Files
jpn-jpan-10mb-100mb_seed3407/checkpoint-21000/trainer_state.json
ModelHub XC 7bbcda3aa3 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/jpn-jpan-10mb-100mb_seed3407
Source: Original Platform
2026-07-18 05:36:12 +08:00

42112 lines
1.1 MiB

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.423542989036353,
"eval_steps": 3000,
"global_step": 21000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.742519760131836,
"epoch": 0.0005770340450086555,
"grad_norm": 4.78125,
"learning_rate": 2e-06,
"loss": 10.7834,
"mean_token_accuracy": 0.0,
"num_tokens": 11955.0,
"step": 5
},
{
"entropy": 10.742532062530518,
"epoch": 0.001154068090017311,
"grad_norm": 5.15625,
"learning_rate": 4.5e-06,
"loss": 10.7821,
"mean_token_accuracy": 7.552870083600282e-05,
"num_tokens": 24473.0,
"step": 10
},
{
"entropy": 10.742538166046142,
"epoch": 0.0017311021350259665,
"grad_norm": 5.4375,
"learning_rate": 7e-06,
"loss": 10.7615,
"mean_token_accuracy": 0.00016723573207855225,
"num_tokens": 36716.0,
"step": 15
},
{
"entropy": 10.742550373077393,
"epoch": 0.002308136180034622,
"grad_norm": 5.125,
"learning_rate": 9.5e-06,
"loss": 10.7088,
"mean_token_accuracy": 0.0010991264251060783,
"num_tokens": 49747.0,
"step": 20
},
{
"entropy": 10.742451667785645,
"epoch": 0.0028851702250432777,
"grad_norm": 4.71875,
"learning_rate": 1.2e-05,
"loss": 10.6029,
"mean_token_accuracy": 0.01508477891329676,
"num_tokens": 61991.0,
"step": 25
},
{
"entropy": 10.741979122161865,
"epoch": 0.003462204270051933,
"grad_norm": 3.875,
"learning_rate": 1.4500000000000002e-05,
"loss": 10.4994,
"mean_token_accuracy": 0.0400444071739912,
"num_tokens": 74918.0,
"step": 30
},
{
"entropy": 10.740076923370362,
"epoch": 0.004039238315060588,
"grad_norm": 3.109375,
"learning_rate": 1.7000000000000003e-05,
"loss": 10.3732,
"mean_token_accuracy": 0.05369483157992363,
"num_tokens": 87833.0,
"step": 35
},
{
"entropy": 10.733743858337402,
"epoch": 0.004616272360069244,
"grad_norm": 2.53125,
"learning_rate": 1.95e-05,
"loss": 10.2264,
"mean_token_accuracy": 0.0561745673418045,
"num_tokens": 101031.0,
"step": 40
},
{
"entropy": 10.72265920639038,
"epoch": 0.0051933064050779,
"grad_norm": 2.296875,
"learning_rate": 2.2e-05,
"loss": 10.1107,
"mean_token_accuracy": 0.05086057800799608,
"num_tokens": 114085.0,
"step": 45
},
{
"entropy": 10.712560367584228,
"epoch": 0.005770340450086555,
"grad_norm": 2.046875,
"learning_rate": 2.4500000000000003e-05,
"loss": 10.0728,
"mean_token_accuracy": 0.05095174703747034,
"num_tokens": 126190.0,
"step": 50
},
{
"entropy": 10.708724021911621,
"epoch": 0.006347374495095211,
"grad_norm": 1.9453125,
"learning_rate": 2.7e-05,
"loss": 9.9872,
"mean_token_accuracy": 0.05040723979473114,
"num_tokens": 138933.0,
"step": 55
},
{
"entropy": 10.705632781982422,
"epoch": 0.006924408540103866,
"grad_norm": 1.96875,
"learning_rate": 2.95e-05,
"loss": 9.9165,
"mean_token_accuracy": 0.05702933557331562,
"num_tokens": 150542.0,
"step": 60
},
{
"entropy": 10.699434947967529,
"epoch": 0.0075014425851125215,
"grad_norm": 1.9609375,
"learning_rate": 3.2e-05,
"loss": 9.9117,
"mean_token_accuracy": 0.05192887857556343,
"num_tokens": 163507.0,
"step": 65
},
{
"entropy": 10.691042518615722,
"epoch": 0.008078476630121177,
"grad_norm": 2.3125,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.8663,
"mean_token_accuracy": 0.0556206401437521,
"num_tokens": 176668.0,
"step": 70
},
{
"entropy": 10.68201036453247,
"epoch": 0.008655510675129832,
"grad_norm": 1.921875,
"learning_rate": 3.7e-05,
"loss": 9.8051,
"mean_token_accuracy": 0.05544878952205181,
"num_tokens": 191413.0,
"step": 75
},
{
"entropy": 10.66737766265869,
"epoch": 0.009232544720138488,
"grad_norm": 1.859375,
"learning_rate": 3.95e-05,
"loss": 9.739,
"mean_token_accuracy": 0.06524630598723888,
"num_tokens": 204176.0,
"step": 80
},
{
"entropy": 10.650106525421142,
"epoch": 0.009809578765147143,
"grad_norm": 2.015625,
"learning_rate": 4.2000000000000004e-05,
"loss": 9.6842,
"mean_token_accuracy": 0.06752815209329129,
"num_tokens": 216851.0,
"step": 85
},
{
"entropy": 10.636476421356202,
"epoch": 0.0103866128101558,
"grad_norm": 1.8125,
"learning_rate": 4.45e-05,
"loss": 9.6572,
"mean_token_accuracy": 0.0653569109737873,
"num_tokens": 229621.0,
"step": 90
},
{
"entropy": 10.622958183288574,
"epoch": 0.010963646855164455,
"grad_norm": 1.953125,
"learning_rate": 4.7000000000000004e-05,
"loss": 9.6025,
"mean_token_accuracy": 0.06540683954954148,
"num_tokens": 242074.0,
"step": 95
},
{
"entropy": 10.592237091064453,
"epoch": 0.01154068090017311,
"grad_norm": 1.703125,
"learning_rate": 4.9500000000000004e-05,
"loss": 9.474,
"mean_token_accuracy": 0.07080609016120434,
"num_tokens": 254094.0,
"step": 100
},
{
"entropy": 10.51324234008789,
"epoch": 0.012117714945181766,
"grad_norm": 2.046875,
"learning_rate": 5.2e-05,
"loss": 9.4787,
"mean_token_accuracy": 0.07307280339300633,
"num_tokens": 267560.0,
"step": 105
},
{
"entropy": 10.503196525573731,
"epoch": 0.012694748990190421,
"grad_norm": 1.4453125,
"learning_rate": 5.45e-05,
"loss": 9.4426,
"mean_token_accuracy": 0.07156955860555173,
"num_tokens": 280717.0,
"step": 110
},
{
"entropy": 10.523096179962158,
"epoch": 0.013271783035199077,
"grad_norm": 1.7421875,
"learning_rate": 5.7e-05,
"loss": 9.3915,
"mean_token_accuracy": 0.07147992886602879,
"num_tokens": 293856.0,
"step": 115
},
{
"entropy": 10.484137058258057,
"epoch": 0.013848817080207732,
"grad_norm": 1.4609375,
"learning_rate": 5.9499999999999996e-05,
"loss": 9.2251,
"mean_token_accuracy": 0.07240887582302094,
"num_tokens": 305191.0,
"step": 120
},
{
"entropy": 10.420050239562988,
"epoch": 0.014425851125216388,
"grad_norm": 1.4375,
"learning_rate": 6.2e-05,
"loss": 9.2288,
"mean_token_accuracy": 0.07244622334837914,
"num_tokens": 318544.0,
"step": 125
},
{
"entropy": 10.332412433624267,
"epoch": 0.015002885170225043,
"grad_norm": 1.4375,
"learning_rate": 6.450000000000001e-05,
"loss": 9.0584,
"mean_token_accuracy": 0.08713233023881913,
"num_tokens": 331445.0,
"step": 130
},
{
"entropy": 10.288755512237548,
"epoch": 0.015579919215233698,
"grad_norm": 1.28125,
"learning_rate": 6.7e-05,
"loss": 9.0833,
"mean_token_accuracy": 0.07415068708360195,
"num_tokens": 344775.0,
"step": 135
},
{
"entropy": 10.267962074279785,
"epoch": 0.016156953260242354,
"grad_norm": 1.1640625,
"learning_rate": 6.950000000000001e-05,
"loss": 8.9864,
"mean_token_accuracy": 0.07388804033398629,
"num_tokens": 357804.0,
"step": 140
},
{
"entropy": 10.174692630767822,
"epoch": 0.01673398730525101,
"grad_norm": 1.3671875,
"learning_rate": 7.2e-05,
"loss": 8.8543,
"mean_token_accuracy": 0.08084411099553108,
"num_tokens": 369826.0,
"step": 145
},
{
"entropy": 10.011744403839112,
"epoch": 0.017311021350259664,
"grad_norm": 1.0390625,
"learning_rate": 7.45e-05,
"loss": 8.7823,
"mean_token_accuracy": 0.08401374593377113,
"num_tokens": 382768.0,
"step": 150
},
{
"entropy": 9.914338493347168,
"epoch": 0.01788805539526832,
"grad_norm": 1.3046875,
"learning_rate": 7.7e-05,
"loss": 8.7625,
"mean_token_accuracy": 0.08076213970780373,
"num_tokens": 395910.0,
"step": 155
},
{
"entropy": 9.87332878112793,
"epoch": 0.018465089440276975,
"grad_norm": 1.015625,
"learning_rate": 7.950000000000001e-05,
"loss": 8.725,
"mean_token_accuracy": 0.07417598105967045,
"num_tokens": 408140.0,
"step": 160
},
{
"entropy": 9.752376747131347,
"epoch": 0.019042123485285632,
"grad_norm": 0.99609375,
"learning_rate": 8.2e-05,
"loss": 8.5835,
"mean_token_accuracy": 0.08260673955082894,
"num_tokens": 420486.0,
"step": 165
},
{
"entropy": 9.501761531829834,
"epoch": 0.019619157530294286,
"grad_norm": 0.88671875,
"learning_rate": 8.450000000000001e-05,
"loss": 8.5107,
"mean_token_accuracy": 0.09241977110505104,
"num_tokens": 433207.0,
"step": 170
},
{
"entropy": 9.351601791381835,
"epoch": 0.020196191575302943,
"grad_norm": 0.83984375,
"learning_rate": 8.7e-05,
"loss": 8.4638,
"mean_token_accuracy": 0.08450455963611603,
"num_tokens": 444880.0,
"step": 175
},
{
"entropy": 9.297267818450928,
"epoch": 0.0207732256203116,
"grad_norm": 1.3125,
"learning_rate": 8.95e-05,
"loss": 8.4926,
"mean_token_accuracy": 0.08199871554970742,
"num_tokens": 456650.0,
"step": 180
},
{
"entropy": 9.096736717224122,
"epoch": 0.021350259665320254,
"grad_norm": 1.109375,
"learning_rate": 9.2e-05,
"loss": 8.4572,
"mean_token_accuracy": 0.08327073007822036,
"num_tokens": 469667.0,
"step": 185
},
{
"entropy": 9.029964542388916,
"epoch": 0.02192729371032891,
"grad_norm": 1.578125,
"learning_rate": 9.45e-05,
"loss": 8.3783,
"mean_token_accuracy": 0.09304521456360818,
"num_tokens": 481952.0,
"step": 190
},
{
"entropy": 8.89255895614624,
"epoch": 0.022504327755337564,
"grad_norm": 1.6953125,
"learning_rate": 9.7e-05,
"loss": 8.399,
"mean_token_accuracy": 0.09114565178751946,
"num_tokens": 494352.0,
"step": 195
},
{
"entropy": 8.913476753234864,
"epoch": 0.02308136180034622,
"grad_norm": 1.140625,
"learning_rate": 9.95e-05,
"loss": 8.3105,
"mean_token_accuracy": 0.0925761379301548,
"num_tokens": 506937.0,
"step": 200
},
{
"entropy": 8.781428337097168,
"epoch": 0.023658395845354875,
"grad_norm": 0.77734375,
"learning_rate": 0.000102,
"loss": 8.303,
"mean_token_accuracy": 0.0928865760564804,
"num_tokens": 519552.0,
"step": 205
},
{
"entropy": 8.800222492218017,
"epoch": 0.024235429890363532,
"grad_norm": 0.9296875,
"learning_rate": 0.00010449999999999999,
"loss": 8.3412,
"mean_token_accuracy": 0.08962251469492913,
"num_tokens": 531359.0,
"step": 210
},
{
"entropy": 8.806383419036866,
"epoch": 0.024812463935372186,
"grad_norm": 1.1796875,
"learning_rate": 0.000107,
"loss": 8.3542,
"mean_token_accuracy": 0.09396427646279334,
"num_tokens": 544197.0,
"step": 215
},
{
"entropy": 8.8606746673584,
"epoch": 0.025389497980380843,
"grad_norm": 1.1875,
"learning_rate": 0.0001095,
"loss": 8.3106,
"mean_token_accuracy": 0.09081738814711571,
"num_tokens": 556818.0,
"step": 220
},
{
"entropy": 8.742358875274657,
"epoch": 0.025966532025389497,
"grad_norm": 0.85546875,
"learning_rate": 0.000112,
"loss": 8.3253,
"mean_token_accuracy": 0.0934368498623371,
"num_tokens": 569363.0,
"step": 225
},
{
"entropy": 8.80865125656128,
"epoch": 0.026543566070398154,
"grad_norm": 0.80859375,
"learning_rate": 0.0001145,
"loss": 8.3076,
"mean_token_accuracy": 0.09487870410084724,
"num_tokens": 581645.0,
"step": 230
},
{
"entropy": 8.763648796081544,
"epoch": 0.027120600115406807,
"grad_norm": 0.79296875,
"learning_rate": 0.00011700000000000001,
"loss": 8.259,
"mean_token_accuracy": 0.08925148844718933,
"num_tokens": 593501.0,
"step": 235
},
{
"entropy": 8.715390586853028,
"epoch": 0.027697634160415464,
"grad_norm": 1.046875,
"learning_rate": 0.00011949999999999999,
"loss": 8.2462,
"mean_token_accuracy": 0.09425812289118767,
"num_tokens": 606328.0,
"step": 240
},
{
"entropy": 8.573129081726075,
"epoch": 0.02827466820542412,
"grad_norm": 1.046875,
"learning_rate": 0.000122,
"loss": 8.1457,
"mean_token_accuracy": 0.1065749242901802,
"num_tokens": 619003.0,
"step": 245
},
{
"entropy": 8.62852210998535,
"epoch": 0.028851702250432775,
"grad_norm": 0.9921875,
"learning_rate": 0.0001245,
"loss": 8.2725,
"mean_token_accuracy": 0.09227693155407905,
"num_tokens": 632910.0,
"step": 250
},
{
"entropy": 8.616901016235351,
"epoch": 0.029428736295441432,
"grad_norm": 0.96875,
"learning_rate": 0.000127,
"loss": 8.2065,
"mean_token_accuracy": 0.09859882518649102,
"num_tokens": 645959.0,
"step": 255
},
{
"entropy": 8.623135948181153,
"epoch": 0.030005770340450086,
"grad_norm": 0.953125,
"learning_rate": 0.0001295,
"loss": 8.1911,
"mean_token_accuracy": 0.10357227995991707,
"num_tokens": 658620.0,
"step": 260
},
{
"entropy": 8.548318576812743,
"epoch": 0.030582804385458743,
"grad_norm": 1.0703125,
"learning_rate": 0.000132,
"loss": 8.1897,
"mean_token_accuracy": 0.10186770558357239,
"num_tokens": 670804.0,
"step": 265
},
{
"entropy": 8.512144851684571,
"epoch": 0.031159838430467397,
"grad_norm": 0.75,
"learning_rate": 0.00013450000000000002,
"loss": 8.191,
"mean_token_accuracy": 0.09745052307844163,
"num_tokens": 683656.0,
"step": 270
},
{
"entropy": 8.583205032348634,
"epoch": 0.031736872475476054,
"grad_norm": 1.140625,
"learning_rate": 0.00013700000000000002,
"loss": 8.1635,
"mean_token_accuracy": 0.10382118448615074,
"num_tokens": 696629.0,
"step": 275
},
{
"entropy": 8.513082599639892,
"epoch": 0.03231390652048471,
"grad_norm": 0.85546875,
"learning_rate": 0.0001395,
"loss": 8.1849,
"mean_token_accuracy": 0.0984301395714283,
"num_tokens": 709053.0,
"step": 280
},
{
"entropy": 8.52897834777832,
"epoch": 0.03289094056549336,
"grad_norm": 0.86328125,
"learning_rate": 0.00014199999999999998,
"loss": 8.1378,
"mean_token_accuracy": 0.101743233948946,
"num_tokens": 721947.0,
"step": 285
},
{
"entropy": 8.485254192352295,
"epoch": 0.03346797461050202,
"grad_norm": 0.94921875,
"learning_rate": 0.0001445,
"loss": 8.1318,
"mean_token_accuracy": 0.10095292180776597,
"num_tokens": 734495.0,
"step": 290
},
{
"entropy": 8.4556489944458,
"epoch": 0.034045008655510675,
"grad_norm": 0.9296875,
"learning_rate": 0.000147,
"loss": 8.1574,
"mean_token_accuracy": 0.09864982217550278,
"num_tokens": 746965.0,
"step": 295
},
{
"entropy": 8.541684627532959,
"epoch": 0.03462204270051933,
"grad_norm": 0.94921875,
"learning_rate": 0.0001495,
"loss": 8.1759,
"mean_token_accuracy": 0.09848161116242408,
"num_tokens": 760105.0,
"step": 300
},
{
"entropy": 8.439905643463135,
"epoch": 0.03519907674552799,
"grad_norm": 0.92578125,
"learning_rate": 0.000152,
"loss": 8.0742,
"mean_token_accuracy": 0.1082187220454216,
"num_tokens": 771765.0,
"step": 305
},
{
"entropy": 8.54954652786255,
"epoch": 0.03577611079053664,
"grad_norm": 1.40625,
"learning_rate": 0.00015450000000000001,
"loss": 8.1565,
"mean_token_accuracy": 0.10081454515457153,
"num_tokens": 784895.0,
"step": 310
},
{
"entropy": 8.430934238433839,
"epoch": 0.0363531448355453,
"grad_norm": 1.109375,
"learning_rate": 0.000157,
"loss": 8.0908,
"mean_token_accuracy": 0.10850713253021241,
"num_tokens": 797139.0,
"step": 315
},
{
"entropy": 8.501363563537598,
"epoch": 0.03693017888055395,
"grad_norm": 0.8046875,
"learning_rate": 0.0001595,
"loss": 8.0515,
"mean_token_accuracy": 0.11537543162703515,
"num_tokens": 809169.0,
"step": 320
},
{
"entropy": 8.328963375091552,
"epoch": 0.03750721292556261,
"grad_norm": 0.94921875,
"learning_rate": 0.000162,
"loss": 8.1059,
"mean_token_accuracy": 0.10505361780524254,
"num_tokens": 821737.0,
"step": 325
},
{
"entropy": 8.49581003189087,
"epoch": 0.038084246970571264,
"grad_norm": 0.90234375,
"learning_rate": 0.00016450000000000001,
"loss": 8.019,
"mean_token_accuracy": 0.1122775912284851,
"num_tokens": 834365.0,
"step": 330
},
{
"entropy": 8.393208026885986,
"epoch": 0.03866128101557992,
"grad_norm": 1.0,
"learning_rate": 0.00016700000000000002,
"loss": 8.0675,
"mean_token_accuracy": 0.10942035019397736,
"num_tokens": 846445.0,
"step": 335
},
{
"entropy": 8.460633182525635,
"epoch": 0.03923831506058857,
"grad_norm": 0.875,
"learning_rate": 0.00016950000000000003,
"loss": 8.1142,
"mean_token_accuracy": 0.10697392895817756,
"num_tokens": 858558.0,
"step": 340
},
{
"entropy": 8.396363449096679,
"epoch": 0.03981534910559723,
"grad_norm": 0.9296875,
"learning_rate": 0.00017199999999999998,
"loss": 8.1058,
"mean_token_accuracy": 0.10723683908581734,
"num_tokens": 871209.0,
"step": 345
},
{
"entropy": 8.491197395324708,
"epoch": 0.040392383150605886,
"grad_norm": 0.9375,
"learning_rate": 0.00017449999999999999,
"loss": 8.0555,
"mean_token_accuracy": 0.10949232503771782,
"num_tokens": 883270.0,
"step": 350
},
{
"entropy": 8.352670478820801,
"epoch": 0.04096941719561454,
"grad_norm": 0.9609375,
"learning_rate": 0.000177,
"loss": 8.0601,
"mean_token_accuracy": 0.10984272882342339,
"num_tokens": 895468.0,
"step": 355
},
{
"entropy": 8.47718162536621,
"epoch": 0.0415464512406232,
"grad_norm": 0.99609375,
"learning_rate": 0.0001795,
"loss": 8.0213,
"mean_token_accuracy": 0.11185759902000428,
"num_tokens": 907900.0,
"step": 360
},
{
"entropy": 8.211096382141113,
"epoch": 0.042123485285631854,
"grad_norm": 1.078125,
"learning_rate": 0.000182,
"loss": 8.0331,
"mean_token_accuracy": 0.11285770758986473,
"num_tokens": 920036.0,
"step": 365
},
{
"entropy": 8.389335536956787,
"epoch": 0.04270051933064051,
"grad_norm": 1.0078125,
"learning_rate": 0.0001845,
"loss": 7.9946,
"mean_token_accuracy": 0.11674289256334305,
"num_tokens": 932525.0,
"step": 370
},
{
"entropy": 8.290297317504884,
"epoch": 0.04327755337564916,
"grad_norm": 1.0859375,
"learning_rate": 0.000187,
"loss": 7.9705,
"mean_token_accuracy": 0.11729388907551766,
"num_tokens": 943581.0,
"step": 375
},
{
"entropy": 8.457341861724853,
"epoch": 0.04385458742065782,
"grad_norm": 1.015625,
"learning_rate": 0.0001895,
"loss": 8.0767,
"mean_token_accuracy": 0.10796716287732125,
"num_tokens": 956270.0,
"step": 380
},
{
"entropy": 8.334104824066163,
"epoch": 0.044431621465666475,
"grad_norm": 0.9140625,
"learning_rate": 0.000192,
"loss": 8.0281,
"mean_token_accuracy": 0.11211411207914353,
"num_tokens": 967631.0,
"step": 385
},
{
"entropy": 8.407048511505128,
"epoch": 0.04500865551067513,
"grad_norm": 0.84765625,
"learning_rate": 0.0001945,
"loss": 8.037,
"mean_token_accuracy": 0.10723293125629425,
"num_tokens": 980999.0,
"step": 390
},
{
"entropy": 8.267741298675537,
"epoch": 0.04558568955568378,
"grad_norm": 0.96875,
"learning_rate": 0.00019700000000000002,
"loss": 7.9457,
"mean_token_accuracy": 0.11497977301478386,
"num_tokens": 993404.0,
"step": 395
},
{
"entropy": 8.311189937591553,
"epoch": 0.04616272360069244,
"grad_norm": 1.0078125,
"learning_rate": 0.00019950000000000002,
"loss": 7.959,
"mean_token_accuracy": 0.11699348911643029,
"num_tokens": 1006009.0,
"step": 400
},
{
"entropy": 8.301223659515381,
"epoch": 0.0467397576457011,
"grad_norm": 0.94921875,
"learning_rate": 0.000202,
"loss": 8.0537,
"mean_token_accuracy": 0.1106877088546753,
"num_tokens": 1019644.0,
"step": 405
},
{
"entropy": 8.281110191345215,
"epoch": 0.04731679169070975,
"grad_norm": 0.83203125,
"learning_rate": 0.00020449999999999998,
"loss": 7.9529,
"mean_token_accuracy": 0.12168486937880515,
"num_tokens": 1032196.0,
"step": 410
},
{
"entropy": 8.194720458984374,
"epoch": 0.04789382573571841,
"grad_norm": 1.1953125,
"learning_rate": 0.000207,
"loss": 7.9104,
"mean_token_accuracy": 0.12571991384029388,
"num_tokens": 1044211.0,
"step": 415
},
{
"entropy": 8.374266242980957,
"epoch": 0.048470859780727064,
"grad_norm": 0.921875,
"learning_rate": 0.0002095,
"loss": 7.9692,
"mean_token_accuracy": 0.11775951310992241,
"num_tokens": 1055743.0,
"step": 420
},
{
"entropy": 8.280481624603272,
"epoch": 0.04904789382573572,
"grad_norm": 0.85546875,
"learning_rate": 0.000212,
"loss": 7.9728,
"mean_token_accuracy": 0.11407571211457253,
"num_tokens": 1068550.0,
"step": 425
},
{
"entropy": 8.259190368652344,
"epoch": 0.04962492787074437,
"grad_norm": 0.90234375,
"learning_rate": 0.0002145,
"loss": 7.876,
"mean_token_accuracy": 0.12458330690860749,
"num_tokens": 1079878.0,
"step": 430
},
{
"entropy": 8.264352798461914,
"epoch": 0.05020196191575303,
"grad_norm": 1.109375,
"learning_rate": 0.00021700000000000002,
"loss": 7.9461,
"mean_token_accuracy": 0.11022370159626008,
"num_tokens": 1093331.0,
"step": 435
},
{
"entropy": 8.320549201965331,
"epoch": 0.050778995960761686,
"grad_norm": 0.94921875,
"learning_rate": 0.0002195,
"loss": 7.8988,
"mean_token_accuracy": 0.12245648875832557,
"num_tokens": 1105830.0,
"step": 440
},
{
"entropy": 8.242807865142822,
"epoch": 0.05135603000577034,
"grad_norm": 1.0,
"learning_rate": 0.000222,
"loss": 7.9022,
"mean_token_accuracy": 0.1231141023337841,
"num_tokens": 1118071.0,
"step": 445
},
{
"entropy": 8.150061178207398,
"epoch": 0.05193306405077899,
"grad_norm": 1.015625,
"learning_rate": 0.0002245,
"loss": 7.9205,
"mean_token_accuracy": 0.11648782640695572,
"num_tokens": 1129781.0,
"step": 450
},
{
"entropy": 8.264570999145509,
"epoch": 0.052510098095787654,
"grad_norm": 0.87890625,
"learning_rate": 0.00022700000000000002,
"loss": 7.9593,
"mean_token_accuracy": 0.11766693964600564,
"num_tokens": 1142750.0,
"step": 455
},
{
"entropy": 8.244252777099609,
"epoch": 0.05308713214079631,
"grad_norm": 1.015625,
"learning_rate": 0.00022950000000000002,
"loss": 7.8898,
"mean_token_accuracy": 0.11929678991436958,
"num_tokens": 1154314.0,
"step": 460
},
{
"entropy": 8.212209606170655,
"epoch": 0.05366416618580496,
"grad_norm": 0.88671875,
"learning_rate": 0.00023200000000000003,
"loss": 7.9087,
"mean_token_accuracy": 0.12657537683844566,
"num_tokens": 1167199.0,
"step": 465
},
{
"entropy": 8.202026081085204,
"epoch": 0.054241200230813615,
"grad_norm": 1.09375,
"learning_rate": 0.00023449999999999998,
"loss": 7.8846,
"mean_token_accuracy": 0.12224558740854263,
"num_tokens": 1179654.0,
"step": 470
},
{
"entropy": 8.187808513641357,
"epoch": 0.054818234275822275,
"grad_norm": 0.9296875,
"learning_rate": 0.000237,
"loss": 7.867,
"mean_token_accuracy": 0.12207963541150094,
"num_tokens": 1190713.0,
"step": 475
},
{
"entropy": 8.158800506591797,
"epoch": 0.05539526832083093,
"grad_norm": 0.89453125,
"learning_rate": 0.0002395,
"loss": 7.8509,
"mean_token_accuracy": 0.12055787444114685,
"num_tokens": 1203881.0,
"step": 480
},
{
"entropy": 8.259974384307862,
"epoch": 0.05597230236583958,
"grad_norm": 1.078125,
"learning_rate": 0.000242,
"loss": 7.9146,
"mean_token_accuracy": 0.11428983137011528,
"num_tokens": 1215795.0,
"step": 485
},
{
"entropy": 8.06658124923706,
"epoch": 0.05654933641084824,
"grad_norm": 0.98828125,
"learning_rate": 0.0002445,
"loss": 7.8294,
"mean_token_accuracy": 0.12558024376630783,
"num_tokens": 1227773.0,
"step": 490
},
{
"entropy": 8.268111038208009,
"epoch": 0.0571263704558569,
"grad_norm": 1.046875,
"learning_rate": 0.000247,
"loss": 7.8281,
"mean_token_accuracy": 0.12732664570212365,
"num_tokens": 1240217.0,
"step": 495
},
{
"entropy": 8.184942293167115,
"epoch": 0.05770340450086555,
"grad_norm": 1.375,
"learning_rate": 0.0002495,
"loss": 7.8963,
"mean_token_accuracy": 0.12094444781541824,
"num_tokens": 1253324.0,
"step": 500
},
{
"entropy": 8.097318315505982,
"epoch": 0.058280438545874204,
"grad_norm": 1.265625,
"learning_rate": 0.000252,
"loss": 7.8021,
"mean_token_accuracy": 0.11756076738238334,
"num_tokens": 1266007.0,
"step": 505
},
{
"entropy": 8.119937992095947,
"epoch": 0.058857472590882864,
"grad_norm": 0.9296875,
"learning_rate": 0.0002545,
"loss": 7.8449,
"mean_token_accuracy": 0.12364009171724319,
"num_tokens": 1278403.0,
"step": 510
},
{
"entropy": 8.165720081329345,
"epoch": 0.05943450663589152,
"grad_norm": 0.9609375,
"learning_rate": 0.000257,
"loss": 7.8565,
"mean_token_accuracy": 0.12108651399612427,
"num_tokens": 1290352.0,
"step": 515
},
{
"entropy": 8.166333532333374,
"epoch": 0.06001154068090017,
"grad_norm": 1.0546875,
"learning_rate": 0.0002595,
"loss": 7.8677,
"mean_token_accuracy": 0.11767618358135223,
"num_tokens": 1302304.0,
"step": 520
},
{
"entropy": 8.154673862457276,
"epoch": 0.060588574725908825,
"grad_norm": 1.0546875,
"learning_rate": 0.000262,
"loss": 7.8293,
"mean_token_accuracy": 0.1254723496735096,
"num_tokens": 1314014.0,
"step": 525
},
{
"entropy": 8.189765071868896,
"epoch": 0.061165608770917486,
"grad_norm": 1.03125,
"learning_rate": 0.00026450000000000003,
"loss": 7.8617,
"mean_token_accuracy": 0.11876866742968559,
"num_tokens": 1326751.0,
"step": 530
},
{
"entropy": 8.086573696136474,
"epoch": 0.06174264281592614,
"grad_norm": 1.109375,
"learning_rate": 0.00026700000000000004,
"loss": 7.7429,
"mean_token_accuracy": 0.1276994377374649,
"num_tokens": 1339070.0,
"step": 535
},
{
"entropy": 8.00021333694458,
"epoch": 0.06231967686093479,
"grad_norm": 1.0625,
"learning_rate": 0.00026950000000000005,
"loss": 7.7617,
"mean_token_accuracy": 0.12492593899369239,
"num_tokens": 1351345.0,
"step": 540
},
{
"entropy": 8.155957984924317,
"epoch": 0.06289671090594345,
"grad_norm": 0.984375,
"learning_rate": 0.00027200000000000005,
"loss": 7.8454,
"mean_token_accuracy": 0.11729749515652657,
"num_tokens": 1364331.0,
"step": 545
},
{
"entropy": 7.948654079437256,
"epoch": 0.06347374495095211,
"grad_norm": 0.91796875,
"learning_rate": 0.0002745,
"loss": 7.7274,
"mean_token_accuracy": 0.1307520568370819,
"num_tokens": 1377426.0,
"step": 550
},
{
"entropy": 8.21699333190918,
"epoch": 0.06405077899596076,
"grad_norm": 1.03125,
"learning_rate": 0.000277,
"loss": 7.8456,
"mean_token_accuracy": 0.11890435740351676,
"num_tokens": 1391553.0,
"step": 555
},
{
"entropy": 8.080363225936889,
"epoch": 0.06462781304096941,
"grad_norm": 1.3125,
"learning_rate": 0.0002795,
"loss": 7.83,
"mean_token_accuracy": 0.12511808127164842,
"num_tokens": 1405526.0,
"step": 560
},
{
"entropy": 8.142201614379882,
"epoch": 0.06520484708597807,
"grad_norm": 0.9375,
"learning_rate": 0.00028199999999999997,
"loss": 7.8219,
"mean_token_accuracy": 0.12369688302278518,
"num_tokens": 1417868.0,
"step": 565
},
{
"entropy": 7.928612327575683,
"epoch": 0.06578188113098672,
"grad_norm": 0.94140625,
"learning_rate": 0.0002845,
"loss": 7.7407,
"mean_token_accuracy": 0.12715482115745544,
"num_tokens": 1429907.0,
"step": 570
},
{
"entropy": 8.15863070487976,
"epoch": 0.06635891517599539,
"grad_norm": 1.0078125,
"learning_rate": 0.000287,
"loss": 7.751,
"mean_token_accuracy": 0.12095296233892441,
"num_tokens": 1442552.0,
"step": 575
},
{
"entropy": 8.045605039596557,
"epoch": 0.06693594922100404,
"grad_norm": 0.9453125,
"learning_rate": 0.0002895,
"loss": 7.8095,
"mean_token_accuracy": 0.12216803878545761,
"num_tokens": 1455717.0,
"step": 580
},
{
"entropy": 8.157436180114747,
"epoch": 0.0675129832660127,
"grad_norm": 0.98046875,
"learning_rate": 0.000292,
"loss": 7.8052,
"mean_token_accuracy": 0.11941280439496041,
"num_tokens": 1468263.0,
"step": 585
},
{
"entropy": 7.988013124465942,
"epoch": 0.06809001731102135,
"grad_norm": 1.0078125,
"learning_rate": 0.0002945,
"loss": 7.7479,
"mean_token_accuracy": 0.12465541884303093,
"num_tokens": 1481632.0,
"step": 590
},
{
"entropy": 8.01614761352539,
"epoch": 0.06866705135603,
"grad_norm": 1.1875,
"learning_rate": 0.000297,
"loss": 7.7005,
"mean_token_accuracy": 0.12634204924106598,
"num_tokens": 1495121.0,
"step": 595
},
{
"entropy": 7.969437456130981,
"epoch": 0.06924408540103866,
"grad_norm": 0.921875,
"learning_rate": 0.0002995,
"loss": 7.7509,
"mean_token_accuracy": 0.1271022602915764,
"num_tokens": 1507669.0,
"step": 600
},
{
"entropy": 8.026603889465331,
"epoch": 0.06982111944604731,
"grad_norm": 1.0859375,
"learning_rate": 0.000302,
"loss": 7.7853,
"mean_token_accuracy": 0.12059543505311013,
"num_tokens": 1520707.0,
"step": 605
},
{
"entropy": 7.99562668800354,
"epoch": 0.07039815349105598,
"grad_norm": 0.87109375,
"learning_rate": 0.0003045,
"loss": 7.696,
"mean_token_accuracy": 0.12601862624287605,
"num_tokens": 1532974.0,
"step": 610
},
{
"entropy": 7.974084091186524,
"epoch": 0.07097518753606463,
"grad_norm": 0.984375,
"learning_rate": 0.000307,
"loss": 7.682,
"mean_token_accuracy": 0.12723494321107864,
"num_tokens": 1544085.0,
"step": 615
},
{
"entropy": 7.9744525909423825,
"epoch": 0.07155222158107329,
"grad_norm": 0.94140625,
"learning_rate": 0.0003095,
"loss": 7.7045,
"mean_token_accuracy": 0.1308353565633297,
"num_tokens": 1556945.0,
"step": 620
},
{
"entropy": 7.941751766204834,
"epoch": 0.07212925562608194,
"grad_norm": 0.9609375,
"learning_rate": 0.000312,
"loss": 7.6518,
"mean_token_accuracy": 0.13126163482666015,
"num_tokens": 1569570.0,
"step": 625
},
{
"entropy": 7.943236637115478,
"epoch": 0.0727062896710906,
"grad_norm": 0.93359375,
"learning_rate": 0.0003145,
"loss": 7.7317,
"mean_token_accuracy": 0.12612373903393745,
"num_tokens": 1582529.0,
"step": 630
},
{
"entropy": 7.964515161514282,
"epoch": 0.07328332371609925,
"grad_norm": 0.9921875,
"learning_rate": 0.000317,
"loss": 7.6504,
"mean_token_accuracy": 0.13465792536735535,
"num_tokens": 1595976.0,
"step": 635
},
{
"entropy": 7.939415836334229,
"epoch": 0.0738603577611079,
"grad_norm": 1.0234375,
"learning_rate": 0.0003195,
"loss": 7.6945,
"mean_token_accuracy": 0.12841632589697838,
"num_tokens": 1609093.0,
"step": 640
},
{
"entropy": 7.928447484970093,
"epoch": 0.07443739180611655,
"grad_norm": 0.9609375,
"learning_rate": 0.000322,
"loss": 7.6804,
"mean_token_accuracy": 0.12497531697154045,
"num_tokens": 1622233.0,
"step": 645
},
{
"entropy": 8.020674419403075,
"epoch": 0.07501442585112522,
"grad_norm": 0.87109375,
"learning_rate": 0.00032450000000000003,
"loss": 7.728,
"mean_token_accuracy": 0.1262144438922405,
"num_tokens": 1635354.0,
"step": 650
},
{
"entropy": 7.9559979915618895,
"epoch": 0.07559145989613388,
"grad_norm": 1.5,
"learning_rate": 0.00032700000000000003,
"loss": 7.7083,
"mean_token_accuracy": 0.12276372462511062,
"num_tokens": 1648223.0,
"step": 655
},
{
"entropy": 7.932180786132813,
"epoch": 0.07616849394114253,
"grad_norm": 1.0,
"learning_rate": 0.00032950000000000004,
"loss": 7.695,
"mean_token_accuracy": 0.12331497594714165,
"num_tokens": 1661652.0,
"step": 660
},
{
"entropy": 7.91778302192688,
"epoch": 0.07674552798615118,
"grad_norm": 1.203125,
"learning_rate": 0.00033200000000000005,
"loss": 7.598,
"mean_token_accuracy": 0.13565101027488707,
"num_tokens": 1674778.0,
"step": 665
},
{
"entropy": 7.959203672409058,
"epoch": 0.07732256203115984,
"grad_norm": 1.0546875,
"learning_rate": 0.00033450000000000005,
"loss": 7.6853,
"mean_token_accuracy": 0.1240819051861763,
"num_tokens": 1686966.0,
"step": 670
},
{
"entropy": 7.902504253387451,
"epoch": 0.07789959607616849,
"grad_norm": 1.203125,
"learning_rate": 0.000337,
"loss": 7.6563,
"mean_token_accuracy": 0.13484344854950905,
"num_tokens": 1699979.0,
"step": 675
},
{
"entropy": 7.8624763011932375,
"epoch": 0.07847663012117714,
"grad_norm": 0.9375,
"learning_rate": 0.0003395,
"loss": 7.5949,
"mean_token_accuracy": 0.12701699286699294,
"num_tokens": 1712306.0,
"step": 680
},
{
"entropy": 7.84359302520752,
"epoch": 0.07905366416618581,
"grad_norm": 1.078125,
"learning_rate": 0.000342,
"loss": 7.6427,
"mean_token_accuracy": 0.12926456406712533,
"num_tokens": 1724670.0,
"step": 685
},
{
"entropy": 7.9609299659729,
"epoch": 0.07963069821119446,
"grad_norm": 1.0,
"learning_rate": 0.00034449999999999997,
"loss": 7.7196,
"mean_token_accuracy": 0.12713819071650506,
"num_tokens": 1736987.0,
"step": 690
},
{
"entropy": 7.934039688110351,
"epoch": 0.08020773225620312,
"grad_norm": 0.94140625,
"learning_rate": 0.000347,
"loss": 7.6931,
"mean_token_accuracy": 0.126790152490139,
"num_tokens": 1750587.0,
"step": 695
},
{
"entropy": 7.82976803779602,
"epoch": 0.08078476630121177,
"grad_norm": 1.15625,
"learning_rate": 0.0003495,
"loss": 7.6356,
"mean_token_accuracy": 0.12186335176229476,
"num_tokens": 1763432.0,
"step": 700
},
{
"entropy": 7.907923984527588,
"epoch": 0.08136180034622043,
"grad_norm": 0.94140625,
"learning_rate": 0.000352,
"loss": 7.5615,
"mean_token_accuracy": 0.13086110800504686,
"num_tokens": 1777705.0,
"step": 705
},
{
"entropy": 7.8514200210571286,
"epoch": 0.08193883439122908,
"grad_norm": 1.03125,
"learning_rate": 0.0003545,
"loss": 7.6198,
"mean_token_accuracy": 0.13134256303310393,
"num_tokens": 1790673.0,
"step": 710
},
{
"entropy": 7.8153650760650635,
"epoch": 0.08251586843623773,
"grad_norm": 0.9609375,
"learning_rate": 0.000357,
"loss": 7.6619,
"mean_token_accuracy": 0.12541591748595238,
"num_tokens": 1803258.0,
"step": 715
},
{
"entropy": 7.950216341018677,
"epoch": 0.0830929024812464,
"grad_norm": 0.98046875,
"learning_rate": 0.0003595,
"loss": 7.6293,
"mean_token_accuracy": 0.12917107716202736,
"num_tokens": 1816534.0,
"step": 720
},
{
"entropy": 7.836187028884888,
"epoch": 0.08366993652625505,
"grad_norm": 1.0390625,
"learning_rate": 0.000362,
"loss": 7.5809,
"mean_token_accuracy": 0.12518987879157067,
"num_tokens": 1828335.0,
"step": 725
},
{
"entropy": 7.771939277648926,
"epoch": 0.08424697057126371,
"grad_norm": 1.0,
"learning_rate": 0.0003645,
"loss": 7.5899,
"mean_token_accuracy": 0.134027336537838,
"num_tokens": 1839327.0,
"step": 730
},
{
"entropy": 7.924041652679444,
"epoch": 0.08482400461627236,
"grad_norm": 1.0078125,
"learning_rate": 0.000367,
"loss": 7.6636,
"mean_token_accuracy": 0.12406575530767441,
"num_tokens": 1851168.0,
"step": 735
},
{
"entropy": 7.836169338226318,
"epoch": 0.08540103866128101,
"grad_norm": 0.9296875,
"learning_rate": 0.0003695,
"loss": 7.6255,
"mean_token_accuracy": 0.1251351036131382,
"num_tokens": 1863875.0,
"step": 740
},
{
"entropy": 7.870956707000732,
"epoch": 0.08597807270628967,
"grad_norm": 1.09375,
"learning_rate": 0.000372,
"loss": 7.5523,
"mean_token_accuracy": 0.12497681528329849,
"num_tokens": 1876613.0,
"step": 745
},
{
"entropy": 7.877524900436401,
"epoch": 0.08655510675129832,
"grad_norm": 0.92578125,
"learning_rate": 0.0003745,
"loss": 7.6508,
"mean_token_accuracy": 0.12530745193362236,
"num_tokens": 1890311.0,
"step": 750
},
{
"entropy": 7.7698094844818115,
"epoch": 0.08713214079630698,
"grad_norm": 1.03125,
"learning_rate": 0.000377,
"loss": 7.6137,
"mean_token_accuracy": 0.12359317764639854,
"num_tokens": 1902925.0,
"step": 755
},
{
"entropy": 7.891464757919311,
"epoch": 0.08770917484131564,
"grad_norm": 1.046875,
"learning_rate": 0.0003795,
"loss": 7.5955,
"mean_token_accuracy": 0.12298363819718361,
"num_tokens": 1915186.0,
"step": 760
},
{
"entropy": 7.836678600311279,
"epoch": 0.0882862088863243,
"grad_norm": 1.0078125,
"learning_rate": 0.000382,
"loss": 7.5912,
"mean_token_accuracy": 0.1303836189210415,
"num_tokens": 1927184.0,
"step": 765
},
{
"entropy": 7.795164489746094,
"epoch": 0.08886324293133295,
"grad_norm": 1.015625,
"learning_rate": 0.0003845,
"loss": 7.5682,
"mean_token_accuracy": 0.1343364216387272,
"num_tokens": 1940275.0,
"step": 770
},
{
"entropy": 7.860983610153198,
"epoch": 0.0894402769763416,
"grad_norm": 0.9765625,
"learning_rate": 0.00038700000000000003,
"loss": 7.6057,
"mean_token_accuracy": 0.1272793047130108,
"num_tokens": 1952583.0,
"step": 775
},
{
"entropy": 7.830558156967163,
"epoch": 0.09001731102135026,
"grad_norm": 0.875,
"learning_rate": 0.00038950000000000003,
"loss": 7.5118,
"mean_token_accuracy": 0.12738451659679412,
"num_tokens": 1965219.0,
"step": 780
},
{
"entropy": 7.71030740737915,
"epoch": 0.09059434506635891,
"grad_norm": 0.91796875,
"learning_rate": 0.00039200000000000004,
"loss": 7.5456,
"mean_token_accuracy": 0.13100098669528962,
"num_tokens": 1977193.0,
"step": 785
},
{
"entropy": 7.909699869155884,
"epoch": 0.09117137911136756,
"grad_norm": 0.98828125,
"learning_rate": 0.00039450000000000005,
"loss": 7.4505,
"mean_token_accuracy": 0.13711674883961678,
"num_tokens": 1988955.0,
"step": 790
},
{
"entropy": 7.730215835571289,
"epoch": 0.09174841315637623,
"grad_norm": 0.87109375,
"learning_rate": 0.00039700000000000005,
"loss": 7.5988,
"mean_token_accuracy": 0.12491806000471115,
"num_tokens": 2001647.0,
"step": 795
},
{
"entropy": 7.779358577728272,
"epoch": 0.09232544720138489,
"grad_norm": 0.90625,
"learning_rate": 0.0003995,
"loss": 7.5131,
"mean_token_accuracy": 0.13641507402062417,
"num_tokens": 2015185.0,
"step": 800
},
{
"entropy": 7.82036943435669,
"epoch": 0.09290248124639354,
"grad_norm": 1.0078125,
"learning_rate": 0.000402,
"loss": 7.6135,
"mean_token_accuracy": 0.12739918157458305,
"num_tokens": 2027257.0,
"step": 805
},
{
"entropy": 7.603882265090943,
"epoch": 0.0934795152914022,
"grad_norm": 1.0078125,
"learning_rate": 0.0004045,
"loss": 7.4517,
"mean_token_accuracy": 0.13969765827059746,
"num_tokens": 2040716.0,
"step": 810
},
{
"entropy": 7.850926303863526,
"epoch": 0.09405654933641085,
"grad_norm": 1.21875,
"learning_rate": 0.00040699999999999997,
"loss": 7.5796,
"mean_token_accuracy": 0.12389181852340699,
"num_tokens": 2053240.0,
"step": 815
},
{
"entropy": 7.774610376358032,
"epoch": 0.0946335833814195,
"grad_norm": 1.1875,
"learning_rate": 0.0004095,
"loss": 7.5473,
"mean_token_accuracy": 0.12548824697732924,
"num_tokens": 2065693.0,
"step": 820
},
{
"entropy": 7.716372299194336,
"epoch": 0.09521061742642815,
"grad_norm": 1.046875,
"learning_rate": 0.000412,
"loss": 7.5014,
"mean_token_accuracy": 0.1397644318640232,
"num_tokens": 2077649.0,
"step": 825
},
{
"entropy": 7.756848621368408,
"epoch": 0.09578765147143682,
"grad_norm": 0.9765625,
"learning_rate": 0.0004145,
"loss": 7.5233,
"mean_token_accuracy": 0.1290776789188385,
"num_tokens": 2090780.0,
"step": 830
},
{
"entropy": 7.749186420440674,
"epoch": 0.09636468551644548,
"grad_norm": 0.90625,
"learning_rate": 0.000417,
"loss": 7.5311,
"mean_token_accuracy": 0.13137806951999664,
"num_tokens": 2104096.0,
"step": 835
},
{
"entropy": 7.7773672580719,
"epoch": 0.09694171956145413,
"grad_norm": 1.046875,
"learning_rate": 0.0004195,
"loss": 7.527,
"mean_token_accuracy": 0.12679293751716614,
"num_tokens": 2117157.0,
"step": 840
},
{
"entropy": 7.73278284072876,
"epoch": 0.09751875360646278,
"grad_norm": 0.84765625,
"learning_rate": 0.000422,
"loss": 7.4858,
"mean_token_accuracy": 0.12687554210424423,
"num_tokens": 2129309.0,
"step": 845
},
{
"entropy": 7.768968677520752,
"epoch": 0.09809578765147144,
"grad_norm": 0.9765625,
"learning_rate": 0.0004245,
"loss": 7.5307,
"mean_token_accuracy": 0.13160400986671447,
"num_tokens": 2142344.0,
"step": 850
},
{
"entropy": 7.714959239959716,
"epoch": 0.09867282169648009,
"grad_norm": 1.140625,
"learning_rate": 0.000427,
"loss": 7.5686,
"mean_token_accuracy": 0.1227949745953083,
"num_tokens": 2155059.0,
"step": 855
},
{
"entropy": 7.734045362472534,
"epoch": 0.09924985574148874,
"grad_norm": 1.0,
"learning_rate": 0.0004295,
"loss": 7.567,
"mean_token_accuracy": 0.12749878615140914,
"num_tokens": 2168901.0,
"step": 860
},
{
"entropy": 7.731997871398926,
"epoch": 0.0998268897864974,
"grad_norm": 0.9140625,
"learning_rate": 0.000432,
"loss": 7.3702,
"mean_token_accuracy": 0.14134701043367387,
"num_tokens": 2180953.0,
"step": 865
},
{
"entropy": 7.591903018951416,
"epoch": 0.10040392383150606,
"grad_norm": 1.1328125,
"learning_rate": 0.0004345,
"loss": 7.4942,
"mean_token_accuracy": 0.1371511548757553,
"num_tokens": 2194097.0,
"step": 870
},
{
"entropy": 7.695831298828125,
"epoch": 0.10098095787651472,
"grad_norm": 0.9921875,
"learning_rate": 0.000437,
"loss": 7.4334,
"mean_token_accuracy": 0.13365770354866982,
"num_tokens": 2206475.0,
"step": 875
},
{
"entropy": 7.78225154876709,
"epoch": 0.10155799192152337,
"grad_norm": 0.91015625,
"learning_rate": 0.0004395,
"loss": 7.4645,
"mean_token_accuracy": 0.1278185375034809,
"num_tokens": 2220006.0,
"step": 880
},
{
"entropy": 7.65887417793274,
"epoch": 0.10213502596653203,
"grad_norm": 1.03125,
"learning_rate": 0.000442,
"loss": 7.5351,
"mean_token_accuracy": 0.12350780516862869,
"num_tokens": 2234082.0,
"step": 885
},
{
"entropy": 7.669657945632935,
"epoch": 0.10271206001154068,
"grad_norm": 1.0390625,
"learning_rate": 0.0004445,
"loss": 7.5227,
"mean_token_accuracy": 0.12489003017544746,
"num_tokens": 2246871.0,
"step": 890
},
{
"entropy": 7.669128274917602,
"epoch": 0.10328909405654933,
"grad_norm": 0.8515625,
"learning_rate": 0.000447,
"loss": 7.4567,
"mean_token_accuracy": 0.13411386385560037,
"num_tokens": 2260172.0,
"step": 895
},
{
"entropy": 7.77032732963562,
"epoch": 0.10386612810155799,
"grad_norm": 1.0234375,
"learning_rate": 0.00044950000000000003,
"loss": 7.5057,
"mean_token_accuracy": 0.11949166432023048,
"num_tokens": 2272848.0,
"step": 900
},
{
"entropy": 7.673234939575195,
"epoch": 0.10444316214656665,
"grad_norm": 1.0625,
"learning_rate": 0.00045200000000000004,
"loss": 7.452,
"mean_token_accuracy": 0.12722696289420127,
"num_tokens": 2285673.0,
"step": 905
},
{
"entropy": 7.741328477859497,
"epoch": 0.10502019619157531,
"grad_norm": 0.9375,
"learning_rate": 0.00045450000000000004,
"loss": 7.489,
"mean_token_accuracy": 0.12697241380810736,
"num_tokens": 2298459.0,
"step": 910
},
{
"entropy": 7.641606569290161,
"epoch": 0.10559723023658396,
"grad_norm": 0.84765625,
"learning_rate": 0.00045700000000000005,
"loss": 7.448,
"mean_token_accuracy": 0.13017196208238602,
"num_tokens": 2311226.0,
"step": 915
},
{
"entropy": 7.574088287353516,
"epoch": 0.10617426428159261,
"grad_norm": 1.0234375,
"learning_rate": 0.00045950000000000006,
"loss": 7.3847,
"mean_token_accuracy": 0.1277943417429924,
"num_tokens": 2323481.0,
"step": 920
},
{
"entropy": 7.646576309204102,
"epoch": 0.10675129832660127,
"grad_norm": 0.8984375,
"learning_rate": 0.000462,
"loss": 7.414,
"mean_token_accuracy": 0.1307280629873276,
"num_tokens": 2336181.0,
"step": 925
},
{
"entropy": 7.636479043960572,
"epoch": 0.10732833237160992,
"grad_norm": 0.94140625,
"learning_rate": 0.0004645,
"loss": 7.3716,
"mean_token_accuracy": 0.13296475633978844,
"num_tokens": 2348941.0,
"step": 930
},
{
"entropy": 7.661097192764283,
"epoch": 0.10790536641661858,
"grad_norm": 0.91796875,
"learning_rate": 0.000467,
"loss": 7.3294,
"mean_token_accuracy": 0.12712401077151297,
"num_tokens": 2361618.0,
"step": 935
},
{
"entropy": 7.540031290054321,
"epoch": 0.10848240046162723,
"grad_norm": 1.03125,
"learning_rate": 0.0004695,
"loss": 7.2806,
"mean_token_accuracy": 0.14269692525267602,
"num_tokens": 2376108.0,
"step": 940
},
{
"entropy": 7.573352289199829,
"epoch": 0.1090594345066359,
"grad_norm": 0.91015625,
"learning_rate": 0.000472,
"loss": 7.382,
"mean_token_accuracy": 0.13606224954128265,
"num_tokens": 2387774.0,
"step": 945
},
{
"entropy": 7.616125917434692,
"epoch": 0.10963646855164455,
"grad_norm": 1.03125,
"learning_rate": 0.0004745,
"loss": 7.4187,
"mean_token_accuracy": 0.13490517437458038,
"num_tokens": 2400816.0,
"step": 950
},
{
"entropy": 7.538399982452392,
"epoch": 0.1102135025966532,
"grad_norm": 0.88671875,
"learning_rate": 0.000477,
"loss": 7.3513,
"mean_token_accuracy": 0.13397277891635895,
"num_tokens": 2412970.0,
"step": 955
},
{
"entropy": 7.531917762756348,
"epoch": 0.11079053664166186,
"grad_norm": 0.953125,
"learning_rate": 0.0004795,
"loss": 7.3595,
"mean_token_accuracy": 0.13522982075810433,
"num_tokens": 2424622.0,
"step": 960
},
{
"entropy": 7.65097861289978,
"epoch": 0.11136757068667051,
"grad_norm": 0.83203125,
"learning_rate": 0.000482,
"loss": 7.4384,
"mean_token_accuracy": 0.13235584348440171,
"num_tokens": 2437293.0,
"step": 965
},
{
"entropy": 7.556930351257324,
"epoch": 0.11194460473167916,
"grad_norm": 1.0859375,
"learning_rate": 0.0004845,
"loss": 7.3101,
"mean_token_accuracy": 0.13271362110972404,
"num_tokens": 2449934.0,
"step": 970
},
{
"entropy": 7.62783989906311,
"epoch": 0.11252163877668782,
"grad_norm": 0.8828125,
"learning_rate": 0.000487,
"loss": 7.3979,
"mean_token_accuracy": 0.12683349400758742,
"num_tokens": 2463139.0,
"step": 975
},
{
"entropy": 7.5757801055908205,
"epoch": 0.11309867282169649,
"grad_norm": 1.109375,
"learning_rate": 0.0004895,
"loss": 7.4281,
"mean_token_accuracy": 0.1270056739449501,
"num_tokens": 2474273.0,
"step": 980
},
{
"entropy": 7.627140283584595,
"epoch": 0.11367570686670514,
"grad_norm": 1.078125,
"learning_rate": 0.000492,
"loss": 7.381,
"mean_token_accuracy": 0.1371190808713436,
"num_tokens": 2486643.0,
"step": 985
},
{
"entropy": 7.516345596313476,
"epoch": 0.1142527409117138,
"grad_norm": 1.0,
"learning_rate": 0.0004945,
"loss": 7.3769,
"mean_token_accuracy": 0.12875159829854965,
"num_tokens": 2499018.0,
"step": 990
},
{
"entropy": 7.49490532875061,
"epoch": 0.11482977495672245,
"grad_norm": 0.9609375,
"learning_rate": 0.000497,
"loss": 7.3419,
"mean_token_accuracy": 0.1379355698823929,
"num_tokens": 2510463.0,
"step": 995
},
{
"entropy": 7.580066394805908,
"epoch": 0.1154068090017311,
"grad_norm": 0.87109375,
"learning_rate": 0.0004995,
"loss": 7.3689,
"mean_token_accuracy": 0.13574447557330133,
"num_tokens": 2522671.0,
"step": 1000
},
{
"entropy": 7.525820398330689,
"epoch": 0.11598384304673975,
"grad_norm": 0.91796875,
"learning_rate": 0.0004999999975783157,
"loss": 7.3706,
"mean_token_accuracy": 0.1312769442796707,
"num_tokens": 2534508.0,
"step": 1005
},
{
"entropy": 7.571441793441773,
"epoch": 0.11656087709174841,
"grad_norm": 0.89453125,
"learning_rate": 0.0004999999877402236,
"loss": 7.3274,
"mean_token_accuracy": 0.13784680590033532,
"num_tokens": 2546804.0,
"step": 1010
},
{
"entropy": 7.521267461776733,
"epoch": 0.11713791113675708,
"grad_norm": 0.875,
"learning_rate": 0.0004999999703343686,
"loss": 7.3429,
"mean_token_accuracy": 0.13090137392282486,
"num_tokens": 2558786.0,
"step": 1015
},
{
"entropy": 7.574562740325928,
"epoch": 0.11771494518176573,
"grad_norm": 0.94140625,
"learning_rate": 0.0004999999453607515,
"loss": 7.3165,
"mean_token_accuracy": 0.13034487813711165,
"num_tokens": 2570834.0,
"step": 1020
},
{
"entropy": 7.461473798751831,
"epoch": 0.11829197922677438,
"grad_norm": 0.9921875,
"learning_rate": 0.0004999999128193729,
"loss": 7.2709,
"mean_token_accuracy": 0.14077538400888442,
"num_tokens": 2583342.0,
"step": 1025
},
{
"entropy": 7.511537408828735,
"epoch": 0.11886901327178304,
"grad_norm": 1.015625,
"learning_rate": 0.000499999872710234,
"loss": 7.3162,
"mean_token_accuracy": 0.1330413155257702,
"num_tokens": 2594878.0,
"step": 1030
},
{
"entropy": 7.390342903137207,
"epoch": 0.11944604731679169,
"grad_norm": 0.9453125,
"learning_rate": 0.0004999998250333361,
"loss": 7.281,
"mean_token_accuracy": 0.13540845960378647,
"num_tokens": 2607070.0,
"step": 1035
},
{
"entropy": 7.526187515258789,
"epoch": 0.12002308136180034,
"grad_norm": 0.890625,
"learning_rate": 0.000499999769788681,
"loss": 7.3157,
"mean_token_accuracy": 0.13957726508378981,
"num_tokens": 2620761.0,
"step": 1040
},
{
"entropy": 7.498535776138306,
"epoch": 0.120600115406809,
"grad_norm": 0.8046875,
"learning_rate": 0.0004999997069762703,
"loss": 7.3307,
"mean_token_accuracy": 0.1318868264555931,
"num_tokens": 2634161.0,
"step": 1045
},
{
"entropy": 7.453407907485962,
"epoch": 0.12117714945181765,
"grad_norm": 0.8984375,
"learning_rate": 0.0004999996365961062,
"loss": 7.2874,
"mean_token_accuracy": 0.1383284404873848,
"num_tokens": 2647459.0,
"step": 1050
},
{
"entropy": 7.446234273910522,
"epoch": 0.12175418349682632,
"grad_norm": 0.92578125,
"learning_rate": 0.0004999995586481912,
"loss": 7.2872,
"mean_token_accuracy": 0.1340254984796047,
"num_tokens": 2660840.0,
"step": 1055
},
{
"entropy": 7.483492088317871,
"epoch": 0.12233121754183497,
"grad_norm": 0.97265625,
"learning_rate": 0.0004999994731325276,
"loss": 7.2865,
"mean_token_accuracy": 0.13337128460407258,
"num_tokens": 2672673.0,
"step": 1060
},
{
"entropy": 7.395563697814941,
"epoch": 0.12290825158684363,
"grad_norm": 0.890625,
"learning_rate": 0.0004999993800491187,
"loss": 7.2987,
"mean_token_accuracy": 0.13419368714094163,
"num_tokens": 2685744.0,
"step": 1065
},
{
"entropy": 7.416986179351807,
"epoch": 0.12348528563185228,
"grad_norm": 0.90625,
"learning_rate": 0.0004999992793979672,
"loss": 7.2196,
"mean_token_accuracy": 0.14943781048059462,
"num_tokens": 2697068.0,
"step": 1070
},
{
"entropy": 7.524578285217285,
"epoch": 0.12406231967686093,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999991711790769,
"loss": 7.3467,
"mean_token_accuracy": 0.12948699221014975,
"num_tokens": 2710418.0,
"step": 1075
},
{
"entropy": 7.54997706413269,
"epoch": 0.12463935372186959,
"grad_norm": 0.89453125,
"learning_rate": 0.0004999990553924511,
"loss": 7.3065,
"mean_token_accuracy": 0.12690478786826134,
"num_tokens": 2722440.0,
"step": 1080
},
{
"entropy": 7.381335258483887,
"epoch": 0.12521638776687824,
"grad_norm": 0.8359375,
"learning_rate": 0.0004999989320380939,
"loss": 7.2963,
"mean_token_accuracy": 0.12917414531111718,
"num_tokens": 2735486.0,
"step": 1085
},
{
"entropy": 7.532785177230835,
"epoch": 0.1257934218118869,
"grad_norm": 0.90625,
"learning_rate": 0.0004999988011160094,
"loss": 7.3223,
"mean_token_accuracy": 0.13123588562011718,
"num_tokens": 2747620.0,
"step": 1090
},
{
"entropy": 7.407538604736328,
"epoch": 0.12637045585689555,
"grad_norm": 0.92578125,
"learning_rate": 0.000499998662626202,
"loss": 7.2571,
"mean_token_accuracy": 0.1341471828520298,
"num_tokens": 2760987.0,
"step": 1095
},
{
"entropy": 7.483826351165772,
"epoch": 0.12694748990190421,
"grad_norm": 0.98046875,
"learning_rate": 0.0004999985165686764,
"loss": 7.234,
"mean_token_accuracy": 0.1353903256356716,
"num_tokens": 2773161.0,
"step": 1100
},
{
"entropy": 7.336683225631714,
"epoch": 0.12752452394691285,
"grad_norm": 0.93359375,
"learning_rate": 0.0004999983629434373,
"loss": 7.1573,
"mean_token_accuracy": 0.15311394929885863,
"num_tokens": 2786179.0,
"step": 1105
},
{
"entropy": 7.440242195129395,
"epoch": 0.12810155799192152,
"grad_norm": 0.90625,
"learning_rate": 0.0004999982017504901,
"loss": 7.1926,
"mean_token_accuracy": 0.14265231788158417,
"num_tokens": 2798859.0,
"step": 1110
},
{
"entropy": 7.385885190963745,
"epoch": 0.1286785920369302,
"grad_norm": 0.859375,
"learning_rate": 0.0004999980329898401,
"loss": 7.2944,
"mean_token_accuracy": 0.1360294461250305,
"num_tokens": 2813048.0,
"step": 1115
},
{
"entropy": 7.456379127502442,
"epoch": 0.12925562608193883,
"grad_norm": 0.953125,
"learning_rate": 0.000499997856661493,
"loss": 7.2612,
"mean_token_accuracy": 0.13587961345911026,
"num_tokens": 2826032.0,
"step": 1120
},
{
"entropy": 7.430348825454712,
"epoch": 0.1298326601269475,
"grad_norm": 0.984375,
"learning_rate": 0.000499997672765455,
"loss": 7.2962,
"mean_token_accuracy": 0.13529185801744462,
"num_tokens": 2839253.0,
"step": 1125
},
{
"entropy": 7.3566066265106205,
"epoch": 0.13040969417195614,
"grad_norm": 1.2109375,
"learning_rate": 0.0004999974813017318,
"loss": 7.2183,
"mean_token_accuracy": 0.14149424508213998,
"num_tokens": 2852542.0,
"step": 1130
},
{
"entropy": 7.3935285091400145,
"epoch": 0.1309867282169648,
"grad_norm": 0.97265625,
"learning_rate": 0.0004999972822703301,
"loss": 7.2395,
"mean_token_accuracy": 0.14146022573113443,
"num_tokens": 2863967.0,
"step": 1135
},
{
"entropy": 7.422988605499268,
"epoch": 0.13156376226197344,
"grad_norm": 0.91015625,
"learning_rate": 0.0004999970756712567,
"loss": 7.3171,
"mean_token_accuracy": 0.13306807354092598,
"num_tokens": 2876141.0,
"step": 1140
},
{
"entropy": 7.2979803562164305,
"epoch": 0.1321407963069821,
"grad_norm": 0.90234375,
"learning_rate": 0.0004999968615045183,
"loss": 7.145,
"mean_token_accuracy": 0.14133854061365128,
"num_tokens": 2888395.0,
"step": 1145
},
{
"entropy": 7.431983804702758,
"epoch": 0.13271783035199078,
"grad_norm": 0.9453125,
"learning_rate": 0.0004999966397701222,
"loss": 7.3261,
"mean_token_accuracy": 0.12834407463669778,
"num_tokens": 2902399.0,
"step": 1150
},
{
"entropy": 7.406958770751953,
"epoch": 0.13329486439699942,
"grad_norm": 0.9609375,
"learning_rate": 0.0004999964104680759,
"loss": 7.0835,
"mean_token_accuracy": 0.1402672976255417,
"num_tokens": 2914999.0,
"step": 1155
},
{
"entropy": 7.348841714859009,
"epoch": 0.13387189844200809,
"grad_norm": 1.0,
"learning_rate": 0.0004999961735983871,
"loss": 7.0785,
"mean_token_accuracy": 0.1498357504606247,
"num_tokens": 2928091.0,
"step": 1160
},
{
"entropy": 7.33998703956604,
"epoch": 0.13444893248701673,
"grad_norm": 0.82421875,
"learning_rate": 0.0004999959291610639,
"loss": 7.2138,
"mean_token_accuracy": 0.1341881737112999,
"num_tokens": 2940840.0,
"step": 1165
},
{
"entropy": 7.289854049682617,
"epoch": 0.1350259665320254,
"grad_norm": 1.0,
"learning_rate": 0.0004999956771561143,
"loss": 7.1303,
"mean_token_accuracy": 0.14412761703133584,
"num_tokens": 2952980.0,
"step": 1170
},
{
"entropy": 7.357520866394043,
"epoch": 0.13560300057703403,
"grad_norm": 0.87109375,
"learning_rate": 0.0004999954175835469,
"loss": 7.1748,
"mean_token_accuracy": 0.13631198480725287,
"num_tokens": 2965437.0,
"step": 1175
},
{
"entropy": 7.3787942886352536,
"epoch": 0.1361800346220427,
"grad_norm": 0.91015625,
"learning_rate": 0.0004999951504433703,
"loss": 7.2047,
"mean_token_accuracy": 0.1348996601998806,
"num_tokens": 2978077.0,
"step": 1180
},
{
"entropy": 7.40587363243103,
"epoch": 0.13675706866705137,
"grad_norm": 0.921875,
"learning_rate": 0.0004999948757355935,
"loss": 7.298,
"mean_token_accuracy": 0.13351393342018128,
"num_tokens": 2990498.0,
"step": 1185
},
{
"entropy": 7.413915586471558,
"epoch": 0.13733410271206,
"grad_norm": 0.86328125,
"learning_rate": 0.000499994593460226,
"loss": 7.2412,
"mean_token_accuracy": 0.1355881556868553,
"num_tokens": 3002784.0,
"step": 1190
},
{
"entropy": 7.372391653060913,
"epoch": 0.13791113675706868,
"grad_norm": 0.9140625,
"learning_rate": 0.0004999943036172771,
"loss": 7.1807,
"mean_token_accuracy": 0.13228997811675072,
"num_tokens": 3015689.0,
"step": 1195
},
{
"entropy": 7.241599178314209,
"epoch": 0.13848817080207732,
"grad_norm": 0.984375,
"learning_rate": 0.0004999940062067565,
"loss": 7.1264,
"mean_token_accuracy": 0.1455356404185295,
"num_tokens": 3026623.0,
"step": 1200
},
{
"entropy": 7.376918649673462,
"epoch": 0.13906520484708598,
"grad_norm": 0.99609375,
"learning_rate": 0.0004999937012286742,
"loss": 7.1615,
"mean_token_accuracy": 0.1412371888756752,
"num_tokens": 3039769.0,
"step": 1205
},
{
"entropy": 7.27626667022705,
"epoch": 0.13964223889209462,
"grad_norm": 0.96875,
"learning_rate": 0.0004999933886830405,
"loss": 7.1505,
"mean_token_accuracy": 0.13528102561831473,
"num_tokens": 3052044.0,
"step": 1210
},
{
"entropy": 7.345494079589844,
"epoch": 0.1402192729371033,
"grad_norm": 0.91015625,
"learning_rate": 0.000499993068569866,
"loss": 7.1241,
"mean_token_accuracy": 0.1391813077032566,
"num_tokens": 3063937.0,
"step": 1215
},
{
"entropy": 7.187998628616333,
"epoch": 0.14079630698211196,
"grad_norm": 1.09375,
"learning_rate": 0.0004999927408891614,
"loss": 7.0939,
"mean_token_accuracy": 0.14361393451690674,
"num_tokens": 3076645.0,
"step": 1220
},
{
"entropy": 7.401137399673462,
"epoch": 0.1413733410271206,
"grad_norm": 0.94921875,
"learning_rate": 0.0004999924056409378,
"loss": 7.1542,
"mean_token_accuracy": 0.13744900077581407,
"num_tokens": 3088985.0,
"step": 1225
},
{
"entropy": 7.271087980270385,
"epoch": 0.14195037507212926,
"grad_norm": 0.875,
"learning_rate": 0.0004999920628252063,
"loss": 7.1543,
"mean_token_accuracy": 0.1385358177125454,
"num_tokens": 3101270.0,
"step": 1230
},
{
"entropy": 7.236308813095093,
"epoch": 0.1425274091171379,
"grad_norm": 0.85546875,
"learning_rate": 0.0004999917124419785,
"loss": 7.1713,
"mean_token_accuracy": 0.13507955446839331,
"num_tokens": 3115420.0,
"step": 1235
},
{
"entropy": 7.414693069458008,
"epoch": 0.14310444316214657,
"grad_norm": 0.90625,
"learning_rate": 0.0004999913544912664,
"loss": 7.1106,
"mean_token_accuracy": 0.13970131129026414,
"num_tokens": 3126176.0,
"step": 1240
},
{
"entropy": 7.252271461486816,
"epoch": 0.1436814772071552,
"grad_norm": 0.828125,
"learning_rate": 0.0004999909889730817,
"loss": 7.1516,
"mean_token_accuracy": 0.14178458228707314,
"num_tokens": 3139136.0,
"step": 1245
},
{
"entropy": 7.280838823318481,
"epoch": 0.14425851125216388,
"grad_norm": 0.91015625,
"learning_rate": 0.0004999906158874368,
"loss": 7.1044,
"mean_token_accuracy": 0.1472743645310402,
"num_tokens": 3152036.0,
"step": 1250
},
{
"entropy": 7.349875354766846,
"epoch": 0.14483554529717255,
"grad_norm": 0.90234375,
"learning_rate": 0.0004999902352343444,
"loss": 7.1386,
"mean_token_accuracy": 0.14143830314278602,
"num_tokens": 3164060.0,
"step": 1255
},
{
"entropy": 7.355139827728271,
"epoch": 0.1454125793421812,
"grad_norm": 0.95703125,
"learning_rate": 0.0004999898470138171,
"loss": 7.206,
"mean_token_accuracy": 0.12975897416472434,
"num_tokens": 3176410.0,
"step": 1260
},
{
"entropy": 7.291885662078857,
"epoch": 0.14598961338718985,
"grad_norm": 0.8125,
"learning_rate": 0.0004999894512258681,
"loss": 7.2261,
"mean_token_accuracy": 0.13479177728295327,
"num_tokens": 3189784.0,
"step": 1265
},
{
"entropy": 7.3698536396026615,
"epoch": 0.1465666474321985,
"grad_norm": 0.83984375,
"learning_rate": 0.0004999890478705107,
"loss": 7.1471,
"mean_token_accuracy": 0.1365978240966797,
"num_tokens": 3202274.0,
"step": 1270
},
{
"entropy": 7.3492168426513675,
"epoch": 0.14714368147720716,
"grad_norm": 0.90625,
"learning_rate": 0.0004999886369477585,
"loss": 7.2021,
"mean_token_accuracy": 0.13651041984558104,
"num_tokens": 3215593.0,
"step": 1275
},
{
"entropy": 7.264506483078003,
"epoch": 0.1477207155222158,
"grad_norm": 0.8984375,
"learning_rate": 0.0004999882184576251,
"loss": 7.1145,
"mean_token_accuracy": 0.1358187846839428,
"num_tokens": 3228307.0,
"step": 1280
},
{
"entropy": 7.262033987045288,
"epoch": 0.14829774956722447,
"grad_norm": 0.7890625,
"learning_rate": 0.0004999877924001248,
"loss": 7.0714,
"mean_token_accuracy": 0.13908419981598855,
"num_tokens": 3241676.0,
"step": 1285
},
{
"entropy": 7.289368486404419,
"epoch": 0.1488747836122331,
"grad_norm": 0.91015625,
"learning_rate": 0.0004999873587752718,
"loss": 7.1412,
"mean_token_accuracy": 0.13665730655193328,
"num_tokens": 3255190.0,
"step": 1290
},
{
"entropy": 7.299326705932617,
"epoch": 0.14945181765724178,
"grad_norm": 0.875,
"learning_rate": 0.0004999869175830808,
"loss": 7.1635,
"mean_token_accuracy": 0.13522787094116212,
"num_tokens": 3268236.0,
"step": 1295
},
{
"entropy": 7.349583387374878,
"epoch": 0.15002885170225044,
"grad_norm": 0.91796875,
"learning_rate": 0.0004999864688235666,
"loss": 7.1786,
"mean_token_accuracy": 0.13588001057505608,
"num_tokens": 3281316.0,
"step": 1300
},
{
"entropy": 7.291733837127685,
"epoch": 0.15060588574725908,
"grad_norm": 0.8515625,
"learning_rate": 0.0004999860124967442,
"loss": 7.0853,
"mean_token_accuracy": 0.1390770271420479,
"num_tokens": 3293517.0,
"step": 1305
},
{
"entropy": 7.185279273986817,
"epoch": 0.15118291979226775,
"grad_norm": 0.84765625,
"learning_rate": 0.0004999855486026291,
"loss": 7.0715,
"mean_token_accuracy": 0.14518356174230576,
"num_tokens": 3306814.0,
"step": 1310
},
{
"entropy": 7.301711988449097,
"epoch": 0.1517599538372764,
"grad_norm": 1.0625,
"learning_rate": 0.0004999850771412369,
"loss": 7.1333,
"mean_token_accuracy": 0.13459300100803376,
"num_tokens": 3318722.0,
"step": 1315
},
{
"entropy": 7.199785852432251,
"epoch": 0.15233698788228506,
"grad_norm": 1.53125,
"learning_rate": 0.0004999845981125832,
"loss": 7.0873,
"mean_token_accuracy": 0.14142397046089172,
"num_tokens": 3331212.0,
"step": 1320
},
{
"entropy": 7.31465106010437,
"epoch": 0.1529140219272937,
"grad_norm": 0.81640625,
"learning_rate": 0.0004999841115166844,
"loss": 7.0661,
"mean_token_accuracy": 0.13654675781726838,
"num_tokens": 3343999.0,
"step": 1325
},
{
"entropy": 7.124961471557617,
"epoch": 0.15349105597230236,
"grad_norm": 0.91015625,
"learning_rate": 0.0004999836173535568,
"loss": 7.0068,
"mean_token_accuracy": 0.14172771871089934,
"num_tokens": 3356281.0,
"step": 1330
},
{
"entropy": 7.201707267761231,
"epoch": 0.15406809001731103,
"grad_norm": 0.94140625,
"learning_rate": 0.0004999831156232169,
"loss": 7.0726,
"mean_token_accuracy": 0.1406794235110283,
"num_tokens": 3369370.0,
"step": 1335
},
{
"entropy": 7.341475009918213,
"epoch": 0.15464512406231967,
"grad_norm": 0.8515625,
"learning_rate": 0.0004999826063256818,
"loss": 7.2012,
"mean_token_accuracy": 0.13309285268187523,
"num_tokens": 3382400.0,
"step": 1340
},
{
"entropy": 7.232538366317749,
"epoch": 0.15522215810732834,
"grad_norm": 0.9140625,
"learning_rate": 0.0004999820894609683,
"loss": 7.0778,
"mean_token_accuracy": 0.13890645131468773,
"num_tokens": 3393666.0,
"step": 1345
},
{
"entropy": 7.243199300765991,
"epoch": 0.15579919215233698,
"grad_norm": 0.8046875,
"learning_rate": 0.0004999815650290941,
"loss": 7.0914,
"mean_token_accuracy": 0.1401012994349003,
"num_tokens": 3405920.0,
"step": 1350
},
{
"entropy": 7.1591578960418705,
"epoch": 0.15637622619734565,
"grad_norm": 0.97265625,
"learning_rate": 0.0004999810330300766,
"loss": 6.9923,
"mean_token_accuracy": 0.14642595648765563,
"num_tokens": 3417886.0,
"step": 1355
},
{
"entropy": 7.254940557479858,
"epoch": 0.1569532602423543,
"grad_norm": 0.828125,
"learning_rate": 0.000499980493463934,
"loss": 7.1075,
"mean_token_accuracy": 0.13476622179150582,
"num_tokens": 3430626.0,
"step": 1360
},
{
"entropy": 7.202736520767212,
"epoch": 0.15753029428736295,
"grad_norm": 0.9453125,
"learning_rate": 0.0004999799463306841,
"loss": 7.0076,
"mean_token_accuracy": 0.1388716422021389,
"num_tokens": 3443248.0,
"step": 1365
},
{
"entropy": 7.213499069213867,
"epoch": 0.15810732833237162,
"grad_norm": 0.9140625,
"learning_rate": 0.0004999793916303455,
"loss": 7.0503,
"mean_token_accuracy": 0.13839739933609962,
"num_tokens": 3456163.0,
"step": 1370
},
{
"entropy": 7.167108821868896,
"epoch": 0.15868436237738026,
"grad_norm": 0.98828125,
"learning_rate": 0.0004999788293629368,
"loss": 7.0754,
"mean_token_accuracy": 0.13633116707205772,
"num_tokens": 3468862.0,
"step": 1375
},
{
"entropy": 7.2402849197387695,
"epoch": 0.15926139642238893,
"grad_norm": 0.90234375,
"learning_rate": 0.000499978259528477,
"loss": 7.0663,
"mean_token_accuracy": 0.14658810272812844,
"num_tokens": 3481516.0,
"step": 1380
},
{
"entropy": 7.265804767608643,
"epoch": 0.15983843046739757,
"grad_norm": 0.87109375,
"learning_rate": 0.0004999776821269852,
"loss": 7.1273,
"mean_token_accuracy": 0.12971169799566268,
"num_tokens": 3493063.0,
"step": 1385
},
{
"entropy": 7.229140663146973,
"epoch": 0.16041546451240624,
"grad_norm": 0.83203125,
"learning_rate": 0.0004999770971584807,
"loss": 7.0123,
"mean_token_accuracy": 0.13699770867824554,
"num_tokens": 3505460.0,
"step": 1390
},
{
"entropy": 7.235083723068238,
"epoch": 0.16099249855741488,
"grad_norm": 0.828125,
"learning_rate": 0.0004999765046229834,
"loss": 7.1218,
"mean_token_accuracy": 0.13258355781435965,
"num_tokens": 3519232.0,
"step": 1395
},
{
"entropy": 7.22713418006897,
"epoch": 0.16156953260242354,
"grad_norm": 0.90625,
"learning_rate": 0.000499975904520513,
"loss": 7.0295,
"mean_token_accuracy": 0.1445997752249241,
"num_tokens": 3531759.0,
"step": 1400
},
{
"entropy": 7.201732730865478,
"epoch": 0.1621465666474322,
"grad_norm": 0.8984375,
"learning_rate": 0.00049997529685109,
"loss": 6.9829,
"mean_token_accuracy": 0.15084661841392516,
"num_tokens": 3543457.0,
"step": 1405
},
{
"entropy": 7.160426235198974,
"epoch": 0.16272360069244085,
"grad_norm": 0.92578125,
"learning_rate": 0.0004999746816147344,
"loss": 7.1195,
"mean_token_accuracy": 0.1298399582505226,
"num_tokens": 3557036.0,
"step": 1410
},
{
"entropy": 7.306451225280762,
"epoch": 0.16330063473744952,
"grad_norm": 0.89453125,
"learning_rate": 0.0004999740588114673,
"loss": 7.0716,
"mean_token_accuracy": 0.1405071273446083,
"num_tokens": 3569415.0,
"step": 1415
},
{
"entropy": 7.171466588973999,
"epoch": 0.16387766878245816,
"grad_norm": 0.96484375,
"learning_rate": 0.0004999734284413095,
"loss": 7.0696,
"mean_token_accuracy": 0.13537402525544168,
"num_tokens": 3581452.0,
"step": 1420
},
{
"entropy": 7.184612178802491,
"epoch": 0.16445470282746683,
"grad_norm": 0.89453125,
"learning_rate": 0.000499972790504282,
"loss": 7.094,
"mean_token_accuracy": 0.13849470168352127,
"num_tokens": 3593482.0,
"step": 1425
},
{
"entropy": 7.202459335327148,
"epoch": 0.16503173687247547,
"grad_norm": 0.9765625,
"learning_rate": 0.0004999721450004067,
"loss": 7.0864,
"mean_token_accuracy": 0.13760560154914855,
"num_tokens": 3606062.0,
"step": 1430
},
{
"entropy": 7.222452545166016,
"epoch": 0.16560877091748413,
"grad_norm": 0.93359375,
"learning_rate": 0.0004999714919297049,
"loss": 7.0499,
"mean_token_accuracy": 0.14111001044511795,
"num_tokens": 3619210.0,
"step": 1435
},
{
"entropy": 7.180074310302734,
"epoch": 0.1661858049624928,
"grad_norm": 0.8203125,
"learning_rate": 0.0004999708312921987,
"loss": 7.0919,
"mean_token_accuracy": 0.13837566673755647,
"num_tokens": 3631952.0,
"step": 1440
},
{
"entropy": 7.17976598739624,
"epoch": 0.16676283900750144,
"grad_norm": 0.84765625,
"learning_rate": 0.0004999701630879103,
"loss": 6.9734,
"mean_token_accuracy": 0.14263298735022545,
"num_tokens": 3644864.0,
"step": 1445
},
{
"entropy": 7.166555690765381,
"epoch": 0.1673398730525101,
"grad_norm": 0.87890625,
"learning_rate": 0.0004999694873168623,
"loss": 7.0507,
"mean_token_accuracy": 0.1378322072327137,
"num_tokens": 3657504.0,
"step": 1450
},
{
"entropy": 7.19564905166626,
"epoch": 0.16791690709751875,
"grad_norm": 0.9140625,
"learning_rate": 0.0004999688039790773,
"loss": 6.9587,
"mean_token_accuracy": 0.14702803492546082,
"num_tokens": 3670304.0,
"step": 1455
},
{
"entropy": 7.150408220291138,
"epoch": 0.16849394114252741,
"grad_norm": 0.96484375,
"learning_rate": 0.0004999681130745784,
"loss": 6.9859,
"mean_token_accuracy": 0.13595322594046594,
"num_tokens": 3681503.0,
"step": 1460
},
{
"entropy": 7.162327766418457,
"epoch": 0.16907097518753605,
"grad_norm": 0.953125,
"learning_rate": 0.0004999674146033888,
"loss": 7.0123,
"mean_token_accuracy": 0.137976536154747,
"num_tokens": 3693248.0,
"step": 1465
},
{
"entropy": 7.136591291427612,
"epoch": 0.16964800923254472,
"grad_norm": 0.90625,
"learning_rate": 0.0004999667085655318,
"loss": 7.0248,
"mean_token_accuracy": 0.14202336519956588,
"num_tokens": 3705285.0,
"step": 1470
},
{
"entropy": 7.1525966167449955,
"epoch": 0.1702250432775534,
"grad_norm": 0.84375,
"learning_rate": 0.0004999659949610313,
"loss": 7.0489,
"mean_token_accuracy": 0.13094842061400414,
"num_tokens": 3719025.0,
"step": 1475
},
{
"entropy": 7.2398560523986815,
"epoch": 0.17080207732256203,
"grad_norm": 0.8984375,
"learning_rate": 0.0004999652737899114,
"loss": 7.0371,
"mean_token_accuracy": 0.14026156663894654,
"num_tokens": 3732054.0,
"step": 1480
},
{
"entropy": 7.175600671768189,
"epoch": 0.1713791113675707,
"grad_norm": 0.92578125,
"learning_rate": 0.0004999645450521963,
"loss": 7.0023,
"mean_token_accuracy": 0.141888265311718,
"num_tokens": 3744080.0,
"step": 1485
},
{
"entropy": 7.114497375488281,
"epoch": 0.17195614541257934,
"grad_norm": 0.7890625,
"learning_rate": 0.0004999638087479104,
"loss": 7.0391,
"mean_token_accuracy": 0.13951010257005692,
"num_tokens": 3756371.0,
"step": 1490
},
{
"entropy": 7.245286512374878,
"epoch": 0.172533179457588,
"grad_norm": 0.91796875,
"learning_rate": 0.0004999630648770786,
"loss": 6.9683,
"mean_token_accuracy": 0.1364215262234211,
"num_tokens": 3769307.0,
"step": 1495
},
{
"entropy": 7.008484745025635,
"epoch": 0.17311021350259664,
"grad_norm": 0.98828125,
"learning_rate": 0.0004999623134397257,
"loss": 6.9637,
"mean_token_accuracy": 0.14434833228588104,
"num_tokens": 3782826.0,
"step": 1500
},
{
"entropy": 7.155062961578369,
"epoch": 0.1736872475476053,
"grad_norm": 0.8515625,
"learning_rate": 0.0004999615544358774,
"loss": 6.969,
"mean_token_accuracy": 0.13818738386034965,
"num_tokens": 3794566.0,
"step": 1505
},
{
"entropy": 7.102244281768799,
"epoch": 0.17426428159261395,
"grad_norm": 0.90234375,
"learning_rate": 0.0004999607878655587,
"loss": 7.0508,
"mean_token_accuracy": 0.13246384710073472,
"num_tokens": 3807058.0,
"step": 1510
},
{
"entropy": 7.190773010253906,
"epoch": 0.17484131563762262,
"grad_norm": 0.87109375,
"learning_rate": 0.0004999600137287958,
"loss": 6.9966,
"mean_token_accuracy": 0.1451525256037712,
"num_tokens": 3819836.0,
"step": 1515
},
{
"entropy": 7.112970066070557,
"epoch": 0.17541834968263129,
"grad_norm": 0.91015625,
"learning_rate": 0.0004999592320256146,
"loss": 7.0526,
"mean_token_accuracy": 0.13325869366526605,
"num_tokens": 3832081.0,
"step": 1520
},
{
"entropy": 7.19920711517334,
"epoch": 0.17599538372763993,
"grad_norm": 0.86328125,
"learning_rate": 0.0004999584427560412,
"loss": 6.9666,
"mean_token_accuracy": 0.14759944379329681,
"num_tokens": 3843279.0,
"step": 1525
},
{
"entropy": 7.110972738265991,
"epoch": 0.1765724177726486,
"grad_norm": 0.9140625,
"learning_rate": 0.0004999576459201024,
"loss": 7.0377,
"mean_token_accuracy": 0.14277849197387696,
"num_tokens": 3855479.0,
"step": 1530
},
{
"entropy": 7.166525030136109,
"epoch": 0.17714945181765723,
"grad_norm": 0.84375,
"learning_rate": 0.000499956841517825,
"loss": 7.0261,
"mean_token_accuracy": 0.14007299840450288,
"num_tokens": 3868111.0,
"step": 1535
},
{
"entropy": 7.039232683181763,
"epoch": 0.1777264858626659,
"grad_norm": 0.9609375,
"learning_rate": 0.000499956029549236,
"loss": 6.9523,
"mean_token_accuracy": 0.14354307875037192,
"num_tokens": 3880062.0,
"step": 1540
},
{
"entropy": 7.2218320846557615,
"epoch": 0.17830351990767454,
"grad_norm": 0.8515625,
"learning_rate": 0.0004999552100143625,
"loss": 7.038,
"mean_token_accuracy": 0.1351063035428524,
"num_tokens": 3892293.0,
"step": 1545
},
{
"entropy": 7.088453531265259,
"epoch": 0.1788805539526832,
"grad_norm": 0.91796875,
"learning_rate": 0.0004999543829132324,
"loss": 6.9011,
"mean_token_accuracy": 0.14455311074852945,
"num_tokens": 3904549.0,
"step": 1550
},
{
"entropy": 7.0796609878540036,
"epoch": 0.17945758799769188,
"grad_norm": 0.95703125,
"learning_rate": 0.0004999535482458734,
"loss": 6.952,
"mean_token_accuracy": 0.14381684213876725,
"num_tokens": 3916693.0,
"step": 1555
},
{
"entropy": 7.087669706344604,
"epoch": 0.18003462204270052,
"grad_norm": 0.90234375,
"learning_rate": 0.0004999527060123135,
"loss": 6.9651,
"mean_token_accuracy": 0.13298058956861497,
"num_tokens": 3930488.0,
"step": 1560
},
{
"entropy": 7.125672006607056,
"epoch": 0.18061165608770918,
"grad_norm": 0.8984375,
"learning_rate": 0.0004999518562125811,
"loss": 6.9626,
"mean_token_accuracy": 0.14101526886224747,
"num_tokens": 3942353.0,
"step": 1565
},
{
"entropy": 7.161968660354614,
"epoch": 0.18118869013271782,
"grad_norm": 0.8984375,
"learning_rate": 0.0004999509988467047,
"loss": 7.0103,
"mean_token_accuracy": 0.13919673189520837,
"num_tokens": 3953868.0,
"step": 1570
},
{
"entropy": 7.124320602416992,
"epoch": 0.1817657241777265,
"grad_norm": 0.890625,
"learning_rate": 0.0004999501339147132,
"loss": 7.0217,
"mean_token_accuracy": 0.1360984094440937,
"num_tokens": 3965148.0,
"step": 1575
},
{
"entropy": 7.110309076309204,
"epoch": 0.18234275822273513,
"grad_norm": 0.94140625,
"learning_rate": 0.0004999492614166357,
"loss": 6.9888,
"mean_token_accuracy": 0.14489941596984862,
"num_tokens": 3977323.0,
"step": 1580
},
{
"entropy": 7.14143214225769,
"epoch": 0.1829197922677438,
"grad_norm": 0.85546875,
"learning_rate": 0.0004999483813525014,
"loss": 6.9486,
"mean_token_accuracy": 0.14665654599666594,
"num_tokens": 3990076.0,
"step": 1585
},
{
"entropy": 7.0736024379730225,
"epoch": 0.18349682631275246,
"grad_norm": 0.8984375,
"learning_rate": 0.0004999474937223403,
"loss": 6.958,
"mean_token_accuracy": 0.13847637176513672,
"num_tokens": 4001996.0,
"step": 1590
},
{
"entropy": 7.1584230899810795,
"epoch": 0.1840738603577611,
"grad_norm": 0.875,
"learning_rate": 0.0004999465985261818,
"loss": 6.996,
"mean_token_accuracy": 0.13838272169232368,
"num_tokens": 4015095.0,
"step": 1595
},
{
"entropy": 7.085082769393921,
"epoch": 0.18465089440276977,
"grad_norm": 0.87109375,
"learning_rate": 0.0004999456957640562,
"loss": 6.8885,
"mean_token_accuracy": 0.14849510788917542,
"num_tokens": 4028633.0,
"step": 1600
},
{
"entropy": 7.059274530410766,
"epoch": 0.1852279284477784,
"grad_norm": 0.85546875,
"learning_rate": 0.0004999447854359939,
"loss": 6.9902,
"mean_token_accuracy": 0.14084767922759056,
"num_tokens": 4042265.0,
"step": 1605
},
{
"entropy": 7.04382438659668,
"epoch": 0.18580496249278708,
"grad_norm": 0.8828125,
"learning_rate": 0.0004999438675420255,
"loss": 6.9434,
"mean_token_accuracy": 0.14098646268248557,
"num_tokens": 4054467.0,
"step": 1610
},
{
"entropy": 7.100906753540039,
"epoch": 0.18638199653779572,
"grad_norm": 1.140625,
"learning_rate": 0.0004999429420821818,
"loss": 6.9422,
"mean_token_accuracy": 0.14708167761564256,
"num_tokens": 4068053.0,
"step": 1615
},
{
"entropy": 6.988407993316651,
"epoch": 0.1869590305828044,
"grad_norm": 1.015625,
"learning_rate": 0.000499942009056494,
"loss": 6.9174,
"mean_token_accuracy": 0.14443018585443496,
"num_tokens": 4080867.0,
"step": 1620
},
{
"entropy": 7.123555755615234,
"epoch": 0.18753606462781305,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999410684649935,
"loss": 6.9813,
"mean_token_accuracy": 0.13821664601564407,
"num_tokens": 4093228.0,
"step": 1625
},
{
"entropy": 7.086485910415649,
"epoch": 0.1881130986728217,
"grad_norm": 0.87109375,
"learning_rate": 0.0004999401203077119,
"loss": 6.9764,
"mean_token_accuracy": 0.14208749383687974,
"num_tokens": 4104929.0,
"step": 1630
},
{
"entropy": 7.062161016464233,
"epoch": 0.18869013271783036,
"grad_norm": 0.8203125,
"learning_rate": 0.000499939164584681,
"loss": 6.9907,
"mean_token_accuracy": 0.15021519139409065,
"num_tokens": 4119445.0,
"step": 1635
},
{
"entropy": 7.106227540969849,
"epoch": 0.189267166762839,
"grad_norm": 1.125,
"learning_rate": 0.0004999382012959331,
"loss": 6.8918,
"mean_token_accuracy": 0.15079083889722825,
"num_tokens": 4131558.0,
"step": 1640
},
{
"entropy": 7.123133182525635,
"epoch": 0.18984420080784767,
"grad_norm": 0.9140625,
"learning_rate": 0.0004999372304415005,
"loss": 7.0313,
"mean_token_accuracy": 0.12920064106583595,
"num_tokens": 4144566.0,
"step": 1645
},
{
"entropy": 7.113665962219239,
"epoch": 0.1904212348528563,
"grad_norm": 0.98046875,
"learning_rate": 0.0004999362520214159,
"loss": 6.9219,
"mean_token_accuracy": 0.14697587639093398,
"num_tokens": 4157295.0,
"step": 1650
},
{
"entropy": 7.081795692443848,
"epoch": 0.19099826889786498,
"grad_norm": 0.859375,
"learning_rate": 0.0004999352660357122,
"loss": 6.9574,
"mean_token_accuracy": 0.1411465436220169,
"num_tokens": 4170229.0,
"step": 1655
},
{
"entropy": 7.1123281955719,
"epoch": 0.19157530294287364,
"grad_norm": 0.87109375,
"learning_rate": 0.0004999342724844226,
"loss": 6.9703,
"mean_token_accuracy": 0.13845267817378043,
"num_tokens": 4182906.0,
"step": 1660
},
{
"entropy": 7.087953901290893,
"epoch": 0.19215233698788228,
"grad_norm": 0.875,
"learning_rate": 0.0004999332713675804,
"loss": 6.9325,
"mean_token_accuracy": 0.143193506449461,
"num_tokens": 4195556.0,
"step": 1665
},
{
"entropy": 7.084608936309815,
"epoch": 0.19272937103289095,
"grad_norm": 0.86328125,
"learning_rate": 0.0004999322626852193,
"loss": 6.902,
"mean_token_accuracy": 0.13993172571063042,
"num_tokens": 4207616.0,
"step": 1670
},
{
"entropy": 7.025543546676635,
"epoch": 0.1933064050778996,
"grad_norm": 0.828125,
"learning_rate": 0.0004999312464373734,
"loss": 6.8576,
"mean_token_accuracy": 0.14821547120809556,
"num_tokens": 4219299.0,
"step": 1675
},
{
"entropy": 7.017240190505982,
"epoch": 0.19388343912290826,
"grad_norm": 0.92578125,
"learning_rate": 0.0004999302226240767,
"loss": 6.997,
"mean_token_accuracy": 0.13786116614937782,
"num_tokens": 4232098.0,
"step": 1680
},
{
"entropy": 7.080112934112549,
"epoch": 0.1944604731679169,
"grad_norm": 0.98828125,
"learning_rate": 0.0004999291912453637,
"loss": 6.8995,
"mean_token_accuracy": 0.14469338953495026,
"num_tokens": 4243879.0,
"step": 1685
},
{
"entropy": 7.064555072784424,
"epoch": 0.19503750721292556,
"grad_norm": 0.92578125,
"learning_rate": 0.0004999281523012691,
"loss": 6.9828,
"mean_token_accuracy": 0.13740749657154083,
"num_tokens": 4256507.0,
"step": 1690
},
{
"entropy": 7.218221855163574,
"epoch": 0.1956145412579342,
"grad_norm": 0.875,
"learning_rate": 0.0004999271057918278,
"loss": 7.0398,
"mean_token_accuracy": 0.13457229733467102,
"num_tokens": 4270763.0,
"step": 1695
},
{
"entropy": 7.035730075836182,
"epoch": 0.19619157530294287,
"grad_norm": 0.8515625,
"learning_rate": 0.0004999260517170751,
"loss": 6.9131,
"mean_token_accuracy": 0.14340217858552934,
"num_tokens": 4284380.0,
"step": 1700
},
{
"entropy": 7.1246764183044435,
"epoch": 0.19676860934795154,
"grad_norm": 0.8828125,
"learning_rate": 0.0004999249900770463,
"loss": 7.0215,
"mean_token_accuracy": 0.13842824175953866,
"num_tokens": 4297812.0,
"step": 1705
},
{
"entropy": 7.021434783935547,
"epoch": 0.19734564339296018,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999239208717772,
"loss": 6.9875,
"mean_token_accuracy": 0.14540473818778993,
"num_tokens": 4310374.0,
"step": 1710
},
{
"entropy": 7.130036401748657,
"epoch": 0.19792267743796885,
"grad_norm": 0.953125,
"learning_rate": 0.0004999228441013037,
"loss": 6.9861,
"mean_token_accuracy": 0.13793584629893302,
"num_tokens": 4322330.0,
"step": 1715
},
{
"entropy": 7.092807817459106,
"epoch": 0.1984997114829775,
"grad_norm": 0.80859375,
"learning_rate": 0.000499921759765662,
"loss": 6.9437,
"mean_token_accuracy": 0.14130837395787238,
"num_tokens": 4335204.0,
"step": 1720
},
{
"entropy": 6.928855037689209,
"epoch": 0.19907674552798615,
"grad_norm": 0.90234375,
"learning_rate": 0.0004999206678648888,
"loss": 6.8285,
"mean_token_accuracy": 0.14999809116125107,
"num_tokens": 4347339.0,
"step": 1725
},
{
"entropy": 7.080965518951416,
"epoch": 0.1996537795729948,
"grad_norm": 1.71875,
"learning_rate": 0.0004999195683990206,
"loss": 6.8898,
"mean_token_accuracy": 0.14809404462575912,
"num_tokens": 4360273.0,
"step": 1730
},
{
"entropy": 7.013464021682739,
"epoch": 0.20023081361800346,
"grad_norm": 0.94921875,
"learning_rate": 0.0004999184613680945,
"loss": 6.9012,
"mean_token_accuracy": 0.14106058850884437,
"num_tokens": 4373424.0,
"step": 1735
},
{
"entropy": 7.049986457824707,
"epoch": 0.20080784766301213,
"grad_norm": 0.92578125,
"learning_rate": 0.0004999173467721476,
"loss": 6.8544,
"mean_token_accuracy": 0.15058322101831437,
"num_tokens": 4386125.0,
"step": 1740
},
{
"entropy": 7.018032741546631,
"epoch": 0.20138488170802077,
"grad_norm": 0.9140625,
"learning_rate": 0.0004999162246112175,
"loss": 6.9365,
"mean_token_accuracy": 0.13854823932051658,
"num_tokens": 4399214.0,
"step": 1745
},
{
"entropy": 6.9998067855834964,
"epoch": 0.20196191575302944,
"grad_norm": 0.88671875,
"learning_rate": 0.0004999150948853419,
"loss": 6.8127,
"mean_token_accuracy": 0.14680370092391967,
"num_tokens": 4411282.0,
"step": 1750
},
{
"entropy": 6.969420385360718,
"epoch": 0.20253894979803808,
"grad_norm": 0.96484375,
"learning_rate": 0.0004999139575945587,
"loss": 6.909,
"mean_token_accuracy": 0.14443379119038582,
"num_tokens": 4423448.0,
"step": 1755
},
{
"entropy": 7.101949882507324,
"epoch": 0.20311598384304674,
"grad_norm": 0.875,
"learning_rate": 0.0004999128127389065,
"loss": 6.8176,
"mean_token_accuracy": 0.15111797004938127,
"num_tokens": 4436498.0,
"step": 1760
},
{
"entropy": 6.992865753173828,
"epoch": 0.20369301788805538,
"grad_norm": 0.89453125,
"learning_rate": 0.0004999116603184233,
"loss": 6.8342,
"mean_token_accuracy": 0.1466807797551155,
"num_tokens": 4448641.0,
"step": 1765
},
{
"entropy": 6.9575080394744875,
"epoch": 0.20427005193306405,
"grad_norm": 0.91015625,
"learning_rate": 0.0004999105003331482,
"loss": 6.8404,
"mean_token_accuracy": 0.1423793762922287,
"num_tokens": 4460539.0,
"step": 1770
},
{
"entropy": 7.0623860359191895,
"epoch": 0.20484708597807272,
"grad_norm": 0.8515625,
"learning_rate": 0.0004999093327831202,
"loss": 6.8898,
"mean_token_accuracy": 0.14088162109255792,
"num_tokens": 4472487.0,
"step": 1775
},
{
"entropy": 6.952205657958984,
"epoch": 0.20542412002308136,
"grad_norm": 0.90234375,
"learning_rate": 0.0004999081576683784,
"loss": 6.8802,
"mean_token_accuracy": 0.1421337030827999,
"num_tokens": 4485164.0,
"step": 1780
},
{
"entropy": 7.1306853771209715,
"epoch": 0.20600115406809003,
"grad_norm": 0.84375,
"learning_rate": 0.0004999069749889626,
"loss": 6.8973,
"mean_token_accuracy": 0.14712294787168503,
"num_tokens": 4497708.0,
"step": 1785
},
{
"entropy": 6.940166759490967,
"epoch": 0.20657818811309867,
"grad_norm": 0.875,
"learning_rate": 0.0004999057847449123,
"loss": 6.9329,
"mean_token_accuracy": 0.1391274891793728,
"num_tokens": 4510648.0,
"step": 1790
},
{
"entropy": 7.065713214874267,
"epoch": 0.20715522215810733,
"grad_norm": 0.859375,
"learning_rate": 0.0004999045869362678,
"loss": 6.8511,
"mean_token_accuracy": 0.14565493836998938,
"num_tokens": 4522699.0,
"step": 1795
},
{
"entropy": 6.939832353591919,
"epoch": 0.20773225620311597,
"grad_norm": 0.88671875,
"learning_rate": 0.000499903381563069,
"loss": 6.8936,
"mean_token_accuracy": 0.13873664960265158,
"num_tokens": 4536060.0,
"step": 1800
},
{
"entropy": 6.97990312576294,
"epoch": 0.20830929024812464,
"grad_norm": 0.8515625,
"learning_rate": 0.0004999021686253568,
"loss": 6.8257,
"mean_token_accuracy": 0.13769187703728675,
"num_tokens": 4549876.0,
"step": 1805
},
{
"entropy": 7.080778312683106,
"epoch": 0.2088863242931333,
"grad_norm": 0.8203125,
"learning_rate": 0.0004999009481231719,
"loss": 6.8655,
"mean_token_accuracy": 0.14449936226010324,
"num_tokens": 4563638.0,
"step": 1810
},
{
"entropy": 6.9409098625183105,
"epoch": 0.20946335833814195,
"grad_norm": 0.91796875,
"learning_rate": 0.0004998997200565553,
"loss": 6.8057,
"mean_token_accuracy": 0.14341058060526848,
"num_tokens": 4575396.0,
"step": 1815
},
{
"entropy": 6.935875415802002,
"epoch": 0.21004039238315061,
"grad_norm": 0.87109375,
"learning_rate": 0.0004998984844255483,
"loss": 6.8199,
"mean_token_accuracy": 0.14724263399839402,
"num_tokens": 4587261.0,
"step": 1820
},
{
"entropy": 7.076818370819092,
"epoch": 0.21061742642815925,
"grad_norm": 0.78125,
"learning_rate": 0.0004998972412301925,
"loss": 6.9409,
"mean_token_accuracy": 0.14100464209914207,
"num_tokens": 4600086.0,
"step": 1825
},
{
"entropy": 7.006335687637329,
"epoch": 0.21119446047316792,
"grad_norm": 0.8359375,
"learning_rate": 0.0004998959904705297,
"loss": 6.8993,
"mean_token_accuracy": 0.14008133336901665,
"num_tokens": 4612320.0,
"step": 1830
},
{
"entropy": 6.99210262298584,
"epoch": 0.21177149451817656,
"grad_norm": 0.95703125,
"learning_rate": 0.0004998947321466021,
"loss": 6.8464,
"mean_token_accuracy": 0.14648700058460234,
"num_tokens": 4623545.0,
"step": 1835
},
{
"entropy": 6.954314517974853,
"epoch": 0.21234852856318523,
"grad_norm": 0.9453125,
"learning_rate": 0.0004998934662584518,
"loss": 6.7498,
"mean_token_accuracy": 0.1578306920826435,
"num_tokens": 4637223.0,
"step": 1840
},
{
"entropy": 6.826448059082031,
"epoch": 0.2129255626081939,
"grad_norm": 0.91796875,
"learning_rate": 0.0004998921928061214,
"loss": 6.837,
"mean_token_accuracy": 0.14694164842367172,
"num_tokens": 4649748.0,
"step": 1845
},
{
"entropy": 7.0238566398620605,
"epoch": 0.21350259665320254,
"grad_norm": 0.765625,
"learning_rate": 0.0004998909117896539,
"loss": 6.8732,
"mean_token_accuracy": 0.1458170548081398,
"num_tokens": 4662441.0,
"step": 1850
},
{
"entropy": 6.895988988876343,
"epoch": 0.2140796306982112,
"grad_norm": 0.984375,
"learning_rate": 0.0004998896232090922,
"loss": 6.8337,
"mean_token_accuracy": 0.15489335879683494,
"num_tokens": 4675546.0,
"step": 1855
},
{
"entropy": 7.177361154556275,
"epoch": 0.21465666474321984,
"grad_norm": 0.90234375,
"learning_rate": 0.0004998883270644798,
"loss": 6.9068,
"mean_token_accuracy": 0.13811369463801385,
"num_tokens": 4687601.0,
"step": 1860
},
{
"entropy": 6.91638216972351,
"epoch": 0.2152336987882285,
"grad_norm": 0.90234375,
"learning_rate": 0.0004998870233558602,
"loss": 6.7837,
"mean_token_accuracy": 0.15353625565767287,
"num_tokens": 4699336.0,
"step": 1865
},
{
"entropy": 6.911949300765992,
"epoch": 0.21581073283323715,
"grad_norm": 0.80859375,
"learning_rate": 0.0004998857120832774,
"loss": 6.9744,
"mean_token_accuracy": 0.13845321610569955,
"num_tokens": 4714312.0,
"step": 1870
},
{
"entropy": 6.956019687652588,
"epoch": 0.21638776687824582,
"grad_norm": 0.84375,
"learning_rate": 0.0004998843932467751,
"loss": 6.7036,
"mean_token_accuracy": 0.15298319831490517,
"num_tokens": 4726436.0,
"step": 1875
},
{
"entropy": 6.97105393409729,
"epoch": 0.21696480092325446,
"grad_norm": 1.0078125,
"learning_rate": 0.0004998830668463982,
"loss": 6.9324,
"mean_token_accuracy": 0.13379157483577728,
"num_tokens": 4739821.0,
"step": 1880
},
{
"entropy": 7.089961147308349,
"epoch": 0.21754183496826313,
"grad_norm": 0.84765625,
"learning_rate": 0.0004998817328821909,
"loss": 6.9187,
"mean_token_accuracy": 0.13890728428959848,
"num_tokens": 4752701.0,
"step": 1885
},
{
"entropy": 6.965564870834351,
"epoch": 0.2181188690132718,
"grad_norm": 0.828125,
"learning_rate": 0.0004998803913541983,
"loss": 6.9329,
"mean_token_accuracy": 0.14065297245979308,
"num_tokens": 4766755.0,
"step": 1890
},
{
"entropy": 7.006665802001953,
"epoch": 0.21869590305828043,
"grad_norm": 0.890625,
"learning_rate": 0.0004998790422624654,
"loss": 6.8586,
"mean_token_accuracy": 0.1429077446460724,
"num_tokens": 4780201.0,
"step": 1895
},
{
"entropy": 6.957398748397827,
"epoch": 0.2192729371032891,
"grad_norm": 0.88671875,
"learning_rate": 0.0004998776856070376,
"loss": 6.81,
"mean_token_accuracy": 0.1421031355857849,
"num_tokens": 4792488.0,
"step": 1900
},
{
"entropy": 6.996427440643311,
"epoch": 0.21984997114829774,
"grad_norm": 0.88671875,
"learning_rate": 0.0004998763213879606,
"loss": 6.7886,
"mean_token_accuracy": 0.14664288908243178,
"num_tokens": 4805154.0,
"step": 1905
},
{
"entropy": 6.966566801071167,
"epoch": 0.2204270051933064,
"grad_norm": 0.859375,
"learning_rate": 0.0004998749496052803,
"loss": 6.8471,
"mean_token_accuracy": 0.14108580872416496,
"num_tokens": 4817947.0,
"step": 1910
},
{
"entropy": 6.996940803527832,
"epoch": 0.22100403923831505,
"grad_norm": 0.91015625,
"learning_rate": 0.0004998735702590426,
"loss": 6.828,
"mean_token_accuracy": 0.1447738878428936,
"num_tokens": 4830296.0,
"step": 1915
},
{
"entropy": 6.933389377593994,
"epoch": 0.22158107328332372,
"grad_norm": 0.91796875,
"learning_rate": 0.0004998721833492942,
"loss": 6.8253,
"mean_token_accuracy": 0.14365117698907853,
"num_tokens": 4841210.0,
"step": 1920
},
{
"entropy": 7.029626893997192,
"epoch": 0.22215810732833238,
"grad_norm": 0.9140625,
"learning_rate": 0.0004998707888760816,
"loss": 6.8996,
"mean_token_accuracy": 0.13317479714751243,
"num_tokens": 4854406.0,
"step": 1925
},
{
"entropy": 6.965882301330566,
"epoch": 0.22273514137334102,
"grad_norm": 0.91015625,
"learning_rate": 0.0004998693868394516,
"loss": 6.8706,
"mean_token_accuracy": 0.14146279469132422,
"num_tokens": 4868156.0,
"step": 1930
},
{
"entropy": 7.022164821624756,
"epoch": 0.2233121754183497,
"grad_norm": 0.953125,
"learning_rate": 0.0004998679772394516,
"loss": 6.804,
"mean_token_accuracy": 0.15072066336870193,
"num_tokens": 4880314.0,
"step": 1935
},
{
"entropy": 6.920300674438477,
"epoch": 0.22388920946335833,
"grad_norm": 0.88671875,
"learning_rate": 0.0004998665600761289,
"loss": 6.813,
"mean_token_accuracy": 0.14527895897626877,
"num_tokens": 4892652.0,
"step": 1940
},
{
"entropy": 7.060734128952026,
"epoch": 0.224466243508367,
"grad_norm": 0.83203125,
"learning_rate": 0.000499865135349531,
"loss": 6.9048,
"mean_token_accuracy": 0.13892186135053636,
"num_tokens": 4905791.0,
"step": 1945
},
{
"entropy": 6.940855360031128,
"epoch": 0.22504327755337564,
"grad_norm": 0.8515625,
"learning_rate": 0.0004998637030597061,
"loss": 6.8723,
"mean_token_accuracy": 0.14380484744906424,
"num_tokens": 4917359.0,
"step": 1950
},
{
"entropy": 7.036824655532837,
"epoch": 0.2256203115983843,
"grad_norm": 0.84375,
"learning_rate": 0.0004998622632067022,
"loss": 6.8305,
"mean_token_accuracy": 0.14697285592556,
"num_tokens": 4928762.0,
"step": 1955
},
{
"entropy": 6.926147079467773,
"epoch": 0.22619734564339297,
"grad_norm": 0.87109375,
"learning_rate": 0.0004998608157905678,
"loss": 6.8447,
"mean_token_accuracy": 0.14583281725645064,
"num_tokens": 4940879.0,
"step": 1960
},
{
"entropy": 7.006029081344605,
"epoch": 0.2267743796884016,
"grad_norm": 0.828125,
"learning_rate": 0.0004998593608113515,
"loss": 6.8538,
"mean_token_accuracy": 0.14606458991765975,
"num_tokens": 4952979.0,
"step": 1965
},
{
"entropy": 6.918392038345337,
"epoch": 0.22735141373341028,
"grad_norm": 0.8203125,
"learning_rate": 0.0004998578982691024,
"loss": 6.7524,
"mean_token_accuracy": 0.1569880038499832,
"num_tokens": 4965465.0,
"step": 1970
},
{
"entropy": 6.9123780727386475,
"epoch": 0.22792844777841892,
"grad_norm": 0.86328125,
"learning_rate": 0.0004998564281638694,
"loss": 6.8233,
"mean_token_accuracy": 0.14547210037708283,
"num_tokens": 4977960.0,
"step": 1975
},
{
"entropy": 6.97648549079895,
"epoch": 0.2285054818234276,
"grad_norm": 0.78515625,
"learning_rate": 0.0004998549504957023,
"loss": 6.8274,
"mean_token_accuracy": 0.14264762550592422,
"num_tokens": 4990732.0,
"step": 1980
},
{
"entropy": 6.921519327163696,
"epoch": 0.22908251586843623,
"grad_norm": 0.8828125,
"learning_rate": 0.0004998534652646506,
"loss": 6.7678,
"mean_token_accuracy": 0.14480722099542617,
"num_tokens": 5002482.0,
"step": 1985
},
{
"entropy": 6.902936887741089,
"epoch": 0.2296595499134449,
"grad_norm": 0.8515625,
"learning_rate": 0.0004998519724707642,
"loss": 6.7529,
"mean_token_accuracy": 0.14723773747682573,
"num_tokens": 5014932.0,
"step": 1990
},
{
"entropy": 6.885674381256104,
"epoch": 0.23023658395845356,
"grad_norm": 0.80078125,
"learning_rate": 0.0004998504721140934,
"loss": 6.8837,
"mean_token_accuracy": 0.138965655118227,
"num_tokens": 5027661.0,
"step": 1995
},
{
"entropy": 6.906474590301514,
"epoch": 0.2308136180034622,
"grad_norm": 0.96875,
"learning_rate": 0.0004998489641946887,
"loss": 6.6331,
"mean_token_accuracy": 0.1527172051370144,
"num_tokens": 5040657.0,
"step": 2000
},
{
"entropy": 6.975762939453125,
"epoch": 0.23139065204847087,
"grad_norm": 0.87109375,
"learning_rate": 0.0004998474487126009,
"loss": 6.9063,
"mean_token_accuracy": 0.13616069480776788,
"num_tokens": 5054408.0,
"step": 2005
},
{
"entropy": 6.98120608329773,
"epoch": 0.2319676860934795,
"grad_norm": 0.9296875,
"learning_rate": 0.0004998459256678806,
"loss": 6.7998,
"mean_token_accuracy": 0.14582831785082817,
"num_tokens": 5065499.0,
"step": 2010
},
{
"entropy": 6.935510063171387,
"epoch": 0.23254472013848818,
"grad_norm": 0.86328125,
"learning_rate": 0.0004998443950605796,
"loss": 6.7508,
"mean_token_accuracy": 0.15238589197397232,
"num_tokens": 5077009.0,
"step": 2015
},
{
"entropy": 6.931089639663696,
"epoch": 0.23312175418349682,
"grad_norm": 0.87109375,
"learning_rate": 0.0004998428568907488,
"loss": 6.925,
"mean_token_accuracy": 0.13808261305093766,
"num_tokens": 5089462.0,
"step": 2020
},
{
"entropy": 6.99543948173523,
"epoch": 0.23369878822850548,
"grad_norm": 0.90625,
"learning_rate": 0.0004998413111584403,
"loss": 6.8333,
"mean_token_accuracy": 0.1430407203733921,
"num_tokens": 5101816.0,
"step": 2025
},
{
"entropy": 6.949823617935181,
"epoch": 0.23427582227351415,
"grad_norm": 0.84375,
"learning_rate": 0.0004998397578637059,
"loss": 6.7939,
"mean_token_accuracy": 0.1399306148290634,
"num_tokens": 5115085.0,
"step": 2030
},
{
"entropy": 6.912753963470459,
"epoch": 0.2348528563185228,
"grad_norm": 0.85546875,
"learning_rate": 0.000499838197006598,
"loss": 6.8265,
"mean_token_accuracy": 0.1417170412838459,
"num_tokens": 5127705.0,
"step": 2035
},
{
"entropy": 6.916851139068603,
"epoch": 0.23542989036353146,
"grad_norm": 0.78125,
"learning_rate": 0.000499836628587169,
"loss": 6.786,
"mean_token_accuracy": 0.1507592000067234,
"num_tokens": 5140509.0,
"step": 2040
},
{
"entropy": 6.963552236557007,
"epoch": 0.2360069244085401,
"grad_norm": 0.8671875,
"learning_rate": 0.0004998350526054716,
"loss": 6.8285,
"mean_token_accuracy": 0.1409867897629738,
"num_tokens": 5153538.0,
"step": 2045
},
{
"entropy": 6.918388509750367,
"epoch": 0.23658395845354876,
"grad_norm": 0.95703125,
"learning_rate": 0.0004998334690615591,
"loss": 6.7526,
"mean_token_accuracy": 0.14691582769155503,
"num_tokens": 5166181.0,
"step": 2050
},
{
"entropy": 6.877604293823242,
"epoch": 0.2371609924985574,
"grad_norm": 0.9140625,
"learning_rate": 0.0004998318779554844,
"loss": 6.7855,
"mean_token_accuracy": 0.14772634357213973,
"num_tokens": 5177209.0,
"step": 2055
},
{
"entropy": 6.908311414718628,
"epoch": 0.23773802654356607,
"grad_norm": 0.96484375,
"learning_rate": 0.0004998302792873012,
"loss": 6.8049,
"mean_token_accuracy": 0.14239051789045334,
"num_tokens": 5189786.0,
"step": 2060
},
{
"entropy": 6.952730369567871,
"epoch": 0.23831506058857474,
"grad_norm": 0.81640625,
"learning_rate": 0.0004998286730570631,
"loss": 6.7892,
"mean_token_accuracy": 0.1510260708630085,
"num_tokens": 5202629.0,
"step": 2065
},
{
"entropy": 6.907465410232544,
"epoch": 0.23889209463358338,
"grad_norm": 0.87109375,
"learning_rate": 0.0004998270592648245,
"loss": 6.8561,
"mean_token_accuracy": 0.13883134126663207,
"num_tokens": 5215339.0,
"step": 2070
},
{
"entropy": 6.9621459484100345,
"epoch": 0.23946912867859205,
"grad_norm": 0.8203125,
"learning_rate": 0.0004998254379106394,
"loss": 6.7359,
"mean_token_accuracy": 0.14754440188407897,
"num_tokens": 5227666.0,
"step": 2075
},
{
"entropy": 6.7812415599823,
"epoch": 0.2400461627236007,
"grad_norm": 0.8828125,
"learning_rate": 0.0004998238089945622,
"loss": 6.7107,
"mean_token_accuracy": 0.1521335408091545,
"num_tokens": 5238200.0,
"step": 2080
},
{
"entropy": 6.852583646774292,
"epoch": 0.24062319676860935,
"grad_norm": 0.88671875,
"learning_rate": 0.0004998221725166479,
"loss": 6.6654,
"mean_token_accuracy": 0.15192302465438842,
"num_tokens": 5250023.0,
"step": 2085
},
{
"entropy": 6.927479076385498,
"epoch": 0.241200230813618,
"grad_norm": 0.92578125,
"learning_rate": 0.0004998205284769516,
"loss": 6.8416,
"mean_token_accuracy": 0.1361626349389553,
"num_tokens": 5262634.0,
"step": 2090
},
{
"entropy": 6.945438241958618,
"epoch": 0.24177726485862666,
"grad_norm": 0.87109375,
"learning_rate": 0.0004998188768755285,
"loss": 6.8404,
"mean_token_accuracy": 0.1391704946756363,
"num_tokens": 5275739.0,
"step": 2095
},
{
"entropy": 6.907373285293579,
"epoch": 0.2423542989036353,
"grad_norm": 0.84375,
"learning_rate": 0.0004998172177124341,
"loss": 6.8036,
"mean_token_accuracy": 0.14423199594020844,
"num_tokens": 5289223.0,
"step": 2100
},
{
"entropy": 6.921164560317993,
"epoch": 0.24293133294864397,
"grad_norm": 0.8671875,
"learning_rate": 0.0004998155509877242,
"loss": 6.7918,
"mean_token_accuracy": 0.14191285520792007,
"num_tokens": 5301869.0,
"step": 2105
},
{
"entropy": 6.931911897659302,
"epoch": 0.24350836699365264,
"grad_norm": 0.796875,
"learning_rate": 0.000499813876701455,
"loss": 6.8142,
"mean_token_accuracy": 0.140006385743618,
"num_tokens": 5314999.0,
"step": 2110
},
{
"entropy": 6.918317890167236,
"epoch": 0.24408540103866128,
"grad_norm": 0.82421875,
"learning_rate": 0.0004998121948536828,
"loss": 6.8173,
"mean_token_accuracy": 0.14651304483413696,
"num_tokens": 5328247.0,
"step": 2115
},
{
"entropy": 6.985309028625489,
"epoch": 0.24466243508366994,
"grad_norm": 0.85546875,
"learning_rate": 0.0004998105054444639,
"loss": 6.804,
"mean_token_accuracy": 0.13474133610725403,
"num_tokens": 5341054.0,
"step": 2120
},
{
"entropy": 6.888967895507813,
"epoch": 0.24523946912867858,
"grad_norm": 0.82421875,
"learning_rate": 0.0004998088084738555,
"loss": 6.8269,
"mean_token_accuracy": 0.14804685413837432,
"num_tokens": 5353857.0,
"step": 2125
},
{
"entropy": 6.884988164901733,
"epoch": 0.24581650317368725,
"grad_norm": 0.91015625,
"learning_rate": 0.0004998071039419144,
"loss": 6.7622,
"mean_token_accuracy": 0.14388485997915268,
"num_tokens": 5366072.0,
"step": 2130
},
{
"entropy": 6.902663278579712,
"epoch": 0.2463935372186959,
"grad_norm": 0.87890625,
"learning_rate": 0.000499805391848698,
"loss": 6.7641,
"mean_token_accuracy": 0.1469337075948715,
"num_tokens": 5379613.0,
"step": 2135
},
{
"entropy": 6.88670859336853,
"epoch": 0.24697057126370456,
"grad_norm": 0.8515625,
"learning_rate": 0.000499803672194264,
"loss": 6.8005,
"mean_token_accuracy": 0.14418511241674423,
"num_tokens": 5392394.0,
"step": 2140
},
{
"entropy": 6.805346250534058,
"epoch": 0.24754760530871323,
"grad_norm": 0.90625,
"learning_rate": 0.0004998019449786701,
"loss": 6.77,
"mean_token_accuracy": 0.14892241209745408,
"num_tokens": 5404127.0,
"step": 2145
},
{
"entropy": 7.025264120101928,
"epoch": 0.24812463935372187,
"grad_norm": 0.78515625,
"learning_rate": 0.0004998002102019744,
"loss": 6.8739,
"mean_token_accuracy": 0.13671603947877883,
"num_tokens": 5417317.0,
"step": 2150
},
{
"entropy": 6.881466197967529,
"epoch": 0.24870167339873053,
"grad_norm": 0.84375,
"learning_rate": 0.0004997984678642354,
"loss": 6.7279,
"mean_token_accuracy": 0.1475033514201641,
"num_tokens": 5429991.0,
"step": 2155
},
{
"entropy": 6.890996217727661,
"epoch": 0.24927870744373917,
"grad_norm": 0.84375,
"learning_rate": 0.0004997967179655115,
"loss": 6.7702,
"mean_token_accuracy": 0.13975565731525422,
"num_tokens": 5442661.0,
"step": 2160
},
{
"entropy": 6.903371953964234,
"epoch": 0.24985574148874784,
"grad_norm": 0.984375,
"learning_rate": 0.0004997949605058617,
"loss": 6.7731,
"mean_token_accuracy": 0.1479140818119049,
"num_tokens": 5455876.0,
"step": 2165
},
{
"entropy": 6.838821744918823,
"epoch": 0.2504327755337565,
"grad_norm": 0.85546875,
"learning_rate": 0.0004997931954853451,
"loss": 6.7326,
"mean_token_accuracy": 0.1502830758690834,
"num_tokens": 5468151.0,
"step": 2170
},
{
"entropy": 6.829051685333252,
"epoch": 0.2510098095787651,
"grad_norm": 0.8671875,
"learning_rate": 0.000499791422904021,
"loss": 6.7642,
"mean_token_accuracy": 0.15258670300245286,
"num_tokens": 5481327.0,
"step": 2175
},
{
"entropy": 6.854774093627929,
"epoch": 0.2515868436237738,
"grad_norm": 0.8984375,
"learning_rate": 0.0004997896427619491,
"loss": 6.726,
"mean_token_accuracy": 0.14523358941078185,
"num_tokens": 5493794.0,
"step": 2180
},
{
"entropy": 6.833822202682495,
"epoch": 0.25216387766878245,
"grad_norm": 0.8359375,
"learning_rate": 0.0004997878550591892,
"loss": 6.7622,
"mean_token_accuracy": 0.14095828533172608,
"num_tokens": 5506831.0,
"step": 2185
},
{
"entropy": 6.8861846923828125,
"epoch": 0.2527409117137911,
"grad_norm": 1.078125,
"learning_rate": 0.0004997860597958013,
"loss": 6.6629,
"mean_token_accuracy": 0.15049846321344376,
"num_tokens": 5518988.0,
"step": 2190
},
{
"entropy": 6.720967817306518,
"epoch": 0.2533179457587998,
"grad_norm": 0.90625,
"learning_rate": 0.0004997842569718461,
"loss": 6.6284,
"mean_token_accuracy": 0.15226881206035614,
"num_tokens": 5530757.0,
"step": 2195
},
{
"entropy": 6.8386878490448,
"epoch": 0.25389497980380843,
"grad_norm": 0.87890625,
"learning_rate": 0.000499782446587384,
"loss": 6.7462,
"mean_token_accuracy": 0.14984930008649827,
"num_tokens": 5542819.0,
"step": 2200
},
{
"entropy": 6.887057685852051,
"epoch": 0.25447201384881707,
"grad_norm": 0.98046875,
"learning_rate": 0.000499780628642476,
"loss": 6.7516,
"mean_token_accuracy": 0.1436480388045311,
"num_tokens": 5555797.0,
"step": 2205
},
{
"entropy": 6.8565185546875,
"epoch": 0.2550490478938257,
"grad_norm": 0.8984375,
"learning_rate": 0.0004997788031371834,
"loss": 6.8377,
"mean_token_accuracy": 0.13526439368724824,
"num_tokens": 5570086.0,
"step": 2210
},
{
"entropy": 6.880842208862305,
"epoch": 0.2556260819388344,
"grad_norm": 0.88671875,
"learning_rate": 0.0004997769700715672,
"loss": 6.6616,
"mean_token_accuracy": 0.15116312801837922,
"num_tokens": 5582182.0,
"step": 2215
},
{
"entropy": 6.771800470352173,
"epoch": 0.25620311598384304,
"grad_norm": 0.859375,
"learning_rate": 0.0004997751294456892,
"loss": 6.7557,
"mean_token_accuracy": 0.1484261780977249,
"num_tokens": 5595395.0,
"step": 2220
},
{
"entropy": 6.907889366149902,
"epoch": 0.2567801500288517,
"grad_norm": 0.7734375,
"learning_rate": 0.0004997732812596114,
"loss": 6.7655,
"mean_token_accuracy": 0.14601099640130996,
"num_tokens": 5608555.0,
"step": 2225
},
{
"entropy": 6.852161073684693,
"epoch": 0.2573571840738604,
"grad_norm": 0.875,
"learning_rate": 0.0004997714255133961,
"loss": 6.7211,
"mean_token_accuracy": 0.14606622010469436,
"num_tokens": 5620933.0,
"step": 2230
},
{
"entropy": 6.908066129684448,
"epoch": 0.257934218118869,
"grad_norm": 0.828125,
"learning_rate": 0.0004997695622071054,
"loss": 6.7645,
"mean_token_accuracy": 0.14898824393749238,
"num_tokens": 5634061.0,
"step": 2235
},
{
"entropy": 6.929029846191407,
"epoch": 0.25851125216387766,
"grad_norm": 0.84765625,
"learning_rate": 0.0004997676913408021,
"loss": 6.7291,
"mean_token_accuracy": 0.1483811229467392,
"num_tokens": 5646617.0,
"step": 2240
},
{
"entropy": 6.87813811302185,
"epoch": 0.2590882862088863,
"grad_norm": 0.8515625,
"learning_rate": 0.0004997658129145493,
"loss": 6.811,
"mean_token_accuracy": 0.14377271234989167,
"num_tokens": 5659361.0,
"step": 2245
},
{
"entropy": 6.849423265457153,
"epoch": 0.259665320253895,
"grad_norm": 0.9140625,
"learning_rate": 0.0004997639269284099,
"loss": 6.6528,
"mean_token_accuracy": 0.15414825975894927,
"num_tokens": 5670591.0,
"step": 2250
},
{
"entropy": 6.851912260055542,
"epoch": 0.26024235429890363,
"grad_norm": 0.9296875,
"learning_rate": 0.0004997620333824476,
"loss": 6.7722,
"mean_token_accuracy": 0.14549338743090628,
"num_tokens": 5683211.0,
"step": 2255
},
{
"entropy": 6.851926565170288,
"epoch": 0.2608193883439123,
"grad_norm": 0.89453125,
"learning_rate": 0.0004997601322767258,
"loss": 6.7653,
"mean_token_accuracy": 0.145635487139225,
"num_tokens": 5695654.0,
"step": 2260
},
{
"entropy": 6.795074939727783,
"epoch": 0.26139642238892097,
"grad_norm": 0.88671875,
"learning_rate": 0.0004997582236113087,
"loss": 6.6557,
"mean_token_accuracy": 0.15083891600370408,
"num_tokens": 5707776.0,
"step": 2265
},
{
"entropy": 6.822677946090698,
"epoch": 0.2619734564339296,
"grad_norm": 0.8046875,
"learning_rate": 0.0004997563073862603,
"loss": 6.7076,
"mean_token_accuracy": 0.14838095828890802,
"num_tokens": 5719895.0,
"step": 2270
},
{
"entropy": 6.895277500152588,
"epoch": 0.26255049047893825,
"grad_norm": 0.83203125,
"learning_rate": 0.0004997543836016453,
"loss": 6.7302,
"mean_token_accuracy": 0.15407091453671456,
"num_tokens": 5733280.0,
"step": 2275
},
{
"entropy": 6.825756692886353,
"epoch": 0.2631275245239469,
"grad_norm": 0.86328125,
"learning_rate": 0.0004997524522575281,
"loss": 6.7713,
"mean_token_accuracy": 0.14787696152925492,
"num_tokens": 5746563.0,
"step": 2280
},
{
"entropy": 6.933543157577515,
"epoch": 0.2637045585689556,
"grad_norm": 0.85546875,
"learning_rate": 0.0004997505133539738,
"loss": 6.8251,
"mean_token_accuracy": 0.14116834327578545,
"num_tokens": 5760735.0,
"step": 2285
},
{
"entropy": 6.7919364929199215,
"epoch": 0.2642815926139642,
"grad_norm": 0.8125,
"learning_rate": 0.0004997485668910476,
"loss": 6.7403,
"mean_token_accuracy": 0.13866735473275185,
"num_tokens": 5774304.0,
"step": 2290
},
{
"entropy": 6.707546329498291,
"epoch": 0.26485862665897286,
"grad_norm": 0.86328125,
"learning_rate": 0.0004997466128688151,
"loss": 6.6343,
"mean_token_accuracy": 0.1520386144518852,
"num_tokens": 5786045.0,
"step": 2295
},
{
"entropy": 6.8912115573883055,
"epoch": 0.26543566070398156,
"grad_norm": 0.99609375,
"learning_rate": 0.000499744651287342,
"loss": 6.7038,
"mean_token_accuracy": 0.1507314458489418,
"num_tokens": 5798126.0,
"step": 2300
},
{
"entropy": 6.800000524520874,
"epoch": 0.2660126947489902,
"grad_norm": 0.8359375,
"learning_rate": 0.000499742682146694,
"loss": 6.708,
"mean_token_accuracy": 0.15146253854036332,
"num_tokens": 5809778.0,
"step": 2305
},
{
"entropy": 6.887187433242798,
"epoch": 0.26658972879399884,
"grad_norm": 0.84375,
"learning_rate": 0.0004997407054469377,
"loss": 6.7913,
"mean_token_accuracy": 0.14095485657453538,
"num_tokens": 5821902.0,
"step": 2310
},
{
"entropy": 6.898465633392334,
"epoch": 0.2671667628390075,
"grad_norm": 0.8125,
"learning_rate": 0.0004997387211881392,
"loss": 6.7311,
"mean_token_accuracy": 0.14221810474991797,
"num_tokens": 5835162.0,
"step": 2315
},
{
"entropy": 6.761828851699829,
"epoch": 0.26774379688401617,
"grad_norm": 1.2109375,
"learning_rate": 0.0004997367293703656,
"loss": 6.7284,
"mean_token_accuracy": 0.1507745712995529,
"num_tokens": 5847708.0,
"step": 2320
},
{
"entropy": 6.91298017501831,
"epoch": 0.2683208309290248,
"grad_norm": 0.82421875,
"learning_rate": 0.0004997347299936837,
"loss": 6.7346,
"mean_token_accuracy": 0.14922600761055946,
"num_tokens": 5860983.0,
"step": 2325
},
{
"entropy": 6.769803524017334,
"epoch": 0.26889786497403345,
"grad_norm": 0.84375,
"learning_rate": 0.0004997327230581608,
"loss": 6.6998,
"mean_token_accuracy": 0.1437514305114746,
"num_tokens": 5873878.0,
"step": 2330
},
{
"entropy": 6.783571243286133,
"epoch": 0.26947489901904215,
"grad_norm": 0.86328125,
"learning_rate": 0.0004997307085638644,
"loss": 6.7147,
"mean_token_accuracy": 0.14909254312515258,
"num_tokens": 5886577.0,
"step": 2335
},
{
"entropy": 6.906566333770752,
"epoch": 0.2700519330640508,
"grad_norm": 1.109375,
"learning_rate": 0.0004997286865108621,
"loss": 6.7362,
"mean_token_accuracy": 0.13940049409866334,
"num_tokens": 5900373.0,
"step": 2340
},
{
"entropy": 6.771531581878662,
"epoch": 0.2706289671090594,
"grad_norm": 0.89453125,
"learning_rate": 0.0004997266568992222,
"loss": 6.708,
"mean_token_accuracy": 0.14844308495521547,
"num_tokens": 5913038.0,
"step": 2345
},
{
"entropy": 6.791477632522583,
"epoch": 0.27120600115406807,
"grad_norm": 0.80859375,
"learning_rate": 0.0004997246197290128,
"loss": 6.6815,
"mean_token_accuracy": 0.1516631633043289,
"num_tokens": 5926096.0,
"step": 2350
},
{
"entropy": 6.820218896865844,
"epoch": 0.27178303519907676,
"grad_norm": 0.85546875,
"learning_rate": 0.0004997225750003024,
"loss": 6.6836,
"mean_token_accuracy": 0.15230127722024916,
"num_tokens": 5937992.0,
"step": 2355
},
{
"entropy": 6.786269426345825,
"epoch": 0.2723600692440854,
"grad_norm": 0.9375,
"learning_rate": 0.0004997205227131599,
"loss": 6.6959,
"mean_token_accuracy": 0.15331070870161057,
"num_tokens": 5949685.0,
"step": 2360
},
{
"entropy": 6.8500142097473145,
"epoch": 0.27293710328909404,
"grad_norm": 0.8828125,
"learning_rate": 0.0004997184628676542,
"loss": 6.77,
"mean_token_accuracy": 0.14370569810271264,
"num_tokens": 5962751.0,
"step": 2365
},
{
"entropy": 6.743644428253174,
"epoch": 0.27351413733410274,
"grad_norm": 0.80859375,
"learning_rate": 0.0004997163954638546,
"loss": 6.5676,
"mean_token_accuracy": 0.15582787990570068,
"num_tokens": 5976043.0,
"step": 2370
},
{
"entropy": 6.826035118103027,
"epoch": 0.2740911713791114,
"grad_norm": 0.83984375,
"learning_rate": 0.0004997143205018306,
"loss": 6.7138,
"mean_token_accuracy": 0.14594173580408096,
"num_tokens": 5988146.0,
"step": 2375
},
{
"entropy": 6.795579051971435,
"epoch": 0.27466820542412,
"grad_norm": 0.875,
"learning_rate": 0.0004997122379816523,
"loss": 6.6587,
"mean_token_accuracy": 0.15158178210258483,
"num_tokens": 6000542.0,
"step": 2380
},
{
"entropy": 6.742963075637817,
"epoch": 0.27524523946912866,
"grad_norm": 0.765625,
"learning_rate": 0.0004997101479033893,
"loss": 6.7064,
"mean_token_accuracy": 0.14576518833637236,
"num_tokens": 6013574.0,
"step": 2385
},
{
"entropy": 6.739541244506836,
"epoch": 0.27582227351413735,
"grad_norm": 0.8125,
"learning_rate": 0.0004997080502671122,
"loss": 6.594,
"mean_token_accuracy": 0.15022992491722106,
"num_tokens": 6025391.0,
"step": 2390
},
{
"entropy": 6.859225606918335,
"epoch": 0.276399307559146,
"grad_norm": 0.8203125,
"learning_rate": 0.0004997059450728913,
"loss": 6.7201,
"mean_token_accuracy": 0.14635233953595161,
"num_tokens": 6036595.0,
"step": 2395
},
{
"entropy": 6.836587810516358,
"epoch": 0.27697634160415463,
"grad_norm": 0.859375,
"learning_rate": 0.0004997038323207977,
"loss": 6.8146,
"mean_token_accuracy": 0.1395593300461769,
"num_tokens": 6048852.0,
"step": 2400
},
{
"entropy": 6.825769519805908,
"epoch": 0.2775533756491633,
"grad_norm": 0.8359375,
"learning_rate": 0.0004997017120109022,
"loss": 6.6492,
"mean_token_accuracy": 0.15694630444049834,
"num_tokens": 6061694.0,
"step": 2405
},
{
"entropy": 6.7436662197113035,
"epoch": 0.27813040969417197,
"grad_norm": 0.83984375,
"learning_rate": 0.0004996995841432762,
"loss": 6.725,
"mean_token_accuracy": 0.15039588510990143,
"num_tokens": 6074244.0,
"step": 2410
},
{
"entropy": 6.894833898544311,
"epoch": 0.2787074437391806,
"grad_norm": 0.86328125,
"learning_rate": 0.0004996974487179915,
"loss": 6.7051,
"mean_token_accuracy": 0.1497049979865551,
"num_tokens": 6085550.0,
"step": 2415
},
{
"entropy": 6.791318702697754,
"epoch": 0.27928447778418924,
"grad_norm": 0.88671875,
"learning_rate": 0.0004996953057351195,
"loss": 6.7501,
"mean_token_accuracy": 0.14439913034439086,
"num_tokens": 6096749.0,
"step": 2420
},
{
"entropy": 6.856110286712647,
"epoch": 0.27986151182919794,
"grad_norm": 0.86328125,
"learning_rate": 0.0004996931551947327,
"loss": 6.6462,
"mean_token_accuracy": 0.14740088433027268,
"num_tokens": 6109490.0,
"step": 2425
},
{
"entropy": 6.801775121688843,
"epoch": 0.2804385458742066,
"grad_norm": 0.83203125,
"learning_rate": 0.0004996909970969031,
"loss": 6.8126,
"mean_token_accuracy": 0.13891539573669434,
"num_tokens": 6122656.0,
"step": 2430
},
{
"entropy": 6.949873161315918,
"epoch": 0.2810155799192152,
"grad_norm": 0.87109375,
"learning_rate": 0.0004996888314417034,
"loss": 6.7062,
"mean_token_accuracy": 0.14734956696629525,
"num_tokens": 6135461.0,
"step": 2435
},
{
"entropy": 6.737766313552856,
"epoch": 0.2815926139642239,
"grad_norm": 0.86328125,
"learning_rate": 0.0004996866582292067,
"loss": 6.7563,
"mean_token_accuracy": 0.1486450642347336,
"num_tokens": 6147698.0,
"step": 2440
},
{
"entropy": 6.906767129898071,
"epoch": 0.28216964800923255,
"grad_norm": 0.8203125,
"learning_rate": 0.0004996844774594856,
"loss": 6.6995,
"mean_token_accuracy": 0.15024199485778808,
"num_tokens": 6160456.0,
"step": 2445
},
{
"entropy": 6.721561002731323,
"epoch": 0.2827466820542412,
"grad_norm": 0.87890625,
"learning_rate": 0.0004996822891326138,
"loss": 6.6952,
"mean_token_accuracy": 0.14862452447414398,
"num_tokens": 6173606.0,
"step": 2450
},
{
"entropy": 6.840061807632447,
"epoch": 0.28332371609924983,
"grad_norm": 0.83203125,
"learning_rate": 0.0004996800932486648,
"loss": 6.7195,
"mean_token_accuracy": 0.14363468587398528,
"num_tokens": 6185355.0,
"step": 2455
},
{
"entropy": 6.82087197303772,
"epoch": 0.28390075014425853,
"grad_norm": 0.83203125,
"learning_rate": 0.0004996778898077126,
"loss": 6.7452,
"mean_token_accuracy": 0.14526572227478027,
"num_tokens": 6198154.0,
"step": 2460
},
{
"entropy": 6.825610780715943,
"epoch": 0.28447778418926717,
"grad_norm": 0.9765625,
"learning_rate": 0.0004996756788098309,
"loss": 6.6295,
"mean_token_accuracy": 0.1540285274386406,
"num_tokens": 6209901.0,
"step": 2465
},
{
"entropy": 6.724011659622192,
"epoch": 0.2850548182342758,
"grad_norm": 0.7890625,
"learning_rate": 0.0004996734602550945,
"loss": 6.6914,
"mean_token_accuracy": 0.14896469041705132,
"num_tokens": 6222052.0,
"step": 2470
},
{
"entropy": 6.822287702560425,
"epoch": 0.2856318522792845,
"grad_norm": 0.828125,
"learning_rate": 0.0004996712341435779,
"loss": 6.6874,
"mean_token_accuracy": 0.1531086578965187,
"num_tokens": 6235112.0,
"step": 2475
},
{
"entropy": 6.779771232604981,
"epoch": 0.28620888632429314,
"grad_norm": 1.0,
"learning_rate": 0.0004996690004753559,
"loss": 6.7241,
"mean_token_accuracy": 0.1425678864121437,
"num_tokens": 6248225.0,
"step": 2480
},
{
"entropy": 6.827151918411255,
"epoch": 0.2867859203693018,
"grad_norm": 0.90234375,
"learning_rate": 0.0004996667592505037,
"loss": 6.6731,
"mean_token_accuracy": 0.15249393209815026,
"num_tokens": 6259518.0,
"step": 2485
},
{
"entropy": 6.752045726776123,
"epoch": 0.2873629544143104,
"grad_norm": 0.8359375,
"learning_rate": 0.0004996645104690967,
"loss": 6.6827,
"mean_token_accuracy": 0.1392819695174694,
"num_tokens": 6271832.0,
"step": 2490
},
{
"entropy": 6.84897813796997,
"epoch": 0.2879399884593191,
"grad_norm": 0.85546875,
"learning_rate": 0.0004996622541312103,
"loss": 6.7198,
"mean_token_accuracy": 0.1458892524242401,
"num_tokens": 6284328.0,
"step": 2495
},
{
"entropy": 6.746988677978516,
"epoch": 0.28851702250432776,
"grad_norm": 0.875,
"learning_rate": 0.0004996599902369207,
"loss": 6.6617,
"mean_token_accuracy": 0.1465374030172825,
"num_tokens": 6296100.0,
"step": 2500
},
{
"entropy": 6.685969734191895,
"epoch": 0.2890940565493364,
"grad_norm": 0.80859375,
"learning_rate": 0.0004996577187863039,
"loss": 6.6493,
"mean_token_accuracy": 0.15570555478334427,
"num_tokens": 6308262.0,
"step": 2505
},
{
"entropy": 6.827516984939575,
"epoch": 0.2896710905943451,
"grad_norm": 0.75,
"learning_rate": 0.0004996554397794364,
"loss": 6.6959,
"mean_token_accuracy": 0.1382772818207741,
"num_tokens": 6319953.0,
"step": 2510
},
{
"entropy": 6.807676601409912,
"epoch": 0.29024812463935373,
"grad_norm": 0.82421875,
"learning_rate": 0.0004996531532163947,
"loss": 6.6329,
"mean_token_accuracy": 0.15100528299808502,
"num_tokens": 6332953.0,
"step": 2515
},
{
"entropy": 6.77238130569458,
"epoch": 0.2908251586843624,
"grad_norm": 0.828125,
"learning_rate": 0.0004996508590972558,
"loss": 6.6873,
"mean_token_accuracy": 0.1495242863893509,
"num_tokens": 6345692.0,
"step": 2520
},
{
"entropy": 6.78111777305603,
"epoch": 0.291402192729371,
"grad_norm": 0.94921875,
"learning_rate": 0.0004996485574220969,
"loss": 6.6698,
"mean_token_accuracy": 0.14763007685542107,
"num_tokens": 6358058.0,
"step": 2525
},
{
"entropy": 6.842091226577759,
"epoch": 0.2919792267743797,
"grad_norm": 0.921875,
"learning_rate": 0.0004996462481909953,
"loss": 6.7157,
"mean_token_accuracy": 0.149982488155365,
"num_tokens": 6370469.0,
"step": 2530
},
{
"entropy": 6.7619242668151855,
"epoch": 0.29255626081938835,
"grad_norm": 0.84375,
"learning_rate": 0.0004996439314040287,
"loss": 6.7762,
"mean_token_accuracy": 0.1360616222023964,
"num_tokens": 6384333.0,
"step": 2535
},
{
"entropy": 6.855607652664185,
"epoch": 0.293133294864397,
"grad_norm": 0.80859375,
"learning_rate": 0.000499641607061275,
"loss": 6.7016,
"mean_token_accuracy": 0.1434970736503601,
"num_tokens": 6397688.0,
"step": 2540
},
{
"entropy": 6.819028520584107,
"epoch": 0.2937103289094057,
"grad_norm": 0.8046875,
"learning_rate": 0.0004996392751628126,
"loss": 6.6602,
"mean_token_accuracy": 0.14889983236789703,
"num_tokens": 6410188.0,
"step": 2545
},
{
"entropy": 6.722808504104615,
"epoch": 0.2942873629544143,
"grad_norm": 0.859375,
"learning_rate": 0.0004996369357087196,
"loss": 6.6805,
"mean_token_accuracy": 0.14856439232826232,
"num_tokens": 6423313.0,
"step": 2550
},
{
"entropy": 6.845215559005737,
"epoch": 0.29486439699942296,
"grad_norm": 0.765625,
"learning_rate": 0.000499634588699075,
"loss": 6.7135,
"mean_token_accuracy": 0.14631582498550416,
"num_tokens": 6435853.0,
"step": 2555
},
{
"entropy": 6.713652801513672,
"epoch": 0.2954414310444316,
"grad_norm": 0.8046875,
"learning_rate": 0.0004996322341339575,
"loss": 6.6397,
"mean_token_accuracy": 0.14477873146533965,
"num_tokens": 6448659.0,
"step": 2560
},
{
"entropy": 6.7395094871521,
"epoch": 0.2960184650894403,
"grad_norm": 0.84375,
"learning_rate": 0.0004996298720134465,
"loss": 6.6985,
"mean_token_accuracy": 0.14935118854045867,
"num_tokens": 6460534.0,
"step": 2565
},
{
"entropy": 6.828916740417481,
"epoch": 0.29659549913444894,
"grad_norm": 0.8515625,
"learning_rate": 0.0004996275023376213,
"loss": 6.6741,
"mean_token_accuracy": 0.14743488729000093,
"num_tokens": 6472368.0,
"step": 2570
},
{
"entropy": 6.772326993942261,
"epoch": 0.2971725331794576,
"grad_norm": 0.9296875,
"learning_rate": 0.0004996251251065615,
"loss": 6.6763,
"mean_token_accuracy": 0.14429058134555817,
"num_tokens": 6485430.0,
"step": 2575
},
{
"entropy": 6.764473915100098,
"epoch": 0.2977495672244662,
"grad_norm": 0.80078125,
"learning_rate": 0.0004996227403203473,
"loss": 6.656,
"mean_token_accuracy": 0.15102906972169877,
"num_tokens": 6497303.0,
"step": 2580
},
{
"entropy": 6.816898822784424,
"epoch": 0.2983266012694749,
"grad_norm": 0.83984375,
"learning_rate": 0.0004996203479790589,
"loss": 6.7282,
"mean_token_accuracy": 0.15129706114530564,
"num_tokens": 6510154.0,
"step": 2585
},
{
"entropy": 6.819794940948486,
"epoch": 0.29890363531448355,
"grad_norm": 0.8125,
"learning_rate": 0.0004996179480827764,
"loss": 6.7073,
"mean_token_accuracy": 0.14853841662406922,
"num_tokens": 6523091.0,
"step": 2590
},
{
"entropy": 6.845903539657593,
"epoch": 0.2994806693594922,
"grad_norm": 1.21875,
"learning_rate": 0.000499615540631581,
"loss": 6.6167,
"mean_token_accuracy": 0.15361105501651764,
"num_tokens": 6536043.0,
"step": 2595
},
{
"entropy": 6.660343933105469,
"epoch": 0.3000577034045009,
"grad_norm": 0.88671875,
"learning_rate": 0.0004996131256255534,
"loss": 6.6328,
"mean_token_accuracy": 0.15334705710411073,
"num_tokens": 6548227.0,
"step": 2600
},
{
"entropy": 6.819034004211426,
"epoch": 0.3006347374495095,
"grad_norm": 0.890625,
"learning_rate": 0.0004996107030647749,
"loss": 6.692,
"mean_token_accuracy": 0.14152004942297935,
"num_tokens": 6560204.0,
"step": 2605
},
{
"entropy": 6.756571340560913,
"epoch": 0.30121177149451817,
"grad_norm": 1.28125,
"learning_rate": 0.0004996082729493269,
"loss": 6.6744,
"mean_token_accuracy": 0.15325141996145247,
"num_tokens": 6573235.0,
"step": 2610
},
{
"entropy": 6.73859806060791,
"epoch": 0.3017888055395268,
"grad_norm": 0.83203125,
"learning_rate": 0.0004996058352792913,
"loss": 6.7054,
"mean_token_accuracy": 0.14550871774554253,
"num_tokens": 6585118.0,
"step": 2615
},
{
"entropy": 6.755663061141968,
"epoch": 0.3023658395845355,
"grad_norm": 0.96484375,
"learning_rate": 0.00049960339005475,
"loss": 6.5996,
"mean_token_accuracy": 0.14909390211105347,
"num_tokens": 6596690.0,
"step": 2620
},
{
"entropy": 6.764217233657837,
"epoch": 0.30294287362954414,
"grad_norm": 0.890625,
"learning_rate": 0.0004996009372757852,
"loss": 6.5965,
"mean_token_accuracy": 0.1569955661892891,
"num_tokens": 6609076.0,
"step": 2625
},
{
"entropy": 6.729177474975586,
"epoch": 0.3035199076745528,
"grad_norm": 0.828125,
"learning_rate": 0.0004995984769424795,
"loss": 6.7118,
"mean_token_accuracy": 0.14563166871666908,
"num_tokens": 6621352.0,
"step": 2630
},
{
"entropy": 6.814102125167847,
"epoch": 0.3040969417195615,
"grad_norm": 1.3515625,
"learning_rate": 0.0004995960090549155,
"loss": 6.5982,
"mean_token_accuracy": 0.1499995172023773,
"num_tokens": 6633924.0,
"step": 2635
},
{
"entropy": 6.754621171951294,
"epoch": 0.3046739757645701,
"grad_norm": 0.86328125,
"learning_rate": 0.0004995935336131764,
"loss": 6.7238,
"mean_token_accuracy": 0.1473952054977417,
"num_tokens": 6646490.0,
"step": 2640
},
{
"entropy": 6.8332771301269535,
"epoch": 0.30525100980957875,
"grad_norm": 0.89453125,
"learning_rate": 0.0004995910506173452,
"loss": 6.6893,
"mean_token_accuracy": 0.14203061014413834,
"num_tokens": 6660171.0,
"step": 2645
},
{
"entropy": 6.768089628219604,
"epoch": 0.3058280438545874,
"grad_norm": 0.828125,
"learning_rate": 0.0004995885600675059,
"loss": 6.7052,
"mean_token_accuracy": 0.1487940713763237,
"num_tokens": 6673505.0,
"step": 2650
},
{
"entropy": 6.782451200485229,
"epoch": 0.3064050778995961,
"grad_norm": 0.8125,
"learning_rate": 0.0004995860619637415,
"loss": 6.7004,
"mean_token_accuracy": 0.1495489463210106,
"num_tokens": 6685798.0,
"step": 2655
},
{
"entropy": 6.705468416213989,
"epoch": 0.30698211194460473,
"grad_norm": 0.90234375,
"learning_rate": 0.0004995835563061367,
"loss": 6.5514,
"mean_token_accuracy": 0.15502395033836364,
"num_tokens": 6699254.0,
"step": 2660
},
{
"entropy": 6.736592388153076,
"epoch": 0.30755914598961337,
"grad_norm": 0.84765625,
"learning_rate": 0.0004995810430947756,
"loss": 6.6154,
"mean_token_accuracy": 0.15057491064071654,
"num_tokens": 6711088.0,
"step": 2665
},
{
"entropy": 6.759505414962769,
"epoch": 0.30813618003462206,
"grad_norm": 0.83984375,
"learning_rate": 0.0004995785223297426,
"loss": 6.6807,
"mean_token_accuracy": 0.14461947679519654,
"num_tokens": 6723373.0,
"step": 2670
},
{
"entropy": 6.741917705535888,
"epoch": 0.3087132140796307,
"grad_norm": 0.73828125,
"learning_rate": 0.0004995759940111225,
"loss": 6.6848,
"mean_token_accuracy": 0.14381011575460434,
"num_tokens": 6737984.0,
"step": 2675
},
{
"entropy": 6.773638963699341,
"epoch": 0.30929024812463934,
"grad_norm": 0.86328125,
"learning_rate": 0.0004995734581390005,
"loss": 6.6328,
"mean_token_accuracy": 0.14959122091531754,
"num_tokens": 6751283.0,
"step": 2680
},
{
"entropy": 6.680616760253907,
"epoch": 0.309867282169648,
"grad_norm": 0.76953125,
"learning_rate": 0.0004995709147134617,
"loss": 6.6046,
"mean_token_accuracy": 0.15074616074562072,
"num_tokens": 6765012.0,
"step": 2685
},
{
"entropy": 6.775850296020508,
"epoch": 0.3104443162146567,
"grad_norm": 0.81640625,
"learning_rate": 0.0004995683637345919,
"loss": 6.6392,
"mean_token_accuracy": 0.15261454582214357,
"num_tokens": 6777708.0,
"step": 2690
},
{
"entropy": 6.7052594184875485,
"epoch": 0.3110213502596653,
"grad_norm": 0.82421875,
"learning_rate": 0.0004995658052024765,
"loss": 6.5669,
"mean_token_accuracy": 0.16054244190454484,
"num_tokens": 6791325.0,
"step": 2695
},
{
"entropy": 6.722959423065186,
"epoch": 0.31159838430467396,
"grad_norm": 0.78125,
"learning_rate": 0.0004995632391172019,
"loss": 6.718,
"mean_token_accuracy": 0.13914413154125213,
"num_tokens": 6805659.0,
"step": 2700
},
{
"entropy": 6.812787103652954,
"epoch": 0.31217541834968265,
"grad_norm": 0.84765625,
"learning_rate": 0.0004995606654788543,
"loss": 6.637,
"mean_token_accuracy": 0.14895061701536177,
"num_tokens": 6818110.0,
"step": 2705
},
{
"entropy": 6.727897787094117,
"epoch": 0.3127524523946913,
"grad_norm": 0.86328125,
"learning_rate": 0.0004995580842875202,
"loss": 6.6378,
"mean_token_accuracy": 0.14641101211309432,
"num_tokens": 6830959.0,
"step": 2710
},
{
"entropy": 6.807159328460694,
"epoch": 0.31332948643969993,
"grad_norm": 0.8671875,
"learning_rate": 0.0004995554955432866,
"loss": 6.6977,
"mean_token_accuracy": 0.14908618479967117,
"num_tokens": 6843318.0,
"step": 2715
},
{
"entropy": 6.718437242507934,
"epoch": 0.3139065204847086,
"grad_norm": 0.90234375,
"learning_rate": 0.0004995528992462404,
"loss": 6.5811,
"mean_token_accuracy": 0.1510560542345047,
"num_tokens": 6855154.0,
"step": 2720
},
{
"entropy": 6.71838641166687,
"epoch": 0.31448355452971727,
"grad_norm": 0.8359375,
"learning_rate": 0.000499550295396469,
"loss": 6.6456,
"mean_token_accuracy": 0.14983784556388854,
"num_tokens": 6867428.0,
"step": 2725
},
{
"entropy": 6.756401872634887,
"epoch": 0.3150605885747259,
"grad_norm": 0.85546875,
"learning_rate": 0.0004995476839940598,
"loss": 6.6363,
"mean_token_accuracy": 0.15786276906728744,
"num_tokens": 6879989.0,
"step": 2730
},
{
"entropy": 6.777546310424805,
"epoch": 0.31563762261973455,
"grad_norm": 0.80078125,
"learning_rate": 0.000499545065039101,
"loss": 6.6447,
"mean_token_accuracy": 0.1432705909013748,
"num_tokens": 6893179.0,
"step": 2735
},
{
"entropy": 6.786166429519653,
"epoch": 0.31621465666474324,
"grad_norm": 0.87890625,
"learning_rate": 0.0004995424385316803,
"loss": 6.6354,
"mean_token_accuracy": 0.1462482675909996,
"num_tokens": 6905647.0,
"step": 2740
},
{
"entropy": 6.713575553894043,
"epoch": 0.3167916907097519,
"grad_norm": 0.80078125,
"learning_rate": 0.0004995398044718863,
"loss": 6.6146,
"mean_token_accuracy": 0.15827973783016205,
"num_tokens": 6917361.0,
"step": 2745
},
{
"entropy": 6.780123996734619,
"epoch": 0.3173687247547605,
"grad_norm": 0.91796875,
"learning_rate": 0.0004995371628598074,
"loss": 6.6339,
"mean_token_accuracy": 0.14651651680469513,
"num_tokens": 6929515.0,
"step": 2750
},
{
"entropy": 6.748660898208618,
"epoch": 0.31794575879976916,
"grad_norm": 0.78125,
"learning_rate": 0.0004995345136955328,
"loss": 6.6036,
"mean_token_accuracy": 0.15300127118825912,
"num_tokens": 6942265.0,
"step": 2755
},
{
"entropy": 6.7021361827850345,
"epoch": 0.31852279284477786,
"grad_norm": 0.80078125,
"learning_rate": 0.0004995318569791512,
"loss": 6.661,
"mean_token_accuracy": 0.15360585749149322,
"num_tokens": 6955151.0,
"step": 2760
},
{
"entropy": 6.784101343154907,
"epoch": 0.3190998268897865,
"grad_norm": 0.88671875,
"learning_rate": 0.0004995291927107522,
"loss": 6.6172,
"mean_token_accuracy": 0.1502458855509758,
"num_tokens": 6968378.0,
"step": 2765
},
{
"entropy": 6.669129657745361,
"epoch": 0.31967686093479514,
"grad_norm": 1.046875,
"learning_rate": 0.0004995265208904252,
"loss": 6.6216,
"mean_token_accuracy": 0.14923231303691864,
"num_tokens": 6980083.0,
"step": 2770
},
{
"entropy": 6.747028255462647,
"epoch": 0.32025389497980383,
"grad_norm": 0.86328125,
"learning_rate": 0.0004995238415182603,
"loss": 6.6581,
"mean_token_accuracy": 0.1432106763124466,
"num_tokens": 6992981.0,
"step": 2775
},
{
"entropy": 6.844202852249145,
"epoch": 0.3208309290248125,
"grad_norm": 0.80859375,
"learning_rate": 0.0004995211545943476,
"loss": 6.6409,
"mean_token_accuracy": 0.14744580015540124,
"num_tokens": 7006115.0,
"step": 2780
},
{
"entropy": 6.653217697143555,
"epoch": 0.3214079630698211,
"grad_norm": 0.8359375,
"learning_rate": 0.0004995184601187772,
"loss": 6.6014,
"mean_token_accuracy": 0.15577706843614578,
"num_tokens": 7019176.0,
"step": 2785
},
{
"entropy": 6.641081857681274,
"epoch": 0.32198499711482975,
"grad_norm": 0.85546875,
"learning_rate": 0.00049951575809164,
"loss": 6.5282,
"mean_token_accuracy": 0.16437966525554656,
"num_tokens": 7031214.0,
"step": 2790
},
{
"entropy": 6.66480655670166,
"epoch": 0.32256203115983845,
"grad_norm": 0.875,
"learning_rate": 0.0004995130485130269,
"loss": 6.6088,
"mean_token_accuracy": 0.15185024589300156,
"num_tokens": 7044702.0,
"step": 2795
},
{
"entropy": 6.752944231033325,
"epoch": 0.3231390652048471,
"grad_norm": 0.81640625,
"learning_rate": 0.0004995103313830289,
"loss": 6.6018,
"mean_token_accuracy": 0.15165336132049562,
"num_tokens": 7056489.0,
"step": 2800
},
{
"entropy": 6.729215812683106,
"epoch": 0.3237160992498557,
"grad_norm": 0.95703125,
"learning_rate": 0.0004995076067017373,
"loss": 6.6406,
"mean_token_accuracy": 0.14547208398580552,
"num_tokens": 7068972.0,
"step": 2805
},
{
"entropy": 6.74854302406311,
"epoch": 0.3242931332948644,
"grad_norm": 0.94921875,
"learning_rate": 0.0004995048744692439,
"loss": 6.5746,
"mean_token_accuracy": 0.15244885683059692,
"num_tokens": 7080894.0,
"step": 2810
},
{
"entropy": 6.713599061965942,
"epoch": 0.32487016733987306,
"grad_norm": 0.76953125,
"learning_rate": 0.0004995021346856405,
"loss": 6.6122,
"mean_token_accuracy": 0.14793540984392167,
"num_tokens": 7094427.0,
"step": 2815
},
{
"entropy": 6.65841121673584,
"epoch": 0.3254472013848817,
"grad_norm": 0.78515625,
"learning_rate": 0.0004994993873510196,
"loss": 6.5596,
"mean_token_accuracy": 0.16087264865636824,
"num_tokens": 7105710.0,
"step": 2820
},
{
"entropy": 6.793656873703003,
"epoch": 0.32602423542989034,
"grad_norm": 0.85546875,
"learning_rate": 0.0004994966324654731,
"loss": 6.5838,
"mean_token_accuracy": 0.14802931025624275,
"num_tokens": 7119042.0,
"step": 2825
},
{
"entropy": 6.634446716308593,
"epoch": 0.32660126947489904,
"grad_norm": 0.84765625,
"learning_rate": 0.000499493870029094,
"loss": 6.6077,
"mean_token_accuracy": 0.148269946873188,
"num_tokens": 7132146.0,
"step": 2830
},
{
"entropy": 6.726744699478149,
"epoch": 0.3271783035199077,
"grad_norm": 0.80859375,
"learning_rate": 0.0004994911000419749,
"loss": 6.562,
"mean_token_accuracy": 0.15012803077697753,
"num_tokens": 7144805.0,
"step": 2835
},
{
"entropy": 6.6751384258270265,
"epoch": 0.3277553375649163,
"grad_norm": 0.859375,
"learning_rate": 0.0004994883225042093,
"loss": 6.5475,
"mean_token_accuracy": 0.16178591400384904,
"num_tokens": 7156906.0,
"step": 2840
},
{
"entropy": 6.753067064285278,
"epoch": 0.328332371609925,
"grad_norm": 0.94921875,
"learning_rate": 0.0004994855374158905,
"loss": 6.5298,
"mean_token_accuracy": 0.15081926435232162,
"num_tokens": 7169451.0,
"step": 2845
},
{
"entropy": 6.7513651847839355,
"epoch": 0.32890940565493365,
"grad_norm": 0.75,
"learning_rate": 0.000499482744777112,
"loss": 6.675,
"mean_token_accuracy": 0.14404026567935943,
"num_tokens": 7183211.0,
"step": 2850
},
{
"entropy": 6.7373758316040036,
"epoch": 0.3294864396999423,
"grad_norm": 0.88671875,
"learning_rate": 0.000499479944587968,
"loss": 6.6147,
"mean_token_accuracy": 0.1517378196120262,
"num_tokens": 7196062.0,
"step": 2855
},
{
"entropy": 6.794651794433594,
"epoch": 0.33006347374495093,
"grad_norm": 0.91796875,
"learning_rate": 0.0004994771368485526,
"loss": 6.7089,
"mean_token_accuracy": 0.14450829550623895,
"num_tokens": 7208079.0,
"step": 2860
},
{
"entropy": 6.799776029586792,
"epoch": 0.3306405077899596,
"grad_norm": 0.92578125,
"learning_rate": 0.0004994743215589602,
"loss": 6.656,
"mean_token_accuracy": 0.14721468538045884,
"num_tokens": 7221537.0,
"step": 2865
},
{
"entropy": 6.66144700050354,
"epoch": 0.33121754183496827,
"grad_norm": 0.79296875,
"learning_rate": 0.0004994714987192854,
"loss": 6.6285,
"mean_token_accuracy": 0.14779918044805526,
"num_tokens": 7234472.0,
"step": 2870
},
{
"entropy": 6.707424116134644,
"epoch": 0.3317945758799769,
"grad_norm": 0.890625,
"learning_rate": 0.0004994686683296234,
"loss": 6.5847,
"mean_token_accuracy": 0.15313812494277954,
"num_tokens": 7247818.0,
"step": 2875
},
{
"entropy": 6.695041847229004,
"epoch": 0.3323716099249856,
"grad_norm": 0.7421875,
"learning_rate": 0.0004994658303900691,
"loss": 6.6729,
"mean_token_accuracy": 0.15236686170101166,
"num_tokens": 7261351.0,
"step": 2880
},
{
"entropy": 6.677237319946289,
"epoch": 0.33294864396999424,
"grad_norm": 0.80078125,
"learning_rate": 0.0004994629849007182,
"loss": 6.5247,
"mean_token_accuracy": 0.15475201308727266,
"num_tokens": 7274310.0,
"step": 2885
},
{
"entropy": 6.6607647895812985,
"epoch": 0.3335256780150029,
"grad_norm": 0.8203125,
"learning_rate": 0.0004994601318616663,
"loss": 6.5631,
"mean_token_accuracy": 0.15157887637615203,
"num_tokens": 7286560.0,
"step": 2890
},
{
"entropy": 6.811610126495362,
"epoch": 0.3341027120600115,
"grad_norm": 0.79296875,
"learning_rate": 0.0004994572712730092,
"loss": 6.6486,
"mean_token_accuracy": 0.14426497519016265,
"num_tokens": 7300337.0,
"step": 2895
},
{
"entropy": 6.691228675842285,
"epoch": 0.3346797461050202,
"grad_norm": 0.80078125,
"learning_rate": 0.0004994544031348434,
"loss": 6.6194,
"mean_token_accuracy": 0.1486266866326332,
"num_tokens": 7313436.0,
"step": 2900
},
{
"entropy": 6.666589450836182,
"epoch": 0.33525678015002885,
"grad_norm": 0.8125,
"learning_rate": 0.0004994515274472653,
"loss": 6.4758,
"mean_token_accuracy": 0.16475249975919723,
"num_tokens": 7325766.0,
"step": 2905
},
{
"entropy": 6.611915159225464,
"epoch": 0.3358338141950375,
"grad_norm": 0.9609375,
"learning_rate": 0.0004994486442103715,
"loss": 6.5599,
"mean_token_accuracy": 0.14973128736019134,
"num_tokens": 7337904.0,
"step": 2910
},
{
"entropy": 6.648727655410767,
"epoch": 0.3364108482400462,
"grad_norm": 0.82421875,
"learning_rate": 0.000499445753424259,
"loss": 6.5601,
"mean_token_accuracy": 0.15160418599843978,
"num_tokens": 7350448.0,
"step": 2915
},
{
"entropy": 6.7852109432220455,
"epoch": 0.33698788228505483,
"grad_norm": 0.78515625,
"learning_rate": 0.0004994428550890251,
"loss": 6.5957,
"mean_token_accuracy": 0.1476546384394169,
"num_tokens": 7363859.0,
"step": 2920
},
{
"entropy": 6.703492069244385,
"epoch": 0.33756491633006347,
"grad_norm": 0.8125,
"learning_rate": 0.0004994399492047672,
"loss": 6.6148,
"mean_token_accuracy": 0.1489669606089592,
"num_tokens": 7376963.0,
"step": 2925
},
{
"entropy": 6.677239227294922,
"epoch": 0.3381419503750721,
"grad_norm": 0.8203125,
"learning_rate": 0.0004994370357715832,
"loss": 6.6462,
"mean_token_accuracy": 0.14910098984837533,
"num_tokens": 7390370.0,
"step": 2930
},
{
"entropy": 6.712501335144043,
"epoch": 0.3387189844200808,
"grad_norm": 0.79296875,
"learning_rate": 0.000499434114789571,
"loss": 6.5836,
"mean_token_accuracy": 0.15484795421361924,
"num_tokens": 7402851.0,
"step": 2935
},
{
"entropy": 6.638098287582397,
"epoch": 0.33929601846508944,
"grad_norm": 0.8046875,
"learning_rate": 0.0004994311862588286,
"loss": 6.6003,
"mean_token_accuracy": 0.14664260819554328,
"num_tokens": 7415428.0,
"step": 2940
},
{
"entropy": 6.786514616012573,
"epoch": 0.3398730525100981,
"grad_norm": 0.7890625,
"learning_rate": 0.0004994282501794551,
"loss": 6.5911,
"mean_token_accuracy": 0.15048429667949675,
"num_tokens": 7428420.0,
"step": 2945
},
{
"entropy": 6.686578941345215,
"epoch": 0.3404500865551068,
"grad_norm": 0.921875,
"learning_rate": 0.0004994253065515486,
"loss": 6.6436,
"mean_token_accuracy": 0.15113215446472167,
"num_tokens": 7439626.0,
"step": 2950
},
{
"entropy": 6.725645685195923,
"epoch": 0.3410271206001154,
"grad_norm": 0.83203125,
"learning_rate": 0.0004994223553752084,
"loss": 6.5901,
"mean_token_accuracy": 0.1514264941215515,
"num_tokens": 7452797.0,
"step": 2955
},
{
"entropy": 6.65960373878479,
"epoch": 0.34160415464512406,
"grad_norm": 0.8359375,
"learning_rate": 0.0004994193966505339,
"loss": 6.5682,
"mean_token_accuracy": 0.15812762975692748,
"num_tokens": 7464311.0,
"step": 2960
},
{
"entropy": 6.6784382343292235,
"epoch": 0.3421811886901327,
"grad_norm": 0.8828125,
"learning_rate": 0.0004994164303776244,
"loss": 6.5852,
"mean_token_accuracy": 0.15011241137981415,
"num_tokens": 7475706.0,
"step": 2965
},
{
"entropy": 6.7143481254577635,
"epoch": 0.3427582227351414,
"grad_norm": 0.8125,
"learning_rate": 0.0004994134565565797,
"loss": 6.6579,
"mean_token_accuracy": 0.1478770911693573,
"num_tokens": 7489077.0,
"step": 2970
},
{
"entropy": 6.736965751647949,
"epoch": 0.34333525678015003,
"grad_norm": 0.796875,
"learning_rate": 0.0004994104751875,
"loss": 6.6074,
"mean_token_accuracy": 0.15452702343463898,
"num_tokens": 7501598.0,
"step": 2975
},
{
"entropy": 6.608485174179077,
"epoch": 0.3439122908251587,
"grad_norm": 0.9921875,
"learning_rate": 0.0004994074862704854,
"loss": 6.4109,
"mean_token_accuracy": 0.16355000287294388,
"num_tokens": 7514776.0,
"step": 2980
},
{
"entropy": 6.584009838104248,
"epoch": 0.3444893248701673,
"grad_norm": 0.81640625,
"learning_rate": 0.0004994044898056363,
"loss": 6.5766,
"mean_token_accuracy": 0.15253832191228867,
"num_tokens": 7527795.0,
"step": 2985
},
{
"entropy": 6.702622604370117,
"epoch": 0.345066358915176,
"grad_norm": 0.8828125,
"learning_rate": 0.0004994014857930538,
"loss": 6.4427,
"mean_token_accuracy": 0.1624614641070366,
"num_tokens": 7541392.0,
"step": 2990
},
{
"entropy": 6.615006446838379,
"epoch": 0.34564339296018465,
"grad_norm": 0.8046875,
"learning_rate": 0.0004993984742328387,
"loss": 6.601,
"mean_token_accuracy": 0.15036358386278154,
"num_tokens": 7554369.0,
"step": 2995
},
{
"entropy": 6.672338581085205,
"epoch": 0.3462204270051933,
"grad_norm": 0.92578125,
"learning_rate": 0.0004993954551250925,
"loss": 6.603,
"mean_token_accuracy": 0.154202963411808,
"num_tokens": 7567528.0,
"step": 3000
},
{
"epoch": 0.3462204270051933,
"eval_entropy": 6.5903391438110805,
"eval_loss": 6.633339881896973,
"eval_mean_token_accuracy": 0.15343972800560624,
"eval_num_tokens": 7567528.0,
"eval_runtime": 17.6947,
"eval_samples_per_second": 1590.081,
"eval_steps_per_second": 198.76,
"step": 3000
},
{
"entropy": 6.706592988967896,
"epoch": 0.346797461050202,
"grad_norm": 0.7890625,
"learning_rate": 0.0004993924284699165,
"loss": 6.5524,
"mean_token_accuracy": 0.15312376469373704,
"num_tokens": 7579146.0,
"step": 3005
},
{
"entropy": 6.66014552116394,
"epoch": 0.3473744950952106,
"grad_norm": 0.84765625,
"learning_rate": 0.0004993893942674127,
"loss": 6.64,
"mean_token_accuracy": 0.1477951481938362,
"num_tokens": 7591902.0,
"step": 3010
},
{
"entropy": 6.799589061737061,
"epoch": 0.34795152914021926,
"grad_norm": 0.8671875,
"learning_rate": 0.000499386352517683,
"loss": 6.6448,
"mean_token_accuracy": 0.1552356779575348,
"num_tokens": 7605565.0,
"step": 3015
},
{
"entropy": 6.7373872756958,
"epoch": 0.3485285631852279,
"grad_norm": 0.7578125,
"learning_rate": 0.00049938330322083,
"loss": 6.5734,
"mean_token_accuracy": 0.15451606512069702,
"num_tokens": 7618380.0,
"step": 3020
},
{
"entropy": 6.653174638748169,
"epoch": 0.3491055972302366,
"grad_norm": 0.80859375,
"learning_rate": 0.0004993802463769558,
"loss": 6.6035,
"mean_token_accuracy": 0.14853976368904115,
"num_tokens": 7632092.0,
"step": 3025
},
{
"entropy": 6.6859503269195555,
"epoch": 0.34968263127524524,
"grad_norm": 0.9140625,
"learning_rate": 0.0004993771819861636,
"loss": 6.6097,
"mean_token_accuracy": 0.14797925502061843,
"num_tokens": 7644185.0,
"step": 3030
},
{
"entropy": 6.741736364364624,
"epoch": 0.3502596653202539,
"grad_norm": 0.83203125,
"learning_rate": 0.0004993741100485564,
"loss": 6.5012,
"mean_token_accuracy": 0.15530159771442414,
"num_tokens": 7656635.0,
"step": 3035
},
{
"entropy": 6.64942421913147,
"epoch": 0.35083669936526257,
"grad_norm": 0.8203125,
"learning_rate": 0.0004993710305642374,
"loss": 6.5621,
"mean_token_accuracy": 0.15173622369766235,
"num_tokens": 7669643.0,
"step": 3040
},
{
"entropy": 6.688398933410644,
"epoch": 0.3514137334102712,
"grad_norm": 0.79296875,
"learning_rate": 0.0004993679435333102,
"loss": 6.5822,
"mean_token_accuracy": 0.14759134352207184,
"num_tokens": 7682489.0,
"step": 3045
},
{
"entropy": 6.630285358428955,
"epoch": 0.35199076745527985,
"grad_norm": 1.2421875,
"learning_rate": 0.0004993648489558788,
"loss": 6.5269,
"mean_token_accuracy": 0.15159836709499358,
"num_tokens": 7696670.0,
"step": 3050
},
{
"entropy": 6.6929933547973635,
"epoch": 0.3525678015002885,
"grad_norm": 0.859375,
"learning_rate": 0.0004993617468320471,
"loss": 6.5451,
"mean_token_accuracy": 0.15906845778226852,
"num_tokens": 7709054.0,
"step": 3055
},
{
"entropy": 6.634079313278198,
"epoch": 0.3531448355452972,
"grad_norm": 0.87109375,
"learning_rate": 0.0004993586371619193,
"loss": 6.5548,
"mean_token_accuracy": 0.15278329253196715,
"num_tokens": 7721710.0,
"step": 3060
},
{
"entropy": 6.722148132324219,
"epoch": 0.3537218695903058,
"grad_norm": 0.77734375,
"learning_rate": 0.0004993555199456004,
"loss": 6.6095,
"mean_token_accuracy": 0.1526441752910614,
"num_tokens": 7733689.0,
"step": 3065
},
{
"entropy": 6.66739444732666,
"epoch": 0.35429890363531447,
"grad_norm": 0.8046875,
"learning_rate": 0.0004993523951831949,
"loss": 6.5803,
"mean_token_accuracy": 0.1555978015065193,
"num_tokens": 7745735.0,
"step": 3070
},
{
"entropy": 6.7588379859924315,
"epoch": 0.35487593768032316,
"grad_norm": 0.83203125,
"learning_rate": 0.0004993492628748081,
"loss": 6.5894,
"mean_token_accuracy": 0.14369118213653564,
"num_tokens": 7757352.0,
"step": 3075
},
{
"entropy": 6.6846785068511965,
"epoch": 0.3554529717253318,
"grad_norm": 0.83984375,
"learning_rate": 0.0004993461230205453,
"loss": 6.5369,
"mean_token_accuracy": 0.14949805587530135,
"num_tokens": 7768363.0,
"step": 3080
},
{
"entropy": 6.668369150161743,
"epoch": 0.35603000577034044,
"grad_norm": 0.83203125,
"learning_rate": 0.0004993429756205121,
"loss": 6.6618,
"mean_token_accuracy": 0.14399161487817763,
"num_tokens": 7781133.0,
"step": 3085
},
{
"entropy": 6.810355234146118,
"epoch": 0.3566070398153491,
"grad_norm": 0.8515625,
"learning_rate": 0.0004993398206748142,
"loss": 6.6461,
"mean_token_accuracy": 0.14326538443565368,
"num_tokens": 7794445.0,
"step": 3090
},
{
"entropy": 6.689512538909912,
"epoch": 0.3571840738603578,
"grad_norm": 0.79296875,
"learning_rate": 0.0004993366581835581,
"loss": 6.5431,
"mean_token_accuracy": 0.15431275665760041,
"num_tokens": 7807601.0,
"step": 3095
},
{
"entropy": 6.592484951019287,
"epoch": 0.3577611079053664,
"grad_norm": 0.80859375,
"learning_rate": 0.0004993334881468498,
"loss": 6.5139,
"mean_token_accuracy": 0.1561570018529892,
"num_tokens": 7819821.0,
"step": 3100
},
{
"entropy": 6.691237831115723,
"epoch": 0.35833814195037506,
"grad_norm": 0.91796875,
"learning_rate": 0.0004993303105647961,
"loss": 6.5343,
"mean_token_accuracy": 0.15187687054276466,
"num_tokens": 7832214.0,
"step": 3105
},
{
"entropy": 6.638499784469604,
"epoch": 0.35891517599538375,
"grad_norm": 0.8671875,
"learning_rate": 0.0004993271254375038,
"loss": 6.5741,
"mean_token_accuracy": 0.16051387637853623,
"num_tokens": 7844566.0,
"step": 3110
},
{
"entropy": 6.710163545608521,
"epoch": 0.3594922100403924,
"grad_norm": 0.78125,
"learning_rate": 0.00049932393276508,
"loss": 6.5434,
"mean_token_accuracy": 0.15657812282443045,
"num_tokens": 7857965.0,
"step": 3115
},
{
"entropy": 6.603605270385742,
"epoch": 0.36006924408540103,
"grad_norm": 1.0859375,
"learning_rate": 0.0004993207325476323,
"loss": 6.5691,
"mean_token_accuracy": 0.1569638028740883,
"num_tokens": 7870902.0,
"step": 3120
},
{
"entropy": 6.778155136108398,
"epoch": 0.36064627813040967,
"grad_norm": 0.828125,
"learning_rate": 0.0004993175247852681,
"loss": 6.6299,
"mean_token_accuracy": 0.14303801953792572,
"num_tokens": 7883694.0,
"step": 3125
},
{
"entropy": 6.624432468414307,
"epoch": 0.36122331217541837,
"grad_norm": 0.84765625,
"learning_rate": 0.0004993143094780954,
"loss": 6.52,
"mean_token_accuracy": 0.1570071041584015,
"num_tokens": 7896693.0,
"step": 3130
},
{
"entropy": 6.6653848648071286,
"epoch": 0.361800346220427,
"grad_norm": 0.765625,
"learning_rate": 0.0004993110866262224,
"loss": 6.519,
"mean_token_accuracy": 0.15744696259498597,
"num_tokens": 7910010.0,
"step": 3135
},
{
"entropy": 6.7992534160614015,
"epoch": 0.36237738026543564,
"grad_norm": 0.87109375,
"learning_rate": 0.0004993078562297573,
"loss": 6.6268,
"mean_token_accuracy": 0.13919368460774423,
"num_tokens": 7922026.0,
"step": 3140
},
{
"entropy": 6.626803922653198,
"epoch": 0.36295441431044434,
"grad_norm": 0.87890625,
"learning_rate": 0.0004993046182888089,
"loss": 6.5974,
"mean_token_accuracy": 0.14518485516309737,
"num_tokens": 7934633.0,
"step": 3145
},
{
"entropy": 6.703473472595215,
"epoch": 0.363531448355453,
"grad_norm": 0.94921875,
"learning_rate": 0.0004993013728034861,
"loss": 6.5012,
"mean_token_accuracy": 0.15910948514938356,
"num_tokens": 7947189.0,
"step": 3150
},
{
"entropy": 6.645997714996338,
"epoch": 0.3641084824004616,
"grad_norm": 1.421875,
"learning_rate": 0.000499298119773898,
"loss": 6.5815,
"mean_token_accuracy": 0.15228615552186966,
"num_tokens": 7961283.0,
"step": 3155
},
{
"entropy": 6.584298086166382,
"epoch": 0.36468551644547026,
"grad_norm": 0.859375,
"learning_rate": 0.0004992948592001541,
"loss": 6.549,
"mean_token_accuracy": 0.157489425688982,
"num_tokens": 7974589.0,
"step": 3160
},
{
"entropy": 6.723839282989502,
"epoch": 0.36526255049047895,
"grad_norm": 0.8515625,
"learning_rate": 0.000499291591082364,
"loss": 6.5873,
"mean_token_accuracy": 0.1510259687900543,
"num_tokens": 7987148.0,
"step": 3165
},
{
"entropy": 6.713741779327393,
"epoch": 0.3658395845354876,
"grad_norm": 0.796875,
"learning_rate": 0.0004992883154206377,
"loss": 6.6151,
"mean_token_accuracy": 0.15011707395315171,
"num_tokens": 8000679.0,
"step": 3170
},
{
"entropy": 6.601009368896484,
"epoch": 0.36641661858049623,
"grad_norm": 0.828125,
"learning_rate": 0.0004992850322150853,
"loss": 6.4989,
"mean_token_accuracy": 0.1541821539402008,
"num_tokens": 8014011.0,
"step": 3175
},
{
"entropy": 6.708580017089844,
"epoch": 0.36699365262550493,
"grad_norm": 0.7734375,
"learning_rate": 0.0004992817414658172,
"loss": 6.5279,
"mean_token_accuracy": 0.1508907914161682,
"num_tokens": 8026022.0,
"step": 3180
},
{
"entropy": 6.696759557723999,
"epoch": 0.36757068667051357,
"grad_norm": 0.90625,
"learning_rate": 0.0004992784431729442,
"loss": 6.5946,
"mean_token_accuracy": 0.15226232409477233,
"num_tokens": 8040123.0,
"step": 3185
},
{
"entropy": 6.711783027648925,
"epoch": 0.3681477207155222,
"grad_norm": 0.87109375,
"learning_rate": 0.0004992751373365771,
"loss": 6.5655,
"mean_token_accuracy": 0.1614807665348053,
"num_tokens": 8053320.0,
"step": 3190
},
{
"entropy": 6.583008337020874,
"epoch": 0.36872475476053085,
"grad_norm": 0.76953125,
"learning_rate": 0.0004992718239568273,
"loss": 6.5506,
"mean_token_accuracy": 0.15854466408491136,
"num_tokens": 8066682.0,
"step": 3195
},
{
"entropy": 6.743299245834351,
"epoch": 0.36930178880553954,
"grad_norm": 0.7890625,
"learning_rate": 0.000499268503033806,
"loss": 6.5441,
"mean_token_accuracy": 0.15438564270734786,
"num_tokens": 8078887.0,
"step": 3200
},
{
"entropy": 6.632726764678955,
"epoch": 0.3698788228505482,
"grad_norm": 0.8671875,
"learning_rate": 0.0004992651745676249,
"loss": 6.5254,
"mean_token_accuracy": 0.14970515072345733,
"num_tokens": 8090801.0,
"step": 3205
},
{
"entropy": 6.689233827590942,
"epoch": 0.3704558568955568,
"grad_norm": 0.86328125,
"learning_rate": 0.0004992618385583962,
"loss": 6.6118,
"mean_token_accuracy": 0.150309057533741,
"num_tokens": 8103387.0,
"step": 3210
},
{
"entropy": 6.599812173843384,
"epoch": 0.3710328909405655,
"grad_norm": 0.84375,
"learning_rate": 0.0004992584950062319,
"loss": 6.4614,
"mean_token_accuracy": 0.15385584011673928,
"num_tokens": 8115356.0,
"step": 3215
},
{
"entropy": 6.6642804622650145,
"epoch": 0.37160992498557416,
"grad_norm": 0.83203125,
"learning_rate": 0.0004992551439112446,
"loss": 6.5755,
"mean_token_accuracy": 0.15292710214853286,
"num_tokens": 8129141.0,
"step": 3220
},
{
"entropy": 6.788556814193726,
"epoch": 0.3721869590305828,
"grad_norm": 0.83203125,
"learning_rate": 0.0004992517852735469,
"loss": 6.6057,
"mean_token_accuracy": 0.15070945620536805,
"num_tokens": 8142453.0,
"step": 3225
},
{
"entropy": 6.635298871994019,
"epoch": 0.37276399307559144,
"grad_norm": 0.8046875,
"learning_rate": 0.0004992484190932517,
"loss": 6.5671,
"mean_token_accuracy": 0.15121689140796662,
"num_tokens": 8154361.0,
"step": 3230
},
{
"entropy": 6.688446187973023,
"epoch": 0.37334102712060013,
"grad_norm": 0.81640625,
"learning_rate": 0.0004992450453704723,
"loss": 6.6194,
"mean_token_accuracy": 0.1466634377837181,
"num_tokens": 8168354.0,
"step": 3235
},
{
"entropy": 6.704189300537109,
"epoch": 0.3739180611656088,
"grad_norm": 0.8125,
"learning_rate": 0.0004992416641053223,
"loss": 6.561,
"mean_token_accuracy": 0.1562179759144783,
"num_tokens": 8180700.0,
"step": 3240
},
{
"entropy": 6.630801677703857,
"epoch": 0.3744950952106174,
"grad_norm": 0.765625,
"learning_rate": 0.0004992382752979153,
"loss": 6.5558,
"mean_token_accuracy": 0.15030025094747543,
"num_tokens": 8193987.0,
"step": 3245
},
{
"entropy": 6.665634822845459,
"epoch": 0.3750721292556261,
"grad_norm": 0.78125,
"learning_rate": 0.0004992348789483651,
"loss": 6.6435,
"mean_token_accuracy": 0.15180691108107566,
"num_tokens": 8207150.0,
"step": 3250
},
{
"entropy": 6.734830856323242,
"epoch": 0.37564916330063475,
"grad_norm": 0.7734375,
"learning_rate": 0.0004992314750567864,
"loss": 6.5991,
"mean_token_accuracy": 0.1455582395195961,
"num_tokens": 8221050.0,
"step": 3255
},
{
"entropy": 6.682382249832154,
"epoch": 0.3762261973456434,
"grad_norm": 0.8046875,
"learning_rate": 0.0004992280636232933,
"loss": 6.5269,
"mean_token_accuracy": 0.1531355321407318,
"num_tokens": 8233641.0,
"step": 3260
},
{
"entropy": 6.685485553741455,
"epoch": 0.376803231390652,
"grad_norm": 0.828125,
"learning_rate": 0.0004992246446480007,
"loss": 6.5393,
"mean_token_accuracy": 0.1599086806178093,
"num_tokens": 8246717.0,
"step": 3265
},
{
"entropy": 6.670789384841919,
"epoch": 0.3773802654356607,
"grad_norm": 0.859375,
"learning_rate": 0.0004992212181310235,
"loss": 6.5781,
"mean_token_accuracy": 0.1480855494737625,
"num_tokens": 8258549.0,
"step": 3270
},
{
"entropy": 6.667711162567139,
"epoch": 0.37795729948066936,
"grad_norm": 1.0078125,
"learning_rate": 0.000499217784072477,
"loss": 6.5681,
"mean_token_accuracy": 0.15179934725165367,
"num_tokens": 8271580.0,
"step": 3275
},
{
"entropy": 6.632532358169556,
"epoch": 0.378534333525678,
"grad_norm": 0.93359375,
"learning_rate": 0.0004992143424724768,
"loss": 6.5012,
"mean_token_accuracy": 0.16231818795204161,
"num_tokens": 8283866.0,
"step": 3280
},
{
"entropy": 6.666814136505127,
"epoch": 0.3791113675706867,
"grad_norm": 0.89453125,
"learning_rate": 0.0004992108933311385,
"loss": 6.546,
"mean_token_accuracy": 0.1500297874212265,
"num_tokens": 8296141.0,
"step": 3285
},
{
"entropy": 6.701229381561279,
"epoch": 0.37968840161569534,
"grad_norm": 0.9140625,
"learning_rate": 0.0004992074366485782,
"loss": 6.5113,
"mean_token_accuracy": 0.15184457004070281,
"num_tokens": 8309028.0,
"step": 3290
},
{
"entropy": 6.686760330200196,
"epoch": 0.380265435660704,
"grad_norm": 0.82421875,
"learning_rate": 0.000499203972424912,
"loss": 6.498,
"mean_token_accuracy": 0.15328776091337204,
"num_tokens": 8321268.0,
"step": 3295
},
{
"entropy": 6.590341329574585,
"epoch": 0.3808424697057126,
"grad_norm": 0.828125,
"learning_rate": 0.0004992005006602567,
"loss": 6.507,
"mean_token_accuracy": 0.16145216226577758,
"num_tokens": 8333518.0,
"step": 3300
},
{
"entropy": 6.609353303909302,
"epoch": 0.3814195037507213,
"grad_norm": 0.88671875,
"learning_rate": 0.0004991970213547289,
"loss": 6.5272,
"mean_token_accuracy": 0.15743554830551149,
"num_tokens": 8345639.0,
"step": 3305
},
{
"entropy": 6.561810779571533,
"epoch": 0.38199653779572995,
"grad_norm": 0.828125,
"learning_rate": 0.0004991935345084457,
"loss": 6.4193,
"mean_token_accuracy": 0.15771780014038086,
"num_tokens": 8358136.0,
"step": 3310
},
{
"entropy": 6.7044079303741455,
"epoch": 0.3825735718407386,
"grad_norm": 0.8359375,
"learning_rate": 0.0004991900401215243,
"loss": 6.5946,
"mean_token_accuracy": 0.14319533258676528,
"num_tokens": 8370480.0,
"step": 3315
},
{
"entropy": 6.665462303161621,
"epoch": 0.3831506058857473,
"grad_norm": 0.8984375,
"learning_rate": 0.0004991865381940822,
"loss": 6.5106,
"mean_token_accuracy": 0.15779313147068025,
"num_tokens": 8382894.0,
"step": 3320
},
{
"entropy": 6.643408632278442,
"epoch": 0.3837276399307559,
"grad_norm": 0.8671875,
"learning_rate": 0.0004991830287262374,
"loss": 6.603,
"mean_token_accuracy": 0.15157458335161209,
"num_tokens": 8395864.0,
"step": 3325
},
{
"entropy": 6.72900710105896,
"epoch": 0.38430467397576457,
"grad_norm": 0.828125,
"learning_rate": 0.0004991795117181077,
"loss": 6.6255,
"mean_token_accuracy": 0.14565462321043016,
"num_tokens": 8408242.0,
"step": 3330
},
{
"entropy": 6.697143411636352,
"epoch": 0.3848817080207732,
"grad_norm": 0.83203125,
"learning_rate": 0.0004991759871698113,
"loss": 6.5052,
"mean_token_accuracy": 0.15765076875686646,
"num_tokens": 8420677.0,
"step": 3335
},
{
"entropy": 6.566110467910766,
"epoch": 0.3854587420657819,
"grad_norm": 0.875,
"learning_rate": 0.0004991724550814671,
"loss": 6.5212,
"mean_token_accuracy": 0.16033077090978623,
"num_tokens": 8434505.0,
"step": 3340
},
{
"entropy": 6.772804021835327,
"epoch": 0.38603577611079054,
"grad_norm": 0.8515625,
"learning_rate": 0.0004991689154531937,
"loss": 6.5408,
"mean_token_accuracy": 0.1514905296266079,
"num_tokens": 8447393.0,
"step": 3345
},
{
"entropy": 6.630925416946411,
"epoch": 0.3866128101557992,
"grad_norm": 0.8359375,
"learning_rate": 0.0004991653682851102,
"loss": 6.4492,
"mean_token_accuracy": 0.15575905442237853,
"num_tokens": 8459659.0,
"step": 3350
},
{
"entropy": 6.618975067138672,
"epoch": 0.3871898442008078,
"grad_norm": 0.78125,
"learning_rate": 0.000499161813577336,
"loss": 6.5953,
"mean_token_accuracy": 0.1454840660095215,
"num_tokens": 8473783.0,
"step": 3355
},
{
"entropy": 6.637290287017822,
"epoch": 0.3877668782458165,
"grad_norm": 0.84375,
"learning_rate": 0.0004991582513299903,
"loss": 6.38,
"mean_token_accuracy": 0.15462302714586257,
"num_tokens": 8486532.0,
"step": 3360
},
{
"entropy": 6.563358974456787,
"epoch": 0.38834391229082516,
"grad_norm": 1.1875,
"learning_rate": 0.0004991546815431932,
"loss": 6.5613,
"mean_token_accuracy": 0.15162240266799926,
"num_tokens": 8499133.0,
"step": 3365
},
{
"entropy": 6.700711011886597,
"epoch": 0.3889209463358338,
"grad_norm": 0.80078125,
"learning_rate": 0.000499151104217065,
"loss": 6.5991,
"mean_token_accuracy": 0.1459987446665764,
"num_tokens": 8513391.0,
"step": 3370
},
{
"entropy": 6.657787609100342,
"epoch": 0.3894979803808425,
"grad_norm": 0.79296875,
"learning_rate": 0.0004991475193517254,
"loss": 6.5366,
"mean_token_accuracy": 0.1531873255968094,
"num_tokens": 8527191.0,
"step": 3375
},
{
"entropy": 6.656068611145019,
"epoch": 0.39007501442585113,
"grad_norm": 0.76171875,
"learning_rate": 0.0004991439269472956,
"loss": 6.5855,
"mean_token_accuracy": 0.15025382339954377,
"num_tokens": 8541328.0,
"step": 3380
},
{
"entropy": 6.641211032867432,
"epoch": 0.39065204847085977,
"grad_norm": 0.92578125,
"learning_rate": 0.0004991403270038961,
"loss": 6.493,
"mean_token_accuracy": 0.14907428622245789,
"num_tokens": 8553381.0,
"step": 3385
},
{
"entropy": 6.629001951217651,
"epoch": 0.3912290825158684,
"grad_norm": 0.91015625,
"learning_rate": 0.000499136719521648,
"loss": 6.5109,
"mean_token_accuracy": 0.14996647387742995,
"num_tokens": 8565149.0,
"step": 3390
},
{
"entropy": 6.6479668617248535,
"epoch": 0.3918061165608771,
"grad_norm": 1.390625,
"learning_rate": 0.0004991331045006726,
"loss": 6.5134,
"mean_token_accuracy": 0.1577385514974594,
"num_tokens": 8576767.0,
"step": 3395
},
{
"entropy": 6.707239389419556,
"epoch": 0.39238315060588574,
"grad_norm": 0.83203125,
"learning_rate": 0.0004991294819410916,
"loss": 6.5702,
"mean_token_accuracy": 0.15049649626016617,
"num_tokens": 8589948.0,
"step": 3400
},
{
"entropy": 6.554754066467285,
"epoch": 0.3929601846508944,
"grad_norm": 0.80078125,
"learning_rate": 0.0004991258518430268,
"loss": 6.4066,
"mean_token_accuracy": 0.1551789790391922,
"num_tokens": 8602233.0,
"step": 3405
},
{
"entropy": 6.66826901435852,
"epoch": 0.3935372186959031,
"grad_norm": 1.2890625,
"learning_rate": 0.0004991222142066003,
"loss": 6.4969,
"mean_token_accuracy": 0.15271663516759873,
"num_tokens": 8614938.0,
"step": 3410
},
{
"entropy": 6.688100671768188,
"epoch": 0.3941142527409117,
"grad_norm": 0.78125,
"learning_rate": 0.0004991185690319345,
"loss": 6.5324,
"mean_token_accuracy": 0.1585379496216774,
"num_tokens": 8628203.0,
"step": 3415
},
{
"entropy": 6.593408536911011,
"epoch": 0.39469128678592036,
"grad_norm": 0.84765625,
"learning_rate": 0.000499114916319152,
"loss": 6.5038,
"mean_token_accuracy": 0.1594579190015793,
"num_tokens": 8640959.0,
"step": 3420
},
{
"entropy": 6.617645931243897,
"epoch": 0.395268320830929,
"grad_norm": 0.7265625,
"learning_rate": 0.0004991112560683755,
"loss": 6.5159,
"mean_token_accuracy": 0.15616845935583115,
"num_tokens": 8656995.0,
"step": 3425
},
{
"entropy": 6.678982210159302,
"epoch": 0.3958453548759377,
"grad_norm": 0.7578125,
"learning_rate": 0.0004991075882797283,
"loss": 6.5291,
"mean_token_accuracy": 0.15549861565232276,
"num_tokens": 8671476.0,
"step": 3430
},
{
"entropy": 6.627415466308594,
"epoch": 0.39642238892094633,
"grad_norm": 0.87890625,
"learning_rate": 0.0004991039129533337,
"loss": 6.5481,
"mean_token_accuracy": 0.1529051437973976,
"num_tokens": 8683667.0,
"step": 3435
},
{
"entropy": 6.644215297698975,
"epoch": 0.396999422965955,
"grad_norm": 0.8125,
"learning_rate": 0.0004991002300893152,
"loss": 6.5546,
"mean_token_accuracy": 0.1545812577009201,
"num_tokens": 8696564.0,
"step": 3440
},
{
"entropy": 6.669400453567505,
"epoch": 0.39757645701096367,
"grad_norm": 0.83203125,
"learning_rate": 0.0004990965396877969,
"loss": 6.4865,
"mean_token_accuracy": 0.15339938551187515,
"num_tokens": 8708512.0,
"step": 3445
},
{
"entropy": 6.609234380722046,
"epoch": 0.3981534910559723,
"grad_norm": 0.8359375,
"learning_rate": 0.0004990928417489027,
"loss": 6.3673,
"mean_token_accuracy": 0.16587528437376023,
"num_tokens": 8721015.0,
"step": 3450
},
{
"entropy": 6.567390012741089,
"epoch": 0.39873052510098095,
"grad_norm": 0.83984375,
"learning_rate": 0.0004990891362727572,
"loss": 6.4854,
"mean_token_accuracy": 0.15047257542610168,
"num_tokens": 8732538.0,
"step": 3455
},
{
"entropy": 6.679238510131836,
"epoch": 0.3993075591459896,
"grad_norm": 0.78515625,
"learning_rate": 0.0004990854232594848,
"loss": 6.5582,
"mean_token_accuracy": 0.15114261358976364,
"num_tokens": 8745093.0,
"step": 3460
},
{
"entropy": 6.634946250915528,
"epoch": 0.3998845931909983,
"grad_norm": 0.78515625,
"learning_rate": 0.0004990817027092106,
"loss": 6.4983,
"mean_token_accuracy": 0.15687089264392853,
"num_tokens": 8757441.0,
"step": 3465
},
{
"entropy": 6.660363864898682,
"epoch": 0.4004616272360069,
"grad_norm": 0.859375,
"learning_rate": 0.0004990779746220595,
"loss": 6.5185,
"mean_token_accuracy": 0.15596205741167068,
"num_tokens": 8770307.0,
"step": 3470
},
{
"entropy": 6.5660014152526855,
"epoch": 0.40103866128101556,
"grad_norm": 0.765625,
"learning_rate": 0.0004990742389981572,
"loss": 6.5366,
"mean_token_accuracy": 0.1550653576850891,
"num_tokens": 8782575.0,
"step": 3475
},
{
"entropy": 6.664673566818237,
"epoch": 0.40161569532602426,
"grad_norm": 0.8046875,
"learning_rate": 0.000499070495837629,
"loss": 6.5848,
"mean_token_accuracy": 0.14479815810918809,
"num_tokens": 8794962.0,
"step": 3480
},
{
"entropy": 6.661259126663208,
"epoch": 0.4021927293710329,
"grad_norm": 0.80859375,
"learning_rate": 0.0004990667451406012,
"loss": 6.5674,
"mean_token_accuracy": 0.1521621063351631,
"num_tokens": 8807434.0,
"step": 3485
},
{
"entropy": 6.673516368865966,
"epoch": 0.40276976341604154,
"grad_norm": 0.91015625,
"learning_rate": 0.0004990629869071995,
"loss": 6.5391,
"mean_token_accuracy": 0.14591969475150107,
"num_tokens": 8820748.0,
"step": 3490
},
{
"entropy": 6.604957246780396,
"epoch": 0.4033467974610502,
"grad_norm": 0.83203125,
"learning_rate": 0.0004990592211375506,
"loss": 6.465,
"mean_token_accuracy": 0.15596169531345366,
"num_tokens": 8833428.0,
"step": 3495
},
{
"entropy": 6.66051025390625,
"epoch": 0.4039238315060589,
"grad_norm": 0.828125,
"learning_rate": 0.0004990554478317811,
"loss": 6.5121,
"mean_token_accuracy": 0.14970427826046945,
"num_tokens": 8845892.0,
"step": 3500
},
{
"entropy": 6.575010538101196,
"epoch": 0.4045008655510675,
"grad_norm": 0.85546875,
"learning_rate": 0.0004990516669900179,
"loss": 6.4569,
"mean_token_accuracy": 0.155875825881958,
"num_tokens": 8857508.0,
"step": 3505
},
{
"entropy": 6.607421207427978,
"epoch": 0.40507789959607615,
"grad_norm": 0.859375,
"learning_rate": 0.0004990478786123882,
"loss": 6.492,
"mean_token_accuracy": 0.1571622833609581,
"num_tokens": 8868730.0,
"step": 3510
},
{
"entropy": 6.664318418502807,
"epoch": 0.40565493364108485,
"grad_norm": 0.75390625,
"learning_rate": 0.0004990440826990193,
"loss": 6.4882,
"mean_token_accuracy": 0.14911171048879623,
"num_tokens": 8882687.0,
"step": 3515
},
{
"entropy": 6.578036642074585,
"epoch": 0.4062319676860935,
"grad_norm": 0.83984375,
"learning_rate": 0.0004990402792500392,
"loss": 6.5032,
"mean_token_accuracy": 0.15692729353904725,
"num_tokens": 8894723.0,
"step": 3520
},
{
"entropy": 6.5801005363464355,
"epoch": 0.4068090017311021,
"grad_norm": 0.87109375,
"learning_rate": 0.0004990364682655754,
"loss": 6.4722,
"mean_token_accuracy": 0.15482148230075837,
"num_tokens": 8906373.0,
"step": 3525
},
{
"entropy": 6.604721021652222,
"epoch": 0.40738603577611077,
"grad_norm": 0.80078125,
"learning_rate": 0.0004990326497457564,
"loss": 6.4737,
"mean_token_accuracy": 0.15373015254735947,
"num_tokens": 8918681.0,
"step": 3530
},
{
"entropy": 6.652784156799316,
"epoch": 0.40796306982111946,
"grad_norm": 0.7890625,
"learning_rate": 0.0004990288236907104,
"loss": 6.5282,
"mean_token_accuracy": 0.1494688406586647,
"num_tokens": 8930232.0,
"step": 3535
},
{
"entropy": 6.576983118057251,
"epoch": 0.4085401038661281,
"grad_norm": 0.84375,
"learning_rate": 0.0004990249901005661,
"loss": 6.4193,
"mean_token_accuracy": 0.15579718947410584,
"num_tokens": 8942264.0,
"step": 3540
},
{
"entropy": 6.643110370635986,
"epoch": 0.40911713791113674,
"grad_norm": 0.828125,
"learning_rate": 0.0004990211489754527,
"loss": 6.5992,
"mean_token_accuracy": 0.1467343896627426,
"num_tokens": 8955679.0,
"step": 3545
},
{
"entropy": 6.642524147033692,
"epoch": 0.40969417195614544,
"grad_norm": 0.8125,
"learning_rate": 0.0004990173003154993,
"loss": 6.4317,
"mean_token_accuracy": 0.1543587066233158,
"num_tokens": 8968421.0,
"step": 3550
},
{
"entropy": 6.565263557434082,
"epoch": 0.4102712060011541,
"grad_norm": 0.7890625,
"learning_rate": 0.0004990134441208351,
"loss": 6.5003,
"mean_token_accuracy": 0.15063199996948243,
"num_tokens": 8981063.0,
"step": 3555
},
{
"entropy": 6.604219722747803,
"epoch": 0.4108482400461627,
"grad_norm": 0.86328125,
"learning_rate": 0.0004990095803915901,
"loss": 6.4315,
"mean_token_accuracy": 0.16306943893432618,
"num_tokens": 8993740.0,
"step": 3560
},
{
"entropy": 6.59393835067749,
"epoch": 0.41142527409117136,
"grad_norm": 0.83203125,
"learning_rate": 0.0004990057091278942,
"loss": 6.4888,
"mean_token_accuracy": 0.14942816495895386,
"num_tokens": 9007135.0,
"step": 3565
},
{
"entropy": 6.600633573532105,
"epoch": 0.41200230813618005,
"grad_norm": 0.84375,
"learning_rate": 0.0004990018303298773,
"loss": 6.5045,
"mean_token_accuracy": 0.15680433362722396,
"num_tokens": 9021596.0,
"step": 3570
},
{
"entropy": 6.61022539138794,
"epoch": 0.4125793421811887,
"grad_norm": 0.8125,
"learning_rate": 0.0004989979439976703,
"loss": 6.44,
"mean_token_accuracy": 0.16000102311372758,
"num_tokens": 9033523.0,
"step": 3575
},
{
"entropy": 6.593396806716919,
"epoch": 0.41315637622619733,
"grad_norm": 0.88671875,
"learning_rate": 0.0004989940501314037,
"loss": 6.4126,
"mean_token_accuracy": 0.15999998301267623,
"num_tokens": 9045690.0,
"step": 3580
},
{
"entropy": 6.580743408203125,
"epoch": 0.413733410271206,
"grad_norm": 0.8671875,
"learning_rate": 0.0004989901487312084,
"loss": 6.4811,
"mean_token_accuracy": 0.1552786871790886,
"num_tokens": 9057672.0,
"step": 3585
},
{
"entropy": 6.589711141586304,
"epoch": 0.41431044431621467,
"grad_norm": 0.80859375,
"learning_rate": 0.0004989862397972157,
"loss": 6.537,
"mean_token_accuracy": 0.15031036734580994,
"num_tokens": 9070004.0,
"step": 3590
},
{
"entropy": 6.658974361419678,
"epoch": 0.4148874783612233,
"grad_norm": 0.8984375,
"learning_rate": 0.0004989823233295572,
"loss": 6.4971,
"mean_token_accuracy": 0.15876225233078003,
"num_tokens": 9082453.0,
"step": 3595
},
{
"entropy": 6.593294286727906,
"epoch": 0.41546451240623195,
"grad_norm": 0.84375,
"learning_rate": 0.0004989783993283644,
"loss": 6.5122,
"mean_token_accuracy": 0.1508851870894432,
"num_tokens": 9095839.0,
"step": 3600
},
{
"entropy": 6.563176059722901,
"epoch": 0.41604154645124064,
"grad_norm": 0.85546875,
"learning_rate": 0.0004989744677937694,
"loss": 6.4782,
"mean_token_accuracy": 0.1590025931596756,
"num_tokens": 9109476.0,
"step": 3605
},
{
"entropy": 6.619072437286377,
"epoch": 0.4166185804962493,
"grad_norm": 0.77734375,
"learning_rate": 0.0004989705287259046,
"loss": 6.4072,
"mean_token_accuracy": 0.1609771430492401,
"num_tokens": 9122354.0,
"step": 3610
},
{
"entropy": 6.532887077331543,
"epoch": 0.4171956145412579,
"grad_norm": 0.8515625,
"learning_rate": 0.0004989665821249021,
"loss": 6.4261,
"mean_token_accuracy": 0.16253601163625717,
"num_tokens": 9135502.0,
"step": 3615
},
{
"entropy": 6.664855527877807,
"epoch": 0.4177726485862666,
"grad_norm": 0.78515625,
"learning_rate": 0.000498962627990895,
"loss": 6.5659,
"mean_token_accuracy": 0.15357777327299119,
"num_tokens": 9147654.0,
"step": 3620
},
{
"entropy": 6.56908655166626,
"epoch": 0.41834968263127525,
"grad_norm": 0.81640625,
"learning_rate": 0.0004989586663240161,
"loss": 6.4847,
"mean_token_accuracy": 0.1522589549422264,
"num_tokens": 9161907.0,
"step": 3625
},
{
"entropy": 6.620093536376953,
"epoch": 0.4189267166762839,
"grad_norm": 0.859375,
"learning_rate": 0.0004989546971243988,
"loss": 6.513,
"mean_token_accuracy": 0.14616103172302247,
"num_tokens": 9175395.0,
"step": 3630
},
{
"entropy": 6.614277410507202,
"epoch": 0.41950375072129253,
"grad_norm": 0.83203125,
"learning_rate": 0.0004989507203921763,
"loss": 6.4278,
"mean_token_accuracy": 0.1567081741988659,
"num_tokens": 9187688.0,
"step": 3635
},
{
"entropy": 6.550759267807007,
"epoch": 0.42008078476630123,
"grad_norm": 0.8203125,
"learning_rate": 0.0004989467361274828,
"loss": 6.4669,
"mean_token_accuracy": 0.15715653598308563,
"num_tokens": 9199773.0,
"step": 3640
},
{
"entropy": 6.521318578720093,
"epoch": 0.42065781881130987,
"grad_norm": 0.6953125,
"learning_rate": 0.0004989427443304519,
"loss": 6.4367,
"mean_token_accuracy": 0.1557897448539734,
"num_tokens": 9213997.0,
"step": 3645
},
{
"entropy": 6.621791362762451,
"epoch": 0.4212348528563185,
"grad_norm": 1.0390625,
"learning_rate": 0.000498938745001218,
"loss": 6.4908,
"mean_token_accuracy": 0.15198236405849458,
"num_tokens": 9227187.0,
"step": 3650
},
{
"entropy": 6.67909688949585,
"epoch": 0.4218118869013272,
"grad_norm": 0.80859375,
"learning_rate": 0.0004989347381399158,
"loss": 6.5423,
"mean_token_accuracy": 0.1490216538310051,
"num_tokens": 9240860.0,
"step": 3655
},
{
"entropy": 6.584900903701782,
"epoch": 0.42238892094633584,
"grad_norm": 0.7578125,
"learning_rate": 0.0004989307237466799,
"loss": 6.436,
"mean_token_accuracy": 0.15650416314601898,
"num_tokens": 9253771.0,
"step": 3660
},
{
"entropy": 6.587461662292481,
"epoch": 0.4229659549913445,
"grad_norm": 0.76171875,
"learning_rate": 0.0004989267018216453,
"loss": 6.4773,
"mean_token_accuracy": 0.15263158679008484,
"num_tokens": 9268380.0,
"step": 3665
},
{
"entropy": 6.588645076751709,
"epoch": 0.4235429890363531,
"grad_norm": 0.8515625,
"learning_rate": 0.0004989226723649473,
"loss": 6.4562,
"mean_token_accuracy": 0.1565222844481468,
"num_tokens": 9279911.0,
"step": 3670
},
{
"entropy": 6.556595277786255,
"epoch": 0.4241200230813618,
"grad_norm": 0.90234375,
"learning_rate": 0.0004989186353767214,
"loss": 6.446,
"mean_token_accuracy": 0.16146985441446304,
"num_tokens": 9292105.0,
"step": 3675
},
{
"entropy": 6.591396760940552,
"epoch": 0.42469705712637046,
"grad_norm": 0.7890625,
"learning_rate": 0.0004989145908571035,
"loss": 6.5677,
"mean_token_accuracy": 0.15078672766685486,
"num_tokens": 9305503.0,
"step": 3680
},
{
"entropy": 6.630074405670166,
"epoch": 0.4252740911713791,
"grad_norm": 0.80859375,
"learning_rate": 0.0004989105388062295,
"loss": 6.4605,
"mean_token_accuracy": 0.1556406855583191,
"num_tokens": 9317978.0,
"step": 3685
},
{
"entropy": 6.619613599777222,
"epoch": 0.4258511252163878,
"grad_norm": 0.76171875,
"learning_rate": 0.0004989064792242358,
"loss": 6.5252,
"mean_token_accuracy": 0.15357265770435333,
"num_tokens": 9332676.0,
"step": 3690
},
{
"entropy": 6.579876184463501,
"epoch": 0.42642815926139643,
"grad_norm": 0.8671875,
"learning_rate": 0.0004989024121112589,
"loss": 6.426,
"mean_token_accuracy": 0.1560150146484375,
"num_tokens": 9345594.0,
"step": 3695
},
{
"entropy": 6.6138917922973635,
"epoch": 0.4270051933064051,
"grad_norm": 0.9296875,
"learning_rate": 0.0004988983374674356,
"loss": 6.5109,
"mean_token_accuracy": 0.1485238753259182,
"num_tokens": 9358303.0,
"step": 3700
},
{
"entropy": 6.520889186859131,
"epoch": 0.4275822273514137,
"grad_norm": 0.7890625,
"learning_rate": 0.0004988942552929029,
"loss": 6.3956,
"mean_token_accuracy": 0.16093592643737792,
"num_tokens": 9370953.0,
"step": 3705
},
{
"entropy": 6.522710132598877,
"epoch": 0.4281592613964224,
"grad_norm": 0.8828125,
"learning_rate": 0.0004988901655877981,
"loss": 6.4721,
"mean_token_accuracy": 0.15702161937952042,
"num_tokens": 9384563.0,
"step": 3710
},
{
"entropy": 6.60606837272644,
"epoch": 0.42873629544143105,
"grad_norm": 0.87109375,
"learning_rate": 0.0004988860683522589,
"loss": 6.4222,
"mean_token_accuracy": 0.16118086278438568,
"num_tokens": 9396401.0,
"step": 3715
},
{
"entropy": 6.555063343048095,
"epoch": 0.4293133294864397,
"grad_norm": 0.87890625,
"learning_rate": 0.000498881963586423,
"loss": 6.4308,
"mean_token_accuracy": 0.15848347842693328,
"num_tokens": 9408520.0,
"step": 3720
},
{
"entropy": 6.4073954105377195,
"epoch": 0.4298903635314484,
"grad_norm": 0.765625,
"learning_rate": 0.0004988778512904282,
"loss": 6.3381,
"mean_token_accuracy": 0.16240834444761276,
"num_tokens": 9421431.0,
"step": 3725
},
{
"entropy": 6.549575996398926,
"epoch": 0.430467397576457,
"grad_norm": 0.85546875,
"learning_rate": 0.0004988737314644134,
"loss": 6.4617,
"mean_token_accuracy": 0.15462952852249146,
"num_tokens": 9432566.0,
"step": 3730
},
{
"entropy": 6.6500896453857425,
"epoch": 0.43104443162146566,
"grad_norm": 0.84375,
"learning_rate": 0.0004988696041085168,
"loss": 6.5593,
"mean_token_accuracy": 0.15154415518045425,
"num_tokens": 9444885.0,
"step": 3735
},
{
"entropy": 6.667054796218872,
"epoch": 0.4316214656664743,
"grad_norm": 1.09375,
"learning_rate": 0.0004988654692228772,
"loss": 6.5498,
"mean_token_accuracy": 0.15102049708366394,
"num_tokens": 9457823.0,
"step": 3740
},
{
"entropy": 6.563848447799683,
"epoch": 0.432198499711483,
"grad_norm": 0.8125,
"learning_rate": 0.0004988613268076335,
"loss": 6.3991,
"mean_token_accuracy": 0.16212892681360244,
"num_tokens": 9470799.0,
"step": 3745
},
{
"entropy": 6.535583543777466,
"epoch": 0.43277553375649164,
"grad_norm": 0.88671875,
"learning_rate": 0.0004988571768629257,
"loss": 6.4583,
"mean_token_accuracy": 0.16189608722925186,
"num_tokens": 9484175.0,
"step": 3750
},
{
"entropy": 6.63653335571289,
"epoch": 0.4333525678015003,
"grad_norm": 0.890625,
"learning_rate": 0.0004988530193888927,
"loss": 6.5043,
"mean_token_accuracy": 0.15041833072900773,
"num_tokens": 9497809.0,
"step": 3755
},
{
"entropy": 6.56855206489563,
"epoch": 0.4339296018465089,
"grad_norm": 0.84765625,
"learning_rate": 0.0004988488543856747,
"loss": 6.4451,
"mean_token_accuracy": 0.15440599322319032,
"num_tokens": 9509755.0,
"step": 3760
},
{
"entropy": 6.524028348922729,
"epoch": 0.4345066358915176,
"grad_norm": 0.75,
"learning_rate": 0.0004988446818534115,
"loss": 6.4522,
"mean_token_accuracy": 0.15307800620794296,
"num_tokens": 9523801.0,
"step": 3765
},
{
"entropy": 6.563017177581787,
"epoch": 0.43508366993652625,
"grad_norm": 0.88671875,
"learning_rate": 0.0004988405017922438,
"loss": 6.4373,
"mean_token_accuracy": 0.16271546185016633,
"num_tokens": 9535846.0,
"step": 3770
},
{
"entropy": 6.650265073776245,
"epoch": 0.4356607039815349,
"grad_norm": 0.82421875,
"learning_rate": 0.000498836314202312,
"loss": 6.5108,
"mean_token_accuracy": 0.15331310480833055,
"num_tokens": 9548194.0,
"step": 3775
},
{
"entropy": 6.523101472854615,
"epoch": 0.4362377380265436,
"grad_norm": 0.78515625,
"learning_rate": 0.0004988321190837568,
"loss": 6.4047,
"mean_token_accuracy": 0.15477531999349595,
"num_tokens": 9561069.0,
"step": 3780
},
{
"entropy": 6.466052484512329,
"epoch": 0.4368147720715522,
"grad_norm": 0.828125,
"learning_rate": 0.0004988279164367196,
"loss": 6.3793,
"mean_token_accuracy": 0.15896909236907958,
"num_tokens": 9573778.0,
"step": 3785
},
{
"entropy": 6.535996627807617,
"epoch": 0.43739180611656087,
"grad_norm": 0.90625,
"learning_rate": 0.0004988237062613415,
"loss": 6.3608,
"mean_token_accuracy": 0.1710158884525299,
"num_tokens": 9586616.0,
"step": 3790
},
{
"entropy": 6.576893711090088,
"epoch": 0.4379688401615695,
"grad_norm": 0.91796875,
"learning_rate": 0.0004988194885577644,
"loss": 6.4697,
"mean_token_accuracy": 0.1554633378982544,
"num_tokens": 9597943.0,
"step": 3795
},
{
"entropy": 6.500680875778198,
"epoch": 0.4385458742065782,
"grad_norm": 0.8203125,
"learning_rate": 0.0004988152633261299,
"loss": 6.4066,
"mean_token_accuracy": 0.16017991304397583,
"num_tokens": 9609861.0,
"step": 3800
},
{
"entropy": 6.532161569595337,
"epoch": 0.43912290825158684,
"grad_norm": 0.81640625,
"learning_rate": 0.00049881103056658,
"loss": 6.4607,
"mean_token_accuracy": 0.16110374480485917,
"num_tokens": 9623307.0,
"step": 3805
},
{
"entropy": 6.590618324279785,
"epoch": 0.4396999422965955,
"grad_norm": 0.86328125,
"learning_rate": 0.0004988067902792575,
"loss": 6.4706,
"mean_token_accuracy": 0.15618328303098677,
"num_tokens": 9635827.0,
"step": 3810
},
{
"entropy": 6.584213638305664,
"epoch": 0.4402769763416042,
"grad_norm": 0.8359375,
"learning_rate": 0.0004988025424643047,
"loss": 6.5281,
"mean_token_accuracy": 0.15362918823957444,
"num_tokens": 9649422.0,
"step": 3815
},
{
"entropy": 6.539908409118652,
"epoch": 0.4408540103866128,
"grad_norm": 0.87109375,
"learning_rate": 0.0004987982871218645,
"loss": 6.4985,
"mean_token_accuracy": 0.16369809061288834,
"num_tokens": 9661542.0,
"step": 3820
},
{
"entropy": 6.592797899246216,
"epoch": 0.44143104443162146,
"grad_norm": 0.78515625,
"learning_rate": 0.0004987940242520802,
"loss": 6.4823,
"mean_token_accuracy": 0.15268328189849853,
"num_tokens": 9674684.0,
"step": 3825
},
{
"entropy": 6.680898857116699,
"epoch": 0.4420080784766301,
"grad_norm": 0.7890625,
"learning_rate": 0.000498789753855095,
"loss": 6.5,
"mean_token_accuracy": 0.1492106169462204,
"num_tokens": 9687522.0,
"step": 3830
},
{
"entropy": 6.574478960037231,
"epoch": 0.4425851125216388,
"grad_norm": 0.8203125,
"learning_rate": 0.0004987854759310526,
"loss": 6.4528,
"mean_token_accuracy": 0.15816389620304108,
"num_tokens": 9699518.0,
"step": 3835
},
{
"entropy": 6.567315101623535,
"epoch": 0.44316214656664743,
"grad_norm": 0.78515625,
"learning_rate": 0.0004987811904800968,
"loss": 6.5127,
"mean_token_accuracy": 0.15438069850206376,
"num_tokens": 9711918.0,
"step": 3840
},
{
"entropy": 6.596231937408447,
"epoch": 0.44373918061165607,
"grad_norm": 0.75390625,
"learning_rate": 0.0004987768975023719,
"loss": 6.3862,
"mean_token_accuracy": 0.15680329352617264,
"num_tokens": 9725643.0,
"step": 3845
},
{
"entropy": 6.530617141723633,
"epoch": 0.44431621465666477,
"grad_norm": 0.85546875,
"learning_rate": 0.0004987725969980222,
"loss": 6.403,
"mean_token_accuracy": 0.1597583845257759,
"num_tokens": 9738871.0,
"step": 3850
},
{
"entropy": 6.540352916717529,
"epoch": 0.4448932487016734,
"grad_norm": 0.8203125,
"learning_rate": 0.0004987682889671923,
"loss": 6.3894,
"mean_token_accuracy": 0.1617853969335556,
"num_tokens": 9751166.0,
"step": 3855
},
{
"entropy": 6.512079095840454,
"epoch": 0.44547028274668204,
"grad_norm": 0.83203125,
"learning_rate": 0.0004987639734100272,
"loss": 6.3536,
"mean_token_accuracy": 0.16155828088521956,
"num_tokens": 9765165.0,
"step": 3860
},
{
"entropy": 6.56067123413086,
"epoch": 0.4460473167916907,
"grad_norm": 0.84375,
"learning_rate": 0.0004987596503266721,
"loss": 6.4014,
"mean_token_accuracy": 0.1621742233633995,
"num_tokens": 9776625.0,
"step": 3865
},
{
"entropy": 6.538637399673462,
"epoch": 0.4466243508366994,
"grad_norm": 0.84765625,
"learning_rate": 0.0004987553197172722,
"loss": 6.4152,
"mean_token_accuracy": 0.16095769703388213,
"num_tokens": 9789689.0,
"step": 3870
},
{
"entropy": 6.617307853698731,
"epoch": 0.447201384881708,
"grad_norm": 0.9140625,
"learning_rate": 0.0004987509815819732,
"loss": 6.5181,
"mean_token_accuracy": 0.15431652069091797,
"num_tokens": 9801124.0,
"step": 3875
},
{
"entropy": 6.545049571990967,
"epoch": 0.44777841892671666,
"grad_norm": 0.8203125,
"learning_rate": 0.0004987466359209213,
"loss": 6.4654,
"mean_token_accuracy": 0.1531405434012413,
"num_tokens": 9814264.0,
"step": 3880
},
{
"entropy": 6.532504224777222,
"epoch": 0.44835545297172535,
"grad_norm": 0.828125,
"learning_rate": 0.0004987422827342622,
"loss": 6.3939,
"mean_token_accuracy": 0.16244966238737107,
"num_tokens": 9826149.0,
"step": 3885
},
{
"entropy": 6.605834484100342,
"epoch": 0.448932487016734,
"grad_norm": 0.875,
"learning_rate": 0.0004987379220221426,
"loss": 6.4765,
"mean_token_accuracy": 0.15153736919164656,
"num_tokens": 9838485.0,
"step": 3890
},
{
"entropy": 6.5250184535980225,
"epoch": 0.44950952106174263,
"grad_norm": 0.8359375,
"learning_rate": 0.0004987335537847092,
"loss": 6.4029,
"mean_token_accuracy": 0.1562870755791664,
"num_tokens": 9851371.0,
"step": 3895
},
{
"entropy": 6.563957357406617,
"epoch": 0.4500865551067513,
"grad_norm": 0.78515625,
"learning_rate": 0.0004987291780221088,
"loss": 6.4599,
"mean_token_accuracy": 0.15669308006763458,
"num_tokens": 9864371.0,
"step": 3900
},
{
"entropy": 6.585865068435669,
"epoch": 0.45066358915175997,
"grad_norm": 0.796875,
"learning_rate": 0.0004987247947344887,
"loss": 6.4487,
"mean_token_accuracy": 0.15703559517860413,
"num_tokens": 9876086.0,
"step": 3905
},
{
"entropy": 6.544737100601196,
"epoch": 0.4512406231967686,
"grad_norm": 0.8515625,
"learning_rate": 0.0004987204039219962,
"loss": 6.4455,
"mean_token_accuracy": 0.15367899984121322,
"num_tokens": 9888850.0,
"step": 3910
},
{
"entropy": 6.561423492431641,
"epoch": 0.45181765724177725,
"grad_norm": 0.8125,
"learning_rate": 0.0004987160055847791,
"loss": 6.4777,
"mean_token_accuracy": 0.15599952191114425,
"num_tokens": 9901467.0,
"step": 3915
},
{
"entropy": 6.574502992630005,
"epoch": 0.45239469128678594,
"grad_norm": 0.76953125,
"learning_rate": 0.0004987115997229852,
"loss": 6.4479,
"mean_token_accuracy": 0.15445881485939025,
"num_tokens": 9914431.0,
"step": 3920
},
{
"entropy": 6.613849687576294,
"epoch": 0.4529717253317946,
"grad_norm": 0.7890625,
"learning_rate": 0.0004987071863367629,
"loss": 6.4776,
"mean_token_accuracy": 0.15640159994363784,
"num_tokens": 9926863.0,
"step": 3925
},
{
"entropy": 6.555788230895996,
"epoch": 0.4535487593768032,
"grad_norm": 0.84375,
"learning_rate": 0.0004987027654262604,
"loss": 6.4231,
"mean_token_accuracy": 0.1610432580113411,
"num_tokens": 9939064.0,
"step": 3930
},
{
"entropy": 6.492784738540649,
"epoch": 0.45412579342181186,
"grad_norm": 0.83984375,
"learning_rate": 0.0004986983369916264,
"loss": 6.4221,
"mean_token_accuracy": 0.15522423386573792,
"num_tokens": 9950897.0,
"step": 3935
},
{
"entropy": 6.640955543518066,
"epoch": 0.45470282746682056,
"grad_norm": 0.77734375,
"learning_rate": 0.0004986939010330102,
"loss": 6.4711,
"mean_token_accuracy": 0.15500133484601974,
"num_tokens": 9964388.0,
"step": 3940
},
{
"entropy": 6.412693643569947,
"epoch": 0.4552798615118292,
"grad_norm": 0.8203125,
"learning_rate": 0.0004986894575505606,
"loss": 6.2872,
"mean_token_accuracy": 0.1698276601731777,
"num_tokens": 9977363.0,
"step": 3945
},
{
"entropy": 6.545732498168945,
"epoch": 0.45585689555683784,
"grad_norm": 0.83984375,
"learning_rate": 0.0004986850065444272,
"loss": 6.3485,
"mean_token_accuracy": 0.16417437195777893,
"num_tokens": 9989691.0,
"step": 3950
},
{
"entropy": 6.592774343490601,
"epoch": 0.45643392960184653,
"grad_norm": 0.77734375,
"learning_rate": 0.0004986805480147598,
"loss": 6.4064,
"mean_token_accuracy": 0.15252988934516906,
"num_tokens": 10002177.0,
"step": 3955
},
{
"entropy": 6.508685827255249,
"epoch": 0.4570109636468552,
"grad_norm": 0.828125,
"learning_rate": 0.0004986760819617082,
"loss": 6.4662,
"mean_token_accuracy": 0.15122403651475907,
"num_tokens": 10014844.0,
"step": 3960
},
{
"entropy": 6.652512836456299,
"epoch": 0.4575879976918638,
"grad_norm": 0.77734375,
"learning_rate": 0.0004986716083854228,
"loss": 6.4914,
"mean_token_accuracy": 0.1520856276154518,
"num_tokens": 10028351.0,
"step": 3965
},
{
"entropy": 6.521466636657715,
"epoch": 0.45816503173687245,
"grad_norm": 0.84375,
"learning_rate": 0.0004986671272860538,
"loss": 6.3913,
"mean_token_accuracy": 0.15310998558998107,
"num_tokens": 10041318.0,
"step": 3970
},
{
"entropy": 6.557436227798462,
"epoch": 0.45874206578188115,
"grad_norm": 0.8359375,
"learning_rate": 0.0004986626386637521,
"loss": 6.4107,
"mean_token_accuracy": 0.1517535850405693,
"num_tokens": 10054985.0,
"step": 3975
},
{
"entropy": 6.552952146530151,
"epoch": 0.4593190998268898,
"grad_norm": 0.78515625,
"learning_rate": 0.0004986581425186688,
"loss": 6.4803,
"mean_token_accuracy": 0.1568808764219284,
"num_tokens": 10067528.0,
"step": 3980
},
{
"entropy": 6.526756238937378,
"epoch": 0.4598961338718984,
"grad_norm": 0.75390625,
"learning_rate": 0.0004986536388509548,
"loss": 6.3925,
"mean_token_accuracy": 0.15640367493033408,
"num_tokens": 10080210.0,
"step": 3985
},
{
"entropy": 6.520599222183227,
"epoch": 0.4604731679169071,
"grad_norm": 0.78125,
"learning_rate": 0.0004986491276607618,
"loss": 6.4428,
"mean_token_accuracy": 0.15482764691114426,
"num_tokens": 10092040.0,
"step": 3990
},
{
"entropy": 6.584397268295288,
"epoch": 0.46105020196191576,
"grad_norm": 0.89453125,
"learning_rate": 0.0004986446089482416,
"loss": 6.399,
"mean_token_accuracy": 0.1545254573225975,
"num_tokens": 10104923.0,
"step": 3995
},
{
"entropy": 6.528775930404663,
"epoch": 0.4616272360069244,
"grad_norm": 0.84765625,
"learning_rate": 0.0004986400827135459,
"loss": 6.3908,
"mean_token_accuracy": 0.15947159230709076,
"num_tokens": 10118963.0,
"step": 4000
},
{
"entropy": 6.557057237625122,
"epoch": 0.46220427005193304,
"grad_norm": 0.8046875,
"learning_rate": 0.0004986355489568272,
"loss": 6.3496,
"mean_token_accuracy": 0.16494845151901244,
"num_tokens": 10131457.0,
"step": 4005
},
{
"entropy": 6.524343824386596,
"epoch": 0.46278130409694174,
"grad_norm": 0.859375,
"learning_rate": 0.0004986310076782379,
"loss": 6.4309,
"mean_token_accuracy": 0.15816483348608018,
"num_tokens": 10143796.0,
"step": 4010
},
{
"entropy": 6.474204587936401,
"epoch": 0.4633583381419504,
"grad_norm": 0.8359375,
"learning_rate": 0.0004986264588779307,
"loss": 6.4078,
"mean_token_accuracy": 0.161160147190094,
"num_tokens": 10156723.0,
"step": 4015
},
{
"entropy": 6.524495840072632,
"epoch": 0.463935372186959,
"grad_norm": 0.8046875,
"learning_rate": 0.0004986219025560586,
"loss": 6.4278,
"mean_token_accuracy": 0.15114813968539237,
"num_tokens": 10168701.0,
"step": 4020
},
{
"entropy": 6.57913761138916,
"epoch": 0.4645124062319677,
"grad_norm": 0.79296875,
"learning_rate": 0.000498617338712775,
"loss": 6.3816,
"mean_token_accuracy": 0.16238873600959777,
"num_tokens": 10182308.0,
"step": 4025
},
{
"entropy": 6.52322735786438,
"epoch": 0.46508944027697635,
"grad_norm": 0.83203125,
"learning_rate": 0.0004986127673482332,
"loss": 6.371,
"mean_token_accuracy": 0.16324072778224946,
"num_tokens": 10194237.0,
"step": 4030
},
{
"entropy": 6.512039661407471,
"epoch": 0.465666474321985,
"grad_norm": 0.7890625,
"learning_rate": 0.0004986081884625871,
"loss": 6.4611,
"mean_token_accuracy": 0.15732699781656265,
"num_tokens": 10208570.0,
"step": 4035
},
{
"entropy": 6.647953844070434,
"epoch": 0.46624350836699363,
"grad_norm": 0.81640625,
"learning_rate": 0.0004986036020559906,
"loss": 6.4109,
"mean_token_accuracy": 0.15890434235334397,
"num_tokens": 10221079.0,
"step": 4040
},
{
"entropy": 6.42305359840393,
"epoch": 0.4668205424120023,
"grad_norm": 0.88671875,
"learning_rate": 0.000498599008128598,
"loss": 6.3319,
"mean_token_accuracy": 0.1590804174542427,
"num_tokens": 10233473.0,
"step": 4045
},
{
"entropy": 6.588786363601685,
"epoch": 0.46739757645701097,
"grad_norm": 0.75,
"learning_rate": 0.0004985944066805639,
"loss": 6.4683,
"mean_token_accuracy": 0.1552932158112526,
"num_tokens": 10247840.0,
"step": 4050
},
{
"entropy": 6.566417503356933,
"epoch": 0.4679746105020196,
"grad_norm": 0.80859375,
"learning_rate": 0.000498589797712043,
"loss": 6.3949,
"mean_token_accuracy": 0.16800516694784165,
"num_tokens": 10261471.0,
"step": 4055
},
{
"entropy": 6.484035158157349,
"epoch": 0.4685516445470283,
"grad_norm": 0.84375,
"learning_rate": 0.0004985851812231903,
"loss": 6.3991,
"mean_token_accuracy": 0.1583906292915344,
"num_tokens": 10274386.0,
"step": 4060
},
{
"entropy": 6.553869724273682,
"epoch": 0.46912867859203694,
"grad_norm": 0.80078125,
"learning_rate": 0.0004985805572141611,
"loss": 6.4131,
"mean_token_accuracy": 0.15777539014816283,
"num_tokens": 10286405.0,
"step": 4065
},
{
"entropy": 6.558121299743652,
"epoch": 0.4697057126370456,
"grad_norm": 0.79296875,
"learning_rate": 0.0004985759256851108,
"loss": 6.4603,
"mean_token_accuracy": 0.15484957844018937,
"num_tokens": 10300084.0,
"step": 4070
},
{
"entropy": 6.565396356582641,
"epoch": 0.4702827466820542,
"grad_norm": 0.83984375,
"learning_rate": 0.0004985712866361954,
"loss": 6.4674,
"mean_token_accuracy": 0.16278457939624785,
"num_tokens": 10312558.0,
"step": 4075
},
{
"entropy": 6.541759634017945,
"epoch": 0.4708597807270629,
"grad_norm": 0.91796875,
"learning_rate": 0.0004985666400675709,
"loss": 6.3687,
"mean_token_accuracy": 0.16311410516500474,
"num_tokens": 10324185.0,
"step": 4080
},
{
"entropy": 6.4401655197143555,
"epoch": 0.47143681477207156,
"grad_norm": 0.75,
"learning_rate": 0.0004985619859793934,
"loss": 6.4018,
"mean_token_accuracy": 0.15202204287052154,
"num_tokens": 10338634.0,
"step": 4085
},
{
"entropy": 6.673071384429932,
"epoch": 0.4720138488170802,
"grad_norm": 0.8359375,
"learning_rate": 0.0004985573243718195,
"loss": 6.4702,
"mean_token_accuracy": 0.1487300381064415,
"num_tokens": 10351272.0,
"step": 4090
},
{
"entropy": 6.562505865097046,
"epoch": 0.4725908828620889,
"grad_norm": 0.828125,
"learning_rate": 0.0004985526552450061,
"loss": 6.4052,
"mean_token_accuracy": 0.15442484468221665,
"num_tokens": 10362894.0,
"step": 4095
},
{
"entropy": 6.557220220565796,
"epoch": 0.47316791690709753,
"grad_norm": 0.80078125,
"learning_rate": 0.0004985479785991103,
"loss": 6.5136,
"mean_token_accuracy": 0.15173576027154922,
"num_tokens": 10376120.0,
"step": 4100
},
{
"entropy": 6.551002073287964,
"epoch": 0.47374495095210617,
"grad_norm": 0.94921875,
"learning_rate": 0.0004985432944342892,
"loss": 6.4281,
"mean_token_accuracy": 0.15780509859323502,
"num_tokens": 10387986.0,
"step": 4105
},
{
"entropy": 6.5132355213165285,
"epoch": 0.4743219849971148,
"grad_norm": 0.87890625,
"learning_rate": 0.0004985386027507003,
"loss": 6.4441,
"mean_token_accuracy": 0.1574099436402321,
"num_tokens": 10400920.0,
"step": 4110
},
{
"entropy": 6.636253833770752,
"epoch": 0.4748990190421235,
"grad_norm": 0.8046875,
"learning_rate": 0.0004985339035485018,
"loss": 6.4511,
"mean_token_accuracy": 0.1540090411901474,
"num_tokens": 10413835.0,
"step": 4115
},
{
"entropy": 6.511466121673584,
"epoch": 0.47547605308713214,
"grad_norm": 0.7109375,
"learning_rate": 0.0004985291968278513,
"loss": 6.4537,
"mean_token_accuracy": 0.15455947071313858,
"num_tokens": 10426959.0,
"step": 4120
},
{
"entropy": 6.5830864906311035,
"epoch": 0.4760530871321408,
"grad_norm": 0.7890625,
"learning_rate": 0.0004985244825889074,
"loss": 6.4912,
"mean_token_accuracy": 0.15826078802347182,
"num_tokens": 10440319.0,
"step": 4125
},
{
"entropy": 6.533916664123535,
"epoch": 0.4766301211771495,
"grad_norm": 0.8046875,
"learning_rate": 0.0004985197608318284,
"loss": 6.4479,
"mean_token_accuracy": 0.15521639585494995,
"num_tokens": 10453715.0,
"step": 4130
},
{
"entropy": 6.575965356826782,
"epoch": 0.4772071552221581,
"grad_norm": 0.80859375,
"learning_rate": 0.0004985150315567735,
"loss": 6.4414,
"mean_token_accuracy": 0.15350656658411027,
"num_tokens": 10465574.0,
"step": 4135
},
{
"entropy": 6.519655561447143,
"epoch": 0.47778418926716676,
"grad_norm": 0.84765625,
"learning_rate": 0.0004985102947639013,
"loss": 6.4083,
"mean_token_accuracy": 0.15839099436998366,
"num_tokens": 10478105.0,
"step": 4140
},
{
"entropy": 6.4816258430480955,
"epoch": 0.4783612233121754,
"grad_norm": 0.86328125,
"learning_rate": 0.0004985055504533715,
"loss": 6.4284,
"mean_token_accuracy": 0.15900716781616211,
"num_tokens": 10490723.0,
"step": 4145
},
{
"entropy": 6.624292707443237,
"epoch": 0.4789382573571841,
"grad_norm": 0.8203125,
"learning_rate": 0.0004985007986253435,
"loss": 6.452,
"mean_token_accuracy": 0.15452224612236024,
"num_tokens": 10503155.0,
"step": 4150
},
{
"entropy": 6.526167535781861,
"epoch": 0.47951529140219273,
"grad_norm": 0.8828125,
"learning_rate": 0.0004984960392799772,
"loss": 6.4215,
"mean_token_accuracy": 0.14876818060874938,
"num_tokens": 10515077.0,
"step": 4155
},
{
"entropy": 6.6001299858093265,
"epoch": 0.4800923254472014,
"grad_norm": 0.83203125,
"learning_rate": 0.0004984912724174326,
"loss": 6.3883,
"mean_token_accuracy": 0.15346773862838745,
"num_tokens": 10528445.0,
"step": 4160
},
{
"entropy": 6.559596395492553,
"epoch": 0.48066935949221,
"grad_norm": 0.7734375,
"learning_rate": 0.0004984864980378701,
"loss": 6.4379,
"mean_token_accuracy": 0.15837605893611909,
"num_tokens": 10541877.0,
"step": 4165
},
{
"entropy": 6.54767746925354,
"epoch": 0.4812463935372187,
"grad_norm": 0.83984375,
"learning_rate": 0.0004984817161414502,
"loss": 6.4044,
"mean_token_accuracy": 0.15747998505830765,
"num_tokens": 10553527.0,
"step": 4170
},
{
"entropy": 6.479561614990234,
"epoch": 0.48182342758222735,
"grad_norm": 0.8203125,
"learning_rate": 0.0004984769267283338,
"loss": 6.4136,
"mean_token_accuracy": 0.15314011722803117,
"num_tokens": 10566492.0,
"step": 4175
},
{
"entropy": 6.467929792404175,
"epoch": 0.482400461627236,
"grad_norm": 0.8125,
"learning_rate": 0.0004984721297986819,
"loss": 6.3739,
"mean_token_accuracy": 0.15953933745622634,
"num_tokens": 10578962.0,
"step": 4180
},
{
"entropy": 6.5416004180908205,
"epoch": 0.4829774956722447,
"grad_norm": 0.86328125,
"learning_rate": 0.0004984673253526561,
"loss": 6.3665,
"mean_token_accuracy": 0.15812182426452637,
"num_tokens": 10591254.0,
"step": 4185
},
{
"entropy": 6.557770919799805,
"epoch": 0.4835545297172533,
"grad_norm": 1.4453125,
"learning_rate": 0.0004984625133904176,
"loss": 6.4061,
"mean_token_accuracy": 0.1579806312918663,
"num_tokens": 10604961.0,
"step": 4190
},
{
"entropy": 6.499729299545288,
"epoch": 0.48413156376226196,
"grad_norm": 0.84765625,
"learning_rate": 0.0004984576939121286,
"loss": 6.3885,
"mean_token_accuracy": 0.16066249012947081,
"num_tokens": 10617419.0,
"step": 4195
},
{
"entropy": 6.50909194946289,
"epoch": 0.4847085978072706,
"grad_norm": 1.2578125,
"learning_rate": 0.0004984528669179511,
"loss": 6.4186,
"mean_token_accuracy": 0.15439673513174057,
"num_tokens": 10629721.0,
"step": 4200
},
{
"entropy": 6.625107002258301,
"epoch": 0.4852856318522793,
"grad_norm": 0.82421875,
"learning_rate": 0.0004984480324080472,
"loss": 6.4535,
"mean_token_accuracy": 0.15551864504814147,
"num_tokens": 10643869.0,
"step": 4205
},
{
"entropy": 6.590443325042725,
"epoch": 0.48586266589728794,
"grad_norm": 0.8046875,
"learning_rate": 0.00049844319038258,
"loss": 6.5082,
"mean_token_accuracy": 0.14841593205928802,
"num_tokens": 10658418.0,
"step": 4210
},
{
"entropy": 6.542080116271973,
"epoch": 0.4864396999422966,
"grad_norm": 0.85546875,
"learning_rate": 0.0004984383408417119,
"loss": 6.3939,
"mean_token_accuracy": 0.16221137195825577,
"num_tokens": 10671105.0,
"step": 4215
},
{
"entropy": 6.542936706542969,
"epoch": 0.4870167339873053,
"grad_norm": 0.84765625,
"learning_rate": 0.0004984334837856064,
"loss": 6.4929,
"mean_token_accuracy": 0.15168781727552413,
"num_tokens": 10683862.0,
"step": 4220
},
{
"entropy": 6.539501905441284,
"epoch": 0.4875937680323139,
"grad_norm": 0.85546875,
"learning_rate": 0.0004984286192144263,
"loss": 6.3919,
"mean_token_accuracy": 0.1602101057767868,
"num_tokens": 10696559.0,
"step": 4225
},
{
"entropy": 6.5565080642700195,
"epoch": 0.48817080207732255,
"grad_norm": 0.80859375,
"learning_rate": 0.0004984237471283359,
"loss": 6.4623,
"mean_token_accuracy": 0.157669498026371,
"num_tokens": 10710227.0,
"step": 4230
},
{
"entropy": 6.489563083648681,
"epoch": 0.4887478361223312,
"grad_norm": 0.92578125,
"learning_rate": 0.0004984188675274986,
"loss": 6.4311,
"mean_token_accuracy": 0.15578922182321547,
"num_tokens": 10722761.0,
"step": 4235
},
{
"entropy": 6.552829694747925,
"epoch": 0.4893248701673399,
"grad_norm": 0.78515625,
"learning_rate": 0.0004984139804120787,
"loss": 6.3864,
"mean_token_accuracy": 0.15277379006147385,
"num_tokens": 10734126.0,
"step": 4240
},
{
"entropy": 6.524606513977051,
"epoch": 0.4899019042123485,
"grad_norm": 0.7734375,
"learning_rate": 0.0004984090857822406,
"loss": 6.4398,
"mean_token_accuracy": 0.15711746215820313,
"num_tokens": 10747570.0,
"step": 4245
},
{
"entropy": 6.61868577003479,
"epoch": 0.49047893825735717,
"grad_norm": 0.6875,
"learning_rate": 0.0004984041836381488,
"loss": 6.5498,
"mean_token_accuracy": 0.14832186549901963,
"num_tokens": 10762975.0,
"step": 4250
},
{
"entropy": 6.625642156600952,
"epoch": 0.49105597230236586,
"grad_norm": 0.8203125,
"learning_rate": 0.0004983992739799682,
"loss": 6.3846,
"mean_token_accuracy": 0.1586022138595581,
"num_tokens": 10774520.0,
"step": 4255
},
{
"entropy": 6.455063724517823,
"epoch": 0.4916330063473745,
"grad_norm": 0.859375,
"learning_rate": 0.0004983943568078642,
"loss": 6.3108,
"mean_token_accuracy": 0.16183219701051713,
"num_tokens": 10786250.0,
"step": 4260
},
{
"entropy": 6.565676832199097,
"epoch": 0.49221004039238314,
"grad_norm": 0.76171875,
"learning_rate": 0.0004983894321220017,
"loss": 6.4387,
"mean_token_accuracy": 0.15883514136075974,
"num_tokens": 10799831.0,
"step": 4265
},
{
"entropy": 6.5317785263061525,
"epoch": 0.4927870744373918,
"grad_norm": 0.859375,
"learning_rate": 0.0004983844999225468,
"loss": 6.3715,
"mean_token_accuracy": 0.16067612767219544,
"num_tokens": 10812803.0,
"step": 4270
},
{
"entropy": 6.497241115570068,
"epoch": 0.4933641084824005,
"grad_norm": 0.85546875,
"learning_rate": 0.0004983795602096651,
"loss": 6.3904,
"mean_token_accuracy": 0.1601540118455887,
"num_tokens": 10825150.0,
"step": 4275
},
{
"entropy": 6.598751640319824,
"epoch": 0.4939411425274091,
"grad_norm": 0.8046875,
"learning_rate": 0.000498374612983523,
"loss": 6.506,
"mean_token_accuracy": 0.15289822071790696,
"num_tokens": 10838337.0,
"step": 4280
},
{
"entropy": 6.5518717765808105,
"epoch": 0.49451817657241776,
"grad_norm": 0.81640625,
"learning_rate": 0.0004983696582442866,
"loss": 6.334,
"mean_token_accuracy": 0.17550577819347382,
"num_tokens": 10852288.0,
"step": 4285
},
{
"entropy": 6.514918279647827,
"epoch": 0.49509521061742645,
"grad_norm": 0.83984375,
"learning_rate": 0.0004983646959921227,
"loss": 6.439,
"mean_token_accuracy": 0.15471772402524947,
"num_tokens": 10864189.0,
"step": 4290
},
{
"entropy": 6.618105697631836,
"epoch": 0.4956722446624351,
"grad_norm": 0.7578125,
"learning_rate": 0.0004983597262271984,
"loss": 6.4346,
"mean_token_accuracy": 0.1550702318549156,
"num_tokens": 10877410.0,
"step": 4295
},
{
"entropy": 6.503079223632812,
"epoch": 0.49624927870744373,
"grad_norm": 0.84765625,
"learning_rate": 0.0004983547489496804,
"loss": 6.4053,
"mean_token_accuracy": 0.15499556958675384,
"num_tokens": 10889757.0,
"step": 4300
},
{
"entropy": 6.490525484085083,
"epoch": 0.49682631275245237,
"grad_norm": 0.8828125,
"learning_rate": 0.0004983497641597365,
"loss": 6.3195,
"mean_token_accuracy": 0.16428075432777406,
"num_tokens": 10901636.0,
"step": 4305
},
{
"entropy": 6.480206155776978,
"epoch": 0.49740334679746107,
"grad_norm": 0.76171875,
"learning_rate": 0.0004983447718575342,
"loss": 6.3544,
"mean_token_accuracy": 0.1630442336201668,
"num_tokens": 10914063.0,
"step": 4310
},
{
"entropy": 6.595718622207642,
"epoch": 0.4979803808424697,
"grad_norm": 0.796875,
"learning_rate": 0.0004983397720432414,
"loss": 6.3886,
"mean_token_accuracy": 0.16058591455221177,
"num_tokens": 10927730.0,
"step": 4315
},
{
"entropy": 6.534880208969116,
"epoch": 0.49855741488747835,
"grad_norm": 0.8125,
"learning_rate": 0.0004983347647170264,
"loss": 6.4898,
"mean_token_accuracy": 0.15413855165243148,
"num_tokens": 10942440.0,
"step": 4320
},
{
"entropy": 6.512958288192749,
"epoch": 0.49913444893248704,
"grad_norm": 1.28125,
"learning_rate": 0.0004983297498790574,
"loss": 6.3992,
"mean_token_accuracy": 0.156264328956604,
"num_tokens": 10955801.0,
"step": 4325
},
{
"entropy": 6.5469934940338135,
"epoch": 0.4997114829774957,
"grad_norm": 0.8203125,
"learning_rate": 0.0004983247275295034,
"loss": 6.3887,
"mean_token_accuracy": 0.1580841600894928,
"num_tokens": 10967918.0,
"step": 4330
},
{
"entropy": 6.508872032165527,
"epoch": 0.5002885170225043,
"grad_norm": 0.8515625,
"learning_rate": 0.0004983196976685329,
"loss": 6.3267,
"mean_token_accuracy": 0.16289351582527162,
"num_tokens": 10979652.0,
"step": 4335
},
{
"entropy": 6.387019300460816,
"epoch": 0.500865551067513,
"grad_norm": 0.890625,
"learning_rate": 0.0004983146602963155,
"loss": 6.2607,
"mean_token_accuracy": 0.17579997777938844,
"num_tokens": 10991433.0,
"step": 4340
},
{
"entropy": 6.460304498672485,
"epoch": 0.5014425851125216,
"grad_norm": 0.86328125,
"learning_rate": 0.0004983096154130203,
"loss": 6.4603,
"mean_token_accuracy": 0.15860795527696608,
"num_tokens": 11003976.0,
"step": 4345
},
{
"entropy": 6.599706220626831,
"epoch": 0.5020196191575302,
"grad_norm": 0.79296875,
"learning_rate": 0.0004983045630188171,
"loss": 6.4366,
"mean_token_accuracy": 0.15410916805267333,
"num_tokens": 11018848.0,
"step": 4350
},
{
"entropy": 6.57402777671814,
"epoch": 0.502596653202539,
"grad_norm": 0.76953125,
"learning_rate": 0.0004982995031138759,
"loss": 6.4038,
"mean_token_accuracy": 0.15641804337501525,
"num_tokens": 11030803.0,
"step": 4355
},
{
"entropy": 6.586047887802124,
"epoch": 0.5031736872475476,
"grad_norm": 0.7890625,
"learning_rate": 0.0004982944356983666,
"loss": 6.4921,
"mean_token_accuracy": 0.15291229784488677,
"num_tokens": 11044688.0,
"step": 4360
},
{
"entropy": 6.524409008026123,
"epoch": 0.5037507212925563,
"grad_norm": 0.859375,
"learning_rate": 0.0004982893607724602,
"loss": 6.4306,
"mean_token_accuracy": 0.15263819694519043,
"num_tokens": 11057026.0,
"step": 4365
},
{
"entropy": 6.639001178741455,
"epoch": 0.5043277553375649,
"grad_norm": 0.76953125,
"learning_rate": 0.000498284278336327,
"loss": 6.4538,
"mean_token_accuracy": 0.15304491817951202,
"num_tokens": 11070407.0,
"step": 4370
},
{
"entropy": 6.5000138759613035,
"epoch": 0.5049047893825735,
"grad_norm": 0.83984375,
"learning_rate": 0.0004982791883901379,
"loss": 6.3616,
"mean_token_accuracy": 0.16394442021846772,
"num_tokens": 11082655.0,
"step": 4375
},
{
"entropy": 6.462573575973511,
"epoch": 0.5054818234275822,
"grad_norm": 0.7578125,
"learning_rate": 0.0004982740909340643,
"loss": 6.3301,
"mean_token_accuracy": 0.16755695044994354,
"num_tokens": 11095948.0,
"step": 4380
},
{
"entropy": 6.589680433273315,
"epoch": 0.5060588574725908,
"grad_norm": 0.8046875,
"learning_rate": 0.0004982689859682775,
"loss": 6.382,
"mean_token_accuracy": 0.15594714432954787,
"num_tokens": 11108105.0,
"step": 4385
},
{
"entropy": 6.5538736343383786,
"epoch": 0.5066358915175996,
"grad_norm": 0.7890625,
"learning_rate": 0.0004982638734929492,
"loss": 6.4291,
"mean_token_accuracy": 0.15332048535346984,
"num_tokens": 11120322.0,
"step": 4390
},
{
"entropy": 6.386771297454834,
"epoch": 0.5072129255626082,
"grad_norm": 0.75390625,
"learning_rate": 0.0004982587535082515,
"loss": 6.2161,
"mean_token_accuracy": 0.16631432473659516,
"num_tokens": 11133903.0,
"step": 4395
},
{
"entropy": 6.46461238861084,
"epoch": 0.5077899596076169,
"grad_norm": 0.84765625,
"learning_rate": 0.0004982536260143565,
"loss": 6.2861,
"mean_token_accuracy": 0.16543451994657515,
"num_tokens": 11145607.0,
"step": 4400
},
{
"entropy": 6.536594581604004,
"epoch": 0.5083669936526255,
"grad_norm": 0.875,
"learning_rate": 0.0004982484910114367,
"loss": 6.391,
"mean_token_accuracy": 0.15751007944345474,
"num_tokens": 11157332.0,
"step": 4405
},
{
"entropy": 6.527062559127808,
"epoch": 0.5089440276976341,
"grad_norm": 0.859375,
"learning_rate": 0.0004982433484996648,
"loss": 6.4747,
"mean_token_accuracy": 0.1585505411028862,
"num_tokens": 11169404.0,
"step": 4410
},
{
"entropy": 6.553807020187378,
"epoch": 0.5095210617426428,
"grad_norm": 0.80859375,
"learning_rate": 0.0004982381984792138,
"loss": 6.3707,
"mean_token_accuracy": 0.15870761573314668,
"num_tokens": 11182506.0,
"step": 4415
},
{
"entropy": 6.516544485092163,
"epoch": 0.5100980957876514,
"grad_norm": 0.82421875,
"learning_rate": 0.0004982330409502568,
"loss": 6.3395,
"mean_token_accuracy": 0.1521760679781437,
"num_tokens": 11195507.0,
"step": 4420
},
{
"entropy": 6.505952548980713,
"epoch": 0.5106751298326602,
"grad_norm": 0.84765625,
"learning_rate": 0.0004982278759129674,
"loss": 6.3472,
"mean_token_accuracy": 0.16159432679414748,
"num_tokens": 11207219.0,
"step": 4425
},
{
"entropy": 6.456001710891724,
"epoch": 0.5112521638776688,
"grad_norm": 0.83203125,
"learning_rate": 0.0004982227033675194,
"loss": 6.3242,
"mean_token_accuracy": 0.16376312375068663,
"num_tokens": 11219301.0,
"step": 4430
},
{
"entropy": 6.460791826248169,
"epoch": 0.5118291979226774,
"grad_norm": 0.8828125,
"learning_rate": 0.0004982175233140865,
"loss": 6.3282,
"mean_token_accuracy": 0.16003126353025438,
"num_tokens": 11230957.0,
"step": 4435
},
{
"entropy": 6.537653398513794,
"epoch": 0.5124062319676861,
"grad_norm": 0.83203125,
"learning_rate": 0.0004982123357528431,
"loss": 6.3529,
"mean_token_accuracy": 0.15861166417598724,
"num_tokens": 11242813.0,
"step": 4440
},
{
"entropy": 6.4945403099060055,
"epoch": 0.5129832660126947,
"grad_norm": 0.8359375,
"learning_rate": 0.0004982071406839636,
"loss": 6.3613,
"mean_token_accuracy": 0.1551041141152382,
"num_tokens": 11255193.0,
"step": 4445
},
{
"entropy": 6.403803586959839,
"epoch": 0.5135603000577034,
"grad_norm": 0.87109375,
"learning_rate": 0.0004982019381076229,
"loss": 6.336,
"mean_token_accuracy": 0.16265275329351425,
"num_tokens": 11267988.0,
"step": 4450
},
{
"entropy": 6.558556795120239,
"epoch": 0.514137334102712,
"grad_norm": 0.828125,
"learning_rate": 0.0004981967280239958,
"loss": 6.4116,
"mean_token_accuracy": 0.15306541174650193,
"num_tokens": 11280456.0,
"step": 4455
},
{
"entropy": 6.527243995666504,
"epoch": 0.5147143681477208,
"grad_norm": 0.8046875,
"learning_rate": 0.0004981915104332578,
"loss": 6.4394,
"mean_token_accuracy": 0.15262870788574218,
"num_tokens": 11293304.0,
"step": 4460
},
{
"entropy": 6.479492855072022,
"epoch": 0.5152914021927294,
"grad_norm": 0.79296875,
"learning_rate": 0.000498186285335584,
"loss": 6.3962,
"mean_token_accuracy": 0.15405147820711135,
"num_tokens": 11305936.0,
"step": 4465
},
{
"entropy": 6.617494297027588,
"epoch": 0.515868436237738,
"grad_norm": 0.7890625,
"learning_rate": 0.0004981810527311505,
"loss": 6.4403,
"mean_token_accuracy": 0.1522215947508812,
"num_tokens": 11319991.0,
"step": 4470
},
{
"entropy": 6.508704996109008,
"epoch": 0.5164454702827467,
"grad_norm": 0.83203125,
"learning_rate": 0.000498175812620133,
"loss": 6.3465,
"mean_token_accuracy": 0.16412411332130433,
"num_tokens": 11332572.0,
"step": 4475
},
{
"entropy": 6.460049343109131,
"epoch": 0.5170225043277553,
"grad_norm": 0.8984375,
"learning_rate": 0.0004981705650027081,
"loss": 6.3431,
"mean_token_accuracy": 0.16454764157533647,
"num_tokens": 11344435.0,
"step": 4480
},
{
"entropy": 6.47212586402893,
"epoch": 0.517599538372764,
"grad_norm": 0.90625,
"learning_rate": 0.000498165309879052,
"loss": 6.273,
"mean_token_accuracy": 0.16744499206542968,
"num_tokens": 11356078.0,
"step": 4485
},
{
"entropy": 6.43641505241394,
"epoch": 0.5181765724177726,
"grad_norm": 0.890625,
"learning_rate": 0.0004981600472493415,
"loss": 6.3231,
"mean_token_accuracy": 0.16197210550308228,
"num_tokens": 11368933.0,
"step": 4490
},
{
"entropy": 6.587095832824707,
"epoch": 0.5187536064627813,
"grad_norm": 0.84765625,
"learning_rate": 0.0004981547771137537,
"loss": 6.4412,
"mean_token_accuracy": 0.15295076966285706,
"num_tokens": 11380810.0,
"step": 4495
},
{
"entropy": 6.448738145828247,
"epoch": 0.51933064050779,
"grad_norm": 0.90625,
"learning_rate": 0.0004981494994724658,
"loss": 6.3362,
"mean_token_accuracy": 0.16053746342658998,
"num_tokens": 11392447.0,
"step": 4500
},
{
"entropy": 6.471343231201172,
"epoch": 0.5199076745527986,
"grad_norm": 0.87890625,
"learning_rate": 0.0004981442143256554,
"loss": 6.3946,
"mean_token_accuracy": 0.1577278733253479,
"num_tokens": 11405237.0,
"step": 4505
},
{
"entropy": 6.582560443878174,
"epoch": 0.5204847085978073,
"grad_norm": 0.765625,
"learning_rate": 0.0004981389216735001,
"loss": 6.5039,
"mean_token_accuracy": 0.14747137874364852,
"num_tokens": 11418951.0,
"step": 4510
},
{
"entropy": 6.54022970199585,
"epoch": 0.5210617426428159,
"grad_norm": 0.75,
"learning_rate": 0.000498133621516178,
"loss": 6.4038,
"mean_token_accuracy": 0.15998345464468003,
"num_tokens": 11432587.0,
"step": 4515
},
{
"entropy": 6.507716655731201,
"epoch": 0.5216387766878245,
"grad_norm": 0.78515625,
"learning_rate": 0.0004981283138538675,
"loss": 6.4289,
"mean_token_accuracy": 0.15074404031038285,
"num_tokens": 11445572.0,
"step": 4520
},
{
"entropy": 6.524649286270142,
"epoch": 0.5222158107328332,
"grad_norm": 0.85546875,
"learning_rate": 0.000498122998686747,
"loss": 6.3821,
"mean_token_accuracy": 0.16107590049505233,
"num_tokens": 11457469.0,
"step": 4525
},
{
"entropy": 6.531647729873657,
"epoch": 0.5227928447778419,
"grad_norm": 0.81640625,
"learning_rate": 0.0004981176760149951,
"loss": 6.4269,
"mean_token_accuracy": 0.1588137172162533,
"num_tokens": 11470306.0,
"step": 4530
},
{
"entropy": 6.553733444213867,
"epoch": 0.5233698788228506,
"grad_norm": 0.84375,
"learning_rate": 0.0004981123458387911,
"loss": 6.4024,
"mean_token_accuracy": 0.16188153773546218,
"num_tokens": 11483839.0,
"step": 4535
},
{
"entropy": 6.549627828598022,
"epoch": 0.5239469128678592,
"grad_norm": 0.91015625,
"learning_rate": 0.0004981070081583142,
"loss": 6.3946,
"mean_token_accuracy": 0.15353466868400573,
"num_tokens": 11495703.0,
"step": 4540
},
{
"entropy": 6.5704262256622314,
"epoch": 0.5245239469128679,
"grad_norm": 0.81640625,
"learning_rate": 0.000498101662973744,
"loss": 6.4888,
"mean_token_accuracy": 0.15426429733633995,
"num_tokens": 11508061.0,
"step": 4545
},
{
"entropy": 6.487470436096191,
"epoch": 0.5251009809578765,
"grad_norm": 0.79296875,
"learning_rate": 0.00049809631028526,
"loss": 6.3195,
"mean_token_accuracy": 0.16369524449110032,
"num_tokens": 11520135.0,
"step": 4550
},
{
"entropy": 6.492602396011352,
"epoch": 0.5256780150028851,
"grad_norm": 0.828125,
"learning_rate": 0.0004980909500930424,
"loss": 6.3946,
"mean_token_accuracy": 0.15684450417757034,
"num_tokens": 11532255.0,
"step": 4555
},
{
"entropy": 6.544296550750732,
"epoch": 0.5262550490478938,
"grad_norm": 0.86328125,
"learning_rate": 0.0004980855823972717,
"loss": 6.3394,
"mean_token_accuracy": 0.1619937911629677,
"num_tokens": 11544596.0,
"step": 4560
},
{
"entropy": 6.4948595523834225,
"epoch": 0.5268320830929025,
"grad_norm": 0.8671875,
"learning_rate": 0.000498080207198128,
"loss": 6.4627,
"mean_token_accuracy": 0.1510115385055542,
"num_tokens": 11556758.0,
"step": 4565
},
{
"entropy": 6.56593132019043,
"epoch": 0.5274091171379112,
"grad_norm": 0.8125,
"learning_rate": 0.0004980748244957925,
"loss": 6.4435,
"mean_token_accuracy": 0.14832553789019584,
"num_tokens": 11570070.0,
"step": 4570
},
{
"entropy": 6.518224000930786,
"epoch": 0.5279861511829198,
"grad_norm": 0.83984375,
"learning_rate": 0.0004980694342904461,
"loss": 6.3229,
"mean_token_accuracy": 0.16714330315589904,
"num_tokens": 11582566.0,
"step": 4575
},
{
"entropy": 6.45475206375122,
"epoch": 0.5285631852279284,
"grad_norm": 0.796875,
"learning_rate": 0.0004980640365822701,
"loss": 6.2754,
"mean_token_accuracy": 0.16809093654155732,
"num_tokens": 11595238.0,
"step": 4580
},
{
"entropy": 6.546554517745972,
"epoch": 0.5291402192729371,
"grad_norm": 0.80859375,
"learning_rate": 0.000498058631371446,
"loss": 6.4037,
"mean_token_accuracy": 0.1609138697385788,
"num_tokens": 11608646.0,
"step": 4585
},
{
"entropy": 6.4840919971466064,
"epoch": 0.5297172533179457,
"grad_norm": 0.8046875,
"learning_rate": 0.0004980532186581555,
"loss": 6.3518,
"mean_token_accuracy": 0.1566994830965996,
"num_tokens": 11619610.0,
"step": 4590
},
{
"entropy": 6.437766647338867,
"epoch": 0.5302942873629544,
"grad_norm": 0.8203125,
"learning_rate": 0.000498047798442581,
"loss": 6.2399,
"mean_token_accuracy": 0.17291501462459563,
"num_tokens": 11631691.0,
"step": 4595
},
{
"entropy": 6.4640161991119385,
"epoch": 0.5308713214079631,
"grad_norm": 0.7890625,
"learning_rate": 0.0004980423707249044,
"loss": 6.286,
"mean_token_accuracy": 0.16628182977437972,
"num_tokens": 11644330.0,
"step": 4600
},
{
"entropy": 6.56778769493103,
"epoch": 0.5314483554529718,
"grad_norm": 0.8203125,
"learning_rate": 0.0004980369355053086,
"loss": 6.4038,
"mean_token_accuracy": 0.15543297529220582,
"num_tokens": 11656826.0,
"step": 4605
},
{
"entropy": 6.468916130065918,
"epoch": 0.5320253894979804,
"grad_norm": 0.9375,
"learning_rate": 0.0004980314927839763,
"loss": 6.3838,
"mean_token_accuracy": 0.1545664668083191,
"num_tokens": 11668669.0,
"step": 4610
},
{
"entropy": 6.521239757537842,
"epoch": 0.532602423542989,
"grad_norm": 0.80859375,
"learning_rate": 0.0004980260425610903,
"loss": 6.3392,
"mean_token_accuracy": 0.15642919391393661,
"num_tokens": 11681237.0,
"step": 4615
},
{
"entropy": 6.442376375198364,
"epoch": 0.5331794575879977,
"grad_norm": 0.84375,
"learning_rate": 0.0004980205848368343,
"loss": 6.3934,
"mean_token_accuracy": 0.15855768769979478,
"num_tokens": 11693953.0,
"step": 4620
},
{
"entropy": 6.447347021102905,
"epoch": 0.5337564916330063,
"grad_norm": 0.8671875,
"learning_rate": 0.0004980151196113917,
"loss": 6.3594,
"mean_token_accuracy": 0.1600581720471382,
"num_tokens": 11705364.0,
"step": 4625
},
{
"entropy": 6.5338707447052,
"epoch": 0.534333525678015,
"grad_norm": 0.80078125,
"learning_rate": 0.0004980096468849464,
"loss": 6.3732,
"mean_token_accuracy": 0.15663958638906478,
"num_tokens": 11717664.0,
"step": 4630
},
{
"entropy": 6.507907485961914,
"epoch": 0.5349105597230237,
"grad_norm": 0.81640625,
"learning_rate": 0.0004980041666576823,
"loss": 6.3688,
"mean_token_accuracy": 0.15612590909004212,
"num_tokens": 11731143.0,
"step": 4635
},
{
"entropy": 6.513534021377564,
"epoch": 0.5354875937680323,
"grad_norm": 0.83984375,
"learning_rate": 0.0004979986789297837,
"loss": 6.3105,
"mean_token_accuracy": 0.1600772351026535,
"num_tokens": 11743904.0,
"step": 4640
},
{
"entropy": 6.3788543224334715,
"epoch": 0.536064627813041,
"grad_norm": 0.83984375,
"learning_rate": 0.0004979931837014355,
"loss": 6.1961,
"mean_token_accuracy": 0.16465394496917723,
"num_tokens": 11756731.0,
"step": 4645
},
{
"entropy": 6.432486915588379,
"epoch": 0.5366416618580496,
"grad_norm": 0.83984375,
"learning_rate": 0.0004979876809728223,
"loss": 6.3189,
"mean_token_accuracy": 0.16390772312879562,
"num_tokens": 11768597.0,
"step": 4650
},
{
"entropy": 6.424148178100586,
"epoch": 0.5372186959030583,
"grad_norm": 0.87109375,
"learning_rate": 0.0004979821707441292,
"loss": 6.2386,
"mean_token_accuracy": 0.1694170728325844,
"num_tokens": 11781464.0,
"step": 4655
},
{
"entropy": 6.385573053359986,
"epoch": 0.5377957299480669,
"grad_norm": 0.82421875,
"learning_rate": 0.0004979766530155416,
"loss": 6.2189,
"mean_token_accuracy": 0.17261924147605895,
"num_tokens": 11794215.0,
"step": 4660
},
{
"entropy": 6.4749983787536625,
"epoch": 0.5383727639930755,
"grad_norm": 0.87109375,
"learning_rate": 0.0004979711277872449,
"loss": 6.444,
"mean_token_accuracy": 0.15245128124952317,
"num_tokens": 11807456.0,
"step": 4665
},
{
"entropy": 6.4587053775787355,
"epoch": 0.5389497980380843,
"grad_norm": 0.796875,
"learning_rate": 0.0004979655950594252,
"loss": 6.337,
"mean_token_accuracy": 0.1637497663497925,
"num_tokens": 11819730.0,
"step": 4670
},
{
"entropy": 6.460689640045166,
"epoch": 0.5395268320830929,
"grad_norm": 0.8046875,
"learning_rate": 0.0004979600548322684,
"loss": 6.3466,
"mean_token_accuracy": 0.17143890559673308,
"num_tokens": 11831892.0,
"step": 4675
},
{
"entropy": 6.456334400177002,
"epoch": 0.5401038661281016,
"grad_norm": 0.81640625,
"learning_rate": 0.000497954507105961,
"loss": 6.3654,
"mean_token_accuracy": 0.15969292372465133,
"num_tokens": 11844114.0,
"step": 4680
},
{
"entropy": 6.526745080947876,
"epoch": 0.5406809001731102,
"grad_norm": 0.7890625,
"learning_rate": 0.0004979489518806893,
"loss": 6.3234,
"mean_token_accuracy": 0.15686967074871064,
"num_tokens": 11855832.0,
"step": 4685
},
{
"entropy": 6.465781307220459,
"epoch": 0.5412579342181189,
"grad_norm": 0.73828125,
"learning_rate": 0.0004979433891566405,
"loss": 6.4208,
"mean_token_accuracy": 0.15778311640024184,
"num_tokens": 11868837.0,
"step": 4690
},
{
"entropy": 6.4877008438110355,
"epoch": 0.5418349682631275,
"grad_norm": 0.80859375,
"learning_rate": 0.0004979378189340015,
"loss": 6.3289,
"mean_token_accuracy": 0.16794711649417876,
"num_tokens": 11880608.0,
"step": 4695
},
{
"entropy": 6.476086235046386,
"epoch": 0.5424120023081361,
"grad_norm": 0.859375,
"learning_rate": 0.0004979322412129597,
"loss": 6.344,
"mean_token_accuracy": 0.15937476307153703,
"num_tokens": 11892652.0,
"step": 4700
},
{
"entropy": 6.458676815032959,
"epoch": 0.5429890363531449,
"grad_norm": 0.78515625,
"learning_rate": 0.0004979266559937028,
"loss": 6.2977,
"mean_token_accuracy": 0.15880679041147233,
"num_tokens": 11904572.0,
"step": 4705
},
{
"entropy": 6.5893689632415775,
"epoch": 0.5435660703981535,
"grad_norm": 0.8046875,
"learning_rate": 0.0004979210632764185,
"loss": 6.4386,
"mean_token_accuracy": 0.15327975898981094,
"num_tokens": 11917794.0,
"step": 4710
},
{
"entropy": 6.511403131484985,
"epoch": 0.5441431044431622,
"grad_norm": 0.80859375,
"learning_rate": 0.0004979154630612949,
"loss": 6.3223,
"mean_token_accuracy": 0.156440269947052,
"num_tokens": 11930403.0,
"step": 4715
},
{
"entropy": 6.556756973266602,
"epoch": 0.5447201384881708,
"grad_norm": 0.921875,
"learning_rate": 0.0004979098553485205,
"loss": 6.4268,
"mean_token_accuracy": 0.15392898991703988,
"num_tokens": 11943974.0,
"step": 4720
},
{
"entropy": 6.528595209121704,
"epoch": 0.5452971725331794,
"grad_norm": 0.81640625,
"learning_rate": 0.0004979042401382838,
"loss": 6.4272,
"mean_token_accuracy": 0.14962007254362106,
"num_tokens": 11956887.0,
"step": 4725
},
{
"entropy": 6.554116296768188,
"epoch": 0.5458742065781881,
"grad_norm": 0.82421875,
"learning_rate": 0.0004978986174307737,
"loss": 6.2719,
"mean_token_accuracy": 0.1685679391026497,
"num_tokens": 11969504.0,
"step": 4730
},
{
"entropy": 6.43930287361145,
"epoch": 0.5464512406231967,
"grad_norm": 0.80859375,
"learning_rate": 0.0004978929872261794,
"loss": 6.326,
"mean_token_accuracy": 0.16304372251033783,
"num_tokens": 11983432.0,
"step": 4735
},
{
"entropy": 6.510177850723267,
"epoch": 0.5470282746682055,
"grad_norm": 0.84765625,
"learning_rate": 0.0004978873495246901,
"loss": 6.3165,
"mean_token_accuracy": 0.1688837394118309,
"num_tokens": 11995915.0,
"step": 4740
},
{
"entropy": 6.414366436004639,
"epoch": 0.5476053087132141,
"grad_norm": 0.734375,
"learning_rate": 0.0004978817043264955,
"loss": 6.3199,
"mean_token_accuracy": 0.1632016494870186,
"num_tokens": 12008395.0,
"step": 4745
},
{
"entropy": 6.401845407485962,
"epoch": 0.5481823427582228,
"grad_norm": 0.93359375,
"learning_rate": 0.0004978760516317856,
"loss": 6.2892,
"mean_token_accuracy": 0.16130719035863877,
"num_tokens": 12021179.0,
"step": 4750
},
{
"entropy": 6.523613595962525,
"epoch": 0.5487593768032314,
"grad_norm": 0.8046875,
"learning_rate": 0.0004978703914407503,
"loss": 6.3688,
"mean_token_accuracy": 0.1535087063908577,
"num_tokens": 12033798.0,
"step": 4755
},
{
"entropy": 6.5373670101165775,
"epoch": 0.54933641084824,
"grad_norm": 0.8671875,
"learning_rate": 0.0004978647237535802,
"loss": 6.3837,
"mean_token_accuracy": 0.15837208032608033,
"num_tokens": 12045720.0,
"step": 4760
},
{
"entropy": 6.5291375637054445,
"epoch": 0.5499134448932487,
"grad_norm": 0.86328125,
"learning_rate": 0.0004978590485704657,
"loss": 6.3069,
"mean_token_accuracy": 0.16414411664009093,
"num_tokens": 12058616.0,
"step": 4765
},
{
"entropy": 6.459080219268799,
"epoch": 0.5504904789382573,
"grad_norm": 0.80859375,
"learning_rate": 0.0004978533658915979,
"loss": 6.4107,
"mean_token_accuracy": 0.15961592346429826,
"num_tokens": 12070173.0,
"step": 4770
},
{
"entropy": 6.411388826370239,
"epoch": 0.5510675129832661,
"grad_norm": 0.98828125,
"learning_rate": 0.0004978476757171678,
"loss": 6.2896,
"mean_token_accuracy": 0.17188112884759904,
"num_tokens": 12083499.0,
"step": 4775
},
{
"entropy": 6.456639385223388,
"epoch": 0.5516445470282747,
"grad_norm": 0.81640625,
"learning_rate": 0.0004978419780473668,
"loss": 6.3513,
"mean_token_accuracy": 0.16023088991641998,
"num_tokens": 12095773.0,
"step": 4780
},
{
"entropy": 6.460473442077637,
"epoch": 0.5522215810732833,
"grad_norm": 0.81640625,
"learning_rate": 0.0004978362728823865,
"loss": 6.3514,
"mean_token_accuracy": 0.16689216941595078,
"num_tokens": 12107640.0,
"step": 4785
},
{
"entropy": 6.499213218688965,
"epoch": 0.552798615118292,
"grad_norm": 0.8046875,
"learning_rate": 0.0004978305602224189,
"loss": 6.297,
"mean_token_accuracy": 0.15836577117443085,
"num_tokens": 12120433.0,
"step": 4790
},
{
"entropy": 6.43018364906311,
"epoch": 0.5533756491633006,
"grad_norm": 1.078125,
"learning_rate": 0.0004978248400676562,
"loss": 6.2886,
"mean_token_accuracy": 0.16459263265132903,
"num_tokens": 12133326.0,
"step": 4795
},
{
"entropy": 6.528225231170654,
"epoch": 0.5539526832083093,
"grad_norm": 0.7578125,
"learning_rate": 0.0004978191124182905,
"loss": 6.3795,
"mean_token_accuracy": 0.15583104342222215,
"num_tokens": 12145119.0,
"step": 4800
},
{
"entropy": 6.500142383575439,
"epoch": 0.5545297172533179,
"grad_norm": 0.8203125,
"learning_rate": 0.0004978133772745149,
"loss": 6.3437,
"mean_token_accuracy": 0.1544487237930298,
"num_tokens": 12157414.0,
"step": 4805
},
{
"entropy": 6.3837847232818605,
"epoch": 0.5551067512983267,
"grad_norm": 0.828125,
"learning_rate": 0.0004978076346365218,
"loss": 6.2201,
"mean_token_accuracy": 0.16513165831565857,
"num_tokens": 12170226.0,
"step": 4810
},
{
"entropy": 6.448636436462403,
"epoch": 0.5556837853433353,
"grad_norm": 0.84765625,
"learning_rate": 0.0004978018845045047,
"loss": 6.2578,
"mean_token_accuracy": 0.16587026715278624,
"num_tokens": 12182804.0,
"step": 4815
},
{
"entropy": 6.569641876220703,
"epoch": 0.5562608193883439,
"grad_norm": 0.8046875,
"learning_rate": 0.0004977961268786568,
"loss": 6.3685,
"mean_token_accuracy": 0.16015153974294663,
"num_tokens": 12194795.0,
"step": 4820
},
{
"entropy": 6.4354218482971195,
"epoch": 0.5568378534333526,
"grad_norm": 0.828125,
"learning_rate": 0.0004977903617591719,
"loss": 6.3301,
"mean_token_accuracy": 0.16911077052354812,
"num_tokens": 12207880.0,
"step": 4825
},
{
"entropy": 6.479910516738892,
"epoch": 0.5574148874783612,
"grad_norm": 0.8984375,
"learning_rate": 0.0004977845891462439,
"loss": 6.3835,
"mean_token_accuracy": 0.15894741415977479,
"num_tokens": 12219434.0,
"step": 4830
},
{
"entropy": 6.427562856674195,
"epoch": 0.5579919215233698,
"grad_norm": 0.82421875,
"learning_rate": 0.0004977788090400668,
"loss": 6.3085,
"mean_token_accuracy": 0.16785141825675964,
"num_tokens": 12232775.0,
"step": 4835
},
{
"entropy": 6.477736520767212,
"epoch": 0.5585689555683785,
"grad_norm": 0.85546875,
"learning_rate": 0.0004977730214408352,
"loss": 6.2896,
"mean_token_accuracy": 0.16171760335564614,
"num_tokens": 12245306.0,
"step": 4840
},
{
"entropy": 6.389444780349732,
"epoch": 0.5591459896133872,
"grad_norm": 0.83984375,
"learning_rate": 0.0004977672263487435,
"loss": 6.2348,
"mean_token_accuracy": 0.1595480427145958,
"num_tokens": 12257553.0,
"step": 4845
},
{
"entropy": 6.3948791980743405,
"epoch": 0.5597230236583959,
"grad_norm": 0.890625,
"learning_rate": 0.000497761423763987,
"loss": 6.2974,
"mean_token_accuracy": 0.16309260874986647,
"num_tokens": 12269626.0,
"step": 4850
},
{
"entropy": 6.498226833343506,
"epoch": 0.5603000577034045,
"grad_norm": 0.83203125,
"learning_rate": 0.0004977556136867606,
"loss": 6.3464,
"mean_token_accuracy": 0.1585548087954521,
"num_tokens": 12282180.0,
"step": 4855
},
{
"entropy": 6.541059827804565,
"epoch": 0.5608770917484132,
"grad_norm": 0.8046875,
"learning_rate": 0.0004977497961172598,
"loss": 6.381,
"mean_token_accuracy": 0.16513874679803847,
"num_tokens": 12296315.0,
"step": 4860
},
{
"entropy": 6.445973348617554,
"epoch": 0.5614541257934218,
"grad_norm": 0.8203125,
"learning_rate": 0.0004977439710556802,
"loss": 6.3057,
"mean_token_accuracy": 0.15708381831645965,
"num_tokens": 12308800.0,
"step": 4865
},
{
"entropy": 6.436301040649414,
"epoch": 0.5620311598384304,
"grad_norm": 0.75390625,
"learning_rate": 0.0004977381385022179,
"loss": 6.3618,
"mean_token_accuracy": 0.16087310016155243,
"num_tokens": 12321717.0,
"step": 4870
},
{
"entropy": 6.537671327590942,
"epoch": 0.5626081938834391,
"grad_norm": 0.7578125,
"learning_rate": 0.0004977322984570688,
"loss": 6.3885,
"mean_token_accuracy": 0.15361500531435013,
"num_tokens": 12335446.0,
"step": 4875
},
{
"entropy": 6.453512048721313,
"epoch": 0.5631852279284478,
"grad_norm": 0.83984375,
"learning_rate": 0.0004977264509204296,
"loss": 6.3143,
"mean_token_accuracy": 0.1592903256416321,
"num_tokens": 12348677.0,
"step": 4880
},
{
"entropy": 6.4898766040802,
"epoch": 0.5637622619734565,
"grad_norm": 0.77734375,
"learning_rate": 0.0004977205958924967,
"loss": 6.3472,
"mean_token_accuracy": 0.16099169105291367,
"num_tokens": 12360934.0,
"step": 4885
},
{
"entropy": 6.5359296798706055,
"epoch": 0.5643392960184651,
"grad_norm": 0.84375,
"learning_rate": 0.0004977147333734673,
"loss": 6.4269,
"mean_token_accuracy": 0.156376850605011,
"num_tokens": 12373538.0,
"step": 4890
},
{
"entropy": 6.398646211624145,
"epoch": 0.5649163300634737,
"grad_norm": 0.80078125,
"learning_rate": 0.0004977088633635385,
"loss": 6.332,
"mean_token_accuracy": 0.15687417089939118,
"num_tokens": 12385291.0,
"step": 4895
},
{
"entropy": 6.582235097885132,
"epoch": 0.5654933641084824,
"grad_norm": 0.89453125,
"learning_rate": 0.0004977029858629076,
"loss": 6.3601,
"mean_token_accuracy": 0.15636546015739441,
"num_tokens": 12398324.0,
"step": 4900
},
{
"entropy": 6.457294559478759,
"epoch": 0.566070398153491,
"grad_norm": 0.83984375,
"learning_rate": 0.0004976971008717726,
"loss": 6.3267,
"mean_token_accuracy": 0.15693403780460358,
"num_tokens": 12409807.0,
"step": 4905
},
{
"entropy": 6.483905696868897,
"epoch": 0.5666474321984997,
"grad_norm": 0.859375,
"learning_rate": 0.0004976912083903309,
"loss": 6.4167,
"mean_token_accuracy": 0.1543364331126213,
"num_tokens": 12422658.0,
"step": 4910
},
{
"entropy": 6.564264154434204,
"epoch": 0.5672244662435084,
"grad_norm": 0.78515625,
"learning_rate": 0.0004976853084187814,
"loss": 6.335,
"mean_token_accuracy": 0.15391853898763658,
"num_tokens": 12435912.0,
"step": 4915
},
{
"entropy": 6.4374730587005615,
"epoch": 0.5678015002885171,
"grad_norm": 0.8046875,
"learning_rate": 0.0004976794009573219,
"loss": 6.3374,
"mean_token_accuracy": 0.16345978677272796,
"num_tokens": 12448382.0,
"step": 4920
},
{
"entropy": 6.52530608177185,
"epoch": 0.5683785343335257,
"grad_norm": 0.78125,
"learning_rate": 0.0004976734860061515,
"loss": 6.4579,
"mean_token_accuracy": 0.1543452709913254,
"num_tokens": 12461355.0,
"step": 4925
},
{
"entropy": 6.517202425003052,
"epoch": 0.5689555683785343,
"grad_norm": 0.92578125,
"learning_rate": 0.0004976675635654688,
"loss": 6.2824,
"mean_token_accuracy": 0.16503604203462602,
"num_tokens": 12473931.0,
"step": 4930
},
{
"entropy": 6.439925289154052,
"epoch": 0.569532602423543,
"grad_norm": 0.83203125,
"learning_rate": 0.0004976616336354733,
"loss": 6.336,
"mean_token_accuracy": 0.16363679096102715,
"num_tokens": 12486130.0,
"step": 4935
},
{
"entropy": 6.407979440689087,
"epoch": 0.5701096364685516,
"grad_norm": 0.8359375,
"learning_rate": 0.0004976556962163645,
"loss": 6.2576,
"mean_token_accuracy": 0.16573751717805862,
"num_tokens": 12499336.0,
"step": 4940
},
{
"entropy": 6.503925704956055,
"epoch": 0.5706866705135603,
"grad_norm": 0.8203125,
"learning_rate": 0.0004976497513083419,
"loss": 6.2713,
"mean_token_accuracy": 0.16759575754404069,
"num_tokens": 12512875.0,
"step": 4945
},
{
"entropy": 6.4720992088317875,
"epoch": 0.571263704558569,
"grad_norm": 0.828125,
"learning_rate": 0.0004976437989116055,
"loss": 6.3864,
"mean_token_accuracy": 0.15907713323831557,
"num_tokens": 12524985.0,
"step": 4950
},
{
"entropy": 6.469041061401367,
"epoch": 0.5718407386035776,
"grad_norm": 0.83984375,
"learning_rate": 0.0004976378390263554,
"loss": 6.3316,
"mean_token_accuracy": 0.16550833880901336,
"num_tokens": 12538244.0,
"step": 4955
},
{
"entropy": 6.539459848403931,
"epoch": 0.5724177726485863,
"grad_norm": 0.8359375,
"learning_rate": 0.0004976318716527924,
"loss": 6.3286,
"mean_token_accuracy": 0.16238382309675217,
"num_tokens": 12550769.0,
"step": 4960
},
{
"entropy": 6.3982970237731935,
"epoch": 0.5729948066935949,
"grad_norm": 0.828125,
"learning_rate": 0.0004976258967911168,
"loss": 6.3497,
"mean_token_accuracy": 0.16136492043733597,
"num_tokens": 12563294.0,
"step": 4965
},
{
"entropy": 6.467198228836059,
"epoch": 0.5735718407386036,
"grad_norm": 0.78515625,
"learning_rate": 0.0004976199144415298,
"loss": 6.3404,
"mean_token_accuracy": 0.1579903855919838,
"num_tokens": 12575857.0,
"step": 4970
},
{
"entropy": 6.509387397766114,
"epoch": 0.5741488747836122,
"grad_norm": 0.9453125,
"learning_rate": 0.0004976139246042325,
"loss": 6.2934,
"mean_token_accuracy": 0.16424267292022704,
"num_tokens": 12589881.0,
"step": 4975
},
{
"entropy": 6.504959058761597,
"epoch": 0.5747259088286208,
"grad_norm": 0.9765625,
"learning_rate": 0.0004976079272794265,
"loss": 6.3632,
"mean_token_accuracy": 0.15701202750205995,
"num_tokens": 12604100.0,
"step": 4980
},
{
"entropy": 6.4913969993591305,
"epoch": 0.5753029428736296,
"grad_norm": 0.84375,
"learning_rate": 0.0004976019224673134,
"loss": 6.3798,
"mean_token_accuracy": 0.1594866156578064,
"num_tokens": 12616643.0,
"step": 4985
},
{
"entropy": 6.417438554763794,
"epoch": 0.5758799769186382,
"grad_norm": 0.87109375,
"learning_rate": 0.0004975959101680953,
"loss": 6.3119,
"mean_token_accuracy": 0.16797322630882264,
"num_tokens": 12627676.0,
"step": 4990
},
{
"entropy": 6.41131820678711,
"epoch": 0.5764570109636469,
"grad_norm": 1.0703125,
"learning_rate": 0.0004975898903819742,
"loss": 6.2615,
"mean_token_accuracy": 0.16815593391656875,
"num_tokens": 12639352.0,
"step": 4995
},
{
"entropy": 6.454370927810669,
"epoch": 0.5770340450086555,
"grad_norm": 0.8046875,
"learning_rate": 0.0004975838631091527,
"loss": 6.2447,
"mean_token_accuracy": 0.1643560364842415,
"num_tokens": 12652102.0,
"step": 5000
},
{
"entropy": 6.509260559082032,
"epoch": 0.5776110790536642,
"grad_norm": 0.859375,
"learning_rate": 0.0004975778283498336,
"loss": 6.3592,
"mean_token_accuracy": 0.1578929305076599,
"num_tokens": 12665084.0,
"step": 5005
},
{
"entropy": 6.360739755630493,
"epoch": 0.5781881130986728,
"grad_norm": 0.7578125,
"learning_rate": 0.0004975717861042198,
"loss": 6.2652,
"mean_token_accuracy": 0.16091600209474563,
"num_tokens": 12677512.0,
"step": 5010
},
{
"entropy": 6.524038887023925,
"epoch": 0.5787651471436814,
"grad_norm": 0.8046875,
"learning_rate": 0.0004975657363725146,
"loss": 6.3909,
"mean_token_accuracy": 0.1512112334370613,
"num_tokens": 12690488.0,
"step": 5015
},
{
"entropy": 6.54783821105957,
"epoch": 0.5793421811886902,
"grad_norm": 0.8359375,
"learning_rate": 0.0004975596791549213,
"loss": 6.3248,
"mean_token_accuracy": 0.15481803715229034,
"num_tokens": 12703830.0,
"step": 5020
},
{
"entropy": 6.459069347381591,
"epoch": 0.5799192152336988,
"grad_norm": 0.8046875,
"learning_rate": 0.0004975536144516437,
"loss": 6.3317,
"mean_token_accuracy": 0.16206814646720885,
"num_tokens": 12716020.0,
"step": 5025
},
{
"entropy": 6.49042387008667,
"epoch": 0.5804962492787075,
"grad_norm": 0.8671875,
"learning_rate": 0.000497547542262886,
"loss": 6.3974,
"mean_token_accuracy": 0.15198142379522322,
"num_tokens": 12728989.0,
"step": 5030
},
{
"entropy": 6.5610472679138185,
"epoch": 0.5810732833237161,
"grad_norm": 0.828125,
"learning_rate": 0.0004975414625888521,
"loss": 6.2683,
"mean_token_accuracy": 0.1594917967915535,
"num_tokens": 12741090.0,
"step": 5035
},
{
"entropy": 6.464597845077515,
"epoch": 0.5816503173687247,
"grad_norm": 0.86328125,
"learning_rate": 0.0004975353754297468,
"loss": 6.3082,
"mean_token_accuracy": 0.16099455803632737,
"num_tokens": 12754176.0,
"step": 5040
},
{
"entropy": 6.39254412651062,
"epoch": 0.5822273514137334,
"grad_norm": 0.890625,
"learning_rate": 0.0004975292807857745,
"loss": 6.2864,
"mean_token_accuracy": 0.15810506939888,
"num_tokens": 12766149.0,
"step": 5045
},
{
"entropy": 6.485265731811523,
"epoch": 0.582804385458742,
"grad_norm": 0.890625,
"learning_rate": 0.0004975231786571406,
"loss": 6.3554,
"mean_token_accuracy": 0.16003530323505402,
"num_tokens": 12778337.0,
"step": 5050
},
{
"entropy": 6.46652660369873,
"epoch": 0.5833814195037508,
"grad_norm": 0.8359375,
"learning_rate": 0.0004975170690440499,
"loss": 6.2617,
"mean_token_accuracy": 0.16169480085372925,
"num_tokens": 12790146.0,
"step": 5055
},
{
"entropy": 6.452705526351929,
"epoch": 0.5839584535487594,
"grad_norm": 0.859375,
"learning_rate": 0.0004975109519467083,
"loss": 6.249,
"mean_token_accuracy": 0.16325473338365554,
"num_tokens": 12802821.0,
"step": 5060
},
{
"entropy": 6.394228124618531,
"epoch": 0.584535487593768,
"grad_norm": 0.86328125,
"learning_rate": 0.0004975048273653212,
"loss": 6.397,
"mean_token_accuracy": 0.16143627166748048,
"num_tokens": 12814409.0,
"step": 5065
},
{
"entropy": 6.498150205612182,
"epoch": 0.5851125216387767,
"grad_norm": 0.80078125,
"learning_rate": 0.0004974986953000948,
"loss": 6.3009,
"mean_token_accuracy": 0.15540309697389604,
"num_tokens": 12827398.0,
"step": 5070
},
{
"entropy": 6.4518615245819095,
"epoch": 0.5856895556837853,
"grad_norm": 0.8984375,
"learning_rate": 0.0004974925557512354,
"loss": 6.2709,
"mean_token_accuracy": 0.16093710511922837,
"num_tokens": 12840378.0,
"step": 5075
},
{
"entropy": 6.448571586608887,
"epoch": 0.586266589728794,
"grad_norm": 0.8203125,
"learning_rate": 0.0004974864087189493,
"loss": 6.357,
"mean_token_accuracy": 0.16484926640987396,
"num_tokens": 12853493.0,
"step": 5080
},
{
"entropy": 6.437574625015259,
"epoch": 0.5868436237738026,
"grad_norm": 1.078125,
"learning_rate": 0.0004974802542034434,
"loss": 6.2316,
"mean_token_accuracy": 0.1698588877916336,
"num_tokens": 12865052.0,
"step": 5085
},
{
"entropy": 6.47462739944458,
"epoch": 0.5874206578188114,
"grad_norm": 0.8046875,
"learning_rate": 0.0004974740922049246,
"loss": 6.3696,
"mean_token_accuracy": 0.15433994829654693,
"num_tokens": 12878095.0,
"step": 5090
},
{
"entropy": 6.512469148635864,
"epoch": 0.58799769186382,
"grad_norm": 0.87890625,
"learning_rate": 0.0004974679227236004,
"loss": 6.2207,
"mean_token_accuracy": 0.17119740098714828,
"num_tokens": 12890855.0,
"step": 5095
},
{
"entropy": 6.409336709976197,
"epoch": 0.5885747259088286,
"grad_norm": 0.828125,
"learning_rate": 0.0004974617457596779,
"loss": 6.2785,
"mean_token_accuracy": 0.1650840535759926,
"num_tokens": 12903833.0,
"step": 5100
},
{
"entropy": 6.506627464294434,
"epoch": 0.5891517599538373,
"grad_norm": 0.796875,
"learning_rate": 0.0004974555613133652,
"loss": 6.4079,
"mean_token_accuracy": 0.15667158514261245,
"num_tokens": 12917579.0,
"step": 5105
},
{
"entropy": 6.480052518844604,
"epoch": 0.5897287939988459,
"grad_norm": 0.83203125,
"learning_rate": 0.0004974493693848702,
"loss": 6.3818,
"mean_token_accuracy": 0.1637255698442459,
"num_tokens": 12929718.0,
"step": 5110
},
{
"entropy": 6.324490737915039,
"epoch": 0.5903058280438546,
"grad_norm": 0.8203125,
"learning_rate": 0.0004974431699744011,
"loss": 6.221,
"mean_token_accuracy": 0.16753413528203964,
"num_tokens": 12943031.0,
"step": 5115
},
{
"entropy": 6.465872192382813,
"epoch": 0.5908828620888632,
"grad_norm": 0.80859375,
"learning_rate": 0.0004974369630821665,
"loss": 6.3385,
"mean_token_accuracy": 0.1643362522125244,
"num_tokens": 12954843.0,
"step": 5120
},
{
"entropy": 6.429745864868164,
"epoch": 0.5914598961338718,
"grad_norm": 0.84765625,
"learning_rate": 0.0004974307487083752,
"loss": 6.3302,
"mean_token_accuracy": 0.16157597452402114,
"num_tokens": 12966915.0,
"step": 5125
},
{
"entropy": 6.483998966217041,
"epoch": 0.5920369301788806,
"grad_norm": 0.7734375,
"learning_rate": 0.0004974245268532361,
"loss": 6.3713,
"mean_token_accuracy": 0.1558799222111702,
"num_tokens": 12979941.0,
"step": 5130
},
{
"entropy": 6.499818563461304,
"epoch": 0.5926139642238892,
"grad_norm": 0.97265625,
"learning_rate": 0.0004974182975169585,
"loss": 6.2561,
"mean_token_accuracy": 0.16042693704366684,
"num_tokens": 12992836.0,
"step": 5135
},
{
"entropy": 6.474150991439819,
"epoch": 0.5931909982688979,
"grad_norm": 0.87890625,
"learning_rate": 0.000497412060699752,
"loss": 6.3075,
"mean_token_accuracy": 0.16249936521053315,
"num_tokens": 13005246.0,
"step": 5140
},
{
"entropy": 6.422859621047974,
"epoch": 0.5937680323139065,
"grad_norm": 0.88671875,
"learning_rate": 0.0004974058164018263,
"loss": 6.2729,
"mean_token_accuracy": 0.159485824406147,
"num_tokens": 13016842.0,
"step": 5145
},
{
"entropy": 6.379044771194458,
"epoch": 0.5943450663589152,
"grad_norm": 0.87109375,
"learning_rate": 0.0004973995646233914,
"loss": 6.277,
"mean_token_accuracy": 0.16455476433038713,
"num_tokens": 13028388.0,
"step": 5150
},
{
"entropy": 6.483341646194458,
"epoch": 0.5949221004039238,
"grad_norm": 0.8046875,
"learning_rate": 0.0004973933053646576,
"loss": 6.2963,
"mean_token_accuracy": 0.16036218404769897,
"num_tokens": 13041895.0,
"step": 5155
},
{
"entropy": 6.4746462345123295,
"epoch": 0.5954991344489324,
"grad_norm": 0.82421875,
"learning_rate": 0.0004973870386258355,
"loss": 6.3554,
"mean_token_accuracy": 0.16368395537137986,
"num_tokens": 13055984.0,
"step": 5160
},
{
"entropy": 6.484179830551147,
"epoch": 0.5960761684939412,
"grad_norm": 0.96875,
"learning_rate": 0.0004973807644071357,
"loss": 6.303,
"mean_token_accuracy": 0.16322016417980195,
"num_tokens": 13068735.0,
"step": 5165
},
{
"entropy": 6.49740834236145,
"epoch": 0.5966532025389498,
"grad_norm": 0.765625,
"learning_rate": 0.0004973744827087695,
"loss": 6.3685,
"mean_token_accuracy": 0.160064959526062,
"num_tokens": 13081564.0,
"step": 5170
},
{
"entropy": 6.477915859222412,
"epoch": 0.5972302365839585,
"grad_norm": 0.85546875,
"learning_rate": 0.000497368193530948,
"loss": 6.2975,
"mean_token_accuracy": 0.16501372158527375,
"num_tokens": 13094146.0,
"step": 5175
},
{
"entropy": 6.37415885925293,
"epoch": 0.5978072706289671,
"grad_norm": 0.8046875,
"learning_rate": 0.0004973618968738828,
"loss": 6.2557,
"mean_token_accuracy": 0.16740904450416566,
"num_tokens": 13106753.0,
"step": 5180
},
{
"entropy": 6.414618730545044,
"epoch": 0.5983843046739757,
"grad_norm": 0.7890625,
"learning_rate": 0.0004973555927377856,
"loss": 6.217,
"mean_token_accuracy": 0.17282827198505402,
"num_tokens": 13118645.0,
"step": 5185
},
{
"entropy": 6.46846227645874,
"epoch": 0.5989613387189844,
"grad_norm": 0.796875,
"learning_rate": 0.0004973492811228685,
"loss": 6.344,
"mean_token_accuracy": 0.16316265612840652,
"num_tokens": 13132250.0,
"step": 5190
},
{
"entropy": 6.466949081420898,
"epoch": 0.599538372763993,
"grad_norm": 0.859375,
"learning_rate": 0.0004973429620293438,
"loss": 6.3362,
"mean_token_accuracy": 0.15950386077165604,
"num_tokens": 13145069.0,
"step": 5195
},
{
"entropy": 6.456646823883057,
"epoch": 0.6001154068090018,
"grad_norm": 0.7890625,
"learning_rate": 0.0004973366354574239,
"loss": 6.3034,
"mean_token_accuracy": 0.16648412495851517,
"num_tokens": 13158244.0,
"step": 5200
},
{
"entropy": 6.455355453491211,
"epoch": 0.6006924408540104,
"grad_norm": 0.83203125,
"learning_rate": 0.0004973303014073219,
"loss": 6.3623,
"mean_token_accuracy": 0.15627395808696748,
"num_tokens": 13171810.0,
"step": 5205
},
{
"entropy": 6.448964262008667,
"epoch": 0.601269474899019,
"grad_norm": 0.83203125,
"learning_rate": 0.0004973239598792504,
"loss": 6.1955,
"mean_token_accuracy": 0.1658018559217453,
"num_tokens": 13184448.0,
"step": 5210
},
{
"entropy": 6.448535013198852,
"epoch": 0.6018465089440277,
"grad_norm": 0.83984375,
"learning_rate": 0.0004973176108734232,
"loss": 6.3448,
"mean_token_accuracy": 0.15199785232543944,
"num_tokens": 13198350.0,
"step": 5215
},
{
"entropy": 6.465864801406861,
"epoch": 0.6024235429890363,
"grad_norm": 0.8203125,
"learning_rate": 0.0004973112543900535,
"loss": 6.2841,
"mean_token_accuracy": 0.16358843743801116,
"num_tokens": 13210660.0,
"step": 5220
},
{
"entropy": 6.406602478027343,
"epoch": 0.603000577034045,
"grad_norm": 0.890625,
"learning_rate": 0.0004973048904293551,
"loss": 6.2393,
"mean_token_accuracy": 0.1710536241531372,
"num_tokens": 13222991.0,
"step": 5225
},
{
"entropy": 6.444959449768066,
"epoch": 0.6035776110790536,
"grad_norm": 1.0625,
"learning_rate": 0.0004972985189915422,
"loss": 6.3254,
"mean_token_accuracy": 0.16002852469682693,
"num_tokens": 13237693.0,
"step": 5230
},
{
"entropy": 6.444726753234863,
"epoch": 0.6041546451240624,
"grad_norm": 0.8046875,
"learning_rate": 0.000497292140076829,
"loss": 6.3317,
"mean_token_accuracy": 0.1622207522392273,
"num_tokens": 13249843.0,
"step": 5235
},
{
"entropy": 6.439457941055298,
"epoch": 0.604731679169071,
"grad_norm": 0.81640625,
"learning_rate": 0.0004972857536854301,
"loss": 6.3119,
"mean_token_accuracy": 0.16525271087884902,
"num_tokens": 13262185.0,
"step": 5240
},
{
"entropy": 6.4337084770202635,
"epoch": 0.6053087132140796,
"grad_norm": 0.796875,
"learning_rate": 0.0004972793598175603,
"loss": 6.3505,
"mean_token_accuracy": 0.15734633207321166,
"num_tokens": 13275344.0,
"step": 5245
},
{
"entropy": 6.473100423812866,
"epoch": 0.6058857472590883,
"grad_norm": 0.8515625,
"learning_rate": 0.0004972729584734347,
"loss": 6.2688,
"mean_token_accuracy": 0.15891817957162857,
"num_tokens": 13287741.0,
"step": 5250
},
{
"entropy": 6.470854473114014,
"epoch": 0.6064627813040969,
"grad_norm": 0.8203125,
"learning_rate": 0.0004972665496532685,
"loss": 6.2701,
"mean_token_accuracy": 0.16430861055850982,
"num_tokens": 13299918.0,
"step": 5255
},
{
"entropy": 6.368015956878662,
"epoch": 0.6070398153491056,
"grad_norm": 0.7890625,
"learning_rate": 0.0004972601333572774,
"loss": 6.2533,
"mean_token_accuracy": 0.15958417505025863,
"num_tokens": 13312765.0,
"step": 5260
},
{
"entropy": 6.462191009521485,
"epoch": 0.6076168493941142,
"grad_norm": 0.8359375,
"learning_rate": 0.0004972537095856769,
"loss": 6.2398,
"mean_token_accuracy": 0.16111138761043547,
"num_tokens": 13325324.0,
"step": 5265
},
{
"entropy": 6.485791730880737,
"epoch": 0.608193883439123,
"grad_norm": 0.8671875,
"learning_rate": 0.0004972472783386834,
"loss": 6.3451,
"mean_token_accuracy": 0.15810697078704833,
"num_tokens": 13337578.0,
"step": 5270
},
{
"entropy": 6.464807462692261,
"epoch": 0.6087709174841316,
"grad_norm": 0.8828125,
"learning_rate": 0.0004972408396165132,
"loss": 6.3088,
"mean_token_accuracy": 0.1609449043869972,
"num_tokens": 13349218.0,
"step": 5275
},
{
"entropy": 6.441641569137573,
"epoch": 0.6093479515291402,
"grad_norm": 0.9375,
"learning_rate": 0.0004972343934193826,
"loss": 6.2705,
"mean_token_accuracy": 0.1591146320104599,
"num_tokens": 13362221.0,
"step": 5280
},
{
"entropy": 6.434703302383423,
"epoch": 0.6099249855741489,
"grad_norm": 0.8828125,
"learning_rate": 0.0004972279397475086,
"loss": 6.2645,
"mean_token_accuracy": 0.17187120169401168,
"num_tokens": 13374147.0,
"step": 5285
},
{
"entropy": 6.378955316543579,
"epoch": 0.6105020196191575,
"grad_norm": 0.7890625,
"learning_rate": 0.0004972214786011083,
"loss": 6.2197,
"mean_token_accuracy": 0.16266336888074875,
"num_tokens": 13386077.0,
"step": 5290
},
{
"entropy": 6.500459098815918,
"epoch": 0.6110790536641661,
"grad_norm": 0.828125,
"learning_rate": 0.000497215009980399,
"loss": 6.297,
"mean_token_accuracy": 0.16877201348543167,
"num_tokens": 13398442.0,
"step": 5295
},
{
"entropy": 6.4331823825836185,
"epoch": 0.6116560877091748,
"grad_norm": 0.80078125,
"learning_rate": 0.000497208533885598,
"loss": 6.3029,
"mean_token_accuracy": 0.16564711034297944,
"num_tokens": 13411249.0,
"step": 5300
},
{
"entropy": 6.43955626487732,
"epoch": 0.6122331217541835,
"grad_norm": 0.79296875,
"learning_rate": 0.0004972020503169235,
"loss": 6.2878,
"mean_token_accuracy": 0.16612933129072188,
"num_tokens": 13424518.0,
"step": 5305
},
{
"entropy": 6.467305707931518,
"epoch": 0.6128101557991922,
"grad_norm": 0.8828125,
"learning_rate": 0.0004971955592745934,
"loss": 6.3069,
"mean_token_accuracy": 0.1545131728053093,
"num_tokens": 13438530.0,
"step": 5310
},
{
"entropy": 6.410894584655762,
"epoch": 0.6133871898442008,
"grad_norm": 0.80859375,
"learning_rate": 0.000497189060758826,
"loss": 6.2452,
"mean_token_accuracy": 0.16825231909751892,
"num_tokens": 13451154.0,
"step": 5315
},
{
"entropy": 6.409408855438232,
"epoch": 0.6139642238892095,
"grad_norm": 0.890625,
"learning_rate": 0.00049718255476984,
"loss": 6.2859,
"mean_token_accuracy": 0.16544894725084305,
"num_tokens": 13461938.0,
"step": 5320
},
{
"entropy": 6.377069711685181,
"epoch": 0.6145412579342181,
"grad_norm": 0.76953125,
"learning_rate": 0.0004971760413078539,
"loss": 6.2693,
"mean_token_accuracy": 0.1646272733807564,
"num_tokens": 13474423.0,
"step": 5325
},
{
"entropy": 6.502867031097412,
"epoch": 0.6151182919792267,
"grad_norm": 0.828125,
"learning_rate": 0.0004971695203730872,
"loss": 6.2578,
"mean_token_accuracy": 0.17385480105876921,
"num_tokens": 13486882.0,
"step": 5330
},
{
"entropy": 6.399074077606201,
"epoch": 0.6156953260242354,
"grad_norm": 0.78515625,
"learning_rate": 0.000497162991965759,
"loss": 6.2091,
"mean_token_accuracy": 0.16568703651428224,
"num_tokens": 13499692.0,
"step": 5335
},
{
"entropy": 6.454089546203614,
"epoch": 0.6162723600692441,
"grad_norm": 0.7734375,
"learning_rate": 0.0004971564560860889,
"loss": 6.2921,
"mean_token_accuracy": 0.1587091013789177,
"num_tokens": 13512995.0,
"step": 5340
},
{
"entropy": 6.335466384887695,
"epoch": 0.6168493941142528,
"grad_norm": 0.80859375,
"learning_rate": 0.0004971499127342968,
"loss": 6.1969,
"mean_token_accuracy": 0.1680700197815895,
"num_tokens": 13525804.0,
"step": 5345
},
{
"entropy": 6.4052308082580565,
"epoch": 0.6174264281592614,
"grad_norm": 0.859375,
"learning_rate": 0.0004971433619106027,
"loss": 6.3092,
"mean_token_accuracy": 0.16079850047826766,
"num_tokens": 13537807.0,
"step": 5350
},
{
"entropy": 6.485114002227784,
"epoch": 0.61800346220427,
"grad_norm": 0.82421875,
"learning_rate": 0.000497136803615227,
"loss": 6.3762,
"mean_token_accuracy": 0.1530951127409935,
"num_tokens": 13550765.0,
"step": 5355
},
{
"entropy": 6.4439774513244625,
"epoch": 0.6185804962492787,
"grad_norm": 0.78515625,
"learning_rate": 0.0004971302378483902,
"loss": 6.2689,
"mean_token_accuracy": 0.165410552918911,
"num_tokens": 13565084.0,
"step": 5360
},
{
"entropy": 6.476373338699341,
"epoch": 0.6191575302942873,
"grad_norm": 0.77734375,
"learning_rate": 0.0004971236646103132,
"loss": 6.2655,
"mean_token_accuracy": 0.16471700817346574,
"num_tokens": 13578851.0,
"step": 5365
},
{
"entropy": 6.406863832473755,
"epoch": 0.619734564339296,
"grad_norm": 0.8515625,
"learning_rate": 0.0004971170839012171,
"loss": 6.1939,
"mean_token_accuracy": 0.17038790881633759,
"num_tokens": 13589984.0,
"step": 5370
},
{
"entropy": 6.3514081001281735,
"epoch": 0.6203115983843047,
"grad_norm": 0.796875,
"learning_rate": 0.0004971104957213233,
"loss": 6.2624,
"mean_token_accuracy": 0.16135939061641694,
"num_tokens": 13602899.0,
"step": 5375
},
{
"entropy": 6.490747451782227,
"epoch": 0.6208886324293134,
"grad_norm": 1.140625,
"learning_rate": 0.0004971039000708531,
"loss": 6.418,
"mean_token_accuracy": 0.1528172329068184,
"num_tokens": 13617672.0,
"step": 5380
},
{
"entropy": 6.473091506958008,
"epoch": 0.621465666474322,
"grad_norm": 0.77734375,
"learning_rate": 0.0004970972969500286,
"loss": 6.2773,
"mean_token_accuracy": 0.1603806808590889,
"num_tokens": 13630029.0,
"step": 5385
},
{
"entropy": 6.401896953582764,
"epoch": 0.6220427005193306,
"grad_norm": 0.83984375,
"learning_rate": 0.000497090686359072,
"loss": 6.2523,
"mean_token_accuracy": 0.1648557275533676,
"num_tokens": 13643091.0,
"step": 5390
},
{
"entropy": 6.350330066680908,
"epoch": 0.6226197345643393,
"grad_norm": 1.1796875,
"learning_rate": 0.0004970840682982054,
"loss": 6.1293,
"mean_token_accuracy": 0.17030057311058044,
"num_tokens": 13654790.0,
"step": 5395
},
{
"entropy": 6.439556312561035,
"epoch": 0.6231967686093479,
"grad_norm": 0.8359375,
"learning_rate": 0.0004970774427676514,
"loss": 6.2464,
"mean_token_accuracy": 0.16800362020730972,
"num_tokens": 13667425.0,
"step": 5400
},
{
"entropy": 6.429106521606445,
"epoch": 0.6237738026543566,
"grad_norm": 0.85546875,
"learning_rate": 0.000497070809767633,
"loss": 6.3099,
"mean_token_accuracy": 0.16256403923034668,
"num_tokens": 13680199.0,
"step": 5405
},
{
"entropy": 6.471726417541504,
"epoch": 0.6243508366993653,
"grad_norm": 0.7890625,
"learning_rate": 0.0004970641692983731,
"loss": 6.3267,
"mean_token_accuracy": 0.16009956300258638,
"num_tokens": 13693613.0,
"step": 5410
},
{
"entropy": 6.32947187423706,
"epoch": 0.624927870744374,
"grad_norm": 0.8359375,
"learning_rate": 0.0004970575213600954,
"loss": 6.2661,
"mean_token_accuracy": 0.160757178068161,
"num_tokens": 13706809.0,
"step": 5415
},
{
"entropy": 6.40821270942688,
"epoch": 0.6255049047893826,
"grad_norm": 0.9140625,
"learning_rate": 0.0004970508659530231,
"loss": 6.2302,
"mean_token_accuracy": 0.16359151303768157,
"num_tokens": 13718976.0,
"step": 5420
},
{
"entropy": 6.440737009048462,
"epoch": 0.6260819388343912,
"grad_norm": 0.81640625,
"learning_rate": 0.0004970442030773802,
"loss": 6.2155,
"mean_token_accuracy": 0.1657729595899582,
"num_tokens": 13731037.0,
"step": 5425
},
{
"entropy": 6.358583593368531,
"epoch": 0.6266589728793999,
"grad_norm": 0.93359375,
"learning_rate": 0.0004970375327333909,
"loss": 6.2887,
"mean_token_accuracy": 0.16418557167053222,
"num_tokens": 13743816.0,
"step": 5430
},
{
"entropy": 6.3964362144470215,
"epoch": 0.6272360069244085,
"grad_norm": 0.75390625,
"learning_rate": 0.0004970308549212796,
"loss": 6.282,
"mean_token_accuracy": 0.16759266555309296,
"num_tokens": 13757165.0,
"step": 5435
},
{
"entropy": 6.450726795196533,
"epoch": 0.6278130409694171,
"grad_norm": 0.80078125,
"learning_rate": 0.0004970241696412705,
"loss": 6.2452,
"mean_token_accuracy": 0.17060438096523284,
"num_tokens": 13769982.0,
"step": 5440
},
{
"entropy": 6.434137296676636,
"epoch": 0.6283900750144259,
"grad_norm": 0.86328125,
"learning_rate": 0.000497017476893589,
"loss": 6.272,
"mean_token_accuracy": 0.16804485619068146,
"num_tokens": 13782922.0,
"step": 5445
},
{
"entropy": 6.38315167427063,
"epoch": 0.6289671090594345,
"grad_norm": 0.7890625,
"learning_rate": 0.0004970107766784598,
"loss": 6.2659,
"mean_token_accuracy": 0.1645989775657654,
"num_tokens": 13795683.0,
"step": 5450
},
{
"entropy": 6.467908000946045,
"epoch": 0.6295441431044432,
"grad_norm": 0.95703125,
"learning_rate": 0.0004970040689961084,
"loss": 6.3515,
"mean_token_accuracy": 0.16600358933210374,
"num_tokens": 13808332.0,
"step": 5455
},
{
"entropy": 6.430469560623169,
"epoch": 0.6301211771494518,
"grad_norm": 0.7890625,
"learning_rate": 0.0004969973538467605,
"loss": 6.3109,
"mean_token_accuracy": 0.16642144173383713,
"num_tokens": 13820949.0,
"step": 5460
},
{
"entropy": 6.349089574813843,
"epoch": 0.6306982111944605,
"grad_norm": 0.875,
"learning_rate": 0.0004969906312306419,
"loss": 6.2808,
"mean_token_accuracy": 0.16602863222360612,
"num_tokens": 13833623.0,
"step": 5465
},
{
"entropy": 6.47224531173706,
"epoch": 0.6312752452394691,
"grad_norm": 0.875,
"learning_rate": 0.0004969839011479786,
"loss": 6.2311,
"mean_token_accuracy": 0.17260048240423204,
"num_tokens": 13844368.0,
"step": 5470
},
{
"entropy": 6.46555233001709,
"epoch": 0.6318522792844777,
"grad_norm": 0.9140625,
"learning_rate": 0.000496977163598997,
"loss": 6.2693,
"mean_token_accuracy": 0.16359723955392838,
"num_tokens": 13857261.0,
"step": 5475
},
{
"entropy": 6.241572618484497,
"epoch": 0.6324293133294865,
"grad_norm": 0.84765625,
"learning_rate": 0.0004969704185839239,
"loss": 6.1323,
"mean_token_accuracy": 0.16393650248646735,
"num_tokens": 13869438.0,
"step": 5480
},
{
"entropy": 6.454886245727539,
"epoch": 0.6330063473744951,
"grad_norm": 0.8515625,
"learning_rate": 0.0004969636661029859,
"loss": 6.3533,
"mean_token_accuracy": 0.15374770537018775,
"num_tokens": 13883353.0,
"step": 5485
},
{
"entropy": 6.484453201293945,
"epoch": 0.6335833814195038,
"grad_norm": 0.8203125,
"learning_rate": 0.0004969569061564103,
"loss": 6.2837,
"mean_token_accuracy": 0.168526728451252,
"num_tokens": 13896950.0,
"step": 5490
},
{
"entropy": 6.4666359424591064,
"epoch": 0.6341604154645124,
"grad_norm": 0.74609375,
"learning_rate": 0.0004969501387444245,
"loss": 6.2937,
"mean_token_accuracy": 0.16304062455892562,
"num_tokens": 13910447.0,
"step": 5495
},
{
"entropy": 6.418818473815918,
"epoch": 0.634737449509521,
"grad_norm": 0.8125,
"learning_rate": 0.0004969433638672559,
"loss": 6.2849,
"mean_token_accuracy": 0.17183531671762467,
"num_tokens": 13922894.0,
"step": 5500
},
{
"entropy": 6.437852239608764,
"epoch": 0.6353144835545297,
"grad_norm": 0.8359375,
"learning_rate": 0.0004969365815251325,
"loss": 6.3015,
"mean_token_accuracy": 0.16050758361816406,
"num_tokens": 13936558.0,
"step": 5505
},
{
"entropy": 6.433607149124145,
"epoch": 0.6358915175995383,
"grad_norm": 0.76953125,
"learning_rate": 0.0004969297917182825,
"loss": 6.2436,
"mean_token_accuracy": 0.16257888972759246,
"num_tokens": 13949005.0,
"step": 5510
},
{
"entropy": 6.431810188293457,
"epoch": 0.6364685516445471,
"grad_norm": 0.80859375,
"learning_rate": 0.0004969229944469342,
"loss": 6.2808,
"mean_token_accuracy": 0.15686439871788024,
"num_tokens": 13962285.0,
"step": 5515
},
{
"entropy": 6.484597444534302,
"epoch": 0.6370455856895557,
"grad_norm": 0.8046875,
"learning_rate": 0.0004969161897113162,
"loss": 6.2797,
"mean_token_accuracy": 0.16125818341970444,
"num_tokens": 13976037.0,
"step": 5520
},
{
"entropy": 6.454035043716431,
"epoch": 0.6376226197345644,
"grad_norm": 0.79296875,
"learning_rate": 0.0004969093775116574,
"loss": 6.2329,
"mean_token_accuracy": 0.16799202859401702,
"num_tokens": 13989028.0,
"step": 5525
},
{
"entropy": 6.353673887252808,
"epoch": 0.638199653779573,
"grad_norm": 0.8984375,
"learning_rate": 0.0004969025578481869,
"loss": 6.2199,
"mean_token_accuracy": 0.16663924157619475,
"num_tokens": 14001814.0,
"step": 5530
},
{
"entropy": 6.490426683425904,
"epoch": 0.6387766878245816,
"grad_norm": 0.8203125,
"learning_rate": 0.000496895730721134,
"loss": 6.3185,
"mean_token_accuracy": 0.15284908413887024,
"num_tokens": 14014305.0,
"step": 5535
},
{
"entropy": 6.4198565006256105,
"epoch": 0.6393537218695903,
"grad_norm": 0.84765625,
"learning_rate": 0.0004968888961307286,
"loss": 6.1901,
"mean_token_accuracy": 0.17025423794984818,
"num_tokens": 14027475.0,
"step": 5540
},
{
"entropy": 6.402793550491333,
"epoch": 0.6399307559145989,
"grad_norm": 0.77734375,
"learning_rate": 0.0004968820540772003,
"loss": 6.2554,
"mean_token_accuracy": 0.16645244061946868,
"num_tokens": 14041031.0,
"step": 5545
},
{
"entropy": 6.391665887832642,
"epoch": 0.6405077899596077,
"grad_norm": 0.81640625,
"learning_rate": 0.0004968752045607794,
"loss": 6.212,
"mean_token_accuracy": 0.1631389558315277,
"num_tokens": 14054138.0,
"step": 5550
},
{
"entropy": 6.474399709701538,
"epoch": 0.6410848240046163,
"grad_norm": 0.796875,
"learning_rate": 0.0004968683475816961,
"loss": 6.2339,
"mean_token_accuracy": 0.16551497131586074,
"num_tokens": 14066708.0,
"step": 5555
},
{
"entropy": 6.412665510177613,
"epoch": 0.641661858049625,
"grad_norm": 0.78515625,
"learning_rate": 0.0004968614831401811,
"loss": 6.319,
"mean_token_accuracy": 0.15504314005374908,
"num_tokens": 14080251.0,
"step": 5560
},
{
"entropy": 6.486737298965454,
"epoch": 0.6422388920946336,
"grad_norm": 0.85546875,
"learning_rate": 0.0004968546112364654,
"loss": 6.2944,
"mean_token_accuracy": 0.156815817207098,
"num_tokens": 14092622.0,
"step": 5565
},
{
"entropy": 6.457394075393677,
"epoch": 0.6428159261396422,
"grad_norm": 0.7734375,
"learning_rate": 0.00049684773187078,
"loss": 6.3607,
"mean_token_accuracy": 0.15759846270084382,
"num_tokens": 14107033.0,
"step": 5570
},
{
"entropy": 6.415627193450928,
"epoch": 0.6433929601846509,
"grad_norm": 1.0,
"learning_rate": 0.0004968408450433565,
"loss": 6.0985,
"mean_token_accuracy": 0.16721982806921004,
"num_tokens": 14119264.0,
"step": 5575
},
{
"entropy": 6.409555053710937,
"epoch": 0.6439699942296595,
"grad_norm": 0.83984375,
"learning_rate": 0.0004968339507544263,
"loss": 6.2658,
"mean_token_accuracy": 0.16522011756896973,
"num_tokens": 14131360.0,
"step": 5580
},
{
"entropy": 6.331378602981568,
"epoch": 0.6445470282746683,
"grad_norm": 0.85546875,
"learning_rate": 0.0004968270490042212,
"loss": 6.2574,
"mean_token_accuracy": 0.16861171871423722,
"num_tokens": 14143236.0,
"step": 5585
},
{
"entropy": 6.466990947723389,
"epoch": 0.6451240623196769,
"grad_norm": 0.828125,
"learning_rate": 0.0004968201397929737,
"loss": 6.2703,
"mean_token_accuracy": 0.16277870833873748,
"num_tokens": 14156470.0,
"step": 5590
},
{
"entropy": 6.471270656585693,
"epoch": 0.6457010963646855,
"grad_norm": 0.83203125,
"learning_rate": 0.0004968132231209158,
"loss": 6.3218,
"mean_token_accuracy": 0.157097789645195,
"num_tokens": 14169359.0,
"step": 5595
},
{
"entropy": 6.400879669189453,
"epoch": 0.6462781304096942,
"grad_norm": 0.84765625,
"learning_rate": 0.0004968062989882803,
"loss": 6.3446,
"mean_token_accuracy": 0.15832698345184326,
"num_tokens": 14181980.0,
"step": 5600
},
{
"entropy": 6.470687961578369,
"epoch": 0.6468551644547028,
"grad_norm": 0.87109375,
"learning_rate": 0.0004967993673953003,
"loss": 6.2859,
"mean_token_accuracy": 0.16663094758987426,
"num_tokens": 14195456.0,
"step": 5605
},
{
"entropy": 6.371501111984253,
"epoch": 0.6474321984997115,
"grad_norm": 0.8125,
"learning_rate": 0.0004967924283422087,
"loss": 6.1873,
"mean_token_accuracy": 0.1712810918688774,
"num_tokens": 14208269.0,
"step": 5610
},
{
"entropy": 6.420989894866944,
"epoch": 0.6480092325447201,
"grad_norm": 0.859375,
"learning_rate": 0.000496785481829239,
"loss": 6.302,
"mean_token_accuracy": 0.16031478866934776,
"num_tokens": 14221474.0,
"step": 5615
},
{
"entropy": 6.473630666732788,
"epoch": 0.6485862665897288,
"grad_norm": 0.9140625,
"learning_rate": 0.0004967785278566245,
"loss": 6.2696,
"mean_token_accuracy": 0.16501279324293136,
"num_tokens": 14234185.0,
"step": 5620
},
{
"entropy": 6.3897919178009035,
"epoch": 0.6491633006347375,
"grad_norm": 0.84375,
"learning_rate": 0.0004967715664245997,
"loss": 6.238,
"mean_token_accuracy": 0.1660897359251976,
"num_tokens": 14246853.0,
"step": 5625
},
{
"entropy": 6.398458003997803,
"epoch": 0.6497403346797461,
"grad_norm": 0.80078125,
"learning_rate": 0.0004967645975333983,
"loss": 6.3224,
"mean_token_accuracy": 0.16524122506380082,
"num_tokens": 14260047.0,
"step": 5630
},
{
"entropy": 6.4040333271026615,
"epoch": 0.6503173687247548,
"grad_norm": 0.91015625,
"learning_rate": 0.0004967576211832548,
"loss": 6.1934,
"mean_token_accuracy": 0.1748912051320076,
"num_tokens": 14273478.0,
"step": 5635
},
{
"entropy": 6.471810722351075,
"epoch": 0.6508944027697634,
"grad_norm": 0.7890625,
"learning_rate": 0.0004967506373744039,
"loss": 6.2874,
"mean_token_accuracy": 0.15878912657499314,
"num_tokens": 14286085.0,
"step": 5640
},
{
"entropy": 6.379119968414306,
"epoch": 0.651471436814772,
"grad_norm": 1.1796875,
"learning_rate": 0.0004967436461070805,
"loss": 6.2396,
"mean_token_accuracy": 0.1718211367726326,
"num_tokens": 14299472.0,
"step": 5645
},
{
"entropy": 6.398261547088623,
"epoch": 0.6520484708597807,
"grad_norm": 0.7421875,
"learning_rate": 0.0004967366473815196,
"loss": 6.2043,
"mean_token_accuracy": 0.16658677011728287,
"num_tokens": 14312624.0,
"step": 5650
},
{
"entropy": 6.396186256408692,
"epoch": 0.6526255049047894,
"grad_norm": 0.8125,
"learning_rate": 0.0004967296411979568,
"loss": 6.1951,
"mean_token_accuracy": 0.17445577383041383,
"num_tokens": 14325418.0,
"step": 5655
},
{
"entropy": 6.32066240310669,
"epoch": 0.6532025389497981,
"grad_norm": 0.8203125,
"learning_rate": 0.0004967226275566275,
"loss": 6.239,
"mean_token_accuracy": 0.166211299598217,
"num_tokens": 14337360.0,
"step": 5660
},
{
"entropy": 6.44496717453003,
"epoch": 0.6537795729948067,
"grad_norm": 0.85546875,
"learning_rate": 0.000496715606457768,
"loss": 6.222,
"mean_token_accuracy": 0.16578047275543212,
"num_tokens": 14349119.0,
"step": 5665
},
{
"entropy": 6.448485326766968,
"epoch": 0.6543566070398154,
"grad_norm": 0.84765625,
"learning_rate": 0.0004967085779016142,
"loss": 6.2683,
"mean_token_accuracy": 0.17126621007919313,
"num_tokens": 14361760.0,
"step": 5670
},
{
"entropy": 6.330710077285767,
"epoch": 0.654933641084824,
"grad_norm": 0.82421875,
"learning_rate": 0.0004967015418884022,
"loss": 6.2345,
"mean_token_accuracy": 0.16232049018144606,
"num_tokens": 14374725.0,
"step": 5675
},
{
"entropy": 6.394761943817139,
"epoch": 0.6555106751298326,
"grad_norm": 0.84375,
"learning_rate": 0.0004966944984183692,
"loss": 6.1996,
"mean_token_accuracy": 0.16768215894699096,
"num_tokens": 14387267.0,
"step": 5680
},
{
"entropy": 6.432275915145874,
"epoch": 0.6560877091748413,
"grad_norm": 0.8046875,
"learning_rate": 0.0004966874474917518,
"loss": 6.2603,
"mean_token_accuracy": 0.1640935719013214,
"num_tokens": 14400531.0,
"step": 5685
},
{
"entropy": 6.437908411026001,
"epoch": 0.65666474321985,
"grad_norm": 0.859375,
"learning_rate": 0.0004966803891087873,
"loss": 6.2716,
"mean_token_accuracy": 0.15894663482904434,
"num_tokens": 14412507.0,
"step": 5690
},
{
"entropy": 6.434341669082642,
"epoch": 0.6572417772648587,
"grad_norm": 0.83984375,
"learning_rate": 0.000496673323269713,
"loss": 6.2589,
"mean_token_accuracy": 0.16347626149654387,
"num_tokens": 14424934.0,
"step": 5695
},
{
"entropy": 6.457496786117554,
"epoch": 0.6578188113098673,
"grad_norm": 0.78515625,
"learning_rate": 0.0004966662499747666,
"loss": 6.3639,
"mean_token_accuracy": 0.15038072019815446,
"num_tokens": 14438875.0,
"step": 5700
},
{
"entropy": 6.40140323638916,
"epoch": 0.6583958453548759,
"grad_norm": 0.78515625,
"learning_rate": 0.0004966591692241859,
"loss": 6.1693,
"mean_token_accuracy": 0.1677701637148857,
"num_tokens": 14451089.0,
"step": 5705
},
{
"entropy": 6.424305438995361,
"epoch": 0.6589728793998846,
"grad_norm": 0.78125,
"learning_rate": 0.0004966520810182092,
"loss": 6.2889,
"mean_token_accuracy": 0.1674267664551735,
"num_tokens": 14463557.0,
"step": 5710
},
{
"entropy": 6.356392765045166,
"epoch": 0.6595499134448932,
"grad_norm": 0.85546875,
"learning_rate": 0.0004966449853570749,
"loss": 6.1922,
"mean_token_accuracy": 0.1630517616868019,
"num_tokens": 14475865.0,
"step": 5715
},
{
"entropy": 6.433615684509277,
"epoch": 0.6601269474899019,
"grad_norm": 0.8125,
"learning_rate": 0.0004966378822410215,
"loss": 6.2999,
"mean_token_accuracy": 0.16027793437242507,
"num_tokens": 14487534.0,
"step": 5720
},
{
"entropy": 6.4160982131958,
"epoch": 0.6607039815349106,
"grad_norm": 0.78515625,
"learning_rate": 0.0004966307716702881,
"loss": 6.2466,
"mean_token_accuracy": 0.1649463638663292,
"num_tokens": 14500006.0,
"step": 5725
},
{
"entropy": 6.478086137771607,
"epoch": 0.6612810155799193,
"grad_norm": 0.859375,
"learning_rate": 0.0004966236536451138,
"loss": 6.3556,
"mean_token_accuracy": 0.15748382806777955,
"num_tokens": 14512844.0,
"step": 5730
},
{
"entropy": 6.474676275253296,
"epoch": 0.6618580496249279,
"grad_norm": 0.8984375,
"learning_rate": 0.000496616528165738,
"loss": 6.3073,
"mean_token_accuracy": 0.15954205095767976,
"num_tokens": 14525555.0,
"step": 5735
},
{
"entropy": 6.387700939178467,
"epoch": 0.6624350836699365,
"grad_norm": 0.8671875,
"learning_rate": 0.0004966093952324003,
"loss": 6.2908,
"mean_token_accuracy": 0.15595891401171685,
"num_tokens": 14537861.0,
"step": 5740
},
{
"entropy": 6.43832688331604,
"epoch": 0.6630121177149452,
"grad_norm": 0.8359375,
"learning_rate": 0.0004966022548453406,
"loss": 6.254,
"mean_token_accuracy": 0.16284551173448564,
"num_tokens": 14550116.0,
"step": 5745
},
{
"entropy": 6.444856739044189,
"epoch": 0.6635891517599538,
"grad_norm": 0.77734375,
"learning_rate": 0.0004965951070047993,
"loss": 6.2261,
"mean_token_accuracy": 0.16848643720149994,
"num_tokens": 14561841.0,
"step": 5750
},
{
"entropy": 6.411498022079468,
"epoch": 0.6641661858049625,
"grad_norm": 0.8046875,
"learning_rate": 0.0004965879517110166,
"loss": 6.2768,
"mean_token_accuracy": 0.16119781583547593,
"num_tokens": 14574889.0,
"step": 5755
},
{
"entropy": 6.336085510253906,
"epoch": 0.6647432198499712,
"grad_norm": 0.84375,
"learning_rate": 0.0004965807889642333,
"loss": 6.2622,
"mean_token_accuracy": 0.16737145632505418,
"num_tokens": 14587032.0,
"step": 5760
},
{
"entropy": 6.412449836730957,
"epoch": 0.6653202538949798,
"grad_norm": 0.8046875,
"learning_rate": 0.00049657361876469,
"loss": 6.2303,
"mean_token_accuracy": 0.16632368713617324,
"num_tokens": 14599654.0,
"step": 5765
},
{
"entropy": 6.332269334793091,
"epoch": 0.6658972879399885,
"grad_norm": 0.85546875,
"learning_rate": 0.0004965664411126282,
"loss": 6.1506,
"mean_token_accuracy": 0.17118496000766753,
"num_tokens": 14611740.0,
"step": 5770
},
{
"entropy": 6.410775899887085,
"epoch": 0.6664743219849971,
"grad_norm": 0.70703125,
"learning_rate": 0.0004965592560082894,
"loss": 6.2481,
"mean_token_accuracy": 0.16527822315692903,
"num_tokens": 14625038.0,
"step": 5775
},
{
"entropy": 6.458446931838989,
"epoch": 0.6670513560300058,
"grad_norm": 0.796875,
"learning_rate": 0.0004965520634519149,
"loss": 6.3134,
"mean_token_accuracy": 0.15978550016880036,
"num_tokens": 14638318.0,
"step": 5780
},
{
"entropy": 6.399044179916382,
"epoch": 0.6676283900750144,
"grad_norm": 0.8125,
"learning_rate": 0.0004965448634437468,
"loss": 6.2815,
"mean_token_accuracy": 0.15635018050670624,
"num_tokens": 14651519.0,
"step": 5785
},
{
"entropy": 6.4846090316772464,
"epoch": 0.668205424120023,
"grad_norm": 0.86328125,
"learning_rate": 0.0004965376559840272,
"loss": 6.2521,
"mean_token_accuracy": 0.16233301162719727,
"num_tokens": 14662994.0,
"step": 5790
},
{
"entropy": 6.413419342041015,
"epoch": 0.6687824581650318,
"grad_norm": 0.8359375,
"learning_rate": 0.0004965304410729986,
"loss": 6.2138,
"mean_token_accuracy": 0.169295796751976,
"num_tokens": 14675488.0,
"step": 5795
},
{
"entropy": 6.341550636291504,
"epoch": 0.6693594922100404,
"grad_norm": 0.859375,
"learning_rate": 0.0004965232187109037,
"loss": 6.1536,
"mean_token_accuracy": 0.1739507034420967,
"num_tokens": 14688512.0,
"step": 5800
},
{
"entropy": 6.425643396377564,
"epoch": 0.6699365262550491,
"grad_norm": 0.875,
"learning_rate": 0.0004965159888979854,
"loss": 6.2133,
"mean_token_accuracy": 0.1665024146437645,
"num_tokens": 14700740.0,
"step": 5805
},
{
"entropy": 6.373208665847779,
"epoch": 0.6705135603000577,
"grad_norm": 0.81640625,
"learning_rate": 0.0004965087516344869,
"loss": 6.2559,
"mean_token_accuracy": 0.16404303461313247,
"num_tokens": 14713769.0,
"step": 5810
},
{
"entropy": 6.37481460571289,
"epoch": 0.6710905943450663,
"grad_norm": 0.8515625,
"learning_rate": 0.0004965015069206515,
"loss": 6.1449,
"mean_token_accuracy": 0.17123078256845475,
"num_tokens": 14725710.0,
"step": 5815
},
{
"entropy": 6.382030820846557,
"epoch": 0.671667628390075,
"grad_norm": 0.78515625,
"learning_rate": 0.000496494254756723,
"loss": 6.1415,
"mean_token_accuracy": 0.17618792951107026,
"num_tokens": 14738504.0,
"step": 5820
},
{
"entropy": 6.413110065460205,
"epoch": 0.6722446624350836,
"grad_norm": 0.82421875,
"learning_rate": 0.0004964869951429451,
"loss": 6.2643,
"mean_token_accuracy": 0.16108937114477156,
"num_tokens": 14750344.0,
"step": 5825
},
{
"entropy": 6.433046150207519,
"epoch": 0.6728216964800924,
"grad_norm": 0.80078125,
"learning_rate": 0.0004964797280795622,
"loss": 6.3041,
"mean_token_accuracy": 0.16477554887533188,
"num_tokens": 14764316.0,
"step": 5830
},
{
"entropy": 6.371626186370849,
"epoch": 0.673398730525101,
"grad_norm": 0.86328125,
"learning_rate": 0.0004964724535668188,
"loss": 6.2249,
"mean_token_accuracy": 0.1627054274082184,
"num_tokens": 14776404.0,
"step": 5835
},
{
"entropy": 6.490979194641113,
"epoch": 0.6739757645701097,
"grad_norm": 0.79296875,
"learning_rate": 0.0004964651716049593,
"loss": 6.2583,
"mean_token_accuracy": 0.16423558443784714,
"num_tokens": 14788843.0,
"step": 5840
},
{
"entropy": 6.37471375465393,
"epoch": 0.6745527986151183,
"grad_norm": 0.82421875,
"learning_rate": 0.0004964578821942288,
"loss": 6.1898,
"mean_token_accuracy": 0.1714974358677864,
"num_tokens": 14802662.0,
"step": 5845
},
{
"entropy": 6.375233840942383,
"epoch": 0.6751298326601269,
"grad_norm": 0.79296875,
"learning_rate": 0.0004964505853348724,
"loss": 6.2682,
"mean_token_accuracy": 0.1575095996260643,
"num_tokens": 14814354.0,
"step": 5850
},
{
"entropy": 6.404491424560547,
"epoch": 0.6757068667051356,
"grad_norm": 1.1875,
"learning_rate": 0.0004964432810271356,
"loss": 6.169,
"mean_token_accuracy": 0.17374546974897384,
"num_tokens": 14826404.0,
"step": 5855
},
{
"entropy": 6.397090053558349,
"epoch": 0.6762839007501442,
"grad_norm": 0.74609375,
"learning_rate": 0.0004964359692712641,
"loss": 6.2305,
"mean_token_accuracy": 0.16469545364379884,
"num_tokens": 14840046.0,
"step": 5860
},
{
"entropy": 6.359001588821411,
"epoch": 0.676860934795153,
"grad_norm": 0.80859375,
"learning_rate": 0.0004964286500675037,
"loss": 6.2521,
"mean_token_accuracy": 0.15627662539482118,
"num_tokens": 14853566.0,
"step": 5865
},
{
"entropy": 6.397631883621216,
"epoch": 0.6774379688401616,
"grad_norm": 0.84375,
"learning_rate": 0.0004964213234161007,
"loss": 6.1925,
"mean_token_accuracy": 0.16885973513126373,
"num_tokens": 14866538.0,
"step": 5870
},
{
"entropy": 6.3361509323120115,
"epoch": 0.6780150028851702,
"grad_norm": 0.81640625,
"learning_rate": 0.0004964139893173014,
"loss": 6.1521,
"mean_token_accuracy": 0.17438876032829284,
"num_tokens": 14879237.0,
"step": 5875
},
{
"entropy": 6.442409992218018,
"epoch": 0.6785920369301789,
"grad_norm": 0.82421875,
"learning_rate": 0.0004964066477713525,
"loss": 6.2748,
"mean_token_accuracy": 0.1616318017244339,
"num_tokens": 14891295.0,
"step": 5880
},
{
"entropy": 6.412937259674072,
"epoch": 0.6791690709751875,
"grad_norm": 0.890625,
"learning_rate": 0.0004963992987785011,
"loss": 6.2673,
"mean_token_accuracy": 0.16440023183822633,
"num_tokens": 14902927.0,
"step": 5885
},
{
"entropy": 6.350733757019043,
"epoch": 0.6797461050201962,
"grad_norm": 0.82421875,
"learning_rate": 0.0004963919423389942,
"loss": 6.2349,
"mean_token_accuracy": 0.16148411780595778,
"num_tokens": 14915203.0,
"step": 5890
},
{
"entropy": 6.369336748123169,
"epoch": 0.6803231390652048,
"grad_norm": 0.85546875,
"learning_rate": 0.0004963845784530794,
"loss": 6.099,
"mean_token_accuracy": 0.17276938557624816,
"num_tokens": 14927428.0,
"step": 5895
},
{
"entropy": 6.338372755050659,
"epoch": 0.6809001731102136,
"grad_norm": 0.81640625,
"learning_rate": 0.000496377207121004,
"loss": 6.2514,
"mean_token_accuracy": 0.16943022161722182,
"num_tokens": 14939979.0,
"step": 5900
},
{
"entropy": 6.460256767272949,
"epoch": 0.6814772071552222,
"grad_norm": 0.81640625,
"learning_rate": 0.0004963698283430164,
"loss": 6.2375,
"mean_token_accuracy": 0.1650419846177101,
"num_tokens": 14952292.0,
"step": 5905
},
{
"entropy": 6.392317628860473,
"epoch": 0.6820542412002308,
"grad_norm": 0.80078125,
"learning_rate": 0.0004963624421193646,
"loss": 6.2536,
"mean_token_accuracy": 0.15970679968595505,
"num_tokens": 14964942.0,
"step": 5910
},
{
"entropy": 6.431348752975464,
"epoch": 0.6826312752452395,
"grad_norm": 0.8828125,
"learning_rate": 0.000496355048450297,
"loss": 6.3675,
"mean_token_accuracy": 0.15923905968666077,
"num_tokens": 14979196.0,
"step": 5915
},
{
"entropy": 6.4473936557769775,
"epoch": 0.6832083092902481,
"grad_norm": 0.86328125,
"learning_rate": 0.0004963476473360623,
"loss": 6.2204,
"mean_token_accuracy": 0.16636578887701034,
"num_tokens": 14991162.0,
"step": 5920
},
{
"entropy": 6.332076978683472,
"epoch": 0.6837853433352568,
"grad_norm": 0.8515625,
"learning_rate": 0.0004963402387769094,
"loss": 6.2417,
"mean_token_accuracy": 0.16846334040164948,
"num_tokens": 15003207.0,
"step": 5925
},
{
"entropy": 6.35644760131836,
"epoch": 0.6843623773802654,
"grad_norm": 0.8125,
"learning_rate": 0.0004963328227730876,
"loss": 6.2604,
"mean_token_accuracy": 0.1596489131450653,
"num_tokens": 15016633.0,
"step": 5930
},
{
"entropy": 6.392962121963501,
"epoch": 0.684939411425274,
"grad_norm": 0.86328125,
"learning_rate": 0.0004963253993248461,
"loss": 6.198,
"mean_token_accuracy": 0.17046815901994705,
"num_tokens": 15029256.0,
"step": 5935
},
{
"entropy": 6.344196081161499,
"epoch": 0.6855164454702828,
"grad_norm": 0.8515625,
"learning_rate": 0.0004963179684324349,
"loss": 6.1649,
"mean_token_accuracy": 0.17169316112995148,
"num_tokens": 15041162.0,
"step": 5940
},
{
"entropy": 6.346894645690918,
"epoch": 0.6860934795152914,
"grad_norm": 0.76953125,
"learning_rate": 0.0004963105300961036,
"loss": 6.2151,
"mean_token_accuracy": 0.17179548889398574,
"num_tokens": 15054122.0,
"step": 5945
},
{
"entropy": 6.368085193634033,
"epoch": 0.6866705135603001,
"grad_norm": 0.8359375,
"learning_rate": 0.0004963030843161026,
"loss": 6.2176,
"mean_token_accuracy": 0.1642700269818306,
"num_tokens": 15066123.0,
"step": 5950
},
{
"entropy": 6.261136484146118,
"epoch": 0.6872475476053087,
"grad_norm": 0.85546875,
"learning_rate": 0.0004962956310926823,
"loss": 6.1427,
"mean_token_accuracy": 0.1735681861639023,
"num_tokens": 15078192.0,
"step": 5955
},
{
"entropy": 6.413783311843872,
"epoch": 0.6878245816503173,
"grad_norm": 0.80078125,
"learning_rate": 0.0004962881704260934,
"loss": 6.1818,
"mean_token_accuracy": 0.1730615571141243,
"num_tokens": 15090227.0,
"step": 5960
},
{
"entropy": 6.358871221542358,
"epoch": 0.688401615695326,
"grad_norm": 0.80859375,
"learning_rate": 0.0004962807023165868,
"loss": 6.3066,
"mean_token_accuracy": 0.1696085214614868,
"num_tokens": 15104093.0,
"step": 5965
},
{
"entropy": 6.3496081829071045,
"epoch": 0.6889786497403346,
"grad_norm": 0.76171875,
"learning_rate": 0.0004962732267644138,
"loss": 6.2006,
"mean_token_accuracy": 0.16877583116292955,
"num_tokens": 15118064.0,
"step": 5970
},
{
"entropy": 6.392092323303222,
"epoch": 0.6895556837853434,
"grad_norm": 1.1484375,
"learning_rate": 0.0004962657437698254,
"loss": 6.0972,
"mean_token_accuracy": 0.17405418753623964,
"num_tokens": 15131686.0,
"step": 5975
},
{
"entropy": 6.378844308853149,
"epoch": 0.690132717830352,
"grad_norm": 0.80859375,
"learning_rate": 0.0004962582533330739,
"loss": 6.2949,
"mean_token_accuracy": 0.15710055381059645,
"num_tokens": 15143920.0,
"step": 5980
},
{
"entropy": 6.44266266822815,
"epoch": 0.6907097518753607,
"grad_norm": 0.82421875,
"learning_rate": 0.0004962507554544109,
"loss": 6.2552,
"mean_token_accuracy": 0.16559473276138306,
"num_tokens": 15156989.0,
"step": 5985
},
{
"entropy": 6.503173542022705,
"epoch": 0.6912867859203693,
"grad_norm": 0.88671875,
"learning_rate": 0.0004962432501340886,
"loss": 6.3219,
"mean_token_accuracy": 0.15267299860715866,
"num_tokens": 15169068.0,
"step": 5990
},
{
"entropy": 6.377065753936767,
"epoch": 0.6918638199653779,
"grad_norm": 0.8359375,
"learning_rate": 0.0004962357373723596,
"loss": 6.2871,
"mean_token_accuracy": 0.16362386345863342,
"num_tokens": 15182081.0,
"step": 5995
},
{
"entropy": 6.492167615890503,
"epoch": 0.6924408540103866,
"grad_norm": 0.82421875,
"learning_rate": 0.0004962282171694763,
"loss": 6.2605,
"mean_token_accuracy": 0.16491686552762985,
"num_tokens": 15194474.0,
"step": 6000
},
{
"epoch": 0.6924408540103866,
"eval_entropy": 6.244893937006504,
"eval_loss": 6.277975559234619,
"eval_mean_token_accuracy": 0.16690639868687931,
"eval_num_tokens": 15194474.0,
"eval_runtime": 17.4205,
"eval_samples_per_second": 1615.111,
"eval_steps_per_second": 201.889,
"step": 6000
},
{
"entropy": 6.419049692153931,
"epoch": 0.6930178880553952,
"grad_norm": 0.8125,
"learning_rate": 0.0004962206895256919,
"loss": 6.2318,
"mean_token_accuracy": 0.16573894619941712,
"num_tokens": 15206371.0,
"step": 6005
},
{
"entropy": 6.34908356666565,
"epoch": 0.693594922100404,
"grad_norm": 0.83203125,
"learning_rate": 0.0004962131544412595,
"loss": 6.2544,
"mean_token_accuracy": 0.16422042697668077,
"num_tokens": 15218913.0,
"step": 6010
},
{
"entropy": 6.471472215652466,
"epoch": 0.6941719561454126,
"grad_norm": 0.77734375,
"learning_rate": 0.0004962056119164325,
"loss": 6.2344,
"mean_token_accuracy": 0.1708833560347557,
"num_tokens": 15231647.0,
"step": 6015
},
{
"entropy": 6.392230892181397,
"epoch": 0.6947489901904212,
"grad_norm": 0.79296875,
"learning_rate": 0.0004961980619514646,
"loss": 6.2363,
"mean_token_accuracy": 0.16547508537769318,
"num_tokens": 15243764.0,
"step": 6020
},
{
"entropy": 6.415359783172607,
"epoch": 0.6953260242354299,
"grad_norm": 0.7734375,
"learning_rate": 0.0004961905045466098,
"loss": 6.2948,
"mean_token_accuracy": 0.15680457055568695,
"num_tokens": 15256165.0,
"step": 6025
},
{
"entropy": 6.357501459121704,
"epoch": 0.6959030582804385,
"grad_norm": 0.83203125,
"learning_rate": 0.0004961829397021222,
"loss": 6.169,
"mean_token_accuracy": 0.16878628879785537,
"num_tokens": 15269169.0,
"step": 6030
},
{
"entropy": 6.377862071990966,
"epoch": 0.6964800923254472,
"grad_norm": 0.75390625,
"learning_rate": 0.0004961753674182564,
"loss": 6.2119,
"mean_token_accuracy": 0.16564356088638305,
"num_tokens": 15281530.0,
"step": 6035
},
{
"entropy": 6.375745582580566,
"epoch": 0.6970571263704558,
"grad_norm": 0.9453125,
"learning_rate": 0.0004961677876952669,
"loss": 6.1756,
"mean_token_accuracy": 0.16821483224630357,
"num_tokens": 15295578.0,
"step": 6040
},
{
"entropy": 6.376891565322876,
"epoch": 0.6976341604154646,
"grad_norm": 0.7734375,
"learning_rate": 0.0004961602005334087,
"loss": 6.2514,
"mean_token_accuracy": 0.16718253195285798,
"num_tokens": 15308258.0,
"step": 6045
},
{
"entropy": 6.4180299758911135,
"epoch": 0.6982111944604732,
"grad_norm": 0.8359375,
"learning_rate": 0.000496152605932937,
"loss": 6.2718,
"mean_token_accuracy": 0.1603887066245079,
"num_tokens": 15320370.0,
"step": 6050
},
{
"entropy": 6.440406322479248,
"epoch": 0.6987882285054818,
"grad_norm": 0.94921875,
"learning_rate": 0.0004961450038941074,
"loss": 6.2492,
"mean_token_accuracy": 0.16523093432188035,
"num_tokens": 15332350.0,
"step": 6055
},
{
"entropy": 6.333216190338135,
"epoch": 0.6993652625504905,
"grad_norm": 0.80859375,
"learning_rate": 0.0004961373944171754,
"loss": 6.1742,
"mean_token_accuracy": 0.1691560611128807,
"num_tokens": 15343424.0,
"step": 6060
},
{
"entropy": 6.359563398361206,
"epoch": 0.6999422965954991,
"grad_norm": 0.8203125,
"learning_rate": 0.0004961297775023968,
"loss": 6.1927,
"mean_token_accuracy": 0.1697380304336548,
"num_tokens": 15356126.0,
"step": 6065
},
{
"entropy": 6.346981000900269,
"epoch": 0.7005193306405078,
"grad_norm": 0.8671875,
"learning_rate": 0.000496122153150028,
"loss": 6.0971,
"mean_token_accuracy": 0.17148021459579468,
"num_tokens": 15369253.0,
"step": 6070
},
{
"entropy": 6.4445713520050045,
"epoch": 0.7010963646855164,
"grad_norm": 0.77734375,
"learning_rate": 0.0004961145213603255,
"loss": 6.2621,
"mean_token_accuracy": 0.16077155470848084,
"num_tokens": 15382679.0,
"step": 6075
},
{
"entropy": 6.3669038772583,
"epoch": 0.7016733987305251,
"grad_norm": 0.73046875,
"learning_rate": 0.000496106882133546,
"loss": 6.276,
"mean_token_accuracy": 0.1646697610616684,
"num_tokens": 15396052.0,
"step": 6080
},
{
"entropy": 6.421784114837647,
"epoch": 0.7022504327755338,
"grad_norm": 0.80859375,
"learning_rate": 0.0004960992354699463,
"loss": 6.2941,
"mean_token_accuracy": 0.15852054804563523,
"num_tokens": 15409249.0,
"step": 6085
},
{
"entropy": 6.455357551574707,
"epoch": 0.7028274668205424,
"grad_norm": 0.8359375,
"learning_rate": 0.0004960915813697836,
"loss": 6.1779,
"mean_token_accuracy": 0.16108503490686416,
"num_tokens": 15421060.0,
"step": 6090
},
{
"entropy": 6.378384447097778,
"epoch": 0.7034045008655511,
"grad_norm": 0.74609375,
"learning_rate": 0.0004960839198333154,
"loss": 6.2629,
"mean_token_accuracy": 0.16128408163785934,
"num_tokens": 15433083.0,
"step": 6095
},
{
"entropy": 6.3820489883422855,
"epoch": 0.7039815349105597,
"grad_norm": 0.82421875,
"learning_rate": 0.0004960762508607994,
"loss": 6.08,
"mean_token_accuracy": 0.17403190284967424,
"num_tokens": 15446664.0,
"step": 6100
},
{
"entropy": 6.398230504989624,
"epoch": 0.7045585689555683,
"grad_norm": 0.7890625,
"learning_rate": 0.0004960685744524934,
"loss": 6.243,
"mean_token_accuracy": 0.1608691543340683,
"num_tokens": 15458609.0,
"step": 6105
},
{
"entropy": 6.359479999542236,
"epoch": 0.705135603000577,
"grad_norm": 0.8359375,
"learning_rate": 0.0004960608906086558,
"loss": 6.144,
"mean_token_accuracy": 0.17022748589515685,
"num_tokens": 15470091.0,
"step": 6110
},
{
"entropy": 6.411485767364502,
"epoch": 0.7057126370455857,
"grad_norm": 0.7578125,
"learning_rate": 0.000496053199329545,
"loss": 6.2529,
"mean_token_accuracy": 0.16091013103723525,
"num_tokens": 15483557.0,
"step": 6115
},
{
"entropy": 6.395710134506226,
"epoch": 0.7062896710905944,
"grad_norm": 0.78125,
"learning_rate": 0.0004960455006154196,
"loss": 6.211,
"mean_token_accuracy": 0.16187724471092224,
"num_tokens": 15497437.0,
"step": 6120
},
{
"entropy": 6.403597688674926,
"epoch": 0.706866705135603,
"grad_norm": 0.83984375,
"learning_rate": 0.0004960377944665386,
"loss": 6.2439,
"mean_token_accuracy": 0.16568287909030915,
"num_tokens": 15509942.0,
"step": 6125
},
{
"entropy": 6.3745523452758786,
"epoch": 0.7074437391806117,
"grad_norm": 0.83984375,
"learning_rate": 0.0004960300808831611,
"loss": 6.194,
"mean_token_accuracy": 0.17037154287099837,
"num_tokens": 15522866.0,
"step": 6130
},
{
"entropy": 6.407792663574218,
"epoch": 0.7080207732256203,
"grad_norm": 0.859375,
"learning_rate": 0.0004960223598655467,
"loss": 6.1858,
"mean_token_accuracy": 0.1648655503988266,
"num_tokens": 15534731.0,
"step": 6135
},
{
"entropy": 6.34327073097229,
"epoch": 0.7085978072706289,
"grad_norm": 0.84375,
"learning_rate": 0.000496014631413955,
"loss": 6.223,
"mean_token_accuracy": 0.16448917090892792,
"num_tokens": 15546401.0,
"step": 6140
},
{
"entropy": 6.450383615493775,
"epoch": 0.7091748413156376,
"grad_norm": 0.80859375,
"learning_rate": 0.0004960068955286459,
"loss": 6.2292,
"mean_token_accuracy": 0.16138217896223067,
"num_tokens": 15559532.0,
"step": 6145
},
{
"entropy": 6.38635630607605,
"epoch": 0.7097518753606463,
"grad_norm": 0.78515625,
"learning_rate": 0.0004959991522098797,
"loss": 6.1771,
"mean_token_accuracy": 0.1652152955532074,
"num_tokens": 15572426.0,
"step": 6150
},
{
"entropy": 6.419304513931275,
"epoch": 0.710328909405655,
"grad_norm": 0.80078125,
"learning_rate": 0.0004959914014579168,
"loss": 6.2391,
"mean_token_accuracy": 0.162534636259079,
"num_tokens": 15584422.0,
"step": 6155
},
{
"entropy": 6.413751649856567,
"epoch": 0.7109059434506636,
"grad_norm": 0.91015625,
"learning_rate": 0.0004959836432730178,
"loss": 6.231,
"mean_token_accuracy": 0.16499146223068237,
"num_tokens": 15595538.0,
"step": 6160
},
{
"entropy": 6.337444114685058,
"epoch": 0.7114829774956722,
"grad_norm": 0.83984375,
"learning_rate": 0.0004959758776554438,
"loss": 6.1783,
"mean_token_accuracy": 0.17357258945703508,
"num_tokens": 15608315.0,
"step": 6165
},
{
"entropy": 6.39624662399292,
"epoch": 0.7120600115406809,
"grad_norm": 0.8515625,
"learning_rate": 0.000495968104605456,
"loss": 6.2659,
"mean_token_accuracy": 0.16520965546369554,
"num_tokens": 15620181.0,
"step": 6170
},
{
"entropy": 6.34517502784729,
"epoch": 0.7126370455856895,
"grad_norm": 0.88671875,
"learning_rate": 0.0004959603241233157,
"loss": 6.1166,
"mean_token_accuracy": 0.16953941881656648,
"num_tokens": 15632100.0,
"step": 6175
},
{
"entropy": 6.311384630203247,
"epoch": 0.7132140796306982,
"grad_norm": 0.796875,
"learning_rate": 0.0004959525362092846,
"loss": 6.1495,
"mean_token_accuracy": 0.16864179223775863,
"num_tokens": 15644185.0,
"step": 6180
},
{
"entropy": 6.354869842529297,
"epoch": 0.7137911136757069,
"grad_norm": 0.890625,
"learning_rate": 0.0004959447408636247,
"loss": 6.1944,
"mean_token_accuracy": 0.1726676657795906,
"num_tokens": 15657761.0,
"step": 6185
},
{
"entropy": 6.350826025009155,
"epoch": 0.7143681477207156,
"grad_norm": 0.80859375,
"learning_rate": 0.0004959369380865983,
"loss": 6.2315,
"mean_token_accuracy": 0.15910745710134505,
"num_tokens": 15671135.0,
"step": 6190
},
{
"entropy": 6.378980588912964,
"epoch": 0.7149451817657242,
"grad_norm": 0.84375,
"learning_rate": 0.0004959291278784676,
"loss": 6.1955,
"mean_token_accuracy": 0.15981043577194215,
"num_tokens": 15683286.0,
"step": 6195
},
{
"entropy": 6.351711416244507,
"epoch": 0.7155222158107328,
"grad_norm": 0.7734375,
"learning_rate": 0.0004959213102394954,
"loss": 6.1165,
"mean_token_accuracy": 0.1762665629386902,
"num_tokens": 15697535.0,
"step": 6200
},
{
"entropy": 6.344398021697998,
"epoch": 0.7160992498557415,
"grad_norm": 0.859375,
"learning_rate": 0.0004959134851699449,
"loss": 6.2067,
"mean_token_accuracy": 0.16598029881715776,
"num_tokens": 15708748.0,
"step": 6205
},
{
"entropy": 6.413574361801148,
"epoch": 0.7166762839007501,
"grad_norm": 0.85546875,
"learning_rate": 0.0004959056526700788,
"loss": 6.1852,
"mean_token_accuracy": 0.16717519015073776,
"num_tokens": 15721720.0,
"step": 6210
},
{
"entropy": 6.368403530120849,
"epoch": 0.7172533179457588,
"grad_norm": 0.88671875,
"learning_rate": 0.0004958978127401609,
"loss": 6.1315,
"mean_token_accuracy": 0.17073239833116532,
"num_tokens": 15734854.0,
"step": 6215
},
{
"entropy": 6.339862442016601,
"epoch": 0.7178303519907675,
"grad_norm": 0.8515625,
"learning_rate": 0.0004958899653804548,
"loss": 6.1926,
"mean_token_accuracy": 0.16976216584444045,
"num_tokens": 15747575.0,
"step": 6220
},
{
"entropy": 6.308337545394897,
"epoch": 0.7184073860357761,
"grad_norm": 1.140625,
"learning_rate": 0.0004958821105912246,
"loss": 6.2057,
"mean_token_accuracy": 0.16995695233345032,
"num_tokens": 15760917.0,
"step": 6225
},
{
"entropy": 6.464078569412232,
"epoch": 0.7189844200807848,
"grad_norm": 0.85546875,
"learning_rate": 0.000495874248372734,
"loss": 6.279,
"mean_token_accuracy": 0.15709616243839264,
"num_tokens": 15774045.0,
"step": 6230
},
{
"entropy": 6.406183242797852,
"epoch": 0.7195614541257934,
"grad_norm": 0.8984375,
"learning_rate": 0.000495866378725248,
"loss": 6.1858,
"mean_token_accuracy": 0.1691389873623848,
"num_tokens": 15786006.0,
"step": 6235
},
{
"entropy": 6.314851379394531,
"epoch": 0.7201384881708021,
"grad_norm": 0.88671875,
"learning_rate": 0.000495858501649031,
"loss": 6.1934,
"mean_token_accuracy": 0.16714197844266893,
"num_tokens": 15798078.0,
"step": 6240
},
{
"entropy": 6.398427200317383,
"epoch": 0.7207155222158107,
"grad_norm": 0.84375,
"learning_rate": 0.000495850617144348,
"loss": 6.1999,
"mean_token_accuracy": 0.167718106508255,
"num_tokens": 15810281.0,
"step": 6245
},
{
"entropy": 6.419170761108399,
"epoch": 0.7212925562608193,
"grad_norm": 0.71875,
"learning_rate": 0.0004958427252114643,
"loss": 6.2836,
"mean_token_accuracy": 0.1600424215197563,
"num_tokens": 15822593.0,
"step": 6250
},
{
"entropy": 6.408493232727051,
"epoch": 0.7218695903058281,
"grad_norm": 0.79296875,
"learning_rate": 0.000495834825850645,
"loss": 6.2203,
"mean_token_accuracy": 0.1696522206068039,
"num_tokens": 15835181.0,
"step": 6255
},
{
"entropy": 6.452267456054687,
"epoch": 0.7224466243508367,
"grad_norm": 0.75,
"learning_rate": 0.0004958269190621562,
"loss": 6.2164,
"mean_token_accuracy": 0.16248857825994492,
"num_tokens": 15847679.0,
"step": 6260
},
{
"entropy": 6.379993677139282,
"epoch": 0.7230236583958454,
"grad_norm": 0.8515625,
"learning_rate": 0.0004958190048462637,
"loss": 6.2552,
"mean_token_accuracy": 0.16551875323057175,
"num_tokens": 15860209.0,
"step": 6265
},
{
"entropy": 6.4074663639068605,
"epoch": 0.723600692440854,
"grad_norm": 0.87890625,
"learning_rate": 0.0004958110832032336,
"loss": 6.2241,
"mean_token_accuracy": 0.1634237140417099,
"num_tokens": 15873165.0,
"step": 6270
},
{
"entropy": 6.370559549331665,
"epoch": 0.7241777264858626,
"grad_norm": 0.82421875,
"learning_rate": 0.0004958031541333322,
"loss": 6.2481,
"mean_token_accuracy": 0.16408838033676149,
"num_tokens": 15885201.0,
"step": 6275
},
{
"entropy": 6.477904367446899,
"epoch": 0.7247547605308713,
"grad_norm": 0.79296875,
"learning_rate": 0.0004957952176368267,
"loss": 6.2923,
"mean_token_accuracy": 0.16007572412490845,
"num_tokens": 15899071.0,
"step": 6280
},
{
"entropy": 6.339187717437744,
"epoch": 0.7253317945758799,
"grad_norm": 0.79296875,
"learning_rate": 0.0004957872737139836,
"loss": 6.1956,
"mean_token_accuracy": 0.16685390919446946,
"num_tokens": 15912274.0,
"step": 6285
},
{
"entropy": 6.358347415924072,
"epoch": 0.7259088286208887,
"grad_norm": 0.83203125,
"learning_rate": 0.0004957793223650702,
"loss": 6.1697,
"mean_token_accuracy": 0.17283968180418013,
"num_tokens": 15925302.0,
"step": 6290
},
{
"entropy": 6.350992727279663,
"epoch": 0.7264858626658973,
"grad_norm": 0.80859375,
"learning_rate": 0.000495771363590354,
"loss": 6.2221,
"mean_token_accuracy": 0.16327236741781234,
"num_tokens": 15938226.0,
"step": 6295
},
{
"entropy": 6.3598075866699215,
"epoch": 0.727062896710906,
"grad_norm": 0.96484375,
"learning_rate": 0.0004957633973901027,
"loss": 6.2529,
"mean_token_accuracy": 0.16555078625679015,
"num_tokens": 15951136.0,
"step": 6300
},
{
"entropy": 6.5036924362182615,
"epoch": 0.7276399307559146,
"grad_norm": 0.9140625,
"learning_rate": 0.0004957554237645841,
"loss": 6.182,
"mean_token_accuracy": 0.16397586315870286,
"num_tokens": 15962820.0,
"step": 6305
},
{
"entropy": 6.3505518436431885,
"epoch": 0.7282169648009232,
"grad_norm": 0.828125,
"learning_rate": 0.0004957474427140665,
"loss": 6.1517,
"mean_token_accuracy": 0.16915166974067689,
"num_tokens": 15974871.0,
"step": 6310
},
{
"entropy": 6.292996549606324,
"epoch": 0.7287939988459319,
"grad_norm": 0.80859375,
"learning_rate": 0.0004957394542388182,
"loss": 6.1424,
"mean_token_accuracy": 0.16711995154619216,
"num_tokens": 15986916.0,
"step": 6315
},
{
"entropy": 6.4575494766235355,
"epoch": 0.7293710328909405,
"grad_norm": 0.8125,
"learning_rate": 0.0004957314583391082,
"loss": 6.2829,
"mean_token_accuracy": 0.1611138626933098,
"num_tokens": 15999735.0,
"step": 6320
},
{
"entropy": 6.395171499252319,
"epoch": 0.7299480669359493,
"grad_norm": 0.8203125,
"learning_rate": 0.0004957234550152052,
"loss": 6.1495,
"mean_token_accuracy": 0.16820143014192582,
"num_tokens": 16013137.0,
"step": 6325
},
{
"entropy": 6.411394023895264,
"epoch": 0.7305251009809579,
"grad_norm": 0.77734375,
"learning_rate": 0.0004957154442673784,
"loss": 6.1912,
"mean_token_accuracy": 0.1681437909603119,
"num_tokens": 16026750.0,
"step": 6330
},
{
"entropy": 6.4092567443847654,
"epoch": 0.7311021350259665,
"grad_norm": 0.82421875,
"learning_rate": 0.0004957074260958972,
"loss": 6.2858,
"mean_token_accuracy": 0.16070856600999833,
"num_tokens": 16039028.0,
"step": 6335
},
{
"entropy": 6.334304571151733,
"epoch": 0.7316791690709752,
"grad_norm": 0.79296875,
"learning_rate": 0.0004956994005010315,
"loss": 6.1644,
"mean_token_accuracy": 0.16928236484527587,
"num_tokens": 16051349.0,
"step": 6340
},
{
"entropy": 6.428053951263427,
"epoch": 0.7322562031159838,
"grad_norm": 0.8828125,
"learning_rate": 0.000495691367483051,
"loss": 6.1938,
"mean_token_accuracy": 0.16701492369174958,
"num_tokens": 16064015.0,
"step": 6345
},
{
"entropy": 6.399576091766358,
"epoch": 0.7328332371609925,
"grad_norm": 0.82421875,
"learning_rate": 0.0004956833270422259,
"loss": 6.2058,
"mean_token_accuracy": 0.16545607447624205,
"num_tokens": 16075571.0,
"step": 6350
},
{
"entropy": 6.313619899749756,
"epoch": 0.7334102712060011,
"grad_norm": 0.81640625,
"learning_rate": 0.0004956752791788269,
"loss": 6.2174,
"mean_token_accuracy": 0.17301566898822784,
"num_tokens": 16088176.0,
"step": 6355
},
{
"entropy": 6.446109962463379,
"epoch": 0.7339873052510099,
"grad_norm": 0.87890625,
"learning_rate": 0.0004956672238931244,
"loss": 6.2416,
"mean_token_accuracy": 0.16300074756145477,
"num_tokens": 16099933.0,
"step": 6360
},
{
"entropy": 6.3145325660705565,
"epoch": 0.7345643392960185,
"grad_norm": 0.8359375,
"learning_rate": 0.0004956591611853894,
"loss": 6.0568,
"mean_token_accuracy": 0.17523580491542817,
"num_tokens": 16113200.0,
"step": 6365
},
{
"entropy": 6.3287248611450195,
"epoch": 0.7351413733410271,
"grad_norm": 0.81640625,
"learning_rate": 0.0004956510910558931,
"loss": 6.226,
"mean_token_accuracy": 0.1691768139600754,
"num_tokens": 16125532.0,
"step": 6370
},
{
"entropy": 6.4246572971344,
"epoch": 0.7357184073860358,
"grad_norm": 0.7734375,
"learning_rate": 0.0004956430135049071,
"loss": 6.1668,
"mean_token_accuracy": 0.16189181953668594,
"num_tokens": 16137197.0,
"step": 6375
},
{
"entropy": 6.420309734344483,
"epoch": 0.7362954414310444,
"grad_norm": 0.81640625,
"learning_rate": 0.0004956349285327028,
"loss": 6.2291,
"mean_token_accuracy": 0.170423786342144,
"num_tokens": 16150481.0,
"step": 6380
},
{
"entropy": 6.436809253692627,
"epoch": 0.7368724754760531,
"grad_norm": 0.84765625,
"learning_rate": 0.0004956268361395523,
"loss": 6.243,
"mean_token_accuracy": 0.16785213947296143,
"num_tokens": 16162395.0,
"step": 6385
},
{
"entropy": 6.395518732070923,
"epoch": 0.7374495095210617,
"grad_norm": 0.8203125,
"learning_rate": 0.0004956187363257278,
"loss": 6.2114,
"mean_token_accuracy": 0.16164291948080062,
"num_tokens": 16174550.0,
"step": 6390
},
{
"entropy": 6.441514873504639,
"epoch": 0.7380265435660704,
"grad_norm": 0.87890625,
"learning_rate": 0.0004956106290915017,
"loss": 6.224,
"mean_token_accuracy": 0.16265684217214585,
"num_tokens": 16187571.0,
"step": 6395
},
{
"entropy": 6.387861871719361,
"epoch": 0.7386035776110791,
"grad_norm": 0.765625,
"learning_rate": 0.0004956025144371467,
"loss": 6.2354,
"mean_token_accuracy": 0.16527050733566284,
"num_tokens": 16199684.0,
"step": 6400
},
{
"entropy": 6.3519782543182375,
"epoch": 0.7391806116560877,
"grad_norm": 0.8125,
"learning_rate": 0.0004955943923629356,
"loss": 6.209,
"mean_token_accuracy": 0.1613857090473175,
"num_tokens": 16211935.0,
"step": 6405
},
{
"entropy": 6.381722450256348,
"epoch": 0.7397576457010964,
"grad_norm": 0.76953125,
"learning_rate": 0.0004955862628691417,
"loss": 6.2057,
"mean_token_accuracy": 0.16139667183160783,
"num_tokens": 16224346.0,
"step": 6410
},
{
"entropy": 6.384852361679077,
"epoch": 0.740334679746105,
"grad_norm": 0.82421875,
"learning_rate": 0.0004955781259560386,
"loss": 6.2382,
"mean_token_accuracy": 0.16073639541864396,
"num_tokens": 16238137.0,
"step": 6415
},
{
"entropy": 6.42009801864624,
"epoch": 0.7409117137911136,
"grad_norm": 0.80078125,
"learning_rate": 0.0004955699816238995,
"loss": 6.2115,
"mean_token_accuracy": 0.1616441637277603,
"num_tokens": 16250777.0,
"step": 6420
},
{
"entropy": 6.490957832336425,
"epoch": 0.7414887478361223,
"grad_norm": 0.82421875,
"learning_rate": 0.0004955618298729988,
"loss": 6.216,
"mean_token_accuracy": 0.16838435977697372,
"num_tokens": 16262440.0,
"step": 6425
},
{
"entropy": 6.3685378074646,
"epoch": 0.742065781881131,
"grad_norm": 0.80859375,
"learning_rate": 0.0004955536707036105,
"loss": 6.1605,
"mean_token_accuracy": 0.1693017989397049,
"num_tokens": 16275227.0,
"step": 6430
},
{
"entropy": 6.362598896026611,
"epoch": 0.7426428159261397,
"grad_norm": 0.8359375,
"learning_rate": 0.000495545504116009,
"loss": 6.2191,
"mean_token_accuracy": 0.16907331794500352,
"num_tokens": 16287246.0,
"step": 6435
},
{
"entropy": 6.334651374816895,
"epoch": 0.7432198499711483,
"grad_norm": 0.84375,
"learning_rate": 0.0004955373301104691,
"loss": 6.0844,
"mean_token_accuracy": 0.1756950169801712,
"num_tokens": 16298779.0,
"step": 6440
},
{
"entropy": 6.257397556304932,
"epoch": 0.743796884016157,
"grad_norm": 0.90625,
"learning_rate": 0.0004955291486872657,
"loss": 6.094,
"mean_token_accuracy": 0.17155533283948898,
"num_tokens": 16310965.0,
"step": 6445
},
{
"entropy": 6.422209453582764,
"epoch": 0.7443739180611656,
"grad_norm": 0.81640625,
"learning_rate": 0.0004955209598466738,
"loss": 6.1489,
"mean_token_accuracy": 0.16697419285774232,
"num_tokens": 16324025.0,
"step": 6450
},
{
"entropy": 6.4021642208099365,
"epoch": 0.7449509521061742,
"grad_norm": 0.7890625,
"learning_rate": 0.000495512763588969,
"loss": 6.1812,
"mean_token_accuracy": 0.1613484129309654,
"num_tokens": 16336152.0,
"step": 6455
},
{
"entropy": 6.3049877166748045,
"epoch": 0.7455279861511829,
"grad_norm": 0.859375,
"learning_rate": 0.0004955045599144269,
"loss": 6.1725,
"mean_token_accuracy": 0.16346538215875625,
"num_tokens": 16349118.0,
"step": 6460
},
{
"entropy": 6.290837526321411,
"epoch": 0.7461050201961916,
"grad_norm": 0.85546875,
"learning_rate": 0.0004954963488233235,
"loss": 6.1527,
"mean_token_accuracy": 0.16980938464403153,
"num_tokens": 16362986.0,
"step": 6465
},
{
"entropy": 6.390332794189453,
"epoch": 0.7466820542412003,
"grad_norm": 0.78515625,
"learning_rate": 0.000495488130315935,
"loss": 6.2864,
"mean_token_accuracy": 0.15601871460676192,
"num_tokens": 16376384.0,
"step": 6470
},
{
"entropy": 6.3824310302734375,
"epoch": 0.7472590882862089,
"grad_norm": 0.83203125,
"learning_rate": 0.0004954799043925377,
"loss": 6.0944,
"mean_token_accuracy": 0.16927106827497482,
"num_tokens": 16388137.0,
"step": 6475
},
{
"entropy": 6.397792720794678,
"epoch": 0.7478361223312175,
"grad_norm": 0.8671875,
"learning_rate": 0.0004954716710534082,
"loss": 6.2386,
"mean_token_accuracy": 0.15695064812898635,
"num_tokens": 16400037.0,
"step": 6480
},
{
"entropy": 6.404593467712402,
"epoch": 0.7484131563762262,
"grad_norm": 0.796875,
"learning_rate": 0.0004954634302988237,
"loss": 6.1692,
"mean_token_accuracy": 0.16684277951717377,
"num_tokens": 16412065.0,
"step": 6485
},
{
"entropy": 6.392002153396606,
"epoch": 0.7489901904212348,
"grad_norm": 0.8828125,
"learning_rate": 0.0004954551821290612,
"loss": 6.1886,
"mean_token_accuracy": 0.1650811791419983,
"num_tokens": 16424345.0,
"step": 6490
},
{
"entropy": 6.408037185668945,
"epoch": 0.7495672244662435,
"grad_norm": 0.890625,
"learning_rate": 0.0004954469265443981,
"loss": 6.2616,
"mean_token_accuracy": 0.16495269536972046,
"num_tokens": 16436423.0,
"step": 6495
},
{
"entropy": 6.3400726318359375,
"epoch": 0.7501442585112522,
"grad_norm": 0.78125,
"learning_rate": 0.0004954386635451123,
"loss": 6.1597,
"mean_token_accuracy": 0.16760794222354888,
"num_tokens": 16449496.0,
"step": 6500
},
{
"entropy": 6.373304224014282,
"epoch": 0.7507212925562609,
"grad_norm": 0.81640625,
"learning_rate": 0.0004954303931314814,
"loss": 6.1806,
"mean_token_accuracy": 0.16673036217689513,
"num_tokens": 16462193.0,
"step": 6505
},
{
"entropy": 6.355952978134155,
"epoch": 0.7512983266012695,
"grad_norm": 0.796875,
"learning_rate": 0.0004954221153037837,
"loss": 6.2043,
"mean_token_accuracy": 0.1631313681602478,
"num_tokens": 16474470.0,
"step": 6510
},
{
"entropy": 6.425698757171631,
"epoch": 0.7518753606462781,
"grad_norm": 0.83203125,
"learning_rate": 0.0004954138300622978,
"loss": 6.1706,
"mean_token_accuracy": 0.17431595772504807,
"num_tokens": 16487231.0,
"step": 6515
},
{
"entropy": 6.373720026016235,
"epoch": 0.7524523946912868,
"grad_norm": 0.7890625,
"learning_rate": 0.000495405537407302,
"loss": 6.2687,
"mean_token_accuracy": 0.16340657472610473,
"num_tokens": 16500822.0,
"step": 6520
},
{
"entropy": 6.301622486114502,
"epoch": 0.7530294287362954,
"grad_norm": 0.87109375,
"learning_rate": 0.0004953972373390755,
"loss": 6.2006,
"mean_token_accuracy": 0.16783786863088607,
"num_tokens": 16514529.0,
"step": 6525
},
{
"entropy": 6.352727317810059,
"epoch": 0.753606462781304,
"grad_norm": 0.828125,
"learning_rate": 0.0004953889298578975,
"loss": 6.1729,
"mean_token_accuracy": 0.1620926558971405,
"num_tokens": 16527281.0,
"step": 6530
},
{
"entropy": 6.431893682479858,
"epoch": 0.7541834968263128,
"grad_norm": 0.93359375,
"learning_rate": 0.0004953806149640473,
"loss": 6.1662,
"mean_token_accuracy": 0.16912026554346085,
"num_tokens": 16539763.0,
"step": 6535
},
{
"entropy": 6.268726921081543,
"epoch": 0.7547605308713214,
"grad_norm": 0.73828125,
"learning_rate": 0.0004953722926578045,
"loss": 6.1403,
"mean_token_accuracy": 0.17996453493833542,
"num_tokens": 16552197.0,
"step": 6540
},
{
"entropy": 6.44415316581726,
"epoch": 0.7553375649163301,
"grad_norm": 0.8203125,
"learning_rate": 0.0004953639629394492,
"loss": 6.2006,
"mean_token_accuracy": 0.16660022884607315,
"num_tokens": 16563988.0,
"step": 6545
},
{
"entropy": 6.337887763977051,
"epoch": 0.7559145989613387,
"grad_norm": 0.75390625,
"learning_rate": 0.0004953556258092613,
"loss": 6.1856,
"mean_token_accuracy": 0.16377629339694977,
"num_tokens": 16576982.0,
"step": 6550
},
{
"entropy": 6.3525402545928955,
"epoch": 0.7564916330063474,
"grad_norm": 0.80859375,
"learning_rate": 0.0004953472812675216,
"loss": 6.2339,
"mean_token_accuracy": 0.16399967223405837,
"num_tokens": 16590268.0,
"step": 6555
},
{
"entropy": 6.381183433532715,
"epoch": 0.757068667051356,
"grad_norm": 0.796875,
"learning_rate": 0.0004953389293145104,
"loss": 6.0784,
"mean_token_accuracy": 0.1773386687040329,
"num_tokens": 16602599.0,
"step": 6560
},
{
"entropy": 6.38706521987915,
"epoch": 0.7576457010963646,
"grad_norm": 0.84375,
"learning_rate": 0.0004953305699505088,
"loss": 6.1784,
"mean_token_accuracy": 0.16482038497924806,
"num_tokens": 16614278.0,
"step": 6565
},
{
"entropy": 6.376954698562622,
"epoch": 0.7582227351413734,
"grad_norm": 0.8828125,
"learning_rate": 0.0004953222031757979,
"loss": 6.1969,
"mean_token_accuracy": 0.16000646650791167,
"num_tokens": 16626810.0,
"step": 6570
},
{
"entropy": 6.30605149269104,
"epoch": 0.758799769186382,
"grad_norm": 0.796875,
"learning_rate": 0.0004953138289906592,
"loss": 6.147,
"mean_token_accuracy": 0.16598434895277023,
"num_tokens": 16639134.0,
"step": 6575
},
{
"entropy": 6.401002597808838,
"epoch": 0.7593768032313907,
"grad_norm": 0.90625,
"learning_rate": 0.0004953054473953742,
"loss": 6.174,
"mean_token_accuracy": 0.16408377885818481,
"num_tokens": 16652724.0,
"step": 6580
},
{
"entropy": 6.300872707366944,
"epoch": 0.7599538372763993,
"grad_norm": 0.7890625,
"learning_rate": 0.0004952970583902251,
"loss": 6.1405,
"mean_token_accuracy": 0.16957145929336548,
"num_tokens": 16666045.0,
"step": 6585
},
{
"entropy": 6.358345413208008,
"epoch": 0.760530871321408,
"grad_norm": 0.8046875,
"learning_rate": 0.0004952886619754937,
"loss": 6.2554,
"mean_token_accuracy": 0.16089996993541716,
"num_tokens": 16678422.0,
"step": 6590
},
{
"entropy": 6.361907529830932,
"epoch": 0.7611079053664166,
"grad_norm": 0.8203125,
"learning_rate": 0.0004952802581514625,
"loss": 6.1704,
"mean_token_accuracy": 0.17014944702386856,
"num_tokens": 16690243.0,
"step": 6595
},
{
"entropy": 6.311407661437988,
"epoch": 0.7616849394114252,
"grad_norm": 0.8359375,
"learning_rate": 0.0004952718469184144,
"loss": 6.1312,
"mean_token_accuracy": 0.17277286797761918,
"num_tokens": 16702418.0,
"step": 6600
},
{
"entropy": 6.436389970779419,
"epoch": 0.762261973456434,
"grad_norm": 0.796875,
"learning_rate": 0.0004952634282766322,
"loss": 6.2206,
"mean_token_accuracy": 0.15880272090435027,
"num_tokens": 16713974.0,
"step": 6605
},
{
"entropy": 6.349586820602417,
"epoch": 0.7628390075014426,
"grad_norm": 0.921875,
"learning_rate": 0.0004952550022263988,
"loss": 6.1066,
"mean_token_accuracy": 0.17593667209148406,
"num_tokens": 16726518.0,
"step": 6610
},
{
"entropy": 6.310934448242188,
"epoch": 0.7634160415464513,
"grad_norm": 0.76953125,
"learning_rate": 0.0004952465687679979,
"loss": 6.1369,
"mean_token_accuracy": 0.17361938208341599,
"num_tokens": 16738701.0,
"step": 6615
},
{
"entropy": 6.3912577629089355,
"epoch": 0.7639930755914599,
"grad_norm": 0.76953125,
"learning_rate": 0.000495238127901713,
"loss": 6.186,
"mean_token_accuracy": 0.1613457351922989,
"num_tokens": 16751251.0,
"step": 6620
},
{
"entropy": 6.388515663146973,
"epoch": 0.7645701096364685,
"grad_norm": 0.78515625,
"learning_rate": 0.0004952296796278282,
"loss": 6.1779,
"mean_token_accuracy": 0.16940819919109346,
"num_tokens": 16764233.0,
"step": 6625
},
{
"entropy": 6.276236534118652,
"epoch": 0.7651471436814772,
"grad_norm": 0.88671875,
"learning_rate": 0.0004952212239466274,
"loss": 6.1759,
"mean_token_accuracy": 0.1788155049085617,
"num_tokens": 16778408.0,
"step": 6630
},
{
"entropy": 6.3944172859191895,
"epoch": 0.7657241777264858,
"grad_norm": 0.8203125,
"learning_rate": 0.0004952127608583953,
"loss": 6.2105,
"mean_token_accuracy": 0.16523972898721695,
"num_tokens": 16789863.0,
"step": 6635
},
{
"entropy": 6.392884111404419,
"epoch": 0.7663012117714946,
"grad_norm": 0.83203125,
"learning_rate": 0.0004952042903634162,
"loss": 6.1331,
"mean_token_accuracy": 0.17282791584730148,
"num_tokens": 16804448.0,
"step": 6640
},
{
"entropy": 6.314636993408203,
"epoch": 0.7668782458165032,
"grad_norm": 0.83984375,
"learning_rate": 0.0004951958124619752,
"loss": 6.231,
"mean_token_accuracy": 0.16494413763284682,
"num_tokens": 16817922.0,
"step": 6645
},
{
"entropy": 6.392580652236939,
"epoch": 0.7674552798615119,
"grad_norm": 0.75390625,
"learning_rate": 0.0004951873271543573,
"loss": 6.2165,
"mean_token_accuracy": 0.16729218661785125,
"num_tokens": 16830322.0,
"step": 6650
},
{
"entropy": 6.465516519546509,
"epoch": 0.7680323139065205,
"grad_norm": 0.890625,
"learning_rate": 0.0004951788344408483,
"loss": 6.2252,
"mean_token_accuracy": 0.16338257789611815,
"num_tokens": 16843489.0,
"step": 6655
},
{
"entropy": 6.345834875106812,
"epoch": 0.7686093479515291,
"grad_norm": 0.8125,
"learning_rate": 0.0004951703343217335,
"loss": 6.1887,
"mean_token_accuracy": 0.16055528968572616,
"num_tokens": 16855256.0,
"step": 6660
},
{
"entropy": 6.285180187225341,
"epoch": 0.7691863819965378,
"grad_norm": 0.7890625,
"learning_rate": 0.0004951618267972987,
"loss": 6.171,
"mean_token_accuracy": 0.1670081600546837,
"num_tokens": 16869927.0,
"step": 6665
},
{
"entropy": 6.294586229324341,
"epoch": 0.7697634160415464,
"grad_norm": 0.91015625,
"learning_rate": 0.0004951533118678304,
"loss": 6.0723,
"mean_token_accuracy": 0.18153493106365204,
"num_tokens": 16882095.0,
"step": 6670
},
{
"entropy": 6.4467226505279545,
"epoch": 0.7703404500865552,
"grad_norm": 0.90625,
"learning_rate": 0.0004951447895336147,
"loss": 6.2758,
"mean_token_accuracy": 0.16662507206201554,
"num_tokens": 16893338.0,
"step": 6675
},
{
"entropy": 6.349839162826538,
"epoch": 0.7709174841315638,
"grad_norm": 0.828125,
"learning_rate": 0.0004951362597949384,
"loss": 6.2421,
"mean_token_accuracy": 0.16923239529132844,
"num_tokens": 16907138.0,
"step": 6680
},
{
"entropy": 6.409167861938476,
"epoch": 0.7714945181765724,
"grad_norm": 1.0390625,
"learning_rate": 0.0004951277226520883,
"loss": 6.1483,
"mean_token_accuracy": 0.16991439014673232,
"num_tokens": 16919756.0,
"step": 6685
},
{
"entropy": 6.386492919921875,
"epoch": 0.7720715522215811,
"grad_norm": 0.8125,
"learning_rate": 0.0004951191781053517,
"loss": 6.104,
"mean_token_accuracy": 0.17598668336868287,
"num_tokens": 16932059.0,
"step": 6690
},
{
"entropy": 6.321619033813477,
"epoch": 0.7726485862665897,
"grad_norm": 0.9296875,
"learning_rate": 0.0004951106261550157,
"loss": 6.2057,
"mean_token_accuracy": 0.16631946563720704,
"num_tokens": 16944777.0,
"step": 6695
},
{
"entropy": 6.380236434936523,
"epoch": 0.7732256203115984,
"grad_norm": 0.8046875,
"learning_rate": 0.0004951020668013683,
"loss": 6.1656,
"mean_token_accuracy": 0.17202370017766952,
"num_tokens": 16957111.0,
"step": 6700
},
{
"entropy": 6.385104084014893,
"epoch": 0.773802654356607,
"grad_norm": 0.84375,
"learning_rate": 0.0004950935000446972,
"loss": 6.2429,
"mean_token_accuracy": 0.15982713252305986,
"num_tokens": 16968663.0,
"step": 6705
},
{
"entropy": 6.359501457214355,
"epoch": 0.7743796884016156,
"grad_norm": 0.80078125,
"learning_rate": 0.0004950849258852905,
"loss": 6.168,
"mean_token_accuracy": 0.16180971562862395,
"num_tokens": 16980668.0,
"step": 6710
},
{
"entropy": 6.346779251098633,
"epoch": 0.7749567224466244,
"grad_norm": 0.7890625,
"learning_rate": 0.0004950763443234366,
"loss": 6.2033,
"mean_token_accuracy": 0.16977418661117555,
"num_tokens": 16993537.0,
"step": 6715
},
{
"entropy": 6.372853565216064,
"epoch": 0.775533756491633,
"grad_norm": 0.765625,
"learning_rate": 0.0004950677553594243,
"loss": 6.18,
"mean_token_accuracy": 0.16297179460525513,
"num_tokens": 17006268.0,
"step": 6720
},
{
"entropy": 6.383951425552368,
"epoch": 0.7761107905366417,
"grad_norm": 0.84375,
"learning_rate": 0.0004950591589935422,
"loss": 6.1762,
"mean_token_accuracy": 0.1659395158290863,
"num_tokens": 17018643.0,
"step": 6725
},
{
"entropy": 6.294509315490723,
"epoch": 0.7766878245816503,
"grad_norm": 0.87890625,
"learning_rate": 0.0004950505552260798,
"loss": 6.1452,
"mean_token_accuracy": 0.17016030550003053,
"num_tokens": 17030670.0,
"step": 6730
},
{
"entropy": 6.4208496570587155,
"epoch": 0.777264858626659,
"grad_norm": 0.828125,
"learning_rate": 0.0004950419440573261,
"loss": 6.155,
"mean_token_accuracy": 0.17145975232124328,
"num_tokens": 17042617.0,
"step": 6735
},
{
"entropy": 6.289498710632325,
"epoch": 0.7778418926716676,
"grad_norm": 0.8046875,
"learning_rate": 0.000495033325487571,
"loss": 6.2014,
"mean_token_accuracy": 0.16481405943632127,
"num_tokens": 17055217.0,
"step": 6740
},
{
"entropy": 6.231577014923095,
"epoch": 0.7784189267166762,
"grad_norm": 0.828125,
"learning_rate": 0.0004950246995171042,
"loss": 6.054,
"mean_token_accuracy": 0.18304862976074218,
"num_tokens": 17068614.0,
"step": 6745
},
{
"entropy": 6.345638132095337,
"epoch": 0.778995960761685,
"grad_norm": 0.921875,
"learning_rate": 0.000495016066146216,
"loss": 6.089,
"mean_token_accuracy": 0.17975687980651855,
"num_tokens": 17079892.0,
"step": 6750
},
{
"entropy": 6.320506286621094,
"epoch": 0.7795729948066936,
"grad_norm": 0.85546875,
"learning_rate": 0.0004950074253751968,
"loss": 6.187,
"mean_token_accuracy": 0.17330573499202728,
"num_tokens": 17092113.0,
"step": 6755
},
{
"entropy": 6.373245906829834,
"epoch": 0.7801500288517023,
"grad_norm": 0.87890625,
"learning_rate": 0.000494998777204337,
"loss": 6.1624,
"mean_token_accuracy": 0.1723353922367096,
"num_tokens": 17103387.0,
"step": 6760
},
{
"entropy": 6.408647680282593,
"epoch": 0.7807270628967109,
"grad_norm": 0.828125,
"learning_rate": 0.0004949901216339276,
"loss": 6.2118,
"mean_token_accuracy": 0.16432149559259415,
"num_tokens": 17116008.0,
"step": 6765
},
{
"entropy": 6.3029053688049315,
"epoch": 0.7813040969417195,
"grad_norm": 0.7890625,
"learning_rate": 0.0004949814586642598,
"loss": 6.0949,
"mean_token_accuracy": 0.1802838459610939,
"num_tokens": 17129224.0,
"step": 6770
},
{
"entropy": 6.2848211288452145,
"epoch": 0.7818811309867282,
"grad_norm": 0.8515625,
"learning_rate": 0.000494972788295625,
"loss": 6.0943,
"mean_token_accuracy": 0.16807924062013627,
"num_tokens": 17141357.0,
"step": 6775
},
{
"entropy": 6.308895206451416,
"epoch": 0.7824581650317368,
"grad_norm": 0.79296875,
"learning_rate": 0.0004949641105283144,
"loss": 6.1263,
"mean_token_accuracy": 0.17011737823486328,
"num_tokens": 17153672.0,
"step": 6780
},
{
"entropy": 6.329161548614502,
"epoch": 0.7830351990767456,
"grad_norm": 0.84765625,
"learning_rate": 0.0004949554253626205,
"loss": 6.1984,
"mean_token_accuracy": 0.16174544990062714,
"num_tokens": 17168429.0,
"step": 6785
},
{
"entropy": 6.412427520751953,
"epoch": 0.7836122331217542,
"grad_norm": 0.85546875,
"learning_rate": 0.0004949467327988351,
"loss": 6.1309,
"mean_token_accuracy": 0.16915023773908616,
"num_tokens": 17181000.0,
"step": 6790
},
{
"entropy": 6.298403978347778,
"epoch": 0.7841892671667628,
"grad_norm": 0.82421875,
"learning_rate": 0.0004949380328372505,
"loss": 6.1312,
"mean_token_accuracy": 0.16709219068288803,
"num_tokens": 17193984.0,
"step": 6795
},
{
"entropy": 6.35187873840332,
"epoch": 0.7847663012117715,
"grad_norm": 0.84765625,
"learning_rate": 0.0004949293254781595,
"loss": 6.1563,
"mean_token_accuracy": 0.17206377685070037,
"num_tokens": 17207289.0,
"step": 6800
},
{
"entropy": 6.3366005420684814,
"epoch": 0.7853433352567801,
"grad_norm": 0.80078125,
"learning_rate": 0.0004949206107218547,
"loss": 6.207,
"mean_token_accuracy": 0.16879773288965225,
"num_tokens": 17220785.0,
"step": 6805
},
{
"entropy": 6.426763868331909,
"epoch": 0.7859203693017888,
"grad_norm": 0.86328125,
"learning_rate": 0.0004949118885686296,
"loss": 6.1794,
"mean_token_accuracy": 0.1629263088107109,
"num_tokens": 17233475.0,
"step": 6810
},
{
"entropy": 6.387394714355469,
"epoch": 0.7864974033467974,
"grad_norm": 0.796875,
"learning_rate": 0.0004949031590187774,
"loss": 6.154,
"mean_token_accuracy": 0.1672731891274452,
"num_tokens": 17246652.0,
"step": 6815
},
{
"entropy": 6.331944465637207,
"epoch": 0.7870744373918062,
"grad_norm": 0.859375,
"learning_rate": 0.0004948944220725915,
"loss": 6.1632,
"mean_token_accuracy": 0.1671597495675087,
"num_tokens": 17259966.0,
"step": 6820
},
{
"entropy": 6.285306072235107,
"epoch": 0.7876514714368148,
"grad_norm": 0.796875,
"learning_rate": 0.000494885677730366,
"loss": 6.0972,
"mean_token_accuracy": 0.1782669961452484,
"num_tokens": 17272556.0,
"step": 6825
},
{
"entropy": 6.356509113311768,
"epoch": 0.7882285054818234,
"grad_norm": 0.890625,
"learning_rate": 0.000494876925992395,
"loss": 6.1213,
"mean_token_accuracy": 0.1762054055929184,
"num_tokens": 17285960.0,
"step": 6830
},
{
"entropy": 6.398293352127075,
"epoch": 0.7888055395268321,
"grad_norm": 0.8515625,
"learning_rate": 0.0004948681668589728,
"loss": 6.2315,
"mean_token_accuracy": 0.15961660146713258,
"num_tokens": 17299743.0,
"step": 6835
},
{
"entropy": 6.301696109771728,
"epoch": 0.7893825735718407,
"grad_norm": 0.8125,
"learning_rate": 0.000494859400330394,
"loss": 6.1103,
"mean_token_accuracy": 0.16794033199548722,
"num_tokens": 17312317.0,
"step": 6840
},
{
"entropy": 6.351978206634522,
"epoch": 0.7899596076168494,
"grad_norm": 0.7734375,
"learning_rate": 0.0004948506264069535,
"loss": 6.1624,
"mean_token_accuracy": 0.167983041703701,
"num_tokens": 17326204.0,
"step": 6845
},
{
"entropy": 6.338317823410034,
"epoch": 0.790536641661858,
"grad_norm": 0.83984375,
"learning_rate": 0.0004948418450889464,
"loss": 6.1077,
"mean_token_accuracy": 0.1751476228237152,
"num_tokens": 17338362.0,
"step": 6850
},
{
"entropy": 6.257613039016723,
"epoch": 0.7911136757068667,
"grad_norm": 0.77734375,
"learning_rate": 0.000494833056376668,
"loss": 6.1526,
"mean_token_accuracy": 0.1725895255804062,
"num_tokens": 17350713.0,
"step": 6855
},
{
"entropy": 6.426647043228149,
"epoch": 0.7916907097518754,
"grad_norm": 1.015625,
"learning_rate": 0.0004948242602704139,
"loss": 6.185,
"mean_token_accuracy": 0.16246354728937148,
"num_tokens": 17364055.0,
"step": 6860
},
{
"entropy": 6.354440021514892,
"epoch": 0.792267743796884,
"grad_norm": 0.8515625,
"learning_rate": 0.0004948154567704801,
"loss": 6.2338,
"mean_token_accuracy": 0.1697024703025818,
"num_tokens": 17377940.0,
"step": 6865
},
{
"entropy": 6.37884521484375,
"epoch": 0.7928447778418927,
"grad_norm": 0.82421875,
"learning_rate": 0.0004948066458771625,
"loss": 6.1571,
"mean_token_accuracy": 0.17270761132240295,
"num_tokens": 17390348.0,
"step": 6870
},
{
"entropy": 6.355157947540283,
"epoch": 0.7934218118869013,
"grad_norm": 0.859375,
"learning_rate": 0.0004947978275907577,
"loss": 6.1631,
"mean_token_accuracy": 0.17038169950246812,
"num_tokens": 17403406.0,
"step": 6875
},
{
"entropy": 6.323590803146362,
"epoch": 0.79399884593191,
"grad_norm": 0.8203125,
"learning_rate": 0.000494789001911562,
"loss": 6.1659,
"mean_token_accuracy": 0.16402290314435958,
"num_tokens": 17415306.0,
"step": 6880
},
{
"entropy": 6.354849624633789,
"epoch": 0.7945758799769186,
"grad_norm": 0.80859375,
"learning_rate": 0.0004947801688398725,
"loss": 6.2131,
"mean_token_accuracy": 0.16550301611423493,
"num_tokens": 17427901.0,
"step": 6885
},
{
"entropy": 6.385193347930908,
"epoch": 0.7951529140219273,
"grad_norm": 0.87109375,
"learning_rate": 0.0004947713283759862,
"loss": 6.1557,
"mean_token_accuracy": 0.16478197127580643,
"num_tokens": 17439812.0,
"step": 6890
},
{
"entropy": 6.380311965942383,
"epoch": 0.795729948066936,
"grad_norm": 0.81640625,
"learning_rate": 0.0004947624805202003,
"loss": 6.2637,
"mean_token_accuracy": 0.16673970818519593,
"num_tokens": 17453317.0,
"step": 6895
},
{
"entropy": 6.315207052230835,
"epoch": 0.7963069821119446,
"grad_norm": 0.80859375,
"learning_rate": 0.0004947536252728126,
"loss": 6.1383,
"mean_token_accuracy": 0.16237509697675706,
"num_tokens": 17465563.0,
"step": 6900
},
{
"entropy": 6.343274450302124,
"epoch": 0.7968840161569533,
"grad_norm": 0.9296875,
"learning_rate": 0.0004947447626341209,
"loss": 6.2019,
"mean_token_accuracy": 0.16558388322591783,
"num_tokens": 17477672.0,
"step": 6905
},
{
"entropy": 6.394934368133545,
"epoch": 0.7974610502019619,
"grad_norm": 0.81640625,
"learning_rate": 0.0004947358926044232,
"loss": 6.168,
"mean_token_accuracy": 0.16697321683168412,
"num_tokens": 17489061.0,
"step": 6910
},
{
"entropy": 6.357774353027343,
"epoch": 0.7980380842469705,
"grad_norm": 0.8359375,
"learning_rate": 0.0004947270151840179,
"loss": 6.1935,
"mean_token_accuracy": 0.1671817809343338,
"num_tokens": 17501734.0,
"step": 6915
},
{
"entropy": 6.3456621170043945,
"epoch": 0.7986151182919792,
"grad_norm": 0.859375,
"learning_rate": 0.0004947181303732038,
"loss": 6.1014,
"mean_token_accuracy": 0.16575353741645812,
"num_tokens": 17514387.0,
"step": 6920
},
{
"entropy": 6.3213715076446535,
"epoch": 0.7991921523369879,
"grad_norm": 0.89453125,
"learning_rate": 0.0004947092381722793,
"loss": 6.1093,
"mean_token_accuracy": 0.176436585187912,
"num_tokens": 17526483.0,
"step": 6925
},
{
"entropy": 6.3709863185882565,
"epoch": 0.7997691863819966,
"grad_norm": 0.80859375,
"learning_rate": 0.0004947003385815438,
"loss": 6.1283,
"mean_token_accuracy": 0.17597151696681976,
"num_tokens": 17539809.0,
"step": 6930
},
{
"entropy": 6.328467512130738,
"epoch": 0.8003462204270052,
"grad_norm": 0.85546875,
"learning_rate": 0.0004946914316012964,
"loss": 6.1598,
"mean_token_accuracy": 0.16539319902658461,
"num_tokens": 17552973.0,
"step": 6935
},
{
"entropy": 6.3325916767120365,
"epoch": 0.8009232544720138,
"grad_norm": 0.80078125,
"learning_rate": 0.000494682517231837,
"loss": 6.1964,
"mean_token_accuracy": 0.16823789924383165,
"num_tokens": 17567803.0,
"step": 6940
},
{
"entropy": 6.404011678695679,
"epoch": 0.8015002885170225,
"grad_norm": 0.80859375,
"learning_rate": 0.0004946735954734652,
"loss": 6.1555,
"mean_token_accuracy": 0.16666851192712784,
"num_tokens": 17579718.0,
"step": 6945
},
{
"entropy": 6.385808038711548,
"epoch": 0.8020773225620311,
"grad_norm": 0.8984375,
"learning_rate": 0.0004946646663264811,
"loss": 6.1333,
"mean_token_accuracy": 0.1694340467453003,
"num_tokens": 17592384.0,
"step": 6950
},
{
"entropy": 6.309904003143311,
"epoch": 0.8026543566070398,
"grad_norm": 0.84375,
"learning_rate": 0.0004946557297911852,
"loss": 6.0212,
"mean_token_accuracy": 0.17547217458486558,
"num_tokens": 17604292.0,
"step": 6955
},
{
"entropy": 6.287991714477539,
"epoch": 0.8032313906520485,
"grad_norm": 0.80859375,
"learning_rate": 0.0004946467858678777,
"loss": 6.075,
"mean_token_accuracy": 0.17394087314605713,
"num_tokens": 17616638.0,
"step": 6960
},
{
"entropy": 6.383854913711548,
"epoch": 0.8038084246970572,
"grad_norm": 0.80078125,
"learning_rate": 0.0004946378345568597,
"loss": 6.1799,
"mean_token_accuracy": 0.16211076080799103,
"num_tokens": 17630672.0,
"step": 6965
},
{
"entropy": 6.366672039031982,
"epoch": 0.8043854587420658,
"grad_norm": 1.1328125,
"learning_rate": 0.0004946288758584324,
"loss": 6.1695,
"mean_token_accuracy": 0.16282691508531572,
"num_tokens": 17644215.0,
"step": 6970
},
{
"entropy": 6.3507161140441895,
"epoch": 0.8049624927870744,
"grad_norm": 0.84375,
"learning_rate": 0.0004946199097728968,
"loss": 6.2385,
"mean_token_accuracy": 0.1637930914759636,
"num_tokens": 17655982.0,
"step": 6975
},
{
"entropy": 6.403667640686035,
"epoch": 0.8055395268320831,
"grad_norm": 0.90625,
"learning_rate": 0.0004946109363005548,
"loss": 6.1556,
"mean_token_accuracy": 0.16717308312654494,
"num_tokens": 17668059.0,
"step": 6980
},
{
"entropy": 6.378528499603272,
"epoch": 0.8061165608770917,
"grad_norm": 0.84375,
"learning_rate": 0.000494601955441708,
"loss": 6.1703,
"mean_token_accuracy": 0.17550845742225646,
"num_tokens": 17680924.0,
"step": 6985
},
{
"entropy": 6.313846302032471,
"epoch": 0.8066935949221004,
"grad_norm": 0.78515625,
"learning_rate": 0.0004945929671966585,
"loss": 6.1863,
"mean_token_accuracy": 0.1592755913734436,
"num_tokens": 17693381.0,
"step": 6990
},
{
"entropy": 6.293050956726074,
"epoch": 0.8072706289671091,
"grad_norm": 0.83203125,
"learning_rate": 0.0004945839715657085,
"loss": 6.0838,
"mean_token_accuracy": 0.1738973081111908,
"num_tokens": 17705900.0,
"step": 6995
},
{
"entropy": 6.292917346954345,
"epoch": 0.8078476630121177,
"grad_norm": 0.80078125,
"learning_rate": 0.0004945749685491607,
"loss": 6.0748,
"mean_token_accuracy": 0.17757318913936615,
"num_tokens": 17719139.0,
"step": 7000
},
{
"entropy": 6.337329006195068,
"epoch": 0.8084246970571264,
"grad_norm": 0.75390625,
"learning_rate": 0.0004945659581473181,
"loss": 6.0884,
"mean_token_accuracy": 0.17271215915679933,
"num_tokens": 17734312.0,
"step": 7005
},
{
"entropy": 6.381900072097778,
"epoch": 0.809001731102135,
"grad_norm": 0.86328125,
"learning_rate": 0.0004945569403604833,
"loss": 6.1688,
"mean_token_accuracy": 0.16242203563451768,
"num_tokens": 17746137.0,
"step": 7010
},
{
"entropy": 6.320837736129761,
"epoch": 0.8095787651471437,
"grad_norm": 0.83203125,
"learning_rate": 0.0004945479151889601,
"loss": 5.9999,
"mean_token_accuracy": 0.17752463966608048,
"num_tokens": 17758879.0,
"step": 7015
},
{
"entropy": 6.252843236923217,
"epoch": 0.8101557991921523,
"grad_norm": 0.875,
"learning_rate": 0.0004945388826330517,
"loss": 6.1388,
"mean_token_accuracy": 0.1744886964559555,
"num_tokens": 17770820.0,
"step": 7020
},
{
"entropy": 6.382633686065674,
"epoch": 0.8107328332371609,
"grad_norm": 0.8359375,
"learning_rate": 0.0004945298426930621,
"loss": 6.1936,
"mean_token_accuracy": 0.16758178621530534,
"num_tokens": 17783495.0,
"step": 7025
},
{
"entropy": 6.428963232040405,
"epoch": 0.8113098672821697,
"grad_norm": 0.86328125,
"learning_rate": 0.0004945207953692952,
"loss": 6.1614,
"mean_token_accuracy": 0.1685134768486023,
"num_tokens": 17795780.0,
"step": 7030
},
{
"entropy": 6.311816883087158,
"epoch": 0.8118869013271783,
"grad_norm": 0.83203125,
"learning_rate": 0.0004945117406620556,
"loss": 6.1866,
"mean_token_accuracy": 0.1712436020374298,
"num_tokens": 17809684.0,
"step": 7035
},
{
"entropy": 6.322688293457031,
"epoch": 0.812463935372187,
"grad_norm": 0.85546875,
"learning_rate": 0.0004945026785716474,
"loss": 6.1805,
"mean_token_accuracy": 0.16512720435857772,
"num_tokens": 17822719.0,
"step": 7040
},
{
"entropy": 6.381142044067383,
"epoch": 0.8130409694171956,
"grad_norm": 0.8046875,
"learning_rate": 0.0004944936090983757,
"loss": 6.2109,
"mean_token_accuracy": 0.16516452431678771,
"num_tokens": 17834883.0,
"step": 7045
},
{
"entropy": 6.307264518737793,
"epoch": 0.8136180034622043,
"grad_norm": 0.7890625,
"learning_rate": 0.0004944845322425455,
"loss": 6.1272,
"mean_token_accuracy": 0.1770351156592369,
"num_tokens": 17847009.0,
"step": 7050
},
{
"entropy": 6.375383043289185,
"epoch": 0.8141950375072129,
"grad_norm": 0.8125,
"learning_rate": 0.0004944754480044621,
"loss": 6.152,
"mean_token_accuracy": 0.1666557177901268,
"num_tokens": 17859106.0,
"step": 7055
},
{
"entropy": 6.412518787384033,
"epoch": 0.8147720715522215,
"grad_norm": 0.8125,
"learning_rate": 0.0004944663563844311,
"loss": 6.1608,
"mean_token_accuracy": 0.16627125889062883,
"num_tokens": 17871418.0,
"step": 7060
},
{
"entropy": 6.2879682064056395,
"epoch": 0.8153491055972303,
"grad_norm": 0.75390625,
"learning_rate": 0.0004944572573827581,
"loss": 6.1249,
"mean_token_accuracy": 0.17137539982795716,
"num_tokens": 17884219.0,
"step": 7065
},
{
"entropy": 6.307466506958008,
"epoch": 0.8159261396422389,
"grad_norm": 0.8203125,
"learning_rate": 0.0004944481509997494,
"loss": 6.131,
"mean_token_accuracy": 0.1689067393541336,
"num_tokens": 17896206.0,
"step": 7070
},
{
"entropy": 6.3939979553222654,
"epoch": 0.8165031736872476,
"grad_norm": 0.77734375,
"learning_rate": 0.000494439037235711,
"loss": 6.2326,
"mean_token_accuracy": 0.16438301056623458,
"num_tokens": 17909488.0,
"step": 7075
},
{
"entropy": 6.375418043136596,
"epoch": 0.8170802077322562,
"grad_norm": 0.8359375,
"learning_rate": 0.0004944299160909495,
"loss": 6.1777,
"mean_token_accuracy": 0.16011893153190612,
"num_tokens": 17922851.0,
"step": 7080
},
{
"entropy": 6.360374975204468,
"epoch": 0.8176572417772648,
"grad_norm": 0.90625,
"learning_rate": 0.000494420787565772,
"loss": 6.0912,
"mean_token_accuracy": 0.1776879087090492,
"num_tokens": 17934586.0,
"step": 7085
},
{
"entropy": 6.310594892501831,
"epoch": 0.8182342758222735,
"grad_norm": 0.78125,
"learning_rate": 0.0004944116516604852,
"loss": 6.1938,
"mean_token_accuracy": 0.16266183257102967,
"num_tokens": 17947637.0,
"step": 7090
},
{
"entropy": 6.354241228103637,
"epoch": 0.8188113098672821,
"grad_norm": 0.859375,
"learning_rate": 0.0004944025083753965,
"loss": 6.1478,
"mean_token_accuracy": 0.16983843892812728,
"num_tokens": 17959601.0,
"step": 7095
},
{
"entropy": 6.352024364471435,
"epoch": 0.8193883439122909,
"grad_norm": 0.84765625,
"learning_rate": 0.0004943933577108133,
"loss": 6.1451,
"mean_token_accuracy": 0.17091177701950072,
"num_tokens": 17972568.0,
"step": 7100
},
{
"entropy": 6.36655969619751,
"epoch": 0.8199653779572995,
"grad_norm": 0.8984375,
"learning_rate": 0.0004943841996670436,
"loss": 6.1432,
"mean_token_accuracy": 0.17002700716257096,
"num_tokens": 17984665.0,
"step": 7105
},
{
"entropy": 6.368354558944702,
"epoch": 0.8205424120023082,
"grad_norm": 0.8046875,
"learning_rate": 0.0004943750342443953,
"loss": 6.1736,
"mean_token_accuracy": 0.1608754187822342,
"num_tokens": 17997140.0,
"step": 7110
},
{
"entropy": 6.355606889724731,
"epoch": 0.8211194460473168,
"grad_norm": 0.84765625,
"learning_rate": 0.0004943658614431767,
"loss": 6.1686,
"mean_token_accuracy": 0.17113997787237167,
"num_tokens": 18009361.0,
"step": 7115
},
{
"entropy": 6.314159536361695,
"epoch": 0.8216964800923254,
"grad_norm": 0.80078125,
"learning_rate": 0.0004943566812636963,
"loss": 6.1279,
"mean_token_accuracy": 0.16654883027076722,
"num_tokens": 18021233.0,
"step": 7120
},
{
"entropy": 6.274408292770386,
"epoch": 0.8222735141373341,
"grad_norm": 0.76953125,
"learning_rate": 0.000494347493706263,
"loss": 5.995,
"mean_token_accuracy": 0.18178044259548187,
"num_tokens": 18034086.0,
"step": 7125
},
{
"entropy": 6.336907291412354,
"epoch": 0.8228505481823427,
"grad_norm": 0.7578125,
"learning_rate": 0.0004943382987711856,
"loss": 6.0874,
"mean_token_accuracy": 0.1737489327788353,
"num_tokens": 18046604.0,
"step": 7130
},
{
"entropy": 6.3122608184814455,
"epoch": 0.8234275822273515,
"grad_norm": 0.8125,
"learning_rate": 0.0004943290964587734,
"loss": 6.1347,
"mean_token_accuracy": 0.17065211534500122,
"num_tokens": 18059185.0,
"step": 7135
},
{
"entropy": 6.315145111083984,
"epoch": 0.8240046162723601,
"grad_norm": 0.71875,
"learning_rate": 0.0004943198867693361,
"loss": 6.0646,
"mean_token_accuracy": 0.16893559992313384,
"num_tokens": 18071707.0,
"step": 7140
},
{
"entropy": 6.3502250671386715,
"epoch": 0.8245816503173687,
"grad_norm": 0.84765625,
"learning_rate": 0.0004943106697031833,
"loss": 6.2012,
"mean_token_accuracy": 0.16397445499897004,
"num_tokens": 18084657.0,
"step": 7145
},
{
"entropy": 6.363767099380493,
"epoch": 0.8251586843623774,
"grad_norm": 0.8515625,
"learning_rate": 0.0004943014452606251,
"loss": 6.1819,
"mean_token_accuracy": 0.1693504735827446,
"num_tokens": 18097084.0,
"step": 7150
},
{
"entropy": 6.316252565383911,
"epoch": 0.825735718407386,
"grad_norm": 0.8125,
"learning_rate": 0.0004942922134419717,
"loss": 6.1042,
"mean_token_accuracy": 0.1739456221461296,
"num_tokens": 18109306.0,
"step": 7155
},
{
"entropy": 6.270631885528564,
"epoch": 0.8263127524523947,
"grad_norm": 0.85546875,
"learning_rate": 0.0004942829742475336,
"loss": 6.0179,
"mean_token_accuracy": 0.1746932238340378,
"num_tokens": 18120300.0,
"step": 7160
},
{
"entropy": 6.370210361480713,
"epoch": 0.8268897864974033,
"grad_norm": 0.92578125,
"learning_rate": 0.0004942737276776217,
"loss": 6.1463,
"mean_token_accuracy": 0.16830987781286239,
"num_tokens": 18132251.0,
"step": 7165
},
{
"entropy": 6.304517507553101,
"epoch": 0.827466820542412,
"grad_norm": 0.796875,
"learning_rate": 0.0004942644737325468,
"loss": 6.0868,
"mean_token_accuracy": 0.17027855664491653,
"num_tokens": 18146198.0,
"step": 7170
},
{
"entropy": 6.336374759674072,
"epoch": 0.8280438545874207,
"grad_norm": 0.79296875,
"learning_rate": 0.0004942552124126202,
"loss": 6.1675,
"mean_token_accuracy": 0.16987940073013305,
"num_tokens": 18159493.0,
"step": 7175
},
{
"entropy": 6.277276945114136,
"epoch": 0.8286208886324293,
"grad_norm": 0.77734375,
"learning_rate": 0.0004942459437181535,
"loss": 6.0566,
"mean_token_accuracy": 0.17661636918783188,
"num_tokens": 18172120.0,
"step": 7180
},
{
"entropy": 6.330974435806274,
"epoch": 0.829197922677438,
"grad_norm": 0.8046875,
"learning_rate": 0.0004942366676494584,
"loss": 6.0871,
"mean_token_accuracy": 0.17477403432130814,
"num_tokens": 18184704.0,
"step": 7185
},
{
"entropy": 6.365555334091186,
"epoch": 0.8297749567224466,
"grad_norm": 0.88671875,
"learning_rate": 0.0004942273842068469,
"loss": 6.2001,
"mean_token_accuracy": 0.16935209333896636,
"num_tokens": 18196770.0,
"step": 7190
},
{
"entropy": 6.337525033950806,
"epoch": 0.8303519907674553,
"grad_norm": 0.8828125,
"learning_rate": 0.0004942180933906311,
"loss": 6.1627,
"mean_token_accuracy": 0.1656957224011421,
"num_tokens": 18209987.0,
"step": 7195
},
{
"entropy": 6.353645181655883,
"epoch": 0.8309290248124639,
"grad_norm": 0.765625,
"learning_rate": 0.0004942087952011237,
"loss": 6.1678,
"mean_token_accuracy": 0.16775988191366195,
"num_tokens": 18224864.0,
"step": 7200
},
{
"entropy": 6.3907112121582035,
"epoch": 0.8315060588574726,
"grad_norm": 0.8828125,
"learning_rate": 0.0004941994896386374,
"loss": 6.1344,
"mean_token_accuracy": 0.17219291627407074,
"num_tokens": 18237270.0,
"step": 7205
},
{
"entropy": 6.274297666549683,
"epoch": 0.8320830929024813,
"grad_norm": 0.80859375,
"learning_rate": 0.0004941901767034851,
"loss": 6.1408,
"mean_token_accuracy": 0.16556089669466018,
"num_tokens": 18251227.0,
"step": 7210
},
{
"entropy": 6.282907962799072,
"epoch": 0.8326601269474899,
"grad_norm": 0.80859375,
"learning_rate": 0.0004941808563959802,
"loss": 6.0705,
"mean_token_accuracy": 0.17843919098377228,
"num_tokens": 18264762.0,
"step": 7215
},
{
"entropy": 6.360298109054566,
"epoch": 0.8332371609924986,
"grad_norm": 0.86328125,
"learning_rate": 0.0004941715287164359,
"loss": 6.1437,
"mean_token_accuracy": 0.16581116169691085,
"num_tokens": 18276836.0,
"step": 7220
},
{
"entropy": 6.303939580917358,
"epoch": 0.8338141950375072,
"grad_norm": 0.83203125,
"learning_rate": 0.0004941621936651661,
"loss": 6.1484,
"mean_token_accuracy": 0.1756073772907257,
"num_tokens": 18290362.0,
"step": 7225
},
{
"entropy": 6.3812695980072025,
"epoch": 0.8343912290825158,
"grad_norm": 0.80078125,
"learning_rate": 0.0004941528512424849,
"loss": 6.1855,
"mean_token_accuracy": 0.1699386864900589,
"num_tokens": 18303924.0,
"step": 7230
},
{
"entropy": 6.256930303573609,
"epoch": 0.8349682631275245,
"grad_norm": 0.85546875,
"learning_rate": 0.0004941435014487064,
"loss": 6.0611,
"mean_token_accuracy": 0.17561491429805756,
"num_tokens": 18316490.0,
"step": 7235
},
{
"entropy": 6.353484201431274,
"epoch": 0.8355452971725332,
"grad_norm": 0.765625,
"learning_rate": 0.000494134144284145,
"loss": 6.1025,
"mean_token_accuracy": 0.1660989746451378,
"num_tokens": 18328819.0,
"step": 7240
},
{
"entropy": 6.304037189483642,
"epoch": 0.8361223312175419,
"grad_norm": 0.79296875,
"learning_rate": 0.0004941247797491156,
"loss": 6.0602,
"mean_token_accuracy": 0.1737822934985161,
"num_tokens": 18341872.0,
"step": 7245
},
{
"entropy": 6.340513896942139,
"epoch": 0.8366993652625505,
"grad_norm": 0.85546875,
"learning_rate": 0.0004941154078439329,
"loss": 6.1038,
"mean_token_accuracy": 0.16772937178611755,
"num_tokens": 18354644.0,
"step": 7250
},
{
"entropy": 6.343120098114014,
"epoch": 0.8372763993075591,
"grad_norm": 0.8203125,
"learning_rate": 0.0004941060285689126,
"loss": 6.1118,
"mean_token_accuracy": 0.16333391666412353,
"num_tokens": 18367581.0,
"step": 7255
},
{
"entropy": 6.312895965576172,
"epoch": 0.8378534333525678,
"grad_norm": 0.82421875,
"learning_rate": 0.0004940966419243695,
"loss": 6.1211,
"mean_token_accuracy": 0.17633418142795562,
"num_tokens": 18381123.0,
"step": 7260
},
{
"entropy": 6.286964797973633,
"epoch": 0.8384304673975764,
"grad_norm": 0.7734375,
"learning_rate": 0.00049408724791062,
"loss": 6.0478,
"mean_token_accuracy": 0.17762214839458465,
"num_tokens": 18395711.0,
"step": 7265
},
{
"entropy": 6.341670942306519,
"epoch": 0.8390075014425851,
"grad_norm": 0.79296875,
"learning_rate": 0.0004940778465279797,
"loss": 6.182,
"mean_token_accuracy": 0.16106790006160737,
"num_tokens": 18409434.0,
"step": 7270
},
{
"entropy": 6.362900352478027,
"epoch": 0.8395845354875938,
"grad_norm": 0.765625,
"learning_rate": 0.0004940684377767647,
"loss": 6.1384,
"mean_token_accuracy": 0.16549608409404754,
"num_tokens": 18423138.0,
"step": 7275
},
{
"entropy": 6.352203893661499,
"epoch": 0.8401615695326025,
"grad_norm": 0.84765625,
"learning_rate": 0.0004940590216572916,
"loss": 6.1294,
"mean_token_accuracy": 0.1653735965490341,
"num_tokens": 18435655.0,
"step": 7280
},
{
"entropy": 6.256585645675659,
"epoch": 0.8407386035776111,
"grad_norm": 0.7734375,
"learning_rate": 0.0004940495981698772,
"loss": 6.0172,
"mean_token_accuracy": 0.1793304905295372,
"num_tokens": 18448344.0,
"step": 7285
},
{
"entropy": 6.291251516342163,
"epoch": 0.8413156376226197,
"grad_norm": 0.87890625,
"learning_rate": 0.0004940401673148384,
"loss": 6.0295,
"mean_token_accuracy": 0.1761486664414406,
"num_tokens": 18460409.0,
"step": 7290
},
{
"entropy": 6.3027403354644775,
"epoch": 0.8418926716676284,
"grad_norm": 0.87890625,
"learning_rate": 0.0004940307290924923,
"loss": 6.1387,
"mean_token_accuracy": 0.16713238060474395,
"num_tokens": 18473650.0,
"step": 7295
},
{
"entropy": 6.2306482791900635,
"epoch": 0.842469705712637,
"grad_norm": 0.828125,
"learning_rate": 0.0004940212835031565,
"loss": 6.0544,
"mean_token_accuracy": 0.17755862772464753,
"num_tokens": 18487108.0,
"step": 7300
},
{
"entropy": 6.340290069580078,
"epoch": 0.8430467397576457,
"grad_norm": 1.3203125,
"learning_rate": 0.0004940118305471486,
"loss": 6.0866,
"mean_token_accuracy": 0.17275313138961793,
"num_tokens": 18500377.0,
"step": 7305
},
{
"entropy": 6.35522575378418,
"epoch": 0.8436237738026544,
"grad_norm": 0.80859375,
"learning_rate": 0.0004940023702247866,
"loss": 6.151,
"mean_token_accuracy": 0.16355671882629394,
"num_tokens": 18513257.0,
"step": 7310
},
{
"entropy": 6.301067304611206,
"epoch": 0.844200807847663,
"grad_norm": 0.84765625,
"learning_rate": 0.0004939929025363886,
"loss": 6.1754,
"mean_token_accuracy": 0.16708555519580842,
"num_tokens": 18525438.0,
"step": 7315
},
{
"entropy": 6.382996892929077,
"epoch": 0.8447778418926717,
"grad_norm": 0.82421875,
"learning_rate": 0.0004939834274822731,
"loss": 6.1996,
"mean_token_accuracy": 0.16973353773355485,
"num_tokens": 18537937.0,
"step": 7320
},
{
"entropy": 6.446295928955078,
"epoch": 0.8453548759376803,
"grad_norm": 0.80859375,
"learning_rate": 0.0004939739450627588,
"loss": 6.2119,
"mean_token_accuracy": 0.1619974046945572,
"num_tokens": 18551629.0,
"step": 7325
},
{
"entropy": 6.287714242935181,
"epoch": 0.845931909982689,
"grad_norm": 0.89453125,
"learning_rate": 0.0004939644552781647,
"loss": 6.1511,
"mean_token_accuracy": 0.16715734750032424,
"num_tokens": 18564549.0,
"step": 7330
},
{
"entropy": 6.365425777435303,
"epoch": 0.8465089440276976,
"grad_norm": 0.90234375,
"learning_rate": 0.0004939549581288099,
"loss": 6.1246,
"mean_token_accuracy": 0.17667931765317918,
"num_tokens": 18576536.0,
"step": 7335
},
{
"entropy": 6.259944009780884,
"epoch": 0.8470859780727062,
"grad_norm": 0.90625,
"learning_rate": 0.0004939454536150138,
"loss": 6.1022,
"mean_token_accuracy": 0.1768004596233368,
"num_tokens": 18588655.0,
"step": 7340
},
{
"entropy": 6.272363328933716,
"epoch": 0.847663012117715,
"grad_norm": 0.94921875,
"learning_rate": 0.000493935941737096,
"loss": 6.0528,
"mean_token_accuracy": 0.18020471781492234,
"num_tokens": 18602152.0,
"step": 7345
},
{
"entropy": 6.318509721755982,
"epoch": 0.8482400461627236,
"grad_norm": 0.83984375,
"learning_rate": 0.0004939264224953768,
"loss": 6.0656,
"mean_token_accuracy": 0.17690059542655945,
"num_tokens": 18615391.0,
"step": 7350
},
{
"entropy": 6.310171890258789,
"epoch": 0.8488170802077323,
"grad_norm": 0.86328125,
"learning_rate": 0.000493916895890176,
"loss": 6.1261,
"mean_token_accuracy": 0.16611895263195037,
"num_tokens": 18629987.0,
"step": 7355
},
{
"entropy": 6.41483244895935,
"epoch": 0.8493941142527409,
"grad_norm": 0.8046875,
"learning_rate": 0.000493907361921814,
"loss": 6.2245,
"mean_token_accuracy": 0.16478994786739348,
"num_tokens": 18643064.0,
"step": 7360
},
{
"entropy": 6.428786897659302,
"epoch": 0.8499711482977496,
"grad_norm": 0.890625,
"learning_rate": 0.0004938978205906118,
"loss": 6.1505,
"mean_token_accuracy": 0.16683144271373748,
"num_tokens": 18654950.0,
"step": 7365
},
{
"entropy": 6.333185768127441,
"epoch": 0.8505481823427582,
"grad_norm": 0.8515625,
"learning_rate": 0.0004938882718968901,
"loss": 6.1116,
"mean_token_accuracy": 0.16756715178489684,
"num_tokens": 18666318.0,
"step": 7370
},
{
"entropy": 6.29099555015564,
"epoch": 0.8511252163877668,
"grad_norm": 0.8515625,
"learning_rate": 0.0004938787158409702,
"loss": 6.0553,
"mean_token_accuracy": 0.17675474882125855,
"num_tokens": 18677357.0,
"step": 7375
},
{
"entropy": 6.326018810272217,
"epoch": 0.8517022504327756,
"grad_norm": 0.89453125,
"learning_rate": 0.0004938691524231733,
"loss": 6.089,
"mean_token_accuracy": 0.17274203151464462,
"num_tokens": 18689563.0,
"step": 7380
},
{
"entropy": 6.243793678283692,
"epoch": 0.8522792844777842,
"grad_norm": 0.89453125,
"learning_rate": 0.0004938595816438212,
"loss": 6.0914,
"mean_token_accuracy": 0.17055510282516478,
"num_tokens": 18701442.0,
"step": 7385
},
{
"entropy": 6.345879173278808,
"epoch": 0.8528563185227929,
"grad_norm": 0.8359375,
"learning_rate": 0.0004938500035032358,
"loss": 6.1358,
"mean_token_accuracy": 0.16795708388090133,
"num_tokens": 18714942.0,
"step": 7390
},
{
"entropy": 6.301207065582275,
"epoch": 0.8534333525678015,
"grad_norm": 1.265625,
"learning_rate": 0.0004938404180017392,
"loss": 6.1479,
"mean_token_accuracy": 0.17592194825410842,
"num_tokens": 18727752.0,
"step": 7395
},
{
"entropy": 6.375054931640625,
"epoch": 0.8540103866128101,
"grad_norm": 0.91796875,
"learning_rate": 0.0004938308251396539,
"loss": 6.1466,
"mean_token_accuracy": 0.1679084911942482,
"num_tokens": 18741719.0,
"step": 7400
},
{
"entropy": 6.36941819190979,
"epoch": 0.8545874206578188,
"grad_norm": 0.875,
"learning_rate": 0.0004938212249173024,
"loss": 6.1028,
"mean_token_accuracy": 0.16361988335847855,
"num_tokens": 18754472.0,
"step": 7405
},
{
"entropy": 6.340943050384522,
"epoch": 0.8551644547028274,
"grad_norm": 0.82421875,
"learning_rate": 0.0004938116173350078,
"loss": 6.1826,
"mean_token_accuracy": 0.17019001990556717,
"num_tokens": 18766691.0,
"step": 7410
},
{
"entropy": 6.338998222351075,
"epoch": 0.8557414887478362,
"grad_norm": 0.84375,
"learning_rate": 0.0004938020023930932,
"loss": 6.1005,
"mean_token_accuracy": 0.17442042529582977,
"num_tokens": 18780083.0,
"step": 7415
},
{
"entropy": 6.400058031082153,
"epoch": 0.8563185227928448,
"grad_norm": 0.7578125,
"learning_rate": 0.0004937923800918817,
"loss": 6.1818,
"mean_token_accuracy": 0.16902839243412018,
"num_tokens": 18792559.0,
"step": 7420
},
{
"entropy": 6.251423120498657,
"epoch": 0.8568955568378535,
"grad_norm": 0.78125,
"learning_rate": 0.0004937827504316974,
"loss": 6.0284,
"mean_token_accuracy": 0.18225133568048477,
"num_tokens": 18805089.0,
"step": 7425
},
{
"entropy": 6.211493444442749,
"epoch": 0.8574725908828621,
"grad_norm": 0.8203125,
"learning_rate": 0.0004937731134128639,
"loss": 6.0332,
"mean_token_accuracy": 0.1719786286354065,
"num_tokens": 18818476.0,
"step": 7430
},
{
"entropy": 6.3511707305908205,
"epoch": 0.8580496249278707,
"grad_norm": 0.83984375,
"learning_rate": 0.0004937634690357054,
"loss": 6.2004,
"mean_token_accuracy": 0.16616718769073485,
"num_tokens": 18830785.0,
"step": 7435
},
{
"entropy": 6.408740901947022,
"epoch": 0.8586266589728794,
"grad_norm": 0.89453125,
"learning_rate": 0.0004937538173005462,
"loss": 6.1835,
"mean_token_accuracy": 0.16461452692747117,
"num_tokens": 18844029.0,
"step": 7440
},
{
"entropy": 6.291387891769409,
"epoch": 0.859203693017888,
"grad_norm": 0.88671875,
"learning_rate": 0.0004937441582077111,
"loss": 6.1483,
"mean_token_accuracy": 0.17121766805648803,
"num_tokens": 18857468.0,
"step": 7445
},
{
"entropy": 6.330543279647827,
"epoch": 0.8597807270628968,
"grad_norm": 0.75,
"learning_rate": 0.0004937344917575249,
"loss": 6.0788,
"mean_token_accuracy": 0.16908426731824874,
"num_tokens": 18870487.0,
"step": 7450
},
{
"entropy": 6.330011510848999,
"epoch": 0.8603577611079054,
"grad_norm": 0.80078125,
"learning_rate": 0.0004937248179503127,
"loss": 6.1243,
"mean_token_accuracy": 0.16731321513652803,
"num_tokens": 18883273.0,
"step": 7455
},
{
"entropy": 6.275924921035767,
"epoch": 0.860934795152914,
"grad_norm": 0.86328125,
"learning_rate": 0.0004937151367863998,
"loss": 6.1026,
"mean_token_accuracy": 0.1796159490942955,
"num_tokens": 18895863.0,
"step": 7460
},
{
"entropy": 6.320479679107666,
"epoch": 0.8615118291979227,
"grad_norm": 0.8046875,
"learning_rate": 0.000493705448266112,
"loss": 6.1605,
"mean_token_accuracy": 0.17161056995391846,
"num_tokens": 18909406.0,
"step": 7465
},
{
"entropy": 6.242699718475341,
"epoch": 0.8620888632429313,
"grad_norm": 0.8046875,
"learning_rate": 0.0004936957523897752,
"loss": 6.0972,
"mean_token_accuracy": 0.17375921010971068,
"num_tokens": 18922794.0,
"step": 7470
},
{
"entropy": 6.2935127258300785,
"epoch": 0.86266589728794,
"grad_norm": 0.84765625,
"learning_rate": 0.0004936860491577153,
"loss": 6.1127,
"mean_token_accuracy": 0.17393147498369216,
"num_tokens": 18936511.0,
"step": 7475
},
{
"entropy": 6.371639537811279,
"epoch": 0.8632429313329486,
"grad_norm": 0.8671875,
"learning_rate": 0.0004936763385702588,
"loss": 6.1866,
"mean_token_accuracy": 0.16243817955255507,
"num_tokens": 18948164.0,
"step": 7480
},
{
"entropy": 6.3689943790435795,
"epoch": 0.8638199653779572,
"grad_norm": 0.7734375,
"learning_rate": 0.0004936666206277322,
"loss": 6.1756,
"mean_token_accuracy": 0.16454965472221375,
"num_tokens": 18960608.0,
"step": 7485
},
{
"entropy": 6.296132802963257,
"epoch": 0.864396999422966,
"grad_norm": 0.796875,
"learning_rate": 0.0004936568953304624,
"loss": 6.031,
"mean_token_accuracy": 0.18456006944179534,
"num_tokens": 18972266.0,
"step": 7490
},
{
"entropy": 6.284459924697876,
"epoch": 0.8649740334679746,
"grad_norm": 0.8125,
"learning_rate": 0.0004936471626787766,
"loss": 6.0742,
"mean_token_accuracy": 0.17050421088933945,
"num_tokens": 18984518.0,
"step": 7495
},
{
"entropy": 6.2937500953674315,
"epoch": 0.8655510675129833,
"grad_norm": 0.84375,
"learning_rate": 0.0004936374226730022,
"loss": 6.1031,
"mean_token_accuracy": 0.17538830041885375,
"num_tokens": 18998611.0,
"step": 7500
},
{
"entropy": 6.312690019607544,
"epoch": 0.8661281015579919,
"grad_norm": 0.86328125,
"learning_rate": 0.0004936276753134666,
"loss": 6.0866,
"mean_token_accuracy": 0.17135524600744248,
"num_tokens": 19012117.0,
"step": 7505
},
{
"entropy": 6.209308815002442,
"epoch": 0.8667051356030006,
"grad_norm": 0.765625,
"learning_rate": 0.0004936179206004976,
"loss": 6.003,
"mean_token_accuracy": 0.1783718004822731,
"num_tokens": 19024075.0,
"step": 7510
},
{
"entropy": 6.337769603729248,
"epoch": 0.8672821696480092,
"grad_norm": 0.80078125,
"learning_rate": 0.0004936081585344236,
"loss": 6.1795,
"mean_token_accuracy": 0.16607438176870346,
"num_tokens": 19037350.0,
"step": 7515
},
{
"entropy": 6.41182656288147,
"epoch": 0.8678592036930178,
"grad_norm": 0.84375,
"learning_rate": 0.0004935983891155727,
"loss": 6.1854,
"mean_token_accuracy": 0.1657259300351143,
"num_tokens": 19049438.0,
"step": 7520
},
{
"entropy": 6.26032190322876,
"epoch": 0.8684362377380266,
"grad_norm": 0.7890625,
"learning_rate": 0.0004935886123442737,
"loss": 6.139,
"mean_token_accuracy": 0.1676519051194191,
"num_tokens": 19061689.0,
"step": 7525
},
{
"entropy": 6.391968154907227,
"epoch": 0.8690132717830352,
"grad_norm": 0.94921875,
"learning_rate": 0.0004935788282208551,
"loss": 6.1892,
"mean_token_accuracy": 0.1616821691393852,
"num_tokens": 19075606.0,
"step": 7530
},
{
"entropy": 6.353225660324097,
"epoch": 0.8695903058280439,
"grad_norm": 0.83984375,
"learning_rate": 0.0004935690367456464,
"loss": 6.1027,
"mean_token_accuracy": 0.17230516970157622,
"num_tokens": 19088248.0,
"step": 7535
},
{
"entropy": 6.297004318237304,
"epoch": 0.8701673398730525,
"grad_norm": 0.80859375,
"learning_rate": 0.0004935592379189766,
"loss": 6.0805,
"mean_token_accuracy": 0.17194265127182007,
"num_tokens": 19102480.0,
"step": 7540
},
{
"entropy": 6.260242652893067,
"epoch": 0.8707443739180611,
"grad_norm": 0.859375,
"learning_rate": 0.0004935494317411754,
"loss": 6.0698,
"mean_token_accuracy": 0.18137836903333665,
"num_tokens": 19114454.0,
"step": 7545
},
{
"entropy": 6.308724689483642,
"epoch": 0.8713214079630698,
"grad_norm": 0.8359375,
"learning_rate": 0.0004935396182125726,
"loss": 6.1046,
"mean_token_accuracy": 0.17647117376327515,
"num_tokens": 19126709.0,
"step": 7550
},
{
"entropy": 6.270776891708374,
"epoch": 0.8718984420080784,
"grad_norm": 0.87109375,
"learning_rate": 0.0004935297973334983,
"loss": 6.1159,
"mean_token_accuracy": 0.17235394865274428,
"num_tokens": 19138831.0,
"step": 7555
},
{
"entropy": 6.326720905303955,
"epoch": 0.8724754760530872,
"grad_norm": 0.7890625,
"learning_rate": 0.0004935199691042828,
"loss": 5.9959,
"mean_token_accuracy": 0.1755734920501709,
"num_tokens": 19151555.0,
"step": 7560
},
{
"entropy": 6.307219934463501,
"epoch": 0.8730525100980958,
"grad_norm": 0.828125,
"learning_rate": 0.0004935101335252568,
"loss": 6.0574,
"mean_token_accuracy": 0.17710819989442825,
"num_tokens": 19164557.0,
"step": 7565
},
{
"entropy": 6.3488623142242435,
"epoch": 0.8736295441431045,
"grad_norm": 0.8515625,
"learning_rate": 0.0004935002905967509,
"loss": 6.1943,
"mean_token_accuracy": 0.1654577985405922,
"num_tokens": 19177081.0,
"step": 7570
},
{
"entropy": 6.294558429718018,
"epoch": 0.8742065781881131,
"grad_norm": 0.8046875,
"learning_rate": 0.0004934904403190963,
"loss": 6.0486,
"mean_token_accuracy": 0.17522133886814117,
"num_tokens": 19190209.0,
"step": 7575
},
{
"entropy": 6.328292036056519,
"epoch": 0.8747836122331217,
"grad_norm": 0.8359375,
"learning_rate": 0.0004934805826926242,
"loss": 6.097,
"mean_token_accuracy": 0.1691294565796852,
"num_tokens": 19202262.0,
"step": 7580
},
{
"entropy": 6.295896530151367,
"epoch": 0.8753606462781304,
"grad_norm": 0.96875,
"learning_rate": 0.0004934707177176663,
"loss": 6.1196,
"mean_token_accuracy": 0.17082754224538804,
"num_tokens": 19214752.0,
"step": 7585
},
{
"entropy": 6.347747945785523,
"epoch": 0.875937680323139,
"grad_norm": 0.81640625,
"learning_rate": 0.0004934608453945543,
"loss": 6.1597,
"mean_token_accuracy": 0.16672886908054352,
"num_tokens": 19227320.0,
"step": 7590
},
{
"entropy": 6.350468921661377,
"epoch": 0.8765147143681478,
"grad_norm": 0.78515625,
"learning_rate": 0.0004934509657236203,
"loss": 6.1475,
"mean_token_accuracy": 0.16858987361192704,
"num_tokens": 19239571.0,
"step": 7595
},
{
"entropy": 6.335233497619629,
"epoch": 0.8770917484131564,
"grad_norm": 0.77734375,
"learning_rate": 0.0004934410787051965,
"loss": 6.0903,
"mean_token_accuracy": 0.1747870922088623,
"num_tokens": 19252242.0,
"step": 7600
},
{
"entropy": 6.353438425064087,
"epoch": 0.877668782458165,
"grad_norm": 0.84765625,
"learning_rate": 0.0004934311843396157,
"loss": 6.1536,
"mean_token_accuracy": 0.16885416358709335,
"num_tokens": 19265501.0,
"step": 7605
},
{
"entropy": 6.254431247711182,
"epoch": 0.8782458165031737,
"grad_norm": 0.80859375,
"learning_rate": 0.0004934212826272104,
"loss": 6.0048,
"mean_token_accuracy": 0.18254768401384353,
"num_tokens": 19278152.0,
"step": 7610
},
{
"entropy": 6.249722099304199,
"epoch": 0.8788228505481823,
"grad_norm": 0.90234375,
"learning_rate": 0.0004934113735683137,
"loss": 6.1195,
"mean_token_accuracy": 0.1660146526992321,
"num_tokens": 19290555.0,
"step": 7615
},
{
"entropy": 6.320179605484009,
"epoch": 0.879399884593191,
"grad_norm": 0.796875,
"learning_rate": 0.000493401457163259,
"loss": 6.0742,
"mean_token_accuracy": 0.17674531638622284,
"num_tokens": 19302866.0,
"step": 7620
},
{
"entropy": 6.364961194992065,
"epoch": 0.8799769186381996,
"grad_norm": 0.9453125,
"learning_rate": 0.0004933915334123798,
"loss": 6.1585,
"mean_token_accuracy": 0.16327778846025467,
"num_tokens": 19315577.0,
"step": 7625
},
{
"entropy": 6.353976726531982,
"epoch": 0.8805539526832084,
"grad_norm": 0.89453125,
"learning_rate": 0.0004933816023160099,
"loss": 6.1489,
"mean_token_accuracy": 0.16975017488002778,
"num_tokens": 19328593.0,
"step": 7630
},
{
"entropy": 6.3438011646270756,
"epoch": 0.881130986728217,
"grad_norm": 0.921875,
"learning_rate": 0.0004933716638744832,
"loss": 6.1096,
"mean_token_accuracy": 0.17835207879543305,
"num_tokens": 19341669.0,
"step": 7635
},
{
"entropy": 6.283733320236206,
"epoch": 0.8817080207732256,
"grad_norm": 0.828125,
"learning_rate": 0.000493361718088134,
"loss": 6.0937,
"mean_token_accuracy": 0.17275342345237732,
"num_tokens": 19354268.0,
"step": 7640
},
{
"entropy": 6.345350837707519,
"epoch": 0.8822850548182343,
"grad_norm": 0.77734375,
"learning_rate": 0.000493351764957297,
"loss": 6.1448,
"mean_token_accuracy": 0.16772449910640716,
"num_tokens": 19367676.0,
"step": 7645
},
{
"entropy": 6.375120687484741,
"epoch": 0.8828620888632429,
"grad_norm": 0.80078125,
"learning_rate": 0.0004933418044823068,
"loss": 6.0982,
"mean_token_accuracy": 0.17239805161952973,
"num_tokens": 19380726.0,
"step": 7650
},
{
"entropy": 6.311630487442017,
"epoch": 0.8834391229082516,
"grad_norm": 0.96875,
"learning_rate": 0.0004933318366634984,
"loss": 6.1146,
"mean_token_accuracy": 0.16780938059091569,
"num_tokens": 19392917.0,
"step": 7655
},
{
"entropy": 6.36509075164795,
"epoch": 0.8840161569532602,
"grad_norm": 0.8046875,
"learning_rate": 0.0004933218615012072,
"loss": 6.1418,
"mean_token_accuracy": 0.17104663252830504,
"num_tokens": 19406026.0,
"step": 7660
},
{
"entropy": 6.322006559371948,
"epoch": 0.8845931909982689,
"grad_norm": 0.8515625,
"learning_rate": 0.0004933118789957687,
"loss": 6.1075,
"mean_token_accuracy": 0.17266625314950942,
"num_tokens": 19418612.0,
"step": 7665
},
{
"entropy": 6.3031665802001955,
"epoch": 0.8851702250432776,
"grad_norm": 0.85546875,
"learning_rate": 0.0004933018891475186,
"loss": 6.1445,
"mean_token_accuracy": 0.16820344775915147,
"num_tokens": 19430746.0,
"step": 7670
},
{
"entropy": 6.3470458984375,
"epoch": 0.8857472590882862,
"grad_norm": 0.875,
"learning_rate": 0.0004932918919567927,
"loss": 6.1882,
"mean_token_accuracy": 0.16353080421686172,
"num_tokens": 19443043.0,
"step": 7675
},
{
"entropy": 6.37825984954834,
"epoch": 0.8863242931332949,
"grad_norm": 0.7421875,
"learning_rate": 0.0004932818874239275,
"loss": 6.1202,
"mean_token_accuracy": 0.1737432137131691,
"num_tokens": 19456463.0,
"step": 7680
},
{
"entropy": 6.364214897155762,
"epoch": 0.8869013271783035,
"grad_norm": 0.8203125,
"learning_rate": 0.0004932718755492595,
"loss": 6.1201,
"mean_token_accuracy": 0.1649479940533638,
"num_tokens": 19468108.0,
"step": 7685
},
{
"entropy": 6.3020881652832035,
"epoch": 0.8874783612233121,
"grad_norm": 0.83203125,
"learning_rate": 0.0004932618563331254,
"loss": 6.1433,
"mean_token_accuracy": 0.16941626369953156,
"num_tokens": 19480741.0,
"step": 7690
},
{
"entropy": 6.326077938079834,
"epoch": 0.8880553952683208,
"grad_norm": 0.83984375,
"learning_rate": 0.0004932518297758622,
"loss": 6.076,
"mean_token_accuracy": 0.17261420786380768,
"num_tokens": 19492996.0,
"step": 7695
},
{
"entropy": 6.355397272109985,
"epoch": 0.8886324293133295,
"grad_norm": 0.796875,
"learning_rate": 0.0004932417958778071,
"loss": 6.0986,
"mean_token_accuracy": 0.17076902687549592,
"num_tokens": 19505513.0,
"step": 7700
},
{
"entropy": 6.336492681503296,
"epoch": 0.8892094633583382,
"grad_norm": 0.80078125,
"learning_rate": 0.0004932317546392976,
"loss": 6.21,
"mean_token_accuracy": 0.16580649316310883,
"num_tokens": 19518244.0,
"step": 7705
},
{
"entropy": 6.319612598419189,
"epoch": 0.8897864974033468,
"grad_norm": 0.8359375,
"learning_rate": 0.0004932217060606714,
"loss": 6.1084,
"mean_token_accuracy": 0.17041295915842056,
"num_tokens": 19530987.0,
"step": 7710
},
{
"entropy": 6.298898792266845,
"epoch": 0.8903635314483554,
"grad_norm": 0.7578125,
"learning_rate": 0.0004932116501422665,
"loss": 6.0194,
"mean_token_accuracy": 0.17620886564254762,
"num_tokens": 19543546.0,
"step": 7715
},
{
"entropy": 6.3706581592559814,
"epoch": 0.8909405654933641,
"grad_norm": 0.87109375,
"learning_rate": 0.0004932015868844211,
"loss": 6.1005,
"mean_token_accuracy": 0.16944789588451387,
"num_tokens": 19556867.0,
"step": 7720
},
{
"entropy": 6.28508243560791,
"epoch": 0.8915175995383727,
"grad_norm": 0.85546875,
"learning_rate": 0.0004931915162874738,
"loss": 6.0956,
"mean_token_accuracy": 0.1710782304406166,
"num_tokens": 19569738.0,
"step": 7725
},
{
"entropy": 6.323682594299316,
"epoch": 0.8920946335833814,
"grad_norm": 0.81640625,
"learning_rate": 0.0004931814383517632,
"loss": 6.1219,
"mean_token_accuracy": 0.1682348594069481,
"num_tokens": 19581701.0,
"step": 7730
},
{
"entropy": 6.300376987457275,
"epoch": 0.8926716676283901,
"grad_norm": 0.859375,
"learning_rate": 0.0004931713530776284,
"loss": 6.0451,
"mean_token_accuracy": 0.1782558888196945,
"num_tokens": 19593698.0,
"step": 7735
},
{
"entropy": 6.293739461898804,
"epoch": 0.8932487016733988,
"grad_norm": 0.8515625,
"learning_rate": 0.0004931612604654083,
"loss": 6.111,
"mean_token_accuracy": 0.17010954022407532,
"num_tokens": 19605323.0,
"step": 7740
},
{
"entropy": 6.367745971679687,
"epoch": 0.8938257357184074,
"grad_norm": 0.8828125,
"learning_rate": 0.0004931511605154428,
"loss": 6.149,
"mean_token_accuracy": 0.16876049041748048,
"num_tokens": 19616577.0,
"step": 7745
},
{
"entropy": 6.328808069229126,
"epoch": 0.894402769763416,
"grad_norm": 0.9296875,
"learning_rate": 0.0004931410532280711,
"loss": 6.0588,
"mean_token_accuracy": 0.17267925143241883,
"num_tokens": 19629177.0,
"step": 7750
},
{
"entropy": 6.28749303817749,
"epoch": 0.8949798038084247,
"grad_norm": 0.90625,
"learning_rate": 0.0004931309386036337,
"loss": 6.0895,
"mean_token_accuracy": 0.16957223564386367,
"num_tokens": 19642170.0,
"step": 7755
},
{
"entropy": 6.2514848709106445,
"epoch": 0.8955568378534333,
"grad_norm": 0.8203125,
"learning_rate": 0.0004931208166424704,
"loss": 6.0435,
"mean_token_accuracy": 0.17608153969049453,
"num_tokens": 19655648.0,
"step": 7760
},
{
"entropy": 6.278182458877564,
"epoch": 0.896133871898442,
"grad_norm": 0.75,
"learning_rate": 0.0004931106873449219,
"loss": 6.0284,
"mean_token_accuracy": 0.17348928600549698,
"num_tokens": 19667941.0,
"step": 7765
},
{
"entropy": 6.33781328201294,
"epoch": 0.8967109059434507,
"grad_norm": 0.8125,
"learning_rate": 0.0004931005507113285,
"loss": 6.1276,
"mean_token_accuracy": 0.17680104076862335,
"num_tokens": 19680523.0,
"step": 7770
},
{
"entropy": 6.186305379867553,
"epoch": 0.8972879399884593,
"grad_norm": 0.8046875,
"learning_rate": 0.0004930904067420317,
"loss": 6.0853,
"mean_token_accuracy": 0.17290082722902297,
"num_tokens": 19692984.0,
"step": 7775
},
{
"entropy": 6.357298135757446,
"epoch": 0.897864974033468,
"grad_norm": 0.890625,
"learning_rate": 0.0004930802554373723,
"loss": 6.0333,
"mean_token_accuracy": 0.17422391027212142,
"num_tokens": 19705926.0,
"step": 7780
},
{
"entropy": 6.330864429473877,
"epoch": 0.8984420080784766,
"grad_norm": 0.91015625,
"learning_rate": 0.0004930700967976918,
"loss": 6.1001,
"mean_token_accuracy": 0.17609639912843705,
"num_tokens": 19717322.0,
"step": 7785
},
{
"entropy": 6.271629285812378,
"epoch": 0.8990190421234853,
"grad_norm": 0.80078125,
"learning_rate": 0.000493059930823332,
"loss": 6.1051,
"mean_token_accuracy": 0.1606309935450554,
"num_tokens": 19730577.0,
"step": 7790
},
{
"entropy": 6.341148757934571,
"epoch": 0.8995960761684939,
"grad_norm": 0.84375,
"learning_rate": 0.0004930497575146346,
"loss": 6.1059,
"mean_token_accuracy": 0.17063196897506713,
"num_tokens": 19744054.0,
"step": 7795
},
{
"entropy": 6.293493986129761,
"epoch": 0.9001731102135025,
"grad_norm": 0.83203125,
"learning_rate": 0.0004930395768719421,
"loss": 6.1121,
"mean_token_accuracy": 0.16904201358556747,
"num_tokens": 19755898.0,
"step": 7800
},
{
"entropy": 6.325391483306885,
"epoch": 0.9007501442585113,
"grad_norm": 0.7421875,
"learning_rate": 0.0004930293888955966,
"loss": 6.1668,
"mean_token_accuracy": 0.1650414600968361,
"num_tokens": 19769599.0,
"step": 7805
},
{
"entropy": 6.402347612380981,
"epoch": 0.9013271783035199,
"grad_norm": 0.84375,
"learning_rate": 0.000493019193585941,
"loss": 6.1494,
"mean_token_accuracy": 0.16273540258407593,
"num_tokens": 19783442.0,
"step": 7810
},
{
"entropy": 6.3388293266296385,
"epoch": 0.9019042123485286,
"grad_norm": 0.87890625,
"learning_rate": 0.000493008990943318,
"loss": 6.1781,
"mean_token_accuracy": 0.16862280368804933,
"num_tokens": 19796039.0,
"step": 7815
},
{
"entropy": 6.331880807876587,
"epoch": 0.9024812463935372,
"grad_norm": 0.8515625,
"learning_rate": 0.0004929987809680709,
"loss": 6.1204,
"mean_token_accuracy": 0.17673451751470565,
"num_tokens": 19808695.0,
"step": 7820
},
{
"entropy": 6.3146881580352785,
"epoch": 0.9030582804385459,
"grad_norm": 0.85546875,
"learning_rate": 0.0004929885636605432,
"loss": 6.0867,
"mean_token_accuracy": 0.17208350598812103,
"num_tokens": 19821173.0,
"step": 7825
},
{
"entropy": 6.29907455444336,
"epoch": 0.9036353144835545,
"grad_norm": 0.80078125,
"learning_rate": 0.0004929783390210784,
"loss": 6.1543,
"mean_token_accuracy": 0.1662888213992119,
"num_tokens": 19833804.0,
"step": 7830
},
{
"entropy": 6.392211389541626,
"epoch": 0.9042123485285631,
"grad_norm": 0.83984375,
"learning_rate": 0.0004929681070500204,
"loss": 6.093,
"mean_token_accuracy": 0.16855536997318268,
"num_tokens": 19845690.0,
"step": 7835
},
{
"entropy": 6.29790940284729,
"epoch": 0.9047893825735719,
"grad_norm": 0.765625,
"learning_rate": 0.0004929578677477135,
"loss": 6.1018,
"mean_token_accuracy": 0.16329824179410934,
"num_tokens": 19859463.0,
"step": 7840
},
{
"entropy": 6.232066822052002,
"epoch": 0.9053664166185805,
"grad_norm": 0.83984375,
"learning_rate": 0.0004929476211145019,
"loss": 5.9956,
"mean_token_accuracy": 0.1839672550559044,
"num_tokens": 19872168.0,
"step": 7845
},
{
"entropy": 6.315573358535767,
"epoch": 0.9059434506635892,
"grad_norm": 0.84765625,
"learning_rate": 0.0004929373671507303,
"loss": 6.077,
"mean_token_accuracy": 0.1776381567120552,
"num_tokens": 19884927.0,
"step": 7850
},
{
"entropy": 6.283964967727661,
"epoch": 0.9065204847085978,
"grad_norm": 0.8984375,
"learning_rate": 0.0004929271058567436,
"loss": 6.0684,
"mean_token_accuracy": 0.17240298688411712,
"num_tokens": 19897105.0,
"step": 7855
},
{
"entropy": 6.282452011108399,
"epoch": 0.9070975187536064,
"grad_norm": 0.77734375,
"learning_rate": 0.000492916837232887,
"loss": 6.0928,
"mean_token_accuracy": 0.1691648006439209,
"num_tokens": 19909973.0,
"step": 7860
},
{
"entropy": 6.319969892501831,
"epoch": 0.9076745527986151,
"grad_norm": 0.87109375,
"learning_rate": 0.0004929065612795058,
"loss": 6.0996,
"mean_token_accuracy": 0.1771798312664032,
"num_tokens": 19923674.0,
"step": 7865
},
{
"entropy": 6.378555679321289,
"epoch": 0.9082515868436237,
"grad_norm": 0.921875,
"learning_rate": 0.0004928962779969456,
"loss": 6.1113,
"mean_token_accuracy": 0.16915464848279954,
"num_tokens": 19935742.0,
"step": 7870
},
{
"entropy": 6.290113019943237,
"epoch": 0.9088286208886325,
"grad_norm": 0.82421875,
"learning_rate": 0.0004928859873855524,
"loss": 6.0995,
"mean_token_accuracy": 0.16852633357048036,
"num_tokens": 19947945.0,
"step": 7875
},
{
"entropy": 6.3777001857757565,
"epoch": 0.9094056549336411,
"grad_norm": 0.82421875,
"learning_rate": 0.0004928756894456723,
"loss": 6.0505,
"mean_token_accuracy": 0.1752867430448532,
"num_tokens": 19961275.0,
"step": 7880
},
{
"entropy": 6.3458672046661375,
"epoch": 0.9099826889786498,
"grad_norm": 0.87109375,
"learning_rate": 0.0004928653841776515,
"loss": 6.1244,
"mean_token_accuracy": 0.16841503977775574,
"num_tokens": 19973634.0,
"step": 7885
},
{
"entropy": 6.317721605300903,
"epoch": 0.9105597230236584,
"grad_norm": 0.7734375,
"learning_rate": 0.0004928550715818368,
"loss": 6.1288,
"mean_token_accuracy": 0.17065613716840744,
"num_tokens": 19985920.0,
"step": 7890
},
{
"entropy": 6.338268184661866,
"epoch": 0.911136757068667,
"grad_norm": 0.87109375,
"learning_rate": 0.0004928447516585749,
"loss": 6.1363,
"mean_token_accuracy": 0.16494126617908478,
"num_tokens": 19999081.0,
"step": 7895
},
{
"entropy": 6.207415676116943,
"epoch": 0.9117137911136757,
"grad_norm": 0.82421875,
"learning_rate": 0.000492834424408213,
"loss": 6.0687,
"mean_token_accuracy": 0.1764218255877495,
"num_tokens": 20012801.0,
"step": 7900
},
{
"entropy": 6.397945928573608,
"epoch": 0.9122908251586843,
"grad_norm": 0.7734375,
"learning_rate": 0.0004928240898310984,
"loss": 6.1504,
"mean_token_accuracy": 0.16762229204177856,
"num_tokens": 20024618.0,
"step": 7905
},
{
"entropy": 6.352006244659424,
"epoch": 0.9128678592036931,
"grad_norm": 0.81640625,
"learning_rate": 0.0004928137479275789,
"loss": 6.1202,
"mean_token_accuracy": 0.1704690560698509,
"num_tokens": 20038587.0,
"step": 7910
},
{
"entropy": 6.303599882125854,
"epoch": 0.9134448932487017,
"grad_norm": 0.828125,
"learning_rate": 0.000492803398698002,
"loss": 6.1108,
"mean_token_accuracy": 0.16644177809357644,
"num_tokens": 20051811.0,
"step": 7915
},
{
"entropy": 6.360376930236816,
"epoch": 0.9140219272937103,
"grad_norm": 0.81640625,
"learning_rate": 0.0004927930421427161,
"loss": 6.1152,
"mean_token_accuracy": 0.16769687086343765,
"num_tokens": 20064463.0,
"step": 7920
},
{
"entropy": 6.255197620391845,
"epoch": 0.914598961338719,
"grad_norm": 0.87109375,
"learning_rate": 0.0004927826782620694,
"loss": 6.1075,
"mean_token_accuracy": 0.16811060458421706,
"num_tokens": 20076614.0,
"step": 7925
},
{
"entropy": 6.415706443786621,
"epoch": 0.9151759953837276,
"grad_norm": 1.0,
"learning_rate": 0.0004927723070564104,
"loss": 6.1995,
"mean_token_accuracy": 0.16223038583993912,
"num_tokens": 20090395.0,
"step": 7930
},
{
"entropy": 6.371805334091187,
"epoch": 0.9157530294287363,
"grad_norm": 0.84765625,
"learning_rate": 0.0004927619285260881,
"loss": 6.1335,
"mean_token_accuracy": 0.16719916462898254,
"num_tokens": 20102736.0,
"step": 7935
},
{
"entropy": 6.344775104522705,
"epoch": 0.9163300634737449,
"grad_norm": 0.89453125,
"learning_rate": 0.0004927515426714515,
"loss": 6.1302,
"mean_token_accuracy": 0.1690652996301651,
"num_tokens": 20116516.0,
"step": 7940
},
{
"entropy": 6.320330667495727,
"epoch": 0.9169070975187537,
"grad_norm": 0.8203125,
"learning_rate": 0.00049274114949285,
"loss": 6.1174,
"mean_token_accuracy": 0.17018368244171142,
"num_tokens": 20128742.0,
"step": 7945
},
{
"entropy": 6.328971815109253,
"epoch": 0.9174841315637623,
"grad_norm": 0.828125,
"learning_rate": 0.000492730748990633,
"loss": 6.078,
"mean_token_accuracy": 0.16928218305110931,
"num_tokens": 20140590.0,
"step": 7950
},
{
"entropy": 6.284335279464722,
"epoch": 0.9180611656087709,
"grad_norm": 0.78125,
"learning_rate": 0.0004927203411651504,
"loss": 6.0797,
"mean_token_accuracy": 0.16228621900081636,
"num_tokens": 20153748.0,
"step": 7955
},
{
"entropy": 6.353853940963745,
"epoch": 0.9186381996537796,
"grad_norm": 0.80078125,
"learning_rate": 0.0004927099260167523,
"loss": 6.0904,
"mean_token_accuracy": 0.1736527130007744,
"num_tokens": 20167094.0,
"step": 7960
},
{
"entropy": 6.308283567428589,
"epoch": 0.9192152336987882,
"grad_norm": 0.828125,
"learning_rate": 0.0004926995035457889,
"loss": 6.0619,
"mean_token_accuracy": 0.16892513036727905,
"num_tokens": 20180716.0,
"step": 7965
},
{
"entropy": 6.339779663085937,
"epoch": 0.9197922677437969,
"grad_norm": 0.87890625,
"learning_rate": 0.000492689073752611,
"loss": 6.1033,
"mean_token_accuracy": 0.17131576538085938,
"num_tokens": 20192214.0,
"step": 7970
},
{
"entropy": 6.226183223724365,
"epoch": 0.9203693017888055,
"grad_norm": 0.96484375,
"learning_rate": 0.0004926786366375691,
"loss": 5.991,
"mean_token_accuracy": 0.17104701697826385,
"num_tokens": 20204789.0,
"step": 7975
},
{
"entropy": 6.316816425323486,
"epoch": 0.9209463358338142,
"grad_norm": 0.8671875,
"learning_rate": 0.0004926681922010145,
"loss": 6.095,
"mean_token_accuracy": 0.16920481026172637,
"num_tokens": 20217318.0,
"step": 7980
},
{
"entropy": 6.4085766792297365,
"epoch": 0.9215233698788229,
"grad_norm": 0.859375,
"learning_rate": 0.0004926577404432982,
"loss": 6.0992,
"mean_token_accuracy": 0.16753261983394624,
"num_tokens": 20229757.0,
"step": 7985
},
{
"entropy": 6.276189374923706,
"epoch": 0.9221004039238315,
"grad_norm": 0.78125,
"learning_rate": 0.0004926472813647721,
"loss": 6.1228,
"mean_token_accuracy": 0.1687633216381073,
"num_tokens": 20242042.0,
"step": 7990
},
{
"entropy": 6.2141529560089115,
"epoch": 0.9226774379688402,
"grad_norm": 0.81640625,
"learning_rate": 0.0004926368149657876,
"loss": 6.0106,
"mean_token_accuracy": 0.18093141317367553,
"num_tokens": 20255188.0,
"step": 7995
},
{
"entropy": 6.415900802612304,
"epoch": 0.9232544720138488,
"grad_norm": 0.921875,
"learning_rate": 0.0004926263412466972,
"loss": 6.0902,
"mean_token_accuracy": 0.17318245768547058,
"num_tokens": 20267359.0,
"step": 8000
},
{
"entropy": 6.35699143409729,
"epoch": 0.9238315060588574,
"grad_norm": 0.79296875,
"learning_rate": 0.0004926158602078527,
"loss": 6.1837,
"mean_token_accuracy": 0.16548164188861847,
"num_tokens": 20280023.0,
"step": 8005
},
{
"entropy": 6.307455205917359,
"epoch": 0.9244085401038661,
"grad_norm": 0.8203125,
"learning_rate": 0.0004926053718496069,
"loss": 6.0779,
"mean_token_accuracy": 0.17290998697280885,
"num_tokens": 20293043.0,
"step": 8010
},
{
"entropy": 6.2883072853088375,
"epoch": 0.9249855741488748,
"grad_norm": 0.79296875,
"learning_rate": 0.0004925948761723126,
"loss": 6.0607,
"mean_token_accuracy": 0.16693697571754457,
"num_tokens": 20304929.0,
"step": 8015
},
{
"entropy": 6.302173900604248,
"epoch": 0.9255626081938835,
"grad_norm": 0.77734375,
"learning_rate": 0.0004925843731763226,
"loss": 6.067,
"mean_token_accuracy": 0.16893115490674973,
"num_tokens": 20317024.0,
"step": 8020
},
{
"entropy": 6.374800300598144,
"epoch": 0.9261396422388921,
"grad_norm": 0.8359375,
"learning_rate": 0.0004925738628619904,
"loss": 6.1205,
"mean_token_accuracy": 0.1658678874373436,
"num_tokens": 20329909.0,
"step": 8025
},
{
"entropy": 6.241035079956054,
"epoch": 0.9267166762839008,
"grad_norm": 0.7890625,
"learning_rate": 0.0004925633452296693,
"loss": 6.0841,
"mean_token_accuracy": 0.16910781860351562,
"num_tokens": 20344224.0,
"step": 8030
},
{
"entropy": 6.371493101119995,
"epoch": 0.9272937103289094,
"grad_norm": 0.85546875,
"learning_rate": 0.0004925528202797131,
"loss": 6.0854,
"mean_token_accuracy": 0.16615129262208939,
"num_tokens": 20357393.0,
"step": 8035
},
{
"entropy": 6.349489068984985,
"epoch": 0.927870744373918,
"grad_norm": 0.984375,
"learning_rate": 0.0004925422880124761,
"loss": 6.1113,
"mean_token_accuracy": 0.16972048878669738,
"num_tokens": 20369551.0,
"step": 8040
},
{
"entropy": 6.298521709442139,
"epoch": 0.9284477784189267,
"grad_norm": 0.890625,
"learning_rate": 0.0004925317484283121,
"loss": 6.2078,
"mean_token_accuracy": 0.16394488960504533,
"num_tokens": 20382639.0,
"step": 8045
},
{
"entropy": 6.349614477157592,
"epoch": 0.9290248124639354,
"grad_norm": 0.8671875,
"learning_rate": 0.0004925212015275758,
"loss": 6.0278,
"mean_token_accuracy": 0.178650863468647,
"num_tokens": 20394751.0,
"step": 8050
},
{
"entropy": 6.232526731491089,
"epoch": 0.9296018465089441,
"grad_norm": 0.78515625,
"learning_rate": 0.000492510647310622,
"loss": 6.0768,
"mean_token_accuracy": 0.17546522319316865,
"num_tokens": 20408235.0,
"step": 8055
},
{
"entropy": 6.31773829460144,
"epoch": 0.9301788805539527,
"grad_norm": 0.82421875,
"learning_rate": 0.0004925000857778055,
"loss": 6.1095,
"mean_token_accuracy": 0.169540336728096,
"num_tokens": 20423063.0,
"step": 8060
},
{
"entropy": 6.342768430709839,
"epoch": 0.9307559145989613,
"grad_norm": 0.87890625,
"learning_rate": 0.0004924895169294818,
"loss": 6.0142,
"mean_token_accuracy": 0.17308391481637955,
"num_tokens": 20436225.0,
"step": 8065
},
{
"entropy": 6.319842863082886,
"epoch": 0.93133294864397,
"grad_norm": 0.93359375,
"learning_rate": 0.0004924789407660062,
"loss": 6.1361,
"mean_token_accuracy": 0.17381656765937806,
"num_tokens": 20447957.0,
"step": 8070
},
{
"entropy": 6.298751926422119,
"epoch": 0.9319099826889786,
"grad_norm": 0.87890625,
"learning_rate": 0.0004924683572877345,
"loss": 6.0219,
"mean_token_accuracy": 0.17717759013175965,
"num_tokens": 20459836.0,
"step": 8075
},
{
"entropy": 6.402027034759522,
"epoch": 0.9324870167339873,
"grad_norm": 0.890625,
"learning_rate": 0.0004924577664950225,
"loss": 6.1794,
"mean_token_accuracy": 0.16712668389081956,
"num_tokens": 20471907.0,
"step": 8080
},
{
"entropy": 6.325817441940307,
"epoch": 0.933064050778996,
"grad_norm": 0.875,
"learning_rate": 0.0004924471683882266,
"loss": 6.1608,
"mean_token_accuracy": 0.16859893202781678,
"num_tokens": 20485166.0,
"step": 8085
},
{
"entropy": 6.3150599002838135,
"epoch": 0.9336410848240047,
"grad_norm": 0.828125,
"learning_rate": 0.0004924365629677031,
"loss": 6.0038,
"mean_token_accuracy": 0.17864430248737334,
"num_tokens": 20498973.0,
"step": 8090
},
{
"entropy": 6.290228700637817,
"epoch": 0.9342181188690133,
"grad_norm": 0.80859375,
"learning_rate": 0.000492425950233809,
"loss": 6.033,
"mean_token_accuracy": 0.18096119910478592,
"num_tokens": 20511615.0,
"step": 8095
},
{
"entropy": 6.306623554229736,
"epoch": 0.9347951529140219,
"grad_norm": 0.87890625,
"learning_rate": 0.000492415330186901,
"loss": 6.0824,
"mean_token_accuracy": 0.1683804363012314,
"num_tokens": 20523615.0,
"step": 8100
},
{
"entropy": 6.372899293899536,
"epoch": 0.9353721869590306,
"grad_norm": 0.93359375,
"learning_rate": 0.0004924047028273364,
"loss": 6.007,
"mean_token_accuracy": 0.1787632629275322,
"num_tokens": 20537048.0,
"step": 8105
},
{
"entropy": 6.285822963714599,
"epoch": 0.9359492210040392,
"grad_norm": 0.80078125,
"learning_rate": 0.0004923940681554725,
"loss": 6.0922,
"mean_token_accuracy": 0.1766421005129814,
"num_tokens": 20551041.0,
"step": 8110
},
{
"entropy": 6.348171663284302,
"epoch": 0.9365262550490479,
"grad_norm": 0.859375,
"learning_rate": 0.0004923834261716672,
"loss": 6.1496,
"mean_token_accuracy": 0.1679307132959366,
"num_tokens": 20563123.0,
"step": 8115
},
{
"entropy": 6.331095409393311,
"epoch": 0.9371032890940566,
"grad_norm": 0.81640625,
"learning_rate": 0.0004923727768762782,
"loss": 6.048,
"mean_token_accuracy": 0.18366726487874985,
"num_tokens": 20577487.0,
"step": 8120
},
{
"entropy": 6.275611782073975,
"epoch": 0.9376803231390652,
"grad_norm": 0.796875,
"learning_rate": 0.000492362120269664,
"loss": 6.0773,
"mean_token_accuracy": 0.17474426031112672,
"num_tokens": 20590125.0,
"step": 8125
},
{
"entropy": 6.328644275665283,
"epoch": 0.9382573571840739,
"grad_norm": 0.78515625,
"learning_rate": 0.0004923514563521827,
"loss": 6.1126,
"mean_token_accuracy": 0.1696262091398239,
"num_tokens": 20603035.0,
"step": 8130
},
{
"entropy": 6.3141919612884525,
"epoch": 0.9388343912290825,
"grad_norm": 0.87890625,
"learning_rate": 0.0004923407851241933,
"loss": 6.094,
"mean_token_accuracy": 0.16628068536520005,
"num_tokens": 20615280.0,
"step": 8135
},
{
"entropy": 6.332769775390625,
"epoch": 0.9394114252740912,
"grad_norm": 0.78515625,
"learning_rate": 0.0004923301065860545,
"loss": 6.0693,
"mean_token_accuracy": 0.16870561093091965,
"num_tokens": 20627800.0,
"step": 8140
},
{
"entropy": 6.297971963882446,
"epoch": 0.9399884593190998,
"grad_norm": 0.92578125,
"learning_rate": 0.0004923194207381254,
"loss": 6.0941,
"mean_token_accuracy": 0.16942809224128724,
"num_tokens": 20639264.0,
"step": 8145
},
{
"entropy": 6.198244857788086,
"epoch": 0.9405654933641084,
"grad_norm": 0.8203125,
"learning_rate": 0.0004923087275807656,
"loss": 6.0176,
"mean_token_accuracy": 0.18265498876571656,
"num_tokens": 20652155.0,
"step": 8150
},
{
"entropy": 6.3499046802520756,
"epoch": 0.9411425274091172,
"grad_norm": 0.86328125,
"learning_rate": 0.0004922980271143347,
"loss": 6.0793,
"mean_token_accuracy": 0.1729395642876625,
"num_tokens": 20665642.0,
"step": 8155
},
{
"entropy": 6.345331525802612,
"epoch": 0.9417195614541258,
"grad_norm": 0.796875,
"learning_rate": 0.0004922873193391927,
"loss": 6.0618,
"mean_token_accuracy": 0.17080418467521669,
"num_tokens": 20678685.0,
"step": 8160
},
{
"entropy": 6.239529323577881,
"epoch": 0.9422965954991345,
"grad_norm": 0.8515625,
"learning_rate": 0.0004922766042556994,
"loss": 6.0014,
"mean_token_accuracy": 0.17112986594438553,
"num_tokens": 20690714.0,
"step": 8165
},
{
"entropy": 6.3647966384887695,
"epoch": 0.9428736295441431,
"grad_norm": 1.1015625,
"learning_rate": 0.0004922658818642156,
"loss": 6.0995,
"mean_token_accuracy": 0.16545148491859435,
"num_tokens": 20703316.0,
"step": 8170
},
{
"entropy": 6.249971199035644,
"epoch": 0.9434506635891518,
"grad_norm": 0.80859375,
"learning_rate": 0.0004922551521651018,
"loss": 5.9891,
"mean_token_accuracy": 0.18353118002414703,
"num_tokens": 20716144.0,
"step": 8175
},
{
"entropy": 6.328268146514892,
"epoch": 0.9440276976341604,
"grad_norm": 0.9140625,
"learning_rate": 0.0004922444151587189,
"loss": 6.0374,
"mean_token_accuracy": 0.1707102119922638,
"num_tokens": 20728089.0,
"step": 8180
},
{
"entropy": 6.219746112823486,
"epoch": 0.944604731679169,
"grad_norm": 0.8359375,
"learning_rate": 0.0004922336708454279,
"loss": 6.0499,
"mean_token_accuracy": 0.18127028048038482,
"num_tokens": 20741684.0,
"step": 8185
},
{
"entropy": 6.337989234924317,
"epoch": 0.9451817657241778,
"grad_norm": 0.8203125,
"learning_rate": 0.0004922229192255903,
"loss": 6.1007,
"mean_token_accuracy": 0.16950066089630128,
"num_tokens": 20754840.0,
"step": 8190
},
{
"entropy": 6.272415828704834,
"epoch": 0.9457587997691864,
"grad_norm": 0.88671875,
"learning_rate": 0.0004922121602995678,
"loss": 5.9846,
"mean_token_accuracy": 0.18377467840909958,
"num_tokens": 20767528.0,
"step": 8195
},
{
"entropy": 6.244569110870361,
"epoch": 0.9463358338141951,
"grad_norm": 0.92578125,
"learning_rate": 0.0004922013940677221,
"loss": 6.0685,
"mean_token_accuracy": 0.1787708282470703,
"num_tokens": 20778886.0,
"step": 8200
},
{
"entropy": 6.314958715438843,
"epoch": 0.9469128678592037,
"grad_norm": 0.76171875,
"learning_rate": 0.0004921906205304155,
"loss": 6.0274,
"mean_token_accuracy": 0.16707849353551865,
"num_tokens": 20792928.0,
"step": 8205
},
{
"entropy": 6.276573610305786,
"epoch": 0.9474899019042123,
"grad_norm": 0.7890625,
"learning_rate": 0.0004921798396880101,
"loss": 6.0222,
"mean_token_accuracy": 0.17047245651483536,
"num_tokens": 20805766.0,
"step": 8210
},
{
"entropy": 6.332600259780884,
"epoch": 0.948066935949221,
"grad_norm": 0.8515625,
"learning_rate": 0.0004921690515408688,
"loss": 6.0799,
"mean_token_accuracy": 0.17117798924446107,
"num_tokens": 20819008.0,
"step": 8215
},
{
"entropy": 6.297818374633789,
"epoch": 0.9486439699942296,
"grad_norm": 0.83203125,
"learning_rate": 0.0004921582560893543,
"loss": 6.1285,
"mean_token_accuracy": 0.1678549811244011,
"num_tokens": 20832706.0,
"step": 8220
},
{
"entropy": 6.29673662185669,
"epoch": 0.9492210040392384,
"grad_norm": 0.828125,
"learning_rate": 0.0004921474533338297,
"loss": 6.0616,
"mean_token_accuracy": 0.1708410307765007,
"num_tokens": 20844568.0,
"step": 8225
},
{
"entropy": 6.305984210968018,
"epoch": 0.949798038084247,
"grad_norm": 0.80859375,
"learning_rate": 0.0004921366432746585,
"loss": 6.0623,
"mean_token_accuracy": 0.17219894528388976,
"num_tokens": 20856157.0,
"step": 8230
},
{
"entropy": 6.256311988830566,
"epoch": 0.9503750721292556,
"grad_norm": 0.87890625,
"learning_rate": 0.000492125825912204,
"loss": 6.0552,
"mean_token_accuracy": 0.1725418046116829,
"num_tokens": 20868039.0,
"step": 8235
},
{
"entropy": 6.362317228317261,
"epoch": 0.9509521061742643,
"grad_norm": 0.86328125,
"learning_rate": 0.0004921150012468302,
"loss": 6.0623,
"mean_token_accuracy": 0.17292184233665467,
"num_tokens": 20880190.0,
"step": 8240
},
{
"entropy": 6.240530061721802,
"epoch": 0.9515291402192729,
"grad_norm": 0.84765625,
"learning_rate": 0.0004921041692789013,
"loss": 6.0576,
"mean_token_accuracy": 0.17715438902378083,
"num_tokens": 20892996.0,
"step": 8245
},
{
"entropy": 6.327496719360352,
"epoch": 0.9521061742642816,
"grad_norm": 0.765625,
"learning_rate": 0.0004920933300087813,
"loss": 6.1245,
"mean_token_accuracy": 0.170589879155159,
"num_tokens": 20906080.0,
"step": 8250
},
{
"entropy": 6.35455002784729,
"epoch": 0.9526832083092902,
"grad_norm": 0.875,
"learning_rate": 0.0004920824834368353,
"loss": 6.1527,
"mean_token_accuracy": 0.1672087237238884,
"num_tokens": 20917944.0,
"step": 8255
},
{
"entropy": 6.2974732398986815,
"epoch": 0.953260242354299,
"grad_norm": 1.1875,
"learning_rate": 0.0004920716295634275,
"loss": 6.0226,
"mean_token_accuracy": 0.18663843721151352,
"num_tokens": 20929046.0,
"step": 8260
},
{
"entropy": 6.309549474716187,
"epoch": 0.9538372763993076,
"grad_norm": 0.9140625,
"learning_rate": 0.0004920607683889235,
"loss": 6.204,
"mean_token_accuracy": 0.16842423677444457,
"num_tokens": 20941643.0,
"step": 8265
},
{
"entropy": 6.374490642547608,
"epoch": 0.9544143104443162,
"grad_norm": 0.83203125,
"learning_rate": 0.0004920498999136882,
"loss": 6.12,
"mean_token_accuracy": 0.17137401849031447,
"num_tokens": 20954620.0,
"step": 8270
},
{
"entropy": 6.301665258407593,
"epoch": 0.9549913444893249,
"grad_norm": 0.87109375,
"learning_rate": 0.0004920390241380874,
"loss": 6.1383,
"mean_token_accuracy": 0.16496547162532807,
"num_tokens": 20968033.0,
"step": 8275
},
{
"entropy": 6.316059875488281,
"epoch": 0.9555683785343335,
"grad_norm": 0.8125,
"learning_rate": 0.0004920281410624868,
"loss": 6.0528,
"mean_token_accuracy": 0.17812226861715316,
"num_tokens": 20980586.0,
"step": 8280
},
{
"entropy": 6.237458086013794,
"epoch": 0.9561454125793422,
"grad_norm": 0.84375,
"learning_rate": 0.0004920172506872525,
"loss": 5.9906,
"mean_token_accuracy": 0.17724904865026475,
"num_tokens": 20992346.0,
"step": 8285
},
{
"entropy": 6.203985404968262,
"epoch": 0.9567224466243508,
"grad_norm": 0.87890625,
"learning_rate": 0.0004920063530127508,
"loss": 5.9545,
"mean_token_accuracy": 0.18309845626354218,
"num_tokens": 21004399.0,
"step": 8290
},
{
"entropy": 6.386181783676148,
"epoch": 0.9572994806693594,
"grad_norm": 0.859375,
"learning_rate": 0.0004919954480393482,
"loss": 6.1593,
"mean_token_accuracy": 0.16094251722097397,
"num_tokens": 21017066.0,
"step": 8295
},
{
"entropy": 6.379828882217407,
"epoch": 0.9578765147143682,
"grad_norm": 0.79296875,
"learning_rate": 0.0004919845357674114,
"loss": 6.2121,
"mean_token_accuracy": 0.1594449073076248,
"num_tokens": 21031664.0,
"step": 8300
},
{
"entropy": 6.345889616012573,
"epoch": 0.9584535487593768,
"grad_norm": 0.859375,
"learning_rate": 0.0004919736161973076,
"loss": 6.0684,
"mean_token_accuracy": 0.18007687032222747,
"num_tokens": 21043980.0,
"step": 8305
},
{
"entropy": 6.341425609588623,
"epoch": 0.9590305828043855,
"grad_norm": 0.79296875,
"learning_rate": 0.000491962689329404,
"loss": 6.0708,
"mean_token_accuracy": 0.17116846591234208,
"num_tokens": 21056916.0,
"step": 8310
},
{
"entropy": 6.38311505317688,
"epoch": 0.9596076168493941,
"grad_norm": 0.87109375,
"learning_rate": 0.0004919517551640681,
"loss": 6.1542,
"mean_token_accuracy": 0.1650987982749939,
"num_tokens": 21070027.0,
"step": 8315
},
{
"entropy": 6.336155128479004,
"epoch": 0.9601846508944027,
"grad_norm": 0.7890625,
"learning_rate": 0.0004919408137016677,
"loss": 6.12,
"mean_token_accuracy": 0.1708296701312065,
"num_tokens": 21082596.0,
"step": 8320
},
{
"entropy": 6.15516300201416,
"epoch": 0.9607616849394114,
"grad_norm": 0.9296875,
"learning_rate": 0.0004919298649425708,
"loss": 5.9459,
"mean_token_accuracy": 0.17924613356590272,
"num_tokens": 21098160.0,
"step": 8325
},
{
"entropy": 6.3055689334869385,
"epoch": 0.96133871898442,
"grad_norm": 0.84765625,
"learning_rate": 0.0004919189088871456,
"loss": 6.041,
"mean_token_accuracy": 0.17082750350236892,
"num_tokens": 21111562.0,
"step": 8330
},
{
"entropy": 6.309827613830566,
"epoch": 0.9619157530294288,
"grad_norm": 0.91015625,
"learning_rate": 0.0004919079455357608,
"loss": 6.051,
"mean_token_accuracy": 0.1726277843117714,
"num_tokens": 21123177.0,
"step": 8335
},
{
"entropy": 6.272983598709106,
"epoch": 0.9624927870744374,
"grad_norm": 0.84765625,
"learning_rate": 0.0004918969748887847,
"loss": 6.1106,
"mean_token_accuracy": 0.1684108003973961,
"num_tokens": 21135390.0,
"step": 8340
},
{
"entropy": 6.303555488586426,
"epoch": 0.9630698211194461,
"grad_norm": 0.8515625,
"learning_rate": 0.0004918859969465868,
"loss": 6.0524,
"mean_token_accuracy": 0.1788319617509842,
"num_tokens": 21148718.0,
"step": 8345
},
{
"entropy": 6.348038244247436,
"epoch": 0.9636468551644547,
"grad_norm": 0.7890625,
"learning_rate": 0.0004918750117095361,
"loss": 6.0769,
"mean_token_accuracy": 0.16928021162748336,
"num_tokens": 21161057.0,
"step": 8350
},
{
"entropy": 6.333800172805786,
"epoch": 0.9642238892094633,
"grad_norm": 0.78515625,
"learning_rate": 0.0004918640191780021,
"loss": 6.0314,
"mean_token_accuracy": 0.1733250930905342,
"num_tokens": 21175048.0,
"step": 8355
},
{
"entropy": 6.298459768295288,
"epoch": 0.964800923254472,
"grad_norm": 0.85546875,
"learning_rate": 0.0004918530193523546,
"loss": 6.0075,
"mean_token_accuracy": 0.17219914495944977,
"num_tokens": 21187995.0,
"step": 8360
},
{
"entropy": 6.2210142612457275,
"epoch": 0.9653779572994806,
"grad_norm": 0.82421875,
"learning_rate": 0.0004918420122329634,
"loss": 5.9762,
"mean_token_accuracy": 0.17670271098613738,
"num_tokens": 21200685.0,
"step": 8365
},
{
"entropy": 6.269420576095581,
"epoch": 0.9659549913444894,
"grad_norm": 0.859375,
"learning_rate": 0.0004918309978201989,
"loss": 6.0031,
"mean_token_accuracy": 0.17940095961093902,
"num_tokens": 21212709.0,
"step": 8370
},
{
"entropy": 6.3614483833312985,
"epoch": 0.966532025389498,
"grad_norm": 0.87890625,
"learning_rate": 0.0004918199761144315,
"loss": 6.1414,
"mean_token_accuracy": 0.16158217340707778,
"num_tokens": 21224846.0,
"step": 8375
},
{
"entropy": 6.342139053344726,
"epoch": 0.9671090594345066,
"grad_norm": 0.86328125,
"learning_rate": 0.0004918089471160318,
"loss": 6.1078,
"mean_token_accuracy": 0.17495157569646835,
"num_tokens": 21238490.0,
"step": 8380
},
{
"entropy": 6.297436285018921,
"epoch": 0.9676860934795153,
"grad_norm": 0.859375,
"learning_rate": 0.0004917979108253709,
"loss": 6.0186,
"mean_token_accuracy": 0.17175852954387666,
"num_tokens": 21250064.0,
"step": 8385
},
{
"entropy": 6.319163703918457,
"epoch": 0.9682631275245239,
"grad_norm": 0.86328125,
"learning_rate": 0.00049178686724282,
"loss": 5.9838,
"mean_token_accuracy": 0.17822523713111876,
"num_tokens": 21262777.0,
"step": 8390
},
{
"entropy": 6.2587940216064455,
"epoch": 0.9688401615695326,
"grad_norm": 0.9140625,
"learning_rate": 0.0004917758163687506,
"loss": 6.0596,
"mean_token_accuracy": 0.18015512079000473,
"num_tokens": 21274837.0,
"step": 8395
},
{
"entropy": 6.299158430099487,
"epoch": 0.9694171956145412,
"grad_norm": 1.3359375,
"learning_rate": 0.0004917647582035341,
"loss": 6.1477,
"mean_token_accuracy": 0.16546362787485122,
"num_tokens": 21287683.0,
"step": 8400
},
{
"entropy": 6.276169300079346,
"epoch": 0.96999422965955,
"grad_norm": 0.92578125,
"learning_rate": 0.0004917536927475428,
"loss": 5.9704,
"mean_token_accuracy": 0.17683717012405395,
"num_tokens": 21300053.0,
"step": 8405
},
{
"entropy": 6.322388982772827,
"epoch": 0.9705712637045586,
"grad_norm": 0.890625,
"learning_rate": 0.0004917426200011486,
"loss": 6.0606,
"mean_token_accuracy": 0.17437842041254042,
"num_tokens": 21312143.0,
"step": 8410
},
{
"entropy": 6.308571004867554,
"epoch": 0.9711482977495672,
"grad_norm": 0.78125,
"learning_rate": 0.000491731539964724,
"loss": 6.064,
"mean_token_accuracy": 0.17512849271297454,
"num_tokens": 21324530.0,
"step": 8415
},
{
"entropy": 6.308686065673828,
"epoch": 0.9717253317945759,
"grad_norm": 0.87890625,
"learning_rate": 0.0004917204526386418,
"loss": 6.1158,
"mean_token_accuracy": 0.17519305050373077,
"num_tokens": 21337766.0,
"step": 8420
},
{
"entropy": 6.3296489238739015,
"epoch": 0.9723023658395845,
"grad_norm": 0.91796875,
"learning_rate": 0.0004917093580232748,
"loss": 6.0457,
"mean_token_accuracy": 0.17636967301368714,
"num_tokens": 21350304.0,
"step": 8425
},
{
"entropy": 6.264460182189941,
"epoch": 0.9728793998845932,
"grad_norm": 0.94921875,
"learning_rate": 0.0004916982561189962,
"loss": 6.0781,
"mean_token_accuracy": 0.17243474572896958,
"num_tokens": 21362030.0,
"step": 8430
},
{
"entropy": 6.325700092315674,
"epoch": 0.9734564339296018,
"grad_norm": 0.859375,
"learning_rate": 0.0004916871469261794,
"loss": 6.088,
"mean_token_accuracy": 0.1718950316309929,
"num_tokens": 21374279.0,
"step": 8435
},
{
"entropy": 6.3129064559936525,
"epoch": 0.9740334679746105,
"grad_norm": 0.80078125,
"learning_rate": 0.000491676030445198,
"loss": 6.074,
"mean_token_accuracy": 0.18431381583213807,
"num_tokens": 21388220.0,
"step": 8440
},
{
"entropy": 6.319225549697876,
"epoch": 0.9746105020196192,
"grad_norm": 0.796875,
"learning_rate": 0.0004916649066764259,
"loss": 6.0279,
"mean_token_accuracy": 0.17508506923913955,
"num_tokens": 21400770.0,
"step": 8445
},
{
"entropy": 6.299949407577515,
"epoch": 0.9751875360646278,
"grad_norm": 0.8515625,
"learning_rate": 0.0004916537756202375,
"loss": 6.0692,
"mean_token_accuracy": 0.1750455766916275,
"num_tokens": 21413078.0,
"step": 8450
},
{
"entropy": 6.322778272628784,
"epoch": 0.9757645701096365,
"grad_norm": 0.9609375,
"learning_rate": 0.0004916426372770069,
"loss": 6.0912,
"mean_token_accuracy": 0.16818054616451264,
"num_tokens": 21427285.0,
"step": 8455
},
{
"entropy": 6.3555844783782955,
"epoch": 0.9763416041546451,
"grad_norm": 1.015625,
"learning_rate": 0.0004916314916471087,
"loss": 6.0548,
"mean_token_accuracy": 0.17514651268720627,
"num_tokens": 21440659.0,
"step": 8460
},
{
"entropy": 6.283309412002564,
"epoch": 0.9769186381996537,
"grad_norm": 0.890625,
"learning_rate": 0.0004916203387309179,
"loss": 6.0336,
"mean_token_accuracy": 0.1689162462949753,
"num_tokens": 21452301.0,
"step": 8465
},
{
"entropy": 6.186957979202271,
"epoch": 0.9774956722446624,
"grad_norm": 0.8671875,
"learning_rate": 0.0004916091785288096,
"loss": 5.9807,
"mean_token_accuracy": 0.18105768263339997,
"num_tokens": 21466716.0,
"step": 8470
},
{
"entropy": 6.330410099029541,
"epoch": 0.9780727062896711,
"grad_norm": 0.96484375,
"learning_rate": 0.0004915980110411593,
"loss": 6.0875,
"mean_token_accuracy": 0.17375342547893524,
"num_tokens": 21479314.0,
"step": 8475
},
{
"entropy": 6.277654647827148,
"epoch": 0.9786497403346798,
"grad_norm": 0.9296875,
"learning_rate": 0.0004915868362683425,
"loss": 5.9829,
"mean_token_accuracy": 0.18661958277225493,
"num_tokens": 21491968.0,
"step": 8480
},
{
"entropy": 6.172560930252075,
"epoch": 0.9792267743796884,
"grad_norm": 0.765625,
"learning_rate": 0.0004915756542107349,
"loss": 6.0973,
"mean_token_accuracy": 0.1710505172610283,
"num_tokens": 21505744.0,
"step": 8485
},
{
"entropy": 6.331524133682251,
"epoch": 0.979803808424697,
"grad_norm": 0.79296875,
"learning_rate": 0.0004915644648687127,
"loss": 6.1035,
"mean_token_accuracy": 0.17333952337503433,
"num_tokens": 21520981.0,
"step": 8490
},
{
"entropy": 6.351734685897827,
"epoch": 0.9803808424697057,
"grad_norm": 0.8515625,
"learning_rate": 0.0004915532682426524,
"loss": 6.067,
"mean_token_accuracy": 0.17047810107469558,
"num_tokens": 21533712.0,
"step": 8495
},
{
"entropy": 6.18950400352478,
"epoch": 0.9809578765147143,
"grad_norm": 0.76953125,
"learning_rate": 0.0004915420643329306,
"loss": 5.9703,
"mean_token_accuracy": 0.1750311180949211,
"num_tokens": 21546875.0,
"step": 8500
},
{
"entropy": 6.286129379272461,
"epoch": 0.981534910559723,
"grad_norm": 0.84375,
"learning_rate": 0.000491530853139924,
"loss": 6.0195,
"mean_token_accuracy": 0.17821505516767502,
"num_tokens": 21559154.0,
"step": 8505
},
{
"entropy": 6.3540106296539305,
"epoch": 0.9821119446047317,
"grad_norm": 0.87890625,
"learning_rate": 0.0004915196346640095,
"loss": 6.1033,
"mean_token_accuracy": 0.16890120655298232,
"num_tokens": 21573164.0,
"step": 8510
},
{
"entropy": 6.343676900863647,
"epoch": 0.9826889786497404,
"grad_norm": 0.80859375,
"learning_rate": 0.0004915084089055648,
"loss": 6.1093,
"mean_token_accuracy": 0.16497408002614974,
"num_tokens": 21585449.0,
"step": 8515
},
{
"entropy": 6.205972909927368,
"epoch": 0.983266012694749,
"grad_norm": 0.80859375,
"learning_rate": 0.0004914971758649673,
"loss": 6.0408,
"mean_token_accuracy": 0.18363562375307083,
"num_tokens": 21598120.0,
"step": 8520
},
{
"entropy": 6.2844775199890135,
"epoch": 0.9838430467397576,
"grad_norm": 0.8359375,
"learning_rate": 0.0004914859355425948,
"loss": 6.0986,
"mean_token_accuracy": 0.17075739353895186,
"num_tokens": 21609912.0,
"step": 8525
},
{
"entropy": 6.362640714645385,
"epoch": 0.9844200807847663,
"grad_norm": 0.8125,
"learning_rate": 0.0004914746879388255,
"loss": 6.0341,
"mean_token_accuracy": 0.17460228204727174,
"num_tokens": 21623242.0,
"step": 8530
},
{
"entropy": 6.252819156646728,
"epoch": 0.9849971148297749,
"grad_norm": 0.83203125,
"learning_rate": 0.0004914634330540373,
"loss": 6.0749,
"mean_token_accuracy": 0.17560923844575882,
"num_tokens": 21635527.0,
"step": 8535
},
{
"entropy": 6.27526888847351,
"epoch": 0.9855741488747836,
"grad_norm": 0.8515625,
"learning_rate": 0.0004914521708886093,
"loss": 6.0472,
"mean_token_accuracy": 0.16989225745201111,
"num_tokens": 21648994.0,
"step": 8540
},
{
"entropy": 6.324329948425293,
"epoch": 0.9861511829197923,
"grad_norm": 0.8359375,
"learning_rate": 0.0004914409014429201,
"loss": 6.0489,
"mean_token_accuracy": 0.17544470131397247,
"num_tokens": 21661512.0,
"step": 8545
},
{
"entropy": 6.28133864402771,
"epoch": 0.986728216964801,
"grad_norm": 0.81640625,
"learning_rate": 0.0004914296247173486,
"loss": 6.1108,
"mean_token_accuracy": 0.16970574706792832,
"num_tokens": 21674900.0,
"step": 8550
},
{
"entropy": 6.445541143417358,
"epoch": 0.9873052510098096,
"grad_norm": 0.859375,
"learning_rate": 0.0004914183407122741,
"loss": 6.2304,
"mean_token_accuracy": 0.1670519694685936,
"num_tokens": 21688451.0,
"step": 8555
},
{
"entropy": 6.338979005813599,
"epoch": 0.9878822850548182,
"grad_norm": 0.87109375,
"learning_rate": 0.0004914070494280763,
"loss": 6.0895,
"mean_token_accuracy": 0.1686733365058899,
"num_tokens": 21700350.0,
"step": 8560
},
{
"entropy": 6.2714245319366455,
"epoch": 0.9884593190998269,
"grad_norm": 0.83984375,
"learning_rate": 0.0004913957508651349,
"loss": 6.0558,
"mean_token_accuracy": 0.17865381836891175,
"num_tokens": 21713211.0,
"step": 8565
},
{
"entropy": 6.273990535736084,
"epoch": 0.9890363531448355,
"grad_norm": 1.6796875,
"learning_rate": 0.0004913844450238299,
"loss": 5.9724,
"mean_token_accuracy": 0.1822005182504654,
"num_tokens": 21726105.0,
"step": 8570
},
{
"entropy": 6.251226806640625,
"epoch": 0.9896133871898442,
"grad_norm": 0.85546875,
"learning_rate": 0.0004913731319045416,
"loss": 6.062,
"mean_token_accuracy": 0.1773639664053917,
"num_tokens": 21738075.0,
"step": 8575
},
{
"entropy": 6.292670202255249,
"epoch": 0.9901904212348529,
"grad_norm": 0.8671875,
"learning_rate": 0.0004913618115076505,
"loss": 6.0441,
"mean_token_accuracy": 0.17401732057332991,
"num_tokens": 21750614.0,
"step": 8580
},
{
"entropy": 6.221653270721435,
"epoch": 0.9907674552798615,
"grad_norm": 0.921875,
"learning_rate": 0.0004913504838335372,
"loss": 6.0495,
"mean_token_accuracy": 0.17573998719453812,
"num_tokens": 21763670.0,
"step": 8585
},
{
"entropy": 6.303406429290772,
"epoch": 0.9913444893248702,
"grad_norm": 0.875,
"learning_rate": 0.0004913391488825829,
"loss": 6.0334,
"mean_token_accuracy": 0.1794967070221901,
"num_tokens": 21776623.0,
"step": 8590
},
{
"entropy": 6.308801317214966,
"epoch": 0.9919215233698788,
"grad_norm": 0.828125,
"learning_rate": 0.0004913278066551689,
"loss": 6.0141,
"mean_token_accuracy": 0.17606466710567475,
"num_tokens": 21787903.0,
"step": 8595
},
{
"entropy": 6.230136156082153,
"epoch": 0.9924985574148875,
"grad_norm": 0.89453125,
"learning_rate": 0.0004913164571516765,
"loss": 5.9398,
"mean_token_accuracy": 0.18365363031625748,
"num_tokens": 21800409.0,
"step": 8600
},
{
"entropy": 6.320093202590942,
"epoch": 0.9930755914598961,
"grad_norm": 0.92578125,
"learning_rate": 0.0004913051003724876,
"loss": 6.1418,
"mean_token_accuracy": 0.17018114328384398,
"num_tokens": 21812741.0,
"step": 8605
},
{
"entropy": 6.295933103561401,
"epoch": 0.9936526255049047,
"grad_norm": 0.828125,
"learning_rate": 0.0004912937363179839,
"loss": 6.0716,
"mean_token_accuracy": 0.17680844217538833,
"num_tokens": 21826180.0,
"step": 8610
},
{
"entropy": 6.28583836555481,
"epoch": 0.9942296595499135,
"grad_norm": 0.92578125,
"learning_rate": 0.000491282364988548,
"loss": 6.1301,
"mean_token_accuracy": 0.17232027649879456,
"num_tokens": 21838961.0,
"step": 8615
},
{
"entropy": 6.3287606716156,
"epoch": 0.9948066935949221,
"grad_norm": 0.87109375,
"learning_rate": 0.0004912709863845621,
"loss": 6.0813,
"mean_token_accuracy": 0.1688533142209053,
"num_tokens": 21850942.0,
"step": 8620
},
{
"entropy": 6.358766841888428,
"epoch": 0.9953837276399308,
"grad_norm": 0.84765625,
"learning_rate": 0.000491259600506409,
"loss": 6.0008,
"mean_token_accuracy": 0.18225180059671403,
"num_tokens": 21862666.0,
"step": 8625
},
{
"entropy": 6.225011587142944,
"epoch": 0.9959607616849394,
"grad_norm": 0.8515625,
"learning_rate": 0.0004912482073544716,
"loss": 6.0263,
"mean_token_accuracy": 0.181974658370018,
"num_tokens": 21874866.0,
"step": 8630
},
{
"entropy": 6.300230407714844,
"epoch": 0.996537795729948,
"grad_norm": 0.91015625,
"learning_rate": 0.0004912368069291333,
"loss": 6.0987,
"mean_token_accuracy": 0.17124349176883696,
"num_tokens": 21887886.0,
"step": 8635
},
{
"entropy": 6.385247230529785,
"epoch": 0.9971148297749567,
"grad_norm": 0.828125,
"learning_rate": 0.0004912253992307773,
"loss": 6.0614,
"mean_token_accuracy": 0.1666038528084755,
"num_tokens": 21901096.0,
"step": 8640
},
{
"entropy": 6.307227563858032,
"epoch": 0.9976918638199653,
"grad_norm": 0.80859375,
"learning_rate": 0.0004912139842597875,
"loss": 6.1417,
"mean_token_accuracy": 0.17292022854089736,
"num_tokens": 21914018.0,
"step": 8645
},
{
"entropy": 6.3174644947052006,
"epoch": 0.9982688978649741,
"grad_norm": 0.890625,
"learning_rate": 0.0004912025620165477,
"loss": 6.0544,
"mean_token_accuracy": 0.1787086993455887,
"num_tokens": 21925488.0,
"step": 8650
},
{
"entropy": 6.379308795928955,
"epoch": 0.9988459319099827,
"grad_norm": 0.84375,
"learning_rate": 0.0004911911325014421,
"loss": 6.1228,
"mean_token_accuracy": 0.1627660095691681,
"num_tokens": 21938268.0,
"step": 8655
},
{
"entropy": 6.32840895652771,
"epoch": 0.9994229659549914,
"grad_norm": 0.8203125,
"learning_rate": 0.0004911796957148552,
"loss": 6.1073,
"mean_token_accuracy": 0.17420676499605178,
"num_tokens": 21951219.0,
"step": 8660
},
{
"entropy": 6.355043363571167,
"epoch": 1.0,
"grad_norm": 0.859375,
"learning_rate": 0.0004911682516571715,
"loss": 6.0847,
"mean_token_accuracy": 0.1745709404349327,
"num_tokens": 21963117.0,
"step": 8665
},
{
"entropy": 6.3443841457366945,
"epoch": 1.0005770340450086,
"grad_norm": 0.8671875,
"learning_rate": 0.0004911568003287761,
"loss": 6.0131,
"mean_token_accuracy": 0.17631109207868575,
"num_tokens": 21974187.0,
"step": 8670
},
{
"entropy": 6.301740312576294,
"epoch": 1.0011540680900173,
"grad_norm": 0.7734375,
"learning_rate": 0.0004911453417300541,
"loss": 6.0218,
"mean_token_accuracy": 0.1745710179209709,
"num_tokens": 21987393.0,
"step": 8675
},
{
"entropy": 6.29511661529541,
"epoch": 1.001731102135026,
"grad_norm": 0.8984375,
"learning_rate": 0.0004911338758613909,
"loss": 5.9168,
"mean_token_accuracy": 0.18078290671110153,
"num_tokens": 21998638.0,
"step": 8680
},
{
"entropy": 6.239432239532471,
"epoch": 1.0023081361800346,
"grad_norm": 0.8515625,
"learning_rate": 0.0004911224027231722,
"loss": 5.9525,
"mean_token_accuracy": 0.17768344581127166,
"num_tokens": 22012231.0,
"step": 8685
},
{
"entropy": 6.150865840911865,
"epoch": 1.0028851702250432,
"grad_norm": 0.83984375,
"learning_rate": 0.0004911109223157838,
"loss": 5.7963,
"mean_token_accuracy": 0.19489599764347076,
"num_tokens": 22024929.0,
"step": 8690
},
{
"entropy": 6.238634347915649,
"epoch": 1.0034622042700518,
"grad_norm": 0.8125,
"learning_rate": 0.0004910994346396118,
"loss": 5.9051,
"mean_token_accuracy": 0.18360282331705094,
"num_tokens": 22037873.0,
"step": 8695
},
{
"entropy": 6.286004877090454,
"epoch": 1.0040392383150605,
"grad_norm": 0.86328125,
"learning_rate": 0.0004910879396950427,
"loss": 5.8986,
"mean_token_accuracy": 0.18249017894268035,
"num_tokens": 22049572.0,
"step": 8700
},
{
"entropy": 6.319458055496216,
"epoch": 1.0046162723600693,
"grad_norm": 0.8125,
"learning_rate": 0.000491076437482463,
"loss": 5.9874,
"mean_token_accuracy": 0.17467263340950012,
"num_tokens": 22063290.0,
"step": 8705
},
{
"entropy": 6.137618780136108,
"epoch": 1.005193306405078,
"grad_norm": 0.8359375,
"learning_rate": 0.0004910649280022599,
"loss": 5.8664,
"mean_token_accuracy": 0.18574946224689484,
"num_tokens": 22076387.0,
"step": 8710
},
{
"entropy": 6.30208010673523,
"epoch": 1.0057703404500866,
"grad_norm": 0.8984375,
"learning_rate": 0.0004910534112548201,
"loss": 5.9577,
"mean_token_accuracy": 0.17944232672452926,
"num_tokens": 22088780.0,
"step": 8715
},
{
"entropy": 6.154451704025268,
"epoch": 1.0063473744950953,
"grad_norm": 0.80859375,
"learning_rate": 0.0004910418872405312,
"loss": 5.8374,
"mean_token_accuracy": 0.1871345892548561,
"num_tokens": 22102150.0,
"step": 8720
},
{
"entropy": 6.243637466430664,
"epoch": 1.006924408540104,
"grad_norm": 0.8671875,
"learning_rate": 0.0004910303559597806,
"loss": 5.9346,
"mean_token_accuracy": 0.1791851580142975,
"num_tokens": 22115250.0,
"step": 8725
},
{
"entropy": 6.302803611755371,
"epoch": 1.0075014425851125,
"grad_norm": 0.7890625,
"learning_rate": 0.0004910188174129564,
"loss": 5.9405,
"mean_token_accuracy": 0.17347067594528198,
"num_tokens": 22129015.0,
"step": 8730
},
{
"entropy": 6.2511063575744625,
"epoch": 1.0080784766301212,
"grad_norm": 0.82421875,
"learning_rate": 0.0004910072716004466,
"loss": 5.9659,
"mean_token_accuracy": 0.17493045777082444,
"num_tokens": 22141716.0,
"step": 8735
},
{
"entropy": 6.333795022964478,
"epoch": 1.0086555106751298,
"grad_norm": 0.87890625,
"learning_rate": 0.0004909957185226394,
"loss": 6.0124,
"mean_token_accuracy": 0.16725752502679825,
"num_tokens": 22153568.0,
"step": 8740
},
{
"entropy": 6.315547466278076,
"epoch": 1.0092325447201385,
"grad_norm": 0.8671875,
"learning_rate": 0.0004909841581799236,
"loss": 6.0358,
"mean_token_accuracy": 0.17059850841760635,
"num_tokens": 22165443.0,
"step": 8745
},
{
"entropy": 6.297538089752197,
"epoch": 1.009809578765147,
"grad_norm": 1.0546875,
"learning_rate": 0.0004909725905726879,
"loss": 5.9411,
"mean_token_accuracy": 0.18054274767637252,
"num_tokens": 22179068.0,
"step": 8750
},
{
"entropy": 6.290983438491821,
"epoch": 1.0103866128101557,
"grad_norm": 0.87109375,
"learning_rate": 0.0004909610157013214,
"loss": 6.0418,
"mean_token_accuracy": 0.16726665794849396,
"num_tokens": 22191597.0,
"step": 8755
},
{
"entropy": 6.272359132766724,
"epoch": 1.0109636468551644,
"grad_norm": 0.80859375,
"learning_rate": 0.0004909494335662134,
"loss": 5.9777,
"mean_token_accuracy": 0.17593691051006316,
"num_tokens": 22203724.0,
"step": 8760
},
{
"entropy": 6.268367767333984,
"epoch": 1.011540680900173,
"grad_norm": 0.84375,
"learning_rate": 0.0004909378441677535,
"loss": 5.9386,
"mean_token_accuracy": 0.1802491694688797,
"num_tokens": 22216100.0,
"step": 8765
},
{
"entropy": 6.311220264434814,
"epoch": 1.0121177149451817,
"grad_norm": 0.859375,
"learning_rate": 0.0004909262475063314,
"loss": 5.9342,
"mean_token_accuracy": 0.17636322379112243,
"num_tokens": 22228162.0,
"step": 8770
},
{
"entropy": 6.266244554519654,
"epoch": 1.0126947489901905,
"grad_norm": 0.85546875,
"learning_rate": 0.0004909146435823373,
"loss": 5.9254,
"mean_token_accuracy": 0.1820003569126129,
"num_tokens": 22239756.0,
"step": 8775
},
{
"entropy": 6.258756494522094,
"epoch": 1.0132717830351992,
"grad_norm": 0.76171875,
"learning_rate": 0.0004909030323961613,
"loss": 5.9261,
"mean_token_accuracy": 0.1728573277592659,
"num_tokens": 22252781.0,
"step": 8780
},
{
"entropy": 6.24869384765625,
"epoch": 1.0138488170802078,
"grad_norm": 0.82421875,
"learning_rate": 0.0004908914139481942,
"loss": 6.0004,
"mean_token_accuracy": 0.17384298741817475,
"num_tokens": 22265171.0,
"step": 8785
},
{
"entropy": 6.272542905807495,
"epoch": 1.0144258511252164,
"grad_norm": 0.8046875,
"learning_rate": 0.0004908797882388265,
"loss": 5.9308,
"mean_token_accuracy": 0.1815079167485237,
"num_tokens": 22278121.0,
"step": 8790
},
{
"entropy": 6.188515949249267,
"epoch": 1.015002885170225,
"grad_norm": 0.83984375,
"learning_rate": 0.0004908681552684495,
"loss": 5.8076,
"mean_token_accuracy": 0.1845837727189064,
"num_tokens": 22290074.0,
"step": 8795
},
{
"entropy": 6.237634563446045,
"epoch": 1.0155799192152337,
"grad_norm": 1.1484375,
"learning_rate": 0.0004908565150374542,
"loss": 5.9317,
"mean_token_accuracy": 0.18133609592914582,
"num_tokens": 22303088.0,
"step": 8800
},
{
"entropy": 6.322842741012574,
"epoch": 1.0161569532602424,
"grad_norm": 0.82421875,
"learning_rate": 0.0004908448675462323,
"loss": 5.9863,
"mean_token_accuracy": 0.1694008842110634,
"num_tokens": 22317693.0,
"step": 8805
},
{
"entropy": 6.229022693634033,
"epoch": 1.016733987305251,
"grad_norm": 0.80078125,
"learning_rate": 0.0004908332127951756,
"loss": 5.9442,
"mean_token_accuracy": 0.17924002856016158,
"num_tokens": 22330876.0,
"step": 8810
},
{
"entropy": 6.266847419738769,
"epoch": 1.0173110213502596,
"grad_norm": 0.90234375,
"learning_rate": 0.0004908215507846757,
"loss": 5.9253,
"mean_token_accuracy": 0.17635516226291656,
"num_tokens": 22342620.0,
"step": 8815
},
{
"entropy": 6.242235136032105,
"epoch": 1.0178880553952683,
"grad_norm": 0.84765625,
"learning_rate": 0.0004908098815151254,
"loss": 5.9486,
"mean_token_accuracy": 0.1775849163532257,
"num_tokens": 22353733.0,
"step": 8820
},
{
"entropy": 6.282942867279052,
"epoch": 1.018465089440277,
"grad_norm": 0.87890625,
"learning_rate": 0.0004907982049869168,
"loss": 5.9636,
"mean_token_accuracy": 0.17333447337150573,
"num_tokens": 22366857.0,
"step": 8825
},
{
"entropy": 6.205226278305053,
"epoch": 1.0190421234852856,
"grad_norm": 0.90625,
"learning_rate": 0.0004907865212004428,
"loss": 5.8306,
"mean_token_accuracy": 0.18225234746932983,
"num_tokens": 22377658.0,
"step": 8830
},
{
"entropy": 6.268972778320313,
"epoch": 1.0196191575302942,
"grad_norm": 0.87109375,
"learning_rate": 0.0004907748301560963,
"loss": 5.9864,
"mean_token_accuracy": 0.17106507569551468,
"num_tokens": 22390060.0,
"step": 8835
},
{
"entropy": 6.259017467498779,
"epoch": 1.0201961915753028,
"grad_norm": 0.796875,
"learning_rate": 0.0004907631318542707,
"loss": 5.9534,
"mean_token_accuracy": 0.17372174561023712,
"num_tokens": 22402903.0,
"step": 8840
},
{
"entropy": 6.163227939605713,
"epoch": 1.0207732256203117,
"grad_norm": 0.84765625,
"learning_rate": 0.0004907514262953594,
"loss": 5.8908,
"mean_token_accuracy": 0.18323398977518082,
"num_tokens": 22416036.0,
"step": 8845
},
{
"entropy": 6.34295973777771,
"epoch": 1.0213502596653203,
"grad_norm": 0.8984375,
"learning_rate": 0.0004907397134797559,
"loss": 5.9372,
"mean_token_accuracy": 0.1771351918578148,
"num_tokens": 22428000.0,
"step": 8850
},
{
"entropy": 6.236253643035889,
"epoch": 1.021927293710329,
"grad_norm": 0.8515625,
"learning_rate": 0.0004907279934078543,
"loss": 5.943,
"mean_token_accuracy": 0.1795724704861641,
"num_tokens": 22440029.0,
"step": 8855
},
{
"entropy": 6.244734859466552,
"epoch": 1.0225043277553376,
"grad_norm": 0.79296875,
"learning_rate": 0.0004907162660800488,
"loss": 5.9615,
"mean_token_accuracy": 0.1742117166519165,
"num_tokens": 22452906.0,
"step": 8860
},
{
"entropy": 6.252014303207398,
"epoch": 1.0230813618003463,
"grad_norm": 0.8125,
"learning_rate": 0.0004907045314967338,
"loss": 5.8512,
"mean_token_accuracy": 0.18662992119789124,
"num_tokens": 22465853.0,
"step": 8865
},
{
"entropy": 6.251199388504029,
"epoch": 1.023658395845355,
"grad_norm": 0.9140625,
"learning_rate": 0.0004906927896583041,
"loss": 5.9166,
"mean_token_accuracy": 0.17843791097402573,
"num_tokens": 22478583.0,
"step": 8870
},
{
"entropy": 6.2310069561004635,
"epoch": 1.0242354298903635,
"grad_norm": 0.8359375,
"learning_rate": 0.0004906810405651546,
"loss": 5.9514,
"mean_token_accuracy": 0.1803251400589943,
"num_tokens": 22491665.0,
"step": 8875
},
{
"entropy": 6.290026569366455,
"epoch": 1.0248124639353722,
"grad_norm": 0.8359375,
"learning_rate": 0.0004906692842176803,
"loss": 5.9343,
"mean_token_accuracy": 0.1794249892234802,
"num_tokens": 22504015.0,
"step": 8880
},
{
"entropy": 6.278184032440185,
"epoch": 1.0253894979803808,
"grad_norm": 0.875,
"learning_rate": 0.0004906575206162769,
"loss": 6.0169,
"mean_token_accuracy": 0.1696304887533188,
"num_tokens": 22516385.0,
"step": 8885
},
{
"entropy": 6.293035173416138,
"epoch": 1.0259665320253895,
"grad_norm": 0.85546875,
"learning_rate": 0.0004906457497613399,
"loss": 5.9412,
"mean_token_accuracy": 0.17702967971563338,
"num_tokens": 22527988.0,
"step": 8890
},
{
"entropy": 6.225295543670654,
"epoch": 1.026543566070398,
"grad_norm": 0.85546875,
"learning_rate": 0.0004906339716532651,
"loss": 5.9193,
"mean_token_accuracy": 0.1842564597725868,
"num_tokens": 22540613.0,
"step": 8895
},
{
"entropy": 6.214762258529663,
"epoch": 1.0271206001154067,
"grad_norm": 0.921875,
"learning_rate": 0.0004906221862924488,
"loss": 5.8908,
"mean_token_accuracy": 0.18303754180669785,
"num_tokens": 22552137.0,
"step": 8900
},
{
"entropy": 6.297317934036255,
"epoch": 1.0276976341604154,
"grad_norm": 0.8515625,
"learning_rate": 0.0004906103936792875,
"loss": 5.9925,
"mean_token_accuracy": 0.16877427697181702,
"num_tokens": 22564677.0,
"step": 8905
},
{
"entropy": 6.28624005317688,
"epoch": 1.028274668205424,
"grad_norm": 0.88671875,
"learning_rate": 0.0004905985938141777,
"loss": 5.9234,
"mean_token_accuracy": 0.18351348042488097,
"num_tokens": 22578236.0,
"step": 8910
},
{
"entropy": 6.232121229171753,
"epoch": 1.0288517022504329,
"grad_norm": 0.734375,
"learning_rate": 0.0004905867866975163,
"loss": 5.9395,
"mean_token_accuracy": 0.18483252376317977,
"num_tokens": 22592533.0,
"step": 8915
},
{
"entropy": 6.336761236190796,
"epoch": 1.0294287362954415,
"grad_norm": 0.859375,
"learning_rate": 0.0004905749723297003,
"loss": 5.9954,
"mean_token_accuracy": 0.17142664939165114,
"num_tokens": 22606062.0,
"step": 8920
},
{
"entropy": 6.330969190597534,
"epoch": 1.0300057703404502,
"grad_norm": 0.84765625,
"learning_rate": 0.0004905631507111271,
"loss": 6.0044,
"mean_token_accuracy": 0.1759049713611603,
"num_tokens": 22619342.0,
"step": 8925
},
{
"entropy": 6.278731107711792,
"epoch": 1.0305828043854588,
"grad_norm": 0.9765625,
"learning_rate": 0.0004905513218421946,
"loss": 5.9213,
"mean_token_accuracy": 0.1838388368487358,
"num_tokens": 22632003.0,
"step": 8930
},
{
"entropy": 6.2721892356872555,
"epoch": 1.0311598384304674,
"grad_norm": 0.9140625,
"learning_rate": 0.0004905394857233004,
"loss": 5.9619,
"mean_token_accuracy": 0.18194596022367476,
"num_tokens": 22644179.0,
"step": 8935
},
{
"entropy": 6.2627777576446535,
"epoch": 1.031736872475476,
"grad_norm": 1.0546875,
"learning_rate": 0.0004905276423548426,
"loss": 5.9137,
"mean_token_accuracy": 0.18379924744367598,
"num_tokens": 22657544.0,
"step": 8940
},
{
"entropy": 6.312189292907715,
"epoch": 1.0323139065204847,
"grad_norm": 0.88671875,
"learning_rate": 0.0004905157917372197,
"loss": 6.032,
"mean_token_accuracy": 0.16942367404699327,
"num_tokens": 22670789.0,
"step": 8945
},
{
"entropy": 6.268924760818481,
"epoch": 1.0328909405654934,
"grad_norm": 0.8515625,
"learning_rate": 0.0004905039338708302,
"loss": 5.9336,
"mean_token_accuracy": 0.1744486227631569,
"num_tokens": 22682491.0,
"step": 8950
},
{
"entropy": 6.331513929367065,
"epoch": 1.033467974610502,
"grad_norm": 0.83203125,
"learning_rate": 0.0004904920687560728,
"loss": 5.958,
"mean_token_accuracy": 0.17775530517101287,
"num_tokens": 22695235.0,
"step": 8955
},
{
"entropy": 6.240482997894287,
"epoch": 1.0340450086555106,
"grad_norm": 0.8984375,
"learning_rate": 0.0004904801963933469,
"loss": 5.9817,
"mean_token_accuracy": 0.1754314720630646,
"num_tokens": 22707222.0,
"step": 8960
},
{
"entropy": 6.281684684753418,
"epoch": 1.0346220427005193,
"grad_norm": 0.890625,
"learning_rate": 0.0004904683167830515,
"loss": 5.9881,
"mean_token_accuracy": 0.17204625010490418,
"num_tokens": 22718820.0,
"step": 8965
},
{
"entropy": 6.3858250141143795,
"epoch": 1.035199076745528,
"grad_norm": 0.890625,
"learning_rate": 0.0004904564299255862,
"loss": 5.9487,
"mean_token_accuracy": 0.1777167558670044,
"num_tokens": 22731265.0,
"step": 8970
},
{
"entropy": 6.2346197128295895,
"epoch": 1.0357761107905366,
"grad_norm": 0.80078125,
"learning_rate": 0.0004904445358213511,
"loss": 5.8784,
"mean_token_accuracy": 0.18681784719228745,
"num_tokens": 22744222.0,
"step": 8975
},
{
"entropy": 6.2135519027709964,
"epoch": 1.0363531448355452,
"grad_norm": 0.84765625,
"learning_rate": 0.0004904326344707461,
"loss": 5.9367,
"mean_token_accuracy": 0.17929679304361343,
"num_tokens": 22756190.0,
"step": 8980
},
{
"entropy": 6.2172692775726315,
"epoch": 1.036930178880554,
"grad_norm": 0.91796875,
"learning_rate": 0.0004904207258741712,
"loss": 5.8621,
"mean_token_accuracy": 0.18134094625711442,
"num_tokens": 22767943.0,
"step": 8985
},
{
"entropy": 6.245588541030884,
"epoch": 1.0375072129255627,
"grad_norm": 0.86328125,
"learning_rate": 0.0004904088100320274,
"loss": 5.926,
"mean_token_accuracy": 0.18322079628705978,
"num_tokens": 22780972.0,
"step": 8990
},
{
"entropy": 6.313575077056885,
"epoch": 1.0380842469705713,
"grad_norm": 0.91015625,
"learning_rate": 0.0004903968869447151,
"loss": 6.0264,
"mean_token_accuracy": 0.17490241527557374,
"num_tokens": 22792584.0,
"step": 8995
},
{
"entropy": 6.190945482254028,
"epoch": 1.03866128101558,
"grad_norm": 0.79296875,
"learning_rate": 0.0004903849566126356,
"loss": 5.9896,
"mean_token_accuracy": 0.18099549263715745,
"num_tokens": 22807385.0,
"step": 9000
},
{
"epoch": 1.03866128101558,
"eval_entropy": 6.084721145014346,
"eval_loss": 6.074094295501709,
"eval_mean_token_accuracy": 0.17770804125441725,
"eval_num_tokens": 22807385.0,
"eval_runtime": 17.4178,
"eval_samples_per_second": 1615.359,
"eval_steps_per_second": 201.92,
"step": 9000
},
{
"entropy": 6.313442659378052,
"epoch": 1.0392383150605886,
"grad_norm": 0.76171875,
"learning_rate": 0.0004903730190361902,
"loss": 5.9632,
"mean_token_accuracy": 0.17392656654119493,
"num_tokens": 22820655.0,
"step": 9005
},
{
"entropy": 6.274996948242188,
"epoch": 1.0398153491055973,
"grad_norm": 0.89453125,
"learning_rate": 0.00049036107421578,
"loss": 5.875,
"mean_token_accuracy": 0.185438571870327,
"num_tokens": 22833043.0,
"step": 9010
},
{
"entropy": 6.250527429580688,
"epoch": 1.040392383150606,
"grad_norm": 0.95703125,
"learning_rate": 0.0004903491221518073,
"loss": 5.9999,
"mean_token_accuracy": 0.17539497166872026,
"num_tokens": 22844414.0,
"step": 9015
},
{
"entropy": 6.217691421508789,
"epoch": 1.0409694171956145,
"grad_norm": 0.87890625,
"learning_rate": 0.0004903371628446737,
"loss": 5.8996,
"mean_token_accuracy": 0.17889068573713302,
"num_tokens": 22855966.0,
"step": 9020
},
{
"entropy": 6.195151519775391,
"epoch": 1.0415464512406232,
"grad_norm": 0.83203125,
"learning_rate": 0.0004903251962947817,
"loss": 5.8646,
"mean_token_accuracy": 0.1914926216006279,
"num_tokens": 22869300.0,
"step": 9025
},
{
"entropy": 6.31218843460083,
"epoch": 1.0421234852856318,
"grad_norm": 0.859375,
"learning_rate": 0.0004903132225025335,
"loss": 5.9627,
"mean_token_accuracy": 0.17988667339086534,
"num_tokens": 22881040.0,
"step": 9030
},
{
"entropy": 6.275069904327393,
"epoch": 1.0427005193306405,
"grad_norm": 0.98828125,
"learning_rate": 0.0004903012414683322,
"loss": 5.8637,
"mean_token_accuracy": 0.1878153622150421,
"num_tokens": 22892367.0,
"step": 9035
},
{
"entropy": 6.274021911621094,
"epoch": 1.043277553375649,
"grad_norm": 0.88671875,
"learning_rate": 0.0004902892531925805,
"loss": 6.0153,
"mean_token_accuracy": 0.17131800800561905,
"num_tokens": 22904737.0,
"step": 9040
},
{
"entropy": 6.24939112663269,
"epoch": 1.0438545874206577,
"grad_norm": 0.87109375,
"learning_rate": 0.0004902772576756818,
"loss": 6.0132,
"mean_token_accuracy": 0.17432661205530167,
"num_tokens": 22917775.0,
"step": 9045
},
{
"entropy": 6.313559484481812,
"epoch": 1.0444316214656664,
"grad_norm": 0.765625,
"learning_rate": 0.0004902652549180394,
"loss": 6.0118,
"mean_token_accuracy": 0.17096944749355317,
"num_tokens": 22930496.0,
"step": 9050
},
{
"entropy": 6.278980875015259,
"epoch": 1.0450086555106752,
"grad_norm": 0.8828125,
"learning_rate": 0.0004902532449200571,
"loss": 5.9626,
"mean_token_accuracy": 0.17596296668052674,
"num_tokens": 22943787.0,
"step": 9055
},
{
"entropy": 6.249150037765503,
"epoch": 1.0455856895556839,
"grad_norm": 0.90234375,
"learning_rate": 0.0004902412276821386,
"loss": 5.9539,
"mean_token_accuracy": 0.1785372719168663,
"num_tokens": 22956399.0,
"step": 9060
},
{
"entropy": 6.36644868850708,
"epoch": 1.0461627236006925,
"grad_norm": 0.796875,
"learning_rate": 0.0004902292032046887,
"loss": 6.031,
"mean_token_accuracy": 0.1718607723712921,
"num_tokens": 22969993.0,
"step": 9065
},
{
"entropy": 6.401646375656128,
"epoch": 1.0467397576457012,
"grad_norm": 0.890625,
"learning_rate": 0.0004902171714881112,
"loss": 6.0586,
"mean_token_accuracy": 0.1708688423037529,
"num_tokens": 22983807.0,
"step": 9070
},
{
"entropy": 6.274668025970459,
"epoch": 1.0473167916907098,
"grad_norm": 0.86328125,
"learning_rate": 0.0004902051325328112,
"loss": 6.004,
"mean_token_accuracy": 0.1766917884349823,
"num_tokens": 22996238.0,
"step": 9075
},
{
"entropy": 6.275001811981201,
"epoch": 1.0478938257357184,
"grad_norm": 0.84765625,
"learning_rate": 0.0004901930863391934,
"loss": 6.0022,
"mean_token_accuracy": 0.17750514149665833,
"num_tokens": 23009084.0,
"step": 9080
},
{
"entropy": 6.3538471221923825,
"epoch": 1.048470859780727,
"grad_norm": 0.81640625,
"learning_rate": 0.000490181032907663,
"loss": 6.0333,
"mean_token_accuracy": 0.1733698308467865,
"num_tokens": 23022799.0,
"step": 9085
},
{
"entropy": 6.252536058425903,
"epoch": 1.0490478938257357,
"grad_norm": 0.81640625,
"learning_rate": 0.0004901689722386255,
"loss": 5.9922,
"mean_token_accuracy": 0.17759983390569686,
"num_tokens": 23035566.0,
"step": 9090
},
{
"entropy": 6.217030572891235,
"epoch": 1.0496249278707444,
"grad_norm": 0.75,
"learning_rate": 0.0004901569043324864,
"loss": 5.8551,
"mean_token_accuracy": 0.18937528282403945,
"num_tokens": 23050156.0,
"step": 9095
},
{
"entropy": 6.304140615463257,
"epoch": 1.050201961915753,
"grad_norm": 0.87890625,
"learning_rate": 0.0004901448291896518,
"loss": 5.964,
"mean_token_accuracy": 0.17621853202581406,
"num_tokens": 23063121.0,
"step": 9100
},
{
"entropy": 6.211063194274902,
"epoch": 1.0507789959607616,
"grad_norm": 0.8671875,
"learning_rate": 0.0004901327468105277,
"loss": 5.8365,
"mean_token_accuracy": 0.18590471446514129,
"num_tokens": 23075236.0,
"step": 9105
},
{
"entropy": 6.220917272567749,
"epoch": 1.0513560300057703,
"grad_norm": 0.83203125,
"learning_rate": 0.0004901206571955205,
"loss": 6.011,
"mean_token_accuracy": 0.17641226947307587,
"num_tokens": 23089091.0,
"step": 9110
},
{
"entropy": 6.319421052932739,
"epoch": 1.051933064050779,
"grad_norm": 0.78125,
"learning_rate": 0.0004901085603450369,
"loss": 5.9762,
"mean_token_accuracy": 0.17164439111948013,
"num_tokens": 23101642.0,
"step": 9115
},
{
"entropy": 6.340474700927734,
"epoch": 1.0525100980957875,
"grad_norm": 0.828125,
"learning_rate": 0.0004900964562594838,
"loss": 5.9078,
"mean_token_accuracy": 0.1801260828971863,
"num_tokens": 23113427.0,
"step": 9120
},
{
"entropy": 6.2288182258605955,
"epoch": 1.0530871321407964,
"grad_norm": 0.80859375,
"learning_rate": 0.000490084344939268,
"loss": 5.883,
"mean_token_accuracy": 0.18409405052661895,
"num_tokens": 23125857.0,
"step": 9125
},
{
"entropy": 6.2246747493743895,
"epoch": 1.053664166185805,
"grad_norm": 0.82421875,
"learning_rate": 0.0004900722263847973,
"loss": 5.9355,
"mean_token_accuracy": 0.1781703308224678,
"num_tokens": 23138541.0,
"step": 9130
},
{
"entropy": 6.216336917877197,
"epoch": 1.0542412002308137,
"grad_norm": 0.87890625,
"learning_rate": 0.0004900601005964791,
"loss": 5.9201,
"mean_token_accuracy": 0.18445058017969132,
"num_tokens": 23151155.0,
"step": 9135
},
{
"entropy": 6.2328308582305905,
"epoch": 1.0548182342758223,
"grad_norm": 0.82421875,
"learning_rate": 0.0004900479675747212,
"loss": 5.9428,
"mean_token_accuracy": 0.1755356252193451,
"num_tokens": 23165478.0,
"step": 9140
},
{
"entropy": 6.286372423171997,
"epoch": 1.055395268320831,
"grad_norm": 0.8515625,
"learning_rate": 0.0004900358273199316,
"loss": 5.9476,
"mean_token_accuracy": 0.17133285999298095,
"num_tokens": 23178120.0,
"step": 9145
},
{
"entropy": 6.308216190338134,
"epoch": 1.0559723023658396,
"grad_norm": 0.87109375,
"learning_rate": 0.000490023679832519,
"loss": 5.9634,
"mean_token_accuracy": 0.17226850390434265,
"num_tokens": 23191275.0,
"step": 9150
},
{
"entropy": 6.207145166397095,
"epoch": 1.0565493364108482,
"grad_norm": 0.78515625,
"learning_rate": 0.0004900115251128916,
"loss": 5.9664,
"mean_token_accuracy": 0.17270159721374512,
"num_tokens": 23204518.0,
"step": 9155
},
{
"entropy": 6.368451738357544,
"epoch": 1.057126370455857,
"grad_norm": 0.8984375,
"learning_rate": 0.0004899993631614583,
"loss": 6.0091,
"mean_token_accuracy": 0.17063124030828475,
"num_tokens": 23217488.0,
"step": 9160
},
{
"entropy": 6.297813034057617,
"epoch": 1.0577034045008655,
"grad_norm": 0.83984375,
"learning_rate": 0.0004899871939786283,
"loss": 5.9517,
"mean_token_accuracy": 0.17866510897874832,
"num_tokens": 23230101.0,
"step": 9165
},
{
"entropy": 6.250898981094361,
"epoch": 1.0582804385458742,
"grad_norm": 0.80078125,
"learning_rate": 0.0004899750175648107,
"loss": 6.1023,
"mean_token_accuracy": 0.16902584880590438,
"num_tokens": 23243747.0,
"step": 9170
},
{
"entropy": 6.296909427642822,
"epoch": 1.0588574725908828,
"grad_norm": 0.8359375,
"learning_rate": 0.0004899628339204154,
"loss": 5.8954,
"mean_token_accuracy": 0.18030100166797638,
"num_tokens": 23256593.0,
"step": 9175
},
{
"entropy": 6.293514776229858,
"epoch": 1.0594345066358914,
"grad_norm": 1.1015625,
"learning_rate": 0.0004899506430458518,
"loss": 6.0224,
"mean_token_accuracy": 0.17253340929746627,
"num_tokens": 23269359.0,
"step": 9180
},
{
"entropy": 6.199410676956177,
"epoch": 1.0600115406809,
"grad_norm": 0.80859375,
"learning_rate": 0.0004899384449415302,
"loss": 5.8559,
"mean_token_accuracy": 0.1903077781200409,
"num_tokens": 23283462.0,
"step": 9185
},
{
"entropy": 6.2551408290863035,
"epoch": 1.0605885747259087,
"grad_norm": 0.85546875,
"learning_rate": 0.0004899262396078606,
"loss": 5.96,
"mean_token_accuracy": 0.17357292026281357,
"num_tokens": 23295920.0,
"step": 9190
},
{
"entropy": 6.3527368068695065,
"epoch": 1.0611656087709176,
"grad_norm": 0.83984375,
"learning_rate": 0.0004899140270452539,
"loss": 5.9859,
"mean_token_accuracy": 0.17623718380928038,
"num_tokens": 23307433.0,
"step": 9195
},
{
"entropy": 6.2791832447052,
"epoch": 1.0617426428159262,
"grad_norm": 0.83984375,
"learning_rate": 0.0004899018072541204,
"loss": 5.9317,
"mean_token_accuracy": 0.17714277356863023,
"num_tokens": 23320265.0,
"step": 9200
},
{
"entropy": 6.240837335586548,
"epoch": 1.0623196768609349,
"grad_norm": 0.90234375,
"learning_rate": 0.0004898895802348715,
"loss": 5.8086,
"mean_token_accuracy": 0.18867361545562744,
"num_tokens": 23331951.0,
"step": 9205
},
{
"entropy": 6.241315603256226,
"epoch": 1.0628967109059435,
"grad_norm": 0.87109375,
"learning_rate": 0.0004898773459879183,
"loss": 5.9554,
"mean_token_accuracy": 0.17665793150663375,
"num_tokens": 23344862.0,
"step": 9210
},
{
"entropy": 6.263033628463745,
"epoch": 1.0634737449509521,
"grad_norm": 0.90234375,
"learning_rate": 0.0004898651045136724,
"loss": 5.9015,
"mean_token_accuracy": 0.1770300403237343,
"num_tokens": 23357212.0,
"step": 9215
},
{
"entropy": 6.239983558654785,
"epoch": 1.0640507789959608,
"grad_norm": 0.828125,
"learning_rate": 0.0004898528558125453,
"loss": 5.9122,
"mean_token_accuracy": 0.1855781152844429,
"num_tokens": 23370114.0,
"step": 9220
},
{
"entropy": 6.2795045375823975,
"epoch": 1.0646278130409694,
"grad_norm": 0.890625,
"learning_rate": 0.0004898405998849492,
"loss": 5.9202,
"mean_token_accuracy": 0.17944572120904922,
"num_tokens": 23382295.0,
"step": 9225
},
{
"entropy": 6.242071914672851,
"epoch": 1.065204847085978,
"grad_norm": 0.859375,
"learning_rate": 0.0004898283367312962,
"loss": 5.9646,
"mean_token_accuracy": 0.18123720586299896,
"num_tokens": 23395477.0,
"step": 9230
},
{
"entropy": 6.255929803848266,
"epoch": 1.0657818811309867,
"grad_norm": 0.875,
"learning_rate": 0.0004898160663519988,
"loss": 5.8941,
"mean_token_accuracy": 0.18162889778614044,
"num_tokens": 23407868.0,
"step": 9235
},
{
"entropy": 6.257204484939575,
"epoch": 1.0663589151759953,
"grad_norm": 1.1484375,
"learning_rate": 0.0004898037887474697,
"loss": 5.9754,
"mean_token_accuracy": 0.17620085179805756,
"num_tokens": 23422156.0,
"step": 9240
},
{
"entropy": 6.26265287399292,
"epoch": 1.066935949221004,
"grad_norm": 0.89453125,
"learning_rate": 0.0004897915039181219,
"loss": 5.9044,
"mean_token_accuracy": 0.18346980959177017,
"num_tokens": 23433951.0,
"step": 9245
},
{
"entropy": 6.230978536605835,
"epoch": 1.0675129832660126,
"grad_norm": 0.80078125,
"learning_rate": 0.0004897792118643685,
"loss": 5.9532,
"mean_token_accuracy": 0.18462717086076735,
"num_tokens": 23447174.0,
"step": 9250
},
{
"entropy": 6.2545677661895756,
"epoch": 1.0680900173110213,
"grad_norm": 0.859375,
"learning_rate": 0.0004897669125866231,
"loss": 5.9351,
"mean_token_accuracy": 0.18284523487091064,
"num_tokens": 23458502.0,
"step": 9255
},
{
"entropy": 6.270356178283691,
"epoch": 1.06866705135603,
"grad_norm": 0.80859375,
"learning_rate": 0.0004897546060852993,
"loss": 6.0253,
"mean_token_accuracy": 0.17326220422983168,
"num_tokens": 23471572.0,
"step": 9260
},
{
"entropy": 6.228240203857422,
"epoch": 1.0692440854010385,
"grad_norm": 0.89453125,
"learning_rate": 0.0004897422923608108,
"loss": 5.8997,
"mean_token_accuracy": 0.1773914650082588,
"num_tokens": 23484454.0,
"step": 9265
},
{
"entropy": 6.254168748855591,
"epoch": 1.0698211194460474,
"grad_norm": 0.90625,
"learning_rate": 0.0004897299714135721,
"loss": 5.9925,
"mean_token_accuracy": 0.17173787504434584,
"num_tokens": 23497022.0,
"step": 9270
},
{
"entropy": 6.310999917984009,
"epoch": 1.070398153491056,
"grad_norm": 0.90234375,
"learning_rate": 0.0004897176432439974,
"loss": 5.9631,
"mean_token_accuracy": 0.18117151111364366,
"num_tokens": 23510714.0,
"step": 9275
},
{
"entropy": 6.266863012313843,
"epoch": 1.0709751875360647,
"grad_norm": 0.91796875,
"learning_rate": 0.0004897053078525016,
"loss": 5.9645,
"mean_token_accuracy": 0.17361937761306762,
"num_tokens": 23522927.0,
"step": 9280
},
{
"entropy": 6.237617301940918,
"epoch": 1.0715522215810733,
"grad_norm": 0.875,
"learning_rate": 0.0004896929652394993,
"loss": 5.861,
"mean_token_accuracy": 0.1824570968747139,
"num_tokens": 23536042.0,
"step": 9285
},
{
"entropy": 6.3404463768005375,
"epoch": 1.072129255626082,
"grad_norm": 0.875,
"learning_rate": 0.0004896806154054057,
"loss": 5.9772,
"mean_token_accuracy": 0.17799821645021438,
"num_tokens": 23549002.0,
"step": 9290
},
{
"entropy": 6.2474583148956295,
"epoch": 1.0727062896710906,
"grad_norm": 0.8984375,
"learning_rate": 0.0004896682583506363,
"loss": 6.0185,
"mean_token_accuracy": 0.17269163578748703,
"num_tokens": 23563080.0,
"step": 9295
},
{
"entropy": 6.307273435592651,
"epoch": 1.0732833237160992,
"grad_norm": 0.86328125,
"learning_rate": 0.0004896558940756067,
"loss": 5.9423,
"mean_token_accuracy": 0.176519912481308,
"num_tokens": 23577431.0,
"step": 9300
},
{
"entropy": 6.2496092319488525,
"epoch": 1.0738603577611079,
"grad_norm": 0.9609375,
"learning_rate": 0.0004896435225807327,
"loss": 5.8596,
"mean_token_accuracy": 0.1761957362294197,
"num_tokens": 23591191.0,
"step": 9305
},
{
"entropy": 6.230933475494385,
"epoch": 1.0744373918061165,
"grad_norm": 0.875,
"learning_rate": 0.0004896311438664304,
"loss": 5.8573,
"mean_token_accuracy": 0.18647629022598267,
"num_tokens": 23603195.0,
"step": 9310
},
{
"entropy": 6.254529142379761,
"epoch": 1.0750144258511252,
"grad_norm": 0.8359375,
"learning_rate": 0.0004896187579331163,
"loss": 5.9028,
"mean_token_accuracy": 0.1798198029398918,
"num_tokens": 23615278.0,
"step": 9315
},
{
"entropy": 6.273842239379883,
"epoch": 1.0755914598961338,
"grad_norm": 0.84375,
"learning_rate": 0.0004896063647812068,
"loss": 5.9939,
"mean_token_accuracy": 0.1774792715907097,
"num_tokens": 23627311.0,
"step": 9320
},
{
"entropy": 6.239826726913452,
"epoch": 1.0761684939411424,
"grad_norm": 0.8828125,
"learning_rate": 0.0004895939644111189,
"loss": 5.9215,
"mean_token_accuracy": 0.18126792460680008,
"num_tokens": 23640338.0,
"step": 9325
},
{
"entropy": 6.3032557487487795,
"epoch": 1.076745527986151,
"grad_norm": 0.79296875,
"learning_rate": 0.0004895815568232694,
"loss": 6.0196,
"mean_token_accuracy": 0.17663963586091996,
"num_tokens": 23654541.0,
"step": 9330
},
{
"entropy": 6.281169319152832,
"epoch": 1.07732256203116,
"grad_norm": 0.86328125,
"learning_rate": 0.0004895691420180759,
"loss": 5.9846,
"mean_token_accuracy": 0.1778423696756363,
"num_tokens": 23666837.0,
"step": 9335
},
{
"entropy": 6.35228910446167,
"epoch": 1.0778995960761686,
"grad_norm": 0.87890625,
"learning_rate": 0.000489556719995956,
"loss": 5.97,
"mean_token_accuracy": 0.1766431748867035,
"num_tokens": 23679270.0,
"step": 9340
},
{
"entropy": 6.268666172027588,
"epoch": 1.0784766301211772,
"grad_norm": 0.859375,
"learning_rate": 0.0004895442907573274,
"loss": 5.9574,
"mean_token_accuracy": 0.178663232922554,
"num_tokens": 23691640.0,
"step": 9345
},
{
"entropy": 6.240317010879517,
"epoch": 1.0790536641661859,
"grad_norm": 0.796875,
"learning_rate": 0.000489531854302608,
"loss": 5.9613,
"mean_token_accuracy": 0.17662242352962493,
"num_tokens": 23704545.0,
"step": 9350
},
{
"entropy": 6.238865852355957,
"epoch": 1.0796306982111945,
"grad_norm": 0.875,
"learning_rate": 0.0004895194106322164,
"loss": 5.9033,
"mean_token_accuracy": 0.1860482156276703,
"num_tokens": 23716319.0,
"step": 9355
},
{
"entropy": 6.265583896636963,
"epoch": 1.0802077322562031,
"grad_norm": 0.90625,
"learning_rate": 0.0004895069597465709,
"loss": 5.9715,
"mean_token_accuracy": 0.1786327689886093,
"num_tokens": 23728633.0,
"step": 9360
},
{
"entropy": 6.3230654239654545,
"epoch": 1.0807847663012118,
"grad_norm": 0.83203125,
"learning_rate": 0.0004894945016460904,
"loss": 5.9901,
"mean_token_accuracy": 0.1795554667711258,
"num_tokens": 23741370.0,
"step": 9365
},
{
"entropy": 6.235442304611206,
"epoch": 1.0813618003462204,
"grad_norm": 0.90234375,
"learning_rate": 0.0004894820363311938,
"loss": 5.917,
"mean_token_accuracy": 0.185208560526371,
"num_tokens": 23754026.0,
"step": 9370
},
{
"entropy": 6.2940778732299805,
"epoch": 1.081938834391229,
"grad_norm": 0.828125,
"learning_rate": 0.0004894695638023005,
"loss": 6.017,
"mean_token_accuracy": 0.16951347440481185,
"num_tokens": 23766950.0,
"step": 9375
},
{
"entropy": 6.275958490371704,
"epoch": 1.0825158684362377,
"grad_norm": 0.859375,
"learning_rate": 0.00048945708405983,
"loss": 5.9975,
"mean_token_accuracy": 0.17893885672092438,
"num_tokens": 23780858.0,
"step": 9380
},
{
"entropy": 6.270656681060791,
"epoch": 1.0830929024812463,
"grad_norm": 0.79296875,
"learning_rate": 0.0004894445971042019,
"loss": 5.9415,
"mean_token_accuracy": 0.17487251460552217,
"num_tokens": 23793213.0,
"step": 9385
},
{
"entropy": 6.233089923858643,
"epoch": 1.083669936526255,
"grad_norm": 0.85546875,
"learning_rate": 0.0004894321029358364,
"loss": 5.9367,
"mean_token_accuracy": 0.17659147530794145,
"num_tokens": 23804754.0,
"step": 9390
},
{
"entropy": 6.246839284896851,
"epoch": 1.0842469705712636,
"grad_norm": 0.859375,
"learning_rate": 0.0004894196015551536,
"loss": 5.9952,
"mean_token_accuracy": 0.17514082789421082,
"num_tokens": 23817503.0,
"step": 9395
},
{
"entropy": 6.269915151596069,
"epoch": 1.0848240046162723,
"grad_norm": 0.83203125,
"learning_rate": 0.000489407092962574,
"loss": 5.9739,
"mean_token_accuracy": 0.17312580794095994,
"num_tokens": 23830263.0,
"step": 9400
},
{
"entropy": 6.2076012134552006,
"epoch": 1.085401038661281,
"grad_norm": 0.828125,
"learning_rate": 0.0004893945771585183,
"loss": 5.8892,
"mean_token_accuracy": 0.18111756443977356,
"num_tokens": 23843734.0,
"step": 9405
},
{
"entropy": 6.334919023513794,
"epoch": 1.0859780727062898,
"grad_norm": 0.84765625,
"learning_rate": 0.0004893820541434075,
"loss": 5.994,
"mean_token_accuracy": 0.1769810661673546,
"num_tokens": 23856857.0,
"step": 9410
},
{
"entropy": 6.277773189544678,
"epoch": 1.0865551067512984,
"grad_norm": 0.85546875,
"learning_rate": 0.0004893695239176629,
"loss": 5.8815,
"mean_token_accuracy": 0.18349405825138093,
"num_tokens": 23869961.0,
"step": 9415
},
{
"entropy": 6.309881114959717,
"epoch": 1.087132140796307,
"grad_norm": 0.87109375,
"learning_rate": 0.0004893569864817057,
"loss": 5.9669,
"mean_token_accuracy": 0.17408453524112702,
"num_tokens": 23884551.0,
"step": 9420
},
{
"entropy": 6.270121240615845,
"epoch": 1.0877091748413157,
"grad_norm": 0.82421875,
"learning_rate": 0.0004893444418359579,
"loss": 6.0336,
"mean_token_accuracy": 0.17170625180006027,
"num_tokens": 23897240.0,
"step": 9425
},
{
"entropy": 6.264082288742065,
"epoch": 1.0882862088863243,
"grad_norm": 0.7890625,
"learning_rate": 0.000489331889980841,
"loss": 5.9237,
"mean_token_accuracy": 0.17865306586027146,
"num_tokens": 23909677.0,
"step": 9430
},
{
"entropy": 6.2898622989654545,
"epoch": 1.088863242931333,
"grad_norm": 0.82421875,
"learning_rate": 0.0004893193309167778,
"loss": 5.9709,
"mean_token_accuracy": 0.1740755632519722,
"num_tokens": 23921552.0,
"step": 9435
},
{
"entropy": 6.293569660186767,
"epoch": 1.0894402769763416,
"grad_norm": 1.0859375,
"learning_rate": 0.0004893067646441902,
"loss": 5.9893,
"mean_token_accuracy": 0.1750696122646332,
"num_tokens": 23936315.0,
"step": 9440
},
{
"entropy": 6.2551616668701175,
"epoch": 1.0900173110213502,
"grad_norm": 0.8203125,
"learning_rate": 0.000489294191163501,
"loss": 5.989,
"mean_token_accuracy": 0.1700183093547821,
"num_tokens": 23948939.0,
"step": 9445
},
{
"entropy": 6.315537405014038,
"epoch": 1.0905943450663589,
"grad_norm": 0.84765625,
"learning_rate": 0.0004892816104751331,
"loss": 5.9714,
"mean_token_accuracy": 0.17250317335128784,
"num_tokens": 23961657.0,
"step": 9450
},
{
"entropy": 6.379075288772583,
"epoch": 1.0911713791113675,
"grad_norm": 0.87890625,
"learning_rate": 0.0004892690225795096,
"loss": 6.0779,
"mean_token_accuracy": 0.16363574415445328,
"num_tokens": 23974085.0,
"step": 9455
},
{
"entropy": 6.226323127746582,
"epoch": 1.0917484131563762,
"grad_norm": 0.8671875,
"learning_rate": 0.0004892564274770542,
"loss": 5.8984,
"mean_token_accuracy": 0.18159161359071732,
"num_tokens": 23987038.0,
"step": 9460
},
{
"entropy": 6.324076747894287,
"epoch": 1.0923254472013848,
"grad_norm": 0.87109375,
"learning_rate": 0.0004892438251681901,
"loss": 5.9539,
"mean_token_accuracy": 0.1822775423526764,
"num_tokens": 24001051.0,
"step": 9465
},
{
"entropy": 6.249374294281006,
"epoch": 1.0929024812463934,
"grad_norm": 0.9453125,
"learning_rate": 0.0004892312156533413,
"loss": 5.9418,
"mean_token_accuracy": 0.17759458720684052,
"num_tokens": 24013817.0,
"step": 9470
},
{
"entropy": 6.213703584671021,
"epoch": 1.0934795152914023,
"grad_norm": 0.8125,
"learning_rate": 0.0004892185989329321,
"loss": 5.9026,
"mean_token_accuracy": 0.18459791988134383,
"num_tokens": 24025810.0,
"step": 9475
},
{
"entropy": 6.205026483535766,
"epoch": 1.094056549336411,
"grad_norm": 0.8203125,
"learning_rate": 0.0004892059750073868,
"loss": 5.8696,
"mean_token_accuracy": 0.18799868524074553,
"num_tokens": 24039796.0,
"step": 9480
},
{
"entropy": 6.299359941482544,
"epoch": 1.0946335833814196,
"grad_norm": 0.90625,
"learning_rate": 0.0004891933438771299,
"loss": 5.9544,
"mean_token_accuracy": 0.18001185804605485,
"num_tokens": 24052721.0,
"step": 9485
},
{
"entropy": 6.223298168182373,
"epoch": 1.0952106174264282,
"grad_norm": 0.8671875,
"learning_rate": 0.0004891807055425862,
"loss": 5.8763,
"mean_token_accuracy": 0.18155607432127,
"num_tokens": 24064515.0,
"step": 9490
},
{
"entropy": 6.23270058631897,
"epoch": 1.0957876514714369,
"grad_norm": 0.91015625,
"learning_rate": 0.0004891680600041809,
"loss": 5.8902,
"mean_token_accuracy": 0.18266638964414597,
"num_tokens": 24078537.0,
"step": 9495
},
{
"entropy": 6.345634460449219,
"epoch": 1.0963646855164455,
"grad_norm": 0.87109375,
"learning_rate": 0.0004891554072623392,
"loss": 6.0158,
"mean_token_accuracy": 0.17161341458559037,
"num_tokens": 24092067.0,
"step": 9500
},
{
"entropy": 6.255663776397705,
"epoch": 1.0969417195614541,
"grad_norm": 0.765625,
"learning_rate": 0.0004891427473174869,
"loss": 5.9806,
"mean_token_accuracy": 0.17526648789644242,
"num_tokens": 24105625.0,
"step": 9505
},
{
"entropy": 6.310681390762329,
"epoch": 1.0975187536064628,
"grad_norm": 0.82421875,
"learning_rate": 0.0004891300801700496,
"loss": 5.9889,
"mean_token_accuracy": 0.1670171231031418,
"num_tokens": 24119714.0,
"step": 9510
},
{
"entropy": 6.2422620296478275,
"epoch": 1.0980957876514714,
"grad_norm": 0.81640625,
"learning_rate": 0.0004891174058204534,
"loss": 5.9128,
"mean_token_accuracy": 0.17377041578292846,
"num_tokens": 24132873.0,
"step": 9515
},
{
"entropy": 6.1889232158660885,
"epoch": 1.09867282169648,
"grad_norm": 0.86328125,
"learning_rate": 0.0004891047242691246,
"loss": 5.8912,
"mean_token_accuracy": 0.17926355302333832,
"num_tokens": 24145550.0,
"step": 9520
},
{
"entropy": 6.221427726745605,
"epoch": 1.0992498557414887,
"grad_norm": 0.93359375,
"learning_rate": 0.0004890920355164897,
"loss": 5.9078,
"mean_token_accuracy": 0.17647993713617324,
"num_tokens": 24158232.0,
"step": 9525
},
{
"entropy": 6.305940246582031,
"epoch": 1.0998268897864973,
"grad_norm": 0.8125,
"learning_rate": 0.0004890793395629756,
"loss": 6.049,
"mean_token_accuracy": 0.16808070093393326,
"num_tokens": 24170780.0,
"step": 9530
},
{
"entropy": 6.220670223236084,
"epoch": 1.100403923831506,
"grad_norm": 0.8828125,
"learning_rate": 0.0004890666364090093,
"loss": 5.9178,
"mean_token_accuracy": 0.18042859733104705,
"num_tokens": 24182347.0,
"step": 9535
},
{
"entropy": 6.292816114425659,
"epoch": 1.1009809578765146,
"grad_norm": 0.80859375,
"learning_rate": 0.0004890539260550181,
"loss": 6.0075,
"mean_token_accuracy": 0.1743740364909172,
"num_tokens": 24195215.0,
"step": 9540
},
{
"entropy": 6.28514461517334,
"epoch": 1.1015579919215233,
"grad_norm": 0.890625,
"learning_rate": 0.0004890412085014292,
"loss": 5.9182,
"mean_token_accuracy": 0.18192071616649627,
"num_tokens": 24208214.0,
"step": 9545
},
{
"entropy": 6.272170162200927,
"epoch": 1.1021350259665321,
"grad_norm": 0.8359375,
"learning_rate": 0.0004890284837486706,
"loss": 5.9363,
"mean_token_accuracy": 0.17845190614461898,
"num_tokens": 24220883.0,
"step": 9550
},
{
"entropy": 6.224795198440551,
"epoch": 1.1027120600115408,
"grad_norm": 0.8671875,
"learning_rate": 0.0004890157517971704,
"loss": 5.8637,
"mean_token_accuracy": 0.18637510240077973,
"num_tokens": 24233918.0,
"step": 9555
},
{
"entropy": 6.2827919006347654,
"epoch": 1.1032890940565494,
"grad_norm": 0.82421875,
"learning_rate": 0.0004890030126473566,
"loss": 6.0017,
"mean_token_accuracy": 0.17295387089252473,
"num_tokens": 24247307.0,
"step": 9560
},
{
"entropy": 6.262751674652099,
"epoch": 1.103866128101558,
"grad_norm": 1.1015625,
"learning_rate": 0.0004889902662996578,
"loss": 5.8885,
"mean_token_accuracy": 0.18006763756275176,
"num_tokens": 24260149.0,
"step": 9565
},
{
"entropy": 6.2460860252380375,
"epoch": 1.1044431621465667,
"grad_norm": 0.83984375,
"learning_rate": 0.0004889775127545027,
"loss": 5.9753,
"mean_token_accuracy": 0.17819419503211975,
"num_tokens": 24273675.0,
"step": 9570
},
{
"entropy": 6.273380994796753,
"epoch": 1.1050201961915753,
"grad_norm": 0.8828125,
"learning_rate": 0.0004889647520123202,
"loss": 5.8817,
"mean_token_accuracy": 0.18066975921392442,
"num_tokens": 24285575.0,
"step": 9575
},
{
"entropy": 6.266949462890625,
"epoch": 1.105597230236584,
"grad_norm": 1.984375,
"learning_rate": 0.0004889519840735396,
"loss": 5.9146,
"mean_token_accuracy": 0.19424535930156708,
"num_tokens": 24297908.0,
"step": 9580
},
{
"entropy": 6.182698535919189,
"epoch": 1.1061742642815926,
"grad_norm": 0.83203125,
"learning_rate": 0.0004889392089385903,
"loss": 5.8977,
"mean_token_accuracy": 0.18063640892505645,
"num_tokens": 24310714.0,
"step": 9585
},
{
"entropy": 6.233695125579834,
"epoch": 1.1067512983266012,
"grad_norm": 0.8984375,
"learning_rate": 0.0004889264266079019,
"loss": 5.9384,
"mean_token_accuracy": 0.18608282655477523,
"num_tokens": 24322367.0,
"step": 9590
},
{
"entropy": 6.27492094039917,
"epoch": 1.1073283323716099,
"grad_norm": 0.94140625,
"learning_rate": 0.0004889136370819045,
"loss": 5.9241,
"mean_token_accuracy": 0.17917955815792083,
"num_tokens": 24334256.0,
"step": 9595
},
{
"entropy": 6.238777923583984,
"epoch": 1.1079053664166185,
"grad_norm": 0.87109375,
"learning_rate": 0.0004889008403610281,
"loss": 5.9273,
"mean_token_accuracy": 0.18196589946746827,
"num_tokens": 24346968.0,
"step": 9600
},
{
"entropy": 6.318524122238159,
"epoch": 1.1084824004616272,
"grad_norm": 0.8828125,
"learning_rate": 0.0004888880364457033,
"loss": 5.9858,
"mean_token_accuracy": 0.18197154253721237,
"num_tokens": 24360468.0,
"step": 9605
},
{
"entropy": 6.250274705886841,
"epoch": 1.1090594345066358,
"grad_norm": 0.88671875,
"learning_rate": 0.0004888752253363604,
"loss": 5.9434,
"mean_token_accuracy": 0.1844514176249504,
"num_tokens": 24372330.0,
"step": 9610
},
{
"entropy": 6.191738557815552,
"epoch": 1.1096364685516447,
"grad_norm": 0.83203125,
"learning_rate": 0.0004888624070334308,
"loss": 5.9206,
"mean_token_accuracy": 0.17861685305833816,
"num_tokens": 24384864.0,
"step": 9615
},
{
"entropy": 6.206880760192871,
"epoch": 1.1102135025966533,
"grad_norm": 0.8359375,
"learning_rate": 0.0004888495815373452,
"loss": 5.8315,
"mean_token_accuracy": 0.18677129745483398,
"num_tokens": 24397408.0,
"step": 9620
},
{
"entropy": 6.244317722320557,
"epoch": 1.110790536641662,
"grad_norm": 0.921875,
"learning_rate": 0.0004888367488485351,
"loss": 5.8915,
"mean_token_accuracy": 0.18083362877368928,
"num_tokens": 24409113.0,
"step": 9625
},
{
"entropy": 6.221122789382934,
"epoch": 1.1113675706866706,
"grad_norm": 0.859375,
"learning_rate": 0.0004888239089674323,
"loss": 5.8999,
"mean_token_accuracy": 0.17989745289087294,
"num_tokens": 24420818.0,
"step": 9630
},
{
"entropy": 6.320473575592041,
"epoch": 1.1119446047316792,
"grad_norm": 0.8125,
"learning_rate": 0.0004888110618944686,
"loss": 6.0477,
"mean_token_accuracy": 0.16832794100046158,
"num_tokens": 24434452.0,
"step": 9635
},
{
"entropy": 6.317052507400513,
"epoch": 1.1125216387766879,
"grad_norm": 0.82421875,
"learning_rate": 0.0004887982076300759,
"loss": 6.018,
"mean_token_accuracy": 0.17300770580768585,
"num_tokens": 24448674.0,
"step": 9640
},
{
"entropy": 6.278442859649658,
"epoch": 1.1130986728216965,
"grad_norm": 0.828125,
"learning_rate": 0.0004887853461746867,
"loss": 5.9311,
"mean_token_accuracy": 0.17755277156829835,
"num_tokens": 24461388.0,
"step": 9645
},
{
"entropy": 6.260433673858643,
"epoch": 1.1136757068667051,
"grad_norm": 0.83203125,
"learning_rate": 0.0004887724775287336,
"loss": 5.8879,
"mean_token_accuracy": 0.18106852620840072,
"num_tokens": 24474304.0,
"step": 9650
},
{
"entropy": 6.193238162994385,
"epoch": 1.1142527409117138,
"grad_norm": 0.7890625,
"learning_rate": 0.0004887596016926494,
"loss": 5.8876,
"mean_token_accuracy": 0.1843292832374573,
"num_tokens": 24487175.0,
"step": 9655
},
{
"entropy": 6.247819232940674,
"epoch": 1.1148297749567224,
"grad_norm": 0.86328125,
"learning_rate": 0.0004887467186668673,
"loss": 5.9165,
"mean_token_accuracy": 0.17582756131887436,
"num_tokens": 24500160.0,
"step": 9660
},
{
"entropy": 6.303691053390503,
"epoch": 1.115406809001731,
"grad_norm": 0.94140625,
"learning_rate": 0.0004887338284518204,
"loss": 6.0161,
"mean_token_accuracy": 0.17239674627780915,
"num_tokens": 24513358.0,
"step": 9665
},
{
"entropy": 6.237333631515503,
"epoch": 1.1159838430467397,
"grad_norm": 0.91015625,
"learning_rate": 0.0004887209310479423,
"loss": 5.9054,
"mean_token_accuracy": 0.18612945675849915,
"num_tokens": 24526254.0,
"step": 9670
},
{
"entropy": 6.213815975189209,
"epoch": 1.1165608770917483,
"grad_norm": 0.8359375,
"learning_rate": 0.0004887080264556668,
"loss": 5.8248,
"mean_token_accuracy": 0.18724657446146012,
"num_tokens": 24540023.0,
"step": 9675
},
{
"entropy": 6.252214860916138,
"epoch": 1.117137911136757,
"grad_norm": 0.90234375,
"learning_rate": 0.0004886951146754282,
"loss": 5.9475,
"mean_token_accuracy": 0.17748111933469773,
"num_tokens": 24553270.0,
"step": 9680
},
{
"entropy": 6.2683617115020756,
"epoch": 1.1177149451817656,
"grad_norm": 0.8046875,
"learning_rate": 0.0004886821957076603,
"loss": 5.9217,
"mean_token_accuracy": 0.181137290596962,
"num_tokens": 24565576.0,
"step": 9685
},
{
"entropy": 6.23697943687439,
"epoch": 1.1182919792267745,
"grad_norm": 0.859375,
"learning_rate": 0.000488669269552798,
"loss": 6.0058,
"mean_token_accuracy": 0.17781507223844528,
"num_tokens": 24578825.0,
"step": 9690
},
{
"entropy": 6.2838945388793945,
"epoch": 1.1188690132717831,
"grad_norm": 0.84375,
"learning_rate": 0.000488656336211276,
"loss": 6.0018,
"mean_token_accuracy": 0.17679450809955596,
"num_tokens": 24592058.0,
"step": 9695
},
{
"entropy": 6.310996246337891,
"epoch": 1.1194460473167918,
"grad_norm": 0.83203125,
"learning_rate": 0.0004886433956835292,
"loss": 5.8804,
"mean_token_accuracy": 0.18037169873714448,
"num_tokens": 24605956.0,
"step": 9700
},
{
"entropy": 6.2612090587615965,
"epoch": 1.1200230813618004,
"grad_norm": 0.87890625,
"learning_rate": 0.0004886304479699929,
"loss": 5.9197,
"mean_token_accuracy": 0.18407063484191893,
"num_tokens": 24618904.0,
"step": 9705
},
{
"entropy": 6.2928119659423825,
"epoch": 1.120600115406809,
"grad_norm": 0.91796875,
"learning_rate": 0.0004886174930711027,
"loss": 6.0456,
"mean_token_accuracy": 0.17686478793621063,
"num_tokens": 24632720.0,
"step": 9710
},
{
"entropy": 6.260981178283691,
"epoch": 1.1211771494518177,
"grad_norm": 0.89453125,
"learning_rate": 0.0004886045309872941,
"loss": 5.9979,
"mean_token_accuracy": 0.17472656220197677,
"num_tokens": 24644863.0,
"step": 9715
},
{
"entropy": 6.306377601623535,
"epoch": 1.1217541834968263,
"grad_norm": 0.8984375,
"learning_rate": 0.0004885915617190034,
"loss": 5.9805,
"mean_token_accuracy": 0.17594851553440094,
"num_tokens": 24656884.0,
"step": 9720
},
{
"entropy": 6.281054592132568,
"epoch": 1.122331217541835,
"grad_norm": 0.95703125,
"learning_rate": 0.0004885785852666664,
"loss": 5.9456,
"mean_token_accuracy": 0.17910037338733673,
"num_tokens": 24671008.0,
"step": 9725
},
{
"entropy": 6.2424633502960205,
"epoch": 1.1229082515868436,
"grad_norm": 0.82421875,
"learning_rate": 0.0004885656016307199,
"loss": 5.9427,
"mean_token_accuracy": 0.17576711028814315,
"num_tokens": 24685787.0,
"step": 9730
},
{
"entropy": 6.344523096084595,
"epoch": 1.1234852856318522,
"grad_norm": 0.91796875,
"learning_rate": 0.0004885526108116004,
"loss": 6.0128,
"mean_token_accuracy": 0.17457142174243928,
"num_tokens": 24697233.0,
"step": 9735
},
{
"entropy": 6.26629490852356,
"epoch": 1.1240623196768609,
"grad_norm": 0.91015625,
"learning_rate": 0.000488539612809745,
"loss": 5.9203,
"mean_token_accuracy": 0.18147749304771424,
"num_tokens": 24709409.0,
"step": 9740
},
{
"entropy": 6.288652181625366,
"epoch": 1.1246393537218695,
"grad_norm": 0.8515625,
"learning_rate": 0.0004885266076255907,
"loss": 5.9991,
"mean_token_accuracy": 0.17411095947027205,
"num_tokens": 24722006.0,
"step": 9745
},
{
"entropy": 6.341065502166748,
"epoch": 1.1252163877668782,
"grad_norm": 0.90234375,
"learning_rate": 0.000488513595259575,
"loss": 5.9978,
"mean_token_accuracy": 0.16869597434997557,
"num_tokens": 24736060.0,
"step": 9750
},
{
"entropy": 6.306094789505005,
"epoch": 1.125793421811887,
"grad_norm": 0.84375,
"learning_rate": 0.0004885005757121357,
"loss": 5.9776,
"mean_token_accuracy": 0.17298872172832488,
"num_tokens": 24748008.0,
"step": 9755
},
{
"entropy": 6.277267408370972,
"epoch": 1.1263704558568954,
"grad_norm": 0.87109375,
"learning_rate": 0.0004884875489837105,
"loss": 5.9418,
"mean_token_accuracy": 0.1754933163523674,
"num_tokens": 24760631.0,
"step": 9760
},
{
"entropy": 6.109272480010986,
"epoch": 1.1269474899019043,
"grad_norm": 0.8515625,
"learning_rate": 0.0004884745150747378,
"loss": 5.8061,
"mean_token_accuracy": 0.1959839642047882,
"num_tokens": 24772646.0,
"step": 9765
},
{
"entropy": 6.2138436794281,
"epoch": 1.127524523946913,
"grad_norm": 0.91015625,
"learning_rate": 0.0004884614739856556,
"loss": 5.9671,
"mean_token_accuracy": 0.17570037841796876,
"num_tokens": 24784571.0,
"step": 9770
},
{
"entropy": 6.336449003219604,
"epoch": 1.1281015579919216,
"grad_norm": 0.86328125,
"learning_rate": 0.0004884484257169028,
"loss": 5.9631,
"mean_token_accuracy": 0.17928054183721542,
"num_tokens": 24797810.0,
"step": 9775
},
{
"entropy": 6.231250190734864,
"epoch": 1.1286785920369302,
"grad_norm": 0.8984375,
"learning_rate": 0.0004884353702689183,
"loss": 5.92,
"mean_token_accuracy": 0.17948038578033448,
"num_tokens": 24810677.0,
"step": 9780
},
{
"entropy": 6.246661615371704,
"epoch": 1.1292556260819389,
"grad_norm": 0.88671875,
"learning_rate": 0.0004884223076421411,
"loss": 5.8837,
"mean_token_accuracy": 0.1834596186876297,
"num_tokens": 24823138.0,
"step": 9785
},
{
"entropy": 6.161348485946656,
"epoch": 1.1298326601269475,
"grad_norm": 0.8203125,
"learning_rate": 0.0004884092378370106,
"loss": 5.8994,
"mean_token_accuracy": 0.19012928754091263,
"num_tokens": 24834548.0,
"step": 9790
},
{
"entropy": 6.260898113250732,
"epoch": 1.1304096941719561,
"grad_norm": 0.9296875,
"learning_rate": 0.0004883961608539664,
"loss": 5.9793,
"mean_token_accuracy": 0.1769823431968689,
"num_tokens": 24847326.0,
"step": 9795
},
{
"entropy": 6.243139791488647,
"epoch": 1.1309867282169648,
"grad_norm": 0.97265625,
"learning_rate": 0.0004883830766934484,
"loss": 5.7928,
"mean_token_accuracy": 0.1948003813624382,
"num_tokens": 24860417.0,
"step": 9800
},
{
"entropy": 6.203162908554077,
"epoch": 1.1315637622619734,
"grad_norm": 0.87109375,
"learning_rate": 0.0004883699853558965,
"loss": 5.9125,
"mean_token_accuracy": 0.17804983854293824,
"num_tokens": 24872759.0,
"step": 9805
},
{
"entropy": 6.2547111988067625,
"epoch": 1.132140796306982,
"grad_norm": 0.88671875,
"learning_rate": 0.0004883568868417511,
"loss": 5.8794,
"mean_token_accuracy": 0.17914481908082963,
"num_tokens": 24885278.0,
"step": 9810
},
{
"entropy": 6.285055685043335,
"epoch": 1.1327178303519907,
"grad_norm": 0.8125,
"learning_rate": 0.0004883437811514528,
"loss": 6.0068,
"mean_token_accuracy": 0.1728021264076233,
"num_tokens": 24898596.0,
"step": 9815
},
{
"entropy": 6.273211240768433,
"epoch": 1.1332948643969993,
"grad_norm": 0.76171875,
"learning_rate": 0.0004883306682854424,
"loss": 5.931,
"mean_token_accuracy": 0.18046294897794724,
"num_tokens": 24911755.0,
"step": 9820
},
{
"entropy": 6.307237911224365,
"epoch": 1.133871898442008,
"grad_norm": 0.87109375,
"learning_rate": 0.0004883175482441611,
"loss": 5.9945,
"mean_token_accuracy": 0.17272798269987105,
"num_tokens": 24925197.0,
"step": 9825
},
{
"entropy": 6.180803823471069,
"epoch": 1.1344489324870168,
"grad_norm": 0.85546875,
"learning_rate": 0.0004883044210280499,
"loss": 5.8241,
"mean_token_accuracy": 0.18567555099725724,
"num_tokens": 24938204.0,
"step": 9830
},
{
"entropy": 6.20053653717041,
"epoch": 1.1350259665320255,
"grad_norm": 0.9453125,
"learning_rate": 0.0004882912866375505,
"loss": 5.9601,
"mean_token_accuracy": 0.18451820313930511,
"num_tokens": 24949382.0,
"step": 9835
},
{
"entropy": 6.2447374820709225,
"epoch": 1.1356030005770341,
"grad_norm": 0.87109375,
"learning_rate": 0.00048827814507310455,
"loss": 5.9229,
"mean_token_accuracy": 0.17463673502206803,
"num_tokens": 24961685.0,
"step": 9840
},
{
"entropy": 6.234250545501709,
"epoch": 1.1361800346220428,
"grad_norm": 0.93359375,
"learning_rate": 0.00048826499633515416,
"loss": 5.9051,
"mean_token_accuracy": 0.18329232782125474,
"num_tokens": 24973619.0,
"step": 9845
},
{
"entropy": 6.21411657333374,
"epoch": 1.1367570686670514,
"grad_norm": 0.93359375,
"learning_rate": 0.00048825184042414156,
"loss": 5.9044,
"mean_token_accuracy": 0.18802542388439178,
"num_tokens": 24985156.0,
"step": 9850
},
{
"entropy": 6.160888385772705,
"epoch": 1.13733410271206,
"grad_norm": 0.90234375,
"learning_rate": 0.0004882386773405092,
"loss": 5.9201,
"mean_token_accuracy": 0.1874276265501976,
"num_tokens": 24997891.0,
"step": 9855
},
{
"entropy": 6.3374419689178465,
"epoch": 1.1379111367570687,
"grad_norm": 0.89453125,
"learning_rate": 0.0004882255070846999,
"loss": 5.9334,
"mean_token_accuracy": 0.17814454138278962,
"num_tokens": 25009824.0,
"step": 9860
},
{
"entropy": 6.28568754196167,
"epoch": 1.1384881708020773,
"grad_norm": 0.84765625,
"learning_rate": 0.00048821232965715663,
"loss": 5.9641,
"mean_token_accuracy": 0.17603467255830765,
"num_tokens": 25021574.0,
"step": 9865
},
{
"entropy": 6.247843408584595,
"epoch": 1.139065204847086,
"grad_norm": 0.8828125,
"learning_rate": 0.0004881991450583225,
"loss": 5.8774,
"mean_token_accuracy": 0.18148830235004426,
"num_tokens": 25033315.0,
"step": 9870
},
{
"entropy": 6.207533264160157,
"epoch": 1.1396422388920946,
"grad_norm": 0.9453125,
"learning_rate": 0.000488185953288641,
"loss": 5.9337,
"mean_token_accuracy": 0.1857161581516266,
"num_tokens": 25046284.0,
"step": 9875
},
{
"entropy": 6.271518850326538,
"epoch": 1.1402192729371032,
"grad_norm": 0.8203125,
"learning_rate": 0.0004881727543485559,
"loss": 5.9082,
"mean_token_accuracy": 0.18233485966920854,
"num_tokens": 25058484.0,
"step": 9880
},
{
"entropy": 6.22105860710144,
"epoch": 1.1407963069821119,
"grad_norm": 0.90234375,
"learning_rate": 0.00048815954823851107,
"loss": 5.8425,
"mean_token_accuracy": 0.18622921258211136,
"num_tokens": 25070555.0,
"step": 9885
},
{
"entropy": 6.322746706008911,
"epoch": 1.1413733410271205,
"grad_norm": 0.86328125,
"learning_rate": 0.00048814633495895067,
"loss": 6.0142,
"mean_token_accuracy": 0.17440420240163804,
"num_tokens": 25083492.0,
"step": 9890
},
{
"entropy": 6.308733797073364,
"epoch": 1.1419503750721294,
"grad_norm": 0.86328125,
"learning_rate": 0.0004881331145103192,
"loss": 5.9921,
"mean_token_accuracy": 0.17199164181947707,
"num_tokens": 25096332.0,
"step": 9895
},
{
"entropy": 6.276531744003296,
"epoch": 1.1425274091171378,
"grad_norm": 1.15625,
"learning_rate": 0.0004881198868930614,
"loss": 5.896,
"mean_token_accuracy": 0.17704352885484695,
"num_tokens": 25110447.0,
"step": 9900
},
{
"entropy": 6.309626197814941,
"epoch": 1.1431044431621467,
"grad_norm": 0.8828125,
"learning_rate": 0.00048810665210762195,
"loss": 5.9725,
"mean_token_accuracy": 0.17967149913311004,
"num_tokens": 25123852.0,
"step": 9905
},
{
"entropy": 6.262395286560059,
"epoch": 1.1436814772071553,
"grad_norm": 0.80078125,
"learning_rate": 0.00048809341015444615,
"loss": 5.9666,
"mean_token_accuracy": 0.1768372818827629,
"num_tokens": 25136151.0,
"step": 9910
},
{
"entropy": 6.243071460723877,
"epoch": 1.144258511252164,
"grad_norm": 0.90625,
"learning_rate": 0.00048808016103397934,
"loss": 5.9179,
"mean_token_accuracy": 0.1830576628446579,
"num_tokens": 25149642.0,
"step": 9915
},
{
"entropy": 6.218459749221802,
"epoch": 1.1448355452971726,
"grad_norm": 0.8359375,
"learning_rate": 0.0004880669047466671,
"loss": 5.8823,
"mean_token_accuracy": 0.18505503088235856,
"num_tokens": 25162022.0,
"step": 9920
},
{
"entropy": 6.280695390701294,
"epoch": 1.1454125793421812,
"grad_norm": 0.87890625,
"learning_rate": 0.00048805364129295554,
"loss": 6.0116,
"mean_token_accuracy": 0.17475848346948625,
"num_tokens": 25175404.0,
"step": 9925
},
{
"entropy": 6.253636407852173,
"epoch": 1.1459896133871899,
"grad_norm": 0.79296875,
"learning_rate": 0.00048804037067329037,
"loss": 5.8558,
"mean_token_accuracy": 0.18484980762004852,
"num_tokens": 25188148.0,
"step": 9930
},
{
"entropy": 6.230699157714843,
"epoch": 1.1465666474321985,
"grad_norm": 0.83984375,
"learning_rate": 0.0004880270928881183,
"loss": 5.9347,
"mean_token_accuracy": 0.18091728538274765,
"num_tokens": 25199960.0,
"step": 9935
},
{
"entropy": 6.191056203842163,
"epoch": 1.1471436814772071,
"grad_norm": 0.9609375,
"learning_rate": 0.0004880138079378857,
"loss": 5.8846,
"mean_token_accuracy": 0.17917097955942154,
"num_tokens": 25211054.0,
"step": 9940
},
{
"entropy": 6.249275350570679,
"epoch": 1.1477207155222158,
"grad_norm": 0.87890625,
"learning_rate": 0.0004880005158230395,
"loss": 5.8641,
"mean_token_accuracy": 0.1871132269501686,
"num_tokens": 25222553.0,
"step": 9945
},
{
"entropy": 6.205245733261108,
"epoch": 1.1482977495672244,
"grad_norm": 0.87109375,
"learning_rate": 0.0004879872165440268,
"loss": 5.9152,
"mean_token_accuracy": 0.1780821532011032,
"num_tokens": 25235472.0,
"step": 9950
},
{
"entropy": 6.222427892684936,
"epoch": 1.148874783612233,
"grad_norm": 0.76171875,
"learning_rate": 0.0004879739101012948,
"loss": 5.9795,
"mean_token_accuracy": 0.17801414877176286,
"num_tokens": 25250209.0,
"step": 9955
},
{
"entropy": 6.301009178161621,
"epoch": 1.1494518176572417,
"grad_norm": 0.90625,
"learning_rate": 0.0004879605964952911,
"loss": 6.0067,
"mean_token_accuracy": 0.17522571235895157,
"num_tokens": 25262064.0,
"step": 9960
},
{
"entropy": 6.322479486465454,
"epoch": 1.1500288517022503,
"grad_norm": 0.8515625,
"learning_rate": 0.00048794727572646366,
"loss": 5.9427,
"mean_token_accuracy": 0.17829561233520508,
"num_tokens": 25274833.0,
"step": 9965
},
{
"entropy": 6.252580785751343,
"epoch": 1.1506058857472592,
"grad_norm": 0.8984375,
"learning_rate": 0.0004879339477952603,
"loss": 5.9259,
"mean_token_accuracy": 0.1844586282968521,
"num_tokens": 25288397.0,
"step": 9970
},
{
"entropy": 6.206064081192016,
"epoch": 1.1511829197922678,
"grad_norm": 0.93359375,
"learning_rate": 0.00048792061270212935,
"loss": 5.8926,
"mean_token_accuracy": 0.1864775836467743,
"num_tokens": 25300887.0,
"step": 9975
},
{
"entropy": 6.300720739364624,
"epoch": 1.1517599538372765,
"grad_norm": 0.796875,
"learning_rate": 0.0004879072704475193,
"loss": 5.9774,
"mean_token_accuracy": 0.1777906149625778,
"num_tokens": 25314686.0,
"step": 9980
},
{
"entropy": 6.324214887619019,
"epoch": 1.1523369878822851,
"grad_norm": 0.88671875,
"learning_rate": 0.00048789392103187906,
"loss": 6.0028,
"mean_token_accuracy": 0.17738907784223557,
"num_tokens": 25328253.0,
"step": 9985
},
{
"entropy": 6.282991886138916,
"epoch": 1.1529140219272938,
"grad_norm": 0.859375,
"learning_rate": 0.0004878805644556575,
"loss": 5.9538,
"mean_token_accuracy": 0.18188581615686417,
"num_tokens": 25340583.0,
"step": 9990
},
{
"entropy": 6.180060386657715,
"epoch": 1.1534910559723024,
"grad_norm": 0.91015625,
"learning_rate": 0.000487867200719304,
"loss": 5.8756,
"mean_token_accuracy": 0.18232353776693344,
"num_tokens": 25352513.0,
"step": 9995
},
{
"entropy": 6.269026517868042,
"epoch": 1.154068090017311,
"grad_norm": 0.85546875,
"learning_rate": 0.0004878538298232678,
"loss": 5.9893,
"mean_token_accuracy": 0.1770420104265213,
"num_tokens": 25365044.0,
"step": 10000
},
{
"entropy": 6.310076713562012,
"epoch": 1.1546451240623197,
"grad_norm": 0.8671875,
"learning_rate": 0.0004878404517679988,
"loss": 5.9366,
"mean_token_accuracy": 0.17858017683029176,
"num_tokens": 25377381.0,
"step": 10005
},
{
"entropy": 6.238185453414917,
"epoch": 1.1552221581073283,
"grad_norm": 0.87109375,
"learning_rate": 0.00048782706655394695,
"loss": 5.938,
"mean_token_accuracy": 0.1837088868021965,
"num_tokens": 25390723.0,
"step": 10010
},
{
"entropy": 6.173210191726684,
"epoch": 1.155799192152337,
"grad_norm": 0.859375,
"learning_rate": 0.0004878136741815624,
"loss": 5.8564,
"mean_token_accuracy": 0.1824432611465454,
"num_tokens": 25403501.0,
"step": 10015
},
{
"entropy": 6.213417387008667,
"epoch": 1.1563762261973456,
"grad_norm": 0.9140625,
"learning_rate": 0.0004878002746512956,
"loss": 5.8816,
"mean_token_accuracy": 0.18476981669664383,
"num_tokens": 25415565.0,
"step": 10020
},
{
"entropy": 6.226587963104248,
"epoch": 1.1569532602423542,
"grad_norm": 0.88671875,
"learning_rate": 0.0004877868679635974,
"loss": 5.9289,
"mean_token_accuracy": 0.18405697494745255,
"num_tokens": 25428261.0,
"step": 10025
},
{
"entropy": 6.28510012626648,
"epoch": 1.1575302942873629,
"grad_norm": 0.95703125,
"learning_rate": 0.0004877734541189185,
"loss": 5.9355,
"mean_token_accuracy": 0.17490267604589463,
"num_tokens": 25439758.0,
"step": 10030
},
{
"entropy": 6.253132295608521,
"epoch": 1.1581073283323717,
"grad_norm": 0.8359375,
"learning_rate": 0.00048776003311771013,
"loss": 5.9766,
"mean_token_accuracy": 0.1719038173556328,
"num_tokens": 25452162.0,
"step": 10035
},
{
"entropy": 6.34536337852478,
"epoch": 1.1586843623773802,
"grad_norm": 0.8828125,
"learning_rate": 0.0004877466049604238,
"loss": 6.0224,
"mean_token_accuracy": 0.17633402347564697,
"num_tokens": 25463741.0,
"step": 10040
},
{
"entropy": 6.273688936233521,
"epoch": 1.159261396422389,
"grad_norm": 0.8125,
"learning_rate": 0.00048773316964751106,
"loss": 5.9607,
"mean_token_accuracy": 0.17500015050172807,
"num_tokens": 25476466.0,
"step": 10045
},
{
"entropy": 6.3328968524932865,
"epoch": 1.1598384304673977,
"grad_norm": 0.78125,
"learning_rate": 0.0004877197271794239,
"loss": 5.948,
"mean_token_accuracy": 0.1761259838938713,
"num_tokens": 25488453.0,
"step": 10050
},
{
"entropy": 6.298605442047119,
"epoch": 1.1604154645124063,
"grad_norm": 0.8359375,
"learning_rate": 0.0004877062775566142,
"loss": 5.9443,
"mean_token_accuracy": 0.17435207664966584,
"num_tokens": 25501803.0,
"step": 10055
},
{
"entropy": 6.273298692703247,
"epoch": 1.160992498557415,
"grad_norm": 0.78125,
"learning_rate": 0.00048769282077953464,
"loss": 6.0359,
"mean_token_accuracy": 0.17547617107629776,
"num_tokens": 25515844.0,
"step": 10060
},
{
"entropy": 6.312673854827881,
"epoch": 1.1615695326024236,
"grad_norm": 0.87890625,
"learning_rate": 0.00048767935684863775,
"loss": 5.9276,
"mean_token_accuracy": 0.18142150789499284,
"num_tokens": 25528529.0,
"step": 10065
},
{
"entropy": 6.302729988098145,
"epoch": 1.1621465666474322,
"grad_norm": 0.86328125,
"learning_rate": 0.0004876658857643762,
"loss": 5.9732,
"mean_token_accuracy": 0.17344674915075303,
"num_tokens": 25540110.0,
"step": 10070
},
{
"entropy": 6.254207420349121,
"epoch": 1.1627236006924409,
"grad_norm": 0.86328125,
"learning_rate": 0.0004876524075272034,
"loss": 5.9334,
"mean_token_accuracy": 0.17588380724191666,
"num_tokens": 25553332.0,
"step": 10075
},
{
"entropy": 6.286834716796875,
"epoch": 1.1633006347374495,
"grad_norm": 0.87890625,
"learning_rate": 0.00048763892213757234,
"loss": 5.9005,
"mean_token_accuracy": 0.17941419333219527,
"num_tokens": 25565852.0,
"step": 10080
},
{
"entropy": 6.242973041534424,
"epoch": 1.1638776687824581,
"grad_norm": 0.8046875,
"learning_rate": 0.00048762542959593683,
"loss": 5.9185,
"mean_token_accuracy": 0.18208333104848862,
"num_tokens": 25579642.0,
"step": 10085
},
{
"entropy": 6.223715496063233,
"epoch": 1.1644547028274668,
"grad_norm": 0.8984375,
"learning_rate": 0.0004876119299027506,
"loss": 5.9185,
"mean_token_accuracy": 0.18511994779109955,
"num_tokens": 25591452.0,
"step": 10090
},
{
"entropy": 6.221129322052002,
"epoch": 1.1650317368724754,
"grad_norm": 0.8359375,
"learning_rate": 0.00048759842305846766,
"loss": 5.8732,
"mean_token_accuracy": 0.17986828535795213,
"num_tokens": 25603426.0,
"step": 10095
},
{
"entropy": 6.264230966567993,
"epoch": 1.165608770917484,
"grad_norm": 0.875,
"learning_rate": 0.0004875849090635425,
"loss": 5.9774,
"mean_token_accuracy": 0.17824428528547287,
"num_tokens": 25617014.0,
"step": 10100
},
{
"entropy": 6.293786478042603,
"epoch": 1.1661858049624927,
"grad_norm": 0.921875,
"learning_rate": 0.00048757138791842943,
"loss": 5.9394,
"mean_token_accuracy": 0.18343609422445298,
"num_tokens": 25629916.0,
"step": 10105
},
{
"entropy": 6.2851982593536375,
"epoch": 1.1667628390075016,
"grad_norm": 0.84765625,
"learning_rate": 0.0004875578596235832,
"loss": 5.9229,
"mean_token_accuracy": 0.18201591074466705,
"num_tokens": 25642301.0,
"step": 10110
},
{
"entropy": 6.254937362670899,
"epoch": 1.1673398730525102,
"grad_norm": 0.83203125,
"learning_rate": 0.0004875443241794591,
"loss": 5.9005,
"mean_token_accuracy": 0.18076282739639282,
"num_tokens": 25653976.0,
"step": 10115
},
{
"entropy": 6.266515922546387,
"epoch": 1.1679169070975188,
"grad_norm": 0.83984375,
"learning_rate": 0.00048753078158651227,
"loss": 5.9433,
"mean_token_accuracy": 0.17355138510465623,
"num_tokens": 25666078.0,
"step": 10120
},
{
"entropy": 6.299070167541504,
"epoch": 1.1684939411425275,
"grad_norm": 0.90625,
"learning_rate": 0.000487517231845198,
"loss": 5.9608,
"mean_token_accuracy": 0.17447977215051652,
"num_tokens": 25679780.0,
"step": 10125
},
{
"entropy": 6.330364561080932,
"epoch": 1.169070975187536,
"grad_norm": 0.8125,
"learning_rate": 0.0004875036749559724,
"loss": 5.921,
"mean_token_accuracy": 0.1767667144536972,
"num_tokens": 25694179.0,
"step": 10130
},
{
"entropy": 6.173453760147095,
"epoch": 1.1696480092325447,
"grad_norm": 0.96484375,
"learning_rate": 0.00048749011091929115,
"loss": 5.9132,
"mean_token_accuracy": 0.18746515810489656,
"num_tokens": 25707281.0,
"step": 10135
},
{
"entropy": 6.262874364852905,
"epoch": 1.1702250432775534,
"grad_norm": 0.81640625,
"learning_rate": 0.0004874765397356105,
"loss": 5.9428,
"mean_token_accuracy": 0.18233703523874284,
"num_tokens": 25719901.0,
"step": 10140
},
{
"entropy": 6.302816724777221,
"epoch": 1.170802077322562,
"grad_norm": 0.90234375,
"learning_rate": 0.0004874629614053871,
"loss": 5.9542,
"mean_token_accuracy": 0.18035022020339966,
"num_tokens": 25732063.0,
"step": 10145
},
{
"entropy": 6.217515897750855,
"epoch": 1.1713791113675707,
"grad_norm": 0.90234375,
"learning_rate": 0.0004874493759290775,
"loss": 5.9195,
"mean_token_accuracy": 0.17959170192480087,
"num_tokens": 25743966.0,
"step": 10150
},
{
"entropy": 6.033494472503662,
"epoch": 1.1719561454125793,
"grad_norm": 1.1796875,
"learning_rate": 0.00048743578330713854,
"loss": 5.6624,
"mean_token_accuracy": 0.20419865399599074,
"num_tokens": 25757053.0,
"step": 10155
},
{
"entropy": 6.10223126411438,
"epoch": 1.172533179457588,
"grad_norm": 0.90234375,
"learning_rate": 0.0004874221835400277,
"loss": 5.7981,
"mean_token_accuracy": 0.1875803977251053,
"num_tokens": 25769430.0,
"step": 10160
},
{
"entropy": 6.264477682113648,
"epoch": 1.1731102135025966,
"grad_norm": 0.90234375,
"learning_rate": 0.0004874085766282022,
"loss": 5.894,
"mean_token_accuracy": 0.18658676594495774,
"num_tokens": 25781687.0,
"step": 10165
},
{
"entropy": 6.178972053527832,
"epoch": 1.1736872475476052,
"grad_norm": 0.890625,
"learning_rate": 0.00048739496257211966,
"loss": 5.9109,
"mean_token_accuracy": 0.1858760565519333,
"num_tokens": 25793646.0,
"step": 10170
},
{
"entropy": 6.226661348342896,
"epoch": 1.1742642815926139,
"grad_norm": 0.8671875,
"learning_rate": 0.00048738134137223815,
"loss": 5.9739,
"mean_token_accuracy": 0.1752454936504364,
"num_tokens": 25807757.0,
"step": 10175
},
{
"entropy": 6.282738161087036,
"epoch": 1.1748413156376225,
"grad_norm": 0.99609375,
"learning_rate": 0.00048736771302901566,
"loss": 5.9495,
"mean_token_accuracy": 0.17936586141586303,
"num_tokens": 25820063.0,
"step": 10180
},
{
"entropy": 6.234112787246704,
"epoch": 1.1754183496826314,
"grad_norm": 0.84375,
"learning_rate": 0.00048735407754291063,
"loss": 5.8828,
"mean_token_accuracy": 0.18974555730819703,
"num_tokens": 25832974.0,
"step": 10185
},
{
"entropy": 6.292014217376709,
"epoch": 1.17599538372764,
"grad_norm": 0.87890625,
"learning_rate": 0.00048734043491438175,
"loss": 5.9219,
"mean_token_accuracy": 0.17494470328092576,
"num_tokens": 25845939.0,
"step": 10190
},
{
"entropy": 6.2192240238189695,
"epoch": 1.1765724177726486,
"grad_norm": 0.87890625,
"learning_rate": 0.00048732678514388773,
"loss": 5.8873,
"mean_token_accuracy": 0.17836469560861587,
"num_tokens": 25857480.0,
"step": 10195
},
{
"entropy": 6.162649917602539,
"epoch": 1.1771494518176573,
"grad_norm": 0.8828125,
"learning_rate": 0.0004873131282318878,
"loss": 5.8513,
"mean_token_accuracy": 0.18638965040445327,
"num_tokens": 25869384.0,
"step": 10200
},
{
"entropy": 6.183882331848144,
"epoch": 1.177726485862666,
"grad_norm": 0.89453125,
"learning_rate": 0.00048729946417884126,
"loss": 5.9408,
"mean_token_accuracy": 0.17680127024650574,
"num_tokens": 25881705.0,
"step": 10205
},
{
"entropy": 6.290098524093628,
"epoch": 1.1783035199076746,
"grad_norm": 0.8671875,
"learning_rate": 0.0004872857929852076,
"loss": 5.9349,
"mean_token_accuracy": 0.1714819997549057,
"num_tokens": 25894072.0,
"step": 10210
},
{
"entropy": 6.232169818878174,
"epoch": 1.1788805539526832,
"grad_norm": 0.875,
"learning_rate": 0.0004872721146514469,
"loss": 5.803,
"mean_token_accuracy": 0.1882660523056984,
"num_tokens": 25907358.0,
"step": 10215
},
{
"entropy": 6.194604921340942,
"epoch": 1.1794575879976918,
"grad_norm": 0.8828125,
"learning_rate": 0.000487258429178019,
"loss": 5.9219,
"mean_token_accuracy": 0.18903794139623642,
"num_tokens": 25918746.0,
"step": 10220
},
{
"entropy": 6.2296899318695065,
"epoch": 1.1800346220427005,
"grad_norm": 0.93359375,
"learning_rate": 0.00048724473656538427,
"loss": 5.913,
"mean_token_accuracy": 0.18672333359718324,
"num_tokens": 25930759.0,
"step": 10225
},
{
"entropy": 6.188735485076904,
"epoch": 1.1806116560877091,
"grad_norm": 0.8125,
"learning_rate": 0.0004872310368140032,
"loss": 5.8568,
"mean_token_accuracy": 0.18429872691631316,
"num_tokens": 25942364.0,
"step": 10230
},
{
"entropy": 6.206774473190308,
"epoch": 1.1811886901327178,
"grad_norm": 0.89453125,
"learning_rate": 0.0004872173299243368,
"loss": 5.8708,
"mean_token_accuracy": 0.19336009174585342,
"num_tokens": 25954254.0,
"step": 10235
},
{
"entropy": 6.222011852264404,
"epoch": 1.1817657241777264,
"grad_norm": 1.3125,
"learning_rate": 0.00048720361589684575,
"loss": 5.9605,
"mean_token_accuracy": 0.18331651240587235,
"num_tokens": 25966708.0,
"step": 10240
},
{
"entropy": 6.236669921875,
"epoch": 1.182342758222735,
"grad_norm": 0.85546875,
"learning_rate": 0.00048718989473199147,
"loss": 5.9233,
"mean_token_accuracy": 0.17969653010368347,
"num_tokens": 25979301.0,
"step": 10245
},
{
"entropy": 6.237456798553467,
"epoch": 1.182919792267744,
"grad_norm": 0.890625,
"learning_rate": 0.0004871761664302356,
"loss": 5.9068,
"mean_token_accuracy": 0.18412716388702394,
"num_tokens": 25992195.0,
"step": 10250
},
{
"entropy": 6.177877140045166,
"epoch": 1.1834968263127525,
"grad_norm": 0.84375,
"learning_rate": 0.0004871624309920397,
"loss": 5.7765,
"mean_token_accuracy": 0.19591953456401826,
"num_tokens": 26005078.0,
"step": 10255
},
{
"entropy": 6.2200273990631105,
"epoch": 1.1840738603577612,
"grad_norm": 0.94921875,
"learning_rate": 0.00048714868841786586,
"loss": 5.9096,
"mean_token_accuracy": 0.179879729449749,
"num_tokens": 26017227.0,
"step": 10260
},
{
"entropy": 6.244432067871093,
"epoch": 1.1846508944027698,
"grad_norm": 0.8984375,
"learning_rate": 0.00048713493870817626,
"loss": 5.9489,
"mean_token_accuracy": 0.18269521296024321,
"num_tokens": 26030782.0,
"step": 10265
},
{
"entropy": 6.180662345886231,
"epoch": 1.1852279284477785,
"grad_norm": 0.86328125,
"learning_rate": 0.00048712118186343336,
"loss": 5.8563,
"mean_token_accuracy": 0.18943388164043426,
"num_tokens": 26042327.0,
"step": 10270
},
{
"entropy": 6.27462363243103,
"epoch": 1.185804962492787,
"grad_norm": 0.859375,
"learning_rate": 0.00048710741788409985,
"loss": 5.9541,
"mean_token_accuracy": 0.17806721180677415,
"num_tokens": 26055298.0,
"step": 10275
},
{
"entropy": 6.273777961730957,
"epoch": 1.1863819965377957,
"grad_norm": 0.84765625,
"learning_rate": 0.0004870936467706387,
"loss": 5.9837,
"mean_token_accuracy": 0.17382072806358337,
"num_tokens": 26067389.0,
"step": 10280
},
{
"entropy": 6.225218200683594,
"epoch": 1.1869590305828044,
"grad_norm": 0.82421875,
"learning_rate": 0.0004870798685235131,
"loss": 5.8962,
"mean_token_accuracy": 0.18277426362037658,
"num_tokens": 26080527.0,
"step": 10285
},
{
"entropy": 6.250852823257446,
"epoch": 1.187536064627813,
"grad_norm": 0.87890625,
"learning_rate": 0.00048706608314318654,
"loss": 5.9648,
"mean_token_accuracy": 0.17581128627061843,
"num_tokens": 26093684.0,
"step": 10290
},
{
"entropy": 6.270060634613037,
"epoch": 1.1881130986728217,
"grad_norm": 0.875,
"learning_rate": 0.0004870522906301225,
"loss": 5.9021,
"mean_token_accuracy": 0.1825753018260002,
"num_tokens": 26105235.0,
"step": 10295
},
{
"entropy": 6.226347017288208,
"epoch": 1.1886901327178303,
"grad_norm": 0.87890625,
"learning_rate": 0.000487038490984785,
"loss": 5.8919,
"mean_token_accuracy": 0.18395963162183762,
"num_tokens": 26117542.0,
"step": 10300
},
{
"entropy": 6.262145042419434,
"epoch": 1.189267166762839,
"grad_norm": 0.8984375,
"learning_rate": 0.00048702468420763826,
"loss": 6.0085,
"mean_token_accuracy": 0.17625221163034438,
"num_tokens": 26130722.0,
"step": 10305
},
{
"entropy": 6.264938068389893,
"epoch": 1.1898442008078476,
"grad_norm": 0.81640625,
"learning_rate": 0.00048701087029914657,
"loss": 5.8314,
"mean_token_accuracy": 0.18314649015665055,
"num_tokens": 26143420.0,
"step": 10310
},
{
"entropy": 6.301358938217163,
"epoch": 1.1904212348528562,
"grad_norm": 0.921875,
"learning_rate": 0.0004869970492597745,
"loss": 6.0332,
"mean_token_accuracy": 0.16742831021547316,
"num_tokens": 26156041.0,
"step": 10315
},
{
"entropy": 6.172136878967285,
"epoch": 1.1909982688978649,
"grad_norm": 0.9140625,
"learning_rate": 0.0004869832210899871,
"loss": 5.845,
"mean_token_accuracy": 0.18829168230295182,
"num_tokens": 26168075.0,
"step": 10320
},
{
"entropy": 6.214507341384888,
"epoch": 1.1915753029428737,
"grad_norm": 0.796875,
"learning_rate": 0.00048696938579024927,
"loss": 5.8632,
"mean_token_accuracy": 0.18680178970098496,
"num_tokens": 26180285.0,
"step": 10325
},
{
"entropy": 6.155381202697754,
"epoch": 1.1921523369878824,
"grad_norm": 0.76953125,
"learning_rate": 0.00048695554336102644,
"loss": 5.8601,
"mean_token_accuracy": 0.18196229487657548,
"num_tokens": 26193095.0,
"step": 10330
},
{
"entropy": 6.198613977432251,
"epoch": 1.192729371032891,
"grad_norm": 0.89453125,
"learning_rate": 0.00048694169380278417,
"loss": 5.9061,
"mean_token_accuracy": 0.19160285741090774,
"num_tokens": 26205477.0,
"step": 10335
},
{
"entropy": 6.220333862304687,
"epoch": 1.1933064050778996,
"grad_norm": 0.7890625,
"learning_rate": 0.0004869278371159884,
"loss": 5.8512,
"mean_token_accuracy": 0.18946202248334884,
"num_tokens": 26220057.0,
"step": 10340
},
{
"entropy": 6.298282432556152,
"epoch": 1.1938834391229083,
"grad_norm": 0.8671875,
"learning_rate": 0.00048691397330110503,
"loss": 5.9385,
"mean_token_accuracy": 0.17706281840801238,
"num_tokens": 26232327.0,
"step": 10345
},
{
"entropy": 6.19044942855835,
"epoch": 1.194460473167917,
"grad_norm": 0.859375,
"learning_rate": 0.0004869001023586005,
"loss": 5.8664,
"mean_token_accuracy": 0.1862966775894165,
"num_tokens": 26245087.0,
"step": 10350
},
{
"entropy": 6.27628083229065,
"epoch": 1.1950375072129256,
"grad_norm": 0.90234375,
"learning_rate": 0.0004868862242889413,
"loss": 5.9464,
"mean_token_accuracy": 0.1738221064209938,
"num_tokens": 26258041.0,
"step": 10355
},
{
"entropy": 6.253827428817749,
"epoch": 1.1956145412579342,
"grad_norm": 0.859375,
"learning_rate": 0.000486872339092594,
"loss": 5.9329,
"mean_token_accuracy": 0.1788163736462593,
"num_tokens": 26270443.0,
"step": 10360
},
{
"entropy": 6.221220397949219,
"epoch": 1.1961915753029428,
"grad_norm": 0.88671875,
"learning_rate": 0.000486858446770026,
"loss": 5.8764,
"mean_token_accuracy": 0.1764179676771164,
"num_tokens": 26282685.0,
"step": 10365
},
{
"entropy": 6.259880018234253,
"epoch": 1.1967686093479515,
"grad_norm": 0.80859375,
"learning_rate": 0.0004868445473217043,
"loss": 5.9615,
"mean_token_accuracy": 0.17861454635858537,
"num_tokens": 26296003.0,
"step": 10370
},
{
"entropy": 6.142031145095825,
"epoch": 1.1973456433929601,
"grad_norm": 0.8515625,
"learning_rate": 0.0004868306407480965,
"loss": 5.802,
"mean_token_accuracy": 0.18455828428268434,
"num_tokens": 26309102.0,
"step": 10375
},
{
"entropy": 6.2524937152862545,
"epoch": 1.1979226774379688,
"grad_norm": 0.87109375,
"learning_rate": 0.00048681672704967036,
"loss": 5.9077,
"mean_token_accuracy": 0.1821337327361107,
"num_tokens": 26321571.0,
"step": 10380
},
{
"entropy": 6.342026090621948,
"epoch": 1.1984997114829774,
"grad_norm": 0.8359375,
"learning_rate": 0.0004868028062268938,
"loss": 5.9821,
"mean_token_accuracy": 0.17679037153720856,
"num_tokens": 26334761.0,
"step": 10385
},
{
"entropy": 6.182615852355957,
"epoch": 1.1990767455279863,
"grad_norm": 0.8671875,
"learning_rate": 0.00048678887828023504,
"loss": 5.794,
"mean_token_accuracy": 0.18676298409700393,
"num_tokens": 26348815.0,
"step": 10390
},
{
"entropy": 6.205089139938354,
"epoch": 1.1996537795729947,
"grad_norm": 0.8359375,
"learning_rate": 0.0004867749432101626,
"loss": 5.915,
"mean_token_accuracy": 0.17840406000614167,
"num_tokens": 26361675.0,
"step": 10395
},
{
"entropy": 6.274042654037475,
"epoch": 1.2002308136180035,
"grad_norm": 0.83984375,
"learning_rate": 0.0004867610010171451,
"loss": 6.0051,
"mean_token_accuracy": 0.17303507626056672,
"num_tokens": 26375010.0,
"step": 10400
},
{
"entropy": 6.292940378189087,
"epoch": 1.2008078476630122,
"grad_norm": 0.9375,
"learning_rate": 0.00048674705170165147,
"loss": 5.9732,
"mean_token_accuracy": 0.17850806564092636,
"num_tokens": 26388217.0,
"step": 10405
},
{
"entropy": 6.195116758346558,
"epoch": 1.2013848817080208,
"grad_norm": 0.953125,
"learning_rate": 0.000486733095264151,
"loss": 5.9038,
"mean_token_accuracy": 0.1861647993326187,
"num_tokens": 26402088.0,
"step": 10410
},
{
"entropy": 6.1927567481994625,
"epoch": 1.2019619157530295,
"grad_norm": 0.87109375,
"learning_rate": 0.00048671913170511306,
"loss": 5.8926,
"mean_token_accuracy": 0.1835414081811905,
"num_tokens": 26414816.0,
"step": 10415
},
{
"entropy": 6.251120758056641,
"epoch": 1.202538949798038,
"grad_norm": 0.83984375,
"learning_rate": 0.0004867051610250073,
"loss": 5.8567,
"mean_token_accuracy": 0.18279548734426498,
"num_tokens": 26426345.0,
"step": 10420
},
{
"entropy": 6.1436532497406,
"epoch": 1.2031159838430467,
"grad_norm": 0.91015625,
"learning_rate": 0.0004866911832243035,
"loss": 5.6708,
"mean_token_accuracy": 0.19303337335586548,
"num_tokens": 26437982.0,
"step": 10425
},
{
"entropy": 6.1232579231262205,
"epoch": 1.2036930178880554,
"grad_norm": 0.93359375,
"learning_rate": 0.00048667719830347203,
"loss": 5.9154,
"mean_token_accuracy": 0.17632388174533845,
"num_tokens": 26449855.0,
"step": 10430
},
{
"entropy": 6.299041652679444,
"epoch": 1.204270051933064,
"grad_norm": 0.89453125,
"learning_rate": 0.00048666320626298307,
"loss": 5.92,
"mean_token_accuracy": 0.18459949046373367,
"num_tokens": 26462927.0,
"step": 10435
},
{
"entropy": 6.25364203453064,
"epoch": 1.2048470859780727,
"grad_norm": 0.90625,
"learning_rate": 0.00048664920710330735,
"loss": 5.9653,
"mean_token_accuracy": 0.1775884971022606,
"num_tokens": 26475022.0,
"step": 10440
},
{
"entropy": 6.214952230453491,
"epoch": 1.2054241200230813,
"grad_norm": 0.8828125,
"learning_rate": 0.00048663520082491564,
"loss": 5.8916,
"mean_token_accuracy": 0.18937628716230392,
"num_tokens": 26486959.0,
"step": 10445
},
{
"entropy": 6.240479230880737,
"epoch": 1.20600115406809,
"grad_norm": 0.8828125,
"learning_rate": 0.0004866211874282791,
"loss": 5.9576,
"mean_token_accuracy": 0.1838987112045288,
"num_tokens": 26500345.0,
"step": 10450
},
{
"entropy": 6.267888355255127,
"epoch": 1.2065781881130986,
"grad_norm": 0.921875,
"learning_rate": 0.000486607166913869,
"loss": 5.9311,
"mean_token_accuracy": 0.18621276021003724,
"num_tokens": 26511625.0,
"step": 10455
},
{
"entropy": 6.242213773727417,
"epoch": 1.2071552221581072,
"grad_norm": 0.94140625,
"learning_rate": 0.00048659313928215705,
"loss": 5.9358,
"mean_token_accuracy": 0.1800112694501877,
"num_tokens": 26523764.0,
"step": 10460
},
{
"entropy": 6.233942937850952,
"epoch": 1.207732256203116,
"grad_norm": 0.9296875,
"learning_rate": 0.0004865791045336149,
"loss": 5.9028,
"mean_token_accuracy": 0.1811545193195343,
"num_tokens": 26536925.0,
"step": 10465
},
{
"entropy": 6.169159698486328,
"epoch": 1.2083092902481247,
"grad_norm": 0.86328125,
"learning_rate": 0.0004865650626687146,
"loss": 5.7468,
"mean_token_accuracy": 0.19598589539527894,
"num_tokens": 26549201.0,
"step": 10470
},
{
"entropy": 6.203572702407837,
"epoch": 1.2088863242931334,
"grad_norm": 0.8515625,
"learning_rate": 0.00048655101368792866,
"loss": 5.9031,
"mean_token_accuracy": 0.18499507009983063,
"num_tokens": 26561495.0,
"step": 10475
},
{
"entropy": 6.237302017211914,
"epoch": 1.209463358338142,
"grad_norm": 0.83203125,
"learning_rate": 0.0004865369575917293,
"loss": 5.9454,
"mean_token_accuracy": 0.17504747658967973,
"num_tokens": 26573820.0,
"step": 10480
},
{
"entropy": 6.256232976913452,
"epoch": 1.2100403923831506,
"grad_norm": 0.875,
"learning_rate": 0.00048652289438058953,
"loss": 5.9242,
"mean_token_accuracy": 0.18367512822151183,
"num_tokens": 26587468.0,
"step": 10485
},
{
"entropy": 6.191364383697509,
"epoch": 1.2106174264281593,
"grad_norm": 0.86328125,
"learning_rate": 0.00048650882405498226,
"loss": 5.9536,
"mean_token_accuracy": 0.17529995739459991,
"num_tokens": 26599884.0,
"step": 10490
},
{
"entropy": 6.18445987701416,
"epoch": 1.211194460473168,
"grad_norm": 0.875,
"learning_rate": 0.0004864947466153808,
"loss": 5.8633,
"mean_token_accuracy": 0.1881292626261711,
"num_tokens": 26612501.0,
"step": 10495
},
{
"entropy": 6.330709075927734,
"epoch": 1.2117714945181766,
"grad_norm": 0.9375,
"learning_rate": 0.0004864806620622585,
"loss": 5.8942,
"mean_token_accuracy": 0.18237232863903047,
"num_tokens": 26624559.0,
"step": 10500
},
{
"entropy": 6.27984037399292,
"epoch": 1.2123485285631852,
"grad_norm": 0.89453125,
"learning_rate": 0.0004864665703960892,
"loss": 5.9248,
"mean_token_accuracy": 0.1735801711678505,
"num_tokens": 26636903.0,
"step": 10505
},
{
"entropy": 6.253863048553467,
"epoch": 1.2129255626081938,
"grad_norm": 0.9296875,
"learning_rate": 0.0004864524716173469,
"loss": 5.8581,
"mean_token_accuracy": 0.18250663876533507,
"num_tokens": 26649393.0,
"step": 10510
},
{
"entropy": 6.182285356521606,
"epoch": 1.2135025966532025,
"grad_norm": 0.92578125,
"learning_rate": 0.0004864383657265058,
"loss": 5.8711,
"mean_token_accuracy": 0.18657347857952117,
"num_tokens": 26661134.0,
"step": 10515
},
{
"entropy": 6.233286142349243,
"epoch": 1.2140796306982111,
"grad_norm": 0.8671875,
"learning_rate": 0.00048642425272404016,
"loss": 5.948,
"mean_token_accuracy": 0.17871742993593215,
"num_tokens": 26674451.0,
"step": 10520
},
{
"entropy": 6.293264722824096,
"epoch": 1.2146566647432198,
"grad_norm": 0.890625,
"learning_rate": 0.0004864101326104248,
"loss": 5.8934,
"mean_token_accuracy": 0.18119763284921647,
"num_tokens": 26686382.0,
"step": 10525
},
{
"entropy": 6.174519824981689,
"epoch": 1.2152336987882286,
"grad_norm": 0.890625,
"learning_rate": 0.0004863960053861348,
"loss": 5.8629,
"mean_token_accuracy": 0.18694709986448288,
"num_tokens": 26698491.0,
"step": 10530
},
{
"entropy": 6.153842973709106,
"epoch": 1.215810732833237,
"grad_norm": 0.8515625,
"learning_rate": 0.00048638187105164507,
"loss": 5.8853,
"mean_token_accuracy": 0.18205370157957076,
"num_tokens": 26710836.0,
"step": 10535
},
{
"entropy": 6.2186424255371096,
"epoch": 1.216387766878246,
"grad_norm": 0.87109375,
"learning_rate": 0.0004863677296074311,
"loss": 5.8716,
"mean_token_accuracy": 0.1870691657066345,
"num_tokens": 26723195.0,
"step": 10540
},
{
"entropy": 6.250338935852051,
"epoch": 1.2169648009232545,
"grad_norm": 0.94140625,
"learning_rate": 0.0004863535810539686,
"loss": 5.8641,
"mean_token_accuracy": 0.19379239678382873,
"num_tokens": 26736048.0,
"step": 10545
},
{
"entropy": 6.230413436889648,
"epoch": 1.2175418349682632,
"grad_norm": 0.86328125,
"learning_rate": 0.00048633942539173325,
"loss": 5.9696,
"mean_token_accuracy": 0.1795030802488327,
"num_tokens": 26748712.0,
"step": 10550
},
{
"entropy": 6.303004455566406,
"epoch": 1.2181188690132718,
"grad_norm": 0.8359375,
"learning_rate": 0.00048632526262120144,
"loss": 5.9658,
"mean_token_accuracy": 0.17351969033479692,
"num_tokens": 26760546.0,
"step": 10555
},
{
"entropy": 6.282928037643432,
"epoch": 1.2186959030582805,
"grad_norm": 0.82421875,
"learning_rate": 0.0004863110927428493,
"loss": 5.8626,
"mean_token_accuracy": 0.18044263273477554,
"num_tokens": 26772792.0,
"step": 10560
},
{
"entropy": 6.124064779281616,
"epoch": 1.219272937103289,
"grad_norm": 1.125,
"learning_rate": 0.0004862969157571536,
"loss": 5.7745,
"mean_token_accuracy": 0.194984470307827,
"num_tokens": 26785321.0,
"step": 10565
},
{
"entropy": 6.213613271713257,
"epoch": 1.2198499711482977,
"grad_norm": 0.875,
"learning_rate": 0.00048628273166459105,
"loss": 5.818,
"mean_token_accuracy": 0.18542979061603546,
"num_tokens": 26797481.0,
"step": 10570
},
{
"entropy": 6.285091686248779,
"epoch": 1.2204270051933064,
"grad_norm": 0.85546875,
"learning_rate": 0.00048626854046563876,
"loss": 5.9554,
"mean_token_accuracy": 0.18456581830978394,
"num_tokens": 26810644.0,
"step": 10575
},
{
"entropy": 6.297290182113647,
"epoch": 1.221004039238315,
"grad_norm": 0.8671875,
"learning_rate": 0.00048625434216077404,
"loss": 5.8977,
"mean_token_accuracy": 0.18243593573570252,
"num_tokens": 26822545.0,
"step": 10580
},
{
"entropy": 6.200481605529785,
"epoch": 1.2215810732833237,
"grad_norm": 0.90234375,
"learning_rate": 0.00048624013675047453,
"loss": 5.8957,
"mean_token_accuracy": 0.18178013414144517,
"num_tokens": 26836221.0,
"step": 10585
},
{
"entropy": 6.284975624084472,
"epoch": 1.2221581073283323,
"grad_norm": 0.85546875,
"learning_rate": 0.00048622592423521783,
"loss": 5.9676,
"mean_token_accuracy": 0.1788189336657524,
"num_tokens": 26848543.0,
"step": 10590
},
{
"entropy": 6.295896053314209,
"epoch": 1.222735141373341,
"grad_norm": 0.8984375,
"learning_rate": 0.0004862117046154822,
"loss": 5.9408,
"mean_token_accuracy": 0.18014086037874222,
"num_tokens": 26859833.0,
"step": 10595
},
{
"entropy": 6.240191459655762,
"epoch": 1.2233121754183496,
"grad_norm": 0.859375,
"learning_rate": 0.00048619747789174577,
"loss": 5.9005,
"mean_token_accuracy": 0.18657582402229309,
"num_tokens": 26873450.0,
"step": 10600
},
{
"entropy": 6.201486682891845,
"epoch": 1.2238892094633584,
"grad_norm": 0.890625,
"learning_rate": 0.0004861832440644871,
"loss": 5.8684,
"mean_token_accuracy": 0.17937362045049668,
"num_tokens": 26886545.0,
"step": 10605
},
{
"entropy": 6.2080159187316895,
"epoch": 1.224466243508367,
"grad_norm": 0.97265625,
"learning_rate": 0.00048616900313418486,
"loss": 5.8221,
"mean_token_accuracy": 0.18913633227348328,
"num_tokens": 26898394.0,
"step": 10610
},
{
"entropy": 6.235791397094727,
"epoch": 1.2250432775533757,
"grad_norm": 0.9296875,
"learning_rate": 0.00048615475510131815,
"loss": 5.8854,
"mean_token_accuracy": 0.18782524019479752,
"num_tokens": 26910172.0,
"step": 10615
},
{
"entropy": 6.1328874111175535,
"epoch": 1.2256203115983844,
"grad_norm": 0.8359375,
"learning_rate": 0.00048614049996636614,
"loss": 5.7541,
"mean_token_accuracy": 0.19627405554056168,
"num_tokens": 26922496.0,
"step": 10620
},
{
"entropy": 6.186247682571411,
"epoch": 1.226197345643393,
"grad_norm": 0.8671875,
"learning_rate": 0.00048612623772980825,
"loss": 5.8499,
"mean_token_accuracy": 0.18871124386787413,
"num_tokens": 26935264.0,
"step": 10625
},
{
"entropy": 6.2213846206665036,
"epoch": 1.2267743796884016,
"grad_norm": 0.875,
"learning_rate": 0.00048611196839212426,
"loss": 5.8391,
"mean_token_accuracy": 0.1925579398870468,
"num_tokens": 26949006.0,
"step": 10630
},
{
"entropy": 6.088655662536621,
"epoch": 1.2273514137334103,
"grad_norm": 0.9375,
"learning_rate": 0.000486097691953794,
"loss": 5.7191,
"mean_token_accuracy": 0.18999349772930146,
"num_tokens": 26961305.0,
"step": 10635
},
{
"entropy": 6.256745481491089,
"epoch": 1.227928447778419,
"grad_norm": 0.89453125,
"learning_rate": 0.00048608340841529784,
"loss": 5.9247,
"mean_token_accuracy": 0.17799484431743623,
"num_tokens": 26973445.0,
"step": 10640
},
{
"entropy": 6.2267831325531,
"epoch": 1.2285054818234276,
"grad_norm": 0.875,
"learning_rate": 0.000486069117777116,
"loss": 5.8593,
"mean_token_accuracy": 0.18302432596683502,
"num_tokens": 26986286.0,
"step": 10645
},
{
"entropy": 6.250400066375732,
"epoch": 1.2290825158684362,
"grad_norm": 0.8515625,
"learning_rate": 0.0004860548200397293,
"loss": 5.9002,
"mean_token_accuracy": 0.18009741902351378,
"num_tokens": 26999281.0,
"step": 10650
},
{
"entropy": 6.267655229568481,
"epoch": 1.2296595499134448,
"grad_norm": 0.8359375,
"learning_rate": 0.00048604051520361846,
"loss": 6.0407,
"mean_token_accuracy": 0.17532236725091935,
"num_tokens": 27011916.0,
"step": 10655
},
{
"entropy": 6.297758436203003,
"epoch": 1.2302365839584535,
"grad_norm": 0.8515625,
"learning_rate": 0.00048602620326926484,
"loss": 5.9231,
"mean_token_accuracy": 0.18180691152811052,
"num_tokens": 27024442.0,
"step": 10660
},
{
"entropy": 6.320510053634644,
"epoch": 1.2308136180034621,
"grad_norm": 0.8671875,
"learning_rate": 0.00048601188423714965,
"loss": 6.0015,
"mean_token_accuracy": 0.17772735059261321,
"num_tokens": 27037978.0,
"step": 10665
},
{
"entropy": 6.302739143371582,
"epoch": 1.231390652048471,
"grad_norm": 0.90234375,
"learning_rate": 0.0004859975581077545,
"loss": 6.0218,
"mean_token_accuracy": 0.17019021958112718,
"num_tokens": 27049447.0,
"step": 10670
},
{
"entropy": 6.216468811035156,
"epoch": 1.2319676860934794,
"grad_norm": 0.88671875,
"learning_rate": 0.0004859832248815614,
"loss": 5.8897,
"mean_token_accuracy": 0.1882360503077507,
"num_tokens": 27062961.0,
"step": 10675
},
{
"entropy": 6.275489568710327,
"epoch": 1.2325447201384883,
"grad_norm": 0.9140625,
"learning_rate": 0.0004859688845590522,
"loss": 5.9641,
"mean_token_accuracy": 0.17728179842233657,
"num_tokens": 27076297.0,
"step": 10680
},
{
"entropy": 6.293725633621216,
"epoch": 1.233121754183497,
"grad_norm": 0.92578125,
"learning_rate": 0.00048595453714070944,
"loss": 5.9957,
"mean_token_accuracy": 0.17474785596132278,
"num_tokens": 27088496.0,
"step": 10685
},
{
"entropy": 6.297595357894897,
"epoch": 1.2336987882285055,
"grad_norm": 0.8515625,
"learning_rate": 0.0004859401826270156,
"loss": 5.956,
"mean_token_accuracy": 0.1806192636489868,
"num_tokens": 27100695.0,
"step": 10690
},
{
"entropy": 6.236401987075806,
"epoch": 1.2342758222735142,
"grad_norm": 0.84765625,
"learning_rate": 0.0004859258210184536,
"loss": 5.958,
"mean_token_accuracy": 0.18606834709644318,
"num_tokens": 27113703.0,
"step": 10695
},
{
"entropy": 6.303116703033448,
"epoch": 1.2348528563185228,
"grad_norm": 0.80078125,
"learning_rate": 0.00048591145231550623,
"loss": 5.949,
"mean_token_accuracy": 0.17845748662948607,
"num_tokens": 27128669.0,
"step": 10700
},
{
"entropy": 6.2689940452575685,
"epoch": 1.2354298903635315,
"grad_norm": 0.90234375,
"learning_rate": 0.00048589707651865697,
"loss": 5.9483,
"mean_token_accuracy": 0.17878946512937546,
"num_tokens": 27141311.0,
"step": 10705
},
{
"entropy": 6.3080309391021725,
"epoch": 1.23600692440854,
"grad_norm": 0.87109375,
"learning_rate": 0.0004858826936283893,
"loss": 5.9311,
"mean_token_accuracy": 0.18167731910943985,
"num_tokens": 27152935.0,
"step": 10710
},
{
"entropy": 6.186159563064575,
"epoch": 1.2365839584535487,
"grad_norm": 0.82421875,
"learning_rate": 0.000485868303645187,
"loss": 5.7991,
"mean_token_accuracy": 0.18926886171102525,
"num_tokens": 27166775.0,
"step": 10715
},
{
"entropy": 6.144335985183716,
"epoch": 1.2371609924985574,
"grad_norm": 0.87109375,
"learning_rate": 0.00048585390656953397,
"loss": 5.8706,
"mean_token_accuracy": 0.18486643135547637,
"num_tokens": 27179406.0,
"step": 10720
},
{
"entropy": 6.277384281158447,
"epoch": 1.237738026543566,
"grad_norm": 0.8203125,
"learning_rate": 0.0004858395024019147,
"loss": 5.8926,
"mean_token_accuracy": 0.1846141442656517,
"num_tokens": 27191562.0,
"step": 10725
},
{
"entropy": 6.242267036437989,
"epoch": 1.2383150605885747,
"grad_norm": 0.96875,
"learning_rate": 0.0004858250911428133,
"loss": 5.9116,
"mean_token_accuracy": 0.17939815521240235,
"num_tokens": 27203827.0,
"step": 10730
},
{
"entropy": 6.236856460571289,
"epoch": 1.2388920946335833,
"grad_norm": 0.81640625,
"learning_rate": 0.0004858106727927148,
"loss": 5.8727,
"mean_token_accuracy": 0.18083032816648484,
"num_tokens": 27217645.0,
"step": 10735
},
{
"entropy": 6.257790279388428,
"epoch": 1.239469128678592,
"grad_norm": 0.8984375,
"learning_rate": 0.000485796247352104,
"loss": 5.9408,
"mean_token_accuracy": 0.187166827917099,
"num_tokens": 27230794.0,
"step": 10740
},
{
"entropy": 6.275010776519776,
"epoch": 1.2400461627236008,
"grad_norm": 0.83984375,
"learning_rate": 0.0004857818148214662,
"loss": 5.9672,
"mean_token_accuracy": 0.17526779770851136,
"num_tokens": 27243965.0,
"step": 10745
},
{
"entropy": 6.313845252990722,
"epoch": 1.2406231967686094,
"grad_norm": 0.8828125,
"learning_rate": 0.0004857673752012866,
"loss": 5.9307,
"mean_token_accuracy": 0.17886531203985215,
"num_tokens": 27256951.0,
"step": 10750
},
{
"entropy": 6.283997392654419,
"epoch": 1.241200230813618,
"grad_norm": 0.89453125,
"learning_rate": 0.00048575292849205114,
"loss": 5.9792,
"mean_token_accuracy": 0.1764329567551613,
"num_tokens": 27268556.0,
"step": 10755
},
{
"entropy": 6.223181200027466,
"epoch": 1.2417772648586267,
"grad_norm": 0.84765625,
"learning_rate": 0.0004857384746942456,
"loss": 5.8171,
"mean_token_accuracy": 0.18010614514350892,
"num_tokens": 27280367.0,
"step": 10760
},
{
"entropy": 6.2159076690673825,
"epoch": 1.2423542989036354,
"grad_norm": 0.9453125,
"learning_rate": 0.0004857240138083562,
"loss": 5.9008,
"mean_token_accuracy": 0.18687991052865982,
"num_tokens": 27293727.0,
"step": 10765
},
{
"entropy": 6.280245590209961,
"epoch": 1.242931332948644,
"grad_norm": 0.76953125,
"learning_rate": 0.0004857095458348692,
"loss": 5.964,
"mean_token_accuracy": 0.1840096592903137,
"num_tokens": 27306677.0,
"step": 10770
},
{
"entropy": 6.303292608261108,
"epoch": 1.2435083669936526,
"grad_norm": 0.84765625,
"learning_rate": 0.00048569507077427134,
"loss": 5.9332,
"mean_token_accuracy": 0.1819072499871254,
"num_tokens": 27319317.0,
"step": 10775
},
{
"entropy": 6.264583969116211,
"epoch": 1.2440854010386613,
"grad_norm": 0.8359375,
"learning_rate": 0.0004856805886270494,
"loss": 5.905,
"mean_token_accuracy": 0.18524052053689957,
"num_tokens": 27332021.0,
"step": 10780
},
{
"entropy": 6.156681680679322,
"epoch": 1.24466243508367,
"grad_norm": 0.92578125,
"learning_rate": 0.0004856660993936905,
"loss": 5.7563,
"mean_token_accuracy": 0.201753930747509,
"num_tokens": 27343972.0,
"step": 10785
},
{
"entropy": 6.273656749725342,
"epoch": 1.2452394691286786,
"grad_norm": 0.96484375,
"learning_rate": 0.000485651603074682,
"loss": 5.9718,
"mean_token_accuracy": 0.1731579691171646,
"num_tokens": 27356712.0,
"step": 10790
},
{
"entropy": 6.211948394775391,
"epoch": 1.2458165031736872,
"grad_norm": 0.8828125,
"learning_rate": 0.0004856370996705115,
"loss": 5.8361,
"mean_token_accuracy": 0.18876608461141586,
"num_tokens": 27369028.0,
"step": 10795
},
{
"entropy": 6.217354869842529,
"epoch": 1.2463935372186958,
"grad_norm": 0.91796875,
"learning_rate": 0.0004856225891816667,
"loss": 5.8618,
"mean_token_accuracy": 0.18710222393274306,
"num_tokens": 27380789.0,
"step": 10800
},
{
"entropy": 6.251491403579712,
"epoch": 1.2469705712637045,
"grad_norm": 0.87890625,
"learning_rate": 0.0004856080716086358,
"loss": 5.8166,
"mean_token_accuracy": 0.1833536610007286,
"num_tokens": 27394098.0,
"step": 10805
},
{
"entropy": 6.221289253234863,
"epoch": 1.2475476053087133,
"grad_norm": 0.8671875,
"learning_rate": 0.000485593546951907,
"loss": 5.9253,
"mean_token_accuracy": 0.18810599744319917,
"num_tokens": 27407270.0,
"step": 10810
},
{
"entropy": 6.242495155334472,
"epoch": 1.2481246393537218,
"grad_norm": 0.81640625,
"learning_rate": 0.0004855790152119688,
"loss": 5.8755,
"mean_token_accuracy": 0.18733642101287842,
"num_tokens": 27420397.0,
"step": 10815
},
{
"entropy": 6.273569202423095,
"epoch": 1.2487016733987306,
"grad_norm": 0.796875,
"learning_rate": 0.0004855644763893102,
"loss": 5.9575,
"mean_token_accuracy": 0.1822887822985649,
"num_tokens": 27433007.0,
"step": 10820
},
{
"entropy": 6.296523666381836,
"epoch": 1.2492787074437393,
"grad_norm": 0.8828125,
"learning_rate": 0.00048554993048441987,
"loss": 5.9286,
"mean_token_accuracy": 0.17798348218202592,
"num_tokens": 27446683.0,
"step": 10825
},
{
"entropy": 6.2345174789428714,
"epoch": 1.249855741488748,
"grad_norm": 0.85546875,
"learning_rate": 0.0004855353774977873,
"loss": 5.9498,
"mean_token_accuracy": 0.1765942618250847,
"num_tokens": 27459298.0,
"step": 10830
},
{
"entropy": 6.222336292266846,
"epoch": 1.2504327755337565,
"grad_norm": 0.8828125,
"learning_rate": 0.00048552081742990184,
"loss": 5.9103,
"mean_token_accuracy": 0.18254689276218414,
"num_tokens": 27472287.0,
"step": 10835
},
{
"entropy": 6.276287794113159,
"epoch": 1.2510098095787652,
"grad_norm": 0.875,
"learning_rate": 0.00048550625028125327,
"loss": 5.8996,
"mean_token_accuracy": 0.18219816386699678,
"num_tokens": 27484808.0,
"step": 10840
},
{
"entropy": 6.2211394786834715,
"epoch": 1.2515868436237738,
"grad_norm": 0.93359375,
"learning_rate": 0.0004854916760523315,
"loss": 5.8676,
"mean_token_accuracy": 0.18489859700202943,
"num_tokens": 27496980.0,
"step": 10845
},
{
"entropy": 6.2227785110473635,
"epoch": 1.2521638776687825,
"grad_norm": 0.96875,
"learning_rate": 0.00048547709474362684,
"loss": 5.9122,
"mean_token_accuracy": 0.17859497368335725,
"num_tokens": 27509969.0,
"step": 10850
},
{
"entropy": 6.25306191444397,
"epoch": 1.252740911713791,
"grad_norm": 0.8359375,
"learning_rate": 0.0004854625063556296,
"loss": 5.8834,
"mean_token_accuracy": 0.1868899032473564,
"num_tokens": 27523410.0,
"step": 10855
},
{
"entropy": 6.227614545822144,
"epoch": 1.2533179457587997,
"grad_norm": 0.82421875,
"learning_rate": 0.0004854479108888305,
"loss": 5.8827,
"mean_token_accuracy": 0.18421921283006668,
"num_tokens": 27535183.0,
"step": 10860
},
{
"entropy": 6.256004571914673,
"epoch": 1.2538949798038084,
"grad_norm": 0.84765625,
"learning_rate": 0.00048543330834372047,
"loss": 5.9298,
"mean_token_accuracy": 0.17713305205106736,
"num_tokens": 27548028.0,
"step": 10865
},
{
"entropy": 6.250798034667969,
"epoch": 1.254472013848817,
"grad_norm": 1.046875,
"learning_rate": 0.00048541869872079064,
"loss": 5.8519,
"mean_token_accuracy": 0.18728440403938293,
"num_tokens": 27561302.0,
"step": 10870
},
{
"entropy": 6.191199779510498,
"epoch": 1.2550490478938257,
"grad_norm": 1.0234375,
"learning_rate": 0.0004854040820205324,
"loss": 5.771,
"mean_token_accuracy": 0.1891787514090538,
"num_tokens": 27572933.0,
"step": 10875
},
{
"entropy": 6.267033433914184,
"epoch": 1.2556260819388343,
"grad_norm": 0.97265625,
"learning_rate": 0.0004853894582434373,
"loss": 5.9594,
"mean_token_accuracy": 0.18094786554574965,
"num_tokens": 27586373.0,
"step": 10880
},
{
"entropy": 6.212432479858398,
"epoch": 1.2562031159838432,
"grad_norm": 1.09375,
"learning_rate": 0.0004853748273899974,
"loss": 5.8121,
"mean_token_accuracy": 0.1917188748717308,
"num_tokens": 27599236.0,
"step": 10885
},
{
"entropy": 6.199079370498657,
"epoch": 1.2567801500288516,
"grad_norm": 0.91796875,
"learning_rate": 0.0004853601894607046,
"loss": 5.8198,
"mean_token_accuracy": 0.1882639765739441,
"num_tokens": 27611904.0,
"step": 10890
},
{
"entropy": 6.141427040100098,
"epoch": 1.2573571840738604,
"grad_norm": 0.8828125,
"learning_rate": 0.0004853455444560514,
"loss": 5.7666,
"mean_token_accuracy": 0.1835411846637726,
"num_tokens": 27625778.0,
"step": 10895
},
{
"entropy": 6.264633512496948,
"epoch": 1.257934218118869,
"grad_norm": 0.89453125,
"learning_rate": 0.0004853308923765302,
"loss": 5.9298,
"mean_token_accuracy": 0.1849829599261284,
"num_tokens": 27638359.0,
"step": 10900
},
{
"entropy": 6.22053279876709,
"epoch": 1.2585112521638777,
"grad_norm": 0.92578125,
"learning_rate": 0.000485316233222634,
"loss": 5.809,
"mean_token_accuracy": 0.19588791131973265,
"num_tokens": 27651107.0,
"step": 10905
},
{
"entropy": 6.263698863983154,
"epoch": 1.2590882862088864,
"grad_norm": 0.9140625,
"learning_rate": 0.0004853015669948557,
"loss": 5.9405,
"mean_token_accuracy": 0.1806721031665802,
"num_tokens": 27664060.0,
"step": 10910
},
{
"entropy": 6.198569345474243,
"epoch": 1.259665320253895,
"grad_norm": 0.91015625,
"learning_rate": 0.00048528689369368863,
"loss": 5.8714,
"mean_token_accuracy": 0.18663408011198043,
"num_tokens": 27676678.0,
"step": 10915
},
{
"entropy": 6.27892484664917,
"epoch": 1.2602423542989036,
"grad_norm": 0.9140625,
"learning_rate": 0.0004852722133196264,
"loss": 5.9284,
"mean_token_accuracy": 0.17606211006641387,
"num_tokens": 27689696.0,
"step": 10920
},
{
"entropy": 6.214528560638428,
"epoch": 1.2608193883439123,
"grad_norm": 0.921875,
"learning_rate": 0.0004852575258731627,
"loss": 5.8139,
"mean_token_accuracy": 0.18999661058187484,
"num_tokens": 27702144.0,
"step": 10925
},
{
"entropy": 6.267048263549805,
"epoch": 1.261396422388921,
"grad_norm": 0.9609375,
"learning_rate": 0.0004852428313547916,
"loss": 5.9585,
"mean_token_accuracy": 0.17625246644020082,
"num_tokens": 27714618.0,
"step": 10930
},
{
"entropy": 6.254409265518189,
"epoch": 1.2619734564339296,
"grad_norm": 0.90625,
"learning_rate": 0.00048522812976500726,
"loss": 5.8882,
"mean_token_accuracy": 0.1819372683763504,
"num_tokens": 27727002.0,
"step": 10935
},
{
"entropy": 6.285655307769775,
"epoch": 1.2625504904789382,
"grad_norm": 0.90234375,
"learning_rate": 0.00048521342110430417,
"loss": 5.9194,
"mean_token_accuracy": 0.1847675174474716,
"num_tokens": 27739506.0,
"step": 10940
},
{
"entropy": 6.199552774429321,
"epoch": 1.2631275245239468,
"grad_norm": 0.890625,
"learning_rate": 0.00048519870537317713,
"loss": 5.7879,
"mean_token_accuracy": 0.18768482953310012,
"num_tokens": 27751959.0,
"step": 10945
},
{
"entropy": 6.188604736328125,
"epoch": 1.2637045585689557,
"grad_norm": 0.875,
"learning_rate": 0.00048518398257212103,
"loss": 5.8612,
"mean_token_accuracy": 0.18423410803079604,
"num_tokens": 27762938.0,
"step": 10950
},
{
"entropy": 6.242674493789673,
"epoch": 1.2642815926139641,
"grad_norm": 0.890625,
"learning_rate": 0.0004851692527016311,
"loss": 5.9281,
"mean_token_accuracy": 0.1746857702732086,
"num_tokens": 27776288.0,
"step": 10955
},
{
"entropy": 6.300945043563843,
"epoch": 1.264858626658973,
"grad_norm": 0.8671875,
"learning_rate": 0.0004851545157622027,
"loss": 5.9403,
"mean_token_accuracy": 0.16904095262289048,
"num_tokens": 27788311.0,
"step": 10960
},
{
"entropy": 6.292170190811158,
"epoch": 1.2654356607039816,
"grad_norm": 0.8984375,
"learning_rate": 0.0004851397717543316,
"loss": 5.9153,
"mean_token_accuracy": 0.1774510622024536,
"num_tokens": 27799589.0,
"step": 10965
},
{
"entropy": 6.163033199310303,
"epoch": 1.2660126947489903,
"grad_norm": 0.9140625,
"learning_rate": 0.0004851250206785137,
"loss": 5.7982,
"mean_token_accuracy": 0.18300086855888367,
"num_tokens": 27813057.0,
"step": 10970
},
{
"entropy": 6.1811439990997314,
"epoch": 1.266589728793999,
"grad_norm": 0.86328125,
"learning_rate": 0.00048511026253524503,
"loss": 5.8343,
"mean_token_accuracy": 0.1845756396651268,
"num_tokens": 27826465.0,
"step": 10975
},
{
"entropy": 6.239641380310059,
"epoch": 1.2671667628390075,
"grad_norm": 0.9296875,
"learning_rate": 0.0004850954973250221,
"loss": 5.9186,
"mean_token_accuracy": 0.183623206615448,
"num_tokens": 27837157.0,
"step": 10980
},
{
"entropy": 6.2734949588775635,
"epoch": 1.2677437968840162,
"grad_norm": 0.86328125,
"learning_rate": 0.00048508072504834144,
"loss": 5.9733,
"mean_token_accuracy": 0.18870452791452408,
"num_tokens": 27850101.0,
"step": 10985
},
{
"entropy": 6.257879447937012,
"epoch": 1.2683208309290248,
"grad_norm": 0.828125,
"learning_rate": 0.00048506594570569997,
"loss": 5.9163,
"mean_token_accuracy": 0.1761870115995407,
"num_tokens": 27862786.0,
"step": 10990
},
{
"entropy": 6.310289525985718,
"epoch": 1.2688978649740335,
"grad_norm": 0.953125,
"learning_rate": 0.0004850511592975947,
"loss": 5.921,
"mean_token_accuracy": 0.1836473450064659,
"num_tokens": 27875196.0,
"step": 10995
},
{
"entropy": 6.256885623931884,
"epoch": 1.269474899019042,
"grad_norm": 0.8515625,
"learning_rate": 0.0004850363658245231,
"loss": 5.9931,
"mean_token_accuracy": 0.17773234248161315,
"num_tokens": 27888348.0,
"step": 11000
},
{
"entropy": 6.264603042602539,
"epoch": 1.2700519330640507,
"grad_norm": 0.8671875,
"learning_rate": 0.0004850215652869826,
"loss": 5.9415,
"mean_token_accuracy": 0.18163408041000367,
"num_tokens": 27901301.0,
"step": 11005
},
{
"entropy": 6.26677885055542,
"epoch": 1.2706289671090594,
"grad_norm": 0.90625,
"learning_rate": 0.0004850067576854711,
"loss": 5.9245,
"mean_token_accuracy": 0.18035585135221482,
"num_tokens": 27915665.0,
"step": 11010
},
{
"entropy": 6.204976367950439,
"epoch": 1.271206001154068,
"grad_norm": 0.8828125,
"learning_rate": 0.0004849919430204867,
"loss": 5.899,
"mean_token_accuracy": 0.18384966850280762,
"num_tokens": 27928333.0,
"step": 11015
},
{
"entropy": 6.2638813018798825,
"epoch": 1.2717830351990767,
"grad_norm": 1.1484375,
"learning_rate": 0.0004849771212925275,
"loss": 5.8452,
"mean_token_accuracy": 0.18147977739572524,
"num_tokens": 27940429.0,
"step": 11020
},
{
"entropy": 6.264388513565064,
"epoch": 1.2723600692440855,
"grad_norm": 0.8828125,
"learning_rate": 0.00048496229250209223,
"loss": 5.9614,
"mean_token_accuracy": 0.18041146397590638,
"num_tokens": 27953846.0,
"step": 11025
},
{
"entropy": 6.211956357955932,
"epoch": 1.272937103289094,
"grad_norm": 0.984375,
"learning_rate": 0.0004849474566496795,
"loss": 5.8087,
"mean_token_accuracy": 0.19337970167398452,
"num_tokens": 27966393.0,
"step": 11030
},
{
"entropy": 6.157489681243897,
"epoch": 1.2735141373341028,
"grad_norm": 0.84765625,
"learning_rate": 0.0004849326137357883,
"loss": 5.7524,
"mean_token_accuracy": 0.20423612147569656,
"num_tokens": 27979928.0,
"step": 11035
},
{
"entropy": 6.274266529083252,
"epoch": 1.2740911713791114,
"grad_norm": 0.953125,
"learning_rate": 0.000484917763760918,
"loss": 5.8724,
"mean_token_accuracy": 0.17999066561460494,
"num_tokens": 27991450.0,
"step": 11040
},
{
"entropy": 6.249115896224976,
"epoch": 1.27466820542412,
"grad_norm": 0.92578125,
"learning_rate": 0.00048490290672556784,
"loss": 5.9163,
"mean_token_accuracy": 0.17860014736652374,
"num_tokens": 28003696.0,
"step": 11045
},
{
"entropy": 6.121306085586548,
"epoch": 1.2752452394691287,
"grad_norm": 0.9140625,
"learning_rate": 0.0004848880426302378,
"loss": 5.8191,
"mean_token_accuracy": 0.1887667015194893,
"num_tokens": 28015886.0,
"step": 11050
},
{
"entropy": 6.220458936691284,
"epoch": 1.2758222735141374,
"grad_norm": 1.2109375,
"learning_rate": 0.0004848731714754277,
"loss": 5.87,
"mean_token_accuracy": 0.18536427319049836,
"num_tokens": 28029552.0,
"step": 11055
},
{
"entropy": 6.2172283172607425,
"epoch": 1.276399307559146,
"grad_norm": 0.8671875,
"learning_rate": 0.0004848582932616377,
"loss": 5.9559,
"mean_token_accuracy": 0.17716862708330156,
"num_tokens": 28042275.0,
"step": 11060
},
{
"entropy": 6.174749374389648,
"epoch": 1.2769763416041546,
"grad_norm": 1.0390625,
"learning_rate": 0.0004848434079893682,
"loss": 5.8283,
"mean_token_accuracy": 0.19337797313928604,
"num_tokens": 28054840.0,
"step": 11065
},
{
"entropy": 6.320803117752075,
"epoch": 1.2775533756491633,
"grad_norm": 1.0078125,
"learning_rate": 0.0004848285156591201,
"loss": 5.9848,
"mean_token_accuracy": 0.17735466361045837,
"num_tokens": 28068052.0,
"step": 11070
},
{
"entropy": 6.317575454711914,
"epoch": 1.278130409694172,
"grad_norm": 0.8828125,
"learning_rate": 0.00048481361627139384,
"loss": 5.9607,
"mean_token_accuracy": 0.17917237877845765,
"num_tokens": 28081157.0,
"step": 11075
},
{
"entropy": 6.264458179473877,
"epoch": 1.2787074437391805,
"grad_norm": 0.9921875,
"learning_rate": 0.00048479870982669096,
"loss": 5.9992,
"mean_token_accuracy": 0.17882073372602464,
"num_tokens": 28093842.0,
"step": 11080
},
{
"entropy": 6.269530010223389,
"epoch": 1.2792844777841892,
"grad_norm": 0.9296875,
"learning_rate": 0.00048478379632551266,
"loss": 5.8656,
"mean_token_accuracy": 0.1861704871058464,
"num_tokens": 28107529.0,
"step": 11085
},
{
"entropy": 6.3019171237945555,
"epoch": 1.279861511829198,
"grad_norm": 0.83203125,
"learning_rate": 0.0004847688757683606,
"loss": 5.9586,
"mean_token_accuracy": 0.17826474457979202,
"num_tokens": 28119650.0,
"step": 11090
},
{
"entropy": 6.197647523880005,
"epoch": 1.2804385458742065,
"grad_norm": 0.91796875,
"learning_rate": 0.0004847539481557366,
"loss": 5.8936,
"mean_token_accuracy": 0.18941795378923415,
"num_tokens": 28131209.0,
"step": 11095
},
{
"entropy": 6.21189546585083,
"epoch": 1.2810155799192153,
"grad_norm": 0.9375,
"learning_rate": 0.00048473901348814277,
"loss": 5.9072,
"mean_token_accuracy": 0.18758580833673477,
"num_tokens": 28143624.0,
"step": 11100
},
{
"entropy": 6.333727693557739,
"epoch": 1.281592613964224,
"grad_norm": 0.90625,
"learning_rate": 0.0004847240717660814,
"loss": 5.9187,
"mean_token_accuracy": 0.18257874101400376,
"num_tokens": 28156752.0,
"step": 11105
},
{
"entropy": 6.148864364624023,
"epoch": 1.2821696480092326,
"grad_norm": 0.83203125,
"learning_rate": 0.00048470912299005493,
"loss": 5.7846,
"mean_token_accuracy": 0.1917967677116394,
"num_tokens": 28169288.0,
"step": 11110
},
{
"entropy": 6.202798795700073,
"epoch": 1.2827466820542412,
"grad_norm": 0.99609375,
"learning_rate": 0.00048469416716056635,
"loss": 5.8863,
"mean_token_accuracy": 0.18294143825769424,
"num_tokens": 28181739.0,
"step": 11115
},
{
"entropy": 6.241795825958252,
"epoch": 1.28332371609925,
"grad_norm": 0.953125,
"learning_rate": 0.0004846792042781187,
"loss": 5.8472,
"mean_token_accuracy": 0.18725763261318207,
"num_tokens": 28193861.0,
"step": 11120
},
{
"entropy": 6.167054653167725,
"epoch": 1.2839007501442585,
"grad_norm": 0.87109375,
"learning_rate": 0.00048466423434321513,
"loss": 5.799,
"mean_token_accuracy": 0.19221861511468888,
"num_tokens": 28205453.0,
"step": 11125
},
{
"entropy": 6.213259506225586,
"epoch": 1.2844777841892672,
"grad_norm": 0.93359375,
"learning_rate": 0.00048464925735635907,
"loss": 5.866,
"mean_token_accuracy": 0.18240144699811936,
"num_tokens": 28217554.0,
"step": 11130
},
{
"entropy": 6.326313447952271,
"epoch": 1.2850548182342758,
"grad_norm": 0.8828125,
"learning_rate": 0.00048463427331805445,
"loss": 5.9837,
"mean_token_accuracy": 0.17859313935041427,
"num_tokens": 28230091.0,
"step": 11135
},
{
"entropy": 6.196951007843017,
"epoch": 1.2856318522792844,
"grad_norm": 0.85546875,
"learning_rate": 0.0004846192822288052,
"loss": 5.8606,
"mean_token_accuracy": 0.19161761701107025,
"num_tokens": 28243285.0,
"step": 11140
},
{
"entropy": 6.159520244598388,
"epoch": 1.286208886324293,
"grad_norm": 0.90234375,
"learning_rate": 0.0004846042840891155,
"loss": 5.7559,
"mean_token_accuracy": 0.19518305808305741,
"num_tokens": 28256210.0,
"step": 11145
},
{
"entropy": 6.202442598342896,
"epoch": 1.2867859203693017,
"grad_norm": 0.9921875,
"learning_rate": 0.0004845892788994899,
"loss": 5.8393,
"mean_token_accuracy": 0.1925252139568329,
"num_tokens": 28268291.0,
"step": 11150
},
{
"entropy": 6.127519702911377,
"epoch": 1.2873629544143104,
"grad_norm": 0.90234375,
"learning_rate": 0.0004845742666604329,
"loss": 5.802,
"mean_token_accuracy": 0.19252759367227554,
"num_tokens": 28281462.0,
"step": 11155
},
{
"entropy": 6.261201524734497,
"epoch": 1.287939988459319,
"grad_norm": 0.87109375,
"learning_rate": 0.00048455924737244953,
"loss": 5.9527,
"mean_token_accuracy": 0.1794736549258232,
"num_tokens": 28292766.0,
"step": 11160
},
{
"entropy": 6.165164470672607,
"epoch": 1.2885170225043279,
"grad_norm": 0.93359375,
"learning_rate": 0.00048454422103604505,
"loss": 5.8265,
"mean_token_accuracy": 0.1932087242603302,
"num_tokens": 28304500.0,
"step": 11165
},
{
"entropy": 6.250514936447144,
"epoch": 1.2890940565493363,
"grad_norm": 0.875,
"learning_rate": 0.0004845291876517247,
"loss": 5.9187,
"mean_token_accuracy": 0.1889398217201233,
"num_tokens": 28317262.0,
"step": 11170
},
{
"entropy": 6.167955780029297,
"epoch": 1.2896710905943451,
"grad_norm": 0.83984375,
"learning_rate": 0.00048451414721999424,
"loss": 5.79,
"mean_token_accuracy": 0.1927010953426361,
"num_tokens": 28330313.0,
"step": 11175
},
{
"entropy": 6.192044591903686,
"epoch": 1.2902481246393538,
"grad_norm": 0.83984375,
"learning_rate": 0.00048449909974135954,
"loss": 5.8116,
"mean_token_accuracy": 0.18487345725297927,
"num_tokens": 28344058.0,
"step": 11180
},
{
"entropy": 6.202538776397705,
"epoch": 1.2908251586843624,
"grad_norm": 0.91796875,
"learning_rate": 0.0004844840452163267,
"loss": 5.8816,
"mean_token_accuracy": 0.18409787267446517,
"num_tokens": 28356664.0,
"step": 11185
},
{
"entropy": 6.264059352874756,
"epoch": 1.291402192729371,
"grad_norm": 0.87109375,
"learning_rate": 0.000484468983645402,
"loss": 5.9159,
"mean_token_accuracy": 0.1831672191619873,
"num_tokens": 28369040.0,
"step": 11190
},
{
"entropy": 6.198862314224243,
"epoch": 1.2919792267743797,
"grad_norm": 0.9140625,
"learning_rate": 0.00048445391502909213,
"loss": 5.8845,
"mean_token_accuracy": 0.17770082056522368,
"num_tokens": 28381788.0,
"step": 11195
},
{
"entropy": 6.235758447647095,
"epoch": 1.2925562608193883,
"grad_norm": 0.87109375,
"learning_rate": 0.00048443883936790386,
"loss": 5.9364,
"mean_token_accuracy": 0.18272285610437394,
"num_tokens": 28394531.0,
"step": 11200
},
{
"entropy": 6.215797090530396,
"epoch": 1.293133294864397,
"grad_norm": 1.0234375,
"learning_rate": 0.00048442375666234427,
"loss": 5.8094,
"mean_token_accuracy": 0.18736853450536728,
"num_tokens": 28407766.0,
"step": 11205
},
{
"entropy": 6.2450777053833,
"epoch": 1.2937103289094056,
"grad_norm": 0.9296875,
"learning_rate": 0.0004844086669129206,
"loss": 5.9169,
"mean_token_accuracy": 0.18248326927423478,
"num_tokens": 28420185.0,
"step": 11210
},
{
"entropy": 6.302453470230103,
"epoch": 1.2942873629544143,
"grad_norm": 0.87109375,
"learning_rate": 0.00048439357012014045,
"loss": 5.875,
"mean_token_accuracy": 0.1817401424050331,
"num_tokens": 28432781.0,
"step": 11215
},
{
"entropy": 6.239097166061401,
"epoch": 1.294864396999423,
"grad_norm": 0.8046875,
"learning_rate": 0.0004843784662845116,
"loss": 5.8712,
"mean_token_accuracy": 0.18863223046064376,
"num_tokens": 28446181.0,
"step": 11220
},
{
"entropy": 6.22045316696167,
"epoch": 1.2954414310444315,
"grad_norm": 0.91015625,
"learning_rate": 0.000484363355406542,
"loss": 5.7876,
"mean_token_accuracy": 0.1905339851975441,
"num_tokens": 28457959.0,
"step": 11225
},
{
"entropy": 6.223681545257568,
"epoch": 1.2960184650894404,
"grad_norm": 0.88671875,
"learning_rate": 0.00048434823748674,
"loss": 5.9161,
"mean_token_accuracy": 0.18176539540290831,
"num_tokens": 28470656.0,
"step": 11230
},
{
"entropy": 6.253976678848266,
"epoch": 1.2965954991344488,
"grad_norm": 0.83203125,
"learning_rate": 0.00048433311252561403,
"loss": 5.9463,
"mean_token_accuracy": 0.18163900822401047,
"num_tokens": 28483359.0,
"step": 11235
},
{
"entropy": 6.231476640701294,
"epoch": 1.2971725331794577,
"grad_norm": 0.8828125,
"learning_rate": 0.0004843179805236728,
"loss": 5.8509,
"mean_token_accuracy": 0.1812107414007187,
"num_tokens": 28495984.0,
"step": 11240
},
{
"entropy": 6.214840412139893,
"epoch": 1.297749567224466,
"grad_norm": 0.90234375,
"learning_rate": 0.00048430284148142516,
"loss": 5.9283,
"mean_token_accuracy": 0.18338681906461715,
"num_tokens": 28508629.0,
"step": 11245
},
{
"entropy": 6.251529169082642,
"epoch": 1.298326601269475,
"grad_norm": 1.0546875,
"learning_rate": 0.0004842876953993805,
"loss": 5.9368,
"mean_token_accuracy": 0.1814151406288147,
"num_tokens": 28521952.0,
"step": 11250
},
{
"entropy": 6.235261106491089,
"epoch": 1.2989036353144836,
"grad_norm": 0.828125,
"learning_rate": 0.0004842725422780482,
"loss": 5.8472,
"mean_token_accuracy": 0.1838516652584076,
"num_tokens": 28535210.0,
"step": 11255
},
{
"entropy": 6.2960120677948,
"epoch": 1.2994806693594922,
"grad_norm": 0.8984375,
"learning_rate": 0.0004842573821179378,
"loss": 5.9481,
"mean_token_accuracy": 0.17584086060523987,
"num_tokens": 28547294.0,
"step": 11260
},
{
"entropy": 6.314822959899902,
"epoch": 1.3000577034045009,
"grad_norm": 0.96484375,
"learning_rate": 0.0004842422149195593,
"loss": 5.9818,
"mean_token_accuracy": 0.1747643157839775,
"num_tokens": 28558934.0,
"step": 11265
},
{
"entropy": 6.228778266906739,
"epoch": 1.3006347374495095,
"grad_norm": 1.0703125,
"learning_rate": 0.00048422704068342294,
"loss": 5.8457,
"mean_token_accuracy": 0.18052484542131425,
"num_tokens": 28571897.0,
"step": 11270
},
{
"entropy": 6.207079267501831,
"epoch": 1.3012117714945182,
"grad_norm": 0.88671875,
"learning_rate": 0.0004842118594100389,
"loss": 5.8526,
"mean_token_accuracy": 0.18636152595281602,
"num_tokens": 28584320.0,
"step": 11275
},
{
"entropy": 6.174588394165039,
"epoch": 1.3017888055395268,
"grad_norm": 0.91015625,
"learning_rate": 0.00048419667109991793,
"loss": 5.8066,
"mean_token_accuracy": 0.1909553661942482,
"num_tokens": 28597018.0,
"step": 11280
},
{
"entropy": 6.1673197746276855,
"epoch": 1.3023658395845354,
"grad_norm": 0.94140625,
"learning_rate": 0.00048418147575357085,
"loss": 5.82,
"mean_token_accuracy": 0.1927016168832779,
"num_tokens": 28609145.0,
"step": 11285
},
{
"entropy": 6.213823366165161,
"epoch": 1.302942873629544,
"grad_norm": 0.91015625,
"learning_rate": 0.0004841662733715087,
"loss": 5.8258,
"mean_token_accuracy": 0.18956251591444015,
"num_tokens": 28622208.0,
"step": 11290
},
{
"entropy": 6.168881797790528,
"epoch": 1.3035199076745527,
"grad_norm": 1.0078125,
"learning_rate": 0.00048415106395424294,
"loss": 5.8299,
"mean_token_accuracy": 0.18110065758228303,
"num_tokens": 28634719.0,
"step": 11295
},
{
"entropy": 6.242797899246216,
"epoch": 1.3040969417195614,
"grad_norm": 0.9140625,
"learning_rate": 0.00048413584750228494,
"loss": 5.9193,
"mean_token_accuracy": 0.18366942554712296,
"num_tokens": 28647138.0,
"step": 11300
},
{
"entropy": 6.160969686508179,
"epoch": 1.3046739757645702,
"grad_norm": 0.84765625,
"learning_rate": 0.00048412062401614653,
"loss": 5.8142,
"mean_token_accuracy": 0.19241383224725722,
"num_tokens": 28660898.0,
"step": 11305
},
{
"entropy": 6.281964683532715,
"epoch": 1.3052510098095786,
"grad_norm": 0.8515625,
"learning_rate": 0.00048410539349634,
"loss": 5.9567,
"mean_token_accuracy": 0.18592915683984756,
"num_tokens": 28672898.0,
"step": 11310
},
{
"entropy": 6.223157262802124,
"epoch": 1.3058280438545875,
"grad_norm": 0.9296875,
"learning_rate": 0.00048409015594337725,
"loss": 5.9526,
"mean_token_accuracy": 0.1888653665781021,
"num_tokens": 28684608.0,
"step": 11315
},
{
"entropy": 6.212820672988892,
"epoch": 1.3064050778995961,
"grad_norm": 0.89453125,
"learning_rate": 0.000484074911357771,
"loss": 5.8609,
"mean_token_accuracy": 0.18949985653162002,
"num_tokens": 28696867.0,
"step": 11320
},
{
"entropy": 6.2286797046661375,
"epoch": 1.3069821119446048,
"grad_norm": 0.9140625,
"learning_rate": 0.00048405965974003404,
"loss": 5.9359,
"mean_token_accuracy": 0.17696356326341628,
"num_tokens": 28709533.0,
"step": 11325
},
{
"entropy": 6.2534784317016605,
"epoch": 1.3075591459896134,
"grad_norm": 0.86328125,
"learning_rate": 0.00048404440109067927,
"loss": 5.8694,
"mean_token_accuracy": 0.17698248773813247,
"num_tokens": 28721647.0,
"step": 11330
},
{
"entropy": 6.255917501449585,
"epoch": 1.308136180034622,
"grad_norm": 0.94140625,
"learning_rate": 0.0004840291354102198,
"loss": 5.8925,
"mean_token_accuracy": 0.18085959553718567,
"num_tokens": 28735261.0,
"step": 11335
},
{
"entropy": 6.202675867080688,
"epoch": 1.3087132140796307,
"grad_norm": 1.1640625,
"learning_rate": 0.0004840138626991693,
"loss": 5.9353,
"mean_token_accuracy": 0.18194161504507064,
"num_tokens": 28747930.0,
"step": 11340
},
{
"entropy": 6.258759212493897,
"epoch": 1.3092902481246393,
"grad_norm": 0.8515625,
"learning_rate": 0.0004839985829580413,
"loss": 5.9106,
"mean_token_accuracy": 0.18136637806892394,
"num_tokens": 28760497.0,
"step": 11345
},
{
"entropy": 6.320033216476441,
"epoch": 1.309867282169648,
"grad_norm": 0.9453125,
"learning_rate": 0.00048398329618734977,
"loss": 5.9464,
"mean_token_accuracy": 0.17641042470932006,
"num_tokens": 28772787.0,
"step": 11350
},
{
"entropy": 6.200205707550049,
"epoch": 1.3104443162146566,
"grad_norm": 0.8046875,
"learning_rate": 0.0004839680023876089,
"loss": 5.8531,
"mean_token_accuracy": 0.18295872509479522,
"num_tokens": 28784901.0,
"step": 11355
},
{
"entropy": 6.262151050567627,
"epoch": 1.3110213502596653,
"grad_norm": 0.92578125,
"learning_rate": 0.0004839527015593331,
"loss": 5.9302,
"mean_token_accuracy": 0.178282168507576,
"num_tokens": 28797376.0,
"step": 11360
},
{
"entropy": 6.249820327758789,
"epoch": 1.311598384304674,
"grad_norm": 0.84765625,
"learning_rate": 0.00048393739370303684,
"loss": 5.8711,
"mean_token_accuracy": 0.1843525782227516,
"num_tokens": 28808805.0,
"step": 11365
},
{
"entropy": 6.219827556610108,
"epoch": 1.3121754183496828,
"grad_norm": 0.85546875,
"learning_rate": 0.0004839220788192353,
"loss": 5.9671,
"mean_token_accuracy": 0.17647455185651778,
"num_tokens": 28821734.0,
"step": 11370
},
{
"entropy": 6.2617974281311035,
"epoch": 1.3127524523946912,
"grad_norm": 0.92578125,
"learning_rate": 0.00048390675690844335,
"loss": 5.8399,
"mean_token_accuracy": 0.1810166746377945,
"num_tokens": 28834864.0,
"step": 11375
},
{
"entropy": 6.158445119857788,
"epoch": 1.3133294864397,
"grad_norm": 0.95703125,
"learning_rate": 0.0004838914279711764,
"loss": 5.8065,
"mean_token_accuracy": 0.18591468781232834,
"num_tokens": 28848154.0,
"step": 11380
},
{
"entropy": 6.175825357437134,
"epoch": 1.3139065204847085,
"grad_norm": 0.80859375,
"learning_rate": 0.00048387609200795003,
"loss": 5.8917,
"mean_token_accuracy": 0.18650826215744018,
"num_tokens": 28861562.0,
"step": 11385
},
{
"entropy": 6.272245788574219,
"epoch": 1.3144835545297173,
"grad_norm": 0.88671875,
"learning_rate": 0.00048386074901928,
"loss": 5.8496,
"mean_token_accuracy": 0.18694826662540437,
"num_tokens": 28873921.0,
"step": 11390
},
{
"entropy": 6.255329275131226,
"epoch": 1.315060588574726,
"grad_norm": 0.859375,
"learning_rate": 0.0004838453990056825,
"loss": 5.9349,
"mean_token_accuracy": 0.1798590064048767,
"num_tokens": 28886126.0,
"step": 11395
},
{
"entropy": 6.220553064346314,
"epoch": 1.3156376226197346,
"grad_norm": 0.875,
"learning_rate": 0.00048383004196767373,
"loss": 5.8019,
"mean_token_accuracy": 0.1911833941936493,
"num_tokens": 28897980.0,
"step": 11400
},
{
"entropy": 6.265301656723023,
"epoch": 1.3162146566647432,
"grad_norm": 0.890625,
"learning_rate": 0.0004838146779057702,
"loss": 5.8514,
"mean_token_accuracy": 0.18370553553104402,
"num_tokens": 28910105.0,
"step": 11405
},
{
"entropy": 6.238138055801391,
"epoch": 1.3167916907097519,
"grad_norm": 0.96484375,
"learning_rate": 0.0004837993068204887,
"loss": 5.9089,
"mean_token_accuracy": 0.18176488429307938,
"num_tokens": 28922004.0,
"step": 11410
},
{
"entropy": 6.176228141784668,
"epoch": 1.3173687247547605,
"grad_norm": 0.859375,
"learning_rate": 0.00048378392871234634,
"loss": 5.767,
"mean_token_accuracy": 0.19638804495334625,
"num_tokens": 28935990.0,
"step": 11415
},
{
"entropy": 6.256175231933594,
"epoch": 1.3179457587997692,
"grad_norm": 0.94921875,
"learning_rate": 0.0004837685435818601,
"loss": 5.8387,
"mean_token_accuracy": 0.1891574367880821,
"num_tokens": 28948274.0,
"step": 11420
},
{
"entropy": 6.233545589447021,
"epoch": 1.3185227928447778,
"grad_norm": 0.91796875,
"learning_rate": 0.0004837531514295477,
"loss": 5.9423,
"mean_token_accuracy": 0.17450683414936066,
"num_tokens": 28960101.0,
"step": 11425
},
{
"entropy": 6.260594320297241,
"epoch": 1.3190998268897864,
"grad_norm": 0.890625,
"learning_rate": 0.0004837377522559267,
"loss": 5.9553,
"mean_token_accuracy": 0.18921227008104324,
"num_tokens": 28972408.0,
"step": 11430
},
{
"entropy": 6.249463510513306,
"epoch": 1.319676860934795,
"grad_norm": 0.84375,
"learning_rate": 0.00048372234606151507,
"loss": 5.8905,
"mean_token_accuracy": 0.18161126375198364,
"num_tokens": 28985025.0,
"step": 11435
},
{
"entropy": 6.256546449661255,
"epoch": 1.3202538949798037,
"grad_norm": 0.8515625,
"learning_rate": 0.00048370693284683106,
"loss": 5.9632,
"mean_token_accuracy": 0.18379874676465988,
"num_tokens": 28997568.0,
"step": 11440
},
{
"entropy": 6.281197547912598,
"epoch": 1.3208309290248126,
"grad_norm": 0.91015625,
"learning_rate": 0.00048369151261239303,
"loss": 5.973,
"mean_token_accuracy": 0.17523153275251388,
"num_tokens": 29009567.0,
"step": 11445
},
{
"entropy": 6.239495086669922,
"epoch": 1.321407963069821,
"grad_norm": 0.91015625,
"learning_rate": 0.0004836760853587196,
"loss": 5.8738,
"mean_token_accuracy": 0.17971327304840087,
"num_tokens": 29021403.0,
"step": 11450
},
{
"entropy": 6.231962966918945,
"epoch": 1.3219849971148299,
"grad_norm": 0.90625,
"learning_rate": 0.00048366065108632967,
"loss": 5.8515,
"mean_token_accuracy": 0.1861049070954323,
"num_tokens": 29033430.0,
"step": 11455
},
{
"entropy": 6.187495756149292,
"epoch": 1.3225620311598385,
"grad_norm": 0.890625,
"learning_rate": 0.00048364520979574246,
"loss": 5.8723,
"mean_token_accuracy": 0.18128441423177719,
"num_tokens": 29045659.0,
"step": 11460
},
{
"entropy": 6.204320430755615,
"epoch": 1.3231390652048471,
"grad_norm": 0.90625,
"learning_rate": 0.00048362976148747715,
"loss": 5.8202,
"mean_token_accuracy": 0.1851746380329132,
"num_tokens": 29058962.0,
"step": 11465
},
{
"entropy": 6.236425065994263,
"epoch": 1.3237160992498558,
"grad_norm": 0.94921875,
"learning_rate": 0.0004836143061620536,
"loss": 5.7613,
"mean_token_accuracy": 0.1951758399605751,
"num_tokens": 29072009.0,
"step": 11470
},
{
"entropy": 6.150970411300659,
"epoch": 1.3242931332948644,
"grad_norm": 0.859375,
"learning_rate": 0.0004835988438199914,
"loss": 5.7753,
"mean_token_accuracy": 0.19481099843978883,
"num_tokens": 29084174.0,
"step": 11475
},
{
"entropy": 6.225009822845459,
"epoch": 1.324870167339873,
"grad_norm": 0.8984375,
"learning_rate": 0.0004835833744618107,
"loss": 5.8656,
"mean_token_accuracy": 0.185127791762352,
"num_tokens": 29096189.0,
"step": 11480
},
{
"entropy": 6.202565431594849,
"epoch": 1.3254472013848817,
"grad_norm": 0.8828125,
"learning_rate": 0.0004835678980880318,
"loss": 5.8374,
"mean_token_accuracy": 0.18455548584461212,
"num_tokens": 29108212.0,
"step": 11485
},
{
"entropy": 6.263130712509155,
"epoch": 1.3260242354298903,
"grad_norm": 1.3984375,
"learning_rate": 0.0004835524146991753,
"loss": 5.8032,
"mean_token_accuracy": 0.19258994311094285,
"num_tokens": 29121058.0,
"step": 11490
},
{
"entropy": 6.197894430160522,
"epoch": 1.326601269474899,
"grad_norm": 0.92578125,
"learning_rate": 0.00048353692429576185,
"loss": 5.9338,
"mean_token_accuracy": 0.1838608577847481,
"num_tokens": 29132981.0,
"step": 11495
},
{
"entropy": 6.250746345520019,
"epoch": 1.3271783035199076,
"grad_norm": 0.8828125,
"learning_rate": 0.0004835214268783126,
"loss": 5.8847,
"mean_token_accuracy": 0.18033799827098845,
"num_tokens": 29145143.0,
"step": 11500
},
{
"entropy": 6.2464357852935795,
"epoch": 1.3277553375649163,
"grad_norm": 0.88671875,
"learning_rate": 0.00048350592244734866,
"loss": 5.8415,
"mean_token_accuracy": 0.18740762770175934,
"num_tokens": 29157548.0,
"step": 11505
},
{
"entropy": 6.139885425567627,
"epoch": 1.3283323716099251,
"grad_norm": 0.9609375,
"learning_rate": 0.0004834904110033917,
"loss": 5.7547,
"mean_token_accuracy": 0.195901720225811,
"num_tokens": 29170243.0,
"step": 11510
},
{
"entropy": 6.218726301193238,
"epoch": 1.3289094056549335,
"grad_norm": 0.890625,
"learning_rate": 0.00048347489254696327,
"loss": 5.8636,
"mean_token_accuracy": 0.18377334475517274,
"num_tokens": 29181769.0,
"step": 11515
},
{
"entropy": 6.258484029769898,
"epoch": 1.3294864396999424,
"grad_norm": 0.94921875,
"learning_rate": 0.0004834593670785854,
"loss": 5.9648,
"mean_token_accuracy": 0.17879902422428132,
"num_tokens": 29194196.0,
"step": 11520
},
{
"entropy": 6.22721004486084,
"epoch": 1.3300634737449508,
"grad_norm": 0.90234375,
"learning_rate": 0.00048344383459878024,
"loss": 5.8595,
"mean_token_accuracy": 0.18442352563142778,
"num_tokens": 29206101.0,
"step": 11525
},
{
"entropy": 6.183701848983764,
"epoch": 1.3306405077899597,
"grad_norm": 0.8671875,
"learning_rate": 0.00048342829510807024,
"loss": 5.836,
"mean_token_accuracy": 0.18734344989061355,
"num_tokens": 29217851.0,
"step": 11530
},
{
"entropy": 6.154987382888794,
"epoch": 1.3312175418349683,
"grad_norm": 0.90234375,
"learning_rate": 0.000483412748606978,
"loss": 5.8028,
"mean_token_accuracy": 0.19526472836732864,
"num_tokens": 29231497.0,
"step": 11535
},
{
"entropy": 6.315514087677002,
"epoch": 1.331794575879977,
"grad_norm": 0.88671875,
"learning_rate": 0.0004833971950960266,
"loss": 5.9461,
"mean_token_accuracy": 0.18248422145843507,
"num_tokens": 29245227.0,
"step": 11540
},
{
"entropy": 6.224634885787964,
"epoch": 1.3323716099249856,
"grad_norm": 0.85546875,
"learning_rate": 0.0004833816345757391,
"loss": 5.8547,
"mean_token_accuracy": 0.1854404926300049,
"num_tokens": 29259403.0,
"step": 11545
},
{
"entropy": 6.249810361862183,
"epoch": 1.3329486439699942,
"grad_norm": 0.8828125,
"learning_rate": 0.0004833660670466387,
"loss": 5.8565,
"mean_token_accuracy": 0.18590396046638488,
"num_tokens": 29270938.0,
"step": 11550
},
{
"entropy": 6.258982610702515,
"epoch": 1.3335256780150029,
"grad_norm": 0.9296875,
"learning_rate": 0.0004833504925092492,
"loss": 5.8566,
"mean_token_accuracy": 0.19000206291675567,
"num_tokens": 29284078.0,
"step": 11555
},
{
"entropy": 6.223692846298218,
"epoch": 1.3341027120600115,
"grad_norm": 0.890625,
"learning_rate": 0.0004833349109640944,
"loss": 5.8385,
"mean_token_accuracy": 0.1834432601928711,
"num_tokens": 29295698.0,
"step": 11560
},
{
"entropy": 6.235724020004272,
"epoch": 1.3346797461050202,
"grad_norm": 0.89453125,
"learning_rate": 0.0004833193224116983,
"loss": 5.8652,
"mean_token_accuracy": 0.1862700179219246,
"num_tokens": 29307585.0,
"step": 11565
},
{
"entropy": 6.237357521057129,
"epoch": 1.3352567801500288,
"grad_norm": 0.87890625,
"learning_rate": 0.00048330372685258526,
"loss": 5.8703,
"mean_token_accuracy": 0.18552322387695314,
"num_tokens": 29321027.0,
"step": 11570
},
{
"entropy": 6.273429441452026,
"epoch": 1.3358338141950374,
"grad_norm": 0.86328125,
"learning_rate": 0.0004832881242872799,
"loss": 5.9237,
"mean_token_accuracy": 0.1840517833828926,
"num_tokens": 29333121.0,
"step": 11575
},
{
"entropy": 6.21780743598938,
"epoch": 1.336410848240046,
"grad_norm": 0.96484375,
"learning_rate": 0.0004832725147163069,
"loss": 5.894,
"mean_token_accuracy": 0.1825244978070259,
"num_tokens": 29346120.0,
"step": 11580
},
{
"entropy": 6.25745325088501,
"epoch": 1.336987882285055,
"grad_norm": 0.8984375,
"learning_rate": 0.00048325689814019134,
"loss": 5.8643,
"mean_token_accuracy": 0.18377418518066407,
"num_tokens": 29357872.0,
"step": 11585
},
{
"entropy": 6.281948804855347,
"epoch": 1.3375649163300634,
"grad_norm": 0.86328125,
"learning_rate": 0.0004832412745594585,
"loss": 5.9228,
"mean_token_accuracy": 0.18576952517032624,
"num_tokens": 29370657.0,
"step": 11590
},
{
"entropy": 6.170208215713501,
"epoch": 1.3381419503750722,
"grad_norm": 0.90625,
"learning_rate": 0.00048322564397463376,
"loss": 5.8472,
"mean_token_accuracy": 0.19092058688402175,
"num_tokens": 29384880.0,
"step": 11595
},
{
"entropy": 6.258925104141236,
"epoch": 1.3387189844200809,
"grad_norm": 0.9609375,
"learning_rate": 0.00048321000638624296,
"loss": 5.8543,
"mean_token_accuracy": 0.18395190089941024,
"num_tokens": 29397215.0,
"step": 11600
},
{
"entropy": 6.2219925880432125,
"epoch": 1.3392960184650895,
"grad_norm": 1.0390625,
"learning_rate": 0.000483194361794812,
"loss": 5.8089,
"mean_token_accuracy": 0.19121019542217255,
"num_tokens": 29409634.0,
"step": 11605
},
{
"entropy": 6.226755666732788,
"epoch": 1.3398730525100981,
"grad_norm": 0.84375,
"learning_rate": 0.000483178710200867,
"loss": 5.7865,
"mean_token_accuracy": 0.19461841881275177,
"num_tokens": 29422404.0,
"step": 11610
},
{
"entropy": 6.2323966979980465,
"epoch": 1.3404500865551068,
"grad_norm": 0.89453125,
"learning_rate": 0.0004831630516049346,
"loss": 5.9668,
"mean_token_accuracy": 0.18530030250549318,
"num_tokens": 29434727.0,
"step": 11615
},
{
"entropy": 6.253775358200073,
"epoch": 1.3410271206001154,
"grad_norm": 0.984375,
"learning_rate": 0.0004831473860075414,
"loss": 5.8695,
"mean_token_accuracy": 0.18326867818832399,
"num_tokens": 29447176.0,
"step": 11620
},
{
"entropy": 6.214875221252441,
"epoch": 1.341604154645124,
"grad_norm": 0.86328125,
"learning_rate": 0.00048313171340921417,
"loss": 5.8307,
"mean_token_accuracy": 0.1961693212389946,
"num_tokens": 29460080.0,
"step": 11625
},
{
"entropy": 6.183676052093506,
"epoch": 1.3421811886901327,
"grad_norm": 0.87109375,
"learning_rate": 0.00048311603381048025,
"loss": 5.8363,
"mean_token_accuracy": 0.19140980392694473,
"num_tokens": 29472503.0,
"step": 11630
},
{
"entropy": 6.234938287734986,
"epoch": 1.3427582227351413,
"grad_norm": 0.84765625,
"learning_rate": 0.0004831003472118668,
"loss": 5.8351,
"mean_token_accuracy": 0.18842962384223938,
"num_tokens": 29485139.0,
"step": 11635
},
{
"entropy": 6.310397815704346,
"epoch": 1.34333525678015,
"grad_norm": 0.96875,
"learning_rate": 0.0004830846536139016,
"loss": 5.9381,
"mean_token_accuracy": 0.18417907506227493,
"num_tokens": 29497455.0,
"step": 11640
},
{
"entropy": 6.260405540466309,
"epoch": 1.3439122908251586,
"grad_norm": 0.87109375,
"learning_rate": 0.0004830689530171124,
"loss": 5.8747,
"mean_token_accuracy": 0.1892422318458557,
"num_tokens": 29509859.0,
"step": 11645
},
{
"entropy": 6.264926242828369,
"epoch": 1.3444893248701673,
"grad_norm": 0.8359375,
"learning_rate": 0.0004830532454220273,
"loss": 5.9185,
"mean_token_accuracy": 0.18690085262060166,
"num_tokens": 29523117.0,
"step": 11650
},
{
"entropy": 6.162897396087646,
"epoch": 1.345066358915176,
"grad_norm": 0.82421875,
"learning_rate": 0.00048303753082917474,
"loss": 5.8265,
"mean_token_accuracy": 0.19078432023525238,
"num_tokens": 29535943.0,
"step": 11655
},
{
"entropy": 6.277468681335449,
"epoch": 1.3456433929601848,
"grad_norm": 0.87890625,
"learning_rate": 0.00048302180923908306,
"loss": 5.9204,
"mean_token_accuracy": 0.18410737067461014,
"num_tokens": 29549036.0,
"step": 11660
},
{
"entropy": 6.163658857345581,
"epoch": 1.3462204270051932,
"grad_norm": 0.8984375,
"learning_rate": 0.00048300608065228126,
"loss": 5.8297,
"mean_token_accuracy": 0.1890963688492775,
"num_tokens": 29563465.0,
"step": 11665
},
{
"entropy": 6.210170888900757,
"epoch": 1.346797461050202,
"grad_norm": 0.875,
"learning_rate": 0.00048299034506929815,
"loss": 5.7719,
"mean_token_accuracy": 0.19281139075756074,
"num_tokens": 29575891.0,
"step": 11670
},
{
"entropy": 6.244243478775024,
"epoch": 1.3473744950952107,
"grad_norm": 0.875,
"learning_rate": 0.00048297460249066315,
"loss": 5.9787,
"mean_token_accuracy": 0.17319456934928895,
"num_tokens": 29589162.0,
"step": 11675
},
{
"entropy": 6.291163921356201,
"epoch": 1.3479515291402193,
"grad_norm": 0.80859375,
"learning_rate": 0.0004829588529169057,
"loss": 5.8233,
"mean_token_accuracy": 0.1888448789715767,
"num_tokens": 29602735.0,
"step": 11680
},
{
"entropy": 6.167922639846802,
"epoch": 1.348528563185228,
"grad_norm": 0.9296875,
"learning_rate": 0.0004829430963485555,
"loss": 5.7813,
"mean_token_accuracy": 0.19492802619934083,
"num_tokens": 29615683.0,
"step": 11685
},
{
"entropy": 6.25222225189209,
"epoch": 1.3491055972302366,
"grad_norm": 0.9375,
"learning_rate": 0.0004829273327861426,
"loss": 5.8556,
"mean_token_accuracy": 0.18927911818027496,
"num_tokens": 29629606.0,
"step": 11690
},
{
"entropy": 6.201506853103638,
"epoch": 1.3496826312752452,
"grad_norm": 0.8828125,
"learning_rate": 0.0004829115622301971,
"loss": 5.838,
"mean_token_accuracy": 0.19121850728988649,
"num_tokens": 29642250.0,
"step": 11695
},
{
"entropy": 6.28028507232666,
"epoch": 1.3502596653202539,
"grad_norm": 0.82421875,
"learning_rate": 0.00048289578468124956,
"loss": 5.9316,
"mean_token_accuracy": 0.1848507806658745,
"num_tokens": 29655689.0,
"step": 11700
},
{
"entropy": 6.116147565841675,
"epoch": 1.3508366993652625,
"grad_norm": 0.92578125,
"learning_rate": 0.00048288000013983046,
"loss": 5.8409,
"mean_token_accuracy": 0.182951357960701,
"num_tokens": 29670084.0,
"step": 11705
},
{
"entropy": 6.25054349899292,
"epoch": 1.3514137334102712,
"grad_norm": 0.94140625,
"learning_rate": 0.00048286420860647086,
"loss": 5.8952,
"mean_token_accuracy": 0.19066344499588012,
"num_tokens": 29683453.0,
"step": 11710
},
{
"entropy": 6.269110584259034,
"epoch": 1.3519907674552798,
"grad_norm": 0.9375,
"learning_rate": 0.00048284841008170185,
"loss": 5.8098,
"mean_token_accuracy": 0.18684105575084686,
"num_tokens": 29695514.0,
"step": 11715
},
{
"entropy": 6.265933084487915,
"epoch": 1.3525678015002884,
"grad_norm": 0.828125,
"learning_rate": 0.00048283260456605487,
"loss": 5.8765,
"mean_token_accuracy": 0.18586160689592363,
"num_tokens": 29708544.0,
"step": 11720
},
{
"entropy": 6.3004742622375485,
"epoch": 1.3531448355452973,
"grad_norm": 0.859375,
"learning_rate": 0.0004828167920600614,
"loss": 5.8174,
"mean_token_accuracy": 0.18437671512365342,
"num_tokens": 29721310.0,
"step": 11725
},
{
"entropy": 6.225083684921264,
"epoch": 1.3537218695903057,
"grad_norm": 0.9453125,
"learning_rate": 0.0004828009725642534,
"loss": 5.8666,
"mean_token_accuracy": 0.18544016480445863,
"num_tokens": 29733995.0,
"step": 11730
},
{
"entropy": 6.239916563034058,
"epoch": 1.3542989036353146,
"grad_norm": 0.87890625,
"learning_rate": 0.0004827851460791628,
"loss": 5.9539,
"mean_token_accuracy": 0.17822468280792236,
"num_tokens": 29745896.0,
"step": 11735
},
{
"entropy": 6.290875339508057,
"epoch": 1.3548759376803232,
"grad_norm": 0.83984375,
"learning_rate": 0.00048276931260532213,
"loss": 5.8275,
"mean_token_accuracy": 0.18893493413925172,
"num_tokens": 29758967.0,
"step": 11740
},
{
"entropy": 6.263391494750977,
"epoch": 1.3554529717253319,
"grad_norm": 0.875,
"learning_rate": 0.0004827534721432639,
"loss": 5.8954,
"mean_token_accuracy": 0.17974050343036652,
"num_tokens": 29772167.0,
"step": 11745
},
{
"entropy": 6.1805259704589846,
"epoch": 1.3560300057703405,
"grad_norm": 0.84765625,
"learning_rate": 0.0004827376246935207,
"loss": 5.825,
"mean_token_accuracy": 0.18858230412006377,
"num_tokens": 29783841.0,
"step": 11750
},
{
"entropy": 6.261368370056152,
"epoch": 1.3566070398153491,
"grad_norm": 0.875,
"learning_rate": 0.0004827217702566257,
"loss": 5.9518,
"mean_token_accuracy": 0.18142978847026825,
"num_tokens": 29795993.0,
"step": 11755
},
{
"entropy": 6.229633855819702,
"epoch": 1.3571840738603578,
"grad_norm": 0.890625,
"learning_rate": 0.00048270590883311217,
"loss": 5.8547,
"mean_token_accuracy": 0.19509654194116594,
"num_tokens": 29807692.0,
"step": 11760
},
{
"entropy": 6.246022510528564,
"epoch": 1.3577611079053664,
"grad_norm": 0.83984375,
"learning_rate": 0.00048269004042351363,
"loss": 5.9361,
"mean_token_accuracy": 0.18227415829896926,
"num_tokens": 29820778.0,
"step": 11765
},
{
"entropy": 6.227572441101074,
"epoch": 1.358338141950375,
"grad_norm": 0.87109375,
"learning_rate": 0.0004826741650283637,
"loss": 5.8178,
"mean_token_accuracy": 0.18706079721450805,
"num_tokens": 29833976.0,
"step": 11770
},
{
"entropy": 6.193403339385986,
"epoch": 1.3589151759953837,
"grad_norm": 0.92578125,
"learning_rate": 0.0004826582826481963,
"loss": 5.8272,
"mean_token_accuracy": 0.1925640806555748,
"num_tokens": 29846226.0,
"step": 11775
},
{
"entropy": 6.178399324417114,
"epoch": 1.3594922100403923,
"grad_norm": 0.83984375,
"learning_rate": 0.0004826423932835458,
"loss": 5.8157,
"mean_token_accuracy": 0.19034133553504945,
"num_tokens": 29858483.0,
"step": 11780
},
{
"entropy": 6.2385763168334964,
"epoch": 1.360069244085401,
"grad_norm": 0.82421875,
"learning_rate": 0.00048262649693494653,
"loss": 5.8547,
"mean_token_accuracy": 0.18518402725458144,
"num_tokens": 29871178.0,
"step": 11785
},
{
"entropy": 6.2989908218383786,
"epoch": 1.3606462781304096,
"grad_norm": 0.91015625,
"learning_rate": 0.0004826105936029332,
"loss": 5.9334,
"mean_token_accuracy": 0.17897191941738128,
"num_tokens": 29885477.0,
"step": 11790
},
{
"entropy": 6.24438328742981,
"epoch": 1.3612233121754183,
"grad_norm": 0.83203125,
"learning_rate": 0.0004825946832880406,
"loss": 5.8913,
"mean_token_accuracy": 0.17726410627365113,
"num_tokens": 29897917.0,
"step": 11795
},
{
"entropy": 6.250182342529297,
"epoch": 1.3618003462204271,
"grad_norm": 0.84765625,
"learning_rate": 0.00048257876599080404,
"loss": 5.9065,
"mean_token_accuracy": 0.1838986322283745,
"num_tokens": 29911321.0,
"step": 11800
},
{
"entropy": 6.223178100585938,
"epoch": 1.3623773802654355,
"grad_norm": 0.9453125,
"learning_rate": 0.00048256284171175874,
"loss": 5.8162,
"mean_token_accuracy": 0.1923563465476036,
"num_tokens": 29924651.0,
"step": 11805
},
{
"entropy": 6.130005931854248,
"epoch": 1.3629544143104444,
"grad_norm": 0.859375,
"learning_rate": 0.00048254691045144035,
"loss": 5.7646,
"mean_token_accuracy": 0.19032905250787735,
"num_tokens": 29937334.0,
"step": 11810
},
{
"entropy": 6.1727530002594,
"epoch": 1.363531448355453,
"grad_norm": 0.875,
"learning_rate": 0.0004825309722103848,
"loss": 5.8041,
"mean_token_accuracy": 0.1924701526761055,
"num_tokens": 29949751.0,
"step": 11815
},
{
"entropy": 6.165993022918701,
"epoch": 1.3641084824004617,
"grad_norm": 0.85546875,
"learning_rate": 0.000482515026989128,
"loss": 5.8309,
"mean_token_accuracy": 0.19365983903408052,
"num_tokens": 29961675.0,
"step": 11820
},
{
"entropy": 6.295892810821533,
"epoch": 1.3646855164454703,
"grad_norm": 0.94921875,
"learning_rate": 0.00048249907478820634,
"loss": 5.9528,
"mean_token_accuracy": 0.17994977831840514,
"num_tokens": 29973222.0,
"step": 11825
},
{
"entropy": 6.31345272064209,
"epoch": 1.365262550490479,
"grad_norm": 0.84375,
"learning_rate": 0.00048248311560815637,
"loss": 5.959,
"mean_token_accuracy": 0.17840566635131835,
"num_tokens": 29985845.0,
"step": 11830
},
{
"entropy": 6.251032972335816,
"epoch": 1.3658395845354876,
"grad_norm": 0.890625,
"learning_rate": 0.0004824671494495149,
"loss": 5.895,
"mean_token_accuracy": 0.18573582470417022,
"num_tokens": 29998252.0,
"step": 11835
},
{
"entropy": 6.248889064788818,
"epoch": 1.3664166185804962,
"grad_norm": 0.94921875,
"learning_rate": 0.0004824511763128189,
"loss": 5.861,
"mean_token_accuracy": 0.18926439434289932,
"num_tokens": 30011150.0,
"step": 11840
},
{
"entropy": 6.287919282913208,
"epoch": 1.3669936526255049,
"grad_norm": 0.80078125,
"learning_rate": 0.00048243519619860567,
"loss": 5.9662,
"mean_token_accuracy": 0.17687484472990037,
"num_tokens": 30024750.0,
"step": 11845
},
{
"entropy": 6.197072124481201,
"epoch": 1.3675706866705135,
"grad_norm": 0.8515625,
"learning_rate": 0.0004824192091074126,
"loss": 5.7818,
"mean_token_accuracy": 0.19744647443294525,
"num_tokens": 30038317.0,
"step": 11850
},
{
"entropy": 6.201137447357178,
"epoch": 1.3681477207155222,
"grad_norm": 0.7890625,
"learning_rate": 0.0004824032150397775,
"loss": 5.9135,
"mean_token_accuracy": 0.19055497795343398,
"num_tokens": 30052156.0,
"step": 11855
},
{
"entropy": 6.2688305377960205,
"epoch": 1.3687247547605308,
"grad_norm": 0.91796875,
"learning_rate": 0.00048238721399623824,
"loss": 5.8899,
"mean_token_accuracy": 0.1839185744524002,
"num_tokens": 30063463.0,
"step": 11860
},
{
"entropy": 6.20152473449707,
"epoch": 1.3693017888055397,
"grad_norm": 0.90625,
"learning_rate": 0.00048237120597733316,
"loss": 5.8278,
"mean_token_accuracy": 0.19133645594120025,
"num_tokens": 30075090.0,
"step": 11865
},
{
"entropy": 6.1734706401824955,
"epoch": 1.369878822850548,
"grad_norm": 0.859375,
"learning_rate": 0.0004823551909836005,
"loss": 5.8125,
"mean_token_accuracy": 0.18438569009304046,
"num_tokens": 30087618.0,
"step": 11870
},
{
"entropy": 6.269489002227783,
"epoch": 1.370455856895557,
"grad_norm": 0.90625,
"learning_rate": 0.00048233916901557896,
"loss": 5.847,
"mean_token_accuracy": 0.18638927936553956,
"num_tokens": 30098781.0,
"step": 11875
},
{
"entropy": 6.193616151809692,
"epoch": 1.3710328909405656,
"grad_norm": 0.89453125,
"learning_rate": 0.00048232314007380753,
"loss": 5.8945,
"mean_token_accuracy": 0.1961129903793335,
"num_tokens": 30111163.0,
"step": 11880
},
{
"entropy": 6.20051646232605,
"epoch": 1.3716099249855742,
"grad_norm": 0.8515625,
"learning_rate": 0.00048230710415882524,
"loss": 5.8787,
"mean_token_accuracy": 0.18906668871641158,
"num_tokens": 30124609.0,
"step": 11885
},
{
"entropy": 6.268427467346191,
"epoch": 1.3721869590305829,
"grad_norm": 0.890625,
"learning_rate": 0.00048229106127117144,
"loss": 5.9442,
"mean_token_accuracy": 0.18480219542980195,
"num_tokens": 30137823.0,
"step": 11890
},
{
"entropy": 6.26952748298645,
"epoch": 1.3727639930755915,
"grad_norm": 0.89453125,
"learning_rate": 0.0004822750114113858,
"loss": 5.8328,
"mean_token_accuracy": 0.18708803802728652,
"num_tokens": 30150295.0,
"step": 11895
},
{
"entropy": 6.1457456111907955,
"epoch": 1.3733410271206001,
"grad_norm": 0.90625,
"learning_rate": 0.0004822589545800081,
"loss": 5.8049,
"mean_token_accuracy": 0.18936679661273956,
"num_tokens": 30163533.0,
"step": 11900
},
{
"entropy": 6.278868198394775,
"epoch": 1.3739180611656088,
"grad_norm": 0.87109375,
"learning_rate": 0.0004822428907775784,
"loss": 5.8765,
"mean_token_accuracy": 0.18396926969289779,
"num_tokens": 30176437.0,
"step": 11905
},
{
"entropy": 6.214042472839355,
"epoch": 1.3744950952106174,
"grad_norm": 0.875,
"learning_rate": 0.00048222682000463704,
"loss": 5.803,
"mean_token_accuracy": 0.1939064934849739,
"num_tokens": 30190181.0,
"step": 11910
},
{
"entropy": 6.17984972000122,
"epoch": 1.375072129255626,
"grad_norm": 0.94140625,
"learning_rate": 0.0004822107422617245,
"loss": 5.8492,
"mean_token_accuracy": 0.1890665829181671,
"num_tokens": 30202374.0,
"step": 11915
},
{
"entropy": 6.156255531311035,
"epoch": 1.3756491633006347,
"grad_norm": 0.90234375,
"learning_rate": 0.00048219465754938156,
"loss": 5.7737,
"mean_token_accuracy": 0.18826987594366074,
"num_tokens": 30215009.0,
"step": 11920
},
{
"entropy": 6.279652118682861,
"epoch": 1.3762261973456433,
"grad_norm": 0.8515625,
"learning_rate": 0.00048217856586814926,
"loss": 5.88,
"mean_token_accuracy": 0.18167006224393845,
"num_tokens": 30226688.0,
"step": 11925
},
{
"entropy": 6.277508211135864,
"epoch": 1.376803231390652,
"grad_norm": 0.8984375,
"learning_rate": 0.00048216246721856875,
"loss": 5.9408,
"mean_token_accuracy": 0.18304099887609482,
"num_tokens": 30238501.0,
"step": 11930
},
{
"entropy": 6.257796669006348,
"epoch": 1.3773802654356606,
"grad_norm": 1.7265625,
"learning_rate": 0.00048214636160118164,
"loss": 5.8067,
"mean_token_accuracy": 0.19265892803668977,
"num_tokens": 30250216.0,
"step": 11935
},
{
"entropy": 6.2177825450897215,
"epoch": 1.3779572994806695,
"grad_norm": 0.8671875,
"learning_rate": 0.0004821302490165295,
"loss": 5.8605,
"mean_token_accuracy": 0.18837961107492446,
"num_tokens": 30262555.0,
"step": 11940
},
{
"entropy": 6.170514822006226,
"epoch": 1.378534333525678,
"grad_norm": 0.8125,
"learning_rate": 0.0004821141294651544,
"loss": 5.7819,
"mean_token_accuracy": 0.19309227615594865,
"num_tokens": 30274593.0,
"step": 11945
},
{
"entropy": 6.200426197052002,
"epoch": 1.3791113675706868,
"grad_norm": 0.9140625,
"learning_rate": 0.00048209800294759836,
"loss": 5.7778,
"mean_token_accuracy": 0.19841670393943786,
"num_tokens": 30286579.0,
"step": 11950
},
{
"entropy": 6.261295652389526,
"epoch": 1.3796884016156954,
"grad_norm": 0.87109375,
"learning_rate": 0.0004820818694644039,
"loss": 5.8622,
"mean_token_accuracy": 0.18498462438583374,
"num_tokens": 30299186.0,
"step": 11955
},
{
"entropy": 6.345550584793091,
"epoch": 1.380265435660704,
"grad_norm": 0.875,
"learning_rate": 0.00048206572901611364,
"loss": 5.9244,
"mean_token_accuracy": 0.18031724393367768,
"num_tokens": 30311429.0,
"step": 11960
},
{
"entropy": 6.304241085052491,
"epoch": 1.3808424697057127,
"grad_norm": 0.84765625,
"learning_rate": 0.00048204958160327034,
"loss": 5.8993,
"mean_token_accuracy": 0.18167479634284972,
"num_tokens": 30323323.0,
"step": 11965
},
{
"entropy": 6.236213731765747,
"epoch": 1.3814195037507213,
"grad_norm": 0.8359375,
"learning_rate": 0.00048203342722641726,
"loss": 5.8821,
"mean_token_accuracy": 0.18929619193077088,
"num_tokens": 30335815.0,
"step": 11970
},
{
"entropy": 6.213303899765014,
"epoch": 1.38199653779573,
"grad_norm": 0.9609375,
"learning_rate": 0.00048201726588609776,
"loss": 5.786,
"mean_token_accuracy": 0.18967500627040862,
"num_tokens": 30347426.0,
"step": 11975
},
{
"entropy": 6.25053596496582,
"epoch": 1.3825735718407386,
"grad_norm": 0.82421875,
"learning_rate": 0.00048200109758285534,
"loss": 5.8717,
"mean_token_accuracy": 0.18591604977846146,
"num_tokens": 30359781.0,
"step": 11980
},
{
"entropy": 6.257670783996582,
"epoch": 1.3831506058857472,
"grad_norm": 0.7890625,
"learning_rate": 0.0004819849223172337,
"loss": 5.8721,
"mean_token_accuracy": 0.18719411343336106,
"num_tokens": 30373399.0,
"step": 11985
},
{
"entropy": 6.16593222618103,
"epoch": 1.3837276399307559,
"grad_norm": 0.91015625,
"learning_rate": 0.00048196874008977716,
"loss": 5.8336,
"mean_token_accuracy": 0.1932594060897827,
"num_tokens": 30386296.0,
"step": 11990
},
{
"entropy": 6.265296363830567,
"epoch": 1.3843046739757645,
"grad_norm": 0.93359375,
"learning_rate": 0.0004819525509010298,
"loss": 5.8941,
"mean_token_accuracy": 0.190611732006073,
"num_tokens": 30399496.0,
"step": 11995
},
{
"entropy": 6.225067758560181,
"epoch": 1.3848817080207732,
"grad_norm": 0.84375,
"learning_rate": 0.0004819363547515361,
"loss": 5.7934,
"mean_token_accuracy": 0.188978311419487,
"num_tokens": 30412491.0,
"step": 12000
},
{
"epoch": 1.3848817080207732,
"eval_entropy": 6.072817668204352,
"eval_loss": 5.934172630310059,
"eval_mean_token_accuracy": 0.1899097032309053,
"eval_num_tokens": 30412491.0,
"eval_runtime": 17.6284,
"eval_samples_per_second": 1596.06,
"eval_steps_per_second": 199.508,
"step": 12000
},
{
"entropy": 6.301853895187378,
"epoch": 1.385458742065782,
"grad_norm": 0.80859375,
"learning_rate": 0.000481920151641841,
"loss": 5.9354,
"mean_token_accuracy": 0.18052596896886824,
"num_tokens": 30427600.0,
"step": 12005
},
{
"entropy": 6.260950231552124,
"epoch": 1.3860357761107904,
"grad_norm": 0.87890625,
"learning_rate": 0.00048190394157248935,
"loss": 5.8174,
"mean_token_accuracy": 0.19201486110687255,
"num_tokens": 30440534.0,
"step": 12010
},
{
"entropy": 6.197269535064697,
"epoch": 1.3866128101557993,
"grad_norm": 0.86328125,
"learning_rate": 0.0004818877245440264,
"loss": 5.8068,
"mean_token_accuracy": 0.19823089689016343,
"num_tokens": 30453996.0,
"step": 12015
},
{
"entropy": 6.251287364959717,
"epoch": 1.3871898442008077,
"grad_norm": 0.88671875,
"learning_rate": 0.00048187150055699763,
"loss": 5.8891,
"mean_token_accuracy": 0.18284614086151124,
"num_tokens": 30465667.0,
"step": 12020
},
{
"entropy": 6.2809501647949215,
"epoch": 1.3877668782458166,
"grad_norm": 0.86328125,
"learning_rate": 0.0004818552696119487,
"loss": 5.9209,
"mean_token_accuracy": 0.18133794516324997,
"num_tokens": 30478950.0,
"step": 12025
},
{
"entropy": 6.175559759140015,
"epoch": 1.3883439122908252,
"grad_norm": 0.9609375,
"learning_rate": 0.0004818390317094255,
"loss": 5.7649,
"mean_token_accuracy": 0.19492525309324266,
"num_tokens": 30490979.0,
"step": 12030
},
{
"entropy": 6.242245292663574,
"epoch": 1.3889209463358339,
"grad_norm": 0.87890625,
"learning_rate": 0.0004818227868499742,
"loss": 5.8052,
"mean_token_accuracy": 0.19470774233341218,
"num_tokens": 30504242.0,
"step": 12035
},
{
"entropy": 6.216363430023193,
"epoch": 1.3894979803808425,
"grad_norm": 0.921875,
"learning_rate": 0.0004818065350341412,
"loss": 5.9003,
"mean_token_accuracy": 0.18019478619098664,
"num_tokens": 30515739.0,
"step": 12040
},
{
"entropy": 6.287183237075806,
"epoch": 1.3900750144258511,
"grad_norm": 0.98046875,
"learning_rate": 0.00048179027626247325,
"loss": 5.8576,
"mean_token_accuracy": 0.18424582928419114,
"num_tokens": 30528338.0,
"step": 12045
},
{
"entropy": 6.294361686706543,
"epoch": 1.3906520484708598,
"grad_norm": 0.87890625,
"learning_rate": 0.0004817740105355169,
"loss": 5.9078,
"mean_token_accuracy": 0.18659729063510894,
"num_tokens": 30540572.0,
"step": 12050
},
{
"entropy": 6.259363889694214,
"epoch": 1.3912290825158684,
"grad_norm": 0.84765625,
"learning_rate": 0.00048175773785381947,
"loss": 5.9115,
"mean_token_accuracy": 0.1899486929178238,
"num_tokens": 30554317.0,
"step": 12055
},
{
"entropy": 6.24990553855896,
"epoch": 1.391806116560877,
"grad_norm": 0.95703125,
"learning_rate": 0.00048174145821792833,
"loss": 5.8755,
"mean_token_accuracy": 0.1851966544985771,
"num_tokens": 30567177.0,
"step": 12060
},
{
"entropy": 6.32722430229187,
"epoch": 1.3923831506058857,
"grad_norm": 0.97265625,
"learning_rate": 0.0004817251716283908,
"loss": 5.8673,
"mean_token_accuracy": 0.18701709061861038,
"num_tokens": 30577948.0,
"step": 12065
},
{
"entropy": 6.19557638168335,
"epoch": 1.3929601846508943,
"grad_norm": 0.91015625,
"learning_rate": 0.0004817088780857548,
"loss": 5.8476,
"mean_token_accuracy": 0.18737161308526992,
"num_tokens": 30590548.0,
"step": 12070
},
{
"entropy": 6.2240033626556395,
"epoch": 1.393537218695903,
"grad_norm": 0.8828125,
"learning_rate": 0.00048169257759056845,
"loss": 5.7913,
"mean_token_accuracy": 0.19839557707309724,
"num_tokens": 30602735.0,
"step": 12075
},
{
"entropy": 6.259526157379151,
"epoch": 1.3941142527409118,
"grad_norm": 0.87890625,
"learning_rate": 0.00048167627014337994,
"loss": 5.9117,
"mean_token_accuracy": 0.18355602622032166,
"num_tokens": 30615112.0,
"step": 12080
},
{
"entropy": 6.180841445922852,
"epoch": 1.3946912867859202,
"grad_norm": 0.953125,
"learning_rate": 0.00048165995574473764,
"loss": 5.835,
"mean_token_accuracy": 0.1852560117840767,
"num_tokens": 30627406.0,
"step": 12085
},
{
"entropy": 6.213917303085327,
"epoch": 1.395268320830929,
"grad_norm": 0.95703125,
"learning_rate": 0.00048164363439519043,
"loss": 5.8516,
"mean_token_accuracy": 0.19082715213298798,
"num_tokens": 30639764.0,
"step": 12090
},
{
"entropy": 6.253957509994507,
"epoch": 1.3958453548759377,
"grad_norm": 0.90234375,
"learning_rate": 0.0004816273060952873,
"loss": 5.8598,
"mean_token_accuracy": 0.18492789268493653,
"num_tokens": 30652181.0,
"step": 12095
},
{
"entropy": 6.233830738067627,
"epoch": 1.3964223889209464,
"grad_norm": 0.91015625,
"learning_rate": 0.00048161097084557726,
"loss": 5.8424,
"mean_token_accuracy": 0.18780053853988649,
"num_tokens": 30663586.0,
"step": 12100
},
{
"entropy": 6.323609018325806,
"epoch": 1.396999422965955,
"grad_norm": 0.92578125,
"learning_rate": 0.00048159462864660993,
"loss": 5.9321,
"mean_token_accuracy": 0.18068586885929108,
"num_tokens": 30676218.0,
"step": 12105
},
{
"entropy": 6.298351240158081,
"epoch": 1.3975764570109637,
"grad_norm": 0.84765625,
"learning_rate": 0.0004815782794989348,
"loss": 5.9088,
"mean_token_accuracy": 0.1828354611992836,
"num_tokens": 30688532.0,
"step": 12110
},
{
"entropy": 6.219765090942383,
"epoch": 1.3981534910559723,
"grad_norm": 0.984375,
"learning_rate": 0.0004815619234031019,
"loss": 5.8698,
"mean_token_accuracy": 0.1810378611087799,
"num_tokens": 30700698.0,
"step": 12115
},
{
"entropy": 6.214390087127685,
"epoch": 1.398730525100981,
"grad_norm": 0.84375,
"learning_rate": 0.0004815455603596613,
"loss": 5.8682,
"mean_token_accuracy": 0.1863407924771309,
"num_tokens": 30713032.0,
"step": 12120
},
{
"entropy": 6.20099720954895,
"epoch": 1.3993075591459896,
"grad_norm": 0.890625,
"learning_rate": 0.0004815291903691634,
"loss": 5.8065,
"mean_token_accuracy": 0.19326940029859543,
"num_tokens": 30726829.0,
"step": 12125
},
{
"entropy": 6.300219249725342,
"epoch": 1.3998845931909982,
"grad_norm": 0.890625,
"learning_rate": 0.00048151281343215873,
"loss": 5.9029,
"mean_token_accuracy": 0.1824083521962166,
"num_tokens": 30740280.0,
"step": 12130
},
{
"entropy": 6.16341199874878,
"epoch": 1.4004616272360069,
"grad_norm": 0.90625,
"learning_rate": 0.0004814964295491982,
"loss": 5.7467,
"mean_token_accuracy": 0.19635725021362305,
"num_tokens": 30753467.0,
"step": 12135
},
{
"entropy": 6.192393827438354,
"epoch": 1.4010386612810155,
"grad_norm": 0.890625,
"learning_rate": 0.00048148003872083286,
"loss": 5.8313,
"mean_token_accuracy": 0.19740188717842103,
"num_tokens": 30766958.0,
"step": 12140
},
{
"entropy": 6.251896476745605,
"epoch": 1.4016156953260244,
"grad_norm": 0.8984375,
"learning_rate": 0.00048146364094761384,
"loss": 5.9156,
"mean_token_accuracy": 0.18174671679735183,
"num_tokens": 30779114.0,
"step": 12145
},
{
"entropy": 6.271113157272339,
"epoch": 1.4021927293710328,
"grad_norm": 0.9765625,
"learning_rate": 0.00048144723623009297,
"loss": 5.813,
"mean_token_accuracy": 0.1902441129088402,
"num_tokens": 30792063.0,
"step": 12150
},
{
"entropy": 6.254286670684815,
"epoch": 1.4027697634160416,
"grad_norm": 0.8515625,
"learning_rate": 0.0004814308245688218,
"loss": 5.8958,
"mean_token_accuracy": 0.18653863221406936,
"num_tokens": 30804404.0,
"step": 12155
},
{
"entropy": 6.170608806610107,
"epoch": 1.40334679746105,
"grad_norm": 0.85546875,
"learning_rate": 0.00048141440596435235,
"loss": 5.8196,
"mean_token_accuracy": 0.19177932739257814,
"num_tokens": 30817607.0,
"step": 12160
},
{
"entropy": 6.21555871963501,
"epoch": 1.403923831506059,
"grad_norm": 0.8203125,
"learning_rate": 0.0004813979804172369,
"loss": 5.893,
"mean_token_accuracy": 0.18380023390054703,
"num_tokens": 30831077.0,
"step": 12165
},
{
"entropy": 6.276795530319214,
"epoch": 1.4045008655510676,
"grad_norm": 0.875,
"learning_rate": 0.00048138154792802795,
"loss": 5.983,
"mean_token_accuracy": 0.18137128055095672,
"num_tokens": 30844096.0,
"step": 12170
},
{
"entropy": 6.295123624801636,
"epoch": 1.4050778995960762,
"grad_norm": 0.91015625,
"learning_rate": 0.0004813651084972781,
"loss": 5.8887,
"mean_token_accuracy": 0.18827279955148696,
"num_tokens": 30856147.0,
"step": 12175
},
{
"entropy": 6.258724975585937,
"epoch": 1.4056549336410848,
"grad_norm": 0.8828125,
"learning_rate": 0.00048134866212554036,
"loss": 5.8853,
"mean_token_accuracy": 0.17940700948238372,
"num_tokens": 30869436.0,
"step": 12180
},
{
"entropy": 6.209239101409912,
"epoch": 1.4062319676860935,
"grad_norm": 0.84375,
"learning_rate": 0.0004813322088133679,
"loss": 5.8189,
"mean_token_accuracy": 0.19204139113426208,
"num_tokens": 30882313.0,
"step": 12185
},
{
"entropy": 6.2562541484832765,
"epoch": 1.4068090017311021,
"grad_norm": 0.89453125,
"learning_rate": 0.00048131574856131407,
"loss": 5.8396,
"mean_token_accuracy": 0.1857314497232437,
"num_tokens": 30895062.0,
"step": 12190
},
{
"entropy": 6.227566480636597,
"epoch": 1.4073860357761108,
"grad_norm": 0.91796875,
"learning_rate": 0.0004812992813699324,
"loss": 5.8386,
"mean_token_accuracy": 0.18683320432901382,
"num_tokens": 30907736.0,
"step": 12195
},
{
"entropy": 6.220577239990234,
"epoch": 1.4079630698211194,
"grad_norm": 0.875,
"learning_rate": 0.000481282807239777,
"loss": 5.8431,
"mean_token_accuracy": 0.19073092341423034,
"num_tokens": 30920462.0,
"step": 12200
},
{
"entropy": 6.217762279510498,
"epoch": 1.408540103866128,
"grad_norm": 0.87890625,
"learning_rate": 0.0004812663261714019,
"loss": 5.7836,
"mean_token_accuracy": 0.19252836406230928,
"num_tokens": 30933501.0,
"step": 12205
},
{
"entropy": 6.223458099365234,
"epoch": 1.4091171379111367,
"grad_norm": 0.9140625,
"learning_rate": 0.0004812498381653613,
"loss": 5.7691,
"mean_token_accuracy": 0.19711357057094575,
"num_tokens": 30944780.0,
"step": 12210
},
{
"entropy": 6.21431188583374,
"epoch": 1.4096941719561453,
"grad_norm": 0.89453125,
"learning_rate": 0.0004812333432222098,
"loss": 5.8125,
"mean_token_accuracy": 0.19472504109144212,
"num_tokens": 30957730.0,
"step": 12215
},
{
"entropy": 6.009715795516968,
"epoch": 1.4102712060011542,
"grad_norm": 0.91796875,
"learning_rate": 0.0004812168413425023,
"loss": 5.6882,
"mean_token_accuracy": 0.20412740260362625,
"num_tokens": 30969371.0,
"step": 12220
},
{
"entropy": 6.231176328659058,
"epoch": 1.4108482400461626,
"grad_norm": 0.8359375,
"learning_rate": 0.00048120033252679374,
"loss": 5.8924,
"mean_token_accuracy": 0.18615046590566636,
"num_tokens": 30983662.0,
"step": 12225
},
{
"entropy": 6.312102746963501,
"epoch": 1.4114252740911715,
"grad_norm": 0.8828125,
"learning_rate": 0.00048118381677563946,
"loss": 5.8878,
"mean_token_accuracy": 0.18438036888837814,
"num_tokens": 30995641.0,
"step": 12230
},
{
"entropy": 6.28008394241333,
"epoch": 1.41200230813618,
"grad_norm": 0.91796875,
"learning_rate": 0.0004811672940895949,
"loss": 5.9443,
"mean_token_accuracy": 0.18446469008922578,
"num_tokens": 31008508.0,
"step": 12235
},
{
"entropy": 6.293724393844604,
"epoch": 1.4125793421811887,
"grad_norm": 0.890625,
"learning_rate": 0.0004811507644692158,
"loss": 5.9187,
"mean_token_accuracy": 0.18171917498111725,
"num_tokens": 31020903.0,
"step": 12240
},
{
"entropy": 6.257511377334595,
"epoch": 1.4131563762261974,
"grad_norm": 0.80859375,
"learning_rate": 0.0004811342279150581,
"loss": 5.8593,
"mean_token_accuracy": 0.190650050342083,
"num_tokens": 31033668.0,
"step": 12245
},
{
"entropy": 6.258108806610108,
"epoch": 1.413733410271206,
"grad_norm": 0.87109375,
"learning_rate": 0.0004811176844276781,
"loss": 5.9092,
"mean_token_accuracy": 0.1842113733291626,
"num_tokens": 31046980.0,
"step": 12250
},
{
"entropy": 6.205495929718017,
"epoch": 1.4143104443162147,
"grad_norm": 0.8359375,
"learning_rate": 0.0004811011340076322,
"loss": 5.8128,
"mean_token_accuracy": 0.186430487036705,
"num_tokens": 31059023.0,
"step": 12255
},
{
"entropy": 6.267776298522949,
"epoch": 1.4148874783612233,
"grad_norm": 0.93359375,
"learning_rate": 0.00048108457665547695,
"loss": 5.8526,
"mean_token_accuracy": 0.18937126398086548,
"num_tokens": 31070449.0,
"step": 12260
},
{
"entropy": 6.198201084136963,
"epoch": 1.415464512406232,
"grad_norm": 0.9140625,
"learning_rate": 0.0004810680123717694,
"loss": 5.8053,
"mean_token_accuracy": 0.19537163823843,
"num_tokens": 31081974.0,
"step": 12265
},
{
"entropy": 6.23746509552002,
"epoch": 1.4160415464512406,
"grad_norm": 0.90625,
"learning_rate": 0.0004810514411570666,
"loss": 5.8773,
"mean_token_accuracy": 0.18206487745046615,
"num_tokens": 31094825.0,
"step": 12270
},
{
"entropy": 6.164452695846558,
"epoch": 1.4166185804962492,
"grad_norm": 0.9140625,
"learning_rate": 0.0004810348630119259,
"loss": 5.8424,
"mean_token_accuracy": 0.18676037788391114,
"num_tokens": 31106589.0,
"step": 12275
},
{
"entropy": 6.306876564025879,
"epoch": 1.4171956145412579,
"grad_norm": 0.88671875,
"learning_rate": 0.00048101827793690493,
"loss": 5.8616,
"mean_token_accuracy": 0.17967692017555237,
"num_tokens": 31118228.0,
"step": 12280
},
{
"entropy": 6.314551591873169,
"epoch": 1.4177726485862667,
"grad_norm": 0.93359375,
"learning_rate": 0.0004810016859325615,
"loss": 5.9554,
"mean_token_accuracy": 0.18243657797574997,
"num_tokens": 31131396.0,
"step": 12285
},
{
"entropy": 6.237841653823852,
"epoch": 1.4183496826312751,
"grad_norm": 0.87109375,
"learning_rate": 0.0004809850869994537,
"loss": 5.8619,
"mean_token_accuracy": 0.1885082244873047,
"num_tokens": 31145524.0,
"step": 12290
},
{
"entropy": 6.274528551101684,
"epoch": 1.418926716676284,
"grad_norm": 0.9296875,
"learning_rate": 0.0004809684811381398,
"loss": 5.8248,
"mean_token_accuracy": 0.1977459728717804,
"num_tokens": 31157866.0,
"step": 12295
},
{
"entropy": 6.155285167694092,
"epoch": 1.4195037507212924,
"grad_norm": 0.85546875,
"learning_rate": 0.0004809518683491785,
"loss": 5.7666,
"mean_token_accuracy": 0.19823187589645386,
"num_tokens": 31170634.0,
"step": 12300
},
{
"entropy": 6.192041683197021,
"epoch": 1.4200807847663013,
"grad_norm": 0.88671875,
"learning_rate": 0.00048093524863312823,
"loss": 5.8119,
"mean_token_accuracy": 0.18903475552797316,
"num_tokens": 31183585.0,
"step": 12305
},
{
"entropy": 6.261973333358765,
"epoch": 1.42065781881131,
"grad_norm": 0.90234375,
"learning_rate": 0.0004809186219905482,
"loss": 5.8426,
"mean_token_accuracy": 0.18727468997240065,
"num_tokens": 31196375.0,
"step": 12310
},
{
"entropy": 6.18221230506897,
"epoch": 1.4212348528563186,
"grad_norm": 0.87890625,
"learning_rate": 0.0004809019884219976,
"loss": 5.8249,
"mean_token_accuracy": 0.19580861926078796,
"num_tokens": 31209797.0,
"step": 12315
},
{
"entropy": 6.166803169250488,
"epoch": 1.4218118869013272,
"grad_norm": 0.94921875,
"learning_rate": 0.00048088534792803595,
"loss": 5.7396,
"mean_token_accuracy": 0.19430786818265916,
"num_tokens": 31221196.0,
"step": 12320
},
{
"entropy": 6.259878826141358,
"epoch": 1.4223889209463358,
"grad_norm": 0.96875,
"learning_rate": 0.00048086870050922286,
"loss": 5.8522,
"mean_token_accuracy": 0.18935182839632034,
"num_tokens": 31234126.0,
"step": 12325
},
{
"entropy": 6.252271556854248,
"epoch": 1.4229659549913445,
"grad_norm": 0.86328125,
"learning_rate": 0.00048085204616611833,
"loss": 5.873,
"mean_token_accuracy": 0.18678005188703536,
"num_tokens": 31245933.0,
"step": 12330
},
{
"entropy": 6.192243480682373,
"epoch": 1.4235429890363531,
"grad_norm": 0.87890625,
"learning_rate": 0.00048083538489928246,
"loss": 5.8689,
"mean_token_accuracy": 0.18617866486310958,
"num_tokens": 31258734.0,
"step": 12335
},
{
"entropy": 6.227387714385986,
"epoch": 1.4241200230813618,
"grad_norm": 0.9296875,
"learning_rate": 0.0004808187167092757,
"loss": 5.7521,
"mean_token_accuracy": 0.18657746613025666,
"num_tokens": 31272487.0,
"step": 12340
},
{
"entropy": 6.213850641250611,
"epoch": 1.4246970571263704,
"grad_norm": 0.87890625,
"learning_rate": 0.0004808020415966586,
"loss": 5.8346,
"mean_token_accuracy": 0.18490028977394105,
"num_tokens": 31285117.0,
"step": 12345
},
{
"entropy": 6.222880744934082,
"epoch": 1.425274091171379,
"grad_norm": 0.85546875,
"learning_rate": 0.000480785359561992,
"loss": 5.809,
"mean_token_accuracy": 0.19161065220832824,
"num_tokens": 31297772.0,
"step": 12350
},
{
"entropy": 6.2099446773529055,
"epoch": 1.4258511252163877,
"grad_norm": 0.9296875,
"learning_rate": 0.00048076867060583704,
"loss": 5.8379,
"mean_token_accuracy": 0.1893964871764183,
"num_tokens": 31310901.0,
"step": 12355
},
{
"entropy": 6.23720760345459,
"epoch": 1.4264281592613965,
"grad_norm": 0.99609375,
"learning_rate": 0.0004807519747287551,
"loss": 5.8364,
"mean_token_accuracy": 0.18434469103813172,
"num_tokens": 31323090.0,
"step": 12360
},
{
"entropy": 6.192369842529297,
"epoch": 1.427005193306405,
"grad_norm": 0.87890625,
"learning_rate": 0.0004807352719313078,
"loss": 5.7538,
"mean_token_accuracy": 0.1981295555830002,
"num_tokens": 31335883.0,
"step": 12365
},
{
"entropy": 6.29363317489624,
"epoch": 1.4275822273514138,
"grad_norm": 0.97265625,
"learning_rate": 0.0004807185622140567,
"loss": 5.9025,
"mean_token_accuracy": 0.18681400418281555,
"num_tokens": 31348237.0,
"step": 12370
},
{
"entropy": 6.159489631652832,
"epoch": 1.4281592613964225,
"grad_norm": 0.92578125,
"learning_rate": 0.00048070184557756396,
"loss": 5.7452,
"mean_token_accuracy": 0.1910381242632866,
"num_tokens": 31360414.0,
"step": 12375
},
{
"entropy": 6.228966617584229,
"epoch": 1.428736295441431,
"grad_norm": 0.94921875,
"learning_rate": 0.00048068512202239177,
"loss": 5.8706,
"mean_token_accuracy": 0.18762275874614714,
"num_tokens": 31372765.0,
"step": 12380
},
{
"entropy": 6.2343464374542235,
"epoch": 1.4293133294864397,
"grad_norm": 0.93359375,
"learning_rate": 0.0004806683915491028,
"loss": 5.8246,
"mean_token_accuracy": 0.19126800447702408,
"num_tokens": 31386176.0,
"step": 12385
},
{
"entropy": 6.275753688812256,
"epoch": 1.4298903635314484,
"grad_norm": 0.95703125,
"learning_rate": 0.0004806516541582596,
"loss": 5.9217,
"mean_token_accuracy": 0.1823081776499748,
"num_tokens": 31398385.0,
"step": 12390
},
{
"entropy": 6.1845824241638185,
"epoch": 1.430467397576457,
"grad_norm": 0.80078125,
"learning_rate": 0.00048063490985042506,
"loss": 5.768,
"mean_token_accuracy": 0.1930743232369423,
"num_tokens": 31410841.0,
"step": 12395
},
{
"entropy": 6.193290281295776,
"epoch": 1.4310444316214657,
"grad_norm": 0.92578125,
"learning_rate": 0.0004806181586261626,
"loss": 5.7982,
"mean_token_accuracy": 0.19314497709274292,
"num_tokens": 31425586.0,
"step": 12400
},
{
"entropy": 6.232039213180542,
"epoch": 1.4316214656664743,
"grad_norm": 0.8984375,
"learning_rate": 0.00048060140048603544,
"loss": 5.8241,
"mean_token_accuracy": 0.19228676557540894,
"num_tokens": 31438943.0,
"step": 12405
},
{
"entropy": 6.189572191238403,
"epoch": 1.432198499711483,
"grad_norm": 0.91796875,
"learning_rate": 0.0004805846354306073,
"loss": 5.7794,
"mean_token_accuracy": 0.19570462852716447,
"num_tokens": 31452284.0,
"step": 12410
},
{
"entropy": 6.265307140350342,
"epoch": 1.4327755337564916,
"grad_norm": 0.93359375,
"learning_rate": 0.00048056786346044214,
"loss": 5.9258,
"mean_token_accuracy": 0.1752777561545372,
"num_tokens": 31466311.0,
"step": 12415
},
{
"entropy": 6.276501178741455,
"epoch": 1.4333525678015002,
"grad_norm": 0.9140625,
"learning_rate": 0.00048055108457610395,
"loss": 5.7913,
"mean_token_accuracy": 0.19310199171304704,
"num_tokens": 31478916.0,
"step": 12420
},
{
"entropy": 6.2271256923675535,
"epoch": 1.4339296018465089,
"grad_norm": 0.8515625,
"learning_rate": 0.0004805342987781571,
"loss": 5.8388,
"mean_token_accuracy": 0.18540789186954498,
"num_tokens": 31490337.0,
"step": 12425
},
{
"entropy": 6.191142988204956,
"epoch": 1.4345066358915175,
"grad_norm": 0.93359375,
"learning_rate": 0.0004805175060671663,
"loss": 5.837,
"mean_token_accuracy": 0.1861076056957245,
"num_tokens": 31502625.0,
"step": 12430
},
{
"entropy": 6.269933652877808,
"epoch": 1.4350836699365264,
"grad_norm": 0.8671875,
"learning_rate": 0.0004805007064436962,
"loss": 5.8688,
"mean_token_accuracy": 0.18913554698228835,
"num_tokens": 31515440.0,
"step": 12435
},
{
"entropy": 6.261519908905029,
"epoch": 1.4356607039815348,
"grad_norm": 0.9375,
"learning_rate": 0.0004804838999083119,
"loss": 5.8387,
"mean_token_accuracy": 0.18860826641321182,
"num_tokens": 31527812.0,
"step": 12440
},
{
"entropy": 6.2459697246551515,
"epoch": 1.4362377380265436,
"grad_norm": 0.98828125,
"learning_rate": 0.0004804670864615787,
"loss": 5.8288,
"mean_token_accuracy": 0.18852628469467164,
"num_tokens": 31540249.0,
"step": 12445
},
{
"entropy": 6.170604562759399,
"epoch": 1.4368147720715523,
"grad_norm": 0.86328125,
"learning_rate": 0.00048045026610406223,
"loss": 5.7808,
"mean_token_accuracy": 0.19519326835870743,
"num_tokens": 31552312.0,
"step": 12450
},
{
"entropy": 6.271270418167115,
"epoch": 1.437391806116561,
"grad_norm": 0.890625,
"learning_rate": 0.000480433438836328,
"loss": 5.8401,
"mean_token_accuracy": 0.1857555016875267,
"num_tokens": 31564496.0,
"step": 12455
},
{
"entropy": 6.26390962600708,
"epoch": 1.4379688401615696,
"grad_norm": 0.87890625,
"learning_rate": 0.00048041660465894206,
"loss": 5.8391,
"mean_token_accuracy": 0.18578193783760072,
"num_tokens": 31577705.0,
"step": 12460
},
{
"entropy": 6.277010202407837,
"epoch": 1.4385458742065782,
"grad_norm": 0.8984375,
"learning_rate": 0.0004803997635724707,
"loss": 5.8735,
"mean_token_accuracy": 0.1823616862297058,
"num_tokens": 31589566.0,
"step": 12465
},
{
"entropy": 6.256769752502441,
"epoch": 1.4391229082515868,
"grad_norm": 0.8359375,
"learning_rate": 0.0004803829155774804,
"loss": 5.8826,
"mean_token_accuracy": 0.1852583885192871,
"num_tokens": 31602379.0,
"step": 12470
},
{
"entropy": 6.250380563735962,
"epoch": 1.4396999422965955,
"grad_norm": 0.85546875,
"learning_rate": 0.0004803660606745377,
"loss": 5.8274,
"mean_token_accuracy": 0.19224091172218322,
"num_tokens": 31615469.0,
"step": 12475
},
{
"entropy": 6.2556861400604244,
"epoch": 1.4402769763416041,
"grad_norm": 0.9140625,
"learning_rate": 0.00048034919886420953,
"loss": 5.932,
"mean_token_accuracy": 0.18619346469640732,
"num_tokens": 31627129.0,
"step": 12480
},
{
"entropy": 6.294282674789429,
"epoch": 1.4408540103866128,
"grad_norm": 0.859375,
"learning_rate": 0.00048033233014706304,
"loss": 5.8952,
"mean_token_accuracy": 0.18746394217014312,
"num_tokens": 31639564.0,
"step": 12485
},
{
"entropy": 6.1616355895996096,
"epoch": 1.4414310444316214,
"grad_norm": 0.875,
"learning_rate": 0.00048031545452366565,
"loss": 5.8522,
"mean_token_accuracy": 0.18221624940633774,
"num_tokens": 31651984.0,
"step": 12490
},
{
"entropy": 6.274483489990234,
"epoch": 1.44200807847663,
"grad_norm": 0.9140625,
"learning_rate": 0.00048029857199458493,
"loss": 5.8248,
"mean_token_accuracy": 0.1933693617582321,
"num_tokens": 31664850.0,
"step": 12495
},
{
"entropy": 6.172151279449463,
"epoch": 1.442585112521639,
"grad_norm": 0.93359375,
"learning_rate": 0.00048028168256038873,
"loss": 5.8083,
"mean_token_accuracy": 0.19690240025520325,
"num_tokens": 31676993.0,
"step": 12500
},
{
"entropy": 6.241194343566894,
"epoch": 1.4431621465666473,
"grad_norm": 0.9453125,
"learning_rate": 0.00048026478622164513,
"loss": 5.9103,
"mean_token_accuracy": 0.19012573957443238,
"num_tokens": 31689632.0,
"step": 12505
},
{
"entropy": 6.277917289733887,
"epoch": 1.4437391806116562,
"grad_norm": 0.92578125,
"learning_rate": 0.00048024788297892234,
"loss": 5.8514,
"mean_token_accuracy": 0.18539552241563798,
"num_tokens": 31701610.0,
"step": 12510
},
{
"entropy": 6.220233011245727,
"epoch": 1.4443162146566648,
"grad_norm": 0.90625,
"learning_rate": 0.000480230972832789,
"loss": 5.8238,
"mean_token_accuracy": 0.18775998800992966,
"num_tokens": 31713838.0,
"step": 12515
},
{
"entropy": 6.17543592453003,
"epoch": 1.4448932487016735,
"grad_norm": 0.9296875,
"learning_rate": 0.00048021405578381384,
"loss": 5.78,
"mean_token_accuracy": 0.19356610178947448,
"num_tokens": 31726097.0,
"step": 12520
},
{
"entropy": 6.206122636795044,
"epoch": 1.445470282746682,
"grad_norm": 0.8515625,
"learning_rate": 0.0004801971318325659,
"loss": 5.8184,
"mean_token_accuracy": 0.1879914492368698,
"num_tokens": 31739646.0,
"step": 12525
},
{
"entropy": 6.21998233795166,
"epoch": 1.4460473167916907,
"grad_norm": 0.87890625,
"learning_rate": 0.0004801802009796142,
"loss": 5.8003,
"mean_token_accuracy": 0.19319549351930618,
"num_tokens": 31752161.0,
"step": 12530
},
{
"entropy": 6.206159591674805,
"epoch": 1.4466243508366994,
"grad_norm": 0.83984375,
"learning_rate": 0.0004801632632255285,
"loss": 5.8059,
"mean_token_accuracy": 0.18725275844335557,
"num_tokens": 31764498.0,
"step": 12535
},
{
"entropy": 6.285904359817505,
"epoch": 1.447201384881708,
"grad_norm": 0.9453125,
"learning_rate": 0.0004801463185708783,
"loss": 5.8608,
"mean_token_accuracy": 0.18627117872238158,
"num_tokens": 31776453.0,
"step": 12540
},
{
"entropy": 6.210245609283447,
"epoch": 1.4477784189267167,
"grad_norm": 0.95703125,
"learning_rate": 0.00048012936701623363,
"loss": 5.9274,
"mean_token_accuracy": 0.18175046145915985,
"num_tokens": 31789761.0,
"step": 12545
},
{
"entropy": 6.2855147361755375,
"epoch": 1.4483554529717253,
"grad_norm": 0.8515625,
"learning_rate": 0.00048011240856216456,
"loss": 5.9142,
"mean_token_accuracy": 0.18825961649417877,
"num_tokens": 31802689.0,
"step": 12550
},
{
"entropy": 6.23141303062439,
"epoch": 1.448932487016734,
"grad_norm": 0.93359375,
"learning_rate": 0.00048009544320924154,
"loss": 5.8918,
"mean_token_accuracy": 0.18411456793546677,
"num_tokens": 31816768.0,
"step": 12555
},
{
"entropy": 6.213440322875977,
"epoch": 1.4495095210617426,
"grad_norm": 0.875,
"learning_rate": 0.0004800784709580351,
"loss": 5.8276,
"mean_token_accuracy": 0.1924056515097618,
"num_tokens": 31828920.0,
"step": 12560
},
{
"entropy": 6.235508108139038,
"epoch": 1.4500865551067512,
"grad_norm": 0.98828125,
"learning_rate": 0.0004800614918091161,
"loss": 5.8868,
"mean_token_accuracy": 0.18438960909843444,
"num_tokens": 31841467.0,
"step": 12565
},
{
"entropy": 6.269950532913208,
"epoch": 1.4506635891517599,
"grad_norm": 0.97265625,
"learning_rate": 0.0004800445057630558,
"loss": 5.8879,
"mean_token_accuracy": 0.18824739307165145,
"num_tokens": 31855254.0,
"step": 12570
},
{
"entropy": 6.227955436706543,
"epoch": 1.4512406231967687,
"grad_norm": 0.87890625,
"learning_rate": 0.0004800275128204254,
"loss": 5.823,
"mean_token_accuracy": 0.1889019101858139,
"num_tokens": 31868234.0,
"step": 12575
},
{
"entropy": 6.259027624130249,
"epoch": 1.4518176572417771,
"grad_norm": 0.83984375,
"learning_rate": 0.00048001051298179637,
"loss": 5.8882,
"mean_token_accuracy": 0.19090647697448732,
"num_tokens": 31880014.0,
"step": 12580
},
{
"entropy": 6.228473424911499,
"epoch": 1.452394691286786,
"grad_norm": 0.92578125,
"learning_rate": 0.0004799935062477407,
"loss": 5.8329,
"mean_token_accuracy": 0.18438107669353485,
"num_tokens": 31892019.0,
"step": 12585
},
{
"entropy": 6.267324924468994,
"epoch": 1.4529717253317946,
"grad_norm": 0.9140625,
"learning_rate": 0.00047997649261883013,
"loss": 5.8476,
"mean_token_accuracy": 0.18466779142618178,
"num_tokens": 31905837.0,
"step": 12590
},
{
"entropy": 6.244672107696533,
"epoch": 1.4535487593768033,
"grad_norm": 0.953125,
"learning_rate": 0.0004799594720956371,
"loss": 5.8252,
"mean_token_accuracy": 0.18755768984556198,
"num_tokens": 31917823.0,
"step": 12595
},
{
"entropy": 6.280782175064087,
"epoch": 1.454125793421812,
"grad_norm": 0.90234375,
"learning_rate": 0.00047994244467873407,
"loss": 5.8977,
"mean_token_accuracy": 0.1816701665520668,
"num_tokens": 31931221.0,
"step": 12600
},
{
"entropy": 6.224785327911377,
"epoch": 1.4547028274668206,
"grad_norm": 1.0,
"learning_rate": 0.00047992541036869364,
"loss": 5.8497,
"mean_token_accuracy": 0.18835566192865372,
"num_tokens": 31943739.0,
"step": 12605
},
{
"entropy": 6.2321693897247314,
"epoch": 1.4552798615118292,
"grad_norm": 0.85546875,
"learning_rate": 0.0004799083691660889,
"loss": 5.9111,
"mean_token_accuracy": 0.1834364727139473,
"num_tokens": 31957805.0,
"step": 12610
},
{
"entropy": 6.254454278945923,
"epoch": 1.4558568955568378,
"grad_norm": 0.92578125,
"learning_rate": 0.0004798913210714929,
"loss": 5.8623,
"mean_token_accuracy": 0.19286692887544632,
"num_tokens": 31970983.0,
"step": 12615
},
{
"entropy": 6.22641954421997,
"epoch": 1.4564339296018465,
"grad_norm": 0.9375,
"learning_rate": 0.00047987426608547915,
"loss": 5.8475,
"mean_token_accuracy": 0.19006728231906891,
"num_tokens": 31982985.0,
"step": 12620
},
{
"entropy": 6.202101469039917,
"epoch": 1.4570109636468551,
"grad_norm": 0.890625,
"learning_rate": 0.0004798572042086212,
"loss": 5.8051,
"mean_token_accuracy": 0.18875966370105743,
"num_tokens": 31994854.0,
"step": 12625
},
{
"entropy": 6.293975305557251,
"epoch": 1.4575879976918638,
"grad_norm": 0.8984375,
"learning_rate": 0.00047984013544149286,
"loss": 5.9473,
"mean_token_accuracy": 0.178886578977108,
"num_tokens": 32007476.0,
"step": 12630
},
{
"entropy": 6.299429178237915,
"epoch": 1.4581650317368724,
"grad_norm": 0.90625,
"learning_rate": 0.00047982305978466836,
"loss": 5.8671,
"mean_token_accuracy": 0.19250797629356384,
"num_tokens": 32021417.0,
"step": 12635
},
{
"entropy": 6.179995727539063,
"epoch": 1.4587420657818813,
"grad_norm": 0.9296875,
"learning_rate": 0.00047980597723872205,
"loss": 5.8372,
"mean_token_accuracy": 0.18427969366312028,
"num_tokens": 32033997.0,
"step": 12640
},
{
"entropy": 6.194073438644409,
"epoch": 1.4593190998268897,
"grad_norm": 0.90234375,
"learning_rate": 0.0004797888878042283,
"loss": 5.8245,
"mean_token_accuracy": 0.1968119978904724,
"num_tokens": 32046797.0,
"step": 12645
},
{
"entropy": 6.255892372131347,
"epoch": 1.4598961338718985,
"grad_norm": 0.89453125,
"learning_rate": 0.00047977179148176217,
"loss": 5.8042,
"mean_token_accuracy": 0.19345609843730927,
"num_tokens": 32060797.0,
"step": 12650
},
{
"entropy": 6.2575019836425785,
"epoch": 1.4604731679169072,
"grad_norm": 1.0546875,
"learning_rate": 0.0004797546882718985,
"loss": 5.913,
"mean_token_accuracy": 0.18159203082323075,
"num_tokens": 32073936.0,
"step": 12655
},
{
"entropy": 6.197871112823487,
"epoch": 1.4610502019619158,
"grad_norm": 0.8046875,
"learning_rate": 0.00047973757817521256,
"loss": 5.7969,
"mean_token_accuracy": 0.1944518953561783,
"num_tokens": 32086730.0,
"step": 12660
},
{
"entropy": 6.288273477554322,
"epoch": 1.4616272360069245,
"grad_norm": 0.87890625,
"learning_rate": 0.0004797204611922799,
"loss": 5.888,
"mean_token_accuracy": 0.18709647357463838,
"num_tokens": 32099201.0,
"step": 12665
},
{
"entropy": 6.1809022426605225,
"epoch": 1.462204270051933,
"grad_norm": 0.8984375,
"learning_rate": 0.00047970333732367626,
"loss": 5.8571,
"mean_token_accuracy": 0.1861635446548462,
"num_tokens": 32112475.0,
"step": 12670
},
{
"entropy": 6.263620090484619,
"epoch": 1.4627813040969417,
"grad_norm": 0.890625,
"learning_rate": 0.00047968620656997754,
"loss": 5.8877,
"mean_token_accuracy": 0.1819758251309395,
"num_tokens": 32124411.0,
"step": 12675
},
{
"entropy": 6.225598430633545,
"epoch": 1.4633583381419504,
"grad_norm": 0.8515625,
"learning_rate": 0.00047966906893175994,
"loss": 5.8729,
"mean_token_accuracy": 0.19142432063817977,
"num_tokens": 32136665.0,
"step": 12680
},
{
"entropy": 6.324308729171753,
"epoch": 1.463935372186959,
"grad_norm": 0.85546875,
"learning_rate": 0.0004796519244095998,
"loss": 5.8716,
"mean_token_accuracy": 0.1902136892080307,
"num_tokens": 32149546.0,
"step": 12685
},
{
"entropy": 6.188792324066162,
"epoch": 1.4645124062319677,
"grad_norm": 0.96875,
"learning_rate": 0.00047963477300407394,
"loss": 5.8044,
"mean_token_accuracy": 0.18858650773763658,
"num_tokens": 32161327.0,
"step": 12690
},
{
"entropy": 6.267832660675049,
"epoch": 1.4650894402769763,
"grad_norm": 0.89453125,
"learning_rate": 0.00047961761471575903,
"loss": 5.808,
"mean_token_accuracy": 0.18862345516681672,
"num_tokens": 32173678.0,
"step": 12695
},
{
"entropy": 6.154121351242066,
"epoch": 1.465666474321985,
"grad_norm": 0.85546875,
"learning_rate": 0.00047960044954523237,
"loss": 5.7554,
"mean_token_accuracy": 0.1918697848916054,
"num_tokens": 32186834.0,
"step": 12700
},
{
"entropy": 6.250173807144165,
"epoch": 1.4662435083669936,
"grad_norm": 0.8828125,
"learning_rate": 0.00047958327749307117,
"loss": 5.8994,
"mean_token_accuracy": 0.18794130235910417,
"num_tokens": 32198876.0,
"step": 12705
},
{
"entropy": 6.236554574966431,
"epoch": 1.4668205424120022,
"grad_norm": 1.078125,
"learning_rate": 0.00047956609855985305,
"loss": 5.7503,
"mean_token_accuracy": 0.19117399752140046,
"num_tokens": 32212190.0,
"step": 12710
},
{
"entropy": 6.200174570083618,
"epoch": 1.467397576457011,
"grad_norm": 0.89453125,
"learning_rate": 0.0004795489127461559,
"loss": 5.7932,
"mean_token_accuracy": 0.19743801206350325,
"num_tokens": 32226129.0,
"step": 12715
},
{
"entropy": 6.19217324256897,
"epoch": 1.4679746105020195,
"grad_norm": 0.87890625,
"learning_rate": 0.00047953172005255756,
"loss": 5.8725,
"mean_token_accuracy": 0.1850110799074173,
"num_tokens": 32240116.0,
"step": 12720
},
{
"entropy": 6.265895223617553,
"epoch": 1.4685516445470284,
"grad_norm": 0.90625,
"learning_rate": 0.0004795145204796365,
"loss": 5.7838,
"mean_token_accuracy": 0.1934996247291565,
"num_tokens": 32252781.0,
"step": 12725
},
{
"entropy": 6.201068782806397,
"epoch": 1.469128678592037,
"grad_norm": 0.91015625,
"learning_rate": 0.0004794973140279711,
"loss": 5.7902,
"mean_token_accuracy": 0.192179936170578,
"num_tokens": 32265625.0,
"step": 12730
},
{
"entropy": 6.210565710067749,
"epoch": 1.4697057126370456,
"grad_norm": 0.94140625,
"learning_rate": 0.00047948010069814005,
"loss": 5.8399,
"mean_token_accuracy": 0.19595302790403366,
"num_tokens": 32278942.0,
"step": 12735
},
{
"entropy": 6.247366428375244,
"epoch": 1.4702827466820543,
"grad_norm": 0.8984375,
"learning_rate": 0.0004794628804907225,
"loss": 5.8417,
"mean_token_accuracy": 0.19263463318347931,
"num_tokens": 32292085.0,
"step": 12740
},
{
"entropy": 6.258548021316528,
"epoch": 1.470859780727063,
"grad_norm": 0.94921875,
"learning_rate": 0.00047944565340629755,
"loss": 5.882,
"mean_token_accuracy": 0.19039649814367293,
"num_tokens": 32303880.0,
"step": 12745
},
{
"entropy": 6.15313949584961,
"epoch": 1.4714368147720716,
"grad_norm": 0.9609375,
"learning_rate": 0.00047942841944544453,
"loss": 5.7886,
"mean_token_accuracy": 0.1929144263267517,
"num_tokens": 32315711.0,
"step": 12750
},
{
"entropy": 6.289398336410523,
"epoch": 1.4720138488170802,
"grad_norm": 0.97265625,
"learning_rate": 0.0004794111786087431,
"loss": 5.8802,
"mean_token_accuracy": 0.18687772899866104,
"num_tokens": 32329344.0,
"step": 12755
},
{
"entropy": 6.329669618606568,
"epoch": 1.4725908828620888,
"grad_norm": 3.171875,
"learning_rate": 0.0004793939308967733,
"loss": 5.8453,
"mean_token_accuracy": 0.18983658850193025,
"num_tokens": 32343335.0,
"step": 12760
},
{
"entropy": 6.150098705291748,
"epoch": 1.4731679169070975,
"grad_norm": 0.86328125,
"learning_rate": 0.0004793766763101152,
"loss": 5.7208,
"mean_token_accuracy": 0.19836216270923615,
"num_tokens": 32357663.0,
"step": 12765
},
{
"entropy": 6.231173849105835,
"epoch": 1.4737449509521061,
"grad_norm": 0.91015625,
"learning_rate": 0.00047935941484934905,
"loss": 5.8432,
"mean_token_accuracy": 0.1936136767268181,
"num_tokens": 32369310.0,
"step": 12770
},
{
"entropy": 6.182768821716309,
"epoch": 1.4743219849971148,
"grad_norm": 0.94140625,
"learning_rate": 0.00047934214651505547,
"loss": 5.8167,
"mean_token_accuracy": 0.19123019874095917,
"num_tokens": 32381478.0,
"step": 12775
},
{
"entropy": 6.159084224700928,
"epoch": 1.4748990190421236,
"grad_norm": 0.93359375,
"learning_rate": 0.00047932487130781533,
"loss": 5.7626,
"mean_token_accuracy": 0.20197259783744811,
"num_tokens": 32394697.0,
"step": 12780
},
{
"entropy": 6.140364646911621,
"epoch": 1.475476053087132,
"grad_norm": 0.9296875,
"learning_rate": 0.0004793075892282097,
"loss": 5.7113,
"mean_token_accuracy": 0.1971853882074356,
"num_tokens": 32405456.0,
"step": 12785
},
{
"entropy": 6.184367847442627,
"epoch": 1.476053087132141,
"grad_norm": 0.90234375,
"learning_rate": 0.0004792903002768197,
"loss": 5.831,
"mean_token_accuracy": 0.18514325618743896,
"num_tokens": 32416772.0,
"step": 12790
},
{
"entropy": 6.148500156402588,
"epoch": 1.4766301211771495,
"grad_norm": 0.91015625,
"learning_rate": 0.00047927300445422687,
"loss": 5.7444,
"mean_token_accuracy": 0.19996704906225204,
"num_tokens": 32429319.0,
"step": 12795
},
{
"entropy": 6.150080442428589,
"epoch": 1.4772071552221582,
"grad_norm": 0.93359375,
"learning_rate": 0.0004792557017610131,
"loss": 5.7314,
"mean_token_accuracy": 0.20687794983386992,
"num_tokens": 32442017.0,
"step": 12800
},
{
"entropy": 6.148825454711914,
"epoch": 1.4777841892671668,
"grad_norm": 0.9140625,
"learning_rate": 0.00047923839219776027,
"loss": 5.7583,
"mean_token_accuracy": 0.1933480203151703,
"num_tokens": 32454255.0,
"step": 12805
},
{
"entropy": 6.160013580322266,
"epoch": 1.4783612233121755,
"grad_norm": 0.86328125,
"learning_rate": 0.0004792210757650506,
"loss": 5.7797,
"mean_token_accuracy": 0.1943795472383499,
"num_tokens": 32465471.0,
"step": 12810
},
{
"entropy": 6.197701454162598,
"epoch": 1.478938257357184,
"grad_norm": 0.9140625,
"learning_rate": 0.00047920375246346636,
"loss": 5.8182,
"mean_token_accuracy": 0.187069371342659,
"num_tokens": 32478271.0,
"step": 12815
},
{
"entropy": 6.247473955154419,
"epoch": 1.4795152914021927,
"grad_norm": 0.98046875,
"learning_rate": 0.00047918642229359044,
"loss": 5.8331,
"mean_token_accuracy": 0.18895274102687837,
"num_tokens": 32490239.0,
"step": 12820
},
{
"entropy": 6.2366992950439455,
"epoch": 1.4800923254472014,
"grad_norm": 0.99609375,
"learning_rate": 0.0004791690852560056,
"loss": 5.8719,
"mean_token_accuracy": 0.18945563733577728,
"num_tokens": 32503511.0,
"step": 12825
},
{
"entropy": 6.193121337890625,
"epoch": 1.48066935949221,
"grad_norm": 0.88671875,
"learning_rate": 0.000479151741351295,
"loss": 5.8729,
"mean_token_accuracy": 0.1820230945944786,
"num_tokens": 32515652.0,
"step": 12830
},
{
"entropy": 6.272677850723267,
"epoch": 1.4812463935372187,
"grad_norm": 0.9453125,
"learning_rate": 0.000479134390580042,
"loss": 5.8576,
"mean_token_accuracy": 0.18222525715827942,
"num_tokens": 32527620.0,
"step": 12835
},
{
"entropy": 6.333395481109619,
"epoch": 1.4818234275822273,
"grad_norm": 0.91015625,
"learning_rate": 0.00047911703294283015,
"loss": 5.8595,
"mean_token_accuracy": 0.1895024448633194,
"num_tokens": 32540948.0,
"step": 12840
},
{
"entropy": 6.189630079269409,
"epoch": 1.482400461627236,
"grad_norm": 0.859375,
"learning_rate": 0.00047909966844024334,
"loss": 5.8242,
"mean_token_accuracy": 0.19464778155088425,
"num_tokens": 32553311.0,
"step": 12845
},
{
"entropy": 6.1735701084136965,
"epoch": 1.4829774956722446,
"grad_norm": 0.9375,
"learning_rate": 0.00047908229707286547,
"loss": 5.7488,
"mean_token_accuracy": 0.1950527086853981,
"num_tokens": 32564639.0,
"step": 12850
},
{
"entropy": 6.22589693069458,
"epoch": 1.4835545297172534,
"grad_norm": 0.921875,
"learning_rate": 0.000479064918841281,
"loss": 5.8654,
"mean_token_accuracy": 0.1862518757581711,
"num_tokens": 32577255.0,
"step": 12855
},
{
"entropy": 6.181830739974975,
"epoch": 1.4841315637622619,
"grad_norm": 0.87109375,
"learning_rate": 0.00047904753374607427,
"loss": 5.8111,
"mean_token_accuracy": 0.19516809582710265,
"num_tokens": 32590201.0,
"step": 12860
},
{
"entropy": 6.255477809906006,
"epoch": 1.4847085978072707,
"grad_norm": 1.1328125,
"learning_rate": 0.00047903014178783015,
"loss": 5.7877,
"mean_token_accuracy": 0.18771864622831344,
"num_tokens": 32603010.0,
"step": 12865
},
{
"entropy": 6.286900043487549,
"epoch": 1.4852856318522794,
"grad_norm": 0.94140625,
"learning_rate": 0.0004790127429671335,
"loss": 5.8502,
"mean_token_accuracy": 0.1860107198357582,
"num_tokens": 32614579.0,
"step": 12870
},
{
"entropy": 6.219177675247193,
"epoch": 1.485862665897288,
"grad_norm": 1.015625,
"learning_rate": 0.0004789953372845697,
"loss": 5.7603,
"mean_token_accuracy": 0.1955152302980423,
"num_tokens": 32627696.0,
"step": 12875
},
{
"entropy": 6.239347314834594,
"epoch": 1.4864396999422966,
"grad_norm": 0.89453125,
"learning_rate": 0.000478977924740724,
"loss": 5.9017,
"mean_token_accuracy": 0.18081731498241424,
"num_tokens": 32640824.0,
"step": 12880
},
{
"entropy": 6.249517917633057,
"epoch": 1.4870167339873053,
"grad_norm": 0.890625,
"learning_rate": 0.0004789605053361821,
"loss": 5.789,
"mean_token_accuracy": 0.19380044490098952,
"num_tokens": 32654373.0,
"step": 12885
},
{
"entropy": 6.3021715641021725,
"epoch": 1.487593768032314,
"grad_norm": 0.85546875,
"learning_rate": 0.0004789430790715299,
"loss": 5.9189,
"mean_token_accuracy": 0.182830311357975,
"num_tokens": 32667717.0,
"step": 12890
},
{
"entropy": 6.217434310913086,
"epoch": 1.4881708020773226,
"grad_norm": 0.84765625,
"learning_rate": 0.00047892564594735355,
"loss": 5.8393,
"mean_token_accuracy": 0.18886099755764008,
"num_tokens": 32681529.0,
"step": 12895
},
{
"entropy": 6.300730133056641,
"epoch": 1.4887478361223312,
"grad_norm": 0.8828125,
"learning_rate": 0.00047890820596423943,
"loss": 5.9136,
"mean_token_accuracy": 0.18771759420633316,
"num_tokens": 32694883.0,
"step": 12900
},
{
"entropy": 6.236034631729126,
"epoch": 1.4893248701673398,
"grad_norm": 0.8984375,
"learning_rate": 0.000478890759122774,
"loss": 5.7976,
"mean_token_accuracy": 0.19470180720090866,
"num_tokens": 32706908.0,
"step": 12905
},
{
"entropy": 6.279126119613648,
"epoch": 1.4899019042123485,
"grad_norm": 1.0234375,
"learning_rate": 0.0004788733054235443,
"loss": 5.8185,
"mean_token_accuracy": 0.18948618620634078,
"num_tokens": 32720057.0,
"step": 12910
},
{
"entropy": 6.199473190307617,
"epoch": 1.4904789382573571,
"grad_norm": 0.94140625,
"learning_rate": 0.00047885584486713717,
"loss": 5.823,
"mean_token_accuracy": 0.19341208040714264,
"num_tokens": 32732200.0,
"step": 12915
},
{
"entropy": 6.187557029724121,
"epoch": 1.491055972302366,
"grad_norm": 0.88671875,
"learning_rate": 0.0004788383774541399,
"loss": 5.7755,
"mean_token_accuracy": 0.20056941658258437,
"num_tokens": 32745144.0,
"step": 12920
},
{
"entropy": 6.1955255508422855,
"epoch": 1.4916330063473744,
"grad_norm": 0.90234375,
"learning_rate": 0.0004788209031851402,
"loss": 5.8306,
"mean_token_accuracy": 0.19000527113676072,
"num_tokens": 32757495.0,
"step": 12925
},
{
"entropy": 6.109148597717285,
"epoch": 1.4922100403923833,
"grad_norm": 1.0390625,
"learning_rate": 0.0004788034220607256,
"loss": 5.7325,
"mean_token_accuracy": 0.1950483053922653,
"num_tokens": 32769562.0,
"step": 12930
},
{
"entropy": 6.2173021793365475,
"epoch": 1.4927870744373917,
"grad_norm": 0.92578125,
"learning_rate": 0.00047878593408148405,
"loss": 5.7953,
"mean_token_accuracy": 0.19607421159744262,
"num_tokens": 32782234.0,
"step": 12935
},
{
"entropy": 6.2127049446105955,
"epoch": 1.4933641084824005,
"grad_norm": 0.90234375,
"learning_rate": 0.00047876843924800393,
"loss": 5.8,
"mean_token_accuracy": 0.18992753624916076,
"num_tokens": 32795274.0,
"step": 12940
},
{
"entropy": 6.185367918014526,
"epoch": 1.4939411425274092,
"grad_norm": 0.96875,
"learning_rate": 0.0004787509375608735,
"loss": 5.7714,
"mean_token_accuracy": 0.19010636657476426,
"num_tokens": 32808338.0,
"step": 12945
},
{
"entropy": 6.238684892654419,
"epoch": 1.4945181765724178,
"grad_norm": 0.8828125,
"learning_rate": 0.00047873342902068157,
"loss": 5.8263,
"mean_token_accuracy": 0.18555284589529036,
"num_tokens": 32820204.0,
"step": 12950
},
{
"entropy": 6.266605186462402,
"epoch": 1.4950952106174265,
"grad_norm": 0.87890625,
"learning_rate": 0.00047871591362801694,
"loss": 5.8544,
"mean_token_accuracy": 0.18671264350414277,
"num_tokens": 32832998.0,
"step": 12955
},
{
"entropy": 6.13381404876709,
"epoch": 1.495672244662435,
"grad_norm": 0.9375,
"learning_rate": 0.0004786983913834687,
"loss": 5.8379,
"mean_token_accuracy": 0.188638374209404,
"num_tokens": 32845484.0,
"step": 12960
},
{
"entropy": 6.316340970993042,
"epoch": 1.4962492787074437,
"grad_norm": 0.83984375,
"learning_rate": 0.00047868086228762633,
"loss": 5.9324,
"mean_token_accuracy": 0.18515325337648392,
"num_tokens": 32857718.0,
"step": 12965
},
{
"entropy": 6.281667041778564,
"epoch": 1.4968263127524524,
"grad_norm": 0.87109375,
"learning_rate": 0.00047866332634107926,
"loss": 5.8123,
"mean_token_accuracy": 0.19124829024076462,
"num_tokens": 32869908.0,
"step": 12970
},
{
"entropy": 6.1783287525177,
"epoch": 1.497403346797461,
"grad_norm": 0.88671875,
"learning_rate": 0.00047864578354441743,
"loss": 5.8322,
"mean_token_accuracy": 0.19004736691713334,
"num_tokens": 32882549.0,
"step": 12975
},
{
"entropy": 6.186053657531739,
"epoch": 1.4979803808424696,
"grad_norm": 0.89453125,
"learning_rate": 0.0004786282338982308,
"loss": 5.773,
"mean_token_accuracy": 0.1942482754588127,
"num_tokens": 32894587.0,
"step": 12980
},
{
"entropy": 6.266414165496826,
"epoch": 1.4985574148874783,
"grad_norm": 0.9453125,
"learning_rate": 0.0004786106774031096,
"loss": 5.8358,
"mean_token_accuracy": 0.1882964327931404,
"num_tokens": 32907001.0,
"step": 12985
},
{
"entropy": 6.235092544555664,
"epoch": 1.499134448932487,
"grad_norm": 0.88671875,
"learning_rate": 0.0004785931140596445,
"loss": 5.8035,
"mean_token_accuracy": 0.19003380984067916,
"num_tokens": 32919498.0,
"step": 12990
},
{
"entropy": 6.293325567245484,
"epoch": 1.4997114829774958,
"grad_norm": 0.8984375,
"learning_rate": 0.00047857554386842606,
"loss": 5.9188,
"mean_token_accuracy": 0.18067218661308287,
"num_tokens": 32932611.0,
"step": 12995
},
{
"entropy": 6.19683198928833,
"epoch": 1.5002885170225042,
"grad_norm": 0.96875,
"learning_rate": 0.00047855796683004534,
"loss": 5.7998,
"mean_token_accuracy": 0.18689163625240326,
"num_tokens": 32944845.0,
"step": 13000
},
{
"entropy": 6.271070766448974,
"epoch": 1.500865551067513,
"grad_norm": 0.90234375,
"learning_rate": 0.00047854038294509356,
"loss": 5.8457,
"mean_token_accuracy": 0.17760048061609268,
"num_tokens": 32958076.0,
"step": 13005
},
{
"entropy": 6.289440774917603,
"epoch": 1.5014425851125215,
"grad_norm": 0.90625,
"learning_rate": 0.0004785227922141621,
"loss": 5.8597,
"mean_token_accuracy": 0.19118052423000337,
"num_tokens": 32968984.0,
"step": 13010
},
{
"entropy": 6.310905838012696,
"epoch": 1.5020196191575304,
"grad_norm": 0.875,
"learning_rate": 0.00047850519463784263,
"loss": 5.9457,
"mean_token_accuracy": 0.1839376851916313,
"num_tokens": 32981488.0,
"step": 13015
},
{
"entropy": 6.229884433746338,
"epoch": 1.502596653202539,
"grad_norm": 0.94921875,
"learning_rate": 0.00047848759021672693,
"loss": 5.8199,
"mean_token_accuracy": 0.19131330102682115,
"num_tokens": 32994156.0,
"step": 13020
},
{
"entropy": 6.235915327072144,
"epoch": 1.5031736872475476,
"grad_norm": 0.86328125,
"learning_rate": 0.0004784699789514073,
"loss": 5.8013,
"mean_token_accuracy": 0.18914027214050294,
"num_tokens": 33007135.0,
"step": 13025
},
{
"entropy": 6.28277621269226,
"epoch": 1.5037507212925563,
"grad_norm": 0.859375,
"learning_rate": 0.000478452360842476,
"loss": 5.9116,
"mean_token_accuracy": 0.18403880894184113,
"num_tokens": 33021259.0,
"step": 13030
},
{
"entropy": 6.236955165863037,
"epoch": 1.504327755337565,
"grad_norm": 0.87109375,
"learning_rate": 0.00047843473589052557,
"loss": 5.84,
"mean_token_accuracy": 0.18680391758680343,
"num_tokens": 33033690.0,
"step": 13035
},
{
"entropy": 6.26040506362915,
"epoch": 1.5049047893825735,
"grad_norm": 0.99609375,
"learning_rate": 0.00047841710409614893,
"loss": 5.823,
"mean_token_accuracy": 0.1852077528834343,
"num_tokens": 33045744.0,
"step": 13040
},
{
"entropy": 6.271863794326782,
"epoch": 1.5054818234275822,
"grad_norm": 0.9765625,
"learning_rate": 0.0004783994654599389,
"loss": 5.8906,
"mean_token_accuracy": 0.17971572130918503,
"num_tokens": 33058307.0,
"step": 13045
},
{
"entropy": 6.303907442092895,
"epoch": 1.5060588574725908,
"grad_norm": 0.8828125,
"learning_rate": 0.00047838181998248897,
"loss": 5.9115,
"mean_token_accuracy": 0.181523796916008,
"num_tokens": 33073622.0,
"step": 13050
},
{
"entropy": 6.216773843765258,
"epoch": 1.5066358915175995,
"grad_norm": 0.85546875,
"learning_rate": 0.0004783641676643925,
"loss": 5.7545,
"mean_token_accuracy": 0.19235570430755616,
"num_tokens": 33087286.0,
"step": 13055
},
{
"entropy": 6.204124641418457,
"epoch": 1.5072129255626083,
"grad_norm": 0.79296875,
"learning_rate": 0.00047834650850624334,
"loss": 5.8409,
"mean_token_accuracy": 0.19425424188375473,
"num_tokens": 33100333.0,
"step": 13060
},
{
"entropy": 6.163000631332397,
"epoch": 1.5077899596076167,
"grad_norm": 0.90625,
"learning_rate": 0.0004783288425086353,
"loss": 5.8379,
"mean_token_accuracy": 0.18831825852394105,
"num_tokens": 33111318.0,
"step": 13065
},
{
"entropy": 6.296581697463989,
"epoch": 1.5083669936526256,
"grad_norm": 1.3984375,
"learning_rate": 0.0004783111696721627,
"loss": 5.9124,
"mean_token_accuracy": 0.1840219795703888,
"num_tokens": 33123766.0,
"step": 13070
},
{
"entropy": 6.241482782363891,
"epoch": 1.508944027697634,
"grad_norm": 0.94140625,
"learning_rate": 0.0004782934899974199,
"loss": 5.7843,
"mean_token_accuracy": 0.19748201221227646,
"num_tokens": 33136042.0,
"step": 13075
},
{
"entropy": 6.191297292709351,
"epoch": 1.5095210617426429,
"grad_norm": 0.92578125,
"learning_rate": 0.00047827580348500147,
"loss": 5.7749,
"mean_token_accuracy": 0.19063863754272461,
"num_tokens": 33148451.0,
"step": 13080
},
{
"entropy": 6.206788158416748,
"epoch": 1.5100980957876513,
"grad_norm": 0.8515625,
"learning_rate": 0.00047825811013550246,
"loss": 5.8011,
"mean_token_accuracy": 0.19754028767347337,
"num_tokens": 33161886.0,
"step": 13085
},
{
"entropy": 6.217094087600708,
"epoch": 1.5106751298326602,
"grad_norm": 0.921875,
"learning_rate": 0.00047824040994951786,
"loss": 5.8841,
"mean_token_accuracy": 0.19206815510988234,
"num_tokens": 33174812.0,
"step": 13090
},
{
"entropy": 6.256129360198974,
"epoch": 1.5112521638776688,
"grad_norm": 0.90625,
"learning_rate": 0.0004782227029276429,
"loss": 5.8011,
"mean_token_accuracy": 0.1992778956890106,
"num_tokens": 33187389.0,
"step": 13095
},
{
"entropy": 6.154243993759155,
"epoch": 1.5118291979226774,
"grad_norm": 0.94140625,
"learning_rate": 0.00047820498907047345,
"loss": 5.7544,
"mean_token_accuracy": 0.19293652325868607,
"num_tokens": 33200106.0,
"step": 13100
},
{
"entropy": 6.208034801483154,
"epoch": 1.512406231967686,
"grad_norm": 1.4296875,
"learning_rate": 0.000478187268378605,
"loss": 5.7489,
"mean_token_accuracy": 0.19893669188022614,
"num_tokens": 33212929.0,
"step": 13105
},
{
"entropy": 6.18809814453125,
"epoch": 1.5129832660126947,
"grad_norm": 0.9375,
"learning_rate": 0.00047816954085263375,
"loss": 5.8521,
"mean_token_accuracy": 0.19083169847726822,
"num_tokens": 33226068.0,
"step": 13110
},
{
"entropy": 6.156454467773438,
"epoch": 1.5135603000577034,
"grad_norm": 0.90234375,
"learning_rate": 0.0004781518064931559,
"loss": 5.7753,
"mean_token_accuracy": 0.19173873215913773,
"num_tokens": 33237677.0,
"step": 13115
},
{
"entropy": 6.252213764190674,
"epoch": 1.514137334102712,
"grad_norm": 0.9140625,
"learning_rate": 0.000478134065300768,
"loss": 5.8582,
"mean_token_accuracy": 0.1917392447590828,
"num_tokens": 33250640.0,
"step": 13120
},
{
"entropy": 6.208042573928833,
"epoch": 1.5147143681477209,
"grad_norm": 0.8828125,
"learning_rate": 0.0004781163172760667,
"loss": 5.785,
"mean_token_accuracy": 0.1916109725832939,
"num_tokens": 33262899.0,
"step": 13125
},
{
"entropy": 6.271803617477417,
"epoch": 1.5152914021927293,
"grad_norm": 1.0,
"learning_rate": 0.00047809856241964893,
"loss": 5.8185,
"mean_token_accuracy": 0.19186412245035173,
"num_tokens": 33275073.0,
"step": 13130
},
{
"entropy": 6.194020318984985,
"epoch": 1.5158684362377381,
"grad_norm": 0.87890625,
"learning_rate": 0.0004780808007321119,
"loss": 5.8097,
"mean_token_accuracy": 0.18588352501392363,
"num_tokens": 33286285.0,
"step": 13135
},
{
"entropy": 6.280729103088379,
"epoch": 1.5164454702827466,
"grad_norm": 0.91796875,
"learning_rate": 0.0004780630322140531,
"loss": 5.8053,
"mean_token_accuracy": 0.19529957920312882,
"num_tokens": 33297745.0,
"step": 13140
},
{
"entropy": 6.28461332321167,
"epoch": 1.5170225043277554,
"grad_norm": 0.875,
"learning_rate": 0.00047804525686607,
"loss": 5.862,
"mean_token_accuracy": 0.17993441820144654,
"num_tokens": 33309463.0,
"step": 13145
},
{
"entropy": 6.230080080032349,
"epoch": 1.5175995383727638,
"grad_norm": 0.8984375,
"learning_rate": 0.0004780274746887606,
"loss": 5.8296,
"mean_token_accuracy": 0.18709089905023574,
"num_tokens": 33322352.0,
"step": 13150
},
{
"entropy": 6.254903411865234,
"epoch": 1.5181765724177727,
"grad_norm": 0.890625,
"learning_rate": 0.00047800968568272284,
"loss": 5.8897,
"mean_token_accuracy": 0.1886549025774002,
"num_tokens": 33336051.0,
"step": 13155
},
{
"entropy": 6.218223762512207,
"epoch": 1.5187536064627813,
"grad_norm": 0.86328125,
"learning_rate": 0.0004779918898485551,
"loss": 5.8053,
"mean_token_accuracy": 0.18849124908447265,
"num_tokens": 33350321.0,
"step": 13160
},
{
"entropy": 6.225475931167603,
"epoch": 1.51933064050779,
"grad_norm": 0.84375,
"learning_rate": 0.00047797408718685614,
"loss": 5.7767,
"mean_token_accuracy": 0.19050310999155046,
"num_tokens": 33363637.0,
"step": 13165
},
{
"entropy": 6.214481449127197,
"epoch": 1.5199076745527986,
"grad_norm": 0.91015625,
"learning_rate": 0.00047795627769822447,
"loss": 5.7798,
"mean_token_accuracy": 0.19742291122674943,
"num_tokens": 33376257.0,
"step": 13170
},
{
"entropy": 6.135192155838013,
"epoch": 1.5204847085978073,
"grad_norm": 0.84765625,
"learning_rate": 0.00047793846138325925,
"loss": 5.7453,
"mean_token_accuracy": 0.1947900339961052,
"num_tokens": 33388812.0,
"step": 13175
},
{
"entropy": 6.2147955894470215,
"epoch": 1.521061742642816,
"grad_norm": 0.89453125,
"learning_rate": 0.0004779206382425598,
"loss": 5.8117,
"mean_token_accuracy": 0.1930110424757004,
"num_tokens": 33401141.0,
"step": 13180
},
{
"entropy": 6.252952575683594,
"epoch": 1.5216387766878245,
"grad_norm": 0.9609375,
"learning_rate": 0.0004779028082767253,
"loss": 5.8197,
"mean_token_accuracy": 0.19050996899604797,
"num_tokens": 33412821.0,
"step": 13185
},
{
"entropy": 6.212389230728149,
"epoch": 1.5222158107328332,
"grad_norm": 0.95703125,
"learning_rate": 0.0004778849714863557,
"loss": 5.8589,
"mean_token_accuracy": 0.183637772500515,
"num_tokens": 33424709.0,
"step": 13190
},
{
"entropy": 6.235611343383789,
"epoch": 1.5227928447778418,
"grad_norm": 0.88671875,
"learning_rate": 0.0004778671278720508,
"loss": 5.8681,
"mean_token_accuracy": 0.186078442633152,
"num_tokens": 33437069.0,
"step": 13195
},
{
"entropy": 6.228446388244629,
"epoch": 1.5233698788228507,
"grad_norm": 0.94140625,
"learning_rate": 0.0004778492774344109,
"loss": 5.7122,
"mean_token_accuracy": 0.19611677676439285,
"num_tokens": 33449441.0,
"step": 13200
},
{
"entropy": 6.274533605575561,
"epoch": 1.523946912867859,
"grad_norm": 1.0078125,
"learning_rate": 0.0004778314201740363,
"loss": 5.8927,
"mean_token_accuracy": 0.1851292923092842,
"num_tokens": 33463184.0,
"step": 13205
},
{
"entropy": 6.205833292007446,
"epoch": 1.524523946912868,
"grad_norm": 0.87890625,
"learning_rate": 0.00047781355609152764,
"loss": 5.7542,
"mean_token_accuracy": 0.19649343192577362,
"num_tokens": 33476118.0,
"step": 13210
},
{
"entropy": 6.192588806152344,
"epoch": 1.5251009809578764,
"grad_norm": 0.91796875,
"learning_rate": 0.0004777956851874858,
"loss": 5.7489,
"mean_token_accuracy": 0.1931898131966591,
"num_tokens": 33487575.0,
"step": 13215
},
{
"entropy": 6.272642326354981,
"epoch": 1.5256780150028852,
"grad_norm": 0.96875,
"learning_rate": 0.00047777780746251176,
"loss": 5.8292,
"mean_token_accuracy": 0.18742457628250123,
"num_tokens": 33499507.0,
"step": 13220
},
{
"entropy": 6.195057535171509,
"epoch": 1.5262550490478937,
"grad_norm": 0.94140625,
"learning_rate": 0.00047775992291720687,
"loss": 5.8102,
"mean_token_accuracy": 0.19332896620035173,
"num_tokens": 33513818.0,
"step": 13225
},
{
"entropy": 6.250328063964844,
"epoch": 1.5268320830929025,
"grad_norm": 1.0,
"learning_rate": 0.0004777420315521728,
"loss": 5.8313,
"mean_token_accuracy": 0.186712084710598,
"num_tokens": 33525762.0,
"step": 13230
},
{
"entropy": 6.17367377281189,
"epoch": 1.5274091171379112,
"grad_norm": 1.2265625,
"learning_rate": 0.0004777241333680111,
"loss": 5.7218,
"mean_token_accuracy": 0.198297181725502,
"num_tokens": 33537469.0,
"step": 13235
},
{
"entropy": 6.186795091629028,
"epoch": 1.5279861511829198,
"grad_norm": 0.82421875,
"learning_rate": 0.0004777062283653239,
"loss": 5.8291,
"mean_token_accuracy": 0.19145113229751587,
"num_tokens": 33550226.0,
"step": 13240
},
{
"entropy": 6.280914831161499,
"epoch": 1.5285631852279284,
"grad_norm": 0.91015625,
"learning_rate": 0.00047768831654471333,
"loss": 5.8919,
"mean_token_accuracy": 0.18494420349597931,
"num_tokens": 33564164.0,
"step": 13245
},
{
"entropy": 6.200793647766114,
"epoch": 1.529140219272937,
"grad_norm": 0.89453125,
"learning_rate": 0.00047767039790678204,
"loss": 5.7056,
"mean_token_accuracy": 0.19484343230724335,
"num_tokens": 33576295.0,
"step": 13250
},
{
"entropy": 6.15148024559021,
"epoch": 1.5297172533179457,
"grad_norm": 0.9609375,
"learning_rate": 0.00047765247245213255,
"loss": 5.708,
"mean_token_accuracy": 0.20231665521860123,
"num_tokens": 33587950.0,
"step": 13255
},
{
"entropy": 6.191800355911255,
"epoch": 1.5302942873629544,
"grad_norm": 0.921875,
"learning_rate": 0.0004776345401813678,
"loss": 5.8057,
"mean_token_accuracy": 0.19851236641407013,
"num_tokens": 33600201.0,
"step": 13260
},
{
"entropy": 6.243471622467041,
"epoch": 1.5308713214079632,
"grad_norm": 0.87109375,
"learning_rate": 0.00047761660109509095,
"loss": 5.8596,
"mean_token_accuracy": 0.19617122262716294,
"num_tokens": 33612355.0,
"step": 13265
},
{
"entropy": 6.280506610870361,
"epoch": 1.5314483554529716,
"grad_norm": 0.921875,
"learning_rate": 0.0004775986551939054,
"loss": 5.8599,
"mean_token_accuracy": 0.18742733150720597,
"num_tokens": 33626322.0,
"step": 13270
},
{
"entropy": 6.191336297988892,
"epoch": 1.5320253894979805,
"grad_norm": 0.8828125,
"learning_rate": 0.00047758070247841465,
"loss": 5.7776,
"mean_token_accuracy": 0.19153404384851455,
"num_tokens": 33638433.0,
"step": 13275
},
{
"entropy": 6.221687507629395,
"epoch": 1.532602423542989,
"grad_norm": 0.84765625,
"learning_rate": 0.00047756274294922266,
"loss": 5.8007,
"mean_token_accuracy": 0.1957632526755333,
"num_tokens": 33651743.0,
"step": 13280
},
{
"entropy": 6.283531665802002,
"epoch": 1.5331794575879978,
"grad_norm": 0.95703125,
"learning_rate": 0.0004775447766069334,
"loss": 5.8932,
"mean_token_accuracy": 0.1905313104391098,
"num_tokens": 33663546.0,
"step": 13285
},
{
"entropy": 6.255209875106812,
"epoch": 1.5337564916330062,
"grad_norm": 0.87890625,
"learning_rate": 0.00047752680345215115,
"loss": 5.8374,
"mean_token_accuracy": 0.18721415102481842,
"num_tokens": 33675358.0,
"step": 13290
},
{
"entropy": 6.268837118148804,
"epoch": 1.534333525678015,
"grad_norm": 0.83984375,
"learning_rate": 0.0004775088234854805,
"loss": 5.7914,
"mean_token_accuracy": 0.18973737806081772,
"num_tokens": 33688066.0,
"step": 13295
},
{
"entropy": 6.1976690769195555,
"epoch": 1.5349105597230237,
"grad_norm": 1.0703125,
"learning_rate": 0.0004774908367075262,
"loss": 5.8236,
"mean_token_accuracy": 0.19111677557229995,
"num_tokens": 33700829.0,
"step": 13300
},
{
"entropy": 6.174250936508178,
"epoch": 1.5354875937680323,
"grad_norm": 0.85546875,
"learning_rate": 0.0004774728431188931,
"loss": 5.7823,
"mean_token_accuracy": 0.18667507469654082,
"num_tokens": 33714049.0,
"step": 13305
},
{
"entropy": 6.153797626495361,
"epoch": 1.536064627813041,
"grad_norm": 1.0,
"learning_rate": 0.00047745484272018664,
"loss": 5.7376,
"mean_token_accuracy": 0.1966078385710716,
"num_tokens": 33727026.0,
"step": 13310
},
{
"entropy": 6.212672233581543,
"epoch": 1.5366416618580496,
"grad_norm": 0.9140625,
"learning_rate": 0.0004774368355120119,
"loss": 5.7338,
"mean_token_accuracy": 0.20255094915628433,
"num_tokens": 33740400.0,
"step": 13315
},
{
"entropy": 6.047137498855591,
"epoch": 1.5372186959030583,
"grad_norm": 0.83984375,
"learning_rate": 0.000477418821494975,
"loss": 5.6107,
"mean_token_accuracy": 0.20713855773210527,
"num_tokens": 33753621.0,
"step": 13320
},
{
"entropy": 6.251862668991089,
"epoch": 1.537795729948067,
"grad_norm": 0.8984375,
"learning_rate": 0.0004774008006696814,
"loss": 5.8651,
"mean_token_accuracy": 0.18378251641988755,
"num_tokens": 33765458.0,
"step": 13325
},
{
"entropy": 6.323590993881226,
"epoch": 1.5383727639930755,
"grad_norm": 0.8984375,
"learning_rate": 0.0004773827730367375,
"loss": 5.8993,
"mean_token_accuracy": 0.1841868206858635,
"num_tokens": 33777264.0,
"step": 13330
},
{
"entropy": 6.242207384109497,
"epoch": 1.5389497980380842,
"grad_norm": 0.8984375,
"learning_rate": 0.00047736473859674955,
"loss": 5.8134,
"mean_token_accuracy": 0.1927764505147934,
"num_tokens": 33789837.0,
"step": 13335
},
{
"entropy": 6.089216327667236,
"epoch": 1.539526832083093,
"grad_norm": 0.9453125,
"learning_rate": 0.00047734669735032404,
"loss": 5.7171,
"mean_token_accuracy": 0.19926753938198088,
"num_tokens": 33801666.0,
"step": 13340
},
{
"entropy": 6.197734022140503,
"epoch": 1.5401038661281015,
"grad_norm": 0.94140625,
"learning_rate": 0.00047732864929806796,
"loss": 5.8392,
"mean_token_accuracy": 0.1812909036874771,
"num_tokens": 33813909.0,
"step": 13345
},
{
"entropy": 6.198130559921265,
"epoch": 1.5406809001731103,
"grad_norm": 0.87109375,
"learning_rate": 0.0004773105944405883,
"loss": 5.8364,
"mean_token_accuracy": 0.19269849210977555,
"num_tokens": 33827081.0,
"step": 13350
},
{
"entropy": 6.183778619766235,
"epoch": 1.5412579342181187,
"grad_norm": 0.95703125,
"learning_rate": 0.00047729253277849226,
"loss": 5.7523,
"mean_token_accuracy": 0.1987853080034256,
"num_tokens": 33838261.0,
"step": 13355
},
{
"entropy": 6.254490613937378,
"epoch": 1.5418349682631276,
"grad_norm": 1.0,
"learning_rate": 0.00047727446431238734,
"loss": 5.9129,
"mean_token_accuracy": 0.18299975246191025,
"num_tokens": 33850189.0,
"step": 13360
},
{
"entropy": 6.303029108047485,
"epoch": 1.542412002308136,
"grad_norm": 0.87109375,
"learning_rate": 0.0004772563890428813,
"loss": 5.8937,
"mean_token_accuracy": 0.18921637237071992,
"num_tokens": 33863570.0,
"step": 13365
},
{
"entropy": 6.217037868499756,
"epoch": 1.5429890363531449,
"grad_norm": 0.8203125,
"learning_rate": 0.0004772383069705821,
"loss": 5.8257,
"mean_token_accuracy": 0.18908795416355134,
"num_tokens": 33876583.0,
"step": 13370
},
{
"entropy": 6.289787244796753,
"epoch": 1.5435660703981535,
"grad_norm": 0.90234375,
"learning_rate": 0.0004772202180960978,
"loss": 5.8502,
"mean_token_accuracy": 0.1855199694633484,
"num_tokens": 33889744.0,
"step": 13375
},
{
"entropy": 6.285410022735595,
"epoch": 1.5441431044431622,
"grad_norm": 0.89453125,
"learning_rate": 0.00047720212242003703,
"loss": 5.8729,
"mean_token_accuracy": 0.19419652074575425,
"num_tokens": 33904129.0,
"step": 13380
},
{
"entropy": 6.162698411941529,
"epoch": 1.5447201384881708,
"grad_norm": 0.8984375,
"learning_rate": 0.00047718401994300825,
"loss": 5.7692,
"mean_token_accuracy": 0.19252093583345414,
"num_tokens": 33916277.0,
"step": 13385
},
{
"entropy": 6.2117432117462155,
"epoch": 1.5452971725331794,
"grad_norm": 0.921875,
"learning_rate": 0.00047716591066562043,
"loss": 5.8584,
"mean_token_accuracy": 0.188547345995903,
"num_tokens": 33929434.0,
"step": 13390
},
{
"entropy": 6.270015859603882,
"epoch": 1.545874206578188,
"grad_norm": 0.90234375,
"learning_rate": 0.00047714779458848255,
"loss": 5.8328,
"mean_token_accuracy": 0.18586413711309432,
"num_tokens": 33942376.0,
"step": 13395
},
{
"entropy": 6.264356374740601,
"epoch": 1.5464512406231967,
"grad_norm": 0.92578125,
"learning_rate": 0.0004771296717122041,
"loss": 5.8404,
"mean_token_accuracy": 0.19098608046770096,
"num_tokens": 33955013.0,
"step": 13400
},
{
"entropy": 6.240370368957519,
"epoch": 1.5470282746682056,
"grad_norm": 0.98828125,
"learning_rate": 0.0004771115420373945,
"loss": 5.8445,
"mean_token_accuracy": 0.1863965794444084,
"num_tokens": 33966673.0,
"step": 13405
},
{
"entropy": 6.177231168746948,
"epoch": 1.547605308713214,
"grad_norm": 0.96484375,
"learning_rate": 0.00047709340556466366,
"loss": 5.769,
"mean_token_accuracy": 0.1987849310040474,
"num_tokens": 33978400.0,
"step": 13410
},
{
"entropy": 6.298257875442505,
"epoch": 1.5481823427582229,
"grad_norm": 0.87890625,
"learning_rate": 0.00047707526229462144,
"loss": 5.9266,
"mean_token_accuracy": 0.18126586228609085,
"num_tokens": 33990690.0,
"step": 13415
},
{
"entropy": 6.25822606086731,
"epoch": 1.5487593768032313,
"grad_norm": 0.9375,
"learning_rate": 0.00047705711222787816,
"loss": 5.8267,
"mean_token_accuracy": 0.1906663656234741,
"num_tokens": 34003992.0,
"step": 13420
},
{
"entropy": 6.256418752670288,
"epoch": 1.5493364108482401,
"grad_norm": 0.9375,
"learning_rate": 0.00047703895536504423,
"loss": 5.8242,
"mean_token_accuracy": 0.18806500285863875,
"num_tokens": 34016075.0,
"step": 13425
},
{
"entropy": 6.231338977813721,
"epoch": 1.5499134448932486,
"grad_norm": 0.97265625,
"learning_rate": 0.0004770207917067305,
"loss": 5.7882,
"mean_token_accuracy": 0.18892282098531724,
"num_tokens": 34029143.0,
"step": 13430
},
{
"entropy": 6.201420450210572,
"epoch": 1.5504904789382574,
"grad_norm": 0.8984375,
"learning_rate": 0.00047700262125354765,
"loss": 5.8749,
"mean_token_accuracy": 0.19344826638698578,
"num_tokens": 34041269.0,
"step": 13435
},
{
"entropy": 6.238750314712524,
"epoch": 1.551067512983266,
"grad_norm": 0.91015625,
"learning_rate": 0.00047698444400610707,
"loss": 5.8859,
"mean_token_accuracy": 0.18998730182647705,
"num_tokens": 34054561.0,
"step": 13440
},
{
"entropy": 6.205687665939331,
"epoch": 1.5516445470282747,
"grad_norm": 0.91015625,
"learning_rate": 0.00047696625996502,
"loss": 5.7521,
"mean_token_accuracy": 0.1924416869878769,
"num_tokens": 34068009.0,
"step": 13445
},
{
"entropy": 6.221275329589844,
"epoch": 1.5522215810732833,
"grad_norm": 0.96875,
"learning_rate": 0.00047694806913089815,
"loss": 5.891,
"mean_token_accuracy": 0.1905246526002884,
"num_tokens": 34081217.0,
"step": 13450
},
{
"entropy": 6.277045774459839,
"epoch": 1.552798615118292,
"grad_norm": 0.921875,
"learning_rate": 0.0004769298715043533,
"loss": 5.8023,
"mean_token_accuracy": 0.18520487993955612,
"num_tokens": 34093903.0,
"step": 13455
},
{
"entropy": 6.28056845664978,
"epoch": 1.5533756491633006,
"grad_norm": 0.91796875,
"learning_rate": 0.0004769116670859975,
"loss": 5.8674,
"mean_token_accuracy": 0.18978661596775054,
"num_tokens": 34105891.0,
"step": 13460
},
{
"entropy": 6.244111442565918,
"epoch": 1.5539526832083093,
"grad_norm": 0.9609375,
"learning_rate": 0.00047689345587644314,
"loss": 5.8749,
"mean_token_accuracy": 0.19215874820947648,
"num_tokens": 34118438.0,
"step": 13465
},
{
"entropy": 6.191610431671142,
"epoch": 1.554529717253318,
"grad_norm": 0.93359375,
"learning_rate": 0.00047687523787630256,
"loss": 5.736,
"mean_token_accuracy": 0.19659065455198288,
"num_tokens": 34130383.0,
"step": 13470
},
{
"entropy": 6.189245986938476,
"epoch": 1.5551067512983265,
"grad_norm": 0.91796875,
"learning_rate": 0.0004768570130861887,
"loss": 5.8577,
"mean_token_accuracy": 0.19298865050077438,
"num_tokens": 34143805.0,
"step": 13475
},
{
"entropy": 6.23731164932251,
"epoch": 1.5556837853433354,
"grad_norm": 0.91796875,
"learning_rate": 0.0004768387815067144,
"loss": 5.7135,
"mean_token_accuracy": 0.20021907836198807,
"num_tokens": 34157053.0,
"step": 13480
},
{
"entropy": 6.2790198802948,
"epoch": 1.5562608193883438,
"grad_norm": 1.03125,
"learning_rate": 0.00047682054313849304,
"loss": 5.8953,
"mean_token_accuracy": 0.1879524365067482,
"num_tokens": 34168804.0,
"step": 13485
},
{
"entropy": 6.2272436141967775,
"epoch": 1.5568378534333527,
"grad_norm": 0.8828125,
"learning_rate": 0.0004768022979821379,
"loss": 5.9036,
"mean_token_accuracy": 0.18060447722673417,
"num_tokens": 34181201.0,
"step": 13490
},
{
"entropy": 6.2782214164733885,
"epoch": 1.557414887478361,
"grad_norm": 0.9609375,
"learning_rate": 0.0004767840460382628,
"loss": 5.8846,
"mean_token_accuracy": 0.18991439938545226,
"num_tokens": 34193906.0,
"step": 13495
},
{
"entropy": 6.245473003387451,
"epoch": 1.55799192152337,
"grad_norm": 0.84765625,
"learning_rate": 0.0004767657873074815,
"loss": 5.8902,
"mean_token_accuracy": 0.18845838755369188,
"num_tokens": 34207462.0,
"step": 13500
},
{
"entropy": 6.18796181678772,
"epoch": 1.5585689555683784,
"grad_norm": 0.83984375,
"learning_rate": 0.0004767475217904081,
"loss": 5.7363,
"mean_token_accuracy": 0.19420798420906066,
"num_tokens": 34219696.0,
"step": 13505
},
{
"entropy": 6.205419874191284,
"epoch": 1.5591459896133872,
"grad_norm": 0.9140625,
"learning_rate": 0.00047672924948765705,
"loss": 5.79,
"mean_token_accuracy": 0.1927314206957817,
"num_tokens": 34232413.0,
"step": 13510
},
{
"entropy": 6.259201574325561,
"epoch": 1.5597230236583959,
"grad_norm": 0.90234375,
"learning_rate": 0.00047671097039984293,
"loss": 5.8829,
"mean_token_accuracy": 0.1864104762673378,
"num_tokens": 34245150.0,
"step": 13515
},
{
"entropy": 6.23311071395874,
"epoch": 1.5603000577034045,
"grad_norm": 0.875,
"learning_rate": 0.00047669268452758053,
"loss": 5.7247,
"mean_token_accuracy": 0.1986491337418556,
"num_tokens": 34257416.0,
"step": 13520
},
{
"entropy": 6.192863082885742,
"epoch": 1.5608770917484132,
"grad_norm": 1.1015625,
"learning_rate": 0.00047667439187148476,
"loss": 5.7546,
"mean_token_accuracy": 0.1986703172326088,
"num_tokens": 34269518.0,
"step": 13525
},
{
"entropy": 6.2323802471160885,
"epoch": 1.5614541257934218,
"grad_norm": 1.0625,
"learning_rate": 0.0004766560924321711,
"loss": 5.7942,
"mean_token_accuracy": 0.19780726730823517,
"num_tokens": 34280965.0,
"step": 13530
},
{
"entropy": 6.22453088760376,
"epoch": 1.5620311598384304,
"grad_norm": 0.7890625,
"learning_rate": 0.00047663778621025496,
"loss": 5.8313,
"mean_token_accuracy": 0.19148373305797578,
"num_tokens": 34294051.0,
"step": 13535
},
{
"entropy": 6.268961334228516,
"epoch": 1.562608193883439,
"grad_norm": 0.859375,
"learning_rate": 0.0004766194732063519,
"loss": 5.863,
"mean_token_accuracy": 0.18264816850423812,
"num_tokens": 34308052.0,
"step": 13540
},
{
"entropy": 6.285745286941529,
"epoch": 1.563185227928448,
"grad_norm": 0.7578125,
"learning_rate": 0.00047660115342107814,
"loss": 5.7969,
"mean_token_accuracy": 0.19112218767404557,
"num_tokens": 34321802.0,
"step": 13545
},
{
"entropy": 6.193321275711059,
"epoch": 1.5637622619734564,
"grad_norm": 0.83203125,
"learning_rate": 0.00047658282685504973,
"loss": 5.7602,
"mean_token_accuracy": 0.19718139320611955,
"num_tokens": 34334789.0,
"step": 13550
},
{
"entropy": 6.235433149337768,
"epoch": 1.5643392960184652,
"grad_norm": 1.015625,
"learning_rate": 0.000476564493508883,
"loss": 5.7801,
"mean_token_accuracy": 0.19197132885456086,
"num_tokens": 34347167.0,
"step": 13555
},
{
"entropy": 6.285042762756348,
"epoch": 1.5649163300634736,
"grad_norm": 0.9140625,
"learning_rate": 0.00047654615338319466,
"loss": 5.9097,
"mean_token_accuracy": 0.1878646969795227,
"num_tokens": 34360468.0,
"step": 13560
},
{
"entropy": 6.280793809890747,
"epoch": 1.5654933641084825,
"grad_norm": 0.94140625,
"learning_rate": 0.0004765278064786016,
"loss": 5.8745,
"mean_token_accuracy": 0.18344386219978331,
"num_tokens": 34373835.0,
"step": 13565
},
{
"entropy": 6.2916289329528805,
"epoch": 1.566070398153491,
"grad_norm": 0.88671875,
"learning_rate": 0.00047650945279572085,
"loss": 5.8593,
"mean_token_accuracy": 0.19200937896966935,
"num_tokens": 34385591.0,
"step": 13570
},
{
"entropy": 6.280641365051269,
"epoch": 1.5666474321984998,
"grad_norm": 0.91015625,
"learning_rate": 0.0004764910923351698,
"loss": 5.8864,
"mean_token_accuracy": 0.183075650036335,
"num_tokens": 34398980.0,
"step": 13575
},
{
"entropy": 6.257032251358032,
"epoch": 1.5672244662435084,
"grad_norm": 0.87109375,
"learning_rate": 0.00047647272509756584,
"loss": 5.869,
"mean_token_accuracy": 0.18773055970668792,
"num_tokens": 34412274.0,
"step": 13580
},
{
"entropy": 6.243408870697022,
"epoch": 1.567801500288517,
"grad_norm": 0.8671875,
"learning_rate": 0.0004764543510835269,
"loss": 5.8246,
"mean_token_accuracy": 0.19365275353193284,
"num_tokens": 34425043.0,
"step": 13585
},
{
"entropy": 6.239257192611694,
"epoch": 1.5683785343335257,
"grad_norm": 0.91015625,
"learning_rate": 0.000476435970293671,
"loss": 5.8773,
"mean_token_accuracy": 0.19190652072429656,
"num_tokens": 34437022.0,
"step": 13590
},
{
"entropy": 6.168194198608399,
"epoch": 1.5689555683785343,
"grad_norm": 0.81640625,
"learning_rate": 0.00047641758272861626,
"loss": 5.6913,
"mean_token_accuracy": 0.1997967079281807,
"num_tokens": 34449668.0,
"step": 13595
},
{
"entropy": 6.230442905426026,
"epoch": 1.569532602423543,
"grad_norm": 0.984375,
"learning_rate": 0.0004763991883889811,
"loss": 5.7525,
"mean_token_accuracy": 0.19202667623758315,
"num_tokens": 34461588.0,
"step": 13600
},
{
"entropy": 6.194968223571777,
"epoch": 1.5701096364685516,
"grad_norm": 0.80859375,
"learning_rate": 0.0004763807872753843,
"loss": 5.7956,
"mean_token_accuracy": 0.19065721333026886,
"num_tokens": 34474696.0,
"step": 13605
},
{
"entropy": 6.2662159442901615,
"epoch": 1.5706866705135603,
"grad_norm": 0.9140625,
"learning_rate": 0.00047636237938844484,
"loss": 5.8088,
"mean_token_accuracy": 0.19261950701475145,
"num_tokens": 34488477.0,
"step": 13610
},
{
"entropy": 6.20445556640625,
"epoch": 1.571263704558569,
"grad_norm": 0.84765625,
"learning_rate": 0.0004763439647287817,
"loss": 5.7521,
"mean_token_accuracy": 0.19336534291505814,
"num_tokens": 34502159.0,
"step": 13615
},
{
"entropy": 6.188671398162842,
"epoch": 1.5718407386035778,
"grad_norm": 0.96484375,
"learning_rate": 0.0004763255432970144,
"loss": 5.788,
"mean_token_accuracy": 0.1959633484482765,
"num_tokens": 34516247.0,
"step": 13620
},
{
"entropy": 6.190359258651734,
"epoch": 1.5724177726485862,
"grad_norm": 0.953125,
"learning_rate": 0.00047630711509376235,
"loss": 5.6789,
"mean_token_accuracy": 0.20005650967359542,
"num_tokens": 34528599.0,
"step": 13625
},
{
"entropy": 6.272625064849853,
"epoch": 1.572994806693595,
"grad_norm": 0.92578125,
"learning_rate": 0.0004762886801196455,
"loss": 5.8926,
"mean_token_accuracy": 0.17960608005523682,
"num_tokens": 34541346.0,
"step": 13630
},
{
"entropy": 6.311180162429809,
"epoch": 1.5735718407386035,
"grad_norm": 0.90234375,
"learning_rate": 0.00047627023837528386,
"loss": 5.845,
"mean_token_accuracy": 0.18619453758001328,
"num_tokens": 34553934.0,
"step": 13635
},
{
"entropy": 6.243749475479126,
"epoch": 1.5741488747836123,
"grad_norm": 0.87890625,
"learning_rate": 0.00047625178986129775,
"loss": 5.8856,
"mean_token_accuracy": 0.1931193843483925,
"num_tokens": 34565739.0,
"step": 13640
},
{
"entropy": 6.188317966461182,
"epoch": 1.5747259088286207,
"grad_norm": 0.9453125,
"learning_rate": 0.0004762333345783078,
"loss": 5.8081,
"mean_token_accuracy": 0.19340444803237916,
"num_tokens": 34579062.0,
"step": 13645
},
{
"entropy": 6.227141380310059,
"epoch": 1.5753029428736296,
"grad_norm": 0.984375,
"learning_rate": 0.00047621487252693436,
"loss": 5.8652,
"mean_token_accuracy": 0.18909793645143508,
"num_tokens": 34592090.0,
"step": 13650
},
{
"entropy": 6.149709033966064,
"epoch": 1.5758799769186382,
"grad_norm": 0.984375,
"learning_rate": 0.00047619640370779876,
"loss": 5.7026,
"mean_token_accuracy": 0.19682869613170623,
"num_tokens": 34604626.0,
"step": 13655
},
{
"entropy": 6.2658247470855715,
"epoch": 1.5764570109636469,
"grad_norm": 0.91015625,
"learning_rate": 0.00047617792812152207,
"loss": 5.8458,
"mean_token_accuracy": 0.18907229751348495,
"num_tokens": 34617174.0,
"step": 13660
},
{
"entropy": 6.185346984863282,
"epoch": 1.5770340450086555,
"grad_norm": 0.85546875,
"learning_rate": 0.0004761594457687256,
"loss": 5.7213,
"mean_token_accuracy": 0.19811177551746367,
"num_tokens": 34629909.0,
"step": 13665
},
{
"entropy": 6.198504495620727,
"epoch": 1.5776110790536642,
"grad_norm": 0.93359375,
"learning_rate": 0.0004761409566500313,
"loss": 5.7826,
"mean_token_accuracy": 0.1974416196346283,
"num_tokens": 34643640.0,
"step": 13670
},
{
"entropy": 6.230290460586548,
"epoch": 1.5781881130986728,
"grad_norm": 1.0,
"learning_rate": 0.00047612246076606066,
"loss": 5.7578,
"mean_token_accuracy": 0.1851365178823471,
"num_tokens": 34655250.0,
"step": 13675
},
{
"entropy": 6.257380104064941,
"epoch": 1.5787651471436814,
"grad_norm": 0.81640625,
"learning_rate": 0.00047610395811743594,
"loss": 5.7802,
"mean_token_accuracy": 0.1935951068997383,
"num_tokens": 34669318.0,
"step": 13680
},
{
"entropy": 6.212140512466431,
"epoch": 1.5793421811886903,
"grad_norm": 0.8984375,
"learning_rate": 0.00047608544870477956,
"loss": 5.8145,
"mean_token_accuracy": 0.1901389628648758,
"num_tokens": 34680932.0,
"step": 13685
},
{
"entropy": 6.2297382831573485,
"epoch": 1.5799192152336987,
"grad_norm": 0.8515625,
"learning_rate": 0.00047606693252871395,
"loss": 5.9309,
"mean_token_accuracy": 0.18365089148283004,
"num_tokens": 34693091.0,
"step": 13690
},
{
"entropy": 6.239744043350219,
"epoch": 1.5804962492787076,
"grad_norm": 0.8984375,
"learning_rate": 0.000476048409589862,
"loss": 5.8484,
"mean_token_accuracy": 0.19662028700113296,
"num_tokens": 34706645.0,
"step": 13695
},
{
"entropy": 6.262181663513184,
"epoch": 1.581073283323716,
"grad_norm": 1.0078125,
"learning_rate": 0.0004760298798888466,
"loss": 5.9018,
"mean_token_accuracy": 0.18771067559719085,
"num_tokens": 34718974.0,
"step": 13700
},
{
"entropy": 6.192539691925049,
"epoch": 1.5816503173687249,
"grad_norm": 0.8828125,
"learning_rate": 0.0004760113434262911,
"loss": 5.8369,
"mean_token_accuracy": 0.18986850529909133,
"num_tokens": 34732424.0,
"step": 13705
},
{
"entropy": 6.183119106292724,
"epoch": 1.5822273514137333,
"grad_norm": 0.91015625,
"learning_rate": 0.00047599280020281894,
"loss": 5.7694,
"mean_token_accuracy": 0.1920637682080269,
"num_tokens": 34743865.0,
"step": 13710
},
{
"entropy": 6.195568656921386,
"epoch": 1.5828043854587421,
"grad_norm": 0.94921875,
"learning_rate": 0.00047597425021905364,
"loss": 5.714,
"mean_token_accuracy": 0.1968247890472412,
"num_tokens": 34756415.0,
"step": 13715
},
{
"entropy": 6.307136392593383,
"epoch": 1.5833814195037508,
"grad_norm": 0.8984375,
"learning_rate": 0.0004759556934756194,
"loss": 5.851,
"mean_token_accuracy": 0.18275767266750337,
"num_tokens": 34769666.0,
"step": 13720
},
{
"entropy": 6.103635835647583,
"epoch": 1.5839584535487594,
"grad_norm": 0.9375,
"learning_rate": 0.00047593712997314017,
"loss": 5.6843,
"mean_token_accuracy": 0.20277404189109802,
"num_tokens": 34781523.0,
"step": 13725
},
{
"entropy": 6.193688011169433,
"epoch": 1.584535487593768,
"grad_norm": 0.90625,
"learning_rate": 0.00047591855971224035,
"loss": 5.7348,
"mean_token_accuracy": 0.20058793425559998,
"num_tokens": 34794597.0,
"step": 13730
},
{
"entropy": 6.22872748374939,
"epoch": 1.5851125216387767,
"grad_norm": 0.875,
"learning_rate": 0.0004758999826935446,
"loss": 5.8807,
"mean_token_accuracy": 0.18744026124477386,
"num_tokens": 34807791.0,
"step": 13735
},
{
"entropy": 6.279449033737182,
"epoch": 1.5856895556837853,
"grad_norm": 1.109375,
"learning_rate": 0.0004758813989176778,
"loss": 5.8438,
"mean_token_accuracy": 0.1967759609222412,
"num_tokens": 34821456.0,
"step": 13740
},
{
"entropy": 6.221560335159301,
"epoch": 1.586266589728794,
"grad_norm": 0.90625,
"learning_rate": 0.00047586280838526483,
"loss": 5.7788,
"mean_token_accuracy": 0.19918196201324462,
"num_tokens": 34834786.0,
"step": 13745
},
{
"entropy": 6.23402967453003,
"epoch": 1.5868436237738026,
"grad_norm": 0.94921875,
"learning_rate": 0.0004758442110969312,
"loss": 5.8089,
"mean_token_accuracy": 0.1831536501646042,
"num_tokens": 34846125.0,
"step": 13750
},
{
"entropy": 6.30714054107666,
"epoch": 1.5874206578188113,
"grad_norm": 0.92578125,
"learning_rate": 0.0004758256070533022,
"loss": 5.8854,
"mean_token_accuracy": 0.18437816053628922,
"num_tokens": 34858438.0,
"step": 13755
},
{
"entropy": 6.2490949630737305,
"epoch": 1.5879976918638201,
"grad_norm": 0.86328125,
"learning_rate": 0.0004758069962550037,
"loss": 5.8674,
"mean_token_accuracy": 0.18302336782217027,
"num_tokens": 34871340.0,
"step": 13760
},
{
"entropy": 6.250127840042114,
"epoch": 1.5885747259088285,
"grad_norm": 0.92578125,
"learning_rate": 0.00047578837870266156,
"loss": 5.8296,
"mean_token_accuracy": 0.18722266256809234,
"num_tokens": 34882111.0,
"step": 13765
},
{
"entropy": 6.2264612197875975,
"epoch": 1.5891517599538374,
"grad_norm": 0.85546875,
"learning_rate": 0.00047576975439690206,
"loss": 5.8497,
"mean_token_accuracy": 0.18753604739904403,
"num_tokens": 34895539.0,
"step": 13770
},
{
"entropy": 6.245386600494385,
"epoch": 1.5897287939988458,
"grad_norm": 0.93359375,
"learning_rate": 0.00047575112333835164,
"loss": 5.7943,
"mean_token_accuracy": 0.1940807059407234,
"num_tokens": 34907860.0,
"step": 13775
},
{
"entropy": 6.318158340454102,
"epoch": 1.5903058280438547,
"grad_norm": 0.85546875,
"learning_rate": 0.00047573248552763684,
"loss": 5.9049,
"mean_token_accuracy": 0.18691892623901368,
"num_tokens": 34920595.0,
"step": 13780
},
{
"entropy": 6.237708854675293,
"epoch": 1.590882862088863,
"grad_norm": 0.87890625,
"learning_rate": 0.00047571384096538474,
"loss": 5.8353,
"mean_token_accuracy": 0.19281982034444808,
"num_tokens": 34933458.0,
"step": 13785
},
{
"entropy": 6.154352331161499,
"epoch": 1.591459896133872,
"grad_norm": 0.9609375,
"learning_rate": 0.0004756951896522222,
"loss": 5.7572,
"mean_token_accuracy": 0.19540754407644273,
"num_tokens": 34946872.0,
"step": 13790
},
{
"entropy": 6.236962699890137,
"epoch": 1.5920369301788806,
"grad_norm": 0.89453125,
"learning_rate": 0.0004756765315887766,
"loss": 5.8304,
"mean_token_accuracy": 0.1889364406466484,
"num_tokens": 34959384.0,
"step": 13795
},
{
"entropy": 6.282778406143189,
"epoch": 1.5926139642238892,
"grad_norm": 0.94921875,
"learning_rate": 0.0004756578667756756,
"loss": 5.8797,
"mean_token_accuracy": 0.18420573323965073,
"num_tokens": 34971571.0,
"step": 13800
},
{
"entropy": 6.234209203720093,
"epoch": 1.5931909982688979,
"grad_norm": 0.921875,
"learning_rate": 0.0004756391952135469,
"loss": 5.7703,
"mean_token_accuracy": 0.20292106419801711,
"num_tokens": 34984897.0,
"step": 13805
},
{
"entropy": 6.226548194885254,
"epoch": 1.5937680323139065,
"grad_norm": 0.95703125,
"learning_rate": 0.00047562051690301855,
"loss": 5.8317,
"mean_token_accuracy": 0.19043446183204651,
"num_tokens": 34998185.0,
"step": 13810
},
{
"entropy": 6.307507181167603,
"epoch": 1.5943450663589152,
"grad_norm": 1.015625,
"learning_rate": 0.00047560183184471873,
"loss": 5.8377,
"mean_token_accuracy": 0.18937501907348633,
"num_tokens": 35010985.0,
"step": 13815
},
{
"entropy": 6.25484938621521,
"epoch": 1.5949221004039238,
"grad_norm": 0.8671875,
"learning_rate": 0.000475583140039276,
"loss": 5.8375,
"mean_token_accuracy": 0.19109233766794204,
"num_tokens": 35023785.0,
"step": 13820
},
{
"entropy": 6.301526784896851,
"epoch": 1.5954991344489324,
"grad_norm": 0.87109375,
"learning_rate": 0.00047556444148731897,
"loss": 5.8994,
"mean_token_accuracy": 0.17948832660913466,
"num_tokens": 35035926.0,
"step": 13825
},
{
"entropy": 6.276957702636719,
"epoch": 1.596076168493941,
"grad_norm": 0.90625,
"learning_rate": 0.0004755457361894766,
"loss": 5.832,
"mean_token_accuracy": 0.19143660515546798,
"num_tokens": 35048290.0,
"step": 13830
},
{
"entropy": 6.166981220245361,
"epoch": 1.59665320253895,
"grad_norm": 0.953125,
"learning_rate": 0.00047552702414637793,
"loss": 5.7645,
"mean_token_accuracy": 0.19035774618387222,
"num_tokens": 35059883.0,
"step": 13835
},
{
"entropy": 6.277225303649902,
"epoch": 1.5972302365839584,
"grad_norm": 0.89453125,
"learning_rate": 0.00047550830535865245,
"loss": 5.8617,
"mean_token_accuracy": 0.1807610049843788,
"num_tokens": 35071747.0,
"step": 13840
},
{
"entropy": 6.190814876556397,
"epoch": 1.5978072706289672,
"grad_norm": 0.98046875,
"learning_rate": 0.00047548957982692974,
"loss": 5.8134,
"mean_token_accuracy": 0.1871611699461937,
"num_tokens": 35083774.0,
"step": 13845
},
{
"entropy": 6.200519466400147,
"epoch": 1.5983843046739756,
"grad_norm": 0.91015625,
"learning_rate": 0.0004754708475518396,
"loss": 5.811,
"mean_token_accuracy": 0.19500787407159806,
"num_tokens": 35095757.0,
"step": 13850
},
{
"entropy": 6.238155698776245,
"epoch": 1.5989613387189845,
"grad_norm": 0.828125,
"learning_rate": 0.00047545210853401214,
"loss": 5.7967,
"mean_token_accuracy": 0.19086273461580278,
"num_tokens": 35108788.0,
"step": 13855
},
{
"entropy": 6.29552264213562,
"epoch": 1.599538372763993,
"grad_norm": 0.85546875,
"learning_rate": 0.00047543336277407753,
"loss": 5.9095,
"mean_token_accuracy": 0.18491909354925157,
"num_tokens": 35121641.0,
"step": 13860
},
{
"entropy": 6.298146390914917,
"epoch": 1.6001154068090018,
"grad_norm": 0.8828125,
"learning_rate": 0.00047541461027266624,
"loss": 5.872,
"mean_token_accuracy": 0.18402589708566666,
"num_tokens": 35133960.0,
"step": 13865
},
{
"entropy": 6.290952396392822,
"epoch": 1.6006924408540104,
"grad_norm": 0.8984375,
"learning_rate": 0.0004753958510304091,
"loss": 5.8602,
"mean_token_accuracy": 0.19193972200155257,
"num_tokens": 35146027.0,
"step": 13870
},
{
"entropy": 6.268626737594604,
"epoch": 1.601269474899019,
"grad_norm": 0.9140625,
"learning_rate": 0.00047537708504793714,
"loss": 5.8229,
"mean_token_accuracy": 0.19206952154636384,
"num_tokens": 35158728.0,
"step": 13875
},
{
"entropy": 6.216690492630005,
"epoch": 1.6018465089440277,
"grad_norm": 0.96484375,
"learning_rate": 0.00047535831232588146,
"loss": 5.8518,
"mean_token_accuracy": 0.18720198273658753,
"num_tokens": 35171734.0,
"step": 13880
},
{
"entropy": 6.28776330947876,
"epoch": 1.6024235429890363,
"grad_norm": 0.83984375,
"learning_rate": 0.00047533953286487345,
"loss": 5.8469,
"mean_token_accuracy": 0.1826049879193306,
"num_tokens": 35185074.0,
"step": 13885
},
{
"entropy": 6.27451376914978,
"epoch": 1.603000577034045,
"grad_norm": 0.90625,
"learning_rate": 0.0004753207466655447,
"loss": 5.8782,
"mean_token_accuracy": 0.19072716683149338,
"num_tokens": 35197972.0,
"step": 13890
},
{
"entropy": 6.271556949615478,
"epoch": 1.6035776110790536,
"grad_norm": 0.86328125,
"learning_rate": 0.0004753019537285273,
"loss": 5.8383,
"mean_token_accuracy": 0.19148626625537873,
"num_tokens": 35210939.0,
"step": 13895
},
{
"entropy": 6.355197715759277,
"epoch": 1.6041546451240625,
"grad_norm": 0.90625,
"learning_rate": 0.00047528315405445296,
"loss": 5.8933,
"mean_token_accuracy": 0.18523967564105986,
"num_tokens": 35223521.0,
"step": 13900
},
{
"entropy": 6.283075332641602,
"epoch": 1.604731679169071,
"grad_norm": 0.921875,
"learning_rate": 0.00047526434764395435,
"loss": 5.8874,
"mean_token_accuracy": 0.19085699915885926,
"num_tokens": 35235713.0,
"step": 13905
},
{
"entropy": 6.227591133117675,
"epoch": 1.6053087132140798,
"grad_norm": 0.9296875,
"learning_rate": 0.00047524553449766386,
"loss": 5.8254,
"mean_token_accuracy": 0.1942302703857422,
"num_tokens": 35248938.0,
"step": 13910
},
{
"entropy": 6.268484354019165,
"epoch": 1.6058857472590882,
"grad_norm": 0.9140625,
"learning_rate": 0.00047522671461621433,
"loss": 5.8516,
"mean_token_accuracy": 0.18590108901262284,
"num_tokens": 35260916.0,
"step": 13915
},
{
"entropy": 6.279177951812744,
"epoch": 1.606462781304097,
"grad_norm": 0.94921875,
"learning_rate": 0.0004752078880002386,
"loss": 5.7918,
"mean_token_accuracy": 0.19422025829553605,
"num_tokens": 35273529.0,
"step": 13920
},
{
"entropy": 6.256890106201172,
"epoch": 1.6070398153491054,
"grad_norm": 0.9296875,
"learning_rate": 0.00047518905465037005,
"loss": 5.7895,
"mean_token_accuracy": 0.1899741917848587,
"num_tokens": 35285500.0,
"step": 13925
},
{
"entropy": 6.217769765853882,
"epoch": 1.6076168493941143,
"grad_norm": 0.921875,
"learning_rate": 0.00047517021456724214,
"loss": 5.8204,
"mean_token_accuracy": 0.18706730306148528,
"num_tokens": 35300039.0,
"step": 13930
},
{
"entropy": 6.256122732162476,
"epoch": 1.608193883439123,
"grad_norm": 0.9375,
"learning_rate": 0.00047515136775148843,
"loss": 5.9094,
"mean_token_accuracy": 0.17840041369199752,
"num_tokens": 35313091.0,
"step": 13935
},
{
"entropy": 6.28008508682251,
"epoch": 1.6087709174841316,
"grad_norm": 0.90234375,
"learning_rate": 0.0004751325142037429,
"loss": 5.8688,
"mean_token_accuracy": 0.1876186579465866,
"num_tokens": 35325890.0,
"step": 13940
},
{
"entropy": 6.198402643203735,
"epoch": 1.6093479515291402,
"grad_norm": 0.8125,
"learning_rate": 0.00047511365392463974,
"loss": 5.7532,
"mean_token_accuracy": 0.1986751899123192,
"num_tokens": 35339395.0,
"step": 13945
},
{
"entropy": 6.235682106018066,
"epoch": 1.6099249855741489,
"grad_norm": 0.93359375,
"learning_rate": 0.00047509478691481317,
"loss": 5.8111,
"mean_token_accuracy": 0.19092074632644654,
"num_tokens": 35351163.0,
"step": 13950
},
{
"entropy": 6.245539283752441,
"epoch": 1.6105020196191575,
"grad_norm": 0.91015625,
"learning_rate": 0.00047507591317489783,
"loss": 5.7374,
"mean_token_accuracy": 0.20853773206472398,
"num_tokens": 35364099.0,
"step": 13955
},
{
"entropy": 6.257050561904907,
"epoch": 1.6110790536641661,
"grad_norm": 0.875,
"learning_rate": 0.0004750570327055286,
"loss": 5.7902,
"mean_token_accuracy": 0.19092931747436523,
"num_tokens": 35376768.0,
"step": 13960
},
{
"entropy": 6.275674676895141,
"epoch": 1.6116560877091748,
"grad_norm": 0.93359375,
"learning_rate": 0.00047503814550734034,
"loss": 5.8654,
"mean_token_accuracy": 0.18828979283571243,
"num_tokens": 35388892.0,
"step": 13965
},
{
"entropy": 6.308603286743164,
"epoch": 1.6122331217541834,
"grad_norm": 0.984375,
"learning_rate": 0.0004750192515809685,
"loss": 5.9013,
"mean_token_accuracy": 0.18381124287843703,
"num_tokens": 35401573.0,
"step": 13970
},
{
"entropy": 6.255910587310791,
"epoch": 1.6128101557991923,
"grad_norm": 0.91015625,
"learning_rate": 0.00047500035092704843,
"loss": 5.7872,
"mean_token_accuracy": 0.19008346199989318,
"num_tokens": 35415073.0,
"step": 13975
},
{
"entropy": 6.209208059310913,
"epoch": 1.6133871898442007,
"grad_norm": 0.87109375,
"learning_rate": 0.0004749814435462159,
"loss": 5.7701,
"mean_token_accuracy": 0.19700252562761306,
"num_tokens": 35428756.0,
"step": 13980
},
{
"entropy": 6.309863519668579,
"epoch": 1.6139642238892096,
"grad_norm": 0.92578125,
"learning_rate": 0.0004749625294391069,
"loss": 5.775,
"mean_token_accuracy": 0.19249810576438903,
"num_tokens": 35440387.0,
"step": 13985
},
{
"entropy": 6.164202404022217,
"epoch": 1.614541257934218,
"grad_norm": 0.7734375,
"learning_rate": 0.00047494360860635755,
"loss": 5.7059,
"mean_token_accuracy": 0.20623115003108977,
"num_tokens": 35454105.0,
"step": 13990
},
{
"entropy": 6.217005205154419,
"epoch": 1.6151182919792268,
"grad_norm": 0.90234375,
"learning_rate": 0.0004749246810486042,
"loss": 5.859,
"mean_token_accuracy": 0.19571419805288315,
"num_tokens": 35467775.0,
"step": 13995
},
{
"entropy": 6.2699981212615965,
"epoch": 1.6156953260242353,
"grad_norm": 0.93359375,
"learning_rate": 0.0004749057467664836,
"loss": 5.8614,
"mean_token_accuracy": 0.18756910860538484,
"num_tokens": 35479217.0,
"step": 14000
},
{
"entropy": 6.258079528808594,
"epoch": 1.6162723600692441,
"grad_norm": 0.95703125,
"learning_rate": 0.00047488680576063247,
"loss": 5.8267,
"mean_token_accuracy": 0.20054476708173752,
"num_tokens": 35490676.0,
"step": 14005
},
{
"entropy": 6.22015151977539,
"epoch": 1.6168493941142528,
"grad_norm": 0.921875,
"learning_rate": 0.0004748678580316878,
"loss": 5.7543,
"mean_token_accuracy": 0.19434951543807982,
"num_tokens": 35503440.0,
"step": 14010
},
{
"entropy": 6.183001565933227,
"epoch": 1.6174264281592614,
"grad_norm": 0.9140625,
"learning_rate": 0.00047484890358028714,
"loss": 5.7756,
"mean_token_accuracy": 0.19921866208314895,
"num_tokens": 35515717.0,
"step": 14015
},
{
"entropy": 6.2771368503570555,
"epoch": 1.61800346220427,
"grad_norm": 1.0390625,
"learning_rate": 0.0004748299424070678,
"loss": 5.7939,
"mean_token_accuracy": 0.1896692395210266,
"num_tokens": 35528445.0,
"step": 14020
},
{
"entropy": 6.1768638610839846,
"epoch": 1.6185804962492787,
"grad_norm": 0.8203125,
"learning_rate": 0.0004748109745126677,
"loss": 5.7165,
"mean_token_accuracy": 0.19463213682174682,
"num_tokens": 35541652.0,
"step": 14025
},
{
"entropy": 6.125383138656616,
"epoch": 1.6191575302942873,
"grad_norm": 0.91015625,
"learning_rate": 0.00047479199989772464,
"loss": 5.7204,
"mean_token_accuracy": 0.2015412136912346,
"num_tokens": 35555310.0,
"step": 14030
},
{
"entropy": 6.320287895202637,
"epoch": 1.619734564339296,
"grad_norm": 0.90625,
"learning_rate": 0.000474773018562877,
"loss": 5.8361,
"mean_token_accuracy": 0.18703369945287704,
"num_tokens": 35567830.0,
"step": 14035
},
{
"entropy": 6.232371616363525,
"epoch": 1.6203115983843048,
"grad_norm": 0.98046875,
"learning_rate": 0.00047475403050876297,
"loss": 5.8173,
"mean_token_accuracy": 0.19013205021619797,
"num_tokens": 35579054.0,
"step": 14040
},
{
"entropy": 6.305903196334839,
"epoch": 1.6208886324293132,
"grad_norm": 0.96484375,
"learning_rate": 0.0004747350357360214,
"loss": 5.92,
"mean_token_accuracy": 0.18613108694553376,
"num_tokens": 35592463.0,
"step": 14045
},
{
"entropy": 6.2606062412261965,
"epoch": 1.621465666474322,
"grad_norm": 0.95703125,
"learning_rate": 0.0004747160342452912,
"loss": 5.8242,
"mean_token_accuracy": 0.1944044604897499,
"num_tokens": 35605127.0,
"step": 14050
},
{
"entropy": 6.210332012176513,
"epoch": 1.6220427005193305,
"grad_norm": 0.9296875,
"learning_rate": 0.00047469702603721134,
"loss": 5.7752,
"mean_token_accuracy": 0.19872388392686843,
"num_tokens": 35617509.0,
"step": 14055
},
{
"entropy": 6.21488995552063,
"epoch": 1.6226197345643394,
"grad_norm": 0.91796875,
"learning_rate": 0.0004746780111124212,
"loss": 5.796,
"mean_token_accuracy": 0.19262754619121553,
"num_tokens": 35630788.0,
"step": 14060
},
{
"entropy": 6.336267614364624,
"epoch": 1.6231967686093478,
"grad_norm": 0.92578125,
"learning_rate": 0.00047465898947156033,
"loss": 5.8856,
"mean_token_accuracy": 0.1877436563372612,
"num_tokens": 35643613.0,
"step": 14065
},
{
"entropy": 6.2986588954925535,
"epoch": 1.6237738026543567,
"grad_norm": 0.9375,
"learning_rate": 0.00047463996111526854,
"loss": 5.8275,
"mean_token_accuracy": 0.189494089782238,
"num_tokens": 35656495.0,
"step": 14070
},
{
"entropy": 6.242229413986206,
"epoch": 1.6243508366993653,
"grad_norm": 0.86328125,
"learning_rate": 0.00047462092604418576,
"loss": 5.9166,
"mean_token_accuracy": 0.18053760081529618,
"num_tokens": 35669661.0,
"step": 14075
},
{
"entropy": 6.240379905700683,
"epoch": 1.624927870744374,
"grad_norm": 0.87890625,
"learning_rate": 0.00047460188425895236,
"loss": 5.8252,
"mean_token_accuracy": 0.18926533162593842,
"num_tokens": 35682675.0,
"step": 14080
},
{
"entropy": 6.289512968063354,
"epoch": 1.6255049047893826,
"grad_norm": 0.921875,
"learning_rate": 0.00047458283576020874,
"loss": 5.8646,
"mean_token_accuracy": 0.1920921802520752,
"num_tokens": 35694571.0,
"step": 14085
},
{
"entropy": 6.22381739616394,
"epoch": 1.6260819388343912,
"grad_norm": 0.92578125,
"learning_rate": 0.00047456378054859554,
"loss": 5.7493,
"mean_token_accuracy": 0.19590264409780503,
"num_tokens": 35707196.0,
"step": 14090
},
{
"entropy": 6.2018373012542725,
"epoch": 1.6266589728793999,
"grad_norm": 0.9140625,
"learning_rate": 0.00047454471862475375,
"loss": 5.7632,
"mean_token_accuracy": 0.195886792242527,
"num_tokens": 35719682.0,
"step": 14095
},
{
"entropy": 6.229247808456421,
"epoch": 1.6272360069244085,
"grad_norm": 0.91015625,
"learning_rate": 0.00047452564998932446,
"loss": 5.8639,
"mean_token_accuracy": 0.18924974799156188,
"num_tokens": 35732595.0,
"step": 14100
},
{
"entropy": 6.275307750701904,
"epoch": 1.6278130409694171,
"grad_norm": 0.92578125,
"learning_rate": 0.000474506574642949,
"loss": 5.8004,
"mean_token_accuracy": 0.19364307522773744,
"num_tokens": 35744611.0,
"step": 14105
},
{
"entropy": 6.194735336303711,
"epoch": 1.6283900750144258,
"grad_norm": 0.97265625,
"learning_rate": 0.000474487492586269,
"loss": 5.8052,
"mean_token_accuracy": 0.19076161533594133,
"num_tokens": 35757288.0,
"step": 14110
},
{
"entropy": 6.270211219787598,
"epoch": 1.6289671090594346,
"grad_norm": 0.94140625,
"learning_rate": 0.0004744684038199263,
"loss": 5.8733,
"mean_token_accuracy": 0.18648385405540466,
"num_tokens": 35769747.0,
"step": 14115
},
{
"entropy": 6.315110445022583,
"epoch": 1.629544143104443,
"grad_norm": 0.953125,
"learning_rate": 0.00047444930834456293,
"loss": 5.8978,
"mean_token_accuracy": 0.19017856419086457,
"num_tokens": 35781656.0,
"step": 14120
},
{
"entropy": 6.277868747711182,
"epoch": 1.630121177149452,
"grad_norm": 0.90234375,
"learning_rate": 0.0004744302061608212,
"loss": 5.8544,
"mean_token_accuracy": 0.19737848043441772,
"num_tokens": 35794618.0,
"step": 14125
},
{
"entropy": 6.253666496276855,
"epoch": 1.6306982111944603,
"grad_norm": 0.8984375,
"learning_rate": 0.00047441109726934345,
"loss": 5.7741,
"mean_token_accuracy": 0.19238534420728684,
"num_tokens": 35807504.0,
"step": 14130
},
{
"entropy": 6.165348815917969,
"epoch": 1.6312752452394692,
"grad_norm": 1.0078125,
"learning_rate": 0.00047439198167077256,
"loss": 5.7917,
"mean_token_accuracy": 0.19519294947385787,
"num_tokens": 35819668.0,
"step": 14135
},
{
"entropy": 6.2695183753967285,
"epoch": 1.6318522792844776,
"grad_norm": 0.97265625,
"learning_rate": 0.0004743728593657514,
"loss": 5.8348,
"mean_token_accuracy": 0.1945918545126915,
"num_tokens": 35832078.0,
"step": 14140
},
{
"entropy": 6.178915405273438,
"epoch": 1.6324293133294865,
"grad_norm": 0.953125,
"learning_rate": 0.0004743537303549231,
"loss": 5.7189,
"mean_token_accuracy": 0.19973592162132264,
"num_tokens": 35843580.0,
"step": 14145
},
{
"entropy": 6.201517915725708,
"epoch": 1.6330063473744951,
"grad_norm": 0.90234375,
"learning_rate": 0.0004743345946389311,
"loss": 5.7507,
"mean_token_accuracy": 0.2023004561662674,
"num_tokens": 35857146.0,
"step": 14150
},
{
"entropy": 6.266290998458862,
"epoch": 1.6335833814195038,
"grad_norm": 0.90234375,
"learning_rate": 0.00047431545221841907,
"loss": 5.7991,
"mean_token_accuracy": 0.1934083268046379,
"num_tokens": 35869374.0,
"step": 14155
},
{
"entropy": 6.319689178466797,
"epoch": 1.6341604154645124,
"grad_norm": 0.93359375,
"learning_rate": 0.00047429630309403086,
"loss": 5.8254,
"mean_token_accuracy": 0.1859660416841507,
"num_tokens": 35881882.0,
"step": 14160
},
{
"entropy": 6.082709503173828,
"epoch": 1.634737449509521,
"grad_norm": 0.8359375,
"learning_rate": 0.00047427714726641044,
"loss": 5.6478,
"mean_token_accuracy": 0.20330152064561843,
"num_tokens": 35895512.0,
"step": 14165
},
{
"entropy": 6.1116431713104244,
"epoch": 1.6353144835545297,
"grad_norm": 0.81640625,
"learning_rate": 0.00047425798473620215,
"loss": 5.6909,
"mean_token_accuracy": 0.19648269861936568,
"num_tokens": 35908020.0,
"step": 14170
},
{
"entropy": 6.265104627609253,
"epoch": 1.6358915175995383,
"grad_norm": 0.88671875,
"learning_rate": 0.0004742388155040505,
"loss": 5.7543,
"mean_token_accuracy": 0.19779868721961974,
"num_tokens": 35920261.0,
"step": 14175
},
{
"entropy": 6.288595819473267,
"epoch": 1.6364685516445472,
"grad_norm": 0.8671875,
"learning_rate": 0.00047421963957060026,
"loss": 5.9132,
"mean_token_accuracy": 0.18365271687507628,
"num_tokens": 35932135.0,
"step": 14180
},
{
"entropy": 6.19545316696167,
"epoch": 1.6370455856895556,
"grad_norm": 0.8671875,
"learning_rate": 0.0004742004569364964,
"loss": 5.7862,
"mean_token_accuracy": 0.19036284685134888,
"num_tokens": 35944574.0,
"step": 14185
},
{
"entropy": 6.272937345504761,
"epoch": 1.6376226197345645,
"grad_norm": 0.796875,
"learning_rate": 0.00047418126760238416,
"loss": 5.7716,
"mean_token_accuracy": 0.19476332664489746,
"num_tokens": 35956877.0,
"step": 14190
},
{
"entropy": 6.306672048568726,
"epoch": 1.6381996537795729,
"grad_norm": 0.93359375,
"learning_rate": 0.00047416207156890887,
"loss": 5.8893,
"mean_token_accuracy": 0.18866454511880876,
"num_tokens": 35968616.0,
"step": 14195
},
{
"entropy": 6.216367101669311,
"epoch": 1.6387766878245817,
"grad_norm": 0.8984375,
"learning_rate": 0.0004741428688367164,
"loss": 5.8467,
"mean_token_accuracy": 0.19205766469240187,
"num_tokens": 35982401.0,
"step": 14200
},
{
"entropy": 6.269579744338989,
"epoch": 1.6393537218695902,
"grad_norm": 0.87109375,
"learning_rate": 0.00047412365940645225,
"loss": 5.7995,
"mean_token_accuracy": 0.19650813192129135,
"num_tokens": 35994907.0,
"step": 14205
},
{
"entropy": 6.257475233078003,
"epoch": 1.639930755914599,
"grad_norm": 1.0,
"learning_rate": 0.00047410444327876286,
"loss": 5.7485,
"mean_token_accuracy": 0.19474590718746185,
"num_tokens": 36007109.0,
"step": 14210
},
{
"entropy": 6.236335754394531,
"epoch": 1.6405077899596077,
"grad_norm": 0.94921875,
"learning_rate": 0.00047408522045429426,
"loss": 5.8324,
"mean_token_accuracy": 0.1903609052300453,
"num_tokens": 36018734.0,
"step": 14215
},
{
"entropy": 6.257100391387939,
"epoch": 1.6410848240046163,
"grad_norm": 1.015625,
"learning_rate": 0.0004740659909336933,
"loss": 5.7787,
"mean_token_accuracy": 0.2008269727230072,
"num_tokens": 36031427.0,
"step": 14220
},
{
"entropy": 6.285252904891967,
"epoch": 1.641661858049625,
"grad_norm": 0.92578125,
"learning_rate": 0.00047404675471760655,
"loss": 5.8026,
"mean_token_accuracy": 0.1962312713265419,
"num_tokens": 36044726.0,
"step": 14225
},
{
"entropy": 6.20171971321106,
"epoch": 1.6422388920946336,
"grad_norm": 0.89453125,
"learning_rate": 0.0004740275118066811,
"loss": 5.8143,
"mean_token_accuracy": 0.18700166642665864,
"num_tokens": 36056882.0,
"step": 14230
},
{
"entropy": 6.2923260688781735,
"epoch": 1.6428159261396422,
"grad_norm": 0.9765625,
"learning_rate": 0.00047400826220156416,
"loss": 5.8656,
"mean_token_accuracy": 0.18483263552188872,
"num_tokens": 36068548.0,
"step": 14235
},
{
"entropy": 6.342332458496093,
"epoch": 1.6433929601846509,
"grad_norm": 0.92578125,
"learning_rate": 0.00047398900590290313,
"loss": 5.7777,
"mean_token_accuracy": 0.18994950652122497,
"num_tokens": 36080652.0,
"step": 14240
},
{
"entropy": 6.206917762756348,
"epoch": 1.6439699942296595,
"grad_norm": 1.0234375,
"learning_rate": 0.00047396974291134575,
"loss": 5.8173,
"mean_token_accuracy": 0.1934569150209427,
"num_tokens": 36093372.0,
"step": 14245
},
{
"entropy": 6.2440855503082275,
"epoch": 1.6445470282746681,
"grad_norm": 0.875,
"learning_rate": 0.00047395047322754,
"loss": 5.8276,
"mean_token_accuracy": 0.1925554320216179,
"num_tokens": 36106023.0,
"step": 14250
},
{
"entropy": 6.222019481658935,
"epoch": 1.645124062319677,
"grad_norm": 0.9296875,
"learning_rate": 0.00047393119685213374,
"loss": 5.7587,
"mean_token_accuracy": 0.20053549259901046,
"num_tokens": 36119627.0,
"step": 14255
},
{
"entropy": 6.09753794670105,
"epoch": 1.6457010963646854,
"grad_norm": 0.91796875,
"learning_rate": 0.0004739119137857756,
"loss": 5.6112,
"mean_token_accuracy": 0.20973964035511017,
"num_tokens": 36132835.0,
"step": 14260
},
{
"entropy": 6.277415990829468,
"epoch": 1.6462781304096943,
"grad_norm": 0.96484375,
"learning_rate": 0.00047389262402911404,
"loss": 5.7902,
"mean_token_accuracy": 0.19406622946262359,
"num_tokens": 36144234.0,
"step": 14265
},
{
"entropy": 6.198006725311279,
"epoch": 1.6468551644547027,
"grad_norm": 0.85546875,
"learning_rate": 0.00047387332758279784,
"loss": 5.7493,
"mean_token_accuracy": 0.19753192216157914,
"num_tokens": 36158556.0,
"step": 14270
},
{
"entropy": 6.210707807540894,
"epoch": 1.6474321984997116,
"grad_norm": 0.875,
"learning_rate": 0.00047385402444747606,
"loss": 5.8218,
"mean_token_accuracy": 0.1887941062450409,
"num_tokens": 36171698.0,
"step": 14275
},
{
"entropy": 6.213572263717651,
"epoch": 1.64800923254472,
"grad_norm": 0.953125,
"learning_rate": 0.00047383471462379803,
"loss": 5.8067,
"mean_token_accuracy": 0.19627797454595566,
"num_tokens": 36184649.0,
"step": 14280
},
{
"entropy": 6.271010494232177,
"epoch": 1.6485862665897288,
"grad_norm": 0.859375,
"learning_rate": 0.000473815398112413,
"loss": 5.7599,
"mean_token_accuracy": 0.19666724503040314,
"num_tokens": 36197127.0,
"step": 14285
},
{
"entropy": 6.229652214050293,
"epoch": 1.6491633006347375,
"grad_norm": 0.90625,
"learning_rate": 0.0004737960749139708,
"loss": 5.7883,
"mean_token_accuracy": 0.19295482188463212,
"num_tokens": 36209471.0,
"step": 14290
},
{
"entropy": 6.301067876815796,
"epoch": 1.6497403346797461,
"grad_norm": 0.8828125,
"learning_rate": 0.0004737767450291215,
"loss": 5.8443,
"mean_token_accuracy": 0.19018818587064742,
"num_tokens": 36221798.0,
"step": 14295
},
{
"entropy": 6.232090139389038,
"epoch": 1.6503173687247548,
"grad_norm": 0.875,
"learning_rate": 0.00047375740845851506,
"loss": 5.7485,
"mean_token_accuracy": 0.19451043158769607,
"num_tokens": 36235758.0,
"step": 14300
},
{
"entropy": 6.224923515319825,
"epoch": 1.6508944027697634,
"grad_norm": 0.91796875,
"learning_rate": 0.0004737380652028019,
"loss": 5.8011,
"mean_token_accuracy": 0.19222778230905532,
"num_tokens": 36248484.0,
"step": 14305
},
{
"entropy": 6.099427223205566,
"epoch": 1.651471436814772,
"grad_norm": 0.9296875,
"learning_rate": 0.00047371871526263263,
"loss": 5.6429,
"mean_token_accuracy": 0.2055506318807602,
"num_tokens": 36260796.0,
"step": 14310
},
{
"entropy": 6.171128606796264,
"epoch": 1.6520484708597807,
"grad_norm": 0.92578125,
"learning_rate": 0.0004736993586386581,
"loss": 5.7813,
"mean_token_accuracy": 0.19944193214178085,
"num_tokens": 36273617.0,
"step": 14315
},
{
"entropy": 6.160193538665771,
"epoch": 1.6526255049047895,
"grad_norm": 0.96484375,
"learning_rate": 0.00047367999533152934,
"loss": 5.7129,
"mean_token_accuracy": 0.2024203896522522,
"num_tokens": 36286285.0,
"step": 14320
},
{
"entropy": 6.3143633842468265,
"epoch": 1.653202538949798,
"grad_norm": 1.9921875,
"learning_rate": 0.00047366062534189756,
"loss": 5.8611,
"mean_token_accuracy": 0.18911528140306472,
"num_tokens": 36298970.0,
"step": 14325
},
{
"entropy": 6.190754985809326,
"epoch": 1.6537795729948068,
"grad_norm": 0.8671875,
"learning_rate": 0.00047364124867041446,
"loss": 5.7636,
"mean_token_accuracy": 0.19722063839435577,
"num_tokens": 36312684.0,
"step": 14330
},
{
"entropy": 6.189275121688842,
"epoch": 1.6543566070398152,
"grad_norm": 0.89453125,
"learning_rate": 0.00047362186531773156,
"loss": 5.8586,
"mean_token_accuracy": 0.18725836277008057,
"num_tokens": 36326300.0,
"step": 14335
},
{
"entropy": 6.228783130645752,
"epoch": 1.654933641084824,
"grad_norm": 0.92578125,
"learning_rate": 0.0004736024752845008,
"loss": 5.7745,
"mean_token_accuracy": 0.18818582445383072,
"num_tokens": 36338234.0,
"step": 14340
},
{
"entropy": 6.295052719116211,
"epoch": 1.6555106751298325,
"grad_norm": 0.96484375,
"learning_rate": 0.0004735830785713746,
"loss": 5.839,
"mean_token_accuracy": 0.18417955487966536,
"num_tokens": 36351032.0,
"step": 14345
},
{
"entropy": 6.242326784133911,
"epoch": 1.6560877091748414,
"grad_norm": 0.90625,
"learning_rate": 0.0004735636751790051,
"loss": 5.7387,
"mean_token_accuracy": 0.1901518702507019,
"num_tokens": 36363267.0,
"step": 14350
},
{
"entropy": 6.219479417800903,
"epoch": 1.65666474321985,
"grad_norm": 1.046875,
"learning_rate": 0.000473544265108045,
"loss": 5.8147,
"mean_token_accuracy": 0.19406894594430923,
"num_tokens": 36375628.0,
"step": 14355
},
{
"entropy": 6.241999006271362,
"epoch": 1.6572417772648587,
"grad_norm": 0.94140625,
"learning_rate": 0.00047352484835914716,
"loss": 5.8367,
"mean_token_accuracy": 0.18755433857440948,
"num_tokens": 36388161.0,
"step": 14360
},
{
"entropy": 6.253871107101441,
"epoch": 1.6578188113098673,
"grad_norm": 0.9296875,
"learning_rate": 0.0004735054249329647,
"loss": 5.7901,
"mean_token_accuracy": 0.19120151847600936,
"num_tokens": 36400287.0,
"step": 14365
},
{
"entropy": 6.257974624633789,
"epoch": 1.658395845354876,
"grad_norm": 0.8515625,
"learning_rate": 0.00047348599483015087,
"loss": 5.8799,
"mean_token_accuracy": 0.19049407839775084,
"num_tokens": 36413896.0,
"step": 14370
},
{
"entropy": 6.253906106948852,
"epoch": 1.6589728793998846,
"grad_norm": 0.88671875,
"learning_rate": 0.00047346655805135916,
"loss": 5.7927,
"mean_token_accuracy": 0.19061724245548248,
"num_tokens": 36425812.0,
"step": 14375
},
{
"entropy": 6.214411783218384,
"epoch": 1.6595499134448932,
"grad_norm": 0.875,
"learning_rate": 0.0004734471145972434,
"loss": 5.7935,
"mean_token_accuracy": 0.18819109499454498,
"num_tokens": 36438977.0,
"step": 14380
},
{
"entropy": 6.262951374053955,
"epoch": 1.6601269474899019,
"grad_norm": 0.92578125,
"learning_rate": 0.00047342766446845753,
"loss": 5.8245,
"mean_token_accuracy": 0.1869310572743416,
"num_tokens": 36453173.0,
"step": 14385
},
{
"entropy": 6.281124496459961,
"epoch": 1.6607039815349105,
"grad_norm": 0.98046875,
"learning_rate": 0.0004734082076656557,
"loss": 5.7762,
"mean_token_accuracy": 0.1942988872528076,
"num_tokens": 36464977.0,
"step": 14390
},
{
"entropy": 6.250260543823242,
"epoch": 1.6612810155799194,
"grad_norm": 0.95703125,
"learning_rate": 0.00047338874418949235,
"loss": 5.896,
"mean_token_accuracy": 0.18223095685243607,
"num_tokens": 36476951.0,
"step": 14395
},
{
"entropy": 6.25014476776123,
"epoch": 1.6618580496249278,
"grad_norm": 0.8203125,
"learning_rate": 0.00047336927404062213,
"loss": 5.876,
"mean_token_accuracy": 0.18608336001634598,
"num_tokens": 36490387.0,
"step": 14400
},
{
"entropy": 6.303406810760498,
"epoch": 1.6624350836699366,
"grad_norm": 0.9453125,
"learning_rate": 0.00047334979721969995,
"loss": 5.8402,
"mean_token_accuracy": 0.18937479555606843,
"num_tokens": 36501958.0,
"step": 14405
},
{
"entropy": 6.3160100936889645,
"epoch": 1.663012117714945,
"grad_norm": 0.87890625,
"learning_rate": 0.0004733303137273808,
"loss": 5.8947,
"mean_token_accuracy": 0.18646145313978196,
"num_tokens": 36515355.0,
"step": 14410
},
{
"entropy": 6.299543190002441,
"epoch": 1.663589151759954,
"grad_norm": 0.91796875,
"learning_rate": 0.00047331082356432015,
"loss": 5.8883,
"mean_token_accuracy": 0.18837940245866774,
"num_tokens": 36528288.0,
"step": 14415
},
{
"entropy": 6.350749063491821,
"epoch": 1.6641661858049623,
"grad_norm": 0.97265625,
"learning_rate": 0.0004732913267311734,
"loss": 5.8876,
"mean_token_accuracy": 0.18897933512926102,
"num_tokens": 36541577.0,
"step": 14420
},
{
"entropy": 6.26870493888855,
"epoch": 1.6647432198499712,
"grad_norm": 0.953125,
"learning_rate": 0.0004732718232285964,
"loss": 5.8037,
"mean_token_accuracy": 0.19384131133556365,
"num_tokens": 36554802.0,
"step": 14425
},
{
"entropy": 6.243334054946899,
"epoch": 1.6653202538949798,
"grad_norm": 0.90625,
"learning_rate": 0.00047325231305724507,
"loss": 5.7683,
"mean_token_accuracy": 0.19212243258953093,
"num_tokens": 36567175.0,
"step": 14430
},
{
"entropy": 6.189241361618042,
"epoch": 1.6658972879399885,
"grad_norm": 0.88671875,
"learning_rate": 0.0004732327962177757,
"loss": 5.7606,
"mean_token_accuracy": 0.20297178626060486,
"num_tokens": 36579391.0,
"step": 14435
},
{
"entropy": 6.300449275970459,
"epoch": 1.6664743219849971,
"grad_norm": 0.9609375,
"learning_rate": 0.0004732132727108447,
"loss": 5.8576,
"mean_token_accuracy": 0.18773895353078843,
"num_tokens": 36592684.0,
"step": 14440
},
{
"entropy": 6.249213838577271,
"epoch": 1.6670513560300058,
"grad_norm": 0.94140625,
"learning_rate": 0.00047319374253710874,
"loss": 5.8894,
"mean_token_accuracy": 0.1900160625576973,
"num_tokens": 36604996.0,
"step": 14445
},
{
"entropy": 6.278888511657715,
"epoch": 1.6676283900750144,
"grad_norm": 0.90625,
"learning_rate": 0.0004731742056972247,
"loss": 5.7876,
"mean_token_accuracy": 0.19654055088758468,
"num_tokens": 36618914.0,
"step": 14450
},
{
"entropy": 6.2485129833221436,
"epoch": 1.668205424120023,
"grad_norm": 0.953125,
"learning_rate": 0.0004731546621918497,
"loss": 5.7587,
"mean_token_accuracy": 0.19068465381860733,
"num_tokens": 36630527.0,
"step": 14455
},
{
"entropy": 6.2103640079498295,
"epoch": 1.668782458165032,
"grad_norm": 0.89453125,
"learning_rate": 0.000473135112021641,
"loss": 5.8591,
"mean_token_accuracy": 0.18707639425992967,
"num_tokens": 36642605.0,
"step": 14460
},
{
"entropy": 6.25440354347229,
"epoch": 1.6693594922100403,
"grad_norm": 0.9140625,
"learning_rate": 0.00047311555518725617,
"loss": 5.7669,
"mean_token_accuracy": 0.19207081943750381,
"num_tokens": 36655075.0,
"step": 14465
},
{
"entropy": 6.2060243606567385,
"epoch": 1.6699365262550492,
"grad_norm": 0.91015625,
"learning_rate": 0.00047309599168935323,
"loss": 5.7996,
"mean_token_accuracy": 0.19139713943004608,
"num_tokens": 36667684.0,
"step": 14470
},
{
"entropy": 6.264299297332764,
"epoch": 1.6705135603000576,
"grad_norm": 0.8984375,
"learning_rate": 0.00047307642152858993,
"loss": 5.8135,
"mean_token_accuracy": 0.19109832346439362,
"num_tokens": 36679656.0,
"step": 14475
},
{
"entropy": 6.1772970199584964,
"epoch": 1.6710905943450665,
"grad_norm": 0.98046875,
"learning_rate": 0.00047305684470562453,
"loss": 5.755,
"mean_token_accuracy": 0.19919458031654358,
"num_tokens": 36691691.0,
"step": 14480
},
{
"entropy": 6.228798484802246,
"epoch": 1.6716676283900749,
"grad_norm": 0.8828125,
"learning_rate": 0.0004730372612211156,
"loss": 5.8375,
"mean_token_accuracy": 0.19381739795207978,
"num_tokens": 36703615.0,
"step": 14485
},
{
"entropy": 6.282718276977539,
"epoch": 1.6722446624350837,
"grad_norm": 0.88671875,
"learning_rate": 0.00047301767107572174,
"loss": 5.8186,
"mean_token_accuracy": 0.1860135242342949,
"num_tokens": 36716299.0,
"step": 14490
},
{
"entropy": 6.275322389602661,
"epoch": 1.6728216964800924,
"grad_norm": 1.015625,
"learning_rate": 0.0004729980742701018,
"loss": 5.8049,
"mean_token_accuracy": 0.18858209103345872,
"num_tokens": 36727723.0,
"step": 14495
},
{
"entropy": 6.198411750793457,
"epoch": 1.673398730525101,
"grad_norm": 0.953125,
"learning_rate": 0.0004729784708049151,
"loss": 5.6589,
"mean_token_accuracy": 0.20318579077720642,
"num_tokens": 36740497.0,
"step": 14500
},
{
"entropy": 6.123383331298828,
"epoch": 1.6739757645701097,
"grad_norm": 0.9140625,
"learning_rate": 0.0004729588606808209,
"loss": 5.7248,
"mean_token_accuracy": 0.19112390279769897,
"num_tokens": 36752862.0,
"step": 14505
},
{
"entropy": 6.287880277633667,
"epoch": 1.6745527986151183,
"grad_norm": 0.921875,
"learning_rate": 0.00047293924389847864,
"loss": 5.7944,
"mean_token_accuracy": 0.19351442903280258,
"num_tokens": 36765948.0,
"step": 14510
},
{
"entropy": 6.265487384796143,
"epoch": 1.675129832660127,
"grad_norm": 0.8359375,
"learning_rate": 0.0004729196204585483,
"loss": 5.8009,
"mean_token_accuracy": 0.19770944267511367,
"num_tokens": 36778768.0,
"step": 14515
},
{
"entropy": 6.250596046447754,
"epoch": 1.6757068667051356,
"grad_norm": 0.92578125,
"learning_rate": 0.00047289999036168983,
"loss": 5.8277,
"mean_token_accuracy": 0.18962397873401643,
"num_tokens": 36790941.0,
"step": 14520
},
{
"entropy": 6.276755619049072,
"epoch": 1.6762839007501442,
"grad_norm": 0.93359375,
"learning_rate": 0.0004728803536085634,
"loss": 5.8926,
"mean_token_accuracy": 0.1894552379846573,
"num_tokens": 36803984.0,
"step": 14525
},
{
"entropy": 6.22985348701477,
"epoch": 1.6768609347951529,
"grad_norm": 1.0703125,
"learning_rate": 0.00047286071019982974,
"loss": 5.7018,
"mean_token_accuracy": 0.20174630880355834,
"num_tokens": 36815079.0,
"step": 14530
},
{
"entropy": 6.265960168838501,
"epoch": 1.6774379688401617,
"grad_norm": 0.95703125,
"learning_rate": 0.00047284106013614926,
"loss": 5.8432,
"mean_token_accuracy": 0.19024327546358108,
"num_tokens": 36828007.0,
"step": 14535
},
{
"entropy": 6.286230373382568,
"epoch": 1.6780150028851701,
"grad_norm": 0.91015625,
"learning_rate": 0.000472821403418183,
"loss": 5.9272,
"mean_token_accuracy": 0.18469211161136628,
"num_tokens": 36841762.0,
"step": 14540
},
{
"entropy": 6.2628261089324955,
"epoch": 1.678592036930179,
"grad_norm": 0.8828125,
"learning_rate": 0.0004728017400465921,
"loss": 5.7975,
"mean_token_accuracy": 0.1922488570213318,
"num_tokens": 36854624.0,
"step": 14545
},
{
"entropy": 6.246957540512085,
"epoch": 1.6791690709751874,
"grad_norm": 0.890625,
"learning_rate": 0.00047278207002203796,
"loss": 5.7187,
"mean_token_accuracy": 0.1921593114733696,
"num_tokens": 36866266.0,
"step": 14550
},
{
"entropy": 6.253695058822632,
"epoch": 1.6797461050201963,
"grad_norm": 0.890625,
"learning_rate": 0.00047276239334518216,
"loss": 5.858,
"mean_token_accuracy": 0.19074209034442902,
"num_tokens": 36878813.0,
"step": 14555
},
{
"entropy": 6.23266019821167,
"epoch": 1.6803231390652047,
"grad_norm": 0.953125,
"learning_rate": 0.00047274271001668646,
"loss": 5.798,
"mean_token_accuracy": 0.1866303414106369,
"num_tokens": 36891848.0,
"step": 14560
},
{
"entropy": 6.179357194900513,
"epoch": 1.6809001731102136,
"grad_norm": 0.9609375,
"learning_rate": 0.00047272302003721286,
"loss": 5.799,
"mean_token_accuracy": 0.190840882062912,
"num_tokens": 36903861.0,
"step": 14565
},
{
"entropy": 6.256790113449097,
"epoch": 1.6814772071552222,
"grad_norm": 0.8828125,
"learning_rate": 0.00047270332340742377,
"loss": 5.8563,
"mean_token_accuracy": 0.18791476786136627,
"num_tokens": 36916849.0,
"step": 14570
},
{
"entropy": 6.325413751602173,
"epoch": 1.6820542412002308,
"grad_norm": 0.9453125,
"learning_rate": 0.00047268362012798157,
"loss": 5.8472,
"mean_token_accuracy": 0.18315469324588776,
"num_tokens": 36929559.0,
"step": 14575
},
{
"entropy": 6.102227115631104,
"epoch": 1.6826312752452395,
"grad_norm": 1.703125,
"learning_rate": 0.0004726639101995491,
"loss": 5.5979,
"mean_token_accuracy": 0.20988662987947465,
"num_tokens": 36943958.0,
"step": 14580
},
{
"entropy": 6.208522462844849,
"epoch": 1.6832083092902481,
"grad_norm": 0.94921875,
"learning_rate": 0.00047264419362278906,
"loss": 5.7652,
"mean_token_accuracy": 0.19693288952112198,
"num_tokens": 36956542.0,
"step": 14585
},
{
"entropy": 6.227226400375367,
"epoch": 1.6837853433352568,
"grad_norm": 0.93359375,
"learning_rate": 0.00047262447039836484,
"loss": 5.8169,
"mean_token_accuracy": 0.19118765741586685,
"num_tokens": 36968872.0,
"step": 14590
},
{
"entropy": 6.201617908477783,
"epoch": 1.6843623773802654,
"grad_norm": 0.8984375,
"learning_rate": 0.00047260474052693963,
"loss": 5.7863,
"mean_token_accuracy": 0.1912344291806221,
"num_tokens": 36982234.0,
"step": 14595
},
{
"entropy": 6.216722536087036,
"epoch": 1.684939411425274,
"grad_norm": 0.97265625,
"learning_rate": 0.00047258500400917724,
"loss": 5.7898,
"mean_token_accuracy": 0.19123946577310563,
"num_tokens": 36994407.0,
"step": 14600
},
{
"entropy": 6.290629053115845,
"epoch": 1.6855164454702827,
"grad_norm": 0.92578125,
"learning_rate": 0.00047256526084574137,
"loss": 5.831,
"mean_token_accuracy": 0.1835671290755272,
"num_tokens": 37006147.0,
"step": 14605
},
{
"entropy": 6.270266962051392,
"epoch": 1.6860934795152915,
"grad_norm": 0.97265625,
"learning_rate": 0.00047254551103729597,
"loss": 5.766,
"mean_token_accuracy": 0.19732389599084854,
"num_tokens": 37018206.0,
"step": 14610
},
{
"entropy": 6.258600664138794,
"epoch": 1.6866705135603,
"grad_norm": 0.91015625,
"learning_rate": 0.0004725257545845055,
"loss": 5.8646,
"mean_token_accuracy": 0.18402135372161865,
"num_tokens": 37030632.0,
"step": 14615
},
{
"entropy": 6.138081741333008,
"epoch": 1.6872475476053088,
"grad_norm": 0.90625,
"learning_rate": 0.00047250599148803443,
"loss": 5.6794,
"mean_token_accuracy": 0.199339559674263,
"num_tokens": 37041700.0,
"step": 14620
},
{
"entropy": 6.236639738082886,
"epoch": 1.6878245816503172,
"grad_norm": 0.8828125,
"learning_rate": 0.00047248622174854746,
"loss": 5.8093,
"mean_token_accuracy": 0.1956299975514412,
"num_tokens": 37054467.0,
"step": 14625
},
{
"entropy": 6.167034578323364,
"epoch": 1.688401615695326,
"grad_norm": 0.91796875,
"learning_rate": 0.0004724664453667094,
"loss": 5.7254,
"mean_token_accuracy": 0.1935678869485855,
"num_tokens": 37066596.0,
"step": 14630
},
{
"entropy": 6.227866506576538,
"epoch": 1.6889786497403345,
"grad_norm": 0.90625,
"learning_rate": 0.0004724466623431857,
"loss": 5.856,
"mean_token_accuracy": 0.18633525371551513,
"num_tokens": 37078812.0,
"step": 14635
},
{
"entropy": 6.278513717651367,
"epoch": 1.6895556837853434,
"grad_norm": 0.88671875,
"learning_rate": 0.0004724268726786415,
"loss": 5.8192,
"mean_token_accuracy": 0.1916288822889328,
"num_tokens": 37090916.0,
"step": 14640
},
{
"entropy": 6.161556243896484,
"epoch": 1.690132717830352,
"grad_norm": 0.90234375,
"learning_rate": 0.0004724070763737424,
"loss": 5.6629,
"mean_token_accuracy": 0.20890249609947203,
"num_tokens": 37104687.0,
"step": 14645
},
{
"entropy": 6.254812526702881,
"epoch": 1.6907097518753607,
"grad_norm": 0.9453125,
"learning_rate": 0.0004723872734291545,
"loss": 5.867,
"mean_token_accuracy": 0.19037088453769685,
"num_tokens": 37117763.0,
"step": 14650
},
{
"entropy": 6.245172071456909,
"epoch": 1.6912867859203693,
"grad_norm": 1.1875,
"learning_rate": 0.00047236746384554364,
"loss": 5.7302,
"mean_token_accuracy": 0.19735212624073029,
"num_tokens": 37130355.0,
"step": 14655
},
{
"entropy": 6.27752685546875,
"epoch": 1.691863819965378,
"grad_norm": 0.95703125,
"learning_rate": 0.0004723476476235762,
"loss": 5.7599,
"mean_token_accuracy": 0.19666002839803695,
"num_tokens": 37142116.0,
"step": 14660
},
{
"entropy": 6.163359785079956,
"epoch": 1.6924408540103866,
"grad_norm": 0.84375,
"learning_rate": 0.0004723278247639186,
"loss": 5.741,
"mean_token_accuracy": 0.19864833503961563,
"num_tokens": 37153841.0,
"step": 14665
},
{
"entropy": 6.198128128051758,
"epoch": 1.6930178880553952,
"grad_norm": 0.91796875,
"learning_rate": 0.0004723079952672377,
"loss": 5.7553,
"mean_token_accuracy": 0.19592914432287217,
"num_tokens": 37165119.0,
"step": 14670
},
{
"entropy": 6.284871768951416,
"epoch": 1.693594922100404,
"grad_norm": 0.99609375,
"learning_rate": 0.00047228815913420035,
"loss": 5.8468,
"mean_token_accuracy": 0.19341864287853242,
"num_tokens": 37178188.0,
"step": 14675
},
{
"entropy": 6.171255970001221,
"epoch": 1.6941719561454125,
"grad_norm": 0.9609375,
"learning_rate": 0.0004722683163654738,
"loss": 5.716,
"mean_token_accuracy": 0.20382838249206542,
"num_tokens": 37190211.0,
"step": 14680
},
{
"entropy": 6.188739013671875,
"epoch": 1.6947489901904214,
"grad_norm": 0.98046875,
"learning_rate": 0.0004722484669617254,
"loss": 5.7178,
"mean_token_accuracy": 0.19711641371250152,
"num_tokens": 37202408.0,
"step": 14685
},
{
"entropy": 6.259600734710693,
"epoch": 1.6953260242354298,
"grad_norm": 0.92578125,
"learning_rate": 0.00047222861092362277,
"loss": 5.8085,
"mean_token_accuracy": 0.190089850127697,
"num_tokens": 37214393.0,
"step": 14690
},
{
"entropy": 6.2397665023803714,
"epoch": 1.6959030582804386,
"grad_norm": 0.8984375,
"learning_rate": 0.00047220874825183387,
"loss": 5.7293,
"mean_token_accuracy": 0.19584015309810637,
"num_tokens": 37227212.0,
"step": 14695
},
{
"entropy": 6.1494776725769045,
"epoch": 1.696480092325447,
"grad_norm": 0.95703125,
"learning_rate": 0.00047218887894702656,
"loss": 5.7782,
"mean_token_accuracy": 0.1920495629310608,
"num_tokens": 37239742.0,
"step": 14700
},
{
"entropy": 6.268459510803223,
"epoch": 1.697057126370456,
"grad_norm": 0.89453125,
"learning_rate": 0.0004721690030098693,
"loss": 5.8354,
"mean_token_accuracy": 0.1878738060593605,
"num_tokens": 37254037.0,
"step": 14705
},
{
"entropy": 6.303516960144043,
"epoch": 1.6976341604154646,
"grad_norm": 0.921875,
"learning_rate": 0.0004721491204410305,
"loss": 5.8516,
"mean_token_accuracy": 0.18976494073867797,
"num_tokens": 37265221.0,
"step": 14710
},
{
"entropy": 6.296883869171142,
"epoch": 1.6982111944604732,
"grad_norm": 0.96484375,
"learning_rate": 0.00047212923124117915,
"loss": 5.8096,
"mean_token_accuracy": 0.19008704870939255,
"num_tokens": 37277992.0,
"step": 14715
},
{
"entropy": 6.190418481826782,
"epoch": 1.6987882285054818,
"grad_norm": 0.8984375,
"learning_rate": 0.0004721093354109839,
"loss": 5.7514,
"mean_token_accuracy": 0.1978226602077484,
"num_tokens": 37291608.0,
"step": 14720
},
{
"entropy": 6.243216705322266,
"epoch": 1.6993652625504905,
"grad_norm": 0.94140625,
"learning_rate": 0.00047208943295111406,
"loss": 5.805,
"mean_token_accuracy": 0.18855539560317994,
"num_tokens": 37303619.0,
"step": 14725
},
{
"entropy": 6.267891263961792,
"epoch": 1.6999422965954991,
"grad_norm": 0.8984375,
"learning_rate": 0.00047206952386223905,
"loss": 5.8398,
"mean_token_accuracy": 0.1896793693304062,
"num_tokens": 37316215.0,
"step": 14730
},
{
"entropy": 6.196926593780518,
"epoch": 1.7005193306405078,
"grad_norm": 0.92578125,
"learning_rate": 0.0004720496081450285,
"loss": 5.8059,
"mean_token_accuracy": 0.19608232825994493,
"num_tokens": 37328643.0,
"step": 14735
},
{
"entropy": 6.205492639541626,
"epoch": 1.7010963646855164,
"grad_norm": 0.984375,
"learning_rate": 0.00047202968580015224,
"loss": 5.7457,
"mean_token_accuracy": 0.19729107320308686,
"num_tokens": 37340792.0,
"step": 14740
},
{
"entropy": 6.328804779052734,
"epoch": 1.701673398730525,
"grad_norm": 0.95703125,
"learning_rate": 0.00047200975682828045,
"loss": 5.7846,
"mean_token_accuracy": 0.18756407052278518,
"num_tokens": 37353866.0,
"step": 14745
},
{
"entropy": 6.197791004180909,
"epoch": 1.702250432775534,
"grad_norm": 0.88671875,
"learning_rate": 0.0004719898212300832,
"loss": 5.7893,
"mean_token_accuracy": 0.1926332965493202,
"num_tokens": 37365403.0,
"step": 14750
},
{
"entropy": 6.213804912567139,
"epoch": 1.7028274668205423,
"grad_norm": 0.9296875,
"learning_rate": 0.00047196987900623134,
"loss": 5.7799,
"mean_token_accuracy": 0.1956440106034279,
"num_tokens": 37379487.0,
"step": 14755
},
{
"entropy": 6.288925409317017,
"epoch": 1.7034045008655512,
"grad_norm": 0.89453125,
"learning_rate": 0.00047194993015739527,
"loss": 5.7255,
"mean_token_accuracy": 0.19549834579229355,
"num_tokens": 37392497.0,
"step": 14760
},
{
"entropy": 6.151324367523193,
"epoch": 1.7039815349105596,
"grad_norm": 0.89453125,
"learning_rate": 0.00047192997468424624,
"loss": 5.6554,
"mean_token_accuracy": 0.2037911593914032,
"num_tokens": 37407126.0,
"step": 14765
},
{
"entropy": 6.107523441314697,
"epoch": 1.7045585689555685,
"grad_norm": 0.88671875,
"learning_rate": 0.0004719100125874553,
"loss": 5.7359,
"mean_token_accuracy": 0.20345260202884674,
"num_tokens": 37419768.0,
"step": 14770
},
{
"entropy": 6.216525936126709,
"epoch": 1.7051356030005769,
"grad_norm": 0.95703125,
"learning_rate": 0.0004718900438676939,
"loss": 5.7706,
"mean_token_accuracy": 0.1966918244957924,
"num_tokens": 37432512.0,
"step": 14775
},
{
"entropy": 6.280521440505981,
"epoch": 1.7057126370455857,
"grad_norm": 0.9921875,
"learning_rate": 0.0004718700685256337,
"loss": 5.8818,
"mean_token_accuracy": 0.19116677343845367,
"num_tokens": 37445006.0,
"step": 14780
},
{
"entropy": 6.279793214797974,
"epoch": 1.7062896710905944,
"grad_norm": 0.921875,
"learning_rate": 0.0004718500865619465,
"loss": 5.8623,
"mean_token_accuracy": 0.18711167126893996,
"num_tokens": 37457386.0,
"step": 14785
},
{
"entropy": 6.241596269607544,
"epoch": 1.706866705135603,
"grad_norm": 0.95703125,
"learning_rate": 0.0004718300979773044,
"loss": 5.7351,
"mean_token_accuracy": 0.2007654130458832,
"num_tokens": 37469773.0,
"step": 14790
},
{
"entropy": 6.293059015274048,
"epoch": 1.7074437391806117,
"grad_norm": 0.89453125,
"learning_rate": 0.00047181010277237977,
"loss": 5.7562,
"mean_token_accuracy": 0.20070116072893143,
"num_tokens": 37483301.0,
"step": 14795
},
{
"entropy": 6.245371294021607,
"epoch": 1.7080207732256203,
"grad_norm": 0.93359375,
"learning_rate": 0.0004717901009478451,
"loss": 5.821,
"mean_token_accuracy": 0.19299632906913758,
"num_tokens": 37495110.0,
"step": 14800
},
{
"entropy": 6.242628049850464,
"epoch": 1.708597807270629,
"grad_norm": 0.87109375,
"learning_rate": 0.00047177009250437313,
"loss": 5.7363,
"mean_token_accuracy": 0.20338231921195984,
"num_tokens": 37509281.0,
"step": 14805
},
{
"entropy": 6.195139837265015,
"epoch": 1.7091748413156376,
"grad_norm": 0.93359375,
"learning_rate": 0.00047175007744263683,
"loss": 5.7811,
"mean_token_accuracy": 0.19870874732732774,
"num_tokens": 37522690.0,
"step": 14810
},
{
"entropy": 6.209357118606567,
"epoch": 1.7097518753606464,
"grad_norm": 0.88671875,
"learning_rate": 0.00047173005576330935,
"loss": 5.7857,
"mean_token_accuracy": 0.19668878614902496,
"num_tokens": 37534737.0,
"step": 14815
},
{
"entropy": 6.265194892883301,
"epoch": 1.7103289094056549,
"grad_norm": 0.96484375,
"learning_rate": 0.00047171002746706424,
"loss": 5.8194,
"mean_token_accuracy": 0.19461351931095122,
"num_tokens": 37547486.0,
"step": 14820
},
{
"entropy": 6.374362993240356,
"epoch": 1.7109059434506637,
"grad_norm": 1.0,
"learning_rate": 0.00047168999255457506,
"loss": 5.8569,
"mean_token_accuracy": 0.1927626445889473,
"num_tokens": 37560083.0,
"step": 14825
},
{
"entropy": 6.199889993667602,
"epoch": 1.7114829774956721,
"grad_norm": 0.921875,
"learning_rate": 0.00047166995102651565,
"loss": 5.75,
"mean_token_accuracy": 0.19805205762386321,
"num_tokens": 37573260.0,
"step": 14830
},
{
"entropy": 6.248316097259521,
"epoch": 1.712060011540681,
"grad_norm": 0.953125,
"learning_rate": 0.0004716499028835601,
"loss": 5.8518,
"mean_token_accuracy": 0.19746263325214386,
"num_tokens": 37586403.0,
"step": 14835
},
{
"entropy": 6.225171422958374,
"epoch": 1.7126370455856894,
"grad_norm": 0.9453125,
"learning_rate": 0.0004716298481263828,
"loss": 5.7769,
"mean_token_accuracy": 0.2004181981086731,
"num_tokens": 37600771.0,
"step": 14840
},
{
"entropy": 6.297064113616943,
"epoch": 1.7132140796306983,
"grad_norm": 1.0,
"learning_rate": 0.0004716097867556583,
"loss": 5.7504,
"mean_token_accuracy": 0.19541673809289933,
"num_tokens": 37613623.0,
"step": 14845
},
{
"entropy": 6.210472059249878,
"epoch": 1.713791113675707,
"grad_norm": 1.0234375,
"learning_rate": 0.00047158971877206114,
"loss": 5.7217,
"mean_token_accuracy": 0.19584263861179352,
"num_tokens": 37624539.0,
"step": 14850
},
{
"entropy": 6.214003038406372,
"epoch": 1.7143681477207156,
"grad_norm": 0.984375,
"learning_rate": 0.0004715696441762665,
"loss": 5.8254,
"mean_token_accuracy": 0.18597609251737596,
"num_tokens": 37636556.0,
"step": 14855
},
{
"entropy": 6.274157619476318,
"epoch": 1.7149451817657242,
"grad_norm": 0.90625,
"learning_rate": 0.00047154956296894954,
"loss": 5.7861,
"mean_token_accuracy": 0.1940763294696808,
"num_tokens": 37648369.0,
"step": 14860
},
{
"entropy": 6.290304517745971,
"epoch": 1.7155222158107328,
"grad_norm": 0.99609375,
"learning_rate": 0.0004715294751507856,
"loss": 5.8648,
"mean_token_accuracy": 0.18487513512372972,
"num_tokens": 37661118.0,
"step": 14865
},
{
"entropy": 6.264235591888427,
"epoch": 1.7160992498557415,
"grad_norm": 0.921875,
"learning_rate": 0.0004715093807224505,
"loss": 5.7724,
"mean_token_accuracy": 0.19355957508087157,
"num_tokens": 37673915.0,
"step": 14870
},
{
"entropy": 6.220427656173706,
"epoch": 1.71667628390075,
"grad_norm": 0.796875,
"learning_rate": 0.00047148927968462,
"loss": 5.786,
"mean_token_accuracy": 0.1952811747789383,
"num_tokens": 37687359.0,
"step": 14875
},
{
"entropy": 6.213399982452392,
"epoch": 1.7172533179457588,
"grad_norm": 0.87109375,
"learning_rate": 0.00047146917203797,
"loss": 5.7825,
"mean_token_accuracy": 0.19128514379262923,
"num_tokens": 37700111.0,
"step": 14880
},
{
"entropy": 6.358771228790284,
"epoch": 1.7178303519907674,
"grad_norm": 0.921875,
"learning_rate": 0.0004714490577831771,
"loss": 5.932,
"mean_token_accuracy": 0.18157403022050858,
"num_tokens": 37712707.0,
"step": 14885
},
{
"entropy": 6.3575211524963375,
"epoch": 1.7184073860357763,
"grad_norm": 0.9296875,
"learning_rate": 0.0004714289369209177,
"loss": 5.8625,
"mean_token_accuracy": 0.1848388597369194,
"num_tokens": 37724242.0,
"step": 14890
},
{
"entropy": 6.273309421539307,
"epoch": 1.7189844200807847,
"grad_norm": 0.9453125,
"learning_rate": 0.00047140880945186863,
"loss": 5.7986,
"mean_token_accuracy": 0.19703706353902817,
"num_tokens": 37737451.0,
"step": 14895
},
{
"entropy": 6.281686735153198,
"epoch": 1.7195614541257935,
"grad_norm": 0.921875,
"learning_rate": 0.00047138867537670676,
"loss": 5.8386,
"mean_token_accuracy": 0.18533087223768235,
"num_tokens": 37749968.0,
"step": 14900
},
{
"entropy": 6.230262804031372,
"epoch": 1.720138488170802,
"grad_norm": 0.921875,
"learning_rate": 0.00047136853469610933,
"loss": 5.748,
"mean_token_accuracy": 0.20007234215736389,
"num_tokens": 37761961.0,
"step": 14905
},
{
"entropy": 6.231614208221435,
"epoch": 1.7207155222158108,
"grad_norm": 0.953125,
"learning_rate": 0.00047134838741075383,
"loss": 5.784,
"mean_token_accuracy": 0.19633534252643586,
"num_tokens": 37775089.0,
"step": 14910
},
{
"entropy": 6.256774854660034,
"epoch": 1.7212925562608192,
"grad_norm": 0.87890625,
"learning_rate": 0.00047132823352131787,
"loss": 5.8697,
"mean_token_accuracy": 0.18893859386444092,
"num_tokens": 37787072.0,
"step": 14915
},
{
"entropy": 6.238740253448486,
"epoch": 1.721869590305828,
"grad_norm": 0.96875,
"learning_rate": 0.0004713080730284793,
"loss": 5.7746,
"mean_token_accuracy": 0.1915179818868637,
"num_tokens": 37799162.0,
"step": 14920
},
{
"entropy": 6.227374458312989,
"epoch": 1.7224466243508367,
"grad_norm": 0.89453125,
"learning_rate": 0.00047128790593291617,
"loss": 5.8036,
"mean_token_accuracy": 0.1961027055978775,
"num_tokens": 37811560.0,
"step": 14925
},
{
"entropy": 6.2812048435211185,
"epoch": 1.7230236583958454,
"grad_norm": 0.9609375,
"learning_rate": 0.00047126773223530677,
"loss": 5.7289,
"mean_token_accuracy": 0.1987067461013794,
"num_tokens": 37823832.0,
"step": 14930
},
{
"entropy": 6.285789251327515,
"epoch": 1.723600692440854,
"grad_norm": 0.90234375,
"learning_rate": 0.00047124755193632975,
"loss": 5.8148,
"mean_token_accuracy": 0.19008388817310334,
"num_tokens": 37836718.0,
"step": 14935
},
{
"entropy": 6.151156234741211,
"epoch": 1.7241777264858626,
"grad_norm": 0.8671875,
"learning_rate": 0.00047122736503666377,
"loss": 5.7345,
"mean_token_accuracy": 0.19504396617412567,
"num_tokens": 37850001.0,
"step": 14940
},
{
"entropy": 6.159657716751099,
"epoch": 1.7247547605308713,
"grad_norm": 0.90625,
"learning_rate": 0.0004712071715369878,
"loss": 5.6801,
"mean_token_accuracy": 0.2019476920366287,
"num_tokens": 37862425.0,
"step": 14945
},
{
"entropy": 6.231092023849487,
"epoch": 1.72533179457588,
"grad_norm": 0.94140625,
"learning_rate": 0.0004711869714379812,
"loss": 5.7032,
"mean_token_accuracy": 0.19919241815805436,
"num_tokens": 37874429.0,
"step": 14950
},
{
"entropy": 6.18427791595459,
"epoch": 1.7259088286208888,
"grad_norm": 0.9765625,
"learning_rate": 0.0004711667647403232,
"loss": 5.7714,
"mean_token_accuracy": 0.1992158979177475,
"num_tokens": 37888317.0,
"step": 14955
},
{
"entropy": 6.216259098052978,
"epoch": 1.7264858626658972,
"grad_norm": 0.875,
"learning_rate": 0.00047114655144469354,
"loss": 5.7637,
"mean_token_accuracy": 0.19563002586364747,
"num_tokens": 37901101.0,
"step": 14960
},
{
"entropy": 6.275106811523438,
"epoch": 1.727062896710906,
"grad_norm": 1.1328125,
"learning_rate": 0.00047112633155177203,
"loss": 5.8041,
"mean_token_accuracy": 0.19201582670211792,
"num_tokens": 37914013.0,
"step": 14965
},
{
"entropy": 6.162282419204712,
"epoch": 1.7276399307559145,
"grad_norm": 0.88671875,
"learning_rate": 0.0004711061050622388,
"loss": 5.7177,
"mean_token_accuracy": 0.20372351109981537,
"num_tokens": 37926799.0,
"step": 14970
},
{
"entropy": 6.157208204269409,
"epoch": 1.7282169648009233,
"grad_norm": 0.97265625,
"learning_rate": 0.00047108587197677404,
"loss": 5.6915,
"mean_token_accuracy": 0.20362317562103271,
"num_tokens": 37939173.0,
"step": 14975
},
{
"entropy": 6.303074741363526,
"epoch": 1.7287939988459318,
"grad_norm": 0.90625,
"learning_rate": 0.00047106563229605845,
"loss": 5.8849,
"mean_token_accuracy": 0.1878253310918808,
"num_tokens": 37951030.0,
"step": 14980
},
{
"entropy": 6.284793043136597,
"epoch": 1.7293710328909406,
"grad_norm": 0.8828125,
"learning_rate": 0.00047104538602077276,
"loss": 5.8565,
"mean_token_accuracy": 0.18910656869411469,
"num_tokens": 37964005.0,
"step": 14985
},
{
"entropy": 6.2199421405792235,
"epoch": 1.7299480669359493,
"grad_norm": 0.8125,
"learning_rate": 0.0004710251331515978,
"loss": 5.8242,
"mean_token_accuracy": 0.18915827125310897,
"num_tokens": 37975851.0,
"step": 14990
},
{
"entropy": 6.276341295242309,
"epoch": 1.730525100980958,
"grad_norm": 0.98828125,
"learning_rate": 0.00047100487368921485,
"loss": 5.8071,
"mean_token_accuracy": 0.1844043716788292,
"num_tokens": 37988008.0,
"step": 14995
},
{
"entropy": 6.245677185058594,
"epoch": 1.7311021350259665,
"grad_norm": 0.96484375,
"learning_rate": 0.0004709846076343055,
"loss": 5.8426,
"mean_token_accuracy": 0.19950297027826308,
"num_tokens": 38000915.0,
"step": 15000
},
{
"epoch": 1.7311021350259665,
"eval_entropy": 6.027668285749499,
"eval_loss": 5.859091758728027,
"eval_mean_token_accuracy": 0.198191051585094,
"eval_num_tokens": 38000915.0,
"eval_runtime": 17.5708,
"eval_samples_per_second": 1601.292,
"eval_steps_per_second": 200.162,
"step": 15000
},
{
"entropy": 6.1998467445373535,
"epoch": 1.7316791690709752,
"grad_norm": 0.921875,
"learning_rate": 0.00047096433498755103,
"loss": 5.7945,
"mean_token_accuracy": 0.19635732620954513,
"num_tokens": 38013109.0,
"step": 15005
},
{
"entropy": 6.225084114074707,
"epoch": 1.7322562031159838,
"grad_norm": 0.87109375,
"learning_rate": 0.00047094405574963364,
"loss": 5.7896,
"mean_token_accuracy": 0.194148051738739,
"num_tokens": 38025969.0,
"step": 15010
},
{
"entropy": 6.260206031799316,
"epoch": 1.7328332371609925,
"grad_norm": 0.953125,
"learning_rate": 0.00047092376992123516,
"loss": 5.7628,
"mean_token_accuracy": 0.19929637908935546,
"num_tokens": 38039104.0,
"step": 15015
},
{
"entropy": 6.228306007385254,
"epoch": 1.733410271206001,
"grad_norm": 0.88671875,
"learning_rate": 0.00047090347750303803,
"loss": 5.8441,
"mean_token_accuracy": 0.1936349615454674,
"num_tokens": 38053453.0,
"step": 15020
},
{
"entropy": 6.302817726135254,
"epoch": 1.7339873052510097,
"grad_norm": 0.9453125,
"learning_rate": 0.0004708831784957247,
"loss": 5.8718,
"mean_token_accuracy": 0.18640264719724656,
"num_tokens": 38064932.0,
"step": 15025
},
{
"entropy": 6.2317393779754635,
"epoch": 1.7345643392960186,
"grad_norm": 0.97265625,
"learning_rate": 0.0004708628728999781,
"loss": 5.7555,
"mean_token_accuracy": 0.1919494777917862,
"num_tokens": 38078904.0,
"step": 15030
},
{
"entropy": 6.292373132705689,
"epoch": 1.735141373341027,
"grad_norm": 0.859375,
"learning_rate": 0.0004708425607164809,
"loss": 5.8553,
"mean_token_accuracy": 0.18859525322914122,
"num_tokens": 38092605.0,
"step": 15035
},
{
"entropy": 6.221016931533813,
"epoch": 1.7357184073860359,
"grad_norm": 0.8671875,
"learning_rate": 0.0004708222419459165,
"loss": 5.7408,
"mean_token_accuracy": 0.2024005964398384,
"num_tokens": 38105953.0,
"step": 15040
},
{
"entropy": 6.250510501861572,
"epoch": 1.7362954414310443,
"grad_norm": 0.86328125,
"learning_rate": 0.0004708019165889683,
"loss": 5.9294,
"mean_token_accuracy": 0.1820162132382393,
"num_tokens": 38118485.0,
"step": 15045
},
{
"entropy": 6.306356477737427,
"epoch": 1.7368724754760532,
"grad_norm": 0.89453125,
"learning_rate": 0.0004707815846463199,
"loss": 5.8671,
"mean_token_accuracy": 0.18989114910364152,
"num_tokens": 38131220.0,
"step": 15050
},
{
"entropy": 6.206059408187866,
"epoch": 1.7374495095210616,
"grad_norm": 0.921875,
"learning_rate": 0.0004707612461186552,
"loss": 5.7749,
"mean_token_accuracy": 0.1962239608168602,
"num_tokens": 38143012.0,
"step": 15055
},
{
"entropy": 6.170250272750854,
"epoch": 1.7380265435660704,
"grad_norm": 1.1015625,
"learning_rate": 0.00047074090100665805,
"loss": 5.6875,
"mean_token_accuracy": 0.20471351891756057,
"num_tokens": 38155810.0,
"step": 15060
},
{
"entropy": 6.262243032455444,
"epoch": 1.738603577611079,
"grad_norm": 0.87890625,
"learning_rate": 0.00047072054931101306,
"loss": 5.8278,
"mean_token_accuracy": 0.18701076209545137,
"num_tokens": 38169183.0,
"step": 15065
},
{
"entropy": 6.228375577926636,
"epoch": 1.7391806116560877,
"grad_norm": 0.94140625,
"learning_rate": 0.0004707001910324046,
"loss": 5.8259,
"mean_token_accuracy": 0.18984763771295549,
"num_tokens": 38182098.0,
"step": 15070
},
{
"entropy": 6.3191286563873295,
"epoch": 1.7397576457010964,
"grad_norm": 0.8984375,
"learning_rate": 0.00047067982617151737,
"loss": 5.8301,
"mean_token_accuracy": 0.18910346925258636,
"num_tokens": 38194950.0,
"step": 15075
},
{
"entropy": 6.264245414733887,
"epoch": 1.740334679746105,
"grad_norm": 0.84375,
"learning_rate": 0.0004706594547290365,
"loss": 5.7909,
"mean_token_accuracy": 0.19904323369264604,
"num_tokens": 38207600.0,
"step": 15080
},
{
"entropy": 6.226841163635254,
"epoch": 1.7409117137911136,
"grad_norm": 1.0078125,
"learning_rate": 0.00047063907670564695,
"loss": 5.7119,
"mean_token_accuracy": 0.2084239214658737,
"num_tokens": 38219489.0,
"step": 15085
},
{
"entropy": 6.228709650039673,
"epoch": 1.7414887478361223,
"grad_norm": 0.82421875,
"learning_rate": 0.0004706186921020342,
"loss": 5.7838,
"mean_token_accuracy": 0.19626915454864502,
"num_tokens": 38233240.0,
"step": 15090
},
{
"entropy": 6.255122900009155,
"epoch": 1.7420657818811311,
"grad_norm": 0.94140625,
"learning_rate": 0.00047059830091888407,
"loss": 5.7584,
"mean_token_accuracy": 0.19674482345581054,
"num_tokens": 38245967.0,
"step": 15095
},
{
"entropy": 6.243045997619629,
"epoch": 1.7426428159261396,
"grad_norm": 0.88671875,
"learning_rate": 0.0004705779031568821,
"loss": 5.7768,
"mean_token_accuracy": 0.18915130496025084,
"num_tokens": 38258586.0,
"step": 15100
},
{
"entropy": 6.210542440414429,
"epoch": 1.7432198499711484,
"grad_norm": 0.94140625,
"learning_rate": 0.00047055749881671463,
"loss": 5.8401,
"mean_token_accuracy": 0.19314245879650116,
"num_tokens": 38270007.0,
"step": 15105
},
{
"entropy": 6.282091379165649,
"epoch": 1.7437968840161568,
"grad_norm": 0.90234375,
"learning_rate": 0.0004705370878990677,
"loss": 5.744,
"mean_token_accuracy": 0.19978414922952653,
"num_tokens": 38282580.0,
"step": 15110
},
{
"entropy": 6.2048032760620115,
"epoch": 1.7443739180611657,
"grad_norm": 1.0546875,
"learning_rate": 0.00047051667040462806,
"loss": 5.6943,
"mean_token_accuracy": 0.20065076798200607,
"num_tokens": 38295577.0,
"step": 15115
},
{
"entropy": 6.218212985992432,
"epoch": 1.7449509521061741,
"grad_norm": 0.96484375,
"learning_rate": 0.00047049624633408224,
"loss": 5.8663,
"mean_token_accuracy": 0.18592003136873245,
"num_tokens": 38307924.0,
"step": 15120
},
{
"entropy": 6.316382169723511,
"epoch": 1.745527986151183,
"grad_norm": 0.953125,
"learning_rate": 0.00047047581568811724,
"loss": 5.7687,
"mean_token_accuracy": 0.1929919019341469,
"num_tokens": 38321573.0,
"step": 15125
},
{
"entropy": 6.251517629623413,
"epoch": 1.7461050201961916,
"grad_norm": 0.8984375,
"learning_rate": 0.00047045537846742043,
"loss": 5.7673,
"mean_token_accuracy": 0.19639647901058196,
"num_tokens": 38333953.0,
"step": 15130
},
{
"entropy": 6.224976444244385,
"epoch": 1.7466820542412003,
"grad_norm": 0.98828125,
"learning_rate": 0.000470434934672679,
"loss": 5.8044,
"mean_token_accuracy": 0.18785583078861237,
"num_tokens": 38346028.0,
"step": 15135
},
{
"entropy": 6.290715026855469,
"epoch": 1.747259088286209,
"grad_norm": 1.0234375,
"learning_rate": 0.00047041448430458054,
"loss": 5.7369,
"mean_token_accuracy": 0.19406510293483734,
"num_tokens": 38358806.0,
"step": 15140
},
{
"entropy": 6.217677211761474,
"epoch": 1.7478361223312175,
"grad_norm": 0.93359375,
"learning_rate": 0.00047039402736381305,
"loss": 5.6909,
"mean_token_accuracy": 0.19793135076761245,
"num_tokens": 38370396.0,
"step": 15145
},
{
"entropy": 6.251976537704468,
"epoch": 1.7484131563762262,
"grad_norm": 0.80078125,
"learning_rate": 0.0004703735638510645,
"loss": 5.9143,
"mean_token_accuracy": 0.19204719215631486,
"num_tokens": 38383747.0,
"step": 15150
},
{
"entropy": 6.297483825683594,
"epoch": 1.7489901904212348,
"grad_norm": 0.88671875,
"learning_rate": 0.0004703530937670232,
"loss": 5.8218,
"mean_token_accuracy": 0.18911525160074233,
"num_tokens": 38396611.0,
"step": 15155
},
{
"entropy": 6.242986965179443,
"epoch": 1.7495672244662435,
"grad_norm": 0.93359375,
"learning_rate": 0.0004703326171123776,
"loss": 5.831,
"mean_token_accuracy": 0.19013755023479462,
"num_tokens": 38407627.0,
"step": 15160
},
{
"entropy": 6.129948234558105,
"epoch": 1.750144258511252,
"grad_norm": 0.9453125,
"learning_rate": 0.0004703121338878164,
"loss": 5.7308,
"mean_token_accuracy": 0.1990264892578125,
"num_tokens": 38420522.0,
"step": 15165
},
{
"entropy": 6.264822196960449,
"epoch": 1.750721292556261,
"grad_norm": 0.9765625,
"learning_rate": 0.0004702916440940286,
"loss": 5.8135,
"mean_token_accuracy": 0.19269165843725206,
"num_tokens": 38433968.0,
"step": 15170
},
{
"entropy": 6.245396900177002,
"epoch": 1.7512983266012694,
"grad_norm": 0.93359375,
"learning_rate": 0.0004702711477317034,
"loss": 5.8251,
"mean_token_accuracy": 0.1896095395088196,
"num_tokens": 38445819.0,
"step": 15175
},
{
"entropy": 6.314490032196045,
"epoch": 1.7518753606462782,
"grad_norm": 0.8984375,
"learning_rate": 0.0004702506448015301,
"loss": 5.8087,
"mean_token_accuracy": 0.19271332770586014,
"num_tokens": 38458823.0,
"step": 15180
},
{
"entropy": 6.226051235198975,
"epoch": 1.7524523946912867,
"grad_norm": 1.0078125,
"learning_rate": 0.00047023013530419843,
"loss": 5.7935,
"mean_token_accuracy": 0.1927502915263176,
"num_tokens": 38472553.0,
"step": 15185
},
{
"entropy": 6.272993087768555,
"epoch": 1.7530294287362955,
"grad_norm": 0.94921875,
"learning_rate": 0.0004702096192403981,
"loss": 5.764,
"mean_token_accuracy": 0.19805403649806977,
"num_tokens": 38484143.0,
"step": 15190
},
{
"entropy": 6.22825927734375,
"epoch": 1.753606462781304,
"grad_norm": 0.921875,
"learning_rate": 0.0004701890966108192,
"loss": 5.7884,
"mean_token_accuracy": 0.18909399807453156,
"num_tokens": 38496795.0,
"step": 15195
},
{
"entropy": 6.199388647079468,
"epoch": 1.7541834968263128,
"grad_norm": 0.90625,
"learning_rate": 0.000470168567416152,
"loss": 5.6885,
"mean_token_accuracy": 0.20440283715724944,
"num_tokens": 38509548.0,
"step": 15200
},
{
"entropy": 6.237175512313843,
"epoch": 1.7547605308713214,
"grad_norm": 0.92578125,
"learning_rate": 0.0004701480316570869,
"loss": 5.772,
"mean_token_accuracy": 0.19347795844078064,
"num_tokens": 38524011.0,
"step": 15205
},
{
"entropy": 6.263273048400879,
"epoch": 1.75533756491633,
"grad_norm": 0.890625,
"learning_rate": 0.0004701274893343147,
"loss": 5.7944,
"mean_token_accuracy": 0.19191619306802749,
"num_tokens": 38536913.0,
"step": 15210
},
{
"entropy": 6.1626180648803714,
"epoch": 1.7559145989613387,
"grad_norm": 0.96484375,
"learning_rate": 0.00047010694044852643,
"loss": 5.7562,
"mean_token_accuracy": 0.1957879841327667,
"num_tokens": 38548759.0,
"step": 15215
},
{
"entropy": 6.243113422393799,
"epoch": 1.7564916330063474,
"grad_norm": 0.90625,
"learning_rate": 0.000470086385000413,
"loss": 5.7656,
"mean_token_accuracy": 0.19853851497173308,
"num_tokens": 38562071.0,
"step": 15220
},
{
"entropy": 6.2278694152832035,
"epoch": 1.757068667051356,
"grad_norm": 0.9609375,
"learning_rate": 0.0004700658229906661,
"loss": 5.7928,
"mean_token_accuracy": 0.18952999264001846,
"num_tokens": 38573816.0,
"step": 15225
},
{
"entropy": 6.30017786026001,
"epoch": 1.7576457010963646,
"grad_norm": 0.88671875,
"learning_rate": 0.00047004525441997694,
"loss": 5.8938,
"mean_token_accuracy": 0.1860449954867363,
"num_tokens": 38586625.0,
"step": 15230
},
{
"entropy": 6.262595701217651,
"epoch": 1.7582227351413735,
"grad_norm": 0.9375,
"learning_rate": 0.0004700246792890376,
"loss": 5.8262,
"mean_token_accuracy": 0.19520506411790847,
"num_tokens": 38599391.0,
"step": 15235
},
{
"entropy": 6.215628337860108,
"epoch": 1.758799769186382,
"grad_norm": 0.98828125,
"learning_rate": 0.0004700040975985401,
"loss": 5.7351,
"mean_token_accuracy": 0.20383531004190444,
"num_tokens": 38610822.0,
"step": 15240
},
{
"entropy": 6.207050704956055,
"epoch": 1.7593768032313908,
"grad_norm": 0.98046875,
"learning_rate": 0.00046998350934917654,
"loss": 5.7472,
"mean_token_accuracy": 0.19348314255475998,
"num_tokens": 38623886.0,
"step": 15245
},
{
"entropy": 6.198969173431396,
"epoch": 1.7599538372763992,
"grad_norm": 0.8984375,
"learning_rate": 0.00046996291454163956,
"loss": 5.7118,
"mean_token_accuracy": 0.20203371942043305,
"num_tokens": 38636680.0,
"step": 15250
},
{
"entropy": 6.212174940109253,
"epoch": 1.760530871321408,
"grad_norm": 0.91796875,
"learning_rate": 0.0004699423131766218,
"loss": 5.7779,
"mean_token_accuracy": 0.2040209636092186,
"num_tokens": 38648841.0,
"step": 15255
},
{
"entropy": 6.171669149398804,
"epoch": 1.7611079053664165,
"grad_norm": 1.03125,
"learning_rate": 0.0004699217052548161,
"loss": 5.7539,
"mean_token_accuracy": 0.2005374625325203,
"num_tokens": 38660603.0,
"step": 15260
},
{
"entropy": 6.237819528579712,
"epoch": 1.7616849394114253,
"grad_norm": 0.9453125,
"learning_rate": 0.00046990109077691577,
"loss": 5.7766,
"mean_token_accuracy": 0.19491585344076157,
"num_tokens": 38674082.0,
"step": 15265
},
{
"entropy": 6.217108345031738,
"epoch": 1.762261973456434,
"grad_norm": 0.89453125,
"learning_rate": 0.00046988046974361406,
"loss": 5.7206,
"mean_token_accuracy": 0.1978909581899643,
"num_tokens": 38686274.0,
"step": 15270
},
{
"entropy": 6.280757188796997,
"epoch": 1.7628390075014426,
"grad_norm": 0.9921875,
"learning_rate": 0.0004698598421556045,
"loss": 5.7949,
"mean_token_accuracy": 0.1977719321846962,
"num_tokens": 38699260.0,
"step": 15275
},
{
"entropy": 6.249194383621216,
"epoch": 1.7634160415464513,
"grad_norm": 0.91796875,
"learning_rate": 0.0004698392080135809,
"loss": 5.7858,
"mean_token_accuracy": 0.18940508514642715,
"num_tokens": 38712054.0,
"step": 15280
},
{
"entropy": 6.188735914230347,
"epoch": 1.76399307559146,
"grad_norm": 0.9296875,
"learning_rate": 0.0004698185673182374,
"loss": 5.7338,
"mean_token_accuracy": 0.20237622261047364,
"num_tokens": 38724634.0,
"step": 15285
},
{
"entropy": 6.214454269409179,
"epoch": 1.7645701096364685,
"grad_norm": 0.89453125,
"learning_rate": 0.00046979792007026817,
"loss": 5.7185,
"mean_token_accuracy": 0.19849735498428345,
"num_tokens": 38737294.0,
"step": 15290
},
{
"entropy": 6.324564361572266,
"epoch": 1.7651471436814772,
"grad_norm": 0.890625,
"learning_rate": 0.0004697772662703676,
"loss": 5.8993,
"mean_token_accuracy": 0.18402630239725112,
"num_tokens": 38749578.0,
"step": 15295
},
{
"entropy": 6.2132916927337645,
"epoch": 1.7657241777264858,
"grad_norm": 0.91796875,
"learning_rate": 0.00046975660591923047,
"loss": 5.7805,
"mean_token_accuracy": 0.1883055880665779,
"num_tokens": 38762282.0,
"step": 15300
},
{
"entropy": 6.30076117515564,
"epoch": 1.7663012117714945,
"grad_norm": 0.8828125,
"learning_rate": 0.0004697359390175516,
"loss": 5.7676,
"mean_token_accuracy": 0.1952459216117859,
"num_tokens": 38773861.0,
"step": 15305
},
{
"entropy": 6.275486326217651,
"epoch": 1.7668782458165033,
"grad_norm": 0.94921875,
"learning_rate": 0.00046971526556602625,
"loss": 5.8716,
"mean_token_accuracy": 0.18915152549743652,
"num_tokens": 38786427.0,
"step": 15310
},
{
"entropy": 6.263535261154175,
"epoch": 1.7674552798615117,
"grad_norm": 0.8984375,
"learning_rate": 0.0004696945855653495,
"loss": 5.856,
"mean_token_accuracy": 0.1845775306224823,
"num_tokens": 38798496.0,
"step": 15315
},
{
"entropy": 6.221828889846802,
"epoch": 1.7680323139065206,
"grad_norm": 0.98046875,
"learning_rate": 0.0004696738990162172,
"loss": 5.8379,
"mean_token_accuracy": 0.18447502553462983,
"num_tokens": 38812069.0,
"step": 15320
},
{
"entropy": 6.265704488754272,
"epoch": 1.768609347951529,
"grad_norm": 0.921875,
"learning_rate": 0.000469653205919325,
"loss": 5.8781,
"mean_token_accuracy": 0.19169940948486328,
"num_tokens": 38824465.0,
"step": 15325
},
{
"entropy": 6.294767951965332,
"epoch": 1.7691863819965379,
"grad_norm": 0.9609375,
"learning_rate": 0.00046963250627536884,
"loss": 5.8166,
"mean_token_accuracy": 0.1910833165049553,
"num_tokens": 38837328.0,
"step": 15330
},
{
"entropy": 6.208098030090332,
"epoch": 1.7697634160415463,
"grad_norm": 0.96875,
"learning_rate": 0.0004696118000850451,
"loss": 5.7961,
"mean_token_accuracy": 0.19421351402997972,
"num_tokens": 38849238.0,
"step": 15335
},
{
"entropy": 6.192309045791626,
"epoch": 1.7703404500865552,
"grad_norm": 1.015625,
"learning_rate": 0.00046959108734905003,
"loss": 5.7641,
"mean_token_accuracy": 0.1998672679066658,
"num_tokens": 38861479.0,
"step": 15340
},
{
"entropy": 6.215923213958741,
"epoch": 1.7709174841315638,
"grad_norm": 1.171875,
"learning_rate": 0.00046957036806808045,
"loss": 5.7414,
"mean_token_accuracy": 0.19977018386125564,
"num_tokens": 38874342.0,
"step": 15345
},
{
"entropy": 6.221998167037964,
"epoch": 1.7714945181765724,
"grad_norm": 0.953125,
"learning_rate": 0.0004695496422428332,
"loss": 5.7593,
"mean_token_accuracy": 0.19942527562379836,
"num_tokens": 38886595.0,
"step": 15350
},
{
"entropy": 6.248060798645019,
"epoch": 1.772071552221581,
"grad_norm": 0.86328125,
"learning_rate": 0.0004695289098740054,
"loss": 5.7896,
"mean_token_accuracy": 0.1939016655087471,
"num_tokens": 38899338.0,
"step": 15355
},
{
"entropy": 6.270295238494873,
"epoch": 1.7726485862665897,
"grad_norm": 0.8984375,
"learning_rate": 0.0004695081709622943,
"loss": 5.7699,
"mean_token_accuracy": 0.19445489048957826,
"num_tokens": 38911765.0,
"step": 15360
},
{
"entropy": 6.197941398620605,
"epoch": 1.7732256203115984,
"grad_norm": 0.890625,
"learning_rate": 0.00046948742550839744,
"loss": 5.7401,
"mean_token_accuracy": 0.2035606637597084,
"num_tokens": 38924137.0,
"step": 15365
},
{
"entropy": 6.26130781173706,
"epoch": 1.773802654356607,
"grad_norm": 0.9609375,
"learning_rate": 0.0004694666735130127,
"loss": 5.7189,
"mean_token_accuracy": 0.19911470264196396,
"num_tokens": 38936401.0,
"step": 15370
},
{
"entropy": 6.235423421859741,
"epoch": 1.7743796884016156,
"grad_norm": 0.97265625,
"learning_rate": 0.000469445914976838,
"loss": 5.8188,
"mean_token_accuracy": 0.19015101790428163,
"num_tokens": 38948224.0,
"step": 15375
},
{
"entropy": 6.26864709854126,
"epoch": 1.7749567224466243,
"grad_norm": 0.9609375,
"learning_rate": 0.0004694251499005715,
"loss": 5.7659,
"mean_token_accuracy": 0.19516605734825135,
"num_tokens": 38959924.0,
"step": 15380
},
{
"entropy": 6.2285974502563475,
"epoch": 1.7755337564916331,
"grad_norm": 0.90234375,
"learning_rate": 0.0004694043782849116,
"loss": 5.8013,
"mean_token_accuracy": 0.1916235476732254,
"num_tokens": 38973018.0,
"step": 15385
},
{
"entropy": 6.259120655059815,
"epoch": 1.7761107905366416,
"grad_norm": 0.8984375,
"learning_rate": 0.00046938360013055715,
"loss": 5.8607,
"mean_token_accuracy": 0.18584455102682113,
"num_tokens": 38985634.0,
"step": 15390
},
{
"entropy": 6.284410619735718,
"epoch": 1.7766878245816504,
"grad_norm": 1.0,
"learning_rate": 0.00046936281543820673,
"loss": 5.8258,
"mean_token_accuracy": 0.19096557646989823,
"num_tokens": 38999446.0,
"step": 15395
},
{
"entropy": 6.295167303085327,
"epoch": 1.7772648586266588,
"grad_norm": 0.9140625,
"learning_rate": 0.00046934202420855967,
"loss": 5.8469,
"mean_token_accuracy": 0.19223827719688416,
"num_tokens": 39012974.0,
"step": 15400
},
{
"entropy": 6.223930025100708,
"epoch": 1.7778418926716677,
"grad_norm": 0.953125,
"learning_rate": 0.00046932122644231507,
"loss": 5.7461,
"mean_token_accuracy": 0.1959339052438736,
"num_tokens": 39025316.0,
"step": 15405
},
{
"entropy": 6.226829528808594,
"epoch": 1.7784189267166761,
"grad_norm": 0.9609375,
"learning_rate": 0.00046930042214017256,
"loss": 5.6983,
"mean_token_accuracy": 0.20610239058732988,
"num_tokens": 39038174.0,
"step": 15410
},
{
"entropy": 6.30842137336731,
"epoch": 1.778995960761685,
"grad_norm": 0.91796875,
"learning_rate": 0.0004692796113028319,
"loss": 5.8718,
"mean_token_accuracy": 0.18104784041643143,
"num_tokens": 39051943.0,
"step": 15415
},
{
"entropy": 6.2169633388519285,
"epoch": 1.7795729948066936,
"grad_norm": 0.96875,
"learning_rate": 0.000469258793930993,
"loss": 5.7505,
"mean_token_accuracy": 0.19396419674158097,
"num_tokens": 39064765.0,
"step": 15420
},
{
"entropy": 6.24879035949707,
"epoch": 1.7801500288517023,
"grad_norm": 0.95703125,
"learning_rate": 0.00046923797002535605,
"loss": 5.8594,
"mean_token_accuracy": 0.18545962870121002,
"num_tokens": 39077326.0,
"step": 15425
},
{
"entropy": 6.255417680740356,
"epoch": 1.780727062896711,
"grad_norm": 0.859375,
"learning_rate": 0.0004692171395866214,
"loss": 5.749,
"mean_token_accuracy": 0.19588208943605423,
"num_tokens": 39090049.0,
"step": 15430
},
{
"entropy": 6.237002658843994,
"epoch": 1.7813040969417195,
"grad_norm": 1.0,
"learning_rate": 0.00046919630261548986,
"loss": 5.7838,
"mean_token_accuracy": 0.1968626856803894,
"num_tokens": 39102805.0,
"step": 15435
},
{
"entropy": 6.096398401260376,
"epoch": 1.7818811309867282,
"grad_norm": 0.9140625,
"learning_rate": 0.00046917545911266207,
"loss": 5.688,
"mean_token_accuracy": 0.2085106134414673,
"num_tokens": 39115966.0,
"step": 15440
},
{
"entropy": 6.211426210403443,
"epoch": 1.7824581650317368,
"grad_norm": 0.91015625,
"learning_rate": 0.00046915460907883923,
"loss": 5.8036,
"mean_token_accuracy": 0.1936090975999832,
"num_tokens": 39128417.0,
"step": 15445
},
{
"entropy": 6.230034494400025,
"epoch": 1.7830351990767457,
"grad_norm": 0.90625,
"learning_rate": 0.00046913375251472246,
"loss": 5.7544,
"mean_token_accuracy": 0.19787432253360748,
"num_tokens": 39142338.0,
"step": 15450
},
{
"entropy": 6.252493810653687,
"epoch": 1.783612233121754,
"grad_norm": 0.94140625,
"learning_rate": 0.00046911288942101345,
"loss": 5.8178,
"mean_token_accuracy": 0.19384605288505555,
"num_tokens": 39155055.0,
"step": 15455
},
{
"entropy": 6.257091951370239,
"epoch": 1.784189267166763,
"grad_norm": 1.015625,
"learning_rate": 0.0004690920197984138,
"loss": 5.7942,
"mean_token_accuracy": 0.19681064337491988,
"num_tokens": 39167170.0,
"step": 15460
},
{
"entropy": 6.360779237747193,
"epoch": 1.7847663012117714,
"grad_norm": 0.9296875,
"learning_rate": 0.0004690711436476254,
"loss": 5.9037,
"mean_token_accuracy": 0.18777545541524887,
"num_tokens": 39181389.0,
"step": 15465
},
{
"entropy": 6.374752235412598,
"epoch": 1.7853433352567802,
"grad_norm": 1.03125,
"learning_rate": 0.00046905026096935056,
"loss": 5.8728,
"mean_token_accuracy": 0.18601856380701065,
"num_tokens": 39194728.0,
"step": 15470
},
{
"entropy": 6.148594760894776,
"epoch": 1.7859203693017887,
"grad_norm": 0.89453125,
"learning_rate": 0.0004690293717642916,
"loss": 5.7134,
"mean_token_accuracy": 0.20158033221960067,
"num_tokens": 39207945.0,
"step": 15475
},
{
"entropy": 6.253357934951782,
"epoch": 1.7864974033467975,
"grad_norm": 0.91015625,
"learning_rate": 0.000469008476033151,
"loss": 5.8538,
"mean_token_accuracy": 0.1929816037416458,
"num_tokens": 39221314.0,
"step": 15480
},
{
"entropy": 6.276904487609864,
"epoch": 1.7870744373918062,
"grad_norm": 0.91015625,
"learning_rate": 0.00046898757377663176,
"loss": 5.8024,
"mean_token_accuracy": 0.1935829922556877,
"num_tokens": 39233910.0,
"step": 15485
},
{
"entropy": 6.246221685409546,
"epoch": 1.7876514714368148,
"grad_norm": 0.9765625,
"learning_rate": 0.00046896666499543683,
"loss": 5.8003,
"mean_token_accuracy": 0.19562088698148727,
"num_tokens": 39246027.0,
"step": 15490
},
{
"entropy": 6.209698486328125,
"epoch": 1.7882285054818234,
"grad_norm": 0.9296875,
"learning_rate": 0.00046894574969026946,
"loss": 5.7485,
"mean_token_accuracy": 0.1964795932173729,
"num_tokens": 39258456.0,
"step": 15495
},
{
"entropy": 6.284151840209961,
"epoch": 1.788805539526832,
"grad_norm": 0.99609375,
"learning_rate": 0.00046892482786183313,
"loss": 5.8465,
"mean_token_accuracy": 0.1841995060443878,
"num_tokens": 39270624.0,
"step": 15500
},
{
"entropy": 6.2593241214752195,
"epoch": 1.7893825735718407,
"grad_norm": 0.92578125,
"learning_rate": 0.00046890389951083155,
"loss": 5.7329,
"mean_token_accuracy": 0.19568620026111602,
"num_tokens": 39283350.0,
"step": 15505
},
{
"entropy": 6.287080955505371,
"epoch": 1.7899596076168494,
"grad_norm": 0.921875,
"learning_rate": 0.00046888296463796857,
"loss": 5.8432,
"mean_token_accuracy": 0.19254444241523744,
"num_tokens": 39296321.0,
"step": 15510
},
{
"entropy": 6.232756280899048,
"epoch": 1.790536641661858,
"grad_norm": 0.8359375,
"learning_rate": 0.0004688620232439485,
"loss": 5.7017,
"mean_token_accuracy": 0.20558897256851197,
"num_tokens": 39309223.0,
"step": 15515
},
{
"entropy": 6.22496485710144,
"epoch": 1.7911136757068666,
"grad_norm": 0.83203125,
"learning_rate": 0.00046884107532947547,
"loss": 5.6886,
"mean_token_accuracy": 0.19321909546852112,
"num_tokens": 39322348.0,
"step": 15520
},
{
"entropy": 6.227154541015625,
"epoch": 1.7916907097518755,
"grad_norm": 0.8515625,
"learning_rate": 0.00046882012089525415,
"loss": 5.786,
"mean_token_accuracy": 0.18817334324121476,
"num_tokens": 39335375.0,
"step": 15525
},
{
"entropy": 6.265221357345581,
"epoch": 1.792267743796884,
"grad_norm": 0.89453125,
"learning_rate": 0.0004687991599419895,
"loss": 5.8031,
"mean_token_accuracy": 0.19223275780677795,
"num_tokens": 39347865.0,
"step": 15530
},
{
"entropy": 6.249596834182739,
"epoch": 1.7928447778418928,
"grad_norm": 0.89453125,
"learning_rate": 0.00046877819247038624,
"loss": 5.8487,
"mean_token_accuracy": 0.19005428701639177,
"num_tokens": 39361402.0,
"step": 15535
},
{
"entropy": 6.221106147766113,
"epoch": 1.7934218118869012,
"grad_norm": 0.91015625,
"learning_rate": 0.0004687572184811497,
"loss": 5.7079,
"mean_token_accuracy": 0.19553205221891404,
"num_tokens": 39372839.0,
"step": 15540
},
{
"entropy": 6.2046037197113035,
"epoch": 1.79399884593191,
"grad_norm": 1.0078125,
"learning_rate": 0.00046873623797498545,
"loss": 5.7399,
"mean_token_accuracy": 0.19506264925003053,
"num_tokens": 39385189.0,
"step": 15545
},
{
"entropy": 6.323671007156372,
"epoch": 1.7945758799769185,
"grad_norm": 0.8515625,
"learning_rate": 0.000468715250952599,
"loss": 5.8881,
"mean_token_accuracy": 0.18917421698570253,
"num_tokens": 39397871.0,
"step": 15550
},
{
"entropy": 6.302221441268921,
"epoch": 1.7951529140219273,
"grad_norm": 0.83984375,
"learning_rate": 0.00046869425741469635,
"loss": 5.8359,
"mean_token_accuracy": 0.18804299235343933,
"num_tokens": 39411222.0,
"step": 15555
},
{
"entropy": 6.259333372116089,
"epoch": 1.795729948066936,
"grad_norm": 0.90234375,
"learning_rate": 0.0004686732573619835,
"loss": 5.8319,
"mean_token_accuracy": 0.19109850972890854,
"num_tokens": 39423614.0,
"step": 15560
},
{
"entropy": 6.249478197097778,
"epoch": 1.7963069821119446,
"grad_norm": 0.859375,
"learning_rate": 0.0004686522507951669,
"loss": 5.7548,
"mean_token_accuracy": 0.19278013855218887,
"num_tokens": 39436299.0,
"step": 15565
},
{
"entropy": 6.260821914672851,
"epoch": 1.7968840161569533,
"grad_norm": 0.9453125,
"learning_rate": 0.0004686312377149531,
"loss": 5.8271,
"mean_token_accuracy": 0.18958440274000168,
"num_tokens": 39448994.0,
"step": 15570
},
{
"entropy": 6.273134469985962,
"epoch": 1.797461050201962,
"grad_norm": 0.9375,
"learning_rate": 0.00046861021812204874,
"loss": 5.8248,
"mean_token_accuracy": 0.18644514679908752,
"num_tokens": 39462387.0,
"step": 15575
},
{
"entropy": 6.307193422317505,
"epoch": 1.7980380842469705,
"grad_norm": 0.85546875,
"learning_rate": 0.00046858919201716085,
"loss": 5.8047,
"mean_token_accuracy": 0.1928827852010727,
"num_tokens": 39475082.0,
"step": 15580
},
{
"entropy": 6.258175945281982,
"epoch": 1.7986151182919792,
"grad_norm": 0.98046875,
"learning_rate": 0.0004685681594009966,
"loss": 5.7914,
"mean_token_accuracy": 0.19656720608472825,
"num_tokens": 39487272.0,
"step": 15585
},
{
"entropy": 6.236111068725586,
"epoch": 1.799192152336988,
"grad_norm": 0.8828125,
"learning_rate": 0.00046854712027426357,
"loss": 5.7724,
"mean_token_accuracy": 0.19646389186382293,
"num_tokens": 39502499.0,
"step": 15590
},
{
"entropy": 6.346733856201172,
"epoch": 1.7997691863819965,
"grad_norm": 0.9140625,
"learning_rate": 0.00046852607463766923,
"loss": 5.8429,
"mean_token_accuracy": 0.1886493071913719,
"num_tokens": 39514652.0,
"step": 15595
},
{
"entropy": 6.34684190750122,
"epoch": 1.8003462204270053,
"grad_norm": 0.93359375,
"learning_rate": 0.0004685050224919215,
"loss": 5.8995,
"mean_token_accuracy": 0.1818003237247467,
"num_tokens": 39527859.0,
"step": 15600
},
{
"entropy": 6.262502241134643,
"epoch": 1.8009232544720137,
"grad_norm": 0.8984375,
"learning_rate": 0.00046848396383772844,
"loss": 5.7547,
"mean_token_accuracy": 0.18986964374780654,
"num_tokens": 39541099.0,
"step": 15605
},
{
"entropy": 6.20468487739563,
"epoch": 1.8015002885170226,
"grad_norm": 0.96484375,
"learning_rate": 0.0004684628986757984,
"loss": 5.7604,
"mean_token_accuracy": 0.19289609640836716,
"num_tokens": 39553233.0,
"step": 15610
},
{
"entropy": 6.250316047668457,
"epoch": 1.802077322562031,
"grad_norm": 0.93359375,
"learning_rate": 0.0004684418270068398,
"loss": 5.7442,
"mean_token_accuracy": 0.19790587574243546,
"num_tokens": 39565379.0,
"step": 15615
},
{
"entropy": 6.201472282409668,
"epoch": 1.8026543566070399,
"grad_norm": 0.93359375,
"learning_rate": 0.0004684207488315615,
"loss": 5.7217,
"mean_token_accuracy": 0.2005346715450287,
"num_tokens": 39577509.0,
"step": 15620
},
{
"entropy": 6.294105386734008,
"epoch": 1.8032313906520485,
"grad_norm": 0.8984375,
"learning_rate": 0.0004683996641506724,
"loss": 5.8205,
"mean_token_accuracy": 0.19148968160152435,
"num_tokens": 39589960.0,
"step": 15625
},
{
"entropy": 6.219392347335815,
"epoch": 1.8038084246970572,
"grad_norm": 0.8828125,
"learning_rate": 0.00046837857296488163,
"loss": 5.7143,
"mean_token_accuracy": 0.20224729776382447,
"num_tokens": 39602231.0,
"step": 15630
},
{
"entropy": 6.256589317321778,
"epoch": 1.8043854587420658,
"grad_norm": 0.984375,
"learning_rate": 0.00046835747527489857,
"loss": 5.8016,
"mean_token_accuracy": 0.20258677154779434,
"num_tokens": 39615756.0,
"step": 15635
},
{
"entropy": 6.315097427368164,
"epoch": 1.8049624927870744,
"grad_norm": 1.015625,
"learning_rate": 0.000468336371081433,
"loss": 5.8292,
"mean_token_accuracy": 0.18631367534399032,
"num_tokens": 39627810.0,
"step": 15640
},
{
"entropy": 6.2539315700531,
"epoch": 1.805539526832083,
"grad_norm": 0.921875,
"learning_rate": 0.00046831526038519444,
"loss": 5.7982,
"mean_token_accuracy": 0.19546411484479903,
"num_tokens": 39640930.0,
"step": 15645
},
{
"entropy": 6.206079769134521,
"epoch": 1.8061165608770917,
"grad_norm": 0.890625,
"learning_rate": 0.0004682941431868933,
"loss": 5.7518,
"mean_token_accuracy": 0.19276881515979766,
"num_tokens": 39652146.0,
"step": 15650
},
{
"entropy": 6.151435089111328,
"epoch": 1.8066935949221004,
"grad_norm": 0.91015625,
"learning_rate": 0.00046827301948723963,
"loss": 5.6683,
"mean_token_accuracy": 0.20766518861055375,
"num_tokens": 39665156.0,
"step": 15655
},
{
"entropy": 6.266790294647217,
"epoch": 1.807270628967109,
"grad_norm": 0.91015625,
"learning_rate": 0.00046825188928694393,
"loss": 5.7792,
"mean_token_accuracy": 0.19093467444181442,
"num_tokens": 39677346.0,
"step": 15660
},
{
"entropy": 6.283413410186768,
"epoch": 1.8078476630121179,
"grad_norm": 0.93359375,
"learning_rate": 0.0004682307525867169,
"loss": 5.746,
"mean_token_accuracy": 0.2032680407166481,
"num_tokens": 39690613.0,
"step": 15665
},
{
"entropy": 6.268688201904297,
"epoch": 1.8084246970571263,
"grad_norm": 0.890625,
"learning_rate": 0.0004682096093872695,
"loss": 5.7572,
"mean_token_accuracy": 0.1922956645488739,
"num_tokens": 39703111.0,
"step": 15670
},
{
"entropy": 6.247060823440552,
"epoch": 1.8090017311021351,
"grad_norm": 0.94140625,
"learning_rate": 0.00046818845968931284,
"loss": 5.7806,
"mean_token_accuracy": 0.19447221159934996,
"num_tokens": 39715441.0,
"step": 15675
},
{
"entropy": 6.275709629058838,
"epoch": 1.8095787651471436,
"grad_norm": 0.90234375,
"learning_rate": 0.00046816730349355843,
"loss": 5.7405,
"mean_token_accuracy": 0.19862063527107238,
"num_tokens": 39728437.0,
"step": 15680
},
{
"entropy": 6.24822850227356,
"epoch": 1.8101557991921524,
"grad_norm": 0.8984375,
"learning_rate": 0.00046814614080071756,
"loss": 5.7679,
"mean_token_accuracy": 0.1967908799648285,
"num_tokens": 39740324.0,
"step": 15685
},
{
"entropy": 6.227537345886231,
"epoch": 1.8107328332371608,
"grad_norm": 0.95703125,
"learning_rate": 0.00046812497161150224,
"loss": 5.7457,
"mean_token_accuracy": 0.1954813316464424,
"num_tokens": 39752158.0,
"step": 15690
},
{
"entropy": 6.251756763458252,
"epoch": 1.8113098672821697,
"grad_norm": 0.85546875,
"learning_rate": 0.00046810379592662445,
"loss": 5.8004,
"mean_token_accuracy": 0.1957491382956505,
"num_tokens": 39766296.0,
"step": 15695
},
{
"entropy": 6.246879053115845,
"epoch": 1.8118869013271783,
"grad_norm": 0.8125,
"learning_rate": 0.00046808261374679637,
"loss": 5.8144,
"mean_token_accuracy": 0.1933879092335701,
"num_tokens": 39779690.0,
"step": 15700
},
{
"entropy": 6.275369453430176,
"epoch": 1.812463935372187,
"grad_norm": 0.91015625,
"learning_rate": 0.0004680614250727305,
"loss": 5.7709,
"mean_token_accuracy": 0.19698434323072433,
"num_tokens": 39790617.0,
"step": 15705
},
{
"entropy": 6.237313270568848,
"epoch": 1.8130409694171956,
"grad_norm": 0.90625,
"learning_rate": 0.0004680402299051395,
"loss": 5.7519,
"mean_token_accuracy": 0.19757142066955566,
"num_tokens": 39802994.0,
"step": 15710
},
{
"entropy": 6.248507452011109,
"epoch": 1.8136180034622043,
"grad_norm": 0.9296875,
"learning_rate": 0.0004680190282447363,
"loss": 5.7598,
"mean_token_accuracy": 0.1952964574098587,
"num_tokens": 39815618.0,
"step": 15715
},
{
"entropy": 6.251852369308471,
"epoch": 1.814195037507213,
"grad_norm": 0.90234375,
"learning_rate": 0.0004679978200922339,
"loss": 5.7412,
"mean_token_accuracy": 0.20035985261201858,
"num_tokens": 39827283.0,
"step": 15720
},
{
"entropy": 6.2605846405029295,
"epoch": 1.8147720715522215,
"grad_norm": 0.94921875,
"learning_rate": 0.0004679766054483457,
"loss": 5.725,
"mean_token_accuracy": 0.20251115262508393,
"num_tokens": 39840116.0,
"step": 15725
},
{
"entropy": 6.193558406829834,
"epoch": 1.8153491055972304,
"grad_norm": 0.94921875,
"learning_rate": 0.0004679553843137852,
"loss": 5.7173,
"mean_token_accuracy": 0.20594813525676728,
"num_tokens": 39851770.0,
"step": 15730
},
{
"entropy": 6.180267715454102,
"epoch": 1.8159261396422388,
"grad_norm": 0.98828125,
"learning_rate": 0.00046793415668926625,
"loss": 5.6866,
"mean_token_accuracy": 0.19606250077486037,
"num_tokens": 39863803.0,
"step": 15735
},
{
"entropy": 6.238861560821533,
"epoch": 1.8165031736872477,
"grad_norm": 1.0078125,
"learning_rate": 0.0004679129225755028,
"loss": 5.7202,
"mean_token_accuracy": 0.20054381489753723,
"num_tokens": 39875713.0,
"step": 15740
},
{
"entropy": 6.170565223693847,
"epoch": 1.817080207732256,
"grad_norm": 0.9296875,
"learning_rate": 0.000467891681973209,
"loss": 5.6841,
"mean_token_accuracy": 0.20006590634584426,
"num_tokens": 39888670.0,
"step": 15745
},
{
"entropy": 6.164975118637085,
"epoch": 1.817657241777265,
"grad_norm": 0.95703125,
"learning_rate": 0.00046787043488309926,
"loss": 5.7258,
"mean_token_accuracy": 0.20983980894088744,
"num_tokens": 39900845.0,
"step": 15750
},
{
"entropy": 6.346622896194458,
"epoch": 1.8182342758222734,
"grad_norm": 0.96484375,
"learning_rate": 0.0004678491813058882,
"loss": 5.8179,
"mean_token_accuracy": 0.18947956562042237,
"num_tokens": 39912268.0,
"step": 15755
},
{
"entropy": 6.255692625045777,
"epoch": 1.8188113098672822,
"grad_norm": 0.875,
"learning_rate": 0.0004678279212422908,
"loss": 5.7643,
"mean_token_accuracy": 0.19456629902124406,
"num_tokens": 39924213.0,
"step": 15760
},
{
"entropy": 6.241471672058106,
"epoch": 1.8193883439122909,
"grad_norm": 0.9296875,
"learning_rate": 0.0004678066546930221,
"loss": 5.7905,
"mean_token_accuracy": 0.19173450469970704,
"num_tokens": 39937069.0,
"step": 15765
},
{
"entropy": 6.219423055648804,
"epoch": 1.8199653779572995,
"grad_norm": 0.96484375,
"learning_rate": 0.00046778538165879725,
"loss": 5.7404,
"mean_token_accuracy": 0.19059522300958634,
"num_tokens": 39948988.0,
"step": 15770
},
{
"entropy": 6.256737899780274,
"epoch": 1.8205424120023082,
"grad_norm": 0.890625,
"learning_rate": 0.00046776410214033185,
"loss": 5.8356,
"mean_token_accuracy": 0.19304797798395157,
"num_tokens": 39962177.0,
"step": 15775
},
{
"entropy": 6.300885152816773,
"epoch": 1.8211194460473168,
"grad_norm": 0.97265625,
"learning_rate": 0.0004677428161383417,
"loss": 5.7657,
"mean_token_accuracy": 0.19903772473335266,
"num_tokens": 39975329.0,
"step": 15780
},
{
"entropy": 6.271979188919067,
"epoch": 1.8216964800923254,
"grad_norm": 1.0390625,
"learning_rate": 0.0004677215236535426,
"loss": 5.7524,
"mean_token_accuracy": 0.19273924678564072,
"num_tokens": 39987923.0,
"step": 15785
},
{
"entropy": 6.2564263343811035,
"epoch": 1.822273514137334,
"grad_norm": 0.953125,
"learning_rate": 0.0004677002246866508,
"loss": 5.8236,
"mean_token_accuracy": 0.19519684463739395,
"num_tokens": 40001596.0,
"step": 15790
},
{
"entropy": 6.253862953186035,
"epoch": 1.8228505481823427,
"grad_norm": 0.9296875,
"learning_rate": 0.00046767891923838264,
"loss": 5.7486,
"mean_token_accuracy": 0.19953580796718598,
"num_tokens": 40014207.0,
"step": 15795
},
{
"entropy": 6.338621330261231,
"epoch": 1.8234275822273514,
"grad_norm": 0.859375,
"learning_rate": 0.0004676576073094548,
"loss": 5.7948,
"mean_token_accuracy": 0.19075928777456283,
"num_tokens": 40027931.0,
"step": 15800
},
{
"entropy": 6.266003274917603,
"epoch": 1.8240046162723602,
"grad_norm": 0.94140625,
"learning_rate": 0.00046763628890058396,
"loss": 5.8163,
"mean_token_accuracy": 0.19684889763593674,
"num_tokens": 40040463.0,
"step": 15805
},
{
"entropy": 6.170436954498291,
"epoch": 1.8245816503173686,
"grad_norm": 0.82421875,
"learning_rate": 0.00046761496401248734,
"loss": 5.7001,
"mean_token_accuracy": 0.20084349513053895,
"num_tokens": 40053085.0,
"step": 15810
},
{
"entropy": 6.3198305606842045,
"epoch": 1.8251586843623775,
"grad_norm": 0.89453125,
"learning_rate": 0.000467593632645882,
"loss": 5.8855,
"mean_token_accuracy": 0.19249660074710845,
"num_tokens": 40065771.0,
"step": 15815
},
{
"entropy": 6.291195583343506,
"epoch": 1.825735718407386,
"grad_norm": 0.890625,
"learning_rate": 0.0004675722948014855,
"loss": 5.7948,
"mean_token_accuracy": 0.19111389964818953,
"num_tokens": 40078939.0,
"step": 15820
},
{
"entropy": 6.223949861526489,
"epoch": 1.8263127524523948,
"grad_norm": 0.91015625,
"learning_rate": 0.00046755095048001556,
"loss": 5.6987,
"mean_token_accuracy": 0.20104024261236192,
"num_tokens": 40091565.0,
"step": 15825
},
{
"entropy": 6.170585823059082,
"epoch": 1.8268897864974032,
"grad_norm": 1.015625,
"learning_rate": 0.0004675295996821899,
"loss": 5.7365,
"mean_token_accuracy": 0.19630666822195053,
"num_tokens": 40103619.0,
"step": 15830
},
{
"entropy": 6.311802721023559,
"epoch": 1.827466820542412,
"grad_norm": 0.9296875,
"learning_rate": 0.000467508242408727,
"loss": 5.8102,
"mean_token_accuracy": 0.18986732810735701,
"num_tokens": 40116370.0,
"step": 15835
},
{
"entropy": 6.246032047271728,
"epoch": 1.8280438545874207,
"grad_norm": 1.0078125,
"learning_rate": 0.0004674868786603448,
"loss": 5.6837,
"mean_token_accuracy": 0.19883956760168076,
"num_tokens": 40129015.0,
"step": 15840
},
{
"entropy": 6.241017913818359,
"epoch": 1.8286208886324293,
"grad_norm": 1.0,
"learning_rate": 0.0004674655084377622,
"loss": 5.717,
"mean_token_accuracy": 0.19837751537561416,
"num_tokens": 40141437.0,
"step": 15845
},
{
"entropy": 6.206828451156616,
"epoch": 1.829197922677438,
"grad_norm": 0.92578125,
"learning_rate": 0.0004674441317416978,
"loss": 5.7643,
"mean_token_accuracy": 0.19043355137109758,
"num_tokens": 40154516.0,
"step": 15850
},
{
"entropy": 6.179724311828613,
"epoch": 1.8297749567224466,
"grad_norm": 0.94921875,
"learning_rate": 0.00046742274857287057,
"loss": 5.6333,
"mean_token_accuracy": 0.20223019868135453,
"num_tokens": 40166598.0,
"step": 15855
},
{
"entropy": 6.229026031494141,
"epoch": 1.8303519907674553,
"grad_norm": 1.0546875,
"learning_rate": 0.0004674013589319998,
"loss": 5.7543,
"mean_token_accuracy": 0.19870882034301757,
"num_tokens": 40178905.0,
"step": 15860
},
{
"entropy": 6.321389770507812,
"epoch": 1.830929024812464,
"grad_norm": 0.95703125,
"learning_rate": 0.0004673799628198049,
"loss": 5.8371,
"mean_token_accuracy": 0.19208986014127732,
"num_tokens": 40191678.0,
"step": 15865
},
{
"entropy": 6.245724630355835,
"epoch": 1.8315060588574728,
"grad_norm": 0.9453125,
"learning_rate": 0.00046735856023700546,
"loss": 5.7539,
"mean_token_accuracy": 0.19165848046541215,
"num_tokens": 40204680.0,
"step": 15870
},
{
"entropy": 6.180008220672607,
"epoch": 1.8320830929024812,
"grad_norm": 1.0234375,
"learning_rate": 0.0004673371511843215,
"loss": 5.8064,
"mean_token_accuracy": 0.20063277781009675,
"num_tokens": 40217026.0,
"step": 15875
},
{
"entropy": 6.242175817489624,
"epoch": 1.83266012694749,
"grad_norm": 0.88671875,
"learning_rate": 0.0004673157356624729,
"loss": 5.7377,
"mean_token_accuracy": 0.19302880316972731,
"num_tokens": 40228950.0,
"step": 15880
},
{
"entropy": 6.2919378757476805,
"epoch": 1.8332371609924984,
"grad_norm": 0.91015625,
"learning_rate": 0.0004672943136721801,
"loss": 5.8163,
"mean_token_accuracy": 0.1909077376127243,
"num_tokens": 40241294.0,
"step": 15885
},
{
"entropy": 6.323341321945191,
"epoch": 1.8338141950375073,
"grad_norm": 0.890625,
"learning_rate": 0.0004672728852141636,
"loss": 5.8536,
"mean_token_accuracy": 0.18982188850641252,
"num_tokens": 40253331.0,
"step": 15890
},
{
"entropy": 6.28448715209961,
"epoch": 1.8343912290825157,
"grad_norm": 0.91015625,
"learning_rate": 0.00046725145028914404,
"loss": 5.8079,
"mean_token_accuracy": 0.19301552474498748,
"num_tokens": 40266059.0,
"step": 15895
},
{
"entropy": 6.252271842956543,
"epoch": 1.8349682631275246,
"grad_norm": 0.9140625,
"learning_rate": 0.0004672300088978425,
"loss": 5.7363,
"mean_token_accuracy": 0.2031920611858368,
"num_tokens": 40278732.0,
"step": 15900
},
{
"entropy": 6.182538175582886,
"epoch": 1.8355452971725332,
"grad_norm": 0.96875,
"learning_rate": 0.0004672085610409801,
"loss": 5.6966,
"mean_token_accuracy": 0.20496753305196763,
"num_tokens": 40290428.0,
"step": 15905
},
{
"entropy": 6.202089929580689,
"epoch": 1.8361223312175419,
"grad_norm": 0.91015625,
"learning_rate": 0.00046718710671927815,
"loss": 5.7778,
"mean_token_accuracy": 0.19897102266550065,
"num_tokens": 40302153.0,
"step": 15910
},
{
"entropy": 6.2814734935760494,
"epoch": 1.8366993652625505,
"grad_norm": 0.9609375,
"learning_rate": 0.00046716564593345843,
"loss": 5.743,
"mean_token_accuracy": 0.1985234797000885,
"num_tokens": 40315493.0,
"step": 15915
},
{
"entropy": 6.283923673629761,
"epoch": 1.8372763993075591,
"grad_norm": 0.9296875,
"learning_rate": 0.00046714417868424265,
"loss": 5.7986,
"mean_token_accuracy": 0.1846300795674324,
"num_tokens": 40328157.0,
"step": 15920
},
{
"entropy": 6.262593412399292,
"epoch": 1.8378534333525678,
"grad_norm": 0.84765625,
"learning_rate": 0.00046712270497235284,
"loss": 5.8082,
"mean_token_accuracy": 0.1937829002737999,
"num_tokens": 40341684.0,
"step": 15925
},
{
"entropy": 6.3377039432525635,
"epoch": 1.8384304673975764,
"grad_norm": 0.90625,
"learning_rate": 0.0004671012247985112,
"loss": 5.8578,
"mean_token_accuracy": 0.18830958604812623,
"num_tokens": 40354002.0,
"step": 15930
},
{
"entropy": 6.204885721206665,
"epoch": 1.839007501442585,
"grad_norm": 0.92578125,
"learning_rate": 0.00046707973816344044,
"loss": 5.7634,
"mean_token_accuracy": 0.20010476559400558,
"num_tokens": 40366211.0,
"step": 15935
},
{
"entropy": 6.284234189987183,
"epoch": 1.8395845354875937,
"grad_norm": 0.984375,
"learning_rate": 0.00046705824506786304,
"loss": 5.8542,
"mean_token_accuracy": 0.19239040166139604,
"num_tokens": 40377957.0,
"step": 15940
},
{
"entropy": 6.301759529113769,
"epoch": 1.8401615695326026,
"grad_norm": 0.890625,
"learning_rate": 0.00046703674551250193,
"loss": 5.802,
"mean_token_accuracy": 0.19346368908882142,
"num_tokens": 40391018.0,
"step": 15945
},
{
"entropy": 6.218786287307739,
"epoch": 1.840738603577611,
"grad_norm": 0.87890625,
"learning_rate": 0.0004670152394980803,
"loss": 5.7965,
"mean_token_accuracy": 0.19256123006343842,
"num_tokens": 40405134.0,
"step": 15950
},
{
"entropy": 6.305995988845825,
"epoch": 1.8413156376226198,
"grad_norm": 0.9375,
"learning_rate": 0.0004669937270253214,
"loss": 5.8067,
"mean_token_accuracy": 0.19366917610168458,
"num_tokens": 40418131.0,
"step": 15955
},
{
"entropy": 6.268421268463134,
"epoch": 1.8418926716676283,
"grad_norm": 0.9765625,
"learning_rate": 0.000466972208094949,
"loss": 5.7485,
"mean_token_accuracy": 0.1956111580133438,
"num_tokens": 40430614.0,
"step": 15960
},
{
"entropy": 6.332875061035156,
"epoch": 1.8424697057126371,
"grad_norm": 1.015625,
"learning_rate": 0.00046695068270768665,
"loss": 5.7761,
"mean_token_accuracy": 0.19068144708871843,
"num_tokens": 40443200.0,
"step": 15965
},
{
"entropy": 6.184208965301513,
"epoch": 1.8430467397576455,
"grad_norm": 1.078125,
"learning_rate": 0.00046692915086425846,
"loss": 5.735,
"mean_token_accuracy": 0.19420334547758103,
"num_tokens": 40455662.0,
"step": 15970
},
{
"entropy": 6.239500045776367,
"epoch": 1.8436237738026544,
"grad_norm": 0.98828125,
"learning_rate": 0.00046690761256538857,
"loss": 5.7007,
"mean_token_accuracy": 0.20253938138484956,
"num_tokens": 40468247.0,
"step": 15975
},
{
"entropy": 6.316354751586914,
"epoch": 1.844200807847663,
"grad_norm": 0.9453125,
"learning_rate": 0.0004668860678118015,
"loss": 5.8784,
"mean_token_accuracy": 0.1913073852658272,
"num_tokens": 40480607.0,
"step": 15980
},
{
"entropy": 6.30676498413086,
"epoch": 1.8447778418926717,
"grad_norm": 0.90234375,
"learning_rate": 0.00046686451660422185,
"loss": 5.7809,
"mean_token_accuracy": 0.1933899149298668,
"num_tokens": 40492140.0,
"step": 15985
},
{
"entropy": 6.29900894165039,
"epoch": 1.8453548759376803,
"grad_norm": 0.953125,
"learning_rate": 0.00046684295894337455,
"loss": 5.8328,
"mean_token_accuracy": 0.19052439033985138,
"num_tokens": 40504513.0,
"step": 15990
},
{
"entropy": 6.217627811431885,
"epoch": 1.845931909982689,
"grad_norm": 1.0,
"learning_rate": 0.0004668213948299845,
"loss": 5.7376,
"mean_token_accuracy": 0.1955086499452591,
"num_tokens": 40517258.0,
"step": 15995
},
{
"entropy": 6.232381010055542,
"epoch": 1.8465089440276976,
"grad_norm": 0.9296875,
"learning_rate": 0.0004667998242647772,
"loss": 5.7692,
"mean_token_accuracy": 0.1925689846277237,
"num_tokens": 40529092.0,
"step": 16000
},
{
"entropy": 6.237630987167359,
"epoch": 1.8470859780727062,
"grad_norm": 0.91796875,
"learning_rate": 0.000466778247248478,
"loss": 5.7287,
"mean_token_accuracy": 0.1985825851559639,
"num_tokens": 40543586.0,
"step": 16005
},
{
"entropy": 6.311019611358643,
"epoch": 1.847663012117715,
"grad_norm": 1.0078125,
"learning_rate": 0.00046675666378181275,
"loss": 5.794,
"mean_token_accuracy": 0.19712699204683304,
"num_tokens": 40555721.0,
"step": 16010
},
{
"entropy": 6.333885526657104,
"epoch": 1.8482400461627235,
"grad_norm": 0.86328125,
"learning_rate": 0.0004667350738655074,
"loss": 5.871,
"mean_token_accuracy": 0.18650257140398024,
"num_tokens": 40567547.0,
"step": 16015
},
{
"entropy": 6.246447324752808,
"epoch": 1.8488170802077324,
"grad_norm": 0.9921875,
"learning_rate": 0.00046671347750028806,
"loss": 5.712,
"mean_token_accuracy": 0.1954139679670334,
"num_tokens": 40579498.0,
"step": 16020
},
{
"entropy": 6.294281148910523,
"epoch": 1.8493941142527408,
"grad_norm": 0.875,
"learning_rate": 0.0004666918746868811,
"loss": 5.8376,
"mean_token_accuracy": 0.18255259990692138,
"num_tokens": 40593853.0,
"step": 16025
},
{
"entropy": 6.21675066947937,
"epoch": 1.8499711482977497,
"grad_norm": 1.0,
"learning_rate": 0.0004666702654260133,
"loss": 5.7154,
"mean_token_accuracy": 0.1969263732433319,
"num_tokens": 40605737.0,
"step": 16030
},
{
"entropy": 6.190192651748657,
"epoch": 1.850548182342758,
"grad_norm": 0.9296875,
"learning_rate": 0.00046664864971841113,
"loss": 5.697,
"mean_token_accuracy": 0.2019049718976021,
"num_tokens": 40617839.0,
"step": 16035
},
{
"entropy": 6.243142032623291,
"epoch": 1.851125216387767,
"grad_norm": 0.9140625,
"learning_rate": 0.00046662702756480195,
"loss": 5.769,
"mean_token_accuracy": 0.196391262114048,
"num_tokens": 40630247.0,
"step": 16040
},
{
"entropy": 6.155957269668579,
"epoch": 1.8517022504327756,
"grad_norm": 1.1484375,
"learning_rate": 0.00046660539896591286,
"loss": 5.6666,
"mean_token_accuracy": 0.2063628390431404,
"num_tokens": 40643869.0,
"step": 16045
},
{
"entropy": 6.268722629547119,
"epoch": 1.8522792844777842,
"grad_norm": 0.93359375,
"learning_rate": 0.0004665837639224713,
"loss": 5.7752,
"mean_token_accuracy": 0.19113756120204925,
"num_tokens": 40655389.0,
"step": 16050
},
{
"entropy": 6.285340595245361,
"epoch": 1.8528563185227929,
"grad_norm": 0.9140625,
"learning_rate": 0.00046656212243520505,
"loss": 5.7934,
"mean_token_accuracy": 0.18825832307338713,
"num_tokens": 40667663.0,
"step": 16055
},
{
"entropy": 6.273303270339966,
"epoch": 1.8534333525678015,
"grad_norm": 0.921875,
"learning_rate": 0.00046654047450484193,
"loss": 5.7277,
"mean_token_accuracy": 0.19776127189397813,
"num_tokens": 40680623.0,
"step": 16060
},
{
"entropy": 6.216945171356201,
"epoch": 1.8540103866128101,
"grad_norm": 0.90234375,
"learning_rate": 0.0004665188201321102,
"loss": 5.7082,
"mean_token_accuracy": 0.19727377593517303,
"num_tokens": 40692679.0,
"step": 16065
},
{
"entropy": 6.272071456909179,
"epoch": 1.8545874206578188,
"grad_norm": 0.921875,
"learning_rate": 0.00046649715931773795,
"loss": 5.8786,
"mean_token_accuracy": 0.19242863059043885,
"num_tokens": 40705187.0,
"step": 16070
},
{
"entropy": 6.28022871017456,
"epoch": 1.8551644547028274,
"grad_norm": 0.8984375,
"learning_rate": 0.000466475492062454,
"loss": 5.8193,
"mean_token_accuracy": 0.19652820974588395,
"num_tokens": 40717854.0,
"step": 16075
},
{
"entropy": 6.257518720626831,
"epoch": 1.855741488747836,
"grad_norm": 0.91796875,
"learning_rate": 0.00046645381836698684,
"loss": 5.8047,
"mean_token_accuracy": 0.19478076994419097,
"num_tokens": 40731039.0,
"step": 16080
},
{
"entropy": 6.252432584762573,
"epoch": 1.856318522792845,
"grad_norm": 0.9453125,
"learning_rate": 0.0004664321382320657,
"loss": 5.742,
"mean_token_accuracy": 0.19954000115394593,
"num_tokens": 40745065.0,
"step": 16085
},
{
"entropy": 6.2835486888885494,
"epoch": 1.8568955568378533,
"grad_norm": 0.91796875,
"learning_rate": 0.00046641045165841965,
"loss": 5.8538,
"mean_token_accuracy": 0.18943217396736145,
"num_tokens": 40758107.0,
"step": 16090
},
{
"entropy": 6.31345567703247,
"epoch": 1.8574725908828622,
"grad_norm": 0.95703125,
"learning_rate": 0.00046638875864677814,
"loss": 5.8626,
"mean_token_accuracy": 0.18975879997015,
"num_tokens": 40771082.0,
"step": 16095
},
{
"entropy": 6.294506025314331,
"epoch": 1.8580496249278706,
"grad_norm": 0.8984375,
"learning_rate": 0.0004663670591978708,
"loss": 5.7806,
"mean_token_accuracy": 0.18993891030550003,
"num_tokens": 40784165.0,
"step": 16100
},
{
"entropy": 6.175074863433838,
"epoch": 1.8586266589728795,
"grad_norm": 0.9375,
"learning_rate": 0.0004663453533124275,
"loss": 5.6254,
"mean_token_accuracy": 0.21204764991998673,
"num_tokens": 40796279.0,
"step": 16105
},
{
"entropy": 6.217782354354858,
"epoch": 1.859203693017888,
"grad_norm": 0.921875,
"learning_rate": 0.0004663236409911783,
"loss": 5.7205,
"mean_token_accuracy": 0.19833692610263826,
"num_tokens": 40809074.0,
"step": 16110
},
{
"entropy": 6.194740915298462,
"epoch": 1.8597807270628968,
"grad_norm": 0.95703125,
"learning_rate": 0.00046630192223485345,
"loss": 5.6586,
"mean_token_accuracy": 0.20452403873205185,
"num_tokens": 40821086.0,
"step": 16115
},
{
"entropy": 6.311218357086181,
"epoch": 1.8603577611079054,
"grad_norm": 0.96484375,
"learning_rate": 0.00046628019704418345,
"loss": 5.7747,
"mean_token_accuracy": 0.19277962148189545,
"num_tokens": 40832697.0,
"step": 16120
},
{
"entropy": 6.1826904773712155,
"epoch": 1.860934795152914,
"grad_norm": 0.91796875,
"learning_rate": 0.000466258465419899,
"loss": 5.7908,
"mean_token_accuracy": 0.19389365762472152,
"num_tokens": 40845268.0,
"step": 16125
},
{
"entropy": 6.3233559131622314,
"epoch": 1.8615118291979227,
"grad_norm": 0.8671875,
"learning_rate": 0.0004662367273627312,
"loss": 5.8121,
"mean_token_accuracy": 0.1891919642686844,
"num_tokens": 40858314.0,
"step": 16130
},
{
"entropy": 6.302750968933106,
"epoch": 1.8620888632429313,
"grad_norm": 0.98828125,
"learning_rate": 0.000466214982873411,
"loss": 5.7606,
"mean_token_accuracy": 0.19642114788293838,
"num_tokens": 40869982.0,
"step": 16135
},
{
"entropy": 6.234612894058228,
"epoch": 1.86266589728794,
"grad_norm": 0.890625,
"learning_rate": 0.00046619323195266975,
"loss": 5.7159,
"mean_token_accuracy": 0.20078064352273942,
"num_tokens": 40881831.0,
"step": 16140
},
{
"entropy": 6.17855396270752,
"epoch": 1.8632429313329486,
"grad_norm": 1.0625,
"learning_rate": 0.0004661714746012392,
"loss": 5.7297,
"mean_token_accuracy": 0.19786572009325026,
"num_tokens": 40894279.0,
"step": 16145
},
{
"entropy": 6.281162405014038,
"epoch": 1.8638199653779572,
"grad_norm": 0.98046875,
"learning_rate": 0.000466149710819851,
"loss": 5.7957,
"mean_token_accuracy": 0.1955430254340172,
"num_tokens": 40906960.0,
"step": 16150
},
{
"entropy": 6.305213737487793,
"epoch": 1.8643969994229659,
"grad_norm": 0.89453125,
"learning_rate": 0.0004661279406092373,
"loss": 5.8203,
"mean_token_accuracy": 0.18938140720129013,
"num_tokens": 40920688.0,
"step": 16155
},
{
"entropy": 6.323654222488403,
"epoch": 1.8649740334679747,
"grad_norm": 0.89453125,
"learning_rate": 0.00046610616397013027,
"loss": 5.826,
"mean_token_accuracy": 0.19093446284532548,
"num_tokens": 40933017.0,
"step": 16160
},
{
"entropy": 6.247139501571655,
"epoch": 1.8655510675129832,
"grad_norm": 0.8828125,
"learning_rate": 0.0004660843809032623,
"loss": 5.6878,
"mean_token_accuracy": 0.20525743216276168,
"num_tokens": 40947179.0,
"step": 16165
},
{
"entropy": 6.2831775665283205,
"epoch": 1.866128101557992,
"grad_norm": 0.91796875,
"learning_rate": 0.0004660625914093661,
"loss": 5.8344,
"mean_token_accuracy": 0.18841950744390487,
"num_tokens": 40958806.0,
"step": 16170
},
{
"entropy": 6.3006516456604,
"epoch": 1.8667051356030004,
"grad_norm": 1.0390625,
"learning_rate": 0.0004660407954891745,
"loss": 5.7546,
"mean_token_accuracy": 0.19830986261367797,
"num_tokens": 40970667.0,
"step": 16175
},
{
"entropy": 6.27160415649414,
"epoch": 1.8672821696480093,
"grad_norm": 0.93359375,
"learning_rate": 0.0004660189931434207,
"loss": 5.7809,
"mean_token_accuracy": 0.1949162170290947,
"num_tokens": 40982663.0,
"step": 16180
},
{
"entropy": 6.185522985458374,
"epoch": 1.8678592036930177,
"grad_norm": 0.984375,
"learning_rate": 0.0004659971843728379,
"loss": 5.7236,
"mean_token_accuracy": 0.20043258517980575,
"num_tokens": 40995168.0,
"step": 16185
},
{
"entropy": 6.284909343719482,
"epoch": 1.8684362377380266,
"grad_norm": 0.92578125,
"learning_rate": 0.0004659753691781597,
"loss": 5.8185,
"mean_token_accuracy": 0.1912219762802124,
"num_tokens": 41007159.0,
"step": 16190
},
{
"entropy": 6.213361740112305,
"epoch": 1.8690132717830352,
"grad_norm": 0.90234375,
"learning_rate": 0.0004659535475601198,
"loss": 5.683,
"mean_token_accuracy": 0.19469626247882843,
"num_tokens": 41019860.0,
"step": 16195
},
{
"entropy": 6.234416866302491,
"epoch": 1.8695903058280439,
"grad_norm": 1.0,
"learning_rate": 0.00046593171951945226,
"loss": 5.76,
"mean_token_accuracy": 0.19812550395727158,
"num_tokens": 41031635.0,
"step": 16200
},
{
"entropy": 6.286600160598755,
"epoch": 1.8701673398730525,
"grad_norm": 0.89453125,
"learning_rate": 0.00046590988505689114,
"loss": 5.8125,
"mean_token_accuracy": 0.19126126021146775,
"num_tokens": 41044678.0,
"step": 16205
},
{
"entropy": 6.305450344085694,
"epoch": 1.8707443739180611,
"grad_norm": 0.90234375,
"learning_rate": 0.00046588804417317084,
"loss": 5.857,
"mean_token_accuracy": 0.19345226287841796,
"num_tokens": 41056799.0,
"step": 16210
},
{
"entropy": 6.275042295455933,
"epoch": 1.8713214079630698,
"grad_norm": 1.015625,
"learning_rate": 0.00046586619686902597,
"loss": 5.814,
"mean_token_accuracy": 0.1963962972164154,
"num_tokens": 41069700.0,
"step": 16215
},
{
"entropy": 6.318129396438598,
"epoch": 1.8718984420080784,
"grad_norm": 1.015625,
"learning_rate": 0.00046584434314519144,
"loss": 5.7263,
"mean_token_accuracy": 0.19932073950767518,
"num_tokens": 41081427.0,
"step": 16220
},
{
"entropy": 6.261219692230225,
"epoch": 1.8724754760530873,
"grad_norm": 1.25,
"learning_rate": 0.0004658224830024022,
"loss": 5.7052,
"mean_token_accuracy": 0.2031535804271698,
"num_tokens": 41094770.0,
"step": 16225
},
{
"entropy": 6.250154447555542,
"epoch": 1.8730525100980957,
"grad_norm": 1.0234375,
"learning_rate": 0.0004658006164413935,
"loss": 5.7422,
"mean_token_accuracy": 0.19554442614316941,
"num_tokens": 41106802.0,
"step": 16230
},
{
"entropy": 6.230137729644776,
"epoch": 1.8736295441431046,
"grad_norm": 0.8984375,
"learning_rate": 0.0004657787434629009,
"loss": 5.8139,
"mean_token_accuracy": 0.20067144930362701,
"num_tokens": 41120125.0,
"step": 16235
},
{
"entropy": 6.221140146255493,
"epoch": 1.874206578188113,
"grad_norm": 1.59375,
"learning_rate": 0.00046575686406765993,
"loss": 5.7643,
"mean_token_accuracy": 0.20250476002693177,
"num_tokens": 41134267.0,
"step": 16240
},
{
"entropy": 6.312375211715699,
"epoch": 1.8747836122331218,
"grad_norm": 0.87890625,
"learning_rate": 0.00046573497825640664,
"loss": 5.7214,
"mean_token_accuracy": 0.19941470474004747,
"num_tokens": 41147266.0,
"step": 16245
},
{
"entropy": 6.245394372940064,
"epoch": 1.8753606462781303,
"grad_norm": 0.921875,
"learning_rate": 0.0004657130860298771,
"loss": 5.7564,
"mean_token_accuracy": 0.19797106981277465,
"num_tokens": 41159666.0,
"step": 16250
},
{
"entropy": 6.305567932128906,
"epoch": 1.8759376803231391,
"grad_norm": 0.94140625,
"learning_rate": 0.0004656911873888077,
"loss": 5.8111,
"mean_token_accuracy": 0.194146266579628,
"num_tokens": 41171947.0,
"step": 16255
},
{
"entropy": 6.2310679912567135,
"epoch": 1.8765147143681478,
"grad_norm": 0.8671875,
"learning_rate": 0.0004656692823339349,
"loss": 5.7744,
"mean_token_accuracy": 0.20527701675891877,
"num_tokens": 41186376.0,
"step": 16260
},
{
"entropy": 6.251262378692627,
"epoch": 1.8770917484131564,
"grad_norm": 0.921875,
"learning_rate": 0.0004656473708659955,
"loss": 5.8127,
"mean_token_accuracy": 0.19876704216003419,
"num_tokens": 41199730.0,
"step": 16265
},
{
"entropy": 6.275247240066529,
"epoch": 1.877668782458165,
"grad_norm": 0.890625,
"learning_rate": 0.00046562545298572646,
"loss": 5.7252,
"mean_token_accuracy": 0.20782668739557267,
"num_tokens": 41212502.0,
"step": 16270
},
{
"entropy": 6.231871271133423,
"epoch": 1.8782458165031737,
"grad_norm": 0.9765625,
"learning_rate": 0.000465603528693865,
"loss": 5.7218,
"mean_token_accuracy": 0.1999581292271614,
"num_tokens": 41226006.0,
"step": 16275
},
{
"entropy": 6.290467929840088,
"epoch": 1.8788228505481823,
"grad_norm": 0.91796875,
"learning_rate": 0.00046558159799114853,
"loss": 5.7759,
"mean_token_accuracy": 0.19554868936538697,
"num_tokens": 41239172.0,
"step": 16280
},
{
"entropy": 6.234803247451782,
"epoch": 1.879399884593191,
"grad_norm": 0.9296875,
"learning_rate": 0.0004655596608783147,
"loss": 5.6807,
"mean_token_accuracy": 0.20324462056159973,
"num_tokens": 41251307.0,
"step": 16285
},
{
"entropy": 6.256707239151001,
"epoch": 1.8799769186381996,
"grad_norm": 0.91015625,
"learning_rate": 0.00046553771735610136,
"loss": 5.7335,
"mean_token_accuracy": 0.1982148304581642,
"num_tokens": 41264634.0,
"step": 16290
},
{
"entropy": 6.3179339408874515,
"epoch": 1.8805539526832082,
"grad_norm": 1.09375,
"learning_rate": 0.0004655157674252465,
"loss": 5.7985,
"mean_token_accuracy": 0.18980283737182618,
"num_tokens": 41278205.0,
"step": 16295
},
{
"entropy": 6.348180198669434,
"epoch": 1.881130986728217,
"grad_norm": 0.93359375,
"learning_rate": 0.00046549381108648843,
"loss": 5.8224,
"mean_token_accuracy": 0.19358165115118026,
"num_tokens": 41290447.0,
"step": 16300
},
{
"entropy": 6.262139749526978,
"epoch": 1.8817080207732255,
"grad_norm": 0.953125,
"learning_rate": 0.0004654718483405656,
"loss": 5.7144,
"mean_token_accuracy": 0.20273840427398682,
"num_tokens": 41302948.0,
"step": 16305
},
{
"entropy": 6.263070011138916,
"epoch": 1.8822850548182344,
"grad_norm": 0.95703125,
"learning_rate": 0.00046544987918821685,
"loss": 5.8237,
"mean_token_accuracy": 0.18879707604646684,
"num_tokens": 41315237.0,
"step": 16310
},
{
"entropy": 6.133535957336425,
"epoch": 1.8828620888632428,
"grad_norm": 1.09375,
"learning_rate": 0.000465427903630181,
"loss": 5.5638,
"mean_token_accuracy": 0.2196532055735588,
"num_tokens": 41327426.0,
"step": 16315
},
{
"entropy": 6.307161808013916,
"epoch": 1.8834391229082517,
"grad_norm": 1.0078125,
"learning_rate": 0.0004654059216671972,
"loss": 5.8517,
"mean_token_accuracy": 0.18843885362148285,
"num_tokens": 41340517.0,
"step": 16320
},
{
"entropy": 6.236600637435913,
"epoch": 1.88401615695326,
"grad_norm": 0.953125,
"learning_rate": 0.0004653839333000048,
"loss": 5.7559,
"mean_token_accuracy": 0.20001779347658158,
"num_tokens": 41353520.0,
"step": 16325
},
{
"entropy": 6.285597038269043,
"epoch": 1.884593190998269,
"grad_norm": 0.92578125,
"learning_rate": 0.00046536193852934334,
"loss": 5.7969,
"mean_token_accuracy": 0.19169134944677352,
"num_tokens": 41366326.0,
"step": 16330
},
{
"entropy": 6.229726505279541,
"epoch": 1.8851702250432776,
"grad_norm": 1.046875,
"learning_rate": 0.00046533993735595273,
"loss": 5.7167,
"mean_token_accuracy": 0.19942979216575624,
"num_tokens": 41377405.0,
"step": 16335
},
{
"entropy": 6.325794410705567,
"epoch": 1.8857472590882862,
"grad_norm": 1.046875,
"learning_rate": 0.00046531792978057277,
"loss": 5.8318,
"mean_token_accuracy": 0.19330891519784926,
"num_tokens": 41391038.0,
"step": 16340
},
{
"entropy": 6.256032085418701,
"epoch": 1.8863242931332949,
"grad_norm": 0.96484375,
"learning_rate": 0.0004652959158039438,
"loss": 5.7934,
"mean_token_accuracy": 0.19577520489692687,
"num_tokens": 41404069.0,
"step": 16345
},
{
"entropy": 6.223421478271485,
"epoch": 1.8869013271783035,
"grad_norm": 0.89453125,
"learning_rate": 0.0004652738954268062,
"loss": 5.7639,
"mean_token_accuracy": 0.19806374460458756,
"num_tokens": 41416698.0,
"step": 16350
},
{
"entropy": 6.249164390563965,
"epoch": 1.8874783612233121,
"grad_norm": 0.9140625,
"learning_rate": 0.00046525186864990073,
"loss": 5.7403,
"mean_token_accuracy": 0.20115036368370057,
"num_tokens": 41429953.0,
"step": 16355
},
{
"entropy": 6.211552906036377,
"epoch": 1.8880553952683208,
"grad_norm": 0.91796875,
"learning_rate": 0.00046522983547396806,
"loss": 5.7539,
"mean_token_accuracy": 0.1969211846590042,
"num_tokens": 41442824.0,
"step": 16360
},
{
"entropy": 6.246453046798706,
"epoch": 1.8886324293133296,
"grad_norm": 0.94921875,
"learning_rate": 0.0004652077958997494,
"loss": 5.7936,
"mean_token_accuracy": 0.19895950108766555,
"num_tokens": 41455062.0,
"step": 16365
},
{
"entropy": 6.222312116622925,
"epoch": 1.889209463358338,
"grad_norm": 1.03125,
"learning_rate": 0.00046518574992798604,
"loss": 5.6555,
"mean_token_accuracy": 0.2099636271595955,
"num_tokens": 41468147.0,
"step": 16370
},
{
"entropy": 6.223028945922851,
"epoch": 1.889786497403347,
"grad_norm": 0.98046875,
"learning_rate": 0.00046516369755941945,
"loss": 5.7131,
"mean_token_accuracy": 0.19650413542985917,
"num_tokens": 41480664.0,
"step": 16375
},
{
"entropy": 6.2845159530639645,
"epoch": 1.8903635314483553,
"grad_norm": 0.87890625,
"learning_rate": 0.0004651416387947914,
"loss": 5.7874,
"mean_token_accuracy": 0.19323295950889588,
"num_tokens": 41494578.0,
"step": 16380
},
{
"entropy": 6.292543506622314,
"epoch": 1.8909405654933642,
"grad_norm": 0.859375,
"learning_rate": 0.0004651195736348437,
"loss": 5.8311,
"mean_token_accuracy": 0.19104174971580506,
"num_tokens": 41506528.0,
"step": 16385
},
{
"entropy": 6.3199584007263185,
"epoch": 1.8915175995383726,
"grad_norm": 0.91015625,
"learning_rate": 0.0004650975020803186,
"loss": 5.8854,
"mean_token_accuracy": 0.18843409717082976,
"num_tokens": 41520861.0,
"step": 16390
},
{
"entropy": 6.2749334335327145,
"epoch": 1.8920946335833815,
"grad_norm": 0.96484375,
"learning_rate": 0.0004650754241319584,
"loss": 5.7578,
"mean_token_accuracy": 0.19465109407901765,
"num_tokens": 41533811.0,
"step": 16395
},
{
"entropy": 6.295410919189453,
"epoch": 1.8926716676283901,
"grad_norm": 0.90625,
"learning_rate": 0.00046505333979050573,
"loss": 5.8309,
"mean_token_accuracy": 0.18629831969738006,
"num_tokens": 41546291.0,
"step": 16400
},
{
"entropy": 6.229169321060181,
"epoch": 1.8932487016733988,
"grad_norm": 0.9375,
"learning_rate": 0.0004650312490567035,
"loss": 5.6885,
"mean_token_accuracy": 0.20371766537427902,
"num_tokens": 41558157.0,
"step": 16405
},
{
"entropy": 6.260204553604126,
"epoch": 1.8938257357184074,
"grad_norm": 0.90625,
"learning_rate": 0.0004650091519312945,
"loss": 5.7904,
"mean_token_accuracy": 0.19707432389259338,
"num_tokens": 41571346.0,
"step": 16410
},
{
"entropy": 6.290263605117798,
"epoch": 1.894402769763416,
"grad_norm": 0.94140625,
"learning_rate": 0.00046498704841502203,
"loss": 5.8656,
"mean_token_accuracy": 0.1875235214829445,
"num_tokens": 41583973.0,
"step": 16415
},
{
"entropy": 6.2632382869720455,
"epoch": 1.8949798038084247,
"grad_norm": 0.85546875,
"learning_rate": 0.0004649649385086296,
"loss": 5.7809,
"mean_token_accuracy": 0.1917982280254364,
"num_tokens": 41596210.0,
"step": 16420
},
{
"entropy": 6.269391632080078,
"epoch": 1.8955568378534333,
"grad_norm": 0.921875,
"learning_rate": 0.0004649428222128608,
"loss": 5.8774,
"mean_token_accuracy": 0.1920461028814316,
"num_tokens": 41608297.0,
"step": 16425
},
{
"entropy": 6.2635517597198485,
"epoch": 1.896133871898442,
"grad_norm": 0.9609375,
"learning_rate": 0.00046492069952845953,
"loss": 5.8159,
"mean_token_accuracy": 0.19155189394950867,
"num_tokens": 41621319.0,
"step": 16430
},
{
"entropy": 6.256300735473633,
"epoch": 1.8967109059434506,
"grad_norm": 0.92578125,
"learning_rate": 0.00046489857045617,
"loss": 5.7019,
"mean_token_accuracy": 0.1957299679517746,
"num_tokens": 41633282.0,
"step": 16435
},
{
"entropy": 6.198005723953247,
"epoch": 1.8972879399884595,
"grad_norm": 0.91015625,
"learning_rate": 0.00046487643499673625,
"loss": 5.7409,
"mean_token_accuracy": 0.19980133175849915,
"num_tokens": 41646573.0,
"step": 16440
},
{
"entropy": 6.209664535522461,
"epoch": 1.8978649740334679,
"grad_norm": 0.84375,
"learning_rate": 0.0004648542931509029,
"loss": 5.7305,
"mean_token_accuracy": 0.1976473018527031,
"num_tokens": 41659596.0,
"step": 16445
},
{
"entropy": 6.271393918991089,
"epoch": 1.8984420080784767,
"grad_norm": 0.890625,
"learning_rate": 0.0004648321449194148,
"loss": 5.7343,
"mean_token_accuracy": 0.19791839867830277,
"num_tokens": 41673612.0,
"step": 16450
},
{
"entropy": 6.33080906867981,
"epoch": 1.8990190421234852,
"grad_norm": 0.88671875,
"learning_rate": 0.00046480999030301673,
"loss": 5.8707,
"mean_token_accuracy": 0.19741834253072738,
"num_tokens": 41686583.0,
"step": 16455
},
{
"entropy": 6.2306641101837155,
"epoch": 1.899596076168494,
"grad_norm": 0.8984375,
"learning_rate": 0.00046478782930245395,
"loss": 5.7818,
"mean_token_accuracy": 0.19308353811502457,
"num_tokens": 41698542.0,
"step": 16460
},
{
"entropy": 6.272447824478149,
"epoch": 1.9001731102135024,
"grad_norm": 0.92578125,
"learning_rate": 0.00046476566191847176,
"loss": 5.7652,
"mean_token_accuracy": 0.19157506674528121,
"num_tokens": 41712461.0,
"step": 16465
},
{
"entropy": 6.274053525924683,
"epoch": 1.9007501442585113,
"grad_norm": 0.94921875,
"learning_rate": 0.0004647434881518159,
"loss": 5.7936,
"mean_token_accuracy": 0.19418258666992189,
"num_tokens": 41725450.0,
"step": 16470
},
{
"entropy": 6.304055404663086,
"epoch": 1.90132717830352,
"grad_norm": 1.0234375,
"learning_rate": 0.00046472130800323194,
"loss": 5.7928,
"mean_token_accuracy": 0.1953343480825424,
"num_tokens": 41737255.0,
"step": 16475
},
{
"entropy": 6.237203598022461,
"epoch": 1.9019042123485286,
"grad_norm": 0.98828125,
"learning_rate": 0.0004646991214734661,
"loss": 5.8467,
"mean_token_accuracy": 0.18810160607099533,
"num_tokens": 41749459.0,
"step": 16480
},
{
"entropy": 6.266273927688599,
"epoch": 1.9024812463935372,
"grad_norm": 0.8828125,
"learning_rate": 0.0004646769285632645,
"loss": 5.7854,
"mean_token_accuracy": 0.19517850428819655,
"num_tokens": 41761603.0,
"step": 16485
},
{
"entropy": 6.29341402053833,
"epoch": 1.9030582804385459,
"grad_norm": 0.95703125,
"learning_rate": 0.0004646547292733737,
"loss": 5.866,
"mean_token_accuracy": 0.19031329154968263,
"num_tokens": 41774865.0,
"step": 16490
},
{
"entropy": 6.235404348373413,
"epoch": 1.9036353144835545,
"grad_norm": 0.95703125,
"learning_rate": 0.0004646325236045402,
"loss": 5.7926,
"mean_token_accuracy": 0.19833193123340606,
"num_tokens": 41787558.0,
"step": 16495
},
{
"entropy": 6.243685007095337,
"epoch": 1.9042123485285631,
"grad_norm": 0.921875,
"learning_rate": 0.000464610311557511,
"loss": 5.719,
"mean_token_accuracy": 0.20007752627134323,
"num_tokens": 41800754.0,
"step": 16500
},
{
"entropy": 6.226137685775757,
"epoch": 1.904789382573572,
"grad_norm": 0.87890625,
"learning_rate": 0.0004645880931330331,
"loss": 5.6967,
"mean_token_accuracy": 0.20966541022062302,
"num_tokens": 41813133.0,
"step": 16505
},
{
"entropy": 6.233737277984619,
"epoch": 1.9053664166185804,
"grad_norm": 0.9609375,
"learning_rate": 0.0004645658683318539,
"loss": 5.8035,
"mean_token_accuracy": 0.18930404186248778,
"num_tokens": 41825288.0,
"step": 16510
},
{
"entropy": 6.292668104171753,
"epoch": 1.9059434506635893,
"grad_norm": 0.9765625,
"learning_rate": 0.0004645436371547209,
"loss": 5.8451,
"mean_token_accuracy": 0.19418457448482512,
"num_tokens": 41837331.0,
"step": 16515
},
{
"entropy": 6.341061973571778,
"epoch": 1.9065204847085977,
"grad_norm": 0.93359375,
"learning_rate": 0.00046452139960238186,
"loss": 5.8377,
"mean_token_accuracy": 0.19629154950380326,
"num_tokens": 41850536.0,
"step": 16520
},
{
"entropy": 6.257677698135376,
"epoch": 1.9070975187536066,
"grad_norm": 0.9453125,
"learning_rate": 0.00046449915567558467,
"loss": 5.7741,
"mean_token_accuracy": 0.20220681130886078,
"num_tokens": 41862199.0,
"step": 16525
},
{
"entropy": 6.220550918579102,
"epoch": 1.907674552798615,
"grad_norm": 0.9765625,
"learning_rate": 0.0004644769053750775,
"loss": 5.7688,
"mean_token_accuracy": 0.196894970536232,
"num_tokens": 41872945.0,
"step": 16530
},
{
"entropy": 6.280444192886352,
"epoch": 1.9082515868436238,
"grad_norm": 0.96875,
"learning_rate": 0.0004644546487016087,
"loss": 5.7714,
"mean_token_accuracy": 0.18869336992502211,
"num_tokens": 41884223.0,
"step": 16535
},
{
"entropy": 6.260154581069946,
"epoch": 1.9088286208886325,
"grad_norm": 0.94140625,
"learning_rate": 0.00046443238565592687,
"loss": 5.7942,
"mean_token_accuracy": 0.19114427119493485,
"num_tokens": 41896997.0,
"step": 16540
},
{
"entropy": 6.2543297290802,
"epoch": 1.9094056549336411,
"grad_norm": 0.96875,
"learning_rate": 0.00046441011623878087,
"loss": 5.8051,
"mean_token_accuracy": 0.1990337774157524,
"num_tokens": 41910210.0,
"step": 16545
},
{
"entropy": 6.144182586669922,
"epoch": 1.9099826889786498,
"grad_norm": 0.98046875,
"learning_rate": 0.0004643878404509197,
"loss": 5.6173,
"mean_token_accuracy": 0.20534706264734268,
"num_tokens": 41922882.0,
"step": 16550
},
{
"entropy": 6.211149787902832,
"epoch": 1.9105597230236584,
"grad_norm": 0.921875,
"learning_rate": 0.00046436555829309264,
"loss": 5.6609,
"mean_token_accuracy": 0.20721425265073776,
"num_tokens": 41934655.0,
"step": 16555
},
{
"entropy": 6.271144676208496,
"epoch": 1.911136757068667,
"grad_norm": 0.984375,
"learning_rate": 0.000464343269766049,
"loss": 5.7733,
"mean_token_accuracy": 0.19531577229499816,
"num_tokens": 41947946.0,
"step": 16560
},
{
"entropy": 6.307552719116211,
"epoch": 1.9117137911136757,
"grad_norm": 0.96875,
"learning_rate": 0.00046432097487053857,
"loss": 5.8634,
"mean_token_accuracy": 0.19490341544151307,
"num_tokens": 41962316.0,
"step": 16565
},
{
"entropy": 6.244507789611816,
"epoch": 1.9122908251586843,
"grad_norm": 0.93359375,
"learning_rate": 0.00046429867360731124,
"loss": 5.7511,
"mean_token_accuracy": 0.20181444138288498,
"num_tokens": 41976076.0,
"step": 16570
},
{
"entropy": 6.296638822555542,
"epoch": 1.912867859203693,
"grad_norm": 0.92578125,
"learning_rate": 0.00046427636597711695,
"loss": 5.7693,
"mean_token_accuracy": 0.19726170897483825,
"num_tokens": 41988762.0,
"step": 16575
},
{
"entropy": 6.256453800201416,
"epoch": 1.9134448932487018,
"grad_norm": 0.875,
"learning_rate": 0.00046425405198070624,
"loss": 5.7026,
"mean_token_accuracy": 0.19614930152893068,
"num_tokens": 42000525.0,
"step": 16580
},
{
"entropy": 6.15288553237915,
"epoch": 1.9140219272937102,
"grad_norm": 0.921875,
"learning_rate": 0.00046423173161882944,
"loss": 5.6421,
"mean_token_accuracy": 0.20159791260957718,
"num_tokens": 42013716.0,
"step": 16585
},
{
"entropy": 6.256470537185669,
"epoch": 1.914598961338719,
"grad_norm": 1.03125,
"learning_rate": 0.00046420940489223735,
"loss": 5.7567,
"mean_token_accuracy": 0.198087240755558,
"num_tokens": 42026689.0,
"step": 16590
},
{
"entropy": 6.285912227630615,
"epoch": 1.9151759953837275,
"grad_norm": 0.89453125,
"learning_rate": 0.0004641870718016809,
"loss": 5.82,
"mean_token_accuracy": 0.18809255659580232,
"num_tokens": 42039907.0,
"step": 16595
},
{
"entropy": 6.284678554534912,
"epoch": 1.9157530294287364,
"grad_norm": 0.921875,
"learning_rate": 0.0004641647323479113,
"loss": 5.7782,
"mean_token_accuracy": 0.20078144371509551,
"num_tokens": 42052781.0,
"step": 16600
},
{
"entropy": 6.257567262649536,
"epoch": 1.9163300634737448,
"grad_norm": 1.015625,
"learning_rate": 0.0004641423865316798,
"loss": 5.7372,
"mean_token_accuracy": 0.2022291049361229,
"num_tokens": 42066695.0,
"step": 16605
},
{
"entropy": 6.1644511222839355,
"epoch": 1.9169070975187537,
"grad_norm": 0.953125,
"learning_rate": 0.0004641200343537381,
"loss": 5.6759,
"mean_token_accuracy": 0.20373013019561767,
"num_tokens": 42079315.0,
"step": 16610
},
{
"entropy": 6.284307432174683,
"epoch": 1.9174841315637623,
"grad_norm": 0.91015625,
"learning_rate": 0.000464097675814838,
"loss": 5.8274,
"mean_token_accuracy": 0.18814072906970977,
"num_tokens": 42091915.0,
"step": 16615
},
{
"entropy": 6.281247520446778,
"epoch": 1.918061165608771,
"grad_norm": 1.0078125,
"learning_rate": 0.0004640753109157316,
"loss": 5.8094,
"mean_token_accuracy": 0.19566377103328705,
"num_tokens": 42105316.0,
"step": 16620
},
{
"entropy": 6.255827951431274,
"epoch": 1.9186381996537796,
"grad_norm": 0.87109375,
"learning_rate": 0.00046405293965717093,
"loss": 5.719,
"mean_token_accuracy": 0.19903454780578614,
"num_tokens": 42118078.0,
"step": 16625
},
{
"entropy": 6.236255788803101,
"epoch": 1.9192152336987882,
"grad_norm": 0.94140625,
"learning_rate": 0.0004640305620399086,
"loss": 5.6829,
"mean_token_accuracy": 0.20465412139892578,
"num_tokens": 42130845.0,
"step": 16630
},
{
"entropy": 6.2283731460571286,
"epoch": 1.9197922677437969,
"grad_norm": 1.125,
"learning_rate": 0.0004640081780646971,
"loss": 5.7412,
"mean_token_accuracy": 0.20514567643404008,
"num_tokens": 42142487.0,
"step": 16635
},
{
"entropy": 6.188979005813598,
"epoch": 1.9203693017888055,
"grad_norm": 0.8984375,
"learning_rate": 0.00046398578773228954,
"loss": 5.7959,
"mean_token_accuracy": 0.1916016846895218,
"num_tokens": 42154747.0,
"step": 16640
},
{
"entropy": 6.3480628490447994,
"epoch": 1.9209463358338144,
"grad_norm": 1.109375,
"learning_rate": 0.00046396339104343886,
"loss": 5.7897,
"mean_token_accuracy": 0.1906105950474739,
"num_tokens": 42167697.0,
"step": 16645
},
{
"entropy": 6.264107656478882,
"epoch": 1.9215233698788228,
"grad_norm": 0.91796875,
"learning_rate": 0.0004639409879988984,
"loss": 5.7672,
"mean_token_accuracy": 0.19499629139900207,
"num_tokens": 42179874.0,
"step": 16650
},
{
"entropy": 6.344415950775146,
"epoch": 1.9221004039238316,
"grad_norm": 0.9921875,
"learning_rate": 0.0004639185785994216,
"loss": 5.8445,
"mean_token_accuracy": 0.19568451046943663,
"num_tokens": 42192747.0,
"step": 16655
},
{
"entropy": 6.209359455108642,
"epoch": 1.92267743796884,
"grad_norm": 0.94921875,
"learning_rate": 0.00046389616284576226,
"loss": 5.7244,
"mean_token_accuracy": 0.20322487354278565,
"num_tokens": 42205534.0,
"step": 16660
},
{
"entropy": 6.236516332626342,
"epoch": 1.923254472013849,
"grad_norm": 0.99609375,
"learning_rate": 0.00046387374073867435,
"loss": 5.7807,
"mean_token_accuracy": 0.1965228259563446,
"num_tokens": 42217825.0,
"step": 16665
},
{
"entropy": 6.307939052581787,
"epoch": 1.9238315060588573,
"grad_norm": 1.0078125,
"learning_rate": 0.00046385131227891197,
"loss": 5.7686,
"mean_token_accuracy": 0.19342057555913925,
"num_tokens": 42230162.0,
"step": 16670
},
{
"entropy": 6.219927167892456,
"epoch": 1.9244085401038662,
"grad_norm": 1.1171875,
"learning_rate": 0.0004638288774672295,
"loss": 5.7397,
"mean_token_accuracy": 0.20268993824720383,
"num_tokens": 42242458.0,
"step": 16675
},
{
"entropy": 6.157504272460938,
"epoch": 1.9249855741488748,
"grad_norm": 0.97265625,
"learning_rate": 0.0004638064363043816,
"loss": 5.7236,
"mean_token_accuracy": 0.19436694234609603,
"num_tokens": 42254389.0,
"step": 16680
},
{
"entropy": 6.249301719665527,
"epoch": 1.9255626081938835,
"grad_norm": 1.015625,
"learning_rate": 0.00046378398879112293,
"loss": 5.7496,
"mean_token_accuracy": 0.20150014460086824,
"num_tokens": 42266421.0,
"step": 16685
},
{
"entropy": 6.132052278518676,
"epoch": 1.9261396422388921,
"grad_norm": 0.95703125,
"learning_rate": 0.0004637615349282086,
"loss": 5.7148,
"mean_token_accuracy": 0.19750168770551682,
"num_tokens": 42279189.0,
"step": 16690
},
{
"entropy": 6.267314481735229,
"epoch": 1.9267166762839008,
"grad_norm": 0.96875,
"learning_rate": 0.0004637390747163938,
"loss": 5.7576,
"mean_token_accuracy": 0.19890677481889724,
"num_tokens": 42291970.0,
"step": 16695
},
{
"entropy": 6.314395475387573,
"epoch": 1.9272937103289094,
"grad_norm": 0.9375,
"learning_rate": 0.0004637166081564339,
"loss": 5.8416,
"mean_token_accuracy": 0.19406890869140625,
"num_tokens": 42305185.0,
"step": 16700
},
{
"entropy": 6.290263223648071,
"epoch": 1.927870744373918,
"grad_norm": 1.3046875,
"learning_rate": 0.00046369413524908473,
"loss": 5.7873,
"mean_token_accuracy": 0.20269953310489655,
"num_tokens": 42317823.0,
"step": 16705
},
{
"entropy": 6.241884231567383,
"epoch": 1.9284477784189267,
"grad_norm": 1.0,
"learning_rate": 0.00046367165599510207,
"loss": 5.8062,
"mean_token_accuracy": 0.1951628655195236,
"num_tokens": 42330540.0,
"step": 16710
},
{
"entropy": 6.224489212036133,
"epoch": 1.9290248124639353,
"grad_norm": 0.93359375,
"learning_rate": 0.0004636491703952419,
"loss": 5.6006,
"mean_token_accuracy": 0.20743975341320037,
"num_tokens": 42342347.0,
"step": 16715
},
{
"entropy": 6.207153224945069,
"epoch": 1.9296018465089442,
"grad_norm": 0.94921875,
"learning_rate": 0.00046362667845026057,
"loss": 5.7571,
"mean_token_accuracy": 0.20456219017505645,
"num_tokens": 42355004.0,
"step": 16720
},
{
"entropy": 6.225836229324341,
"epoch": 1.9301788805539526,
"grad_norm": 0.96484375,
"learning_rate": 0.00046360418016091467,
"loss": 5.7263,
"mean_token_accuracy": 0.19706103801727295,
"num_tokens": 42366700.0,
"step": 16725
},
{
"entropy": 6.230300235748291,
"epoch": 1.9307559145989615,
"grad_norm": 0.94921875,
"learning_rate": 0.00046358167552796085,
"loss": 5.7861,
"mean_token_accuracy": 0.19526439011096955,
"num_tokens": 42379723.0,
"step": 16730
},
{
"entropy": 6.215284585952759,
"epoch": 1.9313329486439699,
"grad_norm": 1.03125,
"learning_rate": 0.00046355916455215597,
"loss": 5.7475,
"mean_token_accuracy": 0.20507837533950807,
"num_tokens": 42393505.0,
"step": 16735
},
{
"entropy": 6.2595137596130375,
"epoch": 1.9319099826889787,
"grad_norm": 0.984375,
"learning_rate": 0.0004635366472342573,
"loss": 5.7536,
"mean_token_accuracy": 0.1928567260503769,
"num_tokens": 42406334.0,
"step": 16740
},
{
"entropy": 6.250863933563233,
"epoch": 1.9324870167339872,
"grad_norm": 0.91015625,
"learning_rate": 0.0004635141235750222,
"loss": 5.7826,
"mean_token_accuracy": 0.19470173269510269,
"num_tokens": 42418585.0,
"step": 16745
},
{
"entropy": 6.236263465881348,
"epoch": 1.933064050778996,
"grad_norm": 0.88671875,
"learning_rate": 0.00046349159357520815,
"loss": 5.6911,
"mean_token_accuracy": 0.20743900984525682,
"num_tokens": 42430741.0,
"step": 16750
},
{
"entropy": 6.18456621170044,
"epoch": 1.9336410848240047,
"grad_norm": 0.95703125,
"learning_rate": 0.000463469057235573,
"loss": 5.6973,
"mean_token_accuracy": 0.21004330068826677,
"num_tokens": 42443241.0,
"step": 16755
},
{
"entropy": 6.249989223480225,
"epoch": 1.9342181188690133,
"grad_norm": 0.92578125,
"learning_rate": 0.00046344651455687476,
"loss": 5.7941,
"mean_token_accuracy": 0.19664210975170135,
"num_tokens": 42456476.0,
"step": 16760
},
{
"entropy": 6.355844640731812,
"epoch": 1.934795152914022,
"grad_norm": 1.0859375,
"learning_rate": 0.00046342396553987155,
"loss": 5.7991,
"mean_token_accuracy": 0.19460918456315995,
"num_tokens": 42468875.0,
"step": 16765
},
{
"entropy": 6.318538808822632,
"epoch": 1.9353721869590306,
"grad_norm": 0.92578125,
"learning_rate": 0.00046340141018532186,
"loss": 5.7436,
"mean_token_accuracy": 0.19695119559764862,
"num_tokens": 42483300.0,
"step": 16770
},
{
"entropy": 6.241217947006225,
"epoch": 1.9359492210040392,
"grad_norm": 0.91015625,
"learning_rate": 0.0004633788484939843,
"loss": 5.8172,
"mean_token_accuracy": 0.19264088720083236,
"num_tokens": 42497748.0,
"step": 16775
},
{
"entropy": 6.202336645126342,
"epoch": 1.9365262550490479,
"grad_norm": 0.84375,
"learning_rate": 0.00046335628046661776,
"loss": 5.8135,
"mean_token_accuracy": 0.1930590033531189,
"num_tokens": 42510464.0,
"step": 16780
},
{
"entropy": 6.34554967880249,
"epoch": 1.9371032890940567,
"grad_norm": 0.9609375,
"learning_rate": 0.00046333370610398135,
"loss": 5.8634,
"mean_token_accuracy": 0.18837577253580093,
"num_tokens": 42522298.0,
"step": 16785
},
{
"entropy": 6.321823215484619,
"epoch": 1.9376803231390651,
"grad_norm": 0.8984375,
"learning_rate": 0.0004633111254068342,
"loss": 5.732,
"mean_token_accuracy": 0.20026923716068268,
"num_tokens": 42535094.0,
"step": 16790
},
{
"entropy": 6.171190404891968,
"epoch": 1.938257357184074,
"grad_norm": 0.921875,
"learning_rate": 0.0004632885383759359,
"loss": 5.7286,
"mean_token_accuracy": 0.20176013112068175,
"num_tokens": 42547272.0,
"step": 16795
},
{
"entropy": 6.122797870635987,
"epoch": 1.9388343912290824,
"grad_norm": 0.890625,
"learning_rate": 0.00046326594501204624,
"loss": 5.6462,
"mean_token_accuracy": 0.20535439550876616,
"num_tokens": 42559568.0,
"step": 16800
},
{
"entropy": 6.31897931098938,
"epoch": 1.9394114252740913,
"grad_norm": 0.92578125,
"learning_rate": 0.000463243345315925,
"loss": 5.7954,
"mean_token_accuracy": 0.19426541924476623,
"num_tokens": 42573177.0,
"step": 16805
},
{
"entropy": 6.238536357879639,
"epoch": 1.9399884593190997,
"grad_norm": 0.90625,
"learning_rate": 0.00046322073928833224,
"loss": 5.7324,
"mean_token_accuracy": 0.19810742139816284,
"num_tokens": 42585436.0,
"step": 16810
},
{
"entropy": 6.25981593132019,
"epoch": 1.9405654933641086,
"grad_norm": 0.890625,
"learning_rate": 0.0004631981269300285,
"loss": 5.7486,
"mean_token_accuracy": 0.19752792567014693,
"num_tokens": 42599826.0,
"step": 16815
},
{
"entropy": 6.23888201713562,
"epoch": 1.9411425274091172,
"grad_norm": 0.90625,
"learning_rate": 0.0004631755082417742,
"loss": 5.7861,
"mean_token_accuracy": 0.19362489581108094,
"num_tokens": 42613901.0,
"step": 16820
},
{
"entropy": 6.338619804382324,
"epoch": 1.9417195614541258,
"grad_norm": 0.92578125,
"learning_rate": 0.0004631528832243302,
"loss": 5.7823,
"mean_token_accuracy": 0.193868550658226,
"num_tokens": 42626592.0,
"step": 16825
},
{
"entropy": 6.2455222606658936,
"epoch": 1.9422965954991345,
"grad_norm": 0.96875,
"learning_rate": 0.00046313025187845735,
"loss": 5.7098,
"mean_token_accuracy": 0.2027307316660881,
"num_tokens": 42639754.0,
"step": 16830
},
{
"entropy": 6.237716293334961,
"epoch": 1.942873629544143,
"grad_norm": 0.97265625,
"learning_rate": 0.00046310761420491705,
"loss": 5.694,
"mean_token_accuracy": 0.2055831789970398,
"num_tokens": 42651321.0,
"step": 16835
},
{
"entropy": 6.281747102737427,
"epoch": 1.9434506635891518,
"grad_norm": 0.87109375,
"learning_rate": 0.0004630849702044705,
"loss": 5.7825,
"mean_token_accuracy": 0.1963137060403824,
"num_tokens": 42664188.0,
"step": 16840
},
{
"entropy": 6.190065813064575,
"epoch": 1.9440276976341604,
"grad_norm": 0.8984375,
"learning_rate": 0.00046306231987787937,
"loss": 5.7493,
"mean_token_accuracy": 0.1937461093068123,
"num_tokens": 42677882.0,
"step": 16845
},
{
"entropy": 6.177444744110107,
"epoch": 1.944604731679169,
"grad_norm": 1.015625,
"learning_rate": 0.00046303966322590556,
"loss": 5.6669,
"mean_token_accuracy": 0.2031422659754753,
"num_tokens": 42690595.0,
"step": 16850
},
{
"entropy": 6.147070264816284,
"epoch": 1.9451817657241777,
"grad_norm": 1.0625,
"learning_rate": 0.0004630170002493111,
"loss": 5.6277,
"mean_token_accuracy": 0.205380442738533,
"num_tokens": 42704784.0,
"step": 16855
},
{
"entropy": 6.207528877258301,
"epoch": 1.9457587997691865,
"grad_norm": 0.890625,
"learning_rate": 0.00046299433094885826,
"loss": 5.7333,
"mean_token_accuracy": 0.1969046950340271,
"num_tokens": 42717012.0,
"step": 16860
},
{
"entropy": 6.309299516677856,
"epoch": 1.946335833814195,
"grad_norm": 0.91015625,
"learning_rate": 0.00046297165532530944,
"loss": 5.7849,
"mean_token_accuracy": 0.1904382139444351,
"num_tokens": 42728879.0,
"step": 16865
},
{
"entropy": 6.261871433258056,
"epoch": 1.9469128678592038,
"grad_norm": 0.94140625,
"learning_rate": 0.0004629489733794274,
"loss": 5.793,
"mean_token_accuracy": 0.19949239790439605,
"num_tokens": 42742688.0,
"step": 16870
},
{
"entropy": 6.28302321434021,
"epoch": 1.9474899019042122,
"grad_norm": 0.96484375,
"learning_rate": 0.000462926285111975,
"loss": 5.744,
"mean_token_accuracy": 0.19738974422216415,
"num_tokens": 42754955.0,
"step": 16875
},
{
"entropy": 6.240672779083252,
"epoch": 1.948066935949221,
"grad_norm": 0.9609375,
"learning_rate": 0.00046290359052371535,
"loss": 5.8072,
"mean_token_accuracy": 0.19272707402706146,
"num_tokens": 42767760.0,
"step": 16880
},
{
"entropy": 6.249153757095337,
"epoch": 1.9486439699942295,
"grad_norm": 0.9375,
"learning_rate": 0.0004628808896154117,
"loss": 5.765,
"mean_token_accuracy": 0.1935882583260536,
"num_tokens": 42779683.0,
"step": 16885
},
{
"entropy": 6.273938417434692,
"epoch": 1.9492210040392384,
"grad_norm": 0.87109375,
"learning_rate": 0.0004628581823878277,
"loss": 5.7644,
"mean_token_accuracy": 0.1917514681816101,
"num_tokens": 42791289.0,
"step": 16890
},
{
"entropy": 6.281899070739746,
"epoch": 1.949798038084247,
"grad_norm": 1.0,
"learning_rate": 0.000462835468841727,
"loss": 5.8156,
"mean_token_accuracy": 0.19286248087882996,
"num_tokens": 42803318.0,
"step": 16895
},
{
"entropy": 6.225988864898682,
"epoch": 1.9503750721292556,
"grad_norm": 0.95703125,
"learning_rate": 0.0004628127489778737,
"loss": 5.7822,
"mean_token_accuracy": 0.19895075708627702,
"num_tokens": 42815935.0,
"step": 16900
},
{
"entropy": 6.2690986633300785,
"epoch": 1.9509521061742643,
"grad_norm": 1.0,
"learning_rate": 0.0004627900227970318,
"loss": 5.7592,
"mean_token_accuracy": 0.2022063061594963,
"num_tokens": 42827759.0,
"step": 16905
},
{
"entropy": 6.2387683391571045,
"epoch": 1.951529140219273,
"grad_norm": 0.921875,
"learning_rate": 0.00046276729029996576,
"loss": 5.7649,
"mean_token_accuracy": 0.19421954751014708,
"num_tokens": 42840479.0,
"step": 16910
},
{
"entropy": 6.255968284606934,
"epoch": 1.9521061742642816,
"grad_norm": 0.859375,
"learning_rate": 0.00046274455148744025,
"loss": 5.8335,
"mean_token_accuracy": 0.1934561923146248,
"num_tokens": 42853972.0,
"step": 16915
},
{
"entropy": 6.2588348388671875,
"epoch": 1.9526832083092902,
"grad_norm": 0.93359375,
"learning_rate": 0.00046272180636022,
"loss": 5.7313,
"mean_token_accuracy": 0.2022838994860649,
"num_tokens": 42866192.0,
"step": 16920
},
{
"entropy": 6.218838548660278,
"epoch": 1.953260242354299,
"grad_norm": 0.98046875,
"learning_rate": 0.00046269905491907,
"loss": 5.7531,
"mean_token_accuracy": 0.20053910315036774,
"num_tokens": 42878661.0,
"step": 16925
},
{
"entropy": 6.17126088142395,
"epoch": 1.9538372763993075,
"grad_norm": 0.921875,
"learning_rate": 0.0004626762971647555,
"loss": 5.7495,
"mean_token_accuracy": 0.1976466402411461,
"num_tokens": 42891498.0,
"step": 16930
},
{
"entropy": 6.24580078125,
"epoch": 1.9544143104443163,
"grad_norm": 0.94140625,
"learning_rate": 0.00046265353309804205,
"loss": 5.6829,
"mean_token_accuracy": 0.20284637361764907,
"num_tokens": 42904657.0,
"step": 16935
},
{
"entropy": 6.273250246047974,
"epoch": 1.9549913444893248,
"grad_norm": 0.921875,
"learning_rate": 0.0004626307627196952,
"loss": 5.7381,
"mean_token_accuracy": 0.20008694678544997,
"num_tokens": 42916824.0,
"step": 16940
},
{
"entropy": 6.279068374633789,
"epoch": 1.9555683785343336,
"grad_norm": 0.8828125,
"learning_rate": 0.0004626079860304808,
"loss": 5.8076,
"mean_token_accuracy": 0.20154052823781968,
"num_tokens": 42929366.0,
"step": 16945
},
{
"entropy": 6.146010112762451,
"epoch": 1.956145412579342,
"grad_norm": 0.8828125,
"learning_rate": 0.00046258520303116496,
"loss": 5.649,
"mean_token_accuracy": 0.20451925396919252,
"num_tokens": 42941955.0,
"step": 16950
},
{
"entropy": 6.277160882949829,
"epoch": 1.956722446624351,
"grad_norm": 0.97265625,
"learning_rate": 0.0004625624137225141,
"loss": 5.8494,
"mean_token_accuracy": 0.18529517501592635,
"num_tokens": 42954302.0,
"step": 16955
},
{
"entropy": 6.32279372215271,
"epoch": 1.9572994806693593,
"grad_norm": 0.93359375,
"learning_rate": 0.0004625396181052945,
"loss": 5.7328,
"mean_token_accuracy": 0.19855155050754547,
"num_tokens": 42967225.0,
"step": 16960
},
{
"entropy": 6.244097757339477,
"epoch": 1.9578765147143682,
"grad_norm": 0.9375,
"learning_rate": 0.00046251681618027316,
"loss": 5.7671,
"mean_token_accuracy": 0.2019764319062233,
"num_tokens": 42981388.0,
"step": 16965
},
{
"entropy": 6.2767432689666744,
"epoch": 1.9584535487593768,
"grad_norm": 0.97265625,
"learning_rate": 0.0004624940079482167,
"loss": 5.7902,
"mean_token_accuracy": 0.1942693993449211,
"num_tokens": 42993110.0,
"step": 16970
},
{
"entropy": 6.224786043167114,
"epoch": 1.9590305828043855,
"grad_norm": 0.94921875,
"learning_rate": 0.00046247119340989254,
"loss": 5.7964,
"mean_token_accuracy": 0.18906237035989762,
"num_tokens": 43007309.0,
"step": 16975
},
{
"entropy": 6.243825435638428,
"epoch": 1.959607616849394,
"grad_norm": 0.984375,
"learning_rate": 0.0004624483725660678,
"loss": 5.6601,
"mean_token_accuracy": 0.21698321104049684,
"num_tokens": 43020813.0,
"step": 16980
},
{
"entropy": 6.279694986343384,
"epoch": 1.9601846508944027,
"grad_norm": 0.91015625,
"learning_rate": 0.0004624255454175102,
"loss": 5.7775,
"mean_token_accuracy": 0.19770735502243042,
"num_tokens": 43033357.0,
"step": 16985
},
{
"entropy": 6.240402030944824,
"epoch": 1.9607616849394114,
"grad_norm": 0.953125,
"learning_rate": 0.0004624027119649875,
"loss": 5.8401,
"mean_token_accuracy": 0.19352957457304001,
"num_tokens": 43046685.0,
"step": 16990
},
{
"entropy": 6.277683067321777,
"epoch": 1.96133871898442,
"grad_norm": 0.90625,
"learning_rate": 0.00046237987220926766,
"loss": 5.8113,
"mean_token_accuracy": 0.19058777391910553,
"num_tokens": 43059670.0,
"step": 16995
},
{
"entropy": 6.229287195205688,
"epoch": 1.9619157530294289,
"grad_norm": 0.92578125,
"learning_rate": 0.00046235702615111886,
"loss": 5.6756,
"mean_token_accuracy": 0.20468678921461106,
"num_tokens": 43073515.0,
"step": 17000
},
{
"entropy": 6.26941409111023,
"epoch": 1.9624927870744373,
"grad_norm": 0.8671875,
"learning_rate": 0.0004623341737913096,
"loss": 5.7838,
"mean_token_accuracy": 0.19650481641292572,
"num_tokens": 43086046.0,
"step": 17005
},
{
"entropy": 6.222126197814942,
"epoch": 1.9630698211194462,
"grad_norm": 0.8671875,
"learning_rate": 0.0004623113151306085,
"loss": 5.6846,
"mean_token_accuracy": 0.19888866394758226,
"num_tokens": 43097703.0,
"step": 17010
},
{
"entropy": 6.213971853256226,
"epoch": 1.9636468551644546,
"grad_norm": 0.984375,
"learning_rate": 0.00046228845016978425,
"loss": 5.7542,
"mean_token_accuracy": 0.19422128796577454,
"num_tokens": 43110378.0,
"step": 17015
},
{
"entropy": 6.270879411697388,
"epoch": 1.9642238892094634,
"grad_norm": 0.95703125,
"learning_rate": 0.0004622655789096061,
"loss": 5.7468,
"mean_token_accuracy": 0.19963121861219407,
"num_tokens": 43122978.0,
"step": 17020
},
{
"entropy": 6.333521223068237,
"epoch": 1.9648009232544719,
"grad_norm": 0.96875,
"learning_rate": 0.00046224270135084315,
"loss": 5.8301,
"mean_token_accuracy": 0.19587821811437606,
"num_tokens": 43135371.0,
"step": 17025
},
{
"entropy": 6.176549243927002,
"epoch": 1.9653779572994807,
"grad_norm": 0.9296875,
"learning_rate": 0.00046221981749426503,
"loss": 5.7494,
"mean_token_accuracy": 0.195055790245533,
"num_tokens": 43147251.0,
"step": 17030
},
{
"entropy": 6.231923294067383,
"epoch": 1.9659549913444894,
"grad_norm": 0.9140625,
"learning_rate": 0.00046219692734064124,
"loss": 5.728,
"mean_token_accuracy": 0.19381537437438964,
"num_tokens": 43160276.0,
"step": 17035
},
{
"entropy": 6.3147297382354735,
"epoch": 1.966532025389498,
"grad_norm": 0.98046875,
"learning_rate": 0.0004621740308907419,
"loss": 5.7714,
"mean_token_accuracy": 0.19927388578653335,
"num_tokens": 43172443.0,
"step": 17040
},
{
"entropy": 6.29047212600708,
"epoch": 1.9671090594345066,
"grad_norm": 0.88671875,
"learning_rate": 0.0004621511281453369,
"loss": 5.8044,
"mean_token_accuracy": 0.19463059306144714,
"num_tokens": 43186350.0,
"step": 17045
},
{
"entropy": 6.209466171264649,
"epoch": 1.9676860934795153,
"grad_norm": 0.890625,
"learning_rate": 0.0004621282191051967,
"loss": 5.7387,
"mean_token_accuracy": 0.2009575068950653,
"num_tokens": 43198936.0,
"step": 17050
},
{
"entropy": 6.32681713104248,
"epoch": 1.968263127524524,
"grad_norm": 0.98046875,
"learning_rate": 0.0004621053037710918,
"loss": 5.7827,
"mean_token_accuracy": 0.19598435312509538,
"num_tokens": 43211793.0,
"step": 17055
},
{
"entropy": 6.263002681732178,
"epoch": 1.9688401615695326,
"grad_norm": 0.8984375,
"learning_rate": 0.000462082382143793,
"loss": 5.7579,
"mean_token_accuracy": 0.19923101365566254,
"num_tokens": 43223817.0,
"step": 17060
},
{
"entropy": 6.261463308334351,
"epoch": 1.9694171956145412,
"grad_norm": 0.953125,
"learning_rate": 0.00046205945422407113,
"loss": 5.7671,
"mean_token_accuracy": 0.1999775692820549,
"num_tokens": 43235769.0,
"step": 17065
},
{
"entropy": 6.275276851654053,
"epoch": 1.9699942296595498,
"grad_norm": 0.99609375,
"learning_rate": 0.00046203652001269754,
"loss": 5.7892,
"mean_token_accuracy": 0.19710277765989304,
"num_tokens": 43249309.0,
"step": 17070
},
{
"entropy": 6.237096548080444,
"epoch": 1.9705712637045587,
"grad_norm": 0.98046875,
"learning_rate": 0.00046201357951044337,
"loss": 5.7608,
"mean_token_accuracy": 0.19623759686946868,
"num_tokens": 43262814.0,
"step": 17075
},
{
"entropy": 6.283816623687744,
"epoch": 1.9711482977495671,
"grad_norm": 0.98828125,
"learning_rate": 0.00046199063271808047,
"loss": 5.8196,
"mean_token_accuracy": 0.19353357702493668,
"num_tokens": 43276898.0,
"step": 17080
},
{
"entropy": 6.243425130844116,
"epoch": 1.971725331794576,
"grad_norm": 0.9296875,
"learning_rate": 0.0004619676796363804,
"loss": 5.7573,
"mean_token_accuracy": 0.2017611876130104,
"num_tokens": 43288902.0,
"step": 17085
},
{
"entropy": 6.289148283004761,
"epoch": 1.9723023658395844,
"grad_norm": 0.99609375,
"learning_rate": 0.00046194472026611546,
"loss": 5.7532,
"mean_token_accuracy": 0.1987377718091011,
"num_tokens": 43301644.0,
"step": 17090
},
{
"entropy": 6.246998453140259,
"epoch": 1.9728793998845933,
"grad_norm": 0.98046875,
"learning_rate": 0.0004619217546080576,
"loss": 5.7426,
"mean_token_accuracy": 0.19673261046409607,
"num_tokens": 43315550.0,
"step": 17095
},
{
"entropy": 6.379453182220459,
"epoch": 1.9734564339296017,
"grad_norm": 0.90234375,
"learning_rate": 0.0004618987826629794,
"loss": 5.855,
"mean_token_accuracy": 0.18522174060344695,
"num_tokens": 43328095.0,
"step": 17100
},
{
"entropy": 6.251423120498657,
"epoch": 1.9740334679746105,
"grad_norm": 0.8828125,
"learning_rate": 0.00046187580443165344,
"loss": 5.7599,
"mean_token_accuracy": 0.20047521889209746,
"num_tokens": 43340461.0,
"step": 17105
},
{
"entropy": 6.297940587997436,
"epoch": 1.9746105020196192,
"grad_norm": 0.90234375,
"learning_rate": 0.0004618528199148527,
"loss": 5.7534,
"mean_token_accuracy": 0.2036628544330597,
"num_tokens": 43352322.0,
"step": 17110
},
{
"entropy": 6.291927099227905,
"epoch": 1.9751875360646278,
"grad_norm": 1.609375,
"learning_rate": 0.00046182982911335016,
"loss": 5.7743,
"mean_token_accuracy": 0.19787712693214415,
"num_tokens": 43366212.0,
"step": 17115
},
{
"entropy": 6.322417783737182,
"epoch": 1.9757645701096365,
"grad_norm": 0.92578125,
"learning_rate": 0.00046180683202791905,
"loss": 5.8686,
"mean_token_accuracy": 0.19052491784095765,
"num_tokens": 43379123.0,
"step": 17120
},
{
"entropy": 6.338251638412475,
"epoch": 1.976341604154645,
"grad_norm": 0.83203125,
"learning_rate": 0.000461783828659333,
"loss": 5.8762,
"mean_token_accuracy": 0.18852563202381134,
"num_tokens": 43393188.0,
"step": 17125
},
{
"entropy": 6.377630805969238,
"epoch": 1.9769186381996537,
"grad_norm": 0.9453125,
"learning_rate": 0.00046176081900836565,
"loss": 5.7829,
"mean_token_accuracy": 0.19455361515283584,
"num_tokens": 43407448.0,
"step": 17130
},
{
"entropy": 6.2423668384552,
"epoch": 1.9774956722446624,
"grad_norm": 0.9375,
"learning_rate": 0.00046173780307579086,
"loss": 5.7254,
"mean_token_accuracy": 0.19675862044095993,
"num_tokens": 43420202.0,
"step": 17135
},
{
"entropy": 6.218957424163818,
"epoch": 1.9780727062896712,
"grad_norm": 1.140625,
"learning_rate": 0.0004617147808623829,
"loss": 5.7939,
"mean_token_accuracy": 0.18706247061491013,
"num_tokens": 43433218.0,
"step": 17140
},
{
"entropy": 6.2471057891845705,
"epoch": 1.9786497403346797,
"grad_norm": 0.96484375,
"learning_rate": 0.00046169175236891605,
"loss": 5.7828,
"mean_token_accuracy": 0.19302263110876083,
"num_tokens": 43445721.0,
"step": 17145
},
{
"entropy": 6.32406005859375,
"epoch": 1.9792267743796885,
"grad_norm": 0.91015625,
"learning_rate": 0.0004616687175961648,
"loss": 5.7908,
"mean_token_accuracy": 0.19397074580192566,
"num_tokens": 43457470.0,
"step": 17150
},
{
"entropy": 6.276082611083984,
"epoch": 1.979803808424697,
"grad_norm": 0.89453125,
"learning_rate": 0.0004616456765449039,
"loss": 5.7838,
"mean_token_accuracy": 0.20368654876947404,
"num_tokens": 43470693.0,
"step": 17155
},
{
"entropy": 6.248766613006592,
"epoch": 1.9803808424697058,
"grad_norm": 0.99609375,
"learning_rate": 0.00046162262921590845,
"loss": 5.8039,
"mean_token_accuracy": 0.19646263122558594,
"num_tokens": 43482890.0,
"step": 17160
},
{
"entropy": 6.372063541412354,
"epoch": 1.9809578765147142,
"grad_norm": 0.8828125,
"learning_rate": 0.0004615995756099535,
"loss": 5.8375,
"mean_token_accuracy": 0.18987953066825866,
"num_tokens": 43495444.0,
"step": 17165
},
{
"entropy": 6.262853002548217,
"epoch": 1.981534910559723,
"grad_norm": 0.8984375,
"learning_rate": 0.0004615765157278146,
"loss": 5.7935,
"mean_token_accuracy": 0.19052637368440628,
"num_tokens": 43507415.0,
"step": 17170
},
{
"entropy": 6.274124622344971,
"epoch": 1.9821119446047317,
"grad_norm": 0.9375,
"learning_rate": 0.00046155344957026726,
"loss": 5.813,
"mean_token_accuracy": 0.19190335720777513,
"num_tokens": 43520832.0,
"step": 17175
},
{
"entropy": 6.275217294692993,
"epoch": 1.9826889786497404,
"grad_norm": 0.89453125,
"learning_rate": 0.0004615303771380873,
"loss": 5.7534,
"mean_token_accuracy": 0.1979634016752243,
"num_tokens": 43534459.0,
"step": 17180
},
{
"entropy": 6.1655778884887695,
"epoch": 1.983266012694749,
"grad_norm": 1.0234375,
"learning_rate": 0.00046150729843205077,
"loss": 5.5974,
"mean_token_accuracy": 0.20756071358919143,
"num_tokens": 43546466.0,
"step": 17185
},
{
"entropy": 6.217870903015137,
"epoch": 1.9838430467397576,
"grad_norm": 0.953125,
"learning_rate": 0.00046148421345293384,
"loss": 5.6775,
"mean_token_accuracy": 0.2055698052048683,
"num_tokens": 43558285.0,
"step": 17190
},
{
"entropy": 6.171381568908691,
"epoch": 1.9844200807847663,
"grad_norm": 0.87890625,
"learning_rate": 0.0004614611222015131,
"loss": 5.6587,
"mean_token_accuracy": 0.20381601601839067,
"num_tokens": 43572117.0,
"step": 17195
},
{
"entropy": 6.258411312103272,
"epoch": 1.984997114829775,
"grad_norm": 1.96875,
"learning_rate": 0.00046143802467856507,
"loss": 5.8139,
"mean_token_accuracy": 0.1962540939450264,
"num_tokens": 43586951.0,
"step": 17200
},
{
"entropy": 6.271241092681885,
"epoch": 1.9855741488747836,
"grad_norm": 0.91015625,
"learning_rate": 0.00046141492088486673,
"loss": 5.6846,
"mean_token_accuracy": 0.2100219815969467,
"num_tokens": 43600542.0,
"step": 17205
},
{
"entropy": 6.2649232864379885,
"epoch": 1.9861511829197922,
"grad_norm": 0.93359375,
"learning_rate": 0.0004613918108211951,
"loss": 5.78,
"mean_token_accuracy": 0.19840521961450577,
"num_tokens": 43612928.0,
"step": 17210
},
{
"entropy": 6.304554271697998,
"epoch": 1.986728216964801,
"grad_norm": 0.87109375,
"learning_rate": 0.0004613686944883275,
"loss": 5.7714,
"mean_token_accuracy": 0.1991189256310463,
"num_tokens": 43625362.0,
"step": 17215
},
{
"entropy": 6.205133724212646,
"epoch": 1.9873052510098095,
"grad_norm": 0.8359375,
"learning_rate": 0.00046134557188704146,
"loss": 5.7749,
"mean_token_accuracy": 0.20026649087667464,
"num_tokens": 43638165.0,
"step": 17220
},
{
"entropy": 6.192930030822754,
"epoch": 1.9878822850548183,
"grad_norm": 0.94140625,
"learning_rate": 0.00046132244301811466,
"loss": 5.7093,
"mean_token_accuracy": 0.19966957122087478,
"num_tokens": 43650688.0,
"step": 17225
},
{
"entropy": 6.329173803329468,
"epoch": 1.9884593190998268,
"grad_norm": 0.953125,
"learning_rate": 0.00046129930788232497,
"loss": 5.8168,
"mean_token_accuracy": 0.19335910826921462,
"num_tokens": 43663168.0,
"step": 17230
},
{
"entropy": 6.296715450286865,
"epoch": 1.9890363531448356,
"grad_norm": 0.90234375,
"learning_rate": 0.00046127616648045073,
"loss": 5.7725,
"mean_token_accuracy": 0.1897001937031746,
"num_tokens": 43676391.0,
"step": 17235
},
{
"entropy": 6.32203950881958,
"epoch": 1.989613387189844,
"grad_norm": 0.8984375,
"learning_rate": 0.00046125301881327007,
"loss": 5.7157,
"mean_token_accuracy": 0.20050082802772523,
"num_tokens": 43689631.0,
"step": 17240
},
{
"entropy": 6.231979131698608,
"epoch": 1.990190421234853,
"grad_norm": 1.1875,
"learning_rate": 0.00046122986488156167,
"loss": 5.7623,
"mean_token_accuracy": 0.1993554025888443,
"num_tokens": 43703176.0,
"step": 17245
},
{
"entropy": 6.319428777694702,
"epoch": 1.9907674552798615,
"grad_norm": 0.8828125,
"learning_rate": 0.00046120670468610426,
"loss": 5.8701,
"mean_token_accuracy": 0.188443386554718,
"num_tokens": 43717439.0,
"step": 17250
},
{
"entropy": 6.282275867462158,
"epoch": 1.9913444893248702,
"grad_norm": 0.93359375,
"learning_rate": 0.00046118353822767683,
"loss": 5.7261,
"mean_token_accuracy": 0.1940552920103073,
"num_tokens": 43730500.0,
"step": 17255
},
{
"entropy": 6.191128492355347,
"epoch": 1.9919215233698788,
"grad_norm": 0.9140625,
"learning_rate": 0.0004611603655070586,
"loss": 5.6687,
"mean_token_accuracy": 0.20141230076551436,
"num_tokens": 43744807.0,
"step": 17260
},
{
"entropy": 6.251776790618896,
"epoch": 1.9924985574148875,
"grad_norm": 0.96484375,
"learning_rate": 0.00046113718652502896,
"loss": 5.7171,
"mean_token_accuracy": 0.20194613486528395,
"num_tokens": 43756748.0,
"step": 17265
},
{
"entropy": 6.261544942855835,
"epoch": 1.993075591459896,
"grad_norm": 0.890625,
"learning_rate": 0.0004611140012823675,
"loss": 5.8213,
"mean_token_accuracy": 0.1938079223036766,
"num_tokens": 43769309.0,
"step": 17270
},
{
"entropy": 6.259779262542724,
"epoch": 1.9936526255049047,
"grad_norm": 0.91015625,
"learning_rate": 0.00046109080977985395,
"loss": 5.7859,
"mean_token_accuracy": 0.19742500483989717,
"num_tokens": 43781057.0,
"step": 17275
},
{
"entropy": 6.273036813735962,
"epoch": 1.9942296595499136,
"grad_norm": 0.84765625,
"learning_rate": 0.00046106761201826854,
"loss": 5.7762,
"mean_token_accuracy": 0.1962513282895088,
"num_tokens": 43794504.0,
"step": 17280
},
{
"entropy": 6.09191312789917,
"epoch": 1.994806693594922,
"grad_norm": 1.046875,
"learning_rate": 0.00046104440799839145,
"loss": 5.5921,
"mean_token_accuracy": 0.21330432295799256,
"num_tokens": 43810214.0,
"step": 17285
},
{
"entropy": 6.263599395751953,
"epoch": 1.9953837276399309,
"grad_norm": 1.0703125,
"learning_rate": 0.000461021197721003,
"loss": 5.7689,
"mean_token_accuracy": 0.19516006261110305,
"num_tokens": 43822197.0,
"step": 17290
},
{
"entropy": 6.319225835800171,
"epoch": 1.9959607616849393,
"grad_norm": 0.875,
"learning_rate": 0.00046099798118688407,
"loss": 5.7714,
"mean_token_accuracy": 0.1970426231622696,
"num_tokens": 43835585.0,
"step": 17295
},
{
"entropy": 6.279296588897705,
"epoch": 1.9965377957299482,
"grad_norm": 0.91796875,
"learning_rate": 0.0004609747583968154,
"loss": 5.7179,
"mean_token_accuracy": 0.19605442583560945,
"num_tokens": 43848542.0,
"step": 17300
},
{
"entropy": 6.251367807388306,
"epoch": 1.9971148297749566,
"grad_norm": 0.95703125,
"learning_rate": 0.0004609515293515781,
"loss": 5.7954,
"mean_token_accuracy": 0.19522191137075423,
"num_tokens": 43860717.0,
"step": 17305
},
{
"entropy": 6.326177597045898,
"epoch": 1.9976918638199654,
"grad_norm": 0.890625,
"learning_rate": 0.0004609282940519535,
"loss": 5.8277,
"mean_token_accuracy": 0.19656899571418762,
"num_tokens": 43873193.0,
"step": 17310
},
{
"entropy": 6.328842449188232,
"epoch": 1.998268897864974,
"grad_norm": 0.94140625,
"learning_rate": 0.0004609050524987231,
"loss": 5.8062,
"mean_token_accuracy": 0.1906093955039978,
"num_tokens": 43886241.0,
"step": 17315
},
{
"entropy": 6.262535762786865,
"epoch": 1.9988459319099827,
"grad_norm": 0.98828125,
"learning_rate": 0.0004608818046926686,
"loss": 5.7307,
"mean_token_accuracy": 0.2026408925652504,
"num_tokens": 43899429.0,
"step": 17320
},
{
"entropy": 6.2589469909667965,
"epoch": 1.9994229659549914,
"grad_norm": 0.91796875,
"learning_rate": 0.0004608585506345719,
"loss": 5.7517,
"mean_token_accuracy": 0.19680778086185455,
"num_tokens": 43913073.0,
"step": 17325
},
{
"entropy": 6.259429550170898,
"epoch": 2.0,
"grad_norm": 0.9140625,
"learning_rate": 0.0004608352903252152,
"loss": 5.7745,
"mean_token_accuracy": 0.19805550575256348,
"num_tokens": 43926234.0,
"step": 17330
},
{
"entropy": 6.2702301979064945,
"epoch": 2.000577034045009,
"grad_norm": 0.9453125,
"learning_rate": 0.00046081202376538084,
"loss": 5.7334,
"mean_token_accuracy": 0.19711553305387497,
"num_tokens": 43937787.0,
"step": 17335
},
{
"entropy": 6.249440240859985,
"epoch": 2.0011540680900173,
"grad_norm": 0.93359375,
"learning_rate": 0.0004607887509558513,
"loss": 5.7267,
"mean_token_accuracy": 0.19739107191562652,
"num_tokens": 43951429.0,
"step": 17340
},
{
"entropy": 6.297765922546387,
"epoch": 2.001731102135026,
"grad_norm": 0.9765625,
"learning_rate": 0.0004607654718974094,
"loss": 5.7265,
"mean_token_accuracy": 0.20845312774181365,
"num_tokens": 43964257.0,
"step": 17345
},
{
"entropy": 6.3072456359863285,
"epoch": 2.0023081361800346,
"grad_norm": 0.96484375,
"learning_rate": 0.0004607421865908382,
"loss": 5.6704,
"mean_token_accuracy": 0.1962365910410881,
"num_tokens": 43975995.0,
"step": 17350
},
{
"entropy": 6.21532130241394,
"epoch": 2.0028851702250434,
"grad_norm": 0.92578125,
"learning_rate": 0.0004607188950369207,
"loss": 5.6302,
"mean_token_accuracy": 0.2015035480260849,
"num_tokens": 43989191.0,
"step": 17355
},
{
"entropy": 6.310169506072998,
"epoch": 2.003462204270052,
"grad_norm": 0.98828125,
"learning_rate": 0.0004606955972364405,
"loss": 5.741,
"mean_token_accuracy": 0.1927739202976227,
"num_tokens": 44000583.0,
"step": 17360
},
{
"entropy": 6.1655200004577635,
"epoch": 2.0040392383150607,
"grad_norm": 0.9140625,
"learning_rate": 0.0004606722931901812,
"loss": 5.5746,
"mean_token_accuracy": 0.213130159676075,
"num_tokens": 44013894.0,
"step": 17365
},
{
"entropy": 6.234589576721191,
"epoch": 2.004616272360069,
"grad_norm": 0.90625,
"learning_rate": 0.0004606489828989264,
"loss": 5.6487,
"mean_token_accuracy": 0.20046643614768983,
"num_tokens": 44026701.0,
"step": 17370
},
{
"entropy": 6.233416175842285,
"epoch": 2.005193306405078,
"grad_norm": 2.890625,
"learning_rate": 0.0004606256663634604,
"loss": 5.7082,
"mean_token_accuracy": 0.2018497332930565,
"num_tokens": 44039775.0,
"step": 17375
},
{
"entropy": 6.285129690170288,
"epoch": 2.0057703404500864,
"grad_norm": 0.87890625,
"learning_rate": 0.0004606023435845672,
"loss": 5.7138,
"mean_token_accuracy": 0.19541945606470107,
"num_tokens": 44052352.0,
"step": 17380
},
{
"entropy": 6.250522422790527,
"epoch": 2.0063473744950953,
"grad_norm": 1.0,
"learning_rate": 0.0004605790145630314,
"loss": 5.6477,
"mean_token_accuracy": 0.20282730013132094,
"num_tokens": 44066147.0,
"step": 17385
},
{
"entropy": 6.255536270141602,
"epoch": 2.0069244085401037,
"grad_norm": 0.96484375,
"learning_rate": 0.0004605556792996377,
"loss": 5.6965,
"mean_token_accuracy": 0.19819739013910292,
"num_tokens": 44078692.0,
"step": 17390
},
{
"entropy": 6.340232467651367,
"epoch": 2.0075014425851125,
"grad_norm": 0.9453125,
"learning_rate": 0.0004605323377951709,
"loss": 5.7362,
"mean_token_accuracy": 0.19044993668794633,
"num_tokens": 44091511.0,
"step": 17395
},
{
"entropy": 6.270852994918823,
"epoch": 2.008078476630121,
"grad_norm": 0.90625,
"learning_rate": 0.000460508990050416,
"loss": 5.6915,
"mean_token_accuracy": 0.195805923640728,
"num_tokens": 44103423.0,
"step": 17400
},
{
"entropy": 6.149043035507202,
"epoch": 2.00865551067513,
"grad_norm": 0.91796875,
"learning_rate": 0.0004604856360661584,
"loss": 5.5513,
"mean_token_accuracy": 0.2083790898323059,
"num_tokens": 44116024.0,
"step": 17405
},
{
"entropy": 6.153539705276489,
"epoch": 2.0092325447201387,
"grad_norm": 0.875,
"learning_rate": 0.0004604622758431835,
"loss": 5.624,
"mean_token_accuracy": 0.20394142121076583,
"num_tokens": 44128595.0,
"step": 17410
},
{
"entropy": 6.3305881977081295,
"epoch": 2.009809578765147,
"grad_norm": 1.03125,
"learning_rate": 0.00046043890938227724,
"loss": 5.7351,
"mean_token_accuracy": 0.19998015761375426,
"num_tokens": 44140104.0,
"step": 17415
},
{
"entropy": 6.2825438499450685,
"epoch": 2.010386612810156,
"grad_norm": 1.0078125,
"learning_rate": 0.00046041553668422526,
"loss": 5.6918,
"mean_token_accuracy": 0.2034749060869217,
"num_tokens": 44152681.0,
"step": 17420
},
{
"entropy": 6.181905794143677,
"epoch": 2.0109636468551644,
"grad_norm": 0.91015625,
"learning_rate": 0.00046039215774981376,
"loss": 5.665,
"mean_token_accuracy": 0.2073669031262398,
"num_tokens": 44165728.0,
"step": 17425
},
{
"entropy": 6.301576805114746,
"epoch": 2.0115406809001732,
"grad_norm": 0.953125,
"learning_rate": 0.00046036877257982917,
"loss": 5.7453,
"mean_token_accuracy": 0.19096045196056366,
"num_tokens": 44178182.0,
"step": 17430
},
{
"entropy": 6.300556945800781,
"epoch": 2.0121177149451817,
"grad_norm": 0.94921875,
"learning_rate": 0.000460345381175058,
"loss": 5.6624,
"mean_token_accuracy": 0.20269179046154023,
"num_tokens": 44190954.0,
"step": 17435
},
{
"entropy": 6.262827301025391,
"epoch": 2.0126947489901905,
"grad_norm": 0.8828125,
"learning_rate": 0.000460321983536287,
"loss": 5.6572,
"mean_token_accuracy": 0.20790137648582457,
"num_tokens": 44204123.0,
"step": 17440
},
{
"entropy": 6.1826049327850345,
"epoch": 2.013271783035199,
"grad_norm": 1.21875,
"learning_rate": 0.00046029857966430315,
"loss": 5.6442,
"mean_token_accuracy": 0.2049027442932129,
"num_tokens": 44218656.0,
"step": 17445
},
{
"entropy": 6.227021884918213,
"epoch": 2.013848817080208,
"grad_norm": 0.984375,
"learning_rate": 0.00046027516955989364,
"loss": 5.6779,
"mean_token_accuracy": 0.20515901893377303,
"num_tokens": 44231191.0,
"step": 17450
},
{
"entropy": 6.304461097717285,
"epoch": 2.014425851125216,
"grad_norm": 0.90625,
"learning_rate": 0.00046025175322384577,
"loss": 5.695,
"mean_token_accuracy": 0.2019312486052513,
"num_tokens": 44244564.0,
"step": 17455
},
{
"entropy": 6.298606538772583,
"epoch": 2.015002885170225,
"grad_norm": 0.99609375,
"learning_rate": 0.00046022833065694727,
"loss": 5.7057,
"mean_token_accuracy": 0.20222496688365937,
"num_tokens": 44257545.0,
"step": 17460
},
{
"entropy": 6.224299478530884,
"epoch": 2.0155799192152335,
"grad_norm": 0.91015625,
"learning_rate": 0.00046020490185998575,
"loss": 5.6246,
"mean_token_accuracy": 0.20759887993335724,
"num_tokens": 44270416.0,
"step": 17465
},
{
"entropy": 6.2018883228302,
"epoch": 2.0161569532602424,
"grad_norm": 0.92578125,
"learning_rate": 0.0004601814668337495,
"loss": 5.6589,
"mean_token_accuracy": 0.20551549792289733,
"num_tokens": 44283366.0,
"step": 17470
},
{
"entropy": 6.226172876358032,
"epoch": 2.016733987305251,
"grad_norm": 0.921875,
"learning_rate": 0.00046015802557902654,
"loss": 5.7103,
"mean_token_accuracy": 0.19451249092817308,
"num_tokens": 44296079.0,
"step": 17475
},
{
"entropy": 6.285435914993286,
"epoch": 2.0173110213502596,
"grad_norm": 0.87890625,
"learning_rate": 0.00046013457809660537,
"loss": 5.6955,
"mean_token_accuracy": 0.1941556990146637,
"num_tokens": 44308409.0,
"step": 17480
},
{
"entropy": 6.292135524749756,
"epoch": 2.0178880553952685,
"grad_norm": 0.875,
"learning_rate": 0.00046011112438727454,
"loss": 5.7379,
"mean_token_accuracy": 0.19877717196941375,
"num_tokens": 44321826.0,
"step": 17485
},
{
"entropy": 6.256671524047851,
"epoch": 2.018465089440277,
"grad_norm": 0.9765625,
"learning_rate": 0.0004600876644518231,
"loss": 5.7023,
"mean_token_accuracy": 0.198341403901577,
"num_tokens": 44335630.0,
"step": 17490
},
{
"entropy": 6.040377807617188,
"epoch": 2.0190421234852858,
"grad_norm": 0.97265625,
"learning_rate": 0.00046006419829104,
"loss": 5.4867,
"mean_token_accuracy": 0.2133197918534279,
"num_tokens": 44349059.0,
"step": 17495
},
{
"entropy": 6.241903305053711,
"epoch": 2.019619157530294,
"grad_norm": 0.95703125,
"learning_rate": 0.0004600407259057145,
"loss": 5.5888,
"mean_token_accuracy": 0.2037927582859993,
"num_tokens": 44361908.0,
"step": 17500
},
{
"entropy": 6.257413721084594,
"epoch": 2.020196191575303,
"grad_norm": 0.87890625,
"learning_rate": 0.0004600172472966361,
"loss": 5.7417,
"mean_token_accuracy": 0.18895848095417023,
"num_tokens": 44375487.0,
"step": 17505
},
{
"entropy": 6.220084714889526,
"epoch": 2.0207732256203115,
"grad_norm": 1.0,
"learning_rate": 0.00045999376246459446,
"loss": 5.642,
"mean_token_accuracy": 0.20260559767484665,
"num_tokens": 44387881.0,
"step": 17510
},
{
"entropy": 6.247606992721558,
"epoch": 2.0213502596653203,
"grad_norm": 0.9375,
"learning_rate": 0.0004599702714103795,
"loss": 5.6491,
"mean_token_accuracy": 0.1996355265378952,
"num_tokens": 44400609.0,
"step": 17515
},
{
"entropy": 6.159318733215332,
"epoch": 2.0219272937103288,
"grad_norm": 0.99609375,
"learning_rate": 0.0004599467741347814,
"loss": 5.599,
"mean_token_accuracy": 0.2111167222261429,
"num_tokens": 44413341.0,
"step": 17520
},
{
"entropy": 6.272531366348266,
"epoch": 2.0225043277553376,
"grad_norm": 0.921875,
"learning_rate": 0.0004599232706385904,
"loss": 5.7392,
"mean_token_accuracy": 0.20063333660364152,
"num_tokens": 44425790.0,
"step": 17525
},
{
"entropy": 6.1971056938171385,
"epoch": 2.023081361800346,
"grad_norm": 0.9140625,
"learning_rate": 0.000459899760922597,
"loss": 5.6528,
"mean_token_accuracy": 0.20446180999279023,
"num_tokens": 44438204.0,
"step": 17530
},
{
"entropy": 6.2362587451934814,
"epoch": 2.023658395845355,
"grad_norm": 0.9140625,
"learning_rate": 0.0004598762449875921,
"loss": 5.6295,
"mean_token_accuracy": 0.2001257747411728,
"num_tokens": 44450717.0,
"step": 17535
},
{
"entropy": 6.257264757156372,
"epoch": 2.0242354298903633,
"grad_norm": 0.9140625,
"learning_rate": 0.0004598527228343665,
"loss": 5.6385,
"mean_token_accuracy": 0.20419044196605682,
"num_tokens": 44463391.0,
"step": 17540
},
{
"entropy": 6.196162414550781,
"epoch": 2.024812463935372,
"grad_norm": 0.9296875,
"learning_rate": 0.0004598291944637112,
"loss": 5.6029,
"mean_token_accuracy": 0.2064843252301216,
"num_tokens": 44477022.0,
"step": 17545
},
{
"entropy": 6.270995855331421,
"epoch": 2.025389497980381,
"grad_norm": 0.8359375,
"learning_rate": 0.00045980565987641797,
"loss": 5.7092,
"mean_token_accuracy": 0.19913180619478227,
"num_tokens": 44490616.0,
"step": 17550
},
{
"entropy": 6.2656354904174805,
"epoch": 2.0259665320253895,
"grad_norm": 0.93359375,
"learning_rate": 0.00045978211907327804,
"loss": 5.7152,
"mean_token_accuracy": 0.19898659586906434,
"num_tokens": 44503307.0,
"step": 17555
},
{
"entropy": 6.278667783737182,
"epoch": 2.0265435660703983,
"grad_norm": 0.9609375,
"learning_rate": 0.0004597585720550834,
"loss": 5.6925,
"mean_token_accuracy": 0.20318609178066255,
"num_tokens": 44516078.0,
"step": 17560
},
{
"entropy": 6.279894495010376,
"epoch": 2.0271206001154067,
"grad_norm": 0.93359375,
"learning_rate": 0.000459735018822626,
"loss": 5.6674,
"mean_token_accuracy": 0.20145113617181779,
"num_tokens": 44528485.0,
"step": 17565
},
{
"entropy": 6.2945067405700685,
"epoch": 2.0276976341604156,
"grad_norm": 1.015625,
"learning_rate": 0.00045971145937669794,
"loss": 5.6317,
"mean_token_accuracy": 0.20258528739213943,
"num_tokens": 44539946.0,
"step": 17570
},
{
"entropy": 6.19449815750122,
"epoch": 2.028274668205424,
"grad_norm": 0.98828125,
"learning_rate": 0.0004596878937180917,
"loss": 5.6912,
"mean_token_accuracy": 0.19609050452709198,
"num_tokens": 44552828.0,
"step": 17575
},
{
"entropy": 6.280514240264893,
"epoch": 2.028851702250433,
"grad_norm": 0.953125,
"learning_rate": 0.0004596643218475999,
"loss": 5.7072,
"mean_token_accuracy": 0.20018178075551987,
"num_tokens": 44564930.0,
"step": 17580
},
{
"entropy": 6.261544609069825,
"epoch": 2.0294287362954413,
"grad_norm": 0.91015625,
"learning_rate": 0.00045964074376601534,
"loss": 5.703,
"mean_token_accuracy": 0.19716645330190657,
"num_tokens": 44578226.0,
"step": 17585
},
{
"entropy": 6.227256774902344,
"epoch": 2.03000577034045,
"grad_norm": 0.94140625,
"learning_rate": 0.00045961715947413106,
"loss": 5.6875,
"mean_token_accuracy": 0.20446657538414,
"num_tokens": 44590704.0,
"step": 17590
},
{
"entropy": 6.264931344985962,
"epoch": 2.0305828043854586,
"grad_norm": 0.98046875,
"learning_rate": 0.0004595935689727404,
"loss": 5.6814,
"mean_token_accuracy": 0.20432521104812623,
"num_tokens": 44602758.0,
"step": 17595
},
{
"entropy": 6.119540214538574,
"epoch": 2.0311598384304674,
"grad_norm": 1.046875,
"learning_rate": 0.0004595699722626367,
"loss": 5.6584,
"mean_token_accuracy": 0.20234377831220626,
"num_tokens": 44614733.0,
"step": 17600
},
{
"entropy": 6.288922500610352,
"epoch": 2.031736872475476,
"grad_norm": 0.90625,
"learning_rate": 0.00045954636934461367,
"loss": 5.7345,
"mean_token_accuracy": 0.19667449444532395,
"num_tokens": 44628339.0,
"step": 17605
},
{
"entropy": 6.261105537414551,
"epoch": 2.0323139065204847,
"grad_norm": 0.984375,
"learning_rate": 0.0004595227602194652,
"loss": 5.6611,
"mean_token_accuracy": 0.2022185817360878,
"num_tokens": 44641382.0,
"step": 17610
},
{
"entropy": 6.185283756256103,
"epoch": 2.0328909405654936,
"grad_norm": 0.9609375,
"learning_rate": 0.0004594991448879853,
"loss": 5.6176,
"mean_token_accuracy": 0.2082076221704483,
"num_tokens": 44654618.0,
"step": 17615
},
{
"entropy": 6.333975410461425,
"epoch": 2.033467974610502,
"grad_norm": 0.99609375,
"learning_rate": 0.0004594755233509683,
"loss": 5.7901,
"mean_token_accuracy": 0.18755829632282256,
"num_tokens": 44667961.0,
"step": 17620
},
{
"entropy": 6.243668031692505,
"epoch": 2.034045008655511,
"grad_norm": 0.90625,
"learning_rate": 0.00045945189560920875,
"loss": 5.6792,
"mean_token_accuracy": 0.19908062219619752,
"num_tokens": 44682185.0,
"step": 17625
},
{
"entropy": 6.279232978820801,
"epoch": 2.0346220427005193,
"grad_norm": 0.9296875,
"learning_rate": 0.0004594282616635013,
"loss": 5.7007,
"mean_token_accuracy": 0.20215352922677993,
"num_tokens": 44695513.0,
"step": 17630
},
{
"entropy": 6.235209274291992,
"epoch": 2.035199076745528,
"grad_norm": 0.98828125,
"learning_rate": 0.0004594046215146409,
"loss": 5.7065,
"mean_token_accuracy": 0.2029103457927704,
"num_tokens": 44707051.0,
"step": 17635
},
{
"entropy": 6.230711984634399,
"epoch": 2.0357761107905366,
"grad_norm": 0.96875,
"learning_rate": 0.00045938097516342257,
"loss": 5.6739,
"mean_token_accuracy": 0.2068231835961342,
"num_tokens": 44719915.0,
"step": 17640
},
{
"entropy": 6.116800594329834,
"epoch": 2.0363531448355454,
"grad_norm": 0.9609375,
"learning_rate": 0.00045935732261064184,
"loss": 5.57,
"mean_token_accuracy": 0.21224127411842347,
"num_tokens": 44733115.0,
"step": 17645
},
{
"entropy": 6.2326884269714355,
"epoch": 2.036930178880554,
"grad_norm": 1.0078125,
"learning_rate": 0.00045933366385709405,
"loss": 5.7019,
"mean_token_accuracy": 0.20067428946495056,
"num_tokens": 44744480.0,
"step": 17650
},
{
"entropy": 6.285044431686401,
"epoch": 2.0375072129255627,
"grad_norm": 0.9609375,
"learning_rate": 0.0004593099989035751,
"loss": 5.7403,
"mean_token_accuracy": 0.1993875503540039,
"num_tokens": 44758200.0,
"step": 17655
},
{
"entropy": 6.3262560844421385,
"epoch": 2.038084246970571,
"grad_norm": 0.89453125,
"learning_rate": 0.0004592863277508809,
"loss": 5.7758,
"mean_token_accuracy": 0.1939818263053894,
"num_tokens": 44771407.0,
"step": 17660
},
{
"entropy": 6.25794620513916,
"epoch": 2.03866128101558,
"grad_norm": 0.98828125,
"learning_rate": 0.0004592626503998076,
"loss": 5.6232,
"mean_token_accuracy": 0.20941001623868943,
"num_tokens": 44783765.0,
"step": 17665
},
{
"entropy": 6.296916103363037,
"epoch": 2.0392383150605884,
"grad_norm": 0.97265625,
"learning_rate": 0.0004592389668511515,
"loss": 5.7197,
"mean_token_accuracy": 0.20150339752435684,
"num_tokens": 44796550.0,
"step": 17670
},
{
"entropy": 6.217992353439331,
"epoch": 2.0398153491055973,
"grad_norm": 0.9453125,
"learning_rate": 0.0004592152771057093,
"loss": 5.7022,
"mean_token_accuracy": 0.2003367841243744,
"num_tokens": 44808802.0,
"step": 17675
},
{
"entropy": 6.215272855758667,
"epoch": 2.0403923831506057,
"grad_norm": 0.9609375,
"learning_rate": 0.00045919158116427785,
"loss": 5.638,
"mean_token_accuracy": 0.20298593789339064,
"num_tokens": 44821023.0,
"step": 17680
},
{
"entropy": 6.254412078857422,
"epoch": 2.0409694171956145,
"grad_norm": 1.0,
"learning_rate": 0.00045916787902765396,
"loss": 5.6491,
"mean_token_accuracy": 0.19988745003938674,
"num_tokens": 44833822.0,
"step": 17685
},
{
"entropy": 6.23627610206604,
"epoch": 2.0415464512406234,
"grad_norm": 0.98046875,
"learning_rate": 0.0004591441706966349,
"loss": 5.6825,
"mean_token_accuracy": 0.1998839184641838,
"num_tokens": 44846440.0,
"step": 17690
},
{
"entropy": 6.276790714263916,
"epoch": 2.042123485285632,
"grad_norm": 0.94140625,
"learning_rate": 0.0004591204561720183,
"loss": 5.6926,
"mean_token_accuracy": 0.19255058020353316,
"num_tokens": 44858257.0,
"step": 17695
},
{
"entropy": 6.261844110488892,
"epoch": 2.0427005193306407,
"grad_norm": 0.875,
"learning_rate": 0.0004590967354546015,
"loss": 5.7283,
"mean_token_accuracy": 0.1950898662209511,
"num_tokens": 44871339.0,
"step": 17700
},
{
"entropy": 6.237417697906494,
"epoch": 2.043277553375649,
"grad_norm": 0.93359375,
"learning_rate": 0.0004590730085451824,
"loss": 5.6583,
"mean_token_accuracy": 0.2076822802424431,
"num_tokens": 44884190.0,
"step": 17705
},
{
"entropy": 6.1819751262664795,
"epoch": 2.043854587420658,
"grad_norm": 0.95703125,
"learning_rate": 0.00045904927544455914,
"loss": 5.5837,
"mean_token_accuracy": 0.20263769328594208,
"num_tokens": 44897530.0,
"step": 17710
},
{
"entropy": 6.191201496124267,
"epoch": 2.0444316214656664,
"grad_norm": 0.95703125,
"learning_rate": 0.00045902553615353005,
"loss": 5.564,
"mean_token_accuracy": 0.21978026032447814,
"num_tokens": 44910428.0,
"step": 17715
},
{
"entropy": 6.256063032150268,
"epoch": 2.0450086555106752,
"grad_norm": 0.8984375,
"learning_rate": 0.0004590017906728933,
"loss": 5.6913,
"mean_token_accuracy": 0.19929961115121841,
"num_tokens": 44922904.0,
"step": 17720
},
{
"entropy": 6.164769124984741,
"epoch": 2.0455856895556837,
"grad_norm": 0.9375,
"learning_rate": 0.00045897803900344774,
"loss": 5.5864,
"mean_token_accuracy": 0.20878782421350478,
"num_tokens": 44935541.0,
"step": 17725
},
{
"entropy": 6.212556028366089,
"epoch": 2.0461627236006925,
"grad_norm": 0.90625,
"learning_rate": 0.0004589542811459923,
"loss": 5.6593,
"mean_token_accuracy": 0.2079017162322998,
"num_tokens": 44948483.0,
"step": 17730
},
{
"entropy": 6.228823947906494,
"epoch": 2.046739757645701,
"grad_norm": 0.984375,
"learning_rate": 0.0004589305171013259,
"loss": 5.6415,
"mean_token_accuracy": 0.2076267421245575,
"num_tokens": 44961797.0,
"step": 17735
},
{
"entropy": 6.2405421257019045,
"epoch": 2.04731679169071,
"grad_norm": 0.9609375,
"learning_rate": 0.000458906746870248,
"loss": 5.6364,
"mean_token_accuracy": 0.20770105421543122,
"num_tokens": 44975426.0,
"step": 17740
},
{
"entropy": 6.236284351348877,
"epoch": 2.047893825735718,
"grad_norm": 0.984375,
"learning_rate": 0.000458882970453558,
"loss": 5.6621,
"mean_token_accuracy": 0.20310534834861754,
"num_tokens": 44988272.0,
"step": 17745
},
{
"entropy": 6.204120826721192,
"epoch": 2.048470859780727,
"grad_norm": 0.94921875,
"learning_rate": 0.0004588591878520556,
"loss": 5.6221,
"mean_token_accuracy": 0.2064763769507408,
"num_tokens": 45000609.0,
"step": 17750
},
{
"entropy": 6.364516687393189,
"epoch": 2.049047893825736,
"grad_norm": 1.0078125,
"learning_rate": 0.0004588353990665407,
"loss": 5.7849,
"mean_token_accuracy": 0.1859120637178421,
"num_tokens": 45012651.0,
"step": 17755
},
{
"entropy": 6.253702116012573,
"epoch": 2.0496249278707444,
"grad_norm": 1.0,
"learning_rate": 0.0004588116040978136,
"loss": 5.727,
"mean_token_accuracy": 0.20087929517030717,
"num_tokens": 45025237.0,
"step": 17760
},
{
"entropy": 6.250041151046753,
"epoch": 2.050201961915753,
"grad_norm": 0.87890625,
"learning_rate": 0.00045878780294667437,
"loss": 5.7408,
"mean_token_accuracy": 0.1949314743280411,
"num_tokens": 45038329.0,
"step": 17765
},
{
"entropy": 6.277400636672974,
"epoch": 2.0507789959607616,
"grad_norm": 0.953125,
"learning_rate": 0.0004587639956139237,
"loss": 5.6204,
"mean_token_accuracy": 0.2077370211482048,
"num_tokens": 45050251.0,
"step": 17770
},
{
"entropy": 6.254482460021973,
"epoch": 2.0513560300057705,
"grad_norm": 1.0,
"learning_rate": 0.0004587401821003624,
"loss": 5.7033,
"mean_token_accuracy": 0.1997854605317116,
"num_tokens": 45062701.0,
"step": 17775
},
{
"entropy": 6.180520868301391,
"epoch": 2.051933064050779,
"grad_norm": 0.8984375,
"learning_rate": 0.00045871636240679133,
"loss": 5.6361,
"mean_token_accuracy": 0.21148186773061753,
"num_tokens": 45077059.0,
"step": 17780
},
{
"entropy": 6.262282276153565,
"epoch": 2.0525100980957878,
"grad_norm": 0.94140625,
"learning_rate": 0.0004586925365340117,
"loss": 5.6733,
"mean_token_accuracy": 0.1936696618795395,
"num_tokens": 45089571.0,
"step": 17785
},
{
"entropy": 6.203660869598389,
"epoch": 2.053087132140796,
"grad_norm": 1.0234375,
"learning_rate": 0.0004586687044828247,
"loss": 5.6444,
"mean_token_accuracy": 0.20130022913217543,
"num_tokens": 45101085.0,
"step": 17790
},
{
"entropy": 6.230860996246338,
"epoch": 2.053664166185805,
"grad_norm": 0.95703125,
"learning_rate": 0.0004586448662540322,
"loss": 5.7041,
"mean_token_accuracy": 0.19646845906972885,
"num_tokens": 45113844.0,
"step": 17795
},
{
"entropy": 6.234907388687134,
"epoch": 2.0542412002308135,
"grad_norm": 0.921875,
"learning_rate": 0.0004586210218484358,
"loss": 5.7351,
"mean_token_accuracy": 0.19803052842617036,
"num_tokens": 45126297.0,
"step": 17800
},
{
"entropy": 6.268433570861816,
"epoch": 2.0548182342758223,
"grad_norm": 0.9921875,
"learning_rate": 0.00045859717126683745,
"loss": 5.5848,
"mean_token_accuracy": 0.2124189928174019,
"num_tokens": 45139337.0,
"step": 17805
},
{
"entropy": 6.254764461517334,
"epoch": 2.0553952683208307,
"grad_norm": 0.96484375,
"learning_rate": 0.00045857331451003953,
"loss": 5.7644,
"mean_token_accuracy": 0.18940299451351167,
"num_tokens": 45151698.0,
"step": 17810
},
{
"entropy": 6.168803453445435,
"epoch": 2.0559723023658396,
"grad_norm": 0.9296875,
"learning_rate": 0.00045854945157884435,
"loss": 5.6336,
"mean_token_accuracy": 0.20379126965999603,
"num_tokens": 45164615.0,
"step": 17815
},
{
"entropy": 6.227227401733399,
"epoch": 2.056549336410848,
"grad_norm": 0.9765625,
"learning_rate": 0.00045852558247405455,
"loss": 5.6802,
"mean_token_accuracy": 0.2069242015480995,
"num_tokens": 45176630.0,
"step": 17820
},
{
"entropy": 6.247831106185913,
"epoch": 2.057126370455857,
"grad_norm": 0.92578125,
"learning_rate": 0.00045850170719647287,
"loss": 5.6404,
"mean_token_accuracy": 0.20814504474401474,
"num_tokens": 45188879.0,
"step": 17825
},
{
"entropy": 6.256878614425659,
"epoch": 2.0577034045008658,
"grad_norm": 0.921875,
"learning_rate": 0.00045847782574690254,
"loss": 5.6535,
"mean_token_accuracy": 0.20146367996931075,
"num_tokens": 45201694.0,
"step": 17830
},
{
"entropy": 6.211376094818116,
"epoch": 2.058280438545874,
"grad_norm": 0.93359375,
"learning_rate": 0.00045845393812614664,
"loss": 5.6302,
"mean_token_accuracy": 0.19902247041463852,
"num_tokens": 45215873.0,
"step": 17835
},
{
"entropy": 6.303824377059937,
"epoch": 2.058857472590883,
"grad_norm": 0.9609375,
"learning_rate": 0.0004584300443350086,
"loss": 5.6714,
"mean_token_accuracy": 0.20408975183963776,
"num_tokens": 45229660.0,
"step": 17840
},
{
"entropy": 6.2332484245300295,
"epoch": 2.0594345066358914,
"grad_norm": 0.98046875,
"learning_rate": 0.0004584061443742922,
"loss": 5.6223,
"mean_token_accuracy": 0.19964006692171096,
"num_tokens": 45243257.0,
"step": 17845
},
{
"entropy": 6.192412042617798,
"epoch": 2.0600115406809003,
"grad_norm": 1.0078125,
"learning_rate": 0.00045838223824480124,
"loss": 5.6241,
"mean_token_accuracy": 0.20478377789258956,
"num_tokens": 45256212.0,
"step": 17850
},
{
"entropy": 6.274218940734864,
"epoch": 2.0605885747259087,
"grad_norm": 0.84375,
"learning_rate": 0.0004583583259473397,
"loss": 5.6856,
"mean_token_accuracy": 0.2076691582798958,
"num_tokens": 45268292.0,
"step": 17855
},
{
"entropy": 6.105169582366943,
"epoch": 2.0611656087709176,
"grad_norm": 0.96875,
"learning_rate": 0.00045833440748271203,
"loss": 5.5239,
"mean_token_accuracy": 0.22912171930074693,
"num_tokens": 45284112.0,
"step": 17860
},
{
"entropy": 6.246973180770874,
"epoch": 2.061742642815926,
"grad_norm": 0.921875,
"learning_rate": 0.00045831048285172266,
"loss": 5.6515,
"mean_token_accuracy": 0.20367234200239182,
"num_tokens": 45295839.0,
"step": 17865
},
{
"entropy": 6.171870565414428,
"epoch": 2.062319676860935,
"grad_norm": 0.89453125,
"learning_rate": 0.0004582865520551762,
"loss": 5.6701,
"mean_token_accuracy": 0.19572561234235764,
"num_tokens": 45309142.0,
"step": 17870
},
{
"entropy": 6.244421911239624,
"epoch": 2.0628967109059433,
"grad_norm": 0.95703125,
"learning_rate": 0.00045826261509387755,
"loss": 5.6564,
"mean_token_accuracy": 0.21014538258314133,
"num_tokens": 45322096.0,
"step": 17875
},
{
"entropy": 6.287837028503418,
"epoch": 2.063473744950952,
"grad_norm": 1.03125,
"learning_rate": 0.00045823867196863197,
"loss": 5.7293,
"mean_token_accuracy": 0.20398633629083635,
"num_tokens": 45333685.0,
"step": 17880
},
{
"entropy": 6.210242366790771,
"epoch": 2.0640507789959606,
"grad_norm": 0.953125,
"learning_rate": 0.0004582147226802446,
"loss": 5.6763,
"mean_token_accuracy": 0.20469199120998383,
"num_tokens": 45345417.0,
"step": 17885
},
{
"entropy": 6.220725202560425,
"epoch": 2.0646278130409694,
"grad_norm": 0.94140625,
"learning_rate": 0.0004581907672295211,
"loss": 5.7159,
"mean_token_accuracy": 0.19976982325315476,
"num_tokens": 45357156.0,
"step": 17890
},
{
"entropy": 6.291027307510376,
"epoch": 2.065204847085978,
"grad_norm": 0.9609375,
"learning_rate": 0.00045816680561726716,
"loss": 5.6847,
"mean_token_accuracy": 0.1986474186182022,
"num_tokens": 45369627.0,
"step": 17895
},
{
"entropy": 6.234702730178833,
"epoch": 2.0657818811309867,
"grad_norm": 0.98046875,
"learning_rate": 0.0004581428378442886,
"loss": 5.6624,
"mean_token_accuracy": 0.19629377871751785,
"num_tokens": 45380603.0,
"step": 17900
},
{
"entropy": 6.188916254043579,
"epoch": 2.0663589151759956,
"grad_norm": 0.83984375,
"learning_rate": 0.00045811886391139173,
"loss": 5.6211,
"mean_token_accuracy": 0.21858908087015153,
"num_tokens": 45394923.0,
"step": 17905
},
{
"entropy": 6.277084445953369,
"epoch": 2.066935949221004,
"grad_norm": 0.92578125,
"learning_rate": 0.00045809488381938284,
"loss": 5.6794,
"mean_token_accuracy": 0.19687334448099136,
"num_tokens": 45407351.0,
"step": 17910
},
{
"entropy": 6.161598968505859,
"epoch": 2.067512983266013,
"grad_norm": 0.921875,
"learning_rate": 0.0004580708975690684,
"loss": 5.6493,
"mean_token_accuracy": 0.20021425932645798,
"num_tokens": 45420783.0,
"step": 17915
},
{
"entropy": 6.197072887420655,
"epoch": 2.0680900173110213,
"grad_norm": 0.953125,
"learning_rate": 0.0004580469051612554,
"loss": 5.5548,
"mean_token_accuracy": 0.2188750311732292,
"num_tokens": 45433208.0,
"step": 17920
},
{
"entropy": 6.294715929031372,
"epoch": 2.06866705135603,
"grad_norm": 0.90625,
"learning_rate": 0.00045802290659675057,
"loss": 5.8009,
"mean_token_accuracy": 0.18830355405807495,
"num_tokens": 45445872.0,
"step": 17925
},
{
"entropy": 6.255209302902221,
"epoch": 2.0692440854010385,
"grad_norm": 0.98828125,
"learning_rate": 0.00045799890187636123,
"loss": 5.6859,
"mean_token_accuracy": 0.20325401276350022,
"num_tokens": 45458844.0,
"step": 17930
},
{
"entropy": 6.223239803314209,
"epoch": 2.0698211194460474,
"grad_norm": 0.91796875,
"learning_rate": 0.00045797489100089464,
"loss": 5.6922,
"mean_token_accuracy": 0.2008743941783905,
"num_tokens": 45471919.0,
"step": 17935
},
{
"entropy": 6.23684606552124,
"epoch": 2.070398153491056,
"grad_norm": 1.0,
"learning_rate": 0.0004579508739711585,
"loss": 5.6973,
"mean_token_accuracy": 0.20341706275939941,
"num_tokens": 45483769.0,
"step": 17940
},
{
"entropy": 6.298162937164307,
"epoch": 2.0709751875360647,
"grad_norm": 0.9765625,
"learning_rate": 0.00045792685078796075,
"loss": 5.7812,
"mean_token_accuracy": 0.19754380136728286,
"num_tokens": 45497077.0,
"step": 17945
},
{
"entropy": 6.258854103088379,
"epoch": 2.071552221581073,
"grad_norm": 1.015625,
"learning_rate": 0.000457902821452109,
"loss": 5.7308,
"mean_token_accuracy": 0.20346533358097077,
"num_tokens": 45509229.0,
"step": 17950
},
{
"entropy": 6.259493160247803,
"epoch": 2.072129255626082,
"grad_norm": 0.9140625,
"learning_rate": 0.00045787878596441193,
"loss": 5.6678,
"mean_token_accuracy": 0.20220885127782823,
"num_tokens": 45521654.0,
"step": 17955
},
{
"entropy": 6.260926580429077,
"epoch": 2.0727062896710904,
"grad_norm": 0.96484375,
"learning_rate": 0.0004578547443256776,
"loss": 5.7121,
"mean_token_accuracy": 0.19537041634321212,
"num_tokens": 45533488.0,
"step": 17960
},
{
"entropy": 6.268562984466553,
"epoch": 2.0732833237160992,
"grad_norm": 0.93359375,
"learning_rate": 0.0004578306965367148,
"loss": 5.6245,
"mean_token_accuracy": 0.20668937861919404,
"num_tokens": 45544938.0,
"step": 17965
},
{
"entropy": 6.247487020492554,
"epoch": 2.073860357761108,
"grad_norm": 0.96875,
"learning_rate": 0.00045780664259833235,
"loss": 5.6844,
"mean_token_accuracy": 0.20103041976690292,
"num_tokens": 45557085.0,
"step": 17970
},
{
"entropy": 6.240365791320801,
"epoch": 2.0744373918061165,
"grad_norm": 0.9453125,
"learning_rate": 0.00045778258251133924,
"loss": 5.6562,
"mean_token_accuracy": 0.20293182879686356,
"num_tokens": 45570174.0,
"step": 17975
},
{
"entropy": 6.269809722900391,
"epoch": 2.0750144258511254,
"grad_norm": 0.99609375,
"learning_rate": 0.00045775851627654474,
"loss": 5.6711,
"mean_token_accuracy": 0.20361365973949433,
"num_tokens": 45582174.0,
"step": 17980
},
{
"entropy": 6.240131282806397,
"epoch": 2.075591459896134,
"grad_norm": 0.90625,
"learning_rate": 0.0004577344438947584,
"loss": 5.7361,
"mean_token_accuracy": 0.19098032414913177,
"num_tokens": 45595732.0,
"step": 17985
},
{
"entropy": 6.214056825637817,
"epoch": 2.0761684939411427,
"grad_norm": 0.90234375,
"learning_rate": 0.00045771036536678984,
"loss": 5.6625,
"mean_token_accuracy": 0.20121949464082717,
"num_tokens": 45609675.0,
"step": 17990
},
{
"entropy": 6.315131139755249,
"epoch": 2.076745527986151,
"grad_norm": 0.8828125,
"learning_rate": 0.00045768628069344885,
"loss": 5.7055,
"mean_token_accuracy": 0.19686917960643768,
"num_tokens": 45622467.0,
"step": 17995
},
{
"entropy": 6.263897705078125,
"epoch": 2.07732256203116,
"grad_norm": 1.0078125,
"learning_rate": 0.0004576621898755455,
"loss": 5.739,
"mean_token_accuracy": 0.19382344782352448,
"num_tokens": 45636246.0,
"step": 18000
},
{
"epoch": 2.07732256203116,
"eval_entropy": 6.069619185822167,
"eval_loss": 5.804035663604736,
"eval_mean_token_accuracy": 0.20375993807384635,
"eval_num_tokens": 45636246.0,
"eval_runtime": 17.5172,
"eval_samples_per_second": 1606.191,
"eval_steps_per_second": 200.774,
"step": 18000
},
{
"entropy": 6.246134519577026,
"epoch": 2.0778995960761684,
"grad_norm": 0.9765625,
"learning_rate": 0.00045763809291389024,
"loss": 5.6481,
"mean_token_accuracy": 0.20348013937473297,
"num_tokens": 45649127.0,
"step": 18005
},
{
"entropy": 6.264445734024048,
"epoch": 2.0784766301211772,
"grad_norm": 0.9453125,
"learning_rate": 0.0004576139898092933,
"loss": 5.6794,
"mean_token_accuracy": 0.19997181594371796,
"num_tokens": 45661633.0,
"step": 18010
},
{
"entropy": 6.222084331512451,
"epoch": 2.0790536641661856,
"grad_norm": 0.921875,
"learning_rate": 0.0004575898805625657,
"loss": 5.6185,
"mean_token_accuracy": 0.20518322587013244,
"num_tokens": 45673643.0,
"step": 18015
},
{
"entropy": 6.335010671615601,
"epoch": 2.0796306982111945,
"grad_norm": 0.92578125,
"learning_rate": 0.00045756576517451804,
"loss": 5.7725,
"mean_token_accuracy": 0.19150546044111252,
"num_tokens": 45686125.0,
"step": 18020
},
{
"entropy": 6.257683420181275,
"epoch": 2.080207732256203,
"grad_norm": 0.95703125,
"learning_rate": 0.00045754164364596156,
"loss": 5.6225,
"mean_token_accuracy": 0.20368454307317735,
"num_tokens": 45697919.0,
"step": 18025
},
{
"entropy": 6.219502353668213,
"epoch": 2.080784766301212,
"grad_norm": 0.94921875,
"learning_rate": 0.0004575175159777076,
"loss": 5.7023,
"mean_token_accuracy": 0.19955314546823502,
"num_tokens": 45709450.0,
"step": 18030
},
{
"entropy": 6.245679044723511,
"epoch": 2.0813618003462206,
"grad_norm": 0.97265625,
"learning_rate": 0.0004574933821705676,
"loss": 5.6477,
"mean_token_accuracy": 0.20409499555826188,
"num_tokens": 45721464.0,
"step": 18035
},
{
"entropy": 6.304778718948365,
"epoch": 2.081938834391229,
"grad_norm": 0.9921875,
"learning_rate": 0.0004574692422253534,
"loss": 5.7526,
"mean_token_accuracy": 0.19708194881677626,
"num_tokens": 45733397.0,
"step": 18040
},
{
"entropy": 6.216876220703125,
"epoch": 2.082515868436238,
"grad_norm": 0.91015625,
"learning_rate": 0.00045744509614287687,
"loss": 5.7058,
"mean_token_accuracy": 0.19746667742729188,
"num_tokens": 45744953.0,
"step": 18045
},
{
"entropy": 6.250694465637207,
"epoch": 2.0830929024812463,
"grad_norm": 0.9765625,
"learning_rate": 0.0004574209439239501,
"loss": 5.6636,
"mean_token_accuracy": 0.20134249180555344,
"num_tokens": 45756914.0,
"step": 18050
},
{
"entropy": 6.23657341003418,
"epoch": 2.083669936526255,
"grad_norm": 0.91015625,
"learning_rate": 0.00045739678556938563,
"loss": 5.6809,
"mean_token_accuracy": 0.21226089149713517,
"num_tokens": 45770888.0,
"step": 18055
},
{
"entropy": 6.235244607925415,
"epoch": 2.0842469705712636,
"grad_norm": 0.9375,
"learning_rate": 0.00045737262107999575,
"loss": 5.6767,
"mean_token_accuracy": 0.2019466146826744,
"num_tokens": 45783551.0,
"step": 18060
},
{
"entropy": 6.26384391784668,
"epoch": 2.0848240046162725,
"grad_norm": 0.984375,
"learning_rate": 0.0004573484504565934,
"loss": 5.6601,
"mean_token_accuracy": 0.20924518406391143,
"num_tokens": 45795700.0,
"step": 18065
},
{
"entropy": 6.19308066368103,
"epoch": 2.085401038661281,
"grad_norm": 0.87890625,
"learning_rate": 0.0004573242736999915,
"loss": 5.6641,
"mean_token_accuracy": 0.20257942378520966,
"num_tokens": 45808414.0,
"step": 18070
},
{
"entropy": 6.195266485214233,
"epoch": 2.0859780727062898,
"grad_norm": 0.9609375,
"learning_rate": 0.00045730009081100314,
"loss": 5.614,
"mean_token_accuracy": 0.2057153984904289,
"num_tokens": 45821710.0,
"step": 18075
},
{
"entropy": 6.121374559402466,
"epoch": 2.086555106751298,
"grad_norm": 0.96875,
"learning_rate": 0.00045727590179044195,
"loss": 5.6034,
"mean_token_accuracy": 0.20624669641256332,
"num_tokens": 45835812.0,
"step": 18080
},
{
"entropy": 6.274444627761841,
"epoch": 2.087132140796307,
"grad_norm": 1.015625,
"learning_rate": 0.0004572517066391211,
"loss": 5.6767,
"mean_token_accuracy": 0.20413774400949478,
"num_tokens": 45849076.0,
"step": 18085
},
{
"entropy": 6.242035007476806,
"epoch": 2.0877091748413155,
"grad_norm": 0.99609375,
"learning_rate": 0.00045722750535785484,
"loss": 5.6815,
"mean_token_accuracy": 0.20116450935602187,
"num_tokens": 45861375.0,
"step": 18090
},
{
"entropy": 6.2057653903961185,
"epoch": 2.0882862088863243,
"grad_norm": 1.0625,
"learning_rate": 0.00045720329794745685,
"loss": 5.6527,
"mean_token_accuracy": 0.2060537040233612,
"num_tokens": 45872096.0,
"step": 18095
},
{
"entropy": 6.1792665958404545,
"epoch": 2.0888632429313327,
"grad_norm": 0.9921875,
"learning_rate": 0.0004571790844087415,
"loss": 5.5907,
"mean_token_accuracy": 0.21414544433355331,
"num_tokens": 45884843.0,
"step": 18100
},
{
"entropy": 6.267030906677246,
"epoch": 2.0894402769763416,
"grad_norm": 0.9609375,
"learning_rate": 0.0004571548647425231,
"loss": 5.6587,
"mean_token_accuracy": 0.19904158115386963,
"num_tokens": 45896644.0,
"step": 18105
},
{
"entropy": 6.324420690536499,
"epoch": 2.0900173110213505,
"grad_norm": 0.93359375,
"learning_rate": 0.0004571306389496164,
"loss": 5.7546,
"mean_token_accuracy": 0.19744710773229598,
"num_tokens": 45910204.0,
"step": 18110
},
{
"entropy": 6.239924144744873,
"epoch": 2.090594345066359,
"grad_norm": 1.03125,
"learning_rate": 0.00045710640703083594,
"loss": 5.6235,
"mean_token_accuracy": 0.20362144559621811,
"num_tokens": 45923332.0,
"step": 18115
},
{
"entropy": 6.175708246231079,
"epoch": 2.0911713791113677,
"grad_norm": 1.0234375,
"learning_rate": 0.00045708216898699707,
"loss": 5.669,
"mean_token_accuracy": 0.21027057766914367,
"num_tokens": 45937322.0,
"step": 18120
},
{
"entropy": 6.245549440383911,
"epoch": 2.091748413156376,
"grad_norm": 0.984375,
"learning_rate": 0.00045705792481891483,
"loss": 5.661,
"mean_token_accuracy": 0.19952643513679505,
"num_tokens": 45950369.0,
"step": 18125
},
{
"entropy": 6.313686466217041,
"epoch": 2.092325447201385,
"grad_norm": 0.9609375,
"learning_rate": 0.00045703367452740477,
"loss": 5.8022,
"mean_token_accuracy": 0.19890412092208862,
"num_tokens": 45963402.0,
"step": 18130
},
{
"entropy": 6.282650661468506,
"epoch": 2.0929024812463934,
"grad_norm": 0.90625,
"learning_rate": 0.00045700941811328247,
"loss": 5.7317,
"mean_token_accuracy": 0.1945398658514023,
"num_tokens": 45976979.0,
"step": 18135
},
{
"entropy": 6.272404193878174,
"epoch": 2.0934795152914023,
"grad_norm": 0.87890625,
"learning_rate": 0.00045698515557736374,
"loss": 5.7198,
"mean_token_accuracy": 0.19928032010793686,
"num_tokens": 45990334.0,
"step": 18140
},
{
"entropy": 6.185986185073853,
"epoch": 2.0940565493364107,
"grad_norm": 1.0078125,
"learning_rate": 0.00045696088692046477,
"loss": 5.6245,
"mean_token_accuracy": 0.20934058129787445,
"num_tokens": 46002322.0,
"step": 18145
},
{
"entropy": 6.240342664718628,
"epoch": 2.0946335833814196,
"grad_norm": 0.96875,
"learning_rate": 0.00045693661214340174,
"loss": 5.722,
"mean_token_accuracy": 0.19595017284154892,
"num_tokens": 46014136.0,
"step": 18150
},
{
"entropy": 6.332130861282349,
"epoch": 2.095210617426428,
"grad_norm": 0.98046875,
"learning_rate": 0.00045691233124699117,
"loss": 5.7533,
"mean_token_accuracy": 0.19440668374300002,
"num_tokens": 46026686.0,
"step": 18155
},
{
"entropy": 6.238727474212647,
"epoch": 2.095787651471437,
"grad_norm": 0.99609375,
"learning_rate": 0.0004568880442320497,
"loss": 5.6499,
"mean_token_accuracy": 0.2080206796526909,
"num_tokens": 46038462.0,
"step": 18160
},
{
"entropy": 6.305221891403198,
"epoch": 2.0963646855164453,
"grad_norm": 0.9375,
"learning_rate": 0.00045686375109939417,
"loss": 5.7261,
"mean_token_accuracy": 0.19346963614225388,
"num_tokens": 46051549.0,
"step": 18165
},
{
"entropy": 6.252967166900635,
"epoch": 2.096941719561454,
"grad_norm": 1.0390625,
"learning_rate": 0.0004568394518498417,
"loss": 5.693,
"mean_token_accuracy": 0.20137814581394195,
"num_tokens": 46065282.0,
"step": 18170
},
{
"entropy": 6.2782073497772215,
"epoch": 2.0975187536064626,
"grad_norm": 0.9375,
"learning_rate": 0.00045681514648420965,
"loss": 5.7062,
"mean_token_accuracy": 0.19837625026702882,
"num_tokens": 46077238.0,
"step": 18175
},
{
"entropy": 6.325450277328491,
"epoch": 2.0980957876514714,
"grad_norm": 0.9765625,
"learning_rate": 0.0004567908350033154,
"loss": 5.6915,
"mean_token_accuracy": 0.2042577013373375,
"num_tokens": 46089044.0,
"step": 18180
},
{
"entropy": 6.248745012283325,
"epoch": 2.0986728216964803,
"grad_norm": 1.0078125,
"learning_rate": 0.0004567665174079767,
"loss": 5.7329,
"mean_token_accuracy": 0.20117929577827454,
"num_tokens": 46101246.0,
"step": 18185
},
{
"entropy": 6.282928800582885,
"epoch": 2.0992498557414887,
"grad_norm": 0.9453125,
"learning_rate": 0.00045674219369901153,
"loss": 5.7487,
"mean_token_accuracy": 0.19632016271352767,
"num_tokens": 46112735.0,
"step": 18190
},
{
"entropy": 6.255322742462158,
"epoch": 2.0998268897864976,
"grad_norm": 0.90625,
"learning_rate": 0.0004567178638772379,
"loss": 5.802,
"mean_token_accuracy": 0.19112858474254607,
"num_tokens": 46125547.0,
"step": 18195
},
{
"entropy": 6.31384596824646,
"epoch": 2.100403923831506,
"grad_norm": 0.984375,
"learning_rate": 0.0004566935279434742,
"loss": 5.7593,
"mean_token_accuracy": 0.19314925372600555,
"num_tokens": 46137356.0,
"step": 18200
},
{
"entropy": 6.22183141708374,
"epoch": 2.100980957876515,
"grad_norm": 0.9140625,
"learning_rate": 0.00045666918589853895,
"loss": 5.6608,
"mean_token_accuracy": 0.20413845479488374,
"num_tokens": 46149935.0,
"step": 18205
},
{
"entropy": 6.188861894607544,
"epoch": 2.1015579919215233,
"grad_norm": 0.953125,
"learning_rate": 0.00045664483774325094,
"loss": 5.5989,
"mean_token_accuracy": 0.2077876254916191,
"num_tokens": 46162186.0,
"step": 18210
},
{
"entropy": 6.222089576721191,
"epoch": 2.102135025966532,
"grad_norm": 1.609375,
"learning_rate": 0.0004566204834784289,
"loss": 5.6059,
"mean_token_accuracy": 0.20326893627643586,
"num_tokens": 46175221.0,
"step": 18215
},
{
"entropy": 6.195293712615967,
"epoch": 2.1027120600115405,
"grad_norm": 0.9609375,
"learning_rate": 0.00045659612310489225,
"loss": 5.762,
"mean_token_accuracy": 0.19867088049650192,
"num_tokens": 46187898.0,
"step": 18220
},
{
"entropy": 6.246435070037842,
"epoch": 2.1032890940565494,
"grad_norm": 0.9453125,
"learning_rate": 0.00045657175662346014,
"loss": 5.665,
"mean_token_accuracy": 0.20157117545604705,
"num_tokens": 46200792.0,
"step": 18225
},
{
"entropy": 6.260198020935059,
"epoch": 2.103866128101558,
"grad_norm": 0.921875,
"learning_rate": 0.0004565473840349522,
"loss": 5.6957,
"mean_token_accuracy": 0.19887917637825012,
"num_tokens": 46213791.0,
"step": 18230
},
{
"entropy": 6.264036750793457,
"epoch": 2.1044431621465667,
"grad_norm": 0.984375,
"learning_rate": 0.00045652300534018816,
"loss": 5.6782,
"mean_token_accuracy": 0.2033469021320343,
"num_tokens": 46226229.0,
"step": 18235
},
{
"entropy": 6.277313184738159,
"epoch": 2.105020196191575,
"grad_norm": 0.99609375,
"learning_rate": 0.000456498620539988,
"loss": 5.6742,
"mean_token_accuracy": 0.20586120039224626,
"num_tokens": 46239253.0,
"step": 18240
},
{
"entropy": 6.210960912704468,
"epoch": 2.105597230236584,
"grad_norm": 1.015625,
"learning_rate": 0.0004564742296351719,
"loss": 5.7082,
"mean_token_accuracy": 0.20025913417339325,
"num_tokens": 46251578.0,
"step": 18245
},
{
"entropy": 6.309379816055298,
"epoch": 2.106174264281593,
"grad_norm": 0.91796875,
"learning_rate": 0.00045644983262656014,
"loss": 5.7046,
"mean_token_accuracy": 0.20009643882513045,
"num_tokens": 46265421.0,
"step": 18250
},
{
"entropy": 6.279318809509277,
"epoch": 2.1067512983266012,
"grad_norm": 0.9609375,
"learning_rate": 0.0004564254295149735,
"loss": 5.7543,
"mean_token_accuracy": 0.19517963677644729,
"num_tokens": 46277480.0,
"step": 18255
},
{
"entropy": 6.281505012512207,
"epoch": 2.10732833237161,
"grad_norm": 1.0078125,
"learning_rate": 0.00045640102030123264,
"loss": 5.7272,
"mean_token_accuracy": 0.1994670122861862,
"num_tokens": 46289793.0,
"step": 18260
},
{
"entropy": 6.272510528564453,
"epoch": 2.1079053664166185,
"grad_norm": 1.15625,
"learning_rate": 0.00045637660498615865,
"loss": 5.6853,
"mean_token_accuracy": 0.20521128475666045,
"num_tokens": 46301653.0,
"step": 18265
},
{
"entropy": 6.129175043106079,
"epoch": 2.1084824004616274,
"grad_norm": 0.95703125,
"learning_rate": 0.0004563521835705725,
"loss": 5.578,
"mean_token_accuracy": 0.21452680677175523,
"num_tokens": 46314368.0,
"step": 18270
},
{
"entropy": 6.310157346725464,
"epoch": 2.109059434506636,
"grad_norm": 0.92578125,
"learning_rate": 0.00045632775605529587,
"loss": 5.7247,
"mean_token_accuracy": 0.19462078511714936,
"num_tokens": 46327446.0,
"step": 18275
},
{
"entropy": 6.319844436645508,
"epoch": 2.1096364685516447,
"grad_norm": 1.0,
"learning_rate": 0.0004563033224411501,
"loss": 5.728,
"mean_token_accuracy": 0.1939805880188942,
"num_tokens": 46340370.0,
"step": 18280
},
{
"entropy": 6.22706356048584,
"epoch": 2.110213502596653,
"grad_norm": 0.9296875,
"learning_rate": 0.0004562788827289572,
"loss": 5.7025,
"mean_token_accuracy": 0.20296211242675782,
"num_tokens": 46352675.0,
"step": 18285
},
{
"entropy": 6.148489570617675,
"epoch": 2.110790536641662,
"grad_norm": 0.890625,
"learning_rate": 0.00045625443691953914,
"loss": 5.5886,
"mean_token_accuracy": 0.20904678702354432,
"num_tokens": 46365404.0,
"step": 18290
},
{
"entropy": 6.284792232513428,
"epoch": 2.1113675706866704,
"grad_norm": 0.90625,
"learning_rate": 0.0004562299850137181,
"loss": 5.652,
"mean_token_accuracy": 0.20398799926042557,
"num_tokens": 46377544.0,
"step": 18295
},
{
"entropy": 6.247260618209839,
"epoch": 2.111944604731679,
"grad_norm": 0.93359375,
"learning_rate": 0.0004562055270123166,
"loss": 5.7487,
"mean_token_accuracy": 0.2020320326089859,
"num_tokens": 46390425.0,
"step": 18300
},
{
"entropy": 6.210721588134765,
"epoch": 2.1125216387766876,
"grad_norm": 1.3203125,
"learning_rate": 0.00045618106291615715,
"loss": 5.6716,
"mean_token_accuracy": 0.2000151827931404,
"num_tokens": 46403359.0,
"step": 18305
},
{
"entropy": 6.296349716186524,
"epoch": 2.1130986728216965,
"grad_norm": 0.9921875,
"learning_rate": 0.0004561565927260627,
"loss": 5.7571,
"mean_token_accuracy": 0.2024470806121826,
"num_tokens": 46414700.0,
"step": 18310
},
{
"entropy": 6.317724514007568,
"epoch": 2.1136757068667054,
"grad_norm": 0.9921875,
"learning_rate": 0.0004561321164428561,
"loss": 5.7405,
"mean_token_accuracy": 0.19626646637916564,
"num_tokens": 46427199.0,
"step": 18315
},
{
"entropy": 6.291296052932739,
"epoch": 2.114252740911714,
"grad_norm": 0.95703125,
"learning_rate": 0.0004561076340673609,
"loss": 5.6788,
"mean_token_accuracy": 0.2070443406701088,
"num_tokens": 46440143.0,
"step": 18320
},
{
"entropy": 6.296773862838745,
"epoch": 2.1148297749567226,
"grad_norm": 0.90234375,
"learning_rate": 0.0004560831456004003,
"loss": 5.6809,
"mean_token_accuracy": 0.19323974549770356,
"num_tokens": 46452868.0,
"step": 18325
},
{
"entropy": 6.2290812015533445,
"epoch": 2.115406809001731,
"grad_norm": 0.99609375,
"learning_rate": 0.0004560586510427981,
"loss": 5.5906,
"mean_token_accuracy": 0.21004874557256697,
"num_tokens": 46465648.0,
"step": 18330
},
{
"entropy": 6.190475177764893,
"epoch": 2.11598384304674,
"grad_norm": 0.97265625,
"learning_rate": 0.0004560341503953781,
"loss": 5.7048,
"mean_token_accuracy": 0.20484923124313353,
"num_tokens": 46478282.0,
"step": 18335
},
{
"entropy": 6.218627786636352,
"epoch": 2.1165608770917483,
"grad_norm": 1.0078125,
"learning_rate": 0.0004560096436589643,
"loss": 5.6113,
"mean_token_accuracy": 0.2062837600708008,
"num_tokens": 46490299.0,
"step": 18340
},
{
"entropy": 6.244489526748657,
"epoch": 2.117137911136757,
"grad_norm": 0.94921875,
"learning_rate": 0.00045598513083438115,
"loss": 5.6169,
"mean_token_accuracy": 0.21169881969690324,
"num_tokens": 46502165.0,
"step": 18345
},
{
"entropy": 6.214208650588989,
"epoch": 2.1177149451817656,
"grad_norm": 0.91796875,
"learning_rate": 0.00045596061192245297,
"loss": 5.7166,
"mean_token_accuracy": 0.20201748758554458,
"num_tokens": 46514954.0,
"step": 18350
},
{
"entropy": 6.290360975265503,
"epoch": 2.1182919792267745,
"grad_norm": 0.9609375,
"learning_rate": 0.0004559360869240045,
"loss": 5.7851,
"mean_token_accuracy": 0.18993605077266693,
"num_tokens": 46527088.0,
"step": 18355
},
{
"entropy": 6.313471698760987,
"epoch": 2.118869013271783,
"grad_norm": 0.9296875,
"learning_rate": 0.0004559115558398606,
"loss": 5.7399,
"mean_token_accuracy": 0.19302885234355927,
"num_tokens": 46538737.0,
"step": 18360
},
{
"entropy": 6.245953607559204,
"epoch": 2.1194460473167918,
"grad_norm": 0.88671875,
"learning_rate": 0.0004558870186708465,
"loss": 5.652,
"mean_token_accuracy": 0.20305613279342652,
"num_tokens": 46551963.0,
"step": 18365
},
{
"entropy": 6.245628738403321,
"epoch": 2.1200230813618,
"grad_norm": 0.91796875,
"learning_rate": 0.00045586247541778724,
"loss": 5.7255,
"mean_token_accuracy": 0.20636988282203675,
"num_tokens": 46564247.0,
"step": 18370
},
{
"entropy": 6.240551710128784,
"epoch": 2.120600115406809,
"grad_norm": 0.96875,
"learning_rate": 0.0004558379260815085,
"loss": 5.6995,
"mean_token_accuracy": 0.20225383788347245,
"num_tokens": 46578491.0,
"step": 18375
},
{
"entropy": 6.269914007186889,
"epoch": 2.1211771494518175,
"grad_norm": 0.9140625,
"learning_rate": 0.0004558133706628359,
"loss": 5.6906,
"mean_token_accuracy": 0.20203321278095246,
"num_tokens": 46591528.0,
"step": 18380
},
{
"entropy": 6.32675838470459,
"epoch": 2.1217541834968263,
"grad_norm": 0.9921875,
"learning_rate": 0.00045578880916259554,
"loss": 5.771,
"mean_token_accuracy": 0.193904410302639,
"num_tokens": 46605028.0,
"step": 18385
},
{
"entropy": 6.199621963500976,
"epoch": 2.122331217541835,
"grad_norm": 0.90625,
"learning_rate": 0.0004557642415816132,
"loss": 5.6377,
"mean_token_accuracy": 0.2080541417002678,
"num_tokens": 46617713.0,
"step": 18390
},
{
"entropy": 6.285545921325683,
"epoch": 2.1229082515868436,
"grad_norm": 0.91015625,
"learning_rate": 0.0004557396679207155,
"loss": 5.7865,
"mean_token_accuracy": 0.19203791320323943,
"num_tokens": 46631897.0,
"step": 18395
},
{
"entropy": 6.303127717971802,
"epoch": 2.1234852856318525,
"grad_norm": 0.97265625,
"learning_rate": 0.00045571508818072887,
"loss": 5.7481,
"mean_token_accuracy": 0.19187881350517272,
"num_tokens": 46645457.0,
"step": 18400
},
{
"entropy": 6.339938688278198,
"epoch": 2.124062319676861,
"grad_norm": 0.95703125,
"learning_rate": 0.0004556905023624799,
"loss": 5.7318,
"mean_token_accuracy": 0.19835630059242249,
"num_tokens": 46657779.0,
"step": 18405
},
{
"entropy": 6.2173059463500975,
"epoch": 2.1246393537218697,
"grad_norm": 0.91796875,
"learning_rate": 0.00045566591046679577,
"loss": 5.6775,
"mean_token_accuracy": 0.2003285899758339,
"num_tokens": 46670590.0,
"step": 18410
},
{
"entropy": 6.223220014572144,
"epoch": 2.125216387766878,
"grad_norm": 0.828125,
"learning_rate": 0.00045564131249450343,
"loss": 5.6518,
"mean_token_accuracy": 0.20317054986953736,
"num_tokens": 46683369.0,
"step": 18415
},
{
"entropy": 6.314276504516601,
"epoch": 2.125793421811887,
"grad_norm": 0.94140625,
"learning_rate": 0.0004556167084464302,
"loss": 5.6898,
"mean_token_accuracy": 0.19398971945047377,
"num_tokens": 46695371.0,
"step": 18420
},
{
"entropy": 6.185404968261719,
"epoch": 2.1263704558568954,
"grad_norm": 0.9609375,
"learning_rate": 0.0004555920983234038,
"loss": 5.6048,
"mean_token_accuracy": 0.20488648414611815,
"num_tokens": 46708422.0,
"step": 18425
},
{
"entropy": 6.131176233291626,
"epoch": 2.1269474899019043,
"grad_norm": 0.96484375,
"learning_rate": 0.00045556748212625183,
"loss": 5.5992,
"mean_token_accuracy": 0.21085411310195923,
"num_tokens": 46722236.0,
"step": 18430
},
{
"entropy": 6.335385847091675,
"epoch": 2.1275245239469127,
"grad_norm": 1.0390625,
"learning_rate": 0.0004555428598558023,
"loss": 5.6881,
"mean_token_accuracy": 0.2015898957848549,
"num_tokens": 46733084.0,
"step": 18435
},
{
"entropy": 6.235428047180176,
"epoch": 2.1281015579919216,
"grad_norm": 1.0390625,
"learning_rate": 0.0004555182315128833,
"loss": 5.6943,
"mean_token_accuracy": 0.19690838754177092,
"num_tokens": 46745174.0,
"step": 18440
},
{
"entropy": 6.291813564300537,
"epoch": 2.12867859203693,
"grad_norm": 0.95703125,
"learning_rate": 0.0004554935970983234,
"loss": 5.7371,
"mean_token_accuracy": 0.20212126523256302,
"num_tokens": 46758134.0,
"step": 18445
},
{
"entropy": 6.26134991645813,
"epoch": 2.129255626081939,
"grad_norm": 0.96484375,
"learning_rate": 0.0004554689566129509,
"loss": 5.6282,
"mean_token_accuracy": 0.20178801715373992,
"num_tokens": 46770941.0,
"step": 18450
},
{
"entropy": 6.253507900238037,
"epoch": 2.1298326601269473,
"grad_norm": 0.953125,
"learning_rate": 0.00045544431005759467,
"loss": 5.7037,
"mean_token_accuracy": 0.20702736973762512,
"num_tokens": 46782532.0,
"step": 18455
},
{
"entropy": 6.190967559814453,
"epoch": 2.130409694171956,
"grad_norm": 1.0234375,
"learning_rate": 0.00045541965743308376,
"loss": 5.6673,
"mean_token_accuracy": 0.20353056937456132,
"num_tokens": 46794636.0,
"step": 18460
},
{
"entropy": 6.23766188621521,
"epoch": 2.130986728216965,
"grad_norm": 0.84375,
"learning_rate": 0.0004553949987402473,
"loss": 5.7034,
"mean_token_accuracy": 0.1964999184012413,
"num_tokens": 46807797.0,
"step": 18465
},
{
"entropy": 6.3087376117706295,
"epoch": 2.1315637622619734,
"grad_norm": 0.9765625,
"learning_rate": 0.0004553703339799146,
"loss": 5.6631,
"mean_token_accuracy": 0.1988433212041855,
"num_tokens": 46819838.0,
"step": 18470
},
{
"entropy": 6.15626368522644,
"epoch": 2.1321407963069823,
"grad_norm": 0.9140625,
"learning_rate": 0.0004553456631529154,
"loss": 5.6281,
"mean_token_accuracy": 0.20693209618330002,
"num_tokens": 46832172.0,
"step": 18475
},
{
"entropy": 6.262816905975342,
"epoch": 2.1327178303519907,
"grad_norm": 0.953125,
"learning_rate": 0.0004553209862600794,
"loss": 5.7047,
"mean_token_accuracy": 0.20258551687002183,
"num_tokens": 46844457.0,
"step": 18480
},
{
"entropy": 6.217689561843872,
"epoch": 2.1332948643969996,
"grad_norm": 0.9609375,
"learning_rate": 0.0004552963033022365,
"loss": 5.6269,
"mean_token_accuracy": 0.20258189141750335,
"num_tokens": 46857256.0,
"step": 18485
},
{
"entropy": 6.245373678207398,
"epoch": 2.133871898442008,
"grad_norm": 0.98828125,
"learning_rate": 0.00045527161428021706,
"loss": 5.6878,
"mean_token_accuracy": 0.2011040687561035,
"num_tokens": 46870971.0,
"step": 18490
},
{
"entropy": 6.261890983581543,
"epoch": 2.134448932487017,
"grad_norm": 1.0390625,
"learning_rate": 0.0004552469191948514,
"loss": 5.6446,
"mean_token_accuracy": 0.20959553867578506,
"num_tokens": 46882911.0,
"step": 18495
},
{
"entropy": 6.253646564483643,
"epoch": 2.1350259665320253,
"grad_norm": 0.90625,
"learning_rate": 0.0004552222180469702,
"loss": 5.693,
"mean_token_accuracy": 0.20216709077358247,
"num_tokens": 46895927.0,
"step": 18500
},
{
"entropy": 6.187870836257934,
"epoch": 2.135603000577034,
"grad_norm": 0.96875,
"learning_rate": 0.00045519751083740413,
"loss": 5.6568,
"mean_token_accuracy": 0.20425989031791686,
"num_tokens": 46908210.0,
"step": 18505
},
{
"entropy": 6.299504232406616,
"epoch": 2.1361800346220425,
"grad_norm": 1.0,
"learning_rate": 0.00045517279756698435,
"loss": 5.7277,
"mean_token_accuracy": 0.1984967589378357,
"num_tokens": 46920197.0,
"step": 18510
},
{
"entropy": 6.272176742553711,
"epoch": 2.1367570686670514,
"grad_norm": 0.98828125,
"learning_rate": 0.00045514807823654203,
"loss": 5.6717,
"mean_token_accuracy": 0.2022643879055977,
"num_tokens": 46932628.0,
"step": 18515
},
{
"entropy": 6.2229221820831295,
"epoch": 2.13733410271206,
"grad_norm": 0.921875,
"learning_rate": 0.0004551233528469086,
"loss": 5.6484,
"mean_token_accuracy": 0.20244522541761398,
"num_tokens": 46945479.0,
"step": 18520
},
{
"entropy": 6.249539518356324,
"epoch": 2.1379111367570687,
"grad_norm": 0.91015625,
"learning_rate": 0.00045509862139891553,
"loss": 5.6598,
"mean_token_accuracy": 0.20135302245616912,
"num_tokens": 46958178.0,
"step": 18525
},
{
"entropy": 6.303174018859863,
"epoch": 2.138488170802077,
"grad_norm": 1.0078125,
"learning_rate": 0.00045507388389339496,
"loss": 5.7638,
"mean_token_accuracy": 0.19554962664842607,
"num_tokens": 46972959.0,
"step": 18530
},
{
"entropy": 6.301294231414795,
"epoch": 2.139065204847086,
"grad_norm": 0.9921875,
"learning_rate": 0.00045504914033117866,
"loss": 5.731,
"mean_token_accuracy": 0.2034759998321533,
"num_tokens": 46985506.0,
"step": 18535
},
{
"entropy": 6.185574340820312,
"epoch": 2.139642238892095,
"grad_norm": 0.94140625,
"learning_rate": 0.00045502439071309897,
"loss": 5.6738,
"mean_token_accuracy": 0.2004707098007202,
"num_tokens": 46997928.0,
"step": 18540
},
{
"entropy": 6.144084739685058,
"epoch": 2.1402192729371032,
"grad_norm": 0.984375,
"learning_rate": 0.00045499963503998835,
"loss": 5.5515,
"mean_token_accuracy": 0.21737504452466966,
"num_tokens": 47010097.0,
"step": 18545
},
{
"entropy": 6.288726758956909,
"epoch": 2.140796306982112,
"grad_norm": 1.0078125,
"learning_rate": 0.0004549748733126794,
"loss": 5.7374,
"mean_token_accuracy": 0.1894450679421425,
"num_tokens": 47021230.0,
"step": 18550
},
{
"entropy": 6.350382137298584,
"epoch": 2.1413733410271205,
"grad_norm": 0.9453125,
"learning_rate": 0.000454950105532005,
"loss": 5.7337,
"mean_token_accuracy": 0.20369782149791718,
"num_tokens": 47034433.0,
"step": 18555
},
{
"entropy": 6.285674619674682,
"epoch": 2.1419503750721294,
"grad_norm": 0.9375,
"learning_rate": 0.00045492533169879816,
"loss": 5.6853,
"mean_token_accuracy": 0.2005313515663147,
"num_tokens": 47046824.0,
"step": 18560
},
{
"entropy": 6.15918869972229,
"epoch": 2.142527409117138,
"grad_norm": 1.015625,
"learning_rate": 0.00045490055181389216,
"loss": 5.6169,
"mean_token_accuracy": 0.21414333134889602,
"num_tokens": 47058868.0,
"step": 18565
},
{
"entropy": 6.236881732940674,
"epoch": 2.1431044431621467,
"grad_norm": 0.97265625,
"learning_rate": 0.00045487576587812046,
"loss": 5.7218,
"mean_token_accuracy": 0.1932273432612419,
"num_tokens": 47070898.0,
"step": 18570
},
{
"entropy": 6.288231134414673,
"epoch": 2.143681477207155,
"grad_norm": 0.98828125,
"learning_rate": 0.00045485097389231675,
"loss": 5.7072,
"mean_token_accuracy": 0.20229474306106568,
"num_tokens": 47083739.0,
"step": 18575
},
{
"entropy": 6.256460046768188,
"epoch": 2.144258511252164,
"grad_norm": 0.9765625,
"learning_rate": 0.0004548261758573149,
"loss": 5.6604,
"mean_token_accuracy": 0.19764898717403412,
"num_tokens": 47095595.0,
"step": 18580
},
{
"entropy": 6.3134369373321535,
"epoch": 2.1448355452971724,
"grad_norm": 1.0234375,
"learning_rate": 0.0004548013717739489,
"loss": 5.7906,
"mean_token_accuracy": 0.1963936612010002,
"num_tokens": 47108326.0,
"step": 18585
},
{
"entropy": 6.267605018615723,
"epoch": 2.145412579342181,
"grad_norm": 0.984375,
"learning_rate": 0.0004547765616430531,
"loss": 5.6946,
"mean_token_accuracy": 0.2020091712474823,
"num_tokens": 47120494.0,
"step": 18590
},
{
"entropy": 6.253426933288575,
"epoch": 2.14598961338719,
"grad_norm": 0.96484375,
"learning_rate": 0.0004547517454654619,
"loss": 5.7123,
"mean_token_accuracy": 0.19711664468050002,
"num_tokens": 47133116.0,
"step": 18595
},
{
"entropy": 6.2377996921539305,
"epoch": 2.1465666474321985,
"grad_norm": 0.984375,
"learning_rate": 0.00045472692324201005,
"loss": 5.6745,
"mean_token_accuracy": 0.20328953266143798,
"num_tokens": 47145208.0,
"step": 18600
},
{
"entropy": 6.2594903945922855,
"epoch": 2.1471436814772074,
"grad_norm": 0.984375,
"learning_rate": 0.00045470209497353243,
"loss": 5.6525,
"mean_token_accuracy": 0.20197178572416305,
"num_tokens": 47159217.0,
"step": 18605
},
{
"entropy": 6.259916639328003,
"epoch": 2.1477207155222158,
"grad_norm": 0.8984375,
"learning_rate": 0.0004546772606608641,
"loss": 5.7191,
"mean_token_accuracy": 0.19843529015779496,
"num_tokens": 47171781.0,
"step": 18610
},
{
"entropy": 6.272399759292602,
"epoch": 2.1482977495672246,
"grad_norm": 1.078125,
"learning_rate": 0.0004546524203048404,
"loss": 5.7301,
"mean_token_accuracy": 0.20068282037973403,
"num_tokens": 47184045.0,
"step": 18615
},
{
"entropy": 6.256565856933594,
"epoch": 2.148874783612233,
"grad_norm": 0.9765625,
"learning_rate": 0.0004546275739062967,
"loss": 5.6422,
"mean_token_accuracy": 0.20642626881599427,
"num_tokens": 47195511.0,
"step": 18620
},
{
"entropy": 6.235472393035889,
"epoch": 2.149451817657242,
"grad_norm": 0.984375,
"learning_rate": 0.0004546027214660688,
"loss": 5.6918,
"mean_token_accuracy": 0.2010675698518753,
"num_tokens": 47206977.0,
"step": 18625
},
{
"entropy": 6.2369743347167965,
"epoch": 2.1500288517022503,
"grad_norm": 1.0234375,
"learning_rate": 0.0004545778629849926,
"loss": 5.6698,
"mean_token_accuracy": 0.19845179915428163,
"num_tokens": 47218748.0,
"step": 18630
},
{
"entropy": 6.347124624252319,
"epoch": 2.150605885747259,
"grad_norm": 0.9296875,
"learning_rate": 0.0004545529984639042,
"loss": 5.7865,
"mean_token_accuracy": 0.1867247551679611,
"num_tokens": 47230651.0,
"step": 18635
},
{
"entropy": 6.214054298400879,
"epoch": 2.1511829197922676,
"grad_norm": 0.96875,
"learning_rate": 0.0004545281279036398,
"loss": 5.6591,
"mean_token_accuracy": 0.2055197224020958,
"num_tokens": 47242959.0,
"step": 18640
},
{
"entropy": 6.25451807975769,
"epoch": 2.1517599538372765,
"grad_norm": 0.94921875,
"learning_rate": 0.0004545032513050361,
"loss": 5.6808,
"mean_token_accuracy": 0.19695733934640886,
"num_tokens": 47255113.0,
"step": 18645
},
{
"entropy": 6.290202808380127,
"epoch": 2.152336987882285,
"grad_norm": 0.94921875,
"learning_rate": 0.0004544783686689296,
"loss": 5.7893,
"mean_token_accuracy": 0.19497634023427962,
"num_tokens": 47266873.0,
"step": 18650
},
{
"entropy": 6.329517269134522,
"epoch": 2.1529140219272938,
"grad_norm": 1.0546875,
"learning_rate": 0.00045445347999615736,
"loss": 5.7372,
"mean_token_accuracy": 0.20065853744745255,
"num_tokens": 47278685.0,
"step": 18655
},
{
"entropy": 6.251347064971924,
"epoch": 2.153491055972302,
"grad_norm": 0.96484375,
"learning_rate": 0.00045442858528755653,
"loss": 5.7136,
"mean_token_accuracy": 0.20842838436365127,
"num_tokens": 47291553.0,
"step": 18660
},
{
"entropy": 6.250447130203247,
"epoch": 2.154068090017311,
"grad_norm": 0.96484375,
"learning_rate": 0.00045440368454396435,
"loss": 5.6378,
"mean_token_accuracy": 0.20666613578796386,
"num_tokens": 47303890.0,
"step": 18665
},
{
"entropy": 6.201526117324829,
"epoch": 2.15464512406232,
"grad_norm": 1.046875,
"learning_rate": 0.0004543787777662183,
"loss": 5.6181,
"mean_token_accuracy": 0.21246950477361679,
"num_tokens": 47316990.0,
"step": 18670
},
{
"entropy": 6.260347652435303,
"epoch": 2.1552221581073283,
"grad_norm": 0.90234375,
"learning_rate": 0.00045435386495515617,
"loss": 5.7288,
"mean_token_accuracy": 0.2012850522994995,
"num_tokens": 47330568.0,
"step": 18675
},
{
"entropy": 6.274090385437011,
"epoch": 2.155799192152337,
"grad_norm": 0.984375,
"learning_rate": 0.0004543289461116159,
"loss": 5.6548,
"mean_token_accuracy": 0.20304317623376847,
"num_tokens": 47343563.0,
"step": 18680
},
{
"entropy": 6.274822044372558,
"epoch": 2.1563762261973456,
"grad_norm": 0.91796875,
"learning_rate": 0.0004543040212364356,
"loss": 5.7077,
"mean_token_accuracy": 0.19780379682779312,
"num_tokens": 47356272.0,
"step": 18685
},
{
"entropy": 6.162377452850341,
"epoch": 2.1569532602423545,
"grad_norm": 1.03125,
"learning_rate": 0.0004542790903304536,
"loss": 5.6503,
"mean_token_accuracy": 0.20433313250541688,
"num_tokens": 47370244.0,
"step": 18690
},
{
"entropy": 6.270251655578614,
"epoch": 2.157530294287363,
"grad_norm": 0.875,
"learning_rate": 0.0004542541533945085,
"loss": 5.6845,
"mean_token_accuracy": 0.20407705754041672,
"num_tokens": 47383120.0,
"step": 18695
},
{
"entropy": 6.325912189483643,
"epoch": 2.1581073283323717,
"grad_norm": 0.94921875,
"learning_rate": 0.00045422921042943885,
"loss": 5.7731,
"mean_token_accuracy": 0.19510978758335112,
"num_tokens": 47397274.0,
"step": 18700
},
{
"entropy": 6.282104444503784,
"epoch": 2.15868436237738,
"grad_norm": 0.92578125,
"learning_rate": 0.000454204261436084,
"loss": 5.6718,
"mean_token_accuracy": 0.19389674961566924,
"num_tokens": 47409611.0,
"step": 18705
},
{
"entropy": 6.2637886047363285,
"epoch": 2.159261396422389,
"grad_norm": 0.98046875,
"learning_rate": 0.00045417930641528255,
"loss": 5.6857,
"mean_token_accuracy": 0.19976329952478408,
"num_tokens": 47421435.0,
"step": 18710
},
{
"entropy": 6.322576427459717,
"epoch": 2.1598384304673974,
"grad_norm": 0.90234375,
"learning_rate": 0.00045415434536787424,
"loss": 5.7587,
"mean_token_accuracy": 0.19851334244012833,
"num_tokens": 47434749.0,
"step": 18715
},
{
"entropy": 6.275216150283813,
"epoch": 2.1604154645124063,
"grad_norm": 0.8984375,
"learning_rate": 0.0004541293782946985,
"loss": 5.7258,
"mean_token_accuracy": 0.19765596836805344,
"num_tokens": 47446477.0,
"step": 18720
},
{
"entropy": 6.1962462902069095,
"epoch": 2.1609924985574147,
"grad_norm": 0.953125,
"learning_rate": 0.0004541044051965952,
"loss": 5.5981,
"mean_token_accuracy": 0.2038559779524803,
"num_tokens": 47459547.0,
"step": 18725
},
{
"entropy": 6.297658157348633,
"epoch": 2.1615695326024236,
"grad_norm": 0.98828125,
"learning_rate": 0.0004540794260744041,
"loss": 5.751,
"mean_token_accuracy": 0.19317446351051332,
"num_tokens": 47472294.0,
"step": 18730
},
{
"entropy": 6.24362964630127,
"epoch": 2.162146566647432,
"grad_norm": 0.92578125,
"learning_rate": 0.0004540544409289655,
"loss": 5.6429,
"mean_token_accuracy": 0.20526028126478196,
"num_tokens": 47484240.0,
"step": 18735
},
{
"entropy": 6.266336107254029,
"epoch": 2.162723600692441,
"grad_norm": 0.92578125,
"learning_rate": 0.0004540294497611197,
"loss": 5.7104,
"mean_token_accuracy": 0.20812188535928727,
"num_tokens": 47498179.0,
"step": 18740
},
{
"entropy": 6.240371036529541,
"epoch": 2.1633006347374497,
"grad_norm": 0.91015625,
"learning_rate": 0.00045400445257170725,
"loss": 5.6758,
"mean_token_accuracy": 0.2001010537147522,
"num_tokens": 47511354.0,
"step": 18745
},
{
"entropy": 6.279890441894532,
"epoch": 2.163877668782458,
"grad_norm": 0.921875,
"learning_rate": 0.0004539794493615689,
"loss": 5.7464,
"mean_token_accuracy": 0.20213051587343217,
"num_tokens": 47523589.0,
"step": 18750
},
{
"entropy": 6.195033931732178,
"epoch": 2.164454702827467,
"grad_norm": 0.98046875,
"learning_rate": 0.0004539544401315458,
"loss": 5.6927,
"mean_token_accuracy": 0.20695994198322296,
"num_tokens": 47536784.0,
"step": 18755
},
{
"entropy": 6.260665416717529,
"epoch": 2.1650317368724754,
"grad_norm": 1.0078125,
"learning_rate": 0.000453929424882479,
"loss": 5.633,
"mean_token_accuracy": 0.20660437643527985,
"num_tokens": 47550560.0,
"step": 18760
},
{
"entropy": 6.246667957305908,
"epoch": 2.1656087709174843,
"grad_norm": 0.9375,
"learning_rate": 0.00045390440361520987,
"loss": 5.5635,
"mean_token_accuracy": 0.22506728023290634,
"num_tokens": 47564069.0,
"step": 18765
},
{
"entropy": 6.2478800296783445,
"epoch": 2.1661858049624927,
"grad_norm": 0.9140625,
"learning_rate": 0.0004538793763305799,
"loss": 5.6714,
"mean_token_accuracy": 0.19922966212034227,
"num_tokens": 47577570.0,
"step": 18770
},
{
"entropy": 6.254863834381103,
"epoch": 2.1667628390075016,
"grad_norm": 1.015625,
"learning_rate": 0.00045385434302943104,
"loss": 5.7292,
"mean_token_accuracy": 0.2031453251838684,
"num_tokens": 47590199.0,
"step": 18775
},
{
"entropy": 6.285591554641724,
"epoch": 2.16733987305251,
"grad_norm": 0.9921875,
"learning_rate": 0.0004538293037126052,
"loss": 5.6744,
"mean_token_accuracy": 0.20117084085941314,
"num_tokens": 47601697.0,
"step": 18780
},
{
"entropy": 6.296120595932007,
"epoch": 2.167916907097519,
"grad_norm": 0.8828125,
"learning_rate": 0.00045380425838094444,
"loss": 5.7184,
"mean_token_accuracy": 0.19993578642606735,
"num_tokens": 47615331.0,
"step": 18785
},
{
"entropy": 6.217986249923706,
"epoch": 2.1684939411425272,
"grad_norm": 0.96875,
"learning_rate": 0.00045377920703529133,
"loss": 5.6688,
"mean_token_accuracy": 0.20416014790534973,
"num_tokens": 47628455.0,
"step": 18790
},
{
"entropy": 6.236662530899048,
"epoch": 2.169070975187536,
"grad_norm": 0.9453125,
"learning_rate": 0.0004537541496764885,
"loss": 5.632,
"mean_token_accuracy": 0.20659274458885193,
"num_tokens": 47642078.0,
"step": 18795
},
{
"entropy": 6.258144998550415,
"epoch": 2.1696480092325445,
"grad_norm": 1.015625,
"learning_rate": 0.0004537290863053786,
"loss": 5.6747,
"mean_token_accuracy": 0.2031049832701683,
"num_tokens": 47653672.0,
"step": 18800
},
{
"entropy": 6.120979070663452,
"epoch": 2.1702250432775534,
"grad_norm": 1.0234375,
"learning_rate": 0.00045370401692280455,
"loss": 5.5686,
"mean_token_accuracy": 0.20843469351530075,
"num_tokens": 47666085.0,
"step": 18805
},
{
"entropy": 6.304890823364258,
"epoch": 2.170802077322562,
"grad_norm": 0.9609375,
"learning_rate": 0.00045367894152960976,
"loss": 5.7797,
"mean_token_accuracy": 0.19347210079431534,
"num_tokens": 47678180.0,
"step": 18810
},
{
"entropy": 6.284006977081299,
"epoch": 2.1713791113675707,
"grad_norm": 0.984375,
"learning_rate": 0.00045365386012663744,
"loss": 5.7109,
"mean_token_accuracy": 0.19503520876169206,
"num_tokens": 47690631.0,
"step": 18815
},
{
"entropy": 6.259499502182007,
"epoch": 2.1719561454125795,
"grad_norm": 1.0234375,
"learning_rate": 0.00045362877271473137,
"loss": 5.6326,
"mean_token_accuracy": 0.20334458649158477,
"num_tokens": 47702577.0,
"step": 18820
},
{
"entropy": 6.2635283946990965,
"epoch": 2.172533179457588,
"grad_norm": 1.015625,
"learning_rate": 0.00045360367929473517,
"loss": 5.6859,
"mean_token_accuracy": 0.20750661194324493,
"num_tokens": 47714683.0,
"step": 18825
},
{
"entropy": 6.2828991413116455,
"epoch": 2.173110213502597,
"grad_norm": 0.96484375,
"learning_rate": 0.000453578579867493,
"loss": 5.6273,
"mean_token_accuracy": 0.20380921959877013,
"num_tokens": 47726202.0,
"step": 18830
},
{
"entropy": 6.223279047012329,
"epoch": 2.1736872475476052,
"grad_norm": 0.94140625,
"learning_rate": 0.00045355347443384896,
"loss": 5.6476,
"mean_token_accuracy": 0.20528243482112885,
"num_tokens": 47740178.0,
"step": 18835
},
{
"entropy": 6.244608068466187,
"epoch": 2.174264281592614,
"grad_norm": 0.984375,
"learning_rate": 0.00045352836299464755,
"loss": 5.6788,
"mean_token_accuracy": 0.20205701440572738,
"num_tokens": 47752710.0,
"step": 18840
},
{
"entropy": 6.250746059417724,
"epoch": 2.1748413156376225,
"grad_norm": 0.90234375,
"learning_rate": 0.0004535032455507333,
"loss": 5.6218,
"mean_token_accuracy": 0.2027655079960823,
"num_tokens": 47765292.0,
"step": 18845
},
{
"entropy": 6.254888486862183,
"epoch": 2.1754183496826314,
"grad_norm": 0.9921875,
"learning_rate": 0.00045347812210295107,
"loss": 5.6778,
"mean_token_accuracy": 0.19805543571710588,
"num_tokens": 47777799.0,
"step": 18850
},
{
"entropy": 6.272021627426147,
"epoch": 2.17599538372764,
"grad_norm": 0.9453125,
"learning_rate": 0.00045345299265214583,
"loss": 5.6492,
"mean_token_accuracy": 0.20628771483898162,
"num_tokens": 47790705.0,
"step": 18855
},
{
"entropy": 6.225584030151367,
"epoch": 2.1765724177726486,
"grad_norm": 0.90625,
"learning_rate": 0.00045342785719916284,
"loss": 5.5986,
"mean_token_accuracy": 0.19875137656927108,
"num_tokens": 47802169.0,
"step": 18860
},
{
"entropy": 6.155571317672729,
"epoch": 2.177149451817657,
"grad_norm": 1.0,
"learning_rate": 0.00045340271574484755,
"loss": 5.5336,
"mean_token_accuracy": 0.20996356904506683,
"num_tokens": 47815832.0,
"step": 18865
},
{
"entropy": 6.340555238723755,
"epoch": 2.177726485862666,
"grad_norm": 1.0703125,
"learning_rate": 0.0004533775682900454,
"loss": 5.7641,
"mean_token_accuracy": 0.19792629182338714,
"num_tokens": 47828967.0,
"step": 18870
},
{
"entropy": 6.216424942016602,
"epoch": 2.1783035199076743,
"grad_norm": 0.94921875,
"learning_rate": 0.0004533524148356025,
"loss": 5.6142,
"mean_token_accuracy": 0.21056083738803863,
"num_tokens": 47842114.0,
"step": 18875
},
{
"entropy": 6.117310237884522,
"epoch": 2.178880553952683,
"grad_norm": 0.9140625,
"learning_rate": 0.0004533272553823646,
"loss": 5.5741,
"mean_token_accuracy": 0.20430090874433518,
"num_tokens": 47855808.0,
"step": 18880
},
{
"entropy": 6.302039957046508,
"epoch": 2.179457587997692,
"grad_norm": 1.1015625,
"learning_rate": 0.00045330208993117816,
"loss": 5.7289,
"mean_token_accuracy": 0.19179463237524033,
"num_tokens": 47866866.0,
"step": 18885
},
{
"entropy": 6.286647701263428,
"epoch": 2.1800346220427005,
"grad_norm": 0.9375,
"learning_rate": 0.0004532769184828894,
"loss": 5.6727,
"mean_token_accuracy": 0.2016996130347252,
"num_tokens": 47878823.0,
"step": 18890
},
{
"entropy": 6.268312454223633,
"epoch": 2.1806116560877093,
"grad_norm": 0.94140625,
"learning_rate": 0.0004532517410383451,
"loss": 5.7583,
"mean_token_accuracy": 0.1968337342143059,
"num_tokens": 47890512.0,
"step": 18895
},
{
"entropy": 6.242161893844605,
"epoch": 2.1811886901327178,
"grad_norm": 1.28125,
"learning_rate": 0.000453226557598392,
"loss": 5.708,
"mean_token_accuracy": 0.19775693565607072,
"num_tokens": 47903728.0,
"step": 18900
},
{
"entropy": 6.29580249786377,
"epoch": 2.1817657241777266,
"grad_norm": 0.98046875,
"learning_rate": 0.0004532013681638771,
"loss": 5.7467,
"mean_token_accuracy": 0.1998975858092308,
"num_tokens": 47914742.0,
"step": 18905
},
{
"entropy": 6.32392201423645,
"epoch": 2.182342758222735,
"grad_norm": 0.99609375,
"learning_rate": 0.0004531761727356478,
"loss": 5.7328,
"mean_token_accuracy": 0.19939059615135193,
"num_tokens": 47926737.0,
"step": 18910
},
{
"entropy": 6.257878255844116,
"epoch": 2.182919792267744,
"grad_norm": 0.875,
"learning_rate": 0.0004531509713145514,
"loss": 5.6638,
"mean_token_accuracy": 0.20171019285917283,
"num_tokens": 47941207.0,
"step": 18915
},
{
"entropy": 6.257398414611816,
"epoch": 2.1834968263127523,
"grad_norm": 0.93359375,
"learning_rate": 0.00045312576390143557,
"loss": 5.7509,
"mean_token_accuracy": 0.19138018190860748,
"num_tokens": 47953640.0,
"step": 18920
},
{
"entropy": 6.2764183521270756,
"epoch": 2.184073860357761,
"grad_norm": 0.96875,
"learning_rate": 0.00045310055049714815,
"loss": 5.7342,
"mean_token_accuracy": 0.20488953590393066,
"num_tokens": 47966399.0,
"step": 18925
},
{
"entropy": 6.283313941955567,
"epoch": 2.1846508944027696,
"grad_norm": 0.98828125,
"learning_rate": 0.00045307533110253726,
"loss": 5.6533,
"mean_token_accuracy": 0.20482224971055984,
"num_tokens": 47979521.0,
"step": 18930
},
{
"entropy": 6.287374973297119,
"epoch": 2.1852279284477785,
"grad_norm": 0.9375,
"learning_rate": 0.00045305010571845096,
"loss": 5.7341,
"mean_token_accuracy": 0.20170841217041016,
"num_tokens": 47992780.0,
"step": 18935
},
{
"entropy": 6.314225530624389,
"epoch": 2.185804962492787,
"grad_norm": 1.09375,
"learning_rate": 0.0004530248743457378,
"loss": 5.7519,
"mean_token_accuracy": 0.19808263331651688,
"num_tokens": 48005548.0,
"step": 18940
},
{
"entropy": 6.2541357517242435,
"epoch": 2.1863819965377957,
"grad_norm": 0.96484375,
"learning_rate": 0.0004529996369852465,
"loss": 5.6555,
"mean_token_accuracy": 0.2016634613275528,
"num_tokens": 48017352.0,
"step": 18945
},
{
"entropy": 6.124024057388306,
"epoch": 2.1869590305828046,
"grad_norm": 0.99609375,
"learning_rate": 0.00045297439363782576,
"loss": 5.4849,
"mean_token_accuracy": 0.21912779062986373,
"num_tokens": 48029252.0,
"step": 18950
},
{
"entropy": 6.261006593704224,
"epoch": 2.187536064627813,
"grad_norm": 0.98046875,
"learning_rate": 0.0004529491443043247,
"loss": 5.7477,
"mean_token_accuracy": 0.20232635885477065,
"num_tokens": 48041534.0,
"step": 18955
},
{
"entropy": 6.252580547332764,
"epoch": 2.188113098672822,
"grad_norm": 0.9765625,
"learning_rate": 0.0004529238889855926,
"loss": 5.7354,
"mean_token_accuracy": 0.19888463020324706,
"num_tokens": 48054396.0,
"step": 18960
},
{
"entropy": 6.259010362625122,
"epoch": 2.1886901327178303,
"grad_norm": 0.89453125,
"learning_rate": 0.0004528986276824789,
"loss": 5.7195,
"mean_token_accuracy": 0.1986936628818512,
"num_tokens": 48066785.0,
"step": 18965
},
{
"entropy": 6.207064390182495,
"epoch": 2.189267166762839,
"grad_norm": 0.90625,
"learning_rate": 0.0004528733603958331,
"loss": 5.6582,
"mean_token_accuracy": 0.20980920046567916,
"num_tokens": 48079837.0,
"step": 18970
},
{
"entropy": 6.275537204742432,
"epoch": 2.1898442008078476,
"grad_norm": 1.1015625,
"learning_rate": 0.0004528480871265053,
"loss": 5.659,
"mean_token_accuracy": 0.20257765352725982,
"num_tokens": 48091670.0,
"step": 18975
},
{
"entropy": 6.2916429996490475,
"epoch": 2.1904212348528564,
"grad_norm": 0.9140625,
"learning_rate": 0.00045282280787534537,
"loss": 5.7575,
"mean_token_accuracy": 0.19688573181629182,
"num_tokens": 48105261.0,
"step": 18980
},
{
"entropy": 6.2920839309692385,
"epoch": 2.190998268897865,
"grad_norm": 0.90625,
"learning_rate": 0.0004527975226432036,
"loss": 5.6593,
"mean_token_accuracy": 0.1986699342727661,
"num_tokens": 48118272.0,
"step": 18985
},
{
"entropy": 6.237543535232544,
"epoch": 2.1915753029428737,
"grad_norm": 1.09375,
"learning_rate": 0.00045277223143093057,
"loss": 5.7048,
"mean_token_accuracy": 0.199216428399086,
"num_tokens": 48130413.0,
"step": 18990
},
{
"entropy": 6.267915391921997,
"epoch": 2.192152336987882,
"grad_norm": 0.96484375,
"learning_rate": 0.00045274693423937674,
"loss": 5.6509,
"mean_token_accuracy": 0.2026078313589096,
"num_tokens": 48143308.0,
"step": 18995
},
{
"entropy": 6.2021924495697025,
"epoch": 2.192729371032891,
"grad_norm": 0.98046875,
"learning_rate": 0.00045272163106939314,
"loss": 5.6053,
"mean_token_accuracy": 0.21072281152009964,
"num_tokens": 48155832.0,
"step": 19000
},
{
"entropy": 6.262426471710205,
"epoch": 2.1933064050778994,
"grad_norm": 0.98046875,
"learning_rate": 0.00045269632192183076,
"loss": 5.7341,
"mean_token_accuracy": 0.1992826998233795,
"num_tokens": 48168390.0,
"step": 19005
},
{
"entropy": 6.279296064376831,
"epoch": 2.1938834391229083,
"grad_norm": 0.9375,
"learning_rate": 0.00045267100679754075,
"loss": 5.7556,
"mean_token_accuracy": 0.19007308334112166,
"num_tokens": 48180918.0,
"step": 19010
},
{
"entropy": 6.300954580307007,
"epoch": 2.1944604731679167,
"grad_norm": 0.86328125,
"learning_rate": 0.0004526456856973748,
"loss": 5.702,
"mean_token_accuracy": 0.2015950232744217,
"num_tokens": 48194251.0,
"step": 19015
},
{
"entropy": 6.320611667633057,
"epoch": 2.1950375072129256,
"grad_norm": 0.98046875,
"learning_rate": 0.0004526203586221844,
"loss": 5.6978,
"mean_token_accuracy": 0.19965052008628845,
"num_tokens": 48206704.0,
"step": 19020
},
{
"entropy": 6.252124881744384,
"epoch": 2.1956145412579344,
"grad_norm": 0.98828125,
"learning_rate": 0.00045259502557282145,
"loss": 5.6983,
"mean_token_accuracy": 0.20150818079710006,
"num_tokens": 48219390.0,
"step": 19025
},
{
"entropy": 6.201693296432495,
"epoch": 2.196191575302943,
"grad_norm": 1.0234375,
"learning_rate": 0.0004525696865501381,
"loss": 5.6442,
"mean_token_accuracy": 0.20039039254188537,
"num_tokens": 48231555.0,
"step": 19030
},
{
"entropy": 6.316070938110352,
"epoch": 2.1967686093479517,
"grad_norm": 1.015625,
"learning_rate": 0.0004525443415549865,
"loss": 5.7185,
"mean_token_accuracy": 0.1988256499171257,
"num_tokens": 48243763.0,
"step": 19035
},
{
"entropy": 6.276049470901489,
"epoch": 2.19734564339296,
"grad_norm": 0.92578125,
"learning_rate": 0.00045251899058821915,
"loss": 5.7118,
"mean_token_accuracy": 0.1995232343673706,
"num_tokens": 48257567.0,
"step": 19040
},
{
"entropy": 6.211150360107422,
"epoch": 2.197922677437969,
"grad_norm": 1.0546875,
"learning_rate": 0.0004524936336506887,
"loss": 5.62,
"mean_token_accuracy": 0.20634069442749023,
"num_tokens": 48270313.0,
"step": 19045
},
{
"entropy": 6.260643768310547,
"epoch": 2.1984997114829774,
"grad_norm": 1.03125,
"learning_rate": 0.0004524682707432482,
"loss": 5.6012,
"mean_token_accuracy": 0.20677340775728226,
"num_tokens": 48282768.0,
"step": 19050
},
{
"entropy": 6.219102239608764,
"epoch": 2.1990767455279863,
"grad_norm": 1.0625,
"learning_rate": 0.00045244290186675034,
"loss": 5.6517,
"mean_token_accuracy": 0.20461307764053344,
"num_tokens": 48293861.0,
"step": 19055
},
{
"entropy": 6.2349823951721195,
"epoch": 2.1996537795729947,
"grad_norm": 0.9765625,
"learning_rate": 0.0004524175270220489,
"loss": 5.5988,
"mean_token_accuracy": 0.21154738813638688,
"num_tokens": 48306062.0,
"step": 19060
},
{
"entropy": 6.280507040023804,
"epoch": 2.2002308136180035,
"grad_norm": 0.9765625,
"learning_rate": 0.00045239214620999683,
"loss": 5.7174,
"mean_token_accuracy": 0.1978029727935791,
"num_tokens": 48318777.0,
"step": 19065
},
{
"entropy": 6.264151763916016,
"epoch": 2.200807847663012,
"grad_norm": 1.0625,
"learning_rate": 0.0004523667594314481,
"loss": 5.6984,
"mean_token_accuracy": 0.1989084467291832,
"num_tokens": 48330575.0,
"step": 19070
},
{
"entropy": 6.1020753383636475,
"epoch": 2.201384881708021,
"grad_norm": 0.9453125,
"learning_rate": 0.00045234136668725655,
"loss": 5.5308,
"mean_token_accuracy": 0.21237103641033173,
"num_tokens": 48343980.0,
"step": 19075
},
{
"entropy": 6.1847601413726805,
"epoch": 2.2019619157530292,
"grad_norm": 0.98828125,
"learning_rate": 0.00045231596797827616,
"loss": 5.6036,
"mean_token_accuracy": 0.2041487902402878,
"num_tokens": 48356140.0,
"step": 19080
},
{
"entropy": 6.245753765106201,
"epoch": 2.202538949798038,
"grad_norm": 0.88671875,
"learning_rate": 0.00045229056330536134,
"loss": 5.6988,
"mean_token_accuracy": 0.20395198315382004,
"num_tokens": 48367756.0,
"step": 19085
},
{
"entropy": 6.229965162277222,
"epoch": 2.2031159838430465,
"grad_norm": 0.91015625,
"learning_rate": 0.00045226515266936644,
"loss": 5.6839,
"mean_token_accuracy": 0.19726950377225877,
"num_tokens": 48381637.0,
"step": 19090
},
{
"entropy": 6.252473640441894,
"epoch": 2.2036930178880554,
"grad_norm": 0.94921875,
"learning_rate": 0.0004522397360711462,
"loss": 5.6362,
"mean_token_accuracy": 0.20076129734516143,
"num_tokens": 48394593.0,
"step": 19095
},
{
"entropy": 6.203752708435059,
"epoch": 2.2042700519330642,
"grad_norm": 0.8671875,
"learning_rate": 0.0004522143135115555,
"loss": 5.6111,
"mean_token_accuracy": 0.20537707656621934,
"num_tokens": 48408555.0,
"step": 19100
},
{
"entropy": 6.2377259731292725,
"epoch": 2.2048470859780727,
"grad_norm": 0.94140625,
"learning_rate": 0.00045218888499144933,
"loss": 5.6602,
"mean_token_accuracy": 0.2072727635502815,
"num_tokens": 48420359.0,
"step": 19105
},
{
"entropy": 6.29434232711792,
"epoch": 2.2054241200230815,
"grad_norm": 0.9453125,
"learning_rate": 0.00045216345051168314,
"loss": 5.7992,
"mean_token_accuracy": 0.1885974407196045,
"num_tokens": 48432516.0,
"step": 19110
},
{
"entropy": 6.259411954879761,
"epoch": 2.20600115406809,
"grad_norm": 1.015625,
"learning_rate": 0.0004521380100731122,
"loss": 5.6699,
"mean_token_accuracy": 0.2050180107355118,
"num_tokens": 48444355.0,
"step": 19115
},
{
"entropy": 6.1959943771362305,
"epoch": 2.206578188113099,
"grad_norm": 1.046875,
"learning_rate": 0.00045211256367659234,
"loss": 5.5727,
"mean_token_accuracy": 0.21873999536037445,
"num_tokens": 48458341.0,
"step": 19120
},
{
"entropy": 6.244530487060547,
"epoch": 2.207155222158107,
"grad_norm": 0.93359375,
"learning_rate": 0.0004520871113229793,
"loss": 5.6865,
"mean_token_accuracy": 0.20000386238098145,
"num_tokens": 48471473.0,
"step": 19125
},
{
"entropy": 6.241182041168213,
"epoch": 2.207732256203116,
"grad_norm": 1.0234375,
"learning_rate": 0.00045206165301312927,
"loss": 5.6741,
"mean_token_accuracy": 0.20176537930965424,
"num_tokens": 48483149.0,
"step": 19130
},
{
"entropy": 6.240596342086792,
"epoch": 2.2083092902481245,
"grad_norm": 0.93359375,
"learning_rate": 0.0004520361887478985,
"loss": 5.6755,
"mean_token_accuracy": 0.20530891567468643,
"num_tokens": 48495617.0,
"step": 19135
},
{
"entropy": 6.135921144485474,
"epoch": 2.2088863242931334,
"grad_norm": 1.03125,
"learning_rate": 0.0004520107185281435,
"loss": 5.632,
"mean_token_accuracy": 0.20589762777090073,
"num_tokens": 48509391.0,
"step": 19140
},
{
"entropy": 6.165386486053467,
"epoch": 2.209463358338142,
"grad_norm": 0.91796875,
"learning_rate": 0.0004519852423547208,
"loss": 5.5958,
"mean_token_accuracy": 0.21079403162002563,
"num_tokens": 48523127.0,
"step": 19145
},
{
"entropy": 6.156606769561767,
"epoch": 2.2100403923831506,
"grad_norm": 0.95703125,
"learning_rate": 0.0004519597602284875,
"loss": 5.569,
"mean_token_accuracy": 0.21757976710796356,
"num_tokens": 48536797.0,
"step": 19150
},
{
"entropy": 6.263695287704468,
"epoch": 2.210617426428159,
"grad_norm": 0.9609375,
"learning_rate": 0.0004519342721503005,
"loss": 5.6717,
"mean_token_accuracy": 0.20158991515636443,
"num_tokens": 48549088.0,
"step": 19155
},
{
"entropy": 6.259319400787353,
"epoch": 2.211194460473168,
"grad_norm": 0.98828125,
"learning_rate": 0.0004519087781210171,
"loss": 5.6259,
"mean_token_accuracy": 0.20565885156393052,
"num_tokens": 48560451.0,
"step": 19160
},
{
"entropy": 6.2218138694763185,
"epoch": 2.2117714945181763,
"grad_norm": 0.875,
"learning_rate": 0.000451883278141495,
"loss": 5.6,
"mean_token_accuracy": 0.2046360641717911,
"num_tokens": 48572870.0,
"step": 19165
},
{
"entropy": 6.205379390716553,
"epoch": 2.212348528563185,
"grad_norm": 0.890625,
"learning_rate": 0.00045185777221259157,
"loss": 5.6622,
"mean_token_accuracy": 0.19950393736362457,
"num_tokens": 48585909.0,
"step": 19170
},
{
"entropy": 6.264685201644897,
"epoch": 2.212925562608194,
"grad_norm": 0.9765625,
"learning_rate": 0.0004518322603351648,
"loss": 5.649,
"mean_token_accuracy": 0.20917298644781113,
"num_tokens": 48599157.0,
"step": 19175
},
{
"entropy": 6.264721012115478,
"epoch": 2.2135025966532025,
"grad_norm": 0.98828125,
"learning_rate": 0.00045180674251007287,
"loss": 5.6516,
"mean_token_accuracy": 0.20502317547798157,
"num_tokens": 48611740.0,
"step": 19180
},
{
"entropy": 6.279746770858765,
"epoch": 2.2140796306982113,
"grad_norm": 0.953125,
"learning_rate": 0.00045178121873817395,
"loss": 5.7617,
"mean_token_accuracy": 0.19199493378400803,
"num_tokens": 48624893.0,
"step": 19185
},
{
"entropy": 6.243294429779053,
"epoch": 2.2146566647432198,
"grad_norm": 1.03125,
"learning_rate": 0.0004517556890203265,
"loss": 5.6802,
"mean_token_accuracy": 0.19957953989505767,
"num_tokens": 48636414.0,
"step": 19190
},
{
"entropy": 6.1810681343078615,
"epoch": 2.2152336987882286,
"grad_norm": 1.0078125,
"learning_rate": 0.00045173015335738925,
"loss": 5.6405,
"mean_token_accuracy": 0.2053627386689186,
"num_tokens": 48649936.0,
"step": 19195
},
{
"entropy": 6.246352767944336,
"epoch": 2.215810732833237,
"grad_norm": 0.94921875,
"learning_rate": 0.00045170461175022116,
"loss": 5.6136,
"mean_token_accuracy": 0.2143157973885536,
"num_tokens": 48662857.0,
"step": 19200
},
{
"entropy": 6.24592604637146,
"epoch": 2.216387766878246,
"grad_norm": 1.046875,
"learning_rate": 0.0004516790641996812,
"loss": 5.6692,
"mean_token_accuracy": 0.2003368243575096,
"num_tokens": 48675087.0,
"step": 19205
},
{
"entropy": 6.176522159576416,
"epoch": 2.2169648009232543,
"grad_norm": 0.88671875,
"learning_rate": 0.0004516535107066286,
"loss": 5.5978,
"mean_token_accuracy": 0.20065319836139678,
"num_tokens": 48687575.0,
"step": 19210
},
{
"entropy": 6.234763860702515,
"epoch": 2.217541834968263,
"grad_norm": 0.95703125,
"learning_rate": 0.00045162795127192296,
"loss": 5.6368,
"mean_token_accuracy": 0.19902375042438508,
"num_tokens": 48701115.0,
"step": 19215
},
{
"entropy": 6.293993902206421,
"epoch": 2.2181188690132716,
"grad_norm": 0.99609375,
"learning_rate": 0.000451602385896424,
"loss": 5.7558,
"mean_token_accuracy": 0.1977062702178955,
"num_tokens": 48713738.0,
"step": 19220
},
{
"entropy": 6.202127361297608,
"epoch": 2.2186959030582805,
"grad_norm": 1.0234375,
"learning_rate": 0.00045157681458099145,
"loss": 5.5793,
"mean_token_accuracy": 0.20735561102628708,
"num_tokens": 48725282.0,
"step": 19225
},
{
"entropy": 6.219801712036133,
"epoch": 2.2192729371032893,
"grad_norm": 1.0625,
"learning_rate": 0.0004515512373264854,
"loss": 5.6486,
"mean_token_accuracy": 0.2041847363114357,
"num_tokens": 48738476.0,
"step": 19230
},
{
"entropy": 6.260962247848511,
"epoch": 2.2198499711482977,
"grad_norm": 0.9453125,
"learning_rate": 0.00045152565413376623,
"loss": 5.6571,
"mean_token_accuracy": 0.2018562912940979,
"num_tokens": 48751447.0,
"step": 19235
},
{
"entropy": 6.275470876693726,
"epoch": 2.2204270051933066,
"grad_norm": 1.0,
"learning_rate": 0.0004515000650036944,
"loss": 5.7167,
"mean_token_accuracy": 0.19641314595937728,
"num_tokens": 48764124.0,
"step": 19240
},
{
"entropy": 6.284907484054566,
"epoch": 2.221004039238315,
"grad_norm": 0.9609375,
"learning_rate": 0.0004514744699371305,
"loss": 5.7523,
"mean_token_accuracy": 0.1944175183773041,
"num_tokens": 48776414.0,
"step": 19245
},
{
"entropy": 6.267220830917358,
"epoch": 2.221581073283324,
"grad_norm": 1.03125,
"learning_rate": 0.00045144886893493547,
"loss": 5.6725,
"mean_token_accuracy": 0.1995649054646492,
"num_tokens": 48789318.0,
"step": 19250
},
{
"entropy": 6.132220125198364,
"epoch": 2.2221581073283323,
"grad_norm": 0.91015625,
"learning_rate": 0.00045142326199797047,
"loss": 5.6118,
"mean_token_accuracy": 0.21107657998800278,
"num_tokens": 48801773.0,
"step": 19255
},
{
"entropy": 6.277349853515625,
"epoch": 2.222735141373341,
"grad_norm": 1.046875,
"learning_rate": 0.00045139764912709656,
"loss": 5.6264,
"mean_token_accuracy": 0.20283719897270203,
"num_tokens": 48814137.0,
"step": 19260
},
{
"entropy": 6.262899732589721,
"epoch": 2.2233121754183496,
"grad_norm": 0.9296875,
"learning_rate": 0.0004513720303231754,
"loss": 5.6507,
"mean_token_accuracy": 0.20469385832548143,
"num_tokens": 48826129.0,
"step": 19265
},
{
"entropy": 6.253290843963623,
"epoch": 2.2238892094633584,
"grad_norm": 0.9375,
"learning_rate": 0.00045134640558706864,
"loss": 5.6963,
"mean_token_accuracy": 0.20241008698940277,
"num_tokens": 48838930.0,
"step": 19270
},
{
"entropy": 6.318625593185425,
"epoch": 2.224466243508367,
"grad_norm": 1.015625,
"learning_rate": 0.000451320774919638,
"loss": 5.6563,
"mean_token_accuracy": 0.19929049760103226,
"num_tokens": 48851506.0,
"step": 19275
},
{
"entropy": 6.214009761810303,
"epoch": 2.2250432775533757,
"grad_norm": 0.984375,
"learning_rate": 0.00045129513832174587,
"loss": 5.5768,
"mean_token_accuracy": 0.21026210784912108,
"num_tokens": 48865267.0,
"step": 19280
},
{
"entropy": 6.187762832641601,
"epoch": 2.225620311598384,
"grad_norm": 0.94921875,
"learning_rate": 0.00045126949579425414,
"loss": 5.6747,
"mean_token_accuracy": 0.2047516793012619,
"num_tokens": 48877642.0,
"step": 19285
},
{
"entropy": 6.310758638381958,
"epoch": 2.226197345643393,
"grad_norm": 0.9375,
"learning_rate": 0.00045124384733802563,
"loss": 5.7544,
"mean_token_accuracy": 0.19669358879327775,
"num_tokens": 48891135.0,
"step": 19290
},
{
"entropy": 6.310164165496826,
"epoch": 2.2267743796884014,
"grad_norm": 0.9765625,
"learning_rate": 0.0004512181929539228,
"loss": 5.7155,
"mean_token_accuracy": 0.1991264522075653,
"num_tokens": 48904361.0,
"step": 19295
},
{
"entropy": 6.211184453964234,
"epoch": 2.2273514137334103,
"grad_norm": 0.9609375,
"learning_rate": 0.00045119253264280855,
"loss": 5.7157,
"mean_token_accuracy": 0.20109605193138122,
"num_tokens": 48916497.0,
"step": 19300
},
{
"entropy": 6.246825551986694,
"epoch": 2.227928447778419,
"grad_norm": 0.9921875,
"learning_rate": 0.00045116686640554607,
"loss": 5.6756,
"mean_token_accuracy": 0.2026742219924927,
"num_tokens": 48928476.0,
"step": 19305
},
{
"entropy": 6.254496431350708,
"epoch": 2.2285054818234276,
"grad_norm": 0.92578125,
"learning_rate": 0.00045114119424299843,
"loss": 5.6985,
"mean_token_accuracy": 0.20265805274248122,
"num_tokens": 48942153.0,
"step": 19310
},
{
"entropy": 6.306353569030762,
"epoch": 2.2290825158684364,
"grad_norm": 0.92578125,
"learning_rate": 0.0004511155161560293,
"loss": 5.7238,
"mean_token_accuracy": 0.20385703891515733,
"num_tokens": 48955313.0,
"step": 19315
},
{
"entropy": 6.243967485427857,
"epoch": 2.229659549913445,
"grad_norm": 0.9921875,
"learning_rate": 0.00045108983214550225,
"loss": 5.6316,
"mean_token_accuracy": 0.2051597759127617,
"num_tokens": 48967875.0,
"step": 19320
},
{
"entropy": 6.336811971664429,
"epoch": 2.2302365839584537,
"grad_norm": 0.9296875,
"learning_rate": 0.0004510641422122811,
"loss": 5.7014,
"mean_token_accuracy": 0.196072755753994,
"num_tokens": 48979534.0,
"step": 19325
},
{
"entropy": 6.326515102386475,
"epoch": 2.230813618003462,
"grad_norm": 0.9375,
"learning_rate": 0.00045103844635723005,
"loss": 5.731,
"mean_token_accuracy": 0.19862714260816575,
"num_tokens": 48991425.0,
"step": 19330
},
{
"entropy": 6.201512050628662,
"epoch": 2.231390652048471,
"grad_norm": 0.96484375,
"learning_rate": 0.00045101274458121335,
"loss": 5.6194,
"mean_token_accuracy": 0.20665293782949448,
"num_tokens": 49003783.0,
"step": 19335
},
{
"entropy": 6.269555282592774,
"epoch": 2.2319676860934794,
"grad_norm": 0.96484375,
"learning_rate": 0.00045098703688509537,
"loss": 5.7233,
"mean_token_accuracy": 0.1967211216688156,
"num_tokens": 49017998.0,
"step": 19340
},
{
"entropy": 6.313391923904419,
"epoch": 2.2325447201384883,
"grad_norm": 0.96484375,
"learning_rate": 0.0004509613232697408,
"loss": 5.7499,
"mean_token_accuracy": 0.19863232374191284,
"num_tokens": 49030429.0,
"step": 19345
},
{
"entropy": 6.254202842712402,
"epoch": 2.2331217541834967,
"grad_norm": 0.984375,
"learning_rate": 0.0004509356037360145,
"loss": 5.6359,
"mean_token_accuracy": 0.2076195076107979,
"num_tokens": 49043619.0,
"step": 19350
},
{
"entropy": 6.298452854156494,
"epoch": 2.2336987882285055,
"grad_norm": 1.03125,
"learning_rate": 0.0004509098782847816,
"loss": 5.6961,
"mean_token_accuracy": 0.19885571599006652,
"num_tokens": 49056674.0,
"step": 19355
},
{
"entropy": 6.241327381134033,
"epoch": 2.234275822273514,
"grad_norm": 0.95703125,
"learning_rate": 0.0004508841469169073,
"loss": 5.7308,
"mean_token_accuracy": 0.1998901277780533,
"num_tokens": 49069616.0,
"step": 19360
},
{
"entropy": 6.208149719238281,
"epoch": 2.234852856318523,
"grad_norm": 0.953125,
"learning_rate": 0.00045085840963325716,
"loss": 5.6743,
"mean_token_accuracy": 0.20631023645401,
"num_tokens": 49082001.0,
"step": 19365
},
{
"entropy": 6.286288022994995,
"epoch": 2.2354298903635312,
"grad_norm": 1.109375,
"learning_rate": 0.0004508326664346967,
"loss": 5.6213,
"mean_token_accuracy": 0.20303625017404556,
"num_tokens": 49094433.0,
"step": 19370
},
{
"entropy": 6.2155601501464846,
"epoch": 2.23600692440854,
"grad_norm": 1.015625,
"learning_rate": 0.00045080691732209176,
"loss": 5.6239,
"mean_token_accuracy": 0.20596866607666015,
"num_tokens": 49106152.0,
"step": 19375
},
{
"entropy": 6.198886299133301,
"epoch": 2.236583958453549,
"grad_norm": 1.0,
"learning_rate": 0.00045078116229630864,
"loss": 5.7094,
"mean_token_accuracy": 0.20838077068328859,
"num_tokens": 49120402.0,
"step": 19380
},
{
"entropy": 6.408450603485107,
"epoch": 2.2371609924985574,
"grad_norm": 0.953125,
"learning_rate": 0.00045075540135821343,
"loss": 5.8063,
"mean_token_accuracy": 0.19086912870407105,
"num_tokens": 49133571.0,
"step": 19385
},
{
"entropy": 6.3284543514251705,
"epoch": 2.2377380265435662,
"grad_norm": 0.94140625,
"learning_rate": 0.0004507296345086725,
"loss": 5.7951,
"mean_token_accuracy": 0.19179506003856658,
"num_tokens": 49147268.0,
"step": 19390
},
{
"entropy": 6.211698198318482,
"epoch": 2.2383150605885747,
"grad_norm": 1.0078125,
"learning_rate": 0.0004507038617485526,
"loss": 5.5474,
"mean_token_accuracy": 0.2093621775507927,
"num_tokens": 49159043.0,
"step": 19395
},
{
"entropy": 6.28239483833313,
"epoch": 2.2388920946335835,
"grad_norm": 0.984375,
"learning_rate": 0.00045067808307872064,
"loss": 5.6941,
"mean_token_accuracy": 0.20465970486402513,
"num_tokens": 49172164.0,
"step": 19400
},
{
"entropy": 6.266603231430054,
"epoch": 2.239469128678592,
"grad_norm": 1.109375,
"learning_rate": 0.00045065229850004365,
"loss": 5.6229,
"mean_token_accuracy": 0.20876996964216232,
"num_tokens": 49185023.0,
"step": 19405
},
{
"entropy": 6.300706672668457,
"epoch": 2.240046162723601,
"grad_norm": 0.95703125,
"learning_rate": 0.0004506265080133888,
"loss": 5.6982,
"mean_token_accuracy": 0.1954214468598366,
"num_tokens": 49198411.0,
"step": 19410
},
{
"entropy": 6.233200168609619,
"epoch": 2.240623196768609,
"grad_norm": 0.9453125,
"learning_rate": 0.00045060071161962364,
"loss": 5.6973,
"mean_token_accuracy": 0.20337700098752975,
"num_tokens": 49211162.0,
"step": 19415
},
{
"entropy": 6.248962163925171,
"epoch": 2.241200230813618,
"grad_norm": 1.0703125,
"learning_rate": 0.0004505749093196158,
"loss": 5.7028,
"mean_token_accuracy": 0.2015640914440155,
"num_tokens": 49223808.0,
"step": 19420
},
{
"entropy": 6.173385334014893,
"epoch": 2.2417772648586265,
"grad_norm": 0.98046875,
"learning_rate": 0.000450549101114233,
"loss": 5.6418,
"mean_token_accuracy": 0.20374636054039003,
"num_tokens": 49236947.0,
"step": 19425
},
{
"entropy": 6.301487636566162,
"epoch": 2.2423542989036354,
"grad_norm": 0.91015625,
"learning_rate": 0.0004505232870043434,
"loss": 5.7153,
"mean_token_accuracy": 0.19642379581928254,
"num_tokens": 49249932.0,
"step": 19430
},
{
"entropy": 6.284289312362671,
"epoch": 2.2429313329486438,
"grad_norm": 0.96484375,
"learning_rate": 0.0004504974669908152,
"loss": 5.7306,
"mean_token_accuracy": 0.1982482597231865,
"num_tokens": 49261783.0,
"step": 19435
},
{
"entropy": 6.331235694885254,
"epoch": 2.2435083669936526,
"grad_norm": 0.96484375,
"learning_rate": 0.00045047164107451696,
"loss": 5.7267,
"mean_token_accuracy": 0.19769036918878555,
"num_tokens": 49274495.0,
"step": 19440
},
{
"entropy": 6.240282869338989,
"epoch": 2.244085401038661,
"grad_norm": 0.97265625,
"learning_rate": 0.0004504458092563172,
"loss": 5.6726,
"mean_token_accuracy": 0.19854051172733306,
"num_tokens": 49288450.0,
"step": 19445
},
{
"entropy": 6.273891544342041,
"epoch": 2.24466243508367,
"grad_norm": 1.0078125,
"learning_rate": 0.00045041997153708475,
"loss": 5.7222,
"mean_token_accuracy": 0.1992565721273422,
"num_tokens": 49300612.0,
"step": 19450
},
{
"entropy": 6.257104921340942,
"epoch": 2.2452394691286788,
"grad_norm": 0.91796875,
"learning_rate": 0.00045039412791768877,
"loss": 5.7277,
"mean_token_accuracy": 0.19571390450000764,
"num_tokens": 49313860.0,
"step": 19455
},
{
"entropy": 6.289849805831909,
"epoch": 2.245816503173687,
"grad_norm": 1.015625,
"learning_rate": 0.00045036827839899833,
"loss": 5.6777,
"mean_token_accuracy": 0.20335286408662795,
"num_tokens": 49326864.0,
"step": 19460
},
{
"entropy": 6.28691840171814,
"epoch": 2.246393537218696,
"grad_norm": 0.89453125,
"learning_rate": 0.00045034242298188303,
"loss": 5.7374,
"mean_token_accuracy": 0.19382706582546233,
"num_tokens": 49339444.0,
"step": 19465
},
{
"entropy": 6.206280183792114,
"epoch": 2.2469705712637045,
"grad_norm": 0.95703125,
"learning_rate": 0.0004503165616672124,
"loss": 5.6207,
"mean_token_accuracy": 0.2063739761710167,
"num_tokens": 49352999.0,
"step": 19470
},
{
"entropy": 6.250473546981811,
"epoch": 2.2475476053087133,
"grad_norm": 0.984375,
"learning_rate": 0.0004502906944558563,
"loss": 5.6508,
"mean_token_accuracy": 0.20927198231220245,
"num_tokens": 49365600.0,
"step": 19475
},
{
"entropy": 6.343959617614746,
"epoch": 2.2481246393537218,
"grad_norm": 1.0234375,
"learning_rate": 0.0004502648213486848,
"loss": 5.7295,
"mean_token_accuracy": 0.20067790150642395,
"num_tokens": 49378121.0,
"step": 19480
},
{
"entropy": 6.210190200805664,
"epoch": 2.2487016733987306,
"grad_norm": 1.0,
"learning_rate": 0.00045023894234656807,
"loss": 5.7057,
"mean_token_accuracy": 0.20189868211746215,
"num_tokens": 49390889.0,
"step": 19485
},
{
"entropy": 6.330983686447143,
"epoch": 2.249278707443739,
"grad_norm": 0.859375,
"learning_rate": 0.0004502130574503766,
"loss": 5.7592,
"mean_token_accuracy": 0.20028941184282303,
"num_tokens": 49404613.0,
"step": 19490
},
{
"entropy": 6.301862335205078,
"epoch": 2.249855741488748,
"grad_norm": 0.99609375,
"learning_rate": 0.0004501871666609809,
"loss": 5.7354,
"mean_token_accuracy": 0.19650717377662658,
"num_tokens": 49416142.0,
"step": 19495
},
{
"entropy": 6.2688291549682615,
"epoch": 2.2504327755337563,
"grad_norm": 1.1171875,
"learning_rate": 0.0004501612699792519,
"loss": 5.642,
"mean_token_accuracy": 0.198591947555542,
"num_tokens": 49427848.0,
"step": 19500
},
{
"entropy": 6.340646886825562,
"epoch": 2.251009809578765,
"grad_norm": 0.9375,
"learning_rate": 0.0004501353674060606,
"loss": 5.8278,
"mean_token_accuracy": 0.1921554610133171,
"num_tokens": 49442338.0,
"step": 19505
},
{
"entropy": 6.329627513885498,
"epoch": 2.251586843623774,
"grad_norm": 1.0625,
"learning_rate": 0.0004501094589422782,
"loss": 5.6851,
"mean_token_accuracy": 0.20651307106018066,
"num_tokens": 49455565.0,
"step": 19510
},
{
"entropy": 6.277817964553833,
"epoch": 2.2521638776687825,
"grad_norm": 0.9453125,
"learning_rate": 0.00045008354458877614,
"loss": 5.6897,
"mean_token_accuracy": 0.20428113937377929,
"num_tokens": 49468894.0,
"step": 19515
},
{
"entropy": 6.164229202270508,
"epoch": 2.252740911713791,
"grad_norm": 0.91015625,
"learning_rate": 0.000450057624346426,
"loss": 5.5589,
"mean_token_accuracy": 0.21396252065896987,
"num_tokens": 49480324.0,
"step": 19520
},
{
"entropy": 6.2618499279022215,
"epoch": 2.2533179457587997,
"grad_norm": 0.93359375,
"learning_rate": 0.00045003169821609967,
"loss": 5.6568,
"mean_token_accuracy": 0.2036493256688118,
"num_tokens": 49493823.0,
"step": 19525
},
{
"entropy": 6.278878498077392,
"epoch": 2.2538949798038086,
"grad_norm": 1.0,
"learning_rate": 0.00045000576619866914,
"loss": 5.6117,
"mean_token_accuracy": 0.2137911170721054,
"num_tokens": 49506512.0,
"step": 19530
},
{
"entropy": 6.312352418899536,
"epoch": 2.254472013848817,
"grad_norm": 0.99609375,
"learning_rate": 0.00044997982829500657,
"loss": 5.6839,
"mean_token_accuracy": 0.19806260019540786,
"num_tokens": 49518424.0,
"step": 19535
},
{
"entropy": 6.261477041244507,
"epoch": 2.255049047893826,
"grad_norm": 0.9140625,
"learning_rate": 0.00044995388450598436,
"loss": 5.7309,
"mean_token_accuracy": 0.20388685017824174,
"num_tokens": 49531828.0,
"step": 19540
},
{
"entropy": 6.279758405685425,
"epoch": 2.2556260819388343,
"grad_norm": 0.921875,
"learning_rate": 0.0004499279348324751,
"loss": 5.649,
"mean_token_accuracy": 0.19457512497901916,
"num_tokens": 49545502.0,
"step": 19545
},
{
"entropy": 6.206504154205322,
"epoch": 2.256203115983843,
"grad_norm": 0.8984375,
"learning_rate": 0.00044990197927535173,
"loss": 5.6958,
"mean_token_accuracy": 0.19898426085710524,
"num_tokens": 49557323.0,
"step": 19550
},
{
"entropy": 6.1493871212005615,
"epoch": 2.2567801500288516,
"grad_norm": 1.046875,
"learning_rate": 0.00044987601783548703,
"loss": 5.5645,
"mean_token_accuracy": 0.21585829854011535,
"num_tokens": 49570149.0,
"step": 19555
},
{
"entropy": 6.267534399032593,
"epoch": 2.2573571840738604,
"grad_norm": 0.9765625,
"learning_rate": 0.0004498500505137545,
"loss": 5.6328,
"mean_token_accuracy": 0.20815033465623856,
"num_tokens": 49581866.0,
"step": 19560
},
{
"entropy": 6.190386343002319,
"epoch": 2.257934218118869,
"grad_norm": 1.0,
"learning_rate": 0.0004498240773110273,
"loss": 5.6434,
"mean_token_accuracy": 0.20312456637620926,
"num_tokens": 49592785.0,
"step": 19565
},
{
"entropy": 6.30643949508667,
"epoch": 2.2585112521638777,
"grad_norm": 0.9765625,
"learning_rate": 0.0004497980982281791,
"loss": 5.7865,
"mean_token_accuracy": 0.2009749099612236,
"num_tokens": 49604925.0,
"step": 19570
},
{
"entropy": 6.350605583190918,
"epoch": 2.259088286208886,
"grad_norm": 0.9140625,
"learning_rate": 0.0004497721132660837,
"loss": 5.7244,
"mean_token_accuracy": 0.19735192358493805,
"num_tokens": 49618548.0,
"step": 19575
},
{
"entropy": 6.258015203475952,
"epoch": 2.259665320253895,
"grad_norm": 0.97265625,
"learning_rate": 0.00044974612242561516,
"loss": 5.6902,
"mean_token_accuracy": 0.20283384919166564,
"num_tokens": 49631968.0,
"step": 19580
},
{
"entropy": 6.256459474563599,
"epoch": 2.260242354298904,
"grad_norm": 0.953125,
"learning_rate": 0.0004497201257076475,
"loss": 5.7116,
"mean_token_accuracy": 0.2024211421608925,
"num_tokens": 49645269.0,
"step": 19585
},
{
"entropy": 6.270970821380615,
"epoch": 2.2608193883439123,
"grad_norm": 0.984375,
"learning_rate": 0.0004496941231130552,
"loss": 5.6926,
"mean_token_accuracy": 0.20178208351135254,
"num_tokens": 49655903.0,
"step": 19590
},
{
"entropy": 6.352920770645142,
"epoch": 2.261396422388921,
"grad_norm": 0.9921875,
"learning_rate": 0.0004496681146427129,
"loss": 5.7618,
"mean_token_accuracy": 0.1929154336452484,
"num_tokens": 49667982.0,
"step": 19595
},
{
"entropy": 6.259737825393676,
"epoch": 2.2619734564339296,
"grad_norm": 0.88671875,
"learning_rate": 0.00044964210029749523,
"loss": 5.6242,
"mean_token_accuracy": 0.20513436794281006,
"num_tokens": 49681441.0,
"step": 19600
},
{
"entropy": 6.19245285987854,
"epoch": 2.2625504904789384,
"grad_norm": 0.8984375,
"learning_rate": 0.00044961608007827736,
"loss": 5.6149,
"mean_token_accuracy": 0.21164268255233765,
"num_tokens": 49695805.0,
"step": 19605
},
{
"entropy": 6.3116106510162355,
"epoch": 2.263127524523947,
"grad_norm": 1.015625,
"learning_rate": 0.0004495900539859344,
"loss": 5.7453,
"mean_token_accuracy": 0.2014342427253723,
"num_tokens": 49708762.0,
"step": 19610
},
{
"entropy": 6.244855976104736,
"epoch": 2.2637045585689557,
"grad_norm": 0.92578125,
"learning_rate": 0.00044956402202134157,
"loss": 5.6769,
"mean_token_accuracy": 0.21064395904541017,
"num_tokens": 49724570.0,
"step": 19615
},
{
"entropy": 6.311522483825684,
"epoch": 2.264281592613964,
"grad_norm": 0.9375,
"learning_rate": 0.00044953798418537465,
"loss": 5.7421,
"mean_token_accuracy": 0.19412882030010223,
"num_tokens": 49736060.0,
"step": 19620
},
{
"entropy": 6.288136529922485,
"epoch": 2.264858626658973,
"grad_norm": 0.9609375,
"learning_rate": 0.0004495119404789093,
"loss": 5.6887,
"mean_token_accuracy": 0.20001592338085175,
"num_tokens": 49748520.0,
"step": 19625
},
{
"entropy": 6.259233474731445,
"epoch": 2.2654356607039814,
"grad_norm": 0.93359375,
"learning_rate": 0.0004494858909028216,
"loss": 5.7547,
"mean_token_accuracy": 0.19457891583442688,
"num_tokens": 49761097.0,
"step": 19630
},
{
"entropy": 6.243998432159424,
"epoch": 2.2660126947489903,
"grad_norm": 0.93359375,
"learning_rate": 0.0004494598354579875,
"loss": 5.6599,
"mean_token_accuracy": 0.2039832279086113,
"num_tokens": 49773430.0,
"step": 19635
},
{
"entropy": 6.283785581588745,
"epoch": 2.2665897287939987,
"grad_norm": 1.015625,
"learning_rate": 0.0004494337741452836,
"loss": 5.6964,
"mean_token_accuracy": 0.20121050328016282,
"num_tokens": 49785525.0,
"step": 19640
},
{
"entropy": 6.272574615478516,
"epoch": 2.2671667628390075,
"grad_norm": 1.0546875,
"learning_rate": 0.0004494077069655863,
"loss": 5.7104,
"mean_token_accuracy": 0.20026218593120576,
"num_tokens": 49796650.0,
"step": 19645
},
{
"entropy": 6.2548116683959964,
"epoch": 2.267743796884016,
"grad_norm": 1.0234375,
"learning_rate": 0.0004493816339197724,
"loss": 5.6775,
"mean_token_accuracy": 0.20387378036975862,
"num_tokens": 49808191.0,
"step": 19650
},
{
"entropy": 6.276640319824219,
"epoch": 2.268320830929025,
"grad_norm": 0.98046875,
"learning_rate": 0.00044935555500871897,
"loss": 5.7046,
"mean_token_accuracy": 0.20125204026699067,
"num_tokens": 49820051.0,
"step": 19655
},
{
"entropy": 6.295619058609009,
"epoch": 2.2688978649740337,
"grad_norm": 0.9375,
"learning_rate": 0.000449329470233303,
"loss": 5.7228,
"mean_token_accuracy": 0.19812791794538498,
"num_tokens": 49835392.0,
"step": 19660
},
{
"entropy": 6.222367143630981,
"epoch": 2.269474899019042,
"grad_norm": 1.0,
"learning_rate": 0.00044930337959440183,
"loss": 5.6577,
"mean_token_accuracy": 0.20379606783390045,
"num_tokens": 49847344.0,
"step": 19665
},
{
"entropy": 6.295651435852051,
"epoch": 2.270051933064051,
"grad_norm": 0.9375,
"learning_rate": 0.0004492772830928931,
"loss": 5.7302,
"mean_token_accuracy": 0.19512915164232253,
"num_tokens": 49859741.0,
"step": 19670
},
{
"entropy": 6.276036500930786,
"epoch": 2.2706289671090594,
"grad_norm": 0.95703125,
"learning_rate": 0.00044925118072965456,
"loss": 5.6989,
"mean_token_accuracy": 0.20129497200250626,
"num_tokens": 49871565.0,
"step": 19675
},
{
"entropy": 6.219705247879029,
"epoch": 2.2712060011540682,
"grad_norm": 0.99609375,
"learning_rate": 0.000449225072505564,
"loss": 5.645,
"mean_token_accuracy": 0.20144531279802322,
"num_tokens": 49883405.0,
"step": 19680
},
{
"entropy": 6.287055253982544,
"epoch": 2.2717830351990767,
"grad_norm": 0.9921875,
"learning_rate": 0.00044919895842149976,
"loss": 5.7471,
"mean_token_accuracy": 0.19765210449695586,
"num_tokens": 49895924.0,
"step": 19685
},
{
"entropy": 6.23684401512146,
"epoch": 2.2723600692440855,
"grad_norm": 0.94921875,
"learning_rate": 0.00044917283847834005,
"loss": 5.6523,
"mean_token_accuracy": 0.19993764013051987,
"num_tokens": 49908506.0,
"step": 19690
},
{
"entropy": 6.29704647064209,
"epoch": 2.272937103289094,
"grad_norm": 1.03125,
"learning_rate": 0.0004491467126769635,
"loss": 5.7223,
"mean_token_accuracy": 0.1992749884724617,
"num_tokens": 49919917.0,
"step": 19695
},
{
"entropy": 6.228441858291626,
"epoch": 2.273514137334103,
"grad_norm": 1.0078125,
"learning_rate": 0.00044912058101824866,
"loss": 5.6465,
"mean_token_accuracy": 0.20652550756931304,
"num_tokens": 49932508.0,
"step": 19700
},
{
"entropy": 6.2381360054016115,
"epoch": 2.274091171379111,
"grad_norm": 1.0,
"learning_rate": 0.00044909444350307463,
"loss": 5.7107,
"mean_token_accuracy": 0.20327081233263017,
"num_tokens": 49945065.0,
"step": 19705
},
{
"entropy": 6.2598044872283936,
"epoch": 2.27466820542412,
"grad_norm": 1.0,
"learning_rate": 0.0004490683001323205,
"loss": 5.6279,
"mean_token_accuracy": 0.2084788978099823,
"num_tokens": 49957530.0,
"step": 19710
},
{
"entropy": 6.201219892501831,
"epoch": 2.2752452394691285,
"grad_norm": 1.265625,
"learning_rate": 0.00044904215090686554,
"loss": 5.5949,
"mean_token_accuracy": 0.20651741623878478,
"num_tokens": 49969760.0,
"step": 19715
},
{
"entropy": 6.252209281921386,
"epoch": 2.2758222735141374,
"grad_norm": 0.9765625,
"learning_rate": 0.00044901599582758926,
"loss": 5.7175,
"mean_token_accuracy": 0.20343547612428664,
"num_tokens": 49983151.0,
"step": 19720
},
{
"entropy": 6.259750556945801,
"epoch": 2.2763993075591458,
"grad_norm": 0.8984375,
"learning_rate": 0.00044898983489537143,
"loss": 5.6256,
"mean_token_accuracy": 0.2036111459136009,
"num_tokens": 49995262.0,
"step": 19725
},
{
"entropy": 6.289621210098266,
"epoch": 2.2769763416041546,
"grad_norm": 1.09375,
"learning_rate": 0.000448963668111092,
"loss": 5.6857,
"mean_token_accuracy": 0.19986894577741623,
"num_tokens": 50007153.0,
"step": 19730
},
{
"entropy": 6.1917328357696535,
"epoch": 2.2775533756491635,
"grad_norm": 0.94140625,
"learning_rate": 0.00044893749547563085,
"loss": 5.6719,
"mean_token_accuracy": 0.20763412564992906,
"num_tokens": 50020145.0,
"step": 19735
},
{
"entropy": 6.243492603302002,
"epoch": 2.278130409694172,
"grad_norm": 1.046875,
"learning_rate": 0.00044891131698986846,
"loss": 5.6842,
"mean_token_accuracy": 0.19811105132102966,
"num_tokens": 50032741.0,
"step": 19740
},
{
"entropy": 6.239491748809814,
"epoch": 2.2787074437391808,
"grad_norm": 1.0,
"learning_rate": 0.0004488851326546854,
"loss": 5.7194,
"mean_token_accuracy": 0.19922717809677123,
"num_tokens": 50046112.0,
"step": 19745
},
{
"entropy": 6.275479888916015,
"epoch": 2.279284477784189,
"grad_norm": 0.984375,
"learning_rate": 0.0004488589424709622,
"loss": 5.6932,
"mean_token_accuracy": 0.20576501041650772,
"num_tokens": 50058718.0,
"step": 19750
},
{
"entropy": 6.196004152297974,
"epoch": 2.279861511829198,
"grad_norm": 1.0390625,
"learning_rate": 0.0004488327464395799,
"loss": 5.6223,
"mean_token_accuracy": 0.20243488848209382,
"num_tokens": 50071759.0,
"step": 19755
},
{
"entropy": 6.277880620956421,
"epoch": 2.2804385458742065,
"grad_norm": 0.96484375,
"learning_rate": 0.0004488065445614195,
"loss": 5.6598,
"mean_token_accuracy": 0.2045716404914856,
"num_tokens": 50083948.0,
"step": 19760
},
{
"entropy": 6.241612482070923,
"epoch": 2.2810155799192153,
"grad_norm": 1.0078125,
"learning_rate": 0.0004487803368373623,
"loss": 5.6438,
"mean_token_accuracy": 0.20779716223478317,
"num_tokens": 50097310.0,
"step": 19765
},
{
"entropy": 6.1986939907073975,
"epoch": 2.2815926139642237,
"grad_norm": 0.921875,
"learning_rate": 0.0004487541232682898,
"loss": 5.6918,
"mean_token_accuracy": 0.20480042099952697,
"num_tokens": 50109939.0,
"step": 19770
},
{
"entropy": 6.297293043136596,
"epoch": 2.2821696480092326,
"grad_norm": 0.953125,
"learning_rate": 0.0004487279038550836,
"loss": 5.7475,
"mean_token_accuracy": 0.19697188287973405,
"num_tokens": 50120651.0,
"step": 19775
},
{
"entropy": 6.284278392791748,
"epoch": 2.282746682054241,
"grad_norm": 0.96484375,
"learning_rate": 0.0004487016785986258,
"loss": 5.6821,
"mean_token_accuracy": 0.20540768802165985,
"num_tokens": 50133180.0,
"step": 19780
},
{
"entropy": 6.259939765930175,
"epoch": 2.28332371609925,
"grad_norm": 0.91796875,
"learning_rate": 0.00044867544749979817,
"loss": 5.6934,
"mean_token_accuracy": 0.2011975407600403,
"num_tokens": 50144808.0,
"step": 19785
},
{
"entropy": 6.242081022262573,
"epoch": 2.2839007501442588,
"grad_norm": 0.9765625,
"learning_rate": 0.00044864921055948317,
"loss": 5.648,
"mean_token_accuracy": 0.20324725955724715,
"num_tokens": 50157487.0,
"step": 19790
},
{
"entropy": 6.274213600158691,
"epoch": 2.284477784189267,
"grad_norm": 0.99609375,
"learning_rate": 0.00044862296777856326,
"loss": 5.7191,
"mean_token_accuracy": 0.19910815358161926,
"num_tokens": 50171837.0,
"step": 19795
},
{
"entropy": 6.262651777267456,
"epoch": 2.2850548182342756,
"grad_norm": 0.9296875,
"learning_rate": 0.0004485967191579211,
"loss": 5.6147,
"mean_token_accuracy": 0.21335643529891968,
"num_tokens": 50184802.0,
"step": 19800
},
{
"entropy": 6.248020982742309,
"epoch": 2.2856318522792844,
"grad_norm": 1.0234375,
"learning_rate": 0.0004485704646984394,
"loss": 5.6945,
"mean_token_accuracy": 0.1977355048060417,
"num_tokens": 50196433.0,
"step": 19805
},
{
"entropy": 6.22298641204834,
"epoch": 2.2862088863242933,
"grad_norm": 0.9375,
"learning_rate": 0.0004485442044010015,
"loss": 5.632,
"mean_token_accuracy": 0.21534291952848433,
"num_tokens": 50209549.0,
"step": 19810
},
{
"entropy": 6.359181070327759,
"epoch": 2.2867859203693017,
"grad_norm": 1.0,
"learning_rate": 0.0004485179382664904,
"loss": 5.7947,
"mean_token_accuracy": 0.19366897642612457,
"num_tokens": 50220691.0,
"step": 19815
},
{
"entropy": 6.368267250061035,
"epoch": 2.2873629544143106,
"grad_norm": 0.953125,
"learning_rate": 0.0004484916662957896,
"loss": 5.7792,
"mean_token_accuracy": 0.19695059061050416,
"num_tokens": 50233003.0,
"step": 19820
},
{
"entropy": 6.260522842407227,
"epoch": 2.287939988459319,
"grad_norm": 0.9921875,
"learning_rate": 0.0004484653884897829,
"loss": 5.6793,
"mean_token_accuracy": 0.1978773593902588,
"num_tokens": 50244742.0,
"step": 19825
},
{
"entropy": 6.151585578918457,
"epoch": 2.288517022504328,
"grad_norm": 1.09375,
"learning_rate": 0.00044843910484935394,
"loss": 5.5735,
"mean_token_accuracy": 0.2117750972509384,
"num_tokens": 50258188.0,
"step": 19830
},
{
"entropy": 6.287138366699219,
"epoch": 2.2890940565493363,
"grad_norm": 0.984375,
"learning_rate": 0.0004484128153753868,
"loss": 5.7306,
"mean_token_accuracy": 0.20295771360397338,
"num_tokens": 50271155.0,
"step": 19835
},
{
"entropy": 6.346404504776001,
"epoch": 2.289671090594345,
"grad_norm": 0.8828125,
"learning_rate": 0.00044838652006876583,
"loss": 5.7226,
"mean_token_accuracy": 0.20089610815048217,
"num_tokens": 50283518.0,
"step": 19840
},
{
"entropy": 6.179970598220825,
"epoch": 2.2902481246393536,
"grad_norm": 0.98828125,
"learning_rate": 0.00044836021893037537,
"loss": 5.6065,
"mean_token_accuracy": 0.21166497617959976,
"num_tokens": 50296208.0,
"step": 19845
},
{
"entropy": 6.183140087127685,
"epoch": 2.2908251586843624,
"grad_norm": 0.9296875,
"learning_rate": 0.0004483339119611001,
"loss": 5.62,
"mean_token_accuracy": 0.21188974529504775,
"num_tokens": 50309111.0,
"step": 19850
},
{
"entropy": 6.266731452941895,
"epoch": 2.291402192729371,
"grad_norm": 0.94140625,
"learning_rate": 0.00044830759916182476,
"loss": 5.7215,
"mean_token_accuracy": 0.19990355223417283,
"num_tokens": 50321895.0,
"step": 19855
},
{
"entropy": 6.300902700424194,
"epoch": 2.2919792267743797,
"grad_norm": 0.99609375,
"learning_rate": 0.0004482812805334344,
"loss": 5.7463,
"mean_token_accuracy": 0.19138864129781724,
"num_tokens": 50335769.0,
"step": 19860
},
{
"entropy": 6.308612489700318,
"epoch": 2.2925562608193886,
"grad_norm": 0.984375,
"learning_rate": 0.0004482549560768142,
"loss": 5.6856,
"mean_token_accuracy": 0.20473549962043763,
"num_tokens": 50348576.0,
"step": 19865
},
{
"entropy": 6.246194124221802,
"epoch": 2.293133294864397,
"grad_norm": 1.0,
"learning_rate": 0.0004482286257928497,
"loss": 5.7056,
"mean_token_accuracy": 0.1999507576227188,
"num_tokens": 50360652.0,
"step": 19870
},
{
"entropy": 6.179588699340821,
"epoch": 2.293710328909406,
"grad_norm": 1.0,
"learning_rate": 0.0004482022896824263,
"loss": 5.6761,
"mean_token_accuracy": 0.19982111304998398,
"num_tokens": 50373256.0,
"step": 19875
},
{
"entropy": 6.262630033493042,
"epoch": 2.2942873629544143,
"grad_norm": 0.9453125,
"learning_rate": 0.00044817594774643004,
"loss": 5.6015,
"mean_token_accuracy": 0.20998111516237258,
"num_tokens": 50385245.0,
"step": 19880
},
{
"entropy": 6.278105211257935,
"epoch": 2.294864396999423,
"grad_norm": 0.96875,
"learning_rate": 0.00044814959998574675,
"loss": 5.7173,
"mean_token_accuracy": 0.19566212147474288,
"num_tokens": 50397276.0,
"step": 19885
},
{
"entropy": 6.310760498046875,
"epoch": 2.2954414310444315,
"grad_norm": 0.95703125,
"learning_rate": 0.00044812324640126265,
"loss": 5.7995,
"mean_token_accuracy": 0.19371946156024933,
"num_tokens": 50409725.0,
"step": 19890
},
{
"entropy": 6.30986967086792,
"epoch": 2.2960184650894404,
"grad_norm": 1.046875,
"learning_rate": 0.0004480968869938642,
"loss": 5.7358,
"mean_token_accuracy": 0.19498946964740754,
"num_tokens": 50421987.0,
"step": 19895
},
{
"entropy": 6.255093336105347,
"epoch": 2.296595499134449,
"grad_norm": 0.86328125,
"learning_rate": 0.00044807052176443793,
"loss": 5.6393,
"mean_token_accuracy": 0.21141475737094878,
"num_tokens": 50436153.0,
"step": 19900
},
{
"entropy": 6.2507484436035154,
"epoch": 2.2971725331794577,
"grad_norm": 0.92578125,
"learning_rate": 0.00044804415071387067,
"loss": 5.7516,
"mean_token_accuracy": 0.20144218802452088,
"num_tokens": 50449683.0,
"step": 19905
},
{
"entropy": 6.172179746627807,
"epoch": 2.297749567224466,
"grad_norm": 0.98046875,
"learning_rate": 0.0004480177738430492,
"loss": 5.5576,
"mean_token_accuracy": 0.21170271188020706,
"num_tokens": 50461535.0,
"step": 19910
},
{
"entropy": 6.247416591644287,
"epoch": 2.298326601269475,
"grad_norm": 0.921875,
"learning_rate": 0.00044799139115286104,
"loss": 5.6759,
"mean_token_accuracy": 0.1969045430421829,
"num_tokens": 50476094.0,
"step": 19915
},
{
"entropy": 6.292913627624512,
"epoch": 2.2989036353144834,
"grad_norm": 1.015625,
"learning_rate": 0.0004479650026441933,
"loss": 5.6821,
"mean_token_accuracy": 0.19706797301769258,
"num_tokens": 50488751.0,
"step": 19920
},
{
"entropy": 6.302343368530273,
"epoch": 2.2994806693594922,
"grad_norm": 1.265625,
"learning_rate": 0.00044793860831793356,
"loss": 5.667,
"mean_token_accuracy": 0.20249564349651336,
"num_tokens": 50502272.0,
"step": 19925
},
{
"entropy": 6.268003511428833,
"epoch": 2.3000577034045007,
"grad_norm": 1.0078125,
"learning_rate": 0.00044791220817496963,
"loss": 5.6962,
"mean_token_accuracy": 0.19340673238039016,
"num_tokens": 50514792.0,
"step": 19930
},
{
"entropy": 6.189672327041626,
"epoch": 2.3006347374495095,
"grad_norm": 0.93359375,
"learning_rate": 0.0004478858022161895,
"loss": 5.6096,
"mean_token_accuracy": 0.2113632693886757,
"num_tokens": 50528484.0,
"step": 19935
},
{
"entropy": 6.3625153541564945,
"epoch": 2.3012117714945184,
"grad_norm": 0.98828125,
"learning_rate": 0.0004478593904424813,
"loss": 5.7847,
"mean_token_accuracy": 0.1942471295595169,
"num_tokens": 50540737.0,
"step": 19940
},
{
"entropy": 6.25290060043335,
"epoch": 2.301788805539527,
"grad_norm": 0.9453125,
"learning_rate": 0.0004478329728547334,
"loss": 5.6936,
"mean_token_accuracy": 0.20512138158082963,
"num_tokens": 50553819.0,
"step": 19945
},
{
"entropy": 6.2829841613769535,
"epoch": 2.3023658395845357,
"grad_norm": 0.9609375,
"learning_rate": 0.00044780654945383424,
"loss": 5.7354,
"mean_token_accuracy": 0.2017420634627342,
"num_tokens": 50566275.0,
"step": 19950
},
{
"entropy": 6.278318548202515,
"epoch": 2.302942873629544,
"grad_norm": 1.0546875,
"learning_rate": 0.00044778012024067267,
"loss": 5.681,
"mean_token_accuracy": 0.20539594292640687,
"num_tokens": 50577653.0,
"step": 19955
},
{
"entropy": 6.310393190383911,
"epoch": 2.303519907674553,
"grad_norm": 1.0234375,
"learning_rate": 0.0004477536852161376,
"loss": 5.7271,
"mean_token_accuracy": 0.1932803899049759,
"num_tokens": 50590237.0,
"step": 19960
},
{
"entropy": 6.186036014556885,
"epoch": 2.3040969417195614,
"grad_norm": 1.0390625,
"learning_rate": 0.0004477272443811181,
"loss": 5.6042,
"mean_token_accuracy": 0.19824027866125107,
"num_tokens": 50602333.0,
"step": 19965
},
{
"entropy": 6.335505819320678,
"epoch": 2.3046739757645702,
"grad_norm": 0.97265625,
"learning_rate": 0.0004477007977365035,
"loss": 5.7524,
"mean_token_accuracy": 0.19401074647903443,
"num_tokens": 50614232.0,
"step": 19970
},
{
"entropy": 6.3040093898773195,
"epoch": 2.3052510098095786,
"grad_norm": 0.98046875,
"learning_rate": 0.0004476743452831834,
"loss": 5.6889,
"mean_token_accuracy": 0.2003216937184334,
"num_tokens": 50627959.0,
"step": 19975
},
{
"entropy": 6.198862886428833,
"epoch": 2.3058280438545875,
"grad_norm": 1.0234375,
"learning_rate": 0.00044764788702204747,
"loss": 5.587,
"mean_token_accuracy": 0.21014727056026458,
"num_tokens": 50639962.0,
"step": 19980
},
{
"entropy": 6.264612627029419,
"epoch": 2.306405077899596,
"grad_norm": 0.91015625,
"learning_rate": 0.0004476214229539856,
"loss": 5.6996,
"mean_token_accuracy": 0.20357227176427842,
"num_tokens": 50652291.0,
"step": 19985
},
{
"entropy": 6.288990640640259,
"epoch": 2.306982111944605,
"grad_norm": 0.97265625,
"learning_rate": 0.0004475949530798879,
"loss": 5.6989,
"mean_token_accuracy": 0.19868904054164888,
"num_tokens": 50664993.0,
"step": 19990
},
{
"entropy": 6.187899351119995,
"epoch": 2.307559145989613,
"grad_norm": 1.03125,
"learning_rate": 0.00044756847740064475,
"loss": 5.5424,
"mean_token_accuracy": 0.19761182218790055,
"num_tokens": 50677846.0,
"step": 19995
},
{
"entropy": 6.221263217926025,
"epoch": 2.308136180034622,
"grad_norm": 0.9140625,
"learning_rate": 0.0004475419959171465,
"loss": 5.6128,
"mean_token_accuracy": 0.21344971507787705,
"num_tokens": 50691068.0,
"step": 20000
},
{
"entropy": 6.230750799179077,
"epoch": 2.3087132140796305,
"grad_norm": 0.953125,
"learning_rate": 0.000447515508630284,
"loss": 5.6977,
"mean_token_accuracy": 0.20123774111270903,
"num_tokens": 50703663.0,
"step": 20005
},
{
"entropy": 6.312432861328125,
"epoch": 2.3092902481246393,
"grad_norm": 0.95703125,
"learning_rate": 0.00044748901554094806,
"loss": 5.6947,
"mean_token_accuracy": 0.20297775119543077,
"num_tokens": 50715709.0,
"step": 20010
},
{
"entropy": 6.248737716674805,
"epoch": 2.309867282169648,
"grad_norm": 0.96875,
"learning_rate": 0.0004474625166500297,
"loss": 5.6769,
"mean_token_accuracy": 0.2087046891450882,
"num_tokens": 50727700.0,
"step": 20015
},
{
"entropy": 6.259288597106933,
"epoch": 2.3104443162146566,
"grad_norm": 1.015625,
"learning_rate": 0.00044743601195842026,
"loss": 5.6259,
"mean_token_accuracy": 0.20704087764024734,
"num_tokens": 50740604.0,
"step": 20020
},
{
"entropy": 6.351035213470459,
"epoch": 2.3110213502596655,
"grad_norm": 0.984375,
"learning_rate": 0.00044740950146701127,
"loss": 5.774,
"mean_token_accuracy": 0.1978513553738594,
"num_tokens": 50753666.0,
"step": 20025
},
{
"entropy": 6.229120397567749,
"epoch": 2.311598384304674,
"grad_norm": 0.92578125,
"learning_rate": 0.0004473829851766943,
"loss": 5.7331,
"mean_token_accuracy": 0.1979401797056198,
"num_tokens": 50766324.0,
"step": 20030
},
{
"entropy": 6.312212944030762,
"epoch": 2.3121754183496828,
"grad_norm": 1.0078125,
"learning_rate": 0.0004473564630883612,
"loss": 5.7301,
"mean_token_accuracy": 0.2022898778319359,
"num_tokens": 50779037.0,
"step": 20035
},
{
"entropy": 6.262638854980469,
"epoch": 2.312752452394691,
"grad_norm": 0.95703125,
"learning_rate": 0.0004473299352029042,
"loss": 5.6611,
"mean_token_accuracy": 0.20583394020795823,
"num_tokens": 50791089.0,
"step": 20040
},
{
"entropy": 6.221489095687867,
"epoch": 2.3133294864397,
"grad_norm": 0.97265625,
"learning_rate": 0.0004473034015212154,
"loss": 5.6526,
"mean_token_accuracy": 0.1966189831495285,
"num_tokens": 50803608.0,
"step": 20045
},
{
"entropy": 6.242483282089234,
"epoch": 2.3139065204847085,
"grad_norm": 0.9453125,
"learning_rate": 0.0004472768620441872,
"loss": 5.6904,
"mean_token_accuracy": 0.19912586808204652,
"num_tokens": 50815712.0,
"step": 20050
},
{
"entropy": 6.3092294216156,
"epoch": 2.3144835545297173,
"grad_norm": 0.97265625,
"learning_rate": 0.00044725031677271234,
"loss": 5.6188,
"mean_token_accuracy": 0.2108631983399391,
"num_tokens": 50827409.0,
"step": 20055
},
{
"entropy": 6.226622200012207,
"epoch": 2.3150605885747257,
"grad_norm": 0.94921875,
"learning_rate": 0.0004472237657076837,
"loss": 5.6465,
"mean_token_accuracy": 0.20455507636070253,
"num_tokens": 50840901.0,
"step": 20060
},
{
"entropy": 6.299163818359375,
"epoch": 2.3156376226197346,
"grad_norm": 0.96484375,
"learning_rate": 0.0004471972088499942,
"loss": 5.7315,
"mean_token_accuracy": 0.1961276039481163,
"num_tokens": 50854453.0,
"step": 20065
},
{
"entropy": 6.350008344650268,
"epoch": 2.3162146566647435,
"grad_norm": 0.96484375,
"learning_rate": 0.0004471706462005371,
"loss": 5.6954,
"mean_token_accuracy": 0.19643843322992324,
"num_tokens": 50866566.0,
"step": 20070
},
{
"entropy": 6.212463426589966,
"epoch": 2.316791690709752,
"grad_norm": 1.1484375,
"learning_rate": 0.0004471440777602059,
"loss": 5.6575,
"mean_token_accuracy": 0.20321660935878755,
"num_tokens": 50879695.0,
"step": 20075
},
{
"entropy": 6.194079113006592,
"epoch": 2.3173687247547603,
"grad_norm": 0.9765625,
"learning_rate": 0.00044711750352989407,
"loss": 5.5996,
"mean_token_accuracy": 0.20679421722888947,
"num_tokens": 50892350.0,
"step": 20080
},
{
"entropy": 6.2928242683410645,
"epoch": 2.317945758799769,
"grad_norm": 0.953125,
"learning_rate": 0.0004470909235104956,
"loss": 5.7393,
"mean_token_accuracy": 0.2002371221780777,
"num_tokens": 50905899.0,
"step": 20085
},
{
"entropy": 6.287396478652954,
"epoch": 2.318522792844778,
"grad_norm": 0.9140625,
"learning_rate": 0.0004470643377029043,
"loss": 5.6599,
"mean_token_accuracy": 0.20983583927154542,
"num_tokens": 50919698.0,
"step": 20090
},
{
"entropy": 6.309205389022827,
"epoch": 2.3190998268897864,
"grad_norm": 0.96875,
"learning_rate": 0.0004470377461080145,
"loss": 5.744,
"mean_token_accuracy": 0.20514176189899444,
"num_tokens": 50932236.0,
"step": 20095
},
{
"entropy": 6.264718341827392,
"epoch": 2.3196768609347953,
"grad_norm": 0.8984375,
"learning_rate": 0.0004470111487267206,
"loss": 5.6731,
"mean_token_accuracy": 0.20396852046251296,
"num_tokens": 50945403.0,
"step": 20100
},
{
"entropy": 6.269400930404663,
"epoch": 2.3202538949798037,
"grad_norm": 0.99609375,
"learning_rate": 0.0004469845455599171,
"loss": 5.6767,
"mean_token_accuracy": 0.19957065880298613,
"num_tokens": 50958854.0,
"step": 20105
},
{
"entropy": 6.345641183853149,
"epoch": 2.3208309290248126,
"grad_norm": 1.0234375,
"learning_rate": 0.0004469579366084989,
"loss": 5.7477,
"mean_token_accuracy": 0.19639746844768524,
"num_tokens": 50971545.0,
"step": 20110
},
{
"entropy": 6.304386758804322,
"epoch": 2.321407963069821,
"grad_norm": 0.9453125,
"learning_rate": 0.00044693132187336094,
"loss": 5.7429,
"mean_token_accuracy": 0.19700338542461396,
"num_tokens": 50985282.0,
"step": 20115
},
{
"entropy": 6.257296991348267,
"epoch": 2.32198499711483,
"grad_norm": 0.94140625,
"learning_rate": 0.0004469047013553983,
"loss": 5.6737,
"mean_token_accuracy": 0.20432363003492354,
"num_tokens": 50998063.0,
"step": 20120
},
{
"entropy": 6.239012908935547,
"epoch": 2.3225620311598383,
"grad_norm": 0.921875,
"learning_rate": 0.00044687807505550646,
"loss": 5.6595,
"mean_token_accuracy": 0.20608614087104798,
"num_tokens": 51011413.0,
"step": 20125
},
{
"entropy": 6.223509073257446,
"epoch": 2.323139065204847,
"grad_norm": 0.94140625,
"learning_rate": 0.00044685144297458096,
"loss": 5.6548,
"mean_token_accuracy": 0.20884050726890563,
"num_tokens": 51023861.0,
"step": 20130
},
{
"entropy": 6.280037975311279,
"epoch": 2.3237160992498556,
"grad_norm": 0.953125,
"learning_rate": 0.00044682480511351754,
"loss": 5.6432,
"mean_token_accuracy": 0.20675942450761794,
"num_tokens": 51035891.0,
"step": 20135
},
{
"entropy": 6.2503454208374025,
"epoch": 2.3242931332948644,
"grad_norm": 1.0078125,
"learning_rate": 0.0004467981614732121,
"loss": 5.6414,
"mean_token_accuracy": 0.2052238777279854,
"num_tokens": 51048115.0,
"step": 20140
},
{
"entropy": 6.263721990585327,
"epoch": 2.3248701673398733,
"grad_norm": 0.921875,
"learning_rate": 0.00044677151205456086,
"loss": 5.6669,
"mean_token_accuracy": 0.19978864639997482,
"num_tokens": 51061503.0,
"step": 20145
},
{
"entropy": 6.283975648880005,
"epoch": 2.3254472013848817,
"grad_norm": 0.97265625,
"learning_rate": 0.0004467448568584601,
"loss": 5.7173,
"mean_token_accuracy": 0.2011381208896637,
"num_tokens": 51074052.0,
"step": 20150
},
{
"entropy": 6.3093095302581785,
"epoch": 2.32602423542989,
"grad_norm": 0.875,
"learning_rate": 0.0004467181958858064,
"loss": 5.7431,
"mean_token_accuracy": 0.20208009481430053,
"num_tokens": 51089456.0,
"step": 20155
},
{
"entropy": 6.306753873825073,
"epoch": 2.326601269474899,
"grad_norm": 0.97265625,
"learning_rate": 0.0004466915291374965,
"loss": 5.7069,
"mean_token_accuracy": 0.19960661828517914,
"num_tokens": 51102835.0,
"step": 20160
},
{
"entropy": 6.306112909317017,
"epoch": 2.327178303519908,
"grad_norm": 0.92578125,
"learning_rate": 0.0004466648566144273,
"loss": 5.7314,
"mean_token_accuracy": 0.19776588380336763,
"num_tokens": 51115472.0,
"step": 20165
},
{
"entropy": 6.299116325378418,
"epoch": 2.3277553375649163,
"grad_norm": 1.078125,
"learning_rate": 0.000446638178317496,
"loss": 5.6569,
"mean_token_accuracy": 0.2033730775117874,
"num_tokens": 51129768.0,
"step": 20170
},
{
"entropy": 6.275330448150635,
"epoch": 2.328332371609925,
"grad_norm": 0.9375,
"learning_rate": 0.00044661149424759974,
"loss": 5.6706,
"mean_token_accuracy": 0.20418451279401778,
"num_tokens": 51143517.0,
"step": 20175
},
{
"entropy": 6.206835556030273,
"epoch": 2.3289094056549335,
"grad_norm": 1.21875,
"learning_rate": 0.0004465848044056361,
"loss": 5.5095,
"mean_token_accuracy": 0.21552657186985016,
"num_tokens": 51157235.0,
"step": 20180
},
{
"entropy": 6.281242322921753,
"epoch": 2.3294864396999424,
"grad_norm": 0.92578125,
"learning_rate": 0.0004465581087925028,
"loss": 5.6846,
"mean_token_accuracy": 0.20341511964797973,
"num_tokens": 51169061.0,
"step": 20185
},
{
"entropy": 6.2411112785339355,
"epoch": 2.330063473744951,
"grad_norm": 1.1171875,
"learning_rate": 0.0004465314074090978,
"loss": 5.6873,
"mean_token_accuracy": 0.19719644337892533,
"num_tokens": 51181063.0,
"step": 20190
},
{
"entropy": 6.25082573890686,
"epoch": 2.3306405077899597,
"grad_norm": 0.9609375,
"learning_rate": 0.00044650470025631904,
"loss": 5.6214,
"mean_token_accuracy": 0.20618860125541688,
"num_tokens": 51193536.0,
"step": 20195
},
{
"entropy": 6.234523773193359,
"epoch": 2.331217541834968,
"grad_norm": 0.96484375,
"learning_rate": 0.0004464779873350649,
"loss": 5.6142,
"mean_token_accuracy": 0.21316068172454833,
"num_tokens": 51205960.0,
"step": 20200
},
{
"entropy": 6.296325969696045,
"epoch": 2.331794575879977,
"grad_norm": 0.921875,
"learning_rate": 0.0004464512686462339,
"loss": 5.7834,
"mean_token_accuracy": 0.20003315955400466,
"num_tokens": 51219227.0,
"step": 20205
},
{
"entropy": 6.323716688156128,
"epoch": 2.3323716099249854,
"grad_norm": 0.9453125,
"learning_rate": 0.00044642454419072455,
"loss": 5.6514,
"mean_token_accuracy": 0.2024744465947151,
"num_tokens": 51232781.0,
"step": 20210
},
{
"entropy": 6.2382483959198,
"epoch": 2.3329486439699942,
"grad_norm": 0.97265625,
"learning_rate": 0.0004463978139694358,
"loss": 5.6744,
"mean_token_accuracy": 0.20180849730968475,
"num_tokens": 51245574.0,
"step": 20215
},
{
"entropy": 6.261038494110108,
"epoch": 2.333525678015003,
"grad_norm": 0.953125,
"learning_rate": 0.00044637107798326675,
"loss": 5.7009,
"mean_token_accuracy": 0.1989492028951645,
"num_tokens": 51258710.0,
"step": 20220
},
{
"entropy": 6.362938356399536,
"epoch": 2.3341027120600115,
"grad_norm": 0.95703125,
"learning_rate": 0.0004463443362331166,
"loss": 5.7797,
"mean_token_accuracy": 0.20133419930934907,
"num_tokens": 51270382.0,
"step": 20225
},
{
"entropy": 6.2769464492797855,
"epoch": 2.3346797461050204,
"grad_norm": 0.9296875,
"learning_rate": 0.00044631758871988486,
"loss": 5.7646,
"mean_token_accuracy": 0.19585290253162385,
"num_tokens": 51283923.0,
"step": 20230
},
{
"entropy": 6.329458999633789,
"epoch": 2.335256780150029,
"grad_norm": 1.171875,
"learning_rate": 0.0004462908354444711,
"loss": 5.7254,
"mean_token_accuracy": 0.1990818738937378,
"num_tokens": 51297671.0,
"step": 20235
},
{
"entropy": 6.3086357593536375,
"epoch": 2.3358338141950377,
"grad_norm": 0.91796875,
"learning_rate": 0.0004462640764077751,
"loss": 5.6835,
"mean_token_accuracy": 0.2007381275296211,
"num_tokens": 51309339.0,
"step": 20240
},
{
"entropy": 6.273665523529052,
"epoch": 2.336410848240046,
"grad_norm": 0.953125,
"learning_rate": 0.0004462373116106971,
"loss": 5.7941,
"mean_token_accuracy": 0.1993747517466545,
"num_tokens": 51321479.0,
"step": 20245
},
{
"entropy": 6.256979846954346,
"epoch": 2.336987882285055,
"grad_norm": 0.984375,
"learning_rate": 0.00044621054105413704,
"loss": 5.7192,
"mean_token_accuracy": 0.19843647629022598,
"num_tokens": 51335135.0,
"step": 20250
},
{
"entropy": 6.226361513137817,
"epoch": 2.3375649163300634,
"grad_norm": 1.0234375,
"learning_rate": 0.00044618376473899555,
"loss": 5.6681,
"mean_token_accuracy": 0.20416603982448578,
"num_tokens": 51346556.0,
"step": 20255
},
{
"entropy": 6.18687252998352,
"epoch": 2.338141950375072,
"grad_norm": 1.734375,
"learning_rate": 0.0004461569826661732,
"loss": 5.5636,
"mean_token_accuracy": 0.21304285377264023,
"num_tokens": 51359692.0,
"step": 20260
},
{
"entropy": 6.295094442367554,
"epoch": 2.3387189844200806,
"grad_norm": 0.98828125,
"learning_rate": 0.0004461301948365707,
"loss": 5.6772,
"mean_token_accuracy": 0.19782449454069137,
"num_tokens": 51371682.0,
"step": 20265
},
{
"entropy": 6.272954797744751,
"epoch": 2.3392960184650895,
"grad_norm": 1.0390625,
"learning_rate": 0.0004461034012510891,
"loss": 5.725,
"mean_token_accuracy": 0.20265191793441772,
"num_tokens": 51383533.0,
"step": 20270
},
{
"entropy": 6.267000722885132,
"epoch": 2.339873052510098,
"grad_norm": 0.94921875,
"learning_rate": 0.00044607660191062963,
"loss": 5.6615,
"mean_token_accuracy": 0.20510787516832352,
"num_tokens": 51395696.0,
"step": 20275
},
{
"entropy": 6.215906572341919,
"epoch": 2.340450086555107,
"grad_norm": 1.0,
"learning_rate": 0.00044604979681609364,
"loss": 5.6255,
"mean_token_accuracy": 0.20820956826210021,
"num_tokens": 51408460.0,
"step": 20280
},
{
"entropy": 6.187142848968506,
"epoch": 2.341027120600115,
"grad_norm": 0.93359375,
"learning_rate": 0.00044602298596838264,
"loss": 5.619,
"mean_token_accuracy": 0.20651773512363433,
"num_tokens": 51420768.0,
"step": 20285
},
{
"entropy": 6.261281728744507,
"epoch": 2.341604154645124,
"grad_norm": 0.88671875,
"learning_rate": 0.00044599616936839853,
"loss": 5.6743,
"mean_token_accuracy": 0.20559660345315933,
"num_tokens": 51434429.0,
"step": 20290
},
{
"entropy": 6.310505104064942,
"epoch": 2.342181188690133,
"grad_norm": 0.98828125,
"learning_rate": 0.0004459693470170432,
"loss": 5.7352,
"mean_token_accuracy": 0.20220571756362915,
"num_tokens": 51447146.0,
"step": 20295
},
{
"entropy": 6.275731611251831,
"epoch": 2.3427582227351413,
"grad_norm": 1.0078125,
"learning_rate": 0.0004459425189152187,
"loss": 5.6227,
"mean_token_accuracy": 0.20923758745193483,
"num_tokens": 51458656.0,
"step": 20300
},
{
"entropy": 6.15320463180542,
"epoch": 2.34333525678015,
"grad_norm": 0.90625,
"learning_rate": 0.00044591568506382757,
"loss": 5.5173,
"mean_token_accuracy": 0.21781913489103316,
"num_tokens": 51473350.0,
"step": 20305
},
{
"entropy": 6.280113744735718,
"epoch": 2.3439122908251586,
"grad_norm": 0.8984375,
"learning_rate": 0.00044588884546377226,
"loss": 5.6646,
"mean_token_accuracy": 0.2047184869647026,
"num_tokens": 51486801.0,
"step": 20310
},
{
"entropy": 6.246380805969238,
"epoch": 2.3444893248701675,
"grad_norm": 0.96875,
"learning_rate": 0.0004458620001159555,
"loss": 5.6899,
"mean_token_accuracy": 0.2027744859457016,
"num_tokens": 51499217.0,
"step": 20315
},
{
"entropy": 6.26472282409668,
"epoch": 2.345066358915176,
"grad_norm": 1.0546875,
"learning_rate": 0.0004458351490212803,
"loss": 5.7649,
"mean_token_accuracy": 0.19978072494268417,
"num_tokens": 51511714.0,
"step": 20320
},
{
"entropy": 6.229470682144165,
"epoch": 2.3456433929601848,
"grad_norm": 0.9765625,
"learning_rate": 0.00044580829218064964,
"loss": 5.6106,
"mean_token_accuracy": 0.20698875188827515,
"num_tokens": 51522725.0,
"step": 20325
},
{
"entropy": 6.3298228740692135,
"epoch": 2.346220427005193,
"grad_norm": 1.015625,
"learning_rate": 0.000445781429594967,
"loss": 5.6844,
"mean_token_accuracy": 0.20495259165763854,
"num_tokens": 51535178.0,
"step": 20330
},
{
"entropy": 6.310057067871094,
"epoch": 2.346797461050202,
"grad_norm": 1.078125,
"learning_rate": 0.0004457545612651357,
"loss": 5.7986,
"mean_token_accuracy": 0.1921558916568756,
"num_tokens": 51546859.0,
"step": 20335
},
{
"entropy": 6.307834815979004,
"epoch": 2.3473744950952105,
"grad_norm": 0.96875,
"learning_rate": 0.00044572768719205964,
"loss": 5.6828,
"mean_token_accuracy": 0.20095667690038682,
"num_tokens": 51558719.0,
"step": 20340
},
{
"entropy": 6.312375783920288,
"epoch": 2.3479515291402193,
"grad_norm": 0.953125,
"learning_rate": 0.00044570080737664264,
"loss": 5.7476,
"mean_token_accuracy": 0.1949980840086937,
"num_tokens": 51570630.0,
"step": 20345
},
{
"entropy": 6.309825801849366,
"epoch": 2.3485285631852277,
"grad_norm": 0.9921875,
"learning_rate": 0.00044567392181978874,
"loss": 5.6623,
"mean_token_accuracy": 0.1984606221318245,
"num_tokens": 51583463.0,
"step": 20350
},
{
"entropy": 6.279160451889038,
"epoch": 2.3491055972302366,
"grad_norm": 0.9296875,
"learning_rate": 0.00044564703052240223,
"loss": 5.7259,
"mean_token_accuracy": 0.19899120777845383,
"num_tokens": 51597090.0,
"step": 20355
},
{
"entropy": 6.219781351089478,
"epoch": 2.349682631275245,
"grad_norm": 0.9765625,
"learning_rate": 0.0004456201334853876,
"loss": 5.6265,
"mean_token_accuracy": 0.20903219729661943,
"num_tokens": 51609288.0,
"step": 20360
},
{
"entropy": 6.171813535690307,
"epoch": 2.350259665320254,
"grad_norm": 0.9375,
"learning_rate": 0.00044559323070964956,
"loss": 5.611,
"mean_token_accuracy": 0.2132205694913864,
"num_tokens": 51622269.0,
"step": 20365
},
{
"entropy": 6.281157636642456,
"epoch": 2.3508366993652627,
"grad_norm": 1.1171875,
"learning_rate": 0.000445566322196093,
"loss": 5.7412,
"mean_token_accuracy": 0.19239043891429902,
"num_tokens": 51634222.0,
"step": 20370
},
{
"entropy": 6.292509889602661,
"epoch": 2.351413733410271,
"grad_norm": 0.921875,
"learning_rate": 0.0004455394079456228,
"loss": 5.7057,
"mean_token_accuracy": 0.19713842421770095,
"num_tokens": 51646933.0,
"step": 20375
},
{
"entropy": 6.2920444965362545,
"epoch": 2.35199076745528,
"grad_norm": 1.0234375,
"learning_rate": 0.00044551248795914446,
"loss": 5.6773,
"mean_token_accuracy": 0.20137425810098647,
"num_tokens": 51658987.0,
"step": 20380
},
{
"entropy": 6.240331506729126,
"epoch": 2.3525678015002884,
"grad_norm": 1.0859375,
"learning_rate": 0.0004454855622375632,
"loss": 5.7234,
"mean_token_accuracy": 0.20117460191249847,
"num_tokens": 51669513.0,
"step": 20385
},
{
"entropy": 6.302077150344848,
"epoch": 2.3531448355452973,
"grad_norm": 0.9921875,
"learning_rate": 0.0004454586307817848,
"loss": 5.6721,
"mean_token_accuracy": 0.20111125260591506,
"num_tokens": 51682084.0,
"step": 20390
},
{
"entropy": 6.271924304962158,
"epoch": 2.3537218695903057,
"grad_norm": 0.95703125,
"learning_rate": 0.000445431693592715,
"loss": 5.7122,
"mean_token_accuracy": 0.20097984075546266,
"num_tokens": 51695335.0,
"step": 20395
},
{
"entropy": 6.301687812805175,
"epoch": 2.3542989036353146,
"grad_norm": 1.015625,
"learning_rate": 0.0004454047506712598,
"loss": 5.7827,
"mean_token_accuracy": 0.19593358039855957,
"num_tokens": 51707856.0,
"step": 20400
},
{
"entropy": 6.273509550094604,
"epoch": 2.354875937680323,
"grad_norm": 1.015625,
"learning_rate": 0.00044537780201832545,
"loss": 5.677,
"mean_token_accuracy": 0.1995402529835701,
"num_tokens": 51719716.0,
"step": 20405
},
{
"entropy": 6.19102635383606,
"epoch": 2.355452971725332,
"grad_norm": 0.9375,
"learning_rate": 0.0004453508476348184,
"loss": 5.6402,
"mean_token_accuracy": 0.21555724292993544,
"num_tokens": 51733263.0,
"step": 20410
},
{
"entropy": 6.248130130767822,
"epoch": 2.3560300057703403,
"grad_norm": 0.9765625,
"learning_rate": 0.0004453238875216452,
"loss": 5.6175,
"mean_token_accuracy": 0.20646194070577623,
"num_tokens": 51745143.0,
"step": 20415
},
{
"entropy": 6.306704330444336,
"epoch": 2.356607039815349,
"grad_norm": 0.96484375,
"learning_rate": 0.0004452969216797127,
"loss": 5.7435,
"mean_token_accuracy": 0.19763799011707306,
"num_tokens": 51757155.0,
"step": 20420
},
{
"entropy": 6.18883695602417,
"epoch": 2.357184073860358,
"grad_norm": 0.94921875,
"learning_rate": 0.0004452699501099277,
"loss": 5.6381,
"mean_token_accuracy": 0.20822127610445024,
"num_tokens": 51769170.0,
"step": 20425
},
{
"entropy": 6.280981349945068,
"epoch": 2.3577611079053664,
"grad_norm": 0.984375,
"learning_rate": 0.00044524297281319766,
"loss": 5.7259,
"mean_token_accuracy": 0.1986905887722969,
"num_tokens": 51781254.0,
"step": 20430
},
{
"entropy": 6.318002128601075,
"epoch": 2.358338141950375,
"grad_norm": 0.91015625,
"learning_rate": 0.00044521598979042963,
"loss": 5.7523,
"mean_token_accuracy": 0.1985146164894104,
"num_tokens": 51793425.0,
"step": 20435
},
{
"entropy": 6.250660800933838,
"epoch": 2.3589151759953837,
"grad_norm": 0.96875,
"learning_rate": 0.00044518900104253154,
"loss": 5.6707,
"mean_token_accuracy": 0.20157449394464494,
"num_tokens": 51806196.0,
"step": 20440
},
{
"entropy": 6.210059547424317,
"epoch": 2.3594922100403926,
"grad_norm": 0.96875,
"learning_rate": 0.0004451620065704108,
"loss": 5.6892,
"mean_token_accuracy": 0.20226312130689622,
"num_tokens": 51819137.0,
"step": 20445
},
{
"entropy": 6.339330101013184,
"epoch": 2.360069244085401,
"grad_norm": 0.9765625,
"learning_rate": 0.00044513500637497546,
"loss": 5.7755,
"mean_token_accuracy": 0.19646340757608413,
"num_tokens": 51830924.0,
"step": 20450
},
{
"entropy": 6.3239030838012695,
"epoch": 2.36064627813041,
"grad_norm": 1.0078125,
"learning_rate": 0.00044510800045713373,
"loss": 5.66,
"mean_token_accuracy": 0.19947621822357178,
"num_tokens": 51843503.0,
"step": 20455
},
{
"entropy": 6.277648830413819,
"epoch": 2.3612233121754183,
"grad_norm": 1.0078125,
"learning_rate": 0.00044508098881779396,
"loss": 5.7303,
"mean_token_accuracy": 0.19973205924034118,
"num_tokens": 51855818.0,
"step": 20460
},
{
"entropy": 6.27275915145874,
"epoch": 2.361800346220427,
"grad_norm": 1.03125,
"learning_rate": 0.0004450539714578645,
"loss": 5.6837,
"mean_token_accuracy": 0.20204851776361465,
"num_tokens": 51867033.0,
"step": 20465
},
{
"entropy": 6.309321117401123,
"epoch": 2.3623773802654355,
"grad_norm": 1.0078125,
"learning_rate": 0.0004450269483782543,
"loss": 5.6707,
"mean_token_accuracy": 0.2012152075767517,
"num_tokens": 51880845.0,
"step": 20470
},
{
"entropy": 6.276156616210938,
"epoch": 2.3629544143104444,
"grad_norm": 0.9765625,
"learning_rate": 0.0004449999195798721,
"loss": 5.7645,
"mean_token_accuracy": 0.1931744247674942,
"num_tokens": 51893761.0,
"step": 20475
},
{
"entropy": 6.266883802413941,
"epoch": 2.363531448355453,
"grad_norm": 0.8984375,
"learning_rate": 0.00044497288506362706,
"loss": 5.6604,
"mean_token_accuracy": 0.20568044781684874,
"num_tokens": 51907478.0,
"step": 20480
},
{
"entropy": 6.320327377319336,
"epoch": 2.3641084824004617,
"grad_norm": 1.0,
"learning_rate": 0.0004449458448304284,
"loss": 5.6667,
"mean_token_accuracy": 0.21099235564470292,
"num_tokens": 51919242.0,
"step": 20485
},
{
"entropy": 6.3270317077636715,
"epoch": 2.36468551644547,
"grad_norm": 1.0546875,
"learning_rate": 0.00044491879888118574,
"loss": 5.7595,
"mean_token_accuracy": 0.19944236427545547,
"num_tokens": 51930791.0,
"step": 20490
},
{
"entropy": 6.123858451843262,
"epoch": 2.365262550490479,
"grad_norm": 0.96875,
"learning_rate": 0.0004448917472168087,
"loss": 5.5088,
"mean_token_accuracy": 0.21103607267141342,
"num_tokens": 51943848.0,
"step": 20495
},
{
"entropy": 6.274829006195068,
"epoch": 2.365839584535488,
"grad_norm": 0.98828125,
"learning_rate": 0.00044486468983820707,
"loss": 5.7413,
"mean_token_accuracy": 0.19155209511518478,
"num_tokens": 51956648.0,
"step": 20500
},
{
"entropy": 6.305342388153076,
"epoch": 2.3664166185804962,
"grad_norm": 0.96875,
"learning_rate": 0.000444837626746291,
"loss": 5.6963,
"mean_token_accuracy": 0.20333817601203918,
"num_tokens": 51969068.0,
"step": 20505
},
{
"entropy": 6.26474609375,
"epoch": 2.366993652625505,
"grad_norm": 1.0,
"learning_rate": 0.0004448105579419707,
"loss": 5.6934,
"mean_token_accuracy": 0.2022864505648613,
"num_tokens": 51981856.0,
"step": 20510
},
{
"entropy": 6.335216236114502,
"epoch": 2.3675706866705135,
"grad_norm": 0.94140625,
"learning_rate": 0.0004447834834261567,
"loss": 5.7573,
"mean_token_accuracy": 0.19250386953353882,
"num_tokens": 51994428.0,
"step": 20515
},
{
"entropy": 6.23250002861023,
"epoch": 2.3681477207155224,
"grad_norm": 0.9453125,
"learning_rate": 0.0004447564031997595,
"loss": 5.5865,
"mean_token_accuracy": 0.21269481927156447,
"num_tokens": 52007875.0,
"step": 20520
},
{
"entropy": 6.257858562469482,
"epoch": 2.368724754760531,
"grad_norm": 1.0546875,
"learning_rate": 0.00044472931726369,
"loss": 5.5938,
"mean_token_accuracy": 0.20823481380939485,
"num_tokens": 52020876.0,
"step": 20525
},
{
"entropy": 6.346431732177734,
"epoch": 2.3693017888055397,
"grad_norm": 1.5859375,
"learning_rate": 0.00044470222561885926,
"loss": 5.7454,
"mean_token_accuracy": 0.19151533842086793,
"num_tokens": 52032056.0,
"step": 20530
},
{
"entropy": 6.249010372161865,
"epoch": 2.369878822850548,
"grad_norm": 1.0,
"learning_rate": 0.00044467512826617845,
"loss": 5.6792,
"mean_token_accuracy": 0.19966776221990584,
"num_tokens": 52044488.0,
"step": 20535
},
{
"entropy": 6.271060562133789,
"epoch": 2.370455856895557,
"grad_norm": 0.984375,
"learning_rate": 0.00044464802520655897,
"loss": 5.749,
"mean_token_accuracy": 0.1937350869178772,
"num_tokens": 52056186.0,
"step": 20540
},
{
"entropy": 6.317001819610596,
"epoch": 2.3710328909405654,
"grad_norm": 1.0078125,
"learning_rate": 0.0004446209164409124,
"loss": 5.6653,
"mean_token_accuracy": 0.20406524538993837,
"num_tokens": 52068218.0,
"step": 20545
},
{
"entropy": 6.200478410720825,
"epoch": 2.371609924985574,
"grad_norm": 0.8515625,
"learning_rate": 0.0004445938019701506,
"loss": 5.6092,
"mean_token_accuracy": 0.21559022963047028,
"num_tokens": 52081854.0,
"step": 20550
},
{
"entropy": 6.200952386856079,
"epoch": 2.3721869590305826,
"grad_norm": 0.96484375,
"learning_rate": 0.0004445666817951855,
"loss": 5.6137,
"mean_token_accuracy": 0.20615407526493074,
"num_tokens": 52094022.0,
"step": 20555
},
{
"entropy": 6.251945877075196,
"epoch": 2.3727639930755915,
"grad_norm": 1.015625,
"learning_rate": 0.0004445395559169293,
"loss": 5.6581,
"mean_token_accuracy": 0.2025573045015335,
"num_tokens": 52105677.0,
"step": 20560
},
{
"entropy": 6.342857313156128,
"epoch": 2.3733410271206,
"grad_norm": 1.0,
"learning_rate": 0.0004445124243362943,
"loss": 5.7209,
"mean_token_accuracy": 0.19989970624446868,
"num_tokens": 52118039.0,
"step": 20565
},
{
"entropy": 6.2887485980987545,
"epoch": 2.3739180611656088,
"grad_norm": 1.0078125,
"learning_rate": 0.0004444852870541932,
"loss": 5.6851,
"mean_token_accuracy": 0.20365866869688035,
"num_tokens": 52131519.0,
"step": 20570
},
{
"entropy": 6.292483949661255,
"epoch": 2.3744950952106176,
"grad_norm": 1.0078125,
"learning_rate": 0.0004444581440715386,
"loss": 5.7147,
"mean_token_accuracy": 0.19802933037281037,
"num_tokens": 52143240.0,
"step": 20575
},
{
"entropy": 6.233852577209473,
"epoch": 2.375072129255626,
"grad_norm": 0.99609375,
"learning_rate": 0.00044443099538924347,
"loss": 5.6081,
"mean_token_accuracy": 0.20580997467041015,
"num_tokens": 52155977.0,
"step": 20580
},
{
"entropy": 6.2496278285980225,
"epoch": 2.375649163300635,
"grad_norm": 0.98046875,
"learning_rate": 0.0004444038410082211,
"loss": 5.6534,
"mean_token_accuracy": 0.2096467509865761,
"num_tokens": 52169388.0,
"step": 20585
},
{
"entropy": 6.230743551254273,
"epoch": 2.3762261973456433,
"grad_norm": 0.9921875,
"learning_rate": 0.0004443766809293846,
"loss": 5.6276,
"mean_token_accuracy": 0.20324479788541794,
"num_tokens": 52181830.0,
"step": 20590
},
{
"entropy": 6.186213684082031,
"epoch": 2.376803231390652,
"grad_norm": 0.98046875,
"learning_rate": 0.0004443495151536475,
"loss": 5.6136,
"mean_token_accuracy": 0.20966268330812454,
"num_tokens": 52194255.0,
"step": 20595
},
{
"entropy": 6.273720645904541,
"epoch": 2.3773802654356606,
"grad_norm": 1.015625,
"learning_rate": 0.0004443223436819237,
"loss": 5.7053,
"mean_token_accuracy": 0.19739032685756683,
"num_tokens": 52205646.0,
"step": 20600
},
{
"entropy": 6.291301012039185,
"epoch": 2.3779572994806695,
"grad_norm": 0.9765625,
"learning_rate": 0.00044429516651512687,
"loss": 5.6598,
"mean_token_accuracy": 0.20497027933597564,
"num_tokens": 52217519.0,
"step": 20605
},
{
"entropy": 6.243464994430542,
"epoch": 2.378534333525678,
"grad_norm": 0.96875,
"learning_rate": 0.00044426798365417133,
"loss": 5.6906,
"mean_token_accuracy": 0.20207190364599228,
"num_tokens": 52230139.0,
"step": 20610
},
{
"entropy": 6.26615309715271,
"epoch": 2.3791113675706868,
"grad_norm": 1.8359375,
"learning_rate": 0.00044424079509997104,
"loss": 5.7295,
"mean_token_accuracy": 0.20137403905391693,
"num_tokens": 52244049.0,
"step": 20615
},
{
"entropy": 6.293638372421265,
"epoch": 2.379688401615695,
"grad_norm": 1.0390625,
"learning_rate": 0.0004442136008534409,
"loss": 5.6727,
"mean_token_accuracy": 0.20594702959060668,
"num_tokens": 52257180.0,
"step": 20620
},
{
"entropy": 6.24235258102417,
"epoch": 2.380265435660704,
"grad_norm": 0.9140625,
"learning_rate": 0.00044418640091549525,
"loss": 5.6548,
"mean_token_accuracy": 0.20861252397298813,
"num_tokens": 52270260.0,
"step": 20625
},
{
"entropy": 6.227157783508301,
"epoch": 2.3808424697057124,
"grad_norm": 1.0078125,
"learning_rate": 0.000444159195287049,
"loss": 5.6543,
"mean_token_accuracy": 0.20346338003873826,
"num_tokens": 52282335.0,
"step": 20630
},
{
"entropy": 6.2641314506530765,
"epoch": 2.3814195037507213,
"grad_norm": 0.94921875,
"learning_rate": 0.0004441319839690173,
"loss": 5.6318,
"mean_token_accuracy": 0.20761382728815078,
"num_tokens": 52296547.0,
"step": 20635
},
{
"entropy": 6.274429273605347,
"epoch": 2.3819965377957297,
"grad_norm": 0.96875,
"learning_rate": 0.0004441047669623153,
"loss": 5.7007,
"mean_token_accuracy": 0.19969301372766496,
"num_tokens": 52309523.0,
"step": 20640
},
{
"entropy": 6.261510848999023,
"epoch": 2.3825735718407386,
"grad_norm": 1.015625,
"learning_rate": 0.00044407754426785845,
"loss": 5.6465,
"mean_token_accuracy": 0.21056678593158723,
"num_tokens": 52322476.0,
"step": 20645
},
{
"entropy": 6.191774082183838,
"epoch": 2.3831506058857475,
"grad_norm": 1.109375,
"learning_rate": 0.0004440503158865625,
"loss": 5.6031,
"mean_token_accuracy": 0.20663601756095887,
"num_tokens": 52335919.0,
"step": 20650
},
{
"entropy": 6.260403728485107,
"epoch": 2.383727639930756,
"grad_norm": 0.95703125,
"learning_rate": 0.00044402308181934295,
"loss": 5.6911,
"mean_token_accuracy": 0.2050690621137619,
"num_tokens": 52347636.0,
"step": 20655
},
{
"entropy": 6.317034482955933,
"epoch": 2.3843046739757647,
"grad_norm": 0.8515625,
"learning_rate": 0.0004439958420671162,
"loss": 5.6786,
"mean_token_accuracy": 0.20000161081552506,
"num_tokens": 52360181.0,
"step": 20660
},
{
"entropy": 6.254880428314209,
"epoch": 2.384881708020773,
"grad_norm": 0.9765625,
"learning_rate": 0.00044396859663079814,
"loss": 5.6601,
"mean_token_accuracy": 0.2131296619772911,
"num_tokens": 52373525.0,
"step": 20665
},
{
"entropy": 6.20746111869812,
"epoch": 2.385458742065782,
"grad_norm": 1.03125,
"learning_rate": 0.00044394134551130533,
"loss": 5.6036,
"mean_token_accuracy": 0.20687361806631088,
"num_tokens": 52386252.0,
"step": 20670
},
{
"entropy": 6.233136701583862,
"epoch": 2.3860357761107904,
"grad_norm": 1.0625,
"learning_rate": 0.0004439140887095542,
"loss": 5.662,
"mean_token_accuracy": 0.1992241472005844,
"num_tokens": 52398056.0,
"step": 20675
},
{
"entropy": 6.248224925994873,
"epoch": 2.3866128101557993,
"grad_norm": 0.98828125,
"learning_rate": 0.00044388682622646165,
"loss": 5.6832,
"mean_token_accuracy": 0.20441022962331773,
"num_tokens": 52409861.0,
"step": 20680
},
{
"entropy": 6.205007266998291,
"epoch": 2.3871898442008077,
"grad_norm": 1.0703125,
"learning_rate": 0.0004438595580629446,
"loss": 5.6461,
"mean_token_accuracy": 0.20737055987119674,
"num_tokens": 52423252.0,
"step": 20685
},
{
"entropy": 6.254592943191528,
"epoch": 2.3877668782458166,
"grad_norm": 1.0234375,
"learning_rate": 0.0004438322842199202,
"loss": 5.6072,
"mean_token_accuracy": 0.2115780532360077,
"num_tokens": 52435950.0,
"step": 20690
},
{
"entropy": 6.291515111923218,
"epoch": 2.388343912290825,
"grad_norm": 0.9375,
"learning_rate": 0.0004438050046983057,
"loss": 5.6623,
"mean_token_accuracy": 0.20793629735708236,
"num_tokens": 52449257.0,
"step": 20695
},
{
"entropy": 6.258818960189819,
"epoch": 2.388920946335834,
"grad_norm": 1.0625,
"learning_rate": 0.00044377771949901876,
"loss": 5.6852,
"mean_token_accuracy": 0.20355032831430436,
"num_tokens": 52461543.0,
"step": 20700
},
{
"entropy": 6.125908517837525,
"epoch": 2.3894979803808427,
"grad_norm": 1.0078125,
"learning_rate": 0.00044375042862297703,
"loss": 5.6012,
"mean_token_accuracy": 0.20494010001420976,
"num_tokens": 52473752.0,
"step": 20705
},
{
"entropy": 6.346489143371582,
"epoch": 2.390075014425851,
"grad_norm": 0.9921875,
"learning_rate": 0.00044372313207109856,
"loss": 5.7409,
"mean_token_accuracy": 0.1928962856531143,
"num_tokens": 52485885.0,
"step": 20710
},
{
"entropy": 6.292835807800293,
"epoch": 2.3906520484708595,
"grad_norm": 0.9921875,
"learning_rate": 0.00044369582984430127,
"loss": 5.6892,
"mean_token_accuracy": 0.20104454159736634,
"num_tokens": 52498389.0,
"step": 20715
},
{
"entropy": 6.241178131103515,
"epoch": 2.3912290825158684,
"grad_norm": 0.9921875,
"learning_rate": 0.00044366852194350354,
"loss": 5.6892,
"mean_token_accuracy": 0.20661631524562835,
"num_tokens": 52511176.0,
"step": 20720
},
{
"entropy": 6.2766162872314455,
"epoch": 2.3918061165608773,
"grad_norm": 0.94921875,
"learning_rate": 0.0004436412083696239,
"loss": 5.6704,
"mean_token_accuracy": 0.1999954655766487,
"num_tokens": 52523173.0,
"step": 20725
},
{
"entropy": 6.2250009059906,
"epoch": 2.3923831506058857,
"grad_norm": 0.91796875,
"learning_rate": 0.00044361388912358095,
"loss": 5.6023,
"mean_token_accuracy": 0.20575390607118607,
"num_tokens": 52535776.0,
"step": 20730
},
{
"entropy": 6.0612109184265135,
"epoch": 2.3929601846508946,
"grad_norm": 0.984375,
"learning_rate": 0.0004435865642062936,
"loss": 5.4344,
"mean_token_accuracy": 0.22326288521289825,
"num_tokens": 52549416.0,
"step": 20735
},
{
"entropy": 6.210688829421997,
"epoch": 2.393537218695903,
"grad_norm": 0.9375,
"learning_rate": 0.0004435592336186809,
"loss": 5.6426,
"mean_token_accuracy": 0.20971183031797408,
"num_tokens": 52562300.0,
"step": 20740
},
{
"entropy": 6.315302419662475,
"epoch": 2.394114252740912,
"grad_norm": 1.0390625,
"learning_rate": 0.0004435318973616622,
"loss": 5.7355,
"mean_token_accuracy": 0.1986914187669754,
"num_tokens": 52573906.0,
"step": 20745
},
{
"entropy": 6.260455179214477,
"epoch": 2.3946912867859202,
"grad_norm": 0.97265625,
"learning_rate": 0.00044350455543615665,
"loss": 5.6618,
"mean_token_accuracy": 0.20642436891794205,
"num_tokens": 52586138.0,
"step": 20750
},
{
"entropy": 6.289743185043335,
"epoch": 2.395268320830929,
"grad_norm": 0.92578125,
"learning_rate": 0.0004434772078430843,
"loss": 5.7052,
"mean_token_accuracy": 0.20260262489318848,
"num_tokens": 52599705.0,
"step": 20755
},
{
"entropy": 6.261003541946411,
"epoch": 2.3958453548759375,
"grad_norm": 0.984375,
"learning_rate": 0.0004434498545833646,
"loss": 5.7523,
"mean_token_accuracy": 0.19939430058002472,
"num_tokens": 52612041.0,
"step": 20760
},
{
"entropy": 6.310602378845215,
"epoch": 2.3964223889209464,
"grad_norm": 0.99609375,
"learning_rate": 0.0004434224956579177,
"loss": 5.7021,
"mean_token_accuracy": 0.20172154903411865,
"num_tokens": 52625634.0,
"step": 20765
},
{
"entropy": 6.172333574295044,
"epoch": 2.396999422965955,
"grad_norm": 1.09375,
"learning_rate": 0.0004433951310676639,
"loss": 5.5445,
"mean_token_accuracy": 0.21477589756250381,
"num_tokens": 52638706.0,
"step": 20770
},
{
"entropy": 6.18256368637085,
"epoch": 2.3975764570109637,
"grad_norm": 0.99609375,
"learning_rate": 0.00044336776081352347,
"loss": 5.6921,
"mean_token_accuracy": 0.2102103739976883,
"num_tokens": 52650876.0,
"step": 20775
},
{
"entropy": 6.233721828460693,
"epoch": 2.3981534910559725,
"grad_norm": 0.9765625,
"learning_rate": 0.00044334038489641706,
"loss": 5.6333,
"mean_token_accuracy": 0.20763159096240996,
"num_tokens": 52663664.0,
"step": 20780
},
{
"entropy": 6.34328670501709,
"epoch": 2.398730525100981,
"grad_norm": 1.0546875,
"learning_rate": 0.00044331300331726544,
"loss": 5.7688,
"mean_token_accuracy": 0.19594075679779052,
"num_tokens": 52675870.0,
"step": 20785
},
{
"entropy": 6.2657371997833256,
"epoch": 2.3993075591459894,
"grad_norm": 1.046875,
"learning_rate": 0.00044328561607698947,
"loss": 5.6955,
"mean_token_accuracy": 0.19709624648094176,
"num_tokens": 52687029.0,
"step": 20790
},
{
"entropy": 6.190671730041504,
"epoch": 2.3998845931909982,
"grad_norm": 0.984375,
"learning_rate": 0.0004432582231765105,
"loss": 5.5523,
"mean_token_accuracy": 0.20293704867362977,
"num_tokens": 52700242.0,
"step": 20795
},
{
"entropy": 6.263112306594849,
"epoch": 2.400461627236007,
"grad_norm": 1.0078125,
"learning_rate": 0.00044323082461674974,
"loss": 5.6512,
"mean_token_accuracy": 0.2004449725151062,
"num_tokens": 52711561.0,
"step": 20800
},
{
"entropy": 6.163639688491822,
"epoch": 2.4010386612810155,
"grad_norm": 0.96484375,
"learning_rate": 0.0004432034203986287,
"loss": 5.5826,
"mean_token_accuracy": 0.20719403624534607,
"num_tokens": 52725101.0,
"step": 20805
},
{
"entropy": 6.299870204925537,
"epoch": 2.4016156953260244,
"grad_norm": 1.046875,
"learning_rate": 0.0004431760105230693,
"loss": 5.7036,
"mean_token_accuracy": 0.19972139000892639,
"num_tokens": 52738315.0,
"step": 20810
},
{
"entropy": 6.311771631240845,
"epoch": 2.402192729371033,
"grad_norm": 1.015625,
"learning_rate": 0.00044314859499099325,
"loss": 5.768,
"mean_token_accuracy": 0.20132242143154144,
"num_tokens": 52752547.0,
"step": 20815
},
{
"entropy": 6.3200325012207035,
"epoch": 2.4027697634160416,
"grad_norm": 0.98828125,
"learning_rate": 0.00044312117380332274,
"loss": 5.7677,
"mean_token_accuracy": 0.19519882798194885,
"num_tokens": 52765831.0,
"step": 20820
},
{
"entropy": 6.276677131652832,
"epoch": 2.40334679746105,
"grad_norm": 0.9921875,
"learning_rate": 0.00044309374696098,
"loss": 5.6135,
"mean_token_accuracy": 0.2075101539492607,
"num_tokens": 52779144.0,
"step": 20825
},
{
"entropy": 6.27869553565979,
"epoch": 2.403923831506059,
"grad_norm": 1.015625,
"learning_rate": 0.0004430663144648876,
"loss": 5.6549,
"mean_token_accuracy": 0.21143777966499328,
"num_tokens": 52790956.0,
"step": 20830
},
{
"entropy": 6.254818725585937,
"epoch": 2.4045008655510673,
"grad_norm": 0.94140625,
"learning_rate": 0.00044303887631596823,
"loss": 5.6933,
"mean_token_accuracy": 0.2000236004590988,
"num_tokens": 52804057.0,
"step": 20835
},
{
"entropy": 6.275049161911011,
"epoch": 2.405077899596076,
"grad_norm": 0.921875,
"learning_rate": 0.0004430114325151447,
"loss": 5.602,
"mean_token_accuracy": 0.20146780759096145,
"num_tokens": 52817197.0,
"step": 20840
},
{
"entropy": 6.312943840026856,
"epoch": 2.4056549336410846,
"grad_norm": 0.96875,
"learning_rate": 0.0004429839830633401,
"loss": 5.6878,
"mean_token_accuracy": 0.20596786588430405,
"num_tokens": 52830162.0,
"step": 20845
},
{
"entropy": 6.244770193099976,
"epoch": 2.4062319676860935,
"grad_norm": 0.96875,
"learning_rate": 0.0004429565279614777,
"loss": 5.6855,
"mean_token_accuracy": 0.20993798077106476,
"num_tokens": 52843681.0,
"step": 20850
},
{
"entropy": 6.273213005065918,
"epoch": 2.4068090017311023,
"grad_norm": 1.0078125,
"learning_rate": 0.00044292906721048094,
"loss": 5.6646,
"mean_token_accuracy": 0.21043166220188142,
"num_tokens": 52857297.0,
"step": 20855
},
{
"entropy": 6.102078199386597,
"epoch": 2.4073860357761108,
"grad_norm": 0.97265625,
"learning_rate": 0.0004429016008112733,
"loss": 5.453,
"mean_token_accuracy": 0.21661452054977418,
"num_tokens": 52870551.0,
"step": 20860
},
{
"entropy": 6.232694149017334,
"epoch": 2.4079630698211196,
"grad_norm": 1.0546875,
"learning_rate": 0.0004428741287647788,
"loss": 5.6018,
"mean_token_accuracy": 0.21334003508090973,
"num_tokens": 52884628.0,
"step": 20865
},
{
"entropy": 6.258617401123047,
"epoch": 2.408540103866128,
"grad_norm": 0.9765625,
"learning_rate": 0.00044284665107192136,
"loss": 5.6018,
"mean_token_accuracy": 0.21635719537734985,
"num_tokens": 52897079.0,
"step": 20870
},
{
"entropy": 6.207066011428833,
"epoch": 2.409117137911137,
"grad_norm": 1.0390625,
"learning_rate": 0.0004428191677336251,
"loss": 5.6794,
"mean_token_accuracy": 0.205386246740818,
"num_tokens": 52909990.0,
"step": 20875
},
{
"entropy": 6.230048990249633,
"epoch": 2.4096941719561453,
"grad_norm": 0.9921875,
"learning_rate": 0.0004427916787508146,
"loss": 5.685,
"mean_token_accuracy": 0.20320132970809937,
"num_tokens": 52922732.0,
"step": 20880
},
{
"entropy": 6.353757715225219,
"epoch": 2.410271206001154,
"grad_norm": 1.125,
"learning_rate": 0.0004427641841244144,
"loss": 5.7219,
"mean_token_accuracy": 0.19882332533597946,
"num_tokens": 52934648.0,
"step": 20885
},
{
"entropy": 6.306688976287842,
"epoch": 2.4108482400461626,
"grad_norm": 1.203125,
"learning_rate": 0.000442736683855349,
"loss": 5.7502,
"mean_token_accuracy": 0.19999517798423766,
"num_tokens": 52947913.0,
"step": 20890
},
{
"entropy": 6.265348243713379,
"epoch": 2.4114252740911715,
"grad_norm": 0.921875,
"learning_rate": 0.0004427091779445437,
"loss": 5.693,
"mean_token_accuracy": 0.20397568345069886,
"num_tokens": 52960491.0,
"step": 20895
},
{
"entropy": 6.3150794506073,
"epoch": 2.41200230813618,
"grad_norm": 0.9375,
"learning_rate": 0.0004426816663929235,
"loss": 5.6529,
"mean_token_accuracy": 0.2066299334168434,
"num_tokens": 52972813.0,
"step": 20900
},
{
"entropy": 6.30979208946228,
"epoch": 2.4125793421811887,
"grad_norm": 0.9921875,
"learning_rate": 0.00044265414920141366,
"loss": 5.7035,
"mean_token_accuracy": 0.19975962191820146,
"num_tokens": 52985548.0,
"step": 20905
},
{
"entropy": 6.237899971008301,
"epoch": 2.413156376226197,
"grad_norm": 1.046875,
"learning_rate": 0.00044262662637093987,
"loss": 5.5775,
"mean_token_accuracy": 0.21558093875646592,
"num_tokens": 52998911.0,
"step": 20910
},
{
"entropy": 6.182219457626343,
"epoch": 2.413733410271206,
"grad_norm": 1.0703125,
"learning_rate": 0.00044259909790242776,
"loss": 5.6054,
"mean_token_accuracy": 0.2133312329649925,
"num_tokens": 53011205.0,
"step": 20915
},
{
"entropy": 6.237178754806519,
"epoch": 2.4143104443162144,
"grad_norm": 0.9765625,
"learning_rate": 0.0004425715637968032,
"loss": 5.7037,
"mean_token_accuracy": 0.2034172847867012,
"num_tokens": 53023428.0,
"step": 20920
},
{
"entropy": 6.351958084106445,
"epoch": 2.4148874783612233,
"grad_norm": 0.94921875,
"learning_rate": 0.0004425440240549923,
"loss": 5.7983,
"mean_token_accuracy": 0.19115305542945862,
"num_tokens": 53035488.0,
"step": 20925
},
{
"entropy": 6.189400720596313,
"epoch": 2.415464512406232,
"grad_norm": 1.0703125,
"learning_rate": 0.00044251647867792147,
"loss": 5.5431,
"mean_token_accuracy": 0.2178526610136032,
"num_tokens": 53048416.0,
"step": 20930
},
{
"entropy": 6.261590957641602,
"epoch": 2.4160415464512406,
"grad_norm": 1.171875,
"learning_rate": 0.00044248892766651706,
"loss": 5.7911,
"mean_token_accuracy": 0.19820116460323334,
"num_tokens": 53061763.0,
"step": 20935
},
{
"entropy": 6.231258487701416,
"epoch": 2.4166185804962494,
"grad_norm": 1.0,
"learning_rate": 0.0004424613710217057,
"loss": 5.608,
"mean_token_accuracy": 0.20854777544736863,
"num_tokens": 53073666.0,
"step": 20940
},
{
"entropy": 6.165039777755737,
"epoch": 2.417195614541258,
"grad_norm": 1.0,
"learning_rate": 0.00044243380874441437,
"loss": 5.5893,
"mean_token_accuracy": 0.2164393588900566,
"num_tokens": 53087155.0,
"step": 20945
},
{
"entropy": 6.291706848144531,
"epoch": 2.4177726485862667,
"grad_norm": 0.9921875,
"learning_rate": 0.00044240624083557,
"loss": 5.7532,
"mean_token_accuracy": 0.20198543518781661,
"num_tokens": 53099199.0,
"step": 20950
},
{
"entropy": 6.27391939163208,
"epoch": 2.418349682631275,
"grad_norm": 0.90625,
"learning_rate": 0.00044237866729609994,
"loss": 5.7253,
"mean_token_accuracy": 0.19764039665460587,
"num_tokens": 53111997.0,
"step": 20955
},
{
"entropy": 6.1567870616912845,
"epoch": 2.418926716676284,
"grad_norm": 1.03125,
"learning_rate": 0.0004423510881269315,
"loss": 5.6611,
"mean_token_accuracy": 0.20668234825134277,
"num_tokens": 53123812.0,
"step": 20960
},
{
"entropy": 6.306679534912109,
"epoch": 2.4195037507212924,
"grad_norm": 0.98828125,
"learning_rate": 0.0004423235033289924,
"loss": 5.7441,
"mean_token_accuracy": 0.19693725556135178,
"num_tokens": 53137232.0,
"step": 20965
},
{
"entropy": 6.320231342315674,
"epoch": 2.4200807847663013,
"grad_norm": 1.0703125,
"learning_rate": 0.0004422959129032103,
"loss": 5.6684,
"mean_token_accuracy": 0.20223398357629777,
"num_tokens": 53149183.0,
"step": 20970
},
{
"entropy": 6.1804546356201175,
"epoch": 2.4206578188113097,
"grad_norm": 0.94140625,
"learning_rate": 0.00044226831685051333,
"loss": 5.5951,
"mean_token_accuracy": 0.20293668061494827,
"num_tokens": 53163187.0,
"step": 20975
},
{
"entropy": 6.322501182556152,
"epoch": 2.4212348528563186,
"grad_norm": 0.91796875,
"learning_rate": 0.0004422407151718296,
"loss": 5.6621,
"mean_token_accuracy": 0.21300754696130753,
"num_tokens": 53178441.0,
"step": 20980
},
{
"entropy": 6.309228181838989,
"epoch": 2.4218118869013274,
"grad_norm": 1.015625,
"learning_rate": 0.00044221310786808746,
"loss": 5.6753,
"mean_token_accuracy": 0.20587997883558273,
"num_tokens": 53190042.0,
"step": 20985
},
{
"entropy": 6.260992860794067,
"epoch": 2.422388920946336,
"grad_norm": 0.98828125,
"learning_rate": 0.0004421854949402155,
"loss": 5.6765,
"mean_token_accuracy": 0.20409729927778245,
"num_tokens": 53201724.0,
"step": 20990
},
{
"entropy": 6.2162477493286135,
"epoch": 2.4229659549913443,
"grad_norm": 0.953125,
"learning_rate": 0.00044215787638914245,
"loss": 5.6576,
"mean_token_accuracy": 0.20342174768447877,
"num_tokens": 53213415.0,
"step": 20995
},
{
"entropy": 6.2664031982421875,
"epoch": 2.423542989036353,
"grad_norm": 0.94140625,
"learning_rate": 0.0004421302522157973,
"loss": 5.6785,
"mean_token_accuracy": 0.20658696591854095,
"num_tokens": 53227324.0,
"step": 21000
},
{
"epoch": 2.423542989036353,
"eval_entropy": 6.088870966742925,
"eval_loss": 5.776307106018066,
"eval_mean_token_accuracy": 0.20609371489316927,
"eval_num_tokens": 53227324.0,
"eval_runtime": 17.4445,
"eval_samples_per_second": 1612.888,
"eval_steps_per_second": 201.611,
"step": 21000
}
],
"logging_steps": 5,
"max_steps": 86650,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 3000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.16435681353728e+16,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}