Files
ModelHub XC 9998b0f430 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/swa-latn-100mb-ppt-Dp-100mb_seed10
Source: Original Platform
2026-08-21 19:27:17 +08:00

6035 lines
164 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.06919297921904191,
"eval_steps": 500,
"global_step": 3000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.691907501220703,
"epoch": 0.0001153216320317365,
"grad_norm": 17.375,
"learning_rate": 2e-06,
"loss": 10.5245,
"mean_token_accuracy": 0.0,
"num_tokens": 3965.0,
"step": 5
},
{
"entropy": 10.691843128204345,
"epoch": 0.000230643264063473,
"grad_norm": 18.5,
"learning_rate": 4.5e-06,
"loss": 10.3993,
"mean_token_accuracy": 0.0003649635007604957,
"num_tokens": 7510.0,
"step": 10
},
{
"entropy": 10.69088363647461,
"epoch": 0.0003459648960952095,
"grad_norm": 13.125,
"learning_rate": 7e-06,
"loss": 10.1564,
"mean_token_accuracy": 0.03439897168427706,
"num_tokens": 11084.0,
"step": 15
},
{
"entropy": 10.681573295593262,
"epoch": 0.000461286528126946,
"grad_norm": 9.0625,
"learning_rate": 9.5e-06,
"loss": 9.7517,
"mean_token_accuracy": 0.06451544389128686,
"num_tokens": 14319.0,
"step": 20
},
{
"entropy": 10.623183345794677,
"epoch": 0.0005766081601586826,
"grad_norm": 5.8125,
"learning_rate": 1.2e-05,
"loss": 9.4401,
"mean_token_accuracy": 0.06273870654404164,
"num_tokens": 17670.0,
"step": 25
},
{
"entropy": 10.555589962005616,
"epoch": 0.000691929792190419,
"grad_norm": 4.9375,
"learning_rate": 1.4500000000000002e-05,
"loss": 9.2749,
"mean_token_accuracy": 0.05860213525593281,
"num_tokens": 21177.0,
"step": 30
},
{
"entropy": 10.556735229492187,
"epoch": 0.0008072514242221556,
"grad_norm": 4.25,
"learning_rate": 1.7000000000000003e-05,
"loss": 9.1316,
"mean_token_accuracy": 0.06961804144084453,
"num_tokens": 24417.0,
"step": 35
},
{
"entropy": 10.520895004272461,
"epoch": 0.000922573056253892,
"grad_norm": 4.09375,
"learning_rate": 1.95e-05,
"loss": 9.1409,
"mean_token_accuracy": 0.067233781889081,
"num_tokens": 27824.0,
"step": 40
},
{
"entropy": 10.48238296508789,
"epoch": 0.0010378946882856287,
"grad_norm": 3.828125,
"learning_rate": 2.2e-05,
"loss": 9.1384,
"mean_token_accuracy": 0.06338647790253163,
"num_tokens": 31712.0,
"step": 45
},
{
"entropy": 10.46641788482666,
"epoch": 0.0011532163203173652,
"grad_norm": 3.640625,
"learning_rate": 2.4500000000000003e-05,
"loss": 9.0513,
"mean_token_accuracy": 0.07285529412329197,
"num_tokens": 35207.0,
"step": 50
},
{
"entropy": 10.364572525024414,
"epoch": 0.0012685379523491016,
"grad_norm": 3.28125,
"learning_rate": 2.7e-05,
"loss": 9.0362,
"mean_token_accuracy": 0.06746394783258439,
"num_tokens": 39066.0,
"step": 55
},
{
"entropy": 10.27311315536499,
"epoch": 0.001383859584380838,
"grad_norm": 3.5,
"learning_rate": 2.95e-05,
"loss": 8.8148,
"mean_token_accuracy": 0.07908576317131519,
"num_tokens": 42389.0,
"step": 60
},
{
"entropy": 10.151123905181885,
"epoch": 0.0014991812164125747,
"grad_norm": 2.953125,
"learning_rate": 3.2e-05,
"loss": 8.8459,
"mean_token_accuracy": 0.07942395582795143,
"num_tokens": 45778.0,
"step": 65
},
{
"entropy": 10.179048538208008,
"epoch": 0.0016145028484443112,
"grad_norm": 3.0625,
"learning_rate": 3.4500000000000005e-05,
"loss": 8.6928,
"mean_token_accuracy": 0.07802934609353543,
"num_tokens": 48918.0,
"step": 70
},
{
"entropy": 10.147464656829834,
"epoch": 0.0017298244804760477,
"grad_norm": 4.0625,
"learning_rate": 3.7e-05,
"loss": 8.6836,
"mean_token_accuracy": 0.07859932407736778,
"num_tokens": 52456.0,
"step": 75
},
{
"entropy": 10.119709587097168,
"epoch": 0.001845146112507784,
"grad_norm": 3.046875,
"learning_rate": 3.95e-05,
"loss": 8.6315,
"mean_token_accuracy": 0.07672536484897137,
"num_tokens": 56193.0,
"step": 80
},
{
"entropy": 10.134781169891358,
"epoch": 0.0019604677445395208,
"grad_norm": 3.5,
"learning_rate": 4.2000000000000004e-05,
"loss": 8.5835,
"mean_token_accuracy": 0.07438027523458005,
"num_tokens": 59977.0,
"step": 85
},
{
"entropy": 10.018630409240723,
"epoch": 0.0020757893765712574,
"grad_norm": 2.625,
"learning_rate": 4.45e-05,
"loss": 8.5291,
"mean_token_accuracy": 0.0768112525343895,
"num_tokens": 63844.0,
"step": 90
},
{
"entropy": 9.969991493225098,
"epoch": 0.0021911110086029937,
"grad_norm": 2.875,
"learning_rate": 4.7000000000000004e-05,
"loss": 8.4302,
"mean_token_accuracy": 0.07833829969167709,
"num_tokens": 67356.0,
"step": 95
},
{
"entropy": 9.947973537445069,
"epoch": 0.0023064326406347303,
"grad_norm": 2.328125,
"learning_rate": 4.9500000000000004e-05,
"loss": 8.2975,
"mean_token_accuracy": 0.08131772689521313,
"num_tokens": 70767.0,
"step": 100
},
{
"entropy": 9.674797916412354,
"epoch": 0.0024217542726664666,
"grad_norm": 2.03125,
"learning_rate": 5.2e-05,
"loss": 8.2983,
"mean_token_accuracy": 0.08184195645153522,
"num_tokens": 74437.0,
"step": 105
},
{
"entropy": 9.848657512664795,
"epoch": 0.0025370759046982033,
"grad_norm": 2.96875,
"learning_rate": 5.45e-05,
"loss": 8.2258,
"mean_token_accuracy": 0.07810623683035374,
"num_tokens": 77940.0,
"step": 110
},
{
"entropy": 9.696725845336914,
"epoch": 0.00265239753672994,
"grad_norm": 2.09375,
"learning_rate": 5.7e-05,
"loss": 8.1357,
"mean_token_accuracy": 0.07201453074812889,
"num_tokens": 81669.0,
"step": 115
},
{
"entropy": 9.512047672271729,
"epoch": 0.002767719168761676,
"grad_norm": 1.765625,
"learning_rate": 5.9499999999999996e-05,
"loss": 8.0767,
"mean_token_accuracy": 0.0643788930028677,
"num_tokens": 86135.0,
"step": 120
},
{
"entropy": 9.434719371795655,
"epoch": 0.002883040800793413,
"grad_norm": 2.171875,
"learning_rate": 6.2e-05,
"loss": 7.898,
"mean_token_accuracy": 0.0802077766507864,
"num_tokens": 89620.0,
"step": 125
},
{
"entropy": 9.149808502197265,
"epoch": 0.0029983624328251495,
"grad_norm": 1.96875,
"learning_rate": 6.450000000000001e-05,
"loss": 7.7739,
"mean_token_accuracy": 0.08522589541971684,
"num_tokens": 93245.0,
"step": 130
},
{
"entropy": 9.161969184875488,
"epoch": 0.0031136840648568857,
"grad_norm": 1.9296875,
"learning_rate": 6.7e-05,
"loss": 7.6885,
"mean_token_accuracy": 0.09521296098828316,
"num_tokens": 96754.0,
"step": 135
},
{
"entropy": 8.86840353012085,
"epoch": 0.0032290056968886224,
"grad_norm": 1.8359375,
"learning_rate": 6.950000000000001e-05,
"loss": 7.6545,
"mean_token_accuracy": 0.08669420927762986,
"num_tokens": 100266.0,
"step": 140
},
{
"entropy": 8.901450920104981,
"epoch": 0.003344327328920359,
"grad_norm": 1.6484375,
"learning_rate": 7.2e-05,
"loss": 7.5653,
"mean_token_accuracy": 0.07821874283254146,
"num_tokens": 103824.0,
"step": 145
},
{
"entropy": 8.649330520629883,
"epoch": 0.0034596489609520953,
"grad_norm": 2.171875,
"learning_rate": 7.45e-05,
"loss": 7.5483,
"mean_token_accuracy": 0.0837211973965168,
"num_tokens": 107659.0,
"step": 150
},
{
"entropy": 8.520522785186767,
"epoch": 0.003574970592983832,
"grad_norm": 2.09375,
"learning_rate": 7.7e-05,
"loss": 7.3799,
"mean_token_accuracy": 0.08768085911870002,
"num_tokens": 111348.0,
"step": 155
},
{
"entropy": 8.380702209472656,
"epoch": 0.003690292225015568,
"grad_norm": 1.515625,
"learning_rate": 7.950000000000001e-05,
"loss": 7.4222,
"mean_token_accuracy": 0.08212160468101501,
"num_tokens": 115386.0,
"step": 160
},
{
"entropy": 8.227167320251464,
"epoch": 0.003805613857047305,
"grad_norm": 1.921875,
"learning_rate": 8.2e-05,
"loss": 7.3087,
"mean_token_accuracy": 0.09835789948701859,
"num_tokens": 118772.0,
"step": 165
},
{
"entropy": 8.145322608947755,
"epoch": 0.0039209354890790415,
"grad_norm": 1.890625,
"learning_rate": 8.450000000000001e-05,
"loss": 7.416,
"mean_token_accuracy": 0.09204246997833251,
"num_tokens": 122680.0,
"step": 170
},
{
"entropy": 8.233028316497803,
"epoch": 0.004036257121110778,
"grad_norm": 1.609375,
"learning_rate": 8.7e-05,
"loss": 7.3521,
"mean_token_accuracy": 0.08081735149025918,
"num_tokens": 127162.0,
"step": 175
},
{
"entropy": 7.950575256347657,
"epoch": 0.004151578753142515,
"grad_norm": 1.5546875,
"learning_rate": 8.95e-05,
"loss": 7.2055,
"mean_token_accuracy": 0.09383777529001236,
"num_tokens": 130684.0,
"step": 180
},
{
"entropy": 8.000711679458618,
"epoch": 0.004266900385174251,
"grad_norm": 1.6171875,
"learning_rate": 9.2e-05,
"loss": 7.275,
"mean_token_accuracy": 0.09546211659908295,
"num_tokens": 134154.0,
"step": 185
},
{
"entropy": 7.941235446929932,
"epoch": 0.004382222017205987,
"grad_norm": 1.703125,
"learning_rate": 9.45e-05,
"loss": 7.2944,
"mean_token_accuracy": 0.08537636548280716,
"num_tokens": 137811.0,
"step": 190
},
{
"entropy": 7.906629467010498,
"epoch": 0.004497543649237724,
"grad_norm": 1.59375,
"learning_rate": 9.7e-05,
"loss": 7.1824,
"mean_token_accuracy": 0.09572790712118148,
"num_tokens": 141220.0,
"step": 195
},
{
"entropy": 7.942177057266235,
"epoch": 0.004612865281269461,
"grad_norm": 1.8671875,
"learning_rate": 9.95e-05,
"loss": 7.2036,
"mean_token_accuracy": 0.09937367662787437,
"num_tokens": 144768.0,
"step": 200
},
{
"entropy": 7.685758304595947,
"epoch": 0.004728186913301197,
"grad_norm": 1.78125,
"learning_rate": 0.000102,
"loss": 7.137,
"mean_token_accuracy": 0.09695517122745514,
"num_tokens": 148173.0,
"step": 205
},
{
"entropy": 7.714945936203003,
"epoch": 0.004843508545332933,
"grad_norm": 1.625,
"learning_rate": 0.00010449999999999999,
"loss": 7.1256,
"mean_token_accuracy": 0.10458688139915466,
"num_tokens": 151861.0,
"step": 210
},
{
"entropy": 7.71102352142334,
"epoch": 0.00495883017736467,
"grad_norm": 1.7578125,
"learning_rate": 0.000107,
"loss": 7.066,
"mean_token_accuracy": 0.10715894550085067,
"num_tokens": 155191.0,
"step": 215
},
{
"entropy": 7.614436388015747,
"epoch": 0.0050741518093964065,
"grad_norm": 1.921875,
"learning_rate": 0.0001095,
"loss": 7.1459,
"mean_token_accuracy": 0.09644531235098838,
"num_tokens": 158655.0,
"step": 220
},
{
"entropy": 7.692019128799439,
"epoch": 0.005189473441428143,
"grad_norm": 1.8515625,
"learning_rate": 0.000112,
"loss": 7.1231,
"mean_token_accuracy": 0.10170018300414085,
"num_tokens": 162244.0,
"step": 225
},
{
"entropy": 7.713358163833618,
"epoch": 0.00530479507345988,
"grad_norm": 1.7109375,
"learning_rate": 0.0001145,
"loss": 7.2913,
"mean_token_accuracy": 0.08797733411192894,
"num_tokens": 165887.0,
"step": 230
},
{
"entropy": 7.608382606506348,
"epoch": 0.0054201167054916165,
"grad_norm": 1.4453125,
"learning_rate": 0.00011700000000000001,
"loss": 7.0288,
"mean_token_accuracy": 0.10224084109067917,
"num_tokens": 169248.0,
"step": 235
},
{
"entropy": 7.681228685379028,
"epoch": 0.005535438337523352,
"grad_norm": 1.8359375,
"learning_rate": 0.00011949999999999999,
"loss": 7.137,
"mean_token_accuracy": 0.09048556201159955,
"num_tokens": 172559.0,
"step": 240
},
{
"entropy": 7.473513507843018,
"epoch": 0.005650759969555089,
"grad_norm": 1.5546875,
"learning_rate": 0.000122,
"loss": 7.0968,
"mean_token_accuracy": 0.1024228110909462,
"num_tokens": 175961.0,
"step": 245
},
{
"entropy": 7.584992599487305,
"epoch": 0.005766081601586826,
"grad_norm": 1.609375,
"learning_rate": 0.0001245,
"loss": 7.1516,
"mean_token_accuracy": 0.09878315702080727,
"num_tokens": 179611.0,
"step": 250
},
{
"entropy": 7.685141277313233,
"epoch": 0.005881403233618562,
"grad_norm": 1.6796875,
"learning_rate": 0.000127,
"loss": 7.1129,
"mean_token_accuracy": 0.10327758342027664,
"num_tokens": 183105.0,
"step": 255
},
{
"entropy": 7.646425008773804,
"epoch": 0.005996724865650299,
"grad_norm": 1.6875,
"learning_rate": 0.0001295,
"loss": 7.118,
"mean_token_accuracy": 0.09364504367113113,
"num_tokens": 186682.0,
"step": 260
},
{
"entropy": 7.5202278137207035,
"epoch": 0.006112046497682035,
"grad_norm": 1.5390625,
"learning_rate": 0.000132,
"loss": 7.1542,
"mean_token_accuracy": 0.09994478896260262,
"num_tokens": 190487.0,
"step": 265
},
{
"entropy": 7.5590576171875,
"epoch": 0.0062273681297137715,
"grad_norm": 1.640625,
"learning_rate": 0.00013450000000000002,
"loss": 7.1467,
"mean_token_accuracy": 0.0977135255932808,
"num_tokens": 194445.0,
"step": 270
},
{
"entropy": 7.514654350280762,
"epoch": 0.006342689761745508,
"grad_norm": 1.6875,
"learning_rate": 0.00013700000000000002,
"loss": 7.0653,
"mean_token_accuracy": 0.10815930888056755,
"num_tokens": 197864.0,
"step": 275
},
{
"entropy": 7.6202771186828615,
"epoch": 0.006458011393777245,
"grad_norm": 1.609375,
"learning_rate": 0.0001395,
"loss": 6.99,
"mean_token_accuracy": 0.1028586745262146,
"num_tokens": 201465.0,
"step": 280
},
{
"entropy": 7.317496013641358,
"epoch": 0.0065733330258089815,
"grad_norm": 1.71875,
"learning_rate": 0.00014199999999999998,
"loss": 6.9834,
"mean_token_accuracy": 0.09826496616005898,
"num_tokens": 204918.0,
"step": 285
},
{
"entropy": 7.434334373474121,
"epoch": 0.006688654657840718,
"grad_norm": 2.015625,
"learning_rate": 0.0001445,
"loss": 7.078,
"mean_token_accuracy": 0.10162978768348693,
"num_tokens": 208725.0,
"step": 290
},
{
"entropy": 7.4441381931304935,
"epoch": 0.006803976289872454,
"grad_norm": 1.78125,
"learning_rate": 0.000147,
"loss": 7.0367,
"mean_token_accuracy": 0.10961202383041382,
"num_tokens": 212286.0,
"step": 295
},
{
"entropy": 7.442938041687012,
"epoch": 0.006919297921904191,
"grad_norm": 1.65625,
"learning_rate": 0.0001495,
"loss": 6.9635,
"mean_token_accuracy": 0.11073270812630653,
"num_tokens": 215900.0,
"step": 300
},
{
"entropy": 7.303906488418579,
"epoch": 0.007034619553935927,
"grad_norm": 1.5703125,
"learning_rate": 0.000152,
"loss": 6.9921,
"mean_token_accuracy": 0.10271828547120095,
"num_tokens": 219495.0,
"step": 305
},
{
"entropy": 7.581103324890137,
"epoch": 0.007149941185967664,
"grad_norm": 1.4375,
"learning_rate": 0.00015450000000000001,
"loss": 7.0565,
"mean_token_accuracy": 0.09874569922685623,
"num_tokens": 223358.0,
"step": 310
},
{
"entropy": 7.358316278457641,
"epoch": 0.007265262817999401,
"grad_norm": 1.75,
"learning_rate": 0.000157,
"loss": 6.9374,
"mean_token_accuracy": 0.11364061161875724,
"num_tokens": 226549.0,
"step": 315
},
{
"entropy": 7.333794832229614,
"epoch": 0.007380584450031136,
"grad_norm": 1.640625,
"learning_rate": 0.0001595,
"loss": 7.0438,
"mean_token_accuracy": 0.11026700586080551,
"num_tokens": 230102.0,
"step": 320
},
{
"entropy": 7.446019983291626,
"epoch": 0.007495906082062873,
"grad_norm": 1.4921875,
"learning_rate": 0.000162,
"loss": 6.9717,
"mean_token_accuracy": 0.10468028411269188,
"num_tokens": 233652.0,
"step": 325
},
{
"entropy": 7.4383687496185305,
"epoch": 0.00761122771409461,
"grad_norm": 1.6171875,
"learning_rate": 0.00016450000000000001,
"loss": 6.9563,
"mean_token_accuracy": 0.10809829756617546,
"num_tokens": 237100.0,
"step": 330
},
{
"entropy": 7.277336835861206,
"epoch": 0.007726549346126346,
"grad_norm": 1.6796875,
"learning_rate": 0.00016700000000000002,
"loss": 6.835,
"mean_token_accuracy": 0.1123481884598732,
"num_tokens": 240390.0,
"step": 335
},
{
"entropy": 7.367178535461425,
"epoch": 0.007841870978158083,
"grad_norm": 1.7734375,
"learning_rate": 0.00016950000000000003,
"loss": 6.9353,
"mean_token_accuracy": 0.10941664353013039,
"num_tokens": 243955.0,
"step": 340
},
{
"entropy": 7.226317501068115,
"epoch": 0.007957192610189819,
"grad_norm": 1.625,
"learning_rate": 0.00017199999999999998,
"loss": 6.8903,
"mean_token_accuracy": 0.11319939866662025,
"num_tokens": 247371.0,
"step": 345
},
{
"entropy": 7.388652610778808,
"epoch": 0.008072514242221556,
"grad_norm": 1.5390625,
"learning_rate": 0.00017449999999999999,
"loss": 6.9579,
"mean_token_accuracy": 0.10422090664505959,
"num_tokens": 250794.0,
"step": 350
},
{
"entropy": 7.3202920913696286,
"epoch": 0.008187835874253292,
"grad_norm": 1.6796875,
"learning_rate": 0.000177,
"loss": 6.985,
"mean_token_accuracy": 0.10096767656505108,
"num_tokens": 254434.0,
"step": 355
},
{
"entropy": 7.292840766906738,
"epoch": 0.00830315750628503,
"grad_norm": 1.8984375,
"learning_rate": 0.0001795,
"loss": 6.9804,
"mean_token_accuracy": 0.10753846392035485,
"num_tokens": 258039.0,
"step": 360
},
{
"entropy": 7.453191423416138,
"epoch": 0.008418479138316766,
"grad_norm": 1.7265625,
"learning_rate": 0.000182,
"loss": 6.9874,
"mean_token_accuracy": 0.11508287489414215,
"num_tokens": 261851.0,
"step": 365
},
{
"entropy": 7.177758312225341,
"epoch": 0.008533800770348501,
"grad_norm": 1.53125,
"learning_rate": 0.0001845,
"loss": 6.9374,
"mean_token_accuracy": 0.10858769118785858,
"num_tokens": 265903.0,
"step": 370
},
{
"entropy": 7.471200084686279,
"epoch": 0.008649122402380239,
"grad_norm": 1.78125,
"learning_rate": 0.000187,
"loss": 6.9962,
"mean_token_accuracy": 0.10989872291684151,
"num_tokens": 269471.0,
"step": 375
},
{
"entropy": 7.166895580291748,
"epoch": 0.008764444034411975,
"grad_norm": 1.484375,
"learning_rate": 0.0001895,
"loss": 6.9137,
"mean_token_accuracy": 0.11640691384673119,
"num_tokens": 272945.0,
"step": 380
},
{
"entropy": 7.404301357269287,
"epoch": 0.008879765666443712,
"grad_norm": 2.0625,
"learning_rate": 0.000192,
"loss": 6.9117,
"mean_token_accuracy": 0.1151728942990303,
"num_tokens": 276300.0,
"step": 385
},
{
"entropy": 7.1740296363830565,
"epoch": 0.008995087298475448,
"grad_norm": 1.671875,
"learning_rate": 0.0001945,
"loss": 6.9439,
"mean_token_accuracy": 0.10883786007761956,
"num_tokens": 279930.0,
"step": 390
},
{
"entropy": 7.307166481018067,
"epoch": 0.009110408930507184,
"grad_norm": 1.5859375,
"learning_rate": 0.00019700000000000002,
"loss": 6.92,
"mean_token_accuracy": 0.1120470218360424,
"num_tokens": 283709.0,
"step": 395
},
{
"entropy": 7.349106884002685,
"epoch": 0.009225730562538921,
"grad_norm": 1.46875,
"learning_rate": 0.00019950000000000002,
"loss": 7.0302,
"mean_token_accuracy": 0.11455085650086402,
"num_tokens": 287880.0,
"step": 400
},
{
"entropy": 7.221231746673584,
"epoch": 0.009341052194570657,
"grad_norm": 1.7578125,
"learning_rate": 0.000202,
"loss": 6.8002,
"mean_token_accuracy": 0.11782657876610755,
"num_tokens": 291367.0,
"step": 405
},
{
"entropy": 7.293564319610596,
"epoch": 0.009456373826602395,
"grad_norm": 1.5859375,
"learning_rate": 0.00020449999999999998,
"loss": 6.9735,
"mean_token_accuracy": 0.10948061645030975,
"num_tokens": 294920.0,
"step": 410
},
{
"entropy": 7.203423309326172,
"epoch": 0.00957169545863413,
"grad_norm": 1.5234375,
"learning_rate": 0.000207,
"loss": 6.8951,
"mean_token_accuracy": 0.1170351468026638,
"num_tokens": 298347.0,
"step": 415
},
{
"entropy": 7.1942479610443115,
"epoch": 0.009687017090665866,
"grad_norm": 1.765625,
"learning_rate": 0.0002095,
"loss": 6.7875,
"mean_token_accuracy": 0.1238088421523571,
"num_tokens": 301787.0,
"step": 420
},
{
"entropy": 7.0459576606750485,
"epoch": 0.009802338722697604,
"grad_norm": 1.8671875,
"learning_rate": 0.000212,
"loss": 6.8287,
"mean_token_accuracy": 0.12091329768300056,
"num_tokens": 305284.0,
"step": 425
},
{
"entropy": 7.336889219284058,
"epoch": 0.00991766035472934,
"grad_norm": 1.46875,
"learning_rate": 0.0002145,
"loss": 6.9463,
"mean_token_accuracy": 0.11388053148984909,
"num_tokens": 308963.0,
"step": 430
},
{
"entropy": 7.106842947006226,
"epoch": 0.010032981986761077,
"grad_norm": 1.640625,
"learning_rate": 0.00021700000000000002,
"loss": 6.809,
"mean_token_accuracy": 0.12353090792894364,
"num_tokens": 312422.0,
"step": 435
},
{
"entropy": 7.182272291183471,
"epoch": 0.010148303618792813,
"grad_norm": 1.53125,
"learning_rate": 0.0002195,
"loss": 6.7662,
"mean_token_accuracy": 0.11858817338943481,
"num_tokens": 316194.0,
"step": 440
},
{
"entropy": 7.024605417251587,
"epoch": 0.010263625250824549,
"grad_norm": 1.2890625,
"learning_rate": 0.000222,
"loss": 6.8614,
"mean_token_accuracy": 0.11561542153358459,
"num_tokens": 319824.0,
"step": 445
},
{
"entropy": 7.047331666946411,
"epoch": 0.010378946882856286,
"grad_norm": 1.671875,
"learning_rate": 0.0002245,
"loss": 6.7707,
"mean_token_accuracy": 0.1250594787299633,
"num_tokens": 323503.0,
"step": 450
},
{
"entropy": 7.204434967041015,
"epoch": 0.010494268514888022,
"grad_norm": 1.6484375,
"learning_rate": 0.00022700000000000002,
"loss": 6.8941,
"mean_token_accuracy": 0.11519786417484283,
"num_tokens": 326858.0,
"step": 455
},
{
"entropy": 7.106210565567016,
"epoch": 0.01060959014691976,
"grad_norm": 1.7734375,
"learning_rate": 0.00022950000000000002,
"loss": 6.8793,
"mean_token_accuracy": 0.11701082810759544,
"num_tokens": 330370.0,
"step": 460
},
{
"entropy": 7.177642726898194,
"epoch": 0.010724911778951495,
"grad_norm": 1.578125,
"learning_rate": 0.00023200000000000003,
"loss": 6.7898,
"mean_token_accuracy": 0.11765560358762742,
"num_tokens": 334041.0,
"step": 465
},
{
"entropy": 7.11465482711792,
"epoch": 0.010840233410983233,
"grad_norm": 1.890625,
"learning_rate": 0.00023449999999999998,
"loss": 6.7651,
"mean_token_accuracy": 0.12222857922315597,
"num_tokens": 337724.0,
"step": 470
},
{
"entropy": 6.927467727661133,
"epoch": 0.010955555043014969,
"grad_norm": 1.7734375,
"learning_rate": 0.000237,
"loss": 6.6746,
"mean_token_accuracy": 0.12812104001641272,
"num_tokens": 340946.0,
"step": 475
},
{
"entropy": 7.083363389968872,
"epoch": 0.011070876675046705,
"grad_norm": 1.7109375,
"learning_rate": 0.0002395,
"loss": 6.8418,
"mean_token_accuracy": 0.12921102717518806,
"num_tokens": 344603.0,
"step": 480
},
{
"entropy": 7.131814002990723,
"epoch": 0.011186198307078442,
"grad_norm": 1.4765625,
"learning_rate": 0.000242,
"loss": 6.8164,
"mean_token_accuracy": 0.11969970613718033,
"num_tokens": 348153.0,
"step": 485
},
{
"entropy": 6.9778149127960205,
"epoch": 0.011301519939110178,
"grad_norm": 1.6328125,
"learning_rate": 0.0002445,
"loss": 6.8872,
"mean_token_accuracy": 0.12184126004576683,
"num_tokens": 351682.0,
"step": 490
},
{
"entropy": 7.12193341255188,
"epoch": 0.011416841571141916,
"grad_norm": 1.5234375,
"learning_rate": 0.000247,
"loss": 6.7129,
"mean_token_accuracy": 0.12792302519083024,
"num_tokens": 355245.0,
"step": 495
},
{
"entropy": 6.980188322067261,
"epoch": 0.011532163203173651,
"grad_norm": 1.53125,
"learning_rate": 0.0002495,
"loss": 6.8127,
"mean_token_accuracy": 0.12161365896463394,
"num_tokens": 358888.0,
"step": 500
},
{
"entropy": 7.066232776641845,
"epoch": 0.011647484835205387,
"grad_norm": 1.5703125,
"learning_rate": 0.000252,
"loss": 6.8635,
"mean_token_accuracy": 0.11938958987593651,
"num_tokens": 362626.0,
"step": 505
},
{
"entropy": 7.00195050239563,
"epoch": 0.011762806467237125,
"grad_norm": 2.09375,
"learning_rate": 0.0002545,
"loss": 6.7086,
"mean_token_accuracy": 0.1228688344359398,
"num_tokens": 366038.0,
"step": 510
},
{
"entropy": 6.969321203231812,
"epoch": 0.01187812809926886,
"grad_norm": 1.7109375,
"learning_rate": 0.000257,
"loss": 6.7136,
"mean_token_accuracy": 0.12526071220636367,
"num_tokens": 369594.0,
"step": 515
},
{
"entropy": 6.9371413230896,
"epoch": 0.011993449731300598,
"grad_norm": 1.703125,
"learning_rate": 0.0002595,
"loss": 6.7367,
"mean_token_accuracy": 0.12349091246724128,
"num_tokens": 373104.0,
"step": 520
},
{
"entropy": 7.061675262451172,
"epoch": 0.012108771363332334,
"grad_norm": 1.578125,
"learning_rate": 0.000262,
"loss": 6.7381,
"mean_token_accuracy": 0.127496138215065,
"num_tokens": 376595.0,
"step": 525
},
{
"entropy": 6.979284811019897,
"epoch": 0.01222409299536407,
"grad_norm": 1.515625,
"learning_rate": 0.00026450000000000003,
"loss": 6.6709,
"mean_token_accuracy": 0.13121070936322213,
"num_tokens": 380156.0,
"step": 530
},
{
"entropy": 6.977970695495605,
"epoch": 0.012339414627395807,
"grad_norm": 1.4921875,
"learning_rate": 0.00026700000000000004,
"loss": 6.7324,
"mean_token_accuracy": 0.1287410192191601,
"num_tokens": 384027.0,
"step": 535
},
{
"entropy": 6.881741619110107,
"epoch": 0.012454736259427543,
"grad_norm": 1.640625,
"learning_rate": 0.00026950000000000005,
"loss": 6.6671,
"mean_token_accuracy": 0.11977160051465034,
"num_tokens": 387550.0,
"step": 540
},
{
"entropy": 6.822022294998169,
"epoch": 0.01257005789145928,
"grad_norm": 1.6015625,
"learning_rate": 0.00027200000000000005,
"loss": 6.6422,
"mean_token_accuracy": 0.13606388345360756,
"num_tokens": 390963.0,
"step": 545
},
{
"entropy": 6.928303003311157,
"epoch": 0.012685379523491016,
"grad_norm": 1.375,
"learning_rate": 0.0002745,
"loss": 6.7124,
"mean_token_accuracy": 0.12595684081315994,
"num_tokens": 394925.0,
"step": 550
},
{
"entropy": 6.908079767227173,
"epoch": 0.012800701155522754,
"grad_norm": 1.75,
"learning_rate": 0.000277,
"loss": 6.6508,
"mean_token_accuracy": 0.13430240824818612,
"num_tokens": 398277.0,
"step": 555
},
{
"entropy": 6.7669871807098385,
"epoch": 0.01291602278755449,
"grad_norm": 1.59375,
"learning_rate": 0.0002795,
"loss": 6.6406,
"mean_token_accuracy": 0.12931998521089555,
"num_tokens": 402031.0,
"step": 560
},
{
"entropy": 7.0115638256073,
"epoch": 0.013031344419586225,
"grad_norm": 1.6640625,
"learning_rate": 0.00028199999999999997,
"loss": 6.7424,
"mean_token_accuracy": 0.12384107932448388,
"num_tokens": 405965.0,
"step": 565
},
{
"entropy": 6.675027227401733,
"epoch": 0.013146666051617963,
"grad_norm": 1.53125,
"learning_rate": 0.0002845,
"loss": 6.6326,
"mean_token_accuracy": 0.13790299072861673,
"num_tokens": 409030.0,
"step": 570
},
{
"entropy": 6.937662792205811,
"epoch": 0.013261987683649699,
"grad_norm": 1.5703125,
"learning_rate": 0.000287,
"loss": 6.6805,
"mean_token_accuracy": 0.1316666141152382,
"num_tokens": 412644.0,
"step": 575
},
{
"entropy": 6.8609226703643795,
"epoch": 0.013377309315681436,
"grad_norm": 1.3359375,
"learning_rate": 0.0002895,
"loss": 6.8327,
"mean_token_accuracy": 0.12451824694871902,
"num_tokens": 416572.0,
"step": 580
},
{
"entropy": 7.033586931228638,
"epoch": 0.013492630947713172,
"grad_norm": 1.390625,
"learning_rate": 0.000292,
"loss": 6.7378,
"mean_token_accuracy": 0.12755787074565889,
"num_tokens": 420282.0,
"step": 585
},
{
"entropy": 6.879875516891479,
"epoch": 0.013607952579744908,
"grad_norm": 1.5703125,
"learning_rate": 0.0002945,
"loss": 6.7316,
"mean_token_accuracy": 0.12889642342925073,
"num_tokens": 423856.0,
"step": 590
},
{
"entropy": 6.873905801773072,
"epoch": 0.013723274211776645,
"grad_norm": 1.4765625,
"learning_rate": 0.000297,
"loss": 6.7251,
"mean_token_accuracy": 0.12292287200689316,
"num_tokens": 427505.0,
"step": 595
},
{
"entropy": 6.9947303295135494,
"epoch": 0.013838595843808381,
"grad_norm": 1.5703125,
"learning_rate": 0.0002995,
"loss": 6.7802,
"mean_token_accuracy": 0.12400763705372811,
"num_tokens": 431019.0,
"step": 600
},
{
"entropy": 6.831447172164917,
"epoch": 0.013953917475840119,
"grad_norm": 1.59375,
"learning_rate": 0.000302,
"loss": 6.7275,
"mean_token_accuracy": 0.11811881884932518,
"num_tokens": 434958.0,
"step": 605
},
{
"entropy": 6.952916431427002,
"epoch": 0.014069239107871855,
"grad_norm": 1.34375,
"learning_rate": 0.0003045,
"loss": 6.6707,
"mean_token_accuracy": 0.12404478713870049,
"num_tokens": 438819.0,
"step": 610
},
{
"entropy": 6.7603600978851315,
"epoch": 0.01418456073990359,
"grad_norm": 1.5859375,
"learning_rate": 0.000307,
"loss": 6.6654,
"mean_token_accuracy": 0.13465720862150193,
"num_tokens": 442673.0,
"step": 615
},
{
"entropy": 6.749461269378662,
"epoch": 0.014299882371935328,
"grad_norm": 1.625,
"learning_rate": 0.0003095,
"loss": 6.611,
"mean_token_accuracy": 0.141814486682415,
"num_tokens": 446022.0,
"step": 620
},
{
"entropy": 6.744637155532837,
"epoch": 0.014415204003967064,
"grad_norm": 1.671875,
"learning_rate": 0.000312,
"loss": 6.5443,
"mean_token_accuracy": 0.12628007531166077,
"num_tokens": 449417.0,
"step": 625
},
{
"entropy": 6.688572549819947,
"epoch": 0.014530525635998801,
"grad_norm": 1.6796875,
"learning_rate": 0.0003145,
"loss": 6.6076,
"mean_token_accuracy": 0.13569982424378396,
"num_tokens": 452864.0,
"step": 630
},
{
"entropy": 6.912837743759155,
"epoch": 0.014645847268030537,
"grad_norm": 1.6015625,
"learning_rate": 0.000317,
"loss": 6.6372,
"mean_token_accuracy": 0.13416576981544495,
"num_tokens": 456271.0,
"step": 635
},
{
"entropy": 6.784486961364746,
"epoch": 0.014761168900062273,
"grad_norm": 1.640625,
"learning_rate": 0.0003195,
"loss": 6.6531,
"mean_token_accuracy": 0.12497906535863876,
"num_tokens": 459829.0,
"step": 640
},
{
"entropy": 6.867062091827393,
"epoch": 0.01487649053209401,
"grad_norm": 1.4609375,
"learning_rate": 0.000322,
"loss": 6.6887,
"mean_token_accuracy": 0.1274550288915634,
"num_tokens": 463533.0,
"step": 645
},
{
"entropy": 6.910113048553467,
"epoch": 0.014991812164125746,
"grad_norm": 1.5,
"learning_rate": 0.00032450000000000003,
"loss": 6.7957,
"mean_token_accuracy": 0.13574171662330628,
"num_tokens": 467332.0,
"step": 650
},
{
"entropy": 6.789191818237304,
"epoch": 0.015107133796157484,
"grad_norm": 1.6796875,
"learning_rate": 0.00032700000000000003,
"loss": 6.5626,
"mean_token_accuracy": 0.13435751348733901,
"num_tokens": 470873.0,
"step": 655
},
{
"entropy": 6.788733005523682,
"epoch": 0.01522245542818922,
"grad_norm": 1.5234375,
"learning_rate": 0.00032950000000000004,
"loss": 6.7839,
"mean_token_accuracy": 0.12393135279417038,
"num_tokens": 474820.0,
"step": 660
},
{
"entropy": 6.878502368927002,
"epoch": 0.015337777060220957,
"grad_norm": 1.5390625,
"learning_rate": 0.00033200000000000005,
"loss": 6.6323,
"mean_token_accuracy": 0.12036252096295356,
"num_tokens": 478395.0,
"step": 665
},
{
"entropy": 6.82345757484436,
"epoch": 0.015453098692252693,
"grad_norm": 1.546875,
"learning_rate": 0.00033450000000000005,
"loss": 6.6041,
"mean_token_accuracy": 0.12858830615878106,
"num_tokens": 482046.0,
"step": 670
},
{
"entropy": 6.717121648788452,
"epoch": 0.015568420324284429,
"grad_norm": 1.4453125,
"learning_rate": 0.000337,
"loss": 6.7698,
"mean_token_accuracy": 0.1298346571624279,
"num_tokens": 485673.0,
"step": 675
},
{
"entropy": 6.864575338363648,
"epoch": 0.015683741956316166,
"grad_norm": 1.4296875,
"learning_rate": 0.0003395,
"loss": 6.7329,
"mean_token_accuracy": 0.1281518019735813,
"num_tokens": 489481.0,
"step": 680
},
{
"entropy": 6.822469806671142,
"epoch": 0.015799063588347904,
"grad_norm": 1.453125,
"learning_rate": 0.000342,
"loss": 6.6497,
"mean_token_accuracy": 0.11982662305235862,
"num_tokens": 493190.0,
"step": 685
},
{
"entropy": 6.7843328475952145,
"epoch": 0.015914385220379638,
"grad_norm": 1.515625,
"learning_rate": 0.00034449999999999997,
"loss": 6.6649,
"mean_token_accuracy": 0.13050103262066842,
"num_tokens": 496998.0,
"step": 690
},
{
"entropy": 6.7976783275604244,
"epoch": 0.016029706852411375,
"grad_norm": 1.3984375,
"learning_rate": 0.000347,
"loss": 6.5988,
"mean_token_accuracy": 0.12620501667261125,
"num_tokens": 500711.0,
"step": 695
},
{
"entropy": 6.778346061706543,
"epoch": 0.016145028484443113,
"grad_norm": 1.5390625,
"learning_rate": 0.0003495,
"loss": 6.6419,
"mean_token_accuracy": 0.13493644669651986,
"num_tokens": 504320.0,
"step": 700
},
{
"entropy": 6.839865684509277,
"epoch": 0.016260350116474847,
"grad_norm": 1.3203125,
"learning_rate": 0.000352,
"loss": 6.7026,
"mean_token_accuracy": 0.12694861963391305,
"num_tokens": 508591.0,
"step": 705
},
{
"entropy": 6.507184028625488,
"epoch": 0.016375671748506584,
"grad_norm": 1.6875,
"learning_rate": 0.0003545,
"loss": 6.5197,
"mean_token_accuracy": 0.12975703105330466,
"num_tokens": 511954.0,
"step": 710
},
{
"entropy": 6.9446001052856445,
"epoch": 0.016490993380538322,
"grad_norm": 1.6328125,
"learning_rate": 0.000357,
"loss": 6.7093,
"mean_token_accuracy": 0.12820022329688072,
"num_tokens": 515674.0,
"step": 715
},
{
"entropy": 6.730710792541504,
"epoch": 0.01660631501257006,
"grad_norm": 1.46875,
"learning_rate": 0.0003595,
"loss": 6.5776,
"mean_token_accuracy": 0.1299228049814701,
"num_tokens": 519263.0,
"step": 720
},
{
"entropy": 6.626702070236206,
"epoch": 0.016721636644601794,
"grad_norm": 1.7890625,
"learning_rate": 0.000362,
"loss": 6.547,
"mean_token_accuracy": 0.13767884224653243,
"num_tokens": 522852.0,
"step": 725
},
{
"entropy": 6.654131937026977,
"epoch": 0.01683695827663353,
"grad_norm": 1.6171875,
"learning_rate": 0.0003645,
"loss": 6.363,
"mean_token_accuracy": 0.14956862181425096,
"num_tokens": 525895.0,
"step": 730
},
{
"entropy": 6.6195868968963625,
"epoch": 0.01695227990866527,
"grad_norm": 1.53125,
"learning_rate": 0.000367,
"loss": 6.66,
"mean_token_accuracy": 0.1396695040166378,
"num_tokens": 529767.0,
"step": 735
},
{
"entropy": 6.844963073730469,
"epoch": 0.017067601540697003,
"grad_norm": 1.5625,
"learning_rate": 0.0003695,
"loss": 6.6272,
"mean_token_accuracy": 0.13760401010513307,
"num_tokens": 533460.0,
"step": 740
},
{
"entropy": 6.55352029800415,
"epoch": 0.01718292317272874,
"grad_norm": 1.453125,
"learning_rate": 0.000372,
"loss": 6.5484,
"mean_token_accuracy": 0.12853334248065948,
"num_tokens": 536858.0,
"step": 745
},
{
"entropy": 6.739038324356079,
"epoch": 0.017298244804760478,
"grad_norm": 1.3203125,
"learning_rate": 0.0003745,
"loss": 6.5296,
"mean_token_accuracy": 0.134282648563385,
"num_tokens": 540385.0,
"step": 750
},
{
"entropy": 6.603275918960572,
"epoch": 0.017413566436792212,
"grad_norm": 1.484375,
"learning_rate": 0.000377,
"loss": 6.6021,
"mean_token_accuracy": 0.1308648779988289,
"num_tokens": 543900.0,
"step": 755
},
{
"entropy": 6.719392156600952,
"epoch": 0.01752888806882395,
"grad_norm": 1.28125,
"learning_rate": 0.0003795,
"loss": 6.4669,
"mean_token_accuracy": 0.14468610361218454,
"num_tokens": 547698.0,
"step": 760
},
{
"entropy": 6.681492519378662,
"epoch": 0.017644209700855687,
"grad_norm": 1.453125,
"learning_rate": 0.000382,
"loss": 6.4244,
"mean_token_accuracy": 0.1444924809038639,
"num_tokens": 551343.0,
"step": 765
},
{
"entropy": 6.512750577926636,
"epoch": 0.017759531332887424,
"grad_norm": 1.46875,
"learning_rate": 0.0003845,
"loss": 6.5919,
"mean_token_accuracy": 0.13365111723542214,
"num_tokens": 554719.0,
"step": 770
},
{
"entropy": 6.8195850372314455,
"epoch": 0.01787485296491916,
"grad_norm": 1.7734375,
"learning_rate": 0.00038700000000000003,
"loss": 6.4418,
"mean_token_accuracy": 0.14398375824093818,
"num_tokens": 558065.0,
"step": 775
},
{
"entropy": 6.40870418548584,
"epoch": 0.017990174596950896,
"grad_norm": 1.453125,
"learning_rate": 0.00038950000000000003,
"loss": 6.4908,
"mean_token_accuracy": 0.13703683838248254,
"num_tokens": 561838.0,
"step": 780
},
{
"entropy": 6.763089752197265,
"epoch": 0.018105496228982634,
"grad_norm": 1.4921875,
"learning_rate": 0.00039200000000000004,
"loss": 6.5724,
"mean_token_accuracy": 0.13872020468115806,
"num_tokens": 565377.0,
"step": 785
},
{
"entropy": 6.414765214920044,
"epoch": 0.018220817861014368,
"grad_norm": 1.609375,
"learning_rate": 0.00039450000000000005,
"loss": 6.5791,
"mean_token_accuracy": 0.1391117937862873,
"num_tokens": 568820.0,
"step": 790
},
{
"entropy": 6.6232490062713625,
"epoch": 0.018336139493046105,
"grad_norm": 1.3984375,
"learning_rate": 0.00039700000000000005,
"loss": 6.516,
"mean_token_accuracy": 0.14359558895230293,
"num_tokens": 572524.0,
"step": 795
},
{
"entropy": 6.646560907363892,
"epoch": 0.018451461125077843,
"grad_norm": 1.4296875,
"learning_rate": 0.0003995,
"loss": 6.5517,
"mean_token_accuracy": 0.14170725047588348,
"num_tokens": 575928.0,
"step": 800
},
{
"entropy": 6.580789995193482,
"epoch": 0.01856678275710958,
"grad_norm": 1.4296875,
"learning_rate": 0.000402,
"loss": 6.479,
"mean_token_accuracy": 0.1312673196196556,
"num_tokens": 579592.0,
"step": 805
},
{
"entropy": 6.487143564224243,
"epoch": 0.018682104389141314,
"grad_norm": 1.6171875,
"learning_rate": 0.0004045,
"loss": 6.5262,
"mean_token_accuracy": 0.14007846415042877,
"num_tokens": 582901.0,
"step": 810
},
{
"entropy": 6.743833398818969,
"epoch": 0.018797426021173052,
"grad_norm": 1.53125,
"learning_rate": 0.00040699999999999997,
"loss": 6.5645,
"mean_token_accuracy": 0.13733114078640937,
"num_tokens": 586314.0,
"step": 815
},
{
"entropy": 6.649324655532837,
"epoch": 0.01891274765320479,
"grad_norm": 1.5078125,
"learning_rate": 0.0004095,
"loss": 6.5989,
"mean_token_accuracy": 0.12807421162724494,
"num_tokens": 590184.0,
"step": 820
},
{
"entropy": 6.660643291473389,
"epoch": 0.019028069285236524,
"grad_norm": 1.421875,
"learning_rate": 0.000412,
"loss": 6.5451,
"mean_token_accuracy": 0.14784720838069915,
"num_tokens": 594206.0,
"step": 825
},
{
"entropy": 6.582896757125854,
"epoch": 0.01914339091726826,
"grad_norm": 1.421875,
"learning_rate": 0.0004145,
"loss": 6.5935,
"mean_token_accuracy": 0.13174692913889885,
"num_tokens": 597907.0,
"step": 830
},
{
"entropy": 6.467390012741089,
"epoch": 0.0192587125493,
"grad_norm": 1.625,
"learning_rate": 0.000417,
"loss": 6.4295,
"mean_token_accuracy": 0.14666235372424125,
"num_tokens": 601184.0,
"step": 835
},
{
"entropy": 6.50648775100708,
"epoch": 0.019374034181331733,
"grad_norm": 1.515625,
"learning_rate": 0.0004195,
"loss": 6.4344,
"mean_token_accuracy": 0.14619253873825072,
"num_tokens": 604461.0,
"step": 840
},
{
"entropy": 6.624946212768554,
"epoch": 0.01948935581336347,
"grad_norm": 1.625,
"learning_rate": 0.000422,
"loss": 6.4808,
"mean_token_accuracy": 0.1452321670949459,
"num_tokens": 608212.0,
"step": 845
},
{
"entropy": 6.407814979553223,
"epoch": 0.019604677445395208,
"grad_norm": 1.46875,
"learning_rate": 0.0004245,
"loss": 6.4109,
"mean_token_accuracy": 0.1504127100110054,
"num_tokens": 611699.0,
"step": 850
},
{
"entropy": 6.546614694595337,
"epoch": 0.019719999077426945,
"grad_norm": 1.4296875,
"learning_rate": 0.000427,
"loss": 6.5066,
"mean_token_accuracy": 0.13756923452019693,
"num_tokens": 615250.0,
"step": 855
},
{
"entropy": 6.57107834815979,
"epoch": 0.01983532070945868,
"grad_norm": 1.3671875,
"learning_rate": 0.0004295,
"loss": 6.5938,
"mean_token_accuracy": 0.13746437877416612,
"num_tokens": 619212.0,
"step": 860
},
{
"entropy": 6.492978191375732,
"epoch": 0.019950642341490417,
"grad_norm": 1.3203125,
"learning_rate": 0.000432,
"loss": 6.4712,
"mean_token_accuracy": 0.14481520354747773,
"num_tokens": 622968.0,
"step": 865
},
{
"entropy": 6.592170143127442,
"epoch": 0.020065963973522154,
"grad_norm": 1.6875,
"learning_rate": 0.0004345,
"loss": 6.3975,
"mean_token_accuracy": 0.14187804758548736,
"num_tokens": 626246.0,
"step": 870
},
{
"entropy": 6.349250316619873,
"epoch": 0.02018128560555389,
"grad_norm": 1.4140625,
"learning_rate": 0.000437,
"loss": 6.4674,
"mean_token_accuracy": 0.14084591791033746,
"num_tokens": 629587.0,
"step": 875
},
{
"entropy": 6.500652837753296,
"epoch": 0.020296607237585626,
"grad_norm": 1.4609375,
"learning_rate": 0.0004395,
"loss": 6.3655,
"mean_token_accuracy": 0.15314365327358245,
"num_tokens": 633145.0,
"step": 880
},
{
"entropy": 6.598798370361328,
"epoch": 0.020411928869617364,
"grad_norm": 1.6328125,
"learning_rate": 0.000442,
"loss": 6.5983,
"mean_token_accuracy": 0.13979744389653206,
"num_tokens": 636833.0,
"step": 885
},
{
"entropy": 6.562899351119995,
"epoch": 0.020527250501649098,
"grad_norm": 1.421875,
"learning_rate": 0.0004445,
"loss": 6.5048,
"mean_token_accuracy": 0.14217502400279045,
"num_tokens": 640416.0,
"step": 890
},
{
"entropy": 6.388691473007202,
"epoch": 0.020642572133680835,
"grad_norm": 1.5703125,
"learning_rate": 0.000447,
"loss": 6.3969,
"mean_token_accuracy": 0.14934756681323053,
"num_tokens": 643749.0,
"step": 895
},
{
"entropy": 6.443750047683716,
"epoch": 0.020757893765712573,
"grad_norm": 1.5546875,
"learning_rate": 0.00044950000000000003,
"loss": 6.4741,
"mean_token_accuracy": 0.1435583434998989,
"num_tokens": 647324.0,
"step": 900
},
{
"entropy": 6.586315631866455,
"epoch": 0.02087321539774431,
"grad_norm": 1.3984375,
"learning_rate": 0.00045200000000000004,
"loss": 6.5574,
"mean_token_accuracy": 0.14090513586997985,
"num_tokens": 650845.0,
"step": 905
},
{
"entropy": 6.472339391708374,
"epoch": 0.020988537029776044,
"grad_norm": 1.59375,
"learning_rate": 0.00045450000000000004,
"loss": 6.4032,
"mean_token_accuracy": 0.1494538463652134,
"num_tokens": 654241.0,
"step": 910
},
{
"entropy": 6.533646154403686,
"epoch": 0.021103858661807782,
"grad_norm": 1.3984375,
"learning_rate": 0.00045700000000000005,
"loss": 6.5261,
"mean_token_accuracy": 0.13883443772792817,
"num_tokens": 658325.0,
"step": 915
},
{
"entropy": 6.595873832702637,
"epoch": 0.02121918029383952,
"grad_norm": 1.59375,
"learning_rate": 0.00045950000000000006,
"loss": 6.592,
"mean_token_accuracy": 0.12782933786511422,
"num_tokens": 661858.0,
"step": 920
},
{
"entropy": 6.363731098175049,
"epoch": 0.021334501925871253,
"grad_norm": 1.4765625,
"learning_rate": 0.000462,
"loss": 6.4567,
"mean_token_accuracy": 0.1426269829273224,
"num_tokens": 665241.0,
"step": 925
},
{
"entropy": 6.458065557479858,
"epoch": 0.02144982355790299,
"grad_norm": 1.5234375,
"learning_rate": 0.0004645,
"loss": 6.2515,
"mean_token_accuracy": 0.16411956250667573,
"num_tokens": 668551.0,
"step": 930
},
{
"entropy": 6.404357767105102,
"epoch": 0.02156514518993473,
"grad_norm": 1.3984375,
"learning_rate": 0.000467,
"loss": 6.4239,
"mean_token_accuracy": 0.15490319207310677,
"num_tokens": 672042.0,
"step": 935
},
{
"entropy": 6.371016883850098,
"epoch": 0.021680466821966466,
"grad_norm": 1.46875,
"learning_rate": 0.0004695,
"loss": 6.2836,
"mean_token_accuracy": 0.16167665868997574,
"num_tokens": 675439.0,
"step": 940
},
{
"entropy": 6.284253358840942,
"epoch": 0.0217957884539982,
"grad_norm": 1.453125,
"learning_rate": 0.000472,
"loss": 6.4548,
"mean_token_accuracy": 0.14620761722326278,
"num_tokens": 678922.0,
"step": 945
},
{
"entropy": 6.28749361038208,
"epoch": 0.021911110086029938,
"grad_norm": 1.3203125,
"learning_rate": 0.0004745,
"loss": 6.3503,
"mean_token_accuracy": 0.14457938969135284,
"num_tokens": 682158.0,
"step": 950
},
{
"entropy": 6.486617231369019,
"epoch": 0.022026431718061675,
"grad_norm": 1.53125,
"learning_rate": 0.000477,
"loss": 6.3366,
"mean_token_accuracy": 0.15324448347091674,
"num_tokens": 685852.0,
"step": 955
},
{
"entropy": 6.460330247879028,
"epoch": 0.02214175335009341,
"grad_norm": 1.53125,
"learning_rate": 0.0004795,
"loss": 6.5499,
"mean_token_accuracy": 0.1374201148748398,
"num_tokens": 689757.0,
"step": 960
},
{
"entropy": 6.396834039688111,
"epoch": 0.022257074982125147,
"grad_norm": 1.5078125,
"learning_rate": 0.000482,
"loss": 6.3268,
"mean_token_accuracy": 0.16849246844649315,
"num_tokens": 692721.0,
"step": 965
},
{
"entropy": 6.379905891418457,
"epoch": 0.022372396614156884,
"grad_norm": 1.390625,
"learning_rate": 0.0004845,
"loss": 6.5339,
"mean_token_accuracy": 0.14080024287104606,
"num_tokens": 696739.0,
"step": 970
},
{
"entropy": 6.532469081878662,
"epoch": 0.02248771824618862,
"grad_norm": 1.5859375,
"learning_rate": 0.000487,
"loss": 6.3908,
"mean_token_accuracy": 0.14212772697210313,
"num_tokens": 700203.0,
"step": 975
},
{
"entropy": 6.363768005371094,
"epoch": 0.022603039878220356,
"grad_norm": 1.3671875,
"learning_rate": 0.0004895,
"loss": 6.4829,
"mean_token_accuracy": 0.13906411677598954,
"num_tokens": 703675.0,
"step": 980
},
{
"entropy": 6.559950065612793,
"epoch": 0.022718361510252093,
"grad_norm": 1.4375,
"learning_rate": 0.000492,
"loss": 6.4583,
"mean_token_accuracy": 0.1475010745227337,
"num_tokens": 707367.0,
"step": 985
},
{
"entropy": 6.396135044097901,
"epoch": 0.02283368314228383,
"grad_norm": 1.390625,
"learning_rate": 0.0004945,
"loss": 6.4877,
"mean_token_accuracy": 0.14678648263216018,
"num_tokens": 711686.0,
"step": 990
},
{
"entropy": 6.352775239944458,
"epoch": 0.022949004774315565,
"grad_norm": 1.3984375,
"learning_rate": 0.000497,
"loss": 6.3399,
"mean_token_accuracy": 0.15635386481881142,
"num_tokens": 715183.0,
"step": 995
},
{
"entropy": 6.322125101089478,
"epoch": 0.023064326406347303,
"grad_norm": 1.46875,
"learning_rate": 0.0004995,
"loss": 6.3754,
"mean_token_accuracy": 0.14837735146284103,
"num_tokens": 718730.0,
"step": 1000
},
{
"entropy": 6.62501335144043,
"epoch": 0.02317964803837904,
"grad_norm": 1.640625,
"learning_rate": 0.000499998026082006,
"loss": 6.4568,
"mean_token_accuracy": 0.14468817710876464,
"num_tokens": 722187.0,
"step": 1005
},
{
"entropy": 6.32572660446167,
"epoch": 0.023294969670410774,
"grad_norm": 1.546875,
"learning_rate": 0.0004999900070995136,
"loss": 6.3606,
"mean_token_accuracy": 0.15079339742660522,
"num_tokens": 725554.0,
"step": 1010
},
{
"entropy": 6.437408113479615,
"epoch": 0.023410291302442512,
"grad_norm": 1.484375,
"learning_rate": 0.0004999758199023239,
"loss": 6.3909,
"mean_token_accuracy": 0.14708152115345002,
"num_tokens": 728875.0,
"step": 1015
},
{
"entropy": 6.323351812362671,
"epoch": 0.02352561293447425,
"grad_norm": 1.609375,
"learning_rate": 0.0004999554648793858,
"loss": 6.2354,
"mean_token_accuracy": 0.154665906727314,
"num_tokens": 731990.0,
"step": 1020
},
{
"entropy": 6.234646892547607,
"epoch": 0.023640934566505987,
"grad_norm": 1.4140625,
"learning_rate": 0.0004999289425887425,
"loss": 6.3546,
"mean_token_accuracy": 0.1499362073838711,
"num_tokens": 735199.0,
"step": 1025
},
{
"entropy": 6.368152284622193,
"epoch": 0.02375625619853772,
"grad_norm": 1.5,
"learning_rate": 0.0004998962537575161,
"loss": 6.2828,
"mean_token_accuracy": 0.15160825103521347,
"num_tokens": 738783.0,
"step": 1030
},
{
"entropy": 6.303047561645508,
"epoch": 0.02387157783056946,
"grad_norm": 1.421875,
"learning_rate": 0.0004998573992818874,
"loss": 6.3826,
"mean_token_accuracy": 0.15797285735607147,
"num_tokens": 742223.0,
"step": 1035
},
{
"entropy": 6.3283342838287355,
"epoch": 0.023986899462601196,
"grad_norm": 1.3515625,
"learning_rate": 0.0004998123802270715,
"loss": 6.4986,
"mean_token_accuracy": 0.14304248094558716,
"num_tokens": 746360.0,
"step": 1040
},
{
"entropy": 6.484515571594239,
"epoch": 0.02410222109463293,
"grad_norm": 1.5,
"learning_rate": 0.0004997611978272886,
"loss": 6.3573,
"mean_token_accuracy": 0.1527860201895237,
"num_tokens": 749832.0,
"step": 1045
},
{
"entropy": 6.429174757003784,
"epoch": 0.024217542726664668,
"grad_norm": 1.4375,
"learning_rate": 0.0004997038534857298,
"loss": 6.4256,
"mean_token_accuracy": 0.1434988111257553,
"num_tokens": 753658.0,
"step": 1050
},
{
"entropy": 6.292228174209595,
"epoch": 0.024332864358696405,
"grad_norm": 1.484375,
"learning_rate": 0.0004996403487745194,
"loss": 6.3508,
"mean_token_accuracy": 0.1513027109205723,
"num_tokens": 756801.0,
"step": 1055
},
{
"entropy": 6.406886625289917,
"epoch": 0.02444818599072814,
"grad_norm": 1.5078125,
"learning_rate": 0.000499570685434671,
"loss": 6.322,
"mean_token_accuracy": 0.1444218523800373,
"num_tokens": 760156.0,
"step": 1060
},
{
"entropy": 6.368652486801148,
"epoch": 0.024563507622759877,
"grad_norm": 1.4140625,
"learning_rate": 0.0004994948653760405,
"loss": 6.3219,
"mean_token_accuracy": 0.14974402114748955,
"num_tokens": 763698.0,
"step": 1065
},
{
"entropy": 6.330729532241821,
"epoch": 0.024678829254791614,
"grad_norm": 1.3828125,
"learning_rate": 0.0004994128906772729,
"loss": 6.4758,
"mean_token_accuracy": 0.14954668283462524,
"num_tokens": 767064.0,
"step": 1070
},
{
"entropy": 6.414439630508423,
"epoch": 0.024794150886823352,
"grad_norm": 1.4375,
"learning_rate": 0.000499324763585746,
"loss": 6.3369,
"mean_token_accuracy": 0.14358527585864067,
"num_tokens": 770789.0,
"step": 1075
},
{
"entropy": 6.4898388385772705,
"epoch": 0.024909472518855086,
"grad_norm": 1.390625,
"learning_rate": 0.0004992304865175085,
"loss": 6.3947,
"mean_token_accuracy": 0.15396371856331825,
"num_tokens": 774560.0,
"step": 1080
},
{
"entropy": 6.4300370693206785,
"epoch": 0.025024794150886823,
"grad_norm": 1.5859375,
"learning_rate": 0.0004991300620572138,
"loss": 6.2374,
"mean_token_accuracy": 0.15147389471530914,
"num_tokens": 777789.0,
"step": 1085
},
{
"entropy": 6.24727053642273,
"epoch": 0.02514011578291856,
"grad_norm": 1.46875,
"learning_rate": 0.0004990234929580494,
"loss": 6.3495,
"mean_token_accuracy": 0.16117030531167983,
"num_tokens": 781328.0,
"step": 1090
},
{
"entropy": 6.419790601730346,
"epoch": 0.025255437414950295,
"grad_norm": 1.40625,
"learning_rate": 0.0004989107821416609,
"loss": 6.297,
"mean_token_accuracy": 0.1486855238676071,
"num_tokens": 784852.0,
"step": 1095
},
{
"entropy": 6.187773895263672,
"epoch": 0.025370759046982033,
"grad_norm": 1.4765625,
"learning_rate": 0.0004987919326980723,
"loss": 6.3001,
"mean_token_accuracy": 0.15562721565365792,
"num_tokens": 788309.0,
"step": 1100
},
{
"entropy": 6.271272754669189,
"epoch": 0.02548608067901377,
"grad_norm": 1.3046875,
"learning_rate": 0.0004986669478856011,
"loss": 6.3261,
"mean_token_accuracy": 0.15314735174179078,
"num_tokens": 791916.0,
"step": 1105
},
{
"entropy": 6.398954916000366,
"epoch": 0.025601402311045508,
"grad_norm": 1.5078125,
"learning_rate": 0.0004985358311307688,
"loss": 6.2889,
"mean_token_accuracy": 0.1459687538444996,
"num_tokens": 795592.0,
"step": 1110
},
{
"entropy": 6.356507205963135,
"epoch": 0.02571672394307724,
"grad_norm": 1.3515625,
"learning_rate": 0.0004983985860282081,
"loss": 6.4106,
"mean_token_accuracy": 0.1406967006623745,
"num_tokens": 799422.0,
"step": 1115
},
{
"entropy": 6.31441707611084,
"epoch": 0.02583204557510898,
"grad_norm": 1.3359375,
"learning_rate": 0.0004982552163405623,
"loss": 6.3634,
"mean_token_accuracy": 0.15381874442100524,
"num_tokens": 803083.0,
"step": 1120
},
{
"entropy": 6.520481824874878,
"epoch": 0.025947367207140717,
"grad_norm": 1.2734375,
"learning_rate": 0.0004981057259983839,
"loss": 6.2407,
"mean_token_accuracy": 0.16333811581134797,
"num_tokens": 806512.0,
"step": 1125
},
{
"entropy": 6.105662679672241,
"epoch": 0.02606268883917245,
"grad_norm": 1.296875,
"learning_rate": 0.0004979501191000262,
"loss": 6.4007,
"mean_token_accuracy": 0.14836936742067336,
"num_tokens": 810081.0,
"step": 1130
},
{
"entropy": 6.501620149612426,
"epoch": 0.02617801047120419,
"grad_norm": 1.3203125,
"learning_rate": 0.0004977883999115311,
"loss": 6.3522,
"mean_token_accuracy": 0.14895105436444284,
"num_tokens": 813844.0,
"step": 1135
},
{
"entropy": 6.404583597183228,
"epoch": 0.026293332103235926,
"grad_norm": 1.3828125,
"learning_rate": 0.0004976205728665113,
"loss": 6.3696,
"mean_token_accuracy": 0.14931450933218002,
"num_tokens": 817334.0,
"step": 1140
},
{
"entropy": 6.281240224838257,
"epoch": 0.02640865373526766,
"grad_norm": 1.3671875,
"learning_rate": 0.0004974466425660307,
"loss": 6.3009,
"mean_token_accuracy": 0.15151196122169494,
"num_tokens": 821106.0,
"step": 1145
},
{
"entropy": 6.369183921813965,
"epoch": 0.026523975367299397,
"grad_norm": 1.6015625,
"learning_rate": 0.0004972666137784759,
"loss": 6.2973,
"mean_token_accuracy": 0.14527865797281264,
"num_tokens": 824625.0,
"step": 1150
},
{
"entropy": 6.292097520828247,
"epoch": 0.026639296999331135,
"grad_norm": 1.3515625,
"learning_rate": 0.0004970804914394271,
"loss": 6.2235,
"mean_token_accuracy": 0.15668834149837493,
"num_tokens": 827879.0,
"step": 1155
},
{
"entropy": 6.342169237136841,
"epoch": 0.026754618631362873,
"grad_norm": 1.4609375,
"learning_rate": 0.0004968882806515225,
"loss": 6.3533,
"mean_token_accuracy": 0.1557260774075985,
"num_tokens": 831320.0,
"step": 1160
},
{
"entropy": 6.337354612350464,
"epoch": 0.026869940263394607,
"grad_norm": 1.4140625,
"learning_rate": 0.0004966899866843177,
"loss": 6.3641,
"mean_token_accuracy": 0.14013018533587457,
"num_tokens": 834454.0,
"step": 1165
},
{
"entropy": 6.28965950012207,
"epoch": 0.026985261895426344,
"grad_norm": 1.5390625,
"learning_rate": 0.000496485614974142,
"loss": 6.3375,
"mean_token_accuracy": 0.14420116394758226,
"num_tokens": 838182.0,
"step": 1170
},
{
"entropy": 6.224214315414429,
"epoch": 0.02710058352745808,
"grad_norm": 1.4921875,
"learning_rate": 0.0004962751711239492,
"loss": 6.1594,
"mean_token_accuracy": 0.16655184477567672,
"num_tokens": 841684.0,
"step": 1175
},
{
"entropy": 6.411214447021484,
"epoch": 0.027215905159489816,
"grad_norm": 1.328125,
"learning_rate": 0.0004960586609031636,
"loss": 6.4334,
"mean_token_accuracy": 0.14897042885422707,
"num_tokens": 845335.0,
"step": 1180
},
{
"entropy": 6.13843560218811,
"epoch": 0.027331226791521553,
"grad_norm": 1.390625,
"learning_rate": 0.0004958360902475224,
"loss": 6.2975,
"mean_token_accuracy": 0.1526500515639782,
"num_tokens": 848901.0,
"step": 1185
},
{
"entropy": 6.5169679641723635,
"epoch": 0.02744654842355329,
"grad_norm": 1.4375,
"learning_rate": 0.0004956074652589125,
"loss": 6.4083,
"mean_token_accuracy": 0.14077496752142907,
"num_tokens": 852567.0,
"step": 1190
},
{
"entropy": 6.490850639343262,
"epoch": 0.02756187005558503,
"grad_norm": 1.2578125,
"learning_rate": 0.0004953727922052035,
"loss": 6.5075,
"mean_token_accuracy": 0.1386740691959858,
"num_tokens": 856798.0,
"step": 1195
},
{
"entropy": 6.476461887359619,
"epoch": 0.027677191687616762,
"grad_norm": 1.4765625,
"learning_rate": 0.0004951320775200756,
"loss": 6.4133,
"mean_token_accuracy": 0.15248756855726242,
"num_tokens": 860463.0,
"step": 1200
},
{
"entropy": 6.432538557052612,
"epoch": 0.0277925133196485,
"grad_norm": 1.3046875,
"learning_rate": 0.0004948853278028436,
"loss": 6.3843,
"mean_token_accuracy": 0.15762968212366105,
"num_tokens": 864384.0,
"step": 1205
},
{
"entropy": 6.336051321029663,
"epoch": 0.027907834951680238,
"grad_norm": 1.265625,
"learning_rate": 0.0004946325498182755,
"loss": 6.2781,
"mean_token_accuracy": 0.1527209609746933,
"num_tokens": 867928.0,
"step": 1210
},
{
"entropy": 6.312854242324829,
"epoch": 0.02802315658371197,
"grad_norm": 1.34375,
"learning_rate": 0.0004943737504964076,
"loss": 6.1901,
"mean_token_accuracy": 0.15976641923189164,
"num_tokens": 871373.0,
"step": 1215
},
{
"entropy": 6.233778858184815,
"epoch": 0.02813847821574371,
"grad_norm": 1.3828125,
"learning_rate": 0.000494108936932354,
"loss": 6.2842,
"mean_token_accuracy": 0.14794852286577226,
"num_tokens": 875043.0,
"step": 1220
},
{
"entropy": 6.406742811203003,
"epoch": 0.028253799847775447,
"grad_norm": 1.515625,
"learning_rate": 0.0004938381163861124,
"loss": 6.4112,
"mean_token_accuracy": 0.1519480362534523,
"num_tokens": 878329.0,
"step": 1225
},
{
"entropy": 6.168566799163818,
"epoch": 0.02836912147980718,
"grad_norm": 1.578125,
"learning_rate": 0.0004935612962823645,
"loss": 6.2277,
"mean_token_accuracy": 0.15066030025482177,
"num_tokens": 881719.0,
"step": 1230
},
{
"entropy": 6.404153537750244,
"epoch": 0.028484443111838918,
"grad_norm": 1.578125,
"learning_rate": 0.0004932784842102739,
"loss": 6.2438,
"mean_token_accuracy": 0.17476099729537964,
"num_tokens": 885558.0,
"step": 1235
},
{
"entropy": 6.376621150970459,
"epoch": 0.028599764743870656,
"grad_norm": 1.421875,
"learning_rate": 0.0004929896879232758,
"loss": 6.2521,
"mean_token_accuracy": 0.15536654517054557,
"num_tokens": 888882.0,
"step": 1240
},
{
"entropy": 6.256564331054688,
"epoch": 0.028715086375902393,
"grad_norm": 1.3515625,
"learning_rate": 0.0004926949153388668,
"loss": 6.2937,
"mean_token_accuracy": 0.14391650259494781,
"num_tokens": 892599.0,
"step": 1245
},
{
"entropy": 6.316967582702636,
"epoch": 0.028830408007934127,
"grad_norm": 1.4921875,
"learning_rate": 0.0004923941745383859,
"loss": 6.1417,
"mean_token_accuracy": 0.1618731714785099,
"num_tokens": 896314.0,
"step": 1250
},
{
"entropy": 6.0990440368652346,
"epoch": 0.028945729639965865,
"grad_norm": 1.46875,
"learning_rate": 0.000492087473766794,
"loss": 6.1285,
"mean_token_accuracy": 0.16341657787561417,
"num_tokens": 899822.0,
"step": 1255
},
{
"entropy": 6.209489202499389,
"epoch": 0.029061051271997602,
"grad_norm": 1.5234375,
"learning_rate": 0.000491774821432448,
"loss": 6.2634,
"mean_token_accuracy": 0.1522805154323578,
"num_tokens": 903076.0,
"step": 1260
},
{
"entropy": 6.091508293151856,
"epoch": 0.029176372904029337,
"grad_norm": 1.4609375,
"learning_rate": 0.0004914562261068693,
"loss": 6.0647,
"mean_token_accuracy": 0.15861415714025498,
"num_tokens": 906270.0,
"step": 1265
},
{
"entropy": 6.227058696746826,
"epoch": 0.029291694536061074,
"grad_norm": 1.296875,
"learning_rate": 0.0004911316965245098,
"loss": 6.1538,
"mean_token_accuracy": 0.16386841982603073,
"num_tokens": 909749.0,
"step": 1270
},
{
"entropy": 6.407493352890015,
"epoch": 0.02940701616809281,
"grad_norm": 1.296875,
"learning_rate": 0.000490801241582512,
"loss": 6.4111,
"mean_token_accuracy": 0.14004577994346618,
"num_tokens": 913513.0,
"step": 1275
},
{
"entropy": 6.329074144363403,
"epoch": 0.029522337800124546,
"grad_norm": 1.3125,
"learning_rate": 0.000490464870340465,
"loss": 6.2342,
"mean_token_accuracy": 0.1552743799984455,
"num_tokens": 917233.0,
"step": 1280
},
{
"entropy": 6.136275959014893,
"epoch": 0.029637659432156283,
"grad_norm": 1.5703125,
"learning_rate": 0.0004901225920201563,
"loss": 6.2121,
"mean_token_accuracy": 0.15740371942520143,
"num_tokens": 920667.0,
"step": 1285
},
{
"entropy": 6.190396308898926,
"epoch": 0.02975298106418802,
"grad_norm": 1.546875,
"learning_rate": 0.000489774416005319,
"loss": 6.1827,
"mean_token_accuracy": 0.17489669919013978,
"num_tokens": 924089.0,
"step": 1290
},
{
"entropy": 6.07538161277771,
"epoch": 0.02986830269621976,
"grad_norm": 1.578125,
"learning_rate": 0.0004894203518413742,
"loss": 6.137,
"mean_token_accuracy": 0.16207724213600158,
"num_tokens": 927677.0,
"step": 1295
},
{
"entropy": 6.431777620315552,
"epoch": 0.029983624328251492,
"grad_norm": 1.46875,
"learning_rate": 0.0004890604092351701,
"loss": 6.2296,
"mean_token_accuracy": 0.15114597231149673,
"num_tokens": 931103.0,
"step": 1300
},
{
"entropy": 6.223585557937622,
"epoch": 0.03009894596028323,
"grad_norm": 1.3046875,
"learning_rate": 0.000488694598054715,
"loss": 6.2609,
"mean_token_accuracy": 0.1521705225110054,
"num_tokens": 934898.0,
"step": 1305
},
{
"entropy": 6.319894886016845,
"epoch": 0.030214267592314967,
"grad_norm": 1.3984375,
"learning_rate": 0.0004883229283289071,
"loss": 6.1789,
"mean_token_accuracy": 0.15976286232471465,
"num_tokens": 938065.0,
"step": 1310
},
{
"entropy": 6.2378973960876465,
"epoch": 0.0303295892243467,
"grad_norm": 1.3828125,
"learning_rate": 0.00048794541024725993,
"loss": 6.2546,
"mean_token_accuracy": 0.15641364604234695,
"num_tokens": 941841.0,
"step": 1315
},
{
"entropy": 6.289143991470337,
"epoch": 0.03044491085637844,
"grad_norm": 1.421875,
"learning_rate": 0.0004875620541596221,
"loss": 6.2547,
"mean_token_accuracy": 0.15297225639224052,
"num_tokens": 945498.0,
"step": 1320
},
{
"entropy": 6.34889588356018,
"epoch": 0.030560232488410177,
"grad_norm": 1.3203125,
"learning_rate": 0.00048717287057589454,
"loss": 6.2074,
"mean_token_accuracy": 0.15397942066192627,
"num_tokens": 949043.0,
"step": 1325
},
{
"entropy": 6.282046842575073,
"epoch": 0.030675554120441914,
"grad_norm": 1.3515625,
"learning_rate": 0.0004867778701657417,
"loss": 6.2069,
"mean_token_accuracy": 0.15130080431699752,
"num_tokens": 952868.0,
"step": 1330
},
{
"entropy": 6.258489274978638,
"epoch": 0.030790875752473648,
"grad_norm": 1.390625,
"learning_rate": 0.00048637706375829955,
"loss": 6.0432,
"mean_token_accuracy": 0.1698402062058449,
"num_tokens": 956112.0,
"step": 1335
},
{
"entropy": 6.061002588272094,
"epoch": 0.030906197384505386,
"grad_norm": 1.4765625,
"learning_rate": 0.000485970462341878,
"loss": 6.2071,
"mean_token_accuracy": 0.1544427402317524,
"num_tokens": 959742.0,
"step": 1340
},
{
"entropy": 6.380103063583374,
"epoch": 0.031021519016537123,
"grad_norm": 1.4296875,
"learning_rate": 0.00048555807706366044,
"loss": 6.2252,
"mean_token_accuracy": 0.14561877325177192,
"num_tokens": 963153.0,
"step": 1345
},
{
"entropy": 6.16155161857605,
"epoch": 0.031136840648568857,
"grad_norm": 1.4140625,
"learning_rate": 0.00048513991922939756,
"loss": 6.173,
"mean_token_accuracy": 0.15342152416706084,
"num_tokens": 966531.0,
"step": 1350
},
{
"entropy": 6.135410356521606,
"epoch": 0.0312521622806006,
"grad_norm": 1.46875,
"learning_rate": 0.00048471600030309744,
"loss": 6.2382,
"mean_token_accuracy": 0.15941717475652695,
"num_tokens": 970441.0,
"step": 1355
},
{
"entropy": 6.366029977798462,
"epoch": 0.03136748391263233,
"grad_norm": 1.484375,
"learning_rate": 0.00048428633190671186,
"loss": 6.2376,
"mean_token_accuracy": 0.15529564544558525,
"num_tokens": 974081.0,
"step": 1360
},
{
"entropy": 6.170897102355957,
"epoch": 0.031482805544664066,
"grad_norm": 1.5,
"learning_rate": 0.0004838509258198167,
"loss": 6.2066,
"mean_token_accuracy": 0.15893015414476394,
"num_tokens": 977477.0,
"step": 1365
},
{
"entropy": 6.194993352890014,
"epoch": 0.03159812717669581,
"grad_norm": 1.4765625,
"learning_rate": 0.00048340979397929,
"loss": 6.2529,
"mean_token_accuracy": 0.15727411061525345,
"num_tokens": 980672.0,
"step": 1370
},
{
"entropy": 6.271054458618164,
"epoch": 0.03171344880872754,
"grad_norm": 1.359375,
"learning_rate": 0.00048296294847898386,
"loss": 6.1784,
"mean_token_accuracy": 0.15967788249254228,
"num_tokens": 984148.0,
"step": 1375
},
{
"entropy": 6.081877613067627,
"epoch": 0.031828770440759276,
"grad_norm": 1.359375,
"learning_rate": 0.0004825104015693934,
"loss": 6.1263,
"mean_token_accuracy": 0.1539233572781086,
"num_tokens": 987532.0,
"step": 1380
},
{
"entropy": 6.235986709594727,
"epoch": 0.03194409207279102,
"grad_norm": 1.28125,
"learning_rate": 0.0004820521656573208,
"loss": 6.252,
"mean_token_accuracy": 0.15114179700613023,
"num_tokens": 991300.0,
"step": 1385
},
{
"entropy": 6.245265817642212,
"epoch": 0.03205941370482275,
"grad_norm": 1.4296875,
"learning_rate": 0.00048158825330553505,
"loss": 6.1516,
"mean_token_accuracy": 0.1626199223101139,
"num_tokens": 994860.0,
"step": 1390
},
{
"entropy": 6.267541837692261,
"epoch": 0.032174735336854485,
"grad_norm": 1.3359375,
"learning_rate": 0.00048111867723242763,
"loss": 6.0817,
"mean_token_accuracy": 0.15991926193237305,
"num_tokens": 998320.0,
"step": 1395
},
{
"entropy": 6.178429985046387,
"epoch": 0.032290056968886226,
"grad_norm": 1.4140625,
"learning_rate": 0.0004806434503116637,
"loss": 6.136,
"mean_token_accuracy": 0.1581188626587391,
"num_tokens": 1001510.0,
"step": 1400
},
{
"entropy": 6.200129270553589,
"epoch": 0.03240537860091796,
"grad_norm": 1.40625,
"learning_rate": 0.0004801625855718296,
"loss": 6.1459,
"mean_token_accuracy": 0.15652914941310883,
"num_tokens": 1005051.0,
"step": 1405
},
{
"entropy": 6.050179481506348,
"epoch": 0.032520700232949694,
"grad_norm": 1.4765625,
"learning_rate": 0.00047967609619607477,
"loss": 6.099,
"mean_token_accuracy": 0.16462735533714296,
"num_tokens": 1008339.0,
"step": 1410
},
{
"entropy": 6.331070899963379,
"epoch": 0.032636021864981435,
"grad_norm": 1.2265625,
"learning_rate": 0.0004791839955217513,
"loss": 6.3128,
"mean_token_accuracy": 0.15583118200302123,
"num_tokens": 1012072.0,
"step": 1415
},
{
"entropy": 6.371997499465943,
"epoch": 0.03275134349701317,
"grad_norm": 1.375,
"learning_rate": 0.00047868629704004786,
"loss": 6.1849,
"mean_token_accuracy": 0.16881252229213714,
"num_tokens": 1015733.0,
"step": 1420
},
{
"entropy": 6.142761659622193,
"epoch": 0.0328666651290449,
"grad_norm": 1.390625,
"learning_rate": 0.00047818301439561965,
"loss": 6.3103,
"mean_token_accuracy": 0.1449531525373459,
"num_tokens": 1019723.0,
"step": 1425
},
{
"entropy": 6.3080970287323,
"epoch": 0.032981986761076644,
"grad_norm": 1.2734375,
"learning_rate": 0.00047767416138621454,
"loss": 6.1312,
"mean_token_accuracy": 0.16128634810447692,
"num_tokens": 1023399.0,
"step": 1430
},
{
"entropy": 6.1839087963104244,
"epoch": 0.03309730839310838,
"grad_norm": 1.2421875,
"learning_rate": 0.000477159751962295,
"loss": 6.3179,
"mean_token_accuracy": 0.14733664467930793,
"num_tokens": 1027654.0,
"step": 1435
},
{
"entropy": 6.340977716445923,
"epoch": 0.03321263002514012,
"grad_norm": 1.515625,
"learning_rate": 0.00047663980022665507,
"loss": 6.2318,
"mean_token_accuracy": 0.15191248804330826,
"num_tokens": 1031093.0,
"step": 1440
},
{
"entropy": 6.1485453128814695,
"epoch": 0.03332795165717185,
"grad_norm": 1.359375,
"learning_rate": 0.00047611432043403437,
"loss": 6.1431,
"mean_token_accuracy": 0.1620752789080143,
"num_tokens": 1034283.0,
"step": 1445
},
{
"entropy": 6.151244878768921,
"epoch": 0.03344327328920359,
"grad_norm": 1.421875,
"learning_rate": 0.0004755833269907267,
"loss": 6.0321,
"mean_token_accuracy": 0.16732411906123162,
"num_tokens": 1038026.0,
"step": 1450
},
{
"entropy": 6.320617818832398,
"epoch": 0.03355859492123533,
"grad_norm": 1.34375,
"learning_rate": 0.0004750468344541857,
"loss": 6.1843,
"mean_token_accuracy": 0.1639467418193817,
"num_tokens": 1041691.0,
"step": 1455
},
{
"entropy": 6.232364463806152,
"epoch": 0.03367391655326706,
"grad_norm": 1.5390625,
"learning_rate": 0.00047450485753262525,
"loss": 6.2904,
"mean_token_accuracy": 0.15383075401186944,
"num_tokens": 1045355.0,
"step": 1460
},
{
"entropy": 6.2604328155517575,
"epoch": 0.033789238185298796,
"grad_norm": 1.4140625,
"learning_rate": 0.00047395741108461633,
"loss": 6.2302,
"mean_token_accuracy": 0.16124827265739441,
"num_tokens": 1048708.0,
"step": 1465
},
{
"entropy": 6.1916501998901365,
"epoch": 0.03390455981733054,
"grad_norm": 1.4765625,
"learning_rate": 0.00047340451011867985,
"loss": 6.1116,
"mean_token_accuracy": 0.15790043771266937,
"num_tokens": 1052193.0,
"step": 1470
},
{
"entropy": 6.245907640457153,
"epoch": 0.03401988144936227,
"grad_norm": 1.3828125,
"learning_rate": 0.00047284616979287515,
"loss": 6.1081,
"mean_token_accuracy": 0.16149753630161284,
"num_tokens": 1055680.0,
"step": 1475
},
{
"entropy": 6.276849269866943,
"epoch": 0.034135203081394005,
"grad_norm": 1.4375,
"learning_rate": 0.00047228240541438433,
"loss": 6.2724,
"mean_token_accuracy": 0.14618031084537506,
"num_tokens": 1059594.0,
"step": 1480
},
{
"entropy": 5.961967182159424,
"epoch": 0.034250524713425747,
"grad_norm": 1.34375,
"learning_rate": 0.00047171323243909257,
"loss": 6.0493,
"mean_token_accuracy": 0.16997741907835007,
"num_tokens": 1062911.0,
"step": 1485
},
{
"entropy": 6.177064704895019,
"epoch": 0.03436584634545748,
"grad_norm": 1.3515625,
"learning_rate": 0.00047113866647116457,
"loss": 6.1622,
"mean_token_accuracy": 0.1611722856760025,
"num_tokens": 1066682.0,
"step": 1490
},
{
"entropy": 6.3686439990997314,
"epoch": 0.034481167977489215,
"grad_norm": 1.3515625,
"learning_rate": 0.0004705587232626164,
"loss": 6.3555,
"mean_token_accuracy": 0.14763259887695312,
"num_tokens": 1070559.0,
"step": 1495
},
{
"entropy": 6.399481296539307,
"epoch": 0.034596489609520956,
"grad_norm": 1.3984375,
"learning_rate": 0.00046997341871288424,
"loss": 6.1886,
"mean_token_accuracy": 0.14196808710694314,
"num_tokens": 1074079.0,
"step": 1500
},
{
"entropy": 6.146364688873291,
"epoch": 0.03471181124155269,
"grad_norm": 1.6953125,
"learning_rate": 0.0004693827688683879,
"loss": 6.1912,
"mean_token_accuracy": 0.1646449625492096,
"num_tokens": 1077450.0,
"step": 1505
},
{
"entropy": 6.380840110778808,
"epoch": 0.034827132873584424,
"grad_norm": 1.4140625,
"learning_rate": 0.0004687867899220914,
"loss": 6.2751,
"mean_token_accuracy": 0.156388820707798,
"num_tokens": 1081104.0,
"step": 1510
},
{
"entropy": 6.217929935455322,
"epoch": 0.034942454505616165,
"grad_norm": 1.5625,
"learning_rate": 0.00046818549821305846,
"loss": 6.0832,
"mean_token_accuracy": 0.16631921082735063,
"num_tokens": 1084525.0,
"step": 1515
},
{
"entropy": 6.082294082641601,
"epoch": 0.0350577761376479,
"grad_norm": 1.5546875,
"learning_rate": 0.00046757891022600494,
"loss": 6.1173,
"mean_token_accuracy": 0.1607721894979477,
"num_tokens": 1088073.0,
"step": 1520
},
{
"entropy": 6.161862897872925,
"epoch": 0.03517309776967964,
"grad_norm": 1.3515625,
"learning_rate": 0.0004669670425908471,
"loss": 6.1957,
"mean_token_accuracy": 0.1579139418900013,
"num_tokens": 1091471.0,
"step": 1525
},
{
"entropy": 6.222669076919556,
"epoch": 0.035288419401711374,
"grad_norm": 1.390625,
"learning_rate": 0.0004663499120822451,
"loss": 5.9901,
"mean_token_accuracy": 0.17222017496824266,
"num_tokens": 1095176.0,
"step": 1530
},
{
"entropy": 6.170104169845581,
"epoch": 0.03540374103374311,
"grad_norm": 1.359375,
"learning_rate": 0.0004657275356191437,
"loss": 6.1183,
"mean_token_accuracy": 0.16429525017738342,
"num_tokens": 1098802.0,
"step": 1535
},
{
"entropy": 6.188034915924073,
"epoch": 0.03551906266577485,
"grad_norm": 1.3359375,
"learning_rate": 0.00046509993026430804,
"loss": 6.0601,
"mean_token_accuracy": 0.16619377508759497,
"num_tokens": 1102470.0,
"step": 1540
},
{
"entropy": 6.193576955795288,
"epoch": 0.03563438429780658,
"grad_norm": 1.390625,
"learning_rate": 0.0004644671132238558,
"loss": 6.0983,
"mean_token_accuracy": 0.15427771657705308,
"num_tokens": 1106357.0,
"step": 1545
},
{
"entropy": 6.105885171890259,
"epoch": 0.03574970592983832,
"grad_norm": 1.4765625,
"learning_rate": 0.00046382910184678585,
"loss": 6.2517,
"mean_token_accuracy": 0.15719945058226586,
"num_tokens": 1109793.0,
"step": 1550
},
{
"entropy": 6.085718631744385,
"epoch": 0.03586502756187006,
"grad_norm": 1.4453125,
"learning_rate": 0.0004631859136245025,
"loss": 6.1414,
"mean_token_accuracy": 0.16397046595811843,
"num_tokens": 1113168.0,
"step": 1555
},
{
"entropy": 6.27104434967041,
"epoch": 0.03598034919390179,
"grad_norm": 1.1640625,
"learning_rate": 0.0004625375661903357,
"loss": 6.1152,
"mean_token_accuracy": 0.16101985722780227,
"num_tokens": 1117049.0,
"step": 1560
},
{
"entropy": 6.293149995803833,
"epoch": 0.036095670825933526,
"grad_norm": 1.59375,
"learning_rate": 0.00046188407731905787,
"loss": 6.1739,
"mean_token_accuracy": 0.15761781558394433,
"num_tokens": 1120560.0,
"step": 1565
},
{
"entropy": 6.117485427856446,
"epoch": 0.03621099245796527,
"grad_norm": 1.3828125,
"learning_rate": 0.00046122546492639643,
"loss": 6.0227,
"mean_token_accuracy": 0.1623656965792179,
"num_tokens": 1124005.0,
"step": 1570
},
{
"entropy": 6.099512052536011,
"epoch": 0.036326314089997,
"grad_norm": 1.5078125,
"learning_rate": 0.000460561747068543,
"loss": 6.1301,
"mean_token_accuracy": 0.16618029475212098,
"num_tokens": 1127407.0,
"step": 1575
},
{
"entropy": 6.252836036682129,
"epoch": 0.036441635722028735,
"grad_norm": 1.2890625,
"learning_rate": 0.0004598929419416578,
"loss": 6.0248,
"mean_token_accuracy": 0.17052212357521057,
"num_tokens": 1131011.0,
"step": 1580
},
{
"entropy": 6.10662841796875,
"epoch": 0.036556957354060476,
"grad_norm": 1.4921875,
"learning_rate": 0.00045921906788137123,
"loss": 6.0539,
"mean_token_accuracy": 0.16527445167303084,
"num_tokens": 1134427.0,
"step": 1585
},
{
"entropy": 6.235507965087891,
"epoch": 0.03667227898609221,
"grad_norm": 1.421875,
"learning_rate": 0.00045854014336228115,
"loss": 6.1162,
"mean_token_accuracy": 0.1626933127641678,
"num_tokens": 1138337.0,
"step": 1590
},
{
"entropy": 6.110680294036865,
"epoch": 0.036787600618123945,
"grad_norm": 1.3046875,
"learning_rate": 0.00045785618699744615,
"loss": 6.1271,
"mean_token_accuracy": 0.1606894239783287,
"num_tokens": 1142123.0,
"step": 1595
},
{
"entropy": 6.190400838851929,
"epoch": 0.036902922250155686,
"grad_norm": 1.4609375,
"learning_rate": 0.00045716721753787543,
"loss": 6.081,
"mean_token_accuracy": 0.16977082192897797,
"num_tokens": 1145338.0,
"step": 1600
},
{
"entropy": 6.240235757827759,
"epoch": 0.03701824388218742,
"grad_norm": 1.34375,
"learning_rate": 0.0004564732538720148,
"loss": 6.2268,
"mean_token_accuracy": 0.15114571154117584,
"num_tokens": 1149277.0,
"step": 1605
},
{
"entropy": 6.209791994094848,
"epoch": 0.03713356551421916,
"grad_norm": 1.296875,
"learning_rate": 0.00045577431502522877,
"loss": 6.2289,
"mean_token_accuracy": 0.1607456311583519,
"num_tokens": 1152776.0,
"step": 1610
},
{
"entropy": 6.08086576461792,
"epoch": 0.037248887146250895,
"grad_norm": 1.4609375,
"learning_rate": 0.0004550704201592787,
"loss": 5.9521,
"mean_token_accuracy": 0.1620200291275978,
"num_tokens": 1156389.0,
"step": 1615
},
{
"entropy": 6.049930000305176,
"epoch": 0.03736420877828263,
"grad_norm": 1.4375,
"learning_rate": 0.0004543615885717981,
"loss": 6.0107,
"mean_token_accuracy": 0.16893413960933684,
"num_tokens": 1159350.0,
"step": 1620
},
{
"entropy": 6.2026038646698,
"epoch": 0.03747953041031437,
"grad_norm": 1.5,
"learning_rate": 0.00045364783969576296,
"loss": 6.0943,
"mean_token_accuracy": 0.1669295035302639,
"num_tokens": 1163030.0,
"step": 1625
},
{
"entropy": 6.159232568740845,
"epoch": 0.037594852042346104,
"grad_norm": 1.5078125,
"learning_rate": 0.0004529291930989592,
"loss": 6.055,
"mean_token_accuracy": 0.15932923331856727,
"num_tokens": 1166353.0,
"step": 1630
},
{
"entropy": 6.360183811187744,
"epoch": 0.03771017367437784,
"grad_norm": 1.4375,
"learning_rate": 0.0004522056684834464,
"loss": 6.1436,
"mean_token_accuracy": 0.1584683448076248,
"num_tokens": 1170085.0,
"step": 1635
},
{
"entropy": 6.089408349990845,
"epoch": 0.03782549530640958,
"grad_norm": 1.5390625,
"learning_rate": 0.0004514772856850173,
"loss": 6.0428,
"mean_token_accuracy": 0.16163670271635056,
"num_tokens": 1173345.0,
"step": 1640
},
{
"entropy": 6.08073844909668,
"epoch": 0.03794081693844131,
"grad_norm": 1.3671875,
"learning_rate": 0.0004507440646726542,
"loss": 6.1306,
"mean_token_accuracy": 0.17117144614458085,
"num_tokens": 1177166.0,
"step": 1645
},
{
"entropy": 6.259210252761841,
"epoch": 0.03805613857047305,
"grad_norm": 1.4296875,
"learning_rate": 0.0004500060255479818,
"loss": 6.0583,
"mean_token_accuracy": 0.16698935478925706,
"num_tokens": 1180962.0,
"step": 1650
},
{
"entropy": 6.145126819610596,
"epoch": 0.03817146020250479,
"grad_norm": 1.515625,
"learning_rate": 0.0004492631885447151,
"loss": 6.1212,
"mean_token_accuracy": 0.15358480364084243,
"num_tokens": 1184545.0,
"step": 1655
},
{
"entropy": 6.112510061264038,
"epoch": 0.03828678183453652,
"grad_norm": 1.46875,
"learning_rate": 0.00044851557402810616,
"loss": 6.0536,
"mean_token_accuracy": 0.17121080309152603,
"num_tokens": 1188151.0,
"step": 1660
},
{
"entropy": 6.1365796566009525,
"epoch": 0.038402103466568256,
"grad_norm": 1.4140625,
"learning_rate": 0.00044776320249438444,
"loss": 6.125,
"mean_token_accuracy": 0.16721008867025375,
"num_tokens": 1191616.0,
"step": 1665
},
{
"entropy": 6.255848693847656,
"epoch": 0.0385174250986,
"grad_norm": 1.390625,
"learning_rate": 0.00044700609457019565,
"loss": 6.0572,
"mean_token_accuracy": 0.17096714824438095,
"num_tokens": 1195151.0,
"step": 1670
},
{
"entropy": 6.254526996612549,
"epoch": 0.03863274673063173,
"grad_norm": 1.4921875,
"learning_rate": 0.0004462442710120359,
"loss": 6.1225,
"mean_token_accuracy": 0.16628739684820176,
"num_tokens": 1198424.0,
"step": 1675
},
{
"entropy": 5.967656421661377,
"epoch": 0.038748068362663465,
"grad_norm": 1.4453125,
"learning_rate": 0.000445477752705683,
"loss": 5.8662,
"mean_token_accuracy": 0.17162444740533828,
"num_tokens": 1201734.0,
"step": 1680
},
{
"entropy": 6.045426559448242,
"epoch": 0.038863389994695206,
"grad_norm": 1.3125,
"learning_rate": 0.00044470656066562336,
"loss": 6.0132,
"mean_token_accuracy": 0.16216118335723878,
"num_tokens": 1205459.0,
"step": 1685
},
{
"entropy": 6.162248420715332,
"epoch": 0.03897871162672694,
"grad_norm": 1.4921875,
"learning_rate": 0.0004439307160344765,
"loss": 6.0186,
"mean_token_accuracy": 0.16619355976581573,
"num_tokens": 1208834.0,
"step": 1690
},
{
"entropy": 6.174242544174194,
"epoch": 0.03909403325875868,
"grad_norm": 1.3046875,
"learning_rate": 0.00044315024008241473,
"loss": 6.259,
"mean_token_accuracy": 0.1478450171649456,
"num_tokens": 1212784.0,
"step": 1695
},
{
"entropy": 6.343083000183105,
"epoch": 0.039209354890790415,
"grad_norm": 1.359375,
"learning_rate": 0.0004423651542065806,
"loss": 6.1379,
"mean_token_accuracy": 0.16056481152772903,
"num_tokens": 1216374.0,
"step": 1700
},
{
"entropy": 6.180943155288697,
"epoch": 0.03932467652282215,
"grad_norm": 1.390625,
"learning_rate": 0.00044157547993050006,
"loss": 5.9442,
"mean_token_accuracy": 0.16904959678649903,
"num_tokens": 1219897.0,
"step": 1705
},
{
"entropy": 6.13713960647583,
"epoch": 0.03943999815485389,
"grad_norm": 1.3828125,
"learning_rate": 0.00044078123890349227,
"loss": 6.1175,
"mean_token_accuracy": 0.15540150851011275,
"num_tokens": 1223440.0,
"step": 1710
},
{
"entropy": 6.13908748626709,
"epoch": 0.039555319786885625,
"grad_norm": 1.4609375,
"learning_rate": 0.00043998245290007606,
"loss": 6.1601,
"mean_token_accuracy": 0.1486704558134079,
"num_tokens": 1227074.0,
"step": 1715
},
{
"entropy": 6.146241235733032,
"epoch": 0.03967064141891736,
"grad_norm": 1.3515625,
"learning_rate": 0.00043917914381937323,
"loss": 6.1146,
"mean_token_accuracy": 0.1662242069840431,
"num_tokens": 1230921.0,
"step": 1720
},
{
"entropy": 6.26403398513794,
"epoch": 0.0397859630509491,
"grad_norm": 1.46875,
"learning_rate": 0.00043837133368450815,
"loss": 6.0855,
"mean_token_accuracy": 0.16866125166416168,
"num_tokens": 1234409.0,
"step": 1725
},
{
"entropy": 6.221911668777466,
"epoch": 0.039901284682980834,
"grad_norm": 1.328125,
"learning_rate": 0.0004375590446420037,
"loss": 6.2278,
"mean_token_accuracy": 0.15684191808104514,
"num_tokens": 1237808.0,
"step": 1730
},
{
"entropy": 6.181419134140015,
"epoch": 0.04001660631501257,
"grad_norm": 1.40625,
"learning_rate": 0.0004367422989611743,
"loss": 6.098,
"mean_token_accuracy": 0.16497262716293334,
"num_tokens": 1241342.0,
"step": 1735
},
{
"entropy": 6.125293397903443,
"epoch": 0.04013192794704431,
"grad_norm": 1.4140625,
"learning_rate": 0.0004359211190335153,
"loss": 6.0605,
"mean_token_accuracy": 0.1732634887099266,
"num_tokens": 1244754.0,
"step": 1740
},
{
"entropy": 6.169851303100586,
"epoch": 0.04024724957907604,
"grad_norm": 1.421875,
"learning_rate": 0.00043509552737208923,
"loss": 6.0142,
"mean_token_accuracy": 0.16834313720464705,
"num_tokens": 1248104.0,
"step": 1745
},
{
"entropy": 6.123953056335449,
"epoch": 0.04036257121110778,
"grad_norm": 1.5390625,
"learning_rate": 0.00043426554661090853,
"loss": 5.9814,
"mean_token_accuracy": 0.16525087058544158,
"num_tokens": 1251447.0,
"step": 1750
},
{
"entropy": 6.168983697891235,
"epoch": 0.04047789284313952,
"grad_norm": 1.4453125,
"learning_rate": 0.00043343119950431516,
"loss": 6.0766,
"mean_token_accuracy": 0.15967110991477967,
"num_tokens": 1254820.0,
"step": 1755
},
{
"entropy": 6.107172632217408,
"epoch": 0.04059321447517125,
"grad_norm": 1.421875,
"learning_rate": 0.00043259250892635644,
"loss": 6.041,
"mean_token_accuracy": 0.1613576665520668,
"num_tokens": 1258539.0,
"step": 1760
},
{
"entropy": 5.984593915939331,
"epoch": 0.040708536107202986,
"grad_norm": 1.4296875,
"learning_rate": 0.0004317494978701582,
"loss": 5.7816,
"mean_token_accuracy": 0.1790942892432213,
"num_tokens": 1261900.0,
"step": 1765
},
{
"entropy": 5.936560773849488,
"epoch": 0.04082385773923473,
"grad_norm": 1.46875,
"learning_rate": 0.0004309021894472943,
"loss": 6.0371,
"mean_token_accuracy": 0.16590082943439483,
"num_tokens": 1265575.0,
"step": 1770
},
{
"entropy": 6.07541332244873,
"epoch": 0.04093917937126646,
"grad_norm": 1.421875,
"learning_rate": 0.0004300506068871534,
"loss": 6.0828,
"mean_token_accuracy": 0.1611502930521965,
"num_tokens": 1269290.0,
"step": 1775
},
{
"entropy": 6.282960844039917,
"epoch": 0.041054501003298195,
"grad_norm": 1.3125,
"learning_rate": 0.00042919477353630135,
"loss": 6.1452,
"mean_token_accuracy": 0.152590075135231,
"num_tokens": 1273253.0,
"step": 1780
},
{
"entropy": 6.1060491561889645,
"epoch": 0.041169822635329936,
"grad_norm": 1.53125,
"learning_rate": 0.000428334712857842,
"loss": 6.0466,
"mean_token_accuracy": 0.16835376545786856,
"num_tokens": 1276535.0,
"step": 1785
},
{
"entropy": 6.045465660095215,
"epoch": 0.04128514426736167,
"grad_norm": 1.4609375,
"learning_rate": 0.00042747044843077304,
"loss": 6.0242,
"mean_token_accuracy": 0.1612742379307747,
"num_tokens": 1279862.0,
"step": 1790
},
{
"entropy": 6.100957536697388,
"epoch": 0.04140046589939341,
"grad_norm": 1.40625,
"learning_rate": 0.00042660200394934047,
"loss": 6.1149,
"mean_token_accuracy": 0.16432895213365556,
"num_tokens": 1283671.0,
"step": 1795
},
{
"entropy": 6.261464691162109,
"epoch": 0.041515787531425145,
"grad_norm": 1.40625,
"learning_rate": 0.00042572940322238844,
"loss": 6.168,
"mean_token_accuracy": 0.1580469474196434,
"num_tokens": 1287545.0,
"step": 1800
},
{
"entropy": 6.333411931991577,
"epoch": 0.04163110916345688,
"grad_norm": 1.3671875,
"learning_rate": 0.00042485267017270664,
"loss": 6.1423,
"mean_token_accuracy": 0.15818402767181397,
"num_tokens": 1291044.0,
"step": 1805
},
{
"entropy": 5.994283294677734,
"epoch": 0.04174643079548862,
"grad_norm": 1.53125,
"learning_rate": 0.0004239718288363745,
"loss": 5.8878,
"mean_token_accuracy": 0.1756291300058365,
"num_tokens": 1294349.0,
"step": 1810
},
{
"entropy": 6.019616651535034,
"epoch": 0.041861752427520355,
"grad_norm": 1.5625,
"learning_rate": 0.0004230869033621023,
"loss": 6.0313,
"mean_token_accuracy": 0.17268310487270355,
"num_tokens": 1297723.0,
"step": 1815
},
{
"entropy": 6.098737716674805,
"epoch": 0.04197707405955209,
"grad_norm": 1.375,
"learning_rate": 0.0004221979180105688,
"loss": 6.088,
"mean_token_accuracy": 0.1723474606871605,
"num_tokens": 1301370.0,
"step": 1820
},
{
"entropy": 6.12902455329895,
"epoch": 0.04209239569158383,
"grad_norm": 1.3984375,
"learning_rate": 0.00042130489715375645,
"loss": 5.9812,
"mean_token_accuracy": 0.16246043741703034,
"num_tokens": 1304883.0,
"step": 1825
},
{
"entropy": 6.216316795349121,
"epoch": 0.042207717323615564,
"grad_norm": 1.5234375,
"learning_rate": 0.00042040786527428335,
"loss": 5.998,
"mean_token_accuracy": 0.1586702957749367,
"num_tokens": 1308764.0,
"step": 1830
},
{
"entropy": 5.99324049949646,
"epoch": 0.0423230389556473,
"grad_norm": 1.3515625,
"learning_rate": 0.0004195068469647315,
"loss": 5.8561,
"mean_token_accuracy": 0.18727454245090486,
"num_tokens": 1312252.0,
"step": 1835
},
{
"entropy": 5.980302715301514,
"epoch": 0.04243836058767904,
"grad_norm": 1.5625,
"learning_rate": 0.00041860186692697297,
"loss": 6.045,
"mean_token_accuracy": 0.16267816126346588,
"num_tokens": 1316115.0,
"step": 1840
},
{
"entropy": 6.071458625793457,
"epoch": 0.04255368221971077,
"grad_norm": 1.390625,
"learning_rate": 0.00041769294997149264,
"loss": 5.9403,
"mean_token_accuracy": 0.17197509184479715,
"num_tokens": 1319384.0,
"step": 1845
},
{
"entropy": 6.084967470169067,
"epoch": 0.04266900385174251,
"grad_norm": 1.4921875,
"learning_rate": 0.0004167801210167081,
"loss": 5.9177,
"mean_token_accuracy": 0.17900481671094895,
"num_tokens": 1322726.0,
"step": 1850
},
{
"entropy": 5.911493730545044,
"epoch": 0.04278432548377425,
"grad_norm": 1.3515625,
"learning_rate": 0.0004158634050882861,
"loss": 6.0838,
"mean_token_accuracy": 0.17069419026374816,
"num_tokens": 1326359.0,
"step": 1855
},
{
"entropy": 6.0123388290405275,
"epoch": 0.04289964711580598,
"grad_norm": 1.4140625,
"learning_rate": 0.0004149428273184569,
"loss": 5.9369,
"mean_token_accuracy": 0.17325670272111893,
"num_tokens": 1329645.0,
"step": 1860
},
{
"entropy": 6.215741968154907,
"epoch": 0.043014968747837716,
"grad_norm": 1.46875,
"learning_rate": 0.0004140184129453253,
"loss": 6.0017,
"mean_token_accuracy": 0.16124175488948822,
"num_tokens": 1332967.0,
"step": 1865
},
{
"entropy": 5.920040416717529,
"epoch": 0.04313029037986946,
"grad_norm": 1.4609375,
"learning_rate": 0.000413090187312178,
"loss": 5.9215,
"mean_token_accuracy": 0.16948316097259522,
"num_tokens": 1336279.0,
"step": 1870
},
{
"entropy": 6.086005544662475,
"epoch": 0.04324561201190119,
"grad_norm": 1.359375,
"learning_rate": 0.0004121581758667898,
"loss": 6.0365,
"mean_token_accuracy": 0.15829629004001616,
"num_tokens": 1339885.0,
"step": 1875
},
{
"entropy": 5.960381555557251,
"epoch": 0.04336093364393293,
"grad_norm": 1.453125,
"learning_rate": 0.00041122240416072533,
"loss": 5.8319,
"mean_token_accuracy": 0.18557217270135878,
"num_tokens": 1343302.0,
"step": 1880
},
{
"entropy": 6.04316668510437,
"epoch": 0.043476255275964666,
"grad_norm": 1.390625,
"learning_rate": 0.0004102828978486385,
"loss": 6.0363,
"mean_token_accuracy": 0.1671247199177742,
"num_tokens": 1346981.0,
"step": 1885
},
{
"entropy": 5.998887348175049,
"epoch": 0.0435915769079964,
"grad_norm": 1.296875,
"learning_rate": 0.0004093396826875695,
"loss": 5.8593,
"mean_token_accuracy": 0.17538370937108994,
"num_tokens": 1350566.0,
"step": 1890
},
{
"entropy": 5.967190217971802,
"epoch": 0.04370689854002814,
"grad_norm": 1.265625,
"learning_rate": 0.00040839278453623837,
"loss": 5.9101,
"mean_token_accuracy": 0.17191963642835617,
"num_tokens": 1353798.0,
"step": 1895
},
{
"entropy": 6.035793685913086,
"epoch": 0.043822220172059875,
"grad_norm": 1.3203125,
"learning_rate": 0.0004074422293543363,
"loss": 6.0761,
"mean_token_accuracy": 0.17167042195796967,
"num_tokens": 1357248.0,
"step": 1900
},
{
"entropy": 6.194664382934571,
"epoch": 0.04393754180409161,
"grad_norm": 1.3359375,
"learning_rate": 0.0004064880432018137,
"loss": 5.9681,
"mean_token_accuracy": 0.17110309451818467,
"num_tokens": 1360949.0,
"step": 1905
},
{
"entropy": 6.144906425476075,
"epoch": 0.04405286343612335,
"grad_norm": 1.5,
"learning_rate": 0.00040553025223816615,
"loss": 5.9874,
"mean_token_accuracy": 0.17255610078573227,
"num_tokens": 1364769.0,
"step": 1910
},
{
"entropy": 6.042750453948974,
"epoch": 0.044168185068155084,
"grad_norm": 1.3359375,
"learning_rate": 0.00040456888272171653,
"loss": 6.2085,
"mean_token_accuracy": 0.16712530329823494,
"num_tokens": 1368719.0,
"step": 1915
},
{
"entropy": 6.225994491577149,
"epoch": 0.04428350670018682,
"grad_norm": 1.3046875,
"learning_rate": 0.00040360396100889577,
"loss": 5.9441,
"mean_token_accuracy": 0.17468636780977248,
"num_tokens": 1372767.0,
"step": 1920
},
{
"entropy": 6.085239028930664,
"epoch": 0.04439882833221856,
"grad_norm": 1.5625,
"learning_rate": 0.0004026355135535202,
"loss": 5.914,
"mean_token_accuracy": 0.15781303942203523,
"num_tokens": 1376327.0,
"step": 1925
},
{
"entropy": 5.871431922912597,
"epoch": 0.044514149964250294,
"grad_norm": 1.359375,
"learning_rate": 0.000401663566906066,
"loss": 5.9378,
"mean_token_accuracy": 0.18061802089214324,
"num_tokens": 1379956.0,
"step": 1930
},
{
"entropy": 6.072559881210327,
"epoch": 0.04462947159628203,
"grad_norm": 1.453125,
"learning_rate": 0.00040068814771294134,
"loss": 6.0744,
"mean_token_accuracy": 0.1600572906434536,
"num_tokens": 1383328.0,
"step": 1935
},
{
"entropy": 6.146542501449585,
"epoch": 0.04474479322831377,
"grad_norm": 1.2734375,
"learning_rate": 0.0003997092827157562,
"loss": 5.9009,
"mean_token_accuracy": 0.16003982871770858,
"num_tokens": 1386891.0,
"step": 1940
},
{
"entropy": 6.113406229019165,
"epoch": 0.0448601148603455,
"grad_norm": 1.3984375,
"learning_rate": 0.000398726998750589,
"loss": 6.0516,
"mean_token_accuracy": 0.16761437505483628,
"num_tokens": 1390278.0,
"step": 1945
},
{
"entropy": 6.074669027328492,
"epoch": 0.04497543649237724,
"grad_norm": 1.3203125,
"learning_rate": 0.00039774132274725076,
"loss": 6.0108,
"mean_token_accuracy": 0.16349065601825713,
"num_tokens": 1393840.0,
"step": 1950
},
{
"entropy": 6.203750133514404,
"epoch": 0.04509075812440898,
"grad_norm": 1.484375,
"learning_rate": 0.00039675228172854707,
"loss": 5.9007,
"mean_token_accuracy": 0.16745836585760115,
"num_tokens": 1396850.0,
"step": 1955
},
{
"entropy": 6.045851993560791,
"epoch": 0.04520607975644071,
"grad_norm": 1.484375,
"learning_rate": 0.0003957599028095371,
"loss": 5.8931,
"mean_token_accuracy": 0.17089987993240358,
"num_tokens": 1400340.0,
"step": 1960
},
{
"entropy": 6.128950214385986,
"epoch": 0.04532140138847245,
"grad_norm": 1.2734375,
"learning_rate": 0.00039476421319679017,
"loss": 6.0904,
"mean_token_accuracy": 0.15978260785341264,
"num_tokens": 1404167.0,
"step": 1965
},
{
"entropy": 6.085157871246338,
"epoch": 0.04543672302050419,
"grad_norm": 1.28125,
"learning_rate": 0.00039376524018764,
"loss": 5.8612,
"mean_token_accuracy": 0.17234077155590058,
"num_tokens": 1407858.0,
"step": 1970
},
{
"entropy": 6.035274887084961,
"epoch": 0.04555204465253592,
"grad_norm": 1.53125,
"learning_rate": 0.00039276301116943616,
"loss": 6.0,
"mean_token_accuracy": 0.16681650429964065,
"num_tokens": 1411238.0,
"step": 1975
},
{
"entropy": 6.05155463218689,
"epoch": 0.04566736628456766,
"grad_norm": 1.453125,
"learning_rate": 0.0003917575536187936,
"loss": 5.8926,
"mean_token_accuracy": 0.17386517375707627,
"num_tokens": 1414698.0,
"step": 1980
},
{
"entropy": 6.057000255584716,
"epoch": 0.045782687916599396,
"grad_norm": 1.4296875,
"learning_rate": 0.00039074889510083894,
"loss": 5.9789,
"mean_token_accuracy": 0.16450004428625106,
"num_tokens": 1418126.0,
"step": 1985
},
{
"entropy": 6.009735202789306,
"epoch": 0.04589800954863113,
"grad_norm": 1.390625,
"learning_rate": 0.00038973706326845495,
"loss": 5.9558,
"mean_token_accuracy": 0.16979953050613403,
"num_tokens": 1421572.0,
"step": 1990
},
{
"entropy": 6.145390844345092,
"epoch": 0.04601333118066287,
"grad_norm": 1.3359375,
"learning_rate": 0.0003887220858615225,
"loss": 5.9862,
"mean_token_accuracy": 0.1639215901494026,
"num_tokens": 1424995.0,
"step": 1995
},
{
"entropy": 6.1229006290435795,
"epoch": 0.046128652812694605,
"grad_norm": 1.4453125,
"learning_rate": 0.0003877039907061597,
"loss": 6.0202,
"mean_token_accuracy": 0.16905055791139603,
"num_tokens": 1428326.0,
"step": 2000
},
{
"entropy": 6.236930561065674,
"epoch": 0.04624397444472634,
"grad_norm": 1.390625,
"learning_rate": 0.0003866828057139598,
"loss": 6.1615,
"mean_token_accuracy": 0.15661614537239074,
"num_tokens": 1432206.0,
"step": 2005
},
{
"entropy": 6.0727519512176515,
"epoch": 0.04635929607675808,
"grad_norm": 1.359375,
"learning_rate": 0.00038565855888122503,
"loss": 5.9146,
"mean_token_accuracy": 0.17826643586158752,
"num_tokens": 1435764.0,
"step": 2010
},
{
"entropy": 5.952383375167846,
"epoch": 0.046474617708789814,
"grad_norm": 1.3828125,
"learning_rate": 0.00038463127828819975,
"loss": 5.9709,
"mean_token_accuracy": 0.17173793017864228,
"num_tokens": 1439048.0,
"step": 2015
},
{
"entropy": 6.11073317527771,
"epoch": 0.04658993934082155,
"grad_norm": 1.515625,
"learning_rate": 0.00038360099209830043,
"loss": 6.0497,
"mean_token_accuracy": 0.16235739290714263,
"num_tokens": 1442660.0,
"step": 2020
},
{
"entropy": 6.364213371276856,
"epoch": 0.04670526097285329,
"grad_norm": 1.4453125,
"learning_rate": 0.0003825677285573433,
"loss": 6.047,
"mean_token_accuracy": 0.15798935294151306,
"num_tokens": 1446625.0,
"step": 2025
},
{
"entropy": 6.2205322742462155,
"epoch": 0.046820582604885023,
"grad_norm": 1.328125,
"learning_rate": 0.00038153151599277027,
"loss": 6.0725,
"mean_token_accuracy": 0.16297839134931563,
"num_tokens": 1450887.0,
"step": 2030
},
{
"entropy": 6.067619657516479,
"epoch": 0.04693590423691676,
"grad_norm": 1.59375,
"learning_rate": 0.0003804923828128723,
"loss": 5.9589,
"mean_token_accuracy": 0.15966229513287544,
"num_tokens": 1454301.0,
"step": 2035
},
{
"entropy": 6.015921974182129,
"epoch": 0.0470512258689485,
"grad_norm": 1.46875,
"learning_rate": 0.0003794503575060104,
"loss": 5.9391,
"mean_token_accuracy": 0.1790228709578514,
"num_tokens": 1457763.0,
"step": 2040
},
{
"entropy": 6.139227962493896,
"epoch": 0.04716654750098023,
"grad_norm": 1.4140625,
"learning_rate": 0.00037840546863983484,
"loss": 6.0676,
"mean_token_accuracy": 0.16168534755706787,
"num_tokens": 1461731.0,
"step": 2045
},
{
"entropy": 6.214613533020019,
"epoch": 0.047281869133011974,
"grad_norm": 1.390625,
"learning_rate": 0.0003773577448605015,
"loss": 5.9339,
"mean_token_accuracy": 0.16974954903125763,
"num_tokens": 1465231.0,
"step": 2050
},
{
"entropy": 6.098228883743286,
"epoch": 0.04739719076504371,
"grad_norm": 1.375,
"learning_rate": 0.0003763072148918872,
"loss": 5.9126,
"mean_token_accuracy": 0.17898860722780227,
"num_tokens": 1468847.0,
"step": 2055
},
{
"entropy": 6.021309328079224,
"epoch": 0.04751251239707544,
"grad_norm": 1.34375,
"learning_rate": 0.0003752539075348017,
"loss": 6.0203,
"mean_token_accuracy": 0.16555785089731218,
"num_tokens": 1472830.0,
"step": 2060
},
{
"entropy": 6.07875280380249,
"epoch": 0.04762783402910718,
"grad_norm": 1.40625,
"learning_rate": 0.00037419785166619817,
"loss": 6.0217,
"mean_token_accuracy": 0.15808642283082008,
"num_tokens": 1476242.0,
"step": 2065
},
{
"entropy": 6.041919994354248,
"epoch": 0.04774315566113892,
"grad_norm": 1.328125,
"learning_rate": 0.0003731390762383818,
"loss": 5.9391,
"mean_token_accuracy": 0.16811346262693405,
"num_tokens": 1480003.0,
"step": 2070
},
{
"entropy": 6.065379619598389,
"epoch": 0.04785847729317065,
"grad_norm": 1.4921875,
"learning_rate": 0.0003720776102782158,
"loss": 5.9406,
"mean_token_accuracy": 0.16069750785827636,
"num_tokens": 1483418.0,
"step": 2075
},
{
"entropy": 5.945605278015137,
"epoch": 0.04797379892520239,
"grad_norm": 1.390625,
"learning_rate": 0.00037101348288632555,
"loss": 5.9164,
"mean_token_accuracy": 0.16400371938943864,
"num_tokens": 1487169.0,
"step": 2080
},
{
"entropy": 5.955249404907226,
"epoch": 0.048089120557234126,
"grad_norm": 1.34375,
"learning_rate": 0.0003699467232363012,
"loss": 5.8412,
"mean_token_accuracy": 0.1820058837532997,
"num_tokens": 1490506.0,
"step": 2085
},
{
"entropy": 5.966968297958374,
"epoch": 0.04820444218926586,
"grad_norm": 1.40625,
"learning_rate": 0.0003688773605738973,
"loss": 5.8842,
"mean_token_accuracy": 0.17049288526177406,
"num_tokens": 1494110.0,
"step": 2090
},
{
"entropy": 6.009013938903808,
"epoch": 0.0483197638212976,
"grad_norm": 1.4609375,
"learning_rate": 0.00036780542421623134,
"loss": 5.9609,
"mean_token_accuracy": 0.16247643604874612,
"num_tokens": 1497594.0,
"step": 2095
},
{
"entropy": 5.94654278755188,
"epoch": 0.048435085453329335,
"grad_norm": 1.546875,
"learning_rate": 0.0003667309435509802,
"loss": 5.7844,
"mean_token_accuracy": 0.1888134077191353,
"num_tokens": 1500838.0,
"step": 2100
},
{
"entropy": 5.914694166183471,
"epoch": 0.04855040708536107,
"grad_norm": 1.3984375,
"learning_rate": 0.0003656539480355741,
"loss": 6.0189,
"mean_token_accuracy": 0.16929620802402495,
"num_tokens": 1504338.0,
"step": 2105
},
{
"entropy": 6.058946943283081,
"epoch": 0.04866572871739281,
"grad_norm": 1.3515625,
"learning_rate": 0.0003645744671963891,
"loss": 6.0116,
"mean_token_accuracy": 0.17386874854564666,
"num_tokens": 1508085.0,
"step": 2110
},
{
"entropy": 6.115987825393677,
"epoch": 0.048781050349424544,
"grad_norm": 1.4140625,
"learning_rate": 0.0003634925306279376,
"loss": 6.0028,
"mean_token_accuracy": 0.16438793689012526,
"num_tokens": 1511846.0,
"step": 2115
},
{
"entropy": 6.000114917755127,
"epoch": 0.04889637198145628,
"grad_norm": 1.40625,
"learning_rate": 0.0003624081679920574,
"loss": 5.8214,
"mean_token_accuracy": 0.1761823520064354,
"num_tokens": 1515277.0,
"step": 2120
},
{
"entropy": 5.977673053741455,
"epoch": 0.04901169361348802,
"grad_norm": 1.40625,
"learning_rate": 0.0003613214090170977,
"loss": 5.7725,
"mean_token_accuracy": 0.1801084578037262,
"num_tokens": 1518872.0,
"step": 2125
},
{
"entropy": 5.881729221343994,
"epoch": 0.04912701524551975,
"grad_norm": 1.421875,
"learning_rate": 0.0003602322834971048,
"loss": 5.8849,
"mean_token_accuracy": 0.17433423697948455,
"num_tokens": 1522613.0,
"step": 2130
},
{
"entropy": 5.9374007225036625,
"epoch": 0.049242336877551494,
"grad_norm": 1.3359375,
"learning_rate": 0.0003591408212910051,
"loss": 6.042,
"mean_token_accuracy": 0.16684025377035142,
"num_tokens": 1526629.0,
"step": 2135
},
{
"entropy": 6.113653039932251,
"epoch": 0.04935765850958323,
"grad_norm": 1.375,
"learning_rate": 0.0003580470523217863,
"loss": 5.8506,
"mean_token_accuracy": 0.17982762604951857,
"num_tokens": 1530185.0,
"step": 2140
},
{
"entropy": 6.001288795471192,
"epoch": 0.04947298014161496,
"grad_norm": 1.4765625,
"learning_rate": 0.0003569510065756771,
"loss": 6.055,
"mean_token_accuracy": 0.16616662591695786,
"num_tokens": 1533608.0,
"step": 2145
},
{
"entropy": 5.973288202285767,
"epoch": 0.049588301773646704,
"grad_norm": 1.640625,
"learning_rate": 0.0003558527141013254,
"loss": 5.9956,
"mean_token_accuracy": 0.171682408452034,
"num_tokens": 1536852.0,
"step": 2150
},
{
"entropy": 6.0692524909973145,
"epoch": 0.04970362340567844,
"grad_norm": 1.4609375,
"learning_rate": 0.0003547522050089742,
"loss": 5.8491,
"mean_token_accuracy": 0.1771762453019619,
"num_tokens": 1540236.0,
"step": 2155
},
{
"entropy": 6.147887372970581,
"epoch": 0.04981894503771017,
"grad_norm": 1.3046875,
"learning_rate": 0.00035364950946963606,
"loss": 5.9819,
"mean_token_accuracy": 0.16693336963653566,
"num_tokens": 1543711.0,
"step": 2160
},
{
"entropy": 6.083334589004517,
"epoch": 0.04993426666974191,
"grad_norm": 1.546875,
"learning_rate": 0.0003525446577142663,
"loss": 5.9676,
"mean_token_accuracy": 0.16684302687644958,
"num_tokens": 1547011.0,
"step": 2165
},
{
"entropy": 6.1137855529785154,
"epoch": 0.05004958830177365,
"grad_norm": 1.3671875,
"learning_rate": 0.00035143768003293395,
"loss": 6.013,
"mean_token_accuracy": 0.16679638773202896,
"num_tokens": 1550733.0,
"step": 2170
},
{
"entropy": 6.084979581832886,
"epoch": 0.05016490993380538,
"grad_norm": 1.40625,
"learning_rate": 0.0003503286067739913,
"loss": 6.0092,
"mean_token_accuracy": 0.17218167185783387,
"num_tokens": 1554337.0,
"step": 2175
},
{
"entropy": 5.925091505050659,
"epoch": 0.05028023156583712,
"grad_norm": 1.4140625,
"learning_rate": 0.00034921746834324193,
"loss": 5.82,
"mean_token_accuracy": 0.17224141359329223,
"num_tokens": 1557613.0,
"step": 2180
},
{
"entropy": 5.929932689666748,
"epoch": 0.050395553197868856,
"grad_norm": 1.3125,
"learning_rate": 0.0003481042952031072,
"loss": 5.9713,
"mean_token_accuracy": 0.17252454310655593,
"num_tokens": 1561384.0,
"step": 2185
},
{
"entropy": 6.017917442321777,
"epoch": 0.05051087482990059,
"grad_norm": 1.3203125,
"learning_rate": 0.0003469891178717911,
"loss": 5.853,
"mean_token_accuracy": 0.17023051977157594,
"num_tokens": 1564714.0,
"step": 2190
},
{
"entropy": 5.832478809356689,
"epoch": 0.05062619646193233,
"grad_norm": 1.4765625,
"learning_rate": 0.0003458719669224436,
"loss": 5.753,
"mean_token_accuracy": 0.1918713331222534,
"num_tokens": 1568058.0,
"step": 2195
},
{
"entropy": 5.825899982452393,
"epoch": 0.050741518093964065,
"grad_norm": 1.3671875,
"learning_rate": 0.0003447528729823221,
"loss": 5.8239,
"mean_token_accuracy": 0.17855536490678786,
"num_tokens": 1571601.0,
"step": 2200
},
{
"entropy": 5.984312915802002,
"epoch": 0.0508568397259958,
"grad_norm": 1.40625,
"learning_rate": 0.0003436318667319525,
"loss": 5.8299,
"mean_token_accuracy": 0.17291364669799805,
"num_tokens": 1575330.0,
"step": 2205
},
{
"entropy": 5.860138988494873,
"epoch": 0.05097216135802754,
"grad_norm": 1.46875,
"learning_rate": 0.00034250897890428716,
"loss": 5.7909,
"mean_token_accuracy": 0.17980906069278718,
"num_tokens": 1578799.0,
"step": 2210
},
{
"entropy": 5.926511240005493,
"epoch": 0.051087482990059274,
"grad_norm": 1.46875,
"learning_rate": 0.0003413842402838633,
"loss": 5.8022,
"mean_token_accuracy": 0.1776898205280304,
"num_tokens": 1582213.0,
"step": 2215
},
{
"entropy": 6.108406400680542,
"epoch": 0.051202804622091015,
"grad_norm": 1.265625,
"learning_rate": 0.00034025768170595834,
"loss": 6.0471,
"mean_token_accuracy": 0.15622774809598922,
"num_tokens": 1586199.0,
"step": 2220
},
{
"entropy": 6.051778173446655,
"epoch": 0.05131812625412275,
"grad_norm": 1.4375,
"learning_rate": 0.0003391293340557446,
"loss": 5.9098,
"mean_token_accuracy": 0.168331515789032,
"num_tokens": 1589869.0,
"step": 2225
},
{
"entropy": 5.972296619415284,
"epoch": 0.05143344788615448,
"grad_norm": 1.4140625,
"learning_rate": 0.0003379992282674431,
"loss": 5.8421,
"mean_token_accuracy": 0.16960253119468688,
"num_tokens": 1593340.0,
"step": 2230
},
{
"entropy": 6.1102211475372314,
"epoch": 0.051548769518186224,
"grad_norm": 1.3828125,
"learning_rate": 0.0003368673953234749,
"loss": 6.0165,
"mean_token_accuracy": 0.15275024324655534,
"num_tokens": 1597465.0,
"step": 2235
},
{
"entropy": 5.97629976272583,
"epoch": 0.05166409115021796,
"grad_norm": 1.5078125,
"learning_rate": 0.00033573386625361176,
"loss": 5.8649,
"mean_token_accuracy": 0.16652099490165712,
"num_tokens": 1601057.0,
"step": 2240
},
{
"entropy": 5.825031757354736,
"epoch": 0.05177941278224969,
"grad_norm": 1.421875,
"learning_rate": 0.00033459867213412567,
"loss": 5.827,
"mean_token_accuracy": 0.1894167572259903,
"num_tokens": 1604570.0,
"step": 2245
},
{
"entropy": 6.007895374298096,
"epoch": 0.05189473441428143,
"grad_norm": 1.328125,
"learning_rate": 0.000333461844086937,
"loss": 6.0169,
"mean_token_accuracy": 0.17256359457969667,
"num_tokens": 1608163.0,
"step": 2250
},
{
"entropy": 5.969921875,
"epoch": 0.05201005604631317,
"grad_norm": 1.4765625,
"learning_rate": 0.00033232341327876097,
"loss": 5.6233,
"mean_token_accuracy": 0.1894993156194687,
"num_tokens": 1611208.0,
"step": 2255
},
{
"entropy": 5.962341260910034,
"epoch": 0.0521253776783449,
"grad_norm": 1.40625,
"learning_rate": 0.0003311834109202531,
"loss": 5.9119,
"mean_token_accuracy": 0.17642295062541963,
"num_tokens": 1614752.0,
"step": 2260
},
{
"entropy": 5.906010150909424,
"epoch": 0.05224069931037664,
"grad_norm": 1.5078125,
"learning_rate": 0.00033004186826515416,
"loss": 5.8531,
"mean_token_accuracy": 0.1669125124812126,
"num_tokens": 1618157.0,
"step": 2265
},
{
"entropy": 6.021723937988281,
"epoch": 0.05235602094240838,
"grad_norm": 1.3203125,
"learning_rate": 0.0003288988166094324,
"loss": 5.8282,
"mean_token_accuracy": 0.18255583345890045,
"num_tokens": 1621489.0,
"step": 2270
},
{
"entropy": 6.020850753784179,
"epoch": 0.05247134257444011,
"grad_norm": 1.4609375,
"learning_rate": 0.00032775428729042656,
"loss": 5.9097,
"mean_token_accuracy": 0.1747518941760063,
"num_tokens": 1624658.0,
"step": 2275
},
{
"entropy": 6.0344264030456545,
"epoch": 0.05258666420647185,
"grad_norm": 1.3125,
"learning_rate": 0.000326608311685986,
"loss": 6.0199,
"mean_token_accuracy": 0.1666715383529663,
"num_tokens": 1628607.0,
"step": 2280
},
{
"entropy": 5.989352369308472,
"epoch": 0.052701985838503586,
"grad_norm": 1.46875,
"learning_rate": 0.0003254609212136108,
"loss": 5.8121,
"mean_token_accuracy": 0.18332432955503464,
"num_tokens": 1631932.0,
"step": 2285
},
{
"entropy": 6.0163475513458256,
"epoch": 0.05281730747053532,
"grad_norm": 1.4609375,
"learning_rate": 0.00032431214732959036,
"loss": 5.933,
"mean_token_accuracy": 0.16141737550497054,
"num_tokens": 1635997.0,
"step": 2290
},
{
"entropy": 6.215541744232178,
"epoch": 0.05293262910256706,
"grad_norm": 1.4140625,
"learning_rate": 0.000323162021528141,
"loss": 6.0482,
"mean_token_accuracy": 0.170789997279644,
"num_tokens": 1639791.0,
"step": 2295
},
{
"entropy": 5.967877388000488,
"epoch": 0.053047950734598795,
"grad_norm": 1.3984375,
"learning_rate": 0.00032201057534054264,
"loss": 5.8909,
"mean_token_accuracy": 0.18046397417783738,
"num_tokens": 1643330.0,
"step": 2300
},
{
"entropy": 5.922166919708252,
"epoch": 0.053163272366630536,
"grad_norm": 1.3671875,
"learning_rate": 0.00032085784033427414,
"loss": 5.8549,
"mean_token_accuracy": 0.18044275790452957,
"num_tokens": 1647032.0,
"step": 2305
},
{
"entropy": 5.904247760772705,
"epoch": 0.05327859399866227,
"grad_norm": 1.484375,
"learning_rate": 0.0003197038481121478,
"loss": 5.9249,
"mean_token_accuracy": 0.16608510613441468,
"num_tokens": 1650433.0,
"step": 2310
},
{
"entropy": 5.849363517761231,
"epoch": 0.053393915630694004,
"grad_norm": 1.421875,
"learning_rate": 0.0003185486303114436,
"loss": 5.7361,
"mean_token_accuracy": 0.19181705117225648,
"num_tokens": 1653885.0,
"step": 2315
},
{
"entropy": 5.972066164016724,
"epoch": 0.053509237262725745,
"grad_norm": 1.3359375,
"learning_rate": 0.0003173922186030409,
"loss": 5.9231,
"mean_token_accuracy": 0.17057469636201858,
"num_tokens": 1657762.0,
"step": 2320
},
{
"entropy": 6.076327896118164,
"epoch": 0.05362455889475748,
"grad_norm": 1.3203125,
"learning_rate": 0.000316234644690551,
"loss": 6.036,
"mean_token_accuracy": 0.1628196932375431,
"num_tokens": 1661520.0,
"step": 2325
},
{
"entropy": 6.134958648681641,
"epoch": 0.05373988052678921,
"grad_norm": 1.5,
"learning_rate": 0.0003150759403094473,
"loss": 5.9004,
"mean_token_accuracy": 0.1698158487677574,
"num_tokens": 1665308.0,
"step": 2330
},
{
"entropy": 5.875095081329346,
"epoch": 0.053855202158820954,
"grad_norm": 1.40625,
"learning_rate": 0.00031391613722619587,
"loss": 5.8404,
"mean_token_accuracy": 0.17533595412969588,
"num_tokens": 1668657.0,
"step": 2335
},
{
"entropy": 5.911960506439209,
"epoch": 0.05397052379085269,
"grad_norm": 1.5078125,
"learning_rate": 0.000312755267237384,
"loss": 5.8772,
"mean_token_accuracy": 0.17444742619991302,
"num_tokens": 1672194.0,
"step": 2340
},
{
"entropy": 5.93304853439331,
"epoch": 0.05408584542288442,
"grad_norm": 1.3515625,
"learning_rate": 0.0003115933621688488,
"loss": 5.8287,
"mean_token_accuracy": 0.17251134365797044,
"num_tokens": 1675515.0,
"step": 2345
},
{
"entropy": 6.095355892181397,
"epoch": 0.05420116705491616,
"grad_norm": 1.3515625,
"learning_rate": 0.00031043045387480487,
"loss": 5.915,
"mean_token_accuracy": 0.16847942024469376,
"num_tokens": 1679170.0,
"step": 2350
},
{
"entropy": 5.956024789810181,
"epoch": 0.0543164886869479,
"grad_norm": 1.421875,
"learning_rate": 0.0003092665742369703,
"loss": 5.8882,
"mean_token_accuracy": 0.1752202644944191,
"num_tokens": 1682628.0,
"step": 2355
},
{
"entropy": 5.803276300430298,
"epoch": 0.05443181031897963,
"grad_norm": 1.40625,
"learning_rate": 0.00030810175516369343,
"loss": 5.8464,
"mean_token_accuracy": 0.18446773141622544,
"num_tokens": 1685996.0,
"step": 2360
},
{
"entropy": 5.894187259674072,
"epoch": 0.05454713195101137,
"grad_norm": 1.3359375,
"learning_rate": 0.0003069360285890775,
"loss": 5.7054,
"mean_token_accuracy": 0.188694728910923,
"num_tokens": 1689571.0,
"step": 2365
},
{
"entropy": 5.941043281555176,
"epoch": 0.05466245358304311,
"grad_norm": 1.390625,
"learning_rate": 0.00030576942647210547,
"loss": 5.7748,
"mean_token_accuracy": 0.18053148537874222,
"num_tokens": 1693281.0,
"step": 2370
},
{
"entropy": 5.812848663330078,
"epoch": 0.05477777521507484,
"grad_norm": 1.390625,
"learning_rate": 0.00030460198079576355,
"loss": 5.7728,
"mean_token_accuracy": 0.18808334469795226,
"num_tokens": 1696679.0,
"step": 2375
},
{
"entropy": 6.0858453750610355,
"epoch": 0.05489309684710658,
"grad_norm": 1.3671875,
"learning_rate": 0.0003034337235661648,
"loss": 6.0305,
"mean_token_accuracy": 0.16516501009464263,
"num_tokens": 1700154.0,
"step": 2380
},
{
"entropy": 6.077689933776855,
"epoch": 0.055008418479138316,
"grad_norm": 1.34375,
"learning_rate": 0.0003022646868116714,
"loss": 5.9408,
"mean_token_accuracy": 0.1638843946158886,
"num_tokens": 1703695.0,
"step": 2385
},
{
"entropy": 5.957744503021241,
"epoch": 0.05512374011117006,
"grad_norm": 1.390625,
"learning_rate": 0.0003010949025820163,
"loss": 5.8457,
"mean_token_accuracy": 0.17660858631134033,
"num_tokens": 1707667.0,
"step": 2390
},
{
"entropy": 5.903037691116333,
"epoch": 0.05523906174320179,
"grad_norm": 1.640625,
"learning_rate": 0.0002999244029474252,
"loss": 5.8012,
"mean_token_accuracy": 0.16960801780223847,
"num_tokens": 1710985.0,
"step": 2395
},
{
"entropy": 6.009402084350586,
"epoch": 0.055354383375233525,
"grad_norm": 1.3984375,
"learning_rate": 0.00029875321999773684,
"loss": 5.9604,
"mean_token_accuracy": 0.1663561351597309,
"num_tokens": 1714956.0,
"step": 2400
},
{
"entropy": 5.893221187591553,
"epoch": 0.055469705007265266,
"grad_norm": 1.375,
"learning_rate": 0.00029758138584152333,
"loss": 5.7352,
"mean_token_accuracy": 0.1840540885925293,
"num_tokens": 1718235.0,
"step": 2405
},
{
"entropy": 5.852742624282837,
"epoch": 0.055585026639297,
"grad_norm": 1.6328125,
"learning_rate": 0.0002964089326052102,
"loss": 5.8755,
"mean_token_accuracy": 0.18149819374084472,
"num_tokens": 1721846.0,
"step": 2410
},
{
"entropy": 5.930685949325562,
"epoch": 0.055700348271328734,
"grad_norm": 1.4296875,
"learning_rate": 0.0002952358924321949,
"loss": 5.8245,
"mean_token_accuracy": 0.17042715474963188,
"num_tokens": 1725206.0,
"step": 2415
},
{
"entropy": 5.949104452133179,
"epoch": 0.055815669903360475,
"grad_norm": 1.359375,
"learning_rate": 0.00029406229748196657,
"loss": 5.8433,
"mean_token_accuracy": 0.1739942029118538,
"num_tokens": 1728756.0,
"step": 2420
},
{
"entropy": 6.095400094985962,
"epoch": 0.05593099153539221,
"grad_norm": 1.2578125,
"learning_rate": 0.0002928881799292235,
"loss": 5.9561,
"mean_token_accuracy": 0.1710992656648159,
"num_tokens": 1732751.0,
"step": 2425
},
{
"entropy": 6.027282619476319,
"epoch": 0.05604631316742394,
"grad_norm": 1.4140625,
"learning_rate": 0.00029171357196299154,
"loss": 5.6891,
"mean_token_accuracy": 0.18352338075637817,
"num_tokens": 1736063.0,
"step": 2430
},
{
"entropy": 5.787494373321533,
"epoch": 0.056161634799455684,
"grad_norm": 1.46875,
"learning_rate": 0.0002905385057857414,
"loss": 5.7392,
"mean_token_accuracy": 0.1811654433608055,
"num_tokens": 1739401.0,
"step": 2435
},
{
"entropy": 5.810848569869995,
"epoch": 0.05627695643148742,
"grad_norm": 1.3671875,
"learning_rate": 0.0002893630136125058,
"loss": 5.7818,
"mean_token_accuracy": 0.1795400395989418,
"num_tokens": 1742812.0,
"step": 2440
},
{
"entropy": 5.931622838973999,
"epoch": 0.05639227806351915,
"grad_norm": 1.390625,
"learning_rate": 0.0002881871276699967,
"loss": 5.9531,
"mean_token_accuracy": 0.17347469925880432,
"num_tokens": 1746490.0,
"step": 2445
},
{
"entropy": 6.101017618179322,
"epoch": 0.05650759969555089,
"grad_norm": 1.2109375,
"learning_rate": 0.00028701088019572114,
"loss": 5.9145,
"mean_token_accuracy": 0.17603710740804673,
"num_tokens": 1750340.0,
"step": 2450
},
{
"entropy": 6.07333345413208,
"epoch": 0.05662292132758263,
"grad_norm": 1.28125,
"learning_rate": 0.0002858343034370977,
"loss": 5.9823,
"mean_token_accuracy": 0.16588258743286133,
"num_tokens": 1754179.0,
"step": 2455
},
{
"entropy": 5.986343765258789,
"epoch": 0.05673824295961436,
"grad_norm": 1.5,
"learning_rate": 0.00028465742965057267,
"loss": 5.96,
"mean_token_accuracy": 0.16463472843170165,
"num_tokens": 1757715.0,
"step": 2460
},
{
"entropy": 5.910198974609375,
"epoch": 0.0568535645916461,
"grad_norm": 1.34375,
"learning_rate": 0.00028348029110073533,
"loss": 5.6724,
"mean_token_accuracy": 0.17794369012117386,
"num_tokens": 1761383.0,
"step": 2465
},
{
"entropy": 5.9212188720703125,
"epoch": 0.056968886223677837,
"grad_norm": 1.515625,
"learning_rate": 0.00028230292005943365,
"loss": 5.9326,
"mean_token_accuracy": 0.17225535660982133,
"num_tokens": 1764927.0,
"step": 2470
},
{
"entropy": 5.827425384521485,
"epoch": 0.05708420785570957,
"grad_norm": 1.4921875,
"learning_rate": 0.00028112534880488945,
"loss": 5.7169,
"mean_token_accuracy": 0.2026936560869217,
"num_tokens": 1768707.0,
"step": 2475
},
{
"entropy": 5.885653352737426,
"epoch": 0.05719952948774131,
"grad_norm": 1.2578125,
"learning_rate": 0.0002799476096208137,
"loss": 5.7824,
"mean_token_accuracy": 0.18457434922456742,
"num_tokens": 1772703.0,
"step": 2480
},
{
"entropy": 6.064858913421631,
"epoch": 0.057314851119773046,
"grad_norm": 1.515625,
"learning_rate": 0.00027876973479552087,
"loss": 5.9318,
"mean_token_accuracy": 0.16946352124214173,
"num_tokens": 1776319.0,
"step": 2485
},
{
"entropy": 5.995760250091553,
"epoch": 0.05743017275180479,
"grad_norm": 1.390625,
"learning_rate": 0.00027759175662104424,
"loss": 5.8421,
"mean_token_accuracy": 0.17095668762922286,
"num_tokens": 1779728.0,
"step": 2490
},
{
"entropy": 5.950234889984131,
"epoch": 0.05754549438383652,
"grad_norm": 1.5625,
"learning_rate": 0.0002764137073922508,
"loss": 5.8148,
"mean_token_accuracy": 0.17959561944007874,
"num_tokens": 1783330.0,
"step": 2495
},
{
"entropy": 5.833258533477784,
"epoch": 0.057660816015868255,
"grad_norm": 1.3359375,
"learning_rate": 0.00027523561940595505,
"loss": 5.7592,
"mean_token_accuracy": 0.18121390789747238,
"num_tokens": 1786797.0,
"step": 2500
},
{
"entropy": 5.859229230880738,
"epoch": 0.057776137647899996,
"grad_norm": 1.390625,
"learning_rate": 0.0002740575249600342,
"loss": 5.7975,
"mean_token_accuracy": 0.1844713032245636,
"num_tokens": 1790415.0,
"step": 2505
},
{
"entropy": 5.938439989089966,
"epoch": 0.05789145927993173,
"grad_norm": 1.421875,
"learning_rate": 0.00027287945635254263,
"loss": 5.8078,
"mean_token_accuracy": 0.17873655557632445,
"num_tokens": 1793968.0,
"step": 2510
},
{
"entropy": 5.973791599273682,
"epoch": 0.058006780911963464,
"grad_norm": 1.3984375,
"learning_rate": 0.00027170144588082635,
"loss": 5.7813,
"mean_token_accuracy": 0.17764477878808976,
"num_tokens": 1797513.0,
"step": 2515
},
{
"entropy": 5.892712211608886,
"epoch": 0.058122102543995205,
"grad_norm": 1.25,
"learning_rate": 0.00027052352584063763,
"loss": 5.9274,
"mean_token_accuracy": 0.17944532185792922,
"num_tokens": 1801298.0,
"step": 2520
},
{
"entropy": 5.867738914489746,
"epoch": 0.05823742417602694,
"grad_norm": 1.4375,
"learning_rate": 0.00026934572852524907,
"loss": 5.7761,
"mean_token_accuracy": 0.17982883900403976,
"num_tokens": 1805056.0,
"step": 2525
},
{
"entropy": 5.968152666091919,
"epoch": 0.05835274580805867,
"grad_norm": 1.4375,
"learning_rate": 0.00026816808622456937,
"loss": 5.7366,
"mean_token_accuracy": 0.183195036649704,
"num_tokens": 1808276.0,
"step": 2530
},
{
"entropy": 5.903601455688476,
"epoch": 0.058468067440090414,
"grad_norm": 1.375,
"learning_rate": 0.0002669906312242569,
"loss": 5.9251,
"mean_token_accuracy": 0.17278433516621589,
"num_tokens": 1811565.0,
"step": 2535
},
{
"entropy": 5.918096017837525,
"epoch": 0.05858338907212215,
"grad_norm": 1.4140625,
"learning_rate": 0.00026581339580483525,
"loss": 5.8191,
"mean_token_accuracy": 0.18014084547758102,
"num_tokens": 1814670.0,
"step": 2540
},
{
"entropy": 6.007537841796875,
"epoch": 0.05869871070415388,
"grad_norm": 1.34375,
"learning_rate": 0.0002646364122408082,
"loss": 5.7367,
"mean_token_accuracy": 0.18985252678394318,
"num_tokens": 1818308.0,
"step": 2545
},
{
"entropy": 5.940880060195923,
"epoch": 0.05881403233618562,
"grad_norm": 1.3671875,
"learning_rate": 0.0002634597127997749,
"loss": 5.7623,
"mean_token_accuracy": 0.1917007476091385,
"num_tokens": 1821920.0,
"step": 2550
},
{
"entropy": 5.869258451461792,
"epoch": 0.05892935396821736,
"grad_norm": 1.2265625,
"learning_rate": 0.0002622833297415445,
"loss": 5.8899,
"mean_token_accuracy": 0.1710454910993576,
"num_tokens": 1825686.0,
"step": 2555
},
{
"entropy": 5.914764070510865,
"epoch": 0.05904467560024909,
"grad_norm": 1.40625,
"learning_rate": 0.0002611072953172531,
"loss": 5.7859,
"mean_token_accuracy": 0.18672958761453629,
"num_tokens": 1829403.0,
"step": 2560
},
{
"entropy": 6.004000902175903,
"epoch": 0.05915999723228083,
"grad_norm": 1.3828125,
"learning_rate": 0.00025993164176847845,
"loss": 5.8741,
"mean_token_accuracy": 0.18347345739603044,
"num_tokens": 1833246.0,
"step": 2565
},
{
"entropy": 5.9829802989959715,
"epoch": 0.059275318864312566,
"grad_norm": 1.4140625,
"learning_rate": 0.0002587564013263564,
"loss": 5.8705,
"mean_token_accuracy": 0.17229643911123277,
"num_tokens": 1836930.0,
"step": 2570
},
{
"entropy": 5.883930635452271,
"epoch": 0.05939064049634431,
"grad_norm": 2.640625,
"learning_rate": 0.0002575816062106974,
"loss": 5.6835,
"mean_token_accuracy": 0.18468537777662278,
"num_tokens": 1840521.0,
"step": 2575
},
{
"entropy": 5.986862087249756,
"epoch": 0.05950596212837604,
"grad_norm": 1.40625,
"learning_rate": 0.00025640728862910293,
"loss": 5.9162,
"mean_token_accuracy": 0.17273142486810683,
"num_tokens": 1844424.0,
"step": 2580
},
{
"entropy": 5.894385862350464,
"epoch": 0.059621283760407776,
"grad_norm": 1.4140625,
"learning_rate": 0.00025523348077608285,
"loss": 5.7489,
"mean_token_accuracy": 0.18549609780311585,
"num_tokens": 1848221.0,
"step": 2585
},
{
"entropy": 5.944499111175537,
"epoch": 0.05973660539243952,
"grad_norm": 1.359375,
"learning_rate": 0.00025406021483217225,
"loss": 5.7143,
"mean_token_accuracy": 0.1954684391617775,
"num_tokens": 1851816.0,
"step": 2590
},
{
"entropy": 5.8232582092285154,
"epoch": 0.05985192702447125,
"grad_norm": 1.421875,
"learning_rate": 0.00025288752296304963,
"loss": 5.7444,
"mean_token_accuracy": 0.1815652847290039,
"num_tokens": 1855440.0,
"step": 2595
},
{
"entropy": 5.851549959182739,
"epoch": 0.059967248656502985,
"grad_norm": 1.4375,
"learning_rate": 0.000251715437318655,
"loss": 5.7637,
"mean_token_accuracy": 0.18233905583620072,
"num_tokens": 1858970.0,
"step": 2600
},
{
"entropy": 5.876289510726929,
"epoch": 0.060082570288534726,
"grad_norm": 1.3984375,
"learning_rate": 0.0002505439900323084,
"loss": 5.7906,
"mean_token_accuracy": 0.18309031724929808,
"num_tokens": 1862850.0,
"step": 2605
},
{
"entropy": 5.914820528030395,
"epoch": 0.06019789192056646,
"grad_norm": 1.484375,
"learning_rate": 0.00024937321321982894,
"loss": 5.799,
"mean_token_accuracy": 0.18647489696741104,
"num_tokens": 1866149.0,
"step": 2610
},
{
"entropy": 5.923345565795898,
"epoch": 0.060313213552598194,
"grad_norm": 1.421875,
"learning_rate": 0.00024820313897865433,
"loss": 5.7205,
"mean_token_accuracy": 0.18145845979452133,
"num_tokens": 1869437.0,
"step": 2615
},
{
"entropy": 5.809894561767578,
"epoch": 0.060428535184629935,
"grad_norm": 1.359375,
"learning_rate": 0.00024703379938696105,
"loss": 5.7622,
"mean_token_accuracy": 0.18689581602811814,
"num_tokens": 1873014.0,
"step": 2620
},
{
"entropy": 5.881002187728882,
"epoch": 0.06054385681666167,
"grad_norm": 1.421875,
"learning_rate": 0.00024586522650278447,
"loss": 5.842,
"mean_token_accuracy": 0.17758374363183976,
"num_tokens": 1876491.0,
"step": 2625
},
{
"entropy": 5.976089286804199,
"epoch": 0.0606591784486934,
"grad_norm": 1.3828125,
"learning_rate": 0.00024469745236314064,
"loss": 5.8699,
"mean_token_accuracy": 0.17344397008419038,
"num_tokens": 1879939.0,
"step": 2630
},
{
"entropy": 6.05605525970459,
"epoch": 0.060774500080725144,
"grad_norm": 1.3515625,
"learning_rate": 0.00024353050898314767,
"loss": 5.8952,
"mean_token_accuracy": 0.17162755578756334,
"num_tokens": 1883565.0,
"step": 2635
},
{
"entropy": 6.052178907394409,
"epoch": 0.06088982171275688,
"grad_norm": 1.40625,
"learning_rate": 0.00024236442835514743,
"loss": 5.8323,
"mean_token_accuracy": 0.17204056531190873,
"num_tokens": 1887129.0,
"step": 2640
},
{
"entropy": 6.052104330062866,
"epoch": 0.06100514334478861,
"grad_norm": 1.3671875,
"learning_rate": 0.00024119924244782965,
"loss": 5.8664,
"mean_token_accuracy": 0.1694296732544899,
"num_tokens": 1890951.0,
"step": 2645
},
{
"entropy": 5.820616102218628,
"epoch": 0.06112046497682035,
"grad_norm": 1.3203125,
"learning_rate": 0.00024003498320535462,
"loss": 5.6695,
"mean_token_accuracy": 0.19724627882242202,
"num_tokens": 1894462.0,
"step": 2650
},
{
"entropy": 5.755842828750611,
"epoch": 0.06123578660885209,
"grad_norm": 1.3984375,
"learning_rate": 0.00023887168254647727,
"loss": 5.7722,
"mean_token_accuracy": 0.19156712889671326,
"num_tokens": 1898014.0,
"step": 2655
},
{
"entropy": 5.875131464004516,
"epoch": 0.06135110824088383,
"grad_norm": 1.5546875,
"learning_rate": 0.00023770937236367308,
"loss": 5.7768,
"mean_token_accuracy": 0.18076497614383696,
"num_tokens": 1901390.0,
"step": 2660
},
{
"entropy": 5.997090768814087,
"epoch": 0.06146642987291556,
"grad_norm": 1.5703125,
"learning_rate": 0.00023654808452226278,
"loss": 5.8307,
"mean_token_accuracy": 0.16497293263673782,
"num_tokens": 1904785.0,
"step": 2665
},
{
"entropy": 5.997742652893066,
"epoch": 0.061581751504947296,
"grad_norm": 1.2578125,
"learning_rate": 0.00023538785085953912,
"loss": 5.6975,
"mean_token_accuracy": 0.17880241423845292,
"num_tokens": 1908349.0,
"step": 2670
},
{
"entropy": 5.962642621994019,
"epoch": 0.06169707313697904,
"grad_norm": 1.3828125,
"learning_rate": 0.00023422870318389404,
"loss": 5.9398,
"mean_token_accuracy": 0.16476313322782515,
"num_tokens": 1912091.0,
"step": 2675
},
{
"entropy": 5.917799091339111,
"epoch": 0.06181239476901077,
"grad_norm": 1.421875,
"learning_rate": 0.0002330706732739468,
"loss": 5.6216,
"mean_token_accuracy": 0.1865406408905983,
"num_tokens": 1915328.0,
"step": 2680
},
{
"entropy": 5.756528043746949,
"epoch": 0.061927716401042505,
"grad_norm": 1.578125,
"learning_rate": 0.00023191379287767211,
"loss": 5.6607,
"mean_token_accuracy": 0.18593050837516784,
"num_tokens": 1918620.0,
"step": 2685
},
{
"entropy": 5.877194452285766,
"epoch": 0.062043038033074246,
"grad_norm": 1.3671875,
"learning_rate": 0.0002307580937115305,
"loss": 5.701,
"mean_token_accuracy": 0.18290412724018096,
"num_tokens": 1922081.0,
"step": 2690
},
{
"entropy": 5.8269915103912355,
"epoch": 0.06215835966510598,
"grad_norm": 1.3828125,
"learning_rate": 0.00022960360745959846,
"loss": 5.7274,
"mean_token_accuracy": 0.18010932803153992,
"num_tokens": 1925448.0,
"step": 2695
},
{
"entropy": 5.848289871215821,
"epoch": 0.062273681297137715,
"grad_norm": 1.3984375,
"learning_rate": 0.00022845036577269972,
"loss": 5.9303,
"mean_token_accuracy": 0.17182183563709258,
"num_tokens": 1929276.0,
"step": 2700
},
{
"entropy": 5.9040264129638675,
"epoch": 0.062389002929169456,
"grad_norm": 1.34375,
"learning_rate": 0.00022729840026753777,
"loss": 5.8178,
"mean_token_accuracy": 0.17916415482759476,
"num_tokens": 1932761.0,
"step": 2705
},
{
"entropy": 6.019765758514405,
"epoch": 0.0625043245612012,
"grad_norm": 1.296875,
"learning_rate": 0.0002261477425258287,
"loss": 5.8401,
"mean_token_accuracy": 0.17046671360731125,
"num_tokens": 1936367.0,
"step": 2710
},
{
"entropy": 5.891169452667237,
"epoch": 0.06261964619323293,
"grad_norm": 1.4375,
"learning_rate": 0.0002249984240934358,
"loss": 5.737,
"mean_token_accuracy": 0.18354604691267012,
"num_tokens": 1939552.0,
"step": 2715
},
{
"entropy": 5.81959719657898,
"epoch": 0.06273496782526466,
"grad_norm": 1.3515625,
"learning_rate": 0.00022385047647950464,
"loss": 5.9077,
"mean_token_accuracy": 0.17215294539928436,
"num_tokens": 1943019.0,
"step": 2720
},
{
"entropy": 5.9343325138092045,
"epoch": 0.0628502894572964,
"grad_norm": 1.2734375,
"learning_rate": 0.0002227039311555986,
"loss": 5.8366,
"mean_token_accuracy": 0.18445852994918824,
"num_tokens": 1946658.0,
"step": 2725
},
{
"entropy": 6.024950742721558,
"epoch": 0.06296561108932813,
"grad_norm": 1.421875,
"learning_rate": 0.0002215588195548372,
"loss": 5.8305,
"mean_token_accuracy": 0.17133526504039764,
"num_tokens": 1950300.0,
"step": 2730
},
{
"entropy": 5.966722249984741,
"epoch": 0.06308093272135987,
"grad_norm": 1.328125,
"learning_rate": 0.00022041517307103337,
"loss": 5.7302,
"mean_token_accuracy": 0.18964787125587462,
"num_tokens": 1953796.0,
"step": 2735
},
{
"entropy": 5.974159049987793,
"epoch": 0.06319625435339161,
"grad_norm": 1.4296875,
"learning_rate": 0.0002192730230578331,
"loss": 5.9238,
"mean_token_accuracy": 0.17226192206144333,
"num_tokens": 1957770.0,
"step": 2740
},
{
"entropy": 5.9047887325286865,
"epoch": 0.06331157598542335,
"grad_norm": 1.5546875,
"learning_rate": 0.0002181324008278559,
"loss": 5.7863,
"mean_token_accuracy": 0.18308857083320618,
"num_tokens": 1961466.0,
"step": 2745
},
{
"entropy": 5.988528156280518,
"epoch": 0.06342689761745508,
"grad_norm": 1.390625,
"learning_rate": 0.00021699333765183655,
"loss": 5.8323,
"mean_token_accuracy": 0.17582432627677919,
"num_tokens": 1964818.0,
"step": 2750
},
{
"entropy": 5.967915153503418,
"epoch": 0.06354221924948682,
"grad_norm": 1.359375,
"learning_rate": 0.0002158558647577673,
"loss": 5.864,
"mean_token_accuracy": 0.1706937775015831,
"num_tokens": 1968779.0,
"step": 2755
},
{
"entropy": 5.914709520339966,
"epoch": 0.06365754088151855,
"grad_norm": 1.3828125,
"learning_rate": 0.00021472001333004215,
"loss": 5.7101,
"mean_token_accuracy": 0.18757800459861756,
"num_tokens": 1972080.0,
"step": 2760
},
{
"entropy": 5.934797668457032,
"epoch": 0.06377286251355029,
"grad_norm": 1.3671875,
"learning_rate": 0.00021358581450860186,
"loss": 5.8142,
"mean_token_accuracy": 0.17301127761602403,
"num_tokens": 1975697.0,
"step": 2765
},
{
"entropy": 5.8657080173492435,
"epoch": 0.06388818414558203,
"grad_norm": 1.5,
"learning_rate": 0.0002124532993880799,
"loss": 5.8521,
"mean_token_accuracy": 0.18053918927907944,
"num_tokens": 1979040.0,
"step": 2770
},
{
"entropy": 5.942452144622803,
"epoch": 0.06400350577761377,
"grad_norm": 1.328125,
"learning_rate": 0.00021132249901695044,
"loss": 5.8689,
"mean_token_accuracy": 0.17712486088275908,
"num_tokens": 1982510.0,
"step": 2775
},
{
"entropy": 5.9110266208648685,
"epoch": 0.0641188274096455,
"grad_norm": 1.375,
"learning_rate": 0.00021019344439667705,
"loss": 5.6708,
"mean_token_accuracy": 0.18872162997722625,
"num_tokens": 1985933.0,
"step": 2780
},
{
"entropy": 5.893104076385498,
"epoch": 0.06423414904167724,
"grad_norm": 1.578125,
"learning_rate": 0.00020906616648086213,
"loss": 5.6688,
"mean_token_accuracy": 0.18823864161968232,
"num_tokens": 1989277.0,
"step": 2785
},
{
"entropy": 5.888962697982788,
"epoch": 0.06434947067370897,
"grad_norm": 1.65625,
"learning_rate": 0.00020794069617439942,
"loss": 5.8824,
"mean_token_accuracy": 0.17175881639122964,
"num_tokens": 1992881.0,
"step": 2790
},
{
"entropy": 5.808063697814942,
"epoch": 0.06446479230574072,
"grad_norm": 1.390625,
"learning_rate": 0.00020681706433262593,
"loss": 5.6385,
"mean_token_accuracy": 0.19691164344549178,
"num_tokens": 1996353.0,
"step": 2795
},
{
"entropy": 5.9756499290466305,
"epoch": 0.06458011393777245,
"grad_norm": 1.28125,
"learning_rate": 0.00020569530176047602,
"loss": 5.8659,
"mean_token_accuracy": 0.16761932000517846,
"num_tokens": 2000650.0,
"step": 2800
},
{
"entropy": 5.938136911392212,
"epoch": 0.06469543556980419,
"grad_norm": 1.3671875,
"learning_rate": 0.0002045754392116374,
"loss": 5.7232,
"mean_token_accuracy": 0.1818224534392357,
"num_tokens": 2004049.0,
"step": 2805
},
{
"entropy": 5.855062627792359,
"epoch": 0.06481075720183592,
"grad_norm": 1.328125,
"learning_rate": 0.00020345750738770757,
"loss": 5.7765,
"mean_token_accuracy": 0.1807533547282219,
"num_tokens": 2007886.0,
"step": 2810
},
{
"entropy": 5.959704732894897,
"epoch": 0.06492607883386765,
"grad_norm": 1.640625,
"learning_rate": 0.00020234153693735214,
"loss": 5.7634,
"mean_token_accuracy": 0.1806884691119194,
"num_tokens": 2011271.0,
"step": 2815
},
{
"entropy": 5.975922679901123,
"epoch": 0.06504140046589939,
"grad_norm": 1.46875,
"learning_rate": 0.0002012275584554647,
"loss": 5.7165,
"mean_token_accuracy": 0.18227946609258652,
"num_tokens": 2014648.0,
"step": 2820
},
{
"entropy": 5.875610256195069,
"epoch": 0.06515672209793114,
"grad_norm": 1.3125,
"learning_rate": 0.00020011560248232803,
"loss": 5.7374,
"mean_token_accuracy": 0.19299339056015014,
"num_tokens": 2018267.0,
"step": 2825
},
{
"entropy": 5.850345706939697,
"epoch": 0.06527204372996287,
"grad_norm": 1.3203125,
"learning_rate": 0.00019900569950277692,
"loss": 5.6723,
"mean_token_accuracy": 0.19151630997657776,
"num_tokens": 2021865.0,
"step": 2830
},
{
"entropy": 5.848925256729126,
"epoch": 0.0653873653619946,
"grad_norm": 1.40625,
"learning_rate": 0.00019789787994536228,
"loss": 5.7429,
"mean_token_accuracy": 0.18572327196598054,
"num_tokens": 2025427.0,
"step": 2835
},
{
"entropy": 5.908142709732056,
"epoch": 0.06550268699402634,
"grad_norm": 1.3984375,
"learning_rate": 0.00019679217418151667,
"loss": 5.7091,
"mean_token_accuracy": 0.19120996594429016,
"num_tokens": 2028854.0,
"step": 2840
},
{
"entropy": 6.015109491348267,
"epoch": 0.06561800862605807,
"grad_norm": 1.3203125,
"learning_rate": 0.00019568861252472236,
"loss": 5.9372,
"mean_token_accuracy": 0.16335895657539368,
"num_tokens": 2032767.0,
"step": 2845
},
{
"entropy": 5.918488073348999,
"epoch": 0.0657333302580898,
"grad_norm": 1.3671875,
"learning_rate": 0.00019458722522967952,
"loss": 5.7233,
"mean_token_accuracy": 0.18703315854072572,
"num_tokens": 2036471.0,
"step": 2850
},
{
"entropy": 6.02737283706665,
"epoch": 0.06584865189012155,
"grad_norm": 1.4453125,
"learning_rate": 0.00019348804249147723,
"loss": 5.8776,
"mean_token_accuracy": 0.1778786689043045,
"num_tokens": 2040251.0,
"step": 2855
},
{
"entropy": 6.013108777999878,
"epoch": 0.06596397352215329,
"grad_norm": 1.3203125,
"learning_rate": 0.0001923910944447655,
"loss": 5.8841,
"mean_token_accuracy": 0.17370433658361434,
"num_tokens": 2043805.0,
"step": 2860
},
{
"entropy": 5.9248310089111325,
"epoch": 0.06607929515418502,
"grad_norm": 1.421875,
"learning_rate": 0.00019129641116292928,
"loss": 5.6517,
"mean_token_accuracy": 0.1846097320318222,
"num_tokens": 2047429.0,
"step": 2865
},
{
"entropy": 5.990289926528931,
"epoch": 0.06619461678621676,
"grad_norm": 1.59375,
"learning_rate": 0.00019020402265726343,
"loss": 5.7009,
"mean_token_accuracy": 0.19372230917215347,
"num_tokens": 2051054.0,
"step": 2870
},
{
"entropy": 5.9012140274047855,
"epoch": 0.06630993841824849,
"grad_norm": 1.53125,
"learning_rate": 0.0001891139588761509,
"loss": 5.8108,
"mean_token_accuracy": 0.17864444702863694,
"num_tokens": 2054621.0,
"step": 2875
},
{
"entropy": 5.877433967590332,
"epoch": 0.06642526005028024,
"grad_norm": 1.484375,
"learning_rate": 0.00018802624970424076,
"loss": 5.848,
"mean_token_accuracy": 0.17309605330228806,
"num_tokens": 2058237.0,
"step": 2880
},
{
"entropy": 5.991059494018555,
"epoch": 0.06654058168231197,
"grad_norm": 1.53125,
"learning_rate": 0.00018694092496162945,
"loss": 5.7263,
"mean_token_accuracy": 0.1866472616791725,
"num_tokens": 2061697.0,
"step": 2885
},
{
"entropy": 5.983783340454101,
"epoch": 0.0666559033143437,
"grad_norm": 1.3671875,
"learning_rate": 0.00018585801440304306,
"loss": 5.6761,
"mean_token_accuracy": 0.18445128798484803,
"num_tokens": 2065127.0,
"step": 2890
},
{
"entropy": 5.846389102935791,
"epoch": 0.06677122494637544,
"grad_norm": 1.3046875,
"learning_rate": 0.00018477754771702165,
"loss": 5.7284,
"mean_token_accuracy": 0.18535285890102388,
"num_tokens": 2068855.0,
"step": 2895
},
{
"entropy": 5.7222825050354,
"epoch": 0.06688654657840717,
"grad_norm": 1.4765625,
"learning_rate": 0.00018369955452510506,
"loss": 5.5675,
"mean_token_accuracy": 0.1989583283662796,
"num_tokens": 2072368.0,
"step": 2900
},
{
"entropy": 5.837818956375122,
"epoch": 0.06700186821043891,
"grad_norm": 1.3515625,
"learning_rate": 0.0001826240643810212,
"loss": 5.8223,
"mean_token_accuracy": 0.16376523524522782,
"num_tokens": 2076016.0,
"step": 2905
},
{
"entropy": 5.903762435913086,
"epoch": 0.06711718984247066,
"grad_norm": 1.359375,
"learning_rate": 0.0001815511067698758,
"loss": 5.799,
"mean_token_accuracy": 0.18310704678297043,
"num_tokens": 2079716.0,
"step": 2910
},
{
"entropy": 6.0248870849609375,
"epoch": 0.06723251147450239,
"grad_norm": 1.453125,
"learning_rate": 0.0001804807111073436,
"loss": 5.7251,
"mean_token_accuracy": 0.18154046386480333,
"num_tokens": 2083348.0,
"step": 2915
},
{
"entropy": 6.0839780330657955,
"epoch": 0.06734783310653412,
"grad_norm": 1.5234375,
"learning_rate": 0.0001794129067388625,
"loss": 5.9075,
"mean_token_accuracy": 0.16682684570550918,
"num_tokens": 2087091.0,
"step": 2920
},
{
"entropy": 5.8681151390075685,
"epoch": 0.06746315473856586,
"grad_norm": 1.515625,
"learning_rate": 0.00017834772293882868,
"loss": 5.7554,
"mean_token_accuracy": 0.18699747025966645,
"num_tokens": 2090964.0,
"step": 2925
},
{
"entropy": 5.946015310287476,
"epoch": 0.06757847637059759,
"grad_norm": 1.390625,
"learning_rate": 0.000177285188909794,
"loss": 5.6862,
"mean_token_accuracy": 0.18752513229846954,
"num_tokens": 2094857.0,
"step": 2930
},
{
"entropy": 5.899681091308594,
"epoch": 0.06769379800262933,
"grad_norm": 1.4453125,
"learning_rate": 0.0001762253337816656,
"loss": 5.8017,
"mean_token_accuracy": 0.17873011901974678,
"num_tokens": 2098426.0,
"step": 2935
},
{
"entropy": 5.885863590240478,
"epoch": 0.06780911963466107,
"grad_norm": 1.34375,
"learning_rate": 0.00017516818661090738,
"loss": 5.8047,
"mean_token_accuracy": 0.18703116625547409,
"num_tokens": 2102102.0,
"step": 2940
},
{
"entropy": 5.87971453666687,
"epoch": 0.06792444126669281,
"grad_norm": 1.59375,
"learning_rate": 0.0001741137763797428,
"loss": 5.7541,
"mean_token_accuracy": 0.18448233753442764,
"num_tokens": 2105727.0,
"step": 2945
},
{
"entropy": 5.937520456314087,
"epoch": 0.06803976289872454,
"grad_norm": 1.34375,
"learning_rate": 0.00017306213199536115,
"loss": 5.6473,
"mean_token_accuracy": 0.18756611943244933,
"num_tokens": 2109519.0,
"step": 2950
},
{
"entropy": 5.859132480621338,
"epoch": 0.06815508453075628,
"grad_norm": 1.5234375,
"learning_rate": 0.0001720132822891243,
"loss": 5.6502,
"mean_token_accuracy": 0.18644311428070068,
"num_tokens": 2113094.0,
"step": 2955
},
{
"entropy": 5.743404197692871,
"epoch": 0.06827040616278801,
"grad_norm": 1.4296875,
"learning_rate": 0.0001709672560157769,
"loss": 5.5667,
"mean_token_accuracy": 0.1907391220331192,
"num_tokens": 2116710.0,
"step": 2960
},
{
"entropy": 5.8213928699493405,
"epoch": 0.06838572779481976,
"grad_norm": 1.484375,
"learning_rate": 0.00016992408185265758,
"loss": 5.7055,
"mean_token_accuracy": 0.18221299052238465,
"num_tokens": 2120164.0,
"step": 2965
},
{
"entropy": 5.877272319793701,
"epoch": 0.06850104942685149,
"grad_norm": 1.5078125,
"learning_rate": 0.00016888378839891298,
"loss": 5.6865,
"mean_token_accuracy": 0.1879534125328064,
"num_tokens": 2123951.0,
"step": 2970
},
{
"entropy": 5.851574468612671,
"epoch": 0.06861637105888323,
"grad_norm": 1.453125,
"learning_rate": 0.0001678464041747137,
"loss": 5.7301,
"mean_token_accuracy": 0.18611981719732285,
"num_tokens": 2127437.0,
"step": 2975
},
{
"entropy": 5.790816736221314,
"epoch": 0.06873169269091496,
"grad_norm": 1.4453125,
"learning_rate": 0.00016681195762047223,
"loss": 5.5886,
"mean_token_accuracy": 0.19709371030330658,
"num_tokens": 2131000.0,
"step": 2980
},
{
"entropy": 5.7607114791870115,
"epoch": 0.0688470143229467,
"grad_norm": 1.421875,
"learning_rate": 0.00016578047709606337,
"loss": 5.6504,
"mean_token_accuracy": 0.19478827118873596,
"num_tokens": 2134556.0,
"step": 2985
},
{
"entropy": 5.881701469421387,
"epoch": 0.06896233595497843,
"grad_norm": 1.3359375,
"learning_rate": 0.00016475199088004678,
"loss": 5.8401,
"mean_token_accuracy": 0.18119265884160995,
"num_tokens": 2138074.0,
"step": 2990
},
{
"entropy": 5.93296217918396,
"epoch": 0.06907765758701018,
"grad_norm": 1.375,
"learning_rate": 0.00016372652716889163,
"loss": 5.7389,
"mean_token_accuracy": 0.1826397642493248,
"num_tokens": 2141917.0,
"step": 2995
},
{
"entropy": 5.937312889099121,
"epoch": 0.06919297921904191,
"grad_norm": 1.3828125,
"learning_rate": 0.0001627041140762035,
"loss": 5.7968,
"mean_token_accuracy": 0.17956418246030809,
"num_tokens": 2146016.0,
"step": 3000
}
],
"logging_steps": 5,
"max_steps": 4000,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3280219342848000.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}