5035 lines
136 KiB
JSON
5035 lines
136 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 0.057660816015868255,
|
|
"eval_steps": 500,
|
|
"global_step": 2500,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 10.691907501220703,
|
|
"epoch": 0.0001153216320317365,
|
|
"grad_norm": 17.375,
|
|
"learning_rate": 2e-06,
|
|
"loss": 10.5245,
|
|
"mean_token_accuracy": 0.0,
|
|
"num_tokens": 3965.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 10.691843128204345,
|
|
"epoch": 0.000230643264063473,
|
|
"grad_norm": 18.5,
|
|
"learning_rate": 4.5e-06,
|
|
"loss": 10.3993,
|
|
"mean_token_accuracy": 0.0003649635007604957,
|
|
"num_tokens": 7510.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 10.69088363647461,
|
|
"epoch": 0.0003459648960952095,
|
|
"grad_norm": 13.125,
|
|
"learning_rate": 7e-06,
|
|
"loss": 10.1564,
|
|
"mean_token_accuracy": 0.03439897168427706,
|
|
"num_tokens": 11084.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 10.681573295593262,
|
|
"epoch": 0.000461286528126946,
|
|
"grad_norm": 9.0625,
|
|
"learning_rate": 9.5e-06,
|
|
"loss": 9.7517,
|
|
"mean_token_accuracy": 0.06451544389128686,
|
|
"num_tokens": 14319.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 10.623183345794677,
|
|
"epoch": 0.0005766081601586826,
|
|
"grad_norm": 5.8125,
|
|
"learning_rate": 1.2e-05,
|
|
"loss": 9.4401,
|
|
"mean_token_accuracy": 0.06273870654404164,
|
|
"num_tokens": 17670.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 10.555589962005616,
|
|
"epoch": 0.000691929792190419,
|
|
"grad_norm": 4.9375,
|
|
"learning_rate": 1.4500000000000002e-05,
|
|
"loss": 9.2749,
|
|
"mean_token_accuracy": 0.05860213525593281,
|
|
"num_tokens": 21177.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 10.556735229492187,
|
|
"epoch": 0.0008072514242221556,
|
|
"grad_norm": 4.25,
|
|
"learning_rate": 1.7000000000000003e-05,
|
|
"loss": 9.1316,
|
|
"mean_token_accuracy": 0.06961804144084453,
|
|
"num_tokens": 24417.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 10.520895004272461,
|
|
"epoch": 0.000922573056253892,
|
|
"grad_norm": 4.09375,
|
|
"learning_rate": 1.95e-05,
|
|
"loss": 9.1409,
|
|
"mean_token_accuracy": 0.067233781889081,
|
|
"num_tokens": 27824.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 10.48238296508789,
|
|
"epoch": 0.0010378946882856287,
|
|
"grad_norm": 3.828125,
|
|
"learning_rate": 2.2e-05,
|
|
"loss": 9.1384,
|
|
"mean_token_accuracy": 0.06338647790253163,
|
|
"num_tokens": 31712.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 10.46641788482666,
|
|
"epoch": 0.0011532163203173652,
|
|
"grad_norm": 3.640625,
|
|
"learning_rate": 2.4500000000000003e-05,
|
|
"loss": 9.0513,
|
|
"mean_token_accuracy": 0.07285529412329197,
|
|
"num_tokens": 35207.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 10.364572525024414,
|
|
"epoch": 0.0012685379523491016,
|
|
"grad_norm": 3.28125,
|
|
"learning_rate": 2.7e-05,
|
|
"loss": 9.0362,
|
|
"mean_token_accuracy": 0.06746394783258439,
|
|
"num_tokens": 39066.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 10.27311315536499,
|
|
"epoch": 0.001383859584380838,
|
|
"grad_norm": 3.5,
|
|
"learning_rate": 2.95e-05,
|
|
"loss": 8.8148,
|
|
"mean_token_accuracy": 0.07908576317131519,
|
|
"num_tokens": 42389.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 10.151123905181885,
|
|
"epoch": 0.0014991812164125747,
|
|
"grad_norm": 2.953125,
|
|
"learning_rate": 3.2e-05,
|
|
"loss": 8.8459,
|
|
"mean_token_accuracy": 0.07942395582795143,
|
|
"num_tokens": 45778.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 10.179048538208008,
|
|
"epoch": 0.0016145028484443112,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 3.4500000000000005e-05,
|
|
"loss": 8.6928,
|
|
"mean_token_accuracy": 0.07802934609353543,
|
|
"num_tokens": 48918.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 10.147464656829834,
|
|
"epoch": 0.0017298244804760477,
|
|
"grad_norm": 4.0625,
|
|
"learning_rate": 3.7e-05,
|
|
"loss": 8.6836,
|
|
"mean_token_accuracy": 0.07859932407736778,
|
|
"num_tokens": 52456.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 10.119709587097168,
|
|
"epoch": 0.001845146112507784,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 3.95e-05,
|
|
"loss": 8.6315,
|
|
"mean_token_accuracy": 0.07672536484897137,
|
|
"num_tokens": 56193.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 10.134781169891358,
|
|
"epoch": 0.0019604677445395208,
|
|
"grad_norm": 3.5,
|
|
"learning_rate": 4.2000000000000004e-05,
|
|
"loss": 8.5835,
|
|
"mean_token_accuracy": 0.07438027523458005,
|
|
"num_tokens": 59977.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 10.018630409240723,
|
|
"epoch": 0.0020757893765712574,
|
|
"grad_norm": 2.625,
|
|
"learning_rate": 4.45e-05,
|
|
"loss": 8.5291,
|
|
"mean_token_accuracy": 0.0768112525343895,
|
|
"num_tokens": 63844.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 9.969991493225098,
|
|
"epoch": 0.0021911110086029937,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 4.7000000000000004e-05,
|
|
"loss": 8.4302,
|
|
"mean_token_accuracy": 0.07833829969167709,
|
|
"num_tokens": 67356.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 9.947973537445069,
|
|
"epoch": 0.0023064326406347303,
|
|
"grad_norm": 2.328125,
|
|
"learning_rate": 4.9500000000000004e-05,
|
|
"loss": 8.2975,
|
|
"mean_token_accuracy": 0.08131772689521313,
|
|
"num_tokens": 70767.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 9.674797916412354,
|
|
"epoch": 0.0024217542726664666,
|
|
"grad_norm": 2.03125,
|
|
"learning_rate": 5.2e-05,
|
|
"loss": 8.2983,
|
|
"mean_token_accuracy": 0.08184195645153522,
|
|
"num_tokens": 74437.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 9.848657512664795,
|
|
"epoch": 0.0025370759046982033,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 5.45e-05,
|
|
"loss": 8.2258,
|
|
"mean_token_accuracy": 0.07810623683035374,
|
|
"num_tokens": 77940.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 9.696725845336914,
|
|
"epoch": 0.00265239753672994,
|
|
"grad_norm": 2.09375,
|
|
"learning_rate": 5.7e-05,
|
|
"loss": 8.1357,
|
|
"mean_token_accuracy": 0.07201453074812889,
|
|
"num_tokens": 81669.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 9.512047672271729,
|
|
"epoch": 0.002767719168761676,
|
|
"grad_norm": 1.765625,
|
|
"learning_rate": 5.9499999999999996e-05,
|
|
"loss": 8.0767,
|
|
"mean_token_accuracy": 0.0643788930028677,
|
|
"num_tokens": 86135.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 9.434719371795655,
|
|
"epoch": 0.002883040800793413,
|
|
"grad_norm": 2.171875,
|
|
"learning_rate": 6.2e-05,
|
|
"loss": 7.898,
|
|
"mean_token_accuracy": 0.0802077766507864,
|
|
"num_tokens": 89620.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 9.149808502197265,
|
|
"epoch": 0.0029983624328251495,
|
|
"grad_norm": 1.96875,
|
|
"learning_rate": 6.450000000000001e-05,
|
|
"loss": 7.7739,
|
|
"mean_token_accuracy": 0.08522589541971684,
|
|
"num_tokens": 93245.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 9.161969184875488,
|
|
"epoch": 0.0031136840648568857,
|
|
"grad_norm": 1.9296875,
|
|
"learning_rate": 6.7e-05,
|
|
"loss": 7.6885,
|
|
"mean_token_accuracy": 0.09521296098828316,
|
|
"num_tokens": 96754.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 8.86840353012085,
|
|
"epoch": 0.0032290056968886224,
|
|
"grad_norm": 1.8359375,
|
|
"learning_rate": 6.950000000000001e-05,
|
|
"loss": 7.6545,
|
|
"mean_token_accuracy": 0.08669420927762986,
|
|
"num_tokens": 100266.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 8.901450920104981,
|
|
"epoch": 0.003344327328920359,
|
|
"grad_norm": 1.6484375,
|
|
"learning_rate": 7.2e-05,
|
|
"loss": 7.5653,
|
|
"mean_token_accuracy": 0.07821874283254146,
|
|
"num_tokens": 103824.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 8.649330520629883,
|
|
"epoch": 0.0034596489609520953,
|
|
"grad_norm": 2.171875,
|
|
"learning_rate": 7.45e-05,
|
|
"loss": 7.5483,
|
|
"mean_token_accuracy": 0.0837211973965168,
|
|
"num_tokens": 107659.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 8.520522785186767,
|
|
"epoch": 0.003574970592983832,
|
|
"grad_norm": 2.09375,
|
|
"learning_rate": 7.7e-05,
|
|
"loss": 7.3799,
|
|
"mean_token_accuracy": 0.08768085911870002,
|
|
"num_tokens": 111348.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 8.380702209472656,
|
|
"epoch": 0.003690292225015568,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 7.950000000000001e-05,
|
|
"loss": 7.4222,
|
|
"mean_token_accuracy": 0.08212160468101501,
|
|
"num_tokens": 115386.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 8.227167320251464,
|
|
"epoch": 0.003805613857047305,
|
|
"grad_norm": 1.921875,
|
|
"learning_rate": 8.2e-05,
|
|
"loss": 7.3087,
|
|
"mean_token_accuracy": 0.09835789948701859,
|
|
"num_tokens": 118772.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 8.145322608947755,
|
|
"epoch": 0.0039209354890790415,
|
|
"grad_norm": 1.890625,
|
|
"learning_rate": 8.450000000000001e-05,
|
|
"loss": 7.416,
|
|
"mean_token_accuracy": 0.09204246997833251,
|
|
"num_tokens": 122680.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 8.233028316497803,
|
|
"epoch": 0.004036257121110778,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 8.7e-05,
|
|
"loss": 7.3521,
|
|
"mean_token_accuracy": 0.08081735149025918,
|
|
"num_tokens": 127162.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 7.950575256347657,
|
|
"epoch": 0.004151578753142515,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 8.95e-05,
|
|
"loss": 7.2055,
|
|
"mean_token_accuracy": 0.09383777529001236,
|
|
"num_tokens": 130684.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 8.000711679458618,
|
|
"epoch": 0.004266900385174251,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 9.2e-05,
|
|
"loss": 7.275,
|
|
"mean_token_accuracy": 0.09546211659908295,
|
|
"num_tokens": 134154.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 7.941235446929932,
|
|
"epoch": 0.004382222017205987,
|
|
"grad_norm": 1.703125,
|
|
"learning_rate": 9.45e-05,
|
|
"loss": 7.2944,
|
|
"mean_token_accuracy": 0.08537636548280716,
|
|
"num_tokens": 137811.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 7.906629467010498,
|
|
"epoch": 0.004497543649237724,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 9.7e-05,
|
|
"loss": 7.1824,
|
|
"mean_token_accuracy": 0.09572790712118148,
|
|
"num_tokens": 141220.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 7.942177057266235,
|
|
"epoch": 0.004612865281269461,
|
|
"grad_norm": 1.8671875,
|
|
"learning_rate": 9.95e-05,
|
|
"loss": 7.2036,
|
|
"mean_token_accuracy": 0.09937367662787437,
|
|
"num_tokens": 144768.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 7.685758304595947,
|
|
"epoch": 0.004728186913301197,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 0.000102,
|
|
"loss": 7.137,
|
|
"mean_token_accuracy": 0.09695517122745514,
|
|
"num_tokens": 148173.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 7.714945936203003,
|
|
"epoch": 0.004843508545332933,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.00010449999999999999,
|
|
"loss": 7.1256,
|
|
"mean_token_accuracy": 0.10458688139915466,
|
|
"num_tokens": 151861.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 7.71102352142334,
|
|
"epoch": 0.00495883017736467,
|
|
"grad_norm": 1.7578125,
|
|
"learning_rate": 0.000107,
|
|
"loss": 7.066,
|
|
"mean_token_accuracy": 0.10715894550085067,
|
|
"num_tokens": 155191.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 7.614436388015747,
|
|
"epoch": 0.0050741518093964065,
|
|
"grad_norm": 1.921875,
|
|
"learning_rate": 0.0001095,
|
|
"loss": 7.1459,
|
|
"mean_token_accuracy": 0.09644531235098838,
|
|
"num_tokens": 158655.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 7.692019128799439,
|
|
"epoch": 0.005189473441428143,
|
|
"grad_norm": 1.8515625,
|
|
"learning_rate": 0.000112,
|
|
"loss": 7.1231,
|
|
"mean_token_accuracy": 0.10170018300414085,
|
|
"num_tokens": 162244.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 7.713358163833618,
|
|
"epoch": 0.00530479507345988,
|
|
"grad_norm": 1.7109375,
|
|
"learning_rate": 0.0001145,
|
|
"loss": 7.2913,
|
|
"mean_token_accuracy": 0.08797733411192894,
|
|
"num_tokens": 165887.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 7.608382606506348,
|
|
"epoch": 0.0054201167054916165,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00011700000000000001,
|
|
"loss": 7.0288,
|
|
"mean_token_accuracy": 0.10224084109067917,
|
|
"num_tokens": 169248.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 7.681228685379028,
|
|
"epoch": 0.005535438337523352,
|
|
"grad_norm": 1.8359375,
|
|
"learning_rate": 0.00011949999999999999,
|
|
"loss": 7.137,
|
|
"mean_token_accuracy": 0.09048556201159955,
|
|
"num_tokens": 172559.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 7.473513507843018,
|
|
"epoch": 0.005650759969555089,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.000122,
|
|
"loss": 7.0968,
|
|
"mean_token_accuracy": 0.1024228110909462,
|
|
"num_tokens": 175961.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 7.584992599487305,
|
|
"epoch": 0.005766081601586826,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0001245,
|
|
"loss": 7.1516,
|
|
"mean_token_accuracy": 0.09878315702080727,
|
|
"num_tokens": 179611.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 7.685141277313233,
|
|
"epoch": 0.005881403233618562,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.000127,
|
|
"loss": 7.1129,
|
|
"mean_token_accuracy": 0.10327758342027664,
|
|
"num_tokens": 183105.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 7.646425008773804,
|
|
"epoch": 0.005996724865650299,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 0.0001295,
|
|
"loss": 7.118,
|
|
"mean_token_accuracy": 0.09364504367113113,
|
|
"num_tokens": 186682.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 7.5202278137207035,
|
|
"epoch": 0.006112046497682035,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.000132,
|
|
"loss": 7.1542,
|
|
"mean_token_accuracy": 0.09994478896260262,
|
|
"num_tokens": 190487.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 7.5590576171875,
|
|
"epoch": 0.0062273681297137715,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.00013450000000000002,
|
|
"loss": 7.1467,
|
|
"mean_token_accuracy": 0.0977135255932808,
|
|
"num_tokens": 194445.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 7.514654350280762,
|
|
"epoch": 0.006342689761745508,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 0.00013700000000000002,
|
|
"loss": 7.0653,
|
|
"mean_token_accuracy": 0.10815930888056755,
|
|
"num_tokens": 197864.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 7.6202771186828615,
|
|
"epoch": 0.006458011393777245,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0001395,
|
|
"loss": 6.99,
|
|
"mean_token_accuracy": 0.1028586745262146,
|
|
"num_tokens": 201465.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 7.317496013641358,
|
|
"epoch": 0.0065733330258089815,
|
|
"grad_norm": 1.71875,
|
|
"learning_rate": 0.00014199999999999998,
|
|
"loss": 6.9834,
|
|
"mean_token_accuracy": 0.09826496616005898,
|
|
"num_tokens": 204918.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 7.434334373474121,
|
|
"epoch": 0.006688654657840718,
|
|
"grad_norm": 2.015625,
|
|
"learning_rate": 0.0001445,
|
|
"loss": 7.078,
|
|
"mean_token_accuracy": 0.10162978768348693,
|
|
"num_tokens": 208725.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 7.4441381931304935,
|
|
"epoch": 0.006803976289872454,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 0.000147,
|
|
"loss": 7.0367,
|
|
"mean_token_accuracy": 0.10961202383041382,
|
|
"num_tokens": 212286.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 7.442938041687012,
|
|
"epoch": 0.006919297921904191,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 0.0001495,
|
|
"loss": 6.9635,
|
|
"mean_token_accuracy": 0.11073270812630653,
|
|
"num_tokens": 215900.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 7.303906488418579,
|
|
"epoch": 0.007034619553935927,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.000152,
|
|
"loss": 6.9921,
|
|
"mean_token_accuracy": 0.10271828547120095,
|
|
"num_tokens": 219495.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 7.581103324890137,
|
|
"epoch": 0.007149941185967664,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00015450000000000001,
|
|
"loss": 7.0565,
|
|
"mean_token_accuracy": 0.09874569922685623,
|
|
"num_tokens": 223358.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 7.358316278457641,
|
|
"epoch": 0.007265262817999401,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 0.000157,
|
|
"loss": 6.9374,
|
|
"mean_token_accuracy": 0.11364061161875724,
|
|
"num_tokens": 226549.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 7.333794832229614,
|
|
"epoch": 0.007380584450031136,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.0001595,
|
|
"loss": 7.0438,
|
|
"mean_token_accuracy": 0.11026700586080551,
|
|
"num_tokens": 230102.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 7.446019983291626,
|
|
"epoch": 0.007495906082062873,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.000162,
|
|
"loss": 6.9717,
|
|
"mean_token_accuracy": 0.10468028411269188,
|
|
"num_tokens": 233652.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 7.4383687496185305,
|
|
"epoch": 0.00761122771409461,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 0.00016450000000000001,
|
|
"loss": 6.9563,
|
|
"mean_token_accuracy": 0.10809829756617546,
|
|
"num_tokens": 237100.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 7.277336835861206,
|
|
"epoch": 0.007726549346126346,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.00016700000000000002,
|
|
"loss": 6.835,
|
|
"mean_token_accuracy": 0.1123481884598732,
|
|
"num_tokens": 240390.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 7.367178535461425,
|
|
"epoch": 0.007841870978158083,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 0.00016950000000000003,
|
|
"loss": 6.9353,
|
|
"mean_token_accuracy": 0.10941664353013039,
|
|
"num_tokens": 243955.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 7.226317501068115,
|
|
"epoch": 0.007957192610189819,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.00017199999999999998,
|
|
"loss": 6.8903,
|
|
"mean_token_accuracy": 0.11319939866662025,
|
|
"num_tokens": 247371.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 7.388652610778808,
|
|
"epoch": 0.008072514242221556,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.00017449999999999999,
|
|
"loss": 6.9579,
|
|
"mean_token_accuracy": 0.10422090664505959,
|
|
"num_tokens": 250794.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 7.3202920913696286,
|
|
"epoch": 0.008187835874253292,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.000177,
|
|
"loss": 6.985,
|
|
"mean_token_accuracy": 0.10096767656505108,
|
|
"num_tokens": 254434.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 7.292840766906738,
|
|
"epoch": 0.00830315750628503,
|
|
"grad_norm": 1.8984375,
|
|
"learning_rate": 0.0001795,
|
|
"loss": 6.9804,
|
|
"mean_token_accuracy": 0.10753846392035485,
|
|
"num_tokens": 258039.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 7.453191423416138,
|
|
"epoch": 0.008418479138316766,
|
|
"grad_norm": 1.7265625,
|
|
"learning_rate": 0.000182,
|
|
"loss": 6.9874,
|
|
"mean_token_accuracy": 0.11508287489414215,
|
|
"num_tokens": 261851.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 7.177758312225341,
|
|
"epoch": 0.008533800770348501,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0001845,
|
|
"loss": 6.9374,
|
|
"mean_token_accuracy": 0.10858769118785858,
|
|
"num_tokens": 265903.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 7.471200084686279,
|
|
"epoch": 0.008649122402380239,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 0.000187,
|
|
"loss": 6.9962,
|
|
"mean_token_accuracy": 0.10989872291684151,
|
|
"num_tokens": 269471.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 7.166895580291748,
|
|
"epoch": 0.008764444034411975,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0001895,
|
|
"loss": 6.9137,
|
|
"mean_token_accuracy": 0.11640691384673119,
|
|
"num_tokens": 272945.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 7.404301357269287,
|
|
"epoch": 0.008879765666443712,
|
|
"grad_norm": 2.0625,
|
|
"learning_rate": 0.000192,
|
|
"loss": 6.9117,
|
|
"mean_token_accuracy": 0.1151728942990303,
|
|
"num_tokens": 276300.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 7.1740296363830565,
|
|
"epoch": 0.008995087298475448,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 0.0001945,
|
|
"loss": 6.9439,
|
|
"mean_token_accuracy": 0.10883786007761956,
|
|
"num_tokens": 279930.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 7.307166481018067,
|
|
"epoch": 0.009110408930507184,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.00019700000000000002,
|
|
"loss": 6.92,
|
|
"mean_token_accuracy": 0.1120470218360424,
|
|
"num_tokens": 283709.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 7.349106884002685,
|
|
"epoch": 0.009225730562538921,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00019950000000000002,
|
|
"loss": 7.0302,
|
|
"mean_token_accuracy": 0.11455085650086402,
|
|
"num_tokens": 287880.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 7.221231746673584,
|
|
"epoch": 0.009341052194570657,
|
|
"grad_norm": 1.7578125,
|
|
"learning_rate": 0.000202,
|
|
"loss": 6.8002,
|
|
"mean_token_accuracy": 0.11782657876610755,
|
|
"num_tokens": 291367.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 7.293564319610596,
|
|
"epoch": 0.009456373826602395,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.00020449999999999998,
|
|
"loss": 6.9735,
|
|
"mean_token_accuracy": 0.10948061645030975,
|
|
"num_tokens": 294920.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 7.203423309326172,
|
|
"epoch": 0.00957169545863413,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.000207,
|
|
"loss": 6.8951,
|
|
"mean_token_accuracy": 0.1170351468026638,
|
|
"num_tokens": 298347.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 7.1942479610443115,
|
|
"epoch": 0.009687017090665866,
|
|
"grad_norm": 1.765625,
|
|
"learning_rate": 0.0002095,
|
|
"loss": 6.7875,
|
|
"mean_token_accuracy": 0.1238088421523571,
|
|
"num_tokens": 301787.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 7.0459576606750485,
|
|
"epoch": 0.009802338722697604,
|
|
"grad_norm": 1.8671875,
|
|
"learning_rate": 0.000212,
|
|
"loss": 6.8287,
|
|
"mean_token_accuracy": 0.12091329768300056,
|
|
"num_tokens": 305284.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 7.336889219284058,
|
|
"epoch": 0.00991766035472934,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0002145,
|
|
"loss": 6.9463,
|
|
"mean_token_accuracy": 0.11388053148984909,
|
|
"num_tokens": 308963.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 7.106842947006226,
|
|
"epoch": 0.010032981986761077,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.00021700000000000002,
|
|
"loss": 6.809,
|
|
"mean_token_accuracy": 0.12353090792894364,
|
|
"num_tokens": 312422.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 7.182272291183471,
|
|
"epoch": 0.010148303618792813,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0002195,
|
|
"loss": 6.7662,
|
|
"mean_token_accuracy": 0.11858817338943481,
|
|
"num_tokens": 316194.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 7.024605417251587,
|
|
"epoch": 0.010263625250824549,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.000222,
|
|
"loss": 6.8614,
|
|
"mean_token_accuracy": 0.11561542153358459,
|
|
"num_tokens": 319824.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 7.047331666946411,
|
|
"epoch": 0.010378946882856286,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 0.0002245,
|
|
"loss": 6.7707,
|
|
"mean_token_accuracy": 0.1250594787299633,
|
|
"num_tokens": 323503.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 7.204434967041015,
|
|
"epoch": 0.010494268514888022,
|
|
"grad_norm": 1.6484375,
|
|
"learning_rate": 0.00022700000000000002,
|
|
"loss": 6.8941,
|
|
"mean_token_accuracy": 0.11519786417484283,
|
|
"num_tokens": 326858.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 7.106210565567016,
|
|
"epoch": 0.01060959014691976,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 0.00022950000000000002,
|
|
"loss": 6.8793,
|
|
"mean_token_accuracy": 0.11701082810759544,
|
|
"num_tokens": 330370.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 7.177642726898194,
|
|
"epoch": 0.010724911778951495,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.00023200000000000003,
|
|
"loss": 6.7898,
|
|
"mean_token_accuracy": 0.11765560358762742,
|
|
"num_tokens": 334041.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 7.11465482711792,
|
|
"epoch": 0.010840233410983233,
|
|
"grad_norm": 1.890625,
|
|
"learning_rate": 0.00023449999999999998,
|
|
"loss": 6.7651,
|
|
"mean_token_accuracy": 0.12222857922315597,
|
|
"num_tokens": 337724.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 6.927467727661133,
|
|
"epoch": 0.010955555043014969,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 0.000237,
|
|
"loss": 6.6746,
|
|
"mean_token_accuracy": 0.12812104001641272,
|
|
"num_tokens": 340946.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 7.083363389968872,
|
|
"epoch": 0.011070876675046705,
|
|
"grad_norm": 1.7109375,
|
|
"learning_rate": 0.0002395,
|
|
"loss": 6.8418,
|
|
"mean_token_accuracy": 0.12921102717518806,
|
|
"num_tokens": 344603.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 7.131814002990723,
|
|
"epoch": 0.011186198307078442,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.000242,
|
|
"loss": 6.8164,
|
|
"mean_token_accuracy": 0.11969970613718033,
|
|
"num_tokens": 348153.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 6.9778149127960205,
|
|
"epoch": 0.011301519939110178,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.0002445,
|
|
"loss": 6.8872,
|
|
"mean_token_accuracy": 0.12184126004576683,
|
|
"num_tokens": 351682.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 7.12193341255188,
|
|
"epoch": 0.011416841571141916,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.000247,
|
|
"loss": 6.7129,
|
|
"mean_token_accuracy": 0.12792302519083024,
|
|
"num_tokens": 355245.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 6.980188322067261,
|
|
"epoch": 0.011532163203173651,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0002495,
|
|
"loss": 6.8127,
|
|
"mean_token_accuracy": 0.12161365896463394,
|
|
"num_tokens": 358888.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 7.066232776641845,
|
|
"epoch": 0.011647484835205387,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.000252,
|
|
"loss": 6.8635,
|
|
"mean_token_accuracy": 0.11938958987593651,
|
|
"num_tokens": 362626.0,
|
|
"step": 505
|
|
},
|
|
{
|
|
"entropy": 7.00195050239563,
|
|
"epoch": 0.011762806467237125,
|
|
"grad_norm": 2.09375,
|
|
"learning_rate": 0.0002545,
|
|
"loss": 6.7086,
|
|
"mean_token_accuracy": 0.1228688344359398,
|
|
"num_tokens": 366038.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 6.969321203231812,
|
|
"epoch": 0.01187812809926886,
|
|
"grad_norm": 1.7109375,
|
|
"learning_rate": 0.000257,
|
|
"loss": 6.7136,
|
|
"mean_token_accuracy": 0.12526071220636367,
|
|
"num_tokens": 369594.0,
|
|
"step": 515
|
|
},
|
|
{
|
|
"entropy": 6.9371413230896,
|
|
"epoch": 0.011993449731300598,
|
|
"grad_norm": 1.703125,
|
|
"learning_rate": 0.0002595,
|
|
"loss": 6.7367,
|
|
"mean_token_accuracy": 0.12349091246724128,
|
|
"num_tokens": 373104.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 7.061675262451172,
|
|
"epoch": 0.012108771363332334,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.000262,
|
|
"loss": 6.7381,
|
|
"mean_token_accuracy": 0.127496138215065,
|
|
"num_tokens": 376595.0,
|
|
"step": 525
|
|
},
|
|
{
|
|
"entropy": 6.979284811019897,
|
|
"epoch": 0.01222409299536407,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.00026450000000000003,
|
|
"loss": 6.6709,
|
|
"mean_token_accuracy": 0.13121070936322213,
|
|
"num_tokens": 380156.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 6.977970695495605,
|
|
"epoch": 0.012339414627395807,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.00026700000000000004,
|
|
"loss": 6.7324,
|
|
"mean_token_accuracy": 0.1287410192191601,
|
|
"num_tokens": 384027.0,
|
|
"step": 535
|
|
},
|
|
{
|
|
"entropy": 6.881741619110107,
|
|
"epoch": 0.012454736259427543,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.00026950000000000005,
|
|
"loss": 6.6671,
|
|
"mean_token_accuracy": 0.11977160051465034,
|
|
"num_tokens": 387550.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 6.822022294998169,
|
|
"epoch": 0.01257005789145928,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.00027200000000000005,
|
|
"loss": 6.6422,
|
|
"mean_token_accuracy": 0.13606388345360756,
|
|
"num_tokens": 390963.0,
|
|
"step": 545
|
|
},
|
|
{
|
|
"entropy": 6.928303003311157,
|
|
"epoch": 0.012685379523491016,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0002745,
|
|
"loss": 6.7124,
|
|
"mean_token_accuracy": 0.12595684081315994,
|
|
"num_tokens": 394925.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 6.908079767227173,
|
|
"epoch": 0.012800701155522754,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 0.000277,
|
|
"loss": 6.6508,
|
|
"mean_token_accuracy": 0.13430240824818612,
|
|
"num_tokens": 398277.0,
|
|
"step": 555
|
|
},
|
|
{
|
|
"entropy": 6.7669871807098385,
|
|
"epoch": 0.01291602278755449,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0002795,
|
|
"loss": 6.6406,
|
|
"mean_token_accuracy": 0.12931998521089555,
|
|
"num_tokens": 402031.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 7.0115638256073,
|
|
"epoch": 0.013031344419586225,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 0.00028199999999999997,
|
|
"loss": 6.7424,
|
|
"mean_token_accuracy": 0.12384107932448388,
|
|
"num_tokens": 405965.0,
|
|
"step": 565
|
|
},
|
|
{
|
|
"entropy": 6.675027227401733,
|
|
"epoch": 0.013146666051617963,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0002845,
|
|
"loss": 6.6326,
|
|
"mean_token_accuracy": 0.13790299072861673,
|
|
"num_tokens": 409030.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 6.937662792205811,
|
|
"epoch": 0.013261987683649699,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.000287,
|
|
"loss": 6.6805,
|
|
"mean_token_accuracy": 0.1316666141152382,
|
|
"num_tokens": 412644.0,
|
|
"step": 575
|
|
},
|
|
{
|
|
"entropy": 6.8609226703643795,
|
|
"epoch": 0.013377309315681436,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0002895,
|
|
"loss": 6.8327,
|
|
"mean_token_accuracy": 0.12451824694871902,
|
|
"num_tokens": 416572.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 7.033586931228638,
|
|
"epoch": 0.013492630947713172,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.000292,
|
|
"loss": 6.7378,
|
|
"mean_token_accuracy": 0.12755787074565889,
|
|
"num_tokens": 420282.0,
|
|
"step": 585
|
|
},
|
|
{
|
|
"entropy": 6.879875516891479,
|
|
"epoch": 0.013607952579744908,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0002945,
|
|
"loss": 6.7316,
|
|
"mean_token_accuracy": 0.12889642342925073,
|
|
"num_tokens": 423856.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 6.873905801773072,
|
|
"epoch": 0.013723274211776645,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.000297,
|
|
"loss": 6.7251,
|
|
"mean_token_accuracy": 0.12292287200689316,
|
|
"num_tokens": 427505.0,
|
|
"step": 595
|
|
},
|
|
{
|
|
"entropy": 6.9947303295135494,
|
|
"epoch": 0.013838595843808381,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0002995,
|
|
"loss": 6.7802,
|
|
"mean_token_accuracy": 0.12400763705372811,
|
|
"num_tokens": 431019.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 6.831447172164917,
|
|
"epoch": 0.013953917475840119,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.000302,
|
|
"loss": 6.7275,
|
|
"mean_token_accuracy": 0.11811881884932518,
|
|
"num_tokens": 434958.0,
|
|
"step": 605
|
|
},
|
|
{
|
|
"entropy": 6.952916431427002,
|
|
"epoch": 0.014069239107871855,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0003045,
|
|
"loss": 6.6707,
|
|
"mean_token_accuracy": 0.12404478713870049,
|
|
"num_tokens": 438819.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 6.7603600978851315,
|
|
"epoch": 0.01418456073990359,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.000307,
|
|
"loss": 6.6654,
|
|
"mean_token_accuracy": 0.13465720862150193,
|
|
"num_tokens": 442673.0,
|
|
"step": 615
|
|
},
|
|
{
|
|
"entropy": 6.749461269378662,
|
|
"epoch": 0.014299882371935328,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.0003095,
|
|
"loss": 6.611,
|
|
"mean_token_accuracy": 0.141814486682415,
|
|
"num_tokens": 446022.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 6.744637155532837,
|
|
"epoch": 0.014415204003967064,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 0.000312,
|
|
"loss": 6.5443,
|
|
"mean_token_accuracy": 0.12628007531166077,
|
|
"num_tokens": 449417.0,
|
|
"step": 625
|
|
},
|
|
{
|
|
"entropy": 6.688572549819947,
|
|
"epoch": 0.014530525635998801,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.0003145,
|
|
"loss": 6.6076,
|
|
"mean_token_accuracy": 0.13569982424378396,
|
|
"num_tokens": 452864.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 6.912837743759155,
|
|
"epoch": 0.014645847268030537,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.000317,
|
|
"loss": 6.6372,
|
|
"mean_token_accuracy": 0.13416576981544495,
|
|
"num_tokens": 456271.0,
|
|
"step": 635
|
|
},
|
|
{
|
|
"entropy": 6.784486961364746,
|
|
"epoch": 0.014761168900062273,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.0003195,
|
|
"loss": 6.6531,
|
|
"mean_token_accuracy": 0.12497906535863876,
|
|
"num_tokens": 459829.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 6.867062091827393,
|
|
"epoch": 0.01487649053209401,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.000322,
|
|
"loss": 6.6887,
|
|
"mean_token_accuracy": 0.1274550288915634,
|
|
"num_tokens": 463533.0,
|
|
"step": 645
|
|
},
|
|
{
|
|
"entropy": 6.910113048553467,
|
|
"epoch": 0.014991812164125746,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.00032450000000000003,
|
|
"loss": 6.7957,
|
|
"mean_token_accuracy": 0.13574171662330628,
|
|
"num_tokens": 467332.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 6.789191818237304,
|
|
"epoch": 0.015107133796157484,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.00032700000000000003,
|
|
"loss": 6.5626,
|
|
"mean_token_accuracy": 0.13435751348733901,
|
|
"num_tokens": 470873.0,
|
|
"step": 655
|
|
},
|
|
{
|
|
"entropy": 6.788733005523682,
|
|
"epoch": 0.01522245542818922,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.00032950000000000004,
|
|
"loss": 6.7839,
|
|
"mean_token_accuracy": 0.12393135279417038,
|
|
"num_tokens": 474820.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 6.878502368927002,
|
|
"epoch": 0.015337777060220957,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.00033200000000000005,
|
|
"loss": 6.6323,
|
|
"mean_token_accuracy": 0.12036252096295356,
|
|
"num_tokens": 478395.0,
|
|
"step": 665
|
|
},
|
|
{
|
|
"entropy": 6.82345757484436,
|
|
"epoch": 0.015453098692252693,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.00033450000000000005,
|
|
"loss": 6.6041,
|
|
"mean_token_accuracy": 0.12858830615878106,
|
|
"num_tokens": 482046.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 6.717121648788452,
|
|
"epoch": 0.015568420324284429,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.000337,
|
|
"loss": 6.7698,
|
|
"mean_token_accuracy": 0.1298346571624279,
|
|
"num_tokens": 485673.0,
|
|
"step": 675
|
|
},
|
|
{
|
|
"entropy": 6.864575338363648,
|
|
"epoch": 0.015683741956316166,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0003395,
|
|
"loss": 6.7329,
|
|
"mean_token_accuracy": 0.1281518019735813,
|
|
"num_tokens": 489481.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 6.822469806671142,
|
|
"epoch": 0.015799063588347904,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.000342,
|
|
"loss": 6.6497,
|
|
"mean_token_accuracy": 0.11982662305235862,
|
|
"num_tokens": 493190.0,
|
|
"step": 685
|
|
},
|
|
{
|
|
"entropy": 6.7843328475952145,
|
|
"epoch": 0.015914385220379638,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.00034449999999999997,
|
|
"loss": 6.6649,
|
|
"mean_token_accuracy": 0.13050103262066842,
|
|
"num_tokens": 496998.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 6.7976783275604244,
|
|
"epoch": 0.016029706852411375,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.000347,
|
|
"loss": 6.5988,
|
|
"mean_token_accuracy": 0.12620501667261125,
|
|
"num_tokens": 500711.0,
|
|
"step": 695
|
|
},
|
|
{
|
|
"entropy": 6.778346061706543,
|
|
"epoch": 0.016145028484443113,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0003495,
|
|
"loss": 6.6419,
|
|
"mean_token_accuracy": 0.13493644669651986,
|
|
"num_tokens": 504320.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 6.839865684509277,
|
|
"epoch": 0.016260350116474847,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000352,
|
|
"loss": 6.7026,
|
|
"mean_token_accuracy": 0.12694861963391305,
|
|
"num_tokens": 508591.0,
|
|
"step": 705
|
|
},
|
|
{
|
|
"entropy": 6.507184028625488,
|
|
"epoch": 0.016375671748506584,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 0.0003545,
|
|
"loss": 6.5197,
|
|
"mean_token_accuracy": 0.12975703105330466,
|
|
"num_tokens": 511954.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 6.9446001052856445,
|
|
"epoch": 0.016490993380538322,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.000357,
|
|
"loss": 6.7093,
|
|
"mean_token_accuracy": 0.12820022329688072,
|
|
"num_tokens": 515674.0,
|
|
"step": 715
|
|
},
|
|
{
|
|
"entropy": 6.730710792541504,
|
|
"epoch": 0.01660631501257006,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0003595,
|
|
"loss": 6.5776,
|
|
"mean_token_accuracy": 0.1299228049814701,
|
|
"num_tokens": 519263.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 6.626702070236206,
|
|
"epoch": 0.016721636644601794,
|
|
"grad_norm": 1.7890625,
|
|
"learning_rate": 0.000362,
|
|
"loss": 6.547,
|
|
"mean_token_accuracy": 0.13767884224653243,
|
|
"num_tokens": 522852.0,
|
|
"step": 725
|
|
},
|
|
{
|
|
"entropy": 6.654131937026977,
|
|
"epoch": 0.01683695827663353,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 0.0003645,
|
|
"loss": 6.363,
|
|
"mean_token_accuracy": 0.14956862181425096,
|
|
"num_tokens": 525895.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 6.6195868968963625,
|
|
"epoch": 0.01695227990866527,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.000367,
|
|
"loss": 6.66,
|
|
"mean_token_accuracy": 0.1396695040166378,
|
|
"num_tokens": 529767.0,
|
|
"step": 735
|
|
},
|
|
{
|
|
"entropy": 6.844963073730469,
|
|
"epoch": 0.017067601540697003,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0003695,
|
|
"loss": 6.6272,
|
|
"mean_token_accuracy": 0.13760401010513307,
|
|
"num_tokens": 533460.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 6.55352029800415,
|
|
"epoch": 0.01718292317272874,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.000372,
|
|
"loss": 6.5484,
|
|
"mean_token_accuracy": 0.12853334248065948,
|
|
"num_tokens": 536858.0,
|
|
"step": 745
|
|
},
|
|
{
|
|
"entropy": 6.739038324356079,
|
|
"epoch": 0.017298244804760478,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0003745,
|
|
"loss": 6.5296,
|
|
"mean_token_accuracy": 0.134282648563385,
|
|
"num_tokens": 540385.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 6.603275918960572,
|
|
"epoch": 0.017413566436792212,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.000377,
|
|
"loss": 6.6021,
|
|
"mean_token_accuracy": 0.1308648779988289,
|
|
"num_tokens": 543900.0,
|
|
"step": 755
|
|
},
|
|
{
|
|
"entropy": 6.719392156600952,
|
|
"epoch": 0.01752888806882395,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0003795,
|
|
"loss": 6.4669,
|
|
"mean_token_accuracy": 0.14468610361218454,
|
|
"num_tokens": 547698.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 6.681492519378662,
|
|
"epoch": 0.017644209700855687,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.000382,
|
|
"loss": 6.4244,
|
|
"mean_token_accuracy": 0.1444924809038639,
|
|
"num_tokens": 551343.0,
|
|
"step": 765
|
|
},
|
|
{
|
|
"entropy": 6.512750577926636,
|
|
"epoch": 0.017759531332887424,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0003845,
|
|
"loss": 6.5919,
|
|
"mean_token_accuracy": 0.13365111723542214,
|
|
"num_tokens": 554719.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 6.8195850372314455,
|
|
"epoch": 0.01787485296491916,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 0.00038700000000000003,
|
|
"loss": 6.4418,
|
|
"mean_token_accuracy": 0.14398375824093818,
|
|
"num_tokens": 558065.0,
|
|
"step": 775
|
|
},
|
|
{
|
|
"entropy": 6.40870418548584,
|
|
"epoch": 0.017990174596950896,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00038950000000000003,
|
|
"loss": 6.4908,
|
|
"mean_token_accuracy": 0.13703683838248254,
|
|
"num_tokens": 561838.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 6.763089752197265,
|
|
"epoch": 0.018105496228982634,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.00039200000000000004,
|
|
"loss": 6.5724,
|
|
"mean_token_accuracy": 0.13872020468115806,
|
|
"num_tokens": 565377.0,
|
|
"step": 785
|
|
},
|
|
{
|
|
"entropy": 6.414765214920044,
|
|
"epoch": 0.018220817861014368,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.00039450000000000005,
|
|
"loss": 6.5791,
|
|
"mean_token_accuracy": 0.1391117937862873,
|
|
"num_tokens": 568820.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 6.6232490062713625,
|
|
"epoch": 0.018336139493046105,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00039700000000000005,
|
|
"loss": 6.516,
|
|
"mean_token_accuracy": 0.14359558895230293,
|
|
"num_tokens": 572524.0,
|
|
"step": 795
|
|
},
|
|
{
|
|
"entropy": 6.646560907363892,
|
|
"epoch": 0.018451461125077843,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0003995,
|
|
"loss": 6.5517,
|
|
"mean_token_accuracy": 0.14170725047588348,
|
|
"num_tokens": 575928.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 6.580789995193482,
|
|
"epoch": 0.01856678275710958,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.000402,
|
|
"loss": 6.479,
|
|
"mean_token_accuracy": 0.1312673196196556,
|
|
"num_tokens": 579592.0,
|
|
"step": 805
|
|
},
|
|
{
|
|
"entropy": 6.487143564224243,
|
|
"epoch": 0.018682104389141314,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 0.0004045,
|
|
"loss": 6.5262,
|
|
"mean_token_accuracy": 0.14007846415042877,
|
|
"num_tokens": 582901.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 6.743833398818969,
|
|
"epoch": 0.018797426021173052,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.00040699999999999997,
|
|
"loss": 6.5645,
|
|
"mean_token_accuracy": 0.13733114078640937,
|
|
"num_tokens": 586314.0,
|
|
"step": 815
|
|
},
|
|
{
|
|
"entropy": 6.649324655532837,
|
|
"epoch": 0.01891274765320479,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004095,
|
|
"loss": 6.5989,
|
|
"mean_token_accuracy": 0.12807421162724494,
|
|
"num_tokens": 590184.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 6.660643291473389,
|
|
"epoch": 0.019028069285236524,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.000412,
|
|
"loss": 6.5451,
|
|
"mean_token_accuracy": 0.14784720838069915,
|
|
"num_tokens": 594206.0,
|
|
"step": 825
|
|
},
|
|
{
|
|
"entropy": 6.582896757125854,
|
|
"epoch": 0.01914339091726826,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004145,
|
|
"loss": 6.5935,
|
|
"mean_token_accuracy": 0.13174692913889885,
|
|
"num_tokens": 597907.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 6.467390012741089,
|
|
"epoch": 0.0192587125493,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.000417,
|
|
"loss": 6.4295,
|
|
"mean_token_accuracy": 0.14666235372424125,
|
|
"num_tokens": 601184.0,
|
|
"step": 835
|
|
},
|
|
{
|
|
"entropy": 6.50648775100708,
|
|
"epoch": 0.019374034181331733,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004195,
|
|
"loss": 6.4344,
|
|
"mean_token_accuracy": 0.14619253873825072,
|
|
"num_tokens": 604461.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 6.624946212768554,
|
|
"epoch": 0.01948935581336347,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.000422,
|
|
"loss": 6.4808,
|
|
"mean_token_accuracy": 0.1452321670949459,
|
|
"num_tokens": 608212.0,
|
|
"step": 845
|
|
},
|
|
{
|
|
"entropy": 6.407814979553223,
|
|
"epoch": 0.019604677445395208,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004245,
|
|
"loss": 6.4109,
|
|
"mean_token_accuracy": 0.1504127100110054,
|
|
"num_tokens": 611699.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 6.546614694595337,
|
|
"epoch": 0.019719999077426945,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.000427,
|
|
"loss": 6.5066,
|
|
"mean_token_accuracy": 0.13756923452019693,
|
|
"num_tokens": 615250.0,
|
|
"step": 855
|
|
},
|
|
{
|
|
"entropy": 6.57107834815979,
|
|
"epoch": 0.01983532070945868,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004295,
|
|
"loss": 6.5938,
|
|
"mean_token_accuracy": 0.13746437877416612,
|
|
"num_tokens": 619212.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 6.492978191375732,
|
|
"epoch": 0.019950642341490417,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000432,
|
|
"loss": 6.4712,
|
|
"mean_token_accuracy": 0.14481520354747773,
|
|
"num_tokens": 622968.0,
|
|
"step": 865
|
|
},
|
|
{
|
|
"entropy": 6.592170143127442,
|
|
"epoch": 0.020065963973522154,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 0.0004345,
|
|
"loss": 6.3975,
|
|
"mean_token_accuracy": 0.14187804758548736,
|
|
"num_tokens": 626246.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 6.349250316619873,
|
|
"epoch": 0.02018128560555389,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.000437,
|
|
"loss": 6.4674,
|
|
"mean_token_accuracy": 0.14084591791033746,
|
|
"num_tokens": 629587.0,
|
|
"step": 875
|
|
},
|
|
{
|
|
"entropy": 6.500652837753296,
|
|
"epoch": 0.020296607237585626,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004395,
|
|
"loss": 6.3655,
|
|
"mean_token_accuracy": 0.15314365327358245,
|
|
"num_tokens": 633145.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 6.598798370361328,
|
|
"epoch": 0.020411928869617364,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.000442,
|
|
"loss": 6.5983,
|
|
"mean_token_accuracy": 0.13979744389653206,
|
|
"num_tokens": 636833.0,
|
|
"step": 885
|
|
},
|
|
{
|
|
"entropy": 6.562899351119995,
|
|
"epoch": 0.020527250501649098,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004445,
|
|
"loss": 6.5048,
|
|
"mean_token_accuracy": 0.14217502400279045,
|
|
"num_tokens": 640416.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 6.388691473007202,
|
|
"epoch": 0.020642572133680835,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.000447,
|
|
"loss": 6.3969,
|
|
"mean_token_accuracy": 0.14934756681323053,
|
|
"num_tokens": 643749.0,
|
|
"step": 895
|
|
},
|
|
{
|
|
"entropy": 6.443750047683716,
|
|
"epoch": 0.020757893765712573,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.00044950000000000003,
|
|
"loss": 6.4741,
|
|
"mean_token_accuracy": 0.1435583434998989,
|
|
"num_tokens": 647324.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 6.586315631866455,
|
|
"epoch": 0.02087321539774431,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00045200000000000004,
|
|
"loss": 6.5574,
|
|
"mean_token_accuracy": 0.14090513586997985,
|
|
"num_tokens": 650845.0,
|
|
"step": 905
|
|
},
|
|
{
|
|
"entropy": 6.472339391708374,
|
|
"epoch": 0.020988537029776044,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.00045450000000000004,
|
|
"loss": 6.4032,
|
|
"mean_token_accuracy": 0.1494538463652134,
|
|
"num_tokens": 654241.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 6.533646154403686,
|
|
"epoch": 0.021103858661807782,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00045700000000000005,
|
|
"loss": 6.5261,
|
|
"mean_token_accuracy": 0.13883443772792817,
|
|
"num_tokens": 658325.0,
|
|
"step": 915
|
|
},
|
|
{
|
|
"entropy": 6.595873832702637,
|
|
"epoch": 0.02121918029383952,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.00045950000000000006,
|
|
"loss": 6.592,
|
|
"mean_token_accuracy": 0.12782933786511422,
|
|
"num_tokens": 661858.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 6.363731098175049,
|
|
"epoch": 0.021334501925871253,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.000462,
|
|
"loss": 6.4567,
|
|
"mean_token_accuracy": 0.1426269829273224,
|
|
"num_tokens": 665241.0,
|
|
"step": 925
|
|
},
|
|
{
|
|
"entropy": 6.458065557479858,
|
|
"epoch": 0.02144982355790299,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004645,
|
|
"loss": 6.2515,
|
|
"mean_token_accuracy": 0.16411956250667573,
|
|
"num_tokens": 668551.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 6.404357767105102,
|
|
"epoch": 0.02156514518993473,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.000467,
|
|
"loss": 6.4239,
|
|
"mean_token_accuracy": 0.15490319207310677,
|
|
"num_tokens": 672042.0,
|
|
"step": 935
|
|
},
|
|
{
|
|
"entropy": 6.371016883850098,
|
|
"epoch": 0.021680466821966466,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004695,
|
|
"loss": 6.2836,
|
|
"mean_token_accuracy": 0.16167665868997574,
|
|
"num_tokens": 675439.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 6.284253358840942,
|
|
"epoch": 0.0217957884539982,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.000472,
|
|
"loss": 6.4548,
|
|
"mean_token_accuracy": 0.14620761722326278,
|
|
"num_tokens": 678922.0,
|
|
"step": 945
|
|
},
|
|
{
|
|
"entropy": 6.28749361038208,
|
|
"epoch": 0.021911110086029938,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004745,
|
|
"loss": 6.3503,
|
|
"mean_token_accuracy": 0.14457938969135284,
|
|
"num_tokens": 682158.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 6.486617231369019,
|
|
"epoch": 0.022026431718061675,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.000477,
|
|
"loss": 6.3366,
|
|
"mean_token_accuracy": 0.15324448347091674,
|
|
"num_tokens": 685852.0,
|
|
"step": 955
|
|
},
|
|
{
|
|
"entropy": 6.460330247879028,
|
|
"epoch": 0.02214175335009341,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004795,
|
|
"loss": 6.5499,
|
|
"mean_token_accuracy": 0.1374201148748398,
|
|
"num_tokens": 689757.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 6.396834039688111,
|
|
"epoch": 0.022257074982125147,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.000482,
|
|
"loss": 6.3268,
|
|
"mean_token_accuracy": 0.16849246844649315,
|
|
"num_tokens": 692721.0,
|
|
"step": 965
|
|
},
|
|
{
|
|
"entropy": 6.379905891418457,
|
|
"epoch": 0.022372396614156884,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004845,
|
|
"loss": 6.5339,
|
|
"mean_token_accuracy": 0.14080024287104606,
|
|
"num_tokens": 696739.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 6.532469081878662,
|
|
"epoch": 0.02248771824618862,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.000487,
|
|
"loss": 6.3908,
|
|
"mean_token_accuracy": 0.14212772697210313,
|
|
"num_tokens": 700203.0,
|
|
"step": 975
|
|
},
|
|
{
|
|
"entropy": 6.363768005371094,
|
|
"epoch": 0.022603039878220356,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004895,
|
|
"loss": 6.4829,
|
|
"mean_token_accuracy": 0.13906411677598954,
|
|
"num_tokens": 703675.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 6.559950065612793,
|
|
"epoch": 0.022718361510252093,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.000492,
|
|
"loss": 6.4583,
|
|
"mean_token_accuracy": 0.1475010745227337,
|
|
"num_tokens": 707367.0,
|
|
"step": 985
|
|
},
|
|
{
|
|
"entropy": 6.396135044097901,
|
|
"epoch": 0.02283368314228383,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004945,
|
|
"loss": 6.4877,
|
|
"mean_token_accuracy": 0.14678648263216018,
|
|
"num_tokens": 711686.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 6.352775239944458,
|
|
"epoch": 0.022949004774315565,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.000497,
|
|
"loss": 6.3399,
|
|
"mean_token_accuracy": 0.15635386481881142,
|
|
"num_tokens": 715183.0,
|
|
"step": 995
|
|
},
|
|
{
|
|
"entropy": 6.322125101089478,
|
|
"epoch": 0.023064326406347303,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004995,
|
|
"loss": 6.3754,
|
|
"mean_token_accuracy": 0.14837735146284103,
|
|
"num_tokens": 718730.0,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"entropy": 6.62501335144043,
|
|
"epoch": 0.02317964803837904,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.000499998026082006,
|
|
"loss": 6.4568,
|
|
"mean_token_accuracy": 0.14468817710876464,
|
|
"num_tokens": 722187.0,
|
|
"step": 1005
|
|
},
|
|
{
|
|
"entropy": 6.32572660446167,
|
|
"epoch": 0.023294969670410774,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004999900070995136,
|
|
"loss": 6.3606,
|
|
"mean_token_accuracy": 0.15079339742660522,
|
|
"num_tokens": 725554.0,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"entropy": 6.437408113479615,
|
|
"epoch": 0.023410291302442512,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004999758199023239,
|
|
"loss": 6.3909,
|
|
"mean_token_accuracy": 0.14708152115345002,
|
|
"num_tokens": 728875.0,
|
|
"step": 1015
|
|
},
|
|
{
|
|
"entropy": 6.323351812362671,
|
|
"epoch": 0.02352561293447425,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004999554648793858,
|
|
"loss": 6.2354,
|
|
"mean_token_accuracy": 0.154665906727314,
|
|
"num_tokens": 731990.0,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"entropy": 6.234646892547607,
|
|
"epoch": 0.023640934566505987,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004999289425887425,
|
|
"loss": 6.3546,
|
|
"mean_token_accuracy": 0.1499362073838711,
|
|
"num_tokens": 735199.0,
|
|
"step": 1025
|
|
},
|
|
{
|
|
"entropy": 6.368152284622193,
|
|
"epoch": 0.02375625619853772,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004998962537575161,
|
|
"loss": 6.2828,
|
|
"mean_token_accuracy": 0.15160825103521347,
|
|
"num_tokens": 738783.0,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"entropy": 6.303047561645508,
|
|
"epoch": 0.02387157783056946,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004998573992818874,
|
|
"loss": 6.3826,
|
|
"mean_token_accuracy": 0.15797285735607147,
|
|
"num_tokens": 742223.0,
|
|
"step": 1035
|
|
},
|
|
{
|
|
"entropy": 6.3283342838287355,
|
|
"epoch": 0.023986899462601196,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004998123802270715,
|
|
"loss": 6.4986,
|
|
"mean_token_accuracy": 0.14304248094558716,
|
|
"num_tokens": 746360.0,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"entropy": 6.484515571594239,
|
|
"epoch": 0.02410222109463293,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004997611978272886,
|
|
"loss": 6.3573,
|
|
"mean_token_accuracy": 0.1527860201895237,
|
|
"num_tokens": 749832.0,
|
|
"step": 1045
|
|
},
|
|
{
|
|
"entropy": 6.429174757003784,
|
|
"epoch": 0.024217542726664668,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004997038534857298,
|
|
"loss": 6.4256,
|
|
"mean_token_accuracy": 0.1434988111257553,
|
|
"num_tokens": 753658.0,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"entropy": 6.292228174209595,
|
|
"epoch": 0.024332864358696405,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004996403487745194,
|
|
"loss": 6.3508,
|
|
"mean_token_accuracy": 0.1513027109205723,
|
|
"num_tokens": 756801.0,
|
|
"step": 1055
|
|
},
|
|
{
|
|
"entropy": 6.406886625289917,
|
|
"epoch": 0.02444818599072814,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.000499570685434671,
|
|
"loss": 6.322,
|
|
"mean_token_accuracy": 0.1444218523800373,
|
|
"num_tokens": 760156.0,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"entropy": 6.368652486801148,
|
|
"epoch": 0.024563507622759877,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004994948653760405,
|
|
"loss": 6.3219,
|
|
"mean_token_accuracy": 0.14974402114748955,
|
|
"num_tokens": 763698.0,
|
|
"step": 1065
|
|
},
|
|
{
|
|
"entropy": 6.330729532241821,
|
|
"epoch": 0.024678829254791614,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004994128906772729,
|
|
"loss": 6.4758,
|
|
"mean_token_accuracy": 0.14954668283462524,
|
|
"num_tokens": 767064.0,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"entropy": 6.414439630508423,
|
|
"epoch": 0.024794150886823352,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.000499324763585746,
|
|
"loss": 6.3369,
|
|
"mean_token_accuracy": 0.14358527585864067,
|
|
"num_tokens": 770789.0,
|
|
"step": 1075
|
|
},
|
|
{
|
|
"entropy": 6.4898388385772705,
|
|
"epoch": 0.024909472518855086,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004992304865175085,
|
|
"loss": 6.3947,
|
|
"mean_token_accuracy": 0.15396371856331825,
|
|
"num_tokens": 774560.0,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"entropy": 6.4300370693206785,
|
|
"epoch": 0.025024794150886823,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.0004991300620572138,
|
|
"loss": 6.2374,
|
|
"mean_token_accuracy": 0.15147389471530914,
|
|
"num_tokens": 777789.0,
|
|
"step": 1085
|
|
},
|
|
{
|
|
"entropy": 6.24727053642273,
|
|
"epoch": 0.02514011578291856,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004990234929580494,
|
|
"loss": 6.3495,
|
|
"mean_token_accuracy": 0.16117030531167983,
|
|
"num_tokens": 781328.0,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"entropy": 6.419790601730346,
|
|
"epoch": 0.025255437414950295,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004989107821416609,
|
|
"loss": 6.297,
|
|
"mean_token_accuracy": 0.1486855238676071,
|
|
"num_tokens": 784852.0,
|
|
"step": 1095
|
|
},
|
|
{
|
|
"entropy": 6.187773895263672,
|
|
"epoch": 0.025370759046982033,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004987919326980723,
|
|
"loss": 6.3001,
|
|
"mean_token_accuracy": 0.15562721565365792,
|
|
"num_tokens": 788309.0,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"entropy": 6.271272754669189,
|
|
"epoch": 0.02548608067901377,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004986669478856011,
|
|
"loss": 6.3261,
|
|
"mean_token_accuracy": 0.15314735174179078,
|
|
"num_tokens": 791916.0,
|
|
"step": 1105
|
|
},
|
|
{
|
|
"entropy": 6.398954916000366,
|
|
"epoch": 0.025601402311045508,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004985358311307688,
|
|
"loss": 6.2889,
|
|
"mean_token_accuracy": 0.1459687538444996,
|
|
"num_tokens": 795592.0,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"entropy": 6.356507205963135,
|
|
"epoch": 0.02571672394307724,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004983985860282081,
|
|
"loss": 6.4106,
|
|
"mean_token_accuracy": 0.1406967006623745,
|
|
"num_tokens": 799422.0,
|
|
"step": 1115
|
|
},
|
|
{
|
|
"entropy": 6.31441707611084,
|
|
"epoch": 0.02583204557510898,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004982552163405623,
|
|
"loss": 6.3634,
|
|
"mean_token_accuracy": 0.15381874442100524,
|
|
"num_tokens": 803083.0,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"entropy": 6.520481824874878,
|
|
"epoch": 0.025947367207140717,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004981057259983839,
|
|
"loss": 6.2407,
|
|
"mean_token_accuracy": 0.16333811581134797,
|
|
"num_tokens": 806512.0,
|
|
"step": 1125
|
|
},
|
|
{
|
|
"entropy": 6.105662679672241,
|
|
"epoch": 0.02606268883917245,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004979501191000262,
|
|
"loss": 6.4007,
|
|
"mean_token_accuracy": 0.14836936742067336,
|
|
"num_tokens": 810081.0,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"entropy": 6.501620149612426,
|
|
"epoch": 0.02617801047120419,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004977883999115311,
|
|
"loss": 6.3522,
|
|
"mean_token_accuracy": 0.14895105436444284,
|
|
"num_tokens": 813844.0,
|
|
"step": 1135
|
|
},
|
|
{
|
|
"entropy": 6.404583597183228,
|
|
"epoch": 0.026293332103235926,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004976205728665113,
|
|
"loss": 6.3696,
|
|
"mean_token_accuracy": 0.14931450933218002,
|
|
"num_tokens": 817334.0,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"entropy": 6.281240224838257,
|
|
"epoch": 0.02640865373526766,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004974466425660307,
|
|
"loss": 6.3009,
|
|
"mean_token_accuracy": 0.15151196122169494,
|
|
"num_tokens": 821106.0,
|
|
"step": 1145
|
|
},
|
|
{
|
|
"entropy": 6.369183921813965,
|
|
"epoch": 0.026523975367299397,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.0004972666137784759,
|
|
"loss": 6.2973,
|
|
"mean_token_accuracy": 0.14527865797281264,
|
|
"num_tokens": 824625.0,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"entropy": 6.292097520828247,
|
|
"epoch": 0.026639296999331135,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004970804914394271,
|
|
"loss": 6.2235,
|
|
"mean_token_accuracy": 0.15668834149837493,
|
|
"num_tokens": 827879.0,
|
|
"step": 1155
|
|
},
|
|
{
|
|
"entropy": 6.342169237136841,
|
|
"epoch": 0.026754618631362873,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004968882806515225,
|
|
"loss": 6.3533,
|
|
"mean_token_accuracy": 0.1557260774075985,
|
|
"num_tokens": 831320.0,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"entropy": 6.337354612350464,
|
|
"epoch": 0.026869940263394607,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004966899866843177,
|
|
"loss": 6.3641,
|
|
"mean_token_accuracy": 0.14013018533587457,
|
|
"num_tokens": 834454.0,
|
|
"step": 1165
|
|
},
|
|
{
|
|
"entropy": 6.28965950012207,
|
|
"epoch": 0.026985261895426344,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.000496485614974142,
|
|
"loss": 6.3375,
|
|
"mean_token_accuracy": 0.14420116394758226,
|
|
"num_tokens": 838182.0,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"entropy": 6.224214315414429,
|
|
"epoch": 0.02710058352745808,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004962751711239492,
|
|
"loss": 6.1594,
|
|
"mean_token_accuracy": 0.16655184477567672,
|
|
"num_tokens": 841684.0,
|
|
"step": 1175
|
|
},
|
|
{
|
|
"entropy": 6.411214447021484,
|
|
"epoch": 0.027215905159489816,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004960586609031636,
|
|
"loss": 6.4334,
|
|
"mean_token_accuracy": 0.14897042885422707,
|
|
"num_tokens": 845335.0,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"entropy": 6.13843560218811,
|
|
"epoch": 0.027331226791521553,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004958360902475224,
|
|
"loss": 6.2975,
|
|
"mean_token_accuracy": 0.1526500515639782,
|
|
"num_tokens": 848901.0,
|
|
"step": 1185
|
|
},
|
|
{
|
|
"entropy": 6.5169679641723635,
|
|
"epoch": 0.02744654842355329,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004956074652589125,
|
|
"loss": 6.4083,
|
|
"mean_token_accuracy": 0.14077496752142907,
|
|
"num_tokens": 852567.0,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"entropy": 6.490850639343262,
|
|
"epoch": 0.02756187005558503,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004953727922052035,
|
|
"loss": 6.5075,
|
|
"mean_token_accuracy": 0.1386740691959858,
|
|
"num_tokens": 856798.0,
|
|
"step": 1195
|
|
},
|
|
{
|
|
"entropy": 6.476461887359619,
|
|
"epoch": 0.027677191687616762,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004951320775200756,
|
|
"loss": 6.4133,
|
|
"mean_token_accuracy": 0.15248756855726242,
|
|
"num_tokens": 860463.0,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"entropy": 6.432538557052612,
|
|
"epoch": 0.0277925133196485,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004948853278028436,
|
|
"loss": 6.3843,
|
|
"mean_token_accuracy": 0.15762968212366105,
|
|
"num_tokens": 864384.0,
|
|
"step": 1205
|
|
},
|
|
{
|
|
"entropy": 6.336051321029663,
|
|
"epoch": 0.027907834951680238,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004946325498182755,
|
|
"loss": 6.2781,
|
|
"mean_token_accuracy": 0.1527209609746933,
|
|
"num_tokens": 867928.0,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"entropy": 6.312854242324829,
|
|
"epoch": 0.02802315658371197,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004943737504964076,
|
|
"loss": 6.1901,
|
|
"mean_token_accuracy": 0.15976641923189164,
|
|
"num_tokens": 871373.0,
|
|
"step": 1215
|
|
},
|
|
{
|
|
"entropy": 6.233778858184815,
|
|
"epoch": 0.02813847821574371,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.000494108936932354,
|
|
"loss": 6.2842,
|
|
"mean_token_accuracy": 0.14794852286577226,
|
|
"num_tokens": 875043.0,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"entropy": 6.406742811203003,
|
|
"epoch": 0.028253799847775447,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004938381163861124,
|
|
"loss": 6.4112,
|
|
"mean_token_accuracy": 0.1519480362534523,
|
|
"num_tokens": 878329.0,
|
|
"step": 1225
|
|
},
|
|
{
|
|
"entropy": 6.168566799163818,
|
|
"epoch": 0.02836912147980718,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.0004935612962823645,
|
|
"loss": 6.2277,
|
|
"mean_token_accuracy": 0.15066030025482177,
|
|
"num_tokens": 881719.0,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"entropy": 6.404153537750244,
|
|
"epoch": 0.028484443111838918,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.0004932784842102739,
|
|
"loss": 6.2438,
|
|
"mean_token_accuracy": 0.17476099729537964,
|
|
"num_tokens": 885558.0,
|
|
"step": 1235
|
|
},
|
|
{
|
|
"entropy": 6.376621150970459,
|
|
"epoch": 0.028599764743870656,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004929896879232758,
|
|
"loss": 6.2521,
|
|
"mean_token_accuracy": 0.15536654517054557,
|
|
"num_tokens": 888882.0,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"entropy": 6.256564331054688,
|
|
"epoch": 0.028715086375902393,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004926949153388668,
|
|
"loss": 6.2937,
|
|
"mean_token_accuracy": 0.14391650259494781,
|
|
"num_tokens": 892599.0,
|
|
"step": 1245
|
|
},
|
|
{
|
|
"entropy": 6.316967582702636,
|
|
"epoch": 0.028830408007934127,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004923941745383859,
|
|
"loss": 6.1417,
|
|
"mean_token_accuracy": 0.1618731714785099,
|
|
"num_tokens": 896314.0,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"entropy": 6.0990440368652346,
|
|
"epoch": 0.028945729639965865,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.000492087473766794,
|
|
"loss": 6.1285,
|
|
"mean_token_accuracy": 0.16341657787561417,
|
|
"num_tokens": 899822.0,
|
|
"step": 1255
|
|
},
|
|
{
|
|
"entropy": 6.209489202499389,
|
|
"epoch": 0.029061051271997602,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.000491774821432448,
|
|
"loss": 6.2634,
|
|
"mean_token_accuracy": 0.1522805154323578,
|
|
"num_tokens": 903076.0,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"entropy": 6.091508293151856,
|
|
"epoch": 0.029176372904029337,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004914562261068693,
|
|
"loss": 6.0647,
|
|
"mean_token_accuracy": 0.15861415714025498,
|
|
"num_tokens": 906270.0,
|
|
"step": 1265
|
|
},
|
|
{
|
|
"entropy": 6.227058696746826,
|
|
"epoch": 0.029291694536061074,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004911316965245098,
|
|
"loss": 6.1538,
|
|
"mean_token_accuracy": 0.16386841982603073,
|
|
"num_tokens": 909749.0,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"entropy": 6.407493352890015,
|
|
"epoch": 0.02940701616809281,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.000490801241582512,
|
|
"loss": 6.4111,
|
|
"mean_token_accuracy": 0.14004577994346618,
|
|
"num_tokens": 913513.0,
|
|
"step": 1275
|
|
},
|
|
{
|
|
"entropy": 6.329074144363403,
|
|
"epoch": 0.029522337800124546,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.000490464870340465,
|
|
"loss": 6.2342,
|
|
"mean_token_accuracy": 0.1552743799984455,
|
|
"num_tokens": 917233.0,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"entropy": 6.136275959014893,
|
|
"epoch": 0.029637659432156283,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0004901225920201563,
|
|
"loss": 6.2121,
|
|
"mean_token_accuracy": 0.15740371942520143,
|
|
"num_tokens": 920667.0,
|
|
"step": 1285
|
|
},
|
|
{
|
|
"entropy": 6.190396308898926,
|
|
"epoch": 0.02975298106418802,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.000489774416005319,
|
|
"loss": 6.1827,
|
|
"mean_token_accuracy": 0.17489669919013978,
|
|
"num_tokens": 924089.0,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"entropy": 6.07538161277771,
|
|
"epoch": 0.02986830269621976,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.0004894203518413742,
|
|
"loss": 6.137,
|
|
"mean_token_accuracy": 0.16207724213600158,
|
|
"num_tokens": 927677.0,
|
|
"step": 1295
|
|
},
|
|
{
|
|
"entropy": 6.431777620315552,
|
|
"epoch": 0.029983624328251492,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004890604092351701,
|
|
"loss": 6.2296,
|
|
"mean_token_accuracy": 0.15114597231149673,
|
|
"num_tokens": 931103.0,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"entropy": 6.223585557937622,
|
|
"epoch": 0.03009894596028323,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000488694598054715,
|
|
"loss": 6.2609,
|
|
"mean_token_accuracy": 0.1521705225110054,
|
|
"num_tokens": 934898.0,
|
|
"step": 1305
|
|
},
|
|
{
|
|
"entropy": 6.319894886016845,
|
|
"epoch": 0.030214267592314967,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004883229283289071,
|
|
"loss": 6.1789,
|
|
"mean_token_accuracy": 0.15976286232471465,
|
|
"num_tokens": 938065.0,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"entropy": 6.2378973960876465,
|
|
"epoch": 0.0303295892243467,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00048794541024725993,
|
|
"loss": 6.2546,
|
|
"mean_token_accuracy": 0.15641364604234695,
|
|
"num_tokens": 941841.0,
|
|
"step": 1315
|
|
},
|
|
{
|
|
"entropy": 6.289143991470337,
|
|
"epoch": 0.03044491085637844,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004875620541596221,
|
|
"loss": 6.2547,
|
|
"mean_token_accuracy": 0.15297225639224052,
|
|
"num_tokens": 945498.0,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"entropy": 6.34889588356018,
|
|
"epoch": 0.030560232488410177,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00048717287057589454,
|
|
"loss": 6.2074,
|
|
"mean_token_accuracy": 0.15397942066192627,
|
|
"num_tokens": 949043.0,
|
|
"step": 1325
|
|
},
|
|
{
|
|
"entropy": 6.282046842575073,
|
|
"epoch": 0.030675554120441914,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004867778701657417,
|
|
"loss": 6.2069,
|
|
"mean_token_accuracy": 0.15130080431699752,
|
|
"num_tokens": 952868.0,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"entropy": 6.258489274978638,
|
|
"epoch": 0.030790875752473648,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00048637706375829955,
|
|
"loss": 6.0432,
|
|
"mean_token_accuracy": 0.1698402062058449,
|
|
"num_tokens": 956112.0,
|
|
"step": 1335
|
|
},
|
|
{
|
|
"entropy": 6.061002588272094,
|
|
"epoch": 0.030906197384505386,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.000485970462341878,
|
|
"loss": 6.2071,
|
|
"mean_token_accuracy": 0.1544427402317524,
|
|
"num_tokens": 959742.0,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"entropy": 6.380103063583374,
|
|
"epoch": 0.031021519016537123,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00048555807706366044,
|
|
"loss": 6.2252,
|
|
"mean_token_accuracy": 0.14561877325177192,
|
|
"num_tokens": 963153.0,
|
|
"step": 1345
|
|
},
|
|
{
|
|
"entropy": 6.16155161857605,
|
|
"epoch": 0.031136840648568857,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00048513991922939756,
|
|
"loss": 6.173,
|
|
"mean_token_accuracy": 0.15342152416706084,
|
|
"num_tokens": 966531.0,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"entropy": 6.135410356521606,
|
|
"epoch": 0.0312521622806006,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00048471600030309744,
|
|
"loss": 6.2382,
|
|
"mean_token_accuracy": 0.15941717475652695,
|
|
"num_tokens": 970441.0,
|
|
"step": 1355
|
|
},
|
|
{
|
|
"entropy": 6.366029977798462,
|
|
"epoch": 0.03136748391263233,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00048428633190671186,
|
|
"loss": 6.2376,
|
|
"mean_token_accuracy": 0.15529564544558525,
|
|
"num_tokens": 974081.0,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"entropy": 6.170897102355957,
|
|
"epoch": 0.031482805544664066,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004838509258198167,
|
|
"loss": 6.2066,
|
|
"mean_token_accuracy": 0.15893015414476394,
|
|
"num_tokens": 977477.0,
|
|
"step": 1365
|
|
},
|
|
{
|
|
"entropy": 6.194993352890014,
|
|
"epoch": 0.03159812717669581,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00048340979397929,
|
|
"loss": 6.2529,
|
|
"mean_token_accuracy": 0.15727411061525345,
|
|
"num_tokens": 980672.0,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"entropy": 6.271054458618164,
|
|
"epoch": 0.03171344880872754,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00048296294847898386,
|
|
"loss": 6.1784,
|
|
"mean_token_accuracy": 0.15967788249254228,
|
|
"num_tokens": 984148.0,
|
|
"step": 1375
|
|
},
|
|
{
|
|
"entropy": 6.081877613067627,
|
|
"epoch": 0.031828770440759276,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004825104015693934,
|
|
"loss": 6.1263,
|
|
"mean_token_accuracy": 0.1539233572781086,
|
|
"num_tokens": 987532.0,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"entropy": 6.235986709594727,
|
|
"epoch": 0.03194409207279102,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004820521656573208,
|
|
"loss": 6.252,
|
|
"mean_token_accuracy": 0.15114179700613023,
|
|
"num_tokens": 991300.0,
|
|
"step": 1385
|
|
},
|
|
{
|
|
"entropy": 6.245265817642212,
|
|
"epoch": 0.03205941370482275,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00048158825330553505,
|
|
"loss": 6.1516,
|
|
"mean_token_accuracy": 0.1626199223101139,
|
|
"num_tokens": 994860.0,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"entropy": 6.267541837692261,
|
|
"epoch": 0.032174735336854485,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00048111867723242763,
|
|
"loss": 6.0817,
|
|
"mean_token_accuracy": 0.15991926193237305,
|
|
"num_tokens": 998320.0,
|
|
"step": 1395
|
|
},
|
|
{
|
|
"entropy": 6.178429985046387,
|
|
"epoch": 0.032290056968886226,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004806434503116637,
|
|
"loss": 6.136,
|
|
"mean_token_accuracy": 0.1581188626587391,
|
|
"num_tokens": 1001510.0,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"entropy": 6.200129270553589,
|
|
"epoch": 0.03240537860091796,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004801625855718296,
|
|
"loss": 6.1459,
|
|
"mean_token_accuracy": 0.15652914941310883,
|
|
"num_tokens": 1005051.0,
|
|
"step": 1405
|
|
},
|
|
{
|
|
"entropy": 6.050179481506348,
|
|
"epoch": 0.032520700232949694,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00047967609619607477,
|
|
"loss": 6.099,
|
|
"mean_token_accuracy": 0.16462735533714296,
|
|
"num_tokens": 1008339.0,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"entropy": 6.331070899963379,
|
|
"epoch": 0.032636021864981435,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004791839955217513,
|
|
"loss": 6.3128,
|
|
"mean_token_accuracy": 0.15583118200302123,
|
|
"num_tokens": 1012072.0,
|
|
"step": 1415
|
|
},
|
|
{
|
|
"entropy": 6.371997499465943,
|
|
"epoch": 0.03275134349701317,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00047868629704004786,
|
|
"loss": 6.1849,
|
|
"mean_token_accuracy": 0.16881252229213714,
|
|
"num_tokens": 1015733.0,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"entropy": 6.142761659622193,
|
|
"epoch": 0.0328666651290449,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00047818301439561965,
|
|
"loss": 6.3103,
|
|
"mean_token_accuracy": 0.1449531525373459,
|
|
"num_tokens": 1019723.0,
|
|
"step": 1425
|
|
},
|
|
{
|
|
"entropy": 6.3080970287323,
|
|
"epoch": 0.032981986761076644,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00047767416138621454,
|
|
"loss": 6.1312,
|
|
"mean_token_accuracy": 0.16128634810447692,
|
|
"num_tokens": 1023399.0,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"entropy": 6.1839087963104244,
|
|
"epoch": 0.03309730839310838,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000477159751962295,
|
|
"loss": 6.3179,
|
|
"mean_token_accuracy": 0.14733664467930793,
|
|
"num_tokens": 1027654.0,
|
|
"step": 1435
|
|
},
|
|
{
|
|
"entropy": 6.340977716445923,
|
|
"epoch": 0.03321263002514012,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.00047663980022665507,
|
|
"loss": 6.2318,
|
|
"mean_token_accuracy": 0.15191248804330826,
|
|
"num_tokens": 1031093.0,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"entropy": 6.1485453128814695,
|
|
"epoch": 0.03332795165717185,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00047611432043403437,
|
|
"loss": 6.1431,
|
|
"mean_token_accuracy": 0.1620752789080143,
|
|
"num_tokens": 1034283.0,
|
|
"step": 1445
|
|
},
|
|
{
|
|
"entropy": 6.151244878768921,
|
|
"epoch": 0.03344327328920359,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004755833269907267,
|
|
"loss": 6.0321,
|
|
"mean_token_accuracy": 0.16732411906123162,
|
|
"num_tokens": 1038026.0,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"entropy": 6.320617818832398,
|
|
"epoch": 0.03355859492123533,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004750468344541857,
|
|
"loss": 6.1843,
|
|
"mean_token_accuracy": 0.1639467418193817,
|
|
"num_tokens": 1041691.0,
|
|
"step": 1455
|
|
},
|
|
{
|
|
"entropy": 6.232364463806152,
|
|
"epoch": 0.03367391655326706,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.00047450485753262525,
|
|
"loss": 6.2904,
|
|
"mean_token_accuracy": 0.15383075401186944,
|
|
"num_tokens": 1045355.0,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"entropy": 6.2604328155517575,
|
|
"epoch": 0.033789238185298796,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00047395741108461633,
|
|
"loss": 6.2302,
|
|
"mean_token_accuracy": 0.16124827265739441,
|
|
"num_tokens": 1048708.0,
|
|
"step": 1465
|
|
},
|
|
{
|
|
"entropy": 6.1916501998901365,
|
|
"epoch": 0.03390455981733054,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00047340451011867985,
|
|
"loss": 6.1116,
|
|
"mean_token_accuracy": 0.15790043771266937,
|
|
"num_tokens": 1052193.0,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"entropy": 6.245907640457153,
|
|
"epoch": 0.03401988144936227,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00047284616979287515,
|
|
"loss": 6.1081,
|
|
"mean_token_accuracy": 0.16149753630161284,
|
|
"num_tokens": 1055680.0,
|
|
"step": 1475
|
|
},
|
|
{
|
|
"entropy": 6.276849269866943,
|
|
"epoch": 0.034135203081394005,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00047228240541438433,
|
|
"loss": 6.2724,
|
|
"mean_token_accuracy": 0.14618031084537506,
|
|
"num_tokens": 1059594.0,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"entropy": 5.961967182159424,
|
|
"epoch": 0.034250524713425747,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00047171323243909257,
|
|
"loss": 6.0493,
|
|
"mean_token_accuracy": 0.16997741907835007,
|
|
"num_tokens": 1062911.0,
|
|
"step": 1485
|
|
},
|
|
{
|
|
"entropy": 6.177064704895019,
|
|
"epoch": 0.03436584634545748,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00047113866647116457,
|
|
"loss": 6.1622,
|
|
"mean_token_accuracy": 0.1611722856760025,
|
|
"num_tokens": 1066682.0,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"entropy": 6.3686439990997314,
|
|
"epoch": 0.034481167977489215,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004705587232626164,
|
|
"loss": 6.3555,
|
|
"mean_token_accuracy": 0.14763259887695312,
|
|
"num_tokens": 1070559.0,
|
|
"step": 1495
|
|
},
|
|
{
|
|
"entropy": 6.399481296539307,
|
|
"epoch": 0.034596489609520956,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00046997341871288424,
|
|
"loss": 6.1886,
|
|
"mean_token_accuracy": 0.14196808710694314,
|
|
"num_tokens": 1074079.0,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"entropy": 6.146364688873291,
|
|
"epoch": 0.03471181124155269,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 0.0004693827688683879,
|
|
"loss": 6.1912,
|
|
"mean_token_accuracy": 0.1646449625492096,
|
|
"num_tokens": 1077450.0,
|
|
"step": 1505
|
|
},
|
|
{
|
|
"entropy": 6.380840110778808,
|
|
"epoch": 0.034827132873584424,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004687867899220914,
|
|
"loss": 6.2751,
|
|
"mean_token_accuracy": 0.156388820707798,
|
|
"num_tokens": 1081104.0,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"entropy": 6.217929935455322,
|
|
"epoch": 0.034942454505616165,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.00046818549821305846,
|
|
"loss": 6.0832,
|
|
"mean_token_accuracy": 0.16631921082735063,
|
|
"num_tokens": 1084525.0,
|
|
"step": 1515
|
|
},
|
|
{
|
|
"entropy": 6.082294082641601,
|
|
"epoch": 0.0350577761376479,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.00046757891022600494,
|
|
"loss": 6.1173,
|
|
"mean_token_accuracy": 0.1607721894979477,
|
|
"num_tokens": 1088073.0,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"entropy": 6.161862897872925,
|
|
"epoch": 0.03517309776967964,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004669670425908471,
|
|
"loss": 6.1957,
|
|
"mean_token_accuracy": 0.1579139418900013,
|
|
"num_tokens": 1091471.0,
|
|
"step": 1525
|
|
},
|
|
{
|
|
"entropy": 6.222669076919556,
|
|
"epoch": 0.035288419401711374,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004663499120822451,
|
|
"loss": 5.9901,
|
|
"mean_token_accuracy": 0.17222017496824266,
|
|
"num_tokens": 1095176.0,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"entropy": 6.170104169845581,
|
|
"epoch": 0.03540374103374311,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004657275356191437,
|
|
"loss": 6.1183,
|
|
"mean_token_accuracy": 0.16429525017738342,
|
|
"num_tokens": 1098802.0,
|
|
"step": 1535
|
|
},
|
|
{
|
|
"entropy": 6.188034915924073,
|
|
"epoch": 0.03551906266577485,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00046509993026430804,
|
|
"loss": 6.0601,
|
|
"mean_token_accuracy": 0.16619377508759497,
|
|
"num_tokens": 1102470.0,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"entropy": 6.193576955795288,
|
|
"epoch": 0.03563438429780658,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004644671132238558,
|
|
"loss": 6.0983,
|
|
"mean_token_accuracy": 0.15427771657705308,
|
|
"num_tokens": 1106357.0,
|
|
"step": 1545
|
|
},
|
|
{
|
|
"entropy": 6.105885171890259,
|
|
"epoch": 0.03574970592983832,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00046382910184678585,
|
|
"loss": 6.2517,
|
|
"mean_token_accuracy": 0.15719945058226586,
|
|
"num_tokens": 1109793.0,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"entropy": 6.085718631744385,
|
|
"epoch": 0.03586502756187006,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004631859136245025,
|
|
"loss": 6.1414,
|
|
"mean_token_accuracy": 0.16397046595811843,
|
|
"num_tokens": 1113168.0,
|
|
"step": 1555
|
|
},
|
|
{
|
|
"entropy": 6.27104434967041,
|
|
"epoch": 0.03598034919390179,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004625375661903357,
|
|
"loss": 6.1152,
|
|
"mean_token_accuracy": 0.16101985722780227,
|
|
"num_tokens": 1117049.0,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"entropy": 6.293149995803833,
|
|
"epoch": 0.036095670825933526,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.00046188407731905787,
|
|
"loss": 6.1739,
|
|
"mean_token_accuracy": 0.15761781558394433,
|
|
"num_tokens": 1120560.0,
|
|
"step": 1565
|
|
},
|
|
{
|
|
"entropy": 6.117485427856446,
|
|
"epoch": 0.03621099245796527,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00046122546492639643,
|
|
"loss": 6.0227,
|
|
"mean_token_accuracy": 0.1623656965792179,
|
|
"num_tokens": 1124005.0,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"entropy": 6.099512052536011,
|
|
"epoch": 0.036326314089997,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.000460561747068543,
|
|
"loss": 6.1301,
|
|
"mean_token_accuracy": 0.16618029475212098,
|
|
"num_tokens": 1127407.0,
|
|
"step": 1575
|
|
},
|
|
{
|
|
"entropy": 6.252836036682129,
|
|
"epoch": 0.036441635722028735,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004598929419416578,
|
|
"loss": 6.0248,
|
|
"mean_token_accuracy": 0.17052212357521057,
|
|
"num_tokens": 1131011.0,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"entropy": 6.10662841796875,
|
|
"epoch": 0.036556957354060476,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.00045921906788137123,
|
|
"loss": 6.0539,
|
|
"mean_token_accuracy": 0.16527445167303084,
|
|
"num_tokens": 1134427.0,
|
|
"step": 1585
|
|
},
|
|
{
|
|
"entropy": 6.235507965087891,
|
|
"epoch": 0.03667227898609221,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00045854014336228115,
|
|
"loss": 6.1162,
|
|
"mean_token_accuracy": 0.1626933127641678,
|
|
"num_tokens": 1138337.0,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"entropy": 6.110680294036865,
|
|
"epoch": 0.036787600618123945,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00045785618699744615,
|
|
"loss": 6.1271,
|
|
"mean_token_accuracy": 0.1606894239783287,
|
|
"num_tokens": 1142123.0,
|
|
"step": 1595
|
|
},
|
|
{
|
|
"entropy": 6.190400838851929,
|
|
"epoch": 0.036902922250155686,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00045716721753787543,
|
|
"loss": 6.081,
|
|
"mean_token_accuracy": 0.16977082192897797,
|
|
"num_tokens": 1145338.0,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"entropy": 6.240235757827759,
|
|
"epoch": 0.03701824388218742,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004564732538720148,
|
|
"loss": 6.2268,
|
|
"mean_token_accuracy": 0.15114571154117584,
|
|
"num_tokens": 1149277.0,
|
|
"step": 1605
|
|
},
|
|
{
|
|
"entropy": 6.209791994094848,
|
|
"epoch": 0.03713356551421916,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00045577431502522877,
|
|
"loss": 6.2289,
|
|
"mean_token_accuracy": 0.1607456311583519,
|
|
"num_tokens": 1152776.0,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"entropy": 6.08086576461792,
|
|
"epoch": 0.037248887146250895,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004550704201592787,
|
|
"loss": 5.9521,
|
|
"mean_token_accuracy": 0.1620200291275978,
|
|
"num_tokens": 1156389.0,
|
|
"step": 1615
|
|
},
|
|
{
|
|
"entropy": 6.049930000305176,
|
|
"epoch": 0.03736420877828263,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004543615885717981,
|
|
"loss": 6.0107,
|
|
"mean_token_accuracy": 0.16893413960933684,
|
|
"num_tokens": 1159350.0,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"entropy": 6.2026038646698,
|
|
"epoch": 0.03747953041031437,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.00045364783969576296,
|
|
"loss": 6.0943,
|
|
"mean_token_accuracy": 0.1669295035302639,
|
|
"num_tokens": 1163030.0,
|
|
"step": 1625
|
|
},
|
|
{
|
|
"entropy": 6.159232568740845,
|
|
"epoch": 0.037594852042346104,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004529291930989592,
|
|
"loss": 6.055,
|
|
"mean_token_accuracy": 0.15932923331856727,
|
|
"num_tokens": 1166353.0,
|
|
"step": 1630
|
|
},
|
|
{
|
|
"entropy": 6.360183811187744,
|
|
"epoch": 0.03771017367437784,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004522056684834464,
|
|
"loss": 6.1436,
|
|
"mean_token_accuracy": 0.1584683448076248,
|
|
"num_tokens": 1170085.0,
|
|
"step": 1635
|
|
},
|
|
{
|
|
"entropy": 6.089408349990845,
|
|
"epoch": 0.03782549530640958,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004514772856850173,
|
|
"loss": 6.0428,
|
|
"mean_token_accuracy": 0.16163670271635056,
|
|
"num_tokens": 1173345.0,
|
|
"step": 1640
|
|
},
|
|
{
|
|
"entropy": 6.08073844909668,
|
|
"epoch": 0.03794081693844131,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004507440646726542,
|
|
"loss": 6.1306,
|
|
"mean_token_accuracy": 0.17117144614458085,
|
|
"num_tokens": 1177166.0,
|
|
"step": 1645
|
|
},
|
|
{
|
|
"entropy": 6.259210252761841,
|
|
"epoch": 0.03805613857047305,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004500060255479818,
|
|
"loss": 6.0583,
|
|
"mean_token_accuracy": 0.16698935478925706,
|
|
"num_tokens": 1180962.0,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"entropy": 6.145126819610596,
|
|
"epoch": 0.03817146020250479,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004492631885447151,
|
|
"loss": 6.1212,
|
|
"mean_token_accuracy": 0.15358480364084243,
|
|
"num_tokens": 1184545.0,
|
|
"step": 1655
|
|
},
|
|
{
|
|
"entropy": 6.112510061264038,
|
|
"epoch": 0.03828678183453652,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00044851557402810616,
|
|
"loss": 6.0536,
|
|
"mean_token_accuracy": 0.17121080309152603,
|
|
"num_tokens": 1188151.0,
|
|
"step": 1660
|
|
},
|
|
{
|
|
"entropy": 6.1365796566009525,
|
|
"epoch": 0.038402103466568256,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00044776320249438444,
|
|
"loss": 6.125,
|
|
"mean_token_accuracy": 0.16721008867025375,
|
|
"num_tokens": 1191616.0,
|
|
"step": 1665
|
|
},
|
|
{
|
|
"entropy": 6.255848693847656,
|
|
"epoch": 0.0385174250986,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00044700609457019565,
|
|
"loss": 6.0572,
|
|
"mean_token_accuracy": 0.17096714824438095,
|
|
"num_tokens": 1195151.0,
|
|
"step": 1670
|
|
},
|
|
{
|
|
"entropy": 6.254526996612549,
|
|
"epoch": 0.03863274673063173,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004462442710120359,
|
|
"loss": 6.1225,
|
|
"mean_token_accuracy": 0.16628739684820176,
|
|
"num_tokens": 1198424.0,
|
|
"step": 1675
|
|
},
|
|
{
|
|
"entropy": 5.967656421661377,
|
|
"epoch": 0.038748068362663465,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.000445477752705683,
|
|
"loss": 5.8662,
|
|
"mean_token_accuracy": 0.17162444740533828,
|
|
"num_tokens": 1201734.0,
|
|
"step": 1680
|
|
},
|
|
{
|
|
"entropy": 6.045426559448242,
|
|
"epoch": 0.038863389994695206,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00044470656066562336,
|
|
"loss": 6.0132,
|
|
"mean_token_accuracy": 0.16216118335723878,
|
|
"num_tokens": 1205459.0,
|
|
"step": 1685
|
|
},
|
|
{
|
|
"entropy": 6.162248420715332,
|
|
"epoch": 0.03897871162672694,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004439307160344765,
|
|
"loss": 6.0186,
|
|
"mean_token_accuracy": 0.16619355976581573,
|
|
"num_tokens": 1208834.0,
|
|
"step": 1690
|
|
},
|
|
{
|
|
"entropy": 6.174242544174194,
|
|
"epoch": 0.03909403325875868,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00044315024008241473,
|
|
"loss": 6.259,
|
|
"mean_token_accuracy": 0.1478450171649456,
|
|
"num_tokens": 1212784.0,
|
|
"step": 1695
|
|
},
|
|
{
|
|
"entropy": 6.343083000183105,
|
|
"epoch": 0.039209354890790415,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004423651542065806,
|
|
"loss": 6.1379,
|
|
"mean_token_accuracy": 0.16056481152772903,
|
|
"num_tokens": 1216374.0,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"entropy": 6.180943155288697,
|
|
"epoch": 0.03932467652282215,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00044157547993050006,
|
|
"loss": 5.9442,
|
|
"mean_token_accuracy": 0.16904959678649903,
|
|
"num_tokens": 1219897.0,
|
|
"step": 1705
|
|
},
|
|
{
|
|
"entropy": 6.13713960647583,
|
|
"epoch": 0.03943999815485389,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00044078123890349227,
|
|
"loss": 6.1175,
|
|
"mean_token_accuracy": 0.15540150851011275,
|
|
"num_tokens": 1223440.0,
|
|
"step": 1710
|
|
},
|
|
{
|
|
"entropy": 6.13908748626709,
|
|
"epoch": 0.039555319786885625,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00043998245290007606,
|
|
"loss": 6.1601,
|
|
"mean_token_accuracy": 0.1486704558134079,
|
|
"num_tokens": 1227074.0,
|
|
"step": 1715
|
|
},
|
|
{
|
|
"entropy": 6.146241235733032,
|
|
"epoch": 0.03967064141891736,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00043917914381937323,
|
|
"loss": 6.1146,
|
|
"mean_token_accuracy": 0.1662242069840431,
|
|
"num_tokens": 1230921.0,
|
|
"step": 1720
|
|
},
|
|
{
|
|
"entropy": 6.26403398513794,
|
|
"epoch": 0.0397859630509491,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00043837133368450815,
|
|
"loss": 6.0855,
|
|
"mean_token_accuracy": 0.16866125166416168,
|
|
"num_tokens": 1234409.0,
|
|
"step": 1725
|
|
},
|
|
{
|
|
"entropy": 6.221911668777466,
|
|
"epoch": 0.039901284682980834,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004375590446420037,
|
|
"loss": 6.2278,
|
|
"mean_token_accuracy": 0.15684191808104514,
|
|
"num_tokens": 1237808.0,
|
|
"step": 1730
|
|
},
|
|
{
|
|
"entropy": 6.181419134140015,
|
|
"epoch": 0.04001660631501257,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004367422989611743,
|
|
"loss": 6.098,
|
|
"mean_token_accuracy": 0.16497262716293334,
|
|
"num_tokens": 1241342.0,
|
|
"step": 1735
|
|
},
|
|
{
|
|
"entropy": 6.125293397903443,
|
|
"epoch": 0.04013192794704431,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004359211190335153,
|
|
"loss": 6.0605,
|
|
"mean_token_accuracy": 0.1732634887099266,
|
|
"num_tokens": 1244754.0,
|
|
"step": 1740
|
|
},
|
|
{
|
|
"entropy": 6.169851303100586,
|
|
"epoch": 0.04024724957907604,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00043509552737208923,
|
|
"loss": 6.0142,
|
|
"mean_token_accuracy": 0.16834313720464705,
|
|
"num_tokens": 1248104.0,
|
|
"step": 1745
|
|
},
|
|
{
|
|
"entropy": 6.123953056335449,
|
|
"epoch": 0.04036257121110778,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.00043426554661090853,
|
|
"loss": 5.9814,
|
|
"mean_token_accuracy": 0.16525087058544158,
|
|
"num_tokens": 1251447.0,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"entropy": 6.168983697891235,
|
|
"epoch": 0.04047789284313952,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00043343119950431516,
|
|
"loss": 6.0766,
|
|
"mean_token_accuracy": 0.15967110991477967,
|
|
"num_tokens": 1254820.0,
|
|
"step": 1755
|
|
},
|
|
{
|
|
"entropy": 6.107172632217408,
|
|
"epoch": 0.04059321447517125,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00043259250892635644,
|
|
"loss": 6.041,
|
|
"mean_token_accuracy": 0.1613576665520668,
|
|
"num_tokens": 1258539.0,
|
|
"step": 1760
|
|
},
|
|
{
|
|
"entropy": 5.984593915939331,
|
|
"epoch": 0.040708536107202986,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004317494978701582,
|
|
"loss": 5.7816,
|
|
"mean_token_accuracy": 0.1790942892432213,
|
|
"num_tokens": 1261900.0,
|
|
"step": 1765
|
|
},
|
|
{
|
|
"entropy": 5.936560773849488,
|
|
"epoch": 0.04082385773923473,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004309021894472943,
|
|
"loss": 6.0371,
|
|
"mean_token_accuracy": 0.16590082943439483,
|
|
"num_tokens": 1265575.0,
|
|
"step": 1770
|
|
},
|
|
{
|
|
"entropy": 6.07541332244873,
|
|
"epoch": 0.04093917937126646,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004300506068871534,
|
|
"loss": 6.0828,
|
|
"mean_token_accuracy": 0.1611502930521965,
|
|
"num_tokens": 1269290.0,
|
|
"step": 1775
|
|
},
|
|
{
|
|
"entropy": 6.282960844039917,
|
|
"epoch": 0.041054501003298195,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00042919477353630135,
|
|
"loss": 6.1452,
|
|
"mean_token_accuracy": 0.152590075135231,
|
|
"num_tokens": 1273253.0,
|
|
"step": 1780
|
|
},
|
|
{
|
|
"entropy": 6.1060491561889645,
|
|
"epoch": 0.041169822635329936,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.000428334712857842,
|
|
"loss": 6.0466,
|
|
"mean_token_accuracy": 0.16835376545786856,
|
|
"num_tokens": 1276535.0,
|
|
"step": 1785
|
|
},
|
|
{
|
|
"entropy": 6.045465660095215,
|
|
"epoch": 0.04128514426736167,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00042747044843077304,
|
|
"loss": 6.0242,
|
|
"mean_token_accuracy": 0.1612742379307747,
|
|
"num_tokens": 1279862.0,
|
|
"step": 1790
|
|
},
|
|
{
|
|
"entropy": 6.100957536697388,
|
|
"epoch": 0.04140046589939341,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00042660200394934047,
|
|
"loss": 6.1149,
|
|
"mean_token_accuracy": 0.16432895213365556,
|
|
"num_tokens": 1283671.0,
|
|
"step": 1795
|
|
},
|
|
{
|
|
"entropy": 6.261464691162109,
|
|
"epoch": 0.041515787531425145,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00042572940322238844,
|
|
"loss": 6.168,
|
|
"mean_token_accuracy": 0.1580469474196434,
|
|
"num_tokens": 1287545.0,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"entropy": 6.333411931991577,
|
|
"epoch": 0.04163110916345688,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00042485267017270664,
|
|
"loss": 6.1423,
|
|
"mean_token_accuracy": 0.15818402767181397,
|
|
"num_tokens": 1291044.0,
|
|
"step": 1805
|
|
},
|
|
{
|
|
"entropy": 5.994283294677734,
|
|
"epoch": 0.04174643079548862,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004239718288363745,
|
|
"loss": 5.8878,
|
|
"mean_token_accuracy": 0.1756291300058365,
|
|
"num_tokens": 1294349.0,
|
|
"step": 1810
|
|
},
|
|
{
|
|
"entropy": 6.019616651535034,
|
|
"epoch": 0.041861752427520355,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004230869033621023,
|
|
"loss": 6.0313,
|
|
"mean_token_accuracy": 0.17268310487270355,
|
|
"num_tokens": 1297723.0,
|
|
"step": 1815
|
|
},
|
|
{
|
|
"entropy": 6.098737716674805,
|
|
"epoch": 0.04197707405955209,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004221979180105688,
|
|
"loss": 6.088,
|
|
"mean_token_accuracy": 0.1723474606871605,
|
|
"num_tokens": 1301370.0,
|
|
"step": 1820
|
|
},
|
|
{
|
|
"entropy": 6.12902455329895,
|
|
"epoch": 0.04209239569158383,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00042130489715375645,
|
|
"loss": 5.9812,
|
|
"mean_token_accuracy": 0.16246043741703034,
|
|
"num_tokens": 1304883.0,
|
|
"step": 1825
|
|
},
|
|
{
|
|
"entropy": 6.216316795349121,
|
|
"epoch": 0.042207717323615564,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.00042040786527428335,
|
|
"loss": 5.998,
|
|
"mean_token_accuracy": 0.1586702957749367,
|
|
"num_tokens": 1308764.0,
|
|
"step": 1830
|
|
},
|
|
{
|
|
"entropy": 5.99324049949646,
|
|
"epoch": 0.0423230389556473,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004195068469647315,
|
|
"loss": 5.8561,
|
|
"mean_token_accuracy": 0.18727454245090486,
|
|
"num_tokens": 1312252.0,
|
|
"step": 1835
|
|
},
|
|
{
|
|
"entropy": 5.980302715301514,
|
|
"epoch": 0.04243836058767904,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.00041860186692697297,
|
|
"loss": 6.045,
|
|
"mean_token_accuracy": 0.16267816126346588,
|
|
"num_tokens": 1316115.0,
|
|
"step": 1840
|
|
},
|
|
{
|
|
"entropy": 6.071458625793457,
|
|
"epoch": 0.04255368221971077,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00041769294997149264,
|
|
"loss": 5.9403,
|
|
"mean_token_accuracy": 0.17197509184479715,
|
|
"num_tokens": 1319384.0,
|
|
"step": 1845
|
|
},
|
|
{
|
|
"entropy": 6.084967470169067,
|
|
"epoch": 0.04266900385174251,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004167801210167081,
|
|
"loss": 5.9177,
|
|
"mean_token_accuracy": 0.17900481671094895,
|
|
"num_tokens": 1322726.0,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"entropy": 5.911493730545044,
|
|
"epoch": 0.04278432548377425,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004158634050882861,
|
|
"loss": 6.0838,
|
|
"mean_token_accuracy": 0.17069419026374816,
|
|
"num_tokens": 1326359.0,
|
|
"step": 1855
|
|
},
|
|
{
|
|
"entropy": 6.0123388290405275,
|
|
"epoch": 0.04289964711580598,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004149428273184569,
|
|
"loss": 5.9369,
|
|
"mean_token_accuracy": 0.17325670272111893,
|
|
"num_tokens": 1329645.0,
|
|
"step": 1860
|
|
},
|
|
{
|
|
"entropy": 6.215741968154907,
|
|
"epoch": 0.043014968747837716,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004140184129453253,
|
|
"loss": 6.0017,
|
|
"mean_token_accuracy": 0.16124175488948822,
|
|
"num_tokens": 1332967.0,
|
|
"step": 1865
|
|
},
|
|
{
|
|
"entropy": 5.920040416717529,
|
|
"epoch": 0.04313029037986946,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.000413090187312178,
|
|
"loss": 5.9215,
|
|
"mean_token_accuracy": 0.16948316097259522,
|
|
"num_tokens": 1336279.0,
|
|
"step": 1870
|
|
},
|
|
{
|
|
"entropy": 6.086005544662475,
|
|
"epoch": 0.04324561201190119,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004121581758667898,
|
|
"loss": 6.0365,
|
|
"mean_token_accuracy": 0.15829629004001616,
|
|
"num_tokens": 1339885.0,
|
|
"step": 1875
|
|
},
|
|
{
|
|
"entropy": 5.960381555557251,
|
|
"epoch": 0.04336093364393293,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00041122240416072533,
|
|
"loss": 5.8319,
|
|
"mean_token_accuracy": 0.18557217270135878,
|
|
"num_tokens": 1343302.0,
|
|
"step": 1880
|
|
},
|
|
{
|
|
"entropy": 6.04316668510437,
|
|
"epoch": 0.043476255275964666,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004102828978486385,
|
|
"loss": 6.0363,
|
|
"mean_token_accuracy": 0.1671247199177742,
|
|
"num_tokens": 1346981.0,
|
|
"step": 1885
|
|
},
|
|
{
|
|
"entropy": 5.998887348175049,
|
|
"epoch": 0.0435915769079964,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004093396826875695,
|
|
"loss": 5.8593,
|
|
"mean_token_accuracy": 0.17538370937108994,
|
|
"num_tokens": 1350566.0,
|
|
"step": 1890
|
|
},
|
|
{
|
|
"entropy": 5.967190217971802,
|
|
"epoch": 0.04370689854002814,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00040839278453623837,
|
|
"loss": 5.9101,
|
|
"mean_token_accuracy": 0.17191963642835617,
|
|
"num_tokens": 1353798.0,
|
|
"step": 1895
|
|
},
|
|
{
|
|
"entropy": 6.035793685913086,
|
|
"epoch": 0.043822220172059875,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004074422293543363,
|
|
"loss": 6.0761,
|
|
"mean_token_accuracy": 0.17167042195796967,
|
|
"num_tokens": 1357248.0,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"entropy": 6.194664382934571,
|
|
"epoch": 0.04393754180409161,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004064880432018137,
|
|
"loss": 5.9681,
|
|
"mean_token_accuracy": 0.17110309451818467,
|
|
"num_tokens": 1360949.0,
|
|
"step": 1905
|
|
},
|
|
{
|
|
"entropy": 6.144906425476075,
|
|
"epoch": 0.04405286343612335,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.00040553025223816615,
|
|
"loss": 5.9874,
|
|
"mean_token_accuracy": 0.17255610078573227,
|
|
"num_tokens": 1364769.0,
|
|
"step": 1910
|
|
},
|
|
{
|
|
"entropy": 6.042750453948974,
|
|
"epoch": 0.044168185068155084,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00040456888272171653,
|
|
"loss": 6.2085,
|
|
"mean_token_accuracy": 0.16712530329823494,
|
|
"num_tokens": 1368719.0,
|
|
"step": 1915
|
|
},
|
|
{
|
|
"entropy": 6.225994491577149,
|
|
"epoch": 0.04428350670018682,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00040360396100889577,
|
|
"loss": 5.9441,
|
|
"mean_token_accuracy": 0.17468636780977248,
|
|
"num_tokens": 1372767.0,
|
|
"step": 1920
|
|
},
|
|
{
|
|
"entropy": 6.085239028930664,
|
|
"epoch": 0.04439882833221856,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004026355135535202,
|
|
"loss": 5.914,
|
|
"mean_token_accuracy": 0.15781303942203523,
|
|
"num_tokens": 1376327.0,
|
|
"step": 1925
|
|
},
|
|
{
|
|
"entropy": 5.871431922912597,
|
|
"epoch": 0.044514149964250294,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.000401663566906066,
|
|
"loss": 5.9378,
|
|
"mean_token_accuracy": 0.18061802089214324,
|
|
"num_tokens": 1379956.0,
|
|
"step": 1930
|
|
},
|
|
{
|
|
"entropy": 6.072559881210327,
|
|
"epoch": 0.04462947159628203,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00040068814771294134,
|
|
"loss": 6.0744,
|
|
"mean_token_accuracy": 0.1600572906434536,
|
|
"num_tokens": 1383328.0,
|
|
"step": 1935
|
|
},
|
|
{
|
|
"entropy": 6.146542501449585,
|
|
"epoch": 0.04474479322831377,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0003997092827157562,
|
|
"loss": 5.9009,
|
|
"mean_token_accuracy": 0.16003982871770858,
|
|
"num_tokens": 1386891.0,
|
|
"step": 1940
|
|
},
|
|
{
|
|
"entropy": 6.113406229019165,
|
|
"epoch": 0.0448601148603455,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.000398726998750589,
|
|
"loss": 6.0516,
|
|
"mean_token_accuracy": 0.16761437505483628,
|
|
"num_tokens": 1390278.0,
|
|
"step": 1945
|
|
},
|
|
{
|
|
"entropy": 6.074669027328492,
|
|
"epoch": 0.04497543649237724,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00039774132274725076,
|
|
"loss": 6.0108,
|
|
"mean_token_accuracy": 0.16349065601825713,
|
|
"num_tokens": 1393840.0,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"entropy": 6.203750133514404,
|
|
"epoch": 0.04509075812440898,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00039675228172854707,
|
|
"loss": 5.9007,
|
|
"mean_token_accuracy": 0.16745836585760115,
|
|
"num_tokens": 1396850.0,
|
|
"step": 1955
|
|
},
|
|
{
|
|
"entropy": 6.045851993560791,
|
|
"epoch": 0.04520607975644071,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0003957599028095371,
|
|
"loss": 5.8931,
|
|
"mean_token_accuracy": 0.17089987993240358,
|
|
"num_tokens": 1400340.0,
|
|
"step": 1960
|
|
},
|
|
{
|
|
"entropy": 6.128950214385986,
|
|
"epoch": 0.04532140138847245,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00039476421319679017,
|
|
"loss": 6.0904,
|
|
"mean_token_accuracy": 0.15978260785341264,
|
|
"num_tokens": 1404167.0,
|
|
"step": 1965
|
|
},
|
|
{
|
|
"entropy": 6.085157871246338,
|
|
"epoch": 0.04543672302050419,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00039376524018764,
|
|
"loss": 5.8612,
|
|
"mean_token_accuracy": 0.17234077155590058,
|
|
"num_tokens": 1407858.0,
|
|
"step": 1970
|
|
},
|
|
{
|
|
"entropy": 6.035274887084961,
|
|
"epoch": 0.04555204465253592,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.00039276301116943616,
|
|
"loss": 6.0,
|
|
"mean_token_accuracy": 0.16681650429964065,
|
|
"num_tokens": 1411238.0,
|
|
"step": 1975
|
|
},
|
|
{
|
|
"entropy": 6.05155463218689,
|
|
"epoch": 0.04566736628456766,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0003917575536187936,
|
|
"loss": 5.8926,
|
|
"mean_token_accuracy": 0.17386517375707627,
|
|
"num_tokens": 1414698.0,
|
|
"step": 1980
|
|
},
|
|
{
|
|
"entropy": 6.057000255584716,
|
|
"epoch": 0.045782687916599396,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00039074889510083894,
|
|
"loss": 5.9789,
|
|
"mean_token_accuracy": 0.16450004428625106,
|
|
"num_tokens": 1418126.0,
|
|
"step": 1985
|
|
},
|
|
{
|
|
"entropy": 6.009735202789306,
|
|
"epoch": 0.04589800954863113,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00038973706326845495,
|
|
"loss": 5.9558,
|
|
"mean_token_accuracy": 0.16979953050613403,
|
|
"num_tokens": 1421572.0,
|
|
"step": 1990
|
|
},
|
|
{
|
|
"entropy": 6.145390844345092,
|
|
"epoch": 0.04601333118066287,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0003887220858615225,
|
|
"loss": 5.9862,
|
|
"mean_token_accuracy": 0.1639215901494026,
|
|
"num_tokens": 1424995.0,
|
|
"step": 1995
|
|
},
|
|
{
|
|
"entropy": 6.1229006290435795,
|
|
"epoch": 0.046128652812694605,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0003877039907061597,
|
|
"loss": 6.0202,
|
|
"mean_token_accuracy": 0.16905055791139603,
|
|
"num_tokens": 1428326.0,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"entropy": 6.236930561065674,
|
|
"epoch": 0.04624397444472634,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0003866828057139598,
|
|
"loss": 6.1615,
|
|
"mean_token_accuracy": 0.15661614537239074,
|
|
"num_tokens": 1432206.0,
|
|
"step": 2005
|
|
},
|
|
{
|
|
"entropy": 6.0727519512176515,
|
|
"epoch": 0.04635929607675808,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00038565855888122503,
|
|
"loss": 5.9146,
|
|
"mean_token_accuracy": 0.17826643586158752,
|
|
"num_tokens": 1435764.0,
|
|
"step": 2010
|
|
},
|
|
{
|
|
"entropy": 5.952383375167846,
|
|
"epoch": 0.046474617708789814,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00038463127828819975,
|
|
"loss": 5.9709,
|
|
"mean_token_accuracy": 0.17173793017864228,
|
|
"num_tokens": 1439048.0,
|
|
"step": 2015
|
|
},
|
|
{
|
|
"entropy": 6.11073317527771,
|
|
"epoch": 0.04658993934082155,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.00038360099209830043,
|
|
"loss": 6.0497,
|
|
"mean_token_accuracy": 0.16235739290714263,
|
|
"num_tokens": 1442660.0,
|
|
"step": 2020
|
|
},
|
|
{
|
|
"entropy": 6.364213371276856,
|
|
"epoch": 0.04670526097285329,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0003825677285573433,
|
|
"loss": 6.047,
|
|
"mean_token_accuracy": 0.15798935294151306,
|
|
"num_tokens": 1446625.0,
|
|
"step": 2025
|
|
},
|
|
{
|
|
"entropy": 6.2205322742462155,
|
|
"epoch": 0.046820582604885023,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00038153151599277027,
|
|
"loss": 6.0725,
|
|
"mean_token_accuracy": 0.16297839134931563,
|
|
"num_tokens": 1450887.0,
|
|
"step": 2030
|
|
},
|
|
{
|
|
"entropy": 6.067619657516479,
|
|
"epoch": 0.04693590423691676,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0003804923828128723,
|
|
"loss": 5.9589,
|
|
"mean_token_accuracy": 0.15966229513287544,
|
|
"num_tokens": 1454301.0,
|
|
"step": 2035
|
|
},
|
|
{
|
|
"entropy": 6.015921974182129,
|
|
"epoch": 0.0470512258689485,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0003794503575060104,
|
|
"loss": 5.9391,
|
|
"mean_token_accuracy": 0.1790228709578514,
|
|
"num_tokens": 1457763.0,
|
|
"step": 2040
|
|
},
|
|
{
|
|
"entropy": 6.139227962493896,
|
|
"epoch": 0.04716654750098023,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00037840546863983484,
|
|
"loss": 6.0676,
|
|
"mean_token_accuracy": 0.16168534755706787,
|
|
"num_tokens": 1461731.0,
|
|
"step": 2045
|
|
},
|
|
{
|
|
"entropy": 6.214613533020019,
|
|
"epoch": 0.047281869133011974,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0003773577448605015,
|
|
"loss": 5.9339,
|
|
"mean_token_accuracy": 0.16974954903125763,
|
|
"num_tokens": 1465231.0,
|
|
"step": 2050
|
|
},
|
|
{
|
|
"entropy": 6.098228883743286,
|
|
"epoch": 0.04739719076504371,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0003763072148918872,
|
|
"loss": 5.9126,
|
|
"mean_token_accuracy": 0.17898860722780227,
|
|
"num_tokens": 1468847.0,
|
|
"step": 2055
|
|
},
|
|
{
|
|
"entropy": 6.021309328079224,
|
|
"epoch": 0.04751251239707544,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0003752539075348017,
|
|
"loss": 6.0203,
|
|
"mean_token_accuracy": 0.16555785089731218,
|
|
"num_tokens": 1472830.0,
|
|
"step": 2060
|
|
},
|
|
{
|
|
"entropy": 6.07875280380249,
|
|
"epoch": 0.04762783402910718,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00037419785166619817,
|
|
"loss": 6.0217,
|
|
"mean_token_accuracy": 0.15808642283082008,
|
|
"num_tokens": 1476242.0,
|
|
"step": 2065
|
|
},
|
|
{
|
|
"entropy": 6.041919994354248,
|
|
"epoch": 0.04774315566113892,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0003731390762383818,
|
|
"loss": 5.9391,
|
|
"mean_token_accuracy": 0.16811346262693405,
|
|
"num_tokens": 1480003.0,
|
|
"step": 2070
|
|
},
|
|
{
|
|
"entropy": 6.065379619598389,
|
|
"epoch": 0.04785847729317065,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0003720776102782158,
|
|
"loss": 5.9406,
|
|
"mean_token_accuracy": 0.16069750785827636,
|
|
"num_tokens": 1483418.0,
|
|
"step": 2075
|
|
},
|
|
{
|
|
"entropy": 5.945605278015137,
|
|
"epoch": 0.04797379892520239,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00037101348288632555,
|
|
"loss": 5.9164,
|
|
"mean_token_accuracy": 0.16400371938943864,
|
|
"num_tokens": 1487169.0,
|
|
"step": 2080
|
|
},
|
|
{
|
|
"entropy": 5.955249404907226,
|
|
"epoch": 0.048089120557234126,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0003699467232363012,
|
|
"loss": 5.8412,
|
|
"mean_token_accuracy": 0.1820058837532997,
|
|
"num_tokens": 1490506.0,
|
|
"step": 2085
|
|
},
|
|
{
|
|
"entropy": 5.966968297958374,
|
|
"epoch": 0.04820444218926586,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0003688773605738973,
|
|
"loss": 5.8842,
|
|
"mean_token_accuracy": 0.17049288526177406,
|
|
"num_tokens": 1494110.0,
|
|
"step": 2090
|
|
},
|
|
{
|
|
"entropy": 6.009013938903808,
|
|
"epoch": 0.0483197638212976,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00036780542421623134,
|
|
"loss": 5.9609,
|
|
"mean_token_accuracy": 0.16247643604874612,
|
|
"num_tokens": 1497594.0,
|
|
"step": 2095
|
|
},
|
|
{
|
|
"entropy": 5.94654278755188,
|
|
"epoch": 0.048435085453329335,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0003667309435509802,
|
|
"loss": 5.7844,
|
|
"mean_token_accuracy": 0.1888134077191353,
|
|
"num_tokens": 1500838.0,
|
|
"step": 2100
|
|
},
|
|
{
|
|
"entropy": 5.914694166183471,
|
|
"epoch": 0.04855040708536107,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0003656539480355741,
|
|
"loss": 6.0189,
|
|
"mean_token_accuracy": 0.16929620802402495,
|
|
"num_tokens": 1504338.0,
|
|
"step": 2105
|
|
},
|
|
{
|
|
"entropy": 6.058946943283081,
|
|
"epoch": 0.04866572871739281,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0003645744671963891,
|
|
"loss": 6.0116,
|
|
"mean_token_accuracy": 0.17386874854564666,
|
|
"num_tokens": 1508085.0,
|
|
"step": 2110
|
|
},
|
|
{
|
|
"entropy": 6.115987825393677,
|
|
"epoch": 0.048781050349424544,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0003634925306279376,
|
|
"loss": 6.0028,
|
|
"mean_token_accuracy": 0.16438793689012526,
|
|
"num_tokens": 1511846.0,
|
|
"step": 2115
|
|
},
|
|
{
|
|
"entropy": 6.000114917755127,
|
|
"epoch": 0.04889637198145628,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0003624081679920574,
|
|
"loss": 5.8214,
|
|
"mean_token_accuracy": 0.1761823520064354,
|
|
"num_tokens": 1515277.0,
|
|
"step": 2120
|
|
},
|
|
{
|
|
"entropy": 5.977673053741455,
|
|
"epoch": 0.04901169361348802,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0003613214090170977,
|
|
"loss": 5.7725,
|
|
"mean_token_accuracy": 0.1801084578037262,
|
|
"num_tokens": 1518872.0,
|
|
"step": 2125
|
|
},
|
|
{
|
|
"entropy": 5.881729221343994,
|
|
"epoch": 0.04912701524551975,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0003602322834971048,
|
|
"loss": 5.8849,
|
|
"mean_token_accuracy": 0.17433423697948455,
|
|
"num_tokens": 1522613.0,
|
|
"step": 2130
|
|
},
|
|
{
|
|
"entropy": 5.9374007225036625,
|
|
"epoch": 0.049242336877551494,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0003591408212910051,
|
|
"loss": 6.042,
|
|
"mean_token_accuracy": 0.16684025377035142,
|
|
"num_tokens": 1526629.0,
|
|
"step": 2135
|
|
},
|
|
{
|
|
"entropy": 6.113653039932251,
|
|
"epoch": 0.04935765850958323,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0003580470523217863,
|
|
"loss": 5.8506,
|
|
"mean_token_accuracy": 0.17982762604951857,
|
|
"num_tokens": 1530185.0,
|
|
"step": 2140
|
|
},
|
|
{
|
|
"entropy": 6.001288795471192,
|
|
"epoch": 0.04947298014161496,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0003569510065756771,
|
|
"loss": 6.055,
|
|
"mean_token_accuracy": 0.16616662591695786,
|
|
"num_tokens": 1533608.0,
|
|
"step": 2145
|
|
},
|
|
{
|
|
"entropy": 5.973288202285767,
|
|
"epoch": 0.049588301773646704,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.0003558527141013254,
|
|
"loss": 5.9956,
|
|
"mean_token_accuracy": 0.171682408452034,
|
|
"num_tokens": 1536852.0,
|
|
"step": 2150
|
|
},
|
|
{
|
|
"entropy": 6.0692524909973145,
|
|
"epoch": 0.04970362340567844,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0003547522050089742,
|
|
"loss": 5.8491,
|
|
"mean_token_accuracy": 0.1771762453019619,
|
|
"num_tokens": 1540236.0,
|
|
"step": 2155
|
|
},
|
|
{
|
|
"entropy": 6.147887372970581,
|
|
"epoch": 0.04981894503771017,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00035364950946963606,
|
|
"loss": 5.9819,
|
|
"mean_token_accuracy": 0.16693336963653566,
|
|
"num_tokens": 1543711.0,
|
|
"step": 2160
|
|
},
|
|
{
|
|
"entropy": 6.083334589004517,
|
|
"epoch": 0.04993426666974191,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0003525446577142663,
|
|
"loss": 5.9676,
|
|
"mean_token_accuracy": 0.16684302687644958,
|
|
"num_tokens": 1547011.0,
|
|
"step": 2165
|
|
},
|
|
{
|
|
"entropy": 6.1137855529785154,
|
|
"epoch": 0.05004958830177365,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00035143768003293395,
|
|
"loss": 6.013,
|
|
"mean_token_accuracy": 0.16679638773202896,
|
|
"num_tokens": 1550733.0,
|
|
"step": 2170
|
|
},
|
|
{
|
|
"entropy": 6.084979581832886,
|
|
"epoch": 0.05016490993380538,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0003503286067739913,
|
|
"loss": 6.0092,
|
|
"mean_token_accuracy": 0.17218167185783387,
|
|
"num_tokens": 1554337.0,
|
|
"step": 2175
|
|
},
|
|
{
|
|
"entropy": 5.925091505050659,
|
|
"epoch": 0.05028023156583712,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00034921746834324193,
|
|
"loss": 5.82,
|
|
"mean_token_accuracy": 0.17224141359329223,
|
|
"num_tokens": 1557613.0,
|
|
"step": 2180
|
|
},
|
|
{
|
|
"entropy": 5.929932689666748,
|
|
"epoch": 0.050395553197868856,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0003481042952031072,
|
|
"loss": 5.9713,
|
|
"mean_token_accuracy": 0.17252454310655593,
|
|
"num_tokens": 1561384.0,
|
|
"step": 2185
|
|
},
|
|
{
|
|
"entropy": 6.017917442321777,
|
|
"epoch": 0.05051087482990059,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0003469891178717911,
|
|
"loss": 5.853,
|
|
"mean_token_accuracy": 0.17023051977157594,
|
|
"num_tokens": 1564714.0,
|
|
"step": 2190
|
|
},
|
|
{
|
|
"entropy": 5.832478809356689,
|
|
"epoch": 0.05062619646193233,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0003458719669224436,
|
|
"loss": 5.753,
|
|
"mean_token_accuracy": 0.1918713331222534,
|
|
"num_tokens": 1568058.0,
|
|
"step": 2195
|
|
},
|
|
{
|
|
"entropy": 5.825899982452393,
|
|
"epoch": 0.050741518093964065,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0003447528729823221,
|
|
"loss": 5.8239,
|
|
"mean_token_accuracy": 0.17855536490678786,
|
|
"num_tokens": 1571601.0,
|
|
"step": 2200
|
|
},
|
|
{
|
|
"entropy": 5.984312915802002,
|
|
"epoch": 0.0508568397259958,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0003436318667319525,
|
|
"loss": 5.8299,
|
|
"mean_token_accuracy": 0.17291364669799805,
|
|
"num_tokens": 1575330.0,
|
|
"step": 2205
|
|
},
|
|
{
|
|
"entropy": 5.860138988494873,
|
|
"epoch": 0.05097216135802754,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00034250897890428716,
|
|
"loss": 5.7909,
|
|
"mean_token_accuracy": 0.17980906069278718,
|
|
"num_tokens": 1578799.0,
|
|
"step": 2210
|
|
},
|
|
{
|
|
"entropy": 5.926511240005493,
|
|
"epoch": 0.051087482990059274,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0003413842402838633,
|
|
"loss": 5.8022,
|
|
"mean_token_accuracy": 0.1776898205280304,
|
|
"num_tokens": 1582213.0,
|
|
"step": 2215
|
|
},
|
|
{
|
|
"entropy": 6.108406400680542,
|
|
"epoch": 0.051202804622091015,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00034025768170595834,
|
|
"loss": 6.0471,
|
|
"mean_token_accuracy": 0.15622774809598922,
|
|
"num_tokens": 1586199.0,
|
|
"step": 2220
|
|
},
|
|
{
|
|
"entropy": 6.051778173446655,
|
|
"epoch": 0.05131812625412275,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0003391293340557446,
|
|
"loss": 5.9098,
|
|
"mean_token_accuracy": 0.168331515789032,
|
|
"num_tokens": 1589869.0,
|
|
"step": 2225
|
|
},
|
|
{
|
|
"entropy": 5.972296619415284,
|
|
"epoch": 0.05143344788615448,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0003379992282674431,
|
|
"loss": 5.8421,
|
|
"mean_token_accuracy": 0.16960253119468688,
|
|
"num_tokens": 1593340.0,
|
|
"step": 2230
|
|
},
|
|
{
|
|
"entropy": 6.1102211475372314,
|
|
"epoch": 0.051548769518186224,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0003368673953234749,
|
|
"loss": 6.0165,
|
|
"mean_token_accuracy": 0.15275024324655534,
|
|
"num_tokens": 1597465.0,
|
|
"step": 2235
|
|
},
|
|
{
|
|
"entropy": 5.97629976272583,
|
|
"epoch": 0.05166409115021796,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.00033573386625361176,
|
|
"loss": 5.8649,
|
|
"mean_token_accuracy": 0.16652099490165712,
|
|
"num_tokens": 1601057.0,
|
|
"step": 2240
|
|
},
|
|
{
|
|
"entropy": 5.825031757354736,
|
|
"epoch": 0.05177941278224969,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00033459867213412567,
|
|
"loss": 5.827,
|
|
"mean_token_accuracy": 0.1894167572259903,
|
|
"num_tokens": 1604570.0,
|
|
"step": 2245
|
|
},
|
|
{
|
|
"entropy": 6.007895374298096,
|
|
"epoch": 0.05189473441428143,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.000333461844086937,
|
|
"loss": 6.0169,
|
|
"mean_token_accuracy": 0.17256359457969667,
|
|
"num_tokens": 1608163.0,
|
|
"step": 2250
|
|
},
|
|
{
|
|
"entropy": 5.969921875,
|
|
"epoch": 0.05201005604631317,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00033232341327876097,
|
|
"loss": 5.6233,
|
|
"mean_token_accuracy": 0.1894993156194687,
|
|
"num_tokens": 1611208.0,
|
|
"step": 2255
|
|
},
|
|
{
|
|
"entropy": 5.962341260910034,
|
|
"epoch": 0.0521253776783449,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0003311834109202531,
|
|
"loss": 5.9119,
|
|
"mean_token_accuracy": 0.17642295062541963,
|
|
"num_tokens": 1614752.0,
|
|
"step": 2260
|
|
},
|
|
{
|
|
"entropy": 5.906010150909424,
|
|
"epoch": 0.05224069931037664,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.00033004186826515416,
|
|
"loss": 5.8531,
|
|
"mean_token_accuracy": 0.1669125124812126,
|
|
"num_tokens": 1618157.0,
|
|
"step": 2265
|
|
},
|
|
{
|
|
"entropy": 6.021723937988281,
|
|
"epoch": 0.05235602094240838,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0003288988166094324,
|
|
"loss": 5.8282,
|
|
"mean_token_accuracy": 0.18255583345890045,
|
|
"num_tokens": 1621489.0,
|
|
"step": 2270
|
|
},
|
|
{
|
|
"entropy": 6.020850753784179,
|
|
"epoch": 0.05247134257444011,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00032775428729042656,
|
|
"loss": 5.9097,
|
|
"mean_token_accuracy": 0.1747518941760063,
|
|
"num_tokens": 1624658.0,
|
|
"step": 2275
|
|
},
|
|
{
|
|
"entropy": 6.0344264030456545,
|
|
"epoch": 0.05258666420647185,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.000326608311685986,
|
|
"loss": 6.0199,
|
|
"mean_token_accuracy": 0.1666715383529663,
|
|
"num_tokens": 1628607.0,
|
|
"step": 2280
|
|
},
|
|
{
|
|
"entropy": 5.989352369308472,
|
|
"epoch": 0.052701985838503586,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0003254609212136108,
|
|
"loss": 5.8121,
|
|
"mean_token_accuracy": 0.18332432955503464,
|
|
"num_tokens": 1631932.0,
|
|
"step": 2285
|
|
},
|
|
{
|
|
"entropy": 6.0163475513458256,
|
|
"epoch": 0.05281730747053532,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00032431214732959036,
|
|
"loss": 5.933,
|
|
"mean_token_accuracy": 0.16141737550497054,
|
|
"num_tokens": 1635997.0,
|
|
"step": 2290
|
|
},
|
|
{
|
|
"entropy": 6.215541744232178,
|
|
"epoch": 0.05293262910256706,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.000323162021528141,
|
|
"loss": 6.0482,
|
|
"mean_token_accuracy": 0.170789997279644,
|
|
"num_tokens": 1639791.0,
|
|
"step": 2295
|
|
},
|
|
{
|
|
"entropy": 5.967877388000488,
|
|
"epoch": 0.053047950734598795,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00032201057534054264,
|
|
"loss": 5.8909,
|
|
"mean_token_accuracy": 0.18046397417783738,
|
|
"num_tokens": 1643330.0,
|
|
"step": 2300
|
|
},
|
|
{
|
|
"entropy": 5.922166919708252,
|
|
"epoch": 0.053163272366630536,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00032085784033427414,
|
|
"loss": 5.8549,
|
|
"mean_token_accuracy": 0.18044275790452957,
|
|
"num_tokens": 1647032.0,
|
|
"step": 2305
|
|
},
|
|
{
|
|
"entropy": 5.904247760772705,
|
|
"epoch": 0.05327859399866227,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0003197038481121478,
|
|
"loss": 5.9249,
|
|
"mean_token_accuracy": 0.16608510613441468,
|
|
"num_tokens": 1650433.0,
|
|
"step": 2310
|
|
},
|
|
{
|
|
"entropy": 5.849363517761231,
|
|
"epoch": 0.053393915630694004,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0003185486303114436,
|
|
"loss": 5.7361,
|
|
"mean_token_accuracy": 0.19181705117225648,
|
|
"num_tokens": 1653885.0,
|
|
"step": 2315
|
|
},
|
|
{
|
|
"entropy": 5.972066164016724,
|
|
"epoch": 0.053509237262725745,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0003173922186030409,
|
|
"loss": 5.9231,
|
|
"mean_token_accuracy": 0.17057469636201858,
|
|
"num_tokens": 1657762.0,
|
|
"step": 2320
|
|
},
|
|
{
|
|
"entropy": 6.076327896118164,
|
|
"epoch": 0.05362455889475748,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000316234644690551,
|
|
"loss": 6.036,
|
|
"mean_token_accuracy": 0.1628196932375431,
|
|
"num_tokens": 1661520.0,
|
|
"step": 2325
|
|
},
|
|
{
|
|
"entropy": 6.134958648681641,
|
|
"epoch": 0.05373988052678921,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0003150759403094473,
|
|
"loss": 5.9004,
|
|
"mean_token_accuracy": 0.1698158487677574,
|
|
"num_tokens": 1665308.0,
|
|
"step": 2330
|
|
},
|
|
{
|
|
"entropy": 5.875095081329346,
|
|
"epoch": 0.053855202158820954,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00031391613722619587,
|
|
"loss": 5.8404,
|
|
"mean_token_accuracy": 0.17533595412969588,
|
|
"num_tokens": 1668657.0,
|
|
"step": 2335
|
|
},
|
|
{
|
|
"entropy": 5.911960506439209,
|
|
"epoch": 0.05397052379085269,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.000312755267237384,
|
|
"loss": 5.8772,
|
|
"mean_token_accuracy": 0.17444742619991302,
|
|
"num_tokens": 1672194.0,
|
|
"step": 2340
|
|
},
|
|
{
|
|
"entropy": 5.93304853439331,
|
|
"epoch": 0.05408584542288442,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0003115933621688488,
|
|
"loss": 5.8287,
|
|
"mean_token_accuracy": 0.17251134365797044,
|
|
"num_tokens": 1675515.0,
|
|
"step": 2345
|
|
},
|
|
{
|
|
"entropy": 6.095355892181397,
|
|
"epoch": 0.05420116705491616,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00031043045387480487,
|
|
"loss": 5.915,
|
|
"mean_token_accuracy": 0.16847942024469376,
|
|
"num_tokens": 1679170.0,
|
|
"step": 2350
|
|
},
|
|
{
|
|
"entropy": 5.956024789810181,
|
|
"epoch": 0.0543164886869479,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0003092665742369703,
|
|
"loss": 5.8882,
|
|
"mean_token_accuracy": 0.1752202644944191,
|
|
"num_tokens": 1682628.0,
|
|
"step": 2355
|
|
},
|
|
{
|
|
"entropy": 5.803276300430298,
|
|
"epoch": 0.05443181031897963,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00030810175516369343,
|
|
"loss": 5.8464,
|
|
"mean_token_accuracy": 0.18446773141622544,
|
|
"num_tokens": 1685996.0,
|
|
"step": 2360
|
|
},
|
|
{
|
|
"entropy": 5.894187259674072,
|
|
"epoch": 0.05454713195101137,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0003069360285890775,
|
|
"loss": 5.7054,
|
|
"mean_token_accuracy": 0.188694728910923,
|
|
"num_tokens": 1689571.0,
|
|
"step": 2365
|
|
},
|
|
{
|
|
"entropy": 5.941043281555176,
|
|
"epoch": 0.05466245358304311,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00030576942647210547,
|
|
"loss": 5.7748,
|
|
"mean_token_accuracy": 0.18053148537874222,
|
|
"num_tokens": 1693281.0,
|
|
"step": 2370
|
|
},
|
|
{
|
|
"entropy": 5.812848663330078,
|
|
"epoch": 0.05477777521507484,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00030460198079576355,
|
|
"loss": 5.7728,
|
|
"mean_token_accuracy": 0.18808334469795226,
|
|
"num_tokens": 1696679.0,
|
|
"step": 2375
|
|
},
|
|
{
|
|
"entropy": 6.0858453750610355,
|
|
"epoch": 0.05489309684710658,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0003034337235661648,
|
|
"loss": 6.0305,
|
|
"mean_token_accuracy": 0.16516501009464263,
|
|
"num_tokens": 1700154.0,
|
|
"step": 2380
|
|
},
|
|
{
|
|
"entropy": 6.077689933776855,
|
|
"epoch": 0.055008418479138316,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0003022646868116714,
|
|
"loss": 5.9408,
|
|
"mean_token_accuracy": 0.1638843946158886,
|
|
"num_tokens": 1703695.0,
|
|
"step": 2385
|
|
},
|
|
{
|
|
"entropy": 5.957744503021241,
|
|
"epoch": 0.05512374011117006,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0003010949025820163,
|
|
"loss": 5.8457,
|
|
"mean_token_accuracy": 0.17660858631134033,
|
|
"num_tokens": 1707667.0,
|
|
"step": 2390
|
|
},
|
|
{
|
|
"entropy": 5.903037691116333,
|
|
"epoch": 0.05523906174320179,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.0002999244029474252,
|
|
"loss": 5.8012,
|
|
"mean_token_accuracy": 0.16960801780223847,
|
|
"num_tokens": 1710985.0,
|
|
"step": 2395
|
|
},
|
|
{
|
|
"entropy": 6.009402084350586,
|
|
"epoch": 0.055354383375233525,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00029875321999773684,
|
|
"loss": 5.9604,
|
|
"mean_token_accuracy": 0.1663561351597309,
|
|
"num_tokens": 1714956.0,
|
|
"step": 2400
|
|
},
|
|
{
|
|
"entropy": 5.893221187591553,
|
|
"epoch": 0.055469705007265266,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00029758138584152333,
|
|
"loss": 5.7352,
|
|
"mean_token_accuracy": 0.1840540885925293,
|
|
"num_tokens": 1718235.0,
|
|
"step": 2405
|
|
},
|
|
{
|
|
"entropy": 5.852742624282837,
|
|
"epoch": 0.055585026639297,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.0002964089326052102,
|
|
"loss": 5.8755,
|
|
"mean_token_accuracy": 0.18149819374084472,
|
|
"num_tokens": 1721846.0,
|
|
"step": 2410
|
|
},
|
|
{
|
|
"entropy": 5.930685949325562,
|
|
"epoch": 0.055700348271328734,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0002952358924321949,
|
|
"loss": 5.8245,
|
|
"mean_token_accuracy": 0.17042715474963188,
|
|
"num_tokens": 1725206.0,
|
|
"step": 2415
|
|
},
|
|
{
|
|
"entropy": 5.949104452133179,
|
|
"epoch": 0.055815669903360475,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00029406229748196657,
|
|
"loss": 5.8433,
|
|
"mean_token_accuracy": 0.1739942029118538,
|
|
"num_tokens": 1728756.0,
|
|
"step": 2420
|
|
},
|
|
{
|
|
"entropy": 6.095400094985962,
|
|
"epoch": 0.05593099153539221,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0002928881799292235,
|
|
"loss": 5.9561,
|
|
"mean_token_accuracy": 0.1710992656648159,
|
|
"num_tokens": 1732751.0,
|
|
"step": 2425
|
|
},
|
|
{
|
|
"entropy": 6.027282619476319,
|
|
"epoch": 0.05604631316742394,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00029171357196299154,
|
|
"loss": 5.6891,
|
|
"mean_token_accuracy": 0.18352338075637817,
|
|
"num_tokens": 1736063.0,
|
|
"step": 2430
|
|
},
|
|
{
|
|
"entropy": 5.787494373321533,
|
|
"epoch": 0.056161634799455684,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0002905385057857414,
|
|
"loss": 5.7392,
|
|
"mean_token_accuracy": 0.1811654433608055,
|
|
"num_tokens": 1739401.0,
|
|
"step": 2435
|
|
},
|
|
{
|
|
"entropy": 5.810848569869995,
|
|
"epoch": 0.05627695643148742,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0002893630136125058,
|
|
"loss": 5.7818,
|
|
"mean_token_accuracy": 0.1795400395989418,
|
|
"num_tokens": 1742812.0,
|
|
"step": 2440
|
|
},
|
|
{
|
|
"entropy": 5.931622838973999,
|
|
"epoch": 0.05639227806351915,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0002881871276699967,
|
|
"loss": 5.9531,
|
|
"mean_token_accuracy": 0.17347469925880432,
|
|
"num_tokens": 1746490.0,
|
|
"step": 2445
|
|
},
|
|
{
|
|
"entropy": 6.101017618179322,
|
|
"epoch": 0.05650759969555089,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00028701088019572114,
|
|
"loss": 5.9145,
|
|
"mean_token_accuracy": 0.17603710740804673,
|
|
"num_tokens": 1750340.0,
|
|
"step": 2450
|
|
},
|
|
{
|
|
"entropy": 6.07333345413208,
|
|
"epoch": 0.05662292132758263,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0002858343034370977,
|
|
"loss": 5.9823,
|
|
"mean_token_accuracy": 0.16588258743286133,
|
|
"num_tokens": 1754179.0,
|
|
"step": 2455
|
|
},
|
|
{
|
|
"entropy": 5.986343765258789,
|
|
"epoch": 0.05673824295961436,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.00028465742965057267,
|
|
"loss": 5.96,
|
|
"mean_token_accuracy": 0.16463472843170165,
|
|
"num_tokens": 1757715.0,
|
|
"step": 2460
|
|
},
|
|
{
|
|
"entropy": 5.910198974609375,
|
|
"epoch": 0.0568535645916461,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00028348029110073533,
|
|
"loss": 5.6724,
|
|
"mean_token_accuracy": 0.17794369012117386,
|
|
"num_tokens": 1761383.0,
|
|
"step": 2465
|
|
},
|
|
{
|
|
"entropy": 5.9212188720703125,
|
|
"epoch": 0.056968886223677837,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.00028230292005943365,
|
|
"loss": 5.9326,
|
|
"mean_token_accuracy": 0.17225535660982133,
|
|
"num_tokens": 1764927.0,
|
|
"step": 2470
|
|
},
|
|
{
|
|
"entropy": 5.827425384521485,
|
|
"epoch": 0.05708420785570957,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.00028112534880488945,
|
|
"loss": 5.7169,
|
|
"mean_token_accuracy": 0.2026936560869217,
|
|
"num_tokens": 1768707.0,
|
|
"step": 2475
|
|
},
|
|
{
|
|
"entropy": 5.885653352737426,
|
|
"epoch": 0.05719952948774131,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0002799476096208137,
|
|
"loss": 5.7824,
|
|
"mean_token_accuracy": 0.18457434922456742,
|
|
"num_tokens": 1772703.0,
|
|
"step": 2480
|
|
},
|
|
{
|
|
"entropy": 6.064858913421631,
|
|
"epoch": 0.057314851119773046,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.00027876973479552087,
|
|
"loss": 5.9318,
|
|
"mean_token_accuracy": 0.16946352124214173,
|
|
"num_tokens": 1776319.0,
|
|
"step": 2485
|
|
},
|
|
{
|
|
"entropy": 5.995760250091553,
|
|
"epoch": 0.05743017275180479,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00027759175662104424,
|
|
"loss": 5.8421,
|
|
"mean_token_accuracy": 0.17095668762922286,
|
|
"num_tokens": 1779728.0,
|
|
"step": 2490
|
|
},
|
|
{
|
|
"entropy": 5.950234889984131,
|
|
"epoch": 0.05754549438383652,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0002764137073922508,
|
|
"loss": 5.8148,
|
|
"mean_token_accuracy": 0.17959561944007874,
|
|
"num_tokens": 1783330.0,
|
|
"step": 2495
|
|
},
|
|
{
|
|
"entropy": 5.833258533477784,
|
|
"epoch": 0.057660816015868255,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00027523561940595505,
|
|
"loss": 5.7592,
|
|
"mean_token_accuracy": 0.18121390789747238,
|
|
"num_tokens": 1786797.0,
|
|
"step": 2500
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 4000,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 1,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 2730052638720000.0,
|
|
"train_batch_size": 16,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|