2035 lines
54 KiB
JSON
2035 lines
54 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 0.023064326406347303,
|
|
"eval_steps": 500,
|
|
"global_step": 1000,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 10.691907501220703,
|
|
"epoch": 0.0001153216320317365,
|
|
"grad_norm": 17.375,
|
|
"learning_rate": 2e-06,
|
|
"loss": 10.5245,
|
|
"mean_token_accuracy": 0.0,
|
|
"num_tokens": 3965.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 10.691843128204345,
|
|
"epoch": 0.000230643264063473,
|
|
"grad_norm": 18.5,
|
|
"learning_rate": 4.5e-06,
|
|
"loss": 10.3993,
|
|
"mean_token_accuracy": 0.0003649635007604957,
|
|
"num_tokens": 7510.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 10.69088363647461,
|
|
"epoch": 0.0003459648960952095,
|
|
"grad_norm": 13.125,
|
|
"learning_rate": 7e-06,
|
|
"loss": 10.1564,
|
|
"mean_token_accuracy": 0.03439897168427706,
|
|
"num_tokens": 11084.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 10.681573295593262,
|
|
"epoch": 0.000461286528126946,
|
|
"grad_norm": 9.0625,
|
|
"learning_rate": 9.5e-06,
|
|
"loss": 9.7517,
|
|
"mean_token_accuracy": 0.06451544389128686,
|
|
"num_tokens": 14319.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 10.623183345794677,
|
|
"epoch": 0.0005766081601586826,
|
|
"grad_norm": 5.8125,
|
|
"learning_rate": 1.2e-05,
|
|
"loss": 9.4401,
|
|
"mean_token_accuracy": 0.06273870654404164,
|
|
"num_tokens": 17670.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 10.555589962005616,
|
|
"epoch": 0.000691929792190419,
|
|
"grad_norm": 4.9375,
|
|
"learning_rate": 1.4500000000000002e-05,
|
|
"loss": 9.2749,
|
|
"mean_token_accuracy": 0.05860213525593281,
|
|
"num_tokens": 21177.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 10.556735229492187,
|
|
"epoch": 0.0008072514242221556,
|
|
"grad_norm": 4.25,
|
|
"learning_rate": 1.7000000000000003e-05,
|
|
"loss": 9.1316,
|
|
"mean_token_accuracy": 0.06961804144084453,
|
|
"num_tokens": 24417.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 10.520895004272461,
|
|
"epoch": 0.000922573056253892,
|
|
"grad_norm": 4.09375,
|
|
"learning_rate": 1.95e-05,
|
|
"loss": 9.1409,
|
|
"mean_token_accuracy": 0.067233781889081,
|
|
"num_tokens": 27824.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 10.48238296508789,
|
|
"epoch": 0.0010378946882856287,
|
|
"grad_norm": 3.828125,
|
|
"learning_rate": 2.2e-05,
|
|
"loss": 9.1384,
|
|
"mean_token_accuracy": 0.06338647790253163,
|
|
"num_tokens": 31712.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 10.46641788482666,
|
|
"epoch": 0.0011532163203173652,
|
|
"grad_norm": 3.640625,
|
|
"learning_rate": 2.4500000000000003e-05,
|
|
"loss": 9.0513,
|
|
"mean_token_accuracy": 0.07285529412329197,
|
|
"num_tokens": 35207.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 10.364572525024414,
|
|
"epoch": 0.0012685379523491016,
|
|
"grad_norm": 3.28125,
|
|
"learning_rate": 2.7e-05,
|
|
"loss": 9.0362,
|
|
"mean_token_accuracy": 0.06746394783258439,
|
|
"num_tokens": 39066.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 10.27311315536499,
|
|
"epoch": 0.001383859584380838,
|
|
"grad_norm": 3.5,
|
|
"learning_rate": 2.95e-05,
|
|
"loss": 8.8148,
|
|
"mean_token_accuracy": 0.07908576317131519,
|
|
"num_tokens": 42389.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 10.151123905181885,
|
|
"epoch": 0.0014991812164125747,
|
|
"grad_norm": 2.953125,
|
|
"learning_rate": 3.2e-05,
|
|
"loss": 8.8459,
|
|
"mean_token_accuracy": 0.07942395582795143,
|
|
"num_tokens": 45778.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 10.179048538208008,
|
|
"epoch": 0.0016145028484443112,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 3.4500000000000005e-05,
|
|
"loss": 8.6928,
|
|
"mean_token_accuracy": 0.07802934609353543,
|
|
"num_tokens": 48918.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 10.147464656829834,
|
|
"epoch": 0.0017298244804760477,
|
|
"grad_norm": 4.0625,
|
|
"learning_rate": 3.7e-05,
|
|
"loss": 8.6836,
|
|
"mean_token_accuracy": 0.07859932407736778,
|
|
"num_tokens": 52456.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 10.119709587097168,
|
|
"epoch": 0.001845146112507784,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 3.95e-05,
|
|
"loss": 8.6315,
|
|
"mean_token_accuracy": 0.07672536484897137,
|
|
"num_tokens": 56193.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 10.134781169891358,
|
|
"epoch": 0.0019604677445395208,
|
|
"grad_norm": 3.5,
|
|
"learning_rate": 4.2000000000000004e-05,
|
|
"loss": 8.5835,
|
|
"mean_token_accuracy": 0.07438027523458005,
|
|
"num_tokens": 59977.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 10.018630409240723,
|
|
"epoch": 0.0020757893765712574,
|
|
"grad_norm": 2.625,
|
|
"learning_rate": 4.45e-05,
|
|
"loss": 8.5291,
|
|
"mean_token_accuracy": 0.0768112525343895,
|
|
"num_tokens": 63844.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 9.969991493225098,
|
|
"epoch": 0.0021911110086029937,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 4.7000000000000004e-05,
|
|
"loss": 8.4302,
|
|
"mean_token_accuracy": 0.07833829969167709,
|
|
"num_tokens": 67356.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 9.947973537445069,
|
|
"epoch": 0.0023064326406347303,
|
|
"grad_norm": 2.328125,
|
|
"learning_rate": 4.9500000000000004e-05,
|
|
"loss": 8.2975,
|
|
"mean_token_accuracy": 0.08131772689521313,
|
|
"num_tokens": 70767.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 9.674797916412354,
|
|
"epoch": 0.0024217542726664666,
|
|
"grad_norm": 2.03125,
|
|
"learning_rate": 5.2e-05,
|
|
"loss": 8.2983,
|
|
"mean_token_accuracy": 0.08184195645153522,
|
|
"num_tokens": 74437.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 9.848657512664795,
|
|
"epoch": 0.0025370759046982033,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 5.45e-05,
|
|
"loss": 8.2258,
|
|
"mean_token_accuracy": 0.07810623683035374,
|
|
"num_tokens": 77940.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 9.696725845336914,
|
|
"epoch": 0.00265239753672994,
|
|
"grad_norm": 2.09375,
|
|
"learning_rate": 5.7e-05,
|
|
"loss": 8.1357,
|
|
"mean_token_accuracy": 0.07201453074812889,
|
|
"num_tokens": 81669.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 9.512047672271729,
|
|
"epoch": 0.002767719168761676,
|
|
"grad_norm": 1.765625,
|
|
"learning_rate": 5.9499999999999996e-05,
|
|
"loss": 8.0767,
|
|
"mean_token_accuracy": 0.0643788930028677,
|
|
"num_tokens": 86135.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 9.434719371795655,
|
|
"epoch": 0.002883040800793413,
|
|
"grad_norm": 2.171875,
|
|
"learning_rate": 6.2e-05,
|
|
"loss": 7.898,
|
|
"mean_token_accuracy": 0.0802077766507864,
|
|
"num_tokens": 89620.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 9.149808502197265,
|
|
"epoch": 0.0029983624328251495,
|
|
"grad_norm": 1.96875,
|
|
"learning_rate": 6.450000000000001e-05,
|
|
"loss": 7.7739,
|
|
"mean_token_accuracy": 0.08522589541971684,
|
|
"num_tokens": 93245.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 9.161969184875488,
|
|
"epoch": 0.0031136840648568857,
|
|
"grad_norm": 1.9296875,
|
|
"learning_rate": 6.7e-05,
|
|
"loss": 7.6885,
|
|
"mean_token_accuracy": 0.09521296098828316,
|
|
"num_tokens": 96754.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 8.86840353012085,
|
|
"epoch": 0.0032290056968886224,
|
|
"grad_norm": 1.8359375,
|
|
"learning_rate": 6.950000000000001e-05,
|
|
"loss": 7.6545,
|
|
"mean_token_accuracy": 0.08669420927762986,
|
|
"num_tokens": 100266.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 8.901450920104981,
|
|
"epoch": 0.003344327328920359,
|
|
"grad_norm": 1.6484375,
|
|
"learning_rate": 7.2e-05,
|
|
"loss": 7.5653,
|
|
"mean_token_accuracy": 0.07821874283254146,
|
|
"num_tokens": 103824.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 8.649330520629883,
|
|
"epoch": 0.0034596489609520953,
|
|
"grad_norm": 2.171875,
|
|
"learning_rate": 7.45e-05,
|
|
"loss": 7.5483,
|
|
"mean_token_accuracy": 0.0837211973965168,
|
|
"num_tokens": 107659.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 8.520522785186767,
|
|
"epoch": 0.003574970592983832,
|
|
"grad_norm": 2.09375,
|
|
"learning_rate": 7.7e-05,
|
|
"loss": 7.3799,
|
|
"mean_token_accuracy": 0.08768085911870002,
|
|
"num_tokens": 111348.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 8.380702209472656,
|
|
"epoch": 0.003690292225015568,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 7.950000000000001e-05,
|
|
"loss": 7.4222,
|
|
"mean_token_accuracy": 0.08212160468101501,
|
|
"num_tokens": 115386.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 8.227167320251464,
|
|
"epoch": 0.003805613857047305,
|
|
"grad_norm": 1.921875,
|
|
"learning_rate": 8.2e-05,
|
|
"loss": 7.3087,
|
|
"mean_token_accuracy": 0.09835789948701859,
|
|
"num_tokens": 118772.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 8.145322608947755,
|
|
"epoch": 0.0039209354890790415,
|
|
"grad_norm": 1.890625,
|
|
"learning_rate": 8.450000000000001e-05,
|
|
"loss": 7.416,
|
|
"mean_token_accuracy": 0.09204246997833251,
|
|
"num_tokens": 122680.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 8.233028316497803,
|
|
"epoch": 0.004036257121110778,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 8.7e-05,
|
|
"loss": 7.3521,
|
|
"mean_token_accuracy": 0.08081735149025918,
|
|
"num_tokens": 127162.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 7.950575256347657,
|
|
"epoch": 0.004151578753142515,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 8.95e-05,
|
|
"loss": 7.2055,
|
|
"mean_token_accuracy": 0.09383777529001236,
|
|
"num_tokens": 130684.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 8.000711679458618,
|
|
"epoch": 0.004266900385174251,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 9.2e-05,
|
|
"loss": 7.275,
|
|
"mean_token_accuracy": 0.09546211659908295,
|
|
"num_tokens": 134154.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 7.941235446929932,
|
|
"epoch": 0.004382222017205987,
|
|
"grad_norm": 1.703125,
|
|
"learning_rate": 9.45e-05,
|
|
"loss": 7.2944,
|
|
"mean_token_accuracy": 0.08537636548280716,
|
|
"num_tokens": 137811.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 7.906629467010498,
|
|
"epoch": 0.004497543649237724,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 9.7e-05,
|
|
"loss": 7.1824,
|
|
"mean_token_accuracy": 0.09572790712118148,
|
|
"num_tokens": 141220.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 7.942177057266235,
|
|
"epoch": 0.004612865281269461,
|
|
"grad_norm": 1.8671875,
|
|
"learning_rate": 9.95e-05,
|
|
"loss": 7.2036,
|
|
"mean_token_accuracy": 0.09937367662787437,
|
|
"num_tokens": 144768.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 7.685758304595947,
|
|
"epoch": 0.004728186913301197,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 0.000102,
|
|
"loss": 7.137,
|
|
"mean_token_accuracy": 0.09695517122745514,
|
|
"num_tokens": 148173.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 7.714945936203003,
|
|
"epoch": 0.004843508545332933,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.00010449999999999999,
|
|
"loss": 7.1256,
|
|
"mean_token_accuracy": 0.10458688139915466,
|
|
"num_tokens": 151861.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 7.71102352142334,
|
|
"epoch": 0.00495883017736467,
|
|
"grad_norm": 1.7578125,
|
|
"learning_rate": 0.000107,
|
|
"loss": 7.066,
|
|
"mean_token_accuracy": 0.10715894550085067,
|
|
"num_tokens": 155191.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 7.614436388015747,
|
|
"epoch": 0.0050741518093964065,
|
|
"grad_norm": 1.921875,
|
|
"learning_rate": 0.0001095,
|
|
"loss": 7.1459,
|
|
"mean_token_accuracy": 0.09644531235098838,
|
|
"num_tokens": 158655.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 7.692019128799439,
|
|
"epoch": 0.005189473441428143,
|
|
"grad_norm": 1.8515625,
|
|
"learning_rate": 0.000112,
|
|
"loss": 7.1231,
|
|
"mean_token_accuracy": 0.10170018300414085,
|
|
"num_tokens": 162244.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 7.713358163833618,
|
|
"epoch": 0.00530479507345988,
|
|
"grad_norm": 1.7109375,
|
|
"learning_rate": 0.0001145,
|
|
"loss": 7.2913,
|
|
"mean_token_accuracy": 0.08797733411192894,
|
|
"num_tokens": 165887.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 7.608382606506348,
|
|
"epoch": 0.0054201167054916165,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00011700000000000001,
|
|
"loss": 7.0288,
|
|
"mean_token_accuracy": 0.10224084109067917,
|
|
"num_tokens": 169248.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 7.681228685379028,
|
|
"epoch": 0.005535438337523352,
|
|
"grad_norm": 1.8359375,
|
|
"learning_rate": 0.00011949999999999999,
|
|
"loss": 7.137,
|
|
"mean_token_accuracy": 0.09048556201159955,
|
|
"num_tokens": 172559.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 7.473513507843018,
|
|
"epoch": 0.005650759969555089,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.000122,
|
|
"loss": 7.0968,
|
|
"mean_token_accuracy": 0.1024228110909462,
|
|
"num_tokens": 175961.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 7.584992599487305,
|
|
"epoch": 0.005766081601586826,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0001245,
|
|
"loss": 7.1516,
|
|
"mean_token_accuracy": 0.09878315702080727,
|
|
"num_tokens": 179611.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 7.685141277313233,
|
|
"epoch": 0.005881403233618562,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.000127,
|
|
"loss": 7.1129,
|
|
"mean_token_accuracy": 0.10327758342027664,
|
|
"num_tokens": 183105.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 7.646425008773804,
|
|
"epoch": 0.005996724865650299,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 0.0001295,
|
|
"loss": 7.118,
|
|
"mean_token_accuracy": 0.09364504367113113,
|
|
"num_tokens": 186682.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 7.5202278137207035,
|
|
"epoch": 0.006112046497682035,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.000132,
|
|
"loss": 7.1542,
|
|
"mean_token_accuracy": 0.09994478896260262,
|
|
"num_tokens": 190487.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 7.5590576171875,
|
|
"epoch": 0.0062273681297137715,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.00013450000000000002,
|
|
"loss": 7.1467,
|
|
"mean_token_accuracy": 0.0977135255932808,
|
|
"num_tokens": 194445.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 7.514654350280762,
|
|
"epoch": 0.006342689761745508,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 0.00013700000000000002,
|
|
"loss": 7.0653,
|
|
"mean_token_accuracy": 0.10815930888056755,
|
|
"num_tokens": 197864.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 7.6202771186828615,
|
|
"epoch": 0.006458011393777245,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0001395,
|
|
"loss": 6.99,
|
|
"mean_token_accuracy": 0.1028586745262146,
|
|
"num_tokens": 201465.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 7.317496013641358,
|
|
"epoch": 0.0065733330258089815,
|
|
"grad_norm": 1.71875,
|
|
"learning_rate": 0.00014199999999999998,
|
|
"loss": 6.9834,
|
|
"mean_token_accuracy": 0.09826496616005898,
|
|
"num_tokens": 204918.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 7.434334373474121,
|
|
"epoch": 0.006688654657840718,
|
|
"grad_norm": 2.015625,
|
|
"learning_rate": 0.0001445,
|
|
"loss": 7.078,
|
|
"mean_token_accuracy": 0.10162978768348693,
|
|
"num_tokens": 208725.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 7.4441381931304935,
|
|
"epoch": 0.006803976289872454,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 0.000147,
|
|
"loss": 7.0367,
|
|
"mean_token_accuracy": 0.10961202383041382,
|
|
"num_tokens": 212286.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 7.442938041687012,
|
|
"epoch": 0.006919297921904191,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 0.0001495,
|
|
"loss": 6.9635,
|
|
"mean_token_accuracy": 0.11073270812630653,
|
|
"num_tokens": 215900.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 7.303906488418579,
|
|
"epoch": 0.007034619553935927,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.000152,
|
|
"loss": 6.9921,
|
|
"mean_token_accuracy": 0.10271828547120095,
|
|
"num_tokens": 219495.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 7.581103324890137,
|
|
"epoch": 0.007149941185967664,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00015450000000000001,
|
|
"loss": 7.0565,
|
|
"mean_token_accuracy": 0.09874569922685623,
|
|
"num_tokens": 223358.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 7.358316278457641,
|
|
"epoch": 0.007265262817999401,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 0.000157,
|
|
"loss": 6.9374,
|
|
"mean_token_accuracy": 0.11364061161875724,
|
|
"num_tokens": 226549.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 7.333794832229614,
|
|
"epoch": 0.007380584450031136,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.0001595,
|
|
"loss": 7.0438,
|
|
"mean_token_accuracy": 0.11026700586080551,
|
|
"num_tokens": 230102.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 7.446019983291626,
|
|
"epoch": 0.007495906082062873,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.000162,
|
|
"loss": 6.9717,
|
|
"mean_token_accuracy": 0.10468028411269188,
|
|
"num_tokens": 233652.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 7.4383687496185305,
|
|
"epoch": 0.00761122771409461,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 0.00016450000000000001,
|
|
"loss": 6.9563,
|
|
"mean_token_accuracy": 0.10809829756617546,
|
|
"num_tokens": 237100.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 7.277336835861206,
|
|
"epoch": 0.007726549346126346,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.00016700000000000002,
|
|
"loss": 6.835,
|
|
"mean_token_accuracy": 0.1123481884598732,
|
|
"num_tokens": 240390.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 7.367178535461425,
|
|
"epoch": 0.007841870978158083,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 0.00016950000000000003,
|
|
"loss": 6.9353,
|
|
"mean_token_accuracy": 0.10941664353013039,
|
|
"num_tokens": 243955.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 7.226317501068115,
|
|
"epoch": 0.007957192610189819,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.00017199999999999998,
|
|
"loss": 6.8903,
|
|
"mean_token_accuracy": 0.11319939866662025,
|
|
"num_tokens": 247371.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 7.388652610778808,
|
|
"epoch": 0.008072514242221556,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.00017449999999999999,
|
|
"loss": 6.9579,
|
|
"mean_token_accuracy": 0.10422090664505959,
|
|
"num_tokens": 250794.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 7.3202920913696286,
|
|
"epoch": 0.008187835874253292,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.000177,
|
|
"loss": 6.985,
|
|
"mean_token_accuracy": 0.10096767656505108,
|
|
"num_tokens": 254434.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 7.292840766906738,
|
|
"epoch": 0.00830315750628503,
|
|
"grad_norm": 1.8984375,
|
|
"learning_rate": 0.0001795,
|
|
"loss": 6.9804,
|
|
"mean_token_accuracy": 0.10753846392035485,
|
|
"num_tokens": 258039.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 7.453191423416138,
|
|
"epoch": 0.008418479138316766,
|
|
"grad_norm": 1.7265625,
|
|
"learning_rate": 0.000182,
|
|
"loss": 6.9874,
|
|
"mean_token_accuracy": 0.11508287489414215,
|
|
"num_tokens": 261851.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 7.177758312225341,
|
|
"epoch": 0.008533800770348501,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0001845,
|
|
"loss": 6.9374,
|
|
"mean_token_accuracy": 0.10858769118785858,
|
|
"num_tokens": 265903.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 7.471200084686279,
|
|
"epoch": 0.008649122402380239,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 0.000187,
|
|
"loss": 6.9962,
|
|
"mean_token_accuracy": 0.10989872291684151,
|
|
"num_tokens": 269471.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 7.166895580291748,
|
|
"epoch": 0.008764444034411975,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0001895,
|
|
"loss": 6.9137,
|
|
"mean_token_accuracy": 0.11640691384673119,
|
|
"num_tokens": 272945.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 7.404301357269287,
|
|
"epoch": 0.008879765666443712,
|
|
"grad_norm": 2.0625,
|
|
"learning_rate": 0.000192,
|
|
"loss": 6.9117,
|
|
"mean_token_accuracy": 0.1151728942990303,
|
|
"num_tokens": 276300.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 7.1740296363830565,
|
|
"epoch": 0.008995087298475448,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 0.0001945,
|
|
"loss": 6.9439,
|
|
"mean_token_accuracy": 0.10883786007761956,
|
|
"num_tokens": 279930.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 7.307166481018067,
|
|
"epoch": 0.009110408930507184,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.00019700000000000002,
|
|
"loss": 6.92,
|
|
"mean_token_accuracy": 0.1120470218360424,
|
|
"num_tokens": 283709.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 7.349106884002685,
|
|
"epoch": 0.009225730562538921,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00019950000000000002,
|
|
"loss": 7.0302,
|
|
"mean_token_accuracy": 0.11455085650086402,
|
|
"num_tokens": 287880.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 7.221231746673584,
|
|
"epoch": 0.009341052194570657,
|
|
"grad_norm": 1.7578125,
|
|
"learning_rate": 0.000202,
|
|
"loss": 6.8002,
|
|
"mean_token_accuracy": 0.11782657876610755,
|
|
"num_tokens": 291367.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 7.293564319610596,
|
|
"epoch": 0.009456373826602395,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.00020449999999999998,
|
|
"loss": 6.9735,
|
|
"mean_token_accuracy": 0.10948061645030975,
|
|
"num_tokens": 294920.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 7.203423309326172,
|
|
"epoch": 0.00957169545863413,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.000207,
|
|
"loss": 6.8951,
|
|
"mean_token_accuracy": 0.1170351468026638,
|
|
"num_tokens": 298347.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 7.1942479610443115,
|
|
"epoch": 0.009687017090665866,
|
|
"grad_norm": 1.765625,
|
|
"learning_rate": 0.0002095,
|
|
"loss": 6.7875,
|
|
"mean_token_accuracy": 0.1238088421523571,
|
|
"num_tokens": 301787.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 7.0459576606750485,
|
|
"epoch": 0.009802338722697604,
|
|
"grad_norm": 1.8671875,
|
|
"learning_rate": 0.000212,
|
|
"loss": 6.8287,
|
|
"mean_token_accuracy": 0.12091329768300056,
|
|
"num_tokens": 305284.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 7.336889219284058,
|
|
"epoch": 0.00991766035472934,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0002145,
|
|
"loss": 6.9463,
|
|
"mean_token_accuracy": 0.11388053148984909,
|
|
"num_tokens": 308963.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 7.106842947006226,
|
|
"epoch": 0.010032981986761077,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.00021700000000000002,
|
|
"loss": 6.809,
|
|
"mean_token_accuracy": 0.12353090792894364,
|
|
"num_tokens": 312422.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 7.182272291183471,
|
|
"epoch": 0.010148303618792813,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0002195,
|
|
"loss": 6.7662,
|
|
"mean_token_accuracy": 0.11858817338943481,
|
|
"num_tokens": 316194.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 7.024605417251587,
|
|
"epoch": 0.010263625250824549,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.000222,
|
|
"loss": 6.8614,
|
|
"mean_token_accuracy": 0.11561542153358459,
|
|
"num_tokens": 319824.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 7.047331666946411,
|
|
"epoch": 0.010378946882856286,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 0.0002245,
|
|
"loss": 6.7707,
|
|
"mean_token_accuracy": 0.1250594787299633,
|
|
"num_tokens": 323503.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 7.204434967041015,
|
|
"epoch": 0.010494268514888022,
|
|
"grad_norm": 1.6484375,
|
|
"learning_rate": 0.00022700000000000002,
|
|
"loss": 6.8941,
|
|
"mean_token_accuracy": 0.11519786417484283,
|
|
"num_tokens": 326858.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 7.106210565567016,
|
|
"epoch": 0.01060959014691976,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 0.00022950000000000002,
|
|
"loss": 6.8793,
|
|
"mean_token_accuracy": 0.11701082810759544,
|
|
"num_tokens": 330370.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 7.177642726898194,
|
|
"epoch": 0.010724911778951495,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.00023200000000000003,
|
|
"loss": 6.7898,
|
|
"mean_token_accuracy": 0.11765560358762742,
|
|
"num_tokens": 334041.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 7.11465482711792,
|
|
"epoch": 0.010840233410983233,
|
|
"grad_norm": 1.890625,
|
|
"learning_rate": 0.00023449999999999998,
|
|
"loss": 6.7651,
|
|
"mean_token_accuracy": 0.12222857922315597,
|
|
"num_tokens": 337724.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 6.927467727661133,
|
|
"epoch": 0.010955555043014969,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 0.000237,
|
|
"loss": 6.6746,
|
|
"mean_token_accuracy": 0.12812104001641272,
|
|
"num_tokens": 340946.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 7.083363389968872,
|
|
"epoch": 0.011070876675046705,
|
|
"grad_norm": 1.7109375,
|
|
"learning_rate": 0.0002395,
|
|
"loss": 6.8418,
|
|
"mean_token_accuracy": 0.12921102717518806,
|
|
"num_tokens": 344603.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 7.131814002990723,
|
|
"epoch": 0.011186198307078442,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.000242,
|
|
"loss": 6.8164,
|
|
"mean_token_accuracy": 0.11969970613718033,
|
|
"num_tokens": 348153.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 6.9778149127960205,
|
|
"epoch": 0.011301519939110178,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.0002445,
|
|
"loss": 6.8872,
|
|
"mean_token_accuracy": 0.12184126004576683,
|
|
"num_tokens": 351682.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 7.12193341255188,
|
|
"epoch": 0.011416841571141916,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.000247,
|
|
"loss": 6.7129,
|
|
"mean_token_accuracy": 0.12792302519083024,
|
|
"num_tokens": 355245.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 6.980188322067261,
|
|
"epoch": 0.011532163203173651,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0002495,
|
|
"loss": 6.8127,
|
|
"mean_token_accuracy": 0.12161365896463394,
|
|
"num_tokens": 358888.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 7.066232776641845,
|
|
"epoch": 0.011647484835205387,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.000252,
|
|
"loss": 6.8635,
|
|
"mean_token_accuracy": 0.11938958987593651,
|
|
"num_tokens": 362626.0,
|
|
"step": 505
|
|
},
|
|
{
|
|
"entropy": 7.00195050239563,
|
|
"epoch": 0.011762806467237125,
|
|
"grad_norm": 2.09375,
|
|
"learning_rate": 0.0002545,
|
|
"loss": 6.7086,
|
|
"mean_token_accuracy": 0.1228688344359398,
|
|
"num_tokens": 366038.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 6.969321203231812,
|
|
"epoch": 0.01187812809926886,
|
|
"grad_norm": 1.7109375,
|
|
"learning_rate": 0.000257,
|
|
"loss": 6.7136,
|
|
"mean_token_accuracy": 0.12526071220636367,
|
|
"num_tokens": 369594.0,
|
|
"step": 515
|
|
},
|
|
{
|
|
"entropy": 6.9371413230896,
|
|
"epoch": 0.011993449731300598,
|
|
"grad_norm": 1.703125,
|
|
"learning_rate": 0.0002595,
|
|
"loss": 6.7367,
|
|
"mean_token_accuracy": 0.12349091246724128,
|
|
"num_tokens": 373104.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 7.061675262451172,
|
|
"epoch": 0.012108771363332334,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.000262,
|
|
"loss": 6.7381,
|
|
"mean_token_accuracy": 0.127496138215065,
|
|
"num_tokens": 376595.0,
|
|
"step": 525
|
|
},
|
|
{
|
|
"entropy": 6.979284811019897,
|
|
"epoch": 0.01222409299536407,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.00026450000000000003,
|
|
"loss": 6.6709,
|
|
"mean_token_accuracy": 0.13121070936322213,
|
|
"num_tokens": 380156.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 6.977970695495605,
|
|
"epoch": 0.012339414627395807,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.00026700000000000004,
|
|
"loss": 6.7324,
|
|
"mean_token_accuracy": 0.1287410192191601,
|
|
"num_tokens": 384027.0,
|
|
"step": 535
|
|
},
|
|
{
|
|
"entropy": 6.881741619110107,
|
|
"epoch": 0.012454736259427543,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.00026950000000000005,
|
|
"loss": 6.6671,
|
|
"mean_token_accuracy": 0.11977160051465034,
|
|
"num_tokens": 387550.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 6.822022294998169,
|
|
"epoch": 0.01257005789145928,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.00027200000000000005,
|
|
"loss": 6.6422,
|
|
"mean_token_accuracy": 0.13606388345360756,
|
|
"num_tokens": 390963.0,
|
|
"step": 545
|
|
},
|
|
{
|
|
"entropy": 6.928303003311157,
|
|
"epoch": 0.012685379523491016,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0002745,
|
|
"loss": 6.7124,
|
|
"mean_token_accuracy": 0.12595684081315994,
|
|
"num_tokens": 394925.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 6.908079767227173,
|
|
"epoch": 0.012800701155522754,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 0.000277,
|
|
"loss": 6.6508,
|
|
"mean_token_accuracy": 0.13430240824818612,
|
|
"num_tokens": 398277.0,
|
|
"step": 555
|
|
},
|
|
{
|
|
"entropy": 6.7669871807098385,
|
|
"epoch": 0.01291602278755449,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0002795,
|
|
"loss": 6.6406,
|
|
"mean_token_accuracy": 0.12931998521089555,
|
|
"num_tokens": 402031.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 7.0115638256073,
|
|
"epoch": 0.013031344419586225,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 0.00028199999999999997,
|
|
"loss": 6.7424,
|
|
"mean_token_accuracy": 0.12384107932448388,
|
|
"num_tokens": 405965.0,
|
|
"step": 565
|
|
},
|
|
{
|
|
"entropy": 6.675027227401733,
|
|
"epoch": 0.013146666051617963,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0002845,
|
|
"loss": 6.6326,
|
|
"mean_token_accuracy": 0.13790299072861673,
|
|
"num_tokens": 409030.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 6.937662792205811,
|
|
"epoch": 0.013261987683649699,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.000287,
|
|
"loss": 6.6805,
|
|
"mean_token_accuracy": 0.1316666141152382,
|
|
"num_tokens": 412644.0,
|
|
"step": 575
|
|
},
|
|
{
|
|
"entropy": 6.8609226703643795,
|
|
"epoch": 0.013377309315681436,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0002895,
|
|
"loss": 6.8327,
|
|
"mean_token_accuracy": 0.12451824694871902,
|
|
"num_tokens": 416572.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 7.033586931228638,
|
|
"epoch": 0.013492630947713172,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.000292,
|
|
"loss": 6.7378,
|
|
"mean_token_accuracy": 0.12755787074565889,
|
|
"num_tokens": 420282.0,
|
|
"step": 585
|
|
},
|
|
{
|
|
"entropy": 6.879875516891479,
|
|
"epoch": 0.013607952579744908,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0002945,
|
|
"loss": 6.7316,
|
|
"mean_token_accuracy": 0.12889642342925073,
|
|
"num_tokens": 423856.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 6.873905801773072,
|
|
"epoch": 0.013723274211776645,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.000297,
|
|
"loss": 6.7251,
|
|
"mean_token_accuracy": 0.12292287200689316,
|
|
"num_tokens": 427505.0,
|
|
"step": 595
|
|
},
|
|
{
|
|
"entropy": 6.9947303295135494,
|
|
"epoch": 0.013838595843808381,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0002995,
|
|
"loss": 6.7802,
|
|
"mean_token_accuracy": 0.12400763705372811,
|
|
"num_tokens": 431019.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 6.831447172164917,
|
|
"epoch": 0.013953917475840119,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.000302,
|
|
"loss": 6.7275,
|
|
"mean_token_accuracy": 0.11811881884932518,
|
|
"num_tokens": 434958.0,
|
|
"step": 605
|
|
},
|
|
{
|
|
"entropy": 6.952916431427002,
|
|
"epoch": 0.014069239107871855,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0003045,
|
|
"loss": 6.6707,
|
|
"mean_token_accuracy": 0.12404478713870049,
|
|
"num_tokens": 438819.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 6.7603600978851315,
|
|
"epoch": 0.01418456073990359,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.000307,
|
|
"loss": 6.6654,
|
|
"mean_token_accuracy": 0.13465720862150193,
|
|
"num_tokens": 442673.0,
|
|
"step": 615
|
|
},
|
|
{
|
|
"entropy": 6.749461269378662,
|
|
"epoch": 0.014299882371935328,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.0003095,
|
|
"loss": 6.611,
|
|
"mean_token_accuracy": 0.141814486682415,
|
|
"num_tokens": 446022.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 6.744637155532837,
|
|
"epoch": 0.014415204003967064,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 0.000312,
|
|
"loss": 6.5443,
|
|
"mean_token_accuracy": 0.12628007531166077,
|
|
"num_tokens": 449417.0,
|
|
"step": 625
|
|
},
|
|
{
|
|
"entropy": 6.688572549819947,
|
|
"epoch": 0.014530525635998801,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.0003145,
|
|
"loss": 6.6076,
|
|
"mean_token_accuracy": 0.13569982424378396,
|
|
"num_tokens": 452864.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 6.912837743759155,
|
|
"epoch": 0.014645847268030537,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.000317,
|
|
"loss": 6.6372,
|
|
"mean_token_accuracy": 0.13416576981544495,
|
|
"num_tokens": 456271.0,
|
|
"step": 635
|
|
},
|
|
{
|
|
"entropy": 6.784486961364746,
|
|
"epoch": 0.014761168900062273,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.0003195,
|
|
"loss": 6.6531,
|
|
"mean_token_accuracy": 0.12497906535863876,
|
|
"num_tokens": 459829.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 6.867062091827393,
|
|
"epoch": 0.01487649053209401,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.000322,
|
|
"loss": 6.6887,
|
|
"mean_token_accuracy": 0.1274550288915634,
|
|
"num_tokens": 463533.0,
|
|
"step": 645
|
|
},
|
|
{
|
|
"entropy": 6.910113048553467,
|
|
"epoch": 0.014991812164125746,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.00032450000000000003,
|
|
"loss": 6.7957,
|
|
"mean_token_accuracy": 0.13574171662330628,
|
|
"num_tokens": 467332.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 6.789191818237304,
|
|
"epoch": 0.015107133796157484,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.00032700000000000003,
|
|
"loss": 6.5626,
|
|
"mean_token_accuracy": 0.13435751348733901,
|
|
"num_tokens": 470873.0,
|
|
"step": 655
|
|
},
|
|
{
|
|
"entropy": 6.788733005523682,
|
|
"epoch": 0.01522245542818922,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.00032950000000000004,
|
|
"loss": 6.7839,
|
|
"mean_token_accuracy": 0.12393135279417038,
|
|
"num_tokens": 474820.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 6.878502368927002,
|
|
"epoch": 0.015337777060220957,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.00033200000000000005,
|
|
"loss": 6.6323,
|
|
"mean_token_accuracy": 0.12036252096295356,
|
|
"num_tokens": 478395.0,
|
|
"step": 665
|
|
},
|
|
{
|
|
"entropy": 6.82345757484436,
|
|
"epoch": 0.015453098692252693,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.00033450000000000005,
|
|
"loss": 6.6041,
|
|
"mean_token_accuracy": 0.12858830615878106,
|
|
"num_tokens": 482046.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 6.717121648788452,
|
|
"epoch": 0.015568420324284429,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.000337,
|
|
"loss": 6.7698,
|
|
"mean_token_accuracy": 0.1298346571624279,
|
|
"num_tokens": 485673.0,
|
|
"step": 675
|
|
},
|
|
{
|
|
"entropy": 6.864575338363648,
|
|
"epoch": 0.015683741956316166,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0003395,
|
|
"loss": 6.7329,
|
|
"mean_token_accuracy": 0.1281518019735813,
|
|
"num_tokens": 489481.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 6.822469806671142,
|
|
"epoch": 0.015799063588347904,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.000342,
|
|
"loss": 6.6497,
|
|
"mean_token_accuracy": 0.11982662305235862,
|
|
"num_tokens": 493190.0,
|
|
"step": 685
|
|
},
|
|
{
|
|
"entropy": 6.7843328475952145,
|
|
"epoch": 0.015914385220379638,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.00034449999999999997,
|
|
"loss": 6.6649,
|
|
"mean_token_accuracy": 0.13050103262066842,
|
|
"num_tokens": 496998.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 6.7976783275604244,
|
|
"epoch": 0.016029706852411375,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.000347,
|
|
"loss": 6.5988,
|
|
"mean_token_accuracy": 0.12620501667261125,
|
|
"num_tokens": 500711.0,
|
|
"step": 695
|
|
},
|
|
{
|
|
"entropy": 6.778346061706543,
|
|
"epoch": 0.016145028484443113,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0003495,
|
|
"loss": 6.6419,
|
|
"mean_token_accuracy": 0.13493644669651986,
|
|
"num_tokens": 504320.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 6.839865684509277,
|
|
"epoch": 0.016260350116474847,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000352,
|
|
"loss": 6.7026,
|
|
"mean_token_accuracy": 0.12694861963391305,
|
|
"num_tokens": 508591.0,
|
|
"step": 705
|
|
},
|
|
{
|
|
"entropy": 6.507184028625488,
|
|
"epoch": 0.016375671748506584,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 0.0003545,
|
|
"loss": 6.5197,
|
|
"mean_token_accuracy": 0.12975703105330466,
|
|
"num_tokens": 511954.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 6.9446001052856445,
|
|
"epoch": 0.016490993380538322,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.000357,
|
|
"loss": 6.7093,
|
|
"mean_token_accuracy": 0.12820022329688072,
|
|
"num_tokens": 515674.0,
|
|
"step": 715
|
|
},
|
|
{
|
|
"entropy": 6.730710792541504,
|
|
"epoch": 0.01660631501257006,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0003595,
|
|
"loss": 6.5776,
|
|
"mean_token_accuracy": 0.1299228049814701,
|
|
"num_tokens": 519263.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 6.626702070236206,
|
|
"epoch": 0.016721636644601794,
|
|
"grad_norm": 1.7890625,
|
|
"learning_rate": 0.000362,
|
|
"loss": 6.547,
|
|
"mean_token_accuracy": 0.13767884224653243,
|
|
"num_tokens": 522852.0,
|
|
"step": 725
|
|
},
|
|
{
|
|
"entropy": 6.654131937026977,
|
|
"epoch": 0.01683695827663353,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 0.0003645,
|
|
"loss": 6.363,
|
|
"mean_token_accuracy": 0.14956862181425096,
|
|
"num_tokens": 525895.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 6.6195868968963625,
|
|
"epoch": 0.01695227990866527,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.000367,
|
|
"loss": 6.66,
|
|
"mean_token_accuracy": 0.1396695040166378,
|
|
"num_tokens": 529767.0,
|
|
"step": 735
|
|
},
|
|
{
|
|
"entropy": 6.844963073730469,
|
|
"epoch": 0.017067601540697003,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0003695,
|
|
"loss": 6.6272,
|
|
"mean_token_accuracy": 0.13760401010513307,
|
|
"num_tokens": 533460.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 6.55352029800415,
|
|
"epoch": 0.01718292317272874,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.000372,
|
|
"loss": 6.5484,
|
|
"mean_token_accuracy": 0.12853334248065948,
|
|
"num_tokens": 536858.0,
|
|
"step": 745
|
|
},
|
|
{
|
|
"entropy": 6.739038324356079,
|
|
"epoch": 0.017298244804760478,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0003745,
|
|
"loss": 6.5296,
|
|
"mean_token_accuracy": 0.134282648563385,
|
|
"num_tokens": 540385.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 6.603275918960572,
|
|
"epoch": 0.017413566436792212,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.000377,
|
|
"loss": 6.6021,
|
|
"mean_token_accuracy": 0.1308648779988289,
|
|
"num_tokens": 543900.0,
|
|
"step": 755
|
|
},
|
|
{
|
|
"entropy": 6.719392156600952,
|
|
"epoch": 0.01752888806882395,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0003795,
|
|
"loss": 6.4669,
|
|
"mean_token_accuracy": 0.14468610361218454,
|
|
"num_tokens": 547698.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 6.681492519378662,
|
|
"epoch": 0.017644209700855687,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.000382,
|
|
"loss": 6.4244,
|
|
"mean_token_accuracy": 0.1444924809038639,
|
|
"num_tokens": 551343.0,
|
|
"step": 765
|
|
},
|
|
{
|
|
"entropy": 6.512750577926636,
|
|
"epoch": 0.017759531332887424,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0003845,
|
|
"loss": 6.5919,
|
|
"mean_token_accuracy": 0.13365111723542214,
|
|
"num_tokens": 554719.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 6.8195850372314455,
|
|
"epoch": 0.01787485296491916,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 0.00038700000000000003,
|
|
"loss": 6.4418,
|
|
"mean_token_accuracy": 0.14398375824093818,
|
|
"num_tokens": 558065.0,
|
|
"step": 775
|
|
},
|
|
{
|
|
"entropy": 6.40870418548584,
|
|
"epoch": 0.017990174596950896,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00038950000000000003,
|
|
"loss": 6.4908,
|
|
"mean_token_accuracy": 0.13703683838248254,
|
|
"num_tokens": 561838.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 6.763089752197265,
|
|
"epoch": 0.018105496228982634,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.00039200000000000004,
|
|
"loss": 6.5724,
|
|
"mean_token_accuracy": 0.13872020468115806,
|
|
"num_tokens": 565377.0,
|
|
"step": 785
|
|
},
|
|
{
|
|
"entropy": 6.414765214920044,
|
|
"epoch": 0.018220817861014368,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.00039450000000000005,
|
|
"loss": 6.5791,
|
|
"mean_token_accuracy": 0.1391117937862873,
|
|
"num_tokens": 568820.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 6.6232490062713625,
|
|
"epoch": 0.018336139493046105,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00039700000000000005,
|
|
"loss": 6.516,
|
|
"mean_token_accuracy": 0.14359558895230293,
|
|
"num_tokens": 572524.0,
|
|
"step": 795
|
|
},
|
|
{
|
|
"entropy": 6.646560907363892,
|
|
"epoch": 0.018451461125077843,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0003995,
|
|
"loss": 6.5517,
|
|
"mean_token_accuracy": 0.14170725047588348,
|
|
"num_tokens": 575928.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 6.580789995193482,
|
|
"epoch": 0.01856678275710958,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.000402,
|
|
"loss": 6.479,
|
|
"mean_token_accuracy": 0.1312673196196556,
|
|
"num_tokens": 579592.0,
|
|
"step": 805
|
|
},
|
|
{
|
|
"entropy": 6.487143564224243,
|
|
"epoch": 0.018682104389141314,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 0.0004045,
|
|
"loss": 6.5262,
|
|
"mean_token_accuracy": 0.14007846415042877,
|
|
"num_tokens": 582901.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 6.743833398818969,
|
|
"epoch": 0.018797426021173052,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.00040699999999999997,
|
|
"loss": 6.5645,
|
|
"mean_token_accuracy": 0.13733114078640937,
|
|
"num_tokens": 586314.0,
|
|
"step": 815
|
|
},
|
|
{
|
|
"entropy": 6.649324655532837,
|
|
"epoch": 0.01891274765320479,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004095,
|
|
"loss": 6.5989,
|
|
"mean_token_accuracy": 0.12807421162724494,
|
|
"num_tokens": 590184.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 6.660643291473389,
|
|
"epoch": 0.019028069285236524,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.000412,
|
|
"loss": 6.5451,
|
|
"mean_token_accuracy": 0.14784720838069915,
|
|
"num_tokens": 594206.0,
|
|
"step": 825
|
|
},
|
|
{
|
|
"entropy": 6.582896757125854,
|
|
"epoch": 0.01914339091726826,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004145,
|
|
"loss": 6.5935,
|
|
"mean_token_accuracy": 0.13174692913889885,
|
|
"num_tokens": 597907.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 6.467390012741089,
|
|
"epoch": 0.0192587125493,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.000417,
|
|
"loss": 6.4295,
|
|
"mean_token_accuracy": 0.14666235372424125,
|
|
"num_tokens": 601184.0,
|
|
"step": 835
|
|
},
|
|
{
|
|
"entropy": 6.50648775100708,
|
|
"epoch": 0.019374034181331733,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004195,
|
|
"loss": 6.4344,
|
|
"mean_token_accuracy": 0.14619253873825072,
|
|
"num_tokens": 604461.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 6.624946212768554,
|
|
"epoch": 0.01948935581336347,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.000422,
|
|
"loss": 6.4808,
|
|
"mean_token_accuracy": 0.1452321670949459,
|
|
"num_tokens": 608212.0,
|
|
"step": 845
|
|
},
|
|
{
|
|
"entropy": 6.407814979553223,
|
|
"epoch": 0.019604677445395208,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004245,
|
|
"loss": 6.4109,
|
|
"mean_token_accuracy": 0.1504127100110054,
|
|
"num_tokens": 611699.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 6.546614694595337,
|
|
"epoch": 0.019719999077426945,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.000427,
|
|
"loss": 6.5066,
|
|
"mean_token_accuracy": 0.13756923452019693,
|
|
"num_tokens": 615250.0,
|
|
"step": 855
|
|
},
|
|
{
|
|
"entropy": 6.57107834815979,
|
|
"epoch": 0.01983532070945868,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004295,
|
|
"loss": 6.5938,
|
|
"mean_token_accuracy": 0.13746437877416612,
|
|
"num_tokens": 619212.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 6.492978191375732,
|
|
"epoch": 0.019950642341490417,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000432,
|
|
"loss": 6.4712,
|
|
"mean_token_accuracy": 0.14481520354747773,
|
|
"num_tokens": 622968.0,
|
|
"step": 865
|
|
},
|
|
{
|
|
"entropy": 6.592170143127442,
|
|
"epoch": 0.020065963973522154,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 0.0004345,
|
|
"loss": 6.3975,
|
|
"mean_token_accuracy": 0.14187804758548736,
|
|
"num_tokens": 626246.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 6.349250316619873,
|
|
"epoch": 0.02018128560555389,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.000437,
|
|
"loss": 6.4674,
|
|
"mean_token_accuracy": 0.14084591791033746,
|
|
"num_tokens": 629587.0,
|
|
"step": 875
|
|
},
|
|
{
|
|
"entropy": 6.500652837753296,
|
|
"epoch": 0.020296607237585626,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004395,
|
|
"loss": 6.3655,
|
|
"mean_token_accuracy": 0.15314365327358245,
|
|
"num_tokens": 633145.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 6.598798370361328,
|
|
"epoch": 0.020411928869617364,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.000442,
|
|
"loss": 6.5983,
|
|
"mean_token_accuracy": 0.13979744389653206,
|
|
"num_tokens": 636833.0,
|
|
"step": 885
|
|
},
|
|
{
|
|
"entropy": 6.562899351119995,
|
|
"epoch": 0.020527250501649098,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004445,
|
|
"loss": 6.5048,
|
|
"mean_token_accuracy": 0.14217502400279045,
|
|
"num_tokens": 640416.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 6.388691473007202,
|
|
"epoch": 0.020642572133680835,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.000447,
|
|
"loss": 6.3969,
|
|
"mean_token_accuracy": 0.14934756681323053,
|
|
"num_tokens": 643749.0,
|
|
"step": 895
|
|
},
|
|
{
|
|
"entropy": 6.443750047683716,
|
|
"epoch": 0.020757893765712573,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.00044950000000000003,
|
|
"loss": 6.4741,
|
|
"mean_token_accuracy": 0.1435583434998989,
|
|
"num_tokens": 647324.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 6.586315631866455,
|
|
"epoch": 0.02087321539774431,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00045200000000000004,
|
|
"loss": 6.5574,
|
|
"mean_token_accuracy": 0.14090513586997985,
|
|
"num_tokens": 650845.0,
|
|
"step": 905
|
|
},
|
|
{
|
|
"entropy": 6.472339391708374,
|
|
"epoch": 0.020988537029776044,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.00045450000000000004,
|
|
"loss": 6.4032,
|
|
"mean_token_accuracy": 0.1494538463652134,
|
|
"num_tokens": 654241.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 6.533646154403686,
|
|
"epoch": 0.021103858661807782,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00045700000000000005,
|
|
"loss": 6.5261,
|
|
"mean_token_accuracy": 0.13883443772792817,
|
|
"num_tokens": 658325.0,
|
|
"step": 915
|
|
},
|
|
{
|
|
"entropy": 6.595873832702637,
|
|
"epoch": 0.02121918029383952,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.00045950000000000006,
|
|
"loss": 6.592,
|
|
"mean_token_accuracy": 0.12782933786511422,
|
|
"num_tokens": 661858.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 6.363731098175049,
|
|
"epoch": 0.021334501925871253,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.000462,
|
|
"loss": 6.4567,
|
|
"mean_token_accuracy": 0.1426269829273224,
|
|
"num_tokens": 665241.0,
|
|
"step": 925
|
|
},
|
|
{
|
|
"entropy": 6.458065557479858,
|
|
"epoch": 0.02144982355790299,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004645,
|
|
"loss": 6.2515,
|
|
"mean_token_accuracy": 0.16411956250667573,
|
|
"num_tokens": 668551.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 6.404357767105102,
|
|
"epoch": 0.02156514518993473,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.000467,
|
|
"loss": 6.4239,
|
|
"mean_token_accuracy": 0.15490319207310677,
|
|
"num_tokens": 672042.0,
|
|
"step": 935
|
|
},
|
|
{
|
|
"entropy": 6.371016883850098,
|
|
"epoch": 0.021680466821966466,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004695,
|
|
"loss": 6.2836,
|
|
"mean_token_accuracy": 0.16167665868997574,
|
|
"num_tokens": 675439.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 6.284253358840942,
|
|
"epoch": 0.0217957884539982,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.000472,
|
|
"loss": 6.4548,
|
|
"mean_token_accuracy": 0.14620761722326278,
|
|
"num_tokens": 678922.0,
|
|
"step": 945
|
|
},
|
|
{
|
|
"entropy": 6.28749361038208,
|
|
"epoch": 0.021911110086029938,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004745,
|
|
"loss": 6.3503,
|
|
"mean_token_accuracy": 0.14457938969135284,
|
|
"num_tokens": 682158.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 6.486617231369019,
|
|
"epoch": 0.022026431718061675,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.000477,
|
|
"loss": 6.3366,
|
|
"mean_token_accuracy": 0.15324448347091674,
|
|
"num_tokens": 685852.0,
|
|
"step": 955
|
|
},
|
|
{
|
|
"entropy": 6.460330247879028,
|
|
"epoch": 0.02214175335009341,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004795,
|
|
"loss": 6.5499,
|
|
"mean_token_accuracy": 0.1374201148748398,
|
|
"num_tokens": 689757.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 6.396834039688111,
|
|
"epoch": 0.022257074982125147,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.000482,
|
|
"loss": 6.3268,
|
|
"mean_token_accuracy": 0.16849246844649315,
|
|
"num_tokens": 692721.0,
|
|
"step": 965
|
|
},
|
|
{
|
|
"entropy": 6.379905891418457,
|
|
"epoch": 0.022372396614156884,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004845,
|
|
"loss": 6.5339,
|
|
"mean_token_accuracy": 0.14080024287104606,
|
|
"num_tokens": 696739.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 6.532469081878662,
|
|
"epoch": 0.02248771824618862,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.000487,
|
|
"loss": 6.3908,
|
|
"mean_token_accuracy": 0.14212772697210313,
|
|
"num_tokens": 700203.0,
|
|
"step": 975
|
|
},
|
|
{
|
|
"entropy": 6.363768005371094,
|
|
"epoch": 0.022603039878220356,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004895,
|
|
"loss": 6.4829,
|
|
"mean_token_accuracy": 0.13906411677598954,
|
|
"num_tokens": 703675.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 6.559950065612793,
|
|
"epoch": 0.022718361510252093,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.000492,
|
|
"loss": 6.4583,
|
|
"mean_token_accuracy": 0.1475010745227337,
|
|
"num_tokens": 707367.0,
|
|
"step": 985
|
|
},
|
|
{
|
|
"entropy": 6.396135044097901,
|
|
"epoch": 0.02283368314228383,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004945,
|
|
"loss": 6.4877,
|
|
"mean_token_accuracy": 0.14678648263216018,
|
|
"num_tokens": 711686.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 6.352775239944458,
|
|
"epoch": 0.022949004774315565,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.000497,
|
|
"loss": 6.3399,
|
|
"mean_token_accuracy": 0.15635386481881142,
|
|
"num_tokens": 715183.0,
|
|
"step": 995
|
|
},
|
|
{
|
|
"entropy": 6.322125101089478,
|
|
"epoch": 0.023064326406347303,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004995,
|
|
"loss": 6.3754,
|
|
"mean_token_accuracy": 0.14837735146284103,
|
|
"num_tokens": 718730.0,
|
|
"step": 1000
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 4000,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 1,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 1097646999552000.0,
|
|
"train_batch_size": 16,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|