6035 lines
167 KiB
JSON
6035 lines
167 KiB
JSON
|
|
{
|
||
|
|
"best_global_step": null,
|
||
|
|
"best_metric": null,
|
||
|
|
"best_model_checkpoint": null,
|
||
|
|
"epoch": 0.9236719809877517,
|
||
|
|
"eval_steps": 500,
|
||
|
|
"global_step": 3000,
|
||
|
|
"is_hyper_param_search": false,
|
||
|
|
"is_local_process_zero": true,
|
||
|
|
"is_world_process_zero": true,
|
||
|
|
"log_history": [
|
||
|
|
{
|
||
|
|
"entropy": 1.1113718893378972,
|
||
|
|
"epoch": 0.0015394533016462528,
|
||
|
|
"grad_norm": 23.25,
|
||
|
|
"learning_rate": 2.666666666666667e-07,
|
||
|
|
"loss": 1.4148,
|
||
|
|
"mean_token_accuracy": 0.6499394655227662,
|
||
|
|
"num_tokens": 379552.0,
|
||
|
|
"step": 5
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1505246445536614,
|
||
|
|
"epoch": 0.0030789066032925055,
|
||
|
|
"grad_norm": 25.375,
|
||
|
|
"learning_rate": 6.000000000000001e-07,
|
||
|
|
"loss": 1.4742,
|
||
|
|
"mean_token_accuracy": 0.6414433296769857,
|
||
|
|
"num_tokens": 743248.0,
|
||
|
|
"step": 10
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1535595946013928,
|
||
|
|
"epoch": 0.004618359904938758,
|
||
|
|
"grad_norm": 24.0,
|
||
|
|
"learning_rate": 9.333333333333334e-07,
|
||
|
|
"loss": 1.4559,
|
||
|
|
"mean_token_accuracy": 0.6436704084277153,
|
||
|
|
"num_tokens": 1124191.0,
|
||
|
|
"step": 15
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1471380971372127,
|
||
|
|
"epoch": 0.006157813206585011,
|
||
|
|
"grad_norm": 21.5,
|
||
|
|
"learning_rate": 1.2666666666666669e-06,
|
||
|
|
"loss": 1.4609,
|
||
|
|
"mean_token_accuracy": 0.642368745803833,
|
||
|
|
"num_tokens": 1488145.0,
|
||
|
|
"step": 20
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.155402697250247,
|
||
|
|
"epoch": 0.007697266508231265,
|
||
|
|
"grad_norm": 18.25,
|
||
|
|
"learning_rate": 1.6000000000000001e-06,
|
||
|
|
"loss": 1.4329,
|
||
|
|
"mean_token_accuracy": 0.6484112951904535,
|
||
|
|
"num_tokens": 1860647.0,
|
||
|
|
"step": 25
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1452072311192751,
|
||
|
|
"epoch": 0.009236719809877517,
|
||
|
|
"grad_norm": 17.25,
|
||
|
|
"learning_rate": 1.9333333333333336e-06,
|
||
|
|
"loss": 1.3712,
|
||
|
|
"mean_token_accuracy": 0.6529930120334029,
|
||
|
|
"num_tokens": 2245973.0,
|
||
|
|
"step": 30
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.123310711979866,
|
||
|
|
"epoch": 0.01077617311152377,
|
||
|
|
"grad_norm": 13.8125,
|
||
|
|
"learning_rate": 2.266666666666667e-06,
|
||
|
|
"loss": 1.3082,
|
||
|
|
"mean_token_accuracy": 0.6658382505178452,
|
||
|
|
"num_tokens": 2631053.0,
|
||
|
|
"step": 35
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1543800953775645,
|
||
|
|
"epoch": 0.012315626413170022,
|
||
|
|
"grad_norm": 8.75,
|
||
|
|
"learning_rate": 2.6e-06,
|
||
|
|
"loss": 1.2982,
|
||
|
|
"mean_token_accuracy": 0.6618854686617851,
|
||
|
|
"num_tokens": 2992829.0,
|
||
|
|
"step": 40
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1680023059248925,
|
||
|
|
"epoch": 0.013855079714816277,
|
||
|
|
"grad_norm": 6.1875,
|
||
|
|
"learning_rate": 2.9333333333333338e-06,
|
||
|
|
"loss": 1.2948,
|
||
|
|
"mean_token_accuracy": 0.6657806046307087,
|
||
|
|
"num_tokens": 3382112.0,
|
||
|
|
"step": 45
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.147538623958826,
|
||
|
|
"epoch": 0.01539453301646253,
|
||
|
|
"grad_norm": 5.375,
|
||
|
|
"learning_rate": 3.266666666666667e-06,
|
||
|
|
"loss": 1.2509,
|
||
|
|
"mean_token_accuracy": 0.675503570586443,
|
||
|
|
"num_tokens": 3764785.0,
|
||
|
|
"step": 50
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.107958966679871,
|
||
|
|
"epoch": 0.01693398631810878,
|
||
|
|
"grad_norm": 4.90625,
|
||
|
|
"learning_rate": 3.6000000000000003e-06,
|
||
|
|
"loss": 1.1997,
|
||
|
|
"mean_token_accuracy": 0.6811204344034195,
|
||
|
|
"num_tokens": 4126394.0,
|
||
|
|
"step": 55
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1157011151313783,
|
||
|
|
"epoch": 0.018473439619755033,
|
||
|
|
"grad_norm": 2.265625,
|
||
|
|
"learning_rate": 3.9333333333333335e-06,
|
||
|
|
"loss": 1.193,
|
||
|
|
"mean_token_accuracy": 0.6808499224483967,
|
||
|
|
"num_tokens": 4510149.0,
|
||
|
|
"step": 60
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1392802488058806,
|
||
|
|
"epoch": 0.020012892921401286,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 4.266666666666668e-06,
|
||
|
|
"loss": 1.1903,
|
||
|
|
"mean_token_accuracy": 0.6806150872260333,
|
||
|
|
"num_tokens": 4875984.0,
|
||
|
|
"step": 65
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1204315345734357,
|
||
|
|
"epoch": 0.02155234622304754,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 4.600000000000001e-06,
|
||
|
|
"loss": 1.1621,
|
||
|
|
"mean_token_accuracy": 0.6908985383808612,
|
||
|
|
"num_tokens": 5251973.0,
|
||
|
|
"step": 70
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1343737579882145,
|
||
|
|
"epoch": 0.02309179952469379,
|
||
|
|
"grad_norm": 0.90234375,
|
||
|
|
"learning_rate": 4.933333333333334e-06,
|
||
|
|
"loss": 1.1367,
|
||
|
|
"mean_token_accuracy": 0.6892836567014455,
|
||
|
|
"num_tokens": 5622302.0,
|
||
|
|
"step": 75
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.138794292882085,
|
||
|
|
"epoch": 0.024631252826340044,
|
||
|
|
"grad_norm": 0.81640625,
|
||
|
|
"learning_rate": 5.2666666666666665e-06,
|
||
|
|
"loss": 1.1657,
|
||
|
|
"mean_token_accuracy": 0.6916824176907539,
|
||
|
|
"num_tokens": 5987467.0,
|
||
|
|
"step": 80
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1140711281448603,
|
||
|
|
"epoch": 0.0261707061279863,
|
||
|
|
"grad_norm": 0.796875,
|
||
|
|
"learning_rate": 5.600000000000001e-06,
|
||
|
|
"loss": 1.1287,
|
||
|
|
"mean_token_accuracy": 0.6946257088333369,
|
||
|
|
"num_tokens": 6369083.0,
|
||
|
|
"step": 85
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1451053522527217,
|
||
|
|
"epoch": 0.027710159429632553,
|
||
|
|
"grad_norm": 0.78515625,
|
||
|
|
"learning_rate": 5.933333333333335e-06,
|
||
|
|
"loss": 1.1546,
|
||
|
|
"mean_token_accuracy": 0.6903918959200382,
|
||
|
|
"num_tokens": 6749350.0,
|
||
|
|
"step": 90
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1201870743185283,
|
||
|
|
"epoch": 0.029249612731278806,
|
||
|
|
"grad_norm": 0.7890625,
|
||
|
|
"learning_rate": 6.266666666666668e-06,
|
||
|
|
"loss": 1.1166,
|
||
|
|
"mean_token_accuracy": 0.6962686065584421,
|
||
|
|
"num_tokens": 7118012.0,
|
||
|
|
"step": 95
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.149271610751748,
|
||
|
|
"epoch": 0.03078906603292506,
|
||
|
|
"grad_norm": 0.796875,
|
||
|
|
"learning_rate": 6.600000000000001e-06,
|
||
|
|
"loss": 1.1534,
|
||
|
|
"mean_token_accuracy": 0.6903159897774458,
|
||
|
|
"num_tokens": 7486407.0,
|
||
|
|
"step": 100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1452004179358481,
|
||
|
|
"epoch": 0.03232851933457131,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 6.9333333333333344e-06,
|
||
|
|
"loss": 1.1658,
|
||
|
|
"mean_token_accuracy": 0.6880020551383496,
|
||
|
|
"num_tokens": 7853929.0,
|
||
|
|
"step": 105
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.133518392033875,
|
||
|
|
"epoch": 0.03386797263621756,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 7.266666666666668e-06,
|
||
|
|
"loss": 1.1477,
|
||
|
|
"mean_token_accuracy": 0.691348098218441,
|
||
|
|
"num_tokens": 8224258.0,
|
||
|
|
"step": 110
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1419388929381966,
|
||
|
|
"epoch": 0.035407425937863814,
|
||
|
|
"grad_norm": 0.7734375,
|
||
|
|
"learning_rate": 7.600000000000001e-06,
|
||
|
|
"loss": 1.1499,
|
||
|
|
"mean_token_accuracy": 0.6935681894421577,
|
||
|
|
"num_tokens": 8601374.0,
|
||
|
|
"step": 115
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1601579703390599,
|
||
|
|
"epoch": 0.036946879239510066,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 7.933333333333334e-06,
|
||
|
|
"loss": 1.1652,
|
||
|
|
"mean_token_accuracy": 0.6893212374299764,
|
||
|
|
"num_tokens": 8976860.0,
|
||
|
|
"step": 120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1541021421551705,
|
||
|
|
"epoch": 0.03848633254115632,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 8.266666666666667e-06,
|
||
|
|
"loss": 1.1553,
|
||
|
|
"mean_token_accuracy": 0.6880058489739895,
|
||
|
|
"num_tokens": 9342172.0,
|
||
|
|
"step": 125
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1215011529624461,
|
||
|
|
"epoch": 0.04002578584280257,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 8.6e-06,
|
||
|
|
"loss": 1.11,
|
||
|
|
"mean_token_accuracy": 0.6971393920481205,
|
||
|
|
"num_tokens": 9711234.0,
|
||
|
|
"step": 130
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1288955546915531,
|
||
|
|
"epoch": 0.041565239144448825,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 8.933333333333333e-06,
|
||
|
|
"loss": 1.1331,
|
||
|
|
"mean_token_accuracy": 0.69485286436975,
|
||
|
|
"num_tokens": 10092041.0,
|
||
|
|
"step": 135
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1383998703211546,
|
||
|
|
"epoch": 0.04310469244609508,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 9.266666666666667e-06,
|
||
|
|
"loss": 1.1608,
|
||
|
|
"mean_token_accuracy": 0.6917846284806728,
|
||
|
|
"num_tokens": 10470367.0,
|
||
|
|
"step": 140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1720476493239402,
|
||
|
|
"epoch": 0.04464414574774133,
|
||
|
|
"grad_norm": 0.7890625,
|
||
|
|
"learning_rate": 9.600000000000001e-06,
|
||
|
|
"loss": 1.1643,
|
||
|
|
"mean_token_accuracy": 0.6900354858487845,
|
||
|
|
"num_tokens": 10840227.0,
|
||
|
|
"step": 145
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1642087884247303,
|
||
|
|
"epoch": 0.04618359904938758,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 9.933333333333334e-06,
|
||
|
|
"loss": 1.1662,
|
||
|
|
"mean_token_accuracy": 0.6894872546195984,
|
||
|
|
"num_tokens": 11212704.0,
|
||
|
|
"step": 150
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1504485111683607,
|
||
|
|
"epoch": 0.047723052351033836,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.0266666666666668e-05,
|
||
|
|
"loss": 1.1618,
|
||
|
|
"mean_token_accuracy": 0.6902470916509629,
|
||
|
|
"num_tokens": 11585050.0,
|
||
|
|
"step": 155
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.139546208642423,
|
||
|
|
"epoch": 0.04926250565268009,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.0600000000000002e-05,
|
||
|
|
"loss": 1.1371,
|
||
|
|
"mean_token_accuracy": 0.6940638959407807,
|
||
|
|
"num_tokens": 11955470.0,
|
||
|
|
"step": 160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1310970352962613,
|
||
|
|
"epoch": 0.05080195895432634,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.0933333333333334e-05,
|
||
|
|
"loss": 1.1217,
|
||
|
|
"mean_token_accuracy": 0.697192519530654,
|
||
|
|
"num_tokens": 12326414.0,
|
||
|
|
"step": 165
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1263095822185278,
|
||
|
|
"epoch": 0.0523414122559726,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.1266666666666668e-05,
|
||
|
|
"loss": 1.1226,
|
||
|
|
"mean_token_accuracy": 0.695407111570239,
|
||
|
|
"num_tokens": 12699566.0,
|
||
|
|
"step": 170
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1608664955943824,
|
||
|
|
"epoch": 0.053880865557618854,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 1.16e-05,
|
||
|
|
"loss": 1.156,
|
||
|
|
"mean_token_accuracy": 0.6909525521099568,
|
||
|
|
"num_tokens": 13076955.0,
|
||
|
|
"step": 175
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1388528019189834,
|
||
|
|
"epoch": 0.05542031885926511,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.1933333333333335e-05,
|
||
|
|
"loss": 1.1475,
|
||
|
|
"mean_token_accuracy": 0.6935607939958572,
|
||
|
|
"num_tokens": 13457841.0,
|
||
|
|
"step": 180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1540386551991104,
|
||
|
|
"epoch": 0.05695977216091136,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.2266666666666667e-05,
|
||
|
|
"loss": 1.1501,
|
||
|
|
"mean_token_accuracy": 0.690580427646637,
|
||
|
|
"num_tokens": 13823331.0,
|
||
|
|
"step": 185
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1634995128959418,
|
||
|
|
"epoch": 0.05849922546255761,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.2600000000000001e-05,
|
||
|
|
"loss": 1.1689,
|
||
|
|
"mean_token_accuracy": 0.6883407317101955,
|
||
|
|
"num_tokens": 14189829.0,
|
||
|
|
"step": 190
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1286564406007529,
|
||
|
|
"epoch": 0.060038678764203865,
|
||
|
|
"grad_norm": 0.68359375,
|
||
|
|
"learning_rate": 1.2933333333333334e-05,
|
||
|
|
"loss": 1.1091,
|
||
|
|
"mean_token_accuracy": 0.6968111153692007,
|
||
|
|
"num_tokens": 14568687.0,
|
||
|
|
"step": 195
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0947596225887537,
|
||
|
|
"epoch": 0.06157813206585012,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.3266666666666668e-05,
|
||
|
|
"loss": 1.0865,
|
||
|
|
"mean_token_accuracy": 0.7018399801105261,
|
||
|
|
"num_tokens": 14956883.0,
|
||
|
|
"step": 200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.105372793599963,
|
||
|
|
"epoch": 0.06311758536749637,
|
||
|
|
"grad_norm": 0.76171875,
|
||
|
|
"learning_rate": 1.3600000000000002e-05,
|
||
|
|
"loss": 1.098,
|
||
|
|
"mean_token_accuracy": 0.7011617802083492,
|
||
|
|
"num_tokens": 15329120.0,
|
||
|
|
"step": 205
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1237883031368257,
|
||
|
|
"epoch": 0.06465703866914262,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.3933333333333334e-05,
|
||
|
|
"loss": 1.1159,
|
||
|
|
"mean_token_accuracy": 0.6975264508277178,
|
||
|
|
"num_tokens": 15706521.0,
|
||
|
|
"step": 210
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1330916548147798,
|
||
|
|
"epoch": 0.06619649197078888,
|
||
|
|
"grad_norm": 0.76953125,
|
||
|
|
"learning_rate": 1.4266666666666668e-05,
|
||
|
|
"loss": 1.1323,
|
||
|
|
"mean_token_accuracy": 0.6972741197794676,
|
||
|
|
"num_tokens": 16066978.0,
|
||
|
|
"step": 215
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1772997351363301,
|
||
|
|
"epoch": 0.06773594527243512,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 1.46e-05,
|
||
|
|
"loss": 1.1734,
|
||
|
|
"mean_token_accuracy": 0.6860150098800659,
|
||
|
|
"num_tokens": 16449339.0,
|
||
|
|
"step": 220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.158057621307671,
|
||
|
|
"epoch": 0.06927539857408138,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.4933333333333335e-05,
|
||
|
|
"loss": 1.1629,
|
||
|
|
"mean_token_accuracy": 0.6880886014550924,
|
||
|
|
"num_tokens": 16831396.0,
|
||
|
|
"step": 225
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.139371989108622,
|
||
|
|
"epoch": 0.07081485187572763,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 1.5266666666666667e-05,
|
||
|
|
"loss": 1.1223,
|
||
|
|
"mean_token_accuracy": 0.6936335910111666,
|
||
|
|
"num_tokens": 17210779.0,
|
||
|
|
"step": 230
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1907519888132811,
|
||
|
|
"epoch": 0.07235430517737389,
|
||
|
|
"grad_norm": 0.78515625,
|
||
|
|
"learning_rate": 1.5600000000000003e-05,
|
||
|
|
"loss": 1.187,
|
||
|
|
"mean_token_accuracy": 0.6834761939942837,
|
||
|
|
"num_tokens": 17582881.0,
|
||
|
|
"step": 235
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1354382883757352,
|
||
|
|
"epoch": 0.07389375847902013,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 1.5933333333333336e-05,
|
||
|
|
"loss": 1.1418,
|
||
|
|
"mean_token_accuracy": 0.6936424177139997,
|
||
|
|
"num_tokens": 17952831.0,
|
||
|
|
"step": 240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.131275094114244,
|
||
|
|
"epoch": 0.07543321178066639,
|
||
|
|
"grad_norm": 0.68359375,
|
||
|
|
"learning_rate": 1.6266666666666668e-05,
|
||
|
|
"loss": 1.1324,
|
||
|
|
"mean_token_accuracy": 0.6951741587370635,
|
||
|
|
"num_tokens": 18341435.0,
|
||
|
|
"step": 245
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1359387850388885,
|
||
|
|
"epoch": 0.07697266508231264,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.66e-05,
|
||
|
|
"loss": 1.1273,
|
||
|
|
"mean_token_accuracy": 0.6938830468803644,
|
||
|
|
"num_tokens": 18710959.0,
|
||
|
|
"step": 250
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1200769424438477,
|
||
|
|
"epoch": 0.0785121183839589,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 1.6933333333333336e-05,
|
||
|
|
"loss": 1.1116,
|
||
|
|
"mean_token_accuracy": 0.698444551974535,
|
||
|
|
"num_tokens": 19077026.0,
|
||
|
|
"step": 255
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.144037862494588,
|
||
|
|
"epoch": 0.08005157168560514,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 1.726666666666667e-05,
|
||
|
|
"loss": 1.1399,
|
||
|
|
"mean_token_accuracy": 0.694709181971848,
|
||
|
|
"num_tokens": 19433930.0,
|
||
|
|
"step": 260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1314732745289802,
|
||
|
|
"epoch": 0.0815910249872514,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 1.76e-05,
|
||
|
|
"loss": 1.1265,
|
||
|
|
"mean_token_accuracy": 0.6972466479986906,
|
||
|
|
"num_tokens": 19801472.0,
|
||
|
|
"step": 265
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1006763726472855,
|
||
|
|
"epoch": 0.08313047828889765,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.7933333333333333e-05,
|
||
|
|
"loss": 1.0907,
|
||
|
|
"mean_token_accuracy": 0.7027702957391739,
|
||
|
|
"num_tokens": 20178765.0,
|
||
|
|
"step": 270
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1250910840928554,
|
||
|
|
"epoch": 0.08466993159054391,
|
||
|
|
"grad_norm": 0.6640625,
|
||
|
|
"learning_rate": 1.826666666666667e-05,
|
||
|
|
"loss": 1.1259,
|
||
|
|
"mean_token_accuracy": 0.6969286557286978,
|
||
|
|
"num_tokens": 20540840.0,
|
||
|
|
"step": 275
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1310079213231803,
|
||
|
|
"epoch": 0.08620938489219016,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.86e-05,
|
||
|
|
"loss": 1.1182,
|
||
|
|
"mean_token_accuracy": 0.6943910989910365,
|
||
|
|
"num_tokens": 20917703.0,
|
||
|
|
"step": 280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1366374537348747,
|
||
|
|
"epoch": 0.08774883819383641,
|
||
|
|
"grad_norm": 0.76953125,
|
||
|
|
"learning_rate": 1.8933333333333334e-05,
|
||
|
|
"loss": 1.1538,
|
||
|
|
"mean_token_accuracy": 0.692281323671341,
|
||
|
|
"num_tokens": 21286716.0,
|
||
|
|
"step": 285
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1471243999898433,
|
||
|
|
"epoch": 0.08928829149548266,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.926666666666667e-05,
|
||
|
|
"loss": 1.1422,
|
||
|
|
"mean_token_accuracy": 0.6914283595979214,
|
||
|
|
"num_tokens": 21672957.0,
|
||
|
|
"step": 290
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0941655661910772,
|
||
|
|
"epoch": 0.09082774479712892,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.9600000000000002e-05,
|
||
|
|
"loss": 1.0918,
|
||
|
|
"mean_token_accuracy": 0.703205331414938,
|
||
|
|
"num_tokens": 22057533.0,
|
||
|
|
"step": 295
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1071835961192846,
|
||
|
|
"epoch": 0.09236719809877517,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.9933333333333334e-05,
|
||
|
|
"loss": 1.1111,
|
||
|
|
"mean_token_accuracy": 0.6998405870050192,
|
||
|
|
"num_tokens": 22435546.0,
|
||
|
|
"step": 300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1055552622303366,
|
||
|
|
"epoch": 0.09390665140042143,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.9999991608372392e-05,
|
||
|
|
"loss": 1.0997,
|
||
|
|
"mean_token_accuracy": 0.7011382140219211,
|
||
|
|
"num_tokens": 22797277.0,
|
||
|
|
"step": 305
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1513552486896514,
|
||
|
|
"epoch": 0.09544610470206767,
|
||
|
|
"grad_norm": 0.76953125,
|
||
|
|
"learning_rate": 1.9999957517409375e-05,
|
||
|
|
"loss": 1.1525,
|
||
|
|
"mean_token_accuracy": 0.6906207267194986,
|
||
|
|
"num_tokens": 23157199.0,
|
||
|
|
"step": 310
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1360066479071975,
|
||
|
|
"epoch": 0.09698555800371393,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.9999897202723546e-05,
|
||
|
|
"loss": 1.1269,
|
||
|
|
"mean_token_accuracy": 0.6963287502527237,
|
||
|
|
"num_tokens": 23542710.0,
|
||
|
|
"step": 315
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1110562330111862,
|
||
|
|
"epoch": 0.09852501130536018,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.999981066447308e-05,
|
||
|
|
"loss": 1.103,
|
||
|
|
"mean_token_accuracy": 0.700805151462555,
|
||
|
|
"num_tokens": 23929848.0,
|
||
|
|
"step": 320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0776942696422338,
|
||
|
|
"epoch": 0.10006446460700644,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.999969790288491e-05,
|
||
|
|
"loss": 1.0754,
|
||
|
|
"mean_token_accuracy": 0.706406794860959,
|
||
|
|
"num_tokens": 24320781.0,
|
||
|
|
"step": 325
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1285138919949531,
|
||
|
|
"epoch": 0.10160391790865268,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 1.9999558918254746e-05,
|
||
|
|
"loss": 1.1159,
|
||
|
|
"mean_token_accuracy": 0.6957792080938816,
|
||
|
|
"num_tokens": 24718182.0,
|
||
|
|
"step": 330
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1143408741801977,
|
||
|
|
"epoch": 0.10314337121029894,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.999939371094705e-05,
|
||
|
|
"loss": 1.1132,
|
||
|
|
"mean_token_accuracy": 0.6973476313054562,
|
||
|
|
"num_tokens": 25078136.0,
|
||
|
|
"step": 335
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1544642113149166,
|
||
|
|
"epoch": 0.1046828245119452,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.9999202281395064e-05,
|
||
|
|
"loss": 1.1505,
|
||
|
|
"mean_token_accuracy": 0.6898461397737264,
|
||
|
|
"num_tokens": 25462544.0,
|
||
|
|
"step": 340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.110057471320033,
|
||
|
|
"epoch": 0.10622227781359145,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.999898463010079e-05,
|
||
|
|
"loss": 1.1093,
|
||
|
|
"mean_token_accuracy": 0.696648533269763,
|
||
|
|
"num_tokens": 25832507.0,
|
||
|
|
"step": 345
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.121138433739543,
|
||
|
|
"epoch": 0.10776173111523771,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 1.9998740757634998e-05,
|
||
|
|
"loss": 1.1206,
|
||
|
|
"mean_token_accuracy": 0.695626575127244,
|
||
|
|
"num_tokens": 26208168.0,
|
||
|
|
"step": 350
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1249326327815652,
|
||
|
|
"epoch": 0.10930118441688395,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.9998470664637205e-05,
|
||
|
|
"loss": 1.1066,
|
||
|
|
"mean_token_accuracy": 0.6976452205330134,
|
||
|
|
"num_tokens": 26567141.0,
|
||
|
|
"step": 355
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1190939696505666,
|
||
|
|
"epoch": 0.11084063771853021,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.9998174351815704e-05,
|
||
|
|
"loss": 1.109,
|
||
|
|
"mean_token_accuracy": 0.696621885150671,
|
||
|
|
"num_tokens": 26946409.0,
|
||
|
|
"step": 360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.097430343925953,
|
||
|
|
"epoch": 0.11238009102017646,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.9997851819947537e-05,
|
||
|
|
"loss": 1.0981,
|
||
|
|
"mean_token_accuracy": 0.6984185025095939,
|
||
|
|
"num_tokens": 27323310.0,
|
||
|
|
"step": 365
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1255185015499591,
|
||
|
|
"epoch": 0.11391954432182272,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.9997503069878515e-05,
|
||
|
|
"loss": 1.1021,
|
||
|
|
"mean_token_accuracy": 0.6977558217942714,
|
||
|
|
"num_tokens": 27728681.0,
|
||
|
|
"step": 370
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1182758403941988,
|
||
|
|
"epoch": 0.11545899762346896,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 1.9997128102523186e-05,
|
||
|
|
"loss": 1.1144,
|
||
|
|
"mean_token_accuracy": 0.6975483104586602,
|
||
|
|
"num_tokens": 28099689.0,
|
||
|
|
"step": 375
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0848099140450358,
|
||
|
|
"epoch": 0.11699845092511522,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.9996726918864857e-05,
|
||
|
|
"loss": 1.0807,
|
||
|
|
"mean_token_accuracy": 0.7057063952088356,
|
||
|
|
"num_tokens": 28470608.0,
|
||
|
|
"step": 380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.147358151897788,
|
||
|
|
"epoch": 0.11853790422676147,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 1.999629951995559e-05,
|
||
|
|
"loss": 1.1361,
|
||
|
|
"mean_token_accuracy": 0.6940991956740618,
|
||
|
|
"num_tokens": 28850518.0,
|
||
|
|
"step": 385
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.158296991325915,
|
||
|
|
"epoch": 0.12007735752840773,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.999584590691619e-05,
|
||
|
|
"loss": 1.1613,
|
||
|
|
"mean_token_accuracy": 0.6874197501689195,
|
||
|
|
"num_tokens": 29223644.0,
|
||
|
|
"step": 390
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1296958446502685,
|
||
|
|
"epoch": 0.12161681083005398,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.9995366080936206e-05,
|
||
|
|
"loss": 1.1062,
|
||
|
|
"mean_token_accuracy": 0.6964040424674749,
|
||
|
|
"num_tokens": 29597922.0,
|
||
|
|
"step": 395
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1090093098580838,
|
||
|
|
"epoch": 0.12315626413170024,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.9994860043273915e-05,
|
||
|
|
"loss": 1.1119,
|
||
|
|
"mean_token_accuracy": 0.6979490287601948,
|
||
|
|
"num_tokens": 29967597.0,
|
||
|
|
"step": 400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1302901729941368,
|
||
|
|
"epoch": 0.12469571743334648,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.999432779525635e-05,
|
||
|
|
"loss": 1.113,
|
||
|
|
"mean_token_accuracy": 0.6980737678706646,
|
||
|
|
"num_tokens": 30351751.0,
|
||
|
|
"step": 405
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0851911935955285,
|
||
|
|
"epoch": 0.12623517073499274,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.999376933827927e-05,
|
||
|
|
"loss": 1.0852,
|
||
|
|
"mean_token_accuracy": 0.7041132722049952,
|
||
|
|
"num_tokens": 30718524.0,
|
||
|
|
"step": 410
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.092500716075301,
|
||
|
|
"epoch": 0.127774624036639,
|
||
|
|
"grad_norm": 0.68359375,
|
||
|
|
"learning_rate": 1.999318467380716e-05,
|
||
|
|
"loss": 1.0757,
|
||
|
|
"mean_token_accuracy": 0.7052585650235415,
|
||
|
|
"num_tokens": 31099388.0,
|
||
|
|
"step": 415
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1496953256428242,
|
||
|
|
"epoch": 0.12931407733828523,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.9992573803373242e-05,
|
||
|
|
"loss": 1.1516,
|
||
|
|
"mean_token_accuracy": 0.6907676491886378,
|
||
|
|
"num_tokens": 31461359.0,
|
||
|
|
"step": 420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1136517949402331,
|
||
|
|
"epoch": 0.1308535306399315,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.9991936728579438e-05,
|
||
|
|
"loss": 1.1098,
|
||
|
|
"mean_token_accuracy": 0.6990172352641821,
|
||
|
|
"num_tokens": 31837580.0,
|
||
|
|
"step": 425
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1240890389308333,
|
||
|
|
"epoch": 0.13239298394157775,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.9991273451096414e-05,
|
||
|
|
"loss": 1.1144,
|
||
|
|
"mean_token_accuracy": 0.6938084073364734,
|
||
|
|
"num_tokens": 32219381.0,
|
||
|
|
"step": 430
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1162253782153129,
|
||
|
|
"epoch": 0.133932437243224,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 1.9990583972663534e-05,
|
||
|
|
"loss": 1.107,
|
||
|
|
"mean_token_accuracy": 0.6976239930838346,
|
||
|
|
"num_tokens": 32600761.0,
|
||
|
|
"step": 435
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1294534251093864,
|
||
|
|
"epoch": 0.13547189054487024,
|
||
|
|
"grad_norm": 0.78515625,
|
||
|
|
"learning_rate": 1.9989868295088876e-05,
|
||
|
|
"loss": 1.1381,
|
||
|
|
"mean_token_accuracy": 0.6945139471441507,
|
||
|
|
"num_tokens": 32967708.0,
|
||
|
|
"step": 440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1337316358461975,
|
||
|
|
"epoch": 0.1370113438465165,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.998912642024922e-05,
|
||
|
|
"loss": 1.1376,
|
||
|
|
"mean_token_accuracy": 0.6949200943112374,
|
||
|
|
"num_tokens": 33348622.0,
|
||
|
|
"step": 445
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1307091983035207,
|
||
|
|
"epoch": 0.13855079714816276,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.9988358350090045e-05,
|
||
|
|
"loss": 1.1169,
|
||
|
|
"mean_token_accuracy": 0.6963778145611286,
|
||
|
|
"num_tokens": 33718264.0,
|
||
|
|
"step": 450
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1685293976217508,
|
||
|
|
"epoch": 0.14009025044980902,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.998756408662553e-05,
|
||
|
|
"loss": 1.1656,
|
||
|
|
"mean_token_accuracy": 0.6891588238999248,
|
||
|
|
"num_tokens": 34095351.0,
|
||
|
|
"step": 455
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1300161950290204,
|
||
|
|
"epoch": 0.14162970375145525,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.9986743631938536e-05,
|
||
|
|
"loss": 1.1278,
|
||
|
|
"mean_token_accuracy": 0.6970746215432883,
|
||
|
|
"num_tokens": 34470308.0,
|
||
|
|
"step": 460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1416201300919055,
|
||
|
|
"epoch": 0.14316915705310151,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.9985896988180607e-05,
|
||
|
|
"loss": 1.1224,
|
||
|
|
"mean_token_accuracy": 0.6962168168276548,
|
||
|
|
"num_tokens": 34842571.0,
|
||
|
|
"step": 465
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1438201934099197,
|
||
|
|
"epoch": 0.14470861035474777,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 1.9985024157571972e-05,
|
||
|
|
"loss": 1.146,
|
||
|
|
"mean_token_accuracy": 0.6919929884374142,
|
||
|
|
"num_tokens": 35212666.0,
|
||
|
|
"step": 470
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1576870299875737,
|
||
|
|
"epoch": 0.14624806365639403,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.998412514240152e-05,
|
||
|
|
"loss": 1.1606,
|
||
|
|
"mean_token_accuracy": 0.692124840989709,
|
||
|
|
"num_tokens": 35593532.0,
|
||
|
|
"step": 475
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1232300328090787,
|
||
|
|
"epoch": 0.14778751695804027,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.9983199945026822e-05,
|
||
|
|
"loss": 1.1198,
|
||
|
|
"mean_token_accuracy": 0.6935272339731455,
|
||
|
|
"num_tokens": 35980581.0,
|
||
|
|
"step": 480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1406380519270898,
|
||
|
|
"epoch": 0.14932697025968653,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.9982248567874098e-05,
|
||
|
|
"loss": 1.1303,
|
||
|
|
"mean_token_accuracy": 0.6920850377529859,
|
||
|
|
"num_tokens": 36366818.0,
|
||
|
|
"step": 485
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1526461832225323,
|
||
|
|
"epoch": 0.15086642356133279,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.998127101343822e-05,
|
||
|
|
"loss": 1.1452,
|
||
|
|
"mean_token_accuracy": 0.6928542651236057,
|
||
|
|
"num_tokens": 36739879.0,
|
||
|
|
"step": 490
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.127664201334119,
|
||
|
|
"epoch": 0.15240587686297905,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.9980267284282718e-05,
|
||
|
|
"loss": 1.1309,
|
||
|
|
"mean_token_accuracy": 0.6948033161461353,
|
||
|
|
"num_tokens": 37126967.0,
|
||
|
|
"step": 495
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1573752466589213,
|
||
|
|
"epoch": 0.15394533016462528,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 1.9979237383039745e-05,
|
||
|
|
"loss": 1.1486,
|
||
|
|
"mean_token_accuracy": 0.6922336863353848,
|
||
|
|
"num_tokens": 37491480.0,
|
||
|
|
"step": 500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1195718679577111,
|
||
|
|
"epoch": 0.15548478346627154,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.9978181312410104e-05,
|
||
|
|
"loss": 1.1097,
|
||
|
|
"mean_token_accuracy": 0.6958762314170599,
|
||
|
|
"num_tokens": 37855648.0,
|
||
|
|
"step": 505
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1157226022332907,
|
||
|
|
"epoch": 0.1570242367679178,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.9977099075163216e-05,
|
||
|
|
"loss": 1.1044,
|
||
|
|
"mean_token_accuracy": 0.6988037750124931,
|
||
|
|
"num_tokens": 38239757.0,
|
||
|
|
"step": 510
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1437922086566688,
|
||
|
|
"epoch": 0.15856369006956406,
|
||
|
|
"grad_norm": 0.66796875,
|
||
|
|
"learning_rate": 1.997599067413712e-05,
|
||
|
|
"loss": 1.1402,
|
||
|
|
"mean_token_accuracy": 0.6914523551240563,
|
||
|
|
"num_tokens": 38626774.0,
|
||
|
|
"step": 515
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1398277616128325,
|
||
|
|
"epoch": 0.1601031433712103,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 1.997485611223847e-05,
|
||
|
|
"loss": 1.1292,
|
||
|
|
"mean_token_accuracy": 0.6958260778337717,
|
||
|
|
"num_tokens": 38999361.0,
|
||
|
|
"step": 520
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1146018091589212,
|
||
|
|
"epoch": 0.16164259667285655,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 1.997369539244252e-05,
|
||
|
|
"loss": 1.1124,
|
||
|
|
"mean_token_accuracy": 0.7005707703530788,
|
||
|
|
"num_tokens": 39381117.0,
|
||
|
|
"step": 525
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1075803402811288,
|
||
|
|
"epoch": 0.1631820499745028,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.9972508517793125e-05,
|
||
|
|
"loss": 1.1011,
|
||
|
|
"mean_token_accuracy": 0.6986994445323944,
|
||
|
|
"num_tokens": 39748243.0,
|
||
|
|
"step": 530
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1309567619115115,
|
||
|
|
"epoch": 0.16472150327614907,
|
||
|
|
"grad_norm": 0.796875,
|
||
|
|
"learning_rate": 1.9971295491402725e-05,
|
||
|
|
"loss": 1.1364,
|
||
|
|
"mean_token_accuracy": 0.6940356496721506,
|
||
|
|
"num_tokens": 40115293.0,
|
||
|
|
"step": 535
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.18396236859262,
|
||
|
|
"epoch": 0.1662609565777953,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.997005631645234e-05,
|
||
|
|
"loss": 1.1725,
|
||
|
|
"mean_token_accuracy": 0.686182476207614,
|
||
|
|
"num_tokens": 40508440.0,
|
||
|
|
"step": 540
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1049391619861126,
|
||
|
|
"epoch": 0.16780040987944156,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.996879099619156e-05,
|
||
|
|
"loss": 1.1144,
|
||
|
|
"mean_token_accuracy": 0.696911821886897,
|
||
|
|
"num_tokens": 40896598.0,
|
||
|
|
"step": 545
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1429337464272975,
|
||
|
|
"epoch": 0.16933986318108782,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.9967499533938544e-05,
|
||
|
|
"loss": 1.136,
|
||
|
|
"mean_token_accuracy": 0.6921508580446243,
|
||
|
|
"num_tokens": 41271458.0,
|
||
|
|
"step": 550
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1443469554185868,
|
||
|
|
"epoch": 0.17087931648273408,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.996618193308e-05,
|
||
|
|
"loss": 1.133,
|
||
|
|
"mean_token_accuracy": 0.6909565668553114,
|
||
|
|
"num_tokens": 41652091.0,
|
||
|
|
"step": 555
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1591787867248058,
|
||
|
|
"epoch": 0.1724187697843803,
|
||
|
|
"grad_norm": 0.6875,
|
||
|
|
"learning_rate": 1.9964838197071173e-05,
|
||
|
|
"loss": 1.1434,
|
||
|
|
"mean_token_accuracy": 0.6915002010762692,
|
||
|
|
"num_tokens": 42027815.0,
|
||
|
|
"step": 560
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1327795442193747,
|
||
|
|
"epoch": 0.17395822308602657,
|
||
|
|
"grad_norm": 0.796875,
|
||
|
|
"learning_rate": 1.9963468329435872e-05,
|
||
|
|
"loss": 1.1364,
|
||
|
|
"mean_token_accuracy": 0.6924004014581442,
|
||
|
|
"num_tokens": 42390261.0,
|
||
|
|
"step": 565
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1397675037384034,
|
||
|
|
"epoch": 0.17549767638767283,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.99620723337664e-05,
|
||
|
|
"loss": 1.1406,
|
||
|
|
"mean_token_accuracy": 0.6912539415061474,
|
||
|
|
"num_tokens": 42759613.0,
|
||
|
|
"step": 570
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.107204508036375,
|
||
|
|
"epoch": 0.1770371296893191,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.9960650213723604e-05,
|
||
|
|
"loss": 1.0852,
|
||
|
|
"mean_token_accuracy": 0.6994996588677168,
|
||
|
|
"num_tokens": 43132014.0,
|
||
|
|
"step": 575
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.099429708532989,
|
||
|
|
"epoch": 0.17857658299096532,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.9959201973036816e-05,
|
||
|
|
"loss": 1.1041,
|
||
|
|
"mean_token_accuracy": 0.7006071075797081,
|
||
|
|
"num_tokens": 43518177.0,
|
||
|
|
"step": 580
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1445161992684008,
|
||
|
|
"epoch": 0.18011603629261158,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.995772761550389e-05,
|
||
|
|
"loss": 1.1382,
|
||
|
|
"mean_token_accuracy": 0.6925386656075716,
|
||
|
|
"num_tokens": 43894430.0,
|
||
|
|
"step": 585
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1534817535430193,
|
||
|
|
"epoch": 0.18165548959425784,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 1.995622714499115e-05,
|
||
|
|
"loss": 1.1493,
|
||
|
|
"mean_token_accuracy": 0.6913147930055856,
|
||
|
|
"num_tokens": 44258015.0,
|
||
|
|
"step": 590
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1478193078190089,
|
||
|
|
"epoch": 0.1831949428959041,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.9954700565433406e-05,
|
||
|
|
"loss": 1.1502,
|
||
|
|
"mean_token_accuracy": 0.6935486130416393,
|
||
|
|
"num_tokens": 44636368.0,
|
||
|
|
"step": 595
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1420258667320013,
|
||
|
|
"epoch": 0.18473439619755033,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 1.9953147880833935e-05,
|
||
|
|
"loss": 1.1395,
|
||
|
|
"mean_token_accuracy": 0.693219494074583,
|
||
|
|
"num_tokens": 45009190.0,
|
||
|
|
"step": 600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1204937249422073,
|
||
|
|
"epoch": 0.1862738494991966,
|
||
|
|
"grad_norm": 0.76953125,
|
||
|
|
"learning_rate": 1.9951569095264473e-05,
|
||
|
|
"loss": 1.1237,
|
||
|
|
"mean_token_accuracy": 0.6966589823365211,
|
||
|
|
"num_tokens": 45369198.0,
|
||
|
|
"step": 605
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1316735215485096,
|
||
|
|
"epoch": 0.18781330280084285,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 1.99499642128652e-05,
|
||
|
|
"loss": 1.1151,
|
||
|
|
"mean_token_accuracy": 0.6951681729406118,
|
||
|
|
"num_tokens": 45735650.0,
|
||
|
|
"step": 610
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.119157313928008,
|
||
|
|
"epoch": 0.1893527561024891,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.994833323784473e-05,
|
||
|
|
"loss": 1.1205,
|
||
|
|
"mean_token_accuracy": 0.6974445167928934,
|
||
|
|
"num_tokens": 46105045.0,
|
||
|
|
"step": 615
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1227743715047835,
|
||
|
|
"epoch": 0.19089220940413534,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.9946676174480115e-05,
|
||
|
|
"loss": 1.1122,
|
||
|
|
"mean_token_accuracy": 0.6958862528204918,
|
||
|
|
"num_tokens": 46468345.0,
|
||
|
|
"step": 620
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.123009406030178,
|
||
|
|
"epoch": 0.1924316627057816,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.9944993027116798e-05,
|
||
|
|
"loss": 1.1064,
|
||
|
|
"mean_token_accuracy": 0.6993745014071464,
|
||
|
|
"num_tokens": 46839653.0,
|
||
|
|
"step": 625
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.13520105779171,
|
||
|
|
"epoch": 0.19397111600742786,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.9943283800168643e-05,
|
||
|
|
"loss": 1.1432,
|
||
|
|
"mean_token_accuracy": 0.69097990244627,
|
||
|
|
"num_tokens": 47218180.0,
|
||
|
|
"step": 630
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1393942264840007,
|
||
|
|
"epoch": 0.19551056930907412,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 1.9941548498117894e-05,
|
||
|
|
"loss": 1.1382,
|
||
|
|
"mean_token_accuracy": 0.6938273806124926,
|
||
|
|
"num_tokens": 47595740.0,
|
||
|
|
"step": 635
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1325588449835777,
|
||
|
|
"epoch": 0.19705002261072035,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.9939787125515188e-05,
|
||
|
|
"loss": 1.1298,
|
||
|
|
"mean_token_accuracy": 0.6938525449484587,
|
||
|
|
"num_tokens": 47982358.0,
|
||
|
|
"step": 640
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.121693492308259,
|
||
|
|
"epoch": 0.19858947591236661,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 1.993799968697951e-05,
|
||
|
|
"loss": 1.1191,
|
||
|
|
"mean_token_accuracy": 0.6956870190799236,
|
||
|
|
"num_tokens": 48372670.0,
|
||
|
|
"step": 645
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1251621477305889,
|
||
|
|
"epoch": 0.20012892921401287,
|
||
|
|
"grad_norm": 0.76953125,
|
||
|
|
"learning_rate": 1.9936186187198214e-05,
|
||
|
|
"loss": 1.1236,
|
||
|
|
"mean_token_accuracy": 0.6986733213067055,
|
||
|
|
"num_tokens": 48737613.0,
|
||
|
|
"step": 650
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.139292366988957,
|
||
|
|
"epoch": 0.20166838251565913,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.9934346630926988e-05,
|
||
|
|
"loss": 1.1304,
|
||
|
|
"mean_token_accuracy": 0.6938830778002739,
|
||
|
|
"num_tokens": 49100209.0,
|
||
|
|
"step": 655
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1345834810286761,
|
||
|
|
"epoch": 0.20320783581730537,
|
||
|
|
"grad_norm": 0.66796875,
|
||
|
|
"learning_rate": 1.9932481022989857e-05,
|
||
|
|
"loss": 1.1181,
|
||
|
|
"mean_token_accuracy": 0.6951233502477407,
|
||
|
|
"num_tokens": 49467553.0,
|
||
|
|
"step": 660
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.094562499411404,
|
||
|
|
"epoch": 0.20474728911895163,
|
||
|
|
"grad_norm": 0.76171875,
|
||
|
|
"learning_rate": 1.993058936827916e-05,
|
||
|
|
"loss": 1.0977,
|
||
|
|
"mean_token_accuracy": 0.7043172724545002,
|
||
|
|
"num_tokens": 49849811.0,
|
||
|
|
"step": 665
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.139369383826852,
|
||
|
|
"epoch": 0.20628674242059789,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.992867167175554e-05,
|
||
|
|
"loss": 1.1425,
|
||
|
|
"mean_token_accuracy": 0.6948151815682649,
|
||
|
|
"num_tokens": 50225933.0,
|
||
|
|
"step": 670
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.079656113870442,
|
||
|
|
"epoch": 0.20782619572224414,
|
||
|
|
"grad_norm": 0.6875,
|
||
|
|
"learning_rate": 1.9926727938447935e-05,
|
||
|
|
"loss": 1.0692,
|
||
|
|
"mean_token_accuracy": 0.7051354993134737,
|
||
|
|
"num_tokens": 50610063.0,
|
||
|
|
"step": 675
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1766547793522477,
|
||
|
|
"epoch": 0.2093656490238904,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.9924758173453555e-05,
|
||
|
|
"loss": 1.1785,
|
||
|
|
"mean_token_accuracy": 0.6878008231520653,
|
||
|
|
"num_tokens": 50990235.0,
|
||
|
|
"step": 680
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0988596007227898,
|
||
|
|
"epoch": 0.21090510232553664,
|
||
|
|
"grad_norm": 0.671875,
|
||
|
|
"learning_rate": 1.992276238193788e-05,
|
||
|
|
"loss": 1.0932,
|
||
|
|
"mean_token_accuracy": 0.7026484467089176,
|
||
|
|
"num_tokens": 51363981.0,
|
||
|
|
"step": 685
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1409345027059317,
|
||
|
|
"epoch": 0.2124445556271829,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 1.992074056913464e-05,
|
||
|
|
"loss": 1.1352,
|
||
|
|
"mean_token_accuracy": 0.6939107369631529,
|
||
|
|
"num_tokens": 51737796.0,
|
||
|
|
"step": 690
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.120890161767602,
|
||
|
|
"epoch": 0.21398400892882916,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.9918692740345804e-05,
|
||
|
|
"loss": 1.1338,
|
||
|
|
"mean_token_accuracy": 0.6986452504992485,
|
||
|
|
"num_tokens": 52114356.0,
|
||
|
|
"step": 695
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.119481140933931,
|
||
|
|
"epoch": 0.21552346223047542,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.9916618900941567e-05,
|
||
|
|
"loss": 1.1131,
|
||
|
|
"mean_token_accuracy": 0.6989668853580951,
|
||
|
|
"num_tokens": 52484836.0,
|
||
|
|
"step": 700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0964285958558322,
|
||
|
|
"epoch": 0.21706291553212165,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.991451905636033e-05,
|
||
|
|
"loss": 1.0937,
|
||
|
|
"mean_token_accuracy": 0.7034055396914483,
|
||
|
|
"num_tokens": 52859792.0,
|
||
|
|
"step": 705
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1160279937088489,
|
||
|
|
"epoch": 0.2186023688337679,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 1.9912393212108692e-05,
|
||
|
|
"loss": 1.1109,
|
||
|
|
"mean_token_accuracy": 0.6976350143551826,
|
||
|
|
"num_tokens": 53212860.0,
|
||
|
|
"step": 710
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.14042426943779,
|
||
|
|
"epoch": 0.22014182213541417,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.9910241373761426e-05,
|
||
|
|
"loss": 1.1385,
|
||
|
|
"mean_token_accuracy": 0.694380571320653,
|
||
|
|
"num_tokens": 53583748.0,
|
||
|
|
"step": 715
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1466562129557132,
|
||
|
|
"epoch": 0.22168127543706043,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.9908063546961482e-05,
|
||
|
|
"loss": 1.1338,
|
||
|
|
"mean_token_accuracy": 0.6904741197824478,
|
||
|
|
"num_tokens": 53940694.0,
|
||
|
|
"step": 720
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.121897478029132,
|
||
|
|
"epoch": 0.22322072873870666,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.990585973741996e-05,
|
||
|
|
"loss": 1.1211,
|
||
|
|
"mean_token_accuracy": 0.6964031044393778,
|
||
|
|
"num_tokens": 54316660.0,
|
||
|
|
"step": 725
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1026945130899548,
|
||
|
|
"epoch": 0.22476018204035292,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.9903629950916083e-05,
|
||
|
|
"loss": 1.0919,
|
||
|
|
"mean_token_accuracy": 0.7022646889090538,
|
||
|
|
"num_tokens": 54700093.0,
|
||
|
|
"step": 730
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1913654580712318,
|
||
|
|
"epoch": 0.22629963534199918,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.9901374193297212e-05,
|
||
|
|
"loss": 1.1867,
|
||
|
|
"mean_token_accuracy": 0.6831524942070246,
|
||
|
|
"num_tokens": 55072259.0,
|
||
|
|
"step": 735
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0986135648563504,
|
||
|
|
"epoch": 0.22783908864364544,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.989909247047881e-05,
|
||
|
|
"loss": 1.0859,
|
||
|
|
"mean_token_accuracy": 0.70220061019063,
|
||
|
|
"num_tokens": 55431253.0,
|
||
|
|
"step": 740
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1104688480496407,
|
||
|
|
"epoch": 0.22937854194529167,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.989678478844443e-05,
|
||
|
|
"loss": 1.1053,
|
||
|
|
"mean_token_accuracy": 0.7009272977709771,
|
||
|
|
"num_tokens": 55806238.0,
|
||
|
|
"step": 745
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1378316521644591,
|
||
|
|
"epoch": 0.23091799524693793,
|
||
|
|
"grad_norm": 0.77734375,
|
||
|
|
"learning_rate": 1.9894451153245695e-05,
|
||
|
|
"loss": 1.1323,
|
||
|
|
"mean_token_accuracy": 0.6941636923700572,
|
||
|
|
"num_tokens": 56167420.0,
|
||
|
|
"step": 750
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0988559927791357,
|
||
|
|
"epoch": 0.2324574485485842,
|
||
|
|
"grad_norm": 0.6875,
|
||
|
|
"learning_rate": 1.9892091571002295e-05,
|
||
|
|
"loss": 1.1008,
|
||
|
|
"mean_token_accuracy": 0.7004305239766836,
|
||
|
|
"num_tokens": 56550823.0,
|
||
|
|
"step": 755
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1214569361880422,
|
||
|
|
"epoch": 0.23399690185023045,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 1.9889706047901956e-05,
|
||
|
|
"loss": 1.1044,
|
||
|
|
"mean_token_accuracy": 0.6996850349009037,
|
||
|
|
"num_tokens": 56920052.0,
|
||
|
|
"step": 760
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1102859888225793,
|
||
|
|
"epoch": 0.23553635515187668,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.9887294590200437e-05,
|
||
|
|
"loss": 1.11,
|
||
|
|
"mean_token_accuracy": 0.6958253476768732,
|
||
|
|
"num_tokens": 57288683.0,
|
||
|
|
"step": 765
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1473000289872288,
|
||
|
|
"epoch": 0.23707580845352294,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.9884857204221503e-05,
|
||
|
|
"loss": 1.1542,
|
||
|
|
"mean_token_accuracy": 0.6928766690194607,
|
||
|
|
"num_tokens": 57645195.0,
|
||
|
|
"step": 770
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1104052532464266,
|
||
|
|
"epoch": 0.2386152617551692,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 1.9882393896356915e-05,
|
||
|
|
"loss": 1.096,
|
||
|
|
"mean_token_accuracy": 0.6981043085455895,
|
||
|
|
"num_tokens": 58010298.0,
|
||
|
|
"step": 775
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1217896696180105,
|
||
|
|
"epoch": 0.24015471505681546,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.987990467306641e-05,
|
||
|
|
"loss": 1.1139,
|
||
|
|
"mean_token_accuracy": 0.6969779424369336,
|
||
|
|
"num_tokens": 58403545.0,
|
||
|
|
"step": 780
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1406789550557732,
|
||
|
|
"epoch": 0.2416941683584617,
|
||
|
|
"grad_norm": 0.640625,
|
||
|
|
"learning_rate": 1.9877389540877686e-05,
|
||
|
|
"loss": 1.1472,
|
||
|
|
"mean_token_accuracy": 0.6947149783372879,
|
||
|
|
"num_tokens": 58774798.0,
|
||
|
|
"step": 785
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.124403426796198,
|
||
|
|
"epoch": 0.24323362166010795,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.9874848506386392e-05,
|
||
|
|
"loss": 1.1214,
|
||
|
|
"mean_token_accuracy": 0.6990401953458786,
|
||
|
|
"num_tokens": 59159772.0,
|
||
|
|
"step": 790
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0997486164793373,
|
||
|
|
"epoch": 0.2447730749617542,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.9872281576256078e-05,
|
||
|
|
"loss": 1.0879,
|
||
|
|
"mean_token_accuracy": 0.7038913916796445,
|
||
|
|
"num_tokens": 59540395.0,
|
||
|
|
"step": 795
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1355868607759476,
|
||
|
|
"epoch": 0.24631252826340047,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 1.9869688757218233e-05,
|
||
|
|
"loss": 1.1415,
|
||
|
|
"mean_token_accuracy": 0.6912806447595358,
|
||
|
|
"num_tokens": 59905249.0,
|
||
|
|
"step": 800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1410336146131157,
|
||
|
|
"epoch": 0.2478519815650467,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.9867070056072215e-05,
|
||
|
|
"loss": 1.1433,
|
||
|
|
"mean_token_accuracy": 0.695595920830965,
|
||
|
|
"num_tokens": 60268255.0,
|
||
|
|
"step": 805
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1349990352988244,
|
||
|
|
"epoch": 0.24939143486669296,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.986442547968527e-05,
|
||
|
|
"loss": 1.1253,
|
||
|
|
"mean_token_accuracy": 0.6944803945720196,
|
||
|
|
"num_tokens": 60639389.0,
|
||
|
|
"step": 810
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.071821440383792,
|
||
|
|
"epoch": 0.2509308881683392,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 1.9861755034992483e-05,
|
||
|
|
"loss": 1.0666,
|
||
|
|
"mean_token_accuracy": 0.7084377076476812,
|
||
|
|
"num_tokens": 61024428.0,
|
||
|
|
"step": 815
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1051497608423233,
|
||
|
|
"epoch": 0.2524703414699855,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 1.9859058728996788e-05,
|
||
|
|
"loss": 1.0965,
|
||
|
|
"mean_token_accuracy": 0.7005310852080584,
|
||
|
|
"num_tokens": 61402658.0,
|
||
|
|
"step": 820
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1438620645552873,
|
||
|
|
"epoch": 0.2540097947716317,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.9856336568768936e-05,
|
||
|
|
"loss": 1.1399,
|
||
|
|
"mean_token_accuracy": 0.6912882044911385,
|
||
|
|
"num_tokens": 61780493.0,
|
||
|
|
"step": 825
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0913935292512178,
|
||
|
|
"epoch": 0.255549248073278,
|
||
|
|
"grad_norm": 0.76953125,
|
||
|
|
"learning_rate": 1.985358856144747e-05,
|
||
|
|
"loss": 1.0922,
|
||
|
|
"mean_token_accuracy": 0.7028463281691074,
|
||
|
|
"num_tokens": 62152861.0,
|
||
|
|
"step": 830
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1374814191833138,
|
||
|
|
"epoch": 0.25708870137492423,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 1.9850814714238718e-05,
|
||
|
|
"loss": 1.13,
|
||
|
|
"mean_token_accuracy": 0.6964493870735169,
|
||
|
|
"num_tokens": 62514124.0,
|
||
|
|
"step": 835
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1332073567435146,
|
||
|
|
"epoch": 0.25862815467657047,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 1.9848015034416776e-05,
|
||
|
|
"loss": 1.1199,
|
||
|
|
"mean_token_accuracy": 0.6939284823834896,
|
||
|
|
"num_tokens": 62901998.0,
|
||
|
|
"step": 840
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1137794975191355,
|
||
|
|
"epoch": 0.26016760797821675,
|
||
|
|
"grad_norm": 0.7734375,
|
||
|
|
"learning_rate": 1.9845189529323473e-05,
|
||
|
|
"loss": 1.103,
|
||
|
|
"mean_token_accuracy": 0.7006840953603387,
|
||
|
|
"num_tokens": 63266839.0,
|
||
|
|
"step": 845
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1099360350519418,
|
||
|
|
"epoch": 0.261707061279863,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.9842338206368375e-05,
|
||
|
|
"loss": 1.0998,
|
||
|
|
"mean_token_accuracy": 0.6972894985228777,
|
||
|
|
"num_tokens": 63654737.0,
|
||
|
|
"step": 850
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1284802999347447,
|
||
|
|
"epoch": 0.2632465145815092,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 1.9839461073028733e-05,
|
||
|
|
"loss": 1.1083,
|
||
|
|
"mean_token_accuracy": 0.6968803893774748,
|
||
|
|
"num_tokens": 64032094.0,
|
||
|
|
"step": 855
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0841836363077164,
|
||
|
|
"epoch": 0.2647859678831555,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 1.98365581368495e-05,
|
||
|
|
"loss": 1.0933,
|
||
|
|
"mean_token_accuracy": 0.7028985098004341,
|
||
|
|
"num_tokens": 64418973.0,
|
||
|
|
"step": 860
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1070842415094375,
|
||
|
|
"epoch": 0.26632542118480174,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.9833629405443283e-05,
|
||
|
|
"loss": 1.1091,
|
||
|
|
"mean_token_accuracy": 0.7023597385734319,
|
||
|
|
"num_tokens": 64798969.0,
|
||
|
|
"step": 865
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1159617979079486,
|
||
|
|
"epoch": 0.267864874486448,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.983067488649035e-05,
|
||
|
|
"loss": 1.1119,
|
||
|
|
"mean_token_accuracy": 0.6988450512290001,
|
||
|
|
"num_tokens": 65171715.0,
|
||
|
|
"step": 870
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1518226452171803,
|
||
|
|
"epoch": 0.26940432778809426,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 1.982769458773857e-05,
|
||
|
|
"loss": 1.1421,
|
||
|
|
"mean_token_accuracy": 0.6895007479935884,
|
||
|
|
"num_tokens": 65548454.0,
|
||
|
|
"step": 875
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1310207761824131,
|
||
|
|
"epoch": 0.2709437810897405,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.9824688517003433e-05,
|
||
|
|
"loss": 1.1165,
|
||
|
|
"mean_token_accuracy": 0.6969778280705213,
|
||
|
|
"num_tokens": 65912713.0,
|
||
|
|
"step": 880
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0850966442376375,
|
||
|
|
"epoch": 0.2724832343913868,
|
||
|
|
"grad_norm": 0.78125,
|
||
|
|
"learning_rate": 1.9821656682168013e-05,
|
||
|
|
"loss": 1.0868,
|
||
|
|
"mean_token_accuracy": 0.7045084740966558,
|
||
|
|
"num_tokens": 66288389.0,
|
||
|
|
"step": 885
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.116120758280158,
|
||
|
|
"epoch": 0.274022687693033,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.981859909118294e-05,
|
||
|
|
"loss": 1.1183,
|
||
|
|
"mean_token_accuracy": 0.6976446002721787,
|
||
|
|
"num_tokens": 66673853.0,
|
||
|
|
"step": 890
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1547842472791672,
|
||
|
|
"epoch": 0.27556214099467924,
|
||
|
|
"grad_norm": 0.76171875,
|
||
|
|
"learning_rate": 1.9815515752066386e-05,
|
||
|
|
"loss": 1.1512,
|
||
|
|
"mean_token_accuracy": 0.6902260981500149,
|
||
|
|
"num_tokens": 67054614.0,
|
||
|
|
"step": 895
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0831589922308922,
|
||
|
|
"epoch": 0.2771015942963255,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 1.9812406672904058e-05,
|
||
|
|
"loss": 1.0824,
|
||
|
|
"mean_token_accuracy": 0.7042932607233524,
|
||
|
|
"num_tokens": 67422842.0,
|
||
|
|
"step": 900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1236521264538168,
|
||
|
|
"epoch": 0.27864104759797176,
|
||
|
|
"grad_norm": 0.80078125,
|
||
|
|
"learning_rate": 1.9809271861849147e-05,
|
||
|
|
"loss": 1.1257,
|
||
|
|
"mean_token_accuracy": 0.6985704395920038,
|
||
|
|
"num_tokens": 67791499.0,
|
||
|
|
"step": 905
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1213534710928799,
|
||
|
|
"epoch": 0.28018050089961805,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 1.9806111327122332e-05,
|
||
|
|
"loss": 1.1056,
|
||
|
|
"mean_token_accuracy": 0.6963206488639117,
|
||
|
|
"num_tokens": 68168533.0,
|
||
|
|
"step": 910
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0945915594696998,
|
||
|
|
"epoch": 0.2817199542012643,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.9802925077011742e-05,
|
||
|
|
"loss": 1.0805,
|
||
|
|
"mean_token_accuracy": 0.7033400624990463,
|
||
|
|
"num_tokens": 68534200.0,
|
||
|
|
"step": 915
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1363273495808244,
|
||
|
|
"epoch": 0.2832594075029105,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.979971311987295e-05,
|
||
|
|
"loss": 1.1331,
|
||
|
|
"mean_token_accuracy": 0.6933297269046307,
|
||
|
|
"num_tokens": 68904756.0,
|
||
|
|
"step": 920
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.113439468294382,
|
||
|
|
"epoch": 0.2847988608045568,
|
||
|
|
"grad_norm": 0.67578125,
|
||
|
|
"learning_rate": 1.9796475464128943e-05,
|
||
|
|
"loss": 1.1136,
|
||
|
|
"mean_token_accuracy": 0.6984921019524336,
|
||
|
|
"num_tokens": 69279269.0,
|
||
|
|
"step": 925
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.106918627768755,
|
||
|
|
"epoch": 0.28633831410620303,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.979321211827009e-05,
|
||
|
|
"loss": 1.0971,
|
||
|
|
"mean_token_accuracy": 0.699981477856636,
|
||
|
|
"num_tokens": 69652060.0,
|
||
|
|
"step": 930
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1193274904042483,
|
||
|
|
"epoch": 0.28787776740784926,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 1.9789923090854138e-05,
|
||
|
|
"loss": 1.1141,
|
||
|
|
"mean_token_accuracy": 0.6945442810654641,
|
||
|
|
"num_tokens": 70031530.0,
|
||
|
|
"step": 935
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1201645512133838,
|
||
|
|
"epoch": 0.28941722070949555,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.9786608390506176e-05,
|
||
|
|
"loss": 1.1248,
|
||
|
|
"mean_token_accuracy": 0.6959635071456433,
|
||
|
|
"num_tokens": 70405759.0,
|
||
|
|
"step": 940
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.158202064409852,
|
||
|
|
"epoch": 0.2909566740111418,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 1.9783268025918622e-05,
|
||
|
|
"loss": 1.1405,
|
||
|
|
"mean_token_accuracy": 0.6916137792170047,
|
||
|
|
"num_tokens": 70773411.0,
|
||
|
|
"step": 945
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1136011434718966,
|
||
|
|
"epoch": 0.29249612731278807,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.9779902005851187e-05,
|
||
|
|
"loss": 1.1032,
|
||
|
|
"mean_token_accuracy": 0.6998088311403989,
|
||
|
|
"num_tokens": 71138724.0,
|
||
|
|
"step": 950
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1528440322726965,
|
||
|
|
"epoch": 0.2940355806144343,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.9776510339130874e-05,
|
||
|
|
"loss": 1.1432,
|
||
|
|
"mean_token_accuracy": 0.6916706405580044,
|
||
|
|
"num_tokens": 71522642.0,
|
||
|
|
"step": 955
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1416105089709163,
|
||
|
|
"epoch": 0.29557503391608053,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.9773093034651928e-05,
|
||
|
|
"loss": 1.1315,
|
||
|
|
"mean_token_accuracy": 0.6934664513915777,
|
||
|
|
"num_tokens": 71885197.0,
|
||
|
|
"step": 960
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1288053080439568,
|
||
|
|
"epoch": 0.2971144872177268,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.9769650101375835e-05,
|
||
|
|
"loss": 1.1253,
|
||
|
|
"mean_token_accuracy": 0.6961982771754265,
|
||
|
|
"num_tokens": 72262607.0,
|
||
|
|
"step": 965
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1250951839610934,
|
||
|
|
"epoch": 0.29865394051937305,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 1.9766181548331283e-05,
|
||
|
|
"loss": 1.1186,
|
||
|
|
"mean_token_accuracy": 0.6970525443553924,
|
||
|
|
"num_tokens": 72653402.0,
|
||
|
|
"step": 970
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1368791069835424,
|
||
|
|
"epoch": 0.3001933938210193,
|
||
|
|
"grad_norm": 0.78125,
|
||
|
|
"learning_rate": 1.9762687384614152e-05,
|
||
|
|
"loss": 1.132,
|
||
|
|
"mean_token_accuracy": 0.6947309102863073,
|
||
|
|
"num_tokens": 73049063.0,
|
||
|
|
"step": 975
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.083188571408391,
|
||
|
|
"epoch": 0.30173284712266557,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.9759167619387474e-05,
|
||
|
|
"loss": 1.0838,
|
||
|
|
"mean_token_accuracy": 0.7051486879587173,
|
||
|
|
"num_tokens": 73435640.0,
|
||
|
|
"step": 980
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1301437310874463,
|
||
|
|
"epoch": 0.3032723004243118,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.975562226188143e-05,
|
||
|
|
"loss": 1.1135,
|
||
|
|
"mean_token_accuracy": 0.6951402083039284,
|
||
|
|
"num_tokens": 73804251.0,
|
||
|
|
"step": 985
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1021712820976972,
|
||
|
|
"epoch": 0.3048117537259581,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 1.97520513213933e-05,
|
||
|
|
"loss": 1.1047,
|
||
|
|
"mean_token_accuracy": 0.6995002727955579,
|
||
|
|
"num_tokens": 74186734.0,
|
||
|
|
"step": 990
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1268383231014014,
|
||
|
|
"epoch": 0.3063512070276043,
|
||
|
|
"grad_norm": 0.67578125,
|
||
|
|
"learning_rate": 1.9748454807287458e-05,
|
||
|
|
"loss": 1.1197,
|
||
|
|
"mean_token_accuracy": 0.6963075909763574,
|
||
|
|
"num_tokens": 74564695.0,
|
||
|
|
"step": 995
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1207784935832024,
|
||
|
|
"epoch": 0.30789066032925055,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 1.974483272899535e-05,
|
||
|
|
"loss": 1.1225,
|
||
|
|
"mean_token_accuracy": 0.6975628361105919,
|
||
|
|
"num_tokens": 74954009.0,
|
||
|
|
"step": 1000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1320615615695715,
|
||
|
|
"epoch": 0.30943011363089684,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.974118509601545e-05,
|
||
|
|
"loss": 1.1245,
|
||
|
|
"mean_token_accuracy": 0.6957272073253989,
|
||
|
|
"num_tokens": 75329081.0,
|
||
|
|
"step": 1005
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0997402749955654,
|
||
|
|
"epoch": 0.3109695669325431,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.973751191791325e-05,
|
||
|
|
"loss": 1.0889,
|
||
|
|
"mean_token_accuracy": 0.7017048012465239,
|
||
|
|
"num_tokens": 75696214.0,
|
||
|
|
"step": 1010
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0914274197071792,
|
||
|
|
"epoch": 0.31250902023418936,
|
||
|
|
"grad_norm": 0.671875,
|
||
|
|
"learning_rate": 1.9733813204321233e-05,
|
||
|
|
"loss": 1.0761,
|
||
|
|
"mean_token_accuracy": 0.7037324849516153,
|
||
|
|
"num_tokens": 76068328.0,
|
||
|
|
"step": 1015
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1191833563148976,
|
||
|
|
"epoch": 0.3140484735358356,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.9730088964938842e-05,
|
||
|
|
"loss": 1.1121,
|
||
|
|
"mean_token_accuracy": 0.6989397961646319,
|
||
|
|
"num_tokens": 76441289.0,
|
||
|
|
"step": 1020
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1179291112348437,
|
||
|
|
"epoch": 0.3155879268374818,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.9726339209532462e-05,
|
||
|
|
"loss": 1.0951,
|
||
|
|
"mean_token_accuracy": 0.7015183545649052,
|
||
|
|
"num_tokens": 76814090.0,
|
||
|
|
"step": 1025
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1256714541465045,
|
||
|
|
"epoch": 0.3171273801391281,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 1.972256394793539e-05,
|
||
|
|
"loss": 1.1131,
|
||
|
|
"mean_token_accuracy": 0.6952388241887093,
|
||
|
|
"num_tokens": 77179591.0,
|
||
|
|
"step": 1030
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.136961457133293,
|
||
|
|
"epoch": 0.31866683344077434,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 1.971876319004781e-05,
|
||
|
|
"loss": 1.1182,
|
||
|
|
"mean_token_accuracy": 0.6935086127370595,
|
||
|
|
"num_tokens": 77550799.0,
|
||
|
|
"step": 1035
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1292035300284624,
|
||
|
|
"epoch": 0.3202062867424206,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.9714936945836764e-05,
|
||
|
|
"loss": 1.1177,
|
||
|
|
"mean_token_accuracy": 0.6930017314851284,
|
||
|
|
"num_tokens": 77920454.0,
|
||
|
|
"step": 1040
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0919932153075933,
|
||
|
|
"epoch": 0.32174574004406686,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 1.971108522533613e-05,
|
||
|
|
"loss": 1.078,
|
||
|
|
"mean_token_accuracy": 0.7059255817905068,
|
||
|
|
"num_tokens": 78285931.0,
|
||
|
|
"step": 1045
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.116225427389145,
|
||
|
|
"epoch": 0.3232851933457131,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 1.9707208038646605e-05,
|
||
|
|
"loss": 1.1197,
|
||
|
|
"mean_token_accuracy": 0.6983599919825793,
|
||
|
|
"num_tokens": 78657492.0,
|
||
|
|
"step": 1050
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1196499440819025,
|
||
|
|
"epoch": 0.3248246466473594,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.970330539593565e-05,
|
||
|
|
"loss": 1.1043,
|
||
|
|
"mean_token_accuracy": 0.6965556625276804,
|
||
|
|
"num_tokens": 79026794.0,
|
||
|
|
"step": 1055
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1315435644239187,
|
||
|
|
"epoch": 0.3263640999490056,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.969937730743749e-05,
|
||
|
|
"loss": 1.1248,
|
||
|
|
"mean_token_accuracy": 0.696228601038456,
|
||
|
|
"num_tokens": 79400596.0,
|
||
|
|
"step": 1060
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0820589877665043,
|
||
|
|
"epoch": 0.32790355325065185,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 1.9695423783453086e-05,
|
||
|
|
"loss": 1.0836,
|
||
|
|
"mean_token_accuracy": 0.705596823990345,
|
||
|
|
"num_tokens": 79767657.0,
|
||
|
|
"step": 1065
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1282978903502225,
|
||
|
|
"epoch": 0.32944300655229813,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 1.969144483435009e-05,
|
||
|
|
"loss": 1.1241,
|
||
|
|
"mean_token_accuracy": 0.6953945115208626,
|
||
|
|
"num_tokens": 80144261.0,
|
||
|
|
"step": 1070
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1406402667984366,
|
||
|
|
"epoch": 0.33098245985394437,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.968744047056283e-05,
|
||
|
|
"loss": 1.1297,
|
||
|
|
"mean_token_accuracy": 0.6934267330914736,
|
||
|
|
"num_tokens": 80525193.0,
|
||
|
|
"step": 1075
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1295597156509758,
|
||
|
|
"epoch": 0.3325219131555906,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 1.9683410702592284e-05,
|
||
|
|
"loss": 1.1203,
|
||
|
|
"mean_token_accuracy": 0.6963451337069273,
|
||
|
|
"num_tokens": 80905579.0,
|
||
|
|
"step": 1080
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1091342974454164,
|
||
|
|
"epoch": 0.3340613664572369,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 1.9679355541006056e-05,
|
||
|
|
"loss": 1.1029,
|
||
|
|
"mean_token_accuracy": 0.6987722083926201,
|
||
|
|
"num_tokens": 81285902.0,
|
||
|
|
"step": 1085
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1366256965324282,
|
||
|
|
"epoch": 0.3356008197588831,
|
||
|
|
"grad_norm": 0.77734375,
|
||
|
|
"learning_rate": 1.9675274996438324e-05,
|
||
|
|
"loss": 1.1364,
|
||
|
|
"mean_token_accuracy": 0.6947485759854317,
|
||
|
|
"num_tokens": 81653385.0,
|
||
|
|
"step": 1090
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1193459507077932,
|
||
|
|
"epoch": 0.3371402730605294,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.967116907958985e-05,
|
||
|
|
"loss": 1.1022,
|
||
|
|
"mean_token_accuracy": 0.7003271400928497,
|
||
|
|
"num_tokens": 82021575.0,
|
||
|
|
"step": 1095
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1462248302996159,
|
||
|
|
"epoch": 0.33867972636217564,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.9667037801227914e-05,
|
||
|
|
"loss": 1.1351,
|
||
|
|
"mean_token_accuracy": 0.6924805622547865,
|
||
|
|
"num_tokens": 82399380.0,
|
||
|
|
"step": 1100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.107696833834052,
|
||
|
|
"epoch": 0.34021917966382187,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.9662881172186313e-05,
|
||
|
|
"loss": 1.1058,
|
||
|
|
"mean_token_accuracy": 0.7026475485414266,
|
||
|
|
"num_tokens": 82771918.0,
|
||
|
|
"step": 1105
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1295810148119927,
|
||
|
|
"epoch": 0.34175863296546816,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 1.965869920336533e-05,
|
||
|
|
"loss": 1.1236,
|
||
|
|
"mean_token_accuracy": 0.6973136257380247,
|
||
|
|
"num_tokens": 83137444.0,
|
||
|
|
"step": 1110
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1330510720610618,
|
||
|
|
"epoch": 0.3432980862671144,
|
||
|
|
"grad_norm": 0.80859375,
|
||
|
|
"learning_rate": 1.965449190573168e-05,
|
||
|
|
"loss": 1.1317,
|
||
|
|
"mean_token_accuracy": 0.6966150533407927,
|
||
|
|
"num_tokens": 83500864.0,
|
||
|
|
"step": 1115
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1691056948155165,
|
||
|
|
"epoch": 0.3448375395687606,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.965025929031852e-05,
|
||
|
|
"loss": 1.1643,
|
||
|
|
"mean_token_accuracy": 0.6873539566993714,
|
||
|
|
"num_tokens": 83868277.0,
|
||
|
|
"step": 1120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0945931367576123,
|
||
|
|
"epoch": 0.3463769928704069,
|
||
|
|
"grad_norm": 0.67578125,
|
||
|
|
"learning_rate": 1.9646001368225382e-05,
|
||
|
|
"loss": 1.1016,
|
||
|
|
"mean_token_accuracy": 0.7012989364564419,
|
||
|
|
"num_tokens": 84252198.0,
|
||
|
|
"step": 1125
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.165550697594881,
|
||
|
|
"epoch": 0.34791644617205314,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.9641718150618177e-05,
|
||
|
|
"loss": 1.1467,
|
||
|
|
"mean_token_accuracy": 0.6915617097169161,
|
||
|
|
"num_tokens": 84617359.0,
|
||
|
|
"step": 1130
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1262395735830069,
|
||
|
|
"epoch": 0.3494558994736994,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.9637409648729142e-05,
|
||
|
|
"loss": 1.1208,
|
||
|
|
"mean_token_accuracy": 0.6933946672827005,
|
||
|
|
"num_tokens": 85000015.0,
|
||
|
|
"step": 1135
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.129942279495299,
|
||
|
|
"epoch": 0.35099535277534566,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.963307587385682e-05,
|
||
|
|
"loss": 1.1206,
|
||
|
|
"mean_token_accuracy": 0.6961002223193645,
|
||
|
|
"num_tokens": 85384245.0,
|
||
|
|
"step": 1140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1344817027449607,
|
||
|
|
"epoch": 0.3525348060769919,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 1.962871683736603e-05,
|
||
|
|
"loss": 1.1255,
|
||
|
|
"mean_token_accuracy": 0.6936954416334629,
|
||
|
|
"num_tokens": 85754567.0,
|
||
|
|
"step": 1145
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1344742052257062,
|
||
|
|
"epoch": 0.3540742593786382,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.9624332550687834e-05,
|
||
|
|
"loss": 1.1209,
|
||
|
|
"mean_token_accuracy": 0.695965689048171,
|
||
|
|
"num_tokens": 86130538.0,
|
||
|
|
"step": 1150
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1286322576925159,
|
||
|
|
"epoch": 0.3556137126802844,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 1.961992302531952e-05,
|
||
|
|
"loss": 1.1213,
|
||
|
|
"mean_token_accuracy": 0.6975085325539112,
|
||
|
|
"num_tokens": 86505523.0,
|
||
|
|
"step": 1155
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.161212246119976,
|
||
|
|
"epoch": 0.35715316598193064,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 1.961548827282455e-05,
|
||
|
|
"loss": 1.1607,
|
||
|
|
"mean_token_accuracy": 0.6912364710122347,
|
||
|
|
"num_tokens": 86889854.0,
|
||
|
|
"step": 1160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1156503956764936,
|
||
|
|
"epoch": 0.35869261928357693,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.9611028304832547e-05,
|
||
|
|
"loss": 1.1063,
|
||
|
|
"mean_token_accuracy": 0.697390603646636,
|
||
|
|
"num_tokens": 87275027.0,
|
||
|
|
"step": 1165
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.117064966261387,
|
||
|
|
"epoch": 0.36023207258522316,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 1.9606543133039254e-05,
|
||
|
|
"loss": 1.1028,
|
||
|
|
"mean_token_accuracy": 0.70021205060184,
|
||
|
|
"num_tokens": 87649310.0,
|
||
|
|
"step": 1170
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1142473477870225,
|
||
|
|
"epoch": 0.36177152588686945,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.9602032769206517e-05,
|
||
|
|
"loss": 1.1113,
|
||
|
|
"mean_token_accuracy": 0.6982534524053335,
|
||
|
|
"num_tokens": 88021284.0,
|
||
|
|
"step": 1175
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1146583622321486,
|
||
|
|
"epoch": 0.3633109791885157,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.9597497225162233e-05,
|
||
|
|
"loss": 1.1098,
|
||
|
|
"mean_token_accuracy": 0.6998208686709404,
|
||
|
|
"num_tokens": 88397256.0,
|
||
|
|
"step": 1180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1496895281597972,
|
||
|
|
"epoch": 0.3648504324901619,
|
||
|
|
"grad_norm": 0.76171875,
|
||
|
|
"learning_rate": 1.959293651280034e-05,
|
||
|
|
"loss": 1.1573,
|
||
|
|
"mean_token_accuracy": 0.6919562425464392,
|
||
|
|
"num_tokens": 88763426.0,
|
||
|
|
"step": 1185
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1269241459667683,
|
||
|
|
"epoch": 0.3663898857918082,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.9588350644080777e-05,
|
||
|
|
"loss": 1.1105,
|
||
|
|
"mean_token_accuracy": 0.6988791462033987,
|
||
|
|
"num_tokens": 89118435.0,
|
||
|
|
"step": 1190
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0833050038665533,
|
||
|
|
"epoch": 0.36792933909345443,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 1.9583739631029446e-05,
|
||
|
|
"loss": 1.0802,
|
||
|
|
"mean_token_accuracy": 0.7041361082345248,
|
||
|
|
"num_tokens": 89508601.0,
|
||
|
|
"step": 1195
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1451345276087523,
|
||
|
|
"epoch": 0.36946879239510066,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.957910348573819e-05,
|
||
|
|
"loss": 1.1369,
|
||
|
|
"mean_token_accuracy": 0.6917477056384087,
|
||
|
|
"num_tokens": 89893267.0,
|
||
|
|
"step": 1200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0983753545209765,
|
||
|
|
"epoch": 0.37100824569674695,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 1.9574442220364768e-05,
|
||
|
|
"loss": 1.0951,
|
||
|
|
"mean_token_accuracy": 0.7006513494998217,
|
||
|
|
"num_tokens": 90284037.0,
|
||
|
|
"step": 1205
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.116368711926043,
|
||
|
|
"epoch": 0.3725476989983932,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.9569755847132796e-05,
|
||
|
|
"loss": 1.1144,
|
||
|
|
"mean_token_accuracy": 0.6977820225059986,
|
||
|
|
"num_tokens": 90670311.0,
|
||
|
|
"step": 1210
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.094654480740428,
|
||
|
|
"epoch": 0.37408715230003947,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.9565044378331745e-05,
|
||
|
|
"loss": 1.0829,
|
||
|
|
"mean_token_accuracy": 0.7023903023451566,
|
||
|
|
"num_tokens": 91055385.0,
|
||
|
|
"step": 1215
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.115629038028419,
|
||
|
|
"epoch": 0.3756266056016857,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.9560307826316892e-05,
|
||
|
|
"loss": 1.1184,
|
||
|
|
"mean_token_accuracy": 0.6971225813031197,
|
||
|
|
"num_tokens": 91424223.0,
|
||
|
|
"step": 1220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1635486509650945,
|
||
|
|
"epoch": 0.37716605890333194,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 1.9555546203509297e-05,
|
||
|
|
"loss": 1.1615,
|
||
|
|
"mean_token_accuracy": 0.6906606066972018,
|
||
|
|
"num_tokens": 91796012.0,
|
||
|
|
"step": 1225
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.120249069854617,
|
||
|
|
"epoch": 0.3787055122049782,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.9550759522395753e-05,
|
||
|
|
"loss": 1.1022,
|
||
|
|
"mean_token_accuracy": 0.6964717313647271,
|
||
|
|
"num_tokens": 92162375.0,
|
||
|
|
"step": 1230
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1134164540097118,
|
||
|
|
"epoch": 0.38024496550662445,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.9545947795528777e-05,
|
||
|
|
"loss": 1.1205,
|
||
|
|
"mean_token_accuracy": 0.6987472154200077,
|
||
|
|
"num_tokens": 92545936.0,
|
||
|
|
"step": 1235
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.086888193897903,
|
||
|
|
"epoch": 0.3817844188082707,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.9541111035526563e-05,
|
||
|
|
"loss": 1.0868,
|
||
|
|
"mean_token_accuracy": 0.7030756056308747,
|
||
|
|
"num_tokens": 92928503.0,
|
||
|
|
"step": 1240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1007358327507972,
|
||
|
|
"epoch": 0.383323872109917,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 1.953624925507295e-05,
|
||
|
|
"loss": 1.0914,
|
||
|
|
"mean_token_accuracy": 0.7022611912339926,
|
||
|
|
"num_tokens": 93313261.0,
|
||
|
|
"step": 1245
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.135701997205615,
|
||
|
|
"epoch": 0.3848633254115632,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.9531362466917388e-05,
|
||
|
|
"loss": 1.1208,
|
||
|
|
"mean_token_accuracy": 0.6953465500846505,
|
||
|
|
"num_tokens": 93694867.0,
|
||
|
|
"step": 1250
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.141565052047372,
|
||
|
|
"epoch": 0.3864027787132095,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.952645068387491e-05,
|
||
|
|
"loss": 1.1328,
|
||
|
|
"mean_token_accuracy": 0.69326724819839,
|
||
|
|
"num_tokens": 94082631.0,
|
||
|
|
"step": 1255
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1221220299601555,
|
||
|
|
"epoch": 0.3879422320148557,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 1.95215139188261e-05,
|
||
|
|
"loss": 1.1079,
|
||
|
|
"mean_token_accuracy": 0.6988440815359354,
|
||
|
|
"num_tokens": 94457533.0,
|
||
|
|
"step": 1260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1194452840834856,
|
||
|
|
"epoch": 0.38948168531650196,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 1.9516552184717036e-05,
|
||
|
|
"loss": 1.1215,
|
||
|
|
"mean_token_accuracy": 0.696359645575285,
|
||
|
|
"num_tokens": 94829571.0,
|
||
|
|
"step": 1265
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.095098103582859,
|
||
|
|
"epoch": 0.39102113861814825,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 1.9511565494559298e-05,
|
||
|
|
"loss": 1.0958,
|
||
|
|
"mean_token_accuracy": 0.7043366067111492,
|
||
|
|
"num_tokens": 95200118.0,
|
||
|
|
"step": 1270
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1012009687721729,
|
||
|
|
"epoch": 0.3925605919197945,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.95065538614299e-05,
|
||
|
|
"loss": 1.0911,
|
||
|
|
"mean_token_accuracy": 0.7037279218435287,
|
||
|
|
"num_tokens": 95570272.0,
|
||
|
|
"step": 1275
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1257656961679459,
|
||
|
|
"epoch": 0.3941000452214407,
|
||
|
|
"grad_norm": 0.77734375,
|
||
|
|
"learning_rate": 1.950151729847126e-05,
|
||
|
|
"loss": 1.1224,
|
||
|
|
"mean_token_accuracy": 0.6986918987706303,
|
||
|
|
"num_tokens": 95942085.0,
|
||
|
|
"step": 1280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1478566963225603,
|
||
|
|
"epoch": 0.395639498523087,
|
||
|
|
"grad_norm": 0.68359375,
|
||
|
|
"learning_rate": 1.949645581889118e-05,
|
||
|
|
"loss": 1.1455,
|
||
|
|
"mean_token_accuracy": 0.6915257848799229,
|
||
|
|
"num_tokens": 96317314.0,
|
||
|
|
"step": 1285
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1262834113091231,
|
||
|
|
"epoch": 0.39717895182473323,
|
||
|
|
"grad_norm": 0.68359375,
|
||
|
|
"learning_rate": 1.9491369435962802e-05,
|
||
|
|
"loss": 1.1219,
|
||
|
|
"mean_token_accuracy": 0.6945701058954,
|
||
|
|
"num_tokens": 96698109.0,
|
||
|
|
"step": 1290
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0999675188213587,
|
||
|
|
"epoch": 0.3987184051263795,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.9486258163024567e-05,
|
||
|
|
"loss": 1.0967,
|
||
|
|
"mean_token_accuracy": 0.7008256938308477,
|
||
|
|
"num_tokens": 97074251.0,
|
||
|
|
"step": 1295
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.127872526086867,
|
||
|
|
"epoch": 0.40025785842802575,
|
||
|
|
"grad_norm": 0.76171875,
|
||
|
|
"learning_rate": 1.94811220134802e-05,
|
||
|
|
"loss": 1.1225,
|
||
|
|
"mean_token_accuracy": 0.6996113903820514,
|
||
|
|
"num_tokens": 97446524.0,
|
||
|
|
"step": 1300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1096723936498165,
|
||
|
|
"epoch": 0.401797311729672,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 1.9475961000798645e-05,
|
||
|
|
"loss": 1.1048,
|
||
|
|
"mean_token_accuracy": 0.6985050681978464,
|
||
|
|
"num_tokens": 97831999.0,
|
||
|
|
"step": 1305
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1193984607234597,
|
||
|
|
"epoch": 0.40333676503131827,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.9470775138514063e-05,
|
||
|
|
"loss": 1.111,
|
||
|
|
"mean_token_accuracy": 0.6988893166184426,
|
||
|
|
"num_tokens": 98203695.0,
|
||
|
|
"step": 1310
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1497751019895077,
|
||
|
|
"epoch": 0.4048762183329645,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.9465564440225768e-05,
|
||
|
|
"loss": 1.1275,
|
||
|
|
"mean_token_accuracy": 0.6922019004821778,
|
||
|
|
"num_tokens": 98579150.0,
|
||
|
|
"step": 1315
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.146084163337946,
|
||
|
|
"epoch": 0.40641567163461073,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 1.9460328919598216e-05,
|
||
|
|
"loss": 1.1382,
|
||
|
|
"mean_token_accuracy": 0.6955520674586296,
|
||
|
|
"num_tokens": 98943956.0,
|
||
|
|
"step": 1320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1438047185540199,
|
||
|
|
"epoch": 0.407955124936257,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 1.9455068590360943e-05,
|
||
|
|
"loss": 1.1408,
|
||
|
|
"mean_token_accuracy": 0.6917512208223343,
|
||
|
|
"num_tokens": 99326339.0,
|
||
|
|
"step": 1325
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1105543179437518,
|
||
|
|
"epoch": 0.40949457823790325,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 1.9449783466308553e-05,
|
||
|
|
"loss": 1.1093,
|
||
|
|
"mean_token_accuracy": 0.6983879100531339,
|
||
|
|
"num_tokens": 99693304.0,
|
||
|
|
"step": 1330
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1154874304309488,
|
||
|
|
"epoch": 0.41103403153954954,
|
||
|
|
"grad_norm": 0.67578125,
|
||
|
|
"learning_rate": 1.9444473561300666e-05,
|
||
|
|
"loss": 1.1124,
|
||
|
|
"mean_token_accuracy": 0.6970164556056261,
|
||
|
|
"num_tokens": 100076953.0,
|
||
|
|
"step": 1335
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1657130055129528,
|
||
|
|
"epoch": 0.41257348484119577,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.943913888926189e-05,
|
||
|
|
"loss": 1.1697,
|
||
|
|
"mean_token_accuracy": 0.6894268091768027,
|
||
|
|
"num_tokens": 100447813.0,
|
||
|
|
"step": 1340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0991169594228267,
|
||
|
|
"epoch": 0.414112938142842,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.943377946418178e-05,
|
||
|
|
"loss": 1.0923,
|
||
|
|
"mean_token_accuracy": 0.7011879209429026,
|
||
|
|
"num_tokens": 100835066.0,
|
||
|
|
"step": 1345
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0682245310395957,
|
||
|
|
"epoch": 0.4156523914444883,
|
||
|
|
"grad_norm": 0.7734375,
|
||
|
|
"learning_rate": 1.9428395300114803e-05,
|
||
|
|
"loss": 1.0678,
|
||
|
|
"mean_token_accuracy": 0.709788928553462,
|
||
|
|
"num_tokens": 101195353.0,
|
||
|
|
"step": 1350
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1283558243885636,
|
||
|
|
"epoch": 0.4171918447461345,
|
||
|
|
"grad_norm": 0.66796875,
|
||
|
|
"learning_rate": 1.94229864111803e-05,
|
||
|
|
"loss": 1.1191,
|
||
|
|
"mean_token_accuracy": 0.6948264576494694,
|
||
|
|
"num_tokens": 101571638.0,
|
||
|
|
"step": 1355
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.114413278736174,
|
||
|
|
"epoch": 0.4187312980477808,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 1.9417552811562457e-05,
|
||
|
|
"loss": 1.1174,
|
||
|
|
"mean_token_accuracy": 0.6991838045418263,
|
||
|
|
"num_tokens": 101941042.0,
|
||
|
|
"step": 1360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1175668630748987,
|
||
|
|
"epoch": 0.42027075134942704,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.941209451551025e-05,
|
||
|
|
"loss": 1.1069,
|
||
|
|
"mean_token_accuracy": 0.6971942469477653,
|
||
|
|
"num_tokens": 102314017.0,
|
||
|
|
"step": 1365
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0761339336633682,
|
||
|
|
"epoch": 0.4218102046510733,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.9406611537337425e-05,
|
||
|
|
"loss": 1.0622,
|
||
|
|
"mean_token_accuracy": 0.7066352400928736,
|
||
|
|
"num_tokens": 102691186.0,
|
||
|
|
"step": 1370
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.127281517535448,
|
||
|
|
"epoch": 0.42334965795271956,
|
||
|
|
"grad_norm": 0.7890625,
|
||
|
|
"learning_rate": 1.9401103891422455e-05,
|
||
|
|
"loss": 1.1202,
|
||
|
|
"mean_token_accuracy": 0.6942048665136099,
|
||
|
|
"num_tokens": 103071698.0,
|
||
|
|
"step": 1375
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.086047711968422,
|
||
|
|
"epoch": 0.4248891112543658,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.93955715922085e-05,
|
||
|
|
"loss": 1.0819,
|
||
|
|
"mean_token_accuracy": 0.7019645646214485,
|
||
|
|
"num_tokens": 103457908.0,
|
||
|
|
"step": 1380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1055951166898013,
|
||
|
|
"epoch": 0.426428564556012,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.939001465420337e-05,
|
||
|
|
"loss": 1.1062,
|
||
|
|
"mean_token_accuracy": 0.6994627211242914,
|
||
|
|
"num_tokens": 103836470.0,
|
||
|
|
"step": 1385
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1144292425364255,
|
||
|
|
"epoch": 0.4279680178576583,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.938443309197948e-05,
|
||
|
|
"loss": 1.1048,
|
||
|
|
"mean_token_accuracy": 0.6957655198872089,
|
||
|
|
"num_tokens": 104216895.0,
|
||
|
|
"step": 1390
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1153745524585248,
|
||
|
|
"epoch": 0.42950747115930454,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.9378826920173835e-05,
|
||
|
|
"loss": 1.1234,
|
||
|
|
"mean_token_accuracy": 0.6969841800630092,
|
||
|
|
"num_tokens": 104601319.0,
|
||
|
|
"step": 1395
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1316595112904906,
|
||
|
|
"epoch": 0.43104692446095083,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.9373196153487962e-05,
|
||
|
|
"loss": 1.129,
|
||
|
|
"mean_token_accuracy": 0.6969845864921809,
|
||
|
|
"num_tokens": 104967171.0,
|
||
|
|
"step": 1400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1544791884720325,
|
||
|
|
"epoch": 0.43258637776259706,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.9367540806687894e-05,
|
||
|
|
"loss": 1.15,
|
||
|
|
"mean_token_accuracy": 0.6929264325648546,
|
||
|
|
"num_tokens": 105333438.0,
|
||
|
|
"step": 1405
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1271388109773397,
|
||
|
|
"epoch": 0.4341258310642433,
|
||
|
|
"grad_norm": 0.796875,
|
||
|
|
"learning_rate": 1.9361860894604116e-05,
|
||
|
|
"loss": 1.1161,
|
||
|
|
"mean_token_accuracy": 0.6955098442733287,
|
||
|
|
"num_tokens": 105691785.0,
|
||
|
|
"step": 1410
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1479596089571715,
|
||
|
|
"epoch": 0.4356652843658896,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 1.9356156432131533e-05,
|
||
|
|
"loss": 1.1482,
|
||
|
|
"mean_token_accuracy": 0.6920965306460858,
|
||
|
|
"num_tokens": 106078624.0,
|
||
|
|
"step": 1415
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1149195641279221,
|
||
|
|
"epoch": 0.4372047376675358,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 1.935042743422944e-05,
|
||
|
|
"loss": 1.1028,
|
||
|
|
"mean_token_accuracy": 0.6970803182572126,
|
||
|
|
"num_tokens": 106454246.0,
|
||
|
|
"step": 1420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0929339196532966,
|
||
|
|
"epoch": 0.43874419096918205,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 1.934467391592146e-05,
|
||
|
|
"loss": 1.1047,
|
||
|
|
"mean_token_accuracy": 0.7016421973705291,
|
||
|
|
"num_tokens": 106810481.0,
|
||
|
|
"step": 1425
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0979965701699257,
|
||
|
|
"epoch": 0.44028364427082833,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 1.9338895892295527e-05,
|
||
|
|
"loss": 1.0956,
|
||
|
|
"mean_token_accuracy": 0.7029366530478001,
|
||
|
|
"num_tokens": 107196667.0,
|
||
|
|
"step": 1430
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1433403573930263,
|
||
|
|
"epoch": 0.44182309757247457,
|
||
|
|
"grad_norm": 0.78515625,
|
||
|
|
"learning_rate": 1.9333093378503832e-05,
|
||
|
|
"loss": 1.1375,
|
||
|
|
"mean_token_accuracy": 0.6927531309425831,
|
||
|
|
"num_tokens": 107575900.0,
|
||
|
|
"step": 1435
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1472560165449976,
|
||
|
|
"epoch": 0.44336255087412085,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.9327266389762787e-05,
|
||
|
|
"loss": 1.1371,
|
||
|
|
"mean_token_accuracy": 0.6947022203356028,
|
||
|
|
"num_tokens": 107944294.0,
|
||
|
|
"step": 1440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.101127756945789,
|
||
|
|
"epoch": 0.4449020041757671,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 1.9321414941353006e-05,
|
||
|
|
"loss": 1.0928,
|
||
|
|
"mean_token_accuracy": 0.7010299023240805,
|
||
|
|
"num_tokens": 108312798.0,
|
||
|
|
"step": 1445
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1180545002222062,
|
||
|
|
"epoch": 0.4464414574774133,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.9315539048619212e-05,
|
||
|
|
"loss": 1.1234,
|
||
|
|
"mean_token_accuracy": 0.6960787653923035,
|
||
|
|
"num_tokens": 108690533.0,
|
||
|
|
"step": 1450
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1227679682895542,
|
||
|
|
"epoch": 0.4479809107790596,
|
||
|
|
"grad_norm": 0.76953125,
|
||
|
|
"learning_rate": 1.930963872697026e-05,
|
||
|
|
"loss": 1.1046,
|
||
|
|
"mean_token_accuracy": 0.6982706602662802,
|
||
|
|
"num_tokens": 109068398.0,
|
||
|
|
"step": 1455
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.107317195646465,
|
||
|
|
"epoch": 0.44952036408070584,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.9303713991879052e-05,
|
||
|
|
"loss": 1.1001,
|
||
|
|
"mean_token_accuracy": 0.6980501331388951,
|
||
|
|
"num_tokens": 109446077.0,
|
||
|
|
"step": 1460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1386326614767313,
|
||
|
|
"epoch": 0.45105981738235207,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.9297764858882516e-05,
|
||
|
|
"loss": 1.1239,
|
||
|
|
"mean_token_accuracy": 0.6934384491294623,
|
||
|
|
"num_tokens": 109826830.0,
|
||
|
|
"step": 1465
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1245597016066313,
|
||
|
|
"epoch": 0.45259927068399836,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 1.9291791343581557e-05,
|
||
|
|
"loss": 1.1149,
|
||
|
|
"mean_token_accuracy": 0.6970586907118559,
|
||
|
|
"num_tokens": 110206021.0,
|
||
|
|
"step": 1470
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.112450549006462,
|
||
|
|
"epoch": 0.4541387239856446,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 1.928579346164103e-05,
|
||
|
|
"loss": 1.1129,
|
||
|
|
"mean_token_accuracy": 0.6991185300052166,
|
||
|
|
"num_tokens": 110575825.0,
|
||
|
|
"step": 1475
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1001921689137817,
|
||
|
|
"epoch": 0.4556781772872909,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.927977122878967e-05,
|
||
|
|
"loss": 1.1028,
|
||
|
|
"mean_token_accuracy": 0.7005803253501653,
|
||
|
|
"num_tokens": 110933606.0,
|
||
|
|
"step": 1480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.136134173721075,
|
||
|
|
"epoch": 0.4572176305889371,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.9273724660820086e-05,
|
||
|
|
"loss": 1.1169,
|
||
|
|
"mean_token_accuracy": 0.6969247065484524,
|
||
|
|
"num_tokens": 111297173.0,
|
||
|
|
"step": 1485
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1197788801044226,
|
||
|
|
"epoch": 0.45875708389058334,
|
||
|
|
"grad_norm": 0.671875,
|
||
|
|
"learning_rate": 1.9267653773588702e-05,
|
||
|
|
"loss": 1.1111,
|
||
|
|
"mean_token_accuracy": 0.6978486493229866,
|
||
|
|
"num_tokens": 111679485.0,
|
||
|
|
"step": 1490
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1003839764744043,
|
||
|
|
"epoch": 0.4602965371922296,
|
||
|
|
"grad_norm": 0.66796875,
|
||
|
|
"learning_rate": 1.926155858301571e-05,
|
||
|
|
"loss": 1.0893,
|
||
|
|
"mean_token_accuracy": 0.7018561966717243,
|
||
|
|
"num_tokens": 112067380.0,
|
||
|
|
"step": 1495
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0989170737564564,
|
||
|
|
"epoch": 0.46183599049387586,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.925543910508503e-05,
|
||
|
|
"loss": 1.1127,
|
||
|
|
"mean_token_accuracy": 0.699932586029172,
|
||
|
|
"num_tokens": 112448405.0,
|
||
|
|
"step": 1500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0723091229796409,
|
||
|
|
"epoch": 0.4633754437955221,
|
||
|
|
"grad_norm": 0.66796875,
|
||
|
|
"learning_rate": 1.9249295355844286e-05,
|
||
|
|
"loss": 1.058,
|
||
|
|
"mean_token_accuracy": 0.7080515351146459,
|
||
|
|
"num_tokens": 112821434.0,
|
||
|
|
"step": 1505
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1173736985772849,
|
||
|
|
"epoch": 0.4649148970971684,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.9243127351404743e-05,
|
||
|
|
"loss": 1.1042,
|
||
|
|
"mean_token_accuracy": 0.6990774724632501,
|
||
|
|
"num_tokens": 113207766.0,
|
||
|
|
"step": 1510
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.136980064958334,
|
||
|
|
"epoch": 0.4664543503988146,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 1.9236935107941272e-05,
|
||
|
|
"loss": 1.1307,
|
||
|
|
"mean_token_accuracy": 0.6950142856687307,
|
||
|
|
"num_tokens": 113564658.0,
|
||
|
|
"step": 1515
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1760700676590203,
|
||
|
|
"epoch": 0.4679938037004609,
|
||
|
|
"grad_norm": 0.79296875,
|
||
|
|
"learning_rate": 1.923071864169231e-05,
|
||
|
|
"loss": 1.1714,
|
||
|
|
"mean_token_accuracy": 0.6890874560922384,
|
||
|
|
"num_tokens": 113935260.0,
|
||
|
|
"step": 1520
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1633779585361481,
|
||
|
|
"epoch": 0.46953325700210713,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 1.922447796895982e-05,
|
||
|
|
"loss": 1.1552,
|
||
|
|
"mean_token_accuracy": 0.6897667136043311,
|
||
|
|
"num_tokens": 114300528.0,
|
||
|
|
"step": 1525
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.096606163494289,
|
||
|
|
"epoch": 0.47107271030375336,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 1.9218213106109234e-05,
|
||
|
|
"loss": 1.0923,
|
||
|
|
"mean_token_accuracy": 0.7029213454574347,
|
||
|
|
"num_tokens": 114670533.0,
|
||
|
|
"step": 1530
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0995285920798779,
|
||
|
|
"epoch": 0.47261216360539965,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.9211924069569422e-05,
|
||
|
|
"loss": 1.1045,
|
||
|
|
"mean_token_accuracy": 0.7023968610912561,
|
||
|
|
"num_tokens": 115033065.0,
|
||
|
|
"step": 1535
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1373300217092037,
|
||
|
|
"epoch": 0.4741516169070459,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.920561087583265e-05,
|
||
|
|
"loss": 1.1375,
|
||
|
|
"mean_token_accuracy": 0.6914490062743426,
|
||
|
|
"num_tokens": 115395504.0,
|
||
|
|
"step": 1540
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1257287595421075,
|
||
|
|
"epoch": 0.4756910702086921,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.919927354145454e-05,
|
||
|
|
"loss": 1.1123,
|
||
|
|
"mean_token_accuracy": 0.6976802740246058,
|
||
|
|
"num_tokens": 115768072.0,
|
||
|
|
"step": 1545
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1214987369254232,
|
||
|
|
"epoch": 0.4772305235103384,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 1.9192912083054003e-05,
|
||
|
|
"loss": 1.1191,
|
||
|
|
"mean_token_accuracy": 0.6951532650738954,
|
||
|
|
"num_tokens": 116143853.0,
|
||
|
|
"step": 1550
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1636530596762895,
|
||
|
|
"epoch": 0.47876997681198463,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 1.9186526517313227e-05,
|
||
|
|
"loss": 1.1578,
|
||
|
|
"mean_token_accuracy": 0.6905960509553551,
|
||
|
|
"num_tokens": 116501275.0,
|
||
|
|
"step": 1555
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1044294204562903,
|
||
|
|
"epoch": 0.4803094301136309,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.9180116860977613e-05,
|
||
|
|
"loss": 1.0837,
|
||
|
|
"mean_token_accuracy": 0.703742691129446,
|
||
|
|
"num_tokens": 116885903.0,
|
||
|
|
"step": 1560
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1139429537579417,
|
||
|
|
"epoch": 0.48184888341527715,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 1.9173683130855737e-05,
|
||
|
|
"loss": 1.104,
|
||
|
|
"mean_token_accuracy": 0.6986370030790567,
|
||
|
|
"num_tokens": 117262674.0,
|
||
|
|
"step": 1565
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0733769409358502,
|
||
|
|
"epoch": 0.4833883367169234,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.916722534381931e-05,
|
||
|
|
"loss": 1.0699,
|
||
|
|
"mean_token_accuracy": 0.7072780448943377,
|
||
|
|
"num_tokens": 117633261.0,
|
||
|
|
"step": 1570
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0940893176943063,
|
||
|
|
"epoch": 0.48492779001856967,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.916074351680312e-05,
|
||
|
|
"loss": 1.0899,
|
||
|
|
"mean_token_accuracy": 0.7040331065654755,
|
||
|
|
"num_tokens": 117994519.0,
|
||
|
|
"step": 1575
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1256133463233708,
|
||
|
|
"epoch": 0.4864672433202159,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.9154237666805005e-05,
|
||
|
|
"loss": 1.1178,
|
||
|
|
"mean_token_accuracy": 0.6980132691562175,
|
||
|
|
"num_tokens": 118357854.0,
|
||
|
|
"step": 1580
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1461247742176055,
|
||
|
|
"epoch": 0.48800669662186213,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 1.9147707810885798e-05,
|
||
|
|
"loss": 1.1273,
|
||
|
|
"mean_token_accuracy": 0.6937376245856285,
|
||
|
|
"num_tokens": 118727990.0,
|
||
|
|
"step": 1585
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.105697209574282,
|
||
|
|
"epoch": 0.4895461499235084,
|
||
|
|
"grad_norm": 0.78125,
|
||
|
|
"learning_rate": 1.9141153966169287e-05,
|
||
|
|
"loss": 1.0988,
|
||
|
|
"mean_token_accuracy": 0.6974029045552015,
|
||
|
|
"num_tokens": 119104452.0,
|
||
|
|
"step": 1590
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0973486991599202,
|
||
|
|
"epoch": 0.49108560322515465,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 1.9134576149842164e-05,
|
||
|
|
"loss": 1.0897,
|
||
|
|
"mean_token_accuracy": 0.7024951457977295,
|
||
|
|
"num_tokens": 119492541.0,
|
||
|
|
"step": 1595
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1395431403070688,
|
||
|
|
"epoch": 0.49262505652680094,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.9127974379153983e-05,
|
||
|
|
"loss": 1.1284,
|
||
|
|
"mean_token_accuracy": 0.6936916135251522,
|
||
|
|
"num_tokens": 119861950.0,
|
||
|
|
"step": 1600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.119615512341261,
|
||
|
|
"epoch": 0.4941645098284472,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.912134867141712e-05,
|
||
|
|
"loss": 1.1297,
|
||
|
|
"mean_token_accuracy": 0.6973624024540186,
|
||
|
|
"num_tokens": 120235402.0,
|
||
|
|
"step": 1605
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.127389458194375,
|
||
|
|
"epoch": 0.4957039631300934,
|
||
|
|
"grad_norm": 0.76171875,
|
||
|
|
"learning_rate": 1.9114699044006725e-05,
|
||
|
|
"loss": 1.1246,
|
||
|
|
"mean_token_accuracy": 0.6948788855224848,
|
||
|
|
"num_tokens": 120616115.0,
|
||
|
|
"step": 1610
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1248438712209463,
|
||
|
|
"epoch": 0.4972434164317397,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.910802551436066e-05,
|
||
|
|
"loss": 1.1298,
|
||
|
|
"mean_token_accuracy": 0.6980609927326441,
|
||
|
|
"num_tokens": 120995993.0,
|
||
|
|
"step": 1615
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0943362485617398,
|
||
|
|
"epoch": 0.4987828697333859,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 1.9101328099979496e-05,
|
||
|
|
"loss": 1.0998,
|
||
|
|
"mean_token_accuracy": 0.7005326244980097,
|
||
|
|
"num_tokens": 121357538.0,
|
||
|
|
"step": 1620
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.158146957680583,
|
||
|
|
"epoch": 0.5003223230350322,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 1.9094606818426403e-05,
|
||
|
|
"loss": 1.1539,
|
||
|
|
"mean_token_accuracy": 0.6923132240772247,
|
||
|
|
"num_tokens": 121710013.0,
|
||
|
|
"step": 1625
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1276648858562113,
|
||
|
|
"epoch": 0.5018617763366784,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 1.908786168732717e-05,
|
||
|
|
"loss": 1.1182,
|
||
|
|
"mean_token_accuracy": 0.6962565090507269,
|
||
|
|
"num_tokens": 122085828.0,
|
||
|
|
"step": 1630
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0802762266248465,
|
||
|
|
"epoch": 0.5034012296383247,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.9081092724370112e-05,
|
||
|
|
"loss": 1.0793,
|
||
|
|
"mean_token_accuracy": 0.7047099947929383,
|
||
|
|
"num_tokens": 122464366.0,
|
||
|
|
"step": 1635
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.136762074381113,
|
||
|
|
"epoch": 0.504940682939971,
|
||
|
|
"grad_norm": 0.68359375,
|
||
|
|
"learning_rate": 1.907429994730605e-05,
|
||
|
|
"loss": 1.1273,
|
||
|
|
"mean_token_accuracy": 0.6950546491891145,
|
||
|
|
"num_tokens": 122835610.0,
|
||
|
|
"step": 1640
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0965771291404962,
|
||
|
|
"epoch": 0.5064801362416171,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.9067483373948245e-05,
|
||
|
|
"loss": 1.0801,
|
||
|
|
"mean_token_accuracy": 0.7031420111656189,
|
||
|
|
"num_tokens": 123198090.0,
|
||
|
|
"step": 1645
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1391410026699305,
|
||
|
|
"epoch": 0.5080195895432634,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 1.9060643022172364e-05,
|
||
|
|
"loss": 1.138,
|
||
|
|
"mean_token_accuracy": 0.6941679731011391,
|
||
|
|
"num_tokens": 123574849.0,
|
||
|
|
"step": 1650
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1137908024713397,
|
||
|
|
"epoch": 0.5095590428449097,
|
||
|
|
"grad_norm": 0.77734375,
|
||
|
|
"learning_rate": 1.905377890991644e-05,
|
||
|
|
"loss": 1.1011,
|
||
|
|
"mean_token_accuracy": 0.7002455405890942,
|
||
|
|
"num_tokens": 123958243.0,
|
||
|
|
"step": 1655
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0767975924536586,
|
||
|
|
"epoch": 0.511098496146556,
|
||
|
|
"grad_norm": 0.65625,
|
||
|
|
"learning_rate": 1.90468910551808e-05,
|
||
|
|
"loss": 1.0628,
|
||
|
|
"mean_token_accuracy": 0.7064414627850055,
|
||
|
|
"num_tokens": 124354285.0,
|
||
|
|
"step": 1660
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1056279137730598,
|
||
|
|
"epoch": 0.5126379494482022,
|
||
|
|
"grad_norm": 0.76953125,
|
||
|
|
"learning_rate": 1.9039979476028044e-05,
|
||
|
|
"loss": 1.1108,
|
||
|
|
"mean_token_accuracy": 0.7005944430828095,
|
||
|
|
"num_tokens": 124716477.0,
|
||
|
|
"step": 1665
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.121751406788826,
|
||
|
|
"epoch": 0.5141774027498485,
|
||
|
|
"grad_norm": 0.7734375,
|
||
|
|
"learning_rate": 1.903304419058298e-05,
|
||
|
|
"loss": 1.1054,
|
||
|
|
"mean_token_accuracy": 0.6988046038895845,
|
||
|
|
"num_tokens": 125084153.0,
|
||
|
|
"step": 1670
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1113942619413137,
|
||
|
|
"epoch": 0.5157168560514948,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.9026085217032592e-05,
|
||
|
|
"loss": 1.1038,
|
||
|
|
"mean_token_accuracy": 0.6969317603856325,
|
||
|
|
"num_tokens": 125454921.0,
|
||
|
|
"step": 1675
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1110334230586887,
|
||
|
|
"epoch": 0.5172563093531409,
|
||
|
|
"grad_norm": 0.78125,
|
||
|
|
"learning_rate": 1.9019102573625966e-05,
|
||
|
|
"loss": 1.112,
|
||
|
|
"mean_token_accuracy": 0.6979748774319887,
|
||
|
|
"num_tokens": 125814552.0,
|
||
|
|
"step": 1680
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.115121967718005,
|
||
|
|
"epoch": 0.5187957626547872,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.9012096278674283e-05,
|
||
|
|
"loss": 1.1022,
|
||
|
|
"mean_token_accuracy": 0.6978176638484002,
|
||
|
|
"num_tokens": 126180100.0,
|
||
|
|
"step": 1685
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1214980090036988,
|
||
|
|
"epoch": 0.5203352159564335,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 1.9005066350550724e-05,
|
||
|
|
"loss": 1.1107,
|
||
|
|
"mean_token_accuracy": 0.6994861856102943,
|
||
|
|
"num_tokens": 126544212.0,
|
||
|
|
"step": 1690
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1030220981687306,
|
||
|
|
"epoch": 0.5218746692580797,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.899801280769046e-05,
|
||
|
|
"loss": 1.1027,
|
||
|
|
"mean_token_accuracy": 0.7016896925866604,
|
||
|
|
"num_tokens": 126936632.0,
|
||
|
|
"step": 1695
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0752276331186295,
|
||
|
|
"epoch": 0.523414122559726,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.8990935668590583e-05,
|
||
|
|
"loss": 1.0732,
|
||
|
|
"mean_token_accuracy": 0.706041594222188,
|
||
|
|
"num_tokens": 127334816.0,
|
||
|
|
"step": 1700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.137972903251648,
|
||
|
|
"epoch": 0.5249535758613723,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 1.8983834951810068e-05,
|
||
|
|
"loss": 1.1276,
|
||
|
|
"mean_token_accuracy": 0.6936356756836176,
|
||
|
|
"num_tokens": 127710399.0,
|
||
|
|
"step": 1705
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1167596075683832,
|
||
|
|
"epoch": 0.5264930291630184,
|
||
|
|
"grad_norm": 0.67578125,
|
||
|
|
"learning_rate": 1.8976710675969715e-05,
|
||
|
|
"loss": 1.1118,
|
||
|
|
"mean_token_accuracy": 0.6976578302681447,
|
||
|
|
"num_tokens": 128099437.0,
|
||
|
|
"step": 1710
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0992528446018697,
|
||
|
|
"epoch": 0.5280324824646647,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 1.896956285975211e-05,
|
||
|
|
"loss": 1.0875,
|
||
|
|
"mean_token_accuracy": 0.7028979767113924,
|
||
|
|
"num_tokens": 128467478.0,
|
||
|
|
"step": 1715
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0609646894037723,
|
||
|
|
"epoch": 0.529571935766311,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.8962391521901565e-05,
|
||
|
|
"loss": 1.0554,
|
||
|
|
"mean_token_accuracy": 0.7095225866883993,
|
||
|
|
"num_tokens": 128838188.0,
|
||
|
|
"step": 1720
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1092106204479932,
|
||
|
|
"epoch": 0.5311113890679573,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.895519668122408e-05,
|
||
|
|
"loss": 1.0967,
|
||
|
|
"mean_token_accuracy": 0.6991548746824264,
|
||
|
|
"num_tokens": 129214099.0,
|
||
|
|
"step": 1725
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0980365563184022,
|
||
|
|
"epoch": 0.5326508423696035,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 1.8947978356587283e-05,
|
||
|
|
"loss": 1.0886,
|
||
|
|
"mean_token_accuracy": 0.702478701993823,
|
||
|
|
"num_tokens": 129593189.0,
|
||
|
|
"step": 1730
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1081396404653787,
|
||
|
|
"epoch": 0.5341902956712498,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 1.8940736566920386e-05,
|
||
|
|
"loss": 1.0974,
|
||
|
|
"mean_token_accuracy": 0.7000274512916803,
|
||
|
|
"num_tokens": 129972696.0,
|
||
|
|
"step": 1735
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0982466185465456,
|
||
|
|
"epoch": 0.535729748972896,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.893347133121415e-05,
|
||
|
|
"loss": 1.0822,
|
||
|
|
"mean_token_accuracy": 0.7039383064955473,
|
||
|
|
"num_tokens": 130350766.0,
|
||
|
|
"step": 1740
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1378747086971999,
|
||
|
|
"epoch": 0.5372692022745422,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.8926182668520794e-05,
|
||
|
|
"loss": 1.1298,
|
||
|
|
"mean_token_accuracy": 0.6929653998464346,
|
||
|
|
"num_tokens": 130712736.0,
|
||
|
|
"step": 1745
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1180994376540183,
|
||
|
|
"epoch": 0.5388086555761885,
|
||
|
|
"grad_norm": 0.6640625,
|
||
|
|
"learning_rate": 1.8918870597953996e-05,
|
||
|
|
"loss": 1.1166,
|
||
|
|
"mean_token_accuracy": 0.697513160482049,
|
||
|
|
"num_tokens": 131108827.0,
|
||
|
|
"step": 1750
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1118130307644605,
|
||
|
|
"epoch": 0.5403481088778348,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 1.89115351386888e-05,
|
||
|
|
"loss": 1.1135,
|
||
|
|
"mean_token_accuracy": 0.7016211155802011,
|
||
|
|
"num_tokens": 131484362.0,
|
||
|
|
"step": 1755
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.154317499510944,
|
||
|
|
"epoch": 0.541887562179481,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.8904176309961606e-05,
|
||
|
|
"loss": 1.1623,
|
||
|
|
"mean_token_accuracy": 0.6900074496865273,
|
||
|
|
"num_tokens": 131854979.0,
|
||
|
|
"step": 1760
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1418317448347808,
|
||
|
|
"epoch": 0.5434270154811273,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 1.8896794131070073e-05,
|
||
|
|
"loss": 1.1409,
|
||
|
|
"mean_token_accuracy": 0.6961004845798016,
|
||
|
|
"num_tokens": 132231075.0,
|
||
|
|
"step": 1765
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1063750840723514,
|
||
|
|
"epoch": 0.5449664687827735,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 1.8889388621373107e-05,
|
||
|
|
"loss": 1.094,
|
||
|
|
"mean_token_accuracy": 0.6988186117261648,
|
||
|
|
"num_tokens": 132614827.0,
|
||
|
|
"step": 1770
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0908017337322236,
|
||
|
|
"epoch": 0.5465059220844197,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 1.88819598002908e-05,
|
||
|
|
"loss": 1.0762,
|
||
|
|
"mean_token_accuracy": 0.7036438055336476,
|
||
|
|
"num_tokens": 133006606.0,
|
||
|
|
"step": 1775
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1063918098807335,
|
||
|
|
"epoch": 0.548045375386066,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.887450768730436e-05,
|
||
|
|
"loss": 1.0865,
|
||
|
|
"mean_token_accuracy": 0.7016949482262135,
|
||
|
|
"num_tokens": 133391329.0,
|
||
|
|
"step": 1780
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.111767608858645,
|
||
|
|
"epoch": 0.5495848286877123,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.886703230195609e-05,
|
||
|
|
"loss": 1.1104,
|
||
|
|
"mean_token_accuracy": 0.7000030245631933,
|
||
|
|
"num_tokens": 133783664.0,
|
||
|
|
"step": 1785
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1513528198003768,
|
||
|
|
"epoch": 0.5511242819893585,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.8859533663849318e-05,
|
||
|
|
"loss": 1.1441,
|
||
|
|
"mean_token_accuracy": 0.6949969541281462,
|
||
|
|
"num_tokens": 134154971.0,
|
||
|
|
"step": 1790
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.109261892735958,
|
||
|
|
"epoch": 0.5526637352910048,
|
||
|
|
"grad_norm": 0.6875,
|
||
|
|
"learning_rate": 1.885201179264834e-05,
|
||
|
|
"loss": 1.1072,
|
||
|
|
"mean_token_accuracy": 0.7005063198506832,
|
||
|
|
"num_tokens": 134541521.0,
|
||
|
|
"step": 1795
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1210583060979844,
|
||
|
|
"epoch": 0.554203188592651,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.8844466708078398e-05,
|
||
|
|
"loss": 1.1179,
|
||
|
|
"mean_token_accuracy": 0.6973602317273617,
|
||
|
|
"num_tokens": 134909569.0,
|
||
|
|
"step": 1800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1100708212703467,
|
||
|
|
"epoch": 0.5557426418942973,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.8836898429925586e-05,
|
||
|
|
"loss": 1.09,
|
||
|
|
"mean_token_accuracy": 0.7016674302518368,
|
||
|
|
"num_tokens": 135278194.0,
|
||
|
|
"step": 1805
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.133229278959334,
|
||
|
|
"epoch": 0.5572820951959435,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 1.8829306978036837e-05,
|
||
|
|
"loss": 1.1279,
|
||
|
|
"mean_token_accuracy": 0.6966449148952961,
|
||
|
|
"num_tokens": 135644126.0,
|
||
|
|
"step": 1810
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.094052490964532,
|
||
|
|
"epoch": 0.5588215484975898,
|
||
|
|
"grad_norm": 0.68359375,
|
||
|
|
"learning_rate": 1.8821692372319852e-05,
|
||
|
|
"loss": 1.0881,
|
||
|
|
"mean_token_accuracy": 0.7018960192799568,
|
||
|
|
"num_tokens": 136040093.0,
|
||
|
|
"step": 1815
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.102319024130702,
|
||
|
|
"epoch": 0.5603610017992361,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 1.8814054632743038e-05,
|
||
|
|
"loss": 1.1009,
|
||
|
|
"mean_token_accuracy": 0.7015113096684218,
|
||
|
|
"num_tokens": 136421328.0,
|
||
|
|
"step": 1820
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1264159340411424,
|
||
|
|
"epoch": 0.5619004551008823,
|
||
|
|
"grad_norm": 0.68359375,
|
||
|
|
"learning_rate": 1.8806393779335483e-05,
|
||
|
|
"loss": 1.1106,
|
||
|
|
"mean_token_accuracy": 0.6967556666582823,
|
||
|
|
"num_tokens": 136796837.0,
|
||
|
|
"step": 1825
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1152265276759863,
|
||
|
|
"epoch": 0.5634399084025286,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 1.879870983218688e-05,
|
||
|
|
"loss": 1.0994,
|
||
|
|
"mean_token_accuracy": 0.6976462483406067,
|
||
|
|
"num_tokens": 137174396.0,
|
||
|
|
"step": 1830
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.116674688272178,
|
||
|
|
"epoch": 0.5649793617041748,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.8791002811447483e-05,
|
||
|
|
"loss": 1.1104,
|
||
|
|
"mean_token_accuracy": 0.7000731214880943,
|
||
|
|
"num_tokens": 137556532.0,
|
||
|
|
"step": 1835
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1110275972634553,
|
||
|
|
"epoch": 0.566518815005821,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.878327273732806e-05,
|
||
|
|
"loss": 1.1098,
|
||
|
|
"mean_token_accuracy": 0.698979677259922,
|
||
|
|
"num_tokens": 137949242.0,
|
||
|
|
"step": 1840
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0584419948980213,
|
||
|
|
"epoch": 0.5680582683074673,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 1.8775519630099822e-05,
|
||
|
|
"loss": 1.0544,
|
||
|
|
"mean_token_accuracy": 0.7107167650014162,
|
||
|
|
"num_tokens": 138325463.0,
|
||
|
|
"step": 1845
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.120271611586213,
|
||
|
|
"epoch": 0.5695977216091136,
|
||
|
|
"grad_norm": 0.76171875,
|
||
|
|
"learning_rate": 1.8767743510094395e-05,
|
||
|
|
"loss": 1.1202,
|
||
|
|
"mean_token_accuracy": 0.6949244394898415,
|
||
|
|
"num_tokens": 138692189.0,
|
||
|
|
"step": 1850
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1016495576128364,
|
||
|
|
"epoch": 0.5711371749107598,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 1.8759944397703748e-05,
|
||
|
|
"loss": 1.1078,
|
||
|
|
"mean_token_accuracy": 0.7005269210785627,
|
||
|
|
"num_tokens": 139066457.0,
|
||
|
|
"step": 1855
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1251827346161007,
|
||
|
|
"epoch": 0.5726766282124061,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.8752122313380137e-05,
|
||
|
|
"loss": 1.1007,
|
||
|
|
"mean_token_accuracy": 0.6988253463059664,
|
||
|
|
"num_tokens": 139426172.0,
|
||
|
|
"step": 1860
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1180114712566138,
|
||
|
|
"epoch": 0.5742160815140523,
|
||
|
|
"grad_norm": 0.68359375,
|
||
|
|
"learning_rate": 1.874427727763607e-05,
|
||
|
|
"loss": 1.1112,
|
||
|
|
"mean_token_accuracy": 0.69961117208004,
|
||
|
|
"num_tokens": 139801332.0,
|
||
|
|
"step": 1865
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.129542938247323,
|
||
|
|
"epoch": 0.5757555348156985,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.8736409311044244e-05,
|
||
|
|
"loss": 1.1289,
|
||
|
|
"mean_token_accuracy": 0.695055254548788,
|
||
|
|
"num_tokens": 140171056.0,
|
||
|
|
"step": 1870
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0734907962381839,
|
||
|
|
"epoch": 0.5772949881173448,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 1.8728518434237476e-05,
|
||
|
|
"loss": 1.0626,
|
||
|
|
"mean_token_accuracy": 0.7072399683296681,
|
||
|
|
"num_tokens": 140566923.0,
|
||
|
|
"step": 1875
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1328235883265734,
|
||
|
|
"epoch": 0.5788344414189911,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.8720604667908673e-05,
|
||
|
|
"loss": 1.1338,
|
||
|
|
"mean_token_accuracy": 0.6954614106565714,
|
||
|
|
"num_tokens": 140929032.0,
|
||
|
|
"step": 1880
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1626869395375252,
|
||
|
|
"epoch": 0.5803738947206374,
|
||
|
|
"grad_norm": 0.6875,
|
||
|
|
"learning_rate": 1.8712668032810767e-05,
|
||
|
|
"loss": 1.153,
|
||
|
|
"mean_token_accuracy": 0.6904126744717359,
|
||
|
|
"num_tokens": 141306794.0,
|
||
|
|
"step": 1885
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0925796177238225,
|
||
|
|
"epoch": 0.5819133480222836,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 1.8704708549756657e-05,
|
||
|
|
"loss": 1.0896,
|
||
|
|
"mean_token_accuracy": 0.7039735574275255,
|
||
|
|
"num_tokens": 141679922.0,
|
||
|
|
"step": 1890
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1325601134449244,
|
||
|
|
"epoch": 0.5834528013239298,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.869672623961916e-05,
|
||
|
|
"loss": 1.1236,
|
||
|
|
"mean_token_accuracy": 0.695359307155013,
|
||
|
|
"num_tokens": 142064042.0,
|
||
|
|
"step": 1895
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1089297072961926,
|
||
|
|
"epoch": 0.5849922546255761,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.8688721123330952e-05,
|
||
|
|
"loss": 1.0961,
|
||
|
|
"mean_token_accuracy": 0.7020201427862048,
|
||
|
|
"num_tokens": 142450974.0,
|
||
|
|
"step": 1900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0782432477921247,
|
||
|
|
"epoch": 0.5865317079272223,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.868069322188452e-05,
|
||
|
|
"loss": 1.077,
|
||
|
|
"mean_token_accuracy": 0.7056647684425116,
|
||
|
|
"num_tokens": 142833583.0,
|
||
|
|
"step": 1905
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.090103941783309,
|
||
|
|
"epoch": 0.5880711612288686,
|
||
|
|
"grad_norm": 0.67578125,
|
||
|
|
"learning_rate": 1.8672642556332093e-05,
|
||
|
|
"loss": 1.0815,
|
||
|
|
"mean_token_accuracy": 0.7041718065738678,
|
||
|
|
"num_tokens": 143202881.0,
|
||
|
|
"step": 1910
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1132526526227593,
|
||
|
|
"epoch": 0.5896106145305149,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 1.8664569147785615e-05,
|
||
|
|
"loss": 1.1143,
|
||
|
|
"mean_token_accuracy": 0.7002504725009203,
|
||
|
|
"num_tokens": 143575381.0,
|
||
|
|
"step": 1915
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0923281263560056,
|
||
|
|
"epoch": 0.5911500678321611,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 1.8656473017416644e-05,
|
||
|
|
"loss": 1.0894,
|
||
|
|
"mean_token_accuracy": 0.7025896862149239,
|
||
|
|
"num_tokens": 143945584.0,
|
||
|
|
"step": 1920
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1606475939974188,
|
||
|
|
"epoch": 0.5926895211338074,
|
||
|
|
"grad_norm": 0.6875,
|
||
|
|
"learning_rate": 1.864835418645635e-05,
|
||
|
|
"loss": 1.1518,
|
||
|
|
"mean_token_accuracy": 0.69000857565552,
|
||
|
|
"num_tokens": 144327615.0,
|
||
|
|
"step": 1925
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.076964562945068,
|
||
|
|
"epoch": 0.5942289744354536,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 1.8640212676195415e-05,
|
||
|
|
"loss": 1.0674,
|
||
|
|
"mean_token_accuracy": 0.705032504722476,
|
||
|
|
"num_tokens": 144702165.0,
|
||
|
|
"step": 1930
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1039565896615386,
|
||
|
|
"epoch": 0.5957684277370998,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 1.8632048507984e-05,
|
||
|
|
"loss": 1.0888,
|
||
|
|
"mean_token_accuracy": 0.7024720892310142,
|
||
|
|
"num_tokens": 145076417.0,
|
||
|
|
"step": 1935
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.093964084982872,
|
||
|
|
"epoch": 0.5973078810387461,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 1.862386170323169e-05,
|
||
|
|
"loss": 1.081,
|
||
|
|
"mean_token_accuracy": 0.7047437366098166,
|
||
|
|
"num_tokens": 145455366.0,
|
||
|
|
"step": 1940
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1448205880820752,
|
||
|
|
"epoch": 0.5988473343403924,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 1.861565228340742e-05,
|
||
|
|
"loss": 1.1458,
|
||
|
|
"mean_token_accuracy": 0.6915356520563364,
|
||
|
|
"num_tokens": 145838812.0,
|
||
|
|
"step": 1945
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1012870259582996,
|
||
|
|
"epoch": 0.6003867876420386,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.860742027003944e-05,
|
||
|
|
"loss": 1.0907,
|
||
|
|
"mean_token_accuracy": 0.7037778791040182,
|
||
|
|
"num_tokens": 146208431.0,
|
||
|
|
"step": 1950
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1052306432276964,
|
||
|
|
"epoch": 0.6019262409436849,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 1.8599165684715238e-05,
|
||
|
|
"loss": 1.0995,
|
||
|
|
"mean_token_accuracy": 0.7021346285939216,
|
||
|
|
"num_tokens": 146587958.0,
|
||
|
|
"step": 1955
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0908923922106624,
|
||
|
|
"epoch": 0.6034656942453311,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.8590888549081514e-05,
|
||
|
|
"loss": 1.0687,
|
||
|
|
"mean_token_accuracy": 0.7040816470980644,
|
||
|
|
"num_tokens": 146956196.0,
|
||
|
|
"step": 1960
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1141000390052795,
|
||
|
|
"epoch": 0.6050051475469774,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.8582588884844086e-05,
|
||
|
|
"loss": 1.1103,
|
||
|
|
"mean_token_accuracy": 0.6970112754032016,
|
||
|
|
"num_tokens": 147320054.0,
|
||
|
|
"step": 1965
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0900843566283585,
|
||
|
|
"epoch": 0.6065446008486236,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.857426671376785e-05,
|
||
|
|
"loss": 1.0764,
|
||
|
|
"mean_token_accuracy": 0.7049407433718443,
|
||
|
|
"num_tokens": 147703735.0,
|
||
|
|
"step": 1970
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1240591725334526,
|
||
|
|
"epoch": 0.6080840541502699,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.8565922057676738e-05,
|
||
|
|
"loss": 1.1196,
|
||
|
|
"mean_token_accuracy": 0.6968345880508423,
|
||
|
|
"num_tokens": 148073305.0,
|
||
|
|
"step": 1975
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1471635062247514,
|
||
|
|
"epoch": 0.6096235074519162,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.855755493845363e-05,
|
||
|
|
"loss": 1.1427,
|
||
|
|
"mean_token_accuracy": 0.6943592650815844,
|
||
|
|
"num_tokens": 148444038.0,
|
||
|
|
"step": 1980
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.132018794864416,
|
||
|
|
"epoch": 0.6111629607535624,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.8549165378040328e-05,
|
||
|
|
"loss": 1.1394,
|
||
|
|
"mean_token_accuracy": 0.6943659249693155,
|
||
|
|
"num_tokens": 148822233.0,
|
||
|
|
"step": 1985
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0830021239817142,
|
||
|
|
"epoch": 0.6127024140552086,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 1.8540753398437473e-05,
|
||
|
|
"loss": 1.0754,
|
||
|
|
"mean_token_accuracy": 0.7037800218909979,
|
||
|
|
"num_tokens": 149211582.0,
|
||
|
|
"step": 1990
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1431629927828908,
|
||
|
|
"epoch": 0.6142418673568549,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 1.8532319021704502e-05,
|
||
|
|
"loss": 1.1372,
|
||
|
|
"mean_token_accuracy": 0.6933602422475815,
|
||
|
|
"num_tokens": 149586556.0,
|
||
|
|
"step": 1995
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1282612700015306,
|
||
|
|
"epoch": 0.6157813206585011,
|
||
|
|
"grad_norm": 0.7734375,
|
||
|
|
"learning_rate": 1.852386226995958e-05,
|
||
|
|
"loss": 1.1324,
|
||
|
|
"mean_token_accuracy": 0.6929793257266283,
|
||
|
|
"num_tokens": 149951555.0,
|
||
|
|
"step": 2000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.133526834100485,
|
||
|
|
"epoch": 0.6173207739601474,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 1.851538316537956e-05,
|
||
|
|
"loss": 1.1148,
|
||
|
|
"mean_token_accuracy": 0.6985038254410029,
|
||
|
|
"num_tokens": 150316391.0,
|
||
|
|
"step": 2005
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0895660797134041,
|
||
|
|
"epoch": 0.6188602272617937,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.85068817301999e-05,
|
||
|
|
"loss": 1.0834,
|
||
|
|
"mean_token_accuracy": 0.7006191689521074,
|
||
|
|
"num_tokens": 150688099.0,
|
||
|
|
"step": 2010
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1398447638377547,
|
||
|
|
"epoch": 0.6203996805634399,
|
||
|
|
"grad_norm": 0.80859375,
|
||
|
|
"learning_rate": 1.8498357986714624e-05,
|
||
|
|
"loss": 1.1352,
|
||
|
|
"mean_token_accuracy": 0.6944937206804752,
|
||
|
|
"num_tokens": 151052692.0,
|
||
|
|
"step": 2015
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.15070056989789,
|
||
|
|
"epoch": 0.6219391338650861,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.8489811957276254e-05,
|
||
|
|
"loss": 1.1302,
|
||
|
|
"mean_token_accuracy": 0.6918449435383082,
|
||
|
|
"num_tokens": 151430576.0,
|
||
|
|
"step": 2020
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1349072763696313,
|
||
|
|
"epoch": 0.6234785871667324,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 1.848124366429576e-05,
|
||
|
|
"loss": 1.124,
|
||
|
|
"mean_token_accuracy": 0.6965412970632314,
|
||
|
|
"num_tokens": 151792787.0,
|
||
|
|
"step": 2025
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1112722108140587,
|
||
|
|
"epoch": 0.6250180404683787,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.8472653130242485e-05,
|
||
|
|
"loss": 1.112,
|
||
|
|
"mean_token_accuracy": 0.7012020844966174,
|
||
|
|
"num_tokens": 152168683.0,
|
||
|
|
"step": 2030
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1380321444943546,
|
||
|
|
"epoch": 0.6265574937700249,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 1.846404037764411e-05,
|
||
|
|
"loss": 1.1238,
|
||
|
|
"mean_token_accuracy": 0.6950769029557705,
|
||
|
|
"num_tokens": 152545104.0,
|
||
|
|
"step": 2035
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1669288910925388,
|
||
|
|
"epoch": 0.6280969470716712,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.8455405429086576e-05,
|
||
|
|
"loss": 1.1662,
|
||
|
|
"mean_token_accuracy": 0.6907285895198584,
|
||
|
|
"num_tokens": 152918857.0,
|
||
|
|
"step": 2040
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.144454488158226,
|
||
|
|
"epoch": 0.6296364003733175,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 1.844674830721402e-05,
|
||
|
|
"loss": 1.1435,
|
||
|
|
"mean_token_accuracy": 0.6939992997795343,
|
||
|
|
"num_tokens": 153304877.0,
|
||
|
|
"step": 2045
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1009058840572834,
|
||
|
|
"epoch": 0.6311758536749636,
|
||
|
|
"grad_norm": 0.671875,
|
||
|
|
"learning_rate": 1.8438069034728738e-05,
|
||
|
|
"loss": 1.0929,
|
||
|
|
"mean_token_accuracy": 0.7022685822099447,
|
||
|
|
"num_tokens": 153689362.0,
|
||
|
|
"step": 2050
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1297755874693394,
|
||
|
|
"epoch": 0.6327153069766099,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 1.8429367634391116e-05,
|
||
|
|
"loss": 1.1184,
|
||
|
|
"mean_token_accuracy": 0.6954657424241304,
|
||
|
|
"num_tokens": 154059184.0,
|
||
|
|
"step": 2055
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1133303932845593,
|
||
|
|
"epoch": 0.6342547602782562,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.8420644129019555e-05,
|
||
|
|
"loss": 1.0993,
|
||
|
|
"mean_token_accuracy": 0.7026321858167648,
|
||
|
|
"num_tokens": 154435058.0,
|
||
|
|
"step": 2060
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1748030522838235,
|
||
|
|
"epoch": 0.6357942135799024,
|
||
|
|
"grad_norm": 0.7734375,
|
||
|
|
"learning_rate": 1.8411898541490433e-05,
|
||
|
|
"loss": 1.1758,
|
||
|
|
"mean_token_accuracy": 0.6871446866542101,
|
||
|
|
"num_tokens": 154795848.0,
|
||
|
|
"step": 2065
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1518771335482598,
|
||
|
|
"epoch": 0.6373336668815487,
|
||
|
|
"grad_norm": 0.78125,
|
||
|
|
"learning_rate": 1.8403130894738038e-05,
|
||
|
|
"loss": 1.1465,
|
||
|
|
"mean_token_accuracy": 0.6935045797377825,
|
||
|
|
"num_tokens": 155153389.0,
|
||
|
|
"step": 2070
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1386884730309248,
|
||
|
|
"epoch": 0.638873120183195,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 1.8394341211754496e-05,
|
||
|
|
"loss": 1.1447,
|
||
|
|
"mean_token_accuracy": 0.6941363386809826,
|
||
|
|
"num_tokens": 155515587.0,
|
||
|
|
"step": 2075
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1431025385856628,
|
||
|
|
"epoch": 0.6404125734848412,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 1.8385529515589726e-05,
|
||
|
|
"loss": 1.1386,
|
||
|
|
"mean_token_accuracy": 0.6931343143805861,
|
||
|
|
"num_tokens": 155891606.0,
|
||
|
|
"step": 2080
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1411488141864539,
|
||
|
|
"epoch": 0.6419520267864874,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.8376695829351378e-05,
|
||
|
|
"loss": 1.1272,
|
||
|
|
"mean_token_accuracy": 0.6926099382340908,
|
||
|
|
"num_tokens": 156273092.0,
|
||
|
|
"step": 2085
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1294952983036637,
|
||
|
|
"epoch": 0.6434914800881337,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 1.836784017620476e-05,
|
||
|
|
"loss": 1.1181,
|
||
|
|
"mean_token_accuracy": 0.6974793665111065,
|
||
|
|
"num_tokens": 156641690.0,
|
||
|
|
"step": 2090
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.142337768152356,
|
||
|
|
"epoch": 0.6450309333897799,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.8358962579372797e-05,
|
||
|
|
"loss": 1.1507,
|
||
|
|
"mean_token_accuracy": 0.6917462650686502,
|
||
|
|
"num_tokens": 157011422.0,
|
||
|
|
"step": 2095
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0961598601192235,
|
||
|
|
"epoch": 0.6465703866914262,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.835006306213594e-05,
|
||
|
|
"loss": 1.1,
|
||
|
|
"mean_token_accuracy": 0.703354274854064,
|
||
|
|
"num_tokens": 157388966.0,
|
||
|
|
"step": 2100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.118635695055127,
|
||
|
|
"epoch": 0.6481098399930725,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.834114164783215e-05,
|
||
|
|
"loss": 1.1093,
|
||
|
|
"mean_token_accuracy": 0.6975133273750543,
|
||
|
|
"num_tokens": 157781000.0,
|
||
|
|
"step": 2105
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1703529071062804,
|
||
|
|
"epoch": 0.6496492932947188,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 1.8332198359856782e-05,
|
||
|
|
"loss": 1.1621,
|
||
|
|
"mean_token_accuracy": 0.6912976618856191,
|
||
|
|
"num_tokens": 158148821.0,
|
||
|
|
"step": 2110
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.139431282877922,
|
||
|
|
"epoch": 0.6511887465963649,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.8323233221662574e-05,
|
||
|
|
"loss": 1.1272,
|
||
|
|
"mean_token_accuracy": 0.6936106860637665,
|
||
|
|
"num_tokens": 158519240.0,
|
||
|
|
"step": 2115
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.137386091426015,
|
||
|
|
"epoch": 0.6527281998980112,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 1.8314246256759556e-05,
|
||
|
|
"loss": 1.1254,
|
||
|
|
"mean_token_accuracy": 0.6957115132361651,
|
||
|
|
"num_tokens": 158896885.0,
|
||
|
|
"step": 2120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.132150064781308,
|
||
|
|
"epoch": 0.6542676531996575,
|
||
|
|
"grad_norm": 0.796875,
|
||
|
|
"learning_rate": 1.8305237488714995e-05,
|
||
|
|
"loss": 1.1325,
|
||
|
|
"mean_token_accuracy": 0.6934053935110569,
|
||
|
|
"num_tokens": 159265519.0,
|
||
|
|
"step": 2125
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1579696323722601,
|
||
|
|
"epoch": 0.6558071065013037,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 1.8296206941153333e-05,
|
||
|
|
"loss": 1.1517,
|
||
|
|
"mean_token_accuracy": 0.689340352639556,
|
||
|
|
"num_tokens": 159634386.0,
|
||
|
|
"step": 2130
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.142648032307625,
|
||
|
|
"epoch": 0.65734655980295,
|
||
|
|
"grad_norm": 0.76953125,
|
||
|
|
"learning_rate": 1.8287154637756125e-05,
|
||
|
|
"loss": 1.1318,
|
||
|
|
"mean_token_accuracy": 0.6927073132246733,
|
||
|
|
"num_tokens": 160008254.0,
|
||
|
|
"step": 2135
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1443445168435573,
|
||
|
|
"epoch": 0.6588860131045963,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 1.827808060226199e-05,
|
||
|
|
"loss": 1.1434,
|
||
|
|
"mean_token_accuracy": 0.6936221666634083,
|
||
|
|
"num_tokens": 160367712.0,
|
||
|
|
"step": 2140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0978737404569983,
|
||
|
|
"epoch": 0.6604254664062424,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 1.8268984858466524e-05,
|
||
|
|
"loss": 1.0886,
|
||
|
|
"mean_token_accuracy": 0.7030142482370139,
|
||
|
|
"num_tokens": 160733299.0,
|
||
|
|
"step": 2145
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1296749690547585,
|
||
|
|
"epoch": 0.6619649197078887,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 1.825986743022225e-05,
|
||
|
|
"loss": 1.1273,
|
||
|
|
"mean_token_accuracy": 0.6956211663782597,
|
||
|
|
"num_tokens": 161103268.0,
|
||
|
|
"step": 2150
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1379246138036252,
|
||
|
|
"epoch": 0.663504373009535,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 1.825072834143857e-05,
|
||
|
|
"loss": 1.1355,
|
||
|
|
"mean_token_accuracy": 0.6943081360310316,
|
||
|
|
"num_tokens": 161476085.0,
|
||
|
|
"step": 2155
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0913480401039124,
|
||
|
|
"epoch": 0.6650438263111812,
|
||
|
|
"grad_norm": 0.76171875,
|
||
|
|
"learning_rate": 1.8241567616081674e-05,
|
||
|
|
"loss": 1.0802,
|
||
|
|
"mean_token_accuracy": 0.7027659468352795,
|
||
|
|
"num_tokens": 161846954.0,
|
||
|
|
"step": 2160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1175310904160143,
|
||
|
|
"epoch": 0.6665832796128275,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 1.823238527817449e-05,
|
||
|
|
"loss": 1.1097,
|
||
|
|
"mean_token_accuracy": 0.6994062628597021,
|
||
|
|
"num_tokens": 162214500.0,
|
||
|
|
"step": 2165
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0967560213059186,
|
||
|
|
"epoch": 0.6681227329144738,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.8223181351796642e-05,
|
||
|
|
"loss": 1.1022,
|
||
|
|
"mean_token_accuracy": 0.7011716574430465,
|
||
|
|
"num_tokens": 162600939.0,
|
||
|
|
"step": 2170
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1191772257909178,
|
||
|
|
"epoch": 0.66966218621612,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.8213955861084342e-05,
|
||
|
|
"loss": 1.1047,
|
||
|
|
"mean_token_accuracy": 0.698114974796772,
|
||
|
|
"num_tokens": 162989103.0,
|
||
|
|
"step": 2175
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.078780804388225,
|
||
|
|
"epoch": 0.6712016395177662,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 1.8204708830230372e-05,
|
||
|
|
"loss": 1.0769,
|
||
|
|
"mean_token_accuracy": 0.7026279237121343,
|
||
|
|
"num_tokens": 163365199.0,
|
||
|
|
"step": 2180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.102193933725357,
|
||
|
|
"epoch": 0.6727410928194125,
|
||
|
|
"grad_norm": 0.81640625,
|
||
|
|
"learning_rate": 1.819544028348399e-05,
|
||
|
|
"loss": 1.1007,
|
||
|
|
"mean_token_accuracy": 0.7027922391891479,
|
||
|
|
"num_tokens": 163737628.0,
|
||
|
|
"step": 2185
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1276447394862772,
|
||
|
|
"epoch": 0.6742805461210588,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.8186150245150876e-05,
|
||
|
|
"loss": 1.1184,
|
||
|
|
"mean_token_accuracy": 0.6979492522776127,
|
||
|
|
"num_tokens": 164121012.0,
|
||
|
|
"step": 2190
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1386257752776145,
|
||
|
|
"epoch": 0.675819999422705,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 1.8176838739593078e-05,
|
||
|
|
"loss": 1.1337,
|
||
|
|
"mean_token_accuracy": 0.6927195183932782,
|
||
|
|
"num_tokens": 164482798.0,
|
||
|
|
"step": 2195
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.127764510177076,
|
||
|
|
"epoch": 0.6773594527243513,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.816750579122893e-05,
|
||
|
|
"loss": 1.1284,
|
||
|
|
"mean_token_accuracy": 0.6954803835600615,
|
||
|
|
"num_tokens": 164859917.0,
|
||
|
|
"step": 2200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0942645370960236,
|
||
|
|
"epoch": 0.6788989060259976,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.8158151424533002e-05,
|
||
|
|
"loss": 1.0873,
|
||
|
|
"mean_token_accuracy": 0.7031883802264929,
|
||
|
|
"num_tokens": 165247314.0,
|
||
|
|
"step": 2205
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1059243634343148,
|
||
|
|
"epoch": 0.6804383593276437,
|
||
|
|
"grad_norm": 0.68359375,
|
||
|
|
"learning_rate": 1.814877566403603e-05,
|
||
|
|
"loss": 1.1071,
|
||
|
|
"mean_token_accuracy": 0.6975095085799694,
|
||
|
|
"num_tokens": 165636534.0,
|
||
|
|
"step": 2210
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1076618060469627,
|
||
|
|
"epoch": 0.68197781262929,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 1.813937853432485e-05,
|
||
|
|
"loss": 1.0991,
|
||
|
|
"mean_token_accuracy": 0.7021389830857515,
|
||
|
|
"num_tokens": 166000924.0,
|
||
|
|
"step": 2215
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1220650862902404,
|
||
|
|
"epoch": 0.6835172659309363,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 1.8129960060042345e-05,
|
||
|
|
"loss": 1.1088,
|
||
|
|
"mean_token_accuracy": 0.6972477741539478,
|
||
|
|
"num_tokens": 166359772.0,
|
||
|
|
"step": 2220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.068718210607767,
|
||
|
|
"epoch": 0.6850567192325825,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 1.8120520265887364e-05,
|
||
|
|
"loss": 1.0561,
|
||
|
|
"mean_token_accuracy": 0.7072693090885878,
|
||
|
|
"num_tokens": 166735638.0,
|
||
|
|
"step": 2225
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1178116356953978,
|
||
|
|
"epoch": 0.6865961725342288,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.8111059176614665e-05,
|
||
|
|
"loss": 1.1218,
|
||
|
|
"mean_token_accuracy": 0.6972925592213869,
|
||
|
|
"num_tokens": 167111121.0,
|
||
|
|
"step": 2230
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.130570314452052,
|
||
|
|
"epoch": 0.6881356258358751,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 1.8101576817034853e-05,
|
||
|
|
"loss": 1.126,
|
||
|
|
"mean_token_accuracy": 0.6954567573964596,
|
||
|
|
"num_tokens": 167477412.0,
|
||
|
|
"step": 2235
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1099465020000934,
|
||
|
|
"epoch": 0.6896750791375212,
|
||
|
|
"grad_norm": 0.6875,
|
||
|
|
"learning_rate": 1.8092073212014307e-05,
|
||
|
|
"loss": 1.1033,
|
||
|
|
"mean_token_accuracy": 0.7016259111464024,
|
||
|
|
"num_tokens": 167840862.0,
|
||
|
|
"step": 2240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0539396397769452,
|
||
|
|
"epoch": 0.6912145324391675,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.808254838647513e-05,
|
||
|
|
"loss": 1.056,
|
||
|
|
"mean_token_accuracy": 0.7084746707230807,
|
||
|
|
"num_tokens": 168239811.0,
|
||
|
|
"step": 2245
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0955925872549415,
|
||
|
|
"epoch": 0.6927539857408138,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.807300236539506e-05,
|
||
|
|
"loss": 1.0801,
|
||
|
|
"mean_token_accuracy": 0.7024415228515863,
|
||
|
|
"num_tokens": 168629807.0,
|
||
|
|
"step": 2250
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1386502474546432,
|
||
|
|
"epoch": 0.69429343904246,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.806343517380743e-05,
|
||
|
|
"loss": 1.1515,
|
||
|
|
"mean_token_accuracy": 0.6970106501132249,
|
||
|
|
"num_tokens": 168997119.0,
|
||
|
|
"step": 2255
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1127931490540504,
|
||
|
|
"epoch": 0.6958328923441063,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.8053846836801076e-05,
|
||
|
|
"loss": 1.1158,
|
||
|
|
"mean_token_accuracy": 0.6967024650424719,
|
||
|
|
"num_tokens": 169368874.0,
|
||
|
|
"step": 2260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1397660907357932,
|
||
|
|
"epoch": 0.6973723456457526,
|
||
|
|
"grad_norm": 0.68359375,
|
||
|
|
"learning_rate": 1.8044237379520305e-05,
|
||
|
|
"loss": 1.1374,
|
||
|
|
"mean_token_accuracy": 0.6930058509111404,
|
||
|
|
"num_tokens": 169744480.0,
|
||
|
|
"step": 2265
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1199751045554875,
|
||
|
|
"epoch": 0.6989117989473989,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.8034606827164795e-05,
|
||
|
|
"loss": 1.1056,
|
||
|
|
"mean_token_accuracy": 0.6997339356690645,
|
||
|
|
"num_tokens": 170127695.0,
|
||
|
|
"step": 2270
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.119225537776947,
|
||
|
|
"epoch": 0.700451252249045,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.8024955204989537e-05,
|
||
|
|
"loss": 1.1199,
|
||
|
|
"mean_token_accuracy": 0.6996861334890128,
|
||
|
|
"num_tokens": 170508510.0,
|
||
|
|
"step": 2275
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1192351464182138,
|
||
|
|
"epoch": 0.7019907055506913,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 1.80152825383048e-05,
|
||
|
|
"loss": 1.1094,
|
||
|
|
"mean_token_accuracy": 0.693935377895832,
|
||
|
|
"num_tokens": 170873383.0,
|
||
|
|
"step": 2280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.115487469546497,
|
||
|
|
"epoch": 0.7035301588523376,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 1.8005588852476018e-05,
|
||
|
|
"loss": 1.1068,
|
||
|
|
"mean_token_accuracy": 0.6981241587549448,
|
||
|
|
"num_tokens": 171261938.0,
|
||
|
|
"step": 2285
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1232613749802112,
|
||
|
|
"epoch": 0.7050696121539838,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.799587417292375e-05,
|
||
|
|
"loss": 1.1239,
|
||
|
|
"mean_token_accuracy": 0.6959119252860546,
|
||
|
|
"num_tokens": 171645402.0,
|
||
|
|
"step": 2290
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1076678885146976,
|
||
|
|
"epoch": 0.7066090654556301,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 1.798613852512361e-05,
|
||
|
|
"loss": 1.0969,
|
||
|
|
"mean_token_accuracy": 0.7003442455083132,
|
||
|
|
"num_tokens": 172025713.0,
|
||
|
|
"step": 2295
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1507720805704593,
|
||
|
|
"epoch": 0.7081485187572764,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 1.79763819346062e-05,
|
||
|
|
"loss": 1.1442,
|
||
|
|
"mean_token_accuracy": 0.6917078942060471,
|
||
|
|
"num_tokens": 172386627.0,
|
||
|
|
"step": 2300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1178302532061934,
|
||
|
|
"epoch": 0.7096879720589225,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 1.796660442695705e-05,
|
||
|
|
"loss": 1.099,
|
||
|
|
"mean_token_accuracy": 0.6997009709477424,
|
||
|
|
"num_tokens": 172762148.0,
|
||
|
|
"step": 2305
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.110177224688232,
|
||
|
|
"epoch": 0.7112274253605688,
|
||
|
|
"grad_norm": 0.79296875,
|
||
|
|
"learning_rate": 1.795680602781652e-05,
|
||
|
|
"loss": 1.1017,
|
||
|
|
"mean_token_accuracy": 0.6984499383717775,
|
||
|
|
"num_tokens": 173139010.0,
|
||
|
|
"step": 2310
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1373082049191,
|
||
|
|
"epoch": 0.7127668786622151,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 1.7946986762879785e-05,
|
||
|
|
"loss": 1.1251,
|
||
|
|
"mean_token_accuracy": 0.6973337743431329,
|
||
|
|
"num_tokens": 173521573.0,
|
||
|
|
"step": 2315
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0916681990027428,
|
||
|
|
"epoch": 0.7143063319638613,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.7937146657896708e-05,
|
||
|
|
"loss": 1.0895,
|
||
|
|
"mean_token_accuracy": 0.7012616876512766,
|
||
|
|
"num_tokens": 173914670.0,
|
||
|
|
"step": 2320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.188042016327381,
|
||
|
|
"epoch": 0.7158457852655076,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 1.7927285738671825e-05,
|
||
|
|
"loss": 1.1786,
|
||
|
|
"mean_token_accuracy": 0.6875874120742083,
|
||
|
|
"num_tokens": 174291376.0,
|
||
|
|
"step": 2325
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0931476794183255,
|
||
|
|
"epoch": 0.7173852385671539,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.7917404031064245e-05,
|
||
|
|
"loss": 1.082,
|
||
|
|
"mean_token_accuracy": 0.702524871379137,
|
||
|
|
"num_tokens": 174670593.0,
|
||
|
|
"step": 2330
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1133252872154116,
|
||
|
|
"epoch": 0.7189246918688001,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 1.7907501560987594e-05,
|
||
|
|
"loss": 1.1079,
|
||
|
|
"mean_token_accuracy": 0.6983722053468228,
|
||
|
|
"num_tokens": 175048912.0,
|
||
|
|
"step": 2335
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.167278153076768,
|
||
|
|
"epoch": 0.7204641451704463,
|
||
|
|
"grad_norm": 0.76171875,
|
||
|
|
"learning_rate": 1.7897578354409945e-05,
|
||
|
|
"loss": 1.1646,
|
||
|
|
"mean_token_accuracy": 0.6914217924699188,
|
||
|
|
"num_tokens": 175419284.0,
|
||
|
|
"step": 2340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.114026983268559,
|
||
|
|
"epoch": 0.7220035984720926,
|
||
|
|
"grad_norm": 0.76953125,
|
||
|
|
"learning_rate": 1.7887634437353754e-05,
|
||
|
|
"loss": 1.1154,
|
||
|
|
"mean_token_accuracy": 0.6988561425358057,
|
||
|
|
"num_tokens": 175793045.0,
|
||
|
|
"step": 2345
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1095017280429602,
|
||
|
|
"epoch": 0.7235430517737389,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.787766983589578e-05,
|
||
|
|
"loss": 1.1076,
|
||
|
|
"mean_token_accuracy": 0.7001173861324788,
|
||
|
|
"num_tokens": 176159168.0,
|
||
|
|
"step": 2350
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.114397633448243,
|
||
|
|
"epoch": 0.7250825050753851,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.7867684576167028e-05,
|
||
|
|
"loss": 1.1065,
|
||
|
|
"mean_token_accuracy": 0.6991507276892662,
|
||
|
|
"num_tokens": 176538415.0,
|
||
|
|
"step": 2355
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1345725648105145,
|
||
|
|
"epoch": 0.7266219583770314,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.7857678684352684e-05,
|
||
|
|
"loss": 1.1261,
|
||
|
|
"mean_token_accuracy": 0.6978184632956982,
|
||
|
|
"num_tokens": 176902529.0,
|
||
|
|
"step": 2360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1068701507523655,
|
||
|
|
"epoch": 0.7281614116786777,
|
||
|
|
"grad_norm": 0.78125,
|
||
|
|
"learning_rate": 1.7847652186692025e-05,
|
||
|
|
"loss": 1.096,
|
||
|
|
"mean_token_accuracy": 0.6995298650115729,
|
||
|
|
"num_tokens": 177273706.0,
|
||
|
|
"step": 2365
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0690416656434536,
|
||
|
|
"epoch": 0.7297008649803238,
|
||
|
|
"grad_norm": 0.76171875,
|
||
|
|
"learning_rate": 1.783760510947838e-05,
|
||
|
|
"loss": 1.0606,
|
||
|
|
"mean_token_accuracy": 0.7073897119611502,
|
||
|
|
"num_tokens": 177642545.0,
|
||
|
|
"step": 2370
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1013412851840259,
|
||
|
|
"epoch": 0.7312403182819701,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.7827537479059026e-05,
|
||
|
|
"loss": 1.0872,
|
||
|
|
"mean_token_accuracy": 0.7016142923384905,
|
||
|
|
"num_tokens": 178023026.0,
|
||
|
|
"step": 2375
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.08609632384032,
|
||
|
|
"epoch": 0.7327797715836164,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 1.7817449321835166e-05,
|
||
|
|
"loss": 1.0756,
|
||
|
|
"mean_token_accuracy": 0.7015501491725444,
|
||
|
|
"num_tokens": 178416678.0,
|
||
|
|
"step": 2380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0995122667402029,
|
||
|
|
"epoch": 0.7343192248852626,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 1.78073406642618e-05,
|
||
|
|
"loss": 1.0907,
|
||
|
|
"mean_token_accuracy": 0.7023708283901214,
|
||
|
|
"num_tokens": 178792520.0,
|
||
|
|
"step": 2385
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1085374269634485,
|
||
|
|
"epoch": 0.7358586781869089,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.779721153284772e-05,
|
||
|
|
"loss": 1.1006,
|
||
|
|
"mean_token_accuracy": 0.7005628883838654,
|
||
|
|
"num_tokens": 179177915.0,
|
||
|
|
"step": 2390
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0867597110569478,
|
||
|
|
"epoch": 0.7373981314885552,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.778706195415538e-05,
|
||
|
|
"loss": 1.0764,
|
||
|
|
"mean_token_accuracy": 0.7046916723251343,
|
||
|
|
"num_tokens": 179554799.0,
|
||
|
|
"step": 2395
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1686318777501583,
|
||
|
|
"epoch": 0.7389375847902013,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 1.777689195480087e-05,
|
||
|
|
"loss": 1.17,
|
||
|
|
"mean_token_accuracy": 0.6879521161317825,
|
||
|
|
"num_tokens": 179918900.0,
|
||
|
|
"step": 2400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0987579802051186,
|
||
|
|
"epoch": 0.7404770380918476,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.776670156145383e-05,
|
||
|
|
"loss": 1.1023,
|
||
|
|
"mean_token_accuracy": 0.7014432933181525,
|
||
|
|
"num_tokens": 180303889.0,
|
||
|
|
"step": 2405
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1044664761051535,
|
||
|
|
"epoch": 0.7420164913934939,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 1.7756490800837377e-05,
|
||
|
|
"loss": 1.1022,
|
||
|
|
"mean_token_accuracy": 0.6991443373262882,
|
||
|
|
"num_tokens": 180665150.0,
|
||
|
|
"step": 2410
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1001021387055516,
|
||
|
|
"epoch": 0.7435559446951402,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 1.774625969972804e-05,
|
||
|
|
"loss": 1.0877,
|
||
|
|
"mean_token_accuracy": 0.7032657440751791,
|
||
|
|
"num_tokens": 181037748.0,
|
||
|
|
"step": 2415
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.124724223650992,
|
||
|
|
"epoch": 0.7450953979967864,
|
||
|
|
"grad_norm": 0.78515625,
|
||
|
|
"learning_rate": 1.7736008284955693e-05,
|
||
|
|
"loss": 1.1304,
|
||
|
|
"mean_token_accuracy": 0.698460428789258,
|
||
|
|
"num_tokens": 181406422.0,
|
||
|
|
"step": 2420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0898881725966931,
|
||
|
|
"epoch": 0.7466348512984327,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.772573658340347e-05,
|
||
|
|
"loss": 1.0731,
|
||
|
|
"mean_token_accuracy": 0.7067207857966423,
|
||
|
|
"num_tokens": 181780292.0,
|
||
|
|
"step": 2425
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1112020071595907,
|
||
|
|
"epoch": 0.7481743046000789,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 1.7715444622007715e-05,
|
||
|
|
"loss": 1.1118,
|
||
|
|
"mean_token_accuracy": 0.7000539500266314,
|
||
|
|
"num_tokens": 182155860.0,
|
||
|
|
"step": 2430
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1400660768151283,
|
||
|
|
"epoch": 0.7497137579017251,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.7705132427757895e-05,
|
||
|
|
"loss": 1.1317,
|
||
|
|
"mean_token_accuracy": 0.693534354865551,
|
||
|
|
"num_tokens": 182541127.0,
|
||
|
|
"step": 2435
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.101803145557642,
|
||
|
|
"epoch": 0.7512532112033714,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 1.7694800027696536e-05,
|
||
|
|
"loss": 1.0949,
|
||
|
|
"mean_token_accuracy": 0.7003138996660709,
|
||
|
|
"num_tokens": 182916319.0,
|
||
|
|
"step": 2440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1126858746632933,
|
||
|
|
"epoch": 0.7527926645050177,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.7684447448919156e-05,
|
||
|
|
"loss": 1.1117,
|
||
|
|
"mean_token_accuracy": 0.6983442030847072,
|
||
|
|
"num_tokens": 183291099.0,
|
||
|
|
"step": 2445
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0931305399164557,
|
||
|
|
"epoch": 0.7543321178066639,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 1.7674074718574187e-05,
|
||
|
|
"loss": 1.087,
|
||
|
|
"mean_token_accuracy": 0.7029769979417324,
|
||
|
|
"num_tokens": 183656984.0,
|
||
|
|
"step": 2450
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0863770237192512,
|
||
|
|
"epoch": 0.7558715711083102,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.7663681863862895e-05,
|
||
|
|
"loss": 1.0745,
|
||
|
|
"mean_token_accuracy": 0.7050878301262855,
|
||
|
|
"num_tokens": 184030898.0,
|
||
|
|
"step": 2455
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1342706704512238,
|
||
|
|
"epoch": 0.7574110244099564,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 1.7653268912039346e-05,
|
||
|
|
"loss": 1.1146,
|
||
|
|
"mean_token_accuracy": 0.6934974033385515,
|
||
|
|
"num_tokens": 184409379.0,
|
||
|
|
"step": 2460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1351441755890845,
|
||
|
|
"epoch": 0.7589504777116026,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 1.764283589041028e-05,
|
||
|
|
"loss": 1.1331,
|
||
|
|
"mean_token_accuracy": 0.6928224857896567,
|
||
|
|
"num_tokens": 184785789.0,
|
||
|
|
"step": 2465
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1305670756846666,
|
||
|
|
"epoch": 0.7604899310132489,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.7632382826335082e-05,
|
||
|
|
"loss": 1.1201,
|
||
|
|
"mean_token_accuracy": 0.6961219064891339,
|
||
|
|
"num_tokens": 185152907.0,
|
||
|
|
"step": 2470
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1167133485898375,
|
||
|
|
"epoch": 0.7620293843148952,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 1.76219097472257e-05,
|
||
|
|
"loss": 1.1284,
|
||
|
|
"mean_token_accuracy": 0.6951590169221162,
|
||
|
|
"num_tokens": 185527048.0,
|
||
|
|
"step": 2475
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1290605710819364,
|
||
|
|
"epoch": 0.7635688376165414,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 1.761141668054655e-05,
|
||
|
|
"loss": 1.1299,
|
||
|
|
"mean_token_accuracy": 0.69532679207623,
|
||
|
|
"num_tokens": 185898944.0,
|
||
|
|
"step": 2480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1405559226870536,
|
||
|
|
"epoch": 0.7651082909181877,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.760090365381449e-05,
|
||
|
|
"loss": 1.1399,
|
||
|
|
"mean_token_accuracy": 0.692203239351511,
|
||
|
|
"num_tokens": 186258758.0,
|
||
|
|
"step": 2485
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1181536603718996,
|
||
|
|
"epoch": 0.766647744219834,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.75903706945987e-05,
|
||
|
|
"loss": 1.1058,
|
||
|
|
"mean_token_accuracy": 0.6988699793815613,
|
||
|
|
"num_tokens": 186624684.0,
|
||
|
|
"step": 2490
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1159826684743166,
|
||
|
|
"epoch": 0.7681871975214802,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 1.7579817830520644e-05,
|
||
|
|
"loss": 1.1029,
|
||
|
|
"mean_token_accuracy": 0.6988367810845375,
|
||
|
|
"num_tokens": 187007877.0,
|
||
|
|
"step": 2495
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0837754575535654,
|
||
|
|
"epoch": 0.7697266508231264,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 1.756924508925397e-05,
|
||
|
|
"loss": 1.0795,
|
||
|
|
"mean_token_accuracy": 0.7029804602265358,
|
||
|
|
"num_tokens": 187395823.0,
|
||
|
|
"step": 2500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0903053333982826,
|
||
|
|
"epoch": 0.7712661041247727,
|
||
|
|
"grad_norm": 0.77734375,
|
||
|
|
"learning_rate": 1.7558652498524464e-05,
|
||
|
|
"loss": 1.0712,
|
||
|
|
"mean_token_accuracy": 0.7018662039190531,
|
||
|
|
"num_tokens": 187767014.0,
|
||
|
|
"step": 2505
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1511711820960044,
|
||
|
|
"epoch": 0.772805557426419,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.7548040086109957e-05,
|
||
|
|
"loss": 1.1538,
|
||
|
|
"mean_token_accuracy": 0.6920887984335422,
|
||
|
|
"num_tokens": 188140908.0,
|
||
|
|
"step": 2510
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1196786388754845,
|
||
|
|
"epoch": 0.7743450107280652,
|
||
|
|
"grad_norm": 0.66796875,
|
||
|
|
"learning_rate": 1.7537407879840266e-05,
|
||
|
|
"loss": 1.1192,
|
||
|
|
"mean_token_accuracy": 0.7018770579248667,
|
||
|
|
"num_tokens": 188516656.0,
|
||
|
|
"step": 2515
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.135399747081101,
|
||
|
|
"epoch": 0.7758844640297115,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.752675590759711e-05,
|
||
|
|
"loss": 1.1263,
|
||
|
|
"mean_token_accuracy": 0.6961784608662128,
|
||
|
|
"num_tokens": 188890179.0,
|
||
|
|
"step": 2520
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1367985662072897,
|
||
|
|
"epoch": 0.7774239173313577,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 1.7516084197314044e-05,
|
||
|
|
"loss": 1.1356,
|
||
|
|
"mean_token_accuracy": 0.6949714899063111,
|
||
|
|
"num_tokens": 189261560.0,
|
||
|
|
"step": 2525
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1175121076405048,
|
||
|
|
"epoch": 0.7789633706330039,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.7505392776976392e-05,
|
||
|
|
"loss": 1.1152,
|
||
|
|
"mean_token_accuracy": 0.6998940669000149,
|
||
|
|
"num_tokens": 189635927.0,
|
||
|
|
"step": 2530
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0612255077809096,
|
||
|
|
"epoch": 0.7805028239346502,
|
||
|
|
"grad_norm": 0.66796875,
|
||
|
|
"learning_rate": 1.7494681674621148e-05,
|
||
|
|
"loss": 1.0615,
|
||
|
|
"mean_token_accuracy": 0.7076791275292635,
|
||
|
|
"num_tokens": 190031986.0,
|
||
|
|
"step": 2535
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0870164155960083,
|
||
|
|
"epoch": 0.7820422772362965,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 1.7483950918336933e-05,
|
||
|
|
"loss": 1.0821,
|
||
|
|
"mean_token_accuracy": 0.7051350273191929,
|
||
|
|
"num_tokens": 190406510.0,
|
||
|
|
"step": 2540
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.098094793781638,
|
||
|
|
"epoch": 0.7835817305379427,
|
||
|
|
"grad_norm": 0.78125,
|
||
|
|
"learning_rate": 1.7473200536263905e-05,
|
||
|
|
"loss": 1.0897,
|
||
|
|
"mean_token_accuracy": 0.7014690071344376,
|
||
|
|
"num_tokens": 190770948.0,
|
||
|
|
"step": 2545
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1395260747522116,
|
||
|
|
"epoch": 0.785121183839589,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.7462430556593687e-05,
|
||
|
|
"loss": 1.1415,
|
||
|
|
"mean_token_accuracy": 0.6940800420939922,
|
||
|
|
"num_tokens": 191145348.0,
|
||
|
|
"step": 2550
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1120876904577017,
|
||
|
|
"epoch": 0.7866606371412352,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 1.7451641007569296e-05,
|
||
|
|
"loss": 1.1064,
|
||
|
|
"mean_token_accuracy": 0.702504301816225,
|
||
|
|
"num_tokens": 191510545.0,
|
||
|
|
"step": 2555
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1490049432963132,
|
||
|
|
"epoch": 0.7882000904428814,
|
||
|
|
"grad_norm": 0.6640625,
|
||
|
|
"learning_rate": 1.7440831917485064e-05,
|
||
|
|
"loss": 1.1411,
|
||
|
|
"mean_token_accuracy": 0.6938914064317941,
|
||
|
|
"num_tokens": 191894746.0,
|
||
|
|
"step": 2560
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.107052903994918,
|
||
|
|
"epoch": 0.7897395437445277,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.743000331468657e-05,
|
||
|
|
"loss": 1.0903,
|
||
|
|
"mean_token_accuracy": 0.6995991533622146,
|
||
|
|
"num_tokens": 192276582.0,
|
||
|
|
"step": 2565
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1070753591135145,
|
||
|
|
"epoch": 0.791278997046174,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 1.7419155227570564e-05,
|
||
|
|
"loss": 1.0866,
|
||
|
|
"mean_token_accuracy": 0.7038450885564089,
|
||
|
|
"num_tokens": 192621423.0,
|
||
|
|
"step": 2570
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0929330352693796,
|
||
|
|
"epoch": 0.7928184503478203,
|
||
|
|
"grad_norm": 0.77734375,
|
||
|
|
"learning_rate": 1.740828768458489e-05,
|
||
|
|
"loss": 1.0926,
|
||
|
|
"mean_token_accuracy": 0.70133086591959,
|
||
|
|
"num_tokens": 192989973.0,
|
||
|
|
"step": 2575
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.129907682351768,
|
||
|
|
"epoch": 0.7943579036494665,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 1.7397400714228414e-05,
|
||
|
|
"loss": 1.1243,
|
||
|
|
"mean_token_accuracy": 0.6967439528554678,
|
||
|
|
"num_tokens": 193363104.0,
|
||
|
|
"step": 2580
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.142175304144621,
|
||
|
|
"epoch": 0.7958973569511127,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 1.7386494345050944e-05,
|
||
|
|
"loss": 1.1438,
|
||
|
|
"mean_token_accuracy": 0.6937367048114538,
|
||
|
|
"num_tokens": 193734742.0,
|
||
|
|
"step": 2585
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1326942648738623,
|
||
|
|
"epoch": 0.797436810252759,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.737556860565316e-05,
|
||
|
|
"loss": 1.1384,
|
||
|
|
"mean_token_accuracy": 0.6964565064758063,
|
||
|
|
"num_tokens": 194114488.0,
|
||
|
|
"step": 2590
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1030776659026742,
|
||
|
|
"epoch": 0.7989762635544052,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 1.7364623524686542e-05,
|
||
|
|
"loss": 1.0997,
|
||
|
|
"mean_token_accuracy": 0.6996722735464573,
|
||
|
|
"num_tokens": 194502358.0,
|
||
|
|
"step": 2595
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0948217798024416,
|
||
|
|
"epoch": 0.8005157168560515,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.735365913085329e-05,
|
||
|
|
"loss": 1.0789,
|
||
|
|
"mean_token_accuracy": 0.7024578548967838,
|
||
|
|
"num_tokens": 194876850.0,
|
||
|
|
"step": 2600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.118626402504742,
|
||
|
|
"epoch": 0.8020551701576978,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 1.734267545290625e-05,
|
||
|
|
"loss": 1.1246,
|
||
|
|
"mean_token_accuracy": 0.6985007669776678,
|
||
|
|
"num_tokens": 195246768.0,
|
||
|
|
"step": 2605
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.121052284166217,
|
||
|
|
"epoch": 0.803594623459344,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 1.7331672519648834e-05,
|
||
|
|
"loss": 1.109,
|
||
|
|
"mean_token_accuracy": 0.699789596349001,
|
||
|
|
"num_tokens": 195637767.0,
|
||
|
|
"step": 2610
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.041398036852479,
|
||
|
|
"epoch": 0.8051340767609902,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.732065035993495e-05,
|
||
|
|
"loss": 1.0279,
|
||
|
|
"mean_token_accuracy": 0.7113026835024356,
|
||
|
|
"num_tokens": 196018909.0,
|
||
|
|
"step": 2615
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1239682227373122,
|
||
|
|
"epoch": 0.8066735300626365,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.7309609002668932e-05,
|
||
|
|
"loss": 1.1141,
|
||
|
|
"mean_token_accuracy": 0.6974333211779594,
|
||
|
|
"num_tokens": 196401477.0,
|
||
|
|
"step": 2620
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.082462282292545,
|
||
|
|
"epoch": 0.8082129833642827,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.7298548476805446e-05,
|
||
|
|
"loss": 1.0828,
|
||
|
|
"mean_token_accuracy": 0.7064408622682095,
|
||
|
|
"num_tokens": 196769663.0,
|
||
|
|
"step": 2625
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.08235105490312,
|
||
|
|
"epoch": 0.809752436665929,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.7287468811349437e-05,
|
||
|
|
"loss": 1.0772,
|
||
|
|
"mean_token_accuracy": 0.7040530938655138,
|
||
|
|
"num_tokens": 197149098.0,
|
||
|
|
"step": 2630
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0794834055006504,
|
||
|
|
"epoch": 0.8112918899675753,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.7276370035356037e-05,
|
||
|
|
"loss": 1.0788,
|
||
|
|
"mean_token_accuracy": 0.7081692714244128,
|
||
|
|
"num_tokens": 197507939.0,
|
||
|
|
"step": 2635
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1190556347370149,
|
||
|
|
"epoch": 0.8128313432692215,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 1.7265252177930483e-05,
|
||
|
|
"loss": 1.1102,
|
||
|
|
"mean_token_accuracy": 0.6978001076728105,
|
||
|
|
"num_tokens": 197878831.0,
|
||
|
|
"step": 2640
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.121983960829675,
|
||
|
|
"epoch": 0.8143707965708677,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 1.7254115268228073e-05,
|
||
|
|
"loss": 1.1101,
|
||
|
|
"mean_token_accuracy": 0.6971151124686003,
|
||
|
|
"num_tokens": 198240722.0,
|
||
|
|
"step": 2645
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0984731782227755,
|
||
|
|
"epoch": 0.815910249872514,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.724295933545404e-05,
|
||
|
|
"loss": 1.0999,
|
||
|
|
"mean_token_accuracy": 0.7044171739369631,
|
||
|
|
"num_tokens": 198623643.0,
|
||
|
|
"step": 2650
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1332397196441888,
|
||
|
|
"epoch": 0.8174497031741603,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 1.723178440886353e-05,
|
||
|
|
"loss": 1.143,
|
||
|
|
"mean_token_accuracy": 0.6969984227791428,
|
||
|
|
"num_tokens": 199002171.0,
|
||
|
|
"step": 2655
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1465369185432792,
|
||
|
|
"epoch": 0.8189891564758065,
|
||
|
|
"grad_norm": 0.66796875,
|
||
|
|
"learning_rate": 1.722059051776148e-05,
|
||
|
|
"loss": 1.1355,
|
||
|
|
"mean_token_accuracy": 0.6944274462759494,
|
||
|
|
"num_tokens": 199396183.0,
|
||
|
|
"step": 2660
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.130674248188734,
|
||
|
|
"epoch": 0.8205286097774528,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.7209377691502565e-05,
|
||
|
|
"loss": 1.1236,
|
||
|
|
"mean_token_accuracy": 0.6986651346087456,
|
||
|
|
"num_tokens": 199766961.0,
|
||
|
|
"step": 2665
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1448373874649405,
|
||
|
|
"epoch": 0.8220680630790991,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 1.7198145959491113e-05,
|
||
|
|
"loss": 1.1518,
|
||
|
|
"mean_token_accuracy": 0.6953822866082191,
|
||
|
|
"num_tokens": 200150523.0,
|
||
|
|
"step": 2670
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1163246229290962,
|
||
|
|
"epoch": 0.8236075163807453,
|
||
|
|
"grad_norm": 0.67578125,
|
||
|
|
"learning_rate": 1.718689535118103e-05,
|
||
|
|
"loss": 1.0971,
|
||
|
|
"mean_token_accuracy": 0.6998222548514604,
|
||
|
|
"num_tokens": 200531969.0,
|
||
|
|
"step": 2675
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1107960917055606,
|
||
|
|
"epoch": 0.8251469696823915,
|
||
|
|
"grad_norm": 0.77734375,
|
||
|
|
"learning_rate": 1.7175625896075732e-05,
|
||
|
|
"loss": 1.1005,
|
||
|
|
"mean_token_accuracy": 0.7001858238130808,
|
||
|
|
"num_tokens": 200904361.0,
|
||
|
|
"step": 2680
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1194037832319736,
|
||
|
|
"epoch": 0.8266864229840378,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.7164337623728044e-05,
|
||
|
|
"loss": 1.1158,
|
||
|
|
"mean_token_accuracy": 0.6979843948036433,
|
||
|
|
"num_tokens": 201277752.0,
|
||
|
|
"step": 2685
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.149041135236621,
|
||
|
|
"epoch": 0.828225876285684,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.715303056374015e-05,
|
||
|
|
"loss": 1.1487,
|
||
|
|
"mean_token_accuracy": 0.691906564310193,
|
||
|
|
"num_tokens": 201639026.0,
|
||
|
|
"step": 2690
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1252323003485798,
|
||
|
|
"epoch": 0.8297653295873303,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.7141704745763494e-05,
|
||
|
|
"loss": 1.1085,
|
||
|
|
"mean_token_accuracy": 0.6988822910934687,
|
||
|
|
"num_tokens": 202032196.0,
|
||
|
|
"step": 2695
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1688425466418266,
|
||
|
|
"epoch": 0.8313047828889766,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 1.713036019949871e-05,
|
||
|
|
"loss": 1.1736,
|
||
|
|
"mean_token_accuracy": 0.68868796415627,
|
||
|
|
"num_tokens": 202396787.0,
|
||
|
|
"step": 2700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0816320231184364,
|
||
|
|
"epoch": 0.8328442361906228,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.7118996954695553e-05,
|
||
|
|
"loss": 1.0761,
|
||
|
|
"mean_token_accuracy": 0.7047209940850735,
|
||
|
|
"num_tokens": 202787506.0,
|
||
|
|
"step": 2705
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1424961797893047,
|
||
|
|
"epoch": 0.834383689492269,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 1.7107615041152807e-05,
|
||
|
|
"loss": 1.1331,
|
||
|
|
"mean_token_accuracy": 0.6949755053967237,
|
||
|
|
"num_tokens": 203162645.0,
|
||
|
|
"step": 2710
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1023723732680082,
|
||
|
|
"epoch": 0.8359231427939153,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.709621448871821e-05,
|
||
|
|
"loss": 1.097,
|
||
|
|
"mean_token_accuracy": 0.7015528365969658,
|
||
|
|
"num_tokens": 203527557.0,
|
||
|
|
"step": 2715
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1118264703080059,
|
||
|
|
"epoch": 0.8374625960955616,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.7084795327288387e-05,
|
||
|
|
"loss": 1.1031,
|
||
|
|
"mean_token_accuracy": 0.7010146964341402,
|
||
|
|
"num_tokens": 203897448.0,
|
||
|
|
"step": 2720
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0787724321708083,
|
||
|
|
"epoch": 0.8390020493972078,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 1.7073357586808753e-05,
|
||
|
|
"loss": 1.0665,
|
||
|
|
"mean_token_accuracy": 0.7078627742826938,
|
||
|
|
"num_tokens": 204269665.0,
|
||
|
|
"step": 2725
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0742497980594634,
|
||
|
|
"epoch": 0.8405415026988541,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.706190129727345e-05,
|
||
|
|
"loss": 1.0766,
|
||
|
|
"mean_token_accuracy": 0.706443578377366,
|
||
|
|
"num_tokens": 204640083.0,
|
||
|
|
"step": 2730
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1287441933527589,
|
||
|
|
"epoch": 0.8420809560005004,
|
||
|
|
"grad_norm": 0.671875,
|
||
|
|
"learning_rate": 1.7050426488725264e-05,
|
||
|
|
"loss": 1.1246,
|
||
|
|
"mean_token_accuracy": 0.6960625112056732,
|
||
|
|
"num_tokens": 205010565.0,
|
||
|
|
"step": 2735
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.114234597980976,
|
||
|
|
"epoch": 0.8436204093021465,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 1.703893319125554e-05,
|
||
|
|
"loss": 1.1083,
|
||
|
|
"mean_token_accuracy": 0.6985804803669453,
|
||
|
|
"num_tokens": 205394241.0,
|
||
|
|
"step": 2740
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0446887370198965,
|
||
|
|
"epoch": 0.8451598626037928,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.7027421435004114e-05,
|
||
|
|
"loss": 1.0396,
|
||
|
|
"mean_token_accuracy": 0.7130256239324808,
|
||
|
|
"num_tokens": 205778044.0,
|
||
|
|
"step": 2745
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.127483463473618,
|
||
|
|
"epoch": 0.8466993159054391,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.701589125015922e-05,
|
||
|
|
"loss": 1.1229,
|
||
|
|
"mean_token_accuracy": 0.6960821971297264,
|
||
|
|
"num_tokens": 206151325.0,
|
||
|
|
"step": 2750
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1459118625149132,
|
||
|
|
"epoch": 0.8482387692070853,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.7004342666957426e-05,
|
||
|
|
"loss": 1.1477,
|
||
|
|
"mean_token_accuracy": 0.6906679786741734,
|
||
|
|
"num_tokens": 206515412.0,
|
||
|
|
"step": 2755
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1285589247941972,
|
||
|
|
"epoch": 0.8497782225087316,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.6992775715683544e-05,
|
||
|
|
"loss": 1.1317,
|
||
|
|
"mean_token_accuracy": 0.6945409368723631,
|
||
|
|
"num_tokens": 206884678.0,
|
||
|
|
"step": 2760
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.099574868567288,
|
||
|
|
"epoch": 0.8513176758103779,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 1.698119042667056e-05,
|
||
|
|
"loss": 1.0839,
|
||
|
|
"mean_token_accuracy": 0.7026559956371784,
|
||
|
|
"num_tokens": 207250423.0,
|
||
|
|
"step": 2765
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1219121659174562,
|
||
|
|
"epoch": 0.852857129112024,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.696958683029954e-05,
|
||
|
|
"loss": 1.1054,
|
||
|
|
"mean_token_accuracy": 0.6976403135806322,
|
||
|
|
"num_tokens": 207623348.0,
|
||
|
|
"step": 2770
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1164616649970411,
|
||
|
|
"epoch": 0.8543965824136703,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.6957964956999563e-05,
|
||
|
|
"loss": 1.1202,
|
||
|
|
"mean_token_accuracy": 0.6999995116144418,
|
||
|
|
"num_tokens": 208001124.0,
|
||
|
|
"step": 2775
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1377616070210934,
|
||
|
|
"epoch": 0.8559360357153166,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.6946324837247636e-05,
|
||
|
|
"loss": 1.1271,
|
||
|
|
"mean_token_accuracy": 0.6944478377699852,
|
||
|
|
"num_tokens": 208375994.0,
|
||
|
|
"step": 2780
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1082529162988066,
|
||
|
|
"epoch": 0.8574754890169628,
|
||
|
|
"grad_norm": 0.68359375,
|
||
|
|
"learning_rate": 1.6934666501568618e-05,
|
||
|
|
"loss": 1.104,
|
||
|
|
"mean_token_accuracy": 0.6988645371049642,
|
||
|
|
"num_tokens": 208752812.0,
|
||
|
|
"step": 2785
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1542402550578117,
|
||
|
|
"epoch": 0.8590149423186091,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 1.6922989980535135e-05,
|
||
|
|
"loss": 1.1351,
|
||
|
|
"mean_token_accuracy": 0.6953271046280861,
|
||
|
|
"num_tokens": 209128737.0,
|
||
|
|
"step": 2790
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.121809756755829,
|
||
|
|
"epoch": 0.8605543956202554,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.6911295304767497e-05,
|
||
|
|
"loss": 1.1157,
|
||
|
|
"mean_token_accuracy": 0.6957637727260589,
|
||
|
|
"num_tokens": 209520264.0,
|
||
|
|
"step": 2795
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1145857820287346,
|
||
|
|
"epoch": 0.8620938489219017,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 1.6899582504933637e-05,
|
||
|
|
"loss": 1.1059,
|
||
|
|
"mean_token_accuracy": 0.7002962566912174,
|
||
|
|
"num_tokens": 209892479.0,
|
||
|
|
"step": 2800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0788703871890903,
|
||
|
|
"epoch": 0.8636333022235478,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.6887851611749005e-05,
|
||
|
|
"loss": 1.0604,
|
||
|
|
"mean_token_accuracy": 0.706576419994235,
|
||
|
|
"num_tokens": 210259673.0,
|
||
|
|
"step": 2805
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1228289678692818,
|
||
|
|
"epoch": 0.8651727555251941,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 1.6876102655976492e-05,
|
||
|
|
"loss": 1.1182,
|
||
|
|
"mean_token_accuracy": 0.6995963159948587,
|
||
|
|
"num_tokens": 210620500.0,
|
||
|
|
"step": 2810
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1059047624468803,
|
||
|
|
"epoch": 0.8667122088268404,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 1.6864335668426373e-05,
|
||
|
|
"loss": 1.1059,
|
||
|
|
"mean_token_accuracy": 0.7024442825466395,
|
||
|
|
"num_tokens": 211012574.0,
|
||
|
|
"step": 2815
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1174401119351387,
|
||
|
|
"epoch": 0.8682516621284866,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 1.68525506799562e-05,
|
||
|
|
"loss": 1.1297,
|
||
|
|
"mean_token_accuracy": 0.6935884576290846,
|
||
|
|
"num_tokens": 211378656.0,
|
||
|
|
"step": 2820
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0923995364457368,
|
||
|
|
"epoch": 0.8697911154301329,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 1.6840747721470733e-05,
|
||
|
|
"loss": 1.0902,
|
||
|
|
"mean_token_accuracy": 0.7031279694288969,
|
||
|
|
"num_tokens": 211748096.0,
|
||
|
|
"step": 2825
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0991105940192938,
|
||
|
|
"epoch": 0.8713305687317792,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.6828926823921845e-05,
|
||
|
|
"loss": 1.0853,
|
||
|
|
"mean_token_accuracy": 0.7029936861246824,
|
||
|
|
"num_tokens": 212131750.0,
|
||
|
|
"step": 2830
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1157667137682439,
|
||
|
|
"epoch": 0.8728700220334253,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 1.6817088018308477e-05,
|
||
|
|
"loss": 1.1162,
|
||
|
|
"mean_token_accuracy": 0.6973326183855534,
|
||
|
|
"num_tokens": 212507126.0,
|
||
|
|
"step": 2835
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1045021768659353,
|
||
|
|
"epoch": 0.8744094753350716,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 1.6805231335676505e-05,
|
||
|
|
"loss": 1.1009,
|
||
|
|
"mean_token_accuracy": 0.7020870693027973,
|
||
|
|
"num_tokens": 212871116.0,
|
||
|
|
"step": 2840
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1048178130760788,
|
||
|
|
"epoch": 0.8759489286367179,
|
||
|
|
"grad_norm": 0.6875,
|
||
|
|
"learning_rate": 1.6793356807118695e-05,
|
||
|
|
"loss": 1.0877,
|
||
|
|
"mean_token_accuracy": 0.702137915417552,
|
||
|
|
"num_tokens": 213241519.0,
|
||
|
|
"step": 2845
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.099703123793006,
|
||
|
|
"epoch": 0.8774883819383641,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 1.6781464463774628e-05,
|
||
|
|
"loss": 1.0733,
|
||
|
|
"mean_token_accuracy": 0.70214060023427,
|
||
|
|
"num_tokens": 213623745.0,
|
||
|
|
"step": 2850
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1110018253326417,
|
||
|
|
"epoch": 0.8790278352400104,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 1.6769554336830577e-05,
|
||
|
|
"loss": 1.1057,
|
||
|
|
"mean_token_accuracy": 0.6998776510357857,
|
||
|
|
"num_tokens": 213997461.0,
|
||
|
|
"step": 2855
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1340667808428406,
|
||
|
|
"epoch": 0.8805672885416567,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 1.675762645751946e-05,
|
||
|
|
"loss": 1.1343,
|
||
|
|
"mean_token_accuracy": 0.692723986506462,
|
||
|
|
"num_tokens": 214370570.0,
|
||
|
|
"step": 2860
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0941222723573447,
|
||
|
|
"epoch": 0.8821067418433028,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.6745680857120757e-05,
|
||
|
|
"loss": 1.077,
|
||
|
|
"mean_token_accuracy": 0.7049151591956615,
|
||
|
|
"num_tokens": 214748557.0,
|
||
|
|
"step": 2865
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1092702638357879,
|
||
|
|
"epoch": 0.8836461951449491,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.673371756696041e-05,
|
||
|
|
"loss": 1.1077,
|
||
|
|
"mean_token_accuracy": 0.6991445735096932,
|
||
|
|
"num_tokens": 215124225.0,
|
||
|
|
"step": 2870
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0871345413848759,
|
||
|
|
"epoch": 0.8851856484465954,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 1.672173661841075e-05,
|
||
|
|
"loss": 1.0845,
|
||
|
|
"mean_token_accuracy": 0.7042425669729709,
|
||
|
|
"num_tokens": 215507111.0,
|
||
|
|
"step": 2875
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.148904792405665,
|
||
|
|
"epoch": 0.8867251017482417,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.670973804289042e-05,
|
||
|
|
"loss": 1.1502,
|
||
|
|
"mean_token_accuracy": 0.6910400237888098,
|
||
|
|
"num_tokens": 215875633.0,
|
||
|
|
"step": 2880
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.15465437322855,
|
||
|
|
"epoch": 0.8882645550498879,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 1.6697721871864286e-05,
|
||
|
|
"loss": 1.1557,
|
||
|
|
"mean_token_accuracy": 0.6898221826180816,
|
||
|
|
"num_tokens": 216254799.0,
|
||
|
|
"step": 2885
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1274722613394261,
|
||
|
|
"epoch": 0.8898040083515342,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 1.6685688136843355e-05,
|
||
|
|
"loss": 1.1143,
|
||
|
|
"mean_token_accuracy": 0.6991093195974827,
|
||
|
|
"num_tokens": 216630501.0,
|
||
|
|
"step": 2890
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1437790846452116,
|
||
|
|
"epoch": 0.8913434616531805,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 1.667363686938469e-05,
|
||
|
|
"loss": 1.1427,
|
||
|
|
"mean_token_accuracy": 0.6937702525407076,
|
||
|
|
"num_tokens": 216998378.0,
|
||
|
|
"step": 2895
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1149624142795802,
|
||
|
|
"epoch": 0.8928829149548266,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 1.6661568101091345e-05,
|
||
|
|
"loss": 1.1057,
|
||
|
|
"mean_token_accuracy": 0.7003548592329025,
|
||
|
|
"num_tokens": 217369136.0,
|
||
|
|
"step": 2900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1179976981133222,
|
||
|
|
"epoch": 0.8944223682564729,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.664948186361225e-05,
|
||
|
|
"loss": 1.1073,
|
||
|
|
"mean_token_accuracy": 0.6955419234931469,
|
||
|
|
"num_tokens": 217739308.0,
|
||
|
|
"step": 2905
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0808471154421568,
|
||
|
|
"epoch": 0.8959618215581192,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.6637378188642156e-05,
|
||
|
|
"loss": 1.0781,
|
||
|
|
"mean_token_accuracy": 0.7017045050859452,
|
||
|
|
"num_tokens": 218124777.0,
|
||
|
|
"step": 2910
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0651660868898034,
|
||
|
|
"epoch": 0.8975012748597654,
|
||
|
|
"grad_norm": 0.6640625,
|
||
|
|
"learning_rate": 1.662525710792154e-05,
|
||
|
|
"loss": 1.0522,
|
||
|
|
"mean_token_accuracy": 0.7084551777690649,
|
||
|
|
"num_tokens": 218515006.0,
|
||
|
|
"step": 2915
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0998478880152107,
|
||
|
|
"epoch": 0.8990407281614117,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 1.661311865323652e-05,
|
||
|
|
"loss": 1.0942,
|
||
|
|
"mean_token_accuracy": 0.7040021698921919,
|
||
|
|
"num_tokens": 218879337.0,
|
||
|
|
"step": 2920
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0932244323194027,
|
||
|
|
"epoch": 0.900580181463058,
|
||
|
|
"grad_norm": 0.68359375,
|
||
|
|
"learning_rate": 1.6600962856418782e-05,
|
||
|
|
"loss": 1.087,
|
||
|
|
"mean_token_accuracy": 0.703185360506177,
|
||
|
|
"num_tokens": 219251883.0,
|
||
|
|
"step": 2925
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1038317073136568,
|
||
|
|
"epoch": 0.9021196347647041,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.6588789749345487e-05,
|
||
|
|
"loss": 1.0918,
|
||
|
|
"mean_token_accuracy": 0.7009527865797281,
|
||
|
|
"num_tokens": 219632445.0,
|
||
|
|
"step": 2930
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0950964797288179,
|
||
|
|
"epoch": 0.9036590880663504,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 1.6576599363939185e-05,
|
||
|
|
"loss": 1.0764,
|
||
|
|
"mean_token_accuracy": 0.7027178958058358,
|
||
|
|
"num_tokens": 220010934.0,
|
||
|
|
"step": 2935
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.101254301518202,
|
||
|
|
"epoch": 0.9051985413679967,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 1.6564391732167743e-05,
|
||
|
|
"loss": 1.0912,
|
||
|
|
"mean_token_accuracy": 0.7002034839242697,
|
||
|
|
"num_tokens": 220374695.0,
|
||
|
|
"step": 2940
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0901438646018504,
|
||
|
|
"epoch": 0.9067379946696429,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.6552166886044253e-05,
|
||
|
|
"loss": 1.0903,
|
||
|
|
"mean_token_accuracy": 0.7034961324185133,
|
||
|
|
"num_tokens": 220739608.0,
|
||
|
|
"step": 2945
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0934947073459624,
|
||
|
|
"epoch": 0.9082774479712892,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 1.6539924857626947e-05,
|
||
|
|
"loss": 1.0803,
|
||
|
|
"mean_token_accuracy": 0.7044488485902548,
|
||
|
|
"num_tokens": 221109955.0,
|
||
|
|
"step": 2950
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0877722285687923,
|
||
|
|
"epoch": 0.9098169012729355,
|
||
|
|
"grad_norm": 0.76953125,
|
||
|
|
"learning_rate": 1.652766567901912e-05,
|
||
|
|
"loss": 1.0912,
|
||
|
|
"mean_token_accuracy": 0.7042174067348241,
|
||
|
|
"num_tokens": 221469786.0,
|
||
|
|
"step": 2955
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1298996726050974,
|
||
|
|
"epoch": 0.9113563545745818,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 1.6515389382369034e-05,
|
||
|
|
"loss": 1.1242,
|
||
|
|
"mean_token_accuracy": 0.6937161698937416,
|
||
|
|
"num_tokens": 221837816.0,
|
||
|
|
"step": 2960
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1138132132589817,
|
||
|
|
"epoch": 0.9128958078762279,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.650309599986985e-05,
|
||
|
|
"loss": 1.1076,
|
||
|
|
"mean_token_accuracy": 0.6995945759117603,
|
||
|
|
"num_tokens": 222203420.0,
|
||
|
|
"step": 2965
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.102806118503213,
|
||
|
|
"epoch": 0.9144352611778742,
|
||
|
|
"grad_norm": 0.78515625,
|
||
|
|
"learning_rate": 1.649078556375953e-05,
|
||
|
|
"loss": 1.0925,
|
||
|
|
"mean_token_accuracy": 0.6999370910227298,
|
||
|
|
"num_tokens": 222580138.0,
|
||
|
|
"step": 2970
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1294960187748075,
|
||
|
|
"epoch": 0.9159747144795205,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 1.6478458106320755e-05,
|
||
|
|
"loss": 1.1236,
|
||
|
|
"mean_token_accuracy": 0.6974813371896744,
|
||
|
|
"num_tokens": 222953640.0,
|
||
|
|
"step": 2975
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1324309218674897,
|
||
|
|
"epoch": 0.9175141677811667,
|
||
|
|
"grad_norm": 0.65234375,
|
||
|
|
"learning_rate": 1.6466113659880845e-05,
|
||
|
|
"loss": 1.1234,
|
||
|
|
"mean_token_accuracy": 0.6944039441645146,
|
||
|
|
"num_tokens": 223333549.0,
|
||
|
|
"step": 2980
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0994510252028704,
|
||
|
|
"epoch": 0.919053621082813,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.6453752256811676e-05,
|
||
|
|
"loss": 1.1045,
|
||
|
|
"mean_token_accuracy": 0.6973139215260744,
|
||
|
|
"num_tokens": 223703963.0,
|
||
|
|
"step": 2985
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.137350879982114,
|
||
|
|
"epoch": 0.9205930743844593,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 1.6441373929529583e-05,
|
||
|
|
"loss": 1.1329,
|
||
|
|
"mean_token_accuracy": 0.6942195292562247,
|
||
|
|
"num_tokens": 224081482.0,
|
||
|
|
"step": 2990
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.1128303619101643,
|
||
|
|
"epoch": 0.9221325276861054,
|
||
|
|
"grad_norm": 0.6875,
|
||
|
|
"learning_rate": 1.6428978710495286e-05,
|
||
|
|
"loss": 1.1036,
|
||
|
|
"mean_token_accuracy": 0.7014426335692405,
|
||
|
|
"num_tokens": 224448417.0,
|
||
|
|
"step": 2995
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.0825168298557402,
|
||
|
|
"epoch": 0.9236719809877517,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 1.6416566632213803e-05,
|
||
|
|
"loss": 1.0628,
|
||
|
|
"mean_token_accuracy": 0.7056166708469391,
|
||
|
|
"num_tokens": 224813610.0,
|
||
|
|
"step": 3000
|
||
|
|
}
|
||
|
|
],
|
||
|
|
"logging_steps": 5,
|
||
|
|
"max_steps": 10000,
|
||
|
|
"num_input_tokens_seen": 0,
|
||
|
|
"num_train_epochs": 4,
|
||
|
|
"save_steps": 1000,
|
||
|
|
"stateful_callbacks": {
|
||
|
|
"TrainerControl": {
|
||
|
|
"args": {
|
||
|
|
"should_epoch_stop": false,
|
||
|
|
"should_evaluate": false,
|
||
|
|
"should_log": false,
|
||
|
|
"should_save": true,
|
||
|
|
"should_training_stop": false
|
||
|
|
},
|
||
|
|
"attributes": {}
|
||
|
|
}
|
||
|
|
},
|
||
|
|
"total_flos": 3.7428414321849795e+18,
|
||
|
|
"train_batch_size": 1,
|
||
|
|
"trial_name": null,
|
||
|
|
"trial_params": null
|
||
|
|
}
|