2035 lines
56 KiB
JSON
2035 lines
56 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 0.30789066032925055,
|
|
"eval_steps": 500,
|
|
"global_step": 1000,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 1.1113718893378972,
|
|
"epoch": 0.0015394533016462528,
|
|
"grad_norm": 23.25,
|
|
"learning_rate": 2.666666666666667e-07,
|
|
"loss": 1.4148,
|
|
"mean_token_accuracy": 0.6499394655227662,
|
|
"num_tokens": 379552.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 1.1505246445536614,
|
|
"epoch": 0.0030789066032925055,
|
|
"grad_norm": 25.375,
|
|
"learning_rate": 6.000000000000001e-07,
|
|
"loss": 1.4742,
|
|
"mean_token_accuracy": 0.6414433296769857,
|
|
"num_tokens": 743248.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 1.1535595946013928,
|
|
"epoch": 0.004618359904938758,
|
|
"grad_norm": 24.0,
|
|
"learning_rate": 9.333333333333334e-07,
|
|
"loss": 1.4559,
|
|
"mean_token_accuracy": 0.6436704084277153,
|
|
"num_tokens": 1124191.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 1.1471380971372127,
|
|
"epoch": 0.006157813206585011,
|
|
"grad_norm": 21.5,
|
|
"learning_rate": 1.2666666666666669e-06,
|
|
"loss": 1.4609,
|
|
"mean_token_accuracy": 0.642368745803833,
|
|
"num_tokens": 1488145.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 1.155402697250247,
|
|
"epoch": 0.007697266508231265,
|
|
"grad_norm": 18.25,
|
|
"learning_rate": 1.6000000000000001e-06,
|
|
"loss": 1.4329,
|
|
"mean_token_accuracy": 0.6484112951904535,
|
|
"num_tokens": 1860647.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 1.1452072311192751,
|
|
"epoch": 0.009236719809877517,
|
|
"grad_norm": 17.25,
|
|
"learning_rate": 1.9333333333333336e-06,
|
|
"loss": 1.3712,
|
|
"mean_token_accuracy": 0.6529930120334029,
|
|
"num_tokens": 2245973.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 1.123310711979866,
|
|
"epoch": 0.01077617311152377,
|
|
"grad_norm": 13.8125,
|
|
"learning_rate": 2.266666666666667e-06,
|
|
"loss": 1.3082,
|
|
"mean_token_accuracy": 0.6658382505178452,
|
|
"num_tokens": 2631053.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 1.1543800953775645,
|
|
"epoch": 0.012315626413170022,
|
|
"grad_norm": 8.75,
|
|
"learning_rate": 2.6e-06,
|
|
"loss": 1.2982,
|
|
"mean_token_accuracy": 0.6618854686617851,
|
|
"num_tokens": 2992829.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 1.1680023059248925,
|
|
"epoch": 0.013855079714816277,
|
|
"grad_norm": 6.1875,
|
|
"learning_rate": 2.9333333333333338e-06,
|
|
"loss": 1.2948,
|
|
"mean_token_accuracy": 0.6657806046307087,
|
|
"num_tokens": 3382112.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 1.147538623958826,
|
|
"epoch": 0.01539453301646253,
|
|
"grad_norm": 5.375,
|
|
"learning_rate": 3.266666666666667e-06,
|
|
"loss": 1.2509,
|
|
"mean_token_accuracy": 0.675503570586443,
|
|
"num_tokens": 3764785.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 1.107958966679871,
|
|
"epoch": 0.01693398631810878,
|
|
"grad_norm": 4.90625,
|
|
"learning_rate": 3.6000000000000003e-06,
|
|
"loss": 1.1997,
|
|
"mean_token_accuracy": 0.6811204344034195,
|
|
"num_tokens": 4126394.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 1.1157011151313783,
|
|
"epoch": 0.018473439619755033,
|
|
"grad_norm": 2.265625,
|
|
"learning_rate": 3.9333333333333335e-06,
|
|
"loss": 1.193,
|
|
"mean_token_accuracy": 0.6808499224483967,
|
|
"num_tokens": 4510149.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 1.1392802488058806,
|
|
"epoch": 0.020012892921401286,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 4.266666666666668e-06,
|
|
"loss": 1.1903,
|
|
"mean_token_accuracy": 0.6806150872260333,
|
|
"num_tokens": 4875984.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 1.1204315345734357,
|
|
"epoch": 0.02155234622304754,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 4.600000000000001e-06,
|
|
"loss": 1.1621,
|
|
"mean_token_accuracy": 0.6908985383808612,
|
|
"num_tokens": 5251973.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 1.1343737579882145,
|
|
"epoch": 0.02309179952469379,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 4.933333333333334e-06,
|
|
"loss": 1.1367,
|
|
"mean_token_accuracy": 0.6892836567014455,
|
|
"num_tokens": 5622302.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 1.138794292882085,
|
|
"epoch": 0.024631252826340044,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 5.2666666666666665e-06,
|
|
"loss": 1.1657,
|
|
"mean_token_accuracy": 0.6916824176907539,
|
|
"num_tokens": 5987467.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 1.1140711281448603,
|
|
"epoch": 0.0261707061279863,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 5.600000000000001e-06,
|
|
"loss": 1.1287,
|
|
"mean_token_accuracy": 0.6946257088333369,
|
|
"num_tokens": 6369083.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 1.1451053522527217,
|
|
"epoch": 0.027710159429632553,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 5.933333333333335e-06,
|
|
"loss": 1.1546,
|
|
"mean_token_accuracy": 0.6903918959200382,
|
|
"num_tokens": 6749350.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 1.1201870743185283,
|
|
"epoch": 0.029249612731278806,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 6.266666666666668e-06,
|
|
"loss": 1.1166,
|
|
"mean_token_accuracy": 0.6962686065584421,
|
|
"num_tokens": 7118012.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 1.149271610751748,
|
|
"epoch": 0.03078906603292506,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 6.600000000000001e-06,
|
|
"loss": 1.1534,
|
|
"mean_token_accuracy": 0.6903159897774458,
|
|
"num_tokens": 7486407.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 1.1452004179358481,
|
|
"epoch": 0.03232851933457131,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 6.9333333333333344e-06,
|
|
"loss": 1.1658,
|
|
"mean_token_accuracy": 0.6880020551383496,
|
|
"num_tokens": 7853929.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 1.133518392033875,
|
|
"epoch": 0.03386797263621756,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 7.266666666666668e-06,
|
|
"loss": 1.1477,
|
|
"mean_token_accuracy": 0.691348098218441,
|
|
"num_tokens": 8224258.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 1.1419388929381966,
|
|
"epoch": 0.035407425937863814,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 7.600000000000001e-06,
|
|
"loss": 1.1499,
|
|
"mean_token_accuracy": 0.6935681894421577,
|
|
"num_tokens": 8601374.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 1.1601579703390599,
|
|
"epoch": 0.036946879239510066,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 7.933333333333334e-06,
|
|
"loss": 1.1652,
|
|
"mean_token_accuracy": 0.6893212374299764,
|
|
"num_tokens": 8976860.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 1.1541021421551705,
|
|
"epoch": 0.03848633254115632,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 8.266666666666667e-06,
|
|
"loss": 1.1553,
|
|
"mean_token_accuracy": 0.6880058489739895,
|
|
"num_tokens": 9342172.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 1.1215011529624461,
|
|
"epoch": 0.04002578584280257,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 8.6e-06,
|
|
"loss": 1.11,
|
|
"mean_token_accuracy": 0.6971393920481205,
|
|
"num_tokens": 9711234.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 1.1288955546915531,
|
|
"epoch": 0.041565239144448825,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 8.933333333333333e-06,
|
|
"loss": 1.1331,
|
|
"mean_token_accuracy": 0.69485286436975,
|
|
"num_tokens": 10092041.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 1.1383998703211546,
|
|
"epoch": 0.04310469244609508,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 9.266666666666667e-06,
|
|
"loss": 1.1608,
|
|
"mean_token_accuracy": 0.6917846284806728,
|
|
"num_tokens": 10470367.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 1.1720476493239402,
|
|
"epoch": 0.04464414574774133,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 9.600000000000001e-06,
|
|
"loss": 1.1643,
|
|
"mean_token_accuracy": 0.6900354858487845,
|
|
"num_tokens": 10840227.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 1.1642087884247303,
|
|
"epoch": 0.04618359904938758,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 9.933333333333334e-06,
|
|
"loss": 1.1662,
|
|
"mean_token_accuracy": 0.6894872546195984,
|
|
"num_tokens": 11212704.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 1.1504485111683607,
|
|
"epoch": 0.047723052351033836,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.0266666666666668e-05,
|
|
"loss": 1.1618,
|
|
"mean_token_accuracy": 0.6902470916509629,
|
|
"num_tokens": 11585050.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 1.139546208642423,
|
|
"epoch": 0.04926250565268009,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.0600000000000002e-05,
|
|
"loss": 1.1371,
|
|
"mean_token_accuracy": 0.6940638959407807,
|
|
"num_tokens": 11955470.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 1.1310970352962613,
|
|
"epoch": 0.05080195895432634,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.0933333333333334e-05,
|
|
"loss": 1.1217,
|
|
"mean_token_accuracy": 0.697192519530654,
|
|
"num_tokens": 12326414.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 1.1263095822185278,
|
|
"epoch": 0.0523414122559726,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.1266666666666668e-05,
|
|
"loss": 1.1226,
|
|
"mean_token_accuracy": 0.695407111570239,
|
|
"num_tokens": 12699566.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 1.1608664955943824,
|
|
"epoch": 0.053880865557618854,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.16e-05,
|
|
"loss": 1.156,
|
|
"mean_token_accuracy": 0.6909525521099568,
|
|
"num_tokens": 13076955.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 1.1388528019189834,
|
|
"epoch": 0.05542031885926511,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.1933333333333335e-05,
|
|
"loss": 1.1475,
|
|
"mean_token_accuracy": 0.6935607939958572,
|
|
"num_tokens": 13457841.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 1.1540386551991104,
|
|
"epoch": 0.05695977216091136,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.2266666666666667e-05,
|
|
"loss": 1.1501,
|
|
"mean_token_accuracy": 0.690580427646637,
|
|
"num_tokens": 13823331.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 1.1634995128959418,
|
|
"epoch": 0.05849922546255761,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.2600000000000001e-05,
|
|
"loss": 1.1689,
|
|
"mean_token_accuracy": 0.6883407317101955,
|
|
"num_tokens": 14189829.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 1.1286564406007529,
|
|
"epoch": 0.060038678764203865,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.2933333333333334e-05,
|
|
"loss": 1.1091,
|
|
"mean_token_accuracy": 0.6968111153692007,
|
|
"num_tokens": 14568687.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 1.0947596225887537,
|
|
"epoch": 0.06157813206585012,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.3266666666666668e-05,
|
|
"loss": 1.0865,
|
|
"mean_token_accuracy": 0.7018399801105261,
|
|
"num_tokens": 14956883.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 1.105372793599963,
|
|
"epoch": 0.06311758536749637,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.3600000000000002e-05,
|
|
"loss": 1.098,
|
|
"mean_token_accuracy": 0.7011617802083492,
|
|
"num_tokens": 15329120.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 1.1237883031368257,
|
|
"epoch": 0.06465703866914262,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.3933333333333334e-05,
|
|
"loss": 1.1159,
|
|
"mean_token_accuracy": 0.6975264508277178,
|
|
"num_tokens": 15706521.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 1.1330916548147798,
|
|
"epoch": 0.06619649197078888,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.4266666666666668e-05,
|
|
"loss": 1.1323,
|
|
"mean_token_accuracy": 0.6972741197794676,
|
|
"num_tokens": 16066978.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 1.1772997351363301,
|
|
"epoch": 0.06773594527243512,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.46e-05,
|
|
"loss": 1.1734,
|
|
"mean_token_accuracy": 0.6860150098800659,
|
|
"num_tokens": 16449339.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 1.158057621307671,
|
|
"epoch": 0.06927539857408138,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.4933333333333335e-05,
|
|
"loss": 1.1629,
|
|
"mean_token_accuracy": 0.6880886014550924,
|
|
"num_tokens": 16831396.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 1.139371989108622,
|
|
"epoch": 0.07081485187572763,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.5266666666666667e-05,
|
|
"loss": 1.1223,
|
|
"mean_token_accuracy": 0.6936335910111666,
|
|
"num_tokens": 17210779.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 1.1907519888132811,
|
|
"epoch": 0.07235430517737389,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 1.5600000000000003e-05,
|
|
"loss": 1.187,
|
|
"mean_token_accuracy": 0.6834761939942837,
|
|
"num_tokens": 17582881.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 1.1354382883757352,
|
|
"epoch": 0.07389375847902013,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.5933333333333336e-05,
|
|
"loss": 1.1418,
|
|
"mean_token_accuracy": 0.6936424177139997,
|
|
"num_tokens": 17952831.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 1.131275094114244,
|
|
"epoch": 0.07543321178066639,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.6266666666666668e-05,
|
|
"loss": 1.1324,
|
|
"mean_token_accuracy": 0.6951741587370635,
|
|
"num_tokens": 18341435.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 1.1359387850388885,
|
|
"epoch": 0.07697266508231264,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.66e-05,
|
|
"loss": 1.1273,
|
|
"mean_token_accuracy": 0.6938830468803644,
|
|
"num_tokens": 18710959.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 1.1200769424438477,
|
|
"epoch": 0.0785121183839589,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.6933333333333336e-05,
|
|
"loss": 1.1116,
|
|
"mean_token_accuracy": 0.698444551974535,
|
|
"num_tokens": 19077026.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 1.144037862494588,
|
|
"epoch": 0.08005157168560514,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.726666666666667e-05,
|
|
"loss": 1.1399,
|
|
"mean_token_accuracy": 0.694709181971848,
|
|
"num_tokens": 19433930.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 1.1314732745289802,
|
|
"epoch": 0.0815910249872514,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.76e-05,
|
|
"loss": 1.1265,
|
|
"mean_token_accuracy": 0.6972466479986906,
|
|
"num_tokens": 19801472.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 1.1006763726472855,
|
|
"epoch": 0.08313047828889765,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.7933333333333333e-05,
|
|
"loss": 1.0907,
|
|
"mean_token_accuracy": 0.7027702957391739,
|
|
"num_tokens": 20178765.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 1.1250910840928554,
|
|
"epoch": 0.08466993159054391,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 1.826666666666667e-05,
|
|
"loss": 1.1259,
|
|
"mean_token_accuracy": 0.6969286557286978,
|
|
"num_tokens": 20540840.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 1.1310079213231803,
|
|
"epoch": 0.08620938489219016,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.86e-05,
|
|
"loss": 1.1182,
|
|
"mean_token_accuracy": 0.6943910989910365,
|
|
"num_tokens": 20917703.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 1.1366374537348747,
|
|
"epoch": 0.08774883819383641,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.8933333333333334e-05,
|
|
"loss": 1.1538,
|
|
"mean_token_accuracy": 0.692281323671341,
|
|
"num_tokens": 21286716.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 1.1471243999898433,
|
|
"epoch": 0.08928829149548266,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.926666666666667e-05,
|
|
"loss": 1.1422,
|
|
"mean_token_accuracy": 0.6914283595979214,
|
|
"num_tokens": 21672957.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 1.0941655661910772,
|
|
"epoch": 0.09082774479712892,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.9600000000000002e-05,
|
|
"loss": 1.0918,
|
|
"mean_token_accuracy": 0.703205331414938,
|
|
"num_tokens": 22057533.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 1.1071835961192846,
|
|
"epoch": 0.09236719809877517,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9933333333333334e-05,
|
|
"loss": 1.1111,
|
|
"mean_token_accuracy": 0.6998405870050192,
|
|
"num_tokens": 22435546.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 1.1055552622303366,
|
|
"epoch": 0.09390665140042143,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9999991608372392e-05,
|
|
"loss": 1.0997,
|
|
"mean_token_accuracy": 0.7011382140219211,
|
|
"num_tokens": 22797277.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 1.1513552486896514,
|
|
"epoch": 0.09544610470206767,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.9999957517409375e-05,
|
|
"loss": 1.1525,
|
|
"mean_token_accuracy": 0.6906207267194986,
|
|
"num_tokens": 23157199.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 1.1360066479071975,
|
|
"epoch": 0.09698555800371393,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.9999897202723546e-05,
|
|
"loss": 1.1269,
|
|
"mean_token_accuracy": 0.6963287502527237,
|
|
"num_tokens": 23542710.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 1.1110562330111862,
|
|
"epoch": 0.09852501130536018,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.999981066447308e-05,
|
|
"loss": 1.103,
|
|
"mean_token_accuracy": 0.700805151462555,
|
|
"num_tokens": 23929848.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 1.0776942696422338,
|
|
"epoch": 0.10006446460700644,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.999969790288491e-05,
|
|
"loss": 1.0754,
|
|
"mean_token_accuracy": 0.706406794860959,
|
|
"num_tokens": 24320781.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 1.1285138919949531,
|
|
"epoch": 0.10160391790865268,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.9999558918254746e-05,
|
|
"loss": 1.1159,
|
|
"mean_token_accuracy": 0.6957792080938816,
|
|
"num_tokens": 24718182.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 1.1143408741801977,
|
|
"epoch": 0.10314337121029894,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.999939371094705e-05,
|
|
"loss": 1.1132,
|
|
"mean_token_accuracy": 0.6973476313054562,
|
|
"num_tokens": 25078136.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 1.1544642113149166,
|
|
"epoch": 0.1046828245119452,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.9999202281395064e-05,
|
|
"loss": 1.1505,
|
|
"mean_token_accuracy": 0.6898461397737264,
|
|
"num_tokens": 25462544.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 1.110057471320033,
|
|
"epoch": 0.10622227781359145,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.999898463010079e-05,
|
|
"loss": 1.1093,
|
|
"mean_token_accuracy": 0.696648533269763,
|
|
"num_tokens": 25832507.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 1.121138433739543,
|
|
"epoch": 0.10776173111523771,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.9998740757634998e-05,
|
|
"loss": 1.1206,
|
|
"mean_token_accuracy": 0.695626575127244,
|
|
"num_tokens": 26208168.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 1.1249326327815652,
|
|
"epoch": 0.10930118441688395,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9998470664637205e-05,
|
|
"loss": 1.1066,
|
|
"mean_token_accuracy": 0.6976452205330134,
|
|
"num_tokens": 26567141.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 1.1190939696505666,
|
|
"epoch": 0.11084063771853021,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.9998174351815704e-05,
|
|
"loss": 1.109,
|
|
"mean_token_accuracy": 0.696621885150671,
|
|
"num_tokens": 26946409.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 1.097430343925953,
|
|
"epoch": 0.11238009102017646,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9997851819947537e-05,
|
|
"loss": 1.0981,
|
|
"mean_token_accuracy": 0.6984185025095939,
|
|
"num_tokens": 27323310.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 1.1255185015499591,
|
|
"epoch": 0.11391954432182272,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9997503069878515e-05,
|
|
"loss": 1.1021,
|
|
"mean_token_accuracy": 0.6977558217942714,
|
|
"num_tokens": 27728681.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 1.1182758403941988,
|
|
"epoch": 0.11545899762346896,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.9997128102523186e-05,
|
|
"loss": 1.1144,
|
|
"mean_token_accuracy": 0.6975483104586602,
|
|
"num_tokens": 28099689.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 1.0848099140450358,
|
|
"epoch": 0.11699845092511522,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.9996726918864857e-05,
|
|
"loss": 1.0807,
|
|
"mean_token_accuracy": 0.7057063952088356,
|
|
"num_tokens": 28470608.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 1.147358151897788,
|
|
"epoch": 0.11853790422676147,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.999629951995559e-05,
|
|
"loss": 1.1361,
|
|
"mean_token_accuracy": 0.6940991956740618,
|
|
"num_tokens": 28850518.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 1.158296991325915,
|
|
"epoch": 0.12007735752840773,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.999584590691619e-05,
|
|
"loss": 1.1613,
|
|
"mean_token_accuracy": 0.6874197501689195,
|
|
"num_tokens": 29223644.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 1.1296958446502685,
|
|
"epoch": 0.12161681083005398,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9995366080936206e-05,
|
|
"loss": 1.1062,
|
|
"mean_token_accuracy": 0.6964040424674749,
|
|
"num_tokens": 29597922.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 1.1090093098580838,
|
|
"epoch": 0.12315626413170024,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9994860043273915e-05,
|
|
"loss": 1.1119,
|
|
"mean_token_accuracy": 0.6979490287601948,
|
|
"num_tokens": 29967597.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 1.1302901729941368,
|
|
"epoch": 0.12469571743334648,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.999432779525635e-05,
|
|
"loss": 1.113,
|
|
"mean_token_accuracy": 0.6980737678706646,
|
|
"num_tokens": 30351751.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 1.0851911935955285,
|
|
"epoch": 0.12623517073499274,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.999376933827927e-05,
|
|
"loss": 1.0852,
|
|
"mean_token_accuracy": 0.7041132722049952,
|
|
"num_tokens": 30718524.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 1.092500716075301,
|
|
"epoch": 0.127774624036639,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.999318467380716e-05,
|
|
"loss": 1.0757,
|
|
"mean_token_accuracy": 0.7052585650235415,
|
|
"num_tokens": 31099388.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 1.1496953256428242,
|
|
"epoch": 0.12931407733828523,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9992573803373242e-05,
|
|
"loss": 1.1516,
|
|
"mean_token_accuracy": 0.6907676491886378,
|
|
"num_tokens": 31461359.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 1.1136517949402331,
|
|
"epoch": 0.1308535306399315,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.9991936728579438e-05,
|
|
"loss": 1.1098,
|
|
"mean_token_accuracy": 0.6990172352641821,
|
|
"num_tokens": 31837580.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 1.1240890389308333,
|
|
"epoch": 0.13239298394157775,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9991273451096414e-05,
|
|
"loss": 1.1144,
|
|
"mean_token_accuracy": 0.6938084073364734,
|
|
"num_tokens": 32219381.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 1.1162253782153129,
|
|
"epoch": 0.133932437243224,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.9990583972663534e-05,
|
|
"loss": 1.107,
|
|
"mean_token_accuracy": 0.6976239930838346,
|
|
"num_tokens": 32600761.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 1.1294534251093864,
|
|
"epoch": 0.13547189054487024,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 1.9989868295088876e-05,
|
|
"loss": 1.1381,
|
|
"mean_token_accuracy": 0.6945139471441507,
|
|
"num_tokens": 32967708.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 1.1337316358461975,
|
|
"epoch": 0.1370113438465165,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.998912642024922e-05,
|
|
"loss": 1.1376,
|
|
"mean_token_accuracy": 0.6949200943112374,
|
|
"num_tokens": 33348622.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 1.1307091983035207,
|
|
"epoch": 0.13855079714816276,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.9988358350090045e-05,
|
|
"loss": 1.1169,
|
|
"mean_token_accuracy": 0.6963778145611286,
|
|
"num_tokens": 33718264.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 1.1685293976217508,
|
|
"epoch": 0.14009025044980902,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.998756408662553e-05,
|
|
"loss": 1.1656,
|
|
"mean_token_accuracy": 0.6891588238999248,
|
|
"num_tokens": 34095351.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 1.1300161950290204,
|
|
"epoch": 0.14162970375145525,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9986743631938536e-05,
|
|
"loss": 1.1278,
|
|
"mean_token_accuracy": 0.6970746215432883,
|
|
"num_tokens": 34470308.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 1.1416201300919055,
|
|
"epoch": 0.14316915705310151,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9985896988180607e-05,
|
|
"loss": 1.1224,
|
|
"mean_token_accuracy": 0.6962168168276548,
|
|
"num_tokens": 34842571.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 1.1438201934099197,
|
|
"epoch": 0.14470861035474777,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.9985024157571972e-05,
|
|
"loss": 1.146,
|
|
"mean_token_accuracy": 0.6919929884374142,
|
|
"num_tokens": 35212666.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 1.1576870299875737,
|
|
"epoch": 0.14624806365639403,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.998412514240152e-05,
|
|
"loss": 1.1606,
|
|
"mean_token_accuracy": 0.692124840989709,
|
|
"num_tokens": 35593532.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 1.1232300328090787,
|
|
"epoch": 0.14778751695804027,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.9983199945026822e-05,
|
|
"loss": 1.1198,
|
|
"mean_token_accuracy": 0.6935272339731455,
|
|
"num_tokens": 35980581.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 1.1406380519270898,
|
|
"epoch": 0.14932697025968653,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9982248567874098e-05,
|
|
"loss": 1.1303,
|
|
"mean_token_accuracy": 0.6920850377529859,
|
|
"num_tokens": 36366818.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 1.1526461832225323,
|
|
"epoch": 0.15086642356133279,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.998127101343822e-05,
|
|
"loss": 1.1452,
|
|
"mean_token_accuracy": 0.6928542651236057,
|
|
"num_tokens": 36739879.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 1.127664201334119,
|
|
"epoch": 0.15240587686297905,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.9980267284282718e-05,
|
|
"loss": 1.1309,
|
|
"mean_token_accuracy": 0.6948033161461353,
|
|
"num_tokens": 37126967.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 1.1573752466589213,
|
|
"epoch": 0.15394533016462528,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.9979237383039745e-05,
|
|
"loss": 1.1486,
|
|
"mean_token_accuracy": 0.6922336863353848,
|
|
"num_tokens": 37491480.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 1.1195718679577111,
|
|
"epoch": 0.15548478346627154,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9978181312410104e-05,
|
|
"loss": 1.1097,
|
|
"mean_token_accuracy": 0.6958762314170599,
|
|
"num_tokens": 37855648.0,
|
|
"step": 505
|
|
},
|
|
{
|
|
"entropy": 1.1157226022332907,
|
|
"epoch": 0.1570242367679178,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9977099075163216e-05,
|
|
"loss": 1.1044,
|
|
"mean_token_accuracy": 0.6988037750124931,
|
|
"num_tokens": 38239757.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 1.1437922086566688,
|
|
"epoch": 0.15856369006956406,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 1.997599067413712e-05,
|
|
"loss": 1.1402,
|
|
"mean_token_accuracy": 0.6914523551240563,
|
|
"num_tokens": 38626774.0,
|
|
"step": 515
|
|
},
|
|
{
|
|
"entropy": 1.1398277616128325,
|
|
"epoch": 0.1601031433712103,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.997485611223847e-05,
|
|
"loss": 1.1292,
|
|
"mean_token_accuracy": 0.6958260778337717,
|
|
"num_tokens": 38999361.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 1.1146018091589212,
|
|
"epoch": 0.16164259667285655,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.997369539244252e-05,
|
|
"loss": 1.1124,
|
|
"mean_token_accuracy": 0.7005707703530788,
|
|
"num_tokens": 39381117.0,
|
|
"step": 525
|
|
},
|
|
{
|
|
"entropy": 1.1075803402811288,
|
|
"epoch": 0.1631820499745028,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.9972508517793125e-05,
|
|
"loss": 1.1011,
|
|
"mean_token_accuracy": 0.6986994445323944,
|
|
"num_tokens": 39748243.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 1.1309567619115115,
|
|
"epoch": 0.16472150327614907,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 1.9971295491402725e-05,
|
|
"loss": 1.1364,
|
|
"mean_token_accuracy": 0.6940356496721506,
|
|
"num_tokens": 40115293.0,
|
|
"step": 535
|
|
},
|
|
{
|
|
"entropy": 1.18396236859262,
|
|
"epoch": 0.1662609565777953,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.997005631645234e-05,
|
|
"loss": 1.1725,
|
|
"mean_token_accuracy": 0.686182476207614,
|
|
"num_tokens": 40508440.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 1.1049391619861126,
|
|
"epoch": 0.16780040987944156,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.996879099619156e-05,
|
|
"loss": 1.1144,
|
|
"mean_token_accuracy": 0.696911821886897,
|
|
"num_tokens": 40896598.0,
|
|
"step": 545
|
|
},
|
|
{
|
|
"entropy": 1.1429337464272975,
|
|
"epoch": 0.16933986318108782,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9967499533938544e-05,
|
|
"loss": 1.136,
|
|
"mean_token_accuracy": 0.6921508580446243,
|
|
"num_tokens": 41271458.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 1.1443469554185868,
|
|
"epoch": 0.17087931648273408,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.996618193308e-05,
|
|
"loss": 1.133,
|
|
"mean_token_accuracy": 0.6909565668553114,
|
|
"num_tokens": 41652091.0,
|
|
"step": 555
|
|
},
|
|
{
|
|
"entropy": 1.1591787867248058,
|
|
"epoch": 0.1724187697843803,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.9964838197071173e-05,
|
|
"loss": 1.1434,
|
|
"mean_token_accuracy": 0.6915002010762692,
|
|
"num_tokens": 42027815.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 1.1327795442193747,
|
|
"epoch": 0.17395822308602657,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 1.9963468329435872e-05,
|
|
"loss": 1.1364,
|
|
"mean_token_accuracy": 0.6924004014581442,
|
|
"num_tokens": 42390261.0,
|
|
"step": 565
|
|
},
|
|
{
|
|
"entropy": 1.1397675037384034,
|
|
"epoch": 0.17549767638767283,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.99620723337664e-05,
|
|
"loss": 1.1406,
|
|
"mean_token_accuracy": 0.6912539415061474,
|
|
"num_tokens": 42759613.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 1.107204508036375,
|
|
"epoch": 0.1770371296893191,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.9960650213723604e-05,
|
|
"loss": 1.0852,
|
|
"mean_token_accuracy": 0.6994996588677168,
|
|
"num_tokens": 43132014.0,
|
|
"step": 575
|
|
},
|
|
{
|
|
"entropy": 1.099429708532989,
|
|
"epoch": 0.17857658299096532,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.9959201973036816e-05,
|
|
"loss": 1.1041,
|
|
"mean_token_accuracy": 0.7006071075797081,
|
|
"num_tokens": 43518177.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 1.1445161992684008,
|
|
"epoch": 0.18011603629261158,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.995772761550389e-05,
|
|
"loss": 1.1382,
|
|
"mean_token_accuracy": 0.6925386656075716,
|
|
"num_tokens": 43894430.0,
|
|
"step": 585
|
|
},
|
|
{
|
|
"entropy": 1.1534817535430193,
|
|
"epoch": 0.18165548959425784,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.995622714499115e-05,
|
|
"loss": 1.1493,
|
|
"mean_token_accuracy": 0.6913147930055856,
|
|
"num_tokens": 44258015.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 1.1478193078190089,
|
|
"epoch": 0.1831949428959041,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9954700565433406e-05,
|
|
"loss": 1.1502,
|
|
"mean_token_accuracy": 0.6935486130416393,
|
|
"num_tokens": 44636368.0,
|
|
"step": 595
|
|
},
|
|
{
|
|
"entropy": 1.1420258667320013,
|
|
"epoch": 0.18473439619755033,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.9953147880833935e-05,
|
|
"loss": 1.1395,
|
|
"mean_token_accuracy": 0.693219494074583,
|
|
"num_tokens": 45009190.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 1.1204937249422073,
|
|
"epoch": 0.1862738494991966,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.9951569095264473e-05,
|
|
"loss": 1.1237,
|
|
"mean_token_accuracy": 0.6966589823365211,
|
|
"num_tokens": 45369198.0,
|
|
"step": 605
|
|
},
|
|
{
|
|
"entropy": 1.1316735215485096,
|
|
"epoch": 0.18781330280084285,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.99499642128652e-05,
|
|
"loss": 1.1151,
|
|
"mean_token_accuracy": 0.6951681729406118,
|
|
"num_tokens": 45735650.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 1.119157313928008,
|
|
"epoch": 0.1893527561024891,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.994833323784473e-05,
|
|
"loss": 1.1205,
|
|
"mean_token_accuracy": 0.6974445167928934,
|
|
"num_tokens": 46105045.0,
|
|
"step": 615
|
|
},
|
|
{
|
|
"entropy": 1.1227743715047835,
|
|
"epoch": 0.19089220940413534,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.9946676174480115e-05,
|
|
"loss": 1.1122,
|
|
"mean_token_accuracy": 0.6958862528204918,
|
|
"num_tokens": 46468345.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 1.123009406030178,
|
|
"epoch": 0.1924316627057816,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.9944993027116798e-05,
|
|
"loss": 1.1064,
|
|
"mean_token_accuracy": 0.6993745014071464,
|
|
"num_tokens": 46839653.0,
|
|
"step": 625
|
|
},
|
|
{
|
|
"entropy": 1.13520105779171,
|
|
"epoch": 0.19397111600742786,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.9943283800168643e-05,
|
|
"loss": 1.1432,
|
|
"mean_token_accuracy": 0.69097990244627,
|
|
"num_tokens": 47218180.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 1.1393942264840007,
|
|
"epoch": 0.19551056930907412,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.9941548498117894e-05,
|
|
"loss": 1.1382,
|
|
"mean_token_accuracy": 0.6938273806124926,
|
|
"num_tokens": 47595740.0,
|
|
"step": 635
|
|
},
|
|
{
|
|
"entropy": 1.1325588449835777,
|
|
"epoch": 0.19705002261072035,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9939787125515188e-05,
|
|
"loss": 1.1298,
|
|
"mean_token_accuracy": 0.6938525449484587,
|
|
"num_tokens": 47982358.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 1.121693492308259,
|
|
"epoch": 0.19858947591236661,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.993799968697951e-05,
|
|
"loss": 1.1191,
|
|
"mean_token_accuracy": 0.6956870190799236,
|
|
"num_tokens": 48372670.0,
|
|
"step": 645
|
|
},
|
|
{
|
|
"entropy": 1.1251621477305889,
|
|
"epoch": 0.20012892921401287,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.9936186187198214e-05,
|
|
"loss": 1.1236,
|
|
"mean_token_accuracy": 0.6986733213067055,
|
|
"num_tokens": 48737613.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 1.139292366988957,
|
|
"epoch": 0.20166838251565913,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9934346630926988e-05,
|
|
"loss": 1.1304,
|
|
"mean_token_accuracy": 0.6938830778002739,
|
|
"num_tokens": 49100209.0,
|
|
"step": 655
|
|
},
|
|
{
|
|
"entropy": 1.1345834810286761,
|
|
"epoch": 0.20320783581730537,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 1.9932481022989857e-05,
|
|
"loss": 1.1181,
|
|
"mean_token_accuracy": 0.6951233502477407,
|
|
"num_tokens": 49467553.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 1.094562499411404,
|
|
"epoch": 0.20474728911895163,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.993058936827916e-05,
|
|
"loss": 1.0977,
|
|
"mean_token_accuracy": 0.7043172724545002,
|
|
"num_tokens": 49849811.0,
|
|
"step": 665
|
|
},
|
|
{
|
|
"entropy": 1.139369383826852,
|
|
"epoch": 0.20628674242059789,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.992867167175554e-05,
|
|
"loss": 1.1425,
|
|
"mean_token_accuracy": 0.6948151815682649,
|
|
"num_tokens": 50225933.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 1.079656113870442,
|
|
"epoch": 0.20782619572224414,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.9926727938447935e-05,
|
|
"loss": 1.0692,
|
|
"mean_token_accuracy": 0.7051354993134737,
|
|
"num_tokens": 50610063.0,
|
|
"step": 675
|
|
},
|
|
{
|
|
"entropy": 1.1766547793522477,
|
|
"epoch": 0.2093656490238904,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9924758173453555e-05,
|
|
"loss": 1.1785,
|
|
"mean_token_accuracy": 0.6878008231520653,
|
|
"num_tokens": 50990235.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 1.0988596007227898,
|
|
"epoch": 0.21090510232553664,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 1.992276238193788e-05,
|
|
"loss": 1.0932,
|
|
"mean_token_accuracy": 0.7026484467089176,
|
|
"num_tokens": 51363981.0,
|
|
"step": 685
|
|
},
|
|
{
|
|
"entropy": 1.1409345027059317,
|
|
"epoch": 0.2124445556271829,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.992074056913464e-05,
|
|
"loss": 1.1352,
|
|
"mean_token_accuracy": 0.6939107369631529,
|
|
"num_tokens": 51737796.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 1.120890161767602,
|
|
"epoch": 0.21398400892882916,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9918692740345804e-05,
|
|
"loss": 1.1338,
|
|
"mean_token_accuracy": 0.6986452504992485,
|
|
"num_tokens": 52114356.0,
|
|
"step": 695
|
|
},
|
|
{
|
|
"entropy": 1.119481140933931,
|
|
"epoch": 0.21552346223047542,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.9916618900941567e-05,
|
|
"loss": 1.1131,
|
|
"mean_token_accuracy": 0.6989668853580951,
|
|
"num_tokens": 52484836.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 1.0964285958558322,
|
|
"epoch": 0.21706291553212165,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.991451905636033e-05,
|
|
"loss": 1.0937,
|
|
"mean_token_accuracy": 0.7034055396914483,
|
|
"num_tokens": 52859792.0,
|
|
"step": 705
|
|
},
|
|
{
|
|
"entropy": 1.1160279937088489,
|
|
"epoch": 0.2186023688337679,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.9912393212108692e-05,
|
|
"loss": 1.1109,
|
|
"mean_token_accuracy": 0.6976350143551826,
|
|
"num_tokens": 53212860.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 1.14042426943779,
|
|
"epoch": 0.22014182213541417,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.9910241373761426e-05,
|
|
"loss": 1.1385,
|
|
"mean_token_accuracy": 0.694380571320653,
|
|
"num_tokens": 53583748.0,
|
|
"step": 715
|
|
},
|
|
{
|
|
"entropy": 1.1466562129557132,
|
|
"epoch": 0.22168127543706043,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.9908063546961482e-05,
|
|
"loss": 1.1338,
|
|
"mean_token_accuracy": 0.6904741197824478,
|
|
"num_tokens": 53940694.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 1.121897478029132,
|
|
"epoch": 0.22322072873870666,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.990585973741996e-05,
|
|
"loss": 1.1211,
|
|
"mean_token_accuracy": 0.6964031044393778,
|
|
"num_tokens": 54316660.0,
|
|
"step": 725
|
|
},
|
|
{
|
|
"entropy": 1.1026945130899548,
|
|
"epoch": 0.22476018204035292,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9903629950916083e-05,
|
|
"loss": 1.0919,
|
|
"mean_token_accuracy": 0.7022646889090538,
|
|
"num_tokens": 54700093.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 1.1913654580712318,
|
|
"epoch": 0.22629963534199918,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.9901374193297212e-05,
|
|
"loss": 1.1867,
|
|
"mean_token_accuracy": 0.6831524942070246,
|
|
"num_tokens": 55072259.0,
|
|
"step": 735
|
|
},
|
|
{
|
|
"entropy": 1.0986135648563504,
|
|
"epoch": 0.22783908864364544,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.989909247047881e-05,
|
|
"loss": 1.0859,
|
|
"mean_token_accuracy": 0.70220061019063,
|
|
"num_tokens": 55431253.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 1.1104688480496407,
|
|
"epoch": 0.22937854194529167,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.989678478844443e-05,
|
|
"loss": 1.1053,
|
|
"mean_token_accuracy": 0.7009272977709771,
|
|
"num_tokens": 55806238.0,
|
|
"step": 745
|
|
},
|
|
{
|
|
"entropy": 1.1378316521644591,
|
|
"epoch": 0.23091799524693793,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 1.9894451153245695e-05,
|
|
"loss": 1.1323,
|
|
"mean_token_accuracy": 0.6941636923700572,
|
|
"num_tokens": 56167420.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 1.0988559927791357,
|
|
"epoch": 0.2324574485485842,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.9892091571002295e-05,
|
|
"loss": 1.1008,
|
|
"mean_token_accuracy": 0.7004305239766836,
|
|
"num_tokens": 56550823.0,
|
|
"step": 755
|
|
},
|
|
{
|
|
"entropy": 1.1214569361880422,
|
|
"epoch": 0.23399690185023045,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.9889706047901956e-05,
|
|
"loss": 1.1044,
|
|
"mean_token_accuracy": 0.6996850349009037,
|
|
"num_tokens": 56920052.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 1.1102859888225793,
|
|
"epoch": 0.23553635515187668,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9887294590200437e-05,
|
|
"loss": 1.11,
|
|
"mean_token_accuracy": 0.6958253476768732,
|
|
"num_tokens": 57288683.0,
|
|
"step": 765
|
|
},
|
|
{
|
|
"entropy": 1.1473000289872288,
|
|
"epoch": 0.23707580845352294,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.9884857204221503e-05,
|
|
"loss": 1.1542,
|
|
"mean_token_accuracy": 0.6928766690194607,
|
|
"num_tokens": 57645195.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 1.1104052532464266,
|
|
"epoch": 0.2386152617551692,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.9882393896356915e-05,
|
|
"loss": 1.096,
|
|
"mean_token_accuracy": 0.6981043085455895,
|
|
"num_tokens": 58010298.0,
|
|
"step": 775
|
|
},
|
|
{
|
|
"entropy": 1.1217896696180105,
|
|
"epoch": 0.24015471505681546,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.987990467306641e-05,
|
|
"loss": 1.1139,
|
|
"mean_token_accuracy": 0.6969779424369336,
|
|
"num_tokens": 58403545.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 1.1406789550557732,
|
|
"epoch": 0.2416941683584617,
|
|
"grad_norm": 0.640625,
|
|
"learning_rate": 1.9877389540877686e-05,
|
|
"loss": 1.1472,
|
|
"mean_token_accuracy": 0.6947149783372879,
|
|
"num_tokens": 58774798.0,
|
|
"step": 785
|
|
},
|
|
{
|
|
"entropy": 1.124403426796198,
|
|
"epoch": 0.24323362166010795,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9874848506386392e-05,
|
|
"loss": 1.1214,
|
|
"mean_token_accuracy": 0.6990401953458786,
|
|
"num_tokens": 59159772.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 1.0997486164793373,
|
|
"epoch": 0.2447730749617542,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9872281576256078e-05,
|
|
"loss": 1.0879,
|
|
"mean_token_accuracy": 0.7038913916796445,
|
|
"num_tokens": 59540395.0,
|
|
"step": 795
|
|
},
|
|
{
|
|
"entropy": 1.1355868607759476,
|
|
"epoch": 0.24631252826340047,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.9869688757218233e-05,
|
|
"loss": 1.1415,
|
|
"mean_token_accuracy": 0.6912806447595358,
|
|
"num_tokens": 59905249.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 1.1410336146131157,
|
|
"epoch": 0.2478519815650467,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.9867070056072215e-05,
|
|
"loss": 1.1433,
|
|
"mean_token_accuracy": 0.695595920830965,
|
|
"num_tokens": 60268255.0,
|
|
"step": 805
|
|
},
|
|
{
|
|
"entropy": 1.1349990352988244,
|
|
"epoch": 0.24939143486669296,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.986442547968527e-05,
|
|
"loss": 1.1253,
|
|
"mean_token_accuracy": 0.6944803945720196,
|
|
"num_tokens": 60639389.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 1.071821440383792,
|
|
"epoch": 0.2509308881683392,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.9861755034992483e-05,
|
|
"loss": 1.0666,
|
|
"mean_token_accuracy": 0.7084377076476812,
|
|
"num_tokens": 61024428.0,
|
|
"step": 815
|
|
},
|
|
{
|
|
"entropy": 1.1051497608423233,
|
|
"epoch": 0.2524703414699855,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.9859058728996788e-05,
|
|
"loss": 1.0965,
|
|
"mean_token_accuracy": 0.7005310852080584,
|
|
"num_tokens": 61402658.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 1.1438620645552873,
|
|
"epoch": 0.2540097947716317,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.9856336568768936e-05,
|
|
"loss": 1.1399,
|
|
"mean_token_accuracy": 0.6912882044911385,
|
|
"num_tokens": 61780493.0,
|
|
"step": 825
|
|
},
|
|
{
|
|
"entropy": 1.0913935292512178,
|
|
"epoch": 0.255549248073278,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.985358856144747e-05,
|
|
"loss": 1.0922,
|
|
"mean_token_accuracy": 0.7028463281691074,
|
|
"num_tokens": 62152861.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 1.1374814191833138,
|
|
"epoch": 0.25708870137492423,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.9850814714238718e-05,
|
|
"loss": 1.13,
|
|
"mean_token_accuracy": 0.6964493870735169,
|
|
"num_tokens": 62514124.0,
|
|
"step": 835
|
|
},
|
|
{
|
|
"entropy": 1.1332073567435146,
|
|
"epoch": 0.25862815467657047,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.9848015034416776e-05,
|
|
"loss": 1.1199,
|
|
"mean_token_accuracy": 0.6939284823834896,
|
|
"num_tokens": 62901998.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 1.1137794975191355,
|
|
"epoch": 0.26016760797821675,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 1.9845189529323473e-05,
|
|
"loss": 1.103,
|
|
"mean_token_accuracy": 0.7006840953603387,
|
|
"num_tokens": 63266839.0,
|
|
"step": 845
|
|
},
|
|
{
|
|
"entropy": 1.1099360350519418,
|
|
"epoch": 0.261707061279863,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9842338206368375e-05,
|
|
"loss": 1.0998,
|
|
"mean_token_accuracy": 0.6972894985228777,
|
|
"num_tokens": 63654737.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 1.1284802999347447,
|
|
"epoch": 0.2632465145815092,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.9839461073028733e-05,
|
|
"loss": 1.1083,
|
|
"mean_token_accuracy": 0.6968803893774748,
|
|
"num_tokens": 64032094.0,
|
|
"step": 855
|
|
},
|
|
{
|
|
"entropy": 1.0841836363077164,
|
|
"epoch": 0.2647859678831555,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.98365581368495e-05,
|
|
"loss": 1.0933,
|
|
"mean_token_accuracy": 0.7028985098004341,
|
|
"num_tokens": 64418973.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 1.1070842415094375,
|
|
"epoch": 0.26632542118480174,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9833629405443283e-05,
|
|
"loss": 1.1091,
|
|
"mean_token_accuracy": 0.7023597385734319,
|
|
"num_tokens": 64798969.0,
|
|
"step": 865
|
|
},
|
|
{
|
|
"entropy": 1.1159617979079486,
|
|
"epoch": 0.267864874486448,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.983067488649035e-05,
|
|
"loss": 1.1119,
|
|
"mean_token_accuracy": 0.6988450512290001,
|
|
"num_tokens": 65171715.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 1.1518226452171803,
|
|
"epoch": 0.26940432778809426,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.982769458773857e-05,
|
|
"loss": 1.1421,
|
|
"mean_token_accuracy": 0.6895007479935884,
|
|
"num_tokens": 65548454.0,
|
|
"step": 875
|
|
},
|
|
{
|
|
"entropy": 1.1310207761824131,
|
|
"epoch": 0.2709437810897405,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.9824688517003433e-05,
|
|
"loss": 1.1165,
|
|
"mean_token_accuracy": 0.6969778280705213,
|
|
"num_tokens": 65912713.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 1.0850966442376375,
|
|
"epoch": 0.2724832343913868,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 1.9821656682168013e-05,
|
|
"loss": 1.0868,
|
|
"mean_token_accuracy": 0.7045084740966558,
|
|
"num_tokens": 66288389.0,
|
|
"step": 885
|
|
},
|
|
{
|
|
"entropy": 1.116120758280158,
|
|
"epoch": 0.274022687693033,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.981859909118294e-05,
|
|
"loss": 1.1183,
|
|
"mean_token_accuracy": 0.6976446002721787,
|
|
"num_tokens": 66673853.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 1.1547842472791672,
|
|
"epoch": 0.27556214099467924,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.9815515752066386e-05,
|
|
"loss": 1.1512,
|
|
"mean_token_accuracy": 0.6902260981500149,
|
|
"num_tokens": 67054614.0,
|
|
"step": 895
|
|
},
|
|
{
|
|
"entropy": 1.0831589922308922,
|
|
"epoch": 0.2771015942963255,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.9812406672904058e-05,
|
|
"loss": 1.0824,
|
|
"mean_token_accuracy": 0.7042932607233524,
|
|
"num_tokens": 67422842.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 1.1236521264538168,
|
|
"epoch": 0.27864104759797176,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 1.9809271861849147e-05,
|
|
"loss": 1.1257,
|
|
"mean_token_accuracy": 0.6985704395920038,
|
|
"num_tokens": 67791499.0,
|
|
"step": 905
|
|
},
|
|
{
|
|
"entropy": 1.1213534710928799,
|
|
"epoch": 0.28018050089961805,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.9806111327122332e-05,
|
|
"loss": 1.1056,
|
|
"mean_token_accuracy": 0.6963206488639117,
|
|
"num_tokens": 68168533.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 1.0945915594696998,
|
|
"epoch": 0.2817199542012643,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9802925077011742e-05,
|
|
"loss": 1.0805,
|
|
"mean_token_accuracy": 0.7033400624990463,
|
|
"num_tokens": 68534200.0,
|
|
"step": 915
|
|
},
|
|
{
|
|
"entropy": 1.1363273495808244,
|
|
"epoch": 0.2832594075029105,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.979971311987295e-05,
|
|
"loss": 1.1331,
|
|
"mean_token_accuracy": 0.6933297269046307,
|
|
"num_tokens": 68904756.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 1.113439468294382,
|
|
"epoch": 0.2847988608045568,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 1.9796475464128943e-05,
|
|
"loss": 1.1136,
|
|
"mean_token_accuracy": 0.6984921019524336,
|
|
"num_tokens": 69279269.0,
|
|
"step": 925
|
|
},
|
|
{
|
|
"entropy": 1.106918627768755,
|
|
"epoch": 0.28633831410620303,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.979321211827009e-05,
|
|
"loss": 1.0971,
|
|
"mean_token_accuracy": 0.699981477856636,
|
|
"num_tokens": 69652060.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 1.1193274904042483,
|
|
"epoch": 0.28787776740784926,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.9789923090854138e-05,
|
|
"loss": 1.1141,
|
|
"mean_token_accuracy": 0.6945442810654641,
|
|
"num_tokens": 70031530.0,
|
|
"step": 935
|
|
},
|
|
{
|
|
"entropy": 1.1201645512133838,
|
|
"epoch": 0.28941722070949555,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.9786608390506176e-05,
|
|
"loss": 1.1248,
|
|
"mean_token_accuracy": 0.6959635071456433,
|
|
"num_tokens": 70405759.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 1.158202064409852,
|
|
"epoch": 0.2909566740111418,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.9783268025918622e-05,
|
|
"loss": 1.1405,
|
|
"mean_token_accuracy": 0.6916137792170047,
|
|
"num_tokens": 70773411.0,
|
|
"step": 945
|
|
},
|
|
{
|
|
"entropy": 1.1136011434718966,
|
|
"epoch": 0.29249612731278807,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9779902005851187e-05,
|
|
"loss": 1.1032,
|
|
"mean_token_accuracy": 0.6998088311403989,
|
|
"num_tokens": 71138724.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 1.1528440322726965,
|
|
"epoch": 0.2940355806144343,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9776510339130874e-05,
|
|
"loss": 1.1432,
|
|
"mean_token_accuracy": 0.6916706405580044,
|
|
"num_tokens": 71522642.0,
|
|
"step": 955
|
|
},
|
|
{
|
|
"entropy": 1.1416105089709163,
|
|
"epoch": 0.29557503391608053,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9773093034651928e-05,
|
|
"loss": 1.1315,
|
|
"mean_token_accuracy": 0.6934664513915777,
|
|
"num_tokens": 71885197.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 1.1288053080439568,
|
|
"epoch": 0.2971144872177268,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9769650101375835e-05,
|
|
"loss": 1.1253,
|
|
"mean_token_accuracy": 0.6961982771754265,
|
|
"num_tokens": 72262607.0,
|
|
"step": 965
|
|
},
|
|
{
|
|
"entropy": 1.1250951839610934,
|
|
"epoch": 0.29865394051937305,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.9766181548331283e-05,
|
|
"loss": 1.1186,
|
|
"mean_token_accuracy": 0.6970525443553924,
|
|
"num_tokens": 72653402.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 1.1368791069835424,
|
|
"epoch": 0.3001933938210193,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 1.9762687384614152e-05,
|
|
"loss": 1.132,
|
|
"mean_token_accuracy": 0.6947309102863073,
|
|
"num_tokens": 73049063.0,
|
|
"step": 975
|
|
},
|
|
{
|
|
"entropy": 1.083188571408391,
|
|
"epoch": 0.30173284712266557,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.9759167619387474e-05,
|
|
"loss": 1.0838,
|
|
"mean_token_accuracy": 0.7051486879587173,
|
|
"num_tokens": 73435640.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 1.1301437310874463,
|
|
"epoch": 0.3032723004243118,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.975562226188143e-05,
|
|
"loss": 1.1135,
|
|
"mean_token_accuracy": 0.6951402083039284,
|
|
"num_tokens": 73804251.0,
|
|
"step": 985
|
|
},
|
|
{
|
|
"entropy": 1.1021712820976972,
|
|
"epoch": 0.3048117537259581,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.97520513213933e-05,
|
|
"loss": 1.1047,
|
|
"mean_token_accuracy": 0.6995002727955579,
|
|
"num_tokens": 74186734.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 1.1268383231014014,
|
|
"epoch": 0.3063512070276043,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 1.9748454807287458e-05,
|
|
"loss": 1.1197,
|
|
"mean_token_accuracy": 0.6963075909763574,
|
|
"num_tokens": 74564695.0,
|
|
"step": 995
|
|
},
|
|
{
|
|
"entropy": 1.1207784935832024,
|
|
"epoch": 0.30789066032925055,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.974483272899535e-05,
|
|
"loss": 1.1225,
|
|
"mean_token_accuracy": 0.6975628361105919,
|
|
"num_tokens": 74954009.0,
|
|
"step": 1000
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 10000,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 4,
|
|
"save_steps": 1000,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 1.247882499766354e+18,
|
|
"train_batch_size": 1,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|