20035 lines
555 KiB
JSON
20035 lines
555 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 3.0788200090442883,
|
|
"eval_steps": 500,
|
|
"global_step": 10000,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 1.1113718893378972,
|
|
"epoch": 0.0015394533016462528,
|
|
"grad_norm": 23.25,
|
|
"learning_rate": 2.666666666666667e-07,
|
|
"loss": 1.4148,
|
|
"mean_token_accuracy": 0.6499394655227662,
|
|
"num_tokens": 379552.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 1.1505246445536614,
|
|
"epoch": 0.0030789066032925055,
|
|
"grad_norm": 25.375,
|
|
"learning_rate": 6.000000000000001e-07,
|
|
"loss": 1.4742,
|
|
"mean_token_accuracy": 0.6414433296769857,
|
|
"num_tokens": 743248.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 1.1535595946013928,
|
|
"epoch": 0.004618359904938758,
|
|
"grad_norm": 24.0,
|
|
"learning_rate": 9.333333333333334e-07,
|
|
"loss": 1.4559,
|
|
"mean_token_accuracy": 0.6436704084277153,
|
|
"num_tokens": 1124191.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 1.1471380971372127,
|
|
"epoch": 0.006157813206585011,
|
|
"grad_norm": 21.5,
|
|
"learning_rate": 1.2666666666666669e-06,
|
|
"loss": 1.4609,
|
|
"mean_token_accuracy": 0.642368745803833,
|
|
"num_tokens": 1488145.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 1.155402697250247,
|
|
"epoch": 0.007697266508231265,
|
|
"grad_norm": 18.25,
|
|
"learning_rate": 1.6000000000000001e-06,
|
|
"loss": 1.4329,
|
|
"mean_token_accuracy": 0.6484112951904535,
|
|
"num_tokens": 1860647.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 1.1452072311192751,
|
|
"epoch": 0.009236719809877517,
|
|
"grad_norm": 17.25,
|
|
"learning_rate": 1.9333333333333336e-06,
|
|
"loss": 1.3712,
|
|
"mean_token_accuracy": 0.6529930120334029,
|
|
"num_tokens": 2245973.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 1.123310711979866,
|
|
"epoch": 0.01077617311152377,
|
|
"grad_norm": 13.8125,
|
|
"learning_rate": 2.266666666666667e-06,
|
|
"loss": 1.3082,
|
|
"mean_token_accuracy": 0.6658382505178452,
|
|
"num_tokens": 2631053.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 1.1543800953775645,
|
|
"epoch": 0.012315626413170022,
|
|
"grad_norm": 8.75,
|
|
"learning_rate": 2.6e-06,
|
|
"loss": 1.2982,
|
|
"mean_token_accuracy": 0.6618854686617851,
|
|
"num_tokens": 2992829.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 1.1680023059248925,
|
|
"epoch": 0.013855079714816277,
|
|
"grad_norm": 6.1875,
|
|
"learning_rate": 2.9333333333333338e-06,
|
|
"loss": 1.2948,
|
|
"mean_token_accuracy": 0.6657806046307087,
|
|
"num_tokens": 3382112.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 1.147538623958826,
|
|
"epoch": 0.01539453301646253,
|
|
"grad_norm": 5.375,
|
|
"learning_rate": 3.266666666666667e-06,
|
|
"loss": 1.2509,
|
|
"mean_token_accuracy": 0.675503570586443,
|
|
"num_tokens": 3764785.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 1.107958966679871,
|
|
"epoch": 0.01693398631810878,
|
|
"grad_norm": 4.90625,
|
|
"learning_rate": 3.6000000000000003e-06,
|
|
"loss": 1.1997,
|
|
"mean_token_accuracy": 0.6811204344034195,
|
|
"num_tokens": 4126394.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 1.1157011151313783,
|
|
"epoch": 0.018473439619755033,
|
|
"grad_norm": 2.265625,
|
|
"learning_rate": 3.9333333333333335e-06,
|
|
"loss": 1.193,
|
|
"mean_token_accuracy": 0.6808499224483967,
|
|
"num_tokens": 4510149.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 1.1392802488058806,
|
|
"epoch": 0.020012892921401286,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 4.266666666666668e-06,
|
|
"loss": 1.1903,
|
|
"mean_token_accuracy": 0.6806150872260333,
|
|
"num_tokens": 4875984.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 1.1204315345734357,
|
|
"epoch": 0.02155234622304754,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 4.600000000000001e-06,
|
|
"loss": 1.1621,
|
|
"mean_token_accuracy": 0.6908985383808612,
|
|
"num_tokens": 5251973.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 1.1343737579882145,
|
|
"epoch": 0.02309179952469379,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 4.933333333333334e-06,
|
|
"loss": 1.1367,
|
|
"mean_token_accuracy": 0.6892836567014455,
|
|
"num_tokens": 5622302.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 1.138794292882085,
|
|
"epoch": 0.024631252826340044,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 5.2666666666666665e-06,
|
|
"loss": 1.1657,
|
|
"mean_token_accuracy": 0.6916824176907539,
|
|
"num_tokens": 5987467.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 1.1140711281448603,
|
|
"epoch": 0.0261707061279863,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 5.600000000000001e-06,
|
|
"loss": 1.1287,
|
|
"mean_token_accuracy": 0.6946257088333369,
|
|
"num_tokens": 6369083.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 1.1451053522527217,
|
|
"epoch": 0.027710159429632553,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 5.933333333333335e-06,
|
|
"loss": 1.1546,
|
|
"mean_token_accuracy": 0.6903918959200382,
|
|
"num_tokens": 6749350.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 1.1201870743185283,
|
|
"epoch": 0.029249612731278806,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 6.266666666666668e-06,
|
|
"loss": 1.1166,
|
|
"mean_token_accuracy": 0.6962686065584421,
|
|
"num_tokens": 7118012.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 1.149271610751748,
|
|
"epoch": 0.03078906603292506,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 6.600000000000001e-06,
|
|
"loss": 1.1534,
|
|
"mean_token_accuracy": 0.6903159897774458,
|
|
"num_tokens": 7486407.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 1.1452004179358481,
|
|
"epoch": 0.03232851933457131,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 6.9333333333333344e-06,
|
|
"loss": 1.1658,
|
|
"mean_token_accuracy": 0.6880020551383496,
|
|
"num_tokens": 7853929.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 1.133518392033875,
|
|
"epoch": 0.03386797263621756,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 7.266666666666668e-06,
|
|
"loss": 1.1477,
|
|
"mean_token_accuracy": 0.691348098218441,
|
|
"num_tokens": 8224258.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 1.1419388929381966,
|
|
"epoch": 0.035407425937863814,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 7.600000000000001e-06,
|
|
"loss": 1.1499,
|
|
"mean_token_accuracy": 0.6935681894421577,
|
|
"num_tokens": 8601374.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 1.1601579703390599,
|
|
"epoch": 0.036946879239510066,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 7.933333333333334e-06,
|
|
"loss": 1.1652,
|
|
"mean_token_accuracy": 0.6893212374299764,
|
|
"num_tokens": 8976860.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 1.1541021421551705,
|
|
"epoch": 0.03848633254115632,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 8.266666666666667e-06,
|
|
"loss": 1.1553,
|
|
"mean_token_accuracy": 0.6880058489739895,
|
|
"num_tokens": 9342172.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 1.1215011529624461,
|
|
"epoch": 0.04002578584280257,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 8.6e-06,
|
|
"loss": 1.11,
|
|
"mean_token_accuracy": 0.6971393920481205,
|
|
"num_tokens": 9711234.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 1.1288955546915531,
|
|
"epoch": 0.041565239144448825,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 8.933333333333333e-06,
|
|
"loss": 1.1331,
|
|
"mean_token_accuracy": 0.69485286436975,
|
|
"num_tokens": 10092041.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 1.1383998703211546,
|
|
"epoch": 0.04310469244609508,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 9.266666666666667e-06,
|
|
"loss": 1.1608,
|
|
"mean_token_accuracy": 0.6917846284806728,
|
|
"num_tokens": 10470367.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 1.1720476493239402,
|
|
"epoch": 0.04464414574774133,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 9.600000000000001e-06,
|
|
"loss": 1.1643,
|
|
"mean_token_accuracy": 0.6900354858487845,
|
|
"num_tokens": 10840227.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 1.1642087884247303,
|
|
"epoch": 0.04618359904938758,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 9.933333333333334e-06,
|
|
"loss": 1.1662,
|
|
"mean_token_accuracy": 0.6894872546195984,
|
|
"num_tokens": 11212704.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 1.1504485111683607,
|
|
"epoch": 0.047723052351033836,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.0266666666666668e-05,
|
|
"loss": 1.1618,
|
|
"mean_token_accuracy": 0.6902470916509629,
|
|
"num_tokens": 11585050.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 1.139546208642423,
|
|
"epoch": 0.04926250565268009,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.0600000000000002e-05,
|
|
"loss": 1.1371,
|
|
"mean_token_accuracy": 0.6940638959407807,
|
|
"num_tokens": 11955470.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 1.1310970352962613,
|
|
"epoch": 0.05080195895432634,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.0933333333333334e-05,
|
|
"loss": 1.1217,
|
|
"mean_token_accuracy": 0.697192519530654,
|
|
"num_tokens": 12326414.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 1.1263095822185278,
|
|
"epoch": 0.0523414122559726,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.1266666666666668e-05,
|
|
"loss": 1.1226,
|
|
"mean_token_accuracy": 0.695407111570239,
|
|
"num_tokens": 12699566.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 1.1608664955943824,
|
|
"epoch": 0.053880865557618854,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.16e-05,
|
|
"loss": 1.156,
|
|
"mean_token_accuracy": 0.6909525521099568,
|
|
"num_tokens": 13076955.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 1.1388528019189834,
|
|
"epoch": 0.05542031885926511,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.1933333333333335e-05,
|
|
"loss": 1.1475,
|
|
"mean_token_accuracy": 0.6935607939958572,
|
|
"num_tokens": 13457841.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 1.1540386551991104,
|
|
"epoch": 0.05695977216091136,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.2266666666666667e-05,
|
|
"loss": 1.1501,
|
|
"mean_token_accuracy": 0.690580427646637,
|
|
"num_tokens": 13823331.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 1.1634995128959418,
|
|
"epoch": 0.05849922546255761,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.2600000000000001e-05,
|
|
"loss": 1.1689,
|
|
"mean_token_accuracy": 0.6883407317101955,
|
|
"num_tokens": 14189829.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 1.1286564406007529,
|
|
"epoch": 0.060038678764203865,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.2933333333333334e-05,
|
|
"loss": 1.1091,
|
|
"mean_token_accuracy": 0.6968111153692007,
|
|
"num_tokens": 14568687.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 1.0947596225887537,
|
|
"epoch": 0.06157813206585012,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.3266666666666668e-05,
|
|
"loss": 1.0865,
|
|
"mean_token_accuracy": 0.7018399801105261,
|
|
"num_tokens": 14956883.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 1.105372793599963,
|
|
"epoch": 0.06311758536749637,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.3600000000000002e-05,
|
|
"loss": 1.098,
|
|
"mean_token_accuracy": 0.7011617802083492,
|
|
"num_tokens": 15329120.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 1.1237883031368257,
|
|
"epoch": 0.06465703866914262,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.3933333333333334e-05,
|
|
"loss": 1.1159,
|
|
"mean_token_accuracy": 0.6975264508277178,
|
|
"num_tokens": 15706521.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 1.1330916548147798,
|
|
"epoch": 0.06619649197078888,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.4266666666666668e-05,
|
|
"loss": 1.1323,
|
|
"mean_token_accuracy": 0.6972741197794676,
|
|
"num_tokens": 16066978.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 1.1772997351363301,
|
|
"epoch": 0.06773594527243512,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.46e-05,
|
|
"loss": 1.1734,
|
|
"mean_token_accuracy": 0.6860150098800659,
|
|
"num_tokens": 16449339.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 1.158057621307671,
|
|
"epoch": 0.06927539857408138,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.4933333333333335e-05,
|
|
"loss": 1.1629,
|
|
"mean_token_accuracy": 0.6880886014550924,
|
|
"num_tokens": 16831396.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 1.139371989108622,
|
|
"epoch": 0.07081485187572763,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.5266666666666667e-05,
|
|
"loss": 1.1223,
|
|
"mean_token_accuracy": 0.6936335910111666,
|
|
"num_tokens": 17210779.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 1.1907519888132811,
|
|
"epoch": 0.07235430517737389,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 1.5600000000000003e-05,
|
|
"loss": 1.187,
|
|
"mean_token_accuracy": 0.6834761939942837,
|
|
"num_tokens": 17582881.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 1.1354382883757352,
|
|
"epoch": 0.07389375847902013,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.5933333333333336e-05,
|
|
"loss": 1.1418,
|
|
"mean_token_accuracy": 0.6936424177139997,
|
|
"num_tokens": 17952831.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 1.131275094114244,
|
|
"epoch": 0.07543321178066639,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.6266666666666668e-05,
|
|
"loss": 1.1324,
|
|
"mean_token_accuracy": 0.6951741587370635,
|
|
"num_tokens": 18341435.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 1.1359387850388885,
|
|
"epoch": 0.07697266508231264,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.66e-05,
|
|
"loss": 1.1273,
|
|
"mean_token_accuracy": 0.6938830468803644,
|
|
"num_tokens": 18710959.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 1.1200769424438477,
|
|
"epoch": 0.0785121183839589,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.6933333333333336e-05,
|
|
"loss": 1.1116,
|
|
"mean_token_accuracy": 0.698444551974535,
|
|
"num_tokens": 19077026.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 1.144037862494588,
|
|
"epoch": 0.08005157168560514,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.726666666666667e-05,
|
|
"loss": 1.1399,
|
|
"mean_token_accuracy": 0.694709181971848,
|
|
"num_tokens": 19433930.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 1.1314732745289802,
|
|
"epoch": 0.0815910249872514,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.76e-05,
|
|
"loss": 1.1265,
|
|
"mean_token_accuracy": 0.6972466479986906,
|
|
"num_tokens": 19801472.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 1.1006763726472855,
|
|
"epoch": 0.08313047828889765,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.7933333333333333e-05,
|
|
"loss": 1.0907,
|
|
"mean_token_accuracy": 0.7027702957391739,
|
|
"num_tokens": 20178765.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 1.1250910840928554,
|
|
"epoch": 0.08466993159054391,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 1.826666666666667e-05,
|
|
"loss": 1.1259,
|
|
"mean_token_accuracy": 0.6969286557286978,
|
|
"num_tokens": 20540840.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 1.1310079213231803,
|
|
"epoch": 0.08620938489219016,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.86e-05,
|
|
"loss": 1.1182,
|
|
"mean_token_accuracy": 0.6943910989910365,
|
|
"num_tokens": 20917703.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 1.1366374537348747,
|
|
"epoch": 0.08774883819383641,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.8933333333333334e-05,
|
|
"loss": 1.1538,
|
|
"mean_token_accuracy": 0.692281323671341,
|
|
"num_tokens": 21286716.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 1.1471243999898433,
|
|
"epoch": 0.08928829149548266,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.926666666666667e-05,
|
|
"loss": 1.1422,
|
|
"mean_token_accuracy": 0.6914283595979214,
|
|
"num_tokens": 21672957.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 1.0941655661910772,
|
|
"epoch": 0.09082774479712892,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.9600000000000002e-05,
|
|
"loss": 1.0918,
|
|
"mean_token_accuracy": 0.703205331414938,
|
|
"num_tokens": 22057533.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 1.1071835961192846,
|
|
"epoch": 0.09236719809877517,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9933333333333334e-05,
|
|
"loss": 1.1111,
|
|
"mean_token_accuracy": 0.6998405870050192,
|
|
"num_tokens": 22435546.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 1.1055552622303366,
|
|
"epoch": 0.09390665140042143,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9999991608372392e-05,
|
|
"loss": 1.0997,
|
|
"mean_token_accuracy": 0.7011382140219211,
|
|
"num_tokens": 22797277.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 1.1513552486896514,
|
|
"epoch": 0.09544610470206767,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.9999957517409375e-05,
|
|
"loss": 1.1525,
|
|
"mean_token_accuracy": 0.6906207267194986,
|
|
"num_tokens": 23157199.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 1.1360066479071975,
|
|
"epoch": 0.09698555800371393,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.9999897202723546e-05,
|
|
"loss": 1.1269,
|
|
"mean_token_accuracy": 0.6963287502527237,
|
|
"num_tokens": 23542710.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 1.1110562330111862,
|
|
"epoch": 0.09852501130536018,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.999981066447308e-05,
|
|
"loss": 1.103,
|
|
"mean_token_accuracy": 0.700805151462555,
|
|
"num_tokens": 23929848.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 1.0776942696422338,
|
|
"epoch": 0.10006446460700644,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.999969790288491e-05,
|
|
"loss": 1.0754,
|
|
"mean_token_accuracy": 0.706406794860959,
|
|
"num_tokens": 24320781.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 1.1285138919949531,
|
|
"epoch": 0.10160391790865268,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.9999558918254746e-05,
|
|
"loss": 1.1159,
|
|
"mean_token_accuracy": 0.6957792080938816,
|
|
"num_tokens": 24718182.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 1.1143408741801977,
|
|
"epoch": 0.10314337121029894,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.999939371094705e-05,
|
|
"loss": 1.1132,
|
|
"mean_token_accuracy": 0.6973476313054562,
|
|
"num_tokens": 25078136.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 1.1544642113149166,
|
|
"epoch": 0.1046828245119452,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.9999202281395064e-05,
|
|
"loss": 1.1505,
|
|
"mean_token_accuracy": 0.6898461397737264,
|
|
"num_tokens": 25462544.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 1.110057471320033,
|
|
"epoch": 0.10622227781359145,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.999898463010079e-05,
|
|
"loss": 1.1093,
|
|
"mean_token_accuracy": 0.696648533269763,
|
|
"num_tokens": 25832507.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 1.121138433739543,
|
|
"epoch": 0.10776173111523771,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.9998740757634998e-05,
|
|
"loss": 1.1206,
|
|
"mean_token_accuracy": 0.695626575127244,
|
|
"num_tokens": 26208168.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 1.1249326327815652,
|
|
"epoch": 0.10930118441688395,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9998470664637205e-05,
|
|
"loss": 1.1066,
|
|
"mean_token_accuracy": 0.6976452205330134,
|
|
"num_tokens": 26567141.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 1.1190939696505666,
|
|
"epoch": 0.11084063771853021,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.9998174351815704e-05,
|
|
"loss": 1.109,
|
|
"mean_token_accuracy": 0.696621885150671,
|
|
"num_tokens": 26946409.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 1.097430343925953,
|
|
"epoch": 0.11238009102017646,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9997851819947537e-05,
|
|
"loss": 1.0981,
|
|
"mean_token_accuracy": 0.6984185025095939,
|
|
"num_tokens": 27323310.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 1.1255185015499591,
|
|
"epoch": 0.11391954432182272,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9997503069878515e-05,
|
|
"loss": 1.1021,
|
|
"mean_token_accuracy": 0.6977558217942714,
|
|
"num_tokens": 27728681.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 1.1182758403941988,
|
|
"epoch": 0.11545899762346896,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.9997128102523186e-05,
|
|
"loss": 1.1144,
|
|
"mean_token_accuracy": 0.6975483104586602,
|
|
"num_tokens": 28099689.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 1.0848099140450358,
|
|
"epoch": 0.11699845092511522,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.9996726918864857e-05,
|
|
"loss": 1.0807,
|
|
"mean_token_accuracy": 0.7057063952088356,
|
|
"num_tokens": 28470608.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 1.147358151897788,
|
|
"epoch": 0.11853790422676147,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.999629951995559e-05,
|
|
"loss": 1.1361,
|
|
"mean_token_accuracy": 0.6940991956740618,
|
|
"num_tokens": 28850518.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 1.158296991325915,
|
|
"epoch": 0.12007735752840773,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.999584590691619e-05,
|
|
"loss": 1.1613,
|
|
"mean_token_accuracy": 0.6874197501689195,
|
|
"num_tokens": 29223644.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 1.1296958446502685,
|
|
"epoch": 0.12161681083005398,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9995366080936206e-05,
|
|
"loss": 1.1062,
|
|
"mean_token_accuracy": 0.6964040424674749,
|
|
"num_tokens": 29597922.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 1.1090093098580838,
|
|
"epoch": 0.12315626413170024,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9994860043273915e-05,
|
|
"loss": 1.1119,
|
|
"mean_token_accuracy": 0.6979490287601948,
|
|
"num_tokens": 29967597.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 1.1302901729941368,
|
|
"epoch": 0.12469571743334648,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.999432779525635e-05,
|
|
"loss": 1.113,
|
|
"mean_token_accuracy": 0.6980737678706646,
|
|
"num_tokens": 30351751.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 1.0851911935955285,
|
|
"epoch": 0.12623517073499274,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.999376933827927e-05,
|
|
"loss": 1.0852,
|
|
"mean_token_accuracy": 0.7041132722049952,
|
|
"num_tokens": 30718524.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 1.092500716075301,
|
|
"epoch": 0.127774624036639,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.999318467380716e-05,
|
|
"loss": 1.0757,
|
|
"mean_token_accuracy": 0.7052585650235415,
|
|
"num_tokens": 31099388.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 1.1496953256428242,
|
|
"epoch": 0.12931407733828523,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9992573803373242e-05,
|
|
"loss": 1.1516,
|
|
"mean_token_accuracy": 0.6907676491886378,
|
|
"num_tokens": 31461359.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 1.1136517949402331,
|
|
"epoch": 0.1308535306399315,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.9991936728579438e-05,
|
|
"loss": 1.1098,
|
|
"mean_token_accuracy": 0.6990172352641821,
|
|
"num_tokens": 31837580.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 1.1240890389308333,
|
|
"epoch": 0.13239298394157775,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9991273451096414e-05,
|
|
"loss": 1.1144,
|
|
"mean_token_accuracy": 0.6938084073364734,
|
|
"num_tokens": 32219381.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 1.1162253782153129,
|
|
"epoch": 0.133932437243224,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.9990583972663534e-05,
|
|
"loss": 1.107,
|
|
"mean_token_accuracy": 0.6976239930838346,
|
|
"num_tokens": 32600761.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 1.1294534251093864,
|
|
"epoch": 0.13547189054487024,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 1.9989868295088876e-05,
|
|
"loss": 1.1381,
|
|
"mean_token_accuracy": 0.6945139471441507,
|
|
"num_tokens": 32967708.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 1.1337316358461975,
|
|
"epoch": 0.1370113438465165,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.998912642024922e-05,
|
|
"loss": 1.1376,
|
|
"mean_token_accuracy": 0.6949200943112374,
|
|
"num_tokens": 33348622.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 1.1307091983035207,
|
|
"epoch": 0.13855079714816276,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.9988358350090045e-05,
|
|
"loss": 1.1169,
|
|
"mean_token_accuracy": 0.6963778145611286,
|
|
"num_tokens": 33718264.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 1.1685293976217508,
|
|
"epoch": 0.14009025044980902,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.998756408662553e-05,
|
|
"loss": 1.1656,
|
|
"mean_token_accuracy": 0.6891588238999248,
|
|
"num_tokens": 34095351.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 1.1300161950290204,
|
|
"epoch": 0.14162970375145525,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9986743631938536e-05,
|
|
"loss": 1.1278,
|
|
"mean_token_accuracy": 0.6970746215432883,
|
|
"num_tokens": 34470308.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 1.1416201300919055,
|
|
"epoch": 0.14316915705310151,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9985896988180607e-05,
|
|
"loss": 1.1224,
|
|
"mean_token_accuracy": 0.6962168168276548,
|
|
"num_tokens": 34842571.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 1.1438201934099197,
|
|
"epoch": 0.14470861035474777,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.9985024157571972e-05,
|
|
"loss": 1.146,
|
|
"mean_token_accuracy": 0.6919929884374142,
|
|
"num_tokens": 35212666.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 1.1576870299875737,
|
|
"epoch": 0.14624806365639403,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.998412514240152e-05,
|
|
"loss": 1.1606,
|
|
"mean_token_accuracy": 0.692124840989709,
|
|
"num_tokens": 35593532.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 1.1232300328090787,
|
|
"epoch": 0.14778751695804027,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.9983199945026822e-05,
|
|
"loss": 1.1198,
|
|
"mean_token_accuracy": 0.6935272339731455,
|
|
"num_tokens": 35980581.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 1.1406380519270898,
|
|
"epoch": 0.14932697025968653,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9982248567874098e-05,
|
|
"loss": 1.1303,
|
|
"mean_token_accuracy": 0.6920850377529859,
|
|
"num_tokens": 36366818.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 1.1526461832225323,
|
|
"epoch": 0.15086642356133279,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.998127101343822e-05,
|
|
"loss": 1.1452,
|
|
"mean_token_accuracy": 0.6928542651236057,
|
|
"num_tokens": 36739879.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 1.127664201334119,
|
|
"epoch": 0.15240587686297905,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.9980267284282718e-05,
|
|
"loss": 1.1309,
|
|
"mean_token_accuracy": 0.6948033161461353,
|
|
"num_tokens": 37126967.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 1.1573752466589213,
|
|
"epoch": 0.15394533016462528,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.9979237383039745e-05,
|
|
"loss": 1.1486,
|
|
"mean_token_accuracy": 0.6922336863353848,
|
|
"num_tokens": 37491480.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 1.1195718679577111,
|
|
"epoch": 0.15548478346627154,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9978181312410104e-05,
|
|
"loss": 1.1097,
|
|
"mean_token_accuracy": 0.6958762314170599,
|
|
"num_tokens": 37855648.0,
|
|
"step": 505
|
|
},
|
|
{
|
|
"entropy": 1.1157226022332907,
|
|
"epoch": 0.1570242367679178,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9977099075163216e-05,
|
|
"loss": 1.1044,
|
|
"mean_token_accuracy": 0.6988037750124931,
|
|
"num_tokens": 38239757.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 1.1437922086566688,
|
|
"epoch": 0.15856369006956406,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 1.997599067413712e-05,
|
|
"loss": 1.1402,
|
|
"mean_token_accuracy": 0.6914523551240563,
|
|
"num_tokens": 38626774.0,
|
|
"step": 515
|
|
},
|
|
{
|
|
"entropy": 1.1398277616128325,
|
|
"epoch": 0.1601031433712103,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.997485611223847e-05,
|
|
"loss": 1.1292,
|
|
"mean_token_accuracy": 0.6958260778337717,
|
|
"num_tokens": 38999361.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 1.1146018091589212,
|
|
"epoch": 0.16164259667285655,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.997369539244252e-05,
|
|
"loss": 1.1124,
|
|
"mean_token_accuracy": 0.7005707703530788,
|
|
"num_tokens": 39381117.0,
|
|
"step": 525
|
|
},
|
|
{
|
|
"entropy": 1.1075803402811288,
|
|
"epoch": 0.1631820499745028,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.9972508517793125e-05,
|
|
"loss": 1.1011,
|
|
"mean_token_accuracy": 0.6986994445323944,
|
|
"num_tokens": 39748243.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 1.1309567619115115,
|
|
"epoch": 0.16472150327614907,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 1.9971295491402725e-05,
|
|
"loss": 1.1364,
|
|
"mean_token_accuracy": 0.6940356496721506,
|
|
"num_tokens": 40115293.0,
|
|
"step": 535
|
|
},
|
|
{
|
|
"entropy": 1.18396236859262,
|
|
"epoch": 0.1662609565777953,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.997005631645234e-05,
|
|
"loss": 1.1725,
|
|
"mean_token_accuracy": 0.686182476207614,
|
|
"num_tokens": 40508440.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 1.1049391619861126,
|
|
"epoch": 0.16780040987944156,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.996879099619156e-05,
|
|
"loss": 1.1144,
|
|
"mean_token_accuracy": 0.696911821886897,
|
|
"num_tokens": 40896598.0,
|
|
"step": 545
|
|
},
|
|
{
|
|
"entropy": 1.1429337464272975,
|
|
"epoch": 0.16933986318108782,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9967499533938544e-05,
|
|
"loss": 1.136,
|
|
"mean_token_accuracy": 0.6921508580446243,
|
|
"num_tokens": 41271458.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 1.1443469554185868,
|
|
"epoch": 0.17087931648273408,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.996618193308e-05,
|
|
"loss": 1.133,
|
|
"mean_token_accuracy": 0.6909565668553114,
|
|
"num_tokens": 41652091.0,
|
|
"step": 555
|
|
},
|
|
{
|
|
"entropy": 1.1591787867248058,
|
|
"epoch": 0.1724187697843803,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.9964838197071173e-05,
|
|
"loss": 1.1434,
|
|
"mean_token_accuracy": 0.6915002010762692,
|
|
"num_tokens": 42027815.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 1.1327795442193747,
|
|
"epoch": 0.17395822308602657,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 1.9963468329435872e-05,
|
|
"loss": 1.1364,
|
|
"mean_token_accuracy": 0.6924004014581442,
|
|
"num_tokens": 42390261.0,
|
|
"step": 565
|
|
},
|
|
{
|
|
"entropy": 1.1397675037384034,
|
|
"epoch": 0.17549767638767283,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.99620723337664e-05,
|
|
"loss": 1.1406,
|
|
"mean_token_accuracy": 0.6912539415061474,
|
|
"num_tokens": 42759613.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 1.107204508036375,
|
|
"epoch": 0.1770371296893191,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.9960650213723604e-05,
|
|
"loss": 1.0852,
|
|
"mean_token_accuracy": 0.6994996588677168,
|
|
"num_tokens": 43132014.0,
|
|
"step": 575
|
|
},
|
|
{
|
|
"entropy": 1.099429708532989,
|
|
"epoch": 0.17857658299096532,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.9959201973036816e-05,
|
|
"loss": 1.1041,
|
|
"mean_token_accuracy": 0.7006071075797081,
|
|
"num_tokens": 43518177.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 1.1445161992684008,
|
|
"epoch": 0.18011603629261158,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.995772761550389e-05,
|
|
"loss": 1.1382,
|
|
"mean_token_accuracy": 0.6925386656075716,
|
|
"num_tokens": 43894430.0,
|
|
"step": 585
|
|
},
|
|
{
|
|
"entropy": 1.1534817535430193,
|
|
"epoch": 0.18165548959425784,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.995622714499115e-05,
|
|
"loss": 1.1493,
|
|
"mean_token_accuracy": 0.6913147930055856,
|
|
"num_tokens": 44258015.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 1.1478193078190089,
|
|
"epoch": 0.1831949428959041,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9954700565433406e-05,
|
|
"loss": 1.1502,
|
|
"mean_token_accuracy": 0.6935486130416393,
|
|
"num_tokens": 44636368.0,
|
|
"step": 595
|
|
},
|
|
{
|
|
"entropy": 1.1420258667320013,
|
|
"epoch": 0.18473439619755033,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.9953147880833935e-05,
|
|
"loss": 1.1395,
|
|
"mean_token_accuracy": 0.693219494074583,
|
|
"num_tokens": 45009190.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 1.1204937249422073,
|
|
"epoch": 0.1862738494991966,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.9951569095264473e-05,
|
|
"loss": 1.1237,
|
|
"mean_token_accuracy": 0.6966589823365211,
|
|
"num_tokens": 45369198.0,
|
|
"step": 605
|
|
},
|
|
{
|
|
"entropy": 1.1316735215485096,
|
|
"epoch": 0.18781330280084285,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.99499642128652e-05,
|
|
"loss": 1.1151,
|
|
"mean_token_accuracy": 0.6951681729406118,
|
|
"num_tokens": 45735650.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 1.119157313928008,
|
|
"epoch": 0.1893527561024891,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.994833323784473e-05,
|
|
"loss": 1.1205,
|
|
"mean_token_accuracy": 0.6974445167928934,
|
|
"num_tokens": 46105045.0,
|
|
"step": 615
|
|
},
|
|
{
|
|
"entropy": 1.1227743715047835,
|
|
"epoch": 0.19089220940413534,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.9946676174480115e-05,
|
|
"loss": 1.1122,
|
|
"mean_token_accuracy": 0.6958862528204918,
|
|
"num_tokens": 46468345.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 1.123009406030178,
|
|
"epoch": 0.1924316627057816,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.9944993027116798e-05,
|
|
"loss": 1.1064,
|
|
"mean_token_accuracy": 0.6993745014071464,
|
|
"num_tokens": 46839653.0,
|
|
"step": 625
|
|
},
|
|
{
|
|
"entropy": 1.13520105779171,
|
|
"epoch": 0.19397111600742786,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.9943283800168643e-05,
|
|
"loss": 1.1432,
|
|
"mean_token_accuracy": 0.69097990244627,
|
|
"num_tokens": 47218180.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 1.1393942264840007,
|
|
"epoch": 0.19551056930907412,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.9941548498117894e-05,
|
|
"loss": 1.1382,
|
|
"mean_token_accuracy": 0.6938273806124926,
|
|
"num_tokens": 47595740.0,
|
|
"step": 635
|
|
},
|
|
{
|
|
"entropy": 1.1325588449835777,
|
|
"epoch": 0.19705002261072035,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9939787125515188e-05,
|
|
"loss": 1.1298,
|
|
"mean_token_accuracy": 0.6938525449484587,
|
|
"num_tokens": 47982358.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 1.121693492308259,
|
|
"epoch": 0.19858947591236661,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.993799968697951e-05,
|
|
"loss": 1.1191,
|
|
"mean_token_accuracy": 0.6956870190799236,
|
|
"num_tokens": 48372670.0,
|
|
"step": 645
|
|
},
|
|
{
|
|
"entropy": 1.1251621477305889,
|
|
"epoch": 0.20012892921401287,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.9936186187198214e-05,
|
|
"loss": 1.1236,
|
|
"mean_token_accuracy": 0.6986733213067055,
|
|
"num_tokens": 48737613.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 1.139292366988957,
|
|
"epoch": 0.20166838251565913,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9934346630926988e-05,
|
|
"loss": 1.1304,
|
|
"mean_token_accuracy": 0.6938830778002739,
|
|
"num_tokens": 49100209.0,
|
|
"step": 655
|
|
},
|
|
{
|
|
"entropy": 1.1345834810286761,
|
|
"epoch": 0.20320783581730537,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 1.9932481022989857e-05,
|
|
"loss": 1.1181,
|
|
"mean_token_accuracy": 0.6951233502477407,
|
|
"num_tokens": 49467553.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 1.094562499411404,
|
|
"epoch": 0.20474728911895163,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.993058936827916e-05,
|
|
"loss": 1.0977,
|
|
"mean_token_accuracy": 0.7043172724545002,
|
|
"num_tokens": 49849811.0,
|
|
"step": 665
|
|
},
|
|
{
|
|
"entropy": 1.139369383826852,
|
|
"epoch": 0.20628674242059789,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.992867167175554e-05,
|
|
"loss": 1.1425,
|
|
"mean_token_accuracy": 0.6948151815682649,
|
|
"num_tokens": 50225933.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 1.079656113870442,
|
|
"epoch": 0.20782619572224414,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.9926727938447935e-05,
|
|
"loss": 1.0692,
|
|
"mean_token_accuracy": 0.7051354993134737,
|
|
"num_tokens": 50610063.0,
|
|
"step": 675
|
|
},
|
|
{
|
|
"entropy": 1.1766547793522477,
|
|
"epoch": 0.2093656490238904,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9924758173453555e-05,
|
|
"loss": 1.1785,
|
|
"mean_token_accuracy": 0.6878008231520653,
|
|
"num_tokens": 50990235.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 1.0988596007227898,
|
|
"epoch": 0.21090510232553664,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 1.992276238193788e-05,
|
|
"loss": 1.0932,
|
|
"mean_token_accuracy": 0.7026484467089176,
|
|
"num_tokens": 51363981.0,
|
|
"step": 685
|
|
},
|
|
{
|
|
"entropy": 1.1409345027059317,
|
|
"epoch": 0.2124445556271829,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.992074056913464e-05,
|
|
"loss": 1.1352,
|
|
"mean_token_accuracy": 0.6939107369631529,
|
|
"num_tokens": 51737796.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 1.120890161767602,
|
|
"epoch": 0.21398400892882916,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9918692740345804e-05,
|
|
"loss": 1.1338,
|
|
"mean_token_accuracy": 0.6986452504992485,
|
|
"num_tokens": 52114356.0,
|
|
"step": 695
|
|
},
|
|
{
|
|
"entropy": 1.119481140933931,
|
|
"epoch": 0.21552346223047542,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.9916618900941567e-05,
|
|
"loss": 1.1131,
|
|
"mean_token_accuracy": 0.6989668853580951,
|
|
"num_tokens": 52484836.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 1.0964285958558322,
|
|
"epoch": 0.21706291553212165,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.991451905636033e-05,
|
|
"loss": 1.0937,
|
|
"mean_token_accuracy": 0.7034055396914483,
|
|
"num_tokens": 52859792.0,
|
|
"step": 705
|
|
},
|
|
{
|
|
"entropy": 1.1160279937088489,
|
|
"epoch": 0.2186023688337679,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.9912393212108692e-05,
|
|
"loss": 1.1109,
|
|
"mean_token_accuracy": 0.6976350143551826,
|
|
"num_tokens": 53212860.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 1.14042426943779,
|
|
"epoch": 0.22014182213541417,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.9910241373761426e-05,
|
|
"loss": 1.1385,
|
|
"mean_token_accuracy": 0.694380571320653,
|
|
"num_tokens": 53583748.0,
|
|
"step": 715
|
|
},
|
|
{
|
|
"entropy": 1.1466562129557132,
|
|
"epoch": 0.22168127543706043,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.9908063546961482e-05,
|
|
"loss": 1.1338,
|
|
"mean_token_accuracy": 0.6904741197824478,
|
|
"num_tokens": 53940694.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 1.121897478029132,
|
|
"epoch": 0.22322072873870666,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.990585973741996e-05,
|
|
"loss": 1.1211,
|
|
"mean_token_accuracy": 0.6964031044393778,
|
|
"num_tokens": 54316660.0,
|
|
"step": 725
|
|
},
|
|
{
|
|
"entropy": 1.1026945130899548,
|
|
"epoch": 0.22476018204035292,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9903629950916083e-05,
|
|
"loss": 1.0919,
|
|
"mean_token_accuracy": 0.7022646889090538,
|
|
"num_tokens": 54700093.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 1.1913654580712318,
|
|
"epoch": 0.22629963534199918,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.9901374193297212e-05,
|
|
"loss": 1.1867,
|
|
"mean_token_accuracy": 0.6831524942070246,
|
|
"num_tokens": 55072259.0,
|
|
"step": 735
|
|
},
|
|
{
|
|
"entropy": 1.0986135648563504,
|
|
"epoch": 0.22783908864364544,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.989909247047881e-05,
|
|
"loss": 1.0859,
|
|
"mean_token_accuracy": 0.70220061019063,
|
|
"num_tokens": 55431253.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 1.1104688480496407,
|
|
"epoch": 0.22937854194529167,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.989678478844443e-05,
|
|
"loss": 1.1053,
|
|
"mean_token_accuracy": 0.7009272977709771,
|
|
"num_tokens": 55806238.0,
|
|
"step": 745
|
|
},
|
|
{
|
|
"entropy": 1.1378316521644591,
|
|
"epoch": 0.23091799524693793,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 1.9894451153245695e-05,
|
|
"loss": 1.1323,
|
|
"mean_token_accuracy": 0.6941636923700572,
|
|
"num_tokens": 56167420.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 1.0988559927791357,
|
|
"epoch": 0.2324574485485842,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.9892091571002295e-05,
|
|
"loss": 1.1008,
|
|
"mean_token_accuracy": 0.7004305239766836,
|
|
"num_tokens": 56550823.0,
|
|
"step": 755
|
|
},
|
|
{
|
|
"entropy": 1.1214569361880422,
|
|
"epoch": 0.23399690185023045,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.9889706047901956e-05,
|
|
"loss": 1.1044,
|
|
"mean_token_accuracy": 0.6996850349009037,
|
|
"num_tokens": 56920052.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 1.1102859888225793,
|
|
"epoch": 0.23553635515187668,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9887294590200437e-05,
|
|
"loss": 1.11,
|
|
"mean_token_accuracy": 0.6958253476768732,
|
|
"num_tokens": 57288683.0,
|
|
"step": 765
|
|
},
|
|
{
|
|
"entropy": 1.1473000289872288,
|
|
"epoch": 0.23707580845352294,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.9884857204221503e-05,
|
|
"loss": 1.1542,
|
|
"mean_token_accuracy": 0.6928766690194607,
|
|
"num_tokens": 57645195.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 1.1104052532464266,
|
|
"epoch": 0.2386152617551692,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.9882393896356915e-05,
|
|
"loss": 1.096,
|
|
"mean_token_accuracy": 0.6981043085455895,
|
|
"num_tokens": 58010298.0,
|
|
"step": 775
|
|
},
|
|
{
|
|
"entropy": 1.1217896696180105,
|
|
"epoch": 0.24015471505681546,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.987990467306641e-05,
|
|
"loss": 1.1139,
|
|
"mean_token_accuracy": 0.6969779424369336,
|
|
"num_tokens": 58403545.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 1.1406789550557732,
|
|
"epoch": 0.2416941683584617,
|
|
"grad_norm": 0.640625,
|
|
"learning_rate": 1.9877389540877686e-05,
|
|
"loss": 1.1472,
|
|
"mean_token_accuracy": 0.6947149783372879,
|
|
"num_tokens": 58774798.0,
|
|
"step": 785
|
|
},
|
|
{
|
|
"entropy": 1.124403426796198,
|
|
"epoch": 0.24323362166010795,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9874848506386392e-05,
|
|
"loss": 1.1214,
|
|
"mean_token_accuracy": 0.6990401953458786,
|
|
"num_tokens": 59159772.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 1.0997486164793373,
|
|
"epoch": 0.2447730749617542,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9872281576256078e-05,
|
|
"loss": 1.0879,
|
|
"mean_token_accuracy": 0.7038913916796445,
|
|
"num_tokens": 59540395.0,
|
|
"step": 795
|
|
},
|
|
{
|
|
"entropy": 1.1355868607759476,
|
|
"epoch": 0.24631252826340047,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.9869688757218233e-05,
|
|
"loss": 1.1415,
|
|
"mean_token_accuracy": 0.6912806447595358,
|
|
"num_tokens": 59905249.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 1.1410336146131157,
|
|
"epoch": 0.2478519815650467,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.9867070056072215e-05,
|
|
"loss": 1.1433,
|
|
"mean_token_accuracy": 0.695595920830965,
|
|
"num_tokens": 60268255.0,
|
|
"step": 805
|
|
},
|
|
{
|
|
"entropy": 1.1349990352988244,
|
|
"epoch": 0.24939143486669296,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.986442547968527e-05,
|
|
"loss": 1.1253,
|
|
"mean_token_accuracy": 0.6944803945720196,
|
|
"num_tokens": 60639389.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 1.071821440383792,
|
|
"epoch": 0.2509308881683392,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.9861755034992483e-05,
|
|
"loss": 1.0666,
|
|
"mean_token_accuracy": 0.7084377076476812,
|
|
"num_tokens": 61024428.0,
|
|
"step": 815
|
|
},
|
|
{
|
|
"entropy": 1.1051497608423233,
|
|
"epoch": 0.2524703414699855,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.9859058728996788e-05,
|
|
"loss": 1.0965,
|
|
"mean_token_accuracy": 0.7005310852080584,
|
|
"num_tokens": 61402658.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 1.1438620645552873,
|
|
"epoch": 0.2540097947716317,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.9856336568768936e-05,
|
|
"loss": 1.1399,
|
|
"mean_token_accuracy": 0.6912882044911385,
|
|
"num_tokens": 61780493.0,
|
|
"step": 825
|
|
},
|
|
{
|
|
"entropy": 1.0913935292512178,
|
|
"epoch": 0.255549248073278,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.985358856144747e-05,
|
|
"loss": 1.0922,
|
|
"mean_token_accuracy": 0.7028463281691074,
|
|
"num_tokens": 62152861.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 1.1374814191833138,
|
|
"epoch": 0.25708870137492423,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.9850814714238718e-05,
|
|
"loss": 1.13,
|
|
"mean_token_accuracy": 0.6964493870735169,
|
|
"num_tokens": 62514124.0,
|
|
"step": 835
|
|
},
|
|
{
|
|
"entropy": 1.1332073567435146,
|
|
"epoch": 0.25862815467657047,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.9848015034416776e-05,
|
|
"loss": 1.1199,
|
|
"mean_token_accuracy": 0.6939284823834896,
|
|
"num_tokens": 62901998.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 1.1137794975191355,
|
|
"epoch": 0.26016760797821675,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 1.9845189529323473e-05,
|
|
"loss": 1.103,
|
|
"mean_token_accuracy": 0.7006840953603387,
|
|
"num_tokens": 63266839.0,
|
|
"step": 845
|
|
},
|
|
{
|
|
"entropy": 1.1099360350519418,
|
|
"epoch": 0.261707061279863,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9842338206368375e-05,
|
|
"loss": 1.0998,
|
|
"mean_token_accuracy": 0.6972894985228777,
|
|
"num_tokens": 63654737.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 1.1284802999347447,
|
|
"epoch": 0.2632465145815092,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.9839461073028733e-05,
|
|
"loss": 1.1083,
|
|
"mean_token_accuracy": 0.6968803893774748,
|
|
"num_tokens": 64032094.0,
|
|
"step": 855
|
|
},
|
|
{
|
|
"entropy": 1.0841836363077164,
|
|
"epoch": 0.2647859678831555,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.98365581368495e-05,
|
|
"loss": 1.0933,
|
|
"mean_token_accuracy": 0.7028985098004341,
|
|
"num_tokens": 64418973.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 1.1070842415094375,
|
|
"epoch": 0.26632542118480174,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9833629405443283e-05,
|
|
"loss": 1.1091,
|
|
"mean_token_accuracy": 0.7023597385734319,
|
|
"num_tokens": 64798969.0,
|
|
"step": 865
|
|
},
|
|
{
|
|
"entropy": 1.1159617979079486,
|
|
"epoch": 0.267864874486448,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.983067488649035e-05,
|
|
"loss": 1.1119,
|
|
"mean_token_accuracy": 0.6988450512290001,
|
|
"num_tokens": 65171715.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 1.1518226452171803,
|
|
"epoch": 0.26940432778809426,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.982769458773857e-05,
|
|
"loss": 1.1421,
|
|
"mean_token_accuracy": 0.6895007479935884,
|
|
"num_tokens": 65548454.0,
|
|
"step": 875
|
|
},
|
|
{
|
|
"entropy": 1.1310207761824131,
|
|
"epoch": 0.2709437810897405,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.9824688517003433e-05,
|
|
"loss": 1.1165,
|
|
"mean_token_accuracy": 0.6969778280705213,
|
|
"num_tokens": 65912713.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 1.0850966442376375,
|
|
"epoch": 0.2724832343913868,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 1.9821656682168013e-05,
|
|
"loss": 1.0868,
|
|
"mean_token_accuracy": 0.7045084740966558,
|
|
"num_tokens": 66288389.0,
|
|
"step": 885
|
|
},
|
|
{
|
|
"entropy": 1.116120758280158,
|
|
"epoch": 0.274022687693033,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.981859909118294e-05,
|
|
"loss": 1.1183,
|
|
"mean_token_accuracy": 0.6976446002721787,
|
|
"num_tokens": 66673853.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 1.1547842472791672,
|
|
"epoch": 0.27556214099467924,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.9815515752066386e-05,
|
|
"loss": 1.1512,
|
|
"mean_token_accuracy": 0.6902260981500149,
|
|
"num_tokens": 67054614.0,
|
|
"step": 895
|
|
},
|
|
{
|
|
"entropy": 1.0831589922308922,
|
|
"epoch": 0.2771015942963255,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.9812406672904058e-05,
|
|
"loss": 1.0824,
|
|
"mean_token_accuracy": 0.7042932607233524,
|
|
"num_tokens": 67422842.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 1.1236521264538168,
|
|
"epoch": 0.27864104759797176,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 1.9809271861849147e-05,
|
|
"loss": 1.1257,
|
|
"mean_token_accuracy": 0.6985704395920038,
|
|
"num_tokens": 67791499.0,
|
|
"step": 905
|
|
},
|
|
{
|
|
"entropy": 1.1213534710928799,
|
|
"epoch": 0.28018050089961805,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.9806111327122332e-05,
|
|
"loss": 1.1056,
|
|
"mean_token_accuracy": 0.6963206488639117,
|
|
"num_tokens": 68168533.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 1.0945915594696998,
|
|
"epoch": 0.2817199542012643,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9802925077011742e-05,
|
|
"loss": 1.0805,
|
|
"mean_token_accuracy": 0.7033400624990463,
|
|
"num_tokens": 68534200.0,
|
|
"step": 915
|
|
},
|
|
{
|
|
"entropy": 1.1363273495808244,
|
|
"epoch": 0.2832594075029105,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.979971311987295e-05,
|
|
"loss": 1.1331,
|
|
"mean_token_accuracy": 0.6933297269046307,
|
|
"num_tokens": 68904756.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 1.113439468294382,
|
|
"epoch": 0.2847988608045568,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 1.9796475464128943e-05,
|
|
"loss": 1.1136,
|
|
"mean_token_accuracy": 0.6984921019524336,
|
|
"num_tokens": 69279269.0,
|
|
"step": 925
|
|
},
|
|
{
|
|
"entropy": 1.106918627768755,
|
|
"epoch": 0.28633831410620303,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.979321211827009e-05,
|
|
"loss": 1.0971,
|
|
"mean_token_accuracy": 0.699981477856636,
|
|
"num_tokens": 69652060.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 1.1193274904042483,
|
|
"epoch": 0.28787776740784926,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.9789923090854138e-05,
|
|
"loss": 1.1141,
|
|
"mean_token_accuracy": 0.6945442810654641,
|
|
"num_tokens": 70031530.0,
|
|
"step": 935
|
|
},
|
|
{
|
|
"entropy": 1.1201645512133838,
|
|
"epoch": 0.28941722070949555,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.9786608390506176e-05,
|
|
"loss": 1.1248,
|
|
"mean_token_accuracy": 0.6959635071456433,
|
|
"num_tokens": 70405759.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 1.158202064409852,
|
|
"epoch": 0.2909566740111418,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.9783268025918622e-05,
|
|
"loss": 1.1405,
|
|
"mean_token_accuracy": 0.6916137792170047,
|
|
"num_tokens": 70773411.0,
|
|
"step": 945
|
|
},
|
|
{
|
|
"entropy": 1.1136011434718966,
|
|
"epoch": 0.29249612731278807,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9779902005851187e-05,
|
|
"loss": 1.1032,
|
|
"mean_token_accuracy": 0.6998088311403989,
|
|
"num_tokens": 71138724.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 1.1528440322726965,
|
|
"epoch": 0.2940355806144343,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9776510339130874e-05,
|
|
"loss": 1.1432,
|
|
"mean_token_accuracy": 0.6916706405580044,
|
|
"num_tokens": 71522642.0,
|
|
"step": 955
|
|
},
|
|
{
|
|
"entropy": 1.1416105089709163,
|
|
"epoch": 0.29557503391608053,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9773093034651928e-05,
|
|
"loss": 1.1315,
|
|
"mean_token_accuracy": 0.6934664513915777,
|
|
"num_tokens": 71885197.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 1.1288053080439568,
|
|
"epoch": 0.2971144872177268,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9769650101375835e-05,
|
|
"loss": 1.1253,
|
|
"mean_token_accuracy": 0.6961982771754265,
|
|
"num_tokens": 72262607.0,
|
|
"step": 965
|
|
},
|
|
{
|
|
"entropy": 1.1250951839610934,
|
|
"epoch": 0.29865394051937305,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.9766181548331283e-05,
|
|
"loss": 1.1186,
|
|
"mean_token_accuracy": 0.6970525443553924,
|
|
"num_tokens": 72653402.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 1.1368791069835424,
|
|
"epoch": 0.3001933938210193,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 1.9762687384614152e-05,
|
|
"loss": 1.132,
|
|
"mean_token_accuracy": 0.6947309102863073,
|
|
"num_tokens": 73049063.0,
|
|
"step": 975
|
|
},
|
|
{
|
|
"entropy": 1.083188571408391,
|
|
"epoch": 0.30173284712266557,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.9759167619387474e-05,
|
|
"loss": 1.0838,
|
|
"mean_token_accuracy": 0.7051486879587173,
|
|
"num_tokens": 73435640.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 1.1301437310874463,
|
|
"epoch": 0.3032723004243118,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.975562226188143e-05,
|
|
"loss": 1.1135,
|
|
"mean_token_accuracy": 0.6951402083039284,
|
|
"num_tokens": 73804251.0,
|
|
"step": 985
|
|
},
|
|
{
|
|
"entropy": 1.1021712820976972,
|
|
"epoch": 0.3048117537259581,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.97520513213933e-05,
|
|
"loss": 1.1047,
|
|
"mean_token_accuracy": 0.6995002727955579,
|
|
"num_tokens": 74186734.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 1.1268383231014014,
|
|
"epoch": 0.3063512070276043,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 1.9748454807287458e-05,
|
|
"loss": 1.1197,
|
|
"mean_token_accuracy": 0.6963075909763574,
|
|
"num_tokens": 74564695.0,
|
|
"step": 995
|
|
},
|
|
{
|
|
"entropy": 1.1207784935832024,
|
|
"epoch": 0.30789066032925055,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.974483272899535e-05,
|
|
"loss": 1.1225,
|
|
"mean_token_accuracy": 0.6975628361105919,
|
|
"num_tokens": 74954009.0,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"entropy": 1.1320615615695715,
|
|
"epoch": 0.30943011363089684,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.974118509601545e-05,
|
|
"loss": 1.1245,
|
|
"mean_token_accuracy": 0.6957272073253989,
|
|
"num_tokens": 75329081.0,
|
|
"step": 1005
|
|
},
|
|
{
|
|
"entropy": 1.0997402749955654,
|
|
"epoch": 0.3109695669325431,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.973751191791325e-05,
|
|
"loss": 1.0889,
|
|
"mean_token_accuracy": 0.7017048012465239,
|
|
"num_tokens": 75696214.0,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"entropy": 1.0914274197071792,
|
|
"epoch": 0.31250902023418936,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 1.9733813204321233e-05,
|
|
"loss": 1.0761,
|
|
"mean_token_accuracy": 0.7037324849516153,
|
|
"num_tokens": 76068328.0,
|
|
"step": 1015
|
|
},
|
|
{
|
|
"entropy": 1.1191833563148976,
|
|
"epoch": 0.3140484735358356,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.9730088964938842e-05,
|
|
"loss": 1.1121,
|
|
"mean_token_accuracy": 0.6989397961646319,
|
|
"num_tokens": 76441289.0,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"entropy": 1.1179291112348437,
|
|
"epoch": 0.3155879268374818,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9726339209532462e-05,
|
|
"loss": 1.0951,
|
|
"mean_token_accuracy": 0.7015183545649052,
|
|
"num_tokens": 76814090.0,
|
|
"step": 1025
|
|
},
|
|
{
|
|
"entropy": 1.1256714541465045,
|
|
"epoch": 0.3171273801391281,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.972256394793539e-05,
|
|
"loss": 1.1131,
|
|
"mean_token_accuracy": 0.6952388241887093,
|
|
"num_tokens": 77179591.0,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"entropy": 1.136961457133293,
|
|
"epoch": 0.31866683344077434,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.971876319004781e-05,
|
|
"loss": 1.1182,
|
|
"mean_token_accuracy": 0.6935086127370595,
|
|
"num_tokens": 77550799.0,
|
|
"step": 1035
|
|
},
|
|
{
|
|
"entropy": 1.1292035300284624,
|
|
"epoch": 0.3202062867424206,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.9714936945836764e-05,
|
|
"loss": 1.1177,
|
|
"mean_token_accuracy": 0.6930017314851284,
|
|
"num_tokens": 77920454.0,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"entropy": 1.0919932153075933,
|
|
"epoch": 0.32174574004406686,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.971108522533613e-05,
|
|
"loss": 1.078,
|
|
"mean_token_accuracy": 0.7059255817905068,
|
|
"num_tokens": 78285931.0,
|
|
"step": 1045
|
|
},
|
|
{
|
|
"entropy": 1.116225427389145,
|
|
"epoch": 0.3232851933457131,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.9707208038646605e-05,
|
|
"loss": 1.1197,
|
|
"mean_token_accuracy": 0.6983599919825793,
|
|
"num_tokens": 78657492.0,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"entropy": 1.1196499440819025,
|
|
"epoch": 0.3248246466473594,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.970330539593565e-05,
|
|
"loss": 1.1043,
|
|
"mean_token_accuracy": 0.6965556625276804,
|
|
"num_tokens": 79026794.0,
|
|
"step": 1055
|
|
},
|
|
{
|
|
"entropy": 1.1315435644239187,
|
|
"epoch": 0.3263640999490056,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.969937730743749e-05,
|
|
"loss": 1.1248,
|
|
"mean_token_accuracy": 0.696228601038456,
|
|
"num_tokens": 79400596.0,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"entropy": 1.0820589877665043,
|
|
"epoch": 0.32790355325065185,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.9695423783453086e-05,
|
|
"loss": 1.0836,
|
|
"mean_token_accuracy": 0.705596823990345,
|
|
"num_tokens": 79767657.0,
|
|
"step": 1065
|
|
},
|
|
{
|
|
"entropy": 1.1282978903502225,
|
|
"epoch": 0.32944300655229813,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.969144483435009e-05,
|
|
"loss": 1.1241,
|
|
"mean_token_accuracy": 0.6953945115208626,
|
|
"num_tokens": 80144261.0,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"entropy": 1.1406402667984366,
|
|
"epoch": 0.33098245985394437,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.968744047056283e-05,
|
|
"loss": 1.1297,
|
|
"mean_token_accuracy": 0.6934267330914736,
|
|
"num_tokens": 80525193.0,
|
|
"step": 1075
|
|
},
|
|
{
|
|
"entropy": 1.1295597156509758,
|
|
"epoch": 0.3325219131555906,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.9683410702592284e-05,
|
|
"loss": 1.1203,
|
|
"mean_token_accuracy": 0.6963451337069273,
|
|
"num_tokens": 80905579.0,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"entropy": 1.1091342974454164,
|
|
"epoch": 0.3340613664572369,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.9679355541006056e-05,
|
|
"loss": 1.1029,
|
|
"mean_token_accuracy": 0.6987722083926201,
|
|
"num_tokens": 81285902.0,
|
|
"step": 1085
|
|
},
|
|
{
|
|
"entropy": 1.1366256965324282,
|
|
"epoch": 0.3356008197588831,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 1.9675274996438324e-05,
|
|
"loss": 1.1364,
|
|
"mean_token_accuracy": 0.6947485759854317,
|
|
"num_tokens": 81653385.0,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"entropy": 1.1193459507077932,
|
|
"epoch": 0.3371402730605294,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.967116907958985e-05,
|
|
"loss": 1.1022,
|
|
"mean_token_accuracy": 0.7003271400928497,
|
|
"num_tokens": 82021575.0,
|
|
"step": 1095
|
|
},
|
|
{
|
|
"entropy": 1.1462248302996159,
|
|
"epoch": 0.33867972636217564,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9667037801227914e-05,
|
|
"loss": 1.1351,
|
|
"mean_token_accuracy": 0.6924805622547865,
|
|
"num_tokens": 82399380.0,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"entropy": 1.107696833834052,
|
|
"epoch": 0.34021917966382187,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9662881172186313e-05,
|
|
"loss": 1.1058,
|
|
"mean_token_accuracy": 0.7026475485414266,
|
|
"num_tokens": 82771918.0,
|
|
"step": 1105
|
|
},
|
|
{
|
|
"entropy": 1.1295810148119927,
|
|
"epoch": 0.34175863296546816,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.965869920336533e-05,
|
|
"loss": 1.1236,
|
|
"mean_token_accuracy": 0.6973136257380247,
|
|
"num_tokens": 83137444.0,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"entropy": 1.1330510720610618,
|
|
"epoch": 0.3432980862671144,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 1.965449190573168e-05,
|
|
"loss": 1.1317,
|
|
"mean_token_accuracy": 0.6966150533407927,
|
|
"num_tokens": 83500864.0,
|
|
"step": 1115
|
|
},
|
|
{
|
|
"entropy": 1.1691056948155165,
|
|
"epoch": 0.3448375395687606,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.965025929031852e-05,
|
|
"loss": 1.1643,
|
|
"mean_token_accuracy": 0.6873539566993714,
|
|
"num_tokens": 83868277.0,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"entropy": 1.0945931367576123,
|
|
"epoch": 0.3463769928704069,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 1.9646001368225382e-05,
|
|
"loss": 1.1016,
|
|
"mean_token_accuracy": 0.7012989364564419,
|
|
"num_tokens": 84252198.0,
|
|
"step": 1125
|
|
},
|
|
{
|
|
"entropy": 1.165550697594881,
|
|
"epoch": 0.34791644617205314,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.9641718150618177e-05,
|
|
"loss": 1.1467,
|
|
"mean_token_accuracy": 0.6915617097169161,
|
|
"num_tokens": 84617359.0,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"entropy": 1.1262395735830069,
|
|
"epoch": 0.3494558994736994,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.9637409648729142e-05,
|
|
"loss": 1.1208,
|
|
"mean_token_accuracy": 0.6933946672827005,
|
|
"num_tokens": 85000015.0,
|
|
"step": 1135
|
|
},
|
|
{
|
|
"entropy": 1.129942279495299,
|
|
"epoch": 0.35099535277534566,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.963307587385682e-05,
|
|
"loss": 1.1206,
|
|
"mean_token_accuracy": 0.6961002223193645,
|
|
"num_tokens": 85384245.0,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"entropy": 1.1344817027449607,
|
|
"epoch": 0.3525348060769919,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.962871683736603e-05,
|
|
"loss": 1.1255,
|
|
"mean_token_accuracy": 0.6936954416334629,
|
|
"num_tokens": 85754567.0,
|
|
"step": 1145
|
|
},
|
|
{
|
|
"entropy": 1.1344742052257062,
|
|
"epoch": 0.3540742593786382,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.9624332550687834e-05,
|
|
"loss": 1.1209,
|
|
"mean_token_accuracy": 0.695965689048171,
|
|
"num_tokens": 86130538.0,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"entropy": 1.1286322576925159,
|
|
"epoch": 0.3556137126802844,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.961992302531952e-05,
|
|
"loss": 1.1213,
|
|
"mean_token_accuracy": 0.6975085325539112,
|
|
"num_tokens": 86505523.0,
|
|
"step": 1155
|
|
},
|
|
{
|
|
"entropy": 1.161212246119976,
|
|
"epoch": 0.35715316598193064,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.961548827282455e-05,
|
|
"loss": 1.1607,
|
|
"mean_token_accuracy": 0.6912364710122347,
|
|
"num_tokens": 86889854.0,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"entropy": 1.1156503956764936,
|
|
"epoch": 0.35869261928357693,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9611028304832547e-05,
|
|
"loss": 1.1063,
|
|
"mean_token_accuracy": 0.697390603646636,
|
|
"num_tokens": 87275027.0,
|
|
"step": 1165
|
|
},
|
|
{
|
|
"entropy": 1.117064966261387,
|
|
"epoch": 0.36023207258522316,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.9606543133039254e-05,
|
|
"loss": 1.1028,
|
|
"mean_token_accuracy": 0.70021205060184,
|
|
"num_tokens": 87649310.0,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"entropy": 1.1142473477870225,
|
|
"epoch": 0.36177152588686945,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.9602032769206517e-05,
|
|
"loss": 1.1113,
|
|
"mean_token_accuracy": 0.6982534524053335,
|
|
"num_tokens": 88021284.0,
|
|
"step": 1175
|
|
},
|
|
{
|
|
"entropy": 1.1146583622321486,
|
|
"epoch": 0.3633109791885157,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.9597497225162233e-05,
|
|
"loss": 1.1098,
|
|
"mean_token_accuracy": 0.6998208686709404,
|
|
"num_tokens": 88397256.0,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"entropy": 1.1496895281597972,
|
|
"epoch": 0.3648504324901619,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.959293651280034e-05,
|
|
"loss": 1.1573,
|
|
"mean_token_accuracy": 0.6919562425464392,
|
|
"num_tokens": 88763426.0,
|
|
"step": 1185
|
|
},
|
|
{
|
|
"entropy": 1.1269241459667683,
|
|
"epoch": 0.3663898857918082,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.9588350644080777e-05,
|
|
"loss": 1.1105,
|
|
"mean_token_accuracy": 0.6988791462033987,
|
|
"num_tokens": 89118435.0,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"entropy": 1.0833050038665533,
|
|
"epoch": 0.36792933909345443,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.9583739631029446e-05,
|
|
"loss": 1.0802,
|
|
"mean_token_accuracy": 0.7041361082345248,
|
|
"num_tokens": 89508601.0,
|
|
"step": 1195
|
|
},
|
|
{
|
|
"entropy": 1.1451345276087523,
|
|
"epoch": 0.36946879239510066,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.957910348573819e-05,
|
|
"loss": 1.1369,
|
|
"mean_token_accuracy": 0.6917477056384087,
|
|
"num_tokens": 89893267.0,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"entropy": 1.0983753545209765,
|
|
"epoch": 0.37100824569674695,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.9574442220364768e-05,
|
|
"loss": 1.0951,
|
|
"mean_token_accuracy": 0.7006513494998217,
|
|
"num_tokens": 90284037.0,
|
|
"step": 1205
|
|
},
|
|
{
|
|
"entropy": 1.116368711926043,
|
|
"epoch": 0.3725476989983932,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.9569755847132796e-05,
|
|
"loss": 1.1144,
|
|
"mean_token_accuracy": 0.6977820225059986,
|
|
"num_tokens": 90670311.0,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"entropy": 1.094654480740428,
|
|
"epoch": 0.37408715230003947,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.9565044378331745e-05,
|
|
"loss": 1.0829,
|
|
"mean_token_accuracy": 0.7023903023451566,
|
|
"num_tokens": 91055385.0,
|
|
"step": 1215
|
|
},
|
|
{
|
|
"entropy": 1.115629038028419,
|
|
"epoch": 0.3756266056016857,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.9560307826316892e-05,
|
|
"loss": 1.1184,
|
|
"mean_token_accuracy": 0.6971225813031197,
|
|
"num_tokens": 91424223.0,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"entropy": 1.1635486509650945,
|
|
"epoch": 0.37716605890333194,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.9555546203509297e-05,
|
|
"loss": 1.1615,
|
|
"mean_token_accuracy": 0.6906606066972018,
|
|
"num_tokens": 91796012.0,
|
|
"step": 1225
|
|
},
|
|
{
|
|
"entropy": 1.120249069854617,
|
|
"epoch": 0.3787055122049782,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9550759522395753e-05,
|
|
"loss": 1.1022,
|
|
"mean_token_accuracy": 0.6964717313647271,
|
|
"num_tokens": 92162375.0,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"entropy": 1.1134164540097118,
|
|
"epoch": 0.38024496550662445,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.9545947795528777e-05,
|
|
"loss": 1.1205,
|
|
"mean_token_accuracy": 0.6987472154200077,
|
|
"num_tokens": 92545936.0,
|
|
"step": 1235
|
|
},
|
|
{
|
|
"entropy": 1.086888193897903,
|
|
"epoch": 0.3817844188082707,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9541111035526563e-05,
|
|
"loss": 1.0868,
|
|
"mean_token_accuracy": 0.7030756056308747,
|
|
"num_tokens": 92928503.0,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"entropy": 1.1007358327507972,
|
|
"epoch": 0.383323872109917,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.953624925507295e-05,
|
|
"loss": 1.0914,
|
|
"mean_token_accuracy": 0.7022611912339926,
|
|
"num_tokens": 93313261.0,
|
|
"step": 1245
|
|
},
|
|
{
|
|
"entropy": 1.135701997205615,
|
|
"epoch": 0.3848633254115632,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.9531362466917388e-05,
|
|
"loss": 1.1208,
|
|
"mean_token_accuracy": 0.6953465500846505,
|
|
"num_tokens": 93694867.0,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"entropy": 1.141565052047372,
|
|
"epoch": 0.3864027787132095,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.952645068387491e-05,
|
|
"loss": 1.1328,
|
|
"mean_token_accuracy": 0.69326724819839,
|
|
"num_tokens": 94082631.0,
|
|
"step": 1255
|
|
},
|
|
{
|
|
"entropy": 1.1221220299601555,
|
|
"epoch": 0.3879422320148557,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.95215139188261e-05,
|
|
"loss": 1.1079,
|
|
"mean_token_accuracy": 0.6988440815359354,
|
|
"num_tokens": 94457533.0,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"entropy": 1.1194452840834856,
|
|
"epoch": 0.38948168531650196,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.9516552184717036e-05,
|
|
"loss": 1.1215,
|
|
"mean_token_accuracy": 0.696359645575285,
|
|
"num_tokens": 94829571.0,
|
|
"step": 1265
|
|
},
|
|
{
|
|
"entropy": 1.095098103582859,
|
|
"epoch": 0.39102113861814825,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.9511565494559298e-05,
|
|
"loss": 1.0958,
|
|
"mean_token_accuracy": 0.7043366067111492,
|
|
"num_tokens": 95200118.0,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"entropy": 1.1012009687721729,
|
|
"epoch": 0.3925605919197945,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.95065538614299e-05,
|
|
"loss": 1.0911,
|
|
"mean_token_accuracy": 0.7037279218435287,
|
|
"num_tokens": 95570272.0,
|
|
"step": 1275
|
|
},
|
|
{
|
|
"entropy": 1.1257656961679459,
|
|
"epoch": 0.3941000452214407,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 1.950151729847126e-05,
|
|
"loss": 1.1224,
|
|
"mean_token_accuracy": 0.6986918987706303,
|
|
"num_tokens": 95942085.0,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"entropy": 1.1478566963225603,
|
|
"epoch": 0.395639498523087,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.949645581889118e-05,
|
|
"loss": 1.1455,
|
|
"mean_token_accuracy": 0.6915257848799229,
|
|
"num_tokens": 96317314.0,
|
|
"step": 1285
|
|
},
|
|
{
|
|
"entropy": 1.1262834113091231,
|
|
"epoch": 0.39717895182473323,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.9491369435962802e-05,
|
|
"loss": 1.1219,
|
|
"mean_token_accuracy": 0.6945701058954,
|
|
"num_tokens": 96698109.0,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"entropy": 1.0999675188213587,
|
|
"epoch": 0.3987184051263795,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.9486258163024567e-05,
|
|
"loss": 1.0967,
|
|
"mean_token_accuracy": 0.7008256938308477,
|
|
"num_tokens": 97074251.0,
|
|
"step": 1295
|
|
},
|
|
{
|
|
"entropy": 1.127872526086867,
|
|
"epoch": 0.40025785842802575,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.94811220134802e-05,
|
|
"loss": 1.1225,
|
|
"mean_token_accuracy": 0.6996113903820514,
|
|
"num_tokens": 97446524.0,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"entropy": 1.1096723936498165,
|
|
"epoch": 0.401797311729672,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.9475961000798645e-05,
|
|
"loss": 1.1048,
|
|
"mean_token_accuracy": 0.6985050681978464,
|
|
"num_tokens": 97831999.0,
|
|
"step": 1305
|
|
},
|
|
{
|
|
"entropy": 1.1193984607234597,
|
|
"epoch": 0.40333676503131827,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.9470775138514063e-05,
|
|
"loss": 1.111,
|
|
"mean_token_accuracy": 0.6988893166184426,
|
|
"num_tokens": 98203695.0,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"entropy": 1.1497751019895077,
|
|
"epoch": 0.4048762183329645,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9465564440225768e-05,
|
|
"loss": 1.1275,
|
|
"mean_token_accuracy": 0.6922019004821778,
|
|
"num_tokens": 98579150.0,
|
|
"step": 1315
|
|
},
|
|
{
|
|
"entropy": 1.146084163337946,
|
|
"epoch": 0.40641567163461073,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.9460328919598216e-05,
|
|
"loss": 1.1382,
|
|
"mean_token_accuracy": 0.6955520674586296,
|
|
"num_tokens": 98943956.0,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"entropy": 1.1438047185540199,
|
|
"epoch": 0.407955124936257,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.9455068590360943e-05,
|
|
"loss": 1.1408,
|
|
"mean_token_accuracy": 0.6917512208223343,
|
|
"num_tokens": 99326339.0,
|
|
"step": 1325
|
|
},
|
|
{
|
|
"entropy": 1.1105543179437518,
|
|
"epoch": 0.40949457823790325,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.9449783466308553e-05,
|
|
"loss": 1.1093,
|
|
"mean_token_accuracy": 0.6983879100531339,
|
|
"num_tokens": 99693304.0,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"entropy": 1.1154874304309488,
|
|
"epoch": 0.41103403153954954,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 1.9444473561300666e-05,
|
|
"loss": 1.1124,
|
|
"mean_token_accuracy": 0.6970164556056261,
|
|
"num_tokens": 100076953.0,
|
|
"step": 1335
|
|
},
|
|
{
|
|
"entropy": 1.1657130055129528,
|
|
"epoch": 0.41257348484119577,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.943913888926189e-05,
|
|
"loss": 1.1697,
|
|
"mean_token_accuracy": 0.6894268091768027,
|
|
"num_tokens": 100447813.0,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"entropy": 1.0991169594228267,
|
|
"epoch": 0.414112938142842,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.943377946418178e-05,
|
|
"loss": 1.0923,
|
|
"mean_token_accuracy": 0.7011879209429026,
|
|
"num_tokens": 100835066.0,
|
|
"step": 1345
|
|
},
|
|
{
|
|
"entropy": 1.0682245310395957,
|
|
"epoch": 0.4156523914444883,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 1.9428395300114803e-05,
|
|
"loss": 1.0678,
|
|
"mean_token_accuracy": 0.709788928553462,
|
|
"num_tokens": 101195353.0,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"entropy": 1.1283558243885636,
|
|
"epoch": 0.4171918447461345,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 1.94229864111803e-05,
|
|
"loss": 1.1191,
|
|
"mean_token_accuracy": 0.6948264576494694,
|
|
"num_tokens": 101571638.0,
|
|
"step": 1355
|
|
},
|
|
{
|
|
"entropy": 1.114413278736174,
|
|
"epoch": 0.4187312980477808,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.9417552811562457e-05,
|
|
"loss": 1.1174,
|
|
"mean_token_accuracy": 0.6991838045418263,
|
|
"num_tokens": 101941042.0,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"entropy": 1.1175668630748987,
|
|
"epoch": 0.42027075134942704,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.941209451551025e-05,
|
|
"loss": 1.1069,
|
|
"mean_token_accuracy": 0.6971942469477653,
|
|
"num_tokens": 102314017.0,
|
|
"step": 1365
|
|
},
|
|
{
|
|
"entropy": 1.0761339336633682,
|
|
"epoch": 0.4218102046510733,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.9406611537337425e-05,
|
|
"loss": 1.0622,
|
|
"mean_token_accuracy": 0.7066352400928736,
|
|
"num_tokens": 102691186.0,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"entropy": 1.127281517535448,
|
|
"epoch": 0.42334965795271956,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 1.9401103891422455e-05,
|
|
"loss": 1.1202,
|
|
"mean_token_accuracy": 0.6942048665136099,
|
|
"num_tokens": 103071698.0,
|
|
"step": 1375
|
|
},
|
|
{
|
|
"entropy": 1.086047711968422,
|
|
"epoch": 0.4248891112543658,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.93955715922085e-05,
|
|
"loss": 1.0819,
|
|
"mean_token_accuracy": 0.7019645646214485,
|
|
"num_tokens": 103457908.0,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"entropy": 1.1055951166898013,
|
|
"epoch": 0.426428564556012,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.939001465420337e-05,
|
|
"loss": 1.1062,
|
|
"mean_token_accuracy": 0.6994627211242914,
|
|
"num_tokens": 103836470.0,
|
|
"step": 1385
|
|
},
|
|
{
|
|
"entropy": 1.1144292425364255,
|
|
"epoch": 0.4279680178576583,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.938443309197948e-05,
|
|
"loss": 1.1048,
|
|
"mean_token_accuracy": 0.6957655198872089,
|
|
"num_tokens": 104216895.0,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"entropy": 1.1153745524585248,
|
|
"epoch": 0.42950747115930454,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9378826920173835e-05,
|
|
"loss": 1.1234,
|
|
"mean_token_accuracy": 0.6969841800630092,
|
|
"num_tokens": 104601319.0,
|
|
"step": 1395
|
|
},
|
|
{
|
|
"entropy": 1.1316595112904906,
|
|
"epoch": 0.43104692446095083,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.9373196153487962e-05,
|
|
"loss": 1.129,
|
|
"mean_token_accuracy": 0.6969845864921809,
|
|
"num_tokens": 104967171.0,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"entropy": 1.1544791884720325,
|
|
"epoch": 0.43258637776259706,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9367540806687894e-05,
|
|
"loss": 1.15,
|
|
"mean_token_accuracy": 0.6929264325648546,
|
|
"num_tokens": 105333438.0,
|
|
"step": 1405
|
|
},
|
|
{
|
|
"entropy": 1.1271388109773397,
|
|
"epoch": 0.4341258310642433,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 1.9361860894604116e-05,
|
|
"loss": 1.1161,
|
|
"mean_token_accuracy": 0.6955098442733287,
|
|
"num_tokens": 105691785.0,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"entropy": 1.1479596089571715,
|
|
"epoch": 0.4356652843658896,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.9356156432131533e-05,
|
|
"loss": 1.1482,
|
|
"mean_token_accuracy": 0.6920965306460858,
|
|
"num_tokens": 106078624.0,
|
|
"step": 1415
|
|
},
|
|
{
|
|
"entropy": 1.1149195641279221,
|
|
"epoch": 0.4372047376675358,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.935042743422944e-05,
|
|
"loss": 1.1028,
|
|
"mean_token_accuracy": 0.6970803182572126,
|
|
"num_tokens": 106454246.0,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"entropy": 1.0929339196532966,
|
|
"epoch": 0.43874419096918205,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.934467391592146e-05,
|
|
"loss": 1.1047,
|
|
"mean_token_accuracy": 0.7016421973705291,
|
|
"num_tokens": 106810481.0,
|
|
"step": 1425
|
|
},
|
|
{
|
|
"entropy": 1.0979965701699257,
|
|
"epoch": 0.44028364427082833,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.9338895892295527e-05,
|
|
"loss": 1.0956,
|
|
"mean_token_accuracy": 0.7029366530478001,
|
|
"num_tokens": 107196667.0,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"entropy": 1.1433403573930263,
|
|
"epoch": 0.44182309757247457,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 1.9333093378503832e-05,
|
|
"loss": 1.1375,
|
|
"mean_token_accuracy": 0.6927531309425831,
|
|
"num_tokens": 107575900.0,
|
|
"step": 1435
|
|
},
|
|
{
|
|
"entropy": 1.1472560165449976,
|
|
"epoch": 0.44336255087412085,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.9327266389762787e-05,
|
|
"loss": 1.1371,
|
|
"mean_token_accuracy": 0.6947022203356028,
|
|
"num_tokens": 107944294.0,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"entropy": 1.101127756945789,
|
|
"epoch": 0.4449020041757671,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.9321414941353006e-05,
|
|
"loss": 1.0928,
|
|
"mean_token_accuracy": 0.7010299023240805,
|
|
"num_tokens": 108312798.0,
|
|
"step": 1445
|
|
},
|
|
{
|
|
"entropy": 1.1180545002222062,
|
|
"epoch": 0.4464414574774133,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9315539048619212e-05,
|
|
"loss": 1.1234,
|
|
"mean_token_accuracy": 0.6960787653923035,
|
|
"num_tokens": 108690533.0,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"entropy": 1.1227679682895542,
|
|
"epoch": 0.4479809107790596,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.930963872697026e-05,
|
|
"loss": 1.1046,
|
|
"mean_token_accuracy": 0.6982706602662802,
|
|
"num_tokens": 109068398.0,
|
|
"step": 1455
|
|
},
|
|
{
|
|
"entropy": 1.107317195646465,
|
|
"epoch": 0.44952036408070584,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.9303713991879052e-05,
|
|
"loss": 1.1001,
|
|
"mean_token_accuracy": 0.6980501331388951,
|
|
"num_tokens": 109446077.0,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"entropy": 1.1386326614767313,
|
|
"epoch": 0.45105981738235207,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.9297764858882516e-05,
|
|
"loss": 1.1239,
|
|
"mean_token_accuracy": 0.6934384491294623,
|
|
"num_tokens": 109826830.0,
|
|
"step": 1465
|
|
},
|
|
{
|
|
"entropy": 1.1245597016066313,
|
|
"epoch": 0.45259927068399836,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.9291791343581557e-05,
|
|
"loss": 1.1149,
|
|
"mean_token_accuracy": 0.6970586907118559,
|
|
"num_tokens": 110206021.0,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"entropy": 1.112450549006462,
|
|
"epoch": 0.4541387239856446,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.928579346164103e-05,
|
|
"loss": 1.1129,
|
|
"mean_token_accuracy": 0.6991185300052166,
|
|
"num_tokens": 110575825.0,
|
|
"step": 1475
|
|
},
|
|
{
|
|
"entropy": 1.1001921689137817,
|
|
"epoch": 0.4556781772872909,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.927977122878967e-05,
|
|
"loss": 1.1028,
|
|
"mean_token_accuracy": 0.7005803253501653,
|
|
"num_tokens": 110933606.0,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"entropy": 1.136134173721075,
|
|
"epoch": 0.4572176305889371,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.9273724660820086e-05,
|
|
"loss": 1.1169,
|
|
"mean_token_accuracy": 0.6969247065484524,
|
|
"num_tokens": 111297173.0,
|
|
"step": 1485
|
|
},
|
|
{
|
|
"entropy": 1.1197788801044226,
|
|
"epoch": 0.45875708389058334,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 1.9267653773588702e-05,
|
|
"loss": 1.1111,
|
|
"mean_token_accuracy": 0.6978486493229866,
|
|
"num_tokens": 111679485.0,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"entropy": 1.1003839764744043,
|
|
"epoch": 0.4602965371922296,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 1.926155858301571e-05,
|
|
"loss": 1.0893,
|
|
"mean_token_accuracy": 0.7018561966717243,
|
|
"num_tokens": 112067380.0,
|
|
"step": 1495
|
|
},
|
|
{
|
|
"entropy": 1.0989170737564564,
|
|
"epoch": 0.46183599049387586,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.925543910508503e-05,
|
|
"loss": 1.1127,
|
|
"mean_token_accuracy": 0.699932586029172,
|
|
"num_tokens": 112448405.0,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"entropy": 1.0723091229796409,
|
|
"epoch": 0.4633754437955221,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 1.9249295355844286e-05,
|
|
"loss": 1.058,
|
|
"mean_token_accuracy": 0.7080515351146459,
|
|
"num_tokens": 112821434.0,
|
|
"step": 1505
|
|
},
|
|
{
|
|
"entropy": 1.1173736985772849,
|
|
"epoch": 0.4649148970971684,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.9243127351404743e-05,
|
|
"loss": 1.1042,
|
|
"mean_token_accuracy": 0.6990774724632501,
|
|
"num_tokens": 113207766.0,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"entropy": 1.136980064958334,
|
|
"epoch": 0.4664543503988146,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.9236935107941272e-05,
|
|
"loss": 1.1307,
|
|
"mean_token_accuracy": 0.6950142856687307,
|
|
"num_tokens": 113564658.0,
|
|
"step": 1515
|
|
},
|
|
{
|
|
"entropy": 1.1760700676590203,
|
|
"epoch": 0.4679938037004609,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 1.923071864169231e-05,
|
|
"loss": 1.1714,
|
|
"mean_token_accuracy": 0.6890874560922384,
|
|
"num_tokens": 113935260.0,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"entropy": 1.1633779585361481,
|
|
"epoch": 0.46953325700210713,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.922447796895982e-05,
|
|
"loss": 1.1552,
|
|
"mean_token_accuracy": 0.6897667136043311,
|
|
"num_tokens": 114300528.0,
|
|
"step": 1525
|
|
},
|
|
{
|
|
"entropy": 1.096606163494289,
|
|
"epoch": 0.47107271030375336,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.9218213106109234e-05,
|
|
"loss": 1.0923,
|
|
"mean_token_accuracy": 0.7029213454574347,
|
|
"num_tokens": 114670533.0,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"entropy": 1.0995285920798779,
|
|
"epoch": 0.47261216360539965,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9211924069569422e-05,
|
|
"loss": 1.1045,
|
|
"mean_token_accuracy": 0.7023968610912561,
|
|
"num_tokens": 115033065.0,
|
|
"step": 1535
|
|
},
|
|
{
|
|
"entropy": 1.1373300217092037,
|
|
"epoch": 0.4741516169070459,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.920561087583265e-05,
|
|
"loss": 1.1375,
|
|
"mean_token_accuracy": 0.6914490062743426,
|
|
"num_tokens": 115395504.0,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"entropy": 1.1257287595421075,
|
|
"epoch": 0.4756910702086921,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.919927354145454e-05,
|
|
"loss": 1.1123,
|
|
"mean_token_accuracy": 0.6976802740246058,
|
|
"num_tokens": 115768072.0,
|
|
"step": 1545
|
|
},
|
|
{
|
|
"entropy": 1.1214987369254232,
|
|
"epoch": 0.4772305235103384,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.9192912083054003e-05,
|
|
"loss": 1.1191,
|
|
"mean_token_accuracy": 0.6951532650738954,
|
|
"num_tokens": 116143853.0,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"entropy": 1.1636530596762895,
|
|
"epoch": 0.47876997681198463,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.9186526517313227e-05,
|
|
"loss": 1.1578,
|
|
"mean_token_accuracy": 0.6905960509553551,
|
|
"num_tokens": 116501275.0,
|
|
"step": 1555
|
|
},
|
|
{
|
|
"entropy": 1.1044294204562903,
|
|
"epoch": 0.4803094301136309,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.9180116860977613e-05,
|
|
"loss": 1.0837,
|
|
"mean_token_accuracy": 0.703742691129446,
|
|
"num_tokens": 116885903.0,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"entropy": 1.1139429537579417,
|
|
"epoch": 0.48184888341527715,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.9173683130855737e-05,
|
|
"loss": 1.104,
|
|
"mean_token_accuracy": 0.6986370030790567,
|
|
"num_tokens": 117262674.0,
|
|
"step": 1565
|
|
},
|
|
{
|
|
"entropy": 1.0733769409358502,
|
|
"epoch": 0.4833883367169234,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.916722534381931e-05,
|
|
"loss": 1.0699,
|
|
"mean_token_accuracy": 0.7072780448943377,
|
|
"num_tokens": 117633261.0,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"entropy": 1.0940893176943063,
|
|
"epoch": 0.48492779001856967,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.916074351680312e-05,
|
|
"loss": 1.0899,
|
|
"mean_token_accuracy": 0.7040331065654755,
|
|
"num_tokens": 117994519.0,
|
|
"step": 1575
|
|
},
|
|
{
|
|
"entropy": 1.1256133463233708,
|
|
"epoch": 0.4864672433202159,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9154237666805005e-05,
|
|
"loss": 1.1178,
|
|
"mean_token_accuracy": 0.6980132691562175,
|
|
"num_tokens": 118357854.0,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"entropy": 1.1461247742176055,
|
|
"epoch": 0.48800669662186213,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.9147707810885798e-05,
|
|
"loss": 1.1273,
|
|
"mean_token_accuracy": 0.6937376245856285,
|
|
"num_tokens": 118727990.0,
|
|
"step": 1585
|
|
},
|
|
{
|
|
"entropy": 1.105697209574282,
|
|
"epoch": 0.4895461499235084,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 1.9141153966169287e-05,
|
|
"loss": 1.0988,
|
|
"mean_token_accuracy": 0.6974029045552015,
|
|
"num_tokens": 119104452.0,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"entropy": 1.0973486991599202,
|
|
"epoch": 0.49108560322515465,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.9134576149842164e-05,
|
|
"loss": 1.0897,
|
|
"mean_token_accuracy": 0.7024951457977295,
|
|
"num_tokens": 119492541.0,
|
|
"step": 1595
|
|
},
|
|
{
|
|
"entropy": 1.1395431403070688,
|
|
"epoch": 0.49262505652680094,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.9127974379153983e-05,
|
|
"loss": 1.1284,
|
|
"mean_token_accuracy": 0.6936916135251522,
|
|
"num_tokens": 119861950.0,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"entropy": 1.119615512341261,
|
|
"epoch": 0.4941645098284472,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.912134867141712e-05,
|
|
"loss": 1.1297,
|
|
"mean_token_accuracy": 0.6973624024540186,
|
|
"num_tokens": 120235402.0,
|
|
"step": 1605
|
|
},
|
|
{
|
|
"entropy": 1.127389458194375,
|
|
"epoch": 0.4957039631300934,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.9114699044006725e-05,
|
|
"loss": 1.1246,
|
|
"mean_token_accuracy": 0.6948788855224848,
|
|
"num_tokens": 120616115.0,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"entropy": 1.1248438712209463,
|
|
"epoch": 0.4972434164317397,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.910802551436066e-05,
|
|
"loss": 1.1298,
|
|
"mean_token_accuracy": 0.6980609927326441,
|
|
"num_tokens": 120995993.0,
|
|
"step": 1615
|
|
},
|
|
{
|
|
"entropy": 1.0943362485617398,
|
|
"epoch": 0.4987828697333859,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.9101328099979496e-05,
|
|
"loss": 1.0998,
|
|
"mean_token_accuracy": 0.7005326244980097,
|
|
"num_tokens": 121357538.0,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"entropy": 1.158146957680583,
|
|
"epoch": 0.5003223230350322,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.9094606818426403e-05,
|
|
"loss": 1.1539,
|
|
"mean_token_accuracy": 0.6923132240772247,
|
|
"num_tokens": 121710013.0,
|
|
"step": 1625
|
|
},
|
|
{
|
|
"entropy": 1.1276648858562113,
|
|
"epoch": 0.5018617763366784,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.908786168732717e-05,
|
|
"loss": 1.1182,
|
|
"mean_token_accuracy": 0.6962565090507269,
|
|
"num_tokens": 122085828.0,
|
|
"step": 1630
|
|
},
|
|
{
|
|
"entropy": 1.0802762266248465,
|
|
"epoch": 0.5034012296383247,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.9081092724370112e-05,
|
|
"loss": 1.0793,
|
|
"mean_token_accuracy": 0.7047099947929383,
|
|
"num_tokens": 122464366.0,
|
|
"step": 1635
|
|
},
|
|
{
|
|
"entropy": 1.136762074381113,
|
|
"epoch": 0.504940682939971,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.907429994730605e-05,
|
|
"loss": 1.1273,
|
|
"mean_token_accuracy": 0.6950546491891145,
|
|
"num_tokens": 122835610.0,
|
|
"step": 1640
|
|
},
|
|
{
|
|
"entropy": 1.0965771291404962,
|
|
"epoch": 0.5064801362416171,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.9067483373948245e-05,
|
|
"loss": 1.0801,
|
|
"mean_token_accuracy": 0.7031420111656189,
|
|
"num_tokens": 123198090.0,
|
|
"step": 1645
|
|
},
|
|
{
|
|
"entropy": 1.1391410026699305,
|
|
"epoch": 0.5080195895432634,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.9060643022172364e-05,
|
|
"loss": 1.138,
|
|
"mean_token_accuracy": 0.6941679731011391,
|
|
"num_tokens": 123574849.0,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"entropy": 1.1137908024713397,
|
|
"epoch": 0.5095590428449097,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 1.905377890991644e-05,
|
|
"loss": 1.1011,
|
|
"mean_token_accuracy": 0.7002455405890942,
|
|
"num_tokens": 123958243.0,
|
|
"step": 1655
|
|
},
|
|
{
|
|
"entropy": 1.0767975924536586,
|
|
"epoch": 0.511098496146556,
|
|
"grad_norm": 0.65625,
|
|
"learning_rate": 1.90468910551808e-05,
|
|
"loss": 1.0628,
|
|
"mean_token_accuracy": 0.7064414627850055,
|
|
"num_tokens": 124354285.0,
|
|
"step": 1660
|
|
},
|
|
{
|
|
"entropy": 1.1056279137730598,
|
|
"epoch": 0.5126379494482022,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.9039979476028044e-05,
|
|
"loss": 1.1108,
|
|
"mean_token_accuracy": 0.7005944430828095,
|
|
"num_tokens": 124716477.0,
|
|
"step": 1665
|
|
},
|
|
{
|
|
"entropy": 1.121751406788826,
|
|
"epoch": 0.5141774027498485,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 1.903304419058298e-05,
|
|
"loss": 1.1054,
|
|
"mean_token_accuracy": 0.6988046038895845,
|
|
"num_tokens": 125084153.0,
|
|
"step": 1670
|
|
},
|
|
{
|
|
"entropy": 1.1113942619413137,
|
|
"epoch": 0.5157168560514948,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.9026085217032592e-05,
|
|
"loss": 1.1038,
|
|
"mean_token_accuracy": 0.6969317603856325,
|
|
"num_tokens": 125454921.0,
|
|
"step": 1675
|
|
},
|
|
{
|
|
"entropy": 1.1110334230586887,
|
|
"epoch": 0.5172563093531409,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 1.9019102573625966e-05,
|
|
"loss": 1.112,
|
|
"mean_token_accuracy": 0.6979748774319887,
|
|
"num_tokens": 125814552.0,
|
|
"step": 1680
|
|
},
|
|
{
|
|
"entropy": 1.115121967718005,
|
|
"epoch": 0.5187957626547872,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.9012096278674283e-05,
|
|
"loss": 1.1022,
|
|
"mean_token_accuracy": 0.6978176638484002,
|
|
"num_tokens": 126180100.0,
|
|
"step": 1685
|
|
},
|
|
{
|
|
"entropy": 1.1214980090036988,
|
|
"epoch": 0.5203352159564335,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.9005066350550724e-05,
|
|
"loss": 1.1107,
|
|
"mean_token_accuracy": 0.6994861856102943,
|
|
"num_tokens": 126544212.0,
|
|
"step": 1690
|
|
},
|
|
{
|
|
"entropy": 1.1030220981687306,
|
|
"epoch": 0.5218746692580797,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.899801280769046e-05,
|
|
"loss": 1.1027,
|
|
"mean_token_accuracy": 0.7016896925866604,
|
|
"num_tokens": 126936632.0,
|
|
"step": 1695
|
|
},
|
|
{
|
|
"entropy": 1.0752276331186295,
|
|
"epoch": 0.523414122559726,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.8990935668590583e-05,
|
|
"loss": 1.0732,
|
|
"mean_token_accuracy": 0.706041594222188,
|
|
"num_tokens": 127334816.0,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"entropy": 1.137972903251648,
|
|
"epoch": 0.5249535758613723,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.8983834951810068e-05,
|
|
"loss": 1.1276,
|
|
"mean_token_accuracy": 0.6936356756836176,
|
|
"num_tokens": 127710399.0,
|
|
"step": 1705
|
|
},
|
|
{
|
|
"entropy": 1.1167596075683832,
|
|
"epoch": 0.5264930291630184,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 1.8976710675969715e-05,
|
|
"loss": 1.1118,
|
|
"mean_token_accuracy": 0.6976578302681447,
|
|
"num_tokens": 128099437.0,
|
|
"step": 1710
|
|
},
|
|
{
|
|
"entropy": 1.0992528446018697,
|
|
"epoch": 0.5280324824646647,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.896956285975211e-05,
|
|
"loss": 1.0875,
|
|
"mean_token_accuracy": 0.7028979767113924,
|
|
"num_tokens": 128467478.0,
|
|
"step": 1715
|
|
},
|
|
{
|
|
"entropy": 1.0609646894037723,
|
|
"epoch": 0.529571935766311,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.8962391521901565e-05,
|
|
"loss": 1.0554,
|
|
"mean_token_accuracy": 0.7095225866883993,
|
|
"num_tokens": 128838188.0,
|
|
"step": 1720
|
|
},
|
|
{
|
|
"entropy": 1.1092106204479932,
|
|
"epoch": 0.5311113890679573,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.895519668122408e-05,
|
|
"loss": 1.0967,
|
|
"mean_token_accuracy": 0.6991548746824264,
|
|
"num_tokens": 129214099.0,
|
|
"step": 1725
|
|
},
|
|
{
|
|
"entropy": 1.0980365563184022,
|
|
"epoch": 0.5326508423696035,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.8947978356587283e-05,
|
|
"loss": 1.0886,
|
|
"mean_token_accuracy": 0.702478701993823,
|
|
"num_tokens": 129593189.0,
|
|
"step": 1730
|
|
},
|
|
{
|
|
"entropy": 1.1081396404653787,
|
|
"epoch": 0.5341902956712498,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.8940736566920386e-05,
|
|
"loss": 1.0974,
|
|
"mean_token_accuracy": 0.7000274512916803,
|
|
"num_tokens": 129972696.0,
|
|
"step": 1735
|
|
},
|
|
{
|
|
"entropy": 1.0982466185465456,
|
|
"epoch": 0.535729748972896,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.893347133121415e-05,
|
|
"loss": 1.0822,
|
|
"mean_token_accuracy": 0.7039383064955473,
|
|
"num_tokens": 130350766.0,
|
|
"step": 1740
|
|
},
|
|
{
|
|
"entropy": 1.1378747086971999,
|
|
"epoch": 0.5372692022745422,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.8926182668520794e-05,
|
|
"loss": 1.1298,
|
|
"mean_token_accuracy": 0.6929653998464346,
|
|
"num_tokens": 130712736.0,
|
|
"step": 1745
|
|
},
|
|
{
|
|
"entropy": 1.1180994376540183,
|
|
"epoch": 0.5388086555761885,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 1.8918870597953996e-05,
|
|
"loss": 1.1166,
|
|
"mean_token_accuracy": 0.697513160482049,
|
|
"num_tokens": 131108827.0,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"entropy": 1.1118130307644605,
|
|
"epoch": 0.5403481088778348,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.89115351386888e-05,
|
|
"loss": 1.1135,
|
|
"mean_token_accuracy": 0.7016211155802011,
|
|
"num_tokens": 131484362.0,
|
|
"step": 1755
|
|
},
|
|
{
|
|
"entropy": 1.154317499510944,
|
|
"epoch": 0.541887562179481,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.8904176309961606e-05,
|
|
"loss": 1.1623,
|
|
"mean_token_accuracy": 0.6900074496865273,
|
|
"num_tokens": 131854979.0,
|
|
"step": 1760
|
|
},
|
|
{
|
|
"entropy": 1.1418317448347808,
|
|
"epoch": 0.5434270154811273,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.8896794131070073e-05,
|
|
"loss": 1.1409,
|
|
"mean_token_accuracy": 0.6961004845798016,
|
|
"num_tokens": 132231075.0,
|
|
"step": 1765
|
|
},
|
|
{
|
|
"entropy": 1.1063750840723514,
|
|
"epoch": 0.5449664687827735,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.8889388621373107e-05,
|
|
"loss": 1.094,
|
|
"mean_token_accuracy": 0.6988186117261648,
|
|
"num_tokens": 132614827.0,
|
|
"step": 1770
|
|
},
|
|
{
|
|
"entropy": 1.0908017337322236,
|
|
"epoch": 0.5465059220844197,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.88819598002908e-05,
|
|
"loss": 1.0762,
|
|
"mean_token_accuracy": 0.7036438055336476,
|
|
"num_tokens": 133006606.0,
|
|
"step": 1775
|
|
},
|
|
{
|
|
"entropy": 1.1063918098807335,
|
|
"epoch": 0.548045375386066,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.887450768730436e-05,
|
|
"loss": 1.0865,
|
|
"mean_token_accuracy": 0.7016949482262135,
|
|
"num_tokens": 133391329.0,
|
|
"step": 1780
|
|
},
|
|
{
|
|
"entropy": 1.111767608858645,
|
|
"epoch": 0.5495848286877123,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.886703230195609e-05,
|
|
"loss": 1.1104,
|
|
"mean_token_accuracy": 0.7000030245631933,
|
|
"num_tokens": 133783664.0,
|
|
"step": 1785
|
|
},
|
|
{
|
|
"entropy": 1.1513528198003768,
|
|
"epoch": 0.5511242819893585,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.8859533663849318e-05,
|
|
"loss": 1.1441,
|
|
"mean_token_accuracy": 0.6949969541281462,
|
|
"num_tokens": 134154971.0,
|
|
"step": 1790
|
|
},
|
|
{
|
|
"entropy": 1.109261892735958,
|
|
"epoch": 0.5526637352910048,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.885201179264834e-05,
|
|
"loss": 1.1072,
|
|
"mean_token_accuracy": 0.7005063198506832,
|
|
"num_tokens": 134541521.0,
|
|
"step": 1795
|
|
},
|
|
{
|
|
"entropy": 1.1210583060979844,
|
|
"epoch": 0.554203188592651,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.8844466708078398e-05,
|
|
"loss": 1.1179,
|
|
"mean_token_accuracy": 0.6973602317273617,
|
|
"num_tokens": 134909569.0,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"entropy": 1.1100708212703467,
|
|
"epoch": 0.5557426418942973,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.8836898429925586e-05,
|
|
"loss": 1.09,
|
|
"mean_token_accuracy": 0.7016674302518368,
|
|
"num_tokens": 135278194.0,
|
|
"step": 1805
|
|
},
|
|
{
|
|
"entropy": 1.133229278959334,
|
|
"epoch": 0.5572820951959435,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.8829306978036837e-05,
|
|
"loss": 1.1279,
|
|
"mean_token_accuracy": 0.6966449148952961,
|
|
"num_tokens": 135644126.0,
|
|
"step": 1810
|
|
},
|
|
{
|
|
"entropy": 1.094052490964532,
|
|
"epoch": 0.5588215484975898,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.8821692372319852e-05,
|
|
"loss": 1.0881,
|
|
"mean_token_accuracy": 0.7018960192799568,
|
|
"num_tokens": 136040093.0,
|
|
"step": 1815
|
|
},
|
|
{
|
|
"entropy": 1.102319024130702,
|
|
"epoch": 0.5603610017992361,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.8814054632743038e-05,
|
|
"loss": 1.1009,
|
|
"mean_token_accuracy": 0.7015113096684218,
|
|
"num_tokens": 136421328.0,
|
|
"step": 1820
|
|
},
|
|
{
|
|
"entropy": 1.1264159340411424,
|
|
"epoch": 0.5619004551008823,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.8806393779335483e-05,
|
|
"loss": 1.1106,
|
|
"mean_token_accuracy": 0.6967556666582823,
|
|
"num_tokens": 136796837.0,
|
|
"step": 1825
|
|
},
|
|
{
|
|
"entropy": 1.1152265276759863,
|
|
"epoch": 0.5634399084025286,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.879870983218688e-05,
|
|
"loss": 1.0994,
|
|
"mean_token_accuracy": 0.6976462483406067,
|
|
"num_tokens": 137174396.0,
|
|
"step": 1830
|
|
},
|
|
{
|
|
"entropy": 1.116674688272178,
|
|
"epoch": 0.5649793617041748,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.8791002811447483e-05,
|
|
"loss": 1.1104,
|
|
"mean_token_accuracy": 0.7000731214880943,
|
|
"num_tokens": 137556532.0,
|
|
"step": 1835
|
|
},
|
|
{
|
|
"entropy": 1.1110275972634553,
|
|
"epoch": 0.566518815005821,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.878327273732806e-05,
|
|
"loss": 1.1098,
|
|
"mean_token_accuracy": 0.698979677259922,
|
|
"num_tokens": 137949242.0,
|
|
"step": 1840
|
|
},
|
|
{
|
|
"entropy": 1.0584419948980213,
|
|
"epoch": 0.5680582683074673,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.8775519630099822e-05,
|
|
"loss": 1.0544,
|
|
"mean_token_accuracy": 0.7107167650014162,
|
|
"num_tokens": 138325463.0,
|
|
"step": 1845
|
|
},
|
|
{
|
|
"entropy": 1.120271611586213,
|
|
"epoch": 0.5695977216091136,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.8767743510094395e-05,
|
|
"loss": 1.1202,
|
|
"mean_token_accuracy": 0.6949244394898415,
|
|
"num_tokens": 138692189.0,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"entropy": 1.1016495576128364,
|
|
"epoch": 0.5711371749107598,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.8759944397703748e-05,
|
|
"loss": 1.1078,
|
|
"mean_token_accuracy": 0.7005269210785627,
|
|
"num_tokens": 139066457.0,
|
|
"step": 1855
|
|
},
|
|
{
|
|
"entropy": 1.1251827346161007,
|
|
"epoch": 0.5726766282124061,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.8752122313380137e-05,
|
|
"loss": 1.1007,
|
|
"mean_token_accuracy": 0.6988253463059664,
|
|
"num_tokens": 139426172.0,
|
|
"step": 1860
|
|
},
|
|
{
|
|
"entropy": 1.1180114712566138,
|
|
"epoch": 0.5742160815140523,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.874427727763607e-05,
|
|
"loss": 1.1112,
|
|
"mean_token_accuracy": 0.69961117208004,
|
|
"num_tokens": 139801332.0,
|
|
"step": 1865
|
|
},
|
|
{
|
|
"entropy": 1.129542938247323,
|
|
"epoch": 0.5757555348156985,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.8736409311044244e-05,
|
|
"loss": 1.1289,
|
|
"mean_token_accuracy": 0.695055254548788,
|
|
"num_tokens": 140171056.0,
|
|
"step": 1870
|
|
},
|
|
{
|
|
"entropy": 1.0734907962381839,
|
|
"epoch": 0.5772949881173448,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.8728518434237476e-05,
|
|
"loss": 1.0626,
|
|
"mean_token_accuracy": 0.7072399683296681,
|
|
"num_tokens": 140566923.0,
|
|
"step": 1875
|
|
},
|
|
{
|
|
"entropy": 1.1328235883265734,
|
|
"epoch": 0.5788344414189911,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.8720604667908673e-05,
|
|
"loss": 1.1338,
|
|
"mean_token_accuracy": 0.6954614106565714,
|
|
"num_tokens": 140929032.0,
|
|
"step": 1880
|
|
},
|
|
{
|
|
"entropy": 1.1626869395375252,
|
|
"epoch": 0.5803738947206374,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.8712668032810767e-05,
|
|
"loss": 1.153,
|
|
"mean_token_accuracy": 0.6904126744717359,
|
|
"num_tokens": 141306794.0,
|
|
"step": 1885
|
|
},
|
|
{
|
|
"entropy": 1.0925796177238225,
|
|
"epoch": 0.5819133480222836,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.8704708549756657e-05,
|
|
"loss": 1.0896,
|
|
"mean_token_accuracy": 0.7039735574275255,
|
|
"num_tokens": 141679922.0,
|
|
"step": 1890
|
|
},
|
|
{
|
|
"entropy": 1.1325601134449244,
|
|
"epoch": 0.5834528013239298,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.869672623961916e-05,
|
|
"loss": 1.1236,
|
|
"mean_token_accuracy": 0.695359307155013,
|
|
"num_tokens": 142064042.0,
|
|
"step": 1895
|
|
},
|
|
{
|
|
"entropy": 1.1089297072961926,
|
|
"epoch": 0.5849922546255761,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.8688721123330952e-05,
|
|
"loss": 1.0961,
|
|
"mean_token_accuracy": 0.7020201427862048,
|
|
"num_tokens": 142450974.0,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"entropy": 1.0782432477921247,
|
|
"epoch": 0.5865317079272223,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.868069322188452e-05,
|
|
"loss": 1.077,
|
|
"mean_token_accuracy": 0.7056647684425116,
|
|
"num_tokens": 142833583.0,
|
|
"step": 1905
|
|
},
|
|
{
|
|
"entropy": 1.090103941783309,
|
|
"epoch": 0.5880711612288686,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 1.8672642556332093e-05,
|
|
"loss": 1.0815,
|
|
"mean_token_accuracy": 0.7041718065738678,
|
|
"num_tokens": 143202881.0,
|
|
"step": 1910
|
|
},
|
|
{
|
|
"entropy": 1.1132526526227593,
|
|
"epoch": 0.5896106145305149,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.8664569147785615e-05,
|
|
"loss": 1.1143,
|
|
"mean_token_accuracy": 0.7002504725009203,
|
|
"num_tokens": 143575381.0,
|
|
"step": 1915
|
|
},
|
|
{
|
|
"entropy": 1.0923281263560056,
|
|
"epoch": 0.5911500678321611,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.8656473017416644e-05,
|
|
"loss": 1.0894,
|
|
"mean_token_accuracy": 0.7025896862149239,
|
|
"num_tokens": 143945584.0,
|
|
"step": 1920
|
|
},
|
|
{
|
|
"entropy": 1.1606475939974188,
|
|
"epoch": 0.5926895211338074,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.864835418645635e-05,
|
|
"loss": 1.1518,
|
|
"mean_token_accuracy": 0.69000857565552,
|
|
"num_tokens": 144327615.0,
|
|
"step": 1925
|
|
},
|
|
{
|
|
"entropy": 1.076964562945068,
|
|
"epoch": 0.5942289744354536,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.8640212676195415e-05,
|
|
"loss": 1.0674,
|
|
"mean_token_accuracy": 0.705032504722476,
|
|
"num_tokens": 144702165.0,
|
|
"step": 1930
|
|
},
|
|
{
|
|
"entropy": 1.1039565896615386,
|
|
"epoch": 0.5957684277370998,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.8632048507984e-05,
|
|
"loss": 1.0888,
|
|
"mean_token_accuracy": 0.7024720892310142,
|
|
"num_tokens": 145076417.0,
|
|
"step": 1935
|
|
},
|
|
{
|
|
"entropy": 1.093964084982872,
|
|
"epoch": 0.5973078810387461,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.862386170323169e-05,
|
|
"loss": 1.081,
|
|
"mean_token_accuracy": 0.7047437366098166,
|
|
"num_tokens": 145455366.0,
|
|
"step": 1940
|
|
},
|
|
{
|
|
"entropy": 1.1448205880820752,
|
|
"epoch": 0.5988473343403924,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.861565228340742e-05,
|
|
"loss": 1.1458,
|
|
"mean_token_accuracy": 0.6915356520563364,
|
|
"num_tokens": 145838812.0,
|
|
"step": 1945
|
|
},
|
|
{
|
|
"entropy": 1.1012870259582996,
|
|
"epoch": 0.6003867876420386,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.860742027003944e-05,
|
|
"loss": 1.0907,
|
|
"mean_token_accuracy": 0.7037778791040182,
|
|
"num_tokens": 146208431.0,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"entropy": 1.1052306432276964,
|
|
"epoch": 0.6019262409436849,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.8599165684715238e-05,
|
|
"loss": 1.0995,
|
|
"mean_token_accuracy": 0.7021346285939216,
|
|
"num_tokens": 146587958.0,
|
|
"step": 1955
|
|
},
|
|
{
|
|
"entropy": 1.0908923922106624,
|
|
"epoch": 0.6034656942453311,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.8590888549081514e-05,
|
|
"loss": 1.0687,
|
|
"mean_token_accuracy": 0.7040816470980644,
|
|
"num_tokens": 146956196.0,
|
|
"step": 1960
|
|
},
|
|
{
|
|
"entropy": 1.1141000390052795,
|
|
"epoch": 0.6050051475469774,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.8582588884844086e-05,
|
|
"loss": 1.1103,
|
|
"mean_token_accuracy": 0.6970112754032016,
|
|
"num_tokens": 147320054.0,
|
|
"step": 1965
|
|
},
|
|
{
|
|
"entropy": 1.0900843566283585,
|
|
"epoch": 0.6065446008486236,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.857426671376785e-05,
|
|
"loss": 1.0764,
|
|
"mean_token_accuracy": 0.7049407433718443,
|
|
"num_tokens": 147703735.0,
|
|
"step": 1970
|
|
},
|
|
{
|
|
"entropy": 1.1240591725334526,
|
|
"epoch": 0.6080840541502699,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.8565922057676738e-05,
|
|
"loss": 1.1196,
|
|
"mean_token_accuracy": 0.6968345880508423,
|
|
"num_tokens": 148073305.0,
|
|
"step": 1975
|
|
},
|
|
{
|
|
"entropy": 1.1471635062247514,
|
|
"epoch": 0.6096235074519162,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.855755493845363e-05,
|
|
"loss": 1.1427,
|
|
"mean_token_accuracy": 0.6943592650815844,
|
|
"num_tokens": 148444038.0,
|
|
"step": 1980
|
|
},
|
|
{
|
|
"entropy": 1.132018794864416,
|
|
"epoch": 0.6111629607535624,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.8549165378040328e-05,
|
|
"loss": 1.1394,
|
|
"mean_token_accuracy": 0.6943659249693155,
|
|
"num_tokens": 148822233.0,
|
|
"step": 1985
|
|
},
|
|
{
|
|
"entropy": 1.0830021239817142,
|
|
"epoch": 0.6127024140552086,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.8540753398437473e-05,
|
|
"loss": 1.0754,
|
|
"mean_token_accuracy": 0.7037800218909979,
|
|
"num_tokens": 149211582.0,
|
|
"step": 1990
|
|
},
|
|
{
|
|
"entropy": 1.1431629927828908,
|
|
"epoch": 0.6142418673568549,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.8532319021704502e-05,
|
|
"loss": 1.1372,
|
|
"mean_token_accuracy": 0.6933602422475815,
|
|
"num_tokens": 149586556.0,
|
|
"step": 1995
|
|
},
|
|
{
|
|
"entropy": 1.1282612700015306,
|
|
"epoch": 0.6157813206585011,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 1.852386226995958e-05,
|
|
"loss": 1.1324,
|
|
"mean_token_accuracy": 0.6929793257266283,
|
|
"num_tokens": 149951555.0,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"entropy": 1.133526834100485,
|
|
"epoch": 0.6173207739601474,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.851538316537956e-05,
|
|
"loss": 1.1148,
|
|
"mean_token_accuracy": 0.6985038254410029,
|
|
"num_tokens": 150316391.0,
|
|
"step": 2005
|
|
},
|
|
{
|
|
"entropy": 1.0895660797134041,
|
|
"epoch": 0.6188602272617937,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.85068817301999e-05,
|
|
"loss": 1.0834,
|
|
"mean_token_accuracy": 0.7006191689521074,
|
|
"num_tokens": 150688099.0,
|
|
"step": 2010
|
|
},
|
|
{
|
|
"entropy": 1.1398447638377547,
|
|
"epoch": 0.6203996805634399,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 1.8498357986714624e-05,
|
|
"loss": 1.1352,
|
|
"mean_token_accuracy": 0.6944937206804752,
|
|
"num_tokens": 151052692.0,
|
|
"step": 2015
|
|
},
|
|
{
|
|
"entropy": 1.15070056989789,
|
|
"epoch": 0.6219391338650861,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.8489811957276254e-05,
|
|
"loss": 1.1302,
|
|
"mean_token_accuracy": 0.6918449435383082,
|
|
"num_tokens": 151430576.0,
|
|
"step": 2020
|
|
},
|
|
{
|
|
"entropy": 1.1349072763696313,
|
|
"epoch": 0.6234785871667324,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.848124366429576e-05,
|
|
"loss": 1.124,
|
|
"mean_token_accuracy": 0.6965412970632314,
|
|
"num_tokens": 151792787.0,
|
|
"step": 2025
|
|
},
|
|
{
|
|
"entropy": 1.1112722108140587,
|
|
"epoch": 0.6250180404683787,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.8472653130242485e-05,
|
|
"loss": 1.112,
|
|
"mean_token_accuracy": 0.7012020844966174,
|
|
"num_tokens": 152168683.0,
|
|
"step": 2030
|
|
},
|
|
{
|
|
"entropy": 1.1380321444943546,
|
|
"epoch": 0.6265574937700249,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.846404037764411e-05,
|
|
"loss": 1.1238,
|
|
"mean_token_accuracy": 0.6950769029557705,
|
|
"num_tokens": 152545104.0,
|
|
"step": 2035
|
|
},
|
|
{
|
|
"entropy": 1.1669288910925388,
|
|
"epoch": 0.6280969470716712,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.8455405429086576e-05,
|
|
"loss": 1.1662,
|
|
"mean_token_accuracy": 0.6907285895198584,
|
|
"num_tokens": 152918857.0,
|
|
"step": 2040
|
|
},
|
|
{
|
|
"entropy": 1.144454488158226,
|
|
"epoch": 0.6296364003733175,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.844674830721402e-05,
|
|
"loss": 1.1435,
|
|
"mean_token_accuracy": 0.6939992997795343,
|
|
"num_tokens": 153304877.0,
|
|
"step": 2045
|
|
},
|
|
{
|
|
"entropy": 1.1009058840572834,
|
|
"epoch": 0.6311758536749636,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 1.8438069034728738e-05,
|
|
"loss": 1.0929,
|
|
"mean_token_accuracy": 0.7022685822099447,
|
|
"num_tokens": 153689362.0,
|
|
"step": 2050
|
|
},
|
|
{
|
|
"entropy": 1.1297755874693394,
|
|
"epoch": 0.6327153069766099,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.8429367634391116e-05,
|
|
"loss": 1.1184,
|
|
"mean_token_accuracy": 0.6954657424241304,
|
|
"num_tokens": 154059184.0,
|
|
"step": 2055
|
|
},
|
|
{
|
|
"entropy": 1.1133303932845593,
|
|
"epoch": 0.6342547602782562,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.8420644129019555e-05,
|
|
"loss": 1.0993,
|
|
"mean_token_accuracy": 0.7026321858167648,
|
|
"num_tokens": 154435058.0,
|
|
"step": 2060
|
|
},
|
|
{
|
|
"entropy": 1.1748030522838235,
|
|
"epoch": 0.6357942135799024,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 1.8411898541490433e-05,
|
|
"loss": 1.1758,
|
|
"mean_token_accuracy": 0.6871446866542101,
|
|
"num_tokens": 154795848.0,
|
|
"step": 2065
|
|
},
|
|
{
|
|
"entropy": 1.1518771335482598,
|
|
"epoch": 0.6373336668815487,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 1.8403130894738038e-05,
|
|
"loss": 1.1465,
|
|
"mean_token_accuracy": 0.6935045797377825,
|
|
"num_tokens": 155153389.0,
|
|
"step": 2070
|
|
},
|
|
{
|
|
"entropy": 1.1386884730309248,
|
|
"epoch": 0.638873120183195,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.8394341211754496e-05,
|
|
"loss": 1.1447,
|
|
"mean_token_accuracy": 0.6941363386809826,
|
|
"num_tokens": 155515587.0,
|
|
"step": 2075
|
|
},
|
|
{
|
|
"entropy": 1.1431025385856628,
|
|
"epoch": 0.6404125734848412,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.8385529515589726e-05,
|
|
"loss": 1.1386,
|
|
"mean_token_accuracy": 0.6931343143805861,
|
|
"num_tokens": 155891606.0,
|
|
"step": 2080
|
|
},
|
|
{
|
|
"entropy": 1.1411488141864539,
|
|
"epoch": 0.6419520267864874,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.8376695829351378e-05,
|
|
"loss": 1.1272,
|
|
"mean_token_accuracy": 0.6926099382340908,
|
|
"num_tokens": 156273092.0,
|
|
"step": 2085
|
|
},
|
|
{
|
|
"entropy": 1.1294952983036637,
|
|
"epoch": 0.6434914800881337,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.836784017620476e-05,
|
|
"loss": 1.1181,
|
|
"mean_token_accuracy": 0.6974793665111065,
|
|
"num_tokens": 156641690.0,
|
|
"step": 2090
|
|
},
|
|
{
|
|
"entropy": 1.142337768152356,
|
|
"epoch": 0.6450309333897799,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.8358962579372797e-05,
|
|
"loss": 1.1507,
|
|
"mean_token_accuracy": 0.6917462650686502,
|
|
"num_tokens": 157011422.0,
|
|
"step": 2095
|
|
},
|
|
{
|
|
"entropy": 1.0961598601192235,
|
|
"epoch": 0.6465703866914262,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.835006306213594e-05,
|
|
"loss": 1.1,
|
|
"mean_token_accuracy": 0.703354274854064,
|
|
"num_tokens": 157388966.0,
|
|
"step": 2100
|
|
},
|
|
{
|
|
"entropy": 1.118635695055127,
|
|
"epoch": 0.6481098399930725,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.834114164783215e-05,
|
|
"loss": 1.1093,
|
|
"mean_token_accuracy": 0.6975133273750543,
|
|
"num_tokens": 157781000.0,
|
|
"step": 2105
|
|
},
|
|
{
|
|
"entropy": 1.1703529071062804,
|
|
"epoch": 0.6496492932947188,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.8332198359856782e-05,
|
|
"loss": 1.1621,
|
|
"mean_token_accuracy": 0.6912976618856191,
|
|
"num_tokens": 158148821.0,
|
|
"step": 2110
|
|
},
|
|
{
|
|
"entropy": 1.139431282877922,
|
|
"epoch": 0.6511887465963649,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.8323233221662574e-05,
|
|
"loss": 1.1272,
|
|
"mean_token_accuracy": 0.6936106860637665,
|
|
"num_tokens": 158519240.0,
|
|
"step": 2115
|
|
},
|
|
{
|
|
"entropy": 1.137386091426015,
|
|
"epoch": 0.6527281998980112,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.8314246256759556e-05,
|
|
"loss": 1.1254,
|
|
"mean_token_accuracy": 0.6957115132361651,
|
|
"num_tokens": 158896885.0,
|
|
"step": 2120
|
|
},
|
|
{
|
|
"entropy": 1.132150064781308,
|
|
"epoch": 0.6542676531996575,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 1.8305237488714995e-05,
|
|
"loss": 1.1325,
|
|
"mean_token_accuracy": 0.6934053935110569,
|
|
"num_tokens": 159265519.0,
|
|
"step": 2125
|
|
},
|
|
{
|
|
"entropy": 1.1579696323722601,
|
|
"epoch": 0.6558071065013037,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.8296206941153333e-05,
|
|
"loss": 1.1517,
|
|
"mean_token_accuracy": 0.689340352639556,
|
|
"num_tokens": 159634386.0,
|
|
"step": 2130
|
|
},
|
|
{
|
|
"entropy": 1.142648032307625,
|
|
"epoch": 0.65734655980295,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.8287154637756125e-05,
|
|
"loss": 1.1318,
|
|
"mean_token_accuracy": 0.6927073132246733,
|
|
"num_tokens": 160008254.0,
|
|
"step": 2135
|
|
},
|
|
{
|
|
"entropy": 1.1443445168435573,
|
|
"epoch": 0.6588860131045963,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.827808060226199e-05,
|
|
"loss": 1.1434,
|
|
"mean_token_accuracy": 0.6936221666634083,
|
|
"num_tokens": 160367712.0,
|
|
"step": 2140
|
|
},
|
|
{
|
|
"entropy": 1.0978737404569983,
|
|
"epoch": 0.6604254664062424,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.8268984858466524e-05,
|
|
"loss": 1.0886,
|
|
"mean_token_accuracy": 0.7030142482370139,
|
|
"num_tokens": 160733299.0,
|
|
"step": 2145
|
|
},
|
|
{
|
|
"entropy": 1.1296749690547585,
|
|
"epoch": 0.6619649197078887,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.825986743022225e-05,
|
|
"loss": 1.1273,
|
|
"mean_token_accuracy": 0.6956211663782597,
|
|
"num_tokens": 161103268.0,
|
|
"step": 2150
|
|
},
|
|
{
|
|
"entropy": 1.1379246138036252,
|
|
"epoch": 0.663504373009535,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.825072834143857e-05,
|
|
"loss": 1.1355,
|
|
"mean_token_accuracy": 0.6943081360310316,
|
|
"num_tokens": 161476085.0,
|
|
"step": 2155
|
|
},
|
|
{
|
|
"entropy": 1.0913480401039124,
|
|
"epoch": 0.6650438263111812,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.8241567616081674e-05,
|
|
"loss": 1.0802,
|
|
"mean_token_accuracy": 0.7027659468352795,
|
|
"num_tokens": 161846954.0,
|
|
"step": 2160
|
|
},
|
|
{
|
|
"entropy": 1.1175310904160143,
|
|
"epoch": 0.6665832796128275,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.823238527817449e-05,
|
|
"loss": 1.1097,
|
|
"mean_token_accuracy": 0.6994062628597021,
|
|
"num_tokens": 162214500.0,
|
|
"step": 2165
|
|
},
|
|
{
|
|
"entropy": 1.0967560213059186,
|
|
"epoch": 0.6681227329144738,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.8223181351796642e-05,
|
|
"loss": 1.1022,
|
|
"mean_token_accuracy": 0.7011716574430465,
|
|
"num_tokens": 162600939.0,
|
|
"step": 2170
|
|
},
|
|
{
|
|
"entropy": 1.1191772257909178,
|
|
"epoch": 0.66966218621612,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.8213955861084342e-05,
|
|
"loss": 1.1047,
|
|
"mean_token_accuracy": 0.698114974796772,
|
|
"num_tokens": 162989103.0,
|
|
"step": 2175
|
|
},
|
|
{
|
|
"entropy": 1.078780804388225,
|
|
"epoch": 0.6712016395177662,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.8204708830230372e-05,
|
|
"loss": 1.0769,
|
|
"mean_token_accuracy": 0.7026279237121343,
|
|
"num_tokens": 163365199.0,
|
|
"step": 2180
|
|
},
|
|
{
|
|
"entropy": 1.102193933725357,
|
|
"epoch": 0.6727410928194125,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 1.819544028348399e-05,
|
|
"loss": 1.1007,
|
|
"mean_token_accuracy": 0.7027922391891479,
|
|
"num_tokens": 163737628.0,
|
|
"step": 2185
|
|
},
|
|
{
|
|
"entropy": 1.1276447394862772,
|
|
"epoch": 0.6742805461210588,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.8186150245150876e-05,
|
|
"loss": 1.1184,
|
|
"mean_token_accuracy": 0.6979492522776127,
|
|
"num_tokens": 164121012.0,
|
|
"step": 2190
|
|
},
|
|
{
|
|
"entropy": 1.1386257752776145,
|
|
"epoch": 0.675819999422705,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.8176838739593078e-05,
|
|
"loss": 1.1337,
|
|
"mean_token_accuracy": 0.6927195183932782,
|
|
"num_tokens": 164482798.0,
|
|
"step": 2195
|
|
},
|
|
{
|
|
"entropy": 1.127764510177076,
|
|
"epoch": 0.6773594527243513,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.816750579122893e-05,
|
|
"loss": 1.1284,
|
|
"mean_token_accuracy": 0.6954803835600615,
|
|
"num_tokens": 164859917.0,
|
|
"step": 2200
|
|
},
|
|
{
|
|
"entropy": 1.0942645370960236,
|
|
"epoch": 0.6788989060259976,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.8158151424533002e-05,
|
|
"loss": 1.0873,
|
|
"mean_token_accuracy": 0.7031883802264929,
|
|
"num_tokens": 165247314.0,
|
|
"step": 2205
|
|
},
|
|
{
|
|
"entropy": 1.1059243634343148,
|
|
"epoch": 0.6804383593276437,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.814877566403603e-05,
|
|
"loss": 1.1071,
|
|
"mean_token_accuracy": 0.6975095085799694,
|
|
"num_tokens": 165636534.0,
|
|
"step": 2210
|
|
},
|
|
{
|
|
"entropy": 1.1076618060469627,
|
|
"epoch": 0.68197781262929,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.813937853432485e-05,
|
|
"loss": 1.0991,
|
|
"mean_token_accuracy": 0.7021389830857515,
|
|
"num_tokens": 166000924.0,
|
|
"step": 2215
|
|
},
|
|
{
|
|
"entropy": 1.1220650862902404,
|
|
"epoch": 0.6835172659309363,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.8129960060042345e-05,
|
|
"loss": 1.1088,
|
|
"mean_token_accuracy": 0.6972477741539478,
|
|
"num_tokens": 166359772.0,
|
|
"step": 2220
|
|
},
|
|
{
|
|
"entropy": 1.068718210607767,
|
|
"epoch": 0.6850567192325825,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.8120520265887364e-05,
|
|
"loss": 1.0561,
|
|
"mean_token_accuracy": 0.7072693090885878,
|
|
"num_tokens": 166735638.0,
|
|
"step": 2225
|
|
},
|
|
{
|
|
"entropy": 1.1178116356953978,
|
|
"epoch": 0.6865961725342288,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.8111059176614665e-05,
|
|
"loss": 1.1218,
|
|
"mean_token_accuracy": 0.6972925592213869,
|
|
"num_tokens": 167111121.0,
|
|
"step": 2230
|
|
},
|
|
{
|
|
"entropy": 1.130570314452052,
|
|
"epoch": 0.6881356258358751,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.8101576817034853e-05,
|
|
"loss": 1.126,
|
|
"mean_token_accuracy": 0.6954567573964596,
|
|
"num_tokens": 167477412.0,
|
|
"step": 2235
|
|
},
|
|
{
|
|
"entropy": 1.1099465020000934,
|
|
"epoch": 0.6896750791375212,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.8092073212014307e-05,
|
|
"loss": 1.1033,
|
|
"mean_token_accuracy": 0.7016259111464024,
|
|
"num_tokens": 167840862.0,
|
|
"step": 2240
|
|
},
|
|
{
|
|
"entropy": 1.0539396397769452,
|
|
"epoch": 0.6912145324391675,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.808254838647513e-05,
|
|
"loss": 1.056,
|
|
"mean_token_accuracy": 0.7084746707230807,
|
|
"num_tokens": 168239811.0,
|
|
"step": 2245
|
|
},
|
|
{
|
|
"entropy": 1.0955925872549415,
|
|
"epoch": 0.6927539857408138,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.807300236539506e-05,
|
|
"loss": 1.0801,
|
|
"mean_token_accuracy": 0.7024415228515863,
|
|
"num_tokens": 168629807.0,
|
|
"step": 2250
|
|
},
|
|
{
|
|
"entropy": 1.1386502474546432,
|
|
"epoch": 0.69429343904246,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.806343517380743e-05,
|
|
"loss": 1.1515,
|
|
"mean_token_accuracy": 0.6970106501132249,
|
|
"num_tokens": 168997119.0,
|
|
"step": 2255
|
|
},
|
|
{
|
|
"entropy": 1.1127931490540504,
|
|
"epoch": 0.6958328923441063,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.8053846836801076e-05,
|
|
"loss": 1.1158,
|
|
"mean_token_accuracy": 0.6967024650424719,
|
|
"num_tokens": 169368874.0,
|
|
"step": 2260
|
|
},
|
|
{
|
|
"entropy": 1.1397660907357932,
|
|
"epoch": 0.6973723456457526,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.8044237379520305e-05,
|
|
"loss": 1.1374,
|
|
"mean_token_accuracy": 0.6930058509111404,
|
|
"num_tokens": 169744480.0,
|
|
"step": 2265
|
|
},
|
|
{
|
|
"entropy": 1.1199751045554875,
|
|
"epoch": 0.6989117989473989,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.8034606827164795e-05,
|
|
"loss": 1.1056,
|
|
"mean_token_accuracy": 0.6997339356690645,
|
|
"num_tokens": 170127695.0,
|
|
"step": 2270
|
|
},
|
|
{
|
|
"entropy": 1.119225537776947,
|
|
"epoch": 0.700451252249045,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.8024955204989537e-05,
|
|
"loss": 1.1199,
|
|
"mean_token_accuracy": 0.6996861334890128,
|
|
"num_tokens": 170508510.0,
|
|
"step": 2275
|
|
},
|
|
{
|
|
"entropy": 1.1192351464182138,
|
|
"epoch": 0.7019907055506913,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.80152825383048e-05,
|
|
"loss": 1.1094,
|
|
"mean_token_accuracy": 0.693935377895832,
|
|
"num_tokens": 170873383.0,
|
|
"step": 2280
|
|
},
|
|
{
|
|
"entropy": 1.115487469546497,
|
|
"epoch": 0.7035301588523376,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.8005588852476018e-05,
|
|
"loss": 1.1068,
|
|
"mean_token_accuracy": 0.6981241587549448,
|
|
"num_tokens": 171261938.0,
|
|
"step": 2285
|
|
},
|
|
{
|
|
"entropy": 1.1232613749802112,
|
|
"epoch": 0.7050696121539838,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.799587417292375e-05,
|
|
"loss": 1.1239,
|
|
"mean_token_accuracy": 0.6959119252860546,
|
|
"num_tokens": 171645402.0,
|
|
"step": 2290
|
|
},
|
|
{
|
|
"entropy": 1.1076678885146976,
|
|
"epoch": 0.7066090654556301,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.798613852512361e-05,
|
|
"loss": 1.0969,
|
|
"mean_token_accuracy": 0.7003442455083132,
|
|
"num_tokens": 172025713.0,
|
|
"step": 2295
|
|
},
|
|
{
|
|
"entropy": 1.1507720805704593,
|
|
"epoch": 0.7081485187572764,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.79763819346062e-05,
|
|
"loss": 1.1442,
|
|
"mean_token_accuracy": 0.6917078942060471,
|
|
"num_tokens": 172386627.0,
|
|
"step": 2300
|
|
},
|
|
{
|
|
"entropy": 1.1178302532061934,
|
|
"epoch": 0.7096879720589225,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.796660442695705e-05,
|
|
"loss": 1.099,
|
|
"mean_token_accuracy": 0.6997009709477424,
|
|
"num_tokens": 172762148.0,
|
|
"step": 2305
|
|
},
|
|
{
|
|
"entropy": 1.110177224688232,
|
|
"epoch": 0.7112274253605688,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 1.795680602781652e-05,
|
|
"loss": 1.1017,
|
|
"mean_token_accuracy": 0.6984499383717775,
|
|
"num_tokens": 173139010.0,
|
|
"step": 2310
|
|
},
|
|
{
|
|
"entropy": 1.1373082049191,
|
|
"epoch": 0.7127668786622151,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.7946986762879785e-05,
|
|
"loss": 1.1251,
|
|
"mean_token_accuracy": 0.6973337743431329,
|
|
"num_tokens": 173521573.0,
|
|
"step": 2315
|
|
},
|
|
{
|
|
"entropy": 1.0916681990027428,
|
|
"epoch": 0.7143063319638613,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.7937146657896708e-05,
|
|
"loss": 1.0895,
|
|
"mean_token_accuracy": 0.7012616876512766,
|
|
"num_tokens": 173914670.0,
|
|
"step": 2320
|
|
},
|
|
{
|
|
"entropy": 1.188042016327381,
|
|
"epoch": 0.7158457852655076,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.7927285738671825e-05,
|
|
"loss": 1.1786,
|
|
"mean_token_accuracy": 0.6875874120742083,
|
|
"num_tokens": 174291376.0,
|
|
"step": 2325
|
|
},
|
|
{
|
|
"entropy": 1.0931476794183255,
|
|
"epoch": 0.7173852385671539,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.7917404031064245e-05,
|
|
"loss": 1.082,
|
|
"mean_token_accuracy": 0.702524871379137,
|
|
"num_tokens": 174670593.0,
|
|
"step": 2330
|
|
},
|
|
{
|
|
"entropy": 1.1133252872154116,
|
|
"epoch": 0.7189246918688001,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.7907501560987594e-05,
|
|
"loss": 1.1079,
|
|
"mean_token_accuracy": 0.6983722053468228,
|
|
"num_tokens": 175048912.0,
|
|
"step": 2335
|
|
},
|
|
{
|
|
"entropy": 1.167278153076768,
|
|
"epoch": 0.7204641451704463,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.7897578354409945e-05,
|
|
"loss": 1.1646,
|
|
"mean_token_accuracy": 0.6914217924699188,
|
|
"num_tokens": 175419284.0,
|
|
"step": 2340
|
|
},
|
|
{
|
|
"entropy": 1.114026983268559,
|
|
"epoch": 0.7220035984720926,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.7887634437353754e-05,
|
|
"loss": 1.1154,
|
|
"mean_token_accuracy": 0.6988561425358057,
|
|
"num_tokens": 175793045.0,
|
|
"step": 2345
|
|
},
|
|
{
|
|
"entropy": 1.1095017280429602,
|
|
"epoch": 0.7235430517737389,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.787766983589578e-05,
|
|
"loss": 1.1076,
|
|
"mean_token_accuracy": 0.7001173861324788,
|
|
"num_tokens": 176159168.0,
|
|
"step": 2350
|
|
},
|
|
{
|
|
"entropy": 1.114397633448243,
|
|
"epoch": 0.7250825050753851,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.7867684576167028e-05,
|
|
"loss": 1.1065,
|
|
"mean_token_accuracy": 0.6991507276892662,
|
|
"num_tokens": 176538415.0,
|
|
"step": 2355
|
|
},
|
|
{
|
|
"entropy": 1.1345725648105145,
|
|
"epoch": 0.7266219583770314,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.7857678684352684e-05,
|
|
"loss": 1.1261,
|
|
"mean_token_accuracy": 0.6978184632956982,
|
|
"num_tokens": 176902529.0,
|
|
"step": 2360
|
|
},
|
|
{
|
|
"entropy": 1.1068701507523655,
|
|
"epoch": 0.7281614116786777,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 1.7847652186692025e-05,
|
|
"loss": 1.096,
|
|
"mean_token_accuracy": 0.6995298650115729,
|
|
"num_tokens": 177273706.0,
|
|
"step": 2365
|
|
},
|
|
{
|
|
"entropy": 1.0690416656434536,
|
|
"epoch": 0.7297008649803238,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.783760510947838e-05,
|
|
"loss": 1.0606,
|
|
"mean_token_accuracy": 0.7073897119611502,
|
|
"num_tokens": 177642545.0,
|
|
"step": 2370
|
|
},
|
|
{
|
|
"entropy": 1.1013412851840259,
|
|
"epoch": 0.7312403182819701,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.7827537479059026e-05,
|
|
"loss": 1.0872,
|
|
"mean_token_accuracy": 0.7016142923384905,
|
|
"num_tokens": 178023026.0,
|
|
"step": 2375
|
|
},
|
|
{
|
|
"entropy": 1.08609632384032,
|
|
"epoch": 0.7327797715836164,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.7817449321835166e-05,
|
|
"loss": 1.0756,
|
|
"mean_token_accuracy": 0.7015501491725444,
|
|
"num_tokens": 178416678.0,
|
|
"step": 2380
|
|
},
|
|
{
|
|
"entropy": 1.0995122667402029,
|
|
"epoch": 0.7343192248852626,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.78073406642618e-05,
|
|
"loss": 1.0907,
|
|
"mean_token_accuracy": 0.7023708283901214,
|
|
"num_tokens": 178792520.0,
|
|
"step": 2385
|
|
},
|
|
{
|
|
"entropy": 1.1085374269634485,
|
|
"epoch": 0.7358586781869089,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.779721153284772e-05,
|
|
"loss": 1.1006,
|
|
"mean_token_accuracy": 0.7005628883838654,
|
|
"num_tokens": 179177915.0,
|
|
"step": 2390
|
|
},
|
|
{
|
|
"entropy": 1.0867597110569478,
|
|
"epoch": 0.7373981314885552,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.778706195415538e-05,
|
|
"loss": 1.0764,
|
|
"mean_token_accuracy": 0.7046916723251343,
|
|
"num_tokens": 179554799.0,
|
|
"step": 2395
|
|
},
|
|
{
|
|
"entropy": 1.1686318777501583,
|
|
"epoch": 0.7389375847902013,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.777689195480087e-05,
|
|
"loss": 1.17,
|
|
"mean_token_accuracy": 0.6879521161317825,
|
|
"num_tokens": 179918900.0,
|
|
"step": 2400
|
|
},
|
|
{
|
|
"entropy": 1.0987579802051186,
|
|
"epoch": 0.7404770380918476,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.776670156145383e-05,
|
|
"loss": 1.1023,
|
|
"mean_token_accuracy": 0.7014432933181525,
|
|
"num_tokens": 180303889.0,
|
|
"step": 2405
|
|
},
|
|
{
|
|
"entropy": 1.1044664761051535,
|
|
"epoch": 0.7420164913934939,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.7756490800837377e-05,
|
|
"loss": 1.1022,
|
|
"mean_token_accuracy": 0.6991443373262882,
|
|
"num_tokens": 180665150.0,
|
|
"step": 2410
|
|
},
|
|
{
|
|
"entropy": 1.1001021387055516,
|
|
"epoch": 0.7435559446951402,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.774625969972804e-05,
|
|
"loss": 1.0877,
|
|
"mean_token_accuracy": 0.7032657440751791,
|
|
"num_tokens": 181037748.0,
|
|
"step": 2415
|
|
},
|
|
{
|
|
"entropy": 1.124724223650992,
|
|
"epoch": 0.7450953979967864,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 1.7736008284955693e-05,
|
|
"loss": 1.1304,
|
|
"mean_token_accuracy": 0.698460428789258,
|
|
"num_tokens": 181406422.0,
|
|
"step": 2420
|
|
},
|
|
{
|
|
"entropy": 1.0898881725966931,
|
|
"epoch": 0.7466348512984327,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.772573658340347e-05,
|
|
"loss": 1.0731,
|
|
"mean_token_accuracy": 0.7067207857966423,
|
|
"num_tokens": 181780292.0,
|
|
"step": 2425
|
|
},
|
|
{
|
|
"entropy": 1.1112020071595907,
|
|
"epoch": 0.7481743046000789,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.7715444622007715e-05,
|
|
"loss": 1.1118,
|
|
"mean_token_accuracy": 0.7000539500266314,
|
|
"num_tokens": 182155860.0,
|
|
"step": 2430
|
|
},
|
|
{
|
|
"entropy": 1.1400660768151283,
|
|
"epoch": 0.7497137579017251,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.7705132427757895e-05,
|
|
"loss": 1.1317,
|
|
"mean_token_accuracy": 0.693534354865551,
|
|
"num_tokens": 182541127.0,
|
|
"step": 2435
|
|
},
|
|
{
|
|
"entropy": 1.101803145557642,
|
|
"epoch": 0.7512532112033714,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.7694800027696536e-05,
|
|
"loss": 1.0949,
|
|
"mean_token_accuracy": 0.7003138996660709,
|
|
"num_tokens": 182916319.0,
|
|
"step": 2440
|
|
},
|
|
{
|
|
"entropy": 1.1126858746632933,
|
|
"epoch": 0.7527926645050177,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.7684447448919156e-05,
|
|
"loss": 1.1117,
|
|
"mean_token_accuracy": 0.6983442030847072,
|
|
"num_tokens": 183291099.0,
|
|
"step": 2445
|
|
},
|
|
{
|
|
"entropy": 1.0931305399164557,
|
|
"epoch": 0.7543321178066639,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.7674074718574187e-05,
|
|
"loss": 1.087,
|
|
"mean_token_accuracy": 0.7029769979417324,
|
|
"num_tokens": 183656984.0,
|
|
"step": 2450
|
|
},
|
|
{
|
|
"entropy": 1.0863770237192512,
|
|
"epoch": 0.7558715711083102,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.7663681863862895e-05,
|
|
"loss": 1.0745,
|
|
"mean_token_accuracy": 0.7050878301262855,
|
|
"num_tokens": 184030898.0,
|
|
"step": 2455
|
|
},
|
|
{
|
|
"entropy": 1.1342706704512238,
|
|
"epoch": 0.7574110244099564,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.7653268912039346e-05,
|
|
"loss": 1.1146,
|
|
"mean_token_accuracy": 0.6934974033385515,
|
|
"num_tokens": 184409379.0,
|
|
"step": 2460
|
|
},
|
|
{
|
|
"entropy": 1.1351441755890845,
|
|
"epoch": 0.7589504777116026,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.764283589041028e-05,
|
|
"loss": 1.1331,
|
|
"mean_token_accuracy": 0.6928224857896567,
|
|
"num_tokens": 184785789.0,
|
|
"step": 2465
|
|
},
|
|
{
|
|
"entropy": 1.1305670756846666,
|
|
"epoch": 0.7604899310132489,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.7632382826335082e-05,
|
|
"loss": 1.1201,
|
|
"mean_token_accuracy": 0.6961219064891339,
|
|
"num_tokens": 185152907.0,
|
|
"step": 2470
|
|
},
|
|
{
|
|
"entropy": 1.1167133485898375,
|
|
"epoch": 0.7620293843148952,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.76219097472257e-05,
|
|
"loss": 1.1284,
|
|
"mean_token_accuracy": 0.6951590169221162,
|
|
"num_tokens": 185527048.0,
|
|
"step": 2475
|
|
},
|
|
{
|
|
"entropy": 1.1290605710819364,
|
|
"epoch": 0.7635688376165414,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.761141668054655e-05,
|
|
"loss": 1.1299,
|
|
"mean_token_accuracy": 0.69532679207623,
|
|
"num_tokens": 185898944.0,
|
|
"step": 2480
|
|
},
|
|
{
|
|
"entropy": 1.1405559226870536,
|
|
"epoch": 0.7651082909181877,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.760090365381449e-05,
|
|
"loss": 1.1399,
|
|
"mean_token_accuracy": 0.692203239351511,
|
|
"num_tokens": 186258758.0,
|
|
"step": 2485
|
|
},
|
|
{
|
|
"entropy": 1.1181536603718996,
|
|
"epoch": 0.766647744219834,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.75903706945987e-05,
|
|
"loss": 1.1058,
|
|
"mean_token_accuracy": 0.6988699793815613,
|
|
"num_tokens": 186624684.0,
|
|
"step": 2490
|
|
},
|
|
{
|
|
"entropy": 1.1159826684743166,
|
|
"epoch": 0.7681871975214802,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.7579817830520644e-05,
|
|
"loss": 1.1029,
|
|
"mean_token_accuracy": 0.6988367810845375,
|
|
"num_tokens": 187007877.0,
|
|
"step": 2495
|
|
},
|
|
{
|
|
"entropy": 1.0837754575535654,
|
|
"epoch": 0.7697266508231264,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.756924508925397e-05,
|
|
"loss": 1.0795,
|
|
"mean_token_accuracy": 0.7029804602265358,
|
|
"num_tokens": 187395823.0,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"entropy": 1.0903053333982826,
|
|
"epoch": 0.7712661041247727,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 1.7558652498524464e-05,
|
|
"loss": 1.0712,
|
|
"mean_token_accuracy": 0.7018662039190531,
|
|
"num_tokens": 187767014.0,
|
|
"step": 2505
|
|
},
|
|
{
|
|
"entropy": 1.1511711820960044,
|
|
"epoch": 0.772805557426419,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.7548040086109957e-05,
|
|
"loss": 1.1538,
|
|
"mean_token_accuracy": 0.6920887984335422,
|
|
"num_tokens": 188140908.0,
|
|
"step": 2510
|
|
},
|
|
{
|
|
"entropy": 1.1196786388754845,
|
|
"epoch": 0.7743450107280652,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 1.7537407879840266e-05,
|
|
"loss": 1.1192,
|
|
"mean_token_accuracy": 0.7018770579248667,
|
|
"num_tokens": 188516656.0,
|
|
"step": 2515
|
|
},
|
|
{
|
|
"entropy": 1.135399747081101,
|
|
"epoch": 0.7758844640297115,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.752675590759711e-05,
|
|
"loss": 1.1263,
|
|
"mean_token_accuracy": 0.6961784608662128,
|
|
"num_tokens": 188890179.0,
|
|
"step": 2520
|
|
},
|
|
{
|
|
"entropy": 1.1367985662072897,
|
|
"epoch": 0.7774239173313577,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.7516084197314044e-05,
|
|
"loss": 1.1356,
|
|
"mean_token_accuracy": 0.6949714899063111,
|
|
"num_tokens": 189261560.0,
|
|
"step": 2525
|
|
},
|
|
{
|
|
"entropy": 1.1175121076405048,
|
|
"epoch": 0.7789633706330039,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.7505392776976392e-05,
|
|
"loss": 1.1152,
|
|
"mean_token_accuracy": 0.6998940669000149,
|
|
"num_tokens": 189635927.0,
|
|
"step": 2530
|
|
},
|
|
{
|
|
"entropy": 1.0612255077809096,
|
|
"epoch": 0.7805028239346502,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 1.7494681674621148e-05,
|
|
"loss": 1.0615,
|
|
"mean_token_accuracy": 0.7076791275292635,
|
|
"num_tokens": 190031986.0,
|
|
"step": 2535
|
|
},
|
|
{
|
|
"entropy": 1.0870164155960083,
|
|
"epoch": 0.7820422772362965,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.7483950918336933e-05,
|
|
"loss": 1.0821,
|
|
"mean_token_accuracy": 0.7051350273191929,
|
|
"num_tokens": 190406510.0,
|
|
"step": 2540
|
|
},
|
|
{
|
|
"entropy": 1.098094793781638,
|
|
"epoch": 0.7835817305379427,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 1.7473200536263905e-05,
|
|
"loss": 1.0897,
|
|
"mean_token_accuracy": 0.7014690071344376,
|
|
"num_tokens": 190770948.0,
|
|
"step": 2545
|
|
},
|
|
{
|
|
"entropy": 1.1395260747522116,
|
|
"epoch": 0.785121183839589,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.7462430556593687e-05,
|
|
"loss": 1.1415,
|
|
"mean_token_accuracy": 0.6940800420939922,
|
|
"num_tokens": 191145348.0,
|
|
"step": 2550
|
|
},
|
|
{
|
|
"entropy": 1.1120876904577017,
|
|
"epoch": 0.7866606371412352,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.7451641007569296e-05,
|
|
"loss": 1.1064,
|
|
"mean_token_accuracy": 0.702504301816225,
|
|
"num_tokens": 191510545.0,
|
|
"step": 2555
|
|
},
|
|
{
|
|
"entropy": 1.1490049432963132,
|
|
"epoch": 0.7882000904428814,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 1.7440831917485064e-05,
|
|
"loss": 1.1411,
|
|
"mean_token_accuracy": 0.6938914064317941,
|
|
"num_tokens": 191894746.0,
|
|
"step": 2560
|
|
},
|
|
{
|
|
"entropy": 1.107052903994918,
|
|
"epoch": 0.7897395437445277,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.743000331468657e-05,
|
|
"loss": 1.0903,
|
|
"mean_token_accuracy": 0.6995991533622146,
|
|
"num_tokens": 192276582.0,
|
|
"step": 2565
|
|
},
|
|
{
|
|
"entropy": 1.1070753591135145,
|
|
"epoch": 0.791278997046174,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.7419155227570564e-05,
|
|
"loss": 1.0866,
|
|
"mean_token_accuracy": 0.7038450885564089,
|
|
"num_tokens": 192621423.0,
|
|
"step": 2570
|
|
},
|
|
{
|
|
"entropy": 1.0929330352693796,
|
|
"epoch": 0.7928184503478203,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 1.740828768458489e-05,
|
|
"loss": 1.0926,
|
|
"mean_token_accuracy": 0.70133086591959,
|
|
"num_tokens": 192989973.0,
|
|
"step": 2575
|
|
},
|
|
{
|
|
"entropy": 1.129907682351768,
|
|
"epoch": 0.7943579036494665,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.7397400714228414e-05,
|
|
"loss": 1.1243,
|
|
"mean_token_accuracy": 0.6967439528554678,
|
|
"num_tokens": 193363104.0,
|
|
"step": 2580
|
|
},
|
|
{
|
|
"entropy": 1.142175304144621,
|
|
"epoch": 0.7958973569511127,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.7386494345050944e-05,
|
|
"loss": 1.1438,
|
|
"mean_token_accuracy": 0.6937367048114538,
|
|
"num_tokens": 193734742.0,
|
|
"step": 2585
|
|
},
|
|
{
|
|
"entropy": 1.1326942648738623,
|
|
"epoch": 0.797436810252759,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.737556860565316e-05,
|
|
"loss": 1.1384,
|
|
"mean_token_accuracy": 0.6964565064758063,
|
|
"num_tokens": 194114488.0,
|
|
"step": 2590
|
|
},
|
|
{
|
|
"entropy": 1.1030776659026742,
|
|
"epoch": 0.7989762635544052,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.7364623524686542e-05,
|
|
"loss": 1.0997,
|
|
"mean_token_accuracy": 0.6996722735464573,
|
|
"num_tokens": 194502358.0,
|
|
"step": 2595
|
|
},
|
|
{
|
|
"entropy": 1.0948217798024416,
|
|
"epoch": 0.8005157168560515,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.735365913085329e-05,
|
|
"loss": 1.0789,
|
|
"mean_token_accuracy": 0.7024578548967838,
|
|
"num_tokens": 194876850.0,
|
|
"step": 2600
|
|
},
|
|
{
|
|
"entropy": 1.118626402504742,
|
|
"epoch": 0.8020551701576978,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.734267545290625e-05,
|
|
"loss": 1.1246,
|
|
"mean_token_accuracy": 0.6985007669776678,
|
|
"num_tokens": 195246768.0,
|
|
"step": 2605
|
|
},
|
|
{
|
|
"entropy": 1.121052284166217,
|
|
"epoch": 0.803594623459344,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.7331672519648834e-05,
|
|
"loss": 1.109,
|
|
"mean_token_accuracy": 0.699789596349001,
|
|
"num_tokens": 195637767.0,
|
|
"step": 2610
|
|
},
|
|
{
|
|
"entropy": 1.041398036852479,
|
|
"epoch": 0.8051340767609902,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.732065035993495e-05,
|
|
"loss": 1.0279,
|
|
"mean_token_accuracy": 0.7113026835024356,
|
|
"num_tokens": 196018909.0,
|
|
"step": 2615
|
|
},
|
|
{
|
|
"entropy": 1.1239682227373122,
|
|
"epoch": 0.8066735300626365,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.7309609002668932e-05,
|
|
"loss": 1.1141,
|
|
"mean_token_accuracy": 0.6974333211779594,
|
|
"num_tokens": 196401477.0,
|
|
"step": 2620
|
|
},
|
|
{
|
|
"entropy": 1.082462282292545,
|
|
"epoch": 0.8082129833642827,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.7298548476805446e-05,
|
|
"loss": 1.0828,
|
|
"mean_token_accuracy": 0.7064408622682095,
|
|
"num_tokens": 196769663.0,
|
|
"step": 2625
|
|
},
|
|
{
|
|
"entropy": 1.08235105490312,
|
|
"epoch": 0.809752436665929,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.7287468811349437e-05,
|
|
"loss": 1.0772,
|
|
"mean_token_accuracy": 0.7040530938655138,
|
|
"num_tokens": 197149098.0,
|
|
"step": 2630
|
|
},
|
|
{
|
|
"entropy": 1.0794834055006504,
|
|
"epoch": 0.8112918899675753,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.7276370035356037e-05,
|
|
"loss": 1.0788,
|
|
"mean_token_accuracy": 0.7081692714244128,
|
|
"num_tokens": 197507939.0,
|
|
"step": 2635
|
|
},
|
|
{
|
|
"entropy": 1.1190556347370149,
|
|
"epoch": 0.8128313432692215,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.7265252177930483e-05,
|
|
"loss": 1.1102,
|
|
"mean_token_accuracy": 0.6978001076728105,
|
|
"num_tokens": 197878831.0,
|
|
"step": 2640
|
|
},
|
|
{
|
|
"entropy": 1.121983960829675,
|
|
"epoch": 0.8143707965708677,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.7254115268228073e-05,
|
|
"loss": 1.1101,
|
|
"mean_token_accuracy": 0.6971151124686003,
|
|
"num_tokens": 198240722.0,
|
|
"step": 2645
|
|
},
|
|
{
|
|
"entropy": 1.0984731782227755,
|
|
"epoch": 0.815910249872514,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.724295933545404e-05,
|
|
"loss": 1.0999,
|
|
"mean_token_accuracy": 0.7044171739369631,
|
|
"num_tokens": 198623643.0,
|
|
"step": 2650
|
|
},
|
|
{
|
|
"entropy": 1.1332397196441888,
|
|
"epoch": 0.8174497031741603,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.723178440886353e-05,
|
|
"loss": 1.143,
|
|
"mean_token_accuracy": 0.6969984227791428,
|
|
"num_tokens": 199002171.0,
|
|
"step": 2655
|
|
},
|
|
{
|
|
"entropy": 1.1465369185432792,
|
|
"epoch": 0.8189891564758065,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 1.722059051776148e-05,
|
|
"loss": 1.1355,
|
|
"mean_token_accuracy": 0.6944274462759494,
|
|
"num_tokens": 199396183.0,
|
|
"step": 2660
|
|
},
|
|
{
|
|
"entropy": 1.130674248188734,
|
|
"epoch": 0.8205286097774528,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.7209377691502565e-05,
|
|
"loss": 1.1236,
|
|
"mean_token_accuracy": 0.6986651346087456,
|
|
"num_tokens": 199766961.0,
|
|
"step": 2665
|
|
},
|
|
{
|
|
"entropy": 1.1448373874649405,
|
|
"epoch": 0.8220680630790991,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.7198145959491113e-05,
|
|
"loss": 1.1518,
|
|
"mean_token_accuracy": 0.6953822866082191,
|
|
"num_tokens": 200150523.0,
|
|
"step": 2670
|
|
},
|
|
{
|
|
"entropy": 1.1163246229290962,
|
|
"epoch": 0.8236075163807453,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 1.718689535118103e-05,
|
|
"loss": 1.0971,
|
|
"mean_token_accuracy": 0.6998222548514604,
|
|
"num_tokens": 200531969.0,
|
|
"step": 2675
|
|
},
|
|
{
|
|
"entropy": 1.1107960917055606,
|
|
"epoch": 0.8251469696823915,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 1.7175625896075732e-05,
|
|
"loss": 1.1005,
|
|
"mean_token_accuracy": 0.7001858238130808,
|
|
"num_tokens": 200904361.0,
|
|
"step": 2680
|
|
},
|
|
{
|
|
"entropy": 1.1194037832319736,
|
|
"epoch": 0.8266864229840378,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.7164337623728044e-05,
|
|
"loss": 1.1158,
|
|
"mean_token_accuracy": 0.6979843948036433,
|
|
"num_tokens": 201277752.0,
|
|
"step": 2685
|
|
},
|
|
{
|
|
"entropy": 1.149041135236621,
|
|
"epoch": 0.828225876285684,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.715303056374015e-05,
|
|
"loss": 1.1487,
|
|
"mean_token_accuracy": 0.691906564310193,
|
|
"num_tokens": 201639026.0,
|
|
"step": 2690
|
|
},
|
|
{
|
|
"entropy": 1.1252323003485798,
|
|
"epoch": 0.8297653295873303,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.7141704745763494e-05,
|
|
"loss": 1.1085,
|
|
"mean_token_accuracy": 0.6988822910934687,
|
|
"num_tokens": 202032196.0,
|
|
"step": 2695
|
|
},
|
|
{
|
|
"entropy": 1.1688425466418266,
|
|
"epoch": 0.8313047828889766,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.713036019949871e-05,
|
|
"loss": 1.1736,
|
|
"mean_token_accuracy": 0.68868796415627,
|
|
"num_tokens": 202396787.0,
|
|
"step": 2700
|
|
},
|
|
{
|
|
"entropy": 1.0816320231184364,
|
|
"epoch": 0.8328442361906228,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.7118996954695553e-05,
|
|
"loss": 1.0761,
|
|
"mean_token_accuracy": 0.7047209940850735,
|
|
"num_tokens": 202787506.0,
|
|
"step": 2705
|
|
},
|
|
{
|
|
"entropy": 1.1424961797893047,
|
|
"epoch": 0.834383689492269,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.7107615041152807e-05,
|
|
"loss": 1.1331,
|
|
"mean_token_accuracy": 0.6949755053967237,
|
|
"num_tokens": 203162645.0,
|
|
"step": 2710
|
|
},
|
|
{
|
|
"entropy": 1.1023723732680082,
|
|
"epoch": 0.8359231427939153,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.709621448871821e-05,
|
|
"loss": 1.097,
|
|
"mean_token_accuracy": 0.7015528365969658,
|
|
"num_tokens": 203527557.0,
|
|
"step": 2715
|
|
},
|
|
{
|
|
"entropy": 1.1118264703080059,
|
|
"epoch": 0.8374625960955616,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.7084795327288387e-05,
|
|
"loss": 1.1031,
|
|
"mean_token_accuracy": 0.7010146964341402,
|
|
"num_tokens": 203897448.0,
|
|
"step": 2720
|
|
},
|
|
{
|
|
"entropy": 1.0787724321708083,
|
|
"epoch": 0.8390020493972078,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.7073357586808753e-05,
|
|
"loss": 1.0665,
|
|
"mean_token_accuracy": 0.7078627742826938,
|
|
"num_tokens": 204269665.0,
|
|
"step": 2725
|
|
},
|
|
{
|
|
"entropy": 1.0742497980594634,
|
|
"epoch": 0.8405415026988541,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.706190129727345e-05,
|
|
"loss": 1.0766,
|
|
"mean_token_accuracy": 0.706443578377366,
|
|
"num_tokens": 204640083.0,
|
|
"step": 2730
|
|
},
|
|
{
|
|
"entropy": 1.1287441933527589,
|
|
"epoch": 0.8420809560005004,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 1.7050426488725264e-05,
|
|
"loss": 1.1246,
|
|
"mean_token_accuracy": 0.6960625112056732,
|
|
"num_tokens": 205010565.0,
|
|
"step": 2735
|
|
},
|
|
{
|
|
"entropy": 1.114234597980976,
|
|
"epoch": 0.8436204093021465,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.703893319125554e-05,
|
|
"loss": 1.1083,
|
|
"mean_token_accuracy": 0.6985804803669453,
|
|
"num_tokens": 205394241.0,
|
|
"step": 2740
|
|
},
|
|
{
|
|
"entropy": 1.0446887370198965,
|
|
"epoch": 0.8451598626037928,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.7027421435004114e-05,
|
|
"loss": 1.0396,
|
|
"mean_token_accuracy": 0.7130256239324808,
|
|
"num_tokens": 205778044.0,
|
|
"step": 2745
|
|
},
|
|
{
|
|
"entropy": 1.127483463473618,
|
|
"epoch": 0.8466993159054391,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.701589125015922e-05,
|
|
"loss": 1.1229,
|
|
"mean_token_accuracy": 0.6960821971297264,
|
|
"num_tokens": 206151325.0,
|
|
"step": 2750
|
|
},
|
|
{
|
|
"entropy": 1.1459118625149132,
|
|
"epoch": 0.8482387692070853,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.7004342666957426e-05,
|
|
"loss": 1.1477,
|
|
"mean_token_accuracy": 0.6906679786741734,
|
|
"num_tokens": 206515412.0,
|
|
"step": 2755
|
|
},
|
|
{
|
|
"entropy": 1.1285589247941972,
|
|
"epoch": 0.8497782225087316,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.6992775715683544e-05,
|
|
"loss": 1.1317,
|
|
"mean_token_accuracy": 0.6945409368723631,
|
|
"num_tokens": 206884678.0,
|
|
"step": 2760
|
|
},
|
|
{
|
|
"entropy": 1.099574868567288,
|
|
"epoch": 0.8513176758103779,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.698119042667056e-05,
|
|
"loss": 1.0839,
|
|
"mean_token_accuracy": 0.7026559956371784,
|
|
"num_tokens": 207250423.0,
|
|
"step": 2765
|
|
},
|
|
{
|
|
"entropy": 1.1219121659174562,
|
|
"epoch": 0.852857129112024,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.696958683029954e-05,
|
|
"loss": 1.1054,
|
|
"mean_token_accuracy": 0.6976403135806322,
|
|
"num_tokens": 207623348.0,
|
|
"step": 2770
|
|
},
|
|
{
|
|
"entropy": 1.1164616649970411,
|
|
"epoch": 0.8543965824136703,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.6957964956999563e-05,
|
|
"loss": 1.1202,
|
|
"mean_token_accuracy": 0.6999995116144418,
|
|
"num_tokens": 208001124.0,
|
|
"step": 2775
|
|
},
|
|
{
|
|
"entropy": 1.1377616070210934,
|
|
"epoch": 0.8559360357153166,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.6946324837247636e-05,
|
|
"loss": 1.1271,
|
|
"mean_token_accuracy": 0.6944478377699852,
|
|
"num_tokens": 208375994.0,
|
|
"step": 2780
|
|
},
|
|
{
|
|
"entropy": 1.1082529162988066,
|
|
"epoch": 0.8574754890169628,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.6934666501568618e-05,
|
|
"loss": 1.104,
|
|
"mean_token_accuracy": 0.6988645371049642,
|
|
"num_tokens": 208752812.0,
|
|
"step": 2785
|
|
},
|
|
{
|
|
"entropy": 1.1542402550578117,
|
|
"epoch": 0.8590149423186091,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.6922989980535135e-05,
|
|
"loss": 1.1351,
|
|
"mean_token_accuracy": 0.6953271046280861,
|
|
"num_tokens": 209128737.0,
|
|
"step": 2790
|
|
},
|
|
{
|
|
"entropy": 1.121809756755829,
|
|
"epoch": 0.8605543956202554,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.6911295304767497e-05,
|
|
"loss": 1.1157,
|
|
"mean_token_accuracy": 0.6957637727260589,
|
|
"num_tokens": 209520264.0,
|
|
"step": 2795
|
|
},
|
|
{
|
|
"entropy": 1.1145857820287346,
|
|
"epoch": 0.8620938489219017,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.6899582504933637e-05,
|
|
"loss": 1.1059,
|
|
"mean_token_accuracy": 0.7002962566912174,
|
|
"num_tokens": 209892479.0,
|
|
"step": 2800
|
|
},
|
|
{
|
|
"entropy": 1.0788703871890903,
|
|
"epoch": 0.8636333022235478,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.6887851611749005e-05,
|
|
"loss": 1.0604,
|
|
"mean_token_accuracy": 0.706576419994235,
|
|
"num_tokens": 210259673.0,
|
|
"step": 2805
|
|
},
|
|
{
|
|
"entropy": 1.1228289678692818,
|
|
"epoch": 0.8651727555251941,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.6876102655976492e-05,
|
|
"loss": 1.1182,
|
|
"mean_token_accuracy": 0.6995963159948587,
|
|
"num_tokens": 210620500.0,
|
|
"step": 2810
|
|
},
|
|
{
|
|
"entropy": 1.1059047624468803,
|
|
"epoch": 0.8667122088268404,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.6864335668426373e-05,
|
|
"loss": 1.1059,
|
|
"mean_token_accuracy": 0.7024442825466395,
|
|
"num_tokens": 211012574.0,
|
|
"step": 2815
|
|
},
|
|
{
|
|
"entropy": 1.1174401119351387,
|
|
"epoch": 0.8682516621284866,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.68525506799562e-05,
|
|
"loss": 1.1297,
|
|
"mean_token_accuracy": 0.6935884576290846,
|
|
"num_tokens": 211378656.0,
|
|
"step": 2820
|
|
},
|
|
{
|
|
"entropy": 1.0923995364457368,
|
|
"epoch": 0.8697911154301329,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.6840747721470733e-05,
|
|
"loss": 1.0902,
|
|
"mean_token_accuracy": 0.7031279694288969,
|
|
"num_tokens": 211748096.0,
|
|
"step": 2825
|
|
},
|
|
{
|
|
"entropy": 1.0991105940192938,
|
|
"epoch": 0.8713305687317792,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.6828926823921845e-05,
|
|
"loss": 1.0853,
|
|
"mean_token_accuracy": 0.7029936861246824,
|
|
"num_tokens": 212131750.0,
|
|
"step": 2830
|
|
},
|
|
{
|
|
"entropy": 1.1157667137682439,
|
|
"epoch": 0.8728700220334253,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.6817088018308477e-05,
|
|
"loss": 1.1162,
|
|
"mean_token_accuracy": 0.6973326183855534,
|
|
"num_tokens": 212507126.0,
|
|
"step": 2835
|
|
},
|
|
{
|
|
"entropy": 1.1045021768659353,
|
|
"epoch": 0.8744094753350716,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.6805231335676505e-05,
|
|
"loss": 1.1009,
|
|
"mean_token_accuracy": 0.7020870693027973,
|
|
"num_tokens": 212871116.0,
|
|
"step": 2840
|
|
},
|
|
{
|
|
"entropy": 1.1048178130760788,
|
|
"epoch": 0.8759489286367179,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.6793356807118695e-05,
|
|
"loss": 1.0877,
|
|
"mean_token_accuracy": 0.702137915417552,
|
|
"num_tokens": 213241519.0,
|
|
"step": 2845
|
|
},
|
|
{
|
|
"entropy": 1.099703123793006,
|
|
"epoch": 0.8774883819383641,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.6781464463774628e-05,
|
|
"loss": 1.0733,
|
|
"mean_token_accuracy": 0.70214060023427,
|
|
"num_tokens": 213623745.0,
|
|
"step": 2850
|
|
},
|
|
{
|
|
"entropy": 1.1110018253326417,
|
|
"epoch": 0.8790278352400104,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.6769554336830577e-05,
|
|
"loss": 1.1057,
|
|
"mean_token_accuracy": 0.6998776510357857,
|
|
"num_tokens": 213997461.0,
|
|
"step": 2855
|
|
},
|
|
{
|
|
"entropy": 1.1340667808428406,
|
|
"epoch": 0.8805672885416567,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.675762645751946e-05,
|
|
"loss": 1.1343,
|
|
"mean_token_accuracy": 0.692723986506462,
|
|
"num_tokens": 214370570.0,
|
|
"step": 2860
|
|
},
|
|
{
|
|
"entropy": 1.0941222723573447,
|
|
"epoch": 0.8821067418433028,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.6745680857120757e-05,
|
|
"loss": 1.077,
|
|
"mean_token_accuracy": 0.7049151591956615,
|
|
"num_tokens": 214748557.0,
|
|
"step": 2865
|
|
},
|
|
{
|
|
"entropy": 1.1092702638357879,
|
|
"epoch": 0.8836461951449491,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.673371756696041e-05,
|
|
"loss": 1.1077,
|
|
"mean_token_accuracy": 0.6991445735096932,
|
|
"num_tokens": 215124225.0,
|
|
"step": 2870
|
|
},
|
|
{
|
|
"entropy": 1.0871345413848759,
|
|
"epoch": 0.8851856484465954,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.672173661841075e-05,
|
|
"loss": 1.0845,
|
|
"mean_token_accuracy": 0.7042425669729709,
|
|
"num_tokens": 215507111.0,
|
|
"step": 2875
|
|
},
|
|
{
|
|
"entropy": 1.148904792405665,
|
|
"epoch": 0.8867251017482417,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.670973804289042e-05,
|
|
"loss": 1.1502,
|
|
"mean_token_accuracy": 0.6910400237888098,
|
|
"num_tokens": 215875633.0,
|
|
"step": 2880
|
|
},
|
|
{
|
|
"entropy": 1.15465437322855,
|
|
"epoch": 0.8882645550498879,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.6697721871864286e-05,
|
|
"loss": 1.1557,
|
|
"mean_token_accuracy": 0.6898221826180816,
|
|
"num_tokens": 216254799.0,
|
|
"step": 2885
|
|
},
|
|
{
|
|
"entropy": 1.1274722613394261,
|
|
"epoch": 0.8898040083515342,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.6685688136843355e-05,
|
|
"loss": 1.1143,
|
|
"mean_token_accuracy": 0.6991093195974827,
|
|
"num_tokens": 216630501.0,
|
|
"step": 2890
|
|
},
|
|
{
|
|
"entropy": 1.1437790846452116,
|
|
"epoch": 0.8913434616531805,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.667363686938469e-05,
|
|
"loss": 1.1427,
|
|
"mean_token_accuracy": 0.6937702525407076,
|
|
"num_tokens": 216998378.0,
|
|
"step": 2895
|
|
},
|
|
{
|
|
"entropy": 1.1149624142795802,
|
|
"epoch": 0.8928829149548266,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.6661568101091345e-05,
|
|
"loss": 1.1057,
|
|
"mean_token_accuracy": 0.7003548592329025,
|
|
"num_tokens": 217369136.0,
|
|
"step": 2900
|
|
},
|
|
{
|
|
"entropy": 1.1179976981133222,
|
|
"epoch": 0.8944223682564729,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.664948186361225e-05,
|
|
"loss": 1.1073,
|
|
"mean_token_accuracy": 0.6955419234931469,
|
|
"num_tokens": 217739308.0,
|
|
"step": 2905
|
|
},
|
|
{
|
|
"entropy": 1.0808471154421568,
|
|
"epoch": 0.8959618215581192,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.6637378188642156e-05,
|
|
"loss": 1.0781,
|
|
"mean_token_accuracy": 0.7017045050859452,
|
|
"num_tokens": 218124777.0,
|
|
"step": 2910
|
|
},
|
|
{
|
|
"entropy": 1.0651660868898034,
|
|
"epoch": 0.8975012748597654,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 1.662525710792154e-05,
|
|
"loss": 1.0522,
|
|
"mean_token_accuracy": 0.7084551777690649,
|
|
"num_tokens": 218515006.0,
|
|
"step": 2915
|
|
},
|
|
{
|
|
"entropy": 1.0998478880152107,
|
|
"epoch": 0.8990407281614117,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.661311865323652e-05,
|
|
"loss": 1.0942,
|
|
"mean_token_accuracy": 0.7040021698921919,
|
|
"num_tokens": 218879337.0,
|
|
"step": 2920
|
|
},
|
|
{
|
|
"entropy": 1.0932244323194027,
|
|
"epoch": 0.900580181463058,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.6600962856418782e-05,
|
|
"loss": 1.087,
|
|
"mean_token_accuracy": 0.703185360506177,
|
|
"num_tokens": 219251883.0,
|
|
"step": 2925
|
|
},
|
|
{
|
|
"entropy": 1.1038317073136568,
|
|
"epoch": 0.9021196347647041,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.6588789749345487e-05,
|
|
"loss": 1.0918,
|
|
"mean_token_accuracy": 0.7009527865797281,
|
|
"num_tokens": 219632445.0,
|
|
"step": 2930
|
|
},
|
|
{
|
|
"entropy": 1.0950964797288179,
|
|
"epoch": 0.9036590880663504,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.6576599363939185e-05,
|
|
"loss": 1.0764,
|
|
"mean_token_accuracy": 0.7027178958058358,
|
|
"num_tokens": 220010934.0,
|
|
"step": 2935
|
|
},
|
|
{
|
|
"entropy": 1.101254301518202,
|
|
"epoch": 0.9051985413679967,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.6564391732167743e-05,
|
|
"loss": 1.0912,
|
|
"mean_token_accuracy": 0.7002034839242697,
|
|
"num_tokens": 220374695.0,
|
|
"step": 2940
|
|
},
|
|
{
|
|
"entropy": 1.0901438646018504,
|
|
"epoch": 0.9067379946696429,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.6552166886044253e-05,
|
|
"loss": 1.0903,
|
|
"mean_token_accuracy": 0.7034961324185133,
|
|
"num_tokens": 220739608.0,
|
|
"step": 2945
|
|
},
|
|
{
|
|
"entropy": 1.0934947073459624,
|
|
"epoch": 0.9082774479712892,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.6539924857626947e-05,
|
|
"loss": 1.0803,
|
|
"mean_token_accuracy": 0.7044488485902548,
|
|
"num_tokens": 221109955.0,
|
|
"step": 2950
|
|
},
|
|
{
|
|
"entropy": 1.0877722285687923,
|
|
"epoch": 0.9098169012729355,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.652766567901912e-05,
|
|
"loss": 1.0912,
|
|
"mean_token_accuracy": 0.7042174067348241,
|
|
"num_tokens": 221469786.0,
|
|
"step": 2955
|
|
},
|
|
{
|
|
"entropy": 1.1298996726050974,
|
|
"epoch": 0.9113563545745818,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.6515389382369034e-05,
|
|
"loss": 1.1242,
|
|
"mean_token_accuracy": 0.6937161698937416,
|
|
"num_tokens": 221837816.0,
|
|
"step": 2960
|
|
},
|
|
{
|
|
"entropy": 1.1138132132589817,
|
|
"epoch": 0.9128958078762279,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.650309599986985e-05,
|
|
"loss": 1.1076,
|
|
"mean_token_accuracy": 0.6995945759117603,
|
|
"num_tokens": 222203420.0,
|
|
"step": 2965
|
|
},
|
|
{
|
|
"entropy": 1.102806118503213,
|
|
"epoch": 0.9144352611778742,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 1.649078556375953e-05,
|
|
"loss": 1.0925,
|
|
"mean_token_accuracy": 0.6999370910227298,
|
|
"num_tokens": 222580138.0,
|
|
"step": 2970
|
|
},
|
|
{
|
|
"entropy": 1.1294960187748075,
|
|
"epoch": 0.9159747144795205,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.6478458106320755e-05,
|
|
"loss": 1.1236,
|
|
"mean_token_accuracy": 0.6974813371896744,
|
|
"num_tokens": 222953640.0,
|
|
"step": 2975
|
|
},
|
|
{
|
|
"entropy": 1.1324309218674897,
|
|
"epoch": 0.9175141677811667,
|
|
"grad_norm": 0.65234375,
|
|
"learning_rate": 1.6466113659880845e-05,
|
|
"loss": 1.1234,
|
|
"mean_token_accuracy": 0.6944039441645146,
|
|
"num_tokens": 223333549.0,
|
|
"step": 2980
|
|
},
|
|
{
|
|
"entropy": 1.0994510252028704,
|
|
"epoch": 0.919053621082813,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.6453752256811676e-05,
|
|
"loss": 1.1045,
|
|
"mean_token_accuracy": 0.6973139215260744,
|
|
"num_tokens": 223703963.0,
|
|
"step": 2985
|
|
},
|
|
{
|
|
"entropy": 1.137350879982114,
|
|
"epoch": 0.9205930743844593,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.6441373929529583e-05,
|
|
"loss": 1.1329,
|
|
"mean_token_accuracy": 0.6942195292562247,
|
|
"num_tokens": 224081482.0,
|
|
"step": 2990
|
|
},
|
|
{
|
|
"entropy": 1.1128303619101643,
|
|
"epoch": 0.9221325276861054,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.6428978710495286e-05,
|
|
"loss": 1.1036,
|
|
"mean_token_accuracy": 0.7014426335692405,
|
|
"num_tokens": 224448417.0,
|
|
"step": 2995
|
|
},
|
|
{
|
|
"entropy": 1.0825168298557402,
|
|
"epoch": 0.9236719809877517,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.6416566632213803e-05,
|
|
"loss": 1.0628,
|
|
"mean_token_accuracy": 0.7056166708469391,
|
|
"num_tokens": 224813610.0,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"entropy": 1.0959913771599532,
|
|
"epoch": 0.925211434289398,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.6404137727234366e-05,
|
|
"loss": 1.0949,
|
|
"mean_token_accuracy": 0.7023037023842335,
|
|
"num_tokens": 225192153.0,
|
|
"step": 3005
|
|
},
|
|
{
|
|
"entropy": 1.0896434228867293,
|
|
"epoch": 0.9267508875910442,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.6391692028150323e-05,
|
|
"loss": 1.0827,
|
|
"mean_token_accuracy": 0.7022975075989961,
|
|
"num_tokens": 225577668.0,
|
|
"step": 3010
|
|
},
|
|
{
|
|
"entropy": 1.1384891115128994,
|
|
"epoch": 0.9282903408926905,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.6379229567599072e-05,
|
|
"loss": 1.129,
|
|
"mean_token_accuracy": 0.695337663218379,
|
|
"num_tokens": 225962836.0,
|
|
"step": 3015
|
|
},
|
|
{
|
|
"entropy": 1.099364478327334,
|
|
"epoch": 0.9298297941943368,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.636675037826196e-05,
|
|
"loss": 1.0941,
|
|
"mean_token_accuracy": 0.701835821568966,
|
|
"num_tokens": 226344216.0,
|
|
"step": 3020
|
|
},
|
|
{
|
|
"entropy": 1.1219324097037315,
|
|
"epoch": 0.931369247495983,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.635425449286421e-05,
|
|
"loss": 1.1147,
|
|
"mean_token_accuracy": 0.6947548136115074,
|
|
"num_tokens": 226714910.0,
|
|
"step": 3025
|
|
},
|
|
{
|
|
"entropy": 1.12341584302485,
|
|
"epoch": 0.9329087007976292,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.6341741944174824e-05,
|
|
"loss": 1.1249,
|
|
"mean_token_accuracy": 0.6955896835774183,
|
|
"num_tokens": 227086456.0,
|
|
"step": 3030
|
|
},
|
|
{
|
|
"entropy": 1.1454509980976582,
|
|
"epoch": 0.9344481540992755,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.6329212765006503e-05,
|
|
"loss": 1.1434,
|
|
"mean_token_accuracy": 0.692763788253069,
|
|
"num_tokens": 227462478.0,
|
|
"step": 3035
|
|
},
|
|
{
|
|
"entropy": 1.1061009069904686,
|
|
"epoch": 0.9359876074009218,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.6316666988215558e-05,
|
|
"loss": 1.1083,
|
|
"mean_token_accuracy": 0.7021861042827368,
|
|
"num_tokens": 227832910.0,
|
|
"step": 3040
|
|
},
|
|
{
|
|
"entropy": 1.0905923018231989,
|
|
"epoch": 0.937527060702568,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.6304104646701818e-05,
|
|
"loss": 1.0791,
|
|
"mean_token_accuracy": 0.7025436852127314,
|
|
"num_tokens": 228197150.0,
|
|
"step": 3045
|
|
},
|
|
{
|
|
"entropy": 1.105141183361411,
|
|
"epoch": 0.9390665140042143,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.6291525773408576e-05,
|
|
"loss": 1.081,
|
|
"mean_token_accuracy": 0.7014652032405138,
|
|
"num_tokens": 228564387.0,
|
|
"step": 3050
|
|
},
|
|
{
|
|
"entropy": 1.093245293945074,
|
|
"epoch": 0.9406059673058605,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.6278930401322445e-05,
|
|
"loss": 1.0915,
|
|
"mean_token_accuracy": 0.7042498689144849,
|
|
"num_tokens": 228935148.0,
|
|
"step": 3055
|
|
},
|
|
{
|
|
"entropy": 1.1256541293114424,
|
|
"epoch": 0.9421454206075067,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.626631856347333e-05,
|
|
"loss": 1.1151,
|
|
"mean_token_accuracy": 0.6959347855299711,
|
|
"num_tokens": 229321596.0,
|
|
"step": 3060
|
|
},
|
|
{
|
|
"entropy": 1.1019672907888889,
|
|
"epoch": 0.943684873909153,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.6253690292934303e-05,
|
|
"loss": 1.0862,
|
|
"mean_token_accuracy": 0.7024039305746556,
|
|
"num_tokens": 229698077.0,
|
|
"step": 3065
|
|
},
|
|
{
|
|
"entropy": 1.1103874322026968,
|
|
"epoch": 0.9452243272107993,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.6241045622821526e-05,
|
|
"loss": 1.0971,
|
|
"mean_token_accuracy": 0.7011660991236568,
|
|
"num_tokens": 230066796.0,
|
|
"step": 3070
|
|
},
|
|
{
|
|
"entropy": 1.1184454999864102,
|
|
"epoch": 0.9467637805124455,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.6228384586294178e-05,
|
|
"loss": 1.1099,
|
|
"mean_token_accuracy": 0.6986790463328362,
|
|
"num_tokens": 230440474.0,
|
|
"step": 3075
|
|
},
|
|
{
|
|
"entropy": 1.1222109664231539,
|
|
"epoch": 0.9483032338140918,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.621570721655435e-05,
|
|
"loss": 1.1173,
|
|
"mean_token_accuracy": 0.6964509148150683,
|
|
"num_tokens": 230825384.0,
|
|
"step": 3080
|
|
},
|
|
{
|
|
"entropy": 1.0932182375341655,
|
|
"epoch": 0.949842687115738,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.6203013546846967e-05,
|
|
"loss": 1.1004,
|
|
"mean_token_accuracy": 0.7018071874976158,
|
|
"num_tokens": 231197174.0,
|
|
"step": 3085
|
|
},
|
|
{
|
|
"entropy": 1.0848873758688569,
|
|
"epoch": 0.9513821404173842,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.6190303610459696e-05,
|
|
"loss": 1.077,
|
|
"mean_token_accuracy": 0.7023764166980981,
|
|
"num_tokens": 231575969.0,
|
|
"step": 3090
|
|
},
|
|
{
|
|
"entropy": 1.119613417983055,
|
|
"epoch": 0.9529215937190305,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.6177577440722863e-05,
|
|
"loss": 1.1007,
|
|
"mean_token_accuracy": 0.7002534594386816,
|
|
"num_tokens": 231939206.0,
|
|
"step": 3095
|
|
},
|
|
{
|
|
"entropy": 1.143301498889923,
|
|
"epoch": 0.9544610470206768,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 1.6164835071009364e-05,
|
|
"loss": 1.1498,
|
|
"mean_token_accuracy": 0.6908706534653902,
|
|
"num_tokens": 232309662.0,
|
|
"step": 3100
|
|
},
|
|
{
|
|
"entropy": 1.1348078405484556,
|
|
"epoch": 0.9560005003223231,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.6152076534734585e-05,
|
|
"loss": 1.1165,
|
|
"mean_token_accuracy": 0.6982807531952858,
|
|
"num_tokens": 232680430.0,
|
|
"step": 3105
|
|
},
|
|
{
|
|
"entropy": 1.1175556883215905,
|
|
"epoch": 0.9575399536239693,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.6139301865356292e-05,
|
|
"loss": 1.1164,
|
|
"mean_token_accuracy": 0.6980854213237763,
|
|
"num_tokens": 233040916.0,
|
|
"step": 3110
|
|
},
|
|
{
|
|
"entropy": 1.0916607104241849,
|
|
"epoch": 0.9590794069256156,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.612651109637457e-05,
|
|
"loss": 1.074,
|
|
"mean_token_accuracy": 0.7059085302054882,
|
|
"num_tokens": 233422778.0,
|
|
"step": 3115
|
|
},
|
|
{
|
|
"entropy": 1.1530342236161233,
|
|
"epoch": 0.9606188602272618,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.611370426133172e-05,
|
|
"loss": 1.1506,
|
|
"mean_token_accuracy": 0.6922825556248426,
|
|
"num_tokens": 233783431.0,
|
|
"step": 3120
|
|
},
|
|
{
|
|
"entropy": 1.0918744718655944,
|
|
"epoch": 0.962158313528908,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.610088139381217e-05,
|
|
"loss": 1.0871,
|
|
"mean_token_accuracy": 0.7025839403271675,
|
|
"num_tokens": 234157549.0,
|
|
"step": 3125
|
|
},
|
|
{
|
|
"entropy": 1.1136182451620698,
|
|
"epoch": 0.9636977668305543,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.60880425274424e-05,
|
|
"loss": 1.1022,
|
|
"mean_token_accuracy": 0.6993775106966496,
|
|
"num_tokens": 234533593.0,
|
|
"step": 3130
|
|
},
|
|
{
|
|
"entropy": 1.1217090966179968,
|
|
"epoch": 0.9652372201322006,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.6075187695890837e-05,
|
|
"loss": 1.1123,
|
|
"mean_token_accuracy": 0.6977352771908045,
|
|
"num_tokens": 234901573.0,
|
|
"step": 3135
|
|
},
|
|
{
|
|
"entropy": 1.1311538334935904,
|
|
"epoch": 0.9667766734338468,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.6062316932867777e-05,
|
|
"loss": 1.1157,
|
|
"mean_token_accuracy": 0.6953879836946726,
|
|
"num_tokens": 235276736.0,
|
|
"step": 3140
|
|
},
|
|
{
|
|
"entropy": 1.1336469167843461,
|
|
"epoch": 0.968316126735493,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.60494302721253e-05,
|
|
"loss": 1.1228,
|
|
"mean_token_accuracy": 0.6957072228193283,
|
|
"num_tokens": 235637944.0,
|
|
"step": 3145
|
|
},
|
|
{
|
|
"entropy": 1.1148815231397748,
|
|
"epoch": 0.9698555800371393,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.6036527747457172e-05,
|
|
"loss": 1.1195,
|
|
"mean_token_accuracy": 0.696688824146986,
|
|
"num_tokens": 236004424.0,
|
|
"step": 3150
|
|
},
|
|
{
|
|
"entropy": 1.0731347337365151,
|
|
"epoch": 0.9713950333387855,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.6023609392698753e-05,
|
|
"loss": 1.0624,
|
|
"mean_token_accuracy": 0.7073259465396404,
|
|
"num_tokens": 236373459.0,
|
|
"step": 3155
|
|
},
|
|
{
|
|
"entropy": 1.1305216647684575,
|
|
"epoch": 0.9729344866404318,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.601067524172693e-05,
|
|
"loss": 1.135,
|
|
"mean_token_accuracy": 0.6961314767599106,
|
|
"num_tokens": 236737997.0,
|
|
"step": 3160
|
|
},
|
|
{
|
|
"entropy": 1.0698123347014188,
|
|
"epoch": 0.9744739399420781,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.599772532846e-05,
|
|
"loss": 1.062,
|
|
"mean_token_accuracy": 0.7111779380589723,
|
|
"num_tokens": 237114157.0,
|
|
"step": 3165
|
|
},
|
|
{
|
|
"entropy": 1.104625035636127,
|
|
"epoch": 0.9760133932437243,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.5984759686857602e-05,
|
|
"loss": 1.0899,
|
|
"mean_token_accuracy": 0.7029267687350511,
|
|
"num_tokens": 237486042.0,
|
|
"step": 3170
|
|
},
|
|
{
|
|
"entropy": 1.1002591367810965,
|
|
"epoch": 0.9775528465453706,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.5971778350920622e-05,
|
|
"loss": 1.1151,
|
|
"mean_token_accuracy": 0.6989728376269341,
|
|
"num_tokens": 237869988.0,
|
|
"step": 3175
|
|
},
|
|
{
|
|
"entropy": 1.1284619925543666,
|
|
"epoch": 0.9790922998470168,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.59587813546911e-05,
|
|
"loss": 1.1141,
|
|
"mean_token_accuracy": 0.6970653466880321,
|
|
"num_tokens": 238251465.0,
|
|
"step": 3180
|
|
},
|
|
{
|
|
"entropy": 1.0933161690831183,
|
|
"epoch": 0.9806317531486631,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.5945768732252144e-05,
|
|
"loss": 1.0765,
|
|
"mean_token_accuracy": 0.7060096051543951,
|
|
"num_tokens": 238609740.0,
|
|
"step": 3185
|
|
},
|
|
{
|
|
"entropy": 1.0971500884741545,
|
|
"epoch": 0.9821712064503093,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.5932740517727835e-05,
|
|
"loss": 1.093,
|
|
"mean_token_accuracy": 0.7040771137923002,
|
|
"num_tokens": 238990674.0,
|
|
"step": 3190
|
|
},
|
|
{
|
|
"entropy": 1.1219343401491642,
|
|
"epoch": 0.9837106597519556,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.5919696745283154e-05,
|
|
"loss": 1.1152,
|
|
"mean_token_accuracy": 0.6963998835533858,
|
|
"num_tokens": 239362660.0,
|
|
"step": 3195
|
|
},
|
|
{
|
|
"entropy": 1.1336881577968598,
|
|
"epoch": 0.9852501130536019,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.5906637449123864e-05,
|
|
"loss": 1.1267,
|
|
"mean_token_accuracy": 0.695428854227066,
|
|
"num_tokens": 239742807.0,
|
|
"step": 3200
|
|
},
|
|
{
|
|
"entropy": 1.1454315075650812,
|
|
"epoch": 0.9867895663552481,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.589356266349645e-05,
|
|
"loss": 1.1388,
|
|
"mean_token_accuracy": 0.6935530882328749,
|
|
"num_tokens": 240117079.0,
|
|
"step": 3205
|
|
},
|
|
{
|
|
"entropy": 1.1146605210378766,
|
|
"epoch": 0.9883290196568943,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 1.5880472422688023e-05,
|
|
"loss": 1.0933,
|
|
"mean_token_accuracy": 0.69862554743886,
|
|
"num_tokens": 240508411.0,
|
|
"step": 3210
|
|
},
|
|
{
|
|
"entropy": 1.1043241050094366,
|
|
"epoch": 0.9898684729585406,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.5867366761026198e-05,
|
|
"loss": 1.0962,
|
|
"mean_token_accuracy": 0.6992103181779384,
|
|
"num_tokens": 240878729.0,
|
|
"step": 3215
|
|
},
|
|
{
|
|
"entropy": 1.1375742366537451,
|
|
"epoch": 0.9914079262601868,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.585424571287906e-05,
|
|
"loss": 1.1282,
|
|
"mean_token_accuracy": 0.6959919854998589,
|
|
"num_tokens": 241254983.0,
|
|
"step": 3220
|
|
},
|
|
{
|
|
"entropy": 1.1033312421292067,
|
|
"epoch": 0.9929473795618331,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.5841109312655017e-05,
|
|
"loss": 1.1034,
|
|
"mean_token_accuracy": 0.6991308070719242,
|
|
"num_tokens": 241613413.0,
|
|
"step": 3225
|
|
},
|
|
{
|
|
"entropy": 1.1465192284435033,
|
|
"epoch": 0.9944868328634794,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.582795759480275e-05,
|
|
"loss": 1.1459,
|
|
"mean_token_accuracy": 0.6932627018541098,
|
|
"num_tokens": 242001055.0,
|
|
"step": 3230
|
|
},
|
|
{
|
|
"entropy": 1.110090786218643,
|
|
"epoch": 0.9960262861651256,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.581479059381111e-05,
|
|
"loss": 1.0991,
|
|
"mean_token_accuracy": 0.7005109634250403,
|
|
"num_tokens": 242376518.0,
|
|
"step": 3235
|
|
},
|
|
{
|
|
"entropy": 1.1250158324837685,
|
|
"epoch": 0.9975657394667719,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 1.5801608344209012e-05,
|
|
"loss": 1.1132,
|
|
"mean_token_accuracy": 0.6980336494743824,
|
|
"num_tokens": 242748045.0,
|
|
"step": 3240
|
|
},
|
|
{
|
|
"entropy": 1.1198844194412232,
|
|
"epoch": 0.9991051927684181,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.578841088056538e-05,
|
|
"loss": 1.1037,
|
|
"mean_token_accuracy": 0.6987688016146422,
|
|
"num_tokens": 243106650.0,
|
|
"step": 3245
|
|
},
|
|
{
|
|
"entropy": 1.0790818838556862,
|
|
"epoch": 1.0006157813206584,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.5775198237489016e-05,
|
|
"loss": 1.0821,
|
|
"mean_token_accuracy": 0.7054923860130796,
|
|
"num_tokens": 243439850.0,
|
|
"step": 3250
|
|
},
|
|
{
|
|
"entropy": 1.1380303783342243,
|
|
"epoch": 1.0021552346223048,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.576197044962854e-05,
|
|
"loss": 1.1069,
|
|
"mean_token_accuracy": 0.6983545649796724,
|
|
"num_tokens": 243819045.0,
|
|
"step": 3255
|
|
},
|
|
{
|
|
"entropy": 1.1184853481128811,
|
|
"epoch": 1.003694687923951,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.574872755167229e-05,
|
|
"loss": 1.1113,
|
|
"mean_token_accuracy": 0.700910248234868,
|
|
"num_tokens": 244187786.0,
|
|
"step": 3260
|
|
},
|
|
{
|
|
"entropy": 1.1144864093512297,
|
|
"epoch": 1.0052341412255972,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.573546957834821e-05,
|
|
"loss": 1.1082,
|
|
"mean_token_accuracy": 0.7001832645386458,
|
|
"num_tokens": 244561413.0,
|
|
"step": 3265
|
|
},
|
|
{
|
|
"entropy": 1.0656934957951307,
|
|
"epoch": 1.0067735945272436,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.572219656442379e-05,
|
|
"loss": 1.0573,
|
|
"mean_token_accuracy": 0.7083818852901459,
|
|
"num_tokens": 244931946.0,
|
|
"step": 3270
|
|
},
|
|
{
|
|
"entropy": 1.1119527027010918,
|
|
"epoch": 1.0083130478288898,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.5708908544705973e-05,
|
|
"loss": 1.1102,
|
|
"mean_token_accuracy": 0.7011913001537323,
|
|
"num_tokens": 245292016.0,
|
|
"step": 3275
|
|
},
|
|
{
|
|
"entropy": 1.0942462753504514,
|
|
"epoch": 1.009852501130536,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.5695605554041035e-05,
|
|
"loss": 1.0912,
|
|
"mean_token_accuracy": 0.7022478103637695,
|
|
"num_tokens": 245678063.0,
|
|
"step": 3280
|
|
},
|
|
{
|
|
"entropy": 1.1299390774220228,
|
|
"epoch": 1.0113919544321823,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.5682287627314513e-05,
|
|
"loss": 1.1255,
|
|
"mean_token_accuracy": 0.6984323725104332,
|
|
"num_tokens": 246052415.0,
|
|
"step": 3285
|
|
},
|
|
{
|
|
"entropy": 1.086801677197218,
|
|
"epoch": 1.0129314077338285,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.566895479945113e-05,
|
|
"loss": 1.0716,
|
|
"mean_token_accuracy": 0.7040470905601979,
|
|
"num_tokens": 246431821.0,
|
|
"step": 3290
|
|
},
|
|
{
|
|
"entropy": 1.0988284349441528,
|
|
"epoch": 1.0144708610354747,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.565560710541466e-05,
|
|
"loss": 1.0975,
|
|
"mean_token_accuracy": 0.7010353293269873,
|
|
"num_tokens": 246798259.0,
|
|
"step": 3295
|
|
},
|
|
{
|
|
"entropy": 1.1112470647320152,
|
|
"epoch": 1.016010314337121,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.5642244580207877e-05,
|
|
"loss": 1.097,
|
|
"mean_token_accuracy": 0.7007181420922279,
|
|
"num_tokens": 247170864.0,
|
|
"step": 3300
|
|
},
|
|
{
|
|
"entropy": 1.0867752809077502,
|
|
"epoch": 1.0175497676387673,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.562886725887245e-05,
|
|
"loss": 1.0825,
|
|
"mean_token_accuracy": 0.7039108872413635,
|
|
"num_tokens": 247548714.0,
|
|
"step": 3305
|
|
},
|
|
{
|
|
"entropy": 1.1126468144357204,
|
|
"epoch": 1.0190892209404134,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.5615475176488843e-05,
|
|
"loss": 1.102,
|
|
"mean_token_accuracy": 0.6979229044169187,
|
|
"num_tokens": 247920202.0,
|
|
"step": 3310
|
|
},
|
|
{
|
|
"entropy": 1.1279393577948214,
|
|
"epoch": 1.0206286742420598,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.5602068368176233e-05,
|
|
"loss": 1.1142,
|
|
"mean_token_accuracy": 0.6973439697176218,
|
|
"num_tokens": 248287755.0,
|
|
"step": 3315
|
|
},
|
|
{
|
|
"entropy": 1.089619634114206,
|
|
"epoch": 1.022168127543706,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.558864686909241e-05,
|
|
"loss": 1.0762,
|
|
"mean_token_accuracy": 0.7067389722913504,
|
|
"num_tokens": 248663289.0,
|
|
"step": 3320
|
|
},
|
|
{
|
|
"entropy": 1.0786739451810718,
|
|
"epoch": 1.0237075808453522,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.5575210714433687e-05,
|
|
"loss": 1.0639,
|
|
"mean_token_accuracy": 0.7083170812577009,
|
|
"num_tokens": 249058665.0,
|
|
"step": 3325
|
|
},
|
|
{
|
|
"entropy": 1.083180119469762,
|
|
"epoch": 1.0252470341469986,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.5561759939434818e-05,
|
|
"loss": 1.0713,
|
|
"mean_token_accuracy": 0.7050989974290133,
|
|
"num_tokens": 249418923.0,
|
|
"step": 3330
|
|
},
|
|
{
|
|
"entropy": 1.0916719660162926,
|
|
"epoch": 1.0267864874486448,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.554829457936889e-05,
|
|
"loss": 1.1016,
|
|
"mean_token_accuracy": 0.7027929250150919,
|
|
"num_tokens": 249786573.0,
|
|
"step": 3335
|
|
},
|
|
{
|
|
"entropy": 1.0770644983276725,
|
|
"epoch": 1.0283259407502912,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.553481466954724e-05,
|
|
"loss": 1.0545,
|
|
"mean_token_accuracy": 0.7072896599769593,
|
|
"num_tokens": 250150055.0,
|
|
"step": 3340
|
|
},
|
|
{
|
|
"entropy": 1.0874699326232076,
|
|
"epoch": 1.0298653940519373,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.5521320245319364e-05,
|
|
"loss": 1.0778,
|
|
"mean_token_accuracy": 0.7057900652289391,
|
|
"num_tokens": 250528230.0,
|
|
"step": 3345
|
|
},
|
|
{
|
|
"entropy": 1.1083404203876852,
|
|
"epoch": 1.0314048473535835,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.5507811342072807e-05,
|
|
"loss": 1.0947,
|
|
"mean_token_accuracy": 0.7005495946854353,
|
|
"num_tokens": 250897457.0,
|
|
"step": 3350
|
|
},
|
|
{
|
|
"entropy": 1.0969204226508737,
|
|
"epoch": 1.03294430065523,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.5494287995233107e-05,
|
|
"loss": 1.0896,
|
|
"mean_token_accuracy": 0.7037246078252792,
|
|
"num_tokens": 251268849.0,
|
|
"step": 3355
|
|
},
|
|
{
|
|
"entropy": 1.1020029282197357,
|
|
"epoch": 1.034483753956876,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.5480750240263653e-05,
|
|
"loss": 1.101,
|
|
"mean_token_accuracy": 0.7017880592495203,
|
|
"num_tokens": 251649825.0,
|
|
"step": 3360
|
|
},
|
|
{
|
|
"entropy": 1.0707179462537169,
|
|
"epoch": 1.0360232072585223,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.5467198112665632e-05,
|
|
"loss": 1.057,
|
|
"mean_token_accuracy": 0.70832026489079,
|
|
"num_tokens": 252017005.0,
|
|
"step": 3365
|
|
},
|
|
{
|
|
"entropy": 1.1088285092264414,
|
|
"epoch": 1.0375626605601687,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.545363164797792e-05,
|
|
"loss": 1.0969,
|
|
"mean_token_accuracy": 0.7014712538570166,
|
|
"num_tokens": 252391928.0,
|
|
"step": 3370
|
|
},
|
|
{
|
|
"entropy": 1.1104559611529112,
|
|
"epoch": 1.0391021138618148,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.544005088177699e-05,
|
|
"loss": 1.1055,
|
|
"mean_token_accuracy": 0.7030448831617833,
|
|
"num_tokens": 252767948.0,
|
|
"step": 3375
|
|
},
|
|
{
|
|
"entropy": 1.071060193143785,
|
|
"epoch": 1.040641567163461,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.5426455849676814e-05,
|
|
"loss": 1.0729,
|
|
"mean_token_accuracy": 0.7063076078891755,
|
|
"num_tokens": 253142814.0,
|
|
"step": 3380
|
|
},
|
|
{
|
|
"entropy": 1.1031985484063624,
|
|
"epoch": 1.0421810204651074,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.541284658732878e-05,
|
|
"loss": 1.0926,
|
|
"mean_token_accuracy": 0.7044143036007882,
|
|
"num_tokens": 253492628.0,
|
|
"step": 3385
|
|
},
|
|
{
|
|
"entropy": 1.1096234690397977,
|
|
"epoch": 1.0437204737667536,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.5399223130421603e-05,
|
|
"loss": 1.1033,
|
|
"mean_token_accuracy": 0.7006593316793441,
|
|
"num_tokens": 253863343.0,
|
|
"step": 3390
|
|
},
|
|
{
|
|
"entropy": 1.123650367371738,
|
|
"epoch": 1.0452599270683998,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.5385585514681193e-05,
|
|
"loss": 1.1068,
|
|
"mean_token_accuracy": 0.7009589888155461,
|
|
"num_tokens": 254232726.0,
|
|
"step": 3395
|
|
},
|
|
{
|
|
"entropy": 1.068775920011103,
|
|
"epoch": 1.0467993803700462,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.5371933775870617e-05,
|
|
"loss": 1.0529,
|
|
"mean_token_accuracy": 0.7107639875262975,
|
|
"num_tokens": 254598584.0,
|
|
"step": 3400
|
|
},
|
|
{
|
|
"entropy": 1.1284779205918312,
|
|
"epoch": 1.0483388336716923,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.5358267949789968e-05,
|
|
"loss": 1.1209,
|
|
"mean_token_accuracy": 0.6933364421129227,
|
|
"num_tokens": 254972956.0,
|
|
"step": 3405
|
|
},
|
|
{
|
|
"entropy": 1.0772378951311112,
|
|
"epoch": 1.0498782869733385,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.534458807227628e-05,
|
|
"loss": 1.0632,
|
|
"mean_token_accuracy": 0.7072331700474024,
|
|
"num_tokens": 255343282.0,
|
|
"step": 3410
|
|
},
|
|
{
|
|
"entropy": 1.0695318503305316,
|
|
"epoch": 1.051417740274985,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.5330894179203436e-05,
|
|
"loss": 1.0706,
|
|
"mean_token_accuracy": 0.7079185370355845,
|
|
"num_tokens": 255725174.0,
|
|
"step": 3415
|
|
},
|
|
{
|
|
"entropy": 1.115126764588058,
|
|
"epoch": 1.052957193576631,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.5317186306482082e-05,
|
|
"loss": 1.1045,
|
|
"mean_token_accuracy": 0.6999828219413757,
|
|
"num_tokens": 256107670.0,
|
|
"step": 3420
|
|
},
|
|
{
|
|
"entropy": 1.079553702287376,
|
|
"epoch": 1.0544966468782773,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.5303464490059506e-05,
|
|
"loss": 1.0608,
|
|
"mean_token_accuracy": 0.705764663591981,
|
|
"num_tokens": 256478764.0,
|
|
"step": 3425
|
|
},
|
|
{
|
|
"entropy": 1.1074867418035865,
|
|
"epoch": 1.0560361001799237,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.5289728765919575e-05,
|
|
"loss": 1.1004,
|
|
"mean_token_accuracy": 0.6995379611849785,
|
|
"num_tokens": 256861547.0,
|
|
"step": 3430
|
|
},
|
|
{
|
|
"entropy": 1.0644168920814991,
|
|
"epoch": 1.0575755534815698,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.5275979170082627e-05,
|
|
"loss": 1.0493,
|
|
"mean_token_accuracy": 0.7086089801043272,
|
|
"num_tokens": 257233684.0,
|
|
"step": 3435
|
|
},
|
|
{
|
|
"entropy": 1.1241430930793286,
|
|
"epoch": 1.059115006783216,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 1.526221573860537e-05,
|
|
"loss": 1.1199,
|
|
"mean_token_accuracy": 0.6986060209572316,
|
|
"num_tokens": 257593259.0,
|
|
"step": 3440
|
|
},
|
|
{
|
|
"entropy": 1.1017340887337923,
|
|
"epoch": 1.0606544600848624,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.5248438507580806e-05,
|
|
"loss": 1.0838,
|
|
"mean_token_accuracy": 0.7036949813365936,
|
|
"num_tokens": 257972827.0,
|
|
"step": 3445
|
|
},
|
|
{
|
|
"entropy": 1.1030063794925808,
|
|
"epoch": 1.0621939133865086,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.5234647513138106e-05,
|
|
"loss": 1.0858,
|
|
"mean_token_accuracy": 0.7019711222499609,
|
|
"num_tokens": 258333006.0,
|
|
"step": 3450
|
|
},
|
|
{
|
|
"entropy": 1.1096134843304752,
|
|
"epoch": 1.0637333666881548,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.5220842791442558e-05,
|
|
"loss": 1.1048,
|
|
"mean_token_accuracy": 0.6985780593007803,
|
|
"num_tokens": 258702676.0,
|
|
"step": 3455
|
|
},
|
|
{
|
|
"entropy": 1.0898446917533875,
|
|
"epoch": 1.0652728199898012,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.5207024378695423e-05,
|
|
"loss": 1.0804,
|
|
"mean_token_accuracy": 0.7027714267373085,
|
|
"num_tokens": 259081794.0,
|
|
"step": 3460
|
|
},
|
|
{
|
|
"entropy": 1.090567890740931,
|
|
"epoch": 1.0668122732914473,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.5193192311133884e-05,
|
|
"loss": 1.0799,
|
|
"mean_token_accuracy": 0.7049614746123553,
|
|
"num_tokens": 259460345.0,
|
|
"step": 3465
|
|
},
|
|
{
|
|
"entropy": 1.1061916414648294,
|
|
"epoch": 1.0683517265930935,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.5179346625030929e-05,
|
|
"loss": 1.0817,
|
|
"mean_token_accuracy": 0.6996982850134372,
|
|
"num_tokens": 259848553.0,
|
|
"step": 3470
|
|
},
|
|
{
|
|
"entropy": 1.07463312856853,
|
|
"epoch": 1.06989117989474,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.5165487356695247e-05,
|
|
"loss": 1.0634,
|
|
"mean_token_accuracy": 0.7061924941837787,
|
|
"num_tokens": 260230396.0,
|
|
"step": 3475
|
|
},
|
|
{
|
|
"entropy": 1.1183871056884527,
|
|
"epoch": 1.071430633196386,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.515161454247116e-05,
|
|
"loss": 1.1159,
|
|
"mean_token_accuracy": 0.6978505562990904,
|
|
"num_tokens": 260622270.0,
|
|
"step": 3480
|
|
},
|
|
{
|
|
"entropy": 1.10673236399889,
|
|
"epoch": 1.0729700864980325,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.5137728218738504e-05,
|
|
"loss": 1.1018,
|
|
"mean_token_accuracy": 0.6978911388665437,
|
|
"num_tokens": 260994502.0,
|
|
"step": 3485
|
|
},
|
|
{
|
|
"entropy": 1.0810140335932374,
|
|
"epoch": 1.0745095397996787,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.5123828421912545e-05,
|
|
"loss": 1.0822,
|
|
"mean_token_accuracy": 0.704467673227191,
|
|
"num_tokens": 261392623.0,
|
|
"step": 3490
|
|
},
|
|
{
|
|
"entropy": 1.1192033480852843,
|
|
"epoch": 1.0760489931013248,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.5109915188443877e-05,
|
|
"loss": 1.1124,
|
|
"mean_token_accuracy": 0.6981711078435182,
|
|
"num_tokens": 261772045.0,
|
|
"step": 3495
|
|
},
|
|
{
|
|
"entropy": 1.0997706385329367,
|
|
"epoch": 1.0775884464029712,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.5095988554818335e-05,
|
|
"loss": 1.0844,
|
|
"mean_token_accuracy": 0.7032960936427116,
|
|
"num_tokens": 262148618.0,
|
|
"step": 3500
|
|
},
|
|
{
|
|
"entropy": 1.0644664347171784,
|
|
"epoch": 1.0791278997046174,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.5082048557556892e-05,
|
|
"loss": 1.0571,
|
|
"mean_token_accuracy": 0.7109281823039055,
|
|
"num_tokens": 262518491.0,
|
|
"step": 3505
|
|
},
|
|
{
|
|
"entropy": 1.1189897157251836,
|
|
"epoch": 1.0806673530062636,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.5068095233215569e-05,
|
|
"loss": 1.1039,
|
|
"mean_token_accuracy": 0.7006072781980037,
|
|
"num_tokens": 262877915.0,
|
|
"step": 3510
|
|
},
|
|
{
|
|
"entropy": 1.0769080670550466,
|
|
"epoch": 1.08220680630791,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.5054128618385324e-05,
|
|
"loss": 1.0731,
|
|
"mean_token_accuracy": 0.7063977219164371,
|
|
"num_tokens": 263255026.0,
|
|
"step": 3515
|
|
},
|
|
{
|
|
"entropy": 1.1102627951651811,
|
|
"epoch": 1.0837462596095562,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.5040148749691983e-05,
|
|
"loss": 1.1111,
|
|
"mean_token_accuracy": 0.699586209654808,
|
|
"num_tokens": 263655337.0,
|
|
"step": 3520
|
|
},
|
|
{
|
|
"entropy": 1.1181556399911643,
|
|
"epoch": 1.0852857129112023,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.5026155663796123e-05,
|
|
"loss": 1.1126,
|
|
"mean_token_accuracy": 0.7016866445541382,
|
|
"num_tokens": 264031676.0,
|
|
"step": 3525
|
|
},
|
|
{
|
|
"entropy": 1.12592663615942,
|
|
"epoch": 1.0868251662128487,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.5012149397392977e-05,
|
|
"loss": 1.1157,
|
|
"mean_token_accuracy": 0.6999137448146939,
|
|
"num_tokens": 264421610.0,
|
|
"step": 3530
|
|
},
|
|
{
|
|
"entropy": 1.0964605376124381,
|
|
"epoch": 1.088364619514495,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.4998129987212344e-05,
|
|
"loss": 1.0927,
|
|
"mean_token_accuracy": 0.7018980991095305,
|
|
"num_tokens": 264795627.0,
|
|
"step": 3535
|
|
},
|
|
{
|
|
"entropy": 1.0974158430472016,
|
|
"epoch": 1.089904072816141,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.4984097470018496e-05,
|
|
"loss": 1.1027,
|
|
"mean_token_accuracy": 0.6999371856451034,
|
|
"num_tokens": 265170809.0,
|
|
"step": 3540
|
|
},
|
|
{
|
|
"entropy": 1.0960556104779244,
|
|
"epoch": 1.0914435261177875,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.4970051882610073e-05,
|
|
"loss": 1.0865,
|
|
"mean_token_accuracy": 0.7036111738532782,
|
|
"num_tokens": 265551705.0,
|
|
"step": 3545
|
|
},
|
|
{
|
|
"entropy": 1.0820874767377973,
|
|
"epoch": 1.0929829794194337,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.4955993261819988e-05,
|
|
"loss": 1.0914,
|
|
"mean_token_accuracy": 0.70390057079494,
|
|
"num_tokens": 265916997.0,
|
|
"step": 3550
|
|
},
|
|
{
|
|
"entropy": 1.0396881414577366,
|
|
"epoch": 1.0945224327210799,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.4941921644515338e-05,
|
|
"loss": 1.0376,
|
|
"mean_token_accuracy": 0.7147219311445951,
|
|
"num_tokens": 266290736.0,
|
|
"step": 3555
|
|
},
|
|
{
|
|
"entropy": 1.0917097030207514,
|
|
"epoch": 1.0960618860227263,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.4927837067597301e-05,
|
|
"loss": 1.0735,
|
|
"mean_token_accuracy": 0.7030528210103512,
|
|
"num_tokens": 266675917.0,
|
|
"step": 3560
|
|
},
|
|
{
|
|
"entropy": 1.0518924606963993,
|
|
"epoch": 1.0976013393243724,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.4913739568001034e-05,
|
|
"loss": 1.0392,
|
|
"mean_token_accuracy": 0.7105511274188757,
|
|
"num_tokens": 267043257.0,
|
|
"step": 3565
|
|
},
|
|
{
|
|
"entropy": 1.0787627583369612,
|
|
"epoch": 1.0991407926260186,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.4899629182695587e-05,
|
|
"loss": 1.0656,
|
|
"mean_token_accuracy": 0.7066638015210629,
|
|
"num_tokens": 267413448.0,
|
|
"step": 3570
|
|
},
|
|
{
|
|
"entropy": 1.1016970597207547,
|
|
"epoch": 1.100680245927665,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.4885505948683801e-05,
|
|
"loss": 1.0929,
|
|
"mean_token_accuracy": 0.7007608834654093,
|
|
"num_tokens": 267785654.0,
|
|
"step": 3575
|
|
},
|
|
{
|
|
"entropy": 1.1083873145282268,
|
|
"epoch": 1.1022196992293112,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.4871369903002211e-05,
|
|
"loss": 1.0932,
|
|
"mean_token_accuracy": 0.7019945353269577,
|
|
"num_tokens": 268146865.0,
|
|
"step": 3580
|
|
},
|
|
{
|
|
"entropy": 1.134457977488637,
|
|
"epoch": 1.1037591525309574,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.485722108272095e-05,
|
|
"loss": 1.1346,
|
|
"mean_token_accuracy": 0.6938718508929014,
|
|
"num_tokens": 268524381.0,
|
|
"step": 3585
|
|
},
|
|
{
|
|
"entropy": 1.0996076967567205,
|
|
"epoch": 1.1052986058326038,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.4843059524943644e-05,
|
|
"loss": 1.0886,
|
|
"mean_token_accuracy": 0.7024534575641155,
|
|
"num_tokens": 268884631.0,
|
|
"step": 3590
|
|
},
|
|
{
|
|
"entropy": 1.105134224332869,
|
|
"epoch": 1.10683805913425,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.4828885266807335e-05,
|
|
"loss": 1.0943,
|
|
"mean_token_accuracy": 0.7044342806562781,
|
|
"num_tokens": 269265070.0,
|
|
"step": 3595
|
|
},
|
|
{
|
|
"entropy": 1.087464764341712,
|
|
"epoch": 1.108377512435896,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 1.4814698345482359e-05,
|
|
"loss": 1.0661,
|
|
"mean_token_accuracy": 0.7041431359946728,
|
|
"num_tokens": 269625648.0,
|
|
"step": 3600
|
|
},
|
|
{
|
|
"entropy": 1.0556759916245937,
|
|
"epoch": 1.1099169657375425,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.4800498798172263e-05,
|
|
"loss": 1.0575,
|
|
"mean_token_accuracy": 0.7074072834104299,
|
|
"num_tokens": 270000439.0,
|
|
"step": 3605
|
|
},
|
|
{
|
|
"entropy": 1.104642354696989,
|
|
"epoch": 1.1114564190391887,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.4786286662113704e-05,
|
|
"loss": 1.093,
|
|
"mean_token_accuracy": 0.70103506334126,
|
|
"num_tokens": 270382298.0,
|
|
"step": 3610
|
|
},
|
|
{
|
|
"entropy": 1.0876236338168384,
|
|
"epoch": 1.1129958723408349,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.4772061974576353e-05,
|
|
"loss": 1.078,
|
|
"mean_token_accuracy": 0.7041713990271091,
|
|
"num_tokens": 270758001.0,
|
|
"step": 3615
|
|
},
|
|
{
|
|
"entropy": 1.1207205276936292,
|
|
"epoch": 1.1145353256424813,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.4757824772862797e-05,
|
|
"loss": 1.1103,
|
|
"mean_token_accuracy": 0.6994964867830277,
|
|
"num_tokens": 271125595.0,
|
|
"step": 3620
|
|
},
|
|
{
|
|
"entropy": 1.1021299615502358,
|
|
"epoch": 1.1160747789441274,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.474357509430843e-05,
|
|
"loss": 1.0981,
|
|
"mean_token_accuracy": 0.7028808105736971,
|
|
"num_tokens": 271487570.0,
|
|
"step": 3625
|
|
},
|
|
{
|
|
"entropy": 1.0768470207229257,
|
|
"epoch": 1.1176142322457738,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.4729312976281385e-05,
|
|
"loss": 1.0715,
|
|
"mean_token_accuracy": 0.7054811583831906,
|
|
"num_tokens": 271846926.0,
|
|
"step": 3630
|
|
},
|
|
{
|
|
"entropy": 1.0420935848727821,
|
|
"epoch": 1.11915368554742,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 1.4715038456182394e-05,
|
|
"loss": 1.0222,
|
|
"mean_token_accuracy": 0.7153880059719085,
|
|
"num_tokens": 272211353.0,
|
|
"step": 3635
|
|
},
|
|
{
|
|
"entropy": 1.0648265935480594,
|
|
"epoch": 1.1206931388490662,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.4700751571444724e-05,
|
|
"loss": 1.0545,
|
|
"mean_token_accuracy": 0.7072536498308182,
|
|
"num_tokens": 272588511.0,
|
|
"step": 3640
|
|
},
|
|
{
|
|
"entropy": 1.1259229142218827,
|
|
"epoch": 1.1222325921507124,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.4686452359534067e-05,
|
|
"loss": 1.123,
|
|
"mean_token_accuracy": 0.6968998841941356,
|
|
"num_tokens": 272961381.0,
|
|
"step": 3645
|
|
},
|
|
{
|
|
"entropy": 1.1046750681474804,
|
|
"epoch": 1.1237720454523588,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.4672140857948436e-05,
|
|
"loss": 1.0893,
|
|
"mean_token_accuracy": 0.7021125748753547,
|
|
"num_tokens": 273333979.0,
|
|
"step": 3650
|
|
},
|
|
{
|
|
"entropy": 1.0746611554175616,
|
|
"epoch": 1.125311498754005,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.4657817104218075e-05,
|
|
"loss": 1.0637,
|
|
"mean_token_accuracy": 0.7094436049461365,
|
|
"num_tokens": 273723286.0,
|
|
"step": 3655
|
|
},
|
|
{
|
|
"entropy": 1.0648497132584454,
|
|
"epoch": 1.1268509520556513,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.4643481135905367e-05,
|
|
"loss": 1.055,
|
|
"mean_token_accuracy": 0.7079874064773322,
|
|
"num_tokens": 274117421.0,
|
|
"step": 3660
|
|
},
|
|
{
|
|
"entropy": 1.1093654725700617,
|
|
"epoch": 1.1283904053572975,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.4629132990604706e-05,
|
|
"loss": 1.0893,
|
|
"mean_token_accuracy": 0.7024959847331047,
|
|
"num_tokens": 274473536.0,
|
|
"step": 3665
|
|
},
|
|
{
|
|
"entropy": 1.072011518292129,
|
|
"epoch": 1.1299298586589437,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.4614772705942437e-05,
|
|
"loss": 1.0744,
|
|
"mean_token_accuracy": 0.7079994067549705,
|
|
"num_tokens": 274840225.0,
|
|
"step": 3670
|
|
},
|
|
{
|
|
"entropy": 1.071100211329758,
|
|
"epoch": 1.13146931196059,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 1.4600400319576734e-05,
|
|
"loss": 1.067,
|
|
"mean_token_accuracy": 0.7057722929865122,
|
|
"num_tokens": 275213917.0,
|
|
"step": 3675
|
|
},
|
|
{
|
|
"entropy": 1.09051328971982,
|
|
"epoch": 1.1330087652622363,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.4586015869197499e-05,
|
|
"loss": 1.0807,
|
|
"mean_token_accuracy": 0.705567728728056,
|
|
"num_tokens": 275579038.0,
|
|
"step": 3680
|
|
},
|
|
{
|
|
"entropy": 1.077046674862504,
|
|
"epoch": 1.1345482185638824,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.4571619392526279e-05,
|
|
"loss": 1.0648,
|
|
"mean_token_accuracy": 0.7068696942180395,
|
|
"num_tokens": 275959239.0,
|
|
"step": 3685
|
|
},
|
|
{
|
|
"entropy": 1.0694725250825285,
|
|
"epoch": 1.1360876718655288,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.4557210927316157e-05,
|
|
"loss": 1.0616,
|
|
"mean_token_accuracy": 0.7077067773789167,
|
|
"num_tokens": 276330200.0,
|
|
"step": 3690
|
|
},
|
|
{
|
|
"entropy": 1.1030939321964979,
|
|
"epoch": 1.137627125167175,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.4542790511351652e-05,
|
|
"loss": 1.0958,
|
|
"mean_token_accuracy": 0.7006549630314112,
|
|
"num_tokens": 276694719.0,
|
|
"step": 3695
|
|
},
|
|
{
|
|
"entropy": 1.0825718816369772,
|
|
"epoch": 1.1391665784688212,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.4528358182448621e-05,
|
|
"loss": 1.0753,
|
|
"mean_token_accuracy": 0.7074236158281565,
|
|
"num_tokens": 277065169.0,
|
|
"step": 3700
|
|
},
|
|
{
|
|
"entropy": 1.08927030172199,
|
|
"epoch": 1.1407060317704676,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.4513913978454169e-05,
|
|
"loss": 1.0889,
|
|
"mean_token_accuracy": 0.7043962199240923,
|
|
"num_tokens": 277440519.0,
|
|
"step": 3705
|
|
},
|
|
{
|
|
"entropy": 1.09373946338892,
|
|
"epoch": 1.1422454850721138,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.4499457937246537e-05,
|
|
"loss": 1.0934,
|
|
"mean_token_accuracy": 0.7008316054940223,
|
|
"num_tokens": 277826775.0,
|
|
"step": 3710
|
|
},
|
|
{
|
|
"entropy": 1.0762307036668062,
|
|
"epoch": 1.14378493837376,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.4484990096735002e-05,
|
|
"loss": 1.0639,
|
|
"mean_token_accuracy": 0.7074637677520513,
|
|
"num_tokens": 278192561.0,
|
|
"step": 3715
|
|
},
|
|
{
|
|
"entropy": 1.0538242898881436,
|
|
"epoch": 1.1453243916754063,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.4470510494859796e-05,
|
|
"loss": 1.0455,
|
|
"mean_token_accuracy": 0.7116703744977713,
|
|
"num_tokens": 278555749.0,
|
|
"step": 3720
|
|
},
|
|
{
|
|
"entropy": 1.102267589047551,
|
|
"epoch": 1.1468638449770525,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.445601916959198e-05,
|
|
"loss": 1.0909,
|
|
"mean_token_accuracy": 0.7021027714014053,
|
|
"num_tokens": 278927881.0,
|
|
"step": 3725
|
|
},
|
|
{
|
|
"entropy": 1.0908799674361944,
|
|
"epoch": 1.1484032982786987,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.4441516158933374e-05,
|
|
"loss": 1.0848,
|
|
"mean_token_accuracy": 0.7060389311984181,
|
|
"num_tokens": 279290842.0,
|
|
"step": 3730
|
|
},
|
|
{
|
|
"entropy": 1.0705156188458205,
|
|
"epoch": 1.149942751580345,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.4427001500916422e-05,
|
|
"loss": 1.0644,
|
|
"mean_token_accuracy": 0.7053807284682989,
|
|
"num_tokens": 279675661.0,
|
|
"step": 3735
|
|
},
|
|
{
|
|
"entropy": 1.0985583700239658,
|
|
"epoch": 1.1514822048819913,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.441247523360413e-05,
|
|
"loss": 1.0854,
|
|
"mean_token_accuracy": 0.7020877465605736,
|
|
"num_tokens": 280056192.0,
|
|
"step": 3740
|
|
},
|
|
{
|
|
"entropy": 1.110937137156725,
|
|
"epoch": 1.1530216581836374,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.439793739508994e-05,
|
|
"loss": 1.091,
|
|
"mean_token_accuracy": 0.7005519773811102,
|
|
"num_tokens": 280439934.0,
|
|
"step": 3745
|
|
},
|
|
{
|
|
"entropy": 1.0774476202204823,
|
|
"epoch": 1.1545611114852838,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.4383388023497635e-05,
|
|
"loss": 1.0771,
|
|
"mean_token_accuracy": 0.7086040396243334,
|
|
"num_tokens": 280809278.0,
|
|
"step": 3750
|
|
},
|
|
{
|
|
"entropy": 1.0923065768554807,
|
|
"epoch": 1.15610056478693,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.436882715698125e-05,
|
|
"loss": 1.0936,
|
|
"mean_token_accuracy": 0.7011645477265119,
|
|
"num_tokens": 281185731.0,
|
|
"step": 3755
|
|
},
|
|
{
|
|
"entropy": 1.0968502664938569,
|
|
"epoch": 1.1576400180885762,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.4354254833724958e-05,
|
|
"loss": 1.0872,
|
|
"mean_token_accuracy": 0.7064242403954267,
|
|
"num_tokens": 281544422.0,
|
|
"step": 3760
|
|
},
|
|
{
|
|
"entropy": 1.10315215382725,
|
|
"epoch": 1.1591794713902226,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.433967109194298e-05,
|
|
"loss": 1.0876,
|
|
"mean_token_accuracy": 0.7011684492230416,
|
|
"num_tokens": 281917408.0,
|
|
"step": 3765
|
|
},
|
|
{
|
|
"entropy": 1.0998672913759946,
|
|
"epoch": 1.1607189246918688,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.4325075969879473e-05,
|
|
"loss": 1.0934,
|
|
"mean_token_accuracy": 0.703576971963048,
|
|
"num_tokens": 282298921.0,
|
|
"step": 3770
|
|
},
|
|
{
|
|
"entropy": 1.1076439332216979,
|
|
"epoch": 1.1622583779935152,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.4310469505808447e-05,
|
|
"loss": 1.1093,
|
|
"mean_token_accuracy": 0.7008686907589435,
|
|
"num_tokens": 282668103.0,
|
|
"step": 3775
|
|
},
|
|
{
|
|
"entropy": 1.0751024398952722,
|
|
"epoch": 1.1637978312951613,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.4295851738033655e-05,
|
|
"loss": 1.0533,
|
|
"mean_token_accuracy": 0.708766408637166,
|
|
"num_tokens": 283041394.0,
|
|
"step": 3780
|
|
},
|
|
{
|
|
"entropy": 1.125790061429143,
|
|
"epoch": 1.1653372845968075,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 1.428122270488848e-05,
|
|
"loss": 1.1117,
|
|
"mean_token_accuracy": 0.6996684454381465,
|
|
"num_tokens": 283407969.0,
|
|
"step": 3785
|
|
},
|
|
{
|
|
"entropy": 1.1088317811489106,
|
|
"epoch": 1.1668767378984537,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 1.4266582444735866e-05,
|
|
"loss": 1.0988,
|
|
"mean_token_accuracy": 0.7021414436399936,
|
|
"num_tokens": 283790471.0,
|
|
"step": 3790
|
|
},
|
|
{
|
|
"entropy": 1.1067815016955138,
|
|
"epoch": 1.1684161912001,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.4251930995968179e-05,
|
|
"loss": 1.103,
|
|
"mean_token_accuracy": 0.699557737633586,
|
|
"num_tokens": 284162486.0,
|
|
"step": 3795
|
|
},
|
|
{
|
|
"entropy": 1.1341670166701079,
|
|
"epoch": 1.1699556445017463,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.4237268397007145e-05,
|
|
"loss": 1.1297,
|
|
"mean_token_accuracy": 0.6976292546838522,
|
|
"num_tokens": 284551266.0,
|
|
"step": 3800
|
|
},
|
|
{
|
|
"entropy": 1.1079873451963067,
|
|
"epoch": 1.1714950978033927,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.4222594686303707e-05,
|
|
"loss": 1.0834,
|
|
"mean_token_accuracy": 0.7043620748445392,
|
|
"num_tokens": 284928528.0,
|
|
"step": 3805
|
|
},
|
|
{
|
|
"entropy": 1.1108773406594992,
|
|
"epoch": 1.1730345511050388,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.4207909902337978e-05,
|
|
"loss": 1.1072,
|
|
"mean_token_accuracy": 0.7001920165494084,
|
|
"num_tokens": 285294660.0,
|
|
"step": 3810
|
|
},
|
|
{
|
|
"entropy": 1.062958618067205,
|
|
"epoch": 1.174574004406685,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.4193214083619075e-05,
|
|
"loss": 1.0593,
|
|
"mean_token_accuracy": 0.7087547797709703,
|
|
"num_tokens": 285684946.0,
|
|
"step": 3815
|
|
},
|
|
{
|
|
"entropy": 1.1068306148052216,
|
|
"epoch": 1.1761134577083314,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.4178507268685082e-05,
|
|
"loss": 1.107,
|
|
"mean_token_accuracy": 0.7006458751857281,
|
|
"num_tokens": 286052105.0,
|
|
"step": 3820
|
|
},
|
|
{
|
|
"entropy": 1.1562053855508565,
|
|
"epoch": 1.1776529110099776,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.4163789496102902e-05,
|
|
"loss": 1.162,
|
|
"mean_token_accuracy": 0.6939568098634481,
|
|
"num_tokens": 286423234.0,
|
|
"step": 3825
|
|
},
|
|
{
|
|
"entropy": 1.091459297388792,
|
|
"epoch": 1.1791923643116238,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.4149060804468178e-05,
|
|
"loss": 1.0842,
|
|
"mean_token_accuracy": 0.7039418306201697,
|
|
"num_tokens": 286800888.0,
|
|
"step": 3830
|
|
},
|
|
{
|
|
"entropy": 1.0655298441648484,
|
|
"epoch": 1.1807318176132702,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.4134321232405185e-05,
|
|
"loss": 1.0594,
|
|
"mean_token_accuracy": 0.7100500397384166,
|
|
"num_tokens": 287181273.0,
|
|
"step": 3835
|
|
},
|
|
{
|
|
"entropy": 1.109318332746625,
|
|
"epoch": 1.1822712709149164,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.4119570818566735e-05,
|
|
"loss": 1.0964,
|
|
"mean_token_accuracy": 0.699808219820261,
|
|
"num_tokens": 287573395.0,
|
|
"step": 3840
|
|
},
|
|
{
|
|
"entropy": 1.0877777617424726,
|
|
"epoch": 1.1838107242165625,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.4104809601634069e-05,
|
|
"loss": 1.0803,
|
|
"mean_token_accuracy": 0.7033943865448237,
|
|
"num_tokens": 287952267.0,
|
|
"step": 3845
|
|
},
|
|
{
|
|
"entropy": 1.100570411980152,
|
|
"epoch": 1.185350177518209,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.4090037620316752e-05,
|
|
"loss": 1.0977,
|
|
"mean_token_accuracy": 0.7031412627547979,
|
|
"num_tokens": 288327604.0,
|
|
"step": 3850
|
|
},
|
|
{
|
|
"entropy": 1.0824162557721138,
|
|
"epoch": 1.186889630819855,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.407525491335259e-05,
|
|
"loss": 1.0867,
|
|
"mean_token_accuracy": 0.7073274951428175,
|
|
"num_tokens": 288699268.0,
|
|
"step": 3855
|
|
},
|
|
{
|
|
"entropy": 1.0807831861078738,
|
|
"epoch": 1.1884290841215013,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.4060461519507506e-05,
|
|
"loss": 1.0675,
|
|
"mean_token_accuracy": 0.7040595654398203,
|
|
"num_tokens": 289088327.0,
|
|
"step": 3860
|
|
},
|
|
{
|
|
"entropy": 1.0778952922672034,
|
|
"epoch": 1.1899685374231477,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.404565747757545e-05,
|
|
"loss": 1.0807,
|
|
"mean_token_accuracy": 0.7046718124300242,
|
|
"num_tokens": 289460784.0,
|
|
"step": 3865
|
|
},
|
|
{
|
|
"entropy": 1.105709740705788,
|
|
"epoch": 1.1915079907247939,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.4030842826378297e-05,
|
|
"loss": 1.0985,
|
|
"mean_token_accuracy": 0.6993788905441761,
|
|
"num_tokens": 289836163.0,
|
|
"step": 3870
|
|
},
|
|
{
|
|
"entropy": 1.0828698825091123,
|
|
"epoch": 1.19304744402644,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.4016017604765742e-05,
|
|
"loss": 1.0674,
|
|
"mean_token_accuracy": 0.7059365000575781,
|
|
"num_tokens": 290212352.0,
|
|
"step": 3875
|
|
},
|
|
{
|
|
"entropy": 1.1272259410470724,
|
|
"epoch": 1.1945868973280864,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.4001181851615203e-05,
|
|
"loss": 1.1078,
|
|
"mean_token_accuracy": 0.6969783172011376,
|
|
"num_tokens": 290595707.0,
|
|
"step": 3880
|
|
},
|
|
{
|
|
"entropy": 1.1166004659608006,
|
|
"epoch": 1.1961263506297326,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.3986335605831707e-05,
|
|
"loss": 1.1046,
|
|
"mean_token_accuracy": 0.7005794644355774,
|
|
"num_tokens": 290950788.0,
|
|
"step": 3885
|
|
},
|
|
{
|
|
"entropy": 1.10059260930866,
|
|
"epoch": 1.1976658039313788,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.3971478906347806e-05,
|
|
"loss": 1.0963,
|
|
"mean_token_accuracy": 0.703722882270813,
|
|
"num_tokens": 291324381.0,
|
|
"step": 3890
|
|
},
|
|
{
|
|
"entropy": 1.1057688169181348,
|
|
"epoch": 1.1992052572330252,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 1.3956611792123469e-05,
|
|
"loss": 1.1043,
|
|
"mean_token_accuracy": 0.7007663905620575,
|
|
"num_tokens": 291696879.0,
|
|
"step": 3895
|
|
},
|
|
{
|
|
"entropy": 1.0631301939487456,
|
|
"epoch": 1.2007447105346714,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.394173430214596e-05,
|
|
"loss": 1.0527,
|
|
"mean_token_accuracy": 0.7092026572674512,
|
|
"num_tokens": 292061900.0,
|
|
"step": 3900
|
|
},
|
|
{
|
|
"entropy": 1.0981714664027096,
|
|
"epoch": 1.2022841638363175,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.3926846475429767e-05,
|
|
"loss": 1.097,
|
|
"mean_token_accuracy": 0.7036932848393918,
|
|
"num_tokens": 292440222.0,
|
|
"step": 3905
|
|
},
|
|
{
|
|
"entropy": 1.0864885102957487,
|
|
"epoch": 1.203823617137964,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.3911948351016475e-05,
|
|
"loss": 1.0723,
|
|
"mean_token_accuracy": 0.7052678003907203,
|
|
"num_tokens": 292834119.0,
|
|
"step": 3910
|
|
},
|
|
{
|
|
"entropy": 1.1018056087195873,
|
|
"epoch": 1.20536307043961,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.3897039967974688e-05,
|
|
"loss": 1.1052,
|
|
"mean_token_accuracy": 0.6991815757006407,
|
|
"num_tokens": 293209771.0,
|
|
"step": 3915
|
|
},
|
|
{
|
|
"entropy": 1.10480572078377,
|
|
"epoch": 1.2069025237412565,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.3882121365399894e-05,
|
|
"loss": 1.1075,
|
|
"mean_token_accuracy": 0.6998530514538288,
|
|
"num_tokens": 293595862.0,
|
|
"step": 3920
|
|
},
|
|
{
|
|
"entropy": 1.0803724970668553,
|
|
"epoch": 1.2084419770429027,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.3867192582414393e-05,
|
|
"loss": 1.0597,
|
|
"mean_token_accuracy": 0.7073673088103533,
|
|
"num_tokens": 293963946.0,
|
|
"step": 3925
|
|
},
|
|
{
|
|
"entropy": 1.117409136891365,
|
|
"epoch": 1.2099814303445489,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 1.3852253658167178e-05,
|
|
"loss": 1.1043,
|
|
"mean_token_accuracy": 0.6973974499851465,
|
|
"num_tokens": 294339121.0,
|
|
"step": 3930
|
|
},
|
|
{
|
|
"entropy": 1.1202900214120746,
|
|
"epoch": 1.211520883646195,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.3837304631833832e-05,
|
|
"loss": 1.1237,
|
|
"mean_token_accuracy": 0.6978885032236576,
|
|
"num_tokens": 294715492.0,
|
|
"step": 3935
|
|
},
|
|
{
|
|
"entropy": 1.072257279790938,
|
|
"epoch": 1.2130603369478414,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.3822345542616443e-05,
|
|
"loss": 1.0769,
|
|
"mean_token_accuracy": 0.7074934743344784,
|
|
"num_tokens": 295073986.0,
|
|
"step": 3940
|
|
},
|
|
{
|
|
"entropy": 1.1001626962795854,
|
|
"epoch": 1.2145997902494876,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.3807376429743467e-05,
|
|
"loss": 1.0944,
|
|
"mean_token_accuracy": 0.7036080248653889,
|
|
"num_tokens": 295449555.0,
|
|
"step": 3945
|
|
},
|
|
{
|
|
"entropy": 1.088081386126578,
|
|
"epoch": 1.216139243551134,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.3792397332469667e-05,
|
|
"loss": 1.0871,
|
|
"mean_token_accuracy": 0.7042498320341111,
|
|
"num_tokens": 295821464.0,
|
|
"step": 3950
|
|
},
|
|
{
|
|
"entropy": 1.1149036642163992,
|
|
"epoch": 1.2176786968527802,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.377740829007597e-05,
|
|
"loss": 1.1149,
|
|
"mean_token_accuracy": 0.7015709541738033,
|
|
"num_tokens": 296187517.0,
|
|
"step": 3955
|
|
},
|
|
{
|
|
"entropy": 1.0869786012917757,
|
|
"epoch": 1.2192181501544264,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.3762409341869404e-05,
|
|
"loss": 1.0821,
|
|
"mean_token_accuracy": 0.7066392619162798,
|
|
"num_tokens": 296562886.0,
|
|
"step": 3960
|
|
},
|
|
{
|
|
"entropy": 1.108170660212636,
|
|
"epoch": 1.2207576034560725,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.3747400527182952e-05,
|
|
"loss": 1.0985,
|
|
"mean_token_accuracy": 0.7013059981167317,
|
|
"num_tokens": 296936231.0,
|
|
"step": 3965
|
|
},
|
|
{
|
|
"entropy": 1.0889248762279748,
|
|
"epoch": 1.222297056757719,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.3732381885375488e-05,
|
|
"loss": 1.0764,
|
|
"mean_token_accuracy": 0.7024991292506456,
|
|
"num_tokens": 297307474.0,
|
|
"step": 3970
|
|
},
|
|
{
|
|
"entropy": 1.1260383136570453,
|
|
"epoch": 1.2238365100593651,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.3717353455831643e-05,
|
|
"loss": 1.1166,
|
|
"mean_token_accuracy": 0.6974424548447132,
|
|
"num_tokens": 297683247.0,
|
|
"step": 3975
|
|
},
|
|
{
|
|
"entropy": 1.0552282366901635,
|
|
"epoch": 1.2253759633610115,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.3702315277961724e-05,
|
|
"loss": 1.0525,
|
|
"mean_token_accuracy": 0.7067247483879328,
|
|
"num_tokens": 298060015.0,
|
|
"step": 3980
|
|
},
|
|
{
|
|
"entropy": 1.0938646005466581,
|
|
"epoch": 1.2269154166626577,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 1.3687267391201604e-05,
|
|
"loss": 1.0785,
|
|
"mean_token_accuracy": 0.7049194592982531,
|
|
"num_tokens": 298425827.0,
|
|
"step": 3985
|
|
},
|
|
{
|
|
"entropy": 1.0813276052474976,
|
|
"epoch": 1.2284548699643039,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.3672209835012602e-05,
|
|
"loss": 1.0754,
|
|
"mean_token_accuracy": 0.7052431304007769,
|
|
"num_tokens": 298796982.0,
|
|
"step": 3990
|
|
},
|
|
{
|
|
"entropy": 1.1203918613493442,
|
|
"epoch": 1.2299943232659503,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.3657142648881414e-05,
|
|
"loss": 1.1066,
|
|
"mean_token_accuracy": 0.7010459274053573,
|
|
"num_tokens": 299172779.0,
|
|
"step": 3995
|
|
},
|
|
{
|
|
"entropy": 1.0993194514885545,
|
|
"epoch": 1.2315337765675964,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.3642065872319971e-05,
|
|
"loss": 1.0942,
|
|
"mean_token_accuracy": 0.7016201814636588,
|
|
"num_tokens": 299549995.0,
|
|
"step": 4000
|
|
},
|
|
{
|
|
"entropy": 1.0879132468253374,
|
|
"epoch": 1.2330732298692426,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.3626979544865369e-05,
|
|
"loss": 1.0739,
|
|
"mean_token_accuracy": 0.7027346216142177,
|
|
"num_tokens": 299924096.0,
|
|
"step": 4005
|
|
},
|
|
{
|
|
"entropy": 1.0912355059757828,
|
|
"epoch": 1.234612683170889,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.3611883706079735e-05,
|
|
"loss": 1.0701,
|
|
"mean_token_accuracy": 0.7062455844134092,
|
|
"num_tokens": 300293703.0,
|
|
"step": 4010
|
|
},
|
|
{
|
|
"entropy": 1.0860985442996025,
|
|
"epoch": 1.2361521364725352,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 1.3596778395550154e-05,
|
|
"loss": 1.0879,
|
|
"mean_token_accuracy": 0.7033099625259638,
|
|
"num_tokens": 300667916.0,
|
|
"step": 4015
|
|
},
|
|
{
|
|
"entropy": 1.10459204018116,
|
|
"epoch": 1.2376915897741814,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.3581663652888536e-05,
|
|
"loss": 1.0968,
|
|
"mean_token_accuracy": 0.702700025960803,
|
|
"num_tokens": 301040155.0,
|
|
"step": 4020
|
|
},
|
|
{
|
|
"entropy": 1.0972048163414,
|
|
"epoch": 1.2392310430758278,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.3566539517731536e-05,
|
|
"loss": 1.0859,
|
|
"mean_token_accuracy": 0.7038055300712586,
|
|
"num_tokens": 301428658.0,
|
|
"step": 4025
|
|
},
|
|
{
|
|
"entropy": 1.1335016749799252,
|
|
"epoch": 1.240770496377474,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.3551406029740435e-05,
|
|
"loss": 1.1263,
|
|
"mean_token_accuracy": 0.6956704515963793,
|
|
"num_tokens": 301815674.0,
|
|
"step": 4030
|
|
},
|
|
{
|
|
"entropy": 1.0878054179251193,
|
|
"epoch": 1.2423099496791201,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.3536263228601036e-05,
|
|
"loss": 1.0822,
|
|
"mean_token_accuracy": 0.7042242761701345,
|
|
"num_tokens": 302184720.0,
|
|
"step": 4035
|
|
},
|
|
{
|
|
"entropy": 1.1134215828031302,
|
|
"epoch": 1.2438494029807665,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.3521111154023573e-05,
|
|
"loss": 1.0983,
|
|
"mean_token_accuracy": 0.6978894144296646,
|
|
"num_tokens": 302569833.0,
|
|
"step": 4040
|
|
},
|
|
{
|
|
"entropy": 1.1078709946945309,
|
|
"epoch": 1.2453888562824127,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.3505949845742599e-05,
|
|
"loss": 1.1053,
|
|
"mean_token_accuracy": 0.7004428334534168,
|
|
"num_tokens": 302953234.0,
|
|
"step": 4045
|
|
},
|
|
{
|
|
"entropy": 1.101970660686493,
|
|
"epoch": 1.2469283095840589,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.349077934351687e-05,
|
|
"loss": 1.1017,
|
|
"mean_token_accuracy": 0.703122254833579,
|
|
"num_tokens": 303323574.0,
|
|
"step": 4050
|
|
},
|
|
{
|
|
"entropy": 1.0964781964197754,
|
|
"epoch": 1.2484677628857053,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.3475599687129265e-05,
|
|
"loss": 1.0883,
|
|
"mean_token_accuracy": 0.7021753527224064,
|
|
"num_tokens": 303694386.0,
|
|
"step": 4055
|
|
},
|
|
{
|
|
"entropy": 1.1142654318362475,
|
|
"epoch": 1.2500072161873514,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.3460410916386661e-05,
|
|
"loss": 1.097,
|
|
"mean_token_accuracy": 0.7025595799088478,
|
|
"num_tokens": 304057550.0,
|
|
"step": 4060
|
|
},
|
|
{
|
|
"entropy": 1.0823018303140999,
|
|
"epoch": 1.2515466694889978,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.3445213071119841e-05,
|
|
"loss": 1.0755,
|
|
"mean_token_accuracy": 0.7057725608348846,
|
|
"num_tokens": 304428244.0,
|
|
"step": 4065
|
|
},
|
|
{
|
|
"entropy": 1.0827654430642724,
|
|
"epoch": 1.253086122790644,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.3430006191183378e-05,
|
|
"loss": 1.0718,
|
|
"mean_token_accuracy": 0.7041387222707272,
|
|
"num_tokens": 304795321.0,
|
|
"step": 4070
|
|
},
|
|
{
|
|
"entropy": 1.087675553932786,
|
|
"epoch": 1.2546255760922902,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.3414790316455546e-05,
|
|
"loss": 1.0755,
|
|
"mean_token_accuracy": 0.7059319779276848,
|
|
"num_tokens": 305155851.0,
|
|
"step": 4075
|
|
},
|
|
{
|
|
"entropy": 1.1189695112407207,
|
|
"epoch": 1.2561650293939364,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.33995654868382e-05,
|
|
"loss": 1.1109,
|
|
"mean_token_accuracy": 0.697902848571539,
|
|
"num_tokens": 305529834.0,
|
|
"step": 4080
|
|
},
|
|
{
|
|
"entropy": 1.130313978344202,
|
|
"epoch": 1.2577044826955828,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.338433174225668e-05,
|
|
"loss": 1.1234,
|
|
"mean_token_accuracy": 0.6920732576400042,
|
|
"num_tokens": 305901433.0,
|
|
"step": 4085
|
|
},
|
|
{
|
|
"entropy": 1.1158683093264699,
|
|
"epoch": 1.259243935997229,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 1.336908912265971e-05,
|
|
"loss": 1.1119,
|
|
"mean_token_accuracy": 0.6996138449758291,
|
|
"num_tokens": 306256021.0,
|
|
"step": 4090
|
|
},
|
|
{
|
|
"entropy": 1.0976204611361027,
|
|
"epoch": 1.2607833892988753,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.335383766801928e-05,
|
|
"loss": 1.0974,
|
|
"mean_token_accuracy": 0.7025588437914848,
|
|
"num_tokens": 306638385.0,
|
|
"step": 4095
|
|
},
|
|
{
|
|
"entropy": 1.0980824884027243,
|
|
"epoch": 1.2623228426005215,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.3338577418330552e-05,
|
|
"loss": 1.097,
|
|
"mean_token_accuracy": 0.7022494181990624,
|
|
"num_tokens": 307020861.0,
|
|
"step": 4100
|
|
},
|
|
{
|
|
"entropy": 1.1165331147611142,
|
|
"epoch": 1.2638622959021677,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.3323308413611748e-05,
|
|
"loss": 1.1204,
|
|
"mean_token_accuracy": 0.6978170141577721,
|
|
"num_tokens": 307402322.0,
|
|
"step": 4105
|
|
},
|
|
{
|
|
"entropy": 1.0698299165815115,
|
|
"epoch": 1.2654017492038139,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.330803069390406e-05,
|
|
"loss": 1.0616,
|
|
"mean_token_accuracy": 0.7063970111310482,
|
|
"num_tokens": 307767960.0,
|
|
"step": 4110
|
|
},
|
|
{
|
|
"entropy": 1.1018039194867015,
|
|
"epoch": 1.2669412025054603,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.329274429927152e-05,
|
|
"loss": 1.088,
|
|
"mean_token_accuracy": 0.7032159678637981,
|
|
"num_tokens": 308132035.0,
|
|
"step": 4115
|
|
},
|
|
{
|
|
"entropy": 1.068551710061729,
|
|
"epoch": 1.2684806558071064,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.3277449269800924e-05,
|
|
"loss": 1.0623,
|
|
"mean_token_accuracy": 0.7077741719782352,
|
|
"num_tokens": 308513720.0,
|
|
"step": 4120
|
|
},
|
|
{
|
|
"entropy": 1.075303773023188,
|
|
"epoch": 1.2700201091087528,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.3262145645601693e-05,
|
|
"loss": 1.0695,
|
|
"mean_token_accuracy": 0.705178477242589,
|
|
"num_tokens": 308892864.0,
|
|
"step": 4125
|
|
},
|
|
{
|
|
"entropy": 1.0696294579654932,
|
|
"epoch": 1.271559562410399,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.3246833466805807e-05,
|
|
"loss": 1.0606,
|
|
"mean_token_accuracy": 0.7081389222294092,
|
|
"num_tokens": 309255759.0,
|
|
"step": 4130
|
|
},
|
|
{
|
|
"entropy": 1.1095837157219648,
|
|
"epoch": 1.2730990157120452,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.3231512773567667e-05,
|
|
"loss": 1.0926,
|
|
"mean_token_accuracy": 0.6996402077376842,
|
|
"num_tokens": 309625858.0,
|
|
"step": 4135
|
|
},
|
|
{
|
|
"entropy": 1.0998979141935705,
|
|
"epoch": 1.2746384690136914,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.3216183606064e-05,
|
|
"loss": 1.0815,
|
|
"mean_token_accuracy": 0.701217382773757,
|
|
"num_tokens": 310016897.0,
|
|
"step": 4140
|
|
},
|
|
{
|
|
"entropy": 1.090337529964745,
|
|
"epoch": 1.2761779223153378,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.320084600449377e-05,
|
|
"loss": 1.0798,
|
|
"mean_token_accuracy": 0.703149201348424,
|
|
"num_tokens": 310379094.0,
|
|
"step": 4145
|
|
},
|
|
{
|
|
"entropy": 1.169959270954132,
|
|
"epoch": 1.277717375616984,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.3185500009078038e-05,
|
|
"loss": 1.166,
|
|
"mean_token_accuracy": 0.6912180252373219,
|
|
"num_tokens": 310755617.0,
|
|
"step": 4150
|
|
},
|
|
{
|
|
"entropy": 1.095761689171195,
|
|
"epoch": 1.2792568289186304,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 1.3170145660059898e-05,
|
|
"loss": 1.0898,
|
|
"mean_token_accuracy": 0.7043176185339689,
|
|
"num_tokens": 311116787.0,
|
|
"step": 4155
|
|
},
|
|
{
|
|
"entropy": 1.1159634843468667,
|
|
"epoch": 1.2807962822202765,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.3154782997704336e-05,
|
|
"loss": 1.1085,
|
|
"mean_token_accuracy": 0.7013845149427652,
|
|
"num_tokens": 311487265.0,
|
|
"step": 4160
|
|
},
|
|
{
|
|
"entropy": 1.1149285018444062,
|
|
"epoch": 1.2823357355219227,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.3139412062298141e-05,
|
|
"loss": 1.1026,
|
|
"mean_token_accuracy": 0.700192927569151,
|
|
"num_tokens": 311866005.0,
|
|
"step": 4165
|
|
},
|
|
{
|
|
"entropy": 1.08015791811049,
|
|
"epoch": 1.283875188823569,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.3124032894149803e-05,
|
|
"loss": 1.0776,
|
|
"mean_token_accuracy": 0.7082461465150118,
|
|
"num_tokens": 312239762.0,
|
|
"step": 4170
|
|
},
|
|
{
|
|
"entropy": 1.1041171737015247,
|
|
"epoch": 1.2854146421252153,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 1.3108645533589394e-05,
|
|
"loss": 1.1019,
|
|
"mean_token_accuracy": 0.7005550045520067,
|
|
"num_tokens": 312609769.0,
|
|
"step": 4175
|
|
},
|
|
{
|
|
"entropy": 1.099213395267725,
|
|
"epoch": 1.2869540954268615,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.3093250020968477e-05,
|
|
"loss": 1.0992,
|
|
"mean_token_accuracy": 0.7003675859421492,
|
|
"num_tokens": 312982466.0,
|
|
"step": 4180
|
|
},
|
|
{
|
|
"entropy": 1.11904187053442,
|
|
"epoch": 1.2884935487285079,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.3077846396659986e-05,
|
|
"loss": 1.1115,
|
|
"mean_token_accuracy": 0.698601096123457,
|
|
"num_tokens": 313351958.0,
|
|
"step": 4185
|
|
},
|
|
{
|
|
"entropy": 1.118068947084248,
|
|
"epoch": 1.290033002030154,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 1.3062434701058134e-05,
|
|
"loss": 1.1143,
|
|
"mean_token_accuracy": 0.6988352715969086,
|
|
"num_tokens": 313731502.0,
|
|
"step": 4190
|
|
},
|
|
{
|
|
"entropy": 1.0864052549004555,
|
|
"epoch": 1.2915724553318002,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.304701497457829e-05,
|
|
"loss": 1.0913,
|
|
"mean_token_accuracy": 0.7051464155316353,
|
|
"num_tokens": 314101396.0,
|
|
"step": 4195
|
|
},
|
|
{
|
|
"entropy": 1.1178832422941922,
|
|
"epoch": 1.2931119086334466,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.3031587257656892e-05,
|
|
"loss": 1.1079,
|
|
"mean_token_accuracy": 0.6991049367934465,
|
|
"num_tokens": 314471199.0,
|
|
"step": 4200
|
|
},
|
|
{
|
|
"entropy": 1.0726791629567742,
|
|
"epoch": 1.2946513619350928,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.3016151590751332e-05,
|
|
"loss": 1.0549,
|
|
"mean_token_accuracy": 0.7091517373919487,
|
|
"num_tokens": 314845420.0,
|
|
"step": 4205
|
|
},
|
|
{
|
|
"entropy": 1.130228528380394,
|
|
"epoch": 1.2961908152367392,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 1.3000708014339842e-05,
|
|
"loss": 1.1247,
|
|
"mean_token_accuracy": 0.694831214658916,
|
|
"num_tokens": 315245088.0,
|
|
"step": 4210
|
|
},
|
|
{
|
|
"entropy": 1.117298081330955,
|
|
"epoch": 1.2977302685383854,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.2985256568921404e-05,
|
|
"loss": 1.1101,
|
|
"mean_token_accuracy": 0.6972995031625032,
|
|
"num_tokens": 315621573.0,
|
|
"step": 4215
|
|
},
|
|
{
|
|
"entropy": 1.1329909652471541,
|
|
"epoch": 1.2992697218400315,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.2969797295015632e-05,
|
|
"loss": 1.1142,
|
|
"mean_token_accuracy": 0.6969684008508921,
|
|
"num_tokens": 315994459.0,
|
|
"step": 4220
|
|
},
|
|
{
|
|
"entropy": 1.091454226896167,
|
|
"epoch": 1.3008091751416777,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.2954330233162669e-05,
|
|
"loss": 1.0852,
|
|
"mean_token_accuracy": 0.7018275778740645,
|
|
"num_tokens": 316363875.0,
|
|
"step": 4225
|
|
},
|
|
{
|
|
"entropy": 1.0521494638174773,
|
|
"epoch": 1.302348628443324,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.2938855423923081e-05,
|
|
"loss": 1.0423,
|
|
"mean_token_accuracy": 0.713319156691432,
|
|
"num_tokens": 316749176.0,
|
|
"step": 4230
|
|
},
|
|
{
|
|
"entropy": 1.1046339757740498,
|
|
"epoch": 1.3038880817449703,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.2923372907877752e-05,
|
|
"loss": 1.106,
|
|
"mean_token_accuracy": 0.7031476181000471,
|
|
"num_tokens": 317124450.0,
|
|
"step": 4235
|
|
},
|
|
{
|
|
"entropy": 1.1137266840785742,
|
|
"epoch": 1.3054275350466167,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.2907882725627776e-05,
|
|
"loss": 1.109,
|
|
"mean_token_accuracy": 0.6983969565480947,
|
|
"num_tokens": 317494302.0,
|
|
"step": 4240
|
|
},
|
|
{
|
|
"entropy": 1.1341589827090501,
|
|
"epoch": 1.3069669883482629,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.2892384917794347e-05,
|
|
"loss": 1.1172,
|
|
"mean_token_accuracy": 0.6974227242171764,
|
|
"num_tokens": 317863339.0,
|
|
"step": 4245
|
|
},
|
|
{
|
|
"entropy": 1.0884424960240722,
|
|
"epoch": 1.308506441649909,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.2876879525018664e-05,
|
|
"loss": 1.073,
|
|
"mean_token_accuracy": 0.7051871689036489,
|
|
"num_tokens": 318249845.0,
|
|
"step": 4250
|
|
},
|
|
{
|
|
"entropy": 1.0661856941878796,
|
|
"epoch": 1.3100458949515552,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.286136658796181e-05,
|
|
"loss": 1.0612,
|
|
"mean_token_accuracy": 0.7064540844410658,
|
|
"num_tokens": 318637131.0,
|
|
"step": 4255
|
|
},
|
|
{
|
|
"entropy": 1.0893873495981097,
|
|
"epoch": 1.3115853482532016,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.284584614730465e-05,
|
|
"loss": 1.0757,
|
|
"mean_token_accuracy": 0.7065093696117402,
|
|
"num_tokens": 319007830.0,
|
|
"step": 4260
|
|
},
|
|
{
|
|
"entropy": 1.0531156476587058,
|
|
"epoch": 1.3131248015548478,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.2830318243747736e-05,
|
|
"loss": 1.053,
|
|
"mean_token_accuracy": 0.7108749382197856,
|
|
"num_tokens": 319368163.0,
|
|
"step": 4265
|
|
},
|
|
{
|
|
"entropy": 1.1421661697328092,
|
|
"epoch": 1.3146642548564942,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.2814782918011183e-05,
|
|
"loss": 1.1389,
|
|
"mean_token_accuracy": 0.6936265856027604,
|
|
"num_tokens": 319737992.0,
|
|
"step": 4270
|
|
},
|
|
{
|
|
"entropy": 1.0545647602528334,
|
|
"epoch": 1.3162037081581404,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 1.2799240210834572e-05,
|
|
"loss": 1.0397,
|
|
"mean_token_accuracy": 0.7110533300787211,
|
|
"num_tokens": 320126655.0,
|
|
"step": 4275
|
|
},
|
|
{
|
|
"entropy": 1.1091747922822832,
|
|
"epoch": 1.3177431614597865,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.2783690162976839e-05,
|
|
"loss": 1.1117,
|
|
"mean_token_accuracy": 0.7007482405751944,
|
|
"num_tokens": 320487977.0,
|
|
"step": 4280
|
|
},
|
|
{
|
|
"entropy": 1.069710309058428,
|
|
"epoch": 1.3192826147614327,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.2768132815216174e-05,
|
|
"loss": 1.0711,
|
|
"mean_token_accuracy": 0.7076846122741699,
|
|
"num_tokens": 320881284.0,
|
|
"step": 4285
|
|
},
|
|
{
|
|
"entropy": 1.1291945701465012,
|
|
"epoch": 1.3208220680630791,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.2752568208349905e-05,
|
|
"loss": 1.1151,
|
|
"mean_token_accuracy": 0.697771786339581,
|
|
"num_tokens": 321264088.0,
|
|
"step": 4290
|
|
},
|
|
{
|
|
"entropy": 1.1011108864098786,
|
|
"epoch": 1.3223615213647253,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.2736996383194403e-05,
|
|
"loss": 1.0921,
|
|
"mean_token_accuracy": 0.7011332143098116,
|
|
"num_tokens": 321650295.0,
|
|
"step": 4295
|
|
},
|
|
{
|
|
"entropy": 1.1025992177426815,
|
|
"epoch": 1.3239009746663717,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.2721417380584957e-05,
|
|
"loss": 1.0897,
|
|
"mean_token_accuracy": 0.7015523098409175,
|
|
"num_tokens": 322025737.0,
|
|
"step": 4300
|
|
},
|
|
{
|
|
"entropy": 1.1109730444848538,
|
|
"epoch": 1.3254404279680179,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.2705831241375695e-05,
|
|
"loss": 1.1065,
|
|
"mean_token_accuracy": 0.6985065761953593,
|
|
"num_tokens": 322400305.0,
|
|
"step": 4305
|
|
},
|
|
{
|
|
"entropy": 1.1235045375302435,
|
|
"epoch": 1.326979881269664,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.269023800643944e-05,
|
|
"loss": 1.1235,
|
|
"mean_token_accuracy": 0.6968322839587927,
|
|
"num_tokens": 322778721.0,
|
|
"step": 4310
|
|
},
|
|
{
|
|
"entropy": 1.1202509528025986,
|
|
"epoch": 1.3285193345713104,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.2674637716667641e-05,
|
|
"loss": 1.1101,
|
|
"mean_token_accuracy": 0.6995937298983336,
|
|
"num_tokens": 323157401.0,
|
|
"step": 4315
|
|
},
|
|
{
|
|
"entropy": 1.1317413434386254,
|
|
"epoch": 1.3300587878729566,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.2659030412970236e-05,
|
|
"loss": 1.1308,
|
|
"mean_token_accuracy": 0.6953566465526819,
|
|
"num_tokens": 323521144.0,
|
|
"step": 4320
|
|
},
|
|
{
|
|
"entropy": 1.139741295017302,
|
|
"epoch": 1.3315982411746028,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.2643416136275557e-05,
|
|
"loss": 1.137,
|
|
"mean_token_accuracy": 0.6940133567899466,
|
|
"num_tokens": 323895960.0,
|
|
"step": 4325
|
|
},
|
|
{
|
|
"entropy": 1.0244571387767791,
|
|
"epoch": 1.3331376944762492,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.262779492753023e-05,
|
|
"loss": 1.0119,
|
|
"mean_token_accuracy": 0.7153892401605845,
|
|
"num_tokens": 324253131.0,
|
|
"step": 4330
|
|
},
|
|
{
|
|
"entropy": 1.1104781314730645,
|
|
"epoch": 1.3346771477778954,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.2612166827699049e-05,
|
|
"loss": 1.0916,
|
|
"mean_token_accuracy": 0.6988188102841377,
|
|
"num_tokens": 324627652.0,
|
|
"step": 4335
|
|
},
|
|
{
|
|
"entropy": 1.1045080471783877,
|
|
"epoch": 1.3362166010795415,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.2596531877764887e-05,
|
|
"loss": 1.1103,
|
|
"mean_token_accuracy": 0.7010735843330622,
|
|
"num_tokens": 325000500.0,
|
|
"step": 4340
|
|
},
|
|
{
|
|
"entropy": 1.1149308316409587,
|
|
"epoch": 1.337756054381188,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.2580890118728572e-05,
|
|
"loss": 1.1017,
|
|
"mean_token_accuracy": 0.6998983439058065,
|
|
"num_tokens": 325377888.0,
|
|
"step": 4345
|
|
},
|
|
{
|
|
"entropy": 1.1100379809737206,
|
|
"epoch": 1.3392955076828341,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.2565241591608798e-05,
|
|
"loss": 1.1059,
|
|
"mean_token_accuracy": 0.6978743225336075,
|
|
"num_tokens": 325756763.0,
|
|
"step": 4350
|
|
},
|
|
{
|
|
"entropy": 1.1045261159539224,
|
|
"epoch": 1.3408349609844805,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.2549586337442006e-05,
|
|
"loss": 1.0947,
|
|
"mean_token_accuracy": 0.7020975951105356,
|
|
"num_tokens": 326135312.0,
|
|
"step": 4355
|
|
},
|
|
{
|
|
"entropy": 1.1263693606480956,
|
|
"epoch": 1.3423744142861267,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.2533924397282268e-05,
|
|
"loss": 1.125,
|
|
"mean_token_accuracy": 0.6978525524958968,
|
|
"num_tokens": 326515109.0,
|
|
"step": 4360
|
|
},
|
|
{
|
|
"entropy": 1.1515977576375007,
|
|
"epoch": 1.3439138675877729,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.2518255812201203e-05,
|
|
"loss": 1.1418,
|
|
"mean_token_accuracy": 0.6906513828784228,
|
|
"num_tokens": 326882050.0,
|
|
"step": 4365
|
|
},
|
|
{
|
|
"entropy": 1.1000885490328074,
|
|
"epoch": 1.345453320889419,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.2502580623287846e-05,
|
|
"loss": 1.0976,
|
|
"mean_token_accuracy": 0.701859263703227,
|
|
"num_tokens": 327238398.0,
|
|
"step": 4370
|
|
},
|
|
{
|
|
"entropy": 1.0934124041348696,
|
|
"epoch": 1.3469927741910654,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.2486898871648552e-05,
|
|
"loss": 1.0896,
|
|
"mean_token_accuracy": 0.7043805528432131,
|
|
"num_tokens": 327619947.0,
|
|
"step": 4375
|
|
},
|
|
{
|
|
"entropy": 1.088824531622231,
|
|
"epoch": 1.3485322274927116,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.2471210598406882e-05,
|
|
"loss": 1.0783,
|
|
"mean_token_accuracy": 0.7049058906733989,
|
|
"num_tokens": 328004206.0,
|
|
"step": 4380
|
|
},
|
|
{
|
|
"entropy": 1.1130892544984818,
|
|
"epoch": 1.350071680794358,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.2455515844703512e-05,
|
|
"loss": 1.1092,
|
|
"mean_token_accuracy": 0.697757763043046,
|
|
"num_tokens": 328384919.0,
|
|
"step": 4385
|
|
},
|
|
{
|
|
"entropy": 1.0882465865463018,
|
|
"epoch": 1.3516111340960042,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.24398146516961e-05,
|
|
"loss": 1.0728,
|
|
"mean_token_accuracy": 0.7054531000554561,
|
|
"num_tokens": 328758461.0,
|
|
"step": 4390
|
|
},
|
|
{
|
|
"entropy": 1.1190194971859455,
|
|
"epoch": 1.3531505873976504,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 1.2424107060559194e-05,
|
|
"loss": 1.1216,
|
|
"mean_token_accuracy": 0.6980281412601471,
|
|
"num_tokens": 329139091.0,
|
|
"step": 4395
|
|
},
|
|
{
|
|
"entropy": 1.1049264952540399,
|
|
"epoch": 1.3546900406992965,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.2408393112484123e-05,
|
|
"loss": 1.1002,
|
|
"mean_token_accuracy": 0.7026136528700591,
|
|
"num_tokens": 329517841.0,
|
|
"step": 4400
|
|
},
|
|
{
|
|
"entropy": 1.10797795727849,
|
|
"epoch": 1.356229494000943,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.2392672848678877e-05,
|
|
"loss": 1.0861,
|
|
"mean_token_accuracy": 0.7025578137487173,
|
|
"num_tokens": 329886529.0,
|
|
"step": 4405
|
|
},
|
|
{
|
|
"entropy": 1.1214808518067003,
|
|
"epoch": 1.3577689473025891,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.2376946310368023e-05,
|
|
"loss": 1.1214,
|
|
"mean_token_accuracy": 0.6982703737914562,
|
|
"num_tokens": 330272866.0,
|
|
"step": 4410
|
|
},
|
|
{
|
|
"entropy": 1.1336385294795037,
|
|
"epoch": 1.3593084006042355,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.236121353879257e-05,
|
|
"loss": 1.129,
|
|
"mean_token_accuracy": 0.6968680553138256,
|
|
"num_tokens": 330647862.0,
|
|
"step": 4415
|
|
},
|
|
{
|
|
"entropy": 1.1065171971917152,
|
|
"epoch": 1.3608478539058817,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.2345474575209884e-05,
|
|
"loss": 1.1058,
|
|
"mean_token_accuracy": 0.7020408466458321,
|
|
"num_tokens": 331018179.0,
|
|
"step": 4420
|
|
},
|
|
{
|
|
"entropy": 1.132369793392718,
|
|
"epoch": 1.3623873072075279,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.2329729460893552e-05,
|
|
"loss": 1.1263,
|
|
"mean_token_accuracy": 0.6953357547521591,
|
|
"num_tokens": 331401445.0,
|
|
"step": 4425
|
|
},
|
|
{
|
|
"entropy": 1.0903928074985743,
|
|
"epoch": 1.363926760509174,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.2313978237133308e-05,
|
|
"loss": 1.0856,
|
|
"mean_token_accuracy": 0.7031658750027419,
|
|
"num_tokens": 331778605.0,
|
|
"step": 4430
|
|
},
|
|
{
|
|
"entropy": 1.1155294952914119,
|
|
"epoch": 1.3654662138108205,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.2298220945234896e-05,
|
|
"loss": 1.1136,
|
|
"mean_token_accuracy": 0.6989368978887797,
|
|
"num_tokens": 332164233.0,
|
|
"step": 4435
|
|
},
|
|
{
|
|
"entropy": 1.116128033772111,
|
|
"epoch": 1.3670056671124666,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.228245762651998e-05,
|
|
"loss": 1.1099,
|
|
"mean_token_accuracy": 0.6996843375265598,
|
|
"num_tokens": 332535147.0,
|
|
"step": 4440
|
|
},
|
|
{
|
|
"entropy": 1.1336406484246253,
|
|
"epoch": 1.368545120414113,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.2266688322326024e-05,
|
|
"loss": 1.1237,
|
|
"mean_token_accuracy": 0.6948333293199539,
|
|
"num_tokens": 332905717.0,
|
|
"step": 4445
|
|
},
|
|
{
|
|
"entropy": 1.0700359644368291,
|
|
"epoch": 1.3700845737157592,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.225091307400619e-05,
|
|
"loss": 1.0706,
|
|
"mean_token_accuracy": 0.7095909129828215,
|
|
"num_tokens": 333275426.0,
|
|
"step": 4450
|
|
},
|
|
{
|
|
"entropy": 1.0737925486639142,
|
|
"epoch": 1.3716240270174054,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.223513192292923e-05,
|
|
"loss": 1.0585,
|
|
"mean_token_accuracy": 0.7085043963044881,
|
|
"num_tokens": 333652235.0,
|
|
"step": 4455
|
|
},
|
|
{
|
|
"entropy": 1.0694486383348702,
|
|
"epoch": 1.3731634803190518,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.2219344910479368e-05,
|
|
"loss": 1.051,
|
|
"mean_token_accuracy": 0.7077645469456911,
|
|
"num_tokens": 334031083.0,
|
|
"step": 4460
|
|
},
|
|
{
|
|
"entropy": 1.086533097922802,
|
|
"epoch": 1.374702933620698,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.2203552078056209e-05,
|
|
"loss": 1.0857,
|
|
"mean_token_accuracy": 0.7078838661313057,
|
|
"num_tokens": 334412528.0,
|
|
"step": 4465
|
|
},
|
|
{
|
|
"entropy": 1.056171497516334,
|
|
"epoch": 1.3762423869223441,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.2187753467074613e-05,
|
|
"loss": 1.0461,
|
|
"mean_token_accuracy": 0.709338441863656,
|
|
"num_tokens": 334782737.0,
|
|
"step": 4470
|
|
},
|
|
{
|
|
"entropy": 1.0703082425519823,
|
|
"epoch": 1.3777818402239905,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.2171949118964592e-05,
|
|
"loss": 1.0679,
|
|
"mean_token_accuracy": 0.7064750380814075,
|
|
"num_tokens": 335171730.0,
|
|
"step": 4475
|
|
},
|
|
{
|
|
"entropy": 1.0893489208072424,
|
|
"epoch": 1.3793212935256367,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.2156139075171212e-05,
|
|
"loss": 1.0797,
|
|
"mean_token_accuracy": 0.7035396687686444,
|
|
"num_tokens": 335539104.0,
|
|
"step": 4480
|
|
},
|
|
{
|
|
"entropy": 1.0840103393420577,
|
|
"epoch": 1.3808607468272829,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.2140323377154467e-05,
|
|
"loss": 1.0684,
|
|
"mean_token_accuracy": 0.7045680597424507,
|
|
"num_tokens": 335909756.0,
|
|
"step": 4485
|
|
},
|
|
{
|
|
"entropy": 1.0821194671094418,
|
|
"epoch": 1.3824002001289293,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.2124502066389181e-05,
|
|
"loss": 1.082,
|
|
"mean_token_accuracy": 0.7039589412510395,
|
|
"num_tokens": 336287736.0,
|
|
"step": 4490
|
|
},
|
|
{
|
|
"entropy": 1.10668462254107,
|
|
"epoch": 1.3839396534305755,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.2108675184364898e-05,
|
|
"loss": 1.1053,
|
|
"mean_token_accuracy": 0.7001998176798224,
|
|
"num_tokens": 336659080.0,
|
|
"step": 4495
|
|
},
|
|
{
|
|
"entropy": 1.0968632355332375,
|
|
"epoch": 1.3854791067322219,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.2092842772585773e-05,
|
|
"loss": 1.0959,
|
|
"mean_token_accuracy": 0.7023633774369955,
|
|
"num_tokens": 337027318.0,
|
|
"step": 4500
|
|
},
|
|
{
|
|
"entropy": 1.0873358672484756,
|
|
"epoch": 1.387018560033868,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.2077004872570454e-05,
|
|
"loss": 1.0826,
|
|
"mean_token_accuracy": 0.7054312709718943,
|
|
"num_tokens": 337389051.0,
|
|
"step": 4505
|
|
},
|
|
{
|
|
"entropy": 1.1103742688894271,
|
|
"epoch": 1.3885580133355142,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.2061161525851991e-05,
|
|
"loss": 1.1031,
|
|
"mean_token_accuracy": 0.7011483401060105,
|
|
"num_tokens": 337765571.0,
|
|
"step": 4510
|
|
},
|
|
{
|
|
"entropy": 1.1220366286113859,
|
|
"epoch": 1.3900974666371604,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.204531277397772e-05,
|
|
"loss": 1.119,
|
|
"mean_token_accuracy": 0.7016996089369059,
|
|
"num_tokens": 338135563.0,
|
|
"step": 4515
|
|
},
|
|
{
|
|
"entropy": 1.0903385024517775,
|
|
"epoch": 1.3916369199388068,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.2029458658509135e-05,
|
|
"loss": 1.0713,
|
|
"mean_token_accuracy": 0.7042645826935768,
|
|
"num_tokens": 338526759.0,
|
|
"step": 4520
|
|
},
|
|
{
|
|
"entropy": 1.088469509407878,
|
|
"epoch": 1.393176373240453,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.201359922102181e-05,
|
|
"loss": 1.0777,
|
|
"mean_token_accuracy": 0.7016157642006874,
|
|
"num_tokens": 338902220.0,
|
|
"step": 4525
|
|
},
|
|
{
|
|
"entropy": 1.11191342510283,
|
|
"epoch": 1.3947158265420994,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.199773450310527e-05,
|
|
"loss": 1.0914,
|
|
"mean_token_accuracy": 0.7026226468384266,
|
|
"num_tokens": 339272556.0,
|
|
"step": 4530
|
|
},
|
|
{
|
|
"entropy": 1.0702030174434185,
|
|
"epoch": 1.3962552798437455,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.1981864546362891e-05,
|
|
"loss": 1.0726,
|
|
"mean_token_accuracy": 0.70561035387218,
|
|
"num_tokens": 339654550.0,
|
|
"step": 4535
|
|
},
|
|
{
|
|
"entropy": 1.0890689438208938,
|
|
"epoch": 1.3977947331453917,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.196598939241178e-05,
|
|
"loss": 1.0837,
|
|
"mean_token_accuracy": 0.7063101982697845,
|
|
"num_tokens": 340017338.0,
|
|
"step": 4540
|
|
},
|
|
{
|
|
"entropy": 1.0902572806924582,
|
|
"epoch": 1.3993341864470379,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.1950109082882681e-05,
|
|
"loss": 1.0801,
|
|
"mean_token_accuracy": 0.7041763126850128,
|
|
"num_tokens": 340398192.0,
|
|
"step": 4545
|
|
},
|
|
{
|
|
"entropy": 1.0909225117415189,
|
|
"epoch": 1.4008736397486843,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.1934223659419855e-05,
|
|
"loss": 1.0755,
|
|
"mean_token_accuracy": 0.7034576587378979,
|
|
"num_tokens": 340783549.0,
|
|
"step": 4550
|
|
},
|
|
{
|
|
"entropy": 1.0837211914360523,
|
|
"epoch": 1.4024130930503305,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.1918333163680968e-05,
|
|
"loss": 1.0821,
|
|
"mean_token_accuracy": 0.7019367016851902,
|
|
"num_tokens": 341166651.0,
|
|
"step": 4555
|
|
},
|
|
{
|
|
"entropy": 1.104997373558581,
|
|
"epoch": 1.4039525463519769,
|
|
"grad_norm": 0.65625,
|
|
"learning_rate": 1.1902437637337e-05,
|
|
"loss": 1.1084,
|
|
"mean_token_accuracy": 0.7023465141654015,
|
|
"num_tokens": 341559392.0,
|
|
"step": 4560
|
|
},
|
|
{
|
|
"entropy": 1.0747286787256598,
|
|
"epoch": 1.405491999653623,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 1.1886537122072106e-05,
|
|
"loss": 1.0713,
|
|
"mean_token_accuracy": 0.7080269675701857,
|
|
"num_tokens": 341947887.0,
|
|
"step": 4565
|
|
},
|
|
{
|
|
"entropy": 1.112991374358535,
|
|
"epoch": 1.4070314529552692,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.1870631659583547e-05,
|
|
"loss": 1.1103,
|
|
"mean_token_accuracy": 0.7009411683306098,
|
|
"num_tokens": 342328586.0,
|
|
"step": 4570
|
|
},
|
|
{
|
|
"entropy": 1.1081901915371417,
|
|
"epoch": 1.4085709062569154,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.185472129158153e-05,
|
|
"loss": 1.1038,
|
|
"mean_token_accuracy": 0.6989708282053471,
|
|
"num_tokens": 342709281.0,
|
|
"step": 4575
|
|
},
|
|
{
|
|
"entropy": 1.0794160701334476,
|
|
"epoch": 1.4101103595585618,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.1838806059789151e-05,
|
|
"loss": 1.0751,
|
|
"mean_token_accuracy": 0.7048471983522177,
|
|
"num_tokens": 343073827.0,
|
|
"step": 4580
|
|
},
|
|
{
|
|
"entropy": 1.1020493187010287,
|
|
"epoch": 1.411649812860208,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.1822886005942244e-05,
|
|
"loss": 1.0861,
|
|
"mean_token_accuracy": 0.7011720657348632,
|
|
"num_tokens": 343461960.0,
|
|
"step": 4585
|
|
},
|
|
{
|
|
"entropy": 1.0860462600365282,
|
|
"epoch": 1.4131892661618544,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.1806961171789297e-05,
|
|
"loss": 1.0809,
|
|
"mean_token_accuracy": 0.7038892190903425,
|
|
"num_tokens": 343840940.0,
|
|
"step": 4590
|
|
},
|
|
{
|
|
"entropy": 1.1033543476834893,
|
|
"epoch": 1.4147287194635005,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.179103159909133e-05,
|
|
"loss": 1.0965,
|
|
"mean_token_accuracy": 0.7027289818972349,
|
|
"num_tokens": 344210514.0,
|
|
"step": 4595
|
|
},
|
|
{
|
|
"entropy": 1.1446595331653953,
|
|
"epoch": 1.4162681727651467,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.1775097329621793e-05,
|
|
"loss": 1.1332,
|
|
"mean_token_accuracy": 0.6938136965036392,
|
|
"num_tokens": 344585915.0,
|
|
"step": 4600
|
|
},
|
|
{
|
|
"entropy": 1.0780494783073664,
|
|
"epoch": 1.417807626066793,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.1759158405166446e-05,
|
|
"loss": 1.0753,
|
|
"mean_token_accuracy": 0.706804946810007,
|
|
"num_tokens": 344958388.0,
|
|
"step": 4605
|
|
},
|
|
{
|
|
"entropy": 1.073190340399742,
|
|
"epoch": 1.4193470793684393,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.174321486752326e-05,
|
|
"loss": 1.0739,
|
|
"mean_token_accuracy": 0.7058147221803666,
|
|
"num_tokens": 345342534.0,
|
|
"step": 4610
|
|
},
|
|
{
|
|
"entropy": 1.0797380482777954,
|
|
"epoch": 1.4208865326700855,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.172726675850231e-05,
|
|
"loss": 1.0682,
|
|
"mean_token_accuracy": 0.70791350081563,
|
|
"num_tokens": 345722416.0,
|
|
"step": 4615
|
|
},
|
|
{
|
|
"entropy": 1.1051574341952801,
|
|
"epoch": 1.4224259859717319,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.1711314119925644e-05,
|
|
"loss": 1.0908,
|
|
"mean_token_accuracy": 0.6985630553215743,
|
|
"num_tokens": 346111353.0,
|
|
"step": 4620
|
|
},
|
|
{
|
|
"entropy": 1.109693994373083,
|
|
"epoch": 1.423965439273378,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.1695356993627203e-05,
|
|
"loss": 1.1038,
|
|
"mean_token_accuracy": 0.7008035439997912,
|
|
"num_tokens": 346487176.0,
|
|
"step": 4625
|
|
},
|
|
{
|
|
"entropy": 1.0987954657524823,
|
|
"epoch": 1.4255048925750242,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.1679395421452688e-05,
|
|
"loss": 1.0869,
|
|
"mean_token_accuracy": 0.7036832481622696,
|
|
"num_tokens": 346877422.0,
|
|
"step": 4630
|
|
},
|
|
{
|
|
"entropy": 1.12406539991498,
|
|
"epoch": 1.4270443458766706,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 1.1663429445259464e-05,
|
|
"loss": 1.1235,
|
|
"mean_token_accuracy": 0.6969954641535878,
|
|
"num_tokens": 347258117.0,
|
|
"step": 4635
|
|
},
|
|
{
|
|
"entropy": 1.1262548461556434,
|
|
"epoch": 1.4285837991783168,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.1647459106916438e-05,
|
|
"loss": 1.1121,
|
|
"mean_token_accuracy": 0.698977418243885,
|
|
"num_tokens": 347615486.0,
|
|
"step": 4640
|
|
},
|
|
{
|
|
"entropy": 1.083485627733171,
|
|
"epoch": 1.4301232524799632,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.1631484448303964e-05,
|
|
"loss": 1.0767,
|
|
"mean_token_accuracy": 0.7037990376353264,
|
|
"num_tokens": 347993978.0,
|
|
"step": 4645
|
|
},
|
|
{
|
|
"entropy": 1.104743254557252,
|
|
"epoch": 1.4316627057816094,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.1615505511313723e-05,
|
|
"loss": 1.0982,
|
|
"mean_token_accuracy": 0.7019114103168249,
|
|
"num_tokens": 348363109.0,
|
|
"step": 4650
|
|
},
|
|
{
|
|
"entropy": 1.1204315826296807,
|
|
"epoch": 1.4332021590832555,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.159952233784861e-05,
|
|
"loss": 1.12,
|
|
"mean_token_accuracy": 0.6980244889855385,
|
|
"num_tokens": 348738479.0,
|
|
"step": 4655
|
|
},
|
|
{
|
|
"entropy": 1.0870197594165802,
|
|
"epoch": 1.4347416123849017,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.1583534969822634e-05,
|
|
"loss": 1.0781,
|
|
"mean_token_accuracy": 0.7041078258305788,
|
|
"num_tokens": 349114597.0,
|
|
"step": 4660
|
|
},
|
|
{
|
|
"entropy": 1.131915664114058,
|
|
"epoch": 1.4362810656865481,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.156754344916081e-05,
|
|
"loss": 1.1266,
|
|
"mean_token_accuracy": 0.6947113610804081,
|
|
"num_tokens": 349495721.0,
|
|
"step": 4665
|
|
},
|
|
{
|
|
"entropy": 1.1002964191138744,
|
|
"epoch": 1.4378205189881943,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.155154781779903e-05,
|
|
"loss": 1.0966,
|
|
"mean_token_accuracy": 0.7026873178780079,
|
|
"num_tokens": 349857054.0,
|
|
"step": 4670
|
|
},
|
|
{
|
|
"entropy": 1.1086486119776964,
|
|
"epoch": 1.4393599722898407,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.1535548117683977e-05,
|
|
"loss": 1.0956,
|
|
"mean_token_accuracy": 0.7016890406608581,
|
|
"num_tokens": 350235771.0,
|
|
"step": 4675
|
|
},
|
|
{
|
|
"entropy": 1.0940628914162516,
|
|
"epoch": 1.4408994255914869,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.1519544390772996e-05,
|
|
"loss": 1.0933,
|
|
"mean_token_accuracy": 0.7022279798984528,
|
|
"num_tokens": 350594431.0,
|
|
"step": 4680
|
|
},
|
|
{
|
|
"entropy": 1.0739692451432348,
|
|
"epoch": 1.442438878893133,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.1503536679034e-05,
|
|
"loss": 1.0582,
|
|
"mean_token_accuracy": 0.7093446459621191,
|
|
"num_tokens": 350966729.0,
|
|
"step": 4685
|
|
},
|
|
{
|
|
"entropy": 1.1036204397678375,
|
|
"epoch": 1.4439783321947792,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.148752502444534e-05,
|
|
"loss": 1.0968,
|
|
"mean_token_accuracy": 0.7027051884680986,
|
|
"num_tokens": 351348015.0,
|
|
"step": 4690
|
|
},
|
|
{
|
|
"entropy": 1.0984970558434726,
|
|
"epoch": 1.4455177854964256,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.1471509468995719e-05,
|
|
"loss": 1.0748,
|
|
"mean_token_accuracy": 0.7056610502302647,
|
|
"num_tokens": 351724259.0,
|
|
"step": 4695
|
|
},
|
|
{
|
|
"entropy": 1.0869323208928108,
|
|
"epoch": 1.4470572387980718,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.1455490054684063e-05,
|
|
"loss": 1.0785,
|
|
"mean_token_accuracy": 0.7069425046443939,
|
|
"num_tokens": 352089350.0,
|
|
"step": 4700
|
|
},
|
|
{
|
|
"entropy": 1.1182052005082368,
|
|
"epoch": 1.4485966920997182,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.1439466823519414e-05,
|
|
"loss": 1.1111,
|
|
"mean_token_accuracy": 0.6985241148620844,
|
|
"num_tokens": 352466679.0,
|
|
"step": 4705
|
|
},
|
|
{
|
|
"entropy": 1.1125420741736889,
|
|
"epoch": 1.4501361454013644,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.1423439817520837e-05,
|
|
"loss": 1.1155,
|
|
"mean_token_accuracy": 0.7014571156352758,
|
|
"num_tokens": 352826493.0,
|
|
"step": 4710
|
|
},
|
|
{
|
|
"entropy": 1.0784962832927705,
|
|
"epoch": 1.4516755987030106,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.1407409078717275e-05,
|
|
"loss": 1.0696,
|
|
"mean_token_accuracy": 0.7046381793916225,
|
|
"num_tokens": 353205948.0,
|
|
"step": 4715
|
|
},
|
|
{
|
|
"entropy": 1.0519383791834116,
|
|
"epoch": 1.4532150520046567,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.1391374649147482e-05,
|
|
"loss": 1.0406,
|
|
"mean_token_accuracy": 0.7135688032954931,
|
|
"num_tokens": 353591448.0,
|
|
"step": 4720
|
|
},
|
|
{
|
|
"entropy": 1.1096265275031327,
|
|
"epoch": 1.4547545053063031,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.1375336570859877e-05,
|
|
"loss": 1.0982,
|
|
"mean_token_accuracy": 0.7041479632258415,
|
|
"num_tokens": 353950453.0,
|
|
"step": 4725
|
|
},
|
|
{
|
|
"entropy": 1.0867053436115384,
|
|
"epoch": 1.4562939586079493,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 1.1359294885912449e-05,
|
|
"loss": 1.0785,
|
|
"mean_token_accuracy": 0.7096118059009313,
|
|
"num_tokens": 354327137.0,
|
|
"step": 4730
|
|
},
|
|
{
|
|
"entropy": 1.1087339762598276,
|
|
"epoch": 1.4578334119095957,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 1.1343249636372646e-05,
|
|
"loss": 1.102,
|
|
"mean_token_accuracy": 0.7003944184631109,
|
|
"num_tokens": 354689574.0,
|
|
"step": 4735
|
|
},
|
|
{
|
|
"entropy": 1.0943115957081317,
|
|
"epoch": 1.4593728652112419,
|
|
"grad_norm": 0.66015625,
|
|
"learning_rate": 1.132720086431727e-05,
|
|
"loss": 1.0829,
|
|
"mean_token_accuracy": 0.7030307587236166,
|
|
"num_tokens": 355073304.0,
|
|
"step": 4740
|
|
},
|
|
{
|
|
"entropy": 1.1095132680609823,
|
|
"epoch": 1.460912318512888,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.1311148611832346e-05,
|
|
"loss": 1.1043,
|
|
"mean_token_accuracy": 0.6999218583106994,
|
|
"num_tokens": 355451708.0,
|
|
"step": 4745
|
|
},
|
|
{
|
|
"entropy": 1.1087484553456306,
|
|
"epoch": 1.4624517718145342,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.129509292101304e-05,
|
|
"loss": 1.1009,
|
|
"mean_token_accuracy": 0.6988322615623475,
|
|
"num_tokens": 355820578.0,
|
|
"step": 4750
|
|
},
|
|
{
|
|
"entropy": 1.094297254830599,
|
|
"epoch": 1.4639912251161806,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.1279033833963532e-05,
|
|
"loss": 1.075,
|
|
"mean_token_accuracy": 0.7040094539523125,
|
|
"num_tokens": 356185880.0,
|
|
"step": 4755
|
|
},
|
|
{
|
|
"entropy": 1.069185835123062,
|
|
"epoch": 1.4655306784178268,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.12629713927969e-05,
|
|
"loss": 1.0557,
|
|
"mean_token_accuracy": 0.7063707388937474,
|
|
"num_tokens": 356557400.0,
|
|
"step": 4760
|
|
},
|
|
{
|
|
"entropy": 1.0941881004720926,
|
|
"epoch": 1.4670701317194732,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 1.1246905639635029e-05,
|
|
"loss": 1.0747,
|
|
"mean_token_accuracy": 0.7060420401394367,
|
|
"num_tokens": 356945971.0,
|
|
"step": 4765
|
|
},
|
|
{
|
|
"entropy": 1.0458490543067456,
|
|
"epoch": 1.4686095850211194,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.1230836616608479e-05,
|
|
"loss": 1.0369,
|
|
"mean_token_accuracy": 0.7089097138494254,
|
|
"num_tokens": 357328145.0,
|
|
"step": 4770
|
|
},
|
|
{
|
|
"entropy": 1.097815372236073,
|
|
"epoch": 1.4701490383227656,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.1214764365856393e-05,
|
|
"loss": 1.0897,
|
|
"mean_token_accuracy": 0.7041168842464686,
|
|
"num_tokens": 357703680.0,
|
|
"step": 4775
|
|
},
|
|
{
|
|
"entropy": 1.1202220287173987,
|
|
"epoch": 1.471688491624412,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.1198688929526369e-05,
|
|
"loss": 1.1033,
|
|
"mean_token_accuracy": 0.6995015844702721,
|
|
"num_tokens": 358070299.0,
|
|
"step": 4780
|
|
},
|
|
{
|
|
"entropy": 1.124421639367938,
|
|
"epoch": 1.4732279449260581,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.118261034977437e-05,
|
|
"loss": 1.12,
|
|
"mean_token_accuracy": 0.699353015422821,
|
|
"num_tokens": 358446153.0,
|
|
"step": 4785
|
|
},
|
|
{
|
|
"entropy": 1.078741892427206,
|
|
"epoch": 1.4747673982277043,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.11665286687646e-05,
|
|
"loss": 1.0736,
|
|
"mean_token_accuracy": 0.7057676538825035,
|
|
"num_tokens": 358837143.0,
|
|
"step": 4790
|
|
},
|
|
{
|
|
"entropy": 1.1247838504612446,
|
|
"epoch": 1.4763068515293507,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.1150443928669383e-05,
|
|
"loss": 1.1311,
|
|
"mean_token_accuracy": 0.6956282909959555,
|
|
"num_tokens": 359212022.0,
|
|
"step": 4795
|
|
},
|
|
{
|
|
"entropy": 1.109905306249857,
|
|
"epoch": 1.4778463048309969,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.1134356171669085e-05,
|
|
"loss": 1.1015,
|
|
"mean_token_accuracy": 0.701968039572239,
|
|
"num_tokens": 359597317.0,
|
|
"step": 4800
|
|
},
|
|
{
|
|
"entropy": 1.076607409492135,
|
|
"epoch": 1.479385758132643,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.1118265439951968e-05,
|
|
"loss": 1.0682,
|
|
"mean_token_accuracy": 0.7075003888458014,
|
|
"num_tokens": 359972997.0,
|
|
"step": 4805
|
|
},
|
|
{
|
|
"entropy": 1.0871192902326583,
|
|
"epoch": 1.4809252114342895,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.1102171775714097e-05,
|
|
"loss": 1.0864,
|
|
"mean_token_accuracy": 0.7057229354977608,
|
|
"num_tokens": 360338277.0,
|
|
"step": 4810
|
|
},
|
|
{
|
|
"entropy": 1.1171676289290189,
|
|
"epoch": 1.4824646647359356,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.1086075221159237e-05,
|
|
"loss": 1.1133,
|
|
"mean_token_accuracy": 0.6995074581354856,
|
|
"num_tokens": 360730974.0,
|
|
"step": 4815
|
|
},
|
|
{
|
|
"entropy": 1.0742021584883332,
|
|
"epoch": 1.484004118037582,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.1069975818498724e-05,
|
|
"loss": 1.0647,
|
|
"mean_token_accuracy": 0.7100146293640137,
|
|
"num_tokens": 361103120.0,
|
|
"step": 4820
|
|
},
|
|
{
|
|
"entropy": 1.095327810011804,
|
|
"epoch": 1.4855435713392282,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.1053873609951362e-05,
|
|
"loss": 1.0845,
|
|
"mean_token_accuracy": 0.7042764712125062,
|
|
"num_tokens": 361464494.0,
|
|
"step": 4825
|
|
},
|
|
{
|
|
"entropy": 1.0706271074712277,
|
|
"epoch": 1.4870830246408744,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.1037768637743316e-05,
|
|
"loss": 1.0652,
|
|
"mean_token_accuracy": 0.7063718538731336,
|
|
"num_tokens": 361827914.0,
|
|
"step": 4830
|
|
},
|
|
{
|
|
"entropy": 1.108374112099409,
|
|
"epoch": 1.4886224779425206,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.1021660944108e-05,
|
|
"loss": 1.1046,
|
|
"mean_token_accuracy": 0.7001846972852945,
|
|
"num_tokens": 362199069.0,
|
|
"step": 4835
|
|
},
|
|
{
|
|
"entropy": 1.1093880301341414,
|
|
"epoch": 1.490161931244167,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.1005550571285964e-05,
|
|
"loss": 1.1008,
|
|
"mean_token_accuracy": 0.7009815942496062,
|
|
"num_tokens": 362581369.0,
|
|
"step": 4840
|
|
},
|
|
{
|
|
"entropy": 1.105388099886477,
|
|
"epoch": 1.4917013845458131,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.0989437561524776e-05,
|
|
"loss": 1.0941,
|
|
"mean_token_accuracy": 0.7039092086255551,
|
|
"num_tokens": 362943341.0,
|
|
"step": 4845
|
|
},
|
|
{
|
|
"entropy": 1.1012696333229541,
|
|
"epoch": 1.4932408378474595,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.0973321957078935e-05,
|
|
"loss": 1.0877,
|
|
"mean_token_accuracy": 0.7057942543178797,
|
|
"num_tokens": 363312084.0,
|
|
"step": 4850
|
|
},
|
|
{
|
|
"entropy": 1.0516272846609354,
|
|
"epoch": 1.4947802911491057,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.0957203800209729e-05,
|
|
"loss": 1.0494,
|
|
"mean_token_accuracy": 0.713024589791894,
|
|
"num_tokens": 363693229.0,
|
|
"step": 4855
|
|
},
|
|
{
|
|
"entropy": 1.1145474841818213,
|
|
"epoch": 1.4963197444507519,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 1.0941083133185146e-05,
|
|
"loss": 1.1039,
|
|
"mean_token_accuracy": 0.6989588256925344,
|
|
"num_tokens": 364077647.0,
|
|
"step": 4860
|
|
},
|
|
{
|
|
"entropy": 1.111084546893835,
|
|
"epoch": 1.497859197752398,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.0924959998279754e-05,
|
|
"loss": 1.0972,
|
|
"mean_token_accuracy": 0.7017969522625208,
|
|
"num_tokens": 364448259.0,
|
|
"step": 4865
|
|
},
|
|
{
|
|
"entropy": 1.102950258180499,
|
|
"epoch": 1.4993986510540445,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.09088344377746e-05,
|
|
"loss": 1.104,
|
|
"mean_token_accuracy": 0.7009441778063774,
|
|
"num_tokens": 364837230.0,
|
|
"step": 4870
|
|
},
|
|
{
|
|
"entropy": 1.1102787114679813,
|
|
"epoch": 1.5009381043556906,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.0892706493957083e-05,
|
|
"loss": 1.1014,
|
|
"mean_token_accuracy": 0.7027213271707297,
|
|
"num_tokens": 365219203.0,
|
|
"step": 4875
|
|
},
|
|
{
|
|
"entropy": 1.0819869244471192,
|
|
"epoch": 1.502477557657337,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.0876576209120857e-05,
|
|
"loss": 1.0785,
|
|
"mean_token_accuracy": 0.7077439911663532,
|
|
"num_tokens": 365579341.0,
|
|
"step": 4880
|
|
},
|
|
{
|
|
"entropy": 1.1024604262784123,
|
|
"epoch": 1.5040170109589832,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.0860443625565712e-05,
|
|
"loss": 1.0952,
|
|
"mean_token_accuracy": 0.7008481990545988,
|
|
"num_tokens": 365946705.0,
|
|
"step": 4885
|
|
},
|
|
{
|
|
"entropy": 1.0811700403690339,
|
|
"epoch": 1.5055564642606294,
|
|
"grad_norm": 0.65625,
|
|
"learning_rate": 1.084430878559747e-05,
|
|
"loss": 1.0586,
|
|
"mean_token_accuracy": 0.7069568939507007,
|
|
"num_tokens": 366329972.0,
|
|
"step": 4890
|
|
},
|
|
{
|
|
"entropy": 1.0681102907285094,
|
|
"epoch": 1.5070959175622756,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 1.0828171731527863e-05,
|
|
"loss": 1.065,
|
|
"mean_token_accuracy": 0.709576641023159,
|
|
"num_tokens": 366721584.0,
|
|
"step": 4895
|
|
},
|
|
{
|
|
"entropy": 1.1116036470979451,
|
|
"epoch": 1.508635370863922,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.081203250567444e-05,
|
|
"loss": 1.0981,
|
|
"mean_token_accuracy": 0.7008657567203045,
|
|
"num_tokens": 367089660.0,
|
|
"step": 4900
|
|
},
|
|
{
|
|
"entropy": 1.0942118011415005,
|
|
"epoch": 1.5101748241655684,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.0795891150360435e-05,
|
|
"loss": 1.1012,
|
|
"mean_token_accuracy": 0.701570986956358,
|
|
"num_tokens": 367460688.0,
|
|
"step": 4905
|
|
},
|
|
{
|
|
"entropy": 1.09613887835294,
|
|
"epoch": 1.5117142774672145,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.0779747707914672e-05,
|
|
"loss": 1.0905,
|
|
"mean_token_accuracy": 0.7026755798608064,
|
|
"num_tokens": 367839853.0,
|
|
"step": 4910
|
|
},
|
|
{
|
|
"entropy": 1.0824256701394916,
|
|
"epoch": 1.5132537307688607,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 1.076360222067145e-05,
|
|
"loss": 1.0698,
|
|
"mean_token_accuracy": 0.7053290653973818,
|
|
"num_tokens": 368212436.0,
|
|
"step": 4915
|
|
},
|
|
{
|
|
"entropy": 1.1290051667019725,
|
|
"epoch": 1.514793184070507,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.0747454730970422e-05,
|
|
"loss": 1.1126,
|
|
"mean_token_accuracy": 0.6994906149804592,
|
|
"num_tokens": 368580297.0,
|
|
"step": 4920
|
|
},
|
|
{
|
|
"entropy": 1.118296029418707,
|
|
"epoch": 1.516332637372153,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.0731305281156499e-05,
|
|
"loss": 1.115,
|
|
"mean_token_accuracy": 0.6976137042045594,
|
|
"num_tokens": 368946846.0,
|
|
"step": 4925
|
|
},
|
|
{
|
|
"entropy": 1.0706999147310854,
|
|
"epoch": 1.5178720906737995,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.071515391357973e-05,
|
|
"loss": 1.0663,
|
|
"mean_token_accuracy": 0.7087556172162295,
|
|
"num_tokens": 369331900.0,
|
|
"step": 4930
|
|
},
|
|
{
|
|
"entropy": 1.1037400741130114,
|
|
"epoch": 1.5194115439754459,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 1.0699000670595194e-05,
|
|
"loss": 1.0975,
|
|
"mean_token_accuracy": 0.7014547817409038,
|
|
"num_tokens": 369703262.0,
|
|
"step": 4935
|
|
},
|
|
{
|
|
"entropy": 1.091360279917717,
|
|
"epoch": 1.520950997277092,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.0682845594562892e-05,
|
|
"loss": 1.0927,
|
|
"mean_token_accuracy": 0.7037259839475155,
|
|
"num_tokens": 370094998.0,
|
|
"step": 4940
|
|
},
|
|
{
|
|
"entropy": 1.0874795876443386,
|
|
"epoch": 1.5224904505787382,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.066668872784762e-05,
|
|
"loss": 1.0817,
|
|
"mean_token_accuracy": 0.7028707899153233,
|
|
"num_tokens": 370473771.0,
|
|
"step": 4945
|
|
},
|
|
{
|
|
"entropy": 1.0719008050858974,
|
|
"epoch": 1.5240299038803844,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.0650530112818884e-05,
|
|
"loss": 1.0753,
|
|
"mean_token_accuracy": 0.7052478577941657,
|
|
"num_tokens": 370843105.0,
|
|
"step": 4950
|
|
},
|
|
{
|
|
"entropy": 1.0888731945306063,
|
|
"epoch": 1.5255693571820306,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.0634369791850761e-05,
|
|
"loss": 1.0789,
|
|
"mean_token_accuracy": 0.7031285293400288,
|
|
"num_tokens": 371220483.0,
|
|
"step": 4955
|
|
},
|
|
{
|
|
"entropy": 1.080846518278122,
|
|
"epoch": 1.527108810483677,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.0618207807321817e-05,
|
|
"loss": 1.0834,
|
|
"mean_token_accuracy": 0.7047945097088814,
|
|
"num_tokens": 371598916.0,
|
|
"step": 4960
|
|
},
|
|
{
|
|
"entropy": 1.1104522667825223,
|
|
"epoch": 1.5286482637853234,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.0602044201614965e-05,
|
|
"loss": 1.1029,
|
|
"mean_token_accuracy": 0.6997536733746529,
|
|
"num_tokens": 371974118.0,
|
|
"step": 4965
|
|
},
|
|
{
|
|
"entropy": 1.055209456756711,
|
|
"epoch": 1.5301877170869695,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.058587901711738e-05,
|
|
"loss": 1.0539,
|
|
"mean_token_accuracy": 0.7098731644451618,
|
|
"num_tokens": 372358939.0,
|
|
"step": 4970
|
|
},
|
|
{
|
|
"entropy": 1.138210940361023,
|
|
"epoch": 1.5317271703886157,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.0569712296220375e-05,
|
|
"loss": 1.1311,
|
|
"mean_token_accuracy": 0.6945899702608586,
|
|
"num_tokens": 372729363.0,
|
|
"step": 4975
|
|
},
|
|
{
|
|
"entropy": 1.0763438038527966,
|
|
"epoch": 1.533266623690262,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.055354408131929e-05,
|
|
"loss": 1.0736,
|
|
"mean_token_accuracy": 0.7102150522172451,
|
|
"num_tokens": 373108891.0,
|
|
"step": 4980
|
|
},
|
|
{
|
|
"entropy": 1.0876709651201963,
|
|
"epoch": 1.5348060769919083,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.0537374414813384e-05,
|
|
"loss": 1.086,
|
|
"mean_token_accuracy": 0.7007746994495392,
|
|
"num_tokens": 373481297.0,
|
|
"step": 4985
|
|
},
|
|
{
|
|
"entropy": 1.1017237912863493,
|
|
"epoch": 1.5363455302935545,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.0521203339105719e-05,
|
|
"loss": 1.0912,
|
|
"mean_token_accuracy": 0.7007615003734827,
|
|
"num_tokens": 373857906.0,
|
|
"step": 4990
|
|
},
|
|
{
|
|
"entropy": 1.0609590832144022,
|
|
"epoch": 1.5378849835952009,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.0505030896603059e-05,
|
|
"loss": 1.0593,
|
|
"mean_token_accuracy": 0.7097893103957176,
|
|
"num_tokens": 374233925.0,
|
|
"step": 4995
|
|
},
|
|
{
|
|
"entropy": 1.0860246624797583,
|
|
"epoch": 1.539424436896847,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.0488857129715748e-05,
|
|
"loss": 1.0739,
|
|
"mean_token_accuracy": 0.7066695354878902,
|
|
"num_tokens": 374605891.0,
|
|
"step": 5000
|
|
},
|
|
{
|
|
"entropy": 1.0733179308474063,
|
|
"epoch": 1.5409638901984932,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.0472682080857606e-05,
|
|
"loss": 1.0646,
|
|
"mean_token_accuracy": 0.7086676068603992,
|
|
"num_tokens": 374982619.0,
|
|
"step": 5005
|
|
},
|
|
{
|
|
"entropy": 1.0740364331752061,
|
|
"epoch": 1.5425033435001394,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.0456505792445812e-05,
|
|
"loss": 1.0727,
|
|
"mean_token_accuracy": 0.7087072696536779,
|
|
"num_tokens": 375340195.0,
|
|
"step": 5010
|
|
},
|
|
{
|
|
"entropy": 1.1030294133350254,
|
|
"epoch": 1.5440427968017858,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.0440328306900791e-05,
|
|
"loss": 1.092,
|
|
"mean_token_accuracy": 0.7018577672541142,
|
|
"num_tokens": 375722395.0,
|
|
"step": 5015
|
|
},
|
|
{
|
|
"entropy": 1.1037698114290833,
|
|
"epoch": 1.545582250103432,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.0424149666646124e-05,
|
|
"loss": 1.1025,
|
|
"mean_token_accuracy": 0.7017383199185133,
|
|
"num_tokens": 376104026.0,
|
|
"step": 5020
|
|
},
|
|
{
|
|
"entropy": 1.0805203307420015,
|
|
"epoch": 1.5471217034050784,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.04079699141084e-05,
|
|
"loss": 1.0811,
|
|
"mean_token_accuracy": 0.7060222543776036,
|
|
"num_tokens": 376481690.0,
|
|
"step": 5025
|
|
},
|
|
{
|
|
"entropy": 1.097636142000556,
|
|
"epoch": 1.5486611567067246,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.0391789091717142e-05,
|
|
"loss": 1.0878,
|
|
"mean_token_accuracy": 0.7033645544201136,
|
|
"num_tokens": 376843403.0,
|
|
"step": 5030
|
|
},
|
|
{
|
|
"entropy": 1.0879626598209142,
|
|
"epoch": 1.5502006100083707,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.037560724190466e-05,
|
|
"loss": 1.0752,
|
|
"mean_token_accuracy": 0.7057198133319617,
|
|
"num_tokens": 377224316.0,
|
|
"step": 5035
|
|
},
|
|
{
|
|
"entropy": 1.1175330474972724,
|
|
"epoch": 1.551740063310017,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.0359424407105976e-05,
|
|
"loss": 1.1319,
|
|
"mean_token_accuracy": 0.6976498179137707,
|
|
"num_tokens": 377590849.0,
|
|
"step": 5040
|
|
},
|
|
{
|
|
"entropy": 1.0952481867745518,
|
|
"epoch": 1.5532795166116633,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.0343240629758683e-05,
|
|
"loss": 1.086,
|
|
"mean_token_accuracy": 0.7038260884582996,
|
|
"num_tokens": 377960241.0,
|
|
"step": 5045
|
|
},
|
|
{
|
|
"entropy": 1.110863327048719,
|
|
"epoch": 1.5548189699133097,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.0327055952302856e-05,
|
|
"loss": 1.0993,
|
|
"mean_token_accuracy": 0.7002655819058419,
|
|
"num_tokens": 378332245.0,
|
|
"step": 5050
|
|
},
|
|
{
|
|
"entropy": 1.1037533113732934,
|
|
"epoch": 1.5563584232149559,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.0310870417180922e-05,
|
|
"loss": 1.0816,
|
|
"mean_token_accuracy": 0.704436918720603,
|
|
"num_tokens": 378690428.0,
|
|
"step": 5055
|
|
},
|
|
{
|
|
"entropy": 1.071759993210435,
|
|
"epoch": 1.557897876516602,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.0294684066837557e-05,
|
|
"loss": 1.0558,
|
|
"mean_token_accuracy": 0.7099790427833795,
|
|
"num_tokens": 379055530.0,
|
|
"step": 5060
|
|
},
|
|
{
|
|
"entropy": 1.0877855179831386,
|
|
"epoch": 1.5594373298182482,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.0278496943719585e-05,
|
|
"loss": 1.0822,
|
|
"mean_token_accuracy": 0.7042963620275259,
|
|
"num_tokens": 379431829.0,
|
|
"step": 5065
|
|
},
|
|
{
|
|
"entropy": 1.0980434942990542,
|
|
"epoch": 1.5609767831198944,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.0262309090275841e-05,
|
|
"loss": 1.0911,
|
|
"mean_token_accuracy": 0.702358391135931,
|
|
"num_tokens": 379813356.0,
|
|
"step": 5070
|
|
},
|
|
{
|
|
"entropy": 1.1178542736917734,
|
|
"epoch": 1.5625162364215408,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.0246120548957091e-05,
|
|
"loss": 1.1075,
|
|
"mean_token_accuracy": 0.6979184910655022,
|
|
"num_tokens": 380194940.0,
|
|
"step": 5075
|
|
},
|
|
{
|
|
"entropy": 1.0823489444330334,
|
|
"epoch": 1.5640556897231872,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.0229931362215891e-05,
|
|
"loss": 1.0866,
|
|
"mean_token_accuracy": 0.7059352733194828,
|
|
"num_tokens": 380570916.0,
|
|
"step": 5080
|
|
},
|
|
{
|
|
"entropy": 1.0442319322377442,
|
|
"epoch": 1.5655951430248334,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.0213741572506497e-05,
|
|
"loss": 1.0474,
|
|
"mean_token_accuracy": 0.712502782419324,
|
|
"num_tokens": 380928231.0,
|
|
"step": 5085
|
|
},
|
|
{
|
|
"entropy": 1.1027513600885868,
|
|
"epoch": 1.5671345963264796,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.0197551222284749e-05,
|
|
"loss": 1.0903,
|
|
"mean_token_accuracy": 0.7028210774064064,
|
|
"num_tokens": 381310711.0,
|
|
"step": 5090
|
|
},
|
|
{
|
|
"entropy": 1.101462545990944,
|
|
"epoch": 1.5686740496281257,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.0181360354007952e-05,
|
|
"loss": 1.0912,
|
|
"mean_token_accuracy": 0.7015898194164037,
|
|
"num_tokens": 381682990.0,
|
|
"step": 5095
|
|
},
|
|
{
|
|
"entropy": 1.0979160640388728,
|
|
"epoch": 1.570213502929772,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.0165169010134769e-05,
|
|
"loss": 1.0862,
|
|
"mean_token_accuracy": 0.7033981300890446,
|
|
"num_tokens": 382053899.0,
|
|
"step": 5100
|
|
},
|
|
{
|
|
"entropy": 1.0869064442813396,
|
|
"epoch": 1.5717529562314183,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.014897723312511e-05,
|
|
"loss": 1.0748,
|
|
"mean_token_accuracy": 0.7061148039996624,
|
|
"num_tokens": 382423768.0,
|
|
"step": 5105
|
|
},
|
|
{
|
|
"entropy": 1.0795267928391694,
|
|
"epoch": 1.5732924095330647,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.0132785065440027e-05,
|
|
"loss": 1.0691,
|
|
"mean_token_accuracy": 0.7053609773516655,
|
|
"num_tokens": 382798395.0,
|
|
"step": 5110
|
|
},
|
|
{
|
|
"entropy": 1.0610070837661625,
|
|
"epoch": 1.5748318628347109,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.0116592549541588e-05,
|
|
"loss": 1.0704,
|
|
"mean_token_accuracy": 0.7101053409278393,
|
|
"num_tokens": 383158627.0,
|
|
"step": 5115
|
|
},
|
|
{
|
|
"entropy": 1.1032455388456583,
|
|
"epoch": 1.576371316136357,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.010039972789278e-05,
|
|
"loss": 1.0963,
|
|
"mean_token_accuracy": 0.7017143130302429,
|
|
"num_tokens": 383542891.0,
|
|
"step": 5120
|
|
},
|
|
{
|
|
"entropy": 1.077076973207295,
|
|
"epoch": 1.5779107694380032,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.0084206642957393e-05,
|
|
"loss": 1.0704,
|
|
"mean_token_accuracy": 0.7088203649967909,
|
|
"num_tokens": 383914195.0,
|
|
"step": 5125
|
|
},
|
|
{
|
|
"entropy": 1.1076103821396828,
|
|
"epoch": 1.5794502227396496,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.0068013337199898e-05,
|
|
"loss": 1.108,
|
|
"mean_token_accuracy": 0.6964867271482944,
|
|
"num_tokens": 384292025.0,
|
|
"step": 5130
|
|
},
|
|
{
|
|
"entropy": 1.1222423382103444,
|
|
"epoch": 1.5809896760412958,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.0051819853085358e-05,
|
|
"loss": 1.1005,
|
|
"mean_token_accuracy": 0.6991239000111819,
|
|
"num_tokens": 384661073.0,
|
|
"step": 5135
|
|
},
|
|
{
|
|
"entropy": 1.0956567427143455,
|
|
"epoch": 1.5825291293429422,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.0035626233079291e-05,
|
|
"loss": 1.1005,
|
|
"mean_token_accuracy": 0.7006195738911629,
|
|
"num_tokens": 385041273.0,
|
|
"step": 5140
|
|
},
|
|
{
|
|
"entropy": 1.0967257339507341,
|
|
"epoch": 1.5840685826445884,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.0019432519647585e-05,
|
|
"loss": 1.0965,
|
|
"mean_token_accuracy": 0.7008111979812384,
|
|
"num_tokens": 385410981.0,
|
|
"step": 5145
|
|
},
|
|
{
|
|
"entropy": 1.0944808378815651,
|
|
"epoch": 1.5856080359462346,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.000323875525636e-05,
|
|
"loss": 1.0926,
|
|
"mean_token_accuracy": 0.7031497668474913,
|
|
"num_tokens": 385796010.0,
|
|
"step": 5150
|
|
},
|
|
{
|
|
"entropy": 1.095008300244808,
|
|
"epoch": 1.5871474892478807,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 9.987044982371875e-06,
|
|
"loss": 1.0916,
|
|
"mean_token_accuracy": 0.7031584359705448,
|
|
"num_tokens": 386157681.0,
|
|
"step": 5155
|
|
},
|
|
{
|
|
"entropy": 1.0735778704285621,
|
|
"epoch": 1.5886869425495271,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 9.970851243460416e-06,
|
|
"loss": 1.0697,
|
|
"mean_token_accuracy": 0.7077977582812309,
|
|
"num_tokens": 386526491.0,
|
|
"step": 5160
|
|
},
|
|
{
|
|
"entropy": 1.1072835041210056,
|
|
"epoch": 1.5902263958511733,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 9.954657580988171e-06,
|
|
"loss": 1.1086,
|
|
"mean_token_accuracy": 0.7007388435304165,
|
|
"num_tokens": 386895651.0,
|
|
"step": 5165
|
|
},
|
|
{
|
|
"entropy": 1.0722421571612357,
|
|
"epoch": 1.5917658491528197,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 9.938464037421138e-06,
|
|
"loss": 1.0811,
|
|
"mean_token_accuracy": 0.7076653763651848,
|
|
"num_tokens": 387270858.0,
|
|
"step": 5170
|
|
},
|
|
{
|
|
"entropy": 1.107360442727804,
|
|
"epoch": 1.5933053024544659,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 9.922270655224989e-06,
|
|
"loss": 1.0884,
|
|
"mean_token_accuracy": 0.6989858888089657,
|
|
"num_tokens": 387638286.0,
|
|
"step": 5175
|
|
},
|
|
{
|
|
"entropy": 1.0881507728248834,
|
|
"epoch": 1.594844755756112,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 9.906077476864986e-06,
|
|
"loss": 1.0799,
|
|
"mean_token_accuracy": 0.7046520821750164,
|
|
"num_tokens": 388021330.0,
|
|
"step": 5180
|
|
},
|
|
{
|
|
"entropy": 1.0813210971653462,
|
|
"epoch": 1.5963842090577582,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 9.88988454480585e-06,
|
|
"loss": 1.0851,
|
|
"mean_token_accuracy": 0.707437664270401,
|
|
"num_tokens": 388392673.0,
|
|
"step": 5185
|
|
},
|
|
{
|
|
"entropy": 1.0807713882997632,
|
|
"epoch": 1.5979236623594046,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 9.873691901511657e-06,
|
|
"loss": 1.0732,
|
|
"mean_token_accuracy": 0.7054242752492428,
|
|
"num_tokens": 388759792.0,
|
|
"step": 5190
|
|
},
|
|
{
|
|
"entropy": 1.084787630289793,
|
|
"epoch": 1.5994631156610508,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 9.857499589445731e-06,
|
|
"loss": 1.0975,
|
|
"mean_token_accuracy": 0.7042995512485504,
|
|
"num_tokens": 389135396.0,
|
|
"step": 5195
|
|
},
|
|
{
|
|
"entropy": 1.0929058007895947,
|
|
"epoch": 1.6010025689626972,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 9.841307651070516e-06,
|
|
"loss": 1.0902,
|
|
"mean_token_accuracy": 0.7021313033998012,
|
|
"num_tokens": 389510632.0,
|
|
"step": 5200
|
|
},
|
|
{
|
|
"entropy": 1.0921098245307803,
|
|
"epoch": 1.6025420222643434,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 9.825116128847488e-06,
|
|
"loss": 1.0828,
|
|
"mean_token_accuracy": 0.7056728139519691,
|
|
"num_tokens": 389876689.0,
|
|
"step": 5205
|
|
},
|
|
{
|
|
"entropy": 1.0983091555535793,
|
|
"epoch": 1.6040814755659896,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 9.808925065237023e-06,
|
|
"loss": 1.0958,
|
|
"mean_token_accuracy": 0.7012007147073746,
|
|
"num_tokens": 390275250.0,
|
|
"step": 5210
|
|
},
|
|
{
|
|
"entropy": 1.1344585316255689,
|
|
"epoch": 1.6056209288676357,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 9.792734502698301e-06,
|
|
"loss": 1.1235,
|
|
"mean_token_accuracy": 0.6990909531712532,
|
|
"num_tokens": 390648927.0,
|
|
"step": 5215
|
|
},
|
|
{
|
|
"entropy": 1.0990639347583055,
|
|
"epoch": 1.6071603821692821,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 9.776544483689182e-06,
|
|
"loss": 1.0946,
|
|
"mean_token_accuracy": 0.7016403157263994,
|
|
"num_tokens": 391038908.0,
|
|
"step": 5220
|
|
},
|
|
{
|
|
"entropy": 1.0563545716926455,
|
|
"epoch": 1.6086998354709285,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 9.760355050666102e-06,
|
|
"loss": 1.0496,
|
|
"mean_token_accuracy": 0.7107026908546686,
|
|
"num_tokens": 391431504.0,
|
|
"step": 5225
|
|
},
|
|
{
|
|
"entropy": 1.034896224923432,
|
|
"epoch": 1.6102392887725747,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 9.744166246083967e-06,
|
|
"loss": 1.0257,
|
|
"mean_token_accuracy": 0.7134051218628883,
|
|
"num_tokens": 391813698.0,
|
|
"step": 5230
|
|
},
|
|
{
|
|
"entropy": 1.0570100730285048,
|
|
"epoch": 1.611778742074221,
|
|
"grad_norm": 0.65625,
|
|
"learning_rate": 9.727978112396026e-06,
|
|
"loss": 1.0477,
|
|
"mean_token_accuracy": 0.7118912305682897,
|
|
"num_tokens": 392200231.0,
|
|
"step": 5235
|
|
},
|
|
{
|
|
"entropy": 1.082013985514641,
|
|
"epoch": 1.613318195375867,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 9.711790692053773e-06,
|
|
"loss": 1.0694,
|
|
"mean_token_accuracy": 0.7059489194303751,
|
|
"num_tokens": 392560134.0,
|
|
"step": 5240
|
|
},
|
|
{
|
|
"entropy": 1.0815768619999289,
|
|
"epoch": 1.6148576486775132,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 9.69560402750683e-06,
|
|
"loss": 1.0796,
|
|
"mean_token_accuracy": 0.7060687590390444,
|
|
"num_tokens": 392919900.0,
|
|
"step": 5245
|
|
},
|
|
{
|
|
"entropy": 1.0644411129876972,
|
|
"epoch": 1.6163971019791596,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 9.679418161202838e-06,
|
|
"loss": 1.0478,
|
|
"mean_token_accuracy": 0.7112126860767602,
|
|
"num_tokens": 393298789.0,
|
|
"step": 5250
|
|
},
|
|
{
|
|
"entropy": 1.1107116842642426,
|
|
"epoch": 1.617936555280806,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 9.663233135587347e-06,
|
|
"loss": 1.1172,
|
|
"mean_token_accuracy": 0.7001914702355861,
|
|
"num_tokens": 393663256.0,
|
|
"step": 5255
|
|
},
|
|
{
|
|
"entropy": 1.0641750687733293,
|
|
"epoch": 1.6194760085824522,
|
|
"grad_norm": 0.66015625,
|
|
"learning_rate": 9.6470489931037e-06,
|
|
"loss": 1.0608,
|
|
"mean_token_accuracy": 0.7058585990220309,
|
|
"num_tokens": 394045765.0,
|
|
"step": 5260
|
|
},
|
|
{
|
|
"entropy": 1.1164660055190325,
|
|
"epoch": 1.6210154618840984,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 9.630865776192918e-06,
|
|
"loss": 1.1029,
|
|
"mean_token_accuracy": 0.7022516313940287,
|
|
"num_tokens": 394417760.0,
|
|
"step": 5265
|
|
},
|
|
{
|
|
"entropy": 1.1058620760217308,
|
|
"epoch": 1.6225549151857446,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 9.614683527293608e-06,
|
|
"loss": 1.1006,
|
|
"mean_token_accuracy": 0.7010145273059607,
|
|
"num_tokens": 394794201.0,
|
|
"step": 5270
|
|
},
|
|
{
|
|
"entropy": 1.1190495744347573,
|
|
"epoch": 1.6240943684873907,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 9.598502288841827e-06,
|
|
"loss": 1.1098,
|
|
"mean_token_accuracy": 0.6974843364208937,
|
|
"num_tokens": 395156235.0,
|
|
"step": 5275
|
|
},
|
|
{
|
|
"entropy": 1.0741985043510796,
|
|
"epoch": 1.6256338217890371,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 9.582322103270989e-06,
|
|
"loss": 1.0666,
|
|
"mean_token_accuracy": 0.7068505808711052,
|
|
"num_tokens": 395526552.0,
|
|
"step": 5280
|
|
},
|
|
{
|
|
"entropy": 1.081602037884295,
|
|
"epoch": 1.6271732750906835,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 9.56614301301174e-06,
|
|
"loss": 1.07,
|
|
"mean_token_accuracy": 0.7066264219582081,
|
|
"num_tokens": 395891206.0,
|
|
"step": 5285
|
|
},
|
|
{
|
|
"entropy": 1.0990107230842114,
|
|
"epoch": 1.6287127283923297,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 9.549965060491862e-06,
|
|
"loss": 1.0809,
|
|
"mean_token_accuracy": 0.7025953829288483,
|
|
"num_tokens": 396268742.0,
|
|
"step": 5290
|
|
},
|
|
{
|
|
"entropy": 1.1323769055306911,
|
|
"epoch": 1.630252181693976,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 9.533788288136149e-06,
|
|
"loss": 1.1309,
|
|
"mean_token_accuracy": 0.6962556965649128,
|
|
"num_tokens": 396629849.0,
|
|
"step": 5295
|
|
},
|
|
{
|
|
"entropy": 1.1434271398931741,
|
|
"epoch": 1.631791634995622,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 9.517612738366299e-06,
|
|
"loss": 1.1322,
|
|
"mean_token_accuracy": 0.6953991457819939,
|
|
"num_tokens": 396992249.0,
|
|
"step": 5300
|
|
},
|
|
{
|
|
"entropy": 1.1273887475952507,
|
|
"epoch": 1.6333310882972685,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 9.501438453600808e-06,
|
|
"loss": 1.1108,
|
|
"mean_token_accuracy": 0.698949940316379,
|
|
"num_tokens": 397367021.0,
|
|
"step": 5305
|
|
},
|
|
{
|
|
"entropy": 1.0627528240904212,
|
|
"epoch": 1.6348705415989147,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 9.485265476254849e-06,
|
|
"loss": 1.0568,
|
|
"mean_token_accuracy": 0.7074823923408985,
|
|
"num_tokens": 397748450.0,
|
|
"step": 5310
|
|
},
|
|
{
|
|
"entropy": 1.1027033567428588,
|
|
"epoch": 1.636409994900561,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 9.469093848740172e-06,
|
|
"loss": 1.1083,
|
|
"mean_token_accuracy": 0.7020572334527969,
|
|
"num_tokens": 398133819.0,
|
|
"step": 5315
|
|
},
|
|
{
|
|
"entropy": 1.1062870137393475,
|
|
"epoch": 1.6379494482022072,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 9.452923613464984e-06,
|
|
"loss": 1.0973,
|
|
"mean_token_accuracy": 0.7047305293381214,
|
|
"num_tokens": 398518230.0,
|
|
"step": 5320
|
|
},
|
|
{
|
|
"entropy": 1.0817337388172745,
|
|
"epoch": 1.6394889015038534,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 9.436754812833843e-06,
|
|
"loss": 1.0608,
|
|
"mean_token_accuracy": 0.7069010555744171,
|
|
"num_tokens": 398895726.0,
|
|
"step": 5325
|
|
},
|
|
{
|
|
"entropy": 1.0478235995396972,
|
|
"epoch": 1.6410283548054996,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 9.420587489247544e-06,
|
|
"loss": 1.0392,
|
|
"mean_token_accuracy": 0.7143516495823861,
|
|
"num_tokens": 399270657.0,
|
|
"step": 5330
|
|
},
|
|
{
|
|
"entropy": 1.0742226297035813,
|
|
"epoch": 1.642567808107146,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 9.404421685103004e-06,
|
|
"loss": 1.0768,
|
|
"mean_token_accuracy": 0.7064595274627209,
|
|
"num_tokens": 399641907.0,
|
|
"step": 5335
|
|
},
|
|
{
|
|
"entropy": 1.0664239136502147,
|
|
"epoch": 1.6441072614087922,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 9.388257442793167e-06,
|
|
"loss": 1.0549,
|
|
"mean_token_accuracy": 0.709942888841033,
|
|
"num_tokens": 400028084.0,
|
|
"step": 5340
|
|
},
|
|
{
|
|
"entropy": 1.085717361792922,
|
|
"epoch": 1.6456467147104386,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 9.372094804706867e-06,
|
|
"loss": 1.0742,
|
|
"mean_token_accuracy": 0.7053239069879055,
|
|
"num_tokens": 400405815.0,
|
|
"step": 5345
|
|
},
|
|
{
|
|
"entropy": 1.128715405613184,
|
|
"epoch": 1.6471861680120847,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 9.355933813228743e-06,
|
|
"loss": 1.1377,
|
|
"mean_token_accuracy": 0.6944836590439081,
|
|
"num_tokens": 400777621.0,
|
|
"step": 5350
|
|
},
|
|
{
|
|
"entropy": 1.0972968596965074,
|
|
"epoch": 1.648725621313731,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 9.339774510739107e-06,
|
|
"loss": 1.0941,
|
|
"mean_token_accuracy": 0.7009974624961615,
|
|
"num_tokens": 401145644.0,
|
|
"step": 5355
|
|
},
|
|
{
|
|
"entropy": 1.0982206501066685,
|
|
"epoch": 1.650265074615377,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 9.32361693961385e-06,
|
|
"loss": 1.0932,
|
|
"mean_token_accuracy": 0.7033186536282301,
|
|
"num_tokens": 401527283.0,
|
|
"step": 5360
|
|
},
|
|
{
|
|
"entropy": 1.070047876611352,
|
|
"epoch": 1.6518045279170235,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 9.307461142224318e-06,
|
|
"loss": 1.06,
|
|
"mean_token_accuracy": 0.7093065988272429,
|
|
"num_tokens": 401900009.0,
|
|
"step": 5365
|
|
},
|
|
{
|
|
"entropy": 1.0823601890355348,
|
|
"epoch": 1.6533439812186699,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 9.291307160937205e-06,
|
|
"loss": 1.0852,
|
|
"mean_token_accuracy": 0.7042948927730321,
|
|
"num_tokens": 402287790.0,
|
|
"step": 5370
|
|
},
|
|
{
|
|
"entropy": 1.043049761094153,
|
|
"epoch": 1.654883434520316,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 9.275155038114442e-06,
|
|
"loss": 1.0357,
|
|
"mean_token_accuracy": 0.7130959361791611,
|
|
"num_tokens": 402667836.0,
|
|
"step": 5375
|
|
},
|
|
{
|
|
"entropy": 1.0972856478765607,
|
|
"epoch": 1.6564228878219622,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 9.259004816113092e-06,
|
|
"loss": 1.0896,
|
|
"mean_token_accuracy": 0.7000352583825589,
|
|
"num_tokens": 403037749.0,
|
|
"step": 5380
|
|
},
|
|
{
|
|
"entropy": 1.1010639168322087,
|
|
"epoch": 1.6579623411236084,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 9.242856537285227e-06,
|
|
"loss": 1.0951,
|
|
"mean_token_accuracy": 0.7032855857163668,
|
|
"num_tokens": 403402020.0,
|
|
"step": 5385
|
|
},
|
|
{
|
|
"entropy": 1.127296519652009,
|
|
"epoch": 1.6595017944252546,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 9.226710243977825e-06,
|
|
"loss": 1.1223,
|
|
"mean_token_accuracy": 0.6977074593305588,
|
|
"num_tokens": 403789310.0,
|
|
"step": 5390
|
|
},
|
|
{
|
|
"entropy": 1.1027636034414172,
|
|
"epoch": 1.661041247726901,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 9.21056597853266e-06,
|
|
"loss": 1.0802,
|
|
"mean_token_accuracy": 0.7017194341868163,
|
|
"num_tokens": 404175821.0,
|
|
"step": 5395
|
|
},
|
|
{
|
|
"entropy": 1.1191116388887168,
|
|
"epoch": 1.6625807010285474,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 9.194423783286185e-06,
|
|
"loss": 1.1219,
|
|
"mean_token_accuracy": 0.6969028972089291,
|
|
"num_tokens": 404571869.0,
|
|
"step": 5400
|
|
},
|
|
{
|
|
"entropy": 1.1187451992183923,
|
|
"epoch": 1.6641201543301936,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 9.178283700569424e-06,
|
|
"loss": 1.1173,
|
|
"mean_token_accuracy": 0.6981020383536816,
|
|
"num_tokens": 404949812.0,
|
|
"step": 5405
|
|
},
|
|
{
|
|
"entropy": 1.0505651988089084,
|
|
"epoch": 1.6656596076318397,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 9.162145772707867e-06,
|
|
"loss": 1.0291,
|
|
"mean_token_accuracy": 0.712232394516468,
|
|
"num_tokens": 405329917.0,
|
|
"step": 5410
|
|
},
|
|
{
|
|
"entropy": 1.1198286700993776,
|
|
"epoch": 1.667199060933486,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 9.146010042021341e-06,
|
|
"loss": 1.101,
|
|
"mean_token_accuracy": 0.7004202278330922,
|
|
"num_tokens": 405705260.0,
|
|
"step": 5415
|
|
},
|
|
{
|
|
"entropy": 1.0653447445482016,
|
|
"epoch": 1.668738514235132,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 9.129876550823926e-06,
|
|
"loss": 1.0451,
|
|
"mean_token_accuracy": 0.709304316714406,
|
|
"num_tokens": 406074228.0,
|
|
"step": 5420
|
|
},
|
|
{
|
|
"entropy": 1.1220490790903568,
|
|
"epoch": 1.6702779675367785,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 9.113745341423816e-06,
|
|
"loss": 1.1186,
|
|
"mean_token_accuracy": 0.6989111371338368,
|
|
"num_tokens": 406455172.0,
|
|
"step": 5425
|
|
},
|
|
{
|
|
"entropy": 1.0868219153955578,
|
|
"epoch": 1.6718174208384249,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 9.09761645612323e-06,
|
|
"loss": 1.0755,
|
|
"mean_token_accuracy": 0.7040824361145497,
|
|
"num_tokens": 406826607.0,
|
|
"step": 5430
|
|
},
|
|
{
|
|
"entropy": 1.1298202399164439,
|
|
"epoch": 1.673356874140071,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 9.081489937218293e-06,
|
|
"loss": 1.1207,
|
|
"mean_token_accuracy": 0.6948817294090986,
|
|
"num_tokens": 407201738.0,
|
|
"step": 5435
|
|
},
|
|
{
|
|
"entropy": 1.1080457199364901,
|
|
"epoch": 1.6748963274417172,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 9.065365826998913e-06,
|
|
"loss": 1.0919,
|
|
"mean_token_accuracy": 0.7014391742646694,
|
|
"num_tokens": 407570526.0,
|
|
"step": 5440
|
|
},
|
|
{
|
|
"entropy": 1.1008265187963844,
|
|
"epoch": 1.6764357807433634,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 9.049244167748694e-06,
|
|
"loss": 1.0848,
|
|
"mean_token_accuracy": 0.7035315703600645,
|
|
"num_tokens": 407946775.0,
|
|
"step": 5445
|
|
},
|
|
{
|
|
"entropy": 1.1211753750219942,
|
|
"epoch": 1.6779752340450098,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 9.033125001744807e-06,
|
|
"loss": 1.107,
|
|
"mean_token_accuracy": 0.699267415329814,
|
|
"num_tokens": 408311759.0,
|
|
"step": 5450
|
|
},
|
|
{
|
|
"entropy": 1.0925109470263124,
|
|
"epoch": 1.679514687346656,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 9.017008371257887e-06,
|
|
"loss": 1.0782,
|
|
"mean_token_accuracy": 0.7053051277995109,
|
|
"num_tokens": 408676723.0,
|
|
"step": 5455
|
|
},
|
|
{
|
|
"entropy": 1.1009349424391985,
|
|
"epoch": 1.6810541406483024,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 9.000894318551914e-06,
|
|
"loss": 1.0966,
|
|
"mean_token_accuracy": 0.6999417837709189,
|
|
"num_tokens": 409064666.0,
|
|
"step": 5460
|
|
},
|
|
{
|
|
"entropy": 1.1137631081044674,
|
|
"epoch": 1.6825935939499486,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 8.984782885884119e-06,
|
|
"loss": 1.102,
|
|
"mean_token_accuracy": 0.696934137865901,
|
|
"num_tokens": 409422309.0,
|
|
"step": 5465
|
|
},
|
|
{
|
|
"entropy": 1.1327384024858476,
|
|
"epoch": 1.6841330472515947,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 8.968674115504853e-06,
|
|
"loss": 1.1184,
|
|
"mean_token_accuracy": 0.6953623220324516,
|
|
"num_tokens": 409788951.0,
|
|
"step": 5470
|
|
},
|
|
{
|
|
"entropy": 1.0916108842939138,
|
|
"epoch": 1.685672500553241,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 8.952568049657488e-06,
|
|
"loss": 1.0942,
|
|
"mean_token_accuracy": 0.7030161291360855,
|
|
"num_tokens": 410165321.0,
|
|
"step": 5475
|
|
},
|
|
{
|
|
"entropy": 1.0850483747199178,
|
|
"epoch": 1.6872119538548873,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 8.936464730578305e-06,
|
|
"loss": 1.0872,
|
|
"mean_token_accuracy": 0.7046362012624741,
|
|
"num_tokens": 410539597.0,
|
|
"step": 5480
|
|
},
|
|
{
|
|
"entropy": 1.0822600834071636,
|
|
"epoch": 1.6887514071565335,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 8.92036420049638e-06,
|
|
"loss": 1.0879,
|
|
"mean_token_accuracy": 0.7063710629940033,
|
|
"num_tokens": 410911686.0,
|
|
"step": 5485
|
|
},
|
|
{
|
|
"entropy": 1.1023914152756333,
|
|
"epoch": 1.69029086045818,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 8.904266501633478e-06,
|
|
"loss": 1.0918,
|
|
"mean_token_accuracy": 0.7032347891479731,
|
|
"num_tokens": 411291904.0,
|
|
"step": 5490
|
|
},
|
|
{
|
|
"entropy": 1.1429678972810506,
|
|
"epoch": 1.691830313759826,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 8.888171676203933e-06,
|
|
"loss": 1.1477,
|
|
"mean_token_accuracy": 0.6976863609626889,
|
|
"num_tokens": 411663508.0,
|
|
"step": 5495
|
|
},
|
|
{
|
|
"entropy": 1.0935937503352762,
|
|
"epoch": 1.6933697670614722,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 8.872079766414554e-06,
|
|
"loss": 1.0857,
|
|
"mean_token_accuracy": 0.7036001961678267,
|
|
"num_tokens": 412036793.0,
|
|
"step": 5500
|
|
},
|
|
{
|
|
"entropy": 1.1136181958019733,
|
|
"epoch": 1.6949092203631184,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 8.855990814464497e-06,
|
|
"loss": 1.1039,
|
|
"mean_token_accuracy": 0.7007360830903053,
|
|
"num_tokens": 412417002.0,
|
|
"step": 5505
|
|
},
|
|
{
|
|
"entropy": 1.0988651858642697,
|
|
"epoch": 1.6964486736647648,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 8.839904862545159e-06,
|
|
"loss": 1.091,
|
|
"mean_token_accuracy": 0.7032442104071379,
|
|
"num_tokens": 412787023.0,
|
|
"step": 5510
|
|
},
|
|
{
|
|
"entropy": 1.1131159963086248,
|
|
"epoch": 1.6979881269664112,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 8.823821952840079e-06,
|
|
"loss": 1.1043,
|
|
"mean_token_accuracy": 0.7012746006250381,
|
|
"num_tokens": 413158657.0,
|
|
"step": 5515
|
|
},
|
|
{
|
|
"entropy": 1.0874667253345252,
|
|
"epoch": 1.6995275802680574,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 8.807742127524808e-06,
|
|
"loss": 1.0856,
|
|
"mean_token_accuracy": 0.7013919126242399,
|
|
"num_tokens": 413530580.0,
|
|
"step": 5520
|
|
},
|
|
{
|
|
"entropy": 1.079220143519342,
|
|
"epoch": 1.7010670335697036,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 8.79166542876682e-06,
|
|
"loss": 1.077,
|
|
"mean_token_accuracy": 0.7076218347996474,
|
|
"num_tokens": 413895117.0,
|
|
"step": 5525
|
|
},
|
|
{
|
|
"entropy": 1.1426918597891926,
|
|
"epoch": 1.7026064868713497,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 8.775591898725374e-06,
|
|
"loss": 1.1407,
|
|
"mean_token_accuracy": 0.6936671763658524,
|
|
"num_tokens": 414279508.0,
|
|
"step": 5530
|
|
},
|
|
{
|
|
"entropy": 1.0584485813975335,
|
|
"epoch": 1.704145940172996,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 8.759521579551434e-06,
|
|
"loss": 1.0555,
|
|
"mean_token_accuracy": 0.7117119245231152,
|
|
"num_tokens": 414648849.0,
|
|
"step": 5535
|
|
},
|
|
{
|
|
"entropy": 1.0914806140586735,
|
|
"epoch": 1.7056853934746423,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 8.743454513387541e-06,
|
|
"loss": 1.0688,
|
|
"mean_token_accuracy": 0.7078217603266239,
|
|
"num_tokens": 415010706.0,
|
|
"step": 5540
|
|
},
|
|
{
|
|
"entropy": 1.0556861903518437,
|
|
"epoch": 1.7072248467762887,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 8.727390742367698e-06,
|
|
"loss": 1.0534,
|
|
"mean_token_accuracy": 0.7101626586169004,
|
|
"num_tokens": 415378532.0,
|
|
"step": 5545
|
|
},
|
|
{
|
|
"entropy": 1.0756891015917063,
|
|
"epoch": 1.708764300077935,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 8.711330308617274e-06,
|
|
"loss": 1.0776,
|
|
"mean_token_accuracy": 0.7052407611161471,
|
|
"num_tokens": 415749659.0,
|
|
"step": 5550
|
|
},
|
|
{
|
|
"entropy": 1.0492336470633745,
|
|
"epoch": 1.710303753379581,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 8.695273254252884e-06,
|
|
"loss": 1.0424,
|
|
"mean_token_accuracy": 0.7122261185199023,
|
|
"num_tokens": 416129112.0,
|
|
"step": 5555
|
|
},
|
|
{
|
|
"entropy": 1.1031751161441208,
|
|
"epoch": 1.7118432066812272,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 8.679219621382283e-06,
|
|
"loss": 1.0942,
|
|
"mean_token_accuracy": 0.7024187419563532,
|
|
"num_tokens": 416520439.0,
|
|
"step": 5560
|
|
},
|
|
{
|
|
"entropy": 1.1054791137576103,
|
|
"epoch": 1.7133826599828734,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 8.663169452104248e-06,
|
|
"loss": 1.0954,
|
|
"mean_token_accuracy": 0.7027520965784788,
|
|
"num_tokens": 416874084.0,
|
|
"step": 5565
|
|
},
|
|
{
|
|
"entropy": 1.036722397059202,
|
|
"epoch": 1.7149221132845198,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 8.647122788508482e-06,
|
|
"loss": 1.0336,
|
|
"mean_token_accuracy": 0.716812988743186,
|
|
"num_tokens": 417242954.0,
|
|
"step": 5570
|
|
},
|
|
{
|
|
"entropy": 1.098541335389018,
|
|
"epoch": 1.7164615665861662,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 8.631079672675483e-06,
|
|
"loss": 1.0877,
|
|
"mean_token_accuracy": 0.7014626737684011,
|
|
"num_tokens": 417602712.0,
|
|
"step": 5575
|
|
},
|
|
{
|
|
"entropy": 1.10658666677773,
|
|
"epoch": 1.7180010198878124,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 8.61504014667646e-06,
|
|
"loss": 1.0984,
|
|
"mean_token_accuracy": 0.703462628647685,
|
|
"num_tokens": 417970322.0,
|
|
"step": 5580
|
|
},
|
|
{
|
|
"entropy": 1.0676762524992227,
|
|
"epoch": 1.7195404731894586,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 8.599004252573191e-06,
|
|
"loss": 1.0685,
|
|
"mean_token_accuracy": 0.706639882735908,
|
|
"num_tokens": 418353866.0,
|
|
"step": 5585
|
|
},
|
|
{
|
|
"entropy": 1.0702585350722074,
|
|
"epoch": 1.7210799264911048,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 8.582972032417946e-06,
|
|
"loss": 1.0689,
|
|
"mean_token_accuracy": 0.7077822372317314,
|
|
"num_tokens": 418745935.0,
|
|
"step": 5590
|
|
},
|
|
{
|
|
"entropy": 1.103281536512077,
|
|
"epoch": 1.7226193797927511,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 8.566943528253348e-06,
|
|
"loss": 1.0884,
|
|
"mean_token_accuracy": 0.7030359204858542,
|
|
"num_tokens": 419128577.0,
|
|
"step": 5595
|
|
},
|
|
{
|
|
"entropy": 1.10045984685421,
|
|
"epoch": 1.7241588330943973,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 8.550918782112284e-06,
|
|
"loss": 1.0917,
|
|
"mean_token_accuracy": 0.7010609969496727,
|
|
"num_tokens": 419510963.0,
|
|
"step": 5600
|
|
},
|
|
{
|
|
"entropy": 1.095107021741569,
|
|
"epoch": 1.7256982863960437,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 8.534897836017784e-06,
|
|
"loss": 1.0867,
|
|
"mean_token_accuracy": 0.7037164829671383,
|
|
"num_tokens": 419878948.0,
|
|
"step": 5605
|
|
},
|
|
{
|
|
"entropy": 1.1128113843500613,
|
|
"epoch": 1.72723773969769,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 8.518880731982908e-06,
|
|
"loss": 1.1021,
|
|
"mean_token_accuracy": 0.6985711392015219,
|
|
"num_tokens": 420243904.0,
|
|
"step": 5610
|
|
},
|
|
{
|
|
"entropy": 1.0931318327784538,
|
|
"epoch": 1.728777192999336,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 8.502867512010645e-06,
|
|
"loss": 1.0927,
|
|
"mean_token_accuracy": 0.701465229690075,
|
|
"num_tokens": 420631698.0,
|
|
"step": 5615
|
|
},
|
|
{
|
|
"entropy": 1.1319708310067653,
|
|
"epoch": 1.7303166463009823,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 8.486858218093798e-06,
|
|
"loss": 1.1243,
|
|
"mean_token_accuracy": 0.6951664183288813,
|
|
"num_tokens": 421015377.0,
|
|
"step": 5620
|
|
},
|
|
{
|
|
"entropy": 1.0940919682383536,
|
|
"epoch": 1.7318560996026287,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 8.470852892214875e-06,
|
|
"loss": 1.0916,
|
|
"mean_token_accuracy": 0.7021523643285036,
|
|
"num_tokens": 421384264.0,
|
|
"step": 5625
|
|
},
|
|
{
|
|
"entropy": 1.1042205872014166,
|
|
"epoch": 1.7333955529042748,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 8.454851576345975e-06,
|
|
"loss": 1.0839,
|
|
"mean_token_accuracy": 0.703589740768075,
|
|
"num_tokens": 421759789.0,
|
|
"step": 5630
|
|
},
|
|
{
|
|
"entropy": 1.1057137260213494,
|
|
"epoch": 1.7349350062059212,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 8.438854312448683e-06,
|
|
"loss": 1.0956,
|
|
"mean_token_accuracy": 0.7006509575992823,
|
|
"num_tokens": 422131167.0,
|
|
"step": 5635
|
|
},
|
|
{
|
|
"entropy": 1.1068471031263472,
|
|
"epoch": 1.7364744595075674,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 8.422861142473964e-06,
|
|
"loss": 1.0919,
|
|
"mean_token_accuracy": 0.7017934639006853,
|
|
"num_tokens": 422515174.0,
|
|
"step": 5640
|
|
},
|
|
{
|
|
"entropy": 1.0898474426940084,
|
|
"epoch": 1.7380139128092136,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 8.406872108362034e-06,
|
|
"loss": 1.0797,
|
|
"mean_token_accuracy": 0.7033606130629778,
|
|
"num_tokens": 422909795.0,
|
|
"step": 5645
|
|
},
|
|
{
|
|
"entropy": 1.1069761399179696,
|
|
"epoch": 1.7395533661108598,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 8.390887252042279e-06,
|
|
"loss": 1.0986,
|
|
"mean_token_accuracy": 0.69997054412961,
|
|
"num_tokens": 423294536.0,
|
|
"step": 5650
|
|
},
|
|
{
|
|
"entropy": 1.123868912830949,
|
|
"epoch": 1.7410928194125062,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 8.374906615433114e-06,
|
|
"loss": 1.1149,
|
|
"mean_token_accuracy": 0.6974284335970878,
|
|
"num_tokens": 423667716.0,
|
|
"step": 5655
|
|
},
|
|
{
|
|
"entropy": 1.1244211729615927,
|
|
"epoch": 1.7426322727141526,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 8.358930240441902e-06,
|
|
"loss": 1.1184,
|
|
"mean_token_accuracy": 0.6964607492089272,
|
|
"num_tokens": 424041824.0,
|
|
"step": 5660
|
|
},
|
|
{
|
|
"entropy": 1.0918286059051752,
|
|
"epoch": 1.7441717260157987,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 8.342958168964816e-06,
|
|
"loss": 1.0821,
|
|
"mean_token_accuracy": 0.7037910025566816,
|
|
"num_tokens": 424413716.0,
|
|
"step": 5665
|
|
},
|
|
{
|
|
"entropy": 1.1624758195132017,
|
|
"epoch": 1.745711179317445,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 8.32699044288676e-06,
|
|
"loss": 1.1621,
|
|
"mean_token_accuracy": 0.6904738619923592,
|
|
"num_tokens": 424797399.0,
|
|
"step": 5670
|
|
},
|
|
{
|
|
"entropy": 1.0800057779997587,
|
|
"epoch": 1.747250632619091,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 8.311027104081228e-06,
|
|
"loss": 1.0755,
|
|
"mean_token_accuracy": 0.7068451933562756,
|
|
"num_tokens": 425172375.0,
|
|
"step": 5675
|
|
},
|
|
{
|
|
"entropy": 1.1069422330707313,
|
|
"epoch": 1.7487900859207373,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 8.295068194410218e-06,
|
|
"loss": 1.0994,
|
|
"mean_token_accuracy": 0.7014332462102175,
|
|
"num_tokens": 425558343.0,
|
|
"step": 5680
|
|
},
|
|
{
|
|
"entropy": 1.0946287367492915,
|
|
"epoch": 1.7503295392223837,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 8.27911375572411e-06,
|
|
"loss": 1.0922,
|
|
"mean_token_accuracy": 0.703186864592135,
|
|
"num_tokens": 425920325.0,
|
|
"step": 5685
|
|
},
|
|
{
|
|
"entropy": 1.105644273199141,
|
|
"epoch": 1.75186899252403,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 8.263163829861558e-06,
|
|
"loss": 1.1003,
|
|
"mean_token_accuracy": 0.7005987077951431,
|
|
"num_tokens": 426299930.0,
|
|
"step": 5690
|
|
},
|
|
{
|
|
"entropy": 1.0577386191114784,
|
|
"epoch": 1.7534084458256762,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 8.247218458649385e-06,
|
|
"loss": 1.0347,
|
|
"mean_token_accuracy": 0.7110945172607899,
|
|
"num_tokens": 426666312.0,
|
|
"step": 5695
|
|
},
|
|
{
|
|
"entropy": 1.1100200988352298,
|
|
"epoch": 1.7549478991273224,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 8.231277683902466e-06,
|
|
"loss": 1.1071,
|
|
"mean_token_accuracy": 0.6992266450077296,
|
|
"num_tokens": 427053081.0,
|
|
"step": 5700
|
|
},
|
|
{
|
|
"entropy": 1.088809297606349,
|
|
"epoch": 1.7564873524289686,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 8.215341547423624e-06,
|
|
"loss": 1.089,
|
|
"mean_token_accuracy": 0.7016501687467098,
|
|
"num_tokens": 427437676.0,
|
|
"step": 5705
|
|
},
|
|
{
|
|
"entropy": 1.1294033788144588,
|
|
"epoch": 1.7580268057306148,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 8.199410091003523e-06,
|
|
"loss": 1.1216,
|
|
"mean_token_accuracy": 0.6971236113458872,
|
|
"num_tokens": 427817613.0,
|
|
"step": 5710
|
|
},
|
|
{
|
|
"entropy": 1.0951994739472866,
|
|
"epoch": 1.7595662590322612,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 8.183483356420547e-06,
|
|
"loss": 1.0912,
|
|
"mean_token_accuracy": 0.703892882540822,
|
|
"num_tokens": 428188343.0,
|
|
"step": 5715
|
|
},
|
|
{
|
|
"entropy": 1.0782027332112194,
|
|
"epoch": 1.7611057123339076,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 8.167561385440704e-06,
|
|
"loss": 1.0585,
|
|
"mean_token_accuracy": 0.7048128854483366,
|
|
"num_tokens": 428563256.0,
|
|
"step": 5720
|
|
},
|
|
{
|
|
"entropy": 1.1324778091162444,
|
|
"epoch": 1.7626451656355537,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 8.1516442198175e-06,
|
|
"loss": 1.1191,
|
|
"mean_token_accuracy": 0.6989505536854267,
|
|
"num_tokens": 428934651.0,
|
|
"step": 5725
|
|
},
|
|
{
|
|
"entropy": 1.100608916580677,
|
|
"epoch": 1.7641846189372,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 8.135731901291854e-06,
|
|
"loss": 1.0997,
|
|
"mean_token_accuracy": 0.701317035779357,
|
|
"num_tokens": 429303348.0,
|
|
"step": 5730
|
|
},
|
|
{
|
|
"entropy": 1.091795919649303,
|
|
"epoch": 1.765724072238846,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 8.119824471591962e-06,
|
|
"loss": 1.0759,
|
|
"mean_token_accuracy": 0.7031828835606575,
|
|
"num_tokens": 429675584.0,
|
|
"step": 5735
|
|
},
|
|
{
|
|
"entropy": 1.1314243663102388,
|
|
"epoch": 1.7672635255404925,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 8.103921972433205e-06,
|
|
"loss": 1.1242,
|
|
"mean_token_accuracy": 0.6955042466521263,
|
|
"num_tokens": 430060030.0,
|
|
"step": 5740
|
|
},
|
|
{
|
|
"entropy": 1.1276394352316856,
|
|
"epoch": 1.7688029788421387,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 8.088024445518033e-06,
|
|
"loss": 1.1155,
|
|
"mean_token_accuracy": 0.6983948316425085,
|
|
"num_tokens": 430432590.0,
|
|
"step": 5745
|
|
},
|
|
{
|
|
"entropy": 1.0966423366218805,
|
|
"epoch": 1.770342432143785,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 8.072131932535855e-06,
|
|
"loss": 1.0801,
|
|
"mean_token_accuracy": 0.7039676802232862,
|
|
"num_tokens": 430800336.0,
|
|
"step": 5750
|
|
},
|
|
{
|
|
"entropy": 1.0784130362793802,
|
|
"epoch": 1.7718818854454312,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 8.056244475162938e-06,
|
|
"loss": 1.0838,
|
|
"mean_token_accuracy": 0.7049125794321298,
|
|
"num_tokens": 431178952.0,
|
|
"step": 5755
|
|
},
|
|
{
|
|
"entropy": 1.1216689372435211,
|
|
"epoch": 1.7734213387470774,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 8.040362115062282e-06,
|
|
"loss": 1.0902,
|
|
"mean_token_accuracy": 0.7011063350364566,
|
|
"num_tokens": 431558004.0,
|
|
"step": 5760
|
|
},
|
|
{
|
|
"entropy": 1.1165176600217819,
|
|
"epoch": 1.7749607920487236,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 8.02448489388353e-06,
|
|
"loss": 1.1137,
|
|
"mean_token_accuracy": 0.7000920219346881,
|
|
"num_tokens": 431948120.0,
|
|
"step": 5765
|
|
},
|
|
{
|
|
"entropy": 1.0720734087750317,
|
|
"epoch": 1.77650024535037,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 8.008612853262837e-06,
|
|
"loss": 1.0601,
|
|
"mean_token_accuracy": 0.708555044978857,
|
|
"num_tokens": 432308263.0,
|
|
"step": 5770
|
|
},
|
|
{
|
|
"entropy": 1.0993305299431086,
|
|
"epoch": 1.7780396986520162,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 7.992746034822783e-06,
|
|
"loss": 1.1032,
|
|
"mean_token_accuracy": 0.7005016192793846,
|
|
"num_tokens": 432685864.0,
|
|
"step": 5775
|
|
},
|
|
{
|
|
"entropy": 1.1099201546981932,
|
|
"epoch": 1.7795791519536626,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 7.976884480172254e-06,
|
|
"loss": 1.1059,
|
|
"mean_token_accuracy": 0.7001881796866656,
|
|
"num_tokens": 433076617.0,
|
|
"step": 5780
|
|
},
|
|
{
|
|
"entropy": 1.0762454096227885,
|
|
"epoch": 1.7811186052553087,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 7.96102823090632e-06,
|
|
"loss": 1.0824,
|
|
"mean_token_accuracy": 0.7059057362377643,
|
|
"num_tokens": 433465666.0,
|
|
"step": 5785
|
|
},
|
|
{
|
|
"entropy": 1.0969509474933148,
|
|
"epoch": 1.782658058556955,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 7.945177328606153e-06,
|
|
"loss": 1.0814,
|
|
"mean_token_accuracy": 0.7026518236845731,
|
|
"num_tokens": 433824058.0,
|
|
"step": 5790
|
|
},
|
|
{
|
|
"entropy": 1.1376112870872022,
|
|
"epoch": 1.784197511858601,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 7.929331814838889e-06,
|
|
"loss": 1.1299,
|
|
"mean_token_accuracy": 0.6918862711638212,
|
|
"num_tokens": 434187709.0,
|
|
"step": 5795
|
|
},
|
|
{
|
|
"entropy": 1.121785393357277,
|
|
"epoch": 1.7857369651602475,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 7.913491731157546e-06,
|
|
"loss": 1.1093,
|
|
"mean_token_accuracy": 0.6965945191681385,
|
|
"num_tokens": 434557943.0,
|
|
"step": 5800
|
|
},
|
|
{
|
|
"entropy": 1.1073852602392436,
|
|
"epoch": 1.7872764184618937,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 7.897657119100896e-06,
|
|
"loss": 1.1004,
|
|
"mean_token_accuracy": 0.7003251485526562,
|
|
"num_tokens": 434930414.0,
|
|
"step": 5805
|
|
},
|
|
{
|
|
"entropy": 1.098065503872931,
|
|
"epoch": 1.78881587176354,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 7.881828020193362e-06,
|
|
"loss": 1.0833,
|
|
"mean_token_accuracy": 0.703624838963151,
|
|
"num_tokens": 435304340.0,
|
|
"step": 5810
|
|
},
|
|
{
|
|
"entropy": 1.0895633462816476,
|
|
"epoch": 1.7903553250651862,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 7.866004475944913e-06,
|
|
"loss": 1.0755,
|
|
"mean_token_accuracy": 0.7055461678653956,
|
|
"num_tokens": 435665203.0,
|
|
"step": 5815
|
|
},
|
|
{
|
|
"entropy": 1.1192277750000357,
|
|
"epoch": 1.7918947783668324,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 7.850186527850944e-06,
|
|
"loss": 1.1025,
|
|
"mean_token_accuracy": 0.6979604728519917,
|
|
"num_tokens": 436038167.0,
|
|
"step": 5820
|
|
},
|
|
{
|
|
"entropy": 1.09830089956522,
|
|
"epoch": 1.7934342316684786,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 7.834374217392188e-06,
|
|
"loss": 1.0988,
|
|
"mean_token_accuracy": 0.6994247294962406,
|
|
"num_tokens": 436404895.0,
|
|
"step": 5825
|
|
},
|
|
{
|
|
"entropy": 1.1108631249517202,
|
|
"epoch": 1.794973684970125,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 7.818567586034578e-06,
|
|
"loss": 1.1086,
|
|
"mean_token_accuracy": 0.7008806396275759,
|
|
"num_tokens": 436787796.0,
|
|
"step": 5830
|
|
},
|
|
{
|
|
"entropy": 1.1002790039405226,
|
|
"epoch": 1.7965131382717714,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 7.802766675229166e-06,
|
|
"loss": 1.0978,
|
|
"mean_token_accuracy": 0.7000899042934179,
|
|
"num_tokens": 437159343.0,
|
|
"step": 5835
|
|
},
|
|
{
|
|
"entropy": 1.093534878641367,
|
|
"epoch": 1.7980525915734176,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 7.786971526411996e-06,
|
|
"loss": 1.0902,
|
|
"mean_token_accuracy": 0.7013321571052075,
|
|
"num_tokens": 437540734.0,
|
|
"step": 5840
|
|
},
|
|
{
|
|
"entropy": 1.1091937126591802,
|
|
"epoch": 1.7995920448750637,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 7.771182181004005e-06,
|
|
"loss": 1.1223,
|
|
"mean_token_accuracy": 0.7017534531652927,
|
|
"num_tokens": 437923871.0,
|
|
"step": 5845
|
|
},
|
|
{
|
|
"entropy": 1.0906352462247013,
|
|
"epoch": 1.80113149817671,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 7.75539868041091e-06,
|
|
"loss": 1.0725,
|
|
"mean_token_accuracy": 0.7056937579065561,
|
|
"num_tokens": 438308749.0,
|
|
"step": 5850
|
|
},
|
|
{
|
|
"entropy": 1.1036672245711088,
|
|
"epoch": 1.802670951478356,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 7.739621066023108e-06,
|
|
"loss": 1.1022,
|
|
"mean_token_accuracy": 0.7028783820569515,
|
|
"num_tokens": 438682800.0,
|
|
"step": 5855
|
|
},
|
|
{
|
|
"entropy": 1.0790150195360184,
|
|
"epoch": 1.8042104047800025,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 7.723849379215545e-06,
|
|
"loss": 1.0664,
|
|
"mean_token_accuracy": 0.7067600462585688,
|
|
"num_tokens": 439044547.0,
|
|
"step": 5860
|
|
},
|
|
{
|
|
"entropy": 1.0927918059751391,
|
|
"epoch": 1.805749858081649,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 7.708083661347637e-06,
|
|
"loss": 1.0832,
|
|
"mean_token_accuracy": 0.701990308985114,
|
|
"num_tokens": 439429330.0,
|
|
"step": 5865
|
|
},
|
|
{
|
|
"entropy": 1.0986420296132564,
|
|
"epoch": 1.807289311383295,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 7.692323953763136e-06,
|
|
"loss": 1.0819,
|
|
"mean_token_accuracy": 0.703334167972207,
|
|
"num_tokens": 439806831.0,
|
|
"step": 5870
|
|
},
|
|
{
|
|
"entropy": 1.115905024856329,
|
|
"epoch": 1.8088287646849412,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 7.676570297790042e-06,
|
|
"loss": 1.1156,
|
|
"mean_token_accuracy": 0.6979976896196604,
|
|
"num_tokens": 440199642.0,
|
|
"step": 5875
|
|
},
|
|
{
|
|
"entropy": 1.097702207043767,
|
|
"epoch": 1.8103682179865874,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 7.660822734740478e-06,
|
|
"loss": 1.0964,
|
|
"mean_token_accuracy": 0.7002390835434198,
|
|
"num_tokens": 440568101.0,
|
|
"step": 5880
|
|
},
|
|
{
|
|
"entropy": 1.1066923171281815,
|
|
"epoch": 1.8119076712882336,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 7.645081305910596e-06,
|
|
"loss": 1.0961,
|
|
"mean_token_accuracy": 0.7003753874450922,
|
|
"num_tokens": 440949744.0,
|
|
"step": 5885
|
|
},
|
|
{
|
|
"entropy": 1.099143149331212,
|
|
"epoch": 1.81344712458988,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 7.629346052580455e-06,
|
|
"loss": 1.0969,
|
|
"mean_token_accuracy": 0.7039138011634349,
|
|
"num_tokens": 441326696.0,
|
|
"step": 5890
|
|
},
|
|
{
|
|
"entropy": 1.1311124755069613,
|
|
"epoch": 1.8149865778915264,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 7.613617016013921e-06,
|
|
"loss": 1.1325,
|
|
"mean_token_accuracy": 0.6956942904740572,
|
|
"num_tokens": 441690504.0,
|
|
"step": 5895
|
|
},
|
|
{
|
|
"entropy": 1.0858320891857147,
|
|
"epoch": 1.8165260311931726,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 7.597894237458564e-06,
|
|
"loss": 1.0739,
|
|
"mean_token_accuracy": 0.7030744664371014,
|
|
"num_tokens": 442060305.0,
|
|
"step": 5900
|
|
},
|
|
{
|
|
"entropy": 1.0901213565841317,
|
|
"epoch": 1.8180654844948188,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 7.582177758145532e-06,
|
|
"loss": 1.0789,
|
|
"mean_token_accuracy": 0.7055381182581186,
|
|
"num_tokens": 442448686.0,
|
|
"step": 5905
|
|
},
|
|
{
|
|
"entropy": 1.102469238638878,
|
|
"epoch": 1.819604937796465,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 7.566467619289464e-06,
|
|
"loss": 1.0875,
|
|
"mean_token_accuracy": 0.7010538402944804,
|
|
"num_tokens": 442824700.0,
|
|
"step": 5910
|
|
},
|
|
{
|
|
"entropy": 1.0969295118004083,
|
|
"epoch": 1.8211443910981113,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 7.550763862088369e-06,
|
|
"loss": 1.0768,
|
|
"mean_token_accuracy": 0.7017213415354491,
|
|
"num_tokens": 443193225.0,
|
|
"step": 5915
|
|
},
|
|
{
|
|
"entropy": 1.0988092232495545,
|
|
"epoch": 1.8226838443997575,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 7.535066527723512e-06,
|
|
"loss": 1.0863,
|
|
"mean_token_accuracy": 0.7045707684010267,
|
|
"num_tokens": 443554211.0,
|
|
"step": 5920
|
|
},
|
|
{
|
|
"entropy": 1.0824280124157668,
|
|
"epoch": 1.824223297701404,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 7.519375657359331e-06,
|
|
"loss": 1.0733,
|
|
"mean_token_accuracy": 0.7038266818970442,
|
|
"num_tokens": 443929023.0,
|
|
"step": 5925
|
|
},
|
|
{
|
|
"entropy": 1.0862654784694314,
|
|
"epoch": 1.82576275100305,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 7.503691292143298e-06,
|
|
"loss": 1.0798,
|
|
"mean_token_accuracy": 0.7037091765552759,
|
|
"num_tokens": 444303786.0,
|
|
"step": 5930
|
|
},
|
|
{
|
|
"entropy": 1.0702639365568758,
|
|
"epoch": 1.8273022043046963,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 7.488013473205838e-06,
|
|
"loss": 1.0607,
|
|
"mean_token_accuracy": 0.7083852611482143,
|
|
"num_tokens": 444667575.0,
|
|
"step": 5935
|
|
},
|
|
{
|
|
"entropy": 1.1145275034010411,
|
|
"epoch": 1.8288416576063424,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 7.472342241660197e-06,
|
|
"loss": 1.1109,
|
|
"mean_token_accuracy": 0.6987389735877514,
|
|
"num_tokens": 445056523.0,
|
|
"step": 5940
|
|
},
|
|
{
|
|
"entropy": 1.090510307624936,
|
|
"epoch": 1.8303811109079888,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 7.456677638602355e-06,
|
|
"loss": 1.0762,
|
|
"mean_token_accuracy": 0.7044423934072256,
|
|
"num_tokens": 445436654.0,
|
|
"step": 5945
|
|
},
|
|
{
|
|
"entropy": 1.0914680624380708,
|
|
"epoch": 1.831920564209635,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 7.441019705110912e-06,
|
|
"loss": 1.0812,
|
|
"mean_token_accuracy": 0.7032285436987877,
|
|
"num_tokens": 445796936.0,
|
|
"step": 5950
|
|
},
|
|
{
|
|
"entropy": 1.0885109342634678,
|
|
"epoch": 1.8334600175112814,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 7.4253684822469684e-06,
|
|
"loss": 1.067,
|
|
"mean_token_accuracy": 0.7039325948804617,
|
|
"num_tokens": 446163382.0,
|
|
"step": 5955
|
|
},
|
|
{
|
|
"entropy": 1.1165390264242887,
|
|
"epoch": 1.8349994708129276,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 7.4097240110540334e-06,
|
|
"loss": 1.1043,
|
|
"mean_token_accuracy": 0.6979116316884756,
|
|
"num_tokens": 446542238.0,
|
|
"step": 5960
|
|
},
|
|
{
|
|
"entropy": 1.1020138522610068,
|
|
"epoch": 1.8365389241145738,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 7.394086332557907e-06,
|
|
"loss": 1.0794,
|
|
"mean_token_accuracy": 0.7033349599689245,
|
|
"num_tokens": 446910390.0,
|
|
"step": 5965
|
|
},
|
|
{
|
|
"entropy": 1.0894953111186623,
|
|
"epoch": 1.83807837741622,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 7.378455487766581e-06,
|
|
"loss": 1.0806,
|
|
"mean_token_accuracy": 0.7039325913414359,
|
|
"num_tokens": 447283405.0,
|
|
"step": 5970
|
|
},
|
|
{
|
|
"entropy": 1.0865185240283608,
|
|
"epoch": 1.8396178307178663,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 7.362831517670121e-06,
|
|
"loss": 1.0855,
|
|
"mean_token_accuracy": 0.7021669633686543,
|
|
"num_tokens": 447660007.0,
|
|
"step": 5975
|
|
},
|
|
{
|
|
"entropy": 1.0959918159991502,
|
|
"epoch": 1.8411572840195127,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 7.347214463240566e-06,
|
|
"loss": 1.0883,
|
|
"mean_token_accuracy": 0.7021512415260076,
|
|
"num_tokens": 448014619.0,
|
|
"step": 5980
|
|
},
|
|
{
|
|
"entropy": 1.086434607207775,
|
|
"epoch": 1.842696737321159,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 7.331604365431826e-06,
|
|
"loss": 1.0731,
|
|
"mean_token_accuracy": 0.7029600974172354,
|
|
"num_tokens": 448390809.0,
|
|
"step": 5985
|
|
},
|
|
{
|
|
"entropy": 1.0790210045874118,
|
|
"epoch": 1.844236190622805,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 7.316001265179557e-06,
|
|
"loss": 1.0772,
|
|
"mean_token_accuracy": 0.7038331352174282,
|
|
"num_tokens": 448760997.0,
|
|
"step": 5990
|
|
},
|
|
{
|
|
"entropy": 1.1307589802891016,
|
|
"epoch": 1.8457756439244513,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 7.300405203401076e-06,
|
|
"loss": 1.1278,
|
|
"mean_token_accuracy": 0.69579869620502,
|
|
"num_tokens": 449129805.0,
|
|
"step": 5995
|
|
},
|
|
{
|
|
"entropy": 1.0936395099386573,
|
|
"epoch": 1.8473150972260974,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 7.2848162209952325e-06,
|
|
"loss": 1.0819,
|
|
"mean_token_accuracy": 0.7036243941634893,
|
|
"num_tokens": 449508266.0,
|
|
"step": 6000
|
|
},
|
|
{
|
|
"entropy": 1.0545811105519534,
|
|
"epoch": 1.8488545505277438,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 7.269234358842314e-06,
|
|
"loss": 1.0502,
|
|
"mean_token_accuracy": 0.7121914543211461,
|
|
"num_tokens": 449885381.0,
|
|
"step": 6005
|
|
},
|
|
{
|
|
"entropy": 1.0633203528821469,
|
|
"epoch": 1.8503940038293902,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 7.253659657803945e-06,
|
|
"loss": 1.0604,
|
|
"mean_token_accuracy": 0.7080067288130522,
|
|
"num_tokens": 450261459.0,
|
|
"step": 6010
|
|
},
|
|
{
|
|
"entropy": 1.084687256626785,
|
|
"epoch": 1.8519334571310364,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 7.2380921587229536e-06,
|
|
"loss": 1.0784,
|
|
"mean_token_accuracy": 0.7024631056934595,
|
|
"num_tokens": 450630072.0,
|
|
"step": 6015
|
|
},
|
|
{
|
|
"entropy": 1.0703973310068249,
|
|
"epoch": 1.8534729104326826,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 7.222531902423299e-06,
|
|
"loss": 1.0773,
|
|
"mean_token_accuracy": 0.7087981674820185,
|
|
"num_tokens": 451004614.0,
|
|
"step": 6020
|
|
},
|
|
{
|
|
"entropy": 1.0939648155122996,
|
|
"epoch": 1.8550123637343288,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 7.2069789297099355e-06,
|
|
"loss": 1.0801,
|
|
"mean_token_accuracy": 0.7047474171966315,
|
|
"num_tokens": 451383623.0,
|
|
"step": 6025
|
|
},
|
|
{
|
|
"entropy": 1.1047096762806177,
|
|
"epoch": 1.856551817035975,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 7.191433281368725e-06,
|
|
"loss": 1.0889,
|
|
"mean_token_accuracy": 0.7026272144168615,
|
|
"num_tokens": 451764245.0,
|
|
"step": 6030
|
|
},
|
|
{
|
|
"entropy": 1.1294628793373704,
|
|
"epoch": 1.8580912703376213,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 7.175894998166311e-06,
|
|
"loss": 1.1174,
|
|
"mean_token_accuracy": 0.6961995653808117,
|
|
"num_tokens": 452147860.0,
|
|
"step": 6035
|
|
},
|
|
{
|
|
"entropy": 1.1343961529433728,
|
|
"epoch": 1.8596307236392677,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 7.160364120850034e-06,
|
|
"loss": 1.1225,
|
|
"mean_token_accuracy": 0.6963326930999756,
|
|
"num_tokens": 452511616.0,
|
|
"step": 6040
|
|
},
|
|
{
|
|
"entropy": 1.120450741611421,
|
|
"epoch": 1.861170176940914,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 7.144840690147812e-06,
|
|
"loss": 1.1122,
|
|
"mean_token_accuracy": 0.6972806714475155,
|
|
"num_tokens": 452893744.0,
|
|
"step": 6045
|
|
},
|
|
{
|
|
"entropy": 1.124107886478305,
|
|
"epoch": 1.86270963024256,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 7.129324746768027e-06,
|
|
"loss": 1.1215,
|
|
"mean_token_accuracy": 0.6985443335026502,
|
|
"num_tokens": 453277343.0,
|
|
"step": 6050
|
|
},
|
|
{
|
|
"entropy": 1.075534589216113,
|
|
"epoch": 1.8642490835442063,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 7.113816331399435e-06,
|
|
"loss": 1.069,
|
|
"mean_token_accuracy": 0.7029131315648556,
|
|
"num_tokens": 453641676.0,
|
|
"step": 6055
|
|
},
|
|
{
|
|
"entropy": 1.1136681359261273,
|
|
"epoch": 1.8657885368458527,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 7.0983154847110445e-06,
|
|
"loss": 1.1002,
|
|
"mean_token_accuracy": 0.6988730806857347,
|
|
"num_tokens": 454037420.0,
|
|
"step": 6060
|
|
},
|
|
{
|
|
"entropy": 1.1039579337462784,
|
|
"epoch": 1.8673279901474988,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 7.082822247352024e-06,
|
|
"loss": 1.1007,
|
|
"mean_token_accuracy": 0.6987725421786308,
|
|
"num_tokens": 454413193.0,
|
|
"step": 6065
|
|
},
|
|
{
|
|
"entropy": 1.1249155843630434,
|
|
"epoch": 1.8688674434491452,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 7.067336659951576e-06,
|
|
"loss": 1.1118,
|
|
"mean_token_accuracy": 0.7007195122539998,
|
|
"num_tokens": 454803091.0,
|
|
"step": 6070
|
|
},
|
|
{
|
|
"entropy": 1.0803063228726386,
|
|
"epoch": 1.8704068967507914,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 7.05185876311885e-06,
|
|
"loss": 1.0746,
|
|
"mean_token_accuracy": 0.7071659781038762,
|
|
"num_tokens": 455167703.0,
|
|
"step": 6075
|
|
},
|
|
{
|
|
"entropy": 1.1002206418663263,
|
|
"epoch": 1.8719463500524376,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 7.036388597442829e-06,
|
|
"loss": 1.0915,
|
|
"mean_token_accuracy": 0.7022796783596277,
|
|
"num_tokens": 455534214.0,
|
|
"step": 6080
|
|
},
|
|
{
|
|
"entropy": 1.0832787048071624,
|
|
"epoch": 1.8734858033540838,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 7.020926203492218e-06,
|
|
"loss": 1.067,
|
|
"mean_token_accuracy": 0.7075303565710783,
|
|
"num_tokens": 455909023.0,
|
|
"step": 6085
|
|
},
|
|
{
|
|
"entropy": 1.1100150370970367,
|
|
"epoch": 1.8750252566557302,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 7.005471621815341e-06,
|
|
"loss": 1.1043,
|
|
"mean_token_accuracy": 0.7005648247897625,
|
|
"num_tokens": 456271306.0,
|
|
"step": 6090
|
|
},
|
|
{
|
|
"entropy": 1.0803228283300996,
|
|
"epoch": 1.8765647099573763,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 6.990024892940036e-06,
|
|
"loss": 1.0764,
|
|
"mean_token_accuracy": 0.7038178157061339,
|
|
"num_tokens": 456639934.0,
|
|
"step": 6095
|
|
},
|
|
{
|
|
"entropy": 1.143845496699214,
|
|
"epoch": 1.8781041632590227,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 6.974586057373552e-06,
|
|
"loss": 1.1277,
|
|
"mean_token_accuracy": 0.6944532591849566,
|
|
"num_tokens": 457011815.0,
|
|
"step": 6100
|
|
},
|
|
{
|
|
"entropy": 1.091782009601593,
|
|
"epoch": 1.879643616560669,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 6.959155155602433e-06,
|
|
"loss": 1.0835,
|
|
"mean_token_accuracy": 0.7064328696578741,
|
|
"num_tokens": 457392422.0,
|
|
"step": 6105
|
|
},
|
|
{
|
|
"entropy": 1.0446917504072188,
|
|
"epoch": 1.881183069862315,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 6.9437322280924195e-06,
|
|
"loss": 1.0404,
|
|
"mean_token_accuracy": 0.7116331540048122,
|
|
"num_tokens": 457774533.0,
|
|
"step": 6110
|
|
},
|
|
{
|
|
"entropy": 1.1006857477128507,
|
|
"epoch": 1.8827225231639613,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 6.928317315288344e-06,
|
|
"loss": 1.0861,
|
|
"mean_token_accuracy": 0.6995784014463424,
|
|
"num_tokens": 458162620.0,
|
|
"step": 6115
|
|
},
|
|
{
|
|
"entropy": 1.0898632440716027,
|
|
"epoch": 1.8842619764656077,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 6.912910457614015e-06,
|
|
"loss": 1.0817,
|
|
"mean_token_accuracy": 0.705943663418293,
|
|
"num_tokens": 458519117.0,
|
|
"step": 6120
|
|
},
|
|
{
|
|
"entropy": 1.0827509367838501,
|
|
"epoch": 1.885801429767254,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 6.897511695472124e-06,
|
|
"loss": 1.0725,
|
|
"mean_token_accuracy": 0.709840028360486,
|
|
"num_tokens": 458890275.0,
|
|
"step": 6125
|
|
},
|
|
{
|
|
"entropy": 1.0922544719651341,
|
|
"epoch": 1.8873408830689002,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 6.882121069244123e-06,
|
|
"loss": 1.0904,
|
|
"mean_token_accuracy": 0.7048375897109509,
|
|
"num_tokens": 459287913.0,
|
|
"step": 6130
|
|
},
|
|
{
|
|
"entropy": 1.1134954746812582,
|
|
"epoch": 1.8888803363705464,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 6.866738619290143e-06,
|
|
"loss": 1.111,
|
|
"mean_token_accuracy": 0.6972104486078023,
|
|
"num_tokens": 459659094.0,
|
|
"step": 6135
|
|
},
|
|
{
|
|
"entropy": 1.1110269401222468,
|
|
"epoch": 1.8904197896721926,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 6.851364385948861e-06,
|
|
"loss": 1.1074,
|
|
"mean_token_accuracy": 0.699640791118145,
|
|
"num_tokens": 460033621.0,
|
|
"step": 6140
|
|
},
|
|
{
|
|
"entropy": 1.0646744795143603,
|
|
"epoch": 1.8919592429738388,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 6.835998409537412e-06,
|
|
"loss": 1.0618,
|
|
"mean_token_accuracy": 0.7081297870725394,
|
|
"num_tokens": 460402996.0,
|
|
"step": 6145
|
|
},
|
|
{
|
|
"entropy": 1.1050880879163743,
|
|
"epoch": 1.8934986962754852,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 6.820640730351281e-06,
|
|
"loss": 1.0945,
|
|
"mean_token_accuracy": 0.7007925882935524,
|
|
"num_tokens": 460783837.0,
|
|
"step": 6150
|
|
},
|
|
{
|
|
"entropy": 1.1039022240787744,
|
|
"epoch": 1.8950381495771316,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 6.805291388664186e-06,
|
|
"loss": 1.0994,
|
|
"mean_token_accuracy": 0.7017687387764454,
|
|
"num_tokens": 461166760.0,
|
|
"step": 6155
|
|
},
|
|
{
|
|
"entropy": 1.0670970810577274,
|
|
"epoch": 1.8965776028787777,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 6.789950424727989e-06,
|
|
"loss": 1.0543,
|
|
"mean_token_accuracy": 0.7099263545125722,
|
|
"num_tokens": 461533033.0,
|
|
"step": 6160
|
|
},
|
|
{
|
|
"entropy": 1.098172004893422,
|
|
"epoch": 1.898117056180424,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 6.774617878772582e-06,
|
|
"loss": 1.0889,
|
|
"mean_token_accuracy": 0.7033809386193752,
|
|
"num_tokens": 461909910.0,
|
|
"step": 6165
|
|
},
|
|
{
|
|
"entropy": 1.0722623517736793,
|
|
"epoch": 1.89965650948207,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 6.759293791005777e-06,
|
|
"loss": 1.0654,
|
|
"mean_token_accuracy": 0.7120100729167461,
|
|
"num_tokens": 462279196.0,
|
|
"step": 6170
|
|
},
|
|
{
|
|
"entropy": 1.0677545212209225,
|
|
"epoch": 1.9011959627837163,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 6.743978201613206e-06,
|
|
"loss": 1.0656,
|
|
"mean_token_accuracy": 0.7059001348912716,
|
|
"num_tokens": 462642758.0,
|
|
"step": 6175
|
|
},
|
|
{
|
|
"entropy": 1.0958318993449212,
|
|
"epoch": 1.9027354160853627,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 6.728671150758222e-06,
|
|
"loss": 1.0837,
|
|
"mean_token_accuracy": 0.7043974000960589,
|
|
"num_tokens": 463017459.0,
|
|
"step": 6180
|
|
},
|
|
{
|
|
"entropy": 1.1266016043722629,
|
|
"epoch": 1.904274869387009,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 6.713372678581773e-06,
|
|
"loss": 1.1335,
|
|
"mean_token_accuracy": 0.6984943628311158,
|
|
"num_tokens": 463391285.0,
|
|
"step": 6185
|
|
},
|
|
{
|
|
"entropy": 1.0423596605658532,
|
|
"epoch": 1.9058143226886552,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 6.6980828252023275e-06,
|
|
"loss": 1.0335,
|
|
"mean_token_accuracy": 0.7145875092595816,
|
|
"num_tokens": 463776260.0,
|
|
"step": 6190
|
|
},
|
|
{
|
|
"entropy": 1.0944068908691407,
|
|
"epoch": 1.9073537759903014,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 6.682801630715737e-06,
|
|
"loss": 1.0886,
|
|
"mean_token_accuracy": 0.703708490729332,
|
|
"num_tokens": 464141133.0,
|
|
"step": 6195
|
|
},
|
|
{
|
|
"entropy": 1.1079072404652834,
|
|
"epoch": 1.9088932292919476,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 6.667529135195158e-06,
|
|
"loss": 1.088,
|
|
"mean_token_accuracy": 0.7016992829740047,
|
|
"num_tokens": 464505591.0,
|
|
"step": 6200
|
|
},
|
|
{
|
|
"entropy": 1.0755875267088413,
|
|
"epoch": 1.910432682593594,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 6.652265378690923e-06,
|
|
"loss": 1.0717,
|
|
"mean_token_accuracy": 0.7072944637387991,
|
|
"num_tokens": 464879856.0,
|
|
"step": 6205
|
|
},
|
|
{
|
|
"entropy": 1.1381605880334973,
|
|
"epoch": 1.9119721358952402,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 6.637010401230459e-06,
|
|
"loss": 1.1295,
|
|
"mean_token_accuracy": 0.696638460829854,
|
|
"num_tokens": 465247870.0,
|
|
"step": 6210
|
|
},
|
|
{
|
|
"entropy": 1.1508839782327414,
|
|
"epoch": 1.9135115891968866,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 6.621764242818167e-06,
|
|
"loss": 1.1543,
|
|
"mean_token_accuracy": 0.6949445586651564,
|
|
"num_tokens": 465608563.0,
|
|
"step": 6215
|
|
},
|
|
{
|
|
"entropy": 1.1009983010590076,
|
|
"epoch": 1.9150510424985328,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 6.606526943435314e-06,
|
|
"loss": 1.1007,
|
|
"mean_token_accuracy": 0.702331218495965,
|
|
"num_tokens": 465972087.0,
|
|
"step": 6220
|
|
},
|
|
{
|
|
"entropy": 1.099109659343958,
|
|
"epoch": 1.916590495800179,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 6.591298543039949e-06,
|
|
"loss": 1.1007,
|
|
"mean_token_accuracy": 0.7017541017383337,
|
|
"num_tokens": 466343586.0,
|
|
"step": 6225
|
|
},
|
|
{
|
|
"entropy": 1.1088095497339965,
|
|
"epoch": 1.918129949101825,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 6.576079081566771e-06,
|
|
"loss": 1.1064,
|
|
"mean_token_accuracy": 0.7002251915633678,
|
|
"num_tokens": 466711813.0,
|
|
"step": 6230
|
|
},
|
|
{
|
|
"entropy": 1.0721097651869058,
|
|
"epoch": 1.9196694024034715,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 6.560868598927046e-06,
|
|
"loss": 1.0569,
|
|
"mean_token_accuracy": 0.708814387768507,
|
|
"num_tokens": 467070695.0,
|
|
"step": 6235
|
|
},
|
|
{
|
|
"entropy": 1.1055051686242223,
|
|
"epoch": 1.9212088557051177,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 6.545667135008489e-06,
|
|
"loss": 1.095,
|
|
"mean_token_accuracy": 0.7011767581105233,
|
|
"num_tokens": 467437554.0,
|
|
"step": 6240
|
|
},
|
|
{
|
|
"entropy": 1.107753809913993,
|
|
"epoch": 1.922748309006764,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 6.530474729675167e-06,
|
|
"loss": 1.0958,
|
|
"mean_token_accuracy": 0.7021241977810859,
|
|
"num_tokens": 467812451.0,
|
|
"step": 6245
|
|
},
|
|
{
|
|
"entropy": 1.137571018561721,
|
|
"epoch": 1.9242877623084103,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 6.515291422767398e-06,
|
|
"loss": 1.1259,
|
|
"mean_token_accuracy": 0.6960702395066619,
|
|
"num_tokens": 468182960.0,
|
|
"step": 6250
|
|
},
|
|
{
|
|
"entropy": 1.0924902483820915,
|
|
"epoch": 1.9258272156100564,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 6.500117254101627e-06,
|
|
"loss": 1.0897,
|
|
"mean_token_accuracy": 0.7043579567223788,
|
|
"num_tokens": 468577209.0,
|
|
"step": 6255
|
|
},
|
|
{
|
|
"entropy": 1.0740537440404296,
|
|
"epoch": 1.9273666689117026,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 6.484952263470348e-06,
|
|
"loss": 1.0702,
|
|
"mean_token_accuracy": 0.7081241730600596,
|
|
"num_tokens": 468946563.0,
|
|
"step": 6260
|
|
},
|
|
{
|
|
"entropy": 1.1009715896099805,
|
|
"epoch": 1.928906122213349,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 6.469796490641974e-06,
|
|
"loss": 1.0899,
|
|
"mean_token_accuracy": 0.7011630225926637,
|
|
"num_tokens": 469325280.0,
|
|
"step": 6265
|
|
},
|
|
{
|
|
"entropy": 1.080787081643939,
|
|
"epoch": 1.9304455755149952,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 6.45464997536076e-06,
|
|
"loss": 1.0613,
|
|
"mean_token_accuracy": 0.706011525541544,
|
|
"num_tokens": 469701666.0,
|
|
"step": 6270
|
|
},
|
|
{
|
|
"entropy": 1.1254060972481965,
|
|
"epoch": 1.9319850288166416,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 6.439512757346671e-06,
|
|
"loss": 1.1243,
|
|
"mean_token_accuracy": 0.6953715585172177,
|
|
"num_tokens": 470083778.0,
|
|
"step": 6275
|
|
},
|
|
{
|
|
"entropy": 1.0976654985919594,
|
|
"epoch": 1.9335244821182878,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 6.4243848762953e-06,
|
|
"loss": 1.0896,
|
|
"mean_token_accuracy": 0.7005417328327894,
|
|
"num_tokens": 470451406.0,
|
|
"step": 6280
|
|
},
|
|
{
|
|
"entropy": 1.0730864990502595,
|
|
"epoch": 1.935063935419934,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 6.409266371877751e-06,
|
|
"loss": 1.0783,
|
|
"mean_token_accuracy": 0.7093465097248555,
|
|
"num_tokens": 470821956.0,
|
|
"step": 6285
|
|
},
|
|
{
|
|
"entropy": 1.0770219882950187,
|
|
"epoch": 1.93660338872158,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 6.394157283740536e-06,
|
|
"loss": 1.0622,
|
|
"mean_token_accuracy": 0.7067357540130615,
|
|
"num_tokens": 471211774.0,
|
|
"step": 6290
|
|
},
|
|
{
|
|
"entropy": 1.10873453207314,
|
|
"epoch": 1.9381428420232265,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 6.3790576515054824e-06,
|
|
"loss": 1.0987,
|
|
"mean_token_accuracy": 0.7020625304430723,
|
|
"num_tokens": 471586845.0,
|
|
"step": 6295
|
|
},
|
|
{
|
|
"entropy": 1.127995678037405,
|
|
"epoch": 1.939682295324873,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 6.363967514769611e-06,
|
|
"loss": 1.1226,
|
|
"mean_token_accuracy": 0.6958362571895123,
|
|
"num_tokens": 471983468.0,
|
|
"step": 6300
|
|
},
|
|
{
|
|
"entropy": 1.1003391455858946,
|
|
"epoch": 1.941221748626519,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 6.3488869131050505e-06,
|
|
"loss": 1.0939,
|
|
"mean_token_accuracy": 0.6993938181549311,
|
|
"num_tokens": 472355976.0,
|
|
"step": 6305
|
|
},
|
|
{
|
|
"entropy": 1.0717536129057408,
|
|
"epoch": 1.9427612019281653,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 6.333815886058916e-06,
|
|
"loss": 1.0682,
|
|
"mean_token_accuracy": 0.708697409555316,
|
|
"num_tokens": 472715202.0,
|
|
"step": 6310
|
|
},
|
|
{
|
|
"entropy": 1.0950305504724382,
|
|
"epoch": 1.9443006552298114,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 6.318754473153221e-06,
|
|
"loss": 1.0877,
|
|
"mean_token_accuracy": 0.7024379357695579,
|
|
"num_tokens": 473075328.0,
|
|
"step": 6315
|
|
},
|
|
{
|
|
"entropy": 1.0924317188560964,
|
|
"epoch": 1.9458401085314576,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 6.303702713884767e-06,
|
|
"loss": 1.0901,
|
|
"mean_token_accuracy": 0.7016599491238594,
|
|
"num_tokens": 473451953.0,
|
|
"step": 6320
|
|
},
|
|
{
|
|
"entropy": 1.0777313707396388,
|
|
"epoch": 1.947379561833104,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 6.2886606477250345e-06,
|
|
"loss": 1.0683,
|
|
"mean_token_accuracy": 0.7068023394793272,
|
|
"num_tokens": 473834891.0,
|
|
"step": 6325
|
|
},
|
|
{
|
|
"entropy": 1.0673731714487076,
|
|
"epoch": 1.9489190151347504,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 6.273628314120092e-06,
|
|
"loss": 1.0493,
|
|
"mean_token_accuracy": 0.708334156498313,
|
|
"num_tokens": 474217007.0,
|
|
"step": 6330
|
|
},
|
|
{
|
|
"entropy": 1.0538257908076047,
|
|
"epoch": 1.9504584684363966,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 6.258605752490477e-06,
|
|
"loss": 1.046,
|
|
"mean_token_accuracy": 0.7104388296604156,
|
|
"num_tokens": 474586640.0,
|
|
"step": 6335
|
|
},
|
|
{
|
|
"entropy": 1.1239116095006465,
|
|
"epoch": 1.9519979217380428,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 6.243593002231112e-06,
|
|
"loss": 1.1054,
|
|
"mean_token_accuracy": 0.7007715322077275,
|
|
"num_tokens": 474946525.0,
|
|
"step": 6340
|
|
},
|
|
{
|
|
"entropy": 1.050543943606317,
|
|
"epoch": 1.953537375039689,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 6.2285901027111806e-06,
|
|
"loss": 1.034,
|
|
"mean_token_accuracy": 0.7103011026978493,
|
|
"num_tokens": 475321804.0,
|
|
"step": 6345
|
|
},
|
|
{
|
|
"entropy": 1.0928098868578673,
|
|
"epoch": 1.9550768283413353,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 6.213597093274038e-06,
|
|
"loss": 1.0835,
|
|
"mean_token_accuracy": 0.7043702017515898,
|
|
"num_tokens": 475692649.0,
|
|
"step": 6350
|
|
},
|
|
{
|
|
"entropy": 1.054861979931593,
|
|
"epoch": 1.9566162816429815,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 6.198614013237105e-06,
|
|
"loss": 1.0411,
|
|
"mean_token_accuracy": 0.7113304033875465,
|
|
"num_tokens": 476080880.0,
|
|
"step": 6355
|
|
},
|
|
{
|
|
"entropy": 1.0645435884594918,
|
|
"epoch": 1.958155734944628,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 6.18364090189176e-06,
|
|
"loss": 1.0556,
|
|
"mean_token_accuracy": 0.7083408702164888,
|
|
"num_tokens": 476461939.0,
|
|
"step": 6360
|
|
},
|
|
{
|
|
"entropy": 1.091073114797473,
|
|
"epoch": 1.959695188246274,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 6.168677798503246e-06,
|
|
"loss": 1.0808,
|
|
"mean_token_accuracy": 0.7051564145833253,
|
|
"num_tokens": 476823152.0,
|
|
"step": 6365
|
|
},
|
|
{
|
|
"entropy": 1.1280314341187476,
|
|
"epoch": 1.9612346415479203,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 6.153724742310551e-06,
|
|
"loss": 1.1257,
|
|
"mean_token_accuracy": 0.6964990302920342,
|
|
"num_tokens": 477193823.0,
|
|
"step": 6370
|
|
},
|
|
{
|
|
"entropy": 1.0870745390653611,
|
|
"epoch": 1.9627740948495664,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 6.13878177252633e-06,
|
|
"loss": 1.0807,
|
|
"mean_token_accuracy": 0.7037721682339907,
|
|
"num_tokens": 477563467.0,
|
|
"step": 6375
|
|
},
|
|
{
|
|
"entropy": 1.0999460713937879,
|
|
"epoch": 1.9643135481512128,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 6.123848928336771e-06,
|
|
"loss": 1.0998,
|
|
"mean_token_accuracy": 0.7026488088071347,
|
|
"num_tokens": 477953436.0,
|
|
"step": 6380
|
|
},
|
|
{
|
|
"entropy": 1.0892467688769103,
|
|
"epoch": 1.965853001452859,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 6.108926248901521e-06,
|
|
"loss": 1.0828,
|
|
"mean_token_accuracy": 0.7028188839554786,
|
|
"num_tokens": 478334573.0,
|
|
"step": 6385
|
|
},
|
|
{
|
|
"entropy": 1.0833508778363465,
|
|
"epoch": 1.9673924547545054,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 6.094013773353569e-06,
|
|
"loss": 1.0728,
|
|
"mean_token_accuracy": 0.705680675059557,
|
|
"num_tokens": 478702459.0,
|
|
"step": 6390
|
|
},
|
|
{
|
|
"entropy": 1.1208801966160535,
|
|
"epoch": 1.9689319080561516,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 6.07911154079914e-06,
|
|
"loss": 1.1142,
|
|
"mean_token_accuracy": 0.7000440448522568,
|
|
"num_tokens": 479088879.0,
|
|
"step": 6395
|
|
},
|
|
{
|
|
"entropy": 1.1056122705340385,
|
|
"epoch": 1.9704713613577978,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 6.064219590317604e-06,
|
|
"loss": 1.0919,
|
|
"mean_token_accuracy": 0.7005075868219137,
|
|
"num_tokens": 479474205.0,
|
|
"step": 6400
|
|
},
|
|
{
|
|
"entropy": 1.0634366851300001,
|
|
"epoch": 1.972010814659444,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 6.049337960961362e-06,
|
|
"loss": 1.0554,
|
|
"mean_token_accuracy": 0.7116304021328688,
|
|
"num_tokens": 479849672.0,
|
|
"step": 6405
|
|
},
|
|
{
|
|
"entropy": 1.1176534678786993,
|
|
"epoch": 1.9735502679610903,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 6.034466691755757e-06,
|
|
"loss": 1.1038,
|
|
"mean_token_accuracy": 0.699062779918313,
|
|
"num_tokens": 480219945.0,
|
|
"step": 6410
|
|
},
|
|
{
|
|
"entropy": 1.1033440206199885,
|
|
"epoch": 1.9750897212627365,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 6.019605821698953e-06,
|
|
"loss": 1.0928,
|
|
"mean_token_accuracy": 0.701035288721323,
|
|
"num_tokens": 480594956.0,
|
|
"step": 6415
|
|
},
|
|
{
|
|
"entropy": 1.1296729780733585,
|
|
"epoch": 1.976629174564383,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 6.004755389761854e-06,
|
|
"loss": 1.1219,
|
|
"mean_token_accuracy": 0.6950528647750616,
|
|
"num_tokens": 480971894.0,
|
|
"step": 6420
|
|
},
|
|
{
|
|
"entropy": 1.0605024078860879,
|
|
"epoch": 1.978168627866029,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 5.989915434887985e-06,
|
|
"loss": 1.0586,
|
|
"mean_token_accuracy": 0.7085768647491932,
|
|
"num_tokens": 481346886.0,
|
|
"step": 6425
|
|
},
|
|
{
|
|
"entropy": 1.0888615921139717,
|
|
"epoch": 1.9797080811676753,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 5.975085995993396e-06,
|
|
"loss": 1.0835,
|
|
"mean_token_accuracy": 0.7071981336921453,
|
|
"num_tokens": 481722102.0,
|
|
"step": 6430
|
|
},
|
|
{
|
|
"entropy": 1.0903908934444189,
|
|
"epoch": 1.9812475344693214,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 5.960267111966565e-06,
|
|
"loss": 1.0778,
|
|
"mean_token_accuracy": 0.7046667341142893,
|
|
"num_tokens": 482097383.0,
|
|
"step": 6435
|
|
},
|
|
{
|
|
"entropy": 1.100091939419508,
|
|
"epoch": 1.9827869877709678,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 5.945458821668284e-06,
|
|
"loss": 1.0817,
|
|
"mean_token_accuracy": 0.7003484524786472,
|
|
"num_tokens": 482479552.0,
|
|
"step": 6440
|
|
},
|
|
{
|
|
"entropy": 1.1107360497117043,
|
|
"epoch": 1.9843264410726142,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 5.930661163931572e-06,
|
|
"loss": 1.105,
|
|
"mean_token_accuracy": 0.6987737376242876,
|
|
"num_tokens": 482861148.0,
|
|
"step": 6445
|
|
},
|
|
{
|
|
"entropy": 1.0845207652077078,
|
|
"epoch": 1.9858658943742604,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 5.915874177561558e-06,
|
|
"loss": 1.0901,
|
|
"mean_token_accuracy": 0.7035898484289647,
|
|
"num_tokens": 483231284.0,
|
|
"step": 6450
|
|
},
|
|
{
|
|
"entropy": 1.053229554183781,
|
|
"epoch": 1.9874053476759066,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 5.901097901335388e-06,
|
|
"loss": 1.0441,
|
|
"mean_token_accuracy": 0.7112236868590116,
|
|
"num_tokens": 483607041.0,
|
|
"step": 6455
|
|
},
|
|
{
|
|
"entropy": 1.1231377620249987,
|
|
"epoch": 1.9889448009775528,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 5.886332374002128e-06,
|
|
"loss": 1.12,
|
|
"mean_token_accuracy": 0.6990904603153467,
|
|
"num_tokens": 483978733.0,
|
|
"step": 6460
|
|
},
|
|
{
|
|
"entropy": 1.1077780202031136,
|
|
"epoch": 1.990484254279199,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 5.871577634282655e-06,
|
|
"loss": 1.102,
|
|
"mean_token_accuracy": 0.6988861288875341,
|
|
"num_tokens": 484340815.0,
|
|
"step": 6465
|
|
},
|
|
{
|
|
"entropy": 1.0894021481275558,
|
|
"epoch": 1.9920237075808453,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 5.856833720869547e-06,
|
|
"loss": 1.0823,
|
|
"mean_token_accuracy": 0.7057371754199266,
|
|
"num_tokens": 484717140.0,
|
|
"step": 6470
|
|
},
|
|
{
|
|
"entropy": 1.0776791851967573,
|
|
"epoch": 1.9935631608824917,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 5.842100672427002e-06,
|
|
"loss": 1.0751,
|
|
"mean_token_accuracy": 0.7062124883756041,
|
|
"num_tokens": 485086102.0,
|
|
"step": 6475
|
|
},
|
|
{
|
|
"entropy": 1.0695521613582968,
|
|
"epoch": 1.995102614184138,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 5.827378527590722e-06,
|
|
"loss": 1.0555,
|
|
"mean_token_accuracy": 0.7089011915028095,
|
|
"num_tokens": 485451286.0,
|
|
"step": 6480
|
|
},
|
|
{
|
|
"entropy": 1.1131516579538583,
|
|
"epoch": 1.996642067485784,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 5.812667324967813e-06,
|
|
"loss": 1.1092,
|
|
"mean_token_accuracy": 0.6991394259035587,
|
|
"num_tokens": 485814422.0,
|
|
"step": 6485
|
|
},
|
|
{
|
|
"entropy": 1.1099822692573071,
|
|
"epoch": 1.9981815207874303,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 5.797967103136688e-06,
|
|
"loss": 1.1018,
|
|
"mean_token_accuracy": 0.6979199107736349,
|
|
"num_tokens": 486191626.0,
|
|
"step": 6490
|
|
},
|
|
{
|
|
"entropy": 1.0982773404568433,
|
|
"epoch": 1.9997209740890765,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 5.783277900646971e-06,
|
|
"loss": 1.0909,
|
|
"mean_token_accuracy": 0.701566357165575,
|
|
"num_tokens": 486551660.0,
|
|
"step": 6495
|
|
},
|
|
{
|
|
"entropy": 1.0724275282993438,
|
|
"epoch": 2.001231562641317,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 5.76859975601938e-06,
|
|
"loss": 1.0472,
|
|
"mean_token_accuracy": 0.7113358086081827,
|
|
"num_tokens": 486880354.0,
|
|
"step": 6500
|
|
},
|
|
{
|
|
"entropy": 1.093696822039783,
|
|
"epoch": 2.0027710159429635,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 5.753932707745635e-06,
|
|
"loss": 1.0936,
|
|
"mean_token_accuracy": 0.7025887954980135,
|
|
"num_tokens": 487270253.0,
|
|
"step": 6505
|
|
},
|
|
{
|
|
"entropy": 1.0612874824553729,
|
|
"epoch": 2.0043104692446096,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 5.739276794288362e-06,
|
|
"loss": 1.049,
|
|
"mean_token_accuracy": 0.7105597052723169,
|
|
"num_tokens": 487643429.0,
|
|
"step": 6510
|
|
},
|
|
{
|
|
"entropy": 1.070736413449049,
|
|
"epoch": 2.005849922546256,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 5.724632054080989e-06,
|
|
"loss": 1.0562,
|
|
"mean_token_accuracy": 0.7097679913043976,
|
|
"num_tokens": 488014302.0,
|
|
"step": 6515
|
|
},
|
|
{
|
|
"entropy": 1.1160105105489493,
|
|
"epoch": 2.007389375847902,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 5.709998525527637e-06,
|
|
"loss": 1.1203,
|
|
"mean_token_accuracy": 0.6995186183601618,
|
|
"num_tokens": 488381727.0,
|
|
"step": 6520
|
|
},
|
|
{
|
|
"entropy": 1.0941135231405497,
|
|
"epoch": 2.008928829149548,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 5.695376247003025e-06,
|
|
"loss": 1.0836,
|
|
"mean_token_accuracy": 0.7027807272970676,
|
|
"num_tokens": 488760634.0,
|
|
"step": 6525
|
|
},
|
|
{
|
|
"entropy": 1.095195009559393,
|
|
"epoch": 2.0104682824511944,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 5.680765256852381e-06,
|
|
"loss": 1.0843,
|
|
"mean_token_accuracy": 0.7023120127618313,
|
|
"num_tokens": 489137974.0,
|
|
"step": 6530
|
|
},
|
|
{
|
|
"entropy": 1.1140346417203546,
|
|
"epoch": 2.012007735752841,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 5.666165593391322e-06,
|
|
"loss": 1.1005,
|
|
"mean_token_accuracy": 0.7006218168884516,
|
|
"num_tokens": 489513109.0,
|
|
"step": 6535
|
|
},
|
|
{
|
|
"entropy": 1.0973135584965348,
|
|
"epoch": 2.013547189054487,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 5.651577294905759e-06,
|
|
"loss": 1.0805,
|
|
"mean_token_accuracy": 0.7035030290484429,
|
|
"num_tokens": 489897207.0,
|
|
"step": 6540
|
|
},
|
|
{
|
|
"entropy": 1.0806972064077853,
|
|
"epoch": 2.0150866423561333,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 5.637000399651804e-06,
|
|
"loss": 1.0723,
|
|
"mean_token_accuracy": 0.7059725172817707,
|
|
"num_tokens": 490272643.0,
|
|
"step": 6545
|
|
},
|
|
{
|
|
"entropy": 1.112701821140945,
|
|
"epoch": 2.0166260956577795,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 5.622434945855671e-06,
|
|
"loss": 1.1049,
|
|
"mean_token_accuracy": 0.6996416699141264,
|
|
"num_tokens": 490657559.0,
|
|
"step": 6550
|
|
},
|
|
{
|
|
"entropy": 1.1059308337047695,
|
|
"epoch": 2.0181655489594257,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 5.6078809717135615e-06,
|
|
"loss": 1.0994,
|
|
"mean_token_accuracy": 0.7015468429774046,
|
|
"num_tokens": 491039991.0,
|
|
"step": 6555
|
|
},
|
|
{
|
|
"entropy": 1.079090579226613,
|
|
"epoch": 2.019705002261072,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 5.5933385153915735e-06,
|
|
"loss": 1.0631,
|
|
"mean_token_accuracy": 0.7083710238337517,
|
|
"num_tokens": 491425588.0,
|
|
"step": 6560
|
|
},
|
|
{
|
|
"entropy": 1.1104231223464012,
|
|
"epoch": 2.0212444555627185,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 5.5788076150256075e-06,
|
|
"loss": 1.1119,
|
|
"mean_token_accuracy": 0.7029163155704736,
|
|
"num_tokens": 491794937.0,
|
|
"step": 6565
|
|
},
|
|
{
|
|
"entropy": 1.0700456749647855,
|
|
"epoch": 2.0227839088643647,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 5.564288308721255e-06,
|
|
"loss": 1.0535,
|
|
"mean_token_accuracy": 0.7105201087892056,
|
|
"num_tokens": 492170248.0,
|
|
"step": 6570
|
|
},
|
|
{
|
|
"entropy": 1.0973915254697204,
|
|
"epoch": 2.024323362166011,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 5.549780634553704e-06,
|
|
"loss": 1.1048,
|
|
"mean_token_accuracy": 0.7003750964999199,
|
|
"num_tokens": 492545407.0,
|
|
"step": 6575
|
|
},
|
|
{
|
|
"entropy": 1.0858017783612013,
|
|
"epoch": 2.025862815467657,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 5.535284630567634e-06,
|
|
"loss": 1.0656,
|
|
"mean_token_accuracy": 0.7074769627302885,
|
|
"num_tokens": 492918316.0,
|
|
"step": 6580
|
|
},
|
|
{
|
|
"entropy": 1.0654700968414546,
|
|
"epoch": 2.027402268769303,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 5.520800334777132e-06,
|
|
"loss": 1.0678,
|
|
"mean_token_accuracy": 0.7074768155813217,
|
|
"num_tokens": 493313868.0,
|
|
"step": 6585
|
|
},
|
|
{
|
|
"entropy": 1.1075419411063194,
|
|
"epoch": 2.0289417220709494,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 5.506327785165574e-06,
|
|
"loss": 1.0979,
|
|
"mean_token_accuracy": 0.7014190126210451,
|
|
"num_tokens": 493674632.0,
|
|
"step": 6590
|
|
},
|
|
{
|
|
"entropy": 1.07550681065768,
|
|
"epoch": 2.030481175372596,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 5.491867019685528e-06,
|
|
"loss": 1.0621,
|
|
"mean_token_accuracy": 0.7091485604643821,
|
|
"num_tokens": 494045338.0,
|
|
"step": 6595
|
|
},
|
|
{
|
|
"entropy": 1.0542234126478434,
|
|
"epoch": 2.032020628674242,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 5.477418076258675e-06,
|
|
"loss": 1.039,
|
|
"mean_token_accuracy": 0.7126051351428032,
|
|
"num_tokens": 494416043.0,
|
|
"step": 6600
|
|
},
|
|
{
|
|
"entropy": 1.100265472754836,
|
|
"epoch": 2.0335600819758883,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 5.4629809927756794e-06,
|
|
"loss": 1.0934,
|
|
"mean_token_accuracy": 0.7013812072575092,
|
|
"num_tokens": 494782921.0,
|
|
"step": 6605
|
|
},
|
|
{
|
|
"entropy": 1.0952286729589105,
|
|
"epoch": 2.0350995352775345,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 5.448555807096111e-06,
|
|
"loss": 1.0802,
|
|
"mean_token_accuracy": 0.702903700992465,
|
|
"num_tokens": 495150957.0,
|
|
"step": 6610
|
|
},
|
|
{
|
|
"entropy": 1.1071723556146025,
|
|
"epoch": 2.0366389885791807,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 5.434142557048332e-06,
|
|
"loss": 1.1029,
|
|
"mean_token_accuracy": 0.7018020739778876,
|
|
"num_tokens": 495518232.0,
|
|
"step": 6615
|
|
},
|
|
{
|
|
"entropy": 1.1007261924445628,
|
|
"epoch": 2.038178441880827,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 5.41974128042942e-06,
|
|
"loss": 1.0851,
|
|
"mean_token_accuracy": 0.7055002640932798,
|
|
"num_tokens": 495892341.0,
|
|
"step": 6620
|
|
},
|
|
{
|
|
"entropy": 1.0998514492064715,
|
|
"epoch": 2.0397178951824735,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 5.405352015005039e-06,
|
|
"loss": 1.1078,
|
|
"mean_token_accuracy": 0.7054444964975118,
|
|
"num_tokens": 496263007.0,
|
|
"step": 6625
|
|
},
|
|
{
|
|
"entropy": 1.1148683808743953,
|
|
"epoch": 2.0412573484841197,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 5.3909747985093565e-06,
|
|
"loss": 1.1085,
|
|
"mean_token_accuracy": 0.7022008113563061,
|
|
"num_tokens": 496624302.0,
|
|
"step": 6630
|
|
},
|
|
{
|
|
"entropy": 1.097429853491485,
|
|
"epoch": 2.042796801785766,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 5.376609668644954e-06,
|
|
"loss": 1.0936,
|
|
"mean_token_accuracy": 0.7041172161698341,
|
|
"num_tokens": 496990351.0,
|
|
"step": 6635
|
|
},
|
|
{
|
|
"entropy": 1.0846844960004092,
|
|
"epoch": 2.044336255087412,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 5.362256663082708e-06,
|
|
"loss": 1.0702,
|
|
"mean_token_accuracy": 0.7036056589335203,
|
|
"num_tokens": 497369186.0,
|
|
"step": 6640
|
|
},
|
|
{
|
|
"entropy": 1.0533880908042192,
|
|
"epoch": 2.045875708389058,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 5.3479158194617e-06,
|
|
"loss": 1.0454,
|
|
"mean_token_accuracy": 0.7085426319390535,
|
|
"num_tokens": 497746007.0,
|
|
"step": 6645
|
|
},
|
|
{
|
|
"entropy": 1.0751962704584002,
|
|
"epoch": 2.0474151616907044,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 5.333587175389117e-06,
|
|
"loss": 1.0659,
|
|
"mean_token_accuracy": 0.7083644978702068,
|
|
"num_tokens": 498118798.0,
|
|
"step": 6650
|
|
},
|
|
{
|
|
"entropy": 1.0909398451447487,
|
|
"epoch": 2.048954614992351,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 5.3192707684401665e-06,
|
|
"loss": 1.0831,
|
|
"mean_token_accuracy": 0.7041855741292238,
|
|
"num_tokens": 498486981.0,
|
|
"step": 6655
|
|
},
|
|
{
|
|
"entropy": 1.0440230850130319,
|
|
"epoch": 2.050494068293997,
|
|
"grad_norm": 0.65234375,
|
|
"learning_rate": 5.304966636157952e-06,
|
|
"loss": 1.0331,
|
|
"mean_token_accuracy": 0.7139819342643022,
|
|
"num_tokens": 498876806.0,
|
|
"step": 6660
|
|
},
|
|
{
|
|
"entropy": 1.0596886252984405,
|
|
"epoch": 2.0520335215956433,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 5.2906748160533895e-06,
|
|
"loss": 1.0351,
|
|
"mean_token_accuracy": 0.7121299121528863,
|
|
"num_tokens": 499255745.0,
|
|
"step": 6665
|
|
},
|
|
{
|
|
"entropy": 1.1212430890649556,
|
|
"epoch": 2.0535729748972895,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 5.276395345605119e-06,
|
|
"loss": 1.1126,
|
|
"mean_token_accuracy": 0.7012370094656944,
|
|
"num_tokens": 499610073.0,
|
|
"step": 6670
|
|
},
|
|
{
|
|
"entropy": 1.0775518629699945,
|
|
"epoch": 2.0551124281989357,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 5.26212826225938e-06,
|
|
"loss": 1.0623,
|
|
"mean_token_accuracy": 0.7060338318347931,
|
|
"num_tokens": 499990341.0,
|
|
"step": 6675
|
|
},
|
|
{
|
|
"entropy": 1.1210505481809379,
|
|
"epoch": 2.0566518815005823,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 5.2478736034299415e-06,
|
|
"loss": 1.1189,
|
|
"mean_token_accuracy": 0.6994668480008841,
|
|
"num_tokens": 500351059.0,
|
|
"step": 6680
|
|
},
|
|
{
|
|
"entropy": 1.1117592051625251,
|
|
"epoch": 2.0581913348022285,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 5.2336314064979766e-06,
|
|
"loss": 1.1056,
|
|
"mean_token_accuracy": 0.7009845215827226,
|
|
"num_tokens": 500730481.0,
|
|
"step": 6685
|
|
},
|
|
{
|
|
"entropy": 1.074427846260369,
|
|
"epoch": 2.0597307881038747,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 5.219401708811993e-06,
|
|
"loss": 1.0658,
|
|
"mean_token_accuracy": 0.709907752647996,
|
|
"num_tokens": 501108650.0,
|
|
"step": 6690
|
|
},
|
|
{
|
|
"entropy": 1.0492214001715183,
|
|
"epoch": 2.061270241405521,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 5.205184547687714e-06,
|
|
"loss": 1.0495,
|
|
"mean_token_accuracy": 0.7113306373357773,
|
|
"num_tokens": 501481875.0,
|
|
"step": 6695
|
|
},
|
|
{
|
|
"entropy": 1.1287394972518086,
|
|
"epoch": 2.062809694707167,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 5.19097996040798e-06,
|
|
"loss": 1.1206,
|
|
"mean_token_accuracy": 0.6949212741106748,
|
|
"num_tokens": 501862921.0,
|
|
"step": 6700
|
|
},
|
|
{
|
|
"entropy": 1.0915212294086813,
|
|
"epoch": 2.064349148008813,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 5.1767879842226745e-06,
|
|
"loss": 1.0904,
|
|
"mean_token_accuracy": 0.7026161756366491,
|
|
"num_tokens": 502249471.0,
|
|
"step": 6705
|
|
},
|
|
{
|
|
"entropy": 1.0963831450790167,
|
|
"epoch": 2.06588860131046,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 5.162608656348597e-06,
|
|
"loss": 1.0964,
|
|
"mean_token_accuracy": 0.7036610264331102,
|
|
"num_tokens": 502633572.0,
|
|
"step": 6710
|
|
},
|
|
{
|
|
"entropy": 1.1283135764300822,
|
|
"epoch": 2.067428054612106,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 5.1484420139693805e-06,
|
|
"loss": 1.1134,
|
|
"mean_token_accuracy": 0.6957179635763169,
|
|
"num_tokens": 503014949.0,
|
|
"step": 6715
|
|
},
|
|
{
|
|
"entropy": 1.0769828870892524,
|
|
"epoch": 2.068967507913752,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 5.13428809423539e-06,
|
|
"loss": 1.0638,
|
|
"mean_token_accuracy": 0.7081765212118626,
|
|
"num_tokens": 503382605.0,
|
|
"step": 6720
|
|
},
|
|
{
|
|
"entropy": 1.1067400734871626,
|
|
"epoch": 2.0705069612153983,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 5.120146934263638e-06,
|
|
"loss": 1.0999,
|
|
"mean_token_accuracy": 0.6966788105666637,
|
|
"num_tokens": 503749538.0,
|
|
"step": 6725
|
|
},
|
|
{
|
|
"entropy": 1.1062267083674668,
|
|
"epoch": 2.0720464145170445,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 5.106018571137663e-06,
|
|
"loss": 1.103,
|
|
"mean_token_accuracy": 0.6997734434902668,
|
|
"num_tokens": 504133709.0,
|
|
"step": 6730
|
|
},
|
|
{
|
|
"entropy": 1.0811271447688342,
|
|
"epoch": 2.0735858678186907,
|
|
"grad_norm": 0.66015625,
|
|
"learning_rate": 5.091903041907449e-06,
|
|
"loss": 1.0721,
|
|
"mean_token_accuracy": 0.7056033130735159,
|
|
"num_tokens": 504514578.0,
|
|
"step": 6735
|
|
},
|
|
{
|
|
"entropy": 1.0823164772242309,
|
|
"epoch": 2.0751253211203373,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 5.077800383589331e-06,
|
|
"loss": 1.0844,
|
|
"mean_token_accuracy": 0.7084089383482933,
|
|
"num_tokens": 504890244.0,
|
|
"step": 6740
|
|
},
|
|
{
|
|
"entropy": 1.0963746555149556,
|
|
"epoch": 2.0766647744219835,
|
|
"grad_norm": 0.65234375,
|
|
"learning_rate": 5.0637106331658815e-06,
|
|
"loss": 1.0841,
|
|
"mean_token_accuracy": 0.7029589910060168,
|
|
"num_tokens": 505283540.0,
|
|
"step": 6745
|
|
},
|
|
{
|
|
"entropy": 1.089256815239787,
|
|
"epoch": 2.0782042277236297,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 5.049633827585832e-06,
|
|
"loss": 1.0776,
|
|
"mean_token_accuracy": 0.7047931130975484,
|
|
"num_tokens": 505642518.0,
|
|
"step": 6750
|
|
},
|
|
{
|
|
"entropy": 1.0970627972856164,
|
|
"epoch": 2.079743681025276,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 5.035570003763958e-06,
|
|
"loss": 1.092,
|
|
"mean_token_accuracy": 0.7042382974177599,
|
|
"num_tokens": 506010915.0,
|
|
"step": 6755
|
|
},
|
|
{
|
|
"entropy": 1.1179208228364588,
|
|
"epoch": 2.081283134326922,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 5.021519198581002e-06,
|
|
"loss": 1.1117,
|
|
"mean_token_accuracy": 0.7009057279676199,
|
|
"num_tokens": 506368180.0,
|
|
"step": 6760
|
|
},
|
|
{
|
|
"entropy": 1.0583285145461558,
|
|
"epoch": 2.082822587628568,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 5.007481448883567e-06,
|
|
"loss": 1.0469,
|
|
"mean_token_accuracy": 0.712808421254158,
|
|
"num_tokens": 506724683.0,
|
|
"step": 6765
|
|
},
|
|
{
|
|
"entropy": 1.1060079161077738,
|
|
"epoch": 2.084362040930215,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 4.993456791484009e-06,
|
|
"loss": 1.0995,
|
|
"mean_token_accuracy": 0.7020147833973169,
|
|
"num_tokens": 507098830.0,
|
|
"step": 6770
|
|
},
|
|
{
|
|
"entropy": 1.0599766116589309,
|
|
"epoch": 2.085901494231861,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 4.979445263160357e-06,
|
|
"loss": 1.0453,
|
|
"mean_token_accuracy": 0.7089229926466942,
|
|
"num_tokens": 507473952.0,
|
|
"step": 6775
|
|
},
|
|
{
|
|
"entropy": 1.0991381265223026,
|
|
"epoch": 2.087440947533507,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 4.965446900656215e-06,
|
|
"loss": 1.1026,
|
|
"mean_token_accuracy": 0.7029609505087138,
|
|
"num_tokens": 507840150.0,
|
|
"step": 6780
|
|
},
|
|
{
|
|
"entropy": 1.0928684398531914,
|
|
"epoch": 2.0889804008351534,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 4.951461740680655e-06,
|
|
"loss": 1.0783,
|
|
"mean_token_accuracy": 0.7046906016767025,
|
|
"num_tokens": 508221754.0,
|
|
"step": 6785
|
|
},
|
|
{
|
|
"entropy": 1.1165203005075455,
|
|
"epoch": 2.0905198541367995,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 4.9374898199081245e-06,
|
|
"loss": 1.1101,
|
|
"mean_token_accuracy": 0.7010883528739213,
|
|
"num_tokens": 508586756.0,
|
|
"step": 6790
|
|
},
|
|
{
|
|
"entropy": 1.0991051271557808,
|
|
"epoch": 2.092059307438446,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 4.923531174978363e-06,
|
|
"loss": 1.0969,
|
|
"mean_token_accuracy": 0.7033261306583881,
|
|
"num_tokens": 508958238.0,
|
|
"step": 6795
|
|
},
|
|
{
|
|
"entropy": 1.103384531661868,
|
|
"epoch": 2.0935987607400923,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 4.909585842496287e-06,
|
|
"loss": 1.1009,
|
|
"mean_token_accuracy": 0.7021346442401409,
|
|
"num_tokens": 509326606.0,
|
|
"step": 6800
|
|
},
|
|
{
|
|
"entropy": 1.070336803421378,
|
|
"epoch": 2.0951382140417385,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 4.895653859031906e-06,
|
|
"loss": 1.0606,
|
|
"mean_token_accuracy": 0.7092524375766516,
|
|
"num_tokens": 509700072.0,
|
|
"step": 6805
|
|
},
|
|
{
|
|
"entropy": 1.100915815681219,
|
|
"epoch": 2.0966776673433847,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 4.881735261120216e-06,
|
|
"loss": 1.0966,
|
|
"mean_token_accuracy": 0.7020135141909123,
|
|
"num_tokens": 510065667.0,
|
|
"step": 6810
|
|
},
|
|
{
|
|
"entropy": 1.0898480478674173,
|
|
"epoch": 2.098217120645031,
|
|
"grad_norm": 0.66015625,
|
|
"learning_rate": 4.867830085261128e-06,
|
|
"loss": 1.0763,
|
|
"mean_token_accuracy": 0.7027867827564478,
|
|
"num_tokens": 510440308.0,
|
|
"step": 6815
|
|
},
|
|
{
|
|
"entropy": 1.1009971672669052,
|
|
"epoch": 2.099756573946677,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 4.853938367919338e-06,
|
|
"loss": 1.087,
|
|
"mean_token_accuracy": 0.7035770278424025,
|
|
"num_tokens": 510813487.0,
|
|
"step": 6820
|
|
},
|
|
{
|
|
"entropy": 1.099606516212225,
|
|
"epoch": 2.1012960272483237,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 4.840060145524254e-06,
|
|
"loss": 1.0743,
|
|
"mean_token_accuracy": 0.7031406704336405,
|
|
"num_tokens": 511189467.0,
|
|
"step": 6825
|
|
},
|
|
{
|
|
"entropy": 1.0487020175904036,
|
|
"epoch": 2.10283548054997,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 4.8261954544699045e-06,
|
|
"loss": 1.0369,
|
|
"mean_token_accuracy": 0.7126423344016075,
|
|
"num_tokens": 511544736.0,
|
|
"step": 6830
|
|
},
|
|
{
|
|
"entropy": 1.078133366443217,
|
|
"epoch": 2.104374933851616,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 4.8123443311148175e-06,
|
|
"loss": 1.0648,
|
|
"mean_token_accuracy": 0.7067284598946572,
|
|
"num_tokens": 511905374.0,
|
|
"step": 6835
|
|
},
|
|
{
|
|
"entropy": 1.0858549252152443,
|
|
"epoch": 2.105914387153262,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 4.798506811781953e-06,
|
|
"loss": 1.076,
|
|
"mean_token_accuracy": 0.705691946297884,
|
|
"num_tokens": 512291018.0,
|
|
"step": 6840
|
|
},
|
|
{
|
|
"entropy": 1.0709224401041866,
|
|
"epoch": 2.1074538404549084,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 4.784682932758588e-06,
|
|
"loss": 1.0694,
|
|
"mean_token_accuracy": 0.7084905669093132,
|
|
"num_tokens": 512673730.0,
|
|
"step": 6845
|
|
},
|
|
{
|
|
"entropy": 1.0656070049852133,
|
|
"epoch": 2.1089932937565545,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 4.770872730296239e-06,
|
|
"loss": 1.0646,
|
|
"mean_token_accuracy": 0.7081656377762556,
|
|
"num_tokens": 513045192.0,
|
|
"step": 6850
|
|
},
|
|
{
|
|
"entropy": 1.0932567993178963,
|
|
"epoch": 2.110532747058201,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 4.75707624061055e-06,
|
|
"loss": 1.0887,
|
|
"mean_token_accuracy": 0.7036776423454285,
|
|
"num_tokens": 513419333.0,
|
|
"step": 6855
|
|
},
|
|
{
|
|
"entropy": 1.1219109144061803,
|
|
"epoch": 2.1120722003598473,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 4.743293499881203e-06,
|
|
"loss": 1.1097,
|
|
"mean_token_accuracy": 0.7000679958611726,
|
|
"num_tokens": 513786174.0,
|
|
"step": 6860
|
|
},
|
|
{
|
|
"entropy": 1.0711252562701703,
|
|
"epoch": 2.1136116536614935,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 4.729524544251837e-06,
|
|
"loss": 1.0738,
|
|
"mean_token_accuracy": 0.7065213404595851,
|
|
"num_tokens": 514167079.0,
|
|
"step": 6865
|
|
},
|
|
{
|
|
"entropy": 1.1069033950567246,
|
|
"epoch": 2.1151511069631397,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 4.715769409829926e-06,
|
|
"loss": 1.1004,
|
|
"mean_token_accuracy": 0.7004016790539026,
|
|
"num_tokens": 514533442.0,
|
|
"step": 6870
|
|
},
|
|
{
|
|
"entropy": 1.0824607308954,
|
|
"epoch": 2.116690560264786,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 4.702028132686711e-06,
|
|
"loss": 1.0763,
|
|
"mean_token_accuracy": 0.7047397267073393,
|
|
"num_tokens": 514913184.0,
|
|
"step": 6875
|
|
},
|
|
{
|
|
"entropy": 1.1173352781683206,
|
|
"epoch": 2.118230013566432,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 4.688300748857083e-06,
|
|
"loss": 1.1101,
|
|
"mean_token_accuracy": 0.6982607658952474,
|
|
"num_tokens": 515278347.0,
|
|
"step": 6880
|
|
},
|
|
{
|
|
"entropy": 1.1017229791730643,
|
|
"epoch": 2.1197694668680787,
|
|
"grad_norm": 0.66015625,
|
|
"learning_rate": 4.674587294339513e-06,
|
|
"loss": 1.1066,
|
|
"mean_token_accuracy": 0.7016796406358481,
|
|
"num_tokens": 515678549.0,
|
|
"step": 6885
|
|
},
|
|
{
|
|
"entropy": 1.0906006468459963,
|
|
"epoch": 2.121308920169725,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 4.660887805095935e-06,
|
|
"loss": 1.0807,
|
|
"mean_token_accuracy": 0.7028378203511239,
|
|
"num_tokens": 516056771.0,
|
|
"step": 6890
|
|
},
|
|
{
|
|
"entropy": 1.0817140895873307,
|
|
"epoch": 2.122848373471371,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 4.647202317051656e-06,
|
|
"loss": 1.0749,
|
|
"mean_token_accuracy": 0.7071141183376313,
|
|
"num_tokens": 516436027.0,
|
|
"step": 6895
|
|
},
|
|
{
|
|
"entropy": 1.0359261933714152,
|
|
"epoch": 2.124387826773017,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 4.6335308660952824e-06,
|
|
"loss": 1.0283,
|
|
"mean_token_accuracy": 0.7171918857842684,
|
|
"num_tokens": 516820384.0,
|
|
"step": 6900
|
|
},
|
|
{
|
|
"entropy": 1.0755269382148982,
|
|
"epoch": 2.1259272800746634,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 4.619873488078597e-06,
|
|
"loss": 1.0599,
|
|
"mean_token_accuracy": 0.7060963280498982,
|
|
"num_tokens": 517205005.0,
|
|
"step": 6905
|
|
},
|
|
{
|
|
"entropy": 1.0914340946823358,
|
|
"epoch": 2.1274667333763095,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 4.60623021881648e-06,
|
|
"loss": 1.073,
|
|
"mean_token_accuracy": 0.7052202550694346,
|
|
"num_tokens": 517578706.0,
|
|
"step": 6910
|
|
},
|
|
{
|
|
"entropy": 1.074513808824122,
|
|
"epoch": 2.129006186677956,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 4.592601094086811e-06,
|
|
"loss": 1.0761,
|
|
"mean_token_accuracy": 0.7057259283959866,
|
|
"num_tokens": 517962783.0,
|
|
"step": 6915
|
|
},
|
|
{
|
|
"entropy": 1.0931804332882167,
|
|
"epoch": 2.1305456399796023,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 4.57898614963039e-06,
|
|
"loss": 1.096,
|
|
"mean_token_accuracy": 0.705153239145875,
|
|
"num_tokens": 518330918.0,
|
|
"step": 6920
|
|
},
|
|
{
|
|
"entropy": 1.1161876695230604,
|
|
"epoch": 2.1320850932812485,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 4.565385421150817e-06,
|
|
"loss": 1.1027,
|
|
"mean_token_accuracy": 0.700276980921626,
|
|
"num_tokens": 518699601.0,
|
|
"step": 6925
|
|
},
|
|
{
|
|
"entropy": 1.0880257442593575,
|
|
"epoch": 2.1336245465828947,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 4.551798944314412e-06,
|
|
"loss": 1.0848,
|
|
"mean_token_accuracy": 0.7064329504966735,
|
|
"num_tokens": 519072219.0,
|
|
"step": 6930
|
|
},
|
|
{
|
|
"entropy": 1.0862583490088582,
|
|
"epoch": 2.135163999884541,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 4.5382267547501335e-06,
|
|
"loss": 1.09,
|
|
"mean_token_accuracy": 0.7049790605902672,
|
|
"num_tokens": 519459823.0,
|
|
"step": 6935
|
|
},
|
|
{
|
|
"entropy": 1.0636250710114836,
|
|
"epoch": 2.136703453186187,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 4.524668888049466e-06,
|
|
"loss": 1.0565,
|
|
"mean_token_accuracy": 0.7103498015552759,
|
|
"num_tokens": 519839902.0,
|
|
"step": 6940
|
|
},
|
|
{
|
|
"entropy": 1.09498644862324,
|
|
"epoch": 2.1382429064878337,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 4.511125379766332e-06,
|
|
"loss": 1.081,
|
|
"mean_token_accuracy": 0.704300693422556,
|
|
"num_tokens": 520207887.0,
|
|
"step": 6945
|
|
},
|
|
{
|
|
"entropy": 1.1112999394536018,
|
|
"epoch": 2.13978235978948,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 4.497596265416999e-06,
|
|
"loss": 1.0964,
|
|
"mean_token_accuracy": 0.6997986163944006,
|
|
"num_tokens": 520577346.0,
|
|
"step": 6950
|
|
},
|
|
{
|
|
"entropy": 1.0772620491683482,
|
|
"epoch": 2.141321813091126,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 4.4840815804800005e-06,
|
|
"loss": 1.0786,
|
|
"mean_token_accuracy": 0.7058813691139221,
|
|
"num_tokens": 520945019.0,
|
|
"step": 6955
|
|
},
|
|
{
|
|
"entropy": 1.10758404918015,
|
|
"epoch": 2.142861266392772,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 4.470581360396019e-06,
|
|
"loss": 1.0955,
|
|
"mean_token_accuracy": 0.7022460035979747,
|
|
"num_tokens": 521314750.0,
|
|
"step": 6960
|
|
},
|
|
{
|
|
"entropy": 1.0734881050884724,
|
|
"epoch": 2.1444007196944184,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 4.457095640567804e-06,
|
|
"loss": 1.0726,
|
|
"mean_token_accuracy": 0.7088086251169443,
|
|
"num_tokens": 521681299.0,
|
|
"step": 6965
|
|
},
|
|
{
|
|
"entropy": 1.0942446809262036,
|
|
"epoch": 2.145940172996065,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 4.44362445636009e-06,
|
|
"loss": 1.0841,
|
|
"mean_token_accuracy": 0.7021552998572588,
|
|
"num_tokens": 522058438.0,
|
|
"step": 6970
|
|
},
|
|
{
|
|
"entropy": 1.084139898046851,
|
|
"epoch": 2.147479626297711,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 4.430167843099483e-06,
|
|
"loss": 1.088,
|
|
"mean_token_accuracy": 0.7050567608326673,
|
|
"num_tokens": 522433643.0,
|
|
"step": 6975
|
|
},
|
|
{
|
|
"entropy": 1.0688125457614661,
|
|
"epoch": 2.1490190795993573,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 4.416725836074384e-06,
|
|
"loss": 1.0609,
|
|
"mean_token_accuracy": 0.707032847777009,
|
|
"num_tokens": 522802597.0,
|
|
"step": 6980
|
|
},
|
|
{
|
|
"entropy": 1.0735689697787165,
|
|
"epoch": 2.1505585329010035,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 4.403298470534885e-06,
|
|
"loss": 1.0782,
|
|
"mean_token_accuracy": 0.707801154628396,
|
|
"num_tokens": 523164749.0,
|
|
"step": 6985
|
|
},
|
|
{
|
|
"entropy": 1.077799851447344,
|
|
"epoch": 2.1520979862026497,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 4.389885781692695e-06,
|
|
"loss": 1.0797,
|
|
"mean_token_accuracy": 0.7071746230125427,
|
|
"num_tokens": 523535983.0,
|
|
"step": 6990
|
|
},
|
|
{
|
|
"entropy": 1.1391544550657273,
|
|
"epoch": 2.153637439504296,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 4.376487804721022e-06,
|
|
"loss": 1.1348,
|
|
"mean_token_accuracy": 0.6927572928369046,
|
|
"num_tokens": 523904330.0,
|
|
"step": 6995
|
|
},
|
|
{
|
|
"entropy": 1.0692474026232959,
|
|
"epoch": 2.1551768928059425,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 4.363104574754495e-06,
|
|
"loss": 1.0549,
|
|
"mean_token_accuracy": 0.7088678143918514,
|
|
"num_tokens": 524278211.0,
|
|
"step": 7000
|
|
},
|
|
{
|
|
"entropy": 1.090220133587718,
|
|
"epoch": 2.1567163461075887,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 4.349736126889084e-06,
|
|
"loss": 1.0771,
|
|
"mean_token_accuracy": 0.7025599487125873,
|
|
"num_tokens": 524655748.0,
|
|
"step": 7005
|
|
},
|
|
{
|
|
"entropy": 1.1282481502741575,
|
|
"epoch": 2.158255799409235,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 4.336382496181978e-06,
|
|
"loss": 1.131,
|
|
"mean_token_accuracy": 0.6949572131037712,
|
|
"num_tokens": 525028983.0,
|
|
"step": 7010
|
|
},
|
|
{
|
|
"entropy": 1.120839673280716,
|
|
"epoch": 2.159795252710881,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 4.323043717651518e-06,
|
|
"loss": 1.1127,
|
|
"mean_token_accuracy": 0.6990990485996008,
|
|
"num_tokens": 525390615.0,
|
|
"step": 7015
|
|
},
|
|
{
|
|
"entropy": 1.1259587448090316,
|
|
"epoch": 2.161334706012527,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 4.309719826277094e-06,
|
|
"loss": 1.1158,
|
|
"mean_token_accuracy": 0.6975144233554602,
|
|
"num_tokens": 525784439.0,
|
|
"step": 7020
|
|
},
|
|
{
|
|
"entropy": 1.1019885558634996,
|
|
"epoch": 2.1628741593141734,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 4.296410856999062e-06,
|
|
"loss": 1.0938,
|
|
"mean_token_accuracy": 0.7006021168082952,
|
|
"num_tokens": 526152265.0,
|
|
"step": 7025
|
|
},
|
|
{
|
|
"entropy": 1.1190752733498812,
|
|
"epoch": 2.16441361261582,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 4.2831168447186425e-06,
|
|
"loss": 1.1079,
|
|
"mean_token_accuracy": 0.6977927356958389,
|
|
"num_tokens": 526510644.0,
|
|
"step": 7030
|
|
},
|
|
{
|
|
"entropy": 1.0918694462627172,
|
|
"epoch": 2.165953065917466,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 4.2698378242978254e-06,
|
|
"loss": 1.0766,
|
|
"mean_token_accuracy": 0.7058471787720919,
|
|
"num_tokens": 526881685.0,
|
|
"step": 7035
|
|
},
|
|
{
|
|
"entropy": 1.0784983541816473,
|
|
"epoch": 2.1674925192191123,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 4.256573830559303e-06,
|
|
"loss": 1.0687,
|
|
"mean_token_accuracy": 0.7078216753900051,
|
|
"num_tokens": 527248682.0,
|
|
"step": 7040
|
|
},
|
|
{
|
|
"entropy": 1.0594509843736888,
|
|
"epoch": 2.1690319725207585,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 4.243324898286349e-06,
|
|
"loss": 1.0405,
|
|
"mean_token_accuracy": 0.7114957604557276,
|
|
"num_tokens": 527628131.0,
|
|
"step": 7045
|
|
},
|
|
{
|
|
"entropy": 1.0864426681771875,
|
|
"epoch": 2.1705714258224047,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 4.230091062222742e-06,
|
|
"loss": 1.0833,
|
|
"mean_token_accuracy": 0.7073518063873052,
|
|
"num_tokens": 528001842.0,
|
|
"step": 7050
|
|
},
|
|
{
|
|
"entropy": 1.101283255778253,
|
|
"epoch": 2.172110879124051,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 4.2168723570726735e-06,
|
|
"loss": 1.1006,
|
|
"mean_token_accuracy": 0.7044052138924599,
|
|
"num_tokens": 528378879.0,
|
|
"step": 7055
|
|
},
|
|
{
|
|
"entropy": 1.0982765555381775,
|
|
"epoch": 2.1736503324256975,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 4.203668817500662e-06,
|
|
"loss": 1.101,
|
|
"mean_token_accuracy": 0.7012195762246847,
|
|
"num_tokens": 528735616.0,
|
|
"step": 7060
|
|
},
|
|
{
|
|
"entropy": 1.0832541318610311,
|
|
"epoch": 2.1751897857273437,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 4.190480478131443e-06,
|
|
"loss": 1.0769,
|
|
"mean_token_accuracy": 0.7044674929231405,
|
|
"num_tokens": 529117326.0,
|
|
"step": 7065
|
|
},
|
|
{
|
|
"entropy": 1.094456014595926,
|
|
"epoch": 2.17672923902899,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 4.177307373549908e-06,
|
|
"loss": 1.0929,
|
|
"mean_token_accuracy": 0.7025119356811047,
|
|
"num_tokens": 529503060.0,
|
|
"step": 7070
|
|
},
|
|
{
|
|
"entropy": 1.0836938658729196,
|
|
"epoch": 2.178268692330636,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 4.16414953830098e-06,
|
|
"loss": 1.0729,
|
|
"mean_token_accuracy": 0.7080078683793545,
|
|
"num_tokens": 529872089.0,
|
|
"step": 7075
|
|
},
|
|
{
|
|
"entropy": 1.0970235496759415,
|
|
"epoch": 2.179808145632282,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 4.151007006889556e-06,
|
|
"loss": 1.0838,
|
|
"mean_token_accuracy": 0.702376975864172,
|
|
"num_tokens": 530243450.0,
|
|
"step": 7080
|
|
},
|
|
{
|
|
"entropy": 1.0968677282333374,
|
|
"epoch": 2.181347598933929,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 4.137879813780388e-06,
|
|
"loss": 1.0764,
|
|
"mean_token_accuracy": 0.7048271480947733,
|
|
"num_tokens": 530614084.0,
|
|
"step": 7085
|
|
},
|
|
{
|
|
"entropy": 1.0746355384588242,
|
|
"epoch": 2.182887052235575,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 4.124767993398009e-06,
|
|
"loss": 1.0694,
|
|
"mean_token_accuracy": 0.707459171116352,
|
|
"num_tokens": 530990419.0,
|
|
"step": 7090
|
|
},
|
|
{
|
|
"entropy": 1.1020061090588569,
|
|
"epoch": 2.184426505537221,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 4.111671580126637e-06,
|
|
"loss": 1.0892,
|
|
"mean_token_accuracy": 0.7019701339304447,
|
|
"num_tokens": 531338117.0,
|
|
"step": 7095
|
|
},
|
|
{
|
|
"entropy": 1.0782205116003751,
|
|
"epoch": 2.1859659588388674,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 4.098590608310097e-06,
|
|
"loss": 1.0627,
|
|
"mean_token_accuracy": 0.7065909449011087,
|
|
"num_tokens": 531716985.0,
|
|
"step": 7100
|
|
},
|
|
{
|
|
"entropy": 1.0996290042996406,
|
|
"epoch": 2.1875054121405135,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 4.085525112251706e-06,
|
|
"loss": 1.0841,
|
|
"mean_token_accuracy": 0.702437836676836,
|
|
"num_tokens": 532079642.0,
|
|
"step": 7105
|
|
},
|
|
{
|
|
"entropy": 1.07847051769495,
|
|
"epoch": 2.1890448654421597,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 4.072475126214204e-06,
|
|
"loss": 1.0732,
|
|
"mean_token_accuracy": 0.7065206378698349,
|
|
"num_tokens": 532451758.0,
|
|
"step": 7110
|
|
},
|
|
{
|
|
"entropy": 1.1080379780381917,
|
|
"epoch": 2.190584318743806,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 4.0594406844196636e-06,
|
|
"loss": 1.104,
|
|
"mean_token_accuracy": 0.7033426735550166,
|
|
"num_tokens": 532823806.0,
|
|
"step": 7115
|
|
},
|
|
{
|
|
"entropy": 1.0777929227799177,
|
|
"epoch": 2.1921237720454525,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 4.046421821049385e-06,
|
|
"loss": 1.0692,
|
|
"mean_token_accuracy": 0.7061353322118521,
|
|
"num_tokens": 533196357.0,
|
|
"step": 7120
|
|
},
|
|
{
|
|
"entropy": 1.078826167061925,
|
|
"epoch": 2.1936632253470987,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 4.033418570243819e-06,
|
|
"loss": 1.0658,
|
|
"mean_token_accuracy": 0.7076907180249691,
|
|
"num_tokens": 533571975.0,
|
|
"step": 7125
|
|
},
|
|
{
|
|
"entropy": 1.1156905554234982,
|
|
"epoch": 2.195202678648745,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 4.020430966102474e-06,
|
|
"loss": 1.1202,
|
|
"mean_token_accuracy": 0.6966037277132273,
|
|
"num_tokens": 533936843.0,
|
|
"step": 7130
|
|
},
|
|
{
|
|
"entropy": 1.1105396434664727,
|
|
"epoch": 2.196742131950391,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 4.007459042683832e-06,
|
|
"loss": 1.1072,
|
|
"mean_token_accuracy": 0.6989070728421212,
|
|
"num_tokens": 534314626.0,
|
|
"step": 7135
|
|
},
|
|
{
|
|
"entropy": 1.1017569642513991,
|
|
"epoch": 2.198281585252037,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 3.994502834005249e-06,
|
|
"loss": 1.0957,
|
|
"mean_token_accuracy": 0.7027489259839058,
|
|
"num_tokens": 534687052.0,
|
|
"step": 7140
|
|
},
|
|
{
|
|
"entropy": 1.0926490917801857,
|
|
"epoch": 2.199821038553684,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 3.981562374042867e-06,
|
|
"loss": 1.0971,
|
|
"mean_token_accuracy": 0.7016716837882996,
|
|
"num_tokens": 535060772.0,
|
|
"step": 7145
|
|
},
|
|
{
|
|
"entropy": 1.0636799171566964,
|
|
"epoch": 2.20136049185533,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 3.96863769673154e-06,
|
|
"loss": 1.0613,
|
|
"mean_token_accuracy": 0.7081130899488925,
|
|
"num_tokens": 535439372.0,
|
|
"step": 7150
|
|
},
|
|
{
|
|
"entropy": 1.0643171694129705,
|
|
"epoch": 2.202899945156976,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 3.955728835964724e-06,
|
|
"loss": 1.0525,
|
|
"mean_token_accuracy": 0.7103862762451172,
|
|
"num_tokens": 535837364.0,
|
|
"step": 7155
|
|
},
|
|
{
|
|
"entropy": 1.114139237999916,
|
|
"epoch": 2.2044393984586224,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 3.942835825594403e-06,
|
|
"loss": 1.1081,
|
|
"mean_token_accuracy": 0.7023636277765035,
|
|
"num_tokens": 536195800.0,
|
|
"step": 7160
|
|
},
|
|
{
|
|
"entropy": 1.0699137741699816,
|
|
"epoch": 2.2059788517602685,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 3.9299586994309905e-06,
|
|
"loss": 1.0599,
|
|
"mean_token_accuracy": 0.7087704047560692,
|
|
"num_tokens": 536560466.0,
|
|
"step": 7165
|
|
},
|
|
{
|
|
"entropy": 1.108319771848619,
|
|
"epoch": 2.2075183050619147,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 3.917097491243252e-06,
|
|
"loss": 1.1053,
|
|
"mean_token_accuracy": 0.7010800469666719,
|
|
"num_tokens": 536934218.0,
|
|
"step": 7170
|
|
},
|
|
{
|
|
"entropy": 1.0901294181123375,
|
|
"epoch": 2.2090577583635613,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 3.904252234758208e-06,
|
|
"loss": 1.0788,
|
|
"mean_token_accuracy": 0.7054005976766348,
|
|
"num_tokens": 537311815.0,
|
|
"step": 7175
|
|
},
|
|
{
|
|
"entropy": 1.0708168588578701,
|
|
"epoch": 2.2105972116652075,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 3.891422963661039e-06,
|
|
"loss": 1.0705,
|
|
"mean_token_accuracy": 0.7057724598795175,
|
|
"num_tokens": 537703368.0,
|
|
"step": 7180
|
|
},
|
|
{
|
|
"entropy": 1.0844555536285043,
|
|
"epoch": 2.2121366649668537,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 3.878609711595022e-06,
|
|
"loss": 1.0763,
|
|
"mean_token_accuracy": 0.7045952614396811,
|
|
"num_tokens": 538083755.0,
|
|
"step": 7185
|
|
},
|
|
{
|
|
"entropy": 1.1050536457449198,
|
|
"epoch": 2.2136761182685,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 3.8658125121614106e-06,
|
|
"loss": 1.0985,
|
|
"mean_token_accuracy": 0.7029761165380478,
|
|
"num_tokens": 538463331.0,
|
|
"step": 7190
|
|
},
|
|
{
|
|
"entropy": 1.1478628635406494,
|
|
"epoch": 2.215215571570146,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 3.853031398919372e-06,
|
|
"loss": 1.1384,
|
|
"mean_token_accuracy": 0.6937270931899547,
|
|
"num_tokens": 538829722.0,
|
|
"step": 7195
|
|
},
|
|
{
|
|
"entropy": 1.0832406245172024,
|
|
"epoch": 2.216755024871792,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 3.84026640538588e-06,
|
|
"loss": 1.0685,
|
|
"mean_token_accuracy": 0.7034183513373137,
|
|
"num_tokens": 539213797.0,
|
|
"step": 7200
|
|
},
|
|
{
|
|
"entropy": 1.0713561676442622,
|
|
"epoch": 2.218294478173439,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 3.8275175650356485e-06,
|
|
"loss": 1.0619,
|
|
"mean_token_accuracy": 0.7095958709716796,
|
|
"num_tokens": 539587738.0,
|
|
"step": 7205
|
|
},
|
|
{
|
|
"entropy": 1.1052755542099475,
|
|
"epoch": 2.219833931475085,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 3.814784911301024e-06,
|
|
"loss": 1.0993,
|
|
"mean_token_accuracy": 0.7030059084296226,
|
|
"num_tokens": 539958472.0,
|
|
"step": 7210
|
|
},
|
|
{
|
|
"entropy": 1.0829205982387067,
|
|
"epoch": 2.221373384776731,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 3.802068477571901e-06,
|
|
"loss": 1.0701,
|
|
"mean_token_accuracy": 0.7067614793777466,
|
|
"num_tokens": 540325788.0,
|
|
"step": 7215
|
|
},
|
|
{
|
|
"entropy": 1.096410566754639,
|
|
"epoch": 2.2229128380783774,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 3.7893682971956512e-06,
|
|
"loss": 1.0993,
|
|
"mean_token_accuracy": 0.7034401163458824,
|
|
"num_tokens": 540701964.0,
|
|
"step": 7220
|
|
},
|
|
{
|
|
"entropy": 1.0891225857660174,
|
|
"epoch": 2.2244522913800235,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 3.7766844034770155e-06,
|
|
"loss": 1.0736,
|
|
"mean_token_accuracy": 0.7025317307561636,
|
|
"num_tokens": 541076927.0,
|
|
"step": 7225
|
|
},
|
|
{
|
|
"entropy": 1.0698047395795585,
|
|
"epoch": 2.2259917446816697,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 3.7640168296780243e-06,
|
|
"loss": 1.0598,
|
|
"mean_token_accuracy": 0.7089819565415383,
|
|
"num_tokens": 541441579.0,
|
|
"step": 7230
|
|
},
|
|
{
|
|
"entropy": 1.046557430177927,
|
|
"epoch": 2.2275311979833163,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 3.7513656090179116e-06,
|
|
"loss": 1.037,
|
|
"mean_token_accuracy": 0.7123051200062036,
|
|
"num_tokens": 541804673.0,
|
|
"step": 7235
|
|
},
|
|
{
|
|
"entropy": 1.0683314673602582,
|
|
"epoch": 2.2290706512849625,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 3.738730774673035e-06,
|
|
"loss": 1.053,
|
|
"mean_token_accuracy": 0.7114871054887771,
|
|
"num_tokens": 542187133.0,
|
|
"step": 7240
|
|
},
|
|
{
|
|
"entropy": 1.06356461904943,
|
|
"epoch": 2.2306101045866087,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 3.72611235977677e-06,
|
|
"loss": 1.0568,
|
|
"mean_token_accuracy": 0.7085862934589386,
|
|
"num_tokens": 542567529.0,
|
|
"step": 7245
|
|
},
|
|
{
|
|
"entropy": 1.13819719273597,
|
|
"epoch": 2.232149557888255,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 3.7135103974194376e-06,
|
|
"loss": 1.1318,
|
|
"mean_token_accuracy": 0.6968474093824625,
|
|
"num_tokens": 542942820.0,
|
|
"step": 7250
|
|
},
|
|
{
|
|
"entropy": 1.100247747451067,
|
|
"epoch": 2.233689011189901,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 3.700924920648219e-06,
|
|
"loss": 1.0855,
|
|
"mean_token_accuracy": 0.7022083260118961,
|
|
"num_tokens": 543317901.0,
|
|
"step": 7255
|
|
},
|
|
{
|
|
"entropy": 1.077917911671102,
|
|
"epoch": 2.2352284644915477,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 3.6883559624670585e-06,
|
|
"loss": 1.0698,
|
|
"mean_token_accuracy": 0.7051962066441775,
|
|
"num_tokens": 543690467.0,
|
|
"step": 7260
|
|
},
|
|
{
|
|
"entropy": 1.1094915432855488,
|
|
"epoch": 2.236767917793194,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 3.675803555836582e-06,
|
|
"loss": 1.1037,
|
|
"mean_token_accuracy": 0.7018929589539766,
|
|
"num_tokens": 544056056.0,
|
|
"step": 7265
|
|
},
|
|
{
|
|
"entropy": 1.1151261983439327,
|
|
"epoch": 2.23830737109484,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 3.6632677336740107e-06,
|
|
"loss": 1.1145,
|
|
"mean_token_accuracy": 0.7005044311285019,
|
|
"num_tokens": 544413120.0,
|
|
"step": 7270
|
|
},
|
|
{
|
|
"entropy": 1.072567318752408,
|
|
"epoch": 2.239846824396486,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 3.650748528853084e-06,
|
|
"loss": 1.0666,
|
|
"mean_token_accuracy": 0.7050907332450151,
|
|
"num_tokens": 544782719.0,
|
|
"step": 7275
|
|
},
|
|
{
|
|
"entropy": 1.0743490194901824,
|
|
"epoch": 2.2413862776981324,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 3.638245974203951e-06,
|
|
"loss": 1.0727,
|
|
"mean_token_accuracy": 0.7080906692892313,
|
|
"num_tokens": 545171618.0,
|
|
"step": 7280
|
|
},
|
|
{
|
|
"entropy": 1.08577760476619,
|
|
"epoch": 2.2429257309997785,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 3.625760102513103e-06,
|
|
"loss": 1.0882,
|
|
"mean_token_accuracy": 0.7058377280831337,
|
|
"num_tokens": 545554748.0,
|
|
"step": 7285
|
|
},
|
|
{
|
|
"entropy": 1.0908119574189186,
|
|
"epoch": 2.2444651843014247,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 3.613290946523289e-06,
|
|
"loss": 1.0846,
|
|
"mean_token_accuracy": 0.7040071625262498,
|
|
"num_tokens": 545938886.0,
|
|
"step": 7290
|
|
},
|
|
{
|
|
"entropy": 1.0599612466990949,
|
|
"epoch": 2.2460046376030713,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 3.6008385389334122e-06,
|
|
"loss": 1.0512,
|
|
"mean_token_accuracy": 0.7105075083673,
|
|
"num_tokens": 546314379.0,
|
|
"step": 7295
|
|
},
|
|
{
|
|
"entropy": 1.0860490923747421,
|
|
"epoch": 2.2475440909047175,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 3.588402912398462e-06,
|
|
"loss": 1.079,
|
|
"mean_token_accuracy": 0.7032475557178259,
|
|
"num_tokens": 546706554.0,
|
|
"step": 7300
|
|
},
|
|
{
|
|
"entropy": 1.1134677527472376,
|
|
"epoch": 2.2490835442063637,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 3.5759840995294136e-06,
|
|
"loss": 1.0971,
|
|
"mean_token_accuracy": 0.7025164358317852,
|
|
"num_tokens": 547070996.0,
|
|
"step": 7305
|
|
},
|
|
{
|
|
"entropy": 1.0836823822930455,
|
|
"epoch": 2.25062299750801,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 3.563582132893164e-06,
|
|
"loss": 1.0783,
|
|
"mean_token_accuracy": 0.7042560994625091,
|
|
"num_tokens": 547440012.0,
|
|
"step": 7310
|
|
},
|
|
{
|
|
"entropy": 1.0858331616967916,
|
|
"epoch": 2.252162450809656,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 3.5511970450124223e-06,
|
|
"loss": 1.0778,
|
|
"mean_token_accuracy": 0.7060915507376194,
|
|
"num_tokens": 547827747.0,
|
|
"step": 7315
|
|
},
|
|
{
|
|
"entropy": 1.0846232699230314,
|
|
"epoch": 2.2537019041113027,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 3.5388288683656336e-06,
|
|
"loss": 1.0616,
|
|
"mean_token_accuracy": 0.7055099099874497,
|
|
"num_tokens": 548202522.0,
|
|
"step": 7320
|
|
},
|
|
{
|
|
"entropy": 1.0849229658022523,
|
|
"epoch": 2.255241357412949,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 3.5264776353869046e-06,
|
|
"loss": 1.0694,
|
|
"mean_token_accuracy": 0.70526979342103,
|
|
"num_tokens": 548584933.0,
|
|
"step": 7325
|
|
},
|
|
{
|
|
"entropy": 1.1197235215455295,
|
|
"epoch": 2.256780810714595,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 3.514143378465903e-06,
|
|
"loss": 1.1133,
|
|
"mean_token_accuracy": 0.6981674917042255,
|
|
"num_tokens": 548958870.0,
|
|
"step": 7330
|
|
},
|
|
{
|
|
"entropy": 1.098776475712657,
|
|
"epoch": 2.258320264016241,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 3.5018261299477772e-06,
|
|
"loss": 1.0873,
|
|
"mean_token_accuracy": 0.7041664723306894,
|
|
"num_tokens": 549321589.0,
|
|
"step": 7335
|
|
},
|
|
{
|
|
"entropy": 1.091570588760078,
|
|
"epoch": 2.2598597173178874,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 3.4895259221330736e-06,
|
|
"loss": 1.0886,
|
|
"mean_token_accuracy": 0.7039386916905641,
|
|
"num_tokens": 549697139.0,
|
|
"step": 7340
|
|
},
|
|
{
|
|
"entropy": 1.1113481312990188,
|
|
"epoch": 2.2613991706195335,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 3.4772427872776606e-06,
|
|
"loss": 1.1084,
|
|
"mean_token_accuracy": 0.7016771081835032,
|
|
"num_tokens": 550076653.0,
|
|
"step": 7345
|
|
},
|
|
{
|
|
"entropy": 1.1028753362596035,
|
|
"epoch": 2.26293862392118,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 3.4649767575926217e-06,
|
|
"loss": 1.0907,
|
|
"mean_token_accuracy": 0.7028355397284031,
|
|
"num_tokens": 550439344.0,
|
|
"step": 7350
|
|
},
|
|
{
|
|
"entropy": 1.1492798574268819,
|
|
"epoch": 2.2644780772228263,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 3.4527278652441896e-06,
|
|
"loss": 1.1408,
|
|
"mean_token_accuracy": 0.6930219711735844,
|
|
"num_tokens": 550823246.0,
|
|
"step": 7355
|
|
},
|
|
{
|
|
"entropy": 1.0700744967907667,
|
|
"epoch": 2.2660175305244725,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 3.440496142353661e-06,
|
|
"loss": 1.0734,
|
|
"mean_token_accuracy": 0.7083887819200754,
|
|
"num_tokens": 551209252.0,
|
|
"step": 7360
|
|
},
|
|
{
|
|
"entropy": 1.1152657635509968,
|
|
"epoch": 2.2675569838261187,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 3.428281620997296e-06,
|
|
"loss": 1.1035,
|
|
"mean_token_accuracy": 0.69907136708498,
|
|
"num_tokens": 551585016.0,
|
|
"step": 7365
|
|
},
|
|
{
|
|
"entropy": 1.0873521752655506,
|
|
"epoch": 2.269096437127765,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 3.4160843332062623e-06,
|
|
"loss": 1.0832,
|
|
"mean_token_accuracy": 0.703127896040678,
|
|
"num_tokens": 551940040.0,
|
|
"step": 7370
|
|
},
|
|
{
|
|
"entropy": 1.0725919427350163,
|
|
"epoch": 2.2706358904294115,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 3.403904310966515e-06,
|
|
"loss": 1.0671,
|
|
"mean_token_accuracy": 0.7063920482993126,
|
|
"num_tokens": 552303959.0,
|
|
"step": 7375
|
|
},
|
|
{
|
|
"entropy": 1.073322146013379,
|
|
"epoch": 2.2721753437310577,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 3.391741586218752e-06,
|
|
"loss": 1.0558,
|
|
"mean_token_accuracy": 0.7058822385966778,
|
|
"num_tokens": 552669919.0,
|
|
"step": 7380
|
|
},
|
|
{
|
|
"entropy": 1.1444176131859423,
|
|
"epoch": 2.273714797032704,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 3.3795961908582965e-06,
|
|
"loss": 1.1396,
|
|
"mean_token_accuracy": 0.6928377140313386,
|
|
"num_tokens": 553032273.0,
|
|
"step": 7385
|
|
},
|
|
{
|
|
"entropy": 1.131690413504839,
|
|
"epoch": 2.27525425033435,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 3.3674681567350332e-06,
|
|
"loss": 1.1259,
|
|
"mean_token_accuracy": 0.6933659914880991,
|
|
"num_tokens": 553394684.0,
|
|
"step": 7390
|
|
},
|
|
{
|
|
"entropy": 1.0877078156918287,
|
|
"epoch": 2.276793703635996,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 3.3553575156533125e-06,
|
|
"loss": 1.0766,
|
|
"mean_token_accuracy": 0.7042814232409,
|
|
"num_tokens": 553776086.0,
|
|
"step": 7395
|
|
},
|
|
{
|
|
"entropy": 1.0529436092823743,
|
|
"epoch": 2.2783331569376424,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 3.3432642993718856e-06,
|
|
"loss": 1.0499,
|
|
"mean_token_accuracy": 0.713499666005373,
|
|
"num_tokens": 554149081.0,
|
|
"step": 7400
|
|
},
|
|
{
|
|
"entropy": 1.1380545269697904,
|
|
"epoch": 2.2798726102392886,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 3.3311885396038002e-06,
|
|
"loss": 1.1341,
|
|
"mean_token_accuracy": 0.6950081013143062,
|
|
"num_tokens": 554518370.0,
|
|
"step": 7405
|
|
},
|
|
{
|
|
"entropy": 1.0973397819325328,
|
|
"epoch": 2.281412063540935,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 3.319130268016325e-06,
|
|
"loss": 1.0915,
|
|
"mean_token_accuracy": 0.702796682715416,
|
|
"num_tokens": 554890265.0,
|
|
"step": 7410
|
|
},
|
|
{
|
|
"entropy": 1.0734642464667559,
|
|
"epoch": 2.2829515168425814,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 3.307089516230878e-06,
|
|
"loss": 1.0692,
|
|
"mean_token_accuracy": 0.7075663685798645,
|
|
"num_tokens": 555268831.0,
|
|
"step": 7415
|
|
},
|
|
{
|
|
"entropy": 1.0636724211275577,
|
|
"epoch": 2.2844909701442275,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 3.2950663158229233e-06,
|
|
"loss": 1.0657,
|
|
"mean_token_accuracy": 0.706801338866353,
|
|
"num_tokens": 555650676.0,
|
|
"step": 7420
|
|
},
|
|
{
|
|
"entropy": 1.1122311763465405,
|
|
"epoch": 2.2860304234458737,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 3.2830606983219038e-06,
|
|
"loss": 1.1097,
|
|
"mean_token_accuracy": 0.6984316986054182,
|
|
"num_tokens": 556029454.0,
|
|
"step": 7425
|
|
},
|
|
{
|
|
"entropy": 1.0897115251049398,
|
|
"epoch": 2.28756987674752,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 3.271072695211146e-06,
|
|
"loss": 1.0812,
|
|
"mean_token_accuracy": 0.7057449143379927,
|
|
"num_tokens": 556413218.0,
|
|
"step": 7430
|
|
},
|
|
{
|
|
"entropy": 1.0761831501498818,
|
|
"epoch": 2.2891093300491665,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 3.2591023379277986e-06,
|
|
"loss": 1.0778,
|
|
"mean_token_accuracy": 0.7065632760524749,
|
|
"num_tokens": 556777137.0,
|
|
"step": 7435
|
|
},
|
|
{
|
|
"entropy": 1.0928261002525688,
|
|
"epoch": 2.2906487833508127,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 3.247149657862725e-06,
|
|
"loss": 1.0919,
|
|
"mean_token_accuracy": 0.702310049161315,
|
|
"num_tokens": 557137208.0,
|
|
"step": 7440
|
|
},
|
|
{
|
|
"entropy": 1.1140711219981312,
|
|
"epoch": 2.292188236652459,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 3.2352146863604317e-06,
|
|
"loss": 1.1095,
|
|
"mean_token_accuracy": 0.6999992109835148,
|
|
"num_tokens": 557506957.0,
|
|
"step": 7445
|
|
},
|
|
{
|
|
"entropy": 1.0943046431988477,
|
|
"epoch": 2.293727689954105,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 3.2232974547189967e-06,
|
|
"loss": 1.0857,
|
|
"mean_token_accuracy": 0.7049948297441005,
|
|
"num_tokens": 557870440.0,
|
|
"step": 7450
|
|
},
|
|
{
|
|
"entropy": 1.1033175121992826,
|
|
"epoch": 2.295267143255751,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 3.2113979941899666e-06,
|
|
"loss": 1.0942,
|
|
"mean_token_accuracy": 0.7022683043032885,
|
|
"num_tokens": 558257968.0,
|
|
"step": 7455
|
|
},
|
|
{
|
|
"entropy": 1.1139326382428407,
|
|
"epoch": 2.2968065965573974,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 3.199516335978291e-06,
|
|
"loss": 1.1014,
|
|
"mean_token_accuracy": 0.6999225728213787,
|
|
"num_tokens": 558628846.0,
|
|
"step": 7460
|
|
},
|
|
{
|
|
"entropy": 1.0697664933279156,
|
|
"epoch": 2.2983460498590436,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 3.1876525112422283e-06,
|
|
"loss": 1.0674,
|
|
"mean_token_accuracy": 0.7082239536568522,
|
|
"num_tokens": 559001052.0,
|
|
"step": 7465
|
|
},
|
|
{
|
|
"entropy": 1.1204854693263768,
|
|
"epoch": 2.29988550316069,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 3.175806551093283e-06,
|
|
"loss": 1.1129,
|
|
"mean_token_accuracy": 0.6981433618813753,
|
|
"num_tokens": 559364545.0,
|
|
"step": 7470
|
|
},
|
|
{
|
|
"entropy": 1.0920405695214868,
|
|
"epoch": 2.3014249564623364,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 3.163978486596103e-06,
|
|
"loss": 1.0807,
|
|
"mean_token_accuracy": 0.7038296688348055,
|
|
"num_tokens": 559746214.0,
|
|
"step": 7475
|
|
},
|
|
{
|
|
"entropy": 1.1568244360387325,
|
|
"epoch": 2.3029644097639825,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 3.152168348768403e-06,
|
|
"loss": 1.1534,
|
|
"mean_token_accuracy": 0.6924691028892994,
|
|
"num_tokens": 560109178.0,
|
|
"step": 7480
|
|
},
|
|
{
|
|
"entropy": 1.085889085009694,
|
|
"epoch": 2.3045038630656287,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 3.1403761685809007e-06,
|
|
"loss": 1.0837,
|
|
"mean_token_accuracy": 0.7035455621778965,
|
|
"num_tokens": 560493983.0,
|
|
"step": 7485
|
|
},
|
|
{
|
|
"entropy": 1.0869456689804793,
|
|
"epoch": 2.306043316367275,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 3.1286019769572095e-06,
|
|
"loss": 1.0716,
|
|
"mean_token_accuracy": 0.7055978389456868,
|
|
"num_tokens": 560864621.0,
|
|
"step": 7490
|
|
},
|
|
{
|
|
"entropy": 1.1057266488671302,
|
|
"epoch": 2.3075827696689215,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 3.116845804773775e-06,
|
|
"loss": 1.0977,
|
|
"mean_token_accuracy": 0.7048073519021273,
|
|
"num_tokens": 561247243.0,
|
|
"step": 7495
|
|
},
|
|
{
|
|
"entropy": 1.1119086988270284,
|
|
"epoch": 2.3091222229705677,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 3.105107682859785e-06,
|
|
"loss": 1.0986,
|
|
"mean_token_accuracy": 0.6993362504988909,
|
|
"num_tokens": 561619535.0,
|
|
"step": 7500
|
|
},
|
|
{
|
|
"entropy": 1.0930931886658073,
|
|
"epoch": 2.310661676272214,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 3.0933876419971008e-06,
|
|
"loss": 1.0771,
|
|
"mean_token_accuracy": 0.7036807803437114,
|
|
"num_tokens": 562001494.0,
|
|
"step": 7505
|
|
},
|
|
{
|
|
"entropy": 1.0794838570058345,
|
|
"epoch": 2.31220112957386,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 3.0816857129201627e-06,
|
|
"loss": 1.0689,
|
|
"mean_token_accuracy": 0.7071578580886125,
|
|
"num_tokens": 562388167.0,
|
|
"step": 7510
|
|
},
|
|
{
|
|
"entropy": 1.113200969621539,
|
|
"epoch": 2.313740582875506,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 3.070001926315911e-06,
|
|
"loss": 1.1064,
|
|
"mean_token_accuracy": 0.7019227147102356,
|
|
"num_tokens": 562753465.0,
|
|
"step": 7515
|
|
},
|
|
{
|
|
"entropy": 1.1013869024813174,
|
|
"epoch": 2.3152800361771524,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 3.058336312823719e-06,
|
|
"loss": 1.0989,
|
|
"mean_token_accuracy": 0.700409910082817,
|
|
"num_tokens": 563124628.0,
|
|
"step": 7520
|
|
},
|
|
{
|
|
"entropy": 1.0737422451376915,
|
|
"epoch": 2.316819489478799,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 3.0466889030352976e-06,
|
|
"loss": 1.0641,
|
|
"mean_token_accuracy": 0.7072563644498586,
|
|
"num_tokens": 563500847.0,
|
|
"step": 7525
|
|
},
|
|
{
|
|
"entropy": 1.1081683367490769,
|
|
"epoch": 2.318358942780445,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 3.035059727494619e-06,
|
|
"loss": 1.1058,
|
|
"mean_token_accuracy": 0.7007244843989611,
|
|
"num_tokens": 563875086.0,
|
|
"step": 7530
|
|
},
|
|
{
|
|
"entropy": 1.0677310092374683,
|
|
"epoch": 2.3198983960820914,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 3.023448816697838e-06,
|
|
"loss": 1.052,
|
|
"mean_token_accuracy": 0.7095424856990575,
|
|
"num_tokens": 564259993.0,
|
|
"step": 7535
|
|
},
|
|
{
|
|
"entropy": 1.0886076901108026,
|
|
"epoch": 2.3214378493837375,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 3.011856201093221e-06,
|
|
"loss": 1.088,
|
|
"mean_token_accuracy": 0.7050859276205301,
|
|
"num_tokens": 564638862.0,
|
|
"step": 7540
|
|
},
|
|
{
|
|
"entropy": 1.0891646862030029,
|
|
"epoch": 2.3229773026853837,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 3.0002819110810475e-06,
|
|
"loss": 1.0811,
|
|
"mean_token_accuracy": 0.7055531058460474,
|
|
"num_tokens": 565004667.0,
|
|
"step": 7545
|
|
},
|
|
{
|
|
"entropy": 1.0320463482290507,
|
|
"epoch": 2.3245167559870303,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 2.9887259770135415e-06,
|
|
"loss": 1.028,
|
|
"mean_token_accuracy": 0.7171314664185047,
|
|
"num_tokens": 565386009.0,
|
|
"step": 7550
|
|
},
|
|
{
|
|
"entropy": 1.090433520823717,
|
|
"epoch": 2.3260562092886765,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 2.977188429194797e-06,
|
|
"loss": 1.0883,
|
|
"mean_token_accuracy": 0.7037417966872453,
|
|
"num_tokens": 565761051.0,
|
|
"step": 7555
|
|
},
|
|
{
|
|
"entropy": 1.0748472291976214,
|
|
"epoch": 2.3275956625903227,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 2.965669297880688e-06,
|
|
"loss": 1.0656,
|
|
"mean_token_accuracy": 0.7057185009121895,
|
|
"num_tokens": 566137666.0,
|
|
"step": 7560
|
|
},
|
|
{
|
|
"entropy": 1.0853023901581764,
|
|
"epoch": 2.329135115891969,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 2.9541686132787907e-06,
|
|
"loss": 1.0777,
|
|
"mean_token_accuracy": 0.7060853041708469,
|
|
"num_tokens": 566512117.0,
|
|
"step": 7565
|
|
},
|
|
{
|
|
"entropy": 1.0811399733647704,
|
|
"epoch": 2.330674569193615,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 2.9426864055483085e-06,
|
|
"loss": 1.0798,
|
|
"mean_token_accuracy": 0.7039544139057398,
|
|
"num_tokens": 566877677.0,
|
|
"step": 7570
|
|
},
|
|
{
|
|
"entropy": 1.116362501308322,
|
|
"epoch": 2.332214022495261,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 2.9312227047999974e-06,
|
|
"loss": 1.1157,
|
|
"mean_token_accuracy": 0.7020010549575091,
|
|
"num_tokens": 567242929.0,
|
|
"step": 7575
|
|
},
|
|
{
|
|
"entropy": 1.0790099190548061,
|
|
"epoch": 2.3337534757969074,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 2.919777541096075e-06,
|
|
"loss": 1.0623,
|
|
"mean_token_accuracy": 0.7058063328266144,
|
|
"num_tokens": 567610077.0,
|
|
"step": 7580
|
|
},
|
|
{
|
|
"entropy": 1.109661253541708,
|
|
"epoch": 2.335292929098554,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 2.9083509444501433e-06,
|
|
"loss": 1.1079,
|
|
"mean_token_accuracy": 0.6998679727315903,
|
|
"num_tokens": 567997971.0,
|
|
"step": 7585
|
|
},
|
|
{
|
|
"entropy": 1.0745121205225587,
|
|
"epoch": 2.3368323824002,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 2.896942944827129e-06,
|
|
"loss": 1.0591,
|
|
"mean_token_accuracy": 0.7060676023364068,
|
|
"num_tokens": 568383266.0,
|
|
"step": 7590
|
|
},
|
|
{
|
|
"entropy": 1.089133051969111,
|
|
"epoch": 2.3383718357018464,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 2.885553572143175e-06,
|
|
"loss": 1.0784,
|
|
"mean_token_accuracy": 0.705547895655036,
|
|
"num_tokens": 568739917.0,
|
|
"step": 7595
|
|
},
|
|
{
|
|
"entropy": 1.075090386159718,
|
|
"epoch": 2.3399112890034925,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 2.874182856265586e-06,
|
|
"loss": 1.0666,
|
|
"mean_token_accuracy": 0.707675988227129,
|
|
"num_tokens": 569107437.0,
|
|
"step": 7600
|
|
},
|
|
{
|
|
"entropy": 1.068441299535334,
|
|
"epoch": 2.3414507423051387,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 2.8628308270127335e-06,
|
|
"loss": 1.0589,
|
|
"mean_token_accuracy": 0.7081480488181114,
|
|
"num_tokens": 569482606.0,
|
|
"step": 7605
|
|
},
|
|
{
|
|
"entropy": 1.1487177412956953,
|
|
"epoch": 2.3429901956067853,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 2.8514975141539993e-06,
|
|
"loss": 1.1455,
|
|
"mean_token_accuracy": 0.6944646582007408,
|
|
"num_tokens": 569862025.0,
|
|
"step": 7610
|
|
},
|
|
{
|
|
"entropy": 1.0953327786177396,
|
|
"epoch": 2.3445296489084315,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 2.8401829474096696e-06,
|
|
"loss": 1.0944,
|
|
"mean_token_accuracy": 0.7021980620920658,
|
|
"num_tokens": 570245707.0,
|
|
"step": 7615
|
|
},
|
|
{
|
|
"entropy": 1.0896007716655731,
|
|
"epoch": 2.3460691022100777,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 2.8288871564508745e-06,
|
|
"loss": 1.0759,
|
|
"mean_token_accuracy": 0.7035564761608839,
|
|
"num_tokens": 570611069.0,
|
|
"step": 7620
|
|
},
|
|
{
|
|
"entropy": 1.0837422212585808,
|
|
"epoch": 2.347608555511724,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 2.8176101708995174e-06,
|
|
"loss": 1.082,
|
|
"mean_token_accuracy": 0.7061542250216007,
|
|
"num_tokens": 570998209.0,
|
|
"step": 7625
|
|
},
|
|
{
|
|
"entropy": 1.0926381362602116,
|
|
"epoch": 2.34914800881337,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 2.8063520203281714e-06,
|
|
"loss": 1.0889,
|
|
"mean_token_accuracy": 0.7049851194024086,
|
|
"num_tokens": 571368814.0,
|
|
"step": 7630
|
|
},
|
|
{
|
|
"entropy": 1.091793043538928,
|
|
"epoch": 2.3506874621150162,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 2.795112734260026e-06,
|
|
"loss": 1.083,
|
|
"mean_token_accuracy": 0.7011283818632364,
|
|
"num_tokens": 571748344.0,
|
|
"step": 7635
|
|
},
|
|
{
|
|
"entropy": 1.1133081253618002,
|
|
"epoch": 2.352226915416663,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 2.783892342168796e-06,
|
|
"loss": 1.1069,
|
|
"mean_token_accuracy": 0.7014238823205232,
|
|
"num_tokens": 572115460.0,
|
|
"step": 7640
|
|
},
|
|
{
|
|
"entropy": 1.0809123251587152,
|
|
"epoch": 2.353766368718309,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 2.772690873478656e-06,
|
|
"loss": 1.0844,
|
|
"mean_token_accuracy": 0.7061019226908684,
|
|
"num_tokens": 572493640.0,
|
|
"step": 7645
|
|
},
|
|
{
|
|
"entropy": 1.132096729800105,
|
|
"epoch": 2.355305822019955,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 2.761508357564151e-06,
|
|
"loss": 1.1235,
|
|
"mean_token_accuracy": 0.6950391452759505,
|
|
"num_tokens": 572880030.0,
|
|
"step": 7650
|
|
},
|
|
{
|
|
"entropy": 1.0936645422130824,
|
|
"epoch": 2.3568452753216014,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 2.7503448237501208e-06,
|
|
"loss": 1.0833,
|
|
"mean_token_accuracy": 0.7042804390192032,
|
|
"num_tokens": 573263115.0,
|
|
"step": 7655
|
|
},
|
|
{
|
|
"entropy": 1.077848588116467,
|
|
"epoch": 2.3583847286232476,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 2.7392003013116362e-06,
|
|
"loss": 1.0735,
|
|
"mean_token_accuracy": 0.7078116741031408,
|
|
"num_tokens": 573643998.0,
|
|
"step": 7660
|
|
},
|
|
{
|
|
"entropy": 1.0813415538519622,
|
|
"epoch": 2.359924181924894,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 2.728074819473908e-06,
|
|
"loss": 1.069,
|
|
"mean_token_accuracy": 0.7063661765307188,
|
|
"num_tokens": 574020143.0,
|
|
"step": 7665
|
|
},
|
|
{
|
|
"entropy": 1.069083166308701,
|
|
"epoch": 2.3614636352265403,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 2.7169684074122105e-06,
|
|
"loss": 1.0698,
|
|
"mean_token_accuracy": 0.7062535721808672,
|
|
"num_tokens": 574396022.0,
|
|
"step": 7670
|
|
},
|
|
{
|
|
"entropy": 1.0834918651729821,
|
|
"epoch": 2.3630030885281865,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 2.705881094251821e-06,
|
|
"loss": 1.0795,
|
|
"mean_token_accuracy": 0.704384483024478,
|
|
"num_tokens": 574762393.0,
|
|
"step": 7675
|
|
},
|
|
{
|
|
"entropy": 1.1349539311602712,
|
|
"epoch": 2.3645425418298327,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 2.69481290906792e-06,
|
|
"loss": 1.1291,
|
|
"mean_token_accuracy": 0.6945093609392643,
|
|
"num_tokens": 575137842.0,
|
|
"step": 7680
|
|
},
|
|
{
|
|
"entropy": 1.127539797872305,
|
|
"epoch": 2.366081995131479,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 2.683763880885538e-06,
|
|
"loss": 1.1219,
|
|
"mean_token_accuracy": 0.7008027387782931,
|
|
"num_tokens": 575532094.0,
|
|
"step": 7685
|
|
},
|
|
{
|
|
"entropy": 1.0749639686197043,
|
|
"epoch": 2.367621448433125,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 2.672734038679461e-06,
|
|
"loss": 1.0626,
|
|
"mean_token_accuracy": 0.7054493118077516,
|
|
"num_tokens": 575913550.0,
|
|
"step": 7690
|
|
},
|
|
{
|
|
"entropy": 1.0963844295591116,
|
|
"epoch": 2.3691609017347712,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 2.661723411374161e-06,
|
|
"loss": 1.0858,
|
|
"mean_token_accuracy": 0.704655422270298,
|
|
"num_tokens": 576275496.0,
|
|
"step": 7695
|
|
},
|
|
{
|
|
"entropy": 1.067787878587842,
|
|
"epoch": 2.370700355036418,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 2.6507320278437296e-06,
|
|
"loss": 1.0585,
|
|
"mean_token_accuracy": 0.7075720652937889,
|
|
"num_tokens": 576662695.0,
|
|
"step": 7700
|
|
},
|
|
{
|
|
"entropy": 1.11925013884902,
|
|
"epoch": 2.372239808338064,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 2.639759916911788e-06,
|
|
"loss": 1.1222,
|
|
"mean_token_accuracy": 0.6992710340768099,
|
|
"num_tokens": 577046795.0,
|
|
"step": 7705
|
|
},
|
|
{
|
|
"entropy": 1.0731504468247295,
|
|
"epoch": 2.37377926163971,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 2.6288071073514176e-06,
|
|
"loss": 1.0508,
|
|
"mean_token_accuracy": 0.7059622500091791,
|
|
"num_tokens": 577435850.0,
|
|
"step": 7710
|
|
},
|
|
{
|
|
"entropy": 1.1088548507541418,
|
|
"epoch": 2.3753187149413564,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 2.6178736278850792e-06,
|
|
"loss": 1.0993,
|
|
"mean_token_accuracy": 0.7028374299407005,
|
|
"num_tokens": 577807399.0,
|
|
"step": 7715
|
|
},
|
|
{
|
|
"entropy": 1.0644744977355003,
|
|
"epoch": 2.3768581682430026,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 2.6069595071845566e-06,
|
|
"loss": 1.0515,
|
|
"mean_token_accuracy": 0.7118535190820694,
|
|
"num_tokens": 578197822.0,
|
|
"step": 7720
|
|
},
|
|
{
|
|
"entropy": 1.0813008610159158,
|
|
"epoch": 2.378397621544649,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 2.5960647738708553e-06,
|
|
"loss": 1.0744,
|
|
"mean_token_accuracy": 0.7042052935808897,
|
|
"num_tokens": 578569515.0,
|
|
"step": 7725
|
|
},
|
|
{
|
|
"entropy": 1.0769266698509454,
|
|
"epoch": 2.3799370748462954,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 2.585189456514139e-06,
|
|
"loss": 1.0779,
|
|
"mean_token_accuracy": 0.7059215787798166,
|
|
"num_tokens": 578946708.0,
|
|
"step": 7730
|
|
},
|
|
{
|
|
"entropy": 1.1014576008543373,
|
|
"epoch": 2.3814765281479415,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 2.574333583633668e-06,
|
|
"loss": 1.0963,
|
|
"mean_token_accuracy": 0.7010703857988119,
|
|
"num_tokens": 579306937.0,
|
|
"step": 7735
|
|
},
|
|
{
|
|
"entropy": 1.0753099456429482,
|
|
"epoch": 2.3830159814495877,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 2.5634971836976987e-06,
|
|
"loss": 1.0734,
|
|
"mean_token_accuracy": 0.705274410545826,
|
|
"num_tokens": 579688441.0,
|
|
"step": 7740
|
|
},
|
|
{
|
|
"entropy": 1.0694767842069268,
|
|
"epoch": 2.384555434751234,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 2.5526802851234268e-06,
|
|
"loss": 1.064,
|
|
"mean_token_accuracy": 0.7094752803444863,
|
|
"num_tokens": 580060813.0,
|
|
"step": 7745
|
|
},
|
|
{
|
|
"entropy": 1.074888569302857,
|
|
"epoch": 2.38609488805288,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 2.5418829162769053e-06,
|
|
"loss": 1.064,
|
|
"mean_token_accuracy": 0.7077912498265505,
|
|
"num_tokens": 580436208.0,
|
|
"step": 7750
|
|
},
|
|
{
|
|
"entropy": 1.0802359960973262,
|
|
"epoch": 2.3876343413545262,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 2.5311051054729806e-06,
|
|
"loss": 1.0668,
|
|
"mean_token_accuracy": 0.7062569424510002,
|
|
"num_tokens": 580805916.0,
|
|
"step": 7755
|
|
},
|
|
{
|
|
"entropy": 1.0570680908858776,
|
|
"epoch": 2.389173794656173,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 2.520346880975203e-06,
|
|
"loss": 1.0504,
|
|
"mean_token_accuracy": 0.7109331101179123,
|
|
"num_tokens": 581181776.0,
|
|
"step": 7760
|
|
},
|
|
{
|
|
"entropy": 1.0814880331978203,
|
|
"epoch": 2.390713247957819,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 2.509608270995758e-06,
|
|
"loss": 1.072,
|
|
"mean_token_accuracy": 0.705212377756834,
|
|
"num_tokens": 581532989.0,
|
|
"step": 7765
|
|
},
|
|
{
|
|
"entropy": 1.0909933172166348,
|
|
"epoch": 2.392252701259465,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 2.4988893036954045e-06,
|
|
"loss": 1.0841,
|
|
"mean_token_accuracy": 0.7039071105420589,
|
|
"num_tokens": 581913605.0,
|
|
"step": 7770
|
|
},
|
|
{
|
|
"entropy": 1.1236516952514648,
|
|
"epoch": 2.3937921545611114,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 2.488190007183383e-06,
|
|
"loss": 1.1064,
|
|
"mean_token_accuracy": 0.6988992355763912,
|
|
"num_tokens": 582277537.0,
|
|
"step": 7775
|
|
},
|
|
{
|
|
"entropy": 1.0965952957049012,
|
|
"epoch": 2.3953316078627576,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 2.4775104095173495e-06,
|
|
"loss": 1.0882,
|
|
"mean_token_accuracy": 0.7022584304213524,
|
|
"num_tokens": 582656276.0,
|
|
"step": 7780
|
|
},
|
|
{
|
|
"entropy": 1.1131680738180876,
|
|
"epoch": 2.396871061164404,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 2.4668505387033025e-06,
|
|
"loss": 1.0967,
|
|
"mean_token_accuracy": 0.7013501133769751,
|
|
"num_tokens": 583033929.0,
|
|
"step": 7785
|
|
},
|
|
{
|
|
"entropy": 1.089404894411564,
|
|
"epoch": 2.3984105144660504,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 2.456210422695515e-06,
|
|
"loss": 1.095,
|
|
"mean_token_accuracy": 0.7058247439563274,
|
|
"num_tokens": 583405595.0,
|
|
"step": 7790
|
|
},
|
|
{
|
|
"entropy": 1.1008950157091022,
|
|
"epoch": 2.3999499677676965,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 2.445590089396449e-06,
|
|
"loss": 1.0965,
|
|
"mean_token_accuracy": 0.7012807335704565,
|
|
"num_tokens": 583790929.0,
|
|
"step": 7795
|
|
},
|
|
{
|
|
"entropy": 1.0701513443142177,
|
|
"epoch": 2.4014894210693427,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 2.434989566656687e-06,
|
|
"loss": 1.0554,
|
|
"mean_token_accuracy": 0.7090517751872539,
|
|
"num_tokens": 584168618.0,
|
|
"step": 7800
|
|
},
|
|
{
|
|
"entropy": 1.068328034132719,
|
|
"epoch": 2.403028874370989,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 2.42440888227487e-06,
|
|
"loss": 1.0556,
|
|
"mean_token_accuracy": 0.7093023076653481,
|
|
"num_tokens": 584548475.0,
|
|
"step": 7805
|
|
},
|
|
{
|
|
"entropy": 1.0896546049043536,
|
|
"epoch": 2.404568327672635,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 2.413848063997607e-06,
|
|
"loss": 1.0834,
|
|
"mean_token_accuracy": 0.7061650305986404,
|
|
"num_tokens": 584917189.0,
|
|
"step": 7810
|
|
},
|
|
{
|
|
"entropy": 1.1122898537665606,
|
|
"epoch": 2.4061077809742817,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 2.403307139519411e-06,
|
|
"loss": 1.0995,
|
|
"mean_token_accuracy": 0.7009069841355086,
|
|
"num_tokens": 585293871.0,
|
|
"step": 7815
|
|
},
|
|
{
|
|
"entropy": 1.071978035196662,
|
|
"epoch": 2.407647234275928,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 2.3927861364826265e-06,
|
|
"loss": 1.0548,
|
|
"mean_token_accuracy": 0.7084488525986672,
|
|
"num_tokens": 585659294.0,
|
|
"step": 7820
|
|
},
|
|
{
|
|
"entropy": 1.0979616954922675,
|
|
"epoch": 2.409186687577574,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 2.3822850824773623e-06,
|
|
"loss": 1.1003,
|
|
"mean_token_accuracy": 0.7011522339656949,
|
|
"num_tokens": 586029985.0,
|
|
"step": 7825
|
|
},
|
|
{
|
|
"entropy": 1.0963656479492783,
|
|
"epoch": 2.41072614087922,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 2.371804005041406e-06,
|
|
"loss": 1.0979,
|
|
"mean_token_accuracy": 0.7039354156702757,
|
|
"num_tokens": 586406465.0,
|
|
"step": 7830
|
|
},
|
|
{
|
|
"entropy": 1.1026376781985163,
|
|
"epoch": 2.4122655941808664,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 2.3613429316601577e-06,
|
|
"loss": 1.0905,
|
|
"mean_token_accuracy": 0.7035287136211992,
|
|
"num_tokens": 586784745.0,
|
|
"step": 7835
|
|
},
|
|
{
|
|
"entropy": 1.0764410136267544,
|
|
"epoch": 2.413805047482513,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 2.35090188976657e-06,
|
|
"loss": 1.0829,
|
|
"mean_token_accuracy": 0.7067187488079071,
|
|
"num_tokens": 587152176.0,
|
|
"step": 7840
|
|
},
|
|
{
|
|
"entropy": 1.1040403481572867,
|
|
"epoch": 2.415344500784159,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 2.340480906741053e-06,
|
|
"loss": 1.0931,
|
|
"mean_token_accuracy": 0.7029427416622639,
|
|
"num_tokens": 587524012.0,
|
|
"step": 7845
|
|
},
|
|
{
|
|
"entropy": 1.0569148847833276,
|
|
"epoch": 2.4168839540858054,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 2.3300800099114186e-06,
|
|
"loss": 1.0576,
|
|
"mean_token_accuracy": 0.7120893083512783,
|
|
"num_tokens": 587908689.0,
|
|
"step": 7850
|
|
},
|
|
{
|
|
"entropy": 1.0790195554494857,
|
|
"epoch": 2.4184234073874515,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 2.3196992265528118e-06,
|
|
"loss": 1.0692,
|
|
"mean_token_accuracy": 0.7058982502669096,
|
|
"num_tokens": 588291989.0,
|
|
"step": 7855
|
|
},
|
|
{
|
|
"entropy": 1.0941580392420291,
|
|
"epoch": 2.4199628606890977,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 2.3093385838876236e-06,
|
|
"loss": 1.0889,
|
|
"mean_token_accuracy": 0.7030092507600785,
|
|
"num_tokens": 588664881.0,
|
|
"step": 7860
|
|
},
|
|
{
|
|
"entropy": 1.1004236981272697,
|
|
"epoch": 2.421502313990744,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 2.2989981090854306e-06,
|
|
"loss": 1.0806,
|
|
"mean_token_accuracy": 0.704431876540184,
|
|
"num_tokens": 589022718.0,
|
|
"step": 7865
|
|
},
|
|
{
|
|
"entropy": 1.0633477183058857,
|
|
"epoch": 2.42304176729239,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 2.2886778292629217e-06,
|
|
"loss": 1.0562,
|
|
"mean_token_accuracy": 0.708922759629786,
|
|
"num_tokens": 589391605.0,
|
|
"step": 7870
|
|
},
|
|
{
|
|
"entropy": 1.1001728110015392,
|
|
"epoch": 2.4245812205940367,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 2.2783777714838316e-06,
|
|
"loss": 1.0899,
|
|
"mean_token_accuracy": 0.7013974748551846,
|
|
"num_tokens": 589764557.0,
|
|
"step": 7875
|
|
},
|
|
{
|
|
"entropy": 1.0912095265462995,
|
|
"epoch": 2.426120673895683,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 2.2680979627588593e-06,
|
|
"loss": 1.0752,
|
|
"mean_token_accuracy": 0.7043900292366743,
|
|
"num_tokens": 590135766.0,
|
|
"step": 7880
|
|
},
|
|
{
|
|
"entropy": 1.106900523416698,
|
|
"epoch": 2.427660127197329,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 2.2578384300456014e-06,
|
|
"loss": 1.0958,
|
|
"mean_token_accuracy": 0.7040692336857319,
|
|
"num_tokens": 590522930.0,
|
|
"step": 7885
|
|
},
|
|
{
|
|
"entropy": 1.0600123774260282,
|
|
"epoch": 2.429199580498975,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 2.2475992002484915e-06,
|
|
"loss": 1.0521,
|
|
"mean_token_accuracy": 0.71066435277462,
|
|
"num_tokens": 590919609.0,
|
|
"step": 7890
|
|
},
|
|
{
|
|
"entropy": 1.0941214755177497,
|
|
"epoch": 2.4307390338006214,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 2.2373803002187146e-06,
|
|
"loss": 1.0854,
|
|
"mean_token_accuracy": 0.7061484418809414,
|
|
"num_tokens": 591287852.0,
|
|
"step": 7895
|
|
},
|
|
{
|
|
"entropy": 1.1029338724911213,
|
|
"epoch": 2.432278487102268,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 2.227181756754143e-06,
|
|
"loss": 1.1008,
|
|
"mean_token_accuracy": 0.7034502621740103,
|
|
"num_tokens": 591661598.0,
|
|
"step": 7900
|
|
},
|
|
{
|
|
"entropy": 1.1055524438619613,
|
|
"epoch": 2.433817940403914,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 2.2170035965992674e-06,
|
|
"loss": 1.1011,
|
|
"mean_token_accuracy": 0.7024203099310398,
|
|
"num_tokens": 592025042.0,
|
|
"step": 7905
|
|
},
|
|
{
|
|
"entropy": 1.0773296501487493,
|
|
"epoch": 2.4353573937055604,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 2.2068458464451292e-06,
|
|
"loss": 1.0721,
|
|
"mean_token_accuracy": 0.7073096320033073,
|
|
"num_tokens": 592401408.0,
|
|
"step": 7910
|
|
},
|
|
{
|
|
"entropy": 1.0957034608349203,
|
|
"epoch": 2.4368968470072065,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 2.1967085329292435e-06,
|
|
"loss": 1.0922,
|
|
"mean_token_accuracy": 0.7037762489169836,
|
|
"num_tokens": 592770253.0,
|
|
"step": 7915
|
|
},
|
|
{
|
|
"entropy": 1.0926884908229113,
|
|
"epoch": 2.4384363003088527,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 2.1865916826355293e-06,
|
|
"loss": 1.0845,
|
|
"mean_token_accuracy": 0.7037423234432936,
|
|
"num_tokens": 593150680.0,
|
|
"step": 7920
|
|
},
|
|
{
|
|
"entropy": 1.076402503810823,
|
|
"epoch": 2.439975753610499,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 2.176495322094254e-06,
|
|
"loss": 1.0677,
|
|
"mean_token_accuracy": 0.7046684123575687,
|
|
"num_tokens": 593540490.0,
|
|
"step": 7925
|
|
},
|
|
{
|
|
"entropy": 1.0894625468179584,
|
|
"epoch": 2.441515206912145,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 2.1664194777819414e-06,
|
|
"loss": 1.075,
|
|
"mean_token_accuracy": 0.7040096584707498,
|
|
"num_tokens": 593919822.0,
|
|
"step": 7930
|
|
},
|
|
{
|
|
"entropy": 1.0954343058168887,
|
|
"epoch": 2.4430546602137917,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 2.1563641761213183e-06,
|
|
"loss": 1.0993,
|
|
"mean_token_accuracy": 0.7020668935030698,
|
|
"num_tokens": 594302130.0,
|
|
"step": 7935
|
|
},
|
|
{
|
|
"entropy": 1.1169216517359017,
|
|
"epoch": 2.444594113515438,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 2.1463294434812408e-06,
|
|
"loss": 1.1149,
|
|
"mean_token_accuracy": 0.6984387528151274,
|
|
"num_tokens": 594672709.0,
|
|
"step": 7940
|
|
},
|
|
{
|
|
"entropy": 1.0712252624332905,
|
|
"epoch": 2.446133566817084,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 2.1363153061766297e-06,
|
|
"loss": 1.0628,
|
|
"mean_token_accuracy": 0.7086791012436151,
|
|
"num_tokens": 595062694.0,
|
|
"step": 7945
|
|
},
|
|
{
|
|
"entropy": 1.0982398126274346,
|
|
"epoch": 2.4476730201187302,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 2.1263217904683884e-06,
|
|
"loss": 1.0889,
|
|
"mean_token_accuracy": 0.7009884502738715,
|
|
"num_tokens": 595444827.0,
|
|
"step": 7950
|
|
},
|
|
{
|
|
"entropy": 1.096589953266084,
|
|
"epoch": 2.4492124734203764,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 2.116348922563346e-06,
|
|
"loss": 1.0872,
|
|
"mean_token_accuracy": 0.7046903520822525,
|
|
"num_tokens": 595808172.0,
|
|
"step": 7955
|
|
},
|
|
{
|
|
"entropy": 1.0466675573959947,
|
|
"epoch": 2.450751926722023,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 2.106396728614192e-06,
|
|
"loss": 1.0431,
|
|
"mean_token_accuracy": 0.7122319608926773,
|
|
"num_tokens": 596180421.0,
|
|
"step": 7960
|
|
},
|
|
{
|
|
"entropy": 1.0509642044082284,
|
|
"epoch": 2.452291380023669,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 2.0964652347193894e-06,
|
|
"loss": 1.0435,
|
|
"mean_token_accuracy": 0.7099323511123657,
|
|
"num_tokens": 596566318.0,
|
|
"step": 7965
|
|
},
|
|
{
|
|
"entropy": 1.1220459565520287,
|
|
"epoch": 2.4538308333253154,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 2.086554466923125e-06,
|
|
"loss": 1.1122,
|
|
"mean_token_accuracy": 0.6963332138955594,
|
|
"num_tokens": 596937480.0,
|
|
"step": 7970
|
|
},
|
|
{
|
|
"entropy": 1.091870979219675,
|
|
"epoch": 2.4553702866269616,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 2.076664451215229e-06,
|
|
"loss": 1.0833,
|
|
"mean_token_accuracy": 0.7075094986706972,
|
|
"num_tokens": 597317292.0,
|
|
"step": 7975
|
|
},
|
|
{
|
|
"entropy": 1.0959447253495456,
|
|
"epoch": 2.4569097399286077,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 2.0667952135311178e-06,
|
|
"loss": 1.0941,
|
|
"mean_token_accuracy": 0.7023411668837071,
|
|
"num_tokens": 597685818.0,
|
|
"step": 7980
|
|
},
|
|
{
|
|
"entropy": 1.065537278726697,
|
|
"epoch": 2.458449193230254,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 2.0569467797517173e-06,
|
|
"loss": 1.0554,
|
|
"mean_token_accuracy": 0.7081322088837624,
|
|
"num_tokens": 598053296.0,
|
|
"step": 7985
|
|
},
|
|
{
|
|
"entropy": 1.058786833100021,
|
|
"epoch": 2.4599886465319005,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 2.047119175703397e-06,
|
|
"loss": 1.0523,
|
|
"mean_token_accuracy": 0.7095863774418831,
|
|
"num_tokens": 598431253.0,
|
|
"step": 7990
|
|
},
|
|
{
|
|
"entropy": 1.0852702271193266,
|
|
"epoch": 2.4615280998335467,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 2.037312427157898e-06,
|
|
"loss": 1.0826,
|
|
"mean_token_accuracy": 0.704978697001934,
|
|
"num_tokens": 598802584.0,
|
|
"step": 7995
|
|
},
|
|
{
|
|
"entropy": 1.0889213621616363,
|
|
"epoch": 2.463067553135193,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 2.0275265598322822e-06,
|
|
"loss": 1.0785,
|
|
"mean_token_accuracy": 0.7041372381150722,
|
|
"num_tokens": 599180943.0,
|
|
"step": 8000
|
|
},
|
|
{
|
|
"entropy": 1.0841034974902868,
|
|
"epoch": 2.464607006436839,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 2.017761599388842e-06,
|
|
"loss": 1.0673,
|
|
"mean_token_accuracy": 0.7067561198025942,
|
|
"num_tokens": 599551829.0,
|
|
"step": 8005
|
|
},
|
|
{
|
|
"entropy": 1.092512927763164,
|
|
"epoch": 2.4661464597384852,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 2.0080175714350492e-06,
|
|
"loss": 1.09,
|
|
"mean_token_accuracy": 0.7033103574067354,
|
|
"num_tokens": 599923543.0,
|
|
"step": 8010
|
|
},
|
|
{
|
|
"entropy": 1.0684495769441127,
|
|
"epoch": 2.467685913040132,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.998294501523477e-06,
|
|
"loss": 1.0633,
|
|
"mean_token_accuracy": 0.708350221067667,
|
|
"num_tokens": 600307023.0,
|
|
"step": 8015
|
|
},
|
|
{
|
|
"entropy": 1.1405854692682624,
|
|
"epoch": 2.469225366341778,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.9885924151517477e-06,
|
|
"loss": 1.1354,
|
|
"mean_token_accuracy": 0.6972792088985443,
|
|
"num_tokens": 600675282.0,
|
|
"step": 8020
|
|
},
|
|
{
|
|
"entropy": 1.1172321127727627,
|
|
"epoch": 2.470764819643424,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.97891133776245e-06,
|
|
"loss": 1.0951,
|
|
"mean_token_accuracy": 0.6995864175260067,
|
|
"num_tokens": 601054653.0,
|
|
"step": 8025
|
|
},
|
|
{
|
|
"entropy": 1.1101034665480256,
|
|
"epoch": 2.4723042729450704,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.9692512947430788e-06,
|
|
"loss": 1.1087,
|
|
"mean_token_accuracy": 0.6992802999913692,
|
|
"num_tokens": 601440442.0,
|
|
"step": 8030
|
|
},
|
|
{
|
|
"entropy": 1.1251870293170214,
|
|
"epoch": 2.4738437262467166,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.9596123114259747e-06,
|
|
"loss": 1.1169,
|
|
"mean_token_accuracy": 0.6971803523600102,
|
|
"num_tokens": 601800119.0,
|
|
"step": 8035
|
|
},
|
|
{
|
|
"entropy": 1.106064740754664,
|
|
"epoch": 2.4753831795483627,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.9499944130882455e-06,
|
|
"loss": 1.0984,
|
|
"mean_token_accuracy": 0.7044102676212788,
|
|
"num_tokens": 602187133.0,
|
|
"step": 8040
|
|
},
|
|
{
|
|
"entropy": 1.116933535039425,
|
|
"epoch": 2.476922632850009,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.940397624951709e-06,
|
|
"loss": 1.1137,
|
|
"mean_token_accuracy": 0.6991714507341384,
|
|
"num_tokens": 602558198.0,
|
|
"step": 8045
|
|
},
|
|
{
|
|
"entropy": 1.0558031117543578,
|
|
"epoch": 2.4784620861516555,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.9308219721828192e-06,
|
|
"loss": 1.0521,
|
|
"mean_token_accuracy": 0.7106507197022438,
|
|
"num_tokens": 602955971.0,
|
|
"step": 8050
|
|
},
|
|
{
|
|
"entropy": 1.104267646931112,
|
|
"epoch": 2.4800015394533017,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.9212674798926156e-06,
|
|
"loss": 1.1045,
|
|
"mean_token_accuracy": 0.7008958891034126,
|
|
"num_tokens": 603331249.0,
|
|
"step": 8055
|
|
},
|
|
{
|
|
"entropy": 1.0773697923868895,
|
|
"epoch": 2.481540992754948,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.911734173136638e-06,
|
|
"loss": 1.0606,
|
|
"mean_token_accuracy": 0.7079930879175663,
|
|
"num_tokens": 603708269.0,
|
|
"step": 8060
|
|
},
|
|
{
|
|
"entropy": 1.069011290743947,
|
|
"epoch": 2.483080446056594,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.902222076914869e-06,
|
|
"loss": 1.0615,
|
|
"mean_token_accuracy": 0.7084514323621989,
|
|
"num_tokens": 604094668.0,
|
|
"step": 8065
|
|
},
|
|
{
|
|
"entropy": 1.0801813624799252,
|
|
"epoch": 2.4846198993582402,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.8927312161716771e-06,
|
|
"loss": 1.0616,
|
|
"mean_token_accuracy": 0.7069826819002628,
|
|
"num_tokens": 604472242.0,
|
|
"step": 8070
|
|
},
|
|
{
|
|
"entropy": 1.092369226180017,
|
|
"epoch": 2.486159352659887,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.8832616157957352e-06,
|
|
"loss": 1.0844,
|
|
"mean_token_accuracy": 0.7045824382454157,
|
|
"num_tokens": 604850842.0,
|
|
"step": 8075
|
|
},
|
|
{
|
|
"entropy": 1.0830218572169543,
|
|
"epoch": 2.487698805961533,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.8738133006199677e-06,
|
|
"loss": 1.0725,
|
|
"mean_token_accuracy": 0.7053586520254612,
|
|
"num_tokens": 605214092.0,
|
|
"step": 8080
|
|
},
|
|
{
|
|
"entropy": 1.1259228682145477,
|
|
"epoch": 2.489238259263179,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.8643862954214754e-06,
|
|
"loss": 1.1139,
|
|
"mean_token_accuracy": 0.6972642321139574,
|
|
"num_tokens": 605578250.0,
|
|
"step": 8085
|
|
},
|
|
{
|
|
"entropy": 1.0899597339332103,
|
|
"epoch": 2.4907777125648254,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.8549806249214863e-06,
|
|
"loss": 1.0856,
|
|
"mean_token_accuracy": 0.7054736413061619,
|
|
"num_tokens": 605953694.0,
|
|
"step": 8090
|
|
},
|
|
{
|
|
"entropy": 1.0892323173582554,
|
|
"epoch": 2.4923171658664716,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.8455963137852728e-06,
|
|
"loss": 1.0925,
|
|
"mean_token_accuracy": 0.70424103140831,
|
|
"num_tokens": 606329777.0,
|
|
"step": 8095
|
|
},
|
|
{
|
|
"entropy": 1.0822312232106923,
|
|
"epoch": 2.4938566191681177,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.836233386622094e-06,
|
|
"loss": 1.062,
|
|
"mean_token_accuracy": 0.7069558564573526,
|
|
"num_tokens": 606705099.0,
|
|
"step": 8100
|
|
},
|
|
{
|
|
"entropy": 1.1041875433176755,
|
|
"epoch": 2.4953960724697644,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.8268918679851388e-06,
|
|
"loss": 1.1014,
|
|
"mean_token_accuracy": 0.6994224146008492,
|
|
"num_tokens": 607088396.0,
|
|
"step": 8105
|
|
},
|
|
{
|
|
"entropy": 1.0816417586058378,
|
|
"epoch": 2.4969355257714105,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.817571782371449e-06,
|
|
"loss": 1.0721,
|
|
"mean_token_accuracy": 0.7060464732348919,
|
|
"num_tokens": 607452305.0,
|
|
"step": 8110
|
|
},
|
|
{
|
|
"entropy": 1.0869854085147381,
|
|
"epoch": 2.4984749790730567,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.8082731542218635e-06,
|
|
"loss": 1.0768,
|
|
"mean_token_accuracy": 0.7060103569179773,
|
|
"num_tokens": 607815614.0,
|
|
"step": 8115
|
|
},
|
|
{
|
|
"entropy": 1.062905584089458,
|
|
"epoch": 2.500014432374703,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.7989960079209479e-06,
|
|
"loss": 1.0524,
|
|
"mean_token_accuracy": 0.7103099074214697,
|
|
"num_tokens": 608196130.0,
|
|
"step": 8120
|
|
},
|
|
{
|
|
"entropy": 1.0980123963207007,
|
|
"epoch": 2.501553885676349,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.7897403677969405e-06,
|
|
"loss": 1.09,
|
|
"mean_token_accuracy": 0.7038155265152455,
|
|
"num_tokens": 608573793.0,
|
|
"step": 8125
|
|
},
|
|
{
|
|
"entropy": 1.115282939746976,
|
|
"epoch": 2.5030933389779957,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.780506258121677e-06,
|
|
"loss": 1.1088,
|
|
"mean_token_accuracy": 0.6986062530428171,
|
|
"num_tokens": 608951638.0,
|
|
"step": 8130
|
|
},
|
|
{
|
|
"entropy": 1.0891677793115377,
|
|
"epoch": 2.504632792279642,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.7712937031105304e-06,
|
|
"loss": 1.0687,
|
|
"mean_token_accuracy": 0.7046469658613205,
|
|
"num_tokens": 609328158.0,
|
|
"step": 8135
|
|
},
|
|
{
|
|
"entropy": 1.0982525795698166,
|
|
"epoch": 2.506172245581288,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.762102726922359e-06,
|
|
"loss": 1.0926,
|
|
"mean_token_accuracy": 0.7035585915669799,
|
|
"num_tokens": 609680528.0,
|
|
"step": 8140
|
|
},
|
|
{
|
|
"entropy": 1.071301612444222,
|
|
"epoch": 2.507711698882934,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.7529333536594217e-06,
|
|
"loss": 1.0627,
|
|
"mean_token_accuracy": 0.7062704581767321,
|
|
"num_tokens": 610070042.0,
|
|
"step": 8145
|
|
},
|
|
{
|
|
"entropy": 1.115753815509379,
|
|
"epoch": 2.5092511521845804,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.743785607367332e-06,
|
|
"loss": 1.1029,
|
|
"mean_token_accuracy": 0.6991423025727272,
|
|
"num_tokens": 610440386.0,
|
|
"step": 8150
|
|
},
|
|
{
|
|
"entropy": 1.0837318778038025,
|
|
"epoch": 2.5107906054862266,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.7346595120349852e-06,
|
|
"loss": 1.0846,
|
|
"mean_token_accuracy": 0.7022957861423492,
|
|
"num_tokens": 610815452.0,
|
|
"step": 8155
|
|
},
|
|
{
|
|
"entropy": 1.0794376220554114,
|
|
"epoch": 2.5123300587878727,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.7255550915945073e-06,
|
|
"loss": 1.0703,
|
|
"mean_token_accuracy": 0.7066490549594164,
|
|
"num_tokens": 611196336.0,
|
|
"step": 8160
|
|
},
|
|
{
|
|
"entropy": 1.0904216645285487,
|
|
"epoch": 2.5138695120895194,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.7164723699211782e-06,
|
|
"loss": 1.0872,
|
|
"mean_token_accuracy": 0.7059140957891941,
|
|
"num_tokens": 611569067.0,
|
|
"step": 8165
|
|
},
|
|
{
|
|
"entropy": 1.109726195409894,
|
|
"epoch": 2.5154089653911655,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.7074113708333727e-06,
|
|
"loss": 1.0978,
|
|
"mean_token_accuracy": 0.6990131322294474,
|
|
"num_tokens": 611940627.0,
|
|
"step": 8170
|
|
},
|
|
{
|
|
"entropy": 1.0837161030620337,
|
|
"epoch": 2.5169484186928117,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.6983721180925106e-06,
|
|
"loss": 1.0712,
|
|
"mean_token_accuracy": 0.7038125224411488,
|
|
"num_tokens": 612316266.0,
|
|
"step": 8175
|
|
},
|
|
{
|
|
"entropy": 1.09095824547112,
|
|
"epoch": 2.518487871994458,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.6893546354029754e-06,
|
|
"loss": 1.0883,
|
|
"mean_token_accuracy": 0.7023481026291847,
|
|
"num_tokens": 612683787.0,
|
|
"step": 8180
|
|
},
|
|
{
|
|
"entropy": 1.077878364175558,
|
|
"epoch": 2.520027325296104,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.680358946412064e-06,
|
|
"loss": 1.06,
|
|
"mean_token_accuracy": 0.7069414801895618,
|
|
"num_tokens": 613054947.0,
|
|
"step": 8185
|
|
},
|
|
{
|
|
"entropy": 1.0883860973641277,
|
|
"epoch": 2.5215667785977507,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.6713850747099202e-06,
|
|
"loss": 1.0798,
|
|
"mean_token_accuracy": 0.706092295050621,
|
|
"num_tokens": 613427166.0,
|
|
"step": 8190
|
|
},
|
|
{
|
|
"entropy": 1.0714717760682106,
|
|
"epoch": 2.523106231899397,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.662433043829481e-06,
|
|
"loss": 1.0639,
|
|
"mean_token_accuracy": 0.7064756121486425,
|
|
"num_tokens": 613794465.0,
|
|
"step": 8195
|
|
},
|
|
{
|
|
"entropy": 1.0907133594155312,
|
|
"epoch": 2.524645685201043,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 1.6535028772464013e-06,
|
|
"loss": 1.0802,
|
|
"mean_token_accuracy": 0.7049011830240488,
|
|
"num_tokens": 614170822.0,
|
|
"step": 8200
|
|
},
|
|
{
|
|
"entropy": 1.0934176294133067,
|
|
"epoch": 2.526185138502689,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.644594598378999e-06,
|
|
"loss": 1.0966,
|
|
"mean_token_accuracy": 0.7021095551550388,
|
|
"num_tokens": 614534051.0,
|
|
"step": 8205
|
|
},
|
|
{
|
|
"entropy": 1.1131039913743734,
|
|
"epoch": 2.5277245918043354,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.6357082305882032e-06,
|
|
"loss": 1.1136,
|
|
"mean_token_accuracy": 0.6996504593640566,
|
|
"num_tokens": 614908707.0,
|
|
"step": 8210
|
|
},
|
|
{
|
|
"entropy": 1.1105786222964524,
|
|
"epoch": 2.5292640451059816,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.626843797177473e-06,
|
|
"loss": 1.1055,
|
|
"mean_token_accuracy": 0.7012466363608837,
|
|
"num_tokens": 615272630.0,
|
|
"step": 8215
|
|
},
|
|
{
|
|
"entropy": 1.0883877009153367,
|
|
"epoch": 2.5308034984076277,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.6180013213927538e-06,
|
|
"loss": 1.0759,
|
|
"mean_token_accuracy": 0.7051719903945923,
|
|
"num_tokens": 615655640.0,
|
|
"step": 8220
|
|
},
|
|
{
|
|
"entropy": 1.0656120399013163,
|
|
"epoch": 2.5323429517092744,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.609180826422404e-06,
|
|
"loss": 1.0516,
|
|
"mean_token_accuracy": 0.7090825058519841,
|
|
"num_tokens": 616031507.0,
|
|
"step": 8225
|
|
},
|
|
{
|
|
"entropy": 1.066834675706923,
|
|
"epoch": 2.5338824050109205,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 1.600382335397147e-06,
|
|
"loss": 1.066,
|
|
"mean_token_accuracy": 0.7087026216089726,
|
|
"num_tokens": 616414165.0,
|
|
"step": 8230
|
|
},
|
|
{
|
|
"entropy": 1.1209287574514746,
|
|
"epoch": 2.5354218583125667,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.5916058713899995e-06,
|
|
"loss": 1.1025,
|
|
"mean_token_accuracy": 0.6993360456079245,
|
|
"num_tokens": 616791719.0,
|
|
"step": 8235
|
|
},
|
|
{
|
|
"entropy": 1.0872398421168328,
|
|
"epoch": 2.536961311614213,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.5828514574162124e-06,
|
|
"loss": 1.0849,
|
|
"mean_token_accuracy": 0.7046960197389126,
|
|
"num_tokens": 617163992.0,
|
|
"step": 8240
|
|
},
|
|
{
|
|
"entropy": 1.0841991014778614,
|
|
"epoch": 2.5385007649158595,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 1.5741191164332192e-06,
|
|
"loss": 1.0855,
|
|
"mean_token_accuracy": 0.7034242197871208,
|
|
"num_tokens": 617544431.0,
|
|
"step": 8245
|
|
},
|
|
{
|
|
"entropy": 1.090884921513498,
|
|
"epoch": 2.5400402182175057,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.5654088713405646e-06,
|
|
"loss": 1.0868,
|
|
"mean_token_accuracy": 0.7045566312968731,
|
|
"num_tokens": 617924846.0,
|
|
"step": 8250
|
|
},
|
|
{
|
|
"entropy": 1.08697919677943,
|
|
"epoch": 2.541579671519152,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.5567207449798517e-06,
|
|
"loss": 1.0809,
|
|
"mean_token_accuracy": 0.7050712469965219,
|
|
"num_tokens": 618292866.0,
|
|
"step": 8255
|
|
},
|
|
{
|
|
"entropy": 1.0650432966649532,
|
|
"epoch": 2.543119124820798,
|
|
"grad_norm": 0.65234375,
|
|
"learning_rate": 1.5480547601346751e-06,
|
|
"loss": 1.0639,
|
|
"mean_token_accuracy": 0.710559680685401,
|
|
"num_tokens": 618665710.0,
|
|
"step": 8260
|
|
},
|
|
{
|
|
"entropy": 1.0672622947022319,
|
|
"epoch": 2.5446585781224442,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.5394109395305757e-06,
|
|
"loss": 1.056,
|
|
"mean_token_accuracy": 0.7105245549231768,
|
|
"num_tokens": 619044481.0,
|
|
"step": 8265
|
|
},
|
|
{
|
|
"entropy": 1.0898038590326906,
|
|
"epoch": 2.5461980314240904,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.5307893058349632e-06,
|
|
"loss": 1.0759,
|
|
"mean_token_accuracy": 0.706136529520154,
|
|
"num_tokens": 619418827.0,
|
|
"step": 8270
|
|
},
|
|
{
|
|
"entropy": 1.063872111774981,
|
|
"epoch": 2.5477374847257366,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.5221898816570623e-06,
|
|
"loss": 1.0635,
|
|
"mean_token_accuracy": 0.7079522784799337,
|
|
"num_tokens": 619807161.0,
|
|
"step": 8275
|
|
},
|
|
{
|
|
"entropy": 1.1080946333706378,
|
|
"epoch": 2.5492769380273828,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.5136126895478653e-06,
|
|
"loss": 1.1004,
|
|
"mean_token_accuracy": 0.701443899795413,
|
|
"num_tokens": 620185267.0,
|
|
"step": 8280
|
|
},
|
|
{
|
|
"entropy": 1.0918529994785786,
|
|
"epoch": 2.5508163913290294,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.5050577520000608e-06,
|
|
"loss": 1.0854,
|
|
"mean_token_accuracy": 0.7042840737849474,
|
|
"num_tokens": 620548661.0,
|
|
"step": 8285
|
|
},
|
|
{
|
|
"entropy": 1.1040124772116542,
|
|
"epoch": 2.5523558446306756,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.4965250914479712e-06,
|
|
"loss": 1.0986,
|
|
"mean_token_accuracy": 0.7009819407016039,
|
|
"num_tokens": 620921993.0,
|
|
"step": 8290
|
|
},
|
|
{
|
|
"entropy": 1.083053377456963,
|
|
"epoch": 2.5538952979323217,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.488014730267502e-06,
|
|
"loss": 1.0714,
|
|
"mean_token_accuracy": 0.7042756274342536,
|
|
"num_tokens": 621296521.0,
|
|
"step": 8295
|
|
},
|
|
{
|
|
"entropy": 1.1043044727295637,
|
|
"epoch": 2.555434751233968,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.4795266907760897e-06,
|
|
"loss": 1.0747,
|
|
"mean_token_accuracy": 0.7042234718799592,
|
|
"num_tokens": 621680105.0,
|
|
"step": 8300
|
|
},
|
|
{
|
|
"entropy": 1.080210821144283,
|
|
"epoch": 2.5569742045356145,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.4710609952326239e-06,
|
|
"loss": 1.0666,
|
|
"mean_token_accuracy": 0.705945460125804,
|
|
"num_tokens": 622063701.0,
|
|
"step": 8305
|
|
},
|
|
{
|
|
"entropy": 1.0943796835839747,
|
|
"epoch": 2.5585136578372607,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.4626176658374058e-06,
|
|
"loss": 1.0882,
|
|
"mean_token_accuracy": 0.7030817274004221,
|
|
"num_tokens": 622437278.0,
|
|
"step": 8310
|
|
},
|
|
{
|
|
"entropy": 1.08386998642236,
|
|
"epoch": 2.560053111138907,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.4541967247320787e-06,
|
|
"loss": 1.0716,
|
|
"mean_token_accuracy": 0.7058494832366705,
|
|
"num_tokens": 622806449.0,
|
|
"step": 8315
|
|
},
|
|
{
|
|
"entropy": 1.1119184829294682,
|
|
"epoch": 2.561592564440553,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.4457981939995847e-06,
|
|
"loss": 1.109,
|
|
"mean_token_accuracy": 0.7010248322039843,
|
|
"num_tokens": 623186900.0,
|
|
"step": 8320
|
|
},
|
|
{
|
|
"entropy": 1.0508412830531597,
|
|
"epoch": 2.5631320177421992,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.4374220956640895e-06,
|
|
"loss": 1.0449,
|
|
"mean_token_accuracy": 0.710378760844469,
|
|
"num_tokens": 623549290.0,
|
|
"step": 8325
|
|
},
|
|
{
|
|
"entropy": 1.0571365270763635,
|
|
"epoch": 2.5646714710438454,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.4290684516909314e-06,
|
|
"loss": 1.0417,
|
|
"mean_token_accuracy": 0.7122047755867242,
|
|
"num_tokens": 623908963.0,
|
|
"step": 8330
|
|
},
|
|
{
|
|
"entropy": 1.0961089542135596,
|
|
"epoch": 2.5662109243454916,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 1.420737283986572e-06,
|
|
"loss": 1.0984,
|
|
"mean_token_accuracy": 0.702150697261095,
|
|
"num_tokens": 624286193.0,
|
|
"step": 8335
|
|
},
|
|
{
|
|
"entropy": 1.0931196499615907,
|
|
"epoch": 2.567750377647138,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.4124286143985267e-06,
|
|
"loss": 1.0876,
|
|
"mean_token_accuracy": 0.7047367937862873,
|
|
"num_tokens": 624672981.0,
|
|
"step": 8340
|
|
},
|
|
{
|
|
"entropy": 1.0746397588402032,
|
|
"epoch": 2.5692898309487844,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.4041424647153112e-06,
|
|
"loss": 1.0658,
|
|
"mean_token_accuracy": 0.7056132916361093,
|
|
"num_tokens": 625049555.0,
|
|
"step": 8345
|
|
},
|
|
{
|
|
"entropy": 1.1072957117110491,
|
|
"epoch": 2.5708292842504306,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.395878856666385e-06,
|
|
"loss": 1.0916,
|
|
"mean_token_accuracy": 0.7013078387826681,
|
|
"num_tokens": 625436683.0,
|
|
"step": 8350
|
|
},
|
|
{
|
|
"entropy": 1.096746638789773,
|
|
"epoch": 2.5723687375520767,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.3876378119221024e-06,
|
|
"loss": 1.0746,
|
|
"mean_token_accuracy": 0.7017311029136181,
|
|
"num_tokens": 625814010.0,
|
|
"step": 8355
|
|
},
|
|
{
|
|
"entropy": 1.091253525018692,
|
|
"epoch": 2.573908190853723,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.3794193520936405e-06,
|
|
"loss": 1.0845,
|
|
"mean_token_accuracy": 0.7037181062623858,
|
|
"num_tokens": 626191920.0,
|
|
"step": 8360
|
|
},
|
|
{
|
|
"entropy": 1.1008768018335104,
|
|
"epoch": 2.5754476441553695,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.3712234987329486e-06,
|
|
"loss": 1.0811,
|
|
"mean_token_accuracy": 0.702424693107605,
|
|
"num_tokens": 626551660.0,
|
|
"step": 8365
|
|
},
|
|
{
|
|
"entropy": 1.0451095206663013,
|
|
"epoch": 2.5769870974570157,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.363050273332701e-06,
|
|
"loss": 1.0411,
|
|
"mean_token_accuracy": 0.7113728944212199,
|
|
"num_tokens": 626935731.0,
|
|
"step": 8370
|
|
},
|
|
{
|
|
"entropy": 1.0727886315435171,
|
|
"epoch": 2.578526550758662,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.3548996973262273e-06,
|
|
"loss": 1.0642,
|
|
"mean_token_accuracy": 0.7078009344637394,
|
|
"num_tokens": 627303463.0,
|
|
"step": 8375
|
|
},
|
|
{
|
|
"entropy": 1.0744563303887844,
|
|
"epoch": 2.580066004060308,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.3467717920874624e-06,
|
|
"loss": 1.0597,
|
|
"mean_token_accuracy": 0.7069951850920916,
|
|
"num_tokens": 627684696.0,
|
|
"step": 8380
|
|
},
|
|
{
|
|
"entropy": 1.0965715309605002,
|
|
"epoch": 2.5816054573619542,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.3386665789308885e-06,
|
|
"loss": 1.0817,
|
|
"mean_token_accuracy": 0.7025937806814909,
|
|
"num_tokens": 628060074.0,
|
|
"step": 8385
|
|
},
|
|
{
|
|
"entropy": 1.0707357473671437,
|
|
"epoch": 2.5831449106636004,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.3305840791114854e-06,
|
|
"loss": 1.0683,
|
|
"mean_token_accuracy": 0.7063583813607692,
|
|
"num_tokens": 628437393.0,
|
|
"step": 8390
|
|
},
|
|
{
|
|
"entropy": 1.0831568064168096,
|
|
"epoch": 2.5846843639652466,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 1.3225243138246669e-06,
|
|
"loss": 1.0801,
|
|
"mean_token_accuracy": 0.7057130847126245,
|
|
"num_tokens": 628811597.0,
|
|
"step": 8395
|
|
},
|
|
{
|
|
"entropy": 1.1021239565685392,
|
|
"epoch": 2.586223817266893,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.3144873042062222e-06,
|
|
"loss": 1.0785,
|
|
"mean_token_accuracy": 0.7036220777779818,
|
|
"num_tokens": 629184773.0,
|
|
"step": 8400
|
|
},
|
|
{
|
|
"entropy": 1.0789752122014762,
|
|
"epoch": 2.5877632705685394,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.3064730713322793e-06,
|
|
"loss": 1.0618,
|
|
"mean_token_accuracy": 0.7071874987334013,
|
|
"num_tokens": 629562761.0,
|
|
"step": 8405
|
|
},
|
|
{
|
|
"entropy": 1.0803477531298995,
|
|
"epoch": 2.5893027238701856,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 1.2984816362192265e-06,
|
|
"loss": 1.0709,
|
|
"mean_token_accuracy": 0.7063110128045083,
|
|
"num_tokens": 629927408.0,
|
|
"step": 8410
|
|
},
|
|
{
|
|
"entropy": 1.0541702834889293,
|
|
"epoch": 2.5908421771718317,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.2905130198236704e-06,
|
|
"loss": 1.0421,
|
|
"mean_token_accuracy": 0.7112767715007067,
|
|
"num_tokens": 630298653.0,
|
|
"step": 8415
|
|
},
|
|
{
|
|
"entropy": 1.0773243509232997,
|
|
"epoch": 2.5923816304734784,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.2825672430423763e-06,
|
|
"loss": 1.0743,
|
|
"mean_token_accuracy": 0.7069871183484793,
|
|
"num_tokens": 630670132.0,
|
|
"step": 8420
|
|
},
|
|
{
|
|
"entropy": 1.0890698049217462,
|
|
"epoch": 2.5939210837751245,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 1.2746443267122233e-06,
|
|
"loss": 1.0848,
|
|
"mean_token_accuracy": 0.7043047390878201,
|
|
"num_tokens": 631038040.0,
|
|
"step": 8425
|
|
},
|
|
{
|
|
"entropy": 1.0772488322108984,
|
|
"epoch": 2.5954605370767707,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.2667442916101313e-06,
|
|
"loss": 1.0596,
|
|
"mean_token_accuracy": 0.7082285489886999,
|
|
"num_tokens": 631406414.0,
|
|
"step": 8430
|
|
},
|
|
{
|
|
"entropy": 1.0764193635433912,
|
|
"epoch": 2.596999990378417,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.258867158453021e-06,
|
|
"loss": 1.0745,
|
|
"mean_token_accuracy": 0.7065963443368674,
|
|
"num_tokens": 631772054.0,
|
|
"step": 8435
|
|
},
|
|
{
|
|
"entropy": 1.0778394332155585,
|
|
"epoch": 2.598539443680063,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.2510129478977594e-06,
|
|
"loss": 1.0748,
|
|
"mean_token_accuracy": 0.7073905680328607,
|
|
"num_tokens": 632134797.0,
|
|
"step": 8440
|
|
},
|
|
{
|
|
"entropy": 1.1111415144056083,
|
|
"epoch": 2.6000788969817092,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.2431816805410968e-06,
|
|
"loss": 1.0896,
|
|
"mean_token_accuracy": 0.7008758056908846,
|
|
"num_tokens": 632507624.0,
|
|
"step": 8445
|
|
},
|
|
{
|
|
"entropy": 1.0644908392801882,
|
|
"epoch": 2.6016183502833554,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.2353733769196174e-06,
|
|
"loss": 1.0532,
|
|
"mean_token_accuracy": 0.7090076547116041,
|
|
"num_tokens": 632884683.0,
|
|
"step": 8450
|
|
},
|
|
{
|
|
"entropy": 1.0695085987448691,
|
|
"epoch": 2.603157803585002,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.2275880575096865e-06,
|
|
"loss": 1.0606,
|
|
"mean_token_accuracy": 0.7088157534599304,
|
|
"num_tokens": 633263377.0,
|
|
"step": 8455
|
|
},
|
|
{
|
|
"entropy": 1.104318262077868,
|
|
"epoch": 2.604697256886648,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.2198257427273997e-06,
|
|
"loss": 1.0854,
|
|
"mean_token_accuracy": 0.7016732916235924,
|
|
"num_tokens": 633634624.0,
|
|
"step": 8460
|
|
},
|
|
{
|
|
"entropy": 1.1314452340826393,
|
|
"epoch": 2.6062367101882944,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.2120864529285203e-06,
|
|
"loss": 1.1336,
|
|
"mean_token_accuracy": 0.6956058299168945,
|
|
"num_tokens": 634006677.0,
|
|
"step": 8465
|
|
},
|
|
{
|
|
"entropy": 1.08210170250386,
|
|
"epoch": 2.6077761634899406,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.204370208408433e-06,
|
|
"loss": 1.0656,
|
|
"mean_token_accuracy": 0.7066924318671226,
|
|
"num_tokens": 634376710.0,
|
|
"step": 8470
|
|
},
|
|
{
|
|
"entropy": 1.0981611719354987,
|
|
"epoch": 2.6093156167915867,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.1966770294020934e-06,
|
|
"loss": 1.0803,
|
|
"mean_token_accuracy": 0.7054270375519991,
|
|
"num_tokens": 634753729.0,
|
|
"step": 8475
|
|
},
|
|
{
|
|
"entropy": 1.1050032678991557,
|
|
"epoch": 2.6108550700932334,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.189006936083963e-06,
|
|
"loss": 1.1115,
|
|
"mean_token_accuracy": 0.7017614796757699,
|
|
"num_tokens": 635122214.0,
|
|
"step": 8480
|
|
},
|
|
{
|
|
"entropy": 1.081735635176301,
|
|
"epoch": 2.6123945233948795,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.1813599485679684e-06,
|
|
"loss": 1.0817,
|
|
"mean_token_accuracy": 0.7051867727190256,
|
|
"num_tokens": 635494338.0,
|
|
"step": 8485
|
|
},
|
|
{
|
|
"entropy": 1.1093892607837916,
|
|
"epoch": 2.6139339766965257,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 1.173736086907441e-06,
|
|
"loss": 1.1059,
|
|
"mean_token_accuracy": 0.6982233244925737,
|
|
"num_tokens": 635862178.0,
|
|
"step": 8490
|
|
},
|
|
{
|
|
"entropy": 1.1163367956876755,
|
|
"epoch": 2.615473429998172,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.166135371095073e-06,
|
|
"loss": 1.1154,
|
|
"mean_token_accuracy": 0.6980734944343567,
|
|
"num_tokens": 636233246.0,
|
|
"step": 8495
|
|
},
|
|
{
|
|
"entropy": 1.0528678687289357,
|
|
"epoch": 2.617012883299818,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 1.1585578210628524e-06,
|
|
"loss": 1.0343,
|
|
"mean_token_accuracy": 0.7108449127525092,
|
|
"num_tokens": 636600925.0,
|
|
"step": 8500
|
|
},
|
|
{
|
|
"entropy": 1.1010185830295085,
|
|
"epoch": 2.6185523366014642,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.1510034566820205e-06,
|
|
"loss": 1.095,
|
|
"mean_token_accuracy": 0.7027761071920395,
|
|
"num_tokens": 636968634.0,
|
|
"step": 8505
|
|
},
|
|
{
|
|
"entropy": 1.0584915898740292,
|
|
"epoch": 2.6200917899031104,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.143472297763022e-06,
|
|
"loss": 1.0373,
|
|
"mean_token_accuracy": 0.7102391637861729,
|
|
"num_tokens": 637345673.0,
|
|
"step": 8510
|
|
},
|
|
{
|
|
"entropy": 1.075180507451296,
|
|
"epoch": 2.621631243204757,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 1.1359643640554384e-06,
|
|
"loss": 1.0792,
|
|
"mean_token_accuracy": 0.7090970227494836,
|
|
"num_tokens": 637711264.0,
|
|
"step": 8515
|
|
},
|
|
{
|
|
"entropy": 1.0991731733083725,
|
|
"epoch": 2.623170696506403,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.128479675247952e-06,
|
|
"loss": 1.1007,
|
|
"mean_token_accuracy": 0.7012095261365175,
|
|
"num_tokens": 638082967.0,
|
|
"step": 8520
|
|
},
|
|
{
|
|
"entropy": 1.1104621531441807,
|
|
"epoch": 2.6247101498080494,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.1210182509682854e-06,
|
|
"loss": 1.0936,
|
|
"mean_token_accuracy": 0.7004246473312378,
|
|
"num_tokens": 638463649.0,
|
|
"step": 8525
|
|
},
|
|
{
|
|
"entropy": 1.1019649423658848,
|
|
"epoch": 2.6262496031096956,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.1135801107831568e-06,
|
|
"loss": 1.0916,
|
|
"mean_token_accuracy": 0.7022252280265093,
|
|
"num_tokens": 638842230.0,
|
|
"step": 8530
|
|
},
|
|
{
|
|
"entropy": 1.1113097636029123,
|
|
"epoch": 2.627789056411342,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.1061652741982198e-06,
|
|
"loss": 1.1067,
|
|
"mean_token_accuracy": 0.6990880757570267,
|
|
"num_tokens": 639238896.0,
|
|
"step": 8535
|
|
},
|
|
{
|
|
"entropy": 1.1236522398889064,
|
|
"epoch": 2.6293285097129884,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.0987737606580174e-06,
|
|
"loss": 1.1179,
|
|
"mean_token_accuracy": 0.6997340172529221,
|
|
"num_tokens": 639612276.0,
|
|
"step": 8540
|
|
},
|
|
{
|
|
"entropy": 1.1222118254750968,
|
|
"epoch": 2.6308679630146345,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.0914055895459353e-06,
|
|
"loss": 1.1166,
|
|
"mean_token_accuracy": 0.6995704405009746,
|
|
"num_tokens": 639982509.0,
|
|
"step": 8545
|
|
},
|
|
{
|
|
"entropy": 1.0843644311651588,
|
|
"epoch": 2.6324074163162807,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.084060780184143e-06,
|
|
"loss": 1.0791,
|
|
"mean_token_accuracy": 0.7068472430109978,
|
|
"num_tokens": 640368773.0,
|
|
"step": 8550
|
|
},
|
|
{
|
|
"entropy": 1.0446718033403157,
|
|
"epoch": 2.633946869617927,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.0767393518335445e-06,
|
|
"loss": 1.0325,
|
|
"mean_token_accuracy": 0.7160828601568937,
|
|
"num_tokens": 640745613.0,
|
|
"step": 8555
|
|
},
|
|
{
|
|
"entropy": 1.0607570856809616,
|
|
"epoch": 2.635486322919573,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.0694413236937329e-06,
|
|
"loss": 1.0494,
|
|
"mean_token_accuracy": 0.7100570943206549,
|
|
"num_tokens": 641134617.0,
|
|
"step": 8560
|
|
},
|
|
{
|
|
"entropy": 1.1504531534388662,
|
|
"epoch": 2.6370257762212193,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.062166714902938e-06,
|
|
"loss": 1.1499,
|
|
"mean_token_accuracy": 0.6932075746357441,
|
|
"num_tokens": 641506942.0,
|
|
"step": 8565
|
|
},
|
|
{
|
|
"entropy": 1.1118824519217014,
|
|
"epoch": 2.6385652295228654,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.054915544537971e-06,
|
|
"loss": 1.1095,
|
|
"mean_token_accuracy": 0.6981380853801966,
|
|
"num_tokens": 641872006.0,
|
|
"step": 8570
|
|
},
|
|
{
|
|
"entropy": 1.0765496885403991,
|
|
"epoch": 2.640104682824512,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.0476878316141814e-06,
|
|
"loss": 1.0589,
|
|
"mean_token_accuracy": 0.7075853127986192,
|
|
"num_tokens": 642241326.0,
|
|
"step": 8575
|
|
},
|
|
{
|
|
"entropy": 1.0996829438954592,
|
|
"epoch": 2.6416441361261582,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.040483595085403e-06,
|
|
"loss": 1.0829,
|
|
"mean_token_accuracy": 0.7048280119895936,
|
|
"num_tokens": 642618588.0,
|
|
"step": 8580
|
|
},
|
|
{
|
|
"entropy": 1.0651772249490024,
|
|
"epoch": 2.6431835894278044,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.0333028538439093e-06,
|
|
"loss": 1.0575,
|
|
"mean_token_accuracy": 0.7102709155529737,
|
|
"num_tokens": 642995073.0,
|
|
"step": 8585
|
|
},
|
|
{
|
|
"entropy": 1.0825393127277494,
|
|
"epoch": 2.6447230427294506,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.0261456267203561e-06,
|
|
"loss": 1.0758,
|
|
"mean_token_accuracy": 0.7078548181802035,
|
|
"num_tokens": 643351783.0,
|
|
"step": 8590
|
|
},
|
|
{
|
|
"entropy": 1.112888291105628,
|
|
"epoch": 2.646262496031097,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 1.0190119324837356e-06,
|
|
"loss": 1.1087,
|
|
"mean_token_accuracy": 0.6982626553624869,
|
|
"num_tokens": 643718767.0,
|
|
"step": 8595
|
|
},
|
|
{
|
|
"entropy": 1.0889703487977385,
|
|
"epoch": 2.6478019493327434,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.0119017898413286e-06,
|
|
"loss": 1.0735,
|
|
"mean_token_accuracy": 0.7080344788730144,
|
|
"num_tokens": 644092492.0,
|
|
"step": 8600
|
|
},
|
|
{
|
|
"entropy": 1.1268511667847634,
|
|
"epoch": 2.6493414026343896,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.0048152174386584e-06,
|
|
"loss": 1.1136,
|
|
"mean_token_accuracy": 0.7007742341607809,
|
|
"num_tokens": 644460038.0,
|
|
"step": 8605
|
|
},
|
|
{
|
|
"entropy": 1.0917161397635937,
|
|
"epoch": 2.6508808559360357,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 9.977522338594325e-07,
|
|
"loss": 1.0847,
|
|
"mean_token_accuracy": 0.7047463800758124,
|
|
"num_tokens": 644825041.0,
|
|
"step": 8610
|
|
},
|
|
{
|
|
"entropy": 1.0769792392849922,
|
|
"epoch": 2.652420309237682,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 9.90712857625501e-07,
|
|
"loss": 1.0789,
|
|
"mean_token_accuracy": 0.706360137462616,
|
|
"num_tokens": 645194711.0,
|
|
"step": 8615
|
|
},
|
|
{
|
|
"entropy": 1.1132209178060293,
|
|
"epoch": 2.653959762539328,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 9.836971071968104e-07,
|
|
"loss": 1.0981,
|
|
"mean_token_accuracy": 0.6996910180896521,
|
|
"num_tokens": 645549414.0,
|
|
"step": 8620
|
|
},
|
|
{
|
|
"entropy": 1.079536897689104,
|
|
"epoch": 2.6554992158409743,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 9.767050009713476e-07,
|
|
"loss": 1.0739,
|
|
"mean_token_accuracy": 0.7066746778786183,
|
|
"num_tokens": 645904132.0,
|
|
"step": 8625
|
|
},
|
|
{
|
|
"entropy": 1.110541058331728,
|
|
"epoch": 2.657038669142621,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 9.697365572850958e-07,
|
|
"loss": 1.1105,
|
|
"mean_token_accuracy": 0.7012249136343598,
|
|
"num_tokens": 646271479.0,
|
|
"step": 8630
|
|
},
|
|
{
|
|
"entropy": 1.0832279035821557,
|
|
"epoch": 2.658578122444267,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 9.627917944119835e-07,
|
|
"loss": 1.0723,
|
|
"mean_token_accuracy": 0.7056699939072132,
|
|
"num_tokens": 646652909.0,
|
|
"step": 8635
|
|
},
|
|
{
|
|
"entropy": 1.0766685290262104,
|
|
"epoch": 2.6601175757459132,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 9.558707305638458e-07,
|
|
"loss": 1.0727,
|
|
"mean_token_accuracy": 0.707184936106205,
|
|
"num_tokens": 647051764.0,
|
|
"step": 8640
|
|
},
|
|
{
|
|
"entropy": 1.1162386810407043,
|
|
"epoch": 2.6616570290475594,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 9.489733838903648e-07,
|
|
"loss": 1.117,
|
|
"mean_token_accuracy": 0.7021023396402597,
|
|
"num_tokens": 647422584.0,
|
|
"step": 8645
|
|
},
|
|
{
|
|
"entropy": 1.1222765684127807,
|
|
"epoch": 2.6631964823492056,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 9.420997724790238e-07,
|
|
"loss": 1.1101,
|
|
"mean_token_accuracy": 0.6999505333602428,
|
|
"num_tokens": 647810392.0,
|
|
"step": 8650
|
|
},
|
|
{
|
|
"entropy": 1.1187356140464544,
|
|
"epoch": 2.664735935650852,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 9.352499143550742e-07,
|
|
"loss": 1.1117,
|
|
"mean_token_accuracy": 0.6978887222707272,
|
|
"num_tokens": 648174316.0,
|
|
"step": 8655
|
|
},
|
|
{
|
|
"entropy": 1.0830912884324788,
|
|
"epoch": 2.6662753889524984,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 9.284238274814672e-07,
|
|
"loss": 1.0815,
|
|
"mean_token_accuracy": 0.704418596625328,
|
|
"num_tokens": 648560564.0,
|
|
"step": 8660
|
|
},
|
|
{
|
|
"entropy": 1.0968494165688754,
|
|
"epoch": 2.6678148422541446,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 9.216215297588182e-07,
|
|
"loss": 1.0965,
|
|
"mean_token_accuracy": 0.7013349425047636,
|
|
"num_tokens": 648945129.0,
|
|
"step": 8665
|
|
},
|
|
{
|
|
"entropy": 1.095397400483489,
|
|
"epoch": 2.6693542955557907,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 9.148430390253615e-07,
|
|
"loss": 1.08,
|
|
"mean_token_accuracy": 0.7044960848987103,
|
|
"num_tokens": 649311205.0,
|
|
"step": 8670
|
|
},
|
|
{
|
|
"entropy": 1.123212101869285,
|
|
"epoch": 2.670893748857437,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 9.08088373056899e-07,
|
|
"loss": 1.1267,
|
|
"mean_token_accuracy": 0.6996923841536045,
|
|
"num_tokens": 649690529.0,
|
|
"step": 8675
|
|
},
|
|
{
|
|
"entropy": 1.120737462118268,
|
|
"epoch": 2.672433202159083,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 9.013575495667559e-07,
|
|
"loss": 1.1142,
|
|
"mean_token_accuracy": 0.6965329051017761,
|
|
"num_tokens": 650072740.0,
|
|
"step": 8680
|
|
},
|
|
{
|
|
"entropy": 1.1076945010572672,
|
|
"epoch": 2.6739726554607293,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 8.946505862057286e-07,
|
|
"loss": 1.1039,
|
|
"mean_token_accuracy": 0.6990118652582169,
|
|
"num_tokens": 650456690.0,
|
|
"step": 8685
|
|
},
|
|
{
|
|
"entropy": 1.082505726069212,
|
|
"epoch": 2.675512108762376,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 8.879675005620503e-07,
|
|
"loss": 1.0725,
|
|
"mean_token_accuracy": 0.7061933267861604,
|
|
"num_tokens": 650823555.0,
|
|
"step": 8690
|
|
},
|
|
{
|
|
"entropy": 1.0786154311150313,
|
|
"epoch": 2.677051562064022,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 8.813083101613329e-07,
|
|
"loss": 1.0724,
|
|
"mean_token_accuracy": 0.7078050151467323,
|
|
"num_tokens": 651198563.0,
|
|
"step": 8695
|
|
},
|
|
{
|
|
"entropy": 1.1012431835755705,
|
|
"epoch": 2.6785910153656682,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 8.746730324665264e-07,
|
|
"loss": 1.0972,
|
|
"mean_token_accuracy": 0.7009351093322038,
|
|
"num_tokens": 651566586.0,
|
|
"step": 8700
|
|
},
|
|
{
|
|
"entropy": 1.0904900334775447,
|
|
"epoch": 2.6801304686673144,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 8.680616848778711e-07,
|
|
"loss": 1.0923,
|
|
"mean_token_accuracy": 0.7075178977102041,
|
|
"num_tokens": 651937449.0,
|
|
"step": 8705
|
|
},
|
|
{
|
|
"entropy": 1.1005827873945235,
|
|
"epoch": 2.681669921968961,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 8.614742847328594e-07,
|
|
"loss": 1.0952,
|
|
"mean_token_accuracy": 0.7045264143496752,
|
|
"num_tokens": 652315679.0,
|
|
"step": 8710
|
|
},
|
|
{
|
|
"entropy": 1.0729358620941638,
|
|
"epoch": 2.683209375270607,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 8.549108493061786e-07,
|
|
"loss": 1.061,
|
|
"mean_token_accuracy": 0.7096313200891018,
|
|
"num_tokens": 652690163.0,
|
|
"step": 8715
|
|
},
|
|
{
|
|
"entropy": 1.0678111106157302,
|
|
"epoch": 2.6847488285722534,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 8.483713958096706e-07,
|
|
"loss": 1.0561,
|
|
"mean_token_accuracy": 0.7088241372257471,
|
|
"num_tokens": 653062880.0,
|
|
"step": 8720
|
|
},
|
|
{
|
|
"entropy": 1.0707178678363563,
|
|
"epoch": 2.6862882818738996,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 8.418559413922933e-07,
|
|
"loss": 1.0564,
|
|
"mean_token_accuracy": 0.7078599616885185,
|
|
"num_tokens": 653454539.0,
|
|
"step": 8725
|
|
},
|
|
{
|
|
"entropy": 1.0829125214368105,
|
|
"epoch": 2.6878277351755457,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 8.353645031400648e-07,
|
|
"loss": 1.0722,
|
|
"mean_token_accuracy": 0.7037454053759575,
|
|
"num_tokens": 653826373.0,
|
|
"step": 8730
|
|
},
|
|
{
|
|
"entropy": 1.0961937030777336,
|
|
"epoch": 2.689367188477192,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 8.288970980760258e-07,
|
|
"loss": 1.0954,
|
|
"mean_token_accuracy": 0.7043376386165618,
|
|
"num_tokens": 654194776.0,
|
|
"step": 8735
|
|
},
|
|
{
|
|
"entropy": 1.0986996894702314,
|
|
"epoch": 2.690906641778838,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 8.224537431601886e-07,
|
|
"loss": 1.0941,
|
|
"mean_token_accuracy": 0.7033939383924007,
|
|
"num_tokens": 654581239.0,
|
|
"step": 8740
|
|
},
|
|
{
|
|
"entropy": 1.0907197531312705,
|
|
"epoch": 2.6924460950804843,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 8.160344552895061e-07,
|
|
"loss": 1.0788,
|
|
"mean_token_accuracy": 0.7029842235147953,
|
|
"num_tokens": 654938536.0,
|
|
"step": 8745
|
|
},
|
|
{
|
|
"entropy": 1.0934245502576232,
|
|
"epoch": 2.693985548382131,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 8.096392512978091e-07,
|
|
"loss": 1.0877,
|
|
"mean_token_accuracy": 0.7048339407891036,
|
|
"num_tokens": 655302978.0,
|
|
"step": 8750
|
|
},
|
|
{
|
|
"entropy": 1.0600236285477878,
|
|
"epoch": 2.695525001683777,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 8.032681479557725e-07,
|
|
"loss": 1.0483,
|
|
"mean_token_accuracy": 0.7077294331043958,
|
|
"num_tokens": 655675009.0,
|
|
"step": 8755
|
|
},
|
|
{
|
|
"entropy": 1.1039345556870104,
|
|
"epoch": 2.6970644549854232,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 7.969211619708773e-07,
|
|
"loss": 1.0923,
|
|
"mean_token_accuracy": 0.702091147005558,
|
|
"num_tokens": 656060460.0,
|
|
"step": 8760
|
|
},
|
|
{
|
|
"entropy": 1.1256631219759583,
|
|
"epoch": 2.6986039082870694,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 7.905983099873504e-07,
|
|
"loss": 1.1175,
|
|
"mean_token_accuracy": 0.6981407880783081,
|
|
"num_tokens": 656446115.0,
|
|
"step": 8765
|
|
},
|
|
{
|
|
"entropy": 1.1070101469755174,
|
|
"epoch": 2.700143361588716,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 7.842996085861365e-07,
|
|
"loss": 1.1117,
|
|
"mean_token_accuracy": 0.7022641632705927,
|
|
"num_tokens": 656815818.0,
|
|
"step": 8770
|
|
},
|
|
{
|
|
"entropy": 1.0692075334489346,
|
|
"epoch": 2.701682814890362,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 7.780250742848416e-07,
|
|
"loss": 1.0554,
|
|
"mean_token_accuracy": 0.7093649230897426,
|
|
"num_tokens": 657184570.0,
|
|
"step": 8775
|
|
},
|
|
{
|
|
"entropy": 1.1263929111883044,
|
|
"epoch": 2.7032222681920084,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 7.717747235377048e-07,
|
|
"loss": 1.1138,
|
|
"mean_token_accuracy": 0.6993951726704836,
|
|
"num_tokens": 657550918.0,
|
|
"step": 8780
|
|
},
|
|
{
|
|
"entropy": 1.1405288198962809,
|
|
"epoch": 2.7047617214936546,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 7.655485727355416e-07,
|
|
"loss": 1.1243,
|
|
"mean_token_accuracy": 0.6943991862237453,
|
|
"num_tokens": 657920391.0,
|
|
"step": 8785
|
|
},
|
|
{
|
|
"entropy": 1.1017889656126498,
|
|
"epoch": 2.7063011747953007,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 7.593466382057035e-07,
|
|
"loss": 1.0985,
|
|
"mean_token_accuracy": 0.7011715356260538,
|
|
"num_tokens": 658309257.0,
|
|
"step": 8790
|
|
},
|
|
{
|
|
"entropy": 1.097086925432086,
|
|
"epoch": 2.707840628096947,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 7.531689362120442e-07,
|
|
"loss": 1.0846,
|
|
"mean_token_accuracy": 0.7059640645980835,
|
|
"num_tokens": 658678359.0,
|
|
"step": 8795
|
|
},
|
|
{
|
|
"entropy": 1.1141622949391603,
|
|
"epoch": 2.709380081398593,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 7.470154829548671e-07,
|
|
"loss": 1.1167,
|
|
"mean_token_accuracy": 0.6996945235878229,
|
|
"num_tokens": 659044248.0,
|
|
"step": 8800
|
|
},
|
|
{
|
|
"entropy": 1.0870655797421933,
|
|
"epoch": 2.7109195347002397,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 7.408862945708839e-07,
|
|
"loss": 1.0843,
|
|
"mean_token_accuracy": 0.7067235954105854,
|
|
"num_tokens": 659422134.0,
|
|
"step": 8805
|
|
},
|
|
{
|
|
"entropy": 1.0943645793944596,
|
|
"epoch": 2.712458988001886,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 7.347813871331755e-07,
|
|
"loss": 1.0904,
|
|
"mean_token_accuracy": 0.7028016820549965,
|
|
"num_tokens": 659799711.0,
|
|
"step": 8810
|
|
},
|
|
{
|
|
"entropy": 1.1046602103859187,
|
|
"epoch": 2.713998441303532,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 7.287007766511534e-07,
|
|
"loss": 1.0941,
|
|
"mean_token_accuracy": 0.6994575697928667,
|
|
"num_tokens": 660177127.0,
|
|
"step": 8815
|
|
},
|
|
{
|
|
"entropy": 1.0964064102619886,
|
|
"epoch": 2.7155378946051782,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 7.22644479070509e-07,
|
|
"loss": 1.0984,
|
|
"mean_token_accuracy": 0.7020392864942551,
|
|
"num_tokens": 660543144.0,
|
|
"step": 8820
|
|
},
|
|
{
|
|
"entropy": 1.0958056036382913,
|
|
"epoch": 2.7170773479068244,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 7.166125102731735e-07,
|
|
"loss": 1.0815,
|
|
"mean_token_accuracy": 0.7035059954971075,
|
|
"num_tokens": 660933644.0,
|
|
"step": 8825
|
|
},
|
|
{
|
|
"entropy": 1.1070061799138784,
|
|
"epoch": 2.718616801208471,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 7.106048860772863e-07,
|
|
"loss": 1.1028,
|
|
"mean_token_accuracy": 0.7030727453529835,
|
|
"num_tokens": 661323215.0,
|
|
"step": 8830
|
|
},
|
|
{
|
|
"entropy": 1.0921488601714373,
|
|
"epoch": 2.720156254510117,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 7.046216222371393e-07,
|
|
"loss": 1.0936,
|
|
"mean_token_accuracy": 0.7014792174100876,
|
|
"num_tokens": 661694622.0,
|
|
"step": 8835
|
|
},
|
|
{
|
|
"entropy": 1.074481917731464,
|
|
"epoch": 2.7216957078117634,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 6.98662734443144e-07,
|
|
"loss": 1.0694,
|
|
"mean_token_accuracy": 0.7062262888997793,
|
|
"num_tokens": 662076469.0,
|
|
"step": 8840
|
|
},
|
|
{
|
|
"entropy": 1.107923055253923,
|
|
"epoch": 2.7232351611134096,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 6.927282383217893e-07,
|
|
"loss": 1.1057,
|
|
"mean_token_accuracy": 0.6992979139089585,
|
|
"num_tokens": 662456187.0,
|
|
"step": 8845
|
|
},
|
|
{
|
|
"entropy": 1.071627826243639,
|
|
"epoch": 2.7247746144150558,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 6.868181494355996e-07,
|
|
"loss": 1.057,
|
|
"mean_token_accuracy": 0.7088756330311299,
|
|
"num_tokens": 662819610.0,
|
|
"step": 8850
|
|
},
|
|
{
|
|
"entropy": 1.1094576137140393,
|
|
"epoch": 2.726314067716702,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 6.809324832830944e-07,
|
|
"loss": 1.0974,
|
|
"mean_token_accuracy": 0.7023822411894798,
|
|
"num_tokens": 663190407.0,
|
|
"step": 8855
|
|
},
|
|
{
|
|
"entropy": 1.1548554703593255,
|
|
"epoch": 2.727853521018348,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 6.75071255298746e-07,
|
|
"loss": 1.1436,
|
|
"mean_token_accuracy": 0.6928546771407127,
|
|
"num_tokens": 663567322.0,
|
|
"step": 8860
|
|
},
|
|
{
|
|
"entropy": 1.1009166978299618,
|
|
"epoch": 2.7293929743199947,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 6.692344808529427e-07,
|
|
"loss": 1.0943,
|
|
"mean_token_accuracy": 0.7030318386852741,
|
|
"num_tokens": 663917850.0,
|
|
"step": 8865
|
|
},
|
|
{
|
|
"entropy": 1.0963743872940541,
|
|
"epoch": 2.730932427621641,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 6.634221752519454e-07,
|
|
"loss": 1.0941,
|
|
"mean_token_accuracy": 0.7031538657844066,
|
|
"num_tokens": 664279606.0,
|
|
"step": 8870
|
|
},
|
|
{
|
|
"entropy": 1.0869026152417063,
|
|
"epoch": 2.732471880923287,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 6.57634353737846e-07,
|
|
"loss": 1.0829,
|
|
"mean_token_accuracy": 0.7039289843291044,
|
|
"num_tokens": 664658457.0,
|
|
"step": 8875
|
|
},
|
|
{
|
|
"entropy": 1.1123804600909353,
|
|
"epoch": 2.7340113342249333,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 6.518710314885302e-07,
|
|
"loss": 1.101,
|
|
"mean_token_accuracy": 0.6991535119712353,
|
|
"num_tokens": 665039672.0,
|
|
"step": 8880
|
|
},
|
|
{
|
|
"entropy": 1.0850198414176702,
|
|
"epoch": 2.73555078752658,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 6.461322236176438e-07,
|
|
"loss": 1.0767,
|
|
"mean_token_accuracy": 0.7041392955929041,
|
|
"num_tokens": 665415400.0,
|
|
"step": 8885
|
|
},
|
|
{
|
|
"entropy": 1.0931290162727236,
|
|
"epoch": 2.737090240828226,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 6.404179451745396e-07,
|
|
"loss": 1.088,
|
|
"mean_token_accuracy": 0.7036156866699457,
|
|
"num_tokens": 665801100.0,
|
|
"step": 8890
|
|
},
|
|
{
|
|
"entropy": 1.0909227378666402,
|
|
"epoch": 2.7386296941298722,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 6.347282111442455e-07,
|
|
"loss": 1.0822,
|
|
"mean_token_accuracy": 0.7043377704918384,
|
|
"num_tokens": 666192278.0,
|
|
"step": 8895
|
|
},
|
|
{
|
|
"entropy": 1.0923385040834546,
|
|
"epoch": 2.7401691474315184,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 6.290630364474248e-07,
|
|
"loss": 1.0844,
|
|
"mean_token_accuracy": 0.7044520813971757,
|
|
"num_tokens": 666567082.0,
|
|
"step": 8900
|
|
},
|
|
{
|
|
"entropy": 1.063293014653027,
|
|
"epoch": 2.7417086007331646,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 6.234224359403407e-07,
|
|
"loss": 1.0622,
|
|
"mean_token_accuracy": 0.7084932412952185,
|
|
"num_tokens": 666952108.0,
|
|
"step": 8905
|
|
},
|
|
{
|
|
"entropy": 1.0692742966115474,
|
|
"epoch": 2.7432480540348108,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 6.178064244148085e-07,
|
|
"loss": 1.0638,
|
|
"mean_token_accuracy": 0.7085377536714077,
|
|
"num_tokens": 667323090.0,
|
|
"step": 8910
|
|
},
|
|
{
|
|
"entropy": 1.0978432845324277,
|
|
"epoch": 2.744787507336457,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 6.122150165981633e-07,
|
|
"loss": 1.0813,
|
|
"mean_token_accuracy": 0.7013709127902985,
|
|
"num_tokens": 667710878.0,
|
|
"step": 8915
|
|
},
|
|
{
|
|
"entropy": 1.0790234494954347,
|
|
"epoch": 2.7463269606381036,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 6.066482271532215e-07,
|
|
"loss": 1.0625,
|
|
"mean_token_accuracy": 0.706735622137785,
|
|
"num_tokens": 668093347.0,
|
|
"step": 8920
|
|
},
|
|
{
|
|
"entropy": 1.087682570889592,
|
|
"epoch": 2.7478664139397497,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 6.01106070678239e-07,
|
|
"loss": 1.0803,
|
|
"mean_token_accuracy": 0.7044631894677877,
|
|
"num_tokens": 668477669.0,
|
|
"step": 8925
|
|
},
|
|
{
|
|
"entropy": 1.0854968342930078,
|
|
"epoch": 2.749405867241396,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 5.955885617068758e-07,
|
|
"loss": 1.0829,
|
|
"mean_token_accuracy": 0.702552431076765,
|
|
"num_tokens": 668854523.0,
|
|
"step": 8930
|
|
},
|
|
{
|
|
"entropy": 1.1138760451227427,
|
|
"epoch": 2.750945320543042,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 5.90095714708152e-07,
|
|
"loss": 1.1113,
|
|
"mean_token_accuracy": 0.6989776596426964,
|
|
"num_tokens": 669220992.0,
|
|
"step": 8935
|
|
},
|
|
{
|
|
"entropy": 1.0634296923875808,
|
|
"epoch": 2.7524847738446883,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 5.846275440864246e-07,
|
|
"loss": 1.0554,
|
|
"mean_token_accuracy": 0.7096430268138647,
|
|
"num_tokens": 669594143.0,
|
|
"step": 8940
|
|
},
|
|
{
|
|
"entropy": 1.1015803342685104,
|
|
"epoch": 2.754024227146335,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 5.791840641813295e-07,
|
|
"loss": 1.1013,
|
|
"mean_token_accuracy": 0.7018820203840732,
|
|
"num_tokens": 669967744.0,
|
|
"step": 8945
|
|
},
|
|
{
|
|
"entropy": 1.1098992815241218,
|
|
"epoch": 2.755563680447981,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 5.737652892677592e-07,
|
|
"loss": 1.097,
|
|
"mean_token_accuracy": 0.7007124435156584,
|
|
"num_tokens": 670342501.0,
|
|
"step": 8950
|
|
},
|
|
{
|
|
"entropy": 1.0739733135327696,
|
|
"epoch": 2.7571031337496272,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 5.683712335558189e-07,
|
|
"loss": 1.0656,
|
|
"mean_token_accuracy": 0.7071675844490528,
|
|
"num_tokens": 670703662.0,
|
|
"step": 8955
|
|
},
|
|
{
|
|
"entropy": 1.1018484968692064,
|
|
"epoch": 2.7586425870512734,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 5.630019111907925e-07,
|
|
"loss": 1.0885,
|
|
"mean_token_accuracy": 0.7015368893742562,
|
|
"num_tokens": 671093003.0,
|
|
"step": 8960
|
|
},
|
|
{
|
|
"entropy": 1.0654717065393924,
|
|
"epoch": 2.7601820403529196,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 5.576573362531001e-07,
|
|
"loss": 1.0522,
|
|
"mean_token_accuracy": 0.7108161211013794,
|
|
"num_tokens": 671448351.0,
|
|
"step": 8965
|
|
},
|
|
{
|
|
"entropy": 1.0969543462619185,
|
|
"epoch": 2.7617214936545658,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 5.523375227582662e-07,
|
|
"loss": 1.09,
|
|
"mean_token_accuracy": 0.7034319680184126,
|
|
"num_tokens": 671832467.0,
|
|
"step": 8970
|
|
},
|
|
{
|
|
"entropy": 1.1132678221911192,
|
|
"epoch": 2.763260946956212,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 5.470424846568833e-07,
|
|
"loss": 1.1067,
|
|
"mean_token_accuracy": 0.6981930460780859,
|
|
"num_tokens": 672213920.0,
|
|
"step": 8975
|
|
},
|
|
{
|
|
"entropy": 1.1005038779228926,
|
|
"epoch": 2.7648004002578586,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 5.417722358345712e-07,
|
|
"loss": 1.0956,
|
|
"mean_token_accuracy": 0.7028115659952163,
|
|
"num_tokens": 672601404.0,
|
|
"step": 8980
|
|
},
|
|
{
|
|
"entropy": 1.0807026676833629,
|
|
"epoch": 2.7663398535595047,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 5.365267901119398e-07,
|
|
"loss": 1.0773,
|
|
"mean_token_accuracy": 0.7056918099522591,
|
|
"num_tokens": 672973104.0,
|
|
"step": 8985
|
|
},
|
|
{
|
|
"entropy": 1.087639617174864,
|
|
"epoch": 2.767879306861151,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 5.313061612445636e-07,
|
|
"loss": 1.0923,
|
|
"mean_token_accuracy": 0.7037202846258879,
|
|
"num_tokens": 673341002.0,
|
|
"step": 8990
|
|
},
|
|
{
|
|
"entropy": 1.1033651810139418,
|
|
"epoch": 2.769418760162797,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 5.261103629229314e-07,
|
|
"loss": 1.0813,
|
|
"mean_token_accuracy": 0.7037397045642138,
|
|
"num_tokens": 673718141.0,
|
|
"step": 8995
|
|
},
|
|
{
|
|
"entropy": 1.0605992011725902,
|
|
"epoch": 2.7709582134644437,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 5.209394087724174e-07,
|
|
"loss": 1.055,
|
|
"mean_token_accuracy": 0.7101302925497294,
|
|
"num_tokens": 674091573.0,
|
|
"step": 9000
|
|
},
|
|
{
|
|
"entropy": 1.0724089531227947,
|
|
"epoch": 2.77249766676609,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 5.157933123532466e-07,
|
|
"loss": 1.0653,
|
|
"mean_token_accuracy": 0.7086140789091587,
|
|
"num_tokens": 674475054.0,
|
|
"step": 9005
|
|
},
|
|
{
|
|
"entropy": 1.1092581523582339,
|
|
"epoch": 2.774037120067736,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 5.106720871604586e-07,
|
|
"loss": 1.1073,
|
|
"mean_token_accuracy": 0.7015041776001454,
|
|
"num_tokens": 674832299.0,
|
|
"step": 9010
|
|
},
|
|
{
|
|
"entropy": 1.0797317519783973,
|
|
"epoch": 2.7755765733693822,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 5.055757466238676e-07,
|
|
"loss": 1.0651,
|
|
"mean_token_accuracy": 0.7046452302485704,
|
|
"num_tokens": 675210195.0,
|
|
"step": 9015
|
|
},
|
|
{
|
|
"entropy": 1.1496307959780097,
|
|
"epoch": 2.7771160266710284,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 5.005043041080327e-07,
|
|
"loss": 1.1425,
|
|
"mean_token_accuracy": 0.6922064602375031,
|
|
"num_tokens": 675587621.0,
|
|
"step": 9020
|
|
},
|
|
{
|
|
"entropy": 1.1083163317292928,
|
|
"epoch": 2.7786554799726746,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 4.954577729122212e-07,
|
|
"loss": 1.1031,
|
|
"mean_token_accuracy": 0.700849587842822,
|
|
"num_tokens": 675974638.0,
|
|
"step": 9025
|
|
},
|
|
{
|
|
"entropy": 1.0742509851232172,
|
|
"epoch": 2.7801949332743208,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 4.904361662703739e-07,
|
|
"loss": 1.0725,
|
|
"mean_token_accuracy": 0.7079987972974777,
|
|
"num_tokens": 676340532.0,
|
|
"step": 9030
|
|
},
|
|
{
|
|
"entropy": 1.0813992872834206,
|
|
"epoch": 2.781734386575967,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 4.854394973510667e-07,
|
|
"loss": 1.0773,
|
|
"mean_token_accuracy": 0.7048488076776266,
|
|
"num_tokens": 676720225.0,
|
|
"step": 9035
|
|
},
|
|
{
|
|
"entropy": 1.0636867800727487,
|
|
"epoch": 2.7832738398776136,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 4.804677792574808e-07,
|
|
"loss": 1.0611,
|
|
"mean_token_accuracy": 0.709589584171772,
|
|
"num_tokens": 677084840.0,
|
|
"step": 9040
|
|
},
|
|
{
|
|
"entropy": 1.063946758955717,
|
|
"epoch": 2.7848132931792597,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 4.755210250273701e-07,
|
|
"loss": 1.0581,
|
|
"mean_token_accuracy": 0.7097185034304857,
|
|
"num_tokens": 677461498.0,
|
|
"step": 9045
|
|
},
|
|
{
|
|
"entropy": 1.0981857057660818,
|
|
"epoch": 2.786352746480906,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 4.7059924763302013e-07,
|
|
"loss": 1.0902,
|
|
"mean_token_accuracy": 0.7031667683273554,
|
|
"num_tokens": 677833469.0,
|
|
"step": 9050
|
|
},
|
|
{
|
|
"entropy": 1.0824573773890733,
|
|
"epoch": 2.787892199782552,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 4.6570245998121654e-07,
|
|
"loss": 1.0777,
|
|
"mean_token_accuracy": 0.7095426443964243,
|
|
"num_tokens": 678192019.0,
|
|
"step": 9055
|
|
},
|
|
{
|
|
"entropy": 1.0899402372539044,
|
|
"epoch": 2.7894316530841987,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 4.6083067491321633e-07,
|
|
"loss": 1.0904,
|
|
"mean_token_accuracy": 0.7029079314321279,
|
|
"num_tokens": 678558585.0,
|
|
"step": 9060
|
|
},
|
|
{
|
|
"entropy": 1.0744083698838949,
|
|
"epoch": 2.790971106385845,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 4.559839052047066e-07,
|
|
"loss": 1.0651,
|
|
"mean_token_accuracy": 0.7065637219697237,
|
|
"num_tokens": 678952996.0,
|
|
"step": 9065
|
|
},
|
|
{
|
|
"entropy": 1.0421586964279412,
|
|
"epoch": 2.792510559687491,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 4.511621635657759e-07,
|
|
"loss": 1.033,
|
|
"mean_token_accuracy": 0.7134201146662236,
|
|
"num_tokens": 679324190.0,
|
|
"step": 9070
|
|
},
|
|
{
|
|
"entropy": 1.1059226881712676,
|
|
"epoch": 2.7940500129891372,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 4.463654626408798e-07,
|
|
"loss": 1.0873,
|
|
"mean_token_accuracy": 0.7038485318422317,
|
|
"num_tokens": 679709577.0,
|
|
"step": 9075
|
|
},
|
|
{
|
|
"entropy": 1.0860208377242089,
|
|
"epoch": 2.7955894662907834,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 4.415938150088073e-07,
|
|
"loss": 1.0794,
|
|
"mean_token_accuracy": 0.7049713090062142,
|
|
"num_tokens": 680098376.0,
|
|
"step": 9080
|
|
},
|
|
{
|
|
"entropy": 1.0759368808940053,
|
|
"epoch": 2.7971289195924296,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 4.368472331826479e-07,
|
|
"loss": 1.0751,
|
|
"mean_token_accuracy": 0.7033807620406151,
|
|
"num_tokens": 680489655.0,
|
|
"step": 9085
|
|
},
|
|
{
|
|
"entropy": 1.075348002463579,
|
|
"epoch": 2.7986683728940758,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 4.321257296097592e-07,
|
|
"loss": 1.0621,
|
|
"mean_token_accuracy": 0.7087483674287796,
|
|
"num_tokens": 680861265.0,
|
|
"step": 9090
|
|
},
|
|
{
|
|
"entropy": 1.1064619544893504,
|
|
"epoch": 2.8002078261957224,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 4.274293166717336e-07,
|
|
"loss": 1.0975,
|
|
"mean_token_accuracy": 0.7025272376835346,
|
|
"num_tokens": 681241367.0,
|
|
"step": 9095
|
|
},
|
|
{
|
|
"entropy": 1.0863706039264798,
|
|
"epoch": 2.8017472794973686,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 4.227580066843684e-07,
|
|
"loss": 1.0707,
|
|
"mean_token_accuracy": 0.7061580020934344,
|
|
"num_tokens": 681622000.0,
|
|
"step": 9100
|
|
},
|
|
{
|
|
"entropy": 1.1229814065620303,
|
|
"epoch": 2.8032867327990147,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 4.1811181189762684e-07,
|
|
"loss": 1.127,
|
|
"mean_token_accuracy": 0.6992808103561401,
|
|
"num_tokens": 681998023.0,
|
|
"step": 9105
|
|
},
|
|
{
|
|
"entropy": 1.1204637141898275,
|
|
"epoch": 2.804826186100661,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 4.1349074449561267e-07,
|
|
"loss": 1.1154,
|
|
"mean_token_accuracy": 0.6982759539037943,
|
|
"num_tokens": 682385386.0,
|
|
"step": 9110
|
|
},
|
|
{
|
|
"entropy": 1.0606722485274076,
|
|
"epoch": 2.806365639402307,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 4.0889481659654006e-07,
|
|
"loss": 1.0535,
|
|
"mean_token_accuracy": 0.711044616252184,
|
|
"num_tokens": 682770218.0,
|
|
"step": 9115
|
|
},
|
|
{
|
|
"entropy": 1.0713387373834848,
|
|
"epoch": 2.8079050927039537,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 4.043240402526916e-07,
|
|
"loss": 1.0577,
|
|
"mean_token_accuracy": 0.7075522273778916,
|
|
"num_tokens": 683149570.0,
|
|
"step": 9120
|
|
},
|
|
{
|
|
"entropy": 1.0740973938256502,
|
|
"epoch": 2.8094445460056,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 3.9977842745039464e-07,
|
|
"loss": 1.0614,
|
|
"mean_token_accuracy": 0.7070597395300865,
|
|
"num_tokens": 683520751.0,
|
|
"step": 9125
|
|
},
|
|
{
|
|
"entropy": 1.0882813472300767,
|
|
"epoch": 2.810983999307246,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 3.9525799010999064e-07,
|
|
"loss": 1.088,
|
|
"mean_token_accuracy": 0.7054922401905059,
|
|
"num_tokens": 683899862.0,
|
|
"step": 9130
|
|
},
|
|
{
|
|
"entropy": 1.1150892047211527,
|
|
"epoch": 2.8125234526088922,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 3.907627400857994e-07,
|
|
"loss": 1.103,
|
|
"mean_token_accuracy": 0.7004376303404569,
|
|
"num_tokens": 684275020.0,
|
|
"step": 9135
|
|
},
|
|
{
|
|
"entropy": 1.0829044301062822,
|
|
"epoch": 2.8140629059105384,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 3.862926891660901e-07,
|
|
"loss": 1.0704,
|
|
"mean_token_accuracy": 0.7066825900226832,
|
|
"num_tokens": 684642492.0,
|
|
"step": 9140
|
|
},
|
|
{
|
|
"entropy": 1.0839938318356872,
|
|
"epoch": 2.8156023592121846,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 3.8184784907304704e-07,
|
|
"loss": 1.07,
|
|
"mean_token_accuracy": 0.7072427023202181,
|
|
"num_tokens": 685007324.0,
|
|
"step": 9145
|
|
},
|
|
{
|
|
"entropy": 1.1097764804959298,
|
|
"epoch": 2.817141812513831,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 3.7742823146274977e-07,
|
|
"loss": 1.0969,
|
|
"mean_token_accuracy": 0.701355904713273,
|
|
"num_tokens": 685370862.0,
|
|
"step": 9150
|
|
},
|
|
{
|
|
"entropy": 1.1225302215665578,
|
|
"epoch": 2.8186812658154774,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 3.730338479251283e-07,
|
|
"loss": 1.1222,
|
|
"mean_token_accuracy": 0.6970809638500214,
|
|
"num_tokens": 685734516.0,
|
|
"step": 9155
|
|
},
|
|
{
|
|
"entropy": 1.0973564708605408,
|
|
"epoch": 2.8202207191171236,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 3.686647099839402e-07,
|
|
"loss": 1.0865,
|
|
"mean_token_accuracy": 0.7027039974927902,
|
|
"num_tokens": 686112446.0,
|
|
"step": 9160
|
|
},
|
|
{
|
|
"entropy": 1.0711197204887868,
|
|
"epoch": 2.8217601724187698,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 3.643208290967415e-07,
|
|
"loss": 1.0632,
|
|
"mean_token_accuracy": 0.7086378984153271,
|
|
"num_tokens": 686482196.0,
|
|
"step": 9165
|
|
},
|
|
{
|
|
"entropy": 1.1112308863550424,
|
|
"epoch": 2.823299625720416,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 3.6000221665485445e-07,
|
|
"loss": 1.1093,
|
|
"mean_token_accuracy": 0.6982701648026705,
|
|
"num_tokens": 686857527.0,
|
|
"step": 9170
|
|
},
|
|
{
|
|
"entropy": 1.0941610429435968,
|
|
"epoch": 2.8248390790220625,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 3.557088839833345e-07,
|
|
"loss": 1.0801,
|
|
"mean_token_accuracy": 0.702389395236969,
|
|
"num_tokens": 687242226.0,
|
|
"step": 9175
|
|
},
|
|
{
|
|
"entropy": 1.0635516757145524,
|
|
"epoch": 2.8263785323237087,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 3.5144084234094544e-07,
|
|
"loss": 1.0552,
|
|
"mean_token_accuracy": 0.7095683190971613,
|
|
"num_tokens": 687610967.0,
|
|
"step": 9180
|
|
},
|
|
{
|
|
"entropy": 1.1062870670109988,
|
|
"epoch": 2.827917985625355,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 3.4719810292013214e-07,
|
|
"loss": 1.0942,
|
|
"mean_token_accuracy": 0.6992207795381546,
|
|
"num_tokens": 687985871.0,
|
|
"step": 9185
|
|
},
|
|
{
|
|
"entropy": 1.1082587013021112,
|
|
"epoch": 2.829457438927001,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 3.429806768469823e-07,
|
|
"loss": 1.1073,
|
|
"mean_token_accuracy": 0.6994328077882528,
|
|
"num_tokens": 688334419.0,
|
|
"step": 9190
|
|
},
|
|
{
|
|
"entropy": 1.0987585870549084,
|
|
"epoch": 2.8309968922286473,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 3.387885751812048e-07,
|
|
"loss": 1.0936,
|
|
"mean_token_accuracy": 0.7042145524173975,
|
|
"num_tokens": 688695542.0,
|
|
"step": 9195
|
|
},
|
|
{
|
|
"entropy": 1.0899001212790609,
|
|
"epoch": 2.8325363455302934,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 3.3462180891609573e-07,
|
|
"loss": 1.0849,
|
|
"mean_token_accuracy": 0.7037851270288229,
|
|
"num_tokens": 689058972.0,
|
|
"step": 9200
|
|
},
|
|
{
|
|
"entropy": 1.0550596602261066,
|
|
"epoch": 2.8340757988319396,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 3.3048038897851576e-07,
|
|
"loss": 1.048,
|
|
"mean_token_accuracy": 0.7121597476303577,
|
|
"num_tokens": 689434895.0,
|
|
"step": 9205
|
|
},
|
|
{
|
|
"entropy": 1.0525223886594177,
|
|
"epoch": 2.835615252133586,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 3.2636432622885627e-07,
|
|
"loss": 1.0405,
|
|
"mean_token_accuracy": 0.7114351458847523,
|
|
"num_tokens": 689814584.0,
|
|
"step": 9210
|
|
},
|
|
{
|
|
"entropy": 1.117156033217907,
|
|
"epoch": 2.8371547054352324,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 3.222736314610098e-07,
|
|
"loss": 1.1048,
|
|
"mean_token_accuracy": 0.6990011800080538,
|
|
"num_tokens": 690186694.0,
|
|
"step": 9215
|
|
},
|
|
{
|
|
"entropy": 1.1056159403175116,
|
|
"epoch": 2.8386941587368786,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 3.1820831540234856e-07,
|
|
"loss": 1.0866,
|
|
"mean_token_accuracy": 0.7033553432673216,
|
|
"num_tokens": 690547805.0,
|
|
"step": 9220
|
|
},
|
|
{
|
|
"entropy": 1.074674123339355,
|
|
"epoch": 2.8402336120385248,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 3.1416838871368925e-07,
|
|
"loss": 1.0626,
|
|
"mean_token_accuracy": 0.7082776438444853,
|
|
"num_tokens": 690925019.0,
|
|
"step": 9225
|
|
},
|
|
{
|
|
"entropy": 1.110180927067995,
|
|
"epoch": 2.841773065340171,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 3.1015386198926856e-07,
|
|
"loss": 1.0934,
|
|
"mean_token_accuracy": 0.7003675043582916,
|
|
"num_tokens": 691311738.0,
|
|
"step": 9230
|
|
},
|
|
{
|
|
"entropy": 1.0937598716467618,
|
|
"epoch": 2.8433125186418176,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 3.0616474575671297e-07,
|
|
"loss": 1.1005,
|
|
"mean_token_accuracy": 0.7012559462338686,
|
|
"num_tokens": 691692572.0,
|
|
"step": 9235
|
|
},
|
|
{
|
|
"entropy": 1.0779551899060607,
|
|
"epoch": 2.8448519719434637,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 3.0220105047701787e-07,
|
|
"loss": 1.0615,
|
|
"mean_token_accuracy": 0.706438597291708,
|
|
"num_tokens": 692070188.0,
|
|
"step": 9240
|
|
},
|
|
{
|
|
"entropy": 1.0998695224523545,
|
|
"epoch": 2.84639142524511,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 2.982627865445109e-07,
|
|
"loss": 1.1014,
|
|
"mean_token_accuracy": 0.7013218883424998,
|
|
"num_tokens": 692448375.0,
|
|
"step": 9245
|
|
},
|
|
{
|
|
"entropy": 1.11143190972507,
|
|
"epoch": 2.847930878546756,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 2.943499642868297e-07,
|
|
"loss": 1.105,
|
|
"mean_token_accuracy": 0.7026957213878632,
|
|
"num_tokens": 692830901.0,
|
|
"step": 9250
|
|
},
|
|
{
|
|
"entropy": 1.1184490606188775,
|
|
"epoch": 2.8494703318484023,
|
|
"grad_norm": 0.65625,
|
|
"learning_rate": 2.904625939648953e-07,
|
|
"loss": 1.1234,
|
|
"mean_token_accuracy": 0.6986414190381766,
|
|
"num_tokens": 693203191.0,
|
|
"step": 9255
|
|
},
|
|
{
|
|
"entropy": 1.0667661979794503,
|
|
"epoch": 2.8510097851500484,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 2.86600685772882e-07,
|
|
"loss": 1.0573,
|
|
"mean_token_accuracy": 0.7118820112198592,
|
|
"num_tokens": 693564285.0,
|
|
"step": 9260
|
|
},
|
|
{
|
|
"entropy": 1.1189139783382416,
|
|
"epoch": 2.8525492384516946,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 2.827642498381955e-07,
|
|
"loss": 1.1117,
|
|
"mean_token_accuracy": 0.6988221053034067,
|
|
"num_tokens": 693944846.0,
|
|
"step": 9265
|
|
},
|
|
{
|
|
"entropy": 1.0952611479908227,
|
|
"epoch": 2.8540886917533412,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 2.7895329622143917e-07,
|
|
"loss": 1.0904,
|
|
"mean_token_accuracy": 0.7030711892992259,
|
|
"num_tokens": 694315859.0,
|
|
"step": 9270
|
|
},
|
|
{
|
|
"entropy": 1.114767324924469,
|
|
"epoch": 2.8556281450549874,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 2.7516783491639666e-07,
|
|
"loss": 1.1166,
|
|
"mean_token_accuracy": 0.6992867670953273,
|
|
"num_tokens": 694669999.0,
|
|
"step": 9275
|
|
},
|
|
{
|
|
"entropy": 1.0777184668928386,
|
|
"epoch": 2.8571675983566336,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 2.714078758499994e-07,
|
|
"loss": 1.0686,
|
|
"mean_token_accuracy": 0.7060581278055906,
|
|
"num_tokens": 695041273.0,
|
|
"step": 9280
|
|
},
|
|
{
|
|
"entropy": 1.1297290083020926,
|
|
"epoch": 2.8587070516582798,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 2.6767342888229907e-07,
|
|
"loss": 1.1185,
|
|
"mean_token_accuracy": 0.696204949915409,
|
|
"num_tokens": 695420714.0,
|
|
"step": 9285
|
|
},
|
|
{
|
|
"entropy": 1.0546232897788286,
|
|
"epoch": 2.8602465049599264,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 2.6396450380644976e-07,
|
|
"loss": 1.0448,
|
|
"mean_token_accuracy": 0.7093728892505169,
|
|
"num_tokens": 695817390.0,
|
|
"step": 9290
|
|
},
|
|
{
|
|
"entropy": 1.0400429025292397,
|
|
"epoch": 2.8617859582615726,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 2.6028111034867466e-07,
|
|
"loss": 1.0384,
|
|
"mean_token_accuracy": 0.7171823922544718,
|
|
"num_tokens": 696176442.0,
|
|
"step": 9295
|
|
},
|
|
{
|
|
"entropy": 1.0730740915983916,
|
|
"epoch": 2.8633254115632187,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 2.566232581682449e-07,
|
|
"loss": 1.0604,
|
|
"mean_token_accuracy": 0.7084676917642355,
|
|
"num_tokens": 696548115.0,
|
|
"step": 9300
|
|
},
|
|
{
|
|
"entropy": 1.1068631008267402,
|
|
"epoch": 2.864864864864865,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 2.5299095685744734e-07,
|
|
"loss": 1.0942,
|
|
"mean_token_accuracy": 0.7028580397367478,
|
|
"num_tokens": 696917616.0,
|
|
"step": 9305
|
|
},
|
|
{
|
|
"entropy": 1.0792828150093556,
|
|
"epoch": 2.866404318166511,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 2.493842159415738e-07,
|
|
"loss": 1.0664,
|
|
"mean_token_accuracy": 0.7053191650658845,
|
|
"num_tokens": 697287285.0,
|
|
"step": 9310
|
|
},
|
|
{
|
|
"entropy": 1.0653324527665973,
|
|
"epoch": 2.8679437714681573,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 2.458030448788784e-07,
|
|
"loss": 1.0565,
|
|
"mean_token_accuracy": 0.7106864672154188,
|
|
"num_tokens": 697656027.0,
|
|
"step": 9315
|
|
},
|
|
{
|
|
"entropy": 1.0567062642425298,
|
|
"epoch": 2.8694832247698034,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 2.422474530605656e-07,
|
|
"loss": 1.0543,
|
|
"mean_token_accuracy": 0.708986384049058,
|
|
"num_tokens": 698039056.0,
|
|
"step": 9320
|
|
},
|
|
{
|
|
"entropy": 1.0895111564546824,
|
|
"epoch": 2.8710226780714496,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 2.387174498107614e-07,
|
|
"loss": 1.0876,
|
|
"mean_token_accuracy": 0.7034507099539041,
|
|
"num_tokens": 698429059.0,
|
|
"step": 9325
|
|
},
|
|
{
|
|
"entropy": 1.0912407897412777,
|
|
"epoch": 2.8725621313730962,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 2.352130443864864e-07,
|
|
"loss": 1.0846,
|
|
"mean_token_accuracy": 0.7038904525339603,
|
|
"num_tokens": 698790766.0,
|
|
"step": 9330
|
|
},
|
|
{
|
|
"entropy": 1.1237780943512916,
|
|
"epoch": 2.8741015846747424,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 2.3173424597763615e-07,
|
|
"loss": 1.119,
|
|
"mean_token_accuracy": 0.7000392712652683,
|
|
"num_tokens": 699153814.0,
|
|
"step": 9335
|
|
},
|
|
{
|
|
"entropy": 1.0693886332213878,
|
|
"epoch": 2.8756410379763886,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 2.2828106370695325e-07,
|
|
"loss": 1.0688,
|
|
"mean_token_accuracy": 0.7103500980883837,
|
|
"num_tokens": 699535023.0,
|
|
"step": 9340
|
|
},
|
|
{
|
|
"entropy": 1.0618276856839657,
|
|
"epoch": 2.8771804912780348,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 2.2485350663000727e-07,
|
|
"loss": 1.0468,
|
|
"mean_token_accuracy": 0.7089301969856023,
|
|
"num_tokens": 699903989.0,
|
|
"step": 9345
|
|
},
|
|
{
|
|
"entropy": 1.114889844879508,
|
|
"epoch": 2.8787199445796814,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 2.2145158373516606e-07,
|
|
"loss": 1.1144,
|
|
"mean_token_accuracy": 0.6969541743397712,
|
|
"num_tokens": 700283872.0,
|
|
"step": 9350
|
|
},
|
|
{
|
|
"entropy": 1.089511461928487,
|
|
"epoch": 2.8802593978813276,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 2.1807530394357457e-07,
|
|
"loss": 1.0836,
|
|
"mean_token_accuracy": 0.704843320697546,
|
|
"num_tokens": 700663993.0,
|
|
"step": 9355
|
|
},
|
|
{
|
|
"entropy": 1.0660556845366955,
|
|
"epoch": 2.8817988511829737,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 2.1472467610913482e-07,
|
|
"loss": 1.067,
|
|
"mean_token_accuracy": 0.7102161169052124,
|
|
"num_tokens": 701042411.0,
|
|
"step": 9360
|
|
},
|
|
{
|
|
"entropy": 1.1050926432013513,
|
|
"epoch": 2.88333830448462,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 2.1139970901847607e-07,
|
|
"loss": 1.0875,
|
|
"mean_token_accuracy": 0.7001321829855442,
|
|
"num_tokens": 701405757.0,
|
|
"step": 9365
|
|
},
|
|
{
|
|
"entropy": 1.1003071704879404,
|
|
"epoch": 2.884877757786266,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 2.0810041139093906e-07,
|
|
"loss": 1.0874,
|
|
"mean_token_accuracy": 0.7028491389006376,
|
|
"num_tokens": 701768518.0,
|
|
"step": 9370
|
|
},
|
|
{
|
|
"entropy": 1.0898928321897983,
|
|
"epoch": 2.8864172110879123,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 2.0482679187854405e-07,
|
|
"loss": 1.07,
|
|
"mean_token_accuracy": 0.7040273543447256,
|
|
"num_tokens": 702157271.0,
|
|
"step": 9375
|
|
},
|
|
{
|
|
"entropy": 1.0512994762510062,
|
|
"epoch": 2.8879566643895584,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 2.0157885906597952e-07,
|
|
"loss": 1.0386,
|
|
"mean_token_accuracy": 0.7128573216497898,
|
|
"num_tokens": 702522932.0,
|
|
"step": 9380
|
|
},
|
|
{
|
|
"entropy": 1.1240558356046677,
|
|
"epoch": 2.889496117691205,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9835662147057012e-07,
|
|
"loss": 1.1154,
|
|
"mean_token_accuracy": 0.6990032196044922,
|
|
"num_tokens": 702894823.0,
|
|
"step": 9385
|
|
},
|
|
{
|
|
"entropy": 1.1239559035748243,
|
|
"epoch": 2.8910355709928512,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.9516008754225658e-07,
|
|
"loss": 1.1259,
|
|
"mean_token_accuracy": 0.7001063216477632,
|
|
"num_tokens": 703274663.0,
|
|
"step": 9390
|
|
},
|
|
{
|
|
"entropy": 1.066321785748005,
|
|
"epoch": 2.8925750242944974,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.91989265663578e-07,
|
|
"loss": 1.0542,
|
|
"mean_token_accuracy": 0.7084260832518339,
|
|
"num_tokens": 703628954.0,
|
|
"step": 9395
|
|
},
|
|
{
|
|
"entropy": 1.0703343912959098,
|
|
"epoch": 2.8941144775961436,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 1.8884416414964524e-07,
|
|
"loss": 1.0563,
|
|
"mean_token_accuracy": 0.7068886440247297,
|
|
"num_tokens": 703993484.0,
|
|
"step": 9400
|
|
},
|
|
{
|
|
"entropy": 1.0785534301772715,
|
|
"epoch": 2.8956539308977898,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.857247912481197e-07,
|
|
"loss": 1.0682,
|
|
"mean_token_accuracy": 0.7054412867873907,
|
|
"num_tokens": 704367394.0,
|
|
"step": 9405
|
|
},
|
|
{
|
|
"entropy": 1.0687660839408637,
|
|
"epoch": 2.8971933841994364,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.826311551391924e-07,
|
|
"loss": 1.0521,
|
|
"mean_token_accuracy": 0.7089894142001867,
|
|
"num_tokens": 704759039.0,
|
|
"step": 9410
|
|
},
|
|
{
|
|
"entropy": 1.0824022317305206,
|
|
"epoch": 2.8987328375010826,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.79563263935566e-07,
|
|
"loss": 1.0702,
|
|
"mean_token_accuracy": 0.7090028896927834,
|
|
"num_tokens": 705131266.0,
|
|
"step": 9415
|
|
},
|
|
{
|
|
"entropy": 1.0676105875521897,
|
|
"epoch": 2.9002722908027287,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.7652112568242398e-07,
|
|
"loss": 1.0576,
|
|
"mean_token_accuracy": 0.705405454710126,
|
|
"num_tokens": 705529731.0,
|
|
"step": 9420
|
|
},
|
|
{
|
|
"entropy": 1.058596447855234,
|
|
"epoch": 2.901811744104375,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.735047483574215e-07,
|
|
"loss": 1.0524,
|
|
"mean_token_accuracy": 0.7111830975860357,
|
|
"num_tokens": 705904054.0,
|
|
"step": 9425
|
|
},
|
|
{
|
|
"entropy": 1.1051165960729121,
|
|
"epoch": 2.903351197406021,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.7051413987065668e-07,
|
|
"loss": 1.0903,
|
|
"mean_token_accuracy": 0.7028014771640301,
|
|
"num_tokens": 706283564.0,
|
|
"step": 9430
|
|
},
|
|
{
|
|
"entropy": 1.1506223361939192,
|
|
"epoch": 2.9048906507076673,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.6754930806465063e-07,
|
|
"loss": 1.1517,
|
|
"mean_token_accuracy": 0.6934065848588944,
|
|
"num_tokens": 706654819.0,
|
|
"step": 9435
|
|
},
|
|
{
|
|
"entropy": 1.0656612049788237,
|
|
"epoch": 2.9064301040093135,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.6461026071433074e-07,
|
|
"loss": 1.0491,
|
|
"mean_token_accuracy": 0.7100828938186169,
|
|
"num_tokens": 707032261.0,
|
|
"step": 9440
|
|
},
|
|
{
|
|
"entropy": 1.1146781235933303,
|
|
"epoch": 2.90796955731096,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.6169700552700284e-07,
|
|
"loss": 1.1095,
|
|
"mean_token_accuracy": 0.6988375999033452,
|
|
"num_tokens": 707404535.0,
|
|
"step": 9445
|
|
},
|
|
{
|
|
"entropy": 1.0917428011074661,
|
|
"epoch": 2.9095090106126063,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.5880955014234144e-07,
|
|
"loss": 1.0853,
|
|
"mean_token_accuracy": 0.7065126363188028,
|
|
"num_tokens": 707782184.0,
|
|
"step": 9450
|
|
},
|
|
{
|
|
"entropy": 1.111644352041185,
|
|
"epoch": 2.9110484639142524,
|
|
"grad_norm": 0.6328125,
|
|
"learning_rate": 1.5594790213236288e-07,
|
|
"loss": 1.1002,
|
|
"mean_token_accuracy": 0.7012423541396856,
|
|
"num_tokens": 708166886.0,
|
|
"step": 9455
|
|
},
|
|
{
|
|
"entropy": 1.1069736605510117,
|
|
"epoch": 2.9125879172158986,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.5311206900140095e-07,
|
|
"loss": 1.0914,
|
|
"mean_token_accuracy": 0.7026559807360172,
|
|
"num_tokens": 708545598.0,
|
|
"step": 9460
|
|
},
|
|
{
|
|
"entropy": 1.0318492030724884,
|
|
"epoch": 2.9141273705175452,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.5030205818610255e-07,
|
|
"loss": 1.0223,
|
|
"mean_token_accuracy": 0.713635815307498,
|
|
"num_tokens": 708911964.0,
|
|
"step": 9465
|
|
},
|
|
{
|
|
"entropy": 1.1140786729753018,
|
|
"epoch": 2.9156668238191914,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 1.475178770553909e-07,
|
|
"loss": 1.1204,
|
|
"mean_token_accuracy": 0.6981513611972332,
|
|
"num_tokens": 709293309.0,
|
|
"step": 9470
|
|
},
|
|
{
|
|
"entropy": 1.123400690406561,
|
|
"epoch": 2.9172062771208376,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 1.4475953291045674e-07,
|
|
"loss": 1.1069,
|
|
"mean_token_accuracy": 0.6971768919378519,
|
|
"num_tokens": 709681191.0,
|
|
"step": 9475
|
|
},
|
|
{
|
|
"entropy": 1.152566420286894,
|
|
"epoch": 2.9187457304224838,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.4202703298473508e-07,
|
|
"loss": 1.1427,
|
|
"mean_token_accuracy": 0.6936543196439743,
|
|
"num_tokens": 710054910.0,
|
|
"step": 9480
|
|
},
|
|
{
|
|
"entropy": 1.082442194968462,
|
|
"epoch": 2.92028518372413,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 1.3932038444389063e-07,
|
|
"loss": 1.068,
|
|
"mean_token_accuracy": 0.7049927357584238,
|
|
"num_tokens": 710435527.0,
|
|
"step": 9485
|
|
},
|
|
{
|
|
"entropy": 1.0420925009995698,
|
|
"epoch": 2.921824637025776,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 1.366395943857912e-07,
|
|
"loss": 1.0402,
|
|
"mean_token_accuracy": 0.7135931387543678,
|
|
"num_tokens": 710817064.0,
|
|
"step": 9490
|
|
},
|
|
{
|
|
"entropy": 1.1026225442066788,
|
|
"epoch": 2.9233640903274223,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.3398466984049786e-07,
|
|
"loss": 1.1007,
|
|
"mean_token_accuracy": 0.7009884677827358,
|
|
"num_tokens": 711204153.0,
|
|
"step": 9495
|
|
},
|
|
{
|
|
"entropy": 1.1171777565032244,
|
|
"epoch": 2.9249035436290685,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 1.313556177702402e-07,
|
|
"loss": 1.1104,
|
|
"mean_token_accuracy": 0.6970661029219627,
|
|
"num_tokens": 711585587.0,
|
|
"step": 9500
|
|
},
|
|
{
|
|
"entropy": 1.1038591895252465,
|
|
"epoch": 2.926442996930715,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 1.287524450694011e-07,
|
|
"loss": 1.0928,
|
|
"mean_token_accuracy": 0.7016601230949163,
|
|
"num_tokens": 711954203.0,
|
|
"step": 9505
|
|
},
|
|
{
|
|
"entropy": 1.0783597964793443,
|
|
"epoch": 2.9279824502323613,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.261751585644977e-07,
|
|
"loss": 1.0672,
|
|
"mean_token_accuracy": 0.709634379670024,
|
|
"num_tokens": 712326797.0,
|
|
"step": 9510
|
|
},
|
|
{
|
|
"entropy": 1.0995419716462493,
|
|
"epoch": 2.9295219035340074,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.2362376501416251e-07,
|
|
"loss": 1.0731,
|
|
"mean_token_accuracy": 0.7023149251937866,
|
|
"num_tokens": 712694824.0,
|
|
"step": 9515
|
|
},
|
|
{
|
|
"entropy": 1.0378732623532414,
|
|
"epoch": 2.9310613568356536,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 1.2109827110912687e-07,
|
|
"loss": 1.015,
|
|
"mean_token_accuracy": 0.7163034208118916,
|
|
"num_tokens": 713082425.0,
|
|
"step": 9520
|
|
},
|
|
{
|
|
"entropy": 1.105372105538845,
|
|
"epoch": 2.9326008101373002,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.1859868347220749e-07,
|
|
"loss": 1.1029,
|
|
"mean_token_accuracy": 0.7024416211992502,
|
|
"num_tokens": 713450263.0,
|
|
"step": 9525
|
|
},
|
|
{
|
|
"entropy": 1.0915406990796328,
|
|
"epoch": 2.9341402634389464,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 1.161250086582777e-07,
|
|
"loss": 1.0746,
|
|
"mean_token_accuracy": 0.7027241876348853,
|
|
"num_tokens": 713809847.0,
|
|
"step": 9530
|
|
},
|
|
{
|
|
"entropy": 1.0774108530953526,
|
|
"epoch": 2.9356797167405926,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.1367725315426403e-07,
|
|
"loss": 1.0684,
|
|
"mean_token_accuracy": 0.7067596852779389,
|
|
"num_tokens": 714180997.0,
|
|
"step": 9535
|
|
},
|
|
{
|
|
"entropy": 1.0914515698328615,
|
|
"epoch": 2.9372191700422388,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.1125542337911854e-07,
|
|
"loss": 1.0903,
|
|
"mean_token_accuracy": 0.7045343466103077,
|
|
"num_tokens": 714553161.0,
|
|
"step": 9540
|
|
},
|
|
{
|
|
"entropy": 1.0932727679610252,
|
|
"epoch": 2.938758623343885,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 1.0885952568380764e-07,
|
|
"loss": 1.0918,
|
|
"mean_token_accuracy": 0.7037795372307301,
|
|
"num_tokens": 714918014.0,
|
|
"step": 9545
|
|
},
|
|
{
|
|
"entropy": 1.0544537369161844,
|
|
"epoch": 2.940298076645531,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 1.0648956635129548e-07,
|
|
"loss": 1.0497,
|
|
"mean_token_accuracy": 0.7106095593422651,
|
|
"num_tokens": 715303422.0,
|
|
"step": 9550
|
|
},
|
|
{
|
|
"entropy": 1.0614672761410475,
|
|
"epoch": 2.9418375299471773,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.0414555159652062e-07,
|
|
"loss": 1.0577,
|
|
"mean_token_accuracy": 0.7088613854721189,
|
|
"num_tokens": 715701033.0,
|
|
"step": 9555
|
|
},
|
|
{
|
|
"entropy": 1.1179406041279436,
|
|
"epoch": 2.943376983248824,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.018274875663916e-07,
|
|
"loss": 1.1207,
|
|
"mean_token_accuracy": 0.6993728913366795,
|
|
"num_tokens": 716079756.0,
|
|
"step": 9560
|
|
},
|
|
{
|
|
"entropy": 1.10177406296134,
|
|
"epoch": 2.94491643655047,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 9.953538033975918e-08,
|
|
"loss": 1.0987,
|
|
"mean_token_accuracy": 0.7022601023316384,
|
|
"num_tokens": 716453982.0,
|
|
"step": 9565
|
|
},
|
|
{
|
|
"entropy": 1.0987323261797428,
|
|
"epoch": 2.9464558898521163,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 9.726923592740855e-08,
|
|
"loss": 1.0948,
|
|
"mean_token_accuracy": 0.7022291176021099,
|
|
"num_tokens": 716814091.0,
|
|
"step": 9570
|
|
},
|
|
{
|
|
"entropy": 1.100754882954061,
|
|
"epoch": 2.9479953431537624,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 9.50290602720394e-08,
|
|
"loss": 1.0911,
|
|
"mean_token_accuracy": 0.700905929133296,
|
|
"num_tokens": 717203340.0,
|
|
"step": 9575
|
|
},
|
|
{
|
|
"entropy": 1.069315160624683,
|
|
"epoch": 2.9495347964554086,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 9.281485924825029e-08,
|
|
"loss": 1.0682,
|
|
"mean_token_accuracy": 0.7072306253015995,
|
|
"num_tokens": 717571854.0,
|
|
"step": 9580
|
|
},
|
|
{
|
|
"entropy": 1.0810949860140682,
|
|
"epoch": 2.9510742497570552,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 9.062663866252541e-08,
|
|
"loss": 1.0687,
|
|
"mean_token_accuracy": 0.7076021049171686,
|
|
"num_tokens": 717959333.0,
|
|
"step": 9585
|
|
},
|
|
{
|
|
"entropy": 1.095454989001155,
|
|
"epoch": 2.9526137030587014,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 8.8464404253219e-08,
|
|
"loss": 1.0874,
|
|
"mean_token_accuracy": 0.7012773253023624,
|
|
"num_tokens": 718328058.0,
|
|
"step": 9590
|
|
},
|
|
{
|
|
"entropy": 1.1148788955062627,
|
|
"epoch": 2.9541531563603476,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 8.63281616905376e-08,
|
|
"loss": 1.1114,
|
|
"mean_token_accuracy": 0.6984370086342097,
|
|
"num_tokens": 718713556.0,
|
|
"step": 9595
|
|
},
|
|
{
|
|
"entropy": 1.0897041935473681,
|
|
"epoch": 2.9556926096619938,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 8.421791657652889e-08,
|
|
"loss": 1.0805,
|
|
"mean_token_accuracy": 0.7050759967416524,
|
|
"num_tokens": 719089426.0,
|
|
"step": 9600
|
|
},
|
|
{
|
|
"entropy": 1.077144232392311,
|
|
"epoch": 2.95723206296364,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 8.213367444506515e-08,
|
|
"loss": 1.0734,
|
|
"mean_token_accuracy": 0.7067074563354254,
|
|
"num_tokens": 719464220.0,
|
|
"step": 9605
|
|
},
|
|
{
|
|
"entropy": 1.1065091947093606,
|
|
"epoch": 2.958771516265286,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 8.00754407618276e-08,
|
|
"loss": 1.0943,
|
|
"mean_token_accuracy": 0.7032693870365619,
|
|
"num_tokens": 719840322.0,
|
|
"step": 9610
|
|
},
|
|
{
|
|
"entropy": 1.0955530542880296,
|
|
"epoch": 2.9603109695669323,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 7.804322092429429e-08,
|
|
"loss": 1.0801,
|
|
"mean_token_accuracy": 0.7005868922919035,
|
|
"num_tokens": 720219512.0,
|
|
"step": 9615
|
|
},
|
|
{
|
|
"entropy": 1.1133868474513293,
|
|
"epoch": 2.961850422868579,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 7.603702026172443e-08,
|
|
"loss": 1.1069,
|
|
"mean_token_accuracy": 0.6959968645125627,
|
|
"num_tokens": 720602892.0,
|
|
"step": 9620
|
|
},
|
|
{
|
|
"entropy": 1.0739076670259238,
|
|
"epoch": 2.963389876170225,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 7.405684403514635e-08,
|
|
"loss": 1.0551,
|
|
"mean_token_accuracy": 0.7087640445679426,
|
|
"num_tokens": 720976506.0,
|
|
"step": 9625
|
|
},
|
|
{
|
|
"entropy": 1.0677341170608998,
|
|
"epoch": 2.9649293294718713,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 7.210269743734067e-08,
|
|
"loss": 1.0618,
|
|
"mean_token_accuracy": 0.7061128184199333,
|
|
"num_tokens": 721349117.0,
|
|
"step": 9630
|
|
},
|
|
{
|
|
"entropy": 1.1364609505981207,
|
|
"epoch": 2.9664687827735174,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 7.01745855928293e-08,
|
|
"loss": 1.1316,
|
|
"mean_token_accuracy": 0.6963102366775274,
|
|
"num_tokens": 721727834.0,
|
|
"step": 9635
|
|
},
|
|
{
|
|
"entropy": 1.1013156514614821,
|
|
"epoch": 2.968008236075164,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 6.827251355786102e-08,
|
|
"loss": 1.0926,
|
|
"mean_token_accuracy": 0.7022101733833551,
|
|
"num_tokens": 722117839.0,
|
|
"step": 9640
|
|
},
|
|
{
|
|
"entropy": 1.0707277633249759,
|
|
"epoch": 2.9695476893768102,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 6.639648632039697e-08,
|
|
"loss": 1.0697,
|
|
"mean_token_accuracy": 0.7081199061125517,
|
|
"num_tokens": 722501435.0,
|
|
"step": 9645
|
|
},
|
|
{
|
|
"entropy": 1.1094145514070988,
|
|
"epoch": 2.9710871426784564,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 6.454650880010182e-08,
|
|
"loss": 1.103,
|
|
"mean_token_accuracy": 0.6991300031542778,
|
|
"num_tokens": 722855642.0,
|
|
"step": 9650
|
|
},
|
|
{
|
|
"entropy": 1.0935522139072418,
|
|
"epoch": 2.9726265959801026,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 6.27225858483238e-08,
|
|
"loss": 1.0882,
|
|
"mean_token_accuracy": 0.70415218770504,
|
|
"num_tokens": 723228685.0,
|
|
"step": 9655
|
|
},
|
|
{
|
|
"entropy": 1.0837059002369642,
|
|
"epoch": 2.9741660492817488,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 6.092472224808909e-08,
|
|
"loss": 1.07,
|
|
"mean_token_accuracy": 0.7059451811015606,
|
|
"num_tokens": 723610147.0,
|
|
"step": 9660
|
|
},
|
|
{
|
|
"entropy": 1.0535811826586723,
|
|
"epoch": 2.975705502583395,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 5.915292271408524e-08,
|
|
"loss": 1.0391,
|
|
"mean_token_accuracy": 0.7123360238969326,
|
|
"num_tokens": 723986769.0,
|
|
"step": 9665
|
|
},
|
|
{
|
|
"entropy": 1.1292795658111572,
|
|
"epoch": 2.977244955885041,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 5.7407191892651095e-08,
|
|
"loss": 1.1327,
|
|
"mean_token_accuracy": 0.6973295573145151,
|
|
"num_tokens": 724358201.0,
|
|
"step": 9670
|
|
},
|
|
{
|
|
"entropy": 1.117397471703589,
|
|
"epoch": 2.9787844091866877,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 5.568753436176022e-08,
|
|
"loss": 1.0928,
|
|
"mean_token_accuracy": 0.7012567259371281,
|
|
"num_tokens": 724741113.0,
|
|
"step": 9675
|
|
},
|
|
{
|
|
"entropy": 1.0929545629769564,
|
|
"epoch": 2.980323862488334,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 5.399395463101531e-08,
|
|
"loss": 1.0774,
|
|
"mean_token_accuracy": 0.7047962984070182,
|
|
"num_tokens": 725112605.0,
|
|
"step": 9680
|
|
},
|
|
{
|
|
"entropy": 1.0630676444619893,
|
|
"epoch": 2.98186331578998,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 5.232645714163265e-08,
|
|
"loss": 1.0501,
|
|
"mean_token_accuracy": 0.7106514770537615,
|
|
"num_tokens": 725494250.0,
|
|
"step": 9685
|
|
},
|
|
{
|
|
"entropy": 1.0875896651297807,
|
|
"epoch": 2.9834027690916263,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 5.068504626642767e-08,
|
|
"loss": 1.0764,
|
|
"mean_token_accuracy": 0.7067676920443773,
|
|
"num_tokens": 725872156.0,
|
|
"step": 9690
|
|
},
|
|
{
|
|
"entropy": 1.078575672954321,
|
|
"epoch": 2.9849422223932724,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 4.906972630981055e-08,
|
|
"loss": 1.0799,
|
|
"mean_token_accuracy": 0.7070812936872244,
|
|
"num_tokens": 726252168.0,
|
|
"step": 9695
|
|
},
|
|
{
|
|
"entropy": 1.0930291138589383,
|
|
"epoch": 2.986481675694919,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 4.748050150776951e-08,
|
|
"loss": 1.0777,
|
|
"mean_token_accuracy": 0.7035938873887062,
|
|
"num_tokens": 726612277.0,
|
|
"step": 9700
|
|
},
|
|
{
|
|
"entropy": 1.1055693438276648,
|
|
"epoch": 2.9880211289965652,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 4.5917376027861945e-08,
|
|
"loss": 1.105,
|
|
"mean_token_accuracy": 0.7023083992302418,
|
|
"num_tokens": 726984062.0,
|
|
"step": 9705
|
|
},
|
|
{
|
|
"entropy": 1.0787129251286387,
|
|
"epoch": 2.9895605822982114,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 4.438035396920004e-08,
|
|
"loss": 1.0742,
|
|
"mean_token_accuracy": 0.7080232869833708,
|
|
"num_tokens": 727360613.0,
|
|
"step": 9710
|
|
},
|
|
{
|
|
"entropy": 1.0855363491922616,
|
|
"epoch": 2.9911000355998576,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 4.2869439362446254e-08,
|
|
"loss": 1.0849,
|
|
"mean_token_accuracy": 0.7050616122782231,
|
|
"num_tokens": 727745439.0,
|
|
"step": 9715
|
|
},
|
|
{
|
|
"entropy": 1.087034145742655,
|
|
"epoch": 2.9926394889015038,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 4.138463616979893e-08,
|
|
"loss": 1.0798,
|
|
"mean_token_accuracy": 0.7041598346084357,
|
|
"num_tokens": 728119411.0,
|
|
"step": 9720
|
|
},
|
|
{
|
|
"entropy": 1.116986507549882,
|
|
"epoch": 2.99417894220315,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 3.9925948284980086e-08,
|
|
"loss": 1.1144,
|
|
"mean_token_accuracy": 0.69991964250803,
|
|
"num_tokens": 728489432.0,
|
|
"step": 9725
|
|
},
|
|
{
|
|
"entropy": 1.0691238172352313,
|
|
"epoch": 2.995718395504796,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 3.849337953322874e-08,
|
|
"loss": 1.0688,
|
|
"mean_token_accuracy": 0.7067211583256722,
|
|
"num_tokens": 728847997.0,
|
|
"step": 9730
|
|
},
|
|
{
|
|
"entropy": 1.0973684798926115,
|
|
"epoch": 2.9972578488064427,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 3.7086933671290904e-08,
|
|
"loss": 1.0926,
|
|
"mean_token_accuracy": 0.7042433958500623,
|
|
"num_tokens": 729237941.0,
|
|
"step": 9735
|
|
},
|
|
{
|
|
"entropy": 1.0921970181167127,
|
|
"epoch": 2.998797302108089,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 3.5706614387404084e-08,
|
|
"loss": 1.0867,
|
|
"mean_token_accuracy": 0.7056788187474012,
|
|
"num_tokens": 729615222.0,
|
|
"step": 9740
|
|
},
|
|
{
|
|
"entropy": 1.090445844041314,
|
|
"epoch": 3.0003078906603293,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 3.435242530129723e-08,
|
|
"loss": 1.0781,
|
|
"mean_token_accuracy": 0.6998650499969531,
|
|
"num_tokens": 729947210.0,
|
|
"step": 9745
|
|
},
|
|
{
|
|
"entropy": 1.074102138541639,
|
|
"epoch": 3.0018473439619755,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 3.3024369964171907e-08,
|
|
"loss": 1.0716,
|
|
"mean_token_accuracy": 0.7076009098440409,
|
|
"num_tokens": 730321761.0,
|
|
"step": 9750
|
|
},
|
|
{
|
|
"entropy": 1.096044022589922,
|
|
"epoch": 3.0033867972636217,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 3.172245185869893e-08,
|
|
"loss": 1.098,
|
|
"mean_token_accuracy": 0.7021739451214671,
|
|
"num_tokens": 730697168.0,
|
|
"step": 9755
|
|
},
|
|
{
|
|
"entropy": 1.1029307190328836,
|
|
"epoch": 3.004926250565268,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 3.044667439900728e-08,
|
|
"loss": 1.0936,
|
|
"mean_token_accuracy": 0.6989955767989159,
|
|
"num_tokens": 731075518.0,
|
|
"step": 9760
|
|
},
|
|
{
|
|
"entropy": 1.0833124034106731,
|
|
"epoch": 3.0064657038669145,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 2.9197040930674102e-08,
|
|
"loss": 1.0766,
|
|
"mean_token_accuracy": 0.7037233162671328,
|
|
"num_tokens": 731449754.0,
|
|
"step": 9765
|
|
},
|
|
{
|
|
"entropy": 1.1167046684771775,
|
|
"epoch": 3.0080051571685607,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 2.7973554730716947e-08,
|
|
"loss": 1.0963,
|
|
"mean_token_accuracy": 0.6994149543344974,
|
|
"num_tokens": 731823577.0,
|
|
"step": 9770
|
|
},
|
|
{
|
|
"entropy": 1.1055131705477834,
|
|
"epoch": 3.009544610470207,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 2.677621900758709e-08,
|
|
"loss": 1.0998,
|
|
"mean_token_accuracy": 0.7012475825846195,
|
|
"num_tokens": 732190840.0,
|
|
"step": 9775
|
|
},
|
|
{
|
|
"entropy": 1.1481240652501583,
|
|
"epoch": 3.011084063771853,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 2.5605036901156233e-08,
|
|
"loss": 1.1355,
|
|
"mean_token_accuracy": 0.6938953299075366,
|
|
"num_tokens": 732571042.0,
|
|
"step": 9780
|
|
},
|
|
{
|
|
"entropy": 1.1082572732120752,
|
|
"epoch": 3.012623517073499,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 2.4460011482713153e-08,
|
|
"loss": 1.0872,
|
|
"mean_token_accuracy": 0.7022128384560347,
|
|
"num_tokens": 732952777.0,
|
|
"step": 9785
|
|
},
|
|
{
|
|
"entropy": 1.0775216864421964,
|
|
"epoch": 3.0141629703751454,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 2.334114575495483e-08,
|
|
"loss": 1.06,
|
|
"mean_token_accuracy": 0.7055583067238331,
|
|
"num_tokens": 733310528.0,
|
|
"step": 9790
|
|
},
|
|
{
|
|
"entropy": 1.094755370169878,
|
|
"epoch": 3.015702423676792,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 2.2248442651975345e-08,
|
|
"loss": 1.0877,
|
|
"mean_token_accuracy": 0.7043863963335752,
|
|
"num_tokens": 733689626.0,
|
|
"step": 9795
|
|
},
|
|
{
|
|
"entropy": 1.1115683114156127,
|
|
"epoch": 3.017241876978438,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 2.118190503926143e-08,
|
|
"loss": 1.1072,
|
|
"mean_token_accuracy": 0.7014489304274321,
|
|
"num_tokens": 734068267.0,
|
|
"step": 9800
|
|
},
|
|
{
|
|
"entropy": 1.059213637560606,
|
|
"epoch": 3.0187813302800843,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 2.01415357136836e-08,
|
|
"loss": 1.0578,
|
|
"mean_token_accuracy": 0.711485032364726,
|
|
"num_tokens": 734442428.0,
|
|
"step": 9805
|
|
},
|
|
{
|
|
"entropy": 1.083645996823907,
|
|
"epoch": 3.0203207835817305,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.9127337403489486e-08,
|
|
"loss": 1.0778,
|
|
"mean_token_accuracy": 0.7058747939765453,
|
|
"num_tokens": 734821756.0,
|
|
"step": 9810
|
|
},
|
|
{
|
|
"entropy": 1.0984794855117799,
|
|
"epoch": 3.0218602368833767,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.8139312768294946e-08,
|
|
"loss": 1.0941,
|
|
"mean_token_accuracy": 0.7022964309900999,
|
|
"num_tokens": 735205655.0,
|
|
"step": 9815
|
|
},
|
|
{
|
|
"entropy": 1.0963041987270117,
|
|
"epoch": 3.023399690185023,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.7177464399080746e-08,
|
|
"loss": 1.095,
|
|
"mean_token_accuracy": 0.7040230691432953,
|
|
"num_tokens": 735580808.0,
|
|
"step": 9820
|
|
},
|
|
{
|
|
"entropy": 1.0826556760817767,
|
|
"epoch": 3.0249391434866695,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 1.6241794818180333e-08,
|
|
"loss": 1.0719,
|
|
"mean_token_accuracy": 0.7066343128681183,
|
|
"num_tokens": 735959544.0,
|
|
"step": 9825
|
|
},
|
|
{
|
|
"entropy": 1.1167619034647942,
|
|
"epoch": 3.0264785967883157,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 1.5332306479279858e-08,
|
|
"loss": 1.1078,
|
|
"mean_token_accuracy": 0.697485838457942,
|
|
"num_tokens": 736338556.0,
|
|
"step": 9830
|
|
},
|
|
{
|
|
"entropy": 1.0701114274561405,
|
|
"epoch": 3.028018050089962,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.4449001767404824e-08,
|
|
"loss": 1.0548,
|
|
"mean_token_accuracy": 0.7049445077776909,
|
|
"num_tokens": 736715537.0,
|
|
"step": 9835
|
|
},
|
|
{
|
|
"entropy": 1.0990862406790256,
|
|
"epoch": 3.029557503391608,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.3591882998920113e-08,
|
|
"loss": 1.0915,
|
|
"mean_token_accuracy": 0.7037747349590063,
|
|
"num_tokens": 737099307.0,
|
|
"step": 9840
|
|
},
|
|
{
|
|
"entropy": 1.0796832548454405,
|
|
"epoch": 3.031096956693254,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 1.276095242151998e-08,
|
|
"loss": 1.0804,
|
|
"mean_token_accuracy": 0.7074272442609072,
|
|
"num_tokens": 737472010.0,
|
|
"step": 9845
|
|
},
|
|
{
|
|
"entropy": 1.0647327981889247,
|
|
"epoch": 3.0326364099949004,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 1.1956212214221385e-08,
|
|
"loss": 1.0489,
|
|
"mean_token_accuracy": 0.7093115296214819,
|
|
"num_tokens": 737844283.0,
|
|
"step": 9850
|
|
},
|
|
{
|
|
"entropy": 1.079849499836564,
|
|
"epoch": 3.034175863296547,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 1.1177664487362905e-08,
|
|
"loss": 1.0773,
|
|
"mean_token_accuracy": 0.7048049360513687,
|
|
"num_tokens": 738211032.0,
|
|
"step": 9855
|
|
},
|
|
{
|
|
"entropy": 1.10904728975147,
|
|
"epoch": 3.035715316598193,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 1.042531128259583e-08,
|
|
"loss": 1.0891,
|
|
"mean_token_accuracy": 0.6987653482705355,
|
|
"num_tokens": 738582179.0,
|
|
"step": 9860
|
|
},
|
|
{
|
|
"entropy": 1.1166222389787435,
|
|
"epoch": 3.0372547698998393,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 9.699154572877511e-09,
|
|
"loss": 1.1166,
|
|
"mean_token_accuracy": 0.7001314748078584,
|
|
"num_tokens": 738965840.0,
|
|
"step": 9865
|
|
},
|
|
{
|
|
"entropy": 1.073373918607831,
|
|
"epoch": 3.0387942232014855,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 8.999196262469146e-09,
|
|
"loss": 1.067,
|
|
"mean_token_accuracy": 0.7045288480818271,
|
|
"num_tokens": 739339067.0,
|
|
"step": 9870
|
|
},
|
|
{
|
|
"entropy": 1.1023689296096564,
|
|
"epoch": 3.0403336765031317,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 8.325438186931323e-09,
|
|
"loss": 1.093,
|
|
"mean_token_accuracy": 0.7022350579500198,
|
|
"num_tokens": 739719984.0,
|
|
"step": 9875
|
|
},
|
|
{
|
|
"entropy": 1.0485968235880136,
|
|
"epoch": 3.041873129804778,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 7.677882113114043e-09,
|
|
"loss": 1.0515,
|
|
"mean_token_accuracy": 0.7104669593274593,
|
|
"num_tokens": 740095910.0,
|
|
"step": 9880
|
|
},
|
|
{
|
|
"entropy": 1.0927950464189053,
|
|
"epoch": 3.0434125831064245,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 7.056529739158935e-09,
|
|
"loss": 1.0783,
|
|
"mean_token_accuracy": 0.7051904398947955,
|
|
"num_tokens": 740470250.0,
|
|
"step": 9885
|
|
},
|
|
{
|
|
"entropy": 1.0785456616431475,
|
|
"epoch": 3.0449520364080707,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 6.46138269449037e-09,
|
|
"loss": 1.0694,
|
|
"mean_token_accuracy": 0.707150898501277,
|
|
"num_tokens": 740843583.0,
|
|
"step": 9890
|
|
},
|
|
{
|
|
"entropy": 1.1008368913084268,
|
|
"epoch": 3.046491489709717,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 5.892442539811028e-09,
|
|
"loss": 1.0912,
|
|
"mean_token_accuracy": 0.7035331267863512,
|
|
"num_tokens": 741225081.0,
|
|
"step": 9895
|
|
},
|
|
{
|
|
"entropy": 1.0785760562866926,
|
|
"epoch": 3.048030943011363,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 5.34971076710078e-09,
|
|
"loss": 1.0779,
|
|
"mean_token_accuracy": 0.7061000455170869,
|
|
"num_tokens": 741598108.0,
|
|
"step": 9900
|
|
},
|
|
{
|
|
"entropy": 1.1148313336074351,
|
|
"epoch": 3.049570396313009,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 4.833188799610033e-09,
|
|
"loss": 1.1082,
|
|
"mean_token_accuracy": 0.698163578659296,
|
|
"num_tokens": 741971423.0,
|
|
"step": 9905
|
|
},
|
|
{
|
|
"entropy": 1.0847873697057366,
|
|
"epoch": 3.051109849614656,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 4.342877991858618e-09,
|
|
"loss": 1.0814,
|
|
"mean_token_accuracy": 0.7055370740592479,
|
|
"num_tokens": 742349905.0,
|
|
"step": 9910
|
|
},
|
|
{
|
|
"entropy": 1.108674155920744,
|
|
"epoch": 3.052649302916302,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 3.878779629628016e-09,
|
|
"loss": 1.1051,
|
|
"mean_token_accuracy": 0.700138570740819,
|
|
"num_tokens": 742719428.0,
|
|
"step": 9915
|
|
},
|
|
{
|
|
"entropy": 1.0805808862671256,
|
|
"epoch": 3.054188756217948,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 3.4408949299624683e-09,
|
|
"loss": 1.0719,
|
|
"mean_token_accuracy": 0.7048815876245499,
|
|
"num_tokens": 743084012.0,
|
|
"step": 9920
|
|
},
|
|
{
|
|
"entropy": 1.0899688798934222,
|
|
"epoch": 3.0557282095195943,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 3.0292250411645406e-09,
|
|
"loss": 1.0814,
|
|
"mean_token_accuracy": 0.7035856068134307,
|
|
"num_tokens": 743446019.0,
|
|
"step": 9925
|
|
},
|
|
{
|
|
"entropy": 1.0755476847290992,
|
|
"epoch": 3.0572676628212405,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 2.643771042789567e-09,
|
|
"loss": 1.0648,
|
|
"mean_token_accuracy": 0.7089338883757591,
|
|
"num_tokens": 743816769.0,
|
|
"step": 9930
|
|
},
|
|
{
|
|
"entropy": 1.088210930675268,
|
|
"epoch": 3.0588071161228867,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 2.2845339456445402e-09,
|
|
"loss": 1.0763,
|
|
"mean_token_accuracy": 0.7049315143376589,
|
|
"num_tokens": 744194878.0,
|
|
"step": 9935
|
|
},
|
|
{
|
|
"entropy": 1.0834743816405534,
|
|
"epoch": 3.0603465694245333,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 1.9515146917892248e-09,
|
|
"loss": 1.0795,
|
|
"mean_token_accuracy": 0.704654747992754,
|
|
"num_tokens": 744565723.0,
|
|
"step": 9940
|
|
},
|
|
{
|
|
"entropy": 1.0797277385368944,
|
|
"epoch": 3.0618860227261795,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 1.6447141545272717e-09,
|
|
"loss": 1.0774,
|
|
"mean_token_accuracy": 0.7051199175417423,
|
|
"num_tokens": 744943221.0,
|
|
"step": 9945
|
|
},
|
|
{
|
|
"entropy": 1.0863937176764011,
|
|
"epoch": 3.0634254760278257,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 1.3641331384062207e-09,
|
|
"loss": 1.0652,
|
|
"mean_token_accuracy": 0.704937232285738,
|
|
"num_tokens": 745328204.0,
|
|
"step": 9950
|
|
},
|
|
{
|
|
"entropy": 1.0870888832956553,
|
|
"epoch": 3.064964929329472,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 1.1097723792174998e-09,
|
|
"loss": 1.0714,
|
|
"mean_token_accuracy": 0.705986562371254,
|
|
"num_tokens": 745709942.0,
|
|
"step": 9955
|
|
},
|
|
{
|
|
"entropy": 1.0934691112488508,
|
|
"epoch": 3.066504382631118,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 8.81632543993094e-10,
|
|
"loss": 1.0758,
|
|
"mean_token_accuracy": 0.7024580135941505,
|
|
"num_tokens": 746073373.0,
|
|
"step": 9960
|
|
},
|
|
{
|
|
"entropy": 1.0886455051600934,
|
|
"epoch": 3.068043835932764,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 6.797142310022154e-10,
|
|
"loss": 1.078,
|
|
"mean_token_accuracy": 0.7037386298179626,
|
|
"num_tokens": 746448603.0,
|
|
"step": 9965
|
|
},
|
|
{
|
|
"entropy": 1.0765321986749767,
|
|
"epoch": 3.069583289234411,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 5.040179697524128e-10,
|
|
"loss": 1.0607,
|
|
"mean_token_accuracy": 0.7079931873828172,
|
|
"num_tokens": 746811282.0,
|
|
"step": 9970
|
|
},
|
|
{
|
|
"entropy": 1.0943534463644027,
|
|
"epoch": 3.071122742536057,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 3.5454422098735176e-10,
|
|
"loss": 1.0915,
|
|
"mean_token_accuracy": 0.705184667557478,
|
|
"num_tokens": 747188329.0,
|
|
"step": 9975
|
|
},
|
|
{
|
|
"entropy": 1.0634538885205984,
|
|
"epoch": 3.072662195837703,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 2.3129337668459372e-10,
|
|
"loss": 1.0488,
|
|
"mean_token_accuracy": 0.7129087168723345,
|
|
"num_tokens": 747558817.0,
|
|
"step": 9980
|
|
},
|
|
{
|
|
"entropy": 1.0838307721540332,
|
|
"epoch": 3.0742016491393493,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 1.342657600544861e-10,
|
|
"loss": 1.079,
|
|
"mean_token_accuracy": 0.7056713305413723,
|
|
"num_tokens": 747952204.0,
|
|
"step": 9985
|
|
},
|
|
{
|
|
"entropy": 1.0978870384395123,
|
|
"epoch": 3.0757411024409955,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 6.34616255401621e-11,
|
|
"loss": 1.0867,
|
|
"mean_token_accuracy": 0.7053111927583814,
|
|
"num_tokens": 748337329.0,
|
|
"step": 9990
|
|
},
|
|
{
|
|
"entropy": 1.1443137027323247,
|
|
"epoch": 3.0772805557426417,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 1.8881158817540824e-11,
|
|
"loss": 1.1257,
|
|
"mean_token_accuracy": 0.6946287345141172,
|
|
"num_tokens": 748717656.0,
|
|
"step": 9995
|
|
},
|
|
{
|
|
"entropy": 1.1074191411957144,
|
|
"epoch": 3.0788200090442883,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 5.244767942169659e-13,
|
|
"loss": 1.0994,
|
|
"mean_token_accuracy": 0.7014887783676386,
|
|
"num_tokens": 749093447.0,
|
|
"step": 10000
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 10000,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 4,
|
|
"save_steps": 1000,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": true
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 1.2473180090471023e+19,
|
|
"train_batch_size": 1,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|