1427 lines
39 KiB
JSON
1427 lines
39 KiB
JSON
|
|
[
|
||
|
|
{
|
||
|
|
"loss": 4.750440063476563,
|
||
|
|
"grad_norm": 18.5,
|
||
|
|
"learning_rate": 1.6937553464499572e-06,
|
||
|
|
"entropy": 1.8923688557744027,
|
||
|
|
"num_tokens": 788631.0,
|
||
|
|
"mean_token_accuracy": 0.4935979051887989,
|
||
|
|
"epoch": 0.02567723712928489,
|
||
|
|
"step": 100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 1.9100816345214844,
|
||
|
|
"grad_norm": 2.46875,
|
||
|
|
"learning_rate": 3.4046193327630456e-06,
|
||
|
|
"entropy": 1.3998645849525928,
|
||
|
|
"num_tokens": 1575343.0,
|
||
|
|
"mean_token_accuracy": 0.7200635960698127,
|
||
|
|
"epoch": 0.05135447425856978,
|
||
|
|
"step": 200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.8591059112548828,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 5.1154833190761344e-06,
|
||
|
|
"entropy": 0.8898824742436409,
|
||
|
|
"num_tokens": 2362291.0,
|
||
|
|
"mean_token_accuracy": 0.8574495847523212,
|
||
|
|
"epoch": 0.07703171138785467,
|
||
|
|
"step": 300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.7470406341552734,
|
||
|
|
"grad_norm": 0.84375,
|
||
|
|
"learning_rate": 6.826347305389223e-06,
|
||
|
|
"entropy": 0.7403855113685132,
|
||
|
|
"num_tokens": 3150439.0,
|
||
|
|
"mean_token_accuracy": 0.8639249949157238,
|
||
|
|
"epoch": 0.10270894851713956,
|
||
|
|
"step": 400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.7207820892333985,
|
||
|
|
"grad_norm": 0.9140625,
|
||
|
|
"learning_rate": 8.537211291702311e-06,
|
||
|
|
"entropy": 0.7141104683279991,
|
||
|
|
"num_tokens": 3939189.0,
|
||
|
|
"mean_token_accuracy": 0.8657969088852405,
|
||
|
|
"epoch": 0.12838618564642446,
|
||
|
|
"step": 500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.7116692066192627,
|
||
|
|
"eval_runtime": 54.8721,
|
||
|
|
"eval_samples_per_second": 246.282,
|
||
|
|
"eval_steps_per_second": 30.799,
|
||
|
|
"eval_entropy": 0.7040384754803054,
|
||
|
|
"eval_num_tokens": 3939189.0,
|
||
|
|
"eval_mean_token_accuracy": 0.8678437359586976,
|
||
|
|
"epoch": 0.12838618564642446,
|
||
|
|
"step": 500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.6964442443847656,
|
||
|
|
"grad_norm": 0.671875,
|
||
|
|
"learning_rate": 1.02480752780154e-05,
|
||
|
|
"entropy": 0.6904747068881989,
|
||
|
|
"num_tokens": 4726987.0,
|
||
|
|
"mean_token_accuracy": 0.8699142991006374,
|
||
|
|
"epoch": 0.15406342277570934,
|
||
|
|
"step": 600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.6845658874511719,
|
||
|
|
"grad_norm": 0.65234375,
|
||
|
|
"learning_rate": 1.1958939264328486e-05,
|
||
|
|
"entropy": 0.6769806676357984,
|
||
|
|
"num_tokens": 5514520.0,
|
||
|
|
"mean_token_accuracy": 0.8706908752024174,
|
||
|
|
"epoch": 0.17974065990499422,
|
||
|
|
"step": 700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.674889907836914,
|
||
|
|
"grad_norm": 0.671875,
|
||
|
|
"learning_rate": 1.3669803250641576e-05,
|
||
|
|
"entropy": 0.6676776028424501,
|
||
|
|
"num_tokens": 6303997.0,
|
||
|
|
"mean_token_accuracy": 0.8724033688008785,
|
||
|
|
"epoch": 0.20541789703427912,
|
||
|
|
"step": 800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.6671540832519531,
|
||
|
|
"grad_norm": 0.52734375,
|
||
|
|
"learning_rate": 1.538066723695466e-05,
|
||
|
|
"entropy": 0.6595571556687355,
|
||
|
|
"num_tokens": 7092051.0,
|
||
|
|
"mean_token_accuracy": 0.8737483167648316,
|
||
|
|
"epoch": 0.231095134163564,
|
||
|
|
"step": 900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.6556224060058594,
|
||
|
|
"grad_norm": 0.6484375,
|
||
|
|
"learning_rate": 1.7091531223267753e-05,
|
||
|
|
"entropy": 0.6491201698035002,
|
||
|
|
"num_tokens": 7879814.0,
|
||
|
|
"mean_token_accuracy": 0.8747330990433693,
|
||
|
|
"epoch": 0.2567723712928489,
|
||
|
|
"step": 1000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.663184642791748,
|
||
|
|
"eval_runtime": 54.7637,
|
||
|
|
"eval_samples_per_second": 246.769,
|
||
|
|
"eval_steps_per_second": 30.86,
|
||
|
|
"eval_entropy": 0.6412436753864119,
|
||
|
|
"eval_num_tokens": 7879814.0,
|
||
|
|
"eval_mean_token_accuracy": 0.8737807706262939,
|
||
|
|
"epoch": 0.2567723712928489,
|
||
|
|
"step": 1000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.6500083923339843,
|
||
|
|
"grad_norm": 0.53515625,
|
||
|
|
"learning_rate": 1.8802395209580838e-05,
|
||
|
|
"entropy": 0.6428950117528438,
|
||
|
|
"num_tokens": 8669131.0,
|
||
|
|
"mean_token_accuracy": 0.8755043950676918,
|
||
|
|
"epoch": 0.2824496084221338,
|
||
|
|
"step": 1100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.6482027435302734,
|
||
|
|
"grad_norm": 0.48828125,
|
||
|
|
"learning_rate": 1.999959838659769e-05,
|
||
|
|
"entropy": 0.6402996262907982,
|
||
|
|
"num_tokens": 9457145.0,
|
||
|
|
"mean_token_accuracy": 0.8748263613879681,
|
||
|
|
"epoch": 0.30812684555141867,
|
||
|
|
"step": 1200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.6415071868896485,
|
||
|
|
"grad_norm": 0.48828125,
|
||
|
|
"learning_rate": 1.9992459490144817e-05,
|
||
|
|
"entropy": 0.6334157256036996,
|
||
|
|
"num_tokens": 10246533.0,
|
||
|
|
"mean_token_accuracy": 0.8767267981171608,
|
||
|
|
"epoch": 0.33380408268070355,
|
||
|
|
"step": 1300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.6354057693481445,
|
||
|
|
"grad_norm": 0.427734375,
|
||
|
|
"learning_rate": 1.9976403184682326e-05,
|
||
|
|
"entropy": 0.6278333819657564,
|
||
|
|
"num_tokens": 11033964.0,
|
||
|
|
"mean_token_accuracy": 0.8767068019509315,
|
||
|
|
"epoch": 0.35948131980998843,
|
||
|
|
"step": 1400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.6239862060546875,
|
||
|
|
"grad_norm": 0.50390625,
|
||
|
|
"learning_rate": 1.9951443799079215e-05,
|
||
|
|
"entropy": 0.617088794335723,
|
||
|
|
"num_tokens": 11822337.0,
|
||
|
|
"mean_token_accuracy": 0.8790474827587604,
|
||
|
|
"epoch": 0.3851585569392733,
|
||
|
|
"step": 1500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.6321121454238892,
|
||
|
|
"eval_runtime": 54.7585,
|
||
|
|
"eval_samples_per_second": 246.793,
|
||
|
|
"eval_steps_per_second": 30.863,
|
||
|
|
"eval_entropy": 0.6265641573089115,
|
||
|
|
"eval_num_tokens": 11822337.0,
|
||
|
|
"eval_mean_token_accuracy": 0.8774857493899983,
|
||
|
|
"epoch": 0.3851585569392733,
|
||
|
|
"step": 1500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.6275780868530273,
|
||
|
|
"grad_norm": 0.439453125,
|
||
|
|
"learning_rate": 1.99176036074363e-05,
|
||
|
|
"entropy": 0.6201947060227394,
|
||
|
|
"num_tokens": 12609317.0,
|
||
|
|
"mean_token_accuracy": 0.8780887794494628,
|
||
|
|
"epoch": 0.41083579406855825,
|
||
|
|
"step": 1600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.6231816101074219,
|
||
|
|
"grad_norm": 0.486328125,
|
||
|
|
"learning_rate": 1.9874912809208492e-05,
|
||
|
|
"entropy": 0.6153993520885706,
|
||
|
|
"num_tokens": 13396496.0,
|
||
|
|
"mean_token_accuracy": 0.8783692798018455,
|
||
|
|
"epoch": 0.4365130311978431,
|
||
|
|
"step": 1700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.6151680374145507,
|
||
|
|
"grad_norm": 0.42578125,
|
||
|
|
"learning_rate": 1.9823409502254395e-05,
|
||
|
|
"entropy": 0.608376269415021,
|
||
|
|
"num_tokens": 14184641.0,
|
||
|
|
"mean_token_accuracy": 0.8793962903320789,
|
||
|
|
"epoch": 0.462190268327128,
|
||
|
|
"step": 1800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.6083632278442382,
|
||
|
|
"grad_norm": 0.48046875,
|
||
|
|
"learning_rate": 1.976313964883724e-05,
|
||
|
|
"entropy": 0.6008849449455738,
|
||
|
|
"num_tokens": 14972736.0,
|
||
|
|
"mean_token_accuracy": 0.8803431905806065,
|
||
|
|
"epoch": 0.4878675054564129,
|
||
|
|
"step": 1900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.6151135635375976,
|
||
|
|
"grad_norm": 0.490234375,
|
||
|
|
"learning_rate": 1.969415703460754e-05,
|
||
|
|
"entropy": 0.6089416973292827,
|
||
|
|
"num_tokens": 15760765.0,
|
||
|
|
"mean_token_accuracy": 0.8788625657558441,
|
||
|
|
"epoch": 0.5135447425856978,
|
||
|
|
"step": 2000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.6166946887969971,
|
||
|
|
"eval_runtime": 54.7524,
|
||
|
|
"eval_samples_per_second": 246.82,
|
||
|
|
"eval_steps_per_second": 30.866,
|
||
|
|
"eval_entropy": 0.6073356674267696,
|
||
|
|
"eval_num_tokens": 15760765.0,
|
||
|
|
"eval_mean_token_accuracy": 0.8794099937529254,
|
||
|
|
"epoch": 0.5135447425856978,
|
||
|
|
"step": 2000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.6144330596923828,
|
||
|
|
"grad_norm": 0.55859375,
|
||
|
|
"learning_rate": 1.9616523220604026e-05,
|
||
|
|
"entropy": 0.607123366817832,
|
||
|
|
"num_tokens": 16548995.0,
|
||
|
|
"mean_token_accuracy": 0.8789290805161,
|
||
|
|
"epoch": 0.5392219797149826,
|
||
|
|
"step": 2100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.6069226837158204,
|
||
|
|
"grad_norm": 0.4609375,
|
||
|
|
"learning_rate": 1.9530307488315705e-05,
|
||
|
|
"entropy": 0.5998961886018515,
|
||
|
|
"num_tokens": 17338195.0,
|
||
|
|
"mean_token_accuracy": 0.8809803961217404,
|
||
|
|
"epoch": 0.5648992168442676,
|
||
|
|
"step": 2200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.6049447250366211,
|
||
|
|
"grad_norm": 0.4375,
|
||
|
|
"learning_rate": 1.943558677785414e-05,
|
||
|
|
"entropy": 0.598465187177062,
|
||
|
|
"num_tokens": 18126378.0,
|
||
|
|
"mean_token_accuracy": 0.8805468159914017,
|
||
|
|
"epoch": 0.5905764539735524,
|
||
|
|
"step": 2300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.6049994659423829,
|
||
|
|
"grad_norm": 0.486328125,
|
||
|
|
"learning_rate": 1.9332445619291003e-05,
|
||
|
|
"entropy": 0.5971225092560053,
|
||
|
|
"num_tokens": 18915415.0,
|
||
|
|
"mean_token_accuracy": 0.8809448407590389,
|
||
|
|
"epoch": 0.6162536911028373,
|
||
|
|
"step": 2400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.594350700378418,
|
||
|
|
"grad_norm": 0.435546875,
|
||
|
|
"learning_rate": 1.9220976057222272e-05,
|
||
|
|
"entropy": 0.5881732907891274,
|
||
|
|
"num_tokens": 19703215.0,
|
||
|
|
"mean_token_accuracy": 0.8828758196532727,
|
||
|
|
"epoch": 0.6419309282321223,
|
||
|
|
"step": 2500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.6071834564208984,
|
||
|
|
"eval_runtime": 54.9257,
|
||
|
|
"eval_samples_per_second": 246.041,
|
||
|
|
"eval_steps_per_second": 30.769,
|
||
|
|
"eval_entropy": 0.5911375472178826,
|
||
|
|
"eval_num_tokens": 19703215.0,
|
||
|
|
"eval_mean_token_accuracy": 0.8806265884249873,
|
||
|
|
"epoch": 0.6419309282321223,
|
||
|
|
"step": 2500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.6014495086669922,
|
||
|
|
"grad_norm": 0.51953125,
|
||
|
|
"learning_rate": 1.9101277568626374e-05,
|
||
|
|
"entropy": 0.5939998836070299,
|
||
|
|
"num_tokens": 20491378.0,
|
||
|
|
"mean_token_accuracy": 0.881148318350315,
|
||
|
|
"epoch": 0.6676081653614071,
|
||
|
|
"step": 2600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.600106201171875,
|
||
|
|
"grad_norm": 0.470703125,
|
||
|
|
"learning_rate": 1.8973456974089533e-05,
|
||
|
|
"entropy": 0.5930179691314698,
|
||
|
|
"num_tokens": 21281188.0,
|
||
|
|
"mean_token_accuracy": 0.8814401589334011,
|
||
|
|
"epoch": 0.693285402490692,
|
||
|
|
"step": 2700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5990888595581054,
|
||
|
|
"grad_norm": 0.474609375,
|
||
|
|
"learning_rate": 1.883762834247763e-05,
|
||
|
|
"entropy": 0.5917389342188835,
|
||
|
|
"num_tokens": 22068585.0,
|
||
|
|
"mean_token_accuracy": 0.8816984808444976,
|
||
|
|
"epoch": 0.7189626396199769,
|
||
|
|
"step": 2800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5918187332153321,
|
||
|
|
"grad_norm": 0.423828125,
|
||
|
|
"learning_rate": 1.8693912889139548e-05,
|
||
|
|
"entropy": 0.5863303769379854,
|
||
|
|
"num_tokens": 22857792.0,
|
||
|
|
"mean_token_accuracy": 0.8828704132139683,
|
||
|
|
"epoch": 0.7446398767492618,
|
||
|
|
"step": 2900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5956339645385742,
|
||
|
|
"grad_norm": 0.5,
|
||
|
|
"learning_rate": 1.8542438867732926e-05,
|
||
|
|
"entropy": 0.588519376218319,
|
||
|
|
"num_tokens": 23646674.0,
|
||
|
|
"mean_token_accuracy": 0.8816372238099575,
|
||
|
|
"epoch": 0.7703171138785466,
|
||
|
|
"step": 3000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.6004985570907593,
|
||
|
|
"eval_runtime": 54.7477,
|
||
|
|
"eval_samples_per_second": 246.841,
|
||
|
|
"eval_steps_per_second": 30.869,
|
||
|
|
"eval_entropy": 0.5863094668416582,
|
||
|
|
"eval_num_tokens": 23646674.0,
|
||
|
|
"eval_mean_token_accuracy": 0.8815102644573302,
|
||
|
|
"epoch": 0.7703171138785466,
|
||
|
|
"step": 3000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5889485931396484,
|
||
|
|
"grad_norm": 0.458984375,
|
||
|
|
"learning_rate": 1.8383341455768818e-05,
|
||
|
|
"entropy": 0.5825948847830296,
|
||
|
|
"num_tokens": 24435112.0,
|
||
|
|
"mean_token_accuracy": 0.8833577731251716,
|
||
|
|
"epoch": 0.7959943510078316,
|
||
|
|
"step": 3100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5954160690307617,
|
||
|
|
"grad_norm": 0.51171875,
|
||
|
|
"learning_rate": 1.821676263397742e-05,
|
||
|
|
"entropy": 0.5882748451083899,
|
||
|
|
"num_tokens": 25222534.0,
|
||
|
|
"mean_token_accuracy": 0.8819541597366333,
|
||
|
|
"epoch": 0.8216715881371165,
|
||
|
|
"step": 3200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.588886604309082,
|
||
|
|
"grad_norm": 0.421875,
|
||
|
|
"learning_rate": 1.80428510596025e-05,
|
||
|
|
"entropy": 0.5826382269710302,
|
||
|
|
"num_tokens": 26010061.0,
|
||
|
|
"mean_token_accuracy": 0.8837110216915608,
|
||
|
|
"epoch": 0.8473488252664013,
|
||
|
|
"step": 3300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5870479202270508,
|
||
|
|
"grad_norm": 0.44140625,
|
||
|
|
"learning_rate": 1.7861761933737617e-05,
|
||
|
|
"entropy": 0.5794471693038941,
|
||
|
|
"num_tokens": 26798369.0,
|
||
|
|
"mean_token_accuracy": 0.8833601754903794,
|
||
|
|
"epoch": 0.8730260623956863,
|
||
|
|
"step": 3400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.592176284790039,
|
||
|
|
"grad_norm": 0.48046875,
|
||
|
|
"learning_rate": 1.7673656862822515e-05,
|
||
|
|
"entropy": 0.5864929938316346,
|
||
|
|
"num_tokens": 27588005.0,
|
||
|
|
"mean_token_accuracy": 0.8821781493723393,
|
||
|
|
"epoch": 0.8987032995249711,
|
||
|
|
"step": 3500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.5955591797828674,
|
||
|
|
"eval_runtime": 54.8151,
|
||
|
|
"eval_samples_per_second": 246.538,
|
||
|
|
"eval_steps_per_second": 30.831,
|
||
|
|
"eval_entropy": 0.587783907803558,
|
||
|
|
"eval_num_tokens": 27588005.0,
|
||
|
|
"eval_mean_token_accuracy": 0.8821474394502019,
|
||
|
|
"epoch": 0.8987032995249711,
|
||
|
|
"step": 3500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.592364845275879,
|
||
|
|
"grad_norm": 0.47265625,
|
||
|
|
"learning_rate": 1.7478703714423316e-05,
|
||
|
|
"entropy": 0.5852145043760538,
|
||
|
|
"num_tokens": 28377750.0,
|
||
|
|
"mean_token_accuracy": 0.8823536723852158,
|
||
|
|
"epoch": 0.924380536654256,
|
||
|
|
"step": 3600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5905634689331055,
|
||
|
|
"grad_norm": 0.484375,
|
||
|
|
"learning_rate": 1.7277076467425163e-05,
|
||
|
|
"entropy": 0.5841019700467587,
|
||
|
|
"num_tokens": 29166016.0,
|
||
|
|
"mean_token_accuracy": 0.8825851279497147,
|
||
|
|
"epoch": 0.9500577737835408,
|
||
|
|
"step": 3700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5932608795166016,
|
||
|
|
"grad_norm": 0.427734375,
|
||
|
|
"learning_rate": 1.706895505677108e-05,
|
||
|
|
"entropy": 0.5853660201281309,
|
||
|
|
"num_tokens": 29953000.0,
|
||
|
|
"mean_token_accuracy": 0.8823425352573395,
|
||
|
|
"epoch": 0.9757350109128258,
|
||
|
|
"step": 3800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5879095458984375,
|
||
|
|
"grad_norm": 0.4609375,
|
||
|
|
"learning_rate": 1.6854525212885517e-05,
|
||
|
|
"entropy": 0.5822415573513089,
|
||
|
|
"num_tokens": 30735372.0,
|
||
|
|
"mean_token_accuracy": 0.8827068781732914,
|
||
|
|
"epoch": 1.0012838618564643,
|
||
|
|
"step": 3900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5767642593383789,
|
||
|
|
"grad_norm": 0.458984375,
|
||
|
|
"learning_rate": 1.6633978295925973e-05,
|
||
|
|
"entropy": 0.5713576471805573,
|
||
|
|
"num_tokens": 31523776.0,
|
||
|
|
"mean_token_accuracy": 0.8843695457279682,
|
||
|
|
"epoch": 1.0269610989857492,
|
||
|
|
"step": 4000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.5925981402397156,
|
||
|
|
"eval_runtime": 54.7961,
|
||
|
|
"eval_samples_per_second": 246.623,
|
||
|
|
"eval_steps_per_second": 30.842,
|
||
|
|
"eval_entropy": 0.5778270154838732,
|
||
|
|
"eval_num_tokens": 31523776.0,
|
||
|
|
"eval_mean_token_accuracy": 0.8826113852876178,
|
||
|
|
"epoch": 1.0269610989857492,
|
||
|
|
"step": 4000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5802158355712891,
|
||
|
|
"grad_norm": 0.44921875,
|
||
|
|
"learning_rate": 1.6407511125010535e-05,
|
||
|
|
"entropy": 0.5741120263934135,
|
||
|
|
"num_tokens": 32312483.0,
|
||
|
|
"mean_token_accuracy": 0.8842027541995049,
|
||
|
|
"epoch": 1.052638336115034,
|
||
|
|
"step": 4100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5740043258666992,
|
||
|
|
"grad_norm": 0.412109375,
|
||
|
|
"learning_rate": 1.6175325802573762e-05,
|
||
|
|
"entropy": 0.567267286553979,
|
||
|
|
"num_tokens": 33100106.0,
|
||
|
|
"mean_token_accuracy": 0.8849893444776535,
|
||
|
|
"epoch": 1.0783155732443188,
|
||
|
|
"step": 4200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5846810150146484,
|
||
|
|
"grad_norm": 0.47265625,
|
||
|
|
"learning_rate": 1.593762953400771e-05,
|
||
|
|
"entropy": 0.5781943628191948,
|
||
|
|
"num_tokens": 33887447.0,
|
||
|
|
"mean_token_accuracy": 0.8829620778560638,
|
||
|
|
"epoch": 1.1039928103736039,
|
||
|
|
"step": 4300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5748196792602539,
|
||
|
|
"grad_norm": 0.4296875,
|
||
|
|
"learning_rate": 1.569463444274896e-05,
|
||
|
|
"entropy": 0.5688514755666256,
|
||
|
|
"num_tokens": 34676497.0,
|
||
|
|
"mean_token_accuracy": 0.885183926820755,
|
||
|
|
"epoch": 1.1296700475028887,
|
||
|
|
"step": 4400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5742076110839843,
|
||
|
|
"grad_norm": 0.431640625,
|
||
|
|
"learning_rate": 1.5446557380976705e-05,
|
||
|
|
"entropy": 0.568457648679614,
|
||
|
|
"num_tokens": 35464531.0,
|
||
|
|
"mean_token_accuracy": 0.8851266872882843,
|
||
|
|
"epoch": 1.1553472846321735,
|
||
|
|
"step": 4500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.589805543422699,
|
||
|
|
"eval_runtime": 54.7583,
|
||
|
|
"eval_samples_per_second": 246.794,
|
||
|
|
"eval_steps_per_second": 30.863,
|
||
|
|
"eval_entropy": 0.5768643142556298,
|
||
|
|
"eval_num_tokens": 35464531.0,
|
||
|
|
"eval_mean_token_accuracy": 0.8828777232466365,
|
||
|
|
"epoch": 1.1553472846321735,
|
||
|
|
"step": 4500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5734137344360352,
|
||
|
|
"grad_norm": 0.3984375,
|
||
|
|
"learning_rate": 1.5193619736090915e-05,
|
||
|
|
"entropy": 0.5677488286048173,
|
||
|
|
"num_tokens": 36252194.0,
|
||
|
|
"mean_token_accuracy": 0.8852373589575291,
|
||
|
|
"epoch": 1.1810245217614586,
|
||
|
|
"step": 4600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5754076385498047,
|
||
|
|
"grad_norm": 0.486328125,
|
||
|
|
"learning_rate": 1.4936047233143121e-05,
|
||
|
|
"entropy": 0.5682116626948118,
|
||
|
|
"num_tokens": 37040269.0,
|
||
|
|
"mean_token_accuracy": 0.8845331266522407,
|
||
|
|
"epoch": 1.2067017588907434,
|
||
|
|
"step": 4700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5745722198486328,
|
||
|
|
"grad_norm": 0.49609375,
|
||
|
|
"learning_rate": 1.4674069733396277e-05,
|
||
|
|
"entropy": 0.5689838898181915,
|
||
|
|
"num_tokens": 37828541.0,
|
||
|
|
"mean_token_accuracy": 0.8847483664751052,
|
||
|
|
"epoch": 1.2323789960200282,
|
||
|
|
"step": 4800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.576999397277832,
|
||
|
|
"grad_norm": 0.48046875,
|
||
|
|
"learning_rate": 1.4407921029193386e-05,
|
||
|
|
"entropy": 0.5696741715818644,
|
||
|
|
"num_tokens": 38617419.0,
|
||
|
|
"mean_token_accuracy": 0.8844019156694413,
|
||
|
|
"epoch": 1.258056233149313,
|
||
|
|
"step": 4900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5678987884521485,
|
||
|
|
"grad_norm": 0.462890625,
|
||
|
|
"learning_rate": 1.4137838635317981e-05,
|
||
|
|
"entropy": 0.5612105248868465,
|
||
|
|
"num_tokens": 39405754.0,
|
||
|
|
"mean_token_accuracy": 0.8869498370587826,
|
||
|
|
"epoch": 1.283733470278598,
|
||
|
|
"step": 5000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.5878459811210632,
|
||
|
|
"eval_runtime": 54.7786,
|
||
|
|
"eval_samples_per_second": 246.702,
|
||
|
|
"eval_steps_per_second": 30.851,
|
||
|
|
"eval_entropy": 0.5790132550269189,
|
||
|
|
"eval_num_tokens": 39405754.0,
|
||
|
|
"eval_mean_token_accuracy": 0.883159120089909,
|
||
|
|
"epoch": 1.283733470278598,
|
||
|
|
"step": 5000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.571096305847168,
|
||
|
|
"grad_norm": 0.443359375,
|
||
|
|
"learning_rate": 1.3864063577032644e-05,
|
||
|
|
"entropy": 0.5649081739038229,
|
||
|
|
"num_tokens": 40194187.0,
|
||
|
|
"mean_token_accuracy": 0.8850538778305054,
|
||
|
|
"epoch": 1.309410707407883,
|
||
|
|
"step": 5100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5754905319213868,
|
||
|
|
"grad_norm": 0.46484375,
|
||
|
|
"learning_rate": 1.3586840174984741e-05,
|
||
|
|
"entropy": 0.5687890707701445,
|
||
|
|
"num_tokens": 40982840.0,
|
||
|
|
"mean_token_accuracy": 0.8848973129689693,
|
||
|
|
"epoch": 1.3350879445371677,
|
||
|
|
"step": 5200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5749807739257813,
|
||
|
|
"grad_norm": 0.486328125,
|
||
|
|
"learning_rate": 1.3306415827171285e-05,
|
||
|
|
"entropy": 0.5689149481058121,
|
||
|
|
"num_tokens": 41771135.0,
|
||
|
|
"mean_token_accuracy": 0.8845471844077111,
|
||
|
|
"epoch": 1.3607651816664528,
|
||
|
|
"step": 5300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5676103210449219,
|
||
|
|
"grad_norm": 0.447265625,
|
||
|
|
"learning_rate": 1.3023040788157542e-05,
|
||
|
|
"entropy": 0.5619329659640789,
|
||
|
|
"num_tokens": 42560001.0,
|
||
|
|
"mean_token_accuracy": 0.8864177967607975,
|
||
|
|
"epoch": 1.3864424187957376,
|
||
|
|
"step": 5400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5773470687866211,
|
||
|
|
"grad_norm": 0.44921875,
|
||
|
|
"learning_rate": 1.2736967945746414e-05,
|
||
|
|
"entropy": 0.5703003640472889,
|
||
|
|
"num_tokens": 43348221.0,
|
||
|
|
"mean_token_accuracy": 0.8847005999088288,
|
||
|
|
"epoch": 1.4121196559250224,
|
||
|
|
"step": 5500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.5865316390991211,
|
||
|
|
"eval_runtime": 54.7913,
|
||
|
|
"eval_samples_per_second": 246.645,
|
||
|
|
"eval_steps_per_second": 30.844,
|
||
|
|
"eval_entropy": 0.5781261159823491,
|
||
|
|
"eval_num_tokens": 43348221.0,
|
||
|
|
"eval_mean_token_accuracy": 0.8833931800881787,
|
||
|
|
"epoch": 1.4121196559250224,
|
||
|
|
"step": 5500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.574415054321289,
|
||
|
|
"grad_norm": 0.44921875,
|
||
|
|
"learning_rate": 1.244845259529785e-05,
|
||
|
|
"entropy": 0.5687751418352127,
|
||
|
|
"num_tokens": 44137063.0,
|
||
|
|
"mean_token_accuracy": 0.8844234578311443,
|
||
|
|
"epoch": 1.4377968930543075,
|
||
|
|
"step": 5600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5696615219116211,
|
||
|
|
"grad_norm": 0.4375,
|
||
|
|
"learning_rate": 1.2157752211899743e-05,
|
||
|
|
"entropy": 0.5634171192348003,
|
||
|
|
"num_tokens": 44925913.0,
|
||
|
|
"mean_token_accuracy": 0.8861848974227905,
|
||
|
|
"epoch": 1.4634741301835923,
|
||
|
|
"step": 5700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.575277099609375,
|
||
|
|
"grad_norm": 0.46484375,
|
||
|
|
"learning_rate": 1.1865126220593606e-05,
|
||
|
|
"entropy": 0.5681466187536717,
|
||
|
|
"num_tokens": 45713041.0,
|
||
|
|
"mean_token_accuracy": 0.8845858334004879,
|
||
|
|
"epoch": 1.4891513673128771,
|
||
|
|
"step": 5800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5714412689208984,
|
||
|
|
"grad_norm": 0.44921875,
|
||
|
|
"learning_rate": 1.157083576486007e-05,
|
||
|
|
"entropy": 0.565763695165515,
|
||
|
|
"num_tokens": 46501563.0,
|
||
|
|
"mean_token_accuracy": 0.885509030520916,
|
||
|
|
"epoch": 1.5148286044421622,
|
||
|
|
"step": 5900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5758369064331055,
|
||
|
|
"grad_norm": 0.4921875,
|
||
|
|
"learning_rate": 1.127514347357083e-05,
|
||
|
|
"entropy": 0.5689407536387443,
|
||
|
|
"num_tokens": 47289330.0,
|
||
|
|
"mean_token_accuracy": 0.8847136509418487,
|
||
|
|
"epoch": 1.5405058415714468,
|
||
|
|
"step": 6000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.5854482650756836,
|
||
|
|
"eval_runtime": 54.7402,
|
||
|
|
"eval_samples_per_second": 246.875,
|
||
|
|
"eval_steps_per_second": 30.873,
|
||
|
|
"eval_entropy": 0.5725359358378416,
|
||
|
|
"eval_num_tokens": 47289330.0,
|
||
|
|
"eval_mean_token_accuracy": 0.8835693229232314,
|
||
|
|
"epoch": 1.5405058415714468,
|
||
|
|
"step": 6000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.569896125793457,
|
||
|
|
"grad_norm": 0.482421875,
|
||
|
|
"learning_rate": 1.097831322661502e-05,
|
||
|
|
"entropy": 0.5651502677053213,
|
||
|
|
"num_tokens": 48077668.0,
|
||
|
|
"mean_token_accuracy": 0.8855502404272556,
|
||
|
|
"epoch": 1.5661830787007318,
|
||
|
|
"step": 6100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5741934204101562,
|
||
|
|
"grad_norm": 0.421875,
|
||
|
|
"learning_rate": 1.0680609919409147e-05,
|
||
|
|
"entropy": 0.5667455117404461,
|
||
|
|
"num_tokens": 48866262.0,
|
||
|
|
"mean_token_accuracy": 0.8851974782347679,
|
||
|
|
"epoch": 1.5918603158300166,
|
||
|
|
"step": 6200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5769135665893554,
|
||
|
|
"grad_norm": 0.48828125,
|
||
|
|
"learning_rate": 1.0382299226500746e-05,
|
||
|
|
"entropy": 0.5715000756084919,
|
||
|
|
"num_tokens": 49654335.0,
|
||
|
|
"mean_token_accuracy": 0.884270426928997,
|
||
|
|
"epoch": 1.6175375529593015,
|
||
|
|
"step": 6300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5753298568725586,
|
||
|
|
"grad_norm": 0.48828125,
|
||
|
|
"learning_rate": 1.0083647364476762e-05,
|
||
|
|
"entropy": 0.5683304871618747,
|
||
|
|
"num_tokens": 50442084.0,
|
||
|
|
"mean_token_accuracy": 0.8846939514577389,
|
||
|
|
"epoch": 1.6432147900885865,
|
||
|
|
"step": 6400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5697883605957031,
|
||
|
|
"grad_norm": 0.458984375,
|
||
|
|
"learning_rate": 9.784920854388168e-06,
|
||
|
|
"entropy": 0.5628506948053836,
|
||
|
|
"num_tokens": 51229616.0,
|
||
|
|
"mean_token_accuracy": 0.8859600865840912,
|
||
|
|
"epoch": 1.6688920272178713,
|
||
|
|
"step": 6500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.5846357345581055,
|
||
|
|
"eval_runtime": 54.7854,
|
||
|
|
"eval_samples_per_second": 246.671,
|
||
|
|
"eval_steps_per_second": 30.848,
|
||
|
|
"eval_entropy": 0.5706642069231124,
|
||
|
|
"eval_num_tokens": 51229616.0,
|
||
|
|
"eval_mean_token_accuracy": 0.8836596347171174,
|
||
|
|
"epoch": 1.6688920272178713,
|
||
|
|
"step": 6500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5802217102050782,
|
||
|
|
"grad_norm": 0.4609375,
|
||
|
|
"learning_rate": 9.486386283902909e-06,
|
||
|
|
"entropy": 0.5745575051009655,
|
||
|
|
"num_tokens": 52018364.0,
|
||
|
|
"mean_token_accuracy": 0.8832403010129929,
|
||
|
|
"epoch": 1.6945692643471562,
|
||
|
|
"step": 6600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5694149780273438,
|
||
|
|
"grad_norm": 0.5,
|
||
|
|
"learning_rate": 9.188310069399368e-06,
|
||
|
|
"entropy": 0.5643654198944569,
|
||
|
|
"num_tokens": 52807100.0,
|
||
|
|
"mean_token_accuracy": 0.8856586934626103,
|
||
|
|
"epoch": 1.7202465014764412,
|
||
|
|
"step": 6700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5712068176269531,
|
||
|
|
"grad_norm": 0.470703125,
|
||
|
|
"learning_rate": 8.890958218212716e-06,
|
||
|
|
"entropy": 0.5652366243302822,
|
||
|
|
"num_tokens": 53594818.0,
|
||
|
|
"mean_token_accuracy": 0.8852976742386818,
|
||
|
|
"epoch": 1.745923738605726,
|
||
|
|
"step": 6800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.572123908996582,
|
||
|
|
"grad_norm": 0.455078125,
|
||
|
|
"learning_rate": 8.594596091246282e-06,
|
||
|
|
"entropy": 0.5659339886903763,
|
||
|
|
"num_tokens": 54382275.0,
|
||
|
|
"mean_token_accuracy": 0.8855576632916927,
|
||
|
|
"epoch": 1.7716009757350109,
|
||
|
|
"step": 6900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5673455810546875,
|
||
|
|
"grad_norm": 0.466796875,
|
||
|
|
"learning_rate": 8.299488166159817e-06,
|
||
|
|
"entropy": 0.5603441470861434,
|
||
|
|
"num_tokens": 55171058.0,
|
||
|
|
"mean_token_accuracy": 0.886252126544714,
|
||
|
|
"epoch": 1.797278212864296,
|
||
|
|
"step": 7000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.5840376019477844,
|
||
|
|
"eval_runtime": 54.7528,
|
||
|
|
"eval_samples_per_second": 246.819,
|
||
|
|
"eval_steps_per_second": 30.866,
|
||
|
|
"eval_entropy": 0.5723238170499633,
|
||
|
|
"eval_num_tokens": 55171058.0,
|
||
|
|
"eval_mean_token_accuracy": 0.8837451899898123,
|
||
|
|
"epoch": 1.797278212864296,
|
||
|
|
"step": 7000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5724852371215821,
|
||
|
|
"grad_norm": 0.470703125,
|
||
|
|
"learning_rate": 8.005897801345976e-06,
|
||
|
|
"entropy": 0.5678604581952095,
|
||
|
|
"num_tokens": 55960002.0,
|
||
|
|
"mean_token_accuracy": 0.8852102899551392,
|
||
|
|
"epoch": 1.8229554499935807,
|
||
|
|
"step": 7100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5700299072265625,
|
||
|
|
"grad_norm": 0.431640625,
|
||
|
|
"learning_rate": 7.714087000905643e-06,
|
||
|
|
"entropy": 0.5633737741410733,
|
||
|
|
"num_tokens": 56748093.0,
|
||
|
|
"mean_token_accuracy": 0.8857182741165162,
|
||
|
|
"epoch": 1.8486326871228655,
|
||
|
|
"step": 7200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5658547592163086,
|
||
|
|
"grad_norm": 0.4765625,
|
||
|
|
"learning_rate": 7.4243161808318465e-06,
|
||
|
|
"entropy": 0.5595473421365023,
|
||
|
|
"num_tokens": 57536251.0,
|
||
|
|
"mean_token_accuracy": 0.8862883093953132,
|
||
|
|
"epoch": 1.8743099242521506,
|
||
|
|
"step": 7300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5735882186889648,
|
||
|
|
"grad_norm": 0.5078125,
|
||
|
|
"learning_rate": 7.136843936610935e-06,
|
||
|
|
"entropy": 0.5662303336709738,
|
||
|
|
"num_tokens": 58324650.0,
|
||
|
|
"mean_token_accuracy": 0.88537473320961,
|
||
|
|
"epoch": 1.8999871613814352,
|
||
|
|
"step": 7400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5727163696289063,
|
||
|
|
"grad_norm": 0.470703125,
|
||
|
|
"learning_rate": 6.851926812448384e-06,
|
||
|
|
"entropy": 0.5662438022345304,
|
||
|
|
"num_tokens": 59112829.0,
|
||
|
|
"mean_token_accuracy": 0.8850460651516915,
|
||
|
|
"epoch": 1.9256643985107202,
|
||
|
|
"step": 7500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.5837904810905457,
|
||
|
|
"eval_runtime": 54.7816,
|
||
|
|
"eval_samples_per_second": 246.689,
|
||
|
|
"eval_steps_per_second": 30.85,
|
||
|
|
"eval_entropy": 0.5699704227715554,
|
||
|
|
"eval_num_tokens": 59112829.0,
|
||
|
|
"eval_mean_token_accuracy": 0.8838138662146393,
|
||
|
|
"epoch": 1.9256643985107202,
|
||
|
|
"step": 7500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5668845367431641,
|
||
|
|
"grad_norm": 0.43359375,
|
||
|
|
"learning_rate": 6.569819072325195e-06,
|
||
|
|
"entropy": 0.5618672482669353,
|
||
|
|
"num_tokens": 59899148.0,
|
||
|
|
"mean_token_accuracy": 0.8864543893933297,
|
||
|
|
"epoch": 1.9513416356400053,
|
||
|
|
"step": 7600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5704514694213867,
|
||
|
|
"grad_norm": 0.4609375,
|
||
|
|
"learning_rate": 6.290772473089214e-06,
|
||
|
|
"entropy": 0.5634412594884634,
|
||
|
|
"num_tokens": 60687114.0,
|
||
|
|
"mean_token_accuracy": 0.8852646884322166,
|
||
|
|
"epoch": 1.97701887276929,
|
||
|
|
"step": 7700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5628739929199219,
|
||
|
|
"grad_norm": 0.42578125,
|
||
|
|
"learning_rate": 6.015036039783836e-06,
|
||
|
|
"entropy": 0.5597166302964915,
|
||
|
|
"num_tokens": 61470852.0,
|
||
|
|
"mean_token_accuracy": 0.8867412068736014,
|
||
|
|
"epoch": 2.0025677237129287,
|
||
|
|
"step": 7800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5704060363769531,
|
||
|
|
"grad_norm": 0.466796875,
|
||
|
|
"learning_rate": 5.74285584341461e-06,
|
||
|
|
"entropy": 0.5638976936042309,
|
||
|
|
"num_tokens": 62258538.0,
|
||
|
|
"mean_token_accuracy": 0.8849544721841812,
|
||
|
|
"epoch": 2.0282449608422133,
|
||
|
|
"step": 7900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5678920364379882,
|
||
|
|
"grad_norm": 0.44140625,
|
||
|
|
"learning_rate": 5.474474781352066e-06,
|
||
|
|
"entropy": 0.5600234078615904,
|
||
|
|
"num_tokens": 63047491.0,
|
||
|
|
"mean_token_accuracy": 0.8858190993964672,
|
||
|
|
"epoch": 2.0539221979714983,
|
||
|
|
"step": 8000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.5835979580879211,
|
||
|
|
"eval_runtime": 54.7541,
|
||
|
|
"eval_samples_per_second": 246.813,
|
||
|
|
"eval_steps_per_second": 30.865,
|
||
|
|
"eval_entropy": 0.5672422566181103,
|
||
|
|
"eval_num_tokens": 63047491.0,
|
||
|
|
"eval_mean_token_accuracy": 0.8837912394802951,
|
||
|
|
"epoch": 2.0539221979714983,
|
||
|
|
"step": 8000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5638013076782227,
|
||
|
|
"grad_norm": 0.46875,
|
||
|
|
"learning_rate": 5.210132360566756e-06,
|
||
|
|
"entropy": 0.5581559921056032,
|
||
|
|
"num_tokens": 63835062.0,
|
||
|
|
"mean_token_accuracy": 0.8870502449572086,
|
||
|
|
"epoch": 2.079599435100783,
|
||
|
|
"step": 8100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5686990737915039,
|
||
|
|
"grad_norm": 0.48046875,
|
||
|
|
"learning_rate": 4.95006448388992e-06,
|
||
|
|
"entropy": 0.5634753279387951,
|
||
|
|
"num_tokens": 64622452.0,
|
||
|
|
"mean_token_accuracy": 0.8858319355547428,
|
||
|
|
"epoch": 2.105276672230068,
|
||
|
|
"step": 8200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5653612899780274,
|
||
|
|
"grad_norm": 0.51953125,
|
||
|
|
"learning_rate": 4.69450323949053e-06,
|
||
|
|
"entropy": 0.560463598370552,
|
||
|
|
"num_tokens": 65410929.0,
|
||
|
|
"mean_token_accuracy": 0.8861120358109474,
|
||
|
|
"epoch": 2.130953909359353,
|
||
|
|
"step": 8300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5681312561035157,
|
||
|
|
"grad_norm": 0.44921875,
|
||
|
|
"learning_rate": 4.443676693756599e-06,
|
||
|
|
"entropy": 0.5618513525277377,
|
||
|
|
"num_tokens": 66199581.0,
|
||
|
|
"mean_token_accuracy": 0.8856175914406776,
|
||
|
|
"epoch": 2.1566311464886376,
|
||
|
|
"step": 8400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5668899536132812,
|
||
|
|
"grad_norm": 0.4921875,
|
||
|
|
"learning_rate": 4.197808687765592e-06,
|
||
|
|
"entropy": 0.5613885246962309,
|
||
|
|
"num_tokens": 66988012.0,
|
||
|
|
"mean_token_accuracy": 0.8863773132860661,
|
||
|
|
"epoch": 2.1823083836179227,
|
||
|
|
"step": 8500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.5835039019584656,
|
||
|
|
"eval_runtime": 54.7586,
|
||
|
|
"eval_samples_per_second": 246.792,
|
||
|
|
"eval_steps_per_second": 30.863,
|
||
|
|
"eval_entropy": 0.567190251882965,
|
||
|
|
"eval_num_tokens": 66988012.0,
|
||
|
|
"eval_mean_token_accuracy": 0.883822848705145,
|
||
|
|
"epoch": 2.1823083836179227,
|
||
|
|
"step": 8500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5656906509399414,
|
||
|
|
"grad_norm": 0.4921875,
|
||
|
|
"learning_rate": 3.957118637525545e-06,
|
||
|
|
"entropy": 0.5595758294314146,
|
||
|
|
"num_tokens": 67776064.0,
|
||
|
|
"mean_token_accuracy": 0.8866737915575504,
|
||
|
|
"epoch": 2.2079856207472077,
|
||
|
|
"step": 8600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5707157897949219,
|
||
|
|
"grad_norm": 0.462890625,
|
||
|
|
"learning_rate": 3.721821338165191e-06,
|
||
|
|
"entropy": 0.5654953311383725,
|
||
|
|
"num_tokens": 68564254.0,
|
||
|
|
"mean_token_accuracy": 0.8849711737036705,
|
||
|
|
"epoch": 2.2336628578764923,
|
||
|
|
"step": 8700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.56755859375,
|
||
|
|
"grad_norm": 0.486328125,
|
||
|
|
"learning_rate": 3.4921267722478115e-06,
|
||
|
|
"entropy": 0.561460267007351,
|
||
|
|
"num_tokens": 69352920.0,
|
||
|
|
"mean_token_accuracy": 0.8862171630561352,
|
||
|
|
"epoch": 2.2593400950057774,
|
||
|
|
"step": 8800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5743030929565429,
|
||
|
|
"grad_norm": 0.50390625,
|
||
|
|
"learning_rate": 3.2682399223799045e-06,
|
||
|
|
"entropy": 0.5674323912709951,
|
||
|
|
"num_tokens": 70141047.0,
|
||
|
|
"mean_token_accuracy": 0.8847744387388229,
|
||
|
|
"epoch": 2.2850173321350624,
|
||
|
|
"step": 8900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5642405319213867,
|
||
|
|
"grad_norm": 0.5078125,
|
||
|
|
"learning_rate": 3.0503605882818623e-06,
|
||
|
|
"entropy": 0.5593039158731699,
|
||
|
|
"num_tokens": 70929498.0,
|
||
|
|
"mean_token_accuracy": 0.8862531779706478,
|
||
|
|
"epoch": 2.310694569264347,
|
||
|
|
"step": 9000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.5834186673164368,
|
||
|
|
"eval_runtime": 54.7257,
|
||
|
|
"eval_samples_per_second": 246.941,
|
||
|
|
"eval_steps_per_second": 30.881,
|
||
|
|
"eval_entropy": 0.565591881455049,
|
||
|
|
"eval_num_tokens": 70929498.0,
|
||
|
|
"eval_mean_token_accuracy": 0.8838287513636979,
|
||
|
|
"epoch": 2.310694569264347,
|
||
|
|
"step": 9000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5682920455932617,
|
||
|
|
"grad_norm": 0.486328125,
|
||
|
|
"learning_rate": 2.838683208483931e-06,
|
||
|
|
"entropy": 0.5619643439352512,
|
||
|
|
"num_tokens": 71718369.0,
|
||
|
|
"mean_token_accuracy": 0.8859986425936222,
|
||
|
|
"epoch": 2.336371806393632,
|
||
|
|
"step": 9100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5623750305175781,
|
||
|
|
"grad_norm": 0.46484375,
|
||
|
|
"learning_rate": 2.633396686806604e-06,
|
||
|
|
"entropy": 0.558722367361188,
|
||
|
|
"num_tokens": 72506753.0,
|
||
|
|
"mean_token_accuracy": 0.8863999578356743,
|
||
|
|
"epoch": 2.362049043522917,
|
||
|
|
"step": 9200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5646149063110352,
|
||
|
|
"grad_norm": 0.51953125,
|
||
|
|
"learning_rate": 2.4346842237802137e-06,
|
||
|
|
"entropy": 0.5581269838660955,
|
||
|
|
"num_tokens": 73294192.0,
|
||
|
|
"mean_token_accuracy": 0.88635782122612,
|
||
|
|
"epoch": 2.3877262806522017,
|
||
|
|
"step": 9300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5689778137207031,
|
||
|
|
"grad_norm": 0.50390625,
|
||
|
|
"learning_rate": 2.2427231531542605e-06,
|
||
|
|
"entropy": 0.5617135275900363,
|
||
|
|
"num_tokens": 74082610.0,
|
||
|
|
"mean_token_accuracy": 0.8854446165263653,
|
||
|
|
"epoch": 2.4134035177814868,
|
||
|
|
"step": 9400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5708549880981445,
|
||
|
|
"grad_norm": 0.451171875,
|
||
|
|
"learning_rate": 2.057684783642321e-06,
|
||
|
|
"entropy": 0.5636298792064189,
|
||
|
|
"num_tokens": 74870230.0,
|
||
|
|
"mean_token_accuracy": 0.884946842044592,
|
||
|
|
"epoch": 2.439080754910772,
|
||
|
|
"step": 9500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.5833942294120789,
|
||
|
|
"eval_runtime": 54.7721,
|
||
|
|
"eval_samples_per_second": 246.731,
|
||
|
|
"eval_steps_per_second": 30.855,
|
||
|
|
"eval_entropy": 0.5652080434666583,
|
||
|
|
"eval_num_tokens": 74870230.0,
|
||
|
|
"eval_mean_token_accuracy": 0.8838422659938857,
|
||
|
|
"epoch": 2.439080754910772,
|
||
|
|
"step": 9500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.563609848022461,
|
||
|
|
"grad_norm": 0.482421875,
|
||
|
|
"learning_rate": 1.8797342460437773e-06,
|
||
|
|
"entropy": 0.5577716715633869,
|
||
|
|
"num_tokens": 75659042.0,
|
||
|
|
"mean_token_accuracy": 0.886573301255703,
|
||
|
|
"epoch": 2.4647579920400564,
|
||
|
|
"step": 9600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.561457405090332,
|
||
|
|
"grad_norm": 0.423828125,
|
||
|
|
"learning_rate": 1.7090303458788138e-06,
|
||
|
|
"entropy": 0.5553829142451286,
|
||
|
|
"num_tokens": 76448289.0,
|
||
|
|
"mean_token_accuracy": 0.887224535793066,
|
||
|
|
"epoch": 2.4904352291693415,
|
||
|
|
"step": 9700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5658607101440429,
|
||
|
|
"grad_norm": 0.458984375,
|
||
|
|
"learning_rate": 1.5457254216681706e-06,
|
||
|
|
"entropy": 0.5601032677292824,
|
||
|
|
"num_tokens": 77237168.0,
|
||
|
|
"mean_token_accuracy": 0.8859628559648991,
|
||
|
|
"epoch": 2.516112466298626,
|
||
|
|
"step": 9800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5639831924438476,
|
||
|
|
"grad_norm": 0.48828125,
|
||
|
|
"learning_rate": 1.3899652089841475e-06,
|
||
|
|
"entropy": 0.5573407121002674,
|
||
|
|
"num_tokens": 78025882.0,
|
||
|
|
"mean_token_accuracy": 0.8864368468523025,
|
||
|
|
"epoch": 2.541789703427911,
|
||
|
|
"step": 9900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5681489562988281,
|
||
|
|
"grad_norm": 0.5,
|
||
|
|
"learning_rate": 1.2418887103941613e-06,
|
||
|
|
"entropy": 0.559699100330472,
|
||
|
|
"num_tokens": 78811967.0,
|
||
|
|
"mean_token_accuracy": 0.8863385920226574,
|
||
|
|
"epoch": 2.567466940557196,
|
||
|
|
"step": 10000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.5833701491355896,
|
||
|
|
"eval_runtime": 54.7792,
|
||
|
|
"eval_samples_per_second": 246.699,
|
||
|
|
"eval_steps_per_second": 30.851,
|
||
|
|
"eval_entropy": 0.5655020334487836,
|
||
|
|
"eval_num_tokens": 78811967.0,
|
||
|
|
"eval_mean_token_accuracy": 0.8838385548111956,
|
||
|
|
"epoch": 2.567466940557196,
|
||
|
|
"step": 10000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5677408981323242,
|
||
|
|
"grad_norm": 0.466796875,
|
||
|
|
"learning_rate": 1.10162807141293e-06,
|
||
|
|
"entropy": 0.561597905009985,
|
||
|
|
"num_tokens": 79600687.0,
|
||
|
|
"mean_token_accuracy": 0.885823979228735,
|
||
|
|
"epoch": 2.593144177686481,
|
||
|
|
"step": 10100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5654913711547852,
|
||
|
|
"grad_norm": 0.4453125,
|
||
|
|
"learning_rate": 9.693084625739946e-07,
|
||
|
|
"entropy": 0.5597928422689438,
|
||
|
|
"num_tokens": 80387505.0,
|
||
|
|
"mean_token_accuracy": 0.8869075067341328,
|
||
|
|
"epoch": 2.618821414815766,
|
||
|
|
"step": 10200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.570673713684082,
|
||
|
|
"grad_norm": 0.431640625,
|
||
|
|
"learning_rate": 8.450479677257962e-07,
|
||
|
|
"entropy": 0.5644417992979288,
|
||
|
|
"num_tokens": 81176251.0,
|
||
|
|
"mean_token_accuracy": 0.8849282260239124,
|
||
|
|
"epoch": 2.644498651945051,
|
||
|
|
"step": 10300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5642371368408203,
|
||
|
|
"grad_norm": 0.50390625,
|
||
|
|
"learning_rate": 7.289574786520237e-07,
|
||
|
|
"entropy": 0.5583383259177208,
|
||
|
|
"num_tokens": 81964977.0,
|
||
|
|
"mean_token_accuracy": 0.886664853990078,
|
||
|
|
"epoch": 2.6701758890743355,
|
||
|
|
"step": 10400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5651642227172852,
|
||
|
|
"grad_norm": 0.451171875,
|
||
|
|
"learning_rate": 6.211405961102512e-07,
|
||
|
|
"entropy": 0.5622740215063096,
|
||
|
|
"num_tokens": 82752889.0,
|
||
|
|
"mean_token_accuracy": 0.8858870002627373,
|
||
|
|
"epoch": 2.6958531262036205,
|
||
|
|
"step": 10500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.5833808779716492,
|
||
|
|
"eval_runtime": 54.7956,
|
||
|
|
"eval_samples_per_second": 246.626,
|
||
|
|
"eval_steps_per_second": 30.842,
|
||
|
|
"eval_entropy": 0.5655967255668527,
|
||
|
|
"eval_num_tokens": 82752889.0,
|
||
|
|
"eval_mean_token_accuracy": 0.8838407609589707,
|
||
|
|
"epoch": 2.6958531262036205,
|
||
|
|
"step": 10500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5681766510009766,
|
||
|
|
"grad_norm": 0.451171875,
|
||
|
|
"learning_rate": 5.216935373771859e-07,
|
||
|
|
"entropy": 0.5597222227603197,
|
||
|
|
"num_tokens": 83540835.0,
|
||
|
|
"mean_token_accuracy": 0.8863530996441841,
|
||
|
|
"epoch": 2.7215303633329055,
|
||
|
|
"step": 10600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5648283767700195,
|
||
|
|
"grad_norm": 0.51171875,
|
||
|
|
"learning_rate": 4.307050503830457e-07,
|
||
|
|
"entropy": 0.5591636901348829,
|
||
|
|
"num_tokens": 84328863.0,
|
||
|
|
"mean_token_accuracy": 0.8865030969679356,
|
||
|
|
"epoch": 2.74720760046219,
|
||
|
|
"step": 10700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5656902694702148,
|
||
|
|
"grad_norm": 0.45703125,
|
||
|
|
"learning_rate": 3.482563345116763e-07,
|
||
|
|
"entropy": 0.5604699329286814,
|
||
|
|
"num_tokens": 85116662.0,
|
||
|
|
"mean_token_accuracy": 0.8866713227331638,
|
||
|
|
"epoch": 2.772884837591475,
|
||
|
|
"step": 10800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5667910003662109,
|
||
|
|
"grad_norm": 0.462890625,
|
||
|
|
"learning_rate": 2.7442096813709684e-07,
|
||
|
|
"entropy": 0.5603388192504645,
|
||
|
|
"num_tokens": 85905228.0,
|
||
|
|
"mean_token_accuracy": 0.8865354016423226,
|
||
|
|
"epoch": 2.79856207472076,
|
||
|
|
"step": 10900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5637351608276367,
|
||
|
|
"grad_norm": 0.5,
|
||
|
|
"learning_rate": 2.0926484296114324e-07,
|
||
|
|
"entropy": 0.5602291403710842,
|
||
|
|
"num_tokens": 86693156.0,
|
||
|
|
"mean_token_accuracy": 0.8864241135120392,
|
||
|
|
"epoch": 2.824239311850045,
|
||
|
|
"step": 11000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.5833633542060852,
|
||
|
|
"eval_runtime": 54.7866,
|
||
|
|
"eval_samples_per_second": 246.666,
|
||
|
|
"eval_steps_per_second": 30.847,
|
||
|
|
"eval_entropy": 0.5657883760668116,
|
||
|
|
"eval_num_tokens": 86693156.0,
|
||
|
|
"eval_mean_token_accuracy": 0.8838432300725633,
|
||
|
|
"epoch": 2.824239311850045,
|
||
|
|
"step": 11000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5719998931884765,
|
||
|
|
"grad_norm": 0.447265625,
|
||
|
|
"learning_rate": 1.5284610521080323e-07,
|
||
|
|
"entropy": 0.5649934285134077,
|
||
|
|
"num_tokens": 87481998.0,
|
||
|
|
"mean_token_accuracy": 0.8849548317492009,
|
||
|
|
"epoch": 2.84991654897933,
|
||
|
|
"step": 11100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5635247802734376,
|
||
|
|
"grad_norm": 0.44921875,
|
||
|
|
"learning_rate": 1.0521510374771781e-07,
|
||
|
|
"entropy": 0.5568317195028066,
|
||
|
|
"num_tokens": 88271222.0,
|
||
|
|
"mean_token_accuracy": 0.8868983842432498,
|
||
|
|
"epoch": 2.875593786108615,
|
||
|
|
"step": 11200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5720051956176758,
|
||
|
|
"grad_norm": 0.5234375,
|
||
|
|
"learning_rate": 6.641434513616208e-08,
|
||
|
|
"entropy": 0.5664055179804564,
|
||
|
|
"num_tokens": 89059356.0,
|
||
|
|
"mean_token_accuracy": 0.8851540146768093,
|
||
|
|
"epoch": 2.9012710232378995,
|
||
|
|
"step": 11300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5645006942749023,
|
||
|
|
"grad_norm": 0.435546875,
|
||
|
|
"learning_rate": 3.6478455709598735e-08,
|
||
|
|
"entropy": 0.557126591950655,
|
||
|
|
"num_tokens": 89847466.0,
|
||
|
|
"mean_token_accuracy": 0.8866650801897049,
|
||
|
|
"epoch": 2.9269482603671846,
|
||
|
|
"step": 11400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5697602462768555,
|
||
|
|
"grad_norm": 0.48828125,
|
||
|
|
"learning_rate": 1.543415066966092e-08,
|
||
|
|
"entropy": 0.5643645803630352,
|
||
|
|
"num_tokens": 90636203.0,
|
||
|
|
"mean_token_accuracy": 0.8856160227954387,
|
||
|
|
"epoch": 2.952625497496469,
|
||
|
|
"step": 11500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"eval_loss": 0.5833660960197449,
|
||
|
|
"eval_runtime": 54.7696,
|
||
|
|
"eval_samples_per_second": 246.743,
|
||
|
|
"eval_steps_per_second": 30.857,
|
||
|
|
"eval_entropy": 0.5657193848014583,
|
||
|
|
"eval_num_tokens": 90636203.0,
|
||
|
|
"eval_mean_token_accuracy": 0.8838451409833671,
|
||
|
|
"epoch": 2.952625497496469,
|
||
|
|
"step": 11500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"loss": 0.5682589721679687,
|
||
|
|
"grad_norm": 0.46875,
|
||
|
|
"learning_rate": 3.3002102451362704e-09,
|
||
|
|
"entropy": 0.5637810256332159,
|
||
|
|
"num_tokens": 91424572.0,
|
||
|
|
"mean_token_accuracy": 0.8857142019271851,
|
||
|
|
"epoch": 2.9783027346257542,
|
||
|
|
"step": 11600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"train_runtime": 7320.9778,
|
||
|
|
"train_samples_per_second": 51.066,
|
||
|
|
"train_steps_per_second": 1.596,
|
||
|
|
"total_flos": 3.293347744559923e+17,
|
||
|
|
"train_loss": 0.6363640229825439,
|
||
|
|
"entropy": 0.5615131076447357,
|
||
|
|
"num_tokens": 92088141.0,
|
||
|
|
"mean_token_accuracy": 0.8857036404003052,
|
||
|
|
"epoch": 3.0,
|
||
|
|
"step": 11685
|
||
|
|
}
|
||
|
|
]
|