7976 lines
215 KiB
JSON
7976 lines
215 KiB
JSON
|
|
{
|
||
|
|
"best_global_step": null,
|
||
|
|
"best_metric": null,
|
||
|
|
"best_model_checkpoint": null,
|
||
|
|
"epoch": 1.0,
|
||
|
|
"eval_steps": 500,
|
||
|
|
"global_step": 793,
|
||
|
|
"is_hyper_param_search": false,
|
||
|
|
"is_local_process_zero": true,
|
||
|
|
"is_world_process_zero": true,
|
||
|
|
"log_history": [
|
||
|
|
{
|
||
|
|
"entropy": 2.7950327396392822,
|
||
|
|
"epoch": 0.0012610340479192938,
|
||
|
|
"grad_norm": 86.0,
|
||
|
|
"learning_rate": 0.0,
|
||
|
|
"loss": 3.5353,
|
||
|
|
"mean_token_accuracy": 0.4060741662979126,
|
||
|
|
"num_tokens": 980.0,
|
||
|
|
"step": 1
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.8440327644348145,
|
||
|
|
"epoch": 0.0025220680958385876,
|
||
|
|
"grad_norm": 97.5,
|
||
|
|
"learning_rate": 1.0000000000000002e-06,
|
||
|
|
"loss": 3.8445,
|
||
|
|
"mean_token_accuracy": 0.38956092298030853,
|
||
|
|
"num_tokens": 1845.0,
|
||
|
|
"step": 2
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.69694983959198,
|
||
|
|
"epoch": 0.0037831021437578815,
|
||
|
|
"grad_norm": 79.5,
|
||
|
|
"learning_rate": 2.0000000000000003e-06,
|
||
|
|
"loss": 3.5857,
|
||
|
|
"mean_token_accuracy": 0.3938943147659302,
|
||
|
|
"num_tokens": 2881.0,
|
||
|
|
"step": 3
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.7534079551696777,
|
||
|
|
"epoch": 0.005044136191677175,
|
||
|
|
"grad_norm": 82.0,
|
||
|
|
"learning_rate": 3e-06,
|
||
|
|
"loss": 3.5584,
|
||
|
|
"mean_token_accuracy": 0.39021462202072144,
|
||
|
|
"num_tokens": 3852.0,
|
||
|
|
"step": 4
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.6539840698242188,
|
||
|
|
"epoch": 0.006305170239596469,
|
||
|
|
"grad_norm": 76.0,
|
||
|
|
"learning_rate": 4.000000000000001e-06,
|
||
|
|
"loss": 3.3509,
|
||
|
|
"mean_token_accuracy": 0.4235767424106598,
|
||
|
|
"num_tokens": 4863.0,
|
||
|
|
"step": 5
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.6439151763916016,
|
||
|
|
"epoch": 0.007566204287515763,
|
||
|
|
"grad_norm": 64.0,
|
||
|
|
"learning_rate": 5e-06,
|
||
|
|
"loss": 3.1652,
|
||
|
|
"mean_token_accuracy": 0.4303048998117447,
|
||
|
|
"num_tokens": 5954.0,
|
||
|
|
"step": 6
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.785458564758301,
|
||
|
|
"epoch": 0.008827238335435058,
|
||
|
|
"grad_norm": 65.0,
|
||
|
|
"learning_rate": 6e-06,
|
||
|
|
"loss": 3.2856,
|
||
|
|
"mean_token_accuracy": 0.4154505133628845,
|
||
|
|
"num_tokens": 6992.0,
|
||
|
|
"step": 7
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.7383415699005127,
|
||
|
|
"epoch": 0.01008827238335435,
|
||
|
|
"grad_norm": 62.75,
|
||
|
|
"learning_rate": 7e-06,
|
||
|
|
"loss": 3.1293,
|
||
|
|
"mean_token_accuracy": 0.44174981117248535,
|
||
|
|
"num_tokens": 8050.0,
|
||
|
|
"step": 8
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.817816376686096,
|
||
|
|
"epoch": 0.011349306431273645,
|
||
|
|
"grad_norm": 57.5,
|
||
|
|
"learning_rate": 8.000000000000001e-06,
|
||
|
|
"loss": 3.1222,
|
||
|
|
"mean_token_accuracy": 0.41762831807136536,
|
||
|
|
"num_tokens": 9098.0,
|
||
|
|
"step": 9
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.6982277631759644,
|
||
|
|
"epoch": 0.012610340479192938,
|
||
|
|
"grad_norm": 41.25,
|
||
|
|
"learning_rate": 9e-06,
|
||
|
|
"loss": 3.0842,
|
||
|
|
"mean_token_accuracy": 0.45535027980804443,
|
||
|
|
"num_tokens": 10107.0,
|
||
|
|
"step": 10
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.509028911590576,
|
||
|
|
"epoch": 0.013871374527112233,
|
||
|
|
"grad_norm": 25.25,
|
||
|
|
"learning_rate": 1e-05,
|
||
|
|
"loss": 2.7484,
|
||
|
|
"mean_token_accuracy": 0.47226977348327637,
|
||
|
|
"num_tokens": 11197.0,
|
||
|
|
"step": 11
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.4640557765960693,
|
||
|
|
"epoch": 0.015132408575031526,
|
||
|
|
"grad_norm": 23.0,
|
||
|
|
"learning_rate": 1.1000000000000001e-05,
|
||
|
|
"loss": 2.6703,
|
||
|
|
"mean_token_accuracy": 0.49717526137828827,
|
||
|
|
"num_tokens": 12259.0,
|
||
|
|
"step": 12
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.5797423124313354,
|
||
|
|
"epoch": 0.01639344262295082,
|
||
|
|
"grad_norm": 23.5,
|
||
|
|
"learning_rate": 1.2e-05,
|
||
|
|
"loss": 2.7376,
|
||
|
|
"mean_token_accuracy": 0.47545965015888214,
|
||
|
|
"num_tokens": 13300.0,
|
||
|
|
"step": 13
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.3857948780059814,
|
||
|
|
"epoch": 0.017654476670870115,
|
||
|
|
"grad_norm": 25.125,
|
||
|
|
"learning_rate": 1.3000000000000001e-05,
|
||
|
|
"loss": 2.3733,
|
||
|
|
"mean_token_accuracy": 0.528388500213623,
|
||
|
|
"num_tokens": 14346.0,
|
||
|
|
"step": 14
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.419264554977417,
|
||
|
|
"epoch": 0.018915510718789406,
|
||
|
|
"grad_norm": 21.125,
|
||
|
|
"learning_rate": 1.4e-05,
|
||
|
|
"loss": 2.4288,
|
||
|
|
"mean_token_accuracy": 0.510771781206131,
|
||
|
|
"num_tokens": 15334.0,
|
||
|
|
"step": 15
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.421216368675232,
|
||
|
|
"epoch": 0.0201765447667087,
|
||
|
|
"grad_norm": 18.75,
|
||
|
|
"learning_rate": 1.5000000000000002e-05,
|
||
|
|
"loss": 2.3786,
|
||
|
|
"mean_token_accuracy": 0.5227930545806885,
|
||
|
|
"num_tokens": 16359.0,
|
||
|
|
"step": 16
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.4401241540908813,
|
||
|
|
"epoch": 0.021437578814627996,
|
||
|
|
"grad_norm": 16.75,
|
||
|
|
"learning_rate": 1.6000000000000003e-05,
|
||
|
|
"loss": 2.4499,
|
||
|
|
"mean_token_accuracy": 0.5229149460792542,
|
||
|
|
"num_tokens": 17338.0,
|
||
|
|
"step": 17
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.210012912750244,
|
||
|
|
"epoch": 0.02269861286254729,
|
||
|
|
"grad_norm": 17.0,
|
||
|
|
"learning_rate": 1.7e-05,
|
||
|
|
"loss": 2.1433,
|
||
|
|
"mean_token_accuracy": 0.5634103715419769,
|
||
|
|
"num_tokens": 18440.0,
|
||
|
|
"step": 18
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.281220316886902,
|
||
|
|
"epoch": 0.02395964691046658,
|
||
|
|
"grad_norm": 15.375,
|
||
|
|
"learning_rate": 1.8e-05,
|
||
|
|
"loss": 2.2554,
|
||
|
|
"mean_token_accuracy": 0.5328912436962128,
|
||
|
|
"num_tokens": 19447.0,
|
||
|
|
"step": 19
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.2521049976348877,
|
||
|
|
"epoch": 0.025220680958385876,
|
||
|
|
"grad_norm": 16.25,
|
||
|
|
"learning_rate": 1.9e-05,
|
||
|
|
"loss": 2.1713,
|
||
|
|
"mean_token_accuracy": 0.5324675440788269,
|
||
|
|
"num_tokens": 20383.0,
|
||
|
|
"step": 20
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.100218653678894,
|
||
|
|
"epoch": 0.02648171500630517,
|
||
|
|
"grad_norm": 15.0,
|
||
|
|
"learning_rate": 2e-05,
|
||
|
|
"loss": 2.1158,
|
||
|
|
"mean_token_accuracy": 0.5483567118644714,
|
||
|
|
"num_tokens": 21428.0,
|
||
|
|
"step": 21
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.2065863609313965,
|
||
|
|
"epoch": 0.027742749054224466,
|
||
|
|
"grad_norm": 15.6875,
|
||
|
|
"learning_rate": 1.999991741329027e-05,
|
||
|
|
"loss": 2.2424,
|
||
|
|
"mean_token_accuracy": 0.5484118163585663,
|
||
|
|
"num_tokens": 22449.0,
|
||
|
|
"step": 22
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.20810329914093,
|
||
|
|
"epoch": 0.029003783102143757,
|
||
|
|
"grad_norm": 13.625,
|
||
|
|
"learning_rate": 1.9999669654525177e-05,
|
||
|
|
"loss": 2.2329,
|
||
|
|
"mean_token_accuracy": 0.5287463665008545,
|
||
|
|
"num_tokens": 23542.0,
|
||
|
|
"step": 23
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.1414037942886353,
|
||
|
|
"epoch": 0.03026481715006305,
|
||
|
|
"grad_norm": 14.5625,
|
||
|
|
"learning_rate": 1.999925672779705e-05,
|
||
|
|
"loss": 2.1067,
|
||
|
|
"mean_token_accuracy": 0.5522293150424957,
|
||
|
|
"num_tokens": 24653.0,
|
||
|
|
"step": 24
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.1838191747665405,
|
||
|
|
"epoch": 0.031525851197982346,
|
||
|
|
"grad_norm": 19.75,
|
||
|
|
"learning_rate": 1.999867863992634e-05,
|
||
|
|
"loss": 2.3647,
|
||
|
|
"mean_token_accuracy": 0.5000769197940826,
|
||
|
|
"num_tokens": 25561.0,
|
||
|
|
"step": 25
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.0990543365478516,
|
||
|
|
"epoch": 0.03278688524590164,
|
||
|
|
"grad_norm": 13.4375,
|
||
|
|
"learning_rate": 1.9997935400461514e-05,
|
||
|
|
"loss": 1.9901,
|
||
|
|
"mean_token_accuracy": 0.5530209839344025,
|
||
|
|
"num_tokens": 26646.0,
|
||
|
|
"step": 26
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.1618154048919678,
|
||
|
|
"epoch": 0.034047919293820936,
|
||
|
|
"grad_norm": 14.125,
|
||
|
|
"learning_rate": 1.9997027021678916e-05,
|
||
|
|
"loss": 2.2127,
|
||
|
|
"mean_token_accuracy": 0.5342467427253723,
|
||
|
|
"num_tokens": 27644.0,
|
||
|
|
"step": 27
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.23007869720459,
|
||
|
|
"epoch": 0.03530895334174023,
|
||
|
|
"grad_norm": 13.6875,
|
||
|
|
"learning_rate": 1.9995953518582553e-05,
|
||
|
|
"loss": 2.1241,
|
||
|
|
"mean_token_accuracy": 0.535846620798111,
|
||
|
|
"num_tokens": 28721.0,
|
||
|
|
"step": 28
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.2455257177352905,
|
||
|
|
"epoch": 0.03656998738965952,
|
||
|
|
"grad_norm": 14.0,
|
||
|
|
"learning_rate": 1.9994714908903837e-05,
|
||
|
|
"loss": 2.1248,
|
||
|
|
"mean_token_accuracy": 0.5323922038078308,
|
||
|
|
"num_tokens": 29794.0,
|
||
|
|
"step": 29
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.1954925060272217,
|
||
|
|
"epoch": 0.03783102143757881,
|
||
|
|
"grad_norm": 14.125,
|
||
|
|
"learning_rate": 1.9993311213101313e-05,
|
||
|
|
"loss": 2.1482,
|
||
|
|
"mean_token_accuracy": 0.5415486097335815,
|
||
|
|
"num_tokens": 30780.0,
|
||
|
|
"step": 30
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.19482421875,
|
||
|
|
"epoch": 0.03909205548549811,
|
||
|
|
"grad_norm": 14.1875,
|
||
|
|
"learning_rate": 1.99917424543603e-05,
|
||
|
|
"loss": 2.2413,
|
||
|
|
"mean_token_accuracy": 0.5033124387264252,
|
||
|
|
"num_tokens": 31825.0,
|
||
|
|
"step": 31
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.19892680644989,
|
||
|
|
"epoch": 0.0403530895334174,
|
||
|
|
"grad_norm": 13.875,
|
||
|
|
"learning_rate": 1.9990008658592527e-05,
|
||
|
|
"loss": 2.1698,
|
||
|
|
"mean_token_accuracy": 0.5146903991699219,
|
||
|
|
"num_tokens": 32894.0,
|
||
|
|
"step": 32
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.153947114944458,
|
||
|
|
"epoch": 0.0416141235813367,
|
||
|
|
"grad_norm": 12.9375,
|
||
|
|
"learning_rate": 1.9988109854435684e-05,
|
||
|
|
"loss": 2.0789,
|
||
|
|
"mean_token_accuracy": 0.5479936003684998,
|
||
|
|
"num_tokens": 33974.0,
|
||
|
|
"step": 33
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.0923315286636353,
|
||
|
|
"epoch": 0.04287515762925599,
|
||
|
|
"grad_norm": 13.875,
|
||
|
|
"learning_rate": 1.9986046073252975e-05,
|
||
|
|
"loss": 2.0017,
|
||
|
|
"mean_token_accuracy": 0.5312956869602203,
|
||
|
|
"num_tokens": 34996.0,
|
||
|
|
"step": 34
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.1483466625213623,
|
||
|
|
"epoch": 0.044136191677175286,
|
||
|
|
"grad_norm": 13.6875,
|
||
|
|
"learning_rate": 1.998381734913258e-05,
|
||
|
|
"loss": 2.1397,
|
||
|
|
"mean_token_accuracy": 0.5254786312580109,
|
||
|
|
"num_tokens": 36001.0,
|
||
|
|
"step": 35
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.114960551261902,
|
||
|
|
"epoch": 0.04539722572509458,
|
||
|
|
"grad_norm": 14.0625,
|
||
|
|
"learning_rate": 1.9981423718887096e-05,
|
||
|
|
"loss": 1.9213,
|
||
|
|
"mean_token_accuracy": 0.5552413165569305,
|
||
|
|
"num_tokens": 36938.0,
|
||
|
|
"step": 36
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.2198466062545776,
|
||
|
|
"epoch": 0.04665825977301387,
|
||
|
|
"grad_norm": 13.5625,
|
||
|
|
"learning_rate": 1.9978865222052927e-05,
|
||
|
|
"loss": 2.0422,
|
||
|
|
"mean_token_accuracy": 0.53462815284729,
|
||
|
|
"num_tokens": 37973.0,
|
||
|
|
"step": 37
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.1119529008865356,
|
||
|
|
"epoch": 0.04791929382093316,
|
||
|
|
"grad_norm": 13.5625,
|
||
|
|
"learning_rate": 1.997614190088965e-05,
|
||
|
|
"loss": 1.9186,
|
||
|
|
"mean_token_accuracy": 0.5696228444576263,
|
||
|
|
"num_tokens": 39015.0,
|
||
|
|
"step": 38
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.1889278888702393,
|
||
|
|
"epoch": 0.04918032786885246,
|
||
|
|
"grad_norm": 15.0,
|
||
|
|
"learning_rate": 1.9973253800379283e-05,
|
||
|
|
"loss": 2.1161,
|
||
|
|
"mean_token_accuracy": 0.5319362878799438,
|
||
|
|
"num_tokens": 39938.0,
|
||
|
|
"step": 39
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.123116612434387,
|
||
|
|
"epoch": 0.05044136191677175,
|
||
|
|
"grad_norm": 13.5625,
|
||
|
|
"learning_rate": 1.997020096822557e-05,
|
||
|
|
"loss": 1.934,
|
||
|
|
"mean_token_accuracy": 0.5706115663051605,
|
||
|
|
"num_tokens": 40973.0,
|
||
|
|
"step": 40
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.141296863555908,
|
||
|
|
"epoch": 0.05170239596469105,
|
||
|
|
"grad_norm": 13.875,
|
||
|
|
"learning_rate": 1.9966983454853193e-05,
|
||
|
|
"loss": 1.968,
|
||
|
|
"mean_token_accuracy": 0.5507127642631531,
|
||
|
|
"num_tokens": 42064.0,
|
||
|
|
"step": 41
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.083743929862976,
|
||
|
|
"epoch": 0.05296343001261034,
|
||
|
|
"grad_norm": 12.8125,
|
||
|
|
"learning_rate": 1.9963601313406916e-05,
|
||
|
|
"loss": 1.8898,
|
||
|
|
"mean_token_accuracy": 0.5689177513122559,
|
||
|
|
"num_tokens": 43103.0,
|
||
|
|
"step": 42
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.071545362472534,
|
||
|
|
"epoch": 0.05422446406052964,
|
||
|
|
"grad_norm": 13.25,
|
||
|
|
"learning_rate": 1.9960054599750718e-05,
|
||
|
|
"loss": 1.7968,
|
||
|
|
"mean_token_accuracy": 0.5993517637252808,
|
||
|
|
"num_tokens": 44136.0,
|
||
|
|
"step": 43
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.134101986885071,
|
||
|
|
"epoch": 0.05548549810844893,
|
||
|
|
"grad_norm": 14.5,
|
||
|
|
"learning_rate": 1.995634337246689e-05,
|
||
|
|
"loss": 1.9464,
|
||
|
|
"mean_token_accuracy": 0.5441032648086548,
|
||
|
|
"num_tokens": 45168.0,
|
||
|
|
"step": 44
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.1150457859039307,
|
||
|
|
"epoch": 0.05674653215636822,
|
||
|
|
"grad_norm": 14.75,
|
||
|
|
"learning_rate": 1.9952467692855043e-05,
|
||
|
|
"loss": 1.97,
|
||
|
|
"mean_token_accuracy": 0.5512273013591766,
|
||
|
|
"num_tokens": 46141.0,
|
||
|
|
"step": 45
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.144010305404663,
|
||
|
|
"epoch": 0.058007566204287514,
|
||
|
|
"grad_norm": 12.8125,
|
||
|
|
"learning_rate": 1.9948427624931094e-05,
|
||
|
|
"loss": 1.9934,
|
||
|
|
"mean_token_accuracy": 0.5609777271747589,
|
||
|
|
"num_tokens": 47185.0,
|
||
|
|
"step": 46
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.075677990913391,
|
||
|
|
"epoch": 0.05926860025220681,
|
||
|
|
"grad_norm": 14.5625,
|
||
|
|
"learning_rate": 1.9944223235426232e-05,
|
||
|
|
"loss": 1.9446,
|
||
|
|
"mean_token_accuracy": 0.547377347946167,
|
||
|
|
"num_tokens": 48112.0,
|
||
|
|
"step": 47
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.274110198020935,
|
||
|
|
"epoch": 0.0605296343001261,
|
||
|
|
"grad_norm": 13.5625,
|
||
|
|
"learning_rate": 1.9939854593785796e-05,
|
||
|
|
"loss": 1.9643,
|
||
|
|
"mean_token_accuracy": 0.5619737207889557,
|
||
|
|
"num_tokens": 49067.0,
|
||
|
|
"step": 48
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.1645387411117554,
|
||
|
|
"epoch": 0.0617906683480454,
|
||
|
|
"grad_norm": 14.5625,
|
||
|
|
"learning_rate": 1.9935321772168136e-05,
|
||
|
|
"loss": 1.9528,
|
||
|
|
"mean_token_accuracy": 0.5660497844219208,
|
||
|
|
"num_tokens": 50073.0,
|
||
|
|
"step": 49
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.223591923713684,
|
||
|
|
"epoch": 0.06305170239596469,
|
||
|
|
"grad_norm": 13.375,
|
||
|
|
"learning_rate": 1.993062484544341e-05,
|
||
|
|
"loss": 1.9164,
|
||
|
|
"mean_token_accuracy": 0.576151043176651,
|
||
|
|
"num_tokens": 51202.0,
|
||
|
|
"step": 50
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.0002373456954956,
|
||
|
|
"epoch": 0.06431273644388398,
|
||
|
|
"grad_norm": 13.25,
|
||
|
|
"learning_rate": 1.992576389119237e-05,
|
||
|
|
"loss": 1.6916,
|
||
|
|
"mean_token_accuracy": 0.615705132484436,
|
||
|
|
"num_tokens": 52210.0,
|
||
|
|
"step": 51
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.098063111305237,
|
||
|
|
"epoch": 0.06557377049180328,
|
||
|
|
"grad_norm": 14.0,
|
||
|
|
"learning_rate": 1.9920738989705054e-05,
|
||
|
|
"loss": 1.9394,
|
||
|
|
"mean_token_accuracy": 0.5619092583656311,
|
||
|
|
"num_tokens": 53140.0,
|
||
|
|
"step": 52
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.1132895946502686,
|
||
|
|
"epoch": 0.06683480453972257,
|
||
|
|
"grad_norm": 12.6875,
|
||
|
|
"learning_rate": 1.9915550223979482e-05,
|
||
|
|
"loss": 1.8591,
|
||
|
|
"mean_token_accuracy": 0.5690476298332214,
|
||
|
|
"num_tokens": 54243.0,
|
||
|
|
"step": 53
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.0955541133880615,
|
||
|
|
"epoch": 0.06809583858764187,
|
||
|
|
"grad_norm": 12.875,
|
||
|
|
"learning_rate": 1.991019767972027e-05,
|
||
|
|
"loss": 1.8968,
|
||
|
|
"mean_token_accuracy": 0.554290235042572,
|
||
|
|
"num_tokens": 55339.0,
|
||
|
|
"step": 54
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.1030133962631226,
|
||
|
|
"epoch": 0.06935687263556116,
|
||
|
|
"grad_norm": 14.0,
|
||
|
|
"learning_rate": 1.990468144533722e-05,
|
||
|
|
"loss": 1.9777,
|
||
|
|
"mean_token_accuracy": 0.5638581812381744,
|
||
|
|
"num_tokens": 56334.0,
|
||
|
|
"step": 55
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.0524032711982727,
|
||
|
|
"epoch": 0.07061790668348046,
|
||
|
|
"grad_norm": 13.125,
|
||
|
|
"learning_rate": 1.9899001611943865e-05,
|
||
|
|
"loss": 1.8719,
|
||
|
|
"mean_token_accuracy": 0.5665269494056702,
|
||
|
|
"num_tokens": 57380.0,
|
||
|
|
"step": 56
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.143702507019043,
|
||
|
|
"epoch": 0.07187894073139975,
|
||
|
|
"grad_norm": 13.6875,
|
||
|
|
"learning_rate": 1.9893158273355956e-05,
|
||
|
|
"loss": 1.86,
|
||
|
|
"mean_token_accuracy": 0.5789254605770111,
|
||
|
|
"num_tokens": 58371.0,
|
||
|
|
"step": 57
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.0837615728378296,
|
||
|
|
"epoch": 0.07313997477931904,
|
||
|
|
"grad_norm": 12.8125,
|
||
|
|
"learning_rate": 1.9887151526089908e-05,
|
||
|
|
"loss": 1.886,
|
||
|
|
"mean_token_accuracy": 0.5713573396205902,
|
||
|
|
"num_tokens": 59377.0,
|
||
|
|
"step": 58
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.095009446144104,
|
||
|
|
"epoch": 0.07440100882723834,
|
||
|
|
"grad_norm": 11.6875,
|
||
|
|
"learning_rate": 1.988098146936123e-05,
|
||
|
|
"loss": 1.8017,
|
||
|
|
"mean_token_accuracy": 0.5734412372112274,
|
||
|
|
"num_tokens": 60547.0,
|
||
|
|
"step": 59
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.013132631778717,
|
||
|
|
"epoch": 0.07566204287515763,
|
||
|
|
"grad_norm": 13.0625,
|
||
|
|
"learning_rate": 1.9874648205082847e-05,
|
||
|
|
"loss": 1.7583,
|
||
|
|
"mean_token_accuracy": 0.5976959466934204,
|
||
|
|
"num_tokens": 61544.0,
|
||
|
|
"step": 60
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.2874679565429688,
|
||
|
|
"epoch": 0.07692307692307693,
|
||
|
|
"grad_norm": 12.9375,
|
||
|
|
"learning_rate": 1.986815183786346e-05,
|
||
|
|
"loss": 2.0184,
|
||
|
|
"mean_token_accuracy": 0.5443170070648193,
|
||
|
|
"num_tokens": 62561.0,
|
||
|
|
"step": 61
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.035236895084381,
|
||
|
|
"epoch": 0.07818411097099622,
|
||
|
|
"grad_norm": 12.375,
|
||
|
|
"learning_rate": 1.9861492475005785e-05,
|
||
|
|
"loss": 1.7743,
|
||
|
|
"mean_token_accuracy": 0.5798207521438599,
|
||
|
|
"num_tokens": 63578.0,
|
||
|
|
"step": 62
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.1492056846618652,
|
||
|
|
"epoch": 0.07944514501891552,
|
||
|
|
"grad_norm": 14.5,
|
||
|
|
"learning_rate": 1.9854670226504792e-05,
|
||
|
|
"loss": 1.8485,
|
||
|
|
"mean_token_accuracy": 0.593048483133316,
|
||
|
|
"num_tokens": 64496.0,
|
||
|
|
"step": 63
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.2305855751037598,
|
||
|
|
"epoch": 0.0807061790668348,
|
||
|
|
"grad_norm": 11.75,
|
||
|
|
"learning_rate": 1.9847685205045896e-05,
|
||
|
|
"loss": 1.9991,
|
||
|
|
"mean_token_accuracy": 0.54645636677742,
|
||
|
|
"num_tokens": 65588.0,
|
||
|
|
"step": 64
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.2173393964767456,
|
||
|
|
"epoch": 0.08196721311475409,
|
||
|
|
"grad_norm": 12.5625,
|
||
|
|
"learning_rate": 1.9840537526003085e-05,
|
||
|
|
"loss": 2.0169,
|
||
|
|
"mean_token_accuracy": 0.5495975017547607,
|
||
|
|
"num_tokens": 66592.0,
|
||
|
|
"step": 65
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.1479790210723877,
|
||
|
|
"epoch": 0.0832282471626734,
|
||
|
|
"grad_norm": 11.5,
|
||
|
|
"learning_rate": 1.9833227307437018e-05,
|
||
|
|
"loss": 1.7981,
|
||
|
|
"mean_token_accuracy": 0.5722366571426392,
|
||
|
|
"num_tokens": 67636.0,
|
||
|
|
"step": 66
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.0105774998664856,
|
||
|
|
"epoch": 0.08448928121059268,
|
||
|
|
"grad_norm": 12.375,
|
||
|
|
"learning_rate": 1.982575467009307e-05,
|
||
|
|
"loss": 1.6853,
|
||
|
|
"mean_token_accuracy": 0.5884263515472412,
|
||
|
|
"num_tokens": 68598.0,
|
||
|
|
"step": 67
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.9725781679153442,
|
||
|
|
"epoch": 0.08575031525851198,
|
||
|
|
"grad_norm": 11.1875,
|
||
|
|
"learning_rate": 1.9818119737399357e-05,
|
||
|
|
"loss": 1.6855,
|
||
|
|
"mean_token_accuracy": 0.604888379573822,
|
||
|
|
"num_tokens": 69604.0,
|
||
|
|
"step": 68
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.0375980138778687,
|
||
|
|
"epoch": 0.08701134930643127,
|
||
|
|
"grad_norm": 11.5,
|
||
|
|
"learning_rate": 1.9810322635464662e-05,
|
||
|
|
"loss": 1.8189,
|
||
|
|
"mean_token_accuracy": 0.5355795323848724,
|
||
|
|
"num_tokens": 70614.0,
|
||
|
|
"step": 69
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.9053971767425537,
|
||
|
|
"epoch": 0.08827238335435057,
|
||
|
|
"grad_norm": 10.75,
|
||
|
|
"learning_rate": 1.9802363493076392e-05,
|
||
|
|
"loss": 1.669,
|
||
|
|
"mean_token_accuracy": 0.5835593342781067,
|
||
|
|
"num_tokens": 71637.0,
|
||
|
|
"step": 70
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.9287728071212769,
|
||
|
|
"epoch": 0.08953341740226986,
|
||
|
|
"grad_norm": 11.375,
|
||
|
|
"learning_rate": 1.9794242441698418e-05,
|
||
|
|
"loss": 1.7419,
|
||
|
|
"mean_token_accuracy": 0.5846641659736633,
|
||
|
|
"num_tokens": 72762.0,
|
||
|
|
"step": 71
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.9991928935050964,
|
||
|
|
"epoch": 0.09079445145018916,
|
||
|
|
"grad_norm": 10.6875,
|
||
|
|
"learning_rate": 1.9785959615468926e-05,
|
||
|
|
"loss": 1.7409,
|
||
|
|
"mean_token_accuracy": 0.5706911385059357,
|
||
|
|
"num_tokens": 73762.0,
|
||
|
|
"step": 72
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.923768401145935,
|
||
|
|
"epoch": 0.09205548549810845,
|
||
|
|
"grad_norm": 11.3125,
|
||
|
|
"learning_rate": 1.977751515119819e-05,
|
||
|
|
"loss": 1.779,
|
||
|
|
"mean_token_accuracy": 0.5645671784877777,
|
||
|
|
"num_tokens": 74700.0,
|
||
|
|
"step": 73
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.8341243863105774,
|
||
|
|
"epoch": 0.09331651954602774,
|
||
|
|
"grad_norm": 11.0625,
|
||
|
|
"learning_rate": 1.976890918836631e-05,
|
||
|
|
"loss": 1.7521,
|
||
|
|
"mean_token_accuracy": 0.5705311894416809,
|
||
|
|
"num_tokens": 75699.0,
|
||
|
|
"step": 74
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.9348458647727966,
|
||
|
|
"epoch": 0.09457755359394704,
|
||
|
|
"grad_norm": 11.25,
|
||
|
|
"learning_rate": 1.9760141869120917e-05,
|
||
|
|
"loss": 1.767,
|
||
|
|
"mean_token_accuracy": 0.5670446455478668,
|
||
|
|
"num_tokens": 76756.0,
|
||
|
|
"step": 75
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.8842027187347412,
|
||
|
|
"epoch": 0.09583858764186633,
|
||
|
|
"grad_norm": 11.0,
|
||
|
|
"learning_rate": 1.9751213338274826e-05,
|
||
|
|
"loss": 1.739,
|
||
|
|
"mean_token_accuracy": 0.5805586576461792,
|
||
|
|
"num_tokens": 77801.0,
|
||
|
|
"step": 76
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.8319332599639893,
|
||
|
|
"epoch": 0.09709962168978563,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 1.974212374330363e-05,
|
||
|
|
"loss": 1.6026,
|
||
|
|
"mean_token_accuracy": 0.6011435985565186,
|
||
|
|
"num_tokens": 78819.0,
|
||
|
|
"step": 77
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.854103684425354,
|
||
|
|
"epoch": 0.09836065573770492,
|
||
|
|
"grad_norm": 10.6875,
|
||
|
|
"learning_rate": 1.9732873234343274e-05,
|
||
|
|
"loss": 1.7739,
|
||
|
|
"mean_token_accuracy": 0.5729092359542847,
|
||
|
|
"num_tokens": 79820.0,
|
||
|
|
"step": 78
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7364491820335388,
|
||
|
|
"epoch": 0.09962168978562422,
|
||
|
|
"grad_norm": 11.1875,
|
||
|
|
"learning_rate": 1.9723461964187587e-05,
|
||
|
|
"loss": 1.6451,
|
||
|
|
"mean_token_accuracy": 0.5989556312561035,
|
||
|
|
"num_tokens": 80797.0,
|
||
|
|
"step": 79
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.8707470893859863,
|
||
|
|
"epoch": 0.1008827238335435,
|
||
|
|
"grad_norm": 12.25,
|
||
|
|
"learning_rate": 1.971389008828573e-05,
|
||
|
|
"loss": 1.7916,
|
||
|
|
"mean_token_accuracy": 0.5801495909690857,
|
||
|
|
"num_tokens": 81701.0,
|
||
|
|
"step": 80
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.8177608251571655,
|
||
|
|
"epoch": 0.1021437578814628,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.9704157764739654e-05,
|
||
|
|
"loss": 1.6348,
|
||
|
|
"mean_token_accuracy": 0.6249110102653503,
|
||
|
|
"num_tokens": 82727.0,
|
||
|
|
"step": 81
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7748131155967712,
|
||
|
|
"epoch": 0.1034047919293821,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 1.9694265154301468e-05,
|
||
|
|
"loss": 1.6217,
|
||
|
|
"mean_token_accuracy": 0.5925298631191254,
|
||
|
|
"num_tokens": 83814.0,
|
||
|
|
"step": 82
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.794422686100006,
|
||
|
|
"epoch": 0.10466582597730138,
|
||
|
|
"grad_norm": 10.625,
|
||
|
|
"learning_rate": 1.9684212420370807e-05,
|
||
|
|
"loss": 1.6624,
|
||
|
|
"mean_token_accuracy": 0.5926792025566101,
|
||
|
|
"num_tokens": 84875.0,
|
||
|
|
"step": 83
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.8910409808158875,
|
||
|
|
"epoch": 0.10592686002522068,
|
||
|
|
"grad_norm": 11.375,
|
||
|
|
"learning_rate": 1.9673999728992115e-05,
|
||
|
|
"loss": 1.791,
|
||
|
|
"mean_token_accuracy": 0.5685008466243744,
|
||
|
|
"num_tokens": 85880.0,
|
||
|
|
"step": 84
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.8583315014839172,
|
||
|
|
"epoch": 0.10718789407313997,
|
||
|
|
"grad_norm": 10.8125,
|
||
|
|
"learning_rate": 1.9663627248851903e-05,
|
||
|
|
"loss": 1.771,
|
||
|
|
"mean_token_accuracy": 0.5630261301994324,
|
||
|
|
"num_tokens": 86886.0,
|
||
|
|
"step": 85
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7223349809646606,
|
||
|
|
"epoch": 0.10844892812105927,
|
||
|
|
"grad_norm": 10.4375,
|
||
|
|
"learning_rate": 1.965309515127598e-05,
|
||
|
|
"loss": 1.5496,
|
||
|
|
"mean_token_accuracy": 0.633098304271698,
|
||
|
|
"num_tokens": 87871.0,
|
||
|
|
"step": 86
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7501602172851562,
|
||
|
|
"epoch": 0.10970996216897856,
|
||
|
|
"grad_norm": 10.75,
|
||
|
|
"learning_rate": 1.9642403610226596e-05,
|
||
|
|
"loss": 1.7226,
|
||
|
|
"mean_token_accuracy": 0.5990203320980072,
|
||
|
|
"num_tokens": 88919.0,
|
||
|
|
"step": 87
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.647248089313507,
|
||
|
|
"epoch": 0.11097099621689786,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 1.9631552802299595e-05,
|
||
|
|
"loss": 1.6105,
|
||
|
|
"mean_token_accuracy": 0.6275560259819031,
|
||
|
|
"num_tokens": 89826.0,
|
||
|
|
"step": 88
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7597458958625793,
|
||
|
|
"epoch": 0.11223203026481715,
|
||
|
|
"grad_norm": 10.4375,
|
||
|
|
"learning_rate": 1.9620542906721476e-05,
|
||
|
|
"loss": 1.7153,
|
||
|
|
"mean_token_accuracy": 0.5785434246063232,
|
||
|
|
"num_tokens": 90801.0,
|
||
|
|
"step": 89
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.849835991859436,
|
||
|
|
"epoch": 0.11349306431273644,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.9609374105346458e-05,
|
||
|
|
"loss": 1.8176,
|
||
|
|
"mean_token_accuracy": 0.5699333846569061,
|
||
|
|
"num_tokens": 91874.0,
|
||
|
|
"step": 90
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.737510323524475,
|
||
|
|
"epoch": 0.11475409836065574,
|
||
|
|
"grad_norm": 10.625,
|
||
|
|
"learning_rate": 1.9598046582653446e-05,
|
||
|
|
"loss": 1.6748,
|
||
|
|
"mean_token_accuracy": 0.5997789800167084,
|
||
|
|
"num_tokens": 92956.0,
|
||
|
|
"step": 91
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7283032536506653,
|
||
|
|
"epoch": 0.11601513240857503,
|
||
|
|
"grad_norm": 10.9375,
|
||
|
|
"learning_rate": 1.9586560525743007e-05,
|
||
|
|
"loss": 1.6929,
|
||
|
|
"mean_token_accuracy": 0.6055110394954681,
|
||
|
|
"num_tokens": 93956.0,
|
||
|
|
"step": 92
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.707078456878662,
|
||
|
|
"epoch": 0.11727616645649433,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 1.957491612433427e-05,
|
||
|
|
"loss": 1.5962,
|
||
|
|
"mean_token_accuracy": 0.5926138162612915,
|
||
|
|
"num_tokens": 95057.0,
|
||
|
|
"step": 93
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7746798396110535,
|
||
|
|
"epoch": 0.11853720050441362,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 1.95631135707618e-05,
|
||
|
|
"loss": 1.5627,
|
||
|
|
"mean_token_accuracy": 0.6124057471752167,
|
||
|
|
"num_tokens": 96076.0,
|
||
|
|
"step": 94
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.9260947704315186,
|
||
|
|
"epoch": 0.11979823455233292,
|
||
|
|
"grad_norm": 12.4375,
|
||
|
|
"learning_rate": 1.9551153059972397e-05,
|
||
|
|
"loss": 1.8671,
|
||
|
|
"mean_token_accuracy": 0.573739230632782,
|
||
|
|
"num_tokens": 97094.0,
|
||
|
|
"step": 95
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.8145451545715332,
|
||
|
|
"epoch": 0.1210592686002522,
|
||
|
|
"grad_norm": 11.1875,
|
||
|
|
"learning_rate": 1.9539034789521924e-05,
|
||
|
|
"loss": 1.6648,
|
||
|
|
"mean_token_accuracy": 0.5760055780410767,
|
||
|
|
"num_tokens": 98062.0,
|
||
|
|
"step": 96
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7630221247673035,
|
||
|
|
"epoch": 0.1223203026481715,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.952675895957199e-05,
|
||
|
|
"loss": 1.6276,
|
||
|
|
"mean_token_accuracy": 0.597524493932724,
|
||
|
|
"num_tokens": 99146.0,
|
||
|
|
"step": 97
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.8840625882148743,
|
||
|
|
"epoch": 0.1235813366960908,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 1.9514325772886674e-05,
|
||
|
|
"loss": 1.7563,
|
||
|
|
"mean_token_accuracy": 0.5629289746284485,
|
||
|
|
"num_tokens": 100176.0,
|
||
|
|
"step": 98
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.8077781200408936,
|
||
|
|
"epoch": 0.12484237074401008,
|
||
|
|
"grad_norm": 10.625,
|
||
|
|
"learning_rate": 1.9501735434829174e-05,
|
||
|
|
"loss": 1.8202,
|
||
|
|
"mean_token_accuracy": 0.5708647072315216,
|
||
|
|
"num_tokens": 101205.0,
|
||
|
|
"step": 99
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7992448210716248,
|
||
|
|
"epoch": 0.12610340479192939,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 1.948898815335841e-05,
|
||
|
|
"loss": 1.7348,
|
||
|
|
"mean_token_accuracy": 0.5803385972976685,
|
||
|
|
"num_tokens": 102198.0,
|
||
|
|
"step": 100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7925843596458435,
|
||
|
|
"epoch": 0.1273644388398487,
|
||
|
|
"grad_norm": 10.6875,
|
||
|
|
"learning_rate": 1.9476084139025592e-05,
|
||
|
|
"loss": 1.7535,
|
||
|
|
"mean_token_accuracy": 0.5725571513175964,
|
||
|
|
"num_tokens": 103202.0,
|
||
|
|
"step": 101
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.738698124885559,
|
||
|
|
"epoch": 0.12862547288776796,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 1.946302360497073e-05,
|
||
|
|
"loss": 1.6793,
|
||
|
|
"mean_token_accuracy": 0.5997990965843201,
|
||
|
|
"num_tokens": 104248.0,
|
||
|
|
"step": 102
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.8028201460838318,
|
||
|
|
"epoch": 0.12988650693568726,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.9449806766919132e-05,
|
||
|
|
"loss": 1.713,
|
||
|
|
"mean_token_accuracy": 0.5938751995563507,
|
||
|
|
"num_tokens": 105357.0,
|
||
|
|
"step": 103
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.8229917883872986,
|
||
|
|
"epoch": 0.13114754098360656,
|
||
|
|
"grad_norm": 10.9375,
|
||
|
|
"learning_rate": 1.943643384317784e-05,
|
||
|
|
"loss": 1.6545,
|
||
|
|
"mean_token_accuracy": 0.5763586759567261,
|
||
|
|
"num_tokens": 106403.0,
|
||
|
|
"step": 104
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.71979421377182,
|
||
|
|
"epoch": 0.13240857503152584,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.9422905054631996e-05,
|
||
|
|
"loss": 1.6326,
|
||
|
|
"mean_token_accuracy": 0.5953395664691925,
|
||
|
|
"num_tokens": 107440.0,
|
||
|
|
"step": 105
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.66442209482193,
|
||
|
|
"epoch": 0.13366960907944514,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 1.9409220624741234e-05,
|
||
|
|
"loss": 1.6023,
|
||
|
|
"mean_token_accuracy": 0.6147553622722626,
|
||
|
|
"num_tokens": 108468.0,
|
||
|
|
"step": 106
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7110742330551147,
|
||
|
|
"epoch": 0.13493064312736444,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.9395380779535964e-05,
|
||
|
|
"loss": 1.6813,
|
||
|
|
"mean_token_accuracy": 0.6113943159580231,
|
||
|
|
"num_tokens": 109515.0,
|
||
|
|
"step": 107
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.8080978989601135,
|
||
|
|
"epoch": 0.13619167717528374,
|
||
|
|
"grad_norm": 11.4375,
|
||
|
|
"learning_rate": 1.9381385747613634e-05,
|
||
|
|
"loss": 1.9568,
|
||
|
|
"mean_token_accuracy": 0.562128484249115,
|
||
|
|
"num_tokens": 110543.0,
|
||
|
|
"step": 108
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.8338959217071533,
|
||
|
|
"epoch": 0.13745271122320302,
|
||
|
|
"grad_norm": 12.0,
|
||
|
|
"learning_rate": 1.936723576013498e-05,
|
||
|
|
"loss": 1.7324,
|
||
|
|
"mean_token_accuracy": 0.5907362401485443,
|
||
|
|
"num_tokens": 111514.0,
|
||
|
|
"step": 109
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.724937081336975,
|
||
|
|
"epoch": 0.13871374527112232,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 1.9352931050820175e-05,
|
||
|
|
"loss": 1.6873,
|
||
|
|
"mean_token_accuracy": 0.6051501631736755,
|
||
|
|
"num_tokens": 112612.0,
|
||
|
|
"step": 110
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.651603639125824,
|
||
|
|
"epoch": 0.13997477931904162,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 1.9338471855945003e-05,
|
||
|
|
"loss": 1.5413,
|
||
|
|
"mean_token_accuracy": 0.6353788375854492,
|
||
|
|
"num_tokens": 113755.0,
|
||
|
|
"step": 111
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.8258926272392273,
|
||
|
|
"epoch": 0.14123581336696092,
|
||
|
|
"grad_norm": 10.8125,
|
||
|
|
"learning_rate": 1.932385841433693e-05,
|
||
|
|
"loss": 1.8245,
|
||
|
|
"mean_token_accuracy": 0.5714909732341766,
|
||
|
|
"num_tokens": 114778.0,
|
||
|
|
"step": 112
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7415724992752075,
|
||
|
|
"epoch": 0.1424968474148802,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 1.9309090967371156e-05,
|
||
|
|
"loss": 1.7037,
|
||
|
|
"mean_token_accuracy": 0.5925652980804443,
|
||
|
|
"num_tokens": 115784.0,
|
||
|
|
"step": 113
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7369269132614136,
|
||
|
|
"epoch": 0.1437578814627995,
|
||
|
|
"grad_norm": 10.9375,
|
||
|
|
"learning_rate": 1.9294169758966665e-05,
|
||
|
|
"loss": 1.7713,
|
||
|
|
"mean_token_accuracy": 0.5780980885028839,
|
||
|
|
"num_tokens": 116816.0,
|
||
|
|
"step": 114
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.604160726070404,
|
||
|
|
"epoch": 0.1450189155107188,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 1.9279095035582153e-05,
|
||
|
|
"loss": 1.5272,
|
||
|
|
"mean_token_accuracy": 0.6051919460296631,
|
||
|
|
"num_tokens": 117823.0,
|
||
|
|
"step": 115
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.789419949054718,
|
||
|
|
"epoch": 0.14627994955863807,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 1.9263867046211983e-05,
|
||
|
|
"loss": 1.6845,
|
||
|
|
"mean_token_accuracy": 0.5877159833908081,
|
||
|
|
"num_tokens": 118874.0,
|
||
|
|
"step": 116
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.695505440235138,
|
||
|
|
"epoch": 0.14754098360655737,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 1.9248486042382058e-05,
|
||
|
|
"loss": 1.5964,
|
||
|
|
"mean_token_accuracy": 0.6158693730831146,
|
||
|
|
"num_tokens": 119920.0,
|
||
|
|
"step": 117
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.736804723739624,
|
||
|
|
"epoch": 0.14880201765447668,
|
||
|
|
"grad_norm": 10.9375,
|
||
|
|
"learning_rate": 1.9232952278145683e-05,
|
||
|
|
"loss": 1.6562,
|
||
|
|
"mean_token_accuracy": 0.6033729314804077,
|
||
|
|
"num_tokens": 120897.0,
|
||
|
|
"step": 118
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.762531578540802,
|
||
|
|
"epoch": 0.15006305170239598,
|
||
|
|
"grad_norm": 10.4375,
|
||
|
|
"learning_rate": 1.9217266010079353e-05,
|
||
|
|
"loss": 1.7068,
|
||
|
|
"mean_token_accuracy": 0.5944864749908447,
|
||
|
|
"num_tokens": 121986.0,
|
||
|
|
"step": 119
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7343703508377075,
|
||
|
|
"epoch": 0.15132408575031525,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 1.9201427497278518e-05,
|
||
|
|
"loss": 1.6192,
|
||
|
|
"mean_token_accuracy": 0.6109800636768341,
|
||
|
|
"num_tokens": 123038.0,
|
||
|
|
"step": 120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7780964970588684,
|
||
|
|
"epoch": 0.15258511979823455,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 1.9185437001353314e-05,
|
||
|
|
"loss": 1.6289,
|
||
|
|
"mean_token_accuracy": 0.5890261828899384,
|
||
|
|
"num_tokens": 124085.0,
|
||
|
|
"step": 121
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7673614621162415,
|
||
|
|
"epoch": 0.15384615384615385,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 1.9169294786424226e-05,
|
||
|
|
"loss": 1.6759,
|
||
|
|
"mean_token_accuracy": 0.5714527368545532,
|
||
|
|
"num_tokens": 125143.0,
|
||
|
|
"step": 122
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7509287595748901,
|
||
|
|
"epoch": 0.15510718789407313,
|
||
|
|
"grad_norm": 10.625,
|
||
|
|
"learning_rate": 1.915300111911774e-05,
|
||
|
|
"loss": 1.6029,
|
||
|
|
"mean_token_accuracy": 0.5813908874988556,
|
||
|
|
"num_tokens": 126181.0,
|
||
|
|
"step": 123
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.688304603099823,
|
||
|
|
"epoch": 0.15636822194199243,
|
||
|
|
"grad_norm": 11.25,
|
||
|
|
"learning_rate": 1.9136556268561932e-05,
|
||
|
|
"loss": 1.5938,
|
||
|
|
"mean_token_accuracy": 0.6254107058048248,
|
||
|
|
"num_tokens": 127143.0,
|
||
|
|
"step": 124
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7035104036331177,
|
||
|
|
"epoch": 0.15762925598991173,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 1.911996050638202e-05,
|
||
|
|
"loss": 1.5971,
|
||
|
|
"mean_token_accuracy": 0.6116199493408203,
|
||
|
|
"num_tokens": 128081.0,
|
||
|
|
"step": 125
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7566595077514648,
|
||
|
|
"epoch": 0.15889029003783103,
|
||
|
|
"grad_norm": 11.0,
|
||
|
|
"learning_rate": 1.9103214106695884e-05,
|
||
|
|
"loss": 1.7476,
|
||
|
|
"mean_token_accuracy": 0.5734935104846954,
|
||
|
|
"num_tokens": 129096.0,
|
||
|
|
"step": 126
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7352384328842163,
|
||
|
|
"epoch": 0.1601513240857503,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 1.9086317346109535e-05,
|
||
|
|
"loss": 1.5611,
|
||
|
|
"mean_token_accuracy": 0.6031631529331207,
|
||
|
|
"num_tokens": 130178.0,
|
||
|
|
"step": 127
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.8352270722389221,
|
||
|
|
"epoch": 0.1614123581336696,
|
||
|
|
"grad_norm": 10.75,
|
||
|
|
"learning_rate": 1.9069270503712535e-05,
|
||
|
|
"loss": 1.8456,
|
||
|
|
"mean_token_accuracy": 0.5572615265846252,
|
||
|
|
"num_tokens": 131146.0,
|
||
|
|
"step": 128
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6694875955581665,
|
||
|
|
"epoch": 0.1626733921815889,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.9052073861073426e-05,
|
||
|
|
"loss": 1.6303,
|
||
|
|
"mean_token_accuracy": 0.6286256313323975,
|
||
|
|
"num_tokens": 132121.0,
|
||
|
|
"step": 129
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6542978882789612,
|
||
|
|
"epoch": 0.16393442622950818,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.9034727702235023e-05,
|
||
|
|
"loss": 1.6593,
|
||
|
|
"mean_token_accuracy": 0.6110431551933289,
|
||
|
|
"num_tokens": 133086.0,
|
||
|
|
"step": 130
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7093634009361267,
|
||
|
|
"epoch": 0.16519546027742749,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.9017232313709767e-05,
|
||
|
|
"loss": 1.6621,
|
||
|
|
"mean_token_accuracy": 0.6013783514499664,
|
||
|
|
"num_tokens": 134077.0,
|
||
|
|
"step": 131
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.8136807680130005,
|
||
|
|
"epoch": 0.1664564943253468,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 1.899958798447497e-05,
|
||
|
|
"loss": 1.8217,
|
||
|
|
"mean_token_accuracy": 0.577373206615448,
|
||
|
|
"num_tokens": 135034.0,
|
||
|
|
"step": 132
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7821927666664124,
|
||
|
|
"epoch": 0.1677175283732661,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.8981795005968057e-05,
|
||
|
|
"loss": 1.695,
|
||
|
|
"mean_token_accuracy": 0.5844568014144897,
|
||
|
|
"num_tokens": 136103.0,
|
||
|
|
"step": 133
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7654359340667725,
|
||
|
|
"epoch": 0.16897856242118536,
|
||
|
|
"grad_norm": 10.8125,
|
||
|
|
"learning_rate": 1.8963853672081732e-05,
|
||
|
|
"loss": 1.5731,
|
||
|
|
"mean_token_accuracy": 0.5868731141090393,
|
||
|
|
"num_tokens": 137100.0,
|
||
|
|
"step": 134
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7660198211669922,
|
||
|
|
"epoch": 0.17023959646910466,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 1.8945764279159144e-05,
|
||
|
|
"loss": 1.7521,
|
||
|
|
"mean_token_accuracy": 0.5795554518699646,
|
||
|
|
"num_tokens": 138108.0,
|
||
|
|
"step": 135
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7412180304527283,
|
||
|
|
"epoch": 0.17150063051702397,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.8927527125988983e-05,
|
||
|
|
"loss": 1.592,
|
||
|
|
"mean_token_accuracy": 0.609203428030014,
|
||
|
|
"num_tokens": 139178.0,
|
||
|
|
"step": 136
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7500796914100647,
|
||
|
|
"epoch": 0.17276166456494324,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 1.8909142513800543e-05,
|
||
|
|
"loss": 1.6479,
|
||
|
|
"mean_token_accuracy": 0.603846937417984,
|
||
|
|
"num_tokens": 140229.0,
|
||
|
|
"step": 137
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7037127614021301,
|
||
|
|
"epoch": 0.17402269861286254,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 1.889061074625875e-05,
|
||
|
|
"loss": 1.6429,
|
||
|
|
"mean_token_accuracy": 0.5965243577957153,
|
||
|
|
"num_tokens": 141264.0,
|
||
|
|
"step": 138
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.718508780002594,
|
||
|
|
"epoch": 0.17528373266078184,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 1.8871932129459146e-05,
|
||
|
|
"loss": 1.6399,
|
||
|
|
"mean_token_accuracy": 0.5820088386535645,
|
||
|
|
"num_tokens": 142284.0,
|
||
|
|
"step": 139
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5986170172691345,
|
||
|
|
"epoch": 0.17654476670870115,
|
||
|
|
"grad_norm": 10.6875,
|
||
|
|
"learning_rate": 1.8853106971922833e-05,
|
||
|
|
"loss": 1.4876,
|
||
|
|
"mean_token_accuracy": 0.6402464509010315,
|
||
|
|
"num_tokens": 143235.0,
|
||
|
|
"step": 140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6880682110786438,
|
||
|
|
"epoch": 0.17780580075662042,
|
||
|
|
"grad_norm": 10.8125,
|
||
|
|
"learning_rate": 1.8834135584591368e-05,
|
||
|
|
"loss": 1.6687,
|
||
|
|
"mean_token_accuracy": 0.5934623181819916,
|
||
|
|
"num_tokens": 144184.0,
|
||
|
|
"step": 141
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6574044227600098,
|
||
|
|
"epoch": 0.17906683480453972,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.8815018280821652e-05,
|
||
|
|
"loss": 1.6142,
|
||
|
|
"mean_token_accuracy": 0.6084502339363098,
|
||
|
|
"num_tokens": 145263.0,
|
||
|
|
"step": 142
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6841396689414978,
|
||
|
|
"epoch": 0.18032786885245902,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.8795755376380724e-05,
|
||
|
|
"loss": 1.6155,
|
||
|
|
"mean_token_accuracy": 0.6059699058532715,
|
||
|
|
"num_tokens": 146303.0,
|
||
|
|
"step": 143
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.705761432647705,
|
||
|
|
"epoch": 0.18158890290037832,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.8776347189440566e-05,
|
||
|
|
"loss": 1.6228,
|
||
|
|
"mean_token_accuracy": 0.5980998873710632,
|
||
|
|
"num_tokens": 147334.0,
|
||
|
|
"step": 144
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6457685232162476,
|
||
|
|
"epoch": 0.1828499369482976,
|
||
|
|
"grad_norm": 10.4375,
|
||
|
|
"learning_rate": 1.8756794040572834e-05,
|
||
|
|
"loss": 1.658,
|
||
|
|
"mean_token_accuracy": 0.6050177216529846,
|
||
|
|
"num_tokens": 148366.0,
|
||
|
|
"step": 145
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7485453486442566,
|
||
|
|
"epoch": 0.1841109709962169,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.8737096252743576e-05,
|
||
|
|
"loss": 1.705,
|
||
|
|
"mean_token_accuracy": 0.5982577800750732,
|
||
|
|
"num_tokens": 149412.0,
|
||
|
|
"step": 146
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7776476740837097,
|
||
|
|
"epoch": 0.1853720050441362,
|
||
|
|
"grad_norm": 11.4375,
|
||
|
|
"learning_rate": 1.871725415130789e-05,
|
||
|
|
"loss": 1.8489,
|
||
|
|
"mean_token_accuracy": 0.5569970011711121,
|
||
|
|
"num_tokens": 150395.0,
|
||
|
|
"step": 147
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5921865701675415,
|
||
|
|
"epoch": 0.18663303909205547,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 1.8697268064004554e-05,
|
||
|
|
"loss": 1.4648,
|
||
|
|
"mean_token_accuracy": 0.6381784975528717,
|
||
|
|
"num_tokens": 151474.0,
|
||
|
|
"step": 148
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.727588713169098,
|
||
|
|
"epoch": 0.18789407313997478,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 1.8677138320950598e-05,
|
||
|
|
"loss": 1.6152,
|
||
|
|
"mean_token_accuracy": 0.5875283479690552,
|
||
|
|
"num_tokens": 152539.0,
|
||
|
|
"step": 149
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.8232128024101257,
|
||
|
|
"epoch": 0.18915510718789408,
|
||
|
|
"grad_norm": 11.5,
|
||
|
|
"learning_rate": 1.8656865254635877e-05,
|
||
|
|
"loss": 1.8738,
|
||
|
|
"mean_token_accuracy": 0.57618048787117,
|
||
|
|
"num_tokens": 153513.0,
|
||
|
|
"step": 150
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6553057432174683,
|
||
|
|
"epoch": 0.19041614123581338,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 1.8636449199917557e-05,
|
||
|
|
"loss": 1.5482,
|
||
|
|
"mean_token_accuracy": 0.6177035272121429,
|
||
|
|
"num_tokens": 154543.0,
|
||
|
|
"step": 151
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.679106891155243,
|
||
|
|
"epoch": 0.19167717528373265,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 1.86158904940146e-05,
|
||
|
|
"loss": 1.5175,
|
||
|
|
"mean_token_accuracy": 0.6258773803710938,
|
||
|
|
"num_tokens": 155554.0,
|
||
|
|
"step": 152
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6641005277633667,
|
||
|
|
"epoch": 0.19293820933165196,
|
||
|
|
"grad_norm": 11.0,
|
||
|
|
"learning_rate": 1.859518947650217e-05,
|
||
|
|
"loss": 1.6082,
|
||
|
|
"mean_token_accuracy": 0.6205520927906036,
|
||
|
|
"num_tokens": 156536.0,
|
||
|
|
"step": 153
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.73294335603714,
|
||
|
|
"epoch": 0.19419924337957126,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 1.8574346489306067e-05,
|
||
|
|
"loss": 1.5866,
|
||
|
|
"mean_token_accuracy": 0.5927672982215881,
|
||
|
|
"num_tokens": 157626.0,
|
||
|
|
"step": 154
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6571336388587952,
|
||
|
|
"epoch": 0.19546027742749053,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 1.8553361876697025e-05,
|
||
|
|
"loss": 1.5071,
|
||
|
|
"mean_token_accuracy": 0.6134444177150726,
|
||
|
|
"num_tokens": 158596.0,
|
||
|
|
"step": 155
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6746886372566223,
|
||
|
|
"epoch": 0.19672131147540983,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.8532235985285073e-05,
|
||
|
|
"loss": 1.6144,
|
||
|
|
"mean_token_accuracy": 0.6072324812412262,
|
||
|
|
"num_tokens": 159605.0,
|
||
|
|
"step": 156
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6456283926963806,
|
||
|
|
"epoch": 0.19798234552332913,
|
||
|
|
"grad_norm": 10.75,
|
||
|
|
"learning_rate": 1.8510969164013783e-05,
|
||
|
|
"loss": 1.5449,
|
||
|
|
"mean_token_accuracy": 0.6262318193912506,
|
||
|
|
"num_tokens": 160539.0,
|
||
|
|
"step": 157
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6222925186157227,
|
||
|
|
"epoch": 0.19924337957124844,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.848956176415451e-05,
|
||
|
|
"loss": 1.4886,
|
||
|
|
"mean_token_accuracy": 0.617477685213089,
|
||
|
|
"num_tokens": 161559.0,
|
||
|
|
"step": 158
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6953288912773132,
|
||
|
|
"epoch": 0.2005044136191677,
|
||
|
|
"grad_norm": 10.6875,
|
||
|
|
"learning_rate": 1.84680141393006e-05,
|
||
|
|
"loss": 1.7406,
|
||
|
|
"mean_token_accuracy": 0.5972300469875336,
|
||
|
|
"num_tokens": 162719.0,
|
||
|
|
"step": 159
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.740957796573639,
|
||
|
|
"epoch": 0.201765447667087,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 1.8446326645361542e-05,
|
||
|
|
"loss": 1.7201,
|
||
|
|
"mean_token_accuracy": 0.5818152725696564,
|
||
|
|
"num_tokens": 163758.0,
|
||
|
|
"step": 160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7102788090705872,
|
||
|
|
"epoch": 0.2030264817150063,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 1.842449964055709e-05,
|
||
|
|
"loss": 1.5999,
|
||
|
|
"mean_token_accuracy": 0.587261438369751,
|
||
|
|
"num_tokens": 164844.0,
|
||
|
|
"step": 161
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6290961503982544,
|
||
|
|
"epoch": 0.2042875157629256,
|
||
|
|
"grad_norm": 11.0,
|
||
|
|
"learning_rate": 1.8402533485411345e-05,
|
||
|
|
"loss": 1.6263,
|
||
|
|
"mean_token_accuracy": 0.6018026471138,
|
||
|
|
"num_tokens": 165819.0,
|
||
|
|
"step": 162
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.688206136226654,
|
||
|
|
"epoch": 0.2055485498108449,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 1.8380428542746797e-05,
|
||
|
|
"loss": 1.6451,
|
||
|
|
"mean_token_accuracy": 0.5944227278232574,
|
||
|
|
"num_tokens": 166877.0,
|
||
|
|
"step": 163
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7512656450271606,
|
||
|
|
"epoch": 0.2068095838587642,
|
||
|
|
"grad_norm": 10.6875,
|
||
|
|
"learning_rate": 1.8358185177678356e-05,
|
||
|
|
"loss": 1.7172,
|
||
|
|
"mean_token_accuracy": 0.593990832567215,
|
||
|
|
"num_tokens": 167899.0,
|
||
|
|
"step": 164
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7278422713279724,
|
||
|
|
"epoch": 0.2080706179066835,
|
||
|
|
"grad_norm": 12.1875,
|
||
|
|
"learning_rate": 1.8335803757607274e-05,
|
||
|
|
"loss": 1.8035,
|
||
|
|
"mean_token_accuracy": 0.5646536350250244,
|
||
|
|
"num_tokens": 168835.0,
|
||
|
|
"step": 165
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6790607571601868,
|
||
|
|
"epoch": 0.20933165195460277,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 1.831328465221513e-05,
|
||
|
|
"loss": 1.5762,
|
||
|
|
"mean_token_accuracy": 0.6165642142295837,
|
||
|
|
"num_tokens": 169861.0,
|
||
|
|
"step": 166
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.571244478225708,
|
||
|
|
"epoch": 0.21059268600252207,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.8290628233457683e-05,
|
||
|
|
"loss": 1.5813,
|
||
|
|
"mean_token_accuracy": 0.6124542355537415,
|
||
|
|
"num_tokens": 170870.0,
|
||
|
|
"step": 167
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5933078527450562,
|
||
|
|
"epoch": 0.21185372005044137,
|
||
|
|
"grad_norm": 10.625,
|
||
|
|
"learning_rate": 1.826783487555875e-05,
|
||
|
|
"loss": 1.6473,
|
||
|
|
"mean_token_accuracy": 0.5962705314159393,
|
||
|
|
"num_tokens": 171826.0,
|
||
|
|
"step": 168
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5253100395202637,
|
||
|
|
"epoch": 0.21311475409836064,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 1.824490495500402e-05,
|
||
|
|
"loss": 1.4781,
|
||
|
|
"mean_token_accuracy": 0.6420259475708008,
|
||
|
|
"num_tokens": 172865.0,
|
||
|
|
"step": 169
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6337009072303772,
|
||
|
|
"epoch": 0.21437578814627994,
|
||
|
|
"grad_norm": 11.0625,
|
||
|
|
"learning_rate": 1.822183885053483e-05,
|
||
|
|
"loss": 1.5454,
|
||
|
|
"mean_token_accuracy": 0.6230681240558624,
|
||
|
|
"num_tokens": 173897.0,
|
||
|
|
"step": 170
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6038676500320435,
|
||
|
|
"epoch": 0.21563682219419925,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 1.8198636943141914e-05,
|
||
|
|
"loss": 1.5517,
|
||
|
|
"mean_token_accuracy": 0.6282725930213928,
|
||
|
|
"num_tokens": 174852.0,
|
||
|
|
"step": 171
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6523604989051819,
|
||
|
|
"epoch": 0.21689785624211855,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.817529961605911e-05,
|
||
|
|
"loss": 1.6576,
|
||
|
|
"mean_token_accuracy": 0.5921481251716614,
|
||
|
|
"num_tokens": 175885.0,
|
||
|
|
"step": 172
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6789647340774536,
|
||
|
|
"epoch": 0.21815889029003782,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 1.815182725475703e-05,
|
||
|
|
"loss": 1.6435,
|
||
|
|
"mean_token_accuracy": 0.6094416081905365,
|
||
|
|
"num_tokens": 176930.0,
|
||
|
|
"step": 173
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7434654235839844,
|
||
|
|
"epoch": 0.21941992433795712,
|
||
|
|
"grad_norm": 10.6875,
|
||
|
|
"learning_rate": 1.8128220246936693e-05,
|
||
|
|
"loss": 1.7223,
|
||
|
|
"mean_token_accuracy": 0.6018305718898773,
|
||
|
|
"num_tokens": 177925.0,
|
||
|
|
"step": 174
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5791435241699219,
|
||
|
|
"epoch": 0.22068095838587642,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.8104478982523117e-05,
|
||
|
|
"loss": 1.4421,
|
||
|
|
"mean_token_accuracy": 0.6328472793102264,
|
||
|
|
"num_tokens": 178966.0,
|
||
|
|
"step": 175
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7045543789863586,
|
||
|
|
"epoch": 0.22194199243379573,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 1.808060385365889e-05,
|
||
|
|
"loss": 1.7502,
|
||
|
|
"mean_token_accuracy": 0.5983400344848633,
|
||
|
|
"num_tokens": 180003.0,
|
||
|
|
"step": 176
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7539182901382446,
|
||
|
|
"epoch": 0.223203026481715,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 1.805659525469767e-05,
|
||
|
|
"loss": 1.6929,
|
||
|
|
"mean_token_accuracy": 0.6106327474117279,
|
||
|
|
"num_tokens": 180975.0,
|
||
|
|
"step": 177
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6250983476638794,
|
||
|
|
"epoch": 0.2244640605296343,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.8032453582197704e-05,
|
||
|
|
"loss": 1.5665,
|
||
|
|
"mean_token_accuracy": 0.6009056568145752,
|
||
|
|
"num_tokens": 182034.0,
|
||
|
|
"step": 178
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7369933128356934,
|
||
|
|
"epoch": 0.2257250945775536,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 1.800817923491525e-05,
|
||
|
|
"loss": 1.6817,
|
||
|
|
"mean_token_accuracy": 0.5977542400360107,
|
||
|
|
"num_tokens": 183111.0,
|
||
|
|
"step": 179
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5737929940223694,
|
||
|
|
"epoch": 0.22698612862547288,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 1.7983772613798006e-05,
|
||
|
|
"loss": 1.5671,
|
||
|
|
"mean_token_accuracy": 0.6290055215358734,
|
||
|
|
"num_tokens": 184084.0,
|
||
|
|
"step": 180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7205604314804077,
|
||
|
|
"epoch": 0.22824716267339218,
|
||
|
|
"grad_norm": 11.375,
|
||
|
|
"learning_rate": 1.795923412197847e-05,
|
||
|
|
"loss": 1.7753,
|
||
|
|
"mean_token_accuracy": 0.573646605014801,
|
||
|
|
"num_tokens": 185036.0,
|
||
|
|
"step": 181
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6126840114593506,
|
||
|
|
"epoch": 0.22950819672131148,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 1.7934564164767306e-05,
|
||
|
|
"loss": 1.5594,
|
||
|
|
"mean_token_accuracy": 0.5945352911949158,
|
||
|
|
"num_tokens": 186070.0,
|
||
|
|
"step": 182
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6718299984931946,
|
||
|
|
"epoch": 0.23076923076923078,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.7909763149646634e-05,
|
||
|
|
"loss": 1.6871,
|
||
|
|
"mean_token_accuracy": 0.5858203172683716,
|
||
|
|
"num_tokens": 187167.0,
|
||
|
|
"step": 183
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7010251879692078,
|
||
|
|
"epoch": 0.23203026481715006,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 1.7884831486263302e-05,
|
||
|
|
"loss": 1.7584,
|
||
|
|
"mean_token_accuracy": 0.5768249332904816,
|
||
|
|
"num_tokens": 188200.0,
|
||
|
|
"step": 184
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.661143183708191,
|
||
|
|
"epoch": 0.23329129886506936,
|
||
|
|
"grad_norm": 13.5,
|
||
|
|
"learning_rate": 1.7859769586422122e-05,
|
||
|
|
"loss": 1.6788,
|
||
|
|
"mean_token_accuracy": 0.600527435541153,
|
||
|
|
"num_tokens": 189107.0,
|
||
|
|
"step": 185
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7367339134216309,
|
||
|
|
"epoch": 0.23455233291298866,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 1.783457786407906e-05,
|
||
|
|
"loss": 1.7237,
|
||
|
|
"mean_token_accuracy": 0.6037432253360748,
|
||
|
|
"num_tokens": 190291.0,
|
||
|
|
"step": 186
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6531615257263184,
|
||
|
|
"epoch": 0.23581336696090793,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 1.7809256735334406e-05,
|
||
|
|
"loss": 1.5585,
|
||
|
|
"mean_token_accuracy": 0.6052311062812805,
|
||
|
|
"num_tokens": 191294.0,
|
||
|
|
"step": 187
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6551061272621155,
|
||
|
|
"epoch": 0.23707440100882723,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 1.7783806618425904e-05,
|
||
|
|
"loss": 1.5179,
|
||
|
|
"mean_token_accuracy": 0.6289675831794739,
|
||
|
|
"num_tokens": 192264.0,
|
||
|
|
"step": 188
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7442683577537537,
|
||
|
|
"epoch": 0.23833543505674654,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 1.775822793372184e-05,
|
||
|
|
"loss": 1.6921,
|
||
|
|
"mean_token_accuracy": 0.5764530301094055,
|
||
|
|
"num_tokens": 193277.0,
|
||
|
|
"step": 189
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.673442304134369,
|
||
|
|
"epoch": 0.23959646910466584,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.773252110371409e-05,
|
||
|
|
"loss": 1.559,
|
||
|
|
"mean_token_accuracy": 0.6022548377513885,
|
||
|
|
"num_tokens": 194237.0,
|
||
|
|
"step": 190
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7216299176216125,
|
||
|
|
"epoch": 0.2408575031525851,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 1.7706686553011165e-05,
|
||
|
|
"loss": 1.685,
|
||
|
|
"mean_token_accuracy": 0.5962297022342682,
|
||
|
|
"num_tokens": 195215.0,
|
||
|
|
"step": 191
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.888852596282959,
|
||
|
|
"epoch": 0.2421185372005044,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 1.7680724708331164e-05,
|
||
|
|
"loss": 1.8301,
|
||
|
|
"mean_token_accuracy": 0.5730539560317993,
|
||
|
|
"num_tokens": 196223.0,
|
||
|
|
"step": 192
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.8013971447944641,
|
||
|
|
"epoch": 0.24337957124842372,
|
||
|
|
"grad_norm": 10.75,
|
||
|
|
"learning_rate": 1.7654635998494755e-05,
|
||
|
|
"loss": 1.7305,
|
||
|
|
"mean_token_accuracy": 0.5656139552593231,
|
||
|
|
"num_tokens": 197264.0,
|
||
|
|
"step": 193
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.653419554233551,
|
||
|
|
"epoch": 0.244640605296343,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.7628420854418082e-05,
|
||
|
|
"loss": 1.5073,
|
||
|
|
"mean_token_accuracy": 0.6104737818241119,
|
||
|
|
"num_tokens": 198209.0,
|
||
|
|
"step": 194
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.690063714981079,
|
||
|
|
"epoch": 0.2459016393442623,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.7602079709105644e-05,
|
||
|
|
"loss": 1.6197,
|
||
|
|
"mean_token_accuracy": 0.601123034954071,
|
||
|
|
"num_tokens": 199190.0,
|
||
|
|
"step": 195
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.735607922077179,
|
||
|
|
"epoch": 0.2471626733921816,
|
||
|
|
"grad_norm": 10.6875,
|
||
|
|
"learning_rate": 1.7575612997643145e-05,
|
||
|
|
"loss": 1.6828,
|
||
|
|
"mean_token_accuracy": 0.6010057330131531,
|
||
|
|
"num_tokens": 200142.0,
|
||
|
|
"step": 196
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7570839524269104,
|
||
|
|
"epoch": 0.2484237074401009,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 1.7549021157190306e-05,
|
||
|
|
"loss": 1.6746,
|
||
|
|
"mean_token_accuracy": 0.5818617343902588,
|
||
|
|
"num_tokens": 201178.0,
|
||
|
|
"step": 197
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5852105021476746,
|
||
|
|
"epoch": 0.24968474148802017,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.752230462697365e-05,
|
||
|
|
"loss": 1.541,
|
||
|
|
"mean_token_accuracy": 0.6247271299362183,
|
||
|
|
"num_tokens": 202116.0,
|
||
|
|
"step": 198
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7055960893630981,
|
||
|
|
"epoch": 0.2509457755359395,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 1.7495463848279245e-05,
|
||
|
|
"loss": 1.7141,
|
||
|
|
"mean_token_accuracy": 0.5982573330402374,
|
||
|
|
"num_tokens": 203204.0,
|
||
|
|
"step": 199
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6302465796470642,
|
||
|
|
"epoch": 0.25220680958385877,
|
||
|
|
"grad_norm": 9.375,
|
||
|
|
"learning_rate": 1.7468499264445405e-05,
|
||
|
|
"loss": 1.4954,
|
||
|
|
"mean_token_accuracy": 0.6210698783397675,
|
||
|
|
"num_tokens": 204281.0,
|
||
|
|
"step": 200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.616503119468689,
|
||
|
|
"epoch": 0.25346784363177804,
|
||
|
|
"grad_norm": 10.4375,
|
||
|
|
"learning_rate": 1.7441411320855385e-05,
|
||
|
|
"loss": 1.5764,
|
||
|
|
"mean_token_accuracy": 0.6116508543491364,
|
||
|
|
"num_tokens": 205271.0,
|
||
|
|
"step": 201
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.656931459903717,
|
||
|
|
"epoch": 0.2547288776796974,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.7414200464930012e-05,
|
||
|
|
"loss": 1.6428,
|
||
|
|
"mean_token_accuracy": 0.6247988939285278,
|
||
|
|
"num_tokens": 206257.0,
|
||
|
|
"step": 202
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6198022961616516,
|
||
|
|
"epoch": 0.25598991172761665,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 1.73868671461203e-05,
|
||
|
|
"loss": 1.6166,
|
||
|
|
"mean_token_accuracy": 0.5975701808929443,
|
||
|
|
"num_tokens": 207435.0,
|
||
|
|
"step": 203
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7515166997909546,
|
||
|
|
"epoch": 0.2572509457755359,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.735941181590002e-05,
|
||
|
|
"loss": 1.8691,
|
||
|
|
"mean_token_accuracy": 0.5813634097576141,
|
||
|
|
"num_tokens": 208535.0,
|
||
|
|
"step": 204
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7693564891815186,
|
||
|
|
"epoch": 0.25851197982345525,
|
||
|
|
"grad_norm": 11.375,
|
||
|
|
"learning_rate": 1.733183492775825e-05,
|
||
|
|
"loss": 1.6963,
|
||
|
|
"mean_token_accuracy": 0.5941225290298462,
|
||
|
|
"num_tokens": 209500.0,
|
||
|
|
"step": 205
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.692057192325592,
|
||
|
|
"epoch": 0.2597730138713745,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 1.730413693719188e-05,
|
||
|
|
"loss": 1.6301,
|
||
|
|
"mean_token_accuracy": 0.5792853236198425,
|
||
|
|
"num_tokens": 210627.0,
|
||
|
|
"step": 206
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.526620626449585,
|
||
|
|
"epoch": 0.2610340479192938,
|
||
|
|
"grad_norm": 9.0,
|
||
|
|
"learning_rate": 1.727631830169809e-05,
|
||
|
|
"loss": 1.3614,
|
||
|
|
"mean_token_accuracy": 0.6597495079040527,
|
||
|
|
"num_tokens": 211754.0,
|
||
|
|
"step": 207
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6747918725013733,
|
||
|
|
"epoch": 0.26229508196721313,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 1.72483794807668e-05,
|
||
|
|
"loss": 1.6232,
|
||
|
|
"mean_token_accuracy": 0.6059800088405609,
|
||
|
|
"num_tokens": 212819.0,
|
||
|
|
"step": 208
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7895873188972473,
|
||
|
|
"epoch": 0.2635561160151324,
|
||
|
|
"grad_norm": 10.6875,
|
||
|
|
"learning_rate": 1.7220320935873066e-05,
|
||
|
|
"loss": 1.7504,
|
||
|
|
"mean_token_accuracy": 0.5805416405200958,
|
||
|
|
"num_tokens": 213802.0,
|
||
|
|
"step": 209
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.634453296661377,
|
||
|
|
"epoch": 0.2648171500630517,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 1.7192143130469466e-05,
|
||
|
|
"loss": 1.5557,
|
||
|
|
"mean_token_accuracy": 0.6099343001842499,
|
||
|
|
"num_tokens": 214834.0,
|
||
|
|
"step": 210
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5252330303192139,
|
||
|
|
"epoch": 0.266078184110971,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 1.7163846529978455e-05,
|
||
|
|
"loss": 1.5364,
|
||
|
|
"mean_token_accuracy": 0.6193564534187317,
|
||
|
|
"num_tokens": 215985.0,
|
||
|
|
"step": 211
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6005837321281433,
|
||
|
|
"epoch": 0.2673392181588903,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.7135431601784654e-05,
|
||
|
|
"loss": 1.552,
|
||
|
|
"mean_token_accuracy": 0.611538827419281,
|
||
|
|
"num_tokens": 216962.0,
|
||
|
|
"step": 212
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.689214050769806,
|
||
|
|
"epoch": 0.2686002522068096,
|
||
|
|
"grad_norm": 10.625,
|
||
|
|
"learning_rate": 1.7106898815227143e-05,
|
||
|
|
"loss": 1.6912,
|
||
|
|
"mean_token_accuracy": 0.5871491432189941,
|
||
|
|
"num_tokens": 217992.0,
|
||
|
|
"step": 213
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6288052797317505,
|
||
|
|
"epoch": 0.2698612862547289,
|
||
|
|
"grad_norm": 11.3125,
|
||
|
|
"learning_rate": 1.7078248641591726e-05,
|
||
|
|
"loss": 1.7354,
|
||
|
|
"mean_token_accuracy": 0.6010589003562927,
|
||
|
|
"num_tokens": 218990.0,
|
||
|
|
"step": 214
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.680719792842865,
|
||
|
|
"epoch": 0.27112232030264816,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 1.7049481554103107e-05,
|
||
|
|
"loss": 1.6217,
|
||
|
|
"mean_token_accuracy": 0.5792437791824341,
|
||
|
|
"num_tokens": 220008.0,
|
||
|
|
"step": 215
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5593616962432861,
|
||
|
|
"epoch": 0.2723833543505675,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 1.7020598027917117e-05,
|
||
|
|
"loss": 1.5212,
|
||
|
|
"mean_token_accuracy": 0.6116653084754944,
|
||
|
|
"num_tokens": 221037.0,
|
||
|
|
"step": 216
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7140450477600098,
|
||
|
|
"epoch": 0.27364438839848676,
|
||
|
|
"grad_norm": 10.8125,
|
||
|
|
"learning_rate": 1.6991598540112825e-05,
|
||
|
|
"loss": 1.7497,
|
||
|
|
"mean_token_accuracy": 0.5818181931972504,
|
||
|
|
"num_tokens": 222035.0,
|
||
|
|
"step": 217
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6045958399772644,
|
||
|
|
"epoch": 0.27490542244640603,
|
||
|
|
"grad_norm": 10.75,
|
||
|
|
"learning_rate": 1.696248356968469e-05,
|
||
|
|
"loss": 1.6136,
|
||
|
|
"mean_token_accuracy": 0.598257303237915,
|
||
|
|
"num_tokens": 223019.0,
|
||
|
|
"step": 218
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.70366370677948,
|
||
|
|
"epoch": 0.27616645649432536,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 1.6933253597534636e-05,
|
||
|
|
"loss": 1.6697,
|
||
|
|
"mean_token_accuracy": 0.5833706855773926,
|
||
|
|
"num_tokens": 224162.0,
|
||
|
|
"step": 219
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.668145775794983,
|
||
|
|
"epoch": 0.27742749054224464,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 1.690390910646411e-05,
|
||
|
|
"loss": 1.6129,
|
||
|
|
"mean_token_accuracy": 0.6058389544487,
|
||
|
|
"num_tokens": 225170.0,
|
||
|
|
"step": 220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7130072116851807,
|
||
|
|
"epoch": 0.2786885245901639,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.6874450581166102e-05,
|
||
|
|
"loss": 1.6922,
|
||
|
|
"mean_token_accuracy": 0.6061215698719025,
|
||
|
|
"num_tokens": 226156.0,
|
||
|
|
"step": 221
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6039882898330688,
|
||
|
|
"epoch": 0.27994955863808324,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 1.6844878508217155e-05,
|
||
|
|
"loss": 1.5697,
|
||
|
|
"mean_token_accuracy": 0.6189434826374054,
|
||
|
|
"num_tokens": 227269.0,
|
||
|
|
"step": 222
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7330880761146545,
|
||
|
|
"epoch": 0.2812105926860025,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 1.6815193376069295e-05,
|
||
|
|
"loss": 1.7152,
|
||
|
|
"mean_token_accuracy": 0.5706145167350769,
|
||
|
|
"num_tokens": 228371.0,
|
||
|
|
"step": 223
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6350038051605225,
|
||
|
|
"epoch": 0.28247162673392184,
|
||
|
|
"grad_norm": 10.8125,
|
||
|
|
"learning_rate": 1.6785395675042013e-05,
|
||
|
|
"loss": 1.6059,
|
||
|
|
"mean_token_accuracy": 0.59665846824646,
|
||
|
|
"num_tokens": 229314.0,
|
||
|
|
"step": 224
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6268184185028076,
|
||
|
|
"epoch": 0.2837326607818411,
|
||
|
|
"grad_norm": 10.9375,
|
||
|
|
"learning_rate": 1.6755485897314122e-05,
|
||
|
|
"loss": 1.6301,
|
||
|
|
"mean_token_accuracy": 0.6120674014091492,
|
||
|
|
"num_tokens": 230247.0,
|
||
|
|
"step": 225
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6736965775489807,
|
||
|
|
"epoch": 0.2849936948297604,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.6725464536915648e-05,
|
||
|
|
"loss": 1.5946,
|
||
|
|
"mean_token_accuracy": 0.5917158722877502,
|
||
|
|
"num_tokens": 231316.0,
|
||
|
|
"step": 226
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.658580720424652,
|
||
|
|
"epoch": 0.2862547288776797,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 1.6695332089719668e-05,
|
||
|
|
"loss": 1.6074,
|
||
|
|
"mean_token_accuracy": 0.5995627045631409,
|
||
|
|
"num_tokens": 232373.0,
|
||
|
|
"step": 227
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5986194610595703,
|
||
|
|
"epoch": 0.287515762925599,
|
||
|
|
"grad_norm": 11.0625,
|
||
|
|
"learning_rate": 1.6665089053434115e-05,
|
||
|
|
"loss": 1.5793,
|
||
|
|
"mean_token_accuracy": 0.6121103763580322,
|
||
|
|
"num_tokens": 233342.0,
|
||
|
|
"step": 228
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6267426013946533,
|
||
|
|
"epoch": 0.28877679697351827,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 1.6634735927593557e-05,
|
||
|
|
"loss": 1.5595,
|
||
|
|
"mean_token_accuracy": 0.6111132800579071,
|
||
|
|
"num_tokens": 234363.0,
|
||
|
|
"step": 229
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6530006527900696,
|
||
|
|
"epoch": 0.2900378310214376,
|
||
|
|
"grad_norm": 11.0,
|
||
|
|
"learning_rate": 1.6604273213550957e-05,
|
||
|
|
"loss": 1.5634,
|
||
|
|
"mean_token_accuracy": 0.6302264630794525,
|
||
|
|
"num_tokens": 235358.0,
|
||
|
|
"step": 230
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6411193013191223,
|
||
|
|
"epoch": 0.29129886506935687,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 1.6573701414469382e-05,
|
||
|
|
"loss": 1.5509,
|
||
|
|
"mean_token_accuracy": 0.5998447239398956,
|
||
|
|
"num_tokens": 236407.0,
|
||
|
|
"step": 231
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.535860538482666,
|
||
|
|
"epoch": 0.29255989911727615,
|
||
|
|
"grad_norm": 9.4375,
|
||
|
|
"learning_rate": 1.654302103531369e-05,
|
||
|
|
"loss": 1.5039,
|
||
|
|
"mean_token_accuracy": 0.6361163556575775,
|
||
|
|
"num_tokens": 237418.0,
|
||
|
|
"step": 232
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6116254329681396,
|
||
|
|
"epoch": 0.2938209331651955,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 1.651223258284219e-05,
|
||
|
|
"loss": 1.4401,
|
||
|
|
"mean_token_accuracy": 0.6204985082149506,
|
||
|
|
"num_tokens": 238423.0,
|
||
|
|
"step": 233
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6180970668792725,
|
||
|
|
"epoch": 0.29508196721311475,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 1.648133656559828e-05,
|
||
|
|
"loss": 1.6389,
|
||
|
|
"mean_token_accuracy": 0.6117756366729736,
|
||
|
|
"num_tokens": 239529.0,
|
||
|
|
"step": 234
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7418981194496155,
|
||
|
|
"epoch": 0.296343001261034,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 1.6450333493902046e-05,
|
||
|
|
"loss": 1.7946,
|
||
|
|
"mean_token_accuracy": 0.5889446437358856,
|
||
|
|
"num_tokens": 240518.0,
|
||
|
|
"step": 235
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6346675753593445,
|
||
|
|
"epoch": 0.29760403530895335,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 1.6419223879841823e-05,
|
||
|
|
"loss": 1.568,
|
||
|
|
"mean_token_accuracy": 0.6020772457122803,
|
||
|
|
"num_tokens": 241527.0,
|
||
|
|
"step": 236
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7152321338653564,
|
||
|
|
"epoch": 0.2988650693568726,
|
||
|
|
"grad_norm": 11.125,
|
||
|
|
"learning_rate": 1.6388008237265744e-05,
|
||
|
|
"loss": 1.7114,
|
||
|
|
"mean_token_accuracy": 0.5903542339801788,
|
||
|
|
"num_tokens": 242555.0,
|
||
|
|
"step": 237
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5987541675567627,
|
||
|
|
"epoch": 0.30012610340479196,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.6356687081773252e-05,
|
||
|
|
"loss": 1.5698,
|
||
|
|
"mean_token_accuracy": 0.6032786965370178,
|
||
|
|
"num_tokens": 243527.0,
|
||
|
|
"step": 238
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5720175504684448,
|
||
|
|
"epoch": 0.30138713745271123,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.6325260930706584e-05,
|
||
|
|
"loss": 1.5089,
|
||
|
|
"mean_token_accuracy": 0.6329275369644165,
|
||
|
|
"num_tokens": 244554.0,
|
||
|
|
"step": 239
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6274954676628113,
|
||
|
|
"epoch": 0.3026481715006305,
|
||
|
|
"grad_norm": 10.75,
|
||
|
|
"learning_rate": 1.6293730303142218e-05,
|
||
|
|
"loss": 1.5996,
|
||
|
|
"mean_token_accuracy": 0.6140457987785339,
|
||
|
|
"num_tokens": 245570.0,
|
||
|
|
"step": 240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5573576092720032,
|
||
|
|
"epoch": 0.30390920554854983,
|
||
|
|
"grad_norm": 9.375,
|
||
|
|
"learning_rate": 1.6262095719882312e-05,
|
||
|
|
"loss": 1.4947,
|
||
|
|
"mean_token_accuracy": 0.6311947107315063,
|
||
|
|
"num_tokens": 246628.0,
|
||
|
|
"step": 241
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.65983647108078,
|
||
|
|
"epoch": 0.3051702395964691,
|
||
|
|
"grad_norm": 10.6875,
|
||
|
|
"learning_rate": 1.62303577034461e-05,
|
||
|
|
"loss": 1.65,
|
||
|
|
"mean_token_accuracy": 0.5926876962184906,
|
||
|
|
"num_tokens": 247611.0,
|
||
|
|
"step": 242
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6971190571784973,
|
||
|
|
"epoch": 0.3064312736443884,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.6198516778061248e-05,
|
||
|
|
"loss": 1.713,
|
||
|
|
"mean_token_accuracy": 0.5977874100208282,
|
||
|
|
"num_tokens": 248631.0,
|
||
|
|
"step": 243
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.636055052280426,
|
||
|
|
"epoch": 0.3076923076923077,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.616657346965521e-05,
|
||
|
|
"loss": 1.5865,
|
||
|
|
"mean_token_accuracy": 0.6173640191555023,
|
||
|
|
"num_tokens": 249616.0,
|
||
|
|
"step": 244
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6533807516098022,
|
||
|
|
"epoch": 0.308953341740227,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 1.6134528305846537e-05,
|
||
|
|
"loss": 1.7129,
|
||
|
|
"mean_token_accuracy": 0.589533805847168,
|
||
|
|
"num_tokens": 250603.0,
|
||
|
|
"step": 245
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6233521699905396,
|
||
|
|
"epoch": 0.31021437578814626,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 1.6102381815936153e-05,
|
||
|
|
"loss": 1.5361,
|
||
|
|
"mean_token_accuracy": 0.5984684228897095,
|
||
|
|
"num_tokens": 251620.0,
|
||
|
|
"step": 246
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6206133365631104,
|
||
|
|
"epoch": 0.3114754098360656,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.6070134530898625e-05,
|
||
|
|
"loss": 1.4942,
|
||
|
|
"mean_token_accuracy": 0.6123421490192413,
|
||
|
|
"num_tokens": 252610.0,
|
||
|
|
"step": 247
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.595905363559723,
|
||
|
|
"epoch": 0.31273644388398486,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.6037786983373386e-05,
|
||
|
|
"loss": 1.5616,
|
||
|
|
"mean_token_accuracy": 0.6123408079147339,
|
||
|
|
"num_tokens": 253614.0,
|
||
|
|
"step": 248
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6981398463249207,
|
||
|
|
"epoch": 0.31399747793190413,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 1.6005339707655943e-05,
|
||
|
|
"loss": 1.7101,
|
||
|
|
"mean_token_accuracy": 0.5854428708553314,
|
||
|
|
"num_tokens": 254724.0,
|
||
|
|
"step": 249
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6348340511322021,
|
||
|
|
"epoch": 0.31525851197982346,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 1.5972793239689038e-05,
|
||
|
|
"loss": 1.5371,
|
||
|
|
"mean_token_accuracy": 0.6322112381458282,
|
||
|
|
"num_tokens": 255791.0,
|
||
|
|
"step": 250
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5895010232925415,
|
||
|
|
"epoch": 0.31651954602774274,
|
||
|
|
"grad_norm": 10.8125,
|
||
|
|
"learning_rate": 1.594014811705382e-05,
|
||
|
|
"loss": 1.5898,
|
||
|
|
"mean_token_accuracy": 0.6156652271747589,
|
||
|
|
"num_tokens": 256797.0,
|
||
|
|
"step": 251
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7035390734672546,
|
||
|
|
"epoch": 0.31778058007566207,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.5907404878960936e-05,
|
||
|
|
"loss": 1.7044,
|
||
|
|
"mean_token_accuracy": 0.5872528553009033,
|
||
|
|
"num_tokens": 257887.0,
|
||
|
|
"step": 252
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6048563718795776,
|
||
|
|
"epoch": 0.31904161412358134,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 1.587456406624165e-05,
|
||
|
|
"loss": 1.5357,
|
||
|
|
"mean_token_accuracy": 0.6179091036319733,
|
||
|
|
"num_tokens": 258945.0,
|
||
|
|
"step": 253
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6857137084007263,
|
||
|
|
"epoch": 0.3203026481715006,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.584162622133889e-05,
|
||
|
|
"loss": 1.7245,
|
||
|
|
"mean_token_accuracy": 0.5977672934532166,
|
||
|
|
"num_tokens": 259937.0,
|
||
|
|
"step": 254
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5376020073890686,
|
||
|
|
"epoch": 0.32156368221941994,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.5808591888298314e-05,
|
||
|
|
"loss": 1.4081,
|
||
|
|
"mean_token_accuracy": 0.6399954557418823,
|
||
|
|
"num_tokens": 260955.0,
|
||
|
|
"step": 255
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5937974452972412,
|
||
|
|
"epoch": 0.3228247162673392,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 1.5775461612759282e-05,
|
||
|
|
"loss": 1.6056,
|
||
|
|
"mean_token_accuracy": 0.6026803851127625,
|
||
|
|
"num_tokens": 262053.0,
|
||
|
|
"step": 256
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5871049761772156,
|
||
|
|
"epoch": 0.3240857503152585,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 1.5742235941945895e-05,
|
||
|
|
"loss": 1.5565,
|
||
|
|
"mean_token_accuracy": 0.6094169020652771,
|
||
|
|
"num_tokens": 263115.0,
|
||
|
|
"step": 257
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5924156308174133,
|
||
|
|
"epoch": 0.3253467843631778,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 1.5708915424657917e-05,
|
||
|
|
"loss": 1.6369,
|
||
|
|
"mean_token_accuracy": 0.6104046404361725,
|
||
|
|
"num_tokens": 264166.0,
|
||
|
|
"step": 258
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6788977980613708,
|
||
|
|
"epoch": 0.3266078184110971,
|
||
|
|
"grad_norm": 10.4375,
|
||
|
|
"learning_rate": 1.5675500611261725e-05,
|
||
|
|
"loss": 1.6851,
|
||
|
|
"mean_token_accuracy": 0.5767435431480408,
|
||
|
|
"num_tokens": 265241.0,
|
||
|
|
"step": 259
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6361313462257385,
|
||
|
|
"epoch": 0.32786885245901637,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.5641992053681213e-05,
|
||
|
|
"loss": 1.5909,
|
||
|
|
"mean_token_accuracy": 0.6082985401153564,
|
||
|
|
"num_tokens": 266258.0,
|
||
|
|
"step": 260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6331862807273865,
|
||
|
|
"epoch": 0.3291298865069357,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 1.5608390305388693e-05,
|
||
|
|
"loss": 1.5652,
|
||
|
|
"mean_token_accuracy": 0.6261056959629059,
|
||
|
|
"num_tokens": 267354.0,
|
||
|
|
"step": 261
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5927565693855286,
|
||
|
|
"epoch": 0.33039092055485497,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 1.557469592139573e-05,
|
||
|
|
"loss": 1.5356,
|
||
|
|
"mean_token_accuracy": 0.6147298514842987,
|
||
|
|
"num_tokens": 268404.0,
|
||
|
|
"step": 262
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7495569586753845,
|
||
|
|
"epoch": 0.3316519546027743,
|
||
|
|
"grad_norm": 10.625,
|
||
|
|
"learning_rate": 1.554090945824398e-05,
|
||
|
|
"loss": 1.7714,
|
||
|
|
"mean_token_accuracy": 0.575711727142334,
|
||
|
|
"num_tokens": 269378.0,
|
||
|
|
"step": 263
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.774012267589569,
|
||
|
|
"epoch": 0.3329129886506936,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 1.5507031473996016e-05,
|
||
|
|
"loss": 1.7444,
|
||
|
|
"mean_token_accuracy": 0.5899884104728699,
|
||
|
|
"num_tokens": 270455.0,
|
||
|
|
"step": 264
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6154621839523315,
|
||
|
|
"epoch": 0.33417402269861285,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 1.5473062528226082e-05,
|
||
|
|
"loss": 1.5548,
|
||
|
|
"mean_token_accuracy": 0.6173100769519806,
|
||
|
|
"num_tokens": 271469.0,
|
||
|
|
"step": 265
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.604124128818512,
|
||
|
|
"epoch": 0.3354350567465322,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.543900318201087e-05,
|
||
|
|
"loss": 1.554,
|
||
|
|
"mean_token_accuracy": 0.6076988577842712,
|
||
|
|
"num_tokens": 272485.0,
|
||
|
|
"step": 266
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7067211866378784,
|
||
|
|
"epoch": 0.33669609079445145,
|
||
|
|
"grad_norm": 11.5,
|
||
|
|
"learning_rate": 1.5404853997920256e-05,
|
||
|
|
"loss": 1.615,
|
||
|
|
"mean_token_accuracy": 0.5953792333602905,
|
||
|
|
"num_tokens": 273436.0,
|
||
|
|
"step": 267
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6479616165161133,
|
||
|
|
"epoch": 0.3379571248423707,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 1.5370615540007986e-05,
|
||
|
|
"loss": 1.6176,
|
||
|
|
"mean_token_accuracy": 0.5981805324554443,
|
||
|
|
"num_tokens": 274539.0,
|
||
|
|
"step": 268
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6458925604820251,
|
||
|
|
"epoch": 0.33921815889029006,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 1.5336288373802377e-05,
|
||
|
|
"loss": 1.606,
|
||
|
|
"mean_token_accuracy": 0.6037389934062958,
|
||
|
|
"num_tokens": 275564.0,
|
||
|
|
"step": 269
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5988786220550537,
|
||
|
|
"epoch": 0.34047919293820933,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 1.530187306629697e-05,
|
||
|
|
"loss": 1.5883,
|
||
|
|
"mean_token_accuracy": 0.6218869984149933,
|
||
|
|
"num_tokens": 276588.0,
|
||
|
|
"step": 270
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7115415930747986,
|
||
|
|
"epoch": 0.3417402269861286,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 1.5267370185941167e-05,
|
||
|
|
"loss": 1.7034,
|
||
|
|
"mean_token_accuracy": 0.5866121649742126,
|
||
|
|
"num_tokens": 277566.0,
|
||
|
|
"step": 271
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6453835368156433,
|
||
|
|
"epoch": 0.34300126103404793,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 1.5232780302630845e-05,
|
||
|
|
"loss": 1.5937,
|
||
|
|
"mean_token_accuracy": 0.6008328199386597,
|
||
|
|
"num_tokens": 278651.0,
|
||
|
|
"step": 272
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6336002945899963,
|
||
|
|
"epoch": 0.3442622950819672,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 1.5198103987698934e-05,
|
||
|
|
"loss": 1.5292,
|
||
|
|
"mean_token_accuracy": 0.6085817515850067,
|
||
|
|
"num_tokens": 279801.0,
|
||
|
|
"step": 273
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6854661107063293,
|
||
|
|
"epoch": 0.3455233291298865,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 1.5163341813905983e-05,
|
||
|
|
"loss": 1.7202,
|
||
|
|
"mean_token_accuracy": 0.5947639346122742,
|
||
|
|
"num_tokens": 280820.0,
|
||
|
|
"step": 274
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6281224489212036,
|
||
|
|
"epoch": 0.3467843631778058,
|
||
|
|
"grad_norm": 11.0625,
|
||
|
|
"learning_rate": 1.5128494355430698e-05,
|
||
|
|
"loss": 1.6097,
|
||
|
|
"mean_token_accuracy": 0.6258082985877991,
|
||
|
|
"num_tokens": 281750.0,
|
||
|
|
"step": 275
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6371582746505737,
|
||
|
|
"epoch": 0.3480453972257251,
|
||
|
|
"grad_norm": 9.4375,
|
||
|
|
"learning_rate": 1.5093562187860476e-05,
|
||
|
|
"loss": 1.5366,
|
||
|
|
"mean_token_accuracy": 0.6078951954841614,
|
||
|
|
"num_tokens": 282806.0,
|
||
|
|
"step": 276
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6713650226593018,
|
||
|
|
"epoch": 0.3493064312736444,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 1.505854588818187e-05,
|
||
|
|
"loss": 1.7111,
|
||
|
|
"mean_token_accuracy": 0.5980280041694641,
|
||
|
|
"num_tokens": 283936.0,
|
||
|
|
"step": 277
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7434438467025757,
|
||
|
|
"epoch": 0.3505674653215637,
|
||
|
|
"grad_norm": 10.75,
|
||
|
|
"learning_rate": 1.5023446034771077e-05,
|
||
|
|
"loss": 1.6995,
|
||
|
|
"mean_token_accuracy": 0.5988207757472992,
|
||
|
|
"num_tokens": 284894.0,
|
||
|
|
"step": 278
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6402634382247925,
|
||
|
|
"epoch": 0.35182849936948296,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 1.4988263207384373e-05,
|
||
|
|
"loss": 1.6622,
|
||
|
|
"mean_token_accuracy": 0.590718001127243,
|
||
|
|
"num_tokens": 285922.0,
|
||
|
|
"step": 279
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.664858877658844,
|
||
|
|
"epoch": 0.3530895334174023,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.4952997987148554e-05,
|
||
|
|
"loss": 1.7105,
|
||
|
|
"mean_token_accuracy": 0.5985745191574097,
|
||
|
|
"num_tokens": 286934.0,
|
||
|
|
"step": 280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5987516045570374,
|
||
|
|
"epoch": 0.35435056746532156,
|
||
|
|
"grad_norm": 11.0,
|
||
|
|
"learning_rate": 1.4917650956551322e-05,
|
||
|
|
"loss": 1.5766,
|
||
|
|
"mean_token_accuracy": 0.6058200299739838,
|
||
|
|
"num_tokens": 287870.0,
|
||
|
|
"step": 281
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7357138991355896,
|
||
|
|
"epoch": 0.35561160151324084,
|
||
|
|
"grad_norm": 10.875,
|
||
|
|
"learning_rate": 1.4882222699431664e-05,
|
||
|
|
"loss": 1.5859,
|
||
|
|
"mean_token_accuracy": 0.5942579209804535,
|
||
|
|
"num_tokens": 288867.0,
|
||
|
|
"step": 282
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6793668866157532,
|
||
|
|
"epoch": 0.35687263556116017,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 1.4846713800970217e-05,
|
||
|
|
"loss": 1.6434,
|
||
|
|
"mean_token_accuracy": 0.5955098867416382,
|
||
|
|
"num_tokens": 289975.0,
|
||
|
|
"step": 283
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.608109951019287,
|
||
|
|
"epoch": 0.35813366960907944,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 1.4811124847679603e-05,
|
||
|
|
"loss": 1.4639,
|
||
|
|
"mean_token_accuracy": 0.6151954233646393,
|
||
|
|
"num_tokens": 290984.0,
|
||
|
|
"step": 284
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.671760380268097,
|
||
|
|
"epoch": 0.3593947036569987,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 1.4775456427394732e-05,
|
||
|
|
"loss": 1.6765,
|
||
|
|
"mean_token_accuracy": 0.6170277297496796,
|
||
|
|
"num_tokens": 292072.0,
|
||
|
|
"step": 285
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7108528017997742,
|
||
|
|
"epoch": 0.36065573770491804,
|
||
|
|
"grad_norm": 10.4375,
|
||
|
|
"learning_rate": 1.4739709129263098e-05,
|
||
|
|
"loss": 1.644,
|
||
|
|
"mean_token_accuracy": 0.5863812863826752,
|
||
|
|
"num_tokens": 293028.0,
|
||
|
|
"step": 286
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6518496870994568,
|
||
|
|
"epoch": 0.3619167717528373,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 1.4703883543735047e-05,
|
||
|
|
"loss": 1.5281,
|
||
|
|
"mean_token_accuracy": 0.622421383857727,
|
||
|
|
"num_tokens": 294115.0,
|
||
|
|
"step": 287
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.722779393196106,
|
||
|
|
"epoch": 0.36317780580075665,
|
||
|
|
"grad_norm": 10.75,
|
||
|
|
"learning_rate": 1.4667980262554026e-05,
|
||
|
|
"loss": 1.663,
|
||
|
|
"mean_token_accuracy": 0.5935376286506653,
|
||
|
|
"num_tokens": 295136.0,
|
||
|
|
"step": 288
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.670470952987671,
|
||
|
|
"epoch": 0.3644388398486759,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 1.4631999878746808e-05,
|
||
|
|
"loss": 1.5116,
|
||
|
|
"mean_token_accuracy": 0.6112522780895233,
|
||
|
|
"num_tokens": 296290.0,
|
||
|
|
"step": 289
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7348973751068115,
|
||
|
|
"epoch": 0.3656998738965952,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.4595942986613696e-05,
|
||
|
|
"loss": 1.7292,
|
||
|
|
"mean_token_accuracy": 0.5710300803184509,
|
||
|
|
"num_tokens": 297324.0,
|
||
|
|
"step": 290
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6113238334655762,
|
||
|
|
"epoch": 0.3669609079445145,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 1.4559810181718706e-05,
|
||
|
|
"loss": 1.6248,
|
||
|
|
"mean_token_accuracy": 0.5936411619186401,
|
||
|
|
"num_tokens": 298359.0,
|
||
|
|
"step": 291
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6766598224639893,
|
||
|
|
"epoch": 0.3682219419924338,
|
||
|
|
"grad_norm": 10.6875,
|
||
|
|
"learning_rate": 1.4523602060879729e-05,
|
||
|
|
"loss": 1.6773,
|
||
|
|
"mean_token_accuracy": 0.5820978581905365,
|
||
|
|
"num_tokens": 299301.0,
|
||
|
|
"step": 292
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.568081796169281,
|
||
|
|
"epoch": 0.3694829760403531,
|
||
|
|
"grad_norm": 12.1875,
|
||
|
|
"learning_rate": 1.4487319222158686e-05,
|
||
|
|
"loss": 1.6511,
|
||
|
|
"mean_token_accuracy": 0.5992470383644104,
|
||
|
|
"num_tokens": 300288.0,
|
||
|
|
"step": 293
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6543119549751282,
|
||
|
|
"epoch": 0.3707440100882724,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.4450962264851624e-05,
|
||
|
|
"loss": 1.6154,
|
||
|
|
"mean_token_accuracy": 0.6061901152133942,
|
||
|
|
"num_tokens": 301233.0,
|
||
|
|
"step": 294
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6144514679908752,
|
||
|
|
"epoch": 0.3720050441361917,
|
||
|
|
"grad_norm": 10.625,
|
||
|
|
"learning_rate": 1.4414531789478841e-05,
|
||
|
|
"loss": 1.4881,
|
||
|
|
"mean_token_accuracy": 0.6079922318458557,
|
||
|
|
"num_tokens": 302187.0,
|
||
|
|
"step": 295
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7027471661567688,
|
||
|
|
"epoch": 0.37326607818411095,
|
||
|
|
"grad_norm": 11.0,
|
||
|
|
"learning_rate": 1.4378028397774956e-05,
|
||
|
|
"loss": 1.7576,
|
||
|
|
"mean_token_accuracy": 0.5662052035331726,
|
||
|
|
"num_tokens": 303178.0,
|
||
|
|
"step": 296
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7361412644386292,
|
||
|
|
"epoch": 0.3745271122320303,
|
||
|
|
"grad_norm": 10.875,
|
||
|
|
"learning_rate": 1.4341452692678977e-05,
|
||
|
|
"loss": 1.7464,
|
||
|
|
"mean_token_accuracy": 0.5893420279026031,
|
||
|
|
"num_tokens": 304216.0,
|
||
|
|
"step": 297
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.572529911994934,
|
||
|
|
"epoch": 0.37578814627994955,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.4304805278324321e-05,
|
||
|
|
"loss": 1.6473,
|
||
|
|
"mean_token_accuracy": 0.5932281911373138,
|
||
|
|
"num_tokens": 305253.0,
|
||
|
|
"step": 298
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6188668608665466,
|
||
|
|
"epoch": 0.3770491803278688,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 1.4268086760028872e-05,
|
||
|
|
"loss": 1.6927,
|
||
|
|
"mean_token_accuracy": 0.5837763547897339,
|
||
|
|
"num_tokens": 306328.0,
|
||
|
|
"step": 299
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.598306119441986,
|
||
|
|
"epoch": 0.37831021437578816,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 1.423129774428495e-05,
|
||
|
|
"loss": 1.5212,
|
||
|
|
"mean_token_accuracy": 0.6186553537845612,
|
||
|
|
"num_tokens": 307333.0,
|
||
|
|
"step": 300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6257503628730774,
|
||
|
|
"epoch": 0.37957124842370743,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 1.4194438838749305e-05,
|
||
|
|
"loss": 1.5741,
|
||
|
|
"mean_token_accuracy": 0.5986464321613312,
|
||
|
|
"num_tokens": 308430.0,
|
||
|
|
"step": 301
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5349686741828918,
|
||
|
|
"epoch": 0.38083228247162676,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 1.4157510652233084e-05,
|
||
|
|
"loss": 1.4696,
|
||
|
|
"mean_token_accuracy": 0.6411460041999817,
|
||
|
|
"num_tokens": 309366.0,
|
||
|
|
"step": 302
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5708142518997192,
|
||
|
|
"epoch": 0.38209331651954603,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 1.4120513794691776e-05,
|
||
|
|
"loss": 1.4997,
|
||
|
|
"mean_token_accuracy": 0.6383326947689056,
|
||
|
|
"num_tokens": 310319.0,
|
||
|
|
"step": 303
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7651317715644836,
|
||
|
|
"epoch": 0.3833543505674653,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 1.4083448877215124e-05,
|
||
|
|
"loss": 1.8198,
|
||
|
|
"mean_token_accuracy": 0.5711182057857513,
|
||
|
|
"num_tokens": 311421.0,
|
||
|
|
"step": 304
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6001337766647339,
|
||
|
|
"epoch": 0.38461538461538464,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 1.4046316512017044e-05,
|
||
|
|
"loss": 1.544,
|
||
|
|
"mean_token_accuracy": 0.6265537142753601,
|
||
|
|
"num_tokens": 312503.0,
|
||
|
|
"step": 305
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5876373052597046,
|
||
|
|
"epoch": 0.3858764186633039,
|
||
|
|
"grad_norm": 9.5,
|
||
|
|
"learning_rate": 1.4009117312425508e-05,
|
||
|
|
"loss": 1.5484,
|
||
|
|
"mean_token_accuracy": 0.6097703576087952,
|
||
|
|
"num_tokens": 313569.0,
|
||
|
|
"step": 306
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5826433300971985,
|
||
|
|
"epoch": 0.3871374527112232,
|
||
|
|
"grad_norm": 10.875,
|
||
|
|
"learning_rate": 1.3971851892872426e-05,
|
||
|
|
"loss": 1.6186,
|
||
|
|
"mean_token_accuracy": 0.616737425327301,
|
||
|
|
"num_tokens": 314606.0,
|
||
|
|
"step": 307
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7062678337097168,
|
||
|
|
"epoch": 0.3883984867591425,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 1.3934520868883458e-05,
|
||
|
|
"loss": 1.6629,
|
||
|
|
"mean_token_accuracy": 0.6007142961025238,
|
||
|
|
"num_tokens": 315649.0,
|
||
|
|
"step": 308
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.737806260585785,
|
||
|
|
"epoch": 0.3896595208070618,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.389712485706791e-05,
|
||
|
|
"loss": 1.6147,
|
||
|
|
"mean_token_accuracy": 0.601561039686203,
|
||
|
|
"num_tokens": 316674.0,
|
||
|
|
"step": 309
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7057384848594666,
|
||
|
|
"epoch": 0.39092055485498106,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 1.3859664475108483e-05,
|
||
|
|
"loss": 1.7392,
|
||
|
|
"mean_token_accuracy": 0.5974953472614288,
|
||
|
|
"num_tokens": 317830.0,
|
||
|
|
"step": 310
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6910250782966614,
|
||
|
|
"epoch": 0.3921815889029004,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 1.3822140341751122e-05,
|
||
|
|
"loss": 1.6296,
|
||
|
|
"mean_token_accuracy": 0.604820191860199,
|
||
|
|
"num_tokens": 318911.0,
|
||
|
|
"step": 311
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6173145771026611,
|
||
|
|
"epoch": 0.39344262295081966,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 1.3784553076794768e-05,
|
||
|
|
"loss": 1.552,
|
||
|
|
"mean_token_accuracy": 0.6047369539737701,
|
||
|
|
"num_tokens": 319921.0,
|
||
|
|
"step": 312
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5731265544891357,
|
||
|
|
"epoch": 0.39470365699873894,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 1.3746903301081131e-05,
|
||
|
|
"loss": 1.5985,
|
||
|
|
"mean_token_accuracy": 0.5914210677146912,
|
||
|
|
"num_tokens": 320934.0,
|
||
|
|
"step": 313
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7886484265327454,
|
||
|
|
"epoch": 0.39596469104665827,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 1.3709191636484427e-05,
|
||
|
|
"loss": 1.8448,
|
||
|
|
"mean_token_accuracy": 0.5820522606372833,
|
||
|
|
"num_tokens": 321982.0,
|
||
|
|
"step": 314
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6690111756324768,
|
||
|
|
"epoch": 0.39722572509457754,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 1.3671418705901116e-05,
|
||
|
|
"loss": 1.5918,
|
||
|
|
"mean_token_accuracy": 0.5964595973491669,
|
||
|
|
"num_tokens": 323078.0,
|
||
|
|
"step": 315
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5699005126953125,
|
||
|
|
"epoch": 0.39848675914249687,
|
||
|
|
"grad_norm": 9.3125,
|
||
|
|
"learning_rate": 1.363358513323961e-05,
|
||
|
|
"loss": 1.5419,
|
||
|
|
"mean_token_accuracy": 0.6049994826316833,
|
||
|
|
"num_tokens": 324137.0,
|
||
|
|
"step": 316
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6646732687950134,
|
||
|
|
"epoch": 0.39974779319041615,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 1.3595691543409965e-05,
|
||
|
|
"loss": 1.5807,
|
||
|
|
"mean_token_accuracy": 0.6185460090637207,
|
||
|
|
"num_tokens": 325172.0,
|
||
|
|
"step": 317
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.570213496685028,
|
||
|
|
"epoch": 0.4010088272383354,
|
||
|
|
"grad_norm": 9.3125,
|
||
|
|
"learning_rate": 1.3557738562313567e-05,
|
||
|
|
"loss": 1.5077,
|
||
|
|
"mean_token_accuracy": 0.6095544099807739,
|
||
|
|
"num_tokens": 326289.0,
|
||
|
|
"step": 318
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6996743083000183,
|
||
|
|
"epoch": 0.40226986128625475,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 1.3519726816832775e-05,
|
||
|
|
"loss": 1.6818,
|
||
|
|
"mean_token_accuracy": 0.6007489562034607,
|
||
|
|
"num_tokens": 327275.0,
|
||
|
|
"step": 319
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6339809894561768,
|
||
|
|
"epoch": 0.403530895334174,
|
||
|
|
"grad_norm": 9.5,
|
||
|
|
"learning_rate": 1.3481656934820588e-05,
|
||
|
|
"loss": 1.5448,
|
||
|
|
"mean_token_accuracy": 0.6216733753681183,
|
||
|
|
"num_tokens": 328328.0,
|
||
|
|
"step": 320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7442388534545898,
|
||
|
|
"epoch": 0.4047919293820933,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 1.3443529545090271e-05,
|
||
|
|
"loss": 1.6775,
|
||
|
|
"mean_token_accuracy": 0.5959572196006775,
|
||
|
|
"num_tokens": 329277.0,
|
||
|
|
"step": 321
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.748035728931427,
|
||
|
|
"epoch": 0.4060529634300126,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 1.340534527740495e-05,
|
||
|
|
"loss": 1.6494,
|
||
|
|
"mean_token_accuracy": 0.5945543348789215,
|
||
|
|
"num_tokens": 330321.0,
|
||
|
|
"step": 322
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7139116525650024,
|
||
|
|
"epoch": 0.4073139974779319,
|
||
|
|
"grad_norm": 10.8125,
|
||
|
|
"learning_rate": 1.336710476246724e-05,
|
||
|
|
"loss": 1.6617,
|
||
|
|
"mean_token_accuracy": 0.6113535761833191,
|
||
|
|
"num_tokens": 331273.0,
|
||
|
|
"step": 323
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.64111989736557,
|
||
|
|
"epoch": 0.4085750315258512,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 1.3328808631908793e-05,
|
||
|
|
"loss": 1.5508,
|
||
|
|
"mean_token_accuracy": 0.6171705424785614,
|
||
|
|
"num_tokens": 332336.0,
|
||
|
|
"step": 324
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.654185175895691,
|
||
|
|
"epoch": 0.4098360655737705,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 1.32904575182799e-05,
|
||
|
|
"loss": 1.6993,
|
||
|
|
"mean_token_accuracy": 0.5866393744945526,
|
||
|
|
"num_tokens": 333364.0,
|
||
|
|
"step": 325
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6556926369667053,
|
||
|
|
"epoch": 0.4110970996216898,
|
||
|
|
"grad_norm": 10.6875,
|
||
|
|
"learning_rate": 1.325205205503902e-05,
|
||
|
|
"loss": 1.6917,
|
||
|
|
"mean_token_accuracy": 0.6197098195552826,
|
||
|
|
"num_tokens": 334299.0,
|
||
|
|
"step": 326
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5928033590316772,
|
||
|
|
"epoch": 0.4123581336696091,
|
||
|
|
"grad_norm": 10.625,
|
||
|
|
"learning_rate": 1.3213592876542311e-05,
|
||
|
|
"loss": 1.5404,
|
||
|
|
"mean_token_accuracy": 0.6149138510227203,
|
||
|
|
"num_tokens": 335227.0,
|
||
|
|
"step": 327
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6902371644973755,
|
||
|
|
"epoch": 0.4136191677175284,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 1.3175080618033184e-05,
|
||
|
|
"loss": 1.601,
|
||
|
|
"mean_token_accuracy": 0.6110547780990601,
|
||
|
|
"num_tokens": 336256.0,
|
||
|
|
"step": 328
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5617586970329285,
|
||
|
|
"epoch": 0.41488020176544765,
|
||
|
|
"grad_norm": 9.25,
|
||
|
|
"learning_rate": 1.3136515915631787e-05,
|
||
|
|
"loss": 1.5141,
|
||
|
|
"mean_token_accuracy": 0.6153754889965057,
|
||
|
|
"num_tokens": 337345.0,
|
||
|
|
"step": 329
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.750313639640808,
|
||
|
|
"epoch": 0.416141235813367,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.309789940632448e-05,
|
||
|
|
"loss": 1.6528,
|
||
|
|
"mean_token_accuracy": 0.5952678918838501,
|
||
|
|
"num_tokens": 338393.0,
|
||
|
|
"step": 330
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6990376114845276,
|
||
|
|
"epoch": 0.41740226986128626,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 1.305923172795337e-05,
|
||
|
|
"loss": 1.6271,
|
||
|
|
"mean_token_accuracy": 0.5852847993373871,
|
||
|
|
"num_tokens": 339528.0,
|
||
|
|
"step": 331
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5784698724746704,
|
||
|
|
"epoch": 0.41866330390920553,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 1.3020513519205714e-05,
|
||
|
|
"loss": 1.4595,
|
||
|
|
"mean_token_accuracy": 0.6244376301765442,
|
||
|
|
"num_tokens": 340505.0,
|
||
|
|
"step": 332
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.646328330039978,
|
||
|
|
"epoch": 0.41992433795712486,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 1.2981745419603403e-05,
|
||
|
|
"loss": 1.5663,
|
||
|
|
"mean_token_accuracy": 0.6136239767074585,
|
||
|
|
"num_tokens": 341606.0,
|
||
|
|
"step": 333
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5949352979660034,
|
||
|
|
"epoch": 0.42118537200504413,
|
||
|
|
"grad_norm": 11.375,
|
||
|
|
"learning_rate": 1.29429280694924e-05,
|
||
|
|
"loss": 1.6404,
|
||
|
|
"mean_token_accuracy": 0.5875102579593658,
|
||
|
|
"num_tokens": 342542.0,
|
||
|
|
"step": 334
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6558752059936523,
|
||
|
|
"epoch": 0.4224464060529634,
|
||
|
|
"grad_norm": 10.75,
|
||
|
|
"learning_rate": 1.2904062110032145e-05,
|
||
|
|
"loss": 1.6276,
|
||
|
|
"mean_token_accuracy": 0.6022941172122955,
|
||
|
|
"num_tokens": 343518.0,
|
||
|
|
"step": 335
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5980592370033264,
|
||
|
|
"epoch": 0.42370744010088274,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.286514818318499e-05,
|
||
|
|
"loss": 1.5295,
|
||
|
|
"mean_token_accuracy": 0.6176810562610626,
|
||
|
|
"num_tokens": 344569.0,
|
||
|
|
"step": 336
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7125784754753113,
|
||
|
|
"epoch": 0.424968474148802,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 1.2826186931705562e-05,
|
||
|
|
"loss": 1.7364,
|
||
|
|
"mean_token_accuracy": 0.5906746685504913,
|
||
|
|
"num_tokens": 345615.0,
|
||
|
|
"step": 337
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6670573949813843,
|
||
|
|
"epoch": 0.4262295081967213,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 1.2787178999130176e-05,
|
||
|
|
"loss": 1.6963,
|
||
|
|
"mean_token_accuracy": 0.5844032764434814,
|
||
|
|
"num_tokens": 346655.0,
|
||
|
|
"step": 338
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.59793359041214,
|
||
|
|
"epoch": 0.4274905422446406,
|
||
|
|
"grad_norm": 11.0625,
|
||
|
|
"learning_rate": 1.2748125029766199e-05,
|
||
|
|
"loss": 1.7215,
|
||
|
|
"mean_token_accuracy": 0.5798592269420624,
|
||
|
|
"num_tokens": 347758.0,
|
||
|
|
"step": 339
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5533649325370789,
|
||
|
|
"epoch": 0.4287515762925599,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 1.270902566868139e-05,
|
||
|
|
"loss": 1.4829,
|
||
|
|
"mean_token_accuracy": 0.6233780384063721,
|
||
|
|
"num_tokens": 348812.0,
|
||
|
|
"step": 340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5563918352127075,
|
||
|
|
"epoch": 0.4300126103404792,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 1.2669881561693268e-05,
|
||
|
|
"loss": 1.5464,
|
||
|
|
"mean_token_accuracy": 0.6154004633426666,
|
||
|
|
"num_tokens": 349899.0,
|
||
|
|
"step": 341
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6067227125167847,
|
||
|
|
"epoch": 0.4312736443883985,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 1.2630693355358436e-05,
|
||
|
|
"loss": 1.6096,
|
||
|
|
"mean_token_accuracy": 0.6106597483158112,
|
||
|
|
"num_tokens": 350892.0,
|
||
|
|
"step": 342
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6174876689910889,
|
||
|
|
"epoch": 0.43253467843631777,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 1.2591461696961895e-05,
|
||
|
|
"loss": 1.5553,
|
||
|
|
"mean_token_accuracy": 0.6354844272136688,
|
||
|
|
"num_tokens": 351985.0,
|
||
|
|
"step": 343
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5226198434829712,
|
||
|
|
"epoch": 0.4337957124842371,
|
||
|
|
"grad_norm": 11.5625,
|
||
|
|
"learning_rate": 1.2552187234506363e-05,
|
||
|
|
"loss": 1.4493,
|
||
|
|
"mean_token_accuracy": 0.6296395361423492,
|
||
|
|
"num_tokens": 352930.0,
|
||
|
|
"step": 344
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6481866836547852,
|
||
|
|
"epoch": 0.43505674653215637,
|
||
|
|
"grad_norm": 10.4375,
|
||
|
|
"learning_rate": 1.2512870616701571e-05,
|
||
|
|
"loss": 1.7494,
|
||
|
|
"mean_token_accuracy": 0.5906344056129456,
|
||
|
|
"num_tokens": 353936.0,
|
||
|
|
"step": 345
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6437349319458008,
|
||
|
|
"epoch": 0.43631778058007564,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.247351249295353e-05,
|
||
|
|
"loss": 1.622,
|
||
|
|
"mean_token_accuracy": 0.6081748604774475,
|
||
|
|
"num_tokens": 354963.0,
|
||
|
|
"step": 346
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6472490429878235,
|
||
|
|
"epoch": 0.43757881462799497,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 1.2434113513353834e-05,
|
||
|
|
"loss": 1.5786,
|
||
|
|
"mean_token_accuracy": 0.6120360493659973,
|
||
|
|
"num_tokens": 356033.0,
|
||
|
|
"step": 347
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5894339680671692,
|
||
|
|
"epoch": 0.43883984867591425,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 1.2394674328668905e-05,
|
||
|
|
"loss": 1.586,
|
||
|
|
"mean_token_accuracy": 0.5935371220111847,
|
||
|
|
"num_tokens": 357017.0,
|
||
|
|
"step": 348
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6726936101913452,
|
||
|
|
"epoch": 0.4401008827238335,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 1.2355195590329233e-05,
|
||
|
|
"loss": 1.6063,
|
||
|
|
"mean_token_accuracy": 0.5973404049873352,
|
||
|
|
"num_tokens": 358044.0,
|
||
|
|
"step": 349
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5750855803489685,
|
||
|
|
"epoch": 0.44136191677175285,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 1.2315677950418645e-05,
|
||
|
|
"loss": 1.4712,
|
||
|
|
"mean_token_accuracy": 0.6315289437770844,
|
||
|
|
"num_tokens": 359086.0,
|
||
|
|
"step": 350
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6587135195732117,
|
||
|
|
"epoch": 0.4426229508196721,
|
||
|
|
"grad_norm": 10.75,
|
||
|
|
"learning_rate": 1.2276122061663512e-05,
|
||
|
|
"loss": 1.7816,
|
||
|
|
"mean_token_accuracy": 0.5714567303657532,
|
||
|
|
"num_tokens": 360075.0,
|
||
|
|
"step": 351
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6971294283866882,
|
||
|
|
"epoch": 0.44388398486759145,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.2236528577421976e-05,
|
||
|
|
"loss": 1.645,
|
||
|
|
"mean_token_accuracy": 0.603605717420578,
|
||
|
|
"num_tokens": 361105.0,
|
||
|
|
"step": 352
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5821102857589722,
|
||
|
|
"epoch": 0.4451450189155107,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.2196898151673151e-05,
|
||
|
|
"loss": 1.5037,
|
||
|
|
"mean_token_accuracy": 0.6134222447872162,
|
||
|
|
"num_tokens": 362102.0,
|
||
|
|
"step": 353
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.658466398715973,
|
||
|
|
"epoch": 0.44640605296343,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.2157231439006332e-05,
|
||
|
|
"loss": 1.6378,
|
||
|
|
"mean_token_accuracy": 0.5979603230953217,
|
||
|
|
"num_tokens": 363142.0,
|
||
|
|
"step": 354
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5029519200325012,
|
||
|
|
"epoch": 0.44766708701134933,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 1.2117529094610177e-05,
|
||
|
|
"loss": 1.5073,
|
||
|
|
"mean_token_accuracy": 0.6103595197200775,
|
||
|
|
"num_tokens": 364152.0,
|
||
|
|
"step": 355
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.594939947128296,
|
||
|
|
"epoch": 0.4489281210592686,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 1.2077791774261884e-05,
|
||
|
|
"loss": 1.5719,
|
||
|
|
"mean_token_accuracy": 0.6029103994369507,
|
||
|
|
"num_tokens": 365285.0,
|
||
|
|
"step": 356
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6445053815841675,
|
||
|
|
"epoch": 0.4501891551071879,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 1.2038020134316361e-05,
|
||
|
|
"loss": 1.5611,
|
||
|
|
"mean_token_accuracy": 0.5866135954856873,
|
||
|
|
"num_tokens": 366248.0,
|
||
|
|
"step": 357
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5946715474128723,
|
||
|
|
"epoch": 0.4514501891551072,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.1998214831695388e-05,
|
||
|
|
"loss": 1.5427,
|
||
|
|
"mean_token_accuracy": 0.6005336046218872,
|
||
|
|
"num_tokens": 367310.0,
|
||
|
|
"step": 358
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.8378031253814697,
|
||
|
|
"epoch": 0.4527112232030265,
|
||
|
|
"grad_norm": 10.4375,
|
||
|
|
"learning_rate": 1.1958376523876754e-05,
|
||
|
|
"loss": 1.9031,
|
||
|
|
"mean_token_accuracy": 0.5457925498485565,
|
||
|
|
"num_tokens": 368362.0,
|
||
|
|
"step": 359
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6695040464401245,
|
||
|
|
"epoch": 0.45397225725094575,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 1.1918505868883414e-05,
|
||
|
|
"loss": 1.5786,
|
||
|
|
"mean_token_accuracy": 0.5993266105651855,
|
||
|
|
"num_tokens": 369444.0,
|
||
|
|
"step": 360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7709419131278992,
|
||
|
|
"epoch": 0.4552332912988651,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 1.1878603525272613e-05,
|
||
|
|
"loss": 1.7425,
|
||
|
|
"mean_token_accuracy": 0.5715267360210419,
|
||
|
|
"num_tokens": 370476.0,
|
||
|
|
"step": 361
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6697160005569458,
|
||
|
|
"epoch": 0.45649432534678436,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 1.1838670152125002e-05,
|
||
|
|
"loss": 1.6235,
|
||
|
|
"mean_token_accuracy": 0.5874466001987457,
|
||
|
|
"num_tokens": 371493.0,
|
||
|
|
"step": 362
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6504763960838318,
|
||
|
|
"epoch": 0.45775535939470363,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 1.179870640903376e-05,
|
||
|
|
"loss": 1.6297,
|
||
|
|
"mean_token_accuracy": 0.611328125,
|
||
|
|
"num_tokens": 372589.0,
|
||
|
|
"step": 363
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.703143298625946,
|
||
|
|
"epoch": 0.45901639344262296,
|
||
|
|
"grad_norm": 10.625,
|
||
|
|
"learning_rate": 1.1758712956093699e-05,
|
||
|
|
"loss": 1.5668,
|
||
|
|
"mean_token_accuracy": 0.619348019361496,
|
||
|
|
"num_tokens": 373566.0,
|
||
|
|
"step": 364
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6715249419212341,
|
||
|
|
"epoch": 0.46027742749054223,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 1.1718690453890356e-05,
|
||
|
|
"loss": 1.6445,
|
||
|
|
"mean_token_accuracy": 0.5938351452350616,
|
||
|
|
"num_tokens": 374681.0,
|
||
|
|
"step": 365
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6687431335449219,
|
||
|
|
"epoch": 0.46153846153846156,
|
||
|
|
"grad_norm": 9.5,
|
||
|
|
"learning_rate": 1.1678639563489085e-05,
|
||
|
|
"loss": 1.6033,
|
||
|
|
"mean_token_accuracy": 0.6006240844726562,
|
||
|
|
"num_tokens": 375780.0,
|
||
|
|
"step": 366
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.698667287826538,
|
||
|
|
"epoch": 0.46279949558638084,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 1.163856094642414e-05,
|
||
|
|
"loss": 1.7423,
|
||
|
|
"mean_token_accuracy": 0.5795640051364899,
|
||
|
|
"num_tokens": 376792.0,
|
||
|
|
"step": 367
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5898205637931824,
|
||
|
|
"epoch": 0.4640605296343001,
|
||
|
|
"grad_norm": 10.6875,
|
||
|
|
"learning_rate": 1.159845526468774e-05,
|
||
|
|
"loss": 1.5514,
|
||
|
|
"mean_token_accuracy": 0.6268898248672485,
|
||
|
|
"num_tokens": 377749.0,
|
||
|
|
"step": 368
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5236408710479736,
|
||
|
|
"epoch": 0.46532156368221944,
|
||
|
|
"grad_norm": 10.4375,
|
||
|
|
"learning_rate": 1.1558323180719147e-05,
|
||
|
|
"loss": 1.5018,
|
||
|
|
"mean_token_accuracy": 0.6263366341590881,
|
||
|
|
"num_tokens": 378731.0,
|
||
|
|
"step": 369
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5538042783737183,
|
||
|
|
"epoch": 0.4665825977301387,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 1.1518165357393716e-05,
|
||
|
|
"loss": 1.4621,
|
||
|
|
"mean_token_accuracy": 0.6311676800251007,
|
||
|
|
"num_tokens": 379782.0,
|
||
|
|
"step": 370
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.693616509437561,
|
||
|
|
"epoch": 0.467843631778058,
|
||
|
|
"grad_norm": 9.375,
|
||
|
|
"learning_rate": 1.1477982458011945e-05,
|
||
|
|
"loss": 1.5905,
|
||
|
|
"mean_token_accuracy": 0.5960313081741333,
|
||
|
|
"num_tokens": 380929.0,
|
||
|
|
"step": 371
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.606422245502472,
|
||
|
|
"epoch": 0.4691046658259773,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 1.1437775146288522e-05,
|
||
|
|
"loss": 1.6387,
|
||
|
|
"mean_token_accuracy": 0.6152320206165314,
|
||
|
|
"num_tokens": 381995.0,
|
||
|
|
"step": 372
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6852609515190125,
|
||
|
|
"epoch": 0.4703656998738966,
|
||
|
|
"grad_norm": 10.4375,
|
||
|
|
"learning_rate": 1.1397544086341366e-05,
|
||
|
|
"loss": 1.6951,
|
||
|
|
"mean_token_accuracy": 0.5859934687614441,
|
||
|
|
"num_tokens": 382974.0,
|
||
|
|
"step": 373
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5799720287322998,
|
||
|
|
"epoch": 0.47162673392181587,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 1.1357289942680652e-05,
|
||
|
|
"loss": 1.5323,
|
||
|
|
"mean_token_accuracy": 0.6245266199111938,
|
||
|
|
"num_tokens": 383989.0,
|
||
|
|
"step": 374
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7972606420516968,
|
||
|
|
"epoch": 0.4728877679697352,
|
||
|
|
"grad_norm": 10.875,
|
||
|
|
"learning_rate": 1.1317013380197832e-05,
|
||
|
|
"loss": 1.7597,
|
||
|
|
"mean_token_accuracy": 0.5681908130645752,
|
||
|
|
"num_tokens": 385042.0,
|
||
|
|
"step": 375
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5598702430725098,
|
||
|
|
"epoch": 0.47414880201765447,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 1.1276715064154663e-05,
|
||
|
|
"loss": 1.4771,
|
||
|
|
"mean_token_accuracy": 0.6240810751914978,
|
||
|
|
"num_tokens": 386083.0,
|
||
|
|
"step": 376
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.590512454509735,
|
||
|
|
"epoch": 0.47540983606557374,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 1.123639566017221e-05,
|
||
|
|
"loss": 1.5557,
|
||
|
|
"mean_token_accuracy": 0.6280277073383331,
|
||
|
|
"num_tokens": 387030.0,
|
||
|
|
"step": 377
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6556403636932373,
|
||
|
|
"epoch": 0.4766708701134931,
|
||
|
|
"grad_norm": 10.625,
|
||
|
|
"learning_rate": 1.119605583421986e-05,
|
||
|
|
"loss": 1.5002,
|
||
|
|
"mean_token_accuracy": 0.6344245374202728,
|
||
|
|
"num_tokens": 387986.0,
|
||
|
|
"step": 378
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6127241253852844,
|
||
|
|
"epoch": 0.47793190416141235,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 1.1155696252604305e-05,
|
||
|
|
"loss": 1.5813,
|
||
|
|
"mean_token_accuracy": 0.6234078109264374,
|
||
|
|
"num_tokens": 389019.0,
|
||
|
|
"step": 379
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.567520260810852,
|
||
|
|
"epoch": 0.4791929382093317,
|
||
|
|
"grad_norm": 9.4375,
|
||
|
|
"learning_rate": 1.111531758195856e-05,
|
||
|
|
"loss": 1.4871,
|
||
|
|
"mean_token_accuracy": 0.623456597328186,
|
||
|
|
"num_tokens": 390134.0,
|
||
|
|
"step": 380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6580626368522644,
|
||
|
|
"epoch": 0.48045397225725095,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.1074920489230934e-05,
|
||
|
|
"loss": 1.6402,
|
||
|
|
"mean_token_accuracy": 0.6016538441181183,
|
||
|
|
"num_tokens": 391072.0,
|
||
|
|
"step": 381
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7108508348464966,
|
||
|
|
"epoch": 0.4817150063051702,
|
||
|
|
"grad_norm": 10.75,
|
||
|
|
"learning_rate": 1.1034505641674022e-05,
|
||
|
|
"loss": 1.7194,
|
||
|
|
"mean_token_accuracy": 0.5933779776096344,
|
||
|
|
"num_tokens": 392032.0,
|
||
|
|
"step": 382
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.777218222618103,
|
||
|
|
"epoch": 0.48297604035308955,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.0994073706833682e-05,
|
||
|
|
"loss": 1.6974,
|
||
|
|
"mean_token_accuracy": 0.6018114984035492,
|
||
|
|
"num_tokens": 393070.0,
|
||
|
|
"step": 383
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6174723505973816,
|
||
|
|
"epoch": 0.4842370744010088,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.0953625352538006e-05,
|
||
|
|
"loss": 1.7052,
|
||
|
|
"mean_token_accuracy": 0.6018138229846954,
|
||
|
|
"num_tokens": 394136.0,
|
||
|
|
"step": 384
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.4872437715530396,
|
||
|
|
"epoch": 0.4854981084489281,
|
||
|
|
"grad_norm": 11.4375,
|
||
|
|
"learning_rate": 1.091316124688629e-05,
|
||
|
|
"loss": 1.4657,
|
||
|
|
"mean_token_accuracy": 0.6230264902114868,
|
||
|
|
"num_tokens": 395019.0,
|
||
|
|
"step": 385
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5409154295921326,
|
||
|
|
"epoch": 0.48675914249684743,
|
||
|
|
"grad_norm": 9.5,
|
||
|
|
"learning_rate": 1.0872682058238009e-05,
|
||
|
|
"loss": 1.501,
|
||
|
|
"mean_token_accuracy": 0.6168979108333588,
|
||
|
|
"num_tokens": 395986.0,
|
||
|
|
"step": 386
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5526871085166931,
|
||
|
|
"epoch": 0.4880201765447667,
|
||
|
|
"grad_norm": 9.5,
|
||
|
|
"learning_rate": 1.0832188455201762e-05,
|
||
|
|
"loss": 1.4908,
|
||
|
|
"mean_token_accuracy": 0.6186527013778687,
|
||
|
|
"num_tokens": 397140.0,
|
||
|
|
"step": 387
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7182149291038513,
|
||
|
|
"epoch": 0.489281210592686,
|
||
|
|
"grad_norm": 11.3125,
|
||
|
|
"learning_rate": 1.0791681106624235e-05,
|
||
|
|
"loss": 1.7584,
|
||
|
|
"mean_token_accuracy": 0.5741702020168304,
|
||
|
|
"num_tokens": 398163.0,
|
||
|
|
"step": 388
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6726354360580444,
|
||
|
|
"epoch": 0.4905422446406053,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 1.0751160681579158e-05,
|
||
|
|
"loss": 1.6979,
|
||
|
|
"mean_token_accuracy": 0.5841811895370483,
|
||
|
|
"num_tokens": 399188.0,
|
||
|
|
"step": 389
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6654912233352661,
|
||
|
|
"epoch": 0.4918032786885246,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 1.0710627849356246e-05,
|
||
|
|
"loss": 1.677,
|
||
|
|
"mean_token_accuracy": 0.5893719792366028,
|
||
|
|
"num_tokens": 400265.0,
|
||
|
|
"step": 390
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6826136112213135,
|
||
|
|
"epoch": 0.4930643127364439,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 1.0670083279450147e-05,
|
||
|
|
"loss": 1.7139,
|
||
|
|
"mean_token_accuracy": 0.5932460427284241,
|
||
|
|
"num_tokens": 401384.0,
|
||
|
|
"step": 391
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7140849232673645,
|
||
|
|
"epoch": 0.4943253467843632,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 1.0629527641549391e-05,
|
||
|
|
"loss": 1.6901,
|
||
|
|
"mean_token_accuracy": 0.5878322720527649,
|
||
|
|
"num_tokens": 402473.0,
|
||
|
|
"step": 392
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6500442624092102,
|
||
|
|
"epoch": 0.49558638083228246,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 1.0588961605525314e-05,
|
||
|
|
"loss": 1.5253,
|
||
|
|
"mean_token_accuracy": 0.6133356094360352,
|
||
|
|
"num_tokens": 403534.0,
|
||
|
|
"step": 393
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6340318322181702,
|
||
|
|
"epoch": 0.4968474148802018,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 1.0548385841421008e-05,
|
||
|
|
"loss": 1.6853,
|
||
|
|
"mean_token_accuracy": 0.5924564301967621,
|
||
|
|
"num_tokens": 404590.0,
|
||
|
|
"step": 394
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5939557552337646,
|
||
|
|
"epoch": 0.49810844892812106,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 1.0507801019440235e-05,
|
||
|
|
"loss": 1.5353,
|
||
|
|
"mean_token_accuracy": 0.6335581541061401,
|
||
|
|
"num_tokens": 405597.0,
|
||
|
|
"step": 395
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6368260979652405,
|
||
|
|
"epoch": 0.49936948297604034,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.0467207809936387e-05,
|
||
|
|
"loss": 1.574,
|
||
|
|
"mean_token_accuracy": 0.6152799725532532,
|
||
|
|
"num_tokens": 406566.0,
|
||
|
|
"step": 396
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6411439180374146,
|
||
|
|
"epoch": 0.5006305170239597,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 1.0426606883401382e-05,
|
||
|
|
"loss": 1.6547,
|
||
|
|
"mean_token_accuracy": 0.597534567117691,
|
||
|
|
"num_tokens": 407648.0,
|
||
|
|
"step": 397
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5688404440879822,
|
||
|
|
"epoch": 0.501891551071879,
|
||
|
|
"grad_norm": 11.0,
|
||
|
|
"learning_rate": 1.0385998910454605e-05,
|
||
|
|
"loss": 1.6324,
|
||
|
|
"mean_token_accuracy": 0.6084195673465729,
|
||
|
|
"num_tokens": 408625.0,
|
||
|
|
"step": 398
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.582146406173706,
|
||
|
|
"epoch": 0.5031525851197982,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 1.034538456183183e-05,
|
||
|
|
"loss": 1.5041,
|
||
|
|
"mean_token_accuracy": 0.6192508339881897,
|
||
|
|
"num_tokens": 409663.0,
|
||
|
|
"step": 399
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7961878180503845,
|
||
|
|
"epoch": 0.5044136191677175,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 1.0304764508374152e-05,
|
||
|
|
"loss": 1.7948,
|
||
|
|
"mean_token_accuracy": 0.5808870196342468,
|
||
|
|
"num_tokens": 410771.0,
|
||
|
|
"step": 400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5845588445663452,
|
||
|
|
"epoch": 0.5056746532156369,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 1.026413942101687e-05,
|
||
|
|
"loss": 1.485,
|
||
|
|
"mean_token_accuracy": 0.6123223900794983,
|
||
|
|
"num_tokens": 411873.0,
|
||
|
|
"step": 401
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6289093494415283,
|
||
|
|
"epoch": 0.5069356872635561,
|
||
|
|
"grad_norm": 10.75,
|
||
|
|
"learning_rate": 1.0223509970778451e-05,
|
||
|
|
"loss": 1.5713,
|
||
|
|
"mean_token_accuracy": 0.5967106819152832,
|
||
|
|
"num_tokens": 412844.0,
|
||
|
|
"step": 402
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.591609001159668,
|
||
|
|
"epoch": 0.5081967213114754,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 1.0182876828749419e-05,
|
||
|
|
"loss": 1.6322,
|
||
|
|
"mean_token_accuracy": 0.6031698882579803,
|
||
|
|
"num_tokens": 413923.0,
|
||
|
|
"step": 403
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7119539380073547,
|
||
|
|
"epoch": 0.5094577553593947,
|
||
|
|
"grad_norm": 10.8125,
|
||
|
|
"learning_rate": 1.0142240666081267e-05,
|
||
|
|
"loss": 1.6689,
|
||
|
|
"mean_token_accuracy": 0.5945393443107605,
|
||
|
|
"num_tokens": 414843.0,
|
||
|
|
"step": 404
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7793172597885132,
|
||
|
|
"epoch": 0.510718789407314,
|
||
|
|
"grad_norm": 10.4375,
|
||
|
|
"learning_rate": 1.0101602153975398e-05,
|
||
|
|
"loss": 1.752,
|
||
|
|
"mean_token_accuracy": 0.5787781774997711,
|
||
|
|
"num_tokens": 415846.0,
|
||
|
|
"step": 405
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6222423911094666,
|
||
|
|
"epoch": 0.5119798234552333,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 1.0060961963672009e-05,
|
||
|
|
"loss": 1.5658,
|
||
|
|
"mean_token_accuracy": 0.6171309351921082,
|
||
|
|
"num_tokens": 416858.0,
|
||
|
|
"step": 406
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6142125725746155,
|
||
|
|
"epoch": 0.5132408575031526,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 1.002032076643902e-05,
|
||
|
|
"loss": 1.5111,
|
||
|
|
"mean_token_accuracy": 0.6223633885383606,
|
||
|
|
"num_tokens": 417867.0,
|
||
|
|
"step": 407
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6783021688461304,
|
||
|
|
"epoch": 0.5145018915510718,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 9.979679233560983e-06,
|
||
|
|
"loss": 1.6308,
|
||
|
|
"mean_token_accuracy": 0.6037567555904388,
|
||
|
|
"num_tokens": 418919.0,
|
||
|
|
"step": 408
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6696065664291382,
|
||
|
|
"epoch": 0.5157629255989912,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 9.939038036327993e-06,
|
||
|
|
"loss": 1.637,
|
||
|
|
"mean_token_accuracy": 0.597319483757019,
|
||
|
|
"num_tokens": 419921.0,
|
||
|
|
"step": 409
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6745046973228455,
|
||
|
|
"epoch": 0.5170239596469105,
|
||
|
|
"grad_norm": 11.875,
|
||
|
|
"learning_rate": 9.898397846024604e-06,
|
||
|
|
"loss": 1.6559,
|
||
|
|
"mean_token_accuracy": 0.5922911167144775,
|
||
|
|
"num_tokens": 420764.0,
|
||
|
|
"step": 410
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6524096727371216,
|
||
|
|
"epoch": 0.5182849936948297,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 9.857759333918736e-06,
|
||
|
|
"loss": 1.6221,
|
||
|
|
"mean_token_accuracy": 0.5971469581127167,
|
||
|
|
"num_tokens": 421788.0,
|
||
|
|
"step": 411
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7309560775756836,
|
||
|
|
"epoch": 0.519546027742749,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 9.817123171250586e-06,
|
||
|
|
"loss": 1.7548,
|
||
|
|
"mean_token_accuracy": 0.5891126096248627,
|
||
|
|
"num_tokens": 422819.0,
|
||
|
|
"step": 412
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6804513335227966,
|
||
|
|
"epoch": 0.5208070617906684,
|
||
|
|
"grad_norm": 10.625,
|
||
|
|
"learning_rate": 9.77649002922155e-06,
|
||
|
|
"loss": 1.6216,
|
||
|
|
"mean_token_accuracy": 0.5936564207077026,
|
||
|
|
"num_tokens": 423775.0,
|
||
|
|
"step": 413
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6066806316375732,
|
||
|
|
"epoch": 0.5220680958385876,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 9.735860578983134e-06,
|
||
|
|
"loss": 1.5184,
|
||
|
|
"mean_token_accuracy": 0.6163980662822723,
|
||
|
|
"num_tokens": 424847.0,
|
||
|
|
"step": 414
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7321721911430359,
|
||
|
|
"epoch": 0.5233291298865069,
|
||
|
|
"grad_norm": 10.875,
|
||
|
|
"learning_rate": 9.69523549162585e-06,
|
||
|
|
"loss": 1.7004,
|
||
|
|
"mean_token_accuracy": 0.591398149728775,
|
||
|
|
"num_tokens": 425822.0,
|
||
|
|
"step": 415
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5671403408050537,
|
||
|
|
"epoch": 0.5245901639344263,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 9.654615438168168e-06,
|
||
|
|
"loss": 1.4598,
|
||
|
|
"mean_token_accuracy": 0.6316723823547363,
|
||
|
|
"num_tokens": 426834.0,
|
||
|
|
"step": 416
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5517327785491943,
|
||
|
|
"epoch": 0.5258511979823455,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 9.614001089545397e-06,
|
||
|
|
"loss": 1.37,
|
||
|
|
"mean_token_accuracy": 0.6457661688327789,
|
||
|
|
"num_tokens": 427799.0,
|
||
|
|
"step": 417
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6002381443977356,
|
||
|
|
"epoch": 0.5271122320302648,
|
||
|
|
"grad_norm": 9.3125,
|
||
|
|
"learning_rate": 9.573393116598623e-06,
|
||
|
|
"loss": 1.5309,
|
||
|
|
"mean_token_accuracy": 0.6354118883609772,
|
||
|
|
"num_tokens": 428914.0,
|
||
|
|
"step": 418
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6189780235290527,
|
||
|
|
"epoch": 0.5283732660781841,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 9.532792190063618e-06,
|
||
|
|
"loss": 1.6119,
|
||
|
|
"mean_token_accuracy": 0.6044613420963287,
|
||
|
|
"num_tokens": 429978.0,
|
||
|
|
"step": 419
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7663971781730652,
|
||
|
|
"epoch": 0.5296343001261034,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 9.492198980559766e-06,
|
||
|
|
"loss": 1.7127,
|
||
|
|
"mean_token_accuracy": 0.5848791599273682,
|
||
|
|
"num_tokens": 431089.0,
|
||
|
|
"step": 420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6590540409088135,
|
||
|
|
"epoch": 0.5308953341740227,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 9.451614158578995e-06,
|
||
|
|
"loss": 1.5649,
|
||
|
|
"mean_token_accuracy": 0.6263427138328552,
|
||
|
|
"num_tokens": 432112.0,
|
||
|
|
"step": 421
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6148885488510132,
|
||
|
|
"epoch": 0.532156368221942,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 9.411038394474688e-06,
|
||
|
|
"loss": 1.5817,
|
||
|
|
"mean_token_accuracy": 0.6041344702243805,
|
||
|
|
"num_tokens": 433130.0,
|
||
|
|
"step": 422
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7220088243484497,
|
||
|
|
"epoch": 0.5334174022698613,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 9.370472358450609e-06,
|
||
|
|
"loss": 1.782,
|
||
|
|
"mean_token_accuracy": 0.5883914828300476,
|
||
|
|
"num_tokens": 434173.0,
|
||
|
|
"step": 423
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6253851652145386,
|
||
|
|
"epoch": 0.5346784363177806,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 9.329916720549855e-06,
|
||
|
|
"loss": 1.6806,
|
||
|
|
"mean_token_accuracy": 0.5752127766609192,
|
||
|
|
"num_tokens": 435273.0,
|
||
|
|
"step": 424
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.565285325050354,
|
||
|
|
"epoch": 0.5359394703656999,
|
||
|
|
"grad_norm": 9.4375,
|
||
|
|
"learning_rate": 9.289372150643759e-06,
|
||
|
|
"loss": 1.5455,
|
||
|
|
"mean_token_accuracy": 0.6019730269908905,
|
||
|
|
"num_tokens": 436387.0,
|
||
|
|
"step": 425
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6875513195991516,
|
||
|
|
"epoch": 0.5372005044136192,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 9.248839318420846e-06,
|
||
|
|
"loss": 1.6154,
|
||
|
|
"mean_token_accuracy": 0.583704262971878,
|
||
|
|
"num_tokens": 437423.0,
|
||
|
|
"step": 426
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5952463746070862,
|
||
|
|
"epoch": 0.5384615384615384,
|
||
|
|
"grad_norm": 11.125,
|
||
|
|
"learning_rate": 9.208318893375769e-06,
|
||
|
|
"loss": 1.5467,
|
||
|
|
"mean_token_accuracy": 0.6100804209709167,
|
||
|
|
"num_tokens": 438401.0,
|
||
|
|
"step": 427
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6592921614646912,
|
||
|
|
"epoch": 0.5397225725094578,
|
||
|
|
"grad_norm": 10.4375,
|
||
|
|
"learning_rate": 9.167811544798241e-06,
|
||
|
|
"loss": 1.7064,
|
||
|
|
"mean_token_accuracy": 0.5798455774784088,
|
||
|
|
"num_tokens": 439411.0,
|
||
|
|
"step": 428
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.638920783996582,
|
||
|
|
"epoch": 0.5409836065573771,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 9.127317941761993e-06,
|
||
|
|
"loss": 1.7301,
|
||
|
|
"mean_token_accuracy": 0.5835573971271515,
|
||
|
|
"num_tokens": 440443.0,
|
||
|
|
"step": 429
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6542947888374329,
|
||
|
|
"epoch": 0.5422446406052963,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 9.08683875311371e-06,
|
||
|
|
"loss": 1.5304,
|
||
|
|
"mean_token_accuracy": 0.6138914525508881,
|
||
|
|
"num_tokens": 441410.0,
|
||
|
|
"step": 430
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6559125185012817,
|
||
|
|
"epoch": 0.5435056746532156,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 9.046374647462e-06,
|
||
|
|
"loss": 1.519,
|
||
|
|
"mean_token_accuracy": 0.6206876933574677,
|
||
|
|
"num_tokens": 442410.0,
|
||
|
|
"step": 431
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6727120280265808,
|
||
|
|
"epoch": 0.544766708701135,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 9.005926293166322e-06,
|
||
|
|
"loss": 1.6683,
|
||
|
|
"mean_token_accuracy": 0.6026677787303925,
|
||
|
|
"num_tokens": 443494.0,
|
||
|
|
"step": 432
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7115206122398376,
|
||
|
|
"epoch": 0.5460277427490542,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 8.965494358325982e-06,
|
||
|
|
"loss": 1.7807,
|
||
|
|
"mean_token_accuracy": 0.5852868556976318,
|
||
|
|
"num_tokens": 444505.0,
|
||
|
|
"step": 433
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5636682510375977,
|
||
|
|
"epoch": 0.5472887767969735,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 8.925079510769068e-06,
|
||
|
|
"loss": 1.4986,
|
||
|
|
"mean_token_accuracy": 0.613828033208847,
|
||
|
|
"num_tokens": 445575.0,
|
||
|
|
"step": 434
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5912127494812012,
|
||
|
|
"epoch": 0.5485498108448928,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 8.884682418041443e-06,
|
||
|
|
"loss": 1.54,
|
||
|
|
"mean_token_accuracy": 0.5976535975933075,
|
||
|
|
"num_tokens": 446540.0,
|
||
|
|
"step": 435
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.582628309726715,
|
||
|
|
"epoch": 0.5498108448928121,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 8.844303747395697e-06,
|
||
|
|
"loss": 1.6275,
|
||
|
|
"mean_token_accuracy": 0.6039268970489502,
|
||
|
|
"num_tokens": 447601.0,
|
||
|
|
"step": 436
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.64738130569458,
|
||
|
|
"epoch": 0.5510718789407314,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 8.803944165780146e-06,
|
||
|
|
"loss": 1.6521,
|
||
|
|
"mean_token_accuracy": 0.5900446474552155,
|
||
|
|
"num_tokens": 448687.0,
|
||
|
|
"step": 437
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7025128602981567,
|
||
|
|
"epoch": 0.5523329129886507,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 8.763604339827793e-06,
|
||
|
|
"loss": 1.6996,
|
||
|
|
"mean_token_accuracy": 0.5777526497840881,
|
||
|
|
"num_tokens": 449742.0,
|
||
|
|
"step": 438
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6411746144294739,
|
||
|
|
"epoch": 0.5535939470365699,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 8.72328493584534e-06,
|
||
|
|
"loss": 1.6065,
|
||
|
|
"mean_token_accuracy": 0.6120361089706421,
|
||
|
|
"num_tokens": 450816.0,
|
||
|
|
"step": 439
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5925988554954529,
|
||
|
|
"epoch": 0.5548549810844893,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 8.682986619802171e-06,
|
||
|
|
"loss": 1.553,
|
||
|
|
"mean_token_accuracy": 0.6123770475387573,
|
||
|
|
"num_tokens": 451812.0,
|
||
|
|
"step": 440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6425592303276062,
|
||
|
|
"epoch": 0.5561160151324086,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 8.642710057319352e-06,
|
||
|
|
"loss": 1.5604,
|
||
|
|
"mean_token_accuracy": 0.5966274738311768,
|
||
|
|
"num_tokens": 452908.0,
|
||
|
|
"step": 441
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6996275782585144,
|
||
|
|
"epoch": 0.5573770491803278,
|
||
|
|
"grad_norm": 10.625,
|
||
|
|
"learning_rate": 8.602455913658634e-06,
|
||
|
|
"loss": 1.7012,
|
||
|
|
"mean_token_accuracy": 0.5858384966850281,
|
||
|
|
"num_tokens": 453906.0,
|
||
|
|
"step": 442
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7025622725486755,
|
||
|
|
"epoch": 0.5586380832282472,
|
||
|
|
"grad_norm": 10.4375,
|
||
|
|
"learning_rate": 8.562224853711482e-06,
|
||
|
|
"loss": 1.727,
|
||
|
|
"mean_token_accuracy": 0.5890208780765533,
|
||
|
|
"num_tokens": 454936.0,
|
||
|
|
"step": 443
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6388814449310303,
|
||
|
|
"epoch": 0.5598991172761665,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 8.52201754198806e-06,
|
||
|
|
"loss": 1.5797,
|
||
|
|
"mean_token_accuracy": 0.6117729544639587,
|
||
|
|
"num_tokens": 455936.0,
|
||
|
|
"step": 444
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5603402853012085,
|
||
|
|
"epoch": 0.5611601513240857,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 8.481834642606287e-06,
|
||
|
|
"loss": 1.4888,
|
||
|
|
"mean_token_accuracy": 0.6284714043140411,
|
||
|
|
"num_tokens": 456990.0,
|
||
|
|
"step": 445
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.586718738079071,
|
||
|
|
"epoch": 0.562421185372005,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 8.441676819280857e-06,
|
||
|
|
"loss": 1.5006,
|
||
|
|
"mean_token_accuracy": 0.6253456175327301,
|
||
|
|
"num_tokens": 458063.0,
|
||
|
|
"step": 446
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7255162596702576,
|
||
|
|
"epoch": 0.5636822194199244,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 8.401544735312262e-06,
|
||
|
|
"loss": 1.725,
|
||
|
|
"mean_token_accuracy": 0.5891078412532806,
|
||
|
|
"num_tokens": 459120.0,
|
||
|
|
"step": 447
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.624710500240326,
|
||
|
|
"epoch": 0.5649432534678437,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 8.361439053575861e-06,
|
||
|
|
"loss": 1.5174,
|
||
|
|
"mean_token_accuracy": 0.6173111796379089,
|
||
|
|
"num_tokens": 460155.0,
|
||
|
|
"step": 448
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6829810738563538,
|
||
|
|
"epoch": 0.5662042875157629,
|
||
|
|
"grad_norm": 9.25,
|
||
|
|
"learning_rate": 8.321360436510916e-06,
|
||
|
|
"loss": 1.5149,
|
||
|
|
"mean_token_accuracy": 0.6153362393379211,
|
||
|
|
"num_tokens": 461286.0,
|
||
|
|
"step": 449
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.550669550895691,
|
||
|
|
"epoch": 0.5674653215636822,
|
||
|
|
"grad_norm": 9.1875,
|
||
|
|
"learning_rate": 8.281309546109649e-06,
|
||
|
|
"loss": 1.4603,
|
||
|
|
"mean_token_accuracy": 0.624053031206131,
|
||
|
|
"num_tokens": 462416.0,
|
||
|
|
"step": 450
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6433277130126953,
|
||
|
|
"epoch": 0.5687263556116016,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 8.241287043906305e-06,
|
||
|
|
"loss": 1.6117,
|
||
|
|
"mean_token_accuracy": 0.5916386544704437,
|
||
|
|
"num_tokens": 463465.0,
|
||
|
|
"step": 451
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5914654731750488,
|
||
|
|
"epoch": 0.5699873896595208,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 8.201293590966244e-06,
|
||
|
|
"loss": 1.6014,
|
||
|
|
"mean_token_accuracy": 0.5853811204433441,
|
||
|
|
"num_tokens": 464524.0,
|
||
|
|
"step": 452
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6217976212501526,
|
||
|
|
"epoch": 0.5712484237074401,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 8.161329847875002e-06,
|
||
|
|
"loss": 1.6488,
|
||
|
|
"mean_token_accuracy": 0.603933721780777,
|
||
|
|
"num_tokens": 465536.0,
|
||
|
|
"step": 453
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.668769657611847,
|
||
|
|
"epoch": 0.5725094577553594,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 8.12139647472739e-06,
|
||
|
|
"loss": 1.5431,
|
||
|
|
"mean_token_accuracy": 0.6194711029529572,
|
||
|
|
"num_tokens": 466533.0,
|
||
|
|
"step": 454
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6079354882240295,
|
||
|
|
"epoch": 0.5737704918032787,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 8.081494131116588e-06,
|
||
|
|
"loss": 1.4601,
|
||
|
|
"mean_token_accuracy": 0.6386167109012604,
|
||
|
|
"num_tokens": 467529.0,
|
||
|
|
"step": 455
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5854069590568542,
|
||
|
|
"epoch": 0.575031525851198,
|
||
|
|
"grad_norm": 9.125,
|
||
|
|
"learning_rate": 8.041623476123251e-06,
|
||
|
|
"loss": 1.47,
|
||
|
|
"mean_token_accuracy": 0.6398445665836334,
|
||
|
|
"num_tokens": 468630.0,
|
||
|
|
"step": 456
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5260156989097595,
|
||
|
|
"epoch": 0.5762925598991173,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 8.001785168304617e-06,
|
||
|
|
"loss": 1.5005,
|
||
|
|
"mean_token_accuracy": 0.6011378169059753,
|
||
|
|
"num_tokens": 469622.0,
|
||
|
|
"step": 457
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7076481580734253,
|
||
|
|
"epoch": 0.5775535939470365,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 7.961979865683642e-06,
|
||
|
|
"loss": 1.6202,
|
||
|
|
"mean_token_accuracy": 0.5933865904808044,
|
||
|
|
"num_tokens": 470758.0,
|
||
|
|
"step": 458
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6706077456474304,
|
||
|
|
"epoch": 0.5788146279949559,
|
||
|
|
"grad_norm": 10.9375,
|
||
|
|
"learning_rate": 7.922208225738118e-06,
|
||
|
|
"loss": 1.8221,
|
||
|
|
"mean_token_accuracy": 0.5651306211948395,
|
||
|
|
"num_tokens": 471795.0,
|
||
|
|
"step": 459
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5406734943389893,
|
||
|
|
"epoch": 0.5800756620428752,
|
||
|
|
"grad_norm": 9.4375,
|
||
|
|
"learning_rate": 7.882470905389827e-06,
|
||
|
|
"loss": 1.505,
|
||
|
|
"mean_token_accuracy": 0.6003578007221222,
|
||
|
|
"num_tokens": 472887.0,
|
||
|
|
"step": 460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6826407313346863,
|
||
|
|
"epoch": 0.5813366960907944,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 7.84276856099367e-06,
|
||
|
|
"loss": 1.6866,
|
||
|
|
"mean_token_accuracy": 0.6079537272453308,
|
||
|
|
"num_tokens": 473895.0,
|
||
|
|
"step": 461
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5261881947517395,
|
||
|
|
"epoch": 0.5825977301387137,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 7.803101848326852e-06,
|
||
|
|
"loss": 1.4308,
|
||
|
|
"mean_token_accuracy": 0.6252034902572632,
|
||
|
|
"num_tokens": 474989.0,
|
||
|
|
"step": 462
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.706149160861969,
|
||
|
|
"epoch": 0.5838587641866331,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 7.76347142257803e-06,
|
||
|
|
"loss": 1.6635,
|
||
|
|
"mean_token_accuracy": 0.5897457003593445,
|
||
|
|
"num_tokens": 476079.0,
|
||
|
|
"step": 463
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6335155367851257,
|
||
|
|
"epoch": 0.5851197982345523,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 7.72387793833649e-06,
|
||
|
|
"loss": 1.6028,
|
||
|
|
"mean_token_accuracy": 0.6074336171150208,
|
||
|
|
"num_tokens": 477152.0,
|
||
|
|
"step": 464
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6319258213043213,
|
||
|
|
"epoch": 0.5863808322824716,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 7.684322049581359e-06,
|
||
|
|
"loss": 1.6743,
|
||
|
|
"mean_token_accuracy": 0.6126231551170349,
|
||
|
|
"num_tokens": 478154.0,
|
||
|
|
"step": 465
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5984978675842285,
|
||
|
|
"epoch": 0.587641866330391,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 7.644804409670769e-06,
|
||
|
|
"loss": 1.5447,
|
||
|
|
"mean_token_accuracy": 0.6286633610725403,
|
||
|
|
"num_tokens": 479188.0,
|
||
|
|
"step": 466
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6517188549041748,
|
||
|
|
"epoch": 0.5889029003783102,
|
||
|
|
"grad_norm": 9.375,
|
||
|
|
"learning_rate": 7.605325671331099e-06,
|
||
|
|
"loss": 1.6067,
|
||
|
|
"mean_token_accuracy": 0.6035177111625671,
|
||
|
|
"num_tokens": 480331.0,
|
||
|
|
"step": 467
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5201899409294128,
|
||
|
|
"epoch": 0.5901639344262295,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 7.565886486646167e-06,
|
||
|
|
"loss": 1.5219,
|
||
|
|
"mean_token_accuracy": 0.6197526156902313,
|
||
|
|
"num_tokens": 481408.0,
|
||
|
|
"step": 468
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5284817814826965,
|
||
|
|
"epoch": 0.5914249684741488,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 7.526487507046474e-06,
|
||
|
|
"loss": 1.5018,
|
||
|
|
"mean_token_accuracy": 0.6163230836391449,
|
||
|
|
"num_tokens": 482388.0,
|
||
|
|
"step": 469
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5280031561851501,
|
||
|
|
"epoch": 0.592686002522068,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 7.487129383298433e-06,
|
||
|
|
"loss": 1.5325,
|
||
|
|
"mean_token_accuracy": 0.6047700941562653,
|
||
|
|
"num_tokens": 483495.0,
|
||
|
|
"step": 470
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.612665593624115,
|
||
|
|
"epoch": 0.5939470365699874,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 7.447812765493639e-06,
|
||
|
|
"loss": 1.4828,
|
||
|
|
"mean_token_accuracy": 0.6308728158473969,
|
||
|
|
"num_tokens": 484477.0,
|
||
|
|
"step": 471
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5260791182518005,
|
||
|
|
"epoch": 0.5952080706179067,
|
||
|
|
"grad_norm": 9.125,
|
||
|
|
"learning_rate": 7.408538303038106e-06,
|
||
|
|
"loss": 1.4307,
|
||
|
|
"mean_token_accuracy": 0.6266357898712158,
|
||
|
|
"num_tokens": 485548.0,
|
||
|
|
"step": 472
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6320922374725342,
|
||
|
|
"epoch": 0.5964691046658259,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 7.369306644641567e-06,
|
||
|
|
"loss": 1.5977,
|
||
|
|
"mean_token_accuracy": 0.6072716414928436,
|
||
|
|
"num_tokens": 486555.0,
|
||
|
|
"step": 473
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6279585361480713,
|
||
|
|
"epoch": 0.5977301387137453,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 7.330118438306732e-06,
|
||
|
|
"loss": 1.6607,
|
||
|
|
"mean_token_accuracy": 0.6020709276199341,
|
||
|
|
"num_tokens": 487590.0,
|
||
|
|
"step": 474
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5980820655822754,
|
||
|
|
"epoch": 0.5989911727616646,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 7.29097433131861e-06,
|
||
|
|
"loss": 1.4855,
|
||
|
|
"mean_token_accuracy": 0.6302129924297333,
|
||
|
|
"num_tokens": 488595.0,
|
||
|
|
"step": 475
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6216946840286255,
|
||
|
|
"epoch": 0.6002522068095839,
|
||
|
|
"grad_norm": 9.5,
|
||
|
|
"learning_rate": 7.251874970233805e-06,
|
||
|
|
"loss": 1.5476,
|
||
|
|
"mean_token_accuracy": 0.6265118420124054,
|
||
|
|
"num_tokens": 489646.0,
|
||
|
|
"step": 476
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5502440333366394,
|
||
|
|
"epoch": 0.6015132408575031,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 7.2128210008698255e-06,
|
||
|
|
"loss": 1.493,
|
||
|
|
"mean_token_accuracy": 0.6286751627922058,
|
||
|
|
"num_tokens": 490682.0,
|
||
|
|
"step": 477
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6056925058364868,
|
||
|
|
"epoch": 0.6027742749054225,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 7.173813068294441e-06,
|
||
|
|
"loss": 1.5198,
|
||
|
|
"mean_token_accuracy": 0.6203805506229401,
|
||
|
|
"num_tokens": 491625.0,
|
||
|
|
"step": 478
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6156052947044373,
|
||
|
|
"epoch": 0.6040353089533418,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 7.134851816815014e-06,
|
||
|
|
"loss": 1.5717,
|
||
|
|
"mean_token_accuracy": 0.6026512980461121,
|
||
|
|
"num_tokens": 492642.0,
|
||
|
|
"step": 479
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5961333513259888,
|
||
|
|
"epoch": 0.605296343001261,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 7.095937889967854e-06,
|
||
|
|
"loss": 1.4724,
|
||
|
|
"mean_token_accuracy": 0.6338109076023102,
|
||
|
|
"num_tokens": 493663.0,
|
||
|
|
"step": 480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5767071843147278,
|
||
|
|
"epoch": 0.6065573770491803,
|
||
|
|
"grad_norm": 10.625,
|
||
|
|
"learning_rate": 7.057071930507604e-06,
|
||
|
|
"loss": 1.5848,
|
||
|
|
"mean_token_accuracy": 0.600738912820816,
|
||
|
|
"num_tokens": 494628.0,
|
||
|
|
"step": 481
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6354678869247437,
|
||
|
|
"epoch": 0.6078184110970997,
|
||
|
|
"grad_norm": 10.4375,
|
||
|
|
"learning_rate": 7.018254580396603e-06,
|
||
|
|
"loss": 1.5456,
|
||
|
|
"mean_token_accuracy": 0.6068757176399231,
|
||
|
|
"num_tokens": 495615.0,
|
||
|
|
"step": 482
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6405519247055054,
|
||
|
|
"epoch": 0.6090794451450189,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 6.9794864807942915e-06,
|
||
|
|
"loss": 1.6047,
|
||
|
|
"mean_token_accuracy": 0.6079174876213074,
|
||
|
|
"num_tokens": 496638.0,
|
||
|
|
"step": 483
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.551555097103119,
|
||
|
|
"epoch": 0.6103404791929382,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 6.940768272046633e-06,
|
||
|
|
"loss": 1.5588,
|
||
|
|
"mean_token_accuracy": 0.6117194890975952,
|
||
|
|
"num_tokens": 497707.0,
|
||
|
|
"step": 484
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.4852462410926819,
|
||
|
|
"epoch": 0.6116015132408575,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 6.90210059367552e-06,
|
||
|
|
"loss": 1.432,
|
||
|
|
"mean_token_accuracy": 0.609993040561676,
|
||
|
|
"num_tokens": 498830.0,
|
||
|
|
"step": 485
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6268917322158813,
|
||
|
|
"epoch": 0.6128625472887768,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 6.863484084368217e-06,
|
||
|
|
"loss": 1.641,
|
||
|
|
"mean_token_accuracy": 0.6106929779052734,
|
||
|
|
"num_tokens": 499805.0,
|
||
|
|
"step": 486
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5206935405731201,
|
||
|
|
"epoch": 0.6141235813366961,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 6.8249193819668165e-06,
|
||
|
|
"loss": 1.499,
|
||
|
|
"mean_token_accuracy": 0.631983757019043,
|
||
|
|
"num_tokens": 500760.0,
|
||
|
|
"step": 487
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6439514756202698,
|
||
|
|
"epoch": 0.6153846153846154,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 6.78640712345769e-06,
|
||
|
|
"loss": 1.6252,
|
||
|
|
"mean_token_accuracy": 0.5874379575252533,
|
||
|
|
"num_tokens": 501784.0,
|
||
|
|
"step": 488
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6015563607215881,
|
||
|
|
"epoch": 0.6166456494325346,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 6.7479479449609865e-06,
|
||
|
|
"loss": 1.5631,
|
||
|
|
"mean_token_accuracy": 0.6084559857845306,
|
||
|
|
"num_tokens": 502827.0,
|
||
|
|
"step": 489
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.755643367767334,
|
||
|
|
"epoch": 0.617906683480454,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 6.7095424817201035e-06,
|
||
|
|
"loss": 1.7159,
|
||
|
|
"mean_token_accuracy": 0.5740377902984619,
|
||
|
|
"num_tokens": 504001.0,
|
||
|
|
"step": 490
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5435524582862854,
|
||
|
|
"epoch": 0.6191677175283733,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 6.6711913680912074e-06,
|
||
|
|
"loss": 1.4508,
|
||
|
|
"mean_token_accuracy": 0.6418914198875427,
|
||
|
|
"num_tokens": 504977.0,
|
||
|
|
"step": 491
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5436031222343445,
|
||
|
|
"epoch": 0.6204287515762925,
|
||
|
|
"grad_norm": 9.25,
|
||
|
|
"learning_rate": 6.632895237532762e-06,
|
||
|
|
"loss": 1.4886,
|
||
|
|
"mean_token_accuracy": 0.6226003170013428,
|
||
|
|
"num_tokens": 506013.0,
|
||
|
|
"step": 492
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.552047848701477,
|
||
|
|
"epoch": 0.6216897856242118,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 6.59465472259505e-06,
|
||
|
|
"loss": 1.5416,
|
||
|
|
"mean_token_accuracy": 0.6107116043567657,
|
||
|
|
"num_tokens": 507052.0,
|
||
|
|
"step": 493
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6853481531143188,
|
||
|
|
"epoch": 0.6229508196721312,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 6.55647045490973e-06,
|
||
|
|
"loss": 1.7292,
|
||
|
|
"mean_token_accuracy": 0.5904629826545715,
|
||
|
|
"num_tokens": 508055.0,
|
||
|
|
"step": 494
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.569117784500122,
|
||
|
|
"epoch": 0.6242118537200504,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 6.518343065179414e-06,
|
||
|
|
"loss": 1.5271,
|
||
|
|
"mean_token_accuracy": 0.5990890860557556,
|
||
|
|
"num_tokens": 509077.0,
|
||
|
|
"step": 495
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.667130947113037,
|
||
|
|
"epoch": 0.6254728877679697,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 6.480273183167229e-06,
|
||
|
|
"loss": 1.7343,
|
||
|
|
"mean_token_accuracy": 0.5864747166633606,
|
||
|
|
"num_tokens": 510099.0,
|
||
|
|
"step": 496
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.622936487197876,
|
||
|
|
"epoch": 0.626733921815889,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 6.442261437686437e-06,
|
||
|
|
"loss": 1.592,
|
||
|
|
"mean_token_accuracy": 0.5998493134975433,
|
||
|
|
"num_tokens": 511064.0,
|
||
|
|
"step": 497
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6585890650749207,
|
||
|
|
"epoch": 0.6279949558638083,
|
||
|
|
"grad_norm": 9.5,
|
||
|
|
"learning_rate": 6.404308456590036e-06,
|
||
|
|
"loss": 1.5832,
|
||
|
|
"mean_token_accuracy": 0.5902130901813507,
|
||
|
|
"num_tokens": 512167.0,
|
||
|
|
"step": 498
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5793468356132507,
|
||
|
|
"epoch": 0.6292559899117276,
|
||
|
|
"grad_norm": 10.8125,
|
||
|
|
"learning_rate": 6.366414866760391e-06,
|
||
|
|
"loss": 1.5788,
|
||
|
|
"mean_token_accuracy": 0.613257646560669,
|
||
|
|
"num_tokens": 513101.0,
|
||
|
|
"step": 499
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6209663152694702,
|
||
|
|
"epoch": 0.6305170239596469,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 6.328581294098887e-06,
|
||
|
|
"loss": 1.7012,
|
||
|
|
"mean_token_accuracy": 0.5858111381530762,
|
||
|
|
"num_tokens": 514227.0,
|
||
|
|
"step": 500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"epoch": 0.6305170239596469,
|
||
|
|
"eval_entropy": 1.6149417110111401,
|
||
|
|
"eval_loss": 1.577573299407959,
|
||
|
|
"eval_mean_token_accuracy": 0.6092382099317468,
|
||
|
|
"eval_num_tokens": 514227.0,
|
||
|
|
"eval_runtime": 1.376,
|
||
|
|
"eval_samples_per_second": 512.338,
|
||
|
|
"eval_steps_per_second": 16.715,
|
||
|
|
"step": 500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6170178651809692,
|
||
|
|
"epoch": 0.6317780580075663,
|
||
|
|
"grad_norm": 9.3125,
|
||
|
|
"learning_rate": 6.2908083635155796e-06,
|
||
|
|
"loss": 1.5835,
|
||
|
|
"mean_token_accuracy": 0.6066112816333771,
|
||
|
|
"num_tokens": 515290.0,
|
||
|
|
"step": 501
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6176294684410095,
|
||
|
|
"epoch": 0.6330390920554855,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 6.253096698918873e-06,
|
||
|
|
"loss": 1.5715,
|
||
|
|
"mean_token_accuracy": 0.6069029867649078,
|
||
|
|
"num_tokens": 516354.0,
|
||
|
|
"step": 502
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.543895184993744,
|
||
|
|
"epoch": 0.6343001261034048,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 6.215446923205233e-06,
|
||
|
|
"loss": 1.5092,
|
||
|
|
"mean_token_accuracy": 0.6218460500240326,
|
||
|
|
"num_tokens": 517310.0,
|
||
|
|
"step": 503
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.602727234363556,
|
||
|
|
"epoch": 0.6355611601513241,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 6.17785965824888e-06,
|
||
|
|
"loss": 1.483,
|
||
|
|
"mean_token_accuracy": 0.6216234862804413,
|
||
|
|
"num_tokens": 518349.0,
|
||
|
|
"step": 504
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6165817379951477,
|
||
|
|
"epoch": 0.6368221941992434,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 6.140335524891518e-06,
|
||
|
|
"loss": 1.5962,
|
||
|
|
"mean_token_accuracy": 0.6051628887653351,
|
||
|
|
"num_tokens": 519393.0,
|
||
|
|
"step": 505
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6006481647491455,
|
||
|
|
"epoch": 0.6380832282471627,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 6.102875142932094e-06,
|
||
|
|
"loss": 1.5795,
|
||
|
|
"mean_token_accuracy": 0.6124628782272339,
|
||
|
|
"num_tokens": 520421.0,
|
||
|
|
"step": 506
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6821855306625366,
|
||
|
|
"epoch": 0.639344262295082,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 6.06547913111654e-06,
|
||
|
|
"loss": 1.6944,
|
||
|
|
"mean_token_accuracy": 0.5923645794391632,
|
||
|
|
"num_tokens": 521439.0,
|
||
|
|
"step": 507
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6875842213630676,
|
||
|
|
"epoch": 0.6406052963430012,
|
||
|
|
"grad_norm": 10.6875,
|
||
|
|
"learning_rate": 6.02814810712758e-06,
|
||
|
|
"loss": 1.7024,
|
||
|
|
"mean_token_accuracy": 0.5728240013122559,
|
||
|
|
"num_tokens": 522360.0,
|
||
|
|
"step": 508
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6741116046905518,
|
||
|
|
"epoch": 0.6418663303909206,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 5.9908826875744926e-06,
|
||
|
|
"loss": 1.6793,
|
||
|
|
"mean_token_accuracy": 0.5976190567016602,
|
||
|
|
"num_tokens": 523383.0,
|
||
|
|
"step": 509
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5459855198860168,
|
||
|
|
"epoch": 0.6431273644388399,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 5.953683487982958e-06,
|
||
|
|
"loss": 1.4656,
|
||
|
|
"mean_token_accuracy": 0.630466103553772,
|
||
|
|
"num_tokens": 524375.0,
|
||
|
|
"step": 510
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6653950810432434,
|
||
|
|
"epoch": 0.6443883984867591,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 5.916551122784877e-06,
|
||
|
|
"loss": 1.6078,
|
||
|
|
"mean_token_accuracy": 0.6030786037445068,
|
||
|
|
"num_tokens": 525476.0,
|
||
|
|
"step": 511
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.621675431728363,
|
||
|
|
"epoch": 0.6456494325346784,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 5.879486205308226e-06,
|
||
|
|
"loss": 1.5923,
|
||
|
|
"mean_token_accuracy": 0.6058108806610107,
|
||
|
|
"num_tokens": 526492.0,
|
||
|
|
"step": 512
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.626869261264801,
|
||
|
|
"epoch": 0.6469104665825978,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 5.8424893477669155e-06,
|
||
|
|
"loss": 1.6056,
|
||
|
|
"mean_token_accuracy": 0.6166197955608368,
|
||
|
|
"num_tokens": 527487.0,
|
||
|
|
"step": 513
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5789138078689575,
|
||
|
|
"epoch": 0.648171500630517,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 5.805561161250701e-06,
|
||
|
|
"loss": 1.5781,
|
||
|
|
"mean_token_accuracy": 0.6022210121154785,
|
||
|
|
"num_tokens": 528537.0,
|
||
|
|
"step": 514
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.575596272945404,
|
||
|
|
"epoch": 0.6494325346784363,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 5.768702255715053e-06,
|
||
|
|
"loss": 1.5509,
|
||
|
|
"mean_token_accuracy": 0.6026001572608948,
|
||
|
|
"num_tokens": 529593.0,
|
||
|
|
"step": 515
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5443761348724365,
|
||
|
|
"epoch": 0.6506935687263556,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 5.7319132399711305e-06,
|
||
|
|
"loss": 1.4789,
|
||
|
|
"mean_token_accuracy": 0.6289182305335999,
|
||
|
|
"num_tokens": 530571.0,
|
||
|
|
"step": 516
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7085075974464417,
|
||
|
|
"epoch": 0.6519546027742749,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 5.695194721675681e-06,
|
||
|
|
"loss": 1.802,
|
||
|
|
"mean_token_accuracy": 0.5795166194438934,
|
||
|
|
"num_tokens": 531599.0,
|
||
|
|
"step": 517
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6720210313796997,
|
||
|
|
"epoch": 0.6532156368221942,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 5.65854730732103e-06,
|
||
|
|
"loss": 1.605,
|
||
|
|
"mean_token_accuracy": 0.6185270547866821,
|
||
|
|
"num_tokens": 532638.0,
|
||
|
|
"step": 518
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.71172297000885,
|
||
|
|
"epoch": 0.6544766708701135,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 5.621971602225043e-06,
|
||
|
|
"loss": 1.6316,
|
||
|
|
"mean_token_accuracy": 0.5973513722419739,
|
||
|
|
"num_tokens": 533704.0,
|
||
|
|
"step": 519
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6067556738853455,
|
||
|
|
"epoch": 0.6557377049180327,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 5.58546821052116e-06,
|
||
|
|
"loss": 1.5113,
|
||
|
|
"mean_token_accuracy": 0.6178349554538727,
|
||
|
|
"num_tokens": 534825.0,
|
||
|
|
"step": 520
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.632061243057251,
|
||
|
|
"epoch": 0.6569987389659521,
|
||
|
|
"grad_norm": 9.0625,
|
||
|
|
"learning_rate": 5.549037735148378e-06,
|
||
|
|
"loss": 1.549,
|
||
|
|
"mean_token_accuracy": 0.6097483932971954,
|
||
|
|
"num_tokens": 535971.0,
|
||
|
|
"step": 521
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5403864979743958,
|
||
|
|
"epoch": 0.6582597730138714,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 5.512680777841317e-06,
|
||
|
|
"loss": 1.4596,
|
||
|
|
"mean_token_accuracy": 0.6230754852294922,
|
||
|
|
"num_tokens": 537024.0,
|
||
|
|
"step": 522
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7151065468788147,
|
||
|
|
"epoch": 0.6595208070617906,
|
||
|
|
"grad_norm": 10.75,
|
||
|
|
"learning_rate": 5.476397939120273e-06,
|
||
|
|
"loss": 1.7112,
|
||
|
|
"mean_token_accuracy": 0.5967777669429779,
|
||
|
|
"num_tokens": 537982.0,
|
||
|
|
"step": 523
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5553420186042786,
|
||
|
|
"epoch": 0.6607818411097099,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 5.4401898182813e-06,
|
||
|
|
"loss": 1.5453,
|
||
|
|
"mean_token_accuracy": 0.6104519665241241,
|
||
|
|
"num_tokens": 539031.0,
|
||
|
|
"step": 524
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5802620649337769,
|
||
|
|
"epoch": 0.6620428751576293,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 5.404057013386306e-06,
|
||
|
|
"loss": 1.5294,
|
||
|
|
"mean_token_accuracy": 0.6248644292354584,
|
||
|
|
"num_tokens": 540036.0,
|
||
|
|
"step": 525
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.720866084098816,
|
||
|
|
"epoch": 0.6633039092055486,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 5.368000121253194e-06,
|
||
|
|
"loss": 1.6522,
|
||
|
|
"mean_token_accuracy": 0.5892738103866577,
|
||
|
|
"num_tokens": 541031.0,
|
||
|
|
"step": 526
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6795371174812317,
|
||
|
|
"epoch": 0.6645649432534678,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 5.3320197374459805e-06,
|
||
|
|
"loss": 1.5991,
|
||
|
|
"mean_token_accuracy": 0.6063407361507416,
|
||
|
|
"num_tokens": 541991.0,
|
||
|
|
"step": 527
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6276273131370544,
|
||
|
|
"epoch": 0.6658259773013872,
|
||
|
|
"grad_norm": 9.5,
|
||
|
|
"learning_rate": 5.2961164562649565e-06,
|
||
|
|
"loss": 1.5845,
|
||
|
|
"mean_token_accuracy": 0.596104234457016,
|
||
|
|
"num_tokens": 543076.0,
|
||
|
|
"step": 528
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5935015678405762,
|
||
|
|
"epoch": 0.6670870113493065,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 5.260290870736906e-06,
|
||
|
|
"loss": 1.5814,
|
||
|
|
"mean_token_accuracy": 0.597423642873764,
|
||
|
|
"num_tokens": 544122.0,
|
||
|
|
"step": 529
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5235545635223389,
|
||
|
|
"epoch": 0.6683480453972257,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 5.224543572605272e-06,
|
||
|
|
"loss": 1.3863,
|
||
|
|
"mean_token_accuracy": 0.6439205408096313,
|
||
|
|
"num_tokens": 545240.0,
|
||
|
|
"step": 530
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.544245183467865,
|
||
|
|
"epoch": 0.669609079445145,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 5.188875152320397e-06,
|
||
|
|
"loss": 1.5034,
|
||
|
|
"mean_token_accuracy": 0.6148544549942017,
|
||
|
|
"num_tokens": 546198.0,
|
||
|
|
"step": 531
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6482225060462952,
|
||
|
|
"epoch": 0.6708701134930644,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 5.153286199029783e-06,
|
||
|
|
"loss": 1.6033,
|
||
|
|
"mean_token_accuracy": 0.5933025479316711,
|
||
|
|
"num_tokens": 547174.0,
|
||
|
|
"step": 532
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5747894048690796,
|
||
|
|
"epoch": 0.6721311475409836,
|
||
|
|
"grad_norm": 9.4375,
|
||
|
|
"learning_rate": 5.1177773005683385e-06,
|
||
|
|
"loss": 1.5494,
|
||
|
|
"mean_token_accuracy": 0.6112948060035706,
|
||
|
|
"num_tokens": 548172.0,
|
||
|
|
"step": 533
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5982520580291748,
|
||
|
|
"epoch": 0.6733921815889029,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 5.082349043448682e-06,
|
||
|
|
"loss": 1.5766,
|
||
|
|
"mean_token_accuracy": 0.6066358089447021,
|
||
|
|
"num_tokens": 549212.0,
|
||
|
|
"step": 534
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6177298426628113,
|
||
|
|
"epoch": 0.6746532156368222,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 5.047002012851447e-06,
|
||
|
|
"loss": 1.5554,
|
||
|
|
"mean_token_accuracy": 0.6127637922763824,
|
||
|
|
"num_tokens": 550274.0,
|
||
|
|
"step": 535
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.702902376651764,
|
||
|
|
"epoch": 0.6759142496847415,
|
||
|
|
"grad_norm": 10.6875,
|
||
|
|
"learning_rate": 5.011736792615629e-06,
|
||
|
|
"loss": 1.7977,
|
||
|
|
"mean_token_accuracy": 0.5673922896385193,
|
||
|
|
"num_tokens": 551248.0,
|
||
|
|
"step": 536
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5914519429206848,
|
||
|
|
"epoch": 0.6771752837326608,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 4.976553965228924e-06,
|
||
|
|
"loss": 1.4721,
|
||
|
|
"mean_token_accuracy": 0.6292415857315063,
|
||
|
|
"num_tokens": 552278.0,
|
||
|
|
"step": 537
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5168818235397339,
|
||
|
|
"epoch": 0.6784363177805801,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 4.941454111818131e-06,
|
||
|
|
"loss": 1.508,
|
||
|
|
"mean_token_accuracy": 0.6399495005607605,
|
||
|
|
"num_tokens": 553237.0,
|
||
|
|
"step": 538
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6197444200515747,
|
||
|
|
"epoch": 0.6796973518284993,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 4.9064378121395255e-06,
|
||
|
|
"loss": 1.5109,
|
||
|
|
"mean_token_accuracy": 0.605815589427948,
|
||
|
|
"num_tokens": 554185.0,
|
||
|
|
"step": 539
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6010251641273499,
|
||
|
|
"epoch": 0.6809583858764187,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 4.871505644569303e-06,
|
||
|
|
"loss": 1.6077,
|
||
|
|
"mean_token_accuracy": 0.5981161296367645,
|
||
|
|
"num_tokens": 555143.0,
|
||
|
|
"step": 540
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.637997329235077,
|
||
|
|
"epoch": 0.682219419924338,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 4.8366581860940236e-06,
|
||
|
|
"loss": 1.6099,
|
||
|
|
"mean_token_accuracy": 0.5952269434928894,
|
||
|
|
"num_tokens": 556171.0,
|
||
|
|
"step": 541
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5722075700759888,
|
||
|
|
"epoch": 0.6834804539722572,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 4.80189601230107e-06,
|
||
|
|
"loss": 1.6759,
|
||
|
|
"mean_token_accuracy": 0.5987652540206909,
|
||
|
|
"num_tokens": 557125.0,
|
||
|
|
"step": 542
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5625829100608826,
|
||
|
|
"epoch": 0.6847414880201765,
|
||
|
|
"grad_norm": 9.375,
|
||
|
|
"learning_rate": 4.767219697369158e-06,
|
||
|
|
"loss": 1.4107,
|
||
|
|
"mean_token_accuracy": 0.6275063455104828,
|
||
|
|
"num_tokens": 558212.0,
|
||
|
|
"step": 543
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6600249409675598,
|
||
|
|
"epoch": 0.6860025220680959,
|
||
|
|
"grad_norm": 9.4375,
|
||
|
|
"learning_rate": 4.7326298140588325e-06,
|
||
|
|
"loss": 1.5607,
|
||
|
|
"mean_token_accuracy": 0.6005679666996002,
|
||
|
|
"num_tokens": 559319.0,
|
||
|
|
"step": 544
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6357145309448242,
|
||
|
|
"epoch": 0.6872635561160151,
|
||
|
|
"grad_norm": 9.25,
|
||
|
|
"learning_rate": 4.698126933703031e-06,
|
||
|
|
"loss": 1.5735,
|
||
|
|
"mean_token_accuracy": 0.6180987358093262,
|
||
|
|
"num_tokens": 560384.0,
|
||
|
|
"step": 545
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6350824236869812,
|
||
|
|
"epoch": 0.6885245901639344,
|
||
|
|
"grad_norm": 10.9375,
|
||
|
|
"learning_rate": 4.663711626197626e-06,
|
||
|
|
"loss": 1.675,
|
||
|
|
"mean_token_accuracy": 0.5842885673046112,
|
||
|
|
"num_tokens": 561443.0,
|
||
|
|
"step": 546
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.600015938282013,
|
||
|
|
"epoch": 0.6897856242118537,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 4.629384459992016e-06,
|
||
|
|
"loss": 1.6724,
|
||
|
|
"mean_token_accuracy": 0.5942023992538452,
|
||
|
|
"num_tokens": 562452.0,
|
||
|
|
"step": 547
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6264303922653198,
|
||
|
|
"epoch": 0.691046658259773,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 4.595146002079746e-06,
|
||
|
|
"loss": 1.6089,
|
||
|
|
"mean_token_accuracy": 0.6137306094169617,
|
||
|
|
"num_tokens": 563401.0,
|
||
|
|
"step": 548
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7280575037002563,
|
||
|
|
"epoch": 0.6923076923076923,
|
||
|
|
"grad_norm": 10.75,
|
||
|
|
"learning_rate": 4.560996817989131e-06,
|
||
|
|
"loss": 1.7236,
|
||
|
|
"mean_token_accuracy": 0.5739762783050537,
|
||
|
|
"num_tokens": 564402.0,
|
||
|
|
"step": 549
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.723551869392395,
|
||
|
|
"epoch": 0.6935687263556116,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 4.526937471773919e-06,
|
||
|
|
"loss": 1.6549,
|
||
|
|
"mean_token_accuracy": 0.5932482182979584,
|
||
|
|
"num_tokens": 565428.0,
|
||
|
|
"step": 550
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.556459128856659,
|
||
|
|
"epoch": 0.694829760403531,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 4.4929685260039865e-06,
|
||
|
|
"loss": 1.5655,
|
||
|
|
"mean_token_accuracy": 0.6099835932254791,
|
||
|
|
"num_tokens": 566536.0,
|
||
|
|
"step": 551
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.641317903995514,
|
||
|
|
"epoch": 0.6960907944514502,
|
||
|
|
"grad_norm": 10.625,
|
||
|
|
"learning_rate": 4.459090541756021e-06,
|
||
|
|
"loss": 1.6463,
|
||
|
|
"mean_token_accuracy": 0.594705730676651,
|
||
|
|
"num_tokens": 567640.0,
|
||
|
|
"step": 552
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.597370684146881,
|
||
|
|
"epoch": 0.6973518284993695,
|
||
|
|
"grad_norm": 11.25,
|
||
|
|
"learning_rate": 4.425304078604274e-06,
|
||
|
|
"loss": 1.6491,
|
||
|
|
"mean_token_accuracy": 0.5952914357185364,
|
||
|
|
"num_tokens": 568574.0,
|
||
|
|
"step": 553
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.667187511920929,
|
||
|
|
"epoch": 0.6986128625472888,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 4.391609694611308e-06,
|
||
|
|
"loss": 1.7062,
|
||
|
|
"mean_token_accuracy": 0.595498651266098,
|
||
|
|
"num_tokens": 569576.0,
|
||
|
|
"step": 554
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6634328365325928,
|
||
|
|
"epoch": 0.699873896595208,
|
||
|
|
"grad_norm": 11.875,
|
||
|
|
"learning_rate": 4.35800794631879e-06,
|
||
|
|
"loss": 1.7539,
|
||
|
|
"mean_token_accuracy": 0.5765984356403351,
|
||
|
|
"num_tokens": 570584.0,
|
||
|
|
"step": 555
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5773706436157227,
|
||
|
|
"epoch": 0.7011349306431274,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 4.324499388738278e-06,
|
||
|
|
"loss": 1.5466,
|
||
|
|
"mean_token_accuracy": 0.6053547561168671,
|
||
|
|
"num_tokens": 571585.0,
|
||
|
|
"step": 556
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.538045346736908,
|
||
|
|
"epoch": 0.7023959646910467,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 4.291084575342085e-06,
|
||
|
|
"loss": 1.5576,
|
||
|
|
"mean_token_accuracy": 0.6018131077289581,
|
||
|
|
"num_tokens": 572577.0,
|
||
|
|
"step": 557
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6479364037513733,
|
||
|
|
"epoch": 0.7036569987389659,
|
||
|
|
"grad_norm": 10.625,
|
||
|
|
"learning_rate": 4.257764058054107e-06,
|
||
|
|
"loss": 1.6424,
|
||
|
|
"mean_token_accuracy": 0.5747182071208954,
|
||
|
|
"num_tokens": 573524.0,
|
||
|
|
"step": 558
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6129924654960632,
|
||
|
|
"epoch": 0.7049180327868853,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 4.2245383872407195e-06,
|
||
|
|
"loss": 1.5762,
|
||
|
|
"mean_token_accuracy": 0.600447416305542,
|
||
|
|
"num_tokens": 574546.0,
|
||
|
|
"step": 559
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.523453950881958,
|
||
|
|
"epoch": 0.7061790668348046,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 4.191408111701693e-06,
|
||
|
|
"loss": 1.5456,
|
||
|
|
"mean_token_accuracy": 0.6228825449943542,
|
||
|
|
"num_tokens": 575568.0,
|
||
|
|
"step": 560
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6055732369422913,
|
||
|
|
"epoch": 0.7074401008827238,
|
||
|
|
"grad_norm": 11.3125,
|
||
|
|
"learning_rate": 4.158373778661112e-06,
|
||
|
|
"loss": 1.6417,
|
||
|
|
"mean_token_accuracy": 0.6085829436779022,
|
||
|
|
"num_tokens": 576426.0,
|
||
|
|
"step": 561
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.667851984500885,
|
||
|
|
"epoch": 0.7087011349306431,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 4.125435933758356e-06,
|
||
|
|
"loss": 1.6283,
|
||
|
|
"mean_token_accuracy": 0.5937761068344116,
|
||
|
|
"num_tokens": 577479.0,
|
||
|
|
"step": 562
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6255273222923279,
|
||
|
|
"epoch": 0.7099621689785625,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 4.092595121039066e-06,
|
||
|
|
"loss": 1.594,
|
||
|
|
"mean_token_accuracy": 0.6089232861995697,
|
||
|
|
"num_tokens": 578535.0,
|
||
|
|
"step": 563
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.4689056873321533,
|
||
|
|
"epoch": 0.7112232030264817,
|
||
|
|
"grad_norm": 9.25,
|
||
|
|
"learning_rate": 4.059851882946183e-06,
|
||
|
|
"loss": 1.3934,
|
||
|
|
"mean_token_accuracy": 0.6476598381996155,
|
||
|
|
"num_tokens": 579635.0,
|
||
|
|
"step": 564
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6343716979026794,
|
||
|
|
"epoch": 0.712484237074401,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 4.0272067603109646e-06,
|
||
|
|
"loss": 1.6306,
|
||
|
|
"mean_token_accuracy": 0.5995541512966156,
|
||
|
|
"num_tokens": 580634.0,
|
||
|
|
"step": 565
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.717770755290985,
|
||
|
|
"epoch": 0.7137452711223203,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 3.994660292344063e-06,
|
||
|
|
"loss": 1.7253,
|
||
|
|
"mean_token_accuracy": 0.5993589758872986,
|
||
|
|
"num_tokens": 581602.0,
|
||
|
|
"step": 566
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.602467954158783,
|
||
|
|
"epoch": 0.7150063051702396,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 3.9622130166266195e-06,
|
||
|
|
"loss": 1.5721,
|
||
|
|
"mean_token_accuracy": 0.6099851429462433,
|
||
|
|
"num_tokens": 582627.0,
|
||
|
|
"step": 567
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.4821465015411377,
|
||
|
|
"epoch": 0.7162673392181589,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 3.929865469101382e-06,
|
||
|
|
"loss": 1.4655,
|
||
|
|
"mean_token_accuracy": 0.6258285343647003,
|
||
|
|
"num_tokens": 583627.0,
|
||
|
|
"step": 568
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6704352498054504,
|
||
|
|
"epoch": 0.7175283732660782,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 3.897618184063849e-06,
|
||
|
|
"loss": 1.6314,
|
||
|
|
"mean_token_accuracy": 0.6009359657764435,
|
||
|
|
"num_tokens": 584698.0,
|
||
|
|
"step": 569
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6103723645210266,
|
||
|
|
"epoch": 0.7187894073139974,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 3.865471694153465e-06,
|
||
|
|
"loss": 1.5382,
|
||
|
|
"mean_token_accuracy": 0.6234713792800903,
|
||
|
|
"num_tokens": 585851.0,
|
||
|
|
"step": 570
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5848249197006226,
|
||
|
|
"epoch": 0.7200504413619168,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 3.833426530344791e-06,
|
||
|
|
"loss": 1.4874,
|
||
|
|
"mean_token_accuracy": 0.6228490173816681,
|
||
|
|
"num_tokens": 586896.0,
|
||
|
|
"step": 571
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6644932627677917,
|
||
|
|
"epoch": 0.7213114754098361,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 3.8014832219387543e-06,
|
||
|
|
"loss": 1.6651,
|
||
|
|
"mean_token_accuracy": 0.5959296822547913,
|
||
|
|
"num_tokens": 587996.0,
|
||
|
|
"step": 572
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6258652210235596,
|
||
|
|
"epoch": 0.7225725094577553,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 3.7696422965539036e-06,
|
||
|
|
"loss": 1.5553,
|
||
|
|
"mean_token_accuracy": 0.6083872020244598,
|
||
|
|
"num_tokens": 589005.0,
|
||
|
|
"step": 573
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6314430236816406,
|
||
|
|
"epoch": 0.7238335435056746,
|
||
|
|
"grad_norm": 9.5,
|
||
|
|
"learning_rate": 3.7379042801176924e-06,
|
||
|
|
"loss": 1.5588,
|
||
|
|
"mean_token_accuracy": 0.6224546134471893,
|
||
|
|
"num_tokens": 590044.0,
|
||
|
|
"step": 574
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6420432925224304,
|
||
|
|
"epoch": 0.725094577553594,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 3.706269696857785e-06,
|
||
|
|
"loss": 1.505,
|
||
|
|
"mean_token_accuracy": 0.6281996965408325,
|
||
|
|
"num_tokens": 590975.0,
|
||
|
|
"step": 575
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6172633171081543,
|
||
|
|
"epoch": 0.7263556116015133,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 3.6747390692934206e-06,
|
||
|
|
"loss": 1.7499,
|
||
|
|
"mean_token_accuracy": 0.5967600345611572,
|
||
|
|
"num_tokens": 591984.0,
|
||
|
|
"step": 576
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.586757779121399,
|
||
|
|
"epoch": 0.7276166456494325,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 3.643312918226749e-06,
|
||
|
|
"loss": 1.5316,
|
||
|
|
"mean_token_accuracy": 0.6224758625030518,
|
||
|
|
"num_tokens": 593046.0,
|
||
|
|
"step": 577
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7036398649215698,
|
||
|
|
"epoch": 0.7288776796973518,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 3.611991762734257e-06,
|
||
|
|
"loss": 1.7105,
|
||
|
|
"mean_token_accuracy": 0.5792748928070068,
|
||
|
|
"num_tokens": 594171.0,
|
||
|
|
"step": 578
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5310705304145813,
|
||
|
|
"epoch": 0.7301387137452712,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 3.580776120158178e-06,
|
||
|
|
"loss": 1.4541,
|
||
|
|
"mean_token_accuracy": 0.6382882595062256,
|
||
|
|
"num_tokens": 595235.0,
|
||
|
|
"step": 579
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6077587008476257,
|
||
|
|
"epoch": 0.7313997477931904,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 3.5496665060979563e-06,
|
||
|
|
"loss": 1.5431,
|
||
|
|
"mean_token_accuracy": 0.622633695602417,
|
||
|
|
"num_tokens": 596309.0,
|
||
|
|
"step": 580
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5529122948646545,
|
||
|
|
"epoch": 0.7326607818411097,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 3.51866343440172e-06,
|
||
|
|
"loss": 1.4659,
|
||
|
|
"mean_token_accuracy": 0.6347672045230865,
|
||
|
|
"num_tokens": 597289.0,
|
||
|
|
"step": 581
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6188974380493164,
|
||
|
|
"epoch": 0.733921815889029,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 3.4877674171578126e-06,
|
||
|
|
"loss": 1.7179,
|
||
|
|
"mean_token_accuracy": 0.5924161672592163,
|
||
|
|
"num_tokens": 598266.0,
|
||
|
|
"step": 582
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7165232300758362,
|
||
|
|
"epoch": 0.7351828499369483,
|
||
|
|
"grad_norm": 10.6875,
|
||
|
|
"learning_rate": 3.456978964686314e-06,
|
||
|
|
"loss": 1.6381,
|
||
|
|
"mean_token_accuracy": 0.6067573130130768,
|
||
|
|
"num_tokens": 599249.0,
|
||
|
|
"step": 583
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5602036714553833,
|
||
|
|
"epoch": 0.7364438839848676,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 3.4262985855306195e-06,
|
||
|
|
"loss": 1.5073,
|
||
|
|
"mean_token_accuracy": 0.6204895377159119,
|
||
|
|
"num_tokens": 600288.0,
|
||
|
|
"step": 584
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.601797878742218,
|
||
|
|
"epoch": 0.7377049180327869,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 3.395726786449044e-06,
|
||
|
|
"loss": 1.5546,
|
||
|
|
"mean_token_accuracy": 0.6125863194465637,
|
||
|
|
"num_tokens": 601315.0,
|
||
|
|
"step": 585
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6076158285140991,
|
||
|
|
"epoch": 0.7389659520807061,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 3.3652640724064465e-06,
|
||
|
|
"loss": 1.5737,
|
||
|
|
"mean_token_accuracy": 0.6054862439632416,
|
||
|
|
"num_tokens": 602341.0,
|
||
|
|
"step": 586
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5928532481193542,
|
||
|
|
"epoch": 0.7402269861286255,
|
||
|
|
"grad_norm": 10.875,
|
||
|
|
"learning_rate": 3.3349109465658914e-06,
|
||
|
|
"loss": 1.6053,
|
||
|
|
"mean_token_accuracy": 0.6129770278930664,
|
||
|
|
"num_tokens": 603318.0,
|
||
|
|
"step": 587
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6385427713394165,
|
||
|
|
"epoch": 0.7414880201765448,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 3.3046679102803346e-06,
|
||
|
|
"loss": 1.6013,
|
||
|
|
"mean_token_accuracy": 0.5976338088512421,
|
||
|
|
"num_tokens": 604302.0,
|
||
|
|
"step": 588
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5366343259811401,
|
||
|
|
"epoch": 0.742749054224464,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 3.274535463084354e-06,
|
||
|
|
"loss": 1.4691,
|
||
|
|
"mean_token_accuracy": 0.6205730736255646,
|
||
|
|
"num_tokens": 605327.0,
|
||
|
|
"step": 589
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.787080466747284,
|
||
|
|
"epoch": 0.7440100882723834,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 3.244514102685881e-06,
|
||
|
|
"loss": 1.7795,
|
||
|
|
"mean_token_accuracy": 0.5752379298210144,
|
||
|
|
"num_tokens": 606439.0,
|
||
|
|
"step": 590
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6053171157836914,
|
||
|
|
"epoch": 0.7452711223203027,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 3.214604324957987e-06,
|
||
|
|
"loss": 1.5571,
|
||
|
|
"mean_token_accuracy": 0.6215971112251282,
|
||
|
|
"num_tokens": 607334.0,
|
||
|
|
"step": 591
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5891655683517456,
|
||
|
|
"epoch": 0.7465321563682219,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 3.1848066239307083e-06,
|
||
|
|
"loss": 1.5656,
|
||
|
|
"mean_token_accuracy": 0.6122055351734161,
|
||
|
|
"num_tokens": 608408.0,
|
||
|
|
"step": 592
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6325897574424744,
|
||
|
|
"epoch": 0.7477931904161412,
|
||
|
|
"grad_norm": 9.375,
|
||
|
|
"learning_rate": 3.155121491782852e-06,
|
||
|
|
"loss": 1.5902,
|
||
|
|
"mean_token_accuracy": 0.598566085100174,
|
||
|
|
"num_tokens": 609555.0,
|
||
|
|
"step": 593
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5693252086639404,
|
||
|
|
"epoch": 0.7490542244640606,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 3.125549418833896e-06,
|
||
|
|
"loss": 1.6252,
|
||
|
|
"mean_token_accuracy": 0.5972473621368408,
|
||
|
|
"num_tokens": 610616.0,
|
||
|
|
"step": 594
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6936177015304565,
|
||
|
|
"epoch": 0.7503152585119798,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 3.0960908935358904e-06,
|
||
|
|
"loss": 1.7018,
|
||
|
|
"mean_token_accuracy": 0.5809133648872375,
|
||
|
|
"num_tokens": 611647.0,
|
||
|
|
"step": 595
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7418553233146667,
|
||
|
|
"epoch": 0.7515762925598991,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 3.066746402465364e-06,
|
||
|
|
"loss": 1.7436,
|
||
|
|
"mean_token_accuracy": 0.577365517616272,
|
||
|
|
"num_tokens": 612739.0,
|
||
|
|
"step": 596
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.65116286277771,
|
||
|
|
"epoch": 0.7528373266078184,
|
||
|
|
"grad_norm": 10.75,
|
||
|
|
"learning_rate": 3.0375164303153125e-06,
|
||
|
|
"loss": 1.5821,
|
||
|
|
"mean_token_accuracy": 0.6119444966316223,
|
||
|
|
"num_tokens": 613679.0,
|
||
|
|
"step": 597
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6618422865867615,
|
||
|
|
"epoch": 0.7540983606557377,
|
||
|
|
"grad_norm": 10.4375,
|
||
|
|
"learning_rate": 3.008401459887179e-06,
|
||
|
|
"loss": 1.6579,
|
||
|
|
"mean_token_accuracy": 0.5936234891414642,
|
||
|
|
"num_tokens": 614649.0,
|
||
|
|
"step": 598
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6057924628257751,
|
||
|
|
"epoch": 0.755359394703657,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 2.9794019720828883e-06,
|
||
|
|
"loss": 1.5492,
|
||
|
|
"mean_token_accuracy": 0.5903959274291992,
|
||
|
|
"num_tokens": 615619.0,
|
||
|
|
"step": 599
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6187320947647095,
|
||
|
|
"epoch": 0.7566204287515763,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 2.9505184458968925e-06,
|
||
|
|
"loss": 1.5641,
|
||
|
|
"mean_token_accuracy": 0.6148360073566437,
|
||
|
|
"num_tokens": 616718.0,
|
||
|
|
"step": 600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6082826852798462,
|
||
|
|
"epoch": 0.7578814627994955,
|
||
|
|
"grad_norm": 10.625,
|
||
|
|
"learning_rate": 2.921751358408276e-06,
|
||
|
|
"loss": 1.4999,
|
||
|
|
"mean_token_accuracy": 0.6301135122776031,
|
||
|
|
"num_tokens": 617718.0,
|
||
|
|
"step": 601
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5655282139778137,
|
||
|
|
"epoch": 0.7591424968474149,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 2.893101184772856e-06,
|
||
|
|
"loss": 1.4883,
|
||
|
|
"mean_token_accuracy": 0.6395408809185028,
|
||
|
|
"num_tokens": 618669.0,
|
||
|
|
"step": 602
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5624969005584717,
|
||
|
|
"epoch": 0.7604035308953342,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 2.8645683982153492e-06,
|
||
|
|
"loss": 1.4476,
|
||
|
|
"mean_token_accuracy": 0.6267207562923431,
|
||
|
|
"num_tokens": 619694.0,
|
||
|
|
"step": 603
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6462831497192383,
|
||
|
|
"epoch": 0.7616645649432535,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 2.8361534700215464e-06,
|
||
|
|
"loss": 1.5804,
|
||
|
|
"mean_token_accuracy": 0.6060568690299988,
|
||
|
|
"num_tokens": 620699.0,
|
||
|
|
"step": 604
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5634891390800476,
|
||
|
|
"epoch": 0.7629255989911727,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 2.807856869530534e-06,
|
||
|
|
"loss": 1.5232,
|
||
|
|
"mean_token_accuracy": 0.6247049272060394,
|
||
|
|
"num_tokens": 621665.0,
|
||
|
|
"step": 605
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6597495675086975,
|
||
|
|
"epoch": 0.7641866330390921,
|
||
|
|
"grad_norm": 10.625,
|
||
|
|
"learning_rate": 2.7796790641269377e-06,
|
||
|
|
"loss": 1.6944,
|
||
|
|
"mean_token_accuracy": 0.5736551582813263,
|
||
|
|
"num_tokens": 622654.0,
|
||
|
|
"step": 606
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.602832555770874,
|
||
|
|
"epoch": 0.7654476670870114,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 2.7516205192332013e-06,
|
||
|
|
"loss": 1.5792,
|
||
|
|
"mean_token_accuracy": 0.5968891382217407,
|
||
|
|
"num_tokens": 623707.0,
|
||
|
|
"step": 607
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5103943347930908,
|
||
|
|
"epoch": 0.7667087011349306,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 2.723681698301911e-06,
|
||
|
|
"loss": 1.4145,
|
||
|
|
"mean_token_accuracy": 0.630720853805542,
|
||
|
|
"num_tokens": 624728.0,
|
||
|
|
"step": 608
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5753813982009888,
|
||
|
|
"epoch": 0.7679697351828499,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 2.695863062808124e-06,
|
||
|
|
"loss": 1.5373,
|
||
|
|
"mean_token_accuracy": 0.6009436249732971,
|
||
|
|
"num_tokens": 625750.0,
|
||
|
|
"step": 609
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5960492491722107,
|
||
|
|
"epoch": 0.7692307692307693,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 2.6681650722417517e-06,
|
||
|
|
"loss": 1.5936,
|
||
|
|
"mean_token_accuracy": 0.6083240509033203,
|
||
|
|
"num_tokens": 626747.0,
|
||
|
|
"step": 610
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5975691676139832,
|
||
|
|
"epoch": 0.7704918032786885,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 2.6405881840999834e-06,
|
||
|
|
"loss": 1.4518,
|
||
|
|
"mean_token_accuracy": 0.633378803730011,
|
||
|
|
"num_tokens": 627761.0,
|
||
|
|
"step": 611
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.719033122062683,
|
||
|
|
"epoch": 0.7717528373266078,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 2.613132853879704e-06,
|
||
|
|
"loss": 1.6493,
|
||
|
|
"mean_token_accuracy": 0.5885544419288635,
|
||
|
|
"num_tokens": 628875.0,
|
||
|
|
"step": 612
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6344210505485535,
|
||
|
|
"epoch": 0.7730138713745272,
|
||
|
|
"grad_norm": 10.75,
|
||
|
|
"learning_rate": 2.585799535069988e-06,
|
||
|
|
"loss": 1.6801,
|
||
|
|
"mean_token_accuracy": 0.5876505076885223,
|
||
|
|
"num_tokens": 629822.0,
|
||
|
|
"step": 613
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5422580242156982,
|
||
|
|
"epoch": 0.7742749054224464,
|
||
|
|
"grad_norm": 9.5,
|
||
|
|
"learning_rate": 2.558588679144617e-06,
|
||
|
|
"loss": 1.4898,
|
||
|
|
"mean_token_accuracy": 0.6156132817268372,
|
||
|
|
"num_tokens": 630850.0,
|
||
|
|
"step": 614
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6368955969810486,
|
||
|
|
"epoch": 0.7755359394703657,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 2.5315007355545983e-06,
|
||
|
|
"loss": 1.6551,
|
||
|
|
"mean_token_accuracy": 0.5985925495624542,
|
||
|
|
"num_tokens": 631878.0,
|
||
|
|
"step": 615
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5841090679168701,
|
||
|
|
"epoch": 0.776796973518285,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 2.504536151720758e-06,
|
||
|
|
"loss": 1.4795,
|
||
|
|
"mean_token_accuracy": 0.622355729341507,
|
||
|
|
"num_tokens": 632928.0,
|
||
|
|
"step": 616
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6905888319015503,
|
||
|
|
"epoch": 0.7780580075662042,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 2.4776953730263542e-06,
|
||
|
|
"loss": 1.6694,
|
||
|
|
"mean_token_accuracy": 0.608178049325943,
|
||
|
|
"num_tokens": 633971.0,
|
||
|
|
"step": 617
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6145029664039612,
|
||
|
|
"epoch": 0.7793190416141236,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 2.450978842809699e-06,
|
||
|
|
"loss": 1.5608,
|
||
|
|
"mean_token_accuracy": 0.5896761119365692,
|
||
|
|
"num_tokens": 635069.0,
|
||
|
|
"step": 618
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.556121051311493,
|
||
|
|
"epoch": 0.7805800756620429,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 2.424387002356857e-06,
|
||
|
|
"loss": 1.5435,
|
||
|
|
"mean_token_accuracy": 0.6025985479354858,
|
||
|
|
"num_tokens": 636177.0,
|
||
|
|
"step": 619
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5894029140472412,
|
||
|
|
"epoch": 0.7818411097099621,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 2.3979202908943576e-06,
|
||
|
|
"loss": 1.6423,
|
||
|
|
"mean_token_accuracy": 0.5967113673686981,
|
||
|
|
"num_tokens": 637161.0,
|
||
|
|
"step": 620
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.586296796798706,
|
||
|
|
"epoch": 0.7831021437578815,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 2.371579145581919e-06,
|
||
|
|
"loss": 1.5078,
|
||
|
|
"mean_token_accuracy": 0.6111081540584564,
|
||
|
|
"num_tokens": 638194.0,
|
||
|
|
"step": 621
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.4746480584144592,
|
||
|
|
"epoch": 0.7843631778058008,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 2.345364001505248e-06,
|
||
|
|
"loss": 1.4639,
|
||
|
|
"mean_token_accuracy": 0.6132495105266571,
|
||
|
|
"num_tokens": 639244.0,
|
||
|
|
"step": 622
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6640491485595703,
|
||
|
|
"epoch": 0.78562421185372,
|
||
|
|
"grad_norm": 9.5,
|
||
|
|
"learning_rate": 2.3192752916688378e-06,
|
||
|
|
"loss": 1.6222,
|
||
|
|
"mean_token_accuracy": 0.5872381925582886,
|
||
|
|
"num_tokens": 640291.0,
|
||
|
|
"step": 623
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5269657969474792,
|
||
|
|
"epoch": 0.7868852459016393,
|
||
|
|
"grad_norm": 10.4375,
|
||
|
|
"learning_rate": 2.2933134469888407e-06,
|
||
|
|
"loss": 1.4887,
|
||
|
|
"mean_token_accuracy": 0.644686758518219,
|
||
|
|
"num_tokens": 641223.0,
|
||
|
|
"step": 624
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6151806712150574,
|
||
|
|
"epoch": 0.7881462799495587,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 2.267478896285913e-06,
|
||
|
|
"loss": 1.5686,
|
||
|
|
"mean_token_accuracy": 0.6034210622310638,
|
||
|
|
"num_tokens": 642263.0,
|
||
|
|
"step": 625
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5540375709533691,
|
||
|
|
"epoch": 0.7894073139974779,
|
||
|
|
"grad_norm": 11.1875,
|
||
|
|
"learning_rate": 2.241772066278164e-06,
|
||
|
|
"loss": 1.6005,
|
||
|
|
"mean_token_accuracy": 0.5964966714382172,
|
||
|
|
"num_tokens": 643272.0,
|
||
|
|
"step": 626
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6209745407104492,
|
||
|
|
"epoch": 0.7906683480453972,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 2.2161933815740987e-06,
|
||
|
|
"loss": 1.593,
|
||
|
|
"mean_token_accuracy": 0.5961326956748962,
|
||
|
|
"num_tokens": 644286.0,
|
||
|
|
"step": 627
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5604700446128845,
|
||
|
|
"epoch": 0.7919293820933165,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 2.190743264665598e-06,
|
||
|
|
"loss": 1.5801,
|
||
|
|
"mean_token_accuracy": 0.6023949980735779,
|
||
|
|
"num_tokens": 645310.0,
|
||
|
|
"step": 628
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7493359446525574,
|
||
|
|
"epoch": 0.7931904161412359,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 2.1654221359209425e-06,
|
||
|
|
"loss": 1.7136,
|
||
|
|
"mean_token_accuracy": 0.5818420052528381,
|
||
|
|
"num_tokens": 646442.0,
|
||
|
|
"step": 629
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6500951647758484,
|
||
|
|
"epoch": 0.7944514501891551,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 2.140230413577882e-06,
|
||
|
|
"loss": 1.587,
|
||
|
|
"mean_token_accuracy": 0.5937412083148956,
|
||
|
|
"num_tokens": 647543.0,
|
||
|
|
"step": 630
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6595157980918884,
|
||
|
|
"epoch": 0.7957124842370744,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 2.1151685137366994e-06,
|
||
|
|
"loss": 1.6438,
|
||
|
|
"mean_token_accuracy": 0.5985355973243713,
|
||
|
|
"num_tokens": 648520.0,
|
||
|
|
"step": 631
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6060655117034912,
|
||
|
|
"epoch": 0.7969735182849937,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 2.0902368503533664e-06,
|
||
|
|
"loss": 1.5514,
|
||
|
|
"mean_token_accuracy": 0.5987799763679504,
|
||
|
|
"num_tokens": 649511.0,
|
||
|
|
"step": 632
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7033616304397583,
|
||
|
|
"epoch": 0.798234552332913,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 2.0654358352326963e-06,
|
||
|
|
"loss": 1.7166,
|
||
|
|
"mean_token_accuracy": 0.6091784834861755,
|
||
|
|
"num_tokens": 650579.0,
|
||
|
|
"step": 633
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5791884660720825,
|
||
|
|
"epoch": 0.7994955863808323,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 2.0407658780215347e-06,
|
||
|
|
"loss": 1.5058,
|
||
|
|
"mean_token_accuracy": 0.6368519365787506,
|
||
|
|
"num_tokens": 651636.0,
|
||
|
|
"step": 634
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.593576431274414,
|
||
|
|
"epoch": 0.8007566204287516,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 2.0162273862019965e-06,
|
||
|
|
"loss": 1.5622,
|
||
|
|
"mean_token_accuracy": 0.6077103018760681,
|
||
|
|
"num_tokens": 652636.0,
|
||
|
|
"step": 635
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6148492097854614,
|
||
|
|
"epoch": 0.8020176544766708,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 1.9918207650847486e-06,
|
||
|
|
"loss": 1.6085,
|
||
|
|
"mean_token_accuracy": 0.5990950167179108,
|
||
|
|
"num_tokens": 653653.0,
|
||
|
|
"step": 636
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.620208740234375,
|
||
|
|
"epoch": 0.8032786885245902,
|
||
|
|
"grad_norm": 9.1875,
|
||
|
|
"learning_rate": 1.9675464178022985e-06,
|
||
|
|
"loss": 1.4553,
|
||
|
|
"mean_token_accuracy": 0.617027074098587,
|
||
|
|
"num_tokens": 654744.0,
|
||
|
|
"step": 637
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.672316312789917,
|
||
|
|
"epoch": 0.8045397225725095,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 1.9434047453023307e-06,
|
||
|
|
"loss": 1.6387,
|
||
|
|
"mean_token_accuracy": 0.6043696105480194,
|
||
|
|
"num_tokens": 655741.0,
|
||
|
|
"step": 638
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6659508347511292,
|
||
|
|
"epoch": 0.8058007566204287,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 1.919396146341115e-06,
|
||
|
|
"loss": 1.6174,
|
||
|
|
"mean_token_accuracy": 0.5979881286621094,
|
||
|
|
"num_tokens": 656728.0,
|
||
|
|
"step": 639
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6201184391975403,
|
||
|
|
"epoch": 0.807061790668348,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.8955210174768857e-06,
|
||
|
|
"loss": 1.5999,
|
||
|
|
"mean_token_accuracy": 0.598040908575058,
|
||
|
|
"num_tokens": 657702.0,
|
||
|
|
"step": 640
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.657130479812622,
|
||
|
|
"epoch": 0.8083228247162674,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 1.8717797530633108e-06,
|
||
|
|
"loss": 1.6281,
|
||
|
|
"mean_token_accuracy": 0.6085665225982666,
|
||
|
|
"num_tokens": 658738.0,
|
||
|
|
"step": 641
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6190232634544373,
|
||
|
|
"epoch": 0.8095838587641866,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.848172745242972e-06,
|
||
|
|
"loss": 1.594,
|
||
|
|
"mean_token_accuracy": 0.6045461893081665,
|
||
|
|
"num_tokens": 659803.0,
|
||
|
|
"step": 642
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5300160646438599,
|
||
|
|
"epoch": 0.8108448928121059,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 1.824700383940895e-06,
|
||
|
|
"loss": 1.5786,
|
||
|
|
"mean_token_accuracy": 0.6075372099876404,
|
||
|
|
"num_tokens": 660758.0,
|
||
|
|
"step": 643
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5939279794692993,
|
||
|
|
"epoch": 0.8121059268600253,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 1.8013630568580887e-06,
|
||
|
|
"loss": 1.5022,
|
||
|
|
"mean_token_accuracy": 0.6274777054786682,
|
||
|
|
"num_tokens": 661868.0,
|
||
|
|
"step": 644
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6016013622283936,
|
||
|
|
"epoch": 0.8133669609079445,
|
||
|
|
"grad_norm": 9.4375,
|
||
|
|
"learning_rate": 1.7781611494651729e-06,
|
||
|
|
"loss": 1.5496,
|
||
|
|
"mean_token_accuracy": 0.6174932420253754,
|
||
|
|
"num_tokens": 662910.0,
|
||
|
|
"step": 645
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6788129210472107,
|
||
|
|
"epoch": 0.8146279949558638,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 1.7550950449959813e-06,
|
||
|
|
"loss": 1.6982,
|
||
|
|
"mean_token_accuracy": 0.5900902450084686,
|
||
|
|
"num_tokens": 663881.0,
|
||
|
|
"step": 646
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5919433236122131,
|
||
|
|
"epoch": 0.8158890290037831,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 1.7321651244412508e-06,
|
||
|
|
"loss": 1.6296,
|
||
|
|
"mean_token_accuracy": 0.5992754995822906,
|
||
|
|
"num_tokens": 664895.0,
|
||
|
|
"step": 647
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6670875549316406,
|
||
|
|
"epoch": 0.8171500630517023,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.709371766542317e-06,
|
||
|
|
"loss": 1.6395,
|
||
|
|
"mean_token_accuracy": 0.6070599853992462,
|
||
|
|
"num_tokens": 665887.0,
|
||
|
|
"step": 648
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6015033721923828,
|
||
|
|
"epoch": 0.8184110970996217,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.6867153477848709e-06,
|
||
|
|
"loss": 1.5273,
|
||
|
|
"mean_token_accuracy": 0.6009906530380249,
|
||
|
|
"num_tokens": 666858.0,
|
||
|
|
"step": 649
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.597748577594757,
|
||
|
|
"epoch": 0.819672131147541,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.6641962423927294e-06,
|
||
|
|
"loss": 1.619,
|
||
|
|
"mean_token_accuracy": 0.6162165701389313,
|
||
|
|
"num_tokens": 667940.0,
|
||
|
|
"step": 650
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5628655552864075,
|
||
|
|
"epoch": 0.8209331651954602,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.641814822321648e-06,
|
||
|
|
"loss": 1.5317,
|
||
|
|
"mean_token_accuracy": 0.6260219216346741,
|
||
|
|
"num_tokens": 668830.0,
|
||
|
|
"step": 651
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5993925333023071,
|
||
|
|
"epoch": 0.8221941992433796,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 1.619571457253203e-06,
|
||
|
|
"loss": 1.5661,
|
||
|
|
"mean_token_accuracy": 0.6064877212047577,
|
||
|
|
"num_tokens": 669770.0,
|
||
|
|
"step": 652
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6037020087242126,
|
||
|
|
"epoch": 0.8234552332912989,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 1.5974665145886591e-06,
|
||
|
|
"loss": 1.5811,
|
||
|
|
"mean_token_accuracy": 0.6146577894687653,
|
||
|
|
"num_tokens": 670788.0,
|
||
|
|
"step": 653
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6218588948249817,
|
||
|
|
"epoch": 0.8247162673392182,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 1.5755003594429107e-06,
|
||
|
|
"loss": 1.6137,
|
||
|
|
"mean_token_accuracy": 0.591108113527298,
|
||
|
|
"num_tokens": 671862.0,
|
||
|
|
"step": 654
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5854175686836243,
|
||
|
|
"epoch": 0.8259773013871374,
|
||
|
|
"grad_norm": 9.4375,
|
||
|
|
"learning_rate": 1.5536733546384574e-06,
|
||
|
|
"loss": 1.5135,
|
||
|
|
"mean_token_accuracy": 0.6228609085083008,
|
||
|
|
"num_tokens": 672976.0,
|
||
|
|
"step": 655
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6092653274536133,
|
||
|
|
"epoch": 0.8272383354350568,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.5319858606994032e-06,
|
||
|
|
"loss": 1.5519,
|
||
|
|
"mean_token_accuracy": 0.616204172372818,
|
||
|
|
"num_tokens": 674015.0,
|
||
|
|
"step": 656
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.657637894153595,
|
||
|
|
"epoch": 0.8284993694829761,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 1.5104382358454927e-06,
|
||
|
|
"loss": 1.6663,
|
||
|
|
"mean_token_accuracy": 0.5839800238609314,
|
||
|
|
"num_tokens": 674966.0,
|
||
|
|
"step": 657
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6724979281425476,
|
||
|
|
"epoch": 0.8297604035308953,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 1.4890308359862204e-06,
|
||
|
|
"loss": 1.6844,
|
||
|
|
"mean_token_accuracy": 0.5795196890830994,
|
||
|
|
"num_tokens": 675964.0,
|
||
|
|
"step": 658
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6867769360542297,
|
||
|
|
"epoch": 0.8310214375788146,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 1.4677640147149298e-06,
|
||
|
|
"loss": 1.7271,
|
||
|
|
"mean_token_accuracy": 0.5976731777191162,
|
||
|
|
"num_tokens": 677050.0,
|
||
|
|
"step": 659
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5519938468933105,
|
||
|
|
"epoch": 0.832282471626734,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.4466381233029781e-06,
|
||
|
|
"loss": 1.5131,
|
||
|
|
"mean_token_accuracy": 0.6237548589706421,
|
||
|
|
"num_tokens": 678111.0,
|
||
|
|
"step": 660
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.62520033121109,
|
||
|
|
"epoch": 0.8335435056746532,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 1.425653510693935e-06,
|
||
|
|
"loss": 1.7469,
|
||
|
|
"mean_token_accuracy": 0.5777223408222198,
|
||
|
|
"num_tokens": 679063.0,
|
||
|
|
"step": 661
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7489730715751648,
|
||
|
|
"epoch": 0.8348045397225725,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.4048105234978316e-06,
|
||
|
|
"loss": 1.7518,
|
||
|
|
"mean_token_accuracy": 0.5856288075447083,
|
||
|
|
"num_tokens": 680136.0,
|
||
|
|
"step": 662
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.608448565006256,
|
||
|
|
"epoch": 0.8360655737704918,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 1.3841095059854037e-06,
|
||
|
|
"loss": 1.6429,
|
||
|
|
"mean_token_accuracy": 0.6058609485626221,
|
||
|
|
"num_tokens": 681199.0,
|
||
|
|
"step": 663
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5358132719993591,
|
||
|
|
"epoch": 0.8373266078184111,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 1.3635508000824438e-06,
|
||
|
|
"loss": 1.483,
|
||
|
|
"mean_token_accuracy": 0.6294578015804291,
|
||
|
|
"num_tokens": 682232.0,
|
||
|
|
"step": 664
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.4801697134971619,
|
||
|
|
"epoch": 0.8385876418663304,
|
||
|
|
"grad_norm": 11.6875,
|
||
|
|
"learning_rate": 1.3431347453641253e-06,
|
||
|
|
"loss": 1.5377,
|
||
|
|
"mean_token_accuracy": 0.62205970287323,
|
||
|
|
"num_tokens": 683134.0,
|
||
|
|
"step": 665
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5673559308052063,
|
||
|
|
"epoch": 0.8398486759142497,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 1.3228616790494041e-06,
|
||
|
|
"loss": 1.555,
|
||
|
|
"mean_token_accuracy": 0.6151553690433502,
|
||
|
|
"num_tokens": 684190.0,
|
||
|
|
"step": 666
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5774081945419312,
|
||
|
|
"epoch": 0.8411097099621689,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 1.302731935995447e-06,
|
||
|
|
"loss": 1.5455,
|
||
|
|
"mean_token_accuracy": 0.61209437251091,
|
||
|
|
"num_tokens": 685309.0,
|
||
|
|
"step": 667
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.714252233505249,
|
||
|
|
"epoch": 0.8423707440100883,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 1.2827458486921084e-06,
|
||
|
|
"loss": 1.7232,
|
||
|
|
"mean_token_accuracy": 0.5814785361289978,
|
||
|
|
"num_tokens": 686464.0,
|
||
|
|
"step": 668
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6024048328399658,
|
||
|
|
"epoch": 0.8436317780580076,
|
||
|
|
"grad_norm": 9.4375,
|
||
|
|
"learning_rate": 1.2629037472564265e-06,
|
||
|
|
"loss": 1.5261,
|
||
|
|
"mean_token_accuracy": 0.6055002510547638,
|
||
|
|
"num_tokens": 687562.0,
|
||
|
|
"step": 669
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.622502863407135,
|
||
|
|
"epoch": 0.8448928121059268,
|
||
|
|
"grad_norm": 9.4375,
|
||
|
|
"learning_rate": 1.2432059594271684e-06,
|
||
|
|
"loss": 1.5345,
|
||
|
|
"mean_token_accuracy": 0.6223553121089935,
|
||
|
|
"num_tokens": 688631.0,
|
||
|
|
"step": 670
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6606404185295105,
|
||
|
|
"epoch": 0.8461538461538461,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 1.223652810559437e-06,
|
||
|
|
"loss": 1.6076,
|
||
|
|
"mean_token_accuracy": 0.5935347676277161,
|
||
|
|
"num_tokens": 689693.0,
|
||
|
|
"step": 671
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5708253383636475,
|
||
|
|
"epoch": 0.8474148802017655,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 1.2042446236192773e-06,
|
||
|
|
"loss": 1.5318,
|
||
|
|
"mean_token_accuracy": 0.6181544959545135,
|
||
|
|
"num_tokens": 690752.0,
|
||
|
|
"step": 672
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.630136489868164,
|
||
|
|
"epoch": 0.8486759142496847,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 1.1849817191783487e-06,
|
||
|
|
"loss": 1.7418,
|
||
|
|
"mean_token_accuracy": 0.5877110660076141,
|
||
|
|
"num_tokens": 691761.0,
|
||
|
|
"step": 673
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.688385009765625,
|
||
|
|
"epoch": 0.849936948297604,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 1.165864415408632e-06,
|
||
|
|
"loss": 1.5957,
|
||
|
|
"mean_token_accuracy": 0.5905094742774963,
|
||
|
|
"num_tokens": 692772.0,
|
||
|
|
"step": 674
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5632014274597168,
|
||
|
|
"epoch": 0.8511979823455234,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 1.1468930280771728e-06,
|
||
|
|
"loss": 1.5715,
|
||
|
|
"mean_token_accuracy": 0.6058877408504486,
|
||
|
|
"num_tokens": 693739.0,
|
||
|
|
"step": 675
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6090402007102966,
|
||
|
|
"epoch": 0.8524590163934426,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 1.1280678705408555e-06,
|
||
|
|
"loss": 1.6009,
|
||
|
|
"mean_token_accuracy": 0.5987589657306671,
|
||
|
|
"num_tokens": 694808.0,
|
||
|
|
"step": 676
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6218902468681335,
|
||
|
|
"epoch": 0.8537200504413619,
|
||
|
|
"grad_norm": 11.25,
|
||
|
|
"learning_rate": 1.109389253741252e-06,
|
||
|
|
"loss": 1.5666,
|
||
|
|
"mean_token_accuracy": 0.6107601821422577,
|
||
|
|
"num_tokens": 695765.0,
|
||
|
|
"step": 677
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.616283357143402,
|
||
|
|
"epoch": 0.8549810844892812,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.0908574861994593e-06,
|
||
|
|
"loss": 1.4888,
|
||
|
|
"mean_token_accuracy": 0.6360717117786407,
|
||
|
|
"num_tokens": 696838.0,
|
||
|
|
"step": 678
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6077577471733093,
|
||
|
|
"epoch": 0.8562421185372006,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 1.072472874011018e-06,
|
||
|
|
"loss": 1.5456,
|
||
|
|
"mean_token_accuracy": 0.600656270980835,
|
||
|
|
"num_tokens": 697843.0,
|
||
|
|
"step": 679
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6344243884086609,
|
||
|
|
"epoch": 0.8575031525851198,
|
||
|
|
"grad_norm": 10.75,
|
||
|
|
"learning_rate": 1.0542357208408572e-06,
|
||
|
|
"loss": 1.6269,
|
||
|
|
"mean_token_accuracy": 0.6122370064258575,
|
||
|
|
"num_tokens": 698850.0,
|
||
|
|
"step": 680
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5988330841064453,
|
||
|
|
"epoch": 0.8587641866330391,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 1.0361463279182705e-06,
|
||
|
|
"loss": 1.4991,
|
||
|
|
"mean_token_accuracy": 0.6044856309890747,
|
||
|
|
"num_tokens": 699813.0,
|
||
|
|
"step": 681
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.646595060825348,
|
||
|
|
"epoch": 0.8600252206809584,
|
||
|
|
"grad_norm": 10.4375,
|
||
|
|
"learning_rate": 1.018204994031946e-06,
|
||
|
|
"loss": 1.6663,
|
||
|
|
"mean_token_accuracy": 0.5816754698753357,
|
||
|
|
"num_tokens": 700860.0,
|
||
|
|
"step": 682
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6502401232719421,
|
||
|
|
"epoch": 0.8612862547288777,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 1.000412015525032e-06,
|
||
|
|
"loss": 1.5711,
|
||
|
|
"mean_token_accuracy": 0.6014617681503296,
|
||
|
|
"num_tokens": 701882.0,
|
||
|
|
"step": 683
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5778306722640991,
|
||
|
|
"epoch": 0.862547288776797,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 9.82767686290237e-07,
|
||
|
|
"loss": 1.5073,
|
||
|
|
"mean_token_accuracy": 0.6309453547000885,
|
||
|
|
"num_tokens": 702970.0,
|
||
|
|
"step": 684
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5491229891777039,
|
||
|
|
"epoch": 0.8638083228247163,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 9.652722977649797e-07,
|
||
|
|
"loss": 1.479,
|
||
|
|
"mean_token_accuracy": 0.6380586922168732,
|
||
|
|
"num_tokens": 703997.0,
|
||
|
|
"step": 685
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6863412261009216,
|
||
|
|
"epoch": 0.8650693568726355,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 9.479261389265759e-07,
|
||
|
|
"loss": 1.6822,
|
||
|
|
"mean_token_accuracy": 0.5966202020645142,
|
||
|
|
"num_tokens": 704998.0,
|
||
|
|
"step": 686
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5364180207252502,
|
||
|
|
"epoch": 0.8663303909205549,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 9.307294962874647e-07,
|
||
|
|
"loss": 1.3953,
|
||
|
|
"mean_token_accuracy": 0.627411425113678,
|
||
|
|
"num_tokens": 705912.0,
|
||
|
|
"step": 687
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6023075580596924,
|
||
|
|
"epoch": 0.8675914249684742,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 9.136826538904698e-07,
|
||
|
|
"loss": 1.5884,
|
||
|
|
"mean_token_accuracy": 0.6016032099723816,
|
||
|
|
"num_tokens": 706959.0,
|
||
|
|
"step": 688
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6296188831329346,
|
||
|
|
"epoch": 0.8688524590163934,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 8.967858933041185e-07,
|
||
|
|
"loss": 1.5787,
|
||
|
|
"mean_token_accuracy": 0.6014998257160187,
|
||
|
|
"num_tokens": 708045.0,
|
||
|
|
"step": 689
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6676581501960754,
|
||
|
|
"epoch": 0.8701134930643127,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 8.800394936179812e-07,
|
||
|
|
"loss": 1.7404,
|
||
|
|
"mean_token_accuracy": 0.5869565010070801,
|
||
|
|
"num_tokens": 709109.0,
|
||
|
|
"step": 690
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6113680005073547,
|
||
|
|
"epoch": 0.8713745271122321,
|
||
|
|
"grad_norm": 9.5,
|
||
|
|
"learning_rate": 8.634437314380694e-07,
|
||
|
|
"loss": 1.5512,
|
||
|
|
"mean_token_accuracy": 0.6073167324066162,
|
||
|
|
"num_tokens": 710171.0,
|
||
|
|
"step": 691
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5472896099090576,
|
||
|
|
"epoch": 0.8726355611601513,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 8.469988808822593e-07,
|
||
|
|
"loss": 1.461,
|
||
|
|
"mean_token_accuracy": 0.6256625950336456,
|
||
|
|
"num_tokens": 711165.0,
|
||
|
|
"step": 692
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6653525829315186,
|
||
|
|
"epoch": 0.8738965952080706,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 8.307052135757754e-07,
|
||
|
|
"loss": 1.6289,
|
||
|
|
"mean_token_accuracy": 0.6001039147377014,
|
||
|
|
"num_tokens": 712235.0,
|
||
|
|
"step": 693
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6848056316375732,
|
||
|
|
"epoch": 0.8751576292559899,
|
||
|
|
"grad_norm": 10.9375,
|
||
|
|
"learning_rate": 8.145629986466885e-07,
|
||
|
|
"loss": 1.796,
|
||
|
|
"mean_token_accuracy": 0.5717266201972961,
|
||
|
|
"num_tokens": 713224.0,
|
||
|
|
"step": 694
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5576205849647522,
|
||
|
|
"epoch": 0.8764186633039092,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 7.985725027214841e-07,
|
||
|
|
"loss": 1.5828,
|
||
|
|
"mean_token_accuracy": 0.6143843829631805,
|
||
|
|
"num_tokens": 714212.0,
|
||
|
|
"step": 695
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5735121965408325,
|
||
|
|
"epoch": 0.8776796973518285,
|
||
|
|
"grad_norm": 9.5,
|
||
|
|
"learning_rate": 7.827339899206498e-07,
|
||
|
|
"loss": 1.5306,
|
||
|
|
"mean_token_accuracy": 0.6237430572509766,
|
||
|
|
"num_tokens": 715266.0,
|
||
|
|
"step": 696
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5997198820114136,
|
||
|
|
"epoch": 0.8789407313997478,
|
||
|
|
"grad_norm": 9.375,
|
||
|
|
"learning_rate": 7.670477218543194e-07,
|
||
|
|
"loss": 1.4566,
|
||
|
|
"mean_token_accuracy": 0.6122881770133972,
|
||
|
|
"num_tokens": 716285.0,
|
||
|
|
"step": 697
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5749364495277405,
|
||
|
|
"epoch": 0.880201765447667,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 7.515139576179431e-07,
|
||
|
|
"loss": 1.5525,
|
||
|
|
"mean_token_accuracy": 0.6019967794418335,
|
||
|
|
"num_tokens": 717288.0,
|
||
|
|
"step": 698
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6196271181106567,
|
||
|
|
"epoch": 0.8814627994955864,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 7.361329537880202e-07,
|
||
|
|
"loss": 1.6218,
|
||
|
|
"mean_token_accuracy": 0.6131271123886108,
|
||
|
|
"num_tokens": 718315.0,
|
||
|
|
"step": 699
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7117086052894592,
|
||
|
|
"epoch": 0.8827238335435057,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 7.209049644178489e-07,
|
||
|
|
"loss": 1.6847,
|
||
|
|
"mean_token_accuracy": 0.5908259451389313,
|
||
|
|
"num_tokens": 719390.0,
|
||
|
|
"step": 700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6483564972877502,
|
||
|
|
"epoch": 0.8839848675914249,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 7.058302410333373e-07,
|
||
|
|
"loss": 1.6003,
|
||
|
|
"mean_token_accuracy": 0.6116471886634827,
|
||
|
|
"num_tokens": 720424.0,
|
||
|
|
"step": 701
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7130059599876404,
|
||
|
|
"epoch": 0.8852459016393442,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 6.909090326288447e-07,
|
||
|
|
"loss": 1.6265,
|
||
|
|
"mean_token_accuracy": 0.5986179709434509,
|
||
|
|
"num_tokens": 721445.0,
|
||
|
|
"step": 702
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6091358065605164,
|
||
|
|
"epoch": 0.8865069356872636,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 6.761415856630749e-07,
|
||
|
|
"loss": 1.5622,
|
||
|
|
"mean_token_accuracy": 0.6100156903266907,
|
||
|
|
"num_tokens": 722510.0,
|
||
|
|
"step": 703
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5620290637016296,
|
||
|
|
"epoch": 0.8877679697351829,
|
||
|
|
"grad_norm": 9.1875,
|
||
|
|
"learning_rate": 6.615281440549981e-07,
|
||
|
|
"loss": 1.5993,
|
||
|
|
"mean_token_accuracy": 0.592156857252121,
|
||
|
|
"num_tokens": 723628.0,
|
||
|
|
"step": 704
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5988438129425049,
|
||
|
|
"epoch": 0.8890290037831021,
|
||
|
|
"grad_norm": 9.4375,
|
||
|
|
"learning_rate": 6.470689491798232e-07,
|
||
|
|
"loss": 1.539,
|
||
|
|
"mean_token_accuracy": 0.608138918876648,
|
||
|
|
"num_tokens": 724760.0,
|
||
|
|
"step": 705
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.641887366771698,
|
||
|
|
"epoch": 0.8902900378310215,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 6.327642398650224e-07,
|
||
|
|
"loss": 1.607,
|
||
|
|
"mean_token_accuracy": 0.6223348081111908,
|
||
|
|
"num_tokens": 725872.0,
|
||
|
|
"step": 706
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7240522503852844,
|
||
|
|
"epoch": 0.8915510718789408,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 6.18614252386367e-07,
|
||
|
|
"loss": 1.7405,
|
||
|
|
"mean_token_accuracy": 0.5823781192302704,
|
||
|
|
"num_tokens": 726878.0,
|
||
|
|
"step": 707
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.667864739894867,
|
||
|
|
"epoch": 0.89281210592686,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 6.046192204640389e-07,
|
||
|
|
"loss": 1.6646,
|
||
|
|
"mean_token_accuracy": 0.6081388592720032,
|
||
|
|
"num_tokens": 727992.0,
|
||
|
|
"step": 708
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6527946591377258,
|
||
|
|
"epoch": 0.8940731399747793,
|
||
|
|
"grad_norm": 10.4375,
|
||
|
|
"learning_rate": 5.907793752587676e-07,
|
||
|
|
"loss": 1.7327,
|
||
|
|
"mean_token_accuracy": 0.580237478017807,
|
||
|
|
"num_tokens": 729029.0,
|
||
|
|
"step": 709
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5796163082122803,
|
||
|
|
"epoch": 0.8953341740226987,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 5.770949453680064e-07,
|
||
|
|
"loss": 1.5413,
|
||
|
|
"mean_token_accuracy": 0.6177756786346436,
|
||
|
|
"num_tokens": 730086.0,
|
||
|
|
"step": 710
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6978189945220947,
|
||
|
|
"epoch": 0.8965952080706179,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 5.63566156822164e-07,
|
||
|
|
"loss": 1.6844,
|
||
|
|
"mean_token_accuracy": 0.5957068800926208,
|
||
|
|
"num_tokens": 731078.0,
|
||
|
|
"step": 711
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6364977955818176,
|
||
|
|
"epoch": 0.8978562421185372,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 5.50193233080869e-07,
|
||
|
|
"loss": 1.627,
|
||
|
|
"mean_token_accuracy": 0.6093653738498688,
|
||
|
|
"num_tokens": 732087.0,
|
||
|
|
"step": 712
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6980788111686707,
|
||
|
|
"epoch": 0.8991172761664565,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 5.369763950292739e-07,
|
||
|
|
"loss": 1.6836,
|
||
|
|
"mean_token_accuracy": 0.5986462235450745,
|
||
|
|
"num_tokens": 733214.0,
|
||
|
|
"step": 713
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6126567125320435,
|
||
|
|
"epoch": 0.9003783102143758,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 5.239158609744122e-07,
|
||
|
|
"loss": 1.4976,
|
||
|
|
"mean_token_accuracy": 0.6257197856903076,
|
||
|
|
"num_tokens": 734264.0,
|
||
|
|
"step": 714
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5426988005638123,
|
||
|
|
"epoch": 0.9016393442622951,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 5.110118466415903e-07,
|
||
|
|
"loss": 1.4991,
|
||
|
|
"mean_token_accuracy": 0.6206920444965363,
|
||
|
|
"num_tokens": 735262.0,
|
||
|
|
"step": 715
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6925783157348633,
|
||
|
|
"epoch": 0.9029003783102144,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 4.982645651708273e-07,
|
||
|
|
"loss": 1.6439,
|
||
|
|
"mean_token_accuracy": 0.5905139148235321,
|
||
|
|
"num_tokens": 736286.0,
|
||
|
|
"step": 716
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6072167754173279,
|
||
|
|
"epoch": 0.9041614123581336,
|
||
|
|
"grad_norm": 9.5,
|
||
|
|
"learning_rate": 4.856742271133275e-07,
|
||
|
|
"loss": 1.4884,
|
||
|
|
"mean_token_accuracy": 0.617807924747467,
|
||
|
|
"num_tokens": 737315.0,
|
||
|
|
"step": 717
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6528156399726868,
|
||
|
|
"epoch": 0.905422446406053,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 4.73241040428013e-07,
|
||
|
|
"loss": 1.7388,
|
||
|
|
"mean_token_accuracy": 0.5700719952583313,
|
||
|
|
"num_tokens": 738450.0,
|
||
|
|
"step": 718
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.621579110622406,
|
||
|
|
"epoch": 0.9066834804539723,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 4.6096521047807706e-07,
|
||
|
|
"loss": 1.5525,
|
||
|
|
"mean_token_accuracy": 0.615268737077713,
|
||
|
|
"num_tokens": 739456.0,
|
||
|
|
"step": 719
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5768209099769592,
|
||
|
|
"epoch": 0.9079445145018915,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 4.4884694002760297e-07,
|
||
|
|
"loss": 1.4851,
|
||
|
|
"mean_token_accuracy": 0.6131468713283539,
|
||
|
|
"num_tokens": 740588.0,
|
||
|
|
"step": 720
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.74585622549057,
|
||
|
|
"epoch": 0.9092055485498108,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 4.368864292382058e-07,
|
||
|
|
"loss": 1.7276,
|
||
|
|
"mean_token_accuracy": 0.5804306268692017,
|
||
|
|
"num_tokens": 741706.0,
|
||
|
|
"step": 721
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6634482741355896,
|
||
|
|
"epoch": 0.9104665825977302,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 4.250838756657327e-07,
|
||
|
|
"loss": 1.6079,
|
||
|
|
"mean_token_accuracy": 0.5807794630527496,
|
||
|
|
"num_tokens": 742647.0,
|
||
|
|
"step": 722
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.719810128211975,
|
||
|
|
"epoch": 0.9117276166456494,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 4.134394742569958e-07,
|
||
|
|
"loss": 1.7388,
|
||
|
|
"mean_token_accuracy": 0.5862915515899658,
|
||
|
|
"num_tokens": 743740.0,
|
||
|
|
"step": 723
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6695452332496643,
|
||
|
|
"epoch": 0.9129886506935687,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 4.019534173465567e-07,
|
||
|
|
"loss": 1.5222,
|
||
|
|
"mean_token_accuracy": 0.6237170398235321,
|
||
|
|
"num_tokens": 744805.0,
|
||
|
|
"step": 724
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6637256741523743,
|
||
|
|
"epoch": 0.914249684741488,
|
||
|
|
"grad_norm": 10.8125,
|
||
|
|
"learning_rate": 3.906258946535446e-07,
|
||
|
|
"loss": 1.5299,
|
||
|
|
"mean_token_accuracy": 0.5966459810733795,
|
||
|
|
"num_tokens": 745889.0,
|
||
|
|
"step": 725
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6322776079177856,
|
||
|
|
"epoch": 0.9155107187894073,
|
||
|
|
"grad_norm": 9.8125,
|
||
|
|
"learning_rate": 3.7945709327852463e-07,
|
||
|
|
"loss": 1.5525,
|
||
|
|
"mean_token_accuracy": 0.6051934063434601,
|
||
|
|
"num_tokens": 746938.0,
|
||
|
|
"step": 726
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.530247688293457,
|
||
|
|
"epoch": 0.9167717528373266,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 3.6844719770040894e-07,
|
||
|
|
"loss": 1.4392,
|
||
|
|
"mean_token_accuracy": 0.6275743544101715,
|
||
|
|
"num_tokens": 747965.0,
|
||
|
|
"step": 727
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.705262839794159,
|
||
|
|
"epoch": 0.9180327868852459,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 3.5759638977340694e-07,
|
||
|
|
"loss": 1.7014,
|
||
|
|
"mean_token_accuracy": 0.5917846262454987,
|
||
|
|
"num_tokens": 749012.0,
|
||
|
|
"step": 728
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6762296557426453,
|
||
|
|
"epoch": 0.9192938209331651,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 3.469048487240234e-07,
|
||
|
|
"loss": 1.6646,
|
||
|
|
"mean_token_accuracy": 0.5977064967155457,
|
||
|
|
"num_tokens": 750096.0,
|
||
|
|
"step": 729
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6182932257652283,
|
||
|
|
"epoch": 0.9205548549810845,
|
||
|
|
"grad_norm": 9.25,
|
||
|
|
"learning_rate": 3.363727511480974e-07,
|
||
|
|
"loss": 1.5485,
|
||
|
|
"mean_token_accuracy": 0.6200019121170044,
|
||
|
|
"num_tokens": 751128.0,
|
||
|
|
"step": 730
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6149555444717407,
|
||
|
|
"epoch": 0.9218158890290038,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 3.26000271007888e-07,
|
||
|
|
"loss": 1.5883,
|
||
|
|
"mean_token_accuracy": 0.6041360795497894,
|
||
|
|
"num_tokens": 752167.0,
|
||
|
|
"step": 731
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5307012796401978,
|
||
|
|
"epoch": 0.9230769230769231,
|
||
|
|
"grad_norm": 9.5,
|
||
|
|
"learning_rate": 3.157875796291954e-07,
|
||
|
|
"loss": 1.5411,
|
||
|
|
"mean_token_accuracy": 0.617628425359726,
|
||
|
|
"num_tokens": 753250.0,
|
||
|
|
"step": 732
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5426356196403503,
|
||
|
|
"epoch": 0.9243379571248423,
|
||
|
|
"grad_norm": 9.4375,
|
||
|
|
"learning_rate": 3.057348456985354e-07,
|
||
|
|
"loss": 1.4675,
|
||
|
|
"mean_token_accuracy": 0.6181185245513916,
|
||
|
|
"num_tokens": 754306.0,
|
||
|
|
"step": 733
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.45901757478714,
|
||
|
|
"epoch": 0.9255989911727617,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 2.958422352603507e-07,
|
||
|
|
"loss": 1.4394,
|
||
|
|
"mean_token_accuracy": 0.6353554129600525,
|
||
|
|
"num_tokens": 755274.0,
|
||
|
|
"step": 734
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5300554633140564,
|
||
|
|
"epoch": 0.926860025220681,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 2.861099117142718e-07,
|
||
|
|
"loss": 1.5487,
|
||
|
|
"mean_token_accuracy": 0.6036134958267212,
|
||
|
|
"num_tokens": 756306.0,
|
||
|
|
"step": 735
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5845162868499756,
|
||
|
|
"epoch": 0.9281210592686002,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 2.765380358124137e-07,
|
||
|
|
"loss": 1.5127,
|
||
|
|
"mean_token_accuracy": 0.6234964728355408,
|
||
|
|
"num_tokens": 757309.0,
|
||
|
|
"step": 736
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6095054745674133,
|
||
|
|
"epoch": 0.9293820933165196,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 2.6712676565672556e-07,
|
||
|
|
"loss": 1.5488,
|
||
|
|
"mean_token_accuracy": 0.6357644498348236,
|
||
|
|
"num_tokens": 758362.0,
|
||
|
|
"step": 737
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6068363785743713,
|
||
|
|
"epoch": 0.9306431273644389,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 2.5787625669637326e-07,
|
||
|
|
"loss": 1.523,
|
||
|
|
"mean_token_accuracy": 0.6318581700325012,
|
||
|
|
"num_tokens": 759368.0,
|
||
|
|
"step": 738
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5889991521835327,
|
||
|
|
"epoch": 0.9319041614123581,
|
||
|
|
"grad_norm": 9.5,
|
||
|
|
"learning_rate": 2.487866617251766e-07,
|
||
|
|
"loss": 1.5508,
|
||
|
|
"mean_token_accuracy": 0.6171300709247589,
|
||
|
|
"num_tokens": 760356.0,
|
||
|
|
"step": 739
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7172034978866577,
|
||
|
|
"epoch": 0.9331651954602774,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 2.398581308790848e-07,
|
||
|
|
"loss": 1.6503,
|
||
|
|
"mean_token_accuracy": 0.5916622281074524,
|
||
|
|
"num_tokens": 761475.0,
|
||
|
|
"step": 740
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6113387942314148,
|
||
|
|
"epoch": 0.9344262295081968,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 2.3109081163369406e-07,
|
||
|
|
"loss": 1.7583,
|
||
|
|
"mean_token_accuracy": 0.576923668384552,
|
||
|
|
"num_tokens": 762521.0,
|
||
|
|
"step": 741
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.584511160850525,
|
||
|
|
"epoch": 0.935687263556116,
|
||
|
|
"grad_norm": 10.0,
|
||
|
|
"learning_rate": 2.2248484880181386e-07,
|
||
|
|
"loss": 1.4955,
|
||
|
|
"mean_token_accuracy": 0.6316056847572327,
|
||
|
|
"num_tokens": 763461.0,
|
||
|
|
"step": 742
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6016417741775513,
|
||
|
|
"epoch": 0.9369482976040353,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 2.1404038453107567e-07,
|
||
|
|
"loss": 1.7041,
|
||
|
|
"mean_token_accuracy": 0.5871516168117523,
|
||
|
|
"num_tokens": 764483.0,
|
||
|
|
"step": 743
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6880784034729004,
|
||
|
|
"epoch": 0.9382093316519546,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 2.057575583015836e-07,
|
||
|
|
"loss": 1.6235,
|
||
|
|
"mean_token_accuracy": 0.5990844666957855,
|
||
|
|
"num_tokens": 765581.0,
|
||
|
|
"step": 744
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.591380536556244,
|
||
|
|
"epoch": 0.9394703656998739,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.976365069236108e-07,
|
||
|
|
"loss": 1.5336,
|
||
|
|
"mean_token_accuracy": 0.6195339858531952,
|
||
|
|
"num_tokens": 766548.0,
|
||
|
|
"step": 745
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5457363724708557,
|
||
|
|
"epoch": 0.9407313997477932,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.8967736453534002e-07,
|
||
|
|
"loss": 1.5151,
|
||
|
|
"mean_token_accuracy": 0.6056419909000397,
|
||
|
|
"num_tokens": 767545.0,
|
||
|
|
"step": 746
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.612839162349701,
|
||
|
|
"epoch": 0.9419924337957125,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 1.818802626006466e-07,
|
||
|
|
"loss": 1.5853,
|
||
|
|
"mean_token_accuracy": 0.603949248790741,
|
||
|
|
"num_tokens": 768586.0,
|
||
|
|
"step": 747
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6123217940330505,
|
||
|
|
"epoch": 0.9432534678436317,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 1.742453299069302e-07,
|
||
|
|
"loss": 1.6436,
|
||
|
|
"mean_token_accuracy": 0.594914048910141,
|
||
|
|
"num_tokens": 769643.0,
|
||
|
|
"step": 748
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7243667244911194,
|
||
|
|
"epoch": 0.9445145018915511,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 1.6677269256298424e-07,
|
||
|
|
"loss": 1.7381,
|
||
|
|
"mean_token_accuracy": 0.5749774873256683,
|
||
|
|
"num_tokens": 770737.0,
|
||
|
|
"step": 749
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5863444209098816,
|
||
|
|
"epoch": 0.9457755359394704,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 1.5946247399691638e-07,
|
||
|
|
"loss": 1.506,
|
||
|
|
"mean_token_accuracy": 0.6276157796382904,
|
||
|
|
"num_tokens": 771682.0,
|
||
|
|
"step": 750
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7262822389602661,
|
||
|
|
"epoch": 0.9470365699873896,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 1.5231479495410595e-07,
|
||
|
|
"loss": 1.647,
|
||
|
|
"mean_token_accuracy": 0.5955233871936798,
|
||
|
|
"num_tokens": 772753.0,
|
||
|
|
"step": 751
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6021072268486023,
|
||
|
|
"epoch": 0.9482976040353089,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 1.453297734952097e-07,
|
||
|
|
"loss": 1.5959,
|
||
|
|
"mean_token_accuracy": 0.6032880544662476,
|
||
|
|
"num_tokens": 773759.0,
|
||
|
|
"step": 752
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6947007775306702,
|
||
|
|
"epoch": 0.9495586380832283,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 1.3850752499421917e-07,
|
||
|
|
"loss": 1.7504,
|
||
|
|
"mean_token_accuracy": 0.5882307887077332,
|
||
|
|
"num_tokens": 774762.0,
|
||
|
|
"step": 753
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.670261800289154,
|
||
|
|
"epoch": 0.9508196721311475,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 1.3184816213654304e-07,
|
||
|
|
"loss": 1.6844,
|
||
|
|
"mean_token_accuracy": 0.5984185636043549,
|
||
|
|
"num_tokens": 775875.0,
|
||
|
|
"step": 754
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5203794240951538,
|
||
|
|
"epoch": 0.9520807061790668,
|
||
|
|
"grad_norm": 9.5,
|
||
|
|
"learning_rate": 1.2535179491715453e-07,
|
||
|
|
"loss": 1.3776,
|
||
|
|
"mean_token_accuracy": 0.6262811720371246,
|
||
|
|
"num_tokens": 776881.0,
|
||
|
|
"step": 755
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.4925638437271118,
|
||
|
|
"epoch": 0.9533417402269861,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 1.1901853063877366e-07,
|
||
|
|
"loss": 1.4646,
|
||
|
|
"mean_token_accuracy": 0.6303501725196838,
|
||
|
|
"num_tokens": 777917.0,
|
||
|
|
"step": 756
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6009969115257263,
|
||
|
|
"epoch": 0.9546027742749055,
|
||
|
|
"grad_norm": 9.625,
|
||
|
|
"learning_rate": 1.1284847391009213e-07,
|
||
|
|
"loss": 1.5383,
|
||
|
|
"mean_token_accuracy": 0.6231265664100647,
|
||
|
|
"num_tokens": 778899.0,
|
||
|
|
"step": 757
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6862744092941284,
|
||
|
|
"epoch": 0.9558638083228247,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 1.0684172664404691e-07,
|
||
|
|
"loss": 1.7485,
|
||
|
|
"mean_token_accuracy": 0.5865633487701416,
|
||
|
|
"num_tokens": 779887.0,
|
||
|
|
"step": 758
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.58489990234375,
|
||
|
|
"epoch": 0.957124842370744,
|
||
|
|
"grad_norm": 10.5,
|
||
|
|
"learning_rate": 1.0099838805613604e-07,
|
||
|
|
"loss": 1.5386,
|
||
|
|
"mean_token_accuracy": 0.6137128174304962,
|
||
|
|
"num_tokens": 780852.0,
|
||
|
|
"step": 759
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7339020371437073,
|
||
|
|
"epoch": 0.9583858764186634,
|
||
|
|
"grad_norm": 9.5,
|
||
|
|
"learning_rate": 9.531855466278218e-08,
|
||
|
|
"loss": 1.6334,
|
||
|
|
"mean_token_accuracy": 0.58381187915802,
|
||
|
|
"num_tokens": 782059.0,
|
||
|
|
"step": 760
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5726083517074585,
|
||
|
|
"epoch": 0.9596469104665826,
|
||
|
|
"grad_norm": 9.375,
|
||
|
|
"learning_rate": 8.980232027973268e-08,
|
||
|
|
"loss": 1.5395,
|
||
|
|
"mean_token_accuracy": 0.6192859411239624,
|
||
|
|
"num_tokens": 783180.0,
|
||
|
|
"step": 761
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.622683346271515,
|
||
|
|
"epoch": 0.9609079445145019,
|
||
|
|
"grad_norm": 10.25,
|
||
|
|
"learning_rate": 8.444977602051985e-08,
|
||
|
|
"loss": 1.6612,
|
||
|
|
"mean_token_accuracy": 0.5969159603118896,
|
||
|
|
"num_tokens": 784134.0,
|
||
|
|
"step": 762
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6213579177856445,
|
||
|
|
"epoch": 0.9621689785624212,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 7.92610102949476e-08,
|
||
|
|
"loss": 1.6319,
|
||
|
|
"mean_token_accuracy": 0.6108648478984833,
|
||
|
|
"num_tokens": 785135.0,
|
||
|
|
"step": 763
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5581125020980835,
|
||
|
|
"epoch": 0.9634300126103404,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 7.423610880763265e-08,
|
||
|
|
"loss": 1.4858,
|
||
|
|
"mean_token_accuracy": 0.6188727617263794,
|
||
|
|
"num_tokens": 786079.0,
|
||
|
|
"step": 764
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6480055451393127,
|
||
|
|
"epoch": 0.9646910466582598,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 6.937515455659128e-08,
|
||
|
|
"loss": 1.6334,
|
||
|
|
"mean_token_accuracy": 0.5843265652656555,
|
||
|
|
"num_tokens": 787144.0,
|
||
|
|
"step": 765
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6536738276481628,
|
||
|
|
"epoch": 0.9659520807061791,
|
||
|
|
"grad_norm": 12.1875,
|
||
|
|
"learning_rate": 6.467822783186695e-08,
|
||
|
|
"loss": 1.7709,
|
||
|
|
"mean_token_accuracy": 0.5781002342700958,
|
||
|
|
"num_tokens": 788136.0,
|
||
|
|
"step": 766
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6026808619499207,
|
||
|
|
"epoch": 0.9672131147540983,
|
||
|
|
"grad_norm": 9.25,
|
||
|
|
"learning_rate": 6.014540621420484e-08,
|
||
|
|
"loss": 1.5298,
|
||
|
|
"mean_token_accuracy": 0.6216602921485901,
|
||
|
|
"num_tokens": 789164.0,
|
||
|
|
"step": 767
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5903871059417725,
|
||
|
|
"epoch": 0.9684741488020177,
|
||
|
|
"grad_norm": 10.6875,
|
||
|
|
"learning_rate": 5.577676457376946e-08,
|
||
|
|
"loss": 1.6205,
|
||
|
|
"mean_token_accuracy": 0.6070701479911804,
|
||
|
|
"num_tokens": 790220.0,
|
||
|
|
"step": 768
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6330612301826477,
|
||
|
|
"epoch": 0.969735182849937,
|
||
|
|
"grad_norm": 10.3125,
|
||
|
|
"learning_rate": 5.157237506890789e-08,
|
||
|
|
"loss": 1.5942,
|
||
|
|
"mean_token_accuracy": 0.6184689104557037,
|
||
|
|
"num_tokens": 791182.0,
|
||
|
|
"step": 769
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6491780877113342,
|
||
|
|
"epoch": 0.9709962168978562,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 4.753230714496071e-08,
|
||
|
|
"loss": 1.6282,
|
||
|
|
"mean_token_accuracy": 0.5884484350681305,
|
||
|
|
"num_tokens": 792197.0,
|
||
|
|
"step": 770
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6831308007240295,
|
||
|
|
"epoch": 0.9722572509457755,
|
||
|
|
"grad_norm": 9.5,
|
||
|
|
"learning_rate": 4.365662753311073e-08,
|
||
|
|
"loss": 1.6791,
|
||
|
|
"mean_token_accuracy": 0.5648599565029144,
|
||
|
|
"num_tokens": 793328.0,
|
||
|
|
"step": 771
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7370674014091492,
|
||
|
|
"epoch": 0.9735182849936949,
|
||
|
|
"grad_norm": 10.125,
|
||
|
|
"learning_rate": 3.994540024928273e-08,
|
||
|
|
"loss": 1.6976,
|
||
|
|
"mean_token_accuracy": 0.5698262751102448,
|
||
|
|
"num_tokens": 794509.0,
|
||
|
|
"step": 772
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6178937554359436,
|
||
|
|
"epoch": 0.9747793190416141,
|
||
|
|
"grad_norm": 10.1875,
|
||
|
|
"learning_rate": 3.639868659308765e-08,
|
||
|
|
"loss": 1.5431,
|
||
|
|
"mean_token_accuracy": 0.6045328080654144,
|
||
|
|
"num_tokens": 795558.0,
|
||
|
|
"step": 773
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5817870497703552,
|
||
|
|
"epoch": 0.9760403530895334,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 3.3016545146806746e-08,
|
||
|
|
"loss": 1.4573,
|
||
|
|
"mean_token_accuracy": 0.6176387667655945,
|
||
|
|
"num_tokens": 796677.0,
|
||
|
|
"step": 774
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6503630876541138,
|
||
|
|
"epoch": 0.9773013871374527,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 2.9799031774427888e-08,
|
||
|
|
"loss": 1.5546,
|
||
|
|
"mean_token_accuracy": 0.5988362729549408,
|
||
|
|
"num_tokens": 797760.0,
|
||
|
|
"step": 775
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5911741256713867,
|
||
|
|
"epoch": 0.978562421185372,
|
||
|
|
"grad_norm": 10.6875,
|
||
|
|
"learning_rate": 2.674619962071967e-08,
|
||
|
|
"loss": 1.6086,
|
||
|
|
"mean_token_accuracy": 0.5956297814846039,
|
||
|
|
"num_tokens": 798827.0,
|
||
|
|
"step": 776
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6258515119552612,
|
||
|
|
"epoch": 0.9798234552332913,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 2.3858099110353195e-08,
|
||
|
|
"loss": 1.5973,
|
||
|
|
"mean_token_accuracy": 0.6139645576477051,
|
||
|
|
"num_tokens": 799926.0,
|
||
|
|
"step": 777
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.466359257698059,
|
||
|
|
"epoch": 0.9810844892812106,
|
||
|
|
"grad_norm": 9.0625,
|
||
|
|
"learning_rate": 2.113477794707386e-08,
|
||
|
|
"loss": 1.3776,
|
||
|
|
"mean_token_accuracy": 0.6282052099704742,
|
||
|
|
"num_tokens": 800967.0,
|
||
|
|
"step": 778
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7200924158096313,
|
||
|
|
"epoch": 0.9823455233291298,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.8576281112907547e-08,
|
||
|
|
"loss": 1.6861,
|
||
|
|
"mean_token_accuracy": 0.5817872583866119,
|
||
|
|
"num_tokens": 802064.0,
|
||
|
|
"step": 779
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6186611652374268,
|
||
|
|
"epoch": 0.9836065573770492,
|
||
|
|
"grad_norm": 9.3125,
|
||
|
|
"learning_rate": 1.6182650867421213e-08,
|
||
|
|
"loss": 1.4432,
|
||
|
|
"mean_token_accuracy": 0.6357538104057312,
|
||
|
|
"num_tokens": 803127.0,
|
||
|
|
"step": 780
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6093505024909973,
|
||
|
|
"epoch": 0.9848675914249685,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 1.395392674702567e-08,
|
||
|
|
"loss": 1.558,
|
||
|
|
"mean_token_accuracy": 0.5987730026245117,
|
||
|
|
"num_tokens": 804164.0,
|
||
|
|
"step": 781
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.683523178100586,
|
||
|
|
"epoch": 0.9861286254728878,
|
||
|
|
"grad_norm": 10.6875,
|
||
|
|
"learning_rate": 1.1890145564317224e-08,
|
||
|
|
"loss": 1.6718,
|
||
|
|
"mean_token_accuracy": 0.6047545671463013,
|
||
|
|
"num_tokens": 805104.0,
|
||
|
|
"step": 782
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5347360968589783,
|
||
|
|
"epoch": 0.987389659520807,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 9.99134140747704e-09,
|
||
|
|
"loss": 1.4964,
|
||
|
|
"mean_token_accuracy": 0.6017536818981171,
|
||
|
|
"num_tokens": 806192.0,
|
||
|
|
"step": 783
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6573684811592102,
|
||
|
|
"epoch": 0.9886506935687264,
|
||
|
|
"grad_norm": 10.875,
|
||
|
|
"learning_rate": 8.257545639701603e-09,
|
||
|
|
"loss": 1.6547,
|
||
|
|
"mean_token_accuracy": 0.607554018497467,
|
||
|
|
"num_tokens": 807134.0,
|
||
|
|
"step": 784
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7061243057250977,
|
||
|
|
"epoch": 0.9899117276166457,
|
||
|
|
"grad_norm": 10.4375,
|
||
|
|
"learning_rate": 6.688786898688682e-09,
|
||
|
|
"loss": 1.7362,
|
||
|
|
"mean_token_accuracy": 0.5759716629981995,
|
||
|
|
"num_tokens": 808137.0,
|
||
|
|
"step": 785
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6357958316802979,
|
||
|
|
"epoch": 0.9911727616645649,
|
||
|
|
"grad_norm": 10.5625,
|
||
|
|
"learning_rate": 5.285091096163264e-09,
|
||
|
|
"loss": 1.6065,
|
||
|
|
"mean_token_accuracy": 0.6168047785758972,
|
||
|
|
"num_tokens": 809228.0,
|
||
|
|
"step": 786
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6620115637779236,
|
||
|
|
"epoch": 0.9924337957124842,
|
||
|
|
"grad_norm": 10.9375,
|
||
|
|
"learning_rate": 4.046481417449011e-09,
|
||
|
|
"loss": 1.6609,
|
||
|
|
"mean_token_accuracy": 0.6115907728672028,
|
||
|
|
"num_tokens": 810156.0,
|
||
|
|
"step": 787
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.54367995262146,
|
||
|
|
"epoch": 0.9936948297604036,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 2.972978321084119e-09,
|
||
|
|
"loss": 1.4789,
|
||
|
|
"mean_token_accuracy": 0.6269399225711823,
|
||
|
|
"num_tokens": 811113.0,
|
||
|
|
"step": 788
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.678809642791748,
|
||
|
|
"epoch": 0.9949558638083228,
|
||
|
|
"grad_norm": 10.375,
|
||
|
|
"learning_rate": 2.0645995384882543e-09,
|
||
|
|
"loss": 1.6143,
|
||
|
|
"mean_token_accuracy": 0.6150172054767609,
|
||
|
|
"num_tokens": 812087.0,
|
||
|
|
"step": 789
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5846712589263916,
|
||
|
|
"epoch": 0.9962168978562421,
|
||
|
|
"grad_norm": 9.75,
|
||
|
|
"learning_rate": 1.321360073662792e-09,
|
||
|
|
"loss": 1.5745,
|
||
|
|
"mean_token_accuracy": 0.6093320846557617,
|
||
|
|
"num_tokens": 813055.0,
|
||
|
|
"step": 790
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.7048763632774353,
|
||
|
|
"epoch": 0.9974779319041615,
|
||
|
|
"grad_norm": 9.9375,
|
||
|
|
"learning_rate": 7.432722029498962e-10,
|
||
|
|
"loss": 1.6682,
|
||
|
|
"mean_token_accuracy": 0.57883021235466,
|
||
|
|
"num_tokens": 814098.0,
|
||
|
|
"step": 791
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5479758381843567,
|
||
|
|
"epoch": 0.9987389659520807,
|
||
|
|
"grad_norm": 9.5625,
|
||
|
|
"learning_rate": 3.3034547482269084e-10,
|
||
|
|
"loss": 1.4608,
|
||
|
|
"mean_token_accuracy": 0.6154327094554901,
|
||
|
|
"num_tokens": 815167.0,
|
||
|
|
"step": 792
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.5840736031532288,
|
||
|
|
"epoch": 1.0,
|
||
|
|
"grad_norm": 9.6875,
|
||
|
|
"learning_rate": 8.258670973426697e-11,
|
||
|
|
"loss": 1.6048,
|
||
|
|
"mean_token_accuracy": 0.6037003099918365,
|
||
|
|
"num_tokens": 816243.0,
|
||
|
|
"step": 793
|
||
|
|
}
|
||
|
|
],
|
||
|
|
"logging_steps": 1,
|
||
|
|
"max_steps": 793,
|
||
|
|
"num_input_tokens_seen": 0,
|
||
|
|
"num_train_epochs": 1,
|
||
|
|
"save_steps": 10000,
|
||
|
|
"stateful_callbacks": {
|
||
|
|
"TrainerControl": {
|
||
|
|
"args": {
|
||
|
|
"should_epoch_stop": false,
|
||
|
|
"should_evaluate": false,
|
||
|
|
"should_log": false,
|
||
|
|
"should_save": true,
|
||
|
|
"should_training_stop": true
|
||
|
|
},
|
||
|
|
"attributes": {}
|
||
|
|
}
|
||
|
|
},
|
||
|
|
"total_flos": 1752790975119360.0,
|
||
|
|
"train_batch_size": 1,
|
||
|
|
"trial_name": null,
|
||
|
|
"trial_params": null
|
||
|
|
}
|