Model: ali-elganzory/1.7b-Comma0.1-300BT-longsft_16k-SFT-Tulu3-decontaminated-masked Source: Original Platform
14677 lines
409 KiB
JSON
14677 lines
409 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 2.0,
|
|
"eval_steps": 500,
|
|
"global_step": 14634,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 1.3484375,
|
|
"epoch": 0.0013666803334700013,
|
|
"grad_norm": 0.18985062494867685,
|
|
"learning_rate": 1.0227272727272728e-07,
|
|
"loss": 1.2082,
|
|
"mean_token_accuracy": 0.7082341551780701,
|
|
"num_tokens": 938571.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 1.3328125,
|
|
"epoch": 0.0027333606669400026,
|
|
"grad_norm": 0.20852251011770945,
|
|
"learning_rate": 2.1590909090909094e-07,
|
|
"loss": 1.1377,
|
|
"mean_token_accuracy": 0.7276302456855774,
|
|
"num_tokens": 1829597.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 1.3453125,
|
|
"epoch": 0.004100041000410004,
|
|
"grad_norm": 0.2270463842355176,
|
|
"learning_rate": 3.2954545454545455e-07,
|
|
"loss": 1.1647,
|
|
"mean_token_accuracy": 0.719216239452362,
|
|
"num_tokens": 2756097.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 1.38203125,
|
|
"epoch": 0.005466721333880005,
|
|
"grad_norm": 0.2766819549766482,
|
|
"learning_rate": 4.431818181818182e-07,
|
|
"loss": 1.2038,
|
|
"mean_token_accuracy": 0.7137662470340729,
|
|
"num_tokens": 3667157.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 1.31796875,
|
|
"epoch": 0.006833401667350007,
|
|
"grad_norm": 0.21071110934435447,
|
|
"learning_rate": 5.568181818181818e-07,
|
|
"loss": 1.1471,
|
|
"mean_token_accuracy": 0.7227297127246857,
|
|
"num_tokens": 4593212.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 1.3671875,
|
|
"epoch": 0.008200082000820008,
|
|
"grad_norm": 0.2485072839023889,
|
|
"learning_rate": 6.704545454545456e-07,
|
|
"loss": 1.1526,
|
|
"mean_token_accuracy": 0.7203880786895752,
|
|
"num_tokens": 5559539.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 1.38828125,
|
|
"epoch": 0.00956676233429001,
|
|
"grad_norm": 0.22306898092535607,
|
|
"learning_rate": 7.840909090909092e-07,
|
|
"loss": 1.1759,
|
|
"mean_token_accuracy": 0.7158682346343994,
|
|
"num_tokens": 6518318.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 1.4265625,
|
|
"epoch": 0.01093344266776001,
|
|
"grad_norm": 0.2669629736623019,
|
|
"learning_rate": 8.977272727272728e-07,
|
|
"loss": 1.2306,
|
|
"mean_token_accuracy": 0.7078282952308654,
|
|
"num_tokens": 7462414.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 1.3609375,
|
|
"epoch": 0.012300123001230012,
|
|
"grad_norm": 0.18611384623814797,
|
|
"learning_rate": 1.0113636363636365e-06,
|
|
"loss": 1.1334,
|
|
"mean_token_accuracy": 0.7211917698383331,
|
|
"num_tokens": 8328147.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 1.3640625,
|
|
"epoch": 0.013666803334700014,
|
|
"grad_norm": 0.18994471551048392,
|
|
"learning_rate": 1.125e-06,
|
|
"loss": 1.1706,
|
|
"mean_token_accuracy": 0.7188221693038941,
|
|
"num_tokens": 9256532.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 1.3390625,
|
|
"epoch": 0.015033483668170014,
|
|
"grad_norm": 0.21527198075936327,
|
|
"learning_rate": 1.2386363636363638e-06,
|
|
"loss": 1.111,
|
|
"mean_token_accuracy": 0.7293626129627228,
|
|
"num_tokens": 10191350.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 1.34765625,
|
|
"epoch": 0.016400164001640016,
|
|
"grad_norm": 0.1852421699268431,
|
|
"learning_rate": 1.3522727272727273e-06,
|
|
"loss": 1.1499,
|
|
"mean_token_accuracy": 0.7229038953781128,
|
|
"num_tokens": 11096376.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 1.34453125,
|
|
"epoch": 0.017766844335110017,
|
|
"grad_norm": 0.1809870856476238,
|
|
"learning_rate": 1.465909090909091e-06,
|
|
"loss": 1.1287,
|
|
"mean_token_accuracy": 0.7259012579917907,
|
|
"num_tokens": 12025075.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 1.36953125,
|
|
"epoch": 0.01913352466858002,
|
|
"grad_norm": 0.1745922753450775,
|
|
"learning_rate": 1.5795454545454547e-06,
|
|
"loss": 1.1054,
|
|
"mean_token_accuracy": 0.7305459260940552,
|
|
"num_tokens": 12961701.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 1.3828125,
|
|
"epoch": 0.02050020500205002,
|
|
"grad_norm": 0.18181828149285356,
|
|
"learning_rate": 1.6931818181818182e-06,
|
|
"loss": 1.16,
|
|
"mean_token_accuracy": 0.7231054306030273,
|
|
"num_tokens": 13905979.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 1.3609375,
|
|
"epoch": 0.02186688533552002,
|
|
"grad_norm": 0.18319953407954068,
|
|
"learning_rate": 1.8068181818181822e-06,
|
|
"loss": 1.1532,
|
|
"mean_token_accuracy": 0.7226971566677094,
|
|
"num_tokens": 14850397.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 1.38984375,
|
|
"epoch": 0.023233565668990024,
|
|
"grad_norm": 0.24875925859798145,
|
|
"learning_rate": 1.9204545454545457e-06,
|
|
"loss": 1.1451,
|
|
"mean_token_accuracy": 0.7248633325099945,
|
|
"num_tokens": 15703108.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 1.33046875,
|
|
"epoch": 0.024600246002460024,
|
|
"grad_norm": 0.14843810212459596,
|
|
"learning_rate": 2.034090909090909e-06,
|
|
"loss": 1.125,
|
|
"mean_token_accuracy": 0.7241590142250061,
|
|
"num_tokens": 16615464.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 1.3703125,
|
|
"epoch": 0.025966926335930025,
|
|
"grad_norm": 0.16952995849205368,
|
|
"learning_rate": 2.147727272727273e-06,
|
|
"loss": 1.1528,
|
|
"mean_token_accuracy": 0.7190424680709839,
|
|
"num_tokens": 17581557.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 1.39296875,
|
|
"epoch": 0.02733360666940003,
|
|
"grad_norm": 0.14114693704060766,
|
|
"learning_rate": 2.2613636363636366e-06,
|
|
"loss": 1.164,
|
|
"mean_token_accuracy": 0.7190779626369477,
|
|
"num_tokens": 18451335.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 1.3734375,
|
|
"epoch": 0.02870028700287003,
|
|
"grad_norm": 0.16756717480407715,
|
|
"learning_rate": 2.375e-06,
|
|
"loss": 1.1355,
|
|
"mean_token_accuracy": 0.7214107036590576,
|
|
"num_tokens": 19392109.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 1.39140625,
|
|
"epoch": 0.03006696733634003,
|
|
"grad_norm": 0.1991019802143163,
|
|
"learning_rate": 2.488636363636364e-06,
|
|
"loss": 1.1194,
|
|
"mean_token_accuracy": 0.7276308953762054,
|
|
"num_tokens": 20323700.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 1.32109375,
|
|
"epoch": 0.03143364766981003,
|
|
"grad_norm": 0.16820024071704165,
|
|
"learning_rate": 2.6022727272727276e-06,
|
|
"loss": 1.062,
|
|
"mean_token_accuracy": 0.738685566186905,
|
|
"num_tokens": 21263745.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 1.36640625,
|
|
"epoch": 0.03280032800328003,
|
|
"grad_norm": 0.17065201695766738,
|
|
"learning_rate": 2.715909090909091e-06,
|
|
"loss": 1.1081,
|
|
"mean_token_accuracy": 0.7288391768932343,
|
|
"num_tokens": 22195458.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 1.3625,
|
|
"epoch": 0.034167008336750036,
|
|
"grad_norm": 0.15505298597091147,
|
|
"learning_rate": 2.829545454545455e-06,
|
|
"loss": 1.1119,
|
|
"mean_token_accuracy": 0.7297877728939056,
|
|
"num_tokens": 23115090.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 1.3390625,
|
|
"epoch": 0.03553368867022003,
|
|
"grad_norm": 0.12319444912080854,
|
|
"learning_rate": 2.9431818181818185e-06,
|
|
"loss": 1.0796,
|
|
"mean_token_accuracy": 0.7368321478366852,
|
|
"num_tokens": 24043510.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 1.34765625,
|
|
"epoch": 0.03690036900369004,
|
|
"grad_norm": 0.1329968120576724,
|
|
"learning_rate": 3.056818181818182e-06,
|
|
"loss": 1.0716,
|
|
"mean_token_accuracy": 0.737455952167511,
|
|
"num_tokens": 24975455.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 1.3390625,
|
|
"epoch": 0.03826704933716004,
|
|
"grad_norm": 0.1382418494646007,
|
|
"learning_rate": 3.1704545454545456e-06,
|
|
"loss": 1.0868,
|
|
"mean_token_accuracy": 0.7330326497554779,
|
|
"num_tokens": 25915880.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 1.35625,
|
|
"epoch": 0.03963372967063004,
|
|
"grad_norm": 0.13435172725361247,
|
|
"learning_rate": 3.2840909090909095e-06,
|
|
"loss": 1.1075,
|
|
"mean_token_accuracy": 0.7294231593608856,
|
|
"num_tokens": 26836649.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 1.33046875,
|
|
"epoch": 0.04100041000410004,
|
|
"grad_norm": 0.12645709966031257,
|
|
"learning_rate": 3.397727272727273e-06,
|
|
"loss": 1.0791,
|
|
"mean_token_accuracy": 0.7321500301361084,
|
|
"num_tokens": 27758649.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 1.3734375,
|
|
"epoch": 0.042367090337570044,
|
|
"grad_norm": 0.15760532735644248,
|
|
"learning_rate": 3.5113636363636365e-06,
|
|
"loss": 1.1018,
|
|
"mean_token_accuracy": 0.7333879888057708,
|
|
"num_tokens": 28704182.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 1.334375,
|
|
"epoch": 0.04373377067104004,
|
|
"grad_norm": 0.11771073920520574,
|
|
"learning_rate": 3.625e-06,
|
|
"loss": 1.0713,
|
|
"mean_token_accuracy": 0.7341139793395997,
|
|
"num_tokens": 29605445.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 1.43828125,
|
|
"epoch": 0.045100451004510045,
|
|
"grad_norm": 0.13210491713831654,
|
|
"learning_rate": 3.7386363636363635e-06,
|
|
"loss": 1.1622,
|
|
"mean_token_accuracy": 0.7225410223007203,
|
|
"num_tokens": 30515940.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 1.30625,
|
|
"epoch": 0.04646713133798005,
|
|
"grad_norm": 0.13370799813814907,
|
|
"learning_rate": 3.852272727272728e-06,
|
|
"loss": 1.0542,
|
|
"mean_token_accuracy": 0.7386926770210266,
|
|
"num_tokens": 31408267.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 1.28203125,
|
|
"epoch": 0.047833811671450045,
|
|
"grad_norm": 0.17144289038319954,
|
|
"learning_rate": 3.965909090909091e-06,
|
|
"loss": 1.0302,
|
|
"mean_token_accuracy": 0.7458747506141663,
|
|
"num_tokens": 32349688.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 1.36015625,
|
|
"epoch": 0.04920049200492005,
|
|
"grad_norm": 0.11933807809108442,
|
|
"learning_rate": 4.079545454545455e-06,
|
|
"loss": 1.1194,
|
|
"mean_token_accuracy": 0.7285032987594604,
|
|
"num_tokens": 33292692.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 1.3765625,
|
|
"epoch": 0.05056717233839005,
|
|
"grad_norm": 0.14745823306653072,
|
|
"learning_rate": 4.193181818181819e-06,
|
|
"loss": 1.0964,
|
|
"mean_token_accuracy": 0.7319888472557068,
|
|
"num_tokens": 34223187.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 1.3921875,
|
|
"epoch": 0.05193385267186005,
|
|
"grad_norm": 0.14065592262219465,
|
|
"learning_rate": 4.306818181818182e-06,
|
|
"loss": 1.1271,
|
|
"mean_token_accuracy": 0.7279395937919617,
|
|
"num_tokens": 35129123.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 1.3140625,
|
|
"epoch": 0.05330053300533005,
|
|
"grad_norm": 0.12605314407020618,
|
|
"learning_rate": 4.420454545454546e-06,
|
|
"loss": 1.0549,
|
|
"mean_token_accuracy": 0.7398518800735474,
|
|
"num_tokens": 36084818.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 1.321875,
|
|
"epoch": 0.05466721333880006,
|
|
"grad_norm": 0.11346806729692653,
|
|
"learning_rate": 4.53409090909091e-06,
|
|
"loss": 1.0378,
|
|
"mean_token_accuracy": 0.7431781530380249,
|
|
"num_tokens": 36969815.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 1.3921875,
|
|
"epoch": 0.05603389367227005,
|
|
"grad_norm": 0.1322721949890684,
|
|
"learning_rate": 4.647727272727273e-06,
|
|
"loss": 1.0989,
|
|
"mean_token_accuracy": 0.7296334505081177,
|
|
"num_tokens": 37874200.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 1.32734375,
|
|
"epoch": 0.05740057400574006,
|
|
"grad_norm": 0.12233190315700458,
|
|
"learning_rate": 4.761363636363637e-06,
|
|
"loss": 1.0491,
|
|
"mean_token_accuracy": 0.7423379242420196,
|
|
"num_tokens": 38814930.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 1.31328125,
|
|
"epoch": 0.05876725433921006,
|
|
"grad_norm": 0.14938797191620398,
|
|
"learning_rate": 4.875e-06,
|
|
"loss": 1.0216,
|
|
"mean_token_accuracy": 0.7463705360889434,
|
|
"num_tokens": 39757293.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 1.35,
|
|
"epoch": 0.06013393467268006,
|
|
"grad_norm": 0.10966077132276654,
|
|
"learning_rate": 4.988636363636364e-06,
|
|
"loss": 1.1293,
|
|
"mean_token_accuracy": 0.7256799042224884,
|
|
"num_tokens": 40713143.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 1.365625,
|
|
"epoch": 0.06150061500615006,
|
|
"grad_norm": 0.13366731022341435,
|
|
"learning_rate": 4.996829646329435e-06,
|
|
"loss": 1.1034,
|
|
"mean_token_accuracy": 0.7289641916751861,
|
|
"num_tokens": 41638884.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 1.40703125,
|
|
"epoch": 0.06286729533962006,
|
|
"grad_norm": 0.12146943771813255,
|
|
"learning_rate": 4.993307031139919e-06,
|
|
"loss": 1.1233,
|
|
"mean_token_accuracy": 0.72938232421875,
|
|
"num_tokens": 42583453.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 1.35546875,
|
|
"epoch": 0.06423397567309007,
|
|
"grad_norm": 0.11898842454742775,
|
|
"learning_rate": 4.989784415950402e-06,
|
|
"loss": 1.115,
|
|
"mean_token_accuracy": 0.7284761071205139,
|
|
"num_tokens": 43522757.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 1.42109375,
|
|
"epoch": 0.06560065600656007,
|
|
"grad_norm": 0.13999490273850712,
|
|
"learning_rate": 4.986261800760885e-06,
|
|
"loss": 1.1552,
|
|
"mean_token_accuracy": 0.7221405744552613,
|
|
"num_tokens": 44444147.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 1.34453125,
|
|
"epoch": 0.06696733634003006,
|
|
"grad_norm": 0.12032666930182966,
|
|
"learning_rate": 4.9827391855713685e-06,
|
|
"loss": 1.0919,
|
|
"mean_token_accuracy": 0.7360530197620392,
|
|
"num_tokens": 45400305.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 1.35703125,
|
|
"epoch": 0.06833401667350007,
|
|
"grad_norm": 0.12408397696628552,
|
|
"learning_rate": 4.979216570381852e-06,
|
|
"loss": 1.041,
|
|
"mean_token_accuracy": 0.7398593127727509,
|
|
"num_tokens": 46325614.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 1.35234375,
|
|
"epoch": 0.06970069700697007,
|
|
"grad_norm": 0.1708522252763973,
|
|
"learning_rate": 4.975693955192335e-06,
|
|
"loss": 1.079,
|
|
"mean_token_accuracy": 0.7331842303276062,
|
|
"num_tokens": 47238170.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 1.3765625,
|
|
"epoch": 0.07106737734044007,
|
|
"grad_norm": 0.1695460532258365,
|
|
"learning_rate": 4.972171340002819e-06,
|
|
"loss": 1.1052,
|
|
"mean_token_accuracy": 0.7327855408191681,
|
|
"num_tokens": 48194911.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 1.38828125,
|
|
"epoch": 0.07243405767391008,
|
|
"grad_norm": 0.1269354201286178,
|
|
"learning_rate": 4.968648724813302e-06,
|
|
"loss": 1.0978,
|
|
"mean_token_accuracy": 0.734226393699646,
|
|
"num_tokens": 49112005.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 1.340625,
|
|
"epoch": 0.07380073800738007,
|
|
"grad_norm": 0.13978779121040413,
|
|
"learning_rate": 4.965126109623785e-06,
|
|
"loss": 1.0872,
|
|
"mean_token_accuracy": 0.7336160957813262,
|
|
"num_tokens": 50015461.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 1.36015625,
|
|
"epoch": 0.07516741834085007,
|
|
"grad_norm": 0.1271231432369859,
|
|
"learning_rate": 4.961603494434268e-06,
|
|
"loss": 1.1092,
|
|
"mean_token_accuracy": 0.7317265272140503,
|
|
"num_tokens": 50935643.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 1.325,
|
|
"epoch": 0.07653409867432008,
|
|
"grad_norm": 0.1254444841600739,
|
|
"learning_rate": 4.958080879244752e-06,
|
|
"loss": 1.04,
|
|
"mean_token_accuracy": 0.7416125357151031,
|
|
"num_tokens": 51878002.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 1.32109375,
|
|
"epoch": 0.07790077900779008,
|
|
"grad_norm": 0.1304209143713833,
|
|
"learning_rate": 4.954558264055234e-06,
|
|
"loss": 1.0828,
|
|
"mean_token_accuracy": 0.7320802330970764,
|
|
"num_tokens": 52758343.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 1.3046875,
|
|
"epoch": 0.07926745934126007,
|
|
"grad_norm": 0.17839339761086323,
|
|
"learning_rate": 4.951035648865719e-06,
|
|
"loss": 1.0454,
|
|
"mean_token_accuracy": 0.7421370029449463,
|
|
"num_tokens": 53650442.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 1.31875,
|
|
"epoch": 0.08063413967473008,
|
|
"grad_norm": 0.1288958293883335,
|
|
"learning_rate": 4.9475130336762015e-06,
|
|
"loss": 1.0456,
|
|
"mean_token_accuracy": 0.7404577732086182,
|
|
"num_tokens": 54555977.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 1.365625,
|
|
"epoch": 0.08200082000820008,
|
|
"grad_norm": 0.1301090096096535,
|
|
"learning_rate": 4.943990418486685e-06,
|
|
"loss": 1.0773,
|
|
"mean_token_accuracy": 0.732443630695343,
|
|
"num_tokens": 55522236.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 1.34765625,
|
|
"epoch": 0.08336750034167008,
|
|
"grad_norm": 0.11886826394044901,
|
|
"learning_rate": 4.9404678032971685e-06,
|
|
"loss": 1.1014,
|
|
"mean_token_accuracy": 0.7344374895095825,
|
|
"num_tokens": 56427197.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 1.30546875,
|
|
"epoch": 0.08473418067514009,
|
|
"grad_norm": 0.12223515949631353,
|
|
"learning_rate": 4.936945188107651e-06,
|
|
"loss": 1.083,
|
|
"mean_token_accuracy": 0.7370599210262299,
|
|
"num_tokens": 57362921.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 1.290625,
|
|
"epoch": 0.08610086100861009,
|
|
"grad_norm": 0.12301382614209318,
|
|
"learning_rate": 4.933422572918135e-06,
|
|
"loss": 1.041,
|
|
"mean_token_accuracy": 0.74444540143013,
|
|
"num_tokens": 58256680.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 1.325,
|
|
"epoch": 0.08746754134208008,
|
|
"grad_norm": 0.1215695112573226,
|
|
"learning_rate": 4.929899957728618e-06,
|
|
"loss": 1.0601,
|
|
"mean_token_accuracy": 0.7396647095680237,
|
|
"num_tokens": 59193508.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 1.33203125,
|
|
"epoch": 0.08883422167555009,
|
|
"grad_norm": 0.13678458961367831,
|
|
"learning_rate": 4.926377342539102e-06,
|
|
"loss": 1.0518,
|
|
"mean_token_accuracy": 0.7393244922161102,
|
|
"num_tokens": 60108420.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 1.30390625,
|
|
"epoch": 0.09020090200902009,
|
|
"grad_norm": 0.12741475124216325,
|
|
"learning_rate": 4.922854727349585e-06,
|
|
"loss": 1.0139,
|
|
"mean_token_accuracy": 0.7470105290412903,
|
|
"num_tokens": 61034298.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 1.3484375,
|
|
"epoch": 0.09156758234249009,
|
|
"grad_norm": 0.11502289446420451,
|
|
"learning_rate": 4.919332112160068e-06,
|
|
"loss": 1.0523,
|
|
"mean_token_accuracy": 0.7422212064266205,
|
|
"num_tokens": 61983537.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 1.31640625,
|
|
"epoch": 0.0929342626759601,
|
|
"grad_norm": 0.11373855950611077,
|
|
"learning_rate": 4.915809496970551e-06,
|
|
"loss": 1.0565,
|
|
"mean_token_accuracy": 0.738726007938385,
|
|
"num_tokens": 62935993.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 1.421875,
|
|
"epoch": 0.0943009430094301,
|
|
"grad_norm": 0.12639533473384007,
|
|
"learning_rate": 4.912286881781035e-06,
|
|
"loss": 1.1764,
|
|
"mean_token_accuracy": 0.7161698281764984,
|
|
"num_tokens": 63853924.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 1.325,
|
|
"epoch": 0.09566762334290009,
|
|
"grad_norm": 0.12516916776515868,
|
|
"learning_rate": 4.908764266591518e-06,
|
|
"loss": 1.0347,
|
|
"mean_token_accuracy": 0.7443830311298371,
|
|
"num_tokens": 64763931.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 1.34140625,
|
|
"epoch": 0.0970343036763701,
|
|
"grad_norm": 0.16217430700842417,
|
|
"learning_rate": 4.9052416514020015e-06,
|
|
"loss": 1.0438,
|
|
"mean_token_accuracy": 0.7426583886146545,
|
|
"num_tokens": 65673140.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 1.2984375,
|
|
"epoch": 0.0984009840098401,
|
|
"grad_norm": 0.12462367837601411,
|
|
"learning_rate": 4.901719036212484e-06,
|
|
"loss": 1.0449,
|
|
"mean_token_accuracy": 0.7407660365104676,
|
|
"num_tokens": 66640391.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 1.29921875,
|
|
"epoch": 0.0997676643433101,
|
|
"grad_norm": 0.11963787613078337,
|
|
"learning_rate": 4.898196421022968e-06,
|
|
"loss": 1.0303,
|
|
"mean_token_accuracy": 0.7460336744785309,
|
|
"num_tokens": 67563282.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 1.29296875,
|
|
"epoch": 0.1011343446767801,
|
|
"grad_norm": 0.17573037959614024,
|
|
"learning_rate": 4.894673805833451e-06,
|
|
"loss": 0.9937,
|
|
"mean_token_accuracy": 0.7508179068565368,
|
|
"num_tokens": 68416165.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 1.32421875,
|
|
"epoch": 0.1025010250102501,
|
|
"grad_norm": 0.13963535921696094,
|
|
"learning_rate": 4.891151190643935e-06,
|
|
"loss": 1.0775,
|
|
"mean_token_accuracy": 0.7370628952980042,
|
|
"num_tokens": 69336094.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 1.32421875,
|
|
"epoch": 0.1038677053437201,
|
|
"grad_norm": 0.11900234257399574,
|
|
"learning_rate": 4.8876285754544175e-06,
|
|
"loss": 1.0556,
|
|
"mean_token_accuracy": 0.7388252973556518,
|
|
"num_tokens": 70292744.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 1.3796875,
|
|
"epoch": 0.10523438567719011,
|
|
"grad_norm": 0.12820065300233344,
|
|
"learning_rate": 4.884105960264901e-06,
|
|
"loss": 1.1122,
|
|
"mean_token_accuracy": 0.7311216354370117,
|
|
"num_tokens": 71192370.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 1.315625,
|
|
"epoch": 0.1066010660106601,
|
|
"grad_norm": 0.115365847395076,
|
|
"learning_rate": 4.880583345075385e-06,
|
|
"loss": 1.0497,
|
|
"mean_token_accuracy": 0.7424078047275543,
|
|
"num_tokens": 72109962.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 1.28125,
|
|
"epoch": 0.1079677463441301,
|
|
"grad_norm": 0.10973735433580542,
|
|
"learning_rate": 4.877060729885867e-06,
|
|
"loss": 0.996,
|
|
"mean_token_accuracy": 0.7503701865673065,
|
|
"num_tokens": 73022537.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 1.3046875,
|
|
"epoch": 0.10933442667760011,
|
|
"grad_norm": 0.1179352824279908,
|
|
"learning_rate": 4.873538114696351e-06,
|
|
"loss": 1.0276,
|
|
"mean_token_accuracy": 0.7442216396331787,
|
|
"num_tokens": 73932084.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 1.3234375,
|
|
"epoch": 0.11070110701107011,
|
|
"grad_norm": 0.15045388265610252,
|
|
"learning_rate": 4.870015499506834e-06,
|
|
"loss": 1.034,
|
|
"mean_token_accuracy": 0.74718057513237,
|
|
"num_tokens": 74843608.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 1.32578125,
|
|
"epoch": 0.1120677873445401,
|
|
"grad_norm": 0.10647498824554359,
|
|
"learning_rate": 4.866492884317318e-06,
|
|
"loss": 1.0489,
|
|
"mean_token_accuracy": 0.7395424365997314,
|
|
"num_tokens": 75769415.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 1.284375,
|
|
"epoch": 0.11343446767801012,
|
|
"grad_norm": 0.14178462491616653,
|
|
"learning_rate": 4.862970269127801e-06,
|
|
"loss": 1.0233,
|
|
"mean_token_accuracy": 0.7494938552379609,
|
|
"num_tokens": 76676625.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 1.3421875,
|
|
"epoch": 0.11480114801148011,
|
|
"grad_norm": 0.14078517248644,
|
|
"learning_rate": 4.859447653938284e-06,
|
|
"loss": 1.0752,
|
|
"mean_token_accuracy": 0.7356143593788147,
|
|
"num_tokens": 77575710.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 1.32421875,
|
|
"epoch": 0.11616782834495011,
|
|
"grad_norm": 0.11007857177462886,
|
|
"learning_rate": 4.855925038748768e-06,
|
|
"loss": 1.1027,
|
|
"mean_token_accuracy": 0.7331833839416504,
|
|
"num_tokens": 78573992.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 1.3359375,
|
|
"epoch": 0.11753450867842012,
|
|
"grad_norm": 0.1298214792915592,
|
|
"learning_rate": 4.852402423559251e-06,
|
|
"loss": 1.0628,
|
|
"mean_token_accuracy": 0.7395843982696533,
|
|
"num_tokens": 79532329.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 1.346875,
|
|
"epoch": 0.11890118901189012,
|
|
"grad_norm": 0.11836810050132628,
|
|
"learning_rate": 4.848879808369734e-06,
|
|
"loss": 1.1061,
|
|
"mean_token_accuracy": 0.732420539855957,
|
|
"num_tokens": 80438221.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 1.30234375,
|
|
"epoch": 0.12026786934536011,
|
|
"grad_norm": 0.11680066314093361,
|
|
"learning_rate": 4.8453571931802175e-06,
|
|
"loss": 1.0054,
|
|
"mean_token_accuracy": 0.7499641895294189,
|
|
"num_tokens": 81376762.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 1.26953125,
|
|
"epoch": 0.12163454967883013,
|
|
"grad_norm": 0.1110379987594711,
|
|
"learning_rate": 4.8418345779907e-06,
|
|
"loss": 1.0634,
|
|
"mean_token_accuracy": 0.7402011275291442,
|
|
"num_tokens": 82272468.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 1.365625,
|
|
"epoch": 0.12300123001230012,
|
|
"grad_norm": 0.12494660130291714,
|
|
"learning_rate": 4.838311962801184e-06,
|
|
"loss": 1.0829,
|
|
"mean_token_accuracy": 0.7355345189571381,
|
|
"num_tokens": 83215846.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 1.3203125,
|
|
"epoch": 0.12436791034577012,
|
|
"grad_norm": 0.13043630445376622,
|
|
"learning_rate": 4.834789347611667e-06,
|
|
"loss": 1.0662,
|
|
"mean_token_accuracy": 0.7377242922782898,
|
|
"num_tokens": 84093524.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 1.34296875,
|
|
"epoch": 0.12573459067924012,
|
|
"grad_norm": 0.11610628557106381,
|
|
"learning_rate": 4.831266732422151e-06,
|
|
"loss": 1.0555,
|
|
"mean_token_accuracy": 0.743509042263031,
|
|
"num_tokens": 84978921.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 1.24296875,
|
|
"epoch": 0.12710127101271013,
|
|
"grad_norm": 0.12322132364438138,
|
|
"learning_rate": 4.827744117232634e-06,
|
|
"loss": 0.9722,
|
|
"mean_token_accuracy": 0.7566001236438751,
|
|
"num_tokens": 85868292.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 1.28828125,
|
|
"epoch": 0.12846795134618014,
|
|
"grad_norm": 0.1329091106161445,
|
|
"learning_rate": 4.824221502043117e-06,
|
|
"loss": 0.9744,
|
|
"mean_token_accuracy": 0.7544209420681,
|
|
"num_tokens": 86759570.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 1.34296875,
|
|
"epoch": 0.12983463167965012,
|
|
"grad_norm": 0.14943948476035543,
|
|
"learning_rate": 4.820698886853601e-06,
|
|
"loss": 1.0765,
|
|
"mean_token_accuracy": 0.7332414031028748,
|
|
"num_tokens": 87742990.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 1.340625,
|
|
"epoch": 0.13120131201312013,
|
|
"grad_norm": 0.11520897030568328,
|
|
"learning_rate": 4.817176271664084e-06,
|
|
"loss": 1.0496,
|
|
"mean_token_accuracy": 0.740620094537735,
|
|
"num_tokens": 88685843.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 1.27890625,
|
|
"epoch": 0.13256799234659014,
|
|
"grad_norm": 0.11143770769075866,
|
|
"learning_rate": 4.813653656474567e-06,
|
|
"loss": 1.004,
|
|
"mean_token_accuracy": 0.7506394565105439,
|
|
"num_tokens": 89560923.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 1.32734375,
|
|
"epoch": 0.13393467268006012,
|
|
"grad_norm": 0.1360270570761917,
|
|
"learning_rate": 4.8101310412850505e-06,
|
|
"loss": 1.0453,
|
|
"mean_token_accuracy": 0.7406519055366516,
|
|
"num_tokens": 90477434.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 1.284375,
|
|
"epoch": 0.13530135301353013,
|
|
"grad_norm": 0.11742952225115637,
|
|
"learning_rate": 4.806608426095534e-06,
|
|
"loss": 1.0264,
|
|
"mean_token_accuracy": 0.7468135714530945,
|
|
"num_tokens": 91445593.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 1.29375,
|
|
"epoch": 0.13666803334700015,
|
|
"grad_norm": 0.12583744900832727,
|
|
"learning_rate": 4.803085810906017e-06,
|
|
"loss": 1.0222,
|
|
"mean_token_accuracy": 0.7445312380790711,
|
|
"num_tokens": 92372246.0,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"entropy": 1.3640625,
|
|
"epoch": 0.13803471368047013,
|
|
"grad_norm": 0.12483441772607323,
|
|
"learning_rate": 4.7995631957165e-06,
|
|
"loss": 1.0731,
|
|
"mean_token_accuracy": 0.7367709994316101,
|
|
"num_tokens": 93322975.0,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"entropy": 1.26484375,
|
|
"epoch": 0.13940139401394014,
|
|
"grad_norm": 0.11954386727863904,
|
|
"learning_rate": 4.796040580526984e-06,
|
|
"loss": 0.9834,
|
|
"mean_token_accuracy": 0.7547881245613098,
|
|
"num_tokens": 94243005.0,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"entropy": 1.30390625,
|
|
"epoch": 0.14076807434741015,
|
|
"grad_norm": 0.13253832864135237,
|
|
"learning_rate": 4.792517965337467e-06,
|
|
"loss": 1.0278,
|
|
"mean_token_accuracy": 0.7474592387676239,
|
|
"num_tokens": 95128367.0,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"entropy": 1.28828125,
|
|
"epoch": 0.14213475468088013,
|
|
"grad_norm": 0.11704466058027525,
|
|
"learning_rate": 4.78899535014795e-06,
|
|
"loss": 0.9669,
|
|
"mean_token_accuracy": 0.7578248500823974,
|
|
"num_tokens": 96052977.0,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"entropy": 1.29296875,
|
|
"epoch": 0.14350143501435014,
|
|
"grad_norm": 0.11834791861401071,
|
|
"learning_rate": 4.785472734958434e-06,
|
|
"loss": 1.0091,
|
|
"mean_token_accuracy": 0.7483573615550995,
|
|
"num_tokens": 96997179.0,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"entropy": 1.3203125,
|
|
"epoch": 0.14486811534782015,
|
|
"grad_norm": 0.11405592671713007,
|
|
"learning_rate": 4.781950119768916e-06,
|
|
"loss": 1.0162,
|
|
"mean_token_accuracy": 0.7469078779220581,
|
|
"num_tokens": 97934565.0,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"entropy": 1.27734375,
|
|
"epoch": 0.14623479568129014,
|
|
"grad_norm": 0.11338231811817162,
|
|
"learning_rate": 4.778427504579401e-06,
|
|
"loss": 0.9725,
|
|
"mean_token_accuracy": 0.7564100384712219,
|
|
"num_tokens": 98864499.0,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"entropy": 1.259375,
|
|
"epoch": 0.14760147601476015,
|
|
"grad_norm": 0.10775879564935999,
|
|
"learning_rate": 4.774904889389883e-06,
|
|
"loss": 1.0097,
|
|
"mean_token_accuracy": 0.7490379095077515,
|
|
"num_tokens": 99822130.0,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"entropy": 1.278125,
|
|
"epoch": 0.14896815634823016,
|
|
"grad_norm": 0.12888154125333748,
|
|
"learning_rate": 4.771382274200367e-06,
|
|
"loss": 1.0362,
|
|
"mean_token_accuracy": 0.7446874439716339,
|
|
"num_tokens": 100744706.0,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"entropy": 1.3328125,
|
|
"epoch": 0.15033483668170014,
|
|
"grad_norm": 0.11552795265560707,
|
|
"learning_rate": 4.76785965901085e-06,
|
|
"loss": 1.0916,
|
|
"mean_token_accuracy": 0.7326217114925384,
|
|
"num_tokens": 101705020.0,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"entropy": 1.35625,
|
|
"epoch": 0.15170151701517015,
|
|
"grad_norm": 0.1297827623524877,
|
|
"learning_rate": 4.764337043821333e-06,
|
|
"loss": 1.1022,
|
|
"mean_token_accuracy": 0.7319262981414795,
|
|
"num_tokens": 102616456.0,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"entropy": 1.33046875,
|
|
"epoch": 0.15306819734864016,
|
|
"grad_norm": 0.12170723091503043,
|
|
"learning_rate": 4.760814428631817e-06,
|
|
"loss": 1.0321,
|
|
"mean_token_accuracy": 0.744338047504425,
|
|
"num_tokens": 103534288.0,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"entropy": 1.3015625,
|
|
"epoch": 0.15443487768211014,
|
|
"grad_norm": 0.116648217806353,
|
|
"learning_rate": 4.7572918134423e-06,
|
|
"loss": 1.0283,
|
|
"mean_token_accuracy": 0.7459810614585877,
|
|
"num_tokens": 104412112.0,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"entropy": 1.25078125,
|
|
"epoch": 0.15580155801558015,
|
|
"grad_norm": 0.11223190893274294,
|
|
"learning_rate": 4.753769198252783e-06,
|
|
"loss": 0.9889,
|
|
"mean_token_accuracy": 0.7522266507148743,
|
|
"num_tokens": 105339912.0,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"entropy": 1.36328125,
|
|
"epoch": 0.15716823834905017,
|
|
"grad_norm": 0.1407538174600619,
|
|
"learning_rate": 4.7502465830632665e-06,
|
|
"loss": 1.0452,
|
|
"mean_token_accuracy": 0.7427780389785766,
|
|
"num_tokens": 106300822.0,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"entropy": 1.253125,
|
|
"epoch": 0.15853491868252015,
|
|
"grad_norm": 0.11372354788777642,
|
|
"learning_rate": 4.74672396787375e-06,
|
|
"loss": 0.9913,
|
|
"mean_token_accuracy": 0.7531047940254212,
|
|
"num_tokens": 107234943.0,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"entropy": 1.2765625,
|
|
"epoch": 0.15990159901599016,
|
|
"grad_norm": 0.10529376871738702,
|
|
"learning_rate": 4.743201352684233e-06,
|
|
"loss": 0.9857,
|
|
"mean_token_accuracy": 0.7536941409111023,
|
|
"num_tokens": 108169288.0,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"entropy": 1.3,
|
|
"epoch": 0.16126827934946017,
|
|
"grad_norm": 0.12576092037328673,
|
|
"learning_rate": 4.739678737494716e-06,
|
|
"loss": 1.0283,
|
|
"mean_token_accuracy": 0.7477025508880615,
|
|
"num_tokens": 109066252.0,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"entropy": 1.32265625,
|
|
"epoch": 0.16263495968293015,
|
|
"grad_norm": 0.11110263318847115,
|
|
"learning_rate": 4.7361561223052e-06,
|
|
"loss": 1.0203,
|
|
"mean_token_accuracy": 0.7440137207508087,
|
|
"num_tokens": 109981241.0,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"entropy": 1.271875,
|
|
"epoch": 0.16400164001640016,
|
|
"grad_norm": 0.13260303846263577,
|
|
"learning_rate": 4.7326335071156834e-06,
|
|
"loss": 1.0084,
|
|
"mean_token_accuracy": 0.7518280148506165,
|
|
"num_tokens": 110887025.0,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"entropy": 1.30703125,
|
|
"epoch": 0.16536832034987017,
|
|
"grad_norm": 0.11829679982055742,
|
|
"learning_rate": 4.729110891926166e-06,
|
|
"loss": 1.0468,
|
|
"mean_token_accuracy": 0.74088836312294,
|
|
"num_tokens": 111835136.0,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"entropy": 1.2859375,
|
|
"epoch": 0.16673500068334016,
|
|
"grad_norm": 0.1832772015375739,
|
|
"learning_rate": 4.72558827673665e-06,
|
|
"loss": 1.0249,
|
|
"mean_token_accuracy": 0.7462021827697753,
|
|
"num_tokens": 112715049.0,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"entropy": 1.29765625,
|
|
"epoch": 0.16810168101681017,
|
|
"grad_norm": 0.1186418772721453,
|
|
"learning_rate": 4.722065661547132e-06,
|
|
"loss": 1.0462,
|
|
"mean_token_accuracy": 0.7440206408500671,
|
|
"num_tokens": 113645212.0,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"entropy": 1.31796875,
|
|
"epoch": 0.16946836135028018,
|
|
"grad_norm": 0.1278893849615983,
|
|
"learning_rate": 4.718543046357617e-06,
|
|
"loss": 1.0526,
|
|
"mean_token_accuracy": 0.7408966600894928,
|
|
"num_tokens": 114607757.0,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"entropy": 1.25234375,
|
|
"epoch": 0.17083504168375016,
|
|
"grad_norm": 0.14479420020396888,
|
|
"learning_rate": 4.7150204311680995e-06,
|
|
"loss": 1.0045,
|
|
"mean_token_accuracy": 0.7483646452426911,
|
|
"num_tokens": 115481536.0,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"entropy": 1.30546875,
|
|
"epoch": 0.17220172201722017,
|
|
"grad_norm": 0.11591451806524251,
|
|
"learning_rate": 4.711497815978583e-06,
|
|
"loss": 1.0258,
|
|
"mean_token_accuracy": 0.7467286825180054,
|
|
"num_tokens": 116398355.0,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"entropy": 1.30625,
|
|
"epoch": 0.17356840235069018,
|
|
"grad_norm": 0.13085044281360123,
|
|
"learning_rate": 4.707975200789066e-06,
|
|
"loss": 1.04,
|
|
"mean_token_accuracy": 0.7418612003326416,
|
|
"num_tokens": 117363895.0,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"entropy": 1.30625,
|
|
"epoch": 0.17493508268416016,
|
|
"grad_norm": 0.12739609543449631,
|
|
"learning_rate": 4.704452585599549e-06,
|
|
"loss": 1.0417,
|
|
"mean_token_accuracy": 0.7417557418346405,
|
|
"num_tokens": 118281157.0,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"entropy": 1.28359375,
|
|
"epoch": 0.17630176301763018,
|
|
"grad_norm": 0.12544189046281198,
|
|
"learning_rate": 4.700929970410033e-06,
|
|
"loss": 1.0072,
|
|
"mean_token_accuracy": 0.7490952491760254,
|
|
"num_tokens": 119199903.0,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"entropy": 1.278125,
|
|
"epoch": 0.17766844335110019,
|
|
"grad_norm": 0.12211791856192715,
|
|
"learning_rate": 4.697407355220516e-06,
|
|
"loss": 1.0276,
|
|
"mean_token_accuracy": 0.745412939786911,
|
|
"num_tokens": 120153384.0,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"entropy": 1.27734375,
|
|
"epoch": 0.17903512368457017,
|
|
"grad_norm": 0.12584363215631073,
|
|
"learning_rate": 4.693884740030999e-06,
|
|
"loss": 0.9928,
|
|
"mean_token_accuracy": 0.7483408749103546,
|
|
"num_tokens": 121028690.0,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"entropy": 1.32265625,
|
|
"epoch": 0.18040180401804018,
|
|
"grad_norm": 0.11958562344495856,
|
|
"learning_rate": 4.690362124841483e-06,
|
|
"loss": 1.0504,
|
|
"mean_token_accuracy": 0.741478830575943,
|
|
"num_tokens": 121950665.0,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"entropy": 1.303125,
|
|
"epoch": 0.1817684843515102,
|
|
"grad_norm": 0.11094125768847574,
|
|
"learning_rate": 4.686839509651966e-06,
|
|
"loss": 1.0079,
|
|
"mean_token_accuracy": 0.7482856690883637,
|
|
"num_tokens": 122875209.0,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"entropy": 1.31171875,
|
|
"epoch": 0.18313516468498017,
|
|
"grad_norm": 0.1198763004541572,
|
|
"learning_rate": 4.683316894462449e-06,
|
|
"loss": 1.0336,
|
|
"mean_token_accuracy": 0.7435357332229614,
|
|
"num_tokens": 123817600.0,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"entropy": 1.2890625,
|
|
"epoch": 0.18450184501845018,
|
|
"grad_norm": 0.12483512842545814,
|
|
"learning_rate": 4.679794279272933e-06,
|
|
"loss": 1.0324,
|
|
"mean_token_accuracy": 0.7436938464641571,
|
|
"num_tokens": 124741536.0,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"entropy": 1.3,
|
|
"epoch": 0.1858685253519202,
|
|
"grad_norm": 0.12181264999014962,
|
|
"learning_rate": 4.676271664083416e-06,
|
|
"loss": 0.9997,
|
|
"mean_token_accuracy": 0.7510847747325897,
|
|
"num_tokens": 125689703.0,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"entropy": 1.35859375,
|
|
"epoch": 0.18723520568539018,
|
|
"grad_norm": 0.13518874092465047,
|
|
"learning_rate": 4.6727490488938995e-06,
|
|
"loss": 1.0636,
|
|
"mean_token_accuracy": 0.7411109149456024,
|
|
"num_tokens": 126565228.0,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"entropy": 1.29453125,
|
|
"epoch": 0.1886018860188602,
|
|
"grad_norm": 0.11237676581274714,
|
|
"learning_rate": 4.669226433704382e-06,
|
|
"loss": 1.0276,
|
|
"mean_token_accuracy": 0.7449018716812134,
|
|
"num_tokens": 127484119.0,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"entropy": 1.2640625,
|
|
"epoch": 0.1899685663523302,
|
|
"grad_norm": 0.12527850972448162,
|
|
"learning_rate": 4.665703818514866e-06,
|
|
"loss": 1.0102,
|
|
"mean_token_accuracy": 0.748941433429718,
|
|
"num_tokens": 128382056.0,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"entropy": 1.28203125,
|
|
"epoch": 0.19133524668580018,
|
|
"grad_norm": 0.10779977259867936,
|
|
"learning_rate": 4.6621812033253484e-06,
|
|
"loss": 0.9958,
|
|
"mean_token_accuracy": 0.7516360759735108,
|
|
"num_tokens": 129302334.0,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"entropy": 1.190625,
|
|
"epoch": 0.1927019270192702,
|
|
"grad_norm": 0.10993034519720814,
|
|
"learning_rate": 4.658658588135833e-06,
|
|
"loss": 0.9392,
|
|
"mean_token_accuracy": 0.7639077425003051,
|
|
"num_tokens": 130215453.0,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"entropy": 1.26015625,
|
|
"epoch": 0.1940686073527402,
|
|
"grad_norm": 0.13670573714707304,
|
|
"learning_rate": 4.6551359729463155e-06,
|
|
"loss": 0.9781,
|
|
"mean_token_accuracy": 0.75620818734169,
|
|
"num_tokens": 131191399.0,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"entropy": 1.32734375,
|
|
"epoch": 0.19543528768621019,
|
|
"grad_norm": 0.12868502842852134,
|
|
"learning_rate": 4.651613357756799e-06,
|
|
"loss": 1.0673,
|
|
"mean_token_accuracy": 0.7362558662891387,
|
|
"num_tokens": 132122523.0,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"entropy": 1.32109375,
|
|
"epoch": 0.1968019680196802,
|
|
"grad_norm": 0.346422177657401,
|
|
"learning_rate": 4.648090742567283e-06,
|
|
"loss": 1.0369,
|
|
"mean_token_accuracy": 0.7444081783294678,
|
|
"num_tokens": 133055902.0,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"entropy": 1.30078125,
|
|
"epoch": 0.1981686483531502,
|
|
"grad_norm": 0.12167541091703424,
|
|
"learning_rate": 4.644568127377765e-06,
|
|
"loss": 1.0171,
|
|
"mean_token_accuracy": 0.7471309006214142,
|
|
"num_tokens": 134007365.0,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"entropy": 1.29140625,
|
|
"epoch": 0.1995353286866202,
|
|
"grad_norm": 0.12494354821860927,
|
|
"learning_rate": 4.641045512188249e-06,
|
|
"loss": 1.0498,
|
|
"mean_token_accuracy": 0.7439544320106506,
|
|
"num_tokens": 134939937.0,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"entropy": 1.2640625,
|
|
"epoch": 0.2009020090200902,
|
|
"grad_norm": 0.13259913603805115,
|
|
"learning_rate": 4.6375228969987324e-06,
|
|
"loss": 0.9973,
|
|
"mean_token_accuracy": 0.7482161462306977,
|
|
"num_tokens": 135883157.0,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"entropy": 1.2890625,
|
|
"epoch": 0.2022686893535602,
|
|
"grad_norm": 0.1330998772395105,
|
|
"learning_rate": 4.634000281809216e-06,
|
|
"loss": 0.9978,
|
|
"mean_token_accuracy": 0.7513881742954254,
|
|
"num_tokens": 136826502.0,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"entropy": 1.28359375,
|
|
"epoch": 0.2036353696870302,
|
|
"grad_norm": 0.11331569141077275,
|
|
"learning_rate": 4.630477666619699e-06,
|
|
"loss": 1.017,
|
|
"mean_token_accuracy": 0.7467792570590973,
|
|
"num_tokens": 137729172.0,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"entropy": 1.23828125,
|
|
"epoch": 0.2050020500205002,
|
|
"grad_norm": 0.1206344547686039,
|
|
"learning_rate": 4.626955051430182e-06,
|
|
"loss": 0.9896,
|
|
"mean_token_accuracy": 0.7551925539970398,
|
|
"num_tokens": 138673916.0,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"entropy": 1.315625,
|
|
"epoch": 0.20636873035397021,
|
|
"grad_norm": 0.17863326208667635,
|
|
"learning_rate": 4.623432436240665e-06,
|
|
"loss": 1.061,
|
|
"mean_token_accuracy": 0.7402375340461731,
|
|
"num_tokens": 139533756.0,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"entropy": 1.26875,
|
|
"epoch": 0.2077354106874402,
|
|
"grad_norm": 0.11611480478157128,
|
|
"learning_rate": 4.619909821051149e-06,
|
|
"loss": 1.0001,
|
|
"mean_token_accuracy": 0.7489430069923401,
|
|
"num_tokens": 140388113.0,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"entropy": 1.28203125,
|
|
"epoch": 0.2091020910209102,
|
|
"grad_norm": 0.1260363080946687,
|
|
"learning_rate": 4.616387205861632e-06,
|
|
"loss": 1.0244,
|
|
"mean_token_accuracy": 0.7467110931873322,
|
|
"num_tokens": 141300644.0,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"entropy": 1.2734375,
|
|
"epoch": 0.21046877135438022,
|
|
"grad_norm": 0.12004868874722198,
|
|
"learning_rate": 4.6128645906721156e-06,
|
|
"loss": 1.0282,
|
|
"mean_token_accuracy": 0.745943033695221,
|
|
"num_tokens": 142178254.0,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"entropy": 1.334375,
|
|
"epoch": 0.2118354516878502,
|
|
"grad_norm": 0.12432890523715193,
|
|
"learning_rate": 4.609341975482598e-06,
|
|
"loss": 1.0343,
|
|
"mean_token_accuracy": 0.7470379710197449,
|
|
"num_tokens": 143088982.0,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"entropy": 1.2984375,
|
|
"epoch": 0.2132021320213202,
|
|
"grad_norm": 0.11980054364344507,
|
|
"learning_rate": 4.605819360293082e-06,
|
|
"loss": 0.9824,
|
|
"mean_token_accuracy": 0.7524501919746399,
|
|
"num_tokens": 144044472.0,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"entropy": 1.24296875,
|
|
"epoch": 0.21456881235479022,
|
|
"grad_norm": 0.11501355765721194,
|
|
"learning_rate": 4.602296745103565e-06,
|
|
"loss": 0.9426,
|
|
"mean_token_accuracy": 0.7612644314765931,
|
|
"num_tokens": 144956757.0,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"entropy": 1.30390625,
|
|
"epoch": 0.2159354926882602,
|
|
"grad_norm": 0.1268894075939361,
|
|
"learning_rate": 4.598774129914049e-06,
|
|
"loss": 1.0723,
|
|
"mean_token_accuracy": 0.7379667401313782,
|
|
"num_tokens": 145879897.0,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"entropy": 1.31328125,
|
|
"epoch": 0.21730217302173022,
|
|
"grad_norm": 0.1272692861430919,
|
|
"learning_rate": 4.595251514724532e-06,
|
|
"loss": 1.0525,
|
|
"mean_token_accuracy": 0.7393347084522247,
|
|
"num_tokens": 146783735.0,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"entropy": 1.27421875,
|
|
"epoch": 0.21866885335520023,
|
|
"grad_norm": 0.11633045132609159,
|
|
"learning_rate": 4.591728899535015e-06,
|
|
"loss": 0.9866,
|
|
"mean_token_accuracy": 0.7515206217765809,
|
|
"num_tokens": 147702553.0,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"entropy": 1.234375,
|
|
"epoch": 0.2200355336886702,
|
|
"grad_norm": 0.1356012180485139,
|
|
"learning_rate": 4.588206284345499e-06,
|
|
"loss": 0.9509,
|
|
"mean_token_accuracy": 0.759547621011734,
|
|
"num_tokens": 148628418.0,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"entropy": 1.35859375,
|
|
"epoch": 0.22140221402214022,
|
|
"grad_norm": 0.13331498399029218,
|
|
"learning_rate": 4.584683669155981e-06,
|
|
"loss": 1.0822,
|
|
"mean_token_accuracy": 0.7344770193099975,
|
|
"num_tokens": 149568000.0,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"entropy": 1.33515625,
|
|
"epoch": 0.22276889435561023,
|
|
"grad_norm": 0.15021464604637308,
|
|
"learning_rate": 4.581161053966465e-06,
|
|
"loss": 1.028,
|
|
"mean_token_accuracy": 0.7473877191543579,
|
|
"num_tokens": 150546517.0,
|
|
"step": 1630
|
|
},
|
|
{
|
|
"entropy": 1.334375,
|
|
"epoch": 0.2241355746890802,
|
|
"grad_norm": 0.13348481890308445,
|
|
"learning_rate": 4.5776384387769485e-06,
|
|
"loss": 1.0323,
|
|
"mean_token_accuracy": 0.7456431686878204,
|
|
"num_tokens": 151479506.0,
|
|
"step": 1640
|
|
},
|
|
{
|
|
"entropy": 1.275,
|
|
"epoch": 0.22550225502255022,
|
|
"grad_norm": 0.16942374315392975,
|
|
"learning_rate": 4.574115823587432e-06,
|
|
"loss": 0.9957,
|
|
"mean_token_accuracy": 0.75212482213974,
|
|
"num_tokens": 152405951.0,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"entropy": 1.2796875,
|
|
"epoch": 0.22686893535602023,
|
|
"grad_norm": 0.12153360560700456,
|
|
"learning_rate": 4.570593208397915e-06,
|
|
"loss": 1.0019,
|
|
"mean_token_accuracy": 0.7516331613063812,
|
|
"num_tokens": 153325504.0,
|
|
"step": 1660
|
|
},
|
|
{
|
|
"entropy": 1.28984375,
|
|
"epoch": 0.22823561568949022,
|
|
"grad_norm": 0.1128331512377669,
|
|
"learning_rate": 4.567070593208398e-06,
|
|
"loss": 1.0427,
|
|
"mean_token_accuracy": 0.7437168478965759,
|
|
"num_tokens": 154226518.0,
|
|
"step": 1670
|
|
},
|
|
{
|
|
"entropy": 1.28828125,
|
|
"epoch": 0.22960229602296023,
|
|
"grad_norm": 0.12131833393875216,
|
|
"learning_rate": 4.563547978018882e-06,
|
|
"loss": 1.0264,
|
|
"mean_token_accuracy": 0.7437920689582824,
|
|
"num_tokens": 155166706.0,
|
|
"step": 1680
|
|
},
|
|
{
|
|
"entropy": 1.265625,
|
|
"epoch": 0.23096897635643024,
|
|
"grad_norm": 0.12080382176811848,
|
|
"learning_rate": 4.560025362829365e-06,
|
|
"loss": 1.016,
|
|
"mean_token_accuracy": 0.7463815748691559,
|
|
"num_tokens": 156080529.0,
|
|
"step": 1690
|
|
},
|
|
{
|
|
"entropy": 1.28203125,
|
|
"epoch": 0.23233565668990022,
|
|
"grad_norm": 0.11873939675290356,
|
|
"learning_rate": 4.556502747639848e-06,
|
|
"loss": 1.0417,
|
|
"mean_token_accuracy": 0.7418499946594238,
|
|
"num_tokens": 157016731.0,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"entropy": 1.296875,
|
|
"epoch": 0.23370233702337023,
|
|
"grad_norm": 0.11669412327774885,
|
|
"learning_rate": 4.552980132450332e-06,
|
|
"loss": 1.0281,
|
|
"mean_token_accuracy": 0.7426606178283691,
|
|
"num_tokens": 157986519.0,
|
|
"step": 1710
|
|
},
|
|
{
|
|
"entropy": 1.26328125,
|
|
"epoch": 0.23506901735684024,
|
|
"grad_norm": 0.12259953635193328,
|
|
"learning_rate": 4.549457517260814e-06,
|
|
"loss": 1.0216,
|
|
"mean_token_accuracy": 0.7491669356822968,
|
|
"num_tokens": 158934641.0,
|
|
"step": 1720
|
|
},
|
|
{
|
|
"entropy": 1.271875,
|
|
"epoch": 0.23643569769031023,
|
|
"grad_norm": 0.12354991293474642,
|
|
"learning_rate": 4.545934902071298e-06,
|
|
"loss": 0.9828,
|
|
"mean_token_accuracy": 0.7545679569244385,
|
|
"num_tokens": 159912974.0,
|
|
"step": 1730
|
|
},
|
|
{
|
|
"entropy": 1.3203125,
|
|
"epoch": 0.23780237802378024,
|
|
"grad_norm": 0.13872614848801584,
|
|
"learning_rate": 4.5424122868817814e-06,
|
|
"loss": 1.0184,
|
|
"mean_token_accuracy": 0.7462136089801789,
|
|
"num_tokens": 160803757.0,
|
|
"step": 1740
|
|
},
|
|
{
|
|
"entropy": 1.25,
|
|
"epoch": 0.23916905835725025,
|
|
"grad_norm": 0.12941254346574554,
|
|
"learning_rate": 4.538889671692265e-06,
|
|
"loss": 0.9921,
|
|
"mean_token_accuracy": 0.7550604403018951,
|
|
"num_tokens": 161701172.0,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"entropy": 1.2875,
|
|
"epoch": 0.24053573869072023,
|
|
"grad_norm": 0.12944193011200594,
|
|
"learning_rate": 4.535367056502748e-06,
|
|
"loss": 1.0149,
|
|
"mean_token_accuracy": 0.7474440395832062,
|
|
"num_tokens": 162650956.0,
|
|
"step": 1760
|
|
},
|
|
{
|
|
"entropy": 1.30078125,
|
|
"epoch": 0.24190241902419024,
|
|
"grad_norm": 0.10998299620161982,
|
|
"learning_rate": 4.531844441313231e-06,
|
|
"loss": 1.0247,
|
|
"mean_token_accuracy": 0.7454554259777069,
|
|
"num_tokens": 163571702.0,
|
|
"step": 1770
|
|
},
|
|
{
|
|
"entropy": 1.2421875,
|
|
"epoch": 0.24326909935766025,
|
|
"grad_norm": 0.11512148921130483,
|
|
"learning_rate": 4.528321826123715e-06,
|
|
"loss": 0.9636,
|
|
"mean_token_accuracy": 0.7568564653396607,
|
|
"num_tokens": 164471607.0,
|
|
"step": 1780
|
|
},
|
|
{
|
|
"entropy": 1.29609375,
|
|
"epoch": 0.24463577969113023,
|
|
"grad_norm": 0.10275803460486269,
|
|
"learning_rate": 4.524799210934198e-06,
|
|
"loss": 0.9817,
|
|
"mean_token_accuracy": 0.754568350315094,
|
|
"num_tokens": 165399554.0,
|
|
"step": 1790
|
|
},
|
|
{
|
|
"entropy": 1.29765625,
|
|
"epoch": 0.24600246002460024,
|
|
"grad_norm": 0.11189741103779213,
|
|
"learning_rate": 4.521276595744681e-06,
|
|
"loss": 0.9605,
|
|
"mean_token_accuracy": 0.760403174161911,
|
|
"num_tokens": 166291849.0,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"entropy": 1.30390625,
|
|
"epoch": 0.24736914035807026,
|
|
"grad_norm": 0.1254229252529456,
|
|
"learning_rate": 4.5177539805551646e-06,
|
|
"loss": 1.0259,
|
|
"mean_token_accuracy": 0.7470467209815979,
|
|
"num_tokens": 167206313.0,
|
|
"step": 1810
|
|
},
|
|
{
|
|
"entropy": 1.26484375,
|
|
"epoch": 0.24873582069154024,
|
|
"grad_norm": 0.13774042805156086,
|
|
"learning_rate": 4.514231365365648e-06,
|
|
"loss": 0.9731,
|
|
"mean_token_accuracy": 0.7573931038379669,
|
|
"num_tokens": 168088688.0,
|
|
"step": 1820
|
|
},
|
|
{
|
|
"entropy": 1.27421875,
|
|
"epoch": 0.25010250102501025,
|
|
"grad_norm": 0.11638896879925598,
|
|
"learning_rate": 4.510708750176131e-06,
|
|
"loss": 0.9971,
|
|
"mean_token_accuracy": 0.7483458161354065,
|
|
"num_tokens": 168991287.0,
|
|
"step": 1830
|
|
},
|
|
{
|
|
"entropy": 1.26953125,
|
|
"epoch": 0.25146918135848023,
|
|
"grad_norm": 0.11517696792045384,
|
|
"learning_rate": 4.507186134986614e-06,
|
|
"loss": 0.9832,
|
|
"mean_token_accuracy": 0.7546384811401368,
|
|
"num_tokens": 169961051.0,
|
|
"step": 1840
|
|
},
|
|
{
|
|
"entropy": 1.2828125,
|
|
"epoch": 0.25283586169195027,
|
|
"grad_norm": 0.11454671834995427,
|
|
"learning_rate": 4.503663519797098e-06,
|
|
"loss": 0.9993,
|
|
"mean_token_accuracy": 0.7499870002269745,
|
|
"num_tokens": 170889299.0,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"entropy": 1.26328125,
|
|
"epoch": 0.25420254202542025,
|
|
"grad_norm": 0.1352273320130704,
|
|
"learning_rate": 4.5001409046075814e-06,
|
|
"loss": 0.9809,
|
|
"mean_token_accuracy": 0.7551847040653229,
|
|
"num_tokens": 171801507.0,
|
|
"step": 1860
|
|
},
|
|
{
|
|
"entropy": 1.25703125,
|
|
"epoch": 0.25556922235889024,
|
|
"grad_norm": 0.11901873222642986,
|
|
"learning_rate": 4.496618289418064e-06,
|
|
"loss": 0.9838,
|
|
"mean_token_accuracy": 0.7529530465602875,
|
|
"num_tokens": 172756808.0,
|
|
"step": 1870
|
|
},
|
|
{
|
|
"entropy": 1.25859375,
|
|
"epoch": 0.2569359026923603,
|
|
"grad_norm": 0.12667481717882836,
|
|
"learning_rate": 4.493095674228548e-06,
|
|
"loss": 0.991,
|
|
"mean_token_accuracy": 0.7533979058265686,
|
|
"num_tokens": 173650984.0,
|
|
"step": 1880
|
|
},
|
|
{
|
|
"entropy": 1.31796875,
|
|
"epoch": 0.25830258302583026,
|
|
"grad_norm": 0.12012006999152217,
|
|
"learning_rate": 4.48957305903903e-06,
|
|
"loss": 1.0376,
|
|
"mean_token_accuracy": 0.7432571172714233,
|
|
"num_tokens": 174590986.0,
|
|
"step": 1890
|
|
},
|
|
{
|
|
"entropy": 1.29375,
|
|
"epoch": 0.25966926335930024,
|
|
"grad_norm": 0.12051217663620682,
|
|
"learning_rate": 4.486050443849515e-06,
|
|
"loss": 0.9747,
|
|
"mean_token_accuracy": 0.7571295022964477,
|
|
"num_tokens": 175502905.0,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"entropy": 1.26015625,
|
|
"epoch": 0.2610359436927703,
|
|
"grad_norm": 0.14189591974414376,
|
|
"learning_rate": 4.4825278286599975e-06,
|
|
"loss": 0.9858,
|
|
"mean_token_accuracy": 0.7525331556797028,
|
|
"num_tokens": 176434918.0,
|
|
"step": 1910
|
|
},
|
|
{
|
|
"entropy": 1.240625,
|
|
"epoch": 0.26240262402624026,
|
|
"grad_norm": 0.13656701350274475,
|
|
"learning_rate": 4.479005213470481e-06,
|
|
"loss": 0.9965,
|
|
"mean_token_accuracy": 0.751965445280075,
|
|
"num_tokens": 177351387.0,
|
|
"step": 1920
|
|
},
|
|
{
|
|
"entropy": 1.28125,
|
|
"epoch": 0.26376930435971024,
|
|
"grad_norm": 0.133961538473525,
|
|
"learning_rate": 4.475482598280964e-06,
|
|
"loss": 1.0525,
|
|
"mean_token_accuracy": 0.7363276422023773,
|
|
"num_tokens": 178273072.0,
|
|
"step": 1930
|
|
},
|
|
{
|
|
"entropy": 1.25078125,
|
|
"epoch": 0.2651359846931803,
|
|
"grad_norm": 0.12910849790183404,
|
|
"learning_rate": 4.471959983091447e-06,
|
|
"loss": 0.9844,
|
|
"mean_token_accuracy": 0.7532525837421418,
|
|
"num_tokens": 179201344.0,
|
|
"step": 1940
|
|
},
|
|
{
|
|
"entropy": 1.2765625,
|
|
"epoch": 0.26650266502665027,
|
|
"grad_norm": 0.12248179199940083,
|
|
"learning_rate": 4.468437367901931e-06,
|
|
"loss": 0.9685,
|
|
"mean_token_accuracy": 0.7568377733230591,
|
|
"num_tokens": 180128488.0,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"entropy": 1.31953125,
|
|
"epoch": 0.26786934536012025,
|
|
"grad_norm": 0.12094829035372119,
|
|
"learning_rate": 4.464914752712414e-06,
|
|
"loss": 1.0329,
|
|
"mean_token_accuracy": 0.7464009702205658,
|
|
"num_tokens": 181044049.0,
|
|
"step": 1960
|
|
},
|
|
{
|
|
"entropy": 1.24375,
|
|
"epoch": 0.2692360256935903,
|
|
"grad_norm": 0.12244583982367602,
|
|
"learning_rate": 4.461392137522897e-06,
|
|
"loss": 0.9914,
|
|
"mean_token_accuracy": 0.7511204898357391,
|
|
"num_tokens": 181988674.0,
|
|
"step": 1970
|
|
},
|
|
{
|
|
"entropy": 1.2453125,
|
|
"epoch": 0.27060270602706027,
|
|
"grad_norm": 0.1224953153181318,
|
|
"learning_rate": 4.457869522333381e-06,
|
|
"loss": 0.9788,
|
|
"mean_token_accuracy": 0.7543729662895202,
|
|
"num_tokens": 182885151.0,
|
|
"step": 1980
|
|
},
|
|
{
|
|
"entropy": 1.2625,
|
|
"epoch": 0.27196938636053025,
|
|
"grad_norm": 0.12543235749697806,
|
|
"learning_rate": 4.454346907143864e-06,
|
|
"loss": 0.978,
|
|
"mean_token_accuracy": 0.7577938675880432,
|
|
"num_tokens": 183799094.0,
|
|
"step": 1990
|
|
},
|
|
{
|
|
"entropy": 1.315625,
|
|
"epoch": 0.2733360666940003,
|
|
"grad_norm": 0.11953998083935855,
|
|
"learning_rate": 4.450824291954347e-06,
|
|
"loss": 1.0016,
|
|
"mean_token_accuracy": 0.7507026255130768,
|
|
"num_tokens": 184737383.0,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"entropy": 1.23203125,
|
|
"epoch": 0.2747027470274703,
|
|
"grad_norm": 0.11072570327210522,
|
|
"learning_rate": 4.44730167676483e-06,
|
|
"loss": 0.9551,
|
|
"mean_token_accuracy": 0.7608284592628479,
|
|
"num_tokens": 185666325.0,
|
|
"step": 2010
|
|
},
|
|
{
|
|
"entropy": 1.30234375,
|
|
"epoch": 0.27606942736094026,
|
|
"grad_norm": 0.12267494184209994,
|
|
"learning_rate": 4.443779061575314e-06,
|
|
"loss": 1.0276,
|
|
"mean_token_accuracy": 0.7456216037273407,
|
|
"num_tokens": 186596675.0,
|
|
"step": 2020
|
|
},
|
|
{
|
|
"entropy": 1.2375,
|
|
"epoch": 0.2774361076944103,
|
|
"grad_norm": 0.1426621103105038,
|
|
"learning_rate": 4.4402564463857975e-06,
|
|
"loss": 0.9628,
|
|
"mean_token_accuracy": 0.7560223400592804,
|
|
"num_tokens": 187482907.0,
|
|
"step": 2030
|
|
},
|
|
{
|
|
"entropy": 1.27578125,
|
|
"epoch": 0.2788027880278803,
|
|
"grad_norm": 0.12506304088685433,
|
|
"learning_rate": 4.43673383119628e-06,
|
|
"loss": 0.9932,
|
|
"mean_token_accuracy": 0.7507397532463074,
|
|
"num_tokens": 188385774.0,
|
|
"step": 2040
|
|
},
|
|
{
|
|
"entropy": 1.26640625,
|
|
"epoch": 0.28016946836135026,
|
|
"grad_norm": 0.12437764430238249,
|
|
"learning_rate": 4.433211216006764e-06,
|
|
"loss": 1.0024,
|
|
"mean_token_accuracy": 0.750031590461731,
|
|
"num_tokens": 189277151.0,
|
|
"step": 2050
|
|
},
|
|
{
|
|
"entropy": 1.24765625,
|
|
"epoch": 0.2815361486948203,
|
|
"grad_norm": 0.10903668334871564,
|
|
"learning_rate": 4.4296886008172465e-06,
|
|
"loss": 0.9955,
|
|
"mean_token_accuracy": 0.7486873209476471,
|
|
"num_tokens": 190184956.0,
|
|
"step": 2060
|
|
},
|
|
{
|
|
"entropy": 1.2578125,
|
|
"epoch": 0.2829028290282903,
|
|
"grad_norm": 0.1156044022815199,
|
|
"learning_rate": 4.426165985627731e-06,
|
|
"loss": 0.961,
|
|
"mean_token_accuracy": 0.7599454998970032,
|
|
"num_tokens": 191146194.0,
|
|
"step": 2070
|
|
},
|
|
{
|
|
"entropy": 1.2453125,
|
|
"epoch": 0.28426950936176026,
|
|
"grad_norm": 0.12926231911295688,
|
|
"learning_rate": 4.4226433704382136e-06,
|
|
"loss": 1.0041,
|
|
"mean_token_accuracy": 0.7534525513648986,
|
|
"num_tokens": 192033840.0,
|
|
"step": 2080
|
|
},
|
|
{
|
|
"entropy": 1.253125,
|
|
"epoch": 0.2856361896952303,
|
|
"grad_norm": 0.1172059565177559,
|
|
"learning_rate": 4.419120755248697e-06,
|
|
"loss": 0.9753,
|
|
"mean_token_accuracy": 0.7568080961704254,
|
|
"num_tokens": 192955176.0,
|
|
"step": 2090
|
|
},
|
|
{
|
|
"entropy": 1.34921875,
|
|
"epoch": 0.2870028700287003,
|
|
"grad_norm": 0.12666857423492806,
|
|
"learning_rate": 4.41559814005918e-06,
|
|
"loss": 1.0693,
|
|
"mean_token_accuracy": 0.7372787535190582,
|
|
"num_tokens": 193892359.0,
|
|
"step": 2100
|
|
},
|
|
{
|
|
"entropy": 1.2578125,
|
|
"epoch": 0.28836955036217027,
|
|
"grad_norm": 0.11421767971992607,
|
|
"learning_rate": 4.412075524869663e-06,
|
|
"loss": 0.979,
|
|
"mean_token_accuracy": 0.756625235080719,
|
|
"num_tokens": 194764643.0,
|
|
"step": 2110
|
|
},
|
|
{
|
|
"entropy": 1.28515625,
|
|
"epoch": 0.2897362306956403,
|
|
"grad_norm": 0.11865503543907321,
|
|
"learning_rate": 4.408552909680147e-06,
|
|
"loss": 1.0176,
|
|
"mean_token_accuracy": 0.7487961292266846,
|
|
"num_tokens": 195672996.0,
|
|
"step": 2120
|
|
},
|
|
{
|
|
"entropy": 1.28203125,
|
|
"epoch": 0.2911029110291103,
|
|
"grad_norm": 0.11234151939690407,
|
|
"learning_rate": 4.4050302944906304e-06,
|
|
"loss": 0.9982,
|
|
"mean_token_accuracy": 0.7501562178134918,
|
|
"num_tokens": 196608934.0,
|
|
"step": 2130
|
|
},
|
|
{
|
|
"entropy": 1.27265625,
|
|
"epoch": 0.2924695913625803,
|
|
"grad_norm": 0.12135056834449494,
|
|
"learning_rate": 4.401507679301113e-06,
|
|
"loss": 0.9793,
|
|
"mean_token_accuracy": 0.7534348726272583,
|
|
"num_tokens": 197498404.0,
|
|
"step": 2140
|
|
},
|
|
{
|
|
"entropy": 1.3421875,
|
|
"epoch": 0.2938362716960503,
|
|
"grad_norm": 0.14774117986170987,
|
|
"learning_rate": 4.397985064111597e-06,
|
|
"loss": 1.0565,
|
|
"mean_token_accuracy": 0.7413647294044494,
|
|
"num_tokens": 198454218.0,
|
|
"step": 2150
|
|
},
|
|
{
|
|
"entropy": 1.284375,
|
|
"epoch": 0.2952029520295203,
|
|
"grad_norm": 0.11602711815082814,
|
|
"learning_rate": 4.39446244892208e-06,
|
|
"loss": 0.984,
|
|
"mean_token_accuracy": 0.7543576002120972,
|
|
"num_tokens": 199374348.0,
|
|
"step": 2160
|
|
},
|
|
{
|
|
"entropy": 1.28046875,
|
|
"epoch": 0.2965696323629903,
|
|
"grad_norm": 0.12883935026563542,
|
|
"learning_rate": 4.390939833732563e-06,
|
|
"loss": 1.0156,
|
|
"mean_token_accuracy": 0.7470311999320984,
|
|
"num_tokens": 200221659.0,
|
|
"step": 2170
|
|
},
|
|
{
|
|
"entropy": 1.27265625,
|
|
"epoch": 0.2979363126964603,
|
|
"grad_norm": 0.1301662368716468,
|
|
"learning_rate": 4.387417218543047e-06,
|
|
"loss": 0.9951,
|
|
"mean_token_accuracy": 0.7512625396251679,
|
|
"num_tokens": 201155187.0,
|
|
"step": 2180
|
|
},
|
|
{
|
|
"entropy": 1.2359375,
|
|
"epoch": 0.2993029930299303,
|
|
"grad_norm": 0.13216669449477866,
|
|
"learning_rate": 4.38389460335353e-06,
|
|
"loss": 0.9313,
|
|
"mean_token_accuracy": 0.7634881377220154,
|
|
"num_tokens": 202067534.0,
|
|
"step": 2190
|
|
},
|
|
{
|
|
"entropy": 1.27421875,
|
|
"epoch": 0.3006696733634003,
|
|
"grad_norm": 0.11791900353333833,
|
|
"learning_rate": 4.380371988164014e-06,
|
|
"loss": 1.0439,
|
|
"mean_token_accuracy": 0.7428429365158081,
|
|
"num_tokens": 203044126.0,
|
|
"step": 2200
|
|
},
|
|
{
|
|
"entropy": 1.2640625,
|
|
"epoch": 0.3020363536968703,
|
|
"grad_norm": 0.11117791980835033,
|
|
"learning_rate": 4.376849372974496e-06,
|
|
"loss": 0.9757,
|
|
"mean_token_accuracy": 0.7571807980537415,
|
|
"num_tokens": 203996905.0,
|
|
"step": 2210
|
|
},
|
|
{
|
|
"entropy": 1.25,
|
|
"epoch": 0.3034030340303403,
|
|
"grad_norm": 0.1190390584963019,
|
|
"learning_rate": 4.37332675778498e-06,
|
|
"loss": 0.9755,
|
|
"mean_token_accuracy": 0.7542799711227417,
|
|
"num_tokens": 204929875.0,
|
|
"step": 2220
|
|
},
|
|
{
|
|
"entropy": 1.2515625,
|
|
"epoch": 0.3047697143638103,
|
|
"grad_norm": 0.12377389991064175,
|
|
"learning_rate": 4.369804142595463e-06,
|
|
"loss": 0.9971,
|
|
"mean_token_accuracy": 0.7526329934597016,
|
|
"num_tokens": 205839908.0,
|
|
"step": 2230
|
|
},
|
|
{
|
|
"entropy": 1.271875,
|
|
"epoch": 0.3061363946972803,
|
|
"grad_norm": 0.11891151059739709,
|
|
"learning_rate": 4.366281527405947e-06,
|
|
"loss": 0.9943,
|
|
"mean_token_accuracy": 0.7537250876426697,
|
|
"num_tokens": 206800232.0,
|
|
"step": 2240
|
|
},
|
|
{
|
|
"entropy": 1.22109375,
|
|
"epoch": 0.3075030750307503,
|
|
"grad_norm": 0.11968438086660978,
|
|
"learning_rate": 4.36275891221643e-06,
|
|
"loss": 0.9532,
|
|
"mean_token_accuracy": 0.7558438062667847,
|
|
"num_tokens": 207736757.0,
|
|
"step": 2250
|
|
},
|
|
{
|
|
"entropy": 1.2328125,
|
|
"epoch": 0.3088697553642203,
|
|
"grad_norm": 0.11933212470125976,
|
|
"learning_rate": 4.359236297026913e-06,
|
|
"loss": 0.9856,
|
|
"mean_token_accuracy": 0.7524786651134491,
|
|
"num_tokens": 208650386.0,
|
|
"step": 2260
|
|
},
|
|
{
|
|
"entropy": 1.22265625,
|
|
"epoch": 0.3102364356976903,
|
|
"grad_norm": 0.13488153616828027,
|
|
"learning_rate": 4.355713681837396e-06,
|
|
"loss": 0.943,
|
|
"mean_token_accuracy": 0.7623308658599853,
|
|
"num_tokens": 209561366.0,
|
|
"step": 2270
|
|
},
|
|
{
|
|
"entropy": 1.25078125,
|
|
"epoch": 0.3116031160311603,
|
|
"grad_norm": 0.12163766826135666,
|
|
"learning_rate": 4.352191066647879e-06,
|
|
"loss": 0.9862,
|
|
"mean_token_accuracy": 0.7520803809165955,
|
|
"num_tokens": 210471900.0,
|
|
"step": 2280
|
|
},
|
|
{
|
|
"entropy": 1.25234375,
|
|
"epoch": 0.3129697963646303,
|
|
"grad_norm": 0.13903602794245434,
|
|
"learning_rate": 4.348668451458363e-06,
|
|
"loss": 1.0053,
|
|
"mean_token_accuracy": 0.7513979852199555,
|
|
"num_tokens": 211400549.0,
|
|
"step": 2290
|
|
},
|
|
{
|
|
"entropy": 1.3015625,
|
|
"epoch": 0.31433647669810033,
|
|
"grad_norm": 0.12263201544624446,
|
|
"learning_rate": 4.3451458362688465e-06,
|
|
"loss": 0.9949,
|
|
"mean_token_accuracy": 0.7513895630836487,
|
|
"num_tokens": 212322958.0,
|
|
"step": 2300
|
|
},
|
|
{
|
|
"entropy": 1.284375,
|
|
"epoch": 0.3157031570315703,
|
|
"grad_norm": 0.1149666484048633,
|
|
"learning_rate": 4.34162322107933e-06,
|
|
"loss": 0.969,
|
|
"mean_token_accuracy": 0.7591212630271912,
|
|
"num_tokens": 213218481.0,
|
|
"step": 2310
|
|
},
|
|
{
|
|
"entropy": 1.28125,
|
|
"epoch": 0.3170698373650403,
|
|
"grad_norm": 0.12146781991814425,
|
|
"learning_rate": 4.338100605889813e-06,
|
|
"loss": 0.983,
|
|
"mean_token_accuracy": 0.7564604043960571,
|
|
"num_tokens": 214104458.0,
|
|
"step": 2320
|
|
},
|
|
{
|
|
"entropy": 1.221875,
|
|
"epoch": 0.31843651769851034,
|
|
"grad_norm": 0.1232747038522599,
|
|
"learning_rate": 4.334577990700296e-06,
|
|
"loss": 0.8918,
|
|
"mean_token_accuracy": 0.7747549057006836,
|
|
"num_tokens": 214997474.0,
|
|
"step": 2330
|
|
},
|
|
{
|
|
"entropy": 1.30234375,
|
|
"epoch": 0.3198031980319803,
|
|
"grad_norm": 0.1262206293078209,
|
|
"learning_rate": 4.33105537551078e-06,
|
|
"loss": 1.0229,
|
|
"mean_token_accuracy": 0.7459903180599212,
|
|
"num_tokens": 215898945.0,
|
|
"step": 2340
|
|
},
|
|
{
|
|
"entropy": 1.2375,
|
|
"epoch": 0.3211698783654503,
|
|
"grad_norm": 0.11591495790220742,
|
|
"learning_rate": 4.327532760321263e-06,
|
|
"loss": 0.9308,
|
|
"mean_token_accuracy": 0.7668770968914032,
|
|
"num_tokens": 216780044.0,
|
|
"step": 2350
|
|
},
|
|
{
|
|
"entropy": 1.25546875,
|
|
"epoch": 0.32253655869892034,
|
|
"grad_norm": 0.13089515628267026,
|
|
"learning_rate": 4.324010145131746e-06,
|
|
"loss": 0.9956,
|
|
"mean_token_accuracy": 0.7518836677074432,
|
|
"num_tokens": 217686514.0,
|
|
"step": 2360
|
|
},
|
|
{
|
|
"entropy": 1.278125,
|
|
"epoch": 0.3239032390323903,
|
|
"grad_norm": 0.11561393204106914,
|
|
"learning_rate": 4.32048752994223e-06,
|
|
"loss": 1.0041,
|
|
"mean_token_accuracy": 0.750518923997879,
|
|
"num_tokens": 218646157.0,
|
|
"step": 2370
|
|
},
|
|
{
|
|
"entropy": 1.28125,
|
|
"epoch": 0.3252699193658603,
|
|
"grad_norm": 0.10880261846281022,
|
|
"learning_rate": 4.316964914752712e-06,
|
|
"loss": 0.9912,
|
|
"mean_token_accuracy": 0.7534381449222565,
|
|
"num_tokens": 219565771.0,
|
|
"step": 2380
|
|
},
|
|
{
|
|
"entropy": 1.28125,
|
|
"epoch": 0.32663659969933034,
|
|
"grad_norm": 0.13195586324510616,
|
|
"learning_rate": 4.313442299563196e-06,
|
|
"loss": 1.0679,
|
|
"mean_token_accuracy": 0.7409363090991974,
|
|
"num_tokens": 220446709.0,
|
|
"step": 2390
|
|
},
|
|
{
|
|
"entropy": 1.2515625,
|
|
"epoch": 0.3280032800328003,
|
|
"grad_norm": 0.13334574018473064,
|
|
"learning_rate": 4.3099196843736794e-06,
|
|
"loss": 0.9915,
|
|
"mean_token_accuracy": 0.7520997405052186,
|
|
"num_tokens": 221335909.0,
|
|
"step": 2400
|
|
},
|
|
{
|
|
"entropy": 1.271875,
|
|
"epoch": 0.3293699603662703,
|
|
"grad_norm": 0.1187610280898252,
|
|
"learning_rate": 4.306397069184163e-06,
|
|
"loss": 0.9774,
|
|
"mean_token_accuracy": 0.7523249447345733,
|
|
"num_tokens": 222251385.0,
|
|
"step": 2410
|
|
},
|
|
{
|
|
"entropy": 1.2859375,
|
|
"epoch": 0.33073664069974035,
|
|
"grad_norm": 0.1263843722108339,
|
|
"learning_rate": 4.302874453994646e-06,
|
|
"loss": 1.0155,
|
|
"mean_token_accuracy": 0.7460274457931518,
|
|
"num_tokens": 223160354.0,
|
|
"step": 2420
|
|
},
|
|
{
|
|
"entropy": 1.26171875,
|
|
"epoch": 0.33210332103321033,
|
|
"grad_norm": 0.11714454827135655,
|
|
"learning_rate": 4.299351838805129e-06,
|
|
"loss": 0.9468,
|
|
"mean_token_accuracy": 0.7627061903476715,
|
|
"num_tokens": 224079742.0,
|
|
"step": 2430
|
|
},
|
|
{
|
|
"entropy": 1.27578125,
|
|
"epoch": 0.3334700013666803,
|
|
"grad_norm": 0.12060312002064288,
|
|
"learning_rate": 4.295829223615613e-06,
|
|
"loss": 0.9872,
|
|
"mean_token_accuracy": 0.7547019839286804,
|
|
"num_tokens": 225006893.0,
|
|
"step": 2440
|
|
},
|
|
{
|
|
"entropy": 1.2921875,
|
|
"epoch": 0.33483668170015035,
|
|
"grad_norm": 0.1523160302497329,
|
|
"learning_rate": 4.292306608426096e-06,
|
|
"loss": 0.9932,
|
|
"mean_token_accuracy": 0.7532041013240814,
|
|
"num_tokens": 225912700.0,
|
|
"step": 2450
|
|
},
|
|
{
|
|
"entropy": 1.23828125,
|
|
"epoch": 0.33620336203362033,
|
|
"grad_norm": 0.11403390543043755,
|
|
"learning_rate": 4.288783993236579e-06,
|
|
"loss": 0.9788,
|
|
"mean_token_accuracy": 0.7551304757595062,
|
|
"num_tokens": 226846501.0,
|
|
"step": 2460
|
|
},
|
|
{
|
|
"entropy": 1.27421875,
|
|
"epoch": 0.3375700423670903,
|
|
"grad_norm": 0.12635021234453606,
|
|
"learning_rate": 4.285261378047063e-06,
|
|
"loss": 0.9613,
|
|
"mean_token_accuracy": 0.7580442547798156,
|
|
"num_tokens": 227775064.0,
|
|
"step": 2470
|
|
},
|
|
{
|
|
"entropy": 1.2734375,
|
|
"epoch": 0.33893672270056036,
|
|
"grad_norm": 0.12650160747712547,
|
|
"learning_rate": 4.281738762857546e-06,
|
|
"loss": 1.0059,
|
|
"mean_token_accuracy": 0.7477004766464234,
|
|
"num_tokens": 228705788.0,
|
|
"step": 2480
|
|
},
|
|
{
|
|
"entropy": 1.3265625,
|
|
"epoch": 0.34030340303403034,
|
|
"grad_norm": 0.1192093391981212,
|
|
"learning_rate": 4.278216147668029e-06,
|
|
"loss": 0.991,
|
|
"mean_token_accuracy": 0.7535622835159301,
|
|
"num_tokens": 229637091.0,
|
|
"step": 2490
|
|
},
|
|
{
|
|
"entropy": 1.26953125,
|
|
"epoch": 0.3416700833675003,
|
|
"grad_norm": 0.127793605102343,
|
|
"learning_rate": 4.274693532478512e-06,
|
|
"loss": 1.0292,
|
|
"mean_token_accuracy": 0.7439892649650574,
|
|
"num_tokens": 230557197.0,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"entropy": 1.21875,
|
|
"epoch": 0.34303676370097036,
|
|
"grad_norm": 0.11423091507222052,
|
|
"learning_rate": 4.271170917288996e-06,
|
|
"loss": 0.9673,
|
|
"mean_token_accuracy": 0.7579885005950928,
|
|
"num_tokens": 231469955.0,
|
|
"step": 2510
|
|
},
|
|
{
|
|
"entropy": 1.24921875,
|
|
"epoch": 0.34440344403444034,
|
|
"grad_norm": 0.11848657021081185,
|
|
"learning_rate": 4.2676483020994795e-06,
|
|
"loss": 0.9645,
|
|
"mean_token_accuracy": 0.7588392674922944,
|
|
"num_tokens": 232397901.0,
|
|
"step": 2520
|
|
},
|
|
{
|
|
"entropy": 1.28671875,
|
|
"epoch": 0.3457701243679103,
|
|
"grad_norm": 0.11808139585497529,
|
|
"learning_rate": 4.264125686909962e-06,
|
|
"loss": 1.0315,
|
|
"mean_token_accuracy": 0.7457147002220154,
|
|
"num_tokens": 233361773.0,
|
|
"step": 2530
|
|
},
|
|
{
|
|
"entropy": 1.2640625,
|
|
"epoch": 0.34713680470138036,
|
|
"grad_norm": 0.11709676591688892,
|
|
"learning_rate": 4.260603071720446e-06,
|
|
"loss": 1.0072,
|
|
"mean_token_accuracy": 0.7509826362133026,
|
|
"num_tokens": 234268527.0,
|
|
"step": 2540
|
|
},
|
|
{
|
|
"entropy": 1.29921875,
|
|
"epoch": 0.34850348503485035,
|
|
"grad_norm": 0.12771272287372926,
|
|
"learning_rate": 4.257080456530928e-06,
|
|
"loss": 1.0103,
|
|
"mean_token_accuracy": 0.7485181510448455,
|
|
"num_tokens": 235186978.0,
|
|
"step": 2550
|
|
},
|
|
{
|
|
"entropy": 1.23515625,
|
|
"epoch": 0.34987016536832033,
|
|
"grad_norm": 0.11900575905997395,
|
|
"learning_rate": 4.253557841341413e-06,
|
|
"loss": 0.9356,
|
|
"mean_token_accuracy": 0.762294614315033,
|
|
"num_tokens": 236119762.0,
|
|
"step": 2560
|
|
},
|
|
{
|
|
"entropy": 1.26640625,
|
|
"epoch": 0.35123684570179037,
|
|
"grad_norm": 0.1306135209076469,
|
|
"learning_rate": 4.2500352261518955e-06,
|
|
"loss": 0.9826,
|
|
"mean_token_accuracy": 0.7531299889087677,
|
|
"num_tokens": 237045069.0,
|
|
"step": 2570
|
|
},
|
|
{
|
|
"entropy": 1.2046875,
|
|
"epoch": 0.35260352603526035,
|
|
"grad_norm": 0.11931748331247702,
|
|
"learning_rate": 4.246512610962379e-06,
|
|
"loss": 0.9591,
|
|
"mean_token_accuracy": 0.7602514624595642,
|
|
"num_tokens": 237966003.0,
|
|
"step": 2580
|
|
},
|
|
{
|
|
"entropy": 1.278125,
|
|
"epoch": 0.35397020636873033,
|
|
"grad_norm": 0.12623672905769123,
|
|
"learning_rate": 4.242989995772862e-06,
|
|
"loss": 0.9924,
|
|
"mean_token_accuracy": 0.7527673006057739,
|
|
"num_tokens": 238847792.0,
|
|
"step": 2590
|
|
},
|
|
{
|
|
"entropy": 1.27578125,
|
|
"epoch": 0.35533688670220037,
|
|
"grad_norm": 0.1200470010204044,
|
|
"learning_rate": 4.239467380583345e-06,
|
|
"loss": 1.0083,
|
|
"mean_token_accuracy": 0.7489852726459503,
|
|
"num_tokens": 239817460.0,
|
|
"step": 2600
|
|
},
|
|
{
|
|
"entropy": 1.24453125,
|
|
"epoch": 0.35670356703567035,
|
|
"grad_norm": 0.11723626774516754,
|
|
"learning_rate": 4.235944765393829e-06,
|
|
"loss": 0.9468,
|
|
"mean_token_accuracy": 0.7618630945682525,
|
|
"num_tokens": 240730875.0,
|
|
"step": 2610
|
|
},
|
|
{
|
|
"entropy": 1.26953125,
|
|
"epoch": 0.35807024736914034,
|
|
"grad_norm": 0.12665083897967627,
|
|
"learning_rate": 4.232422150204312e-06,
|
|
"loss": 1.0125,
|
|
"mean_token_accuracy": 0.746661114692688,
|
|
"num_tokens": 241618927.0,
|
|
"step": 2620
|
|
},
|
|
{
|
|
"entropy": 1.32890625,
|
|
"epoch": 0.3594369277026104,
|
|
"grad_norm": 0.11598775958968191,
|
|
"learning_rate": 4.228899535014795e-06,
|
|
"loss": 1.0363,
|
|
"mean_token_accuracy": 0.7417471766471863,
|
|
"num_tokens": 242506323.0,
|
|
"step": 2630
|
|
},
|
|
{
|
|
"entropy": 1.253125,
|
|
"epoch": 0.36080360803608036,
|
|
"grad_norm": 0.1368535518441516,
|
|
"learning_rate": 4.225376919825279e-06,
|
|
"loss": 0.9885,
|
|
"mean_token_accuracy": 0.7514637112617493,
|
|
"num_tokens": 243419790.0,
|
|
"step": 2640
|
|
},
|
|
{
|
|
"entropy": 1.25390625,
|
|
"epoch": 0.36217028836955034,
|
|
"grad_norm": 0.133398541001531,
|
|
"learning_rate": 4.221854304635762e-06,
|
|
"loss": 0.9908,
|
|
"mean_token_accuracy": 0.7495141625404358,
|
|
"num_tokens": 244337605.0,
|
|
"step": 2650
|
|
},
|
|
{
|
|
"entropy": 1.31796875,
|
|
"epoch": 0.3635369687030204,
|
|
"grad_norm": 0.11814126682693665,
|
|
"learning_rate": 4.218331689446245e-06,
|
|
"loss": 1.0586,
|
|
"mean_token_accuracy": 0.7402962207794189,
|
|
"num_tokens": 245269588.0,
|
|
"step": 2660
|
|
},
|
|
{
|
|
"entropy": 1.253125,
|
|
"epoch": 0.36490364903649036,
|
|
"grad_norm": 0.12979353329660046,
|
|
"learning_rate": 4.2148090742567284e-06,
|
|
"loss": 0.9424,
|
|
"mean_token_accuracy": 0.7628724873065948,
|
|
"num_tokens": 246183522.0,
|
|
"step": 2670
|
|
},
|
|
{
|
|
"entropy": 1.2515625,
|
|
"epoch": 0.36627032936996035,
|
|
"grad_norm": 0.11745551681554425,
|
|
"learning_rate": 4.211286459067212e-06,
|
|
"loss": 1.0105,
|
|
"mean_token_accuracy": 0.7461193442344666,
|
|
"num_tokens": 247159185.0,
|
|
"step": 2680
|
|
},
|
|
{
|
|
"entropy": 1.2140625,
|
|
"epoch": 0.3676370097034304,
|
|
"grad_norm": 0.11085521022332841,
|
|
"learning_rate": 4.2077638438776955e-06,
|
|
"loss": 0.9287,
|
|
"mean_token_accuracy": 0.7654637277126313,
|
|
"num_tokens": 248044696.0,
|
|
"step": 2690
|
|
},
|
|
{
|
|
"entropy": 1.228125,
|
|
"epoch": 0.36900369003690037,
|
|
"grad_norm": 0.1152085776030553,
|
|
"learning_rate": 4.204241228688178e-06,
|
|
"loss": 0.9534,
|
|
"mean_token_accuracy": 0.7606681108474731,
|
|
"num_tokens": 249045044.0,
|
|
"step": 2700
|
|
},
|
|
{
|
|
"entropy": 1.2421875,
|
|
"epoch": 0.37037037037037035,
|
|
"grad_norm": 0.270697177505608,
|
|
"learning_rate": 4.200718613498662e-06,
|
|
"loss": 0.945,
|
|
"mean_token_accuracy": 0.7625020503997803,
|
|
"num_tokens": 249974276.0,
|
|
"step": 2710
|
|
},
|
|
{
|
|
"entropy": 1.2515625,
|
|
"epoch": 0.3717370507038404,
|
|
"grad_norm": 0.13452613276316575,
|
|
"learning_rate": 4.1971959983091445e-06,
|
|
"loss": 0.9636,
|
|
"mean_token_accuracy": 0.758004629611969,
|
|
"num_tokens": 250873544.0,
|
|
"step": 2720
|
|
},
|
|
{
|
|
"entropy": 1.22421875,
|
|
"epoch": 0.37310373103731037,
|
|
"grad_norm": 0.11955825068816561,
|
|
"learning_rate": 4.193673383119629e-06,
|
|
"loss": 0.9346,
|
|
"mean_token_accuracy": 0.7647544920444489,
|
|
"num_tokens": 251819879.0,
|
|
"step": 2730
|
|
},
|
|
{
|
|
"entropy": 1.3109375,
|
|
"epoch": 0.37447041137078035,
|
|
"grad_norm": 0.11914233307818702,
|
|
"learning_rate": 4.190150767930112e-06,
|
|
"loss": 1.0501,
|
|
"mean_token_accuracy": 0.7432317495346069,
|
|
"num_tokens": 252807631.0,
|
|
"step": 2740
|
|
},
|
|
{
|
|
"entropy": 1.32578125,
|
|
"epoch": 0.3758370917042504,
|
|
"grad_norm": 0.12367995622397224,
|
|
"learning_rate": 4.186628152740595e-06,
|
|
"loss": 1.0326,
|
|
"mean_token_accuracy": 0.7451120495796204,
|
|
"num_tokens": 253747908.0,
|
|
"step": 2750
|
|
},
|
|
{
|
|
"entropy": 1.24453125,
|
|
"epoch": 0.3772037720377204,
|
|
"grad_norm": 0.1159893994077907,
|
|
"learning_rate": 4.183105537551078e-06,
|
|
"loss": 0.9635,
|
|
"mean_token_accuracy": 0.7560027718544007,
|
|
"num_tokens": 254680625.0,
|
|
"step": 2760
|
|
},
|
|
{
|
|
"entropy": 1.296875,
|
|
"epoch": 0.37857045237119036,
|
|
"grad_norm": 0.12021313253449245,
|
|
"learning_rate": 4.179582922361561e-06,
|
|
"loss": 1.0214,
|
|
"mean_token_accuracy": 0.7453507304191589,
|
|
"num_tokens": 255573141.0,
|
|
"step": 2770
|
|
},
|
|
{
|
|
"entropy": 1.2859375,
|
|
"epoch": 0.3799371327046604,
|
|
"grad_norm": 0.13366966358656376,
|
|
"learning_rate": 4.176060307172045e-06,
|
|
"loss": 1.0024,
|
|
"mean_token_accuracy": 0.7491429805755615,
|
|
"num_tokens": 256517622.0,
|
|
"step": 2780
|
|
},
|
|
{
|
|
"entropy": 1.25625,
|
|
"epoch": 0.3813038130381304,
|
|
"grad_norm": 0.11616137474075218,
|
|
"learning_rate": 4.1725376919825285e-06,
|
|
"loss": 0.9649,
|
|
"mean_token_accuracy": 0.7576317250728607,
|
|
"num_tokens": 257406301.0,
|
|
"step": 2790
|
|
},
|
|
{
|
|
"entropy": 1.2640625,
|
|
"epoch": 0.38267049337160036,
|
|
"grad_norm": 0.11751999480513123,
|
|
"learning_rate": 4.169015076793011e-06,
|
|
"loss": 1.0092,
|
|
"mean_token_accuracy": 0.7509114146232605,
|
|
"num_tokens": 258296600.0,
|
|
"step": 2800
|
|
},
|
|
{
|
|
"entropy": 1.23125,
|
|
"epoch": 0.3840371737050704,
|
|
"grad_norm": 0.13225799555236484,
|
|
"learning_rate": 4.165492461603495e-06,
|
|
"loss": 0.9675,
|
|
"mean_token_accuracy": 0.754924088716507,
|
|
"num_tokens": 259223724.0,
|
|
"step": 2810
|
|
},
|
|
{
|
|
"entropy": 1.22734375,
|
|
"epoch": 0.3854038540385404,
|
|
"grad_norm": 0.12722431454557193,
|
|
"learning_rate": 4.161969846413978e-06,
|
|
"loss": 0.9408,
|
|
"mean_token_accuracy": 0.761881160736084,
|
|
"num_tokens": 260114709.0,
|
|
"step": 2820
|
|
},
|
|
{
|
|
"entropy": 1.1875,
|
|
"epoch": 0.38677053437201037,
|
|
"grad_norm": 0.11353817391480275,
|
|
"learning_rate": 4.158447231224461e-06,
|
|
"loss": 0.9373,
|
|
"mean_token_accuracy": 0.7626877188682556,
|
|
"num_tokens": 261095644.0,
|
|
"step": 2830
|
|
},
|
|
{
|
|
"entropy": 1.2734375,
|
|
"epoch": 0.3881372147054804,
|
|
"grad_norm": 0.11593789683324969,
|
|
"learning_rate": 4.1549246160349445e-06,
|
|
"loss": 0.9896,
|
|
"mean_token_accuracy": 0.7516660869121552,
|
|
"num_tokens": 262062947.0,
|
|
"step": 2840
|
|
},
|
|
{
|
|
"entropy": 1.2578125,
|
|
"epoch": 0.3895038950389504,
|
|
"grad_norm": 0.127394049037252,
|
|
"learning_rate": 4.151402000845428e-06,
|
|
"loss": 0.9652,
|
|
"mean_token_accuracy": 0.7576943039894104,
|
|
"num_tokens": 263008190.0,
|
|
"step": 2850
|
|
},
|
|
{
|
|
"entropy": 1.22734375,
|
|
"epoch": 0.39087057537242037,
|
|
"grad_norm": 0.10751770930823616,
|
|
"learning_rate": 4.147879385655912e-06,
|
|
"loss": 0.9221,
|
|
"mean_token_accuracy": 0.7682550489902497,
|
|
"num_tokens": 263918362.0,
|
|
"step": 2860
|
|
},
|
|
{
|
|
"entropy": 1.23671875,
|
|
"epoch": 0.3922372557058904,
|
|
"grad_norm": 0.12772354431393226,
|
|
"learning_rate": 4.144356770466394e-06,
|
|
"loss": 0.958,
|
|
"mean_token_accuracy": 0.7579941272735595,
|
|
"num_tokens": 264804628.0,
|
|
"step": 2870
|
|
},
|
|
{
|
|
"entropy": 1.3328125,
|
|
"epoch": 0.3936039360393604,
|
|
"grad_norm": 0.11180270897122442,
|
|
"learning_rate": 4.140834155276878e-06,
|
|
"loss": 1.0397,
|
|
"mean_token_accuracy": 0.7436641693115235,
|
|
"num_tokens": 265741733.0,
|
|
"step": 2880
|
|
},
|
|
{
|
|
"entropy": 1.27890625,
|
|
"epoch": 0.3949706163728304,
|
|
"grad_norm": 0.12126739888536447,
|
|
"learning_rate": 4.137311540087361e-06,
|
|
"loss": 0.9808,
|
|
"mean_token_accuracy": 0.7561534821987153,
|
|
"num_tokens": 266715918.0,
|
|
"step": 2890
|
|
},
|
|
{
|
|
"entropy": 1.31328125,
|
|
"epoch": 0.3963372967063004,
|
|
"grad_norm": 0.13873678205114381,
|
|
"learning_rate": 4.133788924897845e-06,
|
|
"loss": 1.0001,
|
|
"mean_token_accuracy": 0.7505159139633178,
|
|
"num_tokens": 267644209.0,
|
|
"step": 2900
|
|
},
|
|
{
|
|
"entropy": 1.2125,
|
|
"epoch": 0.3977039770397704,
|
|
"grad_norm": 0.11304763437812376,
|
|
"learning_rate": 4.130266309708328e-06,
|
|
"loss": 0.9062,
|
|
"mean_token_accuracy": 0.7710237801074982,
|
|
"num_tokens": 268556439.0,
|
|
"step": 2910
|
|
},
|
|
{
|
|
"entropy": 1.3078125,
|
|
"epoch": 0.3990706573732404,
|
|
"grad_norm": 0.12457122843319371,
|
|
"learning_rate": 4.126743694518811e-06,
|
|
"loss": 1.0241,
|
|
"mean_token_accuracy": 0.7465944230556488,
|
|
"num_tokens": 269504566.0,
|
|
"step": 2920
|
|
},
|
|
{
|
|
"entropy": 1.2484375,
|
|
"epoch": 0.4004373377067104,
|
|
"grad_norm": 0.12466748209141407,
|
|
"learning_rate": 4.123221079329294e-06,
|
|
"loss": 0.9359,
|
|
"mean_token_accuracy": 0.762515252828598,
|
|
"num_tokens": 270367741.0,
|
|
"step": 2930
|
|
},
|
|
{
|
|
"entropy": 1.27734375,
|
|
"epoch": 0.4018040180401804,
|
|
"grad_norm": 0.13263496408554384,
|
|
"learning_rate": 4.1196984641397774e-06,
|
|
"loss": 0.9934,
|
|
"mean_token_accuracy": 0.7514382243156433,
|
|
"num_tokens": 271271744.0,
|
|
"step": 2940
|
|
},
|
|
{
|
|
"entropy": 1.2203125,
|
|
"epoch": 0.4031706983736504,
|
|
"grad_norm": 0.11726351948532596,
|
|
"learning_rate": 4.116175848950261e-06,
|
|
"loss": 0.9107,
|
|
"mean_token_accuracy": 0.7709009408950805,
|
|
"num_tokens": 272171745.0,
|
|
"step": 2950
|
|
},
|
|
{
|
|
"entropy": 1.2375,
|
|
"epoch": 0.4045373787071204,
|
|
"grad_norm": 0.140663603017298,
|
|
"learning_rate": 4.1126532337607445e-06,
|
|
"loss": 0.9103,
|
|
"mean_token_accuracy": 0.7675256133079529,
|
|
"num_tokens": 273016295.0,
|
|
"step": 2960
|
|
},
|
|
{
|
|
"entropy": 1.2734375,
|
|
"epoch": 0.4059040590405904,
|
|
"grad_norm": 0.15126997276298143,
|
|
"learning_rate": 4.109130618571227e-06,
|
|
"loss": 0.9706,
|
|
"mean_token_accuracy": 0.7576745688915253,
|
|
"num_tokens": 273956028.0,
|
|
"step": 2970
|
|
},
|
|
{
|
|
"entropy": 1.2765625,
|
|
"epoch": 0.4072707393740604,
|
|
"grad_norm": 0.126765665671319,
|
|
"learning_rate": 4.105608003381711e-06,
|
|
"loss": 0.9615,
|
|
"mean_token_accuracy": 0.7541747689247131,
|
|
"num_tokens": 274864033.0,
|
|
"step": 2980
|
|
},
|
|
{
|
|
"entropy": 1.21484375,
|
|
"epoch": 0.4086374197075304,
|
|
"grad_norm": 0.12256257171111047,
|
|
"learning_rate": 4.102085388192194e-06,
|
|
"loss": 0.9519,
|
|
"mean_token_accuracy": 0.761723518371582,
|
|
"num_tokens": 275771714.0,
|
|
"step": 2990
|
|
},
|
|
{
|
|
"entropy": 1.2515625,
|
|
"epoch": 0.4100041000410004,
|
|
"grad_norm": 0.130913956953062,
|
|
"learning_rate": 4.098562773002678e-06,
|
|
"loss": 0.9969,
|
|
"mean_token_accuracy": 0.7480932772159576,
|
|
"num_tokens": 276671468.0,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"entropy": 1.2296875,
|
|
"epoch": 0.4113707803744704,
|
|
"grad_norm": 0.12171779113900248,
|
|
"learning_rate": 4.095040157813161e-06,
|
|
"loss": 0.9527,
|
|
"mean_token_accuracy": 0.7593825876712799,
|
|
"num_tokens": 277629191.0,
|
|
"step": 3010
|
|
},
|
|
{
|
|
"entropy": 1.27734375,
|
|
"epoch": 0.41273746070794043,
|
|
"grad_norm": 0.1379148768498411,
|
|
"learning_rate": 4.091517542623644e-06,
|
|
"loss": 0.9954,
|
|
"mean_token_accuracy": 0.7521135985851288,
|
|
"num_tokens": 278530380.0,
|
|
"step": 3020
|
|
},
|
|
{
|
|
"entropy": 1.3109375,
|
|
"epoch": 0.4141041410414104,
|
|
"grad_norm": 0.13699603748242356,
|
|
"learning_rate": 4.087994927434128e-06,
|
|
"loss": 1.0137,
|
|
"mean_token_accuracy": 0.7479040265083313,
|
|
"num_tokens": 279444562.0,
|
|
"step": 3030
|
|
},
|
|
{
|
|
"entropy": 1.26484375,
|
|
"epoch": 0.4154708213748804,
|
|
"grad_norm": 0.1133356462613048,
|
|
"learning_rate": 4.08447231224461e-06,
|
|
"loss": 0.9887,
|
|
"mean_token_accuracy": 0.7510132670402527,
|
|
"num_tokens": 280334745.0,
|
|
"step": 3040
|
|
},
|
|
{
|
|
"entropy": 1.2078125,
|
|
"epoch": 0.41683750170835043,
|
|
"grad_norm": 0.12788849655451293,
|
|
"learning_rate": 4.080949697055094e-06,
|
|
"loss": 0.911,
|
|
"mean_token_accuracy": 0.7673490345478058,
|
|
"num_tokens": 281213602.0,
|
|
"step": 3050
|
|
},
|
|
{
|
|
"entropy": 1.2234375,
|
|
"epoch": 0.4182041820418204,
|
|
"grad_norm": 0.13599920774393218,
|
|
"learning_rate": 4.0774270818655775e-06,
|
|
"loss": 0.9495,
|
|
"mean_token_accuracy": 0.7614608347415924,
|
|
"num_tokens": 282155704.0,
|
|
"step": 3060
|
|
},
|
|
{
|
|
"entropy": 1.29296875,
|
|
"epoch": 0.4195708623752904,
|
|
"grad_norm": 0.13022038598012411,
|
|
"learning_rate": 4.073904466676061e-06,
|
|
"loss": 1.0187,
|
|
"mean_token_accuracy": 0.747229254245758,
|
|
"num_tokens": 283060115.0,
|
|
"step": 3070
|
|
},
|
|
{
|
|
"entropy": 1.2734375,
|
|
"epoch": 0.42093754270876044,
|
|
"grad_norm": 0.13986442237771723,
|
|
"learning_rate": 4.070381851486544e-06,
|
|
"loss": 0.9743,
|
|
"mean_token_accuracy": 0.7589122593402863,
|
|
"num_tokens": 284015383.0,
|
|
"step": 3080
|
|
},
|
|
{
|
|
"entropy": 1.234375,
|
|
"epoch": 0.4223042230422304,
|
|
"grad_norm": 0.11901543076020049,
|
|
"learning_rate": 4.066859236297027e-06,
|
|
"loss": 0.9448,
|
|
"mean_token_accuracy": 0.762594211101532,
|
|
"num_tokens": 284957286.0,
|
|
"step": 3090
|
|
},
|
|
{
|
|
"entropy": 1.26796875,
|
|
"epoch": 0.4236709033757004,
|
|
"grad_norm": 0.1350093939032282,
|
|
"learning_rate": 4.06333662110751e-06,
|
|
"loss": 0.9736,
|
|
"mean_token_accuracy": 0.757775628566742,
|
|
"num_tokens": 285849739.0,
|
|
"step": 3100
|
|
},
|
|
{
|
|
"entropy": 1.30234375,
|
|
"epoch": 0.42503758370917044,
|
|
"grad_norm": 0.12287991241788483,
|
|
"learning_rate": 4.059814005917994e-06,
|
|
"loss": 1.0255,
|
|
"mean_token_accuracy": 0.7456580936908722,
|
|
"num_tokens": 286816194.0,
|
|
"step": 3110
|
|
},
|
|
{
|
|
"entropy": 1.24921875,
|
|
"epoch": 0.4264042640426404,
|
|
"grad_norm": 0.12446554929971927,
|
|
"learning_rate": 4.056291390728477e-06,
|
|
"loss": 0.974,
|
|
"mean_token_accuracy": 0.7579060673713685,
|
|
"num_tokens": 287733305.0,
|
|
"step": 3120
|
|
},
|
|
{
|
|
"entropy": 1.30703125,
|
|
"epoch": 0.4277709443761104,
|
|
"grad_norm": 0.13975498297453887,
|
|
"learning_rate": 4.052768775538961e-06,
|
|
"loss": 1.0011,
|
|
"mean_token_accuracy": 0.7532932877540588,
|
|
"num_tokens": 288676265.0,
|
|
"step": 3130
|
|
},
|
|
{
|
|
"entropy": 1.26796875,
|
|
"epoch": 0.42913762470958045,
|
|
"grad_norm": 0.13586003080848302,
|
|
"learning_rate": 4.049246160349444e-06,
|
|
"loss": 1.0258,
|
|
"mean_token_accuracy": 0.7488530158996582,
|
|
"num_tokens": 289628921.0,
|
|
"step": 3140
|
|
},
|
|
{
|
|
"entropy": 1.23828125,
|
|
"epoch": 0.43050430504305043,
|
|
"grad_norm": 0.1208541613574602,
|
|
"learning_rate": 4.045723545159927e-06,
|
|
"loss": 0.9391,
|
|
"mean_token_accuracy": 0.7632901251316071,
|
|
"num_tokens": 290508054.0,
|
|
"step": 3150
|
|
},
|
|
{
|
|
"entropy": 1.19765625,
|
|
"epoch": 0.4318709853765204,
|
|
"grad_norm": 0.11664169687036528,
|
|
"learning_rate": 4.04220092997041e-06,
|
|
"loss": 0.9071,
|
|
"mean_token_accuracy": 0.7705417335033417,
|
|
"num_tokens": 291445061.0,
|
|
"step": 3160
|
|
},
|
|
{
|
|
"entropy": 1.24453125,
|
|
"epoch": 0.43323766570999045,
|
|
"grad_norm": 0.12246933644441066,
|
|
"learning_rate": 4.038678314780894e-06,
|
|
"loss": 0.9501,
|
|
"mean_token_accuracy": 0.7614389896392822,
|
|
"num_tokens": 292415043.0,
|
|
"step": 3170
|
|
},
|
|
{
|
|
"entropy": 1.2375,
|
|
"epoch": 0.43460434604346043,
|
|
"grad_norm": 0.11210575101845173,
|
|
"learning_rate": 4.0351556995913775e-06,
|
|
"loss": 1.0032,
|
|
"mean_token_accuracy": 0.7502185940742493,
|
|
"num_tokens": 293378677.0,
|
|
"step": 3180
|
|
},
|
|
{
|
|
"entropy": 1.25234375,
|
|
"epoch": 0.4359710263769304,
|
|
"grad_norm": 0.11192251431512928,
|
|
"learning_rate": 4.03163308440186e-06,
|
|
"loss": 0.9953,
|
|
"mean_token_accuracy": 0.7516265749931336,
|
|
"num_tokens": 294289221.0,
|
|
"step": 3190
|
|
},
|
|
{
|
|
"entropy": 1.26171875,
|
|
"epoch": 0.43733770671040045,
|
|
"grad_norm": 0.1291890743120376,
|
|
"learning_rate": 4.028110469212344e-06,
|
|
"loss": 1.0094,
|
|
"mean_token_accuracy": 0.7532454848289489,
|
|
"num_tokens": 295166106.0,
|
|
"step": 3200
|
|
},
|
|
{
|
|
"entropy": 1.24609375,
|
|
"epoch": 0.43870438704387044,
|
|
"grad_norm": 0.11214395867691117,
|
|
"learning_rate": 4.0245878540228264e-06,
|
|
"loss": 0.9539,
|
|
"mean_token_accuracy": 0.7585363388061523,
|
|
"num_tokens": 296076562.0,
|
|
"step": 3210
|
|
},
|
|
{
|
|
"entropy": 1.28203125,
|
|
"epoch": 0.4400710673773404,
|
|
"grad_norm": 0.12450644103631274,
|
|
"learning_rate": 4.02106523883331e-06,
|
|
"loss": 0.9933,
|
|
"mean_token_accuracy": 0.7527141392230987,
|
|
"num_tokens": 296967830.0,
|
|
"step": 3220
|
|
},
|
|
{
|
|
"entropy": 1.21328125,
|
|
"epoch": 0.44143774771081046,
|
|
"grad_norm": 0.12207861278703959,
|
|
"learning_rate": 4.0175426236437935e-06,
|
|
"loss": 0.9616,
|
|
"mean_token_accuracy": 0.7606665968894959,
|
|
"num_tokens": 297854033.0,
|
|
"step": 3230
|
|
},
|
|
{
|
|
"entropy": 1.24375,
|
|
"epoch": 0.44280442804428044,
|
|
"grad_norm": 0.12419026435276011,
|
|
"learning_rate": 4.014020008454277e-06,
|
|
"loss": 0.9672,
|
|
"mean_token_accuracy": 0.75772465467453,
|
|
"num_tokens": 298775899.0,
|
|
"step": 3240
|
|
},
|
|
{
|
|
"entropy": 1.22578125,
|
|
"epoch": 0.4441711083777504,
|
|
"grad_norm": 0.12312441857774363,
|
|
"learning_rate": 4.01049739326476e-06,
|
|
"loss": 0.9703,
|
|
"mean_token_accuracy": 0.7534873306751251,
|
|
"num_tokens": 299644998.0,
|
|
"step": 3250
|
|
},
|
|
{
|
|
"entropy": 1.2515625,
|
|
"epoch": 0.44553778871122046,
|
|
"grad_norm": 0.11886125555688976,
|
|
"learning_rate": 4.006974778075243e-06,
|
|
"loss": 0.9732,
|
|
"mean_token_accuracy": 0.7578278481960297,
|
|
"num_tokens": 300579588.0,
|
|
"step": 3260
|
|
},
|
|
{
|
|
"entropy": 1.2671875,
|
|
"epoch": 0.44690446904469044,
|
|
"grad_norm": 0.12514056016128405,
|
|
"learning_rate": 4.003452162885727e-06,
|
|
"loss": 0.9954,
|
|
"mean_token_accuracy": 0.7466191649436951,
|
|
"num_tokens": 301539377.0,
|
|
"step": 3270
|
|
},
|
|
{
|
|
"entropy": 1.2015625,
|
|
"epoch": 0.4482711493781604,
|
|
"grad_norm": 0.1328142628560664,
|
|
"learning_rate": 3.99992954769621e-06,
|
|
"loss": 0.9433,
|
|
"mean_token_accuracy": 0.7615683376789093,
|
|
"num_tokens": 302459676.0,
|
|
"step": 3280
|
|
},
|
|
{
|
|
"entropy": 1.2171875,
|
|
"epoch": 0.44963782971163047,
|
|
"grad_norm": 0.12006595622887442,
|
|
"learning_rate": 3.996406932506693e-06,
|
|
"loss": 0.965,
|
|
"mean_token_accuracy": 0.7564208507537842,
|
|
"num_tokens": 303424014.0,
|
|
"step": 3290
|
|
},
|
|
{
|
|
"entropy": 1.19453125,
|
|
"epoch": 0.45100451004510045,
|
|
"grad_norm": 0.13392807625872066,
|
|
"learning_rate": 3.992884317317177e-06,
|
|
"loss": 0.9636,
|
|
"mean_token_accuracy": 0.7565394222736359,
|
|
"num_tokens": 304396334.0,
|
|
"step": 3300
|
|
},
|
|
{
|
|
"entropy": 1.29375,
|
|
"epoch": 0.45237119037857043,
|
|
"grad_norm": 0.13605182988789913,
|
|
"learning_rate": 3.98936170212766e-06,
|
|
"loss": 0.9953,
|
|
"mean_token_accuracy": 0.753360903263092,
|
|
"num_tokens": 305340507.0,
|
|
"step": 3310
|
|
},
|
|
{
|
|
"entropy": 1.2078125,
|
|
"epoch": 0.45373787071204047,
|
|
"grad_norm": 0.1200143089311993,
|
|
"learning_rate": 3.985839086938143e-06,
|
|
"loss": 0.9253,
|
|
"mean_token_accuracy": 0.764511102437973,
|
|
"num_tokens": 306253804.0,
|
|
"step": 3320
|
|
},
|
|
{
|
|
"entropy": 1.2640625,
|
|
"epoch": 0.45510455104551045,
|
|
"grad_norm": 0.13298022310290086,
|
|
"learning_rate": 3.9823164717486265e-06,
|
|
"loss": 1.0155,
|
|
"mean_token_accuracy": 0.748230516910553,
|
|
"num_tokens": 307219655.0,
|
|
"step": 3330
|
|
},
|
|
{
|
|
"entropy": 1.2515625,
|
|
"epoch": 0.45647123137898044,
|
|
"grad_norm": 0.11715551544262476,
|
|
"learning_rate": 3.97879385655911e-06,
|
|
"loss": 0.987,
|
|
"mean_token_accuracy": 0.7544230639934539,
|
|
"num_tokens": 308120248.0,
|
|
"step": 3340
|
|
},
|
|
{
|
|
"entropy": 1.28125,
|
|
"epoch": 0.4578379117124505,
|
|
"grad_norm": 0.11976989566055495,
|
|
"learning_rate": 3.9752712413695936e-06,
|
|
"loss": 0.9816,
|
|
"mean_token_accuracy": 0.7536222696304321,
|
|
"num_tokens": 309033220.0,
|
|
"step": 3350
|
|
},
|
|
{
|
|
"entropy": 1.34375,
|
|
"epoch": 0.45920459204592046,
|
|
"grad_norm": 0.11863068010949905,
|
|
"learning_rate": 3.971748626180076e-06,
|
|
"loss": 1.0295,
|
|
"mean_token_accuracy": 0.7439517617225647,
|
|
"num_tokens": 309966122.0,
|
|
"step": 3360
|
|
},
|
|
{
|
|
"entropy": 1.24140625,
|
|
"epoch": 0.46057127237939044,
|
|
"grad_norm": 0.12538969255376853,
|
|
"learning_rate": 3.96822601099056e-06,
|
|
"loss": 0.9817,
|
|
"mean_token_accuracy": 0.7539013266563416,
|
|
"num_tokens": 310927570.0,
|
|
"step": 3370
|
|
},
|
|
{
|
|
"entropy": 1.253125,
|
|
"epoch": 0.4619379527128605,
|
|
"grad_norm": 0.12042289217376595,
|
|
"learning_rate": 3.9647033958010425e-06,
|
|
"loss": 1.0289,
|
|
"mean_token_accuracy": 0.7460577666759491,
|
|
"num_tokens": 311832124.0,
|
|
"step": 3380
|
|
},
|
|
{
|
|
"entropy": 1.26875,
|
|
"epoch": 0.46330463304633046,
|
|
"grad_norm": 0.1351553210577192,
|
|
"learning_rate": 3.961180780611527e-06,
|
|
"loss": 0.9645,
|
|
"mean_token_accuracy": 0.7578821778297424,
|
|
"num_tokens": 312752210.0,
|
|
"step": 3390
|
|
},
|
|
{
|
|
"entropy": 1.2796875,
|
|
"epoch": 0.46467131337980044,
|
|
"grad_norm": 0.11084732619559022,
|
|
"learning_rate": 3.95765816542201e-06,
|
|
"loss": 1.0066,
|
|
"mean_token_accuracy": 0.7528740644454956,
|
|
"num_tokens": 313721040.0,
|
|
"step": 3400
|
|
},
|
|
{
|
|
"entropy": 1.21640625,
|
|
"epoch": 0.4660379937132705,
|
|
"grad_norm": 0.11744281785876302,
|
|
"learning_rate": 3.954135550232493e-06,
|
|
"loss": 0.947,
|
|
"mean_token_accuracy": 0.759137898683548,
|
|
"num_tokens": 314623635.0,
|
|
"step": 3410
|
|
},
|
|
{
|
|
"entropy": 1.265625,
|
|
"epoch": 0.46740467404674046,
|
|
"grad_norm": 0.12911835346165434,
|
|
"learning_rate": 3.950612935042976e-06,
|
|
"loss": 0.9841,
|
|
"mean_token_accuracy": 0.7537752151489258,
|
|
"num_tokens": 315549717.0,
|
|
"step": 3420
|
|
},
|
|
{
|
|
"entropy": 1.21953125,
|
|
"epoch": 0.46877135438021045,
|
|
"grad_norm": 0.13461386607542372,
|
|
"learning_rate": 3.947090319853459e-06,
|
|
"loss": 0.9683,
|
|
"mean_token_accuracy": 0.7575112998485565,
|
|
"num_tokens": 316459223.0,
|
|
"step": 3430
|
|
},
|
|
{
|
|
"entropy": 1.31328125,
|
|
"epoch": 0.4701380347136805,
|
|
"grad_norm": 0.15521135094361013,
|
|
"learning_rate": 3.943567704663943e-06,
|
|
"loss": 1.0236,
|
|
"mean_token_accuracy": 0.747909027338028,
|
|
"num_tokens": 317359360.0,
|
|
"step": 3440
|
|
},
|
|
{
|
|
"entropy": 1.24921875,
|
|
"epoch": 0.47150471504715047,
|
|
"grad_norm": 0.1347265106125518,
|
|
"learning_rate": 3.9400450894744265e-06,
|
|
"loss": 1.0055,
|
|
"mean_token_accuracy": 0.7497696459293366,
|
|
"num_tokens": 318239868.0,
|
|
"step": 3450
|
|
},
|
|
{
|
|
"entropy": 1.28828125,
|
|
"epoch": 0.47287139538062045,
|
|
"grad_norm": 0.13766070564824334,
|
|
"learning_rate": 3.936522474284909e-06,
|
|
"loss": 0.984,
|
|
"mean_token_accuracy": 0.7544755637645721,
|
|
"num_tokens": 319176882.0,
|
|
"step": 3460
|
|
},
|
|
{
|
|
"entropy": 1.24296875,
|
|
"epoch": 0.4742380757140905,
|
|
"grad_norm": 0.13599578414735836,
|
|
"learning_rate": 3.932999859095393e-06,
|
|
"loss": 0.9625,
|
|
"mean_token_accuracy": 0.7607371151447296,
|
|
"num_tokens": 320165510.0,
|
|
"step": 3470
|
|
},
|
|
{
|
|
"entropy": 1.22734375,
|
|
"epoch": 0.4756047560475605,
|
|
"grad_norm": 0.12538669985281217,
|
|
"learning_rate": 3.929477243905876e-06,
|
|
"loss": 0.9478,
|
|
"mean_token_accuracy": 0.7627916932106018,
|
|
"num_tokens": 321088771.0,
|
|
"step": 3480
|
|
},
|
|
{
|
|
"entropy": 1.275,
|
|
"epoch": 0.47697143638103046,
|
|
"grad_norm": 0.14021100070356282,
|
|
"learning_rate": 3.925954628716359e-06,
|
|
"loss": 0.9647,
|
|
"mean_token_accuracy": 0.761043381690979,
|
|
"num_tokens": 322002114.0,
|
|
"step": 3490
|
|
},
|
|
{
|
|
"entropy": 1.26171875,
|
|
"epoch": 0.4783381167145005,
|
|
"grad_norm": 0.12845181692363675,
|
|
"learning_rate": 3.9224320135268425e-06,
|
|
"loss": 0.9747,
|
|
"mean_token_accuracy": 0.7540916919708252,
|
|
"num_tokens": 322898306.0,
|
|
"step": 3500
|
|
},
|
|
{
|
|
"entropy": 1.265625,
|
|
"epoch": 0.4797047970479705,
|
|
"grad_norm": 0.13795697890288297,
|
|
"learning_rate": 3.918909398337326e-06,
|
|
"loss": 0.9756,
|
|
"mean_token_accuracy": 0.7557002067565918,
|
|
"num_tokens": 323816623.0,
|
|
"step": 3510
|
|
},
|
|
{
|
|
"entropy": 1.2390625,
|
|
"epoch": 0.48107147738144046,
|
|
"grad_norm": 0.11623915442641959,
|
|
"learning_rate": 3.91538678314781e-06,
|
|
"loss": 0.981,
|
|
"mean_token_accuracy": 0.7561486601829529,
|
|
"num_tokens": 324757771.0,
|
|
"step": 3520
|
|
},
|
|
{
|
|
"entropy": 1.26953125,
|
|
"epoch": 0.4824381577149105,
|
|
"grad_norm": 0.11268382510653094,
|
|
"learning_rate": 3.911864167958292e-06,
|
|
"loss": 0.9714,
|
|
"mean_token_accuracy": 0.7581970989704132,
|
|
"num_tokens": 325695539.0,
|
|
"step": 3530
|
|
},
|
|
{
|
|
"entropy": 1.23046875,
|
|
"epoch": 0.4838048380483805,
|
|
"grad_norm": 0.13026318787955063,
|
|
"learning_rate": 3.908341552768776e-06,
|
|
"loss": 0.9822,
|
|
"mean_token_accuracy": 0.7538875579833985,
|
|
"num_tokens": 326619627.0,
|
|
"step": 3540
|
|
},
|
|
{
|
|
"entropy": 1.22109375,
|
|
"epoch": 0.48517151838185046,
|
|
"grad_norm": 0.11948996010573154,
|
|
"learning_rate": 3.9048189375792586e-06,
|
|
"loss": 0.9669,
|
|
"mean_token_accuracy": 0.752686756849289,
|
|
"num_tokens": 327522409.0,
|
|
"step": 3550
|
|
},
|
|
{
|
|
"entropy": 1.26953125,
|
|
"epoch": 0.4865381987153205,
|
|
"grad_norm": 0.11291151284778125,
|
|
"learning_rate": 3.901296322389743e-06,
|
|
"loss": 1.0079,
|
|
"mean_token_accuracy": 0.7487696051597595,
|
|
"num_tokens": 328418711.0,
|
|
"step": 3560
|
|
},
|
|
{
|
|
"entropy": 1.27890625,
|
|
"epoch": 0.4879048790487905,
|
|
"grad_norm": 0.12292736270489135,
|
|
"learning_rate": 3.897773707200226e-06,
|
|
"loss": 0.9807,
|
|
"mean_token_accuracy": 0.7554880440235138,
|
|
"num_tokens": 329322871.0,
|
|
"step": 3570
|
|
},
|
|
{
|
|
"entropy": 1.246875,
|
|
"epoch": 0.48927155938226047,
|
|
"grad_norm": 0.13079095336322996,
|
|
"learning_rate": 3.894251092010709e-06,
|
|
"loss": 0.9501,
|
|
"mean_token_accuracy": 0.758570396900177,
|
|
"num_tokens": 330272623.0,
|
|
"step": 3580
|
|
},
|
|
{
|
|
"entropy": 1.21640625,
|
|
"epoch": 0.4906382397157305,
|
|
"grad_norm": 0.1292438890007545,
|
|
"learning_rate": 3.890728476821192e-06,
|
|
"loss": 0.9267,
|
|
"mean_token_accuracy": 0.7659880101680756,
|
|
"num_tokens": 331160163.0,
|
|
"step": 3590
|
|
},
|
|
{
|
|
"entropy": 1.178125,
|
|
"epoch": 0.4920049200492005,
|
|
"grad_norm": 0.1136437626222252,
|
|
"learning_rate": 3.8872058616316755e-06,
|
|
"loss": 0.9129,
|
|
"mean_token_accuracy": 0.7704461991786957,
|
|
"num_tokens": 332041350.0,
|
|
"step": 3600
|
|
},
|
|
{
|
|
"entropy": 1.22890625,
|
|
"epoch": 0.49337160038267047,
|
|
"grad_norm": 0.1278591286782727,
|
|
"learning_rate": 3.883683246442159e-06,
|
|
"loss": 0.9903,
|
|
"mean_token_accuracy": 0.7521268367767334,
|
|
"num_tokens": 332958062.0,
|
|
"step": 3610
|
|
},
|
|
{
|
|
"entropy": 1.25234375,
|
|
"epoch": 0.4947382807161405,
|
|
"grad_norm": 0.11718714649904961,
|
|
"learning_rate": 3.8801606312526426e-06,
|
|
"loss": 0.9335,
|
|
"mean_token_accuracy": 0.7632075905799866,
|
|
"num_tokens": 333926373.0,
|
|
"step": 3620
|
|
},
|
|
{
|
|
"entropy": 1.17734375,
|
|
"epoch": 0.4961049610496105,
|
|
"grad_norm": 0.2450804827465513,
|
|
"learning_rate": 3.876638016063125e-06,
|
|
"loss": 0.903,
|
|
"mean_token_accuracy": 0.7710943758487702,
|
|
"num_tokens": 334867149.0,
|
|
"step": 3630
|
|
},
|
|
{
|
|
"entropy": 1.228125,
|
|
"epoch": 0.4974716413830805,
|
|
"grad_norm": 0.12294409862994264,
|
|
"learning_rate": 3.873115400873609e-06,
|
|
"loss": 0.9338,
|
|
"mean_token_accuracy": 0.7646265625953674,
|
|
"num_tokens": 335748006.0,
|
|
"step": 3640
|
|
},
|
|
{
|
|
"entropy": 1.26015625,
|
|
"epoch": 0.4988383217165505,
|
|
"grad_norm": 0.11575960268010306,
|
|
"learning_rate": 3.869592785684092e-06,
|
|
"loss": 0.9876,
|
|
"mean_token_accuracy": 0.7541362226009369,
|
|
"num_tokens": 336676648.0,
|
|
"step": 3650
|
|
},
|
|
{
|
|
"entropy": 1.23515625,
|
|
"epoch": 0.5002050020500205,
|
|
"grad_norm": 0.11081437221949719,
|
|
"learning_rate": 3.866070170494575e-06,
|
|
"loss": 0.9578,
|
|
"mean_token_accuracy": 0.7615694224834442,
|
|
"num_tokens": 337574385.0,
|
|
"step": 3660
|
|
},
|
|
{
|
|
"entropy": 1.24375,
|
|
"epoch": 0.5015716823834905,
|
|
"grad_norm": 0.1472419161424369,
|
|
"learning_rate": 3.862547555305059e-06,
|
|
"loss": 0.9862,
|
|
"mean_token_accuracy": 0.7528913795948029,
|
|
"num_tokens": 338532100.0,
|
|
"step": 3670
|
|
},
|
|
{
|
|
"entropy": 1.25234375,
|
|
"epoch": 0.5029383627169605,
|
|
"grad_norm": 0.13343116620412887,
|
|
"learning_rate": 3.859024940115542e-06,
|
|
"loss": 0.9729,
|
|
"mean_token_accuracy": 0.7564997255802155,
|
|
"num_tokens": 339464473.0,
|
|
"step": 3680
|
|
},
|
|
{
|
|
"entropy": 1.190625,
|
|
"epoch": 0.5043050430504306,
|
|
"grad_norm": 0.11985049288365528,
|
|
"learning_rate": 3.855502324926026e-06,
|
|
"loss": 0.9181,
|
|
"mean_token_accuracy": 0.7686282753944397,
|
|
"num_tokens": 340432340.0,
|
|
"step": 3690
|
|
},
|
|
{
|
|
"entropy": 1.240625,
|
|
"epoch": 0.5056717233839005,
|
|
"grad_norm": 0.12551242692765946,
|
|
"learning_rate": 3.851979709736508e-06,
|
|
"loss": 0.9571,
|
|
"mean_token_accuracy": 0.7602847635746002,
|
|
"num_tokens": 341335395.0,
|
|
"step": 3700
|
|
},
|
|
{
|
|
"entropy": 1.26875,
|
|
"epoch": 0.5070384037173705,
|
|
"grad_norm": 0.1224808476737284,
|
|
"learning_rate": 3.848457094546992e-06,
|
|
"loss": 0.9852,
|
|
"mean_token_accuracy": 0.753911167383194,
|
|
"num_tokens": 342247450.0,
|
|
"step": 3710
|
|
},
|
|
{
|
|
"entropy": 1.21171875,
|
|
"epoch": 0.5084050840508405,
|
|
"grad_norm": 0.11651810687333262,
|
|
"learning_rate": 3.8449344793574755e-06,
|
|
"loss": 0.9782,
|
|
"mean_token_accuracy": 0.7559613287448883,
|
|
"num_tokens": 343198674.0,
|
|
"step": 3720
|
|
},
|
|
{
|
|
"entropy": 1.25703125,
|
|
"epoch": 0.5097717643843105,
|
|
"grad_norm": 0.1141878497407267,
|
|
"learning_rate": 3.841411864167959e-06,
|
|
"loss": 1.0158,
|
|
"mean_token_accuracy": 0.7474342465400696,
|
|
"num_tokens": 344106894.0,
|
|
"step": 3730
|
|
},
|
|
{
|
|
"entropy": 1.246875,
|
|
"epoch": 0.5111384447177805,
|
|
"grad_norm": 0.1351953032960034,
|
|
"learning_rate": 3.837889248978442e-06,
|
|
"loss": 0.9962,
|
|
"mean_token_accuracy": 0.7500389873981476,
|
|
"num_tokens": 345010494.0,
|
|
"step": 3740
|
|
},
|
|
{
|
|
"entropy": 1.240625,
|
|
"epoch": 0.5125051250512506,
|
|
"grad_norm": 0.12632039819069701,
|
|
"learning_rate": 3.834366633788925e-06,
|
|
"loss": 0.9363,
|
|
"mean_token_accuracy": 0.7643906474113464,
|
|
"num_tokens": 345934020.0,
|
|
"step": 3750
|
|
},
|
|
{
|
|
"entropy": 1.26171875,
|
|
"epoch": 0.5138718053847205,
|
|
"grad_norm": 0.13555228127798455,
|
|
"learning_rate": 3.830844018599408e-06,
|
|
"loss": 0.9532,
|
|
"mean_token_accuracy": 0.760778832435608,
|
|
"num_tokens": 346799355.0,
|
|
"step": 3760
|
|
},
|
|
{
|
|
"entropy": 1.25703125,
|
|
"epoch": 0.5152384857181905,
|
|
"grad_norm": 0.11697582837045174,
|
|
"learning_rate": 3.8273214034098915e-06,
|
|
"loss": 0.9781,
|
|
"mean_token_accuracy": 0.7556431591510773,
|
|
"num_tokens": 347721206.0,
|
|
"step": 3770
|
|
},
|
|
{
|
|
"entropy": 1.2734375,
|
|
"epoch": 0.5166051660516605,
|
|
"grad_norm": 0.15438724907464815,
|
|
"learning_rate": 3.823798788220375e-06,
|
|
"loss": 0.9707,
|
|
"mean_token_accuracy": 0.7561997473239899,
|
|
"num_tokens": 348616795.0,
|
|
"step": 3780
|
|
},
|
|
{
|
|
"entropy": 1.21328125,
|
|
"epoch": 0.5179718463851305,
|
|
"grad_norm": 0.14042482262758116,
|
|
"learning_rate": 3.820276173030859e-06,
|
|
"loss": 0.9504,
|
|
"mean_token_accuracy": 0.762443482875824,
|
|
"num_tokens": 349508928.0,
|
|
"step": 3790
|
|
},
|
|
{
|
|
"entropy": 1.2421875,
|
|
"epoch": 0.5193385267186005,
|
|
"grad_norm": 0.1290238728940998,
|
|
"learning_rate": 3.816753557841341e-06,
|
|
"loss": 0.9408,
|
|
"mean_token_accuracy": 0.762927132844925,
|
|
"num_tokens": 350404276.0,
|
|
"step": 3800
|
|
},
|
|
{
|
|
"entropy": 1.24296875,
|
|
"epoch": 0.5207052070520706,
|
|
"grad_norm": 0.13058242803476863,
|
|
"learning_rate": 3.813230942651825e-06,
|
|
"loss": 0.9952,
|
|
"mean_token_accuracy": 0.7521927654743195,
|
|
"num_tokens": 351273919.0,
|
|
"step": 3810
|
|
},
|
|
{
|
|
"entropy": 1.26484375,
|
|
"epoch": 0.5220718873855406,
|
|
"grad_norm": 0.12111414204144694,
|
|
"learning_rate": 3.809708327462308e-06,
|
|
"loss": 0.9503,
|
|
"mean_token_accuracy": 0.7603338837623597,
|
|
"num_tokens": 352170178.0,
|
|
"step": 3820
|
|
},
|
|
{
|
|
"entropy": 1.271875,
|
|
"epoch": 0.5234385677190105,
|
|
"grad_norm": 0.12698193142358374,
|
|
"learning_rate": 3.806185712272792e-06,
|
|
"loss": 1.0032,
|
|
"mean_token_accuracy": 0.7520676136016846,
|
|
"num_tokens": 353108363.0,
|
|
"step": 3830
|
|
},
|
|
{
|
|
"entropy": 1.321875,
|
|
"epoch": 0.5248052480524805,
|
|
"grad_norm": 0.13601887716777,
|
|
"learning_rate": 3.802663097083275e-06,
|
|
"loss": 1.041,
|
|
"mean_token_accuracy": 0.7445591509342193,
|
|
"num_tokens": 353972875.0,
|
|
"step": 3840
|
|
},
|
|
{
|
|
"entropy": 1.2515625,
|
|
"epoch": 0.5261719283859505,
|
|
"grad_norm": 0.12093257758375703,
|
|
"learning_rate": 3.799140481893758e-06,
|
|
"loss": 0.9674,
|
|
"mean_token_accuracy": 0.7572342395782471,
|
|
"num_tokens": 354864325.0,
|
|
"step": 3850
|
|
},
|
|
{
|
|
"entropy": 1.2328125,
|
|
"epoch": 0.5275386087194205,
|
|
"grad_norm": 0.1181952312619853,
|
|
"learning_rate": 3.7956178667042413e-06,
|
|
"loss": 0.9584,
|
|
"mean_token_accuracy": 0.7602534532546997,
|
|
"num_tokens": 355743210.0,
|
|
"step": 3860
|
|
},
|
|
{
|
|
"entropy": 1.19921875,
|
|
"epoch": 0.5289052890528906,
|
|
"grad_norm": 0.11841728874387891,
|
|
"learning_rate": 3.792095251514725e-06,
|
|
"loss": 0.9494,
|
|
"mean_token_accuracy": 0.7603995203971863,
|
|
"num_tokens": 356680442.0,
|
|
"step": 3870
|
|
},
|
|
{
|
|
"entropy": 1.22578125,
|
|
"epoch": 0.5302719693863606,
|
|
"grad_norm": 0.123018439767606,
|
|
"learning_rate": 3.788572636325208e-06,
|
|
"loss": 0.9717,
|
|
"mean_token_accuracy": 0.7589824318885803,
|
|
"num_tokens": 357633513.0,
|
|
"step": 3880
|
|
},
|
|
{
|
|
"entropy": 1.20546875,
|
|
"epoch": 0.5316386497198305,
|
|
"grad_norm": 0.11891750241170983,
|
|
"learning_rate": 3.7850500211356916e-06,
|
|
"loss": 0.9274,
|
|
"mean_token_accuracy": 0.7641011834144592,
|
|
"num_tokens": 358560575.0,
|
|
"step": 3890
|
|
},
|
|
{
|
|
"entropy": 1.2546875,
|
|
"epoch": 0.5330053300533005,
|
|
"grad_norm": 0.12494797172912903,
|
|
"learning_rate": 3.7815274059461747e-06,
|
|
"loss": 0.9692,
|
|
"mean_token_accuracy": 0.7563157975673676,
|
|
"num_tokens": 359474308.0,
|
|
"step": 3900
|
|
},
|
|
{
|
|
"entropy": 1.22421875,
|
|
"epoch": 0.5343720103867705,
|
|
"grad_norm": 0.121605965600272,
|
|
"learning_rate": 3.7780047907566582e-06,
|
|
"loss": 0.9181,
|
|
"mean_token_accuracy": 0.7674028158187867,
|
|
"num_tokens": 360411784.0,
|
|
"step": 3910
|
|
},
|
|
{
|
|
"entropy": 1.2421875,
|
|
"epoch": 0.5357386907202405,
|
|
"grad_norm": 0.13181338917103982,
|
|
"learning_rate": 3.7744821755671413e-06,
|
|
"loss": 0.9438,
|
|
"mean_token_accuracy": 0.7652172565460205,
|
|
"num_tokens": 361350524.0,
|
|
"step": 3920
|
|
},
|
|
{
|
|
"entropy": 1.25234375,
|
|
"epoch": 0.5371053710537106,
|
|
"grad_norm": 0.1173047734611206,
|
|
"learning_rate": 3.7709595603776245e-06,
|
|
"loss": 0.9604,
|
|
"mean_token_accuracy": 0.7603494167327881,
|
|
"num_tokens": 362283058.0,
|
|
"step": 3930
|
|
},
|
|
{
|
|
"entropy": 1.2609375,
|
|
"epoch": 0.5384720513871806,
|
|
"grad_norm": 0.1337681140883017,
|
|
"learning_rate": 3.767436945188108e-06,
|
|
"loss": 0.9757,
|
|
"mean_token_accuracy": 0.7553689479827881,
|
|
"num_tokens": 363194527.0,
|
|
"step": 3940
|
|
},
|
|
{
|
|
"entropy": 1.2203125,
|
|
"epoch": 0.5398387317206506,
|
|
"grad_norm": 0.12462347393156137,
|
|
"learning_rate": 3.7639143299985916e-06,
|
|
"loss": 0.9419,
|
|
"mean_token_accuracy": 0.7637790679931641,
|
|
"num_tokens": 364108504.0,
|
|
"step": 3950
|
|
},
|
|
{
|
|
"entropy": 1.28046875,
|
|
"epoch": 0.5412054120541205,
|
|
"grad_norm": 0.11714885604964641,
|
|
"learning_rate": 3.7603917148090747e-06,
|
|
"loss": 0.9739,
|
|
"mean_token_accuracy": 0.7582765102386475,
|
|
"num_tokens": 365029878.0,
|
|
"step": 3960
|
|
},
|
|
{
|
|
"entropy": 1.19765625,
|
|
"epoch": 0.5425720923875905,
|
|
"grad_norm": 0.12146600469134891,
|
|
"learning_rate": 3.756869099619558e-06,
|
|
"loss": 0.9185,
|
|
"mean_token_accuracy": 0.7663380563259125,
|
|
"num_tokens": 365964480.0,
|
|
"step": 3970
|
|
},
|
|
{
|
|
"entropy": 1.20703125,
|
|
"epoch": 0.5439387727210605,
|
|
"grad_norm": 0.14309154604604077,
|
|
"learning_rate": 3.753346484430041e-06,
|
|
"loss": 0.937,
|
|
"mean_token_accuracy": 0.7631837487220764,
|
|
"num_tokens": 366872780.0,
|
|
"step": 3980
|
|
},
|
|
{
|
|
"entropy": 1.215625,
|
|
"epoch": 0.5453054530545306,
|
|
"grad_norm": 0.16442800423486617,
|
|
"learning_rate": 3.749823869240524e-06,
|
|
"loss": 0.9394,
|
|
"mean_token_accuracy": 0.7657913148403168,
|
|
"num_tokens": 367776522.0,
|
|
"step": 3990
|
|
},
|
|
{
|
|
"entropy": 1.19453125,
|
|
"epoch": 0.5466721333880006,
|
|
"grad_norm": 0.13907285937187783,
|
|
"learning_rate": 3.746301254051008e-06,
|
|
"loss": 0.9088,
|
|
"mean_token_accuracy": 0.7685202121734619,
|
|
"num_tokens": 368687371.0,
|
|
"step": 4000
|
|
},
|
|
{
|
|
"entropy": 1.2171875,
|
|
"epoch": 0.5480388137214706,
|
|
"grad_norm": 0.12149749651210807,
|
|
"learning_rate": 3.742778638861491e-06,
|
|
"loss": 0.9551,
|
|
"mean_token_accuracy": 0.7599463880062103,
|
|
"num_tokens": 369596596.0,
|
|
"step": 4010
|
|
},
|
|
{
|
|
"entropy": 1.2453125,
|
|
"epoch": 0.5494054940549405,
|
|
"grad_norm": 0.11972350570353041,
|
|
"learning_rate": 3.7392560236719743e-06,
|
|
"loss": 0.9834,
|
|
"mean_token_accuracy": 0.7528489291667938,
|
|
"num_tokens": 370474928.0,
|
|
"step": 4020
|
|
},
|
|
{
|
|
"entropy": 1.175,
|
|
"epoch": 0.5507721743884105,
|
|
"grad_norm": 0.12438498235659869,
|
|
"learning_rate": 3.7357334084824574e-06,
|
|
"loss": 0.9097,
|
|
"mean_token_accuracy": 0.7691805183887481,
|
|
"num_tokens": 371384674.0,
|
|
"step": 4030
|
|
},
|
|
{
|
|
"entropy": 1.20625,
|
|
"epoch": 0.5521388547218805,
|
|
"grad_norm": 0.13216725083071282,
|
|
"learning_rate": 3.732210793292941e-06,
|
|
"loss": 0.9267,
|
|
"mean_token_accuracy": 0.7645229876041413,
|
|
"num_tokens": 372309541.0,
|
|
"step": 4040
|
|
},
|
|
{
|
|
"entropy": 1.26953125,
|
|
"epoch": 0.5535055350553506,
|
|
"grad_norm": 0.12213942025803022,
|
|
"learning_rate": 3.7286881781034245e-06,
|
|
"loss": 0.9687,
|
|
"mean_token_accuracy": 0.7557893037796021,
|
|
"num_tokens": 373247679.0,
|
|
"step": 4050
|
|
},
|
|
{
|
|
"entropy": 1.22578125,
|
|
"epoch": 0.5548722153888206,
|
|
"grad_norm": 0.11925010541186411,
|
|
"learning_rate": 3.7251655629139076e-06,
|
|
"loss": 0.9152,
|
|
"mean_token_accuracy": 0.7668644189834595,
|
|
"num_tokens": 374199142.0,
|
|
"step": 4060
|
|
},
|
|
{
|
|
"entropy": 1.2734375,
|
|
"epoch": 0.5562388957222906,
|
|
"grad_norm": 0.11869318353097456,
|
|
"learning_rate": 3.7216429477243907e-06,
|
|
"loss": 0.9684,
|
|
"mean_token_accuracy": 0.7562341392040253,
|
|
"num_tokens": 375123594.0,
|
|
"step": 4070
|
|
},
|
|
{
|
|
"entropy": 1.234375,
|
|
"epoch": 0.5576055760557606,
|
|
"grad_norm": 0.12300126963538692,
|
|
"learning_rate": 3.7181203325348743e-06,
|
|
"loss": 0.9462,
|
|
"mean_token_accuracy": 0.7627430379390716,
|
|
"num_tokens": 376085352.0,
|
|
"step": 4080
|
|
},
|
|
{
|
|
"entropy": 1.27890625,
|
|
"epoch": 0.5589722563892305,
|
|
"grad_norm": 0.13293022596511572,
|
|
"learning_rate": 3.7145977173453574e-06,
|
|
"loss": 1.0068,
|
|
"mean_token_accuracy": 0.7495386064052582,
|
|
"num_tokens": 376981305.0,
|
|
"step": 4090
|
|
},
|
|
{
|
|
"entropy": 1.22265625,
|
|
"epoch": 0.5603389367227005,
|
|
"grad_norm": 0.11977933626951266,
|
|
"learning_rate": 3.7110751021558405e-06,
|
|
"loss": 0.937,
|
|
"mean_token_accuracy": 0.7630084872245788,
|
|
"num_tokens": 377879583.0,
|
|
"step": 4100
|
|
},
|
|
{
|
|
"entropy": 1.2203125,
|
|
"epoch": 0.5617056170561706,
|
|
"grad_norm": 0.15331099235067527,
|
|
"learning_rate": 3.7075524869663245e-06,
|
|
"loss": 0.9414,
|
|
"mean_token_accuracy": 0.7629482030868531,
|
|
"num_tokens": 378832645.0,
|
|
"step": 4110
|
|
},
|
|
{
|
|
"entropy": 1.2375,
|
|
"epoch": 0.5630722973896406,
|
|
"grad_norm": 0.13734905411539416,
|
|
"learning_rate": 3.7040298717768076e-06,
|
|
"loss": 0.9632,
|
|
"mean_token_accuracy": 0.7597016155719757,
|
|
"num_tokens": 379779952.0,
|
|
"step": 4120
|
|
},
|
|
{
|
|
"entropy": 1.28046875,
|
|
"epoch": 0.5644389777231106,
|
|
"grad_norm": 0.12477811338566287,
|
|
"learning_rate": 3.7005072565872908e-06,
|
|
"loss": 0.9926,
|
|
"mean_token_accuracy": 0.7532250940799713,
|
|
"num_tokens": 380737380.0,
|
|
"step": 4130
|
|
},
|
|
{
|
|
"entropy": 1.2515625,
|
|
"epoch": 0.5658056580565806,
|
|
"grad_norm": 0.1273038545531508,
|
|
"learning_rate": 3.696984641397774e-06,
|
|
"loss": 0.9942,
|
|
"mean_token_accuracy": 0.7524977028369904,
|
|
"num_tokens": 381656151.0,
|
|
"step": 4140
|
|
},
|
|
{
|
|
"entropy": 1.19140625,
|
|
"epoch": 0.5671723383900505,
|
|
"grad_norm": 0.1386446149224366,
|
|
"learning_rate": 3.693462026208257e-06,
|
|
"loss": 0.9128,
|
|
"mean_token_accuracy": 0.7675877153873444,
|
|
"num_tokens": 382571650.0,
|
|
"step": 4150
|
|
},
|
|
{
|
|
"entropy": 1.23671875,
|
|
"epoch": 0.5685390187235205,
|
|
"grad_norm": 0.10794696684282035,
|
|
"learning_rate": 3.689939411018741e-06,
|
|
"loss": 0.9657,
|
|
"mean_token_accuracy": 0.7606060385704041,
|
|
"num_tokens": 383530667.0,
|
|
"step": 4160
|
|
},
|
|
{
|
|
"entropy": 1.1828125,
|
|
"epoch": 0.5699056990569906,
|
|
"grad_norm": 0.12336281027562758,
|
|
"learning_rate": 3.686416795829224e-06,
|
|
"loss": 0.8853,
|
|
"mean_token_accuracy": 0.7739014267921448,
|
|
"num_tokens": 384438746.0,
|
|
"step": 4170
|
|
},
|
|
{
|
|
"entropy": 1.2125,
|
|
"epoch": 0.5712723793904606,
|
|
"grad_norm": 0.13103058506302886,
|
|
"learning_rate": 3.6828941806397072e-06,
|
|
"loss": 0.9569,
|
|
"mean_token_accuracy": 0.7594748914241791,
|
|
"num_tokens": 385325961.0,
|
|
"step": 4180
|
|
},
|
|
{
|
|
"entropy": 1.23203125,
|
|
"epoch": 0.5726390597239306,
|
|
"grad_norm": 0.1175838997183659,
|
|
"learning_rate": 3.6793715654501903e-06,
|
|
"loss": 0.975,
|
|
"mean_token_accuracy": 0.7568680107593536,
|
|
"num_tokens": 386264764.0,
|
|
"step": 4190
|
|
},
|
|
{
|
|
"entropy": 1.2453125,
|
|
"epoch": 0.5740057400574006,
|
|
"grad_norm": 0.13167158181462457,
|
|
"learning_rate": 3.6758489502606735e-06,
|
|
"loss": 0.9715,
|
|
"mean_token_accuracy": 0.7589373588562012,
|
|
"num_tokens": 387231562.0,
|
|
"step": 4200
|
|
},
|
|
{
|
|
"entropy": 1.24921875,
|
|
"epoch": 0.5753724203908706,
|
|
"grad_norm": 0.12710800240431258,
|
|
"learning_rate": 3.672326335071157e-06,
|
|
"loss": 0.9587,
|
|
"mean_token_accuracy": 0.7594258844852447,
|
|
"num_tokens": 388124752.0,
|
|
"step": 4210
|
|
},
|
|
{
|
|
"entropy": 1.23515625,
|
|
"epoch": 0.5767391007243405,
|
|
"grad_norm": 0.12238837509396547,
|
|
"learning_rate": 3.6688037198816406e-06,
|
|
"loss": 0.9368,
|
|
"mean_token_accuracy": 0.763788640499115,
|
|
"num_tokens": 389034093.0,
|
|
"step": 4220
|
|
},
|
|
{
|
|
"entropy": 1.22109375,
|
|
"epoch": 0.5781057810578106,
|
|
"grad_norm": 0.13456356415018342,
|
|
"learning_rate": 3.6652811046921237e-06,
|
|
"loss": 0.9323,
|
|
"mean_token_accuracy": 0.7665305137634277,
|
|
"num_tokens": 389920605.0,
|
|
"step": 4230
|
|
},
|
|
{
|
|
"entropy": 1.21875,
|
|
"epoch": 0.5794724613912806,
|
|
"grad_norm": 0.11770468825389477,
|
|
"learning_rate": 3.6617584895026072e-06,
|
|
"loss": 0.9159,
|
|
"mean_token_accuracy": 0.7682284235954284,
|
|
"num_tokens": 390802728.0,
|
|
"step": 4240
|
|
},
|
|
{
|
|
"entropy": 1.27109375,
|
|
"epoch": 0.5808391417247506,
|
|
"grad_norm": 0.12848310937223403,
|
|
"learning_rate": 3.6582358743130904e-06,
|
|
"loss": 1.0099,
|
|
"mean_token_accuracy": 0.744138753414154,
|
|
"num_tokens": 391735027.0,
|
|
"step": 4250
|
|
},
|
|
{
|
|
"entropy": 1.246875,
|
|
"epoch": 0.5822058220582206,
|
|
"grad_norm": 0.1282906003083693,
|
|
"learning_rate": 3.6547132591235735e-06,
|
|
"loss": 0.9815,
|
|
"mean_token_accuracy": 0.7542316854000092,
|
|
"num_tokens": 392621164.0,
|
|
"step": 4260
|
|
},
|
|
{
|
|
"entropy": 1.26171875,
|
|
"epoch": 0.5835725023916906,
|
|
"grad_norm": 0.13471779410299298,
|
|
"learning_rate": 3.651190643934057e-06,
|
|
"loss": 0.9844,
|
|
"mean_token_accuracy": 0.755744993686676,
|
|
"num_tokens": 393474315.0,
|
|
"step": 4270
|
|
},
|
|
{
|
|
"entropy": 1.2328125,
|
|
"epoch": 0.5849391827251605,
|
|
"grad_norm": 0.119943750991961,
|
|
"learning_rate": 3.6476680287445406e-06,
|
|
"loss": 0.967,
|
|
"mean_token_accuracy": 0.758357685804367,
|
|
"num_tokens": 394416453.0,
|
|
"step": 4280
|
|
},
|
|
{
|
|
"entropy": 1.20703125,
|
|
"epoch": 0.5863058630586306,
|
|
"grad_norm": 0.11277177759389743,
|
|
"learning_rate": 3.6441454135550237e-06,
|
|
"loss": 0.9376,
|
|
"mean_token_accuracy": 0.7651522040367127,
|
|
"num_tokens": 395353788.0,
|
|
"step": 4290
|
|
},
|
|
{
|
|
"entropy": 1.2421875,
|
|
"epoch": 0.5876725433921006,
|
|
"grad_norm": 0.11734342757953227,
|
|
"learning_rate": 3.640622798365507e-06,
|
|
"loss": 0.9774,
|
|
"mean_token_accuracy": 0.7557171225547791,
|
|
"num_tokens": 396277079.0,
|
|
"step": 4300
|
|
},
|
|
{
|
|
"entropy": 1.28828125,
|
|
"epoch": 0.5890392237255706,
|
|
"grad_norm": 0.13344550833545052,
|
|
"learning_rate": 3.63710018317599e-06,
|
|
"loss": 1.0002,
|
|
"mean_token_accuracy": 0.7493975818157196,
|
|
"num_tokens": 397204872.0,
|
|
"step": 4310
|
|
},
|
|
{
|
|
"entropy": 1.303125,
|
|
"epoch": 0.5904059040590406,
|
|
"grad_norm": 0.13498677115816438,
|
|
"learning_rate": 3.633577567986473e-06,
|
|
"loss": 1.0064,
|
|
"mean_token_accuracy": 0.7499499619007111,
|
|
"num_tokens": 398106709.0,
|
|
"step": 4320
|
|
},
|
|
{
|
|
"entropy": 1.234375,
|
|
"epoch": 0.5917725843925106,
|
|
"grad_norm": 0.13390171069211018,
|
|
"learning_rate": 3.630054952796957e-06,
|
|
"loss": 0.9318,
|
|
"mean_token_accuracy": 0.7648610472679138,
|
|
"num_tokens": 399003959.0,
|
|
"step": 4330
|
|
},
|
|
{
|
|
"entropy": 1.296875,
|
|
"epoch": 0.5931392647259806,
|
|
"grad_norm": 0.11070901831737699,
|
|
"learning_rate": 3.62653233760744e-06,
|
|
"loss": 1.0367,
|
|
"mean_token_accuracy": 0.7444121479988098,
|
|
"num_tokens": 399928261.0,
|
|
"step": 4340
|
|
},
|
|
{
|
|
"entropy": 1.221875,
|
|
"epoch": 0.5945059450594506,
|
|
"grad_norm": 0.1285934655693023,
|
|
"learning_rate": 3.6230097224179233e-06,
|
|
"loss": 0.9356,
|
|
"mean_token_accuracy": 0.7656723260879517,
|
|
"num_tokens": 400734644.0,
|
|
"step": 4350
|
|
},
|
|
{
|
|
"entropy": 1.23359375,
|
|
"epoch": 0.5958726253929206,
|
|
"grad_norm": 0.12530866725430773,
|
|
"learning_rate": 3.6194871072284064e-06,
|
|
"loss": 0.965,
|
|
"mean_token_accuracy": 0.7588083207607269,
|
|
"num_tokens": 401677248.0,
|
|
"step": 4360
|
|
},
|
|
{
|
|
"entropy": 1.26953125,
|
|
"epoch": 0.5972393057263906,
|
|
"grad_norm": 0.12812377566056046,
|
|
"learning_rate": 3.61596449203889e-06,
|
|
"loss": 0.9455,
|
|
"mean_token_accuracy": 0.7623443365097046,
|
|
"num_tokens": 402589892.0,
|
|
"step": 4370
|
|
},
|
|
{
|
|
"entropy": 1.19453125,
|
|
"epoch": 0.5986059860598606,
|
|
"grad_norm": 0.11412591490573848,
|
|
"learning_rate": 3.6124418768493735e-06,
|
|
"loss": 0.9316,
|
|
"mean_token_accuracy": 0.7663767099380493,
|
|
"num_tokens": 403493521.0,
|
|
"step": 4380
|
|
},
|
|
{
|
|
"entropy": 1.25,
|
|
"epoch": 0.5999726663933306,
|
|
"grad_norm": 0.15307372712828723,
|
|
"learning_rate": 3.6089192616598566e-06,
|
|
"loss": 0.9808,
|
|
"mean_token_accuracy": 0.7554453611373901,
|
|
"num_tokens": 404481917.0,
|
|
"step": 4390
|
|
},
|
|
{
|
|
"entropy": 1.25390625,
|
|
"epoch": 0.6013393467268006,
|
|
"grad_norm": 0.13618571070582114,
|
|
"learning_rate": 3.6053966464703398e-06,
|
|
"loss": 1.0062,
|
|
"mean_token_accuracy": 0.7515813887119294,
|
|
"num_tokens": 405381103.0,
|
|
"step": 4400
|
|
},
|
|
{
|
|
"entropy": 1.2703125,
|
|
"epoch": 0.6027060270602707,
|
|
"grad_norm": 0.11804634457449506,
|
|
"learning_rate": 3.6018740312808233e-06,
|
|
"loss": 0.9963,
|
|
"mean_token_accuracy": 0.7513442099094391,
|
|
"num_tokens": 406360551.0,
|
|
"step": 4410
|
|
},
|
|
{
|
|
"entropy": 1.234375,
|
|
"epoch": 0.6040727073937406,
|
|
"grad_norm": 0.1297656632573258,
|
|
"learning_rate": 3.5983514160913064e-06,
|
|
"loss": 0.9457,
|
|
"mean_token_accuracy": 0.7585323810577392,
|
|
"num_tokens": 407306942.0,
|
|
"step": 4420
|
|
},
|
|
{
|
|
"entropy": 1.234375,
|
|
"epoch": 0.6054393877272106,
|
|
"grad_norm": 0.1150331647839373,
|
|
"learning_rate": 3.5948288009017895e-06,
|
|
"loss": 0.9637,
|
|
"mean_token_accuracy": 0.7589881181716919,
|
|
"num_tokens": 408238455.0,
|
|
"step": 4430
|
|
},
|
|
{
|
|
"entropy": 1.2625,
|
|
"epoch": 0.6068060680606806,
|
|
"grad_norm": 0.1213934759189937,
|
|
"learning_rate": 3.591306185712273e-06,
|
|
"loss": 1.0035,
|
|
"mean_token_accuracy": 0.7505826413631439,
|
|
"num_tokens": 409152396.0,
|
|
"step": 4440
|
|
},
|
|
{
|
|
"entropy": 1.2890625,
|
|
"epoch": 0.6081727483941506,
|
|
"grad_norm": 0.11538507551086286,
|
|
"learning_rate": 3.5877835705227566e-06,
|
|
"loss": 0.9866,
|
|
"mean_token_accuracy": 0.7536259293556213,
|
|
"num_tokens": 410053504.0,
|
|
"step": 4450
|
|
},
|
|
{
|
|
"entropy": 1.2015625,
|
|
"epoch": 0.6095394287276206,
|
|
"grad_norm": 0.21724060447690666,
|
|
"learning_rate": 3.5842609553332398e-06,
|
|
"loss": 0.957,
|
|
"mean_token_accuracy": 0.7600152015686035,
|
|
"num_tokens": 410972109.0,
|
|
"step": 4460
|
|
},
|
|
{
|
|
"entropy": 1.25234375,
|
|
"epoch": 0.6109061090610907,
|
|
"grad_norm": 0.12291969556183036,
|
|
"learning_rate": 3.580738340143723e-06,
|
|
"loss": 0.9793,
|
|
"mean_token_accuracy": 0.7545647203922272,
|
|
"num_tokens": 411889574.0,
|
|
"step": 4470
|
|
},
|
|
{
|
|
"entropy": 1.22578125,
|
|
"epoch": 0.6122727893945606,
|
|
"grad_norm": 0.12853661872220784,
|
|
"learning_rate": 3.577215724954206e-06,
|
|
"loss": 0.9714,
|
|
"mean_token_accuracy": 0.7561702311038971,
|
|
"num_tokens": 412842473.0,
|
|
"step": 4480
|
|
},
|
|
{
|
|
"entropy": 1.278125,
|
|
"epoch": 0.6136394697280306,
|
|
"grad_norm": 0.11414191301006713,
|
|
"learning_rate": 3.57369310976469e-06,
|
|
"loss": 1.0006,
|
|
"mean_token_accuracy": 0.7484775424003601,
|
|
"num_tokens": 413720887.0,
|
|
"step": 4490
|
|
},
|
|
{
|
|
"entropy": 1.2796875,
|
|
"epoch": 0.6150061500615006,
|
|
"grad_norm": 0.1164033970980803,
|
|
"learning_rate": 3.570170494575173e-06,
|
|
"loss": 0.9783,
|
|
"mean_token_accuracy": 0.7589319348335266,
|
|
"num_tokens": 414663481.0,
|
|
"step": 4500
|
|
},
|
|
{
|
|
"entropy": 1.31328125,
|
|
"epoch": 0.6163728303949706,
|
|
"grad_norm": 0.12328069224968934,
|
|
"learning_rate": 3.5666478793856562e-06,
|
|
"loss": 1.0636,
|
|
"mean_token_accuracy": 0.7396002769470215,
|
|
"num_tokens": 415566128.0,
|
|
"step": 4510
|
|
},
|
|
{
|
|
"entropy": 1.21953125,
|
|
"epoch": 0.6177395107284406,
|
|
"grad_norm": 0.2169966508464091,
|
|
"learning_rate": 3.5631252641961394e-06,
|
|
"loss": 0.9451,
|
|
"mean_token_accuracy": 0.7616720855236053,
|
|
"num_tokens": 416455167.0,
|
|
"step": 4520
|
|
},
|
|
{
|
|
"entropy": 1.17265625,
|
|
"epoch": 0.6191061910619107,
|
|
"grad_norm": 0.12538565744210348,
|
|
"learning_rate": 3.5596026490066225e-06,
|
|
"loss": 0.9066,
|
|
"mean_token_accuracy": 0.7691861927509308,
|
|
"num_tokens": 417403231.0,
|
|
"step": 4530
|
|
},
|
|
{
|
|
"entropy": 1.221875,
|
|
"epoch": 0.6204728713953807,
|
|
"grad_norm": 0.12815431517844805,
|
|
"learning_rate": 3.556080033817106e-06,
|
|
"loss": 0.941,
|
|
"mean_token_accuracy": 0.7641475260257721,
|
|
"num_tokens": 418291523.0,
|
|
"step": 4540
|
|
},
|
|
{
|
|
"entropy": 1.28046875,
|
|
"epoch": 0.6218395517288506,
|
|
"grad_norm": 0.12909459489141545,
|
|
"learning_rate": 3.5525574186275896e-06,
|
|
"loss": 1.0267,
|
|
"mean_token_accuracy": 0.746728491783142,
|
|
"num_tokens": 419177494.0,
|
|
"step": 4550
|
|
},
|
|
{
|
|
"entropy": 1.2671875,
|
|
"epoch": 0.6232062320623206,
|
|
"grad_norm": 0.13319000841776366,
|
|
"learning_rate": 3.5490348034380727e-06,
|
|
"loss": 0.9871,
|
|
"mean_token_accuracy": 0.7540542125701905,
|
|
"num_tokens": 420118197.0,
|
|
"step": 4560
|
|
},
|
|
{
|
|
"entropy": 1.2515625,
|
|
"epoch": 0.6245729123957906,
|
|
"grad_norm": 0.11858822107587845,
|
|
"learning_rate": 3.545512188248556e-06,
|
|
"loss": 0.9728,
|
|
"mean_token_accuracy": 0.755357563495636,
|
|
"num_tokens": 421017126.0,
|
|
"step": 4570
|
|
},
|
|
{
|
|
"entropy": 1.21796875,
|
|
"epoch": 0.6259395927292606,
|
|
"grad_norm": 0.12533849924071994,
|
|
"learning_rate": 3.5419895730590394e-06,
|
|
"loss": 0.9526,
|
|
"mean_token_accuracy": 0.7588722288608551,
|
|
"num_tokens": 421902299.0,
|
|
"step": 4580
|
|
},
|
|
{
|
|
"entropy": 1.27890625,
|
|
"epoch": 0.6273062730627307,
|
|
"grad_norm": 0.1374890961772014,
|
|
"learning_rate": 3.5384669578695225e-06,
|
|
"loss": 0.9793,
|
|
"mean_token_accuracy": 0.7549963474273682,
|
|
"num_tokens": 422810394.0,
|
|
"step": 4590
|
|
},
|
|
{
|
|
"entropy": 1.26796875,
|
|
"epoch": 0.6286729533962007,
|
|
"grad_norm": 0.12706714014691387,
|
|
"learning_rate": 3.534944342680006e-06,
|
|
"loss": 1.0155,
|
|
"mean_token_accuracy": 0.7491903662681579,
|
|
"num_tokens": 423762943.0,
|
|
"step": 4600
|
|
},
|
|
{
|
|
"entropy": 1.22890625,
|
|
"epoch": 0.6300396337296706,
|
|
"grad_norm": 0.1146405260255654,
|
|
"learning_rate": 3.5314217274904896e-06,
|
|
"loss": 0.9643,
|
|
"mean_token_accuracy": 0.7598504424095154,
|
|
"num_tokens": 424688079.0,
|
|
"step": 4610
|
|
},
|
|
{
|
|
"entropy": 1.24921875,
|
|
"epoch": 0.6314063140631406,
|
|
"grad_norm": 0.11884540165195362,
|
|
"learning_rate": 3.5278991123009727e-06,
|
|
"loss": 0.9702,
|
|
"mean_token_accuracy": 0.7576211214065551,
|
|
"num_tokens": 425593816.0,
|
|
"step": 4620
|
|
},
|
|
{
|
|
"entropy": 1.26875,
|
|
"epoch": 0.6327729943966106,
|
|
"grad_norm": 0.1308353321879729,
|
|
"learning_rate": 3.524376497111456e-06,
|
|
"loss": 0.965,
|
|
"mean_token_accuracy": 0.75688915848732,
|
|
"num_tokens": 426535659.0,
|
|
"step": 4630
|
|
},
|
|
{
|
|
"entropy": 1.24453125,
|
|
"epoch": 0.6341396747300806,
|
|
"grad_norm": 0.18286579931147445,
|
|
"learning_rate": 3.520853881921939e-06,
|
|
"loss": 0.9606,
|
|
"mean_token_accuracy": 0.7599182426929474,
|
|
"num_tokens": 427448468.0,
|
|
"step": 4640
|
|
},
|
|
{
|
|
"entropy": 1.2453125,
|
|
"epoch": 0.6355063550635507,
|
|
"grad_norm": 0.11989283182799236,
|
|
"learning_rate": 3.517331266732422e-06,
|
|
"loss": 0.9917,
|
|
"mean_token_accuracy": 0.7558036088943482,
|
|
"num_tokens": 428404261.0,
|
|
"step": 4650
|
|
},
|
|
{
|
|
"entropy": 1.3125,
|
|
"epoch": 0.6368730353970207,
|
|
"grad_norm": 0.12207358149715974,
|
|
"learning_rate": 3.513808651542906e-06,
|
|
"loss": 1.0715,
|
|
"mean_token_accuracy": 0.7406885147094726,
|
|
"num_tokens": 429314923.0,
|
|
"step": 4660
|
|
},
|
|
{
|
|
"entropy": 1.2359375,
|
|
"epoch": 0.6382397157304907,
|
|
"grad_norm": 0.1230217655181167,
|
|
"learning_rate": 3.510286036353389e-06,
|
|
"loss": 0.9186,
|
|
"mean_token_accuracy": 0.7674852669239044,
|
|
"num_tokens": 430177549.0,
|
|
"step": 4670
|
|
},
|
|
{
|
|
"entropy": 1.23984375,
|
|
"epoch": 0.6396063960639606,
|
|
"grad_norm": 0.11916656093193993,
|
|
"learning_rate": 3.5067634211638723e-06,
|
|
"loss": 0.9353,
|
|
"mean_token_accuracy": 0.7642612874507904,
|
|
"num_tokens": 431135284.0,
|
|
"step": 4680
|
|
},
|
|
{
|
|
"entropy": 1.22421875,
|
|
"epoch": 0.6409730763974306,
|
|
"grad_norm": 0.2071279765930979,
|
|
"learning_rate": 3.5032408059743554e-06,
|
|
"loss": 0.9308,
|
|
"mean_token_accuracy": 0.7650740087032318,
|
|
"num_tokens": 432065066.0,
|
|
"step": 4690
|
|
},
|
|
{
|
|
"entropy": 1.2359375,
|
|
"epoch": 0.6423397567309006,
|
|
"grad_norm": 0.12615225743308134,
|
|
"learning_rate": 3.499718190784839e-06,
|
|
"loss": 0.9619,
|
|
"mean_token_accuracy": 0.7585995674133301,
|
|
"num_tokens": 432943463.0,
|
|
"step": 4700
|
|
},
|
|
{
|
|
"entropy": 1.23828125,
|
|
"epoch": 0.6437064370643707,
|
|
"grad_norm": 0.13287519157046074,
|
|
"learning_rate": 3.4961955755953225e-06,
|
|
"loss": 0.9984,
|
|
"mean_token_accuracy": 0.7508528411388398,
|
|
"num_tokens": 433869594.0,
|
|
"step": 4710
|
|
},
|
|
{
|
|
"entropy": 1.26796875,
|
|
"epoch": 0.6450731173978407,
|
|
"grad_norm": 0.11592857732809306,
|
|
"learning_rate": 3.4926729604058056e-06,
|
|
"loss": 0.964,
|
|
"mean_token_accuracy": 0.7570003628730774,
|
|
"num_tokens": 434779798.0,
|
|
"step": 4720
|
|
},
|
|
{
|
|
"entropy": 1.23046875,
|
|
"epoch": 0.6464397977313107,
|
|
"grad_norm": 0.13081188492053833,
|
|
"learning_rate": 3.4891503452162888e-06,
|
|
"loss": 0.9443,
|
|
"mean_token_accuracy": 0.7636656880378723,
|
|
"num_tokens": 435652803.0,
|
|
"step": 4730
|
|
},
|
|
{
|
|
"entropy": 1.20390625,
|
|
"epoch": 0.6478064780647806,
|
|
"grad_norm": 0.11472877576324227,
|
|
"learning_rate": 3.4856277300267723e-06,
|
|
"loss": 0.9112,
|
|
"mean_token_accuracy": 0.7685281157493591,
|
|
"num_tokens": 436545226.0,
|
|
"step": 4740
|
|
},
|
|
{
|
|
"entropy": 1.23671875,
|
|
"epoch": 0.6491731583982506,
|
|
"grad_norm": 0.12760943954737158,
|
|
"learning_rate": 3.4821051148372554e-06,
|
|
"loss": 0.9635,
|
|
"mean_token_accuracy": 0.7573770821094513,
|
|
"num_tokens": 437438317.0,
|
|
"step": 4750
|
|
},
|
|
{
|
|
"entropy": 1.19921875,
|
|
"epoch": 0.6505398387317206,
|
|
"grad_norm": 0.14205726815019024,
|
|
"learning_rate": 3.4785824996477386e-06,
|
|
"loss": 0.8885,
|
|
"mean_token_accuracy": 0.7727140665054322,
|
|
"num_tokens": 438316880.0,
|
|
"step": 4760
|
|
},
|
|
{
|
|
"entropy": 1.18125,
|
|
"epoch": 0.6519065190651907,
|
|
"grad_norm": 0.12118459133352281,
|
|
"learning_rate": 3.475059884458222e-06,
|
|
"loss": 0.9125,
|
|
"mean_token_accuracy": 0.7676490247249603,
|
|
"num_tokens": 439224474.0,
|
|
"step": 4770
|
|
},
|
|
{
|
|
"entropy": 1.21328125,
|
|
"epoch": 0.6532731993986607,
|
|
"grad_norm": 0.12137794657946813,
|
|
"learning_rate": 3.4715372692687057e-06,
|
|
"loss": 0.9404,
|
|
"mean_token_accuracy": 0.7617349028587341,
|
|
"num_tokens": 440100963.0,
|
|
"step": 4780
|
|
},
|
|
{
|
|
"entropy": 1.26640625,
|
|
"epoch": 0.6546398797321307,
|
|
"grad_norm": 0.12435230372805918,
|
|
"learning_rate": 3.4680146540791888e-06,
|
|
"loss": 0.9818,
|
|
"mean_token_accuracy": 0.756016731262207,
|
|
"num_tokens": 441037518.0,
|
|
"step": 4790
|
|
},
|
|
{
|
|
"entropy": 1.24375,
|
|
"epoch": 0.6560065600656007,
|
|
"grad_norm": 0.11501048494236703,
|
|
"learning_rate": 3.464492038889672e-06,
|
|
"loss": 0.967,
|
|
"mean_token_accuracy": 0.7579561471939087,
|
|
"num_tokens": 441908052.0,
|
|
"step": 4800
|
|
},
|
|
{
|
|
"entropy": 1.23203125,
|
|
"epoch": 0.6573732403990706,
|
|
"grad_norm": 0.1363890096550183,
|
|
"learning_rate": 3.460969423700155e-06,
|
|
"loss": 0.9859,
|
|
"mean_token_accuracy": 0.7527011871337891,
|
|
"num_tokens": 442877731.0,
|
|
"step": 4810
|
|
},
|
|
{
|
|
"entropy": 1.2515625,
|
|
"epoch": 0.6587399207325406,
|
|
"grad_norm": 0.11455274908051266,
|
|
"learning_rate": 3.457446808510639e-06,
|
|
"loss": 0.9667,
|
|
"mean_token_accuracy": 0.7575877368450165,
|
|
"num_tokens": 443815286.0,
|
|
"step": 4820
|
|
},
|
|
{
|
|
"entropy": 1.21875,
|
|
"epoch": 0.6601066010660107,
|
|
"grad_norm": 0.1288961384060167,
|
|
"learning_rate": 3.453924193321122e-06,
|
|
"loss": 0.9464,
|
|
"mean_token_accuracy": 0.7623695969581604,
|
|
"num_tokens": 444773427.0,
|
|
"step": 4830
|
|
},
|
|
{
|
|
"entropy": 1.209375,
|
|
"epoch": 0.6614732813994807,
|
|
"grad_norm": 0.124005986513985,
|
|
"learning_rate": 3.4504015781316052e-06,
|
|
"loss": 0.9229,
|
|
"mean_token_accuracy": 0.7685766100883484,
|
|
"num_tokens": 445718805.0,
|
|
"step": 4840
|
|
},
|
|
{
|
|
"entropy": 1.25390625,
|
|
"epoch": 0.6628399617329507,
|
|
"grad_norm": 0.11902311744722462,
|
|
"learning_rate": 3.4468789629420884e-06,
|
|
"loss": 0.9619,
|
|
"mean_token_accuracy": 0.7585610330104828,
|
|
"num_tokens": 446702383.0,
|
|
"step": 4850
|
|
},
|
|
{
|
|
"entropy": 1.18515625,
|
|
"epoch": 0.6642066420664207,
|
|
"grad_norm": 0.13384995846459538,
|
|
"learning_rate": 3.4433563477525715e-06,
|
|
"loss": 0.9354,
|
|
"mean_token_accuracy": 0.7645944833755494,
|
|
"num_tokens": 447616023.0,
|
|
"step": 4860
|
|
},
|
|
{
|
|
"entropy": 1.2421875,
|
|
"epoch": 0.6655733223998906,
|
|
"grad_norm": 0.11658112273205737,
|
|
"learning_rate": 3.439833732563055e-06,
|
|
"loss": 0.9454,
|
|
"mean_token_accuracy": 0.7621660828590393,
|
|
"num_tokens": 448525850.0,
|
|
"step": 4870
|
|
},
|
|
{
|
|
"entropy": 1.2265625,
|
|
"epoch": 0.6669400027333606,
|
|
"grad_norm": 0.12785433618712516,
|
|
"learning_rate": 3.4363111173735386e-06,
|
|
"loss": 0.9506,
|
|
"mean_token_accuracy": 0.7605822920799256,
|
|
"num_tokens": 449488499.0,
|
|
"step": 4880
|
|
},
|
|
{
|
|
"entropy": 1.22890625,
|
|
"epoch": 0.6683066830668307,
|
|
"grad_norm": 0.12540399540099972,
|
|
"learning_rate": 3.4327885021840217e-06,
|
|
"loss": 0.9611,
|
|
"mean_token_accuracy": 0.758602237701416,
|
|
"num_tokens": 450427887.0,
|
|
"step": 4890
|
|
},
|
|
{
|
|
"entropy": 1.2359375,
|
|
"epoch": 0.6696733634003007,
|
|
"grad_norm": 0.12876145790028365,
|
|
"learning_rate": 3.429265886994505e-06,
|
|
"loss": 0.9902,
|
|
"mean_token_accuracy": 0.7540286421775818,
|
|
"num_tokens": 451388079.0,
|
|
"step": 4900
|
|
},
|
|
{
|
|
"entropy": 1.22734375,
|
|
"epoch": 0.6710400437337707,
|
|
"grad_norm": 0.1335960893447507,
|
|
"learning_rate": 3.4257432718049884e-06,
|
|
"loss": 0.939,
|
|
"mean_token_accuracy": 0.7628871500492096,
|
|
"num_tokens": 452325548.0,
|
|
"step": 4910
|
|
},
|
|
{
|
|
"entropy": 1.2078125,
|
|
"epoch": 0.6724067240672407,
|
|
"grad_norm": 0.1216152731519369,
|
|
"learning_rate": 3.4222206566154715e-06,
|
|
"loss": 0.9836,
|
|
"mean_token_accuracy": 0.756491732597351,
|
|
"num_tokens": 453283517.0,
|
|
"step": 4920
|
|
},
|
|
{
|
|
"entropy": 1.253125,
|
|
"epoch": 0.6737734044007107,
|
|
"grad_norm": 0.1258419249756265,
|
|
"learning_rate": 3.418698041425955e-06,
|
|
"loss": 0.9876,
|
|
"mean_token_accuracy": 0.7520616352558136,
|
|
"num_tokens": 454196973.0,
|
|
"step": 4930
|
|
},
|
|
{
|
|
"entropy": 1.19140625,
|
|
"epoch": 0.6751400847341806,
|
|
"grad_norm": 0.11441147146224404,
|
|
"learning_rate": 3.415175426236438e-06,
|
|
"loss": 0.9239,
|
|
"mean_token_accuracy": 0.7670201480388641,
|
|
"num_tokens": 455141874.0,
|
|
"step": 4940
|
|
},
|
|
{
|
|
"entropy": 1.16484375,
|
|
"epoch": 0.6765067650676507,
|
|
"grad_norm": 0.12180889974500998,
|
|
"learning_rate": 3.4116528110469217e-06,
|
|
"loss": 0.8841,
|
|
"mean_token_accuracy": 0.7768872380256653,
|
|
"num_tokens": 456058190.0,
|
|
"step": 4950
|
|
},
|
|
{
|
|
"entropy": 1.2171875,
|
|
"epoch": 0.6778734454011207,
|
|
"grad_norm": 0.13328939347501176,
|
|
"learning_rate": 3.408130195857405e-06,
|
|
"loss": 0.9224,
|
|
"mean_token_accuracy": 0.7678734838962555,
|
|
"num_tokens": 456928962.0,
|
|
"step": 4960
|
|
},
|
|
{
|
|
"entropy": 1.2546875,
|
|
"epoch": 0.6792401257345907,
|
|
"grad_norm": 0.12953355440367192,
|
|
"learning_rate": 3.404607580667888e-06,
|
|
"loss": 0.9637,
|
|
"mean_token_accuracy": 0.7589364945888519,
|
|
"num_tokens": 457856361.0,
|
|
"step": 4970
|
|
},
|
|
{
|
|
"entropy": 1.20078125,
|
|
"epoch": 0.6806068060680607,
|
|
"grad_norm": 0.1237373218875798,
|
|
"learning_rate": 3.401084965478371e-06,
|
|
"loss": 0.9017,
|
|
"mean_token_accuracy": 0.7720216810703278,
|
|
"num_tokens": 458756840.0,
|
|
"step": 4980
|
|
},
|
|
{
|
|
"entropy": 1.25390625,
|
|
"epoch": 0.6819734864015307,
|
|
"grad_norm": 0.11689643838405551,
|
|
"learning_rate": 3.397562350288855e-06,
|
|
"loss": 0.9613,
|
|
"mean_token_accuracy": 0.7598966181278228,
|
|
"num_tokens": 459682905.0,
|
|
"step": 4990
|
|
},
|
|
{
|
|
"entropy": 1.21328125,
|
|
"epoch": 0.6833401667350006,
|
|
"grad_norm": 0.11711293547736282,
|
|
"learning_rate": 3.394039735099338e-06,
|
|
"loss": 0.9061,
|
|
"mean_token_accuracy": 0.7691078901290893,
|
|
"num_tokens": 460604101.0,
|
|
"step": 5000
|
|
},
|
|
{
|
|
"entropy": 1.190625,
|
|
"epoch": 0.6847068470684707,
|
|
"grad_norm": 0.1330716802245761,
|
|
"learning_rate": 3.3905171199098213e-06,
|
|
"loss": 0.9114,
|
|
"mean_token_accuracy": 0.7658736169338226,
|
|
"num_tokens": 461512991.0,
|
|
"step": 5010
|
|
},
|
|
{
|
|
"entropy": 1.2078125,
|
|
"epoch": 0.6860735274019407,
|
|
"grad_norm": 0.11287343921620734,
|
|
"learning_rate": 3.3869945047203044e-06,
|
|
"loss": 0.9587,
|
|
"mean_token_accuracy": 0.7595264077186584,
|
|
"num_tokens": 462454053.0,
|
|
"step": 5020
|
|
},
|
|
{
|
|
"entropy": 1.22578125,
|
|
"epoch": 0.6874402077354107,
|
|
"grad_norm": 0.1213285726168769,
|
|
"learning_rate": 3.3834718895307876e-06,
|
|
"loss": 0.9187,
|
|
"mean_token_accuracy": 0.7669300138950348,
|
|
"num_tokens": 463360778.0,
|
|
"step": 5030
|
|
},
|
|
{
|
|
"entropy": 1.225,
|
|
"epoch": 0.6888068880688807,
|
|
"grad_norm": 0.11244822356350131,
|
|
"learning_rate": 3.3799492743412715e-06,
|
|
"loss": 0.9341,
|
|
"mean_token_accuracy": 0.7653562486171722,
|
|
"num_tokens": 464284769.0,
|
|
"step": 5040
|
|
},
|
|
{
|
|
"entropy": 1.2,
|
|
"epoch": 0.6901735684023507,
|
|
"grad_norm": 0.12158728306134456,
|
|
"learning_rate": 3.3764266591517547e-06,
|
|
"loss": 0.9218,
|
|
"mean_token_accuracy": 0.7656898140907288,
|
|
"num_tokens": 465220861.0,
|
|
"step": 5050
|
|
},
|
|
{
|
|
"entropy": 1.22890625,
|
|
"epoch": 0.6915402487358207,
|
|
"grad_norm": 0.1336245054662739,
|
|
"learning_rate": 3.3729040439622378e-06,
|
|
"loss": 0.9624,
|
|
"mean_token_accuracy": 0.7580953478813172,
|
|
"num_tokens": 466152597.0,
|
|
"step": 5060
|
|
},
|
|
{
|
|
"entropy": 1.24921875,
|
|
"epoch": 0.6929069290692907,
|
|
"grad_norm": 0.13886333362629993,
|
|
"learning_rate": 3.3693814287727213e-06,
|
|
"loss": 0.9864,
|
|
"mean_token_accuracy": 0.7531047105789185,
|
|
"num_tokens": 467052088.0,
|
|
"step": 5070
|
|
},
|
|
{
|
|
"entropy": 1.26484375,
|
|
"epoch": 0.6942736094027607,
|
|
"grad_norm": 0.14023036004370595,
|
|
"learning_rate": 3.3658588135832044e-06,
|
|
"loss": 0.9843,
|
|
"mean_token_accuracy": 0.7555915892124176,
|
|
"num_tokens": 468034958.0,
|
|
"step": 5080
|
|
},
|
|
{
|
|
"entropy": 1.209375,
|
|
"epoch": 0.6956402897362307,
|
|
"grad_norm": 0.11542959396327225,
|
|
"learning_rate": 3.3623361983936876e-06,
|
|
"loss": 0.9503,
|
|
"mean_token_accuracy": 0.7627318441867829,
|
|
"num_tokens": 469021348.0,
|
|
"step": 5090
|
|
},
|
|
{
|
|
"entropy": 1.24375,
|
|
"epoch": 0.6970069700697007,
|
|
"grad_norm": 0.11483551391203556,
|
|
"learning_rate": 3.358813583204171e-06,
|
|
"loss": 0.9427,
|
|
"mean_token_accuracy": 0.7626381754875183,
|
|
"num_tokens": 469996550.0,
|
|
"step": 5100
|
|
},
|
|
{
|
|
"entropy": 1.29609375,
|
|
"epoch": 0.6983736504031707,
|
|
"grad_norm": 0.13362680417917894,
|
|
"learning_rate": 3.3552909680146547e-06,
|
|
"loss": 0.991,
|
|
"mean_token_accuracy": 0.7522117972373963,
|
|
"num_tokens": 470920985.0,
|
|
"step": 5110
|
|
},
|
|
{
|
|
"entropy": 1.19296875,
|
|
"epoch": 0.6997403307366407,
|
|
"grad_norm": 0.11945837196459316,
|
|
"learning_rate": 3.3517683528251378e-06,
|
|
"loss": 0.9239,
|
|
"mean_token_accuracy": 0.7661639034748078,
|
|
"num_tokens": 471845765.0,
|
|
"step": 5120
|
|
},
|
|
{
|
|
"entropy": 1.20390625,
|
|
"epoch": 0.7011070110701108,
|
|
"grad_norm": 0.13434008578598505,
|
|
"learning_rate": 3.348245737635621e-06,
|
|
"loss": 0.918,
|
|
"mean_token_accuracy": 0.7674703538417816,
|
|
"num_tokens": 472791415.0,
|
|
"step": 5130
|
|
},
|
|
{
|
|
"entropy": 1.2421875,
|
|
"epoch": 0.7024736914035807,
|
|
"grad_norm": 0.11457311359448638,
|
|
"learning_rate": 3.344723122446104e-06,
|
|
"loss": 0.9467,
|
|
"mean_token_accuracy": 0.7599003136157989,
|
|
"num_tokens": 473685911.0,
|
|
"step": 5140
|
|
},
|
|
{
|
|
"entropy": 1.25078125,
|
|
"epoch": 0.7038403717370507,
|
|
"grad_norm": 0.12311471073427073,
|
|
"learning_rate": 3.341200507256587e-06,
|
|
"loss": 0.9665,
|
|
"mean_token_accuracy": 0.7599959433078766,
|
|
"num_tokens": 474598701.0,
|
|
"step": 5150
|
|
},
|
|
{
|
|
"entropy": 1.284375,
|
|
"epoch": 0.7052070520705207,
|
|
"grad_norm": 0.12801430499250305,
|
|
"learning_rate": 3.337677892067071e-06,
|
|
"loss": 0.953,
|
|
"mean_token_accuracy": 0.7617881596088409,
|
|
"num_tokens": 475505552.0,
|
|
"step": 5160
|
|
},
|
|
{
|
|
"entropy": 1.25,
|
|
"epoch": 0.7065737324039907,
|
|
"grad_norm": 0.14872178772163616,
|
|
"learning_rate": 3.3341552768775543e-06,
|
|
"loss": 0.9957,
|
|
"mean_token_accuracy": 0.7490961074829101,
|
|
"num_tokens": 476440433.0,
|
|
"step": 5170
|
|
},
|
|
{
|
|
"entropy": 1.23984375,
|
|
"epoch": 0.7079404127374607,
|
|
"grad_norm": 0.1376092603167847,
|
|
"learning_rate": 3.3306326616880374e-06,
|
|
"loss": 0.9223,
|
|
"mean_token_accuracy": 0.7659748256206512,
|
|
"num_tokens": 477364926.0,
|
|
"step": 5180
|
|
},
|
|
{
|
|
"entropy": 1.2875,
|
|
"epoch": 0.7093070930709308,
|
|
"grad_norm": 0.1263523274995859,
|
|
"learning_rate": 3.3271100464985205e-06,
|
|
"loss": 0.9873,
|
|
"mean_token_accuracy": 0.7533835589885711,
|
|
"num_tokens": 478303729.0,
|
|
"step": 5190
|
|
},
|
|
{
|
|
"entropy": 1.22421875,
|
|
"epoch": 0.7106737734044007,
|
|
"grad_norm": 0.13493562035463832,
|
|
"learning_rate": 3.323587431309004e-06,
|
|
"loss": 0.9415,
|
|
"mean_token_accuracy": 0.7660815477371216,
|
|
"num_tokens": 479265206.0,
|
|
"step": 5200
|
|
},
|
|
{
|
|
"entropy": 1.259375,
|
|
"epoch": 0.7120404537378707,
|
|
"grad_norm": 0.13961562708107467,
|
|
"learning_rate": 3.3200648161194876e-06,
|
|
"loss": 0.9676,
|
|
"mean_token_accuracy": 0.7585438966751099,
|
|
"num_tokens": 480196185.0,
|
|
"step": 5210
|
|
},
|
|
{
|
|
"entropy": 1.22578125,
|
|
"epoch": 0.7134071340713407,
|
|
"grad_norm": 0.12494684780564397,
|
|
"learning_rate": 3.3165422009299707e-06,
|
|
"loss": 0.9603,
|
|
"mean_token_accuracy": 0.7602243900299073,
|
|
"num_tokens": 481119022.0,
|
|
"step": 5220
|
|
},
|
|
{
|
|
"entropy": 1.24765625,
|
|
"epoch": 0.7147738144048107,
|
|
"grad_norm": 0.12341809633215656,
|
|
"learning_rate": 3.313019585740454e-06,
|
|
"loss": 0.9518,
|
|
"mean_token_accuracy": 0.7611356019973755,
|
|
"num_tokens": 482034528.0,
|
|
"step": 5230
|
|
},
|
|
{
|
|
"entropy": 1.259375,
|
|
"epoch": 0.7161404947382807,
|
|
"grad_norm": 0.14224853941993498,
|
|
"learning_rate": 3.3094969705509374e-06,
|
|
"loss": 1.0237,
|
|
"mean_token_accuracy": 0.7457894921302796,
|
|
"num_tokens": 482963072.0,
|
|
"step": 5240
|
|
},
|
|
{
|
|
"entropy": 1.23125,
|
|
"epoch": 0.7175071750717508,
|
|
"grad_norm": 0.12755415030941944,
|
|
"learning_rate": 3.3059743553614205e-06,
|
|
"loss": 0.9591,
|
|
"mean_token_accuracy": 0.7588629722595215,
|
|
"num_tokens": 483869466.0,
|
|
"step": 5250
|
|
},
|
|
{
|
|
"entropy": 1.203125,
|
|
"epoch": 0.7188738554052208,
|
|
"grad_norm": 0.1226865407944381,
|
|
"learning_rate": 3.3024517401719036e-06,
|
|
"loss": 0.9335,
|
|
"mean_token_accuracy": 0.7619938373565673,
|
|
"num_tokens": 484772219.0,
|
|
"step": 5260
|
|
},
|
|
{
|
|
"entropy": 1.23125,
|
|
"epoch": 0.7202405357386907,
|
|
"grad_norm": 0.16427874802542344,
|
|
"learning_rate": 3.298929124982387e-06,
|
|
"loss": 0.9964,
|
|
"mean_token_accuracy": 0.7591086149215698,
|
|
"num_tokens": 485705049.0,
|
|
"step": 5270
|
|
},
|
|
{
|
|
"entropy": 1.26796875,
|
|
"epoch": 0.7216072160721607,
|
|
"grad_norm": 0.1322891132587935,
|
|
"learning_rate": 3.2954065097928707e-06,
|
|
"loss": 0.9811,
|
|
"mean_token_accuracy": 0.7576124548912049,
|
|
"num_tokens": 486647525.0,
|
|
"step": 5280
|
|
},
|
|
{
|
|
"entropy": 1.246875,
|
|
"epoch": 0.7229738964056307,
|
|
"grad_norm": 0.1145023786637747,
|
|
"learning_rate": 3.291883894603354e-06,
|
|
"loss": 0.9865,
|
|
"mean_token_accuracy": 0.7572094023227691,
|
|
"num_tokens": 487571730.0,
|
|
"step": 5290
|
|
},
|
|
{
|
|
"entropy": 1.17890625,
|
|
"epoch": 0.7243405767391007,
|
|
"grad_norm": 0.12690959295342383,
|
|
"learning_rate": 3.288361279413837e-06,
|
|
"loss": 0.9468,
|
|
"mean_token_accuracy": 0.7596337735652924,
|
|
"num_tokens": 488486162.0,
|
|
"step": 5300
|
|
},
|
|
{
|
|
"entropy": 1.19296875,
|
|
"epoch": 0.7257072570725708,
|
|
"grad_norm": 0.11716152671250847,
|
|
"learning_rate": 3.28483866422432e-06,
|
|
"loss": 0.909,
|
|
"mean_token_accuracy": 0.7697879910469055,
|
|
"num_tokens": 489397994.0,
|
|
"step": 5310
|
|
},
|
|
{
|
|
"entropy": 1.24296875,
|
|
"epoch": 0.7270739374060408,
|
|
"grad_norm": 0.13200280140367351,
|
|
"learning_rate": 3.281316049034804e-06,
|
|
"loss": 0.9928,
|
|
"mean_token_accuracy": 0.7490647494792938,
|
|
"num_tokens": 490378487.0,
|
|
"step": 5320
|
|
},
|
|
{
|
|
"entropy": 1.2265625,
|
|
"epoch": 0.7284406177395107,
|
|
"grad_norm": 0.1197749831575555,
|
|
"learning_rate": 3.277793433845287e-06,
|
|
"loss": 0.9187,
|
|
"mean_token_accuracy": 0.7632362484931946,
|
|
"num_tokens": 491314657.0,
|
|
"step": 5330
|
|
},
|
|
{
|
|
"entropy": 1.2296875,
|
|
"epoch": 0.7298072980729807,
|
|
"grad_norm": 0.1343835993927691,
|
|
"learning_rate": 3.2742708186557703e-06,
|
|
"loss": 0.9286,
|
|
"mean_token_accuracy": 0.7668617010116577,
|
|
"num_tokens": 492253180.0,
|
|
"step": 5340
|
|
},
|
|
{
|
|
"entropy": 1.24453125,
|
|
"epoch": 0.7311739784064507,
|
|
"grad_norm": 0.1277588420764466,
|
|
"learning_rate": 3.2707482034662534e-06,
|
|
"loss": 0.9575,
|
|
"mean_token_accuracy": 0.757332706451416,
|
|
"num_tokens": 493185858.0,
|
|
"step": 5350
|
|
},
|
|
{
|
|
"entropy": 1.228125,
|
|
"epoch": 0.7325406587399207,
|
|
"grad_norm": 0.11844866194864036,
|
|
"learning_rate": 3.2672255882767366e-06,
|
|
"loss": 0.9412,
|
|
"mean_token_accuracy": 0.764464271068573,
|
|
"num_tokens": 494110299.0,
|
|
"step": 5360
|
|
},
|
|
{
|
|
"entropy": 1.20390625,
|
|
"epoch": 0.7339073390733908,
|
|
"grad_norm": 0.11251069673895021,
|
|
"learning_rate": 3.26370297308722e-06,
|
|
"loss": 0.9116,
|
|
"mean_token_accuracy": 0.7693102061748505,
|
|
"num_tokens": 495063936.0,
|
|
"step": 5370
|
|
},
|
|
{
|
|
"entropy": 1.23046875,
|
|
"epoch": 0.7352740194068608,
|
|
"grad_norm": 0.1294745372984071,
|
|
"learning_rate": 3.2601803578977037e-06,
|
|
"loss": 0.9628,
|
|
"mean_token_accuracy": 0.7574423909187317,
|
|
"num_tokens": 495982933.0,
|
|
"step": 5380
|
|
},
|
|
{
|
|
"entropy": 1.19140625,
|
|
"epoch": 0.7366406997403308,
|
|
"grad_norm": 0.11558262579097853,
|
|
"learning_rate": 3.2566577427081868e-06,
|
|
"loss": 0.9166,
|
|
"mean_token_accuracy": 0.7665105879306793,
|
|
"num_tokens": 496933673.0,
|
|
"step": 5390
|
|
},
|
|
{
|
|
"entropy": 1.23828125,
|
|
"epoch": 0.7380073800738007,
|
|
"grad_norm": 0.1289732709608144,
|
|
"learning_rate": 3.25313512751867e-06,
|
|
"loss": 0.9455,
|
|
"mean_token_accuracy": 0.7615338742733002,
|
|
"num_tokens": 497833208.0,
|
|
"step": 5400
|
|
},
|
|
{
|
|
"entropy": 1.2734375,
|
|
"epoch": 0.7393740604072707,
|
|
"grad_norm": 0.11431614724630318,
|
|
"learning_rate": 3.2496125123291535e-06,
|
|
"loss": 0.9835,
|
|
"mean_token_accuracy": 0.7563389301300049,
|
|
"num_tokens": 498759050.0,
|
|
"step": 5410
|
|
},
|
|
{
|
|
"entropy": 1.2171875,
|
|
"epoch": 0.7407407407407407,
|
|
"grad_norm": 0.13041702876014885,
|
|
"learning_rate": 3.2460898971396366e-06,
|
|
"loss": 0.9367,
|
|
"mean_token_accuracy": 0.7655919373035431,
|
|
"num_tokens": 499683263.0,
|
|
"step": 5420
|
|
},
|
|
{
|
|
"entropy": 1.2421875,
|
|
"epoch": 0.7421074210742108,
|
|
"grad_norm": 0.13648516855667583,
|
|
"learning_rate": 3.24256728195012e-06,
|
|
"loss": 0.9605,
|
|
"mean_token_accuracy": 0.761204868555069,
|
|
"num_tokens": 500587418.0,
|
|
"step": 5430
|
|
},
|
|
{
|
|
"entropy": 1.2140625,
|
|
"epoch": 0.7434741014076808,
|
|
"grad_norm": 0.11553304258405138,
|
|
"learning_rate": 3.2390446667606037e-06,
|
|
"loss": 0.9334,
|
|
"mean_token_accuracy": 0.7643781483173371,
|
|
"num_tokens": 501538593.0,
|
|
"step": 5440
|
|
},
|
|
{
|
|
"entropy": 1.22890625,
|
|
"epoch": 0.7448407817411508,
|
|
"grad_norm": 0.12779280200830093,
|
|
"learning_rate": 3.235522051571087e-06,
|
|
"loss": 0.9256,
|
|
"mean_token_accuracy": 0.76605064868927,
|
|
"num_tokens": 502458567.0,
|
|
"step": 5450
|
|
},
|
|
{
|
|
"entropy": 1.253125,
|
|
"epoch": 0.7462074620746207,
|
|
"grad_norm": 0.12403867001723268,
|
|
"learning_rate": 3.23199943638157e-06,
|
|
"loss": 0.9557,
|
|
"mean_token_accuracy": 0.7589653849601745,
|
|
"num_tokens": 503343942.0,
|
|
"step": 5460
|
|
},
|
|
{
|
|
"entropy": 1.25625,
|
|
"epoch": 0.7475741424080907,
|
|
"grad_norm": 0.13394961589617776,
|
|
"learning_rate": 3.228476821192053e-06,
|
|
"loss": 0.9686,
|
|
"mean_token_accuracy": 0.7579407334327698,
|
|
"num_tokens": 504273657.0,
|
|
"step": 5470
|
|
},
|
|
{
|
|
"entropy": 1.24609375,
|
|
"epoch": 0.7489408227415607,
|
|
"grad_norm": 0.1322582320607546,
|
|
"learning_rate": 3.224954206002536e-06,
|
|
"loss": 0.9903,
|
|
"mean_token_accuracy": 0.7518624842166901,
|
|
"num_tokens": 505223492.0,
|
|
"step": 5480
|
|
},
|
|
{
|
|
"entropy": 1.208203125,
|
|
"epoch": 0.7503075030750308,
|
|
"grad_norm": 0.11988365778296263,
|
|
"learning_rate": 3.22143159081302e-06,
|
|
"loss": 0.8837,
|
|
"mean_token_accuracy": 0.7753868103027344,
|
|
"num_tokens": 506149685.0,
|
|
"step": 5490
|
|
},
|
|
{
|
|
"entropy": 1.28671875,
|
|
"epoch": 0.7516741834085008,
|
|
"grad_norm": 0.12628111096617187,
|
|
"learning_rate": 3.2179089756235033e-06,
|
|
"loss": 0.976,
|
|
"mean_token_accuracy": 0.7536473572254181,
|
|
"num_tokens": 507071941.0,
|
|
"step": 5500
|
|
},
|
|
{
|
|
"entropy": 1.27265625,
|
|
"epoch": 0.7530408637419708,
|
|
"grad_norm": 0.1340841410069943,
|
|
"learning_rate": 3.2143863604339864e-06,
|
|
"loss": 0.9815,
|
|
"mean_token_accuracy": 0.7534163594245911,
|
|
"num_tokens": 508013836.0,
|
|
"step": 5510
|
|
},
|
|
{
|
|
"entropy": 1.253515625,
|
|
"epoch": 0.7544075440754408,
|
|
"grad_norm": 0.12901800587337459,
|
|
"learning_rate": 3.2108637452444695e-06,
|
|
"loss": 0.9609,
|
|
"mean_token_accuracy": 0.7604987263679505,
|
|
"num_tokens": 508928276.0,
|
|
"step": 5520
|
|
},
|
|
{
|
|
"entropy": 1.27734375,
|
|
"epoch": 0.7557742244089107,
|
|
"grad_norm": 0.11944621273051555,
|
|
"learning_rate": 3.2073411300549526e-06,
|
|
"loss": 1.0095,
|
|
"mean_token_accuracy": 0.7522468864917755,
|
|
"num_tokens": 509829624.0,
|
|
"step": 5530
|
|
},
|
|
{
|
|
"entropy": 1.19765625,
|
|
"epoch": 0.7571409047423807,
|
|
"grad_norm": 0.11676329796931283,
|
|
"learning_rate": 3.2038185148654366e-06,
|
|
"loss": 0.9037,
|
|
"mean_token_accuracy": 0.7701876521110534,
|
|
"num_tokens": 510741617.0,
|
|
"step": 5540
|
|
},
|
|
{
|
|
"entropy": 1.259375,
|
|
"epoch": 0.7585075850758508,
|
|
"grad_norm": 0.1421041390336127,
|
|
"learning_rate": 3.2002958996759197e-06,
|
|
"loss": 1.0103,
|
|
"mean_token_accuracy": 0.748807716369629,
|
|
"num_tokens": 511633875.0,
|
|
"step": 5550
|
|
},
|
|
{
|
|
"entropy": 1.25546875,
|
|
"epoch": 0.7598742654093208,
|
|
"grad_norm": 0.12240483318504826,
|
|
"learning_rate": 3.196773284486403e-06,
|
|
"loss": 0.9701,
|
|
"mean_token_accuracy": 0.7577081501483918,
|
|
"num_tokens": 512550694.0,
|
|
"step": 5560
|
|
},
|
|
{
|
|
"entropy": 1.25078125,
|
|
"epoch": 0.7612409457427908,
|
|
"grad_norm": 0.1256519192634172,
|
|
"learning_rate": 3.1932506692968864e-06,
|
|
"loss": 1.0001,
|
|
"mean_token_accuracy": 0.7496147453784943,
|
|
"num_tokens": 513493021.0,
|
|
"step": 5570
|
|
},
|
|
{
|
|
"entropy": 1.21640625,
|
|
"epoch": 0.7626076260762608,
|
|
"grad_norm": 0.13107350203782012,
|
|
"learning_rate": 3.1897280541073695e-06,
|
|
"loss": 0.9366,
|
|
"mean_token_accuracy": 0.7625531136989594,
|
|
"num_tokens": 514438780.0,
|
|
"step": 5580
|
|
},
|
|
{
|
|
"entropy": 1.22890625,
|
|
"epoch": 0.7639743064097307,
|
|
"grad_norm": 0.11168570383399434,
|
|
"learning_rate": 3.1862054389178526e-06,
|
|
"loss": 0.9386,
|
|
"mean_token_accuracy": 0.763778555393219,
|
|
"num_tokens": 515416366.0,
|
|
"step": 5590
|
|
},
|
|
{
|
|
"entropy": 1.2015625,
|
|
"epoch": 0.7653409867432007,
|
|
"grad_norm": 0.1326399608566617,
|
|
"learning_rate": 3.182682823728336e-06,
|
|
"loss": 0.9396,
|
|
"mean_token_accuracy": 0.7631299674510956,
|
|
"num_tokens": 516348299.0,
|
|
"step": 5600
|
|
},
|
|
{
|
|
"entropy": 1.2078125,
|
|
"epoch": 0.7667076670766708,
|
|
"grad_norm": 0.11453696764992052,
|
|
"learning_rate": 3.1791602085388197e-06,
|
|
"loss": 0.9371,
|
|
"mean_token_accuracy": 0.7626445770263672,
|
|
"num_tokens": 517284732.0,
|
|
"step": 5610
|
|
},
|
|
{
|
|
"entropy": 1.278125,
|
|
"epoch": 0.7680743474101408,
|
|
"grad_norm": 0.12737849361165082,
|
|
"learning_rate": 3.175637593349303e-06,
|
|
"loss": 1.0024,
|
|
"mean_token_accuracy": 0.7529632329940796,
|
|
"num_tokens": 518184206.0,
|
|
"step": 5620
|
|
},
|
|
{
|
|
"entropy": 1.26953125,
|
|
"epoch": 0.7694410277436108,
|
|
"grad_norm": 0.11786837257524295,
|
|
"learning_rate": 3.172114978159786e-06,
|
|
"loss": 0.9672,
|
|
"mean_token_accuracy": 0.7588017165660859,
|
|
"num_tokens": 519133164.0,
|
|
"step": 5630
|
|
},
|
|
{
|
|
"entropy": 1.23984375,
|
|
"epoch": 0.7708077080770808,
|
|
"grad_norm": 0.1191553304976518,
|
|
"learning_rate": 3.168592362970269e-06,
|
|
"loss": 0.9411,
|
|
"mean_token_accuracy": 0.7630909621715546,
|
|
"num_tokens": 520018070.0,
|
|
"step": 5640
|
|
},
|
|
{
|
|
"entropy": 1.21796875,
|
|
"epoch": 0.7721743884105507,
|
|
"grad_norm": 0.12307608425504082,
|
|
"learning_rate": 3.165069747780753e-06,
|
|
"loss": 0.9128,
|
|
"mean_token_accuracy": 0.7669616401195526,
|
|
"num_tokens": 520910258.0,
|
|
"step": 5650
|
|
},
|
|
{
|
|
"entropy": 1.27578125,
|
|
"epoch": 0.7735410687440207,
|
|
"grad_norm": 0.13000169261760072,
|
|
"learning_rate": 3.161547132591236e-06,
|
|
"loss": 0.9756,
|
|
"mean_token_accuracy": 0.7550297200679779,
|
|
"num_tokens": 521858095.0,
|
|
"step": 5660
|
|
},
|
|
{
|
|
"entropy": 1.24921875,
|
|
"epoch": 0.7749077490774908,
|
|
"grad_norm": 0.11587239951979891,
|
|
"learning_rate": 3.1580245174017193e-06,
|
|
"loss": 0.9559,
|
|
"mean_token_accuracy": 0.7593581438064575,
|
|
"num_tokens": 522796118.0,
|
|
"step": 5670
|
|
},
|
|
{
|
|
"entropy": 1.253125,
|
|
"epoch": 0.7762744294109608,
|
|
"grad_norm": 0.13410510167603226,
|
|
"learning_rate": 3.1545019022122025e-06,
|
|
"loss": 0.9252,
|
|
"mean_token_accuracy": 0.767153388261795,
|
|
"num_tokens": 523717529.0,
|
|
"step": 5680
|
|
},
|
|
{
|
|
"entropy": 1.26953125,
|
|
"epoch": 0.7776411097444308,
|
|
"grad_norm": 0.12051589415712709,
|
|
"learning_rate": 3.1509792870226856e-06,
|
|
"loss": 0.9904,
|
|
"mean_token_accuracy": 0.752899843454361,
|
|
"num_tokens": 524649560.0,
|
|
"step": 5690
|
|
},
|
|
{
|
|
"entropy": 1.1984375,
|
|
"epoch": 0.7790077900779008,
|
|
"grad_norm": 0.1479657339006141,
|
|
"learning_rate": 3.147456671833169e-06,
|
|
"loss": 0.9442,
|
|
"mean_token_accuracy": 0.7632103443145752,
|
|
"num_tokens": 525561680.0,
|
|
"step": 5700
|
|
},
|
|
{
|
|
"entropy": 1.2265625,
|
|
"epoch": 0.7803744704113708,
|
|
"grad_norm": 0.1277802794268143,
|
|
"learning_rate": 3.1439340566436527e-06,
|
|
"loss": 0.9526,
|
|
"mean_token_accuracy": 0.7604371666908264,
|
|
"num_tokens": 526487767.0,
|
|
"step": 5710
|
|
},
|
|
{
|
|
"entropy": 1.24609375,
|
|
"epoch": 0.7817411507448407,
|
|
"grad_norm": 0.13557955002465585,
|
|
"learning_rate": 3.140411441454136e-06,
|
|
"loss": 0.9708,
|
|
"mean_token_accuracy": 0.7588379263877869,
|
|
"num_tokens": 527395760.0,
|
|
"step": 5720
|
|
},
|
|
{
|
|
"entropy": 1.228125,
|
|
"epoch": 0.7831078310783108,
|
|
"grad_norm": 0.1883734122915506,
|
|
"learning_rate": 3.136888826264619e-06,
|
|
"loss": 0.962,
|
|
"mean_token_accuracy": 0.7575157046318054,
|
|
"num_tokens": 528315987.0,
|
|
"step": 5730
|
|
},
|
|
{
|
|
"entropy": 1.215625,
|
|
"epoch": 0.7844745114117808,
|
|
"grad_norm": 0.14541580270396237,
|
|
"learning_rate": 3.1333662110751025e-06,
|
|
"loss": 0.9488,
|
|
"mean_token_accuracy": 0.7592177093029022,
|
|
"num_tokens": 529222893.0,
|
|
"step": 5740
|
|
},
|
|
{
|
|
"entropy": 1.17578125,
|
|
"epoch": 0.7858411917452508,
|
|
"grad_norm": 0.13234111376572996,
|
|
"learning_rate": 3.1298435958855856e-06,
|
|
"loss": 0.9177,
|
|
"mean_token_accuracy": 0.7670797884464264,
|
|
"num_tokens": 530101850.0,
|
|
"step": 5750
|
|
},
|
|
{
|
|
"entropy": 1.24609375,
|
|
"epoch": 0.7872078720787208,
|
|
"grad_norm": 0.12617272923601605,
|
|
"learning_rate": 3.126320980696069e-06,
|
|
"loss": 0.9875,
|
|
"mean_token_accuracy": 0.7526162683963775,
|
|
"num_tokens": 531000655.0,
|
|
"step": 5760
|
|
},
|
|
{
|
|
"entropy": 1.2453125,
|
|
"epoch": 0.7885745524121908,
|
|
"grad_norm": 0.1338813801054853,
|
|
"learning_rate": 3.1227983655065523e-06,
|
|
"loss": 0.9454,
|
|
"mean_token_accuracy": 0.7595872402191162,
|
|
"num_tokens": 531903053.0,
|
|
"step": 5770
|
|
},
|
|
{
|
|
"entropy": 1.19296875,
|
|
"epoch": 0.7899412327456607,
|
|
"grad_norm": 0.11462494787385613,
|
|
"learning_rate": 3.119275750317036e-06,
|
|
"loss": 0.9047,
|
|
"mean_token_accuracy": 0.7698939204216003,
|
|
"num_tokens": 532817171.0,
|
|
"step": 5780
|
|
},
|
|
{
|
|
"entropy": 1.2828125,
|
|
"epoch": 0.7913079130791308,
|
|
"grad_norm": 0.11709096949115143,
|
|
"learning_rate": 3.115753135127519e-06,
|
|
"loss": 0.9998,
|
|
"mean_token_accuracy": 0.7496966600418091,
|
|
"num_tokens": 533748500.0,
|
|
"step": 5790
|
|
},
|
|
{
|
|
"entropy": 1.2171875,
|
|
"epoch": 0.7926745934126008,
|
|
"grad_norm": 0.14554667864450235,
|
|
"learning_rate": 3.112230519938002e-06,
|
|
"loss": 0.9439,
|
|
"mean_token_accuracy": 0.7623225331306458,
|
|
"num_tokens": 534701836.0,
|
|
"step": 5800
|
|
},
|
|
{
|
|
"entropy": 1.20625,
|
|
"epoch": 0.7940412737460708,
|
|
"grad_norm": 0.14602662693276414,
|
|
"learning_rate": 3.108707904748485e-06,
|
|
"loss": 0.9278,
|
|
"mean_token_accuracy": 0.7664978206157684,
|
|
"num_tokens": 535560186.0,
|
|
"step": 5810
|
|
},
|
|
{
|
|
"entropy": 1.253125,
|
|
"epoch": 0.7954079540795408,
|
|
"grad_norm": 0.12260793335126785,
|
|
"learning_rate": 3.105185289558969e-06,
|
|
"loss": 0.9604,
|
|
"mean_token_accuracy": 0.7601773262023925,
|
|
"num_tokens": 536522995.0,
|
|
"step": 5820
|
|
},
|
|
{
|
|
"entropy": 1.209375,
|
|
"epoch": 0.7967746344130108,
|
|
"grad_norm": 0.1301159859290865,
|
|
"learning_rate": 3.1016626743694523e-06,
|
|
"loss": 0.9504,
|
|
"mean_token_accuracy": 0.7608168721199036,
|
|
"num_tokens": 537446008.0,
|
|
"step": 5830
|
|
},
|
|
{
|
|
"entropy": 1.1796875,
|
|
"epoch": 0.7981413147464808,
|
|
"grad_norm": 0.11282699697118674,
|
|
"learning_rate": 3.0981400591799354e-06,
|
|
"loss": 0.9055,
|
|
"mean_token_accuracy": 0.7689303815364837,
|
|
"num_tokens": 538421022.0,
|
|
"step": 5840
|
|
},
|
|
{
|
|
"entropy": 1.20859375,
|
|
"epoch": 0.7995079950799509,
|
|
"grad_norm": 0.11793636402472867,
|
|
"learning_rate": 3.0946174439904185e-06,
|
|
"loss": 0.9109,
|
|
"mean_token_accuracy": 0.7693886518478393,
|
|
"num_tokens": 539358105.0,
|
|
"step": 5850
|
|
},
|
|
{
|
|
"entropy": 1.20703125,
|
|
"epoch": 0.8008746754134208,
|
|
"grad_norm": 0.11818030366939464,
|
|
"learning_rate": 3.0910948288009016e-06,
|
|
"loss": 0.9106,
|
|
"mean_token_accuracy": 0.7701842486858368,
|
|
"num_tokens": 540247054.0,
|
|
"step": 5860
|
|
},
|
|
{
|
|
"entropy": 1.209375,
|
|
"epoch": 0.8022413557468908,
|
|
"grad_norm": 0.13005252063225928,
|
|
"learning_rate": 3.0875722136113856e-06,
|
|
"loss": 0.96,
|
|
"mean_token_accuracy": 0.7572283804416656,
|
|
"num_tokens": 541163430.0,
|
|
"step": 5870
|
|
},
|
|
{
|
|
"entropy": 1.24609375,
|
|
"epoch": 0.8036080360803608,
|
|
"grad_norm": 0.13464148878854507,
|
|
"learning_rate": 3.0840495984218687e-06,
|
|
"loss": 0.962,
|
|
"mean_token_accuracy": 0.7591633260250091,
|
|
"num_tokens": 542107927.0,
|
|
"step": 5880
|
|
},
|
|
{
|
|
"entropy": 1.2546875,
|
|
"epoch": 0.8049747164138308,
|
|
"grad_norm": 0.12420353980922767,
|
|
"learning_rate": 3.080526983232352e-06,
|
|
"loss": 0.9506,
|
|
"mean_token_accuracy": 0.7603338181972503,
|
|
"num_tokens": 543019413.0,
|
|
"step": 5890
|
|
},
|
|
{
|
|
"entropy": 1.23359375,
|
|
"epoch": 0.8063413967473008,
|
|
"grad_norm": 0.12883534226473375,
|
|
"learning_rate": 3.0770043680428354e-06,
|
|
"loss": 0.9678,
|
|
"mean_token_accuracy": 0.7564488172531127,
|
|
"num_tokens": 543947382.0,
|
|
"step": 5900
|
|
},
|
|
{
|
|
"entropy": 1.21640625,
|
|
"epoch": 0.8077080770807709,
|
|
"grad_norm": 0.12522199877087756,
|
|
"learning_rate": 3.0734817528533185e-06,
|
|
"loss": 0.9137,
|
|
"mean_token_accuracy": 0.7696564137935639,
|
|
"num_tokens": 544847561.0,
|
|
"step": 5910
|
|
},
|
|
{
|
|
"entropy": 1.25546875,
|
|
"epoch": 0.8090747574142408,
|
|
"grad_norm": 0.13116216600274255,
|
|
"learning_rate": 3.0699591376638017e-06,
|
|
"loss": 0.9822,
|
|
"mean_token_accuracy": 0.7559537887573242,
|
|
"num_tokens": 545757015.0,
|
|
"step": 5920
|
|
},
|
|
{
|
|
"entropy": 1.20625,
|
|
"epoch": 0.8104414377477108,
|
|
"grad_norm": 0.11615248338806697,
|
|
"learning_rate": 3.066436522474285e-06,
|
|
"loss": 0.9424,
|
|
"mean_token_accuracy": 0.7646650850772858,
|
|
"num_tokens": 546673248.0,
|
|
"step": 5930
|
|
},
|
|
{
|
|
"entropy": 1.1828125,
|
|
"epoch": 0.8118081180811808,
|
|
"grad_norm": 0.12500614277760078,
|
|
"learning_rate": 3.0629139072847688e-06,
|
|
"loss": 0.9096,
|
|
"mean_token_accuracy": 0.7672588884830475,
|
|
"num_tokens": 547651025.0,
|
|
"step": 5940
|
|
},
|
|
{
|
|
"entropy": 1.2671875,
|
|
"epoch": 0.8131747984146508,
|
|
"grad_norm": 0.1296702954079263,
|
|
"learning_rate": 3.059391292095252e-06,
|
|
"loss": 0.9866,
|
|
"mean_token_accuracy": 0.7522484242916108,
|
|
"num_tokens": 548553494.0,
|
|
"step": 5950
|
|
},
|
|
{
|
|
"entropy": 1.23203125,
|
|
"epoch": 0.8145414787481208,
|
|
"grad_norm": 0.12078542417904112,
|
|
"learning_rate": 3.055868676905735e-06,
|
|
"loss": 0.9565,
|
|
"mean_token_accuracy": 0.7607589423656463,
|
|
"num_tokens": 549523321.0,
|
|
"step": 5960
|
|
},
|
|
{
|
|
"entropy": 1.259375,
|
|
"epoch": 0.8159081590815909,
|
|
"grad_norm": 0.12984037504751797,
|
|
"learning_rate": 3.052346061716218e-06,
|
|
"loss": 0.9727,
|
|
"mean_token_accuracy": 0.7584543764591217,
|
|
"num_tokens": 550382497.0,
|
|
"step": 5970
|
|
},
|
|
{
|
|
"entropy": 1.23515625,
|
|
"epoch": 0.8172748394150608,
|
|
"grad_norm": 0.13101080755591518,
|
|
"learning_rate": 3.048823446526702e-06,
|
|
"loss": 0.9405,
|
|
"mean_token_accuracy": 0.7628609657287597,
|
|
"num_tokens": 551315192.0,
|
|
"step": 5980
|
|
},
|
|
{
|
|
"entropy": 1.26171875,
|
|
"epoch": 0.8186415197485308,
|
|
"grad_norm": 0.1331671553067703,
|
|
"learning_rate": 3.0453008313371852e-06,
|
|
"loss": 0.9808,
|
|
"mean_token_accuracy": 0.7565096020698547,
|
|
"num_tokens": 552283477.0,
|
|
"step": 5990
|
|
},
|
|
{
|
|
"entropy": 1.21640625,
|
|
"epoch": 0.8200082000820008,
|
|
"grad_norm": 0.12875432442421386,
|
|
"learning_rate": 3.0417782161476683e-06,
|
|
"loss": 0.9518,
|
|
"mean_token_accuracy": 0.7606442272663116,
|
|
"num_tokens": 553194884.0,
|
|
"step": 6000
|
|
},
|
|
{
|
|
"entropy": 1.28515625,
|
|
"epoch": 0.8213748804154708,
|
|
"grad_norm": 0.1394424761856078,
|
|
"learning_rate": 3.0382556009581515e-06,
|
|
"loss": 0.9707,
|
|
"mean_token_accuracy": 0.7555649161338807,
|
|
"num_tokens": 554107536.0,
|
|
"step": 6010
|
|
},
|
|
{
|
|
"entropy": 1.21640625,
|
|
"epoch": 0.8227415607489408,
|
|
"grad_norm": 0.13762132125841225,
|
|
"learning_rate": 3.0347329857686346e-06,
|
|
"loss": 0.8996,
|
|
"mean_token_accuracy": 0.769251161813736,
|
|
"num_tokens": 554994790.0,
|
|
"step": 6020
|
|
},
|
|
{
|
|
"entropy": 1.209375,
|
|
"epoch": 0.8241082410824109,
|
|
"grad_norm": 0.13241754504568032,
|
|
"learning_rate": 3.031210370579118e-06,
|
|
"loss": 0.9005,
|
|
"mean_token_accuracy": 0.7736654877662659,
|
|
"num_tokens": 555917889.0,
|
|
"step": 6030
|
|
},
|
|
{
|
|
"entropy": 1.2390625,
|
|
"epoch": 0.8254749214158809,
|
|
"grad_norm": 0.12395491766699104,
|
|
"learning_rate": 3.0276877553896017e-06,
|
|
"loss": 0.9563,
|
|
"mean_token_accuracy": 0.7560256361961365,
|
|
"num_tokens": 556842526.0,
|
|
"step": 6040
|
|
},
|
|
{
|
|
"entropy": 1.23046875,
|
|
"epoch": 0.8268416017493508,
|
|
"grad_norm": 0.1376861315523034,
|
|
"learning_rate": 3.024165140200085e-06,
|
|
"loss": 0.9099,
|
|
"mean_token_accuracy": 0.7678829312324524,
|
|
"num_tokens": 557755256.0,
|
|
"step": 6050
|
|
},
|
|
{
|
|
"entropy": 1.246875,
|
|
"epoch": 0.8282082820828208,
|
|
"grad_norm": 0.12522079378447,
|
|
"learning_rate": 3.020642525010568e-06,
|
|
"loss": 0.9557,
|
|
"mean_token_accuracy": 0.7602041959762573,
|
|
"num_tokens": 558660408.0,
|
|
"step": 6060
|
|
},
|
|
{
|
|
"entropy": 1.2140625,
|
|
"epoch": 0.8295749624162908,
|
|
"grad_norm": 0.13803038824217606,
|
|
"learning_rate": 3.0171199098210515e-06,
|
|
"loss": 0.9207,
|
|
"mean_token_accuracy": 0.7671513974666595,
|
|
"num_tokens": 559553626.0,
|
|
"step": 6070
|
|
},
|
|
{
|
|
"entropy": 1.225,
|
|
"epoch": 0.8309416427497608,
|
|
"grad_norm": 0.1277631679567238,
|
|
"learning_rate": 3.0135972946315346e-06,
|
|
"loss": 0.9607,
|
|
"mean_token_accuracy": 0.7620602250099182,
|
|
"num_tokens": 560480649.0,
|
|
"step": 6080
|
|
},
|
|
{
|
|
"entropy": 1.24140625,
|
|
"epoch": 0.8323083230832309,
|
|
"grad_norm": 0.11977818048728091,
|
|
"learning_rate": 3.010074679442018e-06,
|
|
"loss": 0.9702,
|
|
"mean_token_accuracy": 0.7565788567066193,
|
|
"num_tokens": 561376221.0,
|
|
"step": 6090
|
|
},
|
|
{
|
|
"entropy": 1.23984375,
|
|
"epoch": 0.8336750034167009,
|
|
"grad_norm": 0.13566910477666438,
|
|
"learning_rate": 3.0065520642525013e-06,
|
|
"loss": 0.9744,
|
|
"mean_token_accuracy": 0.7570827782154084,
|
|
"num_tokens": 562274400.0,
|
|
"step": 6100
|
|
},
|
|
{
|
|
"entropy": 1.259375,
|
|
"epoch": 0.8350416837501708,
|
|
"grad_norm": 0.13182406893439674,
|
|
"learning_rate": 3.003029449062985e-06,
|
|
"loss": 0.9596,
|
|
"mean_token_accuracy": 0.758473813533783,
|
|
"num_tokens": 563215626.0,
|
|
"step": 6110
|
|
},
|
|
{
|
|
"entropy": 1.2390625,
|
|
"epoch": 0.8364083640836408,
|
|
"grad_norm": 0.138916370124879,
|
|
"learning_rate": 2.999506833873468e-06,
|
|
"loss": 0.9755,
|
|
"mean_token_accuracy": 0.7572598218917846,
|
|
"num_tokens": 564091313.0,
|
|
"step": 6120
|
|
},
|
|
{
|
|
"entropy": 1.2734375,
|
|
"epoch": 0.8377750444171108,
|
|
"grad_norm": 0.14873966014902118,
|
|
"learning_rate": 2.995984218683951e-06,
|
|
"loss": 1.0018,
|
|
"mean_token_accuracy": 0.7497744202613831,
|
|
"num_tokens": 565012295.0,
|
|
"step": 6130
|
|
},
|
|
{
|
|
"entropy": 1.22421875,
|
|
"epoch": 0.8391417247505808,
|
|
"grad_norm": 0.12940425157211458,
|
|
"learning_rate": 2.992461603494434e-06,
|
|
"loss": 0.9241,
|
|
"mean_token_accuracy": 0.765155953168869,
|
|
"num_tokens": 565954544.0,
|
|
"step": 6140
|
|
},
|
|
{
|
|
"entropy": 1.22734375,
|
|
"epoch": 0.8405084050840509,
|
|
"grad_norm": 0.12529642852725226,
|
|
"learning_rate": 2.988938988304918e-06,
|
|
"loss": 0.9675,
|
|
"mean_token_accuracy": 0.7574544966220855,
|
|
"num_tokens": 566894690.0,
|
|
"step": 6150
|
|
},
|
|
{
|
|
"entropy": 1.228125,
|
|
"epoch": 0.8418750854175209,
|
|
"grad_norm": 0.1206220893841846,
|
|
"learning_rate": 2.9854163731154013e-06,
|
|
"loss": 0.9318,
|
|
"mean_token_accuracy": 0.7665258288383484,
|
|
"num_tokens": 567803082.0,
|
|
"step": 6160
|
|
},
|
|
{
|
|
"entropy": 1.234375,
|
|
"epoch": 0.8432417657509909,
|
|
"grad_norm": 0.11581878546673367,
|
|
"learning_rate": 2.9818937579258844e-06,
|
|
"loss": 0.9356,
|
|
"mean_token_accuracy": 0.7625558495521545,
|
|
"num_tokens": 568676822.0,
|
|
"step": 6170
|
|
},
|
|
{
|
|
"entropy": 1.2328125,
|
|
"epoch": 0.8446084460844608,
|
|
"grad_norm": 0.13325004219410527,
|
|
"learning_rate": 2.9783711427363675e-06,
|
|
"loss": 0.9142,
|
|
"mean_token_accuracy": 0.7676871120929718,
|
|
"num_tokens": 569602337.0,
|
|
"step": 6180
|
|
},
|
|
{
|
|
"entropy": 1.24453125,
|
|
"epoch": 0.8459751264179308,
|
|
"grad_norm": 0.13166020573906484,
|
|
"learning_rate": 2.9748485275468507e-06,
|
|
"loss": 0.9561,
|
|
"mean_token_accuracy": 0.7608251869678497,
|
|
"num_tokens": 570513919.0,
|
|
"step": 6190
|
|
},
|
|
{
|
|
"entropy": 1.21875,
|
|
"epoch": 0.8473418067514008,
|
|
"grad_norm": 0.1173285425463334,
|
|
"learning_rate": 2.9713259123573346e-06,
|
|
"loss": 0.9661,
|
|
"mean_token_accuracy": 0.7568843007087708,
|
|
"num_tokens": 571394215.0,
|
|
"step": 6200
|
|
},
|
|
{
|
|
"entropy": 1.20859375,
|
|
"epoch": 0.8487084870848709,
|
|
"grad_norm": 0.12144448197045904,
|
|
"learning_rate": 2.9678032971678177e-06,
|
|
"loss": 0.951,
|
|
"mean_token_accuracy": 0.7598959624767303,
|
|
"num_tokens": 572265499.0,
|
|
"step": 6210
|
|
},
|
|
{
|
|
"entropy": 1.21875,
|
|
"epoch": 0.8500751674183409,
|
|
"grad_norm": 0.14906402749055508,
|
|
"learning_rate": 2.964280681978301e-06,
|
|
"loss": 1.002,
|
|
"mean_token_accuracy": 0.7494072258472443,
|
|
"num_tokens": 573215815.0,
|
|
"step": 6220
|
|
},
|
|
{
|
|
"entropy": 1.20390625,
|
|
"epoch": 0.8514418477518109,
|
|
"grad_norm": 0.14214544969002377,
|
|
"learning_rate": 2.960758066788784e-06,
|
|
"loss": 0.9312,
|
|
"mean_token_accuracy": 0.7653222978115082,
|
|
"num_tokens": 574095844.0,
|
|
"step": 6230
|
|
},
|
|
{
|
|
"entropy": 1.2578125,
|
|
"epoch": 0.8528085280852808,
|
|
"grad_norm": 0.1288338299165682,
|
|
"learning_rate": 2.9572354515992675e-06,
|
|
"loss": 0.953,
|
|
"mean_token_accuracy": 0.7581019937992096,
|
|
"num_tokens": 574990843.0,
|
|
"step": 6240
|
|
},
|
|
{
|
|
"entropy": 1.15859375,
|
|
"epoch": 0.8541752084187508,
|
|
"grad_norm": 0.13517716232934834,
|
|
"learning_rate": 2.9537128364097507e-06,
|
|
"loss": 0.8854,
|
|
"mean_token_accuracy": 0.7766687512397766,
|
|
"num_tokens": 575911166.0,
|
|
"step": 6250
|
|
},
|
|
{
|
|
"entropy": 1.2375,
|
|
"epoch": 0.8555418887522208,
|
|
"grad_norm": 0.11616852812905555,
|
|
"learning_rate": 2.9501902212202342e-06,
|
|
"loss": 0.9617,
|
|
"mean_token_accuracy": 0.7608492255210877,
|
|
"num_tokens": 576865158.0,
|
|
"step": 6260
|
|
},
|
|
{
|
|
"entropy": 1.23671875,
|
|
"epoch": 0.8569085690856909,
|
|
"grad_norm": 0.11477706520815649,
|
|
"learning_rate": 2.9466676060307178e-06,
|
|
"loss": 0.9595,
|
|
"mean_token_accuracy": 0.7594146728515625,
|
|
"num_tokens": 577798743.0,
|
|
"step": 6270
|
|
},
|
|
{
|
|
"entropy": 1.2640625,
|
|
"epoch": 0.8582752494191609,
|
|
"grad_norm": 0.12129016436626096,
|
|
"learning_rate": 2.943144990841201e-06,
|
|
"loss": 0.9614,
|
|
"mean_token_accuracy": 0.7586426377296448,
|
|
"num_tokens": 578736942.0,
|
|
"step": 6280
|
|
},
|
|
{
|
|
"entropy": 1.2359375,
|
|
"epoch": 0.8596419297526309,
|
|
"grad_norm": 0.1314802629044811,
|
|
"learning_rate": 2.939622375651684e-06,
|
|
"loss": 0.9475,
|
|
"mean_token_accuracy": 0.7628366410732269,
|
|
"num_tokens": 579657758.0,
|
|
"step": 6290
|
|
},
|
|
{
|
|
"entropy": 1.24765625,
|
|
"epoch": 0.8610086100861009,
|
|
"grad_norm": 0.14475920330450046,
|
|
"learning_rate": 2.936099760462167e-06,
|
|
"loss": 0.9972,
|
|
"mean_token_accuracy": 0.7514494001865387,
|
|
"num_tokens": 580624116.0,
|
|
"step": 6300
|
|
},
|
|
{
|
|
"entropy": 1.21640625,
|
|
"epoch": 0.8623752904195708,
|
|
"grad_norm": 0.13028635865440286,
|
|
"learning_rate": 2.932577145272651e-06,
|
|
"loss": 0.8826,
|
|
"mean_token_accuracy": 0.7745753645896911,
|
|
"num_tokens": 581517703.0,
|
|
"step": 6310
|
|
},
|
|
{
|
|
"entropy": 1.24921875,
|
|
"epoch": 0.8637419707530408,
|
|
"grad_norm": 0.11472834862091354,
|
|
"learning_rate": 2.9290545300831342e-06,
|
|
"loss": 0.9651,
|
|
"mean_token_accuracy": 0.7598686873912811,
|
|
"num_tokens": 582458745.0,
|
|
"step": 6320
|
|
},
|
|
{
|
|
"entropy": 1.2671875,
|
|
"epoch": 0.8651086510865109,
|
|
"grad_norm": 0.11973277737150669,
|
|
"learning_rate": 2.9255319148936174e-06,
|
|
"loss": 0.9741,
|
|
"mean_token_accuracy": 0.7582668244838715,
|
|
"num_tokens": 583377378.0,
|
|
"step": 6330
|
|
},
|
|
{
|
|
"entropy": 1.18046875,
|
|
"epoch": 0.8664753314199809,
|
|
"grad_norm": 0.15841932422773639,
|
|
"learning_rate": 2.9220092997041005e-06,
|
|
"loss": 0.8773,
|
|
"mean_token_accuracy": 0.7770186960697174,
|
|
"num_tokens": 584312704.0,
|
|
"step": 6340
|
|
},
|
|
{
|
|
"entropy": 1.24296875,
|
|
"epoch": 0.8678420117534509,
|
|
"grad_norm": 0.13582543702264854,
|
|
"learning_rate": 2.9184866845145836e-06,
|
|
"loss": 0.9516,
|
|
"mean_token_accuracy": 0.7607751190662384,
|
|
"num_tokens": 585234665.0,
|
|
"step": 6350
|
|
},
|
|
{
|
|
"entropy": 1.22578125,
|
|
"epoch": 0.8692086920869209,
|
|
"grad_norm": 0.14662452889407457,
|
|
"learning_rate": 2.9149640693250667e-06,
|
|
"loss": 0.9545,
|
|
"mean_token_accuracy": 0.7587327122688293,
|
|
"num_tokens": 586185228.0,
|
|
"step": 6360
|
|
},
|
|
{
|
|
"entropy": 1.2484375,
|
|
"epoch": 0.8705753724203908,
|
|
"grad_norm": 0.12393460631858057,
|
|
"learning_rate": 2.9114414541355507e-06,
|
|
"loss": 0.9747,
|
|
"mean_token_accuracy": 0.7562020182609558,
|
|
"num_tokens": 587089018.0,
|
|
"step": 6370
|
|
},
|
|
{
|
|
"entropy": 1.23984375,
|
|
"epoch": 0.8719420527538608,
|
|
"grad_norm": 0.1210234284522151,
|
|
"learning_rate": 2.907918838946034e-06,
|
|
"loss": 0.9386,
|
|
"mean_token_accuracy": 0.7661567032337189,
|
|
"num_tokens": 588017673.0,
|
|
"step": 6380
|
|
},
|
|
{
|
|
"entropy": 1.23828125,
|
|
"epoch": 0.8733087330873309,
|
|
"grad_norm": 0.1315472897061363,
|
|
"learning_rate": 2.904396223756517e-06,
|
|
"loss": 0.9519,
|
|
"mean_token_accuracy": 0.7613303661346436,
|
|
"num_tokens": 588935725.0,
|
|
"step": 6390
|
|
},
|
|
{
|
|
"entropy": 1.2609375,
|
|
"epoch": 0.8746754134208009,
|
|
"grad_norm": 0.12862040267661365,
|
|
"learning_rate": 2.9008736085670005e-06,
|
|
"loss": 0.9622,
|
|
"mean_token_accuracy": 0.7610259175300598,
|
|
"num_tokens": 589851938.0,
|
|
"step": 6400
|
|
},
|
|
{
|
|
"entropy": 1.18671875,
|
|
"epoch": 0.8760420937542709,
|
|
"grad_norm": 0.13428094414169095,
|
|
"learning_rate": 2.8973509933774836e-06,
|
|
"loss": 0.915,
|
|
"mean_token_accuracy": 0.7673716962337493,
|
|
"num_tokens": 590750641.0,
|
|
"step": 6410
|
|
},
|
|
{
|
|
"entropy": 1.24453125,
|
|
"epoch": 0.8774087740877409,
|
|
"grad_norm": 0.12681689830995405,
|
|
"learning_rate": 2.893828378187967e-06,
|
|
"loss": 0.9836,
|
|
"mean_token_accuracy": 0.7549520611763001,
|
|
"num_tokens": 591691593.0,
|
|
"step": 6420
|
|
},
|
|
{
|
|
"entropy": 1.2234375,
|
|
"epoch": 0.8787754544212109,
|
|
"grad_norm": 0.126772925574238,
|
|
"learning_rate": 2.8903057629984503e-06,
|
|
"loss": 0.9083,
|
|
"mean_token_accuracy": 0.7690740764141083,
|
|
"num_tokens": 592586272.0,
|
|
"step": 6430
|
|
},
|
|
{
|
|
"entropy": 1.2078125,
|
|
"epoch": 0.8801421347546808,
|
|
"grad_norm": 0.16141046217631008,
|
|
"learning_rate": 2.886783147808934e-06,
|
|
"loss": 0.9088,
|
|
"mean_token_accuracy": 0.7695029556751252,
|
|
"num_tokens": 593523306.0,
|
|
"step": 6440
|
|
},
|
|
{
|
|
"entropy": 1.265625,
|
|
"epoch": 0.8815088150881509,
|
|
"grad_norm": 0.11710108277441726,
|
|
"learning_rate": 2.883260532619417e-06,
|
|
"loss": 0.9902,
|
|
"mean_token_accuracy": 0.7523507475852966,
|
|
"num_tokens": 594414758.0,
|
|
"step": 6450
|
|
},
|
|
{
|
|
"entropy": 1.2203125,
|
|
"epoch": 0.8828754954216209,
|
|
"grad_norm": 0.13483589491708275,
|
|
"learning_rate": 2.8797379174299e-06,
|
|
"loss": 0.9158,
|
|
"mean_token_accuracy": 0.7668928682804108,
|
|
"num_tokens": 595285971.0,
|
|
"step": 6460
|
|
},
|
|
{
|
|
"entropy": 1.1875,
|
|
"epoch": 0.8842421757550909,
|
|
"grad_norm": 0.12237620882329206,
|
|
"learning_rate": 2.876215302240383e-06,
|
|
"loss": 0.9035,
|
|
"mean_token_accuracy": 0.7712464570999146,
|
|
"num_tokens": 596196999.0,
|
|
"step": 6470
|
|
},
|
|
{
|
|
"entropy": 1.24609375,
|
|
"epoch": 0.8856088560885609,
|
|
"grad_norm": 0.13694047865122702,
|
|
"learning_rate": 2.872692687050867e-06,
|
|
"loss": 0.9714,
|
|
"mean_token_accuracy": 0.757841145992279,
|
|
"num_tokens": 597148890.0,
|
|
"step": 6480
|
|
},
|
|
{
|
|
"entropy": 1.21875,
|
|
"epoch": 0.8869755364220309,
|
|
"grad_norm": 0.1272661105845179,
|
|
"learning_rate": 2.8691700718613503e-06,
|
|
"loss": 0.9265,
|
|
"mean_token_accuracy": 0.7631352603435516,
|
|
"num_tokens": 598063968.0,
|
|
"step": 6490
|
|
},
|
|
{
|
|
"entropy": 1.2046875,
|
|
"epoch": 0.8883422167555008,
|
|
"grad_norm": 0.134459699923978,
|
|
"learning_rate": 2.8656474566718334e-06,
|
|
"loss": 0.9269,
|
|
"mean_token_accuracy": 0.7627015888690949,
|
|
"num_tokens": 599016906.0,
|
|
"step": 6500
|
|
},
|
|
{
|
|
"entropy": 1.1984375,
|
|
"epoch": 0.8897088970889709,
|
|
"grad_norm": 0.17149047030508577,
|
|
"learning_rate": 2.8621248414823165e-06,
|
|
"loss": 0.9076,
|
|
"mean_token_accuracy": 0.7695610105991364,
|
|
"num_tokens": 599932323.0,
|
|
"step": 6510
|
|
},
|
|
{
|
|
"entropy": 1.23515625,
|
|
"epoch": 0.8910755774224409,
|
|
"grad_norm": 0.13238586305646036,
|
|
"learning_rate": 2.8586022262927997e-06,
|
|
"loss": 0.9407,
|
|
"mean_token_accuracy": 0.7610719859600067,
|
|
"num_tokens": 600787290.0,
|
|
"step": 6520
|
|
},
|
|
{
|
|
"entropy": 1.2984375,
|
|
"epoch": 0.8924422577559109,
|
|
"grad_norm": 0.12770886699403347,
|
|
"learning_rate": 2.8550796111032836e-06,
|
|
"loss": 1.015,
|
|
"mean_token_accuracy": 0.7457599818706513,
|
|
"num_tokens": 601718435.0,
|
|
"step": 6530
|
|
},
|
|
{
|
|
"entropy": 1.23828125,
|
|
"epoch": 0.8938089380893809,
|
|
"grad_norm": 0.11784947514421247,
|
|
"learning_rate": 2.8515569959137668e-06,
|
|
"loss": 0.9582,
|
|
"mean_token_accuracy": 0.7599861741065979,
|
|
"num_tokens": 602629379.0,
|
|
"step": 6540
|
|
},
|
|
{
|
|
"entropy": 1.21171875,
|
|
"epoch": 0.8951756184228509,
|
|
"grad_norm": 0.12430968868390024,
|
|
"learning_rate": 2.84803438072425e-06,
|
|
"loss": 0.9313,
|
|
"mean_token_accuracy": 0.7652425050735474,
|
|
"num_tokens": 603541464.0,
|
|
"step": 6550
|
|
},
|
|
{
|
|
"entropy": 1.20703125,
|
|
"epoch": 0.8965422987563209,
|
|
"grad_norm": 0.12464078413975088,
|
|
"learning_rate": 2.844511765534733e-06,
|
|
"loss": 0.9327,
|
|
"mean_token_accuracy": 0.7640146374702453,
|
|
"num_tokens": 604455855.0,
|
|
"step": 6560
|
|
},
|
|
{
|
|
"entropy": 1.18203125,
|
|
"epoch": 0.897908979089791,
|
|
"grad_norm": 0.12011718081288707,
|
|
"learning_rate": 2.8409891503452166e-06,
|
|
"loss": 0.9294,
|
|
"mean_token_accuracy": 0.7659608900547028,
|
|
"num_tokens": 605395006.0,
|
|
"step": 6570
|
|
},
|
|
{
|
|
"entropy": 1.23359375,
|
|
"epoch": 0.8992756594232609,
|
|
"grad_norm": 0.1188333493828541,
|
|
"learning_rate": 2.8374665351556997e-06,
|
|
"loss": 0.961,
|
|
"mean_token_accuracy": 0.7596760749816894,
|
|
"num_tokens": 606286202.0,
|
|
"step": 6580
|
|
},
|
|
{
|
|
"entropy": 1.22578125,
|
|
"epoch": 0.9006423397567309,
|
|
"grad_norm": 0.12023528770291865,
|
|
"learning_rate": 2.8339439199661832e-06,
|
|
"loss": 0.9518,
|
|
"mean_token_accuracy": 0.7630109846591949,
|
|
"num_tokens": 607248617.0,
|
|
"step": 6590
|
|
},
|
|
{
|
|
"entropy": 1.2296875,
|
|
"epoch": 0.9020090200902009,
|
|
"grad_norm": 0.12601543701751164,
|
|
"learning_rate": 2.8304213047766663e-06,
|
|
"loss": 0.9743,
|
|
"mean_token_accuracy": 0.7545759081840515,
|
|
"num_tokens": 608137958.0,
|
|
"step": 6600
|
|
},
|
|
{
|
|
"entropy": 1.19140625,
|
|
"epoch": 0.9033757004236709,
|
|
"grad_norm": 0.12917775784649857,
|
|
"learning_rate": 2.82689868958715e-06,
|
|
"loss": 0.9204,
|
|
"mean_token_accuracy": 0.7680601894855499,
|
|
"num_tokens": 609065549.0,
|
|
"step": 6610
|
|
},
|
|
{
|
|
"entropy": 1.21875,
|
|
"epoch": 0.9047423807571409,
|
|
"grad_norm": 0.13938603034748,
|
|
"learning_rate": 2.823376074397633e-06,
|
|
"loss": 0.9826,
|
|
"mean_token_accuracy": 0.7544922590255737,
|
|
"num_tokens": 609996904.0,
|
|
"step": 6620
|
|
},
|
|
{
|
|
"entropy": 1.22734375,
|
|
"epoch": 0.906109061090611,
|
|
"grad_norm": 0.14538829882176407,
|
|
"learning_rate": 2.819853459208116e-06,
|
|
"loss": 0.957,
|
|
"mean_token_accuracy": 0.7604710221290588,
|
|
"num_tokens": 610881045.0,
|
|
"step": 6630
|
|
},
|
|
{
|
|
"entropy": 1.26171875,
|
|
"epoch": 0.9074757414240809,
|
|
"grad_norm": 0.11845650185101654,
|
|
"learning_rate": 2.8163308440186e-06,
|
|
"loss": 0.9873,
|
|
"mean_token_accuracy": 0.7535419642925263,
|
|
"num_tokens": 611806746.0,
|
|
"step": 6640
|
|
},
|
|
{
|
|
"entropy": 1.234375,
|
|
"epoch": 0.9088424217575509,
|
|
"grad_norm": 0.13749752701055762,
|
|
"learning_rate": 2.8128082288290832e-06,
|
|
"loss": 0.9174,
|
|
"mean_token_accuracy": 0.7677323698997498,
|
|
"num_tokens": 612709434.0,
|
|
"step": 6650
|
|
},
|
|
{
|
|
"entropy": 1.24921875,
|
|
"epoch": 0.9102091020910209,
|
|
"grad_norm": 0.13849050537671986,
|
|
"learning_rate": 2.8092856136395664e-06,
|
|
"loss": 0.9552,
|
|
"mean_token_accuracy": 0.7582318782806396,
|
|
"num_tokens": 613639390.0,
|
|
"step": 6660
|
|
},
|
|
{
|
|
"entropy": 1.2453125,
|
|
"epoch": 0.9115757824244909,
|
|
"grad_norm": 0.1558760561441514,
|
|
"learning_rate": 2.8057629984500495e-06,
|
|
"loss": 0.9507,
|
|
"mean_token_accuracy": 0.7596487879753113,
|
|
"num_tokens": 614605380.0,
|
|
"step": 6670
|
|
},
|
|
{
|
|
"entropy": 1.21640625,
|
|
"epoch": 0.9129424627579609,
|
|
"grad_norm": 0.1279887950923365,
|
|
"learning_rate": 2.8022403832605326e-06,
|
|
"loss": 0.9394,
|
|
"mean_token_accuracy": 0.763731861114502,
|
|
"num_tokens": 615539760.0,
|
|
"step": 6680
|
|
},
|
|
{
|
|
"entropy": 1.23828125,
|
|
"epoch": 0.914309143091431,
|
|
"grad_norm": 0.12344204900212581,
|
|
"learning_rate": 2.7987177680710157e-06,
|
|
"loss": 0.9175,
|
|
"mean_token_accuracy": 0.7677618801593781,
|
|
"num_tokens": 616477576.0,
|
|
"step": 6690
|
|
},
|
|
{
|
|
"entropy": 1.23828125,
|
|
"epoch": 0.915675823424901,
|
|
"grad_norm": 0.1400980684113451,
|
|
"learning_rate": 2.7951951528814997e-06,
|
|
"loss": 0.9641,
|
|
"mean_token_accuracy": 0.7570283830165863,
|
|
"num_tokens": 617421890.0,
|
|
"step": 6700
|
|
},
|
|
{
|
|
"entropy": 1.2328125,
|
|
"epoch": 0.9170425037583709,
|
|
"grad_norm": 0.14247019407137476,
|
|
"learning_rate": 2.791672537691983e-06,
|
|
"loss": 0.9619,
|
|
"mean_token_accuracy": 0.7568154752254486,
|
|
"num_tokens": 618393590.0,
|
|
"step": 6710
|
|
},
|
|
{
|
|
"entropy": 1.21953125,
|
|
"epoch": 0.9184091840918409,
|
|
"grad_norm": 0.12904867051676314,
|
|
"learning_rate": 2.788149922502466e-06,
|
|
"loss": 0.9569,
|
|
"mean_token_accuracy": 0.7604748010635376,
|
|
"num_tokens": 619296207.0,
|
|
"step": 6720
|
|
},
|
|
{
|
|
"entropy": 1.20859375,
|
|
"epoch": 0.9197758644253109,
|
|
"grad_norm": 0.14092104328809324,
|
|
"learning_rate": 2.784627307312949e-06,
|
|
"loss": 0.9332,
|
|
"mean_token_accuracy": 0.767452085018158,
|
|
"num_tokens": 620235237.0,
|
|
"step": 6730
|
|
},
|
|
{
|
|
"entropy": 1.2015625,
|
|
"epoch": 0.9211425447587809,
|
|
"grad_norm": 0.13130278683994748,
|
|
"learning_rate": 2.7811046921234326e-06,
|
|
"loss": 0.9041,
|
|
"mean_token_accuracy": 0.7690815508365632,
|
|
"num_tokens": 621157947.0,
|
|
"step": 6740
|
|
},
|
|
{
|
|
"entropy": 1.26640625,
|
|
"epoch": 0.922509225092251,
|
|
"grad_norm": 0.12511761429107082,
|
|
"learning_rate": 2.777582076933916e-06,
|
|
"loss": 0.9753,
|
|
"mean_token_accuracy": 0.7575784146785736,
|
|
"num_tokens": 622061617.0,
|
|
"step": 6750
|
|
},
|
|
{
|
|
"entropy": 1.221875,
|
|
"epoch": 0.923875905425721,
|
|
"grad_norm": 0.11415834402807559,
|
|
"learning_rate": 2.7740594617443993e-06,
|
|
"loss": 0.9259,
|
|
"mean_token_accuracy": 0.7652079582214355,
|
|
"num_tokens": 623006404.0,
|
|
"step": 6760
|
|
},
|
|
{
|
|
"entropy": 1.22890625,
|
|
"epoch": 0.9252425857591909,
|
|
"grad_norm": 0.13069193583443103,
|
|
"learning_rate": 2.770536846554883e-06,
|
|
"loss": 0.9121,
|
|
"mean_token_accuracy": 0.7696107923984528,
|
|
"num_tokens": 623971191.0,
|
|
"step": 6770
|
|
},
|
|
{
|
|
"entropy": 1.26640625,
|
|
"epoch": 0.9266092660926609,
|
|
"grad_norm": 0.12407681860190087,
|
|
"learning_rate": 2.767014231365366e-06,
|
|
"loss": 0.9729,
|
|
"mean_token_accuracy": 0.7588934183120728,
|
|
"num_tokens": 624883123.0,
|
|
"step": 6780
|
|
},
|
|
{
|
|
"entropy": 1.24609375,
|
|
"epoch": 0.9279759464261309,
|
|
"grad_norm": 0.10867850016508009,
|
|
"learning_rate": 2.763491616175849e-06,
|
|
"loss": 1.003,
|
|
"mean_token_accuracy": 0.7526193141937256,
|
|
"num_tokens": 625850233.0,
|
|
"step": 6790
|
|
},
|
|
{
|
|
"entropy": 1.20390625,
|
|
"epoch": 0.9293426267596009,
|
|
"grad_norm": 0.11913933601898347,
|
|
"learning_rate": 2.759969000986332e-06,
|
|
"loss": 0.9504,
|
|
"mean_token_accuracy": 0.7590905666351319,
|
|
"num_tokens": 626789700.0,
|
|
"step": 6800
|
|
},
|
|
{
|
|
"entropy": 1.171875,
|
|
"epoch": 0.930709307093071,
|
|
"grad_norm": 0.18149775440456972,
|
|
"learning_rate": 2.756446385796816e-06,
|
|
"loss": 0.9135,
|
|
"mean_token_accuracy": 0.7673180401325226,
|
|
"num_tokens": 627697328.0,
|
|
"step": 6810
|
|
},
|
|
{
|
|
"entropy": 1.21328125,
|
|
"epoch": 0.932075987426541,
|
|
"grad_norm": 0.12845372970712832,
|
|
"learning_rate": 2.7529237706072993e-06,
|
|
"loss": 0.8918,
|
|
"mean_token_accuracy": 0.7703468143939972,
|
|
"num_tokens": 628630914.0,
|
|
"step": 6820
|
|
},
|
|
{
|
|
"entropy": 1.20078125,
|
|
"epoch": 0.933442667760011,
|
|
"grad_norm": 0.12535052892918247,
|
|
"learning_rate": 2.7494011554177824e-06,
|
|
"loss": 0.9482,
|
|
"mean_token_accuracy": 0.7617609322071075,
|
|
"num_tokens": 629547186.0,
|
|
"step": 6830
|
|
},
|
|
{
|
|
"entropy": 1.2703125,
|
|
"epoch": 0.9348093480934809,
|
|
"grad_norm": 0.1306917746250161,
|
|
"learning_rate": 2.7458785402282656e-06,
|
|
"loss": 0.9709,
|
|
"mean_token_accuracy": 0.7569194436073303,
|
|
"num_tokens": 630457312.0,
|
|
"step": 6840
|
|
},
|
|
{
|
|
"entropy": 1.27109375,
|
|
"epoch": 0.9361760284269509,
|
|
"grad_norm": 0.1208665199556674,
|
|
"learning_rate": 2.7423559250387487e-06,
|
|
"loss": 0.9704,
|
|
"mean_token_accuracy": 0.7589798510074616,
|
|
"num_tokens": 631376333.0,
|
|
"step": 6850
|
|
},
|
|
{
|
|
"entropy": 1.22109375,
|
|
"epoch": 0.9375427087604209,
|
|
"grad_norm": 0.12058154259807527,
|
|
"learning_rate": 2.7388333098492326e-06,
|
|
"loss": 0.9405,
|
|
"mean_token_accuracy": 0.7638838708400726,
|
|
"num_tokens": 632240772.0,
|
|
"step": 6860
|
|
},
|
|
{
|
|
"entropy": 1.240625,
|
|
"epoch": 0.938909389093891,
|
|
"grad_norm": 0.1152278842256019,
|
|
"learning_rate": 2.7353106946597158e-06,
|
|
"loss": 0.9691,
|
|
"mean_token_accuracy": 0.7567602634429932,
|
|
"num_tokens": 633212586.0,
|
|
"step": 6870
|
|
},
|
|
{
|
|
"entropy": 1.25859375,
|
|
"epoch": 0.940276069427361,
|
|
"grad_norm": 0.14016241003356403,
|
|
"learning_rate": 2.731788079470199e-06,
|
|
"loss": 0.9672,
|
|
"mean_token_accuracy": 0.7575452446937561,
|
|
"num_tokens": 634093379.0,
|
|
"step": 6880
|
|
},
|
|
{
|
|
"entropy": 1.26015625,
|
|
"epoch": 0.941642749760831,
|
|
"grad_norm": 0.14242138796477602,
|
|
"learning_rate": 2.728265464280682e-06,
|
|
"loss": 0.9821,
|
|
"mean_token_accuracy": 0.7560397863388062,
|
|
"num_tokens": 634995635.0,
|
|
"step": 6890
|
|
},
|
|
{
|
|
"entropy": 1.2375,
|
|
"epoch": 0.9430094300943009,
|
|
"grad_norm": 0.11698946850687274,
|
|
"learning_rate": 2.7247428490911656e-06,
|
|
"loss": 0.9261,
|
|
"mean_token_accuracy": 0.7673841834068298,
|
|
"num_tokens": 635882762.0,
|
|
"step": 6900
|
|
},
|
|
{
|
|
"entropy": 1.24453125,
|
|
"epoch": 0.9443761104277709,
|
|
"grad_norm": 0.13796916966054526,
|
|
"learning_rate": 2.7212202339016487e-06,
|
|
"loss": 0.9722,
|
|
"mean_token_accuracy": 0.7577023088932038,
|
|
"num_tokens": 636815111.0,
|
|
"step": 6910
|
|
},
|
|
{
|
|
"entropy": 1.2046875,
|
|
"epoch": 0.9457427907612409,
|
|
"grad_norm": 0.10981822736041198,
|
|
"learning_rate": 2.7176976187121322e-06,
|
|
"loss": 0.9597,
|
|
"mean_token_accuracy": 0.7588821113109588,
|
|
"num_tokens": 637800464.0,
|
|
"step": 6920
|
|
},
|
|
{
|
|
"entropy": 1.2609375,
|
|
"epoch": 0.947109471094711,
|
|
"grad_norm": 0.12976294968538077,
|
|
"learning_rate": 2.7141750035226154e-06,
|
|
"loss": 0.9636,
|
|
"mean_token_accuracy": 0.7575055897235871,
|
|
"num_tokens": 638762414.0,
|
|
"step": 6930
|
|
},
|
|
{
|
|
"entropy": 1.253125,
|
|
"epoch": 0.948476151428181,
|
|
"grad_norm": 0.12980392168103957,
|
|
"learning_rate": 2.710652388333099e-06,
|
|
"loss": 0.9657,
|
|
"mean_token_accuracy": 0.7604452252388001,
|
|
"num_tokens": 639708115.0,
|
|
"step": 6940
|
|
},
|
|
{
|
|
"entropy": 1.23984375,
|
|
"epoch": 0.949842831761651,
|
|
"grad_norm": 0.1305044199280165,
|
|
"learning_rate": 2.707129773143582e-06,
|
|
"loss": 1.0078,
|
|
"mean_token_accuracy": 0.7488219022750855,
|
|
"num_tokens": 640669487.0,
|
|
"step": 6950
|
|
},
|
|
{
|
|
"entropy": 1.2078125,
|
|
"epoch": 0.951209512095121,
|
|
"grad_norm": 0.12256916843577502,
|
|
"learning_rate": 2.703607157954065e-06,
|
|
"loss": 0.9499,
|
|
"mean_token_accuracy": 0.7597824335098267,
|
|
"num_tokens": 641609525.0,
|
|
"step": 6960
|
|
},
|
|
{
|
|
"entropy": 1.26796875,
|
|
"epoch": 0.9525761924285909,
|
|
"grad_norm": 0.14471373565447126,
|
|
"learning_rate": 2.7000845427645483e-06,
|
|
"loss": 0.9885,
|
|
"mean_token_accuracy": 0.7518640577793121,
|
|
"num_tokens": 642492862.0,
|
|
"step": 6970
|
|
},
|
|
{
|
|
"entropy": 1.1859375,
|
|
"epoch": 0.9539428727620609,
|
|
"grad_norm": 0.12535778714809734,
|
|
"learning_rate": 2.6965619275750322e-06,
|
|
"loss": 0.9168,
|
|
"mean_token_accuracy": 0.7665763854980469,
|
|
"num_tokens": 643397187.0,
|
|
"step": 6980
|
|
},
|
|
{
|
|
"entropy": 1.27890625,
|
|
"epoch": 0.955309553095531,
|
|
"grad_norm": 0.1364580709674906,
|
|
"learning_rate": 2.6930393123855154e-06,
|
|
"loss": 1.0067,
|
|
"mean_token_accuracy": 0.7512794852256774,
|
|
"num_tokens": 644337919.0,
|
|
"step": 6990
|
|
},
|
|
{
|
|
"entropy": 1.271875,
|
|
"epoch": 0.956676233429001,
|
|
"grad_norm": 0.13376335917420198,
|
|
"learning_rate": 2.6895166971959985e-06,
|
|
"loss": 0.9884,
|
|
"mean_token_accuracy": 0.75415318608284,
|
|
"num_tokens": 645236378.0,
|
|
"step": 7000
|
|
},
|
|
{
|
|
"entropy": 1.19921875,
|
|
"epoch": 0.958042913762471,
|
|
"grad_norm": 0.1165077801670996,
|
|
"learning_rate": 2.6859940820064816e-06,
|
|
"loss": 0.923,
|
|
"mean_token_accuracy": 0.7673950970172883,
|
|
"num_tokens": 646140990.0,
|
|
"step": 7010
|
|
},
|
|
{
|
|
"entropy": 1.25625,
|
|
"epoch": 0.959409594095941,
|
|
"grad_norm": 0.13764669669181123,
|
|
"learning_rate": 2.6824714668169647e-06,
|
|
"loss": 0.9497,
|
|
"mean_token_accuracy": 0.7619356572628021,
|
|
"num_tokens": 647048468.0,
|
|
"step": 7020
|
|
},
|
|
{
|
|
"entropy": 1.23125,
|
|
"epoch": 0.9607762744294109,
|
|
"grad_norm": 0.14532683590221615,
|
|
"learning_rate": 2.6789488516274487e-06,
|
|
"loss": 0.9814,
|
|
"mean_token_accuracy": 0.75561483502388,
|
|
"num_tokens": 648040312.0,
|
|
"step": 7030
|
|
},
|
|
{
|
|
"entropy": 1.24609375,
|
|
"epoch": 0.9621429547628809,
|
|
"grad_norm": 0.1485249831104683,
|
|
"learning_rate": 2.675426236437932e-06,
|
|
"loss": 0.908,
|
|
"mean_token_accuracy": 0.7698418438434601,
|
|
"num_tokens": 649004460.0,
|
|
"step": 7040
|
|
},
|
|
{
|
|
"entropy": 1.1984375,
|
|
"epoch": 0.963509635096351,
|
|
"grad_norm": 0.11702267558621421,
|
|
"learning_rate": 2.671903621248415e-06,
|
|
"loss": 0.9393,
|
|
"mean_token_accuracy": 0.7614290177822113,
|
|
"num_tokens": 649898524.0,
|
|
"step": 7050
|
|
},
|
|
{
|
|
"entropy": 1.22890625,
|
|
"epoch": 0.964876315429821,
|
|
"grad_norm": 0.14277948881909897,
|
|
"learning_rate": 2.668381006058898e-06,
|
|
"loss": 0.9763,
|
|
"mean_token_accuracy": 0.7539461135864258,
|
|
"num_tokens": 650801130.0,
|
|
"step": 7060
|
|
},
|
|
{
|
|
"entropy": 1.24921875,
|
|
"epoch": 0.966242995763291,
|
|
"grad_norm": 0.11635666599631678,
|
|
"learning_rate": 2.6648583908693816e-06,
|
|
"loss": 0.9162,
|
|
"mean_token_accuracy": 0.7677872478961945,
|
|
"num_tokens": 651718796.0,
|
|
"step": 7070
|
|
},
|
|
{
|
|
"entropy": 1.27109375,
|
|
"epoch": 0.967609676096761,
|
|
"grad_norm": 0.18797064706450983,
|
|
"learning_rate": 2.6613357756798648e-06,
|
|
"loss": 1.0216,
|
|
"mean_token_accuracy": 0.7484451174736023,
|
|
"num_tokens": 652638787.0,
|
|
"step": 7080
|
|
},
|
|
{
|
|
"entropy": 1.22578125,
|
|
"epoch": 0.968976356430231,
|
|
"grad_norm": 0.12267175468256121,
|
|
"learning_rate": 2.6578131604903483e-06,
|
|
"loss": 0.9609,
|
|
"mean_token_accuracy": 0.7576536118984223,
|
|
"num_tokens": 653525666.0,
|
|
"step": 7090
|
|
},
|
|
{
|
|
"entropy": 1.2265625,
|
|
"epoch": 0.9703430367637009,
|
|
"grad_norm": 0.13464725232211555,
|
|
"learning_rate": 2.6542905453008314e-06,
|
|
"loss": 0.924,
|
|
"mean_token_accuracy": 0.766748595237732,
|
|
"num_tokens": 654449752.0,
|
|
"step": 7100
|
|
},
|
|
{
|
|
"entropy": 1.246875,
|
|
"epoch": 0.971709717097171,
|
|
"grad_norm": 0.12515579196683602,
|
|
"learning_rate": 2.650767930111315e-06,
|
|
"loss": 0.973,
|
|
"mean_token_accuracy": 0.758135199546814,
|
|
"num_tokens": 655381010.0,
|
|
"step": 7110
|
|
},
|
|
{
|
|
"entropy": 1.2328125,
|
|
"epoch": 0.973076397430641,
|
|
"grad_norm": 0.12200975362687386,
|
|
"learning_rate": 2.647245314921798e-06,
|
|
"loss": 0.9375,
|
|
"mean_token_accuracy": 0.7633744537830353,
|
|
"num_tokens": 656339372.0,
|
|
"step": 7120
|
|
},
|
|
{
|
|
"entropy": 1.21015625,
|
|
"epoch": 0.974443077764111,
|
|
"grad_norm": 0.11026180927988587,
|
|
"learning_rate": 2.6437226997322812e-06,
|
|
"loss": 0.9423,
|
|
"mean_token_accuracy": 0.7640462756156922,
|
|
"num_tokens": 657308740.0,
|
|
"step": 7130
|
|
},
|
|
{
|
|
"entropy": 1.20703125,
|
|
"epoch": 0.975809758097581,
|
|
"grad_norm": 0.12209430824436618,
|
|
"learning_rate": 2.640200084542765e-06,
|
|
"loss": 0.9162,
|
|
"mean_token_accuracy": 0.7656663656234741,
|
|
"num_tokens": 658245328.0,
|
|
"step": 7140
|
|
},
|
|
{
|
|
"entropy": 1.2328125,
|
|
"epoch": 0.977176438431051,
|
|
"grad_norm": 0.14241366176836973,
|
|
"learning_rate": 2.6366774693532483e-06,
|
|
"loss": 0.9589,
|
|
"mean_token_accuracy": 0.7600841164588928,
|
|
"num_tokens": 659099116.0,
|
|
"step": 7150
|
|
},
|
|
{
|
|
"entropy": 1.26328125,
|
|
"epoch": 0.9785431187645209,
|
|
"grad_norm": 0.12937542566565766,
|
|
"learning_rate": 2.6331548541637314e-06,
|
|
"loss": 0.9779,
|
|
"mean_token_accuracy": 0.7554738044738769,
|
|
"num_tokens": 660019179.0,
|
|
"step": 7160
|
|
},
|
|
{
|
|
"entropy": 1.2015625,
|
|
"epoch": 0.979909799097991,
|
|
"grad_norm": 0.11340145215505856,
|
|
"learning_rate": 2.6296322389742146e-06,
|
|
"loss": 0.9227,
|
|
"mean_token_accuracy": 0.7664926230907441,
|
|
"num_tokens": 660951954.0,
|
|
"step": 7170
|
|
},
|
|
{
|
|
"entropy": 1.18203125,
|
|
"epoch": 0.981276479431461,
|
|
"grad_norm": 0.12497899814371519,
|
|
"learning_rate": 2.6261096237846977e-06,
|
|
"loss": 0.9194,
|
|
"mean_token_accuracy": 0.7674131155014038,
|
|
"num_tokens": 661862699.0,
|
|
"step": 7180
|
|
},
|
|
{
|
|
"entropy": 1.2203125,
|
|
"epoch": 0.982643159764931,
|
|
"grad_norm": 0.1457836970008591,
|
|
"learning_rate": 2.622587008595181e-06,
|
|
"loss": 0.955,
|
|
"mean_token_accuracy": 0.7598305165767669,
|
|
"num_tokens": 662762440.0,
|
|
"step": 7190
|
|
},
|
|
{
|
|
"entropy": 1.25546875,
|
|
"epoch": 0.984009840098401,
|
|
"grad_norm": 0.14182798857935514,
|
|
"learning_rate": 2.6190643934056648e-06,
|
|
"loss": 0.9769,
|
|
"mean_token_accuracy": 0.7541238129138946,
|
|
"num_tokens": 663695752.0,
|
|
"step": 7200
|
|
},
|
|
{
|
|
"entropy": 1.28125,
|
|
"epoch": 0.985376520431871,
|
|
"grad_norm": 0.1183344210127067,
|
|
"learning_rate": 2.615541778216148e-06,
|
|
"loss": 1.0009,
|
|
"mean_token_accuracy": 0.7547040164470673,
|
|
"num_tokens": 664595316.0,
|
|
"step": 7210
|
|
},
|
|
{
|
|
"entropy": 1.2109375,
|
|
"epoch": 0.9867432007653409,
|
|
"grad_norm": 0.1305490013145179,
|
|
"learning_rate": 2.612019163026631e-06,
|
|
"loss": 0.9292,
|
|
"mean_token_accuracy": 0.7639696359634399,
|
|
"num_tokens": 665499511.0,
|
|
"step": 7220
|
|
},
|
|
{
|
|
"entropy": 1.29609375,
|
|
"epoch": 0.988109881098811,
|
|
"grad_norm": 0.1325581699737574,
|
|
"learning_rate": 2.6084965478371146e-06,
|
|
"loss": 1.0037,
|
|
"mean_token_accuracy": 0.7510058343410492,
|
|
"num_tokens": 666424892.0,
|
|
"step": 7230
|
|
},
|
|
{
|
|
"entropy": 1.1953125,
|
|
"epoch": 0.989476561432281,
|
|
"grad_norm": 0.11889449282639124,
|
|
"learning_rate": 2.6049739326475977e-06,
|
|
"loss": 0.9265,
|
|
"mean_token_accuracy": 0.7660112917423249,
|
|
"num_tokens": 667349028.0,
|
|
"step": 7240
|
|
},
|
|
{
|
|
"entropy": 1.26328125,
|
|
"epoch": 0.990843241765751,
|
|
"grad_norm": 0.14562505771785184,
|
|
"learning_rate": 2.6014513174580812e-06,
|
|
"loss": 0.9299,
|
|
"mean_token_accuracy": 0.7658173561096191,
|
|
"num_tokens": 668242767.0,
|
|
"step": 7250
|
|
},
|
|
{
|
|
"entropy": 1.2078125,
|
|
"epoch": 0.992209922099221,
|
|
"grad_norm": 0.12641911011154383,
|
|
"learning_rate": 2.5979287022685644e-06,
|
|
"loss": 0.9261,
|
|
"mean_token_accuracy": 0.7662951469421386,
|
|
"num_tokens": 669135549.0,
|
|
"step": 7260
|
|
},
|
|
{
|
|
"entropy": 1.2046875,
|
|
"epoch": 0.993576602432691,
|
|
"grad_norm": 0.13267778410767353,
|
|
"learning_rate": 2.594406087079048e-06,
|
|
"loss": 0.9075,
|
|
"mean_token_accuracy": 0.768664437532425,
|
|
"num_tokens": 670042351.0,
|
|
"step": 7270
|
|
},
|
|
{
|
|
"entropy": 1.25859375,
|
|
"epoch": 0.994943282766161,
|
|
"grad_norm": 0.11969569796532305,
|
|
"learning_rate": 2.590883471889531e-06,
|
|
"loss": 1.0235,
|
|
"mean_token_accuracy": 0.7469672083854675,
|
|
"num_tokens": 670950924.0,
|
|
"step": 7280
|
|
},
|
|
{
|
|
"entropy": 1.2046875,
|
|
"epoch": 0.996309963099631,
|
|
"grad_norm": 0.13007115730505903,
|
|
"learning_rate": 2.587360856700014e-06,
|
|
"loss": 0.9385,
|
|
"mean_token_accuracy": 0.7624850153923035,
|
|
"num_tokens": 671855775.0,
|
|
"step": 7290
|
|
},
|
|
{
|
|
"entropy": 1.21328125,
|
|
"epoch": 0.997676643433101,
|
|
"grad_norm": 0.16651891886464376,
|
|
"learning_rate": 2.5838382415104973e-06,
|
|
"loss": 0.9429,
|
|
"mean_token_accuracy": 0.7631774306297302,
|
|
"num_tokens": 672778864.0,
|
|
"step": 7300
|
|
},
|
|
{
|
|
"entropy": 1.26953125,
|
|
"epoch": 0.999043323766571,
|
|
"grad_norm": 0.11805690298095352,
|
|
"learning_rate": 2.5803156263209813e-06,
|
|
"loss": 0.9721,
|
|
"mean_token_accuracy": 0.756582397222519,
|
|
"num_tokens": 673675531.0,
|
|
"step": 7310
|
|
},
|
|
{
|
|
"entropy": 1.2734375,
|
|
"epoch": 1.000410004100041,
|
|
"grad_norm": 0.13069125119348798,
|
|
"learning_rate": 2.5767930111314644e-06,
|
|
"loss": 1.0087,
|
|
"mean_token_accuracy": 0.750216418504715,
|
|
"num_tokens": 674636327.0,
|
|
"step": 7320
|
|
},
|
|
{
|
|
"entropy": 1.225,
|
|
"epoch": 1.001776684433511,
|
|
"grad_norm": 0.13173200983437824,
|
|
"learning_rate": 2.5732703959419475e-06,
|
|
"loss": 0.9525,
|
|
"mean_token_accuracy": 0.7606507182121277,
|
|
"num_tokens": 675525894.0,
|
|
"step": 7330
|
|
},
|
|
{
|
|
"entropy": 1.2078125,
|
|
"epoch": 1.003143364766981,
|
|
"grad_norm": 0.11275198494405916,
|
|
"learning_rate": 2.5697477807524306e-06,
|
|
"loss": 0.9461,
|
|
"mean_token_accuracy": 0.7597591340541839,
|
|
"num_tokens": 676510301.0,
|
|
"step": 7340
|
|
},
|
|
{
|
|
"entropy": 1.17890625,
|
|
"epoch": 1.004510045100451,
|
|
"grad_norm": 0.15354045396687632,
|
|
"learning_rate": 2.5662251655629138e-06,
|
|
"loss": 0.9352,
|
|
"mean_token_accuracy": 0.7630761981010437,
|
|
"num_tokens": 677432141.0,
|
|
"step": 7350
|
|
},
|
|
{
|
|
"entropy": 1.24921875,
|
|
"epoch": 1.005876725433921,
|
|
"grad_norm": 0.13279458236599365,
|
|
"learning_rate": 2.5627025503733977e-06,
|
|
"loss": 0.9641,
|
|
"mean_token_accuracy": 0.7568867921829223,
|
|
"num_tokens": 678360785.0,
|
|
"step": 7360
|
|
},
|
|
{
|
|
"entropy": 1.26015625,
|
|
"epoch": 1.007243405767391,
|
|
"grad_norm": 0.1190065945972923,
|
|
"learning_rate": 2.559179935183881e-06,
|
|
"loss": 1.0107,
|
|
"mean_token_accuracy": 0.7509410440921783,
|
|
"num_tokens": 679264490.0,
|
|
"step": 7370
|
|
},
|
|
{
|
|
"entropy": 1.22734375,
|
|
"epoch": 1.0086100861008611,
|
|
"grad_norm": 0.13411530027286547,
|
|
"learning_rate": 2.555657319994364e-06,
|
|
"loss": 0.9517,
|
|
"mean_token_accuracy": 0.7612459599971771,
|
|
"num_tokens": 680184449.0,
|
|
"step": 7380
|
|
},
|
|
{
|
|
"entropy": 1.22734375,
|
|
"epoch": 1.009976766434331,
|
|
"grad_norm": 0.12006231216334896,
|
|
"learning_rate": 2.552134704804847e-06,
|
|
"loss": 0.9564,
|
|
"mean_token_accuracy": 0.7590114355087281,
|
|
"num_tokens": 681146324.0,
|
|
"step": 7390
|
|
},
|
|
{
|
|
"entropy": 1.284375,
|
|
"epoch": 1.011343446767801,
|
|
"grad_norm": 0.12782709493134434,
|
|
"learning_rate": 2.5486120896153306e-06,
|
|
"loss": 0.9894,
|
|
"mean_token_accuracy": 0.7523319482803345,
|
|
"num_tokens": 682048165.0,
|
|
"step": 7400
|
|
},
|
|
{
|
|
"entropy": 1.22265625,
|
|
"epoch": 1.012710127101271,
|
|
"grad_norm": 0.15127256191262653,
|
|
"learning_rate": 2.5450894744258138e-06,
|
|
"loss": 0.9311,
|
|
"mean_token_accuracy": 0.7652377545833587,
|
|
"num_tokens": 682971836.0,
|
|
"step": 7410
|
|
},
|
|
{
|
|
"entropy": 1.2015625,
|
|
"epoch": 1.014076807434741,
|
|
"grad_norm": 0.12594378776604742,
|
|
"learning_rate": 2.5415668592362973e-06,
|
|
"loss": 0.916,
|
|
"mean_token_accuracy": 0.7680517196655273,
|
|
"num_tokens": 683851000.0,
|
|
"step": 7420
|
|
},
|
|
{
|
|
"entropy": 1.20546875,
|
|
"epoch": 1.015443487768211,
|
|
"grad_norm": 0.13041259701450797,
|
|
"learning_rate": 2.5380442440467804e-06,
|
|
"loss": 0.9186,
|
|
"mean_token_accuracy": 0.7689075708389282,
|
|
"num_tokens": 684791401.0,
|
|
"step": 7430
|
|
},
|
|
{
|
|
"entropy": 1.27265625,
|
|
"epoch": 1.016810168101681,
|
|
"grad_norm": 0.14150529186637312,
|
|
"learning_rate": 2.534521628857264e-06,
|
|
"loss": 0.9998,
|
|
"mean_token_accuracy": 0.7507450938224792,
|
|
"num_tokens": 685705685.0,
|
|
"step": 7440
|
|
},
|
|
{
|
|
"entropy": 1.22578125,
|
|
"epoch": 1.018176848435151,
|
|
"grad_norm": 0.10952196006492311,
|
|
"learning_rate": 2.530999013667747e-06,
|
|
"loss": 0.9633,
|
|
"mean_token_accuracy": 0.7585271954536438,
|
|
"num_tokens": 686605303.0,
|
|
"step": 7450
|
|
},
|
|
{
|
|
"entropy": 1.32109375,
|
|
"epoch": 1.019543528768621,
|
|
"grad_norm": 0.14659281874256408,
|
|
"learning_rate": 2.5274763984782302e-06,
|
|
"loss": 1.0248,
|
|
"mean_token_accuracy": 0.7478725135326385,
|
|
"num_tokens": 687526237.0,
|
|
"step": 7460
|
|
},
|
|
{
|
|
"entropy": 1.18046875,
|
|
"epoch": 1.020910209102091,
|
|
"grad_norm": 0.13119986305157763,
|
|
"learning_rate": 2.5239537832887138e-06,
|
|
"loss": 0.9189,
|
|
"mean_token_accuracy": 0.768030297756195,
|
|
"num_tokens": 688486449.0,
|
|
"step": 7470
|
|
},
|
|
{
|
|
"entropy": 1.2265625,
|
|
"epoch": 1.022276889435561,
|
|
"grad_norm": 0.13007410363783123,
|
|
"learning_rate": 2.5204311680991973e-06,
|
|
"loss": 0.934,
|
|
"mean_token_accuracy": 0.7624589264392853,
|
|
"num_tokens": 689414922.0,
|
|
"step": 7480
|
|
},
|
|
{
|
|
"entropy": 1.1859375,
|
|
"epoch": 1.023643569769031,
|
|
"grad_norm": 0.11300714793888934,
|
|
"learning_rate": 2.5169085529096804e-06,
|
|
"loss": 0.8963,
|
|
"mean_token_accuracy": 0.7722432911396027,
|
|
"num_tokens": 690270353.0,
|
|
"step": 7490
|
|
},
|
|
{
|
|
"entropy": 1.2390625,
|
|
"epoch": 1.0250102501025011,
|
|
"grad_norm": 0.13194396055293456,
|
|
"learning_rate": 2.5133859377201636e-06,
|
|
"loss": 0.9615,
|
|
"mean_token_accuracy": 0.7565899908542633,
|
|
"num_tokens": 691186114.0,
|
|
"step": 7500
|
|
},
|
|
{
|
|
"entropy": 1.27265625,
|
|
"epoch": 1.0263769304359711,
|
|
"grad_norm": 0.13133848700612488,
|
|
"learning_rate": 2.5098633225306467e-06,
|
|
"loss": 0.9855,
|
|
"mean_token_accuracy": 0.753675502538681,
|
|
"num_tokens": 692117025.0,
|
|
"step": 7510
|
|
},
|
|
{
|
|
"entropy": 1.21796875,
|
|
"epoch": 1.027743610769441,
|
|
"grad_norm": 0.12698902725874223,
|
|
"learning_rate": 2.50634070734113e-06,
|
|
"loss": 0.9303,
|
|
"mean_token_accuracy": 0.7628591597080231,
|
|
"num_tokens": 693050611.0,
|
|
"step": 7520
|
|
},
|
|
{
|
|
"entropy": 1.20859375,
|
|
"epoch": 1.029110291102911,
|
|
"grad_norm": 0.12736377890239328,
|
|
"learning_rate": 2.502818092151614e-06,
|
|
"loss": 0.9432,
|
|
"mean_token_accuracy": 0.7629752159118652,
|
|
"num_tokens": 693952358.0,
|
|
"step": 7530
|
|
},
|
|
{
|
|
"entropy": 1.22421875,
|
|
"epoch": 1.030476971436381,
|
|
"grad_norm": 0.13372724059215116,
|
|
"learning_rate": 2.499295476962097e-06,
|
|
"loss": 0.9613,
|
|
"mean_token_accuracy": 0.7581845760345459,
|
|
"num_tokens": 694878753.0,
|
|
"step": 7540
|
|
},
|
|
{
|
|
"entropy": 1.2375,
|
|
"epoch": 1.031843651769851,
|
|
"grad_norm": 0.12052755843058047,
|
|
"learning_rate": 2.49577286177258e-06,
|
|
"loss": 0.9825,
|
|
"mean_token_accuracy": 0.7565103590488433,
|
|
"num_tokens": 695831733.0,
|
|
"step": 7550
|
|
},
|
|
{
|
|
"entropy": 1.23203125,
|
|
"epoch": 1.033210332103321,
|
|
"grad_norm": 0.1278996682349083,
|
|
"learning_rate": 2.492250246583063e-06,
|
|
"loss": 0.9905,
|
|
"mean_token_accuracy": 0.7546702861785889,
|
|
"num_tokens": 696739857.0,
|
|
"step": 7560
|
|
},
|
|
{
|
|
"entropy": 1.22421875,
|
|
"epoch": 1.034577012436791,
|
|
"grad_norm": 0.12262385144241426,
|
|
"learning_rate": 2.4887276313935467e-06,
|
|
"loss": 0.922,
|
|
"mean_token_accuracy": 0.7655267834663391,
|
|
"num_tokens": 697643679.0,
|
|
"step": 7570
|
|
},
|
|
{
|
|
"entropy": 1.221875,
|
|
"epoch": 1.035943692770261,
|
|
"grad_norm": 0.12170767889881619,
|
|
"learning_rate": 2.48520501620403e-06,
|
|
"loss": 0.937,
|
|
"mean_token_accuracy": 0.7624337553977967,
|
|
"num_tokens": 698587437.0,
|
|
"step": 7580
|
|
},
|
|
{
|
|
"entropy": 1.18359375,
|
|
"epoch": 1.037310373103731,
|
|
"grad_norm": 0.13547905435224422,
|
|
"learning_rate": 2.4816824010145134e-06,
|
|
"loss": 0.9019,
|
|
"mean_token_accuracy": 0.7676351726055145,
|
|
"num_tokens": 699490277.0,
|
|
"step": 7590
|
|
},
|
|
{
|
|
"entropy": 1.2140625,
|
|
"epoch": 1.038677053437201,
|
|
"grad_norm": 0.13862383356926153,
|
|
"learning_rate": 2.478159785824997e-06,
|
|
"loss": 0.959,
|
|
"mean_token_accuracy": 0.7596507012844086,
|
|
"num_tokens": 700469765.0,
|
|
"step": 7600
|
|
},
|
|
{
|
|
"entropy": 1.2265625,
|
|
"epoch": 1.040043733770671,
|
|
"grad_norm": 0.14943425334363336,
|
|
"learning_rate": 2.47463717063548e-06,
|
|
"loss": 0.9152,
|
|
"mean_token_accuracy": 0.768087649345398,
|
|
"num_tokens": 701399673.0,
|
|
"step": 7610
|
|
},
|
|
{
|
|
"entropy": 1.2671875,
|
|
"epoch": 1.0414104141041411,
|
|
"grad_norm": 0.1252776011282262,
|
|
"learning_rate": 2.4711145554459636e-06,
|
|
"loss": 0.9945,
|
|
"mean_token_accuracy": 0.7524405181407928,
|
|
"num_tokens": 702352041.0,
|
|
"step": 7620
|
|
},
|
|
{
|
|
"entropy": 1.2484375,
|
|
"epoch": 1.0427770944376111,
|
|
"grad_norm": 0.1258982003829036,
|
|
"learning_rate": 2.4675919402564467e-06,
|
|
"loss": 0.9644,
|
|
"mean_token_accuracy": 0.7574936330318451,
|
|
"num_tokens": 703273557.0,
|
|
"step": 7630
|
|
},
|
|
{
|
|
"entropy": 1.24609375,
|
|
"epoch": 1.0441437747710811,
|
|
"grad_norm": 0.13629538239920153,
|
|
"learning_rate": 2.46406932506693e-06,
|
|
"loss": 0.9643,
|
|
"mean_token_accuracy": 0.7587669432163239,
|
|
"num_tokens": 704228082.0,
|
|
"step": 7640
|
|
},
|
|
{
|
|
"entropy": 1.2375,
|
|
"epoch": 1.045510455104551,
|
|
"grad_norm": 0.13411271705713282,
|
|
"learning_rate": 2.4605467098774134e-06,
|
|
"loss": 0.9577,
|
|
"mean_token_accuracy": 0.7593065798282623,
|
|
"num_tokens": 705192144.0,
|
|
"step": 7650
|
|
},
|
|
{
|
|
"entropy": 1.1953125,
|
|
"epoch": 1.046877135438021,
|
|
"grad_norm": 0.12714821683599792,
|
|
"learning_rate": 2.4570240946878965e-06,
|
|
"loss": 0.9511,
|
|
"mean_token_accuracy": 0.7607262134552002,
|
|
"num_tokens": 706106625.0,
|
|
"step": 7660
|
|
},
|
|
{
|
|
"entropy": 1.24375,
|
|
"epoch": 1.048243815771491,
|
|
"grad_norm": 0.13293692437195911,
|
|
"learning_rate": 2.4535014794983796e-06,
|
|
"loss": 1.0,
|
|
"mean_token_accuracy": 0.7535376846790314,
|
|
"num_tokens": 707021496.0,
|
|
"step": 7670
|
|
},
|
|
{
|
|
"entropy": 1.19296875,
|
|
"epoch": 1.049610496104961,
|
|
"grad_norm": 0.13560165735140917,
|
|
"learning_rate": 2.449978864308863e-06,
|
|
"loss": 0.8994,
|
|
"mean_token_accuracy": 0.7717001140117645,
|
|
"num_tokens": 707906178.0,
|
|
"step": 7680
|
|
},
|
|
{
|
|
"entropy": 1.228125,
|
|
"epoch": 1.050977176438431,
|
|
"grad_norm": 0.1152389835823692,
|
|
"learning_rate": 2.4464562491193463e-06,
|
|
"loss": 0.9562,
|
|
"mean_token_accuracy": 0.7597063779830933,
|
|
"num_tokens": 708801138.0,
|
|
"step": 7690
|
|
},
|
|
{
|
|
"entropy": 1.2453125,
|
|
"epoch": 1.052343856771901,
|
|
"grad_norm": 0.14678706287777785,
|
|
"learning_rate": 2.4429336339298294e-06,
|
|
"loss": 0.9657,
|
|
"mean_token_accuracy": 0.7599787473678589,
|
|
"num_tokens": 709746763.0,
|
|
"step": 7700
|
|
},
|
|
{
|
|
"entropy": 1.1546875,
|
|
"epoch": 1.053710537105371,
|
|
"grad_norm": 0.12935773267426795,
|
|
"learning_rate": 2.439411018740313e-06,
|
|
"loss": 0.8846,
|
|
"mean_token_accuracy": 0.7701934576034546,
|
|
"num_tokens": 710631483.0,
|
|
"step": 7710
|
|
},
|
|
{
|
|
"entropy": 1.19296875,
|
|
"epoch": 1.055077217438841,
|
|
"grad_norm": 0.11749784969986965,
|
|
"learning_rate": 2.435888403550796e-06,
|
|
"loss": 0.8841,
|
|
"mean_token_accuracy": 0.7728232741355896,
|
|
"num_tokens": 711528540.0,
|
|
"step": 7720
|
|
},
|
|
{
|
|
"entropy": 1.234375,
|
|
"epoch": 1.056443897772311,
|
|
"grad_norm": 0.13399319264897527,
|
|
"learning_rate": 2.4323657883612797e-06,
|
|
"loss": 0.9895,
|
|
"mean_token_accuracy": 0.7546544015407562,
|
|
"num_tokens": 712460832.0,
|
|
"step": 7730
|
|
},
|
|
{
|
|
"entropy": 1.23984375,
|
|
"epoch": 1.0578105781057812,
|
|
"grad_norm": 0.13016476480110103,
|
|
"learning_rate": 2.4288431731717628e-06,
|
|
"loss": 0.9552,
|
|
"mean_token_accuracy": 0.7598065137863159,
|
|
"num_tokens": 713350708.0,
|
|
"step": 7740
|
|
},
|
|
{
|
|
"entropy": 1.216796875,
|
|
"epoch": 1.0591772584392511,
|
|
"grad_norm": 0.13997897769518314,
|
|
"learning_rate": 2.4253205579822463e-06,
|
|
"loss": 0.9514,
|
|
"mean_token_accuracy": 0.7593393564224243,
|
|
"num_tokens": 714247281.0,
|
|
"step": 7750
|
|
},
|
|
{
|
|
"entropy": 1.1953125,
|
|
"epoch": 1.0605439387727211,
|
|
"grad_norm": 0.12550343115825935,
|
|
"learning_rate": 2.4217979427927294e-06,
|
|
"loss": 0.919,
|
|
"mean_token_accuracy": 0.7679598093032837,
|
|
"num_tokens": 715138854.0,
|
|
"step": 7760
|
|
},
|
|
{
|
|
"entropy": 1.178125,
|
|
"epoch": 1.0619106191061911,
|
|
"grad_norm": 0.1751925285289775,
|
|
"learning_rate": 2.418275327603213e-06,
|
|
"loss": 0.9465,
|
|
"mean_token_accuracy": 0.7629696369171143,
|
|
"num_tokens": 716042245.0,
|
|
"step": 7770
|
|
},
|
|
{
|
|
"entropy": 1.2109375,
|
|
"epoch": 1.063277299439661,
|
|
"grad_norm": 0.16888993918736556,
|
|
"learning_rate": 2.414752712413696e-06,
|
|
"loss": 0.9291,
|
|
"mean_token_accuracy": 0.7652594685554505,
|
|
"num_tokens": 716962640.0,
|
|
"step": 7780
|
|
},
|
|
{
|
|
"entropy": 1.18671875,
|
|
"epoch": 1.064643979773131,
|
|
"grad_norm": 0.11981195239550481,
|
|
"learning_rate": 2.4112300972241797e-06,
|
|
"loss": 0.8922,
|
|
"mean_token_accuracy": 0.7726359009742737,
|
|
"num_tokens": 717870625.0,
|
|
"step": 7790
|
|
},
|
|
{
|
|
"entropy": 1.23046875,
|
|
"epoch": 1.066010660106601,
|
|
"grad_norm": 0.12430311161926105,
|
|
"learning_rate": 2.4077074820346628e-06,
|
|
"loss": 0.9825,
|
|
"mean_token_accuracy": 0.7534499824047088,
|
|
"num_tokens": 718799421.0,
|
|
"step": 7800
|
|
},
|
|
{
|
|
"entropy": 1.2359375,
|
|
"epoch": 1.067377340440071,
|
|
"grad_norm": 0.12805750636440222,
|
|
"learning_rate": 2.404184866845146e-06,
|
|
"loss": 0.9564,
|
|
"mean_token_accuracy": 0.7587249934673309,
|
|
"num_tokens": 719746616.0,
|
|
"step": 7810
|
|
},
|
|
{
|
|
"entropy": 1.24921875,
|
|
"epoch": 1.068744020773541,
|
|
"grad_norm": 0.12700165667528251,
|
|
"learning_rate": 2.4006622516556295e-06,
|
|
"loss": 0.9679,
|
|
"mean_token_accuracy": 0.7572682440280915,
|
|
"num_tokens": 720672544.0,
|
|
"step": 7820
|
|
},
|
|
{
|
|
"entropy": 1.2609375,
|
|
"epoch": 1.070110701107011,
|
|
"grad_norm": 0.13314942645470973,
|
|
"learning_rate": 2.3971396364661126e-06,
|
|
"loss": 0.9795,
|
|
"mean_token_accuracy": 0.755351334810257,
|
|
"num_tokens": 721583384.0,
|
|
"step": 7830
|
|
},
|
|
{
|
|
"entropy": 1.246875,
|
|
"epoch": 1.071477381440481,
|
|
"grad_norm": 0.14044421811948316,
|
|
"learning_rate": 2.393617021276596e-06,
|
|
"loss": 0.9571,
|
|
"mean_token_accuracy": 0.7607393145561219,
|
|
"num_tokens": 722493561.0,
|
|
"step": 7840
|
|
},
|
|
{
|
|
"entropy": 1.24765625,
|
|
"epoch": 1.072844061773951,
|
|
"grad_norm": 0.11811985117399573,
|
|
"learning_rate": 2.3900944060870793e-06,
|
|
"loss": 0.946,
|
|
"mean_token_accuracy": 0.7632117211818695,
|
|
"num_tokens": 723384528.0,
|
|
"step": 7850
|
|
},
|
|
{
|
|
"entropy": 1.22421875,
|
|
"epoch": 1.0742107421074212,
|
|
"grad_norm": 0.11970811737163159,
|
|
"learning_rate": 2.3865717908975624e-06,
|
|
"loss": 0.9305,
|
|
"mean_token_accuracy": 0.7634069800376893,
|
|
"num_tokens": 724319167.0,
|
|
"step": 7860
|
|
},
|
|
{
|
|
"entropy": 1.248828125,
|
|
"epoch": 1.0755774224408912,
|
|
"grad_norm": 0.14323936927765024,
|
|
"learning_rate": 2.383049175708046e-06,
|
|
"loss": 0.9389,
|
|
"mean_token_accuracy": 0.762089729309082,
|
|
"num_tokens": 725236882.0,
|
|
"step": 7870
|
|
},
|
|
{
|
|
"entropy": 1.21328125,
|
|
"epoch": 1.0769441027743611,
|
|
"grad_norm": 0.14220299911110712,
|
|
"learning_rate": 2.379526560518529e-06,
|
|
"loss": 0.9661,
|
|
"mean_token_accuracy": 0.7578314006328583,
|
|
"num_tokens": 726143276.0,
|
|
"step": 7880
|
|
},
|
|
{
|
|
"entropy": 1.25859375,
|
|
"epoch": 1.0783107831078311,
|
|
"grad_norm": 0.12274315981589147,
|
|
"learning_rate": 2.376003945329012e-06,
|
|
"loss": 0.9919,
|
|
"mean_token_accuracy": 0.7508577585220337,
|
|
"num_tokens": 727083219.0,
|
|
"step": 7890
|
|
},
|
|
{
|
|
"entropy": 1.1703125,
|
|
"epoch": 1.079677463441301,
|
|
"grad_norm": 0.13305797529666785,
|
|
"learning_rate": 2.3724813301394957e-06,
|
|
"loss": 0.8678,
|
|
"mean_token_accuracy": 0.7762180626392364,
|
|
"num_tokens": 727975162.0,
|
|
"step": 7900
|
|
},
|
|
{
|
|
"entropy": 1.17890625,
|
|
"epoch": 1.081044143774771,
|
|
"grad_norm": 0.1168761776605119,
|
|
"learning_rate": 2.368958714949979e-06,
|
|
"loss": 0.8883,
|
|
"mean_token_accuracy": 0.7737667739391327,
|
|
"num_tokens": 728859542.0,
|
|
"step": 7910
|
|
},
|
|
{
|
|
"entropy": 1.221875,
|
|
"epoch": 1.082410824108241,
|
|
"grad_norm": 0.12331792095876688,
|
|
"learning_rate": 2.3654360997604624e-06,
|
|
"loss": 0.9085,
|
|
"mean_token_accuracy": 0.7697623670101166,
|
|
"num_tokens": 729761593.0,
|
|
"step": 7920
|
|
},
|
|
{
|
|
"entropy": 1.24140625,
|
|
"epoch": 1.083777504441711,
|
|
"grad_norm": 0.12669534896186632,
|
|
"learning_rate": 2.3619134845709455e-06,
|
|
"loss": 0.9295,
|
|
"mean_token_accuracy": 0.7671646475791931,
|
|
"num_tokens": 730709039.0,
|
|
"step": 7930
|
|
},
|
|
{
|
|
"entropy": 1.23359375,
|
|
"epoch": 1.085144184775181,
|
|
"grad_norm": 0.1119266038754281,
|
|
"learning_rate": 2.358390869381429e-06,
|
|
"loss": 0.9231,
|
|
"mean_token_accuracy": 0.7656123101711273,
|
|
"num_tokens": 731624659.0,
|
|
"step": 7940
|
|
},
|
|
{
|
|
"entropy": 1.24609375,
|
|
"epoch": 1.086510865108651,
|
|
"grad_norm": 0.16742080141816598,
|
|
"learning_rate": 2.354868254191912e-06,
|
|
"loss": 0.9551,
|
|
"mean_token_accuracy": 0.760902339220047,
|
|
"num_tokens": 732566122.0,
|
|
"step": 7950
|
|
},
|
|
{
|
|
"entropy": 1.2390625,
|
|
"epoch": 1.087877545442121,
|
|
"grad_norm": 0.13301962720333216,
|
|
"learning_rate": 2.3513456390023957e-06,
|
|
"loss": 0.9366,
|
|
"mean_token_accuracy": 0.7649707198143005,
|
|
"num_tokens": 733499588.0,
|
|
"step": 7960
|
|
},
|
|
{
|
|
"entropy": 1.2546875,
|
|
"epoch": 1.089244225775591,
|
|
"grad_norm": 0.12354251575839327,
|
|
"learning_rate": 2.347823023812879e-06,
|
|
"loss": 0.9428,
|
|
"mean_token_accuracy": 0.7626526772975921,
|
|
"num_tokens": 734386011.0,
|
|
"step": 7970
|
|
},
|
|
{
|
|
"entropy": 1.26328125,
|
|
"epoch": 1.090610906109061,
|
|
"grad_norm": 0.13537953730748523,
|
|
"learning_rate": 2.3443004086233624e-06,
|
|
"loss": 0.9234,
|
|
"mean_token_accuracy": 0.7672766625881196,
|
|
"num_tokens": 735290799.0,
|
|
"step": 7980
|
|
},
|
|
{
|
|
"entropy": 1.20859375,
|
|
"epoch": 1.0919775864425312,
|
|
"grad_norm": 0.1472039339482989,
|
|
"learning_rate": 2.3407777934338455e-06,
|
|
"loss": 0.9058,
|
|
"mean_token_accuracy": 0.7703146517276764,
|
|
"num_tokens": 736222579.0,
|
|
"step": 7990
|
|
},
|
|
{
|
|
"entropy": 1.20859375,
|
|
"epoch": 1.0933442667760012,
|
|
"grad_norm": 0.12334207290563626,
|
|
"learning_rate": 2.3372551782443286e-06,
|
|
"loss": 0.9308,
|
|
"mean_token_accuracy": 0.7647856533527374,
|
|
"num_tokens": 737134733.0,
|
|
"step": 8000
|
|
},
|
|
{
|
|
"entropy": 1.2328125,
|
|
"epoch": 1.0947109471094711,
|
|
"grad_norm": 0.12598806273117413,
|
|
"learning_rate": 2.333732563054812e-06,
|
|
"loss": 0.9626,
|
|
"mean_token_accuracy": 0.7568643927574158,
|
|
"num_tokens": 738079862.0,
|
|
"step": 8010
|
|
},
|
|
{
|
|
"entropy": 1.253125,
|
|
"epoch": 1.0960776274429411,
|
|
"grad_norm": 0.13024060531125153,
|
|
"learning_rate": 2.3302099478652953e-06,
|
|
"loss": 0.9555,
|
|
"mean_token_accuracy": 0.7619451284408569,
|
|
"num_tokens": 739009539.0,
|
|
"step": 8020
|
|
},
|
|
{
|
|
"entropy": 1.22734375,
|
|
"epoch": 1.097444307776411,
|
|
"grad_norm": 0.1691181587629683,
|
|
"learning_rate": 2.3266873326757784e-06,
|
|
"loss": 0.9439,
|
|
"mean_token_accuracy": 0.7635843873023986,
|
|
"num_tokens": 739893426.0,
|
|
"step": 8030
|
|
},
|
|
{
|
|
"entropy": 1.2875,
|
|
"epoch": 1.098810988109881,
|
|
"grad_norm": 0.12404461661826528,
|
|
"learning_rate": 2.323164717486262e-06,
|
|
"loss": 1.0093,
|
|
"mean_token_accuracy": 0.7460172593593597,
|
|
"num_tokens": 740840806.0,
|
|
"step": 8040
|
|
},
|
|
{
|
|
"entropy": 1.17734375,
|
|
"epoch": 1.100177668443351,
|
|
"grad_norm": 0.11689674700308035,
|
|
"learning_rate": 2.319642102296745e-06,
|
|
"loss": 0.9187,
|
|
"mean_token_accuracy": 0.7698860466480255,
|
|
"num_tokens": 741766338.0,
|
|
"step": 8050
|
|
},
|
|
{
|
|
"entropy": 1.2203125,
|
|
"epoch": 1.101544348776821,
|
|
"grad_norm": 0.13359038846232477,
|
|
"learning_rate": 2.3161194871072287e-06,
|
|
"loss": 0.9257,
|
|
"mean_token_accuracy": 0.7652411699295044,
|
|
"num_tokens": 742676539.0,
|
|
"step": 8060
|
|
},
|
|
{
|
|
"entropy": 1.20625,
|
|
"epoch": 1.102911029110291,
|
|
"grad_norm": 0.12168917858666826,
|
|
"learning_rate": 2.3125968719177118e-06,
|
|
"loss": 0.9169,
|
|
"mean_token_accuracy": 0.7685749232769012,
|
|
"num_tokens": 743576261.0,
|
|
"step": 8070
|
|
},
|
|
{
|
|
"entropy": 1.28671875,
|
|
"epoch": 1.104277709443761,
|
|
"grad_norm": 0.13966248337876522,
|
|
"learning_rate": 2.3090742567281953e-06,
|
|
"loss": 0.9687,
|
|
"mean_token_accuracy": 0.7563660383224488,
|
|
"num_tokens": 744533015.0,
|
|
"step": 8080
|
|
},
|
|
{
|
|
"entropy": 1.2015625,
|
|
"epoch": 1.105644389777231,
|
|
"grad_norm": 0.11151507992873008,
|
|
"learning_rate": 2.3055516415386785e-06,
|
|
"loss": 0.9742,
|
|
"mean_token_accuracy": 0.7580677509307862,
|
|
"num_tokens": 745439539.0,
|
|
"step": 8090
|
|
},
|
|
{
|
|
"entropy": 1.21953125,
|
|
"epoch": 1.1070110701107012,
|
|
"grad_norm": 0.146456146901803,
|
|
"learning_rate": 2.302029026349162e-06,
|
|
"loss": 0.923,
|
|
"mean_token_accuracy": 0.767876023054123,
|
|
"num_tokens": 746344325.0,
|
|
"step": 8100
|
|
},
|
|
{
|
|
"entropy": 1.23125,
|
|
"epoch": 1.1083777504441712,
|
|
"grad_norm": 0.14346657309210295,
|
|
"learning_rate": 2.298506411159645e-06,
|
|
"loss": 0.939,
|
|
"mean_token_accuracy": 0.7623617291450501,
|
|
"num_tokens": 747287311.0,
|
|
"step": 8110
|
|
},
|
|
{
|
|
"entropy": 1.20859375,
|
|
"epoch": 1.1097444307776412,
|
|
"grad_norm": 0.12323999967843925,
|
|
"learning_rate": 2.2949837959701287e-06,
|
|
"loss": 0.9338,
|
|
"mean_token_accuracy": 0.7619686126708984,
|
|
"num_tokens": 748278211.0,
|
|
"step": 8120
|
|
},
|
|
{
|
|
"entropy": 1.23671875,
|
|
"epoch": 1.1111111111111112,
|
|
"grad_norm": 0.13214983588479728,
|
|
"learning_rate": 2.291461180780612e-06,
|
|
"loss": 0.9419,
|
|
"mean_token_accuracy": 0.7634317517280579,
|
|
"num_tokens": 749232277.0,
|
|
"step": 8130
|
|
},
|
|
{
|
|
"entropy": 1.21875,
|
|
"epoch": 1.1124777914445811,
|
|
"grad_norm": 0.12458535080983878,
|
|
"learning_rate": 2.287938565591095e-06,
|
|
"loss": 0.8889,
|
|
"mean_token_accuracy": 0.7706424474716187,
|
|
"num_tokens": 750157024.0,
|
|
"step": 8140
|
|
},
|
|
{
|
|
"entropy": 1.1875,
|
|
"epoch": 1.1138444717780511,
|
|
"grad_norm": 0.10393495067307838,
|
|
"learning_rate": 2.2844159504015785e-06,
|
|
"loss": 0.9245,
|
|
"mean_token_accuracy": 0.765565425157547,
|
|
"num_tokens": 751102311.0,
|
|
"step": 8150
|
|
},
|
|
{
|
|
"entropy": 1.228125,
|
|
"epoch": 1.115211152111521,
|
|
"grad_norm": 0.12734595703377122,
|
|
"learning_rate": 2.2808933352120616e-06,
|
|
"loss": 0.9493,
|
|
"mean_token_accuracy": 0.7629797518253326,
|
|
"num_tokens": 751970935.0,
|
|
"step": 8160
|
|
},
|
|
{
|
|
"entropy": 1.23359375,
|
|
"epoch": 1.116577832444991,
|
|
"grad_norm": 0.12562980483819225,
|
|
"learning_rate": 2.277370720022545e-06,
|
|
"loss": 0.9496,
|
|
"mean_token_accuracy": 0.7598897635936737,
|
|
"num_tokens": 752883996.0,
|
|
"step": 8170
|
|
},
|
|
{
|
|
"entropy": 1.2140625,
|
|
"epoch": 1.117944512778461,
|
|
"grad_norm": 0.12848670462186118,
|
|
"learning_rate": 2.2738481048330283e-06,
|
|
"loss": 0.9594,
|
|
"mean_token_accuracy": 0.7576483964920044,
|
|
"num_tokens": 753824067.0,
|
|
"step": 8180
|
|
},
|
|
{
|
|
"entropy": 1.20234375,
|
|
"epoch": 1.119311193111931,
|
|
"grad_norm": 0.12464416703495902,
|
|
"learning_rate": 2.2703254896435114e-06,
|
|
"loss": 0.9459,
|
|
"mean_token_accuracy": 0.7601956725120544,
|
|
"num_tokens": 754780634.0,
|
|
"step": 8190
|
|
},
|
|
{
|
|
"entropy": 1.2421875,
|
|
"epoch": 1.120677873445401,
|
|
"grad_norm": 0.1374756323664175,
|
|
"learning_rate": 2.266802874453995e-06,
|
|
"loss": 0.9613,
|
|
"mean_token_accuracy": 0.7591378509998321,
|
|
"num_tokens": 755718040.0,
|
|
"step": 8200
|
|
},
|
|
{
|
|
"entropy": 1.221875,
|
|
"epoch": 1.122044553778871,
|
|
"grad_norm": 0.1327596184616831,
|
|
"learning_rate": 2.263280259264478e-06,
|
|
"loss": 0.9418,
|
|
"mean_token_accuracy": 0.762775456905365,
|
|
"num_tokens": 756620588.0,
|
|
"step": 8210
|
|
},
|
|
{
|
|
"entropy": 1.184375,
|
|
"epoch": 1.123411234112341,
|
|
"grad_norm": 0.12897872062844895,
|
|
"learning_rate": 2.259757644074961e-06,
|
|
"loss": 0.8544,
|
|
"mean_token_accuracy": 0.7788647294044495,
|
|
"num_tokens": 757521919.0,
|
|
"step": 8220
|
|
},
|
|
{
|
|
"entropy": 1.2421875,
|
|
"epoch": 1.1247779144458112,
|
|
"grad_norm": 0.12570199915075428,
|
|
"learning_rate": 2.2562350288854447e-06,
|
|
"loss": 0.9782,
|
|
"mean_token_accuracy": 0.7561373233795166,
|
|
"num_tokens": 758445977.0,
|
|
"step": 8230
|
|
},
|
|
{
|
|
"entropy": 1.1984375,
|
|
"epoch": 1.1261445947792812,
|
|
"grad_norm": 0.14671578937853208,
|
|
"learning_rate": 2.252712413695928e-06,
|
|
"loss": 0.9262,
|
|
"mean_token_accuracy": 0.7648785471916199,
|
|
"num_tokens": 759331953.0,
|
|
"step": 8240
|
|
},
|
|
{
|
|
"entropy": 1.228125,
|
|
"epoch": 1.1275112751127512,
|
|
"grad_norm": 0.12754742944686395,
|
|
"learning_rate": 2.2491897985064114e-06,
|
|
"loss": 0.9649,
|
|
"mean_token_accuracy": 0.7588446974754334,
|
|
"num_tokens": 760273968.0,
|
|
"step": 8250
|
|
},
|
|
{
|
|
"entropy": 1.20390625,
|
|
"epoch": 1.1288779554462212,
|
|
"grad_norm": 0.12777170263616783,
|
|
"learning_rate": 2.2456671833168945e-06,
|
|
"loss": 0.9328,
|
|
"mean_token_accuracy": 0.7658056139945983,
|
|
"num_tokens": 761159352.0,
|
|
"step": 8260
|
|
},
|
|
{
|
|
"entropy": 1.21796875,
|
|
"epoch": 1.1302446357796911,
|
|
"grad_norm": 0.13659076605173107,
|
|
"learning_rate": 2.242144568127378e-06,
|
|
"loss": 0.9771,
|
|
"mean_token_accuracy": 0.7561130881309509,
|
|
"num_tokens": 762051558.0,
|
|
"step": 8270
|
|
},
|
|
{
|
|
"entropy": 1.2671875,
|
|
"epoch": 1.1316113161131611,
|
|
"grad_norm": 0.11138846701375738,
|
|
"learning_rate": 2.238621952937861e-06,
|
|
"loss": 0.9774,
|
|
"mean_token_accuracy": 0.7580666720867157,
|
|
"num_tokens": 763006454.0,
|
|
"step": 8280
|
|
},
|
|
{
|
|
"entropy": 1.26953125,
|
|
"epoch": 1.132977996446631,
|
|
"grad_norm": 0.13185173412959142,
|
|
"learning_rate": 2.2350993377483447e-06,
|
|
"loss": 0.9715,
|
|
"mean_token_accuracy": 0.7559825658798218,
|
|
"num_tokens": 763919479.0,
|
|
"step": 8290
|
|
},
|
|
{
|
|
"entropy": 1.2234375,
|
|
"epoch": 1.134344676780101,
|
|
"grad_norm": 0.13155284925227564,
|
|
"learning_rate": 2.231576722558828e-06,
|
|
"loss": 0.9672,
|
|
"mean_token_accuracy": 0.7580343365669251,
|
|
"num_tokens": 764823373.0,
|
|
"step": 8300
|
|
},
|
|
{
|
|
"entropy": 1.2171875,
|
|
"epoch": 1.135711357113571,
|
|
"grad_norm": 0.13234231016182338,
|
|
"learning_rate": 2.2280541073693114e-06,
|
|
"loss": 0.9049,
|
|
"mean_token_accuracy": 0.7686514794826508,
|
|
"num_tokens": 765754606.0,
|
|
"step": 8310
|
|
},
|
|
{
|
|
"entropy": 1.2703125,
|
|
"epoch": 1.137078037447041,
|
|
"grad_norm": 0.13322823034944592,
|
|
"learning_rate": 2.2245314921797945e-06,
|
|
"loss": 0.9951,
|
|
"mean_token_accuracy": 0.7524205386638642,
|
|
"num_tokens": 766685236.0,
|
|
"step": 8320
|
|
},
|
|
{
|
|
"entropy": 1.2375,
|
|
"epoch": 1.1384447177805113,
|
|
"grad_norm": 0.13743083199245382,
|
|
"learning_rate": 2.2210088769902777e-06,
|
|
"loss": 0.9575,
|
|
"mean_token_accuracy": 0.7604546070098877,
|
|
"num_tokens": 767625646.0,
|
|
"step": 8330
|
|
},
|
|
{
|
|
"entropy": 1.1171875,
|
|
"epoch": 1.1398113981139812,
|
|
"grad_norm": 0.13992574075398137,
|
|
"learning_rate": 2.217486261800761e-06,
|
|
"loss": 0.8309,
|
|
"mean_token_accuracy": 0.7831876456737519,
|
|
"num_tokens": 768490930.0,
|
|
"step": 8340
|
|
},
|
|
{
|
|
"entropy": 1.23671875,
|
|
"epoch": 1.1411780784474512,
|
|
"grad_norm": 0.14031825557972186,
|
|
"learning_rate": 2.2139636466112443e-06,
|
|
"loss": 0.946,
|
|
"mean_token_accuracy": 0.7623365819454193,
|
|
"num_tokens": 769444909.0,
|
|
"step": 8350
|
|
},
|
|
{
|
|
"entropy": 1.18828125,
|
|
"epoch": 1.1425447587809212,
|
|
"grad_norm": 0.12467647382953874,
|
|
"learning_rate": 2.2104410314217275e-06,
|
|
"loss": 0.9016,
|
|
"mean_token_accuracy": 0.7712280333042145,
|
|
"num_tokens": 770354512.0,
|
|
"step": 8360
|
|
},
|
|
{
|
|
"entropy": 1.26171875,
|
|
"epoch": 1.1439114391143912,
|
|
"grad_norm": 0.13424232559684562,
|
|
"learning_rate": 2.206918416232211e-06,
|
|
"loss": 0.9703,
|
|
"mean_token_accuracy": 0.7581331610679627,
|
|
"num_tokens": 771302117.0,
|
|
"step": 8370
|
|
},
|
|
{
|
|
"entropy": 1.24765625,
|
|
"epoch": 1.1452781194478612,
|
|
"grad_norm": 0.1262717075275114,
|
|
"learning_rate": 2.203395801042694e-06,
|
|
"loss": 0.9897,
|
|
"mean_token_accuracy": 0.748904949426651,
|
|
"num_tokens": 772242430.0,
|
|
"step": 8380
|
|
},
|
|
{
|
|
"entropy": 1.21953125,
|
|
"epoch": 1.1466447997813312,
|
|
"grad_norm": 0.1349041269143827,
|
|
"learning_rate": 2.1998731858531777e-06,
|
|
"loss": 0.9225,
|
|
"mean_token_accuracy": 0.7671296775341034,
|
|
"num_tokens": 773212126.0,
|
|
"step": 8390
|
|
},
|
|
{
|
|
"entropy": 1.24140625,
|
|
"epoch": 1.1480114801148011,
|
|
"grad_norm": 0.13880447626453202,
|
|
"learning_rate": 2.196350570663661e-06,
|
|
"loss": 0.909,
|
|
"mean_token_accuracy": 0.7675726592540741,
|
|
"num_tokens": 774140401.0,
|
|
"step": 8400
|
|
},
|
|
{
|
|
"entropy": 1.23046875,
|
|
"epoch": 1.1493781604482711,
|
|
"grad_norm": 0.13601656562275655,
|
|
"learning_rate": 2.192827955474144e-06,
|
|
"loss": 0.9304,
|
|
"mean_token_accuracy": 0.7663792848587037,
|
|
"num_tokens": 775040095.0,
|
|
"step": 8410
|
|
},
|
|
{
|
|
"entropy": 1.17578125,
|
|
"epoch": 1.150744840781741,
|
|
"grad_norm": 0.11438095591470437,
|
|
"learning_rate": 2.1893053402846275e-06,
|
|
"loss": 0.9222,
|
|
"mean_token_accuracy": 0.7679839253425598,
|
|
"num_tokens": 775963582.0,
|
|
"step": 8420
|
|
},
|
|
{
|
|
"entropy": 1.26796875,
|
|
"epoch": 1.152111521115211,
|
|
"grad_norm": 0.1183956935751037,
|
|
"learning_rate": 2.1857827250951106e-06,
|
|
"loss": 0.9888,
|
|
"mean_token_accuracy": 0.7571158766746521,
|
|
"num_tokens": 776913274.0,
|
|
"step": 8430
|
|
},
|
|
{
|
|
"entropy": 1.23515625,
|
|
"epoch": 1.153478201448681,
|
|
"grad_norm": 0.13255598906016935,
|
|
"learning_rate": 2.182260109905594e-06,
|
|
"loss": 0.9501,
|
|
"mean_token_accuracy": 0.7604475677013397,
|
|
"num_tokens": 777837642.0,
|
|
"step": 8440
|
|
},
|
|
{
|
|
"entropy": 1.20234375,
|
|
"epoch": 1.154844881782151,
|
|
"grad_norm": 0.1374192216712454,
|
|
"learning_rate": 2.1787374947160777e-06,
|
|
"loss": 0.9311,
|
|
"mean_token_accuracy": 0.765647006034851,
|
|
"num_tokens": 778735236.0,
|
|
"step": 8450
|
|
},
|
|
{
|
|
"entropy": 1.1796875,
|
|
"epoch": 1.156211562115621,
|
|
"grad_norm": 0.11524668587366635,
|
|
"learning_rate": 2.175214879526561e-06,
|
|
"loss": 0.9495,
|
|
"mean_token_accuracy": 0.7602663695812225,
|
|
"num_tokens": 779695113.0,
|
|
"step": 8460
|
|
},
|
|
{
|
|
"entropy": 1.2265625,
|
|
"epoch": 1.1575782424490912,
|
|
"grad_norm": 0.12658877912098057,
|
|
"learning_rate": 2.171692264337044e-06,
|
|
"loss": 0.9422,
|
|
"mean_token_accuracy": 0.763300746679306,
|
|
"num_tokens": 780598891.0,
|
|
"step": 8470
|
|
},
|
|
{
|
|
"entropy": 1.21171875,
|
|
"epoch": 1.1589449227825612,
|
|
"grad_norm": 0.11998017653613975,
|
|
"learning_rate": 2.1681696491475275e-06,
|
|
"loss": 0.922,
|
|
"mean_token_accuracy": 0.767149806022644,
|
|
"num_tokens": 781494278.0,
|
|
"step": 8480
|
|
},
|
|
{
|
|
"entropy": 1.2390625,
|
|
"epoch": 1.1603116031160312,
|
|
"grad_norm": 0.1310149001862827,
|
|
"learning_rate": 2.1646470339580106e-06,
|
|
"loss": 0.9327,
|
|
"mean_token_accuracy": 0.7657085299491883,
|
|
"num_tokens": 782471652.0,
|
|
"step": 8490
|
|
},
|
|
{
|
|
"entropy": 1.21171875,
|
|
"epoch": 1.1616782834495012,
|
|
"grad_norm": 0.11974379109398549,
|
|
"learning_rate": 2.1611244187684937e-06,
|
|
"loss": 0.9076,
|
|
"mean_token_accuracy": 0.7712659716606141,
|
|
"num_tokens": 783377485.0,
|
|
"step": 8500
|
|
},
|
|
{
|
|
"entropy": 1.20078125,
|
|
"epoch": 1.1630449637829712,
|
|
"grad_norm": 0.11680255285997689,
|
|
"learning_rate": 2.1576018035789773e-06,
|
|
"loss": 0.9317,
|
|
"mean_token_accuracy": 0.7652956068515777,
|
|
"num_tokens": 784337833.0,
|
|
"step": 8510
|
|
},
|
|
{
|
|
"entropy": 1.1765625,
|
|
"epoch": 1.1644116441164412,
|
|
"grad_norm": 0.14055844965953446,
|
|
"learning_rate": 2.1540791883894604e-06,
|
|
"loss": 0.9371,
|
|
"mean_token_accuracy": 0.7622415900230408,
|
|
"num_tokens": 785204537.0,
|
|
"step": 8520
|
|
},
|
|
{
|
|
"entropy": 1.2328125,
|
|
"epoch": 1.1657783244499111,
|
|
"grad_norm": 0.12469256122235824,
|
|
"learning_rate": 2.150556573199944e-06,
|
|
"loss": 0.9475,
|
|
"mean_token_accuracy": 0.7633870482444763,
|
|
"num_tokens": 786110258.0,
|
|
"step": 8530
|
|
},
|
|
{
|
|
"entropy": 1.20234375,
|
|
"epoch": 1.1671450047833811,
|
|
"grad_norm": 0.11327498764305809,
|
|
"learning_rate": 2.147033958010427e-06,
|
|
"loss": 0.9091,
|
|
"mean_token_accuracy": 0.7701590776443481,
|
|
"num_tokens": 787025727.0,
|
|
"step": 8540
|
|
},
|
|
{
|
|
"entropy": 1.23046875,
|
|
"epoch": 1.168511685116851,
|
|
"grad_norm": 0.1468348896469157,
|
|
"learning_rate": 2.14351134282091e-06,
|
|
"loss": 0.9161,
|
|
"mean_token_accuracy": 0.7692419946193695,
|
|
"num_tokens": 787966153.0,
|
|
"step": 8550
|
|
},
|
|
{
|
|
"entropy": 1.1984375,
|
|
"epoch": 1.169878365450321,
|
|
"grad_norm": 0.1405830838152619,
|
|
"learning_rate": 2.1399887276313937e-06,
|
|
"loss": 0.8686,
|
|
"mean_token_accuracy": 0.777866417169571,
|
|
"num_tokens": 788911753.0,
|
|
"step": 8560
|
|
},
|
|
{
|
|
"entropy": 1.2359375,
|
|
"epoch": 1.1712450457837913,
|
|
"grad_norm": 0.12921277140213866,
|
|
"learning_rate": 2.136466112441877e-06,
|
|
"loss": 0.9681,
|
|
"mean_token_accuracy": 0.7599334716796875,
|
|
"num_tokens": 789851402.0,
|
|
"step": 8570
|
|
},
|
|
{
|
|
"entropy": 1.1984375,
|
|
"epoch": 1.1726117261172613,
|
|
"grad_norm": 0.13264714872662112,
|
|
"learning_rate": 2.1329434972523604e-06,
|
|
"loss": 0.8981,
|
|
"mean_token_accuracy": 0.7706320524215698,
|
|
"num_tokens": 790766294.0,
|
|
"step": 8580
|
|
},
|
|
{
|
|
"entropy": 1.21875,
|
|
"epoch": 1.1739784064507313,
|
|
"grad_norm": 0.1254832717993171,
|
|
"learning_rate": 2.1294208820628435e-06,
|
|
"loss": 0.9344,
|
|
"mean_token_accuracy": 0.7645902633666992,
|
|
"num_tokens": 791663847.0,
|
|
"step": 8590
|
|
},
|
|
{
|
|
"entropy": 1.26640625,
|
|
"epoch": 1.1753450867842012,
|
|
"grad_norm": 0.13661478949926525,
|
|
"learning_rate": 2.125898266873327e-06,
|
|
"loss": 0.9547,
|
|
"mean_token_accuracy": 0.7575432419776916,
|
|
"num_tokens": 792644026.0,
|
|
"step": 8600
|
|
},
|
|
{
|
|
"entropy": 1.2578125,
|
|
"epoch": 1.1767117671176712,
|
|
"grad_norm": 0.11704937497426235,
|
|
"learning_rate": 2.12237565168381e-06,
|
|
"loss": 0.929,
|
|
"mean_token_accuracy": 0.7658152937889099,
|
|
"num_tokens": 793573004.0,
|
|
"step": 8610
|
|
},
|
|
{
|
|
"entropy": 1.23515625,
|
|
"epoch": 1.1780784474511412,
|
|
"grad_norm": 0.12124290627500905,
|
|
"learning_rate": 2.1188530364942938e-06,
|
|
"loss": 0.9755,
|
|
"mean_token_accuracy": 0.7568139612674714,
|
|
"num_tokens": 794498385.0,
|
|
"step": 8620
|
|
},
|
|
{
|
|
"entropy": 1.1671875,
|
|
"epoch": 1.1794451277846112,
|
|
"grad_norm": 0.12327492744372763,
|
|
"learning_rate": 2.115330421304777e-06,
|
|
"loss": 0.924,
|
|
"mean_token_accuracy": 0.7649713933467865,
|
|
"num_tokens": 795410342.0,
|
|
"step": 8630
|
|
},
|
|
{
|
|
"entropy": 1.19921875,
|
|
"epoch": 1.1808118081180812,
|
|
"grad_norm": 0.12080163867156445,
|
|
"learning_rate": 2.1118078061152604e-06,
|
|
"loss": 0.9405,
|
|
"mean_token_accuracy": 0.7637977004051208,
|
|
"num_tokens": 796377123.0,
|
|
"step": 8640
|
|
},
|
|
{
|
|
"entropy": 1.171875,
|
|
"epoch": 1.1821784884515512,
|
|
"grad_norm": 0.1274257349832373,
|
|
"learning_rate": 2.1082851909257435e-06,
|
|
"loss": 0.9178,
|
|
"mean_token_accuracy": 0.7665433824062348,
|
|
"num_tokens": 797310568.0,
|
|
"step": 8650
|
|
},
|
|
{
|
|
"entropy": 1.2078125,
|
|
"epoch": 1.1835451687850211,
|
|
"grad_norm": 0.10490038383140862,
|
|
"learning_rate": 2.1047625757362267e-06,
|
|
"loss": 0.9437,
|
|
"mean_token_accuracy": 0.7622491419315338,
|
|
"num_tokens": 798259517.0,
|
|
"step": 8660
|
|
},
|
|
{
|
|
"entropy": 1.20859375,
|
|
"epoch": 1.1849118491184911,
|
|
"grad_norm": 0.12931086559795757,
|
|
"learning_rate": 2.1012399605467102e-06,
|
|
"loss": 0.9181,
|
|
"mean_token_accuracy": 0.7669582068920135,
|
|
"num_tokens": 799148339.0,
|
|
"step": 8670
|
|
},
|
|
{
|
|
"entropy": 1.24375,
|
|
"epoch": 1.186278529451961,
|
|
"grad_norm": 0.11991894825515236,
|
|
"learning_rate": 2.0977173453571933e-06,
|
|
"loss": 0.9473,
|
|
"mean_token_accuracy": 0.764337807893753,
|
|
"num_tokens": 800030657.0,
|
|
"step": 8680
|
|
},
|
|
{
|
|
"entropy": 1.25390625,
|
|
"epoch": 1.187645209785431,
|
|
"grad_norm": 0.1294719572146895,
|
|
"learning_rate": 2.0941947301676765e-06,
|
|
"loss": 0.9942,
|
|
"mean_token_accuracy": 0.7523476541042328,
|
|
"num_tokens": 800903352.0,
|
|
"step": 8690
|
|
},
|
|
{
|
|
"entropy": 1.18671875,
|
|
"epoch": 1.189011890118901,
|
|
"grad_norm": 0.12092038963646565,
|
|
"learning_rate": 2.09067211497816e-06,
|
|
"loss": 0.9366,
|
|
"mean_token_accuracy": 0.7629974722862244,
|
|
"num_tokens": 801839997.0,
|
|
"step": 8700
|
|
},
|
|
{
|
|
"entropy": 1.2171875,
|
|
"epoch": 1.1903785704523713,
|
|
"grad_norm": 0.1324928515239456,
|
|
"learning_rate": 2.087149499788643e-06,
|
|
"loss": 0.9269,
|
|
"mean_token_accuracy": 0.7627574622631073,
|
|
"num_tokens": 802754802.0,
|
|
"step": 8710
|
|
},
|
|
{
|
|
"entropy": 1.24921875,
|
|
"epoch": 1.1917452507858413,
|
|
"grad_norm": 0.1505209823842029,
|
|
"learning_rate": 2.0836268845991263e-06,
|
|
"loss": 0.9433,
|
|
"mean_token_accuracy": 0.7626750767230988,
|
|
"num_tokens": 803675305.0,
|
|
"step": 8720
|
|
},
|
|
{
|
|
"entropy": 1.21953125,
|
|
"epoch": 1.1931119311193112,
|
|
"grad_norm": 0.13562095671024735,
|
|
"learning_rate": 2.08010426940961e-06,
|
|
"loss": 0.9519,
|
|
"mean_token_accuracy": 0.7620514929294586,
|
|
"num_tokens": 804626080.0,
|
|
"step": 8730
|
|
},
|
|
{
|
|
"entropy": 1.23359375,
|
|
"epoch": 1.1944786114527812,
|
|
"grad_norm": 0.14646009746499414,
|
|
"learning_rate": 2.076581654220093e-06,
|
|
"loss": 0.9637,
|
|
"mean_token_accuracy": 0.75937220454216,
|
|
"num_tokens": 805552114.0,
|
|
"step": 8740
|
|
},
|
|
{
|
|
"entropy": 1.2078125,
|
|
"epoch": 1.1958452917862512,
|
|
"grad_norm": 0.1367536466239867,
|
|
"learning_rate": 2.0730590390305765e-06,
|
|
"loss": 0.9149,
|
|
"mean_token_accuracy": 0.7688004434108734,
|
|
"num_tokens": 806462200.0,
|
|
"step": 8750
|
|
},
|
|
{
|
|
"entropy": 1.2265625,
|
|
"epoch": 1.1972119721197212,
|
|
"grad_norm": 0.14279835476155342,
|
|
"learning_rate": 2.0695364238410596e-06,
|
|
"loss": 0.9453,
|
|
"mean_token_accuracy": 0.7616723358631134,
|
|
"num_tokens": 807437504.0,
|
|
"step": 8760
|
|
},
|
|
{
|
|
"entropy": 1.21640625,
|
|
"epoch": 1.1985786524531912,
|
|
"grad_norm": 0.11723259673377694,
|
|
"learning_rate": 2.066013808651543e-06,
|
|
"loss": 0.922,
|
|
"mean_token_accuracy": 0.765052443742752,
|
|
"num_tokens": 808356776.0,
|
|
"step": 8770
|
|
},
|
|
{
|
|
"entropy": 1.2625,
|
|
"epoch": 1.1999453327866612,
|
|
"grad_norm": 0.14036261243685563,
|
|
"learning_rate": 2.0624911934620263e-06,
|
|
"loss": 0.9684,
|
|
"mean_token_accuracy": 0.76015585064888,
|
|
"num_tokens": 809235508.0,
|
|
"step": 8780
|
|
},
|
|
{
|
|
"entropy": 1.2640625,
|
|
"epoch": 1.2013120131201311,
|
|
"grad_norm": 0.12037241504123157,
|
|
"learning_rate": 2.05896857827251e-06,
|
|
"loss": 0.9982,
|
|
"mean_token_accuracy": 0.7524783372879028,
|
|
"num_tokens": 810205113.0,
|
|
"step": 8790
|
|
},
|
|
{
|
|
"entropy": 1.19921875,
|
|
"epoch": 1.2026786934536011,
|
|
"grad_norm": 0.1252693845881925,
|
|
"learning_rate": 2.055445963082993e-06,
|
|
"loss": 0.9056,
|
|
"mean_token_accuracy": 0.7724756300449371,
|
|
"num_tokens": 811113331.0,
|
|
"step": 8800
|
|
},
|
|
{
|
|
"entropy": 1.1859375,
|
|
"epoch": 1.2040453737870713,
|
|
"grad_norm": 0.14162749796211502,
|
|
"learning_rate": 2.0519233478934765e-06,
|
|
"loss": 0.9121,
|
|
"mean_token_accuracy": 0.7670202076435089,
|
|
"num_tokens": 812063842.0,
|
|
"step": 8810
|
|
},
|
|
{
|
|
"entropy": 1.25234375,
|
|
"epoch": 1.2054120541205413,
|
|
"grad_norm": 0.13605618658049953,
|
|
"learning_rate": 2.0484007327039596e-06,
|
|
"loss": 0.9667,
|
|
"mean_token_accuracy": 0.7570821344852448,
|
|
"num_tokens": 812974009.0,
|
|
"step": 8820
|
|
},
|
|
{
|
|
"entropy": 1.23203125,
|
|
"epoch": 1.2067787344540113,
|
|
"grad_norm": 0.13806664158875026,
|
|
"learning_rate": 2.0448781175144427e-06,
|
|
"loss": 0.9831,
|
|
"mean_token_accuracy": 0.7571740865707397,
|
|
"num_tokens": 813886829.0,
|
|
"step": 8830
|
|
},
|
|
{
|
|
"entropy": 1.2046875,
|
|
"epoch": 1.2081454147874813,
|
|
"grad_norm": 0.1197008538084713,
|
|
"learning_rate": 2.0413555023249263e-06,
|
|
"loss": 0.9441,
|
|
"mean_token_accuracy": 0.7641125559806824,
|
|
"num_tokens": 814818796.0,
|
|
"step": 8840
|
|
},
|
|
{
|
|
"entropy": 1.2265625,
|
|
"epoch": 1.2095120951209513,
|
|
"grad_norm": 0.12771231937359728,
|
|
"learning_rate": 2.0378328871354094e-06,
|
|
"loss": 0.9573,
|
|
"mean_token_accuracy": 0.7604870319366455,
|
|
"num_tokens": 815777038.0,
|
|
"step": 8850
|
|
},
|
|
{
|
|
"entropy": 1.2171875,
|
|
"epoch": 1.2108787754544212,
|
|
"grad_norm": 0.12590137758968573,
|
|
"learning_rate": 2.034310271945893e-06,
|
|
"loss": 0.9266,
|
|
"mean_token_accuracy": 0.7677132844924927,
|
|
"num_tokens": 816742274.0,
|
|
"step": 8860
|
|
},
|
|
{
|
|
"entropy": 1.19453125,
|
|
"epoch": 1.2122454557878912,
|
|
"grad_norm": 0.12796227386831308,
|
|
"learning_rate": 2.030787656756376e-06,
|
|
"loss": 0.9462,
|
|
"mean_token_accuracy": 0.7597826063632965,
|
|
"num_tokens": 817650313.0,
|
|
"step": 8870
|
|
},
|
|
{
|
|
"entropy": 1.1796875,
|
|
"epoch": 1.2136121361213612,
|
|
"grad_norm": 0.1269095650892942,
|
|
"learning_rate": 2.027265041566859e-06,
|
|
"loss": 0.9166,
|
|
"mean_token_accuracy": 0.767738276720047,
|
|
"num_tokens": 818564569.0,
|
|
"step": 8880
|
|
},
|
|
{
|
|
"entropy": 1.2140625,
|
|
"epoch": 1.2149788164548312,
|
|
"grad_norm": 0.12504917973240953,
|
|
"learning_rate": 2.0237424263773427e-06,
|
|
"loss": 0.935,
|
|
"mean_token_accuracy": 0.7645084083080291,
|
|
"num_tokens": 819452714.0,
|
|
"step": 8890
|
|
},
|
|
{
|
|
"entropy": 1.153125,
|
|
"epoch": 1.2163454967883012,
|
|
"grad_norm": 0.11145277954747626,
|
|
"learning_rate": 2.020219811187826e-06,
|
|
"loss": 0.8963,
|
|
"mean_token_accuracy": 0.771187037229538,
|
|
"num_tokens": 820395120.0,
|
|
"step": 8900
|
|
},
|
|
{
|
|
"entropy": 1.24296875,
|
|
"epoch": 1.2177121771217712,
|
|
"grad_norm": 0.12913916054494318,
|
|
"learning_rate": 2.0166971959983094e-06,
|
|
"loss": 0.9633,
|
|
"mean_token_accuracy": 0.7575461387634277,
|
|
"num_tokens": 821331637.0,
|
|
"step": 8910
|
|
},
|
|
{
|
|
"entropy": 1.1828125,
|
|
"epoch": 1.2190788574552411,
|
|
"grad_norm": 0.12665210466620488,
|
|
"learning_rate": 2.0131745808087925e-06,
|
|
"loss": 0.9137,
|
|
"mean_token_accuracy": 0.7680684387683868,
|
|
"num_tokens": 822262363.0,
|
|
"step": 8920
|
|
},
|
|
{
|
|
"entropy": 1.2140625,
|
|
"epoch": 1.2204455377887111,
|
|
"grad_norm": 0.13476392747578472,
|
|
"learning_rate": 2.009651965619276e-06,
|
|
"loss": 0.9144,
|
|
"mean_token_accuracy": 0.7663161396980286,
|
|
"num_tokens": 823185730.0,
|
|
"step": 8930
|
|
},
|
|
{
|
|
"entropy": 1.246875,
|
|
"epoch": 1.221812218122181,
|
|
"grad_norm": 0.13207570646120684,
|
|
"learning_rate": 2.0061293504297592e-06,
|
|
"loss": 0.9566,
|
|
"mean_token_accuracy": 0.7596031129360199,
|
|
"num_tokens": 824130635.0,
|
|
"step": 8940
|
|
},
|
|
{
|
|
"entropy": 1.18671875,
|
|
"epoch": 1.2231788984556513,
|
|
"grad_norm": 0.1286772827381005,
|
|
"learning_rate": 2.0026067352402428e-06,
|
|
"loss": 0.8976,
|
|
"mean_token_accuracy": 0.7708956301212311,
|
|
"num_tokens": 825059981.0,
|
|
"step": 8950
|
|
},
|
|
{
|
|
"entropy": 1.253125,
|
|
"epoch": 1.2245455787891213,
|
|
"grad_norm": 0.11954756059914654,
|
|
"learning_rate": 1.999084120050726e-06,
|
|
"loss": 0.9764,
|
|
"mean_token_accuracy": 0.756880933046341,
|
|
"num_tokens": 825984443.0,
|
|
"step": 8960
|
|
},
|
|
{
|
|
"entropy": 1.18671875,
|
|
"epoch": 1.2259122591225913,
|
|
"grad_norm": 0.11936029889846467,
|
|
"learning_rate": 1.9955615048612094e-06,
|
|
"loss": 0.9161,
|
|
"mean_token_accuracy": 0.7672152936458587,
|
|
"num_tokens": 826900181.0,
|
|
"step": 8970
|
|
},
|
|
{
|
|
"entropy": 1.23203125,
|
|
"epoch": 1.2272789394560613,
|
|
"grad_norm": 0.13533029126196394,
|
|
"learning_rate": 1.9920388896716926e-06,
|
|
"loss": 0.9078,
|
|
"mean_token_accuracy": 0.7710486888885498,
|
|
"num_tokens": 827834339.0,
|
|
"step": 8980
|
|
},
|
|
{
|
|
"entropy": 1.23828125,
|
|
"epoch": 1.2286456197895312,
|
|
"grad_norm": 0.11480981711318869,
|
|
"learning_rate": 1.9885162744821757e-06,
|
|
"loss": 0.9127,
|
|
"mean_token_accuracy": 0.7717219829559326,
|
|
"num_tokens": 828755267.0,
|
|
"step": 8990
|
|
},
|
|
{
|
|
"entropy": 1.21171875,
|
|
"epoch": 1.2300123001230012,
|
|
"grad_norm": 0.1314927185300293,
|
|
"learning_rate": 1.9849936592926592e-06,
|
|
"loss": 0.9395,
|
|
"mean_token_accuracy": 0.7624621152877807,
|
|
"num_tokens": 829615451.0,
|
|
"step": 9000
|
|
},
|
|
{
|
|
"entropy": 1.208984375,
|
|
"epoch": 1.2313789804564712,
|
|
"grad_norm": 0.12897274365473171,
|
|
"learning_rate": 1.9814710441031424e-06,
|
|
"loss": 0.8954,
|
|
"mean_token_accuracy": 0.7711239993572235,
|
|
"num_tokens": 830524527.0,
|
|
"step": 9010
|
|
},
|
|
{
|
|
"entropy": 1.1859375,
|
|
"epoch": 1.2327456607899412,
|
|
"grad_norm": 0.1331352046626591,
|
|
"learning_rate": 1.9779484289136255e-06,
|
|
"loss": 0.9057,
|
|
"mean_token_accuracy": 0.7697903394699097,
|
|
"num_tokens": 831423667.0,
|
|
"step": 9020
|
|
},
|
|
{
|
|
"entropy": 1.2390625,
|
|
"epoch": 1.2341123411234112,
|
|
"grad_norm": 0.12395703282797009,
|
|
"learning_rate": 1.974425813724109e-06,
|
|
"loss": 0.9331,
|
|
"mean_token_accuracy": 0.7664977252483368,
|
|
"num_tokens": 832352867.0,
|
|
"step": 9030
|
|
},
|
|
{
|
|
"entropy": 1.20390625,
|
|
"epoch": 1.2354790214568812,
|
|
"grad_norm": 0.1438286241257898,
|
|
"learning_rate": 1.970903198534592e-06,
|
|
"loss": 0.9184,
|
|
"mean_token_accuracy": 0.7669995546340942,
|
|
"num_tokens": 833293798.0,
|
|
"step": 9040
|
|
},
|
|
{
|
|
"entropy": 1.23046875,
|
|
"epoch": 1.2368457017903514,
|
|
"grad_norm": 0.1474475636172312,
|
|
"learning_rate": 1.9673805833450753e-06,
|
|
"loss": 0.9518,
|
|
"mean_token_accuracy": 0.7602386832237243,
|
|
"num_tokens": 834230235.0,
|
|
"step": 9050
|
|
},
|
|
{
|
|
"entropy": 1.24140625,
|
|
"epoch": 1.2382123821238213,
|
|
"grad_norm": 0.11178326595310405,
|
|
"learning_rate": 1.963857968155559e-06,
|
|
"loss": 0.9315,
|
|
"mean_token_accuracy": 0.7646872818470001,
|
|
"num_tokens": 835171316.0,
|
|
"step": 9060
|
|
},
|
|
{
|
|
"entropy": 1.18828125,
|
|
"epoch": 1.2395790624572913,
|
|
"grad_norm": 0.14536798179584612,
|
|
"learning_rate": 1.960335352966042e-06,
|
|
"loss": 0.9252,
|
|
"mean_token_accuracy": 0.7676630735397338,
|
|
"num_tokens": 836094206.0,
|
|
"step": 9070
|
|
},
|
|
{
|
|
"entropy": 1.2328125,
|
|
"epoch": 1.2409457427907613,
|
|
"grad_norm": 0.12271397813666006,
|
|
"learning_rate": 1.9568127377765255e-06,
|
|
"loss": 0.965,
|
|
"mean_token_accuracy": 0.7576962649822235,
|
|
"num_tokens": 837040128.0,
|
|
"step": 9080
|
|
},
|
|
{
|
|
"entropy": 1.18671875,
|
|
"epoch": 1.2423124231242313,
|
|
"grad_norm": 0.12209509144126685,
|
|
"learning_rate": 1.9532901225870086e-06,
|
|
"loss": 0.9157,
|
|
"mean_token_accuracy": 0.7686978816986084,
|
|
"num_tokens": 838015487.0,
|
|
"step": 9090
|
|
},
|
|
{
|
|
"entropy": 1.19765625,
|
|
"epoch": 1.2436791034577013,
|
|
"grad_norm": 0.12439088995258772,
|
|
"learning_rate": 1.949767507397492e-06,
|
|
"loss": 0.9222,
|
|
"mean_token_accuracy": 0.7656805276870727,
|
|
"num_tokens": 838908651.0,
|
|
"step": 9100
|
|
},
|
|
{
|
|
"entropy": 1.23359375,
|
|
"epoch": 1.2450457837911713,
|
|
"grad_norm": 0.1362483079482717,
|
|
"learning_rate": 1.9462448922079753e-06,
|
|
"loss": 0.9444,
|
|
"mean_token_accuracy": 0.7610013604164123,
|
|
"num_tokens": 839819407.0,
|
|
"step": 9110
|
|
},
|
|
{
|
|
"entropy": 1.215625,
|
|
"epoch": 1.2464124641246412,
|
|
"grad_norm": 0.12720925921308207,
|
|
"learning_rate": 1.942722277018459e-06,
|
|
"loss": 0.9433,
|
|
"mean_token_accuracy": 0.7627991378307343,
|
|
"num_tokens": 840716632.0,
|
|
"step": 9120
|
|
},
|
|
{
|
|
"entropy": 1.24375,
|
|
"epoch": 1.2477791444581112,
|
|
"grad_norm": 0.13175508585355641,
|
|
"learning_rate": 1.939199661828942e-06,
|
|
"loss": 0.9661,
|
|
"mean_token_accuracy": 0.7564938247203827,
|
|
"num_tokens": 841628747.0,
|
|
"step": 9130
|
|
},
|
|
{
|
|
"entropy": 1.1875,
|
|
"epoch": 1.2491458247915812,
|
|
"grad_norm": 0.13551411645774467,
|
|
"learning_rate": 1.9356770466394255e-06,
|
|
"loss": 0.8979,
|
|
"mean_token_accuracy": 0.7729579925537109,
|
|
"num_tokens": 842477808.0,
|
|
"step": 9140
|
|
},
|
|
{
|
|
"entropy": 1.18125,
|
|
"epoch": 1.2505125051250512,
|
|
"grad_norm": 0.13209352289977205,
|
|
"learning_rate": 1.9321544314499086e-06,
|
|
"loss": 0.9517,
|
|
"mean_token_accuracy": 0.7610730648040771,
|
|
"num_tokens": 843389427.0,
|
|
"step": 9150
|
|
},
|
|
{
|
|
"entropy": 1.203125,
|
|
"epoch": 1.2518791854585212,
|
|
"grad_norm": 0.13671909386072495,
|
|
"learning_rate": 1.9286318162603917e-06,
|
|
"loss": 0.931,
|
|
"mean_token_accuracy": 0.7629381597042084,
|
|
"num_tokens": 844326133.0,
|
|
"step": 9160
|
|
},
|
|
{
|
|
"entropy": 1.1828125,
|
|
"epoch": 1.2532458657919912,
|
|
"grad_norm": 0.12009024876279198,
|
|
"learning_rate": 1.9251092010708753e-06,
|
|
"loss": 0.8966,
|
|
"mean_token_accuracy": 0.7744389474391937,
|
|
"num_tokens": 845242173.0,
|
|
"step": 9170
|
|
},
|
|
{
|
|
"entropy": 1.240625,
|
|
"epoch": 1.2546125461254611,
|
|
"grad_norm": 0.1262432837389581,
|
|
"learning_rate": 1.9215865858813584e-06,
|
|
"loss": 0.9418,
|
|
"mean_token_accuracy": 0.7630301356315613,
|
|
"num_tokens": 846159471.0,
|
|
"step": 9180
|
|
},
|
|
{
|
|
"entropy": 1.2359375,
|
|
"epoch": 1.2559792264589311,
|
|
"grad_norm": 0.11930992160642083,
|
|
"learning_rate": 1.918063970691842e-06,
|
|
"loss": 0.9551,
|
|
"mean_token_accuracy": 0.7592744827270508,
|
|
"num_tokens": 847086459.0,
|
|
"step": 9190
|
|
},
|
|
{
|
|
"entropy": 1.23515625,
|
|
"epoch": 1.2573459067924013,
|
|
"grad_norm": 0.131869623942485,
|
|
"learning_rate": 1.914541355502325e-06,
|
|
"loss": 0.9251,
|
|
"mean_token_accuracy": 0.7636242747306824,
|
|
"num_tokens": 847965115.0,
|
|
"step": 9200
|
|
},
|
|
{
|
|
"entropy": 1.19765625,
|
|
"epoch": 1.2587125871258713,
|
|
"grad_norm": 0.20784716981720608,
|
|
"learning_rate": 1.9110187403128082e-06,
|
|
"loss": 0.9125,
|
|
"mean_token_accuracy": 0.7657358467578887,
|
|
"num_tokens": 848874699.0,
|
|
"step": 9210
|
|
},
|
|
{
|
|
"entropy": 1.21640625,
|
|
"epoch": 1.2600792674593413,
|
|
"grad_norm": 0.12507536306987946,
|
|
"learning_rate": 1.9074961251232918e-06,
|
|
"loss": 0.9463,
|
|
"mean_token_accuracy": 0.764547872543335,
|
|
"num_tokens": 849836872.0,
|
|
"step": 9220
|
|
},
|
|
{
|
|
"entropy": 1.203125,
|
|
"epoch": 1.2614459477928113,
|
|
"grad_norm": 0.13178056192115964,
|
|
"learning_rate": 1.903973509933775e-06,
|
|
"loss": 0.9058,
|
|
"mean_token_accuracy": 0.7672463476657867,
|
|
"num_tokens": 850740853.0,
|
|
"step": 9230
|
|
},
|
|
{
|
|
"entropy": 1.26171875,
|
|
"epoch": 1.2628126281262813,
|
|
"grad_norm": 0.13501554931091161,
|
|
"learning_rate": 1.9004508947442582e-06,
|
|
"loss": 0.9645,
|
|
"mean_token_accuracy": 0.7591032266616822,
|
|
"num_tokens": 851633495.0,
|
|
"step": 9240
|
|
},
|
|
{
|
|
"entropy": 1.17578125,
|
|
"epoch": 1.2641793084597512,
|
|
"grad_norm": 0.15456966102644704,
|
|
"learning_rate": 1.8969282795547418e-06,
|
|
"loss": 0.8982,
|
|
"mean_token_accuracy": 0.7712715625762939,
|
|
"num_tokens": 852532177.0,
|
|
"step": 9250
|
|
},
|
|
{
|
|
"entropy": 1.225,
|
|
"epoch": 1.2655459887932212,
|
|
"grad_norm": 0.1135198919734195,
|
|
"learning_rate": 1.8934056643652249e-06,
|
|
"loss": 0.9168,
|
|
"mean_token_accuracy": 0.7662114918231964,
|
|
"num_tokens": 853442859.0,
|
|
"step": 9260
|
|
},
|
|
{
|
|
"entropy": 1.2015625,
|
|
"epoch": 1.2669126691266912,
|
|
"grad_norm": 0.11568110497306362,
|
|
"learning_rate": 1.889883049175708e-06,
|
|
"loss": 0.9146,
|
|
"mean_token_accuracy": 0.7687154471874237,
|
|
"num_tokens": 854344107.0,
|
|
"step": 9270
|
|
},
|
|
{
|
|
"entropy": 1.175,
|
|
"epoch": 1.2682793494601612,
|
|
"grad_norm": 0.1199353844102223,
|
|
"learning_rate": 1.8863604339861916e-06,
|
|
"loss": 0.9203,
|
|
"mean_token_accuracy": 0.7646028518676757,
|
|
"num_tokens": 855262838.0,
|
|
"step": 9280
|
|
},
|
|
{
|
|
"entropy": 1.2265625,
|
|
"epoch": 1.2696460297936314,
|
|
"grad_norm": 0.1325609065123402,
|
|
"learning_rate": 1.8828378187966747e-06,
|
|
"loss": 0.9733,
|
|
"mean_token_accuracy": 0.7585480272769928,
|
|
"num_tokens": 856200075.0,
|
|
"step": 9290
|
|
},
|
|
{
|
|
"entropy": 1.2,
|
|
"epoch": 1.2710127101271014,
|
|
"grad_norm": 0.12961709448514838,
|
|
"learning_rate": 1.8793152036071582e-06,
|
|
"loss": 0.9278,
|
|
"mean_token_accuracy": 0.7657257556915283,
|
|
"num_tokens": 857113863.0,
|
|
"step": 9300
|
|
},
|
|
{
|
|
"entropy": 1.1875,
|
|
"epoch": 1.2723793904605714,
|
|
"grad_norm": 0.1205354396915979,
|
|
"learning_rate": 1.8757925884176414e-06,
|
|
"loss": 0.9399,
|
|
"mean_token_accuracy": 0.7624318182468415,
|
|
"num_tokens": 858051807.0,
|
|
"step": 9310
|
|
},
|
|
{
|
|
"entropy": 1.2421875,
|
|
"epoch": 1.2737460707940413,
|
|
"grad_norm": 0.1387635384501934,
|
|
"learning_rate": 1.8722699732281247e-06,
|
|
"loss": 0.9739,
|
|
"mean_token_accuracy": 0.7540450155735016,
|
|
"num_tokens": 859041307.0,
|
|
"step": 9320
|
|
},
|
|
{
|
|
"entropy": 1.24765625,
|
|
"epoch": 1.2751127511275113,
|
|
"grad_norm": 0.1252238908704557,
|
|
"learning_rate": 1.868747358038608e-06,
|
|
"loss": 0.9636,
|
|
"mean_token_accuracy": 0.7594043731689453,
|
|
"num_tokens": 859948415.0,
|
|
"step": 9330
|
|
},
|
|
{
|
|
"entropy": 1.1796875,
|
|
"epoch": 1.2764794314609813,
|
|
"grad_norm": 0.12996105446517522,
|
|
"learning_rate": 1.8652247428490914e-06,
|
|
"loss": 0.9368,
|
|
"mean_token_accuracy": 0.7653676986694335,
|
|
"num_tokens": 860865275.0,
|
|
"step": 9340
|
|
},
|
|
{
|
|
"entropy": 1.2421875,
|
|
"epoch": 1.2778461117944513,
|
|
"grad_norm": 0.14110715201888557,
|
|
"learning_rate": 1.8617021276595745e-06,
|
|
"loss": 0.9683,
|
|
"mean_token_accuracy": 0.7584783494472503,
|
|
"num_tokens": 861771377.0,
|
|
"step": 9350
|
|
},
|
|
{
|
|
"entropy": 1.225,
|
|
"epoch": 1.2792127921279213,
|
|
"grad_norm": 0.13175458829426673,
|
|
"learning_rate": 1.858179512470058e-06,
|
|
"loss": 0.9258,
|
|
"mean_token_accuracy": 0.7685073614120483,
|
|
"num_tokens": 862681652.0,
|
|
"step": 9360
|
|
},
|
|
{
|
|
"entropy": 1.20078125,
|
|
"epoch": 1.2805794724613913,
|
|
"grad_norm": 0.1241524564309516,
|
|
"learning_rate": 1.8546568972805412e-06,
|
|
"loss": 0.9451,
|
|
"mean_token_accuracy": 0.7636925518512726,
|
|
"num_tokens": 863660677.0,
|
|
"step": 9370
|
|
},
|
|
{
|
|
"entropy": 1.18515625,
|
|
"epoch": 1.2819461527948612,
|
|
"grad_norm": 0.15113650255880207,
|
|
"learning_rate": 1.8511342820910245e-06,
|
|
"loss": 0.9037,
|
|
"mean_token_accuracy": 0.7691202938556672,
|
|
"num_tokens": 864575910.0,
|
|
"step": 9380
|
|
},
|
|
{
|
|
"entropy": 1.18203125,
|
|
"epoch": 1.2833128331283312,
|
|
"grad_norm": 0.12137095559547048,
|
|
"learning_rate": 1.8476116669015078e-06,
|
|
"loss": 0.8877,
|
|
"mean_token_accuracy": 0.7738092482089997,
|
|
"num_tokens": 865515416.0,
|
|
"step": 9390
|
|
},
|
|
{
|
|
"entropy": 1.18125,
|
|
"epoch": 1.2846795134618012,
|
|
"grad_norm": 0.13010650418587597,
|
|
"learning_rate": 1.8440890517119912e-06,
|
|
"loss": 0.8844,
|
|
"mean_token_accuracy": 0.773496025800705,
|
|
"num_tokens": 866447102.0,
|
|
"step": 9400
|
|
},
|
|
{
|
|
"entropy": 1.21171875,
|
|
"epoch": 1.2860461937952712,
|
|
"grad_norm": 0.13072168145504315,
|
|
"learning_rate": 1.8405664365224743e-06,
|
|
"loss": 0.9273,
|
|
"mean_token_accuracy": 0.7664291143417359,
|
|
"num_tokens": 867334361.0,
|
|
"step": 9410
|
|
},
|
|
{
|
|
"entropy": 1.26953125,
|
|
"epoch": 1.2874128741287412,
|
|
"grad_norm": 0.1313795706111341,
|
|
"learning_rate": 1.8370438213329578e-06,
|
|
"loss": 0.96,
|
|
"mean_token_accuracy": 0.7590711414813995,
|
|
"num_tokens": 868306198.0,
|
|
"step": 9420
|
|
},
|
|
{
|
|
"entropy": 1.22421875,
|
|
"epoch": 1.2887795544622112,
|
|
"grad_norm": 0.11973601062047157,
|
|
"learning_rate": 1.833521206143441e-06,
|
|
"loss": 0.9222,
|
|
"mean_token_accuracy": 0.7684303820133209,
|
|
"num_tokens": 869231963.0,
|
|
"step": 9430
|
|
},
|
|
{
|
|
"entropy": 1.2640625,
|
|
"epoch": 1.2901462347956814,
|
|
"grad_norm": 0.12899306784554787,
|
|
"learning_rate": 1.8299985909539245e-06,
|
|
"loss": 0.9576,
|
|
"mean_token_accuracy": 0.759416264295578,
|
|
"num_tokens": 870118000.0,
|
|
"step": 9440
|
|
},
|
|
{
|
|
"entropy": 1.240625,
|
|
"epoch": 1.2915129151291513,
|
|
"grad_norm": 0.13372129171116628,
|
|
"learning_rate": 1.8264759757644076e-06,
|
|
"loss": 0.9159,
|
|
"mean_token_accuracy": 0.7679079532623291,
|
|
"num_tokens": 871032920.0,
|
|
"step": 9450
|
|
},
|
|
{
|
|
"entropy": 1.19609375,
|
|
"epoch": 1.2928795954626213,
|
|
"grad_norm": 0.1339451498781512,
|
|
"learning_rate": 1.822953360574891e-06,
|
|
"loss": 0.9348,
|
|
"mean_token_accuracy": 0.7662735879421234,
|
|
"num_tokens": 871910994.0,
|
|
"step": 9460
|
|
},
|
|
{
|
|
"entropy": 1.17890625,
|
|
"epoch": 1.2942462757960913,
|
|
"grad_norm": 0.12247878386572524,
|
|
"learning_rate": 1.8194307453853743e-06,
|
|
"loss": 0.8948,
|
|
"mean_token_accuracy": 0.7722495198249817,
|
|
"num_tokens": 872819239.0,
|
|
"step": 9470
|
|
},
|
|
{
|
|
"entropy": 1.24765625,
|
|
"epoch": 1.2956129561295613,
|
|
"grad_norm": 0.12469196042849773,
|
|
"learning_rate": 1.8159081301958576e-06,
|
|
"loss": 0.9245,
|
|
"mean_token_accuracy": 0.7672875225543976,
|
|
"num_tokens": 873762298.0,
|
|
"step": 9480
|
|
},
|
|
{
|
|
"entropy": 1.215625,
|
|
"epoch": 1.2969796364630313,
|
|
"grad_norm": 0.11485548281530561,
|
|
"learning_rate": 1.8123855150063408e-06,
|
|
"loss": 0.9403,
|
|
"mean_token_accuracy": 0.7652976334095001,
|
|
"num_tokens": 874698488.0,
|
|
"step": 9490
|
|
},
|
|
{
|
|
"entropy": 1.21640625,
|
|
"epoch": 1.2983463167965013,
|
|
"grad_norm": 0.11785738335520338,
|
|
"learning_rate": 1.8088628998168243e-06,
|
|
"loss": 0.9149,
|
|
"mean_token_accuracy": 0.7686229586601258,
|
|
"num_tokens": 875593896.0,
|
|
"step": 9500
|
|
},
|
|
{
|
|
"entropy": 1.17890625,
|
|
"epoch": 1.2997129971299712,
|
|
"grad_norm": 0.14061205315744155,
|
|
"learning_rate": 1.8053402846273074e-06,
|
|
"loss": 0.9008,
|
|
"mean_token_accuracy": 0.7712561547756195,
|
|
"num_tokens": 876502712.0,
|
|
"step": 9510
|
|
},
|
|
{
|
|
"entropy": 1.14453125,
|
|
"epoch": 1.3010796774634412,
|
|
"grad_norm": 0.3312486393649912,
|
|
"learning_rate": 1.8018176694377906e-06,
|
|
"loss": 0.8753,
|
|
"mean_token_accuracy": 0.7760019540786743,
|
|
"num_tokens": 877406242.0,
|
|
"step": 9520
|
|
},
|
|
{
|
|
"entropy": 1.21953125,
|
|
"epoch": 1.3024463577969114,
|
|
"grad_norm": 0.12509974704467794,
|
|
"learning_rate": 1.798295054248274e-06,
|
|
"loss": 0.9424,
|
|
"mean_token_accuracy": 0.7633995056152344,
|
|
"num_tokens": 878297818.0,
|
|
"step": 9530
|
|
},
|
|
{
|
|
"entropy": 1.1984375,
|
|
"epoch": 1.3038130381303814,
|
|
"grad_norm": 0.13569112637718625,
|
|
"learning_rate": 1.7947724390587572e-06,
|
|
"loss": 0.9147,
|
|
"mean_token_accuracy": 0.7666419208049774,
|
|
"num_tokens": 879197968.0,
|
|
"step": 9540
|
|
},
|
|
{
|
|
"entropy": 1.21484375,
|
|
"epoch": 1.3051797184638514,
|
|
"grad_norm": 0.1354286593142458,
|
|
"learning_rate": 1.7912498238692408e-06,
|
|
"loss": 0.9514,
|
|
"mean_token_accuracy": 0.7605961501598358,
|
|
"num_tokens": 880144165.0,
|
|
"step": 9550
|
|
},
|
|
{
|
|
"entropy": 1.1875,
|
|
"epoch": 1.3065463987973214,
|
|
"grad_norm": 0.12001756482839694,
|
|
"learning_rate": 1.7877272086797239e-06,
|
|
"loss": 0.9322,
|
|
"mean_token_accuracy": 0.7657955169677735,
|
|
"num_tokens": 881067277.0,
|
|
"step": 9560
|
|
},
|
|
{
|
|
"entropy": 1.24140625,
|
|
"epoch": 1.3079130791307914,
|
|
"grad_norm": 0.11583585806149957,
|
|
"learning_rate": 1.7842045934902072e-06,
|
|
"loss": 0.9348,
|
|
"mean_token_accuracy": 0.7638127267360687,
|
|
"num_tokens": 882005499.0,
|
|
"step": 9570
|
|
},
|
|
{
|
|
"entropy": 1.2125,
|
|
"epoch": 1.3092797594642613,
|
|
"grad_norm": 0.12769910980864593,
|
|
"learning_rate": 1.7806819783006908e-06,
|
|
"loss": 0.9722,
|
|
"mean_token_accuracy": 0.7571686625480651,
|
|
"num_tokens": 882921824.0,
|
|
"step": 9580
|
|
},
|
|
{
|
|
"entropy": 1.18203125,
|
|
"epoch": 1.3106464397977313,
|
|
"grad_norm": 0.12157356719164782,
|
|
"learning_rate": 1.777159363111174e-06,
|
|
"loss": 0.9329,
|
|
"mean_token_accuracy": 0.7651493906974792,
|
|
"num_tokens": 883846035.0,
|
|
"step": 9590
|
|
},
|
|
{
|
|
"entropy": 1.20390625,
|
|
"epoch": 1.3120131201312013,
|
|
"grad_norm": 0.11056257156384952,
|
|
"learning_rate": 1.773636747921657e-06,
|
|
"loss": 0.9133,
|
|
"mean_token_accuracy": 0.7677805721759796,
|
|
"num_tokens": 884719258.0,
|
|
"step": 9600
|
|
},
|
|
{
|
|
"entropy": 1.21328125,
|
|
"epoch": 1.3133798004646713,
|
|
"grad_norm": 0.12692160528493646,
|
|
"learning_rate": 1.7701141327321406e-06,
|
|
"loss": 0.9346,
|
|
"mean_token_accuracy": 0.7636367976665497,
|
|
"num_tokens": 885675336.0,
|
|
"step": 9610
|
|
},
|
|
{
|
|
"entropy": 1.23671875,
|
|
"epoch": 1.3147464807981413,
|
|
"grad_norm": 0.11205785787411737,
|
|
"learning_rate": 1.7665915175426237e-06,
|
|
"loss": 0.9202,
|
|
"mean_token_accuracy": 0.768402922153473,
|
|
"num_tokens": 886645805.0,
|
|
"step": 9620
|
|
},
|
|
{
|
|
"entropy": 1.2,
|
|
"epoch": 1.3161131611316113,
|
|
"grad_norm": 0.1304509342838728,
|
|
"learning_rate": 1.763068902353107e-06,
|
|
"loss": 0.9167,
|
|
"mean_token_accuracy": 0.7659415602684021,
|
|
"num_tokens": 887541444.0,
|
|
"step": 9630
|
|
},
|
|
{
|
|
"entropy": 1.240625,
|
|
"epoch": 1.3174798414650812,
|
|
"grad_norm": 0.13495038232903192,
|
|
"learning_rate": 1.7595462871635904e-06,
|
|
"loss": 0.9891,
|
|
"mean_token_accuracy": 0.7529180228710175,
|
|
"num_tokens": 888431199.0,
|
|
"step": 9640
|
|
},
|
|
{
|
|
"entropy": 1.18671875,
|
|
"epoch": 1.3188465217985512,
|
|
"grad_norm": 0.15126636306646257,
|
|
"learning_rate": 1.7560236719740737e-06,
|
|
"loss": 0.8961,
|
|
"mean_token_accuracy": 0.770888376235962,
|
|
"num_tokens": 889364908.0,
|
|
"step": 9650
|
|
},
|
|
{
|
|
"entropy": 1.21015625,
|
|
"epoch": 1.3202132021320212,
|
|
"grad_norm": 0.11790455036373348,
|
|
"learning_rate": 1.752501056784557e-06,
|
|
"loss": 0.911,
|
|
"mean_token_accuracy": 0.7720226883888245,
|
|
"num_tokens": 890313125.0,
|
|
"step": 9660
|
|
},
|
|
{
|
|
"entropy": 1.209375,
|
|
"epoch": 1.3215798824654912,
|
|
"grad_norm": 0.12489435637040268,
|
|
"learning_rate": 1.7489784415950404e-06,
|
|
"loss": 0.8933,
|
|
"mean_token_accuracy": 0.7716591119766235,
|
|
"num_tokens": 891198196.0,
|
|
"step": 9670
|
|
},
|
|
{
|
|
"entropy": 1.184375,
|
|
"epoch": 1.3229465627989614,
|
|
"grad_norm": 0.11874109423628446,
|
|
"learning_rate": 1.7454558264055235e-06,
|
|
"loss": 0.9416,
|
|
"mean_token_accuracy": 0.7610634863376617,
|
|
"num_tokens": 892094044.0,
|
|
"step": 9680
|
|
},
|
|
{
|
|
"entropy": 1.2015625,
|
|
"epoch": 1.3243132431324314,
|
|
"grad_norm": 0.13082418207655228,
|
|
"learning_rate": 1.741933211216007e-06,
|
|
"loss": 0.9032,
|
|
"mean_token_accuracy": 0.7719158351421356,
|
|
"num_tokens": 892984168.0,
|
|
"step": 9690
|
|
},
|
|
{
|
|
"entropy": 1.23359375,
|
|
"epoch": 1.3256799234659014,
|
|
"grad_norm": 0.14502221241269111,
|
|
"learning_rate": 1.7384105960264902e-06,
|
|
"loss": 0.9437,
|
|
"mean_token_accuracy": 0.7644664525985718,
|
|
"num_tokens": 893912834.0,
|
|
"step": 9700
|
|
},
|
|
{
|
|
"entropy": 1.26328125,
|
|
"epoch": 1.3270466037993713,
|
|
"grad_norm": 0.13771268779072124,
|
|
"learning_rate": 1.7348879808369735e-06,
|
|
"loss": 0.9856,
|
|
"mean_token_accuracy": 0.7527810275554657,
|
|
"num_tokens": 894862912.0,
|
|
"step": 9710
|
|
},
|
|
{
|
|
"entropy": 1.18984375,
|
|
"epoch": 1.3284132841328413,
|
|
"grad_norm": 0.12278954682055969,
|
|
"learning_rate": 1.7313653656474568e-06,
|
|
"loss": 0.9537,
|
|
"mean_token_accuracy": 0.7607830584049224,
|
|
"num_tokens": 895810211.0,
|
|
"step": 9720
|
|
},
|
|
{
|
|
"entropy": 1.234375,
|
|
"epoch": 1.3297799644663113,
|
|
"grad_norm": 0.1260983832077437,
|
|
"learning_rate": 1.7278427504579402e-06,
|
|
"loss": 0.9815,
|
|
"mean_token_accuracy": 0.7579868733882904,
|
|
"num_tokens": 896767345.0,
|
|
"step": 9730
|
|
},
|
|
{
|
|
"entropy": 1.24296875,
|
|
"epoch": 1.3311466447997813,
|
|
"grad_norm": 0.1227633402935549,
|
|
"learning_rate": 1.7243201352684233e-06,
|
|
"loss": 0.9515,
|
|
"mean_token_accuracy": 0.7613280057907105,
|
|
"num_tokens": 897730037.0,
|
|
"step": 9740
|
|
},
|
|
{
|
|
"entropy": 1.2328125,
|
|
"epoch": 1.3325133251332513,
|
|
"grad_norm": 0.13028344220692034,
|
|
"learning_rate": 1.7207975200789068e-06,
|
|
"loss": 0.972,
|
|
"mean_token_accuracy": 0.7578902125358582,
|
|
"num_tokens": 898654053.0,
|
|
"step": 9750
|
|
},
|
|
{
|
|
"entropy": 1.20625,
|
|
"epoch": 1.3338800054667213,
|
|
"grad_norm": 0.13277929924718693,
|
|
"learning_rate": 1.71727490488939e-06,
|
|
"loss": 0.9352,
|
|
"mean_token_accuracy": 0.7637438356876374,
|
|
"num_tokens": 899526007.0,
|
|
"step": 9760
|
|
},
|
|
{
|
|
"entropy": 1.20703125,
|
|
"epoch": 1.3352466858001915,
|
|
"grad_norm": 0.12801525598994476,
|
|
"learning_rate": 1.7137522896998735e-06,
|
|
"loss": 0.9179,
|
|
"mean_token_accuracy": 0.7669204473495483,
|
|
"num_tokens": 900457138.0,
|
|
"step": 9770
|
|
},
|
|
{
|
|
"entropy": 1.18203125,
|
|
"epoch": 1.3366133661336614,
|
|
"grad_norm": 0.12319269915527097,
|
|
"learning_rate": 1.7102296745103566e-06,
|
|
"loss": 0.9052,
|
|
"mean_token_accuracy": 0.771210926771164,
|
|
"num_tokens": 901342348.0,
|
|
"step": 9780
|
|
},
|
|
{
|
|
"entropy": 1.22109375,
|
|
"epoch": 1.3379800464671314,
|
|
"grad_norm": 0.14103985360317947,
|
|
"learning_rate": 1.7067070593208398e-06,
|
|
"loss": 0.9433,
|
|
"mean_token_accuracy": 0.7629889905452728,
|
|
"num_tokens": 902289247.0,
|
|
"step": 9790
|
|
},
|
|
{
|
|
"entropy": 1.20390625,
|
|
"epoch": 1.3393467268006014,
|
|
"grad_norm": 0.1251756951964902,
|
|
"learning_rate": 1.7031844441313233e-06,
|
|
"loss": 0.8974,
|
|
"mean_token_accuracy": 0.7725697696208954,
|
|
"num_tokens": 903216964.0,
|
|
"step": 9800
|
|
},
|
|
{
|
|
"entropy": 1.196875,
|
|
"epoch": 1.3407134071340714,
|
|
"grad_norm": 0.13075064332051575,
|
|
"learning_rate": 1.6996618289418064e-06,
|
|
"loss": 0.939,
|
|
"mean_token_accuracy": 0.7650110006332398,
|
|
"num_tokens": 904149583.0,
|
|
"step": 9810
|
|
},
|
|
{
|
|
"entropy": 1.2109375,
|
|
"epoch": 1.3420800874675414,
|
|
"grad_norm": 0.13746896512686158,
|
|
"learning_rate": 1.6961392137522898e-06,
|
|
"loss": 0.926,
|
|
"mean_token_accuracy": 0.7640791773796082,
|
|
"num_tokens": 905019600.0,
|
|
"step": 9820
|
|
},
|
|
{
|
|
"entropy": 1.1875,
|
|
"epoch": 1.3434467678010114,
|
|
"grad_norm": 0.12896280575926095,
|
|
"learning_rate": 1.6926165985627733e-06,
|
|
"loss": 0.9265,
|
|
"mean_token_accuracy": 0.7668571710586548,
|
|
"num_tokens": 905895865.0,
|
|
"step": 9830
|
|
},
|
|
{
|
|
"entropy": 1.22421875,
|
|
"epoch": 1.3448134481344813,
|
|
"grad_norm": 0.13672081743169948,
|
|
"learning_rate": 1.6890939833732564e-06,
|
|
"loss": 0.9802,
|
|
"mean_token_accuracy": 0.7550762236118317,
|
|
"num_tokens": 906847363.0,
|
|
"step": 9840
|
|
},
|
|
{
|
|
"entropy": 1.2359375,
|
|
"epoch": 1.3461801284679513,
|
|
"grad_norm": 0.12808466228869694,
|
|
"learning_rate": 1.6855713681837396e-06,
|
|
"loss": 0.9622,
|
|
"mean_token_accuracy": 0.7589754939079285,
|
|
"num_tokens": 907782159.0,
|
|
"step": 9850
|
|
},
|
|
{
|
|
"entropy": 1.20625,
|
|
"epoch": 1.3475468088014213,
|
|
"grad_norm": 0.13275590944550283,
|
|
"learning_rate": 1.6820487529942231e-06,
|
|
"loss": 0.9222,
|
|
"mean_token_accuracy": 0.7631280303001404,
|
|
"num_tokens": 908694428.0,
|
|
"step": 9860
|
|
},
|
|
{
|
|
"entropy": 1.1921875,
|
|
"epoch": 1.3489134891348913,
|
|
"grad_norm": 0.14251710857971153,
|
|
"learning_rate": 1.6785261378047062e-06,
|
|
"loss": 0.9054,
|
|
"mean_token_accuracy": 0.7685049593448638,
|
|
"num_tokens": 909610885.0,
|
|
"step": 9870
|
|
},
|
|
{
|
|
"entropy": 1.19921875,
|
|
"epoch": 1.3502801694683613,
|
|
"grad_norm": 0.12794762632732315,
|
|
"learning_rate": 1.6750035226151898e-06,
|
|
"loss": 0.9193,
|
|
"mean_token_accuracy": 0.7677441000938415,
|
|
"num_tokens": 910486074.0,
|
|
"step": 9880
|
|
},
|
|
{
|
|
"entropy": 1.1875,
|
|
"epoch": 1.3516468498018313,
|
|
"grad_norm": 0.1306199238682151,
|
|
"learning_rate": 1.671480907425673e-06,
|
|
"loss": 0.9265,
|
|
"mean_token_accuracy": 0.7654483616352081,
|
|
"num_tokens": 911424517.0,
|
|
"step": 9890
|
|
},
|
|
{
|
|
"entropy": 1.20625,
|
|
"epoch": 1.3530135301353012,
|
|
"grad_norm": 0.13020558688549946,
|
|
"learning_rate": 1.6679582922361562e-06,
|
|
"loss": 0.9305,
|
|
"mean_token_accuracy": 0.7666921555995941,
|
|
"num_tokens": 912321096.0,
|
|
"step": 9900
|
|
},
|
|
{
|
|
"entropy": 1.2359375,
|
|
"epoch": 1.3543802104687712,
|
|
"grad_norm": 0.13261620070880714,
|
|
"learning_rate": 1.6644356770466396e-06,
|
|
"loss": 0.9268,
|
|
"mean_token_accuracy": 0.7645103216171265,
|
|
"num_tokens": 913256636.0,
|
|
"step": 9910
|
|
},
|
|
{
|
|
"entropy": 1.21640625,
|
|
"epoch": 1.3557468908022414,
|
|
"grad_norm": 0.13374060852611236,
|
|
"learning_rate": 1.660913061857123e-06,
|
|
"loss": 0.9313,
|
|
"mean_token_accuracy": 0.7631197035312652,
|
|
"num_tokens": 914191751.0,
|
|
"step": 9920
|
|
},
|
|
{
|
|
"entropy": 1.16796875,
|
|
"epoch": 1.3571135711357114,
|
|
"grad_norm": 0.13460834652001694,
|
|
"learning_rate": 1.657390446667606e-06,
|
|
"loss": 0.8767,
|
|
"mean_token_accuracy": 0.7767782390117646,
|
|
"num_tokens": 915113189.0,
|
|
"step": 9930
|
|
},
|
|
{
|
|
"entropy": 1.2046875,
|
|
"epoch": 1.3584802514691814,
|
|
"grad_norm": 0.12509654152478447,
|
|
"learning_rate": 1.6538678314780896e-06,
|
|
"loss": 0.9376,
|
|
"mean_token_accuracy": 0.7644299924373626,
|
|
"num_tokens": 916020500.0,
|
|
"step": 9940
|
|
},
|
|
{
|
|
"entropy": 1.27890625,
|
|
"epoch": 1.3598469318026514,
|
|
"grad_norm": 0.15483186601833016,
|
|
"learning_rate": 1.6503452162885727e-06,
|
|
"loss": 1.0126,
|
|
"mean_token_accuracy": 0.7474663734436036,
|
|
"num_tokens": 916915733.0,
|
|
"step": 9950
|
|
},
|
|
{
|
|
"entropy": 1.221875,
|
|
"epoch": 1.3612136121361214,
|
|
"grad_norm": 0.1322104948608907,
|
|
"learning_rate": 1.646822601099056e-06,
|
|
"loss": 0.9012,
|
|
"mean_token_accuracy": 0.7706958949565887,
|
|
"num_tokens": 917832257.0,
|
|
"step": 9960
|
|
},
|
|
{
|
|
"entropy": 1.1890625,
|
|
"epoch": 1.3625802924695913,
|
|
"grad_norm": 0.13132071789138977,
|
|
"learning_rate": 1.6432999859095394e-06,
|
|
"loss": 0.9021,
|
|
"mean_token_accuracy": 0.7719067156314849,
|
|
"num_tokens": 918751964.0,
|
|
"step": 9970
|
|
},
|
|
{
|
|
"entropy": 1.25703125,
|
|
"epoch": 1.3639469728030613,
|
|
"grad_norm": 0.13024062189797386,
|
|
"learning_rate": 1.6397773707200227e-06,
|
|
"loss": 0.9791,
|
|
"mean_token_accuracy": 0.7546908617019653,
|
|
"num_tokens": 919683718.0,
|
|
"step": 9980
|
|
},
|
|
{
|
|
"entropy": 1.19453125,
|
|
"epoch": 1.3653136531365313,
|
|
"grad_norm": 0.13057035245034104,
|
|
"learning_rate": 1.636254755530506e-06,
|
|
"loss": 0.9201,
|
|
"mean_token_accuracy": 0.765502256155014,
|
|
"num_tokens": 920567825.0,
|
|
"step": 9990
|
|
},
|
|
{
|
|
"entropy": 1.1375,
|
|
"epoch": 1.3666803334700013,
|
|
"grad_norm": 0.11520437683391974,
|
|
"learning_rate": 1.6327321403409894e-06,
|
|
"loss": 0.8512,
|
|
"mean_token_accuracy": 0.7789388060569763,
|
|
"num_tokens": 921479711.0,
|
|
"step": 10000
|
|
},
|
|
{
|
|
"entropy": 1.21171875,
|
|
"epoch": 1.3680470138034715,
|
|
"grad_norm": 0.1420303421014768,
|
|
"learning_rate": 1.6292095251514725e-06,
|
|
"loss": 0.9252,
|
|
"mean_token_accuracy": 0.766900897026062,
|
|
"num_tokens": 922388746.0,
|
|
"step": 10010
|
|
},
|
|
{
|
|
"entropy": 1.24453125,
|
|
"epoch": 1.3694136941369415,
|
|
"grad_norm": 0.1200716291099583,
|
|
"learning_rate": 1.625686909961956e-06,
|
|
"loss": 0.9815,
|
|
"mean_token_accuracy": 0.7548674464225769,
|
|
"num_tokens": 923329842.0,
|
|
"step": 10020
|
|
},
|
|
{
|
|
"entropy": 1.2203125,
|
|
"epoch": 1.3707803744704115,
|
|
"grad_norm": 0.1287654968611796,
|
|
"learning_rate": 1.6221642947724392e-06,
|
|
"loss": 0.9653,
|
|
"mean_token_accuracy": 0.7577765166759491,
|
|
"num_tokens": 924206127.0,
|
|
"step": 10030
|
|
},
|
|
{
|
|
"entropy": 1.25703125,
|
|
"epoch": 1.3721470548038814,
|
|
"grad_norm": 0.14051320137538312,
|
|
"learning_rate": 1.6186416795829223e-06,
|
|
"loss": 0.9589,
|
|
"mean_token_accuracy": 0.7591795146465301,
|
|
"num_tokens": 925150765.0,
|
|
"step": 10040
|
|
},
|
|
{
|
|
"entropy": 1.23046875,
|
|
"epoch": 1.3735137351373514,
|
|
"grad_norm": 0.1363336198318134,
|
|
"learning_rate": 1.6151190643934058e-06,
|
|
"loss": 0.9334,
|
|
"mean_token_accuracy": 0.7617285013198852,
|
|
"num_tokens": 926087915.0,
|
|
"step": 10050
|
|
},
|
|
{
|
|
"entropy": 1.1921875,
|
|
"epoch": 1.3748804154708214,
|
|
"grad_norm": 0.12582471919880878,
|
|
"learning_rate": 1.6115964492038892e-06,
|
|
"loss": 0.9156,
|
|
"mean_token_accuracy": 0.7682185888290405,
|
|
"num_tokens": 926998850.0,
|
|
"step": 10060
|
|
},
|
|
{
|
|
"entropy": 1.22109375,
|
|
"epoch": 1.3762470958042914,
|
|
"grad_norm": 0.1213053644197315,
|
|
"learning_rate": 1.6080738340143723e-06,
|
|
"loss": 0.9063,
|
|
"mean_token_accuracy": 0.7714687764644623,
|
|
"num_tokens": 927939577.0,
|
|
"step": 10070
|
|
},
|
|
{
|
|
"entropy": 1.17578125,
|
|
"epoch": 1.3776137761377614,
|
|
"grad_norm": 0.12380337361466269,
|
|
"learning_rate": 1.6045512188248559e-06,
|
|
"loss": 0.913,
|
|
"mean_token_accuracy": 0.77046879529953,
|
|
"num_tokens": 928810365.0,
|
|
"step": 10080
|
|
},
|
|
{
|
|
"entropy": 1.22265625,
|
|
"epoch": 1.3789804564712314,
|
|
"grad_norm": 0.12039302845144038,
|
|
"learning_rate": 1.601028603635339e-06,
|
|
"loss": 0.909,
|
|
"mean_token_accuracy": 0.7696955800056458,
|
|
"num_tokens": 929705162.0,
|
|
"step": 10090
|
|
},
|
|
{
|
|
"entropy": 1.221875,
|
|
"epoch": 1.3803471368047013,
|
|
"grad_norm": 0.1435905269317809,
|
|
"learning_rate": 1.5975059884458225e-06,
|
|
"loss": 0.9388,
|
|
"mean_token_accuracy": 0.7642656862735748,
|
|
"num_tokens": 930678360.0,
|
|
"step": 10100
|
|
},
|
|
{
|
|
"entropy": 1.19609375,
|
|
"epoch": 1.3817138171381713,
|
|
"grad_norm": 0.12361773558615413,
|
|
"learning_rate": 1.5939833732563056e-06,
|
|
"loss": 0.9022,
|
|
"mean_token_accuracy": 0.769868814945221,
|
|
"num_tokens": 931601996.0,
|
|
"step": 10110
|
|
},
|
|
{
|
|
"entropy": 1.2359375,
|
|
"epoch": 1.3830804974716413,
|
|
"grad_norm": 0.12391310898883065,
|
|
"learning_rate": 1.5904607580667888e-06,
|
|
"loss": 0.9712,
|
|
"mean_token_accuracy": 0.7567344605922699,
|
|
"num_tokens": 932551505.0,
|
|
"step": 10120
|
|
},
|
|
{
|
|
"entropy": 1.21015625,
|
|
"epoch": 1.3844471778051113,
|
|
"grad_norm": 0.187800011142898,
|
|
"learning_rate": 1.5869381428772723e-06,
|
|
"loss": 0.9443,
|
|
"mean_token_accuracy": 0.7635440945625305,
|
|
"num_tokens": 933463791.0,
|
|
"step": 10130
|
|
},
|
|
{
|
|
"entropy": 1.2328125,
|
|
"epoch": 1.3858138581385813,
|
|
"grad_norm": 0.12534078341170768,
|
|
"learning_rate": 1.5834155276877554e-06,
|
|
"loss": 0.9439,
|
|
"mean_token_accuracy": 0.7624890208244324,
|
|
"num_tokens": 934370194.0,
|
|
"step": 10140
|
|
},
|
|
{
|
|
"entropy": 1.240625,
|
|
"epoch": 1.3871805384720512,
|
|
"grad_norm": 0.11851910847325003,
|
|
"learning_rate": 1.5798929124982388e-06,
|
|
"loss": 0.9632,
|
|
"mean_token_accuracy": 0.7592472076416016,
|
|
"num_tokens": 935250557.0,
|
|
"step": 10150
|
|
},
|
|
{
|
|
"entropy": 1.1890625,
|
|
"epoch": 1.3885472188055215,
|
|
"grad_norm": 0.13740453300353783,
|
|
"learning_rate": 1.5763702973087221e-06,
|
|
"loss": 0.9102,
|
|
"mean_token_accuracy": 0.7682406187057496,
|
|
"num_tokens": 936144286.0,
|
|
"step": 10160
|
|
},
|
|
{
|
|
"entropy": 1.17890625,
|
|
"epoch": 1.3899138991389914,
|
|
"grad_norm": 0.16548998418907507,
|
|
"learning_rate": 1.5728476821192054e-06,
|
|
"loss": 0.9319,
|
|
"mean_token_accuracy": 0.7661476790904999,
|
|
"num_tokens": 937054635.0,
|
|
"step": 10170
|
|
},
|
|
{
|
|
"entropy": 1.246875,
|
|
"epoch": 1.3912805794724614,
|
|
"grad_norm": 0.12634191924170773,
|
|
"learning_rate": 1.5693250669296886e-06,
|
|
"loss": 0.9639,
|
|
"mean_token_accuracy": 0.7590725541114807,
|
|
"num_tokens": 938010446.0,
|
|
"step": 10180
|
|
},
|
|
{
|
|
"entropy": 1.18203125,
|
|
"epoch": 1.3926472598059314,
|
|
"grad_norm": 0.11509765619892214,
|
|
"learning_rate": 1.5658024517401721e-06,
|
|
"loss": 0.9312,
|
|
"mean_token_accuracy": 0.7662279009819031,
|
|
"num_tokens": 938926013.0,
|
|
"step": 10190
|
|
},
|
|
{
|
|
"entropy": 1.171875,
|
|
"epoch": 1.3940139401394014,
|
|
"grad_norm": 0.12478888652994889,
|
|
"learning_rate": 1.5622798365506552e-06,
|
|
"loss": 0.9132,
|
|
"mean_token_accuracy": 0.7701297223567962,
|
|
"num_tokens": 939867123.0,
|
|
"step": 10200
|
|
},
|
|
{
|
|
"entropy": 1.22109375,
|
|
"epoch": 1.3953806204728714,
|
|
"grad_norm": 0.13119628639362796,
|
|
"learning_rate": 1.5587572213611388e-06,
|
|
"loss": 0.9245,
|
|
"mean_token_accuracy": 0.7689882695674897,
|
|
"num_tokens": 940784288.0,
|
|
"step": 10210
|
|
},
|
|
{
|
|
"entropy": 1.22890625,
|
|
"epoch": 1.3967473008063414,
|
|
"grad_norm": 0.1359971003609396,
|
|
"learning_rate": 1.555234606171622e-06,
|
|
"loss": 0.9121,
|
|
"mean_token_accuracy": 0.7689318239688874,
|
|
"num_tokens": 941732009.0,
|
|
"step": 10220
|
|
},
|
|
{
|
|
"entropy": 1.2125,
|
|
"epoch": 1.3981139811398113,
|
|
"grad_norm": 0.12409812035498718,
|
|
"learning_rate": 1.5517119909821052e-06,
|
|
"loss": 0.8993,
|
|
"mean_token_accuracy": 0.7704444885253906,
|
|
"num_tokens": 942687281.0,
|
|
"step": 10230
|
|
},
|
|
{
|
|
"entropy": 1.22890625,
|
|
"epoch": 1.3994806614732813,
|
|
"grad_norm": 0.11774730153253765,
|
|
"learning_rate": 1.5481893757925886e-06,
|
|
"loss": 0.9479,
|
|
"mean_token_accuracy": 0.7628151655197144,
|
|
"num_tokens": 943633306.0,
|
|
"step": 10240
|
|
},
|
|
{
|
|
"entropy": 1.23046875,
|
|
"epoch": 1.4008473418067515,
|
|
"grad_norm": 0.14499277714778638,
|
|
"learning_rate": 1.544666760603072e-06,
|
|
"loss": 0.943,
|
|
"mean_token_accuracy": 0.7618251204490661,
|
|
"num_tokens": 944512974.0,
|
|
"step": 10250
|
|
},
|
|
{
|
|
"entropy": 1.2625,
|
|
"epoch": 1.4022140221402215,
|
|
"grad_norm": 0.1403666253232225,
|
|
"learning_rate": 1.541144145413555e-06,
|
|
"loss": 0.9729,
|
|
"mean_token_accuracy": 0.7544866561889648,
|
|
"num_tokens": 945460175.0,
|
|
"step": 10260
|
|
},
|
|
{
|
|
"entropy": 1.25234375,
|
|
"epoch": 1.4035807024736915,
|
|
"grad_norm": 0.1325638192221751,
|
|
"learning_rate": 1.5376215302240386e-06,
|
|
"loss": 0.9189,
|
|
"mean_token_accuracy": 0.7681994259357452,
|
|
"num_tokens": 946446899.0,
|
|
"step": 10270
|
|
},
|
|
{
|
|
"entropy": 1.209375,
|
|
"epoch": 1.4049473828071615,
|
|
"grad_norm": 0.12488909131213538,
|
|
"learning_rate": 1.5340989150345217e-06,
|
|
"loss": 0.9007,
|
|
"mean_token_accuracy": 0.7708295047283172,
|
|
"num_tokens": 947379575.0,
|
|
"step": 10280
|
|
},
|
|
{
|
|
"entropy": 1.17578125,
|
|
"epoch": 1.4063140631406315,
|
|
"grad_norm": 0.12123092442323408,
|
|
"learning_rate": 1.5305762998450048e-06,
|
|
"loss": 0.8729,
|
|
"mean_token_accuracy": 0.7787349760532379,
|
|
"num_tokens": 948285980.0,
|
|
"step": 10290
|
|
},
|
|
{
|
|
"entropy": 1.28046875,
|
|
"epoch": 1.4076807434741014,
|
|
"grad_norm": 0.14591236214837522,
|
|
"learning_rate": 1.5270536846554884e-06,
|
|
"loss": 1.0022,
|
|
"mean_token_accuracy": 0.7523498058319091,
|
|
"num_tokens": 949204652.0,
|
|
"step": 10300
|
|
},
|
|
{
|
|
"entropy": 1.25078125,
|
|
"epoch": 1.4090474238075714,
|
|
"grad_norm": 0.14344204491718685,
|
|
"learning_rate": 1.5235310694659717e-06,
|
|
"loss": 0.9998,
|
|
"mean_token_accuracy": 0.7510453581809997,
|
|
"num_tokens": 950145164.0,
|
|
"step": 10310
|
|
},
|
|
{
|
|
"entropy": 1.17578125,
|
|
"epoch": 1.4104141041410414,
|
|
"grad_norm": 0.12982359302174612,
|
|
"learning_rate": 1.5200084542764548e-06,
|
|
"loss": 0.8835,
|
|
"mean_token_accuracy": 0.7733734965324401,
|
|
"num_tokens": 951084582.0,
|
|
"step": 10320
|
|
},
|
|
{
|
|
"entropy": 1.20546875,
|
|
"epoch": 1.4117807844745114,
|
|
"grad_norm": 0.12946869445165984,
|
|
"learning_rate": 1.5164858390869384e-06,
|
|
"loss": 0.9045,
|
|
"mean_token_accuracy": 0.7690301895141601,
|
|
"num_tokens": 952003428.0,
|
|
"step": 10330
|
|
},
|
|
{
|
|
"entropy": 1.29375,
|
|
"epoch": 1.4131474648079814,
|
|
"grad_norm": 0.144796139903195,
|
|
"learning_rate": 1.5129632238974215e-06,
|
|
"loss": 1.0047,
|
|
"mean_token_accuracy": 0.7533403158187866,
|
|
"num_tokens": 952891571.0,
|
|
"step": 10340
|
|
},
|
|
{
|
|
"entropy": 1.21953125,
|
|
"epoch": 1.4145141451414514,
|
|
"grad_norm": 0.11915896137936798,
|
|
"learning_rate": 1.509440608707905e-06,
|
|
"loss": 0.9016,
|
|
"mean_token_accuracy": 0.7707844555377961,
|
|
"num_tokens": 953841805.0,
|
|
"step": 10350
|
|
},
|
|
{
|
|
"entropy": 1.2671875,
|
|
"epoch": 1.4158808254749213,
|
|
"grad_norm": 0.1280976017369304,
|
|
"learning_rate": 1.5059179935183882e-06,
|
|
"loss": 0.9322,
|
|
"mean_token_accuracy": 0.7643692255020141,
|
|
"num_tokens": 954757093.0,
|
|
"step": 10360
|
|
},
|
|
{
|
|
"entropy": 1.22265625,
|
|
"epoch": 1.4172475058083913,
|
|
"grad_norm": 0.13335001781261624,
|
|
"learning_rate": 1.5023953783288713e-06,
|
|
"loss": 0.9246,
|
|
"mean_token_accuracy": 0.7673652470111847,
|
|
"num_tokens": 955688450.0,
|
|
"step": 10370
|
|
},
|
|
{
|
|
"entropy": 1.1984375,
|
|
"epoch": 1.4186141861418613,
|
|
"grad_norm": 0.1282119361276184,
|
|
"learning_rate": 1.4988727631393549e-06,
|
|
"loss": 0.9261,
|
|
"mean_token_accuracy": 0.7641721546649933,
|
|
"num_tokens": 956599499.0,
|
|
"step": 10380
|
|
},
|
|
{
|
|
"entropy": 1.221875,
|
|
"epoch": 1.4199808664753313,
|
|
"grad_norm": 0.14296626839336596,
|
|
"learning_rate": 1.495350147949838e-06,
|
|
"loss": 0.9701,
|
|
"mean_token_accuracy": 0.7586191177368165,
|
|
"num_tokens": 957556773.0,
|
|
"step": 10390
|
|
},
|
|
{
|
|
"entropy": 1.1765625,
|
|
"epoch": 1.4213475468088015,
|
|
"grad_norm": 0.1257391739862792,
|
|
"learning_rate": 1.4918275327603213e-06,
|
|
"loss": 0.8953,
|
|
"mean_token_accuracy": 0.7739502727985382,
|
|
"num_tokens": 958434459.0,
|
|
"step": 10400
|
|
},
|
|
{
|
|
"entropy": 1.1765625,
|
|
"epoch": 1.4227142271422715,
|
|
"grad_norm": 0.12084241546440523,
|
|
"learning_rate": 1.4883049175708047e-06,
|
|
"loss": 0.9216,
|
|
"mean_token_accuracy": 0.7672718048095704,
|
|
"num_tokens": 959305209.0,
|
|
"step": 10410
|
|
},
|
|
{
|
|
"entropy": 1.234375,
|
|
"epoch": 1.4240809074757415,
|
|
"grad_norm": 0.12497188292808693,
|
|
"learning_rate": 1.484782302381288e-06,
|
|
"loss": 0.9692,
|
|
"mean_token_accuracy": 0.7567567467689514,
|
|
"num_tokens": 960231022.0,
|
|
"step": 10420
|
|
},
|
|
{
|
|
"entropy": 1.23359375,
|
|
"epoch": 1.4254475878092114,
|
|
"grad_norm": 0.1356928196781962,
|
|
"learning_rate": 1.4812596871917711e-06,
|
|
"loss": 0.919,
|
|
"mean_token_accuracy": 0.7684208989143372,
|
|
"num_tokens": 961131511.0,
|
|
"step": 10430
|
|
},
|
|
{
|
|
"entropy": 1.21171875,
|
|
"epoch": 1.4268142681426814,
|
|
"grad_norm": 0.11755157961894455,
|
|
"learning_rate": 1.4777370720022547e-06,
|
|
"loss": 0.9431,
|
|
"mean_token_accuracy": 0.7631329357624054,
|
|
"num_tokens": 962047298.0,
|
|
"step": 10440
|
|
},
|
|
{
|
|
"entropy": 1.20390625,
|
|
"epoch": 1.4281809484761514,
|
|
"grad_norm": 0.13304803536706106,
|
|
"learning_rate": 1.4742144568127378e-06,
|
|
"loss": 0.9243,
|
|
"mean_token_accuracy": 0.7655666291713714,
|
|
"num_tokens": 963000680.0,
|
|
"step": 10450
|
|
},
|
|
{
|
|
"entropy": 1.1703125,
|
|
"epoch": 1.4295476288096214,
|
|
"grad_norm": 0.1250372147262837,
|
|
"learning_rate": 1.4706918416232213e-06,
|
|
"loss": 0.9233,
|
|
"mean_token_accuracy": 0.7674897909164429,
|
|
"num_tokens": 963910634.0,
|
|
"step": 10460
|
|
},
|
|
{
|
|
"entropy": 1.2234375,
|
|
"epoch": 1.4309143091430914,
|
|
"grad_norm": 0.11655303926070984,
|
|
"learning_rate": 1.4671692264337045e-06,
|
|
"loss": 0.9376,
|
|
"mean_token_accuracy": 0.7632603883743286,
|
|
"num_tokens": 964864834.0,
|
|
"step": 10470
|
|
},
|
|
{
|
|
"entropy": 1.198828125,
|
|
"epoch": 1.4322809894765614,
|
|
"grad_norm": 0.12939359022258431,
|
|
"learning_rate": 1.4636466112441878e-06,
|
|
"loss": 0.9437,
|
|
"mean_token_accuracy": 0.7598079919815064,
|
|
"num_tokens": 965816016.0,
|
|
"step": 10480
|
|
},
|
|
{
|
|
"entropy": 1.1953125,
|
|
"epoch": 1.4336476698100316,
|
|
"grad_norm": 0.1392748869652251,
|
|
"learning_rate": 1.4601239960546711e-06,
|
|
"loss": 0.9132,
|
|
"mean_token_accuracy": 0.7682592451572419,
|
|
"num_tokens": 966734698.0,
|
|
"step": 10490
|
|
},
|
|
{
|
|
"entropy": 1.24765625,
|
|
"epoch": 1.4350143501435015,
|
|
"grad_norm": 0.11951603744334995,
|
|
"learning_rate": 1.4566013808651545e-06,
|
|
"loss": 0.9349,
|
|
"mean_token_accuracy": 0.7625779986381531,
|
|
"num_tokens": 967702846.0,
|
|
"step": 10500
|
|
},
|
|
{
|
|
"entropy": 1.16796875,
|
|
"epoch": 1.4363810304769715,
|
|
"grad_norm": 0.1271943825103218,
|
|
"learning_rate": 1.4530787656756376e-06,
|
|
"loss": 0.8714,
|
|
"mean_token_accuracy": 0.7779273629188538,
|
|
"num_tokens": 968655185.0,
|
|
"step": 10510
|
|
},
|
|
{
|
|
"entropy": 1.23046875,
|
|
"epoch": 1.4377477108104415,
|
|
"grad_norm": 0.13481342812897615,
|
|
"learning_rate": 1.4495561504861211e-06,
|
|
"loss": 0.9295,
|
|
"mean_token_accuracy": 0.7641107499599457,
|
|
"num_tokens": 969625560.0,
|
|
"step": 10520
|
|
},
|
|
{
|
|
"entropy": 1.2171875,
|
|
"epoch": 1.4391143911439115,
|
|
"grad_norm": 0.12365992705210871,
|
|
"learning_rate": 1.4460335352966043e-06,
|
|
"loss": 0.923,
|
|
"mean_token_accuracy": 0.7681592285633088,
|
|
"num_tokens": 970536328.0,
|
|
"step": 10530
|
|
},
|
|
{
|
|
"entropy": 1.28046875,
|
|
"epoch": 1.4404810714773815,
|
|
"grad_norm": 0.13291699139446733,
|
|
"learning_rate": 1.4425109201070876e-06,
|
|
"loss": 1.0425,
|
|
"mean_token_accuracy": 0.7413816452026367,
|
|
"num_tokens": 971542224.0,
|
|
"step": 10540
|
|
},
|
|
{
|
|
"entropy": 1.228125,
|
|
"epoch": 1.4418477518108515,
|
|
"grad_norm": 0.13101553985350267,
|
|
"learning_rate": 1.438988304917571e-06,
|
|
"loss": 0.906,
|
|
"mean_token_accuracy": 0.7694543123245239,
|
|
"num_tokens": 972483619.0,
|
|
"step": 10550
|
|
},
|
|
{
|
|
"entropy": 1.20390625,
|
|
"epoch": 1.4432144321443214,
|
|
"grad_norm": 0.11840433238861303,
|
|
"learning_rate": 1.4354656897280543e-06,
|
|
"loss": 0.9563,
|
|
"mean_token_accuracy": 0.7588598132133484,
|
|
"num_tokens": 973418101.0,
|
|
"step": 10560
|
|
},
|
|
{
|
|
"entropy": 1.2046875,
|
|
"epoch": 1.4445811124777914,
|
|
"grad_norm": 0.1221468600929479,
|
|
"learning_rate": 1.4319430745385376e-06,
|
|
"loss": 0.9221,
|
|
"mean_token_accuracy": 0.7649411976337432,
|
|
"num_tokens": 974333475.0,
|
|
"step": 10570
|
|
},
|
|
{
|
|
"entropy": 1.2296875,
|
|
"epoch": 1.4459477928112614,
|
|
"grad_norm": 0.11939636990551414,
|
|
"learning_rate": 1.428420459349021e-06,
|
|
"loss": 0.9364,
|
|
"mean_token_accuracy": 0.7653820157051087,
|
|
"num_tokens": 975250053.0,
|
|
"step": 10580
|
|
},
|
|
{
|
|
"entropy": 1.159375,
|
|
"epoch": 1.4473144731447314,
|
|
"grad_norm": 0.13886464149715277,
|
|
"learning_rate": 1.424897844159504e-06,
|
|
"loss": 0.8683,
|
|
"mean_token_accuracy": 0.7774555683135986,
|
|
"num_tokens": 976170564.0,
|
|
"step": 10590
|
|
},
|
|
{
|
|
"entropy": 1.1984375,
|
|
"epoch": 1.4486811534782014,
|
|
"grad_norm": 0.14961660557047832,
|
|
"learning_rate": 1.4213752289699876e-06,
|
|
"loss": 0.912,
|
|
"mean_token_accuracy": 0.768204802274704,
|
|
"num_tokens": 977076464.0,
|
|
"step": 10600
|
|
},
|
|
{
|
|
"entropy": 1.1796875,
|
|
"epoch": 1.4500478338116713,
|
|
"grad_norm": 0.1181823850284041,
|
|
"learning_rate": 1.4178526137804707e-06,
|
|
"loss": 0.9001,
|
|
"mean_token_accuracy": 0.7726364850997924,
|
|
"num_tokens": 977974328.0,
|
|
"step": 10610
|
|
},
|
|
{
|
|
"entropy": 1.19453125,
|
|
"epoch": 1.4514145141451413,
|
|
"grad_norm": 0.12254919173292149,
|
|
"learning_rate": 1.4143299985909538e-06,
|
|
"loss": 0.8878,
|
|
"mean_token_accuracy": 0.7748463571071624,
|
|
"num_tokens": 978866088.0,
|
|
"step": 10620
|
|
},
|
|
{
|
|
"entropy": 1.1859375,
|
|
"epoch": 1.4527811944786113,
|
|
"grad_norm": 0.12369699702321621,
|
|
"learning_rate": 1.4108073834014374e-06,
|
|
"loss": 0.8946,
|
|
"mean_token_accuracy": 0.7715919435024261,
|
|
"num_tokens": 979814950.0,
|
|
"step": 10630
|
|
},
|
|
{
|
|
"entropy": 1.17734375,
|
|
"epoch": 1.4541478748120815,
|
|
"grad_norm": 0.13380047740724738,
|
|
"learning_rate": 1.4072847682119205e-06,
|
|
"loss": 0.9218,
|
|
"mean_token_accuracy": 0.7686505019664764,
|
|
"num_tokens": 980760948.0,
|
|
"step": 10640
|
|
},
|
|
{
|
|
"entropy": 1.20859375,
|
|
"epoch": 1.4555145551455515,
|
|
"grad_norm": 0.1339811017318032,
|
|
"learning_rate": 1.4037621530224039e-06,
|
|
"loss": 0.9242,
|
|
"mean_token_accuracy": 0.7676812529563903,
|
|
"num_tokens": 981737348.0,
|
|
"step": 10650
|
|
},
|
|
{
|
|
"entropy": 1.18515625,
|
|
"epoch": 1.4568812354790215,
|
|
"grad_norm": 0.1215021217063388,
|
|
"learning_rate": 1.4002395378328872e-06,
|
|
"loss": 0.8576,
|
|
"mean_token_accuracy": 0.7762023866176605,
|
|
"num_tokens": 982695749.0,
|
|
"step": 10660
|
|
},
|
|
{
|
|
"entropy": 1.1734375,
|
|
"epoch": 1.4582479158124915,
|
|
"grad_norm": 0.13899611706539278,
|
|
"learning_rate": 1.3967169226433705e-06,
|
|
"loss": 0.889,
|
|
"mean_token_accuracy": 0.7732386350631714,
|
|
"num_tokens": 983614796.0,
|
|
"step": 10670
|
|
},
|
|
{
|
|
"entropy": 1.22265625,
|
|
"epoch": 1.4596145961459615,
|
|
"grad_norm": 0.12876067701897376,
|
|
"learning_rate": 1.393194307453854e-06,
|
|
"loss": 0.9462,
|
|
"mean_token_accuracy": 0.7610947608947753,
|
|
"num_tokens": 984551709.0,
|
|
"step": 10680
|
|
},
|
|
{
|
|
"entropy": 1.23984375,
|
|
"epoch": 1.4609812764794314,
|
|
"grad_norm": 0.13876053805776126,
|
|
"learning_rate": 1.3896716922643372e-06,
|
|
"loss": 0.9633,
|
|
"mean_token_accuracy": 0.7579413771629333,
|
|
"num_tokens": 985454993.0,
|
|
"step": 10690
|
|
},
|
|
{
|
|
"entropy": 1.2046875,
|
|
"epoch": 1.4623479568129014,
|
|
"grad_norm": 0.13076326290991178,
|
|
"learning_rate": 1.3861490770748203e-06,
|
|
"loss": 0.9006,
|
|
"mean_token_accuracy": 0.7724120318889618,
|
|
"num_tokens": 986391499.0,
|
|
"step": 10700
|
|
},
|
|
{
|
|
"entropy": 1.21875,
|
|
"epoch": 1.4637146371463714,
|
|
"grad_norm": 0.14942327305416145,
|
|
"learning_rate": 1.3826264618853039e-06,
|
|
"loss": 0.9416,
|
|
"mean_token_accuracy": 0.7614064335823059,
|
|
"num_tokens": 987263519.0,
|
|
"step": 10710
|
|
},
|
|
{
|
|
"entropy": 1.2453125,
|
|
"epoch": 1.4650813174798414,
|
|
"grad_norm": 0.13130209947896845,
|
|
"learning_rate": 1.379103846695787e-06,
|
|
"loss": 0.9584,
|
|
"mean_token_accuracy": 0.7604145586490632,
|
|
"num_tokens": 988255038.0,
|
|
"step": 10720
|
|
},
|
|
{
|
|
"entropy": 1.221875,
|
|
"epoch": 1.4664479978133116,
|
|
"grad_norm": 0.13809450346129734,
|
|
"learning_rate": 1.3755812315062703e-06,
|
|
"loss": 0.9546,
|
|
"mean_token_accuracy": 0.7598496556282044,
|
|
"num_tokens": 989167746.0,
|
|
"step": 10730
|
|
},
|
|
{
|
|
"entropy": 1.190625,
|
|
"epoch": 1.4678146781467816,
|
|
"grad_norm": 0.1293277655662316,
|
|
"learning_rate": 1.3720586163167537e-06,
|
|
"loss": 0.9245,
|
|
"mean_token_accuracy": 0.7665970385074615,
|
|
"num_tokens": 990084172.0,
|
|
"step": 10740
|
|
},
|
|
{
|
|
"entropy": 1.23203125,
|
|
"epoch": 1.4691813584802516,
|
|
"grad_norm": 0.13724920927404669,
|
|
"learning_rate": 1.368536001127237e-06,
|
|
"loss": 0.9885,
|
|
"mean_token_accuracy": 0.7566388309001922,
|
|
"num_tokens": 990977216.0,
|
|
"step": 10750
|
|
},
|
|
{
|
|
"entropy": 1.21796875,
|
|
"epoch": 1.4705480388137215,
|
|
"grad_norm": 0.11639800143362508,
|
|
"learning_rate": 1.3650133859377201e-06,
|
|
"loss": 0.9283,
|
|
"mean_token_accuracy": 0.7631816506385803,
|
|
"num_tokens": 991891997.0,
|
|
"step": 10760
|
|
},
|
|
{
|
|
"entropy": 1.2046875,
|
|
"epoch": 1.4719147191471915,
|
|
"grad_norm": 0.12440310337274,
|
|
"learning_rate": 1.3614907707482037e-06,
|
|
"loss": 0.929,
|
|
"mean_token_accuracy": 0.7647937536239624,
|
|
"num_tokens": 992789231.0,
|
|
"step": 10770
|
|
},
|
|
{
|
|
"entropy": 1.28984375,
|
|
"epoch": 1.4732813994806615,
|
|
"grad_norm": 0.13201414936977363,
|
|
"learning_rate": 1.3579681555586868e-06,
|
|
"loss": 0.9827,
|
|
"mean_token_accuracy": 0.7560438632965087,
|
|
"num_tokens": 993739364.0,
|
|
"step": 10780
|
|
},
|
|
{
|
|
"entropy": 1.21796875,
|
|
"epoch": 1.4746480798141315,
|
|
"grad_norm": 0.10894177197700443,
|
|
"learning_rate": 1.3544455403691703e-06,
|
|
"loss": 0.9238,
|
|
"mean_token_accuracy": 0.7684527218341828,
|
|
"num_tokens": 994688957.0,
|
|
"step": 10790
|
|
},
|
|
{
|
|
"entropy": 1.19453125,
|
|
"epoch": 1.4760147601476015,
|
|
"grad_norm": 0.12599195057352952,
|
|
"learning_rate": 1.3509229251796535e-06,
|
|
"loss": 0.9064,
|
|
"mean_token_accuracy": 0.7701891899108887,
|
|
"num_tokens": 995572150.0,
|
|
"step": 10800
|
|
},
|
|
{
|
|
"entropy": 1.2375,
|
|
"epoch": 1.4773814404810715,
|
|
"grad_norm": 0.12844585164902145,
|
|
"learning_rate": 1.3474003099901368e-06,
|
|
"loss": 0.9435,
|
|
"mean_token_accuracy": 0.7628725469112396,
|
|
"num_tokens": 996471230.0,
|
|
"step": 10810
|
|
},
|
|
{
|
|
"entropy": 1.20234375,
|
|
"epoch": 1.4787481208145414,
|
|
"grad_norm": 0.12175563044171474,
|
|
"learning_rate": 1.3438776948006201e-06,
|
|
"loss": 0.9143,
|
|
"mean_token_accuracy": 0.7695338249206543,
|
|
"num_tokens": 997378119.0,
|
|
"step": 10820
|
|
},
|
|
{
|
|
"entropy": 1.1703125,
|
|
"epoch": 1.4801148011480114,
|
|
"grad_norm": 0.11897961055472998,
|
|
"learning_rate": 1.3403550796111035e-06,
|
|
"loss": 0.8357,
|
|
"mean_token_accuracy": 0.784215223789215,
|
|
"num_tokens": 998303380.0,
|
|
"step": 10830
|
|
},
|
|
{
|
|
"entropy": 1.23125,
|
|
"epoch": 1.4814814814814814,
|
|
"grad_norm": 0.12581972070833874,
|
|
"learning_rate": 1.3368324644215866e-06,
|
|
"loss": 0.9302,
|
|
"mean_token_accuracy": 0.7649453938007355,
|
|
"num_tokens": 999225085.0,
|
|
"step": 10840
|
|
},
|
|
{
|
|
"entropy": 1.1734375,
|
|
"epoch": 1.4828481618149514,
|
|
"grad_norm": 0.11803437522198462,
|
|
"learning_rate": 1.3333098492320701e-06,
|
|
"loss": 0.9168,
|
|
"mean_token_accuracy": 0.7672215878963471,
|
|
"num_tokens": 1000160882.0,
|
|
"step": 10850
|
|
},
|
|
{
|
|
"entropy": 1.23359375,
|
|
"epoch": 1.4842148421484214,
|
|
"grad_norm": 0.13252638166286138,
|
|
"learning_rate": 1.3297872340425533e-06,
|
|
"loss": 0.9892,
|
|
"mean_token_accuracy": 0.7530250906944275,
|
|
"num_tokens": 1001058706.0,
|
|
"step": 10860
|
|
},
|
|
{
|
|
"entropy": 1.2484375,
|
|
"epoch": 1.4855815224818913,
|
|
"grad_norm": 0.13003122167230102,
|
|
"learning_rate": 1.3262646188530364e-06,
|
|
"loss": 0.9722,
|
|
"mean_token_accuracy": 0.7572959899902344,
|
|
"num_tokens": 1002025389.0,
|
|
"step": 10870
|
|
},
|
|
{
|
|
"entropy": 1.19140625,
|
|
"epoch": 1.4869482028153616,
|
|
"grad_norm": 0.1308979562044376,
|
|
"learning_rate": 1.32274200366352e-06,
|
|
"loss": 0.9264,
|
|
"mean_token_accuracy": 0.7682469546794891,
|
|
"num_tokens": 1002947444.0,
|
|
"step": 10880
|
|
},
|
|
{
|
|
"entropy": 1.18671875,
|
|
"epoch": 1.4883148831488315,
|
|
"grad_norm": 0.13299161453714362,
|
|
"learning_rate": 1.319219388474003e-06,
|
|
"loss": 0.9186,
|
|
"mean_token_accuracy": 0.7679003775119781,
|
|
"num_tokens": 1003827927.0,
|
|
"step": 10890
|
|
},
|
|
{
|
|
"entropy": 1.2625,
|
|
"epoch": 1.4896815634823015,
|
|
"grad_norm": 0.11919611764891316,
|
|
"learning_rate": 1.3156967732844866e-06,
|
|
"loss": 0.9622,
|
|
"mean_token_accuracy": 0.7588982999324798,
|
|
"num_tokens": 1004761314.0,
|
|
"step": 10900
|
|
},
|
|
{
|
|
"entropy": 1.16875,
|
|
"epoch": 1.4910482438157715,
|
|
"grad_norm": 0.13922058091783118,
|
|
"learning_rate": 1.31217415809497e-06,
|
|
"loss": 0.8627,
|
|
"mean_token_accuracy": 0.7783329308032989,
|
|
"num_tokens": 1005703529.0,
|
|
"step": 10910
|
|
},
|
|
{
|
|
"entropy": 1.2546875,
|
|
"epoch": 1.4924149241492415,
|
|
"grad_norm": 0.13289683499042754,
|
|
"learning_rate": 1.308651542905453e-06,
|
|
"loss": 0.973,
|
|
"mean_token_accuracy": 0.7534335553646088,
|
|
"num_tokens": 1006683078.0,
|
|
"step": 10920
|
|
},
|
|
{
|
|
"entropy": 1.180078125,
|
|
"epoch": 1.4937816044827115,
|
|
"grad_norm": 0.13084866373750703,
|
|
"learning_rate": 1.3051289277159366e-06,
|
|
"loss": 0.8945,
|
|
"mean_token_accuracy": 0.7705242931842804,
|
|
"num_tokens": 1007585241.0,
|
|
"step": 10930
|
|
},
|
|
{
|
|
"entropy": 1.19140625,
|
|
"epoch": 1.4951482848161814,
|
|
"grad_norm": 0.12977194052392424,
|
|
"learning_rate": 1.3016063125264197e-06,
|
|
"loss": 0.9436,
|
|
"mean_token_accuracy": 0.7654342949390411,
|
|
"num_tokens": 1008478476.0,
|
|
"step": 10940
|
|
},
|
|
{
|
|
"entropy": 1.23359375,
|
|
"epoch": 1.4965149651496514,
|
|
"grad_norm": 0.13137497830554787,
|
|
"learning_rate": 1.2980836973369029e-06,
|
|
"loss": 0.9745,
|
|
"mean_token_accuracy": 0.7530411005020141,
|
|
"num_tokens": 1009373252.0,
|
|
"step": 10950
|
|
},
|
|
{
|
|
"entropy": 1.18359375,
|
|
"epoch": 1.4978816454831214,
|
|
"grad_norm": 0.13686881419349448,
|
|
"learning_rate": 1.2945610821473864e-06,
|
|
"loss": 0.919,
|
|
"mean_token_accuracy": 0.7676711142063141,
|
|
"num_tokens": 1010255380.0,
|
|
"step": 10960
|
|
},
|
|
{
|
|
"entropy": 1.17109375,
|
|
"epoch": 1.4992483258165916,
|
|
"grad_norm": 0.12998891929054163,
|
|
"learning_rate": 1.2910384669578695e-06,
|
|
"loss": 0.8611,
|
|
"mean_token_accuracy": 0.7806814789772034,
|
|
"num_tokens": 1011183449.0,
|
|
"step": 10970
|
|
},
|
|
{
|
|
"entropy": 1.17890625,
|
|
"epoch": 1.5006150061500616,
|
|
"grad_norm": 0.1450700382812964,
|
|
"learning_rate": 1.2875158517683529e-06,
|
|
"loss": 0.9328,
|
|
"mean_token_accuracy": 0.7657476544380188,
|
|
"num_tokens": 1012078107.0,
|
|
"step": 10980
|
|
},
|
|
{
|
|
"entropy": 1.23046875,
|
|
"epoch": 1.5019816864835316,
|
|
"grad_norm": 0.13304897954832381,
|
|
"learning_rate": 1.2839932365788362e-06,
|
|
"loss": 0.9668,
|
|
"mean_token_accuracy": 0.7568911015987396,
|
|
"num_tokens": 1012995560.0,
|
|
"step": 10990
|
|
},
|
|
{
|
|
"entropy": 1.2125,
|
|
"epoch": 1.5033483668170016,
|
|
"grad_norm": 0.11308151075721297,
|
|
"learning_rate": 1.2804706213893195e-06,
|
|
"loss": 0.9215,
|
|
"mean_token_accuracy": 0.7671330332756042,
|
|
"num_tokens": 1013935624.0,
|
|
"step": 11000
|
|
},
|
|
{
|
|
"entropy": 1.2359375,
|
|
"epoch": 1.5047150471504716,
|
|
"grad_norm": 0.1289574770764423,
|
|
"learning_rate": 1.2769480061998029e-06,
|
|
"loss": 0.9477,
|
|
"mean_token_accuracy": 0.7629809141159057,
|
|
"num_tokens": 1014862406.0,
|
|
"step": 11010
|
|
},
|
|
{
|
|
"entropy": 1.20859375,
|
|
"epoch": 1.5060817274839415,
|
|
"grad_norm": 0.11521629471794889,
|
|
"learning_rate": 1.2734253910102862e-06,
|
|
"loss": 0.9079,
|
|
"mean_token_accuracy": 0.7708567321300507,
|
|
"num_tokens": 1015821840.0,
|
|
"step": 11020
|
|
},
|
|
{
|
|
"entropy": 1.22265625,
|
|
"epoch": 1.5074484078174115,
|
|
"grad_norm": 0.1372169285457243,
|
|
"learning_rate": 1.2699027758207693e-06,
|
|
"loss": 0.9232,
|
|
"mean_token_accuracy": 0.7665498077869415,
|
|
"num_tokens": 1016739059.0,
|
|
"step": 11030
|
|
},
|
|
{
|
|
"entropy": 1.26015625,
|
|
"epoch": 1.5088150881508815,
|
|
"grad_norm": 0.13752512822239873,
|
|
"learning_rate": 1.2663801606312529e-06,
|
|
"loss": 0.9887,
|
|
"mean_token_accuracy": 0.7500753283500672,
|
|
"num_tokens": 1017732695.0,
|
|
"step": 11040
|
|
},
|
|
{
|
|
"entropy": 1.17578125,
|
|
"epoch": 1.5101817684843515,
|
|
"grad_norm": 0.13051802969759824,
|
|
"learning_rate": 1.262857545441736e-06,
|
|
"loss": 0.8961,
|
|
"mean_token_accuracy": 0.7727594375610352,
|
|
"num_tokens": 1018608385.0,
|
|
"step": 11050
|
|
},
|
|
{
|
|
"entropy": 1.2203125,
|
|
"epoch": 1.5115484488178215,
|
|
"grad_norm": 0.1320435227427393,
|
|
"learning_rate": 1.2593349302522193e-06,
|
|
"loss": 0.928,
|
|
"mean_token_accuracy": 0.7645953118801116,
|
|
"num_tokens": 1019521726.0,
|
|
"step": 11060
|
|
},
|
|
{
|
|
"entropy": 1.2296875,
|
|
"epoch": 1.5129151291512914,
|
|
"grad_norm": 0.13975826902718136,
|
|
"learning_rate": 1.2558123150627027e-06,
|
|
"loss": 0.9294,
|
|
"mean_token_accuracy": 0.7631367802619934,
|
|
"num_tokens": 1020459793.0,
|
|
"step": 11070
|
|
},
|
|
{
|
|
"entropy": 1.24296875,
|
|
"epoch": 1.5142818094847614,
|
|
"grad_norm": 0.14079643216815527,
|
|
"learning_rate": 1.252289699873186e-06,
|
|
"loss": 0.9713,
|
|
"mean_token_accuracy": 0.756269782781601,
|
|
"num_tokens": 1021389370.0,
|
|
"step": 11080
|
|
},
|
|
{
|
|
"entropy": 1.24765625,
|
|
"epoch": 1.5156484898182314,
|
|
"grad_norm": 0.1280481582800378,
|
|
"learning_rate": 1.2487670846836693e-06,
|
|
"loss": 0.9525,
|
|
"mean_token_accuracy": 0.7579525709152222,
|
|
"num_tokens": 1022323761.0,
|
|
"step": 11090
|
|
},
|
|
{
|
|
"entropy": 1.29921875,
|
|
"epoch": 1.5170151701517014,
|
|
"grad_norm": 0.15032117824868327,
|
|
"learning_rate": 1.2452444694941527e-06,
|
|
"loss": 1.067,
|
|
"mean_token_accuracy": 0.7387441098690033,
|
|
"num_tokens": 1023215077.0,
|
|
"step": 11100
|
|
},
|
|
{
|
|
"entropy": 1.221875,
|
|
"epoch": 1.5183818504851714,
|
|
"grad_norm": 0.11193945656166211,
|
|
"learning_rate": 1.2417218543046358e-06,
|
|
"loss": 0.9421,
|
|
"mean_token_accuracy": 0.763867849111557,
|
|
"num_tokens": 1024137735.0,
|
|
"step": 11110
|
|
},
|
|
{
|
|
"entropy": 1.1828125,
|
|
"epoch": 1.5197485308186414,
|
|
"grad_norm": 0.1231381432395944,
|
|
"learning_rate": 1.2381992391151191e-06,
|
|
"loss": 0.9377,
|
|
"mean_token_accuracy": 0.7650776684284211,
|
|
"num_tokens": 1025047579.0,
|
|
"step": 11120
|
|
},
|
|
{
|
|
"entropy": 1.20625,
|
|
"epoch": 1.5211152111521116,
|
|
"grad_norm": 0.12498699516657363,
|
|
"learning_rate": 1.2346766239256025e-06,
|
|
"loss": 0.9381,
|
|
"mean_token_accuracy": 0.7628375887870789,
|
|
"num_tokens": 1025997637.0,
|
|
"step": 11130
|
|
},
|
|
{
|
|
"entropy": 1.2015625,
|
|
"epoch": 1.5224818914855816,
|
|
"grad_norm": 0.12281870645218501,
|
|
"learning_rate": 1.2311540087360858e-06,
|
|
"loss": 0.9079,
|
|
"mean_token_accuracy": 0.7680971145629882,
|
|
"num_tokens": 1026960810.0,
|
|
"step": 11140
|
|
},
|
|
{
|
|
"entropy": 1.19140625,
|
|
"epoch": 1.5238485718190515,
|
|
"grad_norm": 0.1264037181070831,
|
|
"learning_rate": 1.2276313935465691e-06,
|
|
"loss": 0.8924,
|
|
"mean_token_accuracy": 0.7738856852054596,
|
|
"num_tokens": 1027877854.0,
|
|
"step": 11150
|
|
},
|
|
{
|
|
"entropy": 1.17578125,
|
|
"epoch": 1.5252152521525215,
|
|
"grad_norm": 0.1292567279151805,
|
|
"learning_rate": 1.2241087783570525e-06,
|
|
"loss": 0.9146,
|
|
"mean_token_accuracy": 0.7683619797229767,
|
|
"num_tokens": 1028805396.0,
|
|
"step": 11160
|
|
},
|
|
{
|
|
"entropy": 1.2140625,
|
|
"epoch": 1.5265819324859915,
|
|
"grad_norm": 0.1721906764984967,
|
|
"learning_rate": 1.2205861631675358e-06,
|
|
"loss": 0.9264,
|
|
"mean_token_accuracy": 0.7654705345630646,
|
|
"num_tokens": 1029738415.0,
|
|
"step": 11170
|
|
},
|
|
{
|
|
"entropy": 1.29765625,
|
|
"epoch": 1.5279486128194615,
|
|
"grad_norm": 0.13834474086895598,
|
|
"learning_rate": 1.217063547978019e-06,
|
|
"loss": 0.9734,
|
|
"mean_token_accuracy": 0.7564347624778748,
|
|
"num_tokens": 1030646865.0,
|
|
"step": 11180
|
|
},
|
|
{
|
|
"entropy": 1.19453125,
|
|
"epoch": 1.5293152931529317,
|
|
"grad_norm": 0.12322887581147729,
|
|
"learning_rate": 1.2135409327885023e-06,
|
|
"loss": 0.9239,
|
|
"mean_token_accuracy": 0.765785676240921,
|
|
"num_tokens": 1031564697.0,
|
|
"step": 11190
|
|
},
|
|
{
|
|
"entropy": 1.1796875,
|
|
"epoch": 1.5306819734864017,
|
|
"grad_norm": 0.11861052364852558,
|
|
"learning_rate": 1.2100183175989856e-06,
|
|
"loss": 0.903,
|
|
"mean_token_accuracy": 0.7704627394676209,
|
|
"num_tokens": 1032464705.0,
|
|
"step": 11200
|
|
},
|
|
{
|
|
"entropy": 1.171875,
|
|
"epoch": 1.5320486538198717,
|
|
"grad_norm": 0.1149932787108188,
|
|
"learning_rate": 1.206495702409469e-06,
|
|
"loss": 0.9013,
|
|
"mean_token_accuracy": 0.7710861563682556,
|
|
"num_tokens": 1033363698.0,
|
|
"step": 11210
|
|
},
|
|
{
|
|
"entropy": 1.1390625,
|
|
"epoch": 1.5334153341533416,
|
|
"grad_norm": 0.14103506454412726,
|
|
"learning_rate": 1.202973087219952e-06,
|
|
"loss": 0.8713,
|
|
"mean_token_accuracy": 0.7739573538303375,
|
|
"num_tokens": 1034287145.0,
|
|
"step": 11220
|
|
},
|
|
{
|
|
"entropy": 1.16875,
|
|
"epoch": 1.5347820144868116,
|
|
"grad_norm": 0.12956156058583926,
|
|
"learning_rate": 1.1994504720304354e-06,
|
|
"loss": 0.9347,
|
|
"mean_token_accuracy": 0.7633061110973358,
|
|
"num_tokens": 1035237499.0,
|
|
"step": 11230
|
|
},
|
|
{
|
|
"entropy": 1.18515625,
|
|
"epoch": 1.5361486948202816,
|
|
"grad_norm": 0.1343600471543389,
|
|
"learning_rate": 1.1959278568409187e-06,
|
|
"loss": 0.924,
|
|
"mean_token_accuracy": 0.7635237395763397,
|
|
"num_tokens": 1036189146.0,
|
|
"step": 11240
|
|
},
|
|
{
|
|
"entropy": 1.19140625,
|
|
"epoch": 1.5375153751537516,
|
|
"grad_norm": 0.1281386408128826,
|
|
"learning_rate": 1.192405241651402e-06,
|
|
"loss": 0.9126,
|
|
"mean_token_accuracy": 0.7663714587688446,
|
|
"num_tokens": 1037111626.0,
|
|
"step": 11250
|
|
},
|
|
{
|
|
"entropy": 1.2078125,
|
|
"epoch": 1.5388820554872216,
|
|
"grad_norm": 0.1312090611979782,
|
|
"learning_rate": 1.1888826264618854e-06,
|
|
"loss": 0.9352,
|
|
"mean_token_accuracy": 0.7631670534610748,
|
|
"num_tokens": 1038023066.0,
|
|
"step": 11260
|
|
},
|
|
{
|
|
"entropy": 1.2,
|
|
"epoch": 1.5402487358206916,
|
|
"grad_norm": 0.13010123278114416,
|
|
"learning_rate": 1.1853600112723687e-06,
|
|
"loss": 0.931,
|
|
"mean_token_accuracy": 0.7642386794090271,
|
|
"num_tokens": 1038963483.0,
|
|
"step": 11270
|
|
},
|
|
{
|
|
"entropy": 1.18046875,
|
|
"epoch": 1.5416154161541615,
|
|
"grad_norm": 0.1334251354862554,
|
|
"learning_rate": 1.181837396082852e-06,
|
|
"loss": 0.8991,
|
|
"mean_token_accuracy": 0.7710060358047486,
|
|
"num_tokens": 1039900364.0,
|
|
"step": 11280
|
|
},
|
|
{
|
|
"entropy": 1.1734375,
|
|
"epoch": 1.5429820964876315,
|
|
"grad_norm": 0.12768963763270255,
|
|
"learning_rate": 1.1783147808933352e-06,
|
|
"loss": 0.9261,
|
|
"mean_token_accuracy": 0.7668988704681396,
|
|
"num_tokens": 1040829063.0,
|
|
"step": 11290
|
|
},
|
|
{
|
|
"entropy": 1.28203125,
|
|
"epoch": 1.5443487768211015,
|
|
"grad_norm": 0.1291481016099834,
|
|
"learning_rate": 1.1747921657038185e-06,
|
|
"loss": 0.9922,
|
|
"mean_token_accuracy": 0.7515816450119018,
|
|
"num_tokens": 1041751052.0,
|
|
"step": 11300
|
|
},
|
|
{
|
|
"entropy": 1.16875,
|
|
"epoch": 1.5457154571545715,
|
|
"grad_norm": 0.12277024048909523,
|
|
"learning_rate": 1.1712695505143019e-06,
|
|
"loss": 0.8622,
|
|
"mean_token_accuracy": 0.7780764043331146,
|
|
"num_tokens": 1042647676.0,
|
|
"step": 11310
|
|
},
|
|
{
|
|
"entropy": 1.23984375,
|
|
"epoch": 1.5470821374880415,
|
|
"grad_norm": 0.13272975860309325,
|
|
"learning_rate": 1.1677469353247852e-06,
|
|
"loss": 0.9291,
|
|
"mean_token_accuracy": 0.7669274926185607,
|
|
"num_tokens": 1043516583.0,
|
|
"step": 11320
|
|
},
|
|
{
|
|
"entropy": 1.2328125,
|
|
"epoch": 1.5484488178215114,
|
|
"grad_norm": 0.12475690991891447,
|
|
"learning_rate": 1.1642243201352685e-06,
|
|
"loss": 0.9688,
|
|
"mean_token_accuracy": 0.7549090802669525,
|
|
"num_tokens": 1044470985.0,
|
|
"step": 11330
|
|
},
|
|
{
|
|
"entropy": 1.19296875,
|
|
"epoch": 1.5498154981549814,
|
|
"grad_norm": 0.1238577568009452,
|
|
"learning_rate": 1.1607017049457519e-06,
|
|
"loss": 0.9306,
|
|
"mean_token_accuracy": 0.7638805866241455,
|
|
"num_tokens": 1045407715.0,
|
|
"step": 11340
|
|
},
|
|
{
|
|
"entropy": 1.2171875,
|
|
"epoch": 1.5511821784884514,
|
|
"grad_norm": 0.13225168180575744,
|
|
"learning_rate": 1.1571790897562352e-06,
|
|
"loss": 0.9565,
|
|
"mean_token_accuracy": 0.7604785561561584,
|
|
"num_tokens": 1046300953.0,
|
|
"step": 11350
|
|
},
|
|
{
|
|
"entropy": 1.1890625,
|
|
"epoch": 1.5525488588219214,
|
|
"grad_norm": 0.13286455478997827,
|
|
"learning_rate": 1.1536564745667183e-06,
|
|
"loss": 0.913,
|
|
"mean_token_accuracy": 0.7690806329250336,
|
|
"num_tokens": 1047206230.0,
|
|
"step": 11360
|
|
},
|
|
{
|
|
"entropy": 1.2234375,
|
|
"epoch": 1.5539155391553916,
|
|
"grad_norm": 0.13678183700193697,
|
|
"learning_rate": 1.1501338593772017e-06,
|
|
"loss": 0.9361,
|
|
"mean_token_accuracy": 0.7651307225227356,
|
|
"num_tokens": 1048108612.0,
|
|
"step": 11370
|
|
},
|
|
{
|
|
"entropy": 1.24921875,
|
|
"epoch": 1.5552822194888616,
|
|
"grad_norm": 0.13146018213601576,
|
|
"learning_rate": 1.146611244187685e-06,
|
|
"loss": 0.9464,
|
|
"mean_token_accuracy": 0.7638133406639099,
|
|
"num_tokens": 1049057878.0,
|
|
"step": 11380
|
|
},
|
|
{
|
|
"entropy": 1.2015625,
|
|
"epoch": 1.5566488998223316,
|
|
"grad_norm": 0.13009558405075805,
|
|
"learning_rate": 1.1430886289981683e-06,
|
|
"loss": 0.9439,
|
|
"mean_token_accuracy": 0.7589920043945313,
|
|
"num_tokens": 1049975577.0,
|
|
"step": 11390
|
|
},
|
|
{
|
|
"entropy": 1.173828125,
|
|
"epoch": 1.5580155801558015,
|
|
"grad_norm": 0.13221579950176907,
|
|
"learning_rate": 1.1395660138086517e-06,
|
|
"loss": 0.8849,
|
|
"mean_token_accuracy": 0.7733965992927552,
|
|
"num_tokens": 1050838742.0,
|
|
"step": 11400
|
|
},
|
|
{
|
|
"entropy": 1.209375,
|
|
"epoch": 1.5593822604892715,
|
|
"grad_norm": 0.12036429644961631,
|
|
"learning_rate": 1.136043398619135e-06,
|
|
"loss": 0.898,
|
|
"mean_token_accuracy": 0.7733699202537536,
|
|
"num_tokens": 1051748442.0,
|
|
"step": 11410
|
|
},
|
|
{
|
|
"entropy": 1.2515625,
|
|
"epoch": 1.5607489408227415,
|
|
"grad_norm": 0.1292102770939563,
|
|
"learning_rate": 1.1325207834296184e-06,
|
|
"loss": 0.9636,
|
|
"mean_token_accuracy": 0.7584673941135407,
|
|
"num_tokens": 1052690851.0,
|
|
"step": 11420
|
|
},
|
|
{
|
|
"entropy": 1.1890625,
|
|
"epoch": 1.5621156211562117,
|
|
"grad_norm": 0.12973966307779897,
|
|
"learning_rate": 1.1289981682401017e-06,
|
|
"loss": 0.9107,
|
|
"mean_token_accuracy": 0.7678237676620483,
|
|
"num_tokens": 1053577690.0,
|
|
"step": 11430
|
|
},
|
|
{
|
|
"entropy": 1.21796875,
|
|
"epoch": 1.5634823014896817,
|
|
"grad_norm": 0.11727620769541819,
|
|
"learning_rate": 1.1254755530505848e-06,
|
|
"loss": 0.9243,
|
|
"mean_token_accuracy": 0.7680841326713562,
|
|
"num_tokens": 1054497466.0,
|
|
"step": 11440
|
|
},
|
|
{
|
|
"entropy": 1.23125,
|
|
"epoch": 1.5648489818231517,
|
|
"grad_norm": 0.12121544820648344,
|
|
"learning_rate": 1.1219529378610681e-06,
|
|
"loss": 0.9669,
|
|
"mean_token_accuracy": 0.7568071007728576,
|
|
"num_tokens": 1055417792.0,
|
|
"step": 11450
|
|
},
|
|
{
|
|
"entropy": 1.234375,
|
|
"epoch": 1.5662156621566217,
|
|
"grad_norm": 0.15880713534153582,
|
|
"learning_rate": 1.1184303226715515e-06,
|
|
"loss": 0.9434,
|
|
"mean_token_accuracy": 0.7613449633121491,
|
|
"num_tokens": 1056359927.0,
|
|
"step": 11460
|
|
},
|
|
{
|
|
"entropy": 1.2234375,
|
|
"epoch": 1.5675823424900917,
|
|
"grad_norm": 0.14152889058180965,
|
|
"learning_rate": 1.1149077074820346e-06,
|
|
"loss": 0.9427,
|
|
"mean_token_accuracy": 0.7621759176254272,
|
|
"num_tokens": 1057290213.0,
|
|
"step": 11470
|
|
},
|
|
{
|
|
"entropy": 1.26015625,
|
|
"epoch": 1.5689490228235616,
|
|
"grad_norm": 0.14023384465593122,
|
|
"learning_rate": 1.111385092292518e-06,
|
|
"loss": 0.9717,
|
|
"mean_token_accuracy": 0.7588331580162049,
|
|
"num_tokens": 1058200427.0,
|
|
"step": 11480
|
|
},
|
|
{
|
|
"entropy": 1.20703125,
|
|
"epoch": 1.5703157031570316,
|
|
"grad_norm": 0.12350613240853618,
|
|
"learning_rate": 1.1078624771030013e-06,
|
|
"loss": 0.9384,
|
|
"mean_token_accuracy": 0.764654129743576,
|
|
"num_tokens": 1059120981.0,
|
|
"step": 11490
|
|
},
|
|
{
|
|
"entropy": 1.22265625,
|
|
"epoch": 1.5716823834905016,
|
|
"grad_norm": 0.12074054893264295,
|
|
"learning_rate": 1.1043398619134846e-06,
|
|
"loss": 0.9495,
|
|
"mean_token_accuracy": 0.7588781535625457,
|
|
"num_tokens": 1060081905.0,
|
|
"step": 11500
|
|
},
|
|
{
|
|
"entropy": 1.23515625,
|
|
"epoch": 1.5730490638239716,
|
|
"grad_norm": 0.11542465120634525,
|
|
"learning_rate": 1.100817246723968e-06,
|
|
"loss": 0.9442,
|
|
"mean_token_accuracy": 0.7623020827770233,
|
|
"num_tokens": 1060987615.0,
|
|
"step": 11510
|
|
},
|
|
{
|
|
"entropy": 1.215625,
|
|
"epoch": 1.5744157441574416,
|
|
"grad_norm": 0.12533448809521733,
|
|
"learning_rate": 1.0972946315344513e-06,
|
|
"loss": 0.9359,
|
|
"mean_token_accuracy": 0.7644926488399506,
|
|
"num_tokens": 1061947626.0,
|
|
"step": 11520
|
|
},
|
|
{
|
|
"entropy": 1.178125,
|
|
"epoch": 1.5757824244909115,
|
|
"grad_norm": 0.13320970395809065,
|
|
"learning_rate": 1.0937720163449346e-06,
|
|
"loss": 0.9262,
|
|
"mean_token_accuracy": 0.7673975229263306,
|
|
"num_tokens": 1062853005.0,
|
|
"step": 11530
|
|
},
|
|
{
|
|
"entropy": 1.23828125,
|
|
"epoch": 1.5771491048243815,
|
|
"grad_norm": 0.12603642706512558,
|
|
"learning_rate": 1.0902494011554177e-06,
|
|
"loss": 0.947,
|
|
"mean_token_accuracy": 0.7588920950889587,
|
|
"num_tokens": 1063787432.0,
|
|
"step": 11540
|
|
},
|
|
{
|
|
"entropy": 1.20859375,
|
|
"epoch": 1.5785157851578515,
|
|
"grad_norm": 0.16128221161540401,
|
|
"learning_rate": 1.086726785965901e-06,
|
|
"loss": 0.9098,
|
|
"mean_token_accuracy": 0.7702815413475037,
|
|
"num_tokens": 1064750440.0,
|
|
"step": 11550
|
|
},
|
|
{
|
|
"entropy": 1.24453125,
|
|
"epoch": 1.5798824654913215,
|
|
"grad_norm": 0.14252403489405724,
|
|
"learning_rate": 1.0832041707763844e-06,
|
|
"loss": 0.9701,
|
|
"mean_token_accuracy": 0.7591254830360412,
|
|
"num_tokens": 1065677004.0,
|
|
"step": 11560
|
|
},
|
|
{
|
|
"entropy": 1.2390625,
|
|
"epoch": 1.5812491458247915,
|
|
"grad_norm": 0.1273795291127069,
|
|
"learning_rate": 1.0796815555868678e-06,
|
|
"loss": 0.9476,
|
|
"mean_token_accuracy": 0.7635689675807953,
|
|
"num_tokens": 1066659637.0,
|
|
"step": 11570
|
|
},
|
|
{
|
|
"entropy": 1.25,
|
|
"epoch": 1.5826158261582615,
|
|
"grad_norm": 0.11699284639894356,
|
|
"learning_rate": 1.076158940397351e-06,
|
|
"loss": 0.961,
|
|
"mean_token_accuracy": 0.7579980850219726,
|
|
"num_tokens": 1067586812.0,
|
|
"step": 11580
|
|
},
|
|
{
|
|
"entropy": 1.21171875,
|
|
"epoch": 1.5839825064917314,
|
|
"grad_norm": 0.120786582061468,
|
|
"learning_rate": 1.0726363252078344e-06,
|
|
"loss": 0.9491,
|
|
"mean_token_accuracy": 0.7643685698509216,
|
|
"num_tokens": 1068476288.0,
|
|
"step": 11590
|
|
},
|
|
{
|
|
"entropy": 1.16328125,
|
|
"epoch": 1.5853491868252014,
|
|
"grad_norm": 0.11776973618685885,
|
|
"learning_rate": 1.0691137100183178e-06,
|
|
"loss": 0.8625,
|
|
"mean_token_accuracy": 0.7806333005428314,
|
|
"num_tokens": 1069384818.0,
|
|
"step": 11600
|
|
},
|
|
{
|
|
"entropy": 1.18515625,
|
|
"epoch": 1.5867158671586716,
|
|
"grad_norm": 0.12844252880655008,
|
|
"learning_rate": 1.065591094828801e-06,
|
|
"loss": 0.9605,
|
|
"mean_token_accuracy": 0.7581315636634827,
|
|
"num_tokens": 1070358732.0,
|
|
"step": 11610
|
|
},
|
|
{
|
|
"entropy": 1.20859375,
|
|
"epoch": 1.5880825474921416,
|
|
"grad_norm": 0.12718960568829238,
|
|
"learning_rate": 1.0620684796392842e-06,
|
|
"loss": 0.9039,
|
|
"mean_token_accuracy": 0.7680591344833374,
|
|
"num_tokens": 1071225249.0,
|
|
"step": 11620
|
|
},
|
|
{
|
|
"entropy": 1.16953125,
|
|
"epoch": 1.5894492278256116,
|
|
"grad_norm": 0.13022331985167485,
|
|
"learning_rate": 1.0585458644497676e-06,
|
|
"loss": 0.8802,
|
|
"mean_token_accuracy": 0.7754882216453552,
|
|
"num_tokens": 1072105786.0,
|
|
"step": 11630
|
|
},
|
|
{
|
|
"entropy": 1.24453125,
|
|
"epoch": 1.5908159081590816,
|
|
"grad_norm": 0.11725874194525662,
|
|
"learning_rate": 1.0550232492602509e-06,
|
|
"loss": 0.941,
|
|
"mean_token_accuracy": 0.7627396523952484,
|
|
"num_tokens": 1073011100.0,
|
|
"step": 11640
|
|
},
|
|
{
|
|
"entropy": 1.23828125,
|
|
"epoch": 1.5921825884925516,
|
|
"grad_norm": 0.12593513332422487,
|
|
"learning_rate": 1.0515006340707342e-06,
|
|
"loss": 0.9398,
|
|
"mean_token_accuracy": 0.7637458801269531,
|
|
"num_tokens": 1073914349.0,
|
|
"step": 11650
|
|
},
|
|
{
|
|
"entropy": 1.1671875,
|
|
"epoch": 1.5935492688260215,
|
|
"grad_norm": 0.14185994070334518,
|
|
"learning_rate": 1.0479780188812176e-06,
|
|
"loss": 0.8896,
|
|
"mean_token_accuracy": 0.7741438746452332,
|
|
"num_tokens": 1074787847.0,
|
|
"step": 11660
|
|
},
|
|
{
|
|
"entropy": 1.19609375,
|
|
"epoch": 1.5949159491594918,
|
|
"grad_norm": 0.12978302567129363,
|
|
"learning_rate": 1.0444554036917009e-06,
|
|
"loss": 0.926,
|
|
"mean_token_accuracy": 0.7652829766273499,
|
|
"num_tokens": 1075720122.0,
|
|
"step": 11670
|
|
},
|
|
{
|
|
"entropy": 1.2359375,
|
|
"epoch": 1.5962826294929617,
|
|
"grad_norm": 0.12440998148150423,
|
|
"learning_rate": 1.0409327885021842e-06,
|
|
"loss": 0.9371,
|
|
"mean_token_accuracy": 0.7620878159999848,
|
|
"num_tokens": 1076658698.0,
|
|
"step": 11680
|
|
},
|
|
{
|
|
"entropy": 1.17109375,
|
|
"epoch": 1.5976493098264317,
|
|
"grad_norm": 0.12707459640580923,
|
|
"learning_rate": 1.0374101733126674e-06,
|
|
"loss": 0.8998,
|
|
"mean_token_accuracy": 0.7710570752620697,
|
|
"num_tokens": 1077578515.0,
|
|
"step": 11690
|
|
},
|
|
{
|
|
"entropy": 1.175,
|
|
"epoch": 1.5990159901599017,
|
|
"grad_norm": 0.13328266357262672,
|
|
"learning_rate": 1.0338875581231507e-06,
|
|
"loss": 0.899,
|
|
"mean_token_accuracy": 0.77172931432724,
|
|
"num_tokens": 1078439448.0,
|
|
"step": 11700
|
|
},
|
|
{
|
|
"entropy": 1.25546875,
|
|
"epoch": 1.6003826704933717,
|
|
"grad_norm": 0.12848259729288833,
|
|
"learning_rate": 1.030364942933634e-06,
|
|
"loss": 0.9743,
|
|
"mean_token_accuracy": 0.7556020975112915,
|
|
"num_tokens": 1079335986.0,
|
|
"step": 11710
|
|
},
|
|
{
|
|
"entropy": 1.22109375,
|
|
"epoch": 1.6017493508268417,
|
|
"grad_norm": 0.10863807624419655,
|
|
"learning_rate": 1.0268423277441174e-06,
|
|
"loss": 0.925,
|
|
"mean_token_accuracy": 0.7667730271816253,
|
|
"num_tokens": 1080224151.0,
|
|
"step": 11720
|
|
},
|
|
{
|
|
"entropy": 1.2,
|
|
"epoch": 1.6031160311603116,
|
|
"grad_norm": 0.14331105788455892,
|
|
"learning_rate": 1.0233197125546005e-06,
|
|
"loss": 0.9258,
|
|
"mean_token_accuracy": 0.7662277102470398,
|
|
"num_tokens": 1081090458.0,
|
|
"step": 11730
|
|
},
|
|
{
|
|
"entropy": 1.22109375,
|
|
"epoch": 1.6044827114937816,
|
|
"grad_norm": 0.13730097048007178,
|
|
"learning_rate": 1.0197970973650838e-06,
|
|
"loss": 0.9151,
|
|
"mean_token_accuracy": 0.7673362195491791,
|
|
"num_tokens": 1082015833.0,
|
|
"step": 11740
|
|
},
|
|
{
|
|
"entropy": 1.20859375,
|
|
"epoch": 1.6058493918272516,
|
|
"grad_norm": 0.13370501241276714,
|
|
"learning_rate": 1.0162744821755674e-06,
|
|
"loss": 0.9557,
|
|
"mean_token_accuracy": 0.761226749420166,
|
|
"num_tokens": 1082949779.0,
|
|
"step": 11750
|
|
},
|
|
{
|
|
"entropy": 1.1859375,
|
|
"epoch": 1.6072160721607216,
|
|
"grad_norm": 0.12336991279811602,
|
|
"learning_rate": 1.0127518669860505e-06,
|
|
"loss": 0.8992,
|
|
"mean_token_accuracy": 0.7722914218902588,
|
|
"num_tokens": 1083865005.0,
|
|
"step": 11760
|
|
},
|
|
{
|
|
"entropy": 1.2421875,
|
|
"epoch": 1.6085827524941916,
|
|
"grad_norm": 0.13660995855758978,
|
|
"learning_rate": 1.0092292517965338e-06,
|
|
"loss": 0.9656,
|
|
"mean_token_accuracy": 0.7589376449584961,
|
|
"num_tokens": 1084813965.0,
|
|
"step": 11770
|
|
},
|
|
{
|
|
"entropy": 1.22578125,
|
|
"epoch": 1.6099494328276616,
|
|
"grad_norm": 0.11881341696938129,
|
|
"learning_rate": 1.0057066366070172e-06,
|
|
"loss": 0.9234,
|
|
"mean_token_accuracy": 0.7665764570236206,
|
|
"num_tokens": 1085727725.0,
|
|
"step": 11780
|
|
},
|
|
{
|
|
"entropy": 1.1734375,
|
|
"epoch": 1.6113161131611315,
|
|
"grad_norm": 0.12688386065960935,
|
|
"learning_rate": 1.0021840214175005e-06,
|
|
"loss": 0.9024,
|
|
"mean_token_accuracy": 0.7722224831581116,
|
|
"num_tokens": 1086639180.0,
|
|
"step": 11790
|
|
},
|
|
{
|
|
"entropy": 1.2078125,
|
|
"epoch": 1.6126827934946015,
|
|
"grad_norm": 0.13572468121562534,
|
|
"learning_rate": 9.986614062279836e-07,
|
|
"loss": 0.9297,
|
|
"mean_token_accuracy": 0.7666550278663635,
|
|
"num_tokens": 1087573751.0,
|
|
"step": 11800
|
|
},
|
|
{
|
|
"entropy": 1.14453125,
|
|
"epoch": 1.6140494738280715,
|
|
"grad_norm": 0.19383708986811093,
|
|
"learning_rate": 9.95138791038467e-07,
|
|
"loss": 0.8827,
|
|
"mean_token_accuracy": 0.7744998812675477,
|
|
"num_tokens": 1088506212.0,
|
|
"step": 11810
|
|
},
|
|
{
|
|
"entropy": 1.1703125,
|
|
"epoch": 1.6154161541615415,
|
|
"grad_norm": 0.1282137434906949,
|
|
"learning_rate": 9.916161758489503e-07,
|
|
"loss": 0.8732,
|
|
"mean_token_accuracy": 0.7782335758209229,
|
|
"num_tokens": 1089428943.0,
|
|
"step": 11820
|
|
},
|
|
{
|
|
"entropy": 1.2234375,
|
|
"epoch": 1.6167828344950115,
|
|
"grad_norm": 0.1157233487366291,
|
|
"learning_rate": 9.880935606594336e-07,
|
|
"loss": 0.9142,
|
|
"mean_token_accuracy": 0.7689908802509308,
|
|
"num_tokens": 1090406547.0,
|
|
"step": 11830
|
|
},
|
|
{
|
|
"entropy": 1.2078125,
|
|
"epoch": 1.6181495148284815,
|
|
"grad_norm": 0.10836943925058434,
|
|
"learning_rate": 9.84570945469917e-07,
|
|
"loss": 0.905,
|
|
"mean_token_accuracy": 0.7723185420036316,
|
|
"num_tokens": 1091320300.0,
|
|
"step": 11840
|
|
},
|
|
{
|
|
"entropy": 1.22421875,
|
|
"epoch": 1.6195161951619517,
|
|
"grad_norm": 0.12472581541795665,
|
|
"learning_rate": 9.810483302804003e-07,
|
|
"loss": 0.9176,
|
|
"mean_token_accuracy": 0.7648534536361694,
|
|
"num_tokens": 1092235124.0,
|
|
"step": 11850
|
|
},
|
|
{
|
|
"entropy": 1.20078125,
|
|
"epoch": 1.6208828754954216,
|
|
"grad_norm": 0.12590495118719822,
|
|
"learning_rate": 9.775257150908836e-07,
|
|
"loss": 0.9108,
|
|
"mean_token_accuracy": 0.7681007623672486,
|
|
"num_tokens": 1093131170.0,
|
|
"step": 11860
|
|
},
|
|
{
|
|
"entropy": 1.20625,
|
|
"epoch": 1.6222495558288916,
|
|
"grad_norm": 0.1211387412269896,
|
|
"learning_rate": 9.740030999013668e-07,
|
|
"loss": 0.9255,
|
|
"mean_token_accuracy": 0.7665673851966858,
|
|
"num_tokens": 1094028259.0,
|
|
"step": 11870
|
|
},
|
|
{
|
|
"entropy": 1.1734375,
|
|
"epoch": 1.6236162361623616,
|
|
"grad_norm": 0.1314733503623722,
|
|
"learning_rate": 9.7048048471185e-07,
|
|
"loss": 0.903,
|
|
"mean_token_accuracy": 0.7693950116634369,
|
|
"num_tokens": 1094923700.0,
|
|
"step": 11880
|
|
},
|
|
{
|
|
"entropy": 1.2265625,
|
|
"epoch": 1.6249829164958316,
|
|
"grad_norm": 0.11686688318022745,
|
|
"learning_rate": 9.669578695223334e-07,
|
|
"loss": 0.9716,
|
|
"mean_token_accuracy": 0.7580091178417205,
|
|
"num_tokens": 1095863029.0,
|
|
"step": 11890
|
|
},
|
|
{
|
|
"entropy": 1.209375,
|
|
"epoch": 1.6263495968293016,
|
|
"grad_norm": 0.13473211787087547,
|
|
"learning_rate": 9.634352543328168e-07,
|
|
"loss": 0.9412,
|
|
"mean_token_accuracy": 0.7622395634651185,
|
|
"num_tokens": 1096756795.0,
|
|
"step": 11900
|
|
},
|
|
{
|
|
"entropy": 1.2078125,
|
|
"epoch": 1.6277162771627718,
|
|
"grad_norm": 0.13728260068042022,
|
|
"learning_rate": 9.599126391433e-07,
|
|
"loss": 0.9009,
|
|
"mean_token_accuracy": 0.7708010375499725,
|
|
"num_tokens": 1097677930.0,
|
|
"step": 11910
|
|
},
|
|
{
|
|
"entropy": 1.221875,
|
|
"epoch": 1.6290829574962418,
|
|
"grad_norm": 0.13191800080806332,
|
|
"learning_rate": 9.563900239537834e-07,
|
|
"loss": 0.9405,
|
|
"mean_token_accuracy": 0.7622904360294342,
|
|
"num_tokens": 1098586303.0,
|
|
"step": 11920
|
|
},
|
|
{
|
|
"entropy": 1.17265625,
|
|
"epoch": 1.6304496378297118,
|
|
"grad_norm": 0.1358107658414752,
|
|
"learning_rate": 9.528674087642667e-07,
|
|
"loss": 0.9004,
|
|
"mean_token_accuracy": 0.770546293258667,
|
|
"num_tokens": 1099532417.0,
|
|
"step": 11930
|
|
},
|
|
{
|
|
"entropy": 1.17421875,
|
|
"epoch": 1.6318163181631817,
|
|
"grad_norm": 0.1203966247980277,
|
|
"learning_rate": 9.4934479357475e-07,
|
|
"loss": 0.8889,
|
|
"mean_token_accuracy": 0.7752755165100098,
|
|
"num_tokens": 1100461088.0,
|
|
"step": 11940
|
|
},
|
|
{
|
|
"entropy": 1.23828125,
|
|
"epoch": 1.6331829984966517,
|
|
"grad_norm": 0.117605590393351,
|
|
"learning_rate": 9.458221783852332e-07,
|
|
"loss": 0.9666,
|
|
"mean_token_accuracy": 0.7562149643898011,
|
|
"num_tokens": 1101423253.0,
|
|
"step": 11950
|
|
},
|
|
{
|
|
"entropy": 1.19609375,
|
|
"epoch": 1.6345496788301217,
|
|
"grad_norm": 0.1367962517100346,
|
|
"learning_rate": 9.422995631957166e-07,
|
|
"loss": 0.926,
|
|
"mean_token_accuracy": 0.7661690294742585,
|
|
"num_tokens": 1102306270.0,
|
|
"step": 11960
|
|
},
|
|
{
|
|
"entropy": 1.23984375,
|
|
"epoch": 1.6359163591635917,
|
|
"grad_norm": 0.12456767606066182,
|
|
"learning_rate": 9.387769480061999e-07,
|
|
"loss": 0.9699,
|
|
"mean_token_accuracy": 0.7593792080879211,
|
|
"num_tokens": 1103221346.0,
|
|
"step": 11970
|
|
},
|
|
{
|
|
"entropy": 1.221875,
|
|
"epoch": 1.6372830394970617,
|
|
"grad_norm": 0.11686059028396484,
|
|
"learning_rate": 9.352543328166831e-07,
|
|
"loss": 0.9121,
|
|
"mean_token_accuracy": 0.7680422067642212,
|
|
"num_tokens": 1104181732.0,
|
|
"step": 11980
|
|
},
|
|
{
|
|
"entropy": 1.203125,
|
|
"epoch": 1.6386497198305316,
|
|
"grad_norm": 0.10595851213096125,
|
|
"learning_rate": 9.317317176271665e-07,
|
|
"loss": 0.9208,
|
|
"mean_token_accuracy": 0.7686156928539276,
|
|
"num_tokens": 1105059442.0,
|
|
"step": 11990
|
|
},
|
|
{
|
|
"entropy": 1.24765625,
|
|
"epoch": 1.6400164001640016,
|
|
"grad_norm": 1.43634714705683,
|
|
"learning_rate": 9.282091024376498e-07,
|
|
"loss": 0.9825,
|
|
"mean_token_accuracy": 0.7538778483867645,
|
|
"num_tokens": 1106044386.0,
|
|
"step": 12000
|
|
},
|
|
{
|
|
"entropy": 1.2609375,
|
|
"epoch": 1.6413830804974716,
|
|
"grad_norm": 0.14111977419140945,
|
|
"learning_rate": 9.246864872481331e-07,
|
|
"loss": 0.9976,
|
|
"mean_token_accuracy": 0.747274112701416,
|
|
"num_tokens": 1106934899.0,
|
|
"step": 12010
|
|
},
|
|
{
|
|
"entropy": 1.21328125,
|
|
"epoch": 1.6427497608309416,
|
|
"grad_norm": 0.13815130945106538,
|
|
"learning_rate": 9.211638720586164e-07,
|
|
"loss": 0.9197,
|
|
"mean_token_accuracy": 0.7658091723918915,
|
|
"num_tokens": 1107816336.0,
|
|
"step": 12020
|
|
},
|
|
{
|
|
"entropy": 1.18671875,
|
|
"epoch": 1.6441164411644116,
|
|
"grad_norm": 0.14285071785063952,
|
|
"learning_rate": 9.176412568690997e-07,
|
|
"loss": 0.9107,
|
|
"mean_token_accuracy": 0.7687567055225373,
|
|
"num_tokens": 1108734573.0,
|
|
"step": 12030
|
|
},
|
|
{
|
|
"entropy": 1.22890625,
|
|
"epoch": 1.6454831214978816,
|
|
"grad_norm": 0.12842967664016428,
|
|
"learning_rate": 9.14118641679583e-07,
|
|
"loss": 0.9629,
|
|
"mean_token_accuracy": 0.7584052681922913,
|
|
"num_tokens": 1109676722.0,
|
|
"step": 12040
|
|
},
|
|
{
|
|
"entropy": 1.171875,
|
|
"epoch": 1.6468498018313515,
|
|
"grad_norm": 0.14599847378584294,
|
|
"learning_rate": 9.105960264900663e-07,
|
|
"loss": 0.9459,
|
|
"mean_token_accuracy": 0.7611031532287598,
|
|
"num_tokens": 1110551599.0,
|
|
"step": 12050
|
|
},
|
|
{
|
|
"entropy": 1.20625,
|
|
"epoch": 1.6482164821648215,
|
|
"grad_norm": 0.12309561581550811,
|
|
"learning_rate": 9.070734113005496e-07,
|
|
"loss": 0.9291,
|
|
"mean_token_accuracy": 0.7674174189567566,
|
|
"num_tokens": 1111515604.0,
|
|
"step": 12060
|
|
},
|
|
{
|
|
"entropy": 1.27421875,
|
|
"epoch": 1.6495831624982915,
|
|
"grad_norm": 0.12794771132115046,
|
|
"learning_rate": 9.035507961110329e-07,
|
|
"loss": 0.9761,
|
|
"mean_token_accuracy": 0.7560035645961761,
|
|
"num_tokens": 1112423455.0,
|
|
"step": 12070
|
|
},
|
|
{
|
|
"entropy": 1.17890625,
|
|
"epoch": 1.6509498428317615,
|
|
"grad_norm": 0.1360575225722281,
|
|
"learning_rate": 9.000281809215163e-07,
|
|
"loss": 0.9091,
|
|
"mean_token_accuracy": 0.7674163222312927,
|
|
"num_tokens": 1113335564.0,
|
|
"step": 12080
|
|
},
|
|
{
|
|
"entropy": 1.1859375,
|
|
"epoch": 1.6523165231652317,
|
|
"grad_norm": 0.13802885233667436,
|
|
"learning_rate": 8.965055657319995e-07,
|
|
"loss": 0.9171,
|
|
"mean_token_accuracy": 0.769185996055603,
|
|
"num_tokens": 1114248853.0,
|
|
"step": 12090
|
|
},
|
|
{
|
|
"entropy": 1.1828125,
|
|
"epoch": 1.6536832034987017,
|
|
"grad_norm": 0.1229451240457286,
|
|
"learning_rate": 8.929829505424828e-07,
|
|
"loss": 0.9239,
|
|
"mean_token_accuracy": 0.7677403807640075,
|
|
"num_tokens": 1115170986.0,
|
|
"step": 12100
|
|
},
|
|
{
|
|
"entropy": 1.178125,
|
|
"epoch": 1.6550498838321717,
|
|
"grad_norm": 0.1296712290966077,
|
|
"learning_rate": 8.894603353529662e-07,
|
|
"loss": 0.8915,
|
|
"mean_token_accuracy": 0.7721932649612426,
|
|
"num_tokens": 1116084505.0,
|
|
"step": 12110
|
|
},
|
|
{
|
|
"entropy": 1.1765625,
|
|
"epoch": 1.6564165641656416,
|
|
"grad_norm": 0.12602711085084994,
|
|
"learning_rate": 8.859377201634495e-07,
|
|
"loss": 0.9018,
|
|
"mean_token_accuracy": 0.7702773988246918,
|
|
"num_tokens": 1117045714.0,
|
|
"step": 12120
|
|
},
|
|
{
|
|
"entropy": 1.26875,
|
|
"epoch": 1.6577832444991116,
|
|
"grad_norm": 0.11971487771891143,
|
|
"learning_rate": 8.824151049739326e-07,
|
|
"loss": 0.9831,
|
|
"mean_token_accuracy": 0.752328735589981,
|
|
"num_tokens": 1117981222.0,
|
|
"step": 12130
|
|
},
|
|
{
|
|
"entropy": 1.16171875,
|
|
"epoch": 1.6591499248325816,
|
|
"grad_norm": 0.1296061724196654,
|
|
"learning_rate": 8.788924897844161e-07,
|
|
"loss": 0.8881,
|
|
"mean_token_accuracy": 0.7739622235298157,
|
|
"num_tokens": 1118933735.0,
|
|
"step": 12140
|
|
},
|
|
{
|
|
"entropy": 1.17890625,
|
|
"epoch": 1.6605166051660518,
|
|
"grad_norm": 0.151702714578363,
|
|
"learning_rate": 8.753698745948994e-07,
|
|
"loss": 0.8983,
|
|
"mean_token_accuracy": 0.7702127456665039,
|
|
"num_tokens": 1119881597.0,
|
|
"step": 12150
|
|
},
|
|
{
|
|
"entropy": 1.18359375,
|
|
"epoch": 1.6618832854995218,
|
|
"grad_norm": 0.14813481992390812,
|
|
"learning_rate": 8.718472594053825e-07,
|
|
"loss": 0.8993,
|
|
"mean_token_accuracy": 0.7696377873420716,
|
|
"num_tokens": 1120754762.0,
|
|
"step": 12160
|
|
},
|
|
{
|
|
"entropy": 1.196875,
|
|
"epoch": 1.6632499658329918,
|
|
"grad_norm": 0.1381342140735254,
|
|
"learning_rate": 8.683246442158659e-07,
|
|
"loss": 0.9403,
|
|
"mean_token_accuracy": 0.7644879281520843,
|
|
"num_tokens": 1121650333.0,
|
|
"step": 12170
|
|
},
|
|
{
|
|
"entropy": 1.1640625,
|
|
"epoch": 1.6646166461664618,
|
|
"grad_norm": 0.12154920711188973,
|
|
"learning_rate": 8.648020290263492e-07,
|
|
"loss": 0.8907,
|
|
"mean_token_accuracy": 0.7729826807975769,
|
|
"num_tokens": 1122528769.0,
|
|
"step": 12180
|
|
},
|
|
{
|
|
"entropy": 1.24453125,
|
|
"epoch": 1.6659833264999317,
|
|
"grad_norm": 0.13126018585181695,
|
|
"learning_rate": 8.612794138368325e-07,
|
|
"loss": 0.9223,
|
|
"mean_token_accuracy": 0.7679607331752777,
|
|
"num_tokens": 1123462286.0,
|
|
"step": 12190
|
|
},
|
|
{
|
|
"entropy": 1.228125,
|
|
"epoch": 1.6673500068334017,
|
|
"grad_norm": 0.14165187897979584,
|
|
"learning_rate": 8.577567986473158e-07,
|
|
"loss": 0.9203,
|
|
"mean_token_accuracy": 0.7679384589195252,
|
|
"num_tokens": 1124351062.0,
|
|
"step": 12200
|
|
},
|
|
{
|
|
"entropy": 1.1890625,
|
|
"epoch": 1.6687166871668717,
|
|
"grad_norm": 0.13639302057156227,
|
|
"learning_rate": 8.542341834577991e-07,
|
|
"loss": 0.9061,
|
|
"mean_token_accuracy": 0.7706725537776947,
|
|
"num_tokens": 1125252725.0,
|
|
"step": 12210
|
|
},
|
|
{
|
|
"entropy": 1.18125,
|
|
"epoch": 1.6700833675003417,
|
|
"grad_norm": 0.12897899045773525,
|
|
"learning_rate": 8.507115682682824e-07,
|
|
"loss": 0.9194,
|
|
"mean_token_accuracy": 0.7687949776649475,
|
|
"num_tokens": 1126153510.0,
|
|
"step": 12220
|
|
},
|
|
{
|
|
"entropy": 1.24765625,
|
|
"epoch": 1.6714500478338117,
|
|
"grad_norm": 0.1402271365683893,
|
|
"learning_rate": 8.471889530787658e-07,
|
|
"loss": 0.9808,
|
|
"mean_token_accuracy": 0.7577130377292634,
|
|
"num_tokens": 1127109059.0,
|
|
"step": 12230
|
|
},
|
|
{
|
|
"entropy": 1.1859375,
|
|
"epoch": 1.6728167281672817,
|
|
"grad_norm": 0.12097549804934699,
|
|
"learning_rate": 8.43666337889249e-07,
|
|
"loss": 0.9034,
|
|
"mean_token_accuracy": 0.7709527254104614,
|
|
"num_tokens": 1128016887.0,
|
|
"step": 12240
|
|
},
|
|
{
|
|
"entropy": 1.2125,
|
|
"epoch": 1.6741834085007516,
|
|
"grad_norm": 0.1268549112643489,
|
|
"learning_rate": 8.401437226997323e-07,
|
|
"loss": 0.9302,
|
|
"mean_token_accuracy": 0.7658470153808594,
|
|
"num_tokens": 1128956830.0,
|
|
"step": 12250
|
|
},
|
|
{
|
|
"entropy": 1.2015625,
|
|
"epoch": 1.6755500888342216,
|
|
"grad_norm": 0.1313965074085617,
|
|
"learning_rate": 8.366211075102157e-07,
|
|
"loss": 0.9101,
|
|
"mean_token_accuracy": 0.7696449339389801,
|
|
"num_tokens": 1129818746.0,
|
|
"step": 12260
|
|
},
|
|
{
|
|
"entropy": 1.21796875,
|
|
"epoch": 1.6769167691676916,
|
|
"grad_norm": 0.14383934798826045,
|
|
"learning_rate": 8.330984923206989e-07,
|
|
"loss": 0.9055,
|
|
"mean_token_accuracy": 0.7710904955863953,
|
|
"num_tokens": 1130763820.0,
|
|
"step": 12270
|
|
},
|
|
{
|
|
"entropy": 1.24296875,
|
|
"epoch": 1.6782834495011616,
|
|
"grad_norm": 0.1395575932220485,
|
|
"learning_rate": 8.295758771311822e-07,
|
|
"loss": 0.9428,
|
|
"mean_token_accuracy": 0.7619445979595184,
|
|
"num_tokens": 1131629965.0,
|
|
"step": 12280
|
|
},
|
|
{
|
|
"entropy": 1.24453125,
|
|
"epoch": 1.6796501298346316,
|
|
"grad_norm": 0.11704948230584691,
|
|
"learning_rate": 8.260532619416656e-07,
|
|
"loss": 0.9696,
|
|
"mean_token_accuracy": 0.7584838092327117,
|
|
"num_tokens": 1132518569.0,
|
|
"step": 12290
|
|
},
|
|
{
|
|
"entropy": 1.20234375,
|
|
"epoch": 1.6810168101681016,
|
|
"grad_norm": 0.1186304357821388,
|
|
"learning_rate": 8.225306467521489e-07,
|
|
"loss": 0.8944,
|
|
"mean_token_accuracy": 0.7734035670757293,
|
|
"num_tokens": 1133438822.0,
|
|
"step": 12300
|
|
},
|
|
{
|
|
"entropy": 1.234375,
|
|
"epoch": 1.6823834905015715,
|
|
"grad_norm": 0.1425383981934193,
|
|
"learning_rate": 8.190080315626321e-07,
|
|
"loss": 0.9397,
|
|
"mean_token_accuracy": 0.7628993988037109,
|
|
"num_tokens": 1134328980.0,
|
|
"step": 12310
|
|
},
|
|
{
|
|
"entropy": 1.2078125,
|
|
"epoch": 1.6837501708350415,
|
|
"grad_norm": 0.11631265095678524,
|
|
"learning_rate": 8.154854163731155e-07,
|
|
"loss": 0.929,
|
|
"mean_token_accuracy": 0.7661648035049439,
|
|
"num_tokens": 1135276317.0,
|
|
"step": 12320
|
|
},
|
|
{
|
|
"entropy": 1.21640625,
|
|
"epoch": 1.6851168511685117,
|
|
"grad_norm": 0.1300374112607664,
|
|
"learning_rate": 8.119628011835988e-07,
|
|
"loss": 0.9368,
|
|
"mean_token_accuracy": 0.7620457231998443,
|
|
"num_tokens": 1136184171.0,
|
|
"step": 12330
|
|
},
|
|
{
|
|
"entropy": 1.2015625,
|
|
"epoch": 1.6864835315019817,
|
|
"grad_norm": 0.13561021742597287,
|
|
"learning_rate": 8.084401859940821e-07,
|
|
"loss": 0.9072,
|
|
"mean_token_accuracy": 0.7690032064914704,
|
|
"num_tokens": 1137077060.0,
|
|
"step": 12340
|
|
},
|
|
{
|
|
"entropy": 1.228125,
|
|
"epoch": 1.6878502118354517,
|
|
"grad_norm": 0.1276401996092322,
|
|
"learning_rate": 8.049175708045654e-07,
|
|
"loss": 0.9532,
|
|
"mean_token_accuracy": 0.7610952913761139,
|
|
"num_tokens": 1138011756.0,
|
|
"step": 12350
|
|
},
|
|
{
|
|
"entropy": 1.159375,
|
|
"epoch": 1.6892168921689217,
|
|
"grad_norm": 0.11603325310918333,
|
|
"learning_rate": 8.013949556150487e-07,
|
|
"loss": 0.9146,
|
|
"mean_token_accuracy": 0.7675764441490174,
|
|
"num_tokens": 1138882799.0,
|
|
"step": 12360
|
|
},
|
|
{
|
|
"entropy": 1.1796875,
|
|
"epoch": 1.6905835725023917,
|
|
"grad_norm": 0.13044724950524766,
|
|
"learning_rate": 7.97872340425532e-07,
|
|
"loss": 0.9044,
|
|
"mean_token_accuracy": 0.771090817451477,
|
|
"num_tokens": 1139811495.0,
|
|
"step": 12370
|
|
},
|
|
{
|
|
"entropy": 1.21640625,
|
|
"epoch": 1.6919502528358616,
|
|
"grad_norm": 0.1563544080401356,
|
|
"learning_rate": 7.943497252360153e-07,
|
|
"loss": 0.9635,
|
|
"mean_token_accuracy": 0.7582116067409516,
|
|
"num_tokens": 1140709141.0,
|
|
"step": 12380
|
|
},
|
|
{
|
|
"entropy": 1.22421875,
|
|
"epoch": 1.6933169331693319,
|
|
"grad_norm": 0.12850341825045053,
|
|
"learning_rate": 7.908271100464986e-07,
|
|
"loss": 0.9968,
|
|
"mean_token_accuracy": 0.7490311801433563,
|
|
"num_tokens": 1141666241.0,
|
|
"step": 12390
|
|
},
|
|
{
|
|
"entropy": 1.2046875,
|
|
"epoch": 1.6946836135028018,
|
|
"grad_norm": 0.16064495419475291,
|
|
"learning_rate": 7.873044948569819e-07,
|
|
"loss": 0.9284,
|
|
"mean_token_accuracy": 0.7663457453250885,
|
|
"num_tokens": 1142589674.0,
|
|
"step": 12400
|
|
},
|
|
{
|
|
"entropy": 1.23203125,
|
|
"epoch": 1.6960502938362718,
|
|
"grad_norm": 0.12736530929263523,
|
|
"learning_rate": 7.837818796674653e-07,
|
|
"loss": 0.9256,
|
|
"mean_token_accuracy": 0.7662094354629516,
|
|
"num_tokens": 1143515741.0,
|
|
"step": 12410
|
|
},
|
|
{
|
|
"entropy": 1.21171875,
|
|
"epoch": 1.6974169741697418,
|
|
"grad_norm": 0.15617010754509186,
|
|
"learning_rate": 7.802592644779484e-07,
|
|
"loss": 0.9015,
|
|
"mean_token_accuracy": 0.767481940984726,
|
|
"num_tokens": 1144476154.0,
|
|
"step": 12420
|
|
},
|
|
{
|
|
"entropy": 1.2125,
|
|
"epoch": 1.6987836545032118,
|
|
"grad_norm": 0.12265411504648796,
|
|
"learning_rate": 7.767366492884317e-07,
|
|
"loss": 0.9377,
|
|
"mean_token_accuracy": 0.7619780480861664,
|
|
"num_tokens": 1145381719.0,
|
|
"step": 12430
|
|
},
|
|
{
|
|
"entropy": 1.20703125,
|
|
"epoch": 1.7001503348366818,
|
|
"grad_norm": 0.13499873179416702,
|
|
"learning_rate": 7.732140340989152e-07,
|
|
"loss": 0.9346,
|
|
"mean_token_accuracy": 0.7638030230998993,
|
|
"num_tokens": 1146340891.0,
|
|
"step": 12440
|
|
},
|
|
{
|
|
"entropy": 1.21640625,
|
|
"epoch": 1.7015170151701517,
|
|
"grad_norm": 0.13289657501788,
|
|
"learning_rate": 7.696914189093985e-07,
|
|
"loss": 0.9132,
|
|
"mean_token_accuracy": 0.7685869932174683,
|
|
"num_tokens": 1147258008.0,
|
|
"step": 12450
|
|
},
|
|
{
|
|
"entropy": 1.19609375,
|
|
"epoch": 1.7028836955036217,
|
|
"grad_norm": 0.10675297803467935,
|
|
"learning_rate": 7.661688037198816e-07,
|
|
"loss": 0.9193,
|
|
"mean_token_accuracy": 0.7674954175949097,
|
|
"num_tokens": 1148193464.0,
|
|
"step": 12460
|
|
},
|
|
{
|
|
"entropy": 1.16953125,
|
|
"epoch": 1.7042503758370917,
|
|
"grad_norm": 0.12280051583360319,
|
|
"learning_rate": 7.62646188530365e-07,
|
|
"loss": 0.8764,
|
|
"mean_token_accuracy": 0.775999927520752,
|
|
"num_tokens": 1149101520.0,
|
|
"step": 12470
|
|
},
|
|
{
|
|
"entropy": 1.16015625,
|
|
"epoch": 1.7056170561705617,
|
|
"grad_norm": 0.11863826845171871,
|
|
"learning_rate": 7.591235733408483e-07,
|
|
"loss": 0.8872,
|
|
"mean_token_accuracy": 0.7731276154518127,
|
|
"num_tokens": 1150032174.0,
|
|
"step": 12480
|
|
},
|
|
{
|
|
"entropy": 1.1671875,
|
|
"epoch": 1.7069837365040317,
|
|
"grad_norm": 0.13165291243236615,
|
|
"learning_rate": 7.556009581513315e-07,
|
|
"loss": 0.8962,
|
|
"mean_token_accuracy": 0.7707676827907562,
|
|
"num_tokens": 1150946452.0,
|
|
"step": 12490
|
|
},
|
|
{
|
|
"entropy": 1.15546875,
|
|
"epoch": 1.7083504168375017,
|
|
"grad_norm": 0.1170586919161574,
|
|
"learning_rate": 7.520783429618149e-07,
|
|
"loss": 0.8643,
|
|
"mean_token_accuracy": 0.7784387648105622,
|
|
"num_tokens": 1151896671.0,
|
|
"step": 12500
|
|
},
|
|
{
|
|
"entropy": 1.17734375,
|
|
"epoch": 1.7097170971709716,
|
|
"grad_norm": 0.12237125967118319,
|
|
"learning_rate": 7.485557277722982e-07,
|
|
"loss": 0.9169,
|
|
"mean_token_accuracy": 0.7694368124008178,
|
|
"num_tokens": 1152824715.0,
|
|
"step": 12510
|
|
},
|
|
{
|
|
"entropy": 1.20625,
|
|
"epoch": 1.7110837775044416,
|
|
"grad_norm": 0.12789846083605808,
|
|
"learning_rate": 7.450331125827815e-07,
|
|
"loss": 0.9329,
|
|
"mean_token_accuracy": 0.7644328653812409,
|
|
"num_tokens": 1153754394.0,
|
|
"step": 12520
|
|
},
|
|
{
|
|
"entropy": 1.22578125,
|
|
"epoch": 1.7124504578379116,
|
|
"grad_norm": 0.1461059410602623,
|
|
"learning_rate": 7.415104973932648e-07,
|
|
"loss": 0.9328,
|
|
"mean_token_accuracy": 0.7638454079627991,
|
|
"num_tokens": 1154689577.0,
|
|
"step": 12530
|
|
},
|
|
{
|
|
"entropy": 1.16875,
|
|
"epoch": 1.7138171381713816,
|
|
"grad_norm": 0.13263712736753286,
|
|
"learning_rate": 7.379878822037481e-07,
|
|
"loss": 0.8607,
|
|
"mean_token_accuracy": 0.7780575633049012,
|
|
"num_tokens": 1155551569.0,
|
|
"step": 12540
|
|
},
|
|
{
|
|
"entropy": 1.253125,
|
|
"epoch": 1.7151838185048516,
|
|
"grad_norm": 0.12578562794545825,
|
|
"learning_rate": 7.344652670142314e-07,
|
|
"loss": 0.9708,
|
|
"mean_token_accuracy": 0.756470364332199,
|
|
"num_tokens": 1156477388.0,
|
|
"step": 12550
|
|
},
|
|
{
|
|
"entropy": 1.2359375,
|
|
"epoch": 1.7165504988383216,
|
|
"grad_norm": 0.12069774960461303,
|
|
"learning_rate": 7.309426518247147e-07,
|
|
"loss": 0.9548,
|
|
"mean_token_accuracy": 0.7610702753067017,
|
|
"num_tokens": 1157425461.0,
|
|
"step": 12560
|
|
},
|
|
{
|
|
"entropy": 1.20234375,
|
|
"epoch": 1.7179171791717918,
|
|
"grad_norm": 0.1263528050689517,
|
|
"learning_rate": 7.27420036635198e-07,
|
|
"loss": 0.9343,
|
|
"mean_token_accuracy": 0.7649417757987976,
|
|
"num_tokens": 1158324127.0,
|
|
"step": 12570
|
|
},
|
|
{
|
|
"entropy": 1.2265625,
|
|
"epoch": 1.7192838595052617,
|
|
"grad_norm": 0.1287917960100804,
|
|
"learning_rate": 7.238974214456813e-07,
|
|
"loss": 0.9589,
|
|
"mean_token_accuracy": 0.7573458015918731,
|
|
"num_tokens": 1159272953.0,
|
|
"step": 12580
|
|
},
|
|
{
|
|
"entropy": 1.21171875,
|
|
"epoch": 1.7206505398387317,
|
|
"grad_norm": 0.1399354616562198,
|
|
"learning_rate": 7.203748062561647e-07,
|
|
"loss": 0.8977,
|
|
"mean_token_accuracy": 0.7736380279064179,
|
|
"num_tokens": 1160260224.0,
|
|
"step": 12590
|
|
},
|
|
{
|
|
"entropy": 1.2171875,
|
|
"epoch": 1.7220172201722017,
|
|
"grad_norm": 0.11925639855489209,
|
|
"learning_rate": 7.168521910666479e-07,
|
|
"loss": 0.9606,
|
|
"mean_token_accuracy": 0.7612979531288147,
|
|
"num_tokens": 1161175028.0,
|
|
"step": 12600
|
|
},
|
|
{
|
|
"entropy": 1.1765625,
|
|
"epoch": 1.7233839005056717,
|
|
"grad_norm": 0.12036452515211553,
|
|
"learning_rate": 7.133295758771312e-07,
|
|
"loss": 0.9347,
|
|
"mean_token_accuracy": 0.7640786528587341,
|
|
"num_tokens": 1162096312.0,
|
|
"step": 12610
|
|
},
|
|
{
|
|
"entropy": 1.175,
|
|
"epoch": 1.7247505808391417,
|
|
"grad_norm": 0.14532594307585128,
|
|
"learning_rate": 7.098069606876146e-07,
|
|
"loss": 0.9267,
|
|
"mean_token_accuracy": 0.7656041383743286,
|
|
"num_tokens": 1163006874.0,
|
|
"step": 12620
|
|
},
|
|
{
|
|
"entropy": 1.17109375,
|
|
"epoch": 1.7261172611726119,
|
|
"grad_norm": 0.13653366505226824,
|
|
"learning_rate": 7.062843454980979e-07,
|
|
"loss": 0.8997,
|
|
"mean_token_accuracy": 0.7734785377979279,
|
|
"num_tokens": 1163898479.0,
|
|
"step": 12630
|
|
},
|
|
{
|
|
"entropy": 1.18984375,
|
|
"epoch": 1.7274839415060819,
|
|
"grad_norm": 0.11664179681237082,
|
|
"learning_rate": 7.027617303085811e-07,
|
|
"loss": 0.9058,
|
|
"mean_token_accuracy": 0.7710206925868988,
|
|
"num_tokens": 1164832463.0,
|
|
"step": 12640
|
|
},
|
|
{
|
|
"entropy": 1.2046875,
|
|
"epoch": 1.7288506218395518,
|
|
"grad_norm": 0.1331217230388777,
|
|
"learning_rate": 6.992391151190645e-07,
|
|
"loss": 0.9031,
|
|
"mean_token_accuracy": 0.7710935473442078,
|
|
"num_tokens": 1165759891.0,
|
|
"step": 12650
|
|
},
|
|
{
|
|
"entropy": 1.24453125,
|
|
"epoch": 1.7302173021730218,
|
|
"grad_norm": 0.13784760330787327,
|
|
"learning_rate": 6.957164999295478e-07,
|
|
"loss": 0.9568,
|
|
"mean_token_accuracy": 0.7584407389163971,
|
|
"num_tokens": 1166637908.0,
|
|
"step": 12660
|
|
},
|
|
{
|
|
"entropy": 1.190625,
|
|
"epoch": 1.7315839825064918,
|
|
"grad_norm": 0.1324190587651991,
|
|
"learning_rate": 6.921938847400309e-07,
|
|
"loss": 0.9412,
|
|
"mean_token_accuracy": 0.7620978355407715,
|
|
"num_tokens": 1167516841.0,
|
|
"step": 12670
|
|
},
|
|
{
|
|
"entropy": 1.2171875,
|
|
"epoch": 1.7329506628399618,
|
|
"grad_norm": 0.12522183808764628,
|
|
"learning_rate": 6.886712695505144e-07,
|
|
"loss": 0.9384,
|
|
"mean_token_accuracy": 0.7657455861568451,
|
|
"num_tokens": 1168460886.0,
|
|
"step": 12680
|
|
},
|
|
{
|
|
"entropy": 1.2640625,
|
|
"epoch": 1.7343173431734318,
|
|
"grad_norm": 0.12989934699493078,
|
|
"learning_rate": 6.851486543609977e-07,
|
|
"loss": 0.9734,
|
|
"mean_token_accuracy": 0.7565818309783936,
|
|
"num_tokens": 1169394534.0,
|
|
"step": 12690
|
|
},
|
|
{
|
|
"entropy": 1.21640625,
|
|
"epoch": 1.7356840235069018,
|
|
"grad_norm": 0.15740003058551089,
|
|
"learning_rate": 6.816260391714811e-07,
|
|
"loss": 0.9318,
|
|
"mean_token_accuracy": 0.7635848760604859,
|
|
"num_tokens": 1170303680.0,
|
|
"step": 12700
|
|
},
|
|
{
|
|
"entropy": 1.2265625,
|
|
"epoch": 1.7370507038403717,
|
|
"grad_norm": 0.1371409791675767,
|
|
"learning_rate": 6.781034239819642e-07,
|
|
"loss": 0.9492,
|
|
"mean_token_accuracy": 0.7609656929969788,
|
|
"num_tokens": 1171227000.0,
|
|
"step": 12710
|
|
},
|
|
{
|
|
"entropy": 1.212890625,
|
|
"epoch": 1.7384173841738417,
|
|
"grad_norm": 0.13198018053185645,
|
|
"learning_rate": 6.745808087924475e-07,
|
|
"loss": 0.9164,
|
|
"mean_token_accuracy": 0.7662020921707153,
|
|
"num_tokens": 1172133800.0,
|
|
"step": 12720
|
|
},
|
|
{
|
|
"entropy": 1.2390625,
|
|
"epoch": 1.7397840645073117,
|
|
"grad_norm": 0.1326278903150873,
|
|
"learning_rate": 6.710581936029308e-07,
|
|
"loss": 0.9288,
|
|
"mean_token_accuracy": 0.7643956005573272,
|
|
"num_tokens": 1173036861.0,
|
|
"step": 12730
|
|
},
|
|
{
|
|
"entropy": 1.2109375,
|
|
"epoch": 1.7411507448407817,
|
|
"grad_norm": 0.1266096347782323,
|
|
"learning_rate": 6.675355784134143e-07,
|
|
"loss": 0.9206,
|
|
"mean_token_accuracy": 0.7667069911956788,
|
|
"num_tokens": 1173992989.0,
|
|
"step": 12740
|
|
},
|
|
{
|
|
"entropy": 1.2046875,
|
|
"epoch": 1.7425174251742517,
|
|
"grad_norm": 0.12592951404676742,
|
|
"learning_rate": 6.640129632238974e-07,
|
|
"loss": 0.9003,
|
|
"mean_token_accuracy": 0.7730505287647247,
|
|
"num_tokens": 1174911081.0,
|
|
"step": 12750
|
|
},
|
|
{
|
|
"entropy": 1.23046875,
|
|
"epoch": 1.7438841055077217,
|
|
"grad_norm": 0.12666608566996485,
|
|
"learning_rate": 6.604903480343807e-07,
|
|
"loss": 0.913,
|
|
"mean_token_accuracy": 0.7667344033718109,
|
|
"num_tokens": 1175854085.0,
|
|
"step": 12760
|
|
},
|
|
{
|
|
"entropy": 1.1828125,
|
|
"epoch": 1.7452507858411916,
|
|
"grad_norm": 0.155806187899583,
|
|
"learning_rate": 6.569677328448641e-07,
|
|
"loss": 0.9019,
|
|
"mean_token_accuracy": 0.7725851833820343,
|
|
"num_tokens": 1176748247.0,
|
|
"step": 12770
|
|
},
|
|
{
|
|
"entropy": 1.15625,
|
|
"epoch": 1.7466174661746616,
|
|
"grad_norm": 0.12131236441516687,
|
|
"learning_rate": 6.534451176553473e-07,
|
|
"loss": 0.8842,
|
|
"mean_token_accuracy": 0.7768269777297974,
|
|
"num_tokens": 1177664935.0,
|
|
"step": 12780
|
|
},
|
|
{
|
|
"entropy": 1.1875,
|
|
"epoch": 1.7479841465081316,
|
|
"grad_norm": 0.1410407101400564,
|
|
"learning_rate": 6.499225024658306e-07,
|
|
"loss": 0.9297,
|
|
"mean_token_accuracy": 0.7658667802810669,
|
|
"num_tokens": 1178610296.0,
|
|
"step": 12790
|
|
},
|
|
{
|
|
"entropy": 1.1828125,
|
|
"epoch": 1.7493508268416016,
|
|
"grad_norm": 0.12393396332859648,
|
|
"learning_rate": 6.46399887276314e-07,
|
|
"loss": 0.9032,
|
|
"mean_token_accuracy": 0.7700599372386933,
|
|
"num_tokens": 1179486624.0,
|
|
"step": 12800
|
|
},
|
|
{
|
|
"entropy": 1.26640625,
|
|
"epoch": 1.7507175071750718,
|
|
"grad_norm": 0.16822814082042042,
|
|
"learning_rate": 6.428772720867973e-07,
|
|
"loss": 0.9632,
|
|
"mean_token_accuracy": 0.758342981338501,
|
|
"num_tokens": 1180390009.0,
|
|
"step": 12810
|
|
},
|
|
{
|
|
"entropy": 1.2109375,
|
|
"epoch": 1.7520841875085418,
|
|
"grad_norm": 0.12612042019985645,
|
|
"learning_rate": 6.393546568972805e-07,
|
|
"loss": 0.8877,
|
|
"mean_token_accuracy": 0.7727167487144471,
|
|
"num_tokens": 1181281114.0,
|
|
"step": 12820
|
|
},
|
|
{
|
|
"entropy": 1.23046875,
|
|
"epoch": 1.7534508678420118,
|
|
"grad_norm": 0.11681518002535746,
|
|
"learning_rate": 6.358320417077639e-07,
|
|
"loss": 0.9372,
|
|
"mean_token_accuracy": 0.765013599395752,
|
|
"num_tokens": 1182189730.0,
|
|
"step": 12830
|
|
},
|
|
{
|
|
"entropy": 1.175,
|
|
"epoch": 1.7548175481754817,
|
|
"grad_norm": 0.1199503130161116,
|
|
"learning_rate": 6.323094265182472e-07,
|
|
"loss": 0.8848,
|
|
"mean_token_accuracy": 0.7716429114341736,
|
|
"num_tokens": 1183066151.0,
|
|
"step": 12840
|
|
},
|
|
{
|
|
"entropy": 1.16875,
|
|
"epoch": 1.7561842285089517,
|
|
"grad_norm": 0.12619851585268144,
|
|
"learning_rate": 6.287868113287306e-07,
|
|
"loss": 0.8886,
|
|
"mean_token_accuracy": 0.7731076121330261,
|
|
"num_tokens": 1184020440.0,
|
|
"step": 12850
|
|
},
|
|
{
|
|
"entropy": 1.19609375,
|
|
"epoch": 1.7575509088424217,
|
|
"grad_norm": 0.12763359818098288,
|
|
"learning_rate": 6.252641961392138e-07,
|
|
"loss": 0.9425,
|
|
"mean_token_accuracy": 0.7616906940937043,
|
|
"num_tokens": 1184959095.0,
|
|
"step": 12860
|
|
},
|
|
{
|
|
"entropy": 1.158203125,
|
|
"epoch": 1.758917589175892,
|
|
"grad_norm": 0.12457627848683255,
|
|
"learning_rate": 6.217415809496971e-07,
|
|
"loss": 0.9009,
|
|
"mean_token_accuracy": 0.771221786737442,
|
|
"num_tokens": 1185881479.0,
|
|
"step": 12870
|
|
},
|
|
{
|
|
"entropy": 1.2296875,
|
|
"epoch": 1.760284269509362,
|
|
"grad_norm": 0.12457486366311518,
|
|
"learning_rate": 6.182189657601804e-07,
|
|
"loss": 0.9627,
|
|
"mean_token_accuracy": 0.7605029463768005,
|
|
"num_tokens": 1186834125.0,
|
|
"step": 12880
|
|
},
|
|
{
|
|
"entropy": 1.20078125,
|
|
"epoch": 1.7616509498428319,
|
|
"grad_norm": 0.13022864707306736,
|
|
"learning_rate": 6.146963505706637e-07,
|
|
"loss": 0.9165,
|
|
"mean_token_accuracy": 0.7685203731060029,
|
|
"num_tokens": 1187747970.0,
|
|
"step": 12890
|
|
},
|
|
{
|
|
"entropy": 1.203125,
|
|
"epoch": 1.7630176301763019,
|
|
"grad_norm": 0.118453990168731,
|
|
"learning_rate": 6.11173735381147e-07,
|
|
"loss": 0.9464,
|
|
"mean_token_accuracy": 0.7638853549957275,
|
|
"num_tokens": 1188638821.0,
|
|
"step": 12900
|
|
},
|
|
{
|
|
"entropy": 1.21328125,
|
|
"epoch": 1.7643843105097718,
|
|
"grad_norm": 0.11656759064558717,
|
|
"learning_rate": 6.076511201916304e-07,
|
|
"loss": 0.9511,
|
|
"mean_token_accuracy": 0.7616902112960815,
|
|
"num_tokens": 1189546737.0,
|
|
"step": 12910
|
|
},
|
|
{
|
|
"entropy": 1.215625,
|
|
"epoch": 1.7657509908432418,
|
|
"grad_norm": 0.1517735316088871,
|
|
"learning_rate": 6.041285050021136e-07,
|
|
"loss": 0.944,
|
|
"mean_token_accuracy": 0.7610712349414825,
|
|
"num_tokens": 1190408264.0,
|
|
"step": 12920
|
|
},
|
|
{
|
|
"entropy": 1.21171875,
|
|
"epoch": 1.7671176711767118,
|
|
"grad_norm": 0.11780113465066334,
|
|
"learning_rate": 6.006058898125969e-07,
|
|
"loss": 0.9142,
|
|
"mean_token_accuracy": 0.7687551856040955,
|
|
"num_tokens": 1191375402.0,
|
|
"step": 12930
|
|
},
|
|
{
|
|
"entropy": 1.2515625,
|
|
"epoch": 1.7684843515101818,
|
|
"grad_norm": 0.13621285564151836,
|
|
"learning_rate": 5.970832746230803e-07,
|
|
"loss": 0.9677,
|
|
"mean_token_accuracy": 0.7586081326007843,
|
|
"num_tokens": 1192370019.0,
|
|
"step": 12940
|
|
},
|
|
{
|
|
"entropy": 1.21796875,
|
|
"epoch": 1.7698510318436518,
|
|
"grad_norm": 0.12494584124651692,
|
|
"learning_rate": 5.935606594335636e-07,
|
|
"loss": 0.9104,
|
|
"mean_token_accuracy": 0.7695397853851318,
|
|
"num_tokens": 1193337873.0,
|
|
"step": 12950
|
|
},
|
|
{
|
|
"entropy": 1.21015625,
|
|
"epoch": 1.7712177121771218,
|
|
"grad_norm": 0.12757691804787943,
|
|
"learning_rate": 5.900380442440468e-07,
|
|
"loss": 0.9266,
|
|
"mean_token_accuracy": 0.767150616645813,
|
|
"num_tokens": 1194253377.0,
|
|
"step": 12960
|
|
},
|
|
{
|
|
"entropy": 1.2640625,
|
|
"epoch": 1.7725843925105917,
|
|
"grad_norm": 0.12500037466534897,
|
|
"learning_rate": 5.8651542905453e-07,
|
|
"loss": 0.9964,
|
|
"mean_token_accuracy": 0.7546169340610505,
|
|
"num_tokens": 1195191267.0,
|
|
"step": 12970
|
|
},
|
|
{
|
|
"entropy": 1.178125,
|
|
"epoch": 1.7739510728440617,
|
|
"grad_norm": 0.12760785943024017,
|
|
"learning_rate": 5.829928138650135e-07,
|
|
"loss": 0.9191,
|
|
"mean_token_accuracy": 0.7674704611301422,
|
|
"num_tokens": 1196100294.0,
|
|
"step": 12980
|
|
},
|
|
{
|
|
"entropy": 1.21015625,
|
|
"epoch": 1.7753177531775317,
|
|
"grad_norm": 0.12188612756174452,
|
|
"learning_rate": 5.794701986754967e-07,
|
|
"loss": 0.9115,
|
|
"mean_token_accuracy": 0.7699012398719788,
|
|
"num_tokens": 1197011295.0,
|
|
"step": 12990
|
|
},
|
|
{
|
|
"entropy": 1.19453125,
|
|
"epoch": 1.7766844335110017,
|
|
"grad_norm": 0.14590001042837653,
|
|
"learning_rate": 5.759475834859801e-07,
|
|
"loss": 0.9357,
|
|
"mean_token_accuracy": 0.7649892926216125,
|
|
"num_tokens": 1197934427.0,
|
|
"step": 13000
|
|
},
|
|
{
|
|
"entropy": 1.253125,
|
|
"epoch": 1.7780511138444717,
|
|
"grad_norm": 0.1364126427543167,
|
|
"learning_rate": 5.724249682964633e-07,
|
|
"loss": 0.9759,
|
|
"mean_token_accuracy": 0.7569168269634247,
|
|
"num_tokens": 1198826326.0,
|
|
"step": 13010
|
|
},
|
|
{
|
|
"entropy": 1.22265625,
|
|
"epoch": 1.7794177941779417,
|
|
"grad_norm": 0.12410633177412464,
|
|
"learning_rate": 5.689023531069466e-07,
|
|
"loss": 0.9035,
|
|
"mean_token_accuracy": 0.7693656206130981,
|
|
"num_tokens": 1199789877.0,
|
|
"step": 13020
|
|
},
|
|
{
|
|
"entropy": 1.221875,
|
|
"epoch": 1.7807844745114116,
|
|
"grad_norm": 0.1204628094240903,
|
|
"learning_rate": 5.6537973791743e-07,
|
|
"loss": 0.9279,
|
|
"mean_token_accuracy": 0.7658407807350158,
|
|
"num_tokens": 1200693482.0,
|
|
"step": 13030
|
|
},
|
|
{
|
|
"entropy": 1.16015625,
|
|
"epoch": 1.7821511548448816,
|
|
"grad_norm": 0.11670547723066224,
|
|
"learning_rate": 5.618571227279133e-07,
|
|
"loss": 0.9217,
|
|
"mean_token_accuracy": 0.7689062297344208,
|
|
"num_tokens": 1201642783.0,
|
|
"step": 13040
|
|
},
|
|
{
|
|
"entropy": 1.17265625,
|
|
"epoch": 1.7835178351783518,
|
|
"grad_norm": 0.1273352625728459,
|
|
"learning_rate": 5.583345075383965e-07,
|
|
"loss": 0.8993,
|
|
"mean_token_accuracy": 0.7701703667640686,
|
|
"num_tokens": 1202594247.0,
|
|
"step": 13050
|
|
},
|
|
{
|
|
"entropy": 1.1703125,
|
|
"epoch": 1.7848845155118218,
|
|
"grad_norm": 0.1274865055727763,
|
|
"learning_rate": 5.548118923488799e-07,
|
|
"loss": 0.8746,
|
|
"mean_token_accuracy": 0.7759354174137115,
|
|
"num_tokens": 1203472425.0,
|
|
"step": 13060
|
|
},
|
|
{
|
|
"entropy": 1.16484375,
|
|
"epoch": 1.7862511958452918,
|
|
"grad_norm": 0.14204008080581684,
|
|
"learning_rate": 5.512892771593632e-07,
|
|
"loss": 0.8787,
|
|
"mean_token_accuracy": 0.775704026222229,
|
|
"num_tokens": 1204404345.0,
|
|
"step": 13070
|
|
},
|
|
{
|
|
"entropy": 1.22265625,
|
|
"epoch": 1.7876178761787618,
|
|
"grad_norm": 0.10936940039404437,
|
|
"learning_rate": 5.477666619698464e-07,
|
|
"loss": 0.9835,
|
|
"mean_token_accuracy": 0.7564790666103363,
|
|
"num_tokens": 1205341201.0,
|
|
"step": 13080
|
|
},
|
|
{
|
|
"entropy": 1.19453125,
|
|
"epoch": 1.7889845565122318,
|
|
"grad_norm": 0.13184321474542243,
|
|
"learning_rate": 5.442440467803298e-07,
|
|
"loss": 0.9155,
|
|
"mean_token_accuracy": 0.7665495634078979,
|
|
"num_tokens": 1206254963.0,
|
|
"step": 13090
|
|
},
|
|
{
|
|
"entropy": 1.22734375,
|
|
"epoch": 1.7903512368457017,
|
|
"grad_norm": 0.13479802233666974,
|
|
"learning_rate": 5.407214315908131e-07,
|
|
"loss": 0.8909,
|
|
"mean_token_accuracy": 0.7726331889629364,
|
|
"num_tokens": 1207196574.0,
|
|
"step": 13100
|
|
},
|
|
{
|
|
"entropy": 1.2296875,
|
|
"epoch": 1.791717917179172,
|
|
"grad_norm": 0.1276853880762163,
|
|
"learning_rate": 5.371988164012964e-07,
|
|
"loss": 0.9469,
|
|
"mean_token_accuracy": 0.759734696149826,
|
|
"num_tokens": 1208161707.0,
|
|
"step": 13110
|
|
},
|
|
{
|
|
"entropy": 1.16171875,
|
|
"epoch": 1.793084597512642,
|
|
"grad_norm": 0.10929850443573043,
|
|
"learning_rate": 5.336762012117797e-07,
|
|
"loss": 0.9006,
|
|
"mean_token_accuracy": 0.7709809958934783,
|
|
"num_tokens": 1209098714.0,
|
|
"step": 13120
|
|
},
|
|
{
|
|
"entropy": 1.20390625,
|
|
"epoch": 1.794451277846112,
|
|
"grad_norm": 0.1509786914451278,
|
|
"learning_rate": 5.30153586022263e-07,
|
|
"loss": 0.9015,
|
|
"mean_token_accuracy": 0.7694388031959534,
|
|
"num_tokens": 1210039980.0,
|
|
"step": 13130
|
|
},
|
|
{
|
|
"entropy": 1.2078125,
|
|
"epoch": 1.795817958179582,
|
|
"grad_norm": 0.11672993294487181,
|
|
"learning_rate": 5.266309708327462e-07,
|
|
"loss": 0.9132,
|
|
"mean_token_accuracy": 0.7700955152511597,
|
|
"num_tokens": 1210952443.0,
|
|
"step": 13140
|
|
},
|
|
{
|
|
"entropy": 1.1578125,
|
|
"epoch": 1.7971846385130519,
|
|
"grad_norm": 0.11938258128625184,
|
|
"learning_rate": 5.231083556432296e-07,
|
|
"loss": 0.8861,
|
|
"mean_token_accuracy": 0.7772688269615173,
|
|
"num_tokens": 1211851765.0,
|
|
"step": 13150
|
|
},
|
|
{
|
|
"entropy": 1.22890625,
|
|
"epoch": 1.7985513188465219,
|
|
"grad_norm": 0.1319491346859688,
|
|
"learning_rate": 5.195857404537129e-07,
|
|
"loss": 0.9857,
|
|
"mean_token_accuracy": 0.7597759544849396,
|
|
"num_tokens": 1212761460.0,
|
|
"step": 13160
|
|
},
|
|
{
|
|
"entropy": 1.21328125,
|
|
"epoch": 1.7999179991799918,
|
|
"grad_norm": 0.12873124502252725,
|
|
"learning_rate": 5.160631252641961e-07,
|
|
"loss": 0.9198,
|
|
"mean_token_accuracy": 0.7689044773578644,
|
|
"num_tokens": 1213654078.0,
|
|
"step": 13170
|
|
},
|
|
{
|
|
"entropy": 1.178125,
|
|
"epoch": 1.8012846795134618,
|
|
"grad_norm": 0.1428477196842024,
|
|
"learning_rate": 5.125405100746795e-07,
|
|
"loss": 0.9371,
|
|
"mean_token_accuracy": 0.7639489114284516,
|
|
"num_tokens": 1214603029.0,
|
|
"step": 13180
|
|
},
|
|
{
|
|
"entropy": 1.21796875,
|
|
"epoch": 1.8026513598469318,
|
|
"grad_norm": 0.13174321466980435,
|
|
"learning_rate": 5.090178948851628e-07,
|
|
"loss": 0.9533,
|
|
"mean_token_accuracy": 0.7592254340648651,
|
|
"num_tokens": 1215556288.0,
|
|
"step": 13190
|
|
},
|
|
{
|
|
"entropy": 1.2546875,
|
|
"epoch": 1.8040180401804018,
|
|
"grad_norm": 0.13477883530362827,
|
|
"learning_rate": 5.054952796956461e-07,
|
|
"loss": 0.9544,
|
|
"mean_token_accuracy": 0.7592653214931488,
|
|
"num_tokens": 1216456655.0,
|
|
"step": 13200
|
|
},
|
|
{
|
|
"entropy": 1.16171875,
|
|
"epoch": 1.8053847205138718,
|
|
"grad_norm": 0.129645876984869,
|
|
"learning_rate": 5.019726645061294e-07,
|
|
"loss": 0.8547,
|
|
"mean_token_accuracy": 0.7808178067207336,
|
|
"num_tokens": 1217395832.0,
|
|
"step": 13210
|
|
},
|
|
{
|
|
"entropy": 1.2625,
|
|
"epoch": 1.8067514008473418,
|
|
"grad_norm": 0.1341454491106126,
|
|
"learning_rate": 4.984500493166127e-07,
|
|
"loss": 0.9362,
|
|
"mean_token_accuracy": 0.7647335350513458,
|
|
"num_tokens": 1218330293.0,
|
|
"step": 13220
|
|
},
|
|
{
|
|
"entropy": 1.1421875,
|
|
"epoch": 1.8081180811808117,
|
|
"grad_norm": 0.1280514285796073,
|
|
"learning_rate": 4.94927434127096e-07,
|
|
"loss": 0.8476,
|
|
"mean_token_accuracy": 0.7826826572418213,
|
|
"num_tokens": 1219230438.0,
|
|
"step": 13230
|
|
},
|
|
{
|
|
"entropy": 1.22265625,
|
|
"epoch": 1.8094847615142817,
|
|
"grad_norm": 0.1322499522390143,
|
|
"learning_rate": 4.914048189375794e-07,
|
|
"loss": 0.9342,
|
|
"mean_token_accuracy": 0.7653570950031281,
|
|
"num_tokens": 1220134157.0,
|
|
"step": 13240
|
|
},
|
|
{
|
|
"entropy": 1.20546875,
|
|
"epoch": 1.8108514418477517,
|
|
"grad_norm": 0.1399525280100263,
|
|
"learning_rate": 4.878822037480626e-07,
|
|
"loss": 0.9445,
|
|
"mean_token_accuracy": 0.7635837674140931,
|
|
"num_tokens": 1220972846.0,
|
|
"step": 13250
|
|
},
|
|
{
|
|
"entropy": 1.19296875,
|
|
"epoch": 1.8122181221812217,
|
|
"grad_norm": 0.12489423379816515,
|
|
"learning_rate": 4.843595885585459e-07,
|
|
"loss": 0.9199,
|
|
"mean_token_accuracy": 0.7675609171390534,
|
|
"num_tokens": 1221866991.0,
|
|
"step": 13260
|
|
},
|
|
{
|
|
"entropy": 1.21640625,
|
|
"epoch": 1.8135848025146917,
|
|
"grad_norm": 0.2202016529259422,
|
|
"learning_rate": 4.808369733690292e-07,
|
|
"loss": 0.9506,
|
|
"mean_token_accuracy": 0.7594952523708344,
|
|
"num_tokens": 1222815624.0,
|
|
"step": 13270
|
|
},
|
|
{
|
|
"entropy": 1.259375,
|
|
"epoch": 1.8149514828481617,
|
|
"grad_norm": 0.14167574604424743,
|
|
"learning_rate": 4.773143581795125e-07,
|
|
"loss": 1.0002,
|
|
"mean_token_accuracy": 0.7540671169757843,
|
|
"num_tokens": 1223788432.0,
|
|
"step": 13280
|
|
},
|
|
{
|
|
"entropy": 1.18203125,
|
|
"epoch": 1.8163181631816319,
|
|
"grad_norm": 0.13256611960795392,
|
|
"learning_rate": 4.7379174298999583e-07,
|
|
"loss": 0.8916,
|
|
"mean_token_accuracy": 0.7730853676795959,
|
|
"num_tokens": 1224689670.0,
|
|
"step": 13290
|
|
},
|
|
{
|
|
"entropy": 1.2140625,
|
|
"epoch": 1.8176848435151018,
|
|
"grad_norm": 0.1276662370896456,
|
|
"learning_rate": 4.702691278004791e-07,
|
|
"loss": 0.9283,
|
|
"mean_token_accuracy": 0.7669539988040924,
|
|
"num_tokens": 1225649644.0,
|
|
"step": 13300
|
|
},
|
|
{
|
|
"entropy": 1.18984375,
|
|
"epoch": 1.8190515238485718,
|
|
"grad_norm": 0.15490178574840038,
|
|
"learning_rate": 4.6674651261096245e-07,
|
|
"loss": 0.8974,
|
|
"mean_token_accuracy": 0.7726174235343933,
|
|
"num_tokens": 1226575382.0,
|
|
"step": 13310
|
|
},
|
|
{
|
|
"entropy": 1.16484375,
|
|
"epoch": 1.8204182041820418,
|
|
"grad_norm": 0.1350907981039878,
|
|
"learning_rate": 4.632238974214457e-07,
|
|
"loss": 0.8937,
|
|
"mean_token_accuracy": 0.7724673569202423,
|
|
"num_tokens": 1227501212.0,
|
|
"step": 13320
|
|
},
|
|
{
|
|
"entropy": 1.18359375,
|
|
"epoch": 1.8217848845155118,
|
|
"grad_norm": 0.1316457835332661,
|
|
"learning_rate": 4.5970128223192907e-07,
|
|
"loss": 0.9145,
|
|
"mean_token_accuracy": 0.7694324016571045,
|
|
"num_tokens": 1228421466.0,
|
|
"step": 13330
|
|
},
|
|
{
|
|
"entropy": 1.1796875,
|
|
"epoch": 1.8231515648489818,
|
|
"grad_norm": 0.12363318712826905,
|
|
"learning_rate": 4.561786670424123e-07,
|
|
"loss": 0.8857,
|
|
"mean_token_accuracy": 0.7738304853439331,
|
|
"num_tokens": 1229321163.0,
|
|
"step": 13340
|
|
},
|
|
{
|
|
"entropy": 1.2125,
|
|
"epoch": 1.824518245182452,
|
|
"grad_norm": 0.1297089295856019,
|
|
"learning_rate": 4.5265605185289563e-07,
|
|
"loss": 0.9128,
|
|
"mean_token_accuracy": 0.7689539313316345,
|
|
"num_tokens": 1230265475.0,
|
|
"step": 13350
|
|
},
|
|
{
|
|
"entropy": 1.17265625,
|
|
"epoch": 1.825884925515922,
|
|
"grad_norm": 0.12474372617281232,
|
|
"learning_rate": 4.491334366633789e-07,
|
|
"loss": 0.8959,
|
|
"mean_token_accuracy": 0.7709859669208526,
|
|
"num_tokens": 1231203985.0,
|
|
"step": 13360
|
|
},
|
|
{
|
|
"entropy": 1.20078125,
|
|
"epoch": 1.827251605849392,
|
|
"grad_norm": 0.13015086981687993,
|
|
"learning_rate": 4.456108214738622e-07,
|
|
"loss": 0.9252,
|
|
"mean_token_accuracy": 0.7674293518066406,
|
|
"num_tokens": 1232125463.0,
|
|
"step": 13370
|
|
},
|
|
{
|
|
"entropy": 1.19296875,
|
|
"epoch": 1.828618286182862,
|
|
"grad_norm": 0.1403609256835082,
|
|
"learning_rate": 4.4208820628434553e-07,
|
|
"loss": 0.9132,
|
|
"mean_token_accuracy": 0.7695992112159729,
|
|
"num_tokens": 1233047559.0,
|
|
"step": 13380
|
|
},
|
|
{
|
|
"entropy": 1.23046875,
|
|
"epoch": 1.829984966516332,
|
|
"grad_norm": 0.14242184848856668,
|
|
"learning_rate": 4.385655910948288e-07,
|
|
"loss": 0.9779,
|
|
"mean_token_accuracy": 0.7549289226531982,
|
|
"num_tokens": 1233974247.0,
|
|
"step": 13390
|
|
},
|
|
{
|
|
"entropy": 1.21484375,
|
|
"epoch": 1.831351646849802,
|
|
"grad_norm": 0.1280541892281634,
|
|
"learning_rate": 4.3504297590531215e-07,
|
|
"loss": 0.981,
|
|
"mean_token_accuracy": 0.7550446391105652,
|
|
"num_tokens": 1234904080.0,
|
|
"step": 13400
|
|
},
|
|
{
|
|
"entropy": 1.165625,
|
|
"epoch": 1.8327183271832719,
|
|
"grad_norm": 0.14012120991444224,
|
|
"learning_rate": 4.3152036071579543e-07,
|
|
"loss": 0.8936,
|
|
"mean_token_accuracy": 0.7723492980003357,
|
|
"num_tokens": 1235849484.0,
|
|
"step": 13410
|
|
},
|
|
{
|
|
"entropy": 1.15703125,
|
|
"epoch": 1.8340850075167419,
|
|
"grad_norm": 0.12903399782779063,
|
|
"learning_rate": 4.2799774552627877e-07,
|
|
"loss": 0.8981,
|
|
"mean_token_accuracy": 0.7719903767108918,
|
|
"num_tokens": 1236794345.0,
|
|
"step": 13420
|
|
},
|
|
{
|
|
"entropy": 1.175,
|
|
"epoch": 1.8354516878502118,
|
|
"grad_norm": 0.13819863337729948,
|
|
"learning_rate": 4.2447513033676205e-07,
|
|
"loss": 0.908,
|
|
"mean_token_accuracy": 0.7702607154846192,
|
|
"num_tokens": 1237706505.0,
|
|
"step": 13430
|
|
},
|
|
{
|
|
"entropy": 1.18125,
|
|
"epoch": 1.8368183681836818,
|
|
"grad_norm": 0.12287507209109591,
|
|
"learning_rate": 4.209525151472454e-07,
|
|
"loss": 0.9154,
|
|
"mean_token_accuracy": 0.7684490740299225,
|
|
"num_tokens": 1238606143.0,
|
|
"step": 13440
|
|
},
|
|
{
|
|
"entropy": 1.2328125,
|
|
"epoch": 1.8381850485171518,
|
|
"grad_norm": 0.14637753798577668,
|
|
"learning_rate": 4.1742989995772867e-07,
|
|
"loss": 0.9538,
|
|
"mean_token_accuracy": 0.7575156152248382,
|
|
"num_tokens": 1239559646.0,
|
|
"step": 13450
|
|
},
|
|
{
|
|
"entropy": 1.23359375,
|
|
"epoch": 1.8395517288506218,
|
|
"grad_norm": 0.13689704382822032,
|
|
"learning_rate": 4.13907284768212e-07,
|
|
"loss": 0.9629,
|
|
"mean_token_accuracy": 0.7583527088165283,
|
|
"num_tokens": 1240452306.0,
|
|
"step": 13460
|
|
},
|
|
{
|
|
"entropy": 1.23984375,
|
|
"epoch": 1.8409184091840918,
|
|
"grad_norm": 0.13446168713211124,
|
|
"learning_rate": 4.1038466957869523e-07,
|
|
"loss": 0.9261,
|
|
"mean_token_accuracy": 0.7658156335353852,
|
|
"num_tokens": 1241344272.0,
|
|
"step": 13470
|
|
},
|
|
{
|
|
"entropy": 1.2078125,
|
|
"epoch": 1.8422850895175618,
|
|
"grad_norm": 0.12823538184460534,
|
|
"learning_rate": 4.068620543891785e-07,
|
|
"loss": 0.9253,
|
|
"mean_token_accuracy": 0.7666651546955109,
|
|
"num_tokens": 1242336018.0,
|
|
"step": 13480
|
|
},
|
|
{
|
|
"entropy": 1.1890625,
|
|
"epoch": 1.8436517698510317,
|
|
"grad_norm": 0.15620098614624736,
|
|
"learning_rate": 4.0333943919966185e-07,
|
|
"loss": 0.9522,
|
|
"mean_token_accuracy": 0.7606388986110687,
|
|
"num_tokens": 1243313074.0,
|
|
"step": 13490
|
|
},
|
|
{
|
|
"entropy": 1.161328125,
|
|
"epoch": 1.8450184501845017,
|
|
"grad_norm": 0.1311161848741539,
|
|
"learning_rate": 3.9981682401014513e-07,
|
|
"loss": 0.8979,
|
|
"mean_token_accuracy": 0.7711224377155304,
|
|
"num_tokens": 1244278845.0,
|
|
"step": 13500
|
|
},
|
|
{
|
|
"entropy": 1.165625,
|
|
"epoch": 1.8463851305179717,
|
|
"grad_norm": 0.12660540241103171,
|
|
"learning_rate": 3.9629420882062847e-07,
|
|
"loss": 0.8946,
|
|
"mean_token_accuracy": 0.771394419670105,
|
|
"num_tokens": 1245190346.0,
|
|
"step": 13510
|
|
},
|
|
{
|
|
"entropy": 1.23046875,
|
|
"epoch": 1.8477518108514417,
|
|
"grad_norm": 0.12766354271772032,
|
|
"learning_rate": 3.9277159363111175e-07,
|
|
"loss": 0.9211,
|
|
"mean_token_accuracy": 0.7668926775455475,
|
|
"num_tokens": 1246116683.0,
|
|
"step": 13520
|
|
},
|
|
{
|
|
"entropy": 1.21953125,
|
|
"epoch": 1.849118491184912,
|
|
"grad_norm": 0.13329660119369094,
|
|
"learning_rate": 3.892489784415951e-07,
|
|
"loss": 0.927,
|
|
"mean_token_accuracy": 0.7656011462211609,
|
|
"num_tokens": 1247026427.0,
|
|
"step": 13530
|
|
},
|
|
{
|
|
"entropy": 1.2390625,
|
|
"epoch": 1.8504851715183819,
|
|
"grad_norm": 0.13906960581360425,
|
|
"learning_rate": 3.8572636325207837e-07,
|
|
"loss": 0.9469,
|
|
"mean_token_accuracy": 0.7601152837276459,
|
|
"num_tokens": 1247878509.0,
|
|
"step": 13540
|
|
},
|
|
{
|
|
"entropy": 1.26640625,
|
|
"epoch": 1.8518518518518519,
|
|
"grad_norm": 0.130781494681677,
|
|
"learning_rate": 3.822037480625617e-07,
|
|
"loss": 0.9324,
|
|
"mean_token_accuracy": 0.7654435038566589,
|
|
"num_tokens": 1248801015.0,
|
|
"step": 13550
|
|
},
|
|
{
|
|
"entropy": 1.178125,
|
|
"epoch": 1.8532185321853218,
|
|
"grad_norm": 0.12505069444277045,
|
|
"learning_rate": 3.78681132873045e-07,
|
|
"loss": 0.8831,
|
|
"mean_token_accuracy": 0.7757566809654236,
|
|
"num_tokens": 1249786486.0,
|
|
"step": 13560
|
|
},
|
|
{
|
|
"entropy": 1.22890625,
|
|
"epoch": 1.8545852125187918,
|
|
"grad_norm": 0.12786885702509257,
|
|
"learning_rate": 3.7515851768352827e-07,
|
|
"loss": 0.9374,
|
|
"mean_token_accuracy": 0.7635139882564544,
|
|
"num_tokens": 1250701509.0,
|
|
"step": 13570
|
|
},
|
|
{
|
|
"entropy": 1.2296875,
|
|
"epoch": 1.8559518928522618,
|
|
"grad_norm": 0.1359252118944819,
|
|
"learning_rate": 3.716359024940116e-07,
|
|
"loss": 0.9245,
|
|
"mean_token_accuracy": 0.7645541787147522,
|
|
"num_tokens": 1251584765.0,
|
|
"step": 13580
|
|
},
|
|
{
|
|
"entropy": 1.221875,
|
|
"epoch": 1.857318573185732,
|
|
"grad_norm": 0.1463406162119497,
|
|
"learning_rate": 3.6811328730449484e-07,
|
|
"loss": 0.9356,
|
|
"mean_token_accuracy": 0.7625512838363647,
|
|
"num_tokens": 1252528276.0,
|
|
"step": 13590
|
|
},
|
|
{
|
|
"entropy": 1.2078125,
|
|
"epoch": 1.858685253519202,
|
|
"grad_norm": 0.12526886451877464,
|
|
"learning_rate": 3.645906721149782e-07,
|
|
"loss": 0.8969,
|
|
"mean_token_accuracy": 0.770693427324295,
|
|
"num_tokens": 1253396732.0,
|
|
"step": 13600
|
|
},
|
|
{
|
|
"entropy": 1.2234375,
|
|
"epoch": 1.860051933852672,
|
|
"grad_norm": 0.13113822720255772,
|
|
"learning_rate": 3.6106805692546145e-07,
|
|
"loss": 0.9156,
|
|
"mean_token_accuracy": 0.7701052546501159,
|
|
"num_tokens": 1254364158.0,
|
|
"step": 13610
|
|
},
|
|
{
|
|
"entropy": 1.2515625,
|
|
"epoch": 1.861418614186142,
|
|
"grad_norm": 0.13743142200090952,
|
|
"learning_rate": 3.575454417359448e-07,
|
|
"loss": 0.9271,
|
|
"mean_token_accuracy": 0.7657711982727051,
|
|
"num_tokens": 1255269165.0,
|
|
"step": 13620
|
|
},
|
|
{
|
|
"entropy": 1.215625,
|
|
"epoch": 1.862785294519612,
|
|
"grad_norm": 0.1280904475990056,
|
|
"learning_rate": 3.5402282654642807e-07,
|
|
"loss": 0.871,
|
|
"mean_token_accuracy": 0.7764289498329162,
|
|
"num_tokens": 1256163120.0,
|
|
"step": 13630
|
|
},
|
|
{
|
|
"entropy": 1.2234375,
|
|
"epoch": 1.864151974853082,
|
|
"grad_norm": 0.13126284806183494,
|
|
"learning_rate": 3.505002113569114e-07,
|
|
"loss": 0.965,
|
|
"mean_token_accuracy": 0.7571732997894287,
|
|
"num_tokens": 1257106803.0,
|
|
"step": 13640
|
|
},
|
|
{
|
|
"entropy": 1.2109375,
|
|
"epoch": 1.865518655186552,
|
|
"grad_norm": 0.15589027943613648,
|
|
"learning_rate": 3.469775961673947e-07,
|
|
"loss": 0.9323,
|
|
"mean_token_accuracy": 0.7637082874774933,
|
|
"num_tokens": 1257991795.0,
|
|
"step": 13650
|
|
},
|
|
{
|
|
"entropy": 1.18046875,
|
|
"epoch": 1.866885335520022,
|
|
"grad_norm": 0.14452160189002358,
|
|
"learning_rate": 3.43454980977878e-07,
|
|
"loss": 0.916,
|
|
"mean_token_accuracy": 0.7728240191936493,
|
|
"num_tokens": 1258890443.0,
|
|
"step": 13660
|
|
},
|
|
{
|
|
"entropy": 1.234375,
|
|
"epoch": 1.8682520158534919,
|
|
"grad_norm": 0.1435269528190076,
|
|
"learning_rate": 3.399323657883613e-07,
|
|
"loss": 0.931,
|
|
"mean_token_accuracy": 0.7636270701885224,
|
|
"num_tokens": 1259800387.0,
|
|
"step": 13670
|
|
},
|
|
{
|
|
"entropy": 1.21953125,
|
|
"epoch": 1.8696186961869619,
|
|
"grad_norm": 0.12341195686848132,
|
|
"learning_rate": 3.364097505988446e-07,
|
|
"loss": 0.951,
|
|
"mean_token_accuracy": 0.7597443580627441,
|
|
"num_tokens": 1260762116.0,
|
|
"step": 13680
|
|
},
|
|
{
|
|
"entropy": 1.2265625,
|
|
"epoch": 1.8709853765204318,
|
|
"grad_norm": 0.13183873962654316,
|
|
"learning_rate": 3.328871354093279e-07,
|
|
"loss": 0.9373,
|
|
"mean_token_accuracy": 0.7617965340614319,
|
|
"num_tokens": 1261717172.0,
|
|
"step": 13690
|
|
},
|
|
{
|
|
"entropy": 1.228125,
|
|
"epoch": 1.8723520568539018,
|
|
"grad_norm": 0.13267669660592832,
|
|
"learning_rate": 3.293645202198112e-07,
|
|
"loss": 0.9438,
|
|
"mean_token_accuracy": 0.7617592990398407,
|
|
"num_tokens": 1262646086.0,
|
|
"step": 13700
|
|
},
|
|
{
|
|
"entropy": 1.21875,
|
|
"epoch": 1.8737187371873718,
|
|
"grad_norm": 0.11880710545027093,
|
|
"learning_rate": 3.2584190503029454e-07,
|
|
"loss": 0.9324,
|
|
"mean_token_accuracy": 0.7631661772727967,
|
|
"num_tokens": 1263533928.0,
|
|
"step": 13710
|
|
},
|
|
{
|
|
"entropy": 1.18828125,
|
|
"epoch": 1.8750854175208418,
|
|
"grad_norm": 0.12940200751035397,
|
|
"learning_rate": 3.223192898407778e-07,
|
|
"loss": 0.9204,
|
|
"mean_token_accuracy": 0.7684372425079345,
|
|
"num_tokens": 1264464542.0,
|
|
"step": 13720
|
|
},
|
|
{
|
|
"entropy": 1.20625,
|
|
"epoch": 1.8764520978543118,
|
|
"grad_norm": 0.13066720256726003,
|
|
"learning_rate": 3.1879667465126116e-07,
|
|
"loss": 0.8931,
|
|
"mean_token_accuracy": 0.774648380279541,
|
|
"num_tokens": 1265398428.0,
|
|
"step": 13730
|
|
},
|
|
{
|
|
"entropy": 1.19375,
|
|
"epoch": 1.8778187781877818,
|
|
"grad_norm": 0.12585045452968313,
|
|
"learning_rate": 3.152740594617444e-07,
|
|
"loss": 0.9129,
|
|
"mean_token_accuracy": 0.7698080003261566,
|
|
"num_tokens": 1266371418.0,
|
|
"step": 13740
|
|
},
|
|
{
|
|
"entropy": 1.21484375,
|
|
"epoch": 1.8791854585212517,
|
|
"grad_norm": 0.12486335778636186,
|
|
"learning_rate": 3.117514442722277e-07,
|
|
"loss": 0.9236,
|
|
"mean_token_accuracy": 0.768478387594223,
|
|
"num_tokens": 1267319020.0,
|
|
"step": 13750
|
|
},
|
|
{
|
|
"entropy": 1.1484375,
|
|
"epoch": 1.8805521388547217,
|
|
"grad_norm": 0.12040724189256471,
|
|
"learning_rate": 3.08228829082711e-07,
|
|
"loss": 0.8376,
|
|
"mean_token_accuracy": 0.7845637559890747,
|
|
"num_tokens": 1268284225.0,
|
|
"step": 13760
|
|
},
|
|
{
|
|
"entropy": 1.21015625,
|
|
"epoch": 1.881918819188192,
|
|
"grad_norm": 0.14181874779725728,
|
|
"learning_rate": 3.0470621389319434e-07,
|
|
"loss": 0.9209,
|
|
"mean_token_accuracy": 0.7672625601291656,
|
|
"num_tokens": 1269182673.0,
|
|
"step": 13770
|
|
},
|
|
{
|
|
"entropy": 1.18046875,
|
|
"epoch": 1.883285499521662,
|
|
"grad_norm": 0.11903959448872393,
|
|
"learning_rate": 3.0118359870367763e-07,
|
|
"loss": 0.9039,
|
|
"mean_token_accuracy": 0.7724440157413482,
|
|
"num_tokens": 1270055812.0,
|
|
"step": 13780
|
|
},
|
|
{
|
|
"entropy": 1.187109375,
|
|
"epoch": 1.884652179855132,
|
|
"grad_norm": 0.13197820342790334,
|
|
"learning_rate": 2.9766098351416096e-07,
|
|
"loss": 0.8829,
|
|
"mean_token_accuracy": 0.7747654497623444,
|
|
"num_tokens": 1270986557.0,
|
|
"step": 13790
|
|
},
|
|
{
|
|
"entropy": 1.196875,
|
|
"epoch": 1.8860188601886019,
|
|
"grad_norm": 0.11816934287809808,
|
|
"learning_rate": 2.9413836832464424e-07,
|
|
"loss": 0.9284,
|
|
"mean_token_accuracy": 0.7652914762496948,
|
|
"num_tokens": 1271945464.0,
|
|
"step": 13800
|
|
},
|
|
{
|
|
"entropy": 1.26015625,
|
|
"epoch": 1.8873855405220719,
|
|
"grad_norm": 0.1283781233389383,
|
|
"learning_rate": 2.906157531351276e-07,
|
|
"loss": 0.9729,
|
|
"mean_token_accuracy": 0.7589086592197418,
|
|
"num_tokens": 1272876497.0,
|
|
"step": 13810
|
|
},
|
|
{
|
|
"entropy": 1.209375,
|
|
"epoch": 1.8887522208555418,
|
|
"grad_norm": 0.15053931250906935,
|
|
"learning_rate": 2.8709313794561086e-07,
|
|
"loss": 0.909,
|
|
"mean_token_accuracy": 0.7701427638530731,
|
|
"num_tokens": 1273820211.0,
|
|
"step": 13820
|
|
},
|
|
{
|
|
"entropy": 1.22109375,
|
|
"epoch": 1.890118901189012,
|
|
"grad_norm": 0.1235188925418428,
|
|
"learning_rate": 2.8357052275609415e-07,
|
|
"loss": 0.9534,
|
|
"mean_token_accuracy": 0.7610946893692017,
|
|
"num_tokens": 1274699248.0,
|
|
"step": 13830
|
|
},
|
|
{
|
|
"entropy": 1.25703125,
|
|
"epoch": 1.891485581522482,
|
|
"grad_norm": 0.12157667958285735,
|
|
"learning_rate": 2.8004790756657743e-07,
|
|
"loss": 0.9754,
|
|
"mean_token_accuracy": 0.7579045951366424,
|
|
"num_tokens": 1275620559.0,
|
|
"step": 13840
|
|
},
|
|
{
|
|
"entropy": 1.203125,
|
|
"epoch": 1.892852261855952,
|
|
"grad_norm": 0.11620041895941702,
|
|
"learning_rate": 2.7652529237706076e-07,
|
|
"loss": 0.9055,
|
|
"mean_token_accuracy": 0.7697511374950409,
|
|
"num_tokens": 1276536051.0,
|
|
"step": 13850
|
|
},
|
|
{
|
|
"entropy": 1.17421875,
|
|
"epoch": 1.894218942189422,
|
|
"grad_norm": 0.12586999885847153,
|
|
"learning_rate": 2.7300267718754405e-07,
|
|
"loss": 0.926,
|
|
"mean_token_accuracy": 0.7672450125217438,
|
|
"num_tokens": 1277429791.0,
|
|
"step": 13860
|
|
},
|
|
{
|
|
"entropy": 1.140625,
|
|
"epoch": 1.895585622522892,
|
|
"grad_norm": 0.12873700163737734,
|
|
"learning_rate": 2.694800619980274e-07,
|
|
"loss": 0.8899,
|
|
"mean_token_accuracy": 0.7753511846065522,
|
|
"num_tokens": 1278347690.0,
|
|
"step": 13870
|
|
},
|
|
{
|
|
"entropy": 1.19140625,
|
|
"epoch": 1.896952302856362,
|
|
"grad_norm": 0.13169038842929903,
|
|
"learning_rate": 2.6595744680851066e-07,
|
|
"loss": 0.9083,
|
|
"mean_token_accuracy": 0.76952423453331,
|
|
"num_tokens": 1279303603.0,
|
|
"step": 13880
|
|
},
|
|
{
|
|
"entropy": 1.23359375,
|
|
"epoch": 1.898318983189832,
|
|
"grad_norm": 0.12391682374521935,
|
|
"learning_rate": 2.6243483161899395e-07,
|
|
"loss": 0.9257,
|
|
"mean_token_accuracy": 0.7669255137443542,
|
|
"num_tokens": 1280204398.0,
|
|
"step": 13890
|
|
},
|
|
{
|
|
"entropy": 1.20625,
|
|
"epoch": 1.899685663523302,
|
|
"grad_norm": 0.12820084367480528,
|
|
"learning_rate": 2.589122164294773e-07,
|
|
"loss": 0.9333,
|
|
"mean_token_accuracy": 0.7655616283416748,
|
|
"num_tokens": 1281179061.0,
|
|
"step": 13900
|
|
},
|
|
{
|
|
"entropy": 1.21484375,
|
|
"epoch": 1.901052343856772,
|
|
"grad_norm": 0.1360775624889555,
|
|
"learning_rate": 2.5538960123996056e-07,
|
|
"loss": 0.9244,
|
|
"mean_token_accuracy": 0.7668474793434144,
|
|
"num_tokens": 1282093095.0,
|
|
"step": 13910
|
|
},
|
|
{
|
|
"entropy": 1.21484375,
|
|
"epoch": 1.902419024190242,
|
|
"grad_norm": 0.13377807170165162,
|
|
"learning_rate": 2.518669860504439e-07,
|
|
"loss": 0.9264,
|
|
"mean_token_accuracy": 0.7646991014480591,
|
|
"num_tokens": 1282966547.0,
|
|
"step": 13920
|
|
},
|
|
{
|
|
"entropy": 1.2375,
|
|
"epoch": 1.9037857045237119,
|
|
"grad_norm": 0.1313753537759099,
|
|
"learning_rate": 2.483443708609272e-07,
|
|
"loss": 0.9548,
|
|
"mean_token_accuracy": 0.7587161779403686,
|
|
"num_tokens": 1283873376.0,
|
|
"step": 13930
|
|
},
|
|
{
|
|
"entropy": 1.1796875,
|
|
"epoch": 1.9051523848571819,
|
|
"grad_norm": 0.14821544580970916,
|
|
"learning_rate": 2.4482175567141046e-07,
|
|
"loss": 0.8763,
|
|
"mean_token_accuracy": 0.7760555744171143,
|
|
"num_tokens": 1284805609.0,
|
|
"step": 13940
|
|
},
|
|
{
|
|
"entropy": 1.2578125,
|
|
"epoch": 1.9065190651906518,
|
|
"grad_norm": 0.12021225884035179,
|
|
"learning_rate": 2.4129914048189375e-07,
|
|
"loss": 0.9591,
|
|
"mean_token_accuracy": 0.7578355014324188,
|
|
"num_tokens": 1285775120.0,
|
|
"step": 13950
|
|
},
|
|
{
|
|
"entropy": 1.2109375,
|
|
"epoch": 1.9078857455241218,
|
|
"grad_norm": 0.12093904250997317,
|
|
"learning_rate": 2.3777652529237708e-07,
|
|
"loss": 0.9453,
|
|
"mean_token_accuracy": 0.7650219321250915,
|
|
"num_tokens": 1286712132.0,
|
|
"step": 13960
|
|
},
|
|
{
|
|
"entropy": 1.22578125,
|
|
"epoch": 1.9092524258575918,
|
|
"grad_norm": 0.13141312338685485,
|
|
"learning_rate": 2.342539101028604e-07,
|
|
"loss": 0.9717,
|
|
"mean_token_accuracy": 0.7558670222759247,
|
|
"num_tokens": 1287677721.0,
|
|
"step": 13970
|
|
},
|
|
{
|
|
"entropy": 1.228125,
|
|
"epoch": 1.9106191061910618,
|
|
"grad_norm": 0.13274845519634706,
|
|
"learning_rate": 2.307312949133437e-07,
|
|
"loss": 0.9661,
|
|
"mean_token_accuracy": 0.7575204074382782,
|
|
"num_tokens": 1288588013.0,
|
|
"step": 13980
|
|
},
|
|
{
|
|
"entropy": 1.190625,
|
|
"epoch": 1.9119857865245318,
|
|
"grad_norm": 0.11893461094072458,
|
|
"learning_rate": 2.2720867972382698e-07,
|
|
"loss": 0.9332,
|
|
"mean_token_accuracy": 0.7642519533634186,
|
|
"num_tokens": 1289508064.0,
|
|
"step": 13990
|
|
},
|
|
{
|
|
"entropy": 1.2328125,
|
|
"epoch": 1.9133524668580018,
|
|
"grad_norm": 0.12641178427266545,
|
|
"learning_rate": 2.236860645343103e-07,
|
|
"loss": 0.9253,
|
|
"mean_token_accuracy": 0.7667537033557892,
|
|
"num_tokens": 1290403919.0,
|
|
"step": 14000
|
|
},
|
|
{
|
|
"entropy": 1.15546875,
|
|
"epoch": 1.914719147191472,
|
|
"grad_norm": 0.13020893758773255,
|
|
"learning_rate": 2.201634493447936e-07,
|
|
"loss": 0.8766,
|
|
"mean_token_accuracy": 0.7732644438743591,
|
|
"num_tokens": 1291301871.0,
|
|
"step": 14010
|
|
},
|
|
{
|
|
"entropy": 1.17421875,
|
|
"epoch": 1.916085827524942,
|
|
"grad_norm": 0.13697691677581378,
|
|
"learning_rate": 2.166408341552769e-07,
|
|
"loss": 0.943,
|
|
"mean_token_accuracy": 0.7607707738876343,
|
|
"num_tokens": 1292204054.0,
|
|
"step": 14020
|
|
},
|
|
{
|
|
"entropy": 1.228125,
|
|
"epoch": 1.917452507858412,
|
|
"grad_norm": 0.1253329244959156,
|
|
"learning_rate": 2.131182189657602e-07,
|
|
"loss": 0.8803,
|
|
"mean_token_accuracy": 0.775138008594513,
|
|
"num_tokens": 1293107419.0,
|
|
"step": 14030
|
|
},
|
|
{
|
|
"entropy": 1.19765625,
|
|
"epoch": 1.918819188191882,
|
|
"grad_norm": 0.1367401125434268,
|
|
"learning_rate": 2.095956037762435e-07,
|
|
"loss": 0.9269,
|
|
"mean_token_accuracy": 0.7631141722202301,
|
|
"num_tokens": 1294029874.0,
|
|
"step": 14040
|
|
},
|
|
{
|
|
"entropy": 1.21171875,
|
|
"epoch": 1.920185868525352,
|
|
"grad_norm": 0.11774676900937829,
|
|
"learning_rate": 2.0607298858672678e-07,
|
|
"loss": 0.88,
|
|
"mean_token_accuracy": 0.776486337184906,
|
|
"num_tokens": 1294956365.0,
|
|
"step": 14050
|
|
},
|
|
{
|
|
"entropy": 1.1734375,
|
|
"epoch": 1.9215525488588219,
|
|
"grad_norm": 0.13181558554722542,
|
|
"learning_rate": 2.025503733972101e-07,
|
|
"loss": 0.9052,
|
|
"mean_token_accuracy": 0.7714000940322876,
|
|
"num_tokens": 1295888810.0,
|
|
"step": 14060
|
|
},
|
|
{
|
|
"entropy": 1.2453125,
|
|
"epoch": 1.922919229192292,
|
|
"grad_norm": 0.13020002943178563,
|
|
"learning_rate": 1.990277582076934e-07,
|
|
"loss": 0.9722,
|
|
"mean_token_accuracy": 0.7579924702644348,
|
|
"num_tokens": 1296846047.0,
|
|
"step": 14070
|
|
},
|
|
{
|
|
"entropy": 1.20234375,
|
|
"epoch": 1.924285909525762,
|
|
"grad_norm": 0.12857911557093799,
|
|
"learning_rate": 1.955051430181767e-07,
|
|
"loss": 0.8857,
|
|
"mean_token_accuracy": 0.7731184244155884,
|
|
"num_tokens": 1297710203.0,
|
|
"step": 14080
|
|
},
|
|
{
|
|
"entropy": 1.19140625,
|
|
"epoch": 1.925652589859232,
|
|
"grad_norm": 0.1231734141141816,
|
|
"learning_rate": 1.9198252782866002e-07,
|
|
"loss": 0.8917,
|
|
"mean_token_accuracy": 0.7752778053283691,
|
|
"num_tokens": 1298620298.0,
|
|
"step": 14090
|
|
},
|
|
{
|
|
"entropy": 1.20546875,
|
|
"epoch": 1.927019270192702,
|
|
"grad_norm": 0.12133618727706608,
|
|
"learning_rate": 1.8845991263914333e-07,
|
|
"loss": 0.8788,
|
|
"mean_token_accuracy": 0.775577962398529,
|
|
"num_tokens": 1299543900.0,
|
|
"step": 14100
|
|
},
|
|
{
|
|
"entropy": 1.23828125,
|
|
"epoch": 1.928385950526172,
|
|
"grad_norm": 0.130934839006321,
|
|
"learning_rate": 1.8493729744962664e-07,
|
|
"loss": 0.9179,
|
|
"mean_token_accuracy": 0.7674769699573517,
|
|
"num_tokens": 1300390764.0,
|
|
"step": 14110
|
|
},
|
|
{
|
|
"entropy": 1.24609375,
|
|
"epoch": 1.929752630859642,
|
|
"grad_norm": 0.12878467167456686,
|
|
"learning_rate": 1.8141468226010995e-07,
|
|
"loss": 0.9472,
|
|
"mean_token_accuracy": 0.7639811992645263,
|
|
"num_tokens": 1301330590.0,
|
|
"step": 14120
|
|
},
|
|
{
|
|
"entropy": 1.196875,
|
|
"epoch": 1.931119311193112,
|
|
"grad_norm": 0.14007370187106694,
|
|
"learning_rate": 1.778920670705932e-07,
|
|
"loss": 0.8842,
|
|
"mean_token_accuracy": 0.775898015499115,
|
|
"num_tokens": 1302254211.0,
|
|
"step": 14130
|
|
},
|
|
{
|
|
"entropy": 1.21171875,
|
|
"epoch": 1.932485991526582,
|
|
"grad_norm": 0.11844601662938156,
|
|
"learning_rate": 1.743694518810765e-07,
|
|
"loss": 0.909,
|
|
"mean_token_accuracy": 0.7658661603927612,
|
|
"num_tokens": 1303199142.0,
|
|
"step": 14140
|
|
},
|
|
{
|
|
"entropy": 1.20078125,
|
|
"epoch": 1.933852671860052,
|
|
"grad_norm": 0.12352998511216852,
|
|
"learning_rate": 1.7084683669155982e-07,
|
|
"loss": 0.8629,
|
|
"mean_token_accuracy": 0.7785803377628326,
|
|
"num_tokens": 1304128084.0,
|
|
"step": 14150
|
|
},
|
|
{
|
|
"entropy": 1.228125,
|
|
"epoch": 1.935219352193522,
|
|
"grad_norm": 0.13337660992966258,
|
|
"learning_rate": 1.6732422150204313e-07,
|
|
"loss": 0.9327,
|
|
"mean_token_accuracy": 0.7658428966999054,
|
|
"num_tokens": 1305024102.0,
|
|
"step": 14160
|
|
},
|
|
{
|
|
"entropy": 1.190625,
|
|
"epoch": 1.936586032526992,
|
|
"grad_norm": 0.12957456805321318,
|
|
"learning_rate": 1.6380160631252644e-07,
|
|
"loss": 0.8911,
|
|
"mean_token_accuracy": 0.7734810948371887,
|
|
"num_tokens": 1305993003.0,
|
|
"step": 14170
|
|
},
|
|
{
|
|
"entropy": 1.19453125,
|
|
"epoch": 1.937952712860462,
|
|
"grad_norm": 0.12029278831904205,
|
|
"learning_rate": 1.6027899112300975e-07,
|
|
"loss": 0.8892,
|
|
"mean_token_accuracy": 0.7731999576091766,
|
|
"num_tokens": 1306902910.0,
|
|
"step": 14180
|
|
},
|
|
{
|
|
"entropy": 1.18984375,
|
|
"epoch": 1.9393193931939319,
|
|
"grad_norm": 0.12108481293556428,
|
|
"learning_rate": 1.5675637593349303e-07,
|
|
"loss": 0.8645,
|
|
"mean_token_accuracy": 0.7795865118503571,
|
|
"num_tokens": 1307848697.0,
|
|
"step": 14190
|
|
},
|
|
{
|
|
"entropy": 1.208203125,
|
|
"epoch": 1.9406860735274019,
|
|
"grad_norm": 0.12827889143446797,
|
|
"learning_rate": 1.5323376074397634e-07,
|
|
"loss": 0.9281,
|
|
"mean_token_accuracy": 0.7644687414169311,
|
|
"num_tokens": 1308794459.0,
|
|
"step": 14200
|
|
},
|
|
{
|
|
"entropy": 1.29296875,
|
|
"epoch": 1.9420527538608718,
|
|
"grad_norm": 0.14009470019147516,
|
|
"learning_rate": 1.4971114555445965e-07,
|
|
"loss": 1.0172,
|
|
"mean_token_accuracy": 0.7456341922283173,
|
|
"num_tokens": 1309729876.0,
|
|
"step": 14210
|
|
},
|
|
{
|
|
"entropy": 1.234375,
|
|
"epoch": 1.9434194341943418,
|
|
"grad_norm": 0.1334997670887509,
|
|
"learning_rate": 1.4618853036494293e-07,
|
|
"loss": 0.951,
|
|
"mean_token_accuracy": 0.7617784738540649,
|
|
"num_tokens": 1310628319.0,
|
|
"step": 14220
|
|
},
|
|
{
|
|
"entropy": 1.21796875,
|
|
"epoch": 1.9447861145278118,
|
|
"grad_norm": 0.17439729636744417,
|
|
"learning_rate": 1.4266591517542624e-07,
|
|
"loss": 0.9633,
|
|
"mean_token_accuracy": 0.7589798986911773,
|
|
"num_tokens": 1311525499.0,
|
|
"step": 14230
|
|
},
|
|
{
|
|
"entropy": 1.203125,
|
|
"epoch": 1.9461527948612818,
|
|
"grad_norm": 0.12428628312244312,
|
|
"learning_rate": 1.3914329998590955e-07,
|
|
"loss": 0.8968,
|
|
"mean_token_accuracy": 0.7726612210273742,
|
|
"num_tokens": 1312386473.0,
|
|
"step": 14240
|
|
},
|
|
{
|
|
"entropy": 1.2015625,
|
|
"epoch": 1.947519475194752,
|
|
"grad_norm": 0.12496647091704394,
|
|
"learning_rate": 1.3562068479639286e-07,
|
|
"loss": 0.9131,
|
|
"mean_token_accuracy": 0.7700098037719727,
|
|
"num_tokens": 1313349872.0,
|
|
"step": 14250
|
|
},
|
|
{
|
|
"entropy": 1.16640625,
|
|
"epoch": 1.948886155528222,
|
|
"grad_norm": 0.12985017147438083,
|
|
"learning_rate": 1.3209806960687614e-07,
|
|
"loss": 0.9014,
|
|
"mean_token_accuracy": 0.7715899527072907,
|
|
"num_tokens": 1314232660.0,
|
|
"step": 14260
|
|
},
|
|
{
|
|
"entropy": 1.209375,
|
|
"epoch": 1.950252835861692,
|
|
"grad_norm": 0.13043981596790022,
|
|
"learning_rate": 1.2857545441735945e-07,
|
|
"loss": 0.9008,
|
|
"mean_token_accuracy": 0.7718141257762909,
|
|
"num_tokens": 1315141328.0,
|
|
"step": 14270
|
|
},
|
|
{
|
|
"entropy": 1.21953125,
|
|
"epoch": 1.951619516195162,
|
|
"grad_norm": 0.13802244493455426,
|
|
"learning_rate": 1.2505283922784276e-07,
|
|
"loss": 0.9333,
|
|
"mean_token_accuracy": 0.7663715004920959,
|
|
"num_tokens": 1316092719.0,
|
|
"step": 14280
|
|
},
|
|
{
|
|
"entropy": 1.17890625,
|
|
"epoch": 1.952986196528632,
|
|
"grad_norm": 0.11929800286086355,
|
|
"learning_rate": 1.2153022403832607e-07,
|
|
"loss": 0.916,
|
|
"mean_token_accuracy": 0.7660542786121368,
|
|
"num_tokens": 1317027217.0,
|
|
"step": 14290
|
|
},
|
|
{
|
|
"entropy": 1.21953125,
|
|
"epoch": 1.954352876862102,
|
|
"grad_norm": 0.12588647122777397,
|
|
"learning_rate": 1.1800760884880937e-07,
|
|
"loss": 0.9385,
|
|
"mean_token_accuracy": 0.7635622143745422,
|
|
"num_tokens": 1317991078.0,
|
|
"step": 14300
|
|
},
|
|
{
|
|
"entropy": 1.20078125,
|
|
"epoch": 1.9557195571955721,
|
|
"grad_norm": 0.12312324796372513,
|
|
"learning_rate": 1.1448499365929266e-07,
|
|
"loss": 0.9206,
|
|
"mean_token_accuracy": 0.7670711994171142,
|
|
"num_tokens": 1318920657.0,
|
|
"step": 14310
|
|
},
|
|
{
|
|
"entropy": 1.20703125,
|
|
"epoch": 1.957086237529042,
|
|
"grad_norm": 0.1257250203272262,
|
|
"learning_rate": 1.1096237846977597e-07,
|
|
"loss": 0.923,
|
|
"mean_token_accuracy": 0.7669967472553253,
|
|
"num_tokens": 1319837378.0,
|
|
"step": 14320
|
|
},
|
|
{
|
|
"entropy": 1.21328125,
|
|
"epoch": 1.958452917862512,
|
|
"grad_norm": 0.14120292148392077,
|
|
"learning_rate": 1.0743976328025928e-07,
|
|
"loss": 0.9379,
|
|
"mean_token_accuracy": 0.7619308292865753,
|
|
"num_tokens": 1320771783.0,
|
|
"step": 14330
|
|
},
|
|
{
|
|
"entropy": 1.15859375,
|
|
"epoch": 1.959819598195982,
|
|
"grad_norm": 0.13878259892070088,
|
|
"learning_rate": 1.0391714809074258e-07,
|
|
"loss": 0.8905,
|
|
"mean_token_accuracy": 0.7735867321491241,
|
|
"num_tokens": 1321705205.0,
|
|
"step": 14340
|
|
},
|
|
{
|
|
"entropy": 1.20078125,
|
|
"epoch": 1.961186278529452,
|
|
"grad_norm": 0.1444762474199526,
|
|
"learning_rate": 1.0039453290122588e-07,
|
|
"loss": 0.9418,
|
|
"mean_token_accuracy": 0.7613134384155273,
|
|
"num_tokens": 1322615184.0,
|
|
"step": 14350
|
|
},
|
|
{
|
|
"entropy": 1.15,
|
|
"epoch": 1.962552958862922,
|
|
"grad_norm": 0.13886629131790834,
|
|
"learning_rate": 9.687191771170918e-08,
|
|
"loss": 0.8784,
|
|
"mean_token_accuracy": 0.7753280997276306,
|
|
"num_tokens": 1323518533.0,
|
|
"step": 14360
|
|
},
|
|
{
|
|
"entropy": 1.25078125,
|
|
"epoch": 1.963919639196392,
|
|
"grad_norm": 0.14721553772247603,
|
|
"learning_rate": 9.334930252219248e-08,
|
|
"loss": 1.0069,
|
|
"mean_token_accuracy": 0.7515687882900238,
|
|
"num_tokens": 1324479714.0,
|
|
"step": 14370
|
|
},
|
|
{
|
|
"entropy": 1.1953125,
|
|
"epoch": 1.965286319529862,
|
|
"grad_norm": 0.12482583295560845,
|
|
"learning_rate": 8.982668733267578e-08,
|
|
"loss": 0.9033,
|
|
"mean_token_accuracy": 0.771308183670044,
|
|
"num_tokens": 1325417096.0,
|
|
"step": 14380
|
|
},
|
|
{
|
|
"entropy": 1.15625,
|
|
"epoch": 1.966652999863332,
|
|
"grad_norm": 0.12095013319237485,
|
|
"learning_rate": 8.630407214315909e-08,
|
|
"loss": 0.8888,
|
|
"mean_token_accuracy": 0.7740471661090851,
|
|
"num_tokens": 1326334172.0,
|
|
"step": 14390
|
|
},
|
|
{
|
|
"entropy": 1.2546875,
|
|
"epoch": 1.968019680196802,
|
|
"grad_norm": 0.1330733201542206,
|
|
"learning_rate": 8.27814569536424e-08,
|
|
"loss": 0.9267,
|
|
"mean_token_accuracy": 0.767291533946991,
|
|
"num_tokens": 1327269265.0,
|
|
"step": 14400
|
|
},
|
|
{
|
|
"entropy": 1.22734375,
|
|
"epoch": 1.969386360530272,
|
|
"grad_norm": 0.1420199947636037,
|
|
"learning_rate": 7.925884176412568e-08,
|
|
"loss": 0.975,
|
|
"mean_token_accuracy": 0.7563924789428711,
|
|
"num_tokens": 1328170711.0,
|
|
"step": 14410
|
|
},
|
|
{
|
|
"entropy": 1.23203125,
|
|
"epoch": 1.970753040863742,
|
|
"grad_norm": 0.14456097514268978,
|
|
"learning_rate": 7.573622657460899e-08,
|
|
"loss": 0.9528,
|
|
"mean_token_accuracy": 0.7625652015209198,
|
|
"num_tokens": 1329083836.0,
|
|
"step": 14420
|
|
},
|
|
{
|
|
"entropy": 1.175,
|
|
"epoch": 1.972119721197212,
|
|
"grad_norm": 0.1361034982748518,
|
|
"learning_rate": 7.22136113850923e-08,
|
|
"loss": 0.8952,
|
|
"mean_token_accuracy": 0.7719953835010529,
|
|
"num_tokens": 1330010848.0,
|
|
"step": 14430
|
|
},
|
|
{
|
|
"entropy": 1.1875,
|
|
"epoch": 1.9734864015306819,
|
|
"grad_norm": 0.1317169251028568,
|
|
"learning_rate": 6.869099619557561e-08,
|
|
"loss": 0.8949,
|
|
"mean_token_accuracy": 0.7719994366168976,
|
|
"num_tokens": 1330933127.0,
|
|
"step": 14440
|
|
},
|
|
{
|
|
"entropy": 1.18125,
|
|
"epoch": 1.9748530818641519,
|
|
"grad_norm": 0.14431012894468243,
|
|
"learning_rate": 6.51683810060589e-08,
|
|
"loss": 0.9214,
|
|
"mean_token_accuracy": 0.7667833209037781,
|
|
"num_tokens": 1331893703.0,
|
|
"step": 14450
|
|
},
|
|
{
|
|
"entropy": 1.234375,
|
|
"epoch": 1.9762197621976219,
|
|
"grad_norm": 0.13163864452563148,
|
|
"learning_rate": 6.164576581654221e-08,
|
|
"loss": 0.9487,
|
|
"mean_token_accuracy": 0.7615863978862762,
|
|
"num_tokens": 1332776070.0,
|
|
"step": 14460
|
|
},
|
|
{
|
|
"entropy": 1.19921875,
|
|
"epoch": 1.9775864425310918,
|
|
"grad_norm": 0.13848048013898065,
|
|
"learning_rate": 5.8123150627025515e-08,
|
|
"loss": 0.9036,
|
|
"mean_token_accuracy": 0.7688190281391144,
|
|
"num_tokens": 1333671223.0,
|
|
"step": 14470
|
|
},
|
|
{
|
|
"entropy": 1.19375,
|
|
"epoch": 1.9789531228645618,
|
|
"grad_norm": 0.11783773037791861,
|
|
"learning_rate": 5.460053543750881e-08,
|
|
"loss": 0.9052,
|
|
"mean_token_accuracy": 0.7703226804733276,
|
|
"num_tokens": 1334527767.0,
|
|
"step": 14480
|
|
},
|
|
{
|
|
"entropy": 1.234375,
|
|
"epoch": 1.980319803198032,
|
|
"grad_norm": 0.1248712903896063,
|
|
"learning_rate": 5.107792024799211e-08,
|
|
"loss": 0.9269,
|
|
"mean_token_accuracy": 0.7650700688362122,
|
|
"num_tokens": 1335447057.0,
|
|
"step": 14490
|
|
},
|
|
{
|
|
"entropy": 1.27890625,
|
|
"epoch": 1.981686483531502,
|
|
"grad_norm": 0.13635034059832404,
|
|
"learning_rate": 4.7555305058475415e-08,
|
|
"loss": 0.995,
|
|
"mean_token_accuracy": 0.7527548372745514,
|
|
"num_tokens": 1336330757.0,
|
|
"step": 14500
|
|
},
|
|
{
|
|
"entropy": 1.20703125,
|
|
"epoch": 1.983053163864972,
|
|
"grad_norm": 0.13487917498233717,
|
|
"learning_rate": 4.403268986895872e-08,
|
|
"loss": 0.9402,
|
|
"mean_token_accuracy": 0.762943583726883,
|
|
"num_tokens": 1337295795.0,
|
|
"step": 14510
|
|
},
|
|
{
|
|
"entropy": 1.21484375,
|
|
"epoch": 1.984419844198442,
|
|
"grad_norm": 0.12619311603463523,
|
|
"learning_rate": 4.0510074679442026e-08,
|
|
"loss": 0.9231,
|
|
"mean_token_accuracy": 0.765994393825531,
|
|
"num_tokens": 1338219307.0,
|
|
"step": 14520
|
|
},
|
|
{
|
|
"entropy": 1.23515625,
|
|
"epoch": 1.985786524531912,
|
|
"grad_norm": 0.13841330883112382,
|
|
"learning_rate": 3.698745948992532e-08,
|
|
"loss": 0.9777,
|
|
"mean_token_accuracy": 0.7558487117290497,
|
|
"num_tokens": 1339082221.0,
|
|
"step": 14530
|
|
},
|
|
{
|
|
"entropy": 1.1875,
|
|
"epoch": 1.987153204865382,
|
|
"grad_norm": 0.13116151428570533,
|
|
"learning_rate": 3.3464844300408624e-08,
|
|
"loss": 0.9039,
|
|
"mean_token_accuracy": 0.7678617715835572,
|
|
"num_tokens": 1339954792.0,
|
|
"step": 14540
|
|
},
|
|
{
|
|
"entropy": 1.1734375,
|
|
"epoch": 1.9885198851988521,
|
|
"grad_norm": 0.1215017096124415,
|
|
"learning_rate": 2.994222911089193e-08,
|
|
"loss": 0.8864,
|
|
"mean_token_accuracy": 0.7751383364200592,
|
|
"num_tokens": 1340893357.0,
|
|
"step": 14550
|
|
},
|
|
{
|
|
"entropy": 1.23515625,
|
|
"epoch": 1.9898865655323221,
|
|
"grad_norm": 0.12280718692221099,
|
|
"learning_rate": 2.6419613921375232e-08,
|
|
"loss": 0.9141,
|
|
"mean_token_accuracy": 0.7691698193550109,
|
|
"num_tokens": 1341842329.0,
|
|
"step": 14560
|
|
},
|
|
{
|
|
"entropy": 1.159375,
|
|
"epoch": 1.991253245865792,
|
|
"grad_norm": 0.12894552357997094,
|
|
"learning_rate": 2.289699873185853e-08,
|
|
"loss": 0.9068,
|
|
"mean_token_accuracy": 0.7660853266716003,
|
|
"num_tokens": 1342767408.0,
|
|
"step": 14570
|
|
},
|
|
{
|
|
"entropy": 1.27421875,
|
|
"epoch": 1.992619926199262,
|
|
"grad_norm": 0.12668287624734478,
|
|
"learning_rate": 1.9374383542341837e-08,
|
|
"loss": 0.9707,
|
|
"mean_token_accuracy": 0.7579917550086975,
|
|
"num_tokens": 1343650590.0,
|
|
"step": 14580
|
|
},
|
|
{
|
|
"entropy": 1.14921875,
|
|
"epoch": 1.993986606532732,
|
|
"grad_norm": 0.12414303352979501,
|
|
"learning_rate": 1.585176835282514e-08,
|
|
"loss": 0.8807,
|
|
"mean_token_accuracy": 0.7759094297885895,
|
|
"num_tokens": 1344570805.0,
|
|
"step": 14590
|
|
},
|
|
{
|
|
"entropy": 1.26015625,
|
|
"epoch": 1.995353286866202,
|
|
"grad_norm": 0.1290931905152585,
|
|
"learning_rate": 1.2329153163308442e-08,
|
|
"loss": 1.0007,
|
|
"mean_token_accuracy": 0.7530019223690033,
|
|
"num_tokens": 1345512877.0,
|
|
"step": 14600
|
|
},
|
|
{
|
|
"entropy": 1.20546875,
|
|
"epoch": 1.996719967199672,
|
|
"grad_norm": 0.1289995416549784,
|
|
"learning_rate": 8.806537973791744e-09,
|
|
"loss": 0.9323,
|
|
"mean_token_accuracy": 0.7658796846866608,
|
|
"num_tokens": 1346470069.0,
|
|
"step": 14610
|
|
},
|
|
{
|
|
"entropy": 1.1890625,
|
|
"epoch": 1.998086647533142,
|
|
"grad_norm": 0.12919276729908274,
|
|
"learning_rate": 5.2839227842750465e-09,
|
|
"loss": 0.926,
|
|
"mean_token_accuracy": 0.7662369787693024,
|
|
"num_tokens": 1347420912.0,
|
|
"step": 14620
|
|
},
|
|
{
|
|
"entropy": 1.2234375,
|
|
"epoch": 1.999453327866612,
|
|
"grad_norm": 0.1592306780226885,
|
|
"learning_rate": 1.7613075947583486e-09,
|
|
"loss": 0.9414,
|
|
"mean_token_accuracy": 0.7633181810379028,
|
|
"num_tokens": 1348346302.0,
|
|
"step": 14630
|
|
},
|
|
{
|
|
"entropy": 1.220703125,
|
|
"epoch": 2.0,
|
|
"mean_token_accuracy": 0.7547120749950409,
|
|
"num_tokens": 1348725368.0,
|
|
"step": 14634,
|
|
"total_flos": 2.197196595737395e+16,
|
|
"train_loss": 0.958531968545047,
|
|
"train_runtime": 65358.5619,
|
|
"train_samples_per_second": 28.658,
|
|
"train_steps_per_second": 0.224
|
|
}
|
|
],
|
|
"logging_steps": 10,
|
|
"max_steps": 14634,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 2,
|
|
"save_steps": 200,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": true
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 2.197196595737395e+16,
|
|
"train_batch_size": 16,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|