Model: ali-elganzory/SmolLM2-1.7B-16k-SFT-Tulu3-decontaminated-masked Source: Original Platform
14677 lines
410 KiB
JSON
14677 lines
410 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 2.0,
|
|
"eval_steps": 500,
|
|
"global_step": 14634,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 1.13125,
|
|
"epoch": 0.0013666803334700013,
|
|
"grad_norm": 1.781575313805476,
|
|
"learning_rate": 1.0227272727272728e-07,
|
|
"loss": 0.9417,
|
|
"mean_token_accuracy": 0.7560629427433014,
|
|
"num_tokens": 1016869.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 1.1265625,
|
|
"epoch": 0.0027333606669400026,
|
|
"grad_norm": 2.5651415256681998,
|
|
"learning_rate": 2.1590909090909094e-07,
|
|
"loss": 0.8896,
|
|
"mean_token_accuracy": 0.772361445426941,
|
|
"num_tokens": 1980699.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 1.127734375,
|
|
"epoch": 0.004100041000410004,
|
|
"grad_norm": 1.3942237339868888,
|
|
"learning_rate": 3.2954545454545455e-07,
|
|
"loss": 0.9072,
|
|
"mean_token_accuracy": 0.7670667946338654,
|
|
"num_tokens": 2988245.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 1.1640625,
|
|
"epoch": 0.005466721333880005,
|
|
"grad_norm": 5.1559037489770585,
|
|
"learning_rate": 4.431818181818182e-07,
|
|
"loss": 0.9416,
|
|
"mean_token_accuracy": 0.7619005799293518,
|
|
"num_tokens": 3975995.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 1.09921875,
|
|
"epoch": 0.006833401667350007,
|
|
"grad_norm": 1.1169140554015755,
|
|
"learning_rate": 5.568181818181818e-07,
|
|
"loss": 0.8865,
|
|
"mean_token_accuracy": 0.770892858505249,
|
|
"num_tokens": 4978502.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 1.13828125,
|
|
"epoch": 0.008200082000820008,
|
|
"grad_norm": 4.600428490099624,
|
|
"learning_rate": 6.704545454545456e-07,
|
|
"loss": 0.8918,
|
|
"mean_token_accuracy": 0.7677924156188964,
|
|
"num_tokens": 6027883.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 1.17734375,
|
|
"epoch": 0.00956676233429001,
|
|
"grad_norm": 1.7622308285294768,
|
|
"learning_rate": 7.840909090909092e-07,
|
|
"loss": 0.9257,
|
|
"mean_token_accuracy": 0.7619180142879486,
|
|
"num_tokens": 7061996.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 1.18515625,
|
|
"epoch": 0.01093344266776001,
|
|
"grad_norm": 0.7781462377447647,
|
|
"learning_rate": 8.977272727272728e-07,
|
|
"loss": 0.9506,
|
|
"mean_token_accuracy": 0.7590595006942749,
|
|
"num_tokens": 8084402.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 1.130078125,
|
|
"epoch": 0.012300123001230012,
|
|
"grad_norm": 1.7223745040887468,
|
|
"learning_rate": 1.0113636363636365e-06,
|
|
"loss": 0.8733,
|
|
"mean_token_accuracy": 0.7694763779640198,
|
|
"num_tokens": 9025654.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 1.13046875,
|
|
"epoch": 0.013666803334700014,
|
|
"grad_norm": 0.8793706985381146,
|
|
"learning_rate": 1.125e-06,
|
|
"loss": 0.8924,
|
|
"mean_token_accuracy": 0.7699639618396759,
|
|
"num_tokens": 10036395.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 1.13046875,
|
|
"epoch": 0.015033483668170014,
|
|
"grad_norm": 0.6444297935327442,
|
|
"learning_rate": 1.2386363636363638e-06,
|
|
"loss": 0.8684,
|
|
"mean_token_accuracy": 0.7727577090263367,
|
|
"num_tokens": 11045728.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 1.1359375,
|
|
"epoch": 0.016400164001640016,
|
|
"grad_norm": 0.5180782043987796,
|
|
"learning_rate": 1.3522727272727273e-06,
|
|
"loss": 0.8922,
|
|
"mean_token_accuracy": 0.7701211512088776,
|
|
"num_tokens": 12023582.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 1.120703125,
|
|
"epoch": 0.017766844335110017,
|
|
"grad_norm": 0.45575158235291413,
|
|
"learning_rate": 1.465909090909091e-06,
|
|
"loss": 0.8585,
|
|
"mean_token_accuracy": 0.7749844312667846,
|
|
"num_tokens": 13030217.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 1.13125,
|
|
"epoch": 0.01913352466858002,
|
|
"grad_norm": 0.4203492525700111,
|
|
"learning_rate": 1.5795454545454547e-06,
|
|
"loss": 0.844,
|
|
"mean_token_accuracy": 0.7801699101924896,
|
|
"num_tokens": 14048615.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 1.13671875,
|
|
"epoch": 0.02050020500205002,
|
|
"grad_norm": 0.43322115138523243,
|
|
"learning_rate": 1.6931818181818182e-06,
|
|
"loss": 0.8804,
|
|
"mean_token_accuracy": 0.7751793682575225,
|
|
"num_tokens": 15078495.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 1.1171875,
|
|
"epoch": 0.02186688533552002,
|
|
"grad_norm": 0.4551715889753973,
|
|
"learning_rate": 1.8068181818181822e-06,
|
|
"loss": 0.8786,
|
|
"mean_token_accuracy": 0.7731150150299072,
|
|
"num_tokens": 16103047.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 1.1546875,
|
|
"epoch": 0.023233565668990024,
|
|
"grad_norm": 0.3976531240727417,
|
|
"learning_rate": 1.9204545454545457e-06,
|
|
"loss": 0.884,
|
|
"mean_token_accuracy": 0.7729849636554718,
|
|
"num_tokens": 17028892.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 1.069921875,
|
|
"epoch": 0.024600246002460024,
|
|
"grad_norm": 0.37017129213427813,
|
|
"learning_rate": 2.034090909090909e-06,
|
|
"loss": 0.8453,
|
|
"mean_token_accuracy": 0.7776266634464264,
|
|
"num_tokens": 18024902.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 1.0890625,
|
|
"epoch": 0.025966926335930025,
|
|
"grad_norm": 0.35600028627508173,
|
|
"learning_rate": 2.147727272727273e-06,
|
|
"loss": 0.8691,
|
|
"mean_token_accuracy": 0.773022037744522,
|
|
"num_tokens": 19080401.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 1.13515625,
|
|
"epoch": 0.02733360666940003,
|
|
"grad_norm": 0.3248588072145177,
|
|
"learning_rate": 2.2613636363636366e-06,
|
|
"loss": 0.8805,
|
|
"mean_token_accuracy": 0.7731276690959931,
|
|
"num_tokens": 20026588.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 1.11328125,
|
|
"epoch": 0.02870028700287003,
|
|
"grad_norm": 0.39550767219487326,
|
|
"learning_rate": 2.375e-06,
|
|
"loss": 0.8666,
|
|
"mean_token_accuracy": 0.7727326512336731,
|
|
"num_tokens": 21044783.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 1.1234375,
|
|
"epoch": 0.03006696733634003,
|
|
"grad_norm": 0.37175938215349535,
|
|
"learning_rate": 2.488636363636364e-06,
|
|
"loss": 0.8504,
|
|
"mean_token_accuracy": 0.7786373198032379,
|
|
"num_tokens": 22052506.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 1.06171875,
|
|
"epoch": 0.03143364766981003,
|
|
"grad_norm": 0.3071686646431001,
|
|
"learning_rate": 2.6022727272727276e-06,
|
|
"loss": 0.8067,
|
|
"mean_token_accuracy": 0.787099552154541,
|
|
"num_tokens": 23069235.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 1.1140625,
|
|
"epoch": 0.03280032800328003,
|
|
"grad_norm": 0.3185493463011715,
|
|
"learning_rate": 2.715909090909091e-06,
|
|
"loss": 0.8397,
|
|
"mean_token_accuracy": 0.7804415106773377,
|
|
"num_tokens": 24079191.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 1.10625,
|
|
"epoch": 0.034167008336750036,
|
|
"grad_norm": 0.3330706894951769,
|
|
"learning_rate": 2.829545454545455e-06,
|
|
"loss": 0.842,
|
|
"mean_token_accuracy": 0.7800883650779724,
|
|
"num_tokens": 25079457.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 1.073046875,
|
|
"epoch": 0.03553368867022003,
|
|
"grad_norm": 0.2609631057512263,
|
|
"learning_rate": 2.9431818181818185e-06,
|
|
"loss": 0.812,
|
|
"mean_token_accuracy": 0.7862607955932617,
|
|
"num_tokens": 26091186.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 1.0765625,
|
|
"epoch": 0.03690036900369004,
|
|
"grad_norm": 0.2878433539310524,
|
|
"learning_rate": 3.056818181818182e-06,
|
|
"loss": 0.7963,
|
|
"mean_token_accuracy": 0.7897116065025329,
|
|
"num_tokens": 27112339.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 1.074609375,
|
|
"epoch": 0.03826704933716004,
|
|
"grad_norm": 0.28381693277961706,
|
|
"learning_rate": 3.1704545454545456e-06,
|
|
"loss": 0.8198,
|
|
"mean_token_accuracy": 0.7835849940776825,
|
|
"num_tokens": 28134048.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 1.096875,
|
|
"epoch": 0.03963372967063004,
|
|
"grad_norm": 0.3040560784236955,
|
|
"learning_rate": 3.2840909090909095e-06,
|
|
"loss": 0.8358,
|
|
"mean_token_accuracy": 0.7807661116123199,
|
|
"num_tokens": 29136473.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 1.07421875,
|
|
"epoch": 0.04100041000410004,
|
|
"grad_norm": 0.27726229617573234,
|
|
"learning_rate": 3.397727272727273e-06,
|
|
"loss": 0.8109,
|
|
"mean_token_accuracy": 0.784226268529892,
|
|
"num_tokens": 30137323.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 1.104296875,
|
|
"epoch": 0.042367090337570044,
|
|
"grad_norm": 0.3293127808423812,
|
|
"learning_rate": 3.5113636363636365e-06,
|
|
"loss": 0.8343,
|
|
"mean_token_accuracy": 0.7837403774261474,
|
|
"num_tokens": 31163454.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 1.0796875,
|
|
"epoch": 0.04373377067104004,
|
|
"grad_norm": 0.2670238592043461,
|
|
"learning_rate": 3.625e-06,
|
|
"loss": 0.8169,
|
|
"mean_token_accuracy": 0.7828076839447021,
|
|
"num_tokens": 32141812.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 1.1546875,
|
|
"epoch": 0.045100451004510045,
|
|
"grad_norm": 0.31361702846222383,
|
|
"learning_rate": 3.7386363636363635e-06,
|
|
"loss": 0.8857,
|
|
"mean_token_accuracy": 0.7740460276603699,
|
|
"num_tokens": 33126442.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 1.04765625,
|
|
"epoch": 0.04646713133798005,
|
|
"grad_norm": 0.30029560015005863,
|
|
"learning_rate": 3.852272727272728e-06,
|
|
"loss": 0.7902,
|
|
"mean_token_accuracy": 0.7897385716438293,
|
|
"num_tokens": 34104354.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 1.024609375,
|
|
"epoch": 0.047833811671450045,
|
|
"grad_norm": 0.2826038934653051,
|
|
"learning_rate": 3.965909090909091e-06,
|
|
"loss": 0.7741,
|
|
"mean_token_accuracy": 0.7940067946910858,
|
|
"num_tokens": 35132692.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 1.078515625,
|
|
"epoch": 0.04920049200492005,
|
|
"grad_norm": 0.2416215579883873,
|
|
"learning_rate": 4.079545454545455e-06,
|
|
"loss": 0.8447,
|
|
"mean_token_accuracy": 0.7787702202796936,
|
|
"num_tokens": 36158630.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 1.10546875,
|
|
"epoch": 0.05056717233839005,
|
|
"grad_norm": 0.29747005431456774,
|
|
"learning_rate": 4.193181818181819e-06,
|
|
"loss": 0.8243,
|
|
"mean_token_accuracy": 0.7832909107208252,
|
|
"num_tokens": 37163234.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 1.11640625,
|
|
"epoch": 0.05193385267186005,
|
|
"grad_norm": 0.30944531343027337,
|
|
"learning_rate": 4.306818181818182e-06,
|
|
"loss": 0.8515,
|
|
"mean_token_accuracy": 0.7790181457996368,
|
|
"num_tokens": 38146361.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 1.04609375,
|
|
"epoch": 0.05330053300533005,
|
|
"grad_norm": 0.2602927251518843,
|
|
"learning_rate": 4.420454545454546e-06,
|
|
"loss": 0.7919,
|
|
"mean_token_accuracy": 0.7884412109851837,
|
|
"num_tokens": 39174804.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 1.05078125,
|
|
"epoch": 0.05466721333880006,
|
|
"grad_norm": 0.25156684624783515,
|
|
"learning_rate": 4.53409090909091e-06,
|
|
"loss": 0.7747,
|
|
"mean_token_accuracy": 0.794690728187561,
|
|
"num_tokens": 40139777.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 1.1171875,
|
|
"epoch": 0.05603389367227005,
|
|
"grad_norm": 0.30594904195957523,
|
|
"learning_rate": 4.647727272727273e-06,
|
|
"loss": 0.8339,
|
|
"mean_token_accuracy": 0.7795797407627105,
|
|
"num_tokens": 41114574.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 1.080859375,
|
|
"epoch": 0.05740057400574006,
|
|
"grad_norm": 0.2743445524135134,
|
|
"learning_rate": 4.761363636363637e-06,
|
|
"loss": 0.8027,
|
|
"mean_token_accuracy": 0.7895477414131165,
|
|
"num_tokens": 42124866.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 1.03671875,
|
|
"epoch": 0.05876725433921006,
|
|
"grad_norm": 0.33964981923912324,
|
|
"learning_rate": 4.875e-06,
|
|
"loss": 0.7528,
|
|
"mean_token_accuracy": 0.7993932664394379,
|
|
"num_tokens": 43150980.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 1.059765625,
|
|
"epoch": 0.06013393467268006,
|
|
"grad_norm": 0.24569169348808997,
|
|
"learning_rate": 4.988636363636364e-06,
|
|
"loss": 0.8358,
|
|
"mean_token_accuracy": 0.7815402984619141,
|
|
"num_tokens": 44191349.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 1.09921875,
|
|
"epoch": 0.06150061500615006,
|
|
"grad_norm": 0.2754621789353528,
|
|
"learning_rate": 4.996829646329435e-06,
|
|
"loss": 0.8205,
|
|
"mean_token_accuracy": 0.7829422116279602,
|
|
"num_tokens": 45193679.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 1.1375,
|
|
"epoch": 0.06286729533962006,
|
|
"grad_norm": 0.2769689749589337,
|
|
"learning_rate": 4.993307031139919e-06,
|
|
"loss": 0.8533,
|
|
"mean_token_accuracy": 0.7788640260696411,
|
|
"num_tokens": 46212953.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 1.088671875,
|
|
"epoch": 0.06423397567309007,
|
|
"grad_norm": 0.24882573338951497,
|
|
"learning_rate": 4.989784415950402e-06,
|
|
"loss": 0.8507,
|
|
"mean_token_accuracy": 0.7776808917522431,
|
|
"num_tokens": 47223409.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 1.13359375,
|
|
"epoch": 0.06560065600656007,
|
|
"grad_norm": 0.2902646895264343,
|
|
"learning_rate": 4.986261800760885e-06,
|
|
"loss": 0.8559,
|
|
"mean_token_accuracy": 0.7773000240325928,
|
|
"num_tokens": 48219206.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 1.06796875,
|
|
"epoch": 0.06696733634003006,
|
|
"grad_norm": 0.25585697394215057,
|
|
"learning_rate": 4.9827391855713685e-06,
|
|
"loss": 0.8119,
|
|
"mean_token_accuracy": 0.7875959515571594,
|
|
"num_tokens": 49254735.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 1.0921875,
|
|
"epoch": 0.06833401667350007,
|
|
"grad_norm": 0.2879927242844208,
|
|
"learning_rate": 4.979216570381852e-06,
|
|
"loss": 0.7811,
|
|
"mean_token_accuracy": 0.7906504809856415,
|
|
"num_tokens": 50255750.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 1.088671875,
|
|
"epoch": 0.06970069700697007,
|
|
"grad_norm": 0.2595148273399958,
|
|
"learning_rate": 4.975693955192335e-06,
|
|
"loss": 0.8167,
|
|
"mean_token_accuracy": 0.7838614046573639,
|
|
"num_tokens": 51239612.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 1.10234375,
|
|
"epoch": 0.07106737734044007,
|
|
"grad_norm": 0.27832044066584893,
|
|
"learning_rate": 4.972171340002819e-06,
|
|
"loss": 0.8248,
|
|
"mean_token_accuracy": 0.7855765461921692,
|
|
"num_tokens": 52276744.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 1.10703125,
|
|
"epoch": 0.07243405767391008,
|
|
"grad_norm": 0.2618756073838311,
|
|
"learning_rate": 4.968648724813302e-06,
|
|
"loss": 0.8286,
|
|
"mean_token_accuracy": 0.7818135023117065,
|
|
"num_tokens": 53273673.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 1.07890625,
|
|
"epoch": 0.07380073800738007,
|
|
"grad_norm": 0.2778573049973201,
|
|
"learning_rate": 4.965126109623785e-06,
|
|
"loss": 0.8201,
|
|
"mean_token_accuracy": 0.7857865452766418,
|
|
"num_tokens": 54252824.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 1.0921875,
|
|
"epoch": 0.07516741834085007,
|
|
"grad_norm": 0.2573326432269238,
|
|
"learning_rate": 4.961603494434268e-06,
|
|
"loss": 0.8495,
|
|
"mean_token_accuracy": 0.7795455098152161,
|
|
"num_tokens": 55242317.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 1.065234375,
|
|
"epoch": 0.07653409867432008,
|
|
"grad_norm": 0.2693483552874542,
|
|
"learning_rate": 4.958080879244752e-06,
|
|
"loss": 0.7744,
|
|
"mean_token_accuracy": 0.7932467103004456,
|
|
"num_tokens": 56262198.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 1.043359375,
|
|
"epoch": 0.07790077900779008,
|
|
"grad_norm": 0.2930647625637142,
|
|
"learning_rate": 4.954558264055234e-06,
|
|
"loss": 0.7977,
|
|
"mean_token_accuracy": 0.7865098237991333,
|
|
"num_tokens": 57224893.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 1.055859375,
|
|
"epoch": 0.07926745934126007,
|
|
"grad_norm": 0.31196653720511086,
|
|
"learning_rate": 4.951035648865719e-06,
|
|
"loss": 0.7954,
|
|
"mean_token_accuracy": 0.789548134803772,
|
|
"num_tokens": 58192939.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 1.059765625,
|
|
"epoch": 0.08063413967473008,
|
|
"grad_norm": 0.2802684962761971,
|
|
"learning_rate": 4.9475130336762015e-06,
|
|
"loss": 0.7867,
|
|
"mean_token_accuracy": 0.7910029709339141,
|
|
"num_tokens": 59173681.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 1.09453125,
|
|
"epoch": 0.08200082000820008,
|
|
"grad_norm": 0.27539731573040027,
|
|
"learning_rate": 4.943990418486685e-06,
|
|
"loss": 0.8128,
|
|
"mean_token_accuracy": 0.7833833217620849,
|
|
"num_tokens": 60217834.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 1.058984375,
|
|
"epoch": 0.08336750034167008,
|
|
"grad_norm": 0.2760815165604091,
|
|
"learning_rate": 4.9404678032971685e-06,
|
|
"loss": 0.8125,
|
|
"mean_token_accuracy": 0.7883922517299652,
|
|
"num_tokens": 61203226.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 1.0484375,
|
|
"epoch": 0.08473418067514009,
|
|
"grad_norm": 0.2503760508575142,
|
|
"learning_rate": 4.936945188107651e-06,
|
|
"loss": 0.8135,
|
|
"mean_token_accuracy": 0.7869656264781952,
|
|
"num_tokens": 62218471.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 1.020703125,
|
|
"epoch": 0.08610086100861009,
|
|
"grad_norm": 0.2767313479471325,
|
|
"learning_rate": 4.933422572918135e-06,
|
|
"loss": 0.7762,
|
|
"mean_token_accuracy": 0.7953163504600524,
|
|
"num_tokens": 63196352.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 1.0375,
|
|
"epoch": 0.08746754134208008,
|
|
"grad_norm": 0.24862189349315808,
|
|
"learning_rate": 4.929899957728618e-06,
|
|
"loss": 0.7812,
|
|
"mean_token_accuracy": 0.7918992042541504,
|
|
"num_tokens": 64213947.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 1.055078125,
|
|
"epoch": 0.08883422167555009,
|
|
"grad_norm": 0.3152299473698731,
|
|
"learning_rate": 4.926377342539102e-06,
|
|
"loss": 0.7824,
|
|
"mean_token_accuracy": 0.7918226301670075,
|
|
"num_tokens": 65212813.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 1.03984375,
|
|
"epoch": 0.09020090200902009,
|
|
"grad_norm": 0.2842821507684537,
|
|
"learning_rate": 4.922854727349585e-06,
|
|
"loss": 0.7613,
|
|
"mean_token_accuracy": 0.7976277530193329,
|
|
"num_tokens": 66207188.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 1.081640625,
|
|
"epoch": 0.09156758234249009,
|
|
"grad_norm": 0.2524875238366715,
|
|
"learning_rate": 4.919332112160068e-06,
|
|
"loss": 0.7948,
|
|
"mean_token_accuracy": 0.7908314645290375,
|
|
"num_tokens": 67233532.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 1.040625,
|
|
"epoch": 0.0929342626759601,
|
|
"grad_norm": 0.24503822604473038,
|
|
"learning_rate": 4.915809496970551e-06,
|
|
"loss": 0.7771,
|
|
"mean_token_accuracy": 0.7931586444377899,
|
|
"num_tokens": 68263201.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 1.108203125,
|
|
"epoch": 0.0943009430094301,
|
|
"grad_norm": 0.267132780030172,
|
|
"learning_rate": 4.912286881781035e-06,
|
|
"loss": 0.8698,
|
|
"mean_token_accuracy": 0.7729156851768494,
|
|
"num_tokens": 69260237.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 1.041015625,
|
|
"epoch": 0.09566762334290009,
|
|
"grad_norm": 0.2790801575292318,
|
|
"learning_rate": 4.908764266591518e-06,
|
|
"loss": 0.773,
|
|
"mean_token_accuracy": 0.7943916618824005,
|
|
"num_tokens": 70257011.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 1.08046875,
|
|
"epoch": 0.0970343036763701,
|
|
"grad_norm": 0.2807772948000506,
|
|
"learning_rate": 4.9052416514020015e-06,
|
|
"loss": 0.7767,
|
|
"mean_token_accuracy": 0.7935328423976898,
|
|
"num_tokens": 71242071.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 1.016796875,
|
|
"epoch": 0.0984009840098401,
|
|
"grad_norm": 0.2626041257870872,
|
|
"learning_rate": 4.901719036212484e-06,
|
|
"loss": 0.7721,
|
|
"mean_token_accuracy": 0.7931431949138641,
|
|
"num_tokens": 72300678.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 1.0453125,
|
|
"epoch": 0.0997676643433101,
|
|
"grad_norm": 0.25659628511637,
|
|
"learning_rate": 4.898196421022968e-06,
|
|
"loss": 0.7751,
|
|
"mean_token_accuracy": 0.7947411715984345,
|
|
"num_tokens": 73295969.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 1.0390625,
|
|
"epoch": 0.1011343446767801,
|
|
"grad_norm": 0.30611725277357693,
|
|
"learning_rate": 4.894673805833451e-06,
|
|
"loss": 0.7427,
|
|
"mean_token_accuracy": 0.8000989973545074,
|
|
"num_tokens": 74224367.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 1.04921875,
|
|
"epoch": 0.1025010250102501,
|
|
"grad_norm": 0.2618170665440788,
|
|
"learning_rate": 4.891151190643935e-06,
|
|
"loss": 0.8039,
|
|
"mean_token_accuracy": 0.7867703139781952,
|
|
"num_tokens": 75220927.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 1.04765625,
|
|
"epoch": 0.1038677053437201,
|
|
"grad_norm": 0.25068063879554886,
|
|
"learning_rate": 4.8876285754544175e-06,
|
|
"loss": 0.7863,
|
|
"mean_token_accuracy": 0.7909291326999665,
|
|
"num_tokens": 76264459.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 1.102734375,
|
|
"epoch": 0.10523438567719011,
|
|
"grad_norm": 0.2913793068971851,
|
|
"learning_rate": 4.884105960264901e-06,
|
|
"loss": 0.8334,
|
|
"mean_token_accuracy": 0.7820223689079284,
|
|
"num_tokens": 77237576.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 1.04453125,
|
|
"epoch": 0.1066010660106601,
|
|
"grad_norm": 0.2608516061672014,
|
|
"learning_rate": 4.880583345075385e-06,
|
|
"loss": 0.786,
|
|
"mean_token_accuracy": 0.7925894796848297,
|
|
"num_tokens": 78233874.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 1.030078125,
|
|
"epoch": 0.1079677463441301,
|
|
"grad_norm": 0.23303338812117583,
|
|
"learning_rate": 4.877060729885867e-06,
|
|
"loss": 0.7477,
|
|
"mean_token_accuracy": 0.7993072152137757,
|
|
"num_tokens": 79226628.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 1.0421875,
|
|
"epoch": 0.10933442667760011,
|
|
"grad_norm": 0.2597602142208832,
|
|
"learning_rate": 4.873538114696351e-06,
|
|
"loss": 0.7707,
|
|
"mean_token_accuracy": 0.7937746942043304,
|
|
"num_tokens": 80216871.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 1.05390625,
|
|
"epoch": 0.11070110701107011,
|
|
"grad_norm": 0.2830854493692102,
|
|
"learning_rate": 4.870015499506834e-06,
|
|
"loss": 0.7687,
|
|
"mean_token_accuracy": 0.7972835004329681,
|
|
"num_tokens": 81209897.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 1.04453125,
|
|
"epoch": 0.1120677873445401,
|
|
"grad_norm": 0.25050584637945095,
|
|
"learning_rate": 4.866492884317318e-06,
|
|
"loss": 0.7655,
|
|
"mean_token_accuracy": 0.7944554328918457,
|
|
"num_tokens": 82222143.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 1.032421875,
|
|
"epoch": 0.11343446767801012,
|
|
"grad_norm": 0.2627979392977472,
|
|
"learning_rate": 4.862970269127801e-06,
|
|
"loss": 0.7708,
|
|
"mean_token_accuracy": 0.7974313199520111,
|
|
"num_tokens": 83210601.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 1.0609375,
|
|
"epoch": 0.11480114801148011,
|
|
"grad_norm": 0.26974352709999033,
|
|
"learning_rate": 4.859447653938284e-06,
|
|
"loss": 0.8023,
|
|
"mean_token_accuracy": 0.787781584262848,
|
|
"num_tokens": 84189098.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 1.048046875,
|
|
"epoch": 0.11616782834495011,
|
|
"grad_norm": 0.23235024615427782,
|
|
"learning_rate": 4.855925038748768e-06,
|
|
"loss": 0.8235,
|
|
"mean_token_accuracy": 0.7854433834552765,
|
|
"num_tokens": 85278005.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 1.0515625,
|
|
"epoch": 0.11753450867842012,
|
|
"grad_norm": 0.25162274375843635,
|
|
"learning_rate": 4.852402423559251e-06,
|
|
"loss": 0.7798,
|
|
"mean_token_accuracy": 0.793785673379898,
|
|
"num_tokens": 86314347.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 1.08359375,
|
|
"epoch": 0.11890118901189012,
|
|
"grad_norm": 0.2519967808290757,
|
|
"learning_rate": 4.848879808369734e-06,
|
|
"loss": 0.8368,
|
|
"mean_token_accuracy": 0.7824197113513947,
|
|
"num_tokens": 87295027.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 1.0390625,
|
|
"epoch": 0.12026786934536011,
|
|
"grad_norm": 0.25795975074616223,
|
|
"learning_rate": 4.8453571931802175e-06,
|
|
"loss": 0.746,
|
|
"mean_token_accuracy": 0.8001847982406616,
|
|
"num_tokens": 88315349.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 1.00546875,
|
|
"epoch": 0.12163454967883013,
|
|
"grad_norm": 0.24820340984846068,
|
|
"learning_rate": 4.8418345779907e-06,
|
|
"loss": 0.7997,
|
|
"mean_token_accuracy": 0.7898295402526856,
|
|
"num_tokens": 89285381.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 1.0859375,
|
|
"epoch": 0.12300123001230012,
|
|
"grad_norm": 0.29751345390833045,
|
|
"learning_rate": 4.838311962801184e-06,
|
|
"loss": 0.8097,
|
|
"mean_token_accuracy": 0.786676698923111,
|
|
"num_tokens": 90306461.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 1.049609375,
|
|
"epoch": 0.12436791034577012,
|
|
"grad_norm": 0.30305972839018985,
|
|
"learning_rate": 4.834789347611667e-06,
|
|
"loss": 0.7943,
|
|
"mean_token_accuracy": 0.789288192987442,
|
|
"num_tokens": 91255724.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 1.060546875,
|
|
"epoch": 0.12573459067924012,
|
|
"grad_norm": 0.2598056157706055,
|
|
"learning_rate": 4.831266732422151e-06,
|
|
"loss": 0.7826,
|
|
"mean_token_accuracy": 0.7945521295070648,
|
|
"num_tokens": 92220294.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 0.984375,
|
|
"epoch": 0.12710127101271013,
|
|
"grad_norm": 0.26093383801303305,
|
|
"learning_rate": 4.827744117232634e-06,
|
|
"loss": 0.7243,
|
|
"mean_token_accuracy": 0.8050603210926056,
|
|
"num_tokens": 93189250.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 1.040234375,
|
|
"epoch": 0.12846795134618014,
|
|
"grad_norm": 0.28049234692239067,
|
|
"learning_rate": 4.824221502043117e-06,
|
|
"loss": 0.7366,
|
|
"mean_token_accuracy": 0.802125096321106,
|
|
"num_tokens": 94155449.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 1.0546875,
|
|
"epoch": 0.12983463167965012,
|
|
"grad_norm": 0.25105375588735707,
|
|
"learning_rate": 4.820698886853601e-06,
|
|
"loss": 0.796,
|
|
"mean_token_accuracy": 0.7870637714862824,
|
|
"num_tokens": 95222208.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 1.065234375,
|
|
"epoch": 0.13120131201312013,
|
|
"grad_norm": 0.2546547089555019,
|
|
"learning_rate": 4.817176271664084e-06,
|
|
"loss": 0.784,
|
|
"mean_token_accuracy": 0.7916345953941345,
|
|
"num_tokens": 96240732.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 1.01484375,
|
|
"epoch": 0.13256799234659014,
|
|
"grad_norm": 0.26403401082086403,
|
|
"learning_rate": 4.813653656474567e-06,
|
|
"loss": 0.7515,
|
|
"mean_token_accuracy": 0.7994778215885162,
|
|
"num_tokens": 97189622.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 1.04296875,
|
|
"epoch": 0.13393467268006012,
|
|
"grad_norm": 0.30182436441212956,
|
|
"learning_rate": 4.8101310412850505e-06,
|
|
"loss": 0.7763,
|
|
"mean_token_accuracy": 0.7917546510696412,
|
|
"num_tokens": 98193657.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 1.01640625,
|
|
"epoch": 0.13530135301353013,
|
|
"grad_norm": 0.2544865829997281,
|
|
"learning_rate": 4.806608426095534e-06,
|
|
"loss": 0.7638,
|
|
"mean_token_accuracy": 0.7970567345619202,
|
|
"num_tokens": 99244929.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 1.01875,
|
|
"epoch": 0.13666803334700015,
|
|
"grad_norm": 0.2420391912254092,
|
|
"learning_rate": 4.803085810906017e-06,
|
|
"loss": 0.7486,
|
|
"mean_token_accuracy": 0.7986745953559875,
|
|
"num_tokens": 100253866.0,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"entropy": 1.08203125,
|
|
"epoch": 0.13803471368047013,
|
|
"grad_norm": 0.2489423005959183,
|
|
"learning_rate": 4.7995631957165e-06,
|
|
"loss": 0.8006,
|
|
"mean_token_accuracy": 0.7877034664154052,
|
|
"num_tokens": 101284311.0,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"entropy": 1.008984375,
|
|
"epoch": 0.13940139401394014,
|
|
"grad_norm": 0.2641854389751512,
|
|
"learning_rate": 4.796040580526984e-06,
|
|
"loss": 0.7295,
|
|
"mean_token_accuracy": 0.8037738502025604,
|
|
"num_tokens": 102289462.0,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"entropy": 1.027734375,
|
|
"epoch": 0.14076807434741015,
|
|
"grad_norm": 0.2904707747898475,
|
|
"learning_rate": 4.792517965337467e-06,
|
|
"loss": 0.7673,
|
|
"mean_token_accuracy": 0.7957234442234039,
|
|
"num_tokens": 103255021.0,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"entropy": 1.01484375,
|
|
"epoch": 0.14213475468088013,
|
|
"grad_norm": 0.2635077273359354,
|
|
"learning_rate": 4.78899535014795e-06,
|
|
"loss": 0.7185,
|
|
"mean_token_accuracy": 0.8067101657390594,
|
|
"num_tokens": 104261992.0,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"entropy": 1.023046875,
|
|
"epoch": 0.14350143501435014,
|
|
"grad_norm": 0.24209205753931193,
|
|
"learning_rate": 4.785472734958434e-06,
|
|
"loss": 0.7476,
|
|
"mean_token_accuracy": 0.7985336899757385,
|
|
"num_tokens": 105292243.0,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"entropy": 1.040234375,
|
|
"epoch": 0.14486811534782015,
|
|
"grad_norm": 0.23232789759442107,
|
|
"learning_rate": 4.781950119768916e-06,
|
|
"loss": 0.7495,
|
|
"mean_token_accuracy": 0.7974299669265748,
|
|
"num_tokens": 106305001.0,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"entropy": 1.015625,
|
|
"epoch": 0.14623479568129014,
|
|
"grad_norm": 0.2330428226862862,
|
|
"learning_rate": 4.778427504579401e-06,
|
|
"loss": 0.7286,
|
|
"mean_token_accuracy": 0.8033270478248596,
|
|
"num_tokens": 107316342.0,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"entropy": 0.9765625,
|
|
"epoch": 0.14760147601476015,
|
|
"grad_norm": 0.22262565727596517,
|
|
"learning_rate": 4.774904889389883e-06,
|
|
"loss": 0.7444,
|
|
"mean_token_accuracy": 0.8004394471645355,
|
|
"num_tokens": 108361044.0,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"entropy": 1.02109375,
|
|
"epoch": 0.14896815634823016,
|
|
"grad_norm": 0.28809569011474345,
|
|
"learning_rate": 4.771382274200367e-06,
|
|
"loss": 0.7777,
|
|
"mean_token_accuracy": 0.7929108738899231,
|
|
"num_tokens": 109356718.0,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"entropy": 1.057421875,
|
|
"epoch": 0.15033483668170014,
|
|
"grad_norm": 0.23010500868684586,
|
|
"learning_rate": 4.76785965901085e-06,
|
|
"loss": 0.8099,
|
|
"mean_token_accuracy": 0.7855147302150727,
|
|
"num_tokens": 110398127.0,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"entropy": 1.07734375,
|
|
"epoch": 0.15170151701517015,
|
|
"grad_norm": 0.25736004355163894,
|
|
"learning_rate": 4.764337043821333e-06,
|
|
"loss": 0.8249,
|
|
"mean_token_accuracy": 0.7825508832931518,
|
|
"num_tokens": 111382725.0,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"entropy": 1.06171875,
|
|
"epoch": 0.15306819734864016,
|
|
"grad_norm": 0.25578677121109156,
|
|
"learning_rate": 4.760814428631817e-06,
|
|
"loss": 0.7735,
|
|
"mean_token_accuracy": 0.7939091503620148,
|
|
"num_tokens": 112369399.0,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"entropy": 1.039453125,
|
|
"epoch": 0.15443487768211014,
|
|
"grad_norm": 0.2748379821713066,
|
|
"learning_rate": 4.7572918134423e-06,
|
|
"loss": 0.7778,
|
|
"mean_token_accuracy": 0.7934213697910308,
|
|
"num_tokens": 113312860.0,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"entropy": 0.983203125,
|
|
"epoch": 0.15580155801558015,
|
|
"grad_norm": 0.24872573080678498,
|
|
"learning_rate": 4.753769198252783e-06,
|
|
"loss": 0.7339,
|
|
"mean_token_accuracy": 0.8014431893825531,
|
|
"num_tokens": 114320706.0,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"entropy": 1.07890625,
|
|
"epoch": 0.15716823834905017,
|
|
"grad_norm": 0.2848611768872407,
|
|
"learning_rate": 4.7502465830632665e-06,
|
|
"loss": 0.7867,
|
|
"mean_token_accuracy": 0.7912067651748658,
|
|
"num_tokens": 115361624.0,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"entropy": 0.99609375,
|
|
"epoch": 0.15853491868252015,
|
|
"grad_norm": 0.24188038966545336,
|
|
"learning_rate": 4.74672396787375e-06,
|
|
"loss": 0.7426,
|
|
"mean_token_accuracy": 0.8022179186344147,
|
|
"num_tokens": 116373525.0,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"entropy": 1.0140625,
|
|
"epoch": 0.15990159901599016,
|
|
"grad_norm": 0.21833868623401192,
|
|
"learning_rate": 4.743201352684233e-06,
|
|
"loss": 0.7414,
|
|
"mean_token_accuracy": 0.8013425529003143,
|
|
"num_tokens": 117386597.0,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"entropy": 1.032421875,
|
|
"epoch": 0.16126827934946017,
|
|
"grad_norm": 0.28146630326371136,
|
|
"learning_rate": 4.739678737494716e-06,
|
|
"loss": 0.7736,
|
|
"mean_token_accuracy": 0.79534792304039,
|
|
"num_tokens": 118360572.0,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"entropy": 1.050390625,
|
|
"epoch": 0.16263495968293015,
|
|
"grad_norm": 0.24665056054124185,
|
|
"learning_rate": 4.7361561223052e-06,
|
|
"loss": 0.7552,
|
|
"mean_token_accuracy": 0.7971500277519226,
|
|
"num_tokens": 119348661.0,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"entropy": 1.007421875,
|
|
"epoch": 0.16400164001640016,
|
|
"grad_norm": 0.28404001868480633,
|
|
"learning_rate": 4.7326335071156834e-06,
|
|
"loss": 0.7522,
|
|
"mean_token_accuracy": 0.8005962371826172,
|
|
"num_tokens": 120333852.0,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"entropy": 1.020703125,
|
|
"epoch": 0.16536832034987017,
|
|
"grad_norm": 0.22783139941320435,
|
|
"learning_rate": 4.729110891926166e-06,
|
|
"loss": 0.7694,
|
|
"mean_token_accuracy": 0.7955257773399353,
|
|
"num_tokens": 121367501.0,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"entropy": 1.021875,
|
|
"epoch": 0.16673500068334016,
|
|
"grad_norm": 0.4192305792098781,
|
|
"learning_rate": 4.72558827673665e-06,
|
|
"loss": 0.7701,
|
|
"mean_token_accuracy": 0.7948429048061371,
|
|
"num_tokens": 122322265.0,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"entropy": 1.03203125,
|
|
"epoch": 0.16810168101681017,
|
|
"grad_norm": 0.2506982487862201,
|
|
"learning_rate": 4.722065661547132e-06,
|
|
"loss": 0.7864,
|
|
"mean_token_accuracy": 0.7941976547241211,
|
|
"num_tokens": 123326121.0,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"entropy": 1.03359375,
|
|
"epoch": 0.16946836135028018,
|
|
"grad_norm": 0.2825872897459029,
|
|
"learning_rate": 4.718543046357617e-06,
|
|
"loss": 0.7779,
|
|
"mean_token_accuracy": 0.7937130808830262,
|
|
"num_tokens": 124379656.0,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"entropy": 0.9921875,
|
|
"epoch": 0.17083504168375016,
|
|
"grad_norm": 0.281048129896719,
|
|
"learning_rate": 4.7150204311680995e-06,
|
|
"loss": 0.7395,
|
|
"mean_token_accuracy": 0.800057452917099,
|
|
"num_tokens": 125327601.0,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"entropy": 1.040234375,
|
|
"epoch": 0.17220172201722017,
|
|
"grad_norm": 0.2678773119052515,
|
|
"learning_rate": 4.711497815978583e-06,
|
|
"loss": 0.767,
|
|
"mean_token_accuracy": 0.7956908702850342,
|
|
"num_tokens": 126310987.0,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"entropy": 1.041015625,
|
|
"epoch": 0.17356840235069018,
|
|
"grad_norm": 0.23047870200027679,
|
|
"learning_rate": 4.707975200789066e-06,
|
|
"loss": 0.7818,
|
|
"mean_token_accuracy": 0.7915560960769653,
|
|
"num_tokens": 127351646.0,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"entropy": 1.037109375,
|
|
"epoch": 0.17493508268416016,
|
|
"grad_norm": 0.2947972297284195,
|
|
"learning_rate": 4.704452585599549e-06,
|
|
"loss": 0.7782,
|
|
"mean_token_accuracy": 0.792475038766861,
|
|
"num_tokens": 128345444.0,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"entropy": 1.0265625,
|
|
"epoch": 0.17630176301763018,
|
|
"grad_norm": 0.24688892928734324,
|
|
"learning_rate": 4.700929970410033e-06,
|
|
"loss": 0.7556,
|
|
"mean_token_accuracy": 0.7982993245124816,
|
|
"num_tokens": 129339497.0,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"entropy": 1.00234375,
|
|
"epoch": 0.17766844335110019,
|
|
"grad_norm": 0.25544217489159443,
|
|
"learning_rate": 4.697407355220516e-06,
|
|
"loss": 0.7604,
|
|
"mean_token_accuracy": 0.7958552181720734,
|
|
"num_tokens": 130382964.0,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"entropy": 1.01875,
|
|
"epoch": 0.17903512368457017,
|
|
"grad_norm": 0.26681112472938545,
|
|
"learning_rate": 4.693884740030999e-06,
|
|
"loss": 0.7509,
|
|
"mean_token_accuracy": 0.7961471259593964,
|
|
"num_tokens": 131333722.0,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"entropy": 1.048046875,
|
|
"epoch": 0.18040180401804018,
|
|
"grad_norm": 0.25498408028998343,
|
|
"learning_rate": 4.690362124841483e-06,
|
|
"loss": 0.7889,
|
|
"mean_token_accuracy": 0.7912176668643951,
|
|
"num_tokens": 132332448.0,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"entropy": 1.029296875,
|
|
"epoch": 0.1817684843515102,
|
|
"grad_norm": 0.24364712067063593,
|
|
"learning_rate": 4.686839509651966e-06,
|
|
"loss": 0.7464,
|
|
"mean_token_accuracy": 0.7988901615142823,
|
|
"num_tokens": 133339343.0,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"entropy": 1.031640625,
|
|
"epoch": 0.18313516468498017,
|
|
"grad_norm": 0.2622721578723209,
|
|
"learning_rate": 4.683316894462449e-06,
|
|
"loss": 0.7609,
|
|
"mean_token_accuracy": 0.7961421132087707,
|
|
"num_tokens": 134361824.0,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"entropy": 1.01640625,
|
|
"epoch": 0.18450184501845018,
|
|
"grad_norm": 0.2630890204397792,
|
|
"learning_rate": 4.679794279272933e-06,
|
|
"loss": 0.7715,
|
|
"mean_token_accuracy": 0.7942946672439575,
|
|
"num_tokens": 135366570.0,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"entropy": 1.0375,
|
|
"epoch": 0.1858685253519202,
|
|
"grad_norm": 0.2817034049368372,
|
|
"learning_rate": 4.676271664083416e-06,
|
|
"loss": 0.7473,
|
|
"mean_token_accuracy": 0.7994384944438935,
|
|
"num_tokens": 136388166.0,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"entropy": 1.075390625,
|
|
"epoch": 0.18723520568539018,
|
|
"grad_norm": 0.3022820629206589,
|
|
"learning_rate": 4.6727490488938995e-06,
|
|
"loss": 0.7929,
|
|
"mean_token_accuracy": 0.7904511213302612,
|
|
"num_tokens": 137334309.0,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"entropy": 1.02109375,
|
|
"epoch": 0.1886018860188602,
|
|
"grad_norm": 0.23465115432772674,
|
|
"learning_rate": 4.669226433704382e-06,
|
|
"loss": 0.7629,
|
|
"mean_token_accuracy": 0.7967755675315857,
|
|
"num_tokens": 138333216.0,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"entropy": 1.002734375,
|
|
"epoch": 0.1899685663523302,
|
|
"grad_norm": 0.2684687579121513,
|
|
"learning_rate": 4.665703818514866e-06,
|
|
"loss": 0.749,
|
|
"mean_token_accuracy": 0.7996531963348389,
|
|
"num_tokens": 139302001.0,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"entropy": 1.0125,
|
|
"epoch": 0.19133524668580018,
|
|
"grad_norm": 0.23886448808895905,
|
|
"learning_rate": 4.6621812033253484e-06,
|
|
"loss": 0.7474,
|
|
"mean_token_accuracy": 0.8000539720058442,
|
|
"num_tokens": 140300151.0,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"entropy": 0.940234375,
|
|
"epoch": 0.1927019270192702,
|
|
"grad_norm": 0.24952712982634312,
|
|
"learning_rate": 4.658658588135833e-06,
|
|
"loss": 0.7016,
|
|
"mean_token_accuracy": 0.8097106277942657,
|
|
"num_tokens": 141291771.0,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"entropy": 1.0015625,
|
|
"epoch": 0.1940686073527402,
|
|
"grad_norm": 0.2726730394990391,
|
|
"learning_rate": 4.6551359729463155e-06,
|
|
"loss": 0.7398,
|
|
"mean_token_accuracy": 0.8027740716934204,
|
|
"num_tokens": 142345426.0,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"entropy": 1.0484375,
|
|
"epoch": 0.19543528768621019,
|
|
"grad_norm": 0.25203751848951855,
|
|
"learning_rate": 4.651613357756799e-06,
|
|
"loss": 0.8082,
|
|
"mean_token_accuracy": 0.7851341545581818,
|
|
"num_tokens": 143350038.0,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"entropy": 1.0421875,
|
|
"epoch": 0.1968019680196802,
|
|
"grad_norm": 0.27655795218604695,
|
|
"learning_rate": 4.648090742567283e-06,
|
|
"loss": 0.7722,
|
|
"mean_token_accuracy": 0.7938448488712311,
|
|
"num_tokens": 144364790.0,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"entropy": 1.028125,
|
|
"epoch": 0.1981686483531502,
|
|
"grad_norm": 0.27017107733146906,
|
|
"learning_rate": 4.644568127377765e-06,
|
|
"loss": 0.7543,
|
|
"mean_token_accuracy": 0.7974742949008942,
|
|
"num_tokens": 145393023.0,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"entropy": 1.01015625,
|
|
"epoch": 0.1995353286866202,
|
|
"grad_norm": 0.28580294703486764,
|
|
"learning_rate": 4.641045512188249e-06,
|
|
"loss": 0.7852,
|
|
"mean_token_accuracy": 0.7930036723613739,
|
|
"num_tokens": 146402141.0,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"entropy": 0.9859375,
|
|
"epoch": 0.2009020090200902,
|
|
"grad_norm": 0.25396751020380065,
|
|
"learning_rate": 4.6375228969987324e-06,
|
|
"loss": 0.7319,
|
|
"mean_token_accuracy": 0.8007716417312623,
|
|
"num_tokens": 147429117.0,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"entropy": 1.032421875,
|
|
"epoch": 0.2022686893535602,
|
|
"grad_norm": 0.2744576329564757,
|
|
"learning_rate": 4.634000281809216e-06,
|
|
"loss": 0.7488,
|
|
"mean_token_accuracy": 0.798770934343338,
|
|
"num_tokens": 148449641.0,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"entropy": 0.992578125,
|
|
"epoch": 0.2036353696870302,
|
|
"grad_norm": 0.2451714876468569,
|
|
"learning_rate": 4.630477666619699e-06,
|
|
"loss": 0.7499,
|
|
"mean_token_accuracy": 0.7988981544971466,
|
|
"num_tokens": 149435614.0,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"entropy": 0.98828125,
|
|
"epoch": 0.2050020500205002,
|
|
"grad_norm": 0.2534574515855661,
|
|
"learning_rate": 4.626955051430182e-06,
|
|
"loss": 0.737,
|
|
"mean_token_accuracy": 0.8034734010696412,
|
|
"num_tokens": 150463227.0,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"entropy": 1.05234375,
|
|
"epoch": 0.20636873035397021,
|
|
"grad_norm": 0.29091453884058094,
|
|
"learning_rate": 4.623432436240665e-06,
|
|
"loss": 0.8034,
|
|
"mean_token_accuracy": 0.7883971095085144,
|
|
"num_tokens": 151395436.0,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"entropy": 1.006640625,
|
|
"epoch": 0.2077354106874402,
|
|
"grad_norm": 0.27069175533052503,
|
|
"learning_rate": 4.619909821051149e-06,
|
|
"loss": 0.7429,
|
|
"mean_token_accuracy": 0.8000008761882782,
|
|
"num_tokens": 152324730.0,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"entropy": 0.99921875,
|
|
"epoch": 0.2091020910209102,
|
|
"grad_norm": 0.2735144380830945,
|
|
"learning_rate": 4.616387205861632e-06,
|
|
"loss": 0.7591,
|
|
"mean_token_accuracy": 0.7972996652126312,
|
|
"num_tokens": 153320864.0,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"entropy": 0.988671875,
|
|
"epoch": 0.21046877135438022,
|
|
"grad_norm": 0.25407346265620445,
|
|
"learning_rate": 4.6128645906721156e-06,
|
|
"loss": 0.7522,
|
|
"mean_token_accuracy": 0.798249477148056,
|
|
"num_tokens": 154278191.0,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"entropy": 1.04609375,
|
|
"epoch": 0.2118354516878502,
|
|
"grad_norm": 0.24893415175300265,
|
|
"learning_rate": 4.609341975482598e-06,
|
|
"loss": 0.7635,
|
|
"mean_token_accuracy": 0.7973819434642792,
|
|
"num_tokens": 155275095.0,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"entropy": 1.023828125,
|
|
"epoch": 0.2132021320213202,
|
|
"grad_norm": 0.25671828769711796,
|
|
"learning_rate": 4.605819360293082e-06,
|
|
"loss": 0.7229,
|
|
"mean_token_accuracy": 0.8036675155162811,
|
|
"num_tokens": 156313420.0,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"entropy": 0.978125,
|
|
"epoch": 0.21456881235479022,
|
|
"grad_norm": 0.24555247595065136,
|
|
"learning_rate": 4.602296745103565e-06,
|
|
"loss": 0.6942,
|
|
"mean_token_accuracy": 0.8107061266899109,
|
|
"num_tokens": 157298105.0,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"entropy": 1.01640625,
|
|
"epoch": 0.2159354926882602,
|
|
"grad_norm": 0.2854171572832849,
|
|
"learning_rate": 4.598774129914049e-06,
|
|
"loss": 0.7955,
|
|
"mean_token_accuracy": 0.7906077444553375,
|
|
"num_tokens": 158304186.0,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"entropy": 1.025390625,
|
|
"epoch": 0.21730217302173022,
|
|
"grad_norm": 0.297950252952402,
|
|
"learning_rate": 4.595251514724532e-06,
|
|
"loss": 0.777,
|
|
"mean_token_accuracy": 0.7924073517322541,
|
|
"num_tokens": 159286903.0,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"entropy": 1.005078125,
|
|
"epoch": 0.21866885335520023,
|
|
"grad_norm": 0.2470714796991896,
|
|
"learning_rate": 4.591728899535015e-06,
|
|
"loss": 0.7391,
|
|
"mean_token_accuracy": 0.799606442451477,
|
|
"num_tokens": 160287992.0,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"entropy": 0.978515625,
|
|
"epoch": 0.2200355336886702,
|
|
"grad_norm": 0.25788511395335034,
|
|
"learning_rate": 4.588206284345499e-06,
|
|
"loss": 0.7012,
|
|
"mean_token_accuracy": 0.8103311955928802,
|
|
"num_tokens": 161293325.0,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"entropy": 1.065625,
|
|
"epoch": 0.22140221402214022,
|
|
"grad_norm": 0.302579065480841,
|
|
"learning_rate": 4.584683669155981e-06,
|
|
"loss": 0.8067,
|
|
"mean_token_accuracy": 0.7866389214992523,
|
|
"num_tokens": 162313205.0,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"entropy": 1.035546875,
|
|
"epoch": 0.22276889435561023,
|
|
"grad_norm": 0.25936766703957564,
|
|
"learning_rate": 4.581161053966465e-06,
|
|
"loss": 0.7575,
|
|
"mean_token_accuracy": 0.7989834010601043,
|
|
"num_tokens": 163369684.0,
|
|
"step": 1630
|
|
},
|
|
{
|
|
"entropy": 1.074609375,
|
|
"epoch": 0.2241355746890802,
|
|
"grad_norm": 0.2942360395843982,
|
|
"learning_rate": 4.5776384387769485e-06,
|
|
"loss": 0.781,
|
|
"mean_token_accuracy": 0.7927160680294036,
|
|
"num_tokens": 164375021.0,
|
|
"step": 1640
|
|
},
|
|
{
|
|
"entropy": 0.9984375,
|
|
"epoch": 0.22550225502255022,
|
|
"grad_norm": 0.2786336980683152,
|
|
"learning_rate": 4.574115823587432e-06,
|
|
"loss": 0.7332,
|
|
"mean_token_accuracy": 0.8026651501655578,
|
|
"num_tokens": 165385723.0,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"entropy": 0.997265625,
|
|
"epoch": 0.22686893535602023,
|
|
"grad_norm": 0.25322161523778014,
|
|
"learning_rate": 4.570593208397915e-06,
|
|
"loss": 0.7376,
|
|
"mean_token_accuracy": 0.8021052181720734,
|
|
"num_tokens": 166386777.0,
|
|
"step": 1660
|
|
},
|
|
{
|
|
"entropy": 1.01875,
|
|
"epoch": 0.22823561568949022,
|
|
"grad_norm": 0.2417844877845536,
|
|
"learning_rate": 4.567070593208398e-06,
|
|
"loss": 0.777,
|
|
"mean_token_accuracy": 0.7942221939563752,
|
|
"num_tokens": 167364188.0,
|
|
"step": 1670
|
|
},
|
|
{
|
|
"entropy": 1.008984375,
|
|
"epoch": 0.22960229602296023,
|
|
"grad_norm": 0.27356920926228045,
|
|
"learning_rate": 4.563547978018882e-06,
|
|
"loss": 0.7587,
|
|
"mean_token_accuracy": 0.7959176778793335,
|
|
"num_tokens": 168389909.0,
|
|
"step": 1680
|
|
},
|
|
{
|
|
"entropy": 0.99296875,
|
|
"epoch": 0.23096897635643024,
|
|
"grad_norm": 0.25703380598481207,
|
|
"learning_rate": 4.560025362829365e-06,
|
|
"loss": 0.7475,
|
|
"mean_token_accuracy": 0.798676598072052,
|
|
"num_tokens": 169381885.0,
|
|
"step": 1690
|
|
},
|
|
{
|
|
"entropy": 1.002734375,
|
|
"epoch": 0.23233565668990022,
|
|
"grad_norm": 0.23769151648287512,
|
|
"learning_rate": 4.556502747639848e-06,
|
|
"loss": 0.761,
|
|
"mean_token_accuracy": 0.7962983548641205,
|
|
"num_tokens": 170399072.0,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"entropy": 1.016796875,
|
|
"epoch": 0.23370233702337023,
|
|
"grad_norm": 0.23837957347984054,
|
|
"learning_rate": 4.552980132450332e-06,
|
|
"loss": 0.7628,
|
|
"mean_token_accuracy": 0.7937657177448273,
|
|
"num_tokens": 171449606.0,
|
|
"step": 1710
|
|
},
|
|
{
|
|
"entropy": 0.99921875,
|
|
"epoch": 0.23506901735684024,
|
|
"grad_norm": 0.2340723862060662,
|
|
"learning_rate": 4.549457517260814e-06,
|
|
"loss": 0.7571,
|
|
"mean_token_accuracy": 0.7996393203735351,
|
|
"num_tokens": 172478002.0,
|
|
"step": 1720
|
|
},
|
|
{
|
|
"entropy": 0.99765625,
|
|
"epoch": 0.23643569769031023,
|
|
"grad_norm": 0.263248309725613,
|
|
"learning_rate": 4.545934902071298e-06,
|
|
"loss": 0.7276,
|
|
"mean_token_accuracy": 0.8038212478160858,
|
|
"num_tokens": 173536624.0,
|
|
"step": 1730
|
|
},
|
|
{
|
|
"entropy": 1.044140625,
|
|
"epoch": 0.23780237802378024,
|
|
"grad_norm": 0.2721766194250885,
|
|
"learning_rate": 4.5424122868817814e-06,
|
|
"loss": 0.759,
|
|
"mean_token_accuracy": 0.7957892894744873,
|
|
"num_tokens": 174499171.0,
|
|
"step": 1740
|
|
},
|
|
{
|
|
"entropy": 0.98046875,
|
|
"epoch": 0.23916905835725025,
|
|
"grad_norm": 0.24998310538728302,
|
|
"learning_rate": 4.538889671692265e-06,
|
|
"loss": 0.7332,
|
|
"mean_token_accuracy": 0.8048851668834687,
|
|
"num_tokens": 175471599.0,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"entropy": 0.995703125,
|
|
"epoch": 0.24053573869072023,
|
|
"grad_norm": 0.2766967841121009,
|
|
"learning_rate": 4.535367056502748e-06,
|
|
"loss": 0.7413,
|
|
"mean_token_accuracy": 0.800340610742569,
|
|
"num_tokens": 176498065.0,
|
|
"step": 1760
|
|
},
|
|
{
|
|
"entropy": 1.021875,
|
|
"epoch": 0.24190241902419024,
|
|
"grad_norm": 0.24360246913833164,
|
|
"learning_rate": 4.531844441313231e-06,
|
|
"loss": 0.7687,
|
|
"mean_token_accuracy": 0.7943305015563965,
|
|
"num_tokens": 177499643.0,
|
|
"step": 1770
|
|
},
|
|
{
|
|
"entropy": 0.980078125,
|
|
"epoch": 0.24326909935766025,
|
|
"grad_norm": 0.24045729220712034,
|
|
"learning_rate": 4.528321826123715e-06,
|
|
"loss": 0.7074,
|
|
"mean_token_accuracy": 0.8081358015537262,
|
|
"num_tokens": 178477704.0,
|
|
"step": 1780
|
|
},
|
|
{
|
|
"entropy": 1.025,
|
|
"epoch": 0.24463577969113023,
|
|
"grad_norm": 0.23531289596419974,
|
|
"learning_rate": 4.524799210934198e-06,
|
|
"loss": 0.7369,
|
|
"mean_token_accuracy": 0.8022581458091735,
|
|
"num_tokens": 179484701.0,
|
|
"step": 1790
|
|
},
|
|
{
|
|
"entropy": 1.014453125,
|
|
"epoch": 0.24600246002460024,
|
|
"grad_norm": 0.2520866113484783,
|
|
"learning_rate": 4.521276595744681e-06,
|
|
"loss": 0.7024,
|
|
"mean_token_accuracy": 0.8115744054317474,
|
|
"num_tokens": 180460840.0,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"entropy": 1.02421875,
|
|
"epoch": 0.24736914035807026,
|
|
"grad_norm": 0.27171297122525034,
|
|
"learning_rate": 4.5177539805551646e-06,
|
|
"loss": 0.7629,
|
|
"mean_token_accuracy": 0.7976900994777679,
|
|
"num_tokens": 181453261.0,
|
|
"step": 1810
|
|
},
|
|
{
|
|
"entropy": 1.003515625,
|
|
"epoch": 0.24873582069154024,
|
|
"grad_norm": 0.2751604580214286,
|
|
"learning_rate": 4.514231365365648e-06,
|
|
"loss": 0.7169,
|
|
"mean_token_accuracy": 0.8066557288169861,
|
|
"num_tokens": 182417078.0,
|
|
"step": 1820
|
|
},
|
|
{
|
|
"entropy": 1.01328125,
|
|
"epoch": 0.25010250102501025,
|
|
"grad_norm": 0.25238415896377436,
|
|
"learning_rate": 4.510708750176131e-06,
|
|
"loss": 0.7434,
|
|
"mean_token_accuracy": 0.7991031289100647,
|
|
"num_tokens": 183391495.0,
|
|
"step": 1830
|
|
},
|
|
{
|
|
"entropy": 0.994140625,
|
|
"epoch": 0.25146918135848023,
|
|
"grad_norm": 0.2560116639060716,
|
|
"learning_rate": 4.507186134986614e-06,
|
|
"loss": 0.7311,
|
|
"mean_token_accuracy": 0.8045649111270905,
|
|
"num_tokens": 184444423.0,
|
|
"step": 1840
|
|
},
|
|
{
|
|
"entropy": 0.9859375,
|
|
"epoch": 0.25283586169195027,
|
|
"grad_norm": 0.2399119346404923,
|
|
"learning_rate": 4.503663519797098e-06,
|
|
"loss": 0.7183,
|
|
"mean_token_accuracy": 0.805068290233612,
|
|
"num_tokens": 185464205.0,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"entropy": 1.0015625,
|
|
"epoch": 0.25420254202542025,
|
|
"grad_norm": 0.26309872216722696,
|
|
"learning_rate": 4.5001409046075814e-06,
|
|
"loss": 0.7341,
|
|
"mean_token_accuracy": 0.8023520052433014,
|
|
"num_tokens": 186450985.0,
|
|
"step": 1860
|
|
},
|
|
{
|
|
"entropy": 0.98359375,
|
|
"epoch": 0.25556922235889024,
|
|
"grad_norm": 0.2274511708107594,
|
|
"learning_rate": 4.496618289418064e-06,
|
|
"loss": 0.7209,
|
|
"mean_token_accuracy": 0.8060740411281586,
|
|
"num_tokens": 187494172.0,
|
|
"step": 1870
|
|
},
|
|
{
|
|
"entropy": 0.9921875,
|
|
"epoch": 0.2569359026923603,
|
|
"grad_norm": 0.27526389814921337,
|
|
"learning_rate": 4.493095674228548e-06,
|
|
"loss": 0.7352,
|
|
"mean_token_accuracy": 0.8026797473430634,
|
|
"num_tokens": 188466326.0,
|
|
"step": 1880
|
|
},
|
|
{
|
|
"entropy": 1.02890625,
|
|
"epoch": 0.25830258302583026,
|
|
"grad_norm": 0.25083065747240735,
|
|
"learning_rate": 4.48957305903903e-06,
|
|
"loss": 0.7674,
|
|
"mean_token_accuracy": 0.7954668760299682,
|
|
"num_tokens": 189486495.0,
|
|
"step": 1890
|
|
},
|
|
{
|
|
"entropy": 1.02421875,
|
|
"epoch": 0.25966926335930024,
|
|
"grad_norm": 0.27884238766085484,
|
|
"learning_rate": 4.486050443849515e-06,
|
|
"loss": 0.7225,
|
|
"mean_token_accuracy": 0.8058617889881134,
|
|
"num_tokens": 190471394.0,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"entropy": 1.002734375,
|
|
"epoch": 0.2610359436927703,
|
|
"grad_norm": 0.23472685157018228,
|
|
"learning_rate": 4.4825278286599975e-06,
|
|
"loss": 0.7327,
|
|
"mean_token_accuracy": 0.8030340790748596,
|
|
"num_tokens": 191482976.0,
|
|
"step": 1910
|
|
},
|
|
{
|
|
"entropy": 0.972265625,
|
|
"epoch": 0.26240262402624026,
|
|
"grad_norm": 0.28397412347296475,
|
|
"learning_rate": 4.479005213470481e-06,
|
|
"loss": 0.7378,
|
|
"mean_token_accuracy": 0.8021346867084503,
|
|
"num_tokens": 192487003.0,
|
|
"step": 1920
|
|
},
|
|
{
|
|
"entropy": 1.0125,
|
|
"epoch": 0.26376930435971024,
|
|
"grad_norm": 0.2836451434043928,
|
|
"learning_rate": 4.475482598280964e-06,
|
|
"loss": 0.7895,
|
|
"mean_token_accuracy": 0.7863537847995759,
|
|
"num_tokens": 193484373.0,
|
|
"step": 1930
|
|
},
|
|
{
|
|
"entropy": 0.99453125,
|
|
"epoch": 0.2651359846931803,
|
|
"grad_norm": 0.2691424396695675,
|
|
"learning_rate": 4.471959983091447e-06,
|
|
"loss": 0.7401,
|
|
"mean_token_accuracy": 0.8019933998584747,
|
|
"num_tokens": 194489877.0,
|
|
"step": 1940
|
|
},
|
|
{
|
|
"entropy": 1.017578125,
|
|
"epoch": 0.26650266502665027,
|
|
"grad_norm": 0.26333380748681995,
|
|
"learning_rate": 4.468437367901931e-06,
|
|
"loss": 0.7262,
|
|
"mean_token_accuracy": 0.8043246507644654,
|
|
"num_tokens": 195497240.0,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"entropy": 1.03828125,
|
|
"epoch": 0.26786934536012025,
|
|
"grad_norm": 0.271840033215779,
|
|
"learning_rate": 4.464914752712414e-06,
|
|
"loss": 0.7773,
|
|
"mean_token_accuracy": 0.7933602452278137,
|
|
"num_tokens": 196488733.0,
|
|
"step": 1960
|
|
},
|
|
{
|
|
"entropy": 0.97109375,
|
|
"epoch": 0.2692360256935903,
|
|
"grad_norm": 0.24806927300741988,
|
|
"learning_rate": 4.461392137522897e-06,
|
|
"loss": 0.7281,
|
|
"mean_token_accuracy": 0.8022521317005158,
|
|
"num_tokens": 197524439.0,
|
|
"step": 1970
|
|
},
|
|
{
|
|
"entropy": 0.970703125,
|
|
"epoch": 0.27060270602706027,
|
|
"grad_norm": 0.24395035922167785,
|
|
"learning_rate": 4.457869522333381e-06,
|
|
"loss": 0.7208,
|
|
"mean_token_accuracy": 0.8056804776191712,
|
|
"num_tokens": 198500937.0,
|
|
"step": 1980
|
|
},
|
|
{
|
|
"entropy": 0.99765625,
|
|
"epoch": 0.27196938636053025,
|
|
"grad_norm": 0.2553909285756214,
|
|
"learning_rate": 4.454346907143864e-06,
|
|
"loss": 0.7275,
|
|
"mean_token_accuracy": 0.8059855997562408,
|
|
"num_tokens": 199495588.0,
|
|
"step": 1990
|
|
},
|
|
{
|
|
"entropy": 1.039453125,
|
|
"epoch": 0.2733360666940003,
|
|
"grad_norm": 0.2593542396163577,
|
|
"learning_rate": 4.450824291954347e-06,
|
|
"loss": 0.7436,
|
|
"mean_token_accuracy": 0.8011988937854767,
|
|
"num_tokens": 200506609.0,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"entropy": 0.978125,
|
|
"epoch": 0.2747027470274703,
|
|
"grad_norm": 0.22155319389109387,
|
|
"learning_rate": 4.44730167676483e-06,
|
|
"loss": 0.7052,
|
|
"mean_token_accuracy": 0.809945809841156,
|
|
"num_tokens": 201514736.0,
|
|
"step": 2010
|
|
},
|
|
{
|
|
"entropy": 1.008984375,
|
|
"epoch": 0.27606942736094026,
|
|
"grad_norm": 0.257671310255337,
|
|
"learning_rate": 4.443779061575314e-06,
|
|
"loss": 0.7598,
|
|
"mean_token_accuracy": 0.796879768371582,
|
|
"num_tokens": 202528916.0,
|
|
"step": 2020
|
|
},
|
|
{
|
|
"entropy": 0.966015625,
|
|
"epoch": 0.2774361076944103,
|
|
"grad_norm": 0.2818892569603837,
|
|
"learning_rate": 4.4402564463857975e-06,
|
|
"loss": 0.7104,
|
|
"mean_token_accuracy": 0.8069518506526947,
|
|
"num_tokens": 203493505.0,
|
|
"step": 2030
|
|
},
|
|
{
|
|
"entropy": 1.00546875,
|
|
"epoch": 0.2788027880278803,
|
|
"grad_norm": 0.23891974283094689,
|
|
"learning_rate": 4.43673383119628e-06,
|
|
"loss": 0.7334,
|
|
"mean_token_accuracy": 0.8015766143798828,
|
|
"num_tokens": 204472127.0,
|
|
"step": 2040
|
|
},
|
|
{
|
|
"entropy": 0.994140625,
|
|
"epoch": 0.28016946836135026,
|
|
"grad_norm": 0.24886501203553657,
|
|
"learning_rate": 4.433211216006764e-06,
|
|
"loss": 0.7353,
|
|
"mean_token_accuracy": 0.8012044847011566,
|
|
"num_tokens": 205444690.0,
|
|
"step": 2050
|
|
},
|
|
{
|
|
"entropy": 0.980859375,
|
|
"epoch": 0.2815361486948203,
|
|
"grad_norm": 0.2332848126385131,
|
|
"learning_rate": 4.4296886008172465e-06,
|
|
"loss": 0.7403,
|
|
"mean_token_accuracy": 0.7991748750209808,
|
|
"num_tokens": 206433420.0,
|
|
"step": 2060
|
|
},
|
|
{
|
|
"entropy": 1.00078125,
|
|
"epoch": 0.2829028290282903,
|
|
"grad_norm": 0.2539440921339334,
|
|
"learning_rate": 4.426165985627731e-06,
|
|
"loss": 0.7189,
|
|
"mean_token_accuracy": 0.8060760140419007,
|
|
"num_tokens": 207474650.0,
|
|
"step": 2070
|
|
},
|
|
{
|
|
"entropy": 0.9640625,
|
|
"epoch": 0.28426950936176026,
|
|
"grad_norm": 0.25475745820059276,
|
|
"learning_rate": 4.4226433704382136e-06,
|
|
"loss": 0.7403,
|
|
"mean_token_accuracy": 0.8029857754707337,
|
|
"num_tokens": 208449182.0,
|
|
"step": 2080
|
|
},
|
|
{
|
|
"entropy": 0.985546875,
|
|
"epoch": 0.2856361896952303,
|
|
"grad_norm": 0.24424317922466723,
|
|
"learning_rate": 4.419120755248697e-06,
|
|
"loss": 0.721,
|
|
"mean_token_accuracy": 0.8057885289192199,
|
|
"num_tokens": 209450690.0,
|
|
"step": 2090
|
|
},
|
|
{
|
|
"entropy": 1.066796875,
|
|
"epoch": 0.2870028700287003,
|
|
"grad_norm": 0.23717008387182112,
|
|
"learning_rate": 4.41559814005918e-06,
|
|
"loss": 0.7886,
|
|
"mean_token_accuracy": 0.7902935445308685,
|
|
"num_tokens": 210469459.0,
|
|
"step": 2100
|
|
},
|
|
{
|
|
"entropy": 0.9859375,
|
|
"epoch": 0.28836955036217027,
|
|
"grad_norm": 0.25605985113061497,
|
|
"learning_rate": 4.412075524869663e-06,
|
|
"loss": 0.7322,
|
|
"mean_token_accuracy": 0.8038410365581512,
|
|
"num_tokens": 211422588.0,
|
|
"step": 2110
|
|
},
|
|
{
|
|
"entropy": 1.022265625,
|
|
"epoch": 0.2897362306956403,
|
|
"grad_norm": 0.25963337446589746,
|
|
"learning_rate": 4.408552909680147e-06,
|
|
"loss": 0.766,
|
|
"mean_token_accuracy": 0.795734828710556,
|
|
"num_tokens": 212401656.0,
|
|
"step": 2120
|
|
},
|
|
{
|
|
"entropy": 1.0,
|
|
"epoch": 0.2911029110291103,
|
|
"grad_norm": 0.24958807811710146,
|
|
"learning_rate": 4.4050302944906304e-06,
|
|
"loss": 0.735,
|
|
"mean_token_accuracy": 0.8010703742504119,
|
|
"num_tokens": 213418240.0,
|
|
"step": 2130
|
|
},
|
|
{
|
|
"entropy": 0.991796875,
|
|
"epoch": 0.2924695913625803,
|
|
"grad_norm": 0.27365650819643095,
|
|
"learning_rate": 4.401507679301113e-06,
|
|
"loss": 0.7236,
|
|
"mean_token_accuracy": 0.8033260107040405,
|
|
"num_tokens": 214387238.0,
|
|
"step": 2140
|
|
},
|
|
{
|
|
"entropy": 1.063671875,
|
|
"epoch": 0.2938362716960503,
|
|
"grad_norm": 0.3002519483513338,
|
|
"learning_rate": 4.397985064111597e-06,
|
|
"loss": 0.7942,
|
|
"mean_token_accuracy": 0.7895711421966553,
|
|
"num_tokens": 215412774.0,
|
|
"step": 2150
|
|
},
|
|
{
|
|
"entropy": 1.01875,
|
|
"epoch": 0.2952029520295203,
|
|
"grad_norm": 0.24538082219085822,
|
|
"learning_rate": 4.39446244892208e-06,
|
|
"loss": 0.7399,
|
|
"mean_token_accuracy": 0.8014118432998657,
|
|
"num_tokens": 216404116.0,
|
|
"step": 2160
|
|
},
|
|
{
|
|
"entropy": 0.998046875,
|
|
"epoch": 0.2965696323629903,
|
|
"grad_norm": 0.2889999326970343,
|
|
"learning_rate": 4.390939833732563e-06,
|
|
"loss": 0.7494,
|
|
"mean_token_accuracy": 0.7979825675487519,
|
|
"num_tokens": 217329569.0,
|
|
"step": 2170
|
|
},
|
|
{
|
|
"entropy": 1.00234375,
|
|
"epoch": 0.2979363126964603,
|
|
"grad_norm": 0.2632157539116983,
|
|
"learning_rate": 4.387417218543047e-06,
|
|
"loss": 0.739,
|
|
"mean_token_accuracy": 0.8001116394996644,
|
|
"num_tokens": 218348233.0,
|
|
"step": 2180
|
|
},
|
|
{
|
|
"entropy": 0.973046875,
|
|
"epoch": 0.2993029930299303,
|
|
"grad_norm": 0.261781352500626,
|
|
"learning_rate": 4.38389460335353e-06,
|
|
"loss": 0.693,
|
|
"mean_token_accuracy": 0.8116661906242371,
|
|
"num_tokens": 219347779.0,
|
|
"step": 2190
|
|
},
|
|
{
|
|
"entropy": 0.99609375,
|
|
"epoch": 0.3006696733634003,
|
|
"grad_norm": 0.23544276250392693,
|
|
"learning_rate": 4.380371988164014e-06,
|
|
"loss": 0.7712,
|
|
"mean_token_accuracy": 0.7938435077667236,
|
|
"num_tokens": 220403938.0,
|
|
"step": 2200
|
|
},
|
|
{
|
|
"entropy": 0.98984375,
|
|
"epoch": 0.3020363536968703,
|
|
"grad_norm": 0.24721676476602386,
|
|
"learning_rate": 4.376849372974496e-06,
|
|
"loss": 0.724,
|
|
"mean_token_accuracy": 0.8053905010223389,
|
|
"num_tokens": 221435776.0,
|
|
"step": 2210
|
|
},
|
|
{
|
|
"entropy": 0.97734375,
|
|
"epoch": 0.3034030340303403,
|
|
"grad_norm": 0.2413015746536456,
|
|
"learning_rate": 4.37332675778498e-06,
|
|
"loss": 0.7326,
|
|
"mean_token_accuracy": 0.8024221658706665,
|
|
"num_tokens": 222450369.0,
|
|
"step": 2220
|
|
},
|
|
{
|
|
"entropy": 0.992578125,
|
|
"epoch": 0.3047697143638103,
|
|
"grad_norm": 0.25630627893442165,
|
|
"learning_rate": 4.369804142595463e-06,
|
|
"loss": 0.7563,
|
|
"mean_token_accuracy": 0.7984445512294769,
|
|
"num_tokens": 223430185.0,
|
|
"step": 2230
|
|
},
|
|
{
|
|
"entropy": 1.001953125,
|
|
"epoch": 0.3061363946972803,
|
|
"grad_norm": 0.25250258269791337,
|
|
"learning_rate": 4.366281527405947e-06,
|
|
"loss": 0.7454,
|
|
"mean_token_accuracy": 0.8007151007652282,
|
|
"num_tokens": 224476704.0,
|
|
"step": 2240
|
|
},
|
|
{
|
|
"entropy": 0.966015625,
|
|
"epoch": 0.3075030750307503,
|
|
"grad_norm": 0.2535508163189196,
|
|
"learning_rate": 4.36275891221643e-06,
|
|
"loss": 0.7072,
|
|
"mean_token_accuracy": 0.8054208517074585,
|
|
"num_tokens": 225491846.0,
|
|
"step": 2250
|
|
},
|
|
{
|
|
"entropy": 0.963671875,
|
|
"epoch": 0.3088697553642203,
|
|
"grad_norm": 0.2680343545666299,
|
|
"learning_rate": 4.359236297026913e-06,
|
|
"loss": 0.7253,
|
|
"mean_token_accuracy": 0.8046623408794403,
|
|
"num_tokens": 226484127.0,
|
|
"step": 2260
|
|
},
|
|
{
|
|
"entropy": 0.951953125,
|
|
"epoch": 0.3102364356976903,
|
|
"grad_norm": 0.2896783439651311,
|
|
"learning_rate": 4.355713681837396e-06,
|
|
"loss": 0.6998,
|
|
"mean_token_accuracy": 0.8099641323089599,
|
|
"num_tokens": 227474908.0,
|
|
"step": 2270
|
|
},
|
|
{
|
|
"entropy": 0.974609375,
|
|
"epoch": 0.3116031160311603,
|
|
"grad_norm": 0.25794036769959017,
|
|
"learning_rate": 4.352191066647879e-06,
|
|
"loss": 0.7266,
|
|
"mean_token_accuracy": 0.8024690568447113,
|
|
"num_tokens": 228463177.0,
|
|
"step": 2280
|
|
},
|
|
{
|
|
"entropy": 0.99453125,
|
|
"epoch": 0.3129697963646303,
|
|
"grad_norm": 0.2803611250223741,
|
|
"learning_rate": 4.348668451458363e-06,
|
|
"loss": 0.7502,
|
|
"mean_token_accuracy": 0.7996525347232819,
|
|
"num_tokens": 229469712.0,
|
|
"step": 2290
|
|
},
|
|
{
|
|
"entropy": 1.006640625,
|
|
"epoch": 0.31433647669810033,
|
|
"grad_norm": 0.24392136626812433,
|
|
"learning_rate": 4.3451458362688465e-06,
|
|
"loss": 0.7387,
|
|
"mean_token_accuracy": 0.8018359959125518,
|
|
"num_tokens": 230474108.0,
|
|
"step": 2300
|
|
},
|
|
{
|
|
"entropy": 1.02265625,
|
|
"epoch": 0.3157031570315703,
|
|
"grad_norm": 0.24265278255200884,
|
|
"learning_rate": 4.34162322107933e-06,
|
|
"loss": 0.7293,
|
|
"mean_token_accuracy": 0.8046337902545929,
|
|
"num_tokens": 231443208.0,
|
|
"step": 2310
|
|
},
|
|
{
|
|
"entropy": 1.00546875,
|
|
"epoch": 0.3170698373650403,
|
|
"grad_norm": 0.2538208193178827,
|
|
"learning_rate": 4.338100605889813e-06,
|
|
"loss": 0.726,
|
|
"mean_token_accuracy": 0.805007541179657,
|
|
"num_tokens": 232407706.0,
|
|
"step": 2320
|
|
},
|
|
{
|
|
"entropy": 0.969140625,
|
|
"epoch": 0.31843651769851034,
|
|
"grad_norm": 0.24900781097612046,
|
|
"learning_rate": 4.334577990700296e-06,
|
|
"loss": 0.6637,
|
|
"mean_token_accuracy": 0.8197141110897064,
|
|
"num_tokens": 233367033.0,
|
|
"step": 2330
|
|
},
|
|
{
|
|
"entropy": 1.03125,
|
|
"epoch": 0.3198031980319803,
|
|
"grad_norm": 0.2634505959942912,
|
|
"learning_rate": 4.33105537551078e-06,
|
|
"loss": 0.772,
|
|
"mean_token_accuracy": 0.7944820582866668,
|
|
"num_tokens": 234337713.0,
|
|
"step": 2340
|
|
},
|
|
{
|
|
"entropy": 0.977734375,
|
|
"epoch": 0.3211698783654503,
|
|
"grad_norm": 0.25510172763163713,
|
|
"learning_rate": 4.327532760321263e-06,
|
|
"loss": 0.7048,
|
|
"mean_token_accuracy": 0.8098583579063415,
|
|
"num_tokens": 235293773.0,
|
|
"step": 2350
|
|
},
|
|
{
|
|
"entropy": 0.987109375,
|
|
"epoch": 0.32253655869892034,
|
|
"grad_norm": 0.27894575690381523,
|
|
"learning_rate": 4.324010145131746e-06,
|
|
"loss": 0.7525,
|
|
"mean_token_accuracy": 0.7987415134906769,
|
|
"num_tokens": 236278533.0,
|
|
"step": 2360
|
|
},
|
|
{
|
|
"entropy": 1.00078125,
|
|
"epoch": 0.3239032390323903,
|
|
"grad_norm": 0.22695592514519738,
|
|
"learning_rate": 4.32048752994223e-06,
|
|
"loss": 0.7377,
|
|
"mean_token_accuracy": 0.8018962144851685,
|
|
"num_tokens": 237320727.0,
|
|
"step": 2370
|
|
},
|
|
{
|
|
"entropy": 1.016796875,
|
|
"epoch": 0.3252699193658603,
|
|
"grad_norm": 0.2385946073138185,
|
|
"learning_rate": 4.316964914752712e-06,
|
|
"loss": 0.7457,
|
|
"mean_token_accuracy": 0.7996088624000549,
|
|
"num_tokens": 238313682.0,
|
|
"step": 2380
|
|
},
|
|
{
|
|
"entropy": 1.0078125,
|
|
"epoch": 0.32663659969933034,
|
|
"grad_norm": 0.2934593737944774,
|
|
"learning_rate": 4.313442299563196e-06,
|
|
"loss": 0.7931,
|
|
"mean_token_accuracy": 0.7916855871677398,
|
|
"num_tokens": 239272562.0,
|
|
"step": 2390
|
|
},
|
|
{
|
|
"entropy": 0.985546875,
|
|
"epoch": 0.3280032800328003,
|
|
"grad_norm": 0.27845850883109524,
|
|
"learning_rate": 4.3099196843736794e-06,
|
|
"loss": 0.7374,
|
|
"mean_token_accuracy": 0.8023624956607819,
|
|
"num_tokens": 240247837.0,
|
|
"step": 2400
|
|
},
|
|
{
|
|
"entropy": 0.996484375,
|
|
"epoch": 0.3293699603662703,
|
|
"grad_norm": 0.2443243906422597,
|
|
"learning_rate": 4.306397069184163e-06,
|
|
"loss": 0.7272,
|
|
"mean_token_accuracy": 0.8023759543895721,
|
|
"num_tokens": 241244375.0,
|
|
"step": 2410
|
|
},
|
|
{
|
|
"entropy": 1.005859375,
|
|
"epoch": 0.33073664069974035,
|
|
"grad_norm": 0.28440369781530966,
|
|
"learning_rate": 4.302874453994646e-06,
|
|
"loss": 0.7566,
|
|
"mean_token_accuracy": 0.7965581834316253,
|
|
"num_tokens": 242235921.0,
|
|
"step": 2420
|
|
},
|
|
{
|
|
"entropy": 0.996484375,
|
|
"epoch": 0.33210332103321033,
|
|
"grad_norm": 0.2658154634328216,
|
|
"learning_rate": 4.299351838805129e-06,
|
|
"loss": 0.7119,
|
|
"mean_token_accuracy": 0.8074360489845276,
|
|
"num_tokens": 243226532.0,
|
|
"step": 2430
|
|
},
|
|
{
|
|
"entropy": 1.009765625,
|
|
"epoch": 0.3334700013666803,
|
|
"grad_norm": 0.24023947361903683,
|
|
"learning_rate": 4.295829223615613e-06,
|
|
"loss": 0.7434,
|
|
"mean_token_accuracy": 0.8007214426994324,
|
|
"num_tokens": 244230951.0,
|
|
"step": 2440
|
|
},
|
|
{
|
|
"entropy": 1.01484375,
|
|
"epoch": 0.33483668170015035,
|
|
"grad_norm": 0.2768243766132687,
|
|
"learning_rate": 4.292306608426096e-06,
|
|
"loss": 0.7384,
|
|
"mean_token_accuracy": 0.8011974692344666,
|
|
"num_tokens": 245216118.0,
|
|
"step": 2450
|
|
},
|
|
{
|
|
"entropy": 0.961328125,
|
|
"epoch": 0.33620336203362033,
|
|
"grad_norm": 0.23051642325636065,
|
|
"learning_rate": 4.288783993236579e-06,
|
|
"loss": 0.7204,
|
|
"mean_token_accuracy": 0.8057211577892304,
|
|
"num_tokens": 246233429.0,
|
|
"step": 2460
|
|
},
|
|
{
|
|
"entropy": 1.014453125,
|
|
"epoch": 0.3375700423670903,
|
|
"grad_norm": 0.2577115299865729,
|
|
"learning_rate": 4.285261378047063e-06,
|
|
"loss": 0.7211,
|
|
"mean_token_accuracy": 0.8048647463321685,
|
|
"num_tokens": 247241545.0,
|
|
"step": 2470
|
|
},
|
|
{
|
|
"entropy": 0.995703125,
|
|
"epoch": 0.33893672270056036,
|
|
"grad_norm": 0.2573465255225568,
|
|
"learning_rate": 4.281738762857546e-06,
|
|
"loss": 0.7385,
|
|
"mean_token_accuracy": 0.7998440861701965,
|
|
"num_tokens": 248252703.0,
|
|
"step": 2480
|
|
},
|
|
{
|
|
"entropy": 1.042578125,
|
|
"epoch": 0.34030340303403034,
|
|
"grad_norm": 0.27265652444462435,
|
|
"learning_rate": 4.278216147668029e-06,
|
|
"loss": 0.7418,
|
|
"mean_token_accuracy": 0.8012705683708191,
|
|
"num_tokens": 249259960.0,
|
|
"step": 2490
|
|
},
|
|
{
|
|
"entropy": 1.000390625,
|
|
"epoch": 0.3416700833675003,
|
|
"grad_norm": 0.25776278280851483,
|
|
"learning_rate": 4.274693532478512e-06,
|
|
"loss": 0.7747,
|
|
"mean_token_accuracy": 0.7924128174781799,
|
|
"num_tokens": 250256940.0,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"entropy": 0.9578125,
|
|
"epoch": 0.34303676370097036,
|
|
"grad_norm": 0.23153658688361312,
|
|
"learning_rate": 4.271170917288996e-06,
|
|
"loss": 0.7152,
|
|
"mean_token_accuracy": 0.8065634608268738,
|
|
"num_tokens": 251256658.0,
|
|
"step": 2510
|
|
},
|
|
{
|
|
"entropy": 0.98828125,
|
|
"epoch": 0.34440344403444034,
|
|
"grad_norm": 0.2717186607374063,
|
|
"learning_rate": 4.2676483020994795e-06,
|
|
"loss": 0.713,
|
|
"mean_token_accuracy": 0.8070283710956574,
|
|
"num_tokens": 252264359.0,
|
|
"step": 2520
|
|
},
|
|
{
|
|
"entropy": 1.003515625,
|
|
"epoch": 0.3457701243679103,
|
|
"grad_norm": 0.25820550377659013,
|
|
"learning_rate": 4.264125686909962e-06,
|
|
"loss": 0.7576,
|
|
"mean_token_accuracy": 0.7974042117595672,
|
|
"num_tokens": 253309857.0,
|
|
"step": 2530
|
|
},
|
|
{
|
|
"entropy": 1.007421875,
|
|
"epoch": 0.34713680470138036,
|
|
"grad_norm": 0.25187492257651223,
|
|
"learning_rate": 4.260603071720446e-06,
|
|
"loss": 0.761,
|
|
"mean_token_accuracy": 0.7977884113788605,
|
|
"num_tokens": 254290565.0,
|
|
"step": 2540
|
|
},
|
|
{
|
|
"entropy": 1.037109375,
|
|
"epoch": 0.34850348503485035,
|
|
"grad_norm": 0.27067487263585366,
|
|
"learning_rate": 4.257080456530928e-06,
|
|
"loss": 0.7649,
|
|
"mean_token_accuracy": 0.7948747456073761,
|
|
"num_tokens": 255281492.0,
|
|
"step": 2550
|
|
},
|
|
{
|
|
"entropy": 0.975,
|
|
"epoch": 0.34987016536832033,
|
|
"grad_norm": 0.25979685872273733,
|
|
"learning_rate": 4.253557841341413e-06,
|
|
"loss": 0.6999,
|
|
"mean_token_accuracy": 0.8092234492301941,
|
|
"num_tokens": 256296392.0,
|
|
"step": 2560
|
|
},
|
|
{
|
|
"entropy": 0.988671875,
|
|
"epoch": 0.35123684570179037,
|
|
"grad_norm": 0.25693441269771655,
|
|
"learning_rate": 4.2500352261518955e-06,
|
|
"loss": 0.727,
|
|
"mean_token_accuracy": 0.8030635416507721,
|
|
"num_tokens": 257302063.0,
|
|
"step": 2570
|
|
},
|
|
{
|
|
"entropy": 0.944921875,
|
|
"epoch": 0.35260352603526035,
|
|
"grad_norm": 0.2542933764246173,
|
|
"learning_rate": 4.246512610962379e-06,
|
|
"loss": 0.7125,
|
|
"mean_token_accuracy": 0.8075656712055206,
|
|
"num_tokens": 258304554.0,
|
|
"step": 2580
|
|
},
|
|
{
|
|
"entropy": 1.0109375,
|
|
"epoch": 0.35397020636873033,
|
|
"grad_norm": 0.2669182840123564,
|
|
"learning_rate": 4.242989995772862e-06,
|
|
"loss": 0.7419,
|
|
"mean_token_accuracy": 0.8004383385181427,
|
|
"num_tokens": 259259663.0,
|
|
"step": 2590
|
|
},
|
|
{
|
|
"entropy": 1.0015625,
|
|
"epoch": 0.35533688670220037,
|
|
"grad_norm": 0.2419486996983105,
|
|
"learning_rate": 4.239467380583345e-06,
|
|
"loss": 0.7442,
|
|
"mean_token_accuracy": 0.8002930700778961,
|
|
"num_tokens": 260318431.0,
|
|
"step": 2600
|
|
},
|
|
{
|
|
"entropy": 0.96796875,
|
|
"epoch": 0.35670356703567035,
|
|
"grad_norm": 0.24270535852426875,
|
|
"learning_rate": 4.235944765393829e-06,
|
|
"loss": 0.6989,
|
|
"mean_token_accuracy": 0.8104400515556336,
|
|
"num_tokens": 261314415.0,
|
|
"step": 2610
|
|
},
|
|
{
|
|
"entropy": 0.990625,
|
|
"epoch": 0.35807024736914034,
|
|
"grad_norm": 0.27780819102502297,
|
|
"learning_rate": 4.232422150204312e-06,
|
|
"loss": 0.7503,
|
|
"mean_token_accuracy": 0.7971685886383056,
|
|
"num_tokens": 262280825.0,
|
|
"step": 2620
|
|
},
|
|
{
|
|
"entropy": 1.042578125,
|
|
"epoch": 0.3594369277026104,
|
|
"grad_norm": 0.24955288018064206,
|
|
"learning_rate": 4.228899535014795e-06,
|
|
"loss": 0.7679,
|
|
"mean_token_accuracy": 0.7934244096279144,
|
|
"num_tokens": 263248393.0,
|
|
"step": 2630
|
|
},
|
|
{
|
|
"entropy": 0.9921875,
|
|
"epoch": 0.36080360803608036,
|
|
"grad_norm": 0.283525232282741,
|
|
"learning_rate": 4.225376919825279e-06,
|
|
"loss": 0.742,
|
|
"mean_token_accuracy": 0.7996489584445954,
|
|
"num_tokens": 264237945.0,
|
|
"step": 2640
|
|
},
|
|
{
|
|
"entropy": 0.9734375,
|
|
"epoch": 0.36217028836955034,
|
|
"grad_norm": 0.243554357297186,
|
|
"learning_rate": 4.221854304635762e-06,
|
|
"loss": 0.7269,
|
|
"mean_token_accuracy": 0.8023523569107056,
|
|
"num_tokens": 265242177.0,
|
|
"step": 2650
|
|
},
|
|
{
|
|
"entropy": 1.031640625,
|
|
"epoch": 0.3635369687030204,
|
|
"grad_norm": 0.2516791777769264,
|
|
"learning_rate": 4.218331689446245e-06,
|
|
"loss": 0.7864,
|
|
"mean_token_accuracy": 0.7908852100372314,
|
|
"num_tokens": 266261360.0,
|
|
"step": 2660
|
|
},
|
|
{
|
|
"entropy": 0.9765625,
|
|
"epoch": 0.36490364903649036,
|
|
"grad_norm": 0.2890858932647465,
|
|
"learning_rate": 4.2148090742567284e-06,
|
|
"loss": 0.6956,
|
|
"mean_token_accuracy": 0.8119362890720367,
|
|
"num_tokens": 267257220.0,
|
|
"step": 2670
|
|
},
|
|
{
|
|
"entropy": 0.981640625,
|
|
"epoch": 0.36627032936996035,
|
|
"grad_norm": 0.24814254902335092,
|
|
"learning_rate": 4.211286459067212e-06,
|
|
"loss": 0.7534,
|
|
"mean_token_accuracy": 0.7968899011611938,
|
|
"num_tokens": 268317830.0,
|
|
"step": 2680
|
|
},
|
|
{
|
|
"entropy": 0.95625,
|
|
"epoch": 0.3676370097034304,
|
|
"grad_norm": 0.2206899463307735,
|
|
"learning_rate": 4.2077638438776955e-06,
|
|
"loss": 0.6872,
|
|
"mean_token_accuracy": 0.8129349708557129,
|
|
"num_tokens": 269283864.0,
|
|
"step": 2690
|
|
},
|
|
{
|
|
"entropy": 0.96171875,
|
|
"epoch": 0.36900369003690037,
|
|
"grad_norm": 0.24020689536539094,
|
|
"learning_rate": 4.204241228688178e-06,
|
|
"loss": 0.7102,
|
|
"mean_token_accuracy": 0.8075925350189209,
|
|
"num_tokens": 270373918.0,
|
|
"step": 2700
|
|
},
|
|
{
|
|
"entropy": 0.975,
|
|
"epoch": 0.37037037037037035,
|
|
"grad_norm": 0.25849765620873366,
|
|
"learning_rate": 4.200718613498662e-06,
|
|
"loss": 0.6983,
|
|
"mean_token_accuracy": 0.8111603736877442,
|
|
"num_tokens": 271394623.0,
|
|
"step": 2710
|
|
},
|
|
{
|
|
"entropy": 0.98984375,
|
|
"epoch": 0.3717370507038404,
|
|
"grad_norm": 0.2797485936457984,
|
|
"learning_rate": 4.1971959983091445e-06,
|
|
"loss": 0.7155,
|
|
"mean_token_accuracy": 0.8055632710456848,
|
|
"num_tokens": 272366138.0,
|
|
"step": 2720
|
|
},
|
|
{
|
|
"entropy": 0.957421875,
|
|
"epoch": 0.37310373103731037,
|
|
"grad_norm": 0.23823946604733331,
|
|
"learning_rate": 4.193673383119629e-06,
|
|
"loss": 0.6937,
|
|
"mean_token_accuracy": 0.8125109910964966,
|
|
"num_tokens": 273393329.0,
|
|
"step": 2730
|
|
},
|
|
{
|
|
"entropy": 1.04140625,
|
|
"epoch": 0.37447041137078035,
|
|
"grad_norm": 0.2501524608255165,
|
|
"learning_rate": 4.190150767930112e-06,
|
|
"loss": 0.7846,
|
|
"mean_token_accuracy": 0.792328017950058,
|
|
"num_tokens": 274456082.0,
|
|
"step": 2740
|
|
},
|
|
{
|
|
"entropy": 1.033984375,
|
|
"epoch": 0.3758370917042504,
|
|
"grad_norm": 0.25305332905147726,
|
|
"learning_rate": 4.186628152740595e-06,
|
|
"loss": 0.7513,
|
|
"mean_token_accuracy": 0.7983467400074005,
|
|
"num_tokens": 275482962.0,
|
|
"step": 2750
|
|
},
|
|
{
|
|
"entropy": 0.9875,
|
|
"epoch": 0.3772037720377204,
|
|
"grad_norm": 0.2569947214503822,
|
|
"learning_rate": 4.183105537551078e-06,
|
|
"loss": 0.7214,
|
|
"mean_token_accuracy": 0.8039626777172089,
|
|
"num_tokens": 276499414.0,
|
|
"step": 2760
|
|
},
|
|
{
|
|
"entropy": 1.0125,
|
|
"epoch": 0.37857045237119036,
|
|
"grad_norm": 0.27466037820452194,
|
|
"learning_rate": 4.179582922361561e-06,
|
|
"loss": 0.7516,
|
|
"mean_token_accuracy": 0.797834324836731,
|
|
"num_tokens": 277471208.0,
|
|
"step": 2770
|
|
},
|
|
{
|
|
"entropy": 1.0140625,
|
|
"epoch": 0.3799371327046604,
|
|
"grad_norm": 0.27964189602415934,
|
|
"learning_rate": 4.176060307172045e-06,
|
|
"loss": 0.744,
|
|
"mean_token_accuracy": 0.7995247483253479,
|
|
"num_tokens": 278492364.0,
|
|
"step": 2780
|
|
},
|
|
{
|
|
"entropy": 0.9796875,
|
|
"epoch": 0.3813038130381304,
|
|
"grad_norm": 0.24649897160529222,
|
|
"learning_rate": 4.1725376919825285e-06,
|
|
"loss": 0.7096,
|
|
"mean_token_accuracy": 0.8075621843338012,
|
|
"num_tokens": 279461129.0,
|
|
"step": 2790
|
|
},
|
|
{
|
|
"entropy": 0.99921875,
|
|
"epoch": 0.38267049337160036,
|
|
"grad_norm": 0.26472744896562855,
|
|
"learning_rate": 4.169015076793011e-06,
|
|
"loss": 0.7535,
|
|
"mean_token_accuracy": 0.7993480801582337,
|
|
"num_tokens": 280432345.0,
|
|
"step": 2800
|
|
},
|
|
{
|
|
"entropy": 0.97109375,
|
|
"epoch": 0.3840371737050704,
|
|
"grad_norm": 0.2933402547099871,
|
|
"learning_rate": 4.165492461603495e-06,
|
|
"loss": 0.7121,
|
|
"mean_token_accuracy": 0.8054061233997345,
|
|
"num_tokens": 281431868.0,
|
|
"step": 2810
|
|
},
|
|
{
|
|
"entropy": 0.979296875,
|
|
"epoch": 0.3854038540385404,
|
|
"grad_norm": 0.2733187835206099,
|
|
"learning_rate": 4.161969846413978e-06,
|
|
"loss": 0.7108,
|
|
"mean_token_accuracy": 0.8075027644634247,
|
|
"num_tokens": 282396063.0,
|
|
"step": 2820
|
|
},
|
|
{
|
|
"entropy": 0.929296875,
|
|
"epoch": 0.38677053437201037,
|
|
"grad_norm": 0.2549555883672136,
|
|
"learning_rate": 4.158447231224461e-06,
|
|
"loss": 0.6965,
|
|
"mean_token_accuracy": 0.8107801139354706,
|
|
"num_tokens": 283462179.0,
|
|
"step": 2830
|
|
},
|
|
{
|
|
"entropy": 0.9953125,
|
|
"epoch": 0.3881372147054804,
|
|
"grad_norm": 0.24787152731131032,
|
|
"learning_rate": 4.1549246160349445e-06,
|
|
"loss": 0.7351,
|
|
"mean_token_accuracy": 0.8021724700927735,
|
|
"num_tokens": 284512317.0,
|
|
"step": 2840
|
|
},
|
|
{
|
|
"entropy": 0.97578125,
|
|
"epoch": 0.3895038950389504,
|
|
"grad_norm": 0.25225746622304784,
|
|
"learning_rate": 4.151402000845428e-06,
|
|
"loss": 0.7096,
|
|
"mean_token_accuracy": 0.8066835761070251,
|
|
"num_tokens": 285546366.0,
|
|
"step": 2850
|
|
},
|
|
{
|
|
"entropy": 0.965234375,
|
|
"epoch": 0.39087057537242037,
|
|
"grad_norm": 0.23588297945710895,
|
|
"learning_rate": 4.147879385655912e-06,
|
|
"loss": 0.6782,
|
|
"mean_token_accuracy": 0.8157777547836303,
|
|
"num_tokens": 286536086.0,
|
|
"step": 2860
|
|
},
|
|
{
|
|
"entropy": 0.966015625,
|
|
"epoch": 0.3922372557058904,
|
|
"grad_norm": 0.28126207803170833,
|
|
"learning_rate": 4.144356770466394e-06,
|
|
"loss": 0.711,
|
|
"mean_token_accuracy": 0.807208102941513,
|
|
"num_tokens": 287506225.0,
|
|
"step": 2870
|
|
},
|
|
{
|
|
"entropy": 1.058984375,
|
|
"epoch": 0.3936039360393604,
|
|
"grad_norm": 0.2426568539976984,
|
|
"learning_rate": 4.140834155276878e-06,
|
|
"loss": 0.7911,
|
|
"mean_token_accuracy": 0.7907331645488739,
|
|
"num_tokens": 288517766.0,
|
|
"step": 2880
|
|
},
|
|
{
|
|
"entropy": 1.0109375,
|
|
"epoch": 0.3949706163728304,
|
|
"grad_norm": 0.25460089929019486,
|
|
"learning_rate": 4.137311540087361e-06,
|
|
"loss": 0.7285,
|
|
"mean_token_accuracy": 0.8044457316398621,
|
|
"num_tokens": 289575438.0,
|
|
"step": 2890
|
|
},
|
|
{
|
|
"entropy": 1.028515625,
|
|
"epoch": 0.3963372967063004,
|
|
"grad_norm": 0.28362317304096324,
|
|
"learning_rate": 4.133788924897845e-06,
|
|
"loss": 0.7462,
|
|
"mean_token_accuracy": 0.7996983110904694,
|
|
"num_tokens": 290579778.0,
|
|
"step": 2900
|
|
},
|
|
{
|
|
"entropy": 0.9578125,
|
|
"epoch": 0.3977039770397704,
|
|
"grad_norm": 0.23114616435131108,
|
|
"learning_rate": 4.130266309708328e-06,
|
|
"loss": 0.6754,
|
|
"mean_token_accuracy": 0.8173146665096283,
|
|
"num_tokens": 291573891.0,
|
|
"step": 2910
|
|
},
|
|
{
|
|
"entropy": 1.01796875,
|
|
"epoch": 0.3990706573732404,
|
|
"grad_norm": 0.2644783671514736,
|
|
"learning_rate": 4.126743694518811e-06,
|
|
"loss": 0.7587,
|
|
"mean_token_accuracy": 0.7966660618782043,
|
|
"num_tokens": 292603953.0,
|
|
"step": 2920
|
|
},
|
|
{
|
|
"entropy": 0.9953125,
|
|
"epoch": 0.4004373377067104,
|
|
"grad_norm": 0.2610884585741611,
|
|
"learning_rate": 4.123221079329294e-06,
|
|
"loss": 0.703,
|
|
"mean_token_accuracy": 0.8085361003875733,
|
|
"num_tokens": 293541021.0,
|
|
"step": 2930
|
|
},
|
|
{
|
|
"entropy": 0.9953125,
|
|
"epoch": 0.4018040180401804,
|
|
"grad_norm": 0.28471748204491887,
|
|
"learning_rate": 4.1196984641397774e-06,
|
|
"loss": 0.7432,
|
|
"mean_token_accuracy": 0.7987894892692566,
|
|
"num_tokens": 294528087.0,
|
|
"step": 2940
|
|
},
|
|
{
|
|
"entropy": 0.962109375,
|
|
"epoch": 0.4031706983736504,
|
|
"grad_norm": 0.24927613370834034,
|
|
"learning_rate": 4.116175848950261e-06,
|
|
"loss": 0.6759,
|
|
"mean_token_accuracy": 0.8167963445186615,
|
|
"num_tokens": 295510553.0,
|
|
"step": 2950
|
|
},
|
|
{
|
|
"entropy": 0.975390625,
|
|
"epoch": 0.4045373787071204,
|
|
"grad_norm": 0.26102908910734557,
|
|
"learning_rate": 4.1126532337607445e-06,
|
|
"loss": 0.6838,
|
|
"mean_token_accuracy": 0.8122355222702027,
|
|
"num_tokens": 296428358.0,
|
|
"step": 2960
|
|
},
|
|
{
|
|
"entropy": 1.0140625,
|
|
"epoch": 0.4059040590405904,
|
|
"grad_norm": 0.2921610525401252,
|
|
"learning_rate": 4.109130618571227e-06,
|
|
"loss": 0.7417,
|
|
"mean_token_accuracy": 0.8009309351444245,
|
|
"num_tokens": 297444594.0,
|
|
"step": 2970
|
|
},
|
|
{
|
|
"entropy": 1.0046875,
|
|
"epoch": 0.4072707393740604,
|
|
"grad_norm": 0.272027313447913,
|
|
"learning_rate": 4.105608003381711e-06,
|
|
"loss": 0.7146,
|
|
"mean_token_accuracy": 0.8038948714733124,
|
|
"num_tokens": 298427763.0,
|
|
"step": 2980
|
|
},
|
|
{
|
|
"entropy": 0.95390625,
|
|
"epoch": 0.4086374197075304,
|
|
"grad_norm": 0.2653320986107587,
|
|
"learning_rate": 4.102085388192194e-06,
|
|
"loss": 0.7112,
|
|
"mean_token_accuracy": 0.8076350212097168,
|
|
"num_tokens": 299412943.0,
|
|
"step": 2990
|
|
},
|
|
{
|
|
"entropy": 0.98671875,
|
|
"epoch": 0.4100041000410004,
|
|
"grad_norm": 0.2732910247300912,
|
|
"learning_rate": 4.098562773002678e-06,
|
|
"loss": 0.7425,
|
|
"mean_token_accuracy": 0.7990772306919098,
|
|
"num_tokens": 300389659.0,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"entropy": 0.962890625,
|
|
"epoch": 0.4113707803744704,
|
|
"grad_norm": 0.2644104599251261,
|
|
"learning_rate": 4.095040157813161e-06,
|
|
"loss": 0.7015,
|
|
"mean_token_accuracy": 0.8090315997600556,
|
|
"num_tokens": 301433498.0,
|
|
"step": 3010
|
|
},
|
|
{
|
|
"entropy": 1.003515625,
|
|
"epoch": 0.41273746070794043,
|
|
"grad_norm": 0.29318349926099146,
|
|
"learning_rate": 4.091517542623644e-06,
|
|
"loss": 0.7445,
|
|
"mean_token_accuracy": 0.7992210030555725,
|
|
"num_tokens": 302413081.0,
|
|
"step": 3020
|
|
},
|
|
{
|
|
"entropy": 1.038671875,
|
|
"epoch": 0.4141041410414104,
|
|
"grad_norm": 0.26774143361011643,
|
|
"learning_rate": 4.087994927434128e-06,
|
|
"loss": 0.7609,
|
|
"mean_token_accuracy": 0.7963505029678345,
|
|
"num_tokens": 303402573.0,
|
|
"step": 3030
|
|
},
|
|
{
|
|
"entropy": 0.9953125,
|
|
"epoch": 0.4154708213748804,
|
|
"grad_norm": 0.23391292579086087,
|
|
"learning_rate": 4.08447231224461e-06,
|
|
"loss": 0.7376,
|
|
"mean_token_accuracy": 0.8000466644763946,
|
|
"num_tokens": 304370910.0,
|
|
"step": 3040
|
|
},
|
|
{
|
|
"entropy": 0.939453125,
|
|
"epoch": 0.41683750170835043,
|
|
"grad_norm": 0.252595219011643,
|
|
"learning_rate": 4.080949697055094e-06,
|
|
"loss": 0.6673,
|
|
"mean_token_accuracy": 0.8157710433006287,
|
|
"num_tokens": 305334775.0,
|
|
"step": 3050
|
|
},
|
|
{
|
|
"entropy": 0.972265625,
|
|
"epoch": 0.4182041820418204,
|
|
"grad_norm": 0.2649511698062089,
|
|
"learning_rate": 4.0774270818655775e-06,
|
|
"loss": 0.7143,
|
|
"mean_token_accuracy": 0.8071265876293182,
|
|
"num_tokens": 306353872.0,
|
|
"step": 3060
|
|
},
|
|
{
|
|
"entropy": 1.016015625,
|
|
"epoch": 0.4195708623752904,
|
|
"grad_norm": 0.2778637168540778,
|
|
"learning_rate": 4.073904466676061e-06,
|
|
"loss": 0.7609,
|
|
"mean_token_accuracy": 0.7957460403442382,
|
|
"num_tokens": 307331806.0,
|
|
"step": 3070
|
|
},
|
|
{
|
|
"entropy": 1.00078125,
|
|
"epoch": 0.42093754270876044,
|
|
"grad_norm": 0.30004316762839706,
|
|
"learning_rate": 4.070381851486544e-06,
|
|
"loss": 0.7289,
|
|
"mean_token_accuracy": 0.8058485865592957,
|
|
"num_tokens": 308368576.0,
|
|
"step": 3080
|
|
},
|
|
{
|
|
"entropy": 0.984765625,
|
|
"epoch": 0.4223042230422304,
|
|
"grad_norm": 0.25701818002591104,
|
|
"learning_rate": 4.066859236297027e-06,
|
|
"loss": 0.7036,
|
|
"mean_token_accuracy": 0.8092820525169373,
|
|
"num_tokens": 309387885.0,
|
|
"step": 3090
|
|
},
|
|
{
|
|
"entropy": 0.991796875,
|
|
"epoch": 0.4236709033757004,
|
|
"grad_norm": 0.285044745223909,
|
|
"learning_rate": 4.06333662110751e-06,
|
|
"loss": 0.7181,
|
|
"mean_token_accuracy": 0.8069998800754548,
|
|
"num_tokens": 310360880.0,
|
|
"step": 3100
|
|
},
|
|
{
|
|
"entropy": 1.02421875,
|
|
"epoch": 0.42503758370917044,
|
|
"grad_norm": 0.27171100887037336,
|
|
"learning_rate": 4.059814005917994e-06,
|
|
"loss": 0.7583,
|
|
"mean_token_accuracy": 0.7980374157428741,
|
|
"num_tokens": 311413015.0,
|
|
"step": 3110
|
|
},
|
|
{
|
|
"entropy": 0.980859375,
|
|
"epoch": 0.4264042640426404,
|
|
"grad_norm": 0.2601025037792119,
|
|
"learning_rate": 4.056291390728477e-06,
|
|
"loss": 0.72,
|
|
"mean_token_accuracy": 0.8061904668807983,
|
|
"num_tokens": 312411848.0,
|
|
"step": 3120
|
|
},
|
|
{
|
|
"entropy": 1.036328125,
|
|
"epoch": 0.4277709443761104,
|
|
"grad_norm": 0.31308550528989376,
|
|
"learning_rate": 4.052768775538961e-06,
|
|
"loss": 0.7472,
|
|
"mean_token_accuracy": 0.8007317960262299,
|
|
"num_tokens": 313432995.0,
|
|
"step": 3130
|
|
},
|
|
{
|
|
"entropy": 1.0,
|
|
"epoch": 0.42913762470958045,
|
|
"grad_norm": 0.3074854364235427,
|
|
"learning_rate": 4.049246160349444e-06,
|
|
"loss": 0.766,
|
|
"mean_token_accuracy": 0.7973350703716278,
|
|
"num_tokens": 314460323.0,
|
|
"step": 3140
|
|
},
|
|
{
|
|
"entropy": 0.97109375,
|
|
"epoch": 0.43050430504305043,
|
|
"grad_norm": 0.2546725092478274,
|
|
"learning_rate": 4.045723545159927e-06,
|
|
"loss": 0.6997,
|
|
"mean_token_accuracy": 0.8103411018848419,
|
|
"num_tokens": 315425698.0,
|
|
"step": 3150
|
|
},
|
|
{
|
|
"entropy": 0.94453125,
|
|
"epoch": 0.4318709853765204,
|
|
"grad_norm": 0.24935529089483263,
|
|
"learning_rate": 4.04220092997041e-06,
|
|
"loss": 0.6761,
|
|
"mean_token_accuracy": 0.8155496120452881,
|
|
"num_tokens": 316440825.0,
|
|
"step": 3160
|
|
},
|
|
{
|
|
"entropy": 0.973828125,
|
|
"epoch": 0.43323766570999045,
|
|
"grad_norm": 0.24413469805079244,
|
|
"learning_rate": 4.038678314780894e-06,
|
|
"loss": 0.7027,
|
|
"mean_token_accuracy": 0.809731411933899,
|
|
"num_tokens": 317499361.0,
|
|
"step": 3170
|
|
},
|
|
{
|
|
"entropy": 0.980859375,
|
|
"epoch": 0.43460434604346043,
|
|
"grad_norm": 0.2376400185332883,
|
|
"learning_rate": 4.0351556995913775e-06,
|
|
"loss": 0.7578,
|
|
"mean_token_accuracy": 0.7973472118377686,
|
|
"num_tokens": 318535159.0,
|
|
"step": 3180
|
|
},
|
|
{
|
|
"entropy": 0.971484375,
|
|
"epoch": 0.4359710263769304,
|
|
"grad_norm": 0.22609781781849012,
|
|
"learning_rate": 4.03163308440186e-06,
|
|
"loss": 0.7306,
|
|
"mean_token_accuracy": 0.8032373368740082,
|
|
"num_tokens": 319525232.0,
|
|
"step": 3190
|
|
},
|
|
{
|
|
"entropy": 1.0015625,
|
|
"epoch": 0.43733770671040045,
|
|
"grad_norm": 0.2736048384011464,
|
|
"learning_rate": 4.028110469212344e-06,
|
|
"loss": 0.752,
|
|
"mean_token_accuracy": 0.8015840530395508,
|
|
"num_tokens": 320474887.0,
|
|
"step": 3200
|
|
},
|
|
{
|
|
"entropy": 0.98046875,
|
|
"epoch": 0.43870438704387044,
|
|
"grad_norm": 0.25862175182756875,
|
|
"learning_rate": 4.0245878540228264e-06,
|
|
"loss": 0.7133,
|
|
"mean_token_accuracy": 0.8062548756599426,
|
|
"num_tokens": 321463665.0,
|
|
"step": 3210
|
|
},
|
|
{
|
|
"entropy": 1.023046875,
|
|
"epoch": 0.4400710673773404,
|
|
"grad_norm": 0.2651787271717803,
|
|
"learning_rate": 4.02106523883331e-06,
|
|
"loss": 0.7381,
|
|
"mean_token_accuracy": 0.8021844506263733,
|
|
"num_tokens": 322430041.0,
|
|
"step": 3220
|
|
},
|
|
{
|
|
"entropy": 0.951953125,
|
|
"epoch": 0.44143774771081046,
|
|
"grad_norm": 0.26565817112094925,
|
|
"learning_rate": 4.0175426236437935e-06,
|
|
"loss": 0.7225,
|
|
"mean_token_accuracy": 0.8056091725826263,
|
|
"num_tokens": 323393790.0,
|
|
"step": 3230
|
|
},
|
|
{
|
|
"entropy": 0.970703125,
|
|
"epoch": 0.44280442804428044,
|
|
"grad_norm": 0.26612941680729185,
|
|
"learning_rate": 4.014020008454277e-06,
|
|
"loss": 0.7181,
|
|
"mean_token_accuracy": 0.8066425800323487,
|
|
"num_tokens": 324396436.0,
|
|
"step": 3240
|
|
},
|
|
{
|
|
"entropy": 0.965234375,
|
|
"epoch": 0.4441711083777504,
|
|
"grad_norm": 0.23752142669051457,
|
|
"learning_rate": 4.01049739326476e-06,
|
|
"loss": 0.7189,
|
|
"mean_token_accuracy": 0.8027989983558654,
|
|
"num_tokens": 325343170.0,
|
|
"step": 3250
|
|
},
|
|
{
|
|
"entropy": 0.9890625,
|
|
"epoch": 0.44553778871122046,
|
|
"grad_norm": 0.23325359524264036,
|
|
"learning_rate": 4.006974778075243e-06,
|
|
"loss": 0.7262,
|
|
"mean_token_accuracy": 0.8052735149860382,
|
|
"num_tokens": 326355307.0,
|
|
"step": 3260
|
|
},
|
|
{
|
|
"entropy": 1.008984375,
|
|
"epoch": 0.44690446904469044,
|
|
"grad_norm": 0.22100622216691448,
|
|
"learning_rate": 4.003452162885727e-06,
|
|
"loss": 0.7406,
|
|
"mean_token_accuracy": 0.7986101508140564,
|
|
"num_tokens": 327388298.0,
|
|
"step": 3270
|
|
},
|
|
{
|
|
"entropy": 0.9390625,
|
|
"epoch": 0.4482711493781604,
|
|
"grad_norm": 0.2811259035456191,
|
|
"learning_rate": 3.99992954769621e-06,
|
|
"loss": 0.7031,
|
|
"mean_token_accuracy": 0.8084021091461182,
|
|
"num_tokens": 328389066.0,
|
|
"step": 3280
|
|
},
|
|
{
|
|
"entropy": 0.962890625,
|
|
"epoch": 0.44963782971163047,
|
|
"grad_norm": 0.2568125360292908,
|
|
"learning_rate": 3.996406932506693e-06,
|
|
"loss": 0.721,
|
|
"mean_token_accuracy": 0.8045827388763428,
|
|
"num_tokens": 329429521.0,
|
|
"step": 3290
|
|
},
|
|
{
|
|
"entropy": 0.946484375,
|
|
"epoch": 0.45100451004510045,
|
|
"grad_norm": 0.27098273967105624,
|
|
"learning_rate": 3.992884317317177e-06,
|
|
"loss": 0.7123,
|
|
"mean_token_accuracy": 0.8068093478679657,
|
|
"num_tokens": 330482625.0,
|
|
"step": 3300
|
|
},
|
|
{
|
|
"entropy": 1.020703125,
|
|
"epoch": 0.45237119037857043,
|
|
"grad_norm": 0.2706998442074467,
|
|
"learning_rate": 3.98936170212766e-06,
|
|
"loss": 0.7393,
|
|
"mean_token_accuracy": 0.8014754533767701,
|
|
"num_tokens": 331506313.0,
|
|
"step": 3310
|
|
},
|
|
{
|
|
"entropy": 0.946484375,
|
|
"epoch": 0.45373787071204047,
|
|
"grad_norm": 0.24194746066669062,
|
|
"learning_rate": 3.985839086938143e-06,
|
|
"loss": 0.6869,
|
|
"mean_token_accuracy": 0.8118975698947907,
|
|
"num_tokens": 332494855.0,
|
|
"step": 3320
|
|
},
|
|
{
|
|
"entropy": 0.984765625,
|
|
"epoch": 0.45510455104551045,
|
|
"grad_norm": 0.2724508018976577,
|
|
"learning_rate": 3.9823164717486265e-06,
|
|
"loss": 0.7559,
|
|
"mean_token_accuracy": 0.7975544452667236,
|
|
"num_tokens": 333547164.0,
|
|
"step": 3330
|
|
},
|
|
{
|
|
"entropy": 0.980078125,
|
|
"epoch": 0.45647123137898044,
|
|
"grad_norm": 0.2481679669300148,
|
|
"learning_rate": 3.97879385655911e-06,
|
|
"loss": 0.7327,
|
|
"mean_token_accuracy": 0.8032760381698608,
|
|
"num_tokens": 334529077.0,
|
|
"step": 3340
|
|
},
|
|
{
|
|
"entropy": 1.012890625,
|
|
"epoch": 0.4578379117124505,
|
|
"grad_norm": 0.2701100935175807,
|
|
"learning_rate": 3.9752712413695936e-06,
|
|
"loss": 0.7315,
|
|
"mean_token_accuracy": 0.8022517025470733,
|
|
"num_tokens": 335516657.0,
|
|
"step": 3350
|
|
},
|
|
{
|
|
"entropy": 1.041015625,
|
|
"epoch": 0.45920459204592046,
|
|
"grad_norm": 0.25423525510559297,
|
|
"learning_rate": 3.971748626180076e-06,
|
|
"loss": 0.7521,
|
|
"mean_token_accuracy": 0.7975332021713257,
|
|
"num_tokens": 336529399.0,
|
|
"step": 3360
|
|
},
|
|
{
|
|
"entropy": 0.98828125,
|
|
"epoch": 0.46057127237939044,
|
|
"grad_norm": 0.24433892822242764,
|
|
"learning_rate": 3.96822601099056e-06,
|
|
"loss": 0.7311,
|
|
"mean_token_accuracy": 0.8016965568065644,
|
|
"num_tokens": 337575192.0,
|
|
"step": 3370
|
|
},
|
|
{
|
|
"entropy": 0.989453125,
|
|
"epoch": 0.4619379527128605,
|
|
"grad_norm": 0.25843270466851387,
|
|
"learning_rate": 3.9647033958010425e-06,
|
|
"loss": 0.7724,
|
|
"mean_token_accuracy": 0.7948437213897706,
|
|
"num_tokens": 338561351.0,
|
|
"step": 3380
|
|
},
|
|
{
|
|
"entropy": 0.99375,
|
|
"epoch": 0.46330463304633046,
|
|
"grad_norm": 0.2772084265162366,
|
|
"learning_rate": 3.961180780611527e-06,
|
|
"loss": 0.7211,
|
|
"mean_token_accuracy": 0.8048876345157623,
|
|
"num_tokens": 339557736.0,
|
|
"step": 3390
|
|
},
|
|
{
|
|
"entropy": 1.0125,
|
|
"epoch": 0.46467131337980044,
|
|
"grad_norm": 0.23446133617708778,
|
|
"learning_rate": 3.95765816542201e-06,
|
|
"loss": 0.7623,
|
|
"mean_token_accuracy": 0.7981877982616424,
|
|
"num_tokens": 340603014.0,
|
|
"step": 3400
|
|
},
|
|
{
|
|
"entropy": 0.954296875,
|
|
"epoch": 0.4660379937132705,
|
|
"grad_norm": 0.25294641163528453,
|
|
"learning_rate": 3.954135550232493e-06,
|
|
"loss": 0.6977,
|
|
"mean_token_accuracy": 0.8082153916358947,
|
|
"num_tokens": 341584764.0,
|
|
"step": 3410
|
|
},
|
|
{
|
|
"entropy": 0.99609375,
|
|
"epoch": 0.46740467404674046,
|
|
"grad_norm": 0.26105827824542127,
|
|
"learning_rate": 3.950612935042976e-06,
|
|
"loss": 0.7311,
|
|
"mean_token_accuracy": 0.8017292201519013,
|
|
"num_tokens": 342590031.0,
|
|
"step": 3420
|
|
},
|
|
{
|
|
"entropy": 0.962109375,
|
|
"epoch": 0.46877135438021045,
|
|
"grad_norm": 0.26739094752408726,
|
|
"learning_rate": 3.947090319853459e-06,
|
|
"loss": 0.7223,
|
|
"mean_token_accuracy": 0.8045358538627625,
|
|
"num_tokens": 343580633.0,
|
|
"step": 3430
|
|
},
|
|
{
|
|
"entropy": 1.0390625,
|
|
"epoch": 0.4701380347136805,
|
|
"grad_norm": 0.2761776312565086,
|
|
"learning_rate": 3.943567704663943e-06,
|
|
"loss": 0.7624,
|
|
"mean_token_accuracy": 0.7968788325786591,
|
|
"num_tokens": 344555481.0,
|
|
"step": 3440
|
|
},
|
|
{
|
|
"entropy": 0.97265625,
|
|
"epoch": 0.47150471504715047,
|
|
"grad_norm": 0.3020605283782928,
|
|
"learning_rate": 3.9400450894744265e-06,
|
|
"loss": 0.745,
|
|
"mean_token_accuracy": 0.7996992349624634,
|
|
"num_tokens": 345513015.0,
|
|
"step": 3450
|
|
},
|
|
{
|
|
"entropy": 1.042578125,
|
|
"epoch": 0.47287139538062045,
|
|
"grad_norm": 0.29434820113606086,
|
|
"learning_rate": 3.936522474284909e-06,
|
|
"loss": 0.753,
|
|
"mean_token_accuracy": 0.7996717154979706,
|
|
"num_tokens": 346519872.0,
|
|
"step": 3460
|
|
},
|
|
{
|
|
"entropy": 0.977734375,
|
|
"epoch": 0.4742380757140905,
|
|
"grad_norm": 0.2952268339690894,
|
|
"learning_rate": 3.932999859095393e-06,
|
|
"loss": 0.7113,
|
|
"mean_token_accuracy": 0.8084583818912506,
|
|
"num_tokens": 347593024.0,
|
|
"step": 3470
|
|
},
|
|
{
|
|
"entropy": 0.965625,
|
|
"epoch": 0.4756047560475605,
|
|
"grad_norm": 0.2641094307808878,
|
|
"learning_rate": 3.929477243905876e-06,
|
|
"loss": 0.7073,
|
|
"mean_token_accuracy": 0.8087251424789429,
|
|
"num_tokens": 348594832.0,
|
|
"step": 3480
|
|
},
|
|
{
|
|
"entropy": 1.0046875,
|
|
"epoch": 0.47697143638103046,
|
|
"grad_norm": 0.3245606685242501,
|
|
"learning_rate": 3.925954628716359e-06,
|
|
"loss": 0.7155,
|
|
"mean_token_accuracy": 0.8089105904102325,
|
|
"num_tokens": 349593190.0,
|
|
"step": 3490
|
|
},
|
|
{
|
|
"entropy": 1.004296875,
|
|
"epoch": 0.4783381167145005,
|
|
"grad_norm": 0.2840237851059865,
|
|
"learning_rate": 3.9224320135268425e-06,
|
|
"loss": 0.7349,
|
|
"mean_token_accuracy": 0.800891387462616,
|
|
"num_tokens": 350561915.0,
|
|
"step": 3500
|
|
},
|
|
{
|
|
"entropy": 0.990625,
|
|
"epoch": 0.4797047970479705,
|
|
"grad_norm": 0.2902138418820609,
|
|
"learning_rate": 3.918909398337326e-06,
|
|
"loss": 0.7177,
|
|
"mean_token_accuracy": 0.80634765625,
|
|
"num_tokens": 351565428.0,
|
|
"step": 3510
|
|
},
|
|
{
|
|
"entropy": 0.969921875,
|
|
"epoch": 0.48107147738144046,
|
|
"grad_norm": 0.2590537854999585,
|
|
"learning_rate": 3.91538678314781e-06,
|
|
"loss": 0.72,
|
|
"mean_token_accuracy": 0.8059606969356536,
|
|
"num_tokens": 352587603.0,
|
|
"step": 3520
|
|
},
|
|
{
|
|
"entropy": 1.00546875,
|
|
"epoch": 0.4824381577149105,
|
|
"grad_norm": 0.25060251464845557,
|
|
"learning_rate": 3.911864167958292e-06,
|
|
"loss": 0.7223,
|
|
"mean_token_accuracy": 0.8058593928813934,
|
|
"num_tokens": 353602912.0,
|
|
"step": 3530
|
|
},
|
|
{
|
|
"entropy": 0.969140625,
|
|
"epoch": 0.4838048380483805,
|
|
"grad_norm": 0.25146253809744057,
|
|
"learning_rate": 3.908341552768776e-06,
|
|
"loss": 0.739,
|
|
"mean_token_accuracy": 0.8012568414211273,
|
|
"num_tokens": 354606364.0,
|
|
"step": 3540
|
|
},
|
|
{
|
|
"entropy": 0.963671875,
|
|
"epoch": 0.48517151838185046,
|
|
"grad_norm": 0.24840653416391942,
|
|
"learning_rate": 3.9048189375792586e-06,
|
|
"loss": 0.7194,
|
|
"mean_token_accuracy": 0.8021055936813355,
|
|
"num_tokens": 355587589.0,
|
|
"step": 3550
|
|
},
|
|
{
|
|
"entropy": 1.012890625,
|
|
"epoch": 0.4865381987153205,
|
|
"grad_norm": 0.25600438373312756,
|
|
"learning_rate": 3.901296322389743e-06,
|
|
"loss": 0.765,
|
|
"mean_token_accuracy": 0.7951968014240265,
|
|
"num_tokens": 356558152.0,
|
|
"step": 3560
|
|
},
|
|
{
|
|
"entropy": 1.000390625,
|
|
"epoch": 0.4879048790487905,
|
|
"grad_norm": 0.2667077576166459,
|
|
"learning_rate": 3.897773707200226e-06,
|
|
"loss": 0.7319,
|
|
"mean_token_accuracy": 0.8020767033100128,
|
|
"num_tokens": 357540541.0,
|
|
"step": 3570
|
|
},
|
|
{
|
|
"entropy": 0.9875,
|
|
"epoch": 0.48927155938226047,
|
|
"grad_norm": 0.27608775232066773,
|
|
"learning_rate": 3.894251092010709e-06,
|
|
"loss": 0.7071,
|
|
"mean_token_accuracy": 0.8059805452823638,
|
|
"num_tokens": 358570092.0,
|
|
"step": 3580
|
|
},
|
|
{
|
|
"entropy": 0.95625,
|
|
"epoch": 0.4906382397157305,
|
|
"grad_norm": 0.2584501033022997,
|
|
"learning_rate": 3.890728476821192e-06,
|
|
"loss": 0.6993,
|
|
"mean_token_accuracy": 0.8103401839733124,
|
|
"num_tokens": 359534391.0,
|
|
"step": 3590
|
|
},
|
|
{
|
|
"entropy": 0.928515625,
|
|
"epoch": 0.4920049200492005,
|
|
"grad_norm": 0.24450846913740681,
|
|
"learning_rate": 3.8872058616316755e-06,
|
|
"loss": 0.6788,
|
|
"mean_token_accuracy": 0.8153290927410126,
|
|
"num_tokens": 360497311.0,
|
|
"step": 3600
|
|
},
|
|
{
|
|
"entropy": 0.96171875,
|
|
"epoch": 0.49337160038267047,
|
|
"grad_norm": 0.26075468335681584,
|
|
"learning_rate": 3.883683246442159e-06,
|
|
"loss": 0.737,
|
|
"mean_token_accuracy": 0.8013993442058563,
|
|
"num_tokens": 361488754.0,
|
|
"step": 3610
|
|
},
|
|
{
|
|
"entropy": 0.997265625,
|
|
"epoch": 0.4947382807161405,
|
|
"grad_norm": 0.24957281660831052,
|
|
"learning_rate": 3.8801606312526426e-06,
|
|
"loss": 0.698,
|
|
"mean_token_accuracy": 0.8096680700778961,
|
|
"num_tokens": 362539500.0,
|
|
"step": 3620
|
|
},
|
|
{
|
|
"entropy": 0.916015625,
|
|
"epoch": 0.4961049610496105,
|
|
"grad_norm": 0.2567739647824387,
|
|
"learning_rate": 3.876638016063125e-06,
|
|
"loss": 0.6585,
|
|
"mean_token_accuracy": 0.8199857831001282,
|
|
"num_tokens": 363566701.0,
|
|
"step": 3630
|
|
},
|
|
{
|
|
"entropy": 0.962109375,
|
|
"epoch": 0.4974716413830805,
|
|
"grad_norm": 0.2761397240714524,
|
|
"learning_rate": 3.873115400873609e-06,
|
|
"loss": 0.6919,
|
|
"mean_token_accuracy": 0.8122694492340088,
|
|
"num_tokens": 364529201.0,
|
|
"step": 3640
|
|
},
|
|
{
|
|
"entropy": 0.992578125,
|
|
"epoch": 0.4988383217165505,
|
|
"grad_norm": 0.260920825638184,
|
|
"learning_rate": 3.869592785684092e-06,
|
|
"loss": 0.7426,
|
|
"mean_token_accuracy": 0.8006498515605927,
|
|
"num_tokens": 365535910.0,
|
|
"step": 3650
|
|
},
|
|
{
|
|
"entropy": 0.9890625,
|
|
"epoch": 0.5002050020500205,
|
|
"grad_norm": 0.22413516710260342,
|
|
"learning_rate": 3.866070170494575e-06,
|
|
"loss": 0.7217,
|
|
"mean_token_accuracy": 0.806417453289032,
|
|
"num_tokens": 366511634.0,
|
|
"step": 3660
|
|
},
|
|
{
|
|
"entropy": 0.9828125,
|
|
"epoch": 0.5015716823834905,
|
|
"grad_norm": 0.3054523788499468,
|
|
"learning_rate": 3.862547555305059e-06,
|
|
"loss": 0.7328,
|
|
"mean_token_accuracy": 0.8014598906040191,
|
|
"num_tokens": 367546812.0,
|
|
"step": 3670
|
|
},
|
|
{
|
|
"entropy": 0.983984375,
|
|
"epoch": 0.5029383627169605,
|
|
"grad_norm": 0.289252278103562,
|
|
"learning_rate": 3.859024940115542e-06,
|
|
"loss": 0.7228,
|
|
"mean_token_accuracy": 0.8054406702518463,
|
|
"num_tokens": 368552370.0,
|
|
"step": 3680
|
|
},
|
|
{
|
|
"entropy": 0.949609375,
|
|
"epoch": 0.5043050430504306,
|
|
"grad_norm": 0.23608951658423055,
|
|
"learning_rate": 3.855502324926026e-06,
|
|
"loss": 0.6839,
|
|
"mean_token_accuracy": 0.8144189476966858,
|
|
"num_tokens": 369603613.0,
|
|
"step": 3690
|
|
},
|
|
{
|
|
"entropy": 0.984765625,
|
|
"epoch": 0.5056717233839005,
|
|
"grad_norm": 0.258465228239586,
|
|
"learning_rate": 3.851979709736508e-06,
|
|
"loss": 0.7159,
|
|
"mean_token_accuracy": 0.8073198795318604,
|
|
"num_tokens": 370579772.0,
|
|
"step": 3700
|
|
},
|
|
{
|
|
"entropy": 0.994921875,
|
|
"epoch": 0.5070384037173705,
|
|
"grad_norm": 0.2788743048745919,
|
|
"learning_rate": 3.848457094546992e-06,
|
|
"loss": 0.7246,
|
|
"mean_token_accuracy": 0.804264760017395,
|
|
"num_tokens": 371569052.0,
|
|
"step": 3710
|
|
},
|
|
{
|
|
"entropy": 0.956640625,
|
|
"epoch": 0.5084050840508405,
|
|
"grad_norm": 0.23694798293479813,
|
|
"learning_rate": 3.8449344793574755e-06,
|
|
"loss": 0.731,
|
|
"mean_token_accuracy": 0.803287935256958,
|
|
"num_tokens": 372600551.0,
|
|
"step": 3720
|
|
},
|
|
{
|
|
"entropy": 0.991796875,
|
|
"epoch": 0.5097717643843105,
|
|
"grad_norm": 0.23572255752897445,
|
|
"learning_rate": 3.841411864167959e-06,
|
|
"loss": 0.759,
|
|
"mean_token_accuracy": 0.7964557409286499,
|
|
"num_tokens": 373584656.0,
|
|
"step": 3730
|
|
},
|
|
{
|
|
"entropy": 0.98828125,
|
|
"epoch": 0.5111384447177805,
|
|
"grad_norm": 0.2807399901163338,
|
|
"learning_rate": 3.837889248978442e-06,
|
|
"loss": 0.7446,
|
|
"mean_token_accuracy": 0.7991569817066193,
|
|
"num_tokens": 374563340.0,
|
|
"step": 3740
|
|
},
|
|
{
|
|
"entropy": 0.985546875,
|
|
"epoch": 0.5125051250512506,
|
|
"grad_norm": 0.2764313721502761,
|
|
"learning_rate": 3.834366633788925e-06,
|
|
"loss": 0.7032,
|
|
"mean_token_accuracy": 0.8105375230312347,
|
|
"num_tokens": 375567281.0,
|
|
"step": 3750
|
|
},
|
|
{
|
|
"entropy": 0.99453125,
|
|
"epoch": 0.5138718053847205,
|
|
"grad_norm": 0.298614354954772,
|
|
"learning_rate": 3.830844018599408e-06,
|
|
"loss": 0.715,
|
|
"mean_token_accuracy": 0.806985491514206,
|
|
"num_tokens": 376511811.0,
|
|
"step": 3760
|
|
},
|
|
{
|
|
"entropy": 1.001171875,
|
|
"epoch": 0.5152384857181905,
|
|
"grad_norm": 0.26701431696343036,
|
|
"learning_rate": 3.8273214034098915e-06,
|
|
"loss": 0.7348,
|
|
"mean_token_accuracy": 0.8026228249073029,
|
|
"num_tokens": 377512831.0,
|
|
"step": 3770
|
|
},
|
|
{
|
|
"entropy": 1.00234375,
|
|
"epoch": 0.5166051660516605,
|
|
"grad_norm": 0.2598502334145033,
|
|
"learning_rate": 3.823798788220375e-06,
|
|
"loss": 0.7192,
|
|
"mean_token_accuracy": 0.8043923735618591,
|
|
"num_tokens": 378478492.0,
|
|
"step": 3780
|
|
},
|
|
{
|
|
"entropy": 0.96484375,
|
|
"epoch": 0.5179718463851305,
|
|
"grad_norm": 0.2904774346515404,
|
|
"learning_rate": 3.820276173030859e-06,
|
|
"loss": 0.7106,
|
|
"mean_token_accuracy": 0.8074526607990264,
|
|
"num_tokens": 379444691.0,
|
|
"step": 3790
|
|
},
|
|
{
|
|
"entropy": 0.987890625,
|
|
"epoch": 0.5193385267186005,
|
|
"grad_norm": 0.26841142628240927,
|
|
"learning_rate": 3.816753557841341e-06,
|
|
"loss": 0.7028,
|
|
"mean_token_accuracy": 0.8093549907207489,
|
|
"num_tokens": 380423660.0,
|
|
"step": 3800
|
|
},
|
|
{
|
|
"entropy": 0.98984375,
|
|
"epoch": 0.5207052070520706,
|
|
"grad_norm": 0.25968108409969637,
|
|
"learning_rate": 3.813230942651825e-06,
|
|
"loss": 0.7451,
|
|
"mean_token_accuracy": 0.8000588655471802,
|
|
"num_tokens": 381365233.0,
|
|
"step": 3810
|
|
},
|
|
{
|
|
"entropy": 1.0,
|
|
"epoch": 0.5220718873855406,
|
|
"grad_norm": 0.2610194342869446,
|
|
"learning_rate": 3.809708327462308e-06,
|
|
"loss": 0.7063,
|
|
"mean_token_accuracy": 0.8081806182861329,
|
|
"num_tokens": 382338629.0,
|
|
"step": 3820
|
|
},
|
|
{
|
|
"entropy": 1.00390625,
|
|
"epoch": 0.5234385677190105,
|
|
"grad_norm": 0.2552298737254961,
|
|
"learning_rate": 3.806185712272792e-06,
|
|
"loss": 0.743,
|
|
"mean_token_accuracy": 0.8013090491294861,
|
|
"num_tokens": 383353565.0,
|
|
"step": 3830
|
|
},
|
|
{
|
|
"entropy": 1.063671875,
|
|
"epoch": 0.5248052480524805,
|
|
"grad_norm": 0.2713259198409982,
|
|
"learning_rate": 3.802663097083275e-06,
|
|
"loss": 0.7926,
|
|
"mean_token_accuracy": 0.7902474462985992,
|
|
"num_tokens": 384284378.0,
|
|
"step": 3840
|
|
},
|
|
{
|
|
"entropy": 0.994140625,
|
|
"epoch": 0.5261719283859505,
|
|
"grad_norm": 0.26422090543216936,
|
|
"learning_rate": 3.799140481893758e-06,
|
|
"loss": 0.7238,
|
|
"mean_token_accuracy": 0.8038602352142334,
|
|
"num_tokens": 385243988.0,
|
|
"step": 3850
|
|
},
|
|
{
|
|
"entropy": 0.976953125,
|
|
"epoch": 0.5275386087194205,
|
|
"grad_norm": 0.2548924173523697,
|
|
"learning_rate": 3.7956178667042413e-06,
|
|
"loss": 0.7108,
|
|
"mean_token_accuracy": 0.8091165840625762,
|
|
"num_tokens": 386204705.0,
|
|
"step": 3860
|
|
},
|
|
{
|
|
"entropy": 0.94453125,
|
|
"epoch": 0.5289052890528906,
|
|
"grad_norm": 0.2583538994431856,
|
|
"learning_rate": 3.792095251514725e-06,
|
|
"loss": 0.7091,
|
|
"mean_token_accuracy": 0.807134747505188,
|
|
"num_tokens": 387221442.0,
|
|
"step": 3870
|
|
},
|
|
{
|
|
"entropy": 0.95234375,
|
|
"epoch": 0.5302719693863606,
|
|
"grad_norm": 0.2594060248837646,
|
|
"learning_rate": 3.788572636325208e-06,
|
|
"loss": 0.7136,
|
|
"mean_token_accuracy": 0.8063479363918304,
|
|
"num_tokens": 388252567.0,
|
|
"step": 3880
|
|
},
|
|
{
|
|
"entropy": 0.9546875,
|
|
"epoch": 0.5316386497198305,
|
|
"grad_norm": 0.24141570675337037,
|
|
"learning_rate": 3.7850500211356916e-06,
|
|
"loss": 0.6931,
|
|
"mean_token_accuracy": 0.8103323161602021,
|
|
"num_tokens": 389259487.0,
|
|
"step": 3890
|
|
},
|
|
{
|
|
"entropy": 0.98203125,
|
|
"epoch": 0.5330053300533005,
|
|
"grad_norm": 0.26214936937643546,
|
|
"learning_rate": 3.7815274059461747e-06,
|
|
"loss": 0.7153,
|
|
"mean_token_accuracy": 0.8060106694698334,
|
|
"num_tokens": 390253163.0,
|
|
"step": 3900
|
|
},
|
|
{
|
|
"entropy": 0.967578125,
|
|
"epoch": 0.5343720103867705,
|
|
"grad_norm": 0.2389322521731756,
|
|
"learning_rate": 3.7780047907566582e-06,
|
|
"loss": 0.6852,
|
|
"mean_token_accuracy": 0.8127460896968841,
|
|
"num_tokens": 391269104.0,
|
|
"step": 3910
|
|
},
|
|
{
|
|
"entropy": 0.978125,
|
|
"epoch": 0.5357386907202405,
|
|
"grad_norm": 0.22933789363614157,
|
|
"learning_rate": 3.7744821755671413e-06,
|
|
"loss": 0.7033,
|
|
"mean_token_accuracy": 0.811513078212738,
|
|
"num_tokens": 392288204.0,
|
|
"step": 3920
|
|
},
|
|
{
|
|
"entropy": 0.98046875,
|
|
"epoch": 0.5371053710537106,
|
|
"grad_norm": 0.23586803645955345,
|
|
"learning_rate": 3.7709595603776245e-06,
|
|
"loss": 0.7081,
|
|
"mean_token_accuracy": 0.8094004094600677,
|
|
"num_tokens": 393303667.0,
|
|
"step": 3930
|
|
},
|
|
{
|
|
"entropy": 1.005859375,
|
|
"epoch": 0.5384720513871806,
|
|
"grad_norm": 0.3043657864432949,
|
|
"learning_rate": 3.767436945188108e-06,
|
|
"loss": 0.7364,
|
|
"mean_token_accuracy": 0.8016047775745392,
|
|
"num_tokens": 394294972.0,
|
|
"step": 3940
|
|
},
|
|
{
|
|
"entropy": 0.978515625,
|
|
"epoch": 0.5398387317206506,
|
|
"grad_norm": 0.2661342789418694,
|
|
"learning_rate": 3.7639143299985916e-06,
|
|
"loss": 0.7159,
|
|
"mean_token_accuracy": 0.8064292192459106,
|
|
"num_tokens": 395281144.0,
|
|
"step": 3950
|
|
},
|
|
{
|
|
"entropy": 1.020703125,
|
|
"epoch": 0.5412054120541205,
|
|
"grad_norm": 0.24297652384323662,
|
|
"learning_rate": 3.7603917148090747e-06,
|
|
"loss": 0.7252,
|
|
"mean_token_accuracy": 0.8054780900478363,
|
|
"num_tokens": 396282458.0,
|
|
"step": 3960
|
|
},
|
|
{
|
|
"entropy": 0.95078125,
|
|
"epoch": 0.5425720923875905,
|
|
"grad_norm": 0.26317917906379773,
|
|
"learning_rate": 3.756869099619558e-06,
|
|
"loss": 0.6917,
|
|
"mean_token_accuracy": 0.8112543821334839,
|
|
"num_tokens": 397299233.0,
|
|
"step": 3970
|
|
},
|
|
{
|
|
"entropy": 0.954296875,
|
|
"epoch": 0.5439387727210605,
|
|
"grad_norm": 0.2499976412073113,
|
|
"learning_rate": 3.753346484430041e-06,
|
|
"loss": 0.6992,
|
|
"mean_token_accuracy": 0.8106093049049378,
|
|
"num_tokens": 398281717.0,
|
|
"step": 3980
|
|
},
|
|
{
|
|
"entropy": 0.955859375,
|
|
"epoch": 0.5453054530545306,
|
|
"grad_norm": 0.25842726132798405,
|
|
"learning_rate": 3.749823869240524e-06,
|
|
"loss": 0.6926,
|
|
"mean_token_accuracy": 0.8132404267787934,
|
|
"num_tokens": 399265146.0,
|
|
"step": 3990
|
|
},
|
|
{
|
|
"entropy": 0.9359375,
|
|
"epoch": 0.5466721333880006,
|
|
"grad_norm": 0.3106647129790408,
|
|
"learning_rate": 3.746301254051008e-06,
|
|
"loss": 0.6718,
|
|
"mean_token_accuracy": 0.8156864225864411,
|
|
"num_tokens": 400256118.0,
|
|
"step": 4000
|
|
},
|
|
{
|
|
"entropy": 0.9484375,
|
|
"epoch": 0.5480388137214706,
|
|
"grad_norm": 0.2637014697423627,
|
|
"learning_rate": 3.742778638861491e-06,
|
|
"loss": 0.7081,
|
|
"mean_token_accuracy": 0.8076475858688354,
|
|
"num_tokens": 401251718.0,
|
|
"step": 4010
|
|
},
|
|
{
|
|
"entropy": 0.971875,
|
|
"epoch": 0.5494054940549405,
|
|
"grad_norm": 0.2561712322569782,
|
|
"learning_rate": 3.7392560236719743e-06,
|
|
"loss": 0.7248,
|
|
"mean_token_accuracy": 0.8032261312007904,
|
|
"num_tokens": 402208932.0,
|
|
"step": 4020
|
|
},
|
|
{
|
|
"entropy": 0.928125,
|
|
"epoch": 0.5507721743884105,
|
|
"grad_norm": 0.24512737837071874,
|
|
"learning_rate": 3.7357334084824574e-06,
|
|
"loss": 0.6748,
|
|
"mean_token_accuracy": 0.8155068218708038,
|
|
"num_tokens": 403201031.0,
|
|
"step": 4030
|
|
},
|
|
{
|
|
"entropy": 0.948828125,
|
|
"epoch": 0.5521388547218805,
|
|
"grad_norm": 0.2742323187487909,
|
|
"learning_rate": 3.732210793292941e-06,
|
|
"loss": 0.6915,
|
|
"mean_token_accuracy": 0.8117801606655121,
|
|
"num_tokens": 404208352.0,
|
|
"step": 4040
|
|
},
|
|
{
|
|
"entropy": 0.9953125,
|
|
"epoch": 0.5535055350553506,
|
|
"grad_norm": 0.2550421196168313,
|
|
"learning_rate": 3.7286881781034245e-06,
|
|
"loss": 0.7136,
|
|
"mean_token_accuracy": 0.8061869144439697,
|
|
"num_tokens": 405228257.0,
|
|
"step": 4050
|
|
},
|
|
{
|
|
"entropy": 0.976171875,
|
|
"epoch": 0.5548722153888206,
|
|
"grad_norm": 0.23752916753160278,
|
|
"learning_rate": 3.7251655629139076e-06,
|
|
"loss": 0.6786,
|
|
"mean_token_accuracy": 0.8136169135570526,
|
|
"num_tokens": 406262561.0,
|
|
"step": 4060
|
|
},
|
|
{
|
|
"entropy": 1.013671875,
|
|
"epoch": 0.5562388957222906,
|
|
"grad_norm": 0.2478552985780841,
|
|
"learning_rate": 3.7216429477243907e-06,
|
|
"loss": 0.7298,
|
|
"mean_token_accuracy": 0.8025054395198822,
|
|
"num_tokens": 407259161.0,
|
|
"step": 4070
|
|
},
|
|
{
|
|
"entropy": 0.981640625,
|
|
"epoch": 0.5576055760557606,
|
|
"grad_norm": 0.2552574535586499,
|
|
"learning_rate": 3.7181203325348743e-06,
|
|
"loss": 0.7152,
|
|
"mean_token_accuracy": 0.8064877033233643,
|
|
"num_tokens": 408297673.0,
|
|
"step": 4080
|
|
},
|
|
{
|
|
"entropy": 1.009375,
|
|
"epoch": 0.5589722563892305,
|
|
"grad_norm": 0.28507641010507084,
|
|
"learning_rate": 3.7145977173453574e-06,
|
|
"loss": 0.7538,
|
|
"mean_token_accuracy": 0.7981027781963348,
|
|
"num_tokens": 409266496.0,
|
|
"step": 4090
|
|
},
|
|
{
|
|
"entropy": 0.96015625,
|
|
"epoch": 0.5603389367227005,
|
|
"grad_norm": 0.24451420534873824,
|
|
"learning_rate": 3.7110751021558405e-06,
|
|
"loss": 0.6949,
|
|
"mean_token_accuracy": 0.8107175707817078,
|
|
"num_tokens": 410238401.0,
|
|
"step": 4100
|
|
},
|
|
{
|
|
"entropy": 0.956640625,
|
|
"epoch": 0.5617056170561706,
|
|
"grad_norm": 0.25833525051325873,
|
|
"learning_rate": 3.7075524869663245e-06,
|
|
"loss": 0.6957,
|
|
"mean_token_accuracy": 0.8120106637477875,
|
|
"num_tokens": 411280517.0,
|
|
"step": 4110
|
|
},
|
|
{
|
|
"entropy": 0.9734375,
|
|
"epoch": 0.5630722973896406,
|
|
"grad_norm": 0.2516208400294858,
|
|
"learning_rate": 3.7040298717768076e-06,
|
|
"loss": 0.7224,
|
|
"mean_token_accuracy": 0.8064061105251312,
|
|
"num_tokens": 412309765.0,
|
|
"step": 4120
|
|
},
|
|
{
|
|
"entropy": 1.002734375,
|
|
"epoch": 0.5644389777231106,
|
|
"grad_norm": 0.2610550822857222,
|
|
"learning_rate": 3.7005072565872908e-06,
|
|
"loss": 0.7423,
|
|
"mean_token_accuracy": 0.8011087477207184,
|
|
"num_tokens": 413340967.0,
|
|
"step": 4130
|
|
},
|
|
{
|
|
"entropy": 0.987890625,
|
|
"epoch": 0.5658056580565806,
|
|
"grad_norm": 0.262825046168339,
|
|
"learning_rate": 3.696984641397774e-06,
|
|
"loss": 0.7406,
|
|
"mean_token_accuracy": 0.8006796360015869,
|
|
"num_tokens": 414340603.0,
|
|
"step": 4140
|
|
},
|
|
{
|
|
"entropy": 0.944921875,
|
|
"epoch": 0.5671723383900505,
|
|
"grad_norm": 0.2858602180903503,
|
|
"learning_rate": 3.693462026208257e-06,
|
|
"loss": 0.6792,
|
|
"mean_token_accuracy": 0.8141164898872375,
|
|
"num_tokens": 415339057.0,
|
|
"step": 4150
|
|
},
|
|
{
|
|
"entropy": 0.982421875,
|
|
"epoch": 0.5685390187235205,
|
|
"grad_norm": 0.2316094188959597,
|
|
"learning_rate": 3.689939411018741e-06,
|
|
"loss": 0.7156,
|
|
"mean_token_accuracy": 0.8089553833007812,
|
|
"num_tokens": 416381610.0,
|
|
"step": 4160
|
|
},
|
|
{
|
|
"entropy": 0.92265625,
|
|
"epoch": 0.5699056990569906,
|
|
"grad_norm": 0.2555987537679019,
|
|
"learning_rate": 3.686416795829224e-06,
|
|
"loss": 0.6504,
|
|
"mean_token_accuracy": 0.8200347244739532,
|
|
"num_tokens": 417378752.0,
|
|
"step": 4170
|
|
},
|
|
{
|
|
"entropy": 0.953125,
|
|
"epoch": 0.5712723793904606,
|
|
"grad_norm": 0.2672653676373731,
|
|
"learning_rate": 3.6828941806397072e-06,
|
|
"loss": 0.7055,
|
|
"mean_token_accuracy": 0.8083403468132019,
|
|
"num_tokens": 418347850.0,
|
|
"step": 4180
|
|
},
|
|
{
|
|
"entropy": 0.964453125,
|
|
"epoch": 0.5726390597239306,
|
|
"grad_norm": 0.2547549620418805,
|
|
"learning_rate": 3.6793715654501903e-06,
|
|
"loss": 0.7298,
|
|
"mean_token_accuracy": 0.8038694560527802,
|
|
"num_tokens": 419363657.0,
|
|
"step": 4190
|
|
},
|
|
{
|
|
"entropy": 0.976953125,
|
|
"epoch": 0.5740057400574006,
|
|
"grad_norm": 0.3101872373798549,
|
|
"learning_rate": 3.6758489502606735e-06,
|
|
"loss": 0.7243,
|
|
"mean_token_accuracy": 0.8059607326984406,
|
|
"num_tokens": 420407370.0,
|
|
"step": 4200
|
|
},
|
|
{
|
|
"entropy": 0.99375,
|
|
"epoch": 0.5753724203908706,
|
|
"grad_norm": 0.2609478022800938,
|
|
"learning_rate": 3.672326335071157e-06,
|
|
"loss": 0.7198,
|
|
"mean_token_accuracy": 0.8053461194038392,
|
|
"num_tokens": 421382440.0,
|
|
"step": 4210
|
|
},
|
|
{
|
|
"entropy": 0.98671875,
|
|
"epoch": 0.5767391007243405,
|
|
"grad_norm": 0.2545006183891478,
|
|
"learning_rate": 3.6688037198816406e-06,
|
|
"loss": 0.7024,
|
|
"mean_token_accuracy": 0.8094256341457366,
|
|
"num_tokens": 422362775.0,
|
|
"step": 4220
|
|
},
|
|
{
|
|
"entropy": 0.95625,
|
|
"epoch": 0.5781057810578106,
|
|
"grad_norm": 0.27577813329239753,
|
|
"learning_rate": 3.6652811046921237e-06,
|
|
"loss": 0.6918,
|
|
"mean_token_accuracy": 0.8129442512989045,
|
|
"num_tokens": 423331211.0,
|
|
"step": 4230
|
|
},
|
|
{
|
|
"entropy": 0.974609375,
|
|
"epoch": 0.5794724613912806,
|
|
"grad_norm": 0.23751155700111037,
|
|
"learning_rate": 3.6617584895026072e-06,
|
|
"loss": 0.6977,
|
|
"mean_token_accuracy": 0.8105027735233307,
|
|
"num_tokens": 424291289.0,
|
|
"step": 4240
|
|
},
|
|
{
|
|
"entropy": 1.0,
|
|
"epoch": 0.5808391417247506,
|
|
"grad_norm": 0.2951101309892398,
|
|
"learning_rate": 3.6582358743130904e-06,
|
|
"loss": 0.7528,
|
|
"mean_token_accuracy": 0.7945821821689606,
|
|
"num_tokens": 425304325.0,
|
|
"step": 4250
|
|
},
|
|
{
|
|
"entropy": 0.982421875,
|
|
"epoch": 0.5822058220582206,
|
|
"grad_norm": 0.275087214893935,
|
|
"learning_rate": 3.6547132591235735e-06,
|
|
"loss": 0.724,
|
|
"mean_token_accuracy": 0.8043795049190521,
|
|
"num_tokens": 426270499.0,
|
|
"step": 4260
|
|
},
|
|
{
|
|
"entropy": 1.009765625,
|
|
"epoch": 0.5835725023916906,
|
|
"grad_norm": 0.2845303192192815,
|
|
"learning_rate": 3.651190643934057e-06,
|
|
"loss": 0.7477,
|
|
"mean_token_accuracy": 0.8005179822444916,
|
|
"num_tokens": 427187011.0,
|
|
"step": 4270
|
|
},
|
|
{
|
|
"entropy": 0.975390625,
|
|
"epoch": 0.5849391827251605,
|
|
"grad_norm": 0.25611615607917854,
|
|
"learning_rate": 3.6476680287445406e-06,
|
|
"loss": 0.7218,
|
|
"mean_token_accuracy": 0.8065521121025085,
|
|
"num_tokens": 428218892.0,
|
|
"step": 4280
|
|
},
|
|
{
|
|
"entropy": 0.9515625,
|
|
"epoch": 0.5863058630586306,
|
|
"grad_norm": 0.24425764916194237,
|
|
"learning_rate": 3.6441454135550237e-06,
|
|
"loss": 0.6956,
|
|
"mean_token_accuracy": 0.8119922399520874,
|
|
"num_tokens": 429237497.0,
|
|
"step": 4290
|
|
},
|
|
{
|
|
"entropy": 0.9765625,
|
|
"epoch": 0.5876725433921006,
|
|
"grad_norm": 0.25171474353532497,
|
|
"learning_rate": 3.640622798365507e-06,
|
|
"loss": 0.7242,
|
|
"mean_token_accuracy": 0.8040809392929077,
|
|
"num_tokens": 430237115.0,
|
|
"step": 4300
|
|
},
|
|
{
|
|
"entropy": 1.02109375,
|
|
"epoch": 0.5890392237255706,
|
|
"grad_norm": 0.2495996949999943,
|
|
"learning_rate": 3.63710018317599e-06,
|
|
"loss": 0.7415,
|
|
"mean_token_accuracy": 0.7991205632686615,
|
|
"num_tokens": 431241122.0,
|
|
"step": 4310
|
|
},
|
|
{
|
|
"entropy": 1.031640625,
|
|
"epoch": 0.5904059040590406,
|
|
"grad_norm": 0.29021208276260146,
|
|
"learning_rate": 3.633577567986473e-06,
|
|
"loss": 0.7433,
|
|
"mean_token_accuracy": 0.8008840978145599,
|
|
"num_tokens": 432221995.0,
|
|
"step": 4320
|
|
},
|
|
{
|
|
"entropy": 0.978515625,
|
|
"epoch": 0.5917725843925106,
|
|
"grad_norm": 0.254751358205101,
|
|
"learning_rate": 3.630054952796957e-06,
|
|
"loss": 0.6947,
|
|
"mean_token_accuracy": 0.8119446814060212,
|
|
"num_tokens": 433198674.0,
|
|
"step": 4330
|
|
},
|
|
{
|
|
"entropy": 1.01640625,
|
|
"epoch": 0.5931392647259806,
|
|
"grad_norm": 0.2529573188194739,
|
|
"learning_rate": 3.62653233760744e-06,
|
|
"loss": 0.777,
|
|
"mean_token_accuracy": 0.7927482008934021,
|
|
"num_tokens": 434197222.0,
|
|
"step": 4340
|
|
},
|
|
{
|
|
"entropy": 0.9625,
|
|
"epoch": 0.5945059450594506,
|
|
"grad_norm": 0.2700963461052715,
|
|
"learning_rate": 3.6230097224179233e-06,
|
|
"loss": 0.699,
|
|
"mean_token_accuracy": 0.8110020458698273,
|
|
"num_tokens": 435080429.0,
|
|
"step": 4350
|
|
},
|
|
{
|
|
"entropy": 0.984765625,
|
|
"epoch": 0.5958726253929206,
|
|
"grad_norm": 0.2768743173581588,
|
|
"learning_rate": 3.6194871072284064e-06,
|
|
"loss": 0.7183,
|
|
"mean_token_accuracy": 0.8061011970043183,
|
|
"num_tokens": 436104149.0,
|
|
"step": 4360
|
|
},
|
|
{
|
|
"entropy": 1.00703125,
|
|
"epoch": 0.5972393057263906,
|
|
"grad_norm": 0.2858132490087398,
|
|
"learning_rate": 3.61596449203889e-06,
|
|
"loss": 0.7154,
|
|
"mean_token_accuracy": 0.8076961457729339,
|
|
"num_tokens": 437087451.0,
|
|
"step": 4370
|
|
},
|
|
{
|
|
"entropy": 0.939453125,
|
|
"epoch": 0.5986059860598606,
|
|
"grad_norm": 0.2371953145721958,
|
|
"learning_rate": 3.6124418768493735e-06,
|
|
"loss": 0.689,
|
|
"mean_token_accuracy": 0.8134632349014282,
|
|
"num_tokens": 438073519.0,
|
|
"step": 4380
|
|
},
|
|
{
|
|
"entropy": 0.9765625,
|
|
"epoch": 0.5999726663933306,
|
|
"grad_norm": 0.23485259851657034,
|
|
"learning_rate": 3.6089192616598566e-06,
|
|
"loss": 0.7217,
|
|
"mean_token_accuracy": 0.8058984935283661,
|
|
"num_tokens": 439150829.0,
|
|
"step": 4390
|
|
},
|
|
{
|
|
"entropy": 0.986328125,
|
|
"epoch": 0.6013393467268006,
|
|
"grad_norm": 0.2764362978635181,
|
|
"learning_rate": 3.6053966464703398e-06,
|
|
"loss": 0.7595,
|
|
"mean_token_accuracy": 0.7979487359523774,
|
|
"num_tokens": 440124792.0,
|
|
"step": 4400
|
|
},
|
|
{
|
|
"entropy": 1.01015625,
|
|
"epoch": 0.6027060270602707,
|
|
"grad_norm": 0.246609082393002,
|
|
"learning_rate": 3.6018740312808233e-06,
|
|
"loss": 0.7397,
|
|
"mean_token_accuracy": 0.8001858115196228,
|
|
"num_tokens": 441178545.0,
|
|
"step": 4410
|
|
},
|
|
{
|
|
"entropy": 0.976953125,
|
|
"epoch": 0.6040727073937406,
|
|
"grad_norm": 0.28035577542736817,
|
|
"learning_rate": 3.5983514160913064e-06,
|
|
"loss": 0.7051,
|
|
"mean_token_accuracy": 0.8060291945934296,
|
|
"num_tokens": 442210281.0,
|
|
"step": 4420
|
|
},
|
|
{
|
|
"entropy": 0.973046875,
|
|
"epoch": 0.6054393877272106,
|
|
"grad_norm": 0.23668066307273772,
|
|
"learning_rate": 3.5948288009017895e-06,
|
|
"loss": 0.7163,
|
|
"mean_token_accuracy": 0.8064760982990264,
|
|
"num_tokens": 443225259.0,
|
|
"step": 4430
|
|
},
|
|
{
|
|
"entropy": 0.987890625,
|
|
"epoch": 0.6068060680606806,
|
|
"grad_norm": 0.2609187062104592,
|
|
"learning_rate": 3.591306185712273e-06,
|
|
"loss": 0.7534,
|
|
"mean_token_accuracy": 0.7981087505817414,
|
|
"num_tokens": 444220229.0,
|
|
"step": 4440
|
|
},
|
|
{
|
|
"entropy": 1.009375,
|
|
"epoch": 0.6081727483941506,
|
|
"grad_norm": 0.23415364187654217,
|
|
"learning_rate": 3.5877835705227566e-06,
|
|
"loss": 0.7317,
|
|
"mean_token_accuracy": 0.8024899780750274,
|
|
"num_tokens": 445201473.0,
|
|
"step": 4450
|
|
},
|
|
{
|
|
"entropy": 0.9515625,
|
|
"epoch": 0.6095394287276206,
|
|
"grad_norm": 0.3096088364221319,
|
|
"learning_rate": 3.5842609553332398e-06,
|
|
"loss": 0.7171,
|
|
"mean_token_accuracy": 0.8066211700439453,
|
|
"num_tokens": 446200834.0,
|
|
"step": 4460
|
|
},
|
|
{
|
|
"entropy": 0.979296875,
|
|
"epoch": 0.6109061090610907,
|
|
"grad_norm": 0.2722064463641745,
|
|
"learning_rate": 3.580738340143723e-06,
|
|
"loss": 0.7194,
|
|
"mean_token_accuracy": 0.804729163646698,
|
|
"num_tokens": 447203460.0,
|
|
"step": 4470
|
|
},
|
|
{
|
|
"entropy": 0.9703125,
|
|
"epoch": 0.6122727893945606,
|
|
"grad_norm": 0.2596652958958314,
|
|
"learning_rate": 3.577215724954206e-06,
|
|
"loss": 0.7188,
|
|
"mean_token_accuracy": 0.8053621172904968,
|
|
"num_tokens": 448231820.0,
|
|
"step": 4480
|
|
},
|
|
{
|
|
"entropy": 1.008203125,
|
|
"epoch": 0.6136394697280306,
|
|
"grad_norm": 0.24472633720170256,
|
|
"learning_rate": 3.57369310976469e-06,
|
|
"loss": 0.7563,
|
|
"mean_token_accuracy": 0.7953315377235413,
|
|
"num_tokens": 449181166.0,
|
|
"step": 4490
|
|
},
|
|
{
|
|
"entropy": 1.0203125,
|
|
"epoch": 0.6150061500615006,
|
|
"grad_norm": 0.24755506237390593,
|
|
"learning_rate": 3.570170494575173e-06,
|
|
"loss": 0.7365,
|
|
"mean_token_accuracy": 0.804787814617157,
|
|
"num_tokens": 450200977.0,
|
|
"step": 4500
|
|
},
|
|
{
|
|
"entropy": 1.03515625,
|
|
"epoch": 0.6163728303949706,
|
|
"grad_norm": 0.27841775235053035,
|
|
"learning_rate": 3.5666478793856562e-06,
|
|
"loss": 0.7986,
|
|
"mean_token_accuracy": 0.7878994822502137,
|
|
"num_tokens": 451176344.0,
|
|
"step": 4510
|
|
},
|
|
{
|
|
"entropy": 0.952734375,
|
|
"epoch": 0.6177395107284406,
|
|
"grad_norm": 0.2905421851921465,
|
|
"learning_rate": 3.5631252641961394e-06,
|
|
"loss": 0.6987,
|
|
"mean_token_accuracy": 0.8092492640018463,
|
|
"num_tokens": 452144687.0,
|
|
"step": 4520
|
|
},
|
|
{
|
|
"entropy": 0.923046875,
|
|
"epoch": 0.6191061910619107,
|
|
"grad_norm": 0.259121223540954,
|
|
"learning_rate": 3.5596026490066225e-06,
|
|
"loss": 0.6741,
|
|
"mean_token_accuracy": 0.8156991302967072,
|
|
"num_tokens": 453172733.0,
|
|
"step": 4530
|
|
},
|
|
{
|
|
"entropy": 0.969140625,
|
|
"epoch": 0.6204728713953807,
|
|
"grad_norm": 0.27207662347067135,
|
|
"learning_rate": 3.556080033817106e-06,
|
|
"loss": 0.7137,
|
|
"mean_token_accuracy": 0.8076368153095246,
|
|
"num_tokens": 454139460.0,
|
|
"step": 4540
|
|
},
|
|
{
|
|
"entropy": 1.01484375,
|
|
"epoch": 0.6218395517288506,
|
|
"grad_norm": 0.28205295998137186,
|
|
"learning_rate": 3.5525574186275896e-06,
|
|
"loss": 0.7761,
|
|
"mean_token_accuracy": 0.794200998544693,
|
|
"num_tokens": 455099585.0,
|
|
"step": 4550
|
|
},
|
|
{
|
|
"entropy": 1.012890625,
|
|
"epoch": 0.6232062320623206,
|
|
"grad_norm": 0.275182807730778,
|
|
"learning_rate": 3.5490348034380727e-06,
|
|
"loss": 0.7473,
|
|
"mean_token_accuracy": 0.8002617180347442,
|
|
"num_tokens": 456115164.0,
|
|
"step": 4560
|
|
},
|
|
{
|
|
"entropy": 0.986328125,
|
|
"epoch": 0.6245729123957906,
|
|
"grad_norm": 0.24142790269410944,
|
|
"learning_rate": 3.545512188248556e-06,
|
|
"loss": 0.7206,
|
|
"mean_token_accuracy": 0.8050675928592682,
|
|
"num_tokens": 457102641.0,
|
|
"step": 4570
|
|
},
|
|
{
|
|
"entropy": 0.95390625,
|
|
"epoch": 0.6259395927292606,
|
|
"grad_norm": 0.2517912605449594,
|
|
"learning_rate": 3.5419895730590394e-06,
|
|
"loss": 0.7139,
|
|
"mean_token_accuracy": 0.8052597105503082,
|
|
"num_tokens": 458063569.0,
|
|
"step": 4580
|
|
},
|
|
{
|
|
"entropy": 1.008203125,
|
|
"epoch": 0.6273062730627307,
|
|
"grad_norm": 0.27220197354510595,
|
|
"learning_rate": 3.5384669578695225e-06,
|
|
"loss": 0.7265,
|
|
"mean_token_accuracy": 0.8031212627887726,
|
|
"num_tokens": 459050393.0,
|
|
"step": 4590
|
|
},
|
|
{
|
|
"entropy": 1.002734375,
|
|
"epoch": 0.6286729533962007,
|
|
"grad_norm": 0.2732871056705521,
|
|
"learning_rate": 3.534944342680006e-06,
|
|
"loss": 0.7589,
|
|
"mean_token_accuracy": 0.7979365646839142,
|
|
"num_tokens": 460080370.0,
|
|
"step": 4600
|
|
},
|
|
{
|
|
"entropy": 0.964453125,
|
|
"epoch": 0.6300396337296706,
|
|
"grad_norm": 0.24190589173124025,
|
|
"learning_rate": 3.5314217274904896e-06,
|
|
"loss": 0.7208,
|
|
"mean_token_accuracy": 0.8060357809066773,
|
|
"num_tokens": 461083660.0,
|
|
"step": 4610
|
|
},
|
|
{
|
|
"entropy": 0.991796875,
|
|
"epoch": 0.6314063140631406,
|
|
"grad_norm": 0.24153617185857595,
|
|
"learning_rate": 3.5278991123009727e-06,
|
|
"loss": 0.7259,
|
|
"mean_token_accuracy": 0.8034935891628265,
|
|
"num_tokens": 462065871.0,
|
|
"step": 4620
|
|
},
|
|
{
|
|
"entropy": 1.00703125,
|
|
"epoch": 0.6327729943966106,
|
|
"grad_norm": 0.2706841779497132,
|
|
"learning_rate": 3.524376497111456e-06,
|
|
"loss": 0.7214,
|
|
"mean_token_accuracy": 0.8042763054370881,
|
|
"num_tokens": 463080086.0,
|
|
"step": 4630
|
|
},
|
|
{
|
|
"entropy": 0.97109375,
|
|
"epoch": 0.6341396747300806,
|
|
"grad_norm": 0.2755232835142312,
|
|
"learning_rate": 3.520853881921939e-06,
|
|
"loss": 0.7094,
|
|
"mean_token_accuracy": 0.8082884430885315,
|
|
"num_tokens": 464075969.0,
|
|
"step": 4640
|
|
},
|
|
{
|
|
"entropy": 0.961328125,
|
|
"epoch": 0.6355063550635507,
|
|
"grad_norm": 0.2523230002643462,
|
|
"learning_rate": 3.517331266732422e-06,
|
|
"loss": 0.7276,
|
|
"mean_token_accuracy": 0.8062850594520569,
|
|
"num_tokens": 465113877.0,
|
|
"step": 4650
|
|
},
|
|
{
|
|
"entropy": 1.03828125,
|
|
"epoch": 0.6368730353970207,
|
|
"grad_norm": 0.2828568667406249,
|
|
"learning_rate": 3.513808651542906e-06,
|
|
"loss": 0.8077,
|
|
"mean_token_accuracy": 0.7888642191886902,
|
|
"num_tokens": 466103248.0,
|
|
"step": 4660
|
|
},
|
|
{
|
|
"entropy": 0.982421875,
|
|
"epoch": 0.6382397157304907,
|
|
"grad_norm": 0.26130672287982604,
|
|
"learning_rate": 3.510286036353389e-06,
|
|
"loss": 0.692,
|
|
"mean_token_accuracy": 0.811207115650177,
|
|
"num_tokens": 467036111.0,
|
|
"step": 4670
|
|
},
|
|
{
|
|
"entropy": 0.96953125,
|
|
"epoch": 0.6396063960639606,
|
|
"grad_norm": 0.23261703609173115,
|
|
"learning_rate": 3.5067634211638723e-06,
|
|
"loss": 0.6969,
|
|
"mean_token_accuracy": 0.810979688167572,
|
|
"num_tokens": 468077688.0,
|
|
"step": 4680
|
|
},
|
|
{
|
|
"entropy": 0.980078125,
|
|
"epoch": 0.6409730763974306,
|
|
"grad_norm": 0.25201218231991773,
|
|
"learning_rate": 3.5032408059743554e-06,
|
|
"loss": 0.7052,
|
|
"mean_token_accuracy": 0.8087165713310241,
|
|
"num_tokens": 469081863.0,
|
|
"step": 4690
|
|
},
|
|
{
|
|
"entropy": 0.97421875,
|
|
"epoch": 0.6423397567309006,
|
|
"grad_norm": 0.2601865754330908,
|
|
"learning_rate": 3.499718190784839e-06,
|
|
"loss": 0.7125,
|
|
"mean_token_accuracy": 0.8056531190872193,
|
|
"num_tokens": 470036745.0,
|
|
"step": 4700
|
|
},
|
|
{
|
|
"entropy": 0.973046875,
|
|
"epoch": 0.6437064370643707,
|
|
"grad_norm": 0.259228410014436,
|
|
"learning_rate": 3.4961955755953225e-06,
|
|
"loss": 0.7405,
|
|
"mean_token_accuracy": 0.8000729024410248,
|
|
"num_tokens": 471040901.0,
|
|
"step": 4710
|
|
},
|
|
{
|
|
"entropy": 0.993359375,
|
|
"epoch": 0.6450731173978407,
|
|
"grad_norm": 0.24851182622734294,
|
|
"learning_rate": 3.4926729604058056e-06,
|
|
"loss": 0.7139,
|
|
"mean_token_accuracy": 0.8060960292816162,
|
|
"num_tokens": 472034268.0,
|
|
"step": 4720
|
|
},
|
|
{
|
|
"entropy": 0.971875,
|
|
"epoch": 0.6464397977313107,
|
|
"grad_norm": 0.3000138818833469,
|
|
"learning_rate": 3.4891503452162888e-06,
|
|
"loss": 0.7132,
|
|
"mean_token_accuracy": 0.8082328379154206,
|
|
"num_tokens": 472986643.0,
|
|
"step": 4730
|
|
},
|
|
{
|
|
"entropy": 0.956640625,
|
|
"epoch": 0.6478064780647806,
|
|
"grad_norm": 0.25441237886244367,
|
|
"learning_rate": 3.4856277300267723e-06,
|
|
"loss": 0.6821,
|
|
"mean_token_accuracy": 0.8137820839881897,
|
|
"num_tokens": 473958882.0,
|
|
"step": 4740
|
|
},
|
|
{
|
|
"entropy": 0.979296875,
|
|
"epoch": 0.6491731583982506,
|
|
"grad_norm": 0.25056928728415373,
|
|
"learning_rate": 3.4821051148372554e-06,
|
|
"loss": 0.7255,
|
|
"mean_token_accuracy": 0.8041694819927215,
|
|
"num_tokens": 474928079.0,
|
|
"step": 4750
|
|
},
|
|
{
|
|
"entropy": 0.940625,
|
|
"epoch": 0.6505398387317206,
|
|
"grad_norm": 0.28912522523573775,
|
|
"learning_rate": 3.4785824996477386e-06,
|
|
"loss": 0.6613,
|
|
"mean_token_accuracy": 0.8183674335479736,
|
|
"num_tokens": 475886095.0,
|
|
"step": 4760
|
|
},
|
|
{
|
|
"entropy": 0.92734375,
|
|
"epoch": 0.6519065190651907,
|
|
"grad_norm": 0.2631455878973083,
|
|
"learning_rate": 3.475059884458222e-06,
|
|
"loss": 0.6803,
|
|
"mean_token_accuracy": 0.8138411641120911,
|
|
"num_tokens": 476869328.0,
|
|
"step": 4770
|
|
},
|
|
{
|
|
"entropy": 0.958203125,
|
|
"epoch": 0.6532731993986607,
|
|
"grad_norm": 0.26568482326697257,
|
|
"learning_rate": 3.4715372692687057e-06,
|
|
"loss": 0.696,
|
|
"mean_token_accuracy": 0.8098880648612976,
|
|
"num_tokens": 477821773.0,
|
|
"step": 4780
|
|
},
|
|
{
|
|
"entropy": 0.998046875,
|
|
"epoch": 0.6546398797321307,
|
|
"grad_norm": 0.25072836405369475,
|
|
"learning_rate": 3.4680146540791888e-06,
|
|
"loss": 0.7359,
|
|
"mean_token_accuracy": 0.8027579307556152,
|
|
"num_tokens": 478842083.0,
|
|
"step": 4790
|
|
},
|
|
{
|
|
"entropy": 0.98828125,
|
|
"epoch": 0.6560065600656007,
|
|
"grad_norm": 0.23949972930091556,
|
|
"learning_rate": 3.464492038889672e-06,
|
|
"loss": 0.7308,
|
|
"mean_token_accuracy": 0.8036091268062592,
|
|
"num_tokens": 479784211.0,
|
|
"step": 4800
|
|
},
|
|
{
|
|
"entropy": 0.976171875,
|
|
"epoch": 0.6573732403990706,
|
|
"grad_norm": 0.2826506653048949,
|
|
"learning_rate": 3.460969423700155e-06,
|
|
"loss": 0.7451,
|
|
"mean_token_accuracy": 0.7992844939231872,
|
|
"num_tokens": 480833427.0,
|
|
"step": 4810
|
|
},
|
|
{
|
|
"entropy": 0.983203125,
|
|
"epoch": 0.6587399207325406,
|
|
"grad_norm": 0.23566704824191295,
|
|
"learning_rate": 3.457446808510639e-06,
|
|
"loss": 0.7134,
|
|
"mean_token_accuracy": 0.8067427337169647,
|
|
"num_tokens": 481851310.0,
|
|
"step": 4820
|
|
},
|
|
{
|
|
"entropy": 0.958984375,
|
|
"epoch": 0.6601066010660107,
|
|
"grad_norm": 0.27102173985859285,
|
|
"learning_rate": 3.453924193321122e-06,
|
|
"loss": 0.7079,
|
|
"mean_token_accuracy": 0.808801406621933,
|
|
"num_tokens": 482891637.0,
|
|
"step": 4830
|
|
},
|
|
{
|
|
"entropy": 0.950390625,
|
|
"epoch": 0.6614732813994807,
|
|
"grad_norm": 0.26967301831019685,
|
|
"learning_rate": 3.4504015781316052e-06,
|
|
"loss": 0.6876,
|
|
"mean_token_accuracy": 0.8136945188045501,
|
|
"num_tokens": 483921621.0,
|
|
"step": 4840
|
|
},
|
|
{
|
|
"entropy": 0.9828125,
|
|
"epoch": 0.6628399617329507,
|
|
"grad_norm": 0.2507207337078908,
|
|
"learning_rate": 3.4468789629420884e-06,
|
|
"loss": 0.7184,
|
|
"mean_token_accuracy": 0.8058871030807495,
|
|
"num_tokens": 484982954.0,
|
|
"step": 4850
|
|
},
|
|
{
|
|
"entropy": 0.94296875,
|
|
"epoch": 0.6642066420664207,
|
|
"grad_norm": 0.25342536063342463,
|
|
"learning_rate": 3.4433563477525715e-06,
|
|
"loss": 0.7049,
|
|
"mean_token_accuracy": 0.8088086605072021,
|
|
"num_tokens": 485972247.0,
|
|
"step": 4860
|
|
},
|
|
{
|
|
"entropy": 0.976171875,
|
|
"epoch": 0.6655733223998906,
|
|
"grad_norm": 0.254216793756726,
|
|
"learning_rate": 3.439833732563055e-06,
|
|
"loss": 0.7012,
|
|
"mean_token_accuracy": 0.8093314707279206,
|
|
"num_tokens": 486961829.0,
|
|
"step": 4870
|
|
},
|
|
{
|
|
"entropy": 0.983984375,
|
|
"epoch": 0.6669400027333606,
|
|
"grad_norm": 0.28674794964681977,
|
|
"learning_rate": 3.4363111173735386e-06,
|
|
"loss": 0.7134,
|
|
"mean_token_accuracy": 0.8067425429821015,
|
|
"num_tokens": 487999991.0,
|
|
"step": 4880
|
|
},
|
|
{
|
|
"entropy": 0.976953125,
|
|
"epoch": 0.6683066830668307,
|
|
"grad_norm": 0.2625706595824132,
|
|
"learning_rate": 3.4327885021840217e-06,
|
|
"loss": 0.7193,
|
|
"mean_token_accuracy": 0.8057579517364502,
|
|
"num_tokens": 489015250.0,
|
|
"step": 4890
|
|
},
|
|
{
|
|
"entropy": 0.9671875,
|
|
"epoch": 0.6696733634003007,
|
|
"grad_norm": 0.2533782958511728,
|
|
"learning_rate": 3.429265886994505e-06,
|
|
"loss": 0.7402,
|
|
"mean_token_accuracy": 0.801922881603241,
|
|
"num_tokens": 490060131.0,
|
|
"step": 4900
|
|
},
|
|
{
|
|
"entropy": 0.967578125,
|
|
"epoch": 0.6710400437337707,
|
|
"grad_norm": 0.2743602407690303,
|
|
"learning_rate": 3.4257432718049884e-06,
|
|
"loss": 0.6896,
|
|
"mean_token_accuracy": 0.8115870118141174,
|
|
"num_tokens": 491082366.0,
|
|
"step": 4910
|
|
},
|
|
{
|
|
"entropy": 0.9515625,
|
|
"epoch": 0.6724067240672407,
|
|
"grad_norm": 0.2602590084707873,
|
|
"learning_rate": 3.4222206566154715e-06,
|
|
"loss": 0.7308,
|
|
"mean_token_accuracy": 0.8045538246631623,
|
|
"num_tokens": 492125674.0,
|
|
"step": 4920
|
|
},
|
|
{
|
|
"entropy": 1.0,
|
|
"epoch": 0.6737734044007107,
|
|
"grad_norm": 0.259958217379912,
|
|
"learning_rate": 3.418698041425955e-06,
|
|
"loss": 0.7492,
|
|
"mean_token_accuracy": 0.7976952493190765,
|
|
"num_tokens": 493112088.0,
|
|
"step": 4930
|
|
},
|
|
{
|
|
"entropy": 0.93984375,
|
|
"epoch": 0.6751400847341806,
|
|
"grad_norm": 0.25391679560450625,
|
|
"learning_rate": 3.415175426236438e-06,
|
|
"loss": 0.6902,
|
|
"mean_token_accuracy": 0.8124756574630737,
|
|
"num_tokens": 494137107.0,
|
|
"step": 4940
|
|
},
|
|
{
|
|
"entropy": 0.930859375,
|
|
"epoch": 0.6765067650676507,
|
|
"grad_norm": 0.24446812655349068,
|
|
"learning_rate": 3.4116528110469217e-06,
|
|
"loss": 0.6707,
|
|
"mean_token_accuracy": 0.8172999918460846,
|
|
"num_tokens": 495128504.0,
|
|
"step": 4950
|
|
},
|
|
{
|
|
"entropy": 0.96328125,
|
|
"epoch": 0.6778734454011207,
|
|
"grad_norm": 0.2804241484676152,
|
|
"learning_rate": 3.408130195857405e-06,
|
|
"loss": 0.6893,
|
|
"mean_token_accuracy": 0.8132100105285645,
|
|
"num_tokens": 496080043.0,
|
|
"step": 4960
|
|
},
|
|
{
|
|
"entropy": 0.99765625,
|
|
"epoch": 0.6792401257345907,
|
|
"grad_norm": 0.2826258943956965,
|
|
"learning_rate": 3.404607580667888e-06,
|
|
"loss": 0.7226,
|
|
"mean_token_accuracy": 0.8044626116752625,
|
|
"num_tokens": 497081232.0,
|
|
"step": 4970
|
|
},
|
|
{
|
|
"entropy": 0.94765625,
|
|
"epoch": 0.6806068060680607,
|
|
"grad_norm": 0.2585162103479574,
|
|
"learning_rate": 3.401084965478371e-06,
|
|
"loss": 0.6745,
|
|
"mean_token_accuracy": 0.8161998927593231,
|
|
"num_tokens": 498057583.0,
|
|
"step": 4980
|
|
},
|
|
{
|
|
"entropy": 0.990234375,
|
|
"epoch": 0.6819734864015307,
|
|
"grad_norm": 0.24449624310275525,
|
|
"learning_rate": 3.397562350288855e-06,
|
|
"loss": 0.7159,
|
|
"mean_token_accuracy": 0.8074153244495392,
|
|
"num_tokens": 499058823.0,
|
|
"step": 4990
|
|
},
|
|
{
|
|
"entropy": 0.9546875,
|
|
"epoch": 0.6833401667350006,
|
|
"grad_norm": 0.24967537078653604,
|
|
"learning_rate": 3.394039735099338e-06,
|
|
"loss": 0.6762,
|
|
"mean_token_accuracy": 0.8149123787879944,
|
|
"num_tokens": 500054628.0,
|
|
"step": 5000
|
|
},
|
|
{
|
|
"entropy": 0.9390625,
|
|
"epoch": 0.6847068470684707,
|
|
"grad_norm": 0.27123323842777336,
|
|
"learning_rate": 3.3905171199098213e-06,
|
|
"loss": 0.6713,
|
|
"mean_token_accuracy": 0.8142897665500641,
|
|
"num_tokens": 501048187.0,
|
|
"step": 5010
|
|
},
|
|
{
|
|
"entropy": 0.958203125,
|
|
"epoch": 0.6860735274019407,
|
|
"grad_norm": 0.23355031705397983,
|
|
"learning_rate": 3.3869945047203044e-06,
|
|
"loss": 0.7183,
|
|
"mean_token_accuracy": 0.8061842560768128,
|
|
"num_tokens": 502062268.0,
|
|
"step": 5020
|
|
},
|
|
{
|
|
"entropy": 0.957421875,
|
|
"epoch": 0.6874402077354107,
|
|
"grad_norm": 0.26403154563192094,
|
|
"learning_rate": 3.3834718895307876e-06,
|
|
"loss": 0.6779,
|
|
"mean_token_accuracy": 0.8148765444755555,
|
|
"num_tokens": 503054152.0,
|
|
"step": 5030
|
|
},
|
|
{
|
|
"entropy": 0.95078125,
|
|
"epoch": 0.6888068880688807,
|
|
"grad_norm": 0.23144070897620544,
|
|
"learning_rate": 3.3799492743412715e-06,
|
|
"loss": 0.6847,
|
|
"mean_token_accuracy": 0.8140066623687744,
|
|
"num_tokens": 504061542.0,
|
|
"step": 5040
|
|
},
|
|
{
|
|
"entropy": 0.96484375,
|
|
"epoch": 0.6901735684023507,
|
|
"grad_norm": 0.2501583870070361,
|
|
"learning_rate": 3.3764266591517547e-06,
|
|
"loss": 0.7007,
|
|
"mean_token_accuracy": 0.809241259098053,
|
|
"num_tokens": 505071467.0,
|
|
"step": 5050
|
|
},
|
|
{
|
|
"entropy": 0.957421875,
|
|
"epoch": 0.6915402487358207,
|
|
"grad_norm": 0.302623372468435,
|
|
"learning_rate": 3.3729040439622378e-06,
|
|
"loss": 0.7129,
|
|
"mean_token_accuracy": 0.8070549309253693,
|
|
"num_tokens": 506090809.0,
|
|
"step": 5060
|
|
},
|
|
{
|
|
"entropy": 0.981640625,
|
|
"epoch": 0.6929069290692907,
|
|
"grad_norm": 0.29181376780932766,
|
|
"learning_rate": 3.3693814287727213e-06,
|
|
"loss": 0.7271,
|
|
"mean_token_accuracy": 0.8027409672737121,
|
|
"num_tokens": 507069713.0,
|
|
"step": 5070
|
|
},
|
|
{
|
|
"entropy": 1.003125,
|
|
"epoch": 0.6942736094027607,
|
|
"grad_norm": 0.278458870350404,
|
|
"learning_rate": 3.3658588135832044e-06,
|
|
"loss": 0.7402,
|
|
"mean_token_accuracy": 0.8015803515911102,
|
|
"num_tokens": 508131315.0,
|
|
"step": 5080
|
|
},
|
|
{
|
|
"entropy": 0.947265625,
|
|
"epoch": 0.6956402897362307,
|
|
"grad_norm": 0.23082437877643858,
|
|
"learning_rate": 3.3623361983936876e-06,
|
|
"loss": 0.7031,
|
|
"mean_token_accuracy": 0.8101207733154296,
|
|
"num_tokens": 509194218.0,
|
|
"step": 5090
|
|
},
|
|
{
|
|
"entropy": 0.973046875,
|
|
"epoch": 0.6970069700697007,
|
|
"grad_norm": 0.2534051499294235,
|
|
"learning_rate": 3.358813583204171e-06,
|
|
"loss": 0.6976,
|
|
"mean_token_accuracy": 0.8111368894577027,
|
|
"num_tokens": 510256059.0,
|
|
"step": 5100
|
|
},
|
|
{
|
|
"entropy": 1.012109375,
|
|
"epoch": 0.6983736504031707,
|
|
"grad_norm": 0.29547470729339437,
|
|
"learning_rate": 3.3552909680146547e-06,
|
|
"loss": 0.7289,
|
|
"mean_token_accuracy": 0.802514374256134,
|
|
"num_tokens": 511260466.0,
|
|
"step": 5110
|
|
},
|
|
{
|
|
"entropy": 0.94453125,
|
|
"epoch": 0.6997403307366407,
|
|
"grad_norm": 0.25678101606281734,
|
|
"learning_rate": 3.3517683528251378e-06,
|
|
"loss": 0.69,
|
|
"mean_token_accuracy": 0.8114255428314209,
|
|
"num_tokens": 512259871.0,
|
|
"step": 5120
|
|
},
|
|
{
|
|
"entropy": 0.945703125,
|
|
"epoch": 0.7011070110701108,
|
|
"grad_norm": 0.2786364730786681,
|
|
"learning_rate": 3.348245737635621e-06,
|
|
"loss": 0.6849,
|
|
"mean_token_accuracy": 0.8142003774642944,
|
|
"num_tokens": 513284332.0,
|
|
"step": 5130
|
|
},
|
|
{
|
|
"entropy": 0.973828125,
|
|
"epoch": 0.7024736914035807,
|
|
"grad_norm": 0.2378248170624342,
|
|
"learning_rate": 3.344723122446104e-06,
|
|
"loss": 0.7017,
|
|
"mean_token_accuracy": 0.8085037112236023,
|
|
"num_tokens": 514253926.0,
|
|
"step": 5140
|
|
},
|
|
{
|
|
"entropy": 0.9921875,
|
|
"epoch": 0.7038403717370507,
|
|
"grad_norm": 0.26057940353586867,
|
|
"learning_rate": 3.341200507256587e-06,
|
|
"loss": 0.7191,
|
|
"mean_token_accuracy": 0.8061740875244141,
|
|
"num_tokens": 515239960.0,
|
|
"step": 5150
|
|
},
|
|
{
|
|
"entropy": 1.0203125,
|
|
"epoch": 0.7052070520705207,
|
|
"grad_norm": 0.2870843492583088,
|
|
"learning_rate": 3.337677892067071e-06,
|
|
"loss": 0.7084,
|
|
"mean_token_accuracy": 0.8088140726089478,
|
|
"num_tokens": 516225008.0,
|
|
"step": 5160
|
|
},
|
|
{
|
|
"entropy": 0.98125,
|
|
"epoch": 0.7065737324039907,
|
|
"grad_norm": 0.3096970861576957,
|
|
"learning_rate": 3.3341552768775543e-06,
|
|
"loss": 0.7401,
|
|
"mean_token_accuracy": 0.7998013854026794,
|
|
"num_tokens": 517241190.0,
|
|
"step": 5170
|
|
},
|
|
{
|
|
"entropy": 0.976171875,
|
|
"epoch": 0.7079404127374607,
|
|
"grad_norm": 0.2665489522504407,
|
|
"learning_rate": 3.3306326616880374e-06,
|
|
"loss": 0.6879,
|
|
"mean_token_accuracy": 0.8125224232673645,
|
|
"num_tokens": 518251490.0,
|
|
"step": 5180
|
|
},
|
|
{
|
|
"entropy": 1.008984375,
|
|
"epoch": 0.7093070930709308,
|
|
"grad_norm": 0.2511632605902565,
|
|
"learning_rate": 3.3271100464985205e-06,
|
|
"loss": 0.7288,
|
|
"mean_token_accuracy": 0.80311598777771,
|
|
"num_tokens": 519272357.0,
|
|
"step": 5190
|
|
},
|
|
{
|
|
"entropy": 0.96640625,
|
|
"epoch": 0.7106737734044007,
|
|
"grad_norm": 0.2610075851515124,
|
|
"learning_rate": 3.323587431309004e-06,
|
|
"loss": 0.7063,
|
|
"mean_token_accuracy": 0.8108802139759064,
|
|
"num_tokens": 520319517.0,
|
|
"step": 5200
|
|
},
|
|
{
|
|
"entropy": 0.983984375,
|
|
"epoch": 0.7120404537378707,
|
|
"grad_norm": 0.28078101170902847,
|
|
"learning_rate": 3.3200648161194876e-06,
|
|
"loss": 0.7155,
|
|
"mean_token_accuracy": 0.8063763439655304,
|
|
"num_tokens": 521333969.0,
|
|
"step": 5210
|
|
},
|
|
{
|
|
"entropy": 0.964453125,
|
|
"epoch": 0.7134071340713407,
|
|
"grad_norm": 0.2589833926464221,
|
|
"learning_rate": 3.3165422009299707e-06,
|
|
"loss": 0.7101,
|
|
"mean_token_accuracy": 0.808995372056961,
|
|
"num_tokens": 522342219.0,
|
|
"step": 5220
|
|
},
|
|
{
|
|
"entropy": 0.98359375,
|
|
"epoch": 0.7147738144048107,
|
|
"grad_norm": 0.25590361216657875,
|
|
"learning_rate": 3.313019585740454e-06,
|
|
"loss": 0.7049,
|
|
"mean_token_accuracy": 0.809320616722107,
|
|
"num_tokens": 523334861.0,
|
|
"step": 5230
|
|
},
|
|
{
|
|
"entropy": 0.983203125,
|
|
"epoch": 0.7161404947382807,
|
|
"grad_norm": 0.2554044849198769,
|
|
"learning_rate": 3.3094969705509374e-06,
|
|
"loss": 0.7487,
|
|
"mean_token_accuracy": 0.7987917959690094,
|
|
"num_tokens": 524347920.0,
|
|
"step": 5240
|
|
},
|
|
{
|
|
"entropy": 0.97421875,
|
|
"epoch": 0.7175071750717508,
|
|
"grad_norm": 0.2614629757040302,
|
|
"learning_rate": 3.3059743553614205e-06,
|
|
"loss": 0.7144,
|
|
"mean_token_accuracy": 0.8061415016651153,
|
|
"num_tokens": 525329939.0,
|
|
"step": 5250
|
|
},
|
|
{
|
|
"entropy": 0.95390625,
|
|
"epoch": 0.7188738554052208,
|
|
"grad_norm": 0.2589848875479326,
|
|
"learning_rate": 3.3024517401719036e-06,
|
|
"loss": 0.7014,
|
|
"mean_token_accuracy": 0.8080489277839661,
|
|
"num_tokens": 526310927.0,
|
|
"step": 5260
|
|
},
|
|
{
|
|
"entropy": 0.97578125,
|
|
"epoch": 0.7202405357386907,
|
|
"grad_norm": 0.3155676666670751,
|
|
"learning_rate": 3.298929124982387e-06,
|
|
"loss": 0.7508,
|
|
"mean_token_accuracy": 0.8056566476821899,
|
|
"num_tokens": 527328309.0,
|
|
"step": 5270
|
|
},
|
|
{
|
|
"entropy": 0.9984375,
|
|
"epoch": 0.7216072160721607,
|
|
"grad_norm": 0.24315960093674432,
|
|
"learning_rate": 3.2954065097928707e-06,
|
|
"loss": 0.727,
|
|
"mean_token_accuracy": 0.8055390954017639,
|
|
"num_tokens": 528355417.0,
|
|
"step": 5280
|
|
},
|
|
{
|
|
"entropy": 0.971875,
|
|
"epoch": 0.7229738964056307,
|
|
"grad_norm": 0.2531320879935968,
|
|
"learning_rate": 3.291883894603354e-06,
|
|
"loss": 0.7305,
|
|
"mean_token_accuracy": 0.8047998487949372,
|
|
"num_tokens": 529367701.0,
|
|
"step": 5290
|
|
},
|
|
{
|
|
"entropy": 0.93203125,
|
|
"epoch": 0.7243405767391007,
|
|
"grad_norm": 0.2801602998292745,
|
|
"learning_rate": 3.288361279413837e-06,
|
|
"loss": 0.7137,
|
|
"mean_token_accuracy": 0.8068425774574279,
|
|
"num_tokens": 530358442.0,
|
|
"step": 5300
|
|
},
|
|
{
|
|
"entropy": 0.942578125,
|
|
"epoch": 0.7257072570725708,
|
|
"grad_norm": 0.24591744183548986,
|
|
"learning_rate": 3.28483866422432e-06,
|
|
"loss": 0.6782,
|
|
"mean_token_accuracy": 0.815658575296402,
|
|
"num_tokens": 531346660.0,
|
|
"step": 5310
|
|
},
|
|
{
|
|
"entropy": 0.984765625,
|
|
"epoch": 0.7270739374060408,
|
|
"grad_norm": 0.25600858278655175,
|
|
"learning_rate": 3.281316049034804e-06,
|
|
"loss": 0.7328,
|
|
"mean_token_accuracy": 0.7998024344444274,
|
|
"num_tokens": 532403220.0,
|
|
"step": 5320
|
|
},
|
|
{
|
|
"entropy": 0.953125,
|
|
"epoch": 0.7284406177395107,
|
|
"grad_norm": 0.2520953173671218,
|
|
"learning_rate": 3.277793433845287e-06,
|
|
"loss": 0.6665,
|
|
"mean_token_accuracy": 0.8149233043193818,
|
|
"num_tokens": 533433256.0,
|
|
"step": 5330
|
|
},
|
|
{
|
|
"entropy": 0.976953125,
|
|
"epoch": 0.7298072980729807,
|
|
"grad_norm": 0.26740198330068915,
|
|
"learning_rate": 3.2742708186557703e-06,
|
|
"loss": 0.6934,
|
|
"mean_token_accuracy": 0.8132462918758392,
|
|
"num_tokens": 534455546.0,
|
|
"step": 5340
|
|
},
|
|
{
|
|
"entropy": 0.98359375,
|
|
"epoch": 0.7311739784064507,
|
|
"grad_norm": 0.2675063885952516,
|
|
"learning_rate": 3.2707482034662534e-06,
|
|
"loss": 0.7124,
|
|
"mean_token_accuracy": 0.8050222635269165,
|
|
"num_tokens": 535465383.0,
|
|
"step": 5350
|
|
},
|
|
{
|
|
"entropy": 0.98359375,
|
|
"epoch": 0.7325406587399207,
|
|
"grad_norm": 0.26877182185002424,
|
|
"learning_rate": 3.2672255882767366e-06,
|
|
"loss": 0.7089,
|
|
"mean_token_accuracy": 0.8096019506454468,
|
|
"num_tokens": 536463324.0,
|
|
"step": 5360
|
|
},
|
|
{
|
|
"entropy": 0.94296875,
|
|
"epoch": 0.7339073390733908,
|
|
"grad_norm": 0.22596474318800386,
|
|
"learning_rate": 3.26370297308722e-06,
|
|
"loss": 0.667,
|
|
"mean_token_accuracy": 0.8171655833721161,
|
|
"num_tokens": 537502644.0,
|
|
"step": 5370
|
|
},
|
|
{
|
|
"entropy": 0.955078125,
|
|
"epoch": 0.7352740194068608,
|
|
"grad_norm": 0.2655244535060893,
|
|
"learning_rate": 3.2601803578977037e-06,
|
|
"loss": 0.7126,
|
|
"mean_token_accuracy": 0.8067645788192749,
|
|
"num_tokens": 538501841.0,
|
|
"step": 5380
|
|
},
|
|
{
|
|
"entropy": 0.942578125,
|
|
"epoch": 0.7366406997403308,
|
|
"grad_norm": 0.23320100807536462,
|
|
"learning_rate": 3.2566577427081868e-06,
|
|
"loss": 0.6814,
|
|
"mean_token_accuracy": 0.8132574617862701,
|
|
"num_tokens": 539529171.0,
|
|
"step": 5390
|
|
},
|
|
{
|
|
"entropy": 0.9765625,
|
|
"epoch": 0.7380073800738007,
|
|
"grad_norm": 0.284653102855855,
|
|
"learning_rate": 3.25313512751867e-06,
|
|
"loss": 0.7038,
|
|
"mean_token_accuracy": 0.808856874704361,
|
|
"num_tokens": 540506909.0,
|
|
"step": 5400
|
|
},
|
|
{
|
|
"entropy": 1.003515625,
|
|
"epoch": 0.7393740604072707,
|
|
"grad_norm": 0.25092656485475645,
|
|
"learning_rate": 3.2496125123291535e-06,
|
|
"loss": 0.7348,
|
|
"mean_token_accuracy": 0.8030540645122528,
|
|
"num_tokens": 541508626.0,
|
|
"step": 5410
|
|
},
|
|
{
|
|
"entropy": 0.9671875,
|
|
"epoch": 0.7407407407407407,
|
|
"grad_norm": 0.2636424371575202,
|
|
"learning_rate": 3.2460898971396366e-06,
|
|
"loss": 0.6929,
|
|
"mean_token_accuracy": 0.813584154844284,
|
|
"num_tokens": 542509987.0,
|
|
"step": 5420
|
|
},
|
|
{
|
|
"entropy": 0.978515625,
|
|
"epoch": 0.7421074210742108,
|
|
"grad_norm": 0.26201797158549145,
|
|
"learning_rate": 3.24256728195012e-06,
|
|
"loss": 0.7161,
|
|
"mean_token_accuracy": 0.8077457487583161,
|
|
"num_tokens": 543492581.0,
|
|
"step": 5430
|
|
},
|
|
{
|
|
"entropy": 0.95703125,
|
|
"epoch": 0.7434741014076808,
|
|
"grad_norm": 0.24844433642099145,
|
|
"learning_rate": 3.2390446667606037e-06,
|
|
"loss": 0.6919,
|
|
"mean_token_accuracy": 0.8108472287654876,
|
|
"num_tokens": 544522249.0,
|
|
"step": 5440
|
|
},
|
|
{
|
|
"entropy": 0.975,
|
|
"epoch": 0.7448407817411508,
|
|
"grad_norm": 0.2670136831964037,
|
|
"learning_rate": 3.235522051571087e-06,
|
|
"loss": 0.6908,
|
|
"mean_token_accuracy": 0.8116368353366852,
|
|
"num_tokens": 545521894.0,
|
|
"step": 5450
|
|
},
|
|
{
|
|
"entropy": 0.98359375,
|
|
"epoch": 0.7462074620746207,
|
|
"grad_norm": 0.2412497704771886,
|
|
"learning_rate": 3.23199943638157e-06,
|
|
"loss": 0.707,
|
|
"mean_token_accuracy": 0.8078097999095917,
|
|
"num_tokens": 546492940.0,
|
|
"step": 5460
|
|
},
|
|
{
|
|
"entropy": 0.987109375,
|
|
"epoch": 0.7475741424080907,
|
|
"grad_norm": 0.29749712698548975,
|
|
"learning_rate": 3.228476821192053e-06,
|
|
"loss": 0.7204,
|
|
"mean_token_accuracy": 0.8059744298458099,
|
|
"num_tokens": 547508015.0,
|
|
"step": 5470
|
|
},
|
|
{
|
|
"entropy": 1.00234375,
|
|
"epoch": 0.7489408227415607,
|
|
"grad_norm": 0.2920701549005571,
|
|
"learning_rate": 3.224954206002536e-06,
|
|
"loss": 0.7472,
|
|
"mean_token_accuracy": 0.7980372369289398,
|
|
"num_tokens": 548533834.0,
|
|
"step": 5480
|
|
},
|
|
{
|
|
"entropy": 0.9515625,
|
|
"epoch": 0.7503075030750308,
|
|
"grad_norm": 0.24042446823165206,
|
|
"learning_rate": 3.22143159081302e-06,
|
|
"loss": 0.6566,
|
|
"mean_token_accuracy": 0.8196968615055085,
|
|
"num_tokens": 549548230.0,
|
|
"step": 5490
|
|
},
|
|
{
|
|
"entropy": 1.010546875,
|
|
"epoch": 0.7516741834085008,
|
|
"grad_norm": 0.3015723166781897,
|
|
"learning_rate": 3.2179089756235033e-06,
|
|
"loss": 0.722,
|
|
"mean_token_accuracy": 0.803642475605011,
|
|
"num_tokens": 550550533.0,
|
|
"step": 5500
|
|
},
|
|
{
|
|
"entropy": 0.99296875,
|
|
"epoch": 0.7530408637419708,
|
|
"grad_norm": 0.2601121839962206,
|
|
"learning_rate": 3.2143863604339864e-06,
|
|
"loss": 0.7202,
|
|
"mean_token_accuracy": 0.8046010792255401,
|
|
"num_tokens": 551582423.0,
|
|
"step": 5510
|
|
},
|
|
{
|
|
"entropy": 0.98828125,
|
|
"epoch": 0.7544075440754408,
|
|
"grad_norm": 0.25570832884614764,
|
|
"learning_rate": 3.2108637452444695e-06,
|
|
"loss": 0.7131,
|
|
"mean_token_accuracy": 0.807925820350647,
|
|
"num_tokens": 552575638.0,
|
|
"step": 5520
|
|
},
|
|
{
|
|
"entropy": 1.010546875,
|
|
"epoch": 0.7557742244089107,
|
|
"grad_norm": 0.25222997606475034,
|
|
"learning_rate": 3.2073411300549526e-06,
|
|
"loss": 0.7581,
|
|
"mean_token_accuracy": 0.799201101064682,
|
|
"num_tokens": 553546977.0,
|
|
"step": 5530
|
|
},
|
|
{
|
|
"entropy": 0.93671875,
|
|
"epoch": 0.7571409047423807,
|
|
"grad_norm": 0.23615675504165803,
|
|
"learning_rate": 3.2038185148654366e-06,
|
|
"loss": 0.6568,
|
|
"mean_token_accuracy": 0.8190969169139862,
|
|
"num_tokens": 554537362.0,
|
|
"step": 5540
|
|
},
|
|
{
|
|
"entropy": 0.99921875,
|
|
"epoch": 0.7585075850758508,
|
|
"grad_norm": 0.2739274156996308,
|
|
"learning_rate": 3.2002958996759197e-06,
|
|
"loss": 0.7604,
|
|
"mean_token_accuracy": 0.7969181180000305,
|
|
"num_tokens": 555506336.0,
|
|
"step": 5550
|
|
},
|
|
{
|
|
"entropy": 1.015234375,
|
|
"epoch": 0.7598742654093208,
|
|
"grad_norm": 0.2840524877591574,
|
|
"learning_rate": 3.196773284486403e-06,
|
|
"loss": 0.7501,
|
|
"mean_token_accuracy": 0.798887300491333,
|
|
"num_tokens": 556496732.0,
|
|
"step": 5560
|
|
},
|
|
{
|
|
"entropy": 0.98671875,
|
|
"epoch": 0.7612409457427908,
|
|
"grad_norm": 0.281467249322222,
|
|
"learning_rate": 3.1932506692968864e-06,
|
|
"loss": 0.7489,
|
|
"mean_token_accuracy": 0.7988040268421173,
|
|
"num_tokens": 557522731.0,
|
|
"step": 5570
|
|
},
|
|
{
|
|
"entropy": 0.948828125,
|
|
"epoch": 0.7626076260762608,
|
|
"grad_norm": 0.25828020730421686,
|
|
"learning_rate": 3.1897280541073695e-06,
|
|
"loss": 0.6935,
|
|
"mean_token_accuracy": 0.8093697488307953,
|
|
"num_tokens": 558552808.0,
|
|
"step": 5580
|
|
},
|
|
{
|
|
"entropy": 0.96875,
|
|
"epoch": 0.7639743064097307,
|
|
"grad_norm": 0.22680634954524206,
|
|
"learning_rate": 3.1862054389178526e-06,
|
|
"loss": 0.6909,
|
|
"mean_token_accuracy": 0.8127928614616394,
|
|
"num_tokens": 559613029.0,
|
|
"step": 5590
|
|
},
|
|
{
|
|
"entropy": 0.95,
|
|
"epoch": 0.7653409867432007,
|
|
"grad_norm": 0.2605170434232818,
|
|
"learning_rate": 3.182682823728336e-06,
|
|
"loss": 0.7017,
|
|
"mean_token_accuracy": 0.8094173431396484,
|
|
"num_tokens": 560628142.0,
|
|
"step": 5600
|
|
},
|
|
{
|
|
"entropy": 0.94765625,
|
|
"epoch": 0.7667076670766708,
|
|
"grad_norm": 0.2516104850415983,
|
|
"learning_rate": 3.1791602085388197e-06,
|
|
"loss": 0.6938,
|
|
"mean_token_accuracy": 0.810420697927475,
|
|
"num_tokens": 561653303.0,
|
|
"step": 5610
|
|
},
|
|
{
|
|
"entropy": 1.015234375,
|
|
"epoch": 0.7680743474101408,
|
|
"grad_norm": 0.25039079534704023,
|
|
"learning_rate": 3.175637593349303e-06,
|
|
"loss": 0.7509,
|
|
"mean_token_accuracy": 0.8009278237819671,
|
|
"num_tokens": 562622003.0,
|
|
"step": 5620
|
|
},
|
|
{
|
|
"entropy": 1.005078125,
|
|
"epoch": 0.7694410277436108,
|
|
"grad_norm": 0.2496648099367675,
|
|
"learning_rate": 3.172114978159786e-06,
|
|
"loss": 0.7322,
|
|
"mean_token_accuracy": 0.8040093719959259,
|
|
"num_tokens": 563647661.0,
|
|
"step": 5630
|
|
},
|
|
{
|
|
"entropy": 0.9859375,
|
|
"epoch": 0.7708077080770808,
|
|
"grad_norm": 0.24226938259831346,
|
|
"learning_rate": 3.168592362970269e-06,
|
|
"loss": 0.7035,
|
|
"mean_token_accuracy": 0.8096786737442017,
|
|
"num_tokens": 564603750.0,
|
|
"step": 5640
|
|
},
|
|
{
|
|
"entropy": 0.95234375,
|
|
"epoch": 0.7721743884105507,
|
|
"grad_norm": 0.2510320727964819,
|
|
"learning_rate": 3.165069747780753e-06,
|
|
"loss": 0.6696,
|
|
"mean_token_accuracy": 0.8146980166435241,
|
|
"num_tokens": 565577122.0,
|
|
"step": 5650
|
|
},
|
|
{
|
|
"entropy": 1.0015625,
|
|
"epoch": 0.7735410687440207,
|
|
"grad_norm": 0.27152626148073405,
|
|
"learning_rate": 3.161547132591236e-06,
|
|
"loss": 0.7213,
|
|
"mean_token_accuracy": 0.8043554663658142,
|
|
"num_tokens": 566604600.0,
|
|
"step": 5660
|
|
},
|
|
{
|
|
"entropy": 0.991015625,
|
|
"epoch": 0.7749077490774908,
|
|
"grad_norm": 0.23164939319270014,
|
|
"learning_rate": 3.1580245174017193e-06,
|
|
"loss": 0.7164,
|
|
"mean_token_accuracy": 0.8063323080539704,
|
|
"num_tokens": 567617845.0,
|
|
"step": 5670
|
|
},
|
|
{
|
|
"entropy": 0.980859375,
|
|
"epoch": 0.7762744294109608,
|
|
"grad_norm": 0.2682582723031497,
|
|
"learning_rate": 3.1545019022122025e-06,
|
|
"loss": 0.69,
|
|
"mean_token_accuracy": 0.8132848620414734,
|
|
"num_tokens": 568612057.0,
|
|
"step": 5680
|
|
},
|
|
{
|
|
"entropy": 1.007421875,
|
|
"epoch": 0.7776411097444308,
|
|
"grad_norm": 0.25135433022803744,
|
|
"learning_rate": 3.1509792870226856e-06,
|
|
"loss": 0.7387,
|
|
"mean_token_accuracy": 0.8012595772743225,
|
|
"num_tokens": 569613099.0,
|
|
"step": 5690
|
|
},
|
|
{
|
|
"entropy": 0.957421875,
|
|
"epoch": 0.7790077900779008,
|
|
"grad_norm": 0.2933844919030647,
|
|
"learning_rate": 3.147456671833169e-06,
|
|
"loss": 0.7016,
|
|
"mean_token_accuracy": 0.8090573191642761,
|
|
"num_tokens": 570607026.0,
|
|
"step": 5700
|
|
},
|
|
{
|
|
"entropy": 0.9671875,
|
|
"epoch": 0.7803744704113708,
|
|
"grad_norm": 0.26444764859370684,
|
|
"learning_rate": 3.1439340566436527e-06,
|
|
"loss": 0.7081,
|
|
"mean_token_accuracy": 0.8087228059768676,
|
|
"num_tokens": 571616119.0,
|
|
"step": 5710
|
|
},
|
|
{
|
|
"entropy": 0.988671875,
|
|
"epoch": 0.7817411507448407,
|
|
"grad_norm": 0.2551660718974422,
|
|
"learning_rate": 3.140411441454136e-06,
|
|
"loss": 0.7294,
|
|
"mean_token_accuracy": 0.8043662548065186,
|
|
"num_tokens": 572598084.0,
|
|
"step": 5720
|
|
},
|
|
{
|
|
"entropy": 0.97421875,
|
|
"epoch": 0.7831078310783108,
|
|
"grad_norm": 0.2786630238889825,
|
|
"learning_rate": 3.136888826264619e-06,
|
|
"loss": 0.7307,
|
|
"mean_token_accuracy": 0.8027510285377503,
|
|
"num_tokens": 573590736.0,
|
|
"step": 5730
|
|
},
|
|
{
|
|
"entropy": 0.95390625,
|
|
"epoch": 0.7844745114117808,
|
|
"grad_norm": 0.289407044850808,
|
|
"learning_rate": 3.1333662110751025e-06,
|
|
"loss": 0.7024,
|
|
"mean_token_accuracy": 0.808320426940918,
|
|
"num_tokens": 574574376.0,
|
|
"step": 5740
|
|
},
|
|
{
|
|
"entropy": 0.934765625,
|
|
"epoch": 0.7858411917452508,
|
|
"grad_norm": 0.2664768399591294,
|
|
"learning_rate": 3.1298435958855856e-06,
|
|
"loss": 0.6883,
|
|
"mean_token_accuracy": 0.81219123005867,
|
|
"num_tokens": 575523219.0,
|
|
"step": 5750
|
|
},
|
|
{
|
|
"entropy": 0.97265625,
|
|
"epoch": 0.7872078720787208,
|
|
"grad_norm": 0.2637577748598033,
|
|
"learning_rate": 3.126320980696069e-06,
|
|
"loss": 0.7309,
|
|
"mean_token_accuracy": 0.8023333191871643,
|
|
"num_tokens": 576500257.0,
|
|
"step": 5760
|
|
},
|
|
{
|
|
"entropy": 0.99296875,
|
|
"epoch": 0.7885745524121908,
|
|
"grad_norm": 0.2615707277407446,
|
|
"learning_rate": 3.1227983655065523e-06,
|
|
"loss": 0.7089,
|
|
"mean_token_accuracy": 0.8054983496665955,
|
|
"num_tokens": 577473156.0,
|
|
"step": 5770
|
|
},
|
|
{
|
|
"entropy": 0.94765625,
|
|
"epoch": 0.7899412327456607,
|
|
"grad_norm": 0.24842997946859255,
|
|
"learning_rate": 3.119275750317036e-06,
|
|
"loss": 0.6905,
|
|
"mean_token_accuracy": 0.8126639127731323,
|
|
"num_tokens": 578458348.0,
|
|
"step": 5780
|
|
},
|
|
{
|
|
"entropy": 1.006640625,
|
|
"epoch": 0.7913079130791308,
|
|
"grad_norm": 0.25661127388255334,
|
|
"learning_rate": 3.115753135127519e-06,
|
|
"loss": 0.7393,
|
|
"mean_token_accuracy": 0.7993307769298553,
|
|
"num_tokens": 579469890.0,
|
|
"step": 5790
|
|
},
|
|
{
|
|
"entropy": 0.962890625,
|
|
"epoch": 0.7926745934126008,
|
|
"grad_norm": 0.2639284654227982,
|
|
"learning_rate": 3.112230519938002e-06,
|
|
"loss": 0.7034,
|
|
"mean_token_accuracy": 0.8090180933475495,
|
|
"num_tokens": 580508736.0,
|
|
"step": 5800
|
|
},
|
|
{
|
|
"entropy": 0.940234375,
|
|
"epoch": 0.7940412737460708,
|
|
"grad_norm": 0.3037681233282586,
|
|
"learning_rate": 3.108707904748485e-06,
|
|
"loss": 0.6807,
|
|
"mean_token_accuracy": 0.8148297071456909,
|
|
"num_tokens": 581445920.0,
|
|
"step": 5810
|
|
},
|
|
{
|
|
"entropy": 0.984765625,
|
|
"epoch": 0.7954079540795408,
|
|
"grad_norm": 0.23372446610856834,
|
|
"learning_rate": 3.105185289558969e-06,
|
|
"loss": 0.7197,
|
|
"mean_token_accuracy": 0.8064890503883362,
|
|
"num_tokens": 582487593.0,
|
|
"step": 5820
|
|
},
|
|
{
|
|
"entropy": 0.952734375,
|
|
"epoch": 0.7967746344130108,
|
|
"grad_norm": 0.24352121276265445,
|
|
"learning_rate": 3.1016626743694523e-06,
|
|
"loss": 0.703,
|
|
"mean_token_accuracy": 0.8090635359287262,
|
|
"num_tokens": 583488287.0,
|
|
"step": 5830
|
|
},
|
|
{
|
|
"entropy": 0.925,
|
|
"epoch": 0.7981413147464808,
|
|
"grad_norm": 0.25145348609177903,
|
|
"learning_rate": 3.0981400591799354e-06,
|
|
"loss": 0.6686,
|
|
"mean_token_accuracy": 0.8162093877792358,
|
|
"num_tokens": 584551415.0,
|
|
"step": 5840
|
|
},
|
|
{
|
|
"entropy": 0.95703125,
|
|
"epoch": 0.7995079950799509,
|
|
"grad_norm": 0.25549220068093037,
|
|
"learning_rate": 3.0946174439904185e-06,
|
|
"loss": 0.6759,
|
|
"mean_token_accuracy": 0.8158814668655395,
|
|
"num_tokens": 585569034.0,
|
|
"step": 5850
|
|
},
|
|
{
|
|
"entropy": 0.966796875,
|
|
"epoch": 0.8008746754134208,
|
|
"grad_norm": 0.25145983499890134,
|
|
"learning_rate": 3.0910948288009016e-06,
|
|
"loss": 0.6915,
|
|
"mean_token_accuracy": 0.812415361404419,
|
|
"num_tokens": 586536939.0,
|
|
"step": 5860
|
|
},
|
|
{
|
|
"entropy": 0.954296875,
|
|
"epoch": 0.8022413557468908,
|
|
"grad_norm": 0.291528137598365,
|
|
"learning_rate": 3.0875722136113856e-06,
|
|
"loss": 0.7151,
|
|
"mean_token_accuracy": 0.8054151594638824,
|
|
"num_tokens": 587530274.0,
|
|
"step": 5870
|
|
},
|
|
{
|
|
"entropy": 0.978515625,
|
|
"epoch": 0.8036080360803608,
|
|
"grad_norm": 0.25420399660404674,
|
|
"learning_rate": 3.0840495984218687e-06,
|
|
"loss": 0.7163,
|
|
"mean_token_accuracy": 0.8057134091854096,
|
|
"num_tokens": 588558033.0,
|
|
"step": 5880
|
|
},
|
|
{
|
|
"entropy": 0.994140625,
|
|
"epoch": 0.8049747164138308,
|
|
"grad_norm": 0.26697893193532446,
|
|
"learning_rate": 3.080526983232352e-06,
|
|
"loss": 0.7115,
|
|
"mean_token_accuracy": 0.8071715712547303,
|
|
"num_tokens": 589542926.0,
|
|
"step": 5890
|
|
},
|
|
{
|
|
"entropy": 0.975,
|
|
"epoch": 0.8063413967473008,
|
|
"grad_norm": 0.2649224046646963,
|
|
"learning_rate": 3.0770043680428354e-06,
|
|
"loss": 0.7224,
|
|
"mean_token_accuracy": 0.8044336616992951,
|
|
"num_tokens": 590551239.0,
|
|
"step": 5900
|
|
},
|
|
{
|
|
"entropy": 0.946875,
|
|
"epoch": 0.8077080770807709,
|
|
"grad_norm": 0.2509857765180178,
|
|
"learning_rate": 3.0734817528533185e-06,
|
|
"loss": 0.6727,
|
|
"mean_token_accuracy": 0.8169360458850861,
|
|
"num_tokens": 591541550.0,
|
|
"step": 5910
|
|
},
|
|
{
|
|
"entropy": 1.00703125,
|
|
"epoch": 0.8090747574142408,
|
|
"grad_norm": 0.2760859259210618,
|
|
"learning_rate": 3.0699591376638017e-06,
|
|
"loss": 0.7464,
|
|
"mean_token_accuracy": 0.8005715548992157,
|
|
"num_tokens": 592526054.0,
|
|
"step": 5920
|
|
},
|
|
{
|
|
"entropy": 0.958203125,
|
|
"epoch": 0.8104414377477108,
|
|
"grad_norm": 0.24656024621325903,
|
|
"learning_rate": 3.066436522474285e-06,
|
|
"loss": 0.7096,
|
|
"mean_token_accuracy": 0.8094933509826661,
|
|
"num_tokens": 593517164.0,
|
|
"step": 5930
|
|
},
|
|
{
|
|
"entropy": 0.924609375,
|
|
"epoch": 0.8118081180811808,
|
|
"grad_norm": 0.24424489173583988,
|
|
"learning_rate": 3.0629139072847688e-06,
|
|
"loss": 0.6696,
|
|
"mean_token_accuracy": 0.8168092370033264,
|
|
"num_tokens": 594586885.0,
|
|
"step": 5940
|
|
},
|
|
{
|
|
"entropy": 0.998828125,
|
|
"epoch": 0.8131747984146508,
|
|
"grad_norm": 0.2737712153292341,
|
|
"learning_rate": 3.059391292095252e-06,
|
|
"loss": 0.7367,
|
|
"mean_token_accuracy": 0.800313514471054,
|
|
"num_tokens": 595562782.0,
|
|
"step": 5950
|
|
},
|
|
{
|
|
"entropy": 0.978515625,
|
|
"epoch": 0.8145414787481208,
|
|
"grad_norm": 0.2619867507489147,
|
|
"learning_rate": 3.055868676905735e-06,
|
|
"loss": 0.717,
|
|
"mean_token_accuracy": 0.8061873197555542,
|
|
"num_tokens": 596620797.0,
|
|
"step": 5960
|
|
},
|
|
{
|
|
"entropy": 1.006640625,
|
|
"epoch": 0.8159081590815909,
|
|
"grad_norm": 0.28360735815807675,
|
|
"learning_rate": 3.052346061716218e-06,
|
|
"loss": 0.7374,
|
|
"mean_token_accuracy": 0.802816528081894,
|
|
"num_tokens": 597544265.0,
|
|
"step": 5970
|
|
},
|
|
{
|
|
"entropy": 0.97109375,
|
|
"epoch": 0.8172748394150608,
|
|
"grad_norm": 0.2747490449624437,
|
|
"learning_rate": 3.048823446526702e-06,
|
|
"loss": 0.6988,
|
|
"mean_token_accuracy": 0.8098525941371918,
|
|
"num_tokens": 598556947.0,
|
|
"step": 5980
|
|
},
|
|
{
|
|
"entropy": 0.995703125,
|
|
"epoch": 0.8186415197485308,
|
|
"grad_norm": 0.29650112320030214,
|
|
"learning_rate": 3.0453008313371852e-06,
|
|
"loss": 0.7342,
|
|
"mean_token_accuracy": 0.8041230261325836,
|
|
"num_tokens": 599603049.0,
|
|
"step": 5990
|
|
},
|
|
{
|
|
"entropy": 0.96171875,
|
|
"epoch": 0.8200082000820008,
|
|
"grad_norm": 0.28083302904631735,
|
|
"learning_rate": 3.0417782161476683e-06,
|
|
"loss": 0.7201,
|
|
"mean_token_accuracy": 0.8051189005374908,
|
|
"num_tokens": 600590091.0,
|
|
"step": 6000
|
|
},
|
|
{
|
|
"entropy": 1.028125,
|
|
"epoch": 0.8213748804154708,
|
|
"grad_norm": 0.29467032832116224,
|
|
"learning_rate": 3.0382556009581515e-06,
|
|
"loss": 0.7275,
|
|
"mean_token_accuracy": 0.8022810280323028,
|
|
"num_tokens": 601575708.0,
|
|
"step": 6010
|
|
},
|
|
{
|
|
"entropy": 0.962890625,
|
|
"epoch": 0.8227415607489408,
|
|
"grad_norm": 0.26225500914167,
|
|
"learning_rate": 3.0347329857686346e-06,
|
|
"loss": 0.6762,
|
|
"mean_token_accuracy": 0.8149959981441498,
|
|
"num_tokens": 602543161.0,
|
|
"step": 6020
|
|
},
|
|
{
|
|
"entropy": 0.948828125,
|
|
"epoch": 0.8241082410824109,
|
|
"grad_norm": 0.2822183461058575,
|
|
"learning_rate": 3.031210370579118e-06,
|
|
"loss": 0.6665,
|
|
"mean_token_accuracy": 0.8185731530189514,
|
|
"num_tokens": 603550842.0,
|
|
"step": 6030
|
|
},
|
|
{
|
|
"entropy": 0.962109375,
|
|
"epoch": 0.8254749214158809,
|
|
"grad_norm": 0.2551732057455204,
|
|
"learning_rate": 3.0276877553896017e-06,
|
|
"loss": 0.7076,
|
|
"mean_token_accuracy": 0.8051981627941132,
|
|
"num_tokens": 604559325.0,
|
|
"step": 6040
|
|
},
|
|
{
|
|
"entropy": 0.987890625,
|
|
"epoch": 0.8268416017493508,
|
|
"grad_norm": 0.30126786998783245,
|
|
"learning_rate": 3.024165140200085e-06,
|
|
"loss": 0.6879,
|
|
"mean_token_accuracy": 0.8121889472007752,
|
|
"num_tokens": 605552607.0,
|
|
"step": 6050
|
|
},
|
|
{
|
|
"entropy": 0.98359375,
|
|
"epoch": 0.8282082820828208,
|
|
"grad_norm": 0.25863077092489395,
|
|
"learning_rate": 3.020642525010568e-06,
|
|
"loss": 0.7108,
|
|
"mean_token_accuracy": 0.8081291735172271,
|
|
"num_tokens": 606538979.0,
|
|
"step": 6060
|
|
},
|
|
{
|
|
"entropy": 0.97890625,
|
|
"epoch": 0.8295749624162908,
|
|
"grad_norm": 0.26410335649800937,
|
|
"learning_rate": 3.0171199098210515e-06,
|
|
"loss": 0.6911,
|
|
"mean_token_accuracy": 0.8115857064723968,
|
|
"num_tokens": 607508204.0,
|
|
"step": 6070
|
|
},
|
|
{
|
|
"entropy": 0.960546875,
|
|
"epoch": 0.8309416427497608,
|
|
"grad_norm": 0.26897545217021385,
|
|
"learning_rate": 3.0135972946315346e-06,
|
|
"loss": 0.7116,
|
|
"mean_token_accuracy": 0.8090519905090332,
|
|
"num_tokens": 608524577.0,
|
|
"step": 6080
|
|
},
|
|
{
|
|
"entropy": 0.993359375,
|
|
"epoch": 0.8323083230832309,
|
|
"grad_norm": 0.25188288167346706,
|
|
"learning_rate": 3.010074679442018e-06,
|
|
"loss": 0.7317,
|
|
"mean_token_accuracy": 0.8029532968997956,
|
|
"num_tokens": 609491404.0,
|
|
"step": 6090
|
|
},
|
|
{
|
|
"entropy": 0.993359375,
|
|
"epoch": 0.8336750034167009,
|
|
"grad_norm": 0.29929919808536415,
|
|
"learning_rate": 3.0065520642525013e-06,
|
|
"loss": 0.7439,
|
|
"mean_token_accuracy": 0.8014557838439942,
|
|
"num_tokens": 610456894.0,
|
|
"step": 6100
|
|
},
|
|
{
|
|
"entropy": 1.0015625,
|
|
"epoch": 0.8350416837501708,
|
|
"grad_norm": 0.26492858080354836,
|
|
"learning_rate": 3.003029449062985e-06,
|
|
"loss": 0.711,
|
|
"mean_token_accuracy": 0.8074106812477112,
|
|
"num_tokens": 611476065.0,
|
|
"step": 6110
|
|
},
|
|
{
|
|
"entropy": 0.972265625,
|
|
"epoch": 0.8364083640836408,
|
|
"grad_norm": 0.28008302945841757,
|
|
"learning_rate": 2.999506833873468e-06,
|
|
"loss": 0.7263,
|
|
"mean_token_accuracy": 0.8047305107116699,
|
|
"num_tokens": 612425310.0,
|
|
"step": 6120
|
|
},
|
|
{
|
|
"entropy": 1.008203125,
|
|
"epoch": 0.8377750444171108,
|
|
"grad_norm": 0.25509277140343,
|
|
"learning_rate": 2.995984218683951e-06,
|
|
"loss": 0.7523,
|
|
"mean_token_accuracy": 0.7976482391357422,
|
|
"num_tokens": 613425793.0,
|
|
"step": 6130
|
|
},
|
|
{
|
|
"entropy": 0.96953125,
|
|
"epoch": 0.8391417247505808,
|
|
"grad_norm": 0.23355738287598746,
|
|
"learning_rate": 2.992461603494434e-06,
|
|
"loss": 0.6881,
|
|
"mean_token_accuracy": 0.8123613357543945,
|
|
"num_tokens": 614450318.0,
|
|
"step": 6140
|
|
},
|
|
{
|
|
"entropy": 0.96953125,
|
|
"epoch": 0.8405084050840509,
|
|
"grad_norm": 0.26989371995097305,
|
|
"learning_rate": 2.988938988304918e-06,
|
|
"loss": 0.7211,
|
|
"mean_token_accuracy": 0.804918360710144,
|
|
"num_tokens": 615468699.0,
|
|
"step": 6150
|
|
},
|
|
{
|
|
"entropy": 0.95234375,
|
|
"epoch": 0.8418750854175209,
|
|
"grad_norm": 0.26972297000400797,
|
|
"learning_rate": 2.9854163731154013e-06,
|
|
"loss": 0.6939,
|
|
"mean_token_accuracy": 0.8127125918865203,
|
|
"num_tokens": 616457438.0,
|
|
"step": 6160
|
|
},
|
|
{
|
|
"entropy": 0.978125,
|
|
"epoch": 0.8432417657509909,
|
|
"grad_norm": 0.2298691494162817,
|
|
"learning_rate": 2.9818937579258844e-06,
|
|
"loss": 0.7016,
|
|
"mean_token_accuracy": 0.8086892604827881,
|
|
"num_tokens": 617408605.0,
|
|
"step": 6170
|
|
},
|
|
{
|
|
"entropy": 0.96953125,
|
|
"epoch": 0.8446084460844608,
|
|
"grad_norm": 0.2588229725940494,
|
|
"learning_rate": 2.9783711427363675e-06,
|
|
"loss": 0.6774,
|
|
"mean_token_accuracy": 0.8148540437221528,
|
|
"num_tokens": 618412780.0,
|
|
"step": 6180
|
|
},
|
|
{
|
|
"entropy": 0.987109375,
|
|
"epoch": 0.8459751264179308,
|
|
"grad_norm": 0.3147427352045661,
|
|
"learning_rate": 2.9748485275468507e-06,
|
|
"loss": 0.7172,
|
|
"mean_token_accuracy": 0.8069362461566925,
|
|
"num_tokens": 619400950.0,
|
|
"step": 6190
|
|
},
|
|
{
|
|
"entropy": 0.960546875,
|
|
"epoch": 0.8473418067514008,
|
|
"grad_norm": 0.24729164923935162,
|
|
"learning_rate": 2.9713259123573346e-06,
|
|
"loss": 0.7081,
|
|
"mean_token_accuracy": 0.8076168537139893,
|
|
"num_tokens": 620361772.0,
|
|
"step": 6200
|
|
},
|
|
{
|
|
"entropy": 0.96015625,
|
|
"epoch": 0.8487084870848709,
|
|
"grad_norm": 0.24914539323383877,
|
|
"learning_rate": 2.9678032971678177e-06,
|
|
"loss": 0.7172,
|
|
"mean_token_accuracy": 0.8050924897193908,
|
|
"num_tokens": 621309759.0,
|
|
"step": 6210
|
|
},
|
|
{
|
|
"entropy": 0.9515625,
|
|
"epoch": 0.8500751674183409,
|
|
"grad_norm": 0.24715463268826546,
|
|
"learning_rate": 2.964280681978301e-06,
|
|
"loss": 0.7482,
|
|
"mean_token_accuracy": 0.7986325979232788,
|
|
"num_tokens": 622344321.0,
|
|
"step": 6220
|
|
},
|
|
{
|
|
"entropy": 0.9453125,
|
|
"epoch": 0.8514418477518109,
|
|
"grad_norm": 0.3048932290538384,
|
|
"learning_rate": 2.960758066788784e-06,
|
|
"loss": 0.698,
|
|
"mean_token_accuracy": 0.811188131570816,
|
|
"num_tokens": 623307147.0,
|
|
"step": 6230
|
|
},
|
|
{
|
|
"entropy": 0.996875,
|
|
"epoch": 0.8528085280852808,
|
|
"grad_norm": 0.2626318873541507,
|
|
"learning_rate": 2.9572354515992675e-06,
|
|
"loss": 0.7131,
|
|
"mean_token_accuracy": 0.8054319322109222,
|
|
"num_tokens": 624284064.0,
|
|
"step": 6240
|
|
},
|
|
{
|
|
"entropy": 0.91484375,
|
|
"epoch": 0.8541752084187508,
|
|
"grad_norm": 0.258084805970135,
|
|
"learning_rate": 2.9537128364097507e-06,
|
|
"loss": 0.6609,
|
|
"mean_token_accuracy": 0.8207892119884491,
|
|
"num_tokens": 625283185.0,
|
|
"step": 6250
|
|
},
|
|
{
|
|
"entropy": 0.9609375,
|
|
"epoch": 0.8555418887522208,
|
|
"grad_norm": 0.2378338833668553,
|
|
"learning_rate": 2.9501902212202342e-06,
|
|
"loss": 0.7043,
|
|
"mean_token_accuracy": 0.8101511359214782,
|
|
"num_tokens": 626319054.0,
|
|
"step": 6260
|
|
},
|
|
{
|
|
"entropy": 0.97421875,
|
|
"epoch": 0.8569085690856909,
|
|
"grad_norm": 0.2416626494072153,
|
|
"learning_rate": 2.9466676060307178e-06,
|
|
"loss": 0.7254,
|
|
"mean_token_accuracy": 0.8045297920703888,
|
|
"num_tokens": 627327798.0,
|
|
"step": 6270
|
|
},
|
|
{
|
|
"entropy": 0.996484375,
|
|
"epoch": 0.8582752494191609,
|
|
"grad_norm": 0.24539996950517848,
|
|
"learning_rate": 2.943144990841201e-06,
|
|
"loss": 0.7195,
|
|
"mean_token_accuracy": 0.8057716131210327,
|
|
"num_tokens": 628345763.0,
|
|
"step": 6280
|
|
},
|
|
{
|
|
"entropy": 0.971875,
|
|
"epoch": 0.8596419297526309,
|
|
"grad_norm": 0.2595438857011754,
|
|
"learning_rate": 2.939622375651684e-06,
|
|
"loss": 0.6926,
|
|
"mean_token_accuracy": 0.8120434284210205,
|
|
"num_tokens": 629349687.0,
|
|
"step": 6290
|
|
},
|
|
{
|
|
"entropy": 0.983984375,
|
|
"epoch": 0.8610086100861009,
|
|
"grad_norm": 0.27807541834042826,
|
|
"learning_rate": 2.936099760462167e-06,
|
|
"loss": 0.7503,
|
|
"mean_token_accuracy": 0.7992382884025574,
|
|
"num_tokens": 630396591.0,
|
|
"step": 6300
|
|
},
|
|
{
|
|
"entropy": 0.96484375,
|
|
"epoch": 0.8623752904195708,
|
|
"grad_norm": 0.2468940223974095,
|
|
"learning_rate": 2.932577145272651e-06,
|
|
"loss": 0.6548,
|
|
"mean_token_accuracy": 0.8195917487144471,
|
|
"num_tokens": 631372808.0,
|
|
"step": 6310
|
|
},
|
|
{
|
|
"entropy": 0.98984375,
|
|
"epoch": 0.8637419707530408,
|
|
"grad_norm": 0.2354887711537473,
|
|
"learning_rate": 2.9290545300831342e-06,
|
|
"loss": 0.7226,
|
|
"mean_token_accuracy": 0.8052141189575195,
|
|
"num_tokens": 632389956.0,
|
|
"step": 6320
|
|
},
|
|
{
|
|
"entropy": 1.01328125,
|
|
"epoch": 0.8651086510865109,
|
|
"grad_norm": 0.2595376088560116,
|
|
"learning_rate": 2.9255319148936174e-06,
|
|
"loss": 0.7474,
|
|
"mean_token_accuracy": 0.8013930857181549,
|
|
"num_tokens": 633382741.0,
|
|
"step": 6330
|
|
},
|
|
{
|
|
"entropy": 0.94375,
|
|
"epoch": 0.8664753314199809,
|
|
"grad_norm": 0.2629629045580129,
|
|
"learning_rate": 2.9220092997041005e-06,
|
|
"loss": 0.6675,
|
|
"mean_token_accuracy": 0.8185890734195709,
|
|
"num_tokens": 634392872.0,
|
|
"step": 6340
|
|
},
|
|
{
|
|
"entropy": 0.98671875,
|
|
"epoch": 0.8678420117534509,
|
|
"grad_norm": 0.24641157962608376,
|
|
"learning_rate": 2.9184866845145836e-06,
|
|
"loss": 0.7092,
|
|
"mean_token_accuracy": 0.8084762215614318,
|
|
"num_tokens": 635397192.0,
|
|
"step": 6350
|
|
},
|
|
{
|
|
"entropy": 0.963671875,
|
|
"epoch": 0.8692086920869209,
|
|
"grad_norm": 0.275168298230751,
|
|
"learning_rate": 2.9149640693250667e-06,
|
|
"loss": 0.713,
|
|
"mean_token_accuracy": 0.8068542242050171,
|
|
"num_tokens": 636429865.0,
|
|
"step": 6360
|
|
},
|
|
{
|
|
"entropy": 0.980078125,
|
|
"epoch": 0.8705753724203908,
|
|
"grad_norm": 0.26204183062188025,
|
|
"learning_rate": 2.9114414541355507e-06,
|
|
"loss": 0.722,
|
|
"mean_token_accuracy": 0.8049521446228027,
|
|
"num_tokens": 637412707.0,
|
|
"step": 6370
|
|
},
|
|
{
|
|
"entropy": 0.989453125,
|
|
"epoch": 0.8719420527538608,
|
|
"grad_norm": 0.24243161890928308,
|
|
"learning_rate": 2.907918838946034e-06,
|
|
"loss": 0.7028,
|
|
"mean_token_accuracy": 0.8110884964466095,
|
|
"num_tokens": 638419040.0,
|
|
"step": 6380
|
|
},
|
|
{
|
|
"entropy": 0.987109375,
|
|
"epoch": 0.8733087330873309,
|
|
"grad_norm": 0.25769061853211994,
|
|
"learning_rate": 2.904396223756517e-06,
|
|
"loss": 0.7156,
|
|
"mean_token_accuracy": 0.806398230791092,
|
|
"num_tokens": 639409575.0,
|
|
"step": 6390
|
|
},
|
|
{
|
|
"entropy": 0.98671875,
|
|
"epoch": 0.8746754134208009,
|
|
"grad_norm": 0.2724755710102113,
|
|
"learning_rate": 2.9008736085670005e-06,
|
|
"loss": 0.7141,
|
|
"mean_token_accuracy": 0.8073841214179993,
|
|
"num_tokens": 640403980.0,
|
|
"step": 6400
|
|
},
|
|
{
|
|
"entropy": 0.932421875,
|
|
"epoch": 0.8760420937542709,
|
|
"grad_norm": 0.2900752799856261,
|
|
"learning_rate": 2.8973509933774836e-06,
|
|
"loss": 0.6772,
|
|
"mean_token_accuracy": 0.8148886263370514,
|
|
"num_tokens": 641380100.0,
|
|
"step": 6410
|
|
},
|
|
{
|
|
"entropy": 0.979296875,
|
|
"epoch": 0.8774087740877409,
|
|
"grad_norm": 0.24721019672197483,
|
|
"learning_rate": 2.893828378187967e-06,
|
|
"loss": 0.7417,
|
|
"mean_token_accuracy": 0.8015777230262756,
|
|
"num_tokens": 642396526.0,
|
|
"step": 6420
|
|
},
|
|
{
|
|
"entropy": 0.967578125,
|
|
"epoch": 0.8787754544212109,
|
|
"grad_norm": 0.2534383696223407,
|
|
"learning_rate": 2.8903057629984503e-06,
|
|
"loss": 0.6847,
|
|
"mean_token_accuracy": 0.8121343493461609,
|
|
"num_tokens": 643365779.0,
|
|
"step": 6430
|
|
},
|
|
{
|
|
"entropy": 0.9703125,
|
|
"epoch": 0.8801421347546808,
|
|
"grad_norm": 0.26948887420339857,
|
|
"learning_rate": 2.886783147808934e-06,
|
|
"loss": 0.6876,
|
|
"mean_token_accuracy": 0.8117909789085388,
|
|
"num_tokens": 644374233.0,
|
|
"step": 6440
|
|
},
|
|
{
|
|
"entropy": 1.00859375,
|
|
"epoch": 0.8815088150881509,
|
|
"grad_norm": 0.25712393651531085,
|
|
"learning_rate": 2.883260532619417e-06,
|
|
"loss": 0.7446,
|
|
"mean_token_accuracy": 0.8004461050033569,
|
|
"num_tokens": 645333738.0,
|
|
"step": 6450
|
|
},
|
|
{
|
|
"entropy": 0.96796875,
|
|
"epoch": 0.8828754954216209,
|
|
"grad_norm": 0.28464168870353596,
|
|
"learning_rate": 2.8797379174299e-06,
|
|
"loss": 0.6822,
|
|
"mean_token_accuracy": 0.8135372161865234,
|
|
"num_tokens": 646280138.0,
|
|
"step": 6460
|
|
},
|
|
{
|
|
"entropy": 0.930859375,
|
|
"epoch": 0.8842421757550909,
|
|
"grad_norm": 0.24104568553579794,
|
|
"learning_rate": 2.876215302240383e-06,
|
|
"loss": 0.6625,
|
|
"mean_token_accuracy": 0.8189416706562043,
|
|
"num_tokens": 647278647.0,
|
|
"step": 6470
|
|
},
|
|
{
|
|
"entropy": 0.991796875,
|
|
"epoch": 0.8856088560885609,
|
|
"grad_norm": 0.28985363815452414,
|
|
"learning_rate": 2.872692687050867e-06,
|
|
"loss": 0.7334,
|
|
"mean_token_accuracy": 0.8035204827785491,
|
|
"num_tokens": 648304920.0,
|
|
"step": 6480
|
|
},
|
|
{
|
|
"entropy": 0.965625,
|
|
"epoch": 0.8869755364220309,
|
|
"grad_norm": 0.2555521788664949,
|
|
"learning_rate": 2.8691700718613503e-06,
|
|
"loss": 0.6866,
|
|
"mean_token_accuracy": 0.811462152004242,
|
|
"num_tokens": 649296959.0,
|
|
"step": 6490
|
|
},
|
|
{
|
|
"entropy": 0.955859375,
|
|
"epoch": 0.8883422167555008,
|
|
"grad_norm": 0.27392118550253775,
|
|
"learning_rate": 2.8656474566718334e-06,
|
|
"loss": 0.6897,
|
|
"mean_token_accuracy": 0.8093926072120666,
|
|
"num_tokens": 650329433.0,
|
|
"step": 6500
|
|
},
|
|
{
|
|
"entropy": 0.93828125,
|
|
"epoch": 0.8897088970889709,
|
|
"grad_norm": 0.24201252565813602,
|
|
"learning_rate": 2.8621248414823165e-06,
|
|
"loss": 0.6717,
|
|
"mean_token_accuracy": 0.815881758928299,
|
|
"num_tokens": 651325368.0,
|
|
"step": 6510
|
|
},
|
|
{
|
|
"entropy": 0.9796875,
|
|
"epoch": 0.8910755774224409,
|
|
"grad_norm": 0.29237300485157913,
|
|
"learning_rate": 2.8586022262927997e-06,
|
|
"loss": 0.7047,
|
|
"mean_token_accuracy": 0.8075604021549225,
|
|
"num_tokens": 652253282.0,
|
|
"step": 6520
|
|
},
|
|
{
|
|
"entropy": 1.0125,
|
|
"epoch": 0.8924422577559109,
|
|
"grad_norm": 0.2473099473050353,
|
|
"learning_rate": 2.8550796111032836e-06,
|
|
"loss": 0.7403,
|
|
"mean_token_accuracy": 0.7995753765106202,
|
|
"num_tokens": 653261800.0,
|
|
"step": 6530
|
|
},
|
|
{
|
|
"entropy": 0.9609375,
|
|
"epoch": 0.8938089380893809,
|
|
"grad_norm": 0.26573313419590033,
|
|
"learning_rate": 2.8515569959137668e-06,
|
|
"loss": 0.709,
|
|
"mean_token_accuracy": 0.8089358270168304,
|
|
"num_tokens": 654258824.0,
|
|
"step": 6540
|
|
},
|
|
{
|
|
"entropy": 0.95625,
|
|
"epoch": 0.8951756184228509,
|
|
"grad_norm": 0.24561260064373644,
|
|
"learning_rate": 2.84803438072425e-06,
|
|
"loss": 0.6908,
|
|
"mean_token_accuracy": 0.8117465138435364,
|
|
"num_tokens": 655251617.0,
|
|
"step": 6550
|
|
},
|
|
{
|
|
"entropy": 0.959375,
|
|
"epoch": 0.8965422987563209,
|
|
"grad_norm": 0.2621715657335401,
|
|
"learning_rate": 2.844511765534733e-06,
|
|
"loss": 0.6943,
|
|
"mean_token_accuracy": 0.8117259085178375,
|
|
"num_tokens": 656244842.0,
|
|
"step": 6560
|
|
},
|
|
{
|
|
"entropy": 0.920703125,
|
|
"epoch": 0.897908979089791,
|
|
"grad_norm": 0.24256240886044436,
|
|
"learning_rate": 2.8409891503452166e-06,
|
|
"loss": 0.6851,
|
|
"mean_token_accuracy": 0.8132737874984741,
|
|
"num_tokens": 657263161.0,
|
|
"step": 6570
|
|
},
|
|
{
|
|
"entropy": 0.95859375,
|
|
"epoch": 0.8992756594232609,
|
|
"grad_norm": 0.25564969741775145,
|
|
"learning_rate": 2.8374665351556997e-06,
|
|
"loss": 0.711,
|
|
"mean_token_accuracy": 0.8078365325927734,
|
|
"num_tokens": 658229030.0,
|
|
"step": 6580
|
|
},
|
|
{
|
|
"entropy": 0.982421875,
|
|
"epoch": 0.9006423397567309,
|
|
"grad_norm": 0.2609049920418136,
|
|
"learning_rate": 2.8339439199661832e-06,
|
|
"loss": 0.7199,
|
|
"mean_token_accuracy": 0.8074346423149109,
|
|
"num_tokens": 659270232.0,
|
|
"step": 6590
|
|
},
|
|
{
|
|
"entropy": 0.98046875,
|
|
"epoch": 0.9020090200902009,
|
|
"grad_norm": 0.27026411556619756,
|
|
"learning_rate": 2.8304213047766663e-06,
|
|
"loss": 0.7306,
|
|
"mean_token_accuracy": 0.8022331058979034,
|
|
"num_tokens": 660230684.0,
|
|
"step": 6600
|
|
},
|
|
{
|
|
"entropy": 0.9453125,
|
|
"epoch": 0.9033757004236709,
|
|
"grad_norm": 0.2722208906707314,
|
|
"learning_rate": 2.82689868958715e-06,
|
|
"loss": 0.6962,
|
|
"mean_token_accuracy": 0.8119635224342346,
|
|
"num_tokens": 661227468.0,
|
|
"step": 6610
|
|
},
|
|
{
|
|
"entropy": 0.944140625,
|
|
"epoch": 0.9047423807571409,
|
|
"grad_norm": 0.27505717197755997,
|
|
"learning_rate": 2.823376074397633e-06,
|
|
"loss": 0.7267,
|
|
"mean_token_accuracy": 0.8037883400917053,
|
|
"num_tokens": 662247616.0,
|
|
"step": 6620
|
|
},
|
|
{
|
|
"entropy": 0.963671875,
|
|
"epoch": 0.906109061090611,
|
|
"grad_norm": 0.2755426991091686,
|
|
"learning_rate": 2.819853459208116e-06,
|
|
"loss": 0.7055,
|
|
"mean_token_accuracy": 0.8084709644317627,
|
|
"num_tokens": 663208530.0,
|
|
"step": 6630
|
|
},
|
|
{
|
|
"entropy": 1.00625,
|
|
"epoch": 0.9074757414240809,
|
|
"grad_norm": 0.25912019831404387,
|
|
"learning_rate": 2.8163308440186e-06,
|
|
"loss": 0.7415,
|
|
"mean_token_accuracy": 0.8019674718379974,
|
|
"num_tokens": 664207117.0,
|
|
"step": 6640
|
|
},
|
|
{
|
|
"entropy": 0.974609375,
|
|
"epoch": 0.9088424217575509,
|
|
"grad_norm": 0.2698607127545681,
|
|
"learning_rate": 2.8128082288290832e-06,
|
|
"loss": 0.684,
|
|
"mean_token_accuracy": 0.8134922087192535,
|
|
"num_tokens": 665189465.0,
|
|
"step": 6650
|
|
},
|
|
{
|
|
"entropy": 0.986328125,
|
|
"epoch": 0.9102091020910209,
|
|
"grad_norm": 0.28396860137882474,
|
|
"learning_rate": 2.8092856136395664e-06,
|
|
"loss": 0.7111,
|
|
"mean_token_accuracy": 0.8063747346401214,
|
|
"num_tokens": 666199452.0,
|
|
"step": 6660
|
|
},
|
|
{
|
|
"entropy": 0.983203125,
|
|
"epoch": 0.9115757824244909,
|
|
"grad_norm": 0.2740243570975559,
|
|
"learning_rate": 2.8057629984500495e-06,
|
|
"loss": 0.7194,
|
|
"mean_token_accuracy": 0.8049554526805878,
|
|
"num_tokens": 667240091.0,
|
|
"step": 6670
|
|
},
|
|
{
|
|
"entropy": 0.964453125,
|
|
"epoch": 0.9129424627579609,
|
|
"grad_norm": 0.24550615987147875,
|
|
"learning_rate": 2.8022403832605326e-06,
|
|
"loss": 0.7037,
|
|
"mean_token_accuracy": 0.8093572199344635,
|
|
"num_tokens": 668253541.0,
|
|
"step": 6680
|
|
},
|
|
{
|
|
"entropy": 0.9796875,
|
|
"epoch": 0.914309143091431,
|
|
"grad_norm": 0.2537939869216186,
|
|
"learning_rate": 2.7987177680710157e-06,
|
|
"loss": 0.6832,
|
|
"mean_token_accuracy": 0.8141079485416413,
|
|
"num_tokens": 669273366.0,
|
|
"step": 6690
|
|
},
|
|
{
|
|
"entropy": 0.971875,
|
|
"epoch": 0.915675823424901,
|
|
"grad_norm": 0.3478307343119958,
|
|
"learning_rate": 2.7951951528814997e-06,
|
|
"loss": 0.7165,
|
|
"mean_token_accuracy": 0.8043645441532135,
|
|
"num_tokens": 670296894.0,
|
|
"step": 6700
|
|
},
|
|
{
|
|
"entropy": 0.980859375,
|
|
"epoch": 0.9170425037583709,
|
|
"grad_norm": 0.2456962740237069,
|
|
"learning_rate": 2.791672537691983e-06,
|
|
"loss": 0.7204,
|
|
"mean_token_accuracy": 0.8032601416110993,
|
|
"num_tokens": 671344584.0,
|
|
"step": 6710
|
|
},
|
|
{
|
|
"entropy": 0.966796875,
|
|
"epoch": 0.9184091840918409,
|
|
"grad_norm": 0.2738264999958273,
|
|
"learning_rate": 2.788149922502466e-06,
|
|
"loss": 0.7162,
|
|
"mean_token_accuracy": 0.8069249629974365,
|
|
"num_tokens": 672327599.0,
|
|
"step": 6720
|
|
},
|
|
{
|
|
"entropy": 0.96171875,
|
|
"epoch": 0.9197758644253109,
|
|
"grad_norm": 0.3113628001272939,
|
|
"learning_rate": 2.784627307312949e-06,
|
|
"loss": 0.7022,
|
|
"mean_token_accuracy": 0.8108496248722077,
|
|
"num_tokens": 673345908.0,
|
|
"step": 6730
|
|
},
|
|
{
|
|
"entropy": 0.94296875,
|
|
"epoch": 0.9211425447587809,
|
|
"grad_norm": 0.24217534787188447,
|
|
"learning_rate": 2.7811046921234326e-06,
|
|
"loss": 0.6641,
|
|
"mean_token_accuracy": 0.8168315768241883,
|
|
"num_tokens": 674352632.0,
|
|
"step": 6740
|
|
},
|
|
{
|
|
"entropy": 1.00078125,
|
|
"epoch": 0.922509225092251,
|
|
"grad_norm": 0.2704603911502709,
|
|
"learning_rate": 2.777582076933916e-06,
|
|
"loss": 0.7266,
|
|
"mean_token_accuracy": 0.8056230008602142,
|
|
"num_tokens": 675334845.0,
|
|
"step": 6750
|
|
},
|
|
{
|
|
"entropy": 0.9625,
|
|
"epoch": 0.923875905425721,
|
|
"grad_norm": 0.2326368864625637,
|
|
"learning_rate": 2.7740594617443993e-06,
|
|
"loss": 0.6894,
|
|
"mean_token_accuracy": 0.8110181391239166,
|
|
"num_tokens": 676355454.0,
|
|
"step": 6760
|
|
},
|
|
{
|
|
"entropy": 0.976171875,
|
|
"epoch": 0.9252425857591909,
|
|
"grad_norm": 0.2727544275090245,
|
|
"learning_rate": 2.770536846554883e-06,
|
|
"loss": 0.6832,
|
|
"mean_token_accuracy": 0.8144068777561188,
|
|
"num_tokens": 677398895.0,
|
|
"step": 6770
|
|
},
|
|
{
|
|
"entropy": 0.996875,
|
|
"epoch": 0.9266092660926609,
|
|
"grad_norm": 0.2552896061623533,
|
|
"learning_rate": 2.767014231365366e-06,
|
|
"loss": 0.729,
|
|
"mean_token_accuracy": 0.8053665876388549,
|
|
"num_tokens": 678386628.0,
|
|
"step": 6780
|
|
},
|
|
{
|
|
"entropy": 0.983984375,
|
|
"epoch": 0.9279759464261309,
|
|
"grad_norm": 0.2447203562165125,
|
|
"learning_rate": 2.763491616175849e-06,
|
|
"loss": 0.7451,
|
|
"mean_token_accuracy": 0.8006509244441986,
|
|
"num_tokens": 679438210.0,
|
|
"step": 6790
|
|
},
|
|
{
|
|
"entropy": 0.96328125,
|
|
"epoch": 0.9293426267596009,
|
|
"grad_norm": 0.27394158437014315,
|
|
"learning_rate": 2.759969000986332e-06,
|
|
"loss": 0.7173,
|
|
"mean_token_accuracy": 0.8047957241535186,
|
|
"num_tokens": 680454998.0,
|
|
"step": 6800
|
|
},
|
|
{
|
|
"entropy": 0.926953125,
|
|
"epoch": 0.930709307093071,
|
|
"grad_norm": 0.24861332088239096,
|
|
"learning_rate": 2.756446385796816e-06,
|
|
"loss": 0.6813,
|
|
"mean_token_accuracy": 0.8129369080066681,
|
|
"num_tokens": 681444975.0,
|
|
"step": 6810
|
|
},
|
|
{
|
|
"entropy": 0.9609375,
|
|
"epoch": 0.932075987426541,
|
|
"grad_norm": 0.2526095184769312,
|
|
"learning_rate": 2.7529237706072993e-06,
|
|
"loss": 0.6694,
|
|
"mean_token_accuracy": 0.815579479932785,
|
|
"num_tokens": 682457981.0,
|
|
"step": 6820
|
|
},
|
|
{
|
|
"entropy": 0.956640625,
|
|
"epoch": 0.933442667760011,
|
|
"grad_norm": 0.23259446484717236,
|
|
"learning_rate": 2.7494011554177824e-06,
|
|
"loss": 0.7161,
|
|
"mean_token_accuracy": 0.8065908968448638,
|
|
"num_tokens": 683453311.0,
|
|
"step": 6830
|
|
},
|
|
{
|
|
"entropy": 1.0140625,
|
|
"epoch": 0.9348093480934809,
|
|
"grad_norm": 0.27583275067616897,
|
|
"learning_rate": 2.7458785402282656e-06,
|
|
"loss": 0.7276,
|
|
"mean_token_accuracy": 0.8030490875244141,
|
|
"num_tokens": 684437155.0,
|
|
"step": 6840
|
|
},
|
|
{
|
|
"entropy": 1.00859375,
|
|
"epoch": 0.9361760284269509,
|
|
"grad_norm": 0.2591796182836712,
|
|
"learning_rate": 2.7423559250387487e-06,
|
|
"loss": 0.7301,
|
|
"mean_token_accuracy": 0.8048807680606842,
|
|
"num_tokens": 685428193.0,
|
|
"step": 6850
|
|
},
|
|
{
|
|
"entropy": 0.975,
|
|
"epoch": 0.9375427087604209,
|
|
"grad_norm": 0.25772795284802313,
|
|
"learning_rate": 2.7388333098492326e-06,
|
|
"loss": 0.7063,
|
|
"mean_token_accuracy": 0.8089813590049744,
|
|
"num_tokens": 686363719.0,
|
|
"step": 6860
|
|
},
|
|
{
|
|
"entropy": 0.97578125,
|
|
"epoch": 0.938909389093891,
|
|
"grad_norm": 0.24978959908793263,
|
|
"learning_rate": 2.7353106946597158e-06,
|
|
"loss": 0.7231,
|
|
"mean_token_accuracy": 0.8048935830593109,
|
|
"num_tokens": 687423240.0,
|
|
"step": 6870
|
|
},
|
|
{
|
|
"entropy": 0.990625,
|
|
"epoch": 0.940276069427361,
|
|
"grad_norm": 0.29065929262009765,
|
|
"learning_rate": 2.731788079470199e-06,
|
|
"loss": 0.7171,
|
|
"mean_token_accuracy": 0.8056841135025025,
|
|
"num_tokens": 688380864.0,
|
|
"step": 6880
|
|
},
|
|
{
|
|
"entropy": 0.9890625,
|
|
"epoch": 0.941642749760831,
|
|
"grad_norm": 0.2655145730509662,
|
|
"learning_rate": 2.728265464280682e-06,
|
|
"loss": 0.7314,
|
|
"mean_token_accuracy": 0.8042927086353302,
|
|
"num_tokens": 689366091.0,
|
|
"step": 6890
|
|
},
|
|
{
|
|
"entropy": 0.980078125,
|
|
"epoch": 0.9430094300943009,
|
|
"grad_norm": 0.24117047927873766,
|
|
"learning_rate": 2.7247428490911656e-06,
|
|
"loss": 0.694,
|
|
"mean_token_accuracy": 0.8122167944908142,
|
|
"num_tokens": 690330964.0,
|
|
"step": 6900
|
|
},
|
|
{
|
|
"entropy": 0.984765625,
|
|
"epoch": 0.9443761104277709,
|
|
"grad_norm": 0.28611905501240353,
|
|
"learning_rate": 2.7212202339016487e-06,
|
|
"loss": 0.7249,
|
|
"mean_token_accuracy": 0.8049992203712464,
|
|
"num_tokens": 691337981.0,
|
|
"step": 6910
|
|
},
|
|
{
|
|
"entropy": 0.951171875,
|
|
"epoch": 0.9457427907612409,
|
|
"grad_norm": 0.2410930843635194,
|
|
"learning_rate": 2.7176976187121322e-06,
|
|
"loss": 0.7184,
|
|
"mean_token_accuracy": 0.8052477478981018,
|
|
"num_tokens": 692402156.0,
|
|
"step": 6920
|
|
},
|
|
{
|
|
"entropy": 0.983984375,
|
|
"epoch": 0.947109471094711,
|
|
"grad_norm": 0.2619986814735702,
|
|
"learning_rate": 2.7141750035226154e-06,
|
|
"loss": 0.7136,
|
|
"mean_token_accuracy": 0.8062740087509155,
|
|
"num_tokens": 693447012.0,
|
|
"step": 6930
|
|
},
|
|
{
|
|
"entropy": 0.988671875,
|
|
"epoch": 0.948476151428181,
|
|
"grad_norm": 0.26501964290834357,
|
|
"learning_rate": 2.710652388333099e-06,
|
|
"loss": 0.7155,
|
|
"mean_token_accuracy": 0.8076785564422607,
|
|
"num_tokens": 694464422.0,
|
|
"step": 6940
|
|
},
|
|
{
|
|
"entropy": 0.97734375,
|
|
"epoch": 0.949842831761651,
|
|
"grad_norm": 0.26695019405546855,
|
|
"learning_rate": 2.707129773143582e-06,
|
|
"loss": 0.7607,
|
|
"mean_token_accuracy": 0.795050859451294,
|
|
"num_tokens": 695496716.0,
|
|
"step": 6950
|
|
},
|
|
{
|
|
"entropy": 0.94375,
|
|
"epoch": 0.951209512095121,
|
|
"grad_norm": 0.26559329339436744,
|
|
"learning_rate": 2.703607157954065e-06,
|
|
"loss": 0.7018,
|
|
"mean_token_accuracy": 0.8083646297454834,
|
|
"num_tokens": 696522504.0,
|
|
"step": 6960
|
|
},
|
|
{
|
|
"entropy": 1.01484375,
|
|
"epoch": 0.9525761924285909,
|
|
"grad_norm": 0.2721559173997657,
|
|
"learning_rate": 2.7000845427645483e-06,
|
|
"loss": 0.7496,
|
|
"mean_token_accuracy": 0.7984791100025177,
|
|
"num_tokens": 697477258.0,
|
|
"step": 6970
|
|
},
|
|
{
|
|
"entropy": 0.946484375,
|
|
"epoch": 0.9539428727620609,
|
|
"grad_norm": 0.27141250916771087,
|
|
"learning_rate": 2.6965619275750322e-06,
|
|
"loss": 0.6885,
|
|
"mean_token_accuracy": 0.8117671072483063,
|
|
"num_tokens": 698459724.0,
|
|
"step": 6980
|
|
},
|
|
{
|
|
"entropy": 0.998046875,
|
|
"epoch": 0.955309553095531,
|
|
"grad_norm": 0.3010960265670291,
|
|
"learning_rate": 2.6930393123855154e-06,
|
|
"loss": 0.7419,
|
|
"mean_token_accuracy": 0.8024699211120605,
|
|
"num_tokens": 699484062.0,
|
|
"step": 6990
|
|
},
|
|
{
|
|
"entropy": 1.01484375,
|
|
"epoch": 0.956676233429001,
|
|
"grad_norm": 0.28040310474094243,
|
|
"learning_rate": 2.6895166971959985e-06,
|
|
"loss": 0.7441,
|
|
"mean_token_accuracy": 0.8003830075263977,
|
|
"num_tokens": 700454967.0,
|
|
"step": 7000
|
|
},
|
|
{
|
|
"entropy": 0.9421875,
|
|
"epoch": 0.958042913762471,
|
|
"grad_norm": 0.247303795947868,
|
|
"learning_rate": 2.6859940820064816e-06,
|
|
"loss": 0.6883,
|
|
"mean_token_accuracy": 0.8132419645786285,
|
|
"num_tokens": 701442196.0,
|
|
"step": 7010
|
|
},
|
|
{
|
|
"entropy": 1.005859375,
|
|
"epoch": 0.959409594095941,
|
|
"grad_norm": 0.2946835830396952,
|
|
"learning_rate": 2.6824714668169647e-06,
|
|
"loss": 0.722,
|
|
"mean_token_accuracy": 0.8055275678634644,
|
|
"num_tokens": 702419631.0,
|
|
"step": 7020
|
|
},
|
|
{
|
|
"entropy": 0.97265625,
|
|
"epoch": 0.9607762744294109,
|
|
"grad_norm": 0.29257398865394957,
|
|
"learning_rate": 2.6789488516274487e-06,
|
|
"loss": 0.7407,
|
|
"mean_token_accuracy": 0.8017286241054535,
|
|
"num_tokens": 703488927.0,
|
|
"step": 7030
|
|
},
|
|
{
|
|
"entropy": 0.985546875,
|
|
"epoch": 0.9621429547628809,
|
|
"grad_norm": 0.29740835644239555,
|
|
"learning_rate": 2.675426236437932e-06,
|
|
"loss": 0.6788,
|
|
"mean_token_accuracy": 0.8148180544376373,
|
|
"num_tokens": 704531284.0,
|
|
"step": 7040
|
|
},
|
|
{
|
|
"entropy": 0.944140625,
|
|
"epoch": 0.963509635096351,
|
|
"grad_norm": 0.25327571528439446,
|
|
"learning_rate": 2.671903621248415e-06,
|
|
"loss": 0.71,
|
|
"mean_token_accuracy": 0.8059134304523468,
|
|
"num_tokens": 705501913.0,
|
|
"step": 7050
|
|
},
|
|
{
|
|
"entropy": 0.95859375,
|
|
"epoch": 0.964876315429821,
|
|
"grad_norm": 0.28714474772553517,
|
|
"learning_rate": 2.668381006058898e-06,
|
|
"loss": 0.719,
|
|
"mean_token_accuracy": 0.8044980466365814,
|
|
"num_tokens": 706485055.0,
|
|
"step": 7060
|
|
},
|
|
{
|
|
"entropy": 0.988671875,
|
|
"epoch": 0.966242995763291,
|
|
"grad_norm": 0.2573150815375974,
|
|
"learning_rate": 2.6648583908693816e-06,
|
|
"loss": 0.6953,
|
|
"mean_token_accuracy": 0.8111899733543396,
|
|
"num_tokens": 707478154.0,
|
|
"step": 7070
|
|
},
|
|
{
|
|
"entropy": 1.007421875,
|
|
"epoch": 0.967609676096761,
|
|
"grad_norm": 0.28934237088776543,
|
|
"learning_rate": 2.6613357756798648e-06,
|
|
"loss": 0.7691,
|
|
"mean_token_accuracy": 0.7952187359333038,
|
|
"num_tokens": 708467999.0,
|
|
"step": 7080
|
|
},
|
|
{
|
|
"entropy": 0.969140625,
|
|
"epoch": 0.968976356430231,
|
|
"grad_norm": 0.25285584224039054,
|
|
"learning_rate": 2.6578131604903483e-06,
|
|
"loss": 0.7154,
|
|
"mean_token_accuracy": 0.8053597271442413,
|
|
"num_tokens": 709429624.0,
|
|
"step": 7090
|
|
},
|
|
{
|
|
"entropy": 0.965234375,
|
|
"epoch": 0.9703430367637009,
|
|
"grad_norm": 0.2674408342462516,
|
|
"learning_rate": 2.6542905453008314e-06,
|
|
"loss": 0.6784,
|
|
"mean_token_accuracy": 0.8151931822299957,
|
|
"num_tokens": 710434764.0,
|
|
"step": 7100
|
|
},
|
|
{
|
|
"entropy": 0.97890625,
|
|
"epoch": 0.971709717097171,
|
|
"grad_norm": 0.2576502092149439,
|
|
"learning_rate": 2.650767930111315e-06,
|
|
"loss": 0.7258,
|
|
"mean_token_accuracy": 0.8053194999694824,
|
|
"num_tokens": 711448154.0,
|
|
"step": 7110
|
|
},
|
|
{
|
|
"entropy": 0.98359375,
|
|
"epoch": 0.973076397430641,
|
|
"grad_norm": 0.24524665048821767,
|
|
"learning_rate": 2.647245314921798e-06,
|
|
"loss": 0.6976,
|
|
"mean_token_accuracy": 0.8098222732543945,
|
|
"num_tokens": 712485461.0,
|
|
"step": 7120
|
|
},
|
|
{
|
|
"entropy": 0.9625,
|
|
"epoch": 0.974443077764111,
|
|
"grad_norm": 0.23755750405232665,
|
|
"learning_rate": 2.6437226997322812e-06,
|
|
"loss": 0.6981,
|
|
"mean_token_accuracy": 0.8110089361667633,
|
|
"num_tokens": 713537375.0,
|
|
"step": 7130
|
|
},
|
|
{
|
|
"entropy": 0.948828125,
|
|
"epoch": 0.975809758097581,
|
|
"grad_norm": 0.2524075351612562,
|
|
"learning_rate": 2.640200084542765e-06,
|
|
"loss": 0.6801,
|
|
"mean_token_accuracy": 0.8123402535915375,
|
|
"num_tokens": 714549530.0,
|
|
"step": 7140
|
|
},
|
|
{
|
|
"entropy": 0.974609375,
|
|
"epoch": 0.977176438431051,
|
|
"grad_norm": 0.2935673513737918,
|
|
"learning_rate": 2.6366774693532483e-06,
|
|
"loss": 0.719,
|
|
"mean_token_accuracy": 0.8058225095272065,
|
|
"num_tokens": 715478350.0,
|
|
"step": 7150
|
|
},
|
|
{
|
|
"entropy": 0.997265625,
|
|
"epoch": 0.9785431187645209,
|
|
"grad_norm": 0.27668600267001503,
|
|
"learning_rate": 2.6331548541637314e-06,
|
|
"loss": 0.7274,
|
|
"mean_token_accuracy": 0.8039326369762421,
|
|
"num_tokens": 716476986.0,
|
|
"step": 7160
|
|
},
|
|
{
|
|
"entropy": 0.95,
|
|
"epoch": 0.979909799097991,
|
|
"grad_norm": 0.22880358433415923,
|
|
"learning_rate": 2.6296322389742146e-06,
|
|
"loss": 0.6849,
|
|
"mean_token_accuracy": 0.8134180188179017,
|
|
"num_tokens": 717495137.0,
|
|
"step": 7170
|
|
},
|
|
{
|
|
"entropy": 0.93046875,
|
|
"epoch": 0.981276479431461,
|
|
"grad_norm": 0.2574381986451421,
|
|
"learning_rate": 2.6261096237846977e-06,
|
|
"loss": 0.6874,
|
|
"mean_token_accuracy": 0.8121880650520324,
|
|
"num_tokens": 718485758.0,
|
|
"step": 7180
|
|
},
|
|
{
|
|
"entropy": 0.969140625,
|
|
"epoch": 0.982643159764931,
|
|
"grad_norm": 0.27244456326839334,
|
|
"learning_rate": 2.622587008595181e-06,
|
|
"loss": 0.7144,
|
|
"mean_token_accuracy": 0.8073118150234222,
|
|
"num_tokens": 719460644.0,
|
|
"step": 7190
|
|
},
|
|
{
|
|
"entropy": 0.98671875,
|
|
"epoch": 0.984009840098401,
|
|
"grad_norm": 0.2842599560329819,
|
|
"learning_rate": 2.6190643934056648e-06,
|
|
"loss": 0.7213,
|
|
"mean_token_accuracy": 0.8038611829280853,
|
|
"num_tokens": 720475792.0,
|
|
"step": 7200
|
|
},
|
|
{
|
|
"entropy": 1.01640625,
|
|
"epoch": 0.985376520431871,
|
|
"grad_norm": 0.2558693549532008,
|
|
"learning_rate": 2.615541778216148e-06,
|
|
"loss": 0.7526,
|
|
"mean_token_accuracy": 0.8003702104091645,
|
|
"num_tokens": 721453125.0,
|
|
"step": 7210
|
|
},
|
|
{
|
|
"entropy": 0.96171875,
|
|
"epoch": 0.9867432007653409,
|
|
"grad_norm": 0.27266694624504073,
|
|
"learning_rate": 2.612019163026631e-06,
|
|
"loss": 0.6936,
|
|
"mean_token_accuracy": 0.8098690986633301,
|
|
"num_tokens": 722432480.0,
|
|
"step": 7220
|
|
},
|
|
{
|
|
"entropy": 1.02421875,
|
|
"epoch": 0.988109881098811,
|
|
"grad_norm": 0.27747775363597643,
|
|
"learning_rate": 2.6084965478371146e-06,
|
|
"loss": 0.7458,
|
|
"mean_token_accuracy": 0.7995439410209656,
|
|
"num_tokens": 723432525.0,
|
|
"step": 7230
|
|
},
|
|
{
|
|
"entropy": 0.9484375,
|
|
"epoch": 0.989476561432281,
|
|
"grad_norm": 0.2408118753760325,
|
|
"learning_rate": 2.6049739326475977e-06,
|
|
"loss": 0.687,
|
|
"mean_token_accuracy": 0.8138454914093017,
|
|
"num_tokens": 724435158.0,
|
|
"step": 7240
|
|
},
|
|
{
|
|
"entropy": 1.00546875,
|
|
"epoch": 0.990843241765751,
|
|
"grad_norm": 0.32136389035451024,
|
|
"learning_rate": 2.6014513174580812e-06,
|
|
"loss": 0.7005,
|
|
"mean_token_accuracy": 0.8094912230968475,
|
|
"num_tokens": 725410072.0,
|
|
"step": 7250
|
|
},
|
|
{
|
|
"entropy": 0.962109375,
|
|
"epoch": 0.992209922099221,
|
|
"grad_norm": 0.26893917976639364,
|
|
"learning_rate": 2.5979287022685644e-06,
|
|
"loss": 0.7025,
|
|
"mean_token_accuracy": 0.8096980094909668,
|
|
"num_tokens": 726377155.0,
|
|
"step": 7260
|
|
},
|
|
{
|
|
"entropy": 0.948046875,
|
|
"epoch": 0.993576602432691,
|
|
"grad_norm": 0.25952357867394454,
|
|
"learning_rate": 2.594406087079048e-06,
|
|
"loss": 0.6746,
|
|
"mean_token_accuracy": 0.814990657567978,
|
|
"num_tokens": 727361527.0,
|
|
"step": 7270
|
|
},
|
|
{
|
|
"entropy": 0.991796875,
|
|
"epoch": 0.994943282766161,
|
|
"grad_norm": 0.25734403083907975,
|
|
"learning_rate": 2.590883471889531e-06,
|
|
"loss": 0.7604,
|
|
"mean_token_accuracy": 0.7969644844532013,
|
|
"num_tokens": 728344461.0,
|
|
"step": 7280
|
|
},
|
|
{
|
|
"entropy": 0.9578125,
|
|
"epoch": 0.996309963099631,
|
|
"grad_norm": 0.25922147618229574,
|
|
"learning_rate": 2.587360856700014e-06,
|
|
"loss": 0.6973,
|
|
"mean_token_accuracy": 0.8110231041908265,
|
|
"num_tokens": 729330460.0,
|
|
"step": 7290
|
|
},
|
|
{
|
|
"entropy": 0.948046875,
|
|
"epoch": 0.997676643433101,
|
|
"grad_norm": 0.2549214632770167,
|
|
"learning_rate": 2.5838382415104973e-06,
|
|
"loss": 0.7057,
|
|
"mean_token_accuracy": 0.8089974462985993,
|
|
"num_tokens": 730339383.0,
|
|
"step": 7300
|
|
},
|
|
{
|
|
"entropy": 0.994921875,
|
|
"epoch": 0.999043323766571,
|
|
"grad_norm": 0.25529712424056455,
|
|
"learning_rate": 2.5803156263209813e-06,
|
|
"loss": 0.7212,
|
|
"mean_token_accuracy": 0.805428969860077,
|
|
"num_tokens": 731309956.0,
|
|
"step": 7310
|
|
},
|
|
{
|
|
"entropy": 1.001171875,
|
|
"epoch": 1.000410004100041,
|
|
"grad_norm": 0.2735314015395369,
|
|
"learning_rate": 2.5767930111314644e-06,
|
|
"loss": 0.7587,
|
|
"mean_token_accuracy": 0.7976750552654266,
|
|
"num_tokens": 732351410.0,
|
|
"step": 7320
|
|
},
|
|
{
|
|
"entropy": 0.968359375,
|
|
"epoch": 1.001776684433511,
|
|
"grad_norm": 0.24629971257095162,
|
|
"learning_rate": 2.5732703959419475e-06,
|
|
"loss": 0.7133,
|
|
"mean_token_accuracy": 0.8066723942756653,
|
|
"num_tokens": 733308446.0,
|
|
"step": 7330
|
|
},
|
|
{
|
|
"entropy": 0.9359375,
|
|
"epoch": 1.003143364766981,
|
|
"grad_norm": 0.21825167644582405,
|
|
"learning_rate": 2.5697477807524306e-06,
|
|
"loss": 0.6945,
|
|
"mean_token_accuracy": 0.8098106741905212,
|
|
"num_tokens": 734386467.0,
|
|
"step": 7340
|
|
},
|
|
{
|
|
"entropy": 0.92109375,
|
|
"epoch": 1.004510045100451,
|
|
"grad_norm": 0.2843164271258046,
|
|
"learning_rate": 2.5662251655629138e-06,
|
|
"loss": 0.6881,
|
|
"mean_token_accuracy": 0.811497938632965,
|
|
"num_tokens": 735387465.0,
|
|
"step": 7350
|
|
},
|
|
{
|
|
"entropy": 0.971484375,
|
|
"epoch": 1.005876725433921,
|
|
"grad_norm": 0.2916438784823099,
|
|
"learning_rate": 2.5627025503733977e-06,
|
|
"loss": 0.7167,
|
|
"mean_token_accuracy": 0.8050583004951477,
|
|
"num_tokens": 736402880.0,
|
|
"step": 7360
|
|
},
|
|
{
|
|
"entropy": 0.984765625,
|
|
"epoch": 1.007243405767391,
|
|
"grad_norm": 0.2574924906444121,
|
|
"learning_rate": 2.559179935183881e-06,
|
|
"loss": 0.7479,
|
|
"mean_token_accuracy": 0.8010091185569763,
|
|
"num_tokens": 737386726.0,
|
|
"step": 7370
|
|
},
|
|
{
|
|
"entropy": 0.980078125,
|
|
"epoch": 1.0086100861008611,
|
|
"grad_norm": 0.2777376583443756,
|
|
"learning_rate": 2.555657319994364e-06,
|
|
"loss": 0.709,
|
|
"mean_token_accuracy": 0.808789974451065,
|
|
"num_tokens": 738377522.0,
|
|
"step": 7380
|
|
},
|
|
{
|
|
"entropy": 0.95078125,
|
|
"epoch": 1.009976766434331,
|
|
"grad_norm": 0.2577253034772847,
|
|
"learning_rate": 2.552134704804847e-06,
|
|
"loss": 0.7048,
|
|
"mean_token_accuracy": 0.8080570161342621,
|
|
"num_tokens": 739422958.0,
|
|
"step": 7390
|
|
},
|
|
{
|
|
"entropy": 1.0015625,
|
|
"epoch": 1.011343446767801,
|
|
"grad_norm": 0.2713302696439916,
|
|
"learning_rate": 2.5486120896153306e-06,
|
|
"loss": 0.7349,
|
|
"mean_token_accuracy": 0.8014065623283386,
|
|
"num_tokens": 740403213.0,
|
|
"step": 7400
|
|
},
|
|
{
|
|
"entropy": 0.96796875,
|
|
"epoch": 1.012710127101271,
|
|
"grad_norm": 0.2806206612446452,
|
|
"learning_rate": 2.5450894744258138e-06,
|
|
"loss": 0.6883,
|
|
"mean_token_accuracy": 0.8140567898750305,
|
|
"num_tokens": 741400708.0,
|
|
"step": 7410
|
|
},
|
|
{
|
|
"entropy": 0.936328125,
|
|
"epoch": 1.014076807434741,
|
|
"grad_norm": 0.2672001195219989,
|
|
"learning_rate": 2.5415668592362973e-06,
|
|
"loss": 0.6727,
|
|
"mean_token_accuracy": 0.8168688118457794,
|
|
"num_tokens": 742355306.0,
|
|
"step": 7420
|
|
},
|
|
{
|
|
"entropy": 0.94296875,
|
|
"epoch": 1.015443487768211,
|
|
"grad_norm": 0.26873877556978976,
|
|
"learning_rate": 2.5380442440467804e-06,
|
|
"loss": 0.685,
|
|
"mean_token_accuracy": 0.814587289094925,
|
|
"num_tokens": 743374434.0,
|
|
"step": 7430
|
|
},
|
|
{
|
|
"entropy": 1.005859375,
|
|
"epoch": 1.016810168101681,
|
|
"grad_norm": 0.31682534108479926,
|
|
"learning_rate": 2.534521628857264e-06,
|
|
"loss": 0.7457,
|
|
"mean_token_accuracy": 0.7990015327930451,
|
|
"num_tokens": 744361052.0,
|
|
"step": 7440
|
|
},
|
|
{
|
|
"entropy": 0.962109375,
|
|
"epoch": 1.018176848435151,
|
|
"grad_norm": 0.2271527945983952,
|
|
"learning_rate": 2.530999013667747e-06,
|
|
"loss": 0.7127,
|
|
"mean_token_accuracy": 0.8070115923881531,
|
|
"num_tokens": 745341094.0,
|
|
"step": 7450
|
|
},
|
|
{
|
|
"entropy": 1.046484375,
|
|
"epoch": 1.019543528768621,
|
|
"grad_norm": 0.3086350432434946,
|
|
"learning_rate": 2.5274763984782302e-06,
|
|
"loss": 0.7646,
|
|
"mean_token_accuracy": 0.7979197978973389,
|
|
"num_tokens": 746336609.0,
|
|
"step": 7460
|
|
},
|
|
{
|
|
"entropy": 0.923828125,
|
|
"epoch": 1.020910209102091,
|
|
"grad_norm": 0.26114050635100794,
|
|
"learning_rate": 2.5239537832887138e-06,
|
|
"loss": 0.6797,
|
|
"mean_token_accuracy": 0.8156611979007721,
|
|
"num_tokens": 747379304.0,
|
|
"step": 7470
|
|
},
|
|
{
|
|
"entropy": 0.96875,
|
|
"epoch": 1.022276889435561,
|
|
"grad_norm": 0.27284687203001756,
|
|
"learning_rate": 2.5204311680991973e-06,
|
|
"loss": 0.6913,
|
|
"mean_token_accuracy": 0.8098744630813599,
|
|
"num_tokens": 748386663.0,
|
|
"step": 7480
|
|
},
|
|
{
|
|
"entropy": 0.92578125,
|
|
"epoch": 1.023643569769031,
|
|
"grad_norm": 0.23626779873086212,
|
|
"learning_rate": 2.5169085529096804e-06,
|
|
"loss": 0.6708,
|
|
"mean_token_accuracy": 0.8171893060207367,
|
|
"num_tokens": 749319875.0,
|
|
"step": 7490
|
|
},
|
|
{
|
|
"entropy": 0.975,
|
|
"epoch": 1.0250102501025011,
|
|
"grad_norm": 0.29987052196157116,
|
|
"learning_rate": 2.5133859377201636e-06,
|
|
"loss": 0.7184,
|
|
"mean_token_accuracy": 0.8046952366828919,
|
|
"num_tokens": 750306281.0,
|
|
"step": 7500
|
|
},
|
|
{
|
|
"entropy": 1.000390625,
|
|
"epoch": 1.0263769304359711,
|
|
"grad_norm": 0.2521721362259142,
|
|
"learning_rate": 2.5098633225306467e-06,
|
|
"loss": 0.7289,
|
|
"mean_token_accuracy": 0.802823007106781,
|
|
"num_tokens": 751317486.0,
|
|
"step": 7510
|
|
},
|
|
{
|
|
"entropy": 0.966796875,
|
|
"epoch": 1.027743610769441,
|
|
"grad_norm": 0.2616558810860527,
|
|
"learning_rate": 2.50634070734113e-06,
|
|
"loss": 0.6948,
|
|
"mean_token_accuracy": 0.8104283213615417,
|
|
"num_tokens": 752323434.0,
|
|
"step": 7520
|
|
},
|
|
{
|
|
"entropy": 0.95546875,
|
|
"epoch": 1.029110291102911,
|
|
"grad_norm": 0.2433298496563047,
|
|
"learning_rate": 2.502818092151614e-06,
|
|
"loss": 0.7123,
|
|
"mean_token_accuracy": 0.8078288674354553,
|
|
"num_tokens": 753298426.0,
|
|
"step": 7530
|
|
},
|
|
{
|
|
"entropy": 0.956640625,
|
|
"epoch": 1.030476971436381,
|
|
"grad_norm": 0.28429473356733026,
|
|
"learning_rate": 2.499295476962097e-06,
|
|
"loss": 0.7057,
|
|
"mean_token_accuracy": 0.8084239304065705,
|
|
"num_tokens": 754304365.0,
|
|
"step": 7540
|
|
},
|
|
{
|
|
"entropy": 0.96953125,
|
|
"epoch": 1.031843651769851,
|
|
"grad_norm": 0.24984061827614634,
|
|
"learning_rate": 2.49577286177258e-06,
|
|
"loss": 0.7216,
|
|
"mean_token_accuracy": 0.8055876731872559,
|
|
"num_tokens": 755337024.0,
|
|
"step": 7550
|
|
},
|
|
{
|
|
"entropy": 0.965625,
|
|
"epoch": 1.033210332103321,
|
|
"grad_norm": 0.26218294515793955,
|
|
"learning_rate": 2.492250246583063e-06,
|
|
"loss": 0.7346,
|
|
"mean_token_accuracy": 0.8032465219497681,
|
|
"num_tokens": 756321824.0,
|
|
"step": 7560
|
|
},
|
|
{
|
|
"entropy": 0.96015625,
|
|
"epoch": 1.034577012436791,
|
|
"grad_norm": 0.2645578086199289,
|
|
"learning_rate": 2.4887276313935467e-06,
|
|
"loss": 0.6797,
|
|
"mean_token_accuracy": 0.8132204830646514,
|
|
"num_tokens": 757309000.0,
|
|
"step": 7570
|
|
},
|
|
{
|
|
"entropy": 0.942578125,
|
|
"epoch": 1.035943692770261,
|
|
"grad_norm": 0.24754707150083077,
|
|
"learning_rate": 2.48520501620403e-06,
|
|
"loss": 0.6807,
|
|
"mean_token_accuracy": 0.8130726933479309,
|
|
"num_tokens": 758343356.0,
|
|
"step": 7580
|
|
},
|
|
{
|
|
"entropy": 0.926171875,
|
|
"epoch": 1.037310373103731,
|
|
"grad_norm": 0.2713832950005578,
|
|
"learning_rate": 2.4816824010145134e-06,
|
|
"loss": 0.6624,
|
|
"mean_token_accuracy": 0.8161397933959961,
|
|
"num_tokens": 759319244.0,
|
|
"step": 7590
|
|
},
|
|
{
|
|
"entropy": 0.965234375,
|
|
"epoch": 1.038677053437201,
|
|
"grad_norm": 0.3400434696445874,
|
|
"learning_rate": 2.478159785824997e-06,
|
|
"loss": 0.7195,
|
|
"mean_token_accuracy": 0.8065224289894104,
|
|
"num_tokens": 760380763.0,
|
|
"step": 7600
|
|
},
|
|
{
|
|
"entropy": 0.96875,
|
|
"epoch": 1.040043733770671,
|
|
"grad_norm": 0.2847817827349042,
|
|
"learning_rate": 2.47463717063548e-06,
|
|
"loss": 0.6839,
|
|
"mean_token_accuracy": 0.8136050343513489,
|
|
"num_tokens": 761390881.0,
|
|
"step": 7610
|
|
},
|
|
{
|
|
"entropy": 0.99296875,
|
|
"epoch": 1.0414104141041411,
|
|
"grad_norm": 0.26049988236535954,
|
|
"learning_rate": 2.4711145554459636e-06,
|
|
"loss": 0.7337,
|
|
"mean_token_accuracy": 0.8023512601852417,
|
|
"num_tokens": 762417830.0,
|
|
"step": 7620
|
|
},
|
|
{
|
|
"entropy": 0.983203125,
|
|
"epoch": 1.0427770944376111,
|
|
"grad_norm": 0.25245302746454656,
|
|
"learning_rate": 2.4675919402564467e-06,
|
|
"loss": 0.7117,
|
|
"mean_token_accuracy": 0.8063468873500824,
|
|
"num_tokens": 763421144.0,
|
|
"step": 7630
|
|
},
|
|
{
|
|
"entropy": 0.97421875,
|
|
"epoch": 1.0441437747710811,
|
|
"grad_norm": 0.24884655048890117,
|
|
"learning_rate": 2.46406932506693e-06,
|
|
"loss": 0.7041,
|
|
"mean_token_accuracy": 0.8093755841255188,
|
|
"num_tokens": 764456854.0,
|
|
"step": 7640
|
|
},
|
|
{
|
|
"entropy": 0.96875,
|
|
"epoch": 1.045510455104551,
|
|
"grad_norm": 0.2971646792470582,
|
|
"learning_rate": 2.4605467098774134e-06,
|
|
"loss": 0.7024,
|
|
"mean_token_accuracy": 0.8095142185688019,
|
|
"num_tokens": 765502181.0,
|
|
"step": 7650
|
|
},
|
|
{
|
|
"entropy": 0.94296875,
|
|
"epoch": 1.046877135438021,
|
|
"grad_norm": 0.2394416592507437,
|
|
"learning_rate": 2.4570240946878965e-06,
|
|
"loss": 0.7149,
|
|
"mean_token_accuracy": 0.8056001424789428,
|
|
"num_tokens": 766492469.0,
|
|
"step": 7660
|
|
},
|
|
{
|
|
"entropy": 0.969140625,
|
|
"epoch": 1.048243815771491,
|
|
"grad_norm": 0.24761611454018967,
|
|
"learning_rate": 2.4535014794983796e-06,
|
|
"loss": 0.7329,
|
|
"mean_token_accuracy": 0.8039977848529816,
|
|
"num_tokens": 767484098.0,
|
|
"step": 7670
|
|
},
|
|
{
|
|
"entropy": 0.948046875,
|
|
"epoch": 1.049610496104961,
|
|
"grad_norm": 0.2772738142203511,
|
|
"learning_rate": 2.449978864308863e-06,
|
|
"loss": 0.6742,
|
|
"mean_token_accuracy": 0.8161042094230652,
|
|
"num_tokens": 768449811.0,
|
|
"step": 7680
|
|
},
|
|
{
|
|
"entropy": 0.9578125,
|
|
"epoch": 1.050977176438431,
|
|
"grad_norm": 0.25422415762102235,
|
|
"learning_rate": 2.4464562491193463e-06,
|
|
"loss": 0.7093,
|
|
"mean_token_accuracy": 0.8067349672317505,
|
|
"num_tokens": 769423148.0,
|
|
"step": 7690
|
|
},
|
|
{
|
|
"entropy": 0.98828125,
|
|
"epoch": 1.052343856771901,
|
|
"grad_norm": 0.31201020295507936,
|
|
"learning_rate": 2.4429336339298294e-06,
|
|
"loss": 0.7258,
|
|
"mean_token_accuracy": 0.8055537045001984,
|
|
"num_tokens": 770446252.0,
|
|
"step": 7700
|
|
},
|
|
{
|
|
"entropy": 0.909765625,
|
|
"epoch": 1.053710537105371,
|
|
"grad_norm": 0.25876493320708843,
|
|
"learning_rate": 2.439411018740313e-06,
|
|
"loss": 0.6558,
|
|
"mean_token_accuracy": 0.8169002890586853,
|
|
"num_tokens": 771407315.0,
|
|
"step": 7710
|
|
},
|
|
{
|
|
"entropy": 0.937890625,
|
|
"epoch": 1.055077217438841,
|
|
"grad_norm": 0.22497283844162222,
|
|
"learning_rate": 2.435888403550796e-06,
|
|
"loss": 0.6514,
|
|
"mean_token_accuracy": 0.8185275375843049,
|
|
"num_tokens": 772382184.0,
|
|
"step": 7720
|
|
},
|
|
{
|
|
"entropy": 0.971875,
|
|
"epoch": 1.056443897772311,
|
|
"grad_norm": 0.27764877717548153,
|
|
"learning_rate": 2.4323657883612797e-06,
|
|
"loss": 0.7437,
|
|
"mean_token_accuracy": 0.8019507884979248,
|
|
"num_tokens": 773395262.0,
|
|
"step": 7730
|
|
},
|
|
{
|
|
"entropy": 0.9796875,
|
|
"epoch": 1.0578105781057812,
|
|
"grad_norm": 0.26313134363508395,
|
|
"learning_rate": 2.4288431731717628e-06,
|
|
"loss": 0.7115,
|
|
"mean_token_accuracy": 0.8069574534893036,
|
|
"num_tokens": 774360843.0,
|
|
"step": 7740
|
|
},
|
|
{
|
|
"entropy": 0.9578125,
|
|
"epoch": 1.0591772584392511,
|
|
"grad_norm": 0.29453125567827343,
|
|
"learning_rate": 2.4253205579822463e-06,
|
|
"loss": 0.7053,
|
|
"mean_token_accuracy": 0.8070709705352783,
|
|
"num_tokens": 775331478.0,
|
|
"step": 7750
|
|
},
|
|
{
|
|
"entropy": 0.951171875,
|
|
"epoch": 1.0605439387727211,
|
|
"grad_norm": 0.2538965309197439,
|
|
"learning_rate": 2.4217979427927294e-06,
|
|
"loss": 0.6838,
|
|
"mean_token_accuracy": 0.8138194918632508,
|
|
"num_tokens": 776295077.0,
|
|
"step": 7760
|
|
},
|
|
{
|
|
"entropy": 0.921484375,
|
|
"epoch": 1.0619106191061911,
|
|
"grad_norm": 0.24536554846915232,
|
|
"learning_rate": 2.418275327603213e-06,
|
|
"loss": 0.7033,
|
|
"mean_token_accuracy": 0.8100662291049957,
|
|
"num_tokens": 777280868.0,
|
|
"step": 7770
|
|
},
|
|
{
|
|
"entropy": 0.94609375,
|
|
"epoch": 1.063277299439661,
|
|
"grad_norm": 0.2879156069691556,
|
|
"learning_rate": 2.414752712413696e-06,
|
|
"loss": 0.6883,
|
|
"mean_token_accuracy": 0.8120909571647644,
|
|
"num_tokens": 778276696.0,
|
|
"step": 7780
|
|
},
|
|
{
|
|
"entropy": 0.933984375,
|
|
"epoch": 1.064643979773131,
|
|
"grad_norm": 0.25496413626752734,
|
|
"learning_rate": 2.4112300972241797e-06,
|
|
"loss": 0.6634,
|
|
"mean_token_accuracy": 0.8187041044235229,
|
|
"num_tokens": 779266431.0,
|
|
"step": 7790
|
|
},
|
|
{
|
|
"entropy": 0.96640625,
|
|
"epoch": 1.066010660106601,
|
|
"grad_norm": 0.2448120854395793,
|
|
"learning_rate": 2.4077074820346628e-06,
|
|
"loss": 0.721,
|
|
"mean_token_accuracy": 0.8040311813354493,
|
|
"num_tokens": 780277233.0,
|
|
"step": 7800
|
|
},
|
|
{
|
|
"entropy": 0.981640625,
|
|
"epoch": 1.067377340440071,
|
|
"grad_norm": 0.26895738684743714,
|
|
"learning_rate": 2.404184866845146e-06,
|
|
"loss": 0.7163,
|
|
"mean_token_accuracy": 0.8048898220062256,
|
|
"num_tokens": 781305479.0,
|
|
"step": 7810
|
|
},
|
|
{
|
|
"entropy": 0.978125,
|
|
"epoch": 1.068744020773541,
|
|
"grad_norm": 0.26564923882918984,
|
|
"learning_rate": 2.4006622516556295e-06,
|
|
"loss": 0.7202,
|
|
"mean_token_accuracy": 0.8054587602615356,
|
|
"num_tokens": 782310821.0,
|
|
"step": 7820
|
|
},
|
|
{
|
|
"entropy": 0.979296875,
|
|
"epoch": 1.070110701107011,
|
|
"grad_norm": 0.26755915550784876,
|
|
"learning_rate": 2.3971396364661126e-06,
|
|
"loss": 0.7191,
|
|
"mean_token_accuracy": 0.8056545555591583,
|
|
"num_tokens": 783300711.0,
|
|
"step": 7830
|
|
},
|
|
{
|
|
"entropy": 0.984765625,
|
|
"epoch": 1.071477381440481,
|
|
"grad_norm": 0.2642370156248031,
|
|
"learning_rate": 2.393617021276596e-06,
|
|
"loss": 0.7067,
|
|
"mean_token_accuracy": 0.8094327986240387,
|
|
"num_tokens": 784293361.0,
|
|
"step": 7840
|
|
},
|
|
{
|
|
"entropy": 0.97265625,
|
|
"epoch": 1.072844061773951,
|
|
"grad_norm": 0.24395358138231726,
|
|
"learning_rate": 2.3900944060870793e-06,
|
|
"loss": 0.702,
|
|
"mean_token_accuracy": 0.8101473212242126,
|
|
"num_tokens": 785257780.0,
|
|
"step": 7850
|
|
},
|
|
{
|
|
"entropy": 0.970703125,
|
|
"epoch": 1.0742107421074212,
|
|
"grad_norm": 0.25099363538765374,
|
|
"learning_rate": 2.3865717908975624e-06,
|
|
"loss": 0.6929,
|
|
"mean_token_accuracy": 0.8105691552162171,
|
|
"num_tokens": 786269697.0,
|
|
"step": 7860
|
|
},
|
|
{
|
|
"entropy": 0.98515625,
|
|
"epoch": 1.0755774224408912,
|
|
"grad_norm": 0.2914761315069393,
|
|
"learning_rate": 2.383049175708046e-06,
|
|
"loss": 0.7027,
|
|
"mean_token_accuracy": 0.8081891775131226,
|
|
"num_tokens": 787269436.0,
|
|
"step": 7870
|
|
},
|
|
{
|
|
"entropy": 0.940625,
|
|
"epoch": 1.0769441027743611,
|
|
"grad_norm": 0.29361599537400296,
|
|
"learning_rate": 2.379526560518529e-06,
|
|
"loss": 0.7095,
|
|
"mean_token_accuracy": 0.8081060886383057,
|
|
"num_tokens": 788255012.0,
|
|
"step": 7880
|
|
},
|
|
{
|
|
"entropy": 0.9984375,
|
|
"epoch": 1.0783107831078311,
|
|
"grad_norm": 0.2696786539316027,
|
|
"learning_rate": 2.376003945329012e-06,
|
|
"loss": 0.7428,
|
|
"mean_token_accuracy": 0.798009318113327,
|
|
"num_tokens": 789269288.0,
|
|
"step": 7890
|
|
},
|
|
{
|
|
"entropy": 0.9203125,
|
|
"epoch": 1.079677463441301,
|
|
"grad_norm": 0.2698420659479926,
|
|
"learning_rate": 2.3724813301394957e-06,
|
|
"loss": 0.6407,
|
|
"mean_token_accuracy": 0.822805541753769,
|
|
"num_tokens": 790240965.0,
|
|
"step": 7900
|
|
},
|
|
{
|
|
"entropy": 0.937890625,
|
|
"epoch": 1.081044143774771,
|
|
"grad_norm": 0.2384233071791555,
|
|
"learning_rate": 2.368958714949979e-06,
|
|
"loss": 0.6577,
|
|
"mean_token_accuracy": 0.8199202954769135,
|
|
"num_tokens": 791198003.0,
|
|
"step": 7910
|
|
},
|
|
{
|
|
"entropy": 0.96796875,
|
|
"epoch": 1.082410824108241,
|
|
"grad_norm": 0.2648080311686642,
|
|
"learning_rate": 2.3654360997604624e-06,
|
|
"loss": 0.6744,
|
|
"mean_token_accuracy": 0.8159246802330017,
|
|
"num_tokens": 792174104.0,
|
|
"step": 7920
|
|
},
|
|
{
|
|
"entropy": 0.980859375,
|
|
"epoch": 1.083777504441711,
|
|
"grad_norm": 0.25900813214252844,
|
|
"learning_rate": 2.3619134845709455e-06,
|
|
"loss": 0.6945,
|
|
"mean_token_accuracy": 0.8125500857830048,
|
|
"num_tokens": 793200436.0,
|
|
"step": 7930
|
|
},
|
|
{
|
|
"entropy": 0.983203125,
|
|
"epoch": 1.085144184775181,
|
|
"grad_norm": 0.23684498573224147,
|
|
"learning_rate": 2.358390869381429e-06,
|
|
"loss": 0.6962,
|
|
"mean_token_accuracy": 0.810083556175232,
|
|
"num_tokens": 794189380.0,
|
|
"step": 7940
|
|
},
|
|
{
|
|
"entropy": 0.981640625,
|
|
"epoch": 1.086510865108651,
|
|
"grad_norm": 0.25721902091213217,
|
|
"learning_rate": 2.354868254191912e-06,
|
|
"loss": 0.7162,
|
|
"mean_token_accuracy": 0.8074076294898986,
|
|
"num_tokens": 795204803.0,
|
|
"step": 7950
|
|
},
|
|
{
|
|
"entropy": 0.970703125,
|
|
"epoch": 1.087877545442121,
|
|
"grad_norm": 0.2750819681597995,
|
|
"learning_rate": 2.3513456390023957e-06,
|
|
"loss": 0.6971,
|
|
"mean_token_accuracy": 0.8110137343406677,
|
|
"num_tokens": 796219873.0,
|
|
"step": 7960
|
|
},
|
|
{
|
|
"entropy": 0.9859375,
|
|
"epoch": 1.089244225775591,
|
|
"grad_norm": 0.26247204329767587,
|
|
"learning_rate": 2.347823023812879e-06,
|
|
"loss": 0.7073,
|
|
"mean_token_accuracy": 0.8083064794540405,
|
|
"num_tokens": 797177168.0,
|
|
"step": 7970
|
|
},
|
|
{
|
|
"entropy": 0.996875,
|
|
"epoch": 1.090610906109061,
|
|
"grad_norm": 0.2561745083373405,
|
|
"learning_rate": 2.3443004086233624e-06,
|
|
"loss": 0.6847,
|
|
"mean_token_accuracy": 0.8143604099750519,
|
|
"num_tokens": 798158967.0,
|
|
"step": 7980
|
|
},
|
|
{
|
|
"entropy": 0.946484375,
|
|
"epoch": 1.0919775864425312,
|
|
"grad_norm": 0.3145382326730363,
|
|
"learning_rate": 2.3407777934338455e-06,
|
|
"loss": 0.6673,
|
|
"mean_token_accuracy": 0.8167378664016723,
|
|
"num_tokens": 799174977.0,
|
|
"step": 7990
|
|
},
|
|
{
|
|
"entropy": 0.957421875,
|
|
"epoch": 1.0933442667760012,
|
|
"grad_norm": 0.2550663700641901,
|
|
"learning_rate": 2.3372551782443286e-06,
|
|
"loss": 0.6974,
|
|
"mean_token_accuracy": 0.8111193656921387,
|
|
"num_tokens": 800166131.0,
|
|
"step": 8000
|
|
},
|
|
{
|
|
"entropy": 0.967578125,
|
|
"epoch": 1.0947109471094711,
|
|
"grad_norm": 0.24321392753473878,
|
|
"learning_rate": 2.333732563054812e-06,
|
|
"loss": 0.7051,
|
|
"mean_token_accuracy": 0.8070204019546509,
|
|
"num_tokens": 801197432.0,
|
|
"step": 8010
|
|
},
|
|
{
|
|
"entropy": 0.984765625,
|
|
"epoch": 1.0960776274429411,
|
|
"grad_norm": 0.2906289056462751,
|
|
"learning_rate": 2.3302099478652953e-06,
|
|
"loss": 0.7055,
|
|
"mean_token_accuracy": 0.809996610879898,
|
|
"num_tokens": 802211389.0,
|
|
"step": 8020
|
|
},
|
|
{
|
|
"entropy": 0.97109375,
|
|
"epoch": 1.097444307776411,
|
|
"grad_norm": 0.3047634235461331,
|
|
"learning_rate": 2.3266873326757784e-06,
|
|
"loss": 0.7027,
|
|
"mean_token_accuracy": 0.8109454274177551,
|
|
"num_tokens": 803171428.0,
|
|
"step": 8030
|
|
},
|
|
{
|
|
"entropy": 1.01640625,
|
|
"epoch": 1.098810988109881,
|
|
"grad_norm": 0.276169459262225,
|
|
"learning_rate": 2.323164717486262e-06,
|
|
"loss": 0.7504,
|
|
"mean_token_accuracy": 0.7960780084133148,
|
|
"num_tokens": 804203089.0,
|
|
"step": 8040
|
|
},
|
|
{
|
|
"entropy": 0.920703125,
|
|
"epoch": 1.100177668443351,
|
|
"grad_norm": 0.24803595018392965,
|
|
"learning_rate": 2.319642102296745e-06,
|
|
"loss": 0.6829,
|
|
"mean_token_accuracy": 0.8152919709682465,
|
|
"num_tokens": 805209580.0,
|
|
"step": 8050
|
|
},
|
|
{
|
|
"entropy": 0.956640625,
|
|
"epoch": 1.101544348776821,
|
|
"grad_norm": 0.27242304542567813,
|
|
"learning_rate": 2.3161194871072287e-06,
|
|
"loss": 0.6913,
|
|
"mean_token_accuracy": 0.8110647320747375,
|
|
"num_tokens": 806191794.0,
|
|
"step": 8060
|
|
},
|
|
{
|
|
"entropy": 0.943359375,
|
|
"epoch": 1.102911029110291,
|
|
"grad_norm": 0.2642236253101483,
|
|
"learning_rate": 2.3125968719177118e-06,
|
|
"loss": 0.6773,
|
|
"mean_token_accuracy": 0.8150868833065033,
|
|
"num_tokens": 807170541.0,
|
|
"step": 8070
|
|
},
|
|
{
|
|
"entropy": 1.003515625,
|
|
"epoch": 1.104277709443761,
|
|
"grad_norm": 0.2779071346175103,
|
|
"learning_rate": 2.3090742567281953e-06,
|
|
"loss": 0.7094,
|
|
"mean_token_accuracy": 0.8079374194145202,
|
|
"num_tokens": 808211241.0,
|
|
"step": 8080
|
|
},
|
|
{
|
|
"entropy": 0.951171875,
|
|
"epoch": 1.105644389777231,
|
|
"grad_norm": 0.23733673495050595,
|
|
"learning_rate": 2.3055516415386785e-06,
|
|
"loss": 0.7302,
|
|
"mean_token_accuracy": 0.8051317214965821,
|
|
"num_tokens": 809195307.0,
|
|
"step": 8090
|
|
},
|
|
{
|
|
"entropy": 0.9640625,
|
|
"epoch": 1.1070110701107012,
|
|
"grad_norm": 0.309988885933136,
|
|
"learning_rate": 2.302029026349162e-06,
|
|
"loss": 0.6986,
|
|
"mean_token_accuracy": 0.8116549968719482,
|
|
"num_tokens": 810175750.0,
|
|
"step": 8100
|
|
},
|
|
{
|
|
"entropy": 0.972265625,
|
|
"epoch": 1.1083777504441712,
|
|
"grad_norm": 0.3226569260577685,
|
|
"learning_rate": 2.298506411159645e-06,
|
|
"loss": 0.6956,
|
|
"mean_token_accuracy": 0.8102893650531768,
|
|
"num_tokens": 811202472.0,
|
|
"step": 8110
|
|
},
|
|
{
|
|
"entropy": 0.95390625,
|
|
"epoch": 1.1097444307776412,
|
|
"grad_norm": 0.27274688992008195,
|
|
"learning_rate": 2.2949837959701287e-06,
|
|
"loss": 0.6955,
|
|
"mean_token_accuracy": 0.809269267320633,
|
|
"num_tokens": 812275788.0,
|
|
"step": 8120
|
|
},
|
|
{
|
|
"entropy": 0.985546875,
|
|
"epoch": 1.1111111111111112,
|
|
"grad_norm": 0.2724545370484663,
|
|
"learning_rate": 2.291461180780612e-06,
|
|
"loss": 0.7069,
|
|
"mean_token_accuracy": 0.808140903711319,
|
|
"num_tokens": 813309547.0,
|
|
"step": 8130
|
|
},
|
|
{
|
|
"entropy": 0.968359375,
|
|
"epoch": 1.1124777914445811,
|
|
"grad_norm": 0.281452157050825,
|
|
"learning_rate": 2.287938565591095e-06,
|
|
"loss": 0.658,
|
|
"mean_token_accuracy": 0.817566454410553,
|
|
"num_tokens": 814311981.0,
|
|
"step": 8140
|
|
},
|
|
{
|
|
"entropy": 0.932421875,
|
|
"epoch": 1.1138444717780511,
|
|
"grad_norm": 0.22045145093194057,
|
|
"learning_rate": 2.2844159504015785e-06,
|
|
"loss": 0.689,
|
|
"mean_token_accuracy": 0.8115639448165893,
|
|
"num_tokens": 815337391.0,
|
|
"step": 8150
|
|
},
|
|
{
|
|
"entropy": 0.972265625,
|
|
"epoch": 1.115211152111521,
|
|
"grad_norm": 0.2688134603593048,
|
|
"learning_rate": 2.2808933352120616e-06,
|
|
"loss": 0.7012,
|
|
"mean_token_accuracy": 0.8110836803913116,
|
|
"num_tokens": 816285117.0,
|
|
"step": 8160
|
|
},
|
|
{
|
|
"entropy": 0.962109375,
|
|
"epoch": 1.116577832444991,
|
|
"grad_norm": 0.2556421978045472,
|
|
"learning_rate": 2.277370720022545e-06,
|
|
"loss": 0.6961,
|
|
"mean_token_accuracy": 0.8090452253818512,
|
|
"num_tokens": 817279034.0,
|
|
"step": 8170
|
|
},
|
|
{
|
|
"entropy": 0.962890625,
|
|
"epoch": 1.117944512778461,
|
|
"grad_norm": 0.2850900236936682,
|
|
"learning_rate": 2.2738481048330283e-06,
|
|
"loss": 0.7253,
|
|
"mean_token_accuracy": 0.8033904314041138,
|
|
"num_tokens": 818293161.0,
|
|
"step": 8180
|
|
},
|
|
{
|
|
"entropy": 0.942578125,
|
|
"epoch": 1.119311193111931,
|
|
"grad_norm": 0.2692977108812554,
|
|
"learning_rate": 2.2703254896435114e-06,
|
|
"loss": 0.7045,
|
|
"mean_token_accuracy": 0.8077257871627808,
|
|
"num_tokens": 819333445.0,
|
|
"step": 8190
|
|
},
|
|
{
|
|
"entropy": 0.987890625,
|
|
"epoch": 1.120677873445401,
|
|
"grad_norm": 0.2524778682570527,
|
|
"learning_rate": 2.266802874453995e-06,
|
|
"loss": 0.7271,
|
|
"mean_token_accuracy": 0.8038629353046417,
|
|
"num_tokens": 820345529.0,
|
|
"step": 8200
|
|
},
|
|
{
|
|
"entropy": 0.977734375,
|
|
"epoch": 1.122044553778871,
|
|
"grad_norm": 0.30587608013007894,
|
|
"learning_rate": 2.263280259264478e-06,
|
|
"loss": 0.7058,
|
|
"mean_token_accuracy": 0.8082134783267975,
|
|
"num_tokens": 821321575.0,
|
|
"step": 8210
|
|
},
|
|
{
|
|
"entropy": 0.933203125,
|
|
"epoch": 1.123411234112341,
|
|
"grad_norm": 0.24803883958469944,
|
|
"learning_rate": 2.259757644074961e-06,
|
|
"loss": 0.6335,
|
|
"mean_token_accuracy": 0.8241330683231354,
|
|
"num_tokens": 822305031.0,
|
|
"step": 8220
|
|
},
|
|
{
|
|
"entropy": 0.96640625,
|
|
"epoch": 1.1247779144458112,
|
|
"grad_norm": 0.25085504495237154,
|
|
"learning_rate": 2.2562350288854447e-06,
|
|
"loss": 0.7138,
|
|
"mean_token_accuracy": 0.8063889741897583,
|
|
"num_tokens": 823307632.0,
|
|
"step": 8230
|
|
},
|
|
{
|
|
"entropy": 0.934375,
|
|
"epoch": 1.1261445947792812,
|
|
"grad_norm": 0.2693372361776079,
|
|
"learning_rate": 2.252712413695928e-06,
|
|
"loss": 0.6755,
|
|
"mean_token_accuracy": 0.8136297166347504,
|
|
"num_tokens": 824271389.0,
|
|
"step": 8240
|
|
},
|
|
{
|
|
"entropy": 0.97265625,
|
|
"epoch": 1.1275112751127512,
|
|
"grad_norm": 0.27657744595731093,
|
|
"learning_rate": 2.2491897985064114e-06,
|
|
"loss": 0.7241,
|
|
"mean_token_accuracy": 0.8040557682514191,
|
|
"num_tokens": 825278540.0,
|
|
"step": 8250
|
|
},
|
|
{
|
|
"entropy": 0.939453125,
|
|
"epoch": 1.1288779554462212,
|
|
"grad_norm": 0.26717391598389983,
|
|
"learning_rate": 2.2456671833168945e-06,
|
|
"loss": 0.6839,
|
|
"mean_token_accuracy": 0.8132993996143341,
|
|
"num_tokens": 826243008.0,
|
|
"step": 8260
|
|
},
|
|
{
|
|
"entropy": 0.9546875,
|
|
"epoch": 1.1302446357796911,
|
|
"grad_norm": 0.29045203740635095,
|
|
"learning_rate": 2.242144568127378e-06,
|
|
"loss": 0.7262,
|
|
"mean_token_accuracy": 0.8042730927467346,
|
|
"num_tokens": 827215814.0,
|
|
"step": 8270
|
|
},
|
|
{
|
|
"entropy": 1.00234375,
|
|
"epoch": 1.1316113161131611,
|
|
"grad_norm": 0.2371231085474752,
|
|
"learning_rate": 2.238621952937861e-06,
|
|
"loss": 0.7314,
|
|
"mean_token_accuracy": 0.8040135741233826,
|
|
"num_tokens": 828242802.0,
|
|
"step": 8280
|
|
},
|
|
{
|
|
"entropy": 0.999609375,
|
|
"epoch": 1.132977996446631,
|
|
"grad_norm": 0.28783242203387066,
|
|
"learning_rate": 2.2350993377483447e-06,
|
|
"loss": 0.7276,
|
|
"mean_token_accuracy": 0.8026947557926178,
|
|
"num_tokens": 829230247.0,
|
|
"step": 8290
|
|
},
|
|
{
|
|
"entropy": 0.9609375,
|
|
"epoch": 1.134344676780101,
|
|
"grad_norm": 0.26645290106952707,
|
|
"learning_rate": 2.231576722558828e-06,
|
|
"loss": 0.7134,
|
|
"mean_token_accuracy": 0.8075373053550721,
|
|
"num_tokens": 830212886.0,
|
|
"step": 8300
|
|
},
|
|
{
|
|
"entropy": 0.95625,
|
|
"epoch": 1.135711357113571,
|
|
"grad_norm": 0.27253311124399204,
|
|
"learning_rate": 2.2280541073693114e-06,
|
|
"loss": 0.6648,
|
|
"mean_token_accuracy": 0.8158569872379303,
|
|
"num_tokens": 831226328.0,
|
|
"step": 8310
|
|
},
|
|
{
|
|
"entropy": 1.00703125,
|
|
"epoch": 1.137078037447041,
|
|
"grad_norm": 0.27384219314113933,
|
|
"learning_rate": 2.2245314921797945e-06,
|
|
"loss": 0.7427,
|
|
"mean_token_accuracy": 0.8011927306652069,
|
|
"num_tokens": 832234093.0,
|
|
"step": 8320
|
|
},
|
|
{
|
|
"entropy": 0.975390625,
|
|
"epoch": 1.1384447177805113,
|
|
"grad_norm": 0.2698500059583557,
|
|
"learning_rate": 2.2210088769902777e-06,
|
|
"loss": 0.7151,
|
|
"mean_token_accuracy": 0.8063203454017639,
|
|
"num_tokens": 833253215.0,
|
|
"step": 8330
|
|
},
|
|
{
|
|
"entropy": 0.884765625,
|
|
"epoch": 1.1398113981139812,
|
|
"grad_norm": 0.25453881359704056,
|
|
"learning_rate": 2.217486261800761e-06,
|
|
"loss": 0.6195,
|
|
"mean_token_accuracy": 0.8259511113166809,
|
|
"num_tokens": 834191417.0,
|
|
"step": 8340
|
|
},
|
|
{
|
|
"entropy": 0.98046875,
|
|
"epoch": 1.1411780784474512,
|
|
"grad_norm": 0.26215161792270825,
|
|
"learning_rate": 2.2139636466112443e-06,
|
|
"loss": 0.7013,
|
|
"mean_token_accuracy": 0.8098521173000336,
|
|
"num_tokens": 835221928.0,
|
|
"step": 8350
|
|
},
|
|
{
|
|
"entropy": 0.936328125,
|
|
"epoch": 1.1425447587809212,
|
|
"grad_norm": 0.2729471599606265,
|
|
"learning_rate": 2.2104410314217275e-06,
|
|
"loss": 0.6681,
|
|
"mean_token_accuracy": 0.8177756071090698,
|
|
"num_tokens": 836213826.0,
|
|
"step": 8360
|
|
},
|
|
{
|
|
"entropy": 0.9859375,
|
|
"epoch": 1.1439114391143912,
|
|
"grad_norm": 0.28415313176417073,
|
|
"learning_rate": 2.206918416232211e-06,
|
|
"loss": 0.7111,
|
|
"mean_token_accuracy": 0.8083570659160614,
|
|
"num_tokens": 837243775.0,
|
|
"step": 8370
|
|
},
|
|
{
|
|
"entropy": 0.9796875,
|
|
"epoch": 1.1452781194478612,
|
|
"grad_norm": 0.2710894906322775,
|
|
"learning_rate": 2.203395801042694e-06,
|
|
"loss": 0.7332,
|
|
"mean_token_accuracy": 0.7992492616176605,
|
|
"num_tokens": 838260824.0,
|
|
"step": 8380
|
|
},
|
|
{
|
|
"entropy": 0.969921875,
|
|
"epoch": 1.1466447997813312,
|
|
"grad_norm": 0.2966101902076844,
|
|
"learning_rate": 2.1998731858531777e-06,
|
|
"loss": 0.6857,
|
|
"mean_token_accuracy": 0.8131448686122894,
|
|
"num_tokens": 839308991.0,
|
|
"step": 8390
|
|
},
|
|
{
|
|
"entropy": 0.984765625,
|
|
"epoch": 1.1480114801148011,
|
|
"grad_norm": 0.29103422783150606,
|
|
"learning_rate": 2.196350570663661e-06,
|
|
"loss": 0.6688,
|
|
"mean_token_accuracy": 0.815486615896225,
|
|
"num_tokens": 840316186.0,
|
|
"step": 8400
|
|
},
|
|
{
|
|
"entropy": 0.95859375,
|
|
"epoch": 1.1493781604482711,
|
|
"grad_norm": 0.2685553240533166,
|
|
"learning_rate": 2.192827955474144e-06,
|
|
"loss": 0.6877,
|
|
"mean_token_accuracy": 0.8136171340942383,
|
|
"num_tokens": 841297160.0,
|
|
"step": 8410
|
|
},
|
|
{
|
|
"entropy": 0.91953125,
|
|
"epoch": 1.150744840781741,
|
|
"grad_norm": 0.2397162476646541,
|
|
"learning_rate": 2.1893053402846275e-06,
|
|
"loss": 0.6836,
|
|
"mean_token_accuracy": 0.8133617341518402,
|
|
"num_tokens": 842305251.0,
|
|
"step": 8420
|
|
},
|
|
{
|
|
"entropy": 1.010546875,
|
|
"epoch": 1.152111521115211,
|
|
"grad_norm": 0.2681003077018288,
|
|
"learning_rate": 2.1857827250951106e-06,
|
|
"loss": 0.7318,
|
|
"mean_token_accuracy": 0.8054361343383789,
|
|
"num_tokens": 843329273.0,
|
|
"step": 8430
|
|
},
|
|
{
|
|
"entropy": 0.967578125,
|
|
"epoch": 1.153478201448681,
|
|
"grad_norm": 0.2586498332872875,
|
|
"learning_rate": 2.182260109905594e-06,
|
|
"loss": 0.7072,
|
|
"mean_token_accuracy": 0.8081368029117584,
|
|
"num_tokens": 844332178.0,
|
|
"step": 8440
|
|
},
|
|
{
|
|
"entropy": 0.9375,
|
|
"epoch": 1.154844881782151,
|
|
"grad_norm": 0.27935082124327837,
|
|
"learning_rate": 2.1787374947160777e-06,
|
|
"loss": 0.6785,
|
|
"mean_token_accuracy": 0.8149131298065185,
|
|
"num_tokens": 845304453.0,
|
|
"step": 8450
|
|
},
|
|
{
|
|
"entropy": 0.926953125,
|
|
"epoch": 1.156211562115621,
|
|
"grad_norm": 0.23127714847200317,
|
|
"learning_rate": 2.175214879526561e-06,
|
|
"loss": 0.7051,
|
|
"mean_token_accuracy": 0.8078540623188019,
|
|
"num_tokens": 846348270.0,
|
|
"step": 8460
|
|
},
|
|
{
|
|
"entropy": 0.976953125,
|
|
"epoch": 1.1575782424490912,
|
|
"grad_norm": 0.26742502195433604,
|
|
"learning_rate": 2.171692264337044e-06,
|
|
"loss": 0.6993,
|
|
"mean_token_accuracy": 0.8100921511650085,
|
|
"num_tokens": 847329653.0,
|
|
"step": 8470
|
|
},
|
|
{
|
|
"entropy": 0.96328125,
|
|
"epoch": 1.1589449227825612,
|
|
"grad_norm": 0.2550670434150908,
|
|
"learning_rate": 2.1681696491475275e-06,
|
|
"loss": 0.6915,
|
|
"mean_token_accuracy": 0.8123687386512757,
|
|
"num_tokens": 848298122.0,
|
|
"step": 8480
|
|
},
|
|
{
|
|
"entropy": 0.95703125,
|
|
"epoch": 1.1603116031160312,
|
|
"grad_norm": 0.26850796049076614,
|
|
"learning_rate": 2.1646470339580106e-06,
|
|
"loss": 0.6802,
|
|
"mean_token_accuracy": 0.8147450685501099,
|
|
"num_tokens": 849361995.0,
|
|
"step": 8490
|
|
},
|
|
{
|
|
"entropy": 0.951953125,
|
|
"epoch": 1.1616782834495012,
|
|
"grad_norm": 0.2665662639094243,
|
|
"learning_rate": 2.1611244187684937e-06,
|
|
"loss": 0.6707,
|
|
"mean_token_accuracy": 0.8166682600975037,
|
|
"num_tokens": 850348679.0,
|
|
"step": 8500
|
|
},
|
|
{
|
|
"entropy": 0.941015625,
|
|
"epoch": 1.1630449637829712,
|
|
"grad_norm": 0.245498043729849,
|
|
"learning_rate": 2.1576018035789773e-06,
|
|
"loss": 0.6867,
|
|
"mean_token_accuracy": 0.813631021976471,
|
|
"num_tokens": 851390979.0,
|
|
"step": 8510
|
|
},
|
|
{
|
|
"entropy": 0.916796875,
|
|
"epoch": 1.1644116441164412,
|
|
"grad_norm": 0.27900965972338015,
|
|
"learning_rate": 2.1540791883894604e-06,
|
|
"loss": 0.6913,
|
|
"mean_token_accuracy": 0.8105323255062103,
|
|
"num_tokens": 852334784.0,
|
|
"step": 8520
|
|
},
|
|
{
|
|
"entropy": 0.97109375,
|
|
"epoch": 1.1657783244499111,
|
|
"grad_norm": 0.2707248737906118,
|
|
"learning_rate": 2.150556573199944e-06,
|
|
"loss": 0.7017,
|
|
"mean_token_accuracy": 0.8106153309345245,
|
|
"num_tokens": 853316164.0,
|
|
"step": 8530
|
|
},
|
|
{
|
|
"entropy": 0.946875,
|
|
"epoch": 1.1671450047833811,
|
|
"grad_norm": 0.23342761439867404,
|
|
"learning_rate": 2.147033958010427e-06,
|
|
"loss": 0.6781,
|
|
"mean_token_accuracy": 0.8165991008281708,
|
|
"num_tokens": 854310705.0,
|
|
"step": 8540
|
|
},
|
|
{
|
|
"entropy": 0.979296875,
|
|
"epoch": 1.168511685116851,
|
|
"grad_norm": 0.2886032018291234,
|
|
"learning_rate": 2.14351134282091e-06,
|
|
"loss": 0.6901,
|
|
"mean_token_accuracy": 0.813430780172348,
|
|
"num_tokens": 855323999.0,
|
|
"step": 8550
|
|
},
|
|
{
|
|
"entropy": 0.9453125,
|
|
"epoch": 1.169878365450321,
|
|
"grad_norm": 0.27478222874782193,
|
|
"learning_rate": 2.1399887276313937e-06,
|
|
"loss": 0.6435,
|
|
"mean_token_accuracy": 0.8228863120079041,
|
|
"num_tokens": 856354716.0,
|
|
"step": 8560
|
|
},
|
|
{
|
|
"entropy": 0.9890625,
|
|
"epoch": 1.1712450457837913,
|
|
"grad_norm": 0.27036896569350605,
|
|
"learning_rate": 2.136466112441877e-06,
|
|
"loss": 0.7337,
|
|
"mean_token_accuracy": 0.8045261085033417,
|
|
"num_tokens": 857367255.0,
|
|
"step": 8570
|
|
},
|
|
{
|
|
"entropy": 0.95,
|
|
"epoch": 1.1726117261172613,
|
|
"grad_norm": 0.2651768486789538,
|
|
"learning_rate": 2.1329434972523604e-06,
|
|
"loss": 0.6721,
|
|
"mean_token_accuracy": 0.8149563431739807,
|
|
"num_tokens": 858351443.0,
|
|
"step": 8580
|
|
},
|
|
{
|
|
"entropy": 0.9609375,
|
|
"epoch": 1.1739784064507313,
|
|
"grad_norm": 0.2718377537931992,
|
|
"learning_rate": 2.1294208820628435e-06,
|
|
"loss": 0.6999,
|
|
"mean_token_accuracy": 0.8100000023841858,
|
|
"num_tokens": 859323958.0,
|
|
"step": 8590
|
|
},
|
|
{
|
|
"entropy": 0.998828125,
|
|
"epoch": 1.1753450867842012,
|
|
"grad_norm": 0.28302857703278117,
|
|
"learning_rate": 2.125898266873327e-06,
|
|
"loss": 0.7135,
|
|
"mean_token_accuracy": 0.8046480178833008,
|
|
"num_tokens": 860387216.0,
|
|
"step": 8600
|
|
},
|
|
{
|
|
"entropy": 0.998828125,
|
|
"epoch": 1.1767117671176712,
|
|
"grad_norm": 0.2475666636106989,
|
|
"learning_rate": 2.12237565168381e-06,
|
|
"loss": 0.691,
|
|
"mean_token_accuracy": 0.8116539478302002,
|
|
"num_tokens": 861392464.0,
|
|
"step": 8610
|
|
},
|
|
{
|
|
"entropy": 0.972265625,
|
|
"epoch": 1.1780784474511412,
|
|
"grad_norm": 0.26936119993451135,
|
|
"learning_rate": 2.1188530364942938e-06,
|
|
"loss": 0.7262,
|
|
"mean_token_accuracy": 0.8044435203075408,
|
|
"num_tokens": 862397043.0,
|
|
"step": 8620
|
|
},
|
|
{
|
|
"entropy": 0.913671875,
|
|
"epoch": 1.1794451277846112,
|
|
"grad_norm": 0.24493136422155792,
|
|
"learning_rate": 2.115330421304777e-06,
|
|
"loss": 0.6819,
|
|
"mean_token_accuracy": 0.8132322728633881,
|
|
"num_tokens": 863390205.0,
|
|
"step": 8630
|
|
},
|
|
{
|
|
"entropy": 0.93359375,
|
|
"epoch": 1.1808118081180812,
|
|
"grad_norm": 0.25387640514451904,
|
|
"learning_rate": 2.1118078061152604e-06,
|
|
"loss": 0.6862,
|
|
"mean_token_accuracy": 0.8133740901947022,
|
|
"num_tokens": 864448969.0,
|
|
"step": 8640
|
|
},
|
|
{
|
|
"entropy": 0.926953125,
|
|
"epoch": 1.1821784884515512,
|
|
"grad_norm": 0.2510783280096968,
|
|
"learning_rate": 2.1082851909257435e-06,
|
|
"loss": 0.6862,
|
|
"mean_token_accuracy": 0.8129129469394684,
|
|
"num_tokens": 865457188.0,
|
|
"step": 8650
|
|
},
|
|
{
|
|
"entropy": 0.950390625,
|
|
"epoch": 1.1835451687850211,
|
|
"grad_norm": 0.22289626943162483,
|
|
"learning_rate": 2.1047625757362267e-06,
|
|
"loss": 0.7003,
|
|
"mean_token_accuracy": 0.809943550825119,
|
|
"num_tokens": 866493920.0,
|
|
"step": 8660
|
|
},
|
|
{
|
|
"entropy": 0.95625,
|
|
"epoch": 1.1849118491184911,
|
|
"grad_norm": 0.27833555511343655,
|
|
"learning_rate": 2.1012399605467102e-06,
|
|
"loss": 0.6943,
|
|
"mean_token_accuracy": 0.8103886663913726,
|
|
"num_tokens": 867456088.0,
|
|
"step": 8670
|
|
},
|
|
{
|
|
"entropy": 0.994921875,
|
|
"epoch": 1.186278529451961,
|
|
"grad_norm": 0.25134547733781437,
|
|
"learning_rate": 2.0977173453571933e-06,
|
|
"loss": 0.7104,
|
|
"mean_token_accuracy": 0.8088772475719452,
|
|
"num_tokens": 868415965.0,
|
|
"step": 8680
|
|
},
|
|
{
|
|
"entropy": 0.996875,
|
|
"epoch": 1.187645209785431,
|
|
"grad_norm": 0.2898557896943641,
|
|
"learning_rate": 2.0941947301676765e-06,
|
|
"loss": 0.7478,
|
|
"mean_token_accuracy": 0.7993580102920532,
|
|
"num_tokens": 869360829.0,
|
|
"step": 8690
|
|
},
|
|
{
|
|
"entropy": 0.925390625,
|
|
"epoch": 1.189011890118901,
|
|
"grad_norm": 0.2634079396315828,
|
|
"learning_rate": 2.09067211497816e-06,
|
|
"loss": 0.6947,
|
|
"mean_token_accuracy": 0.8108194410800934,
|
|
"num_tokens": 870385804.0,
|
|
"step": 8700
|
|
},
|
|
{
|
|
"entropy": 0.97109375,
|
|
"epoch": 1.1903785704523713,
|
|
"grad_norm": 0.28513340995702924,
|
|
"learning_rate": 2.087149499788643e-06,
|
|
"loss": 0.6881,
|
|
"mean_token_accuracy": 0.8094948768615723,
|
|
"num_tokens": 871374976.0,
|
|
"step": 8710
|
|
},
|
|
{
|
|
"entropy": 0.968359375,
|
|
"epoch": 1.1917452507858413,
|
|
"grad_norm": 0.3388196272164683,
|
|
"learning_rate": 2.0836268845991263e-06,
|
|
"loss": 0.6945,
|
|
"mean_token_accuracy": 0.8117839157581329,
|
|
"num_tokens": 872381296.0,
|
|
"step": 8720
|
|
},
|
|
{
|
|
"entropy": 0.959375,
|
|
"epoch": 1.1931119311193112,
|
|
"grad_norm": 0.27742235954779176,
|
|
"learning_rate": 2.08010426940961e-06,
|
|
"loss": 0.702,
|
|
"mean_token_accuracy": 0.8101055562496186,
|
|
"num_tokens": 873413346.0,
|
|
"step": 8730
|
|
},
|
|
{
|
|
"entropy": 0.9796875,
|
|
"epoch": 1.1944786114527812,
|
|
"grad_norm": 0.2941830125299418,
|
|
"learning_rate": 2.076581654220093e-06,
|
|
"loss": 0.7212,
|
|
"mean_token_accuracy": 0.8057069182395935,
|
|
"num_tokens": 874412929.0,
|
|
"step": 8740
|
|
},
|
|
{
|
|
"entropy": 0.9390625,
|
|
"epoch": 1.1958452917862512,
|
|
"grad_norm": 0.30366448498130233,
|
|
"learning_rate": 2.0730590390305765e-06,
|
|
"loss": 0.6728,
|
|
"mean_token_accuracy": 0.8155039072036743,
|
|
"num_tokens": 875402223.0,
|
|
"step": 8750
|
|
},
|
|
{
|
|
"entropy": 0.9625,
|
|
"epoch": 1.1972119721197212,
|
|
"grad_norm": 0.28312892351583036,
|
|
"learning_rate": 2.0695364238410596e-06,
|
|
"loss": 0.6945,
|
|
"mean_token_accuracy": 0.810288256406784,
|
|
"num_tokens": 876463167.0,
|
|
"step": 8760
|
|
},
|
|
{
|
|
"entropy": 0.962890625,
|
|
"epoch": 1.1985786524531912,
|
|
"grad_norm": 0.24077928729481568,
|
|
"learning_rate": 2.066013808651543e-06,
|
|
"loss": 0.6934,
|
|
"mean_token_accuracy": 0.8103709816932678,
|
|
"num_tokens": 877461994.0,
|
|
"step": 8770
|
|
},
|
|
{
|
|
"entropy": 1.001171875,
|
|
"epoch": 1.1999453327866612,
|
|
"grad_norm": 0.3034386009863905,
|
|
"learning_rate": 2.0624911934620263e-06,
|
|
"loss": 0.7301,
|
|
"mean_token_accuracy": 0.8050022184848785,
|
|
"num_tokens": 878411994.0,
|
|
"step": 8780
|
|
},
|
|
{
|
|
"entropy": 0.991796875,
|
|
"epoch": 1.2013120131201311,
|
|
"grad_norm": 0.26619142012518837,
|
|
"learning_rate": 2.05896857827251e-06,
|
|
"loss": 0.7425,
|
|
"mean_token_accuracy": 0.8007334053516388,
|
|
"num_tokens": 879467450.0,
|
|
"step": 8790
|
|
},
|
|
{
|
|
"entropy": 0.93828125,
|
|
"epoch": 1.2026786934536011,
|
|
"grad_norm": 0.2718477222980935,
|
|
"learning_rate": 2.055445963082993e-06,
|
|
"loss": 0.671,
|
|
"mean_token_accuracy": 0.8175169348716735,
|
|
"num_tokens": 880463239.0,
|
|
"step": 8800
|
|
},
|
|
{
|
|
"entropy": 0.927734375,
|
|
"epoch": 1.2040453737870713,
|
|
"grad_norm": 0.268022231892765,
|
|
"learning_rate": 2.0519233478934765e-06,
|
|
"loss": 0.6772,
|
|
"mean_token_accuracy": 0.813913905620575,
|
|
"num_tokens": 881497928.0,
|
|
"step": 8810
|
|
},
|
|
{
|
|
"entropy": 0.981640625,
|
|
"epoch": 1.2054120541205413,
|
|
"grad_norm": 0.27405722998058984,
|
|
"learning_rate": 2.0484007327039596e-06,
|
|
"loss": 0.7127,
|
|
"mean_token_accuracy": 0.806618195772171,
|
|
"num_tokens": 882484287.0,
|
|
"step": 8820
|
|
},
|
|
{
|
|
"entropy": 0.962109375,
|
|
"epoch": 1.2067787344540113,
|
|
"grad_norm": 0.28922895827331513,
|
|
"learning_rate": 2.0448781175144427e-06,
|
|
"loss": 0.7274,
|
|
"mean_token_accuracy": 0.8057705998420716,
|
|
"num_tokens": 883474734.0,
|
|
"step": 8830
|
|
},
|
|
{
|
|
"entropy": 0.959375,
|
|
"epoch": 1.2081454147874813,
|
|
"grad_norm": 0.25857367885262766,
|
|
"learning_rate": 2.0413555023249263e-06,
|
|
"loss": 0.7094,
|
|
"mean_token_accuracy": 0.808801943063736,
|
|
"num_tokens": 884485200.0,
|
|
"step": 8840
|
|
},
|
|
{
|
|
"entropy": 0.95625,
|
|
"epoch": 1.2095120951209513,
|
|
"grad_norm": 0.2680676242740109,
|
|
"learning_rate": 2.0378328871354094e-06,
|
|
"loss": 0.7068,
|
|
"mean_token_accuracy": 0.8089721202850342,
|
|
"num_tokens": 885527588.0,
|
|
"step": 8850
|
|
},
|
|
{
|
|
"entropy": 0.9625,
|
|
"epoch": 1.2108787754544212,
|
|
"grad_norm": 0.24271807152565475,
|
|
"learning_rate": 2.034310271945893e-06,
|
|
"loss": 0.6877,
|
|
"mean_token_accuracy": 0.8136993169784545,
|
|
"num_tokens": 886576177.0,
|
|
"step": 8860
|
|
},
|
|
{
|
|
"entropy": 0.95,
|
|
"epoch": 1.2122454557878912,
|
|
"grad_norm": 0.26965982463112226,
|
|
"learning_rate": 2.030787656756376e-06,
|
|
"loss": 0.7067,
|
|
"mean_token_accuracy": 0.8068296790122986,
|
|
"num_tokens": 887557289.0,
|
|
"step": 8870
|
|
},
|
|
{
|
|
"entropy": 0.937890625,
|
|
"epoch": 1.2136121361213612,
|
|
"grad_norm": 0.23824557739774466,
|
|
"learning_rate": 2.027265041566859e-06,
|
|
"loss": 0.6844,
|
|
"mean_token_accuracy": 0.8128302574157715,
|
|
"num_tokens": 888551450.0,
|
|
"step": 8880
|
|
},
|
|
{
|
|
"entropy": 0.950390625,
|
|
"epoch": 1.2149788164548312,
|
|
"grad_norm": 0.2725779746979378,
|
|
"learning_rate": 2.0237424263773427e-06,
|
|
"loss": 0.6943,
|
|
"mean_token_accuracy": 0.8106231987476349,
|
|
"num_tokens": 889517616.0,
|
|
"step": 8890
|
|
},
|
|
{
|
|
"entropy": 0.923828125,
|
|
"epoch": 1.2163454967883012,
|
|
"grad_norm": 0.22677692465740446,
|
|
"learning_rate": 2.020219811187826e-06,
|
|
"loss": 0.6736,
|
|
"mean_token_accuracy": 0.8158926784992218,
|
|
"num_tokens": 890537135.0,
|
|
"step": 8900
|
|
},
|
|
{
|
|
"entropy": 0.97578125,
|
|
"epoch": 1.2177121771217712,
|
|
"grad_norm": 0.26750836329994776,
|
|
"learning_rate": 2.0166971959983094e-06,
|
|
"loss": 0.7186,
|
|
"mean_token_accuracy": 0.8044227242469788,
|
|
"num_tokens": 891549004.0,
|
|
"step": 8910
|
|
},
|
|
{
|
|
"entropy": 0.93203125,
|
|
"epoch": 1.2190788574552411,
|
|
"grad_norm": 0.26027796190999547,
|
|
"learning_rate": 2.0131745808087925e-06,
|
|
"loss": 0.6824,
|
|
"mean_token_accuracy": 0.8135682225227356,
|
|
"num_tokens": 892557106.0,
|
|
"step": 8920
|
|
},
|
|
{
|
|
"entropy": 0.946484375,
|
|
"epoch": 1.2204455377887111,
|
|
"grad_norm": 0.28363234196488313,
|
|
"learning_rate": 2.009651965619276e-06,
|
|
"loss": 0.6732,
|
|
"mean_token_accuracy": 0.8145446419715882,
|
|
"num_tokens": 893557870.0,
|
|
"step": 8930
|
|
},
|
|
{
|
|
"entropy": 0.979296875,
|
|
"epoch": 1.221812218122181,
|
|
"grad_norm": 0.26339581033790976,
|
|
"learning_rate": 2.0061293504297592e-06,
|
|
"loss": 0.702,
|
|
"mean_token_accuracy": 0.8093523979187012,
|
|
"num_tokens": 894586657.0,
|
|
"step": 8940
|
|
},
|
|
{
|
|
"entropy": 0.920703125,
|
|
"epoch": 1.2231788984556513,
|
|
"grad_norm": 0.2545586878688595,
|
|
"learning_rate": 2.0026067352402428e-06,
|
|
"loss": 0.6531,
|
|
"mean_token_accuracy": 0.8200562298297882,
|
|
"num_tokens": 895604874.0,
|
|
"step": 8950
|
|
},
|
|
{
|
|
"entropy": 0.980078125,
|
|
"epoch": 1.2245455787891213,
|
|
"grad_norm": 0.25066583580660784,
|
|
"learning_rate": 1.999084120050726e-06,
|
|
"loss": 0.7304,
|
|
"mean_token_accuracy": 0.8033725500106812,
|
|
"num_tokens": 896608041.0,
|
|
"step": 8960
|
|
},
|
|
{
|
|
"entropy": 0.938671875,
|
|
"epoch": 1.2259122591225913,
|
|
"grad_norm": 0.25798847358408555,
|
|
"learning_rate": 1.9955615048612094e-06,
|
|
"loss": 0.6837,
|
|
"mean_token_accuracy": 0.8132625222206116,
|
|
"num_tokens": 897597600.0,
|
|
"step": 8970
|
|
},
|
|
{
|
|
"entropy": 0.962109375,
|
|
"epoch": 1.2272789394560613,
|
|
"grad_norm": 0.26995332677227096,
|
|
"learning_rate": 1.9920388896716926e-06,
|
|
"loss": 0.669,
|
|
"mean_token_accuracy": 0.8178912281990052,
|
|
"num_tokens": 898615203.0,
|
|
"step": 8980
|
|
},
|
|
{
|
|
"entropy": 0.9796875,
|
|
"epoch": 1.2286456197895312,
|
|
"grad_norm": 0.25368561435317916,
|
|
"learning_rate": 1.9885162744821757e-06,
|
|
"loss": 0.6785,
|
|
"mean_token_accuracy": 0.817600816488266,
|
|
"num_tokens": 899617423.0,
|
|
"step": 8990
|
|
},
|
|
{
|
|
"entropy": 0.94921875,
|
|
"epoch": 1.2300123001230012,
|
|
"grad_norm": 0.2681968035827581,
|
|
"learning_rate": 1.9849936592926592e-06,
|
|
"loss": 0.6909,
|
|
"mean_token_accuracy": 0.810970914363861,
|
|
"num_tokens": 900558849.0,
|
|
"step": 9000
|
|
},
|
|
{
|
|
"entropy": 0.94609375,
|
|
"epoch": 1.2313789804564712,
|
|
"grad_norm": 0.24926706704440355,
|
|
"learning_rate": 1.9814710441031424e-06,
|
|
"loss": 0.6696,
|
|
"mean_token_accuracy": 0.816283893585205,
|
|
"num_tokens": 901548912.0,
|
|
"step": 9010
|
|
},
|
|
{
|
|
"entropy": 0.92578125,
|
|
"epoch": 1.2327456607899412,
|
|
"grad_norm": 0.27112526388331243,
|
|
"learning_rate": 1.9779484289136255e-06,
|
|
"loss": 0.6677,
|
|
"mean_token_accuracy": 0.8173651695251465,
|
|
"num_tokens": 902535364.0,
|
|
"step": 9020
|
|
},
|
|
{
|
|
"entropy": 0.97421875,
|
|
"epoch": 1.2341123411234112,
|
|
"grad_norm": 0.25731684153619366,
|
|
"learning_rate": 1.974425813724109e-06,
|
|
"loss": 0.6896,
|
|
"mean_token_accuracy": 0.8132133066654206,
|
|
"num_tokens": 903543096.0,
|
|
"step": 9030
|
|
},
|
|
{
|
|
"entropy": 0.952734375,
|
|
"epoch": 1.2354790214568812,
|
|
"grad_norm": 0.27015593625298856,
|
|
"learning_rate": 1.970903198534592e-06,
|
|
"loss": 0.6847,
|
|
"mean_token_accuracy": 0.8127448439598084,
|
|
"num_tokens": 904565326.0,
|
|
"step": 9040
|
|
},
|
|
{
|
|
"entropy": 0.959375,
|
|
"epoch": 1.2368457017903514,
|
|
"grad_norm": 0.28335951723796066,
|
|
"learning_rate": 1.9673805833450753e-06,
|
|
"loss": 0.7014,
|
|
"mean_token_accuracy": 0.8086576700210572,
|
|
"num_tokens": 905584767.0,
|
|
"step": 9050
|
|
},
|
|
{
|
|
"entropy": 0.969921875,
|
|
"epoch": 1.2382123821238213,
|
|
"grad_norm": 0.22457501258259585,
|
|
"learning_rate": 1.963857968155559e-06,
|
|
"loss": 0.6868,
|
|
"mean_token_accuracy": 0.8128512620925903,
|
|
"num_tokens": 906607326.0,
|
|
"step": 9060
|
|
},
|
|
{
|
|
"entropy": 0.941796875,
|
|
"epoch": 1.2395790624572913,
|
|
"grad_norm": 0.2898100756508614,
|
|
"learning_rate": 1.960335352966042e-06,
|
|
"loss": 0.6934,
|
|
"mean_token_accuracy": 0.8123340725898742,
|
|
"num_tokens": 907609267.0,
|
|
"step": 9070
|
|
},
|
|
{
|
|
"entropy": 0.96328125,
|
|
"epoch": 1.2409457427907613,
|
|
"grad_norm": 0.262981925237442,
|
|
"learning_rate": 1.9568127377765255e-06,
|
|
"loss": 0.7166,
|
|
"mean_token_accuracy": 0.8056684494018554,
|
|
"num_tokens": 908637270.0,
|
|
"step": 9080
|
|
},
|
|
{
|
|
"entropy": 0.91953125,
|
|
"epoch": 1.2423124231242313,
|
|
"grad_norm": 0.2311368863305942,
|
|
"learning_rate": 1.9532901225870086e-06,
|
|
"loss": 0.6655,
|
|
"mean_token_accuracy": 0.8172101259231568,
|
|
"num_tokens": 909704935.0,
|
|
"step": 9090
|
|
},
|
|
{
|
|
"entropy": 0.951171875,
|
|
"epoch": 1.2436791034577013,
|
|
"grad_norm": 0.2718321521572687,
|
|
"learning_rate": 1.949767507397492e-06,
|
|
"loss": 0.6915,
|
|
"mean_token_accuracy": 0.8118139028549194,
|
|
"num_tokens": 910672097.0,
|
|
"step": 9100
|
|
},
|
|
{
|
|
"entropy": 0.9875,
|
|
"epoch": 1.2450457837911713,
|
|
"grad_norm": 0.25818569373932215,
|
|
"learning_rate": 1.9462448922079753e-06,
|
|
"loss": 0.716,
|
|
"mean_token_accuracy": 0.8057972669601441,
|
|
"num_tokens": 911652942.0,
|
|
"step": 9110
|
|
},
|
|
{
|
|
"entropy": 0.962109375,
|
|
"epoch": 1.2464124641246412,
|
|
"grad_norm": 0.2540493151156283,
|
|
"learning_rate": 1.942722277018459e-06,
|
|
"loss": 0.7044,
|
|
"mean_token_accuracy": 0.8094434618949891,
|
|
"num_tokens": 912632049.0,
|
|
"step": 9120
|
|
},
|
|
{
|
|
"entropy": 0.991796875,
|
|
"epoch": 1.2477791444581112,
|
|
"grad_norm": 0.29602578761007364,
|
|
"learning_rate": 1.939199661828942e-06,
|
|
"loss": 0.7226,
|
|
"mean_token_accuracy": 0.8033886075019836,
|
|
"num_tokens": 913616040.0,
|
|
"step": 9130
|
|
},
|
|
{
|
|
"entropy": 0.938671875,
|
|
"epoch": 1.2491458247915812,
|
|
"grad_norm": 0.2742197912276864,
|
|
"learning_rate": 1.9356770466394255e-06,
|
|
"loss": 0.6674,
|
|
"mean_token_accuracy": 0.8186192750930786,
|
|
"num_tokens": 914540891.0,
|
|
"step": 9140
|
|
},
|
|
{
|
|
"entropy": 0.919921875,
|
|
"epoch": 1.2505125051250512,
|
|
"grad_norm": 0.26485721537939483,
|
|
"learning_rate": 1.9321544314499086e-06,
|
|
"loss": 0.6985,
|
|
"mean_token_accuracy": 0.8103637933731079,
|
|
"num_tokens": 915532706.0,
|
|
"step": 9150
|
|
},
|
|
{
|
|
"entropy": 0.95234375,
|
|
"epoch": 1.2518791854585212,
|
|
"grad_norm": 0.3170335208366842,
|
|
"learning_rate": 1.9286318162603917e-06,
|
|
"loss": 0.6938,
|
|
"mean_token_accuracy": 0.8089434385299683,
|
|
"num_tokens": 916543389.0,
|
|
"step": 9160
|
|
},
|
|
{
|
|
"entropy": 0.92734375,
|
|
"epoch": 1.2532458657919912,
|
|
"grad_norm": 0.244500547798833,
|
|
"learning_rate": 1.9251092010708753e-06,
|
|
"loss": 0.6648,
|
|
"mean_token_accuracy": 0.8201595962047576,
|
|
"num_tokens": 917543100.0,
|
|
"step": 9170
|
|
},
|
|
{
|
|
"entropy": 0.977734375,
|
|
"epoch": 1.2546125461254611,
|
|
"grad_norm": 0.22929276044336291,
|
|
"learning_rate": 1.9215865858813584e-06,
|
|
"loss": 0.6988,
|
|
"mean_token_accuracy": 0.8103197872638702,
|
|
"num_tokens": 918538535.0,
|
|
"step": 9180
|
|
},
|
|
{
|
|
"entropy": 0.989453125,
|
|
"epoch": 1.2559792264589311,
|
|
"grad_norm": 0.2592743109641769,
|
|
"learning_rate": 1.918063970691842e-06,
|
|
"loss": 0.7212,
|
|
"mean_token_accuracy": 0.8044298589229584,
|
|
"num_tokens": 919540564.0,
|
|
"step": 9190
|
|
},
|
|
{
|
|
"entropy": 0.95625,
|
|
"epoch": 1.2573459067924013,
|
|
"grad_norm": 0.2685699332000855,
|
|
"learning_rate": 1.914541355502325e-06,
|
|
"loss": 0.684,
|
|
"mean_token_accuracy": 0.8114610195159913,
|
|
"num_tokens": 920498208.0,
|
|
"step": 9200
|
|
},
|
|
{
|
|
"entropy": 0.95,
|
|
"epoch": 1.2587125871258713,
|
|
"grad_norm": 0.2468612295561518,
|
|
"learning_rate": 1.9110187403128082e-06,
|
|
"loss": 0.6832,
|
|
"mean_token_accuracy": 0.8113261342048645,
|
|
"num_tokens": 921485540.0,
|
|
"step": 9210
|
|
},
|
|
{
|
|
"entropy": 0.955078125,
|
|
"epoch": 1.2600792674593413,
|
|
"grad_norm": 0.2566239484375049,
|
|
"learning_rate": 1.9074961251232918e-06,
|
|
"loss": 0.7036,
|
|
"mean_token_accuracy": 0.8108052849769593,
|
|
"num_tokens": 922529790.0,
|
|
"step": 9220
|
|
},
|
|
{
|
|
"entropy": 0.944921875,
|
|
"epoch": 1.2614459477928113,
|
|
"grad_norm": 0.2805412174073146,
|
|
"learning_rate": 1.903973509933775e-06,
|
|
"loss": 0.6812,
|
|
"mean_token_accuracy": 0.8121309638023376,
|
|
"num_tokens": 923511480.0,
|
|
"step": 9230
|
|
},
|
|
{
|
|
"entropy": 0.99140625,
|
|
"epoch": 1.2628126281262813,
|
|
"grad_norm": 0.2754347778339092,
|
|
"learning_rate": 1.9004508947442582e-06,
|
|
"loss": 0.7188,
|
|
"mean_token_accuracy": 0.8064523875713349,
|
|
"num_tokens": 924472391.0,
|
|
"step": 9240
|
|
},
|
|
{
|
|
"entropy": 0.925,
|
|
"epoch": 1.2641793084597512,
|
|
"grad_norm": 0.28751079621186787,
|
|
"learning_rate": 1.8969282795547418e-06,
|
|
"loss": 0.667,
|
|
"mean_token_accuracy": 0.8168643474578857,
|
|
"num_tokens": 925446242.0,
|
|
"step": 9250
|
|
},
|
|
{
|
|
"entropy": 0.96484375,
|
|
"epoch": 1.2655459887932212,
|
|
"grad_norm": 0.24939199049067073,
|
|
"learning_rate": 1.8934056643652249e-06,
|
|
"loss": 0.6789,
|
|
"mean_token_accuracy": 0.8134936511516571,
|
|
"num_tokens": 926428154.0,
|
|
"step": 9260
|
|
},
|
|
{
|
|
"entropy": 0.938671875,
|
|
"epoch": 1.2669126691266912,
|
|
"grad_norm": 0.2415392087739518,
|
|
"learning_rate": 1.889883049175708e-06,
|
|
"loss": 0.6762,
|
|
"mean_token_accuracy": 0.8150924682617188,
|
|
"num_tokens": 927412643.0,
|
|
"step": 9270
|
|
},
|
|
{
|
|
"entropy": 0.9109375,
|
|
"epoch": 1.2682793494601612,
|
|
"grad_norm": 0.25997435487805487,
|
|
"learning_rate": 1.8863604339861916e-06,
|
|
"loss": 0.679,
|
|
"mean_token_accuracy": 0.813396292924881,
|
|
"num_tokens": 928410601.0,
|
|
"step": 9280
|
|
},
|
|
{
|
|
"entropy": 0.975,
|
|
"epoch": 1.2696460297936314,
|
|
"grad_norm": 0.2866010553857564,
|
|
"learning_rate": 1.8828378187966747e-06,
|
|
"loss": 0.7317,
|
|
"mean_token_accuracy": 0.8041097819805145,
|
|
"num_tokens": 929431939.0,
|
|
"step": 9290
|
|
},
|
|
{
|
|
"entropy": 0.943359375,
|
|
"epoch": 1.2710127101271014,
|
|
"grad_norm": 0.26392909105133155,
|
|
"learning_rate": 1.8793152036071582e-06,
|
|
"loss": 0.687,
|
|
"mean_token_accuracy": 0.8127434909343719,
|
|
"num_tokens": 930423657.0,
|
|
"step": 9300
|
|
},
|
|
{
|
|
"entropy": 0.919140625,
|
|
"epoch": 1.2723793904605714,
|
|
"grad_norm": 0.25239591128134575,
|
|
"learning_rate": 1.8757925884176414e-06,
|
|
"loss": 0.6942,
|
|
"mean_token_accuracy": 0.8111981868743896,
|
|
"num_tokens": 931442449.0,
|
|
"step": 9310
|
|
},
|
|
{
|
|
"entropy": 0.969140625,
|
|
"epoch": 1.2737460707940413,
|
|
"grad_norm": 0.28242508266482386,
|
|
"learning_rate": 1.8722699732281247e-06,
|
|
"loss": 0.7128,
|
|
"mean_token_accuracy": 0.8051184475421905,
|
|
"num_tokens": 932521052.0,
|
|
"step": 9320
|
|
},
|
|
{
|
|
"entropy": 0.984375,
|
|
"epoch": 1.2751127511275113,
|
|
"grad_norm": 0.2573696964329717,
|
|
"learning_rate": 1.868747358038608e-06,
|
|
"loss": 0.7129,
|
|
"mean_token_accuracy": 0.8066652119159698,
|
|
"num_tokens": 933507370.0,
|
|
"step": 9330
|
|
},
|
|
{
|
|
"entropy": 0.930859375,
|
|
"epoch": 1.2764794314609813,
|
|
"grad_norm": 0.26302052342003046,
|
|
"learning_rate": 1.8652247428490914e-06,
|
|
"loss": 0.7003,
|
|
"mean_token_accuracy": 0.8100949645042419,
|
|
"num_tokens": 934502095.0,
|
|
"step": 9340
|
|
},
|
|
{
|
|
"entropy": 0.981640625,
|
|
"epoch": 1.2778461117944513,
|
|
"grad_norm": 0.28584653551292993,
|
|
"learning_rate": 1.8617021276595745e-06,
|
|
"loss": 0.7166,
|
|
"mean_token_accuracy": 0.8062439024448395,
|
|
"num_tokens": 935487419.0,
|
|
"step": 9350
|
|
},
|
|
{
|
|
"entropy": 0.97109375,
|
|
"epoch": 1.2792127921279213,
|
|
"grad_norm": 0.2813615649254266,
|
|
"learning_rate": 1.858179512470058e-06,
|
|
"loss": 0.6854,
|
|
"mean_token_accuracy": 0.81510488986969,
|
|
"num_tokens": 936471802.0,
|
|
"step": 9360
|
|
},
|
|
{
|
|
"entropy": 0.938671875,
|
|
"epoch": 1.2805794724613913,
|
|
"grad_norm": 0.2576211814287603,
|
|
"learning_rate": 1.8546568972805412e-06,
|
|
"loss": 0.7003,
|
|
"mean_token_accuracy": 0.8114609181880951,
|
|
"num_tokens": 937539862.0,
|
|
"step": 9370
|
|
},
|
|
{
|
|
"entropy": 0.940625,
|
|
"epoch": 1.2819461527948612,
|
|
"grad_norm": 0.2871505139572238,
|
|
"learning_rate": 1.8511342820910245e-06,
|
|
"loss": 0.6701,
|
|
"mean_token_accuracy": 0.8157315075397491,
|
|
"num_tokens": 938529370.0,
|
|
"step": 9380
|
|
},
|
|
{
|
|
"entropy": 0.9296875,
|
|
"epoch": 1.2833128331283312,
|
|
"grad_norm": 0.2559324078165096,
|
|
"learning_rate": 1.8476116669015078e-06,
|
|
"loss": 0.6583,
|
|
"mean_token_accuracy": 0.819229680299759,
|
|
"num_tokens": 939551040.0,
|
|
"step": 9390
|
|
},
|
|
{
|
|
"entropy": 0.935546875,
|
|
"epoch": 1.2846795134618012,
|
|
"grad_norm": 0.2672209156669353,
|
|
"learning_rate": 1.8440890517119912e-06,
|
|
"loss": 0.6527,
|
|
"mean_token_accuracy": 0.8195210874080658,
|
|
"num_tokens": 940566873.0,
|
|
"step": 9400
|
|
},
|
|
{
|
|
"entropy": 0.959375,
|
|
"epoch": 1.2860461937952712,
|
|
"grad_norm": 0.29466168147668753,
|
|
"learning_rate": 1.8405664365224743e-06,
|
|
"loss": 0.6966,
|
|
"mean_token_accuracy": 0.8105703830718994,
|
|
"num_tokens": 941533238.0,
|
|
"step": 9410
|
|
},
|
|
{
|
|
"entropy": 0.996484375,
|
|
"epoch": 1.2874128741287412,
|
|
"grad_norm": 0.27556110163914027,
|
|
"learning_rate": 1.8370438213329578e-06,
|
|
"loss": 0.7054,
|
|
"mean_token_accuracy": 0.8087777316570282,
|
|
"num_tokens": 942585724.0,
|
|
"step": 9420
|
|
},
|
|
{
|
|
"entropy": 0.9703125,
|
|
"epoch": 1.2887795544622112,
|
|
"grad_norm": 0.25591551977820537,
|
|
"learning_rate": 1.833521206143441e-06,
|
|
"loss": 0.6946,
|
|
"mean_token_accuracy": 0.8117185831069946,
|
|
"num_tokens": 943591743.0,
|
|
"step": 9430
|
|
},
|
|
{
|
|
"entropy": 0.999609375,
|
|
"epoch": 1.2901462347956814,
|
|
"grad_norm": 0.2554744356430326,
|
|
"learning_rate": 1.8299985909539245e-06,
|
|
"loss": 0.7073,
|
|
"mean_token_accuracy": 0.8073924481868744,
|
|
"num_tokens": 944552381.0,
|
|
"step": 9440
|
|
},
|
|
{
|
|
"entropy": 0.9984375,
|
|
"epoch": 1.2915129151291513,
|
|
"grad_norm": 0.28833401941297093,
|
|
"learning_rate": 1.8264759757644076e-06,
|
|
"loss": 0.6924,
|
|
"mean_token_accuracy": 0.8114796638488769,
|
|
"num_tokens": 945540560.0,
|
|
"step": 9450
|
|
},
|
|
{
|
|
"entropy": 0.9359375,
|
|
"epoch": 1.2928795954626213,
|
|
"grad_norm": 0.2799888216135877,
|
|
"learning_rate": 1.822953360574891e-06,
|
|
"loss": 0.6959,
|
|
"mean_token_accuracy": 0.8119245827198028,
|
|
"num_tokens": 946489712.0,
|
|
"step": 9460
|
|
},
|
|
{
|
|
"entropy": 0.9296875,
|
|
"epoch": 1.2942462757960913,
|
|
"grad_norm": 0.23730365225989236,
|
|
"learning_rate": 1.8194307453853743e-06,
|
|
"loss": 0.6722,
|
|
"mean_token_accuracy": 0.8160986423492431,
|
|
"num_tokens": 947476787.0,
|
|
"step": 9470
|
|
},
|
|
{
|
|
"entropy": 0.9828125,
|
|
"epoch": 1.2956129561295613,
|
|
"grad_norm": 0.2625260786300304,
|
|
"learning_rate": 1.8159081301958576e-06,
|
|
"loss": 0.6772,
|
|
"mean_token_accuracy": 0.8158578693866729,
|
|
"num_tokens": 948501617.0,
|
|
"step": 9480
|
|
},
|
|
{
|
|
"entropy": 0.944921875,
|
|
"epoch": 1.2969796364630313,
|
|
"grad_norm": 0.22499438033085847,
|
|
"learning_rate": 1.8123855150063408e-06,
|
|
"loss": 0.6846,
|
|
"mean_token_accuracy": 0.8164918839931488,
|
|
"num_tokens": 949519303.0,
|
|
"step": 9490
|
|
},
|
|
{
|
|
"entropy": 0.972265625,
|
|
"epoch": 1.2983463167965013,
|
|
"grad_norm": 0.24419878976577764,
|
|
"learning_rate": 1.8088628998168243e-06,
|
|
"loss": 0.6851,
|
|
"mean_token_accuracy": 0.8133584499359131,
|
|
"num_tokens": 950486819.0,
|
|
"step": 9500
|
|
},
|
|
{
|
|
"entropy": 0.924609375,
|
|
"epoch": 1.2997129971299712,
|
|
"grad_norm": 0.2856762934796823,
|
|
"learning_rate": 1.8053402846273074e-06,
|
|
"loss": 0.6668,
|
|
"mean_token_accuracy": 0.816881388425827,
|
|
"num_tokens": 951473991.0,
|
|
"step": 9510
|
|
},
|
|
{
|
|
"entropy": 0.900390625,
|
|
"epoch": 1.3010796774634412,
|
|
"grad_norm": 0.24350978763630904,
|
|
"learning_rate": 1.8018176694377906e-06,
|
|
"loss": 0.649,
|
|
"mean_token_accuracy": 0.8204694628715515,
|
|
"num_tokens": 952456845.0,
|
|
"step": 9520
|
|
},
|
|
{
|
|
"entropy": 0.9375,
|
|
"epoch": 1.3024463577969114,
|
|
"grad_norm": 0.25069405800068567,
|
|
"learning_rate": 1.798295054248274e-06,
|
|
"loss": 0.6867,
|
|
"mean_token_accuracy": 0.8126821637153625,
|
|
"num_tokens": 953432509.0,
|
|
"step": 9530
|
|
},
|
|
{
|
|
"entropy": 0.942578125,
|
|
"epoch": 1.3038130381303814,
|
|
"grad_norm": 0.29123383026102084,
|
|
"learning_rate": 1.7947724390587572e-06,
|
|
"loss": 0.6808,
|
|
"mean_token_accuracy": 0.8136253297328949,
|
|
"num_tokens": 954412401.0,
|
|
"step": 9540
|
|
},
|
|
{
|
|
"entropy": 0.96796875,
|
|
"epoch": 1.3051797184638514,
|
|
"grad_norm": 0.32208859773622633,
|
|
"learning_rate": 1.7912498238692408e-06,
|
|
"loss": 0.7214,
|
|
"mean_token_accuracy": 0.8051068007946014,
|
|
"num_tokens": 955434387.0,
|
|
"step": 9550
|
|
},
|
|
{
|
|
"entropy": 0.933203125,
|
|
"epoch": 1.3065463987973214,
|
|
"grad_norm": 0.2573631608106852,
|
|
"learning_rate": 1.7877272086797239e-06,
|
|
"loss": 0.6933,
|
|
"mean_token_accuracy": 0.8122036159038544,
|
|
"num_tokens": 956436781.0,
|
|
"step": 9560
|
|
},
|
|
{
|
|
"entropy": 0.961328125,
|
|
"epoch": 1.3079130791307914,
|
|
"grad_norm": 0.2449672792456906,
|
|
"learning_rate": 1.7842045934902072e-06,
|
|
"loss": 0.6884,
|
|
"mean_token_accuracy": 0.811939537525177,
|
|
"num_tokens": 957455135.0,
|
|
"step": 9570
|
|
},
|
|
{
|
|
"entropy": 0.95546875,
|
|
"epoch": 1.3092797594642613,
|
|
"grad_norm": 0.26329349872781793,
|
|
"learning_rate": 1.7806819783006908e-06,
|
|
"loss": 0.7256,
|
|
"mean_token_accuracy": 0.8036964893341064,
|
|
"num_tokens": 958444739.0,
|
|
"step": 9580
|
|
},
|
|
{
|
|
"entropy": 0.9484375,
|
|
"epoch": 1.3106464397977313,
|
|
"grad_norm": 0.25494205140457105,
|
|
"learning_rate": 1.777159363111174e-06,
|
|
"loss": 0.7013,
|
|
"mean_token_accuracy": 0.8105233311653137,
|
|
"num_tokens": 959438087.0,
|
|
"step": 9590
|
|
},
|
|
{
|
|
"entropy": 0.9421875,
|
|
"epoch": 1.3120131201312013,
|
|
"grad_norm": 0.23175685860982087,
|
|
"learning_rate": 1.773636747921657e-06,
|
|
"loss": 0.6793,
|
|
"mean_token_accuracy": 0.8133301913738251,
|
|
"num_tokens": 960385839.0,
|
|
"step": 9600
|
|
},
|
|
{
|
|
"entropy": 0.948828125,
|
|
"epoch": 1.3133798004646713,
|
|
"grad_norm": 0.2679162983771668,
|
|
"learning_rate": 1.7701141327321406e-06,
|
|
"loss": 0.6915,
|
|
"mean_token_accuracy": 0.8112484693527222,
|
|
"num_tokens": 961419505.0,
|
|
"step": 9610
|
|
},
|
|
{
|
|
"entropy": 0.964453125,
|
|
"epoch": 1.3147464807981413,
|
|
"grad_norm": 0.247292090047059,
|
|
"learning_rate": 1.7665915175426237e-06,
|
|
"loss": 0.6811,
|
|
"mean_token_accuracy": 0.8150373935699463,
|
|
"num_tokens": 962470145.0,
|
|
"step": 9620
|
|
},
|
|
{
|
|
"entropy": 0.941796875,
|
|
"epoch": 1.3161131611316113,
|
|
"grad_norm": 0.25756727919756345,
|
|
"learning_rate": 1.763068902353107e-06,
|
|
"loss": 0.6805,
|
|
"mean_token_accuracy": 0.8122191071510315,
|
|
"num_tokens": 963447229.0,
|
|
"step": 9630
|
|
},
|
|
{
|
|
"entropy": 0.976171875,
|
|
"epoch": 1.3174798414650812,
|
|
"grad_norm": 0.27630052542293887,
|
|
"learning_rate": 1.7595462871635904e-06,
|
|
"loss": 0.7334,
|
|
"mean_token_accuracy": 0.8027892947196961,
|
|
"num_tokens": 964422167.0,
|
|
"step": 9640
|
|
},
|
|
{
|
|
"entropy": 0.92734375,
|
|
"epoch": 1.3188465217985512,
|
|
"grad_norm": 0.2698139336134938,
|
|
"learning_rate": 1.7560236719740737e-06,
|
|
"loss": 0.6586,
|
|
"mean_token_accuracy": 0.8181183040142059,
|
|
"num_tokens": 965440668.0,
|
|
"step": 9650
|
|
},
|
|
{
|
|
"entropy": 0.967578125,
|
|
"epoch": 1.3202132021320212,
|
|
"grad_norm": 0.2402491673553072,
|
|
"learning_rate": 1.752501056784557e-06,
|
|
"loss": 0.6822,
|
|
"mean_token_accuracy": 0.816047978401184,
|
|
"num_tokens": 966467260.0,
|
|
"step": 9660
|
|
},
|
|
{
|
|
"entropy": 0.94609375,
|
|
"epoch": 1.3215798824654912,
|
|
"grad_norm": 0.2720386203037853,
|
|
"learning_rate": 1.7489784415950404e-06,
|
|
"loss": 0.6564,
|
|
"mean_token_accuracy": 0.8191603183746338,
|
|
"num_tokens": 967428711.0,
|
|
"step": 9670
|
|
},
|
|
{
|
|
"entropy": 0.928125,
|
|
"epoch": 1.3229465627989614,
|
|
"grad_norm": 0.2446834883926069,
|
|
"learning_rate": 1.7454558264055235e-06,
|
|
"loss": 0.6973,
|
|
"mean_token_accuracy": 0.8089869320392609,
|
|
"num_tokens": 968403916.0,
|
|
"step": 9680
|
|
},
|
|
{
|
|
"entropy": 0.946484375,
|
|
"epoch": 1.3243132431324314,
|
|
"grad_norm": 0.26262997582646413,
|
|
"learning_rate": 1.741933211216007e-06,
|
|
"loss": 0.6766,
|
|
"mean_token_accuracy": 0.8167299449443817,
|
|
"num_tokens": 969366462.0,
|
|
"step": 9690
|
|
},
|
|
{
|
|
"entropy": 0.97265625,
|
|
"epoch": 1.3256799234659014,
|
|
"grad_norm": 0.2694177956976116,
|
|
"learning_rate": 1.7384105960264902e-06,
|
|
"loss": 0.7104,
|
|
"mean_token_accuracy": 0.8089039266109467,
|
|
"num_tokens": 970373679.0,
|
|
"step": 9700
|
|
},
|
|
{
|
|
"entropy": 0.98828125,
|
|
"epoch": 1.3270466037993713,
|
|
"grad_norm": 0.3027052119864617,
|
|
"learning_rate": 1.7348879808369735e-06,
|
|
"loss": 0.7436,
|
|
"mean_token_accuracy": 0.7993192434310913,
|
|
"num_tokens": 971400650.0,
|
|
"step": 9710
|
|
},
|
|
{
|
|
"entropy": 0.9390625,
|
|
"epoch": 1.3284132841328413,
|
|
"grad_norm": 0.27323695184143904,
|
|
"learning_rate": 1.7313653656474568e-06,
|
|
"loss": 0.7118,
|
|
"mean_token_accuracy": 0.8072861909866333,
|
|
"num_tokens": 972421944.0,
|
|
"step": 9720
|
|
},
|
|
{
|
|
"entropy": 0.965234375,
|
|
"epoch": 1.3297799644663113,
|
|
"grad_norm": 0.2624615849460036,
|
|
"learning_rate": 1.7278427504579402e-06,
|
|
"loss": 0.7264,
|
|
"mean_token_accuracy": 0.8064379751682281,
|
|
"num_tokens": 973453605.0,
|
|
"step": 9730
|
|
},
|
|
{
|
|
"entropy": 0.9671875,
|
|
"epoch": 1.3311466447997813,
|
|
"grad_norm": 0.2564071613040881,
|
|
"learning_rate": 1.7243201352684233e-06,
|
|
"loss": 0.696,
|
|
"mean_token_accuracy": 0.8110496461391449,
|
|
"num_tokens": 974495387.0,
|
|
"step": 9740
|
|
},
|
|
{
|
|
"entropy": 0.9703125,
|
|
"epoch": 1.3325133251332513,
|
|
"grad_norm": 0.2852319595579957,
|
|
"learning_rate": 1.7207975200789068e-06,
|
|
"loss": 0.7244,
|
|
"mean_token_accuracy": 0.8050418555736542,
|
|
"num_tokens": 975496025.0,
|
|
"step": 9750
|
|
},
|
|
{
|
|
"entropy": 0.938671875,
|
|
"epoch": 1.3338800054667213,
|
|
"grad_norm": 0.2715601005410492,
|
|
"learning_rate": 1.71727490488939e-06,
|
|
"loss": 0.6941,
|
|
"mean_token_accuracy": 0.8114617824554443,
|
|
"num_tokens": 976445931.0,
|
|
"step": 9760
|
|
},
|
|
{
|
|
"entropy": 0.955859375,
|
|
"epoch": 1.3352466858001915,
|
|
"grad_norm": 0.27581831848149324,
|
|
"learning_rate": 1.7137522896998735e-06,
|
|
"loss": 0.6856,
|
|
"mean_token_accuracy": 0.8117361962795258,
|
|
"num_tokens": 977455378.0,
|
|
"step": 9770
|
|
},
|
|
{
|
|
"entropy": 0.930078125,
|
|
"epoch": 1.3366133661336614,
|
|
"grad_norm": 0.25713049442781294,
|
|
"learning_rate": 1.7102296745103566e-06,
|
|
"loss": 0.6779,
|
|
"mean_token_accuracy": 0.8153348386287689,
|
|
"num_tokens": 978419993.0,
|
|
"step": 9780
|
|
},
|
|
{
|
|
"entropy": 0.95390625,
|
|
"epoch": 1.3379800464671314,
|
|
"grad_norm": 0.26840605805292916,
|
|
"learning_rate": 1.7067070593208398e-06,
|
|
"loss": 0.6946,
|
|
"mean_token_accuracy": 0.8110612452030181,
|
|
"num_tokens": 979452387.0,
|
|
"step": 9790
|
|
},
|
|
{
|
|
"entropy": 0.96015625,
|
|
"epoch": 1.3393467268006014,
|
|
"grad_norm": 0.26160836103311075,
|
|
"learning_rate": 1.7031844441313233e-06,
|
|
"loss": 0.6805,
|
|
"mean_token_accuracy": 0.8150879383087158,
|
|
"num_tokens": 980455389.0,
|
|
"step": 9800
|
|
},
|
|
{
|
|
"entropy": 0.94453125,
|
|
"epoch": 1.3407134071340714,
|
|
"grad_norm": 0.2664052414080119,
|
|
"learning_rate": 1.6996618289418064e-06,
|
|
"loss": 0.7008,
|
|
"mean_token_accuracy": 0.8104224801063538,
|
|
"num_tokens": 981471110.0,
|
|
"step": 9810
|
|
},
|
|
{
|
|
"entropy": 0.958203125,
|
|
"epoch": 1.3420800874675414,
|
|
"grad_norm": 0.26380550343499676,
|
|
"learning_rate": 1.6961392137522898e-06,
|
|
"loss": 0.6897,
|
|
"mean_token_accuracy": 0.8113485097885131,
|
|
"num_tokens": 982422886.0,
|
|
"step": 9820
|
|
},
|
|
{
|
|
"entropy": 0.93515625,
|
|
"epoch": 1.3434467678010114,
|
|
"grad_norm": 0.26254259413409753,
|
|
"learning_rate": 1.6926165985627733e-06,
|
|
"loss": 0.6943,
|
|
"mean_token_accuracy": 0.8118440628051757,
|
|
"num_tokens": 983371506.0,
|
|
"step": 9830
|
|
},
|
|
{
|
|
"entropy": 0.959375,
|
|
"epoch": 1.3448134481344813,
|
|
"grad_norm": 0.2671810482421734,
|
|
"learning_rate": 1.6890939833732564e-06,
|
|
"loss": 0.73,
|
|
"mean_token_accuracy": 0.8035881876945495,
|
|
"num_tokens": 984412138.0,
|
|
"step": 9840
|
|
},
|
|
{
|
|
"entropy": 0.9734375,
|
|
"epoch": 1.3461801284679513,
|
|
"grad_norm": 0.26794650789055646,
|
|
"learning_rate": 1.6855713681837396e-06,
|
|
"loss": 0.7101,
|
|
"mean_token_accuracy": 0.8080667138099671,
|
|
"num_tokens": 985425229.0,
|
|
"step": 9850
|
|
},
|
|
{
|
|
"entropy": 0.95,
|
|
"epoch": 1.3475468088014213,
|
|
"grad_norm": 0.26593335771995136,
|
|
"learning_rate": 1.6820487529942231e-06,
|
|
"loss": 0.6732,
|
|
"mean_token_accuracy": 0.8139142215251922,
|
|
"num_tokens": 986419865.0,
|
|
"step": 9860
|
|
},
|
|
{
|
|
"entropy": 0.930078125,
|
|
"epoch": 1.3489134891348913,
|
|
"grad_norm": 0.29757586164348665,
|
|
"learning_rate": 1.6785261378047062e-06,
|
|
"loss": 0.6668,
|
|
"mean_token_accuracy": 0.8153345644474029,
|
|
"num_tokens": 987419067.0,
|
|
"step": 9870
|
|
},
|
|
{
|
|
"entropy": 0.933984375,
|
|
"epoch": 1.3502801694683613,
|
|
"grad_norm": 0.2585649207328213,
|
|
"learning_rate": 1.6750035226151898e-06,
|
|
"loss": 0.6813,
|
|
"mean_token_accuracy": 0.8138377368450165,
|
|
"num_tokens": 988373727.0,
|
|
"step": 9880
|
|
},
|
|
{
|
|
"entropy": 0.93984375,
|
|
"epoch": 1.3516468498018313,
|
|
"grad_norm": 0.29767532111020995,
|
|
"learning_rate": 1.671480907425673e-06,
|
|
"loss": 0.6923,
|
|
"mean_token_accuracy": 0.8107978820800781,
|
|
"num_tokens": 989387984.0,
|
|
"step": 9890
|
|
},
|
|
{
|
|
"entropy": 0.964453125,
|
|
"epoch": 1.3530135301353012,
|
|
"grad_norm": 0.2655742870986285,
|
|
"learning_rate": 1.6679582922361562e-06,
|
|
"loss": 0.696,
|
|
"mean_token_accuracy": 0.8115530252456665,
|
|
"num_tokens": 990355546.0,
|
|
"step": 9900
|
|
},
|
|
{
|
|
"entropy": 0.967578125,
|
|
"epoch": 1.3543802104687712,
|
|
"grad_norm": 0.26700206609750665,
|
|
"learning_rate": 1.6644356770466396e-06,
|
|
"loss": 0.6834,
|
|
"mean_token_accuracy": 0.8119508862495423,
|
|
"num_tokens": 991370672.0,
|
|
"step": 9910
|
|
},
|
|
{
|
|
"entropy": 0.965625,
|
|
"epoch": 1.3557468908022414,
|
|
"grad_norm": 0.2801616057298888,
|
|
"learning_rate": 1.660913061857123e-06,
|
|
"loss": 0.6927,
|
|
"mean_token_accuracy": 0.8097673773765564,
|
|
"num_tokens": 992381520.0,
|
|
"step": 9920
|
|
},
|
|
{
|
|
"entropy": 0.908203125,
|
|
"epoch": 1.3571135711357114,
|
|
"grad_norm": 0.28572940398311303,
|
|
"learning_rate": 1.657390446667606e-06,
|
|
"loss": 0.6497,
|
|
"mean_token_accuracy": 0.8227623999118805,
|
|
"num_tokens": 993382761.0,
|
|
"step": 9930
|
|
},
|
|
{
|
|
"entropy": 0.939453125,
|
|
"epoch": 1.3584802514691814,
|
|
"grad_norm": 0.25856045973530817,
|
|
"learning_rate": 1.6538678314780896e-06,
|
|
"loss": 0.6898,
|
|
"mean_token_accuracy": 0.813148421049118,
|
|
"num_tokens": 994369777.0,
|
|
"step": 9940
|
|
},
|
|
{
|
|
"entropy": 1.005078125,
|
|
"epoch": 1.3598469318026514,
|
|
"grad_norm": 0.28591403708594204,
|
|
"learning_rate": 1.6503452162885727e-06,
|
|
"loss": 0.7624,
|
|
"mean_token_accuracy": 0.7950933635234833,
|
|
"num_tokens": 995342083.0,
|
|
"step": 9950
|
|
},
|
|
{
|
|
"entropy": 0.9625,
|
|
"epoch": 1.3612136121361214,
|
|
"grad_norm": 0.26548327286281515,
|
|
"learning_rate": 1.646822601099056e-06,
|
|
"loss": 0.6628,
|
|
"mean_token_accuracy": 0.818171101808548,
|
|
"num_tokens": 996342172.0,
|
|
"step": 9960
|
|
},
|
|
{
|
|
"entropy": 0.930859375,
|
|
"epoch": 1.3625802924695913,
|
|
"grad_norm": 0.266836244910516,
|
|
"learning_rate": 1.6432999859095394e-06,
|
|
"loss": 0.6741,
|
|
"mean_token_accuracy": 0.8161128878593444,
|
|
"num_tokens": 997342669.0,
|
|
"step": 9970
|
|
},
|
|
{
|
|
"entropy": 0.984375,
|
|
"epoch": 1.3639469728030613,
|
|
"grad_norm": 0.27280528529219605,
|
|
"learning_rate": 1.6397773707200227e-06,
|
|
"loss": 0.7348,
|
|
"mean_token_accuracy": 0.8015961229801178,
|
|
"num_tokens": 998358263.0,
|
|
"step": 9980
|
|
},
|
|
{
|
|
"entropy": 0.944140625,
|
|
"epoch": 1.3653136531365313,
|
|
"grad_norm": 0.2558652383351031,
|
|
"learning_rate": 1.636254755530506e-06,
|
|
"loss": 0.6856,
|
|
"mean_token_accuracy": 0.8116373300552369,
|
|
"num_tokens": 999320568.0,
|
|
"step": 9990
|
|
},
|
|
{
|
|
"entropy": 0.887109375,
|
|
"epoch": 1.3666803334700013,
|
|
"grad_norm": 0.25061959305237763,
|
|
"learning_rate": 1.6327321403409894e-06,
|
|
"loss": 0.6217,
|
|
"mean_token_accuracy": 0.8263306081295013,
|
|
"num_tokens": 1000320181.0,
|
|
"step": 10000
|
|
},
|
|
{
|
|
"entropy": 0.955859375,
|
|
"epoch": 1.3680470138034715,
|
|
"grad_norm": 0.29968426806133003,
|
|
"learning_rate": 1.6292095251514725e-06,
|
|
"loss": 0.6853,
|
|
"mean_token_accuracy": 0.8138728022575379,
|
|
"num_tokens": 1001302690.0,
|
|
"step": 10010
|
|
},
|
|
{
|
|
"entropy": 0.9796875,
|
|
"epoch": 1.3694136941369415,
|
|
"grad_norm": 0.26196089239922143,
|
|
"learning_rate": 1.625686909961956e-06,
|
|
"loss": 0.7303,
|
|
"mean_token_accuracy": 0.8037286400794983,
|
|
"num_tokens": 1002324480.0,
|
|
"step": 10020
|
|
},
|
|
{
|
|
"entropy": 0.963671875,
|
|
"epoch": 1.3707803744704115,
|
|
"grad_norm": 0.2860586582998407,
|
|
"learning_rate": 1.6221642947724392e-06,
|
|
"loss": 0.7178,
|
|
"mean_token_accuracy": 0.804962944984436,
|
|
"num_tokens": 1003274627.0,
|
|
"step": 10030
|
|
},
|
|
{
|
|
"entropy": 0.985546875,
|
|
"epoch": 1.3721470548038814,
|
|
"grad_norm": 0.2961977034082418,
|
|
"learning_rate": 1.6186416795829223e-06,
|
|
"loss": 0.7024,
|
|
"mean_token_accuracy": 0.8093068599700928,
|
|
"num_tokens": 1004298174.0,
|
|
"step": 10040
|
|
},
|
|
{
|
|
"entropy": 0.9515625,
|
|
"epoch": 1.3735137351373514,
|
|
"grad_norm": 0.28023699396991153,
|
|
"learning_rate": 1.6151190643934058e-06,
|
|
"loss": 0.6769,
|
|
"mean_token_accuracy": 0.8129920244216919,
|
|
"num_tokens": 1005322220.0,
|
|
"step": 10050
|
|
},
|
|
{
|
|
"entropy": 0.927734375,
|
|
"epoch": 1.3748804154708214,
|
|
"grad_norm": 0.26513316225636085,
|
|
"learning_rate": 1.6115964492038892e-06,
|
|
"loss": 0.6806,
|
|
"mean_token_accuracy": 0.8138647556304932,
|
|
"num_tokens": 1006316700.0,
|
|
"step": 10060
|
|
},
|
|
{
|
|
"entropy": 0.966015625,
|
|
"epoch": 1.3762470958042914,
|
|
"grad_norm": 0.26767870831812823,
|
|
"learning_rate": 1.6080738340143723e-06,
|
|
"loss": 0.6758,
|
|
"mean_token_accuracy": 0.8182268381118775,
|
|
"num_tokens": 1007336671.0,
|
|
"step": 10070
|
|
},
|
|
{
|
|
"entropy": 0.92734375,
|
|
"epoch": 1.3776137761377614,
|
|
"grad_norm": 0.2504193235273593,
|
|
"learning_rate": 1.6045512188248559e-06,
|
|
"loss": 0.6891,
|
|
"mean_token_accuracy": 0.8133227705955506,
|
|
"num_tokens": 1008278921.0,
|
|
"step": 10080
|
|
},
|
|
{
|
|
"entropy": 0.965625,
|
|
"epoch": 1.3789804564712314,
|
|
"grad_norm": 0.254941920361182,
|
|
"learning_rate": 1.601028603635339e-06,
|
|
"loss": 0.6782,
|
|
"mean_token_accuracy": 0.8150285422801972,
|
|
"num_tokens": 1009246342.0,
|
|
"step": 10090
|
|
},
|
|
{
|
|
"entropy": 0.9671875,
|
|
"epoch": 1.3803471368047013,
|
|
"grad_norm": 0.295019658237968,
|
|
"learning_rate": 1.5975059884458225e-06,
|
|
"loss": 0.7013,
|
|
"mean_token_accuracy": 0.8096291184425354,
|
|
"num_tokens": 1010299250.0,
|
|
"step": 10100
|
|
},
|
|
{
|
|
"entropy": 0.94609375,
|
|
"epoch": 1.3817138171381713,
|
|
"grad_norm": 0.25898908014951594,
|
|
"learning_rate": 1.5939833732563056e-06,
|
|
"loss": 0.6735,
|
|
"mean_token_accuracy": 0.8150438129901886,
|
|
"num_tokens": 1011305561.0,
|
|
"step": 10110
|
|
},
|
|
{
|
|
"entropy": 0.94921875,
|
|
"epoch": 1.3830804974716413,
|
|
"grad_norm": 0.24653676202870972,
|
|
"learning_rate": 1.5904607580667888e-06,
|
|
"loss": 0.705,
|
|
"mean_token_accuracy": 0.8082956373691559,
|
|
"num_tokens": 1012341918.0,
|
|
"step": 10120
|
|
},
|
|
{
|
|
"entropy": 0.9640625,
|
|
"epoch": 1.3844471778051113,
|
|
"grad_norm": 0.28433105020454513,
|
|
"learning_rate": 1.5869381428772723e-06,
|
|
"loss": 0.7148,
|
|
"mean_token_accuracy": 0.8065854907035828,
|
|
"num_tokens": 1013327756.0,
|
|
"step": 10130
|
|
},
|
|
{
|
|
"entropy": 0.984765625,
|
|
"epoch": 1.3858138581385813,
|
|
"grad_norm": 0.26066389801883844,
|
|
"learning_rate": 1.5834155276877554e-06,
|
|
"loss": 0.7082,
|
|
"mean_token_accuracy": 0.8080582082271576,
|
|
"num_tokens": 1014308706.0,
|
|
"step": 10140
|
|
},
|
|
{
|
|
"entropy": 0.963671875,
|
|
"epoch": 1.3871805384720512,
|
|
"grad_norm": 0.24576997831588335,
|
|
"learning_rate": 1.5798929124982388e-06,
|
|
"loss": 0.7119,
|
|
"mean_token_accuracy": 0.806447160243988,
|
|
"num_tokens": 1015268139.0,
|
|
"step": 10150
|
|
},
|
|
{
|
|
"entropy": 0.939453125,
|
|
"epoch": 1.3885472188055215,
|
|
"grad_norm": 0.2897161960592668,
|
|
"learning_rate": 1.5763702973087221e-06,
|
|
"loss": 0.6698,
|
|
"mean_token_accuracy": 0.8160024225711823,
|
|
"num_tokens": 1016240467.0,
|
|
"step": 10160
|
|
},
|
|
{
|
|
"entropy": 0.913671875,
|
|
"epoch": 1.3899138991389914,
|
|
"grad_norm": 0.3027223951976294,
|
|
"learning_rate": 1.5728476821192054e-06,
|
|
"loss": 0.6696,
|
|
"mean_token_accuracy": 0.8177828788757324,
|
|
"num_tokens": 1017227965.0,
|
|
"step": 10170
|
|
},
|
|
{
|
|
"entropy": 0.9765625,
|
|
"epoch": 1.3912805794724614,
|
|
"grad_norm": 0.2576409330154128,
|
|
"learning_rate": 1.5693250669296886e-06,
|
|
"loss": 0.7066,
|
|
"mean_token_accuracy": 0.8085818290710449,
|
|
"num_tokens": 1018268281.0,
|
|
"step": 10180
|
|
},
|
|
{
|
|
"entropy": 0.928125,
|
|
"epoch": 1.3926472598059314,
|
|
"grad_norm": 0.24235500216113942,
|
|
"learning_rate": 1.5658024517401721e-06,
|
|
"loss": 0.6895,
|
|
"mean_token_accuracy": 0.8128138422966004,
|
|
"num_tokens": 1019262621.0,
|
|
"step": 10190
|
|
},
|
|
{
|
|
"entropy": 0.91640625,
|
|
"epoch": 1.3940139401394014,
|
|
"grad_norm": 0.2477654926036737,
|
|
"learning_rate": 1.5622798365506552e-06,
|
|
"loss": 0.6766,
|
|
"mean_token_accuracy": 0.8168651223182678,
|
|
"num_tokens": 1020287525.0,
|
|
"step": 10200
|
|
},
|
|
{
|
|
"entropy": 0.94921875,
|
|
"epoch": 1.3953806204728714,
|
|
"grad_norm": 0.2688545381603608,
|
|
"learning_rate": 1.5587572213611388e-06,
|
|
"loss": 0.6876,
|
|
"mean_token_accuracy": 0.8134337961673737,
|
|
"num_tokens": 1021281798.0,
|
|
"step": 10210
|
|
},
|
|
{
|
|
"entropy": 0.98046875,
|
|
"epoch": 1.3967473008063414,
|
|
"grad_norm": 0.2994746565667604,
|
|
"learning_rate": 1.555234606171622e-06,
|
|
"loss": 0.6886,
|
|
"mean_token_accuracy": 0.8128946781158447,
|
|
"num_tokens": 1022297013.0,
|
|
"step": 10220
|
|
},
|
|
{
|
|
"entropy": 0.958203125,
|
|
"epoch": 1.3981139811398113,
|
|
"grad_norm": 0.24484761999415905,
|
|
"learning_rate": 1.5517119909821052e-06,
|
|
"loss": 0.6685,
|
|
"mean_token_accuracy": 0.8158941745758057,
|
|
"num_tokens": 1023336531.0,
|
|
"step": 10230
|
|
},
|
|
{
|
|
"entropy": 0.96796875,
|
|
"epoch": 1.3994806614732813,
|
|
"grad_norm": 0.24138656483661383,
|
|
"learning_rate": 1.5481893757925886e-06,
|
|
"loss": 0.706,
|
|
"mean_token_accuracy": 0.8096398532390594,
|
|
"num_tokens": 1024359820.0,
|
|
"step": 10240
|
|
},
|
|
{
|
|
"entropy": 0.969140625,
|
|
"epoch": 1.4008473418067515,
|
|
"grad_norm": 0.3027818338289465,
|
|
"learning_rate": 1.544666760603072e-06,
|
|
"loss": 0.6931,
|
|
"mean_token_accuracy": 0.8109944880008697,
|
|
"num_tokens": 1025313651.0,
|
|
"step": 10250
|
|
},
|
|
{
|
|
"entropy": 0.991015625,
|
|
"epoch": 1.4022140221402215,
|
|
"grad_norm": 0.2883592932453359,
|
|
"learning_rate": 1.541144145413555e-06,
|
|
"loss": 0.7173,
|
|
"mean_token_accuracy": 0.8047029078006744,
|
|
"num_tokens": 1026338791.0,
|
|
"step": 10260
|
|
},
|
|
{
|
|
"entropy": 0.985546875,
|
|
"epoch": 1.4035807024736915,
|
|
"grad_norm": 0.28841780579050197,
|
|
"learning_rate": 1.5376215302240386e-06,
|
|
"loss": 0.6698,
|
|
"mean_token_accuracy": 0.8167034268379212,
|
|
"num_tokens": 1027409356.0,
|
|
"step": 10270
|
|
},
|
|
{
|
|
"entropy": 0.95234375,
|
|
"epoch": 1.4049473828071615,
|
|
"grad_norm": 0.2661271553519002,
|
|
"learning_rate": 1.5340989150345217e-06,
|
|
"loss": 0.6696,
|
|
"mean_token_accuracy": 0.8168787658214569,
|
|
"num_tokens": 1028421417.0,
|
|
"step": 10280
|
|
},
|
|
{
|
|
"entropy": 0.93046875,
|
|
"epoch": 1.4063140631406315,
|
|
"grad_norm": 0.24809517680796253,
|
|
"learning_rate": 1.5305762998450048e-06,
|
|
"loss": 0.6558,
|
|
"mean_token_accuracy": 0.8218139708042145,
|
|
"num_tokens": 1029407757.0,
|
|
"step": 10290
|
|
},
|
|
{
|
|
"entropy": 1.0125,
|
|
"epoch": 1.4076807434741014,
|
|
"grad_norm": 0.30984466487314155,
|
|
"learning_rate": 1.5270536846554884e-06,
|
|
"loss": 0.7305,
|
|
"mean_token_accuracy": 0.8039511680603028,
|
|
"num_tokens": 1030402768.0,
|
|
"step": 10300
|
|
},
|
|
{
|
|
"entropy": 0.98046875,
|
|
"epoch": 1.4090474238075714,
|
|
"grad_norm": 0.29217676990268365,
|
|
"learning_rate": 1.5235310694659717e-06,
|
|
"loss": 0.744,
|
|
"mean_token_accuracy": 0.7992954909801483,
|
|
"num_tokens": 1031421346.0,
|
|
"step": 10310
|
|
},
|
|
{
|
|
"entropy": 0.925,
|
|
"epoch": 1.4104141041410414,
|
|
"grad_norm": 0.28039579753008054,
|
|
"learning_rate": 1.5200084542764548e-06,
|
|
"loss": 0.6555,
|
|
"mean_token_accuracy": 0.8184912264347076,
|
|
"num_tokens": 1032449936.0,
|
|
"step": 10320
|
|
},
|
|
{
|
|
"entropy": 0.9453125,
|
|
"epoch": 1.4117807844745114,
|
|
"grad_norm": 0.28104411146921265,
|
|
"learning_rate": 1.5164858390869384e-06,
|
|
"loss": 0.6666,
|
|
"mean_token_accuracy": 0.8155142843723298,
|
|
"num_tokens": 1033451424.0,
|
|
"step": 10330
|
|
},
|
|
{
|
|
"entropy": 1.032421875,
|
|
"epoch": 1.4131474648079814,
|
|
"grad_norm": 0.2905607659349496,
|
|
"learning_rate": 1.5129632238974215e-06,
|
|
"loss": 0.7613,
|
|
"mean_token_accuracy": 0.7987513542175293,
|
|
"num_tokens": 1034410200.0,
|
|
"step": 10340
|
|
},
|
|
{
|
|
"entropy": 0.955078125,
|
|
"epoch": 1.4145141451414514,
|
|
"grad_norm": 0.24703066531404216,
|
|
"learning_rate": 1.509440608707905e-06,
|
|
"loss": 0.6739,
|
|
"mean_token_accuracy": 0.8153498411178589,
|
|
"num_tokens": 1035442507.0,
|
|
"step": 10350
|
|
},
|
|
{
|
|
"entropy": 1.00078125,
|
|
"epoch": 1.4158808254749213,
|
|
"grad_norm": 0.26566734268761144,
|
|
"learning_rate": 1.5059179935183882e-06,
|
|
"loss": 0.6986,
|
|
"mean_token_accuracy": 0.8089058935642243,
|
|
"num_tokens": 1036434906.0,
|
|
"step": 10360
|
|
},
|
|
{
|
|
"entropy": 0.971875,
|
|
"epoch": 1.4172475058083913,
|
|
"grad_norm": 0.2608586327894044,
|
|
"learning_rate": 1.5023953783288713e-06,
|
|
"loss": 0.6893,
|
|
"mean_token_accuracy": 0.8130507051944733,
|
|
"num_tokens": 1037442931.0,
|
|
"step": 10370
|
|
},
|
|
{
|
|
"entropy": 0.948046875,
|
|
"epoch": 1.4186141861418613,
|
|
"grad_norm": 0.25464739488200716,
|
|
"learning_rate": 1.4988727631393549e-06,
|
|
"loss": 0.6964,
|
|
"mean_token_accuracy": 0.8094175457954407,
|
|
"num_tokens": 1038428896.0,
|
|
"step": 10380
|
|
},
|
|
{
|
|
"entropy": 0.959765625,
|
|
"epoch": 1.4199808664753313,
|
|
"grad_norm": 0.28749052626667615,
|
|
"learning_rate": 1.495350147949838e-06,
|
|
"loss": 0.7158,
|
|
"mean_token_accuracy": 0.8072777390480042,
|
|
"num_tokens": 1039468446.0,
|
|
"step": 10390
|
|
},
|
|
{
|
|
"entropy": 0.933203125,
|
|
"epoch": 1.4213475468088015,
|
|
"grad_norm": 0.2767216507955122,
|
|
"learning_rate": 1.4918275327603213e-06,
|
|
"loss": 0.6701,
|
|
"mean_token_accuracy": 0.8176517844200134,
|
|
"num_tokens": 1040415907.0,
|
|
"step": 10400
|
|
},
|
|
{
|
|
"entropy": 0.92734375,
|
|
"epoch": 1.4227142271422715,
|
|
"grad_norm": 0.24160946010912346,
|
|
"learning_rate": 1.4883049175708047e-06,
|
|
"loss": 0.6816,
|
|
"mean_token_accuracy": 0.8134872257709503,
|
|
"num_tokens": 1041365926.0,
|
|
"step": 10410
|
|
},
|
|
{
|
|
"entropy": 0.96015625,
|
|
"epoch": 1.4240809074757415,
|
|
"grad_norm": 0.25699883548877905,
|
|
"learning_rate": 1.484782302381288e-06,
|
|
"loss": 0.7161,
|
|
"mean_token_accuracy": 0.8058761596679688,
|
|
"num_tokens": 1042376843.0,
|
|
"step": 10420
|
|
},
|
|
{
|
|
"entropy": 0.971484375,
|
|
"epoch": 1.4254475878092114,
|
|
"grad_norm": 0.301730464165311,
|
|
"learning_rate": 1.4812596871917711e-06,
|
|
"loss": 0.6829,
|
|
"mean_token_accuracy": 0.8141513109207154,
|
|
"num_tokens": 1043360046.0,
|
|
"step": 10430
|
|
},
|
|
{
|
|
"entropy": 0.946875,
|
|
"epoch": 1.4268142681426814,
|
|
"grad_norm": 0.24442754100953432,
|
|
"learning_rate": 1.4777370720022547e-06,
|
|
"loss": 0.6961,
|
|
"mean_token_accuracy": 0.8102770209312439,
|
|
"num_tokens": 1044350861.0,
|
|
"step": 10440
|
|
},
|
|
{
|
|
"entropy": 0.944921875,
|
|
"epoch": 1.4281809484761514,
|
|
"grad_norm": 0.27164678661699226,
|
|
"learning_rate": 1.4742144568127378e-06,
|
|
"loss": 0.6908,
|
|
"mean_token_accuracy": 0.8109385371208191,
|
|
"num_tokens": 1045385211.0,
|
|
"step": 10450
|
|
},
|
|
{
|
|
"entropy": 0.926171875,
|
|
"epoch": 1.4295476288096214,
|
|
"grad_norm": 0.26385868709475946,
|
|
"learning_rate": 1.4706918416232213e-06,
|
|
"loss": 0.6952,
|
|
"mean_token_accuracy": 0.8119573652744293,
|
|
"num_tokens": 1046364295.0,
|
|
"step": 10460
|
|
},
|
|
{
|
|
"entropy": 0.948828125,
|
|
"epoch": 1.4309143091430914,
|
|
"grad_norm": 0.23000310560958162,
|
|
"learning_rate": 1.4671692264337045e-06,
|
|
"loss": 0.6929,
|
|
"mean_token_accuracy": 0.8113634943962097,
|
|
"num_tokens": 1047401532.0,
|
|
"step": 10470
|
|
},
|
|
{
|
|
"entropy": 0.936328125,
|
|
"epoch": 1.4322809894765614,
|
|
"grad_norm": 0.23179456217454703,
|
|
"learning_rate": 1.4636466112441878e-06,
|
|
"loss": 0.6997,
|
|
"mean_token_accuracy": 0.8077889025211334,
|
|
"num_tokens": 1048443079.0,
|
|
"step": 10480
|
|
},
|
|
{
|
|
"entropy": 0.93984375,
|
|
"epoch": 1.4336476698100316,
|
|
"grad_norm": 0.24534921566387732,
|
|
"learning_rate": 1.4601239960546711e-06,
|
|
"loss": 0.6799,
|
|
"mean_token_accuracy": 0.8144190728664398,
|
|
"num_tokens": 1049441194.0,
|
|
"step": 10490
|
|
},
|
|
{
|
|
"entropy": 0.978125,
|
|
"epoch": 1.4350143501435015,
|
|
"grad_norm": 0.26322152053036285,
|
|
"learning_rate": 1.4566013808651545e-06,
|
|
"loss": 0.6805,
|
|
"mean_token_accuracy": 0.811837112903595,
|
|
"num_tokens": 1050494420.0,
|
|
"step": 10500
|
|
},
|
|
{
|
|
"entropy": 0.928125,
|
|
"epoch": 1.4363810304769715,
|
|
"grad_norm": 0.2747125498472904,
|
|
"learning_rate": 1.4530787656756376e-06,
|
|
"loss": 0.6541,
|
|
"mean_token_accuracy": 0.8206701159477234,
|
|
"num_tokens": 1051525559.0,
|
|
"step": 10510
|
|
},
|
|
{
|
|
"entropy": 0.964453125,
|
|
"epoch": 1.4377477108104415,
|
|
"grad_norm": 0.27448555364707583,
|
|
"learning_rate": 1.4495561504861211e-06,
|
|
"loss": 0.6851,
|
|
"mean_token_accuracy": 0.8116642832756042,
|
|
"num_tokens": 1052570593.0,
|
|
"step": 10520
|
|
},
|
|
{
|
|
"entropy": 0.967578125,
|
|
"epoch": 1.4391143911439115,
|
|
"grad_norm": 0.25986239358504293,
|
|
"learning_rate": 1.4460335352966043e-06,
|
|
"loss": 0.6908,
|
|
"mean_token_accuracy": 0.8135143160820008,
|
|
"num_tokens": 1053556483.0,
|
|
"step": 10530
|
|
},
|
|
{
|
|
"entropy": 0.99765625,
|
|
"epoch": 1.4404810714773815,
|
|
"grad_norm": 0.2661118320426667,
|
|
"learning_rate": 1.4425109201070876e-06,
|
|
"loss": 0.7646,
|
|
"mean_token_accuracy": 0.7948696255683899,
|
|
"num_tokens": 1054642123.0,
|
|
"step": 10540
|
|
},
|
|
{
|
|
"entropy": 0.9640625,
|
|
"epoch": 1.4418477518108515,
|
|
"grad_norm": 0.28064363529071096,
|
|
"learning_rate": 1.438988304917571e-06,
|
|
"loss": 0.6819,
|
|
"mean_token_accuracy": 0.8138764858245849,
|
|
"num_tokens": 1055670389.0,
|
|
"step": 10550
|
|
},
|
|
{
|
|
"entropy": 0.941796875,
|
|
"epoch": 1.4432144321443214,
|
|
"grad_norm": 0.24383047843735403,
|
|
"learning_rate": 1.4354656897280543e-06,
|
|
"loss": 0.7082,
|
|
"mean_token_accuracy": 0.8074011206626892,
|
|
"num_tokens": 1056685940.0,
|
|
"step": 10560
|
|
},
|
|
{
|
|
"entropy": 0.94765625,
|
|
"epoch": 1.4445811124777914,
|
|
"grad_norm": 0.2573846280813486,
|
|
"learning_rate": 1.4319430745385376e-06,
|
|
"loss": 0.6805,
|
|
"mean_token_accuracy": 0.8128528714179992,
|
|
"num_tokens": 1057681428.0,
|
|
"step": 10570
|
|
},
|
|
{
|
|
"entropy": 0.964453125,
|
|
"epoch": 1.4459477928112614,
|
|
"grad_norm": 0.2528965599330725,
|
|
"learning_rate": 1.428420459349021e-06,
|
|
"loss": 0.6927,
|
|
"mean_token_accuracy": 0.8128062129020691,
|
|
"num_tokens": 1058675715.0,
|
|
"step": 10580
|
|
},
|
|
{
|
|
"entropy": 0.919140625,
|
|
"epoch": 1.4473144731447314,
|
|
"grad_norm": 0.28567232063735865,
|
|
"learning_rate": 1.424897844159504e-06,
|
|
"loss": 0.6436,
|
|
"mean_token_accuracy": 0.8226661145687103,
|
|
"num_tokens": 1059671350.0,
|
|
"step": 10590
|
|
},
|
|
{
|
|
"entropy": 0.9359375,
|
|
"epoch": 1.4486811534782014,
|
|
"grad_norm": 0.2858149957559657,
|
|
"learning_rate": 1.4213752289699876e-06,
|
|
"loss": 0.6703,
|
|
"mean_token_accuracy": 0.8162054419517517,
|
|
"num_tokens": 1060663937.0,
|
|
"step": 10600
|
|
},
|
|
{
|
|
"entropy": 0.930859375,
|
|
"epoch": 1.4500478338116713,
|
|
"grad_norm": 0.2250833497698629,
|
|
"learning_rate": 1.4178526137804707e-06,
|
|
"loss": 0.6771,
|
|
"mean_token_accuracy": 0.8156712770462036,
|
|
"num_tokens": 1061638094.0,
|
|
"step": 10610
|
|
},
|
|
{
|
|
"entropy": 0.944140625,
|
|
"epoch": 1.4514145141451413,
|
|
"grad_norm": 0.2673887928516039,
|
|
"learning_rate": 1.4143299985909538e-06,
|
|
"loss": 0.6618,
|
|
"mean_token_accuracy": 0.8191396057605743,
|
|
"num_tokens": 1062601786.0,
|
|
"step": 10620
|
|
},
|
|
{
|
|
"entropy": 0.937109375,
|
|
"epoch": 1.4527811944786113,
|
|
"grad_norm": 0.2787666940968765,
|
|
"learning_rate": 1.4108073834014374e-06,
|
|
"loss": 0.6667,
|
|
"mean_token_accuracy": 0.8161397933959961,
|
|
"num_tokens": 1063627100.0,
|
|
"step": 10630
|
|
},
|
|
{
|
|
"entropy": 0.93359375,
|
|
"epoch": 1.4541478748120815,
|
|
"grad_norm": 0.2852944978993672,
|
|
"learning_rate": 1.4072847682119205e-06,
|
|
"loss": 0.6899,
|
|
"mean_token_accuracy": 0.8132129848003388,
|
|
"num_tokens": 1064647511.0,
|
|
"step": 10640
|
|
},
|
|
{
|
|
"entropy": 0.943359375,
|
|
"epoch": 1.4555145551455515,
|
|
"grad_norm": 0.24541725232584063,
|
|
"learning_rate": 1.4037621530224039e-06,
|
|
"loss": 0.6808,
|
|
"mean_token_accuracy": 0.8147680580615997,
|
|
"num_tokens": 1065704175.0,
|
|
"step": 10650
|
|
},
|
|
{
|
|
"entropy": 0.93046875,
|
|
"epoch": 1.4568812354790215,
|
|
"grad_norm": 0.24485019047603485,
|
|
"learning_rate": 1.4002395378328872e-06,
|
|
"loss": 0.6289,
|
|
"mean_token_accuracy": 0.8236425161361695,
|
|
"num_tokens": 1066748260.0,
|
|
"step": 10660
|
|
},
|
|
{
|
|
"entropy": 0.919140625,
|
|
"epoch": 1.4582479158124915,
|
|
"grad_norm": 0.28155397752946776,
|
|
"learning_rate": 1.3967169226433705e-06,
|
|
"loss": 0.6555,
|
|
"mean_token_accuracy": 0.8194720685482025,
|
|
"num_tokens": 1067750021.0,
|
|
"step": 10670
|
|
},
|
|
{
|
|
"entropy": 0.9640625,
|
|
"epoch": 1.4596145961459615,
|
|
"grad_norm": 0.25585380869852486,
|
|
"learning_rate": 1.393194307453854e-06,
|
|
"loss": 0.7032,
|
|
"mean_token_accuracy": 0.8094011843204498,
|
|
"num_tokens": 1068768921.0,
|
|
"step": 10680
|
|
},
|
|
{
|
|
"entropy": 0.975390625,
|
|
"epoch": 1.4609812764794314,
|
|
"grad_norm": 0.28816827635606085,
|
|
"learning_rate": 1.3896716922643372e-06,
|
|
"loss": 0.7213,
|
|
"mean_token_accuracy": 0.8041690826416016,
|
|
"num_tokens": 1069750490.0,
|
|
"step": 10690
|
|
},
|
|
{
|
|
"entropy": 0.940234375,
|
|
"epoch": 1.4623479568129014,
|
|
"grad_norm": 0.246877657395546,
|
|
"learning_rate": 1.3861490770748203e-06,
|
|
"loss": 0.6677,
|
|
"mean_token_accuracy": 0.8177811026573181,
|
|
"num_tokens": 1070764757.0,
|
|
"step": 10700
|
|
},
|
|
{
|
|
"entropy": 0.962109375,
|
|
"epoch": 1.4637146371463714,
|
|
"grad_norm": 0.3171773669531747,
|
|
"learning_rate": 1.3826264618853039e-06,
|
|
"loss": 0.6996,
|
|
"mean_token_accuracy": 0.8093445599079132,
|
|
"num_tokens": 1071707028.0,
|
|
"step": 10710
|
|
},
|
|
{
|
|
"entropy": 0.973046875,
|
|
"epoch": 1.4650813174798414,
|
|
"grad_norm": 0.2621768104830365,
|
|
"learning_rate": 1.379103846695787e-06,
|
|
"loss": 0.7089,
|
|
"mean_token_accuracy": 0.8075982391834259,
|
|
"num_tokens": 1072782291.0,
|
|
"step": 10720
|
|
},
|
|
{
|
|
"entropy": 0.957421875,
|
|
"epoch": 1.4664479978133116,
|
|
"grad_norm": 0.2818197269406066,
|
|
"learning_rate": 1.3755812315062703e-06,
|
|
"loss": 0.7001,
|
|
"mean_token_accuracy": 0.8092041671276092,
|
|
"num_tokens": 1073775705.0,
|
|
"step": 10730
|
|
},
|
|
{
|
|
"entropy": 0.9375,
|
|
"epoch": 1.4678146781467816,
|
|
"grad_norm": 0.266847999282379,
|
|
"learning_rate": 1.3720586163167537e-06,
|
|
"loss": 0.6899,
|
|
"mean_token_accuracy": 0.8114394247531891,
|
|
"num_tokens": 1074768516.0,
|
|
"step": 10740
|
|
},
|
|
{
|
|
"entropy": 0.9796875,
|
|
"epoch": 1.4691813584802516,
|
|
"grad_norm": 0.300410899896802,
|
|
"learning_rate": 1.368536001127237e-06,
|
|
"loss": 0.7316,
|
|
"mean_token_accuracy": 0.805228465795517,
|
|
"num_tokens": 1075736584.0,
|
|
"step": 10750
|
|
},
|
|
{
|
|
"entropy": 0.941015625,
|
|
"epoch": 1.4705480388137215,
|
|
"grad_norm": 0.24906096281150822,
|
|
"learning_rate": 1.3650133859377201e-06,
|
|
"loss": 0.6785,
|
|
"mean_token_accuracy": 0.8122552454471588,
|
|
"num_tokens": 1076732968.0,
|
|
"step": 10760
|
|
},
|
|
{
|
|
"entropy": 0.953515625,
|
|
"epoch": 1.4719147191471915,
|
|
"grad_norm": 0.2839243862501262,
|
|
"learning_rate": 1.3614907707482037e-06,
|
|
"loss": 0.6934,
|
|
"mean_token_accuracy": 0.8109679996967316,
|
|
"num_tokens": 1077705908.0,
|
|
"step": 10770
|
|
},
|
|
{
|
|
"entropy": 1.027734375,
|
|
"epoch": 1.4732813994806615,
|
|
"grad_norm": 0.28037761495997787,
|
|
"learning_rate": 1.3579681555586868e-06,
|
|
"loss": 0.7342,
|
|
"mean_token_accuracy": 0.8035187661647797,
|
|
"num_tokens": 1078728964.0,
|
|
"step": 10780
|
|
},
|
|
{
|
|
"entropy": 0.9640625,
|
|
"epoch": 1.4746480798141315,
|
|
"grad_norm": 0.23547786356721298,
|
|
"learning_rate": 1.3544455403691703e-06,
|
|
"loss": 0.6881,
|
|
"mean_token_accuracy": 0.8138183891773224,
|
|
"num_tokens": 1079762618.0,
|
|
"step": 10790
|
|
},
|
|
{
|
|
"entropy": 0.94296875,
|
|
"epoch": 1.4760147601476015,
|
|
"grad_norm": 0.2659777303164802,
|
|
"learning_rate": 1.3509229251796535e-06,
|
|
"loss": 0.6741,
|
|
"mean_token_accuracy": 0.8160513043403625,
|
|
"num_tokens": 1080719511.0,
|
|
"step": 10800
|
|
},
|
|
{
|
|
"entropy": 0.965234375,
|
|
"epoch": 1.4773814404810715,
|
|
"grad_norm": 0.2615719823707963,
|
|
"learning_rate": 1.3474003099901368e-06,
|
|
"loss": 0.6979,
|
|
"mean_token_accuracy": 0.8098881602287292,
|
|
"num_tokens": 1081698936.0,
|
|
"step": 10810
|
|
},
|
|
{
|
|
"entropy": 0.942578125,
|
|
"epoch": 1.4787481208145414,
|
|
"grad_norm": 0.24749944390880813,
|
|
"learning_rate": 1.3438776948006201e-06,
|
|
"loss": 0.673,
|
|
"mean_token_accuracy": 0.8160821378231049,
|
|
"num_tokens": 1082686698.0,
|
|
"step": 10820
|
|
},
|
|
{
|
|
"entropy": 0.919140625,
|
|
"epoch": 1.4801148011480114,
|
|
"grad_norm": 0.2548199570356021,
|
|
"learning_rate": 1.3403550796111035e-06,
|
|
"loss": 0.6208,
|
|
"mean_token_accuracy": 0.8275293409824371,
|
|
"num_tokens": 1083694783.0,
|
|
"step": 10830
|
|
},
|
|
{
|
|
"entropy": 0.9640625,
|
|
"epoch": 1.4814814814814814,
|
|
"grad_norm": 0.26155040309348204,
|
|
"learning_rate": 1.3368324644215866e-06,
|
|
"loss": 0.6834,
|
|
"mean_token_accuracy": 0.8125834584236145,
|
|
"num_tokens": 1084697142.0,
|
|
"step": 10840
|
|
},
|
|
{
|
|
"entropy": 0.90859375,
|
|
"epoch": 1.4828481618149514,
|
|
"grad_norm": 0.24830963951869203,
|
|
"learning_rate": 1.3333098492320701e-06,
|
|
"loss": 0.6725,
|
|
"mean_token_accuracy": 0.8154646575450897,
|
|
"num_tokens": 1085719990.0,
|
|
"step": 10850
|
|
},
|
|
{
|
|
"entropy": 0.97109375,
|
|
"epoch": 1.4842148421484214,
|
|
"grad_norm": 0.3011663417773359,
|
|
"learning_rate": 1.3297872340425533e-06,
|
|
"loss": 0.7304,
|
|
"mean_token_accuracy": 0.8026747226715087,
|
|
"num_tokens": 1086693132.0,
|
|
"step": 10860
|
|
},
|
|
{
|
|
"entropy": 0.971875,
|
|
"epoch": 1.4855815224818913,
|
|
"grad_norm": 0.27091522683773306,
|
|
"learning_rate": 1.3262646188530364e-06,
|
|
"loss": 0.7167,
|
|
"mean_token_accuracy": 0.8067846715450286,
|
|
"num_tokens": 1087739681.0,
|
|
"step": 10870
|
|
},
|
|
{
|
|
"entropy": 0.944921875,
|
|
"epoch": 1.4869482028153616,
|
|
"grad_norm": 0.2401758354988089,
|
|
"learning_rate": 1.32274200366352e-06,
|
|
"loss": 0.696,
|
|
"mean_token_accuracy": 0.8122277081012725,
|
|
"num_tokens": 1088737790.0,
|
|
"step": 10880
|
|
},
|
|
{
|
|
"entropy": 0.932421875,
|
|
"epoch": 1.4883148831488315,
|
|
"grad_norm": 0.25239562676114735,
|
|
"learning_rate": 1.319219388474003e-06,
|
|
"loss": 0.6801,
|
|
"mean_token_accuracy": 0.8142931044101716,
|
|
"num_tokens": 1089700014.0,
|
|
"step": 10890
|
|
},
|
|
{
|
|
"entropy": 0.996875,
|
|
"epoch": 1.4896815634823015,
|
|
"grad_norm": 0.26164420779723035,
|
|
"learning_rate": 1.3156967732844866e-06,
|
|
"loss": 0.7256,
|
|
"mean_token_accuracy": 0.8042964577674866,
|
|
"num_tokens": 1090707376.0,
|
|
"step": 10900
|
|
},
|
|
{
|
|
"entropy": 0.921875,
|
|
"epoch": 1.4910482438157715,
|
|
"grad_norm": 0.26567649466065074,
|
|
"learning_rate": 1.31217415809497e-06,
|
|
"loss": 0.6428,
|
|
"mean_token_accuracy": 0.8229375839233398,
|
|
"num_tokens": 1091734576.0,
|
|
"step": 10910
|
|
},
|
|
{
|
|
"entropy": 0.9828125,
|
|
"epoch": 1.4924149241492415,
|
|
"grad_norm": 0.26598951123944325,
|
|
"learning_rate": 1.308651542905453e-06,
|
|
"loss": 0.7267,
|
|
"mean_token_accuracy": 0.8023374736309051,
|
|
"num_tokens": 1092800189.0,
|
|
"step": 10920
|
|
},
|
|
{
|
|
"entropy": 0.94140625,
|
|
"epoch": 1.4937816044827115,
|
|
"grad_norm": 0.26999080430241645,
|
|
"learning_rate": 1.3051289277159366e-06,
|
|
"loss": 0.6767,
|
|
"mean_token_accuracy": 0.8138288497924805,
|
|
"num_tokens": 1093775552.0,
|
|
"step": 10930
|
|
},
|
|
{
|
|
"entropy": 0.943359375,
|
|
"epoch": 1.4951482848161814,
|
|
"grad_norm": 0.2924263551155861,
|
|
"learning_rate": 1.3016063125264197e-06,
|
|
"loss": 0.7076,
|
|
"mean_token_accuracy": 0.810584443807602,
|
|
"num_tokens": 1094746366.0,
|
|
"step": 10940
|
|
},
|
|
{
|
|
"entropy": 0.969140625,
|
|
"epoch": 1.4965149651496514,
|
|
"grad_norm": 0.2846541719040715,
|
|
"learning_rate": 1.2980836973369029e-06,
|
|
"loss": 0.7216,
|
|
"mean_token_accuracy": 0.8020740807056427,
|
|
"num_tokens": 1095721115.0,
|
|
"step": 10950
|
|
},
|
|
{
|
|
"entropy": 0.935546875,
|
|
"epoch": 1.4978816454831214,
|
|
"grad_norm": 0.3006126691128295,
|
|
"learning_rate": 1.2945610821473864e-06,
|
|
"loss": 0.6882,
|
|
"mean_token_accuracy": 0.8124734103679657,
|
|
"num_tokens": 1096675122.0,
|
|
"step": 10960
|
|
},
|
|
{
|
|
"entropy": 0.934375,
|
|
"epoch": 1.4992483258165916,
|
|
"grad_norm": 0.26423510574437886,
|
|
"learning_rate": 1.2910384669578695e-06,
|
|
"loss": 0.6421,
|
|
"mean_token_accuracy": 0.8240252792835235,
|
|
"num_tokens": 1097680195.0,
|
|
"step": 10970
|
|
},
|
|
{
|
|
"entropy": 0.927734375,
|
|
"epoch": 1.5006150061500616,
|
|
"grad_norm": 0.28224035246684404,
|
|
"learning_rate": 1.2875158517683529e-06,
|
|
"loss": 0.6917,
|
|
"mean_token_accuracy": 0.8116567969322205,
|
|
"num_tokens": 1098654530.0,
|
|
"step": 10980
|
|
},
|
|
{
|
|
"entropy": 0.96875,
|
|
"epoch": 1.5019816864835316,
|
|
"grad_norm": 0.28475056274540167,
|
|
"learning_rate": 1.2839932365788362e-06,
|
|
"loss": 0.7174,
|
|
"mean_token_accuracy": 0.8054907560348511,
|
|
"num_tokens": 1099644954.0,
|
|
"step": 10990
|
|
},
|
|
{
|
|
"entropy": 0.9515625,
|
|
"epoch": 1.5033483668170016,
|
|
"grad_norm": 0.2215045027095942,
|
|
"learning_rate": 1.2804706213893195e-06,
|
|
"loss": 0.6832,
|
|
"mean_token_accuracy": 0.8144975244998932,
|
|
"num_tokens": 1100670867.0,
|
|
"step": 11000
|
|
},
|
|
{
|
|
"entropy": 0.987890625,
|
|
"epoch": 1.5047150471504716,
|
|
"grad_norm": 0.2652026165892719,
|
|
"learning_rate": 1.2769480061998029e-06,
|
|
"loss": 0.7105,
|
|
"mean_token_accuracy": 0.8094404101371765,
|
|
"num_tokens": 1101669252.0,
|
|
"step": 11010
|
|
},
|
|
{
|
|
"entropy": 0.937109375,
|
|
"epoch": 1.5060817274839415,
|
|
"grad_norm": 0.24933782087062303,
|
|
"learning_rate": 1.2734253910102862e-06,
|
|
"loss": 0.668,
|
|
"mean_token_accuracy": 0.8178416192531586,
|
|
"num_tokens": 1102724602.0,
|
|
"step": 11020
|
|
},
|
|
{
|
|
"entropy": 0.956640625,
|
|
"epoch": 1.5074484078174115,
|
|
"grad_norm": 0.24890640715660928,
|
|
"learning_rate": 1.2699027758207693e-06,
|
|
"loss": 0.6744,
|
|
"mean_token_accuracy": 0.8159781038761139,
|
|
"num_tokens": 1103718122.0,
|
|
"step": 11030
|
|
},
|
|
{
|
|
"entropy": 0.988671875,
|
|
"epoch": 1.5088150881508815,
|
|
"grad_norm": 0.2669180734797891,
|
|
"learning_rate": 1.2663801606312529e-06,
|
|
"loss": 0.7312,
|
|
"mean_token_accuracy": 0.8007203340530396,
|
|
"num_tokens": 1104799231.0,
|
|
"step": 11040
|
|
},
|
|
{
|
|
"entropy": 0.9234375,
|
|
"epoch": 1.5101817684843515,
|
|
"grad_norm": 0.27463583083939347,
|
|
"learning_rate": 1.262857545441736e-06,
|
|
"loss": 0.6725,
|
|
"mean_token_accuracy": 0.816204434633255,
|
|
"num_tokens": 1105748944.0,
|
|
"step": 11050
|
|
},
|
|
{
|
|
"entropy": 0.962109375,
|
|
"epoch": 1.5115484488178215,
|
|
"grad_norm": 0.24898295793364675,
|
|
"learning_rate": 1.2593349302522193e-06,
|
|
"loss": 0.6862,
|
|
"mean_token_accuracy": 0.8116687417030335,
|
|
"num_tokens": 1106750859.0,
|
|
"step": 11060
|
|
},
|
|
{
|
|
"entropy": 0.96171875,
|
|
"epoch": 1.5129151291512914,
|
|
"grad_norm": 0.3034817448631733,
|
|
"learning_rate": 1.2558123150627027e-06,
|
|
"loss": 0.674,
|
|
"mean_token_accuracy": 0.8148876667022705,
|
|
"num_tokens": 1107766800.0,
|
|
"step": 11070
|
|
},
|
|
{
|
|
"entropy": 0.976171875,
|
|
"epoch": 1.5142818094847614,
|
|
"grad_norm": 0.30787236263452394,
|
|
"learning_rate": 1.252289699873186e-06,
|
|
"loss": 0.7241,
|
|
"mean_token_accuracy": 0.8046450138092041,
|
|
"num_tokens": 1108772544.0,
|
|
"step": 11080
|
|
},
|
|
{
|
|
"entropy": 0.98046875,
|
|
"epoch": 1.5156484898182314,
|
|
"grad_norm": 0.3046234069204083,
|
|
"learning_rate": 1.2487670846836693e-06,
|
|
"loss": 0.7069,
|
|
"mean_token_accuracy": 0.8064968466758728,
|
|
"num_tokens": 1109784879.0,
|
|
"step": 11090
|
|
},
|
|
{
|
|
"entropy": 1.00625,
|
|
"epoch": 1.5170151701517014,
|
|
"grad_norm": 0.3051444544482757,
|
|
"learning_rate": 1.2452444694941527e-06,
|
|
"loss": 0.7835,
|
|
"mean_token_accuracy": 0.791454267501831,
|
|
"num_tokens": 1110755323.0,
|
|
"step": 11100
|
|
},
|
|
{
|
|
"entropy": 0.974609375,
|
|
"epoch": 1.5183818504851714,
|
|
"grad_norm": 0.23196078943245121,
|
|
"learning_rate": 1.2417218543046358e-06,
|
|
"loss": 0.7101,
|
|
"mean_token_accuracy": 0.8095407783985138,
|
|
"num_tokens": 1111752070.0,
|
|
"step": 11110
|
|
},
|
|
{
|
|
"entropy": 0.9328125,
|
|
"epoch": 1.5197485308186414,
|
|
"grad_norm": 0.2618098649874603,
|
|
"learning_rate": 1.2381992391151191e-06,
|
|
"loss": 0.7038,
|
|
"mean_token_accuracy": 0.810538935661316,
|
|
"num_tokens": 1112742919.0,
|
|
"step": 11120
|
|
},
|
|
{
|
|
"entropy": 0.941015625,
|
|
"epoch": 1.5211152111521116,
|
|
"grad_norm": 0.2759129617240964,
|
|
"learning_rate": 1.2346766239256025e-06,
|
|
"loss": 0.7041,
|
|
"mean_token_accuracy": 0.8087470233440399,
|
|
"num_tokens": 1113773062.0,
|
|
"step": 11130
|
|
},
|
|
{
|
|
"entropy": 0.940625,
|
|
"epoch": 1.5224818914855816,
|
|
"grad_norm": 0.2560733601510472,
|
|
"learning_rate": 1.2311540087360858e-06,
|
|
"loss": 0.6643,
|
|
"mean_token_accuracy": 0.8165883123874664,
|
|
"num_tokens": 1114820138.0,
|
|
"step": 11140
|
|
},
|
|
{
|
|
"entropy": 0.94296875,
|
|
"epoch": 1.5238485718190515,
|
|
"grad_norm": 0.27278958956035126,
|
|
"learning_rate": 1.2276313935465691e-06,
|
|
"loss": 0.6677,
|
|
"mean_token_accuracy": 0.8177263736724854,
|
|
"num_tokens": 1115814461.0,
|
|
"step": 11150
|
|
},
|
|
{
|
|
"entropy": 0.91796875,
|
|
"epoch": 1.5252152521525215,
|
|
"grad_norm": 0.2551423801080569,
|
|
"learning_rate": 1.2241087783570525e-06,
|
|
"loss": 0.6734,
|
|
"mean_token_accuracy": 0.8151315748691559,
|
|
"num_tokens": 1116817324.0,
|
|
"step": 11160
|
|
},
|
|
{
|
|
"entropy": 0.95546875,
|
|
"epoch": 1.5265819324859915,
|
|
"grad_norm": 0.23652878767493904,
|
|
"learning_rate": 1.2205861631675358e-06,
|
|
"loss": 0.6861,
|
|
"mean_token_accuracy": 0.8125601887702942,
|
|
"num_tokens": 1117823984.0,
|
|
"step": 11170
|
|
},
|
|
{
|
|
"entropy": 1.017578125,
|
|
"epoch": 1.5279486128194615,
|
|
"grad_norm": 0.3125269504565064,
|
|
"learning_rate": 1.217063547978019e-06,
|
|
"loss": 0.7255,
|
|
"mean_token_accuracy": 0.8039110362529754,
|
|
"num_tokens": 1118804345.0,
|
|
"step": 11180
|
|
},
|
|
{
|
|
"entropy": 0.94453125,
|
|
"epoch": 1.5293152931529317,
|
|
"grad_norm": 0.25650797231462313,
|
|
"learning_rate": 1.2135409327885023e-06,
|
|
"loss": 0.6964,
|
|
"mean_token_accuracy": 0.8103684604167938,
|
|
"num_tokens": 1119802939.0,
|
|
"step": 11190
|
|
},
|
|
{
|
|
"entropy": 0.925,
|
|
"epoch": 1.5306819734864017,
|
|
"grad_norm": 0.2593231035451415,
|
|
"learning_rate": 1.2100183175989856e-06,
|
|
"loss": 0.6649,
|
|
"mean_token_accuracy": 0.8177141368389129,
|
|
"num_tokens": 1120777771.0,
|
|
"step": 11200
|
|
},
|
|
{
|
|
"entropy": 0.91484375,
|
|
"epoch": 1.5320486538198717,
|
|
"grad_norm": 0.24775307832307808,
|
|
"learning_rate": 1.206495702409469e-06,
|
|
"loss": 0.6591,
|
|
"mean_token_accuracy": 0.8191110134124756,
|
|
"num_tokens": 1121758238.0,
|
|
"step": 11210
|
|
},
|
|
{
|
|
"entropy": 0.89921875,
|
|
"epoch": 1.5334153341533416,
|
|
"grad_norm": 0.30302306996774,
|
|
"learning_rate": 1.202973087219952e-06,
|
|
"loss": 0.6491,
|
|
"mean_token_accuracy": 0.8194020509719848,
|
|
"num_tokens": 1122757820.0,
|
|
"step": 11220
|
|
},
|
|
{
|
|
"entropy": 0.924609375,
|
|
"epoch": 1.5347820144868116,
|
|
"grad_norm": 0.27438820227700383,
|
|
"learning_rate": 1.1994504720304354e-06,
|
|
"loss": 0.6985,
|
|
"mean_token_accuracy": 0.8100414037704468,
|
|
"num_tokens": 1123784136.0,
|
|
"step": 11230
|
|
},
|
|
{
|
|
"entropy": 0.91328125,
|
|
"epoch": 1.5361486948202816,
|
|
"grad_norm": 0.28150333761274454,
|
|
"learning_rate": 1.1959278568409187e-06,
|
|
"loss": 0.674,
|
|
"mean_token_accuracy": 0.8138809621334075,
|
|
"num_tokens": 1124819123.0,
|
|
"step": 11240
|
|
},
|
|
{
|
|
"entropy": 0.919921875,
|
|
"epoch": 1.5375153751537516,
|
|
"grad_norm": 0.2715610456791992,
|
|
"learning_rate": 1.192405241651402e-06,
|
|
"loss": 0.662,
|
|
"mean_token_accuracy": 0.8167669534683227,
|
|
"num_tokens": 1125826807.0,
|
|
"step": 11250
|
|
},
|
|
{
|
|
"entropy": 0.9515625,
|
|
"epoch": 1.5388820554872216,
|
|
"grad_norm": 0.2758668658808208,
|
|
"learning_rate": 1.1888826264618854e-06,
|
|
"loss": 0.6941,
|
|
"mean_token_accuracy": 0.8102132022380829,
|
|
"num_tokens": 1126817641.0,
|
|
"step": 11260
|
|
},
|
|
{
|
|
"entropy": 0.94296875,
|
|
"epoch": 1.5402487358206916,
|
|
"grad_norm": 0.2736644487049823,
|
|
"learning_rate": 1.1853600112723687e-06,
|
|
"loss": 0.687,
|
|
"mean_token_accuracy": 0.8125528752803802,
|
|
"num_tokens": 1127842712.0,
|
|
"step": 11270
|
|
},
|
|
{
|
|
"entropy": 0.92578125,
|
|
"epoch": 1.5416154161541615,
|
|
"grad_norm": 0.28097506308385983,
|
|
"learning_rate": 1.181837396082852e-06,
|
|
"loss": 0.6596,
|
|
"mean_token_accuracy": 0.8183539271354675,
|
|
"num_tokens": 1128863816.0,
|
|
"step": 11280
|
|
},
|
|
{
|
|
"entropy": 0.924609375,
|
|
"epoch": 1.5429820964876315,
|
|
"grad_norm": 0.2582635750644127,
|
|
"learning_rate": 1.1783147808933352e-06,
|
|
"loss": 0.6864,
|
|
"mean_token_accuracy": 0.8127600491046906,
|
|
"num_tokens": 1129869633.0,
|
|
"step": 11290
|
|
},
|
|
{
|
|
"entropy": 1.006640625,
|
|
"epoch": 1.5443487768211015,
|
|
"grad_norm": 0.2764249033252939,
|
|
"learning_rate": 1.1747921657038185e-06,
|
|
"loss": 0.7342,
|
|
"mean_token_accuracy": 0.801458477973938,
|
|
"num_tokens": 1130865671.0,
|
|
"step": 11300
|
|
},
|
|
{
|
|
"entropy": 0.919921875,
|
|
"epoch": 1.5457154571545715,
|
|
"grad_norm": 0.27422856180620714,
|
|
"learning_rate": 1.1712695505143019e-06,
|
|
"loss": 0.6449,
|
|
"mean_token_accuracy": 0.8221640765666962,
|
|
"num_tokens": 1131846947.0,
|
|
"step": 11310
|
|
},
|
|
{
|
|
"entropy": 0.97265625,
|
|
"epoch": 1.5470821374880415,
|
|
"grad_norm": 0.2747375164329027,
|
|
"learning_rate": 1.1677469353247852e-06,
|
|
"loss": 0.6835,
|
|
"mean_token_accuracy": 0.8148866295814514,
|
|
"num_tokens": 1132793844.0,
|
|
"step": 11320
|
|
},
|
|
{
|
|
"entropy": 0.96796875,
|
|
"epoch": 1.5484488178215114,
|
|
"grad_norm": 0.25287721610277547,
|
|
"learning_rate": 1.1642243201352685e-06,
|
|
"loss": 0.7172,
|
|
"mean_token_accuracy": 0.8040881276130676,
|
|
"num_tokens": 1133827525.0,
|
|
"step": 11330
|
|
},
|
|
{
|
|
"entropy": 0.93203125,
|
|
"epoch": 1.5498154981549814,
|
|
"grad_norm": 0.26770029717786226,
|
|
"learning_rate": 1.1607017049457519e-06,
|
|
"loss": 0.6901,
|
|
"mean_token_accuracy": 0.8108852863311767,
|
|
"num_tokens": 1134851611.0,
|
|
"step": 11340
|
|
},
|
|
{
|
|
"entropy": 0.967578125,
|
|
"epoch": 1.5511821784884514,
|
|
"grad_norm": 0.27057648242103893,
|
|
"learning_rate": 1.1571790897562352e-06,
|
|
"loss": 0.7259,
|
|
"mean_token_accuracy": 0.8047656178474426,
|
|
"num_tokens": 1135812714.0,
|
|
"step": 11350
|
|
},
|
|
{
|
|
"entropy": 0.94375,
|
|
"epoch": 1.5525488588219214,
|
|
"grad_norm": 0.26160279878863324,
|
|
"learning_rate": 1.1536564745667183e-06,
|
|
"loss": 0.6881,
|
|
"mean_token_accuracy": 0.8126548051834106,
|
|
"num_tokens": 1136794405.0,
|
|
"step": 11360
|
|
},
|
|
{
|
|
"entropy": 0.963671875,
|
|
"epoch": 1.5539155391553916,
|
|
"grad_norm": 0.27809650374534767,
|
|
"learning_rate": 1.1501338593772017e-06,
|
|
"loss": 0.7071,
|
|
"mean_token_accuracy": 0.8093691229820251,
|
|
"num_tokens": 1137769619.0,
|
|
"step": 11370
|
|
},
|
|
{
|
|
"entropy": 0.983984375,
|
|
"epoch": 1.5552822194888616,
|
|
"grad_norm": 0.2815473632590634,
|
|
"learning_rate": 1.146611244187685e-06,
|
|
"loss": 0.7002,
|
|
"mean_token_accuracy": 0.8108034610748291,
|
|
"num_tokens": 1138799883.0,
|
|
"step": 11380
|
|
},
|
|
{
|
|
"entropy": 0.95078125,
|
|
"epoch": 1.5566488998223316,
|
|
"grad_norm": 0.26064352931003737,
|
|
"learning_rate": 1.1430886289981683e-06,
|
|
"loss": 0.7093,
|
|
"mean_token_accuracy": 0.8055069386959076,
|
|
"num_tokens": 1139800900.0,
|
|
"step": 11390
|
|
},
|
|
{
|
|
"entropy": 0.923046875,
|
|
"epoch": 1.5580155801558015,
|
|
"grad_norm": 0.2842661075243117,
|
|
"learning_rate": 1.1395660138086517e-06,
|
|
"loss": 0.6567,
|
|
"mean_token_accuracy": 0.818253630399704,
|
|
"num_tokens": 1140741463.0,
|
|
"step": 11400
|
|
},
|
|
{
|
|
"entropy": 0.947265625,
|
|
"epoch": 1.5593822604892715,
|
|
"grad_norm": 0.25848326806775224,
|
|
"learning_rate": 1.136043398619135e-06,
|
|
"loss": 0.6668,
|
|
"mean_token_accuracy": 0.8187281012535095,
|
|
"num_tokens": 1141722088.0,
|
|
"step": 11410
|
|
},
|
|
{
|
|
"entropy": 0.993359375,
|
|
"epoch": 1.5607489408227415,
|
|
"grad_norm": 0.29869836135246963,
|
|
"learning_rate": 1.1325207834296184e-06,
|
|
"loss": 0.7192,
|
|
"mean_token_accuracy": 0.8051835596561432,
|
|
"num_tokens": 1142741382.0,
|
|
"step": 11420
|
|
},
|
|
{
|
|
"entropy": 0.927734375,
|
|
"epoch": 1.5621156211562117,
|
|
"grad_norm": 0.2731182905760725,
|
|
"learning_rate": 1.1289981682401017e-06,
|
|
"loss": 0.6674,
|
|
"mean_token_accuracy": 0.8156837165355683,
|
|
"num_tokens": 1143707105.0,
|
|
"step": 11430
|
|
},
|
|
{
|
|
"entropy": 0.951953125,
|
|
"epoch": 1.5634823014896817,
|
|
"grad_norm": 0.23964055860358469,
|
|
"learning_rate": 1.1254755530505848e-06,
|
|
"loss": 0.6904,
|
|
"mean_token_accuracy": 0.8131338834762574,
|
|
"num_tokens": 1144704253.0,
|
|
"step": 11440
|
|
},
|
|
{
|
|
"entropy": 0.963671875,
|
|
"epoch": 1.5648489818231517,
|
|
"grad_norm": 0.24521163026428078,
|
|
"learning_rate": 1.1219529378610681e-06,
|
|
"loss": 0.7174,
|
|
"mean_token_accuracy": 0.8053602397441864,
|
|
"num_tokens": 1145699269.0,
|
|
"step": 11450
|
|
},
|
|
{
|
|
"entropy": 0.97421875,
|
|
"epoch": 1.5662156621566217,
|
|
"grad_norm": 0.2698758329557142,
|
|
"learning_rate": 1.1184303226715515e-06,
|
|
"loss": 0.7012,
|
|
"mean_token_accuracy": 0.8087267577648163,
|
|
"num_tokens": 1146720558.0,
|
|
"step": 11460
|
|
},
|
|
{
|
|
"entropy": 0.965625,
|
|
"epoch": 1.5675823424900917,
|
|
"grad_norm": 0.2724685313559035,
|
|
"learning_rate": 1.1149077074820346e-06,
|
|
"loss": 0.7029,
|
|
"mean_token_accuracy": 0.8085796654224395,
|
|
"num_tokens": 1147722919.0,
|
|
"step": 11470
|
|
},
|
|
{
|
|
"entropy": 1.009375,
|
|
"epoch": 1.5689490228235616,
|
|
"grad_norm": 0.29942313569195067,
|
|
"learning_rate": 1.111385092292518e-06,
|
|
"loss": 0.7376,
|
|
"mean_token_accuracy": 0.8033331513404847,
|
|
"num_tokens": 1148706767.0,
|
|
"step": 11480
|
|
},
|
|
{
|
|
"entropy": 0.944140625,
|
|
"epoch": 1.5703157031570316,
|
|
"grad_norm": 0.24315765628430094,
|
|
"learning_rate": 1.1078624771030013e-06,
|
|
"loss": 0.6976,
|
|
"mean_token_accuracy": 0.8113403856754303,
|
|
"num_tokens": 1149707433.0,
|
|
"step": 11490
|
|
},
|
|
{
|
|
"entropy": 0.960546875,
|
|
"epoch": 1.5716823834905016,
|
|
"grad_norm": 0.25485580938825514,
|
|
"learning_rate": 1.1043398619134846e-06,
|
|
"loss": 0.7007,
|
|
"mean_token_accuracy": 0.8076777517795563,
|
|
"num_tokens": 1150747647.0,
|
|
"step": 11500
|
|
},
|
|
{
|
|
"entropy": 0.9703125,
|
|
"epoch": 1.5730490638239716,
|
|
"grad_norm": 0.24404870994638844,
|
|
"learning_rate": 1.100817246723968e-06,
|
|
"loss": 0.7023,
|
|
"mean_token_accuracy": 0.809378308057785,
|
|
"num_tokens": 1151734770.0,
|
|
"step": 11510
|
|
},
|
|
{
|
|
"entropy": 0.962109375,
|
|
"epoch": 1.5744157441574416,
|
|
"grad_norm": 0.2507274682021189,
|
|
"learning_rate": 1.0972946315344513e-06,
|
|
"loss": 0.6946,
|
|
"mean_token_accuracy": 0.8116126000881195,
|
|
"num_tokens": 1152776679.0,
|
|
"step": 11520
|
|
},
|
|
{
|
|
"entropy": 0.93046875,
|
|
"epoch": 1.5757824244909115,
|
|
"grad_norm": 0.26330370578411505,
|
|
"learning_rate": 1.0937720163449346e-06,
|
|
"loss": 0.682,
|
|
"mean_token_accuracy": 0.8152799844741822,
|
|
"num_tokens": 1153760751.0,
|
|
"step": 11530
|
|
},
|
|
{
|
|
"entropy": 0.9734375,
|
|
"epoch": 1.5771491048243815,
|
|
"grad_norm": 0.2689021174389902,
|
|
"learning_rate": 1.0902494011554177e-06,
|
|
"loss": 0.703,
|
|
"mean_token_accuracy": 0.8069798469543457,
|
|
"num_tokens": 1154773032.0,
|
|
"step": 11540
|
|
},
|
|
{
|
|
"entropy": 0.940234375,
|
|
"epoch": 1.5785157851578515,
|
|
"grad_norm": 0.27164496855270803,
|
|
"learning_rate": 1.086726785965901e-06,
|
|
"loss": 0.6704,
|
|
"mean_token_accuracy": 0.8169741034507751,
|
|
"num_tokens": 1155822119.0,
|
|
"step": 11550
|
|
},
|
|
{
|
|
"entropy": 0.986328125,
|
|
"epoch": 1.5798824654913215,
|
|
"grad_norm": 0.2887830938875686,
|
|
"learning_rate": 1.0832041707763844e-06,
|
|
"loss": 0.7338,
|
|
"mean_token_accuracy": 0.8033508121967315,
|
|
"num_tokens": 1156821322.0,
|
|
"step": 11560
|
|
},
|
|
{
|
|
"entropy": 0.990625,
|
|
"epoch": 1.5812491458247915,
|
|
"grad_norm": 0.25564845805983216,
|
|
"learning_rate": 1.0796815555868678e-06,
|
|
"loss": 0.7141,
|
|
"mean_token_accuracy": 0.8085777521133423,
|
|
"num_tokens": 1157885137.0,
|
|
"step": 11570
|
|
},
|
|
{
|
|
"entropy": 0.98515625,
|
|
"epoch": 1.5826158261582615,
|
|
"grad_norm": 0.24366135186468893,
|
|
"learning_rate": 1.076158940397351e-06,
|
|
"loss": 0.7144,
|
|
"mean_token_accuracy": 0.8060258090496063,
|
|
"num_tokens": 1158890096.0,
|
|
"step": 11580
|
|
},
|
|
{
|
|
"entropy": 0.961328125,
|
|
"epoch": 1.5839825064917314,
|
|
"grad_norm": 0.24917923568378697,
|
|
"learning_rate": 1.0726363252078344e-06,
|
|
"loss": 0.7159,
|
|
"mean_token_accuracy": 0.8082023739814759,
|
|
"num_tokens": 1159846658.0,
|
|
"step": 11590
|
|
},
|
|
{
|
|
"entropy": 0.9078125,
|
|
"epoch": 1.5853491868252014,
|
|
"grad_norm": 0.25379993854417293,
|
|
"learning_rate": 1.0691137100183178e-06,
|
|
"loss": 0.6341,
|
|
"mean_token_accuracy": 0.8261029601097107,
|
|
"num_tokens": 1160838561.0,
|
|
"step": 11600
|
|
},
|
|
{
|
|
"entropy": 0.919921875,
|
|
"epoch": 1.5867158671586716,
|
|
"grad_norm": 0.26887037789935625,
|
|
"learning_rate": 1.065591094828801e-06,
|
|
"loss": 0.7067,
|
|
"mean_token_accuracy": 0.808424037694931,
|
|
"num_tokens": 1161897074.0,
|
|
"step": 11610
|
|
},
|
|
{
|
|
"entropy": 0.944140625,
|
|
"epoch": 1.5880825474921416,
|
|
"grad_norm": 0.27255080724179437,
|
|
"learning_rate": 1.0620684796392842e-06,
|
|
"loss": 0.6623,
|
|
"mean_token_accuracy": 0.8159412443637848,
|
|
"num_tokens": 1162836144.0,
|
|
"step": 11620
|
|
},
|
|
{
|
|
"entropy": 0.905859375,
|
|
"epoch": 1.5894492278256116,
|
|
"grad_norm": 0.2701929057844104,
|
|
"learning_rate": 1.0585458644497676e-06,
|
|
"loss": 0.6458,
|
|
"mean_token_accuracy": 0.8218151152133941,
|
|
"num_tokens": 1163803783.0,
|
|
"step": 11630
|
|
},
|
|
{
|
|
"entropy": 0.976171875,
|
|
"epoch": 1.5908159081590816,
|
|
"grad_norm": 0.2402425616403005,
|
|
"learning_rate": 1.0550232492602509e-06,
|
|
"loss": 0.7002,
|
|
"mean_token_accuracy": 0.8091272950172425,
|
|
"num_tokens": 1164789119.0,
|
|
"step": 11640
|
|
},
|
|
{
|
|
"entropy": 0.980859375,
|
|
"epoch": 1.5921825884925516,
|
|
"grad_norm": 0.24756635217405254,
|
|
"learning_rate": 1.0515006340707342e-06,
|
|
"loss": 0.6962,
|
|
"mean_token_accuracy": 0.810609620809555,
|
|
"num_tokens": 1165766661.0,
|
|
"step": 11650
|
|
},
|
|
{
|
|
"entropy": 0.91953125,
|
|
"epoch": 1.5935492688260215,
|
|
"grad_norm": 0.286509160577255,
|
|
"learning_rate": 1.0479780188812176e-06,
|
|
"loss": 0.6683,
|
|
"mean_token_accuracy": 0.817117714881897,
|
|
"num_tokens": 1166714400.0,
|
|
"step": 11660
|
|
},
|
|
{
|
|
"entropy": 0.944921875,
|
|
"epoch": 1.5949159491594918,
|
|
"grad_norm": 0.26186688219510085,
|
|
"learning_rate": 1.0444554036917009e-06,
|
|
"loss": 0.6888,
|
|
"mean_token_accuracy": 0.8113969385623931,
|
|
"num_tokens": 1167724315.0,
|
|
"step": 11670
|
|
},
|
|
{
|
|
"entropy": 0.959375,
|
|
"epoch": 1.5962826294929617,
|
|
"grad_norm": 0.25054367380443043,
|
|
"learning_rate": 1.0409327885021842e-06,
|
|
"loss": 0.6964,
|
|
"mean_token_accuracy": 0.8089512646198272,
|
|
"num_tokens": 1168744110.0,
|
|
"step": 11680
|
|
},
|
|
{
|
|
"entropy": 0.92265625,
|
|
"epoch": 1.5976493098264317,
|
|
"grad_norm": 0.2767248637295652,
|
|
"learning_rate": 1.0374101733126674e-06,
|
|
"loss": 0.6697,
|
|
"mean_token_accuracy": 0.8172604322433472,
|
|
"num_tokens": 1169739567.0,
|
|
"step": 11690
|
|
},
|
|
{
|
|
"entropy": 0.913671875,
|
|
"epoch": 1.5990159901599017,
|
|
"grad_norm": 0.3042459845594129,
|
|
"learning_rate": 1.0338875581231507e-06,
|
|
"loss": 0.6625,
|
|
"mean_token_accuracy": 0.8174320578575134,
|
|
"num_tokens": 1170678500.0,
|
|
"step": 11700
|
|
},
|
|
{
|
|
"entropy": 0.9796875,
|
|
"epoch": 1.6003826704933717,
|
|
"grad_norm": 0.2629976069888287,
|
|
"learning_rate": 1.030364942933634e-06,
|
|
"loss": 0.7213,
|
|
"mean_token_accuracy": 0.8048856854438782,
|
|
"num_tokens": 1171654365.0,
|
|
"step": 11710
|
|
},
|
|
{
|
|
"entropy": 0.966015625,
|
|
"epoch": 1.6017493508268417,
|
|
"grad_norm": 0.22854301128603402,
|
|
"learning_rate": 1.0268423277441174e-06,
|
|
"loss": 0.6872,
|
|
"mean_token_accuracy": 0.8128312051296234,
|
|
"num_tokens": 1172617824.0,
|
|
"step": 11720
|
|
},
|
|
{
|
|
"entropy": 0.954296875,
|
|
"epoch": 1.6031160311603116,
|
|
"grad_norm": 0.2865652033047186,
|
|
"learning_rate": 1.0233197125546005e-06,
|
|
"loss": 0.6962,
|
|
"mean_token_accuracy": 0.8108723282814025,
|
|
"num_tokens": 1173559869.0,
|
|
"step": 11730
|
|
},
|
|
{
|
|
"entropy": 0.9609375,
|
|
"epoch": 1.6044827114937816,
|
|
"grad_norm": 0.26686075643445956,
|
|
"learning_rate": 1.0197970973650838e-06,
|
|
"loss": 0.6763,
|
|
"mean_token_accuracy": 0.8144236326217651,
|
|
"num_tokens": 1174562880.0,
|
|
"step": 11740
|
|
},
|
|
{
|
|
"entropy": 0.951953125,
|
|
"epoch": 1.6058493918272516,
|
|
"grad_norm": 0.29309482581824914,
|
|
"learning_rate": 1.0162744821755674e-06,
|
|
"loss": 0.7097,
|
|
"mean_token_accuracy": 0.8083098590373993,
|
|
"num_tokens": 1175582329.0,
|
|
"step": 11750
|
|
},
|
|
{
|
|
"entropy": 0.940234375,
|
|
"epoch": 1.6072160721607216,
|
|
"grad_norm": 0.26203250755621565,
|
|
"learning_rate": 1.0127518669860505e-06,
|
|
"loss": 0.6617,
|
|
"mean_token_accuracy": 0.8188033103942871,
|
|
"num_tokens": 1176571463.0,
|
|
"step": 11760
|
|
},
|
|
{
|
|
"entropy": 0.982421875,
|
|
"epoch": 1.6085827524941916,
|
|
"grad_norm": 0.2911955221016885,
|
|
"learning_rate": 1.0092292517965338e-06,
|
|
"loss": 0.7152,
|
|
"mean_token_accuracy": 0.8071860611438751,
|
|
"num_tokens": 1177603350.0,
|
|
"step": 11770
|
|
},
|
|
{
|
|
"entropy": 0.958203125,
|
|
"epoch": 1.6099494328276616,
|
|
"grad_norm": 0.2486471954748713,
|
|
"learning_rate": 1.0057066366070172e-06,
|
|
"loss": 0.6876,
|
|
"mean_token_accuracy": 0.8137568414211274,
|
|
"num_tokens": 1178602301.0,
|
|
"step": 11780
|
|
},
|
|
{
|
|
"entropy": 0.92265625,
|
|
"epoch": 1.6113161131611315,
|
|
"grad_norm": 0.2665374620500632,
|
|
"learning_rate": 1.0021840214175005e-06,
|
|
"loss": 0.6733,
|
|
"mean_token_accuracy": 0.8166230142116546,
|
|
"num_tokens": 1179589154.0,
|
|
"step": 11790
|
|
},
|
|
{
|
|
"entropy": 0.962890625,
|
|
"epoch": 1.6126827934946015,
|
|
"grad_norm": 0.28370071262948493,
|
|
"learning_rate": 9.986614062279836e-07,
|
|
"loss": 0.6996,
|
|
"mean_token_accuracy": 0.8118164598941803,
|
|
"num_tokens": 1180600360.0,
|
|
"step": 11800
|
|
},
|
|
{
|
|
"entropy": 0.910546875,
|
|
"epoch": 1.6140494738280715,
|
|
"grad_norm": 0.2590916824529614,
|
|
"learning_rate": 9.95138791038467e-07,
|
|
"loss": 0.6598,
|
|
"mean_token_accuracy": 0.8182576596736908,
|
|
"num_tokens": 1181606919.0,
|
|
"step": 11810
|
|
},
|
|
{
|
|
"entropy": 0.928125,
|
|
"epoch": 1.6154161541615415,
|
|
"grad_norm": 0.27372376244052005,
|
|
"learning_rate": 9.916161758489503e-07,
|
|
"loss": 0.6526,
|
|
"mean_token_accuracy": 0.8216562807559967,
|
|
"num_tokens": 1182605366.0,
|
|
"step": 11820
|
|
},
|
|
{
|
|
"entropy": 0.9484375,
|
|
"epoch": 1.6167828344950115,
|
|
"grad_norm": 0.26382650582383355,
|
|
"learning_rate": 9.880935606594336e-07,
|
|
"loss": 0.6778,
|
|
"mean_token_accuracy": 0.8156723260879517,
|
|
"num_tokens": 1183673571.0,
|
|
"step": 11830
|
|
},
|
|
{
|
|
"entropy": 0.948046875,
|
|
"epoch": 1.6181495148284815,
|
|
"grad_norm": 0.23588890005145033,
|
|
"learning_rate": 9.84570945469917e-07,
|
|
"loss": 0.6725,
|
|
"mean_token_accuracy": 0.8175878345966339,
|
|
"num_tokens": 1184672054.0,
|
|
"step": 11840
|
|
},
|
|
{
|
|
"entropy": 0.95390625,
|
|
"epoch": 1.6195161951619517,
|
|
"grad_norm": 0.2503280217532848,
|
|
"learning_rate": 9.810483302804003e-07,
|
|
"loss": 0.6637,
|
|
"mean_token_accuracy": 0.8172738313674927,
|
|
"num_tokens": 1185671748.0,
|
|
"step": 11850
|
|
},
|
|
{
|
|
"entropy": 0.941015625,
|
|
"epoch": 1.6208828754954216,
|
|
"grad_norm": 0.25437458651080647,
|
|
"learning_rate": 9.775257150908836e-07,
|
|
"loss": 0.6771,
|
|
"mean_token_accuracy": 0.8140729248523713,
|
|
"num_tokens": 1186650051.0,
|
|
"step": 11860
|
|
},
|
|
{
|
|
"entropy": 0.948828125,
|
|
"epoch": 1.6222495558288916,
|
|
"grad_norm": 0.2603407218058726,
|
|
"learning_rate": 9.740030999013668e-07,
|
|
"loss": 0.6909,
|
|
"mean_token_accuracy": 0.8124445796012878,
|
|
"num_tokens": 1187625175.0,
|
|
"step": 11870
|
|
},
|
|
{
|
|
"entropy": 0.921484375,
|
|
"epoch": 1.6236162361623616,
|
|
"grad_norm": 0.251114673548205,
|
|
"learning_rate": 9.7048048471185e-07,
|
|
"loss": 0.6709,
|
|
"mean_token_accuracy": 0.8150848567485809,
|
|
"num_tokens": 1188594146.0,
|
|
"step": 11880
|
|
},
|
|
{
|
|
"entropy": 0.96328125,
|
|
"epoch": 1.6249829164958316,
|
|
"grad_norm": 0.23500356095578628,
|
|
"learning_rate": 9.669578695223334e-07,
|
|
"loss": 0.7171,
|
|
"mean_token_accuracy": 0.8058954238891601,
|
|
"num_tokens": 1189612533.0,
|
|
"step": 11890
|
|
},
|
|
{
|
|
"entropy": 0.95,
|
|
"epoch": 1.6263495968293016,
|
|
"grad_norm": 0.2829101450381304,
|
|
"learning_rate": 9.634352543328168e-07,
|
|
"loss": 0.6997,
|
|
"mean_token_accuracy": 0.8088490962982178,
|
|
"num_tokens": 1190580400.0,
|
|
"step": 11900
|
|
},
|
|
{
|
|
"entropy": 0.94765625,
|
|
"epoch": 1.6277162771627718,
|
|
"grad_norm": 0.28367170438037337,
|
|
"learning_rate": 9.599126391433e-07,
|
|
"loss": 0.6697,
|
|
"mean_token_accuracy": 0.8165893197059632,
|
|
"num_tokens": 1191586787.0,
|
|
"step": 11910
|
|
},
|
|
{
|
|
"entropy": 0.9625,
|
|
"epoch": 1.6290829574962418,
|
|
"grad_norm": 0.25951848008779,
|
|
"learning_rate": 9.563900239537834e-07,
|
|
"loss": 0.6949,
|
|
"mean_token_accuracy": 0.8100278437137604,
|
|
"num_tokens": 1192578364.0,
|
|
"step": 11920
|
|
},
|
|
{
|
|
"entropy": 0.928515625,
|
|
"epoch": 1.6304496378297118,
|
|
"grad_norm": 0.2796458153424053,
|
|
"learning_rate": 9.528674087642667e-07,
|
|
"loss": 0.6753,
|
|
"mean_token_accuracy": 0.8140841603279114,
|
|
"num_tokens": 1193601099.0,
|
|
"step": 11930
|
|
},
|
|
{
|
|
"entropy": 0.9109375,
|
|
"epoch": 1.6318163181631817,
|
|
"grad_norm": 0.2622767315137554,
|
|
"learning_rate": 9.4934479357475e-07,
|
|
"loss": 0.6536,
|
|
"mean_token_accuracy": 0.8208265542984009,
|
|
"num_tokens": 1194615552.0,
|
|
"step": 11940
|
|
},
|
|
{
|
|
"entropy": 0.969921875,
|
|
"epoch": 1.6331829984966517,
|
|
"grad_norm": 0.25898107820787564,
|
|
"learning_rate": 9.458221783852332e-07,
|
|
"loss": 0.7172,
|
|
"mean_token_accuracy": 0.8047666490077973,
|
|
"num_tokens": 1195661648.0,
|
|
"step": 11950
|
|
},
|
|
{
|
|
"entropy": 0.942578125,
|
|
"epoch": 1.6345496788301217,
|
|
"grad_norm": 0.2671247694210681,
|
|
"learning_rate": 9.422995631957166e-07,
|
|
"loss": 0.7009,
|
|
"mean_token_accuracy": 0.8094614565372467,
|
|
"num_tokens": 1196611904.0,
|
|
"step": 11960
|
|
},
|
|
{
|
|
"entropy": 0.977734375,
|
|
"epoch": 1.6359163591635917,
|
|
"grad_norm": 0.27778373285448155,
|
|
"learning_rate": 9.387769480061999e-07,
|
|
"loss": 0.7233,
|
|
"mean_token_accuracy": 0.8067568063735961,
|
|
"num_tokens": 1197598162.0,
|
|
"step": 11970
|
|
},
|
|
{
|
|
"entropy": 0.96015625,
|
|
"epoch": 1.6372830394970617,
|
|
"grad_norm": 0.25654721767272654,
|
|
"learning_rate": 9.352543328166831e-07,
|
|
"loss": 0.6845,
|
|
"mean_token_accuracy": 0.8124455571174621,
|
|
"num_tokens": 1198636269.0,
|
|
"step": 11980
|
|
},
|
|
{
|
|
"entropy": 0.943359375,
|
|
"epoch": 1.6386497198305316,
|
|
"grad_norm": 0.23426494817163032,
|
|
"learning_rate": 9.317317176271665e-07,
|
|
"loss": 0.6857,
|
|
"mean_token_accuracy": 0.814460164308548,
|
|
"num_tokens": 1199590978.0,
|
|
"step": 11990
|
|
},
|
|
{
|
|
"entropy": 0.972265625,
|
|
"epoch": 1.6400164001640016,
|
|
"grad_norm": 0.24622047565342356,
|
|
"learning_rate": 9.282091024376498e-07,
|
|
"loss": 0.7267,
|
|
"mean_token_accuracy": 0.8033079504966736,
|
|
"num_tokens": 1200657756.0,
|
|
"step": 12000
|
|
},
|
|
{
|
|
"entropy": 0.989453125,
|
|
"epoch": 1.6413830804974716,
|
|
"grad_norm": 0.29842627325594245,
|
|
"learning_rate": 9.246864872481331e-07,
|
|
"loss": 0.7367,
|
|
"mean_token_accuracy": 0.7991735696792602,
|
|
"num_tokens": 1201625479.0,
|
|
"step": 12010
|
|
},
|
|
{
|
|
"entropy": 0.951171875,
|
|
"epoch": 1.6427497608309416,
|
|
"grad_norm": 0.27361740836813614,
|
|
"learning_rate": 9.211638720586164e-07,
|
|
"loss": 0.6882,
|
|
"mean_token_accuracy": 0.8120012938976288,
|
|
"num_tokens": 1202578801.0,
|
|
"step": 12020
|
|
},
|
|
{
|
|
"entropy": 0.93984375,
|
|
"epoch": 1.6441164411644116,
|
|
"grad_norm": 0.2976661513137074,
|
|
"learning_rate": 9.176412568690997e-07,
|
|
"loss": 0.6795,
|
|
"mean_token_accuracy": 0.8133105039596558,
|
|
"num_tokens": 1203570618.0,
|
|
"step": 12030
|
|
},
|
|
{
|
|
"entropy": 0.962109375,
|
|
"epoch": 1.6454831214978816,
|
|
"grad_norm": 0.2730102546459353,
|
|
"learning_rate": 9.14118641679583e-07,
|
|
"loss": 0.7197,
|
|
"mean_token_accuracy": 0.8057346105575561,
|
|
"num_tokens": 1204596821.0,
|
|
"step": 12040
|
|
},
|
|
{
|
|
"entropy": 0.917578125,
|
|
"epoch": 1.6468498018313515,
|
|
"grad_norm": 0.28366632652213936,
|
|
"learning_rate": 9.105960264900663e-07,
|
|
"loss": 0.7106,
|
|
"mean_token_accuracy": 0.8065852582454681,
|
|
"num_tokens": 1205542592.0,
|
|
"step": 12050
|
|
},
|
|
{
|
|
"entropy": 0.951171875,
|
|
"epoch": 1.6482164821648215,
|
|
"grad_norm": 0.2533755846963103,
|
|
"learning_rate": 9.070734113005496e-07,
|
|
"loss": 0.6904,
|
|
"mean_token_accuracy": 0.8140528321266174,
|
|
"num_tokens": 1206585474.0,
|
|
"step": 12060
|
|
},
|
|
{
|
|
"entropy": 1.01484375,
|
|
"epoch": 1.6495831624982915,
|
|
"grad_norm": 0.27345806631322594,
|
|
"learning_rate": 9.035507961110329e-07,
|
|
"loss": 0.7313,
|
|
"mean_token_accuracy": 0.803348982334137,
|
|
"num_tokens": 1207563707.0,
|
|
"step": 12070
|
|
},
|
|
{
|
|
"entropy": 0.930078125,
|
|
"epoch": 1.6509498428317615,
|
|
"grad_norm": 0.26465525618998975,
|
|
"learning_rate": 9.000281809215163e-07,
|
|
"loss": 0.6717,
|
|
"mean_token_accuracy": 0.8160159826278687,
|
|
"num_tokens": 1208556252.0,
|
|
"step": 12080
|
|
},
|
|
{
|
|
"entropy": 0.92734375,
|
|
"epoch": 1.6523165231652317,
|
|
"grad_norm": 0.2800494163803013,
|
|
"learning_rate": 8.965055657319995e-07,
|
|
"loss": 0.6784,
|
|
"mean_token_accuracy": 0.8150230050086975,
|
|
"num_tokens": 1209554358.0,
|
|
"step": 12090
|
|
},
|
|
{
|
|
"entropy": 0.93125,
|
|
"epoch": 1.6536832034987017,
|
|
"grad_norm": 0.23591063703541262,
|
|
"learning_rate": 8.929829505424828e-07,
|
|
"loss": 0.6849,
|
|
"mean_token_accuracy": 0.8149450123310089,
|
|
"num_tokens": 1210557665.0,
|
|
"step": 12100
|
|
},
|
|
{
|
|
"entropy": 0.9265625,
|
|
"epoch": 1.6550498838321717,
|
|
"grad_norm": 0.26678578069845643,
|
|
"learning_rate": 8.894603353529662e-07,
|
|
"loss": 0.6612,
|
|
"mean_token_accuracy": 0.817802757024765,
|
|
"num_tokens": 1211549288.0,
|
|
"step": 12110
|
|
},
|
|
{
|
|
"entropy": 0.915625,
|
|
"epoch": 1.6564165641656416,
|
|
"grad_norm": 0.2527913813791025,
|
|
"learning_rate": 8.859377201634495e-07,
|
|
"loss": 0.6591,
|
|
"mean_token_accuracy": 0.8184602200984955,
|
|
"num_tokens": 1212591886.0,
|
|
"step": 12120
|
|
},
|
|
{
|
|
"entropy": 1.005078125,
|
|
"epoch": 1.6577832444991116,
|
|
"grad_norm": 0.2538176405002201,
|
|
"learning_rate": 8.824151049739326e-07,
|
|
"loss": 0.7335,
|
|
"mean_token_accuracy": 0.8015165686607361,
|
|
"num_tokens": 1213604606.0,
|
|
"step": 12130
|
|
},
|
|
{
|
|
"entropy": 0.9171875,
|
|
"epoch": 1.6591499248325816,
|
|
"grad_norm": 0.25817277304935193,
|
|
"learning_rate": 8.788924897844161e-07,
|
|
"loss": 0.6651,
|
|
"mean_token_accuracy": 0.8182801902294159,
|
|
"num_tokens": 1214642551.0,
|
|
"step": 12140
|
|
},
|
|
{
|
|
"entropy": 0.926171875,
|
|
"epoch": 1.6605166051660518,
|
|
"grad_norm": 0.26877257607671023,
|
|
"learning_rate": 8.753698745948994e-07,
|
|
"loss": 0.6611,
|
|
"mean_token_accuracy": 0.8172691226005554,
|
|
"num_tokens": 1215673969.0,
|
|
"step": 12150
|
|
},
|
|
{
|
|
"entropy": 0.93828125,
|
|
"epoch": 1.6618832854995218,
|
|
"grad_norm": 0.2745258692227928,
|
|
"learning_rate": 8.718472594053825e-07,
|
|
"loss": 0.6628,
|
|
"mean_token_accuracy": 0.8173817455768585,
|
|
"num_tokens": 1216619775.0,
|
|
"step": 12160
|
|
},
|
|
{
|
|
"entropy": 0.93359375,
|
|
"epoch": 1.6632499658329918,
|
|
"grad_norm": 0.29008213725813503,
|
|
"learning_rate": 8.683246442158659e-07,
|
|
"loss": 0.7052,
|
|
"mean_token_accuracy": 0.8099933207035065,
|
|
"num_tokens": 1217597835.0,
|
|
"step": 12170
|
|
},
|
|
{
|
|
"entropy": 0.908203125,
|
|
"epoch": 1.6646166461664618,
|
|
"grad_norm": 0.24891103290401248,
|
|
"learning_rate": 8.648020290263492e-07,
|
|
"loss": 0.6614,
|
|
"mean_token_accuracy": 0.8179398894309997,
|
|
"num_tokens": 1218556074.0,
|
|
"step": 12180
|
|
},
|
|
{
|
|
"entropy": 0.975,
|
|
"epoch": 1.6659833264999317,
|
|
"grad_norm": 0.281368925394946,
|
|
"learning_rate": 8.612794138368325e-07,
|
|
"loss": 0.6854,
|
|
"mean_token_accuracy": 0.813375186920166,
|
|
"num_tokens": 1219563177.0,
|
|
"step": 12190
|
|
},
|
|
{
|
|
"entropy": 0.96953125,
|
|
"epoch": 1.6673500068334017,
|
|
"grad_norm": 0.2807686796006267,
|
|
"learning_rate": 8.577567986473158e-07,
|
|
"loss": 0.6809,
|
|
"mean_token_accuracy": 0.8150769591331481,
|
|
"num_tokens": 1220525706.0,
|
|
"step": 12200
|
|
},
|
|
{
|
|
"entropy": 0.9296875,
|
|
"epoch": 1.6687166871668717,
|
|
"grad_norm": 0.29354704505547224,
|
|
"learning_rate": 8.542341834577991e-07,
|
|
"loss": 0.6743,
|
|
"mean_token_accuracy": 0.8158905506134033,
|
|
"num_tokens": 1221509657.0,
|
|
"step": 12210
|
|
},
|
|
{
|
|
"entropy": 0.938671875,
|
|
"epoch": 1.6700833675003417,
|
|
"grad_norm": 0.2756004507797667,
|
|
"learning_rate": 8.507115682682824e-07,
|
|
"loss": 0.695,
|
|
"mean_token_accuracy": 0.8118271827697754,
|
|
"num_tokens": 1222483747.0,
|
|
"step": 12220
|
|
},
|
|
{
|
|
"entropy": 0.982421875,
|
|
"epoch": 1.6714500478338117,
|
|
"grad_norm": 0.28389518595290103,
|
|
"learning_rate": 8.471889530787658e-07,
|
|
"loss": 0.7289,
|
|
"mean_token_accuracy": 0.804698383808136,
|
|
"num_tokens": 1223511420.0,
|
|
"step": 12230
|
|
},
|
|
{
|
|
"entropy": 0.933203125,
|
|
"epoch": 1.6728167281672817,
|
|
"grad_norm": 0.25644888641155034,
|
|
"learning_rate": 8.43666337889249e-07,
|
|
"loss": 0.6729,
|
|
"mean_token_accuracy": 0.8156395256519318,
|
|
"num_tokens": 1224496559.0,
|
|
"step": 12240
|
|
},
|
|
{
|
|
"entropy": 0.959375,
|
|
"epoch": 1.6741834085007516,
|
|
"grad_norm": 0.24283768747247086,
|
|
"learning_rate": 8.401437226997323e-07,
|
|
"loss": 0.6937,
|
|
"mean_token_accuracy": 0.8114457786083221,
|
|
"num_tokens": 1225517907.0,
|
|
"step": 12250
|
|
},
|
|
{
|
|
"entropy": 0.95546875,
|
|
"epoch": 1.6755500888342216,
|
|
"grad_norm": 0.26700042401496615,
|
|
"learning_rate": 8.366211075102157e-07,
|
|
"loss": 0.6811,
|
|
"mean_token_accuracy": 0.8141814768314362,
|
|
"num_tokens": 1226443690.0,
|
|
"step": 12260
|
|
},
|
|
{
|
|
"entropy": 0.95390625,
|
|
"epoch": 1.6769167691676916,
|
|
"grad_norm": 0.2741216557980831,
|
|
"learning_rate": 8.330984923206989e-07,
|
|
"loss": 0.6766,
|
|
"mean_token_accuracy": 0.8153111100196838,
|
|
"num_tokens": 1227466312.0,
|
|
"step": 12270
|
|
},
|
|
{
|
|
"entropy": 0.977734375,
|
|
"epoch": 1.6782834495011616,
|
|
"grad_norm": 0.26564967598341793,
|
|
"learning_rate": 8.295758771311822e-07,
|
|
"loss": 0.6983,
|
|
"mean_token_accuracy": 0.8097620785236359,
|
|
"num_tokens": 1228400415.0,
|
|
"step": 12280
|
|
},
|
|
{
|
|
"entropy": 0.96484375,
|
|
"epoch": 1.6796501298346316,
|
|
"grad_norm": 0.23282120239980889,
|
|
"learning_rate": 8.260532619416656e-07,
|
|
"loss": 0.7077,
|
|
"mean_token_accuracy": 0.8077654659748077,
|
|
"num_tokens": 1229369061.0,
|
|
"step": 12290
|
|
},
|
|
{
|
|
"entropy": 0.93828125,
|
|
"epoch": 1.6810168101681016,
|
|
"grad_norm": 0.24664417859610346,
|
|
"learning_rate": 8.225306467521489e-07,
|
|
"loss": 0.6617,
|
|
"mean_token_accuracy": 0.8192084014415741,
|
|
"num_tokens": 1230368442.0,
|
|
"step": 12300
|
|
},
|
|
{
|
|
"entropy": 0.97109375,
|
|
"epoch": 1.6823834905015715,
|
|
"grad_norm": 0.26471631292818876,
|
|
"learning_rate": 8.190080315626321e-07,
|
|
"loss": 0.6963,
|
|
"mean_token_accuracy": 0.8108521401882172,
|
|
"num_tokens": 1231332600.0,
|
|
"step": 12310
|
|
},
|
|
{
|
|
"entropy": 0.94609375,
|
|
"epoch": 1.6837501708350415,
|
|
"grad_norm": 0.2568585096553801,
|
|
"learning_rate": 8.154854163731155e-07,
|
|
"loss": 0.6851,
|
|
"mean_token_accuracy": 0.8135329425334931,
|
|
"num_tokens": 1232365140.0,
|
|
"step": 12320
|
|
},
|
|
{
|
|
"entropy": 0.950390625,
|
|
"epoch": 1.6851168511685117,
|
|
"grad_norm": 0.28044822050628104,
|
|
"learning_rate": 8.119628011835988e-07,
|
|
"loss": 0.7003,
|
|
"mean_token_accuracy": 0.8092410445213318,
|
|
"num_tokens": 1233345099.0,
|
|
"step": 12330
|
|
},
|
|
{
|
|
"entropy": 0.94453125,
|
|
"epoch": 1.6864835315019817,
|
|
"grad_norm": 0.251732159640276,
|
|
"learning_rate": 8.084401859940821e-07,
|
|
"loss": 0.6665,
|
|
"mean_token_accuracy": 0.8157114207744598,
|
|
"num_tokens": 1234317291.0,
|
|
"step": 12340
|
|
},
|
|
{
|
|
"entropy": 0.973828125,
|
|
"epoch": 1.6878502118354517,
|
|
"grad_norm": 0.270574491181554,
|
|
"learning_rate": 8.049175708045654e-07,
|
|
"loss": 0.712,
|
|
"mean_token_accuracy": 0.8072687685489655,
|
|
"num_tokens": 1235330069.0,
|
|
"step": 12350
|
|
},
|
|
{
|
|
"entropy": 0.9015625,
|
|
"epoch": 1.6892168921689217,
|
|
"grad_norm": 0.23798288124513636,
|
|
"learning_rate": 8.013949556150487e-07,
|
|
"loss": 0.6798,
|
|
"mean_token_accuracy": 0.8135797321796417,
|
|
"num_tokens": 1236278954.0,
|
|
"step": 12360
|
|
},
|
|
{
|
|
"entropy": 0.933984375,
|
|
"epoch": 1.6905835725023917,
|
|
"grad_norm": 0.277811225232644,
|
|
"learning_rate": 7.97872340425532e-07,
|
|
"loss": 0.6865,
|
|
"mean_token_accuracy": 0.8134016811847686,
|
|
"num_tokens": 1237283806.0,
|
|
"step": 12370
|
|
},
|
|
{
|
|
"entropy": 0.95234375,
|
|
"epoch": 1.6919502528358616,
|
|
"grad_norm": 0.3169553467385442,
|
|
"learning_rate": 7.943497252360153e-07,
|
|
"loss": 0.7183,
|
|
"mean_token_accuracy": 0.8056247770786286,
|
|
"num_tokens": 1238255669.0,
|
|
"step": 12380
|
|
},
|
|
{
|
|
"entropy": 0.959765625,
|
|
"epoch": 1.6933169331693319,
|
|
"grad_norm": 0.27299921879344996,
|
|
"learning_rate": 7.908271100464986e-07,
|
|
"loss": 0.7462,
|
|
"mean_token_accuracy": 0.7982687830924988,
|
|
"num_tokens": 1239290900.0,
|
|
"step": 12390
|
|
},
|
|
{
|
|
"entropy": 0.946875,
|
|
"epoch": 1.6946836135028018,
|
|
"grad_norm": 0.2834137317668542,
|
|
"learning_rate": 7.873044948569819e-07,
|
|
"loss": 0.6872,
|
|
"mean_token_accuracy": 0.8130285918712616,
|
|
"num_tokens": 1240288490.0,
|
|
"step": 12400
|
|
},
|
|
{
|
|
"entropy": 0.984375,
|
|
"epoch": 1.6960502938362718,
|
|
"grad_norm": 0.253187558771222,
|
|
"learning_rate": 7.837818796674653e-07,
|
|
"loss": 0.6955,
|
|
"mean_token_accuracy": 0.8113761842250824,
|
|
"num_tokens": 1241290636.0,
|
|
"step": 12410
|
|
},
|
|
{
|
|
"entropy": 0.94296875,
|
|
"epoch": 1.6974169741697418,
|
|
"grad_norm": 0.29880563786423153,
|
|
"learning_rate": 7.802592644779484e-07,
|
|
"loss": 0.6615,
|
|
"mean_token_accuracy": 0.8168439328670501,
|
|
"num_tokens": 1242335573.0,
|
|
"step": 12420
|
|
},
|
|
{
|
|
"entropy": 0.954296875,
|
|
"epoch": 1.6987836545032118,
|
|
"grad_norm": 0.26442086995302716,
|
|
"learning_rate": 7.767366492884317e-07,
|
|
"loss": 0.6927,
|
|
"mean_token_accuracy": 0.8107129156589508,
|
|
"num_tokens": 1243320695.0,
|
|
"step": 12430
|
|
},
|
|
{
|
|
"entropy": 0.95859375,
|
|
"epoch": 1.7001503348366818,
|
|
"grad_norm": 0.28224588779410403,
|
|
"learning_rate": 7.732140340989152e-07,
|
|
"loss": 0.7009,
|
|
"mean_token_accuracy": 0.8091909229755402,
|
|
"num_tokens": 1244361117.0,
|
|
"step": 12440
|
|
},
|
|
{
|
|
"entropy": 0.947265625,
|
|
"epoch": 1.7015170151701517,
|
|
"grad_norm": 0.2762840423437236,
|
|
"learning_rate": 7.696914189093985e-07,
|
|
"loss": 0.674,
|
|
"mean_token_accuracy": 0.8164341747760773,
|
|
"num_tokens": 1245361248.0,
|
|
"step": 12450
|
|
},
|
|
{
|
|
"entropy": 0.9390625,
|
|
"epoch": 1.7028836955036217,
|
|
"grad_norm": 0.224038169306632,
|
|
"learning_rate": 7.661688037198816e-07,
|
|
"loss": 0.6886,
|
|
"mean_token_accuracy": 0.811887389421463,
|
|
"num_tokens": 1246373180.0,
|
|
"step": 12460
|
|
},
|
|
{
|
|
"entropy": 0.919921875,
|
|
"epoch": 1.7042503758370917,
|
|
"grad_norm": 0.24380695648614065,
|
|
"learning_rate": 7.62646188530365e-07,
|
|
"loss": 0.6444,
|
|
"mean_token_accuracy": 0.8219160437583923,
|
|
"num_tokens": 1247358000.0,
|
|
"step": 12470
|
|
},
|
|
{
|
|
"entropy": 0.911328125,
|
|
"epoch": 1.7056170561705617,
|
|
"grad_norm": 0.24816340027970857,
|
|
"learning_rate": 7.591235733408483e-07,
|
|
"loss": 0.6597,
|
|
"mean_token_accuracy": 0.8183767259120941,
|
|
"num_tokens": 1248369118.0,
|
|
"step": 12480
|
|
},
|
|
{
|
|
"entropy": 0.90625,
|
|
"epoch": 1.7069837365040317,
|
|
"grad_norm": 0.2739860317544621,
|
|
"learning_rate": 7.556009581513315e-07,
|
|
"loss": 0.6616,
|
|
"mean_token_accuracy": 0.8172933220863342,
|
|
"num_tokens": 1249365813.0,
|
|
"step": 12490
|
|
},
|
|
{
|
|
"entropy": 0.9078125,
|
|
"epoch": 1.7083504168375017,
|
|
"grad_norm": 0.273799341750044,
|
|
"learning_rate": 7.520783429618149e-07,
|
|
"loss": 0.6424,
|
|
"mean_token_accuracy": 0.8226570129394531,
|
|
"num_tokens": 1250403248.0,
|
|
"step": 12500
|
|
},
|
|
{
|
|
"entropy": 0.930078125,
|
|
"epoch": 1.7097170971709716,
|
|
"grad_norm": 0.2685316017775005,
|
|
"learning_rate": 7.485557277722982e-07,
|
|
"loss": 0.6855,
|
|
"mean_token_accuracy": 0.8146668076515198,
|
|
"num_tokens": 1251407666.0,
|
|
"step": 12510
|
|
},
|
|
{
|
|
"entropy": 0.955859375,
|
|
"epoch": 1.7110837775044416,
|
|
"grad_norm": 0.2566756663692838,
|
|
"learning_rate": 7.450331125827815e-07,
|
|
"loss": 0.6963,
|
|
"mean_token_accuracy": 0.8103337526321411,
|
|
"num_tokens": 1252413446.0,
|
|
"step": 12520
|
|
},
|
|
{
|
|
"entropy": 0.97890625,
|
|
"epoch": 1.7124504578379116,
|
|
"grad_norm": 0.2804506075638042,
|
|
"learning_rate": 7.415104973932648e-07,
|
|
"loss": 0.6998,
|
|
"mean_token_accuracy": 0.8083972632884979,
|
|
"num_tokens": 1253419895.0,
|
|
"step": 12530
|
|
},
|
|
{
|
|
"entropy": 0.91875,
|
|
"epoch": 1.7138171381713816,
|
|
"grad_norm": 0.27772621834865097,
|
|
"learning_rate": 7.379878822037481e-07,
|
|
"loss": 0.6431,
|
|
"mean_token_accuracy": 0.8212663769721985,
|
|
"num_tokens": 1254356254.0,
|
|
"step": 12540
|
|
},
|
|
{
|
|
"entropy": 1.00234375,
|
|
"epoch": 1.7151838185048516,
|
|
"grad_norm": 0.28236020846498805,
|
|
"learning_rate": 7.344652670142314e-07,
|
|
"loss": 0.7258,
|
|
"mean_token_accuracy": 0.8037137150764465,
|
|
"num_tokens": 1255353127.0,
|
|
"step": 12550
|
|
},
|
|
{
|
|
"entropy": 0.95390625,
|
|
"epoch": 1.7165504988383216,
|
|
"grad_norm": 0.29084706065522276,
|
|
"learning_rate": 7.309426518247147e-07,
|
|
"loss": 0.7004,
|
|
"mean_token_accuracy": 0.8093136489391327,
|
|
"num_tokens": 1256385439.0,
|
|
"step": 12560
|
|
},
|
|
{
|
|
"entropy": 0.94609375,
|
|
"epoch": 1.7179171791717918,
|
|
"grad_norm": 0.2658424681985929,
|
|
"learning_rate": 7.27420036635198e-07,
|
|
"loss": 0.6935,
|
|
"mean_token_accuracy": 0.811580890417099,
|
|
"num_tokens": 1257359806.0,
|
|
"step": 12570
|
|
},
|
|
{
|
|
"entropy": 0.955078125,
|
|
"epoch": 1.7192838595052617,
|
|
"grad_norm": 0.26349077913045177,
|
|
"learning_rate": 7.238974214456813e-07,
|
|
"loss": 0.6963,
|
|
"mean_token_accuracy": 0.8093410313129425,
|
|
"num_tokens": 1258395792.0,
|
|
"step": 12580
|
|
},
|
|
{
|
|
"entropy": 0.956640625,
|
|
"epoch": 1.7206505398387317,
|
|
"grad_norm": 0.27768895226274154,
|
|
"learning_rate": 7.203748062561647e-07,
|
|
"loss": 0.6626,
|
|
"mean_token_accuracy": 0.8192002356052399,
|
|
"num_tokens": 1259465597.0,
|
|
"step": 12590
|
|
},
|
|
{
|
|
"entropy": 0.950390625,
|
|
"epoch": 1.7220172201722017,
|
|
"grad_norm": 0.2579087635314022,
|
|
"learning_rate": 7.168521910666479e-07,
|
|
"loss": 0.7119,
|
|
"mean_token_accuracy": 0.8090794444084167,
|
|
"num_tokens": 1260458869.0,
|
|
"step": 12600
|
|
},
|
|
{
|
|
"entropy": 0.932421875,
|
|
"epoch": 1.7233839005056717,
|
|
"grad_norm": 0.2650647017555245,
|
|
"learning_rate": 7.133295758771312e-07,
|
|
"loss": 0.7056,
|
|
"mean_token_accuracy": 0.8086047530174255,
|
|
"num_tokens": 1261455673.0,
|
|
"step": 12610
|
|
},
|
|
{
|
|
"entropy": 0.91875,
|
|
"epoch": 1.7247505808391417,
|
|
"grad_norm": 0.276717594759706,
|
|
"learning_rate": 7.098069606876146e-07,
|
|
"loss": 0.6857,
|
|
"mean_token_accuracy": 0.8132845401763916,
|
|
"num_tokens": 1262452225.0,
|
|
"step": 12620
|
|
},
|
|
{
|
|
"entropy": 0.921875,
|
|
"epoch": 1.7261172611726119,
|
|
"grad_norm": 0.3053880502819137,
|
|
"learning_rate": 7.062843454980979e-07,
|
|
"loss": 0.663,
|
|
"mean_token_accuracy": 0.819791454076767,
|
|
"num_tokens": 1263423599.0,
|
|
"step": 12630
|
|
},
|
|
{
|
|
"entropy": 0.941015625,
|
|
"epoch": 1.7274839415060819,
|
|
"grad_norm": 0.2390014227858987,
|
|
"learning_rate": 7.027617303085811e-07,
|
|
"loss": 0.6786,
|
|
"mean_token_accuracy": 0.8158216416835785,
|
|
"num_tokens": 1264437915.0,
|
|
"step": 12640
|
|
},
|
|
{
|
|
"entropy": 0.95546875,
|
|
"epoch": 1.7288506218395518,
|
|
"grad_norm": 0.26486929587772656,
|
|
"learning_rate": 6.992391151190645e-07,
|
|
"loss": 0.668,
|
|
"mean_token_accuracy": 0.8176268517971039,
|
|
"num_tokens": 1265448913.0,
|
|
"step": 12650
|
|
},
|
|
{
|
|
"entropy": 0.964453125,
|
|
"epoch": 1.7302173021730218,
|
|
"grad_norm": 0.3095418634047078,
|
|
"learning_rate": 6.957164999295478e-07,
|
|
"loss": 0.6999,
|
|
"mean_token_accuracy": 0.8083997070789337,
|
|
"num_tokens": 1266405679.0,
|
|
"step": 12660
|
|
},
|
|
{
|
|
"entropy": 0.934375,
|
|
"epoch": 1.7315839825064918,
|
|
"grad_norm": 0.27402523289119624,
|
|
"learning_rate": 6.921938847400309e-07,
|
|
"loss": 0.7041,
|
|
"mean_token_accuracy": 0.8068197548389435,
|
|
"num_tokens": 1267365497.0,
|
|
"step": 12670
|
|
},
|
|
{
|
|
"entropy": 0.95625,
|
|
"epoch": 1.7329506628399618,
|
|
"grad_norm": 0.27422020746363146,
|
|
"learning_rate": 6.886712695505144e-07,
|
|
"loss": 0.6961,
|
|
"mean_token_accuracy": 0.8122963607311249,
|
|
"num_tokens": 1268399851.0,
|
|
"step": 12680
|
|
},
|
|
{
|
|
"entropy": 0.9890625,
|
|
"epoch": 1.7343173431734318,
|
|
"grad_norm": 0.2665107594985772,
|
|
"learning_rate": 6.851486543609977e-07,
|
|
"loss": 0.7227,
|
|
"mean_token_accuracy": 0.8048030853271484,
|
|
"num_tokens": 1269408675.0,
|
|
"step": 12690
|
|
},
|
|
{
|
|
"entropy": 0.9625,
|
|
"epoch": 1.7356840235069018,
|
|
"grad_norm": 0.25436767142514305,
|
|
"learning_rate": 6.816260391714811e-07,
|
|
"loss": 0.6936,
|
|
"mean_token_accuracy": 0.8101162791252137,
|
|
"num_tokens": 1270396370.0,
|
|
"step": 12700
|
|
},
|
|
{
|
|
"entropy": 0.965625,
|
|
"epoch": 1.7370507038403717,
|
|
"grad_norm": 0.2857579460896867,
|
|
"learning_rate": 6.781034239819642e-07,
|
|
"loss": 0.7068,
|
|
"mean_token_accuracy": 0.8079938471317292,
|
|
"num_tokens": 1271394992.0,
|
|
"step": 12710
|
|
},
|
|
{
|
|
"entropy": 0.94609375,
|
|
"epoch": 1.7384173841738417,
|
|
"grad_norm": 0.28279353458491835,
|
|
"learning_rate": 6.745808087924475e-07,
|
|
"loss": 0.6732,
|
|
"mean_token_accuracy": 0.8142616808414459,
|
|
"num_tokens": 1272386483.0,
|
|
"step": 12720
|
|
},
|
|
{
|
|
"entropy": 0.978515625,
|
|
"epoch": 1.7397840645073117,
|
|
"grad_norm": 0.27742842342399565,
|
|
"learning_rate": 6.710581936029308e-07,
|
|
"loss": 0.688,
|
|
"mean_token_accuracy": 0.8109091997146607,
|
|
"num_tokens": 1273372646.0,
|
|
"step": 12730
|
|
},
|
|
{
|
|
"entropy": 0.93828125,
|
|
"epoch": 1.7411507448407817,
|
|
"grad_norm": 0.2784289766762292,
|
|
"learning_rate": 6.675355784134143e-07,
|
|
"loss": 0.6768,
|
|
"mean_token_accuracy": 0.813923054933548,
|
|
"num_tokens": 1274412839.0,
|
|
"step": 12740
|
|
},
|
|
{
|
|
"entropy": 0.9546875,
|
|
"epoch": 1.7425174251742517,
|
|
"grad_norm": 0.2738200730410657,
|
|
"learning_rate": 6.640129632238974e-07,
|
|
"loss": 0.6755,
|
|
"mean_token_accuracy": 0.8165778934955596,
|
|
"num_tokens": 1275411093.0,
|
|
"step": 12750
|
|
},
|
|
{
|
|
"entropy": 0.9703125,
|
|
"epoch": 1.7438841055077217,
|
|
"grad_norm": 0.2614539221553629,
|
|
"learning_rate": 6.604903480343807e-07,
|
|
"loss": 0.6796,
|
|
"mean_token_accuracy": 0.8125415921211243,
|
|
"num_tokens": 1276433218.0,
|
|
"step": 12760
|
|
},
|
|
{
|
|
"entropy": 0.928125,
|
|
"epoch": 1.7452507858411916,
|
|
"grad_norm": 0.3063778441353317,
|
|
"learning_rate": 6.569677328448641e-07,
|
|
"loss": 0.678,
|
|
"mean_token_accuracy": 0.8162495195865631,
|
|
"num_tokens": 1277399684.0,
|
|
"step": 12770
|
|
},
|
|
{
|
|
"entropy": 0.9140625,
|
|
"epoch": 1.7466174661746616,
|
|
"grad_norm": 0.25759901518664113,
|
|
"learning_rate": 6.534451176553473e-07,
|
|
"loss": 0.6687,
|
|
"mean_token_accuracy": 0.8188518404960632,
|
|
"num_tokens": 1278391488.0,
|
|
"step": 12780
|
|
},
|
|
{
|
|
"entropy": 0.9328125,
|
|
"epoch": 1.7479841465081316,
|
|
"grad_norm": 0.27682772884030665,
|
|
"learning_rate": 6.499225024658306e-07,
|
|
"loss": 0.6933,
|
|
"mean_token_accuracy": 0.8120026051998138,
|
|
"num_tokens": 1279414925.0,
|
|
"step": 12790
|
|
},
|
|
{
|
|
"entropy": 0.9296875,
|
|
"epoch": 1.7493508268416016,
|
|
"grad_norm": 0.2460649930774046,
|
|
"learning_rate": 6.46399887276314e-07,
|
|
"loss": 0.6631,
|
|
"mean_token_accuracy": 0.818180912733078,
|
|
"num_tokens": 1280366866.0,
|
|
"step": 12800
|
|
},
|
|
{
|
|
"entropy": 0.998046875,
|
|
"epoch": 1.7507175071750718,
|
|
"grad_norm": 0.31703773685351533,
|
|
"learning_rate": 6.428772720867973e-07,
|
|
"loss": 0.719,
|
|
"mean_token_accuracy": 0.8053463280200959,
|
|
"num_tokens": 1281340884.0,
|
|
"step": 12810
|
|
},
|
|
{
|
|
"entropy": 0.951171875,
|
|
"epoch": 1.7520841875085418,
|
|
"grad_norm": 0.2730608258219285,
|
|
"learning_rate": 6.393546568972805e-07,
|
|
"loss": 0.6643,
|
|
"mean_token_accuracy": 0.8169441103935242,
|
|
"num_tokens": 1282309544.0,
|
|
"step": 12820
|
|
},
|
|
{
|
|
"entropy": 0.96875,
|
|
"epoch": 1.7534508678420118,
|
|
"grad_norm": 0.25191222966354043,
|
|
"learning_rate": 6.358320417077639e-07,
|
|
"loss": 0.6968,
|
|
"mean_token_accuracy": 0.8114981472492218,
|
|
"num_tokens": 1283296117.0,
|
|
"step": 12830
|
|
},
|
|
{
|
|
"entropy": 0.928125,
|
|
"epoch": 1.7548175481754817,
|
|
"grad_norm": 0.25854442118800525,
|
|
"learning_rate": 6.323094265182472e-07,
|
|
"loss": 0.6534,
|
|
"mean_token_accuracy": 0.8178924083709717,
|
|
"num_tokens": 1284253172.0,
|
|
"step": 12840
|
|
},
|
|
{
|
|
"entropy": 0.9140625,
|
|
"epoch": 1.7561842285089517,
|
|
"grad_norm": 0.24491810843337983,
|
|
"learning_rate": 6.287868113287306e-07,
|
|
"loss": 0.6565,
|
|
"mean_token_accuracy": 0.818516606092453,
|
|
"num_tokens": 1285293723.0,
|
|
"step": 12850
|
|
},
|
|
{
|
|
"entropy": 0.928125,
|
|
"epoch": 1.7575509088424217,
|
|
"grad_norm": 0.2765528509670934,
|
|
"learning_rate": 6.252641961392138e-07,
|
|
"loss": 0.6813,
|
|
"mean_token_accuracy": 0.8129901766777039,
|
|
"num_tokens": 1286315895.0,
|
|
"step": 12860
|
|
},
|
|
{
|
|
"entropy": 0.889453125,
|
|
"epoch": 1.758917589175892,
|
|
"grad_norm": 0.24912978610414444,
|
|
"learning_rate": 6.217415809496971e-07,
|
|
"loss": 0.6523,
|
|
"mean_token_accuracy": 0.8200152397155762,
|
|
"num_tokens": 1287326679.0,
|
|
"step": 12870
|
|
},
|
|
{
|
|
"entropy": 0.96640625,
|
|
"epoch": 1.760284269509362,
|
|
"grad_norm": 0.2742157768296183,
|
|
"learning_rate": 6.182189657601804e-07,
|
|
"loss": 0.7191,
|
|
"mean_token_accuracy": 0.8065993309020996,
|
|
"num_tokens": 1288355321.0,
|
|
"step": 12880
|
|
},
|
|
{
|
|
"entropy": 0.94375,
|
|
"epoch": 1.7616509498428319,
|
|
"grad_norm": 0.2837749252880218,
|
|
"learning_rate": 6.146963505706637e-07,
|
|
"loss": 0.6821,
|
|
"mean_token_accuracy": 0.8136309027671814,
|
|
"num_tokens": 1289342451.0,
|
|
"step": 12890
|
|
},
|
|
{
|
|
"entropy": 0.94765625,
|
|
"epoch": 1.7630176301763019,
|
|
"grad_norm": 0.25658495370247747,
|
|
"learning_rate": 6.11173735381147e-07,
|
|
"loss": 0.7103,
|
|
"mean_token_accuracy": 0.8090808987617493,
|
|
"num_tokens": 1290306232.0,
|
|
"step": 12900
|
|
},
|
|
{
|
|
"entropy": 0.95546875,
|
|
"epoch": 1.7643843105097718,
|
|
"grad_norm": 0.2574120861733606,
|
|
"learning_rate": 6.076511201916304e-07,
|
|
"loss": 0.712,
|
|
"mean_token_accuracy": 0.8072498083114624,
|
|
"num_tokens": 1291292043.0,
|
|
"step": 12910
|
|
},
|
|
{
|
|
"entropy": 0.952734375,
|
|
"epoch": 1.7657509908432418,
|
|
"grad_norm": 0.318305830304271,
|
|
"learning_rate": 6.041285050021136e-07,
|
|
"loss": 0.7058,
|
|
"mean_token_accuracy": 0.8069217324256897,
|
|
"num_tokens": 1292227234.0,
|
|
"step": 12920
|
|
},
|
|
{
|
|
"entropy": 0.96015625,
|
|
"epoch": 1.7671176711767118,
|
|
"grad_norm": 0.2539505654843685,
|
|
"learning_rate": 6.006058898125969e-07,
|
|
"loss": 0.6757,
|
|
"mean_token_accuracy": 0.815491783618927,
|
|
"num_tokens": 1293271324.0,
|
|
"step": 12930
|
|
},
|
|
{
|
|
"entropy": 0.978125,
|
|
"epoch": 1.7684843515101818,
|
|
"grad_norm": 0.26929434102992805,
|
|
"learning_rate": 5.970832746230803e-07,
|
|
"loss": 0.7216,
|
|
"mean_token_accuracy": 0.805811607837677,
|
|
"num_tokens": 1294344608.0,
|
|
"step": 12940
|
|
},
|
|
{
|
|
"entropy": 0.964453125,
|
|
"epoch": 1.7698510318436518,
|
|
"grad_norm": 0.2643992005590606,
|
|
"learning_rate": 5.935606594335636e-07,
|
|
"loss": 0.6785,
|
|
"mean_token_accuracy": 0.8147366464138031,
|
|
"num_tokens": 1295392624.0,
|
|
"step": 12950
|
|
},
|
|
{
|
|
"entropy": 0.95,
|
|
"epoch": 1.7712177121771218,
|
|
"grad_norm": 0.26040099073549366,
|
|
"learning_rate": 5.900380442440468e-07,
|
|
"loss": 0.6894,
|
|
"mean_token_accuracy": 0.812649405002594,
|
|
"num_tokens": 1296388849.0,
|
|
"step": 12960
|
|
},
|
|
{
|
|
"entropy": 1.002734375,
|
|
"epoch": 1.7725843925105917,
|
|
"grad_norm": 0.2651387678977714,
|
|
"learning_rate": 5.8651542905453e-07,
|
|
"loss": 0.7554,
|
|
"mean_token_accuracy": 0.7990701377391816,
|
|
"num_tokens": 1297403747.0,
|
|
"step": 12970
|
|
},
|
|
{
|
|
"entropy": 0.928125,
|
|
"epoch": 1.7739510728440617,
|
|
"grad_norm": 0.26546971343401415,
|
|
"learning_rate": 5.829928138650135e-07,
|
|
"loss": 0.6809,
|
|
"mean_token_accuracy": 0.8147707223892212,
|
|
"num_tokens": 1298390531.0,
|
|
"step": 12980
|
|
},
|
|
{
|
|
"entropy": 0.9421875,
|
|
"epoch": 1.7753177531775317,
|
|
"grad_norm": 0.24517454557813892,
|
|
"learning_rate": 5.794701986754967e-07,
|
|
"loss": 0.6706,
|
|
"mean_token_accuracy": 0.8171083450317382,
|
|
"num_tokens": 1299380008.0,
|
|
"step": 12990
|
|
},
|
|
{
|
|
"entropy": 0.943359375,
|
|
"epoch": 1.7766844335110017,
|
|
"grad_norm": 0.2753966369468068,
|
|
"learning_rate": 5.759475834859801e-07,
|
|
"loss": 0.6937,
|
|
"mean_token_accuracy": 0.8118297159671783,
|
|
"num_tokens": 1300380140.0,
|
|
"step": 13000
|
|
},
|
|
{
|
|
"entropy": 0.977734375,
|
|
"epoch": 1.7780511138444717,
|
|
"grad_norm": 0.2720124157205446,
|
|
"learning_rate": 5.724249682964633e-07,
|
|
"loss": 0.7256,
|
|
"mean_token_accuracy": 0.8047678232192993,
|
|
"num_tokens": 1301342727.0,
|
|
"step": 13010
|
|
},
|
|
{
|
|
"entropy": 0.968359375,
|
|
"epoch": 1.7794177941779417,
|
|
"grad_norm": 0.26481100245401745,
|
|
"learning_rate": 5.689023531069466e-07,
|
|
"loss": 0.6767,
|
|
"mean_token_accuracy": 0.8134059846401215,
|
|
"num_tokens": 1302387080.0,
|
|
"step": 13020
|
|
},
|
|
{
|
|
"entropy": 0.962890625,
|
|
"epoch": 1.7807844745114116,
|
|
"grad_norm": 0.2655146683348229,
|
|
"learning_rate": 5.6537973791743e-07,
|
|
"loss": 0.6971,
|
|
"mean_token_accuracy": 0.809563422203064,
|
|
"num_tokens": 1303366775.0,
|
|
"step": 13030
|
|
},
|
|
{
|
|
"entropy": 0.905078125,
|
|
"epoch": 1.7821511548448816,
|
|
"grad_norm": 0.24275373685618296,
|
|
"learning_rate": 5.618571227279133e-07,
|
|
"loss": 0.6859,
|
|
"mean_token_accuracy": 0.8153657853603363,
|
|
"num_tokens": 1304402696.0,
|
|
"step": 13040
|
|
},
|
|
{
|
|
"entropy": 0.919140625,
|
|
"epoch": 1.7835178351783518,
|
|
"grad_norm": 0.27637270016179266,
|
|
"learning_rate": 5.583345075383965e-07,
|
|
"loss": 0.6677,
|
|
"mean_token_accuracy": 0.8157905697822571,
|
|
"num_tokens": 1305437835.0,
|
|
"step": 13050
|
|
},
|
|
{
|
|
"entropy": 0.91484375,
|
|
"epoch": 1.7848845155118218,
|
|
"grad_norm": 0.275152714957303,
|
|
"learning_rate": 5.548118923488799e-07,
|
|
"loss": 0.6502,
|
|
"mean_token_accuracy": 0.8205854177474976,
|
|
"num_tokens": 1306396989.0,
|
|
"step": 13060
|
|
},
|
|
{
|
|
"entropy": 0.920703125,
|
|
"epoch": 1.7862511958452918,
|
|
"grad_norm": 0.24679360315499152,
|
|
"learning_rate": 5.512892771593632e-07,
|
|
"loss": 0.6505,
|
|
"mean_token_accuracy": 0.8210608482360839,
|
|
"num_tokens": 1307411160.0,
|
|
"step": 13070
|
|
},
|
|
{
|
|
"entropy": 0.9671875,
|
|
"epoch": 1.7876178761787618,
|
|
"grad_norm": 0.22945037269395668,
|
|
"learning_rate": 5.477666619698464e-07,
|
|
"loss": 0.7329,
|
|
"mean_token_accuracy": 0.8034459531307221,
|
|
"num_tokens": 1308422364.0,
|
|
"step": 13080
|
|
},
|
|
{
|
|
"entropy": 0.941796875,
|
|
"epoch": 1.7889845565122318,
|
|
"grad_norm": 0.24619154590957879,
|
|
"learning_rate": 5.442440467803298e-07,
|
|
"loss": 0.6797,
|
|
"mean_token_accuracy": 0.8131805717945099,
|
|
"num_tokens": 1309416956.0,
|
|
"step": 13090
|
|
},
|
|
{
|
|
"entropy": 0.963671875,
|
|
"epoch": 1.7903512368457017,
|
|
"grad_norm": 0.2881095246634153,
|
|
"learning_rate": 5.407214315908131e-07,
|
|
"loss": 0.6626,
|
|
"mean_token_accuracy": 0.8175405859947205,
|
|
"num_tokens": 1310437474.0,
|
|
"step": 13100
|
|
},
|
|
{
|
|
"entropy": 0.965234375,
|
|
"epoch": 1.791717917179172,
|
|
"grad_norm": 0.2634548753302209,
|
|
"learning_rate": 5.371988164012964e-07,
|
|
"loss": 0.6974,
|
|
"mean_token_accuracy": 0.8082263350486756,
|
|
"num_tokens": 1311483257.0,
|
|
"step": 13110
|
|
},
|
|
{
|
|
"entropy": 0.912890625,
|
|
"epoch": 1.793084597512642,
|
|
"grad_norm": 0.23913493458552834,
|
|
"learning_rate": 5.336762012117797e-07,
|
|
"loss": 0.6687,
|
|
"mean_token_accuracy": 0.8162523150444031,
|
|
"num_tokens": 1312504017.0,
|
|
"step": 13120
|
|
},
|
|
{
|
|
"entropy": 0.950390625,
|
|
"epoch": 1.794451277846112,
|
|
"grad_norm": 0.27695408201077387,
|
|
"learning_rate": 5.30153586022263e-07,
|
|
"loss": 0.6781,
|
|
"mean_token_accuracy": 0.813936573266983,
|
|
"num_tokens": 1313519252.0,
|
|
"step": 13130
|
|
},
|
|
{
|
|
"entropy": 0.955078125,
|
|
"epoch": 1.795817958179582,
|
|
"grad_norm": 0.24940918146444024,
|
|
"learning_rate": 5.266309708327462e-07,
|
|
"loss": 0.6865,
|
|
"mean_token_accuracy": 0.8133944869041443,
|
|
"num_tokens": 1314515155.0,
|
|
"step": 13140
|
|
},
|
|
{
|
|
"entropy": 0.9171875,
|
|
"epoch": 1.7971846385130519,
|
|
"grad_norm": 0.2547328798126794,
|
|
"learning_rate": 5.231083556432296e-07,
|
|
"loss": 0.6625,
|
|
"mean_token_accuracy": 0.8206698894500732,
|
|
"num_tokens": 1315494592.0,
|
|
"step": 13150
|
|
},
|
|
{
|
|
"entropy": 0.978125,
|
|
"epoch": 1.7985513188465219,
|
|
"grad_norm": 0.26662497034585336,
|
|
"learning_rate": 5.195857404537129e-07,
|
|
"loss": 0.7502,
|
|
"mean_token_accuracy": 0.8040411651134491,
|
|
"num_tokens": 1316485334.0,
|
|
"step": 13160
|
|
},
|
|
{
|
|
"entropy": 0.958984375,
|
|
"epoch": 1.7999179991799918,
|
|
"grad_norm": 0.28338417688101747,
|
|
"learning_rate": 5.160631252641961e-07,
|
|
"loss": 0.6782,
|
|
"mean_token_accuracy": 0.8160488963127136,
|
|
"num_tokens": 1317455713.0,
|
|
"step": 13170
|
|
},
|
|
{
|
|
"entropy": 0.928125,
|
|
"epoch": 1.8012846795134618,
|
|
"grad_norm": 0.29588372721361944,
|
|
"learning_rate": 5.125405100746795e-07,
|
|
"loss": 0.6926,
|
|
"mean_token_accuracy": 0.811240428686142,
|
|
"num_tokens": 1318491881.0,
|
|
"step": 13180
|
|
},
|
|
{
|
|
"entropy": 0.954296875,
|
|
"epoch": 1.8026513598469318,
|
|
"grad_norm": 0.27260985250105885,
|
|
"learning_rate": 5.090178948851628e-07,
|
|
"loss": 0.7081,
|
|
"mean_token_accuracy": 0.8072576284408569,
|
|
"num_tokens": 1319522529.0,
|
|
"step": 13190
|
|
},
|
|
{
|
|
"entropy": 0.986328125,
|
|
"epoch": 1.8040180401804018,
|
|
"grad_norm": 0.3060165564543665,
|
|
"learning_rate": 5.054952796956461e-07,
|
|
"loss": 0.7118,
|
|
"mean_token_accuracy": 0.8072555541992188,
|
|
"num_tokens": 1320498119.0,
|
|
"step": 13200
|
|
},
|
|
{
|
|
"entropy": 0.908984375,
|
|
"epoch": 1.8053847205138718,
|
|
"grad_norm": 0.2614040478788994,
|
|
"learning_rate": 5.019726645061294e-07,
|
|
"loss": 0.6289,
|
|
"mean_token_accuracy": 0.8256859600543975,
|
|
"num_tokens": 1321520797.0,
|
|
"step": 13210
|
|
},
|
|
{
|
|
"entropy": 1.001171875,
|
|
"epoch": 1.8067514008473418,
|
|
"grad_norm": 0.30563263137892105,
|
|
"learning_rate": 4.984500493166127e-07,
|
|
"loss": 0.6944,
|
|
"mean_token_accuracy": 0.8115683495998383,
|
|
"num_tokens": 1322533199.0,
|
|
"step": 13220
|
|
},
|
|
{
|
|
"entropy": 0.8890625,
|
|
"epoch": 1.8081180811808117,
|
|
"grad_norm": 0.26289622728973633,
|
|
"learning_rate": 4.94927434127096e-07,
|
|
"loss": 0.6264,
|
|
"mean_token_accuracy": 0.827044689655304,
|
|
"num_tokens": 1323516433.0,
|
|
"step": 13230
|
|
},
|
|
{
|
|
"entropy": 0.9625,
|
|
"epoch": 1.8094847615142817,
|
|
"grad_norm": 0.2894390902336599,
|
|
"learning_rate": 4.914048189375794e-07,
|
|
"loss": 0.7037,
|
|
"mean_token_accuracy": 0.8101189374923706,
|
|
"num_tokens": 1324489442.0,
|
|
"step": 13240
|
|
},
|
|
{
|
|
"entropy": 0.949609375,
|
|
"epoch": 1.8108514418477517,
|
|
"grad_norm": 0.27217995436223147,
|
|
"learning_rate": 4.878822037480626e-07,
|
|
"loss": 0.7024,
|
|
"mean_token_accuracy": 0.8095542132854462,
|
|
"num_tokens": 1325407187.0,
|
|
"step": 13250
|
|
},
|
|
{
|
|
"entropy": 0.944140625,
|
|
"epoch": 1.8122181221812217,
|
|
"grad_norm": 0.2509119591114115,
|
|
"learning_rate": 4.843595885585459e-07,
|
|
"loss": 0.6931,
|
|
"mean_token_accuracy": 0.8120272696018219,
|
|
"num_tokens": 1326374552.0,
|
|
"step": 13260
|
|
},
|
|
{
|
|
"entropy": 0.944921875,
|
|
"epoch": 1.8135848025146917,
|
|
"grad_norm": 0.2805693613311096,
|
|
"learning_rate": 4.808369733690292e-07,
|
|
"loss": 0.6905,
|
|
"mean_token_accuracy": 0.8110070943832397,
|
|
"num_tokens": 1327402092.0,
|
|
"step": 13270
|
|
},
|
|
{
|
|
"entropy": 0.994140625,
|
|
"epoch": 1.8149514828481617,
|
|
"grad_norm": 0.27301203333421226,
|
|
"learning_rate": 4.773143581795125e-07,
|
|
"loss": 0.7478,
|
|
"mean_token_accuracy": 0.8016707718372345,
|
|
"num_tokens": 1328445454.0,
|
|
"step": 13280
|
|
},
|
|
{
|
|
"entropy": 0.922265625,
|
|
"epoch": 1.8163181631816319,
|
|
"grad_norm": 0.27092189694943697,
|
|
"learning_rate": 4.7379174298999583e-07,
|
|
"loss": 0.6549,
|
|
"mean_token_accuracy": 0.8206198513507843,
|
|
"num_tokens": 1329428756.0,
|
|
"step": 13290
|
|
},
|
|
{
|
|
"entropy": 0.96015625,
|
|
"epoch": 1.8176848435151018,
|
|
"grad_norm": 0.2775130199363729,
|
|
"learning_rate": 4.702691278004791e-07,
|
|
"loss": 0.6873,
|
|
"mean_token_accuracy": 0.8135411202907562,
|
|
"num_tokens": 1330472541.0,
|
|
"step": 13300
|
|
},
|
|
{
|
|
"entropy": 0.93125,
|
|
"epoch": 1.8190515238485718,
|
|
"grad_norm": 0.2984696400043379,
|
|
"learning_rate": 4.6674651261096245e-07,
|
|
"loss": 0.663,
|
|
"mean_token_accuracy": 0.8187650322914124,
|
|
"num_tokens": 1331479843.0,
|
|
"step": 13310
|
|
},
|
|
{
|
|
"entropy": 0.908984375,
|
|
"epoch": 1.8204182041820418,
|
|
"grad_norm": 0.288832423005238,
|
|
"learning_rate": 4.632238974214457e-07,
|
|
"loss": 0.6553,
|
|
"mean_token_accuracy": 0.8202383279800415,
|
|
"num_tokens": 1332493314.0,
|
|
"step": 13320
|
|
},
|
|
{
|
|
"entropy": 0.9265625,
|
|
"epoch": 1.8217848845155118,
|
|
"grad_norm": 0.25105690106917955,
|
|
"learning_rate": 4.5970128223192907e-07,
|
|
"loss": 0.6772,
|
|
"mean_token_accuracy": 0.8151675045490265,
|
|
"num_tokens": 1333490980.0,
|
|
"step": 13330
|
|
},
|
|
{
|
|
"entropy": 0.921875,
|
|
"epoch": 1.8231515648489818,
|
|
"grad_norm": 0.2557426236695699,
|
|
"learning_rate": 4.561786670424123e-07,
|
|
"loss": 0.6572,
|
|
"mean_token_accuracy": 0.8196220576763154,
|
|
"num_tokens": 1334466846.0,
|
|
"step": 13340
|
|
},
|
|
{
|
|
"entropy": 0.9453125,
|
|
"epoch": 1.824518245182452,
|
|
"grad_norm": 0.2777716206655481,
|
|
"learning_rate": 4.5265605185289563e-07,
|
|
"loss": 0.6694,
|
|
"mean_token_accuracy": 0.81638463139534,
|
|
"num_tokens": 1335493116.0,
|
|
"step": 13350
|
|
},
|
|
{
|
|
"entropy": 0.9171875,
|
|
"epoch": 1.825884925515922,
|
|
"grad_norm": 0.24185120909099528,
|
|
"learning_rate": 4.491334366633789e-07,
|
|
"loss": 0.6673,
|
|
"mean_token_accuracy": 0.8166212677955628,
|
|
"num_tokens": 1336516552.0,
|
|
"step": 13360
|
|
},
|
|
{
|
|
"entropy": 0.959765625,
|
|
"epoch": 1.827251605849392,
|
|
"grad_norm": 0.271642556695329,
|
|
"learning_rate": 4.456108214738622e-07,
|
|
"loss": 0.7004,
|
|
"mean_token_accuracy": 0.8110799014568328,
|
|
"num_tokens": 1337514975.0,
|
|
"step": 13370
|
|
},
|
|
{
|
|
"entropy": 0.946484375,
|
|
"epoch": 1.828618286182862,
|
|
"grad_norm": 0.3156444038200316,
|
|
"learning_rate": 4.4208820628434553e-07,
|
|
"loss": 0.6803,
|
|
"mean_token_accuracy": 0.8153466701507568,
|
|
"num_tokens": 1338513483.0,
|
|
"step": 13380
|
|
},
|
|
{
|
|
"entropy": 0.958984375,
|
|
"epoch": 1.829984966516332,
|
|
"grad_norm": 0.27771287208993956,
|
|
"learning_rate": 4.385655910948288e-07,
|
|
"loss": 0.7165,
|
|
"mean_token_accuracy": 0.8051886796951294,
|
|
"num_tokens": 1339518810.0,
|
|
"step": 13390
|
|
},
|
|
{
|
|
"entropy": 0.960546875,
|
|
"epoch": 1.831351646849802,
|
|
"grad_norm": 0.27028464963219406,
|
|
"learning_rate": 4.3504297590531215e-07,
|
|
"loss": 0.7335,
|
|
"mean_token_accuracy": 0.8025502026081085,
|
|
"num_tokens": 1340527451.0,
|
|
"step": 13400
|
|
},
|
|
{
|
|
"entropy": 0.914453125,
|
|
"epoch": 1.8327183271832719,
|
|
"grad_norm": 0.2686492904531506,
|
|
"learning_rate": 4.3152036071579543e-07,
|
|
"loss": 0.6666,
|
|
"mean_token_accuracy": 0.8180868923664093,
|
|
"num_tokens": 1341550702.0,
|
|
"step": 13410
|
|
},
|
|
{
|
|
"entropy": 0.91640625,
|
|
"epoch": 1.8340850075167419,
|
|
"grad_norm": 0.2516752125658997,
|
|
"learning_rate": 4.2799774552627877e-07,
|
|
"loss": 0.6688,
|
|
"mean_token_accuracy": 0.8170841038227081,
|
|
"num_tokens": 1342575219.0,
|
|
"step": 13420
|
|
},
|
|
{
|
|
"entropy": 0.934765625,
|
|
"epoch": 1.8354516878502118,
|
|
"grad_norm": 0.2902690212768455,
|
|
"learning_rate": 4.2447513033676205e-07,
|
|
"loss": 0.673,
|
|
"mean_token_accuracy": 0.8158302664756775,
|
|
"num_tokens": 1343565670.0,
|
|
"step": 13430
|
|
},
|
|
{
|
|
"entropy": 0.93203125,
|
|
"epoch": 1.8368183681836818,
|
|
"grad_norm": 0.26856743696035196,
|
|
"learning_rate": 4.209525151472454e-07,
|
|
"loss": 0.685,
|
|
"mean_token_accuracy": 0.8132183849811554,
|
|
"num_tokens": 1344543137.0,
|
|
"step": 13440
|
|
},
|
|
{
|
|
"entropy": 0.97265625,
|
|
"epoch": 1.8381850485171518,
|
|
"grad_norm": 0.2772631494358592,
|
|
"learning_rate": 4.1742989995772867e-07,
|
|
"loss": 0.712,
|
|
"mean_token_accuracy": 0.8059018790721894,
|
|
"num_tokens": 1345577171.0,
|
|
"step": 13450
|
|
},
|
|
{
|
|
"entropy": 0.9796875,
|
|
"epoch": 1.8395517288506218,
|
|
"grad_norm": 0.27613103449445536,
|
|
"learning_rate": 4.13907284768212e-07,
|
|
"loss": 0.7171,
|
|
"mean_token_accuracy": 0.8064652621746063,
|
|
"num_tokens": 1346542242.0,
|
|
"step": 13460
|
|
},
|
|
{
|
|
"entropy": 0.97578125,
|
|
"epoch": 1.8409184091840918,
|
|
"grad_norm": 0.2755340806929327,
|
|
"learning_rate": 4.1038466957869523e-07,
|
|
"loss": 0.6852,
|
|
"mean_token_accuracy": 0.8128474593162537,
|
|
"num_tokens": 1347510243.0,
|
|
"step": 13470
|
|
},
|
|
{
|
|
"entropy": 0.953125,
|
|
"epoch": 1.8422850895175618,
|
|
"grad_norm": 0.2728333640238315,
|
|
"learning_rate": 4.068620543891785e-07,
|
|
"loss": 0.6908,
|
|
"mean_token_accuracy": 0.8113927125930787,
|
|
"num_tokens": 1348582573.0,
|
|
"step": 13480
|
|
},
|
|
{
|
|
"entropy": 0.935546875,
|
|
"epoch": 1.8436517698510317,
|
|
"grad_norm": 0.2517100825754709,
|
|
"learning_rate": 4.0333943919966185e-07,
|
|
"loss": 0.7059,
|
|
"mean_token_accuracy": 0.8082773149013519,
|
|
"num_tokens": 1349636357.0,
|
|
"step": 13490
|
|
},
|
|
{
|
|
"entropy": 0.913671875,
|
|
"epoch": 1.8450184501845017,
|
|
"grad_norm": 0.26481201500854873,
|
|
"learning_rate": 3.9981682401014513e-07,
|
|
"loss": 0.661,
|
|
"mean_token_accuracy": 0.8183166742324829,
|
|
"num_tokens": 1350688209.0,
|
|
"step": 13500
|
|
},
|
|
{
|
|
"entropy": 0.9125,
|
|
"epoch": 1.8463851305179717,
|
|
"grad_norm": 0.2591571963498134,
|
|
"learning_rate": 3.9629420882062847e-07,
|
|
"loss": 0.6615,
|
|
"mean_token_accuracy": 0.8183167159557343,
|
|
"num_tokens": 1351686326.0,
|
|
"step": 13510
|
|
},
|
|
{
|
|
"entropy": 0.978125,
|
|
"epoch": 1.8477518108514417,
|
|
"grad_norm": 0.26099497863203047,
|
|
"learning_rate": 3.9277159363111175e-07,
|
|
"loss": 0.6857,
|
|
"mean_token_accuracy": 0.8122619450092315,
|
|
"num_tokens": 1352685550.0,
|
|
"step": 13520
|
|
},
|
|
{
|
|
"entropy": 0.955078125,
|
|
"epoch": 1.849118491184912,
|
|
"grad_norm": 0.26945087592212075,
|
|
"learning_rate": 3.892489784415951e-07,
|
|
"loss": 0.6889,
|
|
"mean_token_accuracy": 0.8122616529464721,
|
|
"num_tokens": 1353677598.0,
|
|
"step": 13530
|
|
},
|
|
{
|
|
"entropy": 0.991015625,
|
|
"epoch": 1.8504851715183819,
|
|
"grad_norm": 0.3035147817108464,
|
|
"learning_rate": 3.8572636325207837e-07,
|
|
"loss": 0.7142,
|
|
"mean_token_accuracy": 0.8051504909992218,
|
|
"num_tokens": 1354595839.0,
|
|
"step": 13540
|
|
},
|
|
{
|
|
"entropy": 0.987890625,
|
|
"epoch": 1.8518518518518519,
|
|
"grad_norm": 0.2729747993248406,
|
|
"learning_rate": 3.822037480625617e-07,
|
|
"loss": 0.6874,
|
|
"mean_token_accuracy": 0.8133319437503814,
|
|
"num_tokens": 1355600144.0,
|
|
"step": 13550
|
|
},
|
|
{
|
|
"entropy": 0.92109375,
|
|
"epoch": 1.8532185321853218,
|
|
"grad_norm": 0.2693543502484393,
|
|
"learning_rate": 3.78681132873045e-07,
|
|
"loss": 0.6481,
|
|
"mean_token_accuracy": 0.8226533830165863,
|
|
"num_tokens": 1356670331.0,
|
|
"step": 13560
|
|
},
|
|
{
|
|
"entropy": 0.966796875,
|
|
"epoch": 1.8545852125187918,
|
|
"grad_norm": 0.24411386833820675,
|
|
"learning_rate": 3.7515851768352827e-07,
|
|
"loss": 0.6948,
|
|
"mean_token_accuracy": 0.8103599846363068,
|
|
"num_tokens": 1357661057.0,
|
|
"step": 13570
|
|
},
|
|
{
|
|
"entropy": 0.976171875,
|
|
"epoch": 1.8559518928522618,
|
|
"grad_norm": 0.29325742942215177,
|
|
"learning_rate": 3.716359024940116e-07,
|
|
"loss": 0.6973,
|
|
"mean_token_accuracy": 0.809085738658905,
|
|
"num_tokens": 1358616915.0,
|
|
"step": 13580
|
|
},
|
|
{
|
|
"entropy": 0.956640625,
|
|
"epoch": 1.857318573185732,
|
|
"grad_norm": 0.29613284375511123,
|
|
"learning_rate": 3.6811328730449484e-07,
|
|
"loss": 0.6926,
|
|
"mean_token_accuracy": 0.8096820950508118,
|
|
"num_tokens": 1359643045.0,
|
|
"step": 13590
|
|
},
|
|
{
|
|
"entropy": 0.95859375,
|
|
"epoch": 1.858685253519202,
|
|
"grad_norm": 0.2586848269679132,
|
|
"learning_rate": 3.645906721149782e-07,
|
|
"loss": 0.6733,
|
|
"mean_token_accuracy": 0.8157423138618469,
|
|
"num_tokens": 1360589535.0,
|
|
"step": 13600
|
|
},
|
|
{
|
|
"entropy": 0.9640625,
|
|
"epoch": 1.860051933852672,
|
|
"grad_norm": 0.2683722801708602,
|
|
"learning_rate": 3.6106805692546145e-07,
|
|
"loss": 0.6803,
|
|
"mean_token_accuracy": 0.8160109162330628,
|
|
"num_tokens": 1361633326.0,
|
|
"step": 13610
|
|
},
|
|
{
|
|
"entropy": 0.979296875,
|
|
"epoch": 1.861418614186142,
|
|
"grad_norm": 0.2672818576709852,
|
|
"learning_rate": 3.575454417359448e-07,
|
|
"loss": 0.6857,
|
|
"mean_token_accuracy": 0.813263887166977,
|
|
"num_tokens": 1362627505.0,
|
|
"step": 13620
|
|
},
|
|
{
|
|
"entropy": 0.9671875,
|
|
"epoch": 1.862785294519612,
|
|
"grad_norm": 0.27361505857675955,
|
|
"learning_rate": 3.5402282654642807e-07,
|
|
"loss": 0.654,
|
|
"mean_token_accuracy": 0.8203106939792633,
|
|
"num_tokens": 1363598703.0,
|
|
"step": 13630
|
|
},
|
|
{
|
|
"entropy": 0.9703125,
|
|
"epoch": 1.864151974853082,
|
|
"grad_norm": 0.2614971202230006,
|
|
"learning_rate": 3.505002113569114e-07,
|
|
"loss": 0.7138,
|
|
"mean_token_accuracy": 0.8066613376140594,
|
|
"num_tokens": 1364623838.0,
|
|
"step": 13640
|
|
},
|
|
{
|
|
"entropy": 0.955078125,
|
|
"epoch": 1.865518655186552,
|
|
"grad_norm": 0.3178833978514437,
|
|
"learning_rate": 3.469775961673947e-07,
|
|
"loss": 0.6852,
|
|
"mean_token_accuracy": 0.8122337937355042,
|
|
"num_tokens": 1365591620.0,
|
|
"step": 13650
|
|
},
|
|
{
|
|
"entropy": 0.940234375,
|
|
"epoch": 1.866885335520022,
|
|
"grad_norm": 0.2507447435339676,
|
|
"learning_rate": 3.43454980977878e-07,
|
|
"loss": 0.6808,
|
|
"mean_token_accuracy": 0.8167520880699157,
|
|
"num_tokens": 1366562325.0,
|
|
"step": 13660
|
|
},
|
|
{
|
|
"entropy": 0.975,
|
|
"epoch": 1.8682520158534919,
|
|
"grad_norm": 0.2690109511939931,
|
|
"learning_rate": 3.399323657883613e-07,
|
|
"loss": 0.6916,
|
|
"mean_token_accuracy": 0.8111134529113769,
|
|
"num_tokens": 1367547706.0,
|
|
"step": 13670
|
|
},
|
|
{
|
|
"entropy": 0.96796875,
|
|
"epoch": 1.8696186961869619,
|
|
"grad_norm": 0.2551323292557921,
|
|
"learning_rate": 3.364097505988446e-07,
|
|
"loss": 0.7091,
|
|
"mean_token_accuracy": 0.8074650466442108,
|
|
"num_tokens": 1368583588.0,
|
|
"step": 13680
|
|
},
|
|
{
|
|
"entropy": 0.96328125,
|
|
"epoch": 1.8709853765204318,
|
|
"grad_norm": 0.2581590346467588,
|
|
"learning_rate": 3.328871354093279e-07,
|
|
"loss": 0.689,
|
|
"mean_token_accuracy": 0.8116632103919983,
|
|
"num_tokens": 1369619311.0,
|
|
"step": 13690
|
|
},
|
|
{
|
|
"entropy": 0.979296875,
|
|
"epoch": 1.8723520568539018,
|
|
"grad_norm": 0.26449443963238983,
|
|
"learning_rate": 3.293645202198112e-07,
|
|
"loss": 0.7115,
|
|
"mean_token_accuracy": 0.8070672988891602,
|
|
"num_tokens": 1370620293.0,
|
|
"step": 13700
|
|
},
|
|
{
|
|
"entropy": 0.96953125,
|
|
"epoch": 1.8737187371873718,
|
|
"grad_norm": 0.2430112650812469,
|
|
"learning_rate": 3.2584190503029454e-07,
|
|
"loss": 0.6944,
|
|
"mean_token_accuracy": 0.809479683637619,
|
|
"num_tokens": 1371582481.0,
|
|
"step": 13710
|
|
},
|
|
{
|
|
"entropy": 0.9375,
|
|
"epoch": 1.8750854175208418,
|
|
"grad_norm": 0.2542294463689465,
|
|
"learning_rate": 3.223192898407778e-07,
|
|
"loss": 0.6954,
|
|
"mean_token_accuracy": 0.8124999344348908,
|
|
"num_tokens": 1372591370.0,
|
|
"step": 13720
|
|
},
|
|
{
|
|
"entropy": 0.95625,
|
|
"epoch": 1.8764520978543118,
|
|
"grad_norm": 0.25297799052940995,
|
|
"learning_rate": 3.1879667465126116e-07,
|
|
"loss": 0.6659,
|
|
"mean_token_accuracy": 0.8191012561321258,
|
|
"num_tokens": 1373606101.0,
|
|
"step": 13730
|
|
},
|
|
{
|
|
"entropy": 0.937109375,
|
|
"epoch": 1.8778187781877818,
|
|
"grad_norm": 0.23562258898952695,
|
|
"learning_rate": 3.152740594617444e-07,
|
|
"loss": 0.6739,
|
|
"mean_token_accuracy": 0.8173068284988403,
|
|
"num_tokens": 1374669486.0,
|
|
"step": 13740
|
|
},
|
|
{
|
|
"entropy": 0.955859375,
|
|
"epoch": 1.8791854585212517,
|
|
"grad_norm": 0.2672315577873445,
|
|
"learning_rate": 3.117514442722277e-07,
|
|
"loss": 0.677,
|
|
"mean_token_accuracy": 0.8152702510356903,
|
|
"num_tokens": 1375701416.0,
|
|
"step": 13750
|
|
},
|
|
{
|
|
"entropy": 0.894140625,
|
|
"epoch": 1.8805521388547217,
|
|
"grad_norm": 0.24900921209282503,
|
|
"learning_rate": 3.08228829082711e-07,
|
|
"loss": 0.611,
|
|
"mean_token_accuracy": 0.8297919452190399,
|
|
"num_tokens": 1376758478.0,
|
|
"step": 13760
|
|
},
|
|
{
|
|
"entropy": 0.952734375,
|
|
"epoch": 1.881918819188192,
|
|
"grad_norm": 0.29796939554149116,
|
|
"learning_rate": 3.0470621389319434e-07,
|
|
"loss": 0.6899,
|
|
"mean_token_accuracy": 0.8122688055038452,
|
|
"num_tokens": 1377731744.0,
|
|
"step": 13770
|
|
},
|
|
{
|
|
"entropy": 0.93984375,
|
|
"epoch": 1.883285499521662,
|
|
"grad_norm": 0.24342559302570527,
|
|
"learning_rate": 3.0118359870367763e-07,
|
|
"loss": 0.6844,
|
|
"mean_token_accuracy": 0.8141980469226837,
|
|
"num_tokens": 1378676516.0,
|
|
"step": 13780
|
|
},
|
|
{
|
|
"entropy": 0.9203125,
|
|
"epoch": 1.884652179855132,
|
|
"grad_norm": 0.2673875674617752,
|
|
"learning_rate": 2.9766098351416096e-07,
|
|
"loss": 0.6425,
|
|
"mean_token_accuracy": 0.8221307039260864,
|
|
"num_tokens": 1379694371.0,
|
|
"step": 13790
|
|
},
|
|
{
|
|
"entropy": 0.95390625,
|
|
"epoch": 1.8860188601886019,
|
|
"grad_norm": 0.2590668282748326,
|
|
"learning_rate": 2.9413836832464424e-07,
|
|
"loss": 0.6954,
|
|
"mean_token_accuracy": 0.8110640168190002,
|
|
"num_tokens": 1380725075.0,
|
|
"step": 13800
|
|
},
|
|
{
|
|
"entropy": 0.996484375,
|
|
"epoch": 1.8873855405220719,
|
|
"grad_norm": 0.27123470112730164,
|
|
"learning_rate": 2.906157531351276e-07,
|
|
"loss": 0.7239,
|
|
"mean_token_accuracy": 0.8060334622859955,
|
|
"num_tokens": 1381734170.0,
|
|
"step": 13810
|
|
},
|
|
{
|
|
"entropy": 0.94140625,
|
|
"epoch": 1.8887522208555418,
|
|
"grad_norm": 0.28635492604133533,
|
|
"learning_rate": 2.8709313794561086e-07,
|
|
"loss": 0.6612,
|
|
"mean_token_accuracy": 0.8191395103931427,
|
|
"num_tokens": 1382760495.0,
|
|
"step": 13820
|
|
},
|
|
{
|
|
"entropy": 0.9546875,
|
|
"epoch": 1.890118901189012,
|
|
"grad_norm": 0.26211477941394334,
|
|
"learning_rate": 2.8357052275609415e-07,
|
|
"loss": 0.7124,
|
|
"mean_token_accuracy": 0.8064443469047546,
|
|
"num_tokens": 1383715689.0,
|
|
"step": 13830
|
|
},
|
|
{
|
|
"entropy": 0.99453125,
|
|
"epoch": 1.891485581522482,
|
|
"grad_norm": 0.24245616938580944,
|
|
"learning_rate": 2.8004790756657743e-07,
|
|
"loss": 0.7315,
|
|
"mean_token_accuracy": 0.8045948803424835,
|
|
"num_tokens": 1384708046.0,
|
|
"step": 13840
|
|
},
|
|
{
|
|
"entropy": 0.9546875,
|
|
"epoch": 1.892852261855952,
|
|
"grad_norm": 0.2437943013802228,
|
|
"learning_rate": 2.7652529237706076e-07,
|
|
"loss": 0.6796,
|
|
"mean_token_accuracy": 0.8143338561058044,
|
|
"num_tokens": 1385697303.0,
|
|
"step": 13850
|
|
},
|
|
{
|
|
"entropy": 0.935546875,
|
|
"epoch": 1.894218942189422,
|
|
"grad_norm": 0.26235732514900784,
|
|
"learning_rate": 2.7300267718754405e-07,
|
|
"loss": 0.6984,
|
|
"mean_token_accuracy": 0.8108078718185425,
|
|
"num_tokens": 1386666553.0,
|
|
"step": 13860
|
|
},
|
|
{
|
|
"entropy": 0.884765625,
|
|
"epoch": 1.895585622522892,
|
|
"grad_norm": 0.25737087883423804,
|
|
"learning_rate": 2.694800619980274e-07,
|
|
"loss": 0.6592,
|
|
"mean_token_accuracy": 0.8207131803035737,
|
|
"num_tokens": 1387666933.0,
|
|
"step": 13870
|
|
},
|
|
{
|
|
"entropy": 0.926953125,
|
|
"epoch": 1.896952302856362,
|
|
"grad_norm": 0.2864724832327557,
|
|
"learning_rate": 2.6595744680851066e-07,
|
|
"loss": 0.6657,
|
|
"mean_token_accuracy": 0.8175610780715943,
|
|
"num_tokens": 1388708335.0,
|
|
"step": 13880
|
|
},
|
|
{
|
|
"entropy": 0.96328125,
|
|
"epoch": 1.898318983189832,
|
|
"grad_norm": 0.2514363176616716,
|
|
"learning_rate": 2.6243483161899395e-07,
|
|
"loss": 0.6886,
|
|
"mean_token_accuracy": 0.812585300207138,
|
|
"num_tokens": 1389687489.0,
|
|
"step": 13890
|
|
},
|
|
{
|
|
"entropy": 0.94375,
|
|
"epoch": 1.899685663523302,
|
|
"grad_norm": 0.25950353640716867,
|
|
"learning_rate": 2.589122164294773e-07,
|
|
"loss": 0.6962,
|
|
"mean_token_accuracy": 0.8113864421844482,
|
|
"num_tokens": 1390740352.0,
|
|
"step": 13900
|
|
},
|
|
{
|
|
"entropy": 0.944140625,
|
|
"epoch": 1.901052343856772,
|
|
"grad_norm": 0.27491288314587525,
|
|
"learning_rate": 2.5538960123996056e-07,
|
|
"loss": 0.6702,
|
|
"mean_token_accuracy": 0.8166943252086639,
|
|
"num_tokens": 1391739989.0,
|
|
"step": 13910
|
|
},
|
|
{
|
|
"entropy": 0.946484375,
|
|
"epoch": 1.902419024190242,
|
|
"grad_norm": 0.2671419874341638,
|
|
"learning_rate": 2.518669860504439e-07,
|
|
"loss": 0.6835,
|
|
"mean_token_accuracy": 0.8126407086849212,
|
|
"num_tokens": 1392697957.0,
|
|
"step": 13920
|
|
},
|
|
{
|
|
"entropy": 0.959765625,
|
|
"epoch": 1.9037857045237119,
|
|
"grad_norm": 0.2675897014998099,
|
|
"learning_rate": 2.483443708609272e-07,
|
|
"loss": 0.6953,
|
|
"mean_token_accuracy": 0.8099574685096741,
|
|
"num_tokens": 1393680975.0,
|
|
"step": 13930
|
|
},
|
|
{
|
|
"entropy": 0.92421875,
|
|
"epoch": 1.9051523848571819,
|
|
"grad_norm": 0.3290093973956107,
|
|
"learning_rate": 2.4482175567141046e-07,
|
|
"loss": 0.6447,
|
|
"mean_token_accuracy": 0.8220310032367706,
|
|
"num_tokens": 1394700240.0,
|
|
"step": 13940
|
|
},
|
|
{
|
|
"entropy": 0.99453125,
|
|
"epoch": 1.9065190651906518,
|
|
"grad_norm": 0.24952845621586395,
|
|
"learning_rate": 2.4129914048189375e-07,
|
|
"loss": 0.7063,
|
|
"mean_token_accuracy": 0.8073102831840515,
|
|
"num_tokens": 1395752339.0,
|
|
"step": 13950
|
|
},
|
|
{
|
|
"entropy": 0.959375,
|
|
"epoch": 1.9078857455241218,
|
|
"grad_norm": 0.2528596620773516,
|
|
"learning_rate": 2.3777652529237708e-07,
|
|
"loss": 0.7013,
|
|
"mean_token_accuracy": 0.8112213253974915,
|
|
"num_tokens": 1396771928.0,
|
|
"step": 13960
|
|
},
|
|
{
|
|
"entropy": 0.9640625,
|
|
"epoch": 1.9092524258575918,
|
|
"grad_norm": 0.26482624503497765,
|
|
"learning_rate": 2.342539101028604e-07,
|
|
"loss": 0.7177,
|
|
"mean_token_accuracy": 0.804797101020813,
|
|
"num_tokens": 1397822025.0,
|
|
"step": 13970
|
|
},
|
|
{
|
|
"entropy": 0.966796875,
|
|
"epoch": 1.9106191061910618,
|
|
"grad_norm": 0.2896380326497143,
|
|
"learning_rate": 2.307312949133437e-07,
|
|
"loss": 0.7287,
|
|
"mean_token_accuracy": 0.8039289295673371,
|
|
"num_tokens": 1398809018.0,
|
|
"step": 13980
|
|
},
|
|
{
|
|
"entropy": 0.92421875,
|
|
"epoch": 1.9119857865245318,
|
|
"grad_norm": 0.25146676398052586,
|
|
"learning_rate": 2.2720867972382698e-07,
|
|
"loss": 0.685,
|
|
"mean_token_accuracy": 0.8123407602310181,
|
|
"num_tokens": 1399817169.0,
|
|
"step": 13990
|
|
},
|
|
{
|
|
"entropy": 0.981640625,
|
|
"epoch": 1.9133524668580018,
|
|
"grad_norm": 0.25976584477174125,
|
|
"learning_rate": 2.236860645343103e-07,
|
|
"loss": 0.6922,
|
|
"mean_token_accuracy": 0.8104903161525726,
|
|
"num_tokens": 1400792761.0,
|
|
"step": 14000
|
|
},
|
|
{
|
|
"entropy": 0.91015625,
|
|
"epoch": 1.914719147191472,
|
|
"grad_norm": 0.2931390928594339,
|
|
"learning_rate": 2.201634493447936e-07,
|
|
"loss": 0.6513,
|
|
"mean_token_accuracy": 0.81877281665802,
|
|
"num_tokens": 1401775004.0,
|
|
"step": 14010
|
|
},
|
|
{
|
|
"entropy": 0.92734375,
|
|
"epoch": 1.916085827524942,
|
|
"grad_norm": 0.2774970575582189,
|
|
"learning_rate": 2.166408341552769e-07,
|
|
"loss": 0.7091,
|
|
"mean_token_accuracy": 0.8072974503040313,
|
|
"num_tokens": 1402756501.0,
|
|
"step": 14020
|
|
},
|
|
{
|
|
"entropy": 0.963671875,
|
|
"epoch": 1.917452507858412,
|
|
"grad_norm": 0.2643214068722207,
|
|
"learning_rate": 2.131182189657602e-07,
|
|
"loss": 0.6578,
|
|
"mean_token_accuracy": 0.8194384038448334,
|
|
"num_tokens": 1403739936.0,
|
|
"step": 14030
|
|
},
|
|
{
|
|
"entropy": 0.95078125,
|
|
"epoch": 1.918819188191882,
|
|
"grad_norm": 0.2693656757672511,
|
|
"learning_rate": 2.095956037762435e-07,
|
|
"loss": 0.6907,
|
|
"mean_token_accuracy": 0.810150557756424,
|
|
"num_tokens": 1404737117.0,
|
|
"step": 14040
|
|
},
|
|
{
|
|
"entropy": 0.967578125,
|
|
"epoch": 1.920185868525352,
|
|
"grad_norm": 0.24600116933437977,
|
|
"learning_rate": 2.0607298858672678e-07,
|
|
"loss": 0.661,
|
|
"mean_token_accuracy": 0.8190665483474732,
|
|
"num_tokens": 1405734788.0,
|
|
"step": 14050
|
|
},
|
|
{
|
|
"entropy": 0.928515625,
|
|
"epoch": 1.9215525488588219,
|
|
"grad_norm": 0.2750780317961758,
|
|
"learning_rate": 2.025503733972101e-07,
|
|
"loss": 0.6719,
|
|
"mean_token_accuracy": 0.8167073249816894,
|
|
"num_tokens": 1406751331.0,
|
|
"step": 14060
|
|
},
|
|
{
|
|
"entropy": 0.983984375,
|
|
"epoch": 1.922919229192292,
|
|
"grad_norm": 0.25835278466971395,
|
|
"learning_rate": 1.990277582076934e-07,
|
|
"loss": 0.7247,
|
|
"mean_token_accuracy": 0.8043821513652801,
|
|
"num_tokens": 1407785215.0,
|
|
"step": 14070
|
|
},
|
|
{
|
|
"entropy": 0.958203125,
|
|
"epoch": 1.924285909525762,
|
|
"grad_norm": 0.28079240914092474,
|
|
"learning_rate": 1.955051430181767e-07,
|
|
"loss": 0.6719,
|
|
"mean_token_accuracy": 0.8151933193206787,
|
|
"num_tokens": 1408718823.0,
|
|
"step": 14080
|
|
},
|
|
{
|
|
"entropy": 0.93828125,
|
|
"epoch": 1.925652589859232,
|
|
"grad_norm": 0.266968864182235,
|
|
"learning_rate": 1.9198252782866002e-07,
|
|
"loss": 0.6675,
|
|
"mean_token_accuracy": 0.818309873342514,
|
|
"num_tokens": 1409707417.0,
|
|
"step": 14090
|
|
},
|
|
{
|
|
"entropy": 0.958203125,
|
|
"epoch": 1.927019270192702,
|
|
"grad_norm": 0.2499988060986301,
|
|
"learning_rate": 1.8845991263914333e-07,
|
|
"loss": 0.6583,
|
|
"mean_token_accuracy": 0.8194469034671783,
|
|
"num_tokens": 1410702222.0,
|
|
"step": 14100
|
|
},
|
|
{
|
|
"entropy": 0.974609375,
|
|
"epoch": 1.928385950526172,
|
|
"grad_norm": 0.2855454484104363,
|
|
"learning_rate": 1.8493729744962664e-07,
|
|
"loss": 0.6769,
|
|
"mean_token_accuracy": 0.8147232294082641,
|
|
"num_tokens": 1411621562.0,
|
|
"step": 14110
|
|
},
|
|
{
|
|
"entropy": 0.996875,
|
|
"epoch": 1.929752630859642,
|
|
"grad_norm": 0.2689290081206273,
|
|
"learning_rate": 1.8141468226010995e-07,
|
|
"loss": 0.7163,
|
|
"mean_token_accuracy": 0.8081669211387634,
|
|
"num_tokens": 1412638000.0,
|
|
"step": 14120
|
|
},
|
|
{
|
|
"entropy": 0.93046875,
|
|
"epoch": 1.931119311193112,
|
|
"grad_norm": 0.272366518859594,
|
|
"learning_rate": 1.778920670705932e-07,
|
|
"loss": 0.6579,
|
|
"mean_token_accuracy": 0.8197247564792634,
|
|
"num_tokens": 1413639889.0,
|
|
"step": 14130
|
|
},
|
|
{
|
|
"entropy": 0.95625,
|
|
"epoch": 1.932485991526582,
|
|
"grad_norm": 0.2436086365069545,
|
|
"learning_rate": 1.743694518810765e-07,
|
|
"loss": 0.6681,
|
|
"mean_token_accuracy": 0.8145573496818542,
|
|
"num_tokens": 1414666234.0,
|
|
"step": 14140
|
|
},
|
|
{
|
|
"entropy": 0.951171875,
|
|
"epoch": 1.933852671860052,
|
|
"grad_norm": 0.26345723190868275,
|
|
"learning_rate": 1.7084683669155982e-07,
|
|
"loss": 0.6415,
|
|
"mean_token_accuracy": 0.8229475378990173,
|
|
"num_tokens": 1415670134.0,
|
|
"step": 14150
|
|
},
|
|
{
|
|
"entropy": 0.964453125,
|
|
"epoch": 1.935219352193522,
|
|
"grad_norm": 0.26231043430557677,
|
|
"learning_rate": 1.6732422150204313e-07,
|
|
"loss": 0.6915,
|
|
"mean_token_accuracy": 0.812344628572464,
|
|
"num_tokens": 1416642461.0,
|
|
"step": 14160
|
|
},
|
|
{
|
|
"entropy": 0.927734375,
|
|
"epoch": 1.936586032526992,
|
|
"grad_norm": 0.24609464052382055,
|
|
"learning_rate": 1.6380160631252644e-07,
|
|
"loss": 0.6587,
|
|
"mean_token_accuracy": 0.8198002636432647,
|
|
"num_tokens": 1417700877.0,
|
|
"step": 14170
|
|
},
|
|
{
|
|
"entropy": 0.94921875,
|
|
"epoch": 1.937952712860462,
|
|
"grad_norm": 0.2416882456495494,
|
|
"learning_rate": 1.6027899112300975e-07,
|
|
"loss": 0.6675,
|
|
"mean_token_accuracy": 0.8173816204071045,
|
|
"num_tokens": 1418691154.0,
|
|
"step": 14180
|
|
},
|
|
{
|
|
"entropy": 0.939453125,
|
|
"epoch": 1.9393193931939319,
|
|
"grad_norm": 0.23481614223604505,
|
|
"learning_rate": 1.5675637593349303e-07,
|
|
"loss": 0.6433,
|
|
"mean_token_accuracy": 0.8231639742851258,
|
|
"num_tokens": 1419717600.0,
|
|
"step": 14190
|
|
},
|
|
{
|
|
"entropy": 0.94609375,
|
|
"epoch": 1.9406860735274019,
|
|
"grad_norm": 0.2679311484363052,
|
|
"learning_rate": 1.5323376074397634e-07,
|
|
"loss": 0.6936,
|
|
"mean_token_accuracy": 0.8103129923343658,
|
|
"num_tokens": 1420737827.0,
|
|
"step": 14200
|
|
},
|
|
{
|
|
"entropy": 1.023046875,
|
|
"epoch": 1.9420527538608718,
|
|
"grad_norm": 0.2967737690401374,
|
|
"learning_rate": 1.4971114555445965e-07,
|
|
"loss": 0.7595,
|
|
"mean_token_accuracy": 0.7957878828048706,
|
|
"num_tokens": 1421751522.0,
|
|
"step": 14210
|
|
},
|
|
{
|
|
"entropy": 0.97265625,
|
|
"epoch": 1.9434194341943418,
|
|
"grad_norm": 0.2716083486131373,
|
|
"learning_rate": 1.4618853036494293e-07,
|
|
"loss": 0.7069,
|
|
"mean_token_accuracy": 0.808570945262909,
|
|
"num_tokens": 1422734672.0,
|
|
"step": 14220
|
|
},
|
|
{
|
|
"entropy": 0.946484375,
|
|
"epoch": 1.9447861145278118,
|
|
"grad_norm": 0.26425385739710033,
|
|
"learning_rate": 1.4266591517542624e-07,
|
|
"loss": 0.716,
|
|
"mean_token_accuracy": 0.806209659576416,
|
|
"num_tokens": 1423713545.0,
|
|
"step": 14230
|
|
},
|
|
{
|
|
"entropy": 0.945703125,
|
|
"epoch": 1.9461527948612818,
|
|
"grad_norm": 0.2427078443234462,
|
|
"learning_rate": 1.3914329998590955e-07,
|
|
"loss": 0.6602,
|
|
"mean_token_accuracy": 0.8193513333797455,
|
|
"num_tokens": 1424645986.0,
|
|
"step": 14240
|
|
},
|
|
{
|
|
"entropy": 0.951953125,
|
|
"epoch": 1.947519475194752,
|
|
"grad_norm": 0.2503729556822116,
|
|
"learning_rate": 1.3562068479639286e-07,
|
|
"loss": 0.6881,
|
|
"mean_token_accuracy": 0.8127703487873077,
|
|
"num_tokens": 1425688603.0,
|
|
"step": 14250
|
|
},
|
|
{
|
|
"entropy": 0.908984375,
|
|
"epoch": 1.948886155528222,
|
|
"grad_norm": 0.26475615577424205,
|
|
"learning_rate": 1.3209806960687614e-07,
|
|
"loss": 0.6539,
|
|
"mean_token_accuracy": 0.8210596740245819,
|
|
"num_tokens": 1426653167.0,
|
|
"step": 14260
|
|
},
|
|
{
|
|
"entropy": 0.961328125,
|
|
"epoch": 1.950252835861692,
|
|
"grad_norm": 0.27254695708412635,
|
|
"learning_rate": 1.2857545441735945e-07,
|
|
"loss": 0.6716,
|
|
"mean_token_accuracy": 0.8161811590194702,
|
|
"num_tokens": 1427641418.0,
|
|
"step": 14270
|
|
},
|
|
{
|
|
"entropy": 0.96171875,
|
|
"epoch": 1.951619516195162,
|
|
"grad_norm": 0.2881707686302851,
|
|
"learning_rate": 1.2505283922784276e-07,
|
|
"loss": 0.6917,
|
|
"mean_token_accuracy": 0.8130960464477539,
|
|
"num_tokens": 1428672424.0,
|
|
"step": 14280
|
|
},
|
|
{
|
|
"entropy": 0.923828125,
|
|
"epoch": 1.952986196528632,
|
|
"grad_norm": 0.250462599258687,
|
|
"learning_rate": 1.2153022403832607e-07,
|
|
"loss": 0.682,
|
|
"mean_token_accuracy": 0.8129820108413697,
|
|
"num_tokens": 1429685204.0,
|
|
"step": 14290
|
|
},
|
|
{
|
|
"entropy": 0.951171875,
|
|
"epoch": 1.954352876862102,
|
|
"grad_norm": 0.2623774397922118,
|
|
"learning_rate": 1.1800760884880937e-07,
|
|
"loss": 0.7009,
|
|
"mean_token_accuracy": 0.809536474943161,
|
|
"num_tokens": 1430729799.0,
|
|
"step": 14300
|
|
},
|
|
{
|
|
"entropy": 0.9515625,
|
|
"epoch": 1.9557195571955721,
|
|
"grad_norm": 0.2529117700705809,
|
|
"learning_rate": 1.1448499365929266e-07,
|
|
"loss": 0.6896,
|
|
"mean_token_accuracy": 0.8120938122272492,
|
|
"num_tokens": 1431740518.0,
|
|
"step": 14310
|
|
},
|
|
{
|
|
"entropy": 0.943359375,
|
|
"epoch": 1.957086237529042,
|
|
"grad_norm": 0.24752173375797248,
|
|
"learning_rate": 1.1096237846977597e-07,
|
|
"loss": 0.6809,
|
|
"mean_token_accuracy": 0.8146515965461731,
|
|
"num_tokens": 1432734226.0,
|
|
"step": 14320
|
|
},
|
|
{
|
|
"entropy": 0.946484375,
|
|
"epoch": 1.958452917862512,
|
|
"grad_norm": 0.28010561110346477,
|
|
"learning_rate": 1.0743976328025928e-07,
|
|
"loss": 0.692,
|
|
"mean_token_accuracy": 0.8100615739822388,
|
|
"num_tokens": 1433760564.0,
|
|
"step": 14330
|
|
},
|
|
{
|
|
"entropy": 0.899609375,
|
|
"epoch": 1.959819598195982,
|
|
"grad_norm": 0.2648550095271839,
|
|
"learning_rate": 1.0391714809074258e-07,
|
|
"loss": 0.6554,
|
|
"mean_token_accuracy": 0.8197200655937195,
|
|
"num_tokens": 1434780839.0,
|
|
"step": 14340
|
|
},
|
|
{
|
|
"entropy": 0.941796875,
|
|
"epoch": 1.961186278529452,
|
|
"grad_norm": 0.28213708251363306,
|
|
"learning_rate": 1.0039453290122588e-07,
|
|
"loss": 0.6985,
|
|
"mean_token_accuracy": 0.8091065049171448,
|
|
"num_tokens": 1435777762.0,
|
|
"step": 14350
|
|
},
|
|
{
|
|
"entropy": 0.901171875,
|
|
"epoch": 1.962552958862922,
|
|
"grad_norm": 0.2797483565737916,
|
|
"learning_rate": 9.687191771170918e-08,
|
|
"loss": 0.6512,
|
|
"mean_token_accuracy": 0.8201618790626526,
|
|
"num_tokens": 1436761658.0,
|
|
"step": 14360
|
|
},
|
|
{
|
|
"entropy": 0.987109375,
|
|
"epoch": 1.963919639196392,
|
|
"grad_norm": 0.3066933211020449,
|
|
"learning_rate": 9.334930252219248e-08,
|
|
"loss": 0.7517,
|
|
"mean_token_accuracy": 0.7995231807231903,
|
|
"num_tokens": 1437801007.0,
|
|
"step": 14370
|
|
},
|
|
{
|
|
"entropy": 0.944140625,
|
|
"epoch": 1.965286319529862,
|
|
"grad_norm": 0.2680203511804468,
|
|
"learning_rate": 8.982668733267578e-08,
|
|
"loss": 0.6715,
|
|
"mean_token_accuracy": 0.8166219830513001,
|
|
"num_tokens": 1438814755.0,
|
|
"step": 14380
|
|
},
|
|
{
|
|
"entropy": 0.905859375,
|
|
"epoch": 1.966652999863332,
|
|
"grad_norm": 0.25450461387372997,
|
|
"learning_rate": 8.630407214315909e-08,
|
|
"loss": 0.6608,
|
|
"mean_token_accuracy": 0.8189731001853943,
|
|
"num_tokens": 1439819938.0,
|
|
"step": 14390
|
|
},
|
|
{
|
|
"entropy": 0.9796875,
|
|
"epoch": 1.968019680196802,
|
|
"grad_norm": 0.3069078046465518,
|
|
"learning_rate": 8.27814569536424e-08,
|
|
"loss": 0.6778,
|
|
"mean_token_accuracy": 0.8157084584236145,
|
|
"num_tokens": 1440835381.0,
|
|
"step": 14400
|
|
},
|
|
{
|
|
"entropy": 0.97578125,
|
|
"epoch": 1.969386360530272,
|
|
"grad_norm": 0.30177905109822734,
|
|
"learning_rate": 7.925884176412568e-08,
|
|
"loss": 0.7365,
|
|
"mean_token_accuracy": 0.8021965503692627,
|
|
"num_tokens": 1441812568.0,
|
|
"step": 14410
|
|
},
|
|
{
|
|
"entropy": 0.974609375,
|
|
"epoch": 1.970753040863742,
|
|
"grad_norm": 0.2838629865374666,
|
|
"learning_rate": 7.573622657460899e-08,
|
|
"loss": 0.7138,
|
|
"mean_token_accuracy": 0.8071789801120758,
|
|
"num_tokens": 1442798498.0,
|
|
"step": 14420
|
|
},
|
|
{
|
|
"entropy": 0.941015625,
|
|
"epoch": 1.972119721197212,
|
|
"grad_norm": 0.2938727720260957,
|
|
"learning_rate": 7.22136113850923e-08,
|
|
"loss": 0.6752,
|
|
"mean_token_accuracy": 0.8148731708526611,
|
|
"num_tokens": 1443804598.0,
|
|
"step": 14430
|
|
},
|
|
{
|
|
"entropy": 0.9296875,
|
|
"epoch": 1.9734864015306819,
|
|
"grad_norm": 0.2608591148594485,
|
|
"learning_rate": 6.869099619557561e-08,
|
|
"loss": 0.6577,
|
|
"mean_token_accuracy": 0.8184147953987122,
|
|
"num_tokens": 1444812504.0,
|
|
"step": 14440
|
|
},
|
|
{
|
|
"entropy": 0.926171875,
|
|
"epoch": 1.9748530818641519,
|
|
"grad_norm": 0.33013412718031665,
|
|
"learning_rate": 6.51683810060589e-08,
|
|
"loss": 0.674,
|
|
"mean_token_accuracy": 0.8156328141689301,
|
|
"num_tokens": 1445856326.0,
|
|
"step": 14450
|
|
},
|
|
{
|
|
"entropy": 0.969140625,
|
|
"epoch": 1.9762197621976219,
|
|
"grad_norm": 0.28902395070029163,
|
|
"learning_rate": 6.164576581654221e-08,
|
|
"loss": 0.7091,
|
|
"mean_token_accuracy": 0.8084070801734924,
|
|
"num_tokens": 1446814419.0,
|
|
"step": 14460
|
|
},
|
|
{
|
|
"entropy": 0.94765625,
|
|
"epoch": 1.9775864425310918,
|
|
"grad_norm": 0.28529919908976104,
|
|
"learning_rate": 5.8123150627025515e-08,
|
|
"loss": 0.6741,
|
|
"mean_token_accuracy": 0.8148067951202392,
|
|
"num_tokens": 1447785682.0,
|
|
"step": 14470
|
|
},
|
|
{
|
|
"entropy": 0.947265625,
|
|
"epoch": 1.9789531228645618,
|
|
"grad_norm": 0.25460525925183447,
|
|
"learning_rate": 5.460053543750881e-08,
|
|
"loss": 0.684,
|
|
"mean_token_accuracy": 0.8137139022350312,
|
|
"num_tokens": 1448707537.0,
|
|
"step": 14480
|
|
},
|
|
{
|
|
"entropy": 0.978515625,
|
|
"epoch": 1.980319803198032,
|
|
"grad_norm": 0.2580355553461779,
|
|
"learning_rate": 5.107792024799211e-08,
|
|
"loss": 0.6937,
|
|
"mean_token_accuracy": 0.8104583501815796,
|
|
"num_tokens": 1449707689.0,
|
|
"step": 14490
|
|
},
|
|
{
|
|
"entropy": 1.005078125,
|
|
"epoch": 1.981686483531502,
|
|
"grad_norm": 0.27799898641631704,
|
|
"learning_rate": 4.7555305058475415e-08,
|
|
"loss": 0.7433,
|
|
"mean_token_accuracy": 0.7996393203735351,
|
|
"num_tokens": 1450667160.0,
|
|
"step": 14500
|
|
},
|
|
{
|
|
"entropy": 0.951953125,
|
|
"epoch": 1.983053163864972,
|
|
"grad_norm": 0.2697153717075272,
|
|
"learning_rate": 4.403268986895872e-08,
|
|
"loss": 0.704,
|
|
"mean_token_accuracy": 0.8089022755622863,
|
|
"num_tokens": 1451717212.0,
|
|
"step": 14510
|
|
},
|
|
{
|
|
"entropy": 0.953515625,
|
|
"epoch": 1.984419844198442,
|
|
"grad_norm": 0.2657811797752705,
|
|
"learning_rate": 4.0510074679442026e-08,
|
|
"loss": 0.6883,
|
|
"mean_token_accuracy": 0.8118048727512359,
|
|
"num_tokens": 1452714510.0,
|
|
"step": 14520
|
|
},
|
|
{
|
|
"entropy": 0.96484375,
|
|
"epoch": 1.985786524531912,
|
|
"grad_norm": 0.2863007153014711,
|
|
"learning_rate": 3.698745948992532e-08,
|
|
"loss": 0.7266,
|
|
"mean_token_accuracy": 0.8042195856571197,
|
|
"num_tokens": 1453655116.0,
|
|
"step": 14530
|
|
},
|
|
{
|
|
"entropy": 0.9375,
|
|
"epoch": 1.987153204865382,
|
|
"grad_norm": 0.2612995086525825,
|
|
"learning_rate": 3.3464844300408624e-08,
|
|
"loss": 0.6775,
|
|
"mean_token_accuracy": 0.8139163672924041,
|
|
"num_tokens": 1454601117.0,
|
|
"step": 14540
|
|
},
|
|
{
|
|
"entropy": 0.933203125,
|
|
"epoch": 1.9885198851988521,
|
|
"grad_norm": 0.2514125734512227,
|
|
"learning_rate": 2.994222911089193e-08,
|
|
"loss": 0.6641,
|
|
"mean_token_accuracy": 0.8185163319110871,
|
|
"num_tokens": 1455611512.0,
|
|
"step": 14550
|
|
},
|
|
{
|
|
"entropy": 0.985546875,
|
|
"epoch": 1.9898865655323221,
|
|
"grad_norm": 0.25919561659066886,
|
|
"learning_rate": 2.6419613921375232e-08,
|
|
"loss": 0.6909,
|
|
"mean_token_accuracy": 0.8136953055858612,
|
|
"num_tokens": 1456632158.0,
|
|
"step": 14560
|
|
},
|
|
{
|
|
"entropy": 0.911328125,
|
|
"epoch": 1.991253245865792,
|
|
"grad_norm": 0.2766750134840519,
|
|
"learning_rate": 2.289699873185853e-08,
|
|
"loss": 0.675,
|
|
"mean_token_accuracy": 0.813436073064804,
|
|
"num_tokens": 1457642976.0,
|
|
"step": 14570
|
|
},
|
|
{
|
|
"entropy": 1.014453125,
|
|
"epoch": 1.992619926199262,
|
|
"grad_norm": 0.27252295596909204,
|
|
"learning_rate": 1.9374383542341837e-08,
|
|
"loss": 0.7399,
|
|
"mean_token_accuracy": 0.8009039163589478,
|
|
"num_tokens": 1458592777.0,
|
|
"step": 14580
|
|
},
|
|
{
|
|
"entropy": 0.9046875,
|
|
"epoch": 1.993986606532732,
|
|
"grad_norm": 0.2577939829251592,
|
|
"learning_rate": 1.585176835282514e-08,
|
|
"loss": 0.6484,
|
|
"mean_token_accuracy": 0.8219449043273925,
|
|
"num_tokens": 1459598963.0,
|
|
"step": 14590
|
|
},
|
|
{
|
|
"entropy": 0.980078125,
|
|
"epoch": 1.995353286866202,
|
|
"grad_norm": 0.2698673136539133,
|
|
"learning_rate": 1.2329153163308442e-08,
|
|
"loss": 0.7398,
|
|
"mean_token_accuracy": 0.8016618251800537,
|
|
"num_tokens": 1460621010.0,
|
|
"step": 14600
|
|
},
|
|
{
|
|
"entropy": 0.950390625,
|
|
"epoch": 1.996719967199672,
|
|
"grad_norm": 0.27419386675478313,
|
|
"learning_rate": 8.806537973791744e-09,
|
|
"loss": 0.699,
|
|
"mean_token_accuracy": 0.8102035284042358,
|
|
"num_tokens": 1461657932.0,
|
|
"step": 14610
|
|
},
|
|
{
|
|
"entropy": 0.93046875,
|
|
"epoch": 1.998086647533142,
|
|
"grad_norm": 0.27558529252533814,
|
|
"learning_rate": 5.2839227842750465e-09,
|
|
"loss": 0.6848,
|
|
"mean_token_accuracy": 0.8130056262016296,
|
|
"num_tokens": 1462690155.0,
|
|
"step": 14620
|
|
},
|
|
{
|
|
"entropy": 0.96328125,
|
|
"epoch": 1.999453327866612,
|
|
"grad_norm": 0.2664152814770514,
|
|
"learning_rate": 1.7613075947583486e-09,
|
|
"loss": 0.706,
|
|
"mean_token_accuracy": 0.808808422088623,
|
|
"num_tokens": 1463697643.0,
|
|
"step": 14630
|
|
},
|
|
{
|
|
"entropy": 0.9755859375,
|
|
"epoch": 2.0,
|
|
"mean_token_accuracy": 0.8022506535053253,
|
|
"num_tokens": 1464106948.0,
|
|
"step": 14634,
|
|
"total_flos": 3199489317601280.0,
|
|
"train_loss": 0.7138549819888028,
|
|
"train_runtime": 48209.3705,
|
|
"train_samples_per_second": 38.852,
|
|
"train_steps_per_second": 0.304
|
|
}
|
|
],
|
|
"logging_steps": 10,
|
|
"max_steps": 14634,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 2,
|
|
"save_steps": 200,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": true
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 3199489317601280.0,
|
|
"train_batch_size": 16,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|