7035 lines
192 KiB
JSON
7035 lines
192 KiB
JSON
|
|
{
|
||
|
|
"best_global_step": null,
|
||
|
|
"best_metric": null,
|
||
|
|
"best_model_checkpoint": null,
|
||
|
|
"epoch": 0.2250369703594162,
|
||
|
|
"eval_steps": 500,
|
||
|
|
"global_step": 3500,
|
||
|
|
"is_hyper_param_search": false,
|
||
|
|
"is_local_process_zero": true,
|
||
|
|
"is_world_process_zero": true,
|
||
|
|
"log_history": [
|
||
|
|
{
|
||
|
|
"entropy": 10.742344284057618,
|
||
|
|
"epoch": 0.00032148138622773744,
|
||
|
|
"grad_norm": 5.1875,
|
||
|
|
"learning_rate": 2e-06,
|
||
|
|
"loss": 10.7889,
|
||
|
|
"mean_token_accuracy": 0.0001923076924867928,
|
||
|
|
"num_tokens": 10787.0,
|
||
|
|
"step": 5
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.742341995239258,
|
||
|
|
"epoch": 0.0006429627724554749,
|
||
|
|
"grad_norm": 4.6875,
|
||
|
|
"learning_rate": 4.5e-06,
|
||
|
|
"loss": 10.7754,
|
||
|
|
"mean_token_accuracy": 9.199631749652326e-05,
|
||
|
|
"num_tokens": 21408.0,
|
||
|
|
"step": 10
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.74231481552124,
|
||
|
|
"epoch": 0.0009644441586832123,
|
||
|
|
"grad_norm": 4.84375,
|
||
|
|
"learning_rate": 7e-06,
|
||
|
|
"loss": 10.7745,
|
||
|
|
"mean_token_accuracy": 0.0,
|
||
|
|
"num_tokens": 33838.0,
|
||
|
|
"step": 15
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.742263031005859,
|
||
|
|
"epoch": 0.0012859255449109497,
|
||
|
|
"grad_norm": 4.875,
|
||
|
|
"learning_rate": 9.5e-06,
|
||
|
|
"loss": 10.7415,
|
||
|
|
"mean_token_accuracy": 0.0,
|
||
|
|
"num_tokens": 46592.0,
|
||
|
|
"step": 20
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.742058944702148,
|
||
|
|
"epoch": 0.001607406931138687,
|
||
|
|
"grad_norm": 4.21875,
|
||
|
|
"learning_rate": 1.2e-05,
|
||
|
|
"loss": 10.6278,
|
||
|
|
"mean_token_accuracy": 0.00028761792345903813,
|
||
|
|
"num_tokens": 57409.0,
|
||
|
|
"step": 25
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.741728782653809,
|
||
|
|
"epoch": 0.0019288883173664245,
|
||
|
|
"grad_norm": 3.71875,
|
||
|
|
"learning_rate": 1.4500000000000002e-05,
|
||
|
|
"loss": 10.5262,
|
||
|
|
"mean_token_accuracy": 0.005182119726669043,
|
||
|
|
"num_tokens": 68705.0,
|
||
|
|
"step": 30
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.74124059677124,
|
||
|
|
"epoch": 0.002250369703594162,
|
||
|
|
"grad_norm": 3.09375,
|
||
|
|
"learning_rate": 1.7000000000000003e-05,
|
||
|
|
"loss": 10.4297,
|
||
|
|
"mean_token_accuracy": 0.019557270966470242,
|
||
|
|
"num_tokens": 81460.0,
|
||
|
|
"step": 35
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.740433311462402,
|
||
|
|
"epoch": 0.0025718510898218995,
|
||
|
|
"grad_norm": 2.5,
|
||
|
|
"learning_rate": 1.95e-05,
|
||
|
|
"loss": 10.2725,
|
||
|
|
"mean_token_accuracy": 0.02960890345275402,
|
||
|
|
"num_tokens": 93576.0,
|
||
|
|
"step": 40
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.739229869842529,
|
||
|
|
"epoch": 0.0028933324760496365,
|
||
|
|
"grad_norm": 2.125,
|
||
|
|
"learning_rate": 2.2e-05,
|
||
|
|
"loss": 10.1857,
|
||
|
|
"mean_token_accuracy": 0.02886150423437357,
|
||
|
|
"num_tokens": 105556.0,
|
||
|
|
"step": 45
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.738618659973145,
|
||
|
|
"epoch": 0.003214813862277374,
|
||
|
|
"grad_norm": 2.03125,
|
||
|
|
"learning_rate": 2.4500000000000003e-05,
|
||
|
|
"loss": 10.0792,
|
||
|
|
"mean_token_accuracy": 0.031074166856706144,
|
||
|
|
"num_tokens": 117850.0,
|
||
|
|
"step": 50
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.738714694976807,
|
||
|
|
"epoch": 0.0035362952485051115,
|
||
|
|
"grad_norm": 1.9296875,
|
||
|
|
"learning_rate": 2.7e-05,
|
||
|
|
"loss": 10.0244,
|
||
|
|
"mean_token_accuracy": 0.031163782812654972,
|
||
|
|
"num_tokens": 130955.0,
|
||
|
|
"step": 55
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.738016033172608,
|
||
|
|
"epoch": 0.003857776634732849,
|
||
|
|
"grad_norm": 1.9140625,
|
||
|
|
"learning_rate": 2.95e-05,
|
||
|
|
"loss": 9.9307,
|
||
|
|
"mean_token_accuracy": 0.03660368006676436,
|
||
|
|
"num_tokens": 141959.0,
|
||
|
|
"step": 60
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.736786365509033,
|
||
|
|
"epoch": 0.0041792580209605865,
|
||
|
|
"grad_norm": 1.84375,
|
||
|
|
"learning_rate": 3.2e-05,
|
||
|
|
"loss": 9.8915,
|
||
|
|
"mean_token_accuracy": 0.03608605414628983,
|
||
|
|
"num_tokens": 153856.0,
|
||
|
|
"step": 65
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.73516550064087,
|
||
|
|
"epoch": 0.004500739407188324,
|
||
|
|
"grad_norm": 1.9140625,
|
||
|
|
"learning_rate": 3.4500000000000005e-05,
|
||
|
|
"loss": 9.8384,
|
||
|
|
"mean_token_accuracy": 0.043716078624129295,
|
||
|
|
"num_tokens": 166748.0,
|
||
|
|
"step": 70
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.732550621032715,
|
||
|
|
"epoch": 0.0048222207934160615,
|
||
|
|
"grad_norm": 1.9375,
|
||
|
|
"learning_rate": 3.7e-05,
|
||
|
|
"loss": 9.728,
|
||
|
|
"mean_token_accuracy": 0.04251385778188706,
|
||
|
|
"num_tokens": 177172.0,
|
||
|
|
"step": 75
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.728882122039796,
|
||
|
|
"epoch": 0.005143702179643799,
|
||
|
|
"grad_norm": 1.8046875,
|
||
|
|
"learning_rate": 3.95e-05,
|
||
|
|
"loss": 9.6737,
|
||
|
|
"mean_token_accuracy": 0.04158058017492294,
|
||
|
|
"num_tokens": 189418.0,
|
||
|
|
"step": 80
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.723980331420899,
|
||
|
|
"epoch": 0.0054651835658715365,
|
||
|
|
"grad_norm": 2.0625,
|
||
|
|
"learning_rate": 4.2000000000000004e-05,
|
||
|
|
"loss": 9.5846,
|
||
|
|
"mean_token_accuracy": 0.039340490289032456,
|
||
|
|
"num_tokens": 201349.0,
|
||
|
|
"step": 85
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.718004131317139,
|
||
|
|
"epoch": 0.005786664952099273,
|
||
|
|
"grad_norm": 1.8046875,
|
||
|
|
"learning_rate": 4.45e-05,
|
||
|
|
"loss": 9.5176,
|
||
|
|
"mean_token_accuracy": 0.04345524609088898,
|
||
|
|
"num_tokens": 212298.0,
|
||
|
|
"step": 90
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.710467433929443,
|
||
|
|
"epoch": 0.0061081463383270106,
|
||
|
|
"grad_norm": 1.796875,
|
||
|
|
"learning_rate": 4.7000000000000004e-05,
|
||
|
|
"loss": 9.467,
|
||
|
|
"mean_token_accuracy": 0.04573878571391106,
|
||
|
|
"num_tokens": 223831.0,
|
||
|
|
"step": 95
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.699566841125488,
|
||
|
|
"epoch": 0.006429627724554748,
|
||
|
|
"grad_norm": 1.78125,
|
||
|
|
"learning_rate": 4.9500000000000004e-05,
|
||
|
|
"loss": 9.3601,
|
||
|
|
"mean_token_accuracy": 0.04835316389799118,
|
||
|
|
"num_tokens": 236675.0,
|
||
|
|
"step": 100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.683355236053467,
|
||
|
|
"epoch": 0.0067511091107824855,
|
||
|
|
"grad_norm": 1.7421875,
|
||
|
|
"learning_rate": 5.2e-05,
|
||
|
|
"loss": 9.242,
|
||
|
|
"mean_token_accuracy": 0.04662417732179165,
|
||
|
|
"num_tokens": 247634.0,
|
||
|
|
"step": 105
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.66143503189087,
|
||
|
|
"epoch": 0.007072590497010223,
|
||
|
|
"grad_norm": 1.8046875,
|
||
|
|
"learning_rate": 5.45e-05,
|
||
|
|
"loss": 9.1162,
|
||
|
|
"mean_token_accuracy": 0.05328451320528984,
|
||
|
|
"num_tokens": 259101.0,
|
||
|
|
"step": 110
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.631138801574707,
|
||
|
|
"epoch": 0.0073940718832379605,
|
||
|
|
"grad_norm": 1.6328125,
|
||
|
|
"learning_rate": 5.7e-05,
|
||
|
|
"loss": 9.0393,
|
||
|
|
"mean_token_accuracy": 0.05271790884435177,
|
||
|
|
"num_tokens": 272151.0,
|
||
|
|
"step": 115
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.594438171386718,
|
||
|
|
"epoch": 0.007715553269465698,
|
||
|
|
"grad_norm": 1.75,
|
||
|
|
"learning_rate": 5.9499999999999996e-05,
|
||
|
|
"loss": 8.8606,
|
||
|
|
"mean_token_accuracy": 0.057512912154197696,
|
||
|
|
"num_tokens": 283619.0,
|
||
|
|
"step": 120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.537901401519775,
|
||
|
|
"epoch": 0.008037034655693436,
|
||
|
|
"grad_norm": 1.734375,
|
||
|
|
"learning_rate": 6.2e-05,
|
||
|
|
"loss": 8.7551,
|
||
|
|
"mean_token_accuracy": 0.05864038914442062,
|
||
|
|
"num_tokens": 296233.0,
|
||
|
|
"step": 125
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.46686897277832,
|
||
|
|
"epoch": 0.008358516041921173,
|
||
|
|
"grad_norm": 1.6015625,
|
||
|
|
"learning_rate": 6.450000000000001e-05,
|
||
|
|
"loss": 8.6685,
|
||
|
|
"mean_token_accuracy": 0.05632430389523506,
|
||
|
|
"num_tokens": 309222.0,
|
||
|
|
"step": 130
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.386721515655518,
|
||
|
|
"epoch": 0.00867999742814891,
|
||
|
|
"grad_norm": 1.515625,
|
||
|
|
"learning_rate": 6.7e-05,
|
||
|
|
"loss": 8.4983,
|
||
|
|
"mean_token_accuracy": 0.05754401199519634,
|
||
|
|
"num_tokens": 322291.0,
|
||
|
|
"step": 135
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.285922241210937,
|
||
|
|
"epoch": 0.009001478814376648,
|
||
|
|
"grad_norm": 1.484375,
|
||
|
|
"learning_rate": 6.950000000000001e-05,
|
||
|
|
"loss": 8.3328,
|
||
|
|
"mean_token_accuracy": 0.06465739980340005,
|
||
|
|
"num_tokens": 333520.0,
|
||
|
|
"step": 140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.168986701965332,
|
||
|
|
"epoch": 0.009322960200604385,
|
||
|
|
"grad_norm": 1.453125,
|
||
|
|
"learning_rate": 7.2e-05,
|
||
|
|
"loss": 8.1641,
|
||
|
|
"mean_token_accuracy": 0.0657901257276535,
|
||
|
|
"num_tokens": 344883.0,
|
||
|
|
"step": 145
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.042533111572265,
|
||
|
|
"epoch": 0.009644441586832123,
|
||
|
|
"grad_norm": 1.3515625,
|
||
|
|
"learning_rate": 7.45e-05,
|
||
|
|
"loss": 8.0727,
|
||
|
|
"mean_token_accuracy": 0.07245785929262638,
|
||
|
|
"num_tokens": 356600.0,
|
||
|
|
"step": 150
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.882461643218994,
|
||
|
|
"epoch": 0.00996592297305986,
|
||
|
|
"grad_norm": 1.4609375,
|
||
|
|
"learning_rate": 7.7e-05,
|
||
|
|
"loss": 7.9127,
|
||
|
|
"mean_token_accuracy": 0.0721237450838089,
|
||
|
|
"num_tokens": 368527.0,
|
||
|
|
"step": 155
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.694390869140625,
|
||
|
|
"epoch": 0.010287404359287598,
|
||
|
|
"grad_norm": 1.5,
|
||
|
|
"learning_rate": 7.950000000000001e-05,
|
||
|
|
"loss": 7.8511,
|
||
|
|
"mean_token_accuracy": 0.06826285421848297,
|
||
|
|
"num_tokens": 379836.0,
|
||
|
|
"step": 160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.510071659088135,
|
||
|
|
"epoch": 0.010608885745515335,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 8.2e-05,
|
||
|
|
"loss": 7.8393,
|
||
|
|
"mean_token_accuracy": 0.0674971140921116,
|
||
|
|
"num_tokens": 392535.0,
|
||
|
|
"step": 165
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.299476528167725,
|
||
|
|
"epoch": 0.010930367131743073,
|
||
|
|
"grad_norm": 0.91015625,
|
||
|
|
"learning_rate": 8.450000000000001e-05,
|
||
|
|
"loss": 7.7515,
|
||
|
|
"mean_token_accuracy": 0.06860553249716758,
|
||
|
|
"num_tokens": 405259.0,
|
||
|
|
"step": 170
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.040483093261718,
|
||
|
|
"epoch": 0.011251848517970809,
|
||
|
|
"grad_norm": 0.96875,
|
||
|
|
"learning_rate": 8.7e-05,
|
||
|
|
"loss": 7.599,
|
||
|
|
"mean_token_accuracy": 0.07114262394607067,
|
||
|
|
"num_tokens": 417922.0,
|
||
|
|
"step": 175
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.870688247680665,
|
||
|
|
"epoch": 0.011573329904198546,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 8.95e-05,
|
||
|
|
"loss": 7.6169,
|
||
|
|
"mean_token_accuracy": 0.07012484185397624,
|
||
|
|
"num_tokens": 429411.0,
|
||
|
|
"step": 180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.67488489151001,
|
||
|
|
"epoch": 0.011894811290426284,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 9.2e-05,
|
||
|
|
"loss": 7.386,
|
||
|
|
"mean_token_accuracy": 0.0772802360355854,
|
||
|
|
"num_tokens": 439950.0,
|
||
|
|
"step": 185
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.489033699035645,
|
||
|
|
"epoch": 0.012216292676654021,
|
||
|
|
"grad_norm": 1.328125,
|
||
|
|
"learning_rate": 9.45e-05,
|
||
|
|
"loss": 7.3822,
|
||
|
|
"mean_token_accuracy": 0.07805034667253494,
|
||
|
|
"num_tokens": 451245.0,
|
||
|
|
"step": 190
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.393837928771973,
|
||
|
|
"epoch": 0.012537774062881759,
|
||
|
|
"grad_norm": 0.8671875,
|
||
|
|
"learning_rate": 9.7e-05,
|
||
|
|
"loss": 7.4539,
|
||
|
|
"mean_token_accuracy": 0.07150709182024002,
|
||
|
|
"num_tokens": 465146.0,
|
||
|
|
"step": 195
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.359711456298829,
|
||
|
|
"epoch": 0.012859255449109496,
|
||
|
|
"grad_norm": 1.28125,
|
||
|
|
"learning_rate": 9.95e-05,
|
||
|
|
"loss": 7.4708,
|
||
|
|
"mean_token_accuracy": 0.07765417769551278,
|
||
|
|
"num_tokens": 477079.0,
|
||
|
|
"step": 200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.254557895660401,
|
||
|
|
"epoch": 0.013180736835337234,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.000102,
|
||
|
|
"loss": 7.2964,
|
||
|
|
"mean_token_accuracy": 0.08167731463909149,
|
||
|
|
"num_tokens": 488216.0,
|
||
|
|
"step": 205
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.201800632476807,
|
||
|
|
"epoch": 0.013502218221564971,
|
||
|
|
"grad_norm": 1.3984375,
|
||
|
|
"learning_rate": 0.00010449999999999999,
|
||
|
|
"loss": 7.2996,
|
||
|
|
"mean_token_accuracy": 0.08416381254792213,
|
||
|
|
"num_tokens": 501040.0,
|
||
|
|
"step": 210
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.122812938690185,
|
||
|
|
"epoch": 0.013823699607792709,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.000107,
|
||
|
|
"loss": 7.2535,
|
||
|
|
"mean_token_accuracy": 0.08663205504417419,
|
||
|
|
"num_tokens": 512636.0,
|
||
|
|
"step": 215
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.088646793365479,
|
||
|
|
"epoch": 0.014145180994020446,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 0.0001095,
|
||
|
|
"loss": 7.301,
|
||
|
|
"mean_token_accuracy": 0.08183000981807709,
|
||
|
|
"num_tokens": 525249.0,
|
||
|
|
"step": 220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.097221660614014,
|
||
|
|
"epoch": 0.014466662380248184,
|
||
|
|
"grad_norm": 1.34375,
|
||
|
|
"learning_rate": 0.000112,
|
||
|
|
"loss": 7.3486,
|
||
|
|
"mean_token_accuracy": 0.08002460822463035,
|
||
|
|
"num_tokens": 536963.0,
|
||
|
|
"step": 225
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.05938491821289,
|
||
|
|
"epoch": 0.014788143766475921,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.0001145,
|
||
|
|
"loss": 7.2099,
|
||
|
|
"mean_token_accuracy": 0.08030182272195815,
|
||
|
|
"num_tokens": 549008.0,
|
||
|
|
"step": 230
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.041013956069946,
|
||
|
|
"epoch": 0.015109625152703659,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00011700000000000001,
|
||
|
|
"loss": 7.2319,
|
||
|
|
"mean_token_accuracy": 0.09074903577566147,
|
||
|
|
"num_tokens": 560958.0,
|
||
|
|
"step": 235
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.961578607559204,
|
||
|
|
"epoch": 0.015431106538931396,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.00011949999999999999,
|
||
|
|
"loss": 7.1147,
|
||
|
|
"mean_token_accuracy": 0.09378238469362259,
|
||
|
|
"num_tokens": 572472.0,
|
||
|
|
"step": 240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.922268009185791,
|
||
|
|
"epoch": 0.015752587925159132,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.000122,
|
||
|
|
"loss": 7.1808,
|
||
|
|
"mean_token_accuracy": 0.08942435756325721,
|
||
|
|
"num_tokens": 585125.0,
|
||
|
|
"step": 245
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.913467741012573,
|
||
|
|
"epoch": 0.01607406931138687,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0001245,
|
||
|
|
"loss": 7.1259,
|
||
|
|
"mean_token_accuracy": 0.09376866966485978,
|
||
|
|
"num_tokens": 597774.0,
|
||
|
|
"step": 250
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.856596946716309,
|
||
|
|
"epoch": 0.016395550697614607,
|
||
|
|
"grad_norm": 0.98828125,
|
||
|
|
"learning_rate": 0.000127,
|
||
|
|
"loss": 7.1233,
|
||
|
|
"mean_token_accuracy": 0.09992039278149605,
|
||
|
|
"num_tokens": 610130.0,
|
||
|
|
"step": 255
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.8915050506591795,
|
||
|
|
"epoch": 0.016717032083842346,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.0001295,
|
||
|
|
"loss": 7.1488,
|
||
|
|
"mean_token_accuracy": 0.09605236500501632,
|
||
|
|
"num_tokens": 621659.0,
|
||
|
|
"step": 260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.833514070510864,
|
||
|
|
"epoch": 0.017038513470070082,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.000132,
|
||
|
|
"loss": 7.0552,
|
||
|
|
"mean_token_accuracy": 0.09916835874319077,
|
||
|
|
"num_tokens": 633172.0,
|
||
|
|
"step": 265
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.854182243347168,
|
||
|
|
"epoch": 0.01735999485629782,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.00013450000000000002,
|
||
|
|
"loss": 7.0595,
|
||
|
|
"mean_token_accuracy": 0.09681920260190964,
|
||
|
|
"num_tokens": 643928.0,
|
||
|
|
"step": 270
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.712904834747315,
|
||
|
|
"epoch": 0.017681476242525557,
|
||
|
|
"grad_norm": 1.2265625,
|
||
|
|
"learning_rate": 0.00013700000000000002,
|
||
|
|
"loss": 6.9556,
|
||
|
|
"mean_token_accuracy": 0.09763396382331849,
|
||
|
|
"num_tokens": 654693.0,
|
||
|
|
"step": 275
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.817079973220825,
|
||
|
|
"epoch": 0.018002957628753296,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.0001395,
|
||
|
|
"loss": 7.1338,
|
||
|
|
"mean_token_accuracy": 0.09172611869871616,
|
||
|
|
"num_tokens": 667216.0,
|
||
|
|
"step": 280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.727632856369018,
|
||
|
|
"epoch": 0.01832443901498103,
|
||
|
|
"grad_norm": 1.5078125,
|
||
|
|
"learning_rate": 0.00014199999999999998,
|
||
|
|
"loss": 6.9273,
|
||
|
|
"mean_token_accuracy": 0.10492636933922768,
|
||
|
|
"num_tokens": 679605.0,
|
||
|
|
"step": 285
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.6807286739349365,
|
||
|
|
"epoch": 0.01864592040120877,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0001445,
|
||
|
|
"loss": 7.0243,
|
||
|
|
"mean_token_accuracy": 0.09721777960658073,
|
||
|
|
"num_tokens": 691581.0,
|
||
|
|
"step": 290
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.730735111236572,
|
||
|
|
"epoch": 0.018967401787436507,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.000147,
|
||
|
|
"loss": 7.064,
|
||
|
|
"mean_token_accuracy": 0.10062759071588516,
|
||
|
|
"num_tokens": 703162.0,
|
||
|
|
"step": 295
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.675752592086792,
|
||
|
|
"epoch": 0.019288883173664246,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0001495,
|
||
|
|
"loss": 6.947,
|
||
|
|
"mean_token_accuracy": 0.10126433670520782,
|
||
|
|
"num_tokens": 715024.0,
|
||
|
|
"step": 300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.604991054534912,
|
||
|
|
"epoch": 0.01961036455989198,
|
||
|
|
"grad_norm": 1.390625,
|
||
|
|
"learning_rate": 0.000152,
|
||
|
|
"loss": 6.9484,
|
||
|
|
"mean_token_accuracy": 0.10657469853758812,
|
||
|
|
"num_tokens": 728434.0,
|
||
|
|
"step": 305
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.582369089126587,
|
||
|
|
"epoch": 0.01993184594611972,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.00015450000000000001,
|
||
|
|
"loss": 6.9856,
|
||
|
|
"mean_token_accuracy": 0.10384280532598496,
|
||
|
|
"num_tokens": 741049.0,
|
||
|
|
"step": 310
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.556066989898682,
|
||
|
|
"epoch": 0.020253327332347457,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.000157,
|
||
|
|
"loss": 6.8995,
|
||
|
|
"mean_token_accuracy": 0.10891256630420684,
|
||
|
|
"num_tokens": 753316.0,
|
||
|
|
"step": 315
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.487519884109497,
|
||
|
|
"epoch": 0.020574808718575196,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0001595,
|
||
|
|
"loss": 6.8976,
|
||
|
|
"mean_token_accuracy": 0.10375816151499748,
|
||
|
|
"num_tokens": 766605.0,
|
||
|
|
"step": 320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.575658369064331,
|
||
|
|
"epoch": 0.02089629010480293,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.000162,
|
||
|
|
"loss": 6.8776,
|
||
|
|
"mean_token_accuracy": 0.10548696890473366,
|
||
|
|
"num_tokens": 778857.0,
|
||
|
|
"step": 325
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.49542875289917,
|
||
|
|
"epoch": 0.02121777149103067,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.00016450000000000001,
|
||
|
|
"loss": 6.8801,
|
||
|
|
"mean_token_accuracy": 0.0980547919869423,
|
||
|
|
"num_tokens": 790497.0,
|
||
|
|
"step": 330
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.548171281814575,
|
||
|
|
"epoch": 0.021539252877258407,
|
||
|
|
"grad_norm": 1.2421875,
|
||
|
|
"learning_rate": 0.00016700000000000002,
|
||
|
|
"loss": 6.9457,
|
||
|
|
"mean_token_accuracy": 0.10034449025988579,
|
||
|
|
"num_tokens": 803021.0,
|
||
|
|
"step": 335
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.514672136306762,
|
||
|
|
"epoch": 0.021860734263486146,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.00016950000000000003,
|
||
|
|
"loss": 6.8973,
|
||
|
|
"mean_token_accuracy": 0.10233017727732659,
|
||
|
|
"num_tokens": 815056.0,
|
||
|
|
"step": 340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.548324632644653,
|
||
|
|
"epoch": 0.02218221564971388,
|
||
|
|
"grad_norm": 0.984375,
|
||
|
|
"learning_rate": 0.00017199999999999998,
|
||
|
|
"loss": 6.8436,
|
||
|
|
"mean_token_accuracy": 0.11048155352473259,
|
||
|
|
"num_tokens": 827149.0,
|
||
|
|
"step": 345
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.47729377746582,
|
||
|
|
"epoch": 0.022503697035941617,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.00017449999999999999,
|
||
|
|
"loss": 6.8877,
|
||
|
|
"mean_token_accuracy": 0.10872978940606118,
|
||
|
|
"num_tokens": 839172.0,
|
||
|
|
"step": 350
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.497987508773804,
|
||
|
|
"epoch": 0.022825178422169357,
|
||
|
|
"grad_norm": 1.75,
|
||
|
|
"learning_rate": 0.000177,
|
||
|
|
"loss": 6.9329,
|
||
|
|
"mean_token_accuracy": 0.10738308876752853,
|
||
|
|
"num_tokens": 851148.0,
|
||
|
|
"step": 355
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.548883295059204,
|
||
|
|
"epoch": 0.023146659808397092,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.0001795,
|
||
|
|
"loss": 6.8783,
|
||
|
|
"mean_token_accuracy": 0.10820900201797486,
|
||
|
|
"num_tokens": 862904.0,
|
||
|
|
"step": 360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.436304187774658,
|
||
|
|
"epoch": 0.02346814119462483,
|
||
|
|
"grad_norm": 1.359375,
|
||
|
|
"learning_rate": 0.000182,
|
||
|
|
"loss": 6.7668,
|
||
|
|
"mean_token_accuracy": 0.11688080206513404,
|
||
|
|
"num_tokens": 874720.0,
|
||
|
|
"step": 365
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.409350728988647,
|
||
|
|
"epoch": 0.023789622580852567,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.0001845,
|
||
|
|
"loss": 6.8078,
|
||
|
|
"mean_token_accuracy": 0.11283540055155754,
|
||
|
|
"num_tokens": 887261.0,
|
||
|
|
"step": 370
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.4675617694854735,
|
||
|
|
"epoch": 0.024111103967080307,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.000187,
|
||
|
|
"loss": 6.7767,
|
||
|
|
"mean_token_accuracy": 0.1088891163468361,
|
||
|
|
"num_tokens": 898048.0,
|
||
|
|
"step": 375
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.336610507965088,
|
||
|
|
"epoch": 0.024432585353308042,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.0001895,
|
||
|
|
"loss": 6.8343,
|
||
|
|
"mean_token_accuracy": 0.11030351296067238,
|
||
|
|
"num_tokens": 910297.0,
|
||
|
|
"step": 380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.432262849807739,
|
||
|
|
"epoch": 0.02475406673953578,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.000192,
|
||
|
|
"loss": 6.8693,
|
||
|
|
"mean_token_accuracy": 0.10626164525747299,
|
||
|
|
"num_tokens": 923463.0,
|
||
|
|
"step": 385
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.399855327606201,
|
||
|
|
"epoch": 0.025075548125763517,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.0001945,
|
||
|
|
"loss": 6.8379,
|
||
|
|
"mean_token_accuracy": 0.11091364100575447,
|
||
|
|
"num_tokens": 935306.0,
|
||
|
|
"step": 390
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.355379390716553,
|
||
|
|
"epoch": 0.025397029511991256,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.00019700000000000002,
|
||
|
|
"loss": 6.7379,
|
||
|
|
"mean_token_accuracy": 0.115155877918005,
|
||
|
|
"num_tokens": 947827.0,
|
||
|
|
"step": 395
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.281255531311035,
|
||
|
|
"epoch": 0.025718510898218992,
|
||
|
|
"grad_norm": 1.375,
|
||
|
|
"learning_rate": 0.00019950000000000002,
|
||
|
|
"loss": 6.6838,
|
||
|
|
"mean_token_accuracy": 0.12000245451927186,
|
||
|
|
"num_tokens": 961664.0,
|
||
|
|
"step": 400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.312869071960449,
|
||
|
|
"epoch": 0.02603999228444673,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.000202,
|
||
|
|
"loss": 6.7829,
|
||
|
|
"mean_token_accuracy": 0.09842887446284294,
|
||
|
|
"num_tokens": 973981.0,
|
||
|
|
"step": 405
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.335048866271973,
|
||
|
|
"epoch": 0.026361473670674467,
|
||
|
|
"grad_norm": 1.3515625,
|
||
|
|
"learning_rate": 0.00020449999999999998,
|
||
|
|
"loss": 6.8181,
|
||
|
|
"mean_token_accuracy": 0.11232979372143745,
|
||
|
|
"num_tokens": 986702.0,
|
||
|
|
"step": 410
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.318604183197022,
|
||
|
|
"epoch": 0.026682955056902206,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.000207,
|
||
|
|
"loss": 6.7181,
|
||
|
|
"mean_token_accuracy": 0.11695454865694047,
|
||
|
|
"num_tokens": 998513.0,
|
||
|
|
"step": 415
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.294521141052246,
|
||
|
|
"epoch": 0.027004436443129942,
|
||
|
|
"grad_norm": 1.3515625,
|
||
|
|
"learning_rate": 0.0002095,
|
||
|
|
"loss": 6.7037,
|
||
|
|
"mean_token_accuracy": 0.11898418515920639,
|
||
|
|
"num_tokens": 1011111.0,
|
||
|
|
"step": 420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.186019515991211,
|
||
|
|
"epoch": 0.02732591782935768,
|
||
|
|
"grad_norm": 1.2578125,
|
||
|
|
"learning_rate": 0.000212,
|
||
|
|
"loss": 6.6799,
|
||
|
|
"mean_token_accuracy": 0.11566238775849343,
|
||
|
|
"num_tokens": 1021779.0,
|
||
|
|
"step": 425
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.370555067062378,
|
||
|
|
"epoch": 0.027647399215585417,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0002145,
|
||
|
|
"loss": 6.7381,
|
||
|
|
"mean_token_accuracy": 0.11263754442334176,
|
||
|
|
"num_tokens": 1033228.0,
|
||
|
|
"step": 430
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.226527881622315,
|
||
|
|
"epoch": 0.027968880601813156,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.00021700000000000002,
|
||
|
|
"loss": 6.6415,
|
||
|
|
"mean_token_accuracy": 0.11632440984249115,
|
||
|
|
"num_tokens": 1044964.0,
|
||
|
|
"step": 435
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.18967342376709,
|
||
|
|
"epoch": 0.028290361988040892,
|
||
|
|
"grad_norm": 1.2265625,
|
||
|
|
"learning_rate": 0.0002195,
|
||
|
|
"loss": 6.6058,
|
||
|
|
"mean_token_accuracy": 0.12256524711847305,
|
||
|
|
"num_tokens": 1056450.0,
|
||
|
|
"step": 440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.242304182052612,
|
||
|
|
"epoch": 0.02861184337426863,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.000222,
|
||
|
|
"loss": 6.7402,
|
||
|
|
"mean_token_accuracy": 0.1159943200647831,
|
||
|
|
"num_tokens": 1067031.0,
|
||
|
|
"step": 445
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.1245410442352295,
|
||
|
|
"epoch": 0.028933324760496367,
|
||
|
|
"grad_norm": 1.3046875,
|
||
|
|
"learning_rate": 0.0002245,
|
||
|
|
"loss": 6.6051,
|
||
|
|
"mean_token_accuracy": 0.1228414848446846,
|
||
|
|
"num_tokens": 1078718.0,
|
||
|
|
"step": 450
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.182725429534912,
|
||
|
|
"epoch": 0.029254806146724106,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.00022700000000000002,
|
||
|
|
"loss": 6.6217,
|
||
|
|
"mean_token_accuracy": 0.11590910404920578,
|
||
|
|
"num_tokens": 1091630.0,
|
||
|
|
"step": 455
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.229373598098755,
|
||
|
|
"epoch": 0.029576287532951842,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.00022950000000000002,
|
||
|
|
"loss": 6.6761,
|
||
|
|
"mean_token_accuracy": 0.11919770017266273,
|
||
|
|
"num_tokens": 1102339.0,
|
||
|
|
"step": 460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.166626882553101,
|
||
|
|
"epoch": 0.029897768919179578,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.00023200000000000003,
|
||
|
|
"loss": 6.6491,
|
||
|
|
"mean_token_accuracy": 0.11653751060366631,
|
||
|
|
"num_tokens": 1114385.0,
|
||
|
|
"step": 465
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.213460397720337,
|
||
|
|
"epoch": 0.030219250305407317,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.00023449999999999998,
|
||
|
|
"loss": 6.6627,
|
||
|
|
"mean_token_accuracy": 0.12240460664033889,
|
||
|
|
"num_tokens": 1126364.0,
|
||
|
|
"step": 470
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.160998678207397,
|
||
|
|
"epoch": 0.030540731691635053,
|
||
|
|
"grad_norm": 1.265625,
|
||
|
|
"learning_rate": 0.000237,
|
||
|
|
"loss": 6.6469,
|
||
|
|
"mean_token_accuracy": 0.12170583978295327,
|
||
|
|
"num_tokens": 1137492.0,
|
||
|
|
"step": 475
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.108113145828247,
|
||
|
|
"epoch": 0.030862213077862792,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0002395,
|
||
|
|
"loss": 6.5317,
|
||
|
|
"mean_token_accuracy": 0.12732059210538865,
|
||
|
|
"num_tokens": 1148734.0,
|
||
|
|
"step": 480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.14542589187622,
|
||
|
|
"epoch": 0.031183694464090528,
|
||
|
|
"grad_norm": 0.96875,
|
||
|
|
"learning_rate": 0.000242,
|
||
|
|
"loss": 6.6757,
|
||
|
|
"mean_token_accuracy": 0.12211950346827508,
|
||
|
|
"num_tokens": 1163229.0,
|
||
|
|
"step": 485
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.165257167816162,
|
||
|
|
"epoch": 0.031505175850318264,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.0002445,
|
||
|
|
"loss": 6.6959,
|
||
|
|
"mean_token_accuracy": 0.1155033528804779,
|
||
|
|
"num_tokens": 1175452.0,
|
||
|
|
"step": 490
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.1013343334198,
|
||
|
|
"epoch": 0.031826657236546006,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.000247,
|
||
|
|
"loss": 6.5479,
|
||
|
|
"mean_token_accuracy": 0.12406643405556679,
|
||
|
|
"num_tokens": 1187836.0,
|
||
|
|
"step": 495
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.197257661819458,
|
||
|
|
"epoch": 0.03214813862277374,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.0002495,
|
||
|
|
"loss": 6.6297,
|
||
|
|
"mean_token_accuracy": 0.12298163026571274,
|
||
|
|
"num_tokens": 1198867.0,
|
||
|
|
"step": 500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.00099925994873,
|
||
|
|
"epoch": 0.03246962000900148,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.000252,
|
||
|
|
"loss": 6.5666,
|
||
|
|
"mean_token_accuracy": 0.11886920258402825,
|
||
|
|
"num_tokens": 1212534.0,
|
||
|
|
"step": 505
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.123233509063721,
|
||
|
|
"epoch": 0.032791101395229214,
|
||
|
|
"grad_norm": 1.4375,
|
||
|
|
"learning_rate": 0.0002545,
|
||
|
|
"loss": 6.4812,
|
||
|
|
"mean_token_accuracy": 0.1376668132841587,
|
||
|
|
"num_tokens": 1223028.0,
|
||
|
|
"step": 510
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.040684223175049,
|
||
|
|
"epoch": 0.033112582781456956,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.000257,
|
||
|
|
"loss": 6.5438,
|
||
|
|
"mean_token_accuracy": 0.12737778946757317,
|
||
|
|
"num_tokens": 1235460.0,
|
||
|
|
"step": 515
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.9980145454406735,
|
||
|
|
"epoch": 0.03343406416768469,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 0.0002595,
|
||
|
|
"loss": 6.5329,
|
||
|
|
"mean_token_accuracy": 0.1297763057053089,
|
||
|
|
"num_tokens": 1247180.0,
|
||
|
|
"step": 520
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.0526275634765625,
|
||
|
|
"epoch": 0.03375554555391243,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.000262,
|
||
|
|
"loss": 6.5934,
|
||
|
|
"mean_token_accuracy": 0.12331821173429489,
|
||
|
|
"num_tokens": 1260000.0,
|
||
|
|
"step": 525
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.997141313552857,
|
||
|
|
"epoch": 0.034077026940140163,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.00026450000000000003,
|
||
|
|
"loss": 6.4284,
|
||
|
|
"mean_token_accuracy": 0.12857622653245926,
|
||
|
|
"num_tokens": 1271346.0,
|
||
|
|
"step": 530
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.008873414993286,
|
||
|
|
"epoch": 0.034398508326367906,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.00026700000000000004,
|
||
|
|
"loss": 6.5163,
|
||
|
|
"mean_token_accuracy": 0.12632984891533852,
|
||
|
|
"num_tokens": 1283017.0,
|
||
|
|
"step": 535
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.0776612758636475,
|
||
|
|
"epoch": 0.03471998971259564,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 0.00026950000000000005,
|
||
|
|
"loss": 6.5481,
|
||
|
|
"mean_token_accuracy": 0.12498711422085762,
|
||
|
|
"num_tokens": 1293243.0,
|
||
|
|
"step": 540
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.8785299301147464,
|
||
|
|
"epoch": 0.03504147109882338,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.00027200000000000005,
|
||
|
|
"loss": 6.439,
|
||
|
|
"mean_token_accuracy": 0.134949841350317,
|
||
|
|
"num_tokens": 1304801.0,
|
||
|
|
"step": 545
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.143336582183838,
|
||
|
|
"epoch": 0.03536295248505111,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0002745,
|
||
|
|
"loss": 6.6164,
|
||
|
|
"mean_token_accuracy": 0.12681611329317094,
|
||
|
|
"num_tokens": 1315985.0,
|
||
|
|
"step": 550
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.930103540420532,
|
||
|
|
"epoch": 0.035684433871278856,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.000277,
|
||
|
|
"loss": 6.4575,
|
||
|
|
"mean_token_accuracy": 0.13166105449199678,
|
||
|
|
"num_tokens": 1327771.0,
|
||
|
|
"step": 555
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.966667604446411,
|
||
|
|
"epoch": 0.03600591525750659,
|
||
|
|
"grad_norm": 1.3359375,
|
||
|
|
"learning_rate": 0.0002795,
|
||
|
|
"loss": 6.412,
|
||
|
|
"mean_token_accuracy": 0.13625267744064332,
|
||
|
|
"num_tokens": 1338524.0,
|
||
|
|
"step": 560
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.932982063293457,
|
||
|
|
"epoch": 0.03632739664373433,
|
||
|
|
"grad_norm": 1.2734375,
|
||
|
|
"learning_rate": 0.00028199999999999997,
|
||
|
|
"loss": 6.4579,
|
||
|
|
"mean_token_accuracy": 0.12851827815175057,
|
||
|
|
"num_tokens": 1350619.0,
|
||
|
|
"step": 565
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.9319816589355465,
|
||
|
|
"epoch": 0.03664887802996206,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.0002845,
|
||
|
|
"loss": 6.4918,
|
||
|
|
"mean_token_accuracy": 0.12711360901594163,
|
||
|
|
"num_tokens": 1362781.0,
|
||
|
|
"step": 570
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.932379579544067,
|
||
|
|
"epoch": 0.0369703594161898,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.000287,
|
||
|
|
"loss": 6.4437,
|
||
|
|
"mean_token_accuracy": 0.1318575732409954,
|
||
|
|
"num_tokens": 1373784.0,
|
||
|
|
"step": 575
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.074356174468994,
|
||
|
|
"epoch": 0.03729184080241754,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.0002895,
|
||
|
|
"loss": 6.705,
|
||
|
|
"mean_token_accuracy": 0.11901014372706413,
|
||
|
|
"num_tokens": 1386426.0,
|
||
|
|
"step": 580
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.872195100784301,
|
||
|
|
"epoch": 0.03761332218864528,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.000292,
|
||
|
|
"loss": 6.3845,
|
||
|
|
"mean_token_accuracy": 0.13377587869763374,
|
||
|
|
"num_tokens": 1397703.0,
|
||
|
|
"step": 585
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.900994157791137,
|
||
|
|
"epoch": 0.03793480357487301,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0002945,
|
||
|
|
"loss": 6.4395,
|
||
|
|
"mean_token_accuracy": 0.12795801013708114,
|
||
|
|
"num_tokens": 1410071.0,
|
||
|
|
"step": 590
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.954240083694458,
|
||
|
|
"epoch": 0.03825628496110075,
|
||
|
|
"grad_norm": 1.3828125,
|
||
|
|
"learning_rate": 0.000297,
|
||
|
|
"loss": 6.4338,
|
||
|
|
"mean_token_accuracy": 0.1245950624346733,
|
||
|
|
"num_tokens": 1421387.0,
|
||
|
|
"step": 595
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.907541370391845,
|
||
|
|
"epoch": 0.03857776634732849,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.0002995,
|
||
|
|
"loss": 6.4593,
|
||
|
|
"mean_token_accuracy": 0.12624357938766478,
|
||
|
|
"num_tokens": 1433253.0,
|
||
|
|
"step": 600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.899614143371582,
|
||
|
|
"epoch": 0.03889924773355623,
|
||
|
|
"grad_norm": 1.4296875,
|
||
|
|
"learning_rate": 0.000302,
|
||
|
|
"loss": 6.4459,
|
||
|
|
"mean_token_accuracy": 0.12114612162113189,
|
||
|
|
"num_tokens": 1444189.0,
|
||
|
|
"step": 605
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.889805459976197,
|
||
|
|
"epoch": 0.03922072911978396,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.0003045,
|
||
|
|
"loss": 6.4478,
|
||
|
|
"mean_token_accuracy": 0.12658536732196807,
|
||
|
|
"num_tokens": 1455830.0,
|
||
|
|
"step": 610
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.883515930175781,
|
||
|
|
"epoch": 0.0395422105060117,
|
||
|
|
"grad_norm": 1.2421875,
|
||
|
|
"learning_rate": 0.000307,
|
||
|
|
"loss": 6.474,
|
||
|
|
"mean_token_accuracy": 0.13375141024589537,
|
||
|
|
"num_tokens": 1467442.0,
|
||
|
|
"step": 615
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.902092170715332,
|
||
|
|
"epoch": 0.03986369189223944,
|
||
|
|
"grad_norm": 1.2421875,
|
||
|
|
"learning_rate": 0.0003095,
|
||
|
|
"loss": 6.378,
|
||
|
|
"mean_token_accuracy": 0.1375095695257187,
|
||
|
|
"num_tokens": 1478113.0,
|
||
|
|
"step": 620
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.887974262237549,
|
||
|
|
"epoch": 0.04018517327846718,
|
||
|
|
"grad_norm": 1.2265625,
|
||
|
|
"learning_rate": 0.000312,
|
||
|
|
"loss": 6.4173,
|
||
|
|
"mean_token_accuracy": 0.1352170430123806,
|
||
|
|
"num_tokens": 1490097.0,
|
||
|
|
"step": 625
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.751322174072266,
|
||
|
|
"epoch": 0.04050665466469491,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 0.0003145,
|
||
|
|
"loss": 6.3863,
|
||
|
|
"mean_token_accuracy": 0.13129702284932138,
|
||
|
|
"num_tokens": 1501565.0,
|
||
|
|
"step": 630
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.841671752929687,
|
||
|
|
"epoch": 0.04082813605092265,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.000317,
|
||
|
|
"loss": 6.385,
|
||
|
|
"mean_token_accuracy": 0.13331395909190177,
|
||
|
|
"num_tokens": 1512434.0,
|
||
|
|
"step": 635
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.838632202148437,
|
||
|
|
"epoch": 0.04114961743715039,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0003195,
|
||
|
|
"loss": 6.3326,
|
||
|
|
"mean_token_accuracy": 0.13992721661925317,
|
||
|
|
"num_tokens": 1524212.0,
|
||
|
|
"step": 640
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.717573928833008,
|
||
|
|
"epoch": 0.04147109882337813,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.000322,
|
||
|
|
"loss": 6.2641,
|
||
|
|
"mean_token_accuracy": 0.13435597494244575,
|
||
|
|
"num_tokens": 1536588.0,
|
||
|
|
"step": 645
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.813121795654297,
|
||
|
|
"epoch": 0.04179258020960586,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.00032450000000000003,
|
||
|
|
"loss": 6.4067,
|
||
|
|
"mean_token_accuracy": 0.1357954926788807,
|
||
|
|
"num_tokens": 1548334.0,
|
||
|
|
"step": 650
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.733175325393677,
|
||
|
|
"epoch": 0.0421140615958336,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.00032700000000000003,
|
||
|
|
"loss": 6.3691,
|
||
|
|
"mean_token_accuracy": 0.13718299865722655,
|
||
|
|
"num_tokens": 1560381.0,
|
||
|
|
"step": 655
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.773969268798828,
|
||
|
|
"epoch": 0.04243554298206134,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.00032950000000000004,
|
||
|
|
"loss": 6.3926,
|
||
|
|
"mean_token_accuracy": 0.1230570524930954,
|
||
|
|
"num_tokens": 1573484.0,
|
||
|
|
"step": 660
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.820370149612427,
|
||
|
|
"epoch": 0.04275702436828908,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.00033200000000000005,
|
||
|
|
"loss": 6.3808,
|
||
|
|
"mean_token_accuracy": 0.13517048284411431,
|
||
|
|
"num_tokens": 1585471.0,
|
||
|
|
"step": 665
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.72473177909851,
|
||
|
|
"epoch": 0.04307850575451681,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00033450000000000005,
|
||
|
|
"loss": 6.2612,
|
||
|
|
"mean_token_accuracy": 0.14530360400676728,
|
||
|
|
"num_tokens": 1596321.0,
|
||
|
|
"step": 670
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.86566572189331,
|
||
|
|
"epoch": 0.04339998714074455,
|
||
|
|
"grad_norm": 1.2265625,
|
||
|
|
"learning_rate": 0.000337,
|
||
|
|
"loss": 6.4255,
|
||
|
|
"mean_token_accuracy": 0.1406514436006546,
|
||
|
|
"num_tokens": 1608219.0,
|
||
|
|
"step": 675
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.6760951519012455,
|
||
|
|
"epoch": 0.04372146852697229,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0003395,
|
||
|
|
"loss": 6.2714,
|
||
|
|
"mean_token_accuracy": 0.13934220522642135,
|
||
|
|
"num_tokens": 1619420.0,
|
||
|
|
"step": 680
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.79856915473938,
|
||
|
|
"epoch": 0.04404294991320003,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.000342,
|
||
|
|
"loss": 6.3423,
|
||
|
|
"mean_token_accuracy": 0.13619581386446952,
|
||
|
|
"num_tokens": 1631022.0,
|
||
|
|
"step": 685
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.7899799823760985,
|
||
|
|
"epoch": 0.04436443129942776,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.00034449999999999997,
|
||
|
|
"loss": 6.3661,
|
||
|
|
"mean_token_accuracy": 0.13836024552583695,
|
||
|
|
"num_tokens": 1642930.0,
|
||
|
|
"step": 690
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.691325092315674,
|
||
|
|
"epoch": 0.0446859126856555,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.000347,
|
||
|
|
"loss": 6.3574,
|
||
|
|
"mean_token_accuracy": 0.1367586337029934,
|
||
|
|
"num_tokens": 1655776.0,
|
||
|
|
"step": 695
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.817952728271484,
|
||
|
|
"epoch": 0.045007394071883235,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0003495,
|
||
|
|
"loss": 6.361,
|
||
|
|
"mean_token_accuracy": 0.1369588740170002,
|
||
|
|
"num_tokens": 1669330.0,
|
||
|
|
"step": 700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.626900386810303,
|
||
|
|
"epoch": 0.04532887545811098,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.000352,
|
||
|
|
"loss": 6.3733,
|
||
|
|
"mean_token_accuracy": 0.1379777029156685,
|
||
|
|
"num_tokens": 1682126.0,
|
||
|
|
"step": 705
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.74940242767334,
|
||
|
|
"epoch": 0.04565035684433871,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.0003545,
|
||
|
|
"loss": 6.2913,
|
||
|
|
"mean_token_accuracy": 0.14252828136086465,
|
||
|
|
"num_tokens": 1693070.0,
|
||
|
|
"step": 710
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.821109485626221,
|
||
|
|
"epoch": 0.04597183823056645,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.000357,
|
||
|
|
"loss": 6.3673,
|
||
|
|
"mean_token_accuracy": 0.13518087714910507,
|
||
|
|
"num_tokens": 1705254.0,
|
||
|
|
"step": 715
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.716013097763062,
|
||
|
|
"epoch": 0.046293319616794185,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.0003595,
|
||
|
|
"loss": 6.3296,
|
||
|
|
"mean_token_accuracy": 0.1330641709268093,
|
||
|
|
"num_tokens": 1718214.0,
|
||
|
|
"step": 720
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.745158529281616,
|
||
|
|
"epoch": 0.04661480100302193,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.000362,
|
||
|
|
"loss": 6.36,
|
||
|
|
"mean_token_accuracy": 0.13509849980473518,
|
||
|
|
"num_tokens": 1731046.0,
|
||
|
|
"step": 725
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.691292095184326,
|
||
|
|
"epoch": 0.04693628238924966,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.0003645,
|
||
|
|
"loss": 6.3051,
|
||
|
|
"mean_token_accuracy": 0.13931626304984093,
|
||
|
|
"num_tokens": 1744332.0,
|
||
|
|
"step": 730
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.6679082870483395,
|
||
|
|
"epoch": 0.0472577637754774,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.000367,
|
||
|
|
"loss": 6.3141,
|
||
|
|
"mean_token_accuracy": 0.1361882694065571,
|
||
|
|
"num_tokens": 1757744.0,
|
||
|
|
"step": 735
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.755461311340332,
|
||
|
|
"epoch": 0.047579245161705135,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.0003695,
|
||
|
|
"loss": 6.3255,
|
||
|
|
"mean_token_accuracy": 0.13589167818427086,
|
||
|
|
"num_tokens": 1769710.0,
|
||
|
|
"step": 740
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.661909294128418,
|
||
|
|
"epoch": 0.04790072654793288,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.000372,
|
||
|
|
"loss": 6.3197,
|
||
|
|
"mean_token_accuracy": 0.134683046489954,
|
||
|
|
"num_tokens": 1782299.0,
|
||
|
|
"step": 745
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.686239433288574,
|
||
|
|
"epoch": 0.04822220793416061,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.0003745,
|
||
|
|
"loss": 6.2854,
|
||
|
|
"mean_token_accuracy": 0.1418588526546955,
|
||
|
|
"num_tokens": 1794407.0,
|
||
|
|
"step": 750
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.681186580657959,
|
||
|
|
"epoch": 0.04854368932038835,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.000377,
|
||
|
|
"loss": 6.2539,
|
||
|
|
"mean_token_accuracy": 0.13846987187862397,
|
||
|
|
"num_tokens": 1806512.0,
|
||
|
|
"step": 755
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.679962110519409,
|
||
|
|
"epoch": 0.048865170706616085,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.0003795,
|
||
|
|
"loss": 6.2985,
|
||
|
|
"mean_token_accuracy": 0.14243988171219826,
|
||
|
|
"num_tokens": 1819456.0,
|
||
|
|
"step": 760
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.526072311401367,
|
||
|
|
"epoch": 0.04918665209284383,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 0.000382,
|
||
|
|
"loss": 6.1211,
|
||
|
|
"mean_token_accuracy": 0.14557768478989602,
|
||
|
|
"num_tokens": 1831866.0,
|
||
|
|
"step": 765
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.57554988861084,
|
||
|
|
"epoch": 0.04950813347907156,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.0003845,
|
||
|
|
"loss": 6.141,
|
||
|
|
"mean_token_accuracy": 0.14539860635995866,
|
||
|
|
"num_tokens": 1842662.0,
|
||
|
|
"step": 770
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.579600238800049,
|
||
|
|
"epoch": 0.0498296148652993,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00038700000000000003,
|
||
|
|
"loss": 6.1807,
|
||
|
|
"mean_token_accuracy": 0.14677832573652266,
|
||
|
|
"num_tokens": 1855599.0,
|
||
|
|
"step": 775
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.664310932159424,
|
||
|
|
"epoch": 0.050151096251527034,
|
||
|
|
"grad_norm": 1.265625,
|
||
|
|
"learning_rate": 0.00038950000000000003,
|
||
|
|
"loss": 6.2611,
|
||
|
|
"mean_token_accuracy": 0.13455238118767737,
|
||
|
|
"num_tokens": 1866656.0,
|
||
|
|
"step": 780
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.580622625350952,
|
||
|
|
"epoch": 0.05047257763775478,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.00039200000000000004,
|
||
|
|
"loss": 6.2491,
|
||
|
|
"mean_token_accuracy": 0.13729645386338235,
|
||
|
|
"num_tokens": 1877473.0,
|
||
|
|
"step": 785
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.699300527572632,
|
||
|
|
"epoch": 0.05079405902398251,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00039450000000000005,
|
||
|
|
"loss": 6.2869,
|
||
|
|
"mean_token_accuracy": 0.13934579417109488,
|
||
|
|
"num_tokens": 1889113.0,
|
||
|
|
"step": 790
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.575865650177002,
|
||
|
|
"epoch": 0.05111554041021025,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.00039700000000000005,
|
||
|
|
"loss": 6.1885,
|
||
|
|
"mean_token_accuracy": 0.1417413368821144,
|
||
|
|
"num_tokens": 1901528.0,
|
||
|
|
"step": 795
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.590616846084595,
|
||
|
|
"epoch": 0.051437021796437984,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0003995,
|
||
|
|
"loss": 6.2219,
|
||
|
|
"mean_token_accuracy": 0.13816025704145432,
|
||
|
|
"num_tokens": 1912036.0,
|
||
|
|
"step": 800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.601884841918945,
|
||
|
|
"epoch": 0.05175850318266572,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.000402,
|
||
|
|
"loss": 6.1707,
|
||
|
|
"mean_token_accuracy": 0.14483692795038222,
|
||
|
|
"num_tokens": 1923939.0,
|
||
|
|
"step": 805
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.482674884796142,
|
||
|
|
"epoch": 0.05207998456889346,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0004045,
|
||
|
|
"loss": 6.1383,
|
||
|
|
"mean_token_accuracy": 0.15191132128238677,
|
||
|
|
"num_tokens": 1935248.0,
|
||
|
|
"step": 810
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.679584169387818,
|
||
|
|
"epoch": 0.0524014659551212,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.00040699999999999997,
|
||
|
|
"loss": 6.2512,
|
||
|
|
"mean_token_accuracy": 0.1460711881518364,
|
||
|
|
"num_tokens": 1946732.0,
|
||
|
|
"step": 815
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.574809503555298,
|
||
|
|
"epoch": 0.052722947341348934,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.0004095,
|
||
|
|
"loss": 6.226,
|
||
|
|
"mean_token_accuracy": 0.1427159160375595,
|
||
|
|
"num_tokens": 1958316.0,
|
||
|
|
"step": 820
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.472147607803345,
|
||
|
|
"epoch": 0.05304442872757667,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.000412,
|
||
|
|
"loss": 6.0917,
|
||
|
|
"mean_token_accuracy": 0.15051717907190323,
|
||
|
|
"num_tokens": 1969543.0,
|
||
|
|
"step": 825
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.623300170898437,
|
||
|
|
"epoch": 0.05336591011380441,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.0004145,
|
||
|
|
"loss": 6.313,
|
||
|
|
"mean_token_accuracy": 0.1366821512579918,
|
||
|
|
"num_tokens": 1981085.0,
|
||
|
|
"step": 830
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.603462076187133,
|
||
|
|
"epoch": 0.05368739150003215,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.000417,
|
||
|
|
"loss": 6.1986,
|
||
|
|
"mean_token_accuracy": 0.14714324995875358,
|
||
|
|
"num_tokens": 1992610.0,
|
||
|
|
"step": 835
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.533374309539795,
|
||
|
|
"epoch": 0.054008872886259884,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.0004195,
|
||
|
|
"loss": 6.1716,
|
||
|
|
"mean_token_accuracy": 0.14295029491186143,
|
||
|
|
"num_tokens": 2004154.0,
|
||
|
|
"step": 840
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.516127395629883,
|
||
|
|
"epoch": 0.05433035427248762,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.000422,
|
||
|
|
"loss": 6.0815,
|
||
|
|
"mean_token_accuracy": 0.14348058253526688,
|
||
|
|
"num_tokens": 2015141.0,
|
||
|
|
"step": 845
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.5279299259185795,
|
||
|
|
"epoch": 0.05465183565871536,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.0004245,
|
||
|
|
"loss": 6.1455,
|
||
|
|
"mean_token_accuracy": 0.15023983269929886,
|
||
|
|
"num_tokens": 2028173.0,
|
||
|
|
"step": 850
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.429127645492554,
|
||
|
|
"epoch": 0.0549733170449431,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.000427,
|
||
|
|
"loss": 6.1486,
|
||
|
|
"mean_token_accuracy": 0.14123030006885529,
|
||
|
|
"num_tokens": 2039979.0,
|
||
|
|
"step": 855
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.57825779914856,
|
||
|
|
"epoch": 0.055294798431170834,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0004295,
|
||
|
|
"loss": 6.0981,
|
||
|
|
"mean_token_accuracy": 0.14770488440990448,
|
||
|
|
"num_tokens": 2051052.0,
|
||
|
|
"step": 860
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.48339581489563,
|
||
|
|
"epoch": 0.05561627981739857,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.000432,
|
||
|
|
"loss": 6.2736,
|
||
|
|
"mean_token_accuracy": 0.13757081255316733,
|
||
|
|
"num_tokens": 2064252.0,
|
||
|
|
"step": 865
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.527880430221558,
|
||
|
|
"epoch": 0.05593776120362631,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.0004345,
|
||
|
|
"loss": 6.1659,
|
||
|
|
"mean_token_accuracy": 0.14587004482746124,
|
||
|
|
"num_tokens": 2075697.0,
|
||
|
|
"step": 870
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.587885761260987,
|
||
|
|
"epoch": 0.05625924258985405,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.000437,
|
||
|
|
"loss": 6.2902,
|
||
|
|
"mean_token_accuracy": 0.1394598327577114,
|
||
|
|
"num_tokens": 2088354.0,
|
||
|
|
"step": 875
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.597920179367065,
|
||
|
|
"epoch": 0.056580723976081784,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.0004395,
|
||
|
|
"loss": 6.2794,
|
||
|
|
"mean_token_accuracy": 0.14314963445067405,
|
||
|
|
"num_tokens": 2101291.0,
|
||
|
|
"step": 880
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.531395626068115,
|
||
|
|
"epoch": 0.05690220536230952,
|
||
|
|
"grad_norm": 1.40625,
|
||
|
|
"learning_rate": 0.000442,
|
||
|
|
"loss": 6.1794,
|
||
|
|
"mean_token_accuracy": 0.15109536275267602,
|
||
|
|
"num_tokens": 2114151.0,
|
||
|
|
"step": 885
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.5403975486755375,
|
||
|
|
"epoch": 0.05722368674853726,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.0004445,
|
||
|
|
"loss": 6.2204,
|
||
|
|
"mean_token_accuracy": 0.140879013389349,
|
||
|
|
"num_tokens": 2127638.0,
|
||
|
|
"step": 890
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.454720592498779,
|
||
|
|
"epoch": 0.057545168134765,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.000447,
|
||
|
|
"loss": 6.1054,
|
||
|
|
"mean_token_accuracy": 0.15080050081014634,
|
||
|
|
"num_tokens": 2139773.0,
|
||
|
|
"step": 895
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.582310771942138,
|
||
|
|
"epoch": 0.057866649520992734,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.00044950000000000003,
|
||
|
|
"loss": 6.2261,
|
||
|
|
"mean_token_accuracy": 0.13719287440180777,
|
||
|
|
"num_tokens": 2151167.0,
|
||
|
|
"step": 900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.373457574844361,
|
||
|
|
"epoch": 0.05818813090722047,
|
||
|
|
"grad_norm": 0.98828125,
|
||
|
|
"learning_rate": 0.00045200000000000004,
|
||
|
|
"loss": 6.1103,
|
||
|
|
"mean_token_accuracy": 0.14882433116436006,
|
||
|
|
"num_tokens": 2163150.0,
|
||
|
|
"step": 905
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.511533308029175,
|
||
|
|
"epoch": 0.05850961229344821,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.00045450000000000004,
|
||
|
|
"loss": 6.138,
|
||
|
|
"mean_token_accuracy": 0.1470898576080799,
|
||
|
|
"num_tokens": 2175116.0,
|
||
|
|
"step": 910
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.402334594726563,
|
||
|
|
"epoch": 0.05883109367967595,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.00045700000000000005,
|
||
|
|
"loss": 6.0541,
|
||
|
|
"mean_token_accuracy": 0.1523958332836628,
|
||
|
|
"num_tokens": 2188074.0,
|
||
|
|
"step": 915
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.463513612747192,
|
||
|
|
"epoch": 0.059152575065903684,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.00045950000000000006,
|
||
|
|
"loss": 6.1002,
|
||
|
|
"mean_token_accuracy": 0.1470402017235756,
|
||
|
|
"num_tokens": 2200706.0,
|
||
|
|
"step": 920
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.349210262298584,
|
||
|
|
"epoch": 0.05947405645213142,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.000462,
|
||
|
|
"loss": 6.1154,
|
||
|
|
"mean_token_accuracy": 0.15224614143371581,
|
||
|
|
"num_tokens": 2212493.0,
|
||
|
|
"step": 925
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.507826137542724,
|
||
|
|
"epoch": 0.059795537838359156,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0004645,
|
||
|
|
"loss": 6.1258,
|
||
|
|
"mean_token_accuracy": 0.14575668349862098,
|
||
|
|
"num_tokens": 2224668.0,
|
||
|
|
"step": 930
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.432238912582397,
|
||
|
|
"epoch": 0.0601170192245869,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.000467,
|
||
|
|
"loss": 6.1242,
|
||
|
|
"mean_token_accuracy": 0.14432022348046303,
|
||
|
|
"num_tokens": 2236280.0,
|
||
|
|
"step": 935
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.493103885650635,
|
||
|
|
"epoch": 0.060438500610814634,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0004695,
|
||
|
|
"loss": 6.1341,
|
||
|
|
"mean_token_accuracy": 0.14489658921957016,
|
||
|
|
"num_tokens": 2246947.0,
|
||
|
|
"step": 940
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.486361408233643,
|
||
|
|
"epoch": 0.06075998199704237,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.000472,
|
||
|
|
"loss": 6.1497,
|
||
|
|
"mean_token_accuracy": 0.1474609225988388,
|
||
|
|
"num_tokens": 2258591.0,
|
||
|
|
"step": 945
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.394432783126831,
|
||
|
|
"epoch": 0.061081463383270106,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.0004745,
|
||
|
|
"loss": 6.1055,
|
||
|
|
"mean_token_accuracy": 0.1405967153608799,
|
||
|
|
"num_tokens": 2269725.0,
|
||
|
|
"step": 950
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.481177186965942,
|
||
|
|
"epoch": 0.06140294476949785,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.000477,
|
||
|
|
"loss": 6.0784,
|
||
|
|
"mean_token_accuracy": 0.1547504723072052,
|
||
|
|
"num_tokens": 2282172.0,
|
||
|
|
"step": 955
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.446505546569824,
|
||
|
|
"epoch": 0.061724426155725584,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.0004795,
|
||
|
|
"loss": 6.2106,
|
||
|
|
"mean_token_accuracy": 0.14404927641153337,
|
||
|
|
"num_tokens": 2293991.0,
|
||
|
|
"step": 960
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.479608154296875,
|
||
|
|
"epoch": 0.06204590754195332,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.000482,
|
||
|
|
"loss": 6.1149,
|
||
|
|
"mean_token_accuracy": 0.1508398488163948,
|
||
|
|
"num_tokens": 2306715.0,
|
||
|
|
"step": 965
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.330813074111939,
|
||
|
|
"epoch": 0.062367388928181056,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.0004845,
|
||
|
|
"loss": 6.1465,
|
||
|
|
"mean_token_accuracy": 0.14545181691646575,
|
||
|
|
"num_tokens": 2319096.0,
|
||
|
|
"step": 970
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.360287046432495,
|
||
|
|
"epoch": 0.0626888703144088,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.000487,
|
||
|
|
"loss": 6.0329,
|
||
|
|
"mean_token_accuracy": 0.14853936582803726,
|
||
|
|
"num_tokens": 2332239.0,
|
||
|
|
"step": 975
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.3763471126556395,
|
||
|
|
"epoch": 0.06301035170063653,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0004895,
|
||
|
|
"loss": 6.1228,
|
||
|
|
"mean_token_accuracy": 0.14723728373646736,
|
||
|
|
"num_tokens": 2343897.0,
|
||
|
|
"step": 980
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.353127479553223,
|
||
|
|
"epoch": 0.06333183308686427,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.000492,
|
||
|
|
"loss": 6.0663,
|
||
|
|
"mean_token_accuracy": 0.14970697611570358,
|
||
|
|
"num_tokens": 2356811.0,
|
||
|
|
"step": 985
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.3828963279724125,
|
||
|
|
"epoch": 0.06365331447309201,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.0004945,
|
||
|
|
"loss": 6.0559,
|
||
|
|
"mean_token_accuracy": 0.15341916903853417,
|
||
|
|
"num_tokens": 2369146.0,
|
||
|
|
"step": 990
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.346980619430542,
|
||
|
|
"epoch": 0.06397479585931974,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.000497,
|
||
|
|
"loss": 6.0164,
|
||
|
|
"mean_token_accuracy": 0.1514612004160881,
|
||
|
|
"num_tokens": 2381154.0,
|
||
|
|
"step": 995
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.36736650466919,
|
||
|
|
"epoch": 0.06429627724554748,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 0.0004995,
|
||
|
|
"loss": 6.1074,
|
||
|
|
"mean_token_accuracy": 0.14672497659921646,
|
||
|
|
"num_tokens": 2392095.0,
|
||
|
|
"step": 1000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.426885080337525,
|
||
|
|
"epoch": 0.06461775863177523,
|
||
|
|
"grad_norm": 0.92578125,
|
||
|
|
"learning_rate": 0.000499998026082006,
|
||
|
|
"loss": 6.2126,
|
||
|
|
"mean_token_accuracy": 0.14347948506474495,
|
||
|
|
"num_tokens": 2405446.0,
|
||
|
|
"step": 1005
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.350338315963745,
|
||
|
|
"epoch": 0.06493924001800296,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0004999900070995136,
|
||
|
|
"loss": 6.0627,
|
||
|
|
"mean_token_accuracy": 0.1458252727985382,
|
||
|
|
"num_tokens": 2418506.0,
|
||
|
|
"step": 1010
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.34899787902832,
|
||
|
|
"epoch": 0.0652607214042307,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0004999758199023239,
|
||
|
|
"loss": 6.0568,
|
||
|
|
"mean_token_accuracy": 0.15567989647388458,
|
||
|
|
"num_tokens": 2430125.0,
|
||
|
|
"step": 1015
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.37267050743103,
|
||
|
|
"epoch": 0.06558220279045843,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0004999554648793858,
|
||
|
|
"loss": 6.0766,
|
||
|
|
"mean_token_accuracy": 0.14890180379152299,
|
||
|
|
"num_tokens": 2442000.0,
|
||
|
|
"step": 1020
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.391686868667603,
|
||
|
|
"epoch": 0.06590368417668617,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0004999289425887425,
|
||
|
|
"loss": 6.095,
|
||
|
|
"mean_token_accuracy": 0.1505647674202919,
|
||
|
|
"num_tokens": 2453389.0,
|
||
|
|
"step": 1025
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.414132595062256,
|
||
|
|
"epoch": 0.06622516556291391,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0004998962537575161,
|
||
|
|
"loss": 6.1065,
|
||
|
|
"mean_token_accuracy": 0.1472689539194107,
|
||
|
|
"num_tokens": 2464988.0,
|
||
|
|
"step": 1030
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.3225417137146,
|
||
|
|
"epoch": 0.06654664694914164,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.0004998573992818874,
|
||
|
|
"loss": 6.0009,
|
||
|
|
"mean_token_accuracy": 0.15887372940778732,
|
||
|
|
"num_tokens": 2476820.0,
|
||
|
|
"step": 1035
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.353922176361084,
|
||
|
|
"epoch": 0.06686812833536938,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0004998123802270715,
|
||
|
|
"loss": 6.0069,
|
||
|
|
"mean_token_accuracy": 0.14979753121733666,
|
||
|
|
"num_tokens": 2489427.0,
|
||
|
|
"step": 1040
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.2835996627807615,
|
||
|
|
"epoch": 0.06718960972159711,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0004997611978272886,
|
||
|
|
"loss": 6.0293,
|
||
|
|
"mean_token_accuracy": 0.15290547013282776,
|
||
|
|
"num_tokens": 2501084.0,
|
||
|
|
"step": 1045
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.393969631195068,
|
||
|
|
"epoch": 0.06751109110782486,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 0.0004997038534857298,
|
||
|
|
"loss": 6.1253,
|
||
|
|
"mean_token_accuracy": 0.1501571610569954,
|
||
|
|
"num_tokens": 2513005.0,
|
||
|
|
"step": 1050
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.297085285186768,
|
||
|
|
"epoch": 0.0678325724940526,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.0004996403487745194,
|
||
|
|
"loss": 5.9784,
|
||
|
|
"mean_token_accuracy": 0.15144816786050797,
|
||
|
|
"num_tokens": 2526217.0,
|
||
|
|
"step": 1055
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.364409065246582,
|
||
|
|
"epoch": 0.06815405388028033,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.000499570685434671,
|
||
|
|
"loss": 6.0721,
|
||
|
|
"mean_token_accuracy": 0.15043441355228424,
|
||
|
|
"num_tokens": 2538892.0,
|
||
|
|
"step": 1060
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.305640745162964,
|
||
|
|
"epoch": 0.06847553526650807,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.0004994948653760405,
|
||
|
|
"loss": 6.0322,
|
||
|
|
"mean_token_accuracy": 0.15073884129524232,
|
||
|
|
"num_tokens": 2549929.0,
|
||
|
|
"step": 1065
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.316273498535156,
|
||
|
|
"epoch": 0.06879701665273581,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0004994128906772729,
|
||
|
|
"loss": 5.967,
|
||
|
|
"mean_token_accuracy": 0.16290880739688873,
|
||
|
|
"num_tokens": 2561322.0,
|
||
|
|
"step": 1070
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.35417103767395,
|
||
|
|
"epoch": 0.06911849803896354,
|
||
|
|
"grad_norm": 0.98828125,
|
||
|
|
"learning_rate": 0.000499324763585746,
|
||
|
|
"loss": 5.9635,
|
||
|
|
"mean_token_accuracy": 0.16284787505865098,
|
||
|
|
"num_tokens": 2572908.0,
|
||
|
|
"step": 1075
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.189544916152954,
|
||
|
|
"epoch": 0.06943997942519128,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0004992304865175085,
|
||
|
|
"loss": 6.0468,
|
||
|
|
"mean_token_accuracy": 0.14753600358963012,
|
||
|
|
"num_tokens": 2584880.0,
|
||
|
|
"step": 1080
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.304679203033447,
|
||
|
|
"epoch": 0.06976146081141901,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0004991300620572138,
|
||
|
|
"loss": 5.9537,
|
||
|
|
"mean_token_accuracy": 0.15288592427968978,
|
||
|
|
"num_tokens": 2596663.0,
|
||
|
|
"step": 1085
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.306663751602173,
|
||
|
|
"epoch": 0.07008294219764676,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.0004990234929580494,
|
||
|
|
"loss": 6.0103,
|
||
|
|
"mean_token_accuracy": 0.150350858271122,
|
||
|
|
"num_tokens": 2608609.0,
|
||
|
|
"step": 1090
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.189498329162598,
|
||
|
|
"epoch": 0.0704044235838745,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 0.0004989107821416609,
|
||
|
|
"loss": 5.9271,
|
||
|
|
"mean_token_accuracy": 0.15373560041189194,
|
||
|
|
"num_tokens": 2620535.0,
|
||
|
|
"step": 1095
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.272855806350708,
|
||
|
|
"epoch": 0.07072590497010223,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.0004987919326980723,
|
||
|
|
"loss": 6.0391,
|
||
|
|
"mean_token_accuracy": 0.14719461053609847,
|
||
|
|
"num_tokens": 2631718.0,
|
||
|
|
"step": 1100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.330906057357788,
|
||
|
|
"epoch": 0.07104738635632997,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0004986669478856011,
|
||
|
|
"loss": 5.9971,
|
||
|
|
"mean_token_accuracy": 0.1513780727982521,
|
||
|
|
"num_tokens": 2644641.0,
|
||
|
|
"step": 1105
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.242729377746582,
|
||
|
|
"epoch": 0.07136886774255771,
|
||
|
|
"grad_norm": 1.71875,
|
||
|
|
"learning_rate": 0.0004985358311307688,
|
||
|
|
"loss": 6.0712,
|
||
|
|
"mean_token_accuracy": 0.1472596064209938,
|
||
|
|
"num_tokens": 2656445.0,
|
||
|
|
"step": 1110
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.2387518882751465,
|
||
|
|
"epoch": 0.07169034912878544,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.0004983985860282081,
|
||
|
|
"loss": 5.9288,
|
||
|
|
"mean_token_accuracy": 0.16197773665189744,
|
||
|
|
"num_tokens": 2667782.0,
|
||
|
|
"step": 1115
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.297261524200439,
|
||
|
|
"epoch": 0.07201183051501318,
|
||
|
|
"grad_norm": 0.96484375,
|
||
|
|
"learning_rate": 0.0004982552163405623,
|
||
|
|
"loss": 5.8888,
|
||
|
|
"mean_token_accuracy": 0.16516102403402327,
|
||
|
|
"num_tokens": 2679421.0,
|
||
|
|
"step": 1120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.153607034683228,
|
||
|
|
"epoch": 0.07233331190124091,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0004981057259983839,
|
||
|
|
"loss": 5.8252,
|
||
|
|
"mean_token_accuracy": 0.16737353205680847,
|
||
|
|
"num_tokens": 2690045.0,
|
||
|
|
"step": 1125
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.256674098968506,
|
||
|
|
"epoch": 0.07265479328746866,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.0004979501191000262,
|
||
|
|
"loss": 5.9358,
|
||
|
|
"mean_token_accuracy": 0.1594891406595707,
|
||
|
|
"num_tokens": 2702725.0,
|
||
|
|
"step": 1130
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.189019870758057,
|
||
|
|
"epoch": 0.0729762746736964,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0004977883999115311,
|
||
|
|
"loss": 5.9325,
|
||
|
|
"mean_token_accuracy": 0.1560269773006439,
|
||
|
|
"num_tokens": 2714874.0,
|
||
|
|
"step": 1135
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.31310076713562,
|
||
|
|
"epoch": 0.07329775605992413,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.0004976205728665113,
|
||
|
|
"loss": 6.0494,
|
||
|
|
"mean_token_accuracy": 0.14427177235484123,
|
||
|
|
"num_tokens": 2727237.0,
|
||
|
|
"step": 1140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.140863609313965,
|
||
|
|
"epoch": 0.07361923744615187,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.0004974466425660307,
|
||
|
|
"loss": 5.9221,
|
||
|
|
"mean_token_accuracy": 0.15012870132923126,
|
||
|
|
"num_tokens": 2738201.0,
|
||
|
|
"step": 1145
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.239338064193726,
|
||
|
|
"epoch": 0.0739407188323796,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.0004972666137784759,
|
||
|
|
"loss": 5.967,
|
||
|
|
"mean_token_accuracy": 0.161196768283844,
|
||
|
|
"num_tokens": 2749926.0,
|
||
|
|
"step": 1150
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.244922113418579,
|
||
|
|
"epoch": 0.07426220021860734,
|
||
|
|
"grad_norm": 0.96875,
|
||
|
|
"learning_rate": 0.0004970804914394271,
|
||
|
|
"loss": 5.9984,
|
||
|
|
"mean_token_accuracy": 0.146126826107502,
|
||
|
|
"num_tokens": 2762454.0,
|
||
|
|
"step": 1155
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.172313117980957,
|
||
|
|
"epoch": 0.07458368160483508,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0004968882806515225,
|
||
|
|
"loss": 5.928,
|
||
|
|
"mean_token_accuracy": 0.1524214893579483,
|
||
|
|
"num_tokens": 2775340.0,
|
||
|
|
"step": 1160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.191201305389404,
|
||
|
|
"epoch": 0.07490516299106281,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.0004966899866843177,
|
||
|
|
"loss": 5.8407,
|
||
|
|
"mean_token_accuracy": 0.1651138797402382,
|
||
|
|
"num_tokens": 2787350.0,
|
||
|
|
"step": 1165
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.163157844543457,
|
||
|
|
"epoch": 0.07522664437729056,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.000496485614974142,
|
||
|
|
"loss": 5.8869,
|
||
|
|
"mean_token_accuracy": 0.16123317033052445,
|
||
|
|
"num_tokens": 2797891.0,
|
||
|
|
"step": 1170
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.166656732559204,
|
||
|
|
"epoch": 0.0755481257635183,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.0004962751711239492,
|
||
|
|
"loss": 5.8488,
|
||
|
|
"mean_token_accuracy": 0.15674188137054443,
|
||
|
|
"num_tokens": 2809199.0,
|
||
|
|
"step": 1175
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.317021608352661,
|
||
|
|
"epoch": 0.07586960714974603,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.0004960586609031636,
|
||
|
|
"loss": 6.1259,
|
||
|
|
"mean_token_accuracy": 0.14605942070484162,
|
||
|
|
"num_tokens": 2820881.0,
|
||
|
|
"step": 1180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.217242765426636,
|
||
|
|
"epoch": 0.07619108853597377,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0004958360902475224,
|
||
|
|
"loss": 5.9131,
|
||
|
|
"mean_token_accuracy": 0.158234640955925,
|
||
|
|
"num_tokens": 2833203.0,
|
||
|
|
"step": 1185
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.085934734344482,
|
||
|
|
"epoch": 0.0765125699222015,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.0004956074652589125,
|
||
|
|
"loss": 5.8158,
|
||
|
|
"mean_token_accuracy": 0.1622716337442398,
|
||
|
|
"num_tokens": 2844695.0,
|
||
|
|
"step": 1190
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.18882040977478,
|
||
|
|
"epoch": 0.07683405130842924,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0004953727922052035,
|
||
|
|
"loss": 5.9218,
|
||
|
|
"mean_token_accuracy": 0.15580735355615616,
|
||
|
|
"num_tokens": 2855757.0,
|
||
|
|
"step": 1195
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.096655941009521,
|
||
|
|
"epoch": 0.07715553269465698,
|
||
|
|
"grad_norm": 0.96484375,
|
||
|
|
"learning_rate": 0.0004951320775200756,
|
||
|
|
"loss": 5.8256,
|
||
|
|
"mean_token_accuracy": 0.1585150107741356,
|
||
|
|
"num_tokens": 2867534.0,
|
||
|
|
"step": 1200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.212085294723511,
|
||
|
|
"epoch": 0.07747701408088471,
|
||
|
|
"grad_norm": 0.9375,
|
||
|
|
"learning_rate": 0.0004948853278028436,
|
||
|
|
"loss": 5.9379,
|
||
|
|
"mean_token_accuracy": 0.15673388540744781,
|
||
|
|
"num_tokens": 2879984.0,
|
||
|
|
"step": 1205
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.263598108291626,
|
||
|
|
"epoch": 0.07779849546711246,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.0004946325498182755,
|
||
|
|
"loss": 5.9533,
|
||
|
|
"mean_token_accuracy": 0.1572867900133133,
|
||
|
|
"num_tokens": 2892920.0,
|
||
|
|
"step": 1210
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.116982269287109,
|
||
|
|
"epoch": 0.0781199768533402,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.0004943737504964076,
|
||
|
|
"loss": 5.9162,
|
||
|
|
"mean_token_accuracy": 0.1617930367588997,
|
||
|
|
"num_tokens": 2903821.0,
|
||
|
|
"step": 1215
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.2275710105896,
|
||
|
|
"epoch": 0.07844145823956793,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.000494108936932354,
|
||
|
|
"loss": 5.9182,
|
||
|
|
"mean_token_accuracy": 0.15855470597743987,
|
||
|
|
"num_tokens": 2916280.0,
|
||
|
|
"step": 1220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.233517837524414,
|
||
|
|
"epoch": 0.07876293962579567,
|
||
|
|
"grad_norm": 0.921875,
|
||
|
|
"learning_rate": 0.0004938381163861124,
|
||
|
|
"loss": 5.9979,
|
||
|
|
"mean_token_accuracy": 0.15871625244617463,
|
||
|
|
"num_tokens": 2928737.0,
|
||
|
|
"step": 1225
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.193160438537598,
|
||
|
|
"epoch": 0.0790844210120234,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0004935612962823645,
|
||
|
|
"loss": 5.891,
|
||
|
|
"mean_token_accuracy": 0.16073769181966782,
|
||
|
|
"num_tokens": 2940833.0,
|
||
|
|
"step": 1230
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.115055561065674,
|
||
|
|
"epoch": 0.07940590239825114,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.0004932784842102739,
|
||
|
|
"loss": 5.8428,
|
||
|
|
"mean_token_accuracy": 0.15946858525276184,
|
||
|
|
"num_tokens": 2952662.0,
|
||
|
|
"step": 1235
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.204311752319336,
|
||
|
|
"epoch": 0.07972738378447888,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.0004929896879232758,
|
||
|
|
"loss": 5.9119,
|
||
|
|
"mean_token_accuracy": 0.1619669482111931,
|
||
|
|
"num_tokens": 2965504.0,
|
||
|
|
"step": 1240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.2926552295684814,
|
||
|
|
"epoch": 0.08004886517070661,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.0004926949153388668,
|
||
|
|
"loss": 5.9785,
|
||
|
|
"mean_token_accuracy": 0.15522371083498002,
|
||
|
|
"num_tokens": 2977610.0,
|
||
|
|
"step": 1245
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.112452220916748,
|
||
|
|
"epoch": 0.08037034655693436,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.0004923941745383859,
|
||
|
|
"loss": 5.8564,
|
||
|
|
"mean_token_accuracy": 0.15934567600488664,
|
||
|
|
"num_tokens": 2989677.0,
|
||
|
|
"step": 1250
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.151176643371582,
|
||
|
|
"epoch": 0.0806918279431621,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.000492087473766794,
|
||
|
|
"loss": 5.9276,
|
||
|
|
"mean_token_accuracy": 0.1602254882454872,
|
||
|
|
"num_tokens": 3002164.0,
|
||
|
|
"step": 1255
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.151615953445434,
|
||
|
|
"epoch": 0.08101330932938983,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.000491774821432448,
|
||
|
|
"loss": 5.839,
|
||
|
|
"mean_token_accuracy": 0.1672609567642212,
|
||
|
|
"num_tokens": 3013487.0,
|
||
|
|
"step": 1260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.091053056716919,
|
||
|
|
"epoch": 0.08133479071561757,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0004914562261068693,
|
||
|
|
"loss": 5.7592,
|
||
|
|
"mean_token_accuracy": 0.1637980043888092,
|
||
|
|
"num_tokens": 3025240.0,
|
||
|
|
"step": 1265
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.198080825805664,
|
||
|
|
"epoch": 0.0816562721018453,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.0004911316965245098,
|
||
|
|
"loss": 5.9558,
|
||
|
|
"mean_token_accuracy": 0.15986837595701217,
|
||
|
|
"num_tokens": 3037931.0,
|
||
|
|
"step": 1270
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.180276155471802,
|
||
|
|
"epoch": 0.08197775348807304,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.000490801241582512,
|
||
|
|
"loss": 5.8599,
|
||
|
|
"mean_token_accuracy": 0.16204103082418442,
|
||
|
|
"num_tokens": 3050977.0,
|
||
|
|
"step": 1275
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.0987457752227785,
|
||
|
|
"epoch": 0.08229923487430078,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.000490464870340465,
|
||
|
|
"loss": 5.7864,
|
||
|
|
"mean_token_accuracy": 0.15847471207380295,
|
||
|
|
"num_tokens": 3064797.0,
|
||
|
|
"step": 1280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.059926891326905,
|
||
|
|
"epoch": 0.08262071626052851,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 0.0004901225920201563,
|
||
|
|
"loss": 5.8721,
|
||
|
|
"mean_token_accuracy": 0.16135916709899903,
|
||
|
|
"num_tokens": 3077595.0,
|
||
|
|
"step": 1285
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.165657234191895,
|
||
|
|
"epoch": 0.08294219764675625,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.000489774416005319,
|
||
|
|
"loss": 5.9139,
|
||
|
|
"mean_token_accuracy": 0.15417862236499785,
|
||
|
|
"num_tokens": 3089913.0,
|
||
|
|
"step": 1290
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.133871126174927,
|
||
|
|
"epoch": 0.08326367903298398,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 0.0004894203518413742,
|
||
|
|
"loss": 5.9087,
|
||
|
|
"mean_token_accuracy": 0.1627100259065628,
|
||
|
|
"num_tokens": 3102554.0,
|
||
|
|
"step": 1295
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.111787605285644,
|
||
|
|
"epoch": 0.08358516041921173,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.0004890604092351701,
|
||
|
|
"loss": 5.8258,
|
||
|
|
"mean_token_accuracy": 0.16240279525518417,
|
||
|
|
"num_tokens": 3113511.0,
|
||
|
|
"step": 1300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.131465053558349,
|
||
|
|
"epoch": 0.08390664180543947,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.000488694598054715,
|
||
|
|
"loss": 5.9213,
|
||
|
|
"mean_token_accuracy": 0.15791668891906738,
|
||
|
|
"num_tokens": 3126829.0,
|
||
|
|
"step": 1305
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.069682979583741,
|
||
|
|
"epoch": 0.0842281231916672,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0004883229283289071,
|
||
|
|
"loss": 5.7673,
|
||
|
|
"mean_token_accuracy": 0.16573094874620437,
|
||
|
|
"num_tokens": 3139836.0,
|
||
|
|
"step": 1310
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.073161935806274,
|
||
|
|
"epoch": 0.08454960457789494,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00048794541024725993,
|
||
|
|
"loss": 5.8286,
|
||
|
|
"mean_token_accuracy": 0.16145224422216414,
|
||
|
|
"num_tokens": 3152047.0,
|
||
|
|
"step": 1315
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.066088485717773,
|
||
|
|
"epoch": 0.08487108596412268,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.0004875620541596221,
|
||
|
|
"loss": 5.7994,
|
||
|
|
"mean_token_accuracy": 0.16172150075435637,
|
||
|
|
"num_tokens": 3163501.0,
|
||
|
|
"step": 1320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.123111963272095,
|
||
|
|
"epoch": 0.08519256735035041,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00048717287057589454,
|
||
|
|
"loss": 5.8752,
|
||
|
|
"mean_token_accuracy": 0.16654538810253144,
|
||
|
|
"num_tokens": 3175918.0,
|
||
|
|
"step": 1325
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.194814872741699,
|
||
|
|
"epoch": 0.08551404873657815,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0004867778701657417,
|
||
|
|
"loss": 5.9495,
|
||
|
|
"mean_token_accuracy": 0.14875137954950332,
|
||
|
|
"num_tokens": 3187911.0,
|
||
|
|
"step": 1330
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.065830373764038,
|
||
|
|
"epoch": 0.08583553012280588,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.00048637706375829955,
|
||
|
|
"loss": 5.7759,
|
||
|
|
"mean_token_accuracy": 0.16410106271505356,
|
||
|
|
"num_tokens": 3200143.0,
|
||
|
|
"step": 1335
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.027771663665772,
|
||
|
|
"epoch": 0.08615701150903363,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.000485970462341878,
|
||
|
|
"loss": 5.7746,
|
||
|
|
"mean_token_accuracy": 0.1614765614271164,
|
||
|
|
"num_tokens": 3211570.0,
|
||
|
|
"step": 1340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.113853216171265,
|
||
|
|
"epoch": 0.08647849289526137,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.00048555807706366044,
|
||
|
|
"loss": 5.8393,
|
||
|
|
"mean_token_accuracy": 0.15796211659908294,
|
||
|
|
"num_tokens": 3222014.0,
|
||
|
|
"step": 1345
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.093673276901245,
|
||
|
|
"epoch": 0.0867999742814891,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 0.00048513991922939756,
|
||
|
|
"loss": 5.8008,
|
||
|
|
"mean_token_accuracy": 0.16573861241340637,
|
||
|
|
"num_tokens": 3233115.0,
|
||
|
|
"step": 1350
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.114884376525879,
|
||
|
|
"epoch": 0.08712145566771684,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00048471600030309744,
|
||
|
|
"loss": 5.9123,
|
||
|
|
"mean_token_accuracy": 0.16168183982372283,
|
||
|
|
"num_tokens": 3244084.0,
|
||
|
|
"step": 1355
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.098208856582642,
|
||
|
|
"epoch": 0.08744293705394458,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.00048428633190671186,
|
||
|
|
"loss": 5.846,
|
||
|
|
"mean_token_accuracy": 0.1593250960111618,
|
||
|
|
"num_tokens": 3257476.0,
|
||
|
|
"step": 1360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.054478931427002,
|
||
|
|
"epoch": 0.08776441844017231,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0004838509258198167,
|
||
|
|
"loss": 5.7764,
|
||
|
|
"mean_token_accuracy": 0.17061060965061187,
|
||
|
|
"num_tokens": 3268067.0,
|
||
|
|
"step": 1365
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.125921297073364,
|
||
|
|
"epoch": 0.08808589982640005,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.00048340979397929,
|
||
|
|
"loss": 5.8603,
|
||
|
|
"mean_token_accuracy": 0.16385477036237717,
|
||
|
|
"num_tokens": 3279097.0,
|
||
|
|
"step": 1370
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.049725770950317,
|
||
|
|
"epoch": 0.08840738121262778,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.00048296294847898386,
|
||
|
|
"loss": 5.9084,
|
||
|
|
"mean_token_accuracy": 0.16008279025554656,
|
||
|
|
"num_tokens": 3291198.0,
|
||
|
|
"step": 1375
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.082431793212891,
|
||
|
|
"epoch": 0.08872886259885553,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.0004825104015693934,
|
||
|
|
"loss": 5.7406,
|
||
|
|
"mean_token_accuracy": 0.16886814534664155,
|
||
|
|
"num_tokens": 3303316.0,
|
||
|
|
"step": 1380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.06479926109314,
|
||
|
|
"epoch": 0.08905034398508327,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.0004820521656573208,
|
||
|
|
"loss": 5.8514,
|
||
|
|
"mean_token_accuracy": 0.16055994108319283,
|
||
|
|
"num_tokens": 3316069.0,
|
||
|
|
"step": 1385
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.008887243270874,
|
||
|
|
"epoch": 0.089371825371311,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.00048158825330553505,
|
||
|
|
"loss": 5.7445,
|
||
|
|
"mean_token_accuracy": 0.17007820010185243,
|
||
|
|
"num_tokens": 3328657.0,
|
||
|
|
"step": 1390
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.10736780166626,
|
||
|
|
"epoch": 0.08969330675753874,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.00048111867723242763,
|
||
|
|
"loss": 5.8555,
|
||
|
|
"mean_token_accuracy": 0.16169255524873732,
|
||
|
|
"num_tokens": 3340486.0,
|
||
|
|
"step": 1395
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.1321416854858395,
|
||
|
|
"epoch": 0.09001478814376647,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.0004806434503116637,
|
||
|
|
"loss": 5.8723,
|
||
|
|
"mean_token_accuracy": 0.16864815205335618,
|
||
|
|
"num_tokens": 3350936.0,
|
||
|
|
"step": 1400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.087703371047974,
|
||
|
|
"epoch": 0.09033626952999421,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.0004801625855718296,
|
||
|
|
"loss": 5.8601,
|
||
|
|
"mean_token_accuracy": 0.16583744436502457,
|
||
|
|
"num_tokens": 3362238.0,
|
||
|
|
"step": 1405
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.051072263717652,
|
||
|
|
"epoch": 0.09065775091622195,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00047967609619607477,
|
||
|
|
"loss": 5.794,
|
||
|
|
"mean_token_accuracy": 0.16016314327716827,
|
||
|
|
"num_tokens": 3373818.0,
|
||
|
|
"step": 1410
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.093393230438233,
|
||
|
|
"epoch": 0.09097923230244968,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.0004791839955217513,
|
||
|
|
"loss": 5.8118,
|
||
|
|
"mean_token_accuracy": 0.16103656888008117,
|
||
|
|
"num_tokens": 3385241.0,
|
||
|
|
"step": 1415
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.9892784595489506,
|
||
|
|
"epoch": 0.09130071368867743,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.00047868629704004786,
|
||
|
|
"loss": 5.8093,
|
||
|
|
"mean_token_accuracy": 0.15792890265583992,
|
||
|
|
"num_tokens": 3398274.0,
|
||
|
|
"step": 1420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.129896736145019,
|
||
|
|
"epoch": 0.09162219507490517,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.00047818301439561965,
|
||
|
|
"loss": 5.8595,
|
||
|
|
"mean_token_accuracy": 0.16091282665729523,
|
||
|
|
"num_tokens": 3411798.0,
|
||
|
|
"step": 1425
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.027444553375244,
|
||
|
|
"epoch": 0.0919436764611329,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.00047767416138621454,
|
||
|
|
"loss": 5.8085,
|
||
|
|
"mean_token_accuracy": 0.1594970703125,
|
||
|
|
"num_tokens": 3423646.0,
|
||
|
|
"step": 1430
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.086286878585815,
|
||
|
|
"epoch": 0.09226515784736064,
|
||
|
|
"grad_norm": 0.95703125,
|
||
|
|
"learning_rate": 0.000477159751962295,
|
||
|
|
"loss": 5.8268,
|
||
|
|
"mean_token_accuracy": 0.16200227588415145,
|
||
|
|
"num_tokens": 3436255.0,
|
||
|
|
"step": 1435
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.025093269348145,
|
||
|
|
"epoch": 0.09258663923358837,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.00047663980022665507,
|
||
|
|
"loss": 5.8122,
|
||
|
|
"mean_token_accuracy": 0.16047175079584122,
|
||
|
|
"num_tokens": 3447724.0,
|
||
|
|
"step": 1440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.141870403289795,
|
||
|
|
"epoch": 0.09290812061981611,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00047611432043403437,
|
||
|
|
"loss": 5.8945,
|
||
|
|
"mean_token_accuracy": 0.15279303789138793,
|
||
|
|
"num_tokens": 3460959.0,
|
||
|
|
"step": 1445
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.038381910324096,
|
||
|
|
"epoch": 0.09322960200604385,
|
||
|
|
"grad_norm": 1.3125,
|
||
|
|
"learning_rate": 0.0004755833269907267,
|
||
|
|
"loss": 5.7696,
|
||
|
|
"mean_token_accuracy": 0.16729041934013367,
|
||
|
|
"num_tokens": 3472283.0,
|
||
|
|
"step": 1450
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.012684297561646,
|
||
|
|
"epoch": 0.09355108339227158,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.0004750468344541857,
|
||
|
|
"loss": 5.7736,
|
||
|
|
"mean_token_accuracy": 0.1646544575691223,
|
||
|
|
"num_tokens": 3484296.0,
|
||
|
|
"step": 1455
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.002734279632568,
|
||
|
|
"epoch": 0.09387256477849933,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 0.00047450485753262525,
|
||
|
|
"loss": 5.7357,
|
||
|
|
"mean_token_accuracy": 0.16739338636398315,
|
||
|
|
"num_tokens": 3496553.0,
|
||
|
|
"step": 1460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.06849160194397,
|
||
|
|
"epoch": 0.09419404616472707,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.00047395741108461633,
|
||
|
|
"loss": 5.8064,
|
||
|
|
"mean_token_accuracy": 0.16018352508544922,
|
||
|
|
"num_tokens": 3508515.0,
|
||
|
|
"step": 1465
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.06675968170166,
|
||
|
|
"epoch": 0.0945155275509548,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00047340451011867985,
|
||
|
|
"loss": 5.8216,
|
||
|
|
"mean_token_accuracy": 0.16168036088347434,
|
||
|
|
"num_tokens": 3520883.0,
|
||
|
|
"step": 1470
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.9559320449829105,
|
||
|
|
"epoch": 0.09483700893718254,
|
||
|
|
"grad_norm": 0.984375,
|
||
|
|
"learning_rate": 0.00047284616979287515,
|
||
|
|
"loss": 5.7903,
|
||
|
|
"mean_token_accuracy": 0.16948920488357544,
|
||
|
|
"num_tokens": 3533786.0,
|
||
|
|
"step": 1475
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.1463991641998295,
|
||
|
|
"epoch": 0.09515849032341027,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.00047228240541438433,
|
||
|
|
"loss": 5.7776,
|
||
|
|
"mean_token_accuracy": 0.16706227362155915,
|
||
|
|
"num_tokens": 3544573.0,
|
||
|
|
"step": 1480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.094358777999878,
|
||
|
|
"epoch": 0.09547997170963801,
|
||
|
|
"grad_norm": 0.94921875,
|
||
|
|
"learning_rate": 0.00047171323243909257,
|
||
|
|
"loss": 5.8846,
|
||
|
|
"mean_token_accuracy": 0.15878364443778992,
|
||
|
|
"num_tokens": 3556148.0,
|
||
|
|
"step": 1485
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.980588340759278,
|
||
|
|
"epoch": 0.09580145309586575,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.00047113866647116457,
|
||
|
|
"loss": 5.7641,
|
||
|
|
"mean_token_accuracy": 0.16096356213092805,
|
||
|
|
"num_tokens": 3568047.0,
|
||
|
|
"step": 1490
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.014238119125366,
|
||
|
|
"epoch": 0.09612293448209348,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0004705587232626164,
|
||
|
|
"loss": 5.7819,
|
||
|
|
"mean_token_accuracy": 0.1614854723215103,
|
||
|
|
"num_tokens": 3579864.0,
|
||
|
|
"step": 1495
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.090922594070435,
|
||
|
|
"epoch": 0.09644441586832123,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00046997341871288424,
|
||
|
|
"loss": 5.8161,
|
||
|
|
"mean_token_accuracy": 0.15966751128435136,
|
||
|
|
"num_tokens": 3591602.0,
|
||
|
|
"step": 1500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.911532735824585,
|
||
|
|
"epoch": 0.09676589725454895,
|
||
|
|
"grad_norm": 0.9609375,
|
||
|
|
"learning_rate": 0.0004693827688683879,
|
||
|
|
"loss": 5.7131,
|
||
|
|
"mean_token_accuracy": 0.16157886236906052,
|
||
|
|
"num_tokens": 3603802.0,
|
||
|
|
"step": 1505
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.096415281295776,
|
||
|
|
"epoch": 0.0970873786407767,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.0004687867899220914,
|
||
|
|
"loss": 5.8251,
|
||
|
|
"mean_token_accuracy": 0.16491867303848268,
|
||
|
|
"num_tokens": 3614958.0,
|
||
|
|
"step": 1510
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.926008939743042,
|
||
|
|
"epoch": 0.09740886002700444,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00046818549821305846,
|
||
|
|
"loss": 5.7093,
|
||
|
|
"mean_token_accuracy": 0.16871902197599412,
|
||
|
|
"num_tokens": 3626175.0,
|
||
|
|
"step": 1515
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.9772974967956545,
|
||
|
|
"epoch": 0.09773034141323217,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.00046757891022600494,
|
||
|
|
"loss": 5.6843,
|
||
|
|
"mean_token_accuracy": 0.16257247924804688,
|
||
|
|
"num_tokens": 3638818.0,
|
||
|
|
"step": 1520
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.0240332126617435,
|
||
|
|
"epoch": 0.09805182279945991,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0004669670425908471,
|
||
|
|
"loss": 5.7146,
|
||
|
|
"mean_token_accuracy": 0.16350910812616348,
|
||
|
|
"num_tokens": 3650838.0,
|
||
|
|
"step": 1525
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.000803804397583,
|
||
|
|
"epoch": 0.09837330418568765,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0004663499120822451,
|
||
|
|
"loss": 5.7236,
|
||
|
|
"mean_token_accuracy": 0.16991809606552125,
|
||
|
|
"num_tokens": 3661879.0,
|
||
|
|
"step": 1530
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.000612354278564,
|
||
|
|
"epoch": 0.09869478557191538,
|
||
|
|
"grad_norm": 0.93359375,
|
||
|
|
"learning_rate": 0.0004657275356191437,
|
||
|
|
"loss": 5.7162,
|
||
|
|
"mean_token_accuracy": 0.17283950746059418,
|
||
|
|
"num_tokens": 3674464.0,
|
||
|
|
"step": 1535
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.956651830673218,
|
||
|
|
"epoch": 0.09901626695814313,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00046509993026430804,
|
||
|
|
"loss": 5.6744,
|
||
|
|
"mean_token_accuracy": 0.17085929065942765,
|
||
|
|
"num_tokens": 3686065.0,
|
||
|
|
"step": 1540
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.961250972747803,
|
||
|
|
"epoch": 0.09933774834437085,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.0004644671132238558,
|
||
|
|
"loss": 5.7411,
|
||
|
|
"mean_token_accuracy": 0.17531964033842087,
|
||
|
|
"num_tokens": 3697946.0,
|
||
|
|
"step": 1545
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.9872818946838375,
|
||
|
|
"epoch": 0.0996592297305986,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.00046382910184678585,
|
||
|
|
"loss": 5.7024,
|
||
|
|
"mean_token_accuracy": 0.16942446082830429,
|
||
|
|
"num_tokens": 3710695.0,
|
||
|
|
"step": 1550
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.950470924377441,
|
||
|
|
"epoch": 0.09998071111682634,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.0004631859136245025,
|
||
|
|
"loss": 5.6825,
|
||
|
|
"mean_token_accuracy": 0.17383817434310914,
|
||
|
|
"num_tokens": 3721288.0,
|
||
|
|
"step": 1555
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.928533840179443,
|
||
|
|
"epoch": 0.10030219250305407,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.0004625375661903357,
|
||
|
|
"loss": 5.6365,
|
||
|
|
"mean_token_accuracy": 0.16649701148271562,
|
||
|
|
"num_tokens": 3733611.0,
|
||
|
|
"step": 1560
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.955244255065918,
|
||
|
|
"epoch": 0.10062367388928181,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00046188407731905787,
|
||
|
|
"loss": 5.8012,
|
||
|
|
"mean_token_accuracy": 0.16040457487106324,
|
||
|
|
"num_tokens": 3745018.0,
|
||
|
|
"step": 1565
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.074891996383667,
|
||
|
|
"epoch": 0.10094515527550955,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00046122546492639643,
|
||
|
|
"loss": 5.7903,
|
||
|
|
"mean_token_accuracy": 0.16442708522081376,
|
||
|
|
"num_tokens": 3755414.0,
|
||
|
|
"step": 1570
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.872460556030274,
|
||
|
|
"epoch": 0.10126663666173728,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.000460561747068543,
|
||
|
|
"loss": 5.5877,
|
||
|
|
"mean_token_accuracy": 0.17960427105426788,
|
||
|
|
"num_tokens": 3767398.0,
|
||
|
|
"step": 1575
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.056284761428833,
|
||
|
|
"epoch": 0.10158811804796503,
|
||
|
|
"grad_norm": 0.97265625,
|
||
|
|
"learning_rate": 0.0004598929419416578,
|
||
|
|
"loss": 5.7858,
|
||
|
|
"mean_token_accuracy": 0.16207575798034668,
|
||
|
|
"num_tokens": 3779344.0,
|
||
|
|
"step": 1580
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.901925182342529,
|
||
|
|
"epoch": 0.10190959943419275,
|
||
|
|
"grad_norm": 0.93359375,
|
||
|
|
"learning_rate": 0.00045921906788137123,
|
||
|
|
"loss": 5.6982,
|
||
|
|
"mean_token_accuracy": 0.16722951531410218,
|
||
|
|
"num_tokens": 3791642.0,
|
||
|
|
"step": 1585
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.919206190109253,
|
||
|
|
"epoch": 0.1022310808204205,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.00045854014336228115,
|
||
|
|
"loss": 5.6483,
|
||
|
|
"mean_token_accuracy": 0.16981685012578965,
|
||
|
|
"num_tokens": 3803604.0,
|
||
|
|
"step": 1590
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.09901065826416,
|
||
|
|
"epoch": 0.10255256220664824,
|
||
|
|
"grad_norm": 0.94140625,
|
||
|
|
"learning_rate": 0.00045785618699744615,
|
||
|
|
"loss": 5.7711,
|
||
|
|
"mean_token_accuracy": 0.16022978574037552,
|
||
|
|
"num_tokens": 3815472.0,
|
||
|
|
"step": 1595
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.008738374710083,
|
||
|
|
"epoch": 0.10287404359287597,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.00045716721753787543,
|
||
|
|
"loss": 5.8329,
|
||
|
|
"mean_token_accuracy": 0.1592625081539154,
|
||
|
|
"num_tokens": 3827468.0,
|
||
|
|
"step": 1600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.05591311454773,
|
||
|
|
"epoch": 0.10319552497910371,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0004564732538720148,
|
||
|
|
"loss": 5.814,
|
||
|
|
"mean_token_accuracy": 0.16187592148780822,
|
||
|
|
"num_tokens": 3839532.0,
|
||
|
|
"step": 1605
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.920851564407348,
|
||
|
|
"epoch": 0.10351700636533144,
|
||
|
|
"grad_norm": 0.90234375,
|
||
|
|
"learning_rate": 0.00045577431502522877,
|
||
|
|
"loss": 5.6763,
|
||
|
|
"mean_token_accuracy": 0.1719309151172638,
|
||
|
|
"num_tokens": 3851907.0,
|
||
|
|
"step": 1610
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.0737604141235355,
|
||
|
|
"epoch": 0.10383848775155918,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0004550704201592787,
|
||
|
|
"loss": 5.8084,
|
||
|
|
"mean_token_accuracy": 0.1594211921095848,
|
||
|
|
"num_tokens": 3864624.0,
|
||
|
|
"step": 1615
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.935598373413086,
|
||
|
|
"epoch": 0.10415996913778693,
|
||
|
|
"grad_norm": 0.9609375,
|
||
|
|
"learning_rate": 0.0004543615885717981,
|
||
|
|
"loss": 5.6913,
|
||
|
|
"mean_token_accuracy": 0.1719366803765297,
|
||
|
|
"num_tokens": 3876832.0,
|
||
|
|
"step": 1620
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.900327444076538,
|
||
|
|
"epoch": 0.10448145052401465,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00045364783969576296,
|
||
|
|
"loss": 5.6533,
|
||
|
|
"mean_token_accuracy": 0.1725366458296776,
|
||
|
|
"num_tokens": 3888969.0,
|
||
|
|
"step": 1625
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.919269466400147,
|
||
|
|
"epoch": 0.1048029319102424,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0004529291930989592,
|
||
|
|
"loss": 5.692,
|
||
|
|
"mean_token_accuracy": 0.16689868569374083,
|
||
|
|
"num_tokens": 3900634.0,
|
||
|
|
"step": 1630
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.978420782089233,
|
||
|
|
"epoch": 0.10512441329647014,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.0004522056684834464,
|
||
|
|
"loss": 5.6596,
|
||
|
|
"mean_token_accuracy": 0.17244009226560592,
|
||
|
|
"num_tokens": 3911993.0,
|
||
|
|
"step": 1635
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.944800853729248,
|
||
|
|
"epoch": 0.10544589468269787,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0004514772856850173,
|
||
|
|
"loss": 5.7075,
|
||
|
|
"mean_token_accuracy": 0.16923267394304276,
|
||
|
|
"num_tokens": 3923959.0,
|
||
|
|
"step": 1640
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.934698915481567,
|
||
|
|
"epoch": 0.10576737606892561,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.0004507440646726542,
|
||
|
|
"loss": 5.6799,
|
||
|
|
"mean_token_accuracy": 0.17092464715242386,
|
||
|
|
"num_tokens": 3936868.0,
|
||
|
|
"step": 1645
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.951383352279663,
|
||
|
|
"epoch": 0.10608885745515334,
|
||
|
|
"grad_norm": 0.98828125,
|
||
|
|
"learning_rate": 0.0004500060255479818,
|
||
|
|
"loss": 5.6691,
|
||
|
|
"mean_token_accuracy": 0.17145125269889833,
|
||
|
|
"num_tokens": 3949777.0,
|
||
|
|
"step": 1650
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.009766578674316,
|
||
|
|
"epoch": 0.10641033884138108,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.0004492631885447151,
|
||
|
|
"loss": 5.7863,
|
||
|
|
"mean_token_accuracy": 0.16202808246016503,
|
||
|
|
"num_tokens": 3963913.0,
|
||
|
|
"step": 1655
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.909622049331665,
|
||
|
|
"epoch": 0.10673182022760883,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.00044851557402810616,
|
||
|
|
"loss": 5.6703,
|
||
|
|
"mean_token_accuracy": 0.1712466612458229,
|
||
|
|
"num_tokens": 3976187.0,
|
||
|
|
"step": 1660
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.883133316040039,
|
||
|
|
"epoch": 0.10705330161383655,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.00044776320249438444,
|
||
|
|
"loss": 5.6042,
|
||
|
|
"mean_token_accuracy": 0.17793208807706834,
|
||
|
|
"num_tokens": 3986324.0,
|
||
|
|
"step": 1665
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.935062217712402,
|
||
|
|
"epoch": 0.1073747830000643,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00044700609457019565,
|
||
|
|
"loss": 5.7279,
|
||
|
|
"mean_token_accuracy": 0.17077707052230834,
|
||
|
|
"num_tokens": 3998347.0,
|
||
|
|
"step": 1670
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.9468677043914795,
|
||
|
|
"epoch": 0.10769626438629204,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.0004462442710120359,
|
||
|
|
"loss": 5.7379,
|
||
|
|
"mean_token_accuracy": 0.1692286878824234,
|
||
|
|
"num_tokens": 4010640.0,
|
||
|
|
"step": 1675
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.965192079544067,
|
||
|
|
"epoch": 0.10801774577251977,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.000445477752705683,
|
||
|
|
"loss": 5.7021,
|
||
|
|
"mean_token_accuracy": 0.16421150118112565,
|
||
|
|
"num_tokens": 4023544.0,
|
||
|
|
"step": 1680
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.997580337524414,
|
||
|
|
"epoch": 0.10833922715874751,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00044470656066562336,
|
||
|
|
"loss": 5.7932,
|
||
|
|
"mean_token_accuracy": 0.16685343831777572,
|
||
|
|
"num_tokens": 4035359.0,
|
||
|
|
"step": 1685
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.005310583114624,
|
||
|
|
"epoch": 0.10866070854497524,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0004439307160344765,
|
||
|
|
"loss": 5.7503,
|
||
|
|
"mean_token_accuracy": 0.16817554086446762,
|
||
|
|
"num_tokens": 4047055.0,
|
||
|
|
"step": 1690
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.008270597457885,
|
||
|
|
"epoch": 0.10898218993120298,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00044315024008241473,
|
||
|
|
"loss": 5.7602,
|
||
|
|
"mean_token_accuracy": 0.16708459556102753,
|
||
|
|
"num_tokens": 4058231.0,
|
||
|
|
"step": 1695
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.912751865386963,
|
||
|
|
"epoch": 0.10930367131743073,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0004423651542065806,
|
||
|
|
"loss": 5.6617,
|
||
|
|
"mean_token_accuracy": 0.17167637795209884,
|
||
|
|
"num_tokens": 4071138.0,
|
||
|
|
"step": 1700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.909320926666259,
|
||
|
|
"epoch": 0.10962515270365845,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00044157547993050006,
|
||
|
|
"loss": 5.6095,
|
||
|
|
"mean_token_accuracy": 0.1787335529923439,
|
||
|
|
"num_tokens": 4084144.0,
|
||
|
|
"step": 1705
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.895288896560669,
|
||
|
|
"epoch": 0.1099466340898862,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00044078123890349227,
|
||
|
|
"loss": 5.6396,
|
||
|
|
"mean_token_accuracy": 0.1743350476026535,
|
||
|
|
"num_tokens": 4095828.0,
|
||
|
|
"step": 1710
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.958630466461182,
|
||
|
|
"epoch": 0.11026811547611394,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.00043998245290007606,
|
||
|
|
"loss": 5.7617,
|
||
|
|
"mean_token_accuracy": 0.1587551474571228,
|
||
|
|
"num_tokens": 4108463.0,
|
||
|
|
"step": 1715
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.90827522277832,
|
||
|
|
"epoch": 0.11058959686234167,
|
||
|
|
"grad_norm": 0.9453125,
|
||
|
|
"learning_rate": 0.00043917914381937323,
|
||
|
|
"loss": 5.6133,
|
||
|
|
"mean_token_accuracy": 0.17577288746833802,
|
||
|
|
"num_tokens": 4120153.0,
|
||
|
|
"step": 1720
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.952684164047241,
|
||
|
|
"epoch": 0.11091107824856941,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.00043837133368450815,
|
||
|
|
"loss": 5.6548,
|
||
|
|
"mean_token_accuracy": 0.17637971192598342,
|
||
|
|
"num_tokens": 4131684.0,
|
||
|
|
"step": 1725
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.95789852142334,
|
||
|
|
"epoch": 0.11123255963479714,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0004375590446420037,
|
||
|
|
"loss": 5.7584,
|
||
|
|
"mean_token_accuracy": 0.16837924271821975,
|
||
|
|
"num_tokens": 4142757.0,
|
||
|
|
"step": 1730
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.962955284118652,
|
||
|
|
"epoch": 0.11155404102102488,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.0004367422989611743,
|
||
|
|
"loss": 5.7158,
|
||
|
|
"mean_token_accuracy": 0.16554963290691377,
|
||
|
|
"num_tokens": 4153892.0,
|
||
|
|
"step": 1735
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.933376312255859,
|
||
|
|
"epoch": 0.11187552240725263,
|
||
|
|
"grad_norm": 0.96484375,
|
||
|
|
"learning_rate": 0.0004359211190335153,
|
||
|
|
"loss": 5.7288,
|
||
|
|
"mean_token_accuracy": 0.16116232872009278,
|
||
|
|
"num_tokens": 4166534.0,
|
||
|
|
"step": 1740
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.9422413349151615,
|
||
|
|
"epoch": 0.11219700379348035,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.00043509552737208923,
|
||
|
|
"loss": 5.6579,
|
||
|
|
"mean_token_accuracy": 0.1683451145887375,
|
||
|
|
"num_tokens": 4178648.0,
|
||
|
|
"step": 1745
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.848151159286499,
|
||
|
|
"epoch": 0.1125184851797081,
|
||
|
|
"grad_norm": 0.97265625,
|
||
|
|
"learning_rate": 0.00043426554661090853,
|
||
|
|
"loss": 5.6261,
|
||
|
|
"mean_token_accuracy": 0.17486759424209594,
|
||
|
|
"num_tokens": 4191522.0,
|
||
|
|
"step": 1750
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.953406143188476,
|
||
|
|
"epoch": 0.11283996656593583,
|
||
|
|
"grad_norm": 0.96875,
|
||
|
|
"learning_rate": 0.00043343119950431516,
|
||
|
|
"loss": 5.6226,
|
||
|
|
"mean_token_accuracy": 0.17257331013679506,
|
||
|
|
"num_tokens": 4203900.0,
|
||
|
|
"step": 1755
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.861113119125366,
|
||
|
|
"epoch": 0.11316144795216357,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.00043259250892635644,
|
||
|
|
"loss": 5.5864,
|
||
|
|
"mean_token_accuracy": 0.17675792276859284,
|
||
|
|
"num_tokens": 4214861.0,
|
||
|
|
"step": 1760
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.804804039001465,
|
||
|
|
"epoch": 0.11348292933839131,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 0.0004317494978701582,
|
||
|
|
"loss": 5.5351,
|
||
|
|
"mean_token_accuracy": 0.1776354894042015,
|
||
|
|
"num_tokens": 4227137.0,
|
||
|
|
"step": 1765
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.933787488937378,
|
||
|
|
"epoch": 0.11380441072461904,
|
||
|
|
"grad_norm": 0.8984375,
|
||
|
|
"learning_rate": 0.0004309021894472943,
|
||
|
|
"loss": 5.7155,
|
||
|
|
"mean_token_accuracy": 0.1676717832684517,
|
||
|
|
"num_tokens": 4239997.0,
|
||
|
|
"step": 1770
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.958622455596924,
|
||
|
|
"epoch": 0.11412589211084678,
|
||
|
|
"grad_norm": 0.9140625,
|
||
|
|
"learning_rate": 0.0004300506068871534,
|
||
|
|
"loss": 5.661,
|
||
|
|
"mean_token_accuracy": 0.16713007688522338,
|
||
|
|
"num_tokens": 4252556.0,
|
||
|
|
"step": 1775
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.792713975906372,
|
||
|
|
"epoch": 0.11444737349707453,
|
||
|
|
"grad_norm": 0.90625,
|
||
|
|
"learning_rate": 0.00042919477353630135,
|
||
|
|
"loss": 5.639,
|
||
|
|
"mean_token_accuracy": 0.1729072615504265,
|
||
|
|
"num_tokens": 4265702.0,
|
||
|
|
"step": 1780
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.8895658493042,
|
||
|
|
"epoch": 0.11476885488330225,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.000428334712857842,
|
||
|
|
"loss": 5.6602,
|
||
|
|
"mean_token_accuracy": 0.17446050494909288,
|
||
|
|
"num_tokens": 4278244.0,
|
||
|
|
"step": 1785
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.912885761260986,
|
||
|
|
"epoch": 0.11509033626953,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00042747044843077304,
|
||
|
|
"loss": 5.6157,
|
||
|
|
"mean_token_accuracy": 0.17406022995710374,
|
||
|
|
"num_tokens": 4290242.0,
|
||
|
|
"step": 1790
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.925296115875244,
|
||
|
|
"epoch": 0.11541181765575773,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00042660200394934047,
|
||
|
|
"loss": 5.8008,
|
||
|
|
"mean_token_accuracy": 0.16324599087238312,
|
||
|
|
"num_tokens": 4303198.0,
|
||
|
|
"step": 1795
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.972964572906494,
|
||
|
|
"epoch": 0.11573329904198547,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.00042572940322238844,
|
||
|
|
"loss": 5.7539,
|
||
|
|
"mean_token_accuracy": 0.16906532049179077,
|
||
|
|
"num_tokens": 4316389.0,
|
||
|
|
"step": 1800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.867070102691651,
|
||
|
|
"epoch": 0.11605478042821321,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 0.00042485267017270664,
|
||
|
|
"loss": 5.6284,
|
||
|
|
"mean_token_accuracy": 0.17795921117067337,
|
||
|
|
"num_tokens": 4329829.0,
|
||
|
|
"step": 1805
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.836501359939575,
|
||
|
|
"epoch": 0.11637626181444094,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0004239718288363745,
|
||
|
|
"loss": 5.5708,
|
||
|
|
"mean_token_accuracy": 0.1804552987217903,
|
||
|
|
"num_tokens": 4342024.0,
|
||
|
|
"step": 1810
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.882567024230957,
|
||
|
|
"epoch": 0.11669774320066868,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.0004230869033621023,
|
||
|
|
"loss": 5.6703,
|
||
|
|
"mean_token_accuracy": 0.16930529624223709,
|
||
|
|
"num_tokens": 4355575.0,
|
||
|
|
"step": 1815
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.800036668777466,
|
||
|
|
"epoch": 0.11701922458689643,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.0004221979180105688,
|
||
|
|
"loss": 5.5661,
|
||
|
|
"mean_token_accuracy": 0.17972640544176102,
|
||
|
|
"num_tokens": 4368461.0,
|
||
|
|
"step": 1820
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.918715858459473,
|
||
|
|
"epoch": 0.11734070597312415,
|
||
|
|
"grad_norm": 0.94140625,
|
||
|
|
"learning_rate": 0.00042130489715375645,
|
||
|
|
"loss": 5.6427,
|
||
|
|
"mean_token_accuracy": 0.17834917455911636,
|
||
|
|
"num_tokens": 4380483.0,
|
||
|
|
"step": 1825
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.868259286880493,
|
||
|
|
"epoch": 0.1176621873593519,
|
||
|
|
"grad_norm": 0.953125,
|
||
|
|
"learning_rate": 0.00042040786527428335,
|
||
|
|
"loss": 5.6284,
|
||
|
|
"mean_token_accuracy": 0.16914028078317642,
|
||
|
|
"num_tokens": 4393823.0,
|
||
|
|
"step": 1830
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.887679815292358,
|
||
|
|
"epoch": 0.11798366874557963,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 0.0004195068469647315,
|
||
|
|
"loss": 5.6887,
|
||
|
|
"mean_token_accuracy": 0.1705163061618805,
|
||
|
|
"num_tokens": 4405230.0,
|
||
|
|
"step": 1835
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.95110125541687,
|
||
|
|
"epoch": 0.11830515013180737,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00041860186692697297,
|
||
|
|
"loss": 5.626,
|
||
|
|
"mean_token_accuracy": 0.17905376702547074,
|
||
|
|
"num_tokens": 4416638.0,
|
||
|
|
"step": 1840
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.80819149017334,
|
||
|
|
"epoch": 0.11862663151803511,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00041769294997149264,
|
||
|
|
"loss": 5.5459,
|
||
|
|
"mean_token_accuracy": 0.1780714675784111,
|
||
|
|
"num_tokens": 4428778.0,
|
||
|
|
"step": 1845
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.8609541893005375,
|
||
|
|
"epoch": 0.11894811290426284,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.0004167801210167081,
|
||
|
|
"loss": 5.5975,
|
||
|
|
"mean_token_accuracy": 0.17223136574029924,
|
||
|
|
"num_tokens": 4440698.0,
|
||
|
|
"step": 1850
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.850246858596802,
|
||
|
|
"epoch": 0.11926959429049058,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.0004158634050882861,
|
||
|
|
"loss": 5.6452,
|
||
|
|
"mean_token_accuracy": 0.17951953709125518,
|
||
|
|
"num_tokens": 4451867.0,
|
||
|
|
"step": 1855
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.898460865020752,
|
||
|
|
"epoch": 0.11959107567671831,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0004149428273184569,
|
||
|
|
"loss": 5.6622,
|
||
|
|
"mean_token_accuracy": 0.16997012495994568,
|
||
|
|
"num_tokens": 4464111.0,
|
||
|
|
"step": 1860
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.0535829067230225,
|
||
|
|
"epoch": 0.11991255706294605,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0004140184129453253,
|
||
|
|
"loss": 5.8647,
|
||
|
|
"mean_token_accuracy": 0.1605095535516739,
|
||
|
|
"num_tokens": 4476378.0,
|
||
|
|
"step": 1865
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.918209362030029,
|
||
|
|
"epoch": 0.1202340384491738,
|
||
|
|
"grad_norm": 0.94921875,
|
||
|
|
"learning_rate": 0.000413090187312178,
|
||
|
|
"loss": 5.6126,
|
||
|
|
"mean_token_accuracy": 0.17721273005008698,
|
||
|
|
"num_tokens": 4488714.0,
|
||
|
|
"step": 1870
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.869247961044311,
|
||
|
|
"epoch": 0.12055551983540153,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0004121581758667898,
|
||
|
|
"loss": 5.6413,
|
||
|
|
"mean_token_accuracy": 0.17850209176540374,
|
||
|
|
"num_tokens": 4500168.0,
|
||
|
|
"step": 1875
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.9244630336761475,
|
||
|
|
"epoch": 0.12087700122162927,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00041122240416072533,
|
||
|
|
"loss": 5.6474,
|
||
|
|
"mean_token_accuracy": 0.17328109741210937,
|
||
|
|
"num_tokens": 4511792.0,
|
||
|
|
"step": 1880
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.839860105514527,
|
||
|
|
"epoch": 0.12119848260785701,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.0004102828978486385,
|
||
|
|
"loss": 5.5932,
|
||
|
|
"mean_token_accuracy": 0.18388805836439132,
|
||
|
|
"num_tokens": 4522314.0,
|
||
|
|
"step": 1885
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.965823554992676,
|
||
|
|
"epoch": 0.12151996399408474,
|
||
|
|
"grad_norm": 0.921875,
|
||
|
|
"learning_rate": 0.0004093396826875695,
|
||
|
|
"loss": 5.5762,
|
||
|
|
"mean_token_accuracy": 0.16557498574256896,
|
||
|
|
"num_tokens": 4534827.0,
|
||
|
|
"step": 1890
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.761017513275147,
|
||
|
|
"epoch": 0.12184144538031248,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00040839278453623837,
|
||
|
|
"loss": 5.4789,
|
||
|
|
"mean_token_accuracy": 0.17830830216407775,
|
||
|
|
"num_tokens": 4546730.0,
|
||
|
|
"step": 1895
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.70470962524414,
|
||
|
|
"epoch": 0.12216292676654021,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 0.0004074422293543363,
|
||
|
|
"loss": 5.5623,
|
||
|
|
"mean_token_accuracy": 0.1807377517223358,
|
||
|
|
"num_tokens": 4557573.0,
|
||
|
|
"step": 1900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.9006062030792235,
|
||
|
|
"epoch": 0.12248440815276795,
|
||
|
|
"grad_norm": 0.921875,
|
||
|
|
"learning_rate": 0.0004064880432018137,
|
||
|
|
"loss": 5.6343,
|
||
|
|
"mean_token_accuracy": 0.174290831387043,
|
||
|
|
"num_tokens": 4570238.0,
|
||
|
|
"step": 1905
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.864686441421509,
|
||
|
|
"epoch": 0.1228058895389957,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.00040553025223816615,
|
||
|
|
"loss": 5.6814,
|
||
|
|
"mean_token_accuracy": 0.1700124755501747,
|
||
|
|
"num_tokens": 4583007.0,
|
||
|
|
"step": 1910
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.936568975448608,
|
||
|
|
"epoch": 0.12312737092522343,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00040456888272171653,
|
||
|
|
"loss": 5.6154,
|
||
|
|
"mean_token_accuracy": 0.16709319800138472,
|
||
|
|
"num_tokens": 4594224.0,
|
||
|
|
"step": 1915
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.852287435531617,
|
||
|
|
"epoch": 0.12344885231145117,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.00040360396100889577,
|
||
|
|
"loss": 5.6582,
|
||
|
|
"mean_token_accuracy": 0.17214078456163406,
|
||
|
|
"num_tokens": 4606092.0,
|
||
|
|
"step": 1920
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.904173707962036,
|
||
|
|
"epoch": 0.12377033369767891,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.0004026355135535202,
|
||
|
|
"loss": 5.6247,
|
||
|
|
"mean_token_accuracy": 0.17527548372745513,
|
||
|
|
"num_tokens": 4616751.0,
|
||
|
|
"step": 1925
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.864779424667359,
|
||
|
|
"epoch": 0.12409181508390664,
|
||
|
|
"grad_norm": 0.9140625,
|
||
|
|
"learning_rate": 0.000401663566906066,
|
||
|
|
"loss": 5.647,
|
||
|
|
"mean_token_accuracy": 0.17503723949193956,
|
||
|
|
"num_tokens": 4629497.0,
|
||
|
|
"step": 1930
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.880205869674683,
|
||
|
|
"epoch": 0.12441329647013438,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00040068814771294134,
|
||
|
|
"loss": 5.625,
|
||
|
|
"mean_token_accuracy": 0.17394295632839202,
|
||
|
|
"num_tokens": 4641070.0,
|
||
|
|
"step": 1935
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.814072561264038,
|
||
|
|
"epoch": 0.12473477785636211,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.0003997092827157562,
|
||
|
|
"loss": 5.602,
|
||
|
|
"mean_token_accuracy": 0.1692856341600418,
|
||
|
|
"num_tokens": 4653813.0,
|
||
|
|
"step": 1940
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.759505414962769,
|
||
|
|
"epoch": 0.12505625924258987,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.000398726998750589,
|
||
|
|
"loss": 5.56,
|
||
|
|
"mean_token_accuracy": 0.1789846494793892,
|
||
|
|
"num_tokens": 4665865.0,
|
||
|
|
"step": 1945
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.860892677307129,
|
||
|
|
"epoch": 0.1253777406288176,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.00039774132274725076,
|
||
|
|
"loss": 5.6134,
|
||
|
|
"mean_token_accuracy": 0.17644744664430617,
|
||
|
|
"num_tokens": 4678841.0,
|
||
|
|
"step": 1950
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.835351991653442,
|
||
|
|
"epoch": 0.12569922201504533,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00039675228172854707,
|
||
|
|
"loss": 5.569,
|
||
|
|
"mean_token_accuracy": 0.17764328867197038,
|
||
|
|
"num_tokens": 4691204.0,
|
||
|
|
"step": 1955
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.906078720092774,
|
||
|
|
"epoch": 0.12602070340127305,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 0.0003957599028095371,
|
||
|
|
"loss": 5.5548,
|
||
|
|
"mean_token_accuracy": 0.18006090223789215,
|
||
|
|
"num_tokens": 4702379.0,
|
||
|
|
"step": 1960
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.812206029891968,
|
||
|
|
"epoch": 0.1263421847875008,
|
||
|
|
"grad_norm": 0.93359375,
|
||
|
|
"learning_rate": 0.00039476421319679017,
|
||
|
|
"loss": 5.5982,
|
||
|
|
"mean_token_accuracy": 0.1708923801779747,
|
||
|
|
"num_tokens": 4714737.0,
|
||
|
|
"step": 1965
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.948781299591064,
|
||
|
|
"epoch": 0.12666366617372854,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00039376524018764,
|
||
|
|
"loss": 5.6617,
|
||
|
|
"mean_token_accuracy": 0.16960146874189377,
|
||
|
|
"num_tokens": 4726653.0,
|
||
|
|
"step": 1970
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.826849174499512,
|
||
|
|
"epoch": 0.12698514755995627,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.00039276301116943616,
|
||
|
|
"loss": 5.5537,
|
||
|
|
"mean_token_accuracy": 0.1792762890458107,
|
||
|
|
"num_tokens": 4738989.0,
|
||
|
|
"step": 1975
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.8345729351043705,
|
||
|
|
"epoch": 0.12730662894618403,
|
||
|
|
"grad_norm": 0.953125,
|
||
|
|
"learning_rate": 0.0003917575536187936,
|
||
|
|
"loss": 5.4978,
|
||
|
|
"mean_token_accuracy": 0.18163758963346482,
|
||
|
|
"num_tokens": 4750493.0,
|
||
|
|
"step": 1980
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.797660684585571,
|
||
|
|
"epoch": 0.12762811033241175,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00039074889510083894,
|
||
|
|
"loss": 5.5225,
|
||
|
|
"mean_token_accuracy": 0.17844658195972443,
|
||
|
|
"num_tokens": 4763240.0,
|
||
|
|
"step": 1985
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.834128379821777,
|
||
|
|
"epoch": 0.12794959171863948,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.00038973706326845495,
|
||
|
|
"loss": 5.5719,
|
||
|
|
"mean_token_accuracy": 0.18070205599069594,
|
||
|
|
"num_tokens": 4774804.0,
|
||
|
|
"step": 1990
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.8326366424560545,
|
||
|
|
"epoch": 0.12827107310486724,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.0003887220858615225,
|
||
|
|
"loss": 5.6495,
|
||
|
|
"mean_token_accuracy": 0.17115117609500885,
|
||
|
|
"num_tokens": 4788684.0,
|
||
|
|
"step": 1995
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.905576086044311,
|
||
|
|
"epoch": 0.12859255449109497,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.0003877039907061597,
|
||
|
|
"loss": 5.6195,
|
||
|
|
"mean_token_accuracy": 0.17407953292131423,
|
||
|
|
"num_tokens": 4799819.0,
|
||
|
|
"step": 2000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.870160961151123,
|
||
|
|
"epoch": 0.1289140358773227,
|
||
|
|
"grad_norm": 0.953125,
|
||
|
|
"learning_rate": 0.0003866828057139598,
|
||
|
|
"loss": 5.6052,
|
||
|
|
"mean_token_accuracy": 0.17627264708280563,
|
||
|
|
"num_tokens": 4811466.0,
|
||
|
|
"step": 2005
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.760121917724609,
|
||
|
|
"epoch": 0.12923551726355045,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.00038565855888122503,
|
||
|
|
"loss": 5.5037,
|
||
|
|
"mean_token_accuracy": 0.18457890152931214,
|
||
|
|
"num_tokens": 4824457.0,
|
||
|
|
"step": 2010
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.774965858459472,
|
||
|
|
"epoch": 0.12955699864977818,
|
||
|
|
"grad_norm": 0.98828125,
|
||
|
|
"learning_rate": 0.00038463127828819975,
|
||
|
|
"loss": 5.5049,
|
||
|
|
"mean_token_accuracy": 0.18251402527093888,
|
||
|
|
"num_tokens": 4836717.0,
|
||
|
|
"step": 2015
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.847173833847046,
|
||
|
|
"epoch": 0.1298784800360059,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.00038360099209830043,
|
||
|
|
"loss": 5.5599,
|
||
|
|
"mean_token_accuracy": 0.17191230058670043,
|
||
|
|
"num_tokens": 4849651.0,
|
||
|
|
"step": 2020
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.793238019943237,
|
||
|
|
"epoch": 0.13019996142223364,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.0003825677285573433,
|
||
|
|
"loss": 5.5407,
|
||
|
|
"mean_token_accuracy": 0.17504116892814636,
|
||
|
|
"num_tokens": 4861794.0,
|
||
|
|
"step": 2025
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.844627237319946,
|
||
|
|
"epoch": 0.1305214428084614,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 0.00038153151599277027,
|
||
|
|
"loss": 5.6574,
|
||
|
|
"mean_token_accuracy": 0.17710692882537843,
|
||
|
|
"num_tokens": 4874212.0,
|
||
|
|
"step": 2030
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.84494047164917,
|
||
|
|
"epoch": 0.13084292419468913,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.0003804923828128723,
|
||
|
|
"loss": 5.4783,
|
||
|
|
"mean_token_accuracy": 0.1834234356880188,
|
||
|
|
"num_tokens": 4884997.0,
|
||
|
|
"step": 2035
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.762919187545776,
|
||
|
|
"epoch": 0.13116440558091685,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.0003794503575060104,
|
||
|
|
"loss": 5.5529,
|
||
|
|
"mean_token_accuracy": 0.18413533866405488,
|
||
|
|
"num_tokens": 4896918.0,
|
||
|
|
"step": 2040
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.892176866531372,
|
||
|
|
"epoch": 0.1314858869671446,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.00037840546863983484,
|
||
|
|
"loss": 5.6243,
|
||
|
|
"mean_token_accuracy": 0.17191017419099808,
|
||
|
|
"num_tokens": 4909620.0,
|
||
|
|
"step": 2045
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.945382499694825,
|
||
|
|
"epoch": 0.13180736835337234,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.0003773577448605015,
|
||
|
|
"loss": 5.6835,
|
||
|
|
"mean_token_accuracy": 0.17257035672664642,
|
||
|
|
"num_tokens": 4921607.0,
|
||
|
|
"step": 2050
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.779804420471192,
|
||
|
|
"epoch": 0.13212884973960007,
|
||
|
|
"grad_norm": 0.9140625,
|
||
|
|
"learning_rate": 0.0003763072148918872,
|
||
|
|
"loss": 5.5078,
|
||
|
|
"mean_token_accuracy": 0.18294907361268997,
|
||
|
|
"num_tokens": 4933940.0,
|
||
|
|
"step": 2055
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.8237223625183105,
|
||
|
|
"epoch": 0.13245033112582782,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.0003752539075348017,
|
||
|
|
"loss": 5.4828,
|
||
|
|
"mean_token_accuracy": 0.1808870628476143,
|
||
|
|
"num_tokens": 4945773.0,
|
||
|
|
"step": 2060
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.779390478134156,
|
||
|
|
"epoch": 0.13277181251205555,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.00037419785166619817,
|
||
|
|
"loss": 5.5947,
|
||
|
|
"mean_token_accuracy": 0.17565583139657975,
|
||
|
|
"num_tokens": 4957376.0,
|
||
|
|
"step": 2065
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.813959360122681,
|
||
|
|
"epoch": 0.13309329389828328,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.0003731390762383818,
|
||
|
|
"loss": 5.576,
|
||
|
|
"mean_token_accuracy": 0.18291270285844802,
|
||
|
|
"num_tokens": 4970421.0,
|
||
|
|
"step": 2070
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.725229263305664,
|
||
|
|
"epoch": 0.13341477528451104,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.0003720776102782158,
|
||
|
|
"loss": 5.3501,
|
||
|
|
"mean_token_accuracy": 0.19152092486619948,
|
||
|
|
"num_tokens": 4981342.0,
|
||
|
|
"step": 2075
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.7584638595581055,
|
||
|
|
"epoch": 0.13373625667073877,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.00037101348288632555,
|
||
|
|
"loss": 5.6146,
|
||
|
|
"mean_token_accuracy": 0.17571116387844085,
|
||
|
|
"num_tokens": 4992622.0,
|
||
|
|
"step": 2080
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.923141145706177,
|
||
|
|
"epoch": 0.1340577380569665,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.0003699467232363012,
|
||
|
|
"loss": 5.6139,
|
||
|
|
"mean_token_accuracy": 0.17595019936561584,
|
||
|
|
"num_tokens": 5004362.0,
|
||
|
|
"step": 2085
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.818864965438843,
|
||
|
|
"epoch": 0.13437921944319423,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.0003688773605738973,
|
||
|
|
"loss": 5.6126,
|
||
|
|
"mean_token_accuracy": 0.17965741753578185,
|
||
|
|
"num_tokens": 5016389.0,
|
||
|
|
"step": 2090
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.793763065338135,
|
||
|
|
"epoch": 0.13470070082942198,
|
||
|
|
"grad_norm": 0.9296875,
|
||
|
|
"learning_rate": 0.00036780542421623134,
|
||
|
|
"loss": 5.4654,
|
||
|
|
"mean_token_accuracy": 0.18796980381011963,
|
||
|
|
"num_tokens": 5027988.0,
|
||
|
|
"step": 2095
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.777286338806152,
|
||
|
|
"epoch": 0.1350221822156497,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0003667309435509802,
|
||
|
|
"loss": 5.5386,
|
||
|
|
"mean_token_accuracy": 0.1804940417408943,
|
||
|
|
"num_tokens": 5039236.0,
|
||
|
|
"step": 2100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.817455434799195,
|
||
|
|
"epoch": 0.13534366360187744,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 0.0003656539480355741,
|
||
|
|
"loss": 5.4384,
|
||
|
|
"mean_token_accuracy": 0.18993795216083526,
|
||
|
|
"num_tokens": 5050198.0,
|
||
|
|
"step": 2105
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.810271120071411,
|
||
|
|
"epoch": 0.1356651449881052,
|
||
|
|
"grad_norm": 0.96484375,
|
||
|
|
"learning_rate": 0.0003645744671963891,
|
||
|
|
"loss": 5.5312,
|
||
|
|
"mean_token_accuracy": 0.18325352519750596,
|
||
|
|
"num_tokens": 5063493.0,
|
||
|
|
"step": 2110
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.786569452285766,
|
||
|
|
"epoch": 0.13598662637433293,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.0003634925306279376,
|
||
|
|
"loss": 5.4097,
|
||
|
|
"mean_token_accuracy": 0.19001378118991852,
|
||
|
|
"num_tokens": 5075451.0,
|
||
|
|
"step": 2115
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.784157466888428,
|
||
|
|
"epoch": 0.13630810776056065,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0003624081679920574,
|
||
|
|
"loss": 5.5803,
|
||
|
|
"mean_token_accuracy": 0.18124087005853654,
|
||
|
|
"num_tokens": 5088354.0,
|
||
|
|
"step": 2120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.815143823623657,
|
||
|
|
"epoch": 0.1366295891467884,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.0003613214090170977,
|
||
|
|
"loss": 5.51,
|
||
|
|
"mean_token_accuracy": 0.180302757024765,
|
||
|
|
"num_tokens": 5099525.0,
|
||
|
|
"step": 2125
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.878709602355957,
|
||
|
|
"epoch": 0.13695107053301614,
|
||
|
|
"grad_norm": 0.98828125,
|
||
|
|
"learning_rate": 0.0003602322834971048,
|
||
|
|
"loss": 5.6666,
|
||
|
|
"mean_token_accuracy": 0.17189718186855316,
|
||
|
|
"num_tokens": 5112304.0,
|
||
|
|
"step": 2130
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.723003339767456,
|
||
|
|
"epoch": 0.13727255191924387,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.0003591408212910051,
|
||
|
|
"loss": 5.4404,
|
||
|
|
"mean_token_accuracy": 0.1870084896683693,
|
||
|
|
"num_tokens": 5124662.0,
|
||
|
|
"step": 2135
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.788280439376831,
|
||
|
|
"epoch": 0.13759403330547162,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0003580470523217863,
|
||
|
|
"loss": 5.5564,
|
||
|
|
"mean_token_accuracy": 0.17349497675895692,
|
||
|
|
"num_tokens": 5136012.0,
|
||
|
|
"step": 2140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.790732574462891,
|
||
|
|
"epoch": 0.13791551469169935,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.0003569510065756771,
|
||
|
|
"loss": 5.5504,
|
||
|
|
"mean_token_accuracy": 0.17855857610702514,
|
||
|
|
"num_tokens": 5147777.0,
|
||
|
|
"step": 2145
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.7518140316009525,
|
||
|
|
"epoch": 0.13823699607792708,
|
||
|
|
"grad_norm": 0.9296875,
|
||
|
|
"learning_rate": 0.0003558527141013254,
|
||
|
|
"loss": 5.5611,
|
||
|
|
"mean_token_accuracy": 0.17851039618253708,
|
||
|
|
"num_tokens": 5160246.0,
|
||
|
|
"step": 2150
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.826988935470581,
|
||
|
|
"epoch": 0.13855847746415484,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.0003547522050089742,
|
||
|
|
"loss": 5.5531,
|
||
|
|
"mean_token_accuracy": 0.18062776178121567,
|
||
|
|
"num_tokens": 5172077.0,
|
||
|
|
"step": 2155
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.7975584983825685,
|
||
|
|
"epoch": 0.13887995885038257,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00035364950946963606,
|
||
|
|
"loss": 5.4927,
|
||
|
|
"mean_token_accuracy": 0.18591260462999343,
|
||
|
|
"num_tokens": 5182961.0,
|
||
|
|
"step": 2160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.7447662353515625,
|
||
|
|
"epoch": 0.1392014402366103,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.0003525446577142663,
|
||
|
|
"loss": 5.5275,
|
||
|
|
"mean_token_accuracy": 0.18384548872709275,
|
||
|
|
"num_tokens": 5195675.0,
|
||
|
|
"step": 2165
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.823494243621826,
|
||
|
|
"epoch": 0.13952292162283803,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00035143768003293395,
|
||
|
|
"loss": 5.5203,
|
||
|
|
"mean_token_accuracy": 0.1787479281425476,
|
||
|
|
"num_tokens": 5207385.0,
|
||
|
|
"step": 2170
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.829427433013916,
|
||
|
|
"epoch": 0.13984440300906578,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0003503286067739913,
|
||
|
|
"loss": 5.5229,
|
||
|
|
"mean_token_accuracy": 0.17892941683530808,
|
||
|
|
"num_tokens": 5219546.0,
|
||
|
|
"step": 2175
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.745072078704834,
|
||
|
|
"epoch": 0.1401658843952935,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.00034921746834324193,
|
||
|
|
"loss": 5.4045,
|
||
|
|
"mean_token_accuracy": 0.19110034853219987,
|
||
|
|
"num_tokens": 5231175.0,
|
||
|
|
"step": 2180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.70222487449646,
|
||
|
|
"epoch": 0.14048736578152124,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.0003481042952031072,
|
||
|
|
"loss": 5.5087,
|
||
|
|
"mean_token_accuracy": 0.18616049289703368,
|
||
|
|
"num_tokens": 5242164.0,
|
||
|
|
"step": 2185
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.73668909072876,
|
||
|
|
"epoch": 0.140808847167749,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0003469891178717911,
|
||
|
|
"loss": 5.4051,
|
||
|
|
"mean_token_accuracy": 0.18240442574024202,
|
||
|
|
"num_tokens": 5254798.0,
|
||
|
|
"step": 2190
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.7363566875457765,
|
||
|
|
"epoch": 0.14113032855397672,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 0.0003458719669224436,
|
||
|
|
"loss": 5.498,
|
||
|
|
"mean_token_accuracy": 0.18667046278715133,
|
||
|
|
"num_tokens": 5267540.0,
|
||
|
|
"step": 2195
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.820670938491821,
|
||
|
|
"epoch": 0.14145180994020445,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.0003447528729823221,
|
||
|
|
"loss": 5.5249,
|
||
|
|
"mean_token_accuracy": 0.17592255622148514,
|
||
|
|
"num_tokens": 5280283.0,
|
||
|
|
"step": 2200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.783896446228027,
|
||
|
|
"epoch": 0.1417732913264322,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0003436318667319525,
|
||
|
|
"loss": 5.6086,
|
||
|
|
"mean_token_accuracy": 0.1798434942960739,
|
||
|
|
"num_tokens": 5294247.0,
|
||
|
|
"step": 2205
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.8498693943023685,
|
||
|
|
"epoch": 0.14209477271265994,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00034250897890428716,
|
||
|
|
"loss": 5.6342,
|
||
|
|
"mean_token_accuracy": 0.17710212022066116,
|
||
|
|
"num_tokens": 5307155.0,
|
||
|
|
"step": 2210
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.781178283691406,
|
||
|
|
"epoch": 0.14241625409888767,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.0003413842402838633,
|
||
|
|
"loss": 5.5309,
|
||
|
|
"mean_token_accuracy": 0.18046447187662124,
|
||
|
|
"num_tokens": 5320103.0,
|
||
|
|
"step": 2215
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.801876544952393,
|
||
|
|
"epoch": 0.14273773548511542,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00034025768170595834,
|
||
|
|
"loss": 5.4789,
|
||
|
|
"mean_token_accuracy": 0.18139876872301103,
|
||
|
|
"num_tokens": 5332919.0,
|
||
|
|
"step": 2220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.8165970802307125,
|
||
|
|
"epoch": 0.14305921687134315,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.0003391293340557446,
|
||
|
|
"loss": 5.5771,
|
||
|
|
"mean_token_accuracy": 0.1808025971055031,
|
||
|
|
"num_tokens": 5345028.0,
|
||
|
|
"step": 2225
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.770275068283081,
|
||
|
|
"epoch": 0.14338069825757088,
|
||
|
|
"grad_norm": 0.91796875,
|
||
|
|
"learning_rate": 0.0003379992282674431,
|
||
|
|
"loss": 5.4752,
|
||
|
|
"mean_token_accuracy": 0.18268953412771224,
|
||
|
|
"num_tokens": 5358345.0,
|
||
|
|
"step": 2230
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.736183929443359,
|
||
|
|
"epoch": 0.1437021796437986,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.0003368673953234749,
|
||
|
|
"loss": 5.5918,
|
||
|
|
"mean_token_accuracy": 0.17822258472442626,
|
||
|
|
"num_tokens": 5371968.0,
|
||
|
|
"step": 2235
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.785114908218384,
|
||
|
|
"epoch": 0.14402366103002637,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00033573386625361176,
|
||
|
|
"loss": 5.396,
|
||
|
|
"mean_token_accuracy": 0.19062534272670745,
|
||
|
|
"num_tokens": 5383598.0,
|
||
|
|
"step": 2240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.721212577819824,
|
||
|
|
"epoch": 0.1443451424162541,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.00033459867213412567,
|
||
|
|
"loss": 5.468,
|
||
|
|
"mean_token_accuracy": 0.18324747383594514,
|
||
|
|
"num_tokens": 5394895.0,
|
||
|
|
"step": 2245
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.811119604110718,
|
||
|
|
"epoch": 0.14466662380248183,
|
||
|
|
"grad_norm": 1.2578125,
|
||
|
|
"learning_rate": 0.000333461844086937,
|
||
|
|
"loss": 5.6338,
|
||
|
|
"mean_token_accuracy": 0.1801897630095482,
|
||
|
|
"num_tokens": 5406048.0,
|
||
|
|
"step": 2250
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.779982805252075,
|
||
|
|
"epoch": 0.14498810518870958,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00033232341327876097,
|
||
|
|
"loss": 5.4517,
|
||
|
|
"mean_token_accuracy": 0.1839503049850464,
|
||
|
|
"num_tokens": 5417497.0,
|
||
|
|
"step": 2255
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.738992214202881,
|
||
|
|
"epoch": 0.1453095865749373,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0003311834109202531,
|
||
|
|
"loss": 5.4578,
|
||
|
|
"mean_token_accuracy": 0.18271873742341996,
|
||
|
|
"num_tokens": 5429372.0,
|
||
|
|
"step": 2260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.702697610855102,
|
||
|
|
"epoch": 0.14563106796116504,
|
||
|
|
"grad_norm": 0.94921875,
|
||
|
|
"learning_rate": 0.00033004186826515416,
|
||
|
|
"loss": 5.4782,
|
||
|
|
"mean_token_accuracy": 0.18308925479650498,
|
||
|
|
"num_tokens": 5442687.0,
|
||
|
|
"step": 2265
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.73618860244751,
|
||
|
|
"epoch": 0.1459525493473928,
|
||
|
|
"grad_norm": 0.97265625,
|
||
|
|
"learning_rate": 0.0003288988166094324,
|
||
|
|
"loss": 5.3735,
|
||
|
|
"mean_token_accuracy": 0.1941055417060852,
|
||
|
|
"num_tokens": 5455750.0,
|
||
|
|
"step": 2270
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.719181156158447,
|
||
|
|
"epoch": 0.14627403073362052,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.00032775428729042656,
|
||
|
|
"loss": 5.5103,
|
||
|
|
"mean_token_accuracy": 0.18479931950569153,
|
||
|
|
"num_tokens": 5468591.0,
|
||
|
|
"step": 2275
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.760000133514405,
|
||
|
|
"epoch": 0.14659551211984825,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.000326608311685986,
|
||
|
|
"loss": 5.4651,
|
||
|
|
"mean_token_accuracy": 0.18513359725475312,
|
||
|
|
"num_tokens": 5481351.0,
|
||
|
|
"step": 2280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.824754238128662,
|
||
|
|
"epoch": 0.146916993506076,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0003254609212136108,
|
||
|
|
"loss": 5.4828,
|
||
|
|
"mean_token_accuracy": 0.18338652700185776,
|
||
|
|
"num_tokens": 5493139.0,
|
||
|
|
"step": 2285
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.785252857208252,
|
||
|
|
"epoch": 0.14723847489230374,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00032431214732959036,
|
||
|
|
"loss": 5.5359,
|
||
|
|
"mean_token_accuracy": 0.18975124210119249,
|
||
|
|
"num_tokens": 5504614.0,
|
||
|
|
"step": 2290
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.731715106964112,
|
||
|
|
"epoch": 0.14755995627853147,
|
||
|
|
"grad_norm": 0.96875,
|
||
|
|
"learning_rate": 0.000323162021528141,
|
||
|
|
"loss": 5.4441,
|
||
|
|
"mean_token_accuracy": 0.18522145450115204,
|
||
|
|
"num_tokens": 5516963.0,
|
||
|
|
"step": 2295
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.819196319580078,
|
||
|
|
"epoch": 0.1478814376647592,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.00032201057534054264,
|
||
|
|
"loss": 5.5477,
|
||
|
|
"mean_token_accuracy": 0.17677218914031984,
|
||
|
|
"num_tokens": 5529419.0,
|
||
|
|
"step": 2300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.776256513595581,
|
||
|
|
"epoch": 0.14820291905098695,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00032085784033427414,
|
||
|
|
"loss": 5.4768,
|
||
|
|
"mean_token_accuracy": 0.18908895701169967,
|
||
|
|
"num_tokens": 5540341.0,
|
||
|
|
"step": 2305
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.751850175857544,
|
||
|
|
"epoch": 0.14852440043721468,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.0003197038481121478,
|
||
|
|
"loss": 5.5298,
|
||
|
|
"mean_token_accuracy": 0.17606374025344848,
|
||
|
|
"num_tokens": 5552402.0,
|
||
|
|
"step": 2310
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.883427524566651,
|
||
|
|
"epoch": 0.1488458818234424,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.0003185486303114436,
|
||
|
|
"loss": 5.6783,
|
||
|
|
"mean_token_accuracy": 0.17739115804433822,
|
||
|
|
"num_tokens": 5564309.0,
|
||
|
|
"step": 2315
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.754642295837402,
|
||
|
|
"epoch": 0.14916736320967017,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.0003173922186030409,
|
||
|
|
"loss": 5.4743,
|
||
|
|
"mean_token_accuracy": 0.18725920021533965,
|
||
|
|
"num_tokens": 5576305.0,
|
||
|
|
"step": 2320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.681988668441773,
|
||
|
|
"epoch": 0.1494888445958979,
|
||
|
|
"grad_norm": 0.96875,
|
||
|
|
"learning_rate": 0.000316234644690551,
|
||
|
|
"loss": 5.3909,
|
||
|
|
"mean_token_accuracy": 0.18984435945749284,
|
||
|
|
"num_tokens": 5587629.0,
|
||
|
|
"step": 2325
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.764342403411865,
|
||
|
|
"epoch": 0.14981032598212563,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0003150759403094473,
|
||
|
|
"loss": 5.4833,
|
||
|
|
"mean_token_accuracy": 0.18134974241256713,
|
||
|
|
"num_tokens": 5599459.0,
|
||
|
|
"step": 2330
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.769356298446655,
|
||
|
|
"epoch": 0.15013180736835338,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.00031391613722619587,
|
||
|
|
"loss": 5.3992,
|
||
|
|
"mean_token_accuracy": 0.1888190746307373,
|
||
|
|
"num_tokens": 5610324.0,
|
||
|
|
"step": 2335
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.657149076461792,
|
||
|
|
"epoch": 0.1504532887545811,
|
||
|
|
"grad_norm": 0.91796875,
|
||
|
|
"learning_rate": 0.000312755267237384,
|
||
|
|
"loss": 5.3883,
|
||
|
|
"mean_token_accuracy": 0.19171329736709594,
|
||
|
|
"num_tokens": 5622655.0,
|
||
|
|
"step": 2340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.757540702819824,
|
||
|
|
"epoch": 0.15077477014080884,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.0003115933621688488,
|
||
|
|
"loss": 5.4886,
|
||
|
|
"mean_token_accuracy": 0.1828450933098793,
|
||
|
|
"num_tokens": 5634645.0,
|
||
|
|
"step": 2345
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.745415258407593,
|
||
|
|
"epoch": 0.1510962515270366,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00031043045387480487,
|
||
|
|
"loss": 5.443,
|
||
|
|
"mean_token_accuracy": 0.18682096749544144,
|
||
|
|
"num_tokens": 5646868.0,
|
||
|
|
"step": 2350
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6784426212310795,
|
||
|
|
"epoch": 0.15141773291326432,
|
||
|
|
"grad_norm": 0.953125,
|
||
|
|
"learning_rate": 0.0003092665742369703,
|
||
|
|
"loss": 5.4126,
|
||
|
|
"mean_token_accuracy": 0.18253785818815232,
|
||
|
|
"num_tokens": 5659555.0,
|
||
|
|
"step": 2355
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.772103643417358,
|
||
|
|
"epoch": 0.15173921429949205,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00030810175516369343,
|
||
|
|
"loss": 5.4386,
|
||
|
|
"mean_token_accuracy": 0.19016828536987304,
|
||
|
|
"num_tokens": 5671718.0,
|
||
|
|
"step": 2360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.7293273448944095,
|
||
|
|
"epoch": 0.1520606956857198,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.0003069360285890775,
|
||
|
|
"loss": 5.4382,
|
||
|
|
"mean_token_accuracy": 0.1862625375390053,
|
||
|
|
"num_tokens": 5685121.0,
|
||
|
|
"step": 2365
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.710463333129883,
|
||
|
|
"epoch": 0.15238217707194754,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.00030576942647210547,
|
||
|
|
"loss": 5.4894,
|
||
|
|
"mean_token_accuracy": 0.18526532351970673,
|
||
|
|
"num_tokens": 5696646.0,
|
||
|
|
"step": 2370
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.8341999530792235,
|
||
|
|
"epoch": 0.15270365845817527,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.00030460198079576355,
|
||
|
|
"loss": 5.5394,
|
||
|
|
"mean_token_accuracy": 0.17606807351112366,
|
||
|
|
"num_tokens": 5708529.0,
|
||
|
|
"step": 2375
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.805117750167847,
|
||
|
|
"epoch": 0.153025139844403,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.0003034337235661648,
|
||
|
|
"loss": 5.5085,
|
||
|
|
"mean_token_accuracy": 0.18223248422145844,
|
||
|
|
"num_tokens": 5720655.0,
|
||
|
|
"step": 2380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.740260791778565,
|
||
|
|
"epoch": 0.15334662123063075,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.0003022646868116714,
|
||
|
|
"loss": 5.5217,
|
||
|
|
"mean_token_accuracy": 0.18677257746458054,
|
||
|
|
"num_tokens": 5734026.0,
|
||
|
|
"step": 2385
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.762510967254639,
|
||
|
|
"epoch": 0.15366810261685848,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0003010949025820163,
|
||
|
|
"loss": 5.3718,
|
||
|
|
"mean_token_accuracy": 0.1946680411696434,
|
||
|
|
"num_tokens": 5745780.0,
|
||
|
|
"step": 2390
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.653225946426391,
|
||
|
|
"epoch": 0.1539895840030862,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.0002999244029474252,
|
||
|
|
"loss": 5.4089,
|
||
|
|
"mean_token_accuracy": 0.1960905224084854,
|
||
|
|
"num_tokens": 5757366.0,
|
||
|
|
"step": 2395
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.693793201446534,
|
||
|
|
"epoch": 0.15431106538931397,
|
||
|
|
"grad_norm": 0.97265625,
|
||
|
|
"learning_rate": 0.00029875321999773684,
|
||
|
|
"loss": 5.4323,
|
||
|
|
"mean_token_accuracy": 0.18601686954498292,
|
||
|
|
"num_tokens": 5770233.0,
|
||
|
|
"step": 2400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.744156837463379,
|
||
|
|
"epoch": 0.1546325467755417,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.00029758138584152333,
|
||
|
|
"loss": 5.488,
|
||
|
|
"mean_token_accuracy": 0.18518585562705994,
|
||
|
|
"num_tokens": 5782594.0,
|
||
|
|
"step": 2405
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.776286935806274,
|
||
|
|
"epoch": 0.15495402816176942,
|
||
|
|
"grad_norm": 0.90625,
|
||
|
|
"learning_rate": 0.0002964089326052102,
|
||
|
|
"loss": 5.4478,
|
||
|
|
"mean_token_accuracy": 0.19138861447572708,
|
||
|
|
"num_tokens": 5796483.0,
|
||
|
|
"step": 2410
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.827335071563721,
|
||
|
|
"epoch": 0.15527550954799718,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.0002952358924321949,
|
||
|
|
"loss": 5.5183,
|
||
|
|
"mean_token_accuracy": 0.18744486421346665,
|
||
|
|
"num_tokens": 5808462.0,
|
||
|
|
"step": 2415
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.747323989868164,
|
||
|
|
"epoch": 0.1555969909342249,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00029406229748196657,
|
||
|
|
"loss": 5.4604,
|
||
|
|
"mean_token_accuracy": 0.18579795807600022,
|
||
|
|
"num_tokens": 5819337.0,
|
||
|
|
"step": 2420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.727008581161499,
|
||
|
|
"epoch": 0.15591847232045264,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0002928881799292235,
|
||
|
|
"loss": 5.3936,
|
||
|
|
"mean_token_accuracy": 0.19244006425142288,
|
||
|
|
"num_tokens": 5830546.0,
|
||
|
|
"step": 2425
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.7133873462677,
|
||
|
|
"epoch": 0.1562399537066804,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00029171357196299154,
|
||
|
|
"loss": 5.3786,
|
||
|
|
"mean_token_accuracy": 0.1822706028819084,
|
||
|
|
"num_tokens": 5842737.0,
|
||
|
|
"step": 2430
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.68302960395813,
|
||
|
|
"epoch": 0.15656143509290812,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0002905385057857414,
|
||
|
|
"loss": 5.4229,
|
||
|
|
"mean_token_accuracy": 0.18687608242034912,
|
||
|
|
"num_tokens": 5854411.0,
|
||
|
|
"step": 2435
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.785665130615234,
|
||
|
|
"epoch": 0.15688291647913585,
|
||
|
|
"grad_norm": 0.97265625,
|
||
|
|
"learning_rate": 0.0002893630136125058,
|
||
|
|
"loss": 5.443,
|
||
|
|
"mean_token_accuracy": 0.1872907817363739,
|
||
|
|
"num_tokens": 5866981.0,
|
||
|
|
"step": 2440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.7371235370635985,
|
||
|
|
"epoch": 0.15720439786536358,
|
||
|
|
"grad_norm": 0.96875,
|
||
|
|
"learning_rate": 0.0002881871276699967,
|
||
|
|
"loss": 5.4436,
|
||
|
|
"mean_token_accuracy": 0.1881553366780281,
|
||
|
|
"num_tokens": 5879892.0,
|
||
|
|
"step": 2445
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.744434881210327,
|
||
|
|
"epoch": 0.15752587925159134,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00028701088019572114,
|
||
|
|
"loss": 5.443,
|
||
|
|
"mean_token_accuracy": 0.19242127984762192,
|
||
|
|
"num_tokens": 5892721.0,
|
||
|
|
"step": 2450
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.79182014465332,
|
||
|
|
"epoch": 0.15784736063781907,
|
||
|
|
"grad_norm": 1.3125,
|
||
|
|
"learning_rate": 0.0002858343034370977,
|
||
|
|
"loss": 5.4938,
|
||
|
|
"mean_token_accuracy": 0.1780470922589302,
|
||
|
|
"num_tokens": 5903582.0,
|
||
|
|
"step": 2455
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.704325819015503,
|
||
|
|
"epoch": 0.1581688420240468,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.00028465742965057267,
|
||
|
|
"loss": 5.4225,
|
||
|
|
"mean_token_accuracy": 0.18842038363218308,
|
||
|
|
"num_tokens": 5915520.0,
|
||
|
|
"step": 2460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.7458555698394775,
|
||
|
|
"epoch": 0.15849032341027455,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.00028348029110073533,
|
||
|
|
"loss": 5.3892,
|
||
|
|
"mean_token_accuracy": 0.19154608100652695,
|
||
|
|
"num_tokens": 5926795.0,
|
||
|
|
"step": 2465
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.652383852005005,
|
||
|
|
"epoch": 0.15881180479650228,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.00028230292005943365,
|
||
|
|
"loss": 5.3814,
|
||
|
|
"mean_token_accuracy": 0.19180724918842315,
|
||
|
|
"num_tokens": 5938985.0,
|
||
|
|
"step": 2470
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.769040584564209,
|
||
|
|
"epoch": 0.15913328618273,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00028112534880488945,
|
||
|
|
"loss": 5.4256,
|
||
|
|
"mean_token_accuracy": 0.18810439109802246,
|
||
|
|
"num_tokens": 5950047.0,
|
||
|
|
"step": 2475
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.7024431228637695,
|
||
|
|
"epoch": 0.15945476756895777,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0002799476096208137,
|
||
|
|
"loss": 5.396,
|
||
|
|
"mean_token_accuracy": 0.18664792329072952,
|
||
|
|
"num_tokens": 5962202.0,
|
||
|
|
"step": 2480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6790430545806885,
|
||
|
|
"epoch": 0.1597762489551855,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.00027876973479552087,
|
||
|
|
"loss": 5.4157,
|
||
|
|
"mean_token_accuracy": 0.1834772288799286,
|
||
|
|
"num_tokens": 5974519.0,
|
||
|
|
"step": 2485
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.787295770645142,
|
||
|
|
"epoch": 0.16009773034141322,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.00027759175662104424,
|
||
|
|
"loss": 5.4769,
|
||
|
|
"mean_token_accuracy": 0.1819728434085846,
|
||
|
|
"num_tokens": 5986863.0,
|
||
|
|
"step": 2490
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.736282396316528,
|
||
|
|
"epoch": 0.16041921172764098,
|
||
|
|
"grad_norm": 0.9609375,
|
||
|
|
"learning_rate": 0.0002764137073922508,
|
||
|
|
"loss": 5.4371,
|
||
|
|
"mean_token_accuracy": 0.19367015659809111,
|
||
|
|
"num_tokens": 5999187.0,
|
||
|
|
"step": 2495
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.623657894134522,
|
||
|
|
"epoch": 0.1607406931138687,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.00027523561940595505,
|
||
|
|
"loss": 5.4013,
|
||
|
|
"mean_token_accuracy": 0.19085921943187714,
|
||
|
|
"num_tokens": 6011304.0,
|
||
|
|
"step": 2500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.757048940658569,
|
||
|
|
"epoch": 0.16106217450009644,
|
||
|
|
"grad_norm": 0.984375,
|
||
|
|
"learning_rate": 0.0002740575249600342,
|
||
|
|
"loss": 5.4342,
|
||
|
|
"mean_token_accuracy": 0.18263567388057708,
|
||
|
|
"num_tokens": 6023371.0,
|
||
|
|
"step": 2505
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.774210119247437,
|
||
|
|
"epoch": 0.1613836558863242,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 0.00027287945635254263,
|
||
|
|
"loss": 5.5002,
|
||
|
|
"mean_token_accuracy": 0.18891827315092086,
|
||
|
|
"num_tokens": 6035169.0,
|
||
|
|
"step": 2510
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.745975303649902,
|
||
|
|
"epoch": 0.16170513727255192,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.00027170144588082635,
|
||
|
|
"loss": 5.4882,
|
||
|
|
"mean_token_accuracy": 0.18472196459770202,
|
||
|
|
"num_tokens": 6047484.0,
|
||
|
|
"step": 2515
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.826107740402222,
|
||
|
|
"epoch": 0.16202661865877965,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.00027052352584063763,
|
||
|
|
"loss": 5.5828,
|
||
|
|
"mean_token_accuracy": 0.1836489662528038,
|
||
|
|
"num_tokens": 6060321.0,
|
||
|
|
"step": 2520
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.700526762008667,
|
||
|
|
"epoch": 0.16234810004500738,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.00026934572852524907,
|
||
|
|
"loss": 5.3282,
|
||
|
|
"mean_token_accuracy": 0.19790842682123183,
|
||
|
|
"num_tokens": 6071283.0,
|
||
|
|
"step": 2525
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.678812551498413,
|
||
|
|
"epoch": 0.16266958143123514,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 0.00026816808622456937,
|
||
|
|
"loss": 5.3668,
|
||
|
|
"mean_token_accuracy": 0.19255405217409133,
|
||
|
|
"num_tokens": 6083181.0,
|
||
|
|
"step": 2530
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.733684349060058,
|
||
|
|
"epoch": 0.16299106281746287,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.0002669906312242569,
|
||
|
|
"loss": 5.4731,
|
||
|
|
"mean_token_accuracy": 0.18607353866100312,
|
||
|
|
"num_tokens": 6095453.0,
|
||
|
|
"step": 2535
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.633643722534179,
|
||
|
|
"epoch": 0.1633125442036906,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00026581339580483525,
|
||
|
|
"loss": 5.2663,
|
||
|
|
"mean_token_accuracy": 0.19765492528676987,
|
||
|
|
"num_tokens": 6106626.0,
|
||
|
|
"step": 2540
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.704886960983276,
|
||
|
|
"epoch": 0.16363402558991835,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.0002646364122408082,
|
||
|
|
"loss": 5.3787,
|
||
|
|
"mean_token_accuracy": 0.19035560488700867,
|
||
|
|
"num_tokens": 6118303.0,
|
||
|
|
"step": 2545
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.72221360206604,
|
||
|
|
"epoch": 0.16395550697614608,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0002634597127997749,
|
||
|
|
"loss": 5.3749,
|
||
|
|
"mean_token_accuracy": 0.19013865888118744,
|
||
|
|
"num_tokens": 6129816.0,
|
||
|
|
"step": 2550
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.608705329895019,
|
||
|
|
"epoch": 0.1642769883623738,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0002622833297415445,
|
||
|
|
"loss": 5.3172,
|
||
|
|
"mean_token_accuracy": 0.1911654755473137,
|
||
|
|
"num_tokens": 6140365.0,
|
||
|
|
"step": 2555
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.760907173156738,
|
||
|
|
"epoch": 0.16459846974860157,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0002611072953172531,
|
||
|
|
"loss": 5.4881,
|
||
|
|
"mean_token_accuracy": 0.17768636643886565,
|
||
|
|
"num_tokens": 6152983.0,
|
||
|
|
"step": 2560
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.789962673187256,
|
||
|
|
"epoch": 0.1649199511348293,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00025993164176847845,
|
||
|
|
"loss": 5.3655,
|
||
|
|
"mean_token_accuracy": 0.19078085273504258,
|
||
|
|
"num_tokens": 6164881.0,
|
||
|
|
"step": 2565
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.589530611038208,
|
||
|
|
"epoch": 0.16524143252105702,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0002587564013263564,
|
||
|
|
"loss": 5.3354,
|
||
|
|
"mean_token_accuracy": 0.1928408369421959,
|
||
|
|
"num_tokens": 6176486.0,
|
||
|
|
"step": 2570
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.650345945358277,
|
||
|
|
"epoch": 0.16556291390728478,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.0002575816062106974,
|
||
|
|
"loss": 5.3535,
|
||
|
|
"mean_token_accuracy": 0.18694678395986558,
|
||
|
|
"num_tokens": 6189147.0,
|
||
|
|
"step": 2575
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.760590648651123,
|
||
|
|
"epoch": 0.1658843952935125,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.00025640728862910293,
|
||
|
|
"loss": 5.3917,
|
||
|
|
"mean_token_accuracy": 0.188855442404747,
|
||
|
|
"num_tokens": 6201009.0,
|
||
|
|
"step": 2580
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.788675117492676,
|
||
|
|
"epoch": 0.16620587667974024,
|
||
|
|
"grad_norm": 0.98828125,
|
||
|
|
"learning_rate": 0.00025523348077608285,
|
||
|
|
"loss": 5.5928,
|
||
|
|
"mean_token_accuracy": 0.1768835663795471,
|
||
|
|
"num_tokens": 6212960.0,
|
||
|
|
"step": 2585
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6765465259552,
|
||
|
|
"epoch": 0.16652735806596797,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.00025406021483217225,
|
||
|
|
"loss": 5.421,
|
||
|
|
"mean_token_accuracy": 0.18803070932626725,
|
||
|
|
"num_tokens": 6224528.0,
|
||
|
|
"step": 2590
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.736158561706543,
|
||
|
|
"epoch": 0.16684883945219572,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.00025288752296304963,
|
||
|
|
"loss": 5.4378,
|
||
|
|
"mean_token_accuracy": 0.1856225997209549,
|
||
|
|
"num_tokens": 6235177.0,
|
||
|
|
"step": 2595
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.696233892440796,
|
||
|
|
"epoch": 0.16717032083842345,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.000251715437318655,
|
||
|
|
"loss": 5.35,
|
||
|
|
"mean_token_accuracy": 0.19037462770938873,
|
||
|
|
"num_tokens": 6247358.0,
|
||
|
|
"step": 2600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.712907552719116,
|
||
|
|
"epoch": 0.16749180222465118,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0002505439900323084,
|
||
|
|
"loss": 5.4432,
|
||
|
|
"mean_token_accuracy": 0.19202869087457658,
|
||
|
|
"num_tokens": 6258710.0,
|
||
|
|
"step": 2605
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.673813343048096,
|
||
|
|
"epoch": 0.16781328361087894,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.00024937321321982894,
|
||
|
|
"loss": 5.3658,
|
||
|
|
"mean_token_accuracy": 0.19849955141544343,
|
||
|
|
"num_tokens": 6270877.0,
|
||
|
|
"step": 2610
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.670746183395385,
|
||
|
|
"epoch": 0.16813476499710667,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00024820313897865433,
|
||
|
|
"loss": 5.3693,
|
||
|
|
"mean_token_accuracy": 0.1975083351135254,
|
||
|
|
"num_tokens": 6282938.0,
|
||
|
|
"step": 2615
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.691606140136718,
|
||
|
|
"epoch": 0.1684562463833344,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00024703379938696105,
|
||
|
|
"loss": 5.4931,
|
||
|
|
"mean_token_accuracy": 0.186161832511425,
|
||
|
|
"num_tokens": 6295644.0,
|
||
|
|
"step": 2620
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.752467966079712,
|
||
|
|
"epoch": 0.16877772776956215,
|
||
|
|
"grad_norm": 0.921875,
|
||
|
|
"learning_rate": 0.00024586522650278447,
|
||
|
|
"loss": 5.5008,
|
||
|
|
"mean_token_accuracy": 0.18383887112140657,
|
||
|
|
"num_tokens": 6307713.0,
|
||
|
|
"step": 2625
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.719897651672364,
|
||
|
|
"epoch": 0.16909920915578988,
|
||
|
|
"grad_norm": 0.9609375,
|
||
|
|
"learning_rate": 0.00024469745236314064,
|
||
|
|
"loss": 5.4252,
|
||
|
|
"mean_token_accuracy": 0.1854029953479767,
|
||
|
|
"num_tokens": 6320979.0,
|
||
|
|
"step": 2630
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.738539171218872,
|
||
|
|
"epoch": 0.1694206905420176,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00024353050898314767,
|
||
|
|
"loss": 5.3588,
|
||
|
|
"mean_token_accuracy": 0.19410390853881837,
|
||
|
|
"num_tokens": 6333073.0,
|
||
|
|
"step": 2635
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.770835208892822,
|
||
|
|
"epoch": 0.16974217192824537,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.00024236442835514743,
|
||
|
|
"loss": 5.4642,
|
||
|
|
"mean_token_accuracy": 0.18527479469776154,
|
||
|
|
"num_tokens": 6345820.0,
|
||
|
|
"step": 2640
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.635788154602051,
|
||
|
|
"epoch": 0.1700636533144731,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 0.00024119924244782965,
|
||
|
|
"loss": 5.2619,
|
||
|
|
"mean_token_accuracy": 0.200632905960083,
|
||
|
|
"num_tokens": 6357077.0,
|
||
|
|
"step": 2645
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.64978060722351,
|
||
|
|
"epoch": 0.17038513470070082,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00024003498320535462,
|
||
|
|
"loss": 5.3396,
|
||
|
|
"mean_token_accuracy": 0.18788397163152695,
|
||
|
|
"num_tokens": 6368646.0,
|
||
|
|
"step": 2650
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6555901050567625,
|
||
|
|
"epoch": 0.17070661608692855,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00023887168254647727,
|
||
|
|
"loss": 5.3509,
|
||
|
|
"mean_token_accuracy": 0.18772217631340027,
|
||
|
|
"num_tokens": 6381404.0,
|
||
|
|
"step": 2655
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.755281400680542,
|
||
|
|
"epoch": 0.1710280974731563,
|
||
|
|
"grad_norm": 0.9609375,
|
||
|
|
"learning_rate": 0.00023770937236367308,
|
||
|
|
"loss": 5.4743,
|
||
|
|
"mean_token_accuracy": 0.18462026566267015,
|
||
|
|
"num_tokens": 6393837.0,
|
||
|
|
"step": 2660
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.718565797805786,
|
||
|
|
"epoch": 0.17134957885938404,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00023654808452226278,
|
||
|
|
"loss": 5.4047,
|
||
|
|
"mean_token_accuracy": 0.19541409462690354,
|
||
|
|
"num_tokens": 6406047.0,
|
||
|
|
"step": 2665
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.725548124313354,
|
||
|
|
"epoch": 0.17167106024561177,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.00023538785085953912,
|
||
|
|
"loss": 5.3649,
|
||
|
|
"mean_token_accuracy": 0.1895756259560585,
|
||
|
|
"num_tokens": 6417473.0,
|
||
|
|
"step": 2670
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.680177164077759,
|
||
|
|
"epoch": 0.17199254163183952,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.00023422870318389404,
|
||
|
|
"loss": 5.4406,
|
||
|
|
"mean_token_accuracy": 0.19270267188549042,
|
||
|
|
"num_tokens": 6428790.0,
|
||
|
|
"step": 2675
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.728271961212158,
|
||
|
|
"epoch": 0.17231402301806725,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.0002330706732739468,
|
||
|
|
"loss": 5.3948,
|
||
|
|
"mean_token_accuracy": 0.19255558401346207,
|
||
|
|
"num_tokens": 6440836.0,
|
||
|
|
"step": 2680
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.74830174446106,
|
||
|
|
"epoch": 0.17263550440429498,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.00023191379287767211,
|
||
|
|
"loss": 5.3293,
|
||
|
|
"mean_token_accuracy": 0.19255857914686203,
|
||
|
|
"num_tokens": 6452115.0,
|
||
|
|
"step": 2685
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.634627437591552,
|
||
|
|
"epoch": 0.17295698579052274,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0002307580937115305,
|
||
|
|
"loss": 5.3894,
|
||
|
|
"mean_token_accuracy": 0.19944595396518708,
|
||
|
|
"num_tokens": 6464574.0,
|
||
|
|
"step": 2690
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.7174866676330565,
|
||
|
|
"epoch": 0.17327846717675047,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00022960360745959846,
|
||
|
|
"loss": 5.3937,
|
||
|
|
"mean_token_accuracy": 0.18737066835165023,
|
||
|
|
"num_tokens": 6477092.0,
|
||
|
|
"step": 2695
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.757074880599975,
|
||
|
|
"epoch": 0.1735999485629782,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00022845036577269972,
|
||
|
|
"loss": 5.417,
|
||
|
|
"mean_token_accuracy": 0.18753257244825364,
|
||
|
|
"num_tokens": 6488899.0,
|
||
|
|
"step": 2700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.700710439682007,
|
||
|
|
"epoch": 0.17392142994920595,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00022729840026753777,
|
||
|
|
"loss": 5.4369,
|
||
|
|
"mean_token_accuracy": 0.19061683267354965,
|
||
|
|
"num_tokens": 6502030.0,
|
||
|
|
"step": 2705
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.805812931060791,
|
||
|
|
"epoch": 0.17424291133543368,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.0002261477425258287,
|
||
|
|
"loss": 5.5247,
|
||
|
|
"mean_token_accuracy": 0.1854427859187126,
|
||
|
|
"num_tokens": 6516042.0,
|
||
|
|
"step": 2710
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.729813528060913,
|
||
|
|
"epoch": 0.1745643927216614,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.0002249984240934358,
|
||
|
|
"loss": 5.355,
|
||
|
|
"mean_token_accuracy": 0.19945041835308075,
|
||
|
|
"num_tokens": 6527869.0,
|
||
|
|
"step": 2715
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.656886625289917,
|
||
|
|
"epoch": 0.17488587410788917,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.00022385047647950464,
|
||
|
|
"loss": 5.3595,
|
||
|
|
"mean_token_accuracy": 0.19776754975318908,
|
||
|
|
"num_tokens": 6539108.0,
|
||
|
|
"step": 2720
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.665387916564941,
|
||
|
|
"epoch": 0.1752073554941169,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 0.0002227039311555986,
|
||
|
|
"loss": 5.2585,
|
||
|
|
"mean_token_accuracy": 0.20100895464420318,
|
||
|
|
"num_tokens": 6551035.0,
|
||
|
|
"step": 2725
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.698460817337036,
|
||
|
|
"epoch": 0.17552883688034462,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.0002215588195548372,
|
||
|
|
"loss": 5.4061,
|
||
|
|
"mean_token_accuracy": 0.18864956349134446,
|
||
|
|
"num_tokens": 6563070.0,
|
||
|
|
"step": 2730
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.652213525772095,
|
||
|
|
"epoch": 0.17585031826657235,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00022041517307103337,
|
||
|
|
"loss": 5.3538,
|
||
|
|
"mean_token_accuracy": 0.19336917847394944,
|
||
|
|
"num_tokens": 6575718.0,
|
||
|
|
"step": 2735
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.651966857910156,
|
||
|
|
"epoch": 0.1761717996528001,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.0002192730230578331,
|
||
|
|
"loss": 5.2989,
|
||
|
|
"mean_token_accuracy": 0.20069129168987274,
|
||
|
|
"num_tokens": 6587798.0,
|
||
|
|
"step": 2740
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6531054973602295,
|
||
|
|
"epoch": 0.17649328103902784,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0002181324008278559,
|
||
|
|
"loss": 5.3384,
|
||
|
|
"mean_token_accuracy": 0.19774024188518524,
|
||
|
|
"num_tokens": 6599490.0,
|
||
|
|
"step": 2745
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.735021018981934,
|
||
|
|
"epoch": 0.17681476242525557,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00021699333765183655,
|
||
|
|
"loss": 5.4151,
|
||
|
|
"mean_token_accuracy": 0.19034498184919357,
|
||
|
|
"num_tokens": 6610257.0,
|
||
|
|
"step": 2750
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.766584253311157,
|
||
|
|
"epoch": 0.17713624381148332,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.0002158558647577673,
|
||
|
|
"loss": 5.4415,
|
||
|
|
"mean_token_accuracy": 0.18987052738666535,
|
||
|
|
"num_tokens": 6623106.0,
|
||
|
|
"step": 2755
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.70956335067749,
|
||
|
|
"epoch": 0.17745772519771105,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.00021472001333004215,
|
||
|
|
"loss": 5.4621,
|
||
|
|
"mean_token_accuracy": 0.18878680169582368,
|
||
|
|
"num_tokens": 6634355.0,
|
||
|
|
"step": 2760
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.773206949234009,
|
||
|
|
"epoch": 0.17777920658393878,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.00021358581450860186,
|
||
|
|
"loss": 5.4231,
|
||
|
|
"mean_token_accuracy": 0.18522380888462067,
|
||
|
|
"num_tokens": 6645389.0,
|
||
|
|
"step": 2765
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.630489778518677,
|
||
|
|
"epoch": 0.17810068797016654,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0002124532993880799,
|
||
|
|
"loss": 5.3076,
|
||
|
|
"mean_token_accuracy": 0.1954178676009178,
|
||
|
|
"num_tokens": 6656422.0,
|
||
|
|
"step": 2770
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.683885908126831,
|
||
|
|
"epoch": 0.17842216935639427,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00021132249901695044,
|
||
|
|
"loss": 5.3621,
|
||
|
|
"mean_token_accuracy": 0.1880607470870018,
|
||
|
|
"num_tokens": 6668074.0,
|
||
|
|
"step": 2775
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.697801876068115,
|
||
|
|
"epoch": 0.178743650742622,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00021019344439667705,
|
||
|
|
"loss": 5.4073,
|
||
|
|
"mean_token_accuracy": 0.18855472803115844,
|
||
|
|
"num_tokens": 6680903.0,
|
||
|
|
"step": 2780
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6559816837310795,
|
||
|
|
"epoch": 0.17906513212884975,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.00020906616648086213,
|
||
|
|
"loss": 5.3039,
|
||
|
|
"mean_token_accuracy": 0.20630253553390504,
|
||
|
|
"num_tokens": 6691621.0,
|
||
|
|
"step": 2785
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.671924591064453,
|
||
|
|
"epoch": 0.17938661351507748,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.00020794069617439942,
|
||
|
|
"loss": 5.3438,
|
||
|
|
"mean_token_accuracy": 0.1956033930182457,
|
||
|
|
"num_tokens": 6702941.0,
|
||
|
|
"step": 2790
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.782442951202393,
|
||
|
|
"epoch": 0.1797080949013052,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.00020681706433262593,
|
||
|
|
"loss": 5.4145,
|
||
|
|
"mean_token_accuracy": 0.1867195799946785,
|
||
|
|
"num_tokens": 6715336.0,
|
||
|
|
"step": 2795
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.71237964630127,
|
||
|
|
"epoch": 0.18002957628753294,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00020569530176047602,
|
||
|
|
"loss": 5.3303,
|
||
|
|
"mean_token_accuracy": 0.1883831426501274,
|
||
|
|
"num_tokens": 6727199.0,
|
||
|
|
"step": 2800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6498565673828125,
|
||
|
|
"epoch": 0.1803510576737607,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.0002045754392116374,
|
||
|
|
"loss": 5.3285,
|
||
|
|
"mean_token_accuracy": 0.19204856902360917,
|
||
|
|
"num_tokens": 6739419.0,
|
||
|
|
"step": 2805
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.72914137840271,
|
||
|
|
"epoch": 0.18067253905998842,
|
||
|
|
"grad_norm": 1.3203125,
|
||
|
|
"learning_rate": 0.00020345750738770757,
|
||
|
|
"loss": 5.3964,
|
||
|
|
"mean_token_accuracy": 0.18919821232557296,
|
||
|
|
"num_tokens": 6751751.0,
|
||
|
|
"step": 2810
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.729403638839722,
|
||
|
|
"epoch": 0.18099402044621615,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00020234153693735214,
|
||
|
|
"loss": 5.4011,
|
||
|
|
"mean_token_accuracy": 0.1921023279428482,
|
||
|
|
"num_tokens": 6764313.0,
|
||
|
|
"step": 2815
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.698525762557983,
|
||
|
|
"epoch": 0.1813155018324439,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.0002012275584554647,
|
||
|
|
"loss": 5.3628,
|
||
|
|
"mean_token_accuracy": 0.18777787685394287,
|
||
|
|
"num_tokens": 6777119.0,
|
||
|
|
"step": 2820
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.714127874374389,
|
||
|
|
"epoch": 0.18163698321867164,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.00020011560248232803,
|
||
|
|
"loss": 5.4535,
|
||
|
|
"mean_token_accuracy": 0.18426025062799453,
|
||
|
|
"num_tokens": 6789050.0,
|
||
|
|
"step": 2825
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.654620218276977,
|
||
|
|
"epoch": 0.18195846460489937,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00019900569950277692,
|
||
|
|
"loss": 5.2821,
|
||
|
|
"mean_token_accuracy": 0.19899048358201982,
|
||
|
|
"num_tokens": 6802729.0,
|
||
|
|
"step": 2830
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.658134317398071,
|
||
|
|
"epoch": 0.18227994599112712,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.00019789787994536228,
|
||
|
|
"loss": 5.391,
|
||
|
|
"mean_token_accuracy": 0.19206143766641617,
|
||
|
|
"num_tokens": 6816830.0,
|
||
|
|
"step": 2835
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.663815641403199,
|
||
|
|
"epoch": 0.18260142737735485,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.00019679217418151667,
|
||
|
|
"loss": 5.3093,
|
||
|
|
"mean_token_accuracy": 0.19375376999378205,
|
||
|
|
"num_tokens": 6829310.0,
|
||
|
|
"step": 2840
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.71293830871582,
|
||
|
|
"epoch": 0.18292290876358258,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00019568861252472236,
|
||
|
|
"loss": 5.3716,
|
||
|
|
"mean_token_accuracy": 0.18789880722761154,
|
||
|
|
"num_tokens": 6840777.0,
|
||
|
|
"step": 2845
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.698060512542725,
|
||
|
|
"epoch": 0.18324439014981034,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 0.00019458722522967952,
|
||
|
|
"loss": 5.2837,
|
||
|
|
"mean_token_accuracy": 0.20378447473049163,
|
||
|
|
"num_tokens": 6852153.0,
|
||
|
|
"step": 2850
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.650346040725708,
|
||
|
|
"epoch": 0.18356587153603807,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00019348804249147723,
|
||
|
|
"loss": 5.3548,
|
||
|
|
"mean_token_accuracy": 0.1958395019173622,
|
||
|
|
"num_tokens": 6864939.0,
|
||
|
|
"step": 2855
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.655475997924805,
|
||
|
|
"epoch": 0.1838873529222658,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.0001923910944447655,
|
||
|
|
"loss": 5.3524,
|
||
|
|
"mean_token_accuracy": 0.1980673685669899,
|
||
|
|
"num_tokens": 6878226.0,
|
||
|
|
"step": 2860
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.650178623199463,
|
||
|
|
"epoch": 0.18420883430849355,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00019129641116292928,
|
||
|
|
"loss": 5.3498,
|
||
|
|
"mean_token_accuracy": 0.19102472960948944,
|
||
|
|
"num_tokens": 6892218.0,
|
||
|
|
"step": 2865
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.786796283721924,
|
||
|
|
"epoch": 0.18453031569472128,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00019020402265726343,
|
||
|
|
"loss": 5.418,
|
||
|
|
"mean_token_accuracy": 0.19311929494142532,
|
||
|
|
"num_tokens": 6903956.0,
|
||
|
|
"step": 2870
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.820598363876343,
|
||
|
|
"epoch": 0.184851797080949,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0001891139588761509,
|
||
|
|
"loss": 5.5329,
|
||
|
|
"mean_token_accuracy": 0.18871719986200333,
|
||
|
|
"num_tokens": 6917213.0,
|
||
|
|
"step": 2875
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.765894889831543,
|
||
|
|
"epoch": 0.18517327846717674,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00018802624970424076,
|
||
|
|
"loss": 5.3568,
|
||
|
|
"mean_token_accuracy": 0.1947931945323944,
|
||
|
|
"num_tokens": 6929834.0,
|
||
|
|
"step": 2880
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.634900665283203,
|
||
|
|
"epoch": 0.1854947598534045,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.00018694092496162945,
|
||
|
|
"loss": 5.3401,
|
||
|
|
"mean_token_accuracy": 0.19182991236448288,
|
||
|
|
"num_tokens": 6941910.0,
|
||
|
|
"step": 2885
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.64922981262207,
|
||
|
|
"epoch": 0.18581624123963222,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00018585801440304306,
|
||
|
|
"loss": 5.3106,
|
||
|
|
"mean_token_accuracy": 0.19692609459161758,
|
||
|
|
"num_tokens": 6954878.0,
|
||
|
|
"step": 2890
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.703550624847412,
|
||
|
|
"epoch": 0.18613772262585995,
|
||
|
|
"grad_norm": 0.93359375,
|
||
|
|
"learning_rate": 0.00018477754771702165,
|
||
|
|
"loss": 5.3421,
|
||
|
|
"mean_token_accuracy": 0.19770172238349915,
|
||
|
|
"num_tokens": 6967127.0,
|
||
|
|
"step": 2895
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.713476133346558,
|
||
|
|
"epoch": 0.1864592040120877,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00018369955452510506,
|
||
|
|
"loss": 5.3583,
|
||
|
|
"mean_token_accuracy": 0.18674176931381226,
|
||
|
|
"num_tokens": 6978781.0,
|
||
|
|
"step": 2900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.767842483520508,
|
||
|
|
"epoch": 0.18678068539831544,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0001826240643810212,
|
||
|
|
"loss": 5.4879,
|
||
|
|
"mean_token_accuracy": 0.17964973002672197,
|
||
|
|
"num_tokens": 6991969.0,
|
||
|
|
"step": 2905
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.681934356689453,
|
||
|
|
"epoch": 0.18710216678454317,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 0.0001815511067698758,
|
||
|
|
"loss": 5.3598,
|
||
|
|
"mean_token_accuracy": 0.1911593720316887,
|
||
|
|
"num_tokens": 7004705.0,
|
||
|
|
"step": 2910
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.745440101623535,
|
||
|
|
"epoch": 0.18742364817077092,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.0001804807111073436,
|
||
|
|
"loss": 5.3456,
|
||
|
|
"mean_token_accuracy": 0.19167290329933168,
|
||
|
|
"num_tokens": 7015951.0,
|
||
|
|
"step": 2915
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.674161338806153,
|
||
|
|
"epoch": 0.18774512955699865,
|
||
|
|
"grad_norm": 0.96875,
|
||
|
|
"learning_rate": 0.0001794129067388625,
|
||
|
|
"loss": 5.2976,
|
||
|
|
"mean_token_accuracy": 0.20162287950515748,
|
||
|
|
"num_tokens": 7027585.0,
|
||
|
|
"step": 2920
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.61113977432251,
|
||
|
|
"epoch": 0.18806661094322638,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.00017834772293882868,
|
||
|
|
"loss": 5.256,
|
||
|
|
"mean_token_accuracy": 0.20131248235702515,
|
||
|
|
"num_tokens": 7040313.0,
|
||
|
|
"step": 2925
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6370405673980715,
|
||
|
|
"epoch": 0.18838809232945414,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 0.000177285188909794,
|
||
|
|
"loss": 5.3169,
|
||
|
|
"mean_token_accuracy": 0.19531358480453492,
|
||
|
|
"num_tokens": 7052435.0,
|
||
|
|
"step": 2930
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.634557580947876,
|
||
|
|
"epoch": 0.18870957371568187,
|
||
|
|
"grad_norm": 0.90625,
|
||
|
|
"learning_rate": 0.0001762253337816656,
|
||
|
|
"loss": 5.2732,
|
||
|
|
"mean_token_accuracy": 0.19889160394668579,
|
||
|
|
"num_tokens": 7066002.0,
|
||
|
|
"step": 2935
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.686793994903565,
|
||
|
|
"epoch": 0.1890310551019096,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00017516818661090738,
|
||
|
|
"loss": 5.3494,
|
||
|
|
"mean_token_accuracy": 0.1903778240084648,
|
||
|
|
"num_tokens": 7078137.0,
|
||
|
|
"step": 2940
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.713859176635742,
|
||
|
|
"epoch": 0.18935253648813732,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.0001741137763797428,
|
||
|
|
"loss": 5.3215,
|
||
|
|
"mean_token_accuracy": 0.1975012868642807,
|
||
|
|
"num_tokens": 7089664.0,
|
||
|
|
"step": 2945
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.741861629486084,
|
||
|
|
"epoch": 0.18967401787436508,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.00017306213199536115,
|
||
|
|
"loss": 5.4394,
|
||
|
|
"mean_token_accuracy": 0.18675171881914138,
|
||
|
|
"num_tokens": 7102497.0,
|
||
|
|
"step": 2950
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.641637468338013,
|
||
|
|
"epoch": 0.1899954992605928,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0001720132822891243,
|
||
|
|
"loss": 5.341,
|
||
|
|
"mean_token_accuracy": 0.19709572196006775,
|
||
|
|
"num_tokens": 7114508.0,
|
||
|
|
"step": 2955
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6888528823852536,
|
||
|
|
"epoch": 0.19031698064682054,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 0.0001709672560157769,
|
||
|
|
"loss": 5.4426,
|
||
|
|
"mean_token_accuracy": 0.18821884840726852,
|
||
|
|
"num_tokens": 7128009.0,
|
||
|
|
"step": 2960
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6601934909820555,
|
||
|
|
"epoch": 0.1906384620330483,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.00016992408185265758,
|
||
|
|
"loss": 5.2646,
|
||
|
|
"mean_token_accuracy": 0.20210227966308594,
|
||
|
|
"num_tokens": 7140331.0,
|
||
|
|
"step": 2965
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.7810698509216305,
|
||
|
|
"epoch": 0.19095994341927602,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.00016888378839891298,
|
||
|
|
"loss": 5.497,
|
||
|
|
"mean_token_accuracy": 0.18689459413290024,
|
||
|
|
"num_tokens": 7151371.0,
|
||
|
|
"step": 2970
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.642335271835327,
|
||
|
|
"epoch": 0.19128142480550375,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0001678464041747137,
|
||
|
|
"loss": 5.2909,
|
||
|
|
"mean_token_accuracy": 0.20328755527734757,
|
||
|
|
"num_tokens": 7163298.0,
|
||
|
|
"step": 2975
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.702846956253052,
|
||
|
|
"epoch": 0.1916029061917315,
|
||
|
|
"grad_norm": 0.984375,
|
||
|
|
"learning_rate": 0.00016681195762047223,
|
||
|
|
"loss": 5.3708,
|
||
|
|
"mean_token_accuracy": 0.1930597633123398,
|
||
|
|
"num_tokens": 7175076.0,
|
||
|
|
"step": 2980
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.635656023025513,
|
||
|
|
"epoch": 0.19192438757795924,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.00016578047709606337,
|
||
|
|
"loss": 5.2793,
|
||
|
|
"mean_token_accuracy": 0.1982986733317375,
|
||
|
|
"num_tokens": 7186086.0,
|
||
|
|
"step": 2985
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.638657474517823,
|
||
|
|
"epoch": 0.19224586896418697,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.00016475199088004678,
|
||
|
|
"loss": 5.3208,
|
||
|
|
"mean_token_accuracy": 0.19765783697366715,
|
||
|
|
"num_tokens": 7197877.0,
|
||
|
|
"step": 2990
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.741225624084473,
|
||
|
|
"epoch": 0.19256735035041472,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00016372652716889163,
|
||
|
|
"loss": 5.3174,
|
||
|
|
"mean_token_accuracy": 0.1919741615653038,
|
||
|
|
"num_tokens": 7209694.0,
|
||
|
|
"step": 2995
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.681012868881226,
|
||
|
|
"epoch": 0.19288883173664245,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0001627041140762035,
|
||
|
|
"loss": 5.3563,
|
||
|
|
"mean_token_accuracy": 0.1928807780146599,
|
||
|
|
"num_tokens": 7222238.0,
|
||
|
|
"step": 3000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.672075700759888,
|
||
|
|
"epoch": 0.19321031312287018,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.00016168477963195382,
|
||
|
|
"loss": 5.3286,
|
||
|
|
"mean_token_accuracy": 0.19123267829418183,
|
||
|
|
"num_tokens": 7234645.0,
|
||
|
|
"step": 3005
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.554755353927613,
|
||
|
|
"epoch": 0.1935317945090979,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.0001606685517817114,
|
||
|
|
"loss": 5.2674,
|
||
|
|
"mean_token_accuracy": 0.20121576339006425,
|
||
|
|
"num_tokens": 7246847.0,
|
||
|
|
"step": 3010
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.72060718536377,
|
||
|
|
"epoch": 0.19385327589532567,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.00015965545838587592,
|
||
|
|
"loss": 5.418,
|
||
|
|
"mean_token_accuracy": 0.18845782727003096,
|
||
|
|
"num_tokens": 7259014.0,
|
||
|
|
"step": 3015
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.735719633102417,
|
||
|
|
"epoch": 0.1941747572815534,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00015864552721891467,
|
||
|
|
"loss": 5.3366,
|
||
|
|
"mean_token_accuracy": 0.19298373609781266,
|
||
|
|
"num_tokens": 7270797.0,
|
||
|
|
"step": 3020
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.699824428558349,
|
||
|
|
"epoch": 0.19449623866778112,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.00015763878596860076,
|
||
|
|
"loss": 5.3539,
|
||
|
|
"mean_token_accuracy": 0.19396004527807237,
|
||
|
|
"num_tokens": 7283464.0,
|
||
|
|
"step": 3025
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.7045598983764645,
|
||
|
|
"epoch": 0.19481772005400888,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.00015663526223525412,
|
||
|
|
"loss": 5.3358,
|
||
|
|
"mean_token_accuracy": 0.19428735822439194,
|
||
|
|
"num_tokens": 7295472.0,
|
||
|
|
"step": 3030
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.7908977508544925,
|
||
|
|
"epoch": 0.1951392014402366,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.0001556349835309848,
|
||
|
|
"loss": 5.4155,
|
||
|
|
"mean_token_accuracy": 0.1899193584918976,
|
||
|
|
"num_tokens": 7307284.0,
|
||
|
|
"step": 3035
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.668297529220581,
|
||
|
|
"epoch": 0.19546068282646434,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0001546379772789389,
|
||
|
|
"loss": 5.2233,
|
||
|
|
"mean_token_accuracy": 0.20834969729185104,
|
||
|
|
"num_tokens": 7317922.0,
|
||
|
|
"step": 3040
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.677731895446778,
|
||
|
|
"epoch": 0.1957821642126921,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.00015364427081254622,
|
||
|
|
"loss": 5.2993,
|
||
|
|
"mean_token_accuracy": 0.19774854481220244,
|
||
|
|
"num_tokens": 7328096.0,
|
||
|
|
"step": 3045
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.662015008926391,
|
||
|
|
"epoch": 0.19610364559891982,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00015265389137477165,
|
||
|
|
"loss": 5.268,
|
||
|
|
"mean_token_accuracy": 0.1995667800307274,
|
||
|
|
"num_tokens": 7339326.0,
|
||
|
|
"step": 3050
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.68407244682312,
|
||
|
|
"epoch": 0.19642512698514755,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00015166686611736786,
|
||
|
|
"loss": 5.2963,
|
||
|
|
"mean_token_accuracy": 0.19593835026025772,
|
||
|
|
"num_tokens": 7351609.0,
|
||
|
|
"step": 3055
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.697849941253662,
|
||
|
|
"epoch": 0.1967466083713753,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.00015068322210013064,
|
||
|
|
"loss": 5.419,
|
||
|
|
"mean_token_accuracy": 0.19606532007455826,
|
||
|
|
"num_tokens": 7364141.0,
|
||
|
|
"step": 3060
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.654123401641845,
|
||
|
|
"epoch": 0.19706808975760304,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0001497029862901578,
|
||
|
|
"loss": 5.3209,
|
||
|
|
"mean_token_accuracy": 0.19135044813156127,
|
||
|
|
"num_tokens": 7376237.0,
|
||
|
|
"step": 3065
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.627373838424683,
|
||
|
|
"epoch": 0.19738957114383077,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.00014872618556110905,
|
||
|
|
"loss": 5.3049,
|
||
|
|
"mean_token_accuracy": 0.20300978869199754,
|
||
|
|
"num_tokens": 7387889.0,
|
||
|
|
"step": 3070
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.688027000427246,
|
||
|
|
"epoch": 0.19771105253005852,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.00014775284669246992,
|
||
|
|
"loss": 5.331,
|
||
|
|
"mean_token_accuracy": 0.18905219733715056,
|
||
|
|
"num_tokens": 7400112.0,
|
||
|
|
"step": 3075
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.670854139328003,
|
||
|
|
"epoch": 0.19803253391628625,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.00014678299636881716,
|
||
|
|
"loss": 5.3309,
|
||
|
|
"mean_token_accuracy": 0.19328058809041976,
|
||
|
|
"num_tokens": 7411680.0,
|
||
|
|
"step": 3080
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.685283565521241,
|
||
|
|
"epoch": 0.19835401530251398,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0001458166611790873,
|
||
|
|
"loss": 5.3046,
|
||
|
|
"mean_token_accuracy": 0.20481374114751816,
|
||
|
|
"num_tokens": 7424347.0,
|
||
|
|
"step": 3085
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.684451770782471,
|
||
|
|
"epoch": 0.1986754966887417,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00014485386761584773,
|
||
|
|
"loss": 5.3678,
|
||
|
|
"mean_token_accuracy": 0.1958083614706993,
|
||
|
|
"num_tokens": 7436970.0,
|
||
|
|
"step": 3090
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.679118394851685,
|
||
|
|
"epoch": 0.19899697807496947,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00014389464207457042,
|
||
|
|
"loss": 5.3415,
|
||
|
|
"mean_token_accuracy": 0.1933901235461235,
|
||
|
|
"num_tokens": 7449175.0,
|
||
|
|
"step": 3095
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.581226062774658,
|
||
|
|
"epoch": 0.1993184594611972,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00014293901085290795,
|
||
|
|
"loss": 5.184,
|
||
|
|
"mean_token_accuracy": 0.20435071289539336,
|
||
|
|
"num_tokens": 7460265.0,
|
||
|
|
"step": 3100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.73956184387207,
|
||
|
|
"epoch": 0.19963994084742492,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.00014198700014997307,
|
||
|
|
"loss": 5.3586,
|
||
|
|
"mean_token_accuracy": 0.18684755712747575,
|
||
|
|
"num_tokens": 7472386.0,
|
||
|
|
"step": 3105
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.664403581619263,
|
||
|
|
"epoch": 0.19996142223365268,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.00014103863606562016,
|
||
|
|
"loss": 5.2671,
|
||
|
|
"mean_token_accuracy": 0.19611046761274337,
|
||
|
|
"num_tokens": 7484744.0,
|
||
|
|
"step": 3110
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.575774908065796,
|
||
|
|
"epoch": 0.2002829036198804,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00014009394459972964,
|
||
|
|
"loss": 5.207,
|
||
|
|
"mean_token_accuracy": 0.20065230876207352,
|
||
|
|
"num_tokens": 7497192.0,
|
||
|
|
"step": 3115
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.672440433502198,
|
||
|
|
"epoch": 0.20060438500610814,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.00013915295165149513,
|
||
|
|
"loss": 5.3602,
|
||
|
|
"mean_token_accuracy": 0.19334883540868758,
|
||
|
|
"num_tokens": 7508452.0,
|
||
|
|
"step": 3120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.681038522720337,
|
||
|
|
"epoch": 0.2009258663923359,
|
||
|
|
"grad_norm": 0.94140625,
|
||
|
|
"learning_rate": 0.00013821568301871384,
|
||
|
|
"loss": 5.3319,
|
||
|
|
"mean_token_accuracy": 0.1971898540854454,
|
||
|
|
"num_tokens": 7520008.0,
|
||
|
|
"step": 3125
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.689389419555664,
|
||
|
|
"epoch": 0.20124734777856362,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.00013728216439707862,
|
||
|
|
"loss": 5.3724,
|
||
|
|
"mean_token_accuracy": 0.18985050767660142,
|
||
|
|
"num_tokens": 7532848.0,
|
||
|
|
"step": 3130
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6600761890411375,
|
||
|
|
"epoch": 0.20156882916479135,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.00013635242137947419,
|
||
|
|
"loss": 5.2898,
|
||
|
|
"mean_token_accuracy": 0.19827569723129274,
|
||
|
|
"num_tokens": 7543961.0,
|
||
|
|
"step": 3135
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.658891868591309,
|
||
|
|
"epoch": 0.2018903105510191,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00013542647945527498,
|
||
|
|
"loss": 5.2408,
|
||
|
|
"mean_token_accuracy": 0.20192974507808686,
|
||
|
|
"num_tokens": 7554441.0,
|
||
|
|
"step": 3140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.659081697463989,
|
||
|
|
"epoch": 0.20221179193724684,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0001345043640096465,
|
||
|
|
"loss": 5.2913,
|
||
|
|
"mean_token_accuracy": 0.20584864318370819,
|
||
|
|
"num_tokens": 7565956.0,
|
||
|
|
"step": 3145
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.717943859100342,
|
||
|
|
"epoch": 0.20253327332347457,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00013358610032284957,
|
||
|
|
"loss": 5.3432,
|
||
|
|
"mean_token_accuracy": 0.2040042608976364,
|
||
|
|
"num_tokens": 7577782.0,
|
||
|
|
"step": 3150
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.623188591003418,
|
||
|
|
"epoch": 0.2028547547097023,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.000132671713569547,
|
||
|
|
"loss": 5.3276,
|
||
|
|
"mean_token_accuracy": 0.19923162013292312,
|
||
|
|
"num_tokens": 7589655.0,
|
||
|
|
"step": 3155
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.583046531677246,
|
||
|
|
"epoch": 0.20317623609593005,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.0001317612288181136,
|
||
|
|
"loss": 5.2463,
|
||
|
|
"mean_token_accuracy": 0.20462400913238527,
|
||
|
|
"num_tokens": 7600490.0,
|
||
|
|
"step": 3160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.692988920211792,
|
||
|
|
"epoch": 0.20349771748215778,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.00013085467102994864,
|
||
|
|
"loss": 5.3433,
|
||
|
|
"mean_token_accuracy": 0.19690002948045732,
|
||
|
|
"num_tokens": 7611956.0,
|
||
|
|
"step": 3165
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.632165908813477,
|
||
|
|
"epoch": 0.2038191988683855,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.00012995206505879198,
|
||
|
|
"loss": 5.2644,
|
||
|
|
"mean_token_accuracy": 0.20063740164041519,
|
||
|
|
"num_tokens": 7623525.0,
|
||
|
|
"step": 3170
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.647959756851196,
|
||
|
|
"epoch": 0.20414068025461327,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0001290534356500421,
|
||
|
|
"loss": 5.325,
|
||
|
|
"mean_token_accuracy": 0.19781199842691422,
|
||
|
|
"num_tokens": 7634902.0,
|
||
|
|
"step": 3175
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.669277858734131,
|
||
|
|
"epoch": 0.204462161640841,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.00012815880744007827,
|
||
|
|
"loss": 5.3885,
|
||
|
|
"mean_token_accuracy": 0.19175426363945008,
|
||
|
|
"num_tokens": 7646891.0,
|
||
|
|
"step": 3180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.613622045516967,
|
||
|
|
"epoch": 0.20478364302706872,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.00012726820495558483,
|
||
|
|
"loss": 5.2312,
|
||
|
|
"mean_token_accuracy": 0.20127549767494202,
|
||
|
|
"num_tokens": 7659625.0,
|
||
|
|
"step": 3185
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.688162469863892,
|
||
|
|
"epoch": 0.20510512441329648,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.00012638165261287868,
|
||
|
|
"loss": 5.3102,
|
||
|
|
"mean_token_accuracy": 0.19467726051807405,
|
||
|
|
"num_tokens": 7670963.0,
|
||
|
|
"step": 3190
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.710018157958984,
|
||
|
|
"epoch": 0.2054266057995242,
|
||
|
|
"grad_norm": 0.9375,
|
||
|
|
"learning_rate": 0.0001254991747172402,
|
||
|
|
"loss": 5.3201,
|
||
|
|
"mean_token_accuracy": 0.19359399229288102,
|
||
|
|
"num_tokens": 7683556.0,
|
||
|
|
"step": 3195
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.727203845977783,
|
||
|
|
"epoch": 0.20574808718575194,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00012462079546224662,
|
||
|
|
"loss": 5.3106,
|
||
|
|
"mean_token_accuracy": 0.1922787219285965,
|
||
|
|
"num_tokens": 7695290.0,
|
||
|
|
"step": 3200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.688492345809936,
|
||
|
|
"epoch": 0.2060695685719797,
|
||
|
|
"grad_norm": 0.984375,
|
||
|
|
"learning_rate": 0.00012374653892910896,
|
||
|
|
"loss": 5.3365,
|
||
|
|
"mean_token_accuracy": 0.19461656212806702,
|
||
|
|
"num_tokens": 7707925.0,
|
||
|
|
"step": 3205
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.638540601730346,
|
||
|
|
"epoch": 0.20639104995820742,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.00012287642908601166,
|
||
|
|
"loss": 5.2965,
|
||
|
|
"mean_token_accuracy": 0.1947594776749611,
|
||
|
|
"num_tokens": 7719105.0,
|
||
|
|
"step": 3210
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.700093841552734,
|
||
|
|
"epoch": 0.20671253134443515,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.00012201048978745569,
|
||
|
|
"loss": 5.3787,
|
||
|
|
"mean_token_accuracy": 0.19443995952606202,
|
||
|
|
"num_tokens": 7731453.0,
|
||
|
|
"step": 3215
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.695550537109375,
|
||
|
|
"epoch": 0.20703401273066288,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.00012114874477360427,
|
||
|
|
"loss": 5.2958,
|
||
|
|
"mean_token_accuracy": 0.19526378214359283,
|
||
|
|
"num_tokens": 7743063.0,
|
||
|
|
"step": 3220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.717733478546142,
|
||
|
|
"epoch": 0.20735549411689064,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.00012029121766963236,
|
||
|
|
"loss": 5.3553,
|
||
|
|
"mean_token_accuracy": 0.1992946445941925,
|
||
|
|
"num_tokens": 7755356.0,
|
||
|
|
"step": 3225
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.795975112915039,
|
||
|
|
"epoch": 0.20767697550311837,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.00011943793198507858,
|
||
|
|
"loss": 5.3953,
|
||
|
|
"mean_token_accuracy": 0.19271425604820253,
|
||
|
|
"num_tokens": 7768025.0,
|
||
|
|
"step": 3230
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.725104808807373,
|
||
|
|
"epoch": 0.2079984568893461,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.00011858891111320104,
|
||
|
|
"loss": 5.2853,
|
||
|
|
"mean_token_accuracy": 0.19714273661375045,
|
||
|
|
"num_tokens": 7779116.0,
|
||
|
|
"step": 3235
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.64580020904541,
|
||
|
|
"epoch": 0.20831993827557385,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.0001177441783303359,
|
||
|
|
"loss": 5.3008,
|
||
|
|
"mean_token_accuracy": 0.1985606610774994,
|
||
|
|
"num_tokens": 7790716.0,
|
||
|
|
"step": 3240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.586145257949829,
|
||
|
|
"epoch": 0.20864141966180158,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00011690375679525896,
|
||
|
|
"loss": 5.2532,
|
||
|
|
"mean_token_accuracy": 0.20313566774129868,
|
||
|
|
"num_tokens": 7802144.0,
|
||
|
|
"step": 3245
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.678852701187134,
|
||
|
|
"epoch": 0.2089629010480293,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.00011606766954855124,
|
||
|
|
"loss": 5.3082,
|
||
|
|
"mean_token_accuracy": 0.19698686450719832,
|
||
|
|
"num_tokens": 7813642.0,
|
||
|
|
"step": 3250
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.66460862159729,
|
||
|
|
"epoch": 0.20928438243425707,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.00011523593951196702,
|
||
|
|
"loss": 5.39,
|
||
|
|
"mean_token_accuracy": 0.19884335845708848,
|
||
|
|
"num_tokens": 7826907.0,
|
||
|
|
"step": 3255
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.729547786712646,
|
||
|
|
"epoch": 0.2096058638204848,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.00011440858948780523,
|
||
|
|
"loss": 5.3696,
|
||
|
|
"mean_token_accuracy": 0.19547089338302612,
|
||
|
|
"num_tokens": 7838759.0,
|
||
|
|
"step": 3260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.720437288284302,
|
||
|
|
"epoch": 0.20992734520671252,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00011358564215828484,
|
||
|
|
"loss": 5.3419,
|
||
|
|
"mean_token_accuracy": 0.2006166860461235,
|
||
|
|
"num_tokens": 7851068.0,
|
||
|
|
"step": 3265
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6538135528564455,
|
||
|
|
"epoch": 0.21024882659294028,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 0.00011276712008492254,
|
||
|
|
"loss": 5.2546,
|
||
|
|
"mean_token_accuracy": 0.2034711644053459,
|
||
|
|
"num_tokens": 7862350.0,
|
||
|
|
"step": 3270
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.773383378982544,
|
||
|
|
"epoch": 0.210570307979168,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.00011195304570791451,
|
||
|
|
"loss": 5.4083,
|
||
|
|
"mean_token_accuracy": 0.1907842993736267,
|
||
|
|
"num_tokens": 7873570.0,
|
||
|
|
"step": 3275
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.785184001922607,
|
||
|
|
"epoch": 0.21089178936539574,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.00011114344134552094,
|
||
|
|
"loss": 5.4345,
|
||
|
|
"mean_token_accuracy": 0.18734802007675172,
|
||
|
|
"num_tokens": 7885614.0,
|
||
|
|
"step": 3280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.783140087127686,
|
||
|
|
"epoch": 0.2112132707516235,
|
||
|
|
"grad_norm": 0.94140625,
|
||
|
|
"learning_rate": 0.0001103383291934545,
|
||
|
|
"loss": 5.3579,
|
||
|
|
"mean_token_accuracy": 0.19588245898485185,
|
||
|
|
"num_tokens": 7898806.0,
|
||
|
|
"step": 3285
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.677266359329224,
|
||
|
|
"epoch": 0.21153475213785122,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.00010953773132427141,
|
||
|
|
"loss": 5.333,
|
||
|
|
"mean_token_accuracy": 0.1972532168030739,
|
||
|
|
"num_tokens": 7910284.0,
|
||
|
|
"step": 3290
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.685740852355957,
|
||
|
|
"epoch": 0.21185623352407895,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.00010874166968676677,
|
||
|
|
"loss": 5.2676,
|
||
|
|
"mean_token_accuracy": 0.19928796738386154,
|
||
|
|
"num_tokens": 7922883.0,
|
||
|
|
"step": 3295
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.74858341217041,
|
||
|
|
"epoch": 0.21217771491030668,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.00010795016610537251,
|
||
|
|
"loss": 5.358,
|
||
|
|
"mean_token_accuracy": 0.18693713545799256,
|
||
|
|
"num_tokens": 7934613.0,
|
||
|
|
"step": 3300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.638466262817383,
|
||
|
|
"epoch": 0.21249919629653444,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.00010716324227955904,
|
||
|
|
"loss": 5.2766,
|
||
|
|
"mean_token_accuracy": 0.2001914605498314,
|
||
|
|
"num_tokens": 7947134.0,
|
||
|
|
"step": 3305
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.676190614700317,
|
||
|
|
"epoch": 0.21282067768276217,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.0001063809197832406,
|
||
|
|
"loss": 5.2851,
|
||
|
|
"mean_token_accuracy": 0.19636294841766358,
|
||
|
|
"num_tokens": 7959563.0,
|
||
|
|
"step": 3310
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.715634822845459,
|
||
|
|
"epoch": 0.2131421590689899,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00010560322006418368,
|
||
|
|
"loss": 5.3292,
|
||
|
|
"mean_token_accuracy": 0.19672561585903167,
|
||
|
|
"num_tokens": 7972550.0,
|
||
|
|
"step": 3315
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.786555004119873,
|
||
|
|
"epoch": 0.21346364045521765,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.00010483016444341887,
|
||
|
|
"loss": 5.4613,
|
||
|
|
"mean_token_accuracy": 0.18897956758737564,
|
||
|
|
"num_tokens": 7984571.0,
|
||
|
|
"step": 3320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.723170375823974,
|
||
|
|
"epoch": 0.21378512184144538,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.00010406177411465654,
|
||
|
|
"loss": 5.3174,
|
||
|
|
"mean_token_accuracy": 0.19568678438663484,
|
||
|
|
"num_tokens": 7996838.0,
|
||
|
|
"step": 3325
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6796191215515135,
|
||
|
|
"epoch": 0.2141066032276731,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.00010329807014370562,
|
||
|
|
"loss": 5.3067,
|
||
|
|
"mean_token_accuracy": 0.19560860246419906,
|
||
|
|
"num_tokens": 8008890.0,
|
||
|
|
"step": 3330
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.673989295959473,
|
||
|
|
"epoch": 0.21442808461390087,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.00010253907346789632,
|
||
|
|
"loss": 5.3263,
|
||
|
|
"mean_token_accuracy": 0.20047852993011475,
|
||
|
|
"num_tokens": 8020205.0,
|
||
|
|
"step": 3335
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.657972002029419,
|
||
|
|
"epoch": 0.2147495660001286,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.00010178480489550596,
|
||
|
|
"loss": 5.2956,
|
||
|
|
"mean_token_accuracy": 0.1933861941099167,
|
||
|
|
"num_tokens": 8032281.0,
|
||
|
|
"step": 3340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.693986272811889,
|
||
|
|
"epoch": 0.21507104738635632,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.00010103528510518836,
|
||
|
|
"loss": 5.3529,
|
||
|
|
"mean_token_accuracy": 0.20255055129528046,
|
||
|
|
"num_tokens": 8045418.0,
|
||
|
|
"step": 3345
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.753715753555298,
|
||
|
|
"epoch": 0.21539252877258408,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.0001002905346454073,
|
||
|
|
"loss": 5.4235,
|
||
|
|
"mean_token_accuracy": 0.19115626215934753,
|
||
|
|
"num_tokens": 8058037.0,
|
||
|
|
"step": 3350
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.640271711349487,
|
||
|
|
"epoch": 0.2157140101588118,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 9.955057393387285e-05,
|
||
|
|
"loss": 5.1694,
|
||
|
|
"mean_token_accuracy": 0.20374646037817,
|
||
|
|
"num_tokens": 8071108.0,
|
||
|
|
"step": 3355
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6541835308074955,
|
||
|
|
"epoch": 0.21603549154503954,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 9.88154232569816e-05,
|
||
|
|
"loss": 5.2434,
|
||
|
|
"mean_token_accuracy": 0.1991315320134163,
|
||
|
|
"num_tokens": 8082613.0,
|
||
|
|
"step": 3360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.688753509521485,
|
||
|
|
"epoch": 0.21635697293126727,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 9.808510276926075e-05,
|
||
|
|
"loss": 5.3123,
|
||
|
|
"mean_token_accuracy": 0.20148408263921738,
|
||
|
|
"num_tokens": 8094636.0,
|
||
|
|
"step": 3365
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.68622522354126,
|
||
|
|
"epoch": 0.21667845431749502,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 9.735963249281549e-05,
|
||
|
|
"loss": 5.3377,
|
||
|
|
"mean_token_accuracy": 0.1978584349155426,
|
||
|
|
"num_tokens": 8106512.0,
|
||
|
|
"step": 3370
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6991785049438475,
|
||
|
|
"epoch": 0.21699993570372275,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 9.663903231677974e-05,
|
||
|
|
"loss": 5.3617,
|
||
|
|
"mean_token_accuracy": 0.19115650206804274,
|
||
|
|
"num_tokens": 8118904.0,
|
||
|
|
"step": 3375
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.630835056304932,
|
||
|
|
"epoch": 0.21732141708995048,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 9.592332199677145e-05,
|
||
|
|
"loss": 5.2108,
|
||
|
|
"mean_token_accuracy": 0.2114175707101822,
|
||
|
|
"num_tokens": 8131611.0,
|
||
|
|
"step": 3380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.720883512496949,
|
||
|
|
"epoch": 0.21764289847617824,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 9.521252115435061e-05,
|
||
|
|
"loss": 5.355,
|
||
|
|
"mean_token_accuracy": 0.19938598126173018,
|
||
|
|
"num_tokens": 8143623.0,
|
||
|
|
"step": 3385
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.703151082992553,
|
||
|
|
"epoch": 0.21796437986240597,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 9.450664927648126e-05,
|
||
|
|
"loss": 5.3145,
|
||
|
|
"mean_token_accuracy": 0.20495122224092482,
|
||
|
|
"num_tokens": 8154674.0,
|
||
|
|
"step": 3390
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.639169692993164,
|
||
|
|
"epoch": 0.2182858612486337,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 9.380572571499758e-05,
|
||
|
|
"loss": 5.2716,
|
||
|
|
"mean_token_accuracy": 0.2012424498796463,
|
||
|
|
"num_tokens": 8168228.0,
|
||
|
|
"step": 3395
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.694692230224609,
|
||
|
|
"epoch": 0.21860734263486145,
|
||
|
|
"grad_norm": 0.90625,
|
||
|
|
"learning_rate": 9.310976968607307e-05,
|
||
|
|
"loss": 5.3201,
|
||
|
|
"mean_token_accuracy": 0.2025172919034958,
|
||
|
|
"num_tokens": 8181542.0,
|
||
|
|
"step": 3400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.607951927185058,
|
||
|
|
"epoch": 0.21892882402108918,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 9.241880026969381e-05,
|
||
|
|
"loss": 5.2212,
|
||
|
|
"mean_token_accuracy": 0.20623093843460083,
|
||
|
|
"num_tokens": 8193864.0,
|
||
|
|
"step": 3405
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.776024293899536,
|
||
|
|
"epoch": 0.2192503054073169,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 9.173283640913537e-05,
|
||
|
|
"loss": 5.3334,
|
||
|
|
"mean_token_accuracy": 0.19746736735105513,
|
||
|
|
"num_tokens": 8205643.0,
|
||
|
|
"step": 3410
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.710318279266358,
|
||
|
|
"epoch": 0.21957178679354467,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 9.10518969104436e-05,
|
||
|
|
"loss": 5.3613,
|
||
|
|
"mean_token_accuracy": 0.1931696817278862,
|
||
|
|
"num_tokens": 8218422.0,
|
||
|
|
"step": 3415
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.750222301483154,
|
||
|
|
"epoch": 0.2198932681797724,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 9.037600044191868e-05,
|
||
|
|
"loss": 5.374,
|
||
|
|
"mean_token_accuracy": 0.1952086344361305,
|
||
|
|
"num_tokens": 8230715.0,
|
||
|
|
"step": 3420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.650337791442871,
|
||
|
|
"epoch": 0.22021474956600012,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 8.970516553360383e-05,
|
||
|
|
"loss": 5.2949,
|
||
|
|
"mean_token_accuracy": 0.1994039684534073,
|
||
|
|
"num_tokens": 8244217.0,
|
||
|
|
"step": 3425
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.720923995971679,
|
||
|
|
"epoch": 0.22053623095222788,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 8.903941057677692e-05,
|
||
|
|
"loss": 5.3614,
|
||
|
|
"mean_token_accuracy": 0.19820163398981094,
|
||
|
|
"num_tokens": 8254864.0,
|
||
|
|
"step": 3430
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.671401023864746,
|
||
|
|
"epoch": 0.2208577123384556,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 8.837875382344635e-05,
|
||
|
|
"loss": 5.3039,
|
||
|
|
"mean_token_accuracy": 0.20052341669797896,
|
||
|
|
"num_tokens": 8266485.0,
|
||
|
|
"step": 3435
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.707466506958008,
|
||
|
|
"epoch": 0.22117919372468334,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 8.772321338585076e-05,
|
||
|
|
"loss": 5.3375,
|
||
|
|
"mean_token_accuracy": 0.19078421592712402,
|
||
|
|
"num_tokens": 8278165.0,
|
||
|
|
"step": 3440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.644604349136353,
|
||
|
|
"epoch": 0.22150067511091107,
|
||
|
|
"grad_norm": 0.90234375,
|
||
|
|
"learning_rate": 8.707280723596242e-05,
|
||
|
|
"loss": 5.3229,
|
||
|
|
"mean_token_accuracy": 0.198736971616745,
|
||
|
|
"num_tokens": 8290550.0,
|
||
|
|
"step": 3445
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.713360023498535,
|
||
|
|
"epoch": 0.22182215649713882,
|
||
|
|
"grad_norm": 1.2265625,
|
||
|
|
"learning_rate": 8.64275532049944e-05,
|
||
|
|
"loss": 5.3825,
|
||
|
|
"mean_token_accuracy": 0.19561683386564255,
|
||
|
|
"num_tokens": 8302598.0,
|
||
|
|
"step": 3450
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.674613380432129,
|
||
|
|
"epoch": 0.22214363788336655,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 8.578746898291198e-05,
|
||
|
|
"loss": 5.2341,
|
||
|
|
"mean_token_accuracy": 0.20924482494592667,
|
||
|
|
"num_tokens": 8313815.0,
|
||
|
|
"step": 3455
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.679621362686158,
|
||
|
|
"epoch": 0.22246511926959428,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 8.515257211794742e-05,
|
||
|
|
"loss": 5.3707,
|
||
|
|
"mean_token_accuracy": 0.1968051165342331,
|
||
|
|
"num_tokens": 8326085.0,
|
||
|
|
"step": 3460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.658367347717285,
|
||
|
|
"epoch": 0.22278660065582204,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 8.452288001611896e-05,
|
||
|
|
"loss": 5.2588,
|
||
|
|
"mean_token_accuracy": 0.20085911750793456,
|
||
|
|
"num_tokens": 8338944.0,
|
||
|
|
"step": 3465
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.625350522994995,
|
||
|
|
"epoch": 0.22310808204204977,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 8.389840994075379e-05,
|
||
|
|
"loss": 5.2766,
|
||
|
|
"mean_token_accuracy": 0.2059040352702141,
|
||
|
|
"num_tokens": 8352715.0,
|
||
|
|
"step": 3470
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.687177991867065,
|
||
|
|
"epoch": 0.2234295634282775,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 8.327917901201435e-05,
|
||
|
|
"loss": 5.3275,
|
||
|
|
"mean_token_accuracy": 0.20172294080257416,
|
||
|
|
"num_tokens": 8364484.0,
|
||
|
|
"step": 3475
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.715560483932495,
|
||
|
|
"epoch": 0.22375104481450525,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 8.266520420642931e-05,
|
||
|
|
"loss": 5.2983,
|
||
|
|
"mean_token_accuracy": 0.19617073237895966,
|
||
|
|
"num_tokens": 8375733.0,
|
||
|
|
"step": 3480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.67339015007019,
|
||
|
|
"epoch": 0.22407252620073298,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 8.205650235642828e-05,
|
||
|
|
"loss": 5.2799,
|
||
|
|
"mean_token_accuracy": 0.20136843770742416,
|
||
|
|
"num_tokens": 8387418.0,
|
||
|
|
"step": 3485
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.650016260147095,
|
||
|
|
"epoch": 0.2243940075869607,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 8.145309014987978e-05,
|
||
|
|
"loss": 5.3297,
|
||
|
|
"mean_token_accuracy": 0.19268136769533156,
|
||
|
|
"num_tokens": 8399463.0,
|
||
|
|
"step": 3490
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.655723714828492,
|
||
|
|
"epoch": 0.22471548897318847,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 8.085498412963437e-05,
|
||
|
|
"loss": 5.2701,
|
||
|
|
"mean_token_accuracy": 0.20115672051906586,
|
||
|
|
"num_tokens": 8411769.0,
|
||
|
|
"step": 3495
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.651788568496704,
|
||
|
|
"epoch": 0.2250369703594162,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 8.026220069307078e-05,
|
||
|
|
"loss": 5.2304,
|
||
|
|
"mean_token_accuracy": 0.20759440511465072,
|
||
|
|
"num_tokens": 8423379.0,
|
||
|
|
"step": 3500
|
||
|
|
}
|
||
|
|
],
|
||
|
|
"logging_steps": 5,
|
||
|
|
"max_steps": 4000,
|
||
|
|
"num_input_tokens_seen": 0,
|
||
|
|
"num_train_epochs": 1,
|
||
|
|
"save_steps": 500,
|
||
|
|
"stateful_callbacks": {
|
||
|
|
"TrainerControl": {
|
||
|
|
"args": {
|
||
|
|
"should_epoch_stop": false,
|
||
|
|
"should_evaluate": false,
|
||
|
|
"should_log": false,
|
||
|
|
"should_save": true,
|
||
|
|
"should_training_stop": false
|
||
|
|
},
|
||
|
|
"attributes": {}
|
||
|
|
}
|
||
|
|
},
|
||
|
|
"total_flos": 1898359805214720.0,
|
||
|
|
"train_batch_size": 16,
|
||
|
|
"trial_name": null,
|
||
|
|
"trial_params": null
|
||
|
|
}
|