42112 lines
1.1 MiB
42112 lines
1.1 MiB
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 2.423542989036353,
|
|
"eval_steps": 3000,
|
|
"global_step": 21000,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 10.742519760131836,
|
|
"epoch": 0.0005770340450086555,
|
|
"grad_norm": 4.78125,
|
|
"learning_rate": 2e-06,
|
|
"loss": 10.7834,
|
|
"mean_token_accuracy": 0.0,
|
|
"num_tokens": 11955.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 10.742532062530518,
|
|
"epoch": 0.001154068090017311,
|
|
"grad_norm": 5.15625,
|
|
"learning_rate": 4.5e-06,
|
|
"loss": 10.7821,
|
|
"mean_token_accuracy": 7.552870083600282e-05,
|
|
"num_tokens": 24473.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 10.742538166046142,
|
|
"epoch": 0.0017311021350259665,
|
|
"grad_norm": 5.4375,
|
|
"learning_rate": 7e-06,
|
|
"loss": 10.7615,
|
|
"mean_token_accuracy": 0.00016723573207855225,
|
|
"num_tokens": 36716.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 10.742550373077393,
|
|
"epoch": 0.002308136180034622,
|
|
"grad_norm": 5.125,
|
|
"learning_rate": 9.5e-06,
|
|
"loss": 10.7088,
|
|
"mean_token_accuracy": 0.0010991264251060783,
|
|
"num_tokens": 49747.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 10.742451667785645,
|
|
"epoch": 0.0028851702250432777,
|
|
"grad_norm": 4.71875,
|
|
"learning_rate": 1.2e-05,
|
|
"loss": 10.6029,
|
|
"mean_token_accuracy": 0.01508477891329676,
|
|
"num_tokens": 61991.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 10.741979122161865,
|
|
"epoch": 0.003462204270051933,
|
|
"grad_norm": 3.875,
|
|
"learning_rate": 1.4500000000000002e-05,
|
|
"loss": 10.4994,
|
|
"mean_token_accuracy": 0.0400444071739912,
|
|
"num_tokens": 74918.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 10.740076923370362,
|
|
"epoch": 0.004039238315060588,
|
|
"grad_norm": 3.109375,
|
|
"learning_rate": 1.7000000000000003e-05,
|
|
"loss": 10.3732,
|
|
"mean_token_accuracy": 0.05369483157992363,
|
|
"num_tokens": 87833.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 10.733743858337402,
|
|
"epoch": 0.004616272360069244,
|
|
"grad_norm": 2.53125,
|
|
"learning_rate": 1.95e-05,
|
|
"loss": 10.2264,
|
|
"mean_token_accuracy": 0.0561745673418045,
|
|
"num_tokens": 101031.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 10.72265920639038,
|
|
"epoch": 0.0051933064050779,
|
|
"grad_norm": 2.296875,
|
|
"learning_rate": 2.2e-05,
|
|
"loss": 10.1107,
|
|
"mean_token_accuracy": 0.05086057800799608,
|
|
"num_tokens": 114085.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 10.712560367584228,
|
|
"epoch": 0.005770340450086555,
|
|
"grad_norm": 2.046875,
|
|
"learning_rate": 2.4500000000000003e-05,
|
|
"loss": 10.0728,
|
|
"mean_token_accuracy": 0.05095174703747034,
|
|
"num_tokens": 126190.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 10.708724021911621,
|
|
"epoch": 0.006347374495095211,
|
|
"grad_norm": 1.9453125,
|
|
"learning_rate": 2.7e-05,
|
|
"loss": 9.9872,
|
|
"mean_token_accuracy": 0.05040723979473114,
|
|
"num_tokens": 138933.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 10.705632781982422,
|
|
"epoch": 0.006924408540103866,
|
|
"grad_norm": 1.96875,
|
|
"learning_rate": 2.95e-05,
|
|
"loss": 9.9165,
|
|
"mean_token_accuracy": 0.05702933557331562,
|
|
"num_tokens": 150542.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 10.699434947967529,
|
|
"epoch": 0.0075014425851125215,
|
|
"grad_norm": 1.9609375,
|
|
"learning_rate": 3.2e-05,
|
|
"loss": 9.9117,
|
|
"mean_token_accuracy": 0.05192887857556343,
|
|
"num_tokens": 163507.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 10.691042518615722,
|
|
"epoch": 0.008078476630121177,
|
|
"grad_norm": 2.3125,
|
|
"learning_rate": 3.4500000000000005e-05,
|
|
"loss": 9.8663,
|
|
"mean_token_accuracy": 0.0556206401437521,
|
|
"num_tokens": 176668.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 10.68201036453247,
|
|
"epoch": 0.008655510675129832,
|
|
"grad_norm": 1.921875,
|
|
"learning_rate": 3.7e-05,
|
|
"loss": 9.8051,
|
|
"mean_token_accuracy": 0.05544878952205181,
|
|
"num_tokens": 191413.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 10.66737766265869,
|
|
"epoch": 0.009232544720138488,
|
|
"grad_norm": 1.859375,
|
|
"learning_rate": 3.95e-05,
|
|
"loss": 9.739,
|
|
"mean_token_accuracy": 0.06524630598723888,
|
|
"num_tokens": 204176.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 10.650106525421142,
|
|
"epoch": 0.009809578765147143,
|
|
"grad_norm": 2.015625,
|
|
"learning_rate": 4.2000000000000004e-05,
|
|
"loss": 9.6842,
|
|
"mean_token_accuracy": 0.06752815209329129,
|
|
"num_tokens": 216851.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 10.636476421356202,
|
|
"epoch": 0.0103866128101558,
|
|
"grad_norm": 1.8125,
|
|
"learning_rate": 4.45e-05,
|
|
"loss": 9.6572,
|
|
"mean_token_accuracy": 0.0653569109737873,
|
|
"num_tokens": 229621.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 10.622958183288574,
|
|
"epoch": 0.010963646855164455,
|
|
"grad_norm": 1.953125,
|
|
"learning_rate": 4.7000000000000004e-05,
|
|
"loss": 9.6025,
|
|
"mean_token_accuracy": 0.06540683954954148,
|
|
"num_tokens": 242074.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 10.592237091064453,
|
|
"epoch": 0.01154068090017311,
|
|
"grad_norm": 1.703125,
|
|
"learning_rate": 4.9500000000000004e-05,
|
|
"loss": 9.474,
|
|
"mean_token_accuracy": 0.07080609016120434,
|
|
"num_tokens": 254094.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 10.51324234008789,
|
|
"epoch": 0.012117714945181766,
|
|
"grad_norm": 2.046875,
|
|
"learning_rate": 5.2e-05,
|
|
"loss": 9.4787,
|
|
"mean_token_accuracy": 0.07307280339300633,
|
|
"num_tokens": 267560.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 10.503196525573731,
|
|
"epoch": 0.012694748990190421,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 5.45e-05,
|
|
"loss": 9.4426,
|
|
"mean_token_accuracy": 0.07156955860555173,
|
|
"num_tokens": 280717.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 10.523096179962158,
|
|
"epoch": 0.013271783035199077,
|
|
"grad_norm": 1.7421875,
|
|
"learning_rate": 5.7e-05,
|
|
"loss": 9.3915,
|
|
"mean_token_accuracy": 0.07147992886602879,
|
|
"num_tokens": 293856.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 10.484137058258057,
|
|
"epoch": 0.013848817080207732,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 5.9499999999999996e-05,
|
|
"loss": 9.2251,
|
|
"mean_token_accuracy": 0.07240887582302094,
|
|
"num_tokens": 305191.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 10.420050239562988,
|
|
"epoch": 0.014425851125216388,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 6.2e-05,
|
|
"loss": 9.2288,
|
|
"mean_token_accuracy": 0.07244622334837914,
|
|
"num_tokens": 318544.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 10.332412433624267,
|
|
"epoch": 0.015002885170225043,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 6.450000000000001e-05,
|
|
"loss": 9.0584,
|
|
"mean_token_accuracy": 0.08713233023881913,
|
|
"num_tokens": 331445.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 10.288755512237548,
|
|
"epoch": 0.015579919215233698,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 6.7e-05,
|
|
"loss": 9.0833,
|
|
"mean_token_accuracy": 0.07415068708360195,
|
|
"num_tokens": 344775.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 10.267962074279785,
|
|
"epoch": 0.016156953260242354,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 6.950000000000001e-05,
|
|
"loss": 8.9864,
|
|
"mean_token_accuracy": 0.07388804033398629,
|
|
"num_tokens": 357804.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 10.174692630767822,
|
|
"epoch": 0.01673398730525101,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 7.2e-05,
|
|
"loss": 8.8543,
|
|
"mean_token_accuracy": 0.08084411099553108,
|
|
"num_tokens": 369826.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 10.011744403839112,
|
|
"epoch": 0.017311021350259664,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 7.45e-05,
|
|
"loss": 8.7823,
|
|
"mean_token_accuracy": 0.08401374593377113,
|
|
"num_tokens": 382768.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 9.914338493347168,
|
|
"epoch": 0.01788805539526832,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 7.7e-05,
|
|
"loss": 8.7625,
|
|
"mean_token_accuracy": 0.08076213970780373,
|
|
"num_tokens": 395910.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 9.87332878112793,
|
|
"epoch": 0.018465089440276975,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 7.950000000000001e-05,
|
|
"loss": 8.725,
|
|
"mean_token_accuracy": 0.07417598105967045,
|
|
"num_tokens": 408140.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 9.752376747131347,
|
|
"epoch": 0.019042123485285632,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 8.2e-05,
|
|
"loss": 8.5835,
|
|
"mean_token_accuracy": 0.08260673955082894,
|
|
"num_tokens": 420486.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 9.501761531829834,
|
|
"epoch": 0.019619157530294286,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 8.450000000000001e-05,
|
|
"loss": 8.5107,
|
|
"mean_token_accuracy": 0.09241977110505104,
|
|
"num_tokens": 433207.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 9.351601791381835,
|
|
"epoch": 0.020196191575302943,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 8.7e-05,
|
|
"loss": 8.4638,
|
|
"mean_token_accuracy": 0.08450455963611603,
|
|
"num_tokens": 444880.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 9.297267818450928,
|
|
"epoch": 0.0207732256203116,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 8.95e-05,
|
|
"loss": 8.4926,
|
|
"mean_token_accuracy": 0.08199871554970742,
|
|
"num_tokens": 456650.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 9.096736717224122,
|
|
"epoch": 0.021350259665320254,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 9.2e-05,
|
|
"loss": 8.4572,
|
|
"mean_token_accuracy": 0.08327073007822036,
|
|
"num_tokens": 469667.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 9.029964542388916,
|
|
"epoch": 0.02192729371032891,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 9.45e-05,
|
|
"loss": 8.3783,
|
|
"mean_token_accuracy": 0.09304521456360818,
|
|
"num_tokens": 481952.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 8.89255895614624,
|
|
"epoch": 0.022504327755337564,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 9.7e-05,
|
|
"loss": 8.399,
|
|
"mean_token_accuracy": 0.09114565178751946,
|
|
"num_tokens": 494352.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 8.913476753234864,
|
|
"epoch": 0.02308136180034622,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 9.95e-05,
|
|
"loss": 8.3105,
|
|
"mean_token_accuracy": 0.0925761379301548,
|
|
"num_tokens": 506937.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 8.781428337097168,
|
|
"epoch": 0.023658395845354875,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.000102,
|
|
"loss": 8.303,
|
|
"mean_token_accuracy": 0.0928865760564804,
|
|
"num_tokens": 519552.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 8.800222492218017,
|
|
"epoch": 0.024235429890363532,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00010449999999999999,
|
|
"loss": 8.3412,
|
|
"mean_token_accuracy": 0.08962251469492913,
|
|
"num_tokens": 531359.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 8.806383419036866,
|
|
"epoch": 0.024812463935372186,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000107,
|
|
"loss": 8.3542,
|
|
"mean_token_accuracy": 0.09396427646279334,
|
|
"num_tokens": 544197.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 8.8606746673584,
|
|
"epoch": 0.025389497980380843,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0001095,
|
|
"loss": 8.3106,
|
|
"mean_token_accuracy": 0.09081738814711571,
|
|
"num_tokens": 556818.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 8.742358875274657,
|
|
"epoch": 0.025966532025389497,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.000112,
|
|
"loss": 8.3253,
|
|
"mean_token_accuracy": 0.0934368498623371,
|
|
"num_tokens": 569363.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 8.80865125656128,
|
|
"epoch": 0.026543566070398154,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0001145,
|
|
"loss": 8.3076,
|
|
"mean_token_accuracy": 0.09487870410084724,
|
|
"num_tokens": 581645.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 8.763648796081544,
|
|
"epoch": 0.027120600115406807,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.00011700000000000001,
|
|
"loss": 8.259,
|
|
"mean_token_accuracy": 0.08925148844718933,
|
|
"num_tokens": 593501.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 8.715390586853028,
|
|
"epoch": 0.027697634160415464,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00011949999999999999,
|
|
"loss": 8.2462,
|
|
"mean_token_accuracy": 0.09425812289118767,
|
|
"num_tokens": 606328.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 8.573129081726075,
|
|
"epoch": 0.02827466820542412,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000122,
|
|
"loss": 8.1457,
|
|
"mean_token_accuracy": 0.1065749242901802,
|
|
"num_tokens": 619003.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 8.62852210998535,
|
|
"epoch": 0.028851702250432775,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0001245,
|
|
"loss": 8.2725,
|
|
"mean_token_accuracy": 0.09227693155407905,
|
|
"num_tokens": 632910.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 8.616901016235351,
|
|
"epoch": 0.029428736295441432,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.000127,
|
|
"loss": 8.2065,
|
|
"mean_token_accuracy": 0.09859882518649102,
|
|
"num_tokens": 645959.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 8.623135948181153,
|
|
"epoch": 0.030005770340450086,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0001295,
|
|
"loss": 8.1911,
|
|
"mean_token_accuracy": 0.10357227995991707,
|
|
"num_tokens": 658620.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 8.548318576812743,
|
|
"epoch": 0.030582804385458743,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000132,
|
|
"loss": 8.1897,
|
|
"mean_token_accuracy": 0.10186770558357239,
|
|
"num_tokens": 670804.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 8.512144851684571,
|
|
"epoch": 0.031159838430467397,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.00013450000000000002,
|
|
"loss": 8.191,
|
|
"mean_token_accuracy": 0.09745052307844163,
|
|
"num_tokens": 683656.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 8.583205032348634,
|
|
"epoch": 0.031736872475476054,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00013700000000000002,
|
|
"loss": 8.1635,
|
|
"mean_token_accuracy": 0.10382118448615074,
|
|
"num_tokens": 696629.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 8.513082599639892,
|
|
"epoch": 0.03231390652048471,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0001395,
|
|
"loss": 8.1849,
|
|
"mean_token_accuracy": 0.0984301395714283,
|
|
"num_tokens": 709053.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 8.52897834777832,
|
|
"epoch": 0.03289094056549336,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00014199999999999998,
|
|
"loss": 8.1378,
|
|
"mean_token_accuracy": 0.101743233948946,
|
|
"num_tokens": 721947.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 8.485254192352295,
|
|
"epoch": 0.03346797461050202,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0001445,
|
|
"loss": 8.1318,
|
|
"mean_token_accuracy": 0.10095292180776597,
|
|
"num_tokens": 734495.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 8.4556489944458,
|
|
"epoch": 0.034045008655510675,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.000147,
|
|
"loss": 8.1574,
|
|
"mean_token_accuracy": 0.09864982217550278,
|
|
"num_tokens": 746965.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 8.541684627532959,
|
|
"epoch": 0.03462204270051933,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0001495,
|
|
"loss": 8.1759,
|
|
"mean_token_accuracy": 0.09848161116242408,
|
|
"num_tokens": 760105.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 8.439905643463135,
|
|
"epoch": 0.03519907674552799,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.000152,
|
|
"loss": 8.0742,
|
|
"mean_token_accuracy": 0.1082187220454216,
|
|
"num_tokens": 771765.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 8.54954652786255,
|
|
"epoch": 0.03577611079053664,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00015450000000000001,
|
|
"loss": 8.1565,
|
|
"mean_token_accuracy": 0.10081454515457153,
|
|
"num_tokens": 784895.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 8.430934238433839,
|
|
"epoch": 0.0363531448355453,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000157,
|
|
"loss": 8.0908,
|
|
"mean_token_accuracy": 0.10850713253021241,
|
|
"num_tokens": 797139.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 8.501363563537598,
|
|
"epoch": 0.03693017888055395,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0001595,
|
|
"loss": 8.0515,
|
|
"mean_token_accuracy": 0.11537543162703515,
|
|
"num_tokens": 809169.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 8.328963375091552,
|
|
"epoch": 0.03750721292556261,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.000162,
|
|
"loss": 8.1059,
|
|
"mean_token_accuracy": 0.10505361780524254,
|
|
"num_tokens": 821737.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 8.49581003189087,
|
|
"epoch": 0.038084246970571264,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00016450000000000001,
|
|
"loss": 8.019,
|
|
"mean_token_accuracy": 0.1122775912284851,
|
|
"num_tokens": 834365.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 8.393208026885986,
|
|
"epoch": 0.03866128101557992,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00016700000000000002,
|
|
"loss": 8.0675,
|
|
"mean_token_accuracy": 0.10942035019397736,
|
|
"num_tokens": 846445.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 8.460633182525635,
|
|
"epoch": 0.03923831506058857,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00016950000000000003,
|
|
"loss": 8.1142,
|
|
"mean_token_accuracy": 0.10697392895817756,
|
|
"num_tokens": 858558.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 8.396363449096679,
|
|
"epoch": 0.03981534910559723,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00017199999999999998,
|
|
"loss": 8.1058,
|
|
"mean_token_accuracy": 0.10723683908581734,
|
|
"num_tokens": 871209.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 8.491197395324708,
|
|
"epoch": 0.040392383150605886,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00017449999999999999,
|
|
"loss": 8.0555,
|
|
"mean_token_accuracy": 0.10949232503771782,
|
|
"num_tokens": 883270.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 8.352670478820801,
|
|
"epoch": 0.04096941719561454,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000177,
|
|
"loss": 8.0601,
|
|
"mean_token_accuracy": 0.10984272882342339,
|
|
"num_tokens": 895468.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 8.47718162536621,
|
|
"epoch": 0.0415464512406232,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0001795,
|
|
"loss": 8.0213,
|
|
"mean_token_accuracy": 0.11185759902000428,
|
|
"num_tokens": 907900.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 8.211096382141113,
|
|
"epoch": 0.042123485285631854,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000182,
|
|
"loss": 8.0331,
|
|
"mean_token_accuracy": 0.11285770758986473,
|
|
"num_tokens": 920036.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 8.389335536956787,
|
|
"epoch": 0.04270051933064051,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0001845,
|
|
"loss": 7.9946,
|
|
"mean_token_accuracy": 0.11674289256334305,
|
|
"num_tokens": 932525.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 8.290297317504884,
|
|
"epoch": 0.04327755337564916,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000187,
|
|
"loss": 7.9705,
|
|
"mean_token_accuracy": 0.11729388907551766,
|
|
"num_tokens": 943581.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 8.457341861724853,
|
|
"epoch": 0.04385458742065782,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0001895,
|
|
"loss": 8.0767,
|
|
"mean_token_accuracy": 0.10796716287732125,
|
|
"num_tokens": 956270.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 8.334104824066163,
|
|
"epoch": 0.044431621465666475,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.000192,
|
|
"loss": 8.0281,
|
|
"mean_token_accuracy": 0.11211411207914353,
|
|
"num_tokens": 967631.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 8.407048511505128,
|
|
"epoch": 0.04500865551067513,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0001945,
|
|
"loss": 8.037,
|
|
"mean_token_accuracy": 0.10723293125629425,
|
|
"num_tokens": 980999.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 8.267741298675537,
|
|
"epoch": 0.04558568955568378,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00019700000000000002,
|
|
"loss": 7.9457,
|
|
"mean_token_accuracy": 0.11497977301478386,
|
|
"num_tokens": 993404.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 8.311189937591553,
|
|
"epoch": 0.04616272360069244,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00019950000000000002,
|
|
"loss": 7.959,
|
|
"mean_token_accuracy": 0.11699348911643029,
|
|
"num_tokens": 1006009.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 8.301223659515381,
|
|
"epoch": 0.0467397576457011,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.000202,
|
|
"loss": 8.0537,
|
|
"mean_token_accuracy": 0.1106877088546753,
|
|
"num_tokens": 1019644.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 8.281110191345215,
|
|
"epoch": 0.04731679169070975,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.00020449999999999998,
|
|
"loss": 7.9529,
|
|
"mean_token_accuracy": 0.12168486937880515,
|
|
"num_tokens": 1032196.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 8.194720458984374,
|
|
"epoch": 0.04789382573571841,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000207,
|
|
"loss": 7.9104,
|
|
"mean_token_accuracy": 0.12571991384029388,
|
|
"num_tokens": 1044211.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 8.374266242980957,
|
|
"epoch": 0.048470859780727064,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0002095,
|
|
"loss": 7.9692,
|
|
"mean_token_accuracy": 0.11775951310992241,
|
|
"num_tokens": 1055743.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 8.280481624603272,
|
|
"epoch": 0.04904789382573572,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.000212,
|
|
"loss": 7.9728,
|
|
"mean_token_accuracy": 0.11407571211457253,
|
|
"num_tokens": 1068550.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 8.259190368652344,
|
|
"epoch": 0.04962492787074437,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0002145,
|
|
"loss": 7.876,
|
|
"mean_token_accuracy": 0.12458330690860749,
|
|
"num_tokens": 1079878.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 8.264352798461914,
|
|
"epoch": 0.05020196191575303,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00021700000000000002,
|
|
"loss": 7.9461,
|
|
"mean_token_accuracy": 0.11022370159626008,
|
|
"num_tokens": 1093331.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 8.320549201965331,
|
|
"epoch": 0.050778995960761686,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0002195,
|
|
"loss": 7.8988,
|
|
"mean_token_accuracy": 0.12245648875832557,
|
|
"num_tokens": 1105830.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 8.242807865142822,
|
|
"epoch": 0.05135603000577034,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.000222,
|
|
"loss": 7.9022,
|
|
"mean_token_accuracy": 0.1231141023337841,
|
|
"num_tokens": 1118071.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 8.150061178207398,
|
|
"epoch": 0.05193306405077899,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0002245,
|
|
"loss": 7.9205,
|
|
"mean_token_accuracy": 0.11648782640695572,
|
|
"num_tokens": 1129781.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 8.264570999145509,
|
|
"epoch": 0.052510098095787654,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00022700000000000002,
|
|
"loss": 7.9593,
|
|
"mean_token_accuracy": 0.11766693964600564,
|
|
"num_tokens": 1142750.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 8.244252777099609,
|
|
"epoch": 0.05308713214079631,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00022950000000000002,
|
|
"loss": 7.8898,
|
|
"mean_token_accuracy": 0.11929678991436958,
|
|
"num_tokens": 1154314.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 8.212209606170655,
|
|
"epoch": 0.05366416618580496,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00023200000000000003,
|
|
"loss": 7.9087,
|
|
"mean_token_accuracy": 0.12657537683844566,
|
|
"num_tokens": 1167199.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 8.202026081085204,
|
|
"epoch": 0.054241200230813615,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00023449999999999998,
|
|
"loss": 7.8846,
|
|
"mean_token_accuracy": 0.12224558740854263,
|
|
"num_tokens": 1179654.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 8.187808513641357,
|
|
"epoch": 0.054818234275822275,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.000237,
|
|
"loss": 7.867,
|
|
"mean_token_accuracy": 0.12207963541150094,
|
|
"num_tokens": 1190713.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 8.158800506591797,
|
|
"epoch": 0.05539526832083093,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0002395,
|
|
"loss": 7.8509,
|
|
"mean_token_accuracy": 0.12055787444114685,
|
|
"num_tokens": 1203881.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 8.259974384307862,
|
|
"epoch": 0.05597230236583958,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000242,
|
|
"loss": 7.9146,
|
|
"mean_token_accuracy": 0.11428983137011528,
|
|
"num_tokens": 1215795.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 8.06658124923706,
|
|
"epoch": 0.05654933641084824,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0002445,
|
|
"loss": 7.8294,
|
|
"mean_token_accuracy": 0.12558024376630783,
|
|
"num_tokens": 1227773.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 8.268111038208009,
|
|
"epoch": 0.0571263704558569,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000247,
|
|
"loss": 7.8281,
|
|
"mean_token_accuracy": 0.12732664570212365,
|
|
"num_tokens": 1240217.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 8.184942293167115,
|
|
"epoch": 0.05770340450086555,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0002495,
|
|
"loss": 7.8963,
|
|
"mean_token_accuracy": 0.12094444781541824,
|
|
"num_tokens": 1253324.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 8.097318315505982,
|
|
"epoch": 0.058280438545874204,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000252,
|
|
"loss": 7.8021,
|
|
"mean_token_accuracy": 0.11756076738238334,
|
|
"num_tokens": 1266007.0,
|
|
"step": 505
|
|
},
|
|
{
|
|
"entropy": 8.119937992095947,
|
|
"epoch": 0.058857472590882864,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0002545,
|
|
"loss": 7.8449,
|
|
"mean_token_accuracy": 0.12364009171724319,
|
|
"num_tokens": 1278403.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 8.165720081329345,
|
|
"epoch": 0.05943450663589152,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000257,
|
|
"loss": 7.8565,
|
|
"mean_token_accuracy": 0.12108651399612427,
|
|
"num_tokens": 1290352.0,
|
|
"step": 515
|
|
},
|
|
{
|
|
"entropy": 8.166333532333374,
|
|
"epoch": 0.06001154068090017,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0002595,
|
|
"loss": 7.8677,
|
|
"mean_token_accuracy": 0.11767618358135223,
|
|
"num_tokens": 1302304.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 8.154673862457276,
|
|
"epoch": 0.060588574725908825,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000262,
|
|
"loss": 7.8293,
|
|
"mean_token_accuracy": 0.1254723496735096,
|
|
"num_tokens": 1314014.0,
|
|
"step": 525
|
|
},
|
|
{
|
|
"entropy": 8.189765071868896,
|
|
"epoch": 0.061165608770917486,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00026450000000000003,
|
|
"loss": 7.8617,
|
|
"mean_token_accuracy": 0.11876866742968559,
|
|
"num_tokens": 1326751.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 8.086573696136474,
|
|
"epoch": 0.06174264281592614,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00026700000000000004,
|
|
"loss": 7.7429,
|
|
"mean_token_accuracy": 0.1276994377374649,
|
|
"num_tokens": 1339070.0,
|
|
"step": 535
|
|
},
|
|
{
|
|
"entropy": 8.00021333694458,
|
|
"epoch": 0.06231967686093479,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00026950000000000005,
|
|
"loss": 7.7617,
|
|
"mean_token_accuracy": 0.12492593899369239,
|
|
"num_tokens": 1351345.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 8.155957984924317,
|
|
"epoch": 0.06289671090594345,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00027200000000000005,
|
|
"loss": 7.8454,
|
|
"mean_token_accuracy": 0.11729749515652657,
|
|
"num_tokens": 1364331.0,
|
|
"step": 545
|
|
},
|
|
{
|
|
"entropy": 7.948654079437256,
|
|
"epoch": 0.06347374495095211,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0002745,
|
|
"loss": 7.7274,
|
|
"mean_token_accuracy": 0.1307520568370819,
|
|
"num_tokens": 1377426.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 8.21699333190918,
|
|
"epoch": 0.06405077899596076,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000277,
|
|
"loss": 7.8456,
|
|
"mean_token_accuracy": 0.11890435740351676,
|
|
"num_tokens": 1391553.0,
|
|
"step": 555
|
|
},
|
|
{
|
|
"entropy": 8.080363225936889,
|
|
"epoch": 0.06462781304096941,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0002795,
|
|
"loss": 7.83,
|
|
"mean_token_accuracy": 0.12511808127164842,
|
|
"num_tokens": 1405526.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 8.142201614379882,
|
|
"epoch": 0.06520484708597807,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00028199999999999997,
|
|
"loss": 7.8219,
|
|
"mean_token_accuracy": 0.12369688302278518,
|
|
"num_tokens": 1417868.0,
|
|
"step": 565
|
|
},
|
|
{
|
|
"entropy": 7.928612327575683,
|
|
"epoch": 0.06578188113098672,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0002845,
|
|
"loss": 7.7407,
|
|
"mean_token_accuracy": 0.12715482115745544,
|
|
"num_tokens": 1429907.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 8.15863070487976,
|
|
"epoch": 0.06635891517599539,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000287,
|
|
"loss": 7.751,
|
|
"mean_token_accuracy": 0.12095296233892441,
|
|
"num_tokens": 1442552.0,
|
|
"step": 575
|
|
},
|
|
{
|
|
"entropy": 8.045605039596557,
|
|
"epoch": 0.06693594922100404,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0002895,
|
|
"loss": 7.8095,
|
|
"mean_token_accuracy": 0.12216803878545761,
|
|
"num_tokens": 1455717.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 8.157436180114747,
|
|
"epoch": 0.0675129832660127,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.000292,
|
|
"loss": 7.8052,
|
|
"mean_token_accuracy": 0.11941280439496041,
|
|
"num_tokens": 1468263.0,
|
|
"step": 585
|
|
},
|
|
{
|
|
"entropy": 7.988013124465942,
|
|
"epoch": 0.06809001731102135,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0002945,
|
|
"loss": 7.7479,
|
|
"mean_token_accuracy": 0.12465541884303093,
|
|
"num_tokens": 1481632.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 8.01614761352539,
|
|
"epoch": 0.06866705135603,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000297,
|
|
"loss": 7.7005,
|
|
"mean_token_accuracy": 0.12634204924106598,
|
|
"num_tokens": 1495121.0,
|
|
"step": 595
|
|
},
|
|
{
|
|
"entropy": 7.969437456130981,
|
|
"epoch": 0.06924408540103866,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0002995,
|
|
"loss": 7.7509,
|
|
"mean_token_accuracy": 0.1271022602915764,
|
|
"num_tokens": 1507669.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 8.026603889465331,
|
|
"epoch": 0.06982111944604731,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000302,
|
|
"loss": 7.7853,
|
|
"mean_token_accuracy": 0.12059543505311013,
|
|
"num_tokens": 1520707.0,
|
|
"step": 605
|
|
},
|
|
{
|
|
"entropy": 7.99562668800354,
|
|
"epoch": 0.07039815349105598,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0003045,
|
|
"loss": 7.696,
|
|
"mean_token_accuracy": 0.12601862624287605,
|
|
"num_tokens": 1532974.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 7.974084091186524,
|
|
"epoch": 0.07097518753606463,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.000307,
|
|
"loss": 7.682,
|
|
"mean_token_accuracy": 0.12723494321107864,
|
|
"num_tokens": 1544085.0,
|
|
"step": 615
|
|
},
|
|
{
|
|
"entropy": 7.9744525909423825,
|
|
"epoch": 0.07155222158107329,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0003095,
|
|
"loss": 7.7045,
|
|
"mean_token_accuracy": 0.1308353565633297,
|
|
"num_tokens": 1556945.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 7.941751766204834,
|
|
"epoch": 0.07212925562608194,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000312,
|
|
"loss": 7.6518,
|
|
"mean_token_accuracy": 0.13126163482666015,
|
|
"num_tokens": 1569570.0,
|
|
"step": 625
|
|
},
|
|
{
|
|
"entropy": 7.943236637115478,
|
|
"epoch": 0.0727062896710906,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0003145,
|
|
"loss": 7.7317,
|
|
"mean_token_accuracy": 0.12612373903393745,
|
|
"num_tokens": 1582529.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 7.964515161514282,
|
|
"epoch": 0.07328332371609925,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.000317,
|
|
"loss": 7.6504,
|
|
"mean_token_accuracy": 0.13465792536735535,
|
|
"num_tokens": 1595976.0,
|
|
"step": 635
|
|
},
|
|
{
|
|
"entropy": 7.939415836334229,
|
|
"epoch": 0.0738603577611079,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0003195,
|
|
"loss": 7.6945,
|
|
"mean_token_accuracy": 0.12841632589697838,
|
|
"num_tokens": 1609093.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 7.928447484970093,
|
|
"epoch": 0.07443739180611655,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000322,
|
|
"loss": 7.6804,
|
|
"mean_token_accuracy": 0.12497531697154045,
|
|
"num_tokens": 1622233.0,
|
|
"step": 645
|
|
},
|
|
{
|
|
"entropy": 8.020674419403075,
|
|
"epoch": 0.07501442585112522,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00032450000000000003,
|
|
"loss": 7.728,
|
|
"mean_token_accuracy": 0.1262144438922405,
|
|
"num_tokens": 1635354.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 7.9559979915618895,
|
|
"epoch": 0.07559145989613388,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.00032700000000000003,
|
|
"loss": 7.7083,
|
|
"mean_token_accuracy": 0.12276372462511062,
|
|
"num_tokens": 1648223.0,
|
|
"step": 655
|
|
},
|
|
{
|
|
"entropy": 7.932180786132813,
|
|
"epoch": 0.07616849394114253,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00032950000000000004,
|
|
"loss": 7.695,
|
|
"mean_token_accuracy": 0.12331497594714165,
|
|
"num_tokens": 1661652.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 7.91778302192688,
|
|
"epoch": 0.07674552798615118,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00033200000000000005,
|
|
"loss": 7.598,
|
|
"mean_token_accuracy": 0.13565101027488707,
|
|
"num_tokens": 1674778.0,
|
|
"step": 665
|
|
},
|
|
{
|
|
"entropy": 7.959203672409058,
|
|
"epoch": 0.07732256203115984,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00033450000000000005,
|
|
"loss": 7.6853,
|
|
"mean_token_accuracy": 0.1240819051861763,
|
|
"num_tokens": 1686966.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 7.902504253387451,
|
|
"epoch": 0.07789959607616849,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000337,
|
|
"loss": 7.6563,
|
|
"mean_token_accuracy": 0.13484344854950905,
|
|
"num_tokens": 1699979.0,
|
|
"step": 675
|
|
},
|
|
{
|
|
"entropy": 7.8624763011932375,
|
|
"epoch": 0.07847663012117714,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0003395,
|
|
"loss": 7.5949,
|
|
"mean_token_accuracy": 0.12701699286699294,
|
|
"num_tokens": 1712306.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 7.84359302520752,
|
|
"epoch": 0.07905366416618581,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000342,
|
|
"loss": 7.6427,
|
|
"mean_token_accuracy": 0.12926456406712533,
|
|
"num_tokens": 1724670.0,
|
|
"step": 685
|
|
},
|
|
{
|
|
"entropy": 7.9609299659729,
|
|
"epoch": 0.07963069821119446,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00034449999999999997,
|
|
"loss": 7.7196,
|
|
"mean_token_accuracy": 0.12713819071650506,
|
|
"num_tokens": 1736987.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 7.934039688110351,
|
|
"epoch": 0.08020773225620312,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.000347,
|
|
"loss": 7.6931,
|
|
"mean_token_accuracy": 0.126790152490139,
|
|
"num_tokens": 1750587.0,
|
|
"step": 695
|
|
},
|
|
{
|
|
"entropy": 7.82976803779602,
|
|
"epoch": 0.08078476630121177,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003495,
|
|
"loss": 7.6356,
|
|
"mean_token_accuracy": 0.12186335176229476,
|
|
"num_tokens": 1763432.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 7.907923984527588,
|
|
"epoch": 0.08136180034622043,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.000352,
|
|
"loss": 7.5615,
|
|
"mean_token_accuracy": 0.13086110800504686,
|
|
"num_tokens": 1777705.0,
|
|
"step": 705
|
|
},
|
|
{
|
|
"entropy": 7.8514200210571286,
|
|
"epoch": 0.08193883439122908,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0003545,
|
|
"loss": 7.6198,
|
|
"mean_token_accuracy": 0.13134256303310393,
|
|
"num_tokens": 1790673.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 7.8153650760650635,
|
|
"epoch": 0.08251586843623773,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000357,
|
|
"loss": 7.6619,
|
|
"mean_token_accuracy": 0.12541591748595238,
|
|
"num_tokens": 1803258.0,
|
|
"step": 715
|
|
},
|
|
{
|
|
"entropy": 7.950216341018677,
|
|
"epoch": 0.0830929024812464,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0003595,
|
|
"loss": 7.6293,
|
|
"mean_token_accuracy": 0.12917107716202736,
|
|
"num_tokens": 1816534.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 7.836187028884888,
|
|
"epoch": 0.08366993652625505,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000362,
|
|
"loss": 7.5809,
|
|
"mean_token_accuracy": 0.12518987879157067,
|
|
"num_tokens": 1828335.0,
|
|
"step": 725
|
|
},
|
|
{
|
|
"entropy": 7.771939277648926,
|
|
"epoch": 0.08424697057126371,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0003645,
|
|
"loss": 7.5899,
|
|
"mean_token_accuracy": 0.134027336537838,
|
|
"num_tokens": 1839327.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 7.924041652679444,
|
|
"epoch": 0.08482400461627236,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000367,
|
|
"loss": 7.6636,
|
|
"mean_token_accuracy": 0.12406575530767441,
|
|
"num_tokens": 1851168.0,
|
|
"step": 735
|
|
},
|
|
{
|
|
"entropy": 7.836169338226318,
|
|
"epoch": 0.08540103866128101,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0003695,
|
|
"loss": 7.6255,
|
|
"mean_token_accuracy": 0.1251351036131382,
|
|
"num_tokens": 1863875.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 7.870956707000732,
|
|
"epoch": 0.08597807270628967,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000372,
|
|
"loss": 7.5523,
|
|
"mean_token_accuracy": 0.12497681528329849,
|
|
"num_tokens": 1876613.0,
|
|
"step": 745
|
|
},
|
|
{
|
|
"entropy": 7.877524900436401,
|
|
"epoch": 0.08655510675129832,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0003745,
|
|
"loss": 7.6508,
|
|
"mean_token_accuracy": 0.12530745193362236,
|
|
"num_tokens": 1890311.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 7.7698094844818115,
|
|
"epoch": 0.08713214079630698,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000377,
|
|
"loss": 7.6137,
|
|
"mean_token_accuracy": 0.12359317764639854,
|
|
"num_tokens": 1902925.0,
|
|
"step": 755
|
|
},
|
|
{
|
|
"entropy": 7.891464757919311,
|
|
"epoch": 0.08770917484131564,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003795,
|
|
"loss": 7.5955,
|
|
"mean_token_accuracy": 0.12298363819718361,
|
|
"num_tokens": 1915186.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 7.836678600311279,
|
|
"epoch": 0.0882862088863243,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000382,
|
|
"loss": 7.5912,
|
|
"mean_token_accuracy": 0.1303836189210415,
|
|
"num_tokens": 1927184.0,
|
|
"step": 765
|
|
},
|
|
{
|
|
"entropy": 7.795164489746094,
|
|
"epoch": 0.08886324293133295,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003845,
|
|
"loss": 7.5682,
|
|
"mean_token_accuracy": 0.1343364216387272,
|
|
"num_tokens": 1940275.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 7.860983610153198,
|
|
"epoch": 0.0894402769763416,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00038700000000000003,
|
|
"loss": 7.6057,
|
|
"mean_token_accuracy": 0.1272793047130108,
|
|
"num_tokens": 1952583.0,
|
|
"step": 775
|
|
},
|
|
{
|
|
"entropy": 7.830558156967163,
|
|
"epoch": 0.09001731102135026,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00038950000000000003,
|
|
"loss": 7.5118,
|
|
"mean_token_accuracy": 0.12738451659679412,
|
|
"num_tokens": 1965219.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 7.71030740737915,
|
|
"epoch": 0.09059434506635891,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00039200000000000004,
|
|
"loss": 7.5456,
|
|
"mean_token_accuracy": 0.13100098669528962,
|
|
"num_tokens": 1977193.0,
|
|
"step": 785
|
|
},
|
|
{
|
|
"entropy": 7.909699869155884,
|
|
"epoch": 0.09117137911136756,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00039450000000000005,
|
|
"loss": 7.4505,
|
|
"mean_token_accuracy": 0.13711674883961678,
|
|
"num_tokens": 1988955.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 7.730215835571289,
|
|
"epoch": 0.09174841315637623,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00039700000000000005,
|
|
"loss": 7.5988,
|
|
"mean_token_accuracy": 0.12491806000471115,
|
|
"num_tokens": 2001647.0,
|
|
"step": 795
|
|
},
|
|
{
|
|
"entropy": 7.779358577728272,
|
|
"epoch": 0.09232544720138489,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0003995,
|
|
"loss": 7.5131,
|
|
"mean_token_accuracy": 0.13641507402062417,
|
|
"num_tokens": 2015185.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 7.82036943435669,
|
|
"epoch": 0.09290248124639354,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000402,
|
|
"loss": 7.6135,
|
|
"mean_token_accuracy": 0.12739918157458305,
|
|
"num_tokens": 2027257.0,
|
|
"step": 805
|
|
},
|
|
{
|
|
"entropy": 7.603882265090943,
|
|
"epoch": 0.0934795152914022,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004045,
|
|
"loss": 7.4517,
|
|
"mean_token_accuracy": 0.13969765827059746,
|
|
"num_tokens": 2040716.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 7.850926303863526,
|
|
"epoch": 0.09405654933641085,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00040699999999999997,
|
|
"loss": 7.5796,
|
|
"mean_token_accuracy": 0.12389181852340699,
|
|
"num_tokens": 2053240.0,
|
|
"step": 815
|
|
},
|
|
{
|
|
"entropy": 7.774610376358032,
|
|
"epoch": 0.0946335833814195,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004095,
|
|
"loss": 7.5473,
|
|
"mean_token_accuracy": 0.12548824697732924,
|
|
"num_tokens": 2065693.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 7.716372299194336,
|
|
"epoch": 0.09521061742642815,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000412,
|
|
"loss": 7.5014,
|
|
"mean_token_accuracy": 0.1397644318640232,
|
|
"num_tokens": 2077649.0,
|
|
"step": 825
|
|
},
|
|
{
|
|
"entropy": 7.756848621368408,
|
|
"epoch": 0.09578765147143682,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004145,
|
|
"loss": 7.5233,
|
|
"mean_token_accuracy": 0.1290776789188385,
|
|
"num_tokens": 2090780.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 7.749186420440674,
|
|
"epoch": 0.09636468551644548,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000417,
|
|
"loss": 7.5311,
|
|
"mean_token_accuracy": 0.13137806951999664,
|
|
"num_tokens": 2104096.0,
|
|
"step": 835
|
|
},
|
|
{
|
|
"entropy": 7.7773672580719,
|
|
"epoch": 0.09694171956145413,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004195,
|
|
"loss": 7.527,
|
|
"mean_token_accuracy": 0.12679293751716614,
|
|
"num_tokens": 2117157.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 7.73278284072876,
|
|
"epoch": 0.09751875360646278,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.000422,
|
|
"loss": 7.4858,
|
|
"mean_token_accuracy": 0.12687554210424423,
|
|
"num_tokens": 2129309.0,
|
|
"step": 845
|
|
},
|
|
{
|
|
"entropy": 7.768968677520752,
|
|
"epoch": 0.09809578765147144,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004245,
|
|
"loss": 7.5307,
|
|
"mean_token_accuracy": 0.13160400986671447,
|
|
"num_tokens": 2142344.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 7.714959239959716,
|
|
"epoch": 0.09867282169648009,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000427,
|
|
"loss": 7.5686,
|
|
"mean_token_accuracy": 0.1227949745953083,
|
|
"num_tokens": 2155059.0,
|
|
"step": 855
|
|
},
|
|
{
|
|
"entropy": 7.734045362472534,
|
|
"epoch": 0.09924985574148874,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004295,
|
|
"loss": 7.567,
|
|
"mean_token_accuracy": 0.12749878615140914,
|
|
"num_tokens": 2168901.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 7.731997871398926,
|
|
"epoch": 0.0998268897864974,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.000432,
|
|
"loss": 7.3702,
|
|
"mean_token_accuracy": 0.14134701043367387,
|
|
"num_tokens": 2180953.0,
|
|
"step": 865
|
|
},
|
|
{
|
|
"entropy": 7.591903018951416,
|
|
"epoch": 0.10040392383150606,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004345,
|
|
"loss": 7.4942,
|
|
"mean_token_accuracy": 0.1371511548757553,
|
|
"num_tokens": 2194097.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 7.695831298828125,
|
|
"epoch": 0.10098095787651472,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.000437,
|
|
"loss": 7.4334,
|
|
"mean_token_accuracy": 0.13365770354866982,
|
|
"num_tokens": 2206475.0,
|
|
"step": 875
|
|
},
|
|
{
|
|
"entropy": 7.78225154876709,
|
|
"epoch": 0.10155799192152337,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004395,
|
|
"loss": 7.4645,
|
|
"mean_token_accuracy": 0.1278185375034809,
|
|
"num_tokens": 2220006.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 7.65887417793274,
|
|
"epoch": 0.10213502596653203,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000442,
|
|
"loss": 7.5351,
|
|
"mean_token_accuracy": 0.12350780516862869,
|
|
"num_tokens": 2234082.0,
|
|
"step": 885
|
|
},
|
|
{
|
|
"entropy": 7.669657945632935,
|
|
"epoch": 0.10271206001154068,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004445,
|
|
"loss": 7.5227,
|
|
"mean_token_accuracy": 0.12489003017544746,
|
|
"num_tokens": 2246871.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 7.669128274917602,
|
|
"epoch": 0.10328909405654933,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.000447,
|
|
"loss": 7.4567,
|
|
"mean_token_accuracy": 0.13411386385560037,
|
|
"num_tokens": 2260172.0,
|
|
"step": 895
|
|
},
|
|
{
|
|
"entropy": 7.77032732963562,
|
|
"epoch": 0.10386612810155799,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00044950000000000003,
|
|
"loss": 7.5057,
|
|
"mean_token_accuracy": 0.11949166432023048,
|
|
"num_tokens": 2272848.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 7.673234939575195,
|
|
"epoch": 0.10444316214656665,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00045200000000000004,
|
|
"loss": 7.452,
|
|
"mean_token_accuracy": 0.12722696289420127,
|
|
"num_tokens": 2285673.0,
|
|
"step": 905
|
|
},
|
|
{
|
|
"entropy": 7.741328477859497,
|
|
"epoch": 0.10502019619157531,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045450000000000004,
|
|
"loss": 7.489,
|
|
"mean_token_accuracy": 0.12697241380810736,
|
|
"num_tokens": 2298459.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 7.641606569290161,
|
|
"epoch": 0.10559723023658396,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00045700000000000005,
|
|
"loss": 7.448,
|
|
"mean_token_accuracy": 0.13017196208238602,
|
|
"num_tokens": 2311226.0,
|
|
"step": 915
|
|
},
|
|
{
|
|
"entropy": 7.574088287353516,
|
|
"epoch": 0.10617426428159261,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00045950000000000006,
|
|
"loss": 7.3847,
|
|
"mean_token_accuracy": 0.1277943417429924,
|
|
"num_tokens": 2323481.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 7.646576309204102,
|
|
"epoch": 0.10675129832660127,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.000462,
|
|
"loss": 7.414,
|
|
"mean_token_accuracy": 0.1307280629873276,
|
|
"num_tokens": 2336181.0,
|
|
"step": 925
|
|
},
|
|
{
|
|
"entropy": 7.636479043960572,
|
|
"epoch": 0.10732833237160992,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004645,
|
|
"loss": 7.3716,
|
|
"mean_token_accuracy": 0.13296475633978844,
|
|
"num_tokens": 2348941.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 7.661097192764283,
|
|
"epoch": 0.10790536641661858,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.000467,
|
|
"loss": 7.3294,
|
|
"mean_token_accuracy": 0.12712401077151297,
|
|
"num_tokens": 2361618.0,
|
|
"step": 935
|
|
},
|
|
{
|
|
"entropy": 7.540031290054321,
|
|
"epoch": 0.10848240046162723,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004695,
|
|
"loss": 7.2806,
|
|
"mean_token_accuracy": 0.14269692525267602,
|
|
"num_tokens": 2376108.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 7.573352289199829,
|
|
"epoch": 0.1090594345066359,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000472,
|
|
"loss": 7.382,
|
|
"mean_token_accuracy": 0.13606224954128265,
|
|
"num_tokens": 2387774.0,
|
|
"step": 945
|
|
},
|
|
{
|
|
"entropy": 7.616125917434692,
|
|
"epoch": 0.10963646855164455,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004745,
|
|
"loss": 7.4187,
|
|
"mean_token_accuracy": 0.13490517437458038,
|
|
"num_tokens": 2400816.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 7.538399982452392,
|
|
"epoch": 0.1102135025966532,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.000477,
|
|
"loss": 7.3513,
|
|
"mean_token_accuracy": 0.13397277891635895,
|
|
"num_tokens": 2412970.0,
|
|
"step": 955
|
|
},
|
|
{
|
|
"entropy": 7.531917762756348,
|
|
"epoch": 0.11079053664166186,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004795,
|
|
"loss": 7.3595,
|
|
"mean_token_accuracy": 0.13522982075810433,
|
|
"num_tokens": 2424622.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 7.65097861289978,
|
|
"epoch": 0.11136757068667051,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.000482,
|
|
"loss": 7.4384,
|
|
"mean_token_accuracy": 0.13235584348440171,
|
|
"num_tokens": 2437293.0,
|
|
"step": 965
|
|
},
|
|
{
|
|
"entropy": 7.556930351257324,
|
|
"epoch": 0.11194460473167916,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004845,
|
|
"loss": 7.3101,
|
|
"mean_token_accuracy": 0.13271362110972404,
|
|
"num_tokens": 2449934.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 7.62783989906311,
|
|
"epoch": 0.11252163877668782,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.000487,
|
|
"loss": 7.3979,
|
|
"mean_token_accuracy": 0.12683349400758742,
|
|
"num_tokens": 2463139.0,
|
|
"step": 975
|
|
},
|
|
{
|
|
"entropy": 7.5757801055908205,
|
|
"epoch": 0.11309867282169649,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004895,
|
|
"loss": 7.4281,
|
|
"mean_token_accuracy": 0.1270056739449501,
|
|
"num_tokens": 2474273.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 7.627140283584595,
|
|
"epoch": 0.11367570686670514,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000492,
|
|
"loss": 7.381,
|
|
"mean_token_accuracy": 0.1371190808713436,
|
|
"num_tokens": 2486643.0,
|
|
"step": 985
|
|
},
|
|
{
|
|
"entropy": 7.516345596313476,
|
|
"epoch": 0.1142527409117138,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004945,
|
|
"loss": 7.3769,
|
|
"mean_token_accuracy": 0.12875159829854965,
|
|
"num_tokens": 2499018.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 7.49490532875061,
|
|
"epoch": 0.11482977495672245,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000497,
|
|
"loss": 7.3419,
|
|
"mean_token_accuracy": 0.1379355698823929,
|
|
"num_tokens": 2510463.0,
|
|
"step": 995
|
|
},
|
|
{
|
|
"entropy": 7.580066394805908,
|
|
"epoch": 0.1154068090017311,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004995,
|
|
"loss": 7.3689,
|
|
"mean_token_accuracy": 0.13574447557330133,
|
|
"num_tokens": 2522671.0,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"entropy": 7.525820398330689,
|
|
"epoch": 0.11598384304673975,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004999999975783157,
|
|
"loss": 7.3706,
|
|
"mean_token_accuracy": 0.1312769442796707,
|
|
"num_tokens": 2534508.0,
|
|
"step": 1005
|
|
},
|
|
{
|
|
"entropy": 7.571441793441773,
|
|
"epoch": 0.11656087709174841,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004999999877402236,
|
|
"loss": 7.3274,
|
|
"mean_token_accuracy": 0.13784680590033532,
|
|
"num_tokens": 2546804.0,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"entropy": 7.521267461776733,
|
|
"epoch": 0.11713791113675708,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004999999703343686,
|
|
"loss": 7.3429,
|
|
"mean_token_accuracy": 0.13090137392282486,
|
|
"num_tokens": 2558786.0,
|
|
"step": 1015
|
|
},
|
|
{
|
|
"entropy": 7.574562740325928,
|
|
"epoch": 0.11771494518176573,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004999999453607515,
|
|
"loss": 7.3165,
|
|
"mean_token_accuracy": 0.13034487813711165,
|
|
"num_tokens": 2570834.0,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"entropy": 7.461473798751831,
|
|
"epoch": 0.11829197922677438,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004999999128193729,
|
|
"loss": 7.2709,
|
|
"mean_token_accuracy": 0.14077538400888442,
|
|
"num_tokens": 2583342.0,
|
|
"step": 1025
|
|
},
|
|
{
|
|
"entropy": 7.511537408828735,
|
|
"epoch": 0.11886901327178304,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000499999872710234,
|
|
"loss": 7.3162,
|
|
"mean_token_accuracy": 0.1330413155257702,
|
|
"num_tokens": 2594878.0,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"entropy": 7.390342903137207,
|
|
"epoch": 0.11944604731679169,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004999998250333361,
|
|
"loss": 7.281,
|
|
"mean_token_accuracy": 0.13540845960378647,
|
|
"num_tokens": 2607070.0,
|
|
"step": 1035
|
|
},
|
|
{
|
|
"entropy": 7.526187515258789,
|
|
"epoch": 0.12002308136180034,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.000499999769788681,
|
|
"loss": 7.3157,
|
|
"mean_token_accuracy": 0.13957726508378981,
|
|
"num_tokens": 2620761.0,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"entropy": 7.498535776138306,
|
|
"epoch": 0.120600115406809,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004999997069762703,
|
|
"loss": 7.3307,
|
|
"mean_token_accuracy": 0.1318868264555931,
|
|
"num_tokens": 2634161.0,
|
|
"step": 1045
|
|
},
|
|
{
|
|
"entropy": 7.453407907485962,
|
|
"epoch": 0.12117714945181765,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004999996365961062,
|
|
"loss": 7.2874,
|
|
"mean_token_accuracy": 0.1383284404873848,
|
|
"num_tokens": 2647459.0,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"entropy": 7.446234273910522,
|
|
"epoch": 0.12175418349682632,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004999995586481912,
|
|
"loss": 7.2872,
|
|
"mean_token_accuracy": 0.1340254984796047,
|
|
"num_tokens": 2660840.0,
|
|
"step": 1055
|
|
},
|
|
{
|
|
"entropy": 7.483492088317871,
|
|
"epoch": 0.12233121754183497,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004999994731325276,
|
|
"loss": 7.2865,
|
|
"mean_token_accuracy": 0.13337128460407258,
|
|
"num_tokens": 2672673.0,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"entropy": 7.395563697814941,
|
|
"epoch": 0.12290825158684363,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004999993800491187,
|
|
"loss": 7.2987,
|
|
"mean_token_accuracy": 0.13419368714094163,
|
|
"num_tokens": 2685744.0,
|
|
"step": 1065
|
|
},
|
|
{
|
|
"entropy": 7.416986179351807,
|
|
"epoch": 0.12348528563185228,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004999992793979672,
|
|
"loss": 7.2196,
|
|
"mean_token_accuracy": 0.14943781048059462,
|
|
"num_tokens": 2697068.0,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"entropy": 7.524578285217285,
|
|
"epoch": 0.12406231967686093,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004999991711790769,
|
|
"loss": 7.3467,
|
|
"mean_token_accuracy": 0.12948699221014975,
|
|
"num_tokens": 2710418.0,
|
|
"step": 1075
|
|
},
|
|
{
|
|
"entropy": 7.54997706413269,
|
|
"epoch": 0.12463935372186959,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004999990553924511,
|
|
"loss": 7.3065,
|
|
"mean_token_accuracy": 0.12690478786826134,
|
|
"num_tokens": 2722440.0,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"entropy": 7.381335258483887,
|
|
"epoch": 0.12521638776687824,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004999989320380939,
|
|
"loss": 7.2963,
|
|
"mean_token_accuracy": 0.12917414531111718,
|
|
"num_tokens": 2735486.0,
|
|
"step": 1085
|
|
},
|
|
{
|
|
"entropy": 7.532785177230835,
|
|
"epoch": 0.1257934218118869,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004999988011160094,
|
|
"loss": 7.3223,
|
|
"mean_token_accuracy": 0.13123588562011718,
|
|
"num_tokens": 2747620.0,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"entropy": 7.407538604736328,
|
|
"epoch": 0.12637045585689555,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.000499998662626202,
|
|
"loss": 7.2571,
|
|
"mean_token_accuracy": 0.1341471828520298,
|
|
"num_tokens": 2760987.0,
|
|
"step": 1095
|
|
},
|
|
{
|
|
"entropy": 7.483826351165772,
|
|
"epoch": 0.12694748990190421,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004999985165686764,
|
|
"loss": 7.234,
|
|
"mean_token_accuracy": 0.1353903256356716,
|
|
"num_tokens": 2773161.0,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"entropy": 7.336683225631714,
|
|
"epoch": 0.12752452394691285,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004999983629434373,
|
|
"loss": 7.1573,
|
|
"mean_token_accuracy": 0.15311394929885863,
|
|
"num_tokens": 2786179.0,
|
|
"step": 1105
|
|
},
|
|
{
|
|
"entropy": 7.440242195129395,
|
|
"epoch": 0.12810155799192152,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004999982017504901,
|
|
"loss": 7.1926,
|
|
"mean_token_accuracy": 0.14265231788158417,
|
|
"num_tokens": 2798859.0,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"entropy": 7.385885190963745,
|
|
"epoch": 0.1286785920369302,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004999980329898401,
|
|
"loss": 7.2944,
|
|
"mean_token_accuracy": 0.1360294461250305,
|
|
"num_tokens": 2813048.0,
|
|
"step": 1115
|
|
},
|
|
{
|
|
"entropy": 7.456379127502442,
|
|
"epoch": 0.12925562608193883,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.000499997856661493,
|
|
"loss": 7.2612,
|
|
"mean_token_accuracy": 0.13587961345911026,
|
|
"num_tokens": 2826032.0,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"entropy": 7.430348825454712,
|
|
"epoch": 0.1298326601269475,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.000499997672765455,
|
|
"loss": 7.2962,
|
|
"mean_token_accuracy": 0.13529185801744462,
|
|
"num_tokens": 2839253.0,
|
|
"step": 1125
|
|
},
|
|
{
|
|
"entropy": 7.3566066265106205,
|
|
"epoch": 0.13040969417195614,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004999974813017318,
|
|
"loss": 7.2183,
|
|
"mean_token_accuracy": 0.14149424508213998,
|
|
"num_tokens": 2852542.0,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"entropy": 7.3935285091400145,
|
|
"epoch": 0.1309867282169648,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004999972822703301,
|
|
"loss": 7.2395,
|
|
"mean_token_accuracy": 0.14146022573113443,
|
|
"num_tokens": 2863967.0,
|
|
"step": 1135
|
|
},
|
|
{
|
|
"entropy": 7.422988605499268,
|
|
"epoch": 0.13156376226197344,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004999970756712567,
|
|
"loss": 7.3171,
|
|
"mean_token_accuracy": 0.13306807354092598,
|
|
"num_tokens": 2876141.0,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"entropy": 7.2979803562164305,
|
|
"epoch": 0.1321407963069821,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004999968615045183,
|
|
"loss": 7.145,
|
|
"mean_token_accuracy": 0.14133854061365128,
|
|
"num_tokens": 2888395.0,
|
|
"step": 1145
|
|
},
|
|
{
|
|
"entropy": 7.431983804702758,
|
|
"epoch": 0.13271783035199078,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004999966397701222,
|
|
"loss": 7.3261,
|
|
"mean_token_accuracy": 0.12834407463669778,
|
|
"num_tokens": 2902399.0,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"entropy": 7.406958770751953,
|
|
"epoch": 0.13329486439699942,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004999964104680759,
|
|
"loss": 7.0835,
|
|
"mean_token_accuracy": 0.1402672976255417,
|
|
"num_tokens": 2914999.0,
|
|
"step": 1155
|
|
},
|
|
{
|
|
"entropy": 7.348841714859009,
|
|
"epoch": 0.13387189844200809,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004999961735983871,
|
|
"loss": 7.0785,
|
|
"mean_token_accuracy": 0.1498357504606247,
|
|
"num_tokens": 2928091.0,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"entropy": 7.33998703956604,
|
|
"epoch": 0.13444893248701673,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004999959291610639,
|
|
"loss": 7.2138,
|
|
"mean_token_accuracy": 0.1341881737112999,
|
|
"num_tokens": 2940840.0,
|
|
"step": 1165
|
|
},
|
|
{
|
|
"entropy": 7.289854049682617,
|
|
"epoch": 0.1350259665320254,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004999956771561143,
|
|
"loss": 7.1303,
|
|
"mean_token_accuracy": 0.14412761703133584,
|
|
"num_tokens": 2952980.0,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"entropy": 7.357520866394043,
|
|
"epoch": 0.13560300057703403,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004999954175835469,
|
|
"loss": 7.1748,
|
|
"mean_token_accuracy": 0.13631198480725287,
|
|
"num_tokens": 2965437.0,
|
|
"step": 1175
|
|
},
|
|
{
|
|
"entropy": 7.3787942886352536,
|
|
"epoch": 0.1361800346220427,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004999951504433703,
|
|
"loss": 7.2047,
|
|
"mean_token_accuracy": 0.1348996601998806,
|
|
"num_tokens": 2978077.0,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"entropy": 7.40587363243103,
|
|
"epoch": 0.13675706866705137,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004999948757355935,
|
|
"loss": 7.298,
|
|
"mean_token_accuracy": 0.13351393342018128,
|
|
"num_tokens": 2990498.0,
|
|
"step": 1185
|
|
},
|
|
{
|
|
"entropy": 7.413915586471558,
|
|
"epoch": 0.13733410271206,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.000499994593460226,
|
|
"loss": 7.2412,
|
|
"mean_token_accuracy": 0.1355881556868553,
|
|
"num_tokens": 3002784.0,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"entropy": 7.372391653060913,
|
|
"epoch": 0.13791113675706868,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004999943036172771,
|
|
"loss": 7.1807,
|
|
"mean_token_accuracy": 0.13228997811675072,
|
|
"num_tokens": 3015689.0,
|
|
"step": 1195
|
|
},
|
|
{
|
|
"entropy": 7.241599178314209,
|
|
"epoch": 0.13848817080207732,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004999940062067565,
|
|
"loss": 7.1264,
|
|
"mean_token_accuracy": 0.1455356404185295,
|
|
"num_tokens": 3026623.0,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"entropy": 7.376918649673462,
|
|
"epoch": 0.13906520484708598,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004999937012286742,
|
|
"loss": 7.1615,
|
|
"mean_token_accuracy": 0.1412371888756752,
|
|
"num_tokens": 3039769.0,
|
|
"step": 1205
|
|
},
|
|
{
|
|
"entropy": 7.27626667022705,
|
|
"epoch": 0.13964223889209462,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004999933886830405,
|
|
"loss": 7.1505,
|
|
"mean_token_accuracy": 0.13528102561831473,
|
|
"num_tokens": 3052044.0,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"entropy": 7.345494079589844,
|
|
"epoch": 0.1402192729371033,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000499993068569866,
|
|
"loss": 7.1241,
|
|
"mean_token_accuracy": 0.1391813077032566,
|
|
"num_tokens": 3063937.0,
|
|
"step": 1215
|
|
},
|
|
{
|
|
"entropy": 7.187998628616333,
|
|
"epoch": 0.14079630698211196,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999927408891614,
|
|
"loss": 7.0939,
|
|
"mean_token_accuracy": 0.14361393451690674,
|
|
"num_tokens": 3076645.0,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"entropy": 7.401137399673462,
|
|
"epoch": 0.1413733410271206,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004999924056409378,
|
|
"loss": 7.1542,
|
|
"mean_token_accuracy": 0.13744900077581407,
|
|
"num_tokens": 3088985.0,
|
|
"step": 1225
|
|
},
|
|
{
|
|
"entropy": 7.271087980270385,
|
|
"epoch": 0.14195037507212926,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004999920628252063,
|
|
"loss": 7.1543,
|
|
"mean_token_accuracy": 0.1385358177125454,
|
|
"num_tokens": 3101270.0,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"entropy": 7.236308813095093,
|
|
"epoch": 0.1425274091171379,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004999917124419785,
|
|
"loss": 7.1713,
|
|
"mean_token_accuracy": 0.13507955446839331,
|
|
"num_tokens": 3115420.0,
|
|
"step": 1235
|
|
},
|
|
{
|
|
"entropy": 7.414693069458008,
|
|
"epoch": 0.14310444316214657,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004999913544912664,
|
|
"loss": 7.1106,
|
|
"mean_token_accuracy": 0.13970131129026414,
|
|
"num_tokens": 3126176.0,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"entropy": 7.252271461486816,
|
|
"epoch": 0.1436814772071552,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004999909889730817,
|
|
"loss": 7.1516,
|
|
"mean_token_accuracy": 0.14178458228707314,
|
|
"num_tokens": 3139136.0,
|
|
"step": 1245
|
|
},
|
|
{
|
|
"entropy": 7.280838823318481,
|
|
"epoch": 0.14425851125216388,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004999906158874368,
|
|
"loss": 7.1044,
|
|
"mean_token_accuracy": 0.1472743645310402,
|
|
"num_tokens": 3152036.0,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"entropy": 7.349875354766846,
|
|
"epoch": 0.14483554529717255,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004999902352343444,
|
|
"loss": 7.1386,
|
|
"mean_token_accuracy": 0.14143830314278602,
|
|
"num_tokens": 3164060.0,
|
|
"step": 1255
|
|
},
|
|
{
|
|
"entropy": 7.355139827728271,
|
|
"epoch": 0.1454125793421812,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004999898470138171,
|
|
"loss": 7.206,
|
|
"mean_token_accuracy": 0.12975897416472434,
|
|
"num_tokens": 3176410.0,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"entropy": 7.291885662078857,
|
|
"epoch": 0.14598961338718985,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004999894512258681,
|
|
"loss": 7.2261,
|
|
"mean_token_accuracy": 0.13479177728295327,
|
|
"num_tokens": 3189784.0,
|
|
"step": 1265
|
|
},
|
|
{
|
|
"entropy": 7.3698536396026615,
|
|
"epoch": 0.1465666474321985,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004999890478705107,
|
|
"loss": 7.1471,
|
|
"mean_token_accuracy": 0.1365978240966797,
|
|
"num_tokens": 3202274.0,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"entropy": 7.3492168426513675,
|
|
"epoch": 0.14714368147720716,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004999886369477585,
|
|
"loss": 7.2021,
|
|
"mean_token_accuracy": 0.13651041984558104,
|
|
"num_tokens": 3215593.0,
|
|
"step": 1275
|
|
},
|
|
{
|
|
"entropy": 7.264506483078003,
|
|
"epoch": 0.1477207155222158,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004999882184576251,
|
|
"loss": 7.1145,
|
|
"mean_token_accuracy": 0.1358187846839428,
|
|
"num_tokens": 3228307.0,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"entropy": 7.262033987045288,
|
|
"epoch": 0.14829774956722447,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004999877924001248,
|
|
"loss": 7.0714,
|
|
"mean_token_accuracy": 0.13908419981598855,
|
|
"num_tokens": 3241676.0,
|
|
"step": 1285
|
|
},
|
|
{
|
|
"entropy": 7.289368486404419,
|
|
"epoch": 0.1488747836122331,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004999873587752718,
|
|
"loss": 7.1412,
|
|
"mean_token_accuracy": 0.13665730655193328,
|
|
"num_tokens": 3255190.0,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"entropy": 7.299326705932617,
|
|
"epoch": 0.14945181765724178,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004999869175830808,
|
|
"loss": 7.1635,
|
|
"mean_token_accuracy": 0.13522787094116212,
|
|
"num_tokens": 3268236.0,
|
|
"step": 1295
|
|
},
|
|
{
|
|
"entropy": 7.349583387374878,
|
|
"epoch": 0.15002885170225044,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004999864688235666,
|
|
"loss": 7.1786,
|
|
"mean_token_accuracy": 0.13588001057505608,
|
|
"num_tokens": 3281316.0,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"entropy": 7.291733837127685,
|
|
"epoch": 0.15060588574725908,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004999860124967442,
|
|
"loss": 7.0853,
|
|
"mean_token_accuracy": 0.1390770271420479,
|
|
"num_tokens": 3293517.0,
|
|
"step": 1305
|
|
},
|
|
{
|
|
"entropy": 7.185279273986817,
|
|
"epoch": 0.15118291979226775,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004999855486026291,
|
|
"loss": 7.0715,
|
|
"mean_token_accuracy": 0.14518356174230576,
|
|
"num_tokens": 3306814.0,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"entropy": 7.301711988449097,
|
|
"epoch": 0.1517599538372764,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004999850771412369,
|
|
"loss": 7.1333,
|
|
"mean_token_accuracy": 0.13459300100803376,
|
|
"num_tokens": 3318722.0,
|
|
"step": 1315
|
|
},
|
|
{
|
|
"entropy": 7.199785852432251,
|
|
"epoch": 0.15233698788228506,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004999845981125832,
|
|
"loss": 7.0873,
|
|
"mean_token_accuracy": 0.14142397046089172,
|
|
"num_tokens": 3331212.0,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"entropy": 7.31465106010437,
|
|
"epoch": 0.1529140219272937,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004999841115166844,
|
|
"loss": 7.0661,
|
|
"mean_token_accuracy": 0.13654675781726838,
|
|
"num_tokens": 3343999.0,
|
|
"step": 1325
|
|
},
|
|
{
|
|
"entropy": 7.124961471557617,
|
|
"epoch": 0.15349105597230236,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004999836173535568,
|
|
"loss": 7.0068,
|
|
"mean_token_accuracy": 0.14172771871089934,
|
|
"num_tokens": 3356281.0,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"entropy": 7.201707267761231,
|
|
"epoch": 0.15406809001731103,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004999831156232169,
|
|
"loss": 7.0726,
|
|
"mean_token_accuracy": 0.1406794235110283,
|
|
"num_tokens": 3369370.0,
|
|
"step": 1335
|
|
},
|
|
{
|
|
"entropy": 7.341475009918213,
|
|
"epoch": 0.15464512406231967,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004999826063256818,
|
|
"loss": 7.2012,
|
|
"mean_token_accuracy": 0.13309285268187523,
|
|
"num_tokens": 3382400.0,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"entropy": 7.232538366317749,
|
|
"epoch": 0.15522215810732834,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004999820894609683,
|
|
"loss": 7.0778,
|
|
"mean_token_accuracy": 0.13890645131468773,
|
|
"num_tokens": 3393666.0,
|
|
"step": 1345
|
|
},
|
|
{
|
|
"entropy": 7.243199300765991,
|
|
"epoch": 0.15579919215233698,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004999815650290941,
|
|
"loss": 7.0914,
|
|
"mean_token_accuracy": 0.1401012994349003,
|
|
"num_tokens": 3405920.0,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"entropy": 7.1591578960418705,
|
|
"epoch": 0.15637622619734565,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004999810330300766,
|
|
"loss": 6.9923,
|
|
"mean_token_accuracy": 0.14642595648765563,
|
|
"num_tokens": 3417886.0,
|
|
"step": 1355
|
|
},
|
|
{
|
|
"entropy": 7.254940557479858,
|
|
"epoch": 0.1569532602423543,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.000499980493463934,
|
|
"loss": 7.1075,
|
|
"mean_token_accuracy": 0.13476622179150582,
|
|
"num_tokens": 3430626.0,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"entropy": 7.202736520767212,
|
|
"epoch": 0.15753029428736295,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004999799463306841,
|
|
"loss": 7.0076,
|
|
"mean_token_accuracy": 0.1388716422021389,
|
|
"num_tokens": 3443248.0,
|
|
"step": 1365
|
|
},
|
|
{
|
|
"entropy": 7.213499069213867,
|
|
"epoch": 0.15810732833237162,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004999793916303455,
|
|
"loss": 7.0503,
|
|
"mean_token_accuracy": 0.13839739933609962,
|
|
"num_tokens": 3456163.0,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"entropy": 7.167108821868896,
|
|
"epoch": 0.15868436237738026,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004999788293629368,
|
|
"loss": 7.0754,
|
|
"mean_token_accuracy": 0.13633116707205772,
|
|
"num_tokens": 3468862.0,
|
|
"step": 1375
|
|
},
|
|
{
|
|
"entropy": 7.2402849197387695,
|
|
"epoch": 0.15926139642238893,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.000499978259528477,
|
|
"loss": 7.0663,
|
|
"mean_token_accuracy": 0.14658810272812844,
|
|
"num_tokens": 3481516.0,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"entropy": 7.265804767608643,
|
|
"epoch": 0.15983843046739757,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004999776821269852,
|
|
"loss": 7.1273,
|
|
"mean_token_accuracy": 0.12971169799566268,
|
|
"num_tokens": 3493063.0,
|
|
"step": 1385
|
|
},
|
|
{
|
|
"entropy": 7.229140663146973,
|
|
"epoch": 0.16041546451240624,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004999770971584807,
|
|
"loss": 7.0123,
|
|
"mean_token_accuracy": 0.13699770867824554,
|
|
"num_tokens": 3505460.0,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"entropy": 7.235083723068238,
|
|
"epoch": 0.16099249855741488,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004999765046229834,
|
|
"loss": 7.1218,
|
|
"mean_token_accuracy": 0.13258355781435965,
|
|
"num_tokens": 3519232.0,
|
|
"step": 1395
|
|
},
|
|
{
|
|
"entropy": 7.22713418006897,
|
|
"epoch": 0.16156953260242354,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000499975904520513,
|
|
"loss": 7.0295,
|
|
"mean_token_accuracy": 0.1445997752249241,
|
|
"num_tokens": 3531759.0,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"entropy": 7.201732730865478,
|
|
"epoch": 0.1621465666474322,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00049997529685109,
|
|
"loss": 6.9829,
|
|
"mean_token_accuracy": 0.15084661841392516,
|
|
"num_tokens": 3543457.0,
|
|
"step": 1405
|
|
},
|
|
{
|
|
"entropy": 7.160426235198974,
|
|
"epoch": 0.16272360069244085,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004999746816147344,
|
|
"loss": 7.1195,
|
|
"mean_token_accuracy": 0.1298399582505226,
|
|
"num_tokens": 3557036.0,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"entropy": 7.306451225280762,
|
|
"epoch": 0.16330063473744952,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004999740588114673,
|
|
"loss": 7.0716,
|
|
"mean_token_accuracy": 0.1405071273446083,
|
|
"num_tokens": 3569415.0,
|
|
"step": 1415
|
|
},
|
|
{
|
|
"entropy": 7.171466588973999,
|
|
"epoch": 0.16387766878245816,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004999734284413095,
|
|
"loss": 7.0696,
|
|
"mean_token_accuracy": 0.13537402525544168,
|
|
"num_tokens": 3581452.0,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"entropy": 7.184612178802491,
|
|
"epoch": 0.16445470282746683,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.000499972790504282,
|
|
"loss": 7.094,
|
|
"mean_token_accuracy": 0.13849470168352127,
|
|
"num_tokens": 3593482.0,
|
|
"step": 1425
|
|
},
|
|
{
|
|
"entropy": 7.202459335327148,
|
|
"epoch": 0.16503173687247547,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004999721450004067,
|
|
"loss": 7.0864,
|
|
"mean_token_accuracy": 0.13760560154914855,
|
|
"num_tokens": 3606062.0,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"entropy": 7.222452545166016,
|
|
"epoch": 0.16560877091748413,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004999714919297049,
|
|
"loss": 7.0499,
|
|
"mean_token_accuracy": 0.14111001044511795,
|
|
"num_tokens": 3619210.0,
|
|
"step": 1435
|
|
},
|
|
{
|
|
"entropy": 7.180074310302734,
|
|
"epoch": 0.1661858049624928,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004999708312921987,
|
|
"loss": 7.0919,
|
|
"mean_token_accuracy": 0.13837566673755647,
|
|
"num_tokens": 3631952.0,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"entropy": 7.17976598739624,
|
|
"epoch": 0.16676283900750144,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004999701630879103,
|
|
"loss": 6.9734,
|
|
"mean_token_accuracy": 0.14263298735022545,
|
|
"num_tokens": 3644864.0,
|
|
"step": 1445
|
|
},
|
|
{
|
|
"entropy": 7.166555690765381,
|
|
"epoch": 0.1673398730525101,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004999694873168623,
|
|
"loss": 7.0507,
|
|
"mean_token_accuracy": 0.1378322072327137,
|
|
"num_tokens": 3657504.0,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"entropy": 7.19564905166626,
|
|
"epoch": 0.16791690709751875,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004999688039790773,
|
|
"loss": 6.9587,
|
|
"mean_token_accuracy": 0.14702803492546082,
|
|
"num_tokens": 3670304.0,
|
|
"step": 1455
|
|
},
|
|
{
|
|
"entropy": 7.150408220291138,
|
|
"epoch": 0.16849394114252741,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004999681130745784,
|
|
"loss": 6.9859,
|
|
"mean_token_accuracy": 0.13595322594046594,
|
|
"num_tokens": 3681503.0,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"entropy": 7.162327766418457,
|
|
"epoch": 0.16907097518753605,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004999674146033888,
|
|
"loss": 7.0123,
|
|
"mean_token_accuracy": 0.137976536154747,
|
|
"num_tokens": 3693248.0,
|
|
"step": 1465
|
|
},
|
|
{
|
|
"entropy": 7.136591291427612,
|
|
"epoch": 0.16964800923254472,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004999667085655318,
|
|
"loss": 7.0248,
|
|
"mean_token_accuracy": 0.14202336519956588,
|
|
"num_tokens": 3705285.0,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"entropy": 7.1525966167449955,
|
|
"epoch": 0.1702250432775534,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004999659949610313,
|
|
"loss": 7.0489,
|
|
"mean_token_accuracy": 0.13094842061400414,
|
|
"num_tokens": 3719025.0,
|
|
"step": 1475
|
|
},
|
|
{
|
|
"entropy": 7.2398560523986815,
|
|
"epoch": 0.17080207732256203,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004999652737899114,
|
|
"loss": 7.0371,
|
|
"mean_token_accuracy": 0.14026156663894654,
|
|
"num_tokens": 3732054.0,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"entropy": 7.175600671768189,
|
|
"epoch": 0.1713791113675707,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004999645450521963,
|
|
"loss": 7.0023,
|
|
"mean_token_accuracy": 0.141888265311718,
|
|
"num_tokens": 3744080.0,
|
|
"step": 1485
|
|
},
|
|
{
|
|
"entropy": 7.114497375488281,
|
|
"epoch": 0.17195614541257934,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004999638087479104,
|
|
"loss": 7.0391,
|
|
"mean_token_accuracy": 0.13951010257005692,
|
|
"num_tokens": 3756371.0,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"entropy": 7.245286512374878,
|
|
"epoch": 0.172533179457588,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004999630648770786,
|
|
"loss": 6.9683,
|
|
"mean_token_accuracy": 0.1364215262234211,
|
|
"num_tokens": 3769307.0,
|
|
"step": 1495
|
|
},
|
|
{
|
|
"entropy": 7.008484745025635,
|
|
"epoch": 0.17311021350259664,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004999623134397257,
|
|
"loss": 6.9637,
|
|
"mean_token_accuracy": 0.14434833228588104,
|
|
"num_tokens": 3782826.0,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"entropy": 7.155062961578369,
|
|
"epoch": 0.1736872475476053,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004999615544358774,
|
|
"loss": 6.969,
|
|
"mean_token_accuracy": 0.13818738386034965,
|
|
"num_tokens": 3794566.0,
|
|
"step": 1505
|
|
},
|
|
{
|
|
"entropy": 7.102244281768799,
|
|
"epoch": 0.17426428159261395,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004999607878655587,
|
|
"loss": 7.0508,
|
|
"mean_token_accuracy": 0.13246384710073472,
|
|
"num_tokens": 3807058.0,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"entropy": 7.190773010253906,
|
|
"epoch": 0.17484131563762262,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004999600137287958,
|
|
"loss": 6.9966,
|
|
"mean_token_accuracy": 0.1451525256037712,
|
|
"num_tokens": 3819836.0,
|
|
"step": 1515
|
|
},
|
|
{
|
|
"entropy": 7.112970066070557,
|
|
"epoch": 0.17541834968263129,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004999592320256146,
|
|
"loss": 7.0526,
|
|
"mean_token_accuracy": 0.13325869366526605,
|
|
"num_tokens": 3832081.0,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"entropy": 7.19920711517334,
|
|
"epoch": 0.17599538372763993,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004999584427560412,
|
|
"loss": 6.9666,
|
|
"mean_token_accuracy": 0.14759944379329681,
|
|
"num_tokens": 3843279.0,
|
|
"step": 1525
|
|
},
|
|
{
|
|
"entropy": 7.110972738265991,
|
|
"epoch": 0.1765724177726486,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004999576459201024,
|
|
"loss": 7.0377,
|
|
"mean_token_accuracy": 0.14277849197387696,
|
|
"num_tokens": 3855479.0,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"entropy": 7.166525030136109,
|
|
"epoch": 0.17714945181765723,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.000499956841517825,
|
|
"loss": 7.0261,
|
|
"mean_token_accuracy": 0.14007299840450288,
|
|
"num_tokens": 3868111.0,
|
|
"step": 1535
|
|
},
|
|
{
|
|
"entropy": 7.039232683181763,
|
|
"epoch": 0.1777264858626659,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000499956029549236,
|
|
"loss": 6.9523,
|
|
"mean_token_accuracy": 0.14354307875037192,
|
|
"num_tokens": 3880062.0,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"entropy": 7.2218320846557615,
|
|
"epoch": 0.17830351990767454,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004999552100143625,
|
|
"loss": 7.038,
|
|
"mean_token_accuracy": 0.1351063035428524,
|
|
"num_tokens": 3892293.0,
|
|
"step": 1545
|
|
},
|
|
{
|
|
"entropy": 7.088453531265259,
|
|
"epoch": 0.1788805539526832,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004999543829132324,
|
|
"loss": 6.9011,
|
|
"mean_token_accuracy": 0.14455311074852945,
|
|
"num_tokens": 3904549.0,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"entropy": 7.0796609878540036,
|
|
"epoch": 0.17945758799769188,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004999535482458734,
|
|
"loss": 6.952,
|
|
"mean_token_accuracy": 0.14381684213876725,
|
|
"num_tokens": 3916693.0,
|
|
"step": 1555
|
|
},
|
|
{
|
|
"entropy": 7.087669706344604,
|
|
"epoch": 0.18003462204270052,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004999527060123135,
|
|
"loss": 6.9651,
|
|
"mean_token_accuracy": 0.13298058956861497,
|
|
"num_tokens": 3930488.0,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"entropy": 7.125672006607056,
|
|
"epoch": 0.18061165608770918,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004999518562125811,
|
|
"loss": 6.9626,
|
|
"mean_token_accuracy": 0.14101526886224747,
|
|
"num_tokens": 3942353.0,
|
|
"step": 1565
|
|
},
|
|
{
|
|
"entropy": 7.161968660354614,
|
|
"epoch": 0.18118869013271782,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004999509988467047,
|
|
"loss": 7.0103,
|
|
"mean_token_accuracy": 0.13919673189520837,
|
|
"num_tokens": 3953868.0,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"entropy": 7.124320602416992,
|
|
"epoch": 0.1817657241777265,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004999501339147132,
|
|
"loss": 7.0217,
|
|
"mean_token_accuracy": 0.1360984094440937,
|
|
"num_tokens": 3965148.0,
|
|
"step": 1575
|
|
},
|
|
{
|
|
"entropy": 7.110309076309204,
|
|
"epoch": 0.18234275822273513,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004999492614166357,
|
|
"loss": 6.9888,
|
|
"mean_token_accuracy": 0.14489941596984862,
|
|
"num_tokens": 3977323.0,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"entropy": 7.14143214225769,
|
|
"epoch": 0.1829197922677438,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004999483813525014,
|
|
"loss": 6.9486,
|
|
"mean_token_accuracy": 0.14665654599666594,
|
|
"num_tokens": 3990076.0,
|
|
"step": 1585
|
|
},
|
|
{
|
|
"entropy": 7.0736024379730225,
|
|
"epoch": 0.18349682631275246,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004999474937223403,
|
|
"loss": 6.958,
|
|
"mean_token_accuracy": 0.13847637176513672,
|
|
"num_tokens": 4001996.0,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"entropy": 7.1584230899810795,
|
|
"epoch": 0.1840738603577611,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004999465985261818,
|
|
"loss": 6.996,
|
|
"mean_token_accuracy": 0.13838272169232368,
|
|
"num_tokens": 4015095.0,
|
|
"step": 1595
|
|
},
|
|
{
|
|
"entropy": 7.085082769393921,
|
|
"epoch": 0.18465089440276977,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004999456957640562,
|
|
"loss": 6.8885,
|
|
"mean_token_accuracy": 0.14849510788917542,
|
|
"num_tokens": 4028633.0,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"entropy": 7.059274530410766,
|
|
"epoch": 0.1852279284477784,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004999447854359939,
|
|
"loss": 6.9902,
|
|
"mean_token_accuracy": 0.14084767922759056,
|
|
"num_tokens": 4042265.0,
|
|
"step": 1605
|
|
},
|
|
{
|
|
"entropy": 7.04382438659668,
|
|
"epoch": 0.18580496249278708,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004999438675420255,
|
|
"loss": 6.9434,
|
|
"mean_token_accuracy": 0.14098646268248557,
|
|
"num_tokens": 4054467.0,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"entropy": 7.100906753540039,
|
|
"epoch": 0.18638199653779572,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004999429420821818,
|
|
"loss": 6.9422,
|
|
"mean_token_accuracy": 0.14708167761564256,
|
|
"num_tokens": 4068053.0,
|
|
"step": 1615
|
|
},
|
|
{
|
|
"entropy": 6.988407993316651,
|
|
"epoch": 0.1869590305828044,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000499942009056494,
|
|
"loss": 6.9174,
|
|
"mean_token_accuracy": 0.14443018585443496,
|
|
"num_tokens": 4080867.0,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"entropy": 7.123555755615234,
|
|
"epoch": 0.18753606462781305,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004999410684649935,
|
|
"loss": 6.9813,
|
|
"mean_token_accuracy": 0.13821664601564407,
|
|
"num_tokens": 4093228.0,
|
|
"step": 1625
|
|
},
|
|
{
|
|
"entropy": 7.086485910415649,
|
|
"epoch": 0.1881130986728217,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004999401203077119,
|
|
"loss": 6.9764,
|
|
"mean_token_accuracy": 0.14208749383687974,
|
|
"num_tokens": 4104929.0,
|
|
"step": 1630
|
|
},
|
|
{
|
|
"entropy": 7.062161016464233,
|
|
"epoch": 0.18869013271783036,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.000499939164584681,
|
|
"loss": 6.9907,
|
|
"mean_token_accuracy": 0.15021519139409065,
|
|
"num_tokens": 4119445.0,
|
|
"step": 1635
|
|
},
|
|
{
|
|
"entropy": 7.106227540969849,
|
|
"epoch": 0.189267166762839,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004999382012959331,
|
|
"loss": 6.8918,
|
|
"mean_token_accuracy": 0.15079083889722825,
|
|
"num_tokens": 4131558.0,
|
|
"step": 1640
|
|
},
|
|
{
|
|
"entropy": 7.123133182525635,
|
|
"epoch": 0.18984420080784767,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004999372304415005,
|
|
"loss": 7.0313,
|
|
"mean_token_accuracy": 0.12920064106583595,
|
|
"num_tokens": 4144566.0,
|
|
"step": 1645
|
|
},
|
|
{
|
|
"entropy": 7.113665962219239,
|
|
"epoch": 0.1904212348528563,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004999362520214159,
|
|
"loss": 6.9219,
|
|
"mean_token_accuracy": 0.14697587639093398,
|
|
"num_tokens": 4157295.0,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"entropy": 7.081795692443848,
|
|
"epoch": 0.19099826889786498,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004999352660357122,
|
|
"loss": 6.9574,
|
|
"mean_token_accuracy": 0.1411465436220169,
|
|
"num_tokens": 4170229.0,
|
|
"step": 1655
|
|
},
|
|
{
|
|
"entropy": 7.1123281955719,
|
|
"epoch": 0.19157530294287364,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004999342724844226,
|
|
"loss": 6.9703,
|
|
"mean_token_accuracy": 0.13845267817378043,
|
|
"num_tokens": 4182906.0,
|
|
"step": 1660
|
|
},
|
|
{
|
|
"entropy": 7.087953901290893,
|
|
"epoch": 0.19215233698788228,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004999332713675804,
|
|
"loss": 6.9325,
|
|
"mean_token_accuracy": 0.143193506449461,
|
|
"num_tokens": 4195556.0,
|
|
"step": 1665
|
|
},
|
|
{
|
|
"entropy": 7.084608936309815,
|
|
"epoch": 0.19272937103289095,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004999322626852193,
|
|
"loss": 6.902,
|
|
"mean_token_accuracy": 0.13993172571063042,
|
|
"num_tokens": 4207616.0,
|
|
"step": 1670
|
|
},
|
|
{
|
|
"entropy": 7.025543546676635,
|
|
"epoch": 0.1933064050778996,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004999312464373734,
|
|
"loss": 6.8576,
|
|
"mean_token_accuracy": 0.14821547120809556,
|
|
"num_tokens": 4219299.0,
|
|
"step": 1675
|
|
},
|
|
{
|
|
"entropy": 7.017240190505982,
|
|
"epoch": 0.19388343912290826,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004999302226240767,
|
|
"loss": 6.997,
|
|
"mean_token_accuracy": 0.13786116614937782,
|
|
"num_tokens": 4232098.0,
|
|
"step": 1680
|
|
},
|
|
{
|
|
"entropy": 7.080112934112549,
|
|
"epoch": 0.1944604731679169,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004999291912453637,
|
|
"loss": 6.8995,
|
|
"mean_token_accuracy": 0.14469338953495026,
|
|
"num_tokens": 4243879.0,
|
|
"step": 1685
|
|
},
|
|
{
|
|
"entropy": 7.064555072784424,
|
|
"epoch": 0.19503750721292556,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004999281523012691,
|
|
"loss": 6.9828,
|
|
"mean_token_accuracy": 0.13740749657154083,
|
|
"num_tokens": 4256507.0,
|
|
"step": 1690
|
|
},
|
|
{
|
|
"entropy": 7.218221855163574,
|
|
"epoch": 0.1956145412579342,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004999271057918278,
|
|
"loss": 7.0398,
|
|
"mean_token_accuracy": 0.13457229733467102,
|
|
"num_tokens": 4270763.0,
|
|
"step": 1695
|
|
},
|
|
{
|
|
"entropy": 7.035730075836182,
|
|
"epoch": 0.19619157530294287,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004999260517170751,
|
|
"loss": 6.9131,
|
|
"mean_token_accuracy": 0.14340217858552934,
|
|
"num_tokens": 4284380.0,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"entropy": 7.1246764183044435,
|
|
"epoch": 0.19676860934795154,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004999249900770463,
|
|
"loss": 7.0215,
|
|
"mean_token_accuracy": 0.13842824175953866,
|
|
"num_tokens": 4297812.0,
|
|
"step": 1705
|
|
},
|
|
{
|
|
"entropy": 7.021434783935547,
|
|
"epoch": 0.19734564339296018,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004999239208717772,
|
|
"loss": 6.9875,
|
|
"mean_token_accuracy": 0.14540473818778993,
|
|
"num_tokens": 4310374.0,
|
|
"step": 1710
|
|
},
|
|
{
|
|
"entropy": 7.130036401748657,
|
|
"epoch": 0.19792267743796885,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004999228441013037,
|
|
"loss": 6.9861,
|
|
"mean_token_accuracy": 0.13793584629893302,
|
|
"num_tokens": 4322330.0,
|
|
"step": 1715
|
|
},
|
|
{
|
|
"entropy": 7.092807817459106,
|
|
"epoch": 0.1984997114829775,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.000499921759765662,
|
|
"loss": 6.9437,
|
|
"mean_token_accuracy": 0.14130837395787238,
|
|
"num_tokens": 4335204.0,
|
|
"step": 1720
|
|
},
|
|
{
|
|
"entropy": 6.928855037689209,
|
|
"epoch": 0.19907674552798615,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004999206678648888,
|
|
"loss": 6.8285,
|
|
"mean_token_accuracy": 0.14999809116125107,
|
|
"num_tokens": 4347339.0,
|
|
"step": 1725
|
|
},
|
|
{
|
|
"entropy": 7.080965518951416,
|
|
"epoch": 0.1996537795729948,
|
|
"grad_norm": 1.71875,
|
|
"learning_rate": 0.0004999195683990206,
|
|
"loss": 6.8898,
|
|
"mean_token_accuracy": 0.14809404462575912,
|
|
"num_tokens": 4360273.0,
|
|
"step": 1730
|
|
},
|
|
{
|
|
"entropy": 7.013464021682739,
|
|
"epoch": 0.20023081361800346,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004999184613680945,
|
|
"loss": 6.9012,
|
|
"mean_token_accuracy": 0.14106058850884437,
|
|
"num_tokens": 4373424.0,
|
|
"step": 1735
|
|
},
|
|
{
|
|
"entropy": 7.049986457824707,
|
|
"epoch": 0.20080784766301213,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004999173467721476,
|
|
"loss": 6.8544,
|
|
"mean_token_accuracy": 0.15058322101831437,
|
|
"num_tokens": 4386125.0,
|
|
"step": 1740
|
|
},
|
|
{
|
|
"entropy": 7.018032741546631,
|
|
"epoch": 0.20138488170802077,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004999162246112175,
|
|
"loss": 6.9365,
|
|
"mean_token_accuracy": 0.13854823932051658,
|
|
"num_tokens": 4399214.0,
|
|
"step": 1745
|
|
},
|
|
{
|
|
"entropy": 6.9998067855834964,
|
|
"epoch": 0.20196191575302944,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004999150948853419,
|
|
"loss": 6.8127,
|
|
"mean_token_accuracy": 0.14680370092391967,
|
|
"num_tokens": 4411282.0,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"entropy": 6.969420385360718,
|
|
"epoch": 0.20253894979803808,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004999139575945587,
|
|
"loss": 6.909,
|
|
"mean_token_accuracy": 0.14443379119038582,
|
|
"num_tokens": 4423448.0,
|
|
"step": 1755
|
|
},
|
|
{
|
|
"entropy": 7.101949882507324,
|
|
"epoch": 0.20311598384304674,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004999128127389065,
|
|
"loss": 6.8176,
|
|
"mean_token_accuracy": 0.15111797004938127,
|
|
"num_tokens": 4436498.0,
|
|
"step": 1760
|
|
},
|
|
{
|
|
"entropy": 6.992865753173828,
|
|
"epoch": 0.20369301788805538,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004999116603184233,
|
|
"loss": 6.8342,
|
|
"mean_token_accuracy": 0.1466807797551155,
|
|
"num_tokens": 4448641.0,
|
|
"step": 1765
|
|
},
|
|
{
|
|
"entropy": 6.9575080394744875,
|
|
"epoch": 0.20427005193306405,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004999105003331482,
|
|
"loss": 6.8404,
|
|
"mean_token_accuracy": 0.1423793762922287,
|
|
"num_tokens": 4460539.0,
|
|
"step": 1770
|
|
},
|
|
{
|
|
"entropy": 7.0623860359191895,
|
|
"epoch": 0.20484708597807272,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004999093327831202,
|
|
"loss": 6.8898,
|
|
"mean_token_accuracy": 0.14088162109255792,
|
|
"num_tokens": 4472487.0,
|
|
"step": 1775
|
|
},
|
|
{
|
|
"entropy": 6.952205657958984,
|
|
"epoch": 0.20542412002308136,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004999081576683784,
|
|
"loss": 6.8802,
|
|
"mean_token_accuracy": 0.1421337030827999,
|
|
"num_tokens": 4485164.0,
|
|
"step": 1780
|
|
},
|
|
{
|
|
"entropy": 7.1306853771209715,
|
|
"epoch": 0.20600115406809003,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004999069749889626,
|
|
"loss": 6.8973,
|
|
"mean_token_accuracy": 0.14712294787168503,
|
|
"num_tokens": 4497708.0,
|
|
"step": 1785
|
|
},
|
|
{
|
|
"entropy": 6.940166759490967,
|
|
"epoch": 0.20657818811309867,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004999057847449123,
|
|
"loss": 6.9329,
|
|
"mean_token_accuracy": 0.1391274891793728,
|
|
"num_tokens": 4510648.0,
|
|
"step": 1790
|
|
},
|
|
{
|
|
"entropy": 7.065713214874267,
|
|
"epoch": 0.20715522215810733,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004999045869362678,
|
|
"loss": 6.8511,
|
|
"mean_token_accuracy": 0.14565493836998938,
|
|
"num_tokens": 4522699.0,
|
|
"step": 1795
|
|
},
|
|
{
|
|
"entropy": 6.939832353591919,
|
|
"epoch": 0.20773225620311597,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.000499903381563069,
|
|
"loss": 6.8936,
|
|
"mean_token_accuracy": 0.13873664960265158,
|
|
"num_tokens": 4536060.0,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"entropy": 6.97990312576294,
|
|
"epoch": 0.20830929024812464,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004999021686253568,
|
|
"loss": 6.8257,
|
|
"mean_token_accuracy": 0.13769187703728675,
|
|
"num_tokens": 4549876.0,
|
|
"step": 1805
|
|
},
|
|
{
|
|
"entropy": 7.080778312683106,
|
|
"epoch": 0.2088863242931333,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004999009481231719,
|
|
"loss": 6.8655,
|
|
"mean_token_accuracy": 0.14449936226010324,
|
|
"num_tokens": 4563638.0,
|
|
"step": 1810
|
|
},
|
|
{
|
|
"entropy": 6.9409098625183105,
|
|
"epoch": 0.20946335833814195,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004998997200565553,
|
|
"loss": 6.8057,
|
|
"mean_token_accuracy": 0.14341058060526848,
|
|
"num_tokens": 4575396.0,
|
|
"step": 1815
|
|
},
|
|
{
|
|
"entropy": 6.935875415802002,
|
|
"epoch": 0.21004039238315061,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004998984844255483,
|
|
"loss": 6.8199,
|
|
"mean_token_accuracy": 0.14724263399839402,
|
|
"num_tokens": 4587261.0,
|
|
"step": 1820
|
|
},
|
|
{
|
|
"entropy": 7.076818370819092,
|
|
"epoch": 0.21061742642815925,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004998972412301925,
|
|
"loss": 6.9409,
|
|
"mean_token_accuracy": 0.14100464209914207,
|
|
"num_tokens": 4600086.0,
|
|
"step": 1825
|
|
},
|
|
{
|
|
"entropy": 7.006335687637329,
|
|
"epoch": 0.21119446047316792,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004998959904705297,
|
|
"loss": 6.8993,
|
|
"mean_token_accuracy": 0.14008133336901665,
|
|
"num_tokens": 4612320.0,
|
|
"step": 1830
|
|
},
|
|
{
|
|
"entropy": 6.99210262298584,
|
|
"epoch": 0.21177149451817656,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004998947321466021,
|
|
"loss": 6.8464,
|
|
"mean_token_accuracy": 0.14648700058460234,
|
|
"num_tokens": 4623545.0,
|
|
"step": 1835
|
|
},
|
|
{
|
|
"entropy": 6.954314517974853,
|
|
"epoch": 0.21234852856318523,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004998934662584518,
|
|
"loss": 6.7498,
|
|
"mean_token_accuracy": 0.1578306920826435,
|
|
"num_tokens": 4637223.0,
|
|
"step": 1840
|
|
},
|
|
{
|
|
"entropy": 6.826448059082031,
|
|
"epoch": 0.2129255626081939,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004998921928061214,
|
|
"loss": 6.837,
|
|
"mean_token_accuracy": 0.14694164842367172,
|
|
"num_tokens": 4649748.0,
|
|
"step": 1845
|
|
},
|
|
{
|
|
"entropy": 7.0238566398620605,
|
|
"epoch": 0.21350259665320254,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004998909117896539,
|
|
"loss": 6.8732,
|
|
"mean_token_accuracy": 0.1458170548081398,
|
|
"num_tokens": 4662441.0,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"entropy": 6.895988988876343,
|
|
"epoch": 0.2140796306982112,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004998896232090922,
|
|
"loss": 6.8337,
|
|
"mean_token_accuracy": 0.15489335879683494,
|
|
"num_tokens": 4675546.0,
|
|
"step": 1855
|
|
},
|
|
{
|
|
"entropy": 7.177361154556275,
|
|
"epoch": 0.21465666474321984,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004998883270644798,
|
|
"loss": 6.9068,
|
|
"mean_token_accuracy": 0.13811369463801385,
|
|
"num_tokens": 4687601.0,
|
|
"step": 1860
|
|
},
|
|
{
|
|
"entropy": 6.91638216972351,
|
|
"epoch": 0.2152336987882285,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004998870233558602,
|
|
"loss": 6.7837,
|
|
"mean_token_accuracy": 0.15353625565767287,
|
|
"num_tokens": 4699336.0,
|
|
"step": 1865
|
|
},
|
|
{
|
|
"entropy": 6.911949300765992,
|
|
"epoch": 0.21581073283323715,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004998857120832774,
|
|
"loss": 6.9744,
|
|
"mean_token_accuracy": 0.13845321610569955,
|
|
"num_tokens": 4714312.0,
|
|
"step": 1870
|
|
},
|
|
{
|
|
"entropy": 6.956019687652588,
|
|
"epoch": 0.21638776687824582,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004998843932467751,
|
|
"loss": 6.7036,
|
|
"mean_token_accuracy": 0.15298319831490517,
|
|
"num_tokens": 4726436.0,
|
|
"step": 1875
|
|
},
|
|
{
|
|
"entropy": 6.97105393409729,
|
|
"epoch": 0.21696480092325446,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004998830668463982,
|
|
"loss": 6.9324,
|
|
"mean_token_accuracy": 0.13379157483577728,
|
|
"num_tokens": 4739821.0,
|
|
"step": 1880
|
|
},
|
|
{
|
|
"entropy": 7.089961147308349,
|
|
"epoch": 0.21754183496826313,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004998817328821909,
|
|
"loss": 6.9187,
|
|
"mean_token_accuracy": 0.13890728428959848,
|
|
"num_tokens": 4752701.0,
|
|
"step": 1885
|
|
},
|
|
{
|
|
"entropy": 6.965564870834351,
|
|
"epoch": 0.2181188690132718,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004998803913541983,
|
|
"loss": 6.9329,
|
|
"mean_token_accuracy": 0.14065297245979308,
|
|
"num_tokens": 4766755.0,
|
|
"step": 1890
|
|
},
|
|
{
|
|
"entropy": 7.006665802001953,
|
|
"epoch": 0.21869590305828043,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004998790422624654,
|
|
"loss": 6.8586,
|
|
"mean_token_accuracy": 0.1429077446460724,
|
|
"num_tokens": 4780201.0,
|
|
"step": 1895
|
|
},
|
|
{
|
|
"entropy": 6.957398748397827,
|
|
"epoch": 0.2192729371032891,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004998776856070376,
|
|
"loss": 6.81,
|
|
"mean_token_accuracy": 0.1421031355857849,
|
|
"num_tokens": 4792488.0,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"entropy": 6.996427440643311,
|
|
"epoch": 0.21984997114829774,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004998763213879606,
|
|
"loss": 6.7886,
|
|
"mean_token_accuracy": 0.14664288908243178,
|
|
"num_tokens": 4805154.0,
|
|
"step": 1905
|
|
},
|
|
{
|
|
"entropy": 6.966566801071167,
|
|
"epoch": 0.2204270051933064,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004998749496052803,
|
|
"loss": 6.8471,
|
|
"mean_token_accuracy": 0.14108580872416496,
|
|
"num_tokens": 4817947.0,
|
|
"step": 1910
|
|
},
|
|
{
|
|
"entropy": 6.996940803527832,
|
|
"epoch": 0.22100403923831505,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004998735702590426,
|
|
"loss": 6.828,
|
|
"mean_token_accuracy": 0.1447738878428936,
|
|
"num_tokens": 4830296.0,
|
|
"step": 1915
|
|
},
|
|
{
|
|
"entropy": 6.933389377593994,
|
|
"epoch": 0.22158107328332372,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004998721833492942,
|
|
"loss": 6.8253,
|
|
"mean_token_accuracy": 0.14365117698907853,
|
|
"num_tokens": 4841210.0,
|
|
"step": 1920
|
|
},
|
|
{
|
|
"entropy": 7.029626893997192,
|
|
"epoch": 0.22215810732833238,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004998707888760816,
|
|
"loss": 6.8996,
|
|
"mean_token_accuracy": 0.13317479714751243,
|
|
"num_tokens": 4854406.0,
|
|
"step": 1925
|
|
},
|
|
{
|
|
"entropy": 6.965882301330566,
|
|
"epoch": 0.22273514137334102,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004998693868394516,
|
|
"loss": 6.8706,
|
|
"mean_token_accuracy": 0.14146279469132422,
|
|
"num_tokens": 4868156.0,
|
|
"step": 1930
|
|
},
|
|
{
|
|
"entropy": 7.022164821624756,
|
|
"epoch": 0.2233121754183497,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004998679772394516,
|
|
"loss": 6.804,
|
|
"mean_token_accuracy": 0.15072066336870193,
|
|
"num_tokens": 4880314.0,
|
|
"step": 1935
|
|
},
|
|
{
|
|
"entropy": 6.920300674438477,
|
|
"epoch": 0.22388920946335833,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004998665600761289,
|
|
"loss": 6.813,
|
|
"mean_token_accuracy": 0.14527895897626877,
|
|
"num_tokens": 4892652.0,
|
|
"step": 1940
|
|
},
|
|
{
|
|
"entropy": 7.060734128952026,
|
|
"epoch": 0.224466243508367,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.000499865135349531,
|
|
"loss": 6.9048,
|
|
"mean_token_accuracy": 0.13892186135053636,
|
|
"num_tokens": 4905791.0,
|
|
"step": 1945
|
|
},
|
|
{
|
|
"entropy": 6.940855360031128,
|
|
"epoch": 0.22504327755337564,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004998637030597061,
|
|
"loss": 6.8723,
|
|
"mean_token_accuracy": 0.14380484744906424,
|
|
"num_tokens": 4917359.0,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"entropy": 7.036824655532837,
|
|
"epoch": 0.2256203115983843,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004998622632067022,
|
|
"loss": 6.8305,
|
|
"mean_token_accuracy": 0.14697285592556,
|
|
"num_tokens": 4928762.0,
|
|
"step": 1955
|
|
},
|
|
{
|
|
"entropy": 6.926147079467773,
|
|
"epoch": 0.22619734564339297,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004998608157905678,
|
|
"loss": 6.8447,
|
|
"mean_token_accuracy": 0.14583281725645064,
|
|
"num_tokens": 4940879.0,
|
|
"step": 1960
|
|
},
|
|
{
|
|
"entropy": 7.006029081344605,
|
|
"epoch": 0.2267743796884016,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004998593608113515,
|
|
"loss": 6.8538,
|
|
"mean_token_accuracy": 0.14606458991765975,
|
|
"num_tokens": 4952979.0,
|
|
"step": 1965
|
|
},
|
|
{
|
|
"entropy": 6.918392038345337,
|
|
"epoch": 0.22735141373341028,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004998578982691024,
|
|
"loss": 6.7524,
|
|
"mean_token_accuracy": 0.1569880038499832,
|
|
"num_tokens": 4965465.0,
|
|
"step": 1970
|
|
},
|
|
{
|
|
"entropy": 6.9123780727386475,
|
|
"epoch": 0.22792844777841892,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004998564281638694,
|
|
"loss": 6.8233,
|
|
"mean_token_accuracy": 0.14547210037708283,
|
|
"num_tokens": 4977960.0,
|
|
"step": 1975
|
|
},
|
|
{
|
|
"entropy": 6.97648549079895,
|
|
"epoch": 0.2285054818234276,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004998549504957023,
|
|
"loss": 6.8274,
|
|
"mean_token_accuracy": 0.14264762550592422,
|
|
"num_tokens": 4990732.0,
|
|
"step": 1980
|
|
},
|
|
{
|
|
"entropy": 6.921519327163696,
|
|
"epoch": 0.22908251586843623,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004998534652646506,
|
|
"loss": 6.7678,
|
|
"mean_token_accuracy": 0.14480722099542617,
|
|
"num_tokens": 5002482.0,
|
|
"step": 1985
|
|
},
|
|
{
|
|
"entropy": 6.902936887741089,
|
|
"epoch": 0.2296595499134449,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004998519724707642,
|
|
"loss": 6.7529,
|
|
"mean_token_accuracy": 0.14723773747682573,
|
|
"num_tokens": 5014932.0,
|
|
"step": 1990
|
|
},
|
|
{
|
|
"entropy": 6.885674381256104,
|
|
"epoch": 0.23023658395845356,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004998504721140934,
|
|
"loss": 6.8837,
|
|
"mean_token_accuracy": 0.138965655118227,
|
|
"num_tokens": 5027661.0,
|
|
"step": 1995
|
|
},
|
|
{
|
|
"entropy": 6.906474590301514,
|
|
"epoch": 0.2308136180034622,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004998489641946887,
|
|
"loss": 6.6331,
|
|
"mean_token_accuracy": 0.1527172051370144,
|
|
"num_tokens": 5040657.0,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"entropy": 6.975762939453125,
|
|
"epoch": 0.23139065204847087,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004998474487126009,
|
|
"loss": 6.9063,
|
|
"mean_token_accuracy": 0.13616069480776788,
|
|
"num_tokens": 5054408.0,
|
|
"step": 2005
|
|
},
|
|
{
|
|
"entropy": 6.98120608329773,
|
|
"epoch": 0.2319676860934795,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004998459256678806,
|
|
"loss": 6.7998,
|
|
"mean_token_accuracy": 0.14582831785082817,
|
|
"num_tokens": 5065499.0,
|
|
"step": 2010
|
|
},
|
|
{
|
|
"entropy": 6.935510063171387,
|
|
"epoch": 0.23254472013848818,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004998443950605796,
|
|
"loss": 6.7508,
|
|
"mean_token_accuracy": 0.15238589197397232,
|
|
"num_tokens": 5077009.0,
|
|
"step": 2015
|
|
},
|
|
{
|
|
"entropy": 6.931089639663696,
|
|
"epoch": 0.23312175418349682,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004998428568907488,
|
|
"loss": 6.925,
|
|
"mean_token_accuracy": 0.13808261305093766,
|
|
"num_tokens": 5089462.0,
|
|
"step": 2020
|
|
},
|
|
{
|
|
"entropy": 6.99543948173523,
|
|
"epoch": 0.23369878822850548,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004998413111584403,
|
|
"loss": 6.8333,
|
|
"mean_token_accuracy": 0.1430407203733921,
|
|
"num_tokens": 5101816.0,
|
|
"step": 2025
|
|
},
|
|
{
|
|
"entropy": 6.949823617935181,
|
|
"epoch": 0.23427582227351415,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004998397578637059,
|
|
"loss": 6.7939,
|
|
"mean_token_accuracy": 0.1399306148290634,
|
|
"num_tokens": 5115085.0,
|
|
"step": 2030
|
|
},
|
|
{
|
|
"entropy": 6.912753963470459,
|
|
"epoch": 0.2348528563185228,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.000499838197006598,
|
|
"loss": 6.8265,
|
|
"mean_token_accuracy": 0.1417170412838459,
|
|
"num_tokens": 5127705.0,
|
|
"step": 2035
|
|
},
|
|
{
|
|
"entropy": 6.916851139068603,
|
|
"epoch": 0.23542989036353146,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.000499836628587169,
|
|
"loss": 6.786,
|
|
"mean_token_accuracy": 0.1507592000067234,
|
|
"num_tokens": 5140509.0,
|
|
"step": 2040
|
|
},
|
|
{
|
|
"entropy": 6.963552236557007,
|
|
"epoch": 0.2360069244085401,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004998350526054716,
|
|
"loss": 6.8285,
|
|
"mean_token_accuracy": 0.1409867897629738,
|
|
"num_tokens": 5153538.0,
|
|
"step": 2045
|
|
},
|
|
{
|
|
"entropy": 6.918388509750367,
|
|
"epoch": 0.23658395845354876,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004998334690615591,
|
|
"loss": 6.7526,
|
|
"mean_token_accuracy": 0.14691582769155503,
|
|
"num_tokens": 5166181.0,
|
|
"step": 2050
|
|
},
|
|
{
|
|
"entropy": 6.877604293823242,
|
|
"epoch": 0.2371609924985574,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004998318779554844,
|
|
"loss": 6.7855,
|
|
"mean_token_accuracy": 0.14772634357213973,
|
|
"num_tokens": 5177209.0,
|
|
"step": 2055
|
|
},
|
|
{
|
|
"entropy": 6.908311414718628,
|
|
"epoch": 0.23773802654356607,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004998302792873012,
|
|
"loss": 6.8049,
|
|
"mean_token_accuracy": 0.14239051789045334,
|
|
"num_tokens": 5189786.0,
|
|
"step": 2060
|
|
},
|
|
{
|
|
"entropy": 6.952730369567871,
|
|
"epoch": 0.23831506058857474,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004998286730570631,
|
|
"loss": 6.7892,
|
|
"mean_token_accuracy": 0.1510260708630085,
|
|
"num_tokens": 5202629.0,
|
|
"step": 2065
|
|
},
|
|
{
|
|
"entropy": 6.907465410232544,
|
|
"epoch": 0.23889209463358338,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004998270592648245,
|
|
"loss": 6.8561,
|
|
"mean_token_accuracy": 0.13883134126663207,
|
|
"num_tokens": 5215339.0,
|
|
"step": 2070
|
|
},
|
|
{
|
|
"entropy": 6.9621459484100345,
|
|
"epoch": 0.23946912867859205,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004998254379106394,
|
|
"loss": 6.7359,
|
|
"mean_token_accuracy": 0.14754440188407897,
|
|
"num_tokens": 5227666.0,
|
|
"step": 2075
|
|
},
|
|
{
|
|
"entropy": 6.7812415599823,
|
|
"epoch": 0.2400461627236007,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004998238089945622,
|
|
"loss": 6.7107,
|
|
"mean_token_accuracy": 0.1521335408091545,
|
|
"num_tokens": 5238200.0,
|
|
"step": 2080
|
|
},
|
|
{
|
|
"entropy": 6.852583646774292,
|
|
"epoch": 0.24062319676860935,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004998221725166479,
|
|
"loss": 6.6654,
|
|
"mean_token_accuracy": 0.15192302465438842,
|
|
"num_tokens": 5250023.0,
|
|
"step": 2085
|
|
},
|
|
{
|
|
"entropy": 6.927479076385498,
|
|
"epoch": 0.241200230813618,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004998205284769516,
|
|
"loss": 6.8416,
|
|
"mean_token_accuracy": 0.1361626349389553,
|
|
"num_tokens": 5262634.0,
|
|
"step": 2090
|
|
},
|
|
{
|
|
"entropy": 6.945438241958618,
|
|
"epoch": 0.24177726485862666,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004998188768755285,
|
|
"loss": 6.8404,
|
|
"mean_token_accuracy": 0.1391704946756363,
|
|
"num_tokens": 5275739.0,
|
|
"step": 2095
|
|
},
|
|
{
|
|
"entropy": 6.907373285293579,
|
|
"epoch": 0.2423542989036353,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004998172177124341,
|
|
"loss": 6.8036,
|
|
"mean_token_accuracy": 0.14423199594020844,
|
|
"num_tokens": 5289223.0,
|
|
"step": 2100
|
|
},
|
|
{
|
|
"entropy": 6.921164560317993,
|
|
"epoch": 0.24293133294864397,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004998155509877242,
|
|
"loss": 6.7918,
|
|
"mean_token_accuracy": 0.14191285520792007,
|
|
"num_tokens": 5301869.0,
|
|
"step": 2105
|
|
},
|
|
{
|
|
"entropy": 6.931911897659302,
|
|
"epoch": 0.24350836699365264,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.000499813876701455,
|
|
"loss": 6.8142,
|
|
"mean_token_accuracy": 0.140006385743618,
|
|
"num_tokens": 5314999.0,
|
|
"step": 2110
|
|
},
|
|
{
|
|
"entropy": 6.918317890167236,
|
|
"epoch": 0.24408540103866128,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004998121948536828,
|
|
"loss": 6.8173,
|
|
"mean_token_accuracy": 0.14651304483413696,
|
|
"num_tokens": 5328247.0,
|
|
"step": 2115
|
|
},
|
|
{
|
|
"entropy": 6.985309028625489,
|
|
"epoch": 0.24466243508366994,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004998105054444639,
|
|
"loss": 6.804,
|
|
"mean_token_accuracy": 0.13474133610725403,
|
|
"num_tokens": 5341054.0,
|
|
"step": 2120
|
|
},
|
|
{
|
|
"entropy": 6.888967895507813,
|
|
"epoch": 0.24523946912867858,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004998088084738555,
|
|
"loss": 6.8269,
|
|
"mean_token_accuracy": 0.14804685413837432,
|
|
"num_tokens": 5353857.0,
|
|
"step": 2125
|
|
},
|
|
{
|
|
"entropy": 6.884988164901733,
|
|
"epoch": 0.24581650317368725,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004998071039419144,
|
|
"loss": 6.7622,
|
|
"mean_token_accuracy": 0.14388485997915268,
|
|
"num_tokens": 5366072.0,
|
|
"step": 2130
|
|
},
|
|
{
|
|
"entropy": 6.902663278579712,
|
|
"epoch": 0.2463935372186959,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000499805391848698,
|
|
"loss": 6.7641,
|
|
"mean_token_accuracy": 0.1469337075948715,
|
|
"num_tokens": 5379613.0,
|
|
"step": 2135
|
|
},
|
|
{
|
|
"entropy": 6.88670859336853,
|
|
"epoch": 0.24697057126370456,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.000499803672194264,
|
|
"loss": 6.8005,
|
|
"mean_token_accuracy": 0.14418511241674423,
|
|
"num_tokens": 5392394.0,
|
|
"step": 2140
|
|
},
|
|
{
|
|
"entropy": 6.805346250534058,
|
|
"epoch": 0.24754760530871323,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004998019449786701,
|
|
"loss": 6.77,
|
|
"mean_token_accuracy": 0.14892241209745408,
|
|
"num_tokens": 5404127.0,
|
|
"step": 2145
|
|
},
|
|
{
|
|
"entropy": 7.025264120101928,
|
|
"epoch": 0.24812463935372187,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004998002102019744,
|
|
"loss": 6.8739,
|
|
"mean_token_accuracy": 0.13671603947877883,
|
|
"num_tokens": 5417317.0,
|
|
"step": 2150
|
|
},
|
|
{
|
|
"entropy": 6.881466197967529,
|
|
"epoch": 0.24870167339873053,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004997984678642354,
|
|
"loss": 6.7279,
|
|
"mean_token_accuracy": 0.1475033514201641,
|
|
"num_tokens": 5429991.0,
|
|
"step": 2155
|
|
},
|
|
{
|
|
"entropy": 6.890996217727661,
|
|
"epoch": 0.24927870744373917,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004997967179655115,
|
|
"loss": 6.7702,
|
|
"mean_token_accuracy": 0.13975565731525422,
|
|
"num_tokens": 5442661.0,
|
|
"step": 2160
|
|
},
|
|
{
|
|
"entropy": 6.903371953964234,
|
|
"epoch": 0.24985574148874784,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004997949605058617,
|
|
"loss": 6.7731,
|
|
"mean_token_accuracy": 0.1479140818119049,
|
|
"num_tokens": 5455876.0,
|
|
"step": 2165
|
|
},
|
|
{
|
|
"entropy": 6.838821744918823,
|
|
"epoch": 0.2504327755337565,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004997931954853451,
|
|
"loss": 6.7326,
|
|
"mean_token_accuracy": 0.1502830758690834,
|
|
"num_tokens": 5468151.0,
|
|
"step": 2170
|
|
},
|
|
{
|
|
"entropy": 6.829051685333252,
|
|
"epoch": 0.2510098095787651,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.000499791422904021,
|
|
"loss": 6.7642,
|
|
"mean_token_accuracy": 0.15258670300245286,
|
|
"num_tokens": 5481327.0,
|
|
"step": 2175
|
|
},
|
|
{
|
|
"entropy": 6.854774093627929,
|
|
"epoch": 0.2515868436237738,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004997896427619491,
|
|
"loss": 6.726,
|
|
"mean_token_accuracy": 0.14523358941078185,
|
|
"num_tokens": 5493794.0,
|
|
"step": 2180
|
|
},
|
|
{
|
|
"entropy": 6.833822202682495,
|
|
"epoch": 0.25216387766878245,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004997878550591892,
|
|
"loss": 6.7622,
|
|
"mean_token_accuracy": 0.14095828533172608,
|
|
"num_tokens": 5506831.0,
|
|
"step": 2185
|
|
},
|
|
{
|
|
"entropy": 6.8861846923828125,
|
|
"epoch": 0.2527409117137911,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004997860597958013,
|
|
"loss": 6.6629,
|
|
"mean_token_accuracy": 0.15049846321344376,
|
|
"num_tokens": 5518988.0,
|
|
"step": 2190
|
|
},
|
|
{
|
|
"entropy": 6.720967817306518,
|
|
"epoch": 0.2533179457587998,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004997842569718461,
|
|
"loss": 6.6284,
|
|
"mean_token_accuracy": 0.15226881206035614,
|
|
"num_tokens": 5530757.0,
|
|
"step": 2195
|
|
},
|
|
{
|
|
"entropy": 6.8386878490448,
|
|
"epoch": 0.25389497980380843,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000499782446587384,
|
|
"loss": 6.7462,
|
|
"mean_token_accuracy": 0.14984930008649827,
|
|
"num_tokens": 5542819.0,
|
|
"step": 2200
|
|
},
|
|
{
|
|
"entropy": 6.887057685852051,
|
|
"epoch": 0.25447201384881707,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.000499780628642476,
|
|
"loss": 6.7516,
|
|
"mean_token_accuracy": 0.1436480388045311,
|
|
"num_tokens": 5555797.0,
|
|
"step": 2205
|
|
},
|
|
{
|
|
"entropy": 6.8565185546875,
|
|
"epoch": 0.2550490478938257,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004997788031371834,
|
|
"loss": 6.8377,
|
|
"mean_token_accuracy": 0.13526439368724824,
|
|
"num_tokens": 5570086.0,
|
|
"step": 2210
|
|
},
|
|
{
|
|
"entropy": 6.880842208862305,
|
|
"epoch": 0.2556260819388344,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004997769700715672,
|
|
"loss": 6.6616,
|
|
"mean_token_accuracy": 0.15116312801837922,
|
|
"num_tokens": 5582182.0,
|
|
"step": 2215
|
|
},
|
|
{
|
|
"entropy": 6.771800470352173,
|
|
"epoch": 0.25620311598384304,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004997751294456892,
|
|
"loss": 6.7557,
|
|
"mean_token_accuracy": 0.1484261780977249,
|
|
"num_tokens": 5595395.0,
|
|
"step": 2220
|
|
},
|
|
{
|
|
"entropy": 6.907889366149902,
|
|
"epoch": 0.2567801500288517,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004997732812596114,
|
|
"loss": 6.7655,
|
|
"mean_token_accuracy": 0.14601099640130996,
|
|
"num_tokens": 5608555.0,
|
|
"step": 2225
|
|
},
|
|
{
|
|
"entropy": 6.852161073684693,
|
|
"epoch": 0.2573571840738604,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004997714255133961,
|
|
"loss": 6.7211,
|
|
"mean_token_accuracy": 0.14606622010469436,
|
|
"num_tokens": 5620933.0,
|
|
"step": 2230
|
|
},
|
|
{
|
|
"entropy": 6.908066129684448,
|
|
"epoch": 0.257934218118869,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004997695622071054,
|
|
"loss": 6.7645,
|
|
"mean_token_accuracy": 0.14898824393749238,
|
|
"num_tokens": 5634061.0,
|
|
"step": 2235
|
|
},
|
|
{
|
|
"entropy": 6.929029846191407,
|
|
"epoch": 0.25851125216387766,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004997676913408021,
|
|
"loss": 6.7291,
|
|
"mean_token_accuracy": 0.1483811229467392,
|
|
"num_tokens": 5646617.0,
|
|
"step": 2240
|
|
},
|
|
{
|
|
"entropy": 6.87813811302185,
|
|
"epoch": 0.2590882862088863,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004997658129145493,
|
|
"loss": 6.811,
|
|
"mean_token_accuracy": 0.14377271234989167,
|
|
"num_tokens": 5659361.0,
|
|
"step": 2245
|
|
},
|
|
{
|
|
"entropy": 6.849423265457153,
|
|
"epoch": 0.259665320253895,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004997639269284099,
|
|
"loss": 6.6528,
|
|
"mean_token_accuracy": 0.15414825975894927,
|
|
"num_tokens": 5670591.0,
|
|
"step": 2250
|
|
},
|
|
{
|
|
"entropy": 6.851912260055542,
|
|
"epoch": 0.26024235429890363,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004997620333824476,
|
|
"loss": 6.7722,
|
|
"mean_token_accuracy": 0.14549338743090628,
|
|
"num_tokens": 5683211.0,
|
|
"step": 2255
|
|
},
|
|
{
|
|
"entropy": 6.851926565170288,
|
|
"epoch": 0.2608193883439123,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004997601322767258,
|
|
"loss": 6.7653,
|
|
"mean_token_accuracy": 0.145635487139225,
|
|
"num_tokens": 5695654.0,
|
|
"step": 2260
|
|
},
|
|
{
|
|
"entropy": 6.795074939727783,
|
|
"epoch": 0.26139642238892097,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004997582236113087,
|
|
"loss": 6.6557,
|
|
"mean_token_accuracy": 0.15083891600370408,
|
|
"num_tokens": 5707776.0,
|
|
"step": 2265
|
|
},
|
|
{
|
|
"entropy": 6.822677946090698,
|
|
"epoch": 0.2619734564339296,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004997563073862603,
|
|
"loss": 6.7076,
|
|
"mean_token_accuracy": 0.14838095828890802,
|
|
"num_tokens": 5719895.0,
|
|
"step": 2270
|
|
},
|
|
{
|
|
"entropy": 6.895277500152588,
|
|
"epoch": 0.26255049047893825,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004997543836016453,
|
|
"loss": 6.7302,
|
|
"mean_token_accuracy": 0.15407091453671456,
|
|
"num_tokens": 5733280.0,
|
|
"step": 2275
|
|
},
|
|
{
|
|
"entropy": 6.825756692886353,
|
|
"epoch": 0.2631275245239469,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004997524522575281,
|
|
"loss": 6.7713,
|
|
"mean_token_accuracy": 0.14787696152925492,
|
|
"num_tokens": 5746563.0,
|
|
"step": 2280
|
|
},
|
|
{
|
|
"entropy": 6.933543157577515,
|
|
"epoch": 0.2637045585689556,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004997505133539738,
|
|
"loss": 6.8251,
|
|
"mean_token_accuracy": 0.14116834327578545,
|
|
"num_tokens": 5760735.0,
|
|
"step": 2285
|
|
},
|
|
{
|
|
"entropy": 6.7919364929199215,
|
|
"epoch": 0.2642815926139642,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004997485668910476,
|
|
"loss": 6.7403,
|
|
"mean_token_accuracy": 0.13866735473275185,
|
|
"num_tokens": 5774304.0,
|
|
"step": 2290
|
|
},
|
|
{
|
|
"entropy": 6.707546329498291,
|
|
"epoch": 0.26485862665897286,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004997466128688151,
|
|
"loss": 6.6343,
|
|
"mean_token_accuracy": 0.1520386144518852,
|
|
"num_tokens": 5786045.0,
|
|
"step": 2295
|
|
},
|
|
{
|
|
"entropy": 6.8912115573883055,
|
|
"epoch": 0.26543566070398156,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.000499744651287342,
|
|
"loss": 6.7038,
|
|
"mean_token_accuracy": 0.1507314458489418,
|
|
"num_tokens": 5798126.0,
|
|
"step": 2300
|
|
},
|
|
{
|
|
"entropy": 6.800000524520874,
|
|
"epoch": 0.2660126947489902,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.000499742682146694,
|
|
"loss": 6.708,
|
|
"mean_token_accuracy": 0.15146253854036332,
|
|
"num_tokens": 5809778.0,
|
|
"step": 2305
|
|
},
|
|
{
|
|
"entropy": 6.887187433242798,
|
|
"epoch": 0.26658972879399884,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004997407054469377,
|
|
"loss": 6.7913,
|
|
"mean_token_accuracy": 0.14095485657453538,
|
|
"num_tokens": 5821902.0,
|
|
"step": 2310
|
|
},
|
|
{
|
|
"entropy": 6.898465633392334,
|
|
"epoch": 0.2671667628390075,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004997387211881392,
|
|
"loss": 6.7311,
|
|
"mean_token_accuracy": 0.14221810474991797,
|
|
"num_tokens": 5835162.0,
|
|
"step": 2315
|
|
},
|
|
{
|
|
"entropy": 6.761828851699829,
|
|
"epoch": 0.26774379688401617,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004997367293703656,
|
|
"loss": 6.7284,
|
|
"mean_token_accuracy": 0.1507745712995529,
|
|
"num_tokens": 5847708.0,
|
|
"step": 2320
|
|
},
|
|
{
|
|
"entropy": 6.91298017501831,
|
|
"epoch": 0.2683208309290248,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004997347299936837,
|
|
"loss": 6.7346,
|
|
"mean_token_accuracy": 0.14922600761055946,
|
|
"num_tokens": 5860983.0,
|
|
"step": 2325
|
|
},
|
|
{
|
|
"entropy": 6.769803524017334,
|
|
"epoch": 0.26889786497403345,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004997327230581608,
|
|
"loss": 6.6998,
|
|
"mean_token_accuracy": 0.1437514305114746,
|
|
"num_tokens": 5873878.0,
|
|
"step": 2330
|
|
},
|
|
{
|
|
"entropy": 6.783571243286133,
|
|
"epoch": 0.26947489901904215,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004997307085638644,
|
|
"loss": 6.7147,
|
|
"mean_token_accuracy": 0.14909254312515258,
|
|
"num_tokens": 5886577.0,
|
|
"step": 2335
|
|
},
|
|
{
|
|
"entropy": 6.906566333770752,
|
|
"epoch": 0.2700519330640508,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004997286865108621,
|
|
"loss": 6.7362,
|
|
"mean_token_accuracy": 0.13940049409866334,
|
|
"num_tokens": 5900373.0,
|
|
"step": 2340
|
|
},
|
|
{
|
|
"entropy": 6.771531581878662,
|
|
"epoch": 0.2706289671090594,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004997266568992222,
|
|
"loss": 6.708,
|
|
"mean_token_accuracy": 0.14844308495521547,
|
|
"num_tokens": 5913038.0,
|
|
"step": 2345
|
|
},
|
|
{
|
|
"entropy": 6.791477632522583,
|
|
"epoch": 0.27120600115406807,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004997246197290128,
|
|
"loss": 6.6815,
|
|
"mean_token_accuracy": 0.1516631633043289,
|
|
"num_tokens": 5926096.0,
|
|
"step": 2350
|
|
},
|
|
{
|
|
"entropy": 6.820218896865844,
|
|
"epoch": 0.27178303519907676,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004997225750003024,
|
|
"loss": 6.6836,
|
|
"mean_token_accuracy": 0.15230127722024916,
|
|
"num_tokens": 5937992.0,
|
|
"step": 2355
|
|
},
|
|
{
|
|
"entropy": 6.786269426345825,
|
|
"epoch": 0.2723600692440854,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004997205227131599,
|
|
"loss": 6.6959,
|
|
"mean_token_accuracy": 0.15331070870161057,
|
|
"num_tokens": 5949685.0,
|
|
"step": 2360
|
|
},
|
|
{
|
|
"entropy": 6.8500142097473145,
|
|
"epoch": 0.27293710328909404,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004997184628676542,
|
|
"loss": 6.77,
|
|
"mean_token_accuracy": 0.14370569810271264,
|
|
"num_tokens": 5962751.0,
|
|
"step": 2365
|
|
},
|
|
{
|
|
"entropy": 6.743644428253174,
|
|
"epoch": 0.27351413733410274,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004997163954638546,
|
|
"loss": 6.5676,
|
|
"mean_token_accuracy": 0.15582787990570068,
|
|
"num_tokens": 5976043.0,
|
|
"step": 2370
|
|
},
|
|
{
|
|
"entropy": 6.826035118103027,
|
|
"epoch": 0.2740911713791114,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004997143205018306,
|
|
"loss": 6.7138,
|
|
"mean_token_accuracy": 0.14594173580408096,
|
|
"num_tokens": 5988146.0,
|
|
"step": 2375
|
|
},
|
|
{
|
|
"entropy": 6.795579051971435,
|
|
"epoch": 0.27466820542412,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004997122379816523,
|
|
"loss": 6.6587,
|
|
"mean_token_accuracy": 0.15158178210258483,
|
|
"num_tokens": 6000542.0,
|
|
"step": 2380
|
|
},
|
|
{
|
|
"entropy": 6.742963075637817,
|
|
"epoch": 0.27524523946912866,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004997101479033893,
|
|
"loss": 6.7064,
|
|
"mean_token_accuracy": 0.14576518833637236,
|
|
"num_tokens": 6013574.0,
|
|
"step": 2385
|
|
},
|
|
{
|
|
"entropy": 6.739541244506836,
|
|
"epoch": 0.27582227351413735,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004997080502671122,
|
|
"loss": 6.594,
|
|
"mean_token_accuracy": 0.15022992491722106,
|
|
"num_tokens": 6025391.0,
|
|
"step": 2390
|
|
},
|
|
{
|
|
"entropy": 6.859225606918335,
|
|
"epoch": 0.276399307559146,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004997059450728913,
|
|
"loss": 6.7201,
|
|
"mean_token_accuracy": 0.14635233953595161,
|
|
"num_tokens": 6036595.0,
|
|
"step": 2395
|
|
},
|
|
{
|
|
"entropy": 6.836587810516358,
|
|
"epoch": 0.27697634160415463,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004997038323207977,
|
|
"loss": 6.8146,
|
|
"mean_token_accuracy": 0.1395593300461769,
|
|
"num_tokens": 6048852.0,
|
|
"step": 2400
|
|
},
|
|
{
|
|
"entropy": 6.825769519805908,
|
|
"epoch": 0.2775533756491633,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004997017120109022,
|
|
"loss": 6.6492,
|
|
"mean_token_accuracy": 0.15694630444049834,
|
|
"num_tokens": 6061694.0,
|
|
"step": 2405
|
|
},
|
|
{
|
|
"entropy": 6.7436662197113035,
|
|
"epoch": 0.27813040969417197,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004996995841432762,
|
|
"loss": 6.725,
|
|
"mean_token_accuracy": 0.15039588510990143,
|
|
"num_tokens": 6074244.0,
|
|
"step": 2410
|
|
},
|
|
{
|
|
"entropy": 6.894833898544311,
|
|
"epoch": 0.2787074437391806,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004996974487179915,
|
|
"loss": 6.7051,
|
|
"mean_token_accuracy": 0.1497049979865551,
|
|
"num_tokens": 6085550.0,
|
|
"step": 2415
|
|
},
|
|
{
|
|
"entropy": 6.791318702697754,
|
|
"epoch": 0.27928447778418924,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004996953057351195,
|
|
"loss": 6.7501,
|
|
"mean_token_accuracy": 0.14439913034439086,
|
|
"num_tokens": 6096749.0,
|
|
"step": 2420
|
|
},
|
|
{
|
|
"entropy": 6.856110286712647,
|
|
"epoch": 0.27986151182919794,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004996931551947327,
|
|
"loss": 6.6462,
|
|
"mean_token_accuracy": 0.14740088433027268,
|
|
"num_tokens": 6109490.0,
|
|
"step": 2425
|
|
},
|
|
{
|
|
"entropy": 6.801775121688843,
|
|
"epoch": 0.2804385458742066,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004996909970969031,
|
|
"loss": 6.8126,
|
|
"mean_token_accuracy": 0.13891539573669434,
|
|
"num_tokens": 6122656.0,
|
|
"step": 2430
|
|
},
|
|
{
|
|
"entropy": 6.949873161315918,
|
|
"epoch": 0.2810155799192152,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004996888314417034,
|
|
"loss": 6.7062,
|
|
"mean_token_accuracy": 0.14734956696629525,
|
|
"num_tokens": 6135461.0,
|
|
"step": 2435
|
|
},
|
|
{
|
|
"entropy": 6.737766313552856,
|
|
"epoch": 0.2815926139642239,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004996866582292067,
|
|
"loss": 6.7563,
|
|
"mean_token_accuracy": 0.1486450642347336,
|
|
"num_tokens": 6147698.0,
|
|
"step": 2440
|
|
},
|
|
{
|
|
"entropy": 6.906767129898071,
|
|
"epoch": 0.28216964800923255,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004996844774594856,
|
|
"loss": 6.6995,
|
|
"mean_token_accuracy": 0.15024199485778808,
|
|
"num_tokens": 6160456.0,
|
|
"step": 2445
|
|
},
|
|
{
|
|
"entropy": 6.721561002731323,
|
|
"epoch": 0.2827466820542412,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004996822891326138,
|
|
"loss": 6.6952,
|
|
"mean_token_accuracy": 0.14862452447414398,
|
|
"num_tokens": 6173606.0,
|
|
"step": 2450
|
|
},
|
|
{
|
|
"entropy": 6.840061807632447,
|
|
"epoch": 0.28332371609924983,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004996800932486648,
|
|
"loss": 6.7195,
|
|
"mean_token_accuracy": 0.14363468587398528,
|
|
"num_tokens": 6185355.0,
|
|
"step": 2455
|
|
},
|
|
{
|
|
"entropy": 6.82087197303772,
|
|
"epoch": 0.28390075014425853,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004996778898077126,
|
|
"loss": 6.7452,
|
|
"mean_token_accuracy": 0.14526572227478027,
|
|
"num_tokens": 6198154.0,
|
|
"step": 2460
|
|
},
|
|
{
|
|
"entropy": 6.825610780715943,
|
|
"epoch": 0.28447778418926717,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004996756788098309,
|
|
"loss": 6.6295,
|
|
"mean_token_accuracy": 0.1540285274386406,
|
|
"num_tokens": 6209901.0,
|
|
"step": 2465
|
|
},
|
|
{
|
|
"entropy": 6.724011659622192,
|
|
"epoch": 0.2850548182342758,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004996734602550945,
|
|
"loss": 6.6914,
|
|
"mean_token_accuracy": 0.14896469041705132,
|
|
"num_tokens": 6222052.0,
|
|
"step": 2470
|
|
},
|
|
{
|
|
"entropy": 6.822287702560425,
|
|
"epoch": 0.2856318522792845,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004996712341435779,
|
|
"loss": 6.6874,
|
|
"mean_token_accuracy": 0.1531086578965187,
|
|
"num_tokens": 6235112.0,
|
|
"step": 2475
|
|
},
|
|
{
|
|
"entropy": 6.779771232604981,
|
|
"epoch": 0.28620888632429314,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004996690004753559,
|
|
"loss": 6.7241,
|
|
"mean_token_accuracy": 0.1425678864121437,
|
|
"num_tokens": 6248225.0,
|
|
"step": 2480
|
|
},
|
|
{
|
|
"entropy": 6.827151918411255,
|
|
"epoch": 0.2867859203693018,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004996667592505037,
|
|
"loss": 6.6731,
|
|
"mean_token_accuracy": 0.15249393209815026,
|
|
"num_tokens": 6259518.0,
|
|
"step": 2485
|
|
},
|
|
{
|
|
"entropy": 6.752045726776123,
|
|
"epoch": 0.2873629544143104,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004996645104690967,
|
|
"loss": 6.6827,
|
|
"mean_token_accuracy": 0.1392819695174694,
|
|
"num_tokens": 6271832.0,
|
|
"step": 2490
|
|
},
|
|
{
|
|
"entropy": 6.84897813796997,
|
|
"epoch": 0.2879399884593191,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004996622541312103,
|
|
"loss": 6.7198,
|
|
"mean_token_accuracy": 0.1458892524242401,
|
|
"num_tokens": 6284328.0,
|
|
"step": 2495
|
|
},
|
|
{
|
|
"entropy": 6.746988677978516,
|
|
"epoch": 0.28851702250432776,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004996599902369207,
|
|
"loss": 6.6617,
|
|
"mean_token_accuracy": 0.1465374030172825,
|
|
"num_tokens": 6296100.0,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"entropy": 6.685969734191895,
|
|
"epoch": 0.2890940565493364,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004996577187863039,
|
|
"loss": 6.6493,
|
|
"mean_token_accuracy": 0.15570555478334427,
|
|
"num_tokens": 6308262.0,
|
|
"step": 2505
|
|
},
|
|
{
|
|
"entropy": 6.827516984939575,
|
|
"epoch": 0.2896710905943451,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0004996554397794364,
|
|
"loss": 6.6959,
|
|
"mean_token_accuracy": 0.1382772818207741,
|
|
"num_tokens": 6319953.0,
|
|
"step": 2510
|
|
},
|
|
{
|
|
"entropy": 6.807676601409912,
|
|
"epoch": 0.29024812463935373,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004996531532163947,
|
|
"loss": 6.6329,
|
|
"mean_token_accuracy": 0.15100528299808502,
|
|
"num_tokens": 6332953.0,
|
|
"step": 2515
|
|
},
|
|
{
|
|
"entropy": 6.77238130569458,
|
|
"epoch": 0.2908251586843624,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004996508590972558,
|
|
"loss": 6.6873,
|
|
"mean_token_accuracy": 0.1495242863893509,
|
|
"num_tokens": 6345692.0,
|
|
"step": 2520
|
|
},
|
|
{
|
|
"entropy": 6.78111777305603,
|
|
"epoch": 0.291402192729371,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004996485574220969,
|
|
"loss": 6.6698,
|
|
"mean_token_accuracy": 0.14763007685542107,
|
|
"num_tokens": 6358058.0,
|
|
"step": 2525
|
|
},
|
|
{
|
|
"entropy": 6.842091226577759,
|
|
"epoch": 0.2919792267743797,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004996462481909953,
|
|
"loss": 6.7157,
|
|
"mean_token_accuracy": 0.149982488155365,
|
|
"num_tokens": 6370469.0,
|
|
"step": 2530
|
|
},
|
|
{
|
|
"entropy": 6.7619242668151855,
|
|
"epoch": 0.29255626081938835,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004996439314040287,
|
|
"loss": 6.7762,
|
|
"mean_token_accuracy": 0.1360616222023964,
|
|
"num_tokens": 6384333.0,
|
|
"step": 2535
|
|
},
|
|
{
|
|
"entropy": 6.855607652664185,
|
|
"epoch": 0.293133294864397,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.000499641607061275,
|
|
"loss": 6.7016,
|
|
"mean_token_accuracy": 0.1434970736503601,
|
|
"num_tokens": 6397688.0,
|
|
"step": 2540
|
|
},
|
|
{
|
|
"entropy": 6.819028520584107,
|
|
"epoch": 0.2937103289094057,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004996392751628126,
|
|
"loss": 6.6602,
|
|
"mean_token_accuracy": 0.14889983236789703,
|
|
"num_tokens": 6410188.0,
|
|
"step": 2545
|
|
},
|
|
{
|
|
"entropy": 6.722808504104615,
|
|
"epoch": 0.2942873629544143,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004996369357087196,
|
|
"loss": 6.6805,
|
|
"mean_token_accuracy": 0.14856439232826232,
|
|
"num_tokens": 6423313.0,
|
|
"step": 2550
|
|
},
|
|
{
|
|
"entropy": 6.845215559005737,
|
|
"epoch": 0.29486439699942296,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.000499634588699075,
|
|
"loss": 6.7135,
|
|
"mean_token_accuracy": 0.14631582498550416,
|
|
"num_tokens": 6435853.0,
|
|
"step": 2555
|
|
},
|
|
{
|
|
"entropy": 6.713652801513672,
|
|
"epoch": 0.2954414310444316,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004996322341339575,
|
|
"loss": 6.6397,
|
|
"mean_token_accuracy": 0.14477873146533965,
|
|
"num_tokens": 6448659.0,
|
|
"step": 2560
|
|
},
|
|
{
|
|
"entropy": 6.7395094871521,
|
|
"epoch": 0.2960184650894403,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004996298720134465,
|
|
"loss": 6.6985,
|
|
"mean_token_accuracy": 0.14935118854045867,
|
|
"num_tokens": 6460534.0,
|
|
"step": 2565
|
|
},
|
|
{
|
|
"entropy": 6.828916740417481,
|
|
"epoch": 0.29659549913444894,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004996275023376213,
|
|
"loss": 6.6741,
|
|
"mean_token_accuracy": 0.14743488729000093,
|
|
"num_tokens": 6472368.0,
|
|
"step": 2570
|
|
},
|
|
{
|
|
"entropy": 6.772326993942261,
|
|
"epoch": 0.2971725331794576,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004996251251065615,
|
|
"loss": 6.6763,
|
|
"mean_token_accuracy": 0.14429058134555817,
|
|
"num_tokens": 6485430.0,
|
|
"step": 2575
|
|
},
|
|
{
|
|
"entropy": 6.764473915100098,
|
|
"epoch": 0.2977495672244662,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004996227403203473,
|
|
"loss": 6.656,
|
|
"mean_token_accuracy": 0.15102906972169877,
|
|
"num_tokens": 6497303.0,
|
|
"step": 2580
|
|
},
|
|
{
|
|
"entropy": 6.816898822784424,
|
|
"epoch": 0.2983266012694749,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004996203479790589,
|
|
"loss": 6.7282,
|
|
"mean_token_accuracy": 0.15129706114530564,
|
|
"num_tokens": 6510154.0,
|
|
"step": 2585
|
|
},
|
|
{
|
|
"entropy": 6.819794940948486,
|
|
"epoch": 0.29890363531448355,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004996179480827764,
|
|
"loss": 6.7073,
|
|
"mean_token_accuracy": 0.14853841662406922,
|
|
"num_tokens": 6523091.0,
|
|
"step": 2590
|
|
},
|
|
{
|
|
"entropy": 6.845903539657593,
|
|
"epoch": 0.2994806693594922,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000499615540631581,
|
|
"loss": 6.6167,
|
|
"mean_token_accuracy": 0.15361105501651764,
|
|
"num_tokens": 6536043.0,
|
|
"step": 2595
|
|
},
|
|
{
|
|
"entropy": 6.660343933105469,
|
|
"epoch": 0.3000577034045009,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004996131256255534,
|
|
"loss": 6.6328,
|
|
"mean_token_accuracy": 0.15334705710411073,
|
|
"num_tokens": 6548227.0,
|
|
"step": 2600
|
|
},
|
|
{
|
|
"entropy": 6.819034004211426,
|
|
"epoch": 0.3006347374495095,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004996107030647749,
|
|
"loss": 6.692,
|
|
"mean_token_accuracy": 0.14152004942297935,
|
|
"num_tokens": 6560204.0,
|
|
"step": 2605
|
|
},
|
|
{
|
|
"entropy": 6.756571340560913,
|
|
"epoch": 0.30121177149451817,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004996082729493269,
|
|
"loss": 6.6744,
|
|
"mean_token_accuracy": 0.15325141996145247,
|
|
"num_tokens": 6573235.0,
|
|
"step": 2610
|
|
},
|
|
{
|
|
"entropy": 6.73859806060791,
|
|
"epoch": 0.3017888055395268,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004996058352792913,
|
|
"loss": 6.7054,
|
|
"mean_token_accuracy": 0.14550871774554253,
|
|
"num_tokens": 6585118.0,
|
|
"step": 2615
|
|
},
|
|
{
|
|
"entropy": 6.755663061141968,
|
|
"epoch": 0.3023658395845355,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00049960339005475,
|
|
"loss": 6.5996,
|
|
"mean_token_accuracy": 0.14909390211105347,
|
|
"num_tokens": 6596690.0,
|
|
"step": 2620
|
|
},
|
|
{
|
|
"entropy": 6.764217233657837,
|
|
"epoch": 0.30294287362954414,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004996009372757852,
|
|
"loss": 6.5965,
|
|
"mean_token_accuracy": 0.1569955661892891,
|
|
"num_tokens": 6609076.0,
|
|
"step": 2625
|
|
},
|
|
{
|
|
"entropy": 6.729177474975586,
|
|
"epoch": 0.3035199076745528,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004995984769424795,
|
|
"loss": 6.7118,
|
|
"mean_token_accuracy": 0.14563166871666908,
|
|
"num_tokens": 6621352.0,
|
|
"step": 2630
|
|
},
|
|
{
|
|
"entropy": 6.814102125167847,
|
|
"epoch": 0.3040969417195615,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004995960090549155,
|
|
"loss": 6.5982,
|
|
"mean_token_accuracy": 0.1499995172023773,
|
|
"num_tokens": 6633924.0,
|
|
"step": 2635
|
|
},
|
|
{
|
|
"entropy": 6.754621171951294,
|
|
"epoch": 0.3046739757645701,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004995935336131764,
|
|
"loss": 6.7238,
|
|
"mean_token_accuracy": 0.1473952054977417,
|
|
"num_tokens": 6646490.0,
|
|
"step": 2640
|
|
},
|
|
{
|
|
"entropy": 6.8332771301269535,
|
|
"epoch": 0.30525100980957875,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004995910506173452,
|
|
"loss": 6.6893,
|
|
"mean_token_accuracy": 0.14203061014413834,
|
|
"num_tokens": 6660171.0,
|
|
"step": 2645
|
|
},
|
|
{
|
|
"entropy": 6.768089628219604,
|
|
"epoch": 0.3058280438545874,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004995885600675059,
|
|
"loss": 6.7052,
|
|
"mean_token_accuracy": 0.1487940713763237,
|
|
"num_tokens": 6673505.0,
|
|
"step": 2650
|
|
},
|
|
{
|
|
"entropy": 6.782451200485229,
|
|
"epoch": 0.3064050778995961,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004995860619637415,
|
|
"loss": 6.7004,
|
|
"mean_token_accuracy": 0.1495489463210106,
|
|
"num_tokens": 6685798.0,
|
|
"step": 2655
|
|
},
|
|
{
|
|
"entropy": 6.705468416213989,
|
|
"epoch": 0.30698211194460473,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004995835563061367,
|
|
"loss": 6.5514,
|
|
"mean_token_accuracy": 0.15502395033836364,
|
|
"num_tokens": 6699254.0,
|
|
"step": 2660
|
|
},
|
|
{
|
|
"entropy": 6.736592388153076,
|
|
"epoch": 0.30755914598961337,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004995810430947756,
|
|
"loss": 6.6154,
|
|
"mean_token_accuracy": 0.15057491064071654,
|
|
"num_tokens": 6711088.0,
|
|
"step": 2665
|
|
},
|
|
{
|
|
"entropy": 6.759505414962769,
|
|
"epoch": 0.30813618003462206,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004995785223297426,
|
|
"loss": 6.6807,
|
|
"mean_token_accuracy": 0.14461947679519654,
|
|
"num_tokens": 6723373.0,
|
|
"step": 2670
|
|
},
|
|
{
|
|
"entropy": 6.741917705535888,
|
|
"epoch": 0.3087132140796307,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0004995759940111225,
|
|
"loss": 6.6848,
|
|
"mean_token_accuracy": 0.14381011575460434,
|
|
"num_tokens": 6737984.0,
|
|
"step": 2675
|
|
},
|
|
{
|
|
"entropy": 6.773638963699341,
|
|
"epoch": 0.30929024812463934,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004995734581390005,
|
|
"loss": 6.6328,
|
|
"mean_token_accuracy": 0.14959122091531754,
|
|
"num_tokens": 6751283.0,
|
|
"step": 2680
|
|
},
|
|
{
|
|
"entropy": 6.680616760253907,
|
|
"epoch": 0.309867282169648,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004995709147134617,
|
|
"loss": 6.6046,
|
|
"mean_token_accuracy": 0.15074616074562072,
|
|
"num_tokens": 6765012.0,
|
|
"step": 2685
|
|
},
|
|
{
|
|
"entropy": 6.775850296020508,
|
|
"epoch": 0.3104443162146567,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004995683637345919,
|
|
"loss": 6.6392,
|
|
"mean_token_accuracy": 0.15261454582214357,
|
|
"num_tokens": 6777708.0,
|
|
"step": 2690
|
|
},
|
|
{
|
|
"entropy": 6.7052594184875485,
|
|
"epoch": 0.3110213502596653,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004995658052024765,
|
|
"loss": 6.5669,
|
|
"mean_token_accuracy": 0.16054244190454484,
|
|
"num_tokens": 6791325.0,
|
|
"step": 2695
|
|
},
|
|
{
|
|
"entropy": 6.722959423065186,
|
|
"epoch": 0.31159838430467396,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004995632391172019,
|
|
"loss": 6.718,
|
|
"mean_token_accuracy": 0.13914413154125213,
|
|
"num_tokens": 6805659.0,
|
|
"step": 2700
|
|
},
|
|
{
|
|
"entropy": 6.812787103652954,
|
|
"epoch": 0.31217541834968265,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004995606654788543,
|
|
"loss": 6.637,
|
|
"mean_token_accuracy": 0.14895061701536177,
|
|
"num_tokens": 6818110.0,
|
|
"step": 2705
|
|
},
|
|
{
|
|
"entropy": 6.727897787094117,
|
|
"epoch": 0.3127524523946913,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004995580842875202,
|
|
"loss": 6.6378,
|
|
"mean_token_accuracy": 0.14641101211309432,
|
|
"num_tokens": 6830959.0,
|
|
"step": 2710
|
|
},
|
|
{
|
|
"entropy": 6.807159328460694,
|
|
"epoch": 0.31332948643969993,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004995554955432866,
|
|
"loss": 6.6977,
|
|
"mean_token_accuracy": 0.14908618479967117,
|
|
"num_tokens": 6843318.0,
|
|
"step": 2715
|
|
},
|
|
{
|
|
"entropy": 6.718437242507934,
|
|
"epoch": 0.3139065204847086,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004995528992462404,
|
|
"loss": 6.5811,
|
|
"mean_token_accuracy": 0.1510560542345047,
|
|
"num_tokens": 6855154.0,
|
|
"step": 2720
|
|
},
|
|
{
|
|
"entropy": 6.71838641166687,
|
|
"epoch": 0.31448355452971727,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.000499550295396469,
|
|
"loss": 6.6456,
|
|
"mean_token_accuracy": 0.14983784556388854,
|
|
"num_tokens": 6867428.0,
|
|
"step": 2725
|
|
},
|
|
{
|
|
"entropy": 6.756401872634887,
|
|
"epoch": 0.3150605885747259,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004995476839940598,
|
|
"loss": 6.6363,
|
|
"mean_token_accuracy": 0.15786276906728744,
|
|
"num_tokens": 6879989.0,
|
|
"step": 2730
|
|
},
|
|
{
|
|
"entropy": 6.777546310424805,
|
|
"epoch": 0.31563762261973455,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.000499545065039101,
|
|
"loss": 6.6447,
|
|
"mean_token_accuracy": 0.1432705909013748,
|
|
"num_tokens": 6893179.0,
|
|
"step": 2735
|
|
},
|
|
{
|
|
"entropy": 6.786166429519653,
|
|
"epoch": 0.31621465666474324,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004995424385316803,
|
|
"loss": 6.6354,
|
|
"mean_token_accuracy": 0.1462482675909996,
|
|
"num_tokens": 6905647.0,
|
|
"step": 2740
|
|
},
|
|
{
|
|
"entropy": 6.713575553894043,
|
|
"epoch": 0.3167916907097519,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004995398044718863,
|
|
"loss": 6.6146,
|
|
"mean_token_accuracy": 0.15827973783016205,
|
|
"num_tokens": 6917361.0,
|
|
"step": 2745
|
|
},
|
|
{
|
|
"entropy": 6.780123996734619,
|
|
"epoch": 0.3173687247547605,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004995371628598074,
|
|
"loss": 6.6339,
|
|
"mean_token_accuracy": 0.14651651680469513,
|
|
"num_tokens": 6929515.0,
|
|
"step": 2750
|
|
},
|
|
{
|
|
"entropy": 6.748660898208618,
|
|
"epoch": 0.31794575879976916,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004995345136955328,
|
|
"loss": 6.6036,
|
|
"mean_token_accuracy": 0.15300127118825912,
|
|
"num_tokens": 6942265.0,
|
|
"step": 2755
|
|
},
|
|
{
|
|
"entropy": 6.7021361827850345,
|
|
"epoch": 0.31852279284477786,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004995318569791512,
|
|
"loss": 6.661,
|
|
"mean_token_accuracy": 0.15360585749149322,
|
|
"num_tokens": 6955151.0,
|
|
"step": 2760
|
|
},
|
|
{
|
|
"entropy": 6.784101343154907,
|
|
"epoch": 0.3190998268897865,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004995291927107522,
|
|
"loss": 6.6172,
|
|
"mean_token_accuracy": 0.1502458855509758,
|
|
"num_tokens": 6968378.0,
|
|
"step": 2765
|
|
},
|
|
{
|
|
"entropy": 6.669129657745361,
|
|
"epoch": 0.31967686093479514,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004995265208904252,
|
|
"loss": 6.6216,
|
|
"mean_token_accuracy": 0.14923231303691864,
|
|
"num_tokens": 6980083.0,
|
|
"step": 2770
|
|
},
|
|
{
|
|
"entropy": 6.747028255462647,
|
|
"epoch": 0.32025389497980383,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004995238415182603,
|
|
"loss": 6.6581,
|
|
"mean_token_accuracy": 0.1432106763124466,
|
|
"num_tokens": 6992981.0,
|
|
"step": 2775
|
|
},
|
|
{
|
|
"entropy": 6.844202852249145,
|
|
"epoch": 0.3208309290248125,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004995211545943476,
|
|
"loss": 6.6409,
|
|
"mean_token_accuracy": 0.14744580015540124,
|
|
"num_tokens": 7006115.0,
|
|
"step": 2780
|
|
},
|
|
{
|
|
"entropy": 6.653217697143555,
|
|
"epoch": 0.3214079630698211,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004995184601187772,
|
|
"loss": 6.6014,
|
|
"mean_token_accuracy": 0.15577706843614578,
|
|
"num_tokens": 7019176.0,
|
|
"step": 2785
|
|
},
|
|
{
|
|
"entropy": 6.641081857681274,
|
|
"epoch": 0.32198499711482975,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00049951575809164,
|
|
"loss": 6.5282,
|
|
"mean_token_accuracy": 0.16437966525554656,
|
|
"num_tokens": 7031214.0,
|
|
"step": 2790
|
|
},
|
|
{
|
|
"entropy": 6.66480655670166,
|
|
"epoch": 0.32256203115983845,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004995130485130269,
|
|
"loss": 6.6088,
|
|
"mean_token_accuracy": 0.15185024589300156,
|
|
"num_tokens": 7044702.0,
|
|
"step": 2795
|
|
},
|
|
{
|
|
"entropy": 6.752944231033325,
|
|
"epoch": 0.3231390652048471,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004995103313830289,
|
|
"loss": 6.6018,
|
|
"mean_token_accuracy": 0.15165336132049562,
|
|
"num_tokens": 7056489.0,
|
|
"step": 2800
|
|
},
|
|
{
|
|
"entropy": 6.729215812683106,
|
|
"epoch": 0.3237160992498557,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004995076067017373,
|
|
"loss": 6.6406,
|
|
"mean_token_accuracy": 0.14547208398580552,
|
|
"num_tokens": 7068972.0,
|
|
"step": 2805
|
|
},
|
|
{
|
|
"entropy": 6.74854302406311,
|
|
"epoch": 0.3242931332948644,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004995048744692439,
|
|
"loss": 6.5746,
|
|
"mean_token_accuracy": 0.15244885683059692,
|
|
"num_tokens": 7080894.0,
|
|
"step": 2810
|
|
},
|
|
{
|
|
"entropy": 6.713599061965942,
|
|
"epoch": 0.32487016733987306,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004995021346856405,
|
|
"loss": 6.6122,
|
|
"mean_token_accuracy": 0.14793540984392167,
|
|
"num_tokens": 7094427.0,
|
|
"step": 2815
|
|
},
|
|
{
|
|
"entropy": 6.65841121673584,
|
|
"epoch": 0.3254472013848817,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004994993873510196,
|
|
"loss": 6.5596,
|
|
"mean_token_accuracy": 0.16087264865636824,
|
|
"num_tokens": 7105710.0,
|
|
"step": 2820
|
|
},
|
|
{
|
|
"entropy": 6.793656873703003,
|
|
"epoch": 0.32602423542989034,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004994966324654731,
|
|
"loss": 6.5838,
|
|
"mean_token_accuracy": 0.14802931025624275,
|
|
"num_tokens": 7119042.0,
|
|
"step": 2825
|
|
},
|
|
{
|
|
"entropy": 6.634446716308593,
|
|
"epoch": 0.32660126947489904,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.000499493870029094,
|
|
"loss": 6.6077,
|
|
"mean_token_accuracy": 0.148269946873188,
|
|
"num_tokens": 7132146.0,
|
|
"step": 2830
|
|
},
|
|
{
|
|
"entropy": 6.726744699478149,
|
|
"epoch": 0.3271783035199077,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004994911000419749,
|
|
"loss": 6.562,
|
|
"mean_token_accuracy": 0.15012803077697753,
|
|
"num_tokens": 7144805.0,
|
|
"step": 2835
|
|
},
|
|
{
|
|
"entropy": 6.6751384258270265,
|
|
"epoch": 0.3277553375649163,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004994883225042093,
|
|
"loss": 6.5475,
|
|
"mean_token_accuracy": 0.16178591400384904,
|
|
"num_tokens": 7156906.0,
|
|
"step": 2840
|
|
},
|
|
{
|
|
"entropy": 6.753067064285278,
|
|
"epoch": 0.328332371609925,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004994855374158905,
|
|
"loss": 6.5298,
|
|
"mean_token_accuracy": 0.15081926435232162,
|
|
"num_tokens": 7169451.0,
|
|
"step": 2845
|
|
},
|
|
{
|
|
"entropy": 6.7513651847839355,
|
|
"epoch": 0.32890940565493365,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.000499482744777112,
|
|
"loss": 6.675,
|
|
"mean_token_accuracy": 0.14404026567935943,
|
|
"num_tokens": 7183211.0,
|
|
"step": 2850
|
|
},
|
|
{
|
|
"entropy": 6.7373758316040036,
|
|
"epoch": 0.3294864396999423,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.000499479944587968,
|
|
"loss": 6.6147,
|
|
"mean_token_accuracy": 0.1517378196120262,
|
|
"num_tokens": 7196062.0,
|
|
"step": 2855
|
|
},
|
|
{
|
|
"entropy": 6.794651794433594,
|
|
"epoch": 0.33006347374495093,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004994771368485526,
|
|
"loss": 6.7089,
|
|
"mean_token_accuracy": 0.14450829550623895,
|
|
"num_tokens": 7208079.0,
|
|
"step": 2860
|
|
},
|
|
{
|
|
"entropy": 6.799776029586792,
|
|
"epoch": 0.3306405077899596,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004994743215589602,
|
|
"loss": 6.656,
|
|
"mean_token_accuracy": 0.14721468538045884,
|
|
"num_tokens": 7221537.0,
|
|
"step": 2865
|
|
},
|
|
{
|
|
"entropy": 6.66144700050354,
|
|
"epoch": 0.33121754183496827,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004994714987192854,
|
|
"loss": 6.6285,
|
|
"mean_token_accuracy": 0.14779918044805526,
|
|
"num_tokens": 7234472.0,
|
|
"step": 2870
|
|
},
|
|
{
|
|
"entropy": 6.707424116134644,
|
|
"epoch": 0.3317945758799769,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004994686683296234,
|
|
"loss": 6.5847,
|
|
"mean_token_accuracy": 0.15313812494277954,
|
|
"num_tokens": 7247818.0,
|
|
"step": 2875
|
|
},
|
|
{
|
|
"entropy": 6.695041847229004,
|
|
"epoch": 0.3323716099249856,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0004994658303900691,
|
|
"loss": 6.6729,
|
|
"mean_token_accuracy": 0.15236686170101166,
|
|
"num_tokens": 7261351.0,
|
|
"step": 2880
|
|
},
|
|
{
|
|
"entropy": 6.677237319946289,
|
|
"epoch": 0.33294864396999424,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004994629849007182,
|
|
"loss": 6.5247,
|
|
"mean_token_accuracy": 0.15475201308727266,
|
|
"num_tokens": 7274310.0,
|
|
"step": 2885
|
|
},
|
|
{
|
|
"entropy": 6.6607647895812985,
|
|
"epoch": 0.3335256780150029,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004994601318616663,
|
|
"loss": 6.5631,
|
|
"mean_token_accuracy": 0.15157887637615203,
|
|
"num_tokens": 7286560.0,
|
|
"step": 2890
|
|
},
|
|
{
|
|
"entropy": 6.811610126495362,
|
|
"epoch": 0.3341027120600115,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004994572712730092,
|
|
"loss": 6.6486,
|
|
"mean_token_accuracy": 0.14426497519016265,
|
|
"num_tokens": 7300337.0,
|
|
"step": 2895
|
|
},
|
|
{
|
|
"entropy": 6.691228675842285,
|
|
"epoch": 0.3346797461050202,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004994544031348434,
|
|
"loss": 6.6194,
|
|
"mean_token_accuracy": 0.1486266866326332,
|
|
"num_tokens": 7313436.0,
|
|
"step": 2900
|
|
},
|
|
{
|
|
"entropy": 6.666589450836182,
|
|
"epoch": 0.33525678015002885,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004994515274472653,
|
|
"loss": 6.4758,
|
|
"mean_token_accuracy": 0.16475249975919723,
|
|
"num_tokens": 7325766.0,
|
|
"step": 2905
|
|
},
|
|
{
|
|
"entropy": 6.611915159225464,
|
|
"epoch": 0.3358338141950375,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004994486442103715,
|
|
"loss": 6.5599,
|
|
"mean_token_accuracy": 0.14973128736019134,
|
|
"num_tokens": 7337904.0,
|
|
"step": 2910
|
|
},
|
|
{
|
|
"entropy": 6.648727655410767,
|
|
"epoch": 0.3364108482400462,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.000499445753424259,
|
|
"loss": 6.5601,
|
|
"mean_token_accuracy": 0.15160418599843978,
|
|
"num_tokens": 7350448.0,
|
|
"step": 2915
|
|
},
|
|
{
|
|
"entropy": 6.7852109432220455,
|
|
"epoch": 0.33698788228505483,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004994428550890251,
|
|
"loss": 6.5957,
|
|
"mean_token_accuracy": 0.1476546384394169,
|
|
"num_tokens": 7363859.0,
|
|
"step": 2920
|
|
},
|
|
{
|
|
"entropy": 6.703492069244385,
|
|
"epoch": 0.33756491633006347,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004994399492047672,
|
|
"loss": 6.6148,
|
|
"mean_token_accuracy": 0.1489669606089592,
|
|
"num_tokens": 7376963.0,
|
|
"step": 2925
|
|
},
|
|
{
|
|
"entropy": 6.677239227294922,
|
|
"epoch": 0.3381419503750721,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004994370357715832,
|
|
"loss": 6.6462,
|
|
"mean_token_accuracy": 0.14910098984837533,
|
|
"num_tokens": 7390370.0,
|
|
"step": 2930
|
|
},
|
|
{
|
|
"entropy": 6.712501335144043,
|
|
"epoch": 0.3387189844200808,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.000499434114789571,
|
|
"loss": 6.5836,
|
|
"mean_token_accuracy": 0.15484795421361924,
|
|
"num_tokens": 7402851.0,
|
|
"step": 2935
|
|
},
|
|
{
|
|
"entropy": 6.638098287582397,
|
|
"epoch": 0.33929601846508944,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004994311862588286,
|
|
"loss": 6.6003,
|
|
"mean_token_accuracy": 0.14664260819554328,
|
|
"num_tokens": 7415428.0,
|
|
"step": 2940
|
|
},
|
|
{
|
|
"entropy": 6.786514616012573,
|
|
"epoch": 0.3398730525100981,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004994282501794551,
|
|
"loss": 6.5911,
|
|
"mean_token_accuracy": 0.15048429667949675,
|
|
"num_tokens": 7428420.0,
|
|
"step": 2945
|
|
},
|
|
{
|
|
"entropy": 6.686578941345215,
|
|
"epoch": 0.3404500865551068,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004994253065515486,
|
|
"loss": 6.6436,
|
|
"mean_token_accuracy": 0.15113215446472167,
|
|
"num_tokens": 7439626.0,
|
|
"step": 2950
|
|
},
|
|
{
|
|
"entropy": 6.725645685195923,
|
|
"epoch": 0.3410271206001154,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004994223553752084,
|
|
"loss": 6.5901,
|
|
"mean_token_accuracy": 0.1514264941215515,
|
|
"num_tokens": 7452797.0,
|
|
"step": 2955
|
|
},
|
|
{
|
|
"entropy": 6.65960373878479,
|
|
"epoch": 0.34160415464512406,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004994193966505339,
|
|
"loss": 6.5682,
|
|
"mean_token_accuracy": 0.15812762975692748,
|
|
"num_tokens": 7464311.0,
|
|
"step": 2960
|
|
},
|
|
{
|
|
"entropy": 6.6784382343292235,
|
|
"epoch": 0.3421811886901327,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004994164303776244,
|
|
"loss": 6.5852,
|
|
"mean_token_accuracy": 0.15011241137981415,
|
|
"num_tokens": 7475706.0,
|
|
"step": 2965
|
|
},
|
|
{
|
|
"entropy": 6.7143481254577635,
|
|
"epoch": 0.3427582227351414,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004994134565565797,
|
|
"loss": 6.6579,
|
|
"mean_token_accuracy": 0.1478770911693573,
|
|
"num_tokens": 7489077.0,
|
|
"step": 2970
|
|
},
|
|
{
|
|
"entropy": 6.736965751647949,
|
|
"epoch": 0.34333525678015003,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004994104751875,
|
|
"loss": 6.6074,
|
|
"mean_token_accuracy": 0.15452702343463898,
|
|
"num_tokens": 7501598.0,
|
|
"step": 2975
|
|
},
|
|
{
|
|
"entropy": 6.608485174179077,
|
|
"epoch": 0.3439122908251587,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004994074862704854,
|
|
"loss": 6.4109,
|
|
"mean_token_accuracy": 0.16355000287294388,
|
|
"num_tokens": 7514776.0,
|
|
"step": 2980
|
|
},
|
|
{
|
|
"entropy": 6.584009838104248,
|
|
"epoch": 0.3444893248701673,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004994044898056363,
|
|
"loss": 6.5766,
|
|
"mean_token_accuracy": 0.15253832191228867,
|
|
"num_tokens": 7527795.0,
|
|
"step": 2985
|
|
},
|
|
{
|
|
"entropy": 6.702622604370117,
|
|
"epoch": 0.345066358915176,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004994014857930538,
|
|
"loss": 6.4427,
|
|
"mean_token_accuracy": 0.1624614641070366,
|
|
"num_tokens": 7541392.0,
|
|
"step": 2990
|
|
},
|
|
{
|
|
"entropy": 6.615006446838379,
|
|
"epoch": 0.34564339296018465,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004993984742328387,
|
|
"loss": 6.601,
|
|
"mean_token_accuracy": 0.15036358386278154,
|
|
"num_tokens": 7554369.0,
|
|
"step": 2995
|
|
},
|
|
{
|
|
"entropy": 6.672338581085205,
|
|
"epoch": 0.3462204270051933,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004993954551250925,
|
|
"loss": 6.603,
|
|
"mean_token_accuracy": 0.154202963411808,
|
|
"num_tokens": 7567528.0,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"epoch": 0.3462204270051933,
|
|
"eval_entropy": 6.5903391438110805,
|
|
"eval_loss": 6.633339881896973,
|
|
"eval_mean_token_accuracy": 0.15343972800560624,
|
|
"eval_num_tokens": 7567528.0,
|
|
"eval_runtime": 17.6947,
|
|
"eval_samples_per_second": 1590.081,
|
|
"eval_steps_per_second": 198.76,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"entropy": 6.706592988967896,
|
|
"epoch": 0.346797461050202,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004993924284699165,
|
|
"loss": 6.5524,
|
|
"mean_token_accuracy": 0.15312376469373704,
|
|
"num_tokens": 7579146.0,
|
|
"step": 3005
|
|
},
|
|
{
|
|
"entropy": 6.66014552116394,
|
|
"epoch": 0.3473744950952106,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004993893942674127,
|
|
"loss": 6.64,
|
|
"mean_token_accuracy": 0.1477951481938362,
|
|
"num_tokens": 7591902.0,
|
|
"step": 3010
|
|
},
|
|
{
|
|
"entropy": 6.799589061737061,
|
|
"epoch": 0.34795152914021926,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.000499386352517683,
|
|
"loss": 6.6448,
|
|
"mean_token_accuracy": 0.1552356779575348,
|
|
"num_tokens": 7605565.0,
|
|
"step": 3015
|
|
},
|
|
{
|
|
"entropy": 6.7373872756958,
|
|
"epoch": 0.3485285631852279,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.00049938330322083,
|
|
"loss": 6.5734,
|
|
"mean_token_accuracy": 0.15451606512069702,
|
|
"num_tokens": 7618380.0,
|
|
"step": 3020
|
|
},
|
|
{
|
|
"entropy": 6.653174638748169,
|
|
"epoch": 0.3491055972302366,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004993802463769558,
|
|
"loss": 6.6035,
|
|
"mean_token_accuracy": 0.14853976368904115,
|
|
"num_tokens": 7632092.0,
|
|
"step": 3025
|
|
},
|
|
{
|
|
"entropy": 6.6859503269195555,
|
|
"epoch": 0.34968263127524524,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004993771819861636,
|
|
"loss": 6.6097,
|
|
"mean_token_accuracy": 0.14797925502061843,
|
|
"num_tokens": 7644185.0,
|
|
"step": 3030
|
|
},
|
|
{
|
|
"entropy": 6.741736364364624,
|
|
"epoch": 0.3502596653202539,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004993741100485564,
|
|
"loss": 6.5012,
|
|
"mean_token_accuracy": 0.15530159771442414,
|
|
"num_tokens": 7656635.0,
|
|
"step": 3035
|
|
},
|
|
{
|
|
"entropy": 6.64942421913147,
|
|
"epoch": 0.35083669936526257,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004993710305642374,
|
|
"loss": 6.5621,
|
|
"mean_token_accuracy": 0.15173622369766235,
|
|
"num_tokens": 7669643.0,
|
|
"step": 3040
|
|
},
|
|
{
|
|
"entropy": 6.688398933410644,
|
|
"epoch": 0.3514137334102712,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004993679435333102,
|
|
"loss": 6.5822,
|
|
"mean_token_accuracy": 0.14759134352207184,
|
|
"num_tokens": 7682489.0,
|
|
"step": 3045
|
|
},
|
|
{
|
|
"entropy": 6.630285358428955,
|
|
"epoch": 0.35199076745527985,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004993648489558788,
|
|
"loss": 6.5269,
|
|
"mean_token_accuracy": 0.15159836709499358,
|
|
"num_tokens": 7696670.0,
|
|
"step": 3050
|
|
},
|
|
{
|
|
"entropy": 6.6929933547973635,
|
|
"epoch": 0.3525678015002885,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004993617468320471,
|
|
"loss": 6.5451,
|
|
"mean_token_accuracy": 0.15906845778226852,
|
|
"num_tokens": 7709054.0,
|
|
"step": 3055
|
|
},
|
|
{
|
|
"entropy": 6.634079313278198,
|
|
"epoch": 0.3531448355452972,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004993586371619193,
|
|
"loss": 6.5548,
|
|
"mean_token_accuracy": 0.15278329253196715,
|
|
"num_tokens": 7721710.0,
|
|
"step": 3060
|
|
},
|
|
{
|
|
"entropy": 6.722148132324219,
|
|
"epoch": 0.3537218695903058,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004993555199456004,
|
|
"loss": 6.6095,
|
|
"mean_token_accuracy": 0.1526441752910614,
|
|
"num_tokens": 7733689.0,
|
|
"step": 3065
|
|
},
|
|
{
|
|
"entropy": 6.66739444732666,
|
|
"epoch": 0.35429890363531447,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004993523951831949,
|
|
"loss": 6.5803,
|
|
"mean_token_accuracy": 0.1555978015065193,
|
|
"num_tokens": 7745735.0,
|
|
"step": 3070
|
|
},
|
|
{
|
|
"entropy": 6.7588379859924315,
|
|
"epoch": 0.35487593768032316,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004993492628748081,
|
|
"loss": 6.5894,
|
|
"mean_token_accuracy": 0.14369118213653564,
|
|
"num_tokens": 7757352.0,
|
|
"step": 3075
|
|
},
|
|
{
|
|
"entropy": 6.6846785068511965,
|
|
"epoch": 0.3554529717253318,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004993461230205453,
|
|
"loss": 6.5369,
|
|
"mean_token_accuracy": 0.14949805587530135,
|
|
"num_tokens": 7768363.0,
|
|
"step": 3080
|
|
},
|
|
{
|
|
"entropy": 6.668369150161743,
|
|
"epoch": 0.35603000577034044,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004993429756205121,
|
|
"loss": 6.6618,
|
|
"mean_token_accuracy": 0.14399161487817763,
|
|
"num_tokens": 7781133.0,
|
|
"step": 3085
|
|
},
|
|
{
|
|
"entropy": 6.810355234146118,
|
|
"epoch": 0.3566070398153491,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004993398206748142,
|
|
"loss": 6.6461,
|
|
"mean_token_accuracy": 0.14326538443565368,
|
|
"num_tokens": 7794445.0,
|
|
"step": 3090
|
|
},
|
|
{
|
|
"entropy": 6.689512538909912,
|
|
"epoch": 0.3571840738603578,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004993366581835581,
|
|
"loss": 6.5431,
|
|
"mean_token_accuracy": 0.15431275665760041,
|
|
"num_tokens": 7807601.0,
|
|
"step": 3095
|
|
},
|
|
{
|
|
"entropy": 6.592484951019287,
|
|
"epoch": 0.3577611079053664,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004993334881468498,
|
|
"loss": 6.5139,
|
|
"mean_token_accuracy": 0.1561570018529892,
|
|
"num_tokens": 7819821.0,
|
|
"step": 3100
|
|
},
|
|
{
|
|
"entropy": 6.691237831115723,
|
|
"epoch": 0.35833814195037506,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004993303105647961,
|
|
"loss": 6.5343,
|
|
"mean_token_accuracy": 0.15187687054276466,
|
|
"num_tokens": 7832214.0,
|
|
"step": 3105
|
|
},
|
|
{
|
|
"entropy": 6.638499784469604,
|
|
"epoch": 0.35891517599538375,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004993271254375038,
|
|
"loss": 6.5741,
|
|
"mean_token_accuracy": 0.16051387637853623,
|
|
"num_tokens": 7844566.0,
|
|
"step": 3110
|
|
},
|
|
{
|
|
"entropy": 6.710163545608521,
|
|
"epoch": 0.3594922100403924,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.00049932393276508,
|
|
"loss": 6.5434,
|
|
"mean_token_accuracy": 0.15657812282443045,
|
|
"num_tokens": 7857965.0,
|
|
"step": 3115
|
|
},
|
|
{
|
|
"entropy": 6.603605270385742,
|
|
"epoch": 0.36006924408540103,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004993207325476323,
|
|
"loss": 6.5691,
|
|
"mean_token_accuracy": 0.1569638028740883,
|
|
"num_tokens": 7870902.0,
|
|
"step": 3120
|
|
},
|
|
{
|
|
"entropy": 6.778155136108398,
|
|
"epoch": 0.36064627813040967,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004993175247852681,
|
|
"loss": 6.6299,
|
|
"mean_token_accuracy": 0.14303801953792572,
|
|
"num_tokens": 7883694.0,
|
|
"step": 3125
|
|
},
|
|
{
|
|
"entropy": 6.624432468414307,
|
|
"epoch": 0.36122331217541837,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004993143094780954,
|
|
"loss": 6.52,
|
|
"mean_token_accuracy": 0.1570071041584015,
|
|
"num_tokens": 7896693.0,
|
|
"step": 3130
|
|
},
|
|
{
|
|
"entropy": 6.6653848648071286,
|
|
"epoch": 0.361800346220427,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004993110866262224,
|
|
"loss": 6.519,
|
|
"mean_token_accuracy": 0.15744696259498597,
|
|
"num_tokens": 7910010.0,
|
|
"step": 3135
|
|
},
|
|
{
|
|
"entropy": 6.7992534160614015,
|
|
"epoch": 0.36237738026543564,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004993078562297573,
|
|
"loss": 6.6268,
|
|
"mean_token_accuracy": 0.13919368460774423,
|
|
"num_tokens": 7922026.0,
|
|
"step": 3140
|
|
},
|
|
{
|
|
"entropy": 6.626803922653198,
|
|
"epoch": 0.36295441431044434,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004993046182888089,
|
|
"loss": 6.5974,
|
|
"mean_token_accuracy": 0.14518485516309737,
|
|
"num_tokens": 7934633.0,
|
|
"step": 3145
|
|
},
|
|
{
|
|
"entropy": 6.703473472595215,
|
|
"epoch": 0.363531448355453,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004993013728034861,
|
|
"loss": 6.5012,
|
|
"mean_token_accuracy": 0.15910948514938356,
|
|
"num_tokens": 7947189.0,
|
|
"step": 3150
|
|
},
|
|
{
|
|
"entropy": 6.645997714996338,
|
|
"epoch": 0.3641084824004616,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.000499298119773898,
|
|
"loss": 6.5815,
|
|
"mean_token_accuracy": 0.15228615552186966,
|
|
"num_tokens": 7961283.0,
|
|
"step": 3155
|
|
},
|
|
{
|
|
"entropy": 6.584298086166382,
|
|
"epoch": 0.36468551644547026,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004992948592001541,
|
|
"loss": 6.549,
|
|
"mean_token_accuracy": 0.157489425688982,
|
|
"num_tokens": 7974589.0,
|
|
"step": 3160
|
|
},
|
|
{
|
|
"entropy": 6.723839282989502,
|
|
"epoch": 0.36526255049047895,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.000499291591082364,
|
|
"loss": 6.5873,
|
|
"mean_token_accuracy": 0.1510259687900543,
|
|
"num_tokens": 7987148.0,
|
|
"step": 3165
|
|
},
|
|
{
|
|
"entropy": 6.713741779327393,
|
|
"epoch": 0.3658395845354876,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004992883154206377,
|
|
"loss": 6.6151,
|
|
"mean_token_accuracy": 0.15011707395315171,
|
|
"num_tokens": 8000679.0,
|
|
"step": 3170
|
|
},
|
|
{
|
|
"entropy": 6.601009368896484,
|
|
"epoch": 0.36641661858049623,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004992850322150853,
|
|
"loss": 6.4989,
|
|
"mean_token_accuracy": 0.1541821539402008,
|
|
"num_tokens": 8014011.0,
|
|
"step": 3175
|
|
},
|
|
{
|
|
"entropy": 6.708580017089844,
|
|
"epoch": 0.36699365262550493,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004992817414658172,
|
|
"loss": 6.5279,
|
|
"mean_token_accuracy": 0.1508907914161682,
|
|
"num_tokens": 8026022.0,
|
|
"step": 3180
|
|
},
|
|
{
|
|
"entropy": 6.696759557723999,
|
|
"epoch": 0.36757068667051357,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004992784431729442,
|
|
"loss": 6.5946,
|
|
"mean_token_accuracy": 0.15226232409477233,
|
|
"num_tokens": 8040123.0,
|
|
"step": 3185
|
|
},
|
|
{
|
|
"entropy": 6.711783027648925,
|
|
"epoch": 0.3681477207155222,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004992751373365771,
|
|
"loss": 6.5655,
|
|
"mean_token_accuracy": 0.1614807665348053,
|
|
"num_tokens": 8053320.0,
|
|
"step": 3190
|
|
},
|
|
{
|
|
"entropy": 6.583008337020874,
|
|
"epoch": 0.36872475476053085,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004992718239568273,
|
|
"loss": 6.5506,
|
|
"mean_token_accuracy": 0.15854466408491136,
|
|
"num_tokens": 8066682.0,
|
|
"step": 3195
|
|
},
|
|
{
|
|
"entropy": 6.743299245834351,
|
|
"epoch": 0.36930178880553954,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.000499268503033806,
|
|
"loss": 6.5441,
|
|
"mean_token_accuracy": 0.15438564270734786,
|
|
"num_tokens": 8078887.0,
|
|
"step": 3200
|
|
},
|
|
{
|
|
"entropy": 6.632726764678955,
|
|
"epoch": 0.3698788228505482,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004992651745676249,
|
|
"loss": 6.5254,
|
|
"mean_token_accuracy": 0.14970515072345733,
|
|
"num_tokens": 8090801.0,
|
|
"step": 3205
|
|
},
|
|
{
|
|
"entropy": 6.689233827590942,
|
|
"epoch": 0.3704558568955568,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004992618385583962,
|
|
"loss": 6.6118,
|
|
"mean_token_accuracy": 0.150309057533741,
|
|
"num_tokens": 8103387.0,
|
|
"step": 3210
|
|
},
|
|
{
|
|
"entropy": 6.599812173843384,
|
|
"epoch": 0.3710328909405655,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004992584950062319,
|
|
"loss": 6.4614,
|
|
"mean_token_accuracy": 0.15385584011673928,
|
|
"num_tokens": 8115356.0,
|
|
"step": 3215
|
|
},
|
|
{
|
|
"entropy": 6.6642804622650145,
|
|
"epoch": 0.37160992498557416,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004992551439112446,
|
|
"loss": 6.5755,
|
|
"mean_token_accuracy": 0.15292710214853286,
|
|
"num_tokens": 8129141.0,
|
|
"step": 3220
|
|
},
|
|
{
|
|
"entropy": 6.788556814193726,
|
|
"epoch": 0.3721869590305828,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004992517852735469,
|
|
"loss": 6.6057,
|
|
"mean_token_accuracy": 0.15070945620536805,
|
|
"num_tokens": 8142453.0,
|
|
"step": 3225
|
|
},
|
|
{
|
|
"entropy": 6.635298871994019,
|
|
"epoch": 0.37276399307559144,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004992484190932517,
|
|
"loss": 6.5671,
|
|
"mean_token_accuracy": 0.15121689140796662,
|
|
"num_tokens": 8154361.0,
|
|
"step": 3230
|
|
},
|
|
{
|
|
"entropy": 6.688446187973023,
|
|
"epoch": 0.37334102712060013,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004992450453704723,
|
|
"loss": 6.6194,
|
|
"mean_token_accuracy": 0.1466634377837181,
|
|
"num_tokens": 8168354.0,
|
|
"step": 3235
|
|
},
|
|
{
|
|
"entropy": 6.704189300537109,
|
|
"epoch": 0.3739180611656088,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004992416641053223,
|
|
"loss": 6.561,
|
|
"mean_token_accuracy": 0.1562179759144783,
|
|
"num_tokens": 8180700.0,
|
|
"step": 3240
|
|
},
|
|
{
|
|
"entropy": 6.630801677703857,
|
|
"epoch": 0.3744950952106174,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004992382752979153,
|
|
"loss": 6.5558,
|
|
"mean_token_accuracy": 0.15030025094747543,
|
|
"num_tokens": 8193987.0,
|
|
"step": 3245
|
|
},
|
|
{
|
|
"entropy": 6.665634822845459,
|
|
"epoch": 0.3750721292556261,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004992348789483651,
|
|
"loss": 6.6435,
|
|
"mean_token_accuracy": 0.15180691108107566,
|
|
"num_tokens": 8207150.0,
|
|
"step": 3250
|
|
},
|
|
{
|
|
"entropy": 6.734830856323242,
|
|
"epoch": 0.37564916330063475,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004992314750567864,
|
|
"loss": 6.5991,
|
|
"mean_token_accuracy": 0.1455582395195961,
|
|
"num_tokens": 8221050.0,
|
|
"step": 3255
|
|
},
|
|
{
|
|
"entropy": 6.682382249832154,
|
|
"epoch": 0.3762261973456434,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004992280636232933,
|
|
"loss": 6.5269,
|
|
"mean_token_accuracy": 0.1531355321407318,
|
|
"num_tokens": 8233641.0,
|
|
"step": 3260
|
|
},
|
|
{
|
|
"entropy": 6.685485553741455,
|
|
"epoch": 0.376803231390652,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004992246446480007,
|
|
"loss": 6.5393,
|
|
"mean_token_accuracy": 0.1599086806178093,
|
|
"num_tokens": 8246717.0,
|
|
"step": 3265
|
|
},
|
|
{
|
|
"entropy": 6.670789384841919,
|
|
"epoch": 0.3773802654356607,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004992212181310235,
|
|
"loss": 6.5781,
|
|
"mean_token_accuracy": 0.1480855494737625,
|
|
"num_tokens": 8258549.0,
|
|
"step": 3270
|
|
},
|
|
{
|
|
"entropy": 6.667711162567139,
|
|
"epoch": 0.37795729948066936,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000499217784072477,
|
|
"loss": 6.5681,
|
|
"mean_token_accuracy": 0.15179934725165367,
|
|
"num_tokens": 8271580.0,
|
|
"step": 3275
|
|
},
|
|
{
|
|
"entropy": 6.632532358169556,
|
|
"epoch": 0.378534333525678,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004992143424724768,
|
|
"loss": 6.5012,
|
|
"mean_token_accuracy": 0.16231818795204161,
|
|
"num_tokens": 8283866.0,
|
|
"step": 3280
|
|
},
|
|
{
|
|
"entropy": 6.666814136505127,
|
|
"epoch": 0.3791113675706867,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004992108933311385,
|
|
"loss": 6.546,
|
|
"mean_token_accuracy": 0.1500297874212265,
|
|
"num_tokens": 8296141.0,
|
|
"step": 3285
|
|
},
|
|
{
|
|
"entropy": 6.701229381561279,
|
|
"epoch": 0.37968840161569534,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004992074366485782,
|
|
"loss": 6.5113,
|
|
"mean_token_accuracy": 0.15184457004070281,
|
|
"num_tokens": 8309028.0,
|
|
"step": 3290
|
|
},
|
|
{
|
|
"entropy": 6.686760330200196,
|
|
"epoch": 0.380265435660704,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.000499203972424912,
|
|
"loss": 6.498,
|
|
"mean_token_accuracy": 0.15328776091337204,
|
|
"num_tokens": 8321268.0,
|
|
"step": 3295
|
|
},
|
|
{
|
|
"entropy": 6.590341329574585,
|
|
"epoch": 0.3808424697057126,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004992005006602567,
|
|
"loss": 6.507,
|
|
"mean_token_accuracy": 0.16145216226577758,
|
|
"num_tokens": 8333518.0,
|
|
"step": 3300
|
|
},
|
|
{
|
|
"entropy": 6.609353303909302,
|
|
"epoch": 0.3814195037507213,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004991970213547289,
|
|
"loss": 6.5272,
|
|
"mean_token_accuracy": 0.15743554830551149,
|
|
"num_tokens": 8345639.0,
|
|
"step": 3305
|
|
},
|
|
{
|
|
"entropy": 6.561810779571533,
|
|
"epoch": 0.38199653779572995,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004991935345084457,
|
|
"loss": 6.4193,
|
|
"mean_token_accuracy": 0.15771780014038086,
|
|
"num_tokens": 8358136.0,
|
|
"step": 3310
|
|
},
|
|
{
|
|
"entropy": 6.7044079303741455,
|
|
"epoch": 0.3825735718407386,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004991900401215243,
|
|
"loss": 6.5946,
|
|
"mean_token_accuracy": 0.14319533258676528,
|
|
"num_tokens": 8370480.0,
|
|
"step": 3315
|
|
},
|
|
{
|
|
"entropy": 6.665462303161621,
|
|
"epoch": 0.3831506058857473,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004991865381940822,
|
|
"loss": 6.5106,
|
|
"mean_token_accuracy": 0.15779313147068025,
|
|
"num_tokens": 8382894.0,
|
|
"step": 3320
|
|
},
|
|
{
|
|
"entropy": 6.643408632278442,
|
|
"epoch": 0.3837276399307559,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004991830287262374,
|
|
"loss": 6.603,
|
|
"mean_token_accuracy": 0.15157458335161209,
|
|
"num_tokens": 8395864.0,
|
|
"step": 3325
|
|
},
|
|
{
|
|
"entropy": 6.72900710105896,
|
|
"epoch": 0.38430467397576457,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004991795117181077,
|
|
"loss": 6.6255,
|
|
"mean_token_accuracy": 0.14565462321043016,
|
|
"num_tokens": 8408242.0,
|
|
"step": 3330
|
|
},
|
|
{
|
|
"entropy": 6.697143411636352,
|
|
"epoch": 0.3848817080207732,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004991759871698113,
|
|
"loss": 6.5052,
|
|
"mean_token_accuracy": 0.15765076875686646,
|
|
"num_tokens": 8420677.0,
|
|
"step": 3335
|
|
},
|
|
{
|
|
"entropy": 6.566110467910766,
|
|
"epoch": 0.3854587420657819,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004991724550814671,
|
|
"loss": 6.5212,
|
|
"mean_token_accuracy": 0.16033077090978623,
|
|
"num_tokens": 8434505.0,
|
|
"step": 3340
|
|
},
|
|
{
|
|
"entropy": 6.772804021835327,
|
|
"epoch": 0.38603577611079054,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004991689154531937,
|
|
"loss": 6.5408,
|
|
"mean_token_accuracy": 0.1514905296266079,
|
|
"num_tokens": 8447393.0,
|
|
"step": 3345
|
|
},
|
|
{
|
|
"entropy": 6.630925416946411,
|
|
"epoch": 0.3866128101557992,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004991653682851102,
|
|
"loss": 6.4492,
|
|
"mean_token_accuracy": 0.15575905442237853,
|
|
"num_tokens": 8459659.0,
|
|
"step": 3350
|
|
},
|
|
{
|
|
"entropy": 6.618975067138672,
|
|
"epoch": 0.3871898442008078,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.000499161813577336,
|
|
"loss": 6.5953,
|
|
"mean_token_accuracy": 0.1454840660095215,
|
|
"num_tokens": 8473783.0,
|
|
"step": 3355
|
|
},
|
|
{
|
|
"entropy": 6.637290287017822,
|
|
"epoch": 0.3877668782458165,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004991582513299903,
|
|
"loss": 6.38,
|
|
"mean_token_accuracy": 0.15462302714586257,
|
|
"num_tokens": 8486532.0,
|
|
"step": 3360
|
|
},
|
|
{
|
|
"entropy": 6.563358974456787,
|
|
"epoch": 0.38834391229082516,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004991546815431932,
|
|
"loss": 6.5613,
|
|
"mean_token_accuracy": 0.15162240266799926,
|
|
"num_tokens": 8499133.0,
|
|
"step": 3365
|
|
},
|
|
{
|
|
"entropy": 6.700711011886597,
|
|
"epoch": 0.3889209463358338,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.000499151104217065,
|
|
"loss": 6.5991,
|
|
"mean_token_accuracy": 0.1459987446665764,
|
|
"num_tokens": 8513391.0,
|
|
"step": 3370
|
|
},
|
|
{
|
|
"entropy": 6.657787609100342,
|
|
"epoch": 0.3894979803808425,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004991475193517254,
|
|
"loss": 6.5366,
|
|
"mean_token_accuracy": 0.1531873255968094,
|
|
"num_tokens": 8527191.0,
|
|
"step": 3375
|
|
},
|
|
{
|
|
"entropy": 6.656068611145019,
|
|
"epoch": 0.39007501442585113,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004991439269472956,
|
|
"loss": 6.5855,
|
|
"mean_token_accuracy": 0.15025382339954377,
|
|
"num_tokens": 8541328.0,
|
|
"step": 3380
|
|
},
|
|
{
|
|
"entropy": 6.641211032867432,
|
|
"epoch": 0.39065204847085977,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004991403270038961,
|
|
"loss": 6.493,
|
|
"mean_token_accuracy": 0.14907428622245789,
|
|
"num_tokens": 8553381.0,
|
|
"step": 3385
|
|
},
|
|
{
|
|
"entropy": 6.629001951217651,
|
|
"epoch": 0.3912290825158684,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000499136719521648,
|
|
"loss": 6.5109,
|
|
"mean_token_accuracy": 0.14996647387742995,
|
|
"num_tokens": 8565149.0,
|
|
"step": 3390
|
|
},
|
|
{
|
|
"entropy": 6.6479668617248535,
|
|
"epoch": 0.3918061165608771,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004991331045006726,
|
|
"loss": 6.5134,
|
|
"mean_token_accuracy": 0.1577385514974594,
|
|
"num_tokens": 8576767.0,
|
|
"step": 3395
|
|
},
|
|
{
|
|
"entropy": 6.707239389419556,
|
|
"epoch": 0.39238315060588574,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004991294819410916,
|
|
"loss": 6.5702,
|
|
"mean_token_accuracy": 0.15049649626016617,
|
|
"num_tokens": 8589948.0,
|
|
"step": 3400
|
|
},
|
|
{
|
|
"entropy": 6.554754066467285,
|
|
"epoch": 0.3929601846508944,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004991258518430268,
|
|
"loss": 6.4066,
|
|
"mean_token_accuracy": 0.1551789790391922,
|
|
"num_tokens": 8602233.0,
|
|
"step": 3405
|
|
},
|
|
{
|
|
"entropy": 6.66826901435852,
|
|
"epoch": 0.3935372186959031,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004991222142066003,
|
|
"loss": 6.4969,
|
|
"mean_token_accuracy": 0.15271663516759873,
|
|
"num_tokens": 8614938.0,
|
|
"step": 3410
|
|
},
|
|
{
|
|
"entropy": 6.688100671768188,
|
|
"epoch": 0.3941142527409117,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004991185690319345,
|
|
"loss": 6.5324,
|
|
"mean_token_accuracy": 0.1585379496216774,
|
|
"num_tokens": 8628203.0,
|
|
"step": 3415
|
|
},
|
|
{
|
|
"entropy": 6.593408536911011,
|
|
"epoch": 0.39469128678592036,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.000499114916319152,
|
|
"loss": 6.5038,
|
|
"mean_token_accuracy": 0.1594579190015793,
|
|
"num_tokens": 8640959.0,
|
|
"step": 3420
|
|
},
|
|
{
|
|
"entropy": 6.617645931243897,
|
|
"epoch": 0.395268320830929,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0004991112560683755,
|
|
"loss": 6.5159,
|
|
"mean_token_accuracy": 0.15616845935583115,
|
|
"num_tokens": 8656995.0,
|
|
"step": 3425
|
|
},
|
|
{
|
|
"entropy": 6.678982210159302,
|
|
"epoch": 0.3958453548759377,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004991075882797283,
|
|
"loss": 6.5291,
|
|
"mean_token_accuracy": 0.15549861565232276,
|
|
"num_tokens": 8671476.0,
|
|
"step": 3430
|
|
},
|
|
{
|
|
"entropy": 6.627415466308594,
|
|
"epoch": 0.39642238892094633,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004991039129533337,
|
|
"loss": 6.5481,
|
|
"mean_token_accuracy": 0.1529051437973976,
|
|
"num_tokens": 8683667.0,
|
|
"step": 3435
|
|
},
|
|
{
|
|
"entropy": 6.644215297698975,
|
|
"epoch": 0.396999422965955,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004991002300893152,
|
|
"loss": 6.5546,
|
|
"mean_token_accuracy": 0.1545812577009201,
|
|
"num_tokens": 8696564.0,
|
|
"step": 3440
|
|
},
|
|
{
|
|
"entropy": 6.669400453567505,
|
|
"epoch": 0.39757645701096367,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004990965396877969,
|
|
"loss": 6.4865,
|
|
"mean_token_accuracy": 0.15339938551187515,
|
|
"num_tokens": 8708512.0,
|
|
"step": 3445
|
|
},
|
|
{
|
|
"entropy": 6.609234380722046,
|
|
"epoch": 0.3981534910559723,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004990928417489027,
|
|
"loss": 6.3673,
|
|
"mean_token_accuracy": 0.16587528437376023,
|
|
"num_tokens": 8721015.0,
|
|
"step": 3450
|
|
},
|
|
{
|
|
"entropy": 6.567390012741089,
|
|
"epoch": 0.39873052510098095,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004990891362727572,
|
|
"loss": 6.4854,
|
|
"mean_token_accuracy": 0.15047257542610168,
|
|
"num_tokens": 8732538.0,
|
|
"step": 3455
|
|
},
|
|
{
|
|
"entropy": 6.679238510131836,
|
|
"epoch": 0.3993075591459896,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004990854232594848,
|
|
"loss": 6.5582,
|
|
"mean_token_accuracy": 0.15114261358976364,
|
|
"num_tokens": 8745093.0,
|
|
"step": 3460
|
|
},
|
|
{
|
|
"entropy": 6.634946250915528,
|
|
"epoch": 0.3998845931909983,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004990817027092106,
|
|
"loss": 6.4983,
|
|
"mean_token_accuracy": 0.15687089264392853,
|
|
"num_tokens": 8757441.0,
|
|
"step": 3465
|
|
},
|
|
{
|
|
"entropy": 6.660363864898682,
|
|
"epoch": 0.4004616272360069,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004990779746220595,
|
|
"loss": 6.5185,
|
|
"mean_token_accuracy": 0.15596205741167068,
|
|
"num_tokens": 8770307.0,
|
|
"step": 3470
|
|
},
|
|
{
|
|
"entropy": 6.5660014152526855,
|
|
"epoch": 0.40103866128101556,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004990742389981572,
|
|
"loss": 6.5366,
|
|
"mean_token_accuracy": 0.1550653576850891,
|
|
"num_tokens": 8782575.0,
|
|
"step": 3475
|
|
},
|
|
{
|
|
"entropy": 6.664673566818237,
|
|
"epoch": 0.40161569532602426,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.000499070495837629,
|
|
"loss": 6.5848,
|
|
"mean_token_accuracy": 0.14479815810918809,
|
|
"num_tokens": 8794962.0,
|
|
"step": 3480
|
|
},
|
|
{
|
|
"entropy": 6.661259126663208,
|
|
"epoch": 0.4021927293710329,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004990667451406012,
|
|
"loss": 6.5674,
|
|
"mean_token_accuracy": 0.1521621063351631,
|
|
"num_tokens": 8807434.0,
|
|
"step": 3485
|
|
},
|
|
{
|
|
"entropy": 6.673516368865966,
|
|
"epoch": 0.40276976341604154,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004990629869071995,
|
|
"loss": 6.5391,
|
|
"mean_token_accuracy": 0.14591969475150107,
|
|
"num_tokens": 8820748.0,
|
|
"step": 3490
|
|
},
|
|
{
|
|
"entropy": 6.604957246780396,
|
|
"epoch": 0.4033467974610502,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004990592211375506,
|
|
"loss": 6.465,
|
|
"mean_token_accuracy": 0.15596169531345366,
|
|
"num_tokens": 8833428.0,
|
|
"step": 3495
|
|
},
|
|
{
|
|
"entropy": 6.66051025390625,
|
|
"epoch": 0.4039238315060589,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004990554478317811,
|
|
"loss": 6.5121,
|
|
"mean_token_accuracy": 0.14970427826046945,
|
|
"num_tokens": 8845892.0,
|
|
"step": 3500
|
|
},
|
|
{
|
|
"entropy": 6.575010538101196,
|
|
"epoch": 0.4045008655510675,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004990516669900179,
|
|
"loss": 6.4569,
|
|
"mean_token_accuracy": 0.155875825881958,
|
|
"num_tokens": 8857508.0,
|
|
"step": 3505
|
|
},
|
|
{
|
|
"entropy": 6.607421207427978,
|
|
"epoch": 0.40507789959607615,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004990478786123882,
|
|
"loss": 6.492,
|
|
"mean_token_accuracy": 0.1571622833609581,
|
|
"num_tokens": 8868730.0,
|
|
"step": 3510
|
|
},
|
|
{
|
|
"entropy": 6.664318418502807,
|
|
"epoch": 0.40565493364108485,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0004990440826990193,
|
|
"loss": 6.4882,
|
|
"mean_token_accuracy": 0.14911171048879623,
|
|
"num_tokens": 8882687.0,
|
|
"step": 3515
|
|
},
|
|
{
|
|
"entropy": 6.578036642074585,
|
|
"epoch": 0.4062319676860935,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004990402792500392,
|
|
"loss": 6.5032,
|
|
"mean_token_accuracy": 0.15692729353904725,
|
|
"num_tokens": 8894723.0,
|
|
"step": 3520
|
|
},
|
|
{
|
|
"entropy": 6.5801005363464355,
|
|
"epoch": 0.4068090017311021,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004990364682655754,
|
|
"loss": 6.4722,
|
|
"mean_token_accuracy": 0.15482148230075837,
|
|
"num_tokens": 8906373.0,
|
|
"step": 3525
|
|
},
|
|
{
|
|
"entropy": 6.604721021652222,
|
|
"epoch": 0.40738603577611077,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004990326497457564,
|
|
"loss": 6.4737,
|
|
"mean_token_accuracy": 0.15373015254735947,
|
|
"num_tokens": 8918681.0,
|
|
"step": 3530
|
|
},
|
|
{
|
|
"entropy": 6.652784156799316,
|
|
"epoch": 0.40796306982111946,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004990288236907104,
|
|
"loss": 6.5282,
|
|
"mean_token_accuracy": 0.1494688406586647,
|
|
"num_tokens": 8930232.0,
|
|
"step": 3535
|
|
},
|
|
{
|
|
"entropy": 6.576983118057251,
|
|
"epoch": 0.4085401038661281,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004990249901005661,
|
|
"loss": 6.4193,
|
|
"mean_token_accuracy": 0.15579718947410584,
|
|
"num_tokens": 8942264.0,
|
|
"step": 3540
|
|
},
|
|
{
|
|
"entropy": 6.643110370635986,
|
|
"epoch": 0.40911713791113674,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004990211489754527,
|
|
"loss": 6.5992,
|
|
"mean_token_accuracy": 0.1467343896627426,
|
|
"num_tokens": 8955679.0,
|
|
"step": 3545
|
|
},
|
|
{
|
|
"entropy": 6.642524147033692,
|
|
"epoch": 0.40969417195614544,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004990173003154993,
|
|
"loss": 6.4317,
|
|
"mean_token_accuracy": 0.1543587066233158,
|
|
"num_tokens": 8968421.0,
|
|
"step": 3550
|
|
},
|
|
{
|
|
"entropy": 6.565263557434082,
|
|
"epoch": 0.4102712060011541,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004990134441208351,
|
|
"loss": 6.5003,
|
|
"mean_token_accuracy": 0.15063199996948243,
|
|
"num_tokens": 8981063.0,
|
|
"step": 3555
|
|
},
|
|
{
|
|
"entropy": 6.604219722747803,
|
|
"epoch": 0.4108482400461627,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004990095803915901,
|
|
"loss": 6.4315,
|
|
"mean_token_accuracy": 0.16306943893432618,
|
|
"num_tokens": 8993740.0,
|
|
"step": 3560
|
|
},
|
|
{
|
|
"entropy": 6.59393835067749,
|
|
"epoch": 0.41142527409117136,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004990057091278942,
|
|
"loss": 6.4888,
|
|
"mean_token_accuracy": 0.14942816495895386,
|
|
"num_tokens": 9007135.0,
|
|
"step": 3565
|
|
},
|
|
{
|
|
"entropy": 6.600633573532105,
|
|
"epoch": 0.41200230813618005,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004990018303298773,
|
|
"loss": 6.5045,
|
|
"mean_token_accuracy": 0.15680433362722396,
|
|
"num_tokens": 9021596.0,
|
|
"step": 3570
|
|
},
|
|
{
|
|
"entropy": 6.61022539138794,
|
|
"epoch": 0.4125793421811887,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004989979439976703,
|
|
"loss": 6.44,
|
|
"mean_token_accuracy": 0.16000102311372758,
|
|
"num_tokens": 9033523.0,
|
|
"step": 3575
|
|
},
|
|
{
|
|
"entropy": 6.593396806716919,
|
|
"epoch": 0.41315637622619733,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004989940501314037,
|
|
"loss": 6.4126,
|
|
"mean_token_accuracy": 0.15999998301267623,
|
|
"num_tokens": 9045690.0,
|
|
"step": 3580
|
|
},
|
|
{
|
|
"entropy": 6.580743408203125,
|
|
"epoch": 0.413733410271206,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004989901487312084,
|
|
"loss": 6.4811,
|
|
"mean_token_accuracy": 0.1552786871790886,
|
|
"num_tokens": 9057672.0,
|
|
"step": 3585
|
|
},
|
|
{
|
|
"entropy": 6.589711141586304,
|
|
"epoch": 0.41431044431621467,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004989862397972157,
|
|
"loss": 6.537,
|
|
"mean_token_accuracy": 0.15031036734580994,
|
|
"num_tokens": 9070004.0,
|
|
"step": 3590
|
|
},
|
|
{
|
|
"entropy": 6.658974361419678,
|
|
"epoch": 0.4148874783612233,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004989823233295572,
|
|
"loss": 6.4971,
|
|
"mean_token_accuracy": 0.15876225233078003,
|
|
"num_tokens": 9082453.0,
|
|
"step": 3595
|
|
},
|
|
{
|
|
"entropy": 6.593294286727906,
|
|
"epoch": 0.41546451240623195,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004989783993283644,
|
|
"loss": 6.5122,
|
|
"mean_token_accuracy": 0.1508851870894432,
|
|
"num_tokens": 9095839.0,
|
|
"step": 3600
|
|
},
|
|
{
|
|
"entropy": 6.563176059722901,
|
|
"epoch": 0.41604154645124064,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004989744677937694,
|
|
"loss": 6.4782,
|
|
"mean_token_accuracy": 0.1590025931596756,
|
|
"num_tokens": 9109476.0,
|
|
"step": 3605
|
|
},
|
|
{
|
|
"entropy": 6.619072437286377,
|
|
"epoch": 0.4166185804962493,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004989705287259046,
|
|
"loss": 6.4072,
|
|
"mean_token_accuracy": 0.1609771430492401,
|
|
"num_tokens": 9122354.0,
|
|
"step": 3610
|
|
},
|
|
{
|
|
"entropy": 6.532887077331543,
|
|
"epoch": 0.4171956145412579,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004989665821249021,
|
|
"loss": 6.4261,
|
|
"mean_token_accuracy": 0.16253601163625717,
|
|
"num_tokens": 9135502.0,
|
|
"step": 3615
|
|
},
|
|
{
|
|
"entropy": 6.664855527877807,
|
|
"epoch": 0.4177726485862666,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.000498962627990895,
|
|
"loss": 6.5659,
|
|
"mean_token_accuracy": 0.15357777327299119,
|
|
"num_tokens": 9147654.0,
|
|
"step": 3620
|
|
},
|
|
{
|
|
"entropy": 6.56908655166626,
|
|
"epoch": 0.41834968263127525,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004989586663240161,
|
|
"loss": 6.4847,
|
|
"mean_token_accuracy": 0.1522589549422264,
|
|
"num_tokens": 9161907.0,
|
|
"step": 3625
|
|
},
|
|
{
|
|
"entropy": 6.620093536376953,
|
|
"epoch": 0.4189267166762839,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004989546971243988,
|
|
"loss": 6.513,
|
|
"mean_token_accuracy": 0.14616103172302247,
|
|
"num_tokens": 9175395.0,
|
|
"step": 3630
|
|
},
|
|
{
|
|
"entropy": 6.614277410507202,
|
|
"epoch": 0.41950375072129253,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004989507203921763,
|
|
"loss": 6.4278,
|
|
"mean_token_accuracy": 0.1567081741988659,
|
|
"num_tokens": 9187688.0,
|
|
"step": 3635
|
|
},
|
|
{
|
|
"entropy": 6.550759267807007,
|
|
"epoch": 0.42008078476630123,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004989467361274828,
|
|
"loss": 6.4669,
|
|
"mean_token_accuracy": 0.15715653598308563,
|
|
"num_tokens": 9199773.0,
|
|
"step": 3640
|
|
},
|
|
{
|
|
"entropy": 6.521318578720093,
|
|
"epoch": 0.42065781881130987,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 0.0004989427443304519,
|
|
"loss": 6.4367,
|
|
"mean_token_accuracy": 0.1557897448539734,
|
|
"num_tokens": 9213997.0,
|
|
"step": 3645
|
|
},
|
|
{
|
|
"entropy": 6.621791362762451,
|
|
"epoch": 0.4212348528563185,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000498938745001218,
|
|
"loss": 6.4908,
|
|
"mean_token_accuracy": 0.15198236405849458,
|
|
"num_tokens": 9227187.0,
|
|
"step": 3650
|
|
},
|
|
{
|
|
"entropy": 6.67909688949585,
|
|
"epoch": 0.4218118869013272,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004989347381399158,
|
|
"loss": 6.5423,
|
|
"mean_token_accuracy": 0.1490216538310051,
|
|
"num_tokens": 9240860.0,
|
|
"step": 3655
|
|
},
|
|
{
|
|
"entropy": 6.584900903701782,
|
|
"epoch": 0.42238892094633584,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004989307237466799,
|
|
"loss": 6.436,
|
|
"mean_token_accuracy": 0.15650416314601898,
|
|
"num_tokens": 9253771.0,
|
|
"step": 3660
|
|
},
|
|
{
|
|
"entropy": 6.587461662292481,
|
|
"epoch": 0.4229659549913445,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004989267018216453,
|
|
"loss": 6.4773,
|
|
"mean_token_accuracy": 0.15263158679008484,
|
|
"num_tokens": 9268380.0,
|
|
"step": 3665
|
|
},
|
|
{
|
|
"entropy": 6.588645076751709,
|
|
"epoch": 0.4235429890363531,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004989226723649473,
|
|
"loss": 6.4562,
|
|
"mean_token_accuracy": 0.1565222844481468,
|
|
"num_tokens": 9279911.0,
|
|
"step": 3670
|
|
},
|
|
{
|
|
"entropy": 6.556595277786255,
|
|
"epoch": 0.4241200230813618,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004989186353767214,
|
|
"loss": 6.446,
|
|
"mean_token_accuracy": 0.16146985441446304,
|
|
"num_tokens": 9292105.0,
|
|
"step": 3675
|
|
},
|
|
{
|
|
"entropy": 6.591396760940552,
|
|
"epoch": 0.42469705712637046,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004989145908571035,
|
|
"loss": 6.5677,
|
|
"mean_token_accuracy": 0.15078672766685486,
|
|
"num_tokens": 9305503.0,
|
|
"step": 3680
|
|
},
|
|
{
|
|
"entropy": 6.630074405670166,
|
|
"epoch": 0.4252740911713791,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004989105388062295,
|
|
"loss": 6.4605,
|
|
"mean_token_accuracy": 0.1556406855583191,
|
|
"num_tokens": 9317978.0,
|
|
"step": 3685
|
|
},
|
|
{
|
|
"entropy": 6.619613599777222,
|
|
"epoch": 0.4258511252163878,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004989064792242358,
|
|
"loss": 6.5252,
|
|
"mean_token_accuracy": 0.15357265770435333,
|
|
"num_tokens": 9332676.0,
|
|
"step": 3690
|
|
},
|
|
{
|
|
"entropy": 6.579876184463501,
|
|
"epoch": 0.42642815926139643,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004989024121112589,
|
|
"loss": 6.426,
|
|
"mean_token_accuracy": 0.1560150146484375,
|
|
"num_tokens": 9345594.0,
|
|
"step": 3695
|
|
},
|
|
{
|
|
"entropy": 6.6138917922973635,
|
|
"epoch": 0.4270051933064051,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004988983374674356,
|
|
"loss": 6.5109,
|
|
"mean_token_accuracy": 0.1485238753259182,
|
|
"num_tokens": 9358303.0,
|
|
"step": 3700
|
|
},
|
|
{
|
|
"entropy": 6.520889186859131,
|
|
"epoch": 0.4275822273514137,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004988942552929029,
|
|
"loss": 6.3956,
|
|
"mean_token_accuracy": 0.16093592643737792,
|
|
"num_tokens": 9370953.0,
|
|
"step": 3705
|
|
},
|
|
{
|
|
"entropy": 6.522710132598877,
|
|
"epoch": 0.4281592613964224,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004988901655877981,
|
|
"loss": 6.4721,
|
|
"mean_token_accuracy": 0.15702161937952042,
|
|
"num_tokens": 9384563.0,
|
|
"step": 3710
|
|
},
|
|
{
|
|
"entropy": 6.60606837272644,
|
|
"epoch": 0.42873629544143105,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004988860683522589,
|
|
"loss": 6.4222,
|
|
"mean_token_accuracy": 0.16118086278438568,
|
|
"num_tokens": 9396401.0,
|
|
"step": 3715
|
|
},
|
|
{
|
|
"entropy": 6.555063343048095,
|
|
"epoch": 0.4293133294864397,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000498881963586423,
|
|
"loss": 6.4308,
|
|
"mean_token_accuracy": 0.15848347842693328,
|
|
"num_tokens": 9408520.0,
|
|
"step": 3720
|
|
},
|
|
{
|
|
"entropy": 6.4073954105377195,
|
|
"epoch": 0.4298903635314484,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004988778512904282,
|
|
"loss": 6.3381,
|
|
"mean_token_accuracy": 0.16240834444761276,
|
|
"num_tokens": 9421431.0,
|
|
"step": 3725
|
|
},
|
|
{
|
|
"entropy": 6.549575996398926,
|
|
"epoch": 0.430467397576457,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004988737314644134,
|
|
"loss": 6.4617,
|
|
"mean_token_accuracy": 0.15462952852249146,
|
|
"num_tokens": 9432566.0,
|
|
"step": 3730
|
|
},
|
|
{
|
|
"entropy": 6.6500896453857425,
|
|
"epoch": 0.43104443162146566,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004988696041085168,
|
|
"loss": 6.5593,
|
|
"mean_token_accuracy": 0.15154415518045425,
|
|
"num_tokens": 9444885.0,
|
|
"step": 3735
|
|
},
|
|
{
|
|
"entropy": 6.667054796218872,
|
|
"epoch": 0.4316214656664743,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004988654692228772,
|
|
"loss": 6.5498,
|
|
"mean_token_accuracy": 0.15102049708366394,
|
|
"num_tokens": 9457823.0,
|
|
"step": 3740
|
|
},
|
|
{
|
|
"entropy": 6.563848447799683,
|
|
"epoch": 0.432198499711483,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004988613268076335,
|
|
"loss": 6.3991,
|
|
"mean_token_accuracy": 0.16212892681360244,
|
|
"num_tokens": 9470799.0,
|
|
"step": 3745
|
|
},
|
|
{
|
|
"entropy": 6.535583543777466,
|
|
"epoch": 0.43277553375649164,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004988571768629257,
|
|
"loss": 6.4583,
|
|
"mean_token_accuracy": 0.16189608722925186,
|
|
"num_tokens": 9484175.0,
|
|
"step": 3750
|
|
},
|
|
{
|
|
"entropy": 6.63653335571289,
|
|
"epoch": 0.4333525678015003,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004988530193888927,
|
|
"loss": 6.5043,
|
|
"mean_token_accuracy": 0.15041833072900773,
|
|
"num_tokens": 9497809.0,
|
|
"step": 3755
|
|
},
|
|
{
|
|
"entropy": 6.56855206489563,
|
|
"epoch": 0.4339296018465089,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004988488543856747,
|
|
"loss": 6.4451,
|
|
"mean_token_accuracy": 0.15440599322319032,
|
|
"num_tokens": 9509755.0,
|
|
"step": 3760
|
|
},
|
|
{
|
|
"entropy": 6.524028348922729,
|
|
"epoch": 0.4345066358915176,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0004988446818534115,
|
|
"loss": 6.4522,
|
|
"mean_token_accuracy": 0.15307800620794296,
|
|
"num_tokens": 9523801.0,
|
|
"step": 3765
|
|
},
|
|
{
|
|
"entropy": 6.563017177581787,
|
|
"epoch": 0.43508366993652625,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004988405017922438,
|
|
"loss": 6.4373,
|
|
"mean_token_accuracy": 0.16271546185016633,
|
|
"num_tokens": 9535846.0,
|
|
"step": 3770
|
|
},
|
|
{
|
|
"entropy": 6.650265073776245,
|
|
"epoch": 0.4356607039815349,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.000498836314202312,
|
|
"loss": 6.5108,
|
|
"mean_token_accuracy": 0.15331310480833055,
|
|
"num_tokens": 9548194.0,
|
|
"step": 3775
|
|
},
|
|
{
|
|
"entropy": 6.523101472854615,
|
|
"epoch": 0.4362377380265436,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004988321190837568,
|
|
"loss": 6.4047,
|
|
"mean_token_accuracy": 0.15477531999349595,
|
|
"num_tokens": 9561069.0,
|
|
"step": 3780
|
|
},
|
|
{
|
|
"entropy": 6.466052484512329,
|
|
"epoch": 0.4368147720715522,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004988279164367196,
|
|
"loss": 6.3793,
|
|
"mean_token_accuracy": 0.15896909236907958,
|
|
"num_tokens": 9573778.0,
|
|
"step": 3785
|
|
},
|
|
{
|
|
"entropy": 6.535996627807617,
|
|
"epoch": 0.43739180611656087,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004988237062613415,
|
|
"loss": 6.3608,
|
|
"mean_token_accuracy": 0.1710158884525299,
|
|
"num_tokens": 9586616.0,
|
|
"step": 3790
|
|
},
|
|
{
|
|
"entropy": 6.576893711090088,
|
|
"epoch": 0.4379688401615695,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004988194885577644,
|
|
"loss": 6.4697,
|
|
"mean_token_accuracy": 0.1554633378982544,
|
|
"num_tokens": 9597943.0,
|
|
"step": 3795
|
|
},
|
|
{
|
|
"entropy": 6.500680875778198,
|
|
"epoch": 0.4385458742065782,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004988152633261299,
|
|
"loss": 6.4066,
|
|
"mean_token_accuracy": 0.16017991304397583,
|
|
"num_tokens": 9609861.0,
|
|
"step": 3800
|
|
},
|
|
{
|
|
"entropy": 6.532161569595337,
|
|
"epoch": 0.43912290825158684,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.00049881103056658,
|
|
"loss": 6.4607,
|
|
"mean_token_accuracy": 0.16110374480485917,
|
|
"num_tokens": 9623307.0,
|
|
"step": 3805
|
|
},
|
|
{
|
|
"entropy": 6.590618324279785,
|
|
"epoch": 0.4396999422965955,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004988067902792575,
|
|
"loss": 6.4706,
|
|
"mean_token_accuracy": 0.15618328303098677,
|
|
"num_tokens": 9635827.0,
|
|
"step": 3810
|
|
},
|
|
{
|
|
"entropy": 6.584213638305664,
|
|
"epoch": 0.4402769763416042,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004988025424643047,
|
|
"loss": 6.5281,
|
|
"mean_token_accuracy": 0.15362918823957444,
|
|
"num_tokens": 9649422.0,
|
|
"step": 3815
|
|
},
|
|
{
|
|
"entropy": 6.539908409118652,
|
|
"epoch": 0.4408540103866128,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004987982871218645,
|
|
"loss": 6.4985,
|
|
"mean_token_accuracy": 0.16369809061288834,
|
|
"num_tokens": 9661542.0,
|
|
"step": 3820
|
|
},
|
|
{
|
|
"entropy": 6.592797899246216,
|
|
"epoch": 0.44143104443162146,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004987940242520802,
|
|
"loss": 6.4823,
|
|
"mean_token_accuracy": 0.15268328189849853,
|
|
"num_tokens": 9674684.0,
|
|
"step": 3825
|
|
},
|
|
{
|
|
"entropy": 6.680898857116699,
|
|
"epoch": 0.4420080784766301,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.000498789753855095,
|
|
"loss": 6.5,
|
|
"mean_token_accuracy": 0.1492106169462204,
|
|
"num_tokens": 9687522.0,
|
|
"step": 3830
|
|
},
|
|
{
|
|
"entropy": 6.574478960037231,
|
|
"epoch": 0.4425851125216388,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004987854759310526,
|
|
"loss": 6.4528,
|
|
"mean_token_accuracy": 0.15816389620304108,
|
|
"num_tokens": 9699518.0,
|
|
"step": 3835
|
|
},
|
|
{
|
|
"entropy": 6.567315101623535,
|
|
"epoch": 0.44316214656664743,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004987811904800968,
|
|
"loss": 6.5127,
|
|
"mean_token_accuracy": 0.15438069850206376,
|
|
"num_tokens": 9711918.0,
|
|
"step": 3840
|
|
},
|
|
{
|
|
"entropy": 6.596231937408447,
|
|
"epoch": 0.44373918061165607,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0004987768975023719,
|
|
"loss": 6.3862,
|
|
"mean_token_accuracy": 0.15680329352617264,
|
|
"num_tokens": 9725643.0,
|
|
"step": 3845
|
|
},
|
|
{
|
|
"entropy": 6.530617141723633,
|
|
"epoch": 0.44431621465666477,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004987725969980222,
|
|
"loss": 6.403,
|
|
"mean_token_accuracy": 0.1597583845257759,
|
|
"num_tokens": 9738871.0,
|
|
"step": 3850
|
|
},
|
|
{
|
|
"entropy": 6.540352916717529,
|
|
"epoch": 0.4448932487016734,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004987682889671923,
|
|
"loss": 6.3894,
|
|
"mean_token_accuracy": 0.1617853969335556,
|
|
"num_tokens": 9751166.0,
|
|
"step": 3855
|
|
},
|
|
{
|
|
"entropy": 6.512079095840454,
|
|
"epoch": 0.44547028274668204,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004987639734100272,
|
|
"loss": 6.3536,
|
|
"mean_token_accuracy": 0.16155828088521956,
|
|
"num_tokens": 9765165.0,
|
|
"step": 3860
|
|
},
|
|
{
|
|
"entropy": 6.56067123413086,
|
|
"epoch": 0.4460473167916907,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004987596503266721,
|
|
"loss": 6.4014,
|
|
"mean_token_accuracy": 0.1621742233633995,
|
|
"num_tokens": 9776625.0,
|
|
"step": 3865
|
|
},
|
|
{
|
|
"entropy": 6.538637399673462,
|
|
"epoch": 0.4466243508366994,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004987553197172722,
|
|
"loss": 6.4152,
|
|
"mean_token_accuracy": 0.16095769703388213,
|
|
"num_tokens": 9789689.0,
|
|
"step": 3870
|
|
},
|
|
{
|
|
"entropy": 6.617307853698731,
|
|
"epoch": 0.447201384881708,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004987509815819732,
|
|
"loss": 6.5181,
|
|
"mean_token_accuracy": 0.15431652069091797,
|
|
"num_tokens": 9801124.0,
|
|
"step": 3875
|
|
},
|
|
{
|
|
"entropy": 6.545049571990967,
|
|
"epoch": 0.44777841892671666,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004987466359209213,
|
|
"loss": 6.4654,
|
|
"mean_token_accuracy": 0.1531405434012413,
|
|
"num_tokens": 9814264.0,
|
|
"step": 3880
|
|
},
|
|
{
|
|
"entropy": 6.532504224777222,
|
|
"epoch": 0.44835545297172535,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004987422827342622,
|
|
"loss": 6.3939,
|
|
"mean_token_accuracy": 0.16244966238737107,
|
|
"num_tokens": 9826149.0,
|
|
"step": 3885
|
|
},
|
|
{
|
|
"entropy": 6.605834484100342,
|
|
"epoch": 0.448932487016734,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004987379220221426,
|
|
"loss": 6.4765,
|
|
"mean_token_accuracy": 0.15153736919164656,
|
|
"num_tokens": 9838485.0,
|
|
"step": 3890
|
|
},
|
|
{
|
|
"entropy": 6.5250184535980225,
|
|
"epoch": 0.44950952106174263,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004987335537847092,
|
|
"loss": 6.4029,
|
|
"mean_token_accuracy": 0.1562870755791664,
|
|
"num_tokens": 9851371.0,
|
|
"step": 3895
|
|
},
|
|
{
|
|
"entropy": 6.563957357406617,
|
|
"epoch": 0.4500865551067513,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004987291780221088,
|
|
"loss": 6.4599,
|
|
"mean_token_accuracy": 0.15669308006763458,
|
|
"num_tokens": 9864371.0,
|
|
"step": 3900
|
|
},
|
|
{
|
|
"entropy": 6.585865068435669,
|
|
"epoch": 0.45066358915175997,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004987247947344887,
|
|
"loss": 6.4487,
|
|
"mean_token_accuracy": 0.15703559517860413,
|
|
"num_tokens": 9876086.0,
|
|
"step": 3905
|
|
},
|
|
{
|
|
"entropy": 6.544737100601196,
|
|
"epoch": 0.4512406231967686,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004987204039219962,
|
|
"loss": 6.4455,
|
|
"mean_token_accuracy": 0.15367899984121322,
|
|
"num_tokens": 9888850.0,
|
|
"step": 3910
|
|
},
|
|
{
|
|
"entropy": 6.561423492431641,
|
|
"epoch": 0.45181765724177725,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004987160055847791,
|
|
"loss": 6.4777,
|
|
"mean_token_accuracy": 0.15599952191114425,
|
|
"num_tokens": 9901467.0,
|
|
"step": 3915
|
|
},
|
|
{
|
|
"entropy": 6.574502992630005,
|
|
"epoch": 0.45239469128678594,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004987115997229852,
|
|
"loss": 6.4479,
|
|
"mean_token_accuracy": 0.15445881485939025,
|
|
"num_tokens": 9914431.0,
|
|
"step": 3920
|
|
},
|
|
{
|
|
"entropy": 6.613849687576294,
|
|
"epoch": 0.4529717253317946,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004987071863367629,
|
|
"loss": 6.4776,
|
|
"mean_token_accuracy": 0.15640159994363784,
|
|
"num_tokens": 9926863.0,
|
|
"step": 3925
|
|
},
|
|
{
|
|
"entropy": 6.555788230895996,
|
|
"epoch": 0.4535487593768032,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004987027654262604,
|
|
"loss": 6.4231,
|
|
"mean_token_accuracy": 0.1610432580113411,
|
|
"num_tokens": 9939064.0,
|
|
"step": 3930
|
|
},
|
|
{
|
|
"entropy": 6.492784738540649,
|
|
"epoch": 0.45412579342181186,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004986983369916264,
|
|
"loss": 6.4221,
|
|
"mean_token_accuracy": 0.15522423386573792,
|
|
"num_tokens": 9950897.0,
|
|
"step": 3935
|
|
},
|
|
{
|
|
"entropy": 6.640955543518066,
|
|
"epoch": 0.45470282746682056,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004986939010330102,
|
|
"loss": 6.4711,
|
|
"mean_token_accuracy": 0.15500133484601974,
|
|
"num_tokens": 9964388.0,
|
|
"step": 3940
|
|
},
|
|
{
|
|
"entropy": 6.412693643569947,
|
|
"epoch": 0.4552798615118292,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004986894575505606,
|
|
"loss": 6.2872,
|
|
"mean_token_accuracy": 0.1698276601731777,
|
|
"num_tokens": 9977363.0,
|
|
"step": 3945
|
|
},
|
|
{
|
|
"entropy": 6.545732498168945,
|
|
"epoch": 0.45585689555683784,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004986850065444272,
|
|
"loss": 6.3485,
|
|
"mean_token_accuracy": 0.16417437195777893,
|
|
"num_tokens": 9989691.0,
|
|
"step": 3950
|
|
},
|
|
{
|
|
"entropy": 6.592774343490601,
|
|
"epoch": 0.45643392960184653,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004986805480147598,
|
|
"loss": 6.4064,
|
|
"mean_token_accuracy": 0.15252988934516906,
|
|
"num_tokens": 10002177.0,
|
|
"step": 3955
|
|
},
|
|
{
|
|
"entropy": 6.508685827255249,
|
|
"epoch": 0.4570109636468552,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004986760819617082,
|
|
"loss": 6.4662,
|
|
"mean_token_accuracy": 0.15122403651475907,
|
|
"num_tokens": 10014844.0,
|
|
"step": 3960
|
|
},
|
|
{
|
|
"entropy": 6.652512836456299,
|
|
"epoch": 0.4575879976918638,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004986716083854228,
|
|
"loss": 6.4914,
|
|
"mean_token_accuracy": 0.1520856276154518,
|
|
"num_tokens": 10028351.0,
|
|
"step": 3965
|
|
},
|
|
{
|
|
"entropy": 6.521466636657715,
|
|
"epoch": 0.45816503173687245,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004986671272860538,
|
|
"loss": 6.3913,
|
|
"mean_token_accuracy": 0.15310998558998107,
|
|
"num_tokens": 10041318.0,
|
|
"step": 3970
|
|
},
|
|
{
|
|
"entropy": 6.557436227798462,
|
|
"epoch": 0.45874206578188115,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004986626386637521,
|
|
"loss": 6.4107,
|
|
"mean_token_accuracy": 0.1517535850405693,
|
|
"num_tokens": 10054985.0,
|
|
"step": 3975
|
|
},
|
|
{
|
|
"entropy": 6.552952146530151,
|
|
"epoch": 0.4593190998268898,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004986581425186688,
|
|
"loss": 6.4803,
|
|
"mean_token_accuracy": 0.1568808764219284,
|
|
"num_tokens": 10067528.0,
|
|
"step": 3980
|
|
},
|
|
{
|
|
"entropy": 6.526756238937378,
|
|
"epoch": 0.4598961338718984,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0004986536388509548,
|
|
"loss": 6.3925,
|
|
"mean_token_accuracy": 0.15640367493033408,
|
|
"num_tokens": 10080210.0,
|
|
"step": 3985
|
|
},
|
|
{
|
|
"entropy": 6.520599222183227,
|
|
"epoch": 0.4604731679169071,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004986491276607618,
|
|
"loss": 6.4428,
|
|
"mean_token_accuracy": 0.15482764691114426,
|
|
"num_tokens": 10092040.0,
|
|
"step": 3990
|
|
},
|
|
{
|
|
"entropy": 6.584397268295288,
|
|
"epoch": 0.46105020196191576,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004986446089482416,
|
|
"loss": 6.399,
|
|
"mean_token_accuracy": 0.1545254573225975,
|
|
"num_tokens": 10104923.0,
|
|
"step": 3995
|
|
},
|
|
{
|
|
"entropy": 6.528775930404663,
|
|
"epoch": 0.4616272360069244,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004986400827135459,
|
|
"loss": 6.3908,
|
|
"mean_token_accuracy": 0.15947159230709076,
|
|
"num_tokens": 10118963.0,
|
|
"step": 4000
|
|
},
|
|
{
|
|
"entropy": 6.557057237625122,
|
|
"epoch": 0.46220427005193304,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004986355489568272,
|
|
"loss": 6.3496,
|
|
"mean_token_accuracy": 0.16494845151901244,
|
|
"num_tokens": 10131457.0,
|
|
"step": 4005
|
|
},
|
|
{
|
|
"entropy": 6.524343824386596,
|
|
"epoch": 0.46278130409694174,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004986310076782379,
|
|
"loss": 6.4309,
|
|
"mean_token_accuracy": 0.15816483348608018,
|
|
"num_tokens": 10143796.0,
|
|
"step": 4010
|
|
},
|
|
{
|
|
"entropy": 6.474204587936401,
|
|
"epoch": 0.4633583381419504,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004986264588779307,
|
|
"loss": 6.4078,
|
|
"mean_token_accuracy": 0.161160147190094,
|
|
"num_tokens": 10156723.0,
|
|
"step": 4015
|
|
},
|
|
{
|
|
"entropy": 6.524495840072632,
|
|
"epoch": 0.463935372186959,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004986219025560586,
|
|
"loss": 6.4278,
|
|
"mean_token_accuracy": 0.15114813968539237,
|
|
"num_tokens": 10168701.0,
|
|
"step": 4020
|
|
},
|
|
{
|
|
"entropy": 6.57913761138916,
|
|
"epoch": 0.4645124062319677,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.000498617338712775,
|
|
"loss": 6.3816,
|
|
"mean_token_accuracy": 0.16238873600959777,
|
|
"num_tokens": 10182308.0,
|
|
"step": 4025
|
|
},
|
|
{
|
|
"entropy": 6.52322735786438,
|
|
"epoch": 0.46508944027697635,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004986127673482332,
|
|
"loss": 6.371,
|
|
"mean_token_accuracy": 0.16324072778224946,
|
|
"num_tokens": 10194237.0,
|
|
"step": 4030
|
|
},
|
|
{
|
|
"entropy": 6.512039661407471,
|
|
"epoch": 0.465666474321985,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004986081884625871,
|
|
"loss": 6.4611,
|
|
"mean_token_accuracy": 0.15732699781656265,
|
|
"num_tokens": 10208570.0,
|
|
"step": 4035
|
|
},
|
|
{
|
|
"entropy": 6.647953844070434,
|
|
"epoch": 0.46624350836699363,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004986036020559906,
|
|
"loss": 6.4109,
|
|
"mean_token_accuracy": 0.15890434235334397,
|
|
"num_tokens": 10221079.0,
|
|
"step": 4040
|
|
},
|
|
{
|
|
"entropy": 6.42305359840393,
|
|
"epoch": 0.4668205424120023,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.000498599008128598,
|
|
"loss": 6.3319,
|
|
"mean_token_accuracy": 0.1590804174542427,
|
|
"num_tokens": 10233473.0,
|
|
"step": 4045
|
|
},
|
|
{
|
|
"entropy": 6.588786363601685,
|
|
"epoch": 0.46739757645701097,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0004985944066805639,
|
|
"loss": 6.4683,
|
|
"mean_token_accuracy": 0.1552932158112526,
|
|
"num_tokens": 10247840.0,
|
|
"step": 4050
|
|
},
|
|
{
|
|
"entropy": 6.566417503356933,
|
|
"epoch": 0.4679746105020196,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.000498589797712043,
|
|
"loss": 6.3949,
|
|
"mean_token_accuracy": 0.16800516694784165,
|
|
"num_tokens": 10261471.0,
|
|
"step": 4055
|
|
},
|
|
{
|
|
"entropy": 6.484035158157349,
|
|
"epoch": 0.4685516445470283,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004985851812231903,
|
|
"loss": 6.3991,
|
|
"mean_token_accuracy": 0.1583906292915344,
|
|
"num_tokens": 10274386.0,
|
|
"step": 4060
|
|
},
|
|
{
|
|
"entropy": 6.553869724273682,
|
|
"epoch": 0.46912867859203694,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004985805572141611,
|
|
"loss": 6.4131,
|
|
"mean_token_accuracy": 0.15777539014816283,
|
|
"num_tokens": 10286405.0,
|
|
"step": 4065
|
|
},
|
|
{
|
|
"entropy": 6.558121299743652,
|
|
"epoch": 0.4697057126370456,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004985759256851108,
|
|
"loss": 6.4603,
|
|
"mean_token_accuracy": 0.15484957844018937,
|
|
"num_tokens": 10300084.0,
|
|
"step": 4070
|
|
},
|
|
{
|
|
"entropy": 6.565396356582641,
|
|
"epoch": 0.4702827466820542,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004985712866361954,
|
|
"loss": 6.4674,
|
|
"mean_token_accuracy": 0.16278457939624785,
|
|
"num_tokens": 10312558.0,
|
|
"step": 4075
|
|
},
|
|
{
|
|
"entropy": 6.541759634017945,
|
|
"epoch": 0.4708597807270629,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004985666400675709,
|
|
"loss": 6.3687,
|
|
"mean_token_accuracy": 0.16311410516500474,
|
|
"num_tokens": 10324185.0,
|
|
"step": 4080
|
|
},
|
|
{
|
|
"entropy": 6.4401655197143555,
|
|
"epoch": 0.47143681477207156,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0004985619859793934,
|
|
"loss": 6.4018,
|
|
"mean_token_accuracy": 0.15202204287052154,
|
|
"num_tokens": 10338634.0,
|
|
"step": 4085
|
|
},
|
|
{
|
|
"entropy": 6.673071384429932,
|
|
"epoch": 0.4720138488170802,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004985573243718195,
|
|
"loss": 6.4702,
|
|
"mean_token_accuracy": 0.1487300381064415,
|
|
"num_tokens": 10351272.0,
|
|
"step": 4090
|
|
},
|
|
{
|
|
"entropy": 6.562505865097046,
|
|
"epoch": 0.4725908828620889,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004985526552450061,
|
|
"loss": 6.4052,
|
|
"mean_token_accuracy": 0.15442484468221665,
|
|
"num_tokens": 10362894.0,
|
|
"step": 4095
|
|
},
|
|
{
|
|
"entropy": 6.557220220565796,
|
|
"epoch": 0.47316791690709753,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004985479785991103,
|
|
"loss": 6.5136,
|
|
"mean_token_accuracy": 0.15173576027154922,
|
|
"num_tokens": 10376120.0,
|
|
"step": 4100
|
|
},
|
|
{
|
|
"entropy": 6.551002073287964,
|
|
"epoch": 0.47374495095210617,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004985432944342892,
|
|
"loss": 6.4281,
|
|
"mean_token_accuracy": 0.15780509859323502,
|
|
"num_tokens": 10387986.0,
|
|
"step": 4105
|
|
},
|
|
{
|
|
"entropy": 6.5132355213165285,
|
|
"epoch": 0.4743219849971148,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004985386027507003,
|
|
"loss": 6.4441,
|
|
"mean_token_accuracy": 0.1574099436402321,
|
|
"num_tokens": 10400920.0,
|
|
"step": 4110
|
|
},
|
|
{
|
|
"entropy": 6.636253833770752,
|
|
"epoch": 0.4748990190421235,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004985339035485018,
|
|
"loss": 6.4511,
|
|
"mean_token_accuracy": 0.1540090411901474,
|
|
"num_tokens": 10413835.0,
|
|
"step": 4115
|
|
},
|
|
{
|
|
"entropy": 6.511466121673584,
|
|
"epoch": 0.47547605308713214,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 0.0004985291968278513,
|
|
"loss": 6.4537,
|
|
"mean_token_accuracy": 0.15455947071313858,
|
|
"num_tokens": 10426959.0,
|
|
"step": 4120
|
|
},
|
|
{
|
|
"entropy": 6.5830864906311035,
|
|
"epoch": 0.4760530871321408,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004985244825889074,
|
|
"loss": 6.4912,
|
|
"mean_token_accuracy": 0.15826078802347182,
|
|
"num_tokens": 10440319.0,
|
|
"step": 4125
|
|
},
|
|
{
|
|
"entropy": 6.533916664123535,
|
|
"epoch": 0.4766301211771495,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004985197608318284,
|
|
"loss": 6.4479,
|
|
"mean_token_accuracy": 0.15521639585494995,
|
|
"num_tokens": 10453715.0,
|
|
"step": 4130
|
|
},
|
|
{
|
|
"entropy": 6.575965356826782,
|
|
"epoch": 0.4772071552221581,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004985150315567735,
|
|
"loss": 6.4414,
|
|
"mean_token_accuracy": 0.15350656658411027,
|
|
"num_tokens": 10465574.0,
|
|
"step": 4135
|
|
},
|
|
{
|
|
"entropy": 6.519655561447143,
|
|
"epoch": 0.47778418926716676,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004985102947639013,
|
|
"loss": 6.4083,
|
|
"mean_token_accuracy": 0.15839099436998366,
|
|
"num_tokens": 10478105.0,
|
|
"step": 4140
|
|
},
|
|
{
|
|
"entropy": 6.4816258430480955,
|
|
"epoch": 0.4783612233121754,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004985055504533715,
|
|
"loss": 6.4284,
|
|
"mean_token_accuracy": 0.15900716781616211,
|
|
"num_tokens": 10490723.0,
|
|
"step": 4145
|
|
},
|
|
{
|
|
"entropy": 6.624292707443237,
|
|
"epoch": 0.4789382573571841,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004985007986253435,
|
|
"loss": 6.452,
|
|
"mean_token_accuracy": 0.15452224612236024,
|
|
"num_tokens": 10503155.0,
|
|
"step": 4150
|
|
},
|
|
{
|
|
"entropy": 6.526167535781861,
|
|
"epoch": 0.47951529140219273,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004984960392799772,
|
|
"loss": 6.4215,
|
|
"mean_token_accuracy": 0.14876818060874938,
|
|
"num_tokens": 10515077.0,
|
|
"step": 4155
|
|
},
|
|
{
|
|
"entropy": 6.6001299858093265,
|
|
"epoch": 0.4800923254472014,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004984912724174326,
|
|
"loss": 6.3883,
|
|
"mean_token_accuracy": 0.15346773862838745,
|
|
"num_tokens": 10528445.0,
|
|
"step": 4160
|
|
},
|
|
{
|
|
"entropy": 6.559596395492553,
|
|
"epoch": 0.48066935949221,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004984864980378701,
|
|
"loss": 6.4379,
|
|
"mean_token_accuracy": 0.15837605893611909,
|
|
"num_tokens": 10541877.0,
|
|
"step": 4165
|
|
},
|
|
{
|
|
"entropy": 6.54767746925354,
|
|
"epoch": 0.4812463935372187,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004984817161414502,
|
|
"loss": 6.4044,
|
|
"mean_token_accuracy": 0.15747998505830765,
|
|
"num_tokens": 10553527.0,
|
|
"step": 4170
|
|
},
|
|
{
|
|
"entropy": 6.479561614990234,
|
|
"epoch": 0.48182342758222735,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004984769267283338,
|
|
"loss": 6.4136,
|
|
"mean_token_accuracy": 0.15314011722803117,
|
|
"num_tokens": 10566492.0,
|
|
"step": 4175
|
|
},
|
|
{
|
|
"entropy": 6.467929792404175,
|
|
"epoch": 0.482400461627236,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004984721297986819,
|
|
"loss": 6.3739,
|
|
"mean_token_accuracy": 0.15953933745622634,
|
|
"num_tokens": 10578962.0,
|
|
"step": 4180
|
|
},
|
|
{
|
|
"entropy": 6.5416004180908205,
|
|
"epoch": 0.4829774956722447,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004984673253526561,
|
|
"loss": 6.3665,
|
|
"mean_token_accuracy": 0.15812182426452637,
|
|
"num_tokens": 10591254.0,
|
|
"step": 4185
|
|
},
|
|
{
|
|
"entropy": 6.557770919799805,
|
|
"epoch": 0.4835545297172533,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004984625133904176,
|
|
"loss": 6.4061,
|
|
"mean_token_accuracy": 0.1579806312918663,
|
|
"num_tokens": 10604961.0,
|
|
"step": 4190
|
|
},
|
|
{
|
|
"entropy": 6.499729299545288,
|
|
"epoch": 0.48413156376226196,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004984576939121286,
|
|
"loss": 6.3885,
|
|
"mean_token_accuracy": 0.16066249012947081,
|
|
"num_tokens": 10617419.0,
|
|
"step": 4195
|
|
},
|
|
{
|
|
"entropy": 6.50909194946289,
|
|
"epoch": 0.4847085978072706,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004984528669179511,
|
|
"loss": 6.4186,
|
|
"mean_token_accuracy": 0.15439673513174057,
|
|
"num_tokens": 10629721.0,
|
|
"step": 4200
|
|
},
|
|
{
|
|
"entropy": 6.625107002258301,
|
|
"epoch": 0.4852856318522793,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004984480324080472,
|
|
"loss": 6.4535,
|
|
"mean_token_accuracy": 0.15551864504814147,
|
|
"num_tokens": 10643869.0,
|
|
"step": 4205
|
|
},
|
|
{
|
|
"entropy": 6.590443325042725,
|
|
"epoch": 0.48586266589728794,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.00049844319038258,
|
|
"loss": 6.5082,
|
|
"mean_token_accuracy": 0.14841593205928802,
|
|
"num_tokens": 10658418.0,
|
|
"step": 4210
|
|
},
|
|
{
|
|
"entropy": 6.542080116271973,
|
|
"epoch": 0.4864396999422966,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004984383408417119,
|
|
"loss": 6.3939,
|
|
"mean_token_accuracy": 0.16221137195825577,
|
|
"num_tokens": 10671105.0,
|
|
"step": 4215
|
|
},
|
|
{
|
|
"entropy": 6.542936706542969,
|
|
"epoch": 0.4870167339873053,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004984334837856064,
|
|
"loss": 6.4929,
|
|
"mean_token_accuracy": 0.15168781727552413,
|
|
"num_tokens": 10683862.0,
|
|
"step": 4220
|
|
},
|
|
{
|
|
"entropy": 6.539501905441284,
|
|
"epoch": 0.4875937680323139,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004984286192144263,
|
|
"loss": 6.3919,
|
|
"mean_token_accuracy": 0.1602101057767868,
|
|
"num_tokens": 10696559.0,
|
|
"step": 4225
|
|
},
|
|
{
|
|
"entropy": 6.5565080642700195,
|
|
"epoch": 0.48817080207732255,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004984237471283359,
|
|
"loss": 6.4623,
|
|
"mean_token_accuracy": 0.157669498026371,
|
|
"num_tokens": 10710227.0,
|
|
"step": 4230
|
|
},
|
|
{
|
|
"entropy": 6.489563083648681,
|
|
"epoch": 0.4887478361223312,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004984188675274986,
|
|
"loss": 6.4311,
|
|
"mean_token_accuracy": 0.15578922182321547,
|
|
"num_tokens": 10722761.0,
|
|
"step": 4235
|
|
},
|
|
{
|
|
"entropy": 6.552829694747925,
|
|
"epoch": 0.4893248701673399,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004984139804120787,
|
|
"loss": 6.3864,
|
|
"mean_token_accuracy": 0.15277379006147385,
|
|
"num_tokens": 10734126.0,
|
|
"step": 4240
|
|
},
|
|
{
|
|
"entropy": 6.524606513977051,
|
|
"epoch": 0.4899019042123485,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004984090857822406,
|
|
"loss": 6.4398,
|
|
"mean_token_accuracy": 0.15711746215820313,
|
|
"num_tokens": 10747570.0,
|
|
"step": 4245
|
|
},
|
|
{
|
|
"entropy": 6.61868577003479,
|
|
"epoch": 0.49047893825735717,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 0.0004984041836381488,
|
|
"loss": 6.5498,
|
|
"mean_token_accuracy": 0.14832186549901963,
|
|
"num_tokens": 10762975.0,
|
|
"step": 4250
|
|
},
|
|
{
|
|
"entropy": 6.625642156600952,
|
|
"epoch": 0.49105597230236586,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004983992739799682,
|
|
"loss": 6.3846,
|
|
"mean_token_accuracy": 0.1586022138595581,
|
|
"num_tokens": 10774520.0,
|
|
"step": 4255
|
|
},
|
|
{
|
|
"entropy": 6.455063724517823,
|
|
"epoch": 0.4916330063473745,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004983943568078642,
|
|
"loss": 6.3108,
|
|
"mean_token_accuracy": 0.16183219701051713,
|
|
"num_tokens": 10786250.0,
|
|
"step": 4260
|
|
},
|
|
{
|
|
"entropy": 6.565676832199097,
|
|
"epoch": 0.49221004039238314,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004983894321220017,
|
|
"loss": 6.4387,
|
|
"mean_token_accuracy": 0.15883514136075974,
|
|
"num_tokens": 10799831.0,
|
|
"step": 4265
|
|
},
|
|
{
|
|
"entropy": 6.5317785263061525,
|
|
"epoch": 0.4927870744373918,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004983844999225468,
|
|
"loss": 6.3715,
|
|
"mean_token_accuracy": 0.16067612767219544,
|
|
"num_tokens": 10812803.0,
|
|
"step": 4270
|
|
},
|
|
{
|
|
"entropy": 6.497241115570068,
|
|
"epoch": 0.4933641084824005,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004983795602096651,
|
|
"loss": 6.3904,
|
|
"mean_token_accuracy": 0.1601540118455887,
|
|
"num_tokens": 10825150.0,
|
|
"step": 4275
|
|
},
|
|
{
|
|
"entropy": 6.598751640319824,
|
|
"epoch": 0.4939411425274091,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.000498374612983523,
|
|
"loss": 6.506,
|
|
"mean_token_accuracy": 0.15289822071790696,
|
|
"num_tokens": 10838337.0,
|
|
"step": 4280
|
|
},
|
|
{
|
|
"entropy": 6.5518717765808105,
|
|
"epoch": 0.49451817657241776,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004983696582442866,
|
|
"loss": 6.334,
|
|
"mean_token_accuracy": 0.17550577819347382,
|
|
"num_tokens": 10852288.0,
|
|
"step": 4285
|
|
},
|
|
{
|
|
"entropy": 6.514918279647827,
|
|
"epoch": 0.49509521061742645,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004983646959921227,
|
|
"loss": 6.439,
|
|
"mean_token_accuracy": 0.15471772402524947,
|
|
"num_tokens": 10864189.0,
|
|
"step": 4290
|
|
},
|
|
{
|
|
"entropy": 6.618105697631836,
|
|
"epoch": 0.4956722446624351,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004983597262271984,
|
|
"loss": 6.4346,
|
|
"mean_token_accuracy": 0.1550702318549156,
|
|
"num_tokens": 10877410.0,
|
|
"step": 4295
|
|
},
|
|
{
|
|
"entropy": 6.503079223632812,
|
|
"epoch": 0.49624927870744373,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004983547489496804,
|
|
"loss": 6.4053,
|
|
"mean_token_accuracy": 0.15499556958675384,
|
|
"num_tokens": 10889757.0,
|
|
"step": 4300
|
|
},
|
|
{
|
|
"entropy": 6.490525484085083,
|
|
"epoch": 0.49682631275245237,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004983497641597365,
|
|
"loss": 6.3195,
|
|
"mean_token_accuracy": 0.16428075432777406,
|
|
"num_tokens": 10901636.0,
|
|
"step": 4305
|
|
},
|
|
{
|
|
"entropy": 6.480206155776978,
|
|
"epoch": 0.49740334679746107,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004983447718575342,
|
|
"loss": 6.3544,
|
|
"mean_token_accuracy": 0.1630442336201668,
|
|
"num_tokens": 10914063.0,
|
|
"step": 4310
|
|
},
|
|
{
|
|
"entropy": 6.595718622207642,
|
|
"epoch": 0.4979803808424697,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004983397720432414,
|
|
"loss": 6.3886,
|
|
"mean_token_accuracy": 0.16058591455221177,
|
|
"num_tokens": 10927730.0,
|
|
"step": 4315
|
|
},
|
|
{
|
|
"entropy": 6.534880208969116,
|
|
"epoch": 0.49855741488747835,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004983347647170264,
|
|
"loss": 6.4898,
|
|
"mean_token_accuracy": 0.15413855165243148,
|
|
"num_tokens": 10942440.0,
|
|
"step": 4320
|
|
},
|
|
{
|
|
"entropy": 6.512958288192749,
|
|
"epoch": 0.49913444893248704,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004983297498790574,
|
|
"loss": 6.3992,
|
|
"mean_token_accuracy": 0.156264328956604,
|
|
"num_tokens": 10955801.0,
|
|
"step": 4325
|
|
},
|
|
{
|
|
"entropy": 6.5469934940338135,
|
|
"epoch": 0.4997114829774957,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004983247275295034,
|
|
"loss": 6.3887,
|
|
"mean_token_accuracy": 0.1580841600894928,
|
|
"num_tokens": 10967918.0,
|
|
"step": 4330
|
|
},
|
|
{
|
|
"entropy": 6.508872032165527,
|
|
"epoch": 0.5002885170225043,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004983196976685329,
|
|
"loss": 6.3267,
|
|
"mean_token_accuracy": 0.16289351582527162,
|
|
"num_tokens": 10979652.0,
|
|
"step": 4335
|
|
},
|
|
{
|
|
"entropy": 6.387019300460816,
|
|
"epoch": 0.500865551067513,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004983146602963155,
|
|
"loss": 6.2607,
|
|
"mean_token_accuracy": 0.17579997777938844,
|
|
"num_tokens": 10991433.0,
|
|
"step": 4340
|
|
},
|
|
{
|
|
"entropy": 6.460304498672485,
|
|
"epoch": 0.5014425851125216,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004983096154130203,
|
|
"loss": 6.4603,
|
|
"mean_token_accuracy": 0.15860795527696608,
|
|
"num_tokens": 11003976.0,
|
|
"step": 4345
|
|
},
|
|
{
|
|
"entropy": 6.599706220626831,
|
|
"epoch": 0.5020196191575302,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004983045630188171,
|
|
"loss": 6.4366,
|
|
"mean_token_accuracy": 0.15410916805267333,
|
|
"num_tokens": 11018848.0,
|
|
"step": 4350
|
|
},
|
|
{
|
|
"entropy": 6.57402777671814,
|
|
"epoch": 0.502596653202539,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004982995031138759,
|
|
"loss": 6.4038,
|
|
"mean_token_accuracy": 0.15641804337501525,
|
|
"num_tokens": 11030803.0,
|
|
"step": 4355
|
|
},
|
|
{
|
|
"entropy": 6.586047887802124,
|
|
"epoch": 0.5031736872475476,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004982944356983666,
|
|
"loss": 6.4921,
|
|
"mean_token_accuracy": 0.15291229784488677,
|
|
"num_tokens": 11044688.0,
|
|
"step": 4360
|
|
},
|
|
{
|
|
"entropy": 6.524409008026123,
|
|
"epoch": 0.5037507212925563,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004982893607724602,
|
|
"loss": 6.4306,
|
|
"mean_token_accuracy": 0.15263819694519043,
|
|
"num_tokens": 11057026.0,
|
|
"step": 4365
|
|
},
|
|
{
|
|
"entropy": 6.639001178741455,
|
|
"epoch": 0.5043277553375649,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.000498284278336327,
|
|
"loss": 6.4538,
|
|
"mean_token_accuracy": 0.15304491817951202,
|
|
"num_tokens": 11070407.0,
|
|
"step": 4370
|
|
},
|
|
{
|
|
"entropy": 6.5000138759613035,
|
|
"epoch": 0.5049047893825735,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004982791883901379,
|
|
"loss": 6.3616,
|
|
"mean_token_accuracy": 0.16394442021846772,
|
|
"num_tokens": 11082655.0,
|
|
"step": 4375
|
|
},
|
|
{
|
|
"entropy": 6.462573575973511,
|
|
"epoch": 0.5054818234275822,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004982740909340643,
|
|
"loss": 6.3301,
|
|
"mean_token_accuracy": 0.16755695044994354,
|
|
"num_tokens": 11095948.0,
|
|
"step": 4380
|
|
},
|
|
{
|
|
"entropy": 6.589680433273315,
|
|
"epoch": 0.5060588574725908,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004982689859682775,
|
|
"loss": 6.382,
|
|
"mean_token_accuracy": 0.15594714432954787,
|
|
"num_tokens": 11108105.0,
|
|
"step": 4385
|
|
},
|
|
{
|
|
"entropy": 6.5538736343383786,
|
|
"epoch": 0.5066358915175996,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004982638734929492,
|
|
"loss": 6.4291,
|
|
"mean_token_accuracy": 0.15332048535346984,
|
|
"num_tokens": 11120322.0,
|
|
"step": 4390
|
|
},
|
|
{
|
|
"entropy": 6.386771297454834,
|
|
"epoch": 0.5072129255626082,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0004982587535082515,
|
|
"loss": 6.2161,
|
|
"mean_token_accuracy": 0.16631432473659516,
|
|
"num_tokens": 11133903.0,
|
|
"step": 4395
|
|
},
|
|
{
|
|
"entropy": 6.46461238861084,
|
|
"epoch": 0.5077899596076169,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004982536260143565,
|
|
"loss": 6.2861,
|
|
"mean_token_accuracy": 0.16543451994657515,
|
|
"num_tokens": 11145607.0,
|
|
"step": 4400
|
|
},
|
|
{
|
|
"entropy": 6.536594581604004,
|
|
"epoch": 0.5083669936526255,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004982484910114367,
|
|
"loss": 6.391,
|
|
"mean_token_accuracy": 0.15751007944345474,
|
|
"num_tokens": 11157332.0,
|
|
"step": 4405
|
|
},
|
|
{
|
|
"entropy": 6.527062559127808,
|
|
"epoch": 0.5089440276976341,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004982433484996648,
|
|
"loss": 6.4747,
|
|
"mean_token_accuracy": 0.1585505411028862,
|
|
"num_tokens": 11169404.0,
|
|
"step": 4410
|
|
},
|
|
{
|
|
"entropy": 6.553807020187378,
|
|
"epoch": 0.5095210617426428,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004982381984792138,
|
|
"loss": 6.3707,
|
|
"mean_token_accuracy": 0.15870761573314668,
|
|
"num_tokens": 11182506.0,
|
|
"step": 4415
|
|
},
|
|
{
|
|
"entropy": 6.516544485092163,
|
|
"epoch": 0.5100980957876514,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004982330409502568,
|
|
"loss": 6.3395,
|
|
"mean_token_accuracy": 0.1521760679781437,
|
|
"num_tokens": 11195507.0,
|
|
"step": 4420
|
|
},
|
|
{
|
|
"entropy": 6.505952548980713,
|
|
"epoch": 0.5106751298326602,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004982278759129674,
|
|
"loss": 6.3472,
|
|
"mean_token_accuracy": 0.16159432679414748,
|
|
"num_tokens": 11207219.0,
|
|
"step": 4425
|
|
},
|
|
{
|
|
"entropy": 6.456001710891724,
|
|
"epoch": 0.5112521638776688,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004982227033675194,
|
|
"loss": 6.3242,
|
|
"mean_token_accuracy": 0.16376312375068663,
|
|
"num_tokens": 11219301.0,
|
|
"step": 4430
|
|
},
|
|
{
|
|
"entropy": 6.460791826248169,
|
|
"epoch": 0.5118291979226774,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004982175233140865,
|
|
"loss": 6.3282,
|
|
"mean_token_accuracy": 0.16003126353025438,
|
|
"num_tokens": 11230957.0,
|
|
"step": 4435
|
|
},
|
|
{
|
|
"entropy": 6.537653398513794,
|
|
"epoch": 0.5124062319676861,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004982123357528431,
|
|
"loss": 6.3529,
|
|
"mean_token_accuracy": 0.15861166417598724,
|
|
"num_tokens": 11242813.0,
|
|
"step": 4440
|
|
},
|
|
{
|
|
"entropy": 6.4945403099060055,
|
|
"epoch": 0.5129832660126947,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004982071406839636,
|
|
"loss": 6.3613,
|
|
"mean_token_accuracy": 0.1551041141152382,
|
|
"num_tokens": 11255193.0,
|
|
"step": 4445
|
|
},
|
|
{
|
|
"entropy": 6.403803586959839,
|
|
"epoch": 0.5135603000577034,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004982019381076229,
|
|
"loss": 6.336,
|
|
"mean_token_accuracy": 0.16265275329351425,
|
|
"num_tokens": 11267988.0,
|
|
"step": 4450
|
|
},
|
|
{
|
|
"entropy": 6.558556795120239,
|
|
"epoch": 0.514137334102712,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004981967280239958,
|
|
"loss": 6.4116,
|
|
"mean_token_accuracy": 0.15306541174650193,
|
|
"num_tokens": 11280456.0,
|
|
"step": 4455
|
|
},
|
|
{
|
|
"entropy": 6.527243995666504,
|
|
"epoch": 0.5147143681477208,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004981915104332578,
|
|
"loss": 6.4394,
|
|
"mean_token_accuracy": 0.15262870788574218,
|
|
"num_tokens": 11293304.0,
|
|
"step": 4460
|
|
},
|
|
{
|
|
"entropy": 6.479492855072022,
|
|
"epoch": 0.5152914021927294,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.000498186285335584,
|
|
"loss": 6.3962,
|
|
"mean_token_accuracy": 0.15405147820711135,
|
|
"num_tokens": 11305936.0,
|
|
"step": 4465
|
|
},
|
|
{
|
|
"entropy": 6.617494297027588,
|
|
"epoch": 0.515868436237738,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004981810527311505,
|
|
"loss": 6.4403,
|
|
"mean_token_accuracy": 0.1522215947508812,
|
|
"num_tokens": 11319991.0,
|
|
"step": 4470
|
|
},
|
|
{
|
|
"entropy": 6.508704996109008,
|
|
"epoch": 0.5164454702827467,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.000498175812620133,
|
|
"loss": 6.3465,
|
|
"mean_token_accuracy": 0.16412411332130433,
|
|
"num_tokens": 11332572.0,
|
|
"step": 4475
|
|
},
|
|
{
|
|
"entropy": 6.460049343109131,
|
|
"epoch": 0.5170225043277553,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004981705650027081,
|
|
"loss": 6.3431,
|
|
"mean_token_accuracy": 0.16454764157533647,
|
|
"num_tokens": 11344435.0,
|
|
"step": 4480
|
|
},
|
|
{
|
|
"entropy": 6.47212586402893,
|
|
"epoch": 0.517599538372764,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000498165309879052,
|
|
"loss": 6.273,
|
|
"mean_token_accuracy": 0.16744499206542968,
|
|
"num_tokens": 11356078.0,
|
|
"step": 4485
|
|
},
|
|
{
|
|
"entropy": 6.43641505241394,
|
|
"epoch": 0.5181765724177726,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004981600472493415,
|
|
"loss": 6.3231,
|
|
"mean_token_accuracy": 0.16197210550308228,
|
|
"num_tokens": 11368933.0,
|
|
"step": 4490
|
|
},
|
|
{
|
|
"entropy": 6.587095832824707,
|
|
"epoch": 0.5187536064627813,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004981547771137537,
|
|
"loss": 6.4412,
|
|
"mean_token_accuracy": 0.15295076966285706,
|
|
"num_tokens": 11380810.0,
|
|
"step": 4495
|
|
},
|
|
{
|
|
"entropy": 6.448738145828247,
|
|
"epoch": 0.51933064050779,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004981494994724658,
|
|
"loss": 6.3362,
|
|
"mean_token_accuracy": 0.16053746342658998,
|
|
"num_tokens": 11392447.0,
|
|
"step": 4500
|
|
},
|
|
{
|
|
"entropy": 6.471343231201172,
|
|
"epoch": 0.5199076745527986,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004981442143256554,
|
|
"loss": 6.3946,
|
|
"mean_token_accuracy": 0.1577278733253479,
|
|
"num_tokens": 11405237.0,
|
|
"step": 4505
|
|
},
|
|
{
|
|
"entropy": 6.582560443878174,
|
|
"epoch": 0.5204847085978073,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004981389216735001,
|
|
"loss": 6.5039,
|
|
"mean_token_accuracy": 0.14747137874364852,
|
|
"num_tokens": 11418951.0,
|
|
"step": 4510
|
|
},
|
|
{
|
|
"entropy": 6.54022970199585,
|
|
"epoch": 0.5210617426428159,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.000498133621516178,
|
|
"loss": 6.4038,
|
|
"mean_token_accuracy": 0.15998345464468003,
|
|
"num_tokens": 11432587.0,
|
|
"step": 4515
|
|
},
|
|
{
|
|
"entropy": 6.507716655731201,
|
|
"epoch": 0.5216387766878245,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004981283138538675,
|
|
"loss": 6.4289,
|
|
"mean_token_accuracy": 0.15074404031038285,
|
|
"num_tokens": 11445572.0,
|
|
"step": 4520
|
|
},
|
|
{
|
|
"entropy": 6.524649286270142,
|
|
"epoch": 0.5222158107328332,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.000498122998686747,
|
|
"loss": 6.3821,
|
|
"mean_token_accuracy": 0.16107590049505233,
|
|
"num_tokens": 11457469.0,
|
|
"step": 4525
|
|
},
|
|
{
|
|
"entropy": 6.531647729873657,
|
|
"epoch": 0.5227928447778419,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004981176760149951,
|
|
"loss": 6.4269,
|
|
"mean_token_accuracy": 0.1588137172162533,
|
|
"num_tokens": 11470306.0,
|
|
"step": 4530
|
|
},
|
|
{
|
|
"entropy": 6.553733444213867,
|
|
"epoch": 0.5233698788228506,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004981123458387911,
|
|
"loss": 6.4024,
|
|
"mean_token_accuracy": 0.16188153773546218,
|
|
"num_tokens": 11483839.0,
|
|
"step": 4535
|
|
},
|
|
{
|
|
"entropy": 6.549627828598022,
|
|
"epoch": 0.5239469128678592,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004981070081583142,
|
|
"loss": 6.3946,
|
|
"mean_token_accuracy": 0.15353466868400573,
|
|
"num_tokens": 11495703.0,
|
|
"step": 4540
|
|
},
|
|
{
|
|
"entropy": 6.5704262256622314,
|
|
"epoch": 0.5245239469128679,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.000498101662973744,
|
|
"loss": 6.4888,
|
|
"mean_token_accuracy": 0.15426429733633995,
|
|
"num_tokens": 11508061.0,
|
|
"step": 4545
|
|
},
|
|
{
|
|
"entropy": 6.487470436096191,
|
|
"epoch": 0.5251009809578765,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.00049809631028526,
|
|
"loss": 6.3195,
|
|
"mean_token_accuracy": 0.16369524449110032,
|
|
"num_tokens": 11520135.0,
|
|
"step": 4550
|
|
},
|
|
{
|
|
"entropy": 6.492602396011352,
|
|
"epoch": 0.5256780150028851,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004980909500930424,
|
|
"loss": 6.3946,
|
|
"mean_token_accuracy": 0.15684450417757034,
|
|
"num_tokens": 11532255.0,
|
|
"step": 4555
|
|
},
|
|
{
|
|
"entropy": 6.544296550750732,
|
|
"epoch": 0.5262550490478938,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004980855823972717,
|
|
"loss": 6.3394,
|
|
"mean_token_accuracy": 0.1619937911629677,
|
|
"num_tokens": 11544596.0,
|
|
"step": 4560
|
|
},
|
|
{
|
|
"entropy": 6.4948595523834225,
|
|
"epoch": 0.5268320830929025,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.000498080207198128,
|
|
"loss": 6.4627,
|
|
"mean_token_accuracy": 0.1510115385055542,
|
|
"num_tokens": 11556758.0,
|
|
"step": 4565
|
|
},
|
|
{
|
|
"entropy": 6.56593132019043,
|
|
"epoch": 0.5274091171379112,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004980748244957925,
|
|
"loss": 6.4435,
|
|
"mean_token_accuracy": 0.14832553789019584,
|
|
"num_tokens": 11570070.0,
|
|
"step": 4570
|
|
},
|
|
{
|
|
"entropy": 6.518224000930786,
|
|
"epoch": 0.5279861511829198,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004980694342904461,
|
|
"loss": 6.3229,
|
|
"mean_token_accuracy": 0.16714330315589904,
|
|
"num_tokens": 11582566.0,
|
|
"step": 4575
|
|
},
|
|
{
|
|
"entropy": 6.45475206375122,
|
|
"epoch": 0.5285631852279284,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004980640365822701,
|
|
"loss": 6.2754,
|
|
"mean_token_accuracy": 0.16809093654155732,
|
|
"num_tokens": 11595238.0,
|
|
"step": 4580
|
|
},
|
|
{
|
|
"entropy": 6.546554517745972,
|
|
"epoch": 0.5291402192729371,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.000498058631371446,
|
|
"loss": 6.4037,
|
|
"mean_token_accuracy": 0.1609138697385788,
|
|
"num_tokens": 11608646.0,
|
|
"step": 4585
|
|
},
|
|
{
|
|
"entropy": 6.4840919971466064,
|
|
"epoch": 0.5297172533179457,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004980532186581555,
|
|
"loss": 6.3518,
|
|
"mean_token_accuracy": 0.1566994830965996,
|
|
"num_tokens": 11619610.0,
|
|
"step": 4590
|
|
},
|
|
{
|
|
"entropy": 6.437766647338867,
|
|
"epoch": 0.5302942873629544,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.000498047798442581,
|
|
"loss": 6.2399,
|
|
"mean_token_accuracy": 0.17291501462459563,
|
|
"num_tokens": 11631691.0,
|
|
"step": 4595
|
|
},
|
|
{
|
|
"entropy": 6.4640161991119385,
|
|
"epoch": 0.5308713214079631,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004980423707249044,
|
|
"loss": 6.286,
|
|
"mean_token_accuracy": 0.16628182977437972,
|
|
"num_tokens": 11644330.0,
|
|
"step": 4600
|
|
},
|
|
{
|
|
"entropy": 6.56778769493103,
|
|
"epoch": 0.5314483554529718,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004980369355053086,
|
|
"loss": 6.4038,
|
|
"mean_token_accuracy": 0.15543297529220582,
|
|
"num_tokens": 11656826.0,
|
|
"step": 4605
|
|
},
|
|
{
|
|
"entropy": 6.468916130065918,
|
|
"epoch": 0.5320253894979804,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004980314927839763,
|
|
"loss": 6.3838,
|
|
"mean_token_accuracy": 0.1545664668083191,
|
|
"num_tokens": 11668669.0,
|
|
"step": 4610
|
|
},
|
|
{
|
|
"entropy": 6.521239757537842,
|
|
"epoch": 0.532602423542989,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004980260425610903,
|
|
"loss": 6.3392,
|
|
"mean_token_accuracy": 0.15642919391393661,
|
|
"num_tokens": 11681237.0,
|
|
"step": 4615
|
|
},
|
|
{
|
|
"entropy": 6.442376375198364,
|
|
"epoch": 0.5331794575879977,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004980205848368343,
|
|
"loss": 6.3934,
|
|
"mean_token_accuracy": 0.15855768769979478,
|
|
"num_tokens": 11693953.0,
|
|
"step": 4620
|
|
},
|
|
{
|
|
"entropy": 6.447347021102905,
|
|
"epoch": 0.5337564916330063,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004980151196113917,
|
|
"loss": 6.3594,
|
|
"mean_token_accuracy": 0.1600581720471382,
|
|
"num_tokens": 11705364.0,
|
|
"step": 4625
|
|
},
|
|
{
|
|
"entropy": 6.5338707447052,
|
|
"epoch": 0.534333525678015,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004980096468849464,
|
|
"loss": 6.3732,
|
|
"mean_token_accuracy": 0.15663958638906478,
|
|
"num_tokens": 11717664.0,
|
|
"step": 4630
|
|
},
|
|
{
|
|
"entropy": 6.507907485961914,
|
|
"epoch": 0.5349105597230237,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004980041666576823,
|
|
"loss": 6.3688,
|
|
"mean_token_accuracy": 0.15612590909004212,
|
|
"num_tokens": 11731143.0,
|
|
"step": 4635
|
|
},
|
|
{
|
|
"entropy": 6.513534021377564,
|
|
"epoch": 0.5354875937680323,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004979986789297837,
|
|
"loss": 6.3105,
|
|
"mean_token_accuracy": 0.1600772351026535,
|
|
"num_tokens": 11743904.0,
|
|
"step": 4640
|
|
},
|
|
{
|
|
"entropy": 6.3788543224334715,
|
|
"epoch": 0.536064627813041,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004979931837014355,
|
|
"loss": 6.1961,
|
|
"mean_token_accuracy": 0.16465394496917723,
|
|
"num_tokens": 11756731.0,
|
|
"step": 4645
|
|
},
|
|
{
|
|
"entropy": 6.432486915588379,
|
|
"epoch": 0.5366416618580496,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004979876809728223,
|
|
"loss": 6.3189,
|
|
"mean_token_accuracy": 0.16390772312879562,
|
|
"num_tokens": 11768597.0,
|
|
"step": 4650
|
|
},
|
|
{
|
|
"entropy": 6.424148178100586,
|
|
"epoch": 0.5372186959030583,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004979821707441292,
|
|
"loss": 6.2386,
|
|
"mean_token_accuracy": 0.1694170728325844,
|
|
"num_tokens": 11781464.0,
|
|
"step": 4655
|
|
},
|
|
{
|
|
"entropy": 6.385573053359986,
|
|
"epoch": 0.5377957299480669,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004979766530155416,
|
|
"loss": 6.2189,
|
|
"mean_token_accuracy": 0.17261924147605895,
|
|
"num_tokens": 11794215.0,
|
|
"step": 4660
|
|
},
|
|
{
|
|
"entropy": 6.4749983787536625,
|
|
"epoch": 0.5383727639930755,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004979711277872449,
|
|
"loss": 6.444,
|
|
"mean_token_accuracy": 0.15245128124952317,
|
|
"num_tokens": 11807456.0,
|
|
"step": 4665
|
|
},
|
|
{
|
|
"entropy": 6.4587053775787355,
|
|
"epoch": 0.5389497980380843,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004979655950594252,
|
|
"loss": 6.337,
|
|
"mean_token_accuracy": 0.1637497663497925,
|
|
"num_tokens": 11819730.0,
|
|
"step": 4670
|
|
},
|
|
{
|
|
"entropy": 6.460689640045166,
|
|
"epoch": 0.5395268320830929,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004979600548322684,
|
|
"loss": 6.3466,
|
|
"mean_token_accuracy": 0.17143890559673308,
|
|
"num_tokens": 11831892.0,
|
|
"step": 4675
|
|
},
|
|
{
|
|
"entropy": 6.456334400177002,
|
|
"epoch": 0.5401038661281016,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.000497954507105961,
|
|
"loss": 6.3654,
|
|
"mean_token_accuracy": 0.15969292372465133,
|
|
"num_tokens": 11844114.0,
|
|
"step": 4680
|
|
},
|
|
{
|
|
"entropy": 6.526745080947876,
|
|
"epoch": 0.5406809001731102,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004979489518806893,
|
|
"loss": 6.3234,
|
|
"mean_token_accuracy": 0.15686967074871064,
|
|
"num_tokens": 11855832.0,
|
|
"step": 4685
|
|
},
|
|
{
|
|
"entropy": 6.465781307220459,
|
|
"epoch": 0.5412579342181189,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0004979433891566405,
|
|
"loss": 6.4208,
|
|
"mean_token_accuracy": 0.15778311640024184,
|
|
"num_tokens": 11868837.0,
|
|
"step": 4690
|
|
},
|
|
{
|
|
"entropy": 6.4877008438110355,
|
|
"epoch": 0.5418349682631275,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004979378189340015,
|
|
"loss": 6.3289,
|
|
"mean_token_accuracy": 0.16794711649417876,
|
|
"num_tokens": 11880608.0,
|
|
"step": 4695
|
|
},
|
|
{
|
|
"entropy": 6.476086235046386,
|
|
"epoch": 0.5424120023081361,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004979322412129597,
|
|
"loss": 6.344,
|
|
"mean_token_accuracy": 0.15937476307153703,
|
|
"num_tokens": 11892652.0,
|
|
"step": 4700
|
|
},
|
|
{
|
|
"entropy": 6.458676815032959,
|
|
"epoch": 0.5429890363531449,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004979266559937028,
|
|
"loss": 6.2977,
|
|
"mean_token_accuracy": 0.15880679041147233,
|
|
"num_tokens": 11904572.0,
|
|
"step": 4705
|
|
},
|
|
{
|
|
"entropy": 6.5893689632415775,
|
|
"epoch": 0.5435660703981535,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004979210632764185,
|
|
"loss": 6.4386,
|
|
"mean_token_accuracy": 0.15327975898981094,
|
|
"num_tokens": 11917794.0,
|
|
"step": 4710
|
|
},
|
|
{
|
|
"entropy": 6.511403131484985,
|
|
"epoch": 0.5441431044431622,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004979154630612949,
|
|
"loss": 6.3223,
|
|
"mean_token_accuracy": 0.156440269947052,
|
|
"num_tokens": 11930403.0,
|
|
"step": 4715
|
|
},
|
|
{
|
|
"entropy": 6.556756973266602,
|
|
"epoch": 0.5447201384881708,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004979098553485205,
|
|
"loss": 6.4268,
|
|
"mean_token_accuracy": 0.15392898991703988,
|
|
"num_tokens": 11943974.0,
|
|
"step": 4720
|
|
},
|
|
{
|
|
"entropy": 6.528595209121704,
|
|
"epoch": 0.5452971725331794,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004979042401382838,
|
|
"loss": 6.4272,
|
|
"mean_token_accuracy": 0.14962007254362106,
|
|
"num_tokens": 11956887.0,
|
|
"step": 4725
|
|
},
|
|
{
|
|
"entropy": 6.554116296768188,
|
|
"epoch": 0.5458742065781881,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004978986174307737,
|
|
"loss": 6.2719,
|
|
"mean_token_accuracy": 0.1685679391026497,
|
|
"num_tokens": 11969504.0,
|
|
"step": 4730
|
|
},
|
|
{
|
|
"entropy": 6.43930287361145,
|
|
"epoch": 0.5464512406231967,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004978929872261794,
|
|
"loss": 6.326,
|
|
"mean_token_accuracy": 0.16304372251033783,
|
|
"num_tokens": 11983432.0,
|
|
"step": 4735
|
|
},
|
|
{
|
|
"entropy": 6.510177850723267,
|
|
"epoch": 0.5470282746682055,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004978873495246901,
|
|
"loss": 6.3165,
|
|
"mean_token_accuracy": 0.1688837394118309,
|
|
"num_tokens": 11995915.0,
|
|
"step": 4740
|
|
},
|
|
{
|
|
"entropy": 6.414366436004639,
|
|
"epoch": 0.5476053087132141,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.0004978817043264955,
|
|
"loss": 6.3199,
|
|
"mean_token_accuracy": 0.1632016494870186,
|
|
"num_tokens": 12008395.0,
|
|
"step": 4745
|
|
},
|
|
{
|
|
"entropy": 6.401845407485962,
|
|
"epoch": 0.5481823427582228,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004978760516317856,
|
|
"loss": 6.2892,
|
|
"mean_token_accuracy": 0.16130719035863877,
|
|
"num_tokens": 12021179.0,
|
|
"step": 4750
|
|
},
|
|
{
|
|
"entropy": 6.523613595962525,
|
|
"epoch": 0.5487593768032314,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004978703914407503,
|
|
"loss": 6.3688,
|
|
"mean_token_accuracy": 0.1535087063908577,
|
|
"num_tokens": 12033798.0,
|
|
"step": 4755
|
|
},
|
|
{
|
|
"entropy": 6.5373670101165775,
|
|
"epoch": 0.54933641084824,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004978647237535802,
|
|
"loss": 6.3837,
|
|
"mean_token_accuracy": 0.15837208032608033,
|
|
"num_tokens": 12045720.0,
|
|
"step": 4760
|
|
},
|
|
{
|
|
"entropy": 6.5291375637054445,
|
|
"epoch": 0.5499134448932487,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004978590485704657,
|
|
"loss": 6.3069,
|
|
"mean_token_accuracy": 0.16414411664009093,
|
|
"num_tokens": 12058616.0,
|
|
"step": 4765
|
|
},
|
|
{
|
|
"entropy": 6.459080219268799,
|
|
"epoch": 0.5504904789382573,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004978533658915979,
|
|
"loss": 6.4107,
|
|
"mean_token_accuracy": 0.15961592346429826,
|
|
"num_tokens": 12070173.0,
|
|
"step": 4770
|
|
},
|
|
{
|
|
"entropy": 6.411388826370239,
|
|
"epoch": 0.5510675129832661,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004978476757171678,
|
|
"loss": 6.2896,
|
|
"mean_token_accuracy": 0.17188112884759904,
|
|
"num_tokens": 12083499.0,
|
|
"step": 4775
|
|
},
|
|
{
|
|
"entropy": 6.456639385223388,
|
|
"epoch": 0.5516445470282747,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004978419780473668,
|
|
"loss": 6.3513,
|
|
"mean_token_accuracy": 0.16023088991641998,
|
|
"num_tokens": 12095773.0,
|
|
"step": 4780
|
|
},
|
|
{
|
|
"entropy": 6.460473442077637,
|
|
"epoch": 0.5522215810732833,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004978362728823865,
|
|
"loss": 6.3514,
|
|
"mean_token_accuracy": 0.16689216941595078,
|
|
"num_tokens": 12107640.0,
|
|
"step": 4785
|
|
},
|
|
{
|
|
"entropy": 6.499213218688965,
|
|
"epoch": 0.552798615118292,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004978305602224189,
|
|
"loss": 6.297,
|
|
"mean_token_accuracy": 0.15836577117443085,
|
|
"num_tokens": 12120433.0,
|
|
"step": 4790
|
|
},
|
|
{
|
|
"entropy": 6.43018364906311,
|
|
"epoch": 0.5533756491633006,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004978248400676562,
|
|
"loss": 6.2886,
|
|
"mean_token_accuracy": 0.16459263265132903,
|
|
"num_tokens": 12133326.0,
|
|
"step": 4795
|
|
},
|
|
{
|
|
"entropy": 6.528225231170654,
|
|
"epoch": 0.5539526832083093,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004978191124182905,
|
|
"loss": 6.3795,
|
|
"mean_token_accuracy": 0.15583104342222215,
|
|
"num_tokens": 12145119.0,
|
|
"step": 4800
|
|
},
|
|
{
|
|
"entropy": 6.500142383575439,
|
|
"epoch": 0.5545297172533179,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004978133772745149,
|
|
"loss": 6.3437,
|
|
"mean_token_accuracy": 0.1544487237930298,
|
|
"num_tokens": 12157414.0,
|
|
"step": 4805
|
|
},
|
|
{
|
|
"entropy": 6.3837847232818605,
|
|
"epoch": 0.5551067512983267,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004978076346365218,
|
|
"loss": 6.2201,
|
|
"mean_token_accuracy": 0.16513165831565857,
|
|
"num_tokens": 12170226.0,
|
|
"step": 4810
|
|
},
|
|
{
|
|
"entropy": 6.448636436462403,
|
|
"epoch": 0.5556837853433353,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004978018845045047,
|
|
"loss": 6.2578,
|
|
"mean_token_accuracy": 0.16587026715278624,
|
|
"num_tokens": 12182804.0,
|
|
"step": 4815
|
|
},
|
|
{
|
|
"entropy": 6.569641876220703,
|
|
"epoch": 0.5562608193883439,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004977961268786568,
|
|
"loss": 6.3685,
|
|
"mean_token_accuracy": 0.16015153974294663,
|
|
"num_tokens": 12194795.0,
|
|
"step": 4820
|
|
},
|
|
{
|
|
"entropy": 6.4354218482971195,
|
|
"epoch": 0.5568378534333526,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004977903617591719,
|
|
"loss": 6.3301,
|
|
"mean_token_accuracy": 0.16911077052354812,
|
|
"num_tokens": 12207880.0,
|
|
"step": 4825
|
|
},
|
|
{
|
|
"entropy": 6.479910516738892,
|
|
"epoch": 0.5574148874783612,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004977845891462439,
|
|
"loss": 6.3835,
|
|
"mean_token_accuracy": 0.15894741415977479,
|
|
"num_tokens": 12219434.0,
|
|
"step": 4830
|
|
},
|
|
{
|
|
"entropy": 6.427562856674195,
|
|
"epoch": 0.5579919215233698,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004977788090400668,
|
|
"loss": 6.3085,
|
|
"mean_token_accuracy": 0.16785141825675964,
|
|
"num_tokens": 12232775.0,
|
|
"step": 4835
|
|
},
|
|
{
|
|
"entropy": 6.477736520767212,
|
|
"epoch": 0.5585689555683785,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004977730214408352,
|
|
"loss": 6.2896,
|
|
"mean_token_accuracy": 0.16171760335564614,
|
|
"num_tokens": 12245306.0,
|
|
"step": 4840
|
|
},
|
|
{
|
|
"entropy": 6.389444780349732,
|
|
"epoch": 0.5591459896133872,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004977672263487435,
|
|
"loss": 6.2348,
|
|
"mean_token_accuracy": 0.1595480427145958,
|
|
"num_tokens": 12257553.0,
|
|
"step": 4845
|
|
},
|
|
{
|
|
"entropy": 6.3948791980743405,
|
|
"epoch": 0.5597230236583959,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.000497761423763987,
|
|
"loss": 6.2974,
|
|
"mean_token_accuracy": 0.16309260874986647,
|
|
"num_tokens": 12269626.0,
|
|
"step": 4850
|
|
},
|
|
{
|
|
"entropy": 6.498226833343506,
|
|
"epoch": 0.5603000577034045,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004977556136867606,
|
|
"loss": 6.3464,
|
|
"mean_token_accuracy": 0.1585548087954521,
|
|
"num_tokens": 12282180.0,
|
|
"step": 4855
|
|
},
|
|
{
|
|
"entropy": 6.541059827804565,
|
|
"epoch": 0.5608770917484132,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004977497961172598,
|
|
"loss": 6.381,
|
|
"mean_token_accuracy": 0.16513874679803847,
|
|
"num_tokens": 12296315.0,
|
|
"step": 4860
|
|
},
|
|
{
|
|
"entropy": 6.445973348617554,
|
|
"epoch": 0.5614541257934218,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004977439710556802,
|
|
"loss": 6.3057,
|
|
"mean_token_accuracy": 0.15708381831645965,
|
|
"num_tokens": 12308800.0,
|
|
"step": 4865
|
|
},
|
|
{
|
|
"entropy": 6.436301040649414,
|
|
"epoch": 0.5620311598384304,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0004977381385022179,
|
|
"loss": 6.3618,
|
|
"mean_token_accuracy": 0.16087310016155243,
|
|
"num_tokens": 12321717.0,
|
|
"step": 4870
|
|
},
|
|
{
|
|
"entropy": 6.537671327590942,
|
|
"epoch": 0.5626081938834391,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004977322984570688,
|
|
"loss": 6.3885,
|
|
"mean_token_accuracy": 0.15361500531435013,
|
|
"num_tokens": 12335446.0,
|
|
"step": 4875
|
|
},
|
|
{
|
|
"entropy": 6.453512048721313,
|
|
"epoch": 0.5631852279284478,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004977264509204296,
|
|
"loss": 6.3143,
|
|
"mean_token_accuracy": 0.1592903256416321,
|
|
"num_tokens": 12348677.0,
|
|
"step": 4880
|
|
},
|
|
{
|
|
"entropy": 6.4898766040802,
|
|
"epoch": 0.5637622619734565,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004977205958924967,
|
|
"loss": 6.3472,
|
|
"mean_token_accuracy": 0.16099169105291367,
|
|
"num_tokens": 12360934.0,
|
|
"step": 4885
|
|
},
|
|
{
|
|
"entropy": 6.5359296798706055,
|
|
"epoch": 0.5643392960184651,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004977147333734673,
|
|
"loss": 6.4269,
|
|
"mean_token_accuracy": 0.156376850605011,
|
|
"num_tokens": 12373538.0,
|
|
"step": 4890
|
|
},
|
|
{
|
|
"entropy": 6.398646211624145,
|
|
"epoch": 0.5649163300634737,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004977088633635385,
|
|
"loss": 6.332,
|
|
"mean_token_accuracy": 0.15687417089939118,
|
|
"num_tokens": 12385291.0,
|
|
"step": 4895
|
|
},
|
|
{
|
|
"entropy": 6.582235097885132,
|
|
"epoch": 0.5654933641084824,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004977029858629076,
|
|
"loss": 6.3601,
|
|
"mean_token_accuracy": 0.15636546015739441,
|
|
"num_tokens": 12398324.0,
|
|
"step": 4900
|
|
},
|
|
{
|
|
"entropy": 6.457294559478759,
|
|
"epoch": 0.566070398153491,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004976971008717726,
|
|
"loss": 6.3267,
|
|
"mean_token_accuracy": 0.15693403780460358,
|
|
"num_tokens": 12409807.0,
|
|
"step": 4905
|
|
},
|
|
{
|
|
"entropy": 6.483905696868897,
|
|
"epoch": 0.5666474321984997,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004976912083903309,
|
|
"loss": 6.4167,
|
|
"mean_token_accuracy": 0.1543364331126213,
|
|
"num_tokens": 12422658.0,
|
|
"step": 4910
|
|
},
|
|
{
|
|
"entropy": 6.564264154434204,
|
|
"epoch": 0.5672244662435084,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004976853084187814,
|
|
"loss": 6.335,
|
|
"mean_token_accuracy": 0.15391853898763658,
|
|
"num_tokens": 12435912.0,
|
|
"step": 4915
|
|
},
|
|
{
|
|
"entropy": 6.4374730587005615,
|
|
"epoch": 0.5678015002885171,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004976794009573219,
|
|
"loss": 6.3374,
|
|
"mean_token_accuracy": 0.16345978677272796,
|
|
"num_tokens": 12448382.0,
|
|
"step": 4920
|
|
},
|
|
{
|
|
"entropy": 6.52530608177185,
|
|
"epoch": 0.5683785343335257,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004976734860061515,
|
|
"loss": 6.4579,
|
|
"mean_token_accuracy": 0.1543452709913254,
|
|
"num_tokens": 12461355.0,
|
|
"step": 4925
|
|
},
|
|
{
|
|
"entropy": 6.517202425003052,
|
|
"epoch": 0.5689555683785343,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004976675635654688,
|
|
"loss": 6.2824,
|
|
"mean_token_accuracy": 0.16503604203462602,
|
|
"num_tokens": 12473931.0,
|
|
"step": 4930
|
|
},
|
|
{
|
|
"entropy": 6.439925289154052,
|
|
"epoch": 0.569532602423543,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004976616336354733,
|
|
"loss": 6.336,
|
|
"mean_token_accuracy": 0.16363679096102715,
|
|
"num_tokens": 12486130.0,
|
|
"step": 4935
|
|
},
|
|
{
|
|
"entropy": 6.407979440689087,
|
|
"epoch": 0.5701096364685516,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004976556962163645,
|
|
"loss": 6.2576,
|
|
"mean_token_accuracy": 0.16573751717805862,
|
|
"num_tokens": 12499336.0,
|
|
"step": 4940
|
|
},
|
|
{
|
|
"entropy": 6.503925704956055,
|
|
"epoch": 0.5706866705135603,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004976497513083419,
|
|
"loss": 6.2713,
|
|
"mean_token_accuracy": 0.16759575754404069,
|
|
"num_tokens": 12512875.0,
|
|
"step": 4945
|
|
},
|
|
{
|
|
"entropy": 6.4720992088317875,
|
|
"epoch": 0.571263704558569,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004976437989116055,
|
|
"loss": 6.3864,
|
|
"mean_token_accuracy": 0.15907713323831557,
|
|
"num_tokens": 12524985.0,
|
|
"step": 4950
|
|
},
|
|
{
|
|
"entropy": 6.469041061401367,
|
|
"epoch": 0.5718407386035776,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004976378390263554,
|
|
"loss": 6.3316,
|
|
"mean_token_accuracy": 0.16550833880901336,
|
|
"num_tokens": 12538244.0,
|
|
"step": 4955
|
|
},
|
|
{
|
|
"entropy": 6.539459848403931,
|
|
"epoch": 0.5724177726485863,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004976318716527924,
|
|
"loss": 6.3286,
|
|
"mean_token_accuracy": 0.16238382309675217,
|
|
"num_tokens": 12550769.0,
|
|
"step": 4960
|
|
},
|
|
{
|
|
"entropy": 6.3982970237731935,
|
|
"epoch": 0.5729948066935949,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004976258967911168,
|
|
"loss": 6.3497,
|
|
"mean_token_accuracy": 0.16136492043733597,
|
|
"num_tokens": 12563294.0,
|
|
"step": 4965
|
|
},
|
|
{
|
|
"entropy": 6.467198228836059,
|
|
"epoch": 0.5735718407386036,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004976199144415298,
|
|
"loss": 6.3404,
|
|
"mean_token_accuracy": 0.1579903855919838,
|
|
"num_tokens": 12575857.0,
|
|
"step": 4970
|
|
},
|
|
{
|
|
"entropy": 6.509387397766114,
|
|
"epoch": 0.5741488747836122,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004976139246042325,
|
|
"loss": 6.2934,
|
|
"mean_token_accuracy": 0.16424267292022704,
|
|
"num_tokens": 12589881.0,
|
|
"step": 4975
|
|
},
|
|
{
|
|
"entropy": 6.504959058761597,
|
|
"epoch": 0.5747259088286208,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004976079272794265,
|
|
"loss": 6.3632,
|
|
"mean_token_accuracy": 0.15701202750205995,
|
|
"num_tokens": 12604100.0,
|
|
"step": 4980
|
|
},
|
|
{
|
|
"entropy": 6.4913969993591305,
|
|
"epoch": 0.5753029428736296,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004976019224673134,
|
|
"loss": 6.3798,
|
|
"mean_token_accuracy": 0.1594866156578064,
|
|
"num_tokens": 12616643.0,
|
|
"step": 4985
|
|
},
|
|
{
|
|
"entropy": 6.417438554763794,
|
|
"epoch": 0.5758799769186382,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004975959101680953,
|
|
"loss": 6.3119,
|
|
"mean_token_accuracy": 0.16797322630882264,
|
|
"num_tokens": 12627676.0,
|
|
"step": 4990
|
|
},
|
|
{
|
|
"entropy": 6.41131820678711,
|
|
"epoch": 0.5764570109636469,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004975898903819742,
|
|
"loss": 6.2615,
|
|
"mean_token_accuracy": 0.16815593391656875,
|
|
"num_tokens": 12639352.0,
|
|
"step": 4995
|
|
},
|
|
{
|
|
"entropy": 6.454370927810669,
|
|
"epoch": 0.5770340450086555,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004975838631091527,
|
|
"loss": 6.2447,
|
|
"mean_token_accuracy": 0.1643560364842415,
|
|
"num_tokens": 12652102.0,
|
|
"step": 5000
|
|
},
|
|
{
|
|
"entropy": 6.509260559082032,
|
|
"epoch": 0.5776110790536642,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004975778283498336,
|
|
"loss": 6.3592,
|
|
"mean_token_accuracy": 0.1578929305076599,
|
|
"num_tokens": 12665084.0,
|
|
"step": 5005
|
|
},
|
|
{
|
|
"entropy": 6.360739755630493,
|
|
"epoch": 0.5781881130986728,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004975717861042198,
|
|
"loss": 6.2652,
|
|
"mean_token_accuracy": 0.16091600209474563,
|
|
"num_tokens": 12677512.0,
|
|
"step": 5010
|
|
},
|
|
{
|
|
"entropy": 6.524038887023925,
|
|
"epoch": 0.5787651471436814,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004975657363725146,
|
|
"loss": 6.3909,
|
|
"mean_token_accuracy": 0.1512112334370613,
|
|
"num_tokens": 12690488.0,
|
|
"step": 5015
|
|
},
|
|
{
|
|
"entropy": 6.54783821105957,
|
|
"epoch": 0.5793421811886902,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004975596791549213,
|
|
"loss": 6.3248,
|
|
"mean_token_accuracy": 0.15481803715229034,
|
|
"num_tokens": 12703830.0,
|
|
"step": 5020
|
|
},
|
|
{
|
|
"entropy": 6.459069347381591,
|
|
"epoch": 0.5799192152336988,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004975536144516437,
|
|
"loss": 6.3317,
|
|
"mean_token_accuracy": 0.16206814646720885,
|
|
"num_tokens": 12716020.0,
|
|
"step": 5025
|
|
},
|
|
{
|
|
"entropy": 6.49042387008667,
|
|
"epoch": 0.5804962492787075,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.000497547542262886,
|
|
"loss": 6.3974,
|
|
"mean_token_accuracy": 0.15198142379522322,
|
|
"num_tokens": 12728989.0,
|
|
"step": 5030
|
|
},
|
|
{
|
|
"entropy": 6.5610472679138185,
|
|
"epoch": 0.5810732833237161,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004975414625888521,
|
|
"loss": 6.2683,
|
|
"mean_token_accuracy": 0.1594917967915535,
|
|
"num_tokens": 12741090.0,
|
|
"step": 5035
|
|
},
|
|
{
|
|
"entropy": 6.464597845077515,
|
|
"epoch": 0.5816503173687247,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004975353754297468,
|
|
"loss": 6.3082,
|
|
"mean_token_accuracy": 0.16099455803632737,
|
|
"num_tokens": 12754176.0,
|
|
"step": 5040
|
|
},
|
|
{
|
|
"entropy": 6.39254412651062,
|
|
"epoch": 0.5822273514137334,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004975292807857745,
|
|
"loss": 6.2864,
|
|
"mean_token_accuracy": 0.15810506939888,
|
|
"num_tokens": 12766149.0,
|
|
"step": 5045
|
|
},
|
|
{
|
|
"entropy": 6.485265731811523,
|
|
"epoch": 0.582804385458742,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004975231786571406,
|
|
"loss": 6.3554,
|
|
"mean_token_accuracy": 0.16003530323505402,
|
|
"num_tokens": 12778337.0,
|
|
"step": 5050
|
|
},
|
|
{
|
|
"entropy": 6.46652660369873,
|
|
"epoch": 0.5833814195037508,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004975170690440499,
|
|
"loss": 6.2617,
|
|
"mean_token_accuracy": 0.16169480085372925,
|
|
"num_tokens": 12790146.0,
|
|
"step": 5055
|
|
},
|
|
{
|
|
"entropy": 6.452705526351929,
|
|
"epoch": 0.5839584535487594,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004975109519467083,
|
|
"loss": 6.249,
|
|
"mean_token_accuracy": 0.16325473338365554,
|
|
"num_tokens": 12802821.0,
|
|
"step": 5060
|
|
},
|
|
{
|
|
"entropy": 6.394228124618531,
|
|
"epoch": 0.584535487593768,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004975048273653212,
|
|
"loss": 6.397,
|
|
"mean_token_accuracy": 0.16143627166748048,
|
|
"num_tokens": 12814409.0,
|
|
"step": 5065
|
|
},
|
|
{
|
|
"entropy": 6.498150205612182,
|
|
"epoch": 0.5851125216387767,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004974986953000948,
|
|
"loss": 6.3009,
|
|
"mean_token_accuracy": 0.15540309697389604,
|
|
"num_tokens": 12827398.0,
|
|
"step": 5070
|
|
},
|
|
{
|
|
"entropy": 6.4518615245819095,
|
|
"epoch": 0.5856895556837853,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004974925557512354,
|
|
"loss": 6.2709,
|
|
"mean_token_accuracy": 0.16093710511922837,
|
|
"num_tokens": 12840378.0,
|
|
"step": 5075
|
|
},
|
|
{
|
|
"entropy": 6.448571586608887,
|
|
"epoch": 0.586266589728794,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004974864087189493,
|
|
"loss": 6.357,
|
|
"mean_token_accuracy": 0.16484926640987396,
|
|
"num_tokens": 12853493.0,
|
|
"step": 5080
|
|
},
|
|
{
|
|
"entropy": 6.437574625015259,
|
|
"epoch": 0.5868436237738026,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004974802542034434,
|
|
"loss": 6.2316,
|
|
"mean_token_accuracy": 0.1698588877916336,
|
|
"num_tokens": 12865052.0,
|
|
"step": 5085
|
|
},
|
|
{
|
|
"entropy": 6.47462739944458,
|
|
"epoch": 0.5874206578188114,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004974740922049246,
|
|
"loss": 6.3696,
|
|
"mean_token_accuracy": 0.15433994829654693,
|
|
"num_tokens": 12878095.0,
|
|
"step": 5090
|
|
},
|
|
{
|
|
"entropy": 6.512469148635864,
|
|
"epoch": 0.58799769186382,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004974679227236004,
|
|
"loss": 6.2207,
|
|
"mean_token_accuracy": 0.17119740098714828,
|
|
"num_tokens": 12890855.0,
|
|
"step": 5095
|
|
},
|
|
{
|
|
"entropy": 6.409336709976197,
|
|
"epoch": 0.5885747259088286,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004974617457596779,
|
|
"loss": 6.2785,
|
|
"mean_token_accuracy": 0.1650840535759926,
|
|
"num_tokens": 12903833.0,
|
|
"step": 5100
|
|
},
|
|
{
|
|
"entropy": 6.506627464294434,
|
|
"epoch": 0.5891517599538373,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004974555613133652,
|
|
"loss": 6.4079,
|
|
"mean_token_accuracy": 0.15667158514261245,
|
|
"num_tokens": 12917579.0,
|
|
"step": 5105
|
|
},
|
|
{
|
|
"entropy": 6.480052518844604,
|
|
"epoch": 0.5897287939988459,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004974493693848702,
|
|
"loss": 6.3818,
|
|
"mean_token_accuracy": 0.1637255698442459,
|
|
"num_tokens": 12929718.0,
|
|
"step": 5110
|
|
},
|
|
{
|
|
"entropy": 6.324490737915039,
|
|
"epoch": 0.5903058280438546,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004974431699744011,
|
|
"loss": 6.221,
|
|
"mean_token_accuracy": 0.16753413528203964,
|
|
"num_tokens": 12943031.0,
|
|
"step": 5115
|
|
},
|
|
{
|
|
"entropy": 6.465872192382813,
|
|
"epoch": 0.5908828620888632,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004974369630821665,
|
|
"loss": 6.3385,
|
|
"mean_token_accuracy": 0.1643362522125244,
|
|
"num_tokens": 12954843.0,
|
|
"step": 5120
|
|
},
|
|
{
|
|
"entropy": 6.429745864868164,
|
|
"epoch": 0.5914598961338718,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004974307487083752,
|
|
"loss": 6.3302,
|
|
"mean_token_accuracy": 0.16157597452402114,
|
|
"num_tokens": 12966915.0,
|
|
"step": 5125
|
|
},
|
|
{
|
|
"entropy": 6.483998966217041,
|
|
"epoch": 0.5920369301788806,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004974245268532361,
|
|
"loss": 6.3713,
|
|
"mean_token_accuracy": 0.1558799222111702,
|
|
"num_tokens": 12979941.0,
|
|
"step": 5130
|
|
},
|
|
{
|
|
"entropy": 6.499818563461304,
|
|
"epoch": 0.5926139642238892,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004974182975169585,
|
|
"loss": 6.2561,
|
|
"mean_token_accuracy": 0.16042693704366684,
|
|
"num_tokens": 12992836.0,
|
|
"step": 5135
|
|
},
|
|
{
|
|
"entropy": 6.474150991439819,
|
|
"epoch": 0.5931909982688979,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000497412060699752,
|
|
"loss": 6.3075,
|
|
"mean_token_accuracy": 0.16249936521053315,
|
|
"num_tokens": 13005246.0,
|
|
"step": 5140
|
|
},
|
|
{
|
|
"entropy": 6.422859621047974,
|
|
"epoch": 0.5937680323139065,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004974058164018263,
|
|
"loss": 6.2729,
|
|
"mean_token_accuracy": 0.159485824406147,
|
|
"num_tokens": 13016842.0,
|
|
"step": 5145
|
|
},
|
|
{
|
|
"entropy": 6.379044771194458,
|
|
"epoch": 0.5943450663589152,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004973995646233914,
|
|
"loss": 6.277,
|
|
"mean_token_accuracy": 0.16455476433038713,
|
|
"num_tokens": 13028388.0,
|
|
"step": 5150
|
|
},
|
|
{
|
|
"entropy": 6.483341646194458,
|
|
"epoch": 0.5949221004039238,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004973933053646576,
|
|
"loss": 6.2963,
|
|
"mean_token_accuracy": 0.16036218404769897,
|
|
"num_tokens": 13041895.0,
|
|
"step": 5155
|
|
},
|
|
{
|
|
"entropy": 6.4746462345123295,
|
|
"epoch": 0.5954991344489324,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004973870386258355,
|
|
"loss": 6.3554,
|
|
"mean_token_accuracy": 0.16368395537137986,
|
|
"num_tokens": 13055984.0,
|
|
"step": 5160
|
|
},
|
|
{
|
|
"entropy": 6.484179830551147,
|
|
"epoch": 0.5960761684939412,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004973807644071357,
|
|
"loss": 6.303,
|
|
"mean_token_accuracy": 0.16322016417980195,
|
|
"num_tokens": 13068735.0,
|
|
"step": 5165
|
|
},
|
|
{
|
|
"entropy": 6.49740834236145,
|
|
"epoch": 0.5966532025389498,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004973744827087695,
|
|
"loss": 6.3685,
|
|
"mean_token_accuracy": 0.160064959526062,
|
|
"num_tokens": 13081564.0,
|
|
"step": 5170
|
|
},
|
|
{
|
|
"entropy": 6.477915859222412,
|
|
"epoch": 0.5972302365839585,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.000497368193530948,
|
|
"loss": 6.2975,
|
|
"mean_token_accuracy": 0.16501372158527375,
|
|
"num_tokens": 13094146.0,
|
|
"step": 5175
|
|
},
|
|
{
|
|
"entropy": 6.37415885925293,
|
|
"epoch": 0.5978072706289671,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004973618968738828,
|
|
"loss": 6.2557,
|
|
"mean_token_accuracy": 0.16740904450416566,
|
|
"num_tokens": 13106753.0,
|
|
"step": 5180
|
|
},
|
|
{
|
|
"entropy": 6.414618730545044,
|
|
"epoch": 0.5983843046739757,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004973555927377856,
|
|
"loss": 6.217,
|
|
"mean_token_accuracy": 0.17282827198505402,
|
|
"num_tokens": 13118645.0,
|
|
"step": 5185
|
|
},
|
|
{
|
|
"entropy": 6.46846227645874,
|
|
"epoch": 0.5989613387189844,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004973492811228685,
|
|
"loss": 6.344,
|
|
"mean_token_accuracy": 0.16316265612840652,
|
|
"num_tokens": 13132250.0,
|
|
"step": 5190
|
|
},
|
|
{
|
|
"entropy": 6.466949081420898,
|
|
"epoch": 0.599538372763993,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004973429620293438,
|
|
"loss": 6.3362,
|
|
"mean_token_accuracy": 0.15950386077165604,
|
|
"num_tokens": 13145069.0,
|
|
"step": 5195
|
|
},
|
|
{
|
|
"entropy": 6.456646823883057,
|
|
"epoch": 0.6001154068090018,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004973366354574239,
|
|
"loss": 6.3034,
|
|
"mean_token_accuracy": 0.16648412495851517,
|
|
"num_tokens": 13158244.0,
|
|
"step": 5200
|
|
},
|
|
{
|
|
"entropy": 6.455355453491211,
|
|
"epoch": 0.6006924408540104,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004973303014073219,
|
|
"loss": 6.3623,
|
|
"mean_token_accuracy": 0.15627395808696748,
|
|
"num_tokens": 13171810.0,
|
|
"step": 5205
|
|
},
|
|
{
|
|
"entropy": 6.448964262008667,
|
|
"epoch": 0.601269474899019,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004973239598792504,
|
|
"loss": 6.1955,
|
|
"mean_token_accuracy": 0.1658018559217453,
|
|
"num_tokens": 13184448.0,
|
|
"step": 5210
|
|
},
|
|
{
|
|
"entropy": 6.448535013198852,
|
|
"epoch": 0.6018465089440277,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004973176108734232,
|
|
"loss": 6.3448,
|
|
"mean_token_accuracy": 0.15199785232543944,
|
|
"num_tokens": 13198350.0,
|
|
"step": 5215
|
|
},
|
|
{
|
|
"entropy": 6.465864801406861,
|
|
"epoch": 0.6024235429890363,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004973112543900535,
|
|
"loss": 6.2841,
|
|
"mean_token_accuracy": 0.16358843743801116,
|
|
"num_tokens": 13210660.0,
|
|
"step": 5220
|
|
},
|
|
{
|
|
"entropy": 6.406602478027343,
|
|
"epoch": 0.603000577034045,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004973048904293551,
|
|
"loss": 6.2393,
|
|
"mean_token_accuracy": 0.1710536241531372,
|
|
"num_tokens": 13222991.0,
|
|
"step": 5225
|
|
},
|
|
{
|
|
"entropy": 6.444959449768066,
|
|
"epoch": 0.6035776110790536,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004972985189915422,
|
|
"loss": 6.3254,
|
|
"mean_token_accuracy": 0.16002852469682693,
|
|
"num_tokens": 13237693.0,
|
|
"step": 5230
|
|
},
|
|
{
|
|
"entropy": 6.444726753234863,
|
|
"epoch": 0.6041546451240624,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.000497292140076829,
|
|
"loss": 6.3317,
|
|
"mean_token_accuracy": 0.1622207522392273,
|
|
"num_tokens": 13249843.0,
|
|
"step": 5235
|
|
},
|
|
{
|
|
"entropy": 6.439457941055298,
|
|
"epoch": 0.604731679169071,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004972857536854301,
|
|
"loss": 6.3119,
|
|
"mean_token_accuracy": 0.16525271087884902,
|
|
"num_tokens": 13262185.0,
|
|
"step": 5240
|
|
},
|
|
{
|
|
"entropy": 6.4337084770202635,
|
|
"epoch": 0.6053087132140796,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004972793598175603,
|
|
"loss": 6.3505,
|
|
"mean_token_accuracy": 0.15734633207321166,
|
|
"num_tokens": 13275344.0,
|
|
"step": 5245
|
|
},
|
|
{
|
|
"entropy": 6.473100423812866,
|
|
"epoch": 0.6058857472590883,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004972729584734347,
|
|
"loss": 6.2688,
|
|
"mean_token_accuracy": 0.15891817957162857,
|
|
"num_tokens": 13287741.0,
|
|
"step": 5250
|
|
},
|
|
{
|
|
"entropy": 6.470854473114014,
|
|
"epoch": 0.6064627813040969,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004972665496532685,
|
|
"loss": 6.2701,
|
|
"mean_token_accuracy": 0.16430861055850982,
|
|
"num_tokens": 13299918.0,
|
|
"step": 5255
|
|
},
|
|
{
|
|
"entropy": 6.368015956878662,
|
|
"epoch": 0.6070398153491056,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004972601333572774,
|
|
"loss": 6.2533,
|
|
"mean_token_accuracy": 0.15958417505025863,
|
|
"num_tokens": 13312765.0,
|
|
"step": 5260
|
|
},
|
|
{
|
|
"entropy": 6.462191009521485,
|
|
"epoch": 0.6076168493941142,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004972537095856769,
|
|
"loss": 6.2398,
|
|
"mean_token_accuracy": 0.16111138761043547,
|
|
"num_tokens": 13325324.0,
|
|
"step": 5265
|
|
},
|
|
{
|
|
"entropy": 6.485791730880737,
|
|
"epoch": 0.608193883439123,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004972472783386834,
|
|
"loss": 6.3451,
|
|
"mean_token_accuracy": 0.15810697078704833,
|
|
"num_tokens": 13337578.0,
|
|
"step": 5270
|
|
},
|
|
{
|
|
"entropy": 6.464807462692261,
|
|
"epoch": 0.6087709174841316,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004972408396165132,
|
|
"loss": 6.3088,
|
|
"mean_token_accuracy": 0.1609449043869972,
|
|
"num_tokens": 13349218.0,
|
|
"step": 5275
|
|
},
|
|
{
|
|
"entropy": 6.441641569137573,
|
|
"epoch": 0.6093479515291402,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004972343934193826,
|
|
"loss": 6.2705,
|
|
"mean_token_accuracy": 0.1591146320104599,
|
|
"num_tokens": 13362221.0,
|
|
"step": 5280
|
|
},
|
|
{
|
|
"entropy": 6.434703302383423,
|
|
"epoch": 0.6099249855741489,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004972279397475086,
|
|
"loss": 6.2645,
|
|
"mean_token_accuracy": 0.17187120169401168,
|
|
"num_tokens": 13374147.0,
|
|
"step": 5285
|
|
},
|
|
{
|
|
"entropy": 6.378955316543579,
|
|
"epoch": 0.6105020196191575,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004972214786011083,
|
|
"loss": 6.2197,
|
|
"mean_token_accuracy": 0.16266336888074875,
|
|
"num_tokens": 13386077.0,
|
|
"step": 5290
|
|
},
|
|
{
|
|
"entropy": 6.500459098815918,
|
|
"epoch": 0.6110790536641661,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.000497215009980399,
|
|
"loss": 6.297,
|
|
"mean_token_accuracy": 0.16877201348543167,
|
|
"num_tokens": 13398442.0,
|
|
"step": 5295
|
|
},
|
|
{
|
|
"entropy": 6.4331823825836185,
|
|
"epoch": 0.6116560877091748,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.000497208533885598,
|
|
"loss": 6.3029,
|
|
"mean_token_accuracy": 0.16564711034297944,
|
|
"num_tokens": 13411249.0,
|
|
"step": 5300
|
|
},
|
|
{
|
|
"entropy": 6.43955626487732,
|
|
"epoch": 0.6122331217541835,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004972020503169235,
|
|
"loss": 6.2878,
|
|
"mean_token_accuracy": 0.16612933129072188,
|
|
"num_tokens": 13424518.0,
|
|
"step": 5305
|
|
},
|
|
{
|
|
"entropy": 6.467305707931518,
|
|
"epoch": 0.6128101557991922,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004971955592745934,
|
|
"loss": 6.3069,
|
|
"mean_token_accuracy": 0.1545131728053093,
|
|
"num_tokens": 13438530.0,
|
|
"step": 5310
|
|
},
|
|
{
|
|
"entropy": 6.410894584655762,
|
|
"epoch": 0.6133871898442008,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.000497189060758826,
|
|
"loss": 6.2452,
|
|
"mean_token_accuracy": 0.16825231909751892,
|
|
"num_tokens": 13451154.0,
|
|
"step": 5315
|
|
},
|
|
{
|
|
"entropy": 6.409408855438232,
|
|
"epoch": 0.6139642238892095,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00049718255476984,
|
|
"loss": 6.2859,
|
|
"mean_token_accuracy": 0.16544894725084305,
|
|
"num_tokens": 13461938.0,
|
|
"step": 5320
|
|
},
|
|
{
|
|
"entropy": 6.377069711685181,
|
|
"epoch": 0.6145412579342181,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004971760413078539,
|
|
"loss": 6.2693,
|
|
"mean_token_accuracy": 0.1646272733807564,
|
|
"num_tokens": 13474423.0,
|
|
"step": 5325
|
|
},
|
|
{
|
|
"entropy": 6.502867031097412,
|
|
"epoch": 0.6151182919792267,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004971695203730872,
|
|
"loss": 6.2578,
|
|
"mean_token_accuracy": 0.17385480105876921,
|
|
"num_tokens": 13486882.0,
|
|
"step": 5330
|
|
},
|
|
{
|
|
"entropy": 6.399074077606201,
|
|
"epoch": 0.6156953260242354,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.000497162991965759,
|
|
"loss": 6.2091,
|
|
"mean_token_accuracy": 0.16568703651428224,
|
|
"num_tokens": 13499692.0,
|
|
"step": 5335
|
|
},
|
|
{
|
|
"entropy": 6.454089546203614,
|
|
"epoch": 0.6162723600692441,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004971564560860889,
|
|
"loss": 6.2921,
|
|
"mean_token_accuracy": 0.1587091013789177,
|
|
"num_tokens": 13512995.0,
|
|
"step": 5340
|
|
},
|
|
{
|
|
"entropy": 6.335466384887695,
|
|
"epoch": 0.6168493941142528,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004971499127342968,
|
|
"loss": 6.1969,
|
|
"mean_token_accuracy": 0.1680700197815895,
|
|
"num_tokens": 13525804.0,
|
|
"step": 5345
|
|
},
|
|
{
|
|
"entropy": 6.4052308082580565,
|
|
"epoch": 0.6174264281592614,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004971433619106027,
|
|
"loss": 6.3092,
|
|
"mean_token_accuracy": 0.16079850047826766,
|
|
"num_tokens": 13537807.0,
|
|
"step": 5350
|
|
},
|
|
{
|
|
"entropy": 6.485114002227784,
|
|
"epoch": 0.61800346220427,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.000497136803615227,
|
|
"loss": 6.3762,
|
|
"mean_token_accuracy": 0.1530951127409935,
|
|
"num_tokens": 13550765.0,
|
|
"step": 5355
|
|
},
|
|
{
|
|
"entropy": 6.4439774513244625,
|
|
"epoch": 0.6185804962492787,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004971302378483902,
|
|
"loss": 6.2689,
|
|
"mean_token_accuracy": 0.165410552918911,
|
|
"num_tokens": 13565084.0,
|
|
"step": 5360
|
|
},
|
|
{
|
|
"entropy": 6.476373338699341,
|
|
"epoch": 0.6191575302942873,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004971236646103132,
|
|
"loss": 6.2655,
|
|
"mean_token_accuracy": 0.16471700817346574,
|
|
"num_tokens": 13578851.0,
|
|
"step": 5365
|
|
},
|
|
{
|
|
"entropy": 6.406863832473755,
|
|
"epoch": 0.619734564339296,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004971170839012171,
|
|
"loss": 6.1939,
|
|
"mean_token_accuracy": 0.17038790881633759,
|
|
"num_tokens": 13589984.0,
|
|
"step": 5370
|
|
},
|
|
{
|
|
"entropy": 6.3514081001281735,
|
|
"epoch": 0.6203115983843047,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004971104957213233,
|
|
"loss": 6.2624,
|
|
"mean_token_accuracy": 0.16135939061641694,
|
|
"num_tokens": 13602899.0,
|
|
"step": 5375
|
|
},
|
|
{
|
|
"entropy": 6.490747451782227,
|
|
"epoch": 0.6208886324293134,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004971039000708531,
|
|
"loss": 6.418,
|
|
"mean_token_accuracy": 0.1528172329068184,
|
|
"num_tokens": 13617672.0,
|
|
"step": 5380
|
|
},
|
|
{
|
|
"entropy": 6.473091506958008,
|
|
"epoch": 0.621465666474322,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004970972969500286,
|
|
"loss": 6.2773,
|
|
"mean_token_accuracy": 0.1603806808590889,
|
|
"num_tokens": 13630029.0,
|
|
"step": 5385
|
|
},
|
|
{
|
|
"entropy": 6.401896953582764,
|
|
"epoch": 0.6220427005193306,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.000497090686359072,
|
|
"loss": 6.2523,
|
|
"mean_token_accuracy": 0.1648557275533676,
|
|
"num_tokens": 13643091.0,
|
|
"step": 5390
|
|
},
|
|
{
|
|
"entropy": 6.350330066680908,
|
|
"epoch": 0.6226197345643393,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004970840682982054,
|
|
"loss": 6.1293,
|
|
"mean_token_accuracy": 0.17030057311058044,
|
|
"num_tokens": 13654790.0,
|
|
"step": 5395
|
|
},
|
|
{
|
|
"entropy": 6.439556312561035,
|
|
"epoch": 0.6231967686093479,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004970774427676514,
|
|
"loss": 6.2464,
|
|
"mean_token_accuracy": 0.16800362020730972,
|
|
"num_tokens": 13667425.0,
|
|
"step": 5400
|
|
},
|
|
{
|
|
"entropy": 6.429106521606445,
|
|
"epoch": 0.6237738026543566,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.000497070809767633,
|
|
"loss": 6.3099,
|
|
"mean_token_accuracy": 0.16256403923034668,
|
|
"num_tokens": 13680199.0,
|
|
"step": 5405
|
|
},
|
|
{
|
|
"entropy": 6.471726417541504,
|
|
"epoch": 0.6243508366993653,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004970641692983731,
|
|
"loss": 6.3267,
|
|
"mean_token_accuracy": 0.16009956300258638,
|
|
"num_tokens": 13693613.0,
|
|
"step": 5410
|
|
},
|
|
{
|
|
"entropy": 6.32947187423706,
|
|
"epoch": 0.624927870744374,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004970575213600954,
|
|
"loss": 6.2661,
|
|
"mean_token_accuracy": 0.160757178068161,
|
|
"num_tokens": 13706809.0,
|
|
"step": 5415
|
|
},
|
|
{
|
|
"entropy": 6.40821270942688,
|
|
"epoch": 0.6255049047893826,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004970508659530231,
|
|
"loss": 6.2302,
|
|
"mean_token_accuracy": 0.16359151303768157,
|
|
"num_tokens": 13718976.0,
|
|
"step": 5420
|
|
},
|
|
{
|
|
"entropy": 6.440737009048462,
|
|
"epoch": 0.6260819388343912,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004970442030773802,
|
|
"loss": 6.2155,
|
|
"mean_token_accuracy": 0.1657729595899582,
|
|
"num_tokens": 13731037.0,
|
|
"step": 5425
|
|
},
|
|
{
|
|
"entropy": 6.358583593368531,
|
|
"epoch": 0.6266589728793999,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004970375327333909,
|
|
"loss": 6.2887,
|
|
"mean_token_accuracy": 0.16418557167053222,
|
|
"num_tokens": 13743816.0,
|
|
"step": 5430
|
|
},
|
|
{
|
|
"entropy": 6.3964362144470215,
|
|
"epoch": 0.6272360069244085,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0004970308549212796,
|
|
"loss": 6.282,
|
|
"mean_token_accuracy": 0.16759266555309296,
|
|
"num_tokens": 13757165.0,
|
|
"step": 5435
|
|
},
|
|
{
|
|
"entropy": 6.450726795196533,
|
|
"epoch": 0.6278130409694171,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004970241696412705,
|
|
"loss": 6.2452,
|
|
"mean_token_accuracy": 0.17060438096523284,
|
|
"num_tokens": 13769982.0,
|
|
"step": 5440
|
|
},
|
|
{
|
|
"entropy": 6.434137296676636,
|
|
"epoch": 0.6283900750144259,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.000497017476893589,
|
|
"loss": 6.272,
|
|
"mean_token_accuracy": 0.16804485619068146,
|
|
"num_tokens": 13782922.0,
|
|
"step": 5445
|
|
},
|
|
{
|
|
"entropy": 6.38315167427063,
|
|
"epoch": 0.6289671090594345,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004970107766784598,
|
|
"loss": 6.2659,
|
|
"mean_token_accuracy": 0.1645989775657654,
|
|
"num_tokens": 13795683.0,
|
|
"step": 5450
|
|
},
|
|
{
|
|
"entropy": 6.467908000946045,
|
|
"epoch": 0.6295441431044432,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004970040689961084,
|
|
"loss": 6.3515,
|
|
"mean_token_accuracy": 0.16600358933210374,
|
|
"num_tokens": 13808332.0,
|
|
"step": 5455
|
|
},
|
|
{
|
|
"entropy": 6.430469560623169,
|
|
"epoch": 0.6301211771494518,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004969973538467605,
|
|
"loss": 6.3109,
|
|
"mean_token_accuracy": 0.16642144173383713,
|
|
"num_tokens": 13820949.0,
|
|
"step": 5460
|
|
},
|
|
{
|
|
"entropy": 6.349089574813843,
|
|
"epoch": 0.6306982111944605,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004969906312306419,
|
|
"loss": 6.2808,
|
|
"mean_token_accuracy": 0.16602863222360612,
|
|
"num_tokens": 13833623.0,
|
|
"step": 5465
|
|
},
|
|
{
|
|
"entropy": 6.47224531173706,
|
|
"epoch": 0.6312752452394691,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004969839011479786,
|
|
"loss": 6.2311,
|
|
"mean_token_accuracy": 0.17260048240423204,
|
|
"num_tokens": 13844368.0,
|
|
"step": 5470
|
|
},
|
|
{
|
|
"entropy": 6.46555233001709,
|
|
"epoch": 0.6318522792844777,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.000496977163598997,
|
|
"loss": 6.2693,
|
|
"mean_token_accuracy": 0.16359723955392838,
|
|
"num_tokens": 13857261.0,
|
|
"step": 5475
|
|
},
|
|
{
|
|
"entropy": 6.241572618484497,
|
|
"epoch": 0.6324293133294865,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004969704185839239,
|
|
"loss": 6.1323,
|
|
"mean_token_accuracy": 0.16393650248646735,
|
|
"num_tokens": 13869438.0,
|
|
"step": 5480
|
|
},
|
|
{
|
|
"entropy": 6.454886245727539,
|
|
"epoch": 0.6330063473744951,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004969636661029859,
|
|
"loss": 6.3533,
|
|
"mean_token_accuracy": 0.15374770537018775,
|
|
"num_tokens": 13883353.0,
|
|
"step": 5485
|
|
},
|
|
{
|
|
"entropy": 6.484453201293945,
|
|
"epoch": 0.6335833814195038,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004969569061564103,
|
|
"loss": 6.2837,
|
|
"mean_token_accuracy": 0.168526728451252,
|
|
"num_tokens": 13896950.0,
|
|
"step": 5490
|
|
},
|
|
{
|
|
"entropy": 6.4666359424591064,
|
|
"epoch": 0.6341604154645124,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0004969501387444245,
|
|
"loss": 6.2937,
|
|
"mean_token_accuracy": 0.16304062455892562,
|
|
"num_tokens": 13910447.0,
|
|
"step": 5495
|
|
},
|
|
{
|
|
"entropy": 6.418818473815918,
|
|
"epoch": 0.634737449509521,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004969433638672559,
|
|
"loss": 6.2849,
|
|
"mean_token_accuracy": 0.17183531671762467,
|
|
"num_tokens": 13922894.0,
|
|
"step": 5500
|
|
},
|
|
{
|
|
"entropy": 6.437852239608764,
|
|
"epoch": 0.6353144835545297,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004969365815251325,
|
|
"loss": 6.3015,
|
|
"mean_token_accuracy": 0.16050758361816406,
|
|
"num_tokens": 13936558.0,
|
|
"step": 5505
|
|
},
|
|
{
|
|
"entropy": 6.433607149124145,
|
|
"epoch": 0.6358915175995383,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004969297917182825,
|
|
"loss": 6.2436,
|
|
"mean_token_accuracy": 0.16257888972759246,
|
|
"num_tokens": 13949005.0,
|
|
"step": 5510
|
|
},
|
|
{
|
|
"entropy": 6.431810188293457,
|
|
"epoch": 0.6364685516445471,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004969229944469342,
|
|
"loss": 6.2808,
|
|
"mean_token_accuracy": 0.15686439871788024,
|
|
"num_tokens": 13962285.0,
|
|
"step": 5515
|
|
},
|
|
{
|
|
"entropy": 6.484597444534302,
|
|
"epoch": 0.6370455856895557,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004969161897113162,
|
|
"loss": 6.2797,
|
|
"mean_token_accuracy": 0.16125818341970444,
|
|
"num_tokens": 13976037.0,
|
|
"step": 5520
|
|
},
|
|
{
|
|
"entropy": 6.454035043716431,
|
|
"epoch": 0.6376226197345644,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004969093775116574,
|
|
"loss": 6.2329,
|
|
"mean_token_accuracy": 0.16799202859401702,
|
|
"num_tokens": 13989028.0,
|
|
"step": 5525
|
|
},
|
|
{
|
|
"entropy": 6.353673887252808,
|
|
"epoch": 0.638199653779573,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004969025578481869,
|
|
"loss": 6.2199,
|
|
"mean_token_accuracy": 0.16663924157619475,
|
|
"num_tokens": 14001814.0,
|
|
"step": 5530
|
|
},
|
|
{
|
|
"entropy": 6.490426683425904,
|
|
"epoch": 0.6387766878245816,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.000496895730721134,
|
|
"loss": 6.3185,
|
|
"mean_token_accuracy": 0.15284908413887024,
|
|
"num_tokens": 14014305.0,
|
|
"step": 5535
|
|
},
|
|
{
|
|
"entropy": 6.4198565006256105,
|
|
"epoch": 0.6393537218695903,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004968888961307286,
|
|
"loss": 6.1901,
|
|
"mean_token_accuracy": 0.17025423794984818,
|
|
"num_tokens": 14027475.0,
|
|
"step": 5540
|
|
},
|
|
{
|
|
"entropy": 6.402793550491333,
|
|
"epoch": 0.6399307559145989,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004968820540772003,
|
|
"loss": 6.2554,
|
|
"mean_token_accuracy": 0.16645244061946868,
|
|
"num_tokens": 14041031.0,
|
|
"step": 5545
|
|
},
|
|
{
|
|
"entropy": 6.391665887832642,
|
|
"epoch": 0.6405077899596077,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004968752045607794,
|
|
"loss": 6.212,
|
|
"mean_token_accuracy": 0.1631389558315277,
|
|
"num_tokens": 14054138.0,
|
|
"step": 5550
|
|
},
|
|
{
|
|
"entropy": 6.474399709701538,
|
|
"epoch": 0.6410848240046163,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004968683475816961,
|
|
"loss": 6.2339,
|
|
"mean_token_accuracy": 0.16551497131586074,
|
|
"num_tokens": 14066708.0,
|
|
"step": 5555
|
|
},
|
|
{
|
|
"entropy": 6.412665510177613,
|
|
"epoch": 0.641661858049625,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004968614831401811,
|
|
"loss": 6.319,
|
|
"mean_token_accuracy": 0.15504314005374908,
|
|
"num_tokens": 14080251.0,
|
|
"step": 5560
|
|
},
|
|
{
|
|
"entropy": 6.486737298965454,
|
|
"epoch": 0.6422388920946336,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004968546112364654,
|
|
"loss": 6.2944,
|
|
"mean_token_accuracy": 0.156815817207098,
|
|
"num_tokens": 14092622.0,
|
|
"step": 5565
|
|
},
|
|
{
|
|
"entropy": 6.457394075393677,
|
|
"epoch": 0.6428159261396422,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.00049684773187078,
|
|
"loss": 6.3607,
|
|
"mean_token_accuracy": 0.15759846270084382,
|
|
"num_tokens": 14107033.0,
|
|
"step": 5570
|
|
},
|
|
{
|
|
"entropy": 6.415627193450928,
|
|
"epoch": 0.6433929601846509,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004968408450433565,
|
|
"loss": 6.0985,
|
|
"mean_token_accuracy": 0.16721982806921004,
|
|
"num_tokens": 14119264.0,
|
|
"step": 5575
|
|
},
|
|
{
|
|
"entropy": 6.409555053710937,
|
|
"epoch": 0.6439699942296595,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004968339507544263,
|
|
"loss": 6.2658,
|
|
"mean_token_accuracy": 0.16522011756896973,
|
|
"num_tokens": 14131360.0,
|
|
"step": 5580
|
|
},
|
|
{
|
|
"entropy": 6.331378602981568,
|
|
"epoch": 0.6445470282746683,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004968270490042212,
|
|
"loss": 6.2574,
|
|
"mean_token_accuracy": 0.16861171871423722,
|
|
"num_tokens": 14143236.0,
|
|
"step": 5585
|
|
},
|
|
{
|
|
"entropy": 6.466990947723389,
|
|
"epoch": 0.6451240623196769,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004968201397929737,
|
|
"loss": 6.2703,
|
|
"mean_token_accuracy": 0.16277870833873748,
|
|
"num_tokens": 14156470.0,
|
|
"step": 5590
|
|
},
|
|
{
|
|
"entropy": 6.471270656585693,
|
|
"epoch": 0.6457010963646855,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004968132231209158,
|
|
"loss": 6.3218,
|
|
"mean_token_accuracy": 0.157097789645195,
|
|
"num_tokens": 14169359.0,
|
|
"step": 5595
|
|
},
|
|
{
|
|
"entropy": 6.400879669189453,
|
|
"epoch": 0.6462781304096942,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004968062989882803,
|
|
"loss": 6.3446,
|
|
"mean_token_accuracy": 0.15832698345184326,
|
|
"num_tokens": 14181980.0,
|
|
"step": 5600
|
|
},
|
|
{
|
|
"entropy": 6.470687961578369,
|
|
"epoch": 0.6468551644547028,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004967993673953003,
|
|
"loss": 6.2859,
|
|
"mean_token_accuracy": 0.16663094758987426,
|
|
"num_tokens": 14195456.0,
|
|
"step": 5605
|
|
},
|
|
{
|
|
"entropy": 6.371501111984253,
|
|
"epoch": 0.6474321984997115,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004967924283422087,
|
|
"loss": 6.1873,
|
|
"mean_token_accuracy": 0.1712810918688774,
|
|
"num_tokens": 14208269.0,
|
|
"step": 5610
|
|
},
|
|
{
|
|
"entropy": 6.420989894866944,
|
|
"epoch": 0.6480092325447201,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.000496785481829239,
|
|
"loss": 6.302,
|
|
"mean_token_accuracy": 0.16031478866934776,
|
|
"num_tokens": 14221474.0,
|
|
"step": 5615
|
|
},
|
|
{
|
|
"entropy": 6.473630666732788,
|
|
"epoch": 0.6485862665897288,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004967785278566245,
|
|
"loss": 6.2696,
|
|
"mean_token_accuracy": 0.16501279324293136,
|
|
"num_tokens": 14234185.0,
|
|
"step": 5620
|
|
},
|
|
{
|
|
"entropy": 6.3897919178009035,
|
|
"epoch": 0.6491633006347375,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004967715664245997,
|
|
"loss": 6.238,
|
|
"mean_token_accuracy": 0.1660897359251976,
|
|
"num_tokens": 14246853.0,
|
|
"step": 5625
|
|
},
|
|
{
|
|
"entropy": 6.398458003997803,
|
|
"epoch": 0.6497403346797461,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004967645975333983,
|
|
"loss": 6.3224,
|
|
"mean_token_accuracy": 0.16524122506380082,
|
|
"num_tokens": 14260047.0,
|
|
"step": 5630
|
|
},
|
|
{
|
|
"entropy": 6.4040333271026615,
|
|
"epoch": 0.6503173687247548,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004967576211832548,
|
|
"loss": 6.1934,
|
|
"mean_token_accuracy": 0.1748912051320076,
|
|
"num_tokens": 14273478.0,
|
|
"step": 5635
|
|
},
|
|
{
|
|
"entropy": 6.471810722351075,
|
|
"epoch": 0.6508944027697634,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004967506373744039,
|
|
"loss": 6.2874,
|
|
"mean_token_accuracy": 0.15878912657499314,
|
|
"num_tokens": 14286085.0,
|
|
"step": 5640
|
|
},
|
|
{
|
|
"entropy": 6.379119968414306,
|
|
"epoch": 0.651471436814772,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004967436461070805,
|
|
"loss": 6.2396,
|
|
"mean_token_accuracy": 0.1718211367726326,
|
|
"num_tokens": 14299472.0,
|
|
"step": 5645
|
|
},
|
|
{
|
|
"entropy": 6.398261547088623,
|
|
"epoch": 0.6520484708597807,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0004967366473815196,
|
|
"loss": 6.2043,
|
|
"mean_token_accuracy": 0.16658677011728287,
|
|
"num_tokens": 14312624.0,
|
|
"step": 5650
|
|
},
|
|
{
|
|
"entropy": 6.396186256408692,
|
|
"epoch": 0.6526255049047894,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004967296411979568,
|
|
"loss": 6.1951,
|
|
"mean_token_accuracy": 0.17445577383041383,
|
|
"num_tokens": 14325418.0,
|
|
"step": 5655
|
|
},
|
|
{
|
|
"entropy": 6.32066240310669,
|
|
"epoch": 0.6532025389497981,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004967226275566275,
|
|
"loss": 6.239,
|
|
"mean_token_accuracy": 0.166211299598217,
|
|
"num_tokens": 14337360.0,
|
|
"step": 5660
|
|
},
|
|
{
|
|
"entropy": 6.44496717453003,
|
|
"epoch": 0.6537795729948067,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.000496715606457768,
|
|
"loss": 6.222,
|
|
"mean_token_accuracy": 0.16578047275543212,
|
|
"num_tokens": 14349119.0,
|
|
"step": 5665
|
|
},
|
|
{
|
|
"entropy": 6.448485326766968,
|
|
"epoch": 0.6543566070398154,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004967085779016142,
|
|
"loss": 6.2683,
|
|
"mean_token_accuracy": 0.17126621007919313,
|
|
"num_tokens": 14361760.0,
|
|
"step": 5670
|
|
},
|
|
{
|
|
"entropy": 6.330710077285767,
|
|
"epoch": 0.654933641084824,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004967015418884022,
|
|
"loss": 6.2345,
|
|
"mean_token_accuracy": 0.16232049018144606,
|
|
"num_tokens": 14374725.0,
|
|
"step": 5675
|
|
},
|
|
{
|
|
"entropy": 6.394761943817139,
|
|
"epoch": 0.6555106751298326,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004966944984183692,
|
|
"loss": 6.1996,
|
|
"mean_token_accuracy": 0.16768215894699096,
|
|
"num_tokens": 14387267.0,
|
|
"step": 5680
|
|
},
|
|
{
|
|
"entropy": 6.432275915145874,
|
|
"epoch": 0.6560877091748413,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004966874474917518,
|
|
"loss": 6.2603,
|
|
"mean_token_accuracy": 0.1640935719013214,
|
|
"num_tokens": 14400531.0,
|
|
"step": 5685
|
|
},
|
|
{
|
|
"entropy": 6.437908411026001,
|
|
"epoch": 0.65666474321985,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004966803891087873,
|
|
"loss": 6.2716,
|
|
"mean_token_accuracy": 0.15894663482904434,
|
|
"num_tokens": 14412507.0,
|
|
"step": 5690
|
|
},
|
|
{
|
|
"entropy": 6.434341669082642,
|
|
"epoch": 0.6572417772648587,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.000496673323269713,
|
|
"loss": 6.2589,
|
|
"mean_token_accuracy": 0.16347626149654387,
|
|
"num_tokens": 14424934.0,
|
|
"step": 5695
|
|
},
|
|
{
|
|
"entropy": 6.457496786117554,
|
|
"epoch": 0.6578188113098673,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004966662499747666,
|
|
"loss": 6.3639,
|
|
"mean_token_accuracy": 0.15038072019815446,
|
|
"num_tokens": 14438875.0,
|
|
"step": 5700
|
|
},
|
|
{
|
|
"entropy": 6.40140323638916,
|
|
"epoch": 0.6583958453548759,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004966591692241859,
|
|
"loss": 6.1693,
|
|
"mean_token_accuracy": 0.1677701637148857,
|
|
"num_tokens": 14451089.0,
|
|
"step": 5705
|
|
},
|
|
{
|
|
"entropy": 6.424305438995361,
|
|
"epoch": 0.6589728793998846,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004966520810182092,
|
|
"loss": 6.2889,
|
|
"mean_token_accuracy": 0.1674267664551735,
|
|
"num_tokens": 14463557.0,
|
|
"step": 5710
|
|
},
|
|
{
|
|
"entropy": 6.356392765045166,
|
|
"epoch": 0.6595499134448932,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004966449853570749,
|
|
"loss": 6.1922,
|
|
"mean_token_accuracy": 0.1630517616868019,
|
|
"num_tokens": 14475865.0,
|
|
"step": 5715
|
|
},
|
|
{
|
|
"entropy": 6.433615684509277,
|
|
"epoch": 0.6601269474899019,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004966378822410215,
|
|
"loss": 6.2999,
|
|
"mean_token_accuracy": 0.16027793437242507,
|
|
"num_tokens": 14487534.0,
|
|
"step": 5720
|
|
},
|
|
{
|
|
"entropy": 6.4160982131958,
|
|
"epoch": 0.6607039815349106,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004966307716702881,
|
|
"loss": 6.2466,
|
|
"mean_token_accuracy": 0.1649463638663292,
|
|
"num_tokens": 14500006.0,
|
|
"step": 5725
|
|
},
|
|
{
|
|
"entropy": 6.478086137771607,
|
|
"epoch": 0.6612810155799193,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004966236536451138,
|
|
"loss": 6.3556,
|
|
"mean_token_accuracy": 0.15748382806777955,
|
|
"num_tokens": 14512844.0,
|
|
"step": 5730
|
|
},
|
|
{
|
|
"entropy": 6.474676275253296,
|
|
"epoch": 0.6618580496249279,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.000496616528165738,
|
|
"loss": 6.3073,
|
|
"mean_token_accuracy": 0.15954205095767976,
|
|
"num_tokens": 14525555.0,
|
|
"step": 5735
|
|
},
|
|
{
|
|
"entropy": 6.387700939178467,
|
|
"epoch": 0.6624350836699365,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004966093952324003,
|
|
"loss": 6.2908,
|
|
"mean_token_accuracy": 0.15595891401171685,
|
|
"num_tokens": 14537861.0,
|
|
"step": 5740
|
|
},
|
|
{
|
|
"entropy": 6.43832688331604,
|
|
"epoch": 0.6630121177149452,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004966022548453406,
|
|
"loss": 6.254,
|
|
"mean_token_accuracy": 0.16284551173448564,
|
|
"num_tokens": 14550116.0,
|
|
"step": 5745
|
|
},
|
|
{
|
|
"entropy": 6.444856739044189,
|
|
"epoch": 0.6635891517599538,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004965951070047993,
|
|
"loss": 6.2261,
|
|
"mean_token_accuracy": 0.16848643720149994,
|
|
"num_tokens": 14561841.0,
|
|
"step": 5750
|
|
},
|
|
{
|
|
"entropy": 6.411498022079468,
|
|
"epoch": 0.6641661858049625,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004965879517110166,
|
|
"loss": 6.2768,
|
|
"mean_token_accuracy": 0.16119781583547593,
|
|
"num_tokens": 14574889.0,
|
|
"step": 5755
|
|
},
|
|
{
|
|
"entropy": 6.336085510253906,
|
|
"epoch": 0.6647432198499712,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004965807889642333,
|
|
"loss": 6.2622,
|
|
"mean_token_accuracy": 0.16737145632505418,
|
|
"num_tokens": 14587032.0,
|
|
"step": 5760
|
|
},
|
|
{
|
|
"entropy": 6.412449836730957,
|
|
"epoch": 0.6653202538949798,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.00049657361876469,
|
|
"loss": 6.2303,
|
|
"mean_token_accuracy": 0.16632368713617324,
|
|
"num_tokens": 14599654.0,
|
|
"step": 5765
|
|
},
|
|
{
|
|
"entropy": 6.332269334793091,
|
|
"epoch": 0.6658972879399885,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004965664411126282,
|
|
"loss": 6.1506,
|
|
"mean_token_accuracy": 0.17118496000766753,
|
|
"num_tokens": 14611740.0,
|
|
"step": 5770
|
|
},
|
|
{
|
|
"entropy": 6.410775899887085,
|
|
"epoch": 0.6664743219849971,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.0004965592560082894,
|
|
"loss": 6.2481,
|
|
"mean_token_accuracy": 0.16527822315692903,
|
|
"num_tokens": 14625038.0,
|
|
"step": 5775
|
|
},
|
|
{
|
|
"entropy": 6.458446931838989,
|
|
"epoch": 0.6670513560300058,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004965520634519149,
|
|
"loss": 6.3134,
|
|
"mean_token_accuracy": 0.15978550016880036,
|
|
"num_tokens": 14638318.0,
|
|
"step": 5780
|
|
},
|
|
{
|
|
"entropy": 6.399044179916382,
|
|
"epoch": 0.6676283900750144,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004965448634437468,
|
|
"loss": 6.2815,
|
|
"mean_token_accuracy": 0.15635018050670624,
|
|
"num_tokens": 14651519.0,
|
|
"step": 5785
|
|
},
|
|
{
|
|
"entropy": 6.4846090316772464,
|
|
"epoch": 0.668205424120023,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004965376559840272,
|
|
"loss": 6.2521,
|
|
"mean_token_accuracy": 0.16233301162719727,
|
|
"num_tokens": 14662994.0,
|
|
"step": 5790
|
|
},
|
|
{
|
|
"entropy": 6.413419342041015,
|
|
"epoch": 0.6687824581650318,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004965304410729986,
|
|
"loss": 6.2138,
|
|
"mean_token_accuracy": 0.169295796751976,
|
|
"num_tokens": 14675488.0,
|
|
"step": 5795
|
|
},
|
|
{
|
|
"entropy": 6.341550636291504,
|
|
"epoch": 0.6693594922100404,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004965232187109037,
|
|
"loss": 6.1536,
|
|
"mean_token_accuracy": 0.1739507034420967,
|
|
"num_tokens": 14688512.0,
|
|
"step": 5800
|
|
},
|
|
{
|
|
"entropy": 6.425643396377564,
|
|
"epoch": 0.6699365262550491,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004965159888979854,
|
|
"loss": 6.2133,
|
|
"mean_token_accuracy": 0.1665024146437645,
|
|
"num_tokens": 14700740.0,
|
|
"step": 5805
|
|
},
|
|
{
|
|
"entropy": 6.373208665847779,
|
|
"epoch": 0.6705135603000577,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004965087516344869,
|
|
"loss": 6.2559,
|
|
"mean_token_accuracy": 0.16404303461313247,
|
|
"num_tokens": 14713769.0,
|
|
"step": 5810
|
|
},
|
|
{
|
|
"entropy": 6.37481460571289,
|
|
"epoch": 0.6710905943450663,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004965015069206515,
|
|
"loss": 6.1449,
|
|
"mean_token_accuracy": 0.17123078256845475,
|
|
"num_tokens": 14725710.0,
|
|
"step": 5815
|
|
},
|
|
{
|
|
"entropy": 6.382030820846557,
|
|
"epoch": 0.671667628390075,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.000496494254756723,
|
|
"loss": 6.1415,
|
|
"mean_token_accuracy": 0.17618792951107026,
|
|
"num_tokens": 14738504.0,
|
|
"step": 5820
|
|
},
|
|
{
|
|
"entropy": 6.413110065460205,
|
|
"epoch": 0.6722446624350836,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004964869951429451,
|
|
"loss": 6.2643,
|
|
"mean_token_accuracy": 0.16108937114477156,
|
|
"num_tokens": 14750344.0,
|
|
"step": 5825
|
|
},
|
|
{
|
|
"entropy": 6.433046150207519,
|
|
"epoch": 0.6728216964800924,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004964797280795622,
|
|
"loss": 6.3041,
|
|
"mean_token_accuracy": 0.16477554887533188,
|
|
"num_tokens": 14764316.0,
|
|
"step": 5830
|
|
},
|
|
{
|
|
"entropy": 6.371626186370849,
|
|
"epoch": 0.673398730525101,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004964724535668188,
|
|
"loss": 6.2249,
|
|
"mean_token_accuracy": 0.1627054274082184,
|
|
"num_tokens": 14776404.0,
|
|
"step": 5835
|
|
},
|
|
{
|
|
"entropy": 6.490979194641113,
|
|
"epoch": 0.6739757645701097,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004964651716049593,
|
|
"loss": 6.2583,
|
|
"mean_token_accuracy": 0.16423558443784714,
|
|
"num_tokens": 14788843.0,
|
|
"step": 5840
|
|
},
|
|
{
|
|
"entropy": 6.37471375465393,
|
|
"epoch": 0.6745527986151183,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004964578821942288,
|
|
"loss": 6.1898,
|
|
"mean_token_accuracy": 0.1714974358677864,
|
|
"num_tokens": 14802662.0,
|
|
"step": 5845
|
|
},
|
|
{
|
|
"entropy": 6.375233840942383,
|
|
"epoch": 0.6751298326601269,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004964505853348724,
|
|
"loss": 6.2682,
|
|
"mean_token_accuracy": 0.1575095996260643,
|
|
"num_tokens": 14814354.0,
|
|
"step": 5850
|
|
},
|
|
{
|
|
"entropy": 6.404491424560547,
|
|
"epoch": 0.6757068667051356,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004964432810271356,
|
|
"loss": 6.169,
|
|
"mean_token_accuracy": 0.17374546974897384,
|
|
"num_tokens": 14826404.0,
|
|
"step": 5855
|
|
},
|
|
{
|
|
"entropy": 6.397090053558349,
|
|
"epoch": 0.6762839007501442,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0004964359692712641,
|
|
"loss": 6.2305,
|
|
"mean_token_accuracy": 0.16469545364379884,
|
|
"num_tokens": 14840046.0,
|
|
"step": 5860
|
|
},
|
|
{
|
|
"entropy": 6.359001588821411,
|
|
"epoch": 0.676860934795153,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004964286500675037,
|
|
"loss": 6.2521,
|
|
"mean_token_accuracy": 0.15627662539482118,
|
|
"num_tokens": 14853566.0,
|
|
"step": 5865
|
|
},
|
|
{
|
|
"entropy": 6.397631883621216,
|
|
"epoch": 0.6774379688401616,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004964213234161007,
|
|
"loss": 6.1925,
|
|
"mean_token_accuracy": 0.16885973513126373,
|
|
"num_tokens": 14866538.0,
|
|
"step": 5870
|
|
},
|
|
{
|
|
"entropy": 6.3361509323120115,
|
|
"epoch": 0.6780150028851702,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004964139893173014,
|
|
"loss": 6.1521,
|
|
"mean_token_accuracy": 0.17438876032829284,
|
|
"num_tokens": 14879237.0,
|
|
"step": 5875
|
|
},
|
|
{
|
|
"entropy": 6.442409992218018,
|
|
"epoch": 0.6785920369301789,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004964066477713525,
|
|
"loss": 6.2748,
|
|
"mean_token_accuracy": 0.1616318017244339,
|
|
"num_tokens": 14891295.0,
|
|
"step": 5880
|
|
},
|
|
{
|
|
"entropy": 6.412937259674072,
|
|
"epoch": 0.6791690709751875,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004963992987785011,
|
|
"loss": 6.2673,
|
|
"mean_token_accuracy": 0.16440023183822633,
|
|
"num_tokens": 14902927.0,
|
|
"step": 5885
|
|
},
|
|
{
|
|
"entropy": 6.350733757019043,
|
|
"epoch": 0.6797461050201962,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004963919423389942,
|
|
"loss": 6.2349,
|
|
"mean_token_accuracy": 0.16148411780595778,
|
|
"num_tokens": 14915203.0,
|
|
"step": 5890
|
|
},
|
|
{
|
|
"entropy": 6.369336748123169,
|
|
"epoch": 0.6803231390652048,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004963845784530794,
|
|
"loss": 6.099,
|
|
"mean_token_accuracy": 0.17276938557624816,
|
|
"num_tokens": 14927428.0,
|
|
"step": 5895
|
|
},
|
|
{
|
|
"entropy": 6.338372755050659,
|
|
"epoch": 0.6809001731102136,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.000496377207121004,
|
|
"loss": 6.2514,
|
|
"mean_token_accuracy": 0.16943022161722182,
|
|
"num_tokens": 14939979.0,
|
|
"step": 5900
|
|
},
|
|
{
|
|
"entropy": 6.460256767272949,
|
|
"epoch": 0.6814772071552222,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004963698283430164,
|
|
"loss": 6.2375,
|
|
"mean_token_accuracy": 0.1650419846177101,
|
|
"num_tokens": 14952292.0,
|
|
"step": 5905
|
|
},
|
|
{
|
|
"entropy": 6.392317628860473,
|
|
"epoch": 0.6820542412002308,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004963624421193646,
|
|
"loss": 6.2536,
|
|
"mean_token_accuracy": 0.15970679968595505,
|
|
"num_tokens": 14964942.0,
|
|
"step": 5910
|
|
},
|
|
{
|
|
"entropy": 6.431348752975464,
|
|
"epoch": 0.6826312752452395,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.000496355048450297,
|
|
"loss": 6.3675,
|
|
"mean_token_accuracy": 0.15923905968666077,
|
|
"num_tokens": 14979196.0,
|
|
"step": 5915
|
|
},
|
|
{
|
|
"entropy": 6.4473936557769775,
|
|
"epoch": 0.6832083092902481,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004963476473360623,
|
|
"loss": 6.2204,
|
|
"mean_token_accuracy": 0.16636578887701034,
|
|
"num_tokens": 14991162.0,
|
|
"step": 5920
|
|
},
|
|
{
|
|
"entropy": 6.332076978683472,
|
|
"epoch": 0.6837853433352568,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004963402387769094,
|
|
"loss": 6.2417,
|
|
"mean_token_accuracy": 0.16846334040164948,
|
|
"num_tokens": 15003207.0,
|
|
"step": 5925
|
|
},
|
|
{
|
|
"entropy": 6.35644760131836,
|
|
"epoch": 0.6843623773802654,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004963328227730876,
|
|
"loss": 6.2604,
|
|
"mean_token_accuracy": 0.1596489131450653,
|
|
"num_tokens": 15016633.0,
|
|
"step": 5930
|
|
},
|
|
{
|
|
"entropy": 6.392962121963501,
|
|
"epoch": 0.684939411425274,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004963253993248461,
|
|
"loss": 6.198,
|
|
"mean_token_accuracy": 0.17046815901994705,
|
|
"num_tokens": 15029256.0,
|
|
"step": 5935
|
|
},
|
|
{
|
|
"entropy": 6.344196081161499,
|
|
"epoch": 0.6855164454702828,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004963179684324349,
|
|
"loss": 6.1649,
|
|
"mean_token_accuracy": 0.17169316112995148,
|
|
"num_tokens": 15041162.0,
|
|
"step": 5940
|
|
},
|
|
{
|
|
"entropy": 6.346894645690918,
|
|
"epoch": 0.6860934795152914,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004963105300961036,
|
|
"loss": 6.2151,
|
|
"mean_token_accuracy": 0.17179548889398574,
|
|
"num_tokens": 15054122.0,
|
|
"step": 5945
|
|
},
|
|
{
|
|
"entropy": 6.368085193634033,
|
|
"epoch": 0.6866705135603001,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004963030843161026,
|
|
"loss": 6.2176,
|
|
"mean_token_accuracy": 0.1642700269818306,
|
|
"num_tokens": 15066123.0,
|
|
"step": 5950
|
|
},
|
|
{
|
|
"entropy": 6.261136484146118,
|
|
"epoch": 0.6872475476053087,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004962956310926823,
|
|
"loss": 6.1427,
|
|
"mean_token_accuracy": 0.1735681861639023,
|
|
"num_tokens": 15078192.0,
|
|
"step": 5955
|
|
},
|
|
{
|
|
"entropy": 6.413783311843872,
|
|
"epoch": 0.6878245816503173,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004962881704260934,
|
|
"loss": 6.1818,
|
|
"mean_token_accuracy": 0.1730615571141243,
|
|
"num_tokens": 15090227.0,
|
|
"step": 5960
|
|
},
|
|
{
|
|
"entropy": 6.358871221542358,
|
|
"epoch": 0.688401615695326,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004962807023165868,
|
|
"loss": 6.3066,
|
|
"mean_token_accuracy": 0.1696085214614868,
|
|
"num_tokens": 15104093.0,
|
|
"step": 5965
|
|
},
|
|
{
|
|
"entropy": 6.3496081829071045,
|
|
"epoch": 0.6889786497403346,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004962732267644138,
|
|
"loss": 6.2006,
|
|
"mean_token_accuracy": 0.16877583116292955,
|
|
"num_tokens": 15118064.0,
|
|
"step": 5970
|
|
},
|
|
{
|
|
"entropy": 6.392092323303222,
|
|
"epoch": 0.6895556837853434,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004962657437698254,
|
|
"loss": 6.0972,
|
|
"mean_token_accuracy": 0.17405418753623964,
|
|
"num_tokens": 15131686.0,
|
|
"step": 5975
|
|
},
|
|
{
|
|
"entropy": 6.378844308853149,
|
|
"epoch": 0.690132717830352,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004962582533330739,
|
|
"loss": 6.2949,
|
|
"mean_token_accuracy": 0.15710055381059645,
|
|
"num_tokens": 15143920.0,
|
|
"step": 5980
|
|
},
|
|
{
|
|
"entropy": 6.44266266822815,
|
|
"epoch": 0.6907097518753607,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004962507554544109,
|
|
"loss": 6.2552,
|
|
"mean_token_accuracy": 0.16559473276138306,
|
|
"num_tokens": 15156989.0,
|
|
"step": 5985
|
|
},
|
|
{
|
|
"entropy": 6.503173542022705,
|
|
"epoch": 0.6912867859203693,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004962432501340886,
|
|
"loss": 6.3219,
|
|
"mean_token_accuracy": 0.15267299860715866,
|
|
"num_tokens": 15169068.0,
|
|
"step": 5990
|
|
},
|
|
{
|
|
"entropy": 6.377065753936767,
|
|
"epoch": 0.6918638199653779,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004962357373723596,
|
|
"loss": 6.2871,
|
|
"mean_token_accuracy": 0.16362386345863342,
|
|
"num_tokens": 15182081.0,
|
|
"step": 5995
|
|
},
|
|
{
|
|
"entropy": 6.492167615890503,
|
|
"epoch": 0.6924408540103866,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004962282171694763,
|
|
"loss": 6.2605,
|
|
"mean_token_accuracy": 0.16491686552762985,
|
|
"num_tokens": 15194474.0,
|
|
"step": 6000
|
|
},
|
|
{
|
|
"epoch": 0.6924408540103866,
|
|
"eval_entropy": 6.244893937006504,
|
|
"eval_loss": 6.277975559234619,
|
|
"eval_mean_token_accuracy": 0.16690639868687931,
|
|
"eval_num_tokens": 15194474.0,
|
|
"eval_runtime": 17.4205,
|
|
"eval_samples_per_second": 1615.111,
|
|
"eval_steps_per_second": 201.889,
|
|
"step": 6000
|
|
},
|
|
{
|
|
"entropy": 6.419049692153931,
|
|
"epoch": 0.6930178880553952,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004962206895256919,
|
|
"loss": 6.2318,
|
|
"mean_token_accuracy": 0.16573894619941712,
|
|
"num_tokens": 15206371.0,
|
|
"step": 6005
|
|
},
|
|
{
|
|
"entropy": 6.34908356666565,
|
|
"epoch": 0.693594922100404,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004962131544412595,
|
|
"loss": 6.2544,
|
|
"mean_token_accuracy": 0.16422042697668077,
|
|
"num_tokens": 15218913.0,
|
|
"step": 6010
|
|
},
|
|
{
|
|
"entropy": 6.471472215652466,
|
|
"epoch": 0.6941719561454126,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004962056119164325,
|
|
"loss": 6.2344,
|
|
"mean_token_accuracy": 0.1708833560347557,
|
|
"num_tokens": 15231647.0,
|
|
"step": 6015
|
|
},
|
|
{
|
|
"entropy": 6.392230892181397,
|
|
"epoch": 0.6947489901904212,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004961980619514646,
|
|
"loss": 6.2363,
|
|
"mean_token_accuracy": 0.16547508537769318,
|
|
"num_tokens": 15243764.0,
|
|
"step": 6020
|
|
},
|
|
{
|
|
"entropy": 6.415359783172607,
|
|
"epoch": 0.6953260242354299,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004961905045466098,
|
|
"loss": 6.2948,
|
|
"mean_token_accuracy": 0.15680457055568695,
|
|
"num_tokens": 15256165.0,
|
|
"step": 6025
|
|
},
|
|
{
|
|
"entropy": 6.357501459121704,
|
|
"epoch": 0.6959030582804385,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004961829397021222,
|
|
"loss": 6.169,
|
|
"mean_token_accuracy": 0.16878628879785537,
|
|
"num_tokens": 15269169.0,
|
|
"step": 6030
|
|
},
|
|
{
|
|
"entropy": 6.377862071990966,
|
|
"epoch": 0.6964800923254472,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0004961753674182564,
|
|
"loss": 6.2119,
|
|
"mean_token_accuracy": 0.16564356088638305,
|
|
"num_tokens": 15281530.0,
|
|
"step": 6035
|
|
},
|
|
{
|
|
"entropy": 6.375745582580566,
|
|
"epoch": 0.6970571263704558,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004961677876952669,
|
|
"loss": 6.1756,
|
|
"mean_token_accuracy": 0.16821483224630357,
|
|
"num_tokens": 15295578.0,
|
|
"step": 6040
|
|
},
|
|
{
|
|
"entropy": 6.376891565322876,
|
|
"epoch": 0.6976341604154646,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004961602005334087,
|
|
"loss": 6.2514,
|
|
"mean_token_accuracy": 0.16718253195285798,
|
|
"num_tokens": 15308258.0,
|
|
"step": 6045
|
|
},
|
|
{
|
|
"entropy": 6.4180299758911135,
|
|
"epoch": 0.6982111944604732,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.000496152605932937,
|
|
"loss": 6.2718,
|
|
"mean_token_accuracy": 0.1603887066245079,
|
|
"num_tokens": 15320370.0,
|
|
"step": 6050
|
|
},
|
|
{
|
|
"entropy": 6.440406322479248,
|
|
"epoch": 0.6987882285054818,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004961450038941074,
|
|
"loss": 6.2492,
|
|
"mean_token_accuracy": 0.16523093432188035,
|
|
"num_tokens": 15332350.0,
|
|
"step": 6055
|
|
},
|
|
{
|
|
"entropy": 6.333216190338135,
|
|
"epoch": 0.6993652625504905,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004961373944171754,
|
|
"loss": 6.1742,
|
|
"mean_token_accuracy": 0.1691560611128807,
|
|
"num_tokens": 15343424.0,
|
|
"step": 6060
|
|
},
|
|
{
|
|
"entropy": 6.359563398361206,
|
|
"epoch": 0.6999422965954991,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004961297775023968,
|
|
"loss": 6.1927,
|
|
"mean_token_accuracy": 0.1697380304336548,
|
|
"num_tokens": 15356126.0,
|
|
"step": 6065
|
|
},
|
|
{
|
|
"entropy": 6.346981000900269,
|
|
"epoch": 0.7005193306405078,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.000496122153150028,
|
|
"loss": 6.0971,
|
|
"mean_token_accuracy": 0.17148021459579468,
|
|
"num_tokens": 15369253.0,
|
|
"step": 6070
|
|
},
|
|
{
|
|
"entropy": 6.4445713520050045,
|
|
"epoch": 0.7010963646855164,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004961145213603255,
|
|
"loss": 6.2621,
|
|
"mean_token_accuracy": 0.16077155470848084,
|
|
"num_tokens": 15382679.0,
|
|
"step": 6075
|
|
},
|
|
{
|
|
"entropy": 6.3669038772583,
|
|
"epoch": 0.7016733987305251,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 0.000496106882133546,
|
|
"loss": 6.276,
|
|
"mean_token_accuracy": 0.1646697610616684,
|
|
"num_tokens": 15396052.0,
|
|
"step": 6080
|
|
},
|
|
{
|
|
"entropy": 6.421784114837647,
|
|
"epoch": 0.7022504327755338,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004960992354699463,
|
|
"loss": 6.2941,
|
|
"mean_token_accuracy": 0.15852054804563523,
|
|
"num_tokens": 15409249.0,
|
|
"step": 6085
|
|
},
|
|
{
|
|
"entropy": 6.455357551574707,
|
|
"epoch": 0.7028274668205424,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004960915813697836,
|
|
"loss": 6.1779,
|
|
"mean_token_accuracy": 0.16108503490686416,
|
|
"num_tokens": 15421060.0,
|
|
"step": 6090
|
|
},
|
|
{
|
|
"entropy": 6.378384447097778,
|
|
"epoch": 0.7034045008655511,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0004960839198333154,
|
|
"loss": 6.2629,
|
|
"mean_token_accuracy": 0.16128408163785934,
|
|
"num_tokens": 15433083.0,
|
|
"step": 6095
|
|
},
|
|
{
|
|
"entropy": 6.3820489883422855,
|
|
"epoch": 0.7039815349105597,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004960762508607994,
|
|
"loss": 6.08,
|
|
"mean_token_accuracy": 0.17403190284967424,
|
|
"num_tokens": 15446664.0,
|
|
"step": 6100
|
|
},
|
|
{
|
|
"entropy": 6.398230504989624,
|
|
"epoch": 0.7045585689555683,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004960685744524934,
|
|
"loss": 6.243,
|
|
"mean_token_accuracy": 0.1608691543340683,
|
|
"num_tokens": 15458609.0,
|
|
"step": 6105
|
|
},
|
|
{
|
|
"entropy": 6.359479999542236,
|
|
"epoch": 0.705135603000577,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004960608906086558,
|
|
"loss": 6.144,
|
|
"mean_token_accuracy": 0.17022748589515685,
|
|
"num_tokens": 15470091.0,
|
|
"step": 6110
|
|
},
|
|
{
|
|
"entropy": 6.411485767364502,
|
|
"epoch": 0.7057126370455857,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.000496053199329545,
|
|
"loss": 6.2529,
|
|
"mean_token_accuracy": 0.16091013103723525,
|
|
"num_tokens": 15483557.0,
|
|
"step": 6115
|
|
},
|
|
{
|
|
"entropy": 6.395710134506226,
|
|
"epoch": 0.7062896710905944,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004960455006154196,
|
|
"loss": 6.211,
|
|
"mean_token_accuracy": 0.16187724471092224,
|
|
"num_tokens": 15497437.0,
|
|
"step": 6120
|
|
},
|
|
{
|
|
"entropy": 6.403597688674926,
|
|
"epoch": 0.706866705135603,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004960377944665386,
|
|
"loss": 6.2439,
|
|
"mean_token_accuracy": 0.16568287909030915,
|
|
"num_tokens": 15509942.0,
|
|
"step": 6125
|
|
},
|
|
{
|
|
"entropy": 6.3745523452758786,
|
|
"epoch": 0.7074437391806117,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004960300808831611,
|
|
"loss": 6.194,
|
|
"mean_token_accuracy": 0.17037154287099837,
|
|
"num_tokens": 15522866.0,
|
|
"step": 6130
|
|
},
|
|
{
|
|
"entropy": 6.407792663574218,
|
|
"epoch": 0.7080207732256203,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004960223598655467,
|
|
"loss": 6.1858,
|
|
"mean_token_accuracy": 0.1648655503988266,
|
|
"num_tokens": 15534731.0,
|
|
"step": 6135
|
|
},
|
|
{
|
|
"entropy": 6.34327073097229,
|
|
"epoch": 0.7085978072706289,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.000496014631413955,
|
|
"loss": 6.223,
|
|
"mean_token_accuracy": 0.16448917090892792,
|
|
"num_tokens": 15546401.0,
|
|
"step": 6140
|
|
},
|
|
{
|
|
"entropy": 6.450383615493775,
|
|
"epoch": 0.7091748413156376,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004960068955286459,
|
|
"loss": 6.2292,
|
|
"mean_token_accuracy": 0.16138217896223067,
|
|
"num_tokens": 15559532.0,
|
|
"step": 6145
|
|
},
|
|
{
|
|
"entropy": 6.38635630607605,
|
|
"epoch": 0.7097518753606463,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004959991522098797,
|
|
"loss": 6.1771,
|
|
"mean_token_accuracy": 0.1652152955532074,
|
|
"num_tokens": 15572426.0,
|
|
"step": 6150
|
|
},
|
|
{
|
|
"entropy": 6.419304513931275,
|
|
"epoch": 0.710328909405655,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004959914014579168,
|
|
"loss": 6.2391,
|
|
"mean_token_accuracy": 0.162534636259079,
|
|
"num_tokens": 15584422.0,
|
|
"step": 6155
|
|
},
|
|
{
|
|
"entropy": 6.413751649856567,
|
|
"epoch": 0.7109059434506636,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004959836432730178,
|
|
"loss": 6.231,
|
|
"mean_token_accuracy": 0.16499146223068237,
|
|
"num_tokens": 15595538.0,
|
|
"step": 6160
|
|
},
|
|
{
|
|
"entropy": 6.337444114685058,
|
|
"epoch": 0.7114829774956722,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004959758776554438,
|
|
"loss": 6.1783,
|
|
"mean_token_accuracy": 0.17357258945703508,
|
|
"num_tokens": 15608315.0,
|
|
"step": 6165
|
|
},
|
|
{
|
|
"entropy": 6.39624662399292,
|
|
"epoch": 0.7120600115406809,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.000495968104605456,
|
|
"loss": 6.2659,
|
|
"mean_token_accuracy": 0.16520965546369554,
|
|
"num_tokens": 15620181.0,
|
|
"step": 6170
|
|
},
|
|
{
|
|
"entropy": 6.34517502784729,
|
|
"epoch": 0.7126370455856895,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004959603241233157,
|
|
"loss": 6.1166,
|
|
"mean_token_accuracy": 0.16953941881656648,
|
|
"num_tokens": 15632100.0,
|
|
"step": 6175
|
|
},
|
|
{
|
|
"entropy": 6.311384630203247,
|
|
"epoch": 0.7132140796306982,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004959525362092846,
|
|
"loss": 6.1495,
|
|
"mean_token_accuracy": 0.16864179223775863,
|
|
"num_tokens": 15644185.0,
|
|
"step": 6180
|
|
},
|
|
{
|
|
"entropy": 6.354869842529297,
|
|
"epoch": 0.7137911136757069,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004959447408636247,
|
|
"loss": 6.1944,
|
|
"mean_token_accuracy": 0.1726676657795906,
|
|
"num_tokens": 15657761.0,
|
|
"step": 6185
|
|
},
|
|
{
|
|
"entropy": 6.350826025009155,
|
|
"epoch": 0.7143681477207156,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004959369380865983,
|
|
"loss": 6.2315,
|
|
"mean_token_accuracy": 0.15910745710134505,
|
|
"num_tokens": 15671135.0,
|
|
"step": 6190
|
|
},
|
|
{
|
|
"entropy": 6.378980588912964,
|
|
"epoch": 0.7149451817657242,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004959291278784676,
|
|
"loss": 6.1955,
|
|
"mean_token_accuracy": 0.15981043577194215,
|
|
"num_tokens": 15683286.0,
|
|
"step": 6195
|
|
},
|
|
{
|
|
"entropy": 6.351711416244507,
|
|
"epoch": 0.7155222158107328,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004959213102394954,
|
|
"loss": 6.1165,
|
|
"mean_token_accuracy": 0.1762665629386902,
|
|
"num_tokens": 15697535.0,
|
|
"step": 6200
|
|
},
|
|
{
|
|
"entropy": 6.344398021697998,
|
|
"epoch": 0.7160992498557415,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004959134851699449,
|
|
"loss": 6.2067,
|
|
"mean_token_accuracy": 0.16598029881715776,
|
|
"num_tokens": 15708748.0,
|
|
"step": 6205
|
|
},
|
|
{
|
|
"entropy": 6.413574361801148,
|
|
"epoch": 0.7166762839007501,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004959056526700788,
|
|
"loss": 6.1852,
|
|
"mean_token_accuracy": 0.16717519015073776,
|
|
"num_tokens": 15721720.0,
|
|
"step": 6210
|
|
},
|
|
{
|
|
"entropy": 6.368403530120849,
|
|
"epoch": 0.7172533179457588,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004958978127401609,
|
|
"loss": 6.1315,
|
|
"mean_token_accuracy": 0.17073239833116532,
|
|
"num_tokens": 15734854.0,
|
|
"step": 6215
|
|
},
|
|
{
|
|
"entropy": 6.339862442016601,
|
|
"epoch": 0.7178303519907675,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004958899653804548,
|
|
"loss": 6.1926,
|
|
"mean_token_accuracy": 0.16976216584444045,
|
|
"num_tokens": 15747575.0,
|
|
"step": 6220
|
|
},
|
|
{
|
|
"entropy": 6.308337545394897,
|
|
"epoch": 0.7184073860357761,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004958821105912246,
|
|
"loss": 6.2057,
|
|
"mean_token_accuracy": 0.16995695233345032,
|
|
"num_tokens": 15760917.0,
|
|
"step": 6225
|
|
},
|
|
{
|
|
"entropy": 6.464078569412232,
|
|
"epoch": 0.7189844200807848,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.000495874248372734,
|
|
"loss": 6.279,
|
|
"mean_token_accuracy": 0.15709616243839264,
|
|
"num_tokens": 15774045.0,
|
|
"step": 6230
|
|
},
|
|
{
|
|
"entropy": 6.406183242797852,
|
|
"epoch": 0.7195614541257934,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.000495866378725248,
|
|
"loss": 6.1858,
|
|
"mean_token_accuracy": 0.1691389873623848,
|
|
"num_tokens": 15786006.0,
|
|
"step": 6235
|
|
},
|
|
{
|
|
"entropy": 6.314851379394531,
|
|
"epoch": 0.7201384881708021,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.000495858501649031,
|
|
"loss": 6.1934,
|
|
"mean_token_accuracy": 0.16714197844266893,
|
|
"num_tokens": 15798078.0,
|
|
"step": 6240
|
|
},
|
|
{
|
|
"entropy": 6.398427200317383,
|
|
"epoch": 0.7207155222158107,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.000495850617144348,
|
|
"loss": 6.1999,
|
|
"mean_token_accuracy": 0.167718106508255,
|
|
"num_tokens": 15810281.0,
|
|
"step": 6245
|
|
},
|
|
{
|
|
"entropy": 6.419170761108399,
|
|
"epoch": 0.7212925562608193,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.0004958427252114643,
|
|
"loss": 6.2836,
|
|
"mean_token_accuracy": 0.1600424215197563,
|
|
"num_tokens": 15822593.0,
|
|
"step": 6250
|
|
},
|
|
{
|
|
"entropy": 6.408493232727051,
|
|
"epoch": 0.7218695903058281,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.000495834825850645,
|
|
"loss": 6.2203,
|
|
"mean_token_accuracy": 0.1696522206068039,
|
|
"num_tokens": 15835181.0,
|
|
"step": 6255
|
|
},
|
|
{
|
|
"entropy": 6.452267456054687,
|
|
"epoch": 0.7224466243508367,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0004958269190621562,
|
|
"loss": 6.2164,
|
|
"mean_token_accuracy": 0.16248857825994492,
|
|
"num_tokens": 15847679.0,
|
|
"step": 6260
|
|
},
|
|
{
|
|
"entropy": 6.379993677139282,
|
|
"epoch": 0.7230236583958454,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004958190048462637,
|
|
"loss": 6.2552,
|
|
"mean_token_accuracy": 0.16551875323057175,
|
|
"num_tokens": 15860209.0,
|
|
"step": 6265
|
|
},
|
|
{
|
|
"entropy": 6.4074663639068605,
|
|
"epoch": 0.723600692440854,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004958110832032336,
|
|
"loss": 6.2241,
|
|
"mean_token_accuracy": 0.1634237140417099,
|
|
"num_tokens": 15873165.0,
|
|
"step": 6270
|
|
},
|
|
{
|
|
"entropy": 6.370559549331665,
|
|
"epoch": 0.7241777264858626,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004958031541333322,
|
|
"loss": 6.2481,
|
|
"mean_token_accuracy": 0.16408838033676149,
|
|
"num_tokens": 15885201.0,
|
|
"step": 6275
|
|
},
|
|
{
|
|
"entropy": 6.477904367446899,
|
|
"epoch": 0.7247547605308713,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004957952176368267,
|
|
"loss": 6.2923,
|
|
"mean_token_accuracy": 0.16007572412490845,
|
|
"num_tokens": 15899071.0,
|
|
"step": 6280
|
|
},
|
|
{
|
|
"entropy": 6.339187717437744,
|
|
"epoch": 0.7253317945758799,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004957872737139836,
|
|
"loss": 6.1956,
|
|
"mean_token_accuracy": 0.16685390919446946,
|
|
"num_tokens": 15912274.0,
|
|
"step": 6285
|
|
},
|
|
{
|
|
"entropy": 6.358347415924072,
|
|
"epoch": 0.7259088286208887,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004957793223650702,
|
|
"loss": 6.1697,
|
|
"mean_token_accuracy": 0.17283968180418013,
|
|
"num_tokens": 15925302.0,
|
|
"step": 6290
|
|
},
|
|
{
|
|
"entropy": 6.350992727279663,
|
|
"epoch": 0.7264858626658973,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.000495771363590354,
|
|
"loss": 6.2221,
|
|
"mean_token_accuracy": 0.16327236741781234,
|
|
"num_tokens": 15938226.0,
|
|
"step": 6295
|
|
},
|
|
{
|
|
"entropy": 6.3598075866699215,
|
|
"epoch": 0.727062896710906,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004957633973901027,
|
|
"loss": 6.2529,
|
|
"mean_token_accuracy": 0.16555078625679015,
|
|
"num_tokens": 15951136.0,
|
|
"step": 6300
|
|
},
|
|
{
|
|
"entropy": 6.5036924362182615,
|
|
"epoch": 0.7276399307559146,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004957554237645841,
|
|
"loss": 6.182,
|
|
"mean_token_accuracy": 0.16397586315870286,
|
|
"num_tokens": 15962820.0,
|
|
"step": 6305
|
|
},
|
|
{
|
|
"entropy": 6.3505518436431885,
|
|
"epoch": 0.7282169648009232,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004957474427140665,
|
|
"loss": 6.1517,
|
|
"mean_token_accuracy": 0.16915166974067689,
|
|
"num_tokens": 15974871.0,
|
|
"step": 6310
|
|
},
|
|
{
|
|
"entropy": 6.292996549606324,
|
|
"epoch": 0.7287939988459319,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004957394542388182,
|
|
"loss": 6.1424,
|
|
"mean_token_accuracy": 0.16711995154619216,
|
|
"num_tokens": 15986916.0,
|
|
"step": 6315
|
|
},
|
|
{
|
|
"entropy": 6.4575494766235355,
|
|
"epoch": 0.7293710328909405,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004957314583391082,
|
|
"loss": 6.2829,
|
|
"mean_token_accuracy": 0.1611138626933098,
|
|
"num_tokens": 15999735.0,
|
|
"step": 6320
|
|
},
|
|
{
|
|
"entropy": 6.395171499252319,
|
|
"epoch": 0.7299480669359493,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004957234550152052,
|
|
"loss": 6.1495,
|
|
"mean_token_accuracy": 0.16820143014192582,
|
|
"num_tokens": 16013137.0,
|
|
"step": 6325
|
|
},
|
|
{
|
|
"entropy": 6.411394023895264,
|
|
"epoch": 0.7305251009809579,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004957154442673784,
|
|
"loss": 6.1912,
|
|
"mean_token_accuracy": 0.1681437909603119,
|
|
"num_tokens": 16026750.0,
|
|
"step": 6330
|
|
},
|
|
{
|
|
"entropy": 6.4092567443847654,
|
|
"epoch": 0.7311021350259665,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004957074260958972,
|
|
"loss": 6.2858,
|
|
"mean_token_accuracy": 0.16070856600999833,
|
|
"num_tokens": 16039028.0,
|
|
"step": 6335
|
|
},
|
|
{
|
|
"entropy": 6.334304571151733,
|
|
"epoch": 0.7316791690709752,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004956994005010315,
|
|
"loss": 6.1644,
|
|
"mean_token_accuracy": 0.16928236484527587,
|
|
"num_tokens": 16051349.0,
|
|
"step": 6340
|
|
},
|
|
{
|
|
"entropy": 6.428053951263427,
|
|
"epoch": 0.7322562031159838,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.000495691367483051,
|
|
"loss": 6.1938,
|
|
"mean_token_accuracy": 0.16701492369174958,
|
|
"num_tokens": 16064015.0,
|
|
"step": 6345
|
|
},
|
|
{
|
|
"entropy": 6.399576091766358,
|
|
"epoch": 0.7328332371609925,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004956833270422259,
|
|
"loss": 6.2058,
|
|
"mean_token_accuracy": 0.16545607447624205,
|
|
"num_tokens": 16075571.0,
|
|
"step": 6350
|
|
},
|
|
{
|
|
"entropy": 6.313619899749756,
|
|
"epoch": 0.7334102712060011,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004956752791788269,
|
|
"loss": 6.2174,
|
|
"mean_token_accuracy": 0.17301566898822784,
|
|
"num_tokens": 16088176.0,
|
|
"step": 6355
|
|
},
|
|
{
|
|
"entropy": 6.446109962463379,
|
|
"epoch": 0.7339873052510099,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004956672238931244,
|
|
"loss": 6.2416,
|
|
"mean_token_accuracy": 0.16300074756145477,
|
|
"num_tokens": 16099933.0,
|
|
"step": 6360
|
|
},
|
|
{
|
|
"entropy": 6.3145325660705565,
|
|
"epoch": 0.7345643392960185,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004956591611853894,
|
|
"loss": 6.0568,
|
|
"mean_token_accuracy": 0.17523580491542817,
|
|
"num_tokens": 16113200.0,
|
|
"step": 6365
|
|
},
|
|
{
|
|
"entropy": 6.3287248611450195,
|
|
"epoch": 0.7351413733410271,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004956510910558931,
|
|
"loss": 6.226,
|
|
"mean_token_accuracy": 0.1691768139600754,
|
|
"num_tokens": 16125532.0,
|
|
"step": 6370
|
|
},
|
|
{
|
|
"entropy": 6.4246572971344,
|
|
"epoch": 0.7357184073860358,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004956430135049071,
|
|
"loss": 6.1668,
|
|
"mean_token_accuracy": 0.16189181953668594,
|
|
"num_tokens": 16137197.0,
|
|
"step": 6375
|
|
},
|
|
{
|
|
"entropy": 6.420309734344483,
|
|
"epoch": 0.7362954414310444,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004956349285327028,
|
|
"loss": 6.2291,
|
|
"mean_token_accuracy": 0.170423786342144,
|
|
"num_tokens": 16150481.0,
|
|
"step": 6380
|
|
},
|
|
{
|
|
"entropy": 6.436809253692627,
|
|
"epoch": 0.7368724754760531,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004956268361395523,
|
|
"loss": 6.243,
|
|
"mean_token_accuracy": 0.16785213947296143,
|
|
"num_tokens": 16162395.0,
|
|
"step": 6385
|
|
},
|
|
{
|
|
"entropy": 6.395518732070923,
|
|
"epoch": 0.7374495095210617,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004956187363257278,
|
|
"loss": 6.2114,
|
|
"mean_token_accuracy": 0.16164291948080062,
|
|
"num_tokens": 16174550.0,
|
|
"step": 6390
|
|
},
|
|
{
|
|
"entropy": 6.441514873504639,
|
|
"epoch": 0.7380265435660704,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004956106290915017,
|
|
"loss": 6.224,
|
|
"mean_token_accuracy": 0.16265684217214585,
|
|
"num_tokens": 16187571.0,
|
|
"step": 6395
|
|
},
|
|
{
|
|
"entropy": 6.387861871719361,
|
|
"epoch": 0.7386035776110791,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004956025144371467,
|
|
"loss": 6.2354,
|
|
"mean_token_accuracy": 0.16527050733566284,
|
|
"num_tokens": 16199684.0,
|
|
"step": 6400
|
|
},
|
|
{
|
|
"entropy": 6.3519782543182375,
|
|
"epoch": 0.7391806116560877,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004955943923629356,
|
|
"loss": 6.209,
|
|
"mean_token_accuracy": 0.1613857090473175,
|
|
"num_tokens": 16211935.0,
|
|
"step": 6405
|
|
},
|
|
{
|
|
"entropy": 6.381722450256348,
|
|
"epoch": 0.7397576457010964,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004955862628691417,
|
|
"loss": 6.2057,
|
|
"mean_token_accuracy": 0.16139667183160783,
|
|
"num_tokens": 16224346.0,
|
|
"step": 6410
|
|
},
|
|
{
|
|
"entropy": 6.384852361679077,
|
|
"epoch": 0.740334679746105,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004955781259560386,
|
|
"loss": 6.2382,
|
|
"mean_token_accuracy": 0.16073639541864396,
|
|
"num_tokens": 16238137.0,
|
|
"step": 6415
|
|
},
|
|
{
|
|
"entropy": 6.42009801864624,
|
|
"epoch": 0.7409117137911136,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004955699816238995,
|
|
"loss": 6.2115,
|
|
"mean_token_accuracy": 0.1616441637277603,
|
|
"num_tokens": 16250777.0,
|
|
"step": 6420
|
|
},
|
|
{
|
|
"entropy": 6.490957832336425,
|
|
"epoch": 0.7414887478361223,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004955618298729988,
|
|
"loss": 6.216,
|
|
"mean_token_accuracy": 0.16838435977697372,
|
|
"num_tokens": 16262440.0,
|
|
"step": 6425
|
|
},
|
|
{
|
|
"entropy": 6.3685378074646,
|
|
"epoch": 0.742065781881131,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004955536707036105,
|
|
"loss": 6.1605,
|
|
"mean_token_accuracy": 0.1693017989397049,
|
|
"num_tokens": 16275227.0,
|
|
"step": 6430
|
|
},
|
|
{
|
|
"entropy": 6.362598896026611,
|
|
"epoch": 0.7426428159261397,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.000495545504116009,
|
|
"loss": 6.2191,
|
|
"mean_token_accuracy": 0.16907331794500352,
|
|
"num_tokens": 16287246.0,
|
|
"step": 6435
|
|
},
|
|
{
|
|
"entropy": 6.334651374816895,
|
|
"epoch": 0.7432198499711483,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004955373301104691,
|
|
"loss": 6.0844,
|
|
"mean_token_accuracy": 0.1756950169801712,
|
|
"num_tokens": 16298779.0,
|
|
"step": 6440
|
|
},
|
|
{
|
|
"entropy": 6.257397556304932,
|
|
"epoch": 0.743796884016157,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004955291486872657,
|
|
"loss": 6.094,
|
|
"mean_token_accuracy": 0.17155533283948898,
|
|
"num_tokens": 16310965.0,
|
|
"step": 6445
|
|
},
|
|
{
|
|
"entropy": 6.422209453582764,
|
|
"epoch": 0.7443739180611656,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004955209598466738,
|
|
"loss": 6.1489,
|
|
"mean_token_accuracy": 0.16697419285774232,
|
|
"num_tokens": 16324025.0,
|
|
"step": 6450
|
|
},
|
|
{
|
|
"entropy": 6.4021642208099365,
|
|
"epoch": 0.7449509521061742,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.000495512763588969,
|
|
"loss": 6.1812,
|
|
"mean_token_accuracy": 0.1613484129309654,
|
|
"num_tokens": 16336152.0,
|
|
"step": 6455
|
|
},
|
|
{
|
|
"entropy": 6.3049877166748045,
|
|
"epoch": 0.7455279861511829,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004955045599144269,
|
|
"loss": 6.1725,
|
|
"mean_token_accuracy": 0.16346538215875625,
|
|
"num_tokens": 16349118.0,
|
|
"step": 6460
|
|
},
|
|
{
|
|
"entropy": 6.290837526321411,
|
|
"epoch": 0.7461050201961916,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004954963488233235,
|
|
"loss": 6.1527,
|
|
"mean_token_accuracy": 0.16980938464403153,
|
|
"num_tokens": 16362986.0,
|
|
"step": 6465
|
|
},
|
|
{
|
|
"entropy": 6.390332794189453,
|
|
"epoch": 0.7466820542412003,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.000495488130315935,
|
|
"loss": 6.2864,
|
|
"mean_token_accuracy": 0.15601871460676192,
|
|
"num_tokens": 16376384.0,
|
|
"step": 6470
|
|
},
|
|
{
|
|
"entropy": 6.3824310302734375,
|
|
"epoch": 0.7472590882862089,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004954799043925377,
|
|
"loss": 6.0944,
|
|
"mean_token_accuracy": 0.16927106827497482,
|
|
"num_tokens": 16388137.0,
|
|
"step": 6475
|
|
},
|
|
{
|
|
"entropy": 6.397792720794678,
|
|
"epoch": 0.7478361223312175,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004954716710534082,
|
|
"loss": 6.2386,
|
|
"mean_token_accuracy": 0.15695064812898635,
|
|
"num_tokens": 16400037.0,
|
|
"step": 6480
|
|
},
|
|
{
|
|
"entropy": 6.404593467712402,
|
|
"epoch": 0.7484131563762262,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004954634302988237,
|
|
"loss": 6.1692,
|
|
"mean_token_accuracy": 0.16684277951717377,
|
|
"num_tokens": 16412065.0,
|
|
"step": 6485
|
|
},
|
|
{
|
|
"entropy": 6.392002153396606,
|
|
"epoch": 0.7489901904212348,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004954551821290612,
|
|
"loss": 6.1886,
|
|
"mean_token_accuracy": 0.1650811791419983,
|
|
"num_tokens": 16424345.0,
|
|
"step": 6490
|
|
},
|
|
{
|
|
"entropy": 6.408037185668945,
|
|
"epoch": 0.7495672244662435,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004954469265443981,
|
|
"loss": 6.2616,
|
|
"mean_token_accuracy": 0.16495269536972046,
|
|
"num_tokens": 16436423.0,
|
|
"step": 6495
|
|
},
|
|
{
|
|
"entropy": 6.3400726318359375,
|
|
"epoch": 0.7501442585112522,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004954386635451123,
|
|
"loss": 6.1597,
|
|
"mean_token_accuracy": 0.16760794222354888,
|
|
"num_tokens": 16449496.0,
|
|
"step": 6500
|
|
},
|
|
{
|
|
"entropy": 6.373304224014282,
|
|
"epoch": 0.7507212925562609,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004954303931314814,
|
|
"loss": 6.1806,
|
|
"mean_token_accuracy": 0.16673036217689513,
|
|
"num_tokens": 16462193.0,
|
|
"step": 6505
|
|
},
|
|
{
|
|
"entropy": 6.355952978134155,
|
|
"epoch": 0.7512983266012695,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004954221153037837,
|
|
"loss": 6.2043,
|
|
"mean_token_accuracy": 0.1631313681602478,
|
|
"num_tokens": 16474470.0,
|
|
"step": 6510
|
|
},
|
|
{
|
|
"entropy": 6.425698757171631,
|
|
"epoch": 0.7518753606462781,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004954138300622978,
|
|
"loss": 6.1706,
|
|
"mean_token_accuracy": 0.17431595772504807,
|
|
"num_tokens": 16487231.0,
|
|
"step": 6515
|
|
},
|
|
{
|
|
"entropy": 6.373720026016235,
|
|
"epoch": 0.7524523946912868,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.000495405537407302,
|
|
"loss": 6.2687,
|
|
"mean_token_accuracy": 0.16340657472610473,
|
|
"num_tokens": 16500822.0,
|
|
"step": 6520
|
|
},
|
|
{
|
|
"entropy": 6.301622486114502,
|
|
"epoch": 0.7530294287362954,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004953972373390755,
|
|
"loss": 6.2006,
|
|
"mean_token_accuracy": 0.16783786863088607,
|
|
"num_tokens": 16514529.0,
|
|
"step": 6525
|
|
},
|
|
{
|
|
"entropy": 6.352727317810059,
|
|
"epoch": 0.753606462781304,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004953889298578975,
|
|
"loss": 6.1729,
|
|
"mean_token_accuracy": 0.1620926558971405,
|
|
"num_tokens": 16527281.0,
|
|
"step": 6530
|
|
},
|
|
{
|
|
"entropy": 6.431893682479858,
|
|
"epoch": 0.7541834968263128,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004953806149640473,
|
|
"loss": 6.1662,
|
|
"mean_token_accuracy": 0.16912026554346085,
|
|
"num_tokens": 16539763.0,
|
|
"step": 6535
|
|
},
|
|
{
|
|
"entropy": 6.268726921081543,
|
|
"epoch": 0.7547605308713214,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0004953722926578045,
|
|
"loss": 6.1403,
|
|
"mean_token_accuracy": 0.17996453493833542,
|
|
"num_tokens": 16552197.0,
|
|
"step": 6540
|
|
},
|
|
{
|
|
"entropy": 6.44415316581726,
|
|
"epoch": 0.7553375649163301,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004953639629394492,
|
|
"loss": 6.2006,
|
|
"mean_token_accuracy": 0.16660022884607315,
|
|
"num_tokens": 16563988.0,
|
|
"step": 6545
|
|
},
|
|
{
|
|
"entropy": 6.337887763977051,
|
|
"epoch": 0.7559145989613387,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0004953556258092613,
|
|
"loss": 6.1856,
|
|
"mean_token_accuracy": 0.16377629339694977,
|
|
"num_tokens": 16576982.0,
|
|
"step": 6550
|
|
},
|
|
{
|
|
"entropy": 6.3525402545928955,
|
|
"epoch": 0.7564916330063474,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004953472812675216,
|
|
"loss": 6.2339,
|
|
"mean_token_accuracy": 0.16399967223405837,
|
|
"num_tokens": 16590268.0,
|
|
"step": 6555
|
|
},
|
|
{
|
|
"entropy": 6.381183433532715,
|
|
"epoch": 0.757068667051356,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004953389293145104,
|
|
"loss": 6.0784,
|
|
"mean_token_accuracy": 0.1773386687040329,
|
|
"num_tokens": 16602599.0,
|
|
"step": 6560
|
|
},
|
|
{
|
|
"entropy": 6.38706521987915,
|
|
"epoch": 0.7576457010963646,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004953305699505088,
|
|
"loss": 6.1784,
|
|
"mean_token_accuracy": 0.16482038497924806,
|
|
"num_tokens": 16614278.0,
|
|
"step": 6565
|
|
},
|
|
{
|
|
"entropy": 6.376954698562622,
|
|
"epoch": 0.7582227351413734,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004953222031757979,
|
|
"loss": 6.1969,
|
|
"mean_token_accuracy": 0.16000646650791167,
|
|
"num_tokens": 16626810.0,
|
|
"step": 6570
|
|
},
|
|
{
|
|
"entropy": 6.30605149269104,
|
|
"epoch": 0.758799769186382,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004953138289906592,
|
|
"loss": 6.147,
|
|
"mean_token_accuracy": 0.16598434895277023,
|
|
"num_tokens": 16639134.0,
|
|
"step": 6575
|
|
},
|
|
{
|
|
"entropy": 6.401002597808838,
|
|
"epoch": 0.7593768032313907,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004953054473953742,
|
|
"loss": 6.174,
|
|
"mean_token_accuracy": 0.16408377885818481,
|
|
"num_tokens": 16652724.0,
|
|
"step": 6580
|
|
},
|
|
{
|
|
"entropy": 6.300872707366944,
|
|
"epoch": 0.7599538372763993,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004952970583902251,
|
|
"loss": 6.1405,
|
|
"mean_token_accuracy": 0.16957145929336548,
|
|
"num_tokens": 16666045.0,
|
|
"step": 6585
|
|
},
|
|
{
|
|
"entropy": 6.358345413208008,
|
|
"epoch": 0.760530871321408,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004952886619754937,
|
|
"loss": 6.2554,
|
|
"mean_token_accuracy": 0.16089996993541716,
|
|
"num_tokens": 16678422.0,
|
|
"step": 6590
|
|
},
|
|
{
|
|
"entropy": 6.361907529830932,
|
|
"epoch": 0.7611079053664166,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004952802581514625,
|
|
"loss": 6.1704,
|
|
"mean_token_accuracy": 0.17014944702386856,
|
|
"num_tokens": 16690243.0,
|
|
"step": 6595
|
|
},
|
|
{
|
|
"entropy": 6.311407661437988,
|
|
"epoch": 0.7616849394114252,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004952718469184144,
|
|
"loss": 6.1312,
|
|
"mean_token_accuracy": 0.17277286797761918,
|
|
"num_tokens": 16702418.0,
|
|
"step": 6600
|
|
},
|
|
{
|
|
"entropy": 6.436389970779419,
|
|
"epoch": 0.762261973456434,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004952634282766322,
|
|
"loss": 6.2206,
|
|
"mean_token_accuracy": 0.15880272090435027,
|
|
"num_tokens": 16713974.0,
|
|
"step": 6605
|
|
},
|
|
{
|
|
"entropy": 6.349586820602417,
|
|
"epoch": 0.7628390075014426,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004952550022263988,
|
|
"loss": 6.1066,
|
|
"mean_token_accuracy": 0.17593667209148406,
|
|
"num_tokens": 16726518.0,
|
|
"step": 6610
|
|
},
|
|
{
|
|
"entropy": 6.310934448242188,
|
|
"epoch": 0.7634160415464513,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004952465687679979,
|
|
"loss": 6.1369,
|
|
"mean_token_accuracy": 0.17361938208341599,
|
|
"num_tokens": 16738701.0,
|
|
"step": 6615
|
|
},
|
|
{
|
|
"entropy": 6.3912577629089355,
|
|
"epoch": 0.7639930755914599,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.000495238127901713,
|
|
"loss": 6.186,
|
|
"mean_token_accuracy": 0.1613457351922989,
|
|
"num_tokens": 16751251.0,
|
|
"step": 6620
|
|
},
|
|
{
|
|
"entropy": 6.388515663146973,
|
|
"epoch": 0.7645701096364685,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004952296796278282,
|
|
"loss": 6.1779,
|
|
"mean_token_accuracy": 0.16940819919109346,
|
|
"num_tokens": 16764233.0,
|
|
"step": 6625
|
|
},
|
|
{
|
|
"entropy": 6.276236534118652,
|
|
"epoch": 0.7651471436814772,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004952212239466274,
|
|
"loss": 6.1759,
|
|
"mean_token_accuracy": 0.1788155049085617,
|
|
"num_tokens": 16778408.0,
|
|
"step": 6630
|
|
},
|
|
{
|
|
"entropy": 6.3944172859191895,
|
|
"epoch": 0.7657241777264858,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004952127608583953,
|
|
"loss": 6.2105,
|
|
"mean_token_accuracy": 0.16523972898721695,
|
|
"num_tokens": 16789863.0,
|
|
"step": 6635
|
|
},
|
|
{
|
|
"entropy": 6.392884111404419,
|
|
"epoch": 0.7663012117714946,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004952042903634162,
|
|
"loss": 6.1331,
|
|
"mean_token_accuracy": 0.17282791584730148,
|
|
"num_tokens": 16804448.0,
|
|
"step": 6640
|
|
},
|
|
{
|
|
"entropy": 6.314636993408203,
|
|
"epoch": 0.7668782458165032,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004951958124619752,
|
|
"loss": 6.231,
|
|
"mean_token_accuracy": 0.16494413763284682,
|
|
"num_tokens": 16817922.0,
|
|
"step": 6645
|
|
},
|
|
{
|
|
"entropy": 6.392580652236939,
|
|
"epoch": 0.7674552798615119,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0004951873271543573,
|
|
"loss": 6.2165,
|
|
"mean_token_accuracy": 0.16729218661785125,
|
|
"num_tokens": 16830322.0,
|
|
"step": 6650
|
|
},
|
|
{
|
|
"entropy": 6.465516519546509,
|
|
"epoch": 0.7680323139065205,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004951788344408483,
|
|
"loss": 6.2252,
|
|
"mean_token_accuracy": 0.16338257789611815,
|
|
"num_tokens": 16843489.0,
|
|
"step": 6655
|
|
},
|
|
{
|
|
"entropy": 6.345834875106812,
|
|
"epoch": 0.7686093479515291,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004951703343217335,
|
|
"loss": 6.1887,
|
|
"mean_token_accuracy": 0.16055528968572616,
|
|
"num_tokens": 16855256.0,
|
|
"step": 6660
|
|
},
|
|
{
|
|
"entropy": 6.285180187225341,
|
|
"epoch": 0.7691863819965378,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004951618267972987,
|
|
"loss": 6.171,
|
|
"mean_token_accuracy": 0.1670081600546837,
|
|
"num_tokens": 16869927.0,
|
|
"step": 6665
|
|
},
|
|
{
|
|
"entropy": 6.294586229324341,
|
|
"epoch": 0.7697634160415464,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004951533118678304,
|
|
"loss": 6.0723,
|
|
"mean_token_accuracy": 0.18153493106365204,
|
|
"num_tokens": 16882095.0,
|
|
"step": 6670
|
|
},
|
|
{
|
|
"entropy": 6.4467226505279545,
|
|
"epoch": 0.7703404500865552,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004951447895336147,
|
|
"loss": 6.2758,
|
|
"mean_token_accuracy": 0.16662507206201554,
|
|
"num_tokens": 16893338.0,
|
|
"step": 6675
|
|
},
|
|
{
|
|
"entropy": 6.349839162826538,
|
|
"epoch": 0.7709174841315638,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004951362597949384,
|
|
"loss": 6.2421,
|
|
"mean_token_accuracy": 0.16923239529132844,
|
|
"num_tokens": 16907138.0,
|
|
"step": 6680
|
|
},
|
|
{
|
|
"entropy": 6.409167861938476,
|
|
"epoch": 0.7714945181765724,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004951277226520883,
|
|
"loss": 6.1483,
|
|
"mean_token_accuracy": 0.16991439014673232,
|
|
"num_tokens": 16919756.0,
|
|
"step": 6685
|
|
},
|
|
{
|
|
"entropy": 6.386492919921875,
|
|
"epoch": 0.7720715522215811,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004951191781053517,
|
|
"loss": 6.104,
|
|
"mean_token_accuracy": 0.17598668336868287,
|
|
"num_tokens": 16932059.0,
|
|
"step": 6690
|
|
},
|
|
{
|
|
"entropy": 6.321619033813477,
|
|
"epoch": 0.7726485862665897,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004951106261550157,
|
|
"loss": 6.2057,
|
|
"mean_token_accuracy": 0.16631946563720704,
|
|
"num_tokens": 16944777.0,
|
|
"step": 6695
|
|
},
|
|
{
|
|
"entropy": 6.380236434936523,
|
|
"epoch": 0.7732256203115984,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004951020668013683,
|
|
"loss": 6.1656,
|
|
"mean_token_accuracy": 0.17202370017766952,
|
|
"num_tokens": 16957111.0,
|
|
"step": 6700
|
|
},
|
|
{
|
|
"entropy": 6.385104084014893,
|
|
"epoch": 0.773802654356607,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004950935000446972,
|
|
"loss": 6.2429,
|
|
"mean_token_accuracy": 0.15982713252305986,
|
|
"num_tokens": 16968663.0,
|
|
"step": 6705
|
|
},
|
|
{
|
|
"entropy": 6.359501457214355,
|
|
"epoch": 0.7743796884016156,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004950849258852905,
|
|
"loss": 6.168,
|
|
"mean_token_accuracy": 0.16180971562862395,
|
|
"num_tokens": 16980668.0,
|
|
"step": 6710
|
|
},
|
|
{
|
|
"entropy": 6.346779251098633,
|
|
"epoch": 0.7749567224466244,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004950763443234366,
|
|
"loss": 6.2033,
|
|
"mean_token_accuracy": 0.16977418661117555,
|
|
"num_tokens": 16993537.0,
|
|
"step": 6715
|
|
},
|
|
{
|
|
"entropy": 6.372853565216064,
|
|
"epoch": 0.775533756491633,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004950677553594243,
|
|
"loss": 6.18,
|
|
"mean_token_accuracy": 0.16297179460525513,
|
|
"num_tokens": 17006268.0,
|
|
"step": 6720
|
|
},
|
|
{
|
|
"entropy": 6.383951425552368,
|
|
"epoch": 0.7761107905366417,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004950591589935422,
|
|
"loss": 6.1762,
|
|
"mean_token_accuracy": 0.1659395158290863,
|
|
"num_tokens": 17018643.0,
|
|
"step": 6725
|
|
},
|
|
{
|
|
"entropy": 6.294509315490723,
|
|
"epoch": 0.7766878245816503,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004950505552260798,
|
|
"loss": 6.1452,
|
|
"mean_token_accuracy": 0.17016030550003053,
|
|
"num_tokens": 17030670.0,
|
|
"step": 6730
|
|
},
|
|
{
|
|
"entropy": 6.4208496570587155,
|
|
"epoch": 0.777264858626659,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004950419440573261,
|
|
"loss": 6.155,
|
|
"mean_token_accuracy": 0.17145975232124328,
|
|
"num_tokens": 17042617.0,
|
|
"step": 6735
|
|
},
|
|
{
|
|
"entropy": 6.289498710632325,
|
|
"epoch": 0.7778418926716676,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.000495033325487571,
|
|
"loss": 6.2014,
|
|
"mean_token_accuracy": 0.16481405943632127,
|
|
"num_tokens": 17055217.0,
|
|
"step": 6740
|
|
},
|
|
{
|
|
"entropy": 6.231577014923095,
|
|
"epoch": 0.7784189267166762,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004950246995171042,
|
|
"loss": 6.054,
|
|
"mean_token_accuracy": 0.18304862976074218,
|
|
"num_tokens": 17068614.0,
|
|
"step": 6745
|
|
},
|
|
{
|
|
"entropy": 6.345638132095337,
|
|
"epoch": 0.778995960761685,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.000495016066146216,
|
|
"loss": 6.089,
|
|
"mean_token_accuracy": 0.17975687980651855,
|
|
"num_tokens": 17079892.0,
|
|
"step": 6750
|
|
},
|
|
{
|
|
"entropy": 6.320506286621094,
|
|
"epoch": 0.7795729948066936,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004950074253751968,
|
|
"loss": 6.187,
|
|
"mean_token_accuracy": 0.17330573499202728,
|
|
"num_tokens": 17092113.0,
|
|
"step": 6755
|
|
},
|
|
{
|
|
"entropy": 6.373245906829834,
|
|
"epoch": 0.7801500288517023,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000494998777204337,
|
|
"loss": 6.1624,
|
|
"mean_token_accuracy": 0.1723353922367096,
|
|
"num_tokens": 17103387.0,
|
|
"step": 6760
|
|
},
|
|
{
|
|
"entropy": 6.408647680282593,
|
|
"epoch": 0.7807270628967109,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004949901216339276,
|
|
"loss": 6.2118,
|
|
"mean_token_accuracy": 0.16432149559259415,
|
|
"num_tokens": 17116008.0,
|
|
"step": 6765
|
|
},
|
|
{
|
|
"entropy": 6.3029053688049315,
|
|
"epoch": 0.7813040969417195,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004949814586642598,
|
|
"loss": 6.0949,
|
|
"mean_token_accuracy": 0.1802838459610939,
|
|
"num_tokens": 17129224.0,
|
|
"step": 6770
|
|
},
|
|
{
|
|
"entropy": 6.2848211288452145,
|
|
"epoch": 0.7818811309867282,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.000494972788295625,
|
|
"loss": 6.0943,
|
|
"mean_token_accuracy": 0.16807924062013627,
|
|
"num_tokens": 17141357.0,
|
|
"step": 6775
|
|
},
|
|
{
|
|
"entropy": 6.308895206451416,
|
|
"epoch": 0.7824581650317368,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004949641105283144,
|
|
"loss": 6.1263,
|
|
"mean_token_accuracy": 0.17011737823486328,
|
|
"num_tokens": 17153672.0,
|
|
"step": 6780
|
|
},
|
|
{
|
|
"entropy": 6.329161548614502,
|
|
"epoch": 0.7830351990767456,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004949554253626205,
|
|
"loss": 6.1984,
|
|
"mean_token_accuracy": 0.16174544990062714,
|
|
"num_tokens": 17168429.0,
|
|
"step": 6785
|
|
},
|
|
{
|
|
"entropy": 6.412427520751953,
|
|
"epoch": 0.7836122331217542,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004949467327988351,
|
|
"loss": 6.1309,
|
|
"mean_token_accuracy": 0.16915023773908616,
|
|
"num_tokens": 17181000.0,
|
|
"step": 6790
|
|
},
|
|
{
|
|
"entropy": 6.298403978347778,
|
|
"epoch": 0.7841892671667628,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004949380328372505,
|
|
"loss": 6.1312,
|
|
"mean_token_accuracy": 0.16709219068288803,
|
|
"num_tokens": 17193984.0,
|
|
"step": 6795
|
|
},
|
|
{
|
|
"entropy": 6.35187873840332,
|
|
"epoch": 0.7847663012117715,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004949293254781595,
|
|
"loss": 6.1563,
|
|
"mean_token_accuracy": 0.17206377685070037,
|
|
"num_tokens": 17207289.0,
|
|
"step": 6800
|
|
},
|
|
{
|
|
"entropy": 6.3366005420684814,
|
|
"epoch": 0.7853433352567801,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004949206107218547,
|
|
"loss": 6.207,
|
|
"mean_token_accuracy": 0.16879773288965225,
|
|
"num_tokens": 17220785.0,
|
|
"step": 6805
|
|
},
|
|
{
|
|
"entropy": 6.426763868331909,
|
|
"epoch": 0.7859203693017888,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004949118885686296,
|
|
"loss": 6.1794,
|
|
"mean_token_accuracy": 0.1629263088107109,
|
|
"num_tokens": 17233475.0,
|
|
"step": 6810
|
|
},
|
|
{
|
|
"entropy": 6.387394714355469,
|
|
"epoch": 0.7864974033467974,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004949031590187774,
|
|
"loss": 6.154,
|
|
"mean_token_accuracy": 0.1672731891274452,
|
|
"num_tokens": 17246652.0,
|
|
"step": 6815
|
|
},
|
|
{
|
|
"entropy": 6.331944465637207,
|
|
"epoch": 0.7870744373918062,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004948944220725915,
|
|
"loss": 6.1632,
|
|
"mean_token_accuracy": 0.1671597495675087,
|
|
"num_tokens": 17259966.0,
|
|
"step": 6820
|
|
},
|
|
{
|
|
"entropy": 6.285306072235107,
|
|
"epoch": 0.7876514714368148,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.000494885677730366,
|
|
"loss": 6.0972,
|
|
"mean_token_accuracy": 0.1782669961452484,
|
|
"num_tokens": 17272556.0,
|
|
"step": 6825
|
|
},
|
|
{
|
|
"entropy": 6.356509113311768,
|
|
"epoch": 0.7882285054818234,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.000494876925992395,
|
|
"loss": 6.1213,
|
|
"mean_token_accuracy": 0.1762054055929184,
|
|
"num_tokens": 17285960.0,
|
|
"step": 6830
|
|
},
|
|
{
|
|
"entropy": 6.398293352127075,
|
|
"epoch": 0.7888055395268321,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004948681668589728,
|
|
"loss": 6.2315,
|
|
"mean_token_accuracy": 0.15961660146713258,
|
|
"num_tokens": 17299743.0,
|
|
"step": 6835
|
|
},
|
|
{
|
|
"entropy": 6.301696109771728,
|
|
"epoch": 0.7893825735718407,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.000494859400330394,
|
|
"loss": 6.1103,
|
|
"mean_token_accuracy": 0.16794033199548722,
|
|
"num_tokens": 17312317.0,
|
|
"step": 6840
|
|
},
|
|
{
|
|
"entropy": 6.351978206634522,
|
|
"epoch": 0.7899596076168494,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004948506264069535,
|
|
"loss": 6.1624,
|
|
"mean_token_accuracy": 0.167983041703701,
|
|
"num_tokens": 17326204.0,
|
|
"step": 6845
|
|
},
|
|
{
|
|
"entropy": 6.338317823410034,
|
|
"epoch": 0.790536641661858,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004948418450889464,
|
|
"loss": 6.1077,
|
|
"mean_token_accuracy": 0.1751476228237152,
|
|
"num_tokens": 17338362.0,
|
|
"step": 6850
|
|
},
|
|
{
|
|
"entropy": 6.257613039016723,
|
|
"epoch": 0.7911136757068667,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.000494833056376668,
|
|
"loss": 6.1526,
|
|
"mean_token_accuracy": 0.1725895255804062,
|
|
"num_tokens": 17350713.0,
|
|
"step": 6855
|
|
},
|
|
{
|
|
"entropy": 6.426647043228149,
|
|
"epoch": 0.7916907097518754,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004948242602704139,
|
|
"loss": 6.185,
|
|
"mean_token_accuracy": 0.16246354728937148,
|
|
"num_tokens": 17364055.0,
|
|
"step": 6860
|
|
},
|
|
{
|
|
"entropy": 6.354440021514892,
|
|
"epoch": 0.792267743796884,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004948154567704801,
|
|
"loss": 6.2338,
|
|
"mean_token_accuracy": 0.1697024703025818,
|
|
"num_tokens": 17377940.0,
|
|
"step": 6865
|
|
},
|
|
{
|
|
"entropy": 6.37884521484375,
|
|
"epoch": 0.7928447778418927,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004948066458771625,
|
|
"loss": 6.1571,
|
|
"mean_token_accuracy": 0.17270761132240295,
|
|
"num_tokens": 17390348.0,
|
|
"step": 6870
|
|
},
|
|
{
|
|
"entropy": 6.355157947540283,
|
|
"epoch": 0.7934218118869013,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004947978275907577,
|
|
"loss": 6.1631,
|
|
"mean_token_accuracy": 0.17038169950246812,
|
|
"num_tokens": 17403406.0,
|
|
"step": 6875
|
|
},
|
|
{
|
|
"entropy": 6.323590803146362,
|
|
"epoch": 0.79399884593191,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.000494789001911562,
|
|
"loss": 6.1659,
|
|
"mean_token_accuracy": 0.16402290314435958,
|
|
"num_tokens": 17415306.0,
|
|
"step": 6880
|
|
},
|
|
{
|
|
"entropy": 6.354849624633789,
|
|
"epoch": 0.7945758799769186,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004947801688398725,
|
|
"loss": 6.2131,
|
|
"mean_token_accuracy": 0.16550301611423493,
|
|
"num_tokens": 17427901.0,
|
|
"step": 6885
|
|
},
|
|
{
|
|
"entropy": 6.385193347930908,
|
|
"epoch": 0.7951529140219273,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004947713283759862,
|
|
"loss": 6.1557,
|
|
"mean_token_accuracy": 0.16478197127580643,
|
|
"num_tokens": 17439812.0,
|
|
"step": 6890
|
|
},
|
|
{
|
|
"entropy": 6.380311965942383,
|
|
"epoch": 0.795729948066936,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004947624805202003,
|
|
"loss": 6.2637,
|
|
"mean_token_accuracy": 0.16673970818519593,
|
|
"num_tokens": 17453317.0,
|
|
"step": 6895
|
|
},
|
|
{
|
|
"entropy": 6.315207052230835,
|
|
"epoch": 0.7963069821119446,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004947536252728126,
|
|
"loss": 6.1383,
|
|
"mean_token_accuracy": 0.16237509697675706,
|
|
"num_tokens": 17465563.0,
|
|
"step": 6900
|
|
},
|
|
{
|
|
"entropy": 6.343274450302124,
|
|
"epoch": 0.7968840161569533,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004947447626341209,
|
|
"loss": 6.2019,
|
|
"mean_token_accuracy": 0.16558388322591783,
|
|
"num_tokens": 17477672.0,
|
|
"step": 6905
|
|
},
|
|
{
|
|
"entropy": 6.394934368133545,
|
|
"epoch": 0.7974610502019619,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004947358926044232,
|
|
"loss": 6.168,
|
|
"mean_token_accuracy": 0.16697321683168412,
|
|
"num_tokens": 17489061.0,
|
|
"step": 6910
|
|
},
|
|
{
|
|
"entropy": 6.357774353027343,
|
|
"epoch": 0.7980380842469705,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004947270151840179,
|
|
"loss": 6.1935,
|
|
"mean_token_accuracy": 0.1671817809343338,
|
|
"num_tokens": 17501734.0,
|
|
"step": 6915
|
|
},
|
|
{
|
|
"entropy": 6.3456621170043945,
|
|
"epoch": 0.7986151182919792,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004947181303732038,
|
|
"loss": 6.1014,
|
|
"mean_token_accuracy": 0.16575353741645812,
|
|
"num_tokens": 17514387.0,
|
|
"step": 6920
|
|
},
|
|
{
|
|
"entropy": 6.3213715076446535,
|
|
"epoch": 0.7991921523369879,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004947092381722793,
|
|
"loss": 6.1093,
|
|
"mean_token_accuracy": 0.176436585187912,
|
|
"num_tokens": 17526483.0,
|
|
"step": 6925
|
|
},
|
|
{
|
|
"entropy": 6.3709863185882565,
|
|
"epoch": 0.7997691863819966,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004947003385815438,
|
|
"loss": 6.1283,
|
|
"mean_token_accuracy": 0.17597151696681976,
|
|
"num_tokens": 17539809.0,
|
|
"step": 6930
|
|
},
|
|
{
|
|
"entropy": 6.328467512130738,
|
|
"epoch": 0.8003462204270052,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004946914316012964,
|
|
"loss": 6.1598,
|
|
"mean_token_accuracy": 0.16539319902658461,
|
|
"num_tokens": 17552973.0,
|
|
"step": 6935
|
|
},
|
|
{
|
|
"entropy": 6.3325916767120365,
|
|
"epoch": 0.8009232544720138,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.000494682517231837,
|
|
"loss": 6.1964,
|
|
"mean_token_accuracy": 0.16823789924383165,
|
|
"num_tokens": 17567803.0,
|
|
"step": 6940
|
|
},
|
|
{
|
|
"entropy": 6.404011678695679,
|
|
"epoch": 0.8015002885170225,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004946735954734652,
|
|
"loss": 6.1555,
|
|
"mean_token_accuracy": 0.16666851192712784,
|
|
"num_tokens": 17579718.0,
|
|
"step": 6945
|
|
},
|
|
{
|
|
"entropy": 6.385808038711548,
|
|
"epoch": 0.8020773225620311,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004946646663264811,
|
|
"loss": 6.1333,
|
|
"mean_token_accuracy": 0.1694340467453003,
|
|
"num_tokens": 17592384.0,
|
|
"step": 6950
|
|
},
|
|
{
|
|
"entropy": 6.309904003143311,
|
|
"epoch": 0.8026543566070398,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004946557297911852,
|
|
"loss": 6.0212,
|
|
"mean_token_accuracy": 0.17547217458486558,
|
|
"num_tokens": 17604292.0,
|
|
"step": 6955
|
|
},
|
|
{
|
|
"entropy": 6.287991714477539,
|
|
"epoch": 0.8032313906520485,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004946467858678777,
|
|
"loss": 6.075,
|
|
"mean_token_accuracy": 0.17394087314605713,
|
|
"num_tokens": 17616638.0,
|
|
"step": 6960
|
|
},
|
|
{
|
|
"entropy": 6.383854913711548,
|
|
"epoch": 0.8038084246970572,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004946378345568597,
|
|
"loss": 6.1799,
|
|
"mean_token_accuracy": 0.16211076080799103,
|
|
"num_tokens": 17630672.0,
|
|
"step": 6965
|
|
},
|
|
{
|
|
"entropy": 6.366672039031982,
|
|
"epoch": 0.8043854587420658,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004946288758584324,
|
|
"loss": 6.1695,
|
|
"mean_token_accuracy": 0.16282691508531572,
|
|
"num_tokens": 17644215.0,
|
|
"step": 6970
|
|
},
|
|
{
|
|
"entropy": 6.3507161140441895,
|
|
"epoch": 0.8049624927870744,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004946199097728968,
|
|
"loss": 6.2385,
|
|
"mean_token_accuracy": 0.1637930914759636,
|
|
"num_tokens": 17655982.0,
|
|
"step": 6975
|
|
},
|
|
{
|
|
"entropy": 6.403667640686035,
|
|
"epoch": 0.8055395268320831,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004946109363005548,
|
|
"loss": 6.1556,
|
|
"mean_token_accuracy": 0.16717308312654494,
|
|
"num_tokens": 17668059.0,
|
|
"step": 6980
|
|
},
|
|
{
|
|
"entropy": 6.378528499603272,
|
|
"epoch": 0.8061165608770917,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.000494601955441708,
|
|
"loss": 6.1703,
|
|
"mean_token_accuracy": 0.17550845742225646,
|
|
"num_tokens": 17680924.0,
|
|
"step": 6985
|
|
},
|
|
{
|
|
"entropy": 6.313846302032471,
|
|
"epoch": 0.8066935949221004,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004945929671966585,
|
|
"loss": 6.1863,
|
|
"mean_token_accuracy": 0.1592755913734436,
|
|
"num_tokens": 17693381.0,
|
|
"step": 6990
|
|
},
|
|
{
|
|
"entropy": 6.293050956726074,
|
|
"epoch": 0.8072706289671091,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004945839715657085,
|
|
"loss": 6.0838,
|
|
"mean_token_accuracy": 0.1738973081111908,
|
|
"num_tokens": 17705900.0,
|
|
"step": 6995
|
|
},
|
|
{
|
|
"entropy": 6.292917346954345,
|
|
"epoch": 0.8078476630121177,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004945749685491607,
|
|
"loss": 6.0748,
|
|
"mean_token_accuracy": 0.17757318913936615,
|
|
"num_tokens": 17719139.0,
|
|
"step": 7000
|
|
},
|
|
{
|
|
"entropy": 6.337329006195068,
|
|
"epoch": 0.8084246970571264,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0004945659581473181,
|
|
"loss": 6.0884,
|
|
"mean_token_accuracy": 0.17271215915679933,
|
|
"num_tokens": 17734312.0,
|
|
"step": 7005
|
|
},
|
|
{
|
|
"entropy": 6.381900072097778,
|
|
"epoch": 0.809001731102135,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004945569403604833,
|
|
"loss": 6.1688,
|
|
"mean_token_accuracy": 0.16242203563451768,
|
|
"num_tokens": 17746137.0,
|
|
"step": 7010
|
|
},
|
|
{
|
|
"entropy": 6.320837736129761,
|
|
"epoch": 0.8095787651471437,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004945479151889601,
|
|
"loss": 5.9999,
|
|
"mean_token_accuracy": 0.17752463966608048,
|
|
"num_tokens": 17758879.0,
|
|
"step": 7015
|
|
},
|
|
{
|
|
"entropy": 6.252843236923217,
|
|
"epoch": 0.8101557991921523,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004945388826330517,
|
|
"loss": 6.1388,
|
|
"mean_token_accuracy": 0.1744886964559555,
|
|
"num_tokens": 17770820.0,
|
|
"step": 7020
|
|
},
|
|
{
|
|
"entropy": 6.382633686065674,
|
|
"epoch": 0.8107328332371609,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004945298426930621,
|
|
"loss": 6.1936,
|
|
"mean_token_accuracy": 0.16758178621530534,
|
|
"num_tokens": 17783495.0,
|
|
"step": 7025
|
|
},
|
|
{
|
|
"entropy": 6.428963232040405,
|
|
"epoch": 0.8113098672821697,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004945207953692952,
|
|
"loss": 6.1614,
|
|
"mean_token_accuracy": 0.1685134768486023,
|
|
"num_tokens": 17795780.0,
|
|
"step": 7030
|
|
},
|
|
{
|
|
"entropy": 6.311816883087158,
|
|
"epoch": 0.8118869013271783,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004945117406620556,
|
|
"loss": 6.1866,
|
|
"mean_token_accuracy": 0.1712436020374298,
|
|
"num_tokens": 17809684.0,
|
|
"step": 7035
|
|
},
|
|
{
|
|
"entropy": 6.322688293457031,
|
|
"epoch": 0.812463935372187,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004945026785716474,
|
|
"loss": 6.1805,
|
|
"mean_token_accuracy": 0.16512720435857772,
|
|
"num_tokens": 17822719.0,
|
|
"step": 7040
|
|
},
|
|
{
|
|
"entropy": 6.381142044067383,
|
|
"epoch": 0.8130409694171956,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004944936090983757,
|
|
"loss": 6.2109,
|
|
"mean_token_accuracy": 0.16516452431678771,
|
|
"num_tokens": 17834883.0,
|
|
"step": 7045
|
|
},
|
|
{
|
|
"entropy": 6.307264518737793,
|
|
"epoch": 0.8136180034622043,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004944845322425455,
|
|
"loss": 6.1272,
|
|
"mean_token_accuracy": 0.1770351156592369,
|
|
"num_tokens": 17847009.0,
|
|
"step": 7050
|
|
},
|
|
{
|
|
"entropy": 6.375383043289185,
|
|
"epoch": 0.8141950375072129,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004944754480044621,
|
|
"loss": 6.152,
|
|
"mean_token_accuracy": 0.1666557177901268,
|
|
"num_tokens": 17859106.0,
|
|
"step": 7055
|
|
},
|
|
{
|
|
"entropy": 6.412518787384033,
|
|
"epoch": 0.8147720715522215,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004944663563844311,
|
|
"loss": 6.1608,
|
|
"mean_token_accuracy": 0.16627125889062883,
|
|
"num_tokens": 17871418.0,
|
|
"step": 7060
|
|
},
|
|
{
|
|
"entropy": 6.2879682064056395,
|
|
"epoch": 0.8153491055972303,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0004944572573827581,
|
|
"loss": 6.1249,
|
|
"mean_token_accuracy": 0.17137539982795716,
|
|
"num_tokens": 17884219.0,
|
|
"step": 7065
|
|
},
|
|
{
|
|
"entropy": 6.307466506958008,
|
|
"epoch": 0.8159261396422389,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004944481509997494,
|
|
"loss": 6.131,
|
|
"mean_token_accuracy": 0.1689067393541336,
|
|
"num_tokens": 17896206.0,
|
|
"step": 7070
|
|
},
|
|
{
|
|
"entropy": 6.3939979553222654,
|
|
"epoch": 0.8165031736872476,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.000494439037235711,
|
|
"loss": 6.2326,
|
|
"mean_token_accuracy": 0.16438301056623458,
|
|
"num_tokens": 17909488.0,
|
|
"step": 7075
|
|
},
|
|
{
|
|
"entropy": 6.375418043136596,
|
|
"epoch": 0.8170802077322562,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004944299160909495,
|
|
"loss": 6.1777,
|
|
"mean_token_accuracy": 0.16011893153190612,
|
|
"num_tokens": 17922851.0,
|
|
"step": 7080
|
|
},
|
|
{
|
|
"entropy": 6.360374975204468,
|
|
"epoch": 0.8176572417772648,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000494420787565772,
|
|
"loss": 6.0912,
|
|
"mean_token_accuracy": 0.1776879087090492,
|
|
"num_tokens": 17934586.0,
|
|
"step": 7085
|
|
},
|
|
{
|
|
"entropy": 6.310594892501831,
|
|
"epoch": 0.8182342758222735,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004944116516604852,
|
|
"loss": 6.1938,
|
|
"mean_token_accuracy": 0.16266183257102967,
|
|
"num_tokens": 17947637.0,
|
|
"step": 7090
|
|
},
|
|
{
|
|
"entropy": 6.354241228103637,
|
|
"epoch": 0.8188113098672821,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004944025083753965,
|
|
"loss": 6.1478,
|
|
"mean_token_accuracy": 0.16983843892812728,
|
|
"num_tokens": 17959601.0,
|
|
"step": 7095
|
|
},
|
|
{
|
|
"entropy": 6.352024364471435,
|
|
"epoch": 0.8193883439122909,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004943933577108133,
|
|
"loss": 6.1451,
|
|
"mean_token_accuracy": 0.17091177701950072,
|
|
"num_tokens": 17972568.0,
|
|
"step": 7100
|
|
},
|
|
{
|
|
"entropy": 6.36655969619751,
|
|
"epoch": 0.8199653779572995,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004943841996670436,
|
|
"loss": 6.1432,
|
|
"mean_token_accuracy": 0.17002700716257096,
|
|
"num_tokens": 17984665.0,
|
|
"step": 7105
|
|
},
|
|
{
|
|
"entropy": 6.368354558944702,
|
|
"epoch": 0.8205424120023082,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004943750342443953,
|
|
"loss": 6.1736,
|
|
"mean_token_accuracy": 0.1608754187822342,
|
|
"num_tokens": 17997140.0,
|
|
"step": 7110
|
|
},
|
|
{
|
|
"entropy": 6.355606889724731,
|
|
"epoch": 0.8211194460473168,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004943658614431767,
|
|
"loss": 6.1686,
|
|
"mean_token_accuracy": 0.17113997787237167,
|
|
"num_tokens": 18009361.0,
|
|
"step": 7115
|
|
},
|
|
{
|
|
"entropy": 6.314159536361695,
|
|
"epoch": 0.8216964800923254,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004943566812636963,
|
|
"loss": 6.1279,
|
|
"mean_token_accuracy": 0.16654883027076722,
|
|
"num_tokens": 18021233.0,
|
|
"step": 7120
|
|
},
|
|
{
|
|
"entropy": 6.274408292770386,
|
|
"epoch": 0.8222735141373341,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.000494347493706263,
|
|
"loss": 5.995,
|
|
"mean_token_accuracy": 0.18178044259548187,
|
|
"num_tokens": 18034086.0,
|
|
"step": 7125
|
|
},
|
|
{
|
|
"entropy": 6.336907291412354,
|
|
"epoch": 0.8228505481823427,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004943382987711856,
|
|
"loss": 6.0874,
|
|
"mean_token_accuracy": 0.1737489327788353,
|
|
"num_tokens": 18046604.0,
|
|
"step": 7130
|
|
},
|
|
{
|
|
"entropy": 6.3122608184814455,
|
|
"epoch": 0.8234275822273515,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004943290964587734,
|
|
"loss": 6.1347,
|
|
"mean_token_accuracy": 0.17065211534500122,
|
|
"num_tokens": 18059185.0,
|
|
"step": 7135
|
|
},
|
|
{
|
|
"entropy": 6.315145111083984,
|
|
"epoch": 0.8240046162723601,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.0004943198867693361,
|
|
"loss": 6.0646,
|
|
"mean_token_accuracy": 0.16893559992313384,
|
|
"num_tokens": 18071707.0,
|
|
"step": 7140
|
|
},
|
|
{
|
|
"entropy": 6.3502250671386715,
|
|
"epoch": 0.8245816503173687,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004943106697031833,
|
|
"loss": 6.2012,
|
|
"mean_token_accuracy": 0.16397445499897004,
|
|
"num_tokens": 18084657.0,
|
|
"step": 7145
|
|
},
|
|
{
|
|
"entropy": 6.363767099380493,
|
|
"epoch": 0.8251586843623774,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004943014452606251,
|
|
"loss": 6.1819,
|
|
"mean_token_accuracy": 0.1693504735827446,
|
|
"num_tokens": 18097084.0,
|
|
"step": 7150
|
|
},
|
|
{
|
|
"entropy": 6.316252565383911,
|
|
"epoch": 0.825735718407386,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004942922134419717,
|
|
"loss": 6.1042,
|
|
"mean_token_accuracy": 0.1739456221461296,
|
|
"num_tokens": 18109306.0,
|
|
"step": 7155
|
|
},
|
|
{
|
|
"entropy": 6.270631885528564,
|
|
"epoch": 0.8263127524523947,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004942829742475336,
|
|
"loss": 6.0179,
|
|
"mean_token_accuracy": 0.1746932238340378,
|
|
"num_tokens": 18120300.0,
|
|
"step": 7160
|
|
},
|
|
{
|
|
"entropy": 6.370210361480713,
|
|
"epoch": 0.8268897864974033,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004942737276776217,
|
|
"loss": 6.1463,
|
|
"mean_token_accuracy": 0.16830987781286239,
|
|
"num_tokens": 18132251.0,
|
|
"step": 7165
|
|
},
|
|
{
|
|
"entropy": 6.304517507553101,
|
|
"epoch": 0.827466820542412,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004942644737325468,
|
|
"loss": 6.0868,
|
|
"mean_token_accuracy": 0.17027855664491653,
|
|
"num_tokens": 18146198.0,
|
|
"step": 7170
|
|
},
|
|
{
|
|
"entropy": 6.336374759674072,
|
|
"epoch": 0.8280438545874207,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004942552124126202,
|
|
"loss": 6.1675,
|
|
"mean_token_accuracy": 0.16987940073013305,
|
|
"num_tokens": 18159493.0,
|
|
"step": 7175
|
|
},
|
|
{
|
|
"entropy": 6.277276945114136,
|
|
"epoch": 0.8286208886324293,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004942459437181535,
|
|
"loss": 6.0566,
|
|
"mean_token_accuracy": 0.17661636918783188,
|
|
"num_tokens": 18172120.0,
|
|
"step": 7180
|
|
},
|
|
{
|
|
"entropy": 6.330974435806274,
|
|
"epoch": 0.829197922677438,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004942366676494584,
|
|
"loss": 6.0871,
|
|
"mean_token_accuracy": 0.17477403432130814,
|
|
"num_tokens": 18184704.0,
|
|
"step": 7185
|
|
},
|
|
{
|
|
"entropy": 6.365555334091186,
|
|
"epoch": 0.8297749567224466,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004942273842068469,
|
|
"loss": 6.2001,
|
|
"mean_token_accuracy": 0.16935209333896636,
|
|
"num_tokens": 18196770.0,
|
|
"step": 7190
|
|
},
|
|
{
|
|
"entropy": 6.337525033950806,
|
|
"epoch": 0.8303519907674553,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004942180933906311,
|
|
"loss": 6.1627,
|
|
"mean_token_accuracy": 0.1656957224011421,
|
|
"num_tokens": 18209987.0,
|
|
"step": 7195
|
|
},
|
|
{
|
|
"entropy": 6.353645181655883,
|
|
"epoch": 0.8309290248124639,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004942087952011237,
|
|
"loss": 6.1678,
|
|
"mean_token_accuracy": 0.16775988191366195,
|
|
"num_tokens": 18224864.0,
|
|
"step": 7200
|
|
},
|
|
{
|
|
"entropy": 6.3907112121582035,
|
|
"epoch": 0.8315060588574726,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004941994896386374,
|
|
"loss": 6.1344,
|
|
"mean_token_accuracy": 0.17219291627407074,
|
|
"num_tokens": 18237270.0,
|
|
"step": 7205
|
|
},
|
|
{
|
|
"entropy": 6.274297666549683,
|
|
"epoch": 0.8320830929024813,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004941901767034851,
|
|
"loss": 6.1408,
|
|
"mean_token_accuracy": 0.16556089669466018,
|
|
"num_tokens": 18251227.0,
|
|
"step": 7210
|
|
},
|
|
{
|
|
"entropy": 6.282907962799072,
|
|
"epoch": 0.8326601269474899,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004941808563959802,
|
|
"loss": 6.0705,
|
|
"mean_token_accuracy": 0.17843919098377228,
|
|
"num_tokens": 18264762.0,
|
|
"step": 7215
|
|
},
|
|
{
|
|
"entropy": 6.360298109054566,
|
|
"epoch": 0.8332371609924986,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004941715287164359,
|
|
"loss": 6.1437,
|
|
"mean_token_accuracy": 0.16581116169691085,
|
|
"num_tokens": 18276836.0,
|
|
"step": 7220
|
|
},
|
|
{
|
|
"entropy": 6.303939580917358,
|
|
"epoch": 0.8338141950375072,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004941621936651661,
|
|
"loss": 6.1484,
|
|
"mean_token_accuracy": 0.1756073772907257,
|
|
"num_tokens": 18290362.0,
|
|
"step": 7225
|
|
},
|
|
{
|
|
"entropy": 6.3812695980072025,
|
|
"epoch": 0.8343912290825158,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004941528512424849,
|
|
"loss": 6.1855,
|
|
"mean_token_accuracy": 0.1699386864900589,
|
|
"num_tokens": 18303924.0,
|
|
"step": 7230
|
|
},
|
|
{
|
|
"entropy": 6.256930303573609,
|
|
"epoch": 0.8349682631275245,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004941435014487064,
|
|
"loss": 6.0611,
|
|
"mean_token_accuracy": 0.17561491429805756,
|
|
"num_tokens": 18316490.0,
|
|
"step": 7235
|
|
},
|
|
{
|
|
"entropy": 6.353484201431274,
|
|
"epoch": 0.8355452971725332,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.000494134144284145,
|
|
"loss": 6.1025,
|
|
"mean_token_accuracy": 0.1660989746451378,
|
|
"num_tokens": 18328819.0,
|
|
"step": 7240
|
|
},
|
|
{
|
|
"entropy": 6.304037189483642,
|
|
"epoch": 0.8361223312175419,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004941247797491156,
|
|
"loss": 6.0602,
|
|
"mean_token_accuracy": 0.1737822934985161,
|
|
"num_tokens": 18341872.0,
|
|
"step": 7245
|
|
},
|
|
{
|
|
"entropy": 6.340513896942139,
|
|
"epoch": 0.8366993652625505,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004941154078439329,
|
|
"loss": 6.1038,
|
|
"mean_token_accuracy": 0.16772937178611755,
|
|
"num_tokens": 18354644.0,
|
|
"step": 7250
|
|
},
|
|
{
|
|
"entropy": 6.343120098114014,
|
|
"epoch": 0.8372763993075591,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004941060285689126,
|
|
"loss": 6.1118,
|
|
"mean_token_accuracy": 0.16333391666412353,
|
|
"num_tokens": 18367581.0,
|
|
"step": 7255
|
|
},
|
|
{
|
|
"entropy": 6.312895965576172,
|
|
"epoch": 0.8378534333525678,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004940966419243695,
|
|
"loss": 6.1211,
|
|
"mean_token_accuracy": 0.17633418142795562,
|
|
"num_tokens": 18381123.0,
|
|
"step": 7260
|
|
},
|
|
{
|
|
"entropy": 6.286964797973633,
|
|
"epoch": 0.8384304673975764,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.00049408724791062,
|
|
"loss": 6.0478,
|
|
"mean_token_accuracy": 0.17762214839458465,
|
|
"num_tokens": 18395711.0,
|
|
"step": 7265
|
|
},
|
|
{
|
|
"entropy": 6.341670942306519,
|
|
"epoch": 0.8390075014425851,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004940778465279797,
|
|
"loss": 6.182,
|
|
"mean_token_accuracy": 0.16106790006160737,
|
|
"num_tokens": 18409434.0,
|
|
"step": 7270
|
|
},
|
|
{
|
|
"entropy": 6.362900352478027,
|
|
"epoch": 0.8395845354875938,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004940684377767647,
|
|
"loss": 6.1384,
|
|
"mean_token_accuracy": 0.16549608409404754,
|
|
"num_tokens": 18423138.0,
|
|
"step": 7275
|
|
},
|
|
{
|
|
"entropy": 6.352203893661499,
|
|
"epoch": 0.8401615695326025,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004940590216572916,
|
|
"loss": 6.1294,
|
|
"mean_token_accuracy": 0.1653735965490341,
|
|
"num_tokens": 18435655.0,
|
|
"step": 7280
|
|
},
|
|
{
|
|
"entropy": 6.256585645675659,
|
|
"epoch": 0.8407386035776111,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004940495981698772,
|
|
"loss": 6.0172,
|
|
"mean_token_accuracy": 0.1793304905295372,
|
|
"num_tokens": 18448344.0,
|
|
"step": 7285
|
|
},
|
|
{
|
|
"entropy": 6.291251516342163,
|
|
"epoch": 0.8413156376226197,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004940401673148384,
|
|
"loss": 6.0295,
|
|
"mean_token_accuracy": 0.1761486664414406,
|
|
"num_tokens": 18460409.0,
|
|
"step": 7290
|
|
},
|
|
{
|
|
"entropy": 6.3027403354644775,
|
|
"epoch": 0.8418926716676284,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004940307290924923,
|
|
"loss": 6.1387,
|
|
"mean_token_accuracy": 0.16713238060474395,
|
|
"num_tokens": 18473650.0,
|
|
"step": 7295
|
|
},
|
|
{
|
|
"entropy": 6.2306482791900635,
|
|
"epoch": 0.842469705712637,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004940212835031565,
|
|
"loss": 6.0544,
|
|
"mean_token_accuracy": 0.17755862772464753,
|
|
"num_tokens": 18487108.0,
|
|
"step": 7300
|
|
},
|
|
{
|
|
"entropy": 6.340290069580078,
|
|
"epoch": 0.8430467397576457,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004940118305471486,
|
|
"loss": 6.0866,
|
|
"mean_token_accuracy": 0.17275313138961793,
|
|
"num_tokens": 18500377.0,
|
|
"step": 7305
|
|
},
|
|
{
|
|
"entropy": 6.35522575378418,
|
|
"epoch": 0.8436237738026544,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004940023702247866,
|
|
"loss": 6.151,
|
|
"mean_token_accuracy": 0.16355671882629394,
|
|
"num_tokens": 18513257.0,
|
|
"step": 7310
|
|
},
|
|
{
|
|
"entropy": 6.301067304611206,
|
|
"epoch": 0.844200807847663,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004939929025363886,
|
|
"loss": 6.1754,
|
|
"mean_token_accuracy": 0.16708555519580842,
|
|
"num_tokens": 18525438.0,
|
|
"step": 7315
|
|
},
|
|
{
|
|
"entropy": 6.382996892929077,
|
|
"epoch": 0.8447778418926717,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004939834274822731,
|
|
"loss": 6.1996,
|
|
"mean_token_accuracy": 0.16973353773355485,
|
|
"num_tokens": 18537937.0,
|
|
"step": 7320
|
|
},
|
|
{
|
|
"entropy": 6.446295928955078,
|
|
"epoch": 0.8453548759376803,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004939739450627588,
|
|
"loss": 6.2119,
|
|
"mean_token_accuracy": 0.1619974046945572,
|
|
"num_tokens": 18551629.0,
|
|
"step": 7325
|
|
},
|
|
{
|
|
"entropy": 6.287714242935181,
|
|
"epoch": 0.845931909982689,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004939644552781647,
|
|
"loss": 6.1511,
|
|
"mean_token_accuracy": 0.16715734750032424,
|
|
"num_tokens": 18564549.0,
|
|
"step": 7330
|
|
},
|
|
{
|
|
"entropy": 6.365425777435303,
|
|
"epoch": 0.8465089440276976,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004939549581288099,
|
|
"loss": 6.1246,
|
|
"mean_token_accuracy": 0.17667931765317918,
|
|
"num_tokens": 18576536.0,
|
|
"step": 7335
|
|
},
|
|
{
|
|
"entropy": 6.259944009780884,
|
|
"epoch": 0.8470859780727062,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004939454536150138,
|
|
"loss": 6.1022,
|
|
"mean_token_accuracy": 0.1768004596233368,
|
|
"num_tokens": 18588655.0,
|
|
"step": 7340
|
|
},
|
|
{
|
|
"entropy": 6.272363328933716,
|
|
"epoch": 0.847663012117715,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.000493935941737096,
|
|
"loss": 6.0528,
|
|
"mean_token_accuracy": 0.18020471781492234,
|
|
"num_tokens": 18602152.0,
|
|
"step": 7345
|
|
},
|
|
{
|
|
"entropy": 6.318509721755982,
|
|
"epoch": 0.8482400461627236,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004939264224953768,
|
|
"loss": 6.0656,
|
|
"mean_token_accuracy": 0.17690059542655945,
|
|
"num_tokens": 18615391.0,
|
|
"step": 7350
|
|
},
|
|
{
|
|
"entropy": 6.310171890258789,
|
|
"epoch": 0.8488170802077323,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.000493916895890176,
|
|
"loss": 6.1261,
|
|
"mean_token_accuracy": 0.16611895263195037,
|
|
"num_tokens": 18629987.0,
|
|
"step": 7355
|
|
},
|
|
{
|
|
"entropy": 6.41483244895935,
|
|
"epoch": 0.8493941142527409,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.000493907361921814,
|
|
"loss": 6.2245,
|
|
"mean_token_accuracy": 0.16478994786739348,
|
|
"num_tokens": 18643064.0,
|
|
"step": 7360
|
|
},
|
|
{
|
|
"entropy": 6.428786897659302,
|
|
"epoch": 0.8499711482977496,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004938978205906118,
|
|
"loss": 6.1505,
|
|
"mean_token_accuracy": 0.16683144271373748,
|
|
"num_tokens": 18654950.0,
|
|
"step": 7365
|
|
},
|
|
{
|
|
"entropy": 6.333185768127441,
|
|
"epoch": 0.8505481823427582,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004938882718968901,
|
|
"loss": 6.1116,
|
|
"mean_token_accuracy": 0.16756715178489684,
|
|
"num_tokens": 18666318.0,
|
|
"step": 7370
|
|
},
|
|
{
|
|
"entropy": 6.29099555015564,
|
|
"epoch": 0.8511252163877668,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004938787158409702,
|
|
"loss": 6.0553,
|
|
"mean_token_accuracy": 0.17675474882125855,
|
|
"num_tokens": 18677357.0,
|
|
"step": 7375
|
|
},
|
|
{
|
|
"entropy": 6.326018810272217,
|
|
"epoch": 0.8517022504327756,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004938691524231733,
|
|
"loss": 6.089,
|
|
"mean_token_accuracy": 0.17274203151464462,
|
|
"num_tokens": 18689563.0,
|
|
"step": 7380
|
|
},
|
|
{
|
|
"entropy": 6.243793678283692,
|
|
"epoch": 0.8522792844777842,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004938595816438212,
|
|
"loss": 6.0914,
|
|
"mean_token_accuracy": 0.17055510282516478,
|
|
"num_tokens": 18701442.0,
|
|
"step": 7385
|
|
},
|
|
{
|
|
"entropy": 6.345879173278808,
|
|
"epoch": 0.8528563185227929,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004938500035032358,
|
|
"loss": 6.1358,
|
|
"mean_token_accuracy": 0.16795708388090133,
|
|
"num_tokens": 18714942.0,
|
|
"step": 7390
|
|
},
|
|
{
|
|
"entropy": 6.301207065582275,
|
|
"epoch": 0.8534333525678015,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004938404180017392,
|
|
"loss": 6.1479,
|
|
"mean_token_accuracy": 0.17592194825410842,
|
|
"num_tokens": 18727752.0,
|
|
"step": 7395
|
|
},
|
|
{
|
|
"entropy": 6.375054931640625,
|
|
"epoch": 0.8540103866128101,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004938308251396539,
|
|
"loss": 6.1466,
|
|
"mean_token_accuracy": 0.1679084911942482,
|
|
"num_tokens": 18741719.0,
|
|
"step": 7400
|
|
},
|
|
{
|
|
"entropy": 6.36941819190979,
|
|
"epoch": 0.8545874206578188,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004938212249173024,
|
|
"loss": 6.1028,
|
|
"mean_token_accuracy": 0.16361988335847855,
|
|
"num_tokens": 18754472.0,
|
|
"step": 7405
|
|
},
|
|
{
|
|
"entropy": 6.340943050384522,
|
|
"epoch": 0.8551644547028274,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004938116173350078,
|
|
"loss": 6.1826,
|
|
"mean_token_accuracy": 0.17019001990556717,
|
|
"num_tokens": 18766691.0,
|
|
"step": 7410
|
|
},
|
|
{
|
|
"entropy": 6.338998222351075,
|
|
"epoch": 0.8557414887478362,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004938020023930932,
|
|
"loss": 6.1005,
|
|
"mean_token_accuracy": 0.17442042529582977,
|
|
"num_tokens": 18780083.0,
|
|
"step": 7415
|
|
},
|
|
{
|
|
"entropy": 6.400058031082153,
|
|
"epoch": 0.8563185227928448,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004937923800918817,
|
|
"loss": 6.1818,
|
|
"mean_token_accuracy": 0.16902839243412018,
|
|
"num_tokens": 18792559.0,
|
|
"step": 7420
|
|
},
|
|
{
|
|
"entropy": 6.251423120498657,
|
|
"epoch": 0.8568955568378535,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004937827504316974,
|
|
"loss": 6.0284,
|
|
"mean_token_accuracy": 0.18225133568048477,
|
|
"num_tokens": 18805089.0,
|
|
"step": 7425
|
|
},
|
|
{
|
|
"entropy": 6.211493444442749,
|
|
"epoch": 0.8574725908828621,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004937731134128639,
|
|
"loss": 6.0332,
|
|
"mean_token_accuracy": 0.1719786286354065,
|
|
"num_tokens": 18818476.0,
|
|
"step": 7430
|
|
},
|
|
{
|
|
"entropy": 6.3511707305908205,
|
|
"epoch": 0.8580496249278707,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004937634690357054,
|
|
"loss": 6.2004,
|
|
"mean_token_accuracy": 0.16616718769073485,
|
|
"num_tokens": 18830785.0,
|
|
"step": 7435
|
|
},
|
|
{
|
|
"entropy": 6.408740901947022,
|
|
"epoch": 0.8586266589728794,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004937538173005462,
|
|
"loss": 6.1835,
|
|
"mean_token_accuracy": 0.16461452692747117,
|
|
"num_tokens": 18844029.0,
|
|
"step": 7440
|
|
},
|
|
{
|
|
"entropy": 6.291387891769409,
|
|
"epoch": 0.859203693017888,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004937441582077111,
|
|
"loss": 6.1483,
|
|
"mean_token_accuracy": 0.17121766805648803,
|
|
"num_tokens": 18857468.0,
|
|
"step": 7445
|
|
},
|
|
{
|
|
"entropy": 6.330543279647827,
|
|
"epoch": 0.8597807270628968,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0004937344917575249,
|
|
"loss": 6.0788,
|
|
"mean_token_accuracy": 0.16908426731824874,
|
|
"num_tokens": 18870487.0,
|
|
"step": 7450
|
|
},
|
|
{
|
|
"entropy": 6.330011510848999,
|
|
"epoch": 0.8603577611079054,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004937248179503127,
|
|
"loss": 6.1243,
|
|
"mean_token_accuracy": 0.16731321513652803,
|
|
"num_tokens": 18883273.0,
|
|
"step": 7455
|
|
},
|
|
{
|
|
"entropy": 6.275924921035767,
|
|
"epoch": 0.860934795152914,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004937151367863998,
|
|
"loss": 6.1026,
|
|
"mean_token_accuracy": 0.1796159490942955,
|
|
"num_tokens": 18895863.0,
|
|
"step": 7460
|
|
},
|
|
{
|
|
"entropy": 6.320479679107666,
|
|
"epoch": 0.8615118291979227,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.000493705448266112,
|
|
"loss": 6.1605,
|
|
"mean_token_accuracy": 0.17161056995391846,
|
|
"num_tokens": 18909406.0,
|
|
"step": 7465
|
|
},
|
|
{
|
|
"entropy": 6.242699718475341,
|
|
"epoch": 0.8620888632429313,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004936957523897752,
|
|
"loss": 6.0972,
|
|
"mean_token_accuracy": 0.17375921010971068,
|
|
"num_tokens": 18922794.0,
|
|
"step": 7470
|
|
},
|
|
{
|
|
"entropy": 6.2935127258300785,
|
|
"epoch": 0.86266589728794,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004936860491577153,
|
|
"loss": 6.1127,
|
|
"mean_token_accuracy": 0.17393147498369216,
|
|
"num_tokens": 18936511.0,
|
|
"step": 7475
|
|
},
|
|
{
|
|
"entropy": 6.371639537811279,
|
|
"epoch": 0.8632429313329486,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004936763385702588,
|
|
"loss": 6.1866,
|
|
"mean_token_accuracy": 0.16243817955255507,
|
|
"num_tokens": 18948164.0,
|
|
"step": 7480
|
|
},
|
|
{
|
|
"entropy": 6.3689943790435795,
|
|
"epoch": 0.8638199653779572,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004936666206277322,
|
|
"loss": 6.1756,
|
|
"mean_token_accuracy": 0.16454965472221375,
|
|
"num_tokens": 18960608.0,
|
|
"step": 7485
|
|
},
|
|
{
|
|
"entropy": 6.296132802963257,
|
|
"epoch": 0.864396999422966,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004936568953304624,
|
|
"loss": 6.031,
|
|
"mean_token_accuracy": 0.18456006944179534,
|
|
"num_tokens": 18972266.0,
|
|
"step": 7490
|
|
},
|
|
{
|
|
"entropy": 6.284459924697876,
|
|
"epoch": 0.8649740334679746,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004936471626787766,
|
|
"loss": 6.0742,
|
|
"mean_token_accuracy": 0.17050421088933945,
|
|
"num_tokens": 18984518.0,
|
|
"step": 7495
|
|
},
|
|
{
|
|
"entropy": 6.2937500953674315,
|
|
"epoch": 0.8655510675129833,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004936374226730022,
|
|
"loss": 6.1031,
|
|
"mean_token_accuracy": 0.17538830041885375,
|
|
"num_tokens": 18998611.0,
|
|
"step": 7500
|
|
},
|
|
{
|
|
"entropy": 6.312690019607544,
|
|
"epoch": 0.8661281015579919,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004936276753134666,
|
|
"loss": 6.0866,
|
|
"mean_token_accuracy": 0.17135524600744248,
|
|
"num_tokens": 19012117.0,
|
|
"step": 7505
|
|
},
|
|
{
|
|
"entropy": 6.209308815002442,
|
|
"epoch": 0.8667051356030006,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004936179206004976,
|
|
"loss": 6.003,
|
|
"mean_token_accuracy": 0.1783718004822731,
|
|
"num_tokens": 19024075.0,
|
|
"step": 7510
|
|
},
|
|
{
|
|
"entropy": 6.337769603729248,
|
|
"epoch": 0.8672821696480092,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004936081585344236,
|
|
"loss": 6.1795,
|
|
"mean_token_accuracy": 0.16607438176870346,
|
|
"num_tokens": 19037350.0,
|
|
"step": 7515
|
|
},
|
|
{
|
|
"entropy": 6.41182656288147,
|
|
"epoch": 0.8678592036930178,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004935983891155727,
|
|
"loss": 6.1854,
|
|
"mean_token_accuracy": 0.1657259300351143,
|
|
"num_tokens": 19049438.0,
|
|
"step": 7520
|
|
},
|
|
{
|
|
"entropy": 6.26032190322876,
|
|
"epoch": 0.8684362377380266,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004935886123442737,
|
|
"loss": 6.139,
|
|
"mean_token_accuracy": 0.1676519051194191,
|
|
"num_tokens": 19061689.0,
|
|
"step": 7525
|
|
},
|
|
{
|
|
"entropy": 6.391968154907227,
|
|
"epoch": 0.8690132717830352,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004935788282208551,
|
|
"loss": 6.1892,
|
|
"mean_token_accuracy": 0.1616821691393852,
|
|
"num_tokens": 19075606.0,
|
|
"step": 7530
|
|
},
|
|
{
|
|
"entropy": 6.353225660324097,
|
|
"epoch": 0.8695903058280439,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004935690367456464,
|
|
"loss": 6.1027,
|
|
"mean_token_accuracy": 0.17230516970157622,
|
|
"num_tokens": 19088248.0,
|
|
"step": 7535
|
|
},
|
|
{
|
|
"entropy": 6.297004318237304,
|
|
"epoch": 0.8701673398730525,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004935592379189766,
|
|
"loss": 6.0805,
|
|
"mean_token_accuracy": 0.17194265127182007,
|
|
"num_tokens": 19102480.0,
|
|
"step": 7540
|
|
},
|
|
{
|
|
"entropy": 6.260242652893067,
|
|
"epoch": 0.8707443739180611,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004935494317411754,
|
|
"loss": 6.0698,
|
|
"mean_token_accuracy": 0.18137836903333665,
|
|
"num_tokens": 19114454.0,
|
|
"step": 7545
|
|
},
|
|
{
|
|
"entropy": 6.308724689483642,
|
|
"epoch": 0.8713214079630698,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004935396182125726,
|
|
"loss": 6.1046,
|
|
"mean_token_accuracy": 0.17647117376327515,
|
|
"num_tokens": 19126709.0,
|
|
"step": 7550
|
|
},
|
|
{
|
|
"entropy": 6.270776891708374,
|
|
"epoch": 0.8718984420080784,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004935297973334983,
|
|
"loss": 6.1159,
|
|
"mean_token_accuracy": 0.17235394865274428,
|
|
"num_tokens": 19138831.0,
|
|
"step": 7555
|
|
},
|
|
{
|
|
"entropy": 6.326720905303955,
|
|
"epoch": 0.8724754760530872,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004935199691042828,
|
|
"loss": 5.9959,
|
|
"mean_token_accuracy": 0.1755734920501709,
|
|
"num_tokens": 19151555.0,
|
|
"step": 7560
|
|
},
|
|
{
|
|
"entropy": 6.307219934463501,
|
|
"epoch": 0.8730525100980958,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004935101335252568,
|
|
"loss": 6.0574,
|
|
"mean_token_accuracy": 0.17710819989442825,
|
|
"num_tokens": 19164557.0,
|
|
"step": 7565
|
|
},
|
|
{
|
|
"entropy": 6.3488623142242435,
|
|
"epoch": 0.8736295441431045,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004935002905967509,
|
|
"loss": 6.1943,
|
|
"mean_token_accuracy": 0.1654577985405922,
|
|
"num_tokens": 19177081.0,
|
|
"step": 7570
|
|
},
|
|
{
|
|
"entropy": 6.294558429718018,
|
|
"epoch": 0.8742065781881131,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004934904403190963,
|
|
"loss": 6.0486,
|
|
"mean_token_accuracy": 0.17522133886814117,
|
|
"num_tokens": 19190209.0,
|
|
"step": 7575
|
|
},
|
|
{
|
|
"entropy": 6.328292036056519,
|
|
"epoch": 0.8747836122331217,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004934805826926242,
|
|
"loss": 6.097,
|
|
"mean_token_accuracy": 0.1691294565796852,
|
|
"num_tokens": 19202262.0,
|
|
"step": 7580
|
|
},
|
|
{
|
|
"entropy": 6.295896530151367,
|
|
"epoch": 0.8753606462781304,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004934707177176663,
|
|
"loss": 6.1196,
|
|
"mean_token_accuracy": 0.17082754224538804,
|
|
"num_tokens": 19214752.0,
|
|
"step": 7585
|
|
},
|
|
{
|
|
"entropy": 6.347747945785523,
|
|
"epoch": 0.875937680323139,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004934608453945543,
|
|
"loss": 6.1597,
|
|
"mean_token_accuracy": 0.16672886908054352,
|
|
"num_tokens": 19227320.0,
|
|
"step": 7590
|
|
},
|
|
{
|
|
"entropy": 6.350468921661377,
|
|
"epoch": 0.8765147143681478,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004934509657236203,
|
|
"loss": 6.1475,
|
|
"mean_token_accuracy": 0.16858987361192704,
|
|
"num_tokens": 19239571.0,
|
|
"step": 7595
|
|
},
|
|
{
|
|
"entropy": 6.335233497619629,
|
|
"epoch": 0.8770917484131564,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004934410787051965,
|
|
"loss": 6.0903,
|
|
"mean_token_accuracy": 0.1747870922088623,
|
|
"num_tokens": 19252242.0,
|
|
"step": 7600
|
|
},
|
|
{
|
|
"entropy": 6.353438425064087,
|
|
"epoch": 0.877668782458165,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004934311843396157,
|
|
"loss": 6.1536,
|
|
"mean_token_accuracy": 0.16885416358709335,
|
|
"num_tokens": 19265501.0,
|
|
"step": 7605
|
|
},
|
|
{
|
|
"entropy": 6.254431247711182,
|
|
"epoch": 0.8782458165031737,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004934212826272104,
|
|
"loss": 6.0048,
|
|
"mean_token_accuracy": 0.18254768401384353,
|
|
"num_tokens": 19278152.0,
|
|
"step": 7610
|
|
},
|
|
{
|
|
"entropy": 6.249722099304199,
|
|
"epoch": 0.8788228505481823,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004934113735683137,
|
|
"loss": 6.1195,
|
|
"mean_token_accuracy": 0.1660146526992321,
|
|
"num_tokens": 19290555.0,
|
|
"step": 7615
|
|
},
|
|
{
|
|
"entropy": 6.320179605484009,
|
|
"epoch": 0.879399884593191,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.000493401457163259,
|
|
"loss": 6.0742,
|
|
"mean_token_accuracy": 0.17674531638622284,
|
|
"num_tokens": 19302866.0,
|
|
"step": 7620
|
|
},
|
|
{
|
|
"entropy": 6.364961194992065,
|
|
"epoch": 0.8799769186381996,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004933915334123798,
|
|
"loss": 6.1585,
|
|
"mean_token_accuracy": 0.16327778846025467,
|
|
"num_tokens": 19315577.0,
|
|
"step": 7625
|
|
},
|
|
{
|
|
"entropy": 6.353976726531982,
|
|
"epoch": 0.8805539526832084,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004933816023160099,
|
|
"loss": 6.1489,
|
|
"mean_token_accuracy": 0.16975017488002778,
|
|
"num_tokens": 19328593.0,
|
|
"step": 7630
|
|
},
|
|
{
|
|
"entropy": 6.3438011646270756,
|
|
"epoch": 0.881130986728217,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004933716638744832,
|
|
"loss": 6.1096,
|
|
"mean_token_accuracy": 0.17835207879543305,
|
|
"num_tokens": 19341669.0,
|
|
"step": 7635
|
|
},
|
|
{
|
|
"entropy": 6.283733320236206,
|
|
"epoch": 0.8817080207732256,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.000493361718088134,
|
|
"loss": 6.0937,
|
|
"mean_token_accuracy": 0.17275342345237732,
|
|
"num_tokens": 19354268.0,
|
|
"step": 7640
|
|
},
|
|
{
|
|
"entropy": 6.345350837707519,
|
|
"epoch": 0.8822850548182343,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.000493351764957297,
|
|
"loss": 6.1448,
|
|
"mean_token_accuracy": 0.16772449910640716,
|
|
"num_tokens": 19367676.0,
|
|
"step": 7645
|
|
},
|
|
{
|
|
"entropy": 6.375120687484741,
|
|
"epoch": 0.8828620888632429,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004933418044823068,
|
|
"loss": 6.0982,
|
|
"mean_token_accuracy": 0.17239805161952973,
|
|
"num_tokens": 19380726.0,
|
|
"step": 7650
|
|
},
|
|
{
|
|
"entropy": 6.311630487442017,
|
|
"epoch": 0.8834391229082516,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004933318366634984,
|
|
"loss": 6.1146,
|
|
"mean_token_accuracy": 0.16780938059091569,
|
|
"num_tokens": 19392917.0,
|
|
"step": 7655
|
|
},
|
|
{
|
|
"entropy": 6.36509075164795,
|
|
"epoch": 0.8840161569532602,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004933218615012072,
|
|
"loss": 6.1418,
|
|
"mean_token_accuracy": 0.17104663252830504,
|
|
"num_tokens": 19406026.0,
|
|
"step": 7660
|
|
},
|
|
{
|
|
"entropy": 6.322006559371948,
|
|
"epoch": 0.8845931909982689,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004933118789957687,
|
|
"loss": 6.1075,
|
|
"mean_token_accuracy": 0.17266625314950942,
|
|
"num_tokens": 19418612.0,
|
|
"step": 7665
|
|
},
|
|
{
|
|
"entropy": 6.3031665802001955,
|
|
"epoch": 0.8851702250432776,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004933018891475186,
|
|
"loss": 6.1445,
|
|
"mean_token_accuracy": 0.16820344775915147,
|
|
"num_tokens": 19430746.0,
|
|
"step": 7670
|
|
},
|
|
{
|
|
"entropy": 6.3470458984375,
|
|
"epoch": 0.8857472590882862,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004932918919567927,
|
|
"loss": 6.1882,
|
|
"mean_token_accuracy": 0.16353080421686172,
|
|
"num_tokens": 19443043.0,
|
|
"step": 7675
|
|
},
|
|
{
|
|
"entropy": 6.37825984954834,
|
|
"epoch": 0.8863242931332949,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0004932818874239275,
|
|
"loss": 6.1202,
|
|
"mean_token_accuracy": 0.1737432137131691,
|
|
"num_tokens": 19456463.0,
|
|
"step": 7680
|
|
},
|
|
{
|
|
"entropy": 6.364214897155762,
|
|
"epoch": 0.8869013271783035,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004932718755492595,
|
|
"loss": 6.1201,
|
|
"mean_token_accuracy": 0.1649479940533638,
|
|
"num_tokens": 19468108.0,
|
|
"step": 7685
|
|
},
|
|
{
|
|
"entropy": 6.3020881652832035,
|
|
"epoch": 0.8874783612233121,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004932618563331254,
|
|
"loss": 6.1433,
|
|
"mean_token_accuracy": 0.16941626369953156,
|
|
"num_tokens": 19480741.0,
|
|
"step": 7690
|
|
},
|
|
{
|
|
"entropy": 6.326077938079834,
|
|
"epoch": 0.8880553952683208,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004932518297758622,
|
|
"loss": 6.076,
|
|
"mean_token_accuracy": 0.17261420786380768,
|
|
"num_tokens": 19492996.0,
|
|
"step": 7695
|
|
},
|
|
{
|
|
"entropy": 6.355397272109985,
|
|
"epoch": 0.8886324293133295,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004932417958778071,
|
|
"loss": 6.0986,
|
|
"mean_token_accuracy": 0.17076902687549592,
|
|
"num_tokens": 19505513.0,
|
|
"step": 7700
|
|
},
|
|
{
|
|
"entropy": 6.336492681503296,
|
|
"epoch": 0.8892094633583382,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004932317546392976,
|
|
"loss": 6.21,
|
|
"mean_token_accuracy": 0.16580649316310883,
|
|
"num_tokens": 19518244.0,
|
|
"step": 7705
|
|
},
|
|
{
|
|
"entropy": 6.319612598419189,
|
|
"epoch": 0.8897864974033468,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004932217060606714,
|
|
"loss": 6.1084,
|
|
"mean_token_accuracy": 0.17041295915842056,
|
|
"num_tokens": 19530987.0,
|
|
"step": 7710
|
|
},
|
|
{
|
|
"entropy": 6.298898792266845,
|
|
"epoch": 0.8903635314483554,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004932116501422665,
|
|
"loss": 6.0194,
|
|
"mean_token_accuracy": 0.17620886564254762,
|
|
"num_tokens": 19543546.0,
|
|
"step": 7715
|
|
},
|
|
{
|
|
"entropy": 6.3706581592559814,
|
|
"epoch": 0.8909405654933641,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004932015868844211,
|
|
"loss": 6.1005,
|
|
"mean_token_accuracy": 0.16944789588451387,
|
|
"num_tokens": 19556867.0,
|
|
"step": 7720
|
|
},
|
|
{
|
|
"entropy": 6.28508243560791,
|
|
"epoch": 0.8915175995383727,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004931915162874738,
|
|
"loss": 6.0956,
|
|
"mean_token_accuracy": 0.1710782304406166,
|
|
"num_tokens": 19569738.0,
|
|
"step": 7725
|
|
},
|
|
{
|
|
"entropy": 6.323682594299316,
|
|
"epoch": 0.8920946335833814,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004931814383517632,
|
|
"loss": 6.1219,
|
|
"mean_token_accuracy": 0.1682348594069481,
|
|
"num_tokens": 19581701.0,
|
|
"step": 7730
|
|
},
|
|
{
|
|
"entropy": 6.300376987457275,
|
|
"epoch": 0.8926716676283901,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004931713530776284,
|
|
"loss": 6.0451,
|
|
"mean_token_accuracy": 0.1782558888196945,
|
|
"num_tokens": 19593698.0,
|
|
"step": 7735
|
|
},
|
|
{
|
|
"entropy": 6.293739461898804,
|
|
"epoch": 0.8932487016733988,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004931612604654083,
|
|
"loss": 6.111,
|
|
"mean_token_accuracy": 0.17010954022407532,
|
|
"num_tokens": 19605323.0,
|
|
"step": 7740
|
|
},
|
|
{
|
|
"entropy": 6.367745971679687,
|
|
"epoch": 0.8938257357184074,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004931511605154428,
|
|
"loss": 6.149,
|
|
"mean_token_accuracy": 0.16876049041748048,
|
|
"num_tokens": 19616577.0,
|
|
"step": 7745
|
|
},
|
|
{
|
|
"entropy": 6.328808069229126,
|
|
"epoch": 0.894402769763416,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004931410532280711,
|
|
"loss": 6.0588,
|
|
"mean_token_accuracy": 0.17267925143241883,
|
|
"num_tokens": 19629177.0,
|
|
"step": 7750
|
|
},
|
|
{
|
|
"entropy": 6.28749303817749,
|
|
"epoch": 0.8949798038084247,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004931309386036337,
|
|
"loss": 6.0895,
|
|
"mean_token_accuracy": 0.16957223564386367,
|
|
"num_tokens": 19642170.0,
|
|
"step": 7755
|
|
},
|
|
{
|
|
"entropy": 6.2514848709106445,
|
|
"epoch": 0.8955568378534333,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004931208166424704,
|
|
"loss": 6.0435,
|
|
"mean_token_accuracy": 0.17608153969049453,
|
|
"num_tokens": 19655648.0,
|
|
"step": 7760
|
|
},
|
|
{
|
|
"entropy": 6.278182458877564,
|
|
"epoch": 0.896133871898442,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0004931106873449219,
|
|
"loss": 6.0284,
|
|
"mean_token_accuracy": 0.17348928600549698,
|
|
"num_tokens": 19667941.0,
|
|
"step": 7765
|
|
},
|
|
{
|
|
"entropy": 6.33781328201294,
|
|
"epoch": 0.8967109059434507,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004931005507113285,
|
|
"loss": 6.1276,
|
|
"mean_token_accuracy": 0.17680104076862335,
|
|
"num_tokens": 19680523.0,
|
|
"step": 7770
|
|
},
|
|
{
|
|
"entropy": 6.186305379867553,
|
|
"epoch": 0.8972879399884593,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004930904067420317,
|
|
"loss": 6.0853,
|
|
"mean_token_accuracy": 0.17290082722902297,
|
|
"num_tokens": 19692984.0,
|
|
"step": 7775
|
|
},
|
|
{
|
|
"entropy": 6.357298135757446,
|
|
"epoch": 0.897864974033468,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004930802554373723,
|
|
"loss": 6.0333,
|
|
"mean_token_accuracy": 0.17422391027212142,
|
|
"num_tokens": 19705926.0,
|
|
"step": 7780
|
|
},
|
|
{
|
|
"entropy": 6.330864429473877,
|
|
"epoch": 0.8984420080784766,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004930700967976918,
|
|
"loss": 6.1001,
|
|
"mean_token_accuracy": 0.17609639912843705,
|
|
"num_tokens": 19717322.0,
|
|
"step": 7785
|
|
},
|
|
{
|
|
"entropy": 6.271629285812378,
|
|
"epoch": 0.8990190421234853,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.000493059930823332,
|
|
"loss": 6.1051,
|
|
"mean_token_accuracy": 0.1606309935450554,
|
|
"num_tokens": 19730577.0,
|
|
"step": 7790
|
|
},
|
|
{
|
|
"entropy": 6.341148757934571,
|
|
"epoch": 0.8995960761684939,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004930497575146346,
|
|
"loss": 6.1059,
|
|
"mean_token_accuracy": 0.17063196897506713,
|
|
"num_tokens": 19744054.0,
|
|
"step": 7795
|
|
},
|
|
{
|
|
"entropy": 6.293493986129761,
|
|
"epoch": 0.9001731102135025,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004930395768719421,
|
|
"loss": 6.1121,
|
|
"mean_token_accuracy": 0.16904201358556747,
|
|
"num_tokens": 19755898.0,
|
|
"step": 7800
|
|
},
|
|
{
|
|
"entropy": 6.325391483306885,
|
|
"epoch": 0.9007501442585113,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0004930293888955966,
|
|
"loss": 6.1668,
|
|
"mean_token_accuracy": 0.1650414600968361,
|
|
"num_tokens": 19769599.0,
|
|
"step": 7805
|
|
},
|
|
{
|
|
"entropy": 6.402347612380981,
|
|
"epoch": 0.9013271783035199,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.000493019193585941,
|
|
"loss": 6.1494,
|
|
"mean_token_accuracy": 0.16273540258407593,
|
|
"num_tokens": 19783442.0,
|
|
"step": 7810
|
|
},
|
|
{
|
|
"entropy": 6.3388293266296385,
|
|
"epoch": 0.9019042123485286,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000493008990943318,
|
|
"loss": 6.1781,
|
|
"mean_token_accuracy": 0.16862280368804933,
|
|
"num_tokens": 19796039.0,
|
|
"step": 7815
|
|
},
|
|
{
|
|
"entropy": 6.331880807876587,
|
|
"epoch": 0.9024812463935372,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004929987809680709,
|
|
"loss": 6.1204,
|
|
"mean_token_accuracy": 0.17673451751470565,
|
|
"num_tokens": 19808695.0,
|
|
"step": 7820
|
|
},
|
|
{
|
|
"entropy": 6.3146881580352785,
|
|
"epoch": 0.9030582804385459,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004929885636605432,
|
|
"loss": 6.0867,
|
|
"mean_token_accuracy": 0.17208350598812103,
|
|
"num_tokens": 19821173.0,
|
|
"step": 7825
|
|
},
|
|
{
|
|
"entropy": 6.29907455444336,
|
|
"epoch": 0.9036353144835545,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004929783390210784,
|
|
"loss": 6.1543,
|
|
"mean_token_accuracy": 0.1662888213992119,
|
|
"num_tokens": 19833804.0,
|
|
"step": 7830
|
|
},
|
|
{
|
|
"entropy": 6.392211389541626,
|
|
"epoch": 0.9042123485285631,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004929681070500204,
|
|
"loss": 6.093,
|
|
"mean_token_accuracy": 0.16855536997318268,
|
|
"num_tokens": 19845690.0,
|
|
"step": 7835
|
|
},
|
|
{
|
|
"entropy": 6.29790940284729,
|
|
"epoch": 0.9047893825735719,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004929578677477135,
|
|
"loss": 6.1018,
|
|
"mean_token_accuracy": 0.16329824179410934,
|
|
"num_tokens": 19859463.0,
|
|
"step": 7840
|
|
},
|
|
{
|
|
"entropy": 6.232066822052002,
|
|
"epoch": 0.9053664166185805,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004929476211145019,
|
|
"loss": 5.9956,
|
|
"mean_token_accuracy": 0.1839672550559044,
|
|
"num_tokens": 19872168.0,
|
|
"step": 7845
|
|
},
|
|
{
|
|
"entropy": 6.315573358535767,
|
|
"epoch": 0.9059434506635892,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004929373671507303,
|
|
"loss": 6.077,
|
|
"mean_token_accuracy": 0.1776381567120552,
|
|
"num_tokens": 19884927.0,
|
|
"step": 7850
|
|
},
|
|
{
|
|
"entropy": 6.283964967727661,
|
|
"epoch": 0.9065204847085978,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004929271058567436,
|
|
"loss": 6.0684,
|
|
"mean_token_accuracy": 0.17240298688411712,
|
|
"num_tokens": 19897105.0,
|
|
"step": 7855
|
|
},
|
|
{
|
|
"entropy": 6.282452011108399,
|
|
"epoch": 0.9070975187536064,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.000492916837232887,
|
|
"loss": 6.0928,
|
|
"mean_token_accuracy": 0.1691648006439209,
|
|
"num_tokens": 19909973.0,
|
|
"step": 7860
|
|
},
|
|
{
|
|
"entropy": 6.319969892501831,
|
|
"epoch": 0.9076745527986151,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004929065612795058,
|
|
"loss": 6.0996,
|
|
"mean_token_accuracy": 0.1771798312664032,
|
|
"num_tokens": 19923674.0,
|
|
"step": 7865
|
|
},
|
|
{
|
|
"entropy": 6.378555679321289,
|
|
"epoch": 0.9082515868436237,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004928962779969456,
|
|
"loss": 6.1113,
|
|
"mean_token_accuracy": 0.16915464848279954,
|
|
"num_tokens": 19935742.0,
|
|
"step": 7870
|
|
},
|
|
{
|
|
"entropy": 6.290113019943237,
|
|
"epoch": 0.9088286208886325,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004928859873855524,
|
|
"loss": 6.0995,
|
|
"mean_token_accuracy": 0.16852633357048036,
|
|
"num_tokens": 19947945.0,
|
|
"step": 7875
|
|
},
|
|
{
|
|
"entropy": 6.3777001857757565,
|
|
"epoch": 0.9094056549336411,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004928756894456723,
|
|
"loss": 6.0505,
|
|
"mean_token_accuracy": 0.1752867430448532,
|
|
"num_tokens": 19961275.0,
|
|
"step": 7880
|
|
},
|
|
{
|
|
"entropy": 6.3458672046661375,
|
|
"epoch": 0.9099826889786498,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004928653841776515,
|
|
"loss": 6.1244,
|
|
"mean_token_accuracy": 0.16841503977775574,
|
|
"num_tokens": 19973634.0,
|
|
"step": 7885
|
|
},
|
|
{
|
|
"entropy": 6.317721605300903,
|
|
"epoch": 0.9105597230236584,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004928550715818368,
|
|
"loss": 6.1288,
|
|
"mean_token_accuracy": 0.17065613716840744,
|
|
"num_tokens": 19985920.0,
|
|
"step": 7890
|
|
},
|
|
{
|
|
"entropy": 6.338268184661866,
|
|
"epoch": 0.911136757068667,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004928447516585749,
|
|
"loss": 6.1363,
|
|
"mean_token_accuracy": 0.16494126617908478,
|
|
"num_tokens": 19999081.0,
|
|
"step": 7895
|
|
},
|
|
{
|
|
"entropy": 6.207415676116943,
|
|
"epoch": 0.9117137911136757,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.000492834424408213,
|
|
"loss": 6.0687,
|
|
"mean_token_accuracy": 0.1764218255877495,
|
|
"num_tokens": 20012801.0,
|
|
"step": 7900
|
|
},
|
|
{
|
|
"entropy": 6.397945928573608,
|
|
"epoch": 0.9122908251586843,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004928240898310984,
|
|
"loss": 6.1504,
|
|
"mean_token_accuracy": 0.16762229204177856,
|
|
"num_tokens": 20024618.0,
|
|
"step": 7905
|
|
},
|
|
{
|
|
"entropy": 6.352006244659424,
|
|
"epoch": 0.9128678592036931,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004928137479275789,
|
|
"loss": 6.1202,
|
|
"mean_token_accuracy": 0.1704690560698509,
|
|
"num_tokens": 20038587.0,
|
|
"step": 7910
|
|
},
|
|
{
|
|
"entropy": 6.303599882125854,
|
|
"epoch": 0.9134448932487017,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.000492803398698002,
|
|
"loss": 6.1108,
|
|
"mean_token_accuracy": 0.16644177809357644,
|
|
"num_tokens": 20051811.0,
|
|
"step": 7915
|
|
},
|
|
{
|
|
"entropy": 6.360376930236816,
|
|
"epoch": 0.9140219272937103,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004927930421427161,
|
|
"loss": 6.1152,
|
|
"mean_token_accuracy": 0.16769687086343765,
|
|
"num_tokens": 20064463.0,
|
|
"step": 7920
|
|
},
|
|
{
|
|
"entropy": 6.255197620391845,
|
|
"epoch": 0.914598961338719,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004927826782620694,
|
|
"loss": 6.1075,
|
|
"mean_token_accuracy": 0.16811060458421706,
|
|
"num_tokens": 20076614.0,
|
|
"step": 7925
|
|
},
|
|
{
|
|
"entropy": 6.415706443786621,
|
|
"epoch": 0.9151759953837276,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004927723070564104,
|
|
"loss": 6.1995,
|
|
"mean_token_accuracy": 0.16223038583993912,
|
|
"num_tokens": 20090395.0,
|
|
"step": 7930
|
|
},
|
|
{
|
|
"entropy": 6.371805334091187,
|
|
"epoch": 0.9157530294287363,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004927619285260881,
|
|
"loss": 6.1335,
|
|
"mean_token_accuracy": 0.16719916462898254,
|
|
"num_tokens": 20102736.0,
|
|
"step": 7935
|
|
},
|
|
{
|
|
"entropy": 6.344775104522705,
|
|
"epoch": 0.9163300634737449,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004927515426714515,
|
|
"loss": 6.1302,
|
|
"mean_token_accuracy": 0.1690652996301651,
|
|
"num_tokens": 20116516.0,
|
|
"step": 7940
|
|
},
|
|
{
|
|
"entropy": 6.320330667495727,
|
|
"epoch": 0.9169070975187537,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.00049274114949285,
|
|
"loss": 6.1174,
|
|
"mean_token_accuracy": 0.17018368244171142,
|
|
"num_tokens": 20128742.0,
|
|
"step": 7945
|
|
},
|
|
{
|
|
"entropy": 6.328971815109253,
|
|
"epoch": 0.9174841315637623,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.000492730748990633,
|
|
"loss": 6.078,
|
|
"mean_token_accuracy": 0.16928218305110931,
|
|
"num_tokens": 20140590.0,
|
|
"step": 7950
|
|
},
|
|
{
|
|
"entropy": 6.284335279464722,
|
|
"epoch": 0.9180611656087709,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004927203411651504,
|
|
"loss": 6.0797,
|
|
"mean_token_accuracy": 0.16228621900081636,
|
|
"num_tokens": 20153748.0,
|
|
"step": 7955
|
|
},
|
|
{
|
|
"entropy": 6.353853940963745,
|
|
"epoch": 0.9186381996537796,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004927099260167523,
|
|
"loss": 6.0904,
|
|
"mean_token_accuracy": 0.1736527130007744,
|
|
"num_tokens": 20167094.0,
|
|
"step": 7960
|
|
},
|
|
{
|
|
"entropy": 6.308283567428589,
|
|
"epoch": 0.9192152336987882,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004926995035457889,
|
|
"loss": 6.0619,
|
|
"mean_token_accuracy": 0.16892513036727905,
|
|
"num_tokens": 20180716.0,
|
|
"step": 7965
|
|
},
|
|
{
|
|
"entropy": 6.339779663085937,
|
|
"epoch": 0.9197922677437969,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000492689073752611,
|
|
"loss": 6.1033,
|
|
"mean_token_accuracy": 0.17131576538085938,
|
|
"num_tokens": 20192214.0,
|
|
"step": 7970
|
|
},
|
|
{
|
|
"entropy": 6.226183223724365,
|
|
"epoch": 0.9203693017888055,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004926786366375691,
|
|
"loss": 5.991,
|
|
"mean_token_accuracy": 0.17104701697826385,
|
|
"num_tokens": 20204789.0,
|
|
"step": 7975
|
|
},
|
|
{
|
|
"entropy": 6.316816425323486,
|
|
"epoch": 0.9209463358338142,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004926681922010145,
|
|
"loss": 6.095,
|
|
"mean_token_accuracy": 0.16920481026172637,
|
|
"num_tokens": 20217318.0,
|
|
"step": 7980
|
|
},
|
|
{
|
|
"entropy": 6.4085766792297365,
|
|
"epoch": 0.9215233698788229,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004926577404432982,
|
|
"loss": 6.0992,
|
|
"mean_token_accuracy": 0.16753261983394624,
|
|
"num_tokens": 20229757.0,
|
|
"step": 7985
|
|
},
|
|
{
|
|
"entropy": 6.276189374923706,
|
|
"epoch": 0.9221004039238315,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004926472813647721,
|
|
"loss": 6.1228,
|
|
"mean_token_accuracy": 0.1687633216381073,
|
|
"num_tokens": 20242042.0,
|
|
"step": 7990
|
|
},
|
|
{
|
|
"entropy": 6.2141529560089115,
|
|
"epoch": 0.9226774379688402,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004926368149657876,
|
|
"loss": 6.0106,
|
|
"mean_token_accuracy": 0.18093141317367553,
|
|
"num_tokens": 20255188.0,
|
|
"step": 7995
|
|
},
|
|
{
|
|
"entropy": 6.415900802612304,
|
|
"epoch": 0.9232544720138488,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004926263412466972,
|
|
"loss": 6.0902,
|
|
"mean_token_accuracy": 0.17318245768547058,
|
|
"num_tokens": 20267359.0,
|
|
"step": 8000
|
|
},
|
|
{
|
|
"entropy": 6.35699143409729,
|
|
"epoch": 0.9238315060588574,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004926158602078527,
|
|
"loss": 6.1837,
|
|
"mean_token_accuracy": 0.16548164188861847,
|
|
"num_tokens": 20280023.0,
|
|
"step": 8005
|
|
},
|
|
{
|
|
"entropy": 6.307455205917359,
|
|
"epoch": 0.9244085401038661,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004926053718496069,
|
|
"loss": 6.0779,
|
|
"mean_token_accuracy": 0.17290998697280885,
|
|
"num_tokens": 20293043.0,
|
|
"step": 8010
|
|
},
|
|
{
|
|
"entropy": 6.2883072853088375,
|
|
"epoch": 0.9249855741488748,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004925948761723126,
|
|
"loss": 6.0607,
|
|
"mean_token_accuracy": 0.16693697571754457,
|
|
"num_tokens": 20304929.0,
|
|
"step": 8015
|
|
},
|
|
{
|
|
"entropy": 6.302173900604248,
|
|
"epoch": 0.9255626081938835,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004925843731763226,
|
|
"loss": 6.067,
|
|
"mean_token_accuracy": 0.16893115490674973,
|
|
"num_tokens": 20317024.0,
|
|
"step": 8020
|
|
},
|
|
{
|
|
"entropy": 6.374800300598144,
|
|
"epoch": 0.9261396422388921,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004925738628619904,
|
|
"loss": 6.1205,
|
|
"mean_token_accuracy": 0.1658678874373436,
|
|
"num_tokens": 20329909.0,
|
|
"step": 8025
|
|
},
|
|
{
|
|
"entropy": 6.241035079956054,
|
|
"epoch": 0.9267166762839008,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004925633452296693,
|
|
"loss": 6.0841,
|
|
"mean_token_accuracy": 0.16910781860351562,
|
|
"num_tokens": 20344224.0,
|
|
"step": 8030
|
|
},
|
|
{
|
|
"entropy": 6.371493101119995,
|
|
"epoch": 0.9272937103289094,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004925528202797131,
|
|
"loss": 6.0854,
|
|
"mean_token_accuracy": 0.16615129262208939,
|
|
"num_tokens": 20357393.0,
|
|
"step": 8035
|
|
},
|
|
{
|
|
"entropy": 6.349489068984985,
|
|
"epoch": 0.927870744373918,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004925422880124761,
|
|
"loss": 6.1113,
|
|
"mean_token_accuracy": 0.16972048878669738,
|
|
"num_tokens": 20369551.0,
|
|
"step": 8040
|
|
},
|
|
{
|
|
"entropy": 6.298521709442139,
|
|
"epoch": 0.9284477784189267,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004925317484283121,
|
|
"loss": 6.2078,
|
|
"mean_token_accuracy": 0.16394488960504533,
|
|
"num_tokens": 20382639.0,
|
|
"step": 8045
|
|
},
|
|
{
|
|
"entropy": 6.349614477157592,
|
|
"epoch": 0.9290248124639354,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004925212015275758,
|
|
"loss": 6.0278,
|
|
"mean_token_accuracy": 0.178650863468647,
|
|
"num_tokens": 20394751.0,
|
|
"step": 8050
|
|
},
|
|
{
|
|
"entropy": 6.232526731491089,
|
|
"epoch": 0.9296018465089441,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.000492510647310622,
|
|
"loss": 6.0768,
|
|
"mean_token_accuracy": 0.17546522319316865,
|
|
"num_tokens": 20408235.0,
|
|
"step": 8055
|
|
},
|
|
{
|
|
"entropy": 6.31773829460144,
|
|
"epoch": 0.9301788805539527,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004925000857778055,
|
|
"loss": 6.1095,
|
|
"mean_token_accuracy": 0.169540336728096,
|
|
"num_tokens": 20423063.0,
|
|
"step": 8060
|
|
},
|
|
{
|
|
"entropy": 6.342768430709839,
|
|
"epoch": 0.9307559145989613,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004924895169294818,
|
|
"loss": 6.0142,
|
|
"mean_token_accuracy": 0.17308391481637955,
|
|
"num_tokens": 20436225.0,
|
|
"step": 8065
|
|
},
|
|
{
|
|
"entropy": 6.319842863082886,
|
|
"epoch": 0.93133294864397,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004924789407660062,
|
|
"loss": 6.1361,
|
|
"mean_token_accuracy": 0.17381656765937806,
|
|
"num_tokens": 20447957.0,
|
|
"step": 8070
|
|
},
|
|
{
|
|
"entropy": 6.298751926422119,
|
|
"epoch": 0.9319099826889786,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004924683572877345,
|
|
"loss": 6.0219,
|
|
"mean_token_accuracy": 0.17717759013175965,
|
|
"num_tokens": 20459836.0,
|
|
"step": 8075
|
|
},
|
|
{
|
|
"entropy": 6.402027034759522,
|
|
"epoch": 0.9324870167339873,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004924577664950225,
|
|
"loss": 6.1794,
|
|
"mean_token_accuracy": 0.16712668389081956,
|
|
"num_tokens": 20471907.0,
|
|
"step": 8080
|
|
},
|
|
{
|
|
"entropy": 6.325817441940307,
|
|
"epoch": 0.933064050778996,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004924471683882266,
|
|
"loss": 6.1608,
|
|
"mean_token_accuracy": 0.16859893202781678,
|
|
"num_tokens": 20485166.0,
|
|
"step": 8085
|
|
},
|
|
{
|
|
"entropy": 6.3150599002838135,
|
|
"epoch": 0.9336410848240047,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004924365629677031,
|
|
"loss": 6.0038,
|
|
"mean_token_accuracy": 0.17864430248737334,
|
|
"num_tokens": 20498973.0,
|
|
"step": 8090
|
|
},
|
|
{
|
|
"entropy": 6.290228700637817,
|
|
"epoch": 0.9342181188690133,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.000492425950233809,
|
|
"loss": 6.033,
|
|
"mean_token_accuracy": 0.18096119910478592,
|
|
"num_tokens": 20511615.0,
|
|
"step": 8095
|
|
},
|
|
{
|
|
"entropy": 6.306623554229736,
|
|
"epoch": 0.9347951529140219,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000492415330186901,
|
|
"loss": 6.0824,
|
|
"mean_token_accuracy": 0.1683804363012314,
|
|
"num_tokens": 20523615.0,
|
|
"step": 8100
|
|
},
|
|
{
|
|
"entropy": 6.372899293899536,
|
|
"epoch": 0.9353721869590306,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004924047028273364,
|
|
"loss": 6.007,
|
|
"mean_token_accuracy": 0.1787632629275322,
|
|
"num_tokens": 20537048.0,
|
|
"step": 8105
|
|
},
|
|
{
|
|
"entropy": 6.285822963714599,
|
|
"epoch": 0.9359492210040392,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004923940681554725,
|
|
"loss": 6.0922,
|
|
"mean_token_accuracy": 0.1766421005129814,
|
|
"num_tokens": 20551041.0,
|
|
"step": 8110
|
|
},
|
|
{
|
|
"entropy": 6.348171663284302,
|
|
"epoch": 0.9365262550490479,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004923834261716672,
|
|
"loss": 6.1496,
|
|
"mean_token_accuracy": 0.1679307132959366,
|
|
"num_tokens": 20563123.0,
|
|
"step": 8115
|
|
},
|
|
{
|
|
"entropy": 6.331095409393311,
|
|
"epoch": 0.9371032890940566,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004923727768762782,
|
|
"loss": 6.048,
|
|
"mean_token_accuracy": 0.18366726487874985,
|
|
"num_tokens": 20577487.0,
|
|
"step": 8120
|
|
},
|
|
{
|
|
"entropy": 6.275611782073975,
|
|
"epoch": 0.9376803231390652,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.000492362120269664,
|
|
"loss": 6.0773,
|
|
"mean_token_accuracy": 0.17474426031112672,
|
|
"num_tokens": 20590125.0,
|
|
"step": 8125
|
|
},
|
|
{
|
|
"entropy": 6.328644275665283,
|
|
"epoch": 0.9382573571840739,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004923514563521827,
|
|
"loss": 6.1126,
|
|
"mean_token_accuracy": 0.1696262091398239,
|
|
"num_tokens": 20603035.0,
|
|
"step": 8130
|
|
},
|
|
{
|
|
"entropy": 6.3141919612884525,
|
|
"epoch": 0.9388343912290825,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004923407851241933,
|
|
"loss": 6.094,
|
|
"mean_token_accuracy": 0.16628068536520005,
|
|
"num_tokens": 20615280.0,
|
|
"step": 8135
|
|
},
|
|
{
|
|
"entropy": 6.332769775390625,
|
|
"epoch": 0.9394114252740912,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004923301065860545,
|
|
"loss": 6.0693,
|
|
"mean_token_accuracy": 0.16870561093091965,
|
|
"num_tokens": 20627800.0,
|
|
"step": 8140
|
|
},
|
|
{
|
|
"entropy": 6.297971963882446,
|
|
"epoch": 0.9399884593190998,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004923194207381254,
|
|
"loss": 6.0941,
|
|
"mean_token_accuracy": 0.16942809224128724,
|
|
"num_tokens": 20639264.0,
|
|
"step": 8145
|
|
},
|
|
{
|
|
"entropy": 6.198244857788086,
|
|
"epoch": 0.9405654933641084,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004923087275807656,
|
|
"loss": 6.0176,
|
|
"mean_token_accuracy": 0.18265498876571656,
|
|
"num_tokens": 20652155.0,
|
|
"step": 8150
|
|
},
|
|
{
|
|
"entropy": 6.3499046802520756,
|
|
"epoch": 0.9411425274091172,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004922980271143347,
|
|
"loss": 6.0793,
|
|
"mean_token_accuracy": 0.1729395642876625,
|
|
"num_tokens": 20665642.0,
|
|
"step": 8155
|
|
},
|
|
{
|
|
"entropy": 6.345331525802612,
|
|
"epoch": 0.9417195614541258,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004922873193391927,
|
|
"loss": 6.0618,
|
|
"mean_token_accuracy": 0.17080418467521669,
|
|
"num_tokens": 20678685.0,
|
|
"step": 8160
|
|
},
|
|
{
|
|
"entropy": 6.239529323577881,
|
|
"epoch": 0.9422965954991345,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004922766042556994,
|
|
"loss": 6.0014,
|
|
"mean_token_accuracy": 0.17112986594438553,
|
|
"num_tokens": 20690714.0,
|
|
"step": 8165
|
|
},
|
|
{
|
|
"entropy": 6.3647966384887695,
|
|
"epoch": 0.9428736295441431,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004922658818642156,
|
|
"loss": 6.0995,
|
|
"mean_token_accuracy": 0.16545148491859435,
|
|
"num_tokens": 20703316.0,
|
|
"step": 8170
|
|
},
|
|
{
|
|
"entropy": 6.249971199035644,
|
|
"epoch": 0.9434506635891518,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004922551521651018,
|
|
"loss": 5.9891,
|
|
"mean_token_accuracy": 0.18353118002414703,
|
|
"num_tokens": 20716144.0,
|
|
"step": 8175
|
|
},
|
|
{
|
|
"entropy": 6.328268146514892,
|
|
"epoch": 0.9440276976341604,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004922444151587189,
|
|
"loss": 6.0374,
|
|
"mean_token_accuracy": 0.1707102119922638,
|
|
"num_tokens": 20728089.0,
|
|
"step": 8180
|
|
},
|
|
{
|
|
"entropy": 6.219746112823486,
|
|
"epoch": 0.944604731679169,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004922336708454279,
|
|
"loss": 6.0499,
|
|
"mean_token_accuracy": 0.18127028048038482,
|
|
"num_tokens": 20741684.0,
|
|
"step": 8185
|
|
},
|
|
{
|
|
"entropy": 6.337989234924317,
|
|
"epoch": 0.9451817657241778,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004922229192255903,
|
|
"loss": 6.1007,
|
|
"mean_token_accuracy": 0.16950066089630128,
|
|
"num_tokens": 20754840.0,
|
|
"step": 8190
|
|
},
|
|
{
|
|
"entropy": 6.272415828704834,
|
|
"epoch": 0.9457587997691864,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004922121602995678,
|
|
"loss": 5.9846,
|
|
"mean_token_accuracy": 0.18377467840909958,
|
|
"num_tokens": 20767528.0,
|
|
"step": 8195
|
|
},
|
|
{
|
|
"entropy": 6.244569110870361,
|
|
"epoch": 0.9463358338141951,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004922013940677221,
|
|
"loss": 6.0685,
|
|
"mean_token_accuracy": 0.1787708282470703,
|
|
"num_tokens": 20778886.0,
|
|
"step": 8200
|
|
},
|
|
{
|
|
"entropy": 6.314958715438843,
|
|
"epoch": 0.9469128678592037,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004921906205304155,
|
|
"loss": 6.0274,
|
|
"mean_token_accuracy": 0.16707849353551865,
|
|
"num_tokens": 20792928.0,
|
|
"step": 8205
|
|
},
|
|
{
|
|
"entropy": 6.276573610305786,
|
|
"epoch": 0.9474899019042123,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004921798396880101,
|
|
"loss": 6.0222,
|
|
"mean_token_accuracy": 0.17047245651483536,
|
|
"num_tokens": 20805766.0,
|
|
"step": 8210
|
|
},
|
|
{
|
|
"entropy": 6.332600259780884,
|
|
"epoch": 0.948066935949221,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004921690515408688,
|
|
"loss": 6.0799,
|
|
"mean_token_accuracy": 0.17117798924446107,
|
|
"num_tokens": 20819008.0,
|
|
"step": 8215
|
|
},
|
|
{
|
|
"entropy": 6.297818374633789,
|
|
"epoch": 0.9486439699942296,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004921582560893543,
|
|
"loss": 6.1285,
|
|
"mean_token_accuracy": 0.1678549811244011,
|
|
"num_tokens": 20832706.0,
|
|
"step": 8220
|
|
},
|
|
{
|
|
"entropy": 6.29673662185669,
|
|
"epoch": 0.9492210040392384,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004921474533338297,
|
|
"loss": 6.0616,
|
|
"mean_token_accuracy": 0.1708410307765007,
|
|
"num_tokens": 20844568.0,
|
|
"step": 8225
|
|
},
|
|
{
|
|
"entropy": 6.305984210968018,
|
|
"epoch": 0.949798038084247,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004921366432746585,
|
|
"loss": 6.0623,
|
|
"mean_token_accuracy": 0.17219894528388976,
|
|
"num_tokens": 20856157.0,
|
|
"step": 8230
|
|
},
|
|
{
|
|
"entropy": 6.256311988830566,
|
|
"epoch": 0.9503750721292556,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000492125825912204,
|
|
"loss": 6.0552,
|
|
"mean_token_accuracy": 0.1725418046116829,
|
|
"num_tokens": 20868039.0,
|
|
"step": 8235
|
|
},
|
|
{
|
|
"entropy": 6.362317228317261,
|
|
"epoch": 0.9509521061742643,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004921150012468302,
|
|
"loss": 6.0623,
|
|
"mean_token_accuracy": 0.17292184233665467,
|
|
"num_tokens": 20880190.0,
|
|
"step": 8240
|
|
},
|
|
{
|
|
"entropy": 6.240530061721802,
|
|
"epoch": 0.9515291402192729,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004921041692789013,
|
|
"loss": 6.0576,
|
|
"mean_token_accuracy": 0.17715438902378083,
|
|
"num_tokens": 20892996.0,
|
|
"step": 8245
|
|
},
|
|
{
|
|
"entropy": 6.327496719360352,
|
|
"epoch": 0.9521061742642816,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004920933300087813,
|
|
"loss": 6.1245,
|
|
"mean_token_accuracy": 0.170589879155159,
|
|
"num_tokens": 20906080.0,
|
|
"step": 8250
|
|
},
|
|
{
|
|
"entropy": 6.35455002784729,
|
|
"epoch": 0.9526832083092902,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004920824834368353,
|
|
"loss": 6.1527,
|
|
"mean_token_accuracy": 0.1672087237238884,
|
|
"num_tokens": 20917944.0,
|
|
"step": 8255
|
|
},
|
|
{
|
|
"entropy": 6.2974732398986815,
|
|
"epoch": 0.953260242354299,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004920716295634275,
|
|
"loss": 6.0226,
|
|
"mean_token_accuracy": 0.18663843721151352,
|
|
"num_tokens": 20929046.0,
|
|
"step": 8260
|
|
},
|
|
{
|
|
"entropy": 6.309549474716187,
|
|
"epoch": 0.9538372763993076,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004920607683889235,
|
|
"loss": 6.204,
|
|
"mean_token_accuracy": 0.16842423677444457,
|
|
"num_tokens": 20941643.0,
|
|
"step": 8265
|
|
},
|
|
{
|
|
"entropy": 6.374490642547608,
|
|
"epoch": 0.9544143104443162,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004920498999136882,
|
|
"loss": 6.12,
|
|
"mean_token_accuracy": 0.17137401849031447,
|
|
"num_tokens": 20954620.0,
|
|
"step": 8270
|
|
},
|
|
{
|
|
"entropy": 6.301665258407593,
|
|
"epoch": 0.9549913444893249,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004920390241380874,
|
|
"loss": 6.1383,
|
|
"mean_token_accuracy": 0.16496547162532807,
|
|
"num_tokens": 20968033.0,
|
|
"step": 8275
|
|
},
|
|
{
|
|
"entropy": 6.316059875488281,
|
|
"epoch": 0.9555683785343335,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004920281410624868,
|
|
"loss": 6.0528,
|
|
"mean_token_accuracy": 0.17812226861715316,
|
|
"num_tokens": 20980586.0,
|
|
"step": 8280
|
|
},
|
|
{
|
|
"entropy": 6.237458086013794,
|
|
"epoch": 0.9561454125793422,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004920172506872525,
|
|
"loss": 5.9906,
|
|
"mean_token_accuracy": 0.17724904865026475,
|
|
"num_tokens": 20992346.0,
|
|
"step": 8285
|
|
},
|
|
{
|
|
"entropy": 6.203985404968262,
|
|
"epoch": 0.9567224466243508,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004920063530127508,
|
|
"loss": 5.9545,
|
|
"mean_token_accuracy": 0.18309845626354218,
|
|
"num_tokens": 21004399.0,
|
|
"step": 8290
|
|
},
|
|
{
|
|
"entropy": 6.386181783676148,
|
|
"epoch": 0.9572994806693594,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004919954480393482,
|
|
"loss": 6.1593,
|
|
"mean_token_accuracy": 0.16094251722097397,
|
|
"num_tokens": 21017066.0,
|
|
"step": 8295
|
|
},
|
|
{
|
|
"entropy": 6.379828882217407,
|
|
"epoch": 0.9578765147143682,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004919845357674114,
|
|
"loss": 6.2121,
|
|
"mean_token_accuracy": 0.1594449073076248,
|
|
"num_tokens": 21031664.0,
|
|
"step": 8300
|
|
},
|
|
{
|
|
"entropy": 6.345889616012573,
|
|
"epoch": 0.9584535487593768,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004919736161973076,
|
|
"loss": 6.0684,
|
|
"mean_token_accuracy": 0.18007687032222747,
|
|
"num_tokens": 21043980.0,
|
|
"step": 8305
|
|
},
|
|
{
|
|
"entropy": 6.341425609588623,
|
|
"epoch": 0.9590305828043855,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.000491962689329404,
|
|
"loss": 6.0708,
|
|
"mean_token_accuracy": 0.17116846591234208,
|
|
"num_tokens": 21056916.0,
|
|
"step": 8310
|
|
},
|
|
{
|
|
"entropy": 6.38311505317688,
|
|
"epoch": 0.9596076168493941,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004919517551640681,
|
|
"loss": 6.1542,
|
|
"mean_token_accuracy": 0.1650987982749939,
|
|
"num_tokens": 21070027.0,
|
|
"step": 8315
|
|
},
|
|
{
|
|
"entropy": 6.336155128479004,
|
|
"epoch": 0.9601846508944027,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004919408137016677,
|
|
"loss": 6.12,
|
|
"mean_token_accuracy": 0.1708296701312065,
|
|
"num_tokens": 21082596.0,
|
|
"step": 8320
|
|
},
|
|
{
|
|
"entropy": 6.15516300201416,
|
|
"epoch": 0.9607616849394114,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004919298649425708,
|
|
"loss": 5.9459,
|
|
"mean_token_accuracy": 0.17924613356590272,
|
|
"num_tokens": 21098160.0,
|
|
"step": 8325
|
|
},
|
|
{
|
|
"entropy": 6.3055689334869385,
|
|
"epoch": 0.96133871898442,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004919189088871456,
|
|
"loss": 6.041,
|
|
"mean_token_accuracy": 0.17082750350236892,
|
|
"num_tokens": 21111562.0,
|
|
"step": 8330
|
|
},
|
|
{
|
|
"entropy": 6.309827613830566,
|
|
"epoch": 0.9619157530294288,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004919079455357608,
|
|
"loss": 6.051,
|
|
"mean_token_accuracy": 0.1726277843117714,
|
|
"num_tokens": 21123177.0,
|
|
"step": 8335
|
|
},
|
|
{
|
|
"entropy": 6.272983598709106,
|
|
"epoch": 0.9624927870744374,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004918969748887847,
|
|
"loss": 6.1106,
|
|
"mean_token_accuracy": 0.1684108003973961,
|
|
"num_tokens": 21135390.0,
|
|
"step": 8340
|
|
},
|
|
{
|
|
"entropy": 6.303555488586426,
|
|
"epoch": 0.9630698211194461,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004918859969465868,
|
|
"loss": 6.0524,
|
|
"mean_token_accuracy": 0.1788319617509842,
|
|
"num_tokens": 21148718.0,
|
|
"step": 8345
|
|
},
|
|
{
|
|
"entropy": 6.348038244247436,
|
|
"epoch": 0.9636468551644547,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004918750117095361,
|
|
"loss": 6.0769,
|
|
"mean_token_accuracy": 0.16928021162748336,
|
|
"num_tokens": 21161057.0,
|
|
"step": 8350
|
|
},
|
|
{
|
|
"entropy": 6.333800172805786,
|
|
"epoch": 0.9642238892094633,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004918640191780021,
|
|
"loss": 6.0314,
|
|
"mean_token_accuracy": 0.1733250930905342,
|
|
"num_tokens": 21175048.0,
|
|
"step": 8355
|
|
},
|
|
{
|
|
"entropy": 6.298459768295288,
|
|
"epoch": 0.964800923254472,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004918530193523546,
|
|
"loss": 6.0075,
|
|
"mean_token_accuracy": 0.17219914495944977,
|
|
"num_tokens": 21187995.0,
|
|
"step": 8360
|
|
},
|
|
{
|
|
"entropy": 6.2210142612457275,
|
|
"epoch": 0.9653779572994806,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004918420122329634,
|
|
"loss": 5.9762,
|
|
"mean_token_accuracy": 0.17670271098613738,
|
|
"num_tokens": 21200685.0,
|
|
"step": 8365
|
|
},
|
|
{
|
|
"entropy": 6.269420576095581,
|
|
"epoch": 0.9659549913444894,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004918309978201989,
|
|
"loss": 6.0031,
|
|
"mean_token_accuracy": 0.17940095961093902,
|
|
"num_tokens": 21212709.0,
|
|
"step": 8370
|
|
},
|
|
{
|
|
"entropy": 6.3614483833312985,
|
|
"epoch": 0.966532025389498,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004918199761144315,
|
|
"loss": 6.1414,
|
|
"mean_token_accuracy": 0.16158217340707778,
|
|
"num_tokens": 21224846.0,
|
|
"step": 8375
|
|
},
|
|
{
|
|
"entropy": 6.342139053344726,
|
|
"epoch": 0.9671090594345066,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004918089471160318,
|
|
"loss": 6.1078,
|
|
"mean_token_accuracy": 0.17495157569646835,
|
|
"num_tokens": 21238490.0,
|
|
"step": 8380
|
|
},
|
|
{
|
|
"entropy": 6.297436285018921,
|
|
"epoch": 0.9676860934795153,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004917979108253709,
|
|
"loss": 6.0186,
|
|
"mean_token_accuracy": 0.17175852954387666,
|
|
"num_tokens": 21250064.0,
|
|
"step": 8385
|
|
},
|
|
{
|
|
"entropy": 6.319163703918457,
|
|
"epoch": 0.9682631275245239,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00049178686724282,
|
|
"loss": 5.9838,
|
|
"mean_token_accuracy": 0.17822523713111876,
|
|
"num_tokens": 21262777.0,
|
|
"step": 8390
|
|
},
|
|
{
|
|
"entropy": 6.2587940216064455,
|
|
"epoch": 0.9688401615695326,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004917758163687506,
|
|
"loss": 6.0596,
|
|
"mean_token_accuracy": 0.18015512079000473,
|
|
"num_tokens": 21274837.0,
|
|
"step": 8395
|
|
},
|
|
{
|
|
"entropy": 6.299158430099487,
|
|
"epoch": 0.9694171956145412,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004917647582035341,
|
|
"loss": 6.1477,
|
|
"mean_token_accuracy": 0.16546362787485122,
|
|
"num_tokens": 21287683.0,
|
|
"step": 8400
|
|
},
|
|
{
|
|
"entropy": 6.276169300079346,
|
|
"epoch": 0.96999422965955,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004917536927475428,
|
|
"loss": 5.9704,
|
|
"mean_token_accuracy": 0.17683717012405395,
|
|
"num_tokens": 21300053.0,
|
|
"step": 8405
|
|
},
|
|
{
|
|
"entropy": 6.322388982772827,
|
|
"epoch": 0.9705712637045586,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004917426200011486,
|
|
"loss": 6.0606,
|
|
"mean_token_accuracy": 0.17437842041254042,
|
|
"num_tokens": 21312143.0,
|
|
"step": 8410
|
|
},
|
|
{
|
|
"entropy": 6.308571004867554,
|
|
"epoch": 0.9711482977495672,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.000491731539964724,
|
|
"loss": 6.064,
|
|
"mean_token_accuracy": 0.17512849271297454,
|
|
"num_tokens": 21324530.0,
|
|
"step": 8415
|
|
},
|
|
{
|
|
"entropy": 6.308686065673828,
|
|
"epoch": 0.9717253317945759,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004917204526386418,
|
|
"loss": 6.1158,
|
|
"mean_token_accuracy": 0.17519305050373077,
|
|
"num_tokens": 21337766.0,
|
|
"step": 8420
|
|
},
|
|
{
|
|
"entropy": 6.3296489238739015,
|
|
"epoch": 0.9723023658395845,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004917093580232748,
|
|
"loss": 6.0457,
|
|
"mean_token_accuracy": 0.17636967301368714,
|
|
"num_tokens": 21350304.0,
|
|
"step": 8425
|
|
},
|
|
{
|
|
"entropy": 6.264460182189941,
|
|
"epoch": 0.9728793998845932,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004916982561189962,
|
|
"loss": 6.0781,
|
|
"mean_token_accuracy": 0.17243474572896958,
|
|
"num_tokens": 21362030.0,
|
|
"step": 8430
|
|
},
|
|
{
|
|
"entropy": 6.325700092315674,
|
|
"epoch": 0.9734564339296018,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004916871469261794,
|
|
"loss": 6.088,
|
|
"mean_token_accuracy": 0.1718950316309929,
|
|
"num_tokens": 21374279.0,
|
|
"step": 8435
|
|
},
|
|
{
|
|
"entropy": 6.3129064559936525,
|
|
"epoch": 0.9740334679746105,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.000491676030445198,
|
|
"loss": 6.074,
|
|
"mean_token_accuracy": 0.18431381583213807,
|
|
"num_tokens": 21388220.0,
|
|
"step": 8440
|
|
},
|
|
{
|
|
"entropy": 6.319225549697876,
|
|
"epoch": 0.9746105020196192,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004916649066764259,
|
|
"loss": 6.0279,
|
|
"mean_token_accuracy": 0.17508506923913955,
|
|
"num_tokens": 21400770.0,
|
|
"step": 8445
|
|
},
|
|
{
|
|
"entropy": 6.299949407577515,
|
|
"epoch": 0.9751875360646278,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004916537756202375,
|
|
"loss": 6.0692,
|
|
"mean_token_accuracy": 0.1750455766916275,
|
|
"num_tokens": 21413078.0,
|
|
"step": 8450
|
|
},
|
|
{
|
|
"entropy": 6.322778272628784,
|
|
"epoch": 0.9757645701096365,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004916426372770069,
|
|
"loss": 6.0912,
|
|
"mean_token_accuracy": 0.16818054616451264,
|
|
"num_tokens": 21427285.0,
|
|
"step": 8455
|
|
},
|
|
{
|
|
"entropy": 6.3555844783782955,
|
|
"epoch": 0.9763416041546451,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004916314916471087,
|
|
"loss": 6.0548,
|
|
"mean_token_accuracy": 0.17514651268720627,
|
|
"num_tokens": 21440659.0,
|
|
"step": 8460
|
|
},
|
|
{
|
|
"entropy": 6.283309412002564,
|
|
"epoch": 0.9769186381996537,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004916203387309179,
|
|
"loss": 6.0336,
|
|
"mean_token_accuracy": 0.1689162462949753,
|
|
"num_tokens": 21452301.0,
|
|
"step": 8465
|
|
},
|
|
{
|
|
"entropy": 6.186957979202271,
|
|
"epoch": 0.9774956722446624,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004916091785288096,
|
|
"loss": 5.9807,
|
|
"mean_token_accuracy": 0.18105768263339997,
|
|
"num_tokens": 21466716.0,
|
|
"step": 8470
|
|
},
|
|
{
|
|
"entropy": 6.330410099029541,
|
|
"epoch": 0.9780727062896711,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004915980110411593,
|
|
"loss": 6.0875,
|
|
"mean_token_accuracy": 0.17375342547893524,
|
|
"num_tokens": 21479314.0,
|
|
"step": 8475
|
|
},
|
|
{
|
|
"entropy": 6.277654647827148,
|
|
"epoch": 0.9786497403346798,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004915868362683425,
|
|
"loss": 5.9829,
|
|
"mean_token_accuracy": 0.18661958277225493,
|
|
"num_tokens": 21491968.0,
|
|
"step": 8480
|
|
},
|
|
{
|
|
"entropy": 6.172560930252075,
|
|
"epoch": 0.9792267743796884,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004915756542107349,
|
|
"loss": 6.0973,
|
|
"mean_token_accuracy": 0.1710505172610283,
|
|
"num_tokens": 21505744.0,
|
|
"step": 8485
|
|
},
|
|
{
|
|
"entropy": 6.331524133682251,
|
|
"epoch": 0.979803808424697,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004915644648687127,
|
|
"loss": 6.1035,
|
|
"mean_token_accuracy": 0.17333952337503433,
|
|
"num_tokens": 21520981.0,
|
|
"step": 8490
|
|
},
|
|
{
|
|
"entropy": 6.351734685897827,
|
|
"epoch": 0.9803808424697057,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004915532682426524,
|
|
"loss": 6.067,
|
|
"mean_token_accuracy": 0.17047810107469558,
|
|
"num_tokens": 21533712.0,
|
|
"step": 8495
|
|
},
|
|
{
|
|
"entropy": 6.18950400352478,
|
|
"epoch": 0.9809578765147143,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004915420643329306,
|
|
"loss": 5.9703,
|
|
"mean_token_accuracy": 0.1750311180949211,
|
|
"num_tokens": 21546875.0,
|
|
"step": 8500
|
|
},
|
|
{
|
|
"entropy": 6.286129379272461,
|
|
"epoch": 0.981534910559723,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.000491530853139924,
|
|
"loss": 6.0195,
|
|
"mean_token_accuracy": 0.17821505516767502,
|
|
"num_tokens": 21559154.0,
|
|
"step": 8505
|
|
},
|
|
{
|
|
"entropy": 6.3540106296539305,
|
|
"epoch": 0.9821119446047317,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004915196346640095,
|
|
"loss": 6.1033,
|
|
"mean_token_accuracy": 0.16890120655298232,
|
|
"num_tokens": 21573164.0,
|
|
"step": 8510
|
|
},
|
|
{
|
|
"entropy": 6.343676900863647,
|
|
"epoch": 0.9826889786497404,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004915084089055648,
|
|
"loss": 6.1093,
|
|
"mean_token_accuracy": 0.16497408002614974,
|
|
"num_tokens": 21585449.0,
|
|
"step": 8515
|
|
},
|
|
{
|
|
"entropy": 6.205972909927368,
|
|
"epoch": 0.983266012694749,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004914971758649673,
|
|
"loss": 6.0408,
|
|
"mean_token_accuracy": 0.18363562375307083,
|
|
"num_tokens": 21598120.0,
|
|
"step": 8520
|
|
},
|
|
{
|
|
"entropy": 6.2844775199890135,
|
|
"epoch": 0.9838430467397576,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004914859355425948,
|
|
"loss": 6.0986,
|
|
"mean_token_accuracy": 0.17075739353895186,
|
|
"num_tokens": 21609912.0,
|
|
"step": 8525
|
|
},
|
|
{
|
|
"entropy": 6.362640714645385,
|
|
"epoch": 0.9844200807847663,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004914746879388255,
|
|
"loss": 6.0341,
|
|
"mean_token_accuracy": 0.17460228204727174,
|
|
"num_tokens": 21623242.0,
|
|
"step": 8530
|
|
},
|
|
{
|
|
"entropy": 6.252819156646728,
|
|
"epoch": 0.9849971148297749,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004914634330540373,
|
|
"loss": 6.0749,
|
|
"mean_token_accuracy": 0.17560923844575882,
|
|
"num_tokens": 21635527.0,
|
|
"step": 8535
|
|
},
|
|
{
|
|
"entropy": 6.27526888847351,
|
|
"epoch": 0.9855741488747836,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004914521708886093,
|
|
"loss": 6.0472,
|
|
"mean_token_accuracy": 0.16989225745201111,
|
|
"num_tokens": 21648994.0,
|
|
"step": 8540
|
|
},
|
|
{
|
|
"entropy": 6.324329948425293,
|
|
"epoch": 0.9861511829197923,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004914409014429201,
|
|
"loss": 6.0489,
|
|
"mean_token_accuracy": 0.17544470131397247,
|
|
"num_tokens": 21661512.0,
|
|
"step": 8545
|
|
},
|
|
{
|
|
"entropy": 6.28133864402771,
|
|
"epoch": 0.986728216964801,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004914296247173486,
|
|
"loss": 6.1108,
|
|
"mean_token_accuracy": 0.16970574706792832,
|
|
"num_tokens": 21674900.0,
|
|
"step": 8550
|
|
},
|
|
{
|
|
"entropy": 6.445541143417358,
|
|
"epoch": 0.9873052510098096,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004914183407122741,
|
|
"loss": 6.2304,
|
|
"mean_token_accuracy": 0.1670519694685936,
|
|
"num_tokens": 21688451.0,
|
|
"step": 8555
|
|
},
|
|
{
|
|
"entropy": 6.338979005813599,
|
|
"epoch": 0.9878822850548182,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004914070494280763,
|
|
"loss": 6.0895,
|
|
"mean_token_accuracy": 0.1686733365058899,
|
|
"num_tokens": 21700350.0,
|
|
"step": 8560
|
|
},
|
|
{
|
|
"entropy": 6.2714245319366455,
|
|
"epoch": 0.9884593190998269,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004913957508651349,
|
|
"loss": 6.0558,
|
|
"mean_token_accuracy": 0.17865381836891175,
|
|
"num_tokens": 21713211.0,
|
|
"step": 8565
|
|
},
|
|
{
|
|
"entropy": 6.273990535736084,
|
|
"epoch": 0.9890363531448355,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.0004913844450238299,
|
|
"loss": 5.9724,
|
|
"mean_token_accuracy": 0.1822005182504654,
|
|
"num_tokens": 21726105.0,
|
|
"step": 8570
|
|
},
|
|
{
|
|
"entropy": 6.251226806640625,
|
|
"epoch": 0.9896133871898442,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004913731319045416,
|
|
"loss": 6.062,
|
|
"mean_token_accuracy": 0.1773639664053917,
|
|
"num_tokens": 21738075.0,
|
|
"step": 8575
|
|
},
|
|
{
|
|
"entropy": 6.292670202255249,
|
|
"epoch": 0.9901904212348529,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004913618115076505,
|
|
"loss": 6.0441,
|
|
"mean_token_accuracy": 0.17401732057332991,
|
|
"num_tokens": 21750614.0,
|
|
"step": 8580
|
|
},
|
|
{
|
|
"entropy": 6.221653270721435,
|
|
"epoch": 0.9907674552798615,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004913504838335372,
|
|
"loss": 6.0495,
|
|
"mean_token_accuracy": 0.17573998719453812,
|
|
"num_tokens": 21763670.0,
|
|
"step": 8585
|
|
},
|
|
{
|
|
"entropy": 6.303406429290772,
|
|
"epoch": 0.9913444893248702,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004913391488825829,
|
|
"loss": 6.0334,
|
|
"mean_token_accuracy": 0.1794967070221901,
|
|
"num_tokens": 21776623.0,
|
|
"step": 8590
|
|
},
|
|
{
|
|
"entropy": 6.308801317214966,
|
|
"epoch": 0.9919215233698788,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004913278066551689,
|
|
"loss": 6.0141,
|
|
"mean_token_accuracy": 0.17606466710567475,
|
|
"num_tokens": 21787903.0,
|
|
"step": 8595
|
|
},
|
|
{
|
|
"entropy": 6.230136156082153,
|
|
"epoch": 0.9924985574148875,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004913164571516765,
|
|
"loss": 5.9398,
|
|
"mean_token_accuracy": 0.18365363031625748,
|
|
"num_tokens": 21800409.0,
|
|
"step": 8600
|
|
},
|
|
{
|
|
"entropy": 6.320093202590942,
|
|
"epoch": 0.9930755914598961,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004913051003724876,
|
|
"loss": 6.1418,
|
|
"mean_token_accuracy": 0.17018114328384398,
|
|
"num_tokens": 21812741.0,
|
|
"step": 8605
|
|
},
|
|
{
|
|
"entropy": 6.295933103561401,
|
|
"epoch": 0.9936526255049047,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004912937363179839,
|
|
"loss": 6.0716,
|
|
"mean_token_accuracy": 0.17680844217538833,
|
|
"num_tokens": 21826180.0,
|
|
"step": 8610
|
|
},
|
|
{
|
|
"entropy": 6.28583836555481,
|
|
"epoch": 0.9942296595499135,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.000491282364988548,
|
|
"loss": 6.1301,
|
|
"mean_token_accuracy": 0.17232027649879456,
|
|
"num_tokens": 21838961.0,
|
|
"step": 8615
|
|
},
|
|
{
|
|
"entropy": 6.3287606716156,
|
|
"epoch": 0.9948066935949221,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004912709863845621,
|
|
"loss": 6.0813,
|
|
"mean_token_accuracy": 0.1688533142209053,
|
|
"num_tokens": 21850942.0,
|
|
"step": 8620
|
|
},
|
|
{
|
|
"entropy": 6.358766841888428,
|
|
"epoch": 0.9953837276399308,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.000491259600506409,
|
|
"loss": 6.0008,
|
|
"mean_token_accuracy": 0.18225180059671403,
|
|
"num_tokens": 21862666.0,
|
|
"step": 8625
|
|
},
|
|
{
|
|
"entropy": 6.225011587142944,
|
|
"epoch": 0.9959607616849394,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004912482073544716,
|
|
"loss": 6.0263,
|
|
"mean_token_accuracy": 0.181974658370018,
|
|
"num_tokens": 21874866.0,
|
|
"step": 8630
|
|
},
|
|
{
|
|
"entropy": 6.300230407714844,
|
|
"epoch": 0.996537795729948,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004912368069291333,
|
|
"loss": 6.0987,
|
|
"mean_token_accuracy": 0.17124349176883696,
|
|
"num_tokens": 21887886.0,
|
|
"step": 8635
|
|
},
|
|
{
|
|
"entropy": 6.385247230529785,
|
|
"epoch": 0.9971148297749567,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004912253992307773,
|
|
"loss": 6.0614,
|
|
"mean_token_accuracy": 0.1666038528084755,
|
|
"num_tokens": 21901096.0,
|
|
"step": 8640
|
|
},
|
|
{
|
|
"entropy": 6.307227563858032,
|
|
"epoch": 0.9976918638199653,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004912139842597875,
|
|
"loss": 6.1417,
|
|
"mean_token_accuracy": 0.17292022854089736,
|
|
"num_tokens": 21914018.0,
|
|
"step": 8645
|
|
},
|
|
{
|
|
"entropy": 6.3174644947052006,
|
|
"epoch": 0.9982688978649741,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004912025620165477,
|
|
"loss": 6.0544,
|
|
"mean_token_accuracy": 0.1787086993455887,
|
|
"num_tokens": 21925488.0,
|
|
"step": 8650
|
|
},
|
|
{
|
|
"entropy": 6.379308795928955,
|
|
"epoch": 0.9988459319099827,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004911911325014421,
|
|
"loss": 6.1228,
|
|
"mean_token_accuracy": 0.1627660095691681,
|
|
"num_tokens": 21938268.0,
|
|
"step": 8655
|
|
},
|
|
{
|
|
"entropy": 6.32840895652771,
|
|
"epoch": 0.9994229659549914,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004911796957148552,
|
|
"loss": 6.1073,
|
|
"mean_token_accuracy": 0.17420676499605178,
|
|
"num_tokens": 21951219.0,
|
|
"step": 8660
|
|
},
|
|
{
|
|
"entropy": 6.355043363571167,
|
|
"epoch": 1.0,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004911682516571715,
|
|
"loss": 6.0847,
|
|
"mean_token_accuracy": 0.1745709404349327,
|
|
"num_tokens": 21963117.0,
|
|
"step": 8665
|
|
},
|
|
{
|
|
"entropy": 6.3443841457366945,
|
|
"epoch": 1.0005770340450086,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004911568003287761,
|
|
"loss": 6.0131,
|
|
"mean_token_accuracy": 0.17631109207868575,
|
|
"num_tokens": 21974187.0,
|
|
"step": 8670
|
|
},
|
|
{
|
|
"entropy": 6.301740312576294,
|
|
"epoch": 1.0011540680900173,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004911453417300541,
|
|
"loss": 6.0218,
|
|
"mean_token_accuracy": 0.1745710179209709,
|
|
"num_tokens": 21987393.0,
|
|
"step": 8675
|
|
},
|
|
{
|
|
"entropy": 6.29511661529541,
|
|
"epoch": 1.001731102135026,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004911338758613909,
|
|
"loss": 5.9168,
|
|
"mean_token_accuracy": 0.18078290671110153,
|
|
"num_tokens": 21998638.0,
|
|
"step": 8680
|
|
},
|
|
{
|
|
"entropy": 6.239432239532471,
|
|
"epoch": 1.0023081361800346,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004911224027231722,
|
|
"loss": 5.9525,
|
|
"mean_token_accuracy": 0.17768344581127166,
|
|
"num_tokens": 22012231.0,
|
|
"step": 8685
|
|
},
|
|
{
|
|
"entropy": 6.150865840911865,
|
|
"epoch": 1.0028851702250432,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004911109223157838,
|
|
"loss": 5.7963,
|
|
"mean_token_accuracy": 0.19489599764347076,
|
|
"num_tokens": 22024929.0,
|
|
"step": 8690
|
|
},
|
|
{
|
|
"entropy": 6.238634347915649,
|
|
"epoch": 1.0034622042700518,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004910994346396118,
|
|
"loss": 5.9051,
|
|
"mean_token_accuracy": 0.18360282331705094,
|
|
"num_tokens": 22037873.0,
|
|
"step": 8695
|
|
},
|
|
{
|
|
"entropy": 6.286004877090454,
|
|
"epoch": 1.0040392383150605,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004910879396950427,
|
|
"loss": 5.8986,
|
|
"mean_token_accuracy": 0.18249017894268035,
|
|
"num_tokens": 22049572.0,
|
|
"step": 8700
|
|
},
|
|
{
|
|
"entropy": 6.319458055496216,
|
|
"epoch": 1.0046162723600693,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.000491076437482463,
|
|
"loss": 5.9874,
|
|
"mean_token_accuracy": 0.17467263340950012,
|
|
"num_tokens": 22063290.0,
|
|
"step": 8705
|
|
},
|
|
{
|
|
"entropy": 6.137618780136108,
|
|
"epoch": 1.005193306405078,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004910649280022599,
|
|
"loss": 5.8664,
|
|
"mean_token_accuracy": 0.18574946224689484,
|
|
"num_tokens": 22076387.0,
|
|
"step": 8710
|
|
},
|
|
{
|
|
"entropy": 6.30208010673523,
|
|
"epoch": 1.0057703404500866,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004910534112548201,
|
|
"loss": 5.9577,
|
|
"mean_token_accuracy": 0.17944232672452926,
|
|
"num_tokens": 22088780.0,
|
|
"step": 8715
|
|
},
|
|
{
|
|
"entropy": 6.154451704025268,
|
|
"epoch": 1.0063473744950953,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004910418872405312,
|
|
"loss": 5.8374,
|
|
"mean_token_accuracy": 0.1871345892548561,
|
|
"num_tokens": 22102150.0,
|
|
"step": 8720
|
|
},
|
|
{
|
|
"entropy": 6.243637466430664,
|
|
"epoch": 1.006924408540104,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004910303559597806,
|
|
"loss": 5.9346,
|
|
"mean_token_accuracy": 0.1791851580142975,
|
|
"num_tokens": 22115250.0,
|
|
"step": 8725
|
|
},
|
|
{
|
|
"entropy": 6.302803611755371,
|
|
"epoch": 1.0075014425851125,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004910188174129564,
|
|
"loss": 5.9405,
|
|
"mean_token_accuracy": 0.17347067594528198,
|
|
"num_tokens": 22129015.0,
|
|
"step": 8730
|
|
},
|
|
{
|
|
"entropy": 6.2511063575744625,
|
|
"epoch": 1.0080784766301212,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004910072716004466,
|
|
"loss": 5.9659,
|
|
"mean_token_accuracy": 0.17493045777082444,
|
|
"num_tokens": 22141716.0,
|
|
"step": 8735
|
|
},
|
|
{
|
|
"entropy": 6.333795022964478,
|
|
"epoch": 1.0086555106751298,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004909957185226394,
|
|
"loss": 6.0124,
|
|
"mean_token_accuracy": 0.16725752502679825,
|
|
"num_tokens": 22153568.0,
|
|
"step": 8740
|
|
},
|
|
{
|
|
"entropy": 6.315547466278076,
|
|
"epoch": 1.0092325447201385,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004909841581799236,
|
|
"loss": 6.0358,
|
|
"mean_token_accuracy": 0.17059850841760635,
|
|
"num_tokens": 22165443.0,
|
|
"step": 8745
|
|
},
|
|
{
|
|
"entropy": 6.297538089752197,
|
|
"epoch": 1.009809578765147,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004909725905726879,
|
|
"loss": 5.9411,
|
|
"mean_token_accuracy": 0.18054274767637252,
|
|
"num_tokens": 22179068.0,
|
|
"step": 8750
|
|
},
|
|
{
|
|
"entropy": 6.290983438491821,
|
|
"epoch": 1.0103866128101557,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004909610157013214,
|
|
"loss": 6.0418,
|
|
"mean_token_accuracy": 0.16726665794849396,
|
|
"num_tokens": 22191597.0,
|
|
"step": 8755
|
|
},
|
|
{
|
|
"entropy": 6.272359132766724,
|
|
"epoch": 1.0109636468551644,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004909494335662134,
|
|
"loss": 5.9777,
|
|
"mean_token_accuracy": 0.17593691051006316,
|
|
"num_tokens": 22203724.0,
|
|
"step": 8760
|
|
},
|
|
{
|
|
"entropy": 6.268367767333984,
|
|
"epoch": 1.011540680900173,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004909378441677535,
|
|
"loss": 5.9386,
|
|
"mean_token_accuracy": 0.1802491694688797,
|
|
"num_tokens": 22216100.0,
|
|
"step": 8765
|
|
},
|
|
{
|
|
"entropy": 6.311220264434814,
|
|
"epoch": 1.0121177149451817,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004909262475063314,
|
|
"loss": 5.9342,
|
|
"mean_token_accuracy": 0.17636322379112243,
|
|
"num_tokens": 22228162.0,
|
|
"step": 8770
|
|
},
|
|
{
|
|
"entropy": 6.266244554519654,
|
|
"epoch": 1.0126947489901905,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004909146435823373,
|
|
"loss": 5.9254,
|
|
"mean_token_accuracy": 0.1820003569126129,
|
|
"num_tokens": 22239756.0,
|
|
"step": 8775
|
|
},
|
|
{
|
|
"entropy": 6.258756494522094,
|
|
"epoch": 1.0132717830351992,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004909030323961613,
|
|
"loss": 5.9261,
|
|
"mean_token_accuracy": 0.1728573277592659,
|
|
"num_tokens": 22252781.0,
|
|
"step": 8780
|
|
},
|
|
{
|
|
"entropy": 6.24869384765625,
|
|
"epoch": 1.0138488170802078,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004908914139481942,
|
|
"loss": 6.0004,
|
|
"mean_token_accuracy": 0.17384298741817475,
|
|
"num_tokens": 22265171.0,
|
|
"step": 8785
|
|
},
|
|
{
|
|
"entropy": 6.272542905807495,
|
|
"epoch": 1.0144258511252164,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004908797882388265,
|
|
"loss": 5.9308,
|
|
"mean_token_accuracy": 0.1815079167485237,
|
|
"num_tokens": 22278121.0,
|
|
"step": 8790
|
|
},
|
|
{
|
|
"entropy": 6.188515949249267,
|
|
"epoch": 1.015002885170225,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004908681552684495,
|
|
"loss": 5.8076,
|
|
"mean_token_accuracy": 0.1845837727189064,
|
|
"num_tokens": 22290074.0,
|
|
"step": 8795
|
|
},
|
|
{
|
|
"entropy": 6.237634563446045,
|
|
"epoch": 1.0155799192152337,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004908565150374542,
|
|
"loss": 5.9317,
|
|
"mean_token_accuracy": 0.18133609592914582,
|
|
"num_tokens": 22303088.0,
|
|
"step": 8800
|
|
},
|
|
{
|
|
"entropy": 6.322842741012574,
|
|
"epoch": 1.0161569532602424,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004908448675462323,
|
|
"loss": 5.9863,
|
|
"mean_token_accuracy": 0.1694008842110634,
|
|
"num_tokens": 22317693.0,
|
|
"step": 8805
|
|
},
|
|
{
|
|
"entropy": 6.229022693634033,
|
|
"epoch": 1.016733987305251,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004908332127951756,
|
|
"loss": 5.9442,
|
|
"mean_token_accuracy": 0.17924002856016158,
|
|
"num_tokens": 22330876.0,
|
|
"step": 8810
|
|
},
|
|
{
|
|
"entropy": 6.266847419738769,
|
|
"epoch": 1.0173110213502596,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004908215507846757,
|
|
"loss": 5.9253,
|
|
"mean_token_accuracy": 0.17635516226291656,
|
|
"num_tokens": 22342620.0,
|
|
"step": 8815
|
|
},
|
|
{
|
|
"entropy": 6.242235136032105,
|
|
"epoch": 1.0178880553952683,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004908098815151254,
|
|
"loss": 5.9486,
|
|
"mean_token_accuracy": 0.1775849163532257,
|
|
"num_tokens": 22353733.0,
|
|
"step": 8820
|
|
},
|
|
{
|
|
"entropy": 6.282942867279052,
|
|
"epoch": 1.018465089440277,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004907982049869168,
|
|
"loss": 5.9636,
|
|
"mean_token_accuracy": 0.17333447337150573,
|
|
"num_tokens": 22366857.0,
|
|
"step": 8825
|
|
},
|
|
{
|
|
"entropy": 6.205226278305053,
|
|
"epoch": 1.0190421234852856,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004907865212004428,
|
|
"loss": 5.8306,
|
|
"mean_token_accuracy": 0.18225234746932983,
|
|
"num_tokens": 22377658.0,
|
|
"step": 8830
|
|
},
|
|
{
|
|
"entropy": 6.268972778320313,
|
|
"epoch": 1.0196191575302942,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004907748301560963,
|
|
"loss": 5.9864,
|
|
"mean_token_accuracy": 0.17106507569551468,
|
|
"num_tokens": 22390060.0,
|
|
"step": 8835
|
|
},
|
|
{
|
|
"entropy": 6.259017467498779,
|
|
"epoch": 1.0201961915753028,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004907631318542707,
|
|
"loss": 5.9534,
|
|
"mean_token_accuracy": 0.17372174561023712,
|
|
"num_tokens": 22402903.0,
|
|
"step": 8840
|
|
},
|
|
{
|
|
"entropy": 6.163227939605713,
|
|
"epoch": 1.0207732256203117,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004907514262953594,
|
|
"loss": 5.8908,
|
|
"mean_token_accuracy": 0.18323398977518082,
|
|
"num_tokens": 22416036.0,
|
|
"step": 8845
|
|
},
|
|
{
|
|
"entropy": 6.34295973777771,
|
|
"epoch": 1.0213502596653203,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004907397134797559,
|
|
"loss": 5.9372,
|
|
"mean_token_accuracy": 0.1771351918578148,
|
|
"num_tokens": 22428000.0,
|
|
"step": 8850
|
|
},
|
|
{
|
|
"entropy": 6.236253643035889,
|
|
"epoch": 1.021927293710329,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004907279934078543,
|
|
"loss": 5.943,
|
|
"mean_token_accuracy": 0.1795724704861641,
|
|
"num_tokens": 22440029.0,
|
|
"step": 8855
|
|
},
|
|
{
|
|
"entropy": 6.244734859466552,
|
|
"epoch": 1.0225043277553376,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004907162660800488,
|
|
"loss": 5.9615,
|
|
"mean_token_accuracy": 0.1742117166519165,
|
|
"num_tokens": 22452906.0,
|
|
"step": 8860
|
|
},
|
|
{
|
|
"entropy": 6.252014303207398,
|
|
"epoch": 1.0230813618003463,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004907045314967338,
|
|
"loss": 5.8512,
|
|
"mean_token_accuracy": 0.18662992119789124,
|
|
"num_tokens": 22465853.0,
|
|
"step": 8865
|
|
},
|
|
{
|
|
"entropy": 6.251199388504029,
|
|
"epoch": 1.023658395845355,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004906927896583041,
|
|
"loss": 5.9166,
|
|
"mean_token_accuracy": 0.17843791097402573,
|
|
"num_tokens": 22478583.0,
|
|
"step": 8870
|
|
},
|
|
{
|
|
"entropy": 6.2310069561004635,
|
|
"epoch": 1.0242354298903635,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004906810405651546,
|
|
"loss": 5.9514,
|
|
"mean_token_accuracy": 0.1803251400589943,
|
|
"num_tokens": 22491665.0,
|
|
"step": 8875
|
|
},
|
|
{
|
|
"entropy": 6.290026569366455,
|
|
"epoch": 1.0248124639353722,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004906692842176803,
|
|
"loss": 5.9343,
|
|
"mean_token_accuracy": 0.1794249892234802,
|
|
"num_tokens": 22504015.0,
|
|
"step": 8880
|
|
},
|
|
{
|
|
"entropy": 6.278184032440185,
|
|
"epoch": 1.0253894979803808,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004906575206162769,
|
|
"loss": 6.0169,
|
|
"mean_token_accuracy": 0.1696304887533188,
|
|
"num_tokens": 22516385.0,
|
|
"step": 8885
|
|
},
|
|
{
|
|
"entropy": 6.293035173416138,
|
|
"epoch": 1.0259665320253895,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004906457497613399,
|
|
"loss": 5.9412,
|
|
"mean_token_accuracy": 0.17702967971563338,
|
|
"num_tokens": 22527988.0,
|
|
"step": 8890
|
|
},
|
|
{
|
|
"entropy": 6.225295543670654,
|
|
"epoch": 1.026543566070398,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004906339716532651,
|
|
"loss": 5.9193,
|
|
"mean_token_accuracy": 0.1842564597725868,
|
|
"num_tokens": 22540613.0,
|
|
"step": 8895
|
|
},
|
|
{
|
|
"entropy": 6.214762258529663,
|
|
"epoch": 1.0271206001154067,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004906221862924488,
|
|
"loss": 5.8908,
|
|
"mean_token_accuracy": 0.18303754180669785,
|
|
"num_tokens": 22552137.0,
|
|
"step": 8900
|
|
},
|
|
{
|
|
"entropy": 6.297317934036255,
|
|
"epoch": 1.0276976341604154,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004906103936792875,
|
|
"loss": 5.9925,
|
|
"mean_token_accuracy": 0.16877427697181702,
|
|
"num_tokens": 22564677.0,
|
|
"step": 8905
|
|
},
|
|
{
|
|
"entropy": 6.28624005317688,
|
|
"epoch": 1.028274668205424,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004905985938141777,
|
|
"loss": 5.9234,
|
|
"mean_token_accuracy": 0.18351348042488097,
|
|
"num_tokens": 22578236.0,
|
|
"step": 8910
|
|
},
|
|
{
|
|
"entropy": 6.232121229171753,
|
|
"epoch": 1.0288517022504329,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.0004905867866975163,
|
|
"loss": 5.9395,
|
|
"mean_token_accuracy": 0.18483252376317977,
|
|
"num_tokens": 22592533.0,
|
|
"step": 8915
|
|
},
|
|
{
|
|
"entropy": 6.336761236190796,
|
|
"epoch": 1.0294287362954415,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004905749723297003,
|
|
"loss": 5.9954,
|
|
"mean_token_accuracy": 0.17142664939165114,
|
|
"num_tokens": 22606062.0,
|
|
"step": 8920
|
|
},
|
|
{
|
|
"entropy": 6.330969190597534,
|
|
"epoch": 1.0300057703404502,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004905631507111271,
|
|
"loss": 6.0044,
|
|
"mean_token_accuracy": 0.1759049713611603,
|
|
"num_tokens": 22619342.0,
|
|
"step": 8925
|
|
},
|
|
{
|
|
"entropy": 6.278731107711792,
|
|
"epoch": 1.0305828043854588,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004905513218421946,
|
|
"loss": 5.9213,
|
|
"mean_token_accuracy": 0.1838388368487358,
|
|
"num_tokens": 22632003.0,
|
|
"step": 8930
|
|
},
|
|
{
|
|
"entropy": 6.2721892356872555,
|
|
"epoch": 1.0311598384304674,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004905394857233004,
|
|
"loss": 5.9619,
|
|
"mean_token_accuracy": 0.18194596022367476,
|
|
"num_tokens": 22644179.0,
|
|
"step": 8935
|
|
},
|
|
{
|
|
"entropy": 6.2627777576446535,
|
|
"epoch": 1.031736872475476,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004905276423548426,
|
|
"loss": 5.9137,
|
|
"mean_token_accuracy": 0.18379924744367598,
|
|
"num_tokens": 22657544.0,
|
|
"step": 8940
|
|
},
|
|
{
|
|
"entropy": 6.312189292907715,
|
|
"epoch": 1.0323139065204847,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004905157917372197,
|
|
"loss": 6.032,
|
|
"mean_token_accuracy": 0.16942367404699327,
|
|
"num_tokens": 22670789.0,
|
|
"step": 8945
|
|
},
|
|
{
|
|
"entropy": 6.268924760818481,
|
|
"epoch": 1.0328909405654934,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004905039338708302,
|
|
"loss": 5.9336,
|
|
"mean_token_accuracy": 0.1744486227631569,
|
|
"num_tokens": 22682491.0,
|
|
"step": 8950
|
|
},
|
|
{
|
|
"entropy": 6.331513929367065,
|
|
"epoch": 1.033467974610502,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004904920687560728,
|
|
"loss": 5.958,
|
|
"mean_token_accuracy": 0.17775530517101287,
|
|
"num_tokens": 22695235.0,
|
|
"step": 8955
|
|
},
|
|
{
|
|
"entropy": 6.240482997894287,
|
|
"epoch": 1.0340450086555106,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004904801963933469,
|
|
"loss": 5.9817,
|
|
"mean_token_accuracy": 0.1754314720630646,
|
|
"num_tokens": 22707222.0,
|
|
"step": 8960
|
|
},
|
|
{
|
|
"entropy": 6.281684684753418,
|
|
"epoch": 1.0346220427005193,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004904683167830515,
|
|
"loss": 5.9881,
|
|
"mean_token_accuracy": 0.17204625010490418,
|
|
"num_tokens": 22718820.0,
|
|
"step": 8965
|
|
},
|
|
{
|
|
"entropy": 6.3858250141143795,
|
|
"epoch": 1.035199076745528,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004904564299255862,
|
|
"loss": 5.9487,
|
|
"mean_token_accuracy": 0.1777167558670044,
|
|
"num_tokens": 22731265.0,
|
|
"step": 8970
|
|
},
|
|
{
|
|
"entropy": 6.2346197128295895,
|
|
"epoch": 1.0357761107905366,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004904445358213511,
|
|
"loss": 5.8784,
|
|
"mean_token_accuracy": 0.18681784719228745,
|
|
"num_tokens": 22744222.0,
|
|
"step": 8975
|
|
},
|
|
{
|
|
"entropy": 6.2135519027709964,
|
|
"epoch": 1.0363531448355452,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004904326344707461,
|
|
"loss": 5.9367,
|
|
"mean_token_accuracy": 0.17929679304361343,
|
|
"num_tokens": 22756190.0,
|
|
"step": 8980
|
|
},
|
|
{
|
|
"entropy": 6.2172692775726315,
|
|
"epoch": 1.036930178880554,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004904207258741712,
|
|
"loss": 5.8621,
|
|
"mean_token_accuracy": 0.18134094625711442,
|
|
"num_tokens": 22767943.0,
|
|
"step": 8985
|
|
},
|
|
{
|
|
"entropy": 6.245588541030884,
|
|
"epoch": 1.0375072129255627,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004904088100320274,
|
|
"loss": 5.926,
|
|
"mean_token_accuracy": 0.18322079628705978,
|
|
"num_tokens": 22780972.0,
|
|
"step": 8990
|
|
},
|
|
{
|
|
"entropy": 6.313575077056885,
|
|
"epoch": 1.0380842469705713,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004903968869447151,
|
|
"loss": 6.0264,
|
|
"mean_token_accuracy": 0.17490241527557374,
|
|
"num_tokens": 22792584.0,
|
|
"step": 8995
|
|
},
|
|
{
|
|
"entropy": 6.190945482254028,
|
|
"epoch": 1.03866128101558,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004903849566126356,
|
|
"loss": 5.9896,
|
|
"mean_token_accuracy": 0.18099549263715745,
|
|
"num_tokens": 22807385.0,
|
|
"step": 9000
|
|
},
|
|
{
|
|
"epoch": 1.03866128101558,
|
|
"eval_entropy": 6.084721145014346,
|
|
"eval_loss": 6.074094295501709,
|
|
"eval_mean_token_accuracy": 0.17770804125441725,
|
|
"eval_num_tokens": 22807385.0,
|
|
"eval_runtime": 17.4178,
|
|
"eval_samples_per_second": 1615.359,
|
|
"eval_steps_per_second": 201.92,
|
|
"step": 9000
|
|
},
|
|
{
|
|
"entropy": 6.313442659378052,
|
|
"epoch": 1.0392383150605886,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004903730190361902,
|
|
"loss": 5.9632,
|
|
"mean_token_accuracy": 0.17392656654119493,
|
|
"num_tokens": 22820655.0,
|
|
"step": 9005
|
|
},
|
|
{
|
|
"entropy": 6.274996948242188,
|
|
"epoch": 1.0398153491055973,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00049036107421578,
|
|
"loss": 5.875,
|
|
"mean_token_accuracy": 0.185438571870327,
|
|
"num_tokens": 22833043.0,
|
|
"step": 9010
|
|
},
|
|
{
|
|
"entropy": 6.250527429580688,
|
|
"epoch": 1.040392383150606,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004903491221518073,
|
|
"loss": 5.9999,
|
|
"mean_token_accuracy": 0.17539497166872026,
|
|
"num_tokens": 22844414.0,
|
|
"step": 9015
|
|
},
|
|
{
|
|
"entropy": 6.217691421508789,
|
|
"epoch": 1.0409694171956145,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004903371628446737,
|
|
"loss": 5.8996,
|
|
"mean_token_accuracy": 0.17889068573713302,
|
|
"num_tokens": 22855966.0,
|
|
"step": 9020
|
|
},
|
|
{
|
|
"entropy": 6.195151519775391,
|
|
"epoch": 1.0415464512406232,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004903251962947817,
|
|
"loss": 5.8646,
|
|
"mean_token_accuracy": 0.1914926216006279,
|
|
"num_tokens": 22869300.0,
|
|
"step": 9025
|
|
},
|
|
{
|
|
"entropy": 6.31218843460083,
|
|
"epoch": 1.0421234852856318,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004903132225025335,
|
|
"loss": 5.9627,
|
|
"mean_token_accuracy": 0.17988667339086534,
|
|
"num_tokens": 22881040.0,
|
|
"step": 9030
|
|
},
|
|
{
|
|
"entropy": 6.275069904327393,
|
|
"epoch": 1.0427005193306405,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004903012414683322,
|
|
"loss": 5.8637,
|
|
"mean_token_accuracy": 0.1878153622150421,
|
|
"num_tokens": 22892367.0,
|
|
"step": 9035
|
|
},
|
|
{
|
|
"entropy": 6.274021911621094,
|
|
"epoch": 1.043277553375649,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004902892531925805,
|
|
"loss": 6.0153,
|
|
"mean_token_accuracy": 0.17131800800561905,
|
|
"num_tokens": 22904737.0,
|
|
"step": 9040
|
|
},
|
|
{
|
|
"entropy": 6.24939112663269,
|
|
"epoch": 1.0438545874206577,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004902772576756818,
|
|
"loss": 6.0132,
|
|
"mean_token_accuracy": 0.17432661205530167,
|
|
"num_tokens": 22917775.0,
|
|
"step": 9045
|
|
},
|
|
{
|
|
"entropy": 6.313559484481812,
|
|
"epoch": 1.0444316214656664,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004902652549180394,
|
|
"loss": 6.0118,
|
|
"mean_token_accuracy": 0.17096944749355317,
|
|
"num_tokens": 22930496.0,
|
|
"step": 9050
|
|
},
|
|
{
|
|
"entropy": 6.278980875015259,
|
|
"epoch": 1.0450086555106752,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004902532449200571,
|
|
"loss": 5.9626,
|
|
"mean_token_accuracy": 0.17596296668052674,
|
|
"num_tokens": 22943787.0,
|
|
"step": 9055
|
|
},
|
|
{
|
|
"entropy": 6.249150037765503,
|
|
"epoch": 1.0455856895556839,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004902412276821386,
|
|
"loss": 5.9539,
|
|
"mean_token_accuracy": 0.1785372719168663,
|
|
"num_tokens": 22956399.0,
|
|
"step": 9060
|
|
},
|
|
{
|
|
"entropy": 6.36644868850708,
|
|
"epoch": 1.0461627236006925,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004902292032046887,
|
|
"loss": 6.031,
|
|
"mean_token_accuracy": 0.1718607723712921,
|
|
"num_tokens": 22969993.0,
|
|
"step": 9065
|
|
},
|
|
{
|
|
"entropy": 6.401646375656128,
|
|
"epoch": 1.0467397576457012,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004902171714881112,
|
|
"loss": 6.0586,
|
|
"mean_token_accuracy": 0.1708688423037529,
|
|
"num_tokens": 22983807.0,
|
|
"step": 9070
|
|
},
|
|
{
|
|
"entropy": 6.274668025970459,
|
|
"epoch": 1.0473167916907098,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004902051325328112,
|
|
"loss": 6.004,
|
|
"mean_token_accuracy": 0.1766917884349823,
|
|
"num_tokens": 22996238.0,
|
|
"step": 9075
|
|
},
|
|
{
|
|
"entropy": 6.275001811981201,
|
|
"epoch": 1.0478938257357184,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004901930863391934,
|
|
"loss": 6.0022,
|
|
"mean_token_accuracy": 0.17750514149665833,
|
|
"num_tokens": 23009084.0,
|
|
"step": 9080
|
|
},
|
|
{
|
|
"entropy": 6.3538471221923825,
|
|
"epoch": 1.048470859780727,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.000490181032907663,
|
|
"loss": 6.0333,
|
|
"mean_token_accuracy": 0.1733698308467865,
|
|
"num_tokens": 23022799.0,
|
|
"step": 9085
|
|
},
|
|
{
|
|
"entropy": 6.252536058425903,
|
|
"epoch": 1.0490478938257357,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004901689722386255,
|
|
"loss": 5.9922,
|
|
"mean_token_accuracy": 0.17759983390569686,
|
|
"num_tokens": 23035566.0,
|
|
"step": 9090
|
|
},
|
|
{
|
|
"entropy": 6.217030572891235,
|
|
"epoch": 1.0496249278707444,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0004901569043324864,
|
|
"loss": 5.8551,
|
|
"mean_token_accuracy": 0.18937528282403945,
|
|
"num_tokens": 23050156.0,
|
|
"step": 9095
|
|
},
|
|
{
|
|
"entropy": 6.304140615463257,
|
|
"epoch": 1.050201961915753,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004901448291896518,
|
|
"loss": 5.964,
|
|
"mean_token_accuracy": 0.17621853202581406,
|
|
"num_tokens": 23063121.0,
|
|
"step": 9100
|
|
},
|
|
{
|
|
"entropy": 6.211063194274902,
|
|
"epoch": 1.0507789959607616,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004901327468105277,
|
|
"loss": 5.8365,
|
|
"mean_token_accuracy": 0.18590471446514129,
|
|
"num_tokens": 23075236.0,
|
|
"step": 9105
|
|
},
|
|
{
|
|
"entropy": 6.220917272567749,
|
|
"epoch": 1.0513560300057703,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004901206571955205,
|
|
"loss": 6.011,
|
|
"mean_token_accuracy": 0.17641226947307587,
|
|
"num_tokens": 23089091.0,
|
|
"step": 9110
|
|
},
|
|
{
|
|
"entropy": 6.319421052932739,
|
|
"epoch": 1.051933064050779,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004901085603450369,
|
|
"loss": 5.9762,
|
|
"mean_token_accuracy": 0.17164439111948013,
|
|
"num_tokens": 23101642.0,
|
|
"step": 9115
|
|
},
|
|
{
|
|
"entropy": 6.340474700927734,
|
|
"epoch": 1.0525100980957875,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004900964562594838,
|
|
"loss": 5.9078,
|
|
"mean_token_accuracy": 0.1801260828971863,
|
|
"num_tokens": 23113427.0,
|
|
"step": 9120
|
|
},
|
|
{
|
|
"entropy": 6.2288182258605955,
|
|
"epoch": 1.0530871321407964,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.000490084344939268,
|
|
"loss": 5.883,
|
|
"mean_token_accuracy": 0.18409405052661895,
|
|
"num_tokens": 23125857.0,
|
|
"step": 9125
|
|
},
|
|
{
|
|
"entropy": 6.2246747493743895,
|
|
"epoch": 1.053664166185805,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004900722263847973,
|
|
"loss": 5.9355,
|
|
"mean_token_accuracy": 0.1781703308224678,
|
|
"num_tokens": 23138541.0,
|
|
"step": 9130
|
|
},
|
|
{
|
|
"entropy": 6.216336917877197,
|
|
"epoch": 1.0542412002308137,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004900601005964791,
|
|
"loss": 5.9201,
|
|
"mean_token_accuracy": 0.18445058017969132,
|
|
"num_tokens": 23151155.0,
|
|
"step": 9135
|
|
},
|
|
{
|
|
"entropy": 6.2328308582305905,
|
|
"epoch": 1.0548182342758223,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004900479675747212,
|
|
"loss": 5.9428,
|
|
"mean_token_accuracy": 0.1755356252193451,
|
|
"num_tokens": 23165478.0,
|
|
"step": 9140
|
|
},
|
|
{
|
|
"entropy": 6.286372423171997,
|
|
"epoch": 1.055395268320831,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004900358273199316,
|
|
"loss": 5.9476,
|
|
"mean_token_accuracy": 0.17133285999298095,
|
|
"num_tokens": 23178120.0,
|
|
"step": 9145
|
|
},
|
|
{
|
|
"entropy": 6.308216190338134,
|
|
"epoch": 1.0559723023658396,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.000490023679832519,
|
|
"loss": 5.9634,
|
|
"mean_token_accuracy": 0.17226850390434265,
|
|
"num_tokens": 23191275.0,
|
|
"step": 9150
|
|
},
|
|
{
|
|
"entropy": 6.207145166397095,
|
|
"epoch": 1.0565493364108482,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004900115251128916,
|
|
"loss": 5.9664,
|
|
"mean_token_accuracy": 0.17270159721374512,
|
|
"num_tokens": 23204518.0,
|
|
"step": 9155
|
|
},
|
|
{
|
|
"entropy": 6.368451738357544,
|
|
"epoch": 1.057126370455857,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004899993631614583,
|
|
"loss": 6.0091,
|
|
"mean_token_accuracy": 0.17063124030828475,
|
|
"num_tokens": 23217488.0,
|
|
"step": 9160
|
|
},
|
|
{
|
|
"entropy": 6.297813034057617,
|
|
"epoch": 1.0577034045008655,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004899871939786283,
|
|
"loss": 5.9517,
|
|
"mean_token_accuracy": 0.17866510897874832,
|
|
"num_tokens": 23230101.0,
|
|
"step": 9165
|
|
},
|
|
{
|
|
"entropy": 6.250898981094361,
|
|
"epoch": 1.0582804385458742,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004899750175648107,
|
|
"loss": 6.1023,
|
|
"mean_token_accuracy": 0.16902584880590438,
|
|
"num_tokens": 23243747.0,
|
|
"step": 9170
|
|
},
|
|
{
|
|
"entropy": 6.296909427642822,
|
|
"epoch": 1.0588574725908828,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004899628339204154,
|
|
"loss": 5.8954,
|
|
"mean_token_accuracy": 0.18030100166797638,
|
|
"num_tokens": 23256593.0,
|
|
"step": 9175
|
|
},
|
|
{
|
|
"entropy": 6.293514776229858,
|
|
"epoch": 1.0594345066358914,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004899506430458518,
|
|
"loss": 6.0224,
|
|
"mean_token_accuracy": 0.17253340929746627,
|
|
"num_tokens": 23269359.0,
|
|
"step": 9180
|
|
},
|
|
{
|
|
"entropy": 6.199410676956177,
|
|
"epoch": 1.0600115406809,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004899384449415302,
|
|
"loss": 5.8559,
|
|
"mean_token_accuracy": 0.1903077781200409,
|
|
"num_tokens": 23283462.0,
|
|
"step": 9185
|
|
},
|
|
{
|
|
"entropy": 6.2551408290863035,
|
|
"epoch": 1.0605885747259087,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004899262396078606,
|
|
"loss": 5.96,
|
|
"mean_token_accuracy": 0.17357292026281357,
|
|
"num_tokens": 23295920.0,
|
|
"step": 9190
|
|
},
|
|
{
|
|
"entropy": 6.3527368068695065,
|
|
"epoch": 1.0611656087709176,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004899140270452539,
|
|
"loss": 5.9859,
|
|
"mean_token_accuracy": 0.17623718380928038,
|
|
"num_tokens": 23307433.0,
|
|
"step": 9195
|
|
},
|
|
{
|
|
"entropy": 6.2791832447052,
|
|
"epoch": 1.0617426428159262,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004899018072541204,
|
|
"loss": 5.9317,
|
|
"mean_token_accuracy": 0.17714277356863023,
|
|
"num_tokens": 23320265.0,
|
|
"step": 9200
|
|
},
|
|
{
|
|
"entropy": 6.240837335586548,
|
|
"epoch": 1.0623196768609349,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004898895802348715,
|
|
"loss": 5.8086,
|
|
"mean_token_accuracy": 0.18867361545562744,
|
|
"num_tokens": 23331951.0,
|
|
"step": 9205
|
|
},
|
|
{
|
|
"entropy": 6.241315603256226,
|
|
"epoch": 1.0628967109059435,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004898773459879183,
|
|
"loss": 5.9554,
|
|
"mean_token_accuracy": 0.17665793150663375,
|
|
"num_tokens": 23344862.0,
|
|
"step": 9210
|
|
},
|
|
{
|
|
"entropy": 6.263033628463745,
|
|
"epoch": 1.0634737449509521,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004898651045136724,
|
|
"loss": 5.9015,
|
|
"mean_token_accuracy": 0.1770300403237343,
|
|
"num_tokens": 23357212.0,
|
|
"step": 9215
|
|
},
|
|
{
|
|
"entropy": 6.239983558654785,
|
|
"epoch": 1.0640507789959608,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004898528558125453,
|
|
"loss": 5.9122,
|
|
"mean_token_accuracy": 0.1855781152844429,
|
|
"num_tokens": 23370114.0,
|
|
"step": 9220
|
|
},
|
|
{
|
|
"entropy": 6.2795045375823975,
|
|
"epoch": 1.0646278130409694,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004898405998849492,
|
|
"loss": 5.9202,
|
|
"mean_token_accuracy": 0.17944572120904922,
|
|
"num_tokens": 23382295.0,
|
|
"step": 9225
|
|
},
|
|
{
|
|
"entropy": 6.242071914672851,
|
|
"epoch": 1.065204847085978,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004898283367312962,
|
|
"loss": 5.9646,
|
|
"mean_token_accuracy": 0.18123720586299896,
|
|
"num_tokens": 23395477.0,
|
|
"step": 9230
|
|
},
|
|
{
|
|
"entropy": 6.255929803848266,
|
|
"epoch": 1.0657818811309867,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004898160663519988,
|
|
"loss": 5.8941,
|
|
"mean_token_accuracy": 0.18162889778614044,
|
|
"num_tokens": 23407868.0,
|
|
"step": 9235
|
|
},
|
|
{
|
|
"entropy": 6.257204484939575,
|
|
"epoch": 1.0663589151759953,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004898037887474697,
|
|
"loss": 5.9754,
|
|
"mean_token_accuracy": 0.17620085179805756,
|
|
"num_tokens": 23422156.0,
|
|
"step": 9240
|
|
},
|
|
{
|
|
"entropy": 6.26265287399292,
|
|
"epoch": 1.066935949221004,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004897915039181219,
|
|
"loss": 5.9044,
|
|
"mean_token_accuracy": 0.18346980959177017,
|
|
"num_tokens": 23433951.0,
|
|
"step": 9245
|
|
},
|
|
{
|
|
"entropy": 6.230978536605835,
|
|
"epoch": 1.0675129832660126,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004897792118643685,
|
|
"loss": 5.9532,
|
|
"mean_token_accuracy": 0.18462717086076735,
|
|
"num_tokens": 23447174.0,
|
|
"step": 9250
|
|
},
|
|
{
|
|
"entropy": 6.2545677661895756,
|
|
"epoch": 1.0680900173110213,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004897669125866231,
|
|
"loss": 5.9351,
|
|
"mean_token_accuracy": 0.18284523487091064,
|
|
"num_tokens": 23458502.0,
|
|
"step": 9255
|
|
},
|
|
{
|
|
"entropy": 6.270356178283691,
|
|
"epoch": 1.06866705135603,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004897546060852993,
|
|
"loss": 6.0253,
|
|
"mean_token_accuracy": 0.17326220422983168,
|
|
"num_tokens": 23471572.0,
|
|
"step": 9260
|
|
},
|
|
{
|
|
"entropy": 6.228240203857422,
|
|
"epoch": 1.0692440854010385,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004897422923608108,
|
|
"loss": 5.8997,
|
|
"mean_token_accuracy": 0.1773914650082588,
|
|
"num_tokens": 23484454.0,
|
|
"step": 9265
|
|
},
|
|
{
|
|
"entropy": 6.254168748855591,
|
|
"epoch": 1.0698211194460474,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004897299714135721,
|
|
"loss": 5.9925,
|
|
"mean_token_accuracy": 0.17173787504434584,
|
|
"num_tokens": 23497022.0,
|
|
"step": 9270
|
|
},
|
|
{
|
|
"entropy": 6.310999917984009,
|
|
"epoch": 1.070398153491056,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004897176432439974,
|
|
"loss": 5.9631,
|
|
"mean_token_accuracy": 0.18117151111364366,
|
|
"num_tokens": 23510714.0,
|
|
"step": 9275
|
|
},
|
|
{
|
|
"entropy": 6.266863012313843,
|
|
"epoch": 1.0709751875360647,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004897053078525016,
|
|
"loss": 5.9645,
|
|
"mean_token_accuracy": 0.17361937761306762,
|
|
"num_tokens": 23522927.0,
|
|
"step": 9280
|
|
},
|
|
{
|
|
"entropy": 6.237617301940918,
|
|
"epoch": 1.0715522215810733,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004896929652394993,
|
|
"loss": 5.861,
|
|
"mean_token_accuracy": 0.1824570968747139,
|
|
"num_tokens": 23536042.0,
|
|
"step": 9285
|
|
},
|
|
{
|
|
"entropy": 6.3404463768005375,
|
|
"epoch": 1.072129255626082,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004896806154054057,
|
|
"loss": 5.9772,
|
|
"mean_token_accuracy": 0.17799821645021438,
|
|
"num_tokens": 23549002.0,
|
|
"step": 9290
|
|
},
|
|
{
|
|
"entropy": 6.2474583148956295,
|
|
"epoch": 1.0727062896710906,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004896682583506363,
|
|
"loss": 6.0185,
|
|
"mean_token_accuracy": 0.17269163578748703,
|
|
"num_tokens": 23563080.0,
|
|
"step": 9295
|
|
},
|
|
{
|
|
"entropy": 6.307273435592651,
|
|
"epoch": 1.0732833237160992,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004896558940756067,
|
|
"loss": 5.9423,
|
|
"mean_token_accuracy": 0.176519912481308,
|
|
"num_tokens": 23577431.0,
|
|
"step": 9300
|
|
},
|
|
{
|
|
"entropy": 6.2496092319488525,
|
|
"epoch": 1.0738603577611079,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004896435225807327,
|
|
"loss": 5.8596,
|
|
"mean_token_accuracy": 0.1761957362294197,
|
|
"num_tokens": 23591191.0,
|
|
"step": 9305
|
|
},
|
|
{
|
|
"entropy": 6.230933475494385,
|
|
"epoch": 1.0744373918061165,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004896311438664304,
|
|
"loss": 5.8573,
|
|
"mean_token_accuracy": 0.18647629022598267,
|
|
"num_tokens": 23603195.0,
|
|
"step": 9310
|
|
},
|
|
{
|
|
"entropy": 6.254529142379761,
|
|
"epoch": 1.0750144258511252,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004896187579331163,
|
|
"loss": 5.9028,
|
|
"mean_token_accuracy": 0.1798198029398918,
|
|
"num_tokens": 23615278.0,
|
|
"step": 9315
|
|
},
|
|
{
|
|
"entropy": 6.273842239379883,
|
|
"epoch": 1.0755914598961338,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004896063647812068,
|
|
"loss": 5.9939,
|
|
"mean_token_accuracy": 0.1774792715907097,
|
|
"num_tokens": 23627311.0,
|
|
"step": 9320
|
|
},
|
|
{
|
|
"entropy": 6.239826726913452,
|
|
"epoch": 1.0761684939411424,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004895939644111189,
|
|
"loss": 5.9215,
|
|
"mean_token_accuracy": 0.18126792460680008,
|
|
"num_tokens": 23640338.0,
|
|
"step": 9325
|
|
},
|
|
{
|
|
"entropy": 6.3032557487487795,
|
|
"epoch": 1.076745527986151,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004895815568232694,
|
|
"loss": 6.0196,
|
|
"mean_token_accuracy": 0.17663963586091996,
|
|
"num_tokens": 23654541.0,
|
|
"step": 9330
|
|
},
|
|
{
|
|
"entropy": 6.281169319152832,
|
|
"epoch": 1.07732256203116,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004895691420180759,
|
|
"loss": 5.9846,
|
|
"mean_token_accuracy": 0.1778423696756363,
|
|
"num_tokens": 23666837.0,
|
|
"step": 9335
|
|
},
|
|
{
|
|
"entropy": 6.35228910446167,
|
|
"epoch": 1.0778995960761686,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000489556719995956,
|
|
"loss": 5.97,
|
|
"mean_token_accuracy": 0.1766431748867035,
|
|
"num_tokens": 23679270.0,
|
|
"step": 9340
|
|
},
|
|
{
|
|
"entropy": 6.268666172027588,
|
|
"epoch": 1.0784766301211772,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004895442907573274,
|
|
"loss": 5.9574,
|
|
"mean_token_accuracy": 0.178663232922554,
|
|
"num_tokens": 23691640.0,
|
|
"step": 9345
|
|
},
|
|
{
|
|
"entropy": 6.240317010879517,
|
|
"epoch": 1.0790536641661859,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.000489531854302608,
|
|
"loss": 5.9613,
|
|
"mean_token_accuracy": 0.17662242352962493,
|
|
"num_tokens": 23704545.0,
|
|
"step": 9350
|
|
},
|
|
{
|
|
"entropy": 6.238865852355957,
|
|
"epoch": 1.0796306982111945,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004895194106322164,
|
|
"loss": 5.9033,
|
|
"mean_token_accuracy": 0.1860482156276703,
|
|
"num_tokens": 23716319.0,
|
|
"step": 9355
|
|
},
|
|
{
|
|
"entropy": 6.265583896636963,
|
|
"epoch": 1.0802077322562031,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004895069597465709,
|
|
"loss": 5.9715,
|
|
"mean_token_accuracy": 0.1786327689886093,
|
|
"num_tokens": 23728633.0,
|
|
"step": 9360
|
|
},
|
|
{
|
|
"entropy": 6.3230654239654545,
|
|
"epoch": 1.0807847663012118,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004894945016460904,
|
|
"loss": 5.9901,
|
|
"mean_token_accuracy": 0.1795554667711258,
|
|
"num_tokens": 23741370.0,
|
|
"step": 9365
|
|
},
|
|
{
|
|
"entropy": 6.235442304611206,
|
|
"epoch": 1.0813618003462204,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004894820363311938,
|
|
"loss": 5.917,
|
|
"mean_token_accuracy": 0.185208560526371,
|
|
"num_tokens": 23754026.0,
|
|
"step": 9370
|
|
},
|
|
{
|
|
"entropy": 6.2940778732299805,
|
|
"epoch": 1.081938834391229,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004894695638023005,
|
|
"loss": 6.017,
|
|
"mean_token_accuracy": 0.16951347440481185,
|
|
"num_tokens": 23766950.0,
|
|
"step": 9375
|
|
},
|
|
{
|
|
"entropy": 6.275958490371704,
|
|
"epoch": 1.0825158684362377,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.00048945708405983,
|
|
"loss": 5.9975,
|
|
"mean_token_accuracy": 0.17893885672092438,
|
|
"num_tokens": 23780858.0,
|
|
"step": 9380
|
|
},
|
|
{
|
|
"entropy": 6.270656681060791,
|
|
"epoch": 1.0830929024812463,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004894445971042019,
|
|
"loss": 5.9415,
|
|
"mean_token_accuracy": 0.17487251460552217,
|
|
"num_tokens": 23793213.0,
|
|
"step": 9385
|
|
},
|
|
{
|
|
"entropy": 6.233089923858643,
|
|
"epoch": 1.083669936526255,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004894321029358364,
|
|
"loss": 5.9367,
|
|
"mean_token_accuracy": 0.17659147530794145,
|
|
"num_tokens": 23804754.0,
|
|
"step": 9390
|
|
},
|
|
{
|
|
"entropy": 6.246839284896851,
|
|
"epoch": 1.0842469705712636,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004894196015551536,
|
|
"loss": 5.9952,
|
|
"mean_token_accuracy": 0.17514082789421082,
|
|
"num_tokens": 23817503.0,
|
|
"step": 9395
|
|
},
|
|
{
|
|
"entropy": 6.269915151596069,
|
|
"epoch": 1.0848240046162723,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.000489407092962574,
|
|
"loss": 5.9739,
|
|
"mean_token_accuracy": 0.17312580794095994,
|
|
"num_tokens": 23830263.0,
|
|
"step": 9400
|
|
},
|
|
{
|
|
"entropy": 6.2076012134552006,
|
|
"epoch": 1.085401038661281,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004893945771585183,
|
|
"loss": 5.8892,
|
|
"mean_token_accuracy": 0.18111756443977356,
|
|
"num_tokens": 23843734.0,
|
|
"step": 9405
|
|
},
|
|
{
|
|
"entropy": 6.334919023513794,
|
|
"epoch": 1.0859780727062898,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004893820541434075,
|
|
"loss": 5.994,
|
|
"mean_token_accuracy": 0.1769810661673546,
|
|
"num_tokens": 23856857.0,
|
|
"step": 9410
|
|
},
|
|
{
|
|
"entropy": 6.277773189544678,
|
|
"epoch": 1.0865551067512984,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004893695239176629,
|
|
"loss": 5.8815,
|
|
"mean_token_accuracy": 0.18349405825138093,
|
|
"num_tokens": 23869961.0,
|
|
"step": 9415
|
|
},
|
|
{
|
|
"entropy": 6.309881114959717,
|
|
"epoch": 1.087132140796307,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004893569864817057,
|
|
"loss": 5.9669,
|
|
"mean_token_accuracy": 0.17408453524112702,
|
|
"num_tokens": 23884551.0,
|
|
"step": 9420
|
|
},
|
|
{
|
|
"entropy": 6.270121240615845,
|
|
"epoch": 1.0877091748413157,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004893444418359579,
|
|
"loss": 6.0336,
|
|
"mean_token_accuracy": 0.17170625180006027,
|
|
"num_tokens": 23897240.0,
|
|
"step": 9425
|
|
},
|
|
{
|
|
"entropy": 6.264082288742065,
|
|
"epoch": 1.0882862088863243,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.000489331889980841,
|
|
"loss": 5.9237,
|
|
"mean_token_accuracy": 0.17865306586027146,
|
|
"num_tokens": 23909677.0,
|
|
"step": 9430
|
|
},
|
|
{
|
|
"entropy": 6.2898622989654545,
|
|
"epoch": 1.088863242931333,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004893193309167778,
|
|
"loss": 5.9709,
|
|
"mean_token_accuracy": 0.1740755632519722,
|
|
"num_tokens": 23921552.0,
|
|
"step": 9435
|
|
},
|
|
{
|
|
"entropy": 6.293569660186767,
|
|
"epoch": 1.0894402769763416,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004893067646441902,
|
|
"loss": 5.9893,
|
|
"mean_token_accuracy": 0.1750696122646332,
|
|
"num_tokens": 23936315.0,
|
|
"step": 9440
|
|
},
|
|
{
|
|
"entropy": 6.2551616668701175,
|
|
"epoch": 1.0900173110213502,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.000489294191163501,
|
|
"loss": 5.989,
|
|
"mean_token_accuracy": 0.1700183093547821,
|
|
"num_tokens": 23948939.0,
|
|
"step": 9445
|
|
},
|
|
{
|
|
"entropy": 6.315537405014038,
|
|
"epoch": 1.0905943450663589,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004892816104751331,
|
|
"loss": 5.9714,
|
|
"mean_token_accuracy": 0.17250317335128784,
|
|
"num_tokens": 23961657.0,
|
|
"step": 9450
|
|
},
|
|
{
|
|
"entropy": 6.379075288772583,
|
|
"epoch": 1.0911713791113675,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004892690225795096,
|
|
"loss": 6.0779,
|
|
"mean_token_accuracy": 0.16363574415445328,
|
|
"num_tokens": 23974085.0,
|
|
"step": 9455
|
|
},
|
|
{
|
|
"entropy": 6.226323127746582,
|
|
"epoch": 1.0917484131563762,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004892564274770542,
|
|
"loss": 5.8984,
|
|
"mean_token_accuracy": 0.18159161359071732,
|
|
"num_tokens": 23987038.0,
|
|
"step": 9460
|
|
},
|
|
{
|
|
"entropy": 6.324076747894287,
|
|
"epoch": 1.0923254472013848,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004892438251681901,
|
|
"loss": 5.9539,
|
|
"mean_token_accuracy": 0.1822775423526764,
|
|
"num_tokens": 24001051.0,
|
|
"step": 9465
|
|
},
|
|
{
|
|
"entropy": 6.249374294281006,
|
|
"epoch": 1.0929024812463934,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004892312156533413,
|
|
"loss": 5.9418,
|
|
"mean_token_accuracy": 0.17759458720684052,
|
|
"num_tokens": 24013817.0,
|
|
"step": 9470
|
|
},
|
|
{
|
|
"entropy": 6.213703584671021,
|
|
"epoch": 1.0934795152914023,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004892185989329321,
|
|
"loss": 5.9026,
|
|
"mean_token_accuracy": 0.18459791988134383,
|
|
"num_tokens": 24025810.0,
|
|
"step": 9475
|
|
},
|
|
{
|
|
"entropy": 6.205026483535766,
|
|
"epoch": 1.094056549336411,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004892059750073868,
|
|
"loss": 5.8696,
|
|
"mean_token_accuracy": 0.18799868524074553,
|
|
"num_tokens": 24039796.0,
|
|
"step": 9480
|
|
},
|
|
{
|
|
"entropy": 6.299359941482544,
|
|
"epoch": 1.0946335833814196,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004891933438771299,
|
|
"loss": 5.9544,
|
|
"mean_token_accuracy": 0.18001185804605485,
|
|
"num_tokens": 24052721.0,
|
|
"step": 9485
|
|
},
|
|
{
|
|
"entropy": 6.223298168182373,
|
|
"epoch": 1.0952106174264282,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004891807055425862,
|
|
"loss": 5.8763,
|
|
"mean_token_accuracy": 0.18155607432127,
|
|
"num_tokens": 24064515.0,
|
|
"step": 9490
|
|
},
|
|
{
|
|
"entropy": 6.23270058631897,
|
|
"epoch": 1.0957876514714369,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004891680600041809,
|
|
"loss": 5.8902,
|
|
"mean_token_accuracy": 0.18266638964414597,
|
|
"num_tokens": 24078537.0,
|
|
"step": 9495
|
|
},
|
|
{
|
|
"entropy": 6.345634460449219,
|
|
"epoch": 1.0963646855164455,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004891554072623392,
|
|
"loss": 6.0158,
|
|
"mean_token_accuracy": 0.17161341458559037,
|
|
"num_tokens": 24092067.0,
|
|
"step": 9500
|
|
},
|
|
{
|
|
"entropy": 6.255663776397705,
|
|
"epoch": 1.0969417195614541,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004891427473174869,
|
|
"loss": 5.9806,
|
|
"mean_token_accuracy": 0.17526648789644242,
|
|
"num_tokens": 24105625.0,
|
|
"step": 9505
|
|
},
|
|
{
|
|
"entropy": 6.310681390762329,
|
|
"epoch": 1.0975187536064628,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004891300801700496,
|
|
"loss": 5.9889,
|
|
"mean_token_accuracy": 0.1670171231031418,
|
|
"num_tokens": 24119714.0,
|
|
"step": 9510
|
|
},
|
|
{
|
|
"entropy": 6.2422620296478275,
|
|
"epoch": 1.0980957876514714,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004891174058204534,
|
|
"loss": 5.9128,
|
|
"mean_token_accuracy": 0.17377041578292846,
|
|
"num_tokens": 24132873.0,
|
|
"step": 9515
|
|
},
|
|
{
|
|
"entropy": 6.1889232158660885,
|
|
"epoch": 1.09867282169648,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004891047242691246,
|
|
"loss": 5.8912,
|
|
"mean_token_accuracy": 0.17926355302333832,
|
|
"num_tokens": 24145550.0,
|
|
"step": 9520
|
|
},
|
|
{
|
|
"entropy": 6.221427726745605,
|
|
"epoch": 1.0992498557414887,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004890920355164897,
|
|
"loss": 5.9078,
|
|
"mean_token_accuracy": 0.17647993713617324,
|
|
"num_tokens": 24158232.0,
|
|
"step": 9525
|
|
},
|
|
{
|
|
"entropy": 6.305940246582031,
|
|
"epoch": 1.0998268897864973,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004890793395629756,
|
|
"loss": 6.049,
|
|
"mean_token_accuracy": 0.16808070093393326,
|
|
"num_tokens": 24170780.0,
|
|
"step": 9530
|
|
},
|
|
{
|
|
"entropy": 6.220670223236084,
|
|
"epoch": 1.100403923831506,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004890666364090093,
|
|
"loss": 5.9178,
|
|
"mean_token_accuracy": 0.18042859733104705,
|
|
"num_tokens": 24182347.0,
|
|
"step": 9535
|
|
},
|
|
{
|
|
"entropy": 6.292816114425659,
|
|
"epoch": 1.1009809578765146,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004890539260550181,
|
|
"loss": 6.0075,
|
|
"mean_token_accuracy": 0.1743740364909172,
|
|
"num_tokens": 24195215.0,
|
|
"step": 9540
|
|
},
|
|
{
|
|
"entropy": 6.28514461517334,
|
|
"epoch": 1.1015579919215233,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004890412085014292,
|
|
"loss": 5.9182,
|
|
"mean_token_accuracy": 0.18192071616649627,
|
|
"num_tokens": 24208214.0,
|
|
"step": 9545
|
|
},
|
|
{
|
|
"entropy": 6.272170162200927,
|
|
"epoch": 1.1021350259665321,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004890284837486706,
|
|
"loss": 5.9363,
|
|
"mean_token_accuracy": 0.17845190614461898,
|
|
"num_tokens": 24220883.0,
|
|
"step": 9550
|
|
},
|
|
{
|
|
"entropy": 6.224795198440551,
|
|
"epoch": 1.1027120600115408,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004890157517971704,
|
|
"loss": 5.8637,
|
|
"mean_token_accuracy": 0.18637510240077973,
|
|
"num_tokens": 24233918.0,
|
|
"step": 9555
|
|
},
|
|
{
|
|
"entropy": 6.2827919006347654,
|
|
"epoch": 1.1032890940565494,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004890030126473566,
|
|
"loss": 6.0017,
|
|
"mean_token_accuracy": 0.17295387089252473,
|
|
"num_tokens": 24247307.0,
|
|
"step": 9560
|
|
},
|
|
{
|
|
"entropy": 6.262751674652099,
|
|
"epoch": 1.103866128101558,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004889902662996578,
|
|
"loss": 5.8885,
|
|
"mean_token_accuracy": 0.18006763756275176,
|
|
"num_tokens": 24260149.0,
|
|
"step": 9565
|
|
},
|
|
{
|
|
"entropy": 6.2460860252380375,
|
|
"epoch": 1.1044431621465667,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004889775127545027,
|
|
"loss": 5.9753,
|
|
"mean_token_accuracy": 0.17819419503211975,
|
|
"num_tokens": 24273675.0,
|
|
"step": 9570
|
|
},
|
|
{
|
|
"entropy": 6.273380994796753,
|
|
"epoch": 1.1050201961915753,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004889647520123202,
|
|
"loss": 5.8817,
|
|
"mean_token_accuracy": 0.18066975921392442,
|
|
"num_tokens": 24285575.0,
|
|
"step": 9575
|
|
},
|
|
{
|
|
"entropy": 6.266949462890625,
|
|
"epoch": 1.105597230236584,
|
|
"grad_norm": 1.984375,
|
|
"learning_rate": 0.0004889519840735396,
|
|
"loss": 5.9146,
|
|
"mean_token_accuracy": 0.19424535930156708,
|
|
"num_tokens": 24297908.0,
|
|
"step": 9580
|
|
},
|
|
{
|
|
"entropy": 6.182698535919189,
|
|
"epoch": 1.1061742642815926,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004889392089385903,
|
|
"loss": 5.8977,
|
|
"mean_token_accuracy": 0.18063640892505645,
|
|
"num_tokens": 24310714.0,
|
|
"step": 9585
|
|
},
|
|
{
|
|
"entropy": 6.233695125579834,
|
|
"epoch": 1.1067512983266012,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004889264266079019,
|
|
"loss": 5.9384,
|
|
"mean_token_accuracy": 0.18608282655477523,
|
|
"num_tokens": 24322367.0,
|
|
"step": 9590
|
|
},
|
|
{
|
|
"entropy": 6.27492094039917,
|
|
"epoch": 1.1073283323716099,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004889136370819045,
|
|
"loss": 5.9241,
|
|
"mean_token_accuracy": 0.17917955815792083,
|
|
"num_tokens": 24334256.0,
|
|
"step": 9595
|
|
},
|
|
{
|
|
"entropy": 6.238777923583984,
|
|
"epoch": 1.1079053664166185,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004889008403610281,
|
|
"loss": 5.9273,
|
|
"mean_token_accuracy": 0.18196589946746827,
|
|
"num_tokens": 24346968.0,
|
|
"step": 9600
|
|
},
|
|
{
|
|
"entropy": 6.318524122238159,
|
|
"epoch": 1.1084824004616272,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004888880364457033,
|
|
"loss": 5.9858,
|
|
"mean_token_accuracy": 0.18197154253721237,
|
|
"num_tokens": 24360468.0,
|
|
"step": 9605
|
|
},
|
|
{
|
|
"entropy": 6.250274705886841,
|
|
"epoch": 1.1090594345066358,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004888752253363604,
|
|
"loss": 5.9434,
|
|
"mean_token_accuracy": 0.1844514176249504,
|
|
"num_tokens": 24372330.0,
|
|
"step": 9610
|
|
},
|
|
{
|
|
"entropy": 6.191738557815552,
|
|
"epoch": 1.1096364685516447,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004888624070334308,
|
|
"loss": 5.9206,
|
|
"mean_token_accuracy": 0.17861685305833816,
|
|
"num_tokens": 24384864.0,
|
|
"step": 9615
|
|
},
|
|
{
|
|
"entropy": 6.206880760192871,
|
|
"epoch": 1.1102135025966533,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004888495815373452,
|
|
"loss": 5.8315,
|
|
"mean_token_accuracy": 0.18677129745483398,
|
|
"num_tokens": 24397408.0,
|
|
"step": 9620
|
|
},
|
|
{
|
|
"entropy": 6.244317722320557,
|
|
"epoch": 1.110790536641662,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004888367488485351,
|
|
"loss": 5.8915,
|
|
"mean_token_accuracy": 0.18083362877368928,
|
|
"num_tokens": 24409113.0,
|
|
"step": 9625
|
|
},
|
|
{
|
|
"entropy": 6.221122789382934,
|
|
"epoch": 1.1113675706866706,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004888239089674323,
|
|
"loss": 5.8999,
|
|
"mean_token_accuracy": 0.17989745289087294,
|
|
"num_tokens": 24420818.0,
|
|
"step": 9630
|
|
},
|
|
{
|
|
"entropy": 6.320473575592041,
|
|
"epoch": 1.1119446047316792,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004888110618944686,
|
|
"loss": 6.0477,
|
|
"mean_token_accuracy": 0.16832794100046158,
|
|
"num_tokens": 24434452.0,
|
|
"step": 9635
|
|
},
|
|
{
|
|
"entropy": 6.317052507400513,
|
|
"epoch": 1.1125216387766879,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004887982076300759,
|
|
"loss": 6.018,
|
|
"mean_token_accuracy": 0.17300770580768585,
|
|
"num_tokens": 24448674.0,
|
|
"step": 9640
|
|
},
|
|
{
|
|
"entropy": 6.278442859649658,
|
|
"epoch": 1.1130986728216965,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004887853461746867,
|
|
"loss": 5.9311,
|
|
"mean_token_accuracy": 0.17755277156829835,
|
|
"num_tokens": 24461388.0,
|
|
"step": 9645
|
|
},
|
|
{
|
|
"entropy": 6.260433673858643,
|
|
"epoch": 1.1136757068667051,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004887724775287336,
|
|
"loss": 5.8879,
|
|
"mean_token_accuracy": 0.18106852620840072,
|
|
"num_tokens": 24474304.0,
|
|
"step": 9650
|
|
},
|
|
{
|
|
"entropy": 6.193238162994385,
|
|
"epoch": 1.1142527409117138,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004887596016926494,
|
|
"loss": 5.8876,
|
|
"mean_token_accuracy": 0.1843292832374573,
|
|
"num_tokens": 24487175.0,
|
|
"step": 9655
|
|
},
|
|
{
|
|
"entropy": 6.247819232940674,
|
|
"epoch": 1.1148297749567224,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004887467186668673,
|
|
"loss": 5.9165,
|
|
"mean_token_accuracy": 0.17582756131887436,
|
|
"num_tokens": 24500160.0,
|
|
"step": 9660
|
|
},
|
|
{
|
|
"entropy": 6.303691053390503,
|
|
"epoch": 1.115406809001731,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004887338284518204,
|
|
"loss": 6.0161,
|
|
"mean_token_accuracy": 0.17239674627780915,
|
|
"num_tokens": 24513358.0,
|
|
"step": 9665
|
|
},
|
|
{
|
|
"entropy": 6.237333631515503,
|
|
"epoch": 1.1159838430467397,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004887209310479423,
|
|
"loss": 5.9054,
|
|
"mean_token_accuracy": 0.18612945675849915,
|
|
"num_tokens": 24526254.0,
|
|
"step": 9670
|
|
},
|
|
{
|
|
"entropy": 6.213815975189209,
|
|
"epoch": 1.1165608770917483,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004887080264556668,
|
|
"loss": 5.8248,
|
|
"mean_token_accuracy": 0.18724657446146012,
|
|
"num_tokens": 24540023.0,
|
|
"step": 9675
|
|
},
|
|
{
|
|
"entropy": 6.252214860916138,
|
|
"epoch": 1.117137911136757,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004886951146754282,
|
|
"loss": 5.9475,
|
|
"mean_token_accuracy": 0.17748111933469773,
|
|
"num_tokens": 24553270.0,
|
|
"step": 9680
|
|
},
|
|
{
|
|
"entropy": 6.2683617115020756,
|
|
"epoch": 1.1177149451817656,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004886821957076603,
|
|
"loss": 5.9217,
|
|
"mean_token_accuracy": 0.181137290596962,
|
|
"num_tokens": 24565576.0,
|
|
"step": 9685
|
|
},
|
|
{
|
|
"entropy": 6.23697943687439,
|
|
"epoch": 1.1182919792267745,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.000488669269552798,
|
|
"loss": 6.0058,
|
|
"mean_token_accuracy": 0.17781507223844528,
|
|
"num_tokens": 24578825.0,
|
|
"step": 9690
|
|
},
|
|
{
|
|
"entropy": 6.2838945388793945,
|
|
"epoch": 1.1188690132717831,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.000488656336211276,
|
|
"loss": 6.0018,
|
|
"mean_token_accuracy": 0.17679450809955596,
|
|
"num_tokens": 24592058.0,
|
|
"step": 9695
|
|
},
|
|
{
|
|
"entropy": 6.310996246337891,
|
|
"epoch": 1.1194460473167918,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004886433956835292,
|
|
"loss": 5.8804,
|
|
"mean_token_accuracy": 0.18037169873714448,
|
|
"num_tokens": 24605956.0,
|
|
"step": 9700
|
|
},
|
|
{
|
|
"entropy": 6.2612090587615965,
|
|
"epoch": 1.1200230813618004,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004886304479699929,
|
|
"loss": 5.9197,
|
|
"mean_token_accuracy": 0.18407063484191893,
|
|
"num_tokens": 24618904.0,
|
|
"step": 9705
|
|
},
|
|
{
|
|
"entropy": 6.2928119659423825,
|
|
"epoch": 1.120600115406809,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004886174930711027,
|
|
"loss": 6.0456,
|
|
"mean_token_accuracy": 0.17686478793621063,
|
|
"num_tokens": 24632720.0,
|
|
"step": 9710
|
|
},
|
|
{
|
|
"entropy": 6.260981178283691,
|
|
"epoch": 1.1211771494518177,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004886045309872941,
|
|
"loss": 5.9979,
|
|
"mean_token_accuracy": 0.17472656220197677,
|
|
"num_tokens": 24644863.0,
|
|
"step": 9715
|
|
},
|
|
{
|
|
"entropy": 6.306377601623535,
|
|
"epoch": 1.1217541834968263,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004885915617190034,
|
|
"loss": 5.9805,
|
|
"mean_token_accuracy": 0.17594851553440094,
|
|
"num_tokens": 24656884.0,
|
|
"step": 9720
|
|
},
|
|
{
|
|
"entropy": 6.281054592132568,
|
|
"epoch": 1.122331217541835,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004885785852666664,
|
|
"loss": 5.9456,
|
|
"mean_token_accuracy": 0.17910037338733673,
|
|
"num_tokens": 24671008.0,
|
|
"step": 9725
|
|
},
|
|
{
|
|
"entropy": 6.2424633502960205,
|
|
"epoch": 1.1229082515868436,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004885656016307199,
|
|
"loss": 5.9427,
|
|
"mean_token_accuracy": 0.17576711028814315,
|
|
"num_tokens": 24685787.0,
|
|
"step": 9730
|
|
},
|
|
{
|
|
"entropy": 6.344523096084595,
|
|
"epoch": 1.1234852856318522,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004885526108116004,
|
|
"loss": 6.0128,
|
|
"mean_token_accuracy": 0.17457142174243928,
|
|
"num_tokens": 24697233.0,
|
|
"step": 9735
|
|
},
|
|
{
|
|
"entropy": 6.26629490852356,
|
|
"epoch": 1.1240623196768609,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000488539612809745,
|
|
"loss": 5.9203,
|
|
"mean_token_accuracy": 0.18147749304771424,
|
|
"num_tokens": 24709409.0,
|
|
"step": 9740
|
|
},
|
|
{
|
|
"entropy": 6.288652181625366,
|
|
"epoch": 1.1246393537218695,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004885266076255907,
|
|
"loss": 5.9991,
|
|
"mean_token_accuracy": 0.17411095947027205,
|
|
"num_tokens": 24722006.0,
|
|
"step": 9745
|
|
},
|
|
{
|
|
"entropy": 6.341065502166748,
|
|
"epoch": 1.1252163877668782,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.000488513595259575,
|
|
"loss": 5.9978,
|
|
"mean_token_accuracy": 0.16869597434997557,
|
|
"num_tokens": 24736060.0,
|
|
"step": 9750
|
|
},
|
|
{
|
|
"entropy": 6.306094789505005,
|
|
"epoch": 1.125793421811887,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004885005757121357,
|
|
"loss": 5.9776,
|
|
"mean_token_accuracy": 0.17298872172832488,
|
|
"num_tokens": 24748008.0,
|
|
"step": 9755
|
|
},
|
|
{
|
|
"entropy": 6.277267408370972,
|
|
"epoch": 1.1263704558568954,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004884875489837105,
|
|
"loss": 5.9418,
|
|
"mean_token_accuracy": 0.1754933163523674,
|
|
"num_tokens": 24760631.0,
|
|
"step": 9760
|
|
},
|
|
{
|
|
"entropy": 6.109272480010986,
|
|
"epoch": 1.1269474899019043,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004884745150747378,
|
|
"loss": 5.8061,
|
|
"mean_token_accuracy": 0.1959839642047882,
|
|
"num_tokens": 24772646.0,
|
|
"step": 9765
|
|
},
|
|
{
|
|
"entropy": 6.2138436794281,
|
|
"epoch": 1.127524523946913,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004884614739856556,
|
|
"loss": 5.9671,
|
|
"mean_token_accuracy": 0.17570037841796876,
|
|
"num_tokens": 24784571.0,
|
|
"step": 9770
|
|
},
|
|
{
|
|
"entropy": 6.336449003219604,
|
|
"epoch": 1.1281015579919216,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004884484257169028,
|
|
"loss": 5.9631,
|
|
"mean_token_accuracy": 0.17928054183721542,
|
|
"num_tokens": 24797810.0,
|
|
"step": 9775
|
|
},
|
|
{
|
|
"entropy": 6.231250190734864,
|
|
"epoch": 1.1286785920369302,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004884353702689183,
|
|
"loss": 5.92,
|
|
"mean_token_accuracy": 0.17948038578033448,
|
|
"num_tokens": 24810677.0,
|
|
"step": 9780
|
|
},
|
|
{
|
|
"entropy": 6.246661615371704,
|
|
"epoch": 1.1292556260819389,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004884223076421411,
|
|
"loss": 5.8837,
|
|
"mean_token_accuracy": 0.1834596186876297,
|
|
"num_tokens": 24823138.0,
|
|
"step": 9785
|
|
},
|
|
{
|
|
"entropy": 6.161348485946656,
|
|
"epoch": 1.1298326601269475,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004884092378370106,
|
|
"loss": 5.8994,
|
|
"mean_token_accuracy": 0.19012928754091263,
|
|
"num_tokens": 24834548.0,
|
|
"step": 9790
|
|
},
|
|
{
|
|
"entropy": 6.260898113250732,
|
|
"epoch": 1.1304096941719561,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004883961608539664,
|
|
"loss": 5.9793,
|
|
"mean_token_accuracy": 0.1769823431968689,
|
|
"num_tokens": 24847326.0,
|
|
"step": 9795
|
|
},
|
|
{
|
|
"entropy": 6.243139791488647,
|
|
"epoch": 1.1309867282169648,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004883830766934484,
|
|
"loss": 5.7928,
|
|
"mean_token_accuracy": 0.1948003813624382,
|
|
"num_tokens": 24860417.0,
|
|
"step": 9800
|
|
},
|
|
{
|
|
"entropy": 6.203162908554077,
|
|
"epoch": 1.1315637622619734,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004883699853558965,
|
|
"loss": 5.9125,
|
|
"mean_token_accuracy": 0.17804983854293824,
|
|
"num_tokens": 24872759.0,
|
|
"step": 9805
|
|
},
|
|
{
|
|
"entropy": 6.2547111988067625,
|
|
"epoch": 1.132140796306982,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004883568868417511,
|
|
"loss": 5.8794,
|
|
"mean_token_accuracy": 0.17914481908082963,
|
|
"num_tokens": 24885278.0,
|
|
"step": 9810
|
|
},
|
|
{
|
|
"entropy": 6.285055685043335,
|
|
"epoch": 1.1327178303519907,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004883437811514528,
|
|
"loss": 6.0068,
|
|
"mean_token_accuracy": 0.1728021264076233,
|
|
"num_tokens": 24898596.0,
|
|
"step": 9815
|
|
},
|
|
{
|
|
"entropy": 6.273211240768433,
|
|
"epoch": 1.1332948643969993,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004883306682854424,
|
|
"loss": 5.931,
|
|
"mean_token_accuracy": 0.18046294897794724,
|
|
"num_tokens": 24911755.0,
|
|
"step": 9820
|
|
},
|
|
{
|
|
"entropy": 6.307237911224365,
|
|
"epoch": 1.133871898442008,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004883175482441611,
|
|
"loss": 5.9945,
|
|
"mean_token_accuracy": 0.17272798269987105,
|
|
"num_tokens": 24925197.0,
|
|
"step": 9825
|
|
},
|
|
{
|
|
"entropy": 6.180803823471069,
|
|
"epoch": 1.1344489324870168,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004883044210280499,
|
|
"loss": 5.8241,
|
|
"mean_token_accuracy": 0.18567555099725724,
|
|
"num_tokens": 24938204.0,
|
|
"step": 9830
|
|
},
|
|
{
|
|
"entropy": 6.20053653717041,
|
|
"epoch": 1.1350259665320255,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004882912866375505,
|
|
"loss": 5.9601,
|
|
"mean_token_accuracy": 0.18451820313930511,
|
|
"num_tokens": 24949382.0,
|
|
"step": 9835
|
|
},
|
|
{
|
|
"entropy": 6.2447374820709225,
|
|
"epoch": 1.1356030005770341,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00048827814507310455,
|
|
"loss": 5.9229,
|
|
"mean_token_accuracy": 0.17463673502206803,
|
|
"num_tokens": 24961685.0,
|
|
"step": 9840
|
|
},
|
|
{
|
|
"entropy": 6.234250545501709,
|
|
"epoch": 1.1361800346220428,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048826499633515416,
|
|
"loss": 5.9051,
|
|
"mean_token_accuracy": 0.18329232782125474,
|
|
"num_tokens": 24973619.0,
|
|
"step": 9845
|
|
},
|
|
{
|
|
"entropy": 6.21411657333374,
|
|
"epoch": 1.1367570686670514,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048825184042414156,
|
|
"loss": 5.9044,
|
|
"mean_token_accuracy": 0.18802542388439178,
|
|
"num_tokens": 24985156.0,
|
|
"step": 9850
|
|
},
|
|
{
|
|
"entropy": 6.160888385772705,
|
|
"epoch": 1.13733410271206,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004882386773405092,
|
|
"loss": 5.9201,
|
|
"mean_token_accuracy": 0.1874276265501976,
|
|
"num_tokens": 24997891.0,
|
|
"step": 9855
|
|
},
|
|
{
|
|
"entropy": 6.3374419689178465,
|
|
"epoch": 1.1379111367570687,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004882255070846999,
|
|
"loss": 5.9334,
|
|
"mean_token_accuracy": 0.17814454138278962,
|
|
"num_tokens": 25009824.0,
|
|
"step": 9860
|
|
},
|
|
{
|
|
"entropy": 6.28568754196167,
|
|
"epoch": 1.1384881708020773,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00048821232965715663,
|
|
"loss": 5.9641,
|
|
"mean_token_accuracy": 0.17603467255830765,
|
|
"num_tokens": 25021574.0,
|
|
"step": 9865
|
|
},
|
|
{
|
|
"entropy": 6.247843408584595,
|
|
"epoch": 1.139065204847086,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004881991450583225,
|
|
"loss": 5.8774,
|
|
"mean_token_accuracy": 0.18148830235004426,
|
|
"num_tokens": 25033315.0,
|
|
"step": 9870
|
|
},
|
|
{
|
|
"entropy": 6.207533264160157,
|
|
"epoch": 1.1396422388920946,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.000488185953288641,
|
|
"loss": 5.9337,
|
|
"mean_token_accuracy": 0.1857161581516266,
|
|
"num_tokens": 25046284.0,
|
|
"step": 9875
|
|
},
|
|
{
|
|
"entropy": 6.271518850326538,
|
|
"epoch": 1.1402192729371032,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004881727543485559,
|
|
"loss": 5.9082,
|
|
"mean_token_accuracy": 0.18233485966920854,
|
|
"num_tokens": 25058484.0,
|
|
"step": 9880
|
|
},
|
|
{
|
|
"entropy": 6.22105860710144,
|
|
"epoch": 1.1407963069821119,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00048815954823851107,
|
|
"loss": 5.8425,
|
|
"mean_token_accuracy": 0.18622921258211136,
|
|
"num_tokens": 25070555.0,
|
|
"step": 9885
|
|
},
|
|
{
|
|
"entropy": 6.322746706008911,
|
|
"epoch": 1.1413733410271205,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00048814633495895067,
|
|
"loss": 6.0142,
|
|
"mean_token_accuracy": 0.17440420240163804,
|
|
"num_tokens": 25083492.0,
|
|
"step": 9890
|
|
},
|
|
{
|
|
"entropy": 6.308733797073364,
|
|
"epoch": 1.1419503750721294,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004881331145103192,
|
|
"loss": 5.9921,
|
|
"mean_token_accuracy": 0.17199164181947707,
|
|
"num_tokens": 25096332.0,
|
|
"step": 9895
|
|
},
|
|
{
|
|
"entropy": 6.276531744003296,
|
|
"epoch": 1.1425274091171378,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004881198868930614,
|
|
"loss": 5.896,
|
|
"mean_token_accuracy": 0.17704352885484695,
|
|
"num_tokens": 25110447.0,
|
|
"step": 9900
|
|
},
|
|
{
|
|
"entropy": 6.309626197814941,
|
|
"epoch": 1.1431044431621467,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00048810665210762195,
|
|
"loss": 5.9725,
|
|
"mean_token_accuracy": 0.17967149913311004,
|
|
"num_tokens": 25123852.0,
|
|
"step": 9905
|
|
},
|
|
{
|
|
"entropy": 6.262395286560059,
|
|
"epoch": 1.1436814772071553,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.00048809341015444615,
|
|
"loss": 5.9666,
|
|
"mean_token_accuracy": 0.1768372818827629,
|
|
"num_tokens": 25136151.0,
|
|
"step": 9910
|
|
},
|
|
{
|
|
"entropy": 6.243071460723877,
|
|
"epoch": 1.144258511252164,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00048808016103397934,
|
|
"loss": 5.9179,
|
|
"mean_token_accuracy": 0.1830576628446579,
|
|
"num_tokens": 25149642.0,
|
|
"step": 9915
|
|
},
|
|
{
|
|
"entropy": 6.218459749221802,
|
|
"epoch": 1.1448355452971726,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004880669047466671,
|
|
"loss": 5.8823,
|
|
"mean_token_accuracy": 0.18505503088235856,
|
|
"num_tokens": 25162022.0,
|
|
"step": 9920
|
|
},
|
|
{
|
|
"entropy": 6.280695390701294,
|
|
"epoch": 1.1454125793421812,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048805364129295554,
|
|
"loss": 6.0116,
|
|
"mean_token_accuracy": 0.17475848346948625,
|
|
"num_tokens": 25175404.0,
|
|
"step": 9925
|
|
},
|
|
{
|
|
"entropy": 6.253636407852173,
|
|
"epoch": 1.1459896133871899,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.00048804037067329037,
|
|
"loss": 5.8558,
|
|
"mean_token_accuracy": 0.18484980762004852,
|
|
"num_tokens": 25188148.0,
|
|
"step": 9930
|
|
},
|
|
{
|
|
"entropy": 6.230699157714843,
|
|
"epoch": 1.1465666474321985,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004880270928881183,
|
|
"loss": 5.9347,
|
|
"mean_token_accuracy": 0.18091728538274765,
|
|
"num_tokens": 25199960.0,
|
|
"step": 9935
|
|
},
|
|
{
|
|
"entropy": 6.191056203842163,
|
|
"epoch": 1.1471436814772071,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004880138079378857,
|
|
"loss": 5.8846,
|
|
"mean_token_accuracy": 0.17917097955942154,
|
|
"num_tokens": 25211054.0,
|
|
"step": 9940
|
|
},
|
|
{
|
|
"entropy": 6.249275350570679,
|
|
"epoch": 1.1477207155222158,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004880005158230395,
|
|
"loss": 5.8641,
|
|
"mean_token_accuracy": 0.1871132269501686,
|
|
"num_tokens": 25222553.0,
|
|
"step": 9945
|
|
},
|
|
{
|
|
"entropy": 6.205245733261108,
|
|
"epoch": 1.1482977495672244,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004879872165440268,
|
|
"loss": 5.9152,
|
|
"mean_token_accuracy": 0.1780821532011032,
|
|
"num_tokens": 25235472.0,
|
|
"step": 9950
|
|
},
|
|
{
|
|
"entropy": 6.222427892684936,
|
|
"epoch": 1.148874783612233,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004879739101012948,
|
|
"loss": 5.9795,
|
|
"mean_token_accuracy": 0.17801414877176286,
|
|
"num_tokens": 25250209.0,
|
|
"step": 9955
|
|
},
|
|
{
|
|
"entropy": 6.301009178161621,
|
|
"epoch": 1.1494518176572417,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004879605964952911,
|
|
"loss": 6.0067,
|
|
"mean_token_accuracy": 0.17522571235895157,
|
|
"num_tokens": 25262064.0,
|
|
"step": 9960
|
|
},
|
|
{
|
|
"entropy": 6.322479486465454,
|
|
"epoch": 1.1500288517022503,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00048794727572646366,
|
|
"loss": 5.9427,
|
|
"mean_token_accuracy": 0.17829561233520508,
|
|
"num_tokens": 25274833.0,
|
|
"step": 9965
|
|
},
|
|
{
|
|
"entropy": 6.252580785751343,
|
|
"epoch": 1.1506058857472592,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004879339477952603,
|
|
"loss": 5.9259,
|
|
"mean_token_accuracy": 0.1844586282968521,
|
|
"num_tokens": 25288397.0,
|
|
"step": 9970
|
|
},
|
|
{
|
|
"entropy": 6.206064081192016,
|
|
"epoch": 1.1511829197922678,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048792061270212935,
|
|
"loss": 5.8926,
|
|
"mean_token_accuracy": 0.1864775836467743,
|
|
"num_tokens": 25300887.0,
|
|
"step": 9975
|
|
},
|
|
{
|
|
"entropy": 6.300720739364624,
|
|
"epoch": 1.1517599538372765,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004879072704475193,
|
|
"loss": 5.9774,
|
|
"mean_token_accuracy": 0.1777906149625778,
|
|
"num_tokens": 25314686.0,
|
|
"step": 9980
|
|
},
|
|
{
|
|
"entropy": 6.324214887619019,
|
|
"epoch": 1.1523369878822851,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00048789392103187906,
|
|
"loss": 6.0028,
|
|
"mean_token_accuracy": 0.17738907784223557,
|
|
"num_tokens": 25328253.0,
|
|
"step": 9985
|
|
},
|
|
{
|
|
"entropy": 6.282991886138916,
|
|
"epoch": 1.1529140219272938,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004878805644556575,
|
|
"loss": 5.9538,
|
|
"mean_token_accuracy": 0.18188581615686417,
|
|
"num_tokens": 25340583.0,
|
|
"step": 9990
|
|
},
|
|
{
|
|
"entropy": 6.180060386657715,
|
|
"epoch": 1.1534910559723024,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000487867200719304,
|
|
"loss": 5.8756,
|
|
"mean_token_accuracy": 0.18232353776693344,
|
|
"num_tokens": 25352513.0,
|
|
"step": 9995
|
|
},
|
|
{
|
|
"entropy": 6.269026517868042,
|
|
"epoch": 1.154068090017311,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004878538298232678,
|
|
"loss": 5.9893,
|
|
"mean_token_accuracy": 0.1770420104265213,
|
|
"num_tokens": 25365044.0,
|
|
"step": 10000
|
|
},
|
|
{
|
|
"entropy": 6.310076713562012,
|
|
"epoch": 1.1546451240623197,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004878404517679988,
|
|
"loss": 5.9366,
|
|
"mean_token_accuracy": 0.17858017683029176,
|
|
"num_tokens": 25377381.0,
|
|
"step": 10005
|
|
},
|
|
{
|
|
"entropy": 6.238185453414917,
|
|
"epoch": 1.1552221581073283,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00048782706655394695,
|
|
"loss": 5.938,
|
|
"mean_token_accuracy": 0.1837088868021965,
|
|
"num_tokens": 25390723.0,
|
|
"step": 10010
|
|
},
|
|
{
|
|
"entropy": 6.173210191726684,
|
|
"epoch": 1.155799192152337,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004878136741815624,
|
|
"loss": 5.8564,
|
|
"mean_token_accuracy": 0.1824432611465454,
|
|
"num_tokens": 25403501.0,
|
|
"step": 10015
|
|
},
|
|
{
|
|
"entropy": 6.213417387008667,
|
|
"epoch": 1.1563762261973456,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004878002746512956,
|
|
"loss": 5.8816,
|
|
"mean_token_accuracy": 0.18476981669664383,
|
|
"num_tokens": 25415565.0,
|
|
"step": 10020
|
|
},
|
|
{
|
|
"entropy": 6.226587963104248,
|
|
"epoch": 1.1569532602423542,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004877868679635974,
|
|
"loss": 5.9289,
|
|
"mean_token_accuracy": 0.18405697494745255,
|
|
"num_tokens": 25428261.0,
|
|
"step": 10025
|
|
},
|
|
{
|
|
"entropy": 6.28510012626648,
|
|
"epoch": 1.1575302942873629,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004877734541189185,
|
|
"loss": 5.9355,
|
|
"mean_token_accuracy": 0.17490267604589463,
|
|
"num_tokens": 25439758.0,
|
|
"step": 10030
|
|
},
|
|
{
|
|
"entropy": 6.253132295608521,
|
|
"epoch": 1.1581073283323717,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00048776003311771013,
|
|
"loss": 5.9766,
|
|
"mean_token_accuracy": 0.1719038173556328,
|
|
"num_tokens": 25452162.0,
|
|
"step": 10035
|
|
},
|
|
{
|
|
"entropy": 6.34536337852478,
|
|
"epoch": 1.1586843623773802,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004877466049604238,
|
|
"loss": 6.0224,
|
|
"mean_token_accuracy": 0.17633402347564697,
|
|
"num_tokens": 25463741.0,
|
|
"step": 10040
|
|
},
|
|
{
|
|
"entropy": 6.273688936233521,
|
|
"epoch": 1.159261396422389,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.00048773316964751106,
|
|
"loss": 5.9607,
|
|
"mean_token_accuracy": 0.17500015050172807,
|
|
"num_tokens": 25476466.0,
|
|
"step": 10045
|
|
},
|
|
{
|
|
"entropy": 6.3328968524932865,
|
|
"epoch": 1.1598384304673977,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004877197271794239,
|
|
"loss": 5.948,
|
|
"mean_token_accuracy": 0.1761259838938713,
|
|
"num_tokens": 25488453.0,
|
|
"step": 10050
|
|
},
|
|
{
|
|
"entropy": 6.298605442047119,
|
|
"epoch": 1.1604154645124063,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004877062775566142,
|
|
"loss": 5.9443,
|
|
"mean_token_accuracy": 0.17435207664966584,
|
|
"num_tokens": 25501803.0,
|
|
"step": 10055
|
|
},
|
|
{
|
|
"entropy": 6.273298692703247,
|
|
"epoch": 1.160992498557415,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.00048769282077953464,
|
|
"loss": 6.0359,
|
|
"mean_token_accuracy": 0.17547617107629776,
|
|
"num_tokens": 25515844.0,
|
|
"step": 10060
|
|
},
|
|
{
|
|
"entropy": 6.312673854827881,
|
|
"epoch": 1.1615695326024236,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048767935684863775,
|
|
"loss": 5.9276,
|
|
"mean_token_accuracy": 0.18142150789499284,
|
|
"num_tokens": 25528529.0,
|
|
"step": 10065
|
|
},
|
|
{
|
|
"entropy": 6.302729988098145,
|
|
"epoch": 1.1621465666474322,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004876658857643762,
|
|
"loss": 5.9732,
|
|
"mean_token_accuracy": 0.17344674915075303,
|
|
"num_tokens": 25540110.0,
|
|
"step": 10070
|
|
},
|
|
{
|
|
"entropy": 6.254207420349121,
|
|
"epoch": 1.1627236006924409,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004876524075272034,
|
|
"loss": 5.9334,
|
|
"mean_token_accuracy": 0.17588380724191666,
|
|
"num_tokens": 25553332.0,
|
|
"step": 10075
|
|
},
|
|
{
|
|
"entropy": 6.286834716796875,
|
|
"epoch": 1.1633006347374495,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048763892213757234,
|
|
"loss": 5.9005,
|
|
"mean_token_accuracy": 0.17941419333219527,
|
|
"num_tokens": 25565852.0,
|
|
"step": 10080
|
|
},
|
|
{
|
|
"entropy": 6.242973041534424,
|
|
"epoch": 1.1638776687824581,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.00048762542959593683,
|
|
"loss": 5.9185,
|
|
"mean_token_accuracy": 0.18208333104848862,
|
|
"num_tokens": 25579642.0,
|
|
"step": 10085
|
|
},
|
|
{
|
|
"entropy": 6.223715496063233,
|
|
"epoch": 1.1644547028274668,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004876119299027506,
|
|
"loss": 5.9185,
|
|
"mean_token_accuracy": 0.18511994779109955,
|
|
"num_tokens": 25591452.0,
|
|
"step": 10090
|
|
},
|
|
{
|
|
"entropy": 6.221129322052002,
|
|
"epoch": 1.1650317368724754,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00048759842305846766,
|
|
"loss": 5.8732,
|
|
"mean_token_accuracy": 0.17986828535795213,
|
|
"num_tokens": 25603426.0,
|
|
"step": 10095
|
|
},
|
|
{
|
|
"entropy": 6.264230966567993,
|
|
"epoch": 1.165608770917484,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004875849090635425,
|
|
"loss": 5.9774,
|
|
"mean_token_accuracy": 0.17824428528547287,
|
|
"num_tokens": 25617014.0,
|
|
"step": 10100
|
|
},
|
|
{
|
|
"entropy": 6.293786478042603,
|
|
"epoch": 1.1661858049624927,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00048757138791842943,
|
|
"loss": 5.9394,
|
|
"mean_token_accuracy": 0.18343609422445298,
|
|
"num_tokens": 25629916.0,
|
|
"step": 10105
|
|
},
|
|
{
|
|
"entropy": 6.2851982593536375,
|
|
"epoch": 1.1667628390075016,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004875578596235832,
|
|
"loss": 5.9229,
|
|
"mean_token_accuracy": 0.18201591074466705,
|
|
"num_tokens": 25642301.0,
|
|
"step": 10110
|
|
},
|
|
{
|
|
"entropy": 6.254937362670899,
|
|
"epoch": 1.1673398730525102,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004875443241794591,
|
|
"loss": 5.9005,
|
|
"mean_token_accuracy": 0.18076282739639282,
|
|
"num_tokens": 25653976.0,
|
|
"step": 10115
|
|
},
|
|
{
|
|
"entropy": 6.266515922546387,
|
|
"epoch": 1.1679169070975188,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00048753078158651227,
|
|
"loss": 5.9433,
|
|
"mean_token_accuracy": 0.17355138510465623,
|
|
"num_tokens": 25666078.0,
|
|
"step": 10120
|
|
},
|
|
{
|
|
"entropy": 6.299070167541504,
|
|
"epoch": 1.1684939411425275,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000487517231845198,
|
|
"loss": 5.9608,
|
|
"mean_token_accuracy": 0.17447977215051652,
|
|
"num_tokens": 25679780.0,
|
|
"step": 10125
|
|
},
|
|
{
|
|
"entropy": 6.330364561080932,
|
|
"epoch": 1.169070975187536,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004875036749559724,
|
|
"loss": 5.921,
|
|
"mean_token_accuracy": 0.1767667144536972,
|
|
"num_tokens": 25694179.0,
|
|
"step": 10130
|
|
},
|
|
{
|
|
"entropy": 6.173453760147095,
|
|
"epoch": 1.1696480092325447,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00048749011091929115,
|
|
"loss": 5.9132,
|
|
"mean_token_accuracy": 0.18746515810489656,
|
|
"num_tokens": 25707281.0,
|
|
"step": 10135
|
|
},
|
|
{
|
|
"entropy": 6.262874364852905,
|
|
"epoch": 1.1702250432775534,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004874765397356105,
|
|
"loss": 5.9428,
|
|
"mean_token_accuracy": 0.18233703523874284,
|
|
"num_tokens": 25719901.0,
|
|
"step": 10140
|
|
},
|
|
{
|
|
"entropy": 6.302816724777221,
|
|
"epoch": 1.170802077322562,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004874629614053871,
|
|
"loss": 5.9542,
|
|
"mean_token_accuracy": 0.18035022020339966,
|
|
"num_tokens": 25732063.0,
|
|
"step": 10145
|
|
},
|
|
{
|
|
"entropy": 6.217515897750855,
|
|
"epoch": 1.1713791113675707,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004874493759290775,
|
|
"loss": 5.9195,
|
|
"mean_token_accuracy": 0.17959170192480087,
|
|
"num_tokens": 25743966.0,
|
|
"step": 10150
|
|
},
|
|
{
|
|
"entropy": 6.033494472503662,
|
|
"epoch": 1.1719561454125793,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00048743578330713854,
|
|
"loss": 5.6624,
|
|
"mean_token_accuracy": 0.20419865399599074,
|
|
"num_tokens": 25757053.0,
|
|
"step": 10155
|
|
},
|
|
{
|
|
"entropy": 6.10223126411438,
|
|
"epoch": 1.172533179457588,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004874221835400277,
|
|
"loss": 5.7981,
|
|
"mean_token_accuracy": 0.1875803977251053,
|
|
"num_tokens": 25769430.0,
|
|
"step": 10160
|
|
},
|
|
{
|
|
"entropy": 6.264477682113648,
|
|
"epoch": 1.1731102135025966,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004874085766282022,
|
|
"loss": 5.894,
|
|
"mean_token_accuracy": 0.18658676594495774,
|
|
"num_tokens": 25781687.0,
|
|
"step": 10165
|
|
},
|
|
{
|
|
"entropy": 6.178972053527832,
|
|
"epoch": 1.1736872475476052,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00048739496257211966,
|
|
"loss": 5.9109,
|
|
"mean_token_accuracy": 0.1858760565519333,
|
|
"num_tokens": 25793646.0,
|
|
"step": 10170
|
|
},
|
|
{
|
|
"entropy": 6.226661348342896,
|
|
"epoch": 1.1742642815926139,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00048738134137223815,
|
|
"loss": 5.9739,
|
|
"mean_token_accuracy": 0.1752454936504364,
|
|
"num_tokens": 25807757.0,
|
|
"step": 10175
|
|
},
|
|
{
|
|
"entropy": 6.282738161087036,
|
|
"epoch": 1.1748413156376225,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00048736771302901566,
|
|
"loss": 5.9495,
|
|
"mean_token_accuracy": 0.17936586141586303,
|
|
"num_tokens": 25820063.0,
|
|
"step": 10180
|
|
},
|
|
{
|
|
"entropy": 6.234112787246704,
|
|
"epoch": 1.1754183496826314,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.00048735407754291063,
|
|
"loss": 5.8828,
|
|
"mean_token_accuracy": 0.18974555730819703,
|
|
"num_tokens": 25832974.0,
|
|
"step": 10185
|
|
},
|
|
{
|
|
"entropy": 6.292014217376709,
|
|
"epoch": 1.17599538372764,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048734043491438175,
|
|
"loss": 5.9219,
|
|
"mean_token_accuracy": 0.17494470328092576,
|
|
"num_tokens": 25845939.0,
|
|
"step": 10190
|
|
},
|
|
{
|
|
"entropy": 6.2192240238189695,
|
|
"epoch": 1.1765724177726486,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048732678514388773,
|
|
"loss": 5.8873,
|
|
"mean_token_accuracy": 0.17836469560861587,
|
|
"num_tokens": 25857480.0,
|
|
"step": 10195
|
|
},
|
|
{
|
|
"entropy": 6.162649917602539,
|
|
"epoch": 1.1771494518176573,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004873131282318878,
|
|
"loss": 5.8513,
|
|
"mean_token_accuracy": 0.18638965040445327,
|
|
"num_tokens": 25869384.0,
|
|
"step": 10200
|
|
},
|
|
{
|
|
"entropy": 6.183882331848144,
|
|
"epoch": 1.177726485862666,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00048729946417884126,
|
|
"loss": 5.9408,
|
|
"mean_token_accuracy": 0.17680127024650574,
|
|
"num_tokens": 25881705.0,
|
|
"step": 10205
|
|
},
|
|
{
|
|
"entropy": 6.290098524093628,
|
|
"epoch": 1.1783035199076746,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004872857929852076,
|
|
"loss": 5.9349,
|
|
"mean_token_accuracy": 0.1714819997549057,
|
|
"num_tokens": 25894072.0,
|
|
"step": 10210
|
|
},
|
|
{
|
|
"entropy": 6.232169818878174,
|
|
"epoch": 1.1788805539526832,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004872721146514469,
|
|
"loss": 5.803,
|
|
"mean_token_accuracy": 0.1882660523056984,
|
|
"num_tokens": 25907358.0,
|
|
"step": 10215
|
|
},
|
|
{
|
|
"entropy": 6.194604921340942,
|
|
"epoch": 1.1794575879976918,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.000487258429178019,
|
|
"loss": 5.9219,
|
|
"mean_token_accuracy": 0.18903794139623642,
|
|
"num_tokens": 25918746.0,
|
|
"step": 10220
|
|
},
|
|
{
|
|
"entropy": 6.2296899318695065,
|
|
"epoch": 1.1800346220427005,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048724473656538427,
|
|
"loss": 5.913,
|
|
"mean_token_accuracy": 0.18672333359718324,
|
|
"num_tokens": 25930759.0,
|
|
"step": 10225
|
|
},
|
|
{
|
|
"entropy": 6.188735485076904,
|
|
"epoch": 1.1806116560877091,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004872310368140032,
|
|
"loss": 5.8568,
|
|
"mean_token_accuracy": 0.18429872691631316,
|
|
"num_tokens": 25942364.0,
|
|
"step": 10230
|
|
},
|
|
{
|
|
"entropy": 6.206774473190308,
|
|
"epoch": 1.1811886901327178,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004872173299243368,
|
|
"loss": 5.8708,
|
|
"mean_token_accuracy": 0.19336009174585342,
|
|
"num_tokens": 25954254.0,
|
|
"step": 10235
|
|
},
|
|
{
|
|
"entropy": 6.222011852264404,
|
|
"epoch": 1.1817657241777264,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00048720361589684575,
|
|
"loss": 5.9605,
|
|
"mean_token_accuracy": 0.18331651240587235,
|
|
"num_tokens": 25966708.0,
|
|
"step": 10240
|
|
},
|
|
{
|
|
"entropy": 6.236669921875,
|
|
"epoch": 1.182342758222735,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00048718989473199147,
|
|
"loss": 5.9233,
|
|
"mean_token_accuracy": 0.17969653010368347,
|
|
"num_tokens": 25979301.0,
|
|
"step": 10245
|
|
},
|
|
{
|
|
"entropy": 6.237456798553467,
|
|
"epoch": 1.182919792267744,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004871761664302356,
|
|
"loss": 5.9068,
|
|
"mean_token_accuracy": 0.18412716388702394,
|
|
"num_tokens": 25992195.0,
|
|
"step": 10250
|
|
},
|
|
{
|
|
"entropy": 6.177877140045166,
|
|
"epoch": 1.1834968263127525,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004871624309920397,
|
|
"loss": 5.7765,
|
|
"mean_token_accuracy": 0.19591953456401826,
|
|
"num_tokens": 26005078.0,
|
|
"step": 10255
|
|
},
|
|
{
|
|
"entropy": 6.2200273990631105,
|
|
"epoch": 1.1840738603577612,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00048714868841786586,
|
|
"loss": 5.9096,
|
|
"mean_token_accuracy": 0.179879729449749,
|
|
"num_tokens": 26017227.0,
|
|
"step": 10260
|
|
},
|
|
{
|
|
"entropy": 6.244432067871093,
|
|
"epoch": 1.1846508944027698,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00048713493870817626,
|
|
"loss": 5.9489,
|
|
"mean_token_accuracy": 0.18269521296024321,
|
|
"num_tokens": 26030782.0,
|
|
"step": 10265
|
|
},
|
|
{
|
|
"entropy": 6.180662345886231,
|
|
"epoch": 1.1852279284477785,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00048712118186343336,
|
|
"loss": 5.8563,
|
|
"mean_token_accuracy": 0.18943388164043426,
|
|
"num_tokens": 26042327.0,
|
|
"step": 10270
|
|
},
|
|
{
|
|
"entropy": 6.27462363243103,
|
|
"epoch": 1.185804962492787,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.00048710741788409985,
|
|
"loss": 5.9541,
|
|
"mean_token_accuracy": 0.17806721180677415,
|
|
"num_tokens": 26055298.0,
|
|
"step": 10275
|
|
},
|
|
{
|
|
"entropy": 6.273777961730957,
|
|
"epoch": 1.1863819965377957,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004870936467706387,
|
|
"loss": 5.9837,
|
|
"mean_token_accuracy": 0.17382072806358337,
|
|
"num_tokens": 26067389.0,
|
|
"step": 10280
|
|
},
|
|
{
|
|
"entropy": 6.225218200683594,
|
|
"epoch": 1.1869590305828044,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004870798685235131,
|
|
"loss": 5.8962,
|
|
"mean_token_accuracy": 0.18277426362037658,
|
|
"num_tokens": 26080527.0,
|
|
"step": 10285
|
|
},
|
|
{
|
|
"entropy": 6.250852823257446,
|
|
"epoch": 1.187536064627813,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048706608314318654,
|
|
"loss": 5.9648,
|
|
"mean_token_accuracy": 0.17581128627061843,
|
|
"num_tokens": 26093684.0,
|
|
"step": 10290
|
|
},
|
|
{
|
|
"entropy": 6.270060634613037,
|
|
"epoch": 1.1881130986728217,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004870522906301225,
|
|
"loss": 5.9021,
|
|
"mean_token_accuracy": 0.1825753018260002,
|
|
"num_tokens": 26105235.0,
|
|
"step": 10295
|
|
},
|
|
{
|
|
"entropy": 6.226347017288208,
|
|
"epoch": 1.1886901327178303,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000487038490984785,
|
|
"loss": 5.8919,
|
|
"mean_token_accuracy": 0.18395963162183762,
|
|
"num_tokens": 26117542.0,
|
|
"step": 10300
|
|
},
|
|
{
|
|
"entropy": 6.262145042419434,
|
|
"epoch": 1.189267166762839,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00048702468420763826,
|
|
"loss": 6.0085,
|
|
"mean_token_accuracy": 0.17625221163034438,
|
|
"num_tokens": 26130722.0,
|
|
"step": 10305
|
|
},
|
|
{
|
|
"entropy": 6.264938068389893,
|
|
"epoch": 1.1898442008078476,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.00048701087029914657,
|
|
"loss": 5.8314,
|
|
"mean_token_accuracy": 0.18314649015665055,
|
|
"num_tokens": 26143420.0,
|
|
"step": 10310
|
|
},
|
|
{
|
|
"entropy": 6.301358938217163,
|
|
"epoch": 1.1904212348528562,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004869970492597745,
|
|
"loss": 6.0332,
|
|
"mean_token_accuracy": 0.16742831021547316,
|
|
"num_tokens": 26156041.0,
|
|
"step": 10315
|
|
},
|
|
{
|
|
"entropy": 6.172136878967285,
|
|
"epoch": 1.1909982688978649,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004869832210899871,
|
|
"loss": 5.845,
|
|
"mean_token_accuracy": 0.18829168230295182,
|
|
"num_tokens": 26168075.0,
|
|
"step": 10320
|
|
},
|
|
{
|
|
"entropy": 6.214507341384888,
|
|
"epoch": 1.1915753029428737,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.00048696938579024927,
|
|
"loss": 5.8632,
|
|
"mean_token_accuracy": 0.18680178970098496,
|
|
"num_tokens": 26180285.0,
|
|
"step": 10325
|
|
},
|
|
{
|
|
"entropy": 6.155381202697754,
|
|
"epoch": 1.1921523369878824,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.00048695554336102644,
|
|
"loss": 5.8601,
|
|
"mean_token_accuracy": 0.18196229487657548,
|
|
"num_tokens": 26193095.0,
|
|
"step": 10330
|
|
},
|
|
{
|
|
"entropy": 6.198613977432251,
|
|
"epoch": 1.192729371032891,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00048694169380278417,
|
|
"loss": 5.9061,
|
|
"mean_token_accuracy": 0.19160285741090774,
|
|
"num_tokens": 26205477.0,
|
|
"step": 10335
|
|
},
|
|
{
|
|
"entropy": 6.220333862304687,
|
|
"epoch": 1.1933064050778996,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004869278371159884,
|
|
"loss": 5.8512,
|
|
"mean_token_accuracy": 0.18946202248334884,
|
|
"num_tokens": 26220057.0,
|
|
"step": 10340
|
|
},
|
|
{
|
|
"entropy": 6.298282432556152,
|
|
"epoch": 1.1938834391229083,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00048691397330110503,
|
|
"loss": 5.9385,
|
|
"mean_token_accuracy": 0.17706281840801238,
|
|
"num_tokens": 26232327.0,
|
|
"step": 10345
|
|
},
|
|
{
|
|
"entropy": 6.19044942855835,
|
|
"epoch": 1.194460473167917,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004869001023586005,
|
|
"loss": 5.8664,
|
|
"mean_token_accuracy": 0.1862966775894165,
|
|
"num_tokens": 26245087.0,
|
|
"step": 10350
|
|
},
|
|
{
|
|
"entropy": 6.27628083229065,
|
|
"epoch": 1.1950375072129256,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004868862242889413,
|
|
"loss": 5.9464,
|
|
"mean_token_accuracy": 0.1738221064209938,
|
|
"num_tokens": 26258041.0,
|
|
"step": 10355
|
|
},
|
|
{
|
|
"entropy": 6.253827428817749,
|
|
"epoch": 1.1956145412579342,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.000486872339092594,
|
|
"loss": 5.9329,
|
|
"mean_token_accuracy": 0.1788163736462593,
|
|
"num_tokens": 26270443.0,
|
|
"step": 10360
|
|
},
|
|
{
|
|
"entropy": 6.221220397949219,
|
|
"epoch": 1.1961915753029428,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.000486858446770026,
|
|
"loss": 5.8764,
|
|
"mean_token_accuracy": 0.1764179676771164,
|
|
"num_tokens": 26282685.0,
|
|
"step": 10365
|
|
},
|
|
{
|
|
"entropy": 6.259880018234253,
|
|
"epoch": 1.1967686093479515,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004868445473217043,
|
|
"loss": 5.9615,
|
|
"mean_token_accuracy": 0.17861454635858537,
|
|
"num_tokens": 26296003.0,
|
|
"step": 10370
|
|
},
|
|
{
|
|
"entropy": 6.142031145095825,
|
|
"epoch": 1.1973456433929601,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004868306407480965,
|
|
"loss": 5.802,
|
|
"mean_token_accuracy": 0.18455828428268434,
|
|
"num_tokens": 26309102.0,
|
|
"step": 10375
|
|
},
|
|
{
|
|
"entropy": 6.2524937152862545,
|
|
"epoch": 1.1979226774379688,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00048681672704967036,
|
|
"loss": 5.9077,
|
|
"mean_token_accuracy": 0.1821337327361107,
|
|
"num_tokens": 26321571.0,
|
|
"step": 10380
|
|
},
|
|
{
|
|
"entropy": 6.342026090621948,
|
|
"epoch": 1.1984997114829774,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004868028062268938,
|
|
"loss": 5.9821,
|
|
"mean_token_accuracy": 0.17679037153720856,
|
|
"num_tokens": 26334761.0,
|
|
"step": 10385
|
|
},
|
|
{
|
|
"entropy": 6.182615852355957,
|
|
"epoch": 1.1990767455279863,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00048678887828023504,
|
|
"loss": 5.794,
|
|
"mean_token_accuracy": 0.18676298409700393,
|
|
"num_tokens": 26348815.0,
|
|
"step": 10390
|
|
},
|
|
{
|
|
"entropy": 6.205089139938354,
|
|
"epoch": 1.1996537795729947,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004867749432101626,
|
|
"loss": 5.915,
|
|
"mean_token_accuracy": 0.17840406000614167,
|
|
"num_tokens": 26361675.0,
|
|
"step": 10395
|
|
},
|
|
{
|
|
"entropy": 6.274042654037475,
|
|
"epoch": 1.2002308136180035,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004867610010171451,
|
|
"loss": 6.0051,
|
|
"mean_token_accuracy": 0.17303507626056672,
|
|
"num_tokens": 26375010.0,
|
|
"step": 10400
|
|
},
|
|
{
|
|
"entropy": 6.292940378189087,
|
|
"epoch": 1.2008078476630122,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00048674705170165147,
|
|
"loss": 5.9732,
|
|
"mean_token_accuracy": 0.17850806564092636,
|
|
"num_tokens": 26388217.0,
|
|
"step": 10405
|
|
},
|
|
{
|
|
"entropy": 6.195116758346558,
|
|
"epoch": 1.2013848817080208,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.000486733095264151,
|
|
"loss": 5.9038,
|
|
"mean_token_accuracy": 0.1861647993326187,
|
|
"num_tokens": 26402088.0,
|
|
"step": 10410
|
|
},
|
|
{
|
|
"entropy": 6.1927567481994625,
|
|
"epoch": 1.2019619157530295,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00048671913170511306,
|
|
"loss": 5.8926,
|
|
"mean_token_accuracy": 0.1835414081811905,
|
|
"num_tokens": 26414816.0,
|
|
"step": 10415
|
|
},
|
|
{
|
|
"entropy": 6.251120758056641,
|
|
"epoch": 1.202538949798038,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004867051610250073,
|
|
"loss": 5.8567,
|
|
"mean_token_accuracy": 0.18279548734426498,
|
|
"num_tokens": 26426345.0,
|
|
"step": 10420
|
|
},
|
|
{
|
|
"entropy": 6.1436532497406,
|
|
"epoch": 1.2031159838430467,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004866911832243035,
|
|
"loss": 5.6708,
|
|
"mean_token_accuracy": 0.19303337335586548,
|
|
"num_tokens": 26437982.0,
|
|
"step": 10425
|
|
},
|
|
{
|
|
"entropy": 6.1232579231262205,
|
|
"epoch": 1.2036930178880554,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048667719830347203,
|
|
"loss": 5.9154,
|
|
"mean_token_accuracy": 0.17632388174533845,
|
|
"num_tokens": 26449855.0,
|
|
"step": 10430
|
|
},
|
|
{
|
|
"entropy": 6.299041652679444,
|
|
"epoch": 1.204270051933064,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00048666320626298307,
|
|
"loss": 5.92,
|
|
"mean_token_accuracy": 0.18459949046373367,
|
|
"num_tokens": 26462927.0,
|
|
"step": 10435
|
|
},
|
|
{
|
|
"entropy": 6.25364203453064,
|
|
"epoch": 1.2048470859780727,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00048664920710330735,
|
|
"loss": 5.9653,
|
|
"mean_token_accuracy": 0.1775884971022606,
|
|
"num_tokens": 26475022.0,
|
|
"step": 10440
|
|
},
|
|
{
|
|
"entropy": 6.214952230453491,
|
|
"epoch": 1.2054241200230813,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00048663520082491564,
|
|
"loss": 5.8916,
|
|
"mean_token_accuracy": 0.18937628716230392,
|
|
"num_tokens": 26486959.0,
|
|
"step": 10445
|
|
},
|
|
{
|
|
"entropy": 6.240479230880737,
|
|
"epoch": 1.20600115406809,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004866211874282791,
|
|
"loss": 5.9576,
|
|
"mean_token_accuracy": 0.1838987112045288,
|
|
"num_tokens": 26500345.0,
|
|
"step": 10450
|
|
},
|
|
{
|
|
"entropy": 6.267888355255127,
|
|
"epoch": 1.2065781881130986,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.000486607166913869,
|
|
"loss": 5.9311,
|
|
"mean_token_accuracy": 0.18621276021003724,
|
|
"num_tokens": 26511625.0,
|
|
"step": 10455
|
|
},
|
|
{
|
|
"entropy": 6.242213773727417,
|
|
"epoch": 1.2071552221581072,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00048659313928215705,
|
|
"loss": 5.9358,
|
|
"mean_token_accuracy": 0.1800112694501877,
|
|
"num_tokens": 26523764.0,
|
|
"step": 10460
|
|
},
|
|
{
|
|
"entropy": 6.233942937850952,
|
|
"epoch": 1.207732256203116,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004865791045336149,
|
|
"loss": 5.9028,
|
|
"mean_token_accuracy": 0.1811545193195343,
|
|
"num_tokens": 26536925.0,
|
|
"step": 10465
|
|
},
|
|
{
|
|
"entropy": 6.169159698486328,
|
|
"epoch": 1.2083092902481247,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004865650626687146,
|
|
"loss": 5.7468,
|
|
"mean_token_accuracy": 0.19598589539527894,
|
|
"num_tokens": 26549201.0,
|
|
"step": 10470
|
|
},
|
|
{
|
|
"entropy": 6.203572702407837,
|
|
"epoch": 1.2088863242931334,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00048655101368792866,
|
|
"loss": 5.9031,
|
|
"mean_token_accuracy": 0.18499507009983063,
|
|
"num_tokens": 26561495.0,
|
|
"step": 10475
|
|
},
|
|
{
|
|
"entropy": 6.237302017211914,
|
|
"epoch": 1.209463358338142,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004865369575917293,
|
|
"loss": 5.9454,
|
|
"mean_token_accuracy": 0.17504747658967973,
|
|
"num_tokens": 26573820.0,
|
|
"step": 10480
|
|
},
|
|
{
|
|
"entropy": 6.256232976913452,
|
|
"epoch": 1.2100403923831506,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048652289438058953,
|
|
"loss": 5.9242,
|
|
"mean_token_accuracy": 0.18367512822151183,
|
|
"num_tokens": 26587468.0,
|
|
"step": 10485
|
|
},
|
|
{
|
|
"entropy": 6.191364383697509,
|
|
"epoch": 1.2106174264281593,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00048650882405498226,
|
|
"loss": 5.9536,
|
|
"mean_token_accuracy": 0.17529995739459991,
|
|
"num_tokens": 26599884.0,
|
|
"step": 10490
|
|
},
|
|
{
|
|
"entropy": 6.18445987701416,
|
|
"epoch": 1.211194460473168,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004864947466153808,
|
|
"loss": 5.8633,
|
|
"mean_token_accuracy": 0.1881292626261711,
|
|
"num_tokens": 26612501.0,
|
|
"step": 10495
|
|
},
|
|
{
|
|
"entropy": 6.330709075927734,
|
|
"epoch": 1.2117714945181766,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004864806620622585,
|
|
"loss": 5.8942,
|
|
"mean_token_accuracy": 0.18237232863903047,
|
|
"num_tokens": 26624559.0,
|
|
"step": 10500
|
|
},
|
|
{
|
|
"entropy": 6.27984037399292,
|
|
"epoch": 1.2123485285631852,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004864665703960892,
|
|
"loss": 5.9248,
|
|
"mean_token_accuracy": 0.1735801711678505,
|
|
"num_tokens": 26636903.0,
|
|
"step": 10505
|
|
},
|
|
{
|
|
"entropy": 6.253863048553467,
|
|
"epoch": 1.2129255626081938,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004864524716173469,
|
|
"loss": 5.8581,
|
|
"mean_token_accuracy": 0.18250663876533507,
|
|
"num_tokens": 26649393.0,
|
|
"step": 10510
|
|
},
|
|
{
|
|
"entropy": 6.182285356521606,
|
|
"epoch": 1.2135025966532025,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004864383657265058,
|
|
"loss": 5.8711,
|
|
"mean_token_accuracy": 0.18657347857952117,
|
|
"num_tokens": 26661134.0,
|
|
"step": 10515
|
|
},
|
|
{
|
|
"entropy": 6.233286142349243,
|
|
"epoch": 1.2140796306982111,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00048642425272404016,
|
|
"loss": 5.948,
|
|
"mean_token_accuracy": 0.17871742993593215,
|
|
"num_tokens": 26674451.0,
|
|
"step": 10520
|
|
},
|
|
{
|
|
"entropy": 6.293264722824096,
|
|
"epoch": 1.2146566647432198,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004864101326104248,
|
|
"loss": 5.8934,
|
|
"mean_token_accuracy": 0.18119763284921647,
|
|
"num_tokens": 26686382.0,
|
|
"step": 10525
|
|
},
|
|
{
|
|
"entropy": 6.174519824981689,
|
|
"epoch": 1.2152336987882286,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004863960053861348,
|
|
"loss": 5.8629,
|
|
"mean_token_accuracy": 0.18694709986448288,
|
|
"num_tokens": 26698491.0,
|
|
"step": 10530
|
|
},
|
|
{
|
|
"entropy": 6.153842973709106,
|
|
"epoch": 1.215810732833237,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00048638187105164507,
|
|
"loss": 5.8853,
|
|
"mean_token_accuracy": 0.18205370157957076,
|
|
"num_tokens": 26710836.0,
|
|
"step": 10535
|
|
},
|
|
{
|
|
"entropy": 6.2186424255371096,
|
|
"epoch": 1.216387766878246,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004863677296074311,
|
|
"loss": 5.8716,
|
|
"mean_token_accuracy": 0.1870691657066345,
|
|
"num_tokens": 26723195.0,
|
|
"step": 10540
|
|
},
|
|
{
|
|
"entropy": 6.250338935852051,
|
|
"epoch": 1.2169648009232545,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004863535810539686,
|
|
"loss": 5.8641,
|
|
"mean_token_accuracy": 0.19379239678382873,
|
|
"num_tokens": 26736048.0,
|
|
"step": 10545
|
|
},
|
|
{
|
|
"entropy": 6.230413436889648,
|
|
"epoch": 1.2175418349682632,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00048633942539173325,
|
|
"loss": 5.9696,
|
|
"mean_token_accuracy": 0.1795030802488327,
|
|
"num_tokens": 26748712.0,
|
|
"step": 10550
|
|
},
|
|
{
|
|
"entropy": 6.303004455566406,
|
|
"epoch": 1.2181188690132718,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00048632526262120144,
|
|
"loss": 5.9658,
|
|
"mean_token_accuracy": 0.17351969033479692,
|
|
"num_tokens": 26760546.0,
|
|
"step": 10555
|
|
},
|
|
{
|
|
"entropy": 6.282928037643432,
|
|
"epoch": 1.2186959030582805,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004863110927428493,
|
|
"loss": 5.8626,
|
|
"mean_token_accuracy": 0.18044263273477554,
|
|
"num_tokens": 26772792.0,
|
|
"step": 10560
|
|
},
|
|
{
|
|
"entropy": 6.124064779281616,
|
|
"epoch": 1.219272937103289,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004862969157571536,
|
|
"loss": 5.7745,
|
|
"mean_token_accuracy": 0.194984470307827,
|
|
"num_tokens": 26785321.0,
|
|
"step": 10565
|
|
},
|
|
{
|
|
"entropy": 6.213613271713257,
|
|
"epoch": 1.2198499711482977,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048628273166459105,
|
|
"loss": 5.818,
|
|
"mean_token_accuracy": 0.18542979061603546,
|
|
"num_tokens": 26797481.0,
|
|
"step": 10570
|
|
},
|
|
{
|
|
"entropy": 6.285091686248779,
|
|
"epoch": 1.2204270051933064,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00048626854046563876,
|
|
"loss": 5.9554,
|
|
"mean_token_accuracy": 0.18456581830978394,
|
|
"num_tokens": 26810644.0,
|
|
"step": 10575
|
|
},
|
|
{
|
|
"entropy": 6.297290182113647,
|
|
"epoch": 1.221004039238315,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00048625434216077404,
|
|
"loss": 5.8977,
|
|
"mean_token_accuracy": 0.18243593573570252,
|
|
"num_tokens": 26822545.0,
|
|
"step": 10580
|
|
},
|
|
{
|
|
"entropy": 6.200481605529785,
|
|
"epoch": 1.2215810732833237,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00048624013675047453,
|
|
"loss": 5.8957,
|
|
"mean_token_accuracy": 0.18178013414144517,
|
|
"num_tokens": 26836221.0,
|
|
"step": 10585
|
|
},
|
|
{
|
|
"entropy": 6.284975624084472,
|
|
"epoch": 1.2221581073283323,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00048622592423521783,
|
|
"loss": 5.9676,
|
|
"mean_token_accuracy": 0.1788189336657524,
|
|
"num_tokens": 26848543.0,
|
|
"step": 10590
|
|
},
|
|
{
|
|
"entropy": 6.295896053314209,
|
|
"epoch": 1.222735141373341,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004862117046154822,
|
|
"loss": 5.9408,
|
|
"mean_token_accuracy": 0.18014086037874222,
|
|
"num_tokens": 26859833.0,
|
|
"step": 10595
|
|
},
|
|
{
|
|
"entropy": 6.240191459655762,
|
|
"epoch": 1.2233121754183496,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.00048619747789174577,
|
|
"loss": 5.9005,
|
|
"mean_token_accuracy": 0.18657582402229309,
|
|
"num_tokens": 26873450.0,
|
|
"step": 10600
|
|
},
|
|
{
|
|
"entropy": 6.201486682891845,
|
|
"epoch": 1.2238892094633584,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004861832440644871,
|
|
"loss": 5.8684,
|
|
"mean_token_accuracy": 0.17937362045049668,
|
|
"num_tokens": 26886545.0,
|
|
"step": 10605
|
|
},
|
|
{
|
|
"entropy": 6.2080159187316895,
|
|
"epoch": 1.224466243508367,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00048616900313418486,
|
|
"loss": 5.8221,
|
|
"mean_token_accuracy": 0.18913633227348328,
|
|
"num_tokens": 26898394.0,
|
|
"step": 10610
|
|
},
|
|
{
|
|
"entropy": 6.235791397094727,
|
|
"epoch": 1.2250432775533757,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00048615475510131815,
|
|
"loss": 5.8854,
|
|
"mean_token_accuracy": 0.18782524019479752,
|
|
"num_tokens": 26910172.0,
|
|
"step": 10615
|
|
},
|
|
{
|
|
"entropy": 6.1328874111175535,
|
|
"epoch": 1.2256203115983844,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00048614049996636614,
|
|
"loss": 5.7541,
|
|
"mean_token_accuracy": 0.19627405554056168,
|
|
"num_tokens": 26922496.0,
|
|
"step": 10620
|
|
},
|
|
{
|
|
"entropy": 6.186247682571411,
|
|
"epoch": 1.226197345643393,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00048612623772980825,
|
|
"loss": 5.8499,
|
|
"mean_token_accuracy": 0.18871124386787413,
|
|
"num_tokens": 26935264.0,
|
|
"step": 10625
|
|
},
|
|
{
|
|
"entropy": 6.2213846206665036,
|
|
"epoch": 1.2267743796884016,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048611196839212426,
|
|
"loss": 5.8391,
|
|
"mean_token_accuracy": 0.1925579398870468,
|
|
"num_tokens": 26949006.0,
|
|
"step": 10630
|
|
},
|
|
{
|
|
"entropy": 6.088655662536621,
|
|
"epoch": 1.2273514137334103,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.000486097691953794,
|
|
"loss": 5.7191,
|
|
"mean_token_accuracy": 0.18999349772930146,
|
|
"num_tokens": 26961305.0,
|
|
"step": 10635
|
|
},
|
|
{
|
|
"entropy": 6.256745481491089,
|
|
"epoch": 1.227928447778419,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00048608340841529784,
|
|
"loss": 5.9247,
|
|
"mean_token_accuracy": 0.17799484431743623,
|
|
"num_tokens": 26973445.0,
|
|
"step": 10640
|
|
},
|
|
{
|
|
"entropy": 6.2267831325531,
|
|
"epoch": 1.2285054818234276,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.000486069117777116,
|
|
"loss": 5.8593,
|
|
"mean_token_accuracy": 0.18302432596683502,
|
|
"num_tokens": 26986286.0,
|
|
"step": 10645
|
|
},
|
|
{
|
|
"entropy": 6.250400066375732,
|
|
"epoch": 1.2290825158684362,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004860548200397293,
|
|
"loss": 5.9002,
|
|
"mean_token_accuracy": 0.18009741902351378,
|
|
"num_tokens": 26999281.0,
|
|
"step": 10650
|
|
},
|
|
{
|
|
"entropy": 6.267655229568481,
|
|
"epoch": 1.2296595499134448,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00048604051520361846,
|
|
"loss": 6.0407,
|
|
"mean_token_accuracy": 0.17532236725091935,
|
|
"num_tokens": 27011916.0,
|
|
"step": 10655
|
|
},
|
|
{
|
|
"entropy": 6.297758436203003,
|
|
"epoch": 1.2302365839584535,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00048602620326926484,
|
|
"loss": 5.9231,
|
|
"mean_token_accuracy": 0.18180691152811052,
|
|
"num_tokens": 27024442.0,
|
|
"step": 10660
|
|
},
|
|
{
|
|
"entropy": 6.320510053634644,
|
|
"epoch": 1.2308136180034621,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00048601188423714965,
|
|
"loss": 6.0015,
|
|
"mean_token_accuracy": 0.17772735059261321,
|
|
"num_tokens": 27037978.0,
|
|
"step": 10665
|
|
},
|
|
{
|
|
"entropy": 6.302739143371582,
|
|
"epoch": 1.231390652048471,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004859975581077545,
|
|
"loss": 6.0218,
|
|
"mean_token_accuracy": 0.17019021958112718,
|
|
"num_tokens": 27049447.0,
|
|
"step": 10670
|
|
},
|
|
{
|
|
"entropy": 6.216468811035156,
|
|
"epoch": 1.2319676860934794,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004859832248815614,
|
|
"loss": 5.8897,
|
|
"mean_token_accuracy": 0.1882360503077507,
|
|
"num_tokens": 27062961.0,
|
|
"step": 10675
|
|
},
|
|
{
|
|
"entropy": 6.275489568710327,
|
|
"epoch": 1.2325447201384883,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004859688845590522,
|
|
"loss": 5.9641,
|
|
"mean_token_accuracy": 0.17728179842233657,
|
|
"num_tokens": 27076297.0,
|
|
"step": 10680
|
|
},
|
|
{
|
|
"entropy": 6.293725633621216,
|
|
"epoch": 1.233121754183497,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00048595453714070944,
|
|
"loss": 5.9957,
|
|
"mean_token_accuracy": 0.17474785596132278,
|
|
"num_tokens": 27088496.0,
|
|
"step": 10685
|
|
},
|
|
{
|
|
"entropy": 6.297595357894897,
|
|
"epoch": 1.2336987882285055,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004859401826270156,
|
|
"loss": 5.956,
|
|
"mean_token_accuracy": 0.1806192636489868,
|
|
"num_tokens": 27100695.0,
|
|
"step": 10690
|
|
},
|
|
{
|
|
"entropy": 6.236401987075806,
|
|
"epoch": 1.2342758222735142,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004859258210184536,
|
|
"loss": 5.958,
|
|
"mean_token_accuracy": 0.18606834709644318,
|
|
"num_tokens": 27113703.0,
|
|
"step": 10695
|
|
},
|
|
{
|
|
"entropy": 6.303116703033448,
|
|
"epoch": 1.2348528563185228,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.00048591145231550623,
|
|
"loss": 5.949,
|
|
"mean_token_accuracy": 0.17845748662948607,
|
|
"num_tokens": 27128669.0,
|
|
"step": 10700
|
|
},
|
|
{
|
|
"entropy": 6.2689940452575685,
|
|
"epoch": 1.2354298903635315,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00048589707651865697,
|
|
"loss": 5.9483,
|
|
"mean_token_accuracy": 0.17878946512937546,
|
|
"num_tokens": 27141311.0,
|
|
"step": 10705
|
|
},
|
|
{
|
|
"entropy": 6.3080309391021725,
|
|
"epoch": 1.23600692440854,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004858826936283893,
|
|
"loss": 5.9311,
|
|
"mean_token_accuracy": 0.18167731910943985,
|
|
"num_tokens": 27152935.0,
|
|
"step": 10710
|
|
},
|
|
{
|
|
"entropy": 6.186159563064575,
|
|
"epoch": 1.2365839584535487,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.000485868303645187,
|
|
"loss": 5.7991,
|
|
"mean_token_accuracy": 0.18926886171102525,
|
|
"num_tokens": 27166775.0,
|
|
"step": 10715
|
|
},
|
|
{
|
|
"entropy": 6.144335985183716,
|
|
"epoch": 1.2371609924985574,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00048585390656953397,
|
|
"loss": 5.8706,
|
|
"mean_token_accuracy": 0.18486643135547637,
|
|
"num_tokens": 27179406.0,
|
|
"step": 10720
|
|
},
|
|
{
|
|
"entropy": 6.277384281158447,
|
|
"epoch": 1.237738026543566,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004858395024019147,
|
|
"loss": 5.8926,
|
|
"mean_token_accuracy": 0.1846141442656517,
|
|
"num_tokens": 27191562.0,
|
|
"step": 10725
|
|
},
|
|
{
|
|
"entropy": 6.242267036437989,
|
|
"epoch": 1.2383150605885747,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004858250911428133,
|
|
"loss": 5.9116,
|
|
"mean_token_accuracy": 0.17939815521240235,
|
|
"num_tokens": 27203827.0,
|
|
"step": 10730
|
|
},
|
|
{
|
|
"entropy": 6.236856460571289,
|
|
"epoch": 1.2388920946335833,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004858106727927148,
|
|
"loss": 5.8727,
|
|
"mean_token_accuracy": 0.18083032816648484,
|
|
"num_tokens": 27217645.0,
|
|
"step": 10735
|
|
},
|
|
{
|
|
"entropy": 6.257790279388428,
|
|
"epoch": 1.239469128678592,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.000485796247352104,
|
|
"loss": 5.9408,
|
|
"mean_token_accuracy": 0.187166827917099,
|
|
"num_tokens": 27230794.0,
|
|
"step": 10740
|
|
},
|
|
{
|
|
"entropy": 6.275010776519776,
|
|
"epoch": 1.2400461627236008,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004857818148214662,
|
|
"loss": 5.9672,
|
|
"mean_token_accuracy": 0.17526779770851136,
|
|
"num_tokens": 27243965.0,
|
|
"step": 10745
|
|
},
|
|
{
|
|
"entropy": 6.313845252990722,
|
|
"epoch": 1.2406231967686094,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004857673752012866,
|
|
"loss": 5.9307,
|
|
"mean_token_accuracy": 0.17886531203985215,
|
|
"num_tokens": 27256951.0,
|
|
"step": 10750
|
|
},
|
|
{
|
|
"entropy": 6.283997392654419,
|
|
"epoch": 1.241200230813618,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00048575292849205114,
|
|
"loss": 5.9792,
|
|
"mean_token_accuracy": 0.1764329567551613,
|
|
"num_tokens": 27268556.0,
|
|
"step": 10755
|
|
},
|
|
{
|
|
"entropy": 6.223181200027466,
|
|
"epoch": 1.2417772648586267,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004857384746942456,
|
|
"loss": 5.8171,
|
|
"mean_token_accuracy": 0.18010614514350892,
|
|
"num_tokens": 27280367.0,
|
|
"step": 10760
|
|
},
|
|
{
|
|
"entropy": 6.2159076690673825,
|
|
"epoch": 1.2423542989036354,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004857240138083562,
|
|
"loss": 5.9008,
|
|
"mean_token_accuracy": 0.18687991052865982,
|
|
"num_tokens": 27293727.0,
|
|
"step": 10765
|
|
},
|
|
{
|
|
"entropy": 6.280245590209961,
|
|
"epoch": 1.242931332948644,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004857095458348692,
|
|
"loss": 5.964,
|
|
"mean_token_accuracy": 0.1840096592903137,
|
|
"num_tokens": 27306677.0,
|
|
"step": 10770
|
|
},
|
|
{
|
|
"entropy": 6.303292608261108,
|
|
"epoch": 1.2435083669936526,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00048569507077427134,
|
|
"loss": 5.9332,
|
|
"mean_token_accuracy": 0.1819072499871254,
|
|
"num_tokens": 27319317.0,
|
|
"step": 10775
|
|
},
|
|
{
|
|
"entropy": 6.264583969116211,
|
|
"epoch": 1.2440854010386613,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004856805886270494,
|
|
"loss": 5.905,
|
|
"mean_token_accuracy": 0.18524052053689957,
|
|
"num_tokens": 27332021.0,
|
|
"step": 10780
|
|
},
|
|
{
|
|
"entropy": 6.156681680679322,
|
|
"epoch": 1.24466243508367,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004856660993936905,
|
|
"loss": 5.7563,
|
|
"mean_token_accuracy": 0.201753930747509,
|
|
"num_tokens": 27343972.0,
|
|
"step": 10785
|
|
},
|
|
{
|
|
"entropy": 6.273656749725342,
|
|
"epoch": 1.2452394691286786,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.000485651603074682,
|
|
"loss": 5.9718,
|
|
"mean_token_accuracy": 0.1731579691171646,
|
|
"num_tokens": 27356712.0,
|
|
"step": 10790
|
|
},
|
|
{
|
|
"entropy": 6.211948394775391,
|
|
"epoch": 1.2458165031736872,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004856370996705115,
|
|
"loss": 5.8361,
|
|
"mean_token_accuracy": 0.18876608461141586,
|
|
"num_tokens": 27369028.0,
|
|
"step": 10795
|
|
},
|
|
{
|
|
"entropy": 6.217354869842529,
|
|
"epoch": 1.2463935372186958,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004856225891816667,
|
|
"loss": 5.8618,
|
|
"mean_token_accuracy": 0.18710222393274306,
|
|
"num_tokens": 27380789.0,
|
|
"step": 10800
|
|
},
|
|
{
|
|
"entropy": 6.251491403579712,
|
|
"epoch": 1.2469705712637045,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004856080716086358,
|
|
"loss": 5.8166,
|
|
"mean_token_accuracy": 0.1833536610007286,
|
|
"num_tokens": 27394098.0,
|
|
"step": 10805
|
|
},
|
|
{
|
|
"entropy": 6.221289253234863,
|
|
"epoch": 1.2475476053087133,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.000485593546951907,
|
|
"loss": 5.9253,
|
|
"mean_token_accuracy": 0.18810599744319917,
|
|
"num_tokens": 27407270.0,
|
|
"step": 10810
|
|
},
|
|
{
|
|
"entropy": 6.242495155334472,
|
|
"epoch": 1.2481246393537218,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004855790152119688,
|
|
"loss": 5.8755,
|
|
"mean_token_accuracy": 0.18733642101287842,
|
|
"num_tokens": 27420397.0,
|
|
"step": 10815
|
|
},
|
|
{
|
|
"entropy": 6.273569202423095,
|
|
"epoch": 1.2487016733987306,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004855644763893102,
|
|
"loss": 5.9575,
|
|
"mean_token_accuracy": 0.1822887822985649,
|
|
"num_tokens": 27433007.0,
|
|
"step": 10820
|
|
},
|
|
{
|
|
"entropy": 6.296523666381836,
|
|
"epoch": 1.2492787074437393,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00048554993048441987,
|
|
"loss": 5.9286,
|
|
"mean_token_accuracy": 0.17798348218202592,
|
|
"num_tokens": 27446683.0,
|
|
"step": 10825
|
|
},
|
|
{
|
|
"entropy": 6.2345174789428714,
|
|
"epoch": 1.249855741488748,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004855353774977873,
|
|
"loss": 5.9498,
|
|
"mean_token_accuracy": 0.1765942618250847,
|
|
"num_tokens": 27459298.0,
|
|
"step": 10830
|
|
},
|
|
{
|
|
"entropy": 6.222336292266846,
|
|
"epoch": 1.2504327755337565,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00048552081742990184,
|
|
"loss": 5.9103,
|
|
"mean_token_accuracy": 0.18254689276218414,
|
|
"num_tokens": 27472287.0,
|
|
"step": 10835
|
|
},
|
|
{
|
|
"entropy": 6.276287794113159,
|
|
"epoch": 1.2510098095787652,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048550625028125327,
|
|
"loss": 5.8996,
|
|
"mean_token_accuracy": 0.18219816386699678,
|
|
"num_tokens": 27484808.0,
|
|
"step": 10840
|
|
},
|
|
{
|
|
"entropy": 6.2211394786834715,
|
|
"epoch": 1.2515868436237738,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004854916760523315,
|
|
"loss": 5.8676,
|
|
"mean_token_accuracy": 0.18489859700202943,
|
|
"num_tokens": 27496980.0,
|
|
"step": 10845
|
|
},
|
|
{
|
|
"entropy": 6.2227785110473635,
|
|
"epoch": 1.2521638776687825,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00048547709474362684,
|
|
"loss": 5.9122,
|
|
"mean_token_accuracy": 0.17859497368335725,
|
|
"num_tokens": 27509969.0,
|
|
"step": 10850
|
|
},
|
|
{
|
|
"entropy": 6.25306191444397,
|
|
"epoch": 1.252740911713791,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004854625063556296,
|
|
"loss": 5.8834,
|
|
"mean_token_accuracy": 0.1868899032473564,
|
|
"num_tokens": 27523410.0,
|
|
"step": 10855
|
|
},
|
|
{
|
|
"entropy": 6.227614545822144,
|
|
"epoch": 1.2533179457587997,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004854479108888305,
|
|
"loss": 5.8827,
|
|
"mean_token_accuracy": 0.18421921283006668,
|
|
"num_tokens": 27535183.0,
|
|
"step": 10860
|
|
},
|
|
{
|
|
"entropy": 6.256004571914673,
|
|
"epoch": 1.2538949798038084,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00048543330834372047,
|
|
"loss": 5.9298,
|
|
"mean_token_accuracy": 0.17713305205106736,
|
|
"num_tokens": 27548028.0,
|
|
"step": 10865
|
|
},
|
|
{
|
|
"entropy": 6.250798034667969,
|
|
"epoch": 1.254472013848817,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00048541869872079064,
|
|
"loss": 5.8519,
|
|
"mean_token_accuracy": 0.18728440403938293,
|
|
"num_tokens": 27561302.0,
|
|
"step": 10870
|
|
},
|
|
{
|
|
"entropy": 6.191199779510498,
|
|
"epoch": 1.2550490478938257,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004854040820205324,
|
|
"loss": 5.771,
|
|
"mean_token_accuracy": 0.1891787514090538,
|
|
"num_tokens": 27572933.0,
|
|
"step": 10875
|
|
},
|
|
{
|
|
"entropy": 6.267033433914184,
|
|
"epoch": 1.2556260819388343,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004853894582434373,
|
|
"loss": 5.9594,
|
|
"mean_token_accuracy": 0.18094786554574965,
|
|
"num_tokens": 27586373.0,
|
|
"step": 10880
|
|
},
|
|
{
|
|
"entropy": 6.212432479858398,
|
|
"epoch": 1.2562031159838432,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004853748273899974,
|
|
"loss": 5.8121,
|
|
"mean_token_accuracy": 0.1917188748717308,
|
|
"num_tokens": 27599236.0,
|
|
"step": 10885
|
|
},
|
|
{
|
|
"entropy": 6.199079370498657,
|
|
"epoch": 1.2567801500288516,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004853601894607046,
|
|
"loss": 5.8198,
|
|
"mean_token_accuracy": 0.1882639765739441,
|
|
"num_tokens": 27611904.0,
|
|
"step": 10890
|
|
},
|
|
{
|
|
"entropy": 6.141427040100098,
|
|
"epoch": 1.2573571840738604,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004853455444560514,
|
|
"loss": 5.7666,
|
|
"mean_token_accuracy": 0.1835411846637726,
|
|
"num_tokens": 27625778.0,
|
|
"step": 10895
|
|
},
|
|
{
|
|
"entropy": 6.264633512496948,
|
|
"epoch": 1.257934218118869,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004853308923765302,
|
|
"loss": 5.9298,
|
|
"mean_token_accuracy": 0.1849829599261284,
|
|
"num_tokens": 27638359.0,
|
|
"step": 10900
|
|
},
|
|
{
|
|
"entropy": 6.22053279876709,
|
|
"epoch": 1.2585112521638777,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.000485316233222634,
|
|
"loss": 5.809,
|
|
"mean_token_accuracy": 0.19588791131973265,
|
|
"num_tokens": 27651107.0,
|
|
"step": 10905
|
|
},
|
|
{
|
|
"entropy": 6.263698863983154,
|
|
"epoch": 1.2590882862088864,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004853015669948557,
|
|
"loss": 5.9405,
|
|
"mean_token_accuracy": 0.1806721031665802,
|
|
"num_tokens": 27664060.0,
|
|
"step": 10910
|
|
},
|
|
{
|
|
"entropy": 6.198569345474243,
|
|
"epoch": 1.259665320253895,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00048528689369368863,
|
|
"loss": 5.8714,
|
|
"mean_token_accuracy": 0.18663408011198043,
|
|
"num_tokens": 27676678.0,
|
|
"step": 10915
|
|
},
|
|
{
|
|
"entropy": 6.27892484664917,
|
|
"epoch": 1.2602423542989036,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004852722133196264,
|
|
"loss": 5.9284,
|
|
"mean_token_accuracy": 0.17606211006641387,
|
|
"num_tokens": 27689696.0,
|
|
"step": 10920
|
|
},
|
|
{
|
|
"entropy": 6.214528560638428,
|
|
"epoch": 1.2608193883439123,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004852575258731627,
|
|
"loss": 5.8139,
|
|
"mean_token_accuracy": 0.18999661058187484,
|
|
"num_tokens": 27702144.0,
|
|
"step": 10925
|
|
},
|
|
{
|
|
"entropy": 6.267048263549805,
|
|
"epoch": 1.261396422388921,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004852428313547916,
|
|
"loss": 5.9585,
|
|
"mean_token_accuracy": 0.17625246644020082,
|
|
"num_tokens": 27714618.0,
|
|
"step": 10930
|
|
},
|
|
{
|
|
"entropy": 6.254409265518189,
|
|
"epoch": 1.2619734564339296,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00048522812976500726,
|
|
"loss": 5.8882,
|
|
"mean_token_accuracy": 0.1819372683763504,
|
|
"num_tokens": 27727002.0,
|
|
"step": 10935
|
|
},
|
|
{
|
|
"entropy": 6.285655307769775,
|
|
"epoch": 1.2625504904789382,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00048521342110430417,
|
|
"loss": 5.9194,
|
|
"mean_token_accuracy": 0.1847675174474716,
|
|
"num_tokens": 27739506.0,
|
|
"step": 10940
|
|
},
|
|
{
|
|
"entropy": 6.199552774429321,
|
|
"epoch": 1.2631275245239468,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00048519870537317713,
|
|
"loss": 5.7879,
|
|
"mean_token_accuracy": 0.18768482953310012,
|
|
"num_tokens": 27751959.0,
|
|
"step": 10945
|
|
},
|
|
{
|
|
"entropy": 6.188604736328125,
|
|
"epoch": 1.2637045585689557,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048518398257212103,
|
|
"loss": 5.8612,
|
|
"mean_token_accuracy": 0.18423410803079604,
|
|
"num_tokens": 27762938.0,
|
|
"step": 10950
|
|
},
|
|
{
|
|
"entropy": 6.242674493789673,
|
|
"epoch": 1.2642815926139641,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004851692527016311,
|
|
"loss": 5.9281,
|
|
"mean_token_accuracy": 0.1746857702732086,
|
|
"num_tokens": 27776288.0,
|
|
"step": 10955
|
|
},
|
|
{
|
|
"entropy": 6.300945043563843,
|
|
"epoch": 1.264858626658973,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004851545157622027,
|
|
"loss": 5.9403,
|
|
"mean_token_accuracy": 0.16904095262289048,
|
|
"num_tokens": 27788311.0,
|
|
"step": 10960
|
|
},
|
|
{
|
|
"entropy": 6.292170190811158,
|
|
"epoch": 1.2654356607039816,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004851397717543316,
|
|
"loss": 5.9153,
|
|
"mean_token_accuracy": 0.1774510622024536,
|
|
"num_tokens": 27799589.0,
|
|
"step": 10965
|
|
},
|
|
{
|
|
"entropy": 6.163033199310303,
|
|
"epoch": 1.2660126947489903,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004851250206785137,
|
|
"loss": 5.7982,
|
|
"mean_token_accuracy": 0.18300086855888367,
|
|
"num_tokens": 27813057.0,
|
|
"step": 10970
|
|
},
|
|
{
|
|
"entropy": 6.1811439990997314,
|
|
"epoch": 1.266589728793999,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00048511026253524503,
|
|
"loss": 5.8343,
|
|
"mean_token_accuracy": 0.1845756396651268,
|
|
"num_tokens": 27826465.0,
|
|
"step": 10975
|
|
},
|
|
{
|
|
"entropy": 6.239641380310059,
|
|
"epoch": 1.2671667628390075,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004850954973250221,
|
|
"loss": 5.9186,
|
|
"mean_token_accuracy": 0.183623206615448,
|
|
"num_tokens": 27837157.0,
|
|
"step": 10980
|
|
},
|
|
{
|
|
"entropy": 6.2734949588775635,
|
|
"epoch": 1.2677437968840162,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00048508072504834144,
|
|
"loss": 5.9733,
|
|
"mean_token_accuracy": 0.18870452791452408,
|
|
"num_tokens": 27850101.0,
|
|
"step": 10985
|
|
},
|
|
{
|
|
"entropy": 6.257879447937012,
|
|
"epoch": 1.2683208309290248,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.00048506594570569997,
|
|
"loss": 5.9163,
|
|
"mean_token_accuracy": 0.1761870115995407,
|
|
"num_tokens": 27862786.0,
|
|
"step": 10990
|
|
},
|
|
{
|
|
"entropy": 6.310289525985718,
|
|
"epoch": 1.2688978649740335,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004850511592975947,
|
|
"loss": 5.921,
|
|
"mean_token_accuracy": 0.1836473450064659,
|
|
"num_tokens": 27875196.0,
|
|
"step": 10995
|
|
},
|
|
{
|
|
"entropy": 6.256885623931884,
|
|
"epoch": 1.269474899019042,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004850363658245231,
|
|
"loss": 5.9931,
|
|
"mean_token_accuracy": 0.17773234248161315,
|
|
"num_tokens": 27888348.0,
|
|
"step": 11000
|
|
},
|
|
{
|
|
"entropy": 6.264603042602539,
|
|
"epoch": 1.2700519330640507,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004850215652869826,
|
|
"loss": 5.9415,
|
|
"mean_token_accuracy": 0.18163408041000367,
|
|
"num_tokens": 27901301.0,
|
|
"step": 11005
|
|
},
|
|
{
|
|
"entropy": 6.26677885055542,
|
|
"epoch": 1.2706289671090594,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004850067576854711,
|
|
"loss": 5.9245,
|
|
"mean_token_accuracy": 0.18035585135221482,
|
|
"num_tokens": 27915665.0,
|
|
"step": 11010
|
|
},
|
|
{
|
|
"entropy": 6.204976367950439,
|
|
"epoch": 1.271206001154068,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004849919430204867,
|
|
"loss": 5.899,
|
|
"mean_token_accuracy": 0.18384966850280762,
|
|
"num_tokens": 27928333.0,
|
|
"step": 11015
|
|
},
|
|
{
|
|
"entropy": 6.2638813018798825,
|
|
"epoch": 1.2717830351990767,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004849771212925275,
|
|
"loss": 5.8452,
|
|
"mean_token_accuracy": 0.18147977739572524,
|
|
"num_tokens": 27940429.0,
|
|
"step": 11020
|
|
},
|
|
{
|
|
"entropy": 6.264388513565064,
|
|
"epoch": 1.2723600692440855,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00048496229250209223,
|
|
"loss": 5.9614,
|
|
"mean_token_accuracy": 0.18041146397590638,
|
|
"num_tokens": 27953846.0,
|
|
"step": 11025
|
|
},
|
|
{
|
|
"entropy": 6.211956357955932,
|
|
"epoch": 1.272937103289094,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004849474566496795,
|
|
"loss": 5.8087,
|
|
"mean_token_accuracy": 0.19337970167398452,
|
|
"num_tokens": 27966393.0,
|
|
"step": 11030
|
|
},
|
|
{
|
|
"entropy": 6.157489681243897,
|
|
"epoch": 1.2735141373341028,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004849326137357883,
|
|
"loss": 5.7524,
|
|
"mean_token_accuracy": 0.20423612147569656,
|
|
"num_tokens": 27979928.0,
|
|
"step": 11035
|
|
},
|
|
{
|
|
"entropy": 6.274266529083252,
|
|
"epoch": 1.2740911713791114,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.000484917763760918,
|
|
"loss": 5.8724,
|
|
"mean_token_accuracy": 0.17999066561460494,
|
|
"num_tokens": 27991450.0,
|
|
"step": 11040
|
|
},
|
|
{
|
|
"entropy": 6.249115896224976,
|
|
"epoch": 1.27466820542412,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00048490290672556784,
|
|
"loss": 5.9163,
|
|
"mean_token_accuracy": 0.17860014736652374,
|
|
"num_tokens": 28003696.0,
|
|
"step": 11045
|
|
},
|
|
{
|
|
"entropy": 6.121306085586548,
|
|
"epoch": 1.2752452394691287,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004848880426302378,
|
|
"loss": 5.8191,
|
|
"mean_token_accuracy": 0.1887667015194893,
|
|
"num_tokens": 28015886.0,
|
|
"step": 11050
|
|
},
|
|
{
|
|
"entropy": 6.220458936691284,
|
|
"epoch": 1.2758222735141374,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004848731714754277,
|
|
"loss": 5.87,
|
|
"mean_token_accuracy": 0.18536427319049836,
|
|
"num_tokens": 28029552.0,
|
|
"step": 11055
|
|
},
|
|
{
|
|
"entropy": 6.2172283172607425,
|
|
"epoch": 1.276399307559146,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004848582932616377,
|
|
"loss": 5.9559,
|
|
"mean_token_accuracy": 0.17716862708330156,
|
|
"num_tokens": 28042275.0,
|
|
"step": 11060
|
|
},
|
|
{
|
|
"entropy": 6.174749374389648,
|
|
"epoch": 1.2769763416041546,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004848434079893682,
|
|
"loss": 5.8283,
|
|
"mean_token_accuracy": 0.19337797313928604,
|
|
"num_tokens": 28054840.0,
|
|
"step": 11065
|
|
},
|
|
{
|
|
"entropy": 6.320803117752075,
|
|
"epoch": 1.2775533756491633,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004848285156591201,
|
|
"loss": 5.9848,
|
|
"mean_token_accuracy": 0.17735466361045837,
|
|
"num_tokens": 28068052.0,
|
|
"step": 11070
|
|
},
|
|
{
|
|
"entropy": 6.317575454711914,
|
|
"epoch": 1.278130409694172,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00048481361627139384,
|
|
"loss": 5.9607,
|
|
"mean_token_accuracy": 0.17917237877845765,
|
|
"num_tokens": 28081157.0,
|
|
"step": 11075
|
|
},
|
|
{
|
|
"entropy": 6.264458179473877,
|
|
"epoch": 1.2787074437391805,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00048479870982669096,
|
|
"loss": 5.9992,
|
|
"mean_token_accuracy": 0.17882073372602464,
|
|
"num_tokens": 28093842.0,
|
|
"step": 11080
|
|
},
|
|
{
|
|
"entropy": 6.269530010223389,
|
|
"epoch": 1.2792844777841892,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00048478379632551266,
|
|
"loss": 5.8656,
|
|
"mean_token_accuracy": 0.1861704871058464,
|
|
"num_tokens": 28107529.0,
|
|
"step": 11085
|
|
},
|
|
{
|
|
"entropy": 6.3019171237945555,
|
|
"epoch": 1.279861511829198,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004847688757683606,
|
|
"loss": 5.9586,
|
|
"mean_token_accuracy": 0.17826474457979202,
|
|
"num_tokens": 28119650.0,
|
|
"step": 11090
|
|
},
|
|
{
|
|
"entropy": 6.197647523880005,
|
|
"epoch": 1.2804385458742065,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004847539481557366,
|
|
"loss": 5.8936,
|
|
"mean_token_accuracy": 0.18941795378923415,
|
|
"num_tokens": 28131209.0,
|
|
"step": 11095
|
|
},
|
|
{
|
|
"entropy": 6.21189546585083,
|
|
"epoch": 1.2810155799192153,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00048473901348814277,
|
|
"loss": 5.9072,
|
|
"mean_token_accuracy": 0.18758580833673477,
|
|
"num_tokens": 28143624.0,
|
|
"step": 11100
|
|
},
|
|
{
|
|
"entropy": 6.333727693557739,
|
|
"epoch": 1.281592613964224,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004847240717660814,
|
|
"loss": 5.9187,
|
|
"mean_token_accuracy": 0.18257874101400376,
|
|
"num_tokens": 28156752.0,
|
|
"step": 11105
|
|
},
|
|
{
|
|
"entropy": 6.148864364624023,
|
|
"epoch": 1.2821696480092326,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.00048470912299005493,
|
|
"loss": 5.7846,
|
|
"mean_token_accuracy": 0.1917967677116394,
|
|
"num_tokens": 28169288.0,
|
|
"step": 11110
|
|
},
|
|
{
|
|
"entropy": 6.202798795700073,
|
|
"epoch": 1.2827466820542412,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00048469416716056635,
|
|
"loss": 5.8863,
|
|
"mean_token_accuracy": 0.18294143825769424,
|
|
"num_tokens": 28181739.0,
|
|
"step": 11115
|
|
},
|
|
{
|
|
"entropy": 6.241795825958252,
|
|
"epoch": 1.28332371609925,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004846792042781187,
|
|
"loss": 5.8472,
|
|
"mean_token_accuracy": 0.18725763261318207,
|
|
"num_tokens": 28193861.0,
|
|
"step": 11120
|
|
},
|
|
{
|
|
"entropy": 6.167054653167725,
|
|
"epoch": 1.2839007501442585,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00048466423434321513,
|
|
"loss": 5.799,
|
|
"mean_token_accuracy": 0.19221861511468888,
|
|
"num_tokens": 28205453.0,
|
|
"step": 11125
|
|
},
|
|
{
|
|
"entropy": 6.213259506225586,
|
|
"epoch": 1.2844777841892672,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048464925735635907,
|
|
"loss": 5.866,
|
|
"mean_token_accuracy": 0.18240144699811936,
|
|
"num_tokens": 28217554.0,
|
|
"step": 11130
|
|
},
|
|
{
|
|
"entropy": 6.326313447952271,
|
|
"epoch": 1.2850548182342758,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00048463427331805445,
|
|
"loss": 5.9837,
|
|
"mean_token_accuracy": 0.17859313935041427,
|
|
"num_tokens": 28230091.0,
|
|
"step": 11135
|
|
},
|
|
{
|
|
"entropy": 6.196951007843017,
|
|
"epoch": 1.2856318522792844,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004846192822288052,
|
|
"loss": 5.8606,
|
|
"mean_token_accuracy": 0.19161761701107025,
|
|
"num_tokens": 28243285.0,
|
|
"step": 11140
|
|
},
|
|
{
|
|
"entropy": 6.159520244598388,
|
|
"epoch": 1.286208886324293,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004846042840891155,
|
|
"loss": 5.7559,
|
|
"mean_token_accuracy": 0.19518305808305741,
|
|
"num_tokens": 28256210.0,
|
|
"step": 11145
|
|
},
|
|
{
|
|
"entropy": 6.202442598342896,
|
|
"epoch": 1.2867859203693017,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004845892788994899,
|
|
"loss": 5.8393,
|
|
"mean_token_accuracy": 0.1925252139568329,
|
|
"num_tokens": 28268291.0,
|
|
"step": 11150
|
|
},
|
|
{
|
|
"entropy": 6.127519702911377,
|
|
"epoch": 1.2873629544143104,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004845742666604329,
|
|
"loss": 5.802,
|
|
"mean_token_accuracy": 0.19252759367227554,
|
|
"num_tokens": 28281462.0,
|
|
"step": 11155
|
|
},
|
|
{
|
|
"entropy": 6.261201524734497,
|
|
"epoch": 1.287939988459319,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00048455924737244953,
|
|
"loss": 5.9527,
|
|
"mean_token_accuracy": 0.1794736549258232,
|
|
"num_tokens": 28292766.0,
|
|
"step": 11160
|
|
},
|
|
{
|
|
"entropy": 6.165164470672607,
|
|
"epoch": 1.2885170225043279,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048454422103604505,
|
|
"loss": 5.8265,
|
|
"mean_token_accuracy": 0.1932087242603302,
|
|
"num_tokens": 28304500.0,
|
|
"step": 11165
|
|
},
|
|
{
|
|
"entropy": 6.250514936447144,
|
|
"epoch": 1.2890940565493363,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004845291876517247,
|
|
"loss": 5.9187,
|
|
"mean_token_accuracy": 0.1889398217201233,
|
|
"num_tokens": 28317262.0,
|
|
"step": 11170
|
|
},
|
|
{
|
|
"entropy": 6.167955780029297,
|
|
"epoch": 1.2896710905943451,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00048451414721999424,
|
|
"loss": 5.79,
|
|
"mean_token_accuracy": 0.1927010953426361,
|
|
"num_tokens": 28330313.0,
|
|
"step": 11175
|
|
},
|
|
{
|
|
"entropy": 6.192044591903686,
|
|
"epoch": 1.2902481246393538,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00048449909974135954,
|
|
"loss": 5.8116,
|
|
"mean_token_accuracy": 0.18487345725297927,
|
|
"num_tokens": 28344058.0,
|
|
"step": 11180
|
|
},
|
|
{
|
|
"entropy": 6.202538776397705,
|
|
"epoch": 1.2908251586843624,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004844840452163267,
|
|
"loss": 5.8816,
|
|
"mean_token_accuracy": 0.18409787267446517,
|
|
"num_tokens": 28356664.0,
|
|
"step": 11185
|
|
},
|
|
{
|
|
"entropy": 6.264059352874756,
|
|
"epoch": 1.291402192729371,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.000484468983645402,
|
|
"loss": 5.9159,
|
|
"mean_token_accuracy": 0.1831672191619873,
|
|
"num_tokens": 28369040.0,
|
|
"step": 11190
|
|
},
|
|
{
|
|
"entropy": 6.198862314224243,
|
|
"epoch": 1.2919792267743797,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00048445391502909213,
|
|
"loss": 5.8845,
|
|
"mean_token_accuracy": 0.17770082056522368,
|
|
"num_tokens": 28381788.0,
|
|
"step": 11195
|
|
},
|
|
{
|
|
"entropy": 6.235758447647095,
|
|
"epoch": 1.2925562608193883,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00048443883936790386,
|
|
"loss": 5.9364,
|
|
"mean_token_accuracy": 0.18272285610437394,
|
|
"num_tokens": 28394531.0,
|
|
"step": 11200
|
|
},
|
|
{
|
|
"entropy": 6.215797090530396,
|
|
"epoch": 1.293133294864397,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00048442375666234427,
|
|
"loss": 5.8094,
|
|
"mean_token_accuracy": 0.18736853450536728,
|
|
"num_tokens": 28407766.0,
|
|
"step": 11205
|
|
},
|
|
{
|
|
"entropy": 6.2450777053833,
|
|
"epoch": 1.2937103289094056,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004844086669129206,
|
|
"loss": 5.9169,
|
|
"mean_token_accuracy": 0.18248326927423478,
|
|
"num_tokens": 28420185.0,
|
|
"step": 11210
|
|
},
|
|
{
|
|
"entropy": 6.302453470230103,
|
|
"epoch": 1.2942873629544143,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00048439357012014045,
|
|
"loss": 5.875,
|
|
"mean_token_accuracy": 0.1817401424050331,
|
|
"num_tokens": 28432781.0,
|
|
"step": 11215
|
|
},
|
|
{
|
|
"entropy": 6.239097166061401,
|
|
"epoch": 1.294864396999423,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004843784662845116,
|
|
"loss": 5.8712,
|
|
"mean_token_accuracy": 0.18863223046064376,
|
|
"num_tokens": 28446181.0,
|
|
"step": 11220
|
|
},
|
|
{
|
|
"entropy": 6.22045316696167,
|
|
"epoch": 1.2954414310444315,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000484363355406542,
|
|
"loss": 5.7876,
|
|
"mean_token_accuracy": 0.1905339851975441,
|
|
"num_tokens": 28457959.0,
|
|
"step": 11225
|
|
},
|
|
{
|
|
"entropy": 6.223681545257568,
|
|
"epoch": 1.2960184650894404,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00048434823748674,
|
|
"loss": 5.9161,
|
|
"mean_token_accuracy": 0.18176539540290831,
|
|
"num_tokens": 28470656.0,
|
|
"step": 11230
|
|
},
|
|
{
|
|
"entropy": 6.253976678848266,
|
|
"epoch": 1.2965954991344488,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.00048433311252561403,
|
|
"loss": 5.9463,
|
|
"mean_token_accuracy": 0.18163900822401047,
|
|
"num_tokens": 28483359.0,
|
|
"step": 11235
|
|
},
|
|
{
|
|
"entropy": 6.231476640701294,
|
|
"epoch": 1.2971725331794577,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004843179805236728,
|
|
"loss": 5.8509,
|
|
"mean_token_accuracy": 0.1812107414007187,
|
|
"num_tokens": 28495984.0,
|
|
"step": 11240
|
|
},
|
|
{
|
|
"entropy": 6.214840412139893,
|
|
"epoch": 1.297749567224466,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00048430284148142516,
|
|
"loss": 5.9283,
|
|
"mean_token_accuracy": 0.18338681906461715,
|
|
"num_tokens": 28508629.0,
|
|
"step": 11245
|
|
},
|
|
{
|
|
"entropy": 6.251529169082642,
|
|
"epoch": 1.298326601269475,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004842876953993805,
|
|
"loss": 5.9368,
|
|
"mean_token_accuracy": 0.1814151406288147,
|
|
"num_tokens": 28521952.0,
|
|
"step": 11250
|
|
},
|
|
{
|
|
"entropy": 6.235261106491089,
|
|
"epoch": 1.2989036353144836,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004842725422780482,
|
|
"loss": 5.8472,
|
|
"mean_token_accuracy": 0.1838516652584076,
|
|
"num_tokens": 28535210.0,
|
|
"step": 11255
|
|
},
|
|
{
|
|
"entropy": 6.2960120677948,
|
|
"epoch": 1.2994806693594922,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004842573821179378,
|
|
"loss": 5.9481,
|
|
"mean_token_accuracy": 0.17584086060523987,
|
|
"num_tokens": 28547294.0,
|
|
"step": 11260
|
|
},
|
|
{
|
|
"entropy": 6.314822959899902,
|
|
"epoch": 1.3000577034045009,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004842422149195593,
|
|
"loss": 5.9818,
|
|
"mean_token_accuracy": 0.1747643157839775,
|
|
"num_tokens": 28558934.0,
|
|
"step": 11265
|
|
},
|
|
{
|
|
"entropy": 6.228778266906739,
|
|
"epoch": 1.3006347374495095,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00048422704068342294,
|
|
"loss": 5.8457,
|
|
"mean_token_accuracy": 0.18052484542131425,
|
|
"num_tokens": 28571897.0,
|
|
"step": 11270
|
|
},
|
|
{
|
|
"entropy": 6.207079267501831,
|
|
"epoch": 1.3012117714945182,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004842118594100389,
|
|
"loss": 5.8526,
|
|
"mean_token_accuracy": 0.18636152595281602,
|
|
"num_tokens": 28584320.0,
|
|
"step": 11275
|
|
},
|
|
{
|
|
"entropy": 6.174588394165039,
|
|
"epoch": 1.3017888055395268,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00048419667109991793,
|
|
"loss": 5.8066,
|
|
"mean_token_accuracy": 0.1909553661942482,
|
|
"num_tokens": 28597018.0,
|
|
"step": 11280
|
|
},
|
|
{
|
|
"entropy": 6.1673197746276855,
|
|
"epoch": 1.3023658395845354,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00048418147575357085,
|
|
"loss": 5.82,
|
|
"mean_token_accuracy": 0.1927016168832779,
|
|
"num_tokens": 28609145.0,
|
|
"step": 11285
|
|
},
|
|
{
|
|
"entropy": 6.213823366165161,
|
|
"epoch": 1.302942873629544,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004841662733715087,
|
|
"loss": 5.8258,
|
|
"mean_token_accuracy": 0.18956251591444015,
|
|
"num_tokens": 28622208.0,
|
|
"step": 11290
|
|
},
|
|
{
|
|
"entropy": 6.168881797790528,
|
|
"epoch": 1.3035199076745527,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00048415106395424294,
|
|
"loss": 5.8299,
|
|
"mean_token_accuracy": 0.18110065758228303,
|
|
"num_tokens": 28634719.0,
|
|
"step": 11295
|
|
},
|
|
{
|
|
"entropy": 6.242797899246216,
|
|
"epoch": 1.3040969417195614,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00048413584750228494,
|
|
"loss": 5.9193,
|
|
"mean_token_accuracy": 0.18366942554712296,
|
|
"num_tokens": 28647138.0,
|
|
"step": 11300
|
|
},
|
|
{
|
|
"entropy": 6.160969686508179,
|
|
"epoch": 1.3046739757645702,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00048412062401614653,
|
|
"loss": 5.8142,
|
|
"mean_token_accuracy": 0.19241383224725722,
|
|
"num_tokens": 28660898.0,
|
|
"step": 11305
|
|
},
|
|
{
|
|
"entropy": 6.281964683532715,
|
|
"epoch": 1.3052510098095786,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00048410539349634,
|
|
"loss": 5.9567,
|
|
"mean_token_accuracy": 0.18592915683984756,
|
|
"num_tokens": 28672898.0,
|
|
"step": 11310
|
|
},
|
|
{
|
|
"entropy": 6.223157262802124,
|
|
"epoch": 1.3058280438545875,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00048409015594337725,
|
|
"loss": 5.9526,
|
|
"mean_token_accuracy": 0.1888653665781021,
|
|
"num_tokens": 28684608.0,
|
|
"step": 11315
|
|
},
|
|
{
|
|
"entropy": 6.212820672988892,
|
|
"epoch": 1.3064050778995961,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.000484074911357771,
|
|
"loss": 5.8609,
|
|
"mean_token_accuracy": 0.18949985653162002,
|
|
"num_tokens": 28696867.0,
|
|
"step": 11320
|
|
},
|
|
{
|
|
"entropy": 6.2286797046661375,
|
|
"epoch": 1.3069821119446048,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00048405965974003404,
|
|
"loss": 5.9359,
|
|
"mean_token_accuracy": 0.17696356326341628,
|
|
"num_tokens": 28709533.0,
|
|
"step": 11325
|
|
},
|
|
{
|
|
"entropy": 6.2534784317016605,
|
|
"epoch": 1.3075591459896134,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00048404440109067927,
|
|
"loss": 5.8694,
|
|
"mean_token_accuracy": 0.17698248773813247,
|
|
"num_tokens": 28721647.0,
|
|
"step": 11330
|
|
},
|
|
{
|
|
"entropy": 6.255917501449585,
|
|
"epoch": 1.308136180034622,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004840291354102198,
|
|
"loss": 5.8925,
|
|
"mean_token_accuracy": 0.18085959553718567,
|
|
"num_tokens": 28735261.0,
|
|
"step": 11335
|
|
},
|
|
{
|
|
"entropy": 6.202675867080688,
|
|
"epoch": 1.3087132140796307,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004840138626991693,
|
|
"loss": 5.9353,
|
|
"mean_token_accuracy": 0.18194161504507064,
|
|
"num_tokens": 28747930.0,
|
|
"step": 11340
|
|
},
|
|
{
|
|
"entropy": 6.258759212493897,
|
|
"epoch": 1.3092902481246393,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004839985829580413,
|
|
"loss": 5.9106,
|
|
"mean_token_accuracy": 0.18136637806892394,
|
|
"num_tokens": 28760497.0,
|
|
"step": 11345
|
|
},
|
|
{
|
|
"entropy": 6.320033216476441,
|
|
"epoch": 1.309867282169648,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00048398329618734977,
|
|
"loss": 5.9464,
|
|
"mean_token_accuracy": 0.17641042470932006,
|
|
"num_tokens": 28772787.0,
|
|
"step": 11350
|
|
},
|
|
{
|
|
"entropy": 6.200205707550049,
|
|
"epoch": 1.3104443162146566,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004839680023876089,
|
|
"loss": 5.8531,
|
|
"mean_token_accuracy": 0.18295872509479522,
|
|
"num_tokens": 28784901.0,
|
|
"step": 11355
|
|
},
|
|
{
|
|
"entropy": 6.262151050567627,
|
|
"epoch": 1.3110213502596653,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004839527015593331,
|
|
"loss": 5.9302,
|
|
"mean_token_accuracy": 0.178282168507576,
|
|
"num_tokens": 28797376.0,
|
|
"step": 11360
|
|
},
|
|
{
|
|
"entropy": 6.249820327758789,
|
|
"epoch": 1.311598384304674,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00048393739370303684,
|
|
"loss": 5.8711,
|
|
"mean_token_accuracy": 0.1843525782227516,
|
|
"num_tokens": 28808805.0,
|
|
"step": 11365
|
|
},
|
|
{
|
|
"entropy": 6.219827556610108,
|
|
"epoch": 1.3121754183496828,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004839220788192353,
|
|
"loss": 5.9671,
|
|
"mean_token_accuracy": 0.17647455185651778,
|
|
"num_tokens": 28821734.0,
|
|
"step": 11370
|
|
},
|
|
{
|
|
"entropy": 6.2617974281311035,
|
|
"epoch": 1.3127524523946912,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00048390675690844335,
|
|
"loss": 5.8399,
|
|
"mean_token_accuracy": 0.1810166746377945,
|
|
"num_tokens": 28834864.0,
|
|
"step": 11375
|
|
},
|
|
{
|
|
"entropy": 6.158445119857788,
|
|
"epoch": 1.3133294864397,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004838914279711764,
|
|
"loss": 5.8065,
|
|
"mean_token_accuracy": 0.18591468781232834,
|
|
"num_tokens": 28848154.0,
|
|
"step": 11380
|
|
},
|
|
{
|
|
"entropy": 6.175825357437134,
|
|
"epoch": 1.3139065204847085,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.00048387609200795003,
|
|
"loss": 5.8917,
|
|
"mean_token_accuracy": 0.18650826215744018,
|
|
"num_tokens": 28861562.0,
|
|
"step": 11385
|
|
},
|
|
{
|
|
"entropy": 6.272245788574219,
|
|
"epoch": 1.3144835545297173,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00048386074901928,
|
|
"loss": 5.8496,
|
|
"mean_token_accuracy": 0.18694826662540437,
|
|
"num_tokens": 28873921.0,
|
|
"step": 11390
|
|
},
|
|
{
|
|
"entropy": 6.255329275131226,
|
|
"epoch": 1.315060588574726,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004838453990056825,
|
|
"loss": 5.9349,
|
|
"mean_token_accuracy": 0.1798590064048767,
|
|
"num_tokens": 28886126.0,
|
|
"step": 11395
|
|
},
|
|
{
|
|
"entropy": 6.220553064346314,
|
|
"epoch": 1.3156376226197346,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048383004196767373,
|
|
"loss": 5.8019,
|
|
"mean_token_accuracy": 0.1911833941936493,
|
|
"num_tokens": 28897980.0,
|
|
"step": 11400
|
|
},
|
|
{
|
|
"entropy": 6.265301656723023,
|
|
"epoch": 1.3162146566647432,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004838146779057702,
|
|
"loss": 5.8514,
|
|
"mean_token_accuracy": 0.18370553553104402,
|
|
"num_tokens": 28910105.0,
|
|
"step": 11405
|
|
},
|
|
{
|
|
"entropy": 6.238138055801391,
|
|
"epoch": 1.3167916907097519,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004837993068204887,
|
|
"loss": 5.9089,
|
|
"mean_token_accuracy": 0.18176488429307938,
|
|
"num_tokens": 28922004.0,
|
|
"step": 11410
|
|
},
|
|
{
|
|
"entropy": 6.176228141784668,
|
|
"epoch": 1.3173687247547605,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.00048378392871234634,
|
|
"loss": 5.767,
|
|
"mean_token_accuracy": 0.19638804495334625,
|
|
"num_tokens": 28935990.0,
|
|
"step": 11415
|
|
},
|
|
{
|
|
"entropy": 6.256175231933594,
|
|
"epoch": 1.3179457587997692,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004837685435818601,
|
|
"loss": 5.8387,
|
|
"mean_token_accuracy": 0.1891574367880821,
|
|
"num_tokens": 28948274.0,
|
|
"step": 11420
|
|
},
|
|
{
|
|
"entropy": 6.233545589447021,
|
|
"epoch": 1.3185227928447778,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004837531514295477,
|
|
"loss": 5.9423,
|
|
"mean_token_accuracy": 0.17450683414936066,
|
|
"num_tokens": 28960101.0,
|
|
"step": 11425
|
|
},
|
|
{
|
|
"entropy": 6.260594320297241,
|
|
"epoch": 1.3190998268897864,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004837377522559267,
|
|
"loss": 5.9553,
|
|
"mean_token_accuracy": 0.18921227008104324,
|
|
"num_tokens": 28972408.0,
|
|
"step": 11430
|
|
},
|
|
{
|
|
"entropy": 6.249463510513306,
|
|
"epoch": 1.319676860934795,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.00048372234606151507,
|
|
"loss": 5.8905,
|
|
"mean_token_accuracy": 0.18161126375198364,
|
|
"num_tokens": 28985025.0,
|
|
"step": 11435
|
|
},
|
|
{
|
|
"entropy": 6.256546449661255,
|
|
"epoch": 1.3202538949798037,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00048370693284683106,
|
|
"loss": 5.9632,
|
|
"mean_token_accuracy": 0.18379874676465988,
|
|
"num_tokens": 28997568.0,
|
|
"step": 11440
|
|
},
|
|
{
|
|
"entropy": 6.281197547912598,
|
|
"epoch": 1.3208309290248126,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00048369151261239303,
|
|
"loss": 5.973,
|
|
"mean_token_accuracy": 0.17523153275251388,
|
|
"num_tokens": 29009567.0,
|
|
"step": 11445
|
|
},
|
|
{
|
|
"entropy": 6.239495086669922,
|
|
"epoch": 1.321407963069821,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004836760853587196,
|
|
"loss": 5.8738,
|
|
"mean_token_accuracy": 0.17971327304840087,
|
|
"num_tokens": 29021403.0,
|
|
"step": 11450
|
|
},
|
|
{
|
|
"entropy": 6.231962966918945,
|
|
"epoch": 1.3219849971148299,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00048366065108632967,
|
|
"loss": 5.8515,
|
|
"mean_token_accuracy": 0.1861049070954323,
|
|
"num_tokens": 29033430.0,
|
|
"step": 11455
|
|
},
|
|
{
|
|
"entropy": 6.187495756149292,
|
|
"epoch": 1.3225620311598385,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00048364520979574246,
|
|
"loss": 5.8723,
|
|
"mean_token_accuracy": 0.18128441423177719,
|
|
"num_tokens": 29045659.0,
|
|
"step": 11460
|
|
},
|
|
{
|
|
"entropy": 6.204320430755615,
|
|
"epoch": 1.3231390652048471,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00048362976148747715,
|
|
"loss": 5.8202,
|
|
"mean_token_accuracy": 0.1851746380329132,
|
|
"num_tokens": 29058962.0,
|
|
"step": 11465
|
|
},
|
|
{
|
|
"entropy": 6.236425065994263,
|
|
"epoch": 1.3237160992498558,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004836143061620536,
|
|
"loss": 5.7613,
|
|
"mean_token_accuracy": 0.1951758399605751,
|
|
"num_tokens": 29072009.0,
|
|
"step": 11470
|
|
},
|
|
{
|
|
"entropy": 6.150970411300659,
|
|
"epoch": 1.3242931332948644,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004835988438199914,
|
|
"loss": 5.7753,
|
|
"mean_token_accuracy": 0.19481099843978883,
|
|
"num_tokens": 29084174.0,
|
|
"step": 11475
|
|
},
|
|
{
|
|
"entropy": 6.225009822845459,
|
|
"epoch": 1.324870167339873,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004835833744618107,
|
|
"loss": 5.8656,
|
|
"mean_token_accuracy": 0.185127791762352,
|
|
"num_tokens": 29096189.0,
|
|
"step": 11480
|
|
},
|
|
{
|
|
"entropy": 6.202565431594849,
|
|
"epoch": 1.3254472013848817,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004835678980880318,
|
|
"loss": 5.8374,
|
|
"mean_token_accuracy": 0.18455548584461212,
|
|
"num_tokens": 29108212.0,
|
|
"step": 11485
|
|
},
|
|
{
|
|
"entropy": 6.263130712509155,
|
|
"epoch": 1.3260242354298903,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004835524146991753,
|
|
"loss": 5.8032,
|
|
"mean_token_accuracy": 0.19258994311094285,
|
|
"num_tokens": 29121058.0,
|
|
"step": 11490
|
|
},
|
|
{
|
|
"entropy": 6.197894430160522,
|
|
"epoch": 1.326601269474899,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00048353692429576185,
|
|
"loss": 5.9338,
|
|
"mean_token_accuracy": 0.1838608577847481,
|
|
"num_tokens": 29132981.0,
|
|
"step": 11495
|
|
},
|
|
{
|
|
"entropy": 6.250746345520019,
|
|
"epoch": 1.3271783035199076,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004835214268783126,
|
|
"loss": 5.8847,
|
|
"mean_token_accuracy": 0.18033799827098845,
|
|
"num_tokens": 29145143.0,
|
|
"step": 11500
|
|
},
|
|
{
|
|
"entropy": 6.2464357852935795,
|
|
"epoch": 1.3277553375649163,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00048350592244734866,
|
|
"loss": 5.8415,
|
|
"mean_token_accuracy": 0.18740762770175934,
|
|
"num_tokens": 29157548.0,
|
|
"step": 11505
|
|
},
|
|
{
|
|
"entropy": 6.139885425567627,
|
|
"epoch": 1.3283323716099251,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004834904110033917,
|
|
"loss": 5.7547,
|
|
"mean_token_accuracy": 0.195901720225811,
|
|
"num_tokens": 29170243.0,
|
|
"step": 11510
|
|
},
|
|
{
|
|
"entropy": 6.218726301193238,
|
|
"epoch": 1.3289094056549335,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00048347489254696327,
|
|
"loss": 5.8636,
|
|
"mean_token_accuracy": 0.18377334475517274,
|
|
"num_tokens": 29181769.0,
|
|
"step": 11515
|
|
},
|
|
{
|
|
"entropy": 6.258484029769898,
|
|
"epoch": 1.3294864396999424,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004834593670785854,
|
|
"loss": 5.9648,
|
|
"mean_token_accuracy": 0.17879902422428132,
|
|
"num_tokens": 29194196.0,
|
|
"step": 11520
|
|
},
|
|
{
|
|
"entropy": 6.22721004486084,
|
|
"epoch": 1.3300634737449508,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00048344383459878024,
|
|
"loss": 5.8595,
|
|
"mean_token_accuracy": 0.18442352563142778,
|
|
"num_tokens": 29206101.0,
|
|
"step": 11525
|
|
},
|
|
{
|
|
"entropy": 6.183701848983764,
|
|
"epoch": 1.3306405077899597,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00048342829510807024,
|
|
"loss": 5.836,
|
|
"mean_token_accuracy": 0.18734344989061355,
|
|
"num_tokens": 29217851.0,
|
|
"step": 11530
|
|
},
|
|
{
|
|
"entropy": 6.154987382888794,
|
|
"epoch": 1.3312175418349683,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.000483412748606978,
|
|
"loss": 5.8028,
|
|
"mean_token_accuracy": 0.19526472836732864,
|
|
"num_tokens": 29231497.0,
|
|
"step": 11535
|
|
},
|
|
{
|
|
"entropy": 6.315514087677002,
|
|
"epoch": 1.331794575879977,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004833971950960266,
|
|
"loss": 5.9461,
|
|
"mean_token_accuracy": 0.18248422145843507,
|
|
"num_tokens": 29245227.0,
|
|
"step": 11540
|
|
},
|
|
{
|
|
"entropy": 6.224634885787964,
|
|
"epoch": 1.3323716099249856,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004833816345757391,
|
|
"loss": 5.8547,
|
|
"mean_token_accuracy": 0.1854404926300049,
|
|
"num_tokens": 29259403.0,
|
|
"step": 11545
|
|
},
|
|
{
|
|
"entropy": 6.249810361862183,
|
|
"epoch": 1.3329486439699942,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004833660670466387,
|
|
"loss": 5.8565,
|
|
"mean_token_accuracy": 0.18590396046638488,
|
|
"num_tokens": 29270938.0,
|
|
"step": 11550
|
|
},
|
|
{
|
|
"entropy": 6.258982610702515,
|
|
"epoch": 1.3335256780150029,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004833504925092492,
|
|
"loss": 5.8566,
|
|
"mean_token_accuracy": 0.19000206291675567,
|
|
"num_tokens": 29284078.0,
|
|
"step": 11555
|
|
},
|
|
{
|
|
"entropy": 6.223692846298218,
|
|
"epoch": 1.3341027120600115,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004833349109640944,
|
|
"loss": 5.8385,
|
|
"mean_token_accuracy": 0.1834432601928711,
|
|
"num_tokens": 29295698.0,
|
|
"step": 11560
|
|
},
|
|
{
|
|
"entropy": 6.235724020004272,
|
|
"epoch": 1.3346797461050202,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004833193224116983,
|
|
"loss": 5.8652,
|
|
"mean_token_accuracy": 0.1862700179219246,
|
|
"num_tokens": 29307585.0,
|
|
"step": 11565
|
|
},
|
|
{
|
|
"entropy": 6.237357521057129,
|
|
"epoch": 1.3352567801500288,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048330372685258526,
|
|
"loss": 5.8703,
|
|
"mean_token_accuracy": 0.18552322387695314,
|
|
"num_tokens": 29321027.0,
|
|
"step": 11570
|
|
},
|
|
{
|
|
"entropy": 6.273429441452026,
|
|
"epoch": 1.3358338141950374,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004832881242872799,
|
|
"loss": 5.9237,
|
|
"mean_token_accuracy": 0.1840517833828926,
|
|
"num_tokens": 29333121.0,
|
|
"step": 11575
|
|
},
|
|
{
|
|
"entropy": 6.21780743598938,
|
|
"epoch": 1.336410848240046,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004832725147163069,
|
|
"loss": 5.894,
|
|
"mean_token_accuracy": 0.1825244978070259,
|
|
"num_tokens": 29346120.0,
|
|
"step": 11580
|
|
},
|
|
{
|
|
"entropy": 6.25745325088501,
|
|
"epoch": 1.336987882285055,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00048325689814019134,
|
|
"loss": 5.8643,
|
|
"mean_token_accuracy": 0.18377418518066407,
|
|
"num_tokens": 29357872.0,
|
|
"step": 11585
|
|
},
|
|
{
|
|
"entropy": 6.281948804855347,
|
|
"epoch": 1.3375649163300634,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004832412745594585,
|
|
"loss": 5.9228,
|
|
"mean_token_accuracy": 0.18576952517032624,
|
|
"num_tokens": 29370657.0,
|
|
"step": 11590
|
|
},
|
|
{
|
|
"entropy": 6.170208215713501,
|
|
"epoch": 1.3381419503750722,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00048322564397463376,
|
|
"loss": 5.8472,
|
|
"mean_token_accuracy": 0.19092058688402175,
|
|
"num_tokens": 29384880.0,
|
|
"step": 11595
|
|
},
|
|
{
|
|
"entropy": 6.258925104141236,
|
|
"epoch": 1.3387189844200809,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00048321000638624296,
|
|
"loss": 5.8543,
|
|
"mean_token_accuracy": 0.18395190089941024,
|
|
"num_tokens": 29397215.0,
|
|
"step": 11600
|
|
},
|
|
{
|
|
"entropy": 6.2219925880432125,
|
|
"epoch": 1.3392960184650895,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000483194361794812,
|
|
"loss": 5.8089,
|
|
"mean_token_accuracy": 0.19121019542217255,
|
|
"num_tokens": 29409634.0,
|
|
"step": 11605
|
|
},
|
|
{
|
|
"entropy": 6.226755666732788,
|
|
"epoch": 1.3398730525100981,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.000483178710200867,
|
|
"loss": 5.7865,
|
|
"mean_token_accuracy": 0.19461841881275177,
|
|
"num_tokens": 29422404.0,
|
|
"step": 11610
|
|
},
|
|
{
|
|
"entropy": 6.2323966979980465,
|
|
"epoch": 1.3404500865551068,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004831630516049346,
|
|
"loss": 5.9668,
|
|
"mean_token_accuracy": 0.18530030250549318,
|
|
"num_tokens": 29434727.0,
|
|
"step": 11615
|
|
},
|
|
{
|
|
"entropy": 6.253775358200073,
|
|
"epoch": 1.3410271206001154,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004831473860075414,
|
|
"loss": 5.8695,
|
|
"mean_token_accuracy": 0.18326867818832399,
|
|
"num_tokens": 29447176.0,
|
|
"step": 11620
|
|
},
|
|
{
|
|
"entropy": 6.214875221252441,
|
|
"epoch": 1.341604154645124,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00048313171340921417,
|
|
"loss": 5.8307,
|
|
"mean_token_accuracy": 0.1961693212389946,
|
|
"num_tokens": 29460080.0,
|
|
"step": 11625
|
|
},
|
|
{
|
|
"entropy": 6.183676052093506,
|
|
"epoch": 1.3421811886901327,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00048311603381048025,
|
|
"loss": 5.8363,
|
|
"mean_token_accuracy": 0.19140980392694473,
|
|
"num_tokens": 29472503.0,
|
|
"step": 11630
|
|
},
|
|
{
|
|
"entropy": 6.234938287734986,
|
|
"epoch": 1.3427582227351413,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004831003472118668,
|
|
"loss": 5.8351,
|
|
"mean_token_accuracy": 0.18842962384223938,
|
|
"num_tokens": 29485139.0,
|
|
"step": 11635
|
|
},
|
|
{
|
|
"entropy": 6.310397815704346,
|
|
"epoch": 1.34333525678015,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004830846536139016,
|
|
"loss": 5.9381,
|
|
"mean_token_accuracy": 0.18417907506227493,
|
|
"num_tokens": 29497455.0,
|
|
"step": 11640
|
|
},
|
|
{
|
|
"entropy": 6.260405540466309,
|
|
"epoch": 1.3439122908251586,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004830689530171124,
|
|
"loss": 5.8747,
|
|
"mean_token_accuracy": 0.1892422318458557,
|
|
"num_tokens": 29509859.0,
|
|
"step": 11645
|
|
},
|
|
{
|
|
"entropy": 6.264926242828369,
|
|
"epoch": 1.3444893248701673,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004830532454220273,
|
|
"loss": 5.9185,
|
|
"mean_token_accuracy": 0.18690085262060166,
|
|
"num_tokens": 29523117.0,
|
|
"step": 11650
|
|
},
|
|
{
|
|
"entropy": 6.162897396087646,
|
|
"epoch": 1.345066358915176,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.00048303753082917474,
|
|
"loss": 5.8265,
|
|
"mean_token_accuracy": 0.19078432023525238,
|
|
"num_tokens": 29535943.0,
|
|
"step": 11655
|
|
},
|
|
{
|
|
"entropy": 6.277468681335449,
|
|
"epoch": 1.3456433929601848,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048302180923908306,
|
|
"loss": 5.9204,
|
|
"mean_token_accuracy": 0.18410737067461014,
|
|
"num_tokens": 29549036.0,
|
|
"step": 11660
|
|
},
|
|
{
|
|
"entropy": 6.163658857345581,
|
|
"epoch": 1.3462204270051932,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00048300608065228126,
|
|
"loss": 5.8297,
|
|
"mean_token_accuracy": 0.1890963688492775,
|
|
"num_tokens": 29563465.0,
|
|
"step": 11665
|
|
},
|
|
{
|
|
"entropy": 6.210170888900757,
|
|
"epoch": 1.346797461050202,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048299034506929815,
|
|
"loss": 5.7719,
|
|
"mean_token_accuracy": 0.19281139075756074,
|
|
"num_tokens": 29575891.0,
|
|
"step": 11670
|
|
},
|
|
{
|
|
"entropy": 6.244243478775024,
|
|
"epoch": 1.3473744950952107,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048297460249066315,
|
|
"loss": 5.9787,
|
|
"mean_token_accuracy": 0.17319456934928895,
|
|
"num_tokens": 29589162.0,
|
|
"step": 11675
|
|
},
|
|
{
|
|
"entropy": 6.291163921356201,
|
|
"epoch": 1.3479515291402193,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004829588529169057,
|
|
"loss": 5.8233,
|
|
"mean_token_accuracy": 0.1888448789715767,
|
|
"num_tokens": 29602735.0,
|
|
"step": 11680
|
|
},
|
|
{
|
|
"entropy": 6.167922639846802,
|
|
"epoch": 1.348528563185228,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004829430963485555,
|
|
"loss": 5.7813,
|
|
"mean_token_accuracy": 0.19492802619934083,
|
|
"num_tokens": 29615683.0,
|
|
"step": 11685
|
|
},
|
|
{
|
|
"entropy": 6.25222225189209,
|
|
"epoch": 1.3491055972302366,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004829273327861426,
|
|
"loss": 5.8556,
|
|
"mean_token_accuracy": 0.18927911818027496,
|
|
"num_tokens": 29629606.0,
|
|
"step": 11690
|
|
},
|
|
{
|
|
"entropy": 6.201506853103638,
|
|
"epoch": 1.3496826312752452,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004829115622301971,
|
|
"loss": 5.838,
|
|
"mean_token_accuracy": 0.19121850728988649,
|
|
"num_tokens": 29642250.0,
|
|
"step": 11695
|
|
},
|
|
{
|
|
"entropy": 6.28028507232666,
|
|
"epoch": 1.3502596653202539,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.00048289578468124956,
|
|
"loss": 5.9316,
|
|
"mean_token_accuracy": 0.1848507806658745,
|
|
"num_tokens": 29655689.0,
|
|
"step": 11700
|
|
},
|
|
{
|
|
"entropy": 6.116147565841675,
|
|
"epoch": 1.3508366993652625,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00048288000013983046,
|
|
"loss": 5.8409,
|
|
"mean_token_accuracy": 0.182951357960701,
|
|
"num_tokens": 29670084.0,
|
|
"step": 11705
|
|
},
|
|
{
|
|
"entropy": 6.25054349899292,
|
|
"epoch": 1.3514137334102712,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00048286420860647086,
|
|
"loss": 5.8952,
|
|
"mean_token_accuracy": 0.19066344499588012,
|
|
"num_tokens": 29683453.0,
|
|
"step": 11710
|
|
},
|
|
{
|
|
"entropy": 6.269110584259034,
|
|
"epoch": 1.3519907674552798,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00048284841008170185,
|
|
"loss": 5.8098,
|
|
"mean_token_accuracy": 0.18684105575084686,
|
|
"num_tokens": 29695514.0,
|
|
"step": 11715
|
|
},
|
|
{
|
|
"entropy": 6.265933084487915,
|
|
"epoch": 1.3525678015002884,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.00048283260456605487,
|
|
"loss": 5.8765,
|
|
"mean_token_accuracy": 0.18586160689592363,
|
|
"num_tokens": 29708544.0,
|
|
"step": 11720
|
|
},
|
|
{
|
|
"entropy": 6.3004742622375485,
|
|
"epoch": 1.3531448355452973,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004828167920600614,
|
|
"loss": 5.8174,
|
|
"mean_token_accuracy": 0.18437671512365342,
|
|
"num_tokens": 29721310.0,
|
|
"step": 11725
|
|
},
|
|
{
|
|
"entropy": 6.225083684921264,
|
|
"epoch": 1.3537218695903057,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004828009725642534,
|
|
"loss": 5.8666,
|
|
"mean_token_accuracy": 0.18544016480445863,
|
|
"num_tokens": 29733995.0,
|
|
"step": 11730
|
|
},
|
|
{
|
|
"entropy": 6.239916563034058,
|
|
"epoch": 1.3542989036353146,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004827851460791628,
|
|
"loss": 5.9539,
|
|
"mean_token_accuracy": 0.17822468280792236,
|
|
"num_tokens": 29745896.0,
|
|
"step": 11735
|
|
},
|
|
{
|
|
"entropy": 6.290875339508057,
|
|
"epoch": 1.3548759376803232,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00048276931260532213,
|
|
"loss": 5.8275,
|
|
"mean_token_accuracy": 0.18893493413925172,
|
|
"num_tokens": 29758967.0,
|
|
"step": 11740
|
|
},
|
|
{
|
|
"entropy": 6.263391494750977,
|
|
"epoch": 1.3554529717253319,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004827534721432639,
|
|
"loss": 5.8954,
|
|
"mean_token_accuracy": 0.17974050343036652,
|
|
"num_tokens": 29772167.0,
|
|
"step": 11745
|
|
},
|
|
{
|
|
"entropy": 6.1805259704589846,
|
|
"epoch": 1.3560300057703405,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004827376246935207,
|
|
"loss": 5.825,
|
|
"mean_token_accuracy": 0.18858230412006377,
|
|
"num_tokens": 29783841.0,
|
|
"step": 11750
|
|
},
|
|
{
|
|
"entropy": 6.261368370056152,
|
|
"epoch": 1.3566070398153491,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004827217702566257,
|
|
"loss": 5.9518,
|
|
"mean_token_accuracy": 0.18142978847026825,
|
|
"num_tokens": 29795993.0,
|
|
"step": 11755
|
|
},
|
|
{
|
|
"entropy": 6.229633855819702,
|
|
"epoch": 1.3571840738603578,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00048270590883311217,
|
|
"loss": 5.8547,
|
|
"mean_token_accuracy": 0.19509654194116594,
|
|
"num_tokens": 29807692.0,
|
|
"step": 11760
|
|
},
|
|
{
|
|
"entropy": 6.246022510528564,
|
|
"epoch": 1.3577611079053664,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00048269004042351363,
|
|
"loss": 5.9361,
|
|
"mean_token_accuracy": 0.18227415829896926,
|
|
"num_tokens": 29820778.0,
|
|
"step": 11765
|
|
},
|
|
{
|
|
"entropy": 6.227572441101074,
|
|
"epoch": 1.358338141950375,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004826741650283637,
|
|
"loss": 5.8178,
|
|
"mean_token_accuracy": 0.18706079721450805,
|
|
"num_tokens": 29833976.0,
|
|
"step": 11770
|
|
},
|
|
{
|
|
"entropy": 6.193403339385986,
|
|
"epoch": 1.3589151759953837,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004826582826481963,
|
|
"loss": 5.8272,
|
|
"mean_token_accuracy": 0.1925640806555748,
|
|
"num_tokens": 29846226.0,
|
|
"step": 11775
|
|
},
|
|
{
|
|
"entropy": 6.178399324417114,
|
|
"epoch": 1.3594922100403923,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004826423932835458,
|
|
"loss": 5.8157,
|
|
"mean_token_accuracy": 0.19034133553504945,
|
|
"num_tokens": 29858483.0,
|
|
"step": 11780
|
|
},
|
|
{
|
|
"entropy": 6.2385763168334964,
|
|
"epoch": 1.360069244085401,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.00048262649693494653,
|
|
"loss": 5.8547,
|
|
"mean_token_accuracy": 0.18518402725458144,
|
|
"num_tokens": 29871178.0,
|
|
"step": 11785
|
|
},
|
|
{
|
|
"entropy": 6.2989908218383786,
|
|
"epoch": 1.3606462781304096,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004826105936029332,
|
|
"loss": 5.9334,
|
|
"mean_token_accuracy": 0.17897191941738128,
|
|
"num_tokens": 29885477.0,
|
|
"step": 11790
|
|
},
|
|
{
|
|
"entropy": 6.24438328742981,
|
|
"epoch": 1.3612233121754183,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004825946832880406,
|
|
"loss": 5.8913,
|
|
"mean_token_accuracy": 0.17726410627365113,
|
|
"num_tokens": 29897917.0,
|
|
"step": 11795
|
|
},
|
|
{
|
|
"entropy": 6.250182342529297,
|
|
"epoch": 1.3618003462204271,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00048257876599080404,
|
|
"loss": 5.9065,
|
|
"mean_token_accuracy": 0.1838986322283745,
|
|
"num_tokens": 29911321.0,
|
|
"step": 11800
|
|
},
|
|
{
|
|
"entropy": 6.223178100585938,
|
|
"epoch": 1.3623773802654355,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00048256284171175874,
|
|
"loss": 5.8162,
|
|
"mean_token_accuracy": 0.1923563465476036,
|
|
"num_tokens": 29924651.0,
|
|
"step": 11805
|
|
},
|
|
{
|
|
"entropy": 6.130005931854248,
|
|
"epoch": 1.3629544143104444,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.00048254691045144035,
|
|
"loss": 5.7646,
|
|
"mean_token_accuracy": 0.19032905250787735,
|
|
"num_tokens": 29937334.0,
|
|
"step": 11810
|
|
},
|
|
{
|
|
"entropy": 6.1727530002594,
|
|
"epoch": 1.363531448355453,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004825309722103848,
|
|
"loss": 5.8041,
|
|
"mean_token_accuracy": 0.1924701526761055,
|
|
"num_tokens": 29949751.0,
|
|
"step": 11815
|
|
},
|
|
{
|
|
"entropy": 6.165993022918701,
|
|
"epoch": 1.3641084824004617,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.000482515026989128,
|
|
"loss": 5.8309,
|
|
"mean_token_accuracy": 0.19365983903408052,
|
|
"num_tokens": 29961675.0,
|
|
"step": 11820
|
|
},
|
|
{
|
|
"entropy": 6.295892810821533,
|
|
"epoch": 1.3646855164454703,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00048249907478820634,
|
|
"loss": 5.9528,
|
|
"mean_token_accuracy": 0.17994977831840514,
|
|
"num_tokens": 29973222.0,
|
|
"step": 11825
|
|
},
|
|
{
|
|
"entropy": 6.31345272064209,
|
|
"epoch": 1.365262550490479,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.00048248311560815637,
|
|
"loss": 5.959,
|
|
"mean_token_accuracy": 0.17840566635131835,
|
|
"num_tokens": 29985845.0,
|
|
"step": 11830
|
|
},
|
|
{
|
|
"entropy": 6.251032972335816,
|
|
"epoch": 1.3658395845354876,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004824671494495149,
|
|
"loss": 5.895,
|
|
"mean_token_accuracy": 0.18573582470417022,
|
|
"num_tokens": 29998252.0,
|
|
"step": 11835
|
|
},
|
|
{
|
|
"entropy": 6.248889064788818,
|
|
"epoch": 1.3664166185804962,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004824511763128189,
|
|
"loss": 5.861,
|
|
"mean_token_accuracy": 0.18926439434289932,
|
|
"num_tokens": 30011150.0,
|
|
"step": 11840
|
|
},
|
|
{
|
|
"entropy": 6.287919282913208,
|
|
"epoch": 1.3669936526255049,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.00048243519619860567,
|
|
"loss": 5.9662,
|
|
"mean_token_accuracy": 0.17687484472990037,
|
|
"num_tokens": 30024750.0,
|
|
"step": 11845
|
|
},
|
|
{
|
|
"entropy": 6.197072124481201,
|
|
"epoch": 1.3675706866705135,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004824192091074126,
|
|
"loss": 5.7818,
|
|
"mean_token_accuracy": 0.19744647443294525,
|
|
"num_tokens": 30038317.0,
|
|
"step": 11850
|
|
},
|
|
{
|
|
"entropy": 6.201137447357178,
|
|
"epoch": 1.3681477207155222,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004824032150397775,
|
|
"loss": 5.9135,
|
|
"mean_token_accuracy": 0.19055497795343398,
|
|
"num_tokens": 30052156.0,
|
|
"step": 11855
|
|
},
|
|
{
|
|
"entropy": 6.2688305377960205,
|
|
"epoch": 1.3687247547605308,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00048238721399623824,
|
|
"loss": 5.8899,
|
|
"mean_token_accuracy": 0.1839185744524002,
|
|
"num_tokens": 30063463.0,
|
|
"step": 11860
|
|
},
|
|
{
|
|
"entropy": 6.20152473449707,
|
|
"epoch": 1.3693017888055397,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00048237120597733316,
|
|
"loss": 5.8278,
|
|
"mean_token_accuracy": 0.19133645594120025,
|
|
"num_tokens": 30075090.0,
|
|
"step": 11865
|
|
},
|
|
{
|
|
"entropy": 6.1734706401824955,
|
|
"epoch": 1.369878822850548,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004823551909836005,
|
|
"loss": 5.8125,
|
|
"mean_token_accuracy": 0.18438569009304046,
|
|
"num_tokens": 30087618.0,
|
|
"step": 11870
|
|
},
|
|
{
|
|
"entropy": 6.269489002227783,
|
|
"epoch": 1.370455856895557,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00048233916901557896,
|
|
"loss": 5.847,
|
|
"mean_token_accuracy": 0.18638927936553956,
|
|
"num_tokens": 30098781.0,
|
|
"step": 11875
|
|
},
|
|
{
|
|
"entropy": 6.193616151809692,
|
|
"epoch": 1.3710328909405656,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00048232314007380753,
|
|
"loss": 5.8945,
|
|
"mean_token_accuracy": 0.1961129903793335,
|
|
"num_tokens": 30111163.0,
|
|
"step": 11880
|
|
},
|
|
{
|
|
"entropy": 6.20051646232605,
|
|
"epoch": 1.3716099249855742,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00048230710415882524,
|
|
"loss": 5.8787,
|
|
"mean_token_accuracy": 0.18906668871641158,
|
|
"num_tokens": 30124609.0,
|
|
"step": 11885
|
|
},
|
|
{
|
|
"entropy": 6.268427467346191,
|
|
"epoch": 1.3721869590305829,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00048229106127117144,
|
|
"loss": 5.9442,
|
|
"mean_token_accuracy": 0.18480219542980195,
|
|
"num_tokens": 30137823.0,
|
|
"step": 11890
|
|
},
|
|
{
|
|
"entropy": 6.26952748298645,
|
|
"epoch": 1.3727639930755915,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004822750114113858,
|
|
"loss": 5.8328,
|
|
"mean_token_accuracy": 0.18708803802728652,
|
|
"num_tokens": 30150295.0,
|
|
"step": 11895
|
|
},
|
|
{
|
|
"entropy": 6.1457456111907955,
|
|
"epoch": 1.3733410271206001,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004822589545800081,
|
|
"loss": 5.8049,
|
|
"mean_token_accuracy": 0.18936679661273956,
|
|
"num_tokens": 30163533.0,
|
|
"step": 11900
|
|
},
|
|
{
|
|
"entropy": 6.278868198394775,
|
|
"epoch": 1.3739180611656088,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004822428907775784,
|
|
"loss": 5.8765,
|
|
"mean_token_accuracy": 0.18396926969289779,
|
|
"num_tokens": 30176437.0,
|
|
"step": 11905
|
|
},
|
|
{
|
|
"entropy": 6.214042472839355,
|
|
"epoch": 1.3744950952106174,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048222682000463704,
|
|
"loss": 5.803,
|
|
"mean_token_accuracy": 0.1939064934849739,
|
|
"num_tokens": 30190181.0,
|
|
"step": 11910
|
|
},
|
|
{
|
|
"entropy": 6.17984972000122,
|
|
"epoch": 1.375072129255626,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004822107422617245,
|
|
"loss": 5.8492,
|
|
"mean_token_accuracy": 0.1890665829181671,
|
|
"num_tokens": 30202374.0,
|
|
"step": 11915
|
|
},
|
|
{
|
|
"entropy": 6.156255531311035,
|
|
"epoch": 1.3756491633006347,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00048219465754938156,
|
|
"loss": 5.7737,
|
|
"mean_token_accuracy": 0.18826987594366074,
|
|
"num_tokens": 30215009.0,
|
|
"step": 11920
|
|
},
|
|
{
|
|
"entropy": 6.279652118682861,
|
|
"epoch": 1.3762261973456433,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00048217856586814926,
|
|
"loss": 5.88,
|
|
"mean_token_accuracy": 0.18167006224393845,
|
|
"num_tokens": 30226688.0,
|
|
"step": 11925
|
|
},
|
|
{
|
|
"entropy": 6.277508211135864,
|
|
"epoch": 1.376803231390652,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00048216246721856875,
|
|
"loss": 5.9408,
|
|
"mean_token_accuracy": 0.18304099887609482,
|
|
"num_tokens": 30238501.0,
|
|
"step": 11930
|
|
},
|
|
{
|
|
"entropy": 6.257796669006348,
|
|
"epoch": 1.3773802654356606,
|
|
"grad_norm": 1.7265625,
|
|
"learning_rate": 0.00048214636160118164,
|
|
"loss": 5.8067,
|
|
"mean_token_accuracy": 0.19265892803668977,
|
|
"num_tokens": 30250216.0,
|
|
"step": 11935
|
|
},
|
|
{
|
|
"entropy": 6.2177825450897215,
|
|
"epoch": 1.3779572994806695,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004821302490165295,
|
|
"loss": 5.8605,
|
|
"mean_token_accuracy": 0.18837961107492446,
|
|
"num_tokens": 30262555.0,
|
|
"step": 11940
|
|
},
|
|
{
|
|
"entropy": 6.170514822006226,
|
|
"epoch": 1.378534333525678,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004821141294651544,
|
|
"loss": 5.7819,
|
|
"mean_token_accuracy": 0.19309227615594865,
|
|
"num_tokens": 30274593.0,
|
|
"step": 11945
|
|
},
|
|
{
|
|
"entropy": 6.200426197052002,
|
|
"epoch": 1.3791113675706868,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00048209800294759836,
|
|
"loss": 5.7778,
|
|
"mean_token_accuracy": 0.19841670393943786,
|
|
"num_tokens": 30286579.0,
|
|
"step": 11950
|
|
},
|
|
{
|
|
"entropy": 6.261295652389526,
|
|
"epoch": 1.3796884016156954,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004820818694644039,
|
|
"loss": 5.8622,
|
|
"mean_token_accuracy": 0.18498462438583374,
|
|
"num_tokens": 30299186.0,
|
|
"step": 11955
|
|
},
|
|
{
|
|
"entropy": 6.345550584793091,
|
|
"epoch": 1.380265435660704,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048206572901611364,
|
|
"loss": 5.9244,
|
|
"mean_token_accuracy": 0.18031724393367768,
|
|
"num_tokens": 30311429.0,
|
|
"step": 11960
|
|
},
|
|
{
|
|
"entropy": 6.304241085052491,
|
|
"epoch": 1.3808424697057127,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00048204958160327034,
|
|
"loss": 5.8993,
|
|
"mean_token_accuracy": 0.18167479634284972,
|
|
"num_tokens": 30323323.0,
|
|
"step": 11965
|
|
},
|
|
{
|
|
"entropy": 6.236213731765747,
|
|
"epoch": 1.3814195037507213,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00048203342722641726,
|
|
"loss": 5.8821,
|
|
"mean_token_accuracy": 0.18929619193077088,
|
|
"num_tokens": 30335815.0,
|
|
"step": 11970
|
|
},
|
|
{
|
|
"entropy": 6.213303899765014,
|
|
"epoch": 1.38199653779573,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00048201726588609776,
|
|
"loss": 5.786,
|
|
"mean_token_accuracy": 0.18967500627040862,
|
|
"num_tokens": 30347426.0,
|
|
"step": 11975
|
|
},
|
|
{
|
|
"entropy": 6.25053596496582,
|
|
"epoch": 1.3825735718407386,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.00048200109758285534,
|
|
"loss": 5.8717,
|
|
"mean_token_accuracy": 0.18591604977846146,
|
|
"num_tokens": 30359781.0,
|
|
"step": 11980
|
|
},
|
|
{
|
|
"entropy": 6.257670783996582,
|
|
"epoch": 1.3831506058857472,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004819849223172337,
|
|
"loss": 5.8721,
|
|
"mean_token_accuracy": 0.18719411343336106,
|
|
"num_tokens": 30373399.0,
|
|
"step": 11985
|
|
},
|
|
{
|
|
"entropy": 6.16593222618103,
|
|
"epoch": 1.3837276399307559,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00048196874008977716,
|
|
"loss": 5.8336,
|
|
"mean_token_accuracy": 0.1932594060897827,
|
|
"num_tokens": 30386296.0,
|
|
"step": 11990
|
|
},
|
|
{
|
|
"entropy": 6.265296363830567,
|
|
"epoch": 1.3843046739757645,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004819525509010298,
|
|
"loss": 5.8941,
|
|
"mean_token_accuracy": 0.190611732006073,
|
|
"num_tokens": 30399496.0,
|
|
"step": 11995
|
|
},
|
|
{
|
|
"entropy": 6.225067758560181,
|
|
"epoch": 1.3848817080207732,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004819363547515361,
|
|
"loss": 5.7934,
|
|
"mean_token_accuracy": 0.188978311419487,
|
|
"num_tokens": 30412491.0,
|
|
"step": 12000
|
|
},
|
|
{
|
|
"epoch": 1.3848817080207732,
|
|
"eval_entropy": 6.072817668204352,
|
|
"eval_loss": 5.934172630310059,
|
|
"eval_mean_token_accuracy": 0.1899097032309053,
|
|
"eval_num_tokens": 30412491.0,
|
|
"eval_runtime": 17.6284,
|
|
"eval_samples_per_second": 1596.06,
|
|
"eval_steps_per_second": 199.508,
|
|
"step": 12000
|
|
},
|
|
{
|
|
"entropy": 6.301853895187378,
|
|
"epoch": 1.385458742065782,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.000481920151641841,
|
|
"loss": 5.9354,
|
|
"mean_token_accuracy": 0.18052596896886824,
|
|
"num_tokens": 30427600.0,
|
|
"step": 12005
|
|
},
|
|
{
|
|
"entropy": 6.260950231552124,
|
|
"epoch": 1.3860357761107904,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048190394157248935,
|
|
"loss": 5.8174,
|
|
"mean_token_accuracy": 0.19201486110687255,
|
|
"num_tokens": 30440534.0,
|
|
"step": 12010
|
|
},
|
|
{
|
|
"entropy": 6.197269535064697,
|
|
"epoch": 1.3866128101557993,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004818877245440264,
|
|
"loss": 5.8068,
|
|
"mean_token_accuracy": 0.19823089689016343,
|
|
"num_tokens": 30453996.0,
|
|
"step": 12015
|
|
},
|
|
{
|
|
"entropy": 6.251287364959717,
|
|
"epoch": 1.3871898442008077,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00048187150055699763,
|
|
"loss": 5.8891,
|
|
"mean_token_accuracy": 0.18284614086151124,
|
|
"num_tokens": 30465667.0,
|
|
"step": 12020
|
|
},
|
|
{
|
|
"entropy": 6.2809501647949215,
|
|
"epoch": 1.3877668782458166,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004818552696119487,
|
|
"loss": 5.9209,
|
|
"mean_token_accuracy": 0.18133794516324997,
|
|
"num_tokens": 30478950.0,
|
|
"step": 12025
|
|
},
|
|
{
|
|
"entropy": 6.175559759140015,
|
|
"epoch": 1.3883439122908252,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004818390317094255,
|
|
"loss": 5.7649,
|
|
"mean_token_accuracy": 0.19492525309324266,
|
|
"num_tokens": 30490979.0,
|
|
"step": 12030
|
|
},
|
|
{
|
|
"entropy": 6.242245292663574,
|
|
"epoch": 1.3889209463358339,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004818227868499742,
|
|
"loss": 5.8052,
|
|
"mean_token_accuracy": 0.19470774233341218,
|
|
"num_tokens": 30504242.0,
|
|
"step": 12035
|
|
},
|
|
{
|
|
"entropy": 6.216363430023193,
|
|
"epoch": 1.3894979803808425,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004818065350341412,
|
|
"loss": 5.9003,
|
|
"mean_token_accuracy": 0.18019478619098664,
|
|
"num_tokens": 30515739.0,
|
|
"step": 12040
|
|
},
|
|
{
|
|
"entropy": 6.287183237075806,
|
|
"epoch": 1.3900750144258511,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00048179027626247325,
|
|
"loss": 5.8576,
|
|
"mean_token_accuracy": 0.18424582928419114,
|
|
"num_tokens": 30528338.0,
|
|
"step": 12045
|
|
},
|
|
{
|
|
"entropy": 6.294361686706543,
|
|
"epoch": 1.3906520484708598,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004817740105355169,
|
|
"loss": 5.9078,
|
|
"mean_token_accuracy": 0.18659729063510894,
|
|
"num_tokens": 30540572.0,
|
|
"step": 12050
|
|
},
|
|
{
|
|
"entropy": 6.259363889694214,
|
|
"epoch": 1.3912290825158684,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00048175773785381947,
|
|
"loss": 5.9115,
|
|
"mean_token_accuracy": 0.1899486929178238,
|
|
"num_tokens": 30554317.0,
|
|
"step": 12055
|
|
},
|
|
{
|
|
"entropy": 6.24990553855896,
|
|
"epoch": 1.391806116560877,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00048174145821792833,
|
|
"loss": 5.8755,
|
|
"mean_token_accuracy": 0.1851966544985771,
|
|
"num_tokens": 30567177.0,
|
|
"step": 12060
|
|
},
|
|
{
|
|
"entropy": 6.32722430229187,
|
|
"epoch": 1.3923831506058857,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004817251716283908,
|
|
"loss": 5.8673,
|
|
"mean_token_accuracy": 0.18701709061861038,
|
|
"num_tokens": 30577948.0,
|
|
"step": 12065
|
|
},
|
|
{
|
|
"entropy": 6.19557638168335,
|
|
"epoch": 1.3929601846508943,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004817088780857548,
|
|
"loss": 5.8476,
|
|
"mean_token_accuracy": 0.18737161308526992,
|
|
"num_tokens": 30590548.0,
|
|
"step": 12070
|
|
},
|
|
{
|
|
"entropy": 6.2240033626556395,
|
|
"epoch": 1.393537218695903,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00048169257759056845,
|
|
"loss": 5.7913,
|
|
"mean_token_accuracy": 0.19839557707309724,
|
|
"num_tokens": 30602735.0,
|
|
"step": 12075
|
|
},
|
|
{
|
|
"entropy": 6.259526157379151,
|
|
"epoch": 1.3941142527409118,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048167627014337994,
|
|
"loss": 5.9117,
|
|
"mean_token_accuracy": 0.18355602622032166,
|
|
"num_tokens": 30615112.0,
|
|
"step": 12080
|
|
},
|
|
{
|
|
"entropy": 6.180841445922852,
|
|
"epoch": 1.3946912867859202,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00048165995574473764,
|
|
"loss": 5.835,
|
|
"mean_token_accuracy": 0.1852560117840767,
|
|
"num_tokens": 30627406.0,
|
|
"step": 12085
|
|
},
|
|
{
|
|
"entropy": 6.213917303085327,
|
|
"epoch": 1.395268320830929,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00048164363439519043,
|
|
"loss": 5.8516,
|
|
"mean_token_accuracy": 0.19082715213298798,
|
|
"num_tokens": 30639764.0,
|
|
"step": 12090
|
|
},
|
|
{
|
|
"entropy": 6.253957509994507,
|
|
"epoch": 1.3958453548759377,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004816273060952873,
|
|
"loss": 5.8598,
|
|
"mean_token_accuracy": 0.18492789268493653,
|
|
"num_tokens": 30652181.0,
|
|
"step": 12095
|
|
},
|
|
{
|
|
"entropy": 6.233830738067627,
|
|
"epoch": 1.3964223889209464,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00048161097084557726,
|
|
"loss": 5.8424,
|
|
"mean_token_accuracy": 0.18780053853988649,
|
|
"num_tokens": 30663586.0,
|
|
"step": 12100
|
|
},
|
|
{
|
|
"entropy": 6.323609018325806,
|
|
"epoch": 1.396999422965955,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00048159462864660993,
|
|
"loss": 5.9321,
|
|
"mean_token_accuracy": 0.18068586885929108,
|
|
"num_tokens": 30676218.0,
|
|
"step": 12105
|
|
},
|
|
{
|
|
"entropy": 6.298351240158081,
|
|
"epoch": 1.3975764570109637,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004815782794989348,
|
|
"loss": 5.9088,
|
|
"mean_token_accuracy": 0.1828354611992836,
|
|
"num_tokens": 30688532.0,
|
|
"step": 12110
|
|
},
|
|
{
|
|
"entropy": 6.219765090942383,
|
|
"epoch": 1.3981534910559723,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004815619234031019,
|
|
"loss": 5.8698,
|
|
"mean_token_accuracy": 0.1810378611087799,
|
|
"num_tokens": 30700698.0,
|
|
"step": 12115
|
|
},
|
|
{
|
|
"entropy": 6.214390087127685,
|
|
"epoch": 1.398730525100981,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004815455603596613,
|
|
"loss": 5.8682,
|
|
"mean_token_accuracy": 0.1863407924771309,
|
|
"num_tokens": 30713032.0,
|
|
"step": 12120
|
|
},
|
|
{
|
|
"entropy": 6.20099720954895,
|
|
"epoch": 1.3993075591459896,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004815291903691634,
|
|
"loss": 5.8065,
|
|
"mean_token_accuracy": 0.19326940029859543,
|
|
"num_tokens": 30726829.0,
|
|
"step": 12125
|
|
},
|
|
{
|
|
"entropy": 6.300219249725342,
|
|
"epoch": 1.3998845931909982,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00048151281343215873,
|
|
"loss": 5.9029,
|
|
"mean_token_accuracy": 0.1824083521962166,
|
|
"num_tokens": 30740280.0,
|
|
"step": 12130
|
|
},
|
|
{
|
|
"entropy": 6.16341199874878,
|
|
"epoch": 1.4004616272360069,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004814964295491982,
|
|
"loss": 5.7467,
|
|
"mean_token_accuracy": 0.19635725021362305,
|
|
"num_tokens": 30753467.0,
|
|
"step": 12135
|
|
},
|
|
{
|
|
"entropy": 6.192393827438354,
|
|
"epoch": 1.4010386612810155,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00048148003872083286,
|
|
"loss": 5.8313,
|
|
"mean_token_accuracy": 0.19740188717842103,
|
|
"num_tokens": 30766958.0,
|
|
"step": 12140
|
|
},
|
|
{
|
|
"entropy": 6.251896476745605,
|
|
"epoch": 1.4016156953260244,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00048146364094761384,
|
|
"loss": 5.9156,
|
|
"mean_token_accuracy": 0.18174671679735183,
|
|
"num_tokens": 30779114.0,
|
|
"step": 12145
|
|
},
|
|
{
|
|
"entropy": 6.271113157272339,
|
|
"epoch": 1.4021927293710328,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00048144723623009297,
|
|
"loss": 5.813,
|
|
"mean_token_accuracy": 0.1902441129088402,
|
|
"num_tokens": 30792063.0,
|
|
"step": 12150
|
|
},
|
|
{
|
|
"entropy": 6.254286670684815,
|
|
"epoch": 1.4027697634160416,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004814308245688218,
|
|
"loss": 5.8958,
|
|
"mean_token_accuracy": 0.18653863221406936,
|
|
"num_tokens": 30804404.0,
|
|
"step": 12155
|
|
},
|
|
{
|
|
"entropy": 6.170608806610107,
|
|
"epoch": 1.40334679746105,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00048141440596435235,
|
|
"loss": 5.8196,
|
|
"mean_token_accuracy": 0.19177932739257814,
|
|
"num_tokens": 30817607.0,
|
|
"step": 12160
|
|
},
|
|
{
|
|
"entropy": 6.21555871963501,
|
|
"epoch": 1.403923831506059,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004813979804172369,
|
|
"loss": 5.893,
|
|
"mean_token_accuracy": 0.18380023390054703,
|
|
"num_tokens": 30831077.0,
|
|
"step": 12165
|
|
},
|
|
{
|
|
"entropy": 6.276795530319214,
|
|
"epoch": 1.4045008655510676,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048138154792802795,
|
|
"loss": 5.983,
|
|
"mean_token_accuracy": 0.18137128055095672,
|
|
"num_tokens": 30844096.0,
|
|
"step": 12170
|
|
},
|
|
{
|
|
"entropy": 6.295123624801636,
|
|
"epoch": 1.4050778995960762,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004813651084972781,
|
|
"loss": 5.8887,
|
|
"mean_token_accuracy": 0.18827279955148696,
|
|
"num_tokens": 30856147.0,
|
|
"step": 12175
|
|
},
|
|
{
|
|
"entropy": 6.258724975585937,
|
|
"epoch": 1.4056549336410848,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00048134866212554036,
|
|
"loss": 5.8853,
|
|
"mean_token_accuracy": 0.17940700948238372,
|
|
"num_tokens": 30869436.0,
|
|
"step": 12180
|
|
},
|
|
{
|
|
"entropy": 6.209239101409912,
|
|
"epoch": 1.4062319676860935,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004813322088133679,
|
|
"loss": 5.8189,
|
|
"mean_token_accuracy": 0.19204139113426208,
|
|
"num_tokens": 30882313.0,
|
|
"step": 12185
|
|
},
|
|
{
|
|
"entropy": 6.2562541484832765,
|
|
"epoch": 1.4068090017311021,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00048131574856131407,
|
|
"loss": 5.8396,
|
|
"mean_token_accuracy": 0.1857314497232437,
|
|
"num_tokens": 30895062.0,
|
|
"step": 12190
|
|
},
|
|
{
|
|
"entropy": 6.227566480636597,
|
|
"epoch": 1.4073860357761108,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004812992813699324,
|
|
"loss": 5.8386,
|
|
"mean_token_accuracy": 0.18683320432901382,
|
|
"num_tokens": 30907736.0,
|
|
"step": 12195
|
|
},
|
|
{
|
|
"entropy": 6.220577239990234,
|
|
"epoch": 1.4079630698211194,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.000481282807239777,
|
|
"loss": 5.8431,
|
|
"mean_token_accuracy": 0.19073092341423034,
|
|
"num_tokens": 30920462.0,
|
|
"step": 12200
|
|
},
|
|
{
|
|
"entropy": 6.217762279510498,
|
|
"epoch": 1.408540103866128,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004812663261714019,
|
|
"loss": 5.7836,
|
|
"mean_token_accuracy": 0.19252836406230928,
|
|
"num_tokens": 30933501.0,
|
|
"step": 12205
|
|
},
|
|
{
|
|
"entropy": 6.223458099365234,
|
|
"epoch": 1.4091171379111367,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004812498381653613,
|
|
"loss": 5.7691,
|
|
"mean_token_accuracy": 0.19711357057094575,
|
|
"num_tokens": 30944780.0,
|
|
"step": 12210
|
|
},
|
|
{
|
|
"entropy": 6.21431188583374,
|
|
"epoch": 1.4096941719561453,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004812333432222098,
|
|
"loss": 5.8125,
|
|
"mean_token_accuracy": 0.19472504109144212,
|
|
"num_tokens": 30957730.0,
|
|
"step": 12215
|
|
},
|
|
{
|
|
"entropy": 6.009715795516968,
|
|
"epoch": 1.4102712060011542,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004812168413425023,
|
|
"loss": 5.6882,
|
|
"mean_token_accuracy": 0.20412740260362625,
|
|
"num_tokens": 30969371.0,
|
|
"step": 12220
|
|
},
|
|
{
|
|
"entropy": 6.231176328659058,
|
|
"epoch": 1.4108482400461626,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00048120033252679374,
|
|
"loss": 5.8924,
|
|
"mean_token_accuracy": 0.18615046590566636,
|
|
"num_tokens": 30983662.0,
|
|
"step": 12225
|
|
},
|
|
{
|
|
"entropy": 6.312102746963501,
|
|
"epoch": 1.4114252740911715,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00048118381677563946,
|
|
"loss": 5.8878,
|
|
"mean_token_accuracy": 0.18438036888837814,
|
|
"num_tokens": 30995641.0,
|
|
"step": 12230
|
|
},
|
|
{
|
|
"entropy": 6.28008394241333,
|
|
"epoch": 1.41200230813618,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004811672940895949,
|
|
"loss": 5.9443,
|
|
"mean_token_accuracy": 0.18446469008922578,
|
|
"num_tokens": 31008508.0,
|
|
"step": 12235
|
|
},
|
|
{
|
|
"entropy": 6.293724393844604,
|
|
"epoch": 1.4125793421811887,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004811507644692158,
|
|
"loss": 5.9187,
|
|
"mean_token_accuracy": 0.18171917498111725,
|
|
"num_tokens": 31020903.0,
|
|
"step": 12240
|
|
},
|
|
{
|
|
"entropy": 6.257511377334595,
|
|
"epoch": 1.4131563762261974,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004811342279150581,
|
|
"loss": 5.8593,
|
|
"mean_token_accuracy": 0.190650050342083,
|
|
"num_tokens": 31033668.0,
|
|
"step": 12245
|
|
},
|
|
{
|
|
"entropy": 6.258108806610108,
|
|
"epoch": 1.413733410271206,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004811176844276781,
|
|
"loss": 5.9092,
|
|
"mean_token_accuracy": 0.1842113733291626,
|
|
"num_tokens": 31046980.0,
|
|
"step": 12250
|
|
},
|
|
{
|
|
"entropy": 6.205495929718017,
|
|
"epoch": 1.4143104443162147,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004811011340076322,
|
|
"loss": 5.8128,
|
|
"mean_token_accuracy": 0.186430487036705,
|
|
"num_tokens": 31059023.0,
|
|
"step": 12255
|
|
},
|
|
{
|
|
"entropy": 6.267776298522949,
|
|
"epoch": 1.4148874783612233,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048108457665547695,
|
|
"loss": 5.8526,
|
|
"mean_token_accuracy": 0.18937126398086548,
|
|
"num_tokens": 31070449.0,
|
|
"step": 12260
|
|
},
|
|
{
|
|
"entropy": 6.198201084136963,
|
|
"epoch": 1.415464512406232,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004810680123717694,
|
|
"loss": 5.8053,
|
|
"mean_token_accuracy": 0.19537163823843,
|
|
"num_tokens": 31081974.0,
|
|
"step": 12265
|
|
},
|
|
{
|
|
"entropy": 6.23746509552002,
|
|
"epoch": 1.4160415464512406,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004810514411570666,
|
|
"loss": 5.8773,
|
|
"mean_token_accuracy": 0.18206487745046615,
|
|
"num_tokens": 31094825.0,
|
|
"step": 12270
|
|
},
|
|
{
|
|
"entropy": 6.164452695846558,
|
|
"epoch": 1.4166185804962492,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004810348630119259,
|
|
"loss": 5.8424,
|
|
"mean_token_accuracy": 0.18676037788391114,
|
|
"num_tokens": 31106589.0,
|
|
"step": 12275
|
|
},
|
|
{
|
|
"entropy": 6.306876564025879,
|
|
"epoch": 1.4171956145412579,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00048101827793690493,
|
|
"loss": 5.8616,
|
|
"mean_token_accuracy": 0.17967692017555237,
|
|
"num_tokens": 31118228.0,
|
|
"step": 12280
|
|
},
|
|
{
|
|
"entropy": 6.314551591873169,
|
|
"epoch": 1.4177726485862667,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004810016859325615,
|
|
"loss": 5.9554,
|
|
"mean_token_accuracy": 0.18243657797574997,
|
|
"num_tokens": 31131396.0,
|
|
"step": 12285
|
|
},
|
|
{
|
|
"entropy": 6.237841653823852,
|
|
"epoch": 1.4183496826312751,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004809850869994537,
|
|
"loss": 5.8619,
|
|
"mean_token_accuracy": 0.1885082244873047,
|
|
"num_tokens": 31145524.0,
|
|
"step": 12290
|
|
},
|
|
{
|
|
"entropy": 6.274528551101684,
|
|
"epoch": 1.418926716676284,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004809684811381398,
|
|
"loss": 5.8248,
|
|
"mean_token_accuracy": 0.1977459728717804,
|
|
"num_tokens": 31157866.0,
|
|
"step": 12295
|
|
},
|
|
{
|
|
"entropy": 6.155285167694092,
|
|
"epoch": 1.4195037507212924,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004809518683491785,
|
|
"loss": 5.7666,
|
|
"mean_token_accuracy": 0.19823187589645386,
|
|
"num_tokens": 31170634.0,
|
|
"step": 12300
|
|
},
|
|
{
|
|
"entropy": 6.192041683197021,
|
|
"epoch": 1.4200807847663013,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00048093524863312823,
|
|
"loss": 5.8119,
|
|
"mean_token_accuracy": 0.18903475552797316,
|
|
"num_tokens": 31183585.0,
|
|
"step": 12305
|
|
},
|
|
{
|
|
"entropy": 6.261973333358765,
|
|
"epoch": 1.42065781881131,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004809186219905482,
|
|
"loss": 5.8426,
|
|
"mean_token_accuracy": 0.18727468997240065,
|
|
"num_tokens": 31196375.0,
|
|
"step": 12310
|
|
},
|
|
{
|
|
"entropy": 6.18221230506897,
|
|
"epoch": 1.4212348528563186,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004809019884219976,
|
|
"loss": 5.8249,
|
|
"mean_token_accuracy": 0.19580861926078796,
|
|
"num_tokens": 31209797.0,
|
|
"step": 12315
|
|
},
|
|
{
|
|
"entropy": 6.166803169250488,
|
|
"epoch": 1.4218118869013272,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00048088534792803595,
|
|
"loss": 5.7396,
|
|
"mean_token_accuracy": 0.19430786818265916,
|
|
"num_tokens": 31221196.0,
|
|
"step": 12320
|
|
},
|
|
{
|
|
"entropy": 6.259878826141358,
|
|
"epoch": 1.4223889209463358,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00048086870050922286,
|
|
"loss": 5.8522,
|
|
"mean_token_accuracy": 0.18935182839632034,
|
|
"num_tokens": 31234126.0,
|
|
"step": 12325
|
|
},
|
|
{
|
|
"entropy": 6.252271556854248,
|
|
"epoch": 1.4229659549913445,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00048085204616611833,
|
|
"loss": 5.873,
|
|
"mean_token_accuracy": 0.18678005188703536,
|
|
"num_tokens": 31245933.0,
|
|
"step": 12330
|
|
},
|
|
{
|
|
"entropy": 6.192243480682373,
|
|
"epoch": 1.4235429890363531,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048083538489928246,
|
|
"loss": 5.8689,
|
|
"mean_token_accuracy": 0.18617866486310958,
|
|
"num_tokens": 31258734.0,
|
|
"step": 12335
|
|
},
|
|
{
|
|
"entropy": 6.227387714385986,
|
|
"epoch": 1.4241200230813618,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004808187167092757,
|
|
"loss": 5.7521,
|
|
"mean_token_accuracy": 0.18657746613025666,
|
|
"num_tokens": 31272487.0,
|
|
"step": 12340
|
|
},
|
|
{
|
|
"entropy": 6.213850641250611,
|
|
"epoch": 1.4246970571263704,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004808020415966586,
|
|
"loss": 5.8346,
|
|
"mean_token_accuracy": 0.18490028977394105,
|
|
"num_tokens": 31285117.0,
|
|
"step": 12345
|
|
},
|
|
{
|
|
"entropy": 6.222880744934082,
|
|
"epoch": 1.425274091171379,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.000480785359561992,
|
|
"loss": 5.809,
|
|
"mean_token_accuracy": 0.19161065220832824,
|
|
"num_tokens": 31297772.0,
|
|
"step": 12350
|
|
},
|
|
{
|
|
"entropy": 6.2099446773529055,
|
|
"epoch": 1.4258511252163877,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00048076867060583704,
|
|
"loss": 5.8379,
|
|
"mean_token_accuracy": 0.1893964871764183,
|
|
"num_tokens": 31310901.0,
|
|
"step": 12355
|
|
},
|
|
{
|
|
"entropy": 6.23720760345459,
|
|
"epoch": 1.4264281592613965,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004807519747287551,
|
|
"loss": 5.8364,
|
|
"mean_token_accuracy": 0.18434469103813172,
|
|
"num_tokens": 31323090.0,
|
|
"step": 12360
|
|
},
|
|
{
|
|
"entropy": 6.192369842529297,
|
|
"epoch": 1.427005193306405,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004807352719313078,
|
|
"loss": 5.7538,
|
|
"mean_token_accuracy": 0.1981295555830002,
|
|
"num_tokens": 31335883.0,
|
|
"step": 12365
|
|
},
|
|
{
|
|
"entropy": 6.29363317489624,
|
|
"epoch": 1.4275822273514138,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004807185622140567,
|
|
"loss": 5.9025,
|
|
"mean_token_accuracy": 0.18681400418281555,
|
|
"num_tokens": 31348237.0,
|
|
"step": 12370
|
|
},
|
|
{
|
|
"entropy": 6.159489631652832,
|
|
"epoch": 1.4281592613964225,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00048070184557756396,
|
|
"loss": 5.7452,
|
|
"mean_token_accuracy": 0.1910381242632866,
|
|
"num_tokens": 31360414.0,
|
|
"step": 12375
|
|
},
|
|
{
|
|
"entropy": 6.228966617584229,
|
|
"epoch": 1.428736295441431,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00048068512202239177,
|
|
"loss": 5.8706,
|
|
"mean_token_accuracy": 0.18762275874614714,
|
|
"num_tokens": 31372765.0,
|
|
"step": 12380
|
|
},
|
|
{
|
|
"entropy": 6.2343464374542235,
|
|
"epoch": 1.4293133294864397,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004806683915491028,
|
|
"loss": 5.8246,
|
|
"mean_token_accuracy": 0.19126800447702408,
|
|
"num_tokens": 31386176.0,
|
|
"step": 12385
|
|
},
|
|
{
|
|
"entropy": 6.275753688812256,
|
|
"epoch": 1.4298903635314484,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004806516541582596,
|
|
"loss": 5.9217,
|
|
"mean_token_accuracy": 0.1823081776499748,
|
|
"num_tokens": 31398385.0,
|
|
"step": 12390
|
|
},
|
|
{
|
|
"entropy": 6.1845824241638185,
|
|
"epoch": 1.430467397576457,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.00048063490985042506,
|
|
"loss": 5.768,
|
|
"mean_token_accuracy": 0.1930743232369423,
|
|
"num_tokens": 31410841.0,
|
|
"step": 12395
|
|
},
|
|
{
|
|
"entropy": 6.193290281295776,
|
|
"epoch": 1.4310444316214657,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004806181586261626,
|
|
"loss": 5.7982,
|
|
"mean_token_accuracy": 0.19314497709274292,
|
|
"num_tokens": 31425586.0,
|
|
"step": 12400
|
|
},
|
|
{
|
|
"entropy": 6.232039213180542,
|
|
"epoch": 1.4316214656664743,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00048060140048603544,
|
|
"loss": 5.8241,
|
|
"mean_token_accuracy": 0.19228676557540894,
|
|
"num_tokens": 31438943.0,
|
|
"step": 12405
|
|
},
|
|
{
|
|
"entropy": 6.189572191238403,
|
|
"epoch": 1.432198499711483,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004805846354306073,
|
|
"loss": 5.7794,
|
|
"mean_token_accuracy": 0.19570462852716447,
|
|
"num_tokens": 31452284.0,
|
|
"step": 12410
|
|
},
|
|
{
|
|
"entropy": 6.265307140350342,
|
|
"epoch": 1.4327755337564916,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048056786346044214,
|
|
"loss": 5.9258,
|
|
"mean_token_accuracy": 0.1752777561545372,
|
|
"num_tokens": 31466311.0,
|
|
"step": 12415
|
|
},
|
|
{
|
|
"entropy": 6.276501178741455,
|
|
"epoch": 1.4333525678015002,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00048055108457610395,
|
|
"loss": 5.7913,
|
|
"mean_token_accuracy": 0.19310199171304704,
|
|
"num_tokens": 31478916.0,
|
|
"step": 12420
|
|
},
|
|
{
|
|
"entropy": 6.2271256923675535,
|
|
"epoch": 1.4339296018465089,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004805342987781571,
|
|
"loss": 5.8388,
|
|
"mean_token_accuracy": 0.18540789186954498,
|
|
"num_tokens": 31490337.0,
|
|
"step": 12425
|
|
},
|
|
{
|
|
"entropy": 6.191142988204956,
|
|
"epoch": 1.4345066358915175,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004805175060671663,
|
|
"loss": 5.837,
|
|
"mean_token_accuracy": 0.1861076056957245,
|
|
"num_tokens": 31502625.0,
|
|
"step": 12430
|
|
},
|
|
{
|
|
"entropy": 6.269933652877808,
|
|
"epoch": 1.4350836699365264,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004805007064436962,
|
|
"loss": 5.8688,
|
|
"mean_token_accuracy": 0.18913554698228835,
|
|
"num_tokens": 31515440.0,
|
|
"step": 12435
|
|
},
|
|
{
|
|
"entropy": 6.261519908905029,
|
|
"epoch": 1.4356607039815348,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004804838999083119,
|
|
"loss": 5.8387,
|
|
"mean_token_accuracy": 0.18860826641321182,
|
|
"num_tokens": 31527812.0,
|
|
"step": 12440
|
|
},
|
|
{
|
|
"entropy": 6.2459697246551515,
|
|
"epoch": 1.4362377380265436,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004804670864615787,
|
|
"loss": 5.8288,
|
|
"mean_token_accuracy": 0.18852628469467164,
|
|
"num_tokens": 31540249.0,
|
|
"step": 12445
|
|
},
|
|
{
|
|
"entropy": 6.170604562759399,
|
|
"epoch": 1.4368147720715523,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00048045026610406223,
|
|
"loss": 5.7808,
|
|
"mean_token_accuracy": 0.19519326835870743,
|
|
"num_tokens": 31552312.0,
|
|
"step": 12450
|
|
},
|
|
{
|
|
"entropy": 6.271270418167115,
|
|
"epoch": 1.437391806116561,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.000480433438836328,
|
|
"loss": 5.8401,
|
|
"mean_token_accuracy": 0.1857555016875267,
|
|
"num_tokens": 31564496.0,
|
|
"step": 12455
|
|
},
|
|
{
|
|
"entropy": 6.26390962600708,
|
|
"epoch": 1.4379688401615696,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048041660465894206,
|
|
"loss": 5.8391,
|
|
"mean_token_accuracy": 0.18578193783760072,
|
|
"num_tokens": 31577705.0,
|
|
"step": 12460
|
|
},
|
|
{
|
|
"entropy": 6.277010202407837,
|
|
"epoch": 1.4385458742065782,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004803997635724707,
|
|
"loss": 5.8735,
|
|
"mean_token_accuracy": 0.1823616862297058,
|
|
"num_tokens": 31589566.0,
|
|
"step": 12465
|
|
},
|
|
{
|
|
"entropy": 6.256769752502441,
|
|
"epoch": 1.4391229082515868,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004803829155774804,
|
|
"loss": 5.8826,
|
|
"mean_token_accuracy": 0.1852583885192871,
|
|
"num_tokens": 31602379.0,
|
|
"step": 12470
|
|
},
|
|
{
|
|
"entropy": 6.250380563735962,
|
|
"epoch": 1.4396999422965955,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004803660606745377,
|
|
"loss": 5.8274,
|
|
"mean_token_accuracy": 0.19224091172218322,
|
|
"num_tokens": 31615469.0,
|
|
"step": 12475
|
|
},
|
|
{
|
|
"entropy": 6.2556861400604244,
|
|
"epoch": 1.4402769763416041,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00048034919886420953,
|
|
"loss": 5.932,
|
|
"mean_token_accuracy": 0.18619346469640732,
|
|
"num_tokens": 31627129.0,
|
|
"step": 12480
|
|
},
|
|
{
|
|
"entropy": 6.294282674789429,
|
|
"epoch": 1.4408540103866128,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.00048033233014706304,
|
|
"loss": 5.8952,
|
|
"mean_token_accuracy": 0.18746394217014312,
|
|
"num_tokens": 31639564.0,
|
|
"step": 12485
|
|
},
|
|
{
|
|
"entropy": 6.1616355895996096,
|
|
"epoch": 1.4414310444316214,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048031545452366565,
|
|
"loss": 5.8522,
|
|
"mean_token_accuracy": 0.18221624940633774,
|
|
"num_tokens": 31651984.0,
|
|
"step": 12490
|
|
},
|
|
{
|
|
"entropy": 6.274483489990234,
|
|
"epoch": 1.44200807847663,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00048029857199458493,
|
|
"loss": 5.8248,
|
|
"mean_token_accuracy": 0.1933693617582321,
|
|
"num_tokens": 31664850.0,
|
|
"step": 12495
|
|
},
|
|
{
|
|
"entropy": 6.172151279449463,
|
|
"epoch": 1.442585112521639,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048028168256038873,
|
|
"loss": 5.8083,
|
|
"mean_token_accuracy": 0.19690240025520325,
|
|
"num_tokens": 31676993.0,
|
|
"step": 12500
|
|
},
|
|
{
|
|
"entropy": 6.241194343566894,
|
|
"epoch": 1.4431621465666473,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00048026478622164513,
|
|
"loss": 5.9103,
|
|
"mean_token_accuracy": 0.19012573957443238,
|
|
"num_tokens": 31689632.0,
|
|
"step": 12505
|
|
},
|
|
{
|
|
"entropy": 6.277917289733887,
|
|
"epoch": 1.4437391806116562,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00048024788297892234,
|
|
"loss": 5.8514,
|
|
"mean_token_accuracy": 0.18539552241563798,
|
|
"num_tokens": 31701610.0,
|
|
"step": 12510
|
|
},
|
|
{
|
|
"entropy": 6.220233011245727,
|
|
"epoch": 1.4443162146566648,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000480230972832789,
|
|
"loss": 5.8238,
|
|
"mean_token_accuracy": 0.18775998800992966,
|
|
"num_tokens": 31713838.0,
|
|
"step": 12515
|
|
},
|
|
{
|
|
"entropy": 6.17543592453003,
|
|
"epoch": 1.4448932487016735,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00048021405578381384,
|
|
"loss": 5.78,
|
|
"mean_token_accuracy": 0.19356610178947448,
|
|
"num_tokens": 31726097.0,
|
|
"step": 12520
|
|
},
|
|
{
|
|
"entropy": 6.206122636795044,
|
|
"epoch": 1.445470282746682,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004801971318325659,
|
|
"loss": 5.8184,
|
|
"mean_token_accuracy": 0.1879914492368698,
|
|
"num_tokens": 31739646.0,
|
|
"step": 12525
|
|
},
|
|
{
|
|
"entropy": 6.21998233795166,
|
|
"epoch": 1.4460473167916907,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004801802009796142,
|
|
"loss": 5.8003,
|
|
"mean_token_accuracy": 0.19319549351930618,
|
|
"num_tokens": 31752161.0,
|
|
"step": 12530
|
|
},
|
|
{
|
|
"entropy": 6.206159591674805,
|
|
"epoch": 1.4466243508366994,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004801632632255285,
|
|
"loss": 5.8059,
|
|
"mean_token_accuracy": 0.18725275844335557,
|
|
"num_tokens": 31764498.0,
|
|
"step": 12535
|
|
},
|
|
{
|
|
"entropy": 6.285904359817505,
|
|
"epoch": 1.447201384881708,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004801463185708783,
|
|
"loss": 5.8608,
|
|
"mean_token_accuracy": 0.18627117872238158,
|
|
"num_tokens": 31776453.0,
|
|
"step": 12540
|
|
},
|
|
{
|
|
"entropy": 6.210245609283447,
|
|
"epoch": 1.4477784189267167,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00048012936701623363,
|
|
"loss": 5.9274,
|
|
"mean_token_accuracy": 0.18175046145915985,
|
|
"num_tokens": 31789761.0,
|
|
"step": 12545
|
|
},
|
|
{
|
|
"entropy": 6.2855147361755375,
|
|
"epoch": 1.4483554529717253,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00048011240856216456,
|
|
"loss": 5.9142,
|
|
"mean_token_accuracy": 0.18825961649417877,
|
|
"num_tokens": 31802689.0,
|
|
"step": 12550
|
|
},
|
|
{
|
|
"entropy": 6.23141303062439,
|
|
"epoch": 1.448932487016734,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048009544320924154,
|
|
"loss": 5.8918,
|
|
"mean_token_accuracy": 0.18411456793546677,
|
|
"num_tokens": 31816768.0,
|
|
"step": 12555
|
|
},
|
|
{
|
|
"entropy": 6.213440322875977,
|
|
"epoch": 1.4495095210617426,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004800784709580351,
|
|
"loss": 5.8276,
|
|
"mean_token_accuracy": 0.1924056515097618,
|
|
"num_tokens": 31828920.0,
|
|
"step": 12560
|
|
},
|
|
{
|
|
"entropy": 6.235508108139038,
|
|
"epoch": 1.4500865551067512,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004800614918091161,
|
|
"loss": 5.8868,
|
|
"mean_token_accuracy": 0.18438960909843444,
|
|
"num_tokens": 31841467.0,
|
|
"step": 12565
|
|
},
|
|
{
|
|
"entropy": 6.269950532913208,
|
|
"epoch": 1.4506635891517599,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004800445057630558,
|
|
"loss": 5.8879,
|
|
"mean_token_accuracy": 0.18824739307165145,
|
|
"num_tokens": 31855254.0,
|
|
"step": 12570
|
|
},
|
|
{
|
|
"entropy": 6.227955436706543,
|
|
"epoch": 1.4512406231967687,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004800275128204254,
|
|
"loss": 5.823,
|
|
"mean_token_accuracy": 0.1889019101858139,
|
|
"num_tokens": 31868234.0,
|
|
"step": 12575
|
|
},
|
|
{
|
|
"entropy": 6.259027624130249,
|
|
"epoch": 1.4518176572417771,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00048001051298179637,
|
|
"loss": 5.8882,
|
|
"mean_token_accuracy": 0.19090647697448732,
|
|
"num_tokens": 31880014.0,
|
|
"step": 12580
|
|
},
|
|
{
|
|
"entropy": 6.228473424911499,
|
|
"epoch": 1.452394691286786,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004799935062477407,
|
|
"loss": 5.8329,
|
|
"mean_token_accuracy": 0.18438107669353485,
|
|
"num_tokens": 31892019.0,
|
|
"step": 12585
|
|
},
|
|
{
|
|
"entropy": 6.267324924468994,
|
|
"epoch": 1.4529717253317946,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00047997649261883013,
|
|
"loss": 5.8476,
|
|
"mean_token_accuracy": 0.18466779142618178,
|
|
"num_tokens": 31905837.0,
|
|
"step": 12590
|
|
},
|
|
{
|
|
"entropy": 6.244672107696533,
|
|
"epoch": 1.4535487593768033,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004799594720956371,
|
|
"loss": 5.8252,
|
|
"mean_token_accuracy": 0.18755768984556198,
|
|
"num_tokens": 31917823.0,
|
|
"step": 12595
|
|
},
|
|
{
|
|
"entropy": 6.280782175064087,
|
|
"epoch": 1.454125793421812,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00047994244467873407,
|
|
"loss": 5.8977,
|
|
"mean_token_accuracy": 0.1816701665520668,
|
|
"num_tokens": 31931221.0,
|
|
"step": 12600
|
|
},
|
|
{
|
|
"entropy": 6.224785327911377,
|
|
"epoch": 1.4547028274668206,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00047992541036869364,
|
|
"loss": 5.8497,
|
|
"mean_token_accuracy": 0.18835566192865372,
|
|
"num_tokens": 31943739.0,
|
|
"step": 12605
|
|
},
|
|
{
|
|
"entropy": 6.2321693897247314,
|
|
"epoch": 1.4552798615118292,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004799083691660889,
|
|
"loss": 5.9111,
|
|
"mean_token_accuracy": 0.1834364727139473,
|
|
"num_tokens": 31957805.0,
|
|
"step": 12610
|
|
},
|
|
{
|
|
"entropy": 6.254454278945923,
|
|
"epoch": 1.4558568955568378,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004798913210714929,
|
|
"loss": 5.8623,
|
|
"mean_token_accuracy": 0.19286692887544632,
|
|
"num_tokens": 31970983.0,
|
|
"step": 12615
|
|
},
|
|
{
|
|
"entropy": 6.22641954421997,
|
|
"epoch": 1.4564339296018465,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00047987426608547915,
|
|
"loss": 5.8475,
|
|
"mean_token_accuracy": 0.19006728231906891,
|
|
"num_tokens": 31982985.0,
|
|
"step": 12620
|
|
},
|
|
{
|
|
"entropy": 6.202101469039917,
|
|
"epoch": 1.4570109636468551,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004798572042086212,
|
|
"loss": 5.8051,
|
|
"mean_token_accuracy": 0.18875966370105743,
|
|
"num_tokens": 31994854.0,
|
|
"step": 12625
|
|
},
|
|
{
|
|
"entropy": 6.293975305557251,
|
|
"epoch": 1.4575879976918638,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047984013544149286,
|
|
"loss": 5.9473,
|
|
"mean_token_accuracy": 0.178886578977108,
|
|
"num_tokens": 32007476.0,
|
|
"step": 12630
|
|
},
|
|
{
|
|
"entropy": 6.299429178237915,
|
|
"epoch": 1.4581650317368724,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00047982305978466836,
|
|
"loss": 5.8671,
|
|
"mean_token_accuracy": 0.19250797629356384,
|
|
"num_tokens": 32021417.0,
|
|
"step": 12635
|
|
},
|
|
{
|
|
"entropy": 6.179995727539063,
|
|
"epoch": 1.4587420657818813,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00047980597723872205,
|
|
"loss": 5.8372,
|
|
"mean_token_accuracy": 0.18427969366312028,
|
|
"num_tokens": 32033997.0,
|
|
"step": 12640
|
|
},
|
|
{
|
|
"entropy": 6.194073438644409,
|
|
"epoch": 1.4593190998268897,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004797888878042283,
|
|
"loss": 5.8245,
|
|
"mean_token_accuracy": 0.1968119978904724,
|
|
"num_tokens": 32046797.0,
|
|
"step": 12645
|
|
},
|
|
{
|
|
"entropy": 6.255892372131347,
|
|
"epoch": 1.4598961338718985,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00047977179148176217,
|
|
"loss": 5.8042,
|
|
"mean_token_accuracy": 0.19345609843730927,
|
|
"num_tokens": 32060797.0,
|
|
"step": 12650
|
|
},
|
|
{
|
|
"entropy": 6.2575019836425785,
|
|
"epoch": 1.4604731679169072,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004797546882718985,
|
|
"loss": 5.913,
|
|
"mean_token_accuracy": 0.18159203082323075,
|
|
"num_tokens": 32073936.0,
|
|
"step": 12655
|
|
},
|
|
{
|
|
"entropy": 6.197871112823487,
|
|
"epoch": 1.4610502019619158,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.00047973757817521256,
|
|
"loss": 5.7969,
|
|
"mean_token_accuracy": 0.1944518953561783,
|
|
"num_tokens": 32086730.0,
|
|
"step": 12660
|
|
},
|
|
{
|
|
"entropy": 6.288273477554322,
|
|
"epoch": 1.4616272360069245,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004797204611922799,
|
|
"loss": 5.888,
|
|
"mean_token_accuracy": 0.18709647357463838,
|
|
"num_tokens": 32099201.0,
|
|
"step": 12665
|
|
},
|
|
{
|
|
"entropy": 6.1809022426605225,
|
|
"epoch": 1.462204270051933,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047970333732367626,
|
|
"loss": 5.8571,
|
|
"mean_token_accuracy": 0.1861635446548462,
|
|
"num_tokens": 32112475.0,
|
|
"step": 12670
|
|
},
|
|
{
|
|
"entropy": 6.263620090484619,
|
|
"epoch": 1.4627813040969417,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00047968620656997754,
|
|
"loss": 5.8877,
|
|
"mean_token_accuracy": 0.1819758251309395,
|
|
"num_tokens": 32124411.0,
|
|
"step": 12675
|
|
},
|
|
{
|
|
"entropy": 6.225598430633545,
|
|
"epoch": 1.4633583381419504,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00047966906893175994,
|
|
"loss": 5.8729,
|
|
"mean_token_accuracy": 0.19142432063817977,
|
|
"num_tokens": 32136665.0,
|
|
"step": 12680
|
|
},
|
|
{
|
|
"entropy": 6.324308729171753,
|
|
"epoch": 1.463935372186959,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004796519244095998,
|
|
"loss": 5.8716,
|
|
"mean_token_accuracy": 0.1902136892080307,
|
|
"num_tokens": 32149546.0,
|
|
"step": 12685
|
|
},
|
|
{
|
|
"entropy": 6.188792324066162,
|
|
"epoch": 1.4645124062319677,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00047963477300407394,
|
|
"loss": 5.8044,
|
|
"mean_token_accuracy": 0.18858650773763658,
|
|
"num_tokens": 32161327.0,
|
|
"step": 12690
|
|
},
|
|
{
|
|
"entropy": 6.267832660675049,
|
|
"epoch": 1.4650894402769763,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00047961761471575903,
|
|
"loss": 5.808,
|
|
"mean_token_accuracy": 0.18862345516681672,
|
|
"num_tokens": 32173678.0,
|
|
"step": 12695
|
|
},
|
|
{
|
|
"entropy": 6.154121351242066,
|
|
"epoch": 1.465666474321985,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00047960044954523237,
|
|
"loss": 5.7554,
|
|
"mean_token_accuracy": 0.1918697848916054,
|
|
"num_tokens": 32186834.0,
|
|
"step": 12700
|
|
},
|
|
{
|
|
"entropy": 6.250173807144165,
|
|
"epoch": 1.4662435083669936,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00047958327749307117,
|
|
"loss": 5.8994,
|
|
"mean_token_accuracy": 0.18794130235910417,
|
|
"num_tokens": 32198876.0,
|
|
"step": 12705
|
|
},
|
|
{
|
|
"entropy": 6.236554574966431,
|
|
"epoch": 1.4668205424120022,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00047956609855985305,
|
|
"loss": 5.7503,
|
|
"mean_token_accuracy": 0.19117399752140046,
|
|
"num_tokens": 32212190.0,
|
|
"step": 12710
|
|
},
|
|
{
|
|
"entropy": 6.200174570083618,
|
|
"epoch": 1.467397576457011,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004795489127461559,
|
|
"loss": 5.7932,
|
|
"mean_token_accuracy": 0.19743801206350325,
|
|
"num_tokens": 32226129.0,
|
|
"step": 12715
|
|
},
|
|
{
|
|
"entropy": 6.19217324256897,
|
|
"epoch": 1.4679746105020195,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00047953172005255756,
|
|
"loss": 5.8725,
|
|
"mean_token_accuracy": 0.1850110799074173,
|
|
"num_tokens": 32240116.0,
|
|
"step": 12720
|
|
},
|
|
{
|
|
"entropy": 6.265895223617553,
|
|
"epoch": 1.4685516445470284,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004795145204796365,
|
|
"loss": 5.7838,
|
|
"mean_token_accuracy": 0.1934996247291565,
|
|
"num_tokens": 32252781.0,
|
|
"step": 12725
|
|
},
|
|
{
|
|
"entropy": 6.201068782806397,
|
|
"epoch": 1.469128678592037,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004794973140279711,
|
|
"loss": 5.7902,
|
|
"mean_token_accuracy": 0.192179936170578,
|
|
"num_tokens": 32265625.0,
|
|
"step": 12730
|
|
},
|
|
{
|
|
"entropy": 6.210565710067749,
|
|
"epoch": 1.4697057126370456,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00047948010069814005,
|
|
"loss": 5.8399,
|
|
"mean_token_accuracy": 0.19595302790403366,
|
|
"num_tokens": 32278942.0,
|
|
"step": 12735
|
|
},
|
|
{
|
|
"entropy": 6.247366428375244,
|
|
"epoch": 1.4702827466820543,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004794628804907225,
|
|
"loss": 5.8417,
|
|
"mean_token_accuracy": 0.19263463318347931,
|
|
"num_tokens": 32292085.0,
|
|
"step": 12740
|
|
},
|
|
{
|
|
"entropy": 6.258548021316528,
|
|
"epoch": 1.470859780727063,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00047944565340629755,
|
|
"loss": 5.882,
|
|
"mean_token_accuracy": 0.19039649814367293,
|
|
"num_tokens": 32303880.0,
|
|
"step": 12745
|
|
},
|
|
{
|
|
"entropy": 6.15313949584961,
|
|
"epoch": 1.4714368147720716,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00047942841944544453,
|
|
"loss": 5.7886,
|
|
"mean_token_accuracy": 0.1929144263267517,
|
|
"num_tokens": 32315711.0,
|
|
"step": 12750
|
|
},
|
|
{
|
|
"entropy": 6.289398336410523,
|
|
"epoch": 1.4720138488170802,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004794111786087431,
|
|
"loss": 5.8802,
|
|
"mean_token_accuracy": 0.18687772899866104,
|
|
"num_tokens": 32329344.0,
|
|
"step": 12755
|
|
},
|
|
{
|
|
"entropy": 6.329669618606568,
|
|
"epoch": 1.4725908828620888,
|
|
"grad_norm": 3.171875,
|
|
"learning_rate": 0.0004793939308967733,
|
|
"loss": 5.8453,
|
|
"mean_token_accuracy": 0.18983658850193025,
|
|
"num_tokens": 32343335.0,
|
|
"step": 12760
|
|
},
|
|
{
|
|
"entropy": 6.150098705291748,
|
|
"epoch": 1.4731679169070975,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004793766763101152,
|
|
"loss": 5.7208,
|
|
"mean_token_accuracy": 0.19836216270923615,
|
|
"num_tokens": 32357663.0,
|
|
"step": 12765
|
|
},
|
|
{
|
|
"entropy": 6.231173849105835,
|
|
"epoch": 1.4737449509521061,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047935941484934905,
|
|
"loss": 5.8432,
|
|
"mean_token_accuracy": 0.1936136767268181,
|
|
"num_tokens": 32369310.0,
|
|
"step": 12770
|
|
},
|
|
{
|
|
"entropy": 6.182768821716309,
|
|
"epoch": 1.4743219849971148,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00047934214651505547,
|
|
"loss": 5.8167,
|
|
"mean_token_accuracy": 0.19123019874095917,
|
|
"num_tokens": 32381478.0,
|
|
"step": 12775
|
|
},
|
|
{
|
|
"entropy": 6.159084224700928,
|
|
"epoch": 1.4748990190421236,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00047932487130781533,
|
|
"loss": 5.7626,
|
|
"mean_token_accuracy": 0.20197259783744811,
|
|
"num_tokens": 32394697.0,
|
|
"step": 12780
|
|
},
|
|
{
|
|
"entropy": 6.140364646911621,
|
|
"epoch": 1.475476053087132,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004793075892282097,
|
|
"loss": 5.7113,
|
|
"mean_token_accuracy": 0.1971853882074356,
|
|
"num_tokens": 32405456.0,
|
|
"step": 12785
|
|
},
|
|
{
|
|
"entropy": 6.184367847442627,
|
|
"epoch": 1.476053087132141,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004792903002768197,
|
|
"loss": 5.831,
|
|
"mean_token_accuracy": 0.18514325618743896,
|
|
"num_tokens": 32416772.0,
|
|
"step": 12790
|
|
},
|
|
{
|
|
"entropy": 6.148500156402588,
|
|
"epoch": 1.4766301211771495,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047927300445422687,
|
|
"loss": 5.7444,
|
|
"mean_token_accuracy": 0.19996704906225204,
|
|
"num_tokens": 32429319.0,
|
|
"step": 12795
|
|
},
|
|
{
|
|
"entropy": 6.150080442428589,
|
|
"epoch": 1.4772071552221582,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004792557017610131,
|
|
"loss": 5.7314,
|
|
"mean_token_accuracy": 0.20687794983386992,
|
|
"num_tokens": 32442017.0,
|
|
"step": 12800
|
|
},
|
|
{
|
|
"entropy": 6.148825454711914,
|
|
"epoch": 1.4777841892671668,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00047923839219776027,
|
|
"loss": 5.7583,
|
|
"mean_token_accuracy": 0.1933480203151703,
|
|
"num_tokens": 32454255.0,
|
|
"step": 12805
|
|
},
|
|
{
|
|
"entropy": 6.160013580322266,
|
|
"epoch": 1.4783612233121755,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004792210757650506,
|
|
"loss": 5.7797,
|
|
"mean_token_accuracy": 0.1943795472383499,
|
|
"num_tokens": 32465471.0,
|
|
"step": 12810
|
|
},
|
|
{
|
|
"entropy": 6.197701454162598,
|
|
"epoch": 1.478938257357184,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00047920375246346636,
|
|
"loss": 5.8182,
|
|
"mean_token_accuracy": 0.187069371342659,
|
|
"num_tokens": 32478271.0,
|
|
"step": 12815
|
|
},
|
|
{
|
|
"entropy": 6.247473955154419,
|
|
"epoch": 1.4795152914021927,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00047918642229359044,
|
|
"loss": 5.8331,
|
|
"mean_token_accuracy": 0.18895274102687837,
|
|
"num_tokens": 32490239.0,
|
|
"step": 12820
|
|
},
|
|
{
|
|
"entropy": 6.2366992950439455,
|
|
"epoch": 1.4800923254472014,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004791690852560056,
|
|
"loss": 5.8719,
|
|
"mean_token_accuracy": 0.18945563733577728,
|
|
"num_tokens": 32503511.0,
|
|
"step": 12825
|
|
},
|
|
{
|
|
"entropy": 6.193121337890625,
|
|
"epoch": 1.48066935949221,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.000479151741351295,
|
|
"loss": 5.8729,
|
|
"mean_token_accuracy": 0.1820230945944786,
|
|
"num_tokens": 32515652.0,
|
|
"step": 12830
|
|
},
|
|
{
|
|
"entropy": 6.272677850723267,
|
|
"epoch": 1.4812463935372187,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.000479134390580042,
|
|
"loss": 5.8576,
|
|
"mean_token_accuracy": 0.18222525715827942,
|
|
"num_tokens": 32527620.0,
|
|
"step": 12835
|
|
},
|
|
{
|
|
"entropy": 6.333395481109619,
|
|
"epoch": 1.4818234275822273,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047911703294283015,
|
|
"loss": 5.8595,
|
|
"mean_token_accuracy": 0.1895024448633194,
|
|
"num_tokens": 32540948.0,
|
|
"step": 12840
|
|
},
|
|
{
|
|
"entropy": 6.189630079269409,
|
|
"epoch": 1.482400461627236,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.00047909966844024334,
|
|
"loss": 5.8242,
|
|
"mean_token_accuracy": 0.19464778155088425,
|
|
"num_tokens": 32553311.0,
|
|
"step": 12845
|
|
},
|
|
{
|
|
"entropy": 6.1735701084136965,
|
|
"epoch": 1.4829774956722446,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00047908229707286547,
|
|
"loss": 5.7488,
|
|
"mean_token_accuracy": 0.1950527086853981,
|
|
"num_tokens": 32564639.0,
|
|
"step": 12850
|
|
},
|
|
{
|
|
"entropy": 6.22589693069458,
|
|
"epoch": 1.4835545297172534,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.000479064918841281,
|
|
"loss": 5.8654,
|
|
"mean_token_accuracy": 0.1862518757581711,
|
|
"num_tokens": 32577255.0,
|
|
"step": 12855
|
|
},
|
|
{
|
|
"entropy": 6.181830739974975,
|
|
"epoch": 1.4841315637622619,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00047904753374607427,
|
|
"loss": 5.8111,
|
|
"mean_token_accuracy": 0.19516809582710265,
|
|
"num_tokens": 32590201.0,
|
|
"step": 12860
|
|
},
|
|
{
|
|
"entropy": 6.255477809906006,
|
|
"epoch": 1.4847085978072707,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00047903014178783015,
|
|
"loss": 5.7877,
|
|
"mean_token_accuracy": 0.18771864622831344,
|
|
"num_tokens": 32603010.0,
|
|
"step": 12865
|
|
},
|
|
{
|
|
"entropy": 6.286900043487549,
|
|
"epoch": 1.4852856318522794,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004790127429671335,
|
|
"loss": 5.8502,
|
|
"mean_token_accuracy": 0.1860107198357582,
|
|
"num_tokens": 32614579.0,
|
|
"step": 12870
|
|
},
|
|
{
|
|
"entropy": 6.219177675247193,
|
|
"epoch": 1.485862665897288,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004789953372845697,
|
|
"loss": 5.7603,
|
|
"mean_token_accuracy": 0.1955152302980423,
|
|
"num_tokens": 32627696.0,
|
|
"step": 12875
|
|
},
|
|
{
|
|
"entropy": 6.239347314834594,
|
|
"epoch": 1.4864396999422966,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.000478977924740724,
|
|
"loss": 5.9017,
|
|
"mean_token_accuracy": 0.18081731498241424,
|
|
"num_tokens": 32640824.0,
|
|
"step": 12880
|
|
},
|
|
{
|
|
"entropy": 6.249517917633057,
|
|
"epoch": 1.4870167339873053,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004789605053361821,
|
|
"loss": 5.789,
|
|
"mean_token_accuracy": 0.19380044490098952,
|
|
"num_tokens": 32654373.0,
|
|
"step": 12885
|
|
},
|
|
{
|
|
"entropy": 6.3021715641021725,
|
|
"epoch": 1.487593768032314,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004789430790715299,
|
|
"loss": 5.9189,
|
|
"mean_token_accuracy": 0.182830311357975,
|
|
"num_tokens": 32667717.0,
|
|
"step": 12890
|
|
},
|
|
{
|
|
"entropy": 6.217434310913086,
|
|
"epoch": 1.4881708020773226,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00047892564594735355,
|
|
"loss": 5.8393,
|
|
"mean_token_accuracy": 0.18886099755764008,
|
|
"num_tokens": 32681529.0,
|
|
"step": 12895
|
|
},
|
|
{
|
|
"entropy": 6.300730133056641,
|
|
"epoch": 1.4887478361223312,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00047890820596423943,
|
|
"loss": 5.9136,
|
|
"mean_token_accuracy": 0.18771759420633316,
|
|
"num_tokens": 32694883.0,
|
|
"step": 12900
|
|
},
|
|
{
|
|
"entropy": 6.236034631729126,
|
|
"epoch": 1.4893248701673398,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.000478890759122774,
|
|
"loss": 5.7976,
|
|
"mean_token_accuracy": 0.19470180720090866,
|
|
"num_tokens": 32706908.0,
|
|
"step": 12905
|
|
},
|
|
{
|
|
"entropy": 6.279126119613648,
|
|
"epoch": 1.4899019042123485,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004788733054235443,
|
|
"loss": 5.8185,
|
|
"mean_token_accuracy": 0.18948618620634078,
|
|
"num_tokens": 32720057.0,
|
|
"step": 12910
|
|
},
|
|
{
|
|
"entropy": 6.199473190307617,
|
|
"epoch": 1.4904789382573571,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00047885584486713717,
|
|
"loss": 5.823,
|
|
"mean_token_accuracy": 0.19341208040714264,
|
|
"num_tokens": 32732200.0,
|
|
"step": 12915
|
|
},
|
|
{
|
|
"entropy": 6.187557029724121,
|
|
"epoch": 1.491055972302366,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004788383774541399,
|
|
"loss": 5.7755,
|
|
"mean_token_accuracy": 0.20056941658258437,
|
|
"num_tokens": 32745144.0,
|
|
"step": 12920
|
|
},
|
|
{
|
|
"entropy": 6.1955255508422855,
|
|
"epoch": 1.4916330063473744,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004788209031851402,
|
|
"loss": 5.8306,
|
|
"mean_token_accuracy": 0.19000527113676072,
|
|
"num_tokens": 32757495.0,
|
|
"step": 12925
|
|
},
|
|
{
|
|
"entropy": 6.109148597717285,
|
|
"epoch": 1.4922100403923833,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004788034220607256,
|
|
"loss": 5.7325,
|
|
"mean_token_accuracy": 0.1950483053922653,
|
|
"num_tokens": 32769562.0,
|
|
"step": 12930
|
|
},
|
|
{
|
|
"entropy": 6.2173021793365475,
|
|
"epoch": 1.4927870744373917,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00047878593408148405,
|
|
"loss": 5.7953,
|
|
"mean_token_accuracy": 0.19607421159744262,
|
|
"num_tokens": 32782234.0,
|
|
"step": 12935
|
|
},
|
|
{
|
|
"entropy": 6.2127049446105955,
|
|
"epoch": 1.4933641084824005,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00047876843924800393,
|
|
"loss": 5.8,
|
|
"mean_token_accuracy": 0.18992753624916076,
|
|
"num_tokens": 32795274.0,
|
|
"step": 12940
|
|
},
|
|
{
|
|
"entropy": 6.185367918014526,
|
|
"epoch": 1.4939411425274092,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004787509375608735,
|
|
"loss": 5.7714,
|
|
"mean_token_accuracy": 0.19010636657476426,
|
|
"num_tokens": 32808338.0,
|
|
"step": 12945
|
|
},
|
|
{
|
|
"entropy": 6.238684892654419,
|
|
"epoch": 1.4945181765724178,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00047873342902068157,
|
|
"loss": 5.8263,
|
|
"mean_token_accuracy": 0.18555284589529036,
|
|
"num_tokens": 32820204.0,
|
|
"step": 12950
|
|
},
|
|
{
|
|
"entropy": 6.266605186462402,
|
|
"epoch": 1.4950952106174265,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00047871591362801694,
|
|
"loss": 5.8544,
|
|
"mean_token_accuracy": 0.18671264350414277,
|
|
"num_tokens": 32832998.0,
|
|
"step": 12955
|
|
},
|
|
{
|
|
"entropy": 6.13381404876709,
|
|
"epoch": 1.495672244662435,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004786983913834687,
|
|
"loss": 5.8379,
|
|
"mean_token_accuracy": 0.188638374209404,
|
|
"num_tokens": 32845484.0,
|
|
"step": 12960
|
|
},
|
|
{
|
|
"entropy": 6.316340970993042,
|
|
"epoch": 1.4962492787074437,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00047868086228762633,
|
|
"loss": 5.9324,
|
|
"mean_token_accuracy": 0.18515325337648392,
|
|
"num_tokens": 32857718.0,
|
|
"step": 12965
|
|
},
|
|
{
|
|
"entropy": 6.281667041778564,
|
|
"epoch": 1.4968263127524524,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00047866332634107926,
|
|
"loss": 5.8123,
|
|
"mean_token_accuracy": 0.19124829024076462,
|
|
"num_tokens": 32869908.0,
|
|
"step": 12970
|
|
},
|
|
{
|
|
"entropy": 6.1783287525177,
|
|
"epoch": 1.497403346797461,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00047864578354441743,
|
|
"loss": 5.8322,
|
|
"mean_token_accuracy": 0.19004736691713334,
|
|
"num_tokens": 32882549.0,
|
|
"step": 12975
|
|
},
|
|
{
|
|
"entropy": 6.186053657531739,
|
|
"epoch": 1.4979803808424696,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004786282338982308,
|
|
"loss": 5.773,
|
|
"mean_token_accuracy": 0.1942482754588127,
|
|
"num_tokens": 32894587.0,
|
|
"step": 12980
|
|
},
|
|
{
|
|
"entropy": 6.266414165496826,
|
|
"epoch": 1.4985574148874783,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004786106774031096,
|
|
"loss": 5.8358,
|
|
"mean_token_accuracy": 0.1882964327931404,
|
|
"num_tokens": 32907001.0,
|
|
"step": 12985
|
|
},
|
|
{
|
|
"entropy": 6.235092544555664,
|
|
"epoch": 1.499134448932487,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004785931140596445,
|
|
"loss": 5.8035,
|
|
"mean_token_accuracy": 0.19003380984067916,
|
|
"num_tokens": 32919498.0,
|
|
"step": 12990
|
|
},
|
|
{
|
|
"entropy": 6.293325567245484,
|
|
"epoch": 1.4997114829774958,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047857554386842606,
|
|
"loss": 5.9188,
|
|
"mean_token_accuracy": 0.18067218661308287,
|
|
"num_tokens": 32932611.0,
|
|
"step": 12995
|
|
},
|
|
{
|
|
"entropy": 6.19683198928833,
|
|
"epoch": 1.5002885170225042,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00047855796683004534,
|
|
"loss": 5.7998,
|
|
"mean_token_accuracy": 0.18689163625240326,
|
|
"num_tokens": 32944845.0,
|
|
"step": 13000
|
|
},
|
|
{
|
|
"entropy": 6.271070766448974,
|
|
"epoch": 1.500865551067513,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00047854038294509356,
|
|
"loss": 5.8457,
|
|
"mean_token_accuracy": 0.17760048061609268,
|
|
"num_tokens": 32958076.0,
|
|
"step": 13005
|
|
},
|
|
{
|
|
"entropy": 6.289440774917603,
|
|
"epoch": 1.5014425851125215,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004785227922141621,
|
|
"loss": 5.8597,
|
|
"mean_token_accuracy": 0.19118052423000337,
|
|
"num_tokens": 32968984.0,
|
|
"step": 13010
|
|
},
|
|
{
|
|
"entropy": 6.310905838012696,
|
|
"epoch": 1.5020196191575304,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00047850519463784263,
|
|
"loss": 5.9457,
|
|
"mean_token_accuracy": 0.1839376851916313,
|
|
"num_tokens": 32981488.0,
|
|
"step": 13015
|
|
},
|
|
{
|
|
"entropy": 6.229884433746338,
|
|
"epoch": 1.502596653202539,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00047848759021672693,
|
|
"loss": 5.8199,
|
|
"mean_token_accuracy": 0.19131330102682115,
|
|
"num_tokens": 32994156.0,
|
|
"step": 13020
|
|
},
|
|
{
|
|
"entropy": 6.235915327072144,
|
|
"epoch": 1.5031736872475476,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004784699789514073,
|
|
"loss": 5.8013,
|
|
"mean_token_accuracy": 0.18914027214050294,
|
|
"num_tokens": 33007135.0,
|
|
"step": 13025
|
|
},
|
|
{
|
|
"entropy": 6.28277621269226,
|
|
"epoch": 1.5037507212925563,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.000478452360842476,
|
|
"loss": 5.9116,
|
|
"mean_token_accuracy": 0.18403880894184113,
|
|
"num_tokens": 33021259.0,
|
|
"step": 13030
|
|
},
|
|
{
|
|
"entropy": 6.236955165863037,
|
|
"epoch": 1.504327755337565,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00047843473589052557,
|
|
"loss": 5.84,
|
|
"mean_token_accuracy": 0.18680391758680343,
|
|
"num_tokens": 33033690.0,
|
|
"step": 13035
|
|
},
|
|
{
|
|
"entropy": 6.26040506362915,
|
|
"epoch": 1.5049047893825735,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00047841710409614893,
|
|
"loss": 5.823,
|
|
"mean_token_accuracy": 0.1852077528834343,
|
|
"num_tokens": 33045744.0,
|
|
"step": 13040
|
|
},
|
|
{
|
|
"entropy": 6.271863794326782,
|
|
"epoch": 1.5054818234275822,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004783994654599389,
|
|
"loss": 5.8906,
|
|
"mean_token_accuracy": 0.17971572130918503,
|
|
"num_tokens": 33058307.0,
|
|
"step": 13045
|
|
},
|
|
{
|
|
"entropy": 6.303907442092895,
|
|
"epoch": 1.5060588574725908,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00047838181998248897,
|
|
"loss": 5.9115,
|
|
"mean_token_accuracy": 0.181523796916008,
|
|
"num_tokens": 33073622.0,
|
|
"step": 13050
|
|
},
|
|
{
|
|
"entropy": 6.216773843765258,
|
|
"epoch": 1.5066358915175995,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004783641676643925,
|
|
"loss": 5.7545,
|
|
"mean_token_accuracy": 0.19235570430755616,
|
|
"num_tokens": 33087286.0,
|
|
"step": 13055
|
|
},
|
|
{
|
|
"entropy": 6.204124641418457,
|
|
"epoch": 1.5072129255626083,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.00047834650850624334,
|
|
"loss": 5.8409,
|
|
"mean_token_accuracy": 0.19425424188375473,
|
|
"num_tokens": 33100333.0,
|
|
"step": 13060
|
|
},
|
|
{
|
|
"entropy": 6.163000631332397,
|
|
"epoch": 1.5077899596076167,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004783288425086353,
|
|
"loss": 5.8379,
|
|
"mean_token_accuracy": 0.18831825852394105,
|
|
"num_tokens": 33111318.0,
|
|
"step": 13065
|
|
},
|
|
{
|
|
"entropy": 6.296581697463989,
|
|
"epoch": 1.5083669936526256,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004783111696721627,
|
|
"loss": 5.9124,
|
|
"mean_token_accuracy": 0.1840219795703888,
|
|
"num_tokens": 33123766.0,
|
|
"step": 13070
|
|
},
|
|
{
|
|
"entropy": 6.241482782363891,
|
|
"epoch": 1.508944027697634,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004782934899974199,
|
|
"loss": 5.7843,
|
|
"mean_token_accuracy": 0.19748201221227646,
|
|
"num_tokens": 33136042.0,
|
|
"step": 13075
|
|
},
|
|
{
|
|
"entropy": 6.191297292709351,
|
|
"epoch": 1.5095210617426429,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00047827580348500147,
|
|
"loss": 5.7749,
|
|
"mean_token_accuracy": 0.19063863754272461,
|
|
"num_tokens": 33148451.0,
|
|
"step": 13080
|
|
},
|
|
{
|
|
"entropy": 6.206788158416748,
|
|
"epoch": 1.5100980957876513,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00047825811013550246,
|
|
"loss": 5.8011,
|
|
"mean_token_accuracy": 0.19754028767347337,
|
|
"num_tokens": 33161886.0,
|
|
"step": 13085
|
|
},
|
|
{
|
|
"entropy": 6.217094087600708,
|
|
"epoch": 1.5106751298326602,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00047824040994951786,
|
|
"loss": 5.8841,
|
|
"mean_token_accuracy": 0.19206815510988234,
|
|
"num_tokens": 33174812.0,
|
|
"step": 13090
|
|
},
|
|
{
|
|
"entropy": 6.256129360198974,
|
|
"epoch": 1.5112521638776688,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004782227029276429,
|
|
"loss": 5.8011,
|
|
"mean_token_accuracy": 0.1992778956890106,
|
|
"num_tokens": 33187389.0,
|
|
"step": 13095
|
|
},
|
|
{
|
|
"entropy": 6.154243993759155,
|
|
"epoch": 1.5118291979226774,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00047820498907047345,
|
|
"loss": 5.7544,
|
|
"mean_token_accuracy": 0.19293652325868607,
|
|
"num_tokens": 33200106.0,
|
|
"step": 13100
|
|
},
|
|
{
|
|
"entropy": 6.208034801483154,
|
|
"epoch": 1.512406231967686,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.000478187268378605,
|
|
"loss": 5.7489,
|
|
"mean_token_accuracy": 0.19893669188022614,
|
|
"num_tokens": 33212929.0,
|
|
"step": 13105
|
|
},
|
|
{
|
|
"entropy": 6.18809814453125,
|
|
"epoch": 1.5129832660126947,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00047816954085263375,
|
|
"loss": 5.8521,
|
|
"mean_token_accuracy": 0.19083169847726822,
|
|
"num_tokens": 33226068.0,
|
|
"step": 13110
|
|
},
|
|
{
|
|
"entropy": 6.156454467773438,
|
|
"epoch": 1.5135603000577034,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004781518064931559,
|
|
"loss": 5.7753,
|
|
"mean_token_accuracy": 0.19173873215913773,
|
|
"num_tokens": 33237677.0,
|
|
"step": 13115
|
|
},
|
|
{
|
|
"entropy": 6.252213764190674,
|
|
"epoch": 1.514137334102712,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.000478134065300768,
|
|
"loss": 5.8582,
|
|
"mean_token_accuracy": 0.1917392447590828,
|
|
"num_tokens": 33250640.0,
|
|
"step": 13120
|
|
},
|
|
{
|
|
"entropy": 6.208042573928833,
|
|
"epoch": 1.5147143681477209,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004781163172760667,
|
|
"loss": 5.785,
|
|
"mean_token_accuracy": 0.1916109725832939,
|
|
"num_tokens": 33262899.0,
|
|
"step": 13125
|
|
},
|
|
{
|
|
"entropy": 6.271803617477417,
|
|
"epoch": 1.5152914021927293,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00047809856241964893,
|
|
"loss": 5.8185,
|
|
"mean_token_accuracy": 0.19186412245035173,
|
|
"num_tokens": 33275073.0,
|
|
"step": 13130
|
|
},
|
|
{
|
|
"entropy": 6.194020318984985,
|
|
"epoch": 1.5158684362377381,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004780808007321119,
|
|
"loss": 5.8097,
|
|
"mean_token_accuracy": 0.18588352501392363,
|
|
"num_tokens": 33286285.0,
|
|
"step": 13135
|
|
},
|
|
{
|
|
"entropy": 6.280729103088379,
|
|
"epoch": 1.5164454702827466,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004780630322140531,
|
|
"loss": 5.8053,
|
|
"mean_token_accuracy": 0.19529957920312882,
|
|
"num_tokens": 33297745.0,
|
|
"step": 13140
|
|
},
|
|
{
|
|
"entropy": 6.28461332321167,
|
|
"epoch": 1.5170225043277554,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00047804525686607,
|
|
"loss": 5.862,
|
|
"mean_token_accuracy": 0.17993441820144654,
|
|
"num_tokens": 33309463.0,
|
|
"step": 13145
|
|
},
|
|
{
|
|
"entropy": 6.230080080032349,
|
|
"epoch": 1.5175995383727638,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004780274746887606,
|
|
"loss": 5.8296,
|
|
"mean_token_accuracy": 0.18709089905023574,
|
|
"num_tokens": 33322352.0,
|
|
"step": 13150
|
|
},
|
|
{
|
|
"entropy": 6.254903411865234,
|
|
"epoch": 1.5181765724177727,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00047800968568272284,
|
|
"loss": 5.8897,
|
|
"mean_token_accuracy": 0.1886549025774002,
|
|
"num_tokens": 33336051.0,
|
|
"step": 13155
|
|
},
|
|
{
|
|
"entropy": 6.218223762512207,
|
|
"epoch": 1.5187536064627813,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004779918898485551,
|
|
"loss": 5.8053,
|
|
"mean_token_accuracy": 0.18849124908447265,
|
|
"num_tokens": 33350321.0,
|
|
"step": 13160
|
|
},
|
|
{
|
|
"entropy": 6.225475931167603,
|
|
"epoch": 1.51933064050779,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.00047797408718685614,
|
|
"loss": 5.7767,
|
|
"mean_token_accuracy": 0.19050310999155046,
|
|
"num_tokens": 33363637.0,
|
|
"step": 13165
|
|
},
|
|
{
|
|
"entropy": 6.214481449127197,
|
|
"epoch": 1.5199076745527986,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047795627769822447,
|
|
"loss": 5.7798,
|
|
"mean_token_accuracy": 0.19742291122674943,
|
|
"num_tokens": 33376257.0,
|
|
"step": 13170
|
|
},
|
|
{
|
|
"entropy": 6.135192155838013,
|
|
"epoch": 1.5204847085978073,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00047793846138325925,
|
|
"loss": 5.7453,
|
|
"mean_token_accuracy": 0.1947900339961052,
|
|
"num_tokens": 33388812.0,
|
|
"step": 13175
|
|
},
|
|
{
|
|
"entropy": 6.2147955894470215,
|
|
"epoch": 1.521061742642816,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004779206382425598,
|
|
"loss": 5.8117,
|
|
"mean_token_accuracy": 0.1930110424757004,
|
|
"num_tokens": 33401141.0,
|
|
"step": 13180
|
|
},
|
|
{
|
|
"entropy": 6.252952575683594,
|
|
"epoch": 1.5216387766878245,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004779028082767253,
|
|
"loss": 5.8197,
|
|
"mean_token_accuracy": 0.19050996899604797,
|
|
"num_tokens": 33412821.0,
|
|
"step": 13185
|
|
},
|
|
{
|
|
"entropy": 6.212389230728149,
|
|
"epoch": 1.5222158107328332,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004778849714863557,
|
|
"loss": 5.8589,
|
|
"mean_token_accuracy": 0.183637772500515,
|
|
"num_tokens": 33424709.0,
|
|
"step": 13190
|
|
},
|
|
{
|
|
"entropy": 6.235611343383789,
|
|
"epoch": 1.5227928447778418,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004778671278720508,
|
|
"loss": 5.8681,
|
|
"mean_token_accuracy": 0.186078442633152,
|
|
"num_tokens": 33437069.0,
|
|
"step": 13195
|
|
},
|
|
{
|
|
"entropy": 6.228446388244629,
|
|
"epoch": 1.5233698788228507,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004778492774344109,
|
|
"loss": 5.7122,
|
|
"mean_token_accuracy": 0.19611677676439285,
|
|
"num_tokens": 33449441.0,
|
|
"step": 13200
|
|
},
|
|
{
|
|
"entropy": 6.274533605575561,
|
|
"epoch": 1.523946912867859,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004778314201740363,
|
|
"loss": 5.8927,
|
|
"mean_token_accuracy": 0.1851292923092842,
|
|
"num_tokens": 33463184.0,
|
|
"step": 13205
|
|
},
|
|
{
|
|
"entropy": 6.205833292007446,
|
|
"epoch": 1.524523946912868,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00047781355609152764,
|
|
"loss": 5.7542,
|
|
"mean_token_accuracy": 0.19649343192577362,
|
|
"num_tokens": 33476118.0,
|
|
"step": 13210
|
|
},
|
|
{
|
|
"entropy": 6.192588806152344,
|
|
"epoch": 1.5251009809578764,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004777956851874858,
|
|
"loss": 5.7489,
|
|
"mean_token_accuracy": 0.1931898131966591,
|
|
"num_tokens": 33487575.0,
|
|
"step": 13215
|
|
},
|
|
{
|
|
"entropy": 6.272642326354981,
|
|
"epoch": 1.5256780150028852,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00047777780746251176,
|
|
"loss": 5.8292,
|
|
"mean_token_accuracy": 0.18742457628250123,
|
|
"num_tokens": 33499507.0,
|
|
"step": 13220
|
|
},
|
|
{
|
|
"entropy": 6.195057535171509,
|
|
"epoch": 1.5262550490478937,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00047775992291720687,
|
|
"loss": 5.8102,
|
|
"mean_token_accuracy": 0.19332896620035173,
|
|
"num_tokens": 33513818.0,
|
|
"step": 13225
|
|
},
|
|
{
|
|
"entropy": 6.250328063964844,
|
|
"epoch": 1.5268320830929025,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004777420315521728,
|
|
"loss": 5.8313,
|
|
"mean_token_accuracy": 0.186712084710598,
|
|
"num_tokens": 33525762.0,
|
|
"step": 13230
|
|
},
|
|
{
|
|
"entropy": 6.17367377281189,
|
|
"epoch": 1.5274091171379112,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004777241333680111,
|
|
"loss": 5.7218,
|
|
"mean_token_accuracy": 0.198297181725502,
|
|
"num_tokens": 33537469.0,
|
|
"step": 13235
|
|
},
|
|
{
|
|
"entropy": 6.186795091629028,
|
|
"epoch": 1.5279861511829198,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004777062283653239,
|
|
"loss": 5.8291,
|
|
"mean_token_accuracy": 0.19145113229751587,
|
|
"num_tokens": 33550226.0,
|
|
"step": 13240
|
|
},
|
|
{
|
|
"entropy": 6.280914831161499,
|
|
"epoch": 1.5285631852279284,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047768831654471333,
|
|
"loss": 5.8919,
|
|
"mean_token_accuracy": 0.18494420349597931,
|
|
"num_tokens": 33564164.0,
|
|
"step": 13245
|
|
},
|
|
{
|
|
"entropy": 6.200793647766114,
|
|
"epoch": 1.529140219272937,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00047767039790678204,
|
|
"loss": 5.7056,
|
|
"mean_token_accuracy": 0.19484343230724335,
|
|
"num_tokens": 33576295.0,
|
|
"step": 13250
|
|
},
|
|
{
|
|
"entropy": 6.15148024559021,
|
|
"epoch": 1.5297172533179457,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00047765247245213255,
|
|
"loss": 5.708,
|
|
"mean_token_accuracy": 0.20231665521860123,
|
|
"num_tokens": 33587950.0,
|
|
"step": 13255
|
|
},
|
|
{
|
|
"entropy": 6.191800355911255,
|
|
"epoch": 1.5302942873629544,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004776345401813678,
|
|
"loss": 5.8057,
|
|
"mean_token_accuracy": 0.19851236641407013,
|
|
"num_tokens": 33600201.0,
|
|
"step": 13260
|
|
},
|
|
{
|
|
"entropy": 6.243471622467041,
|
|
"epoch": 1.5308713214079632,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00047761660109509095,
|
|
"loss": 5.8596,
|
|
"mean_token_accuracy": 0.19617122262716294,
|
|
"num_tokens": 33612355.0,
|
|
"step": 13265
|
|
},
|
|
{
|
|
"entropy": 6.280506610870361,
|
|
"epoch": 1.5314483554529716,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004775986551939054,
|
|
"loss": 5.8599,
|
|
"mean_token_accuracy": 0.18742733150720597,
|
|
"num_tokens": 33626322.0,
|
|
"step": 13270
|
|
},
|
|
{
|
|
"entropy": 6.191336297988892,
|
|
"epoch": 1.5320253894979805,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00047758070247841465,
|
|
"loss": 5.7776,
|
|
"mean_token_accuracy": 0.19153404384851455,
|
|
"num_tokens": 33638433.0,
|
|
"step": 13275
|
|
},
|
|
{
|
|
"entropy": 6.221687507629395,
|
|
"epoch": 1.532602423542989,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00047756274294922266,
|
|
"loss": 5.8007,
|
|
"mean_token_accuracy": 0.1957632526755333,
|
|
"num_tokens": 33651743.0,
|
|
"step": 13280
|
|
},
|
|
{
|
|
"entropy": 6.283531665802002,
|
|
"epoch": 1.5331794575879978,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004775447766069334,
|
|
"loss": 5.8932,
|
|
"mean_token_accuracy": 0.1905313104391098,
|
|
"num_tokens": 33663546.0,
|
|
"step": 13285
|
|
},
|
|
{
|
|
"entropy": 6.255209875106812,
|
|
"epoch": 1.5337564916330062,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00047752680345215115,
|
|
"loss": 5.8374,
|
|
"mean_token_accuracy": 0.18721415102481842,
|
|
"num_tokens": 33675358.0,
|
|
"step": 13290
|
|
},
|
|
{
|
|
"entropy": 6.268837118148804,
|
|
"epoch": 1.534333525678015,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004775088234854805,
|
|
"loss": 5.7914,
|
|
"mean_token_accuracy": 0.18973737806081772,
|
|
"num_tokens": 33688066.0,
|
|
"step": 13295
|
|
},
|
|
{
|
|
"entropy": 6.1976690769195555,
|
|
"epoch": 1.5349105597230237,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004774908367075262,
|
|
"loss": 5.8236,
|
|
"mean_token_accuracy": 0.19111677557229995,
|
|
"num_tokens": 33700829.0,
|
|
"step": 13300
|
|
},
|
|
{
|
|
"entropy": 6.174250936508178,
|
|
"epoch": 1.5354875937680323,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004774728431188931,
|
|
"loss": 5.7823,
|
|
"mean_token_accuracy": 0.18667507469654082,
|
|
"num_tokens": 33714049.0,
|
|
"step": 13305
|
|
},
|
|
{
|
|
"entropy": 6.153797626495361,
|
|
"epoch": 1.536064627813041,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00047745484272018664,
|
|
"loss": 5.7376,
|
|
"mean_token_accuracy": 0.1966078385710716,
|
|
"num_tokens": 33727026.0,
|
|
"step": 13310
|
|
},
|
|
{
|
|
"entropy": 6.212672233581543,
|
|
"epoch": 1.5366416618580496,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004774368355120119,
|
|
"loss": 5.7338,
|
|
"mean_token_accuracy": 0.20255094915628433,
|
|
"num_tokens": 33740400.0,
|
|
"step": 13315
|
|
},
|
|
{
|
|
"entropy": 6.047137498855591,
|
|
"epoch": 1.5372186959030583,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.000477418821494975,
|
|
"loss": 5.6107,
|
|
"mean_token_accuracy": 0.20713855773210527,
|
|
"num_tokens": 33753621.0,
|
|
"step": 13320
|
|
},
|
|
{
|
|
"entropy": 6.251862668991089,
|
|
"epoch": 1.537795729948067,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004774008006696814,
|
|
"loss": 5.8651,
|
|
"mean_token_accuracy": 0.18378251641988755,
|
|
"num_tokens": 33765458.0,
|
|
"step": 13325
|
|
},
|
|
{
|
|
"entropy": 6.323590993881226,
|
|
"epoch": 1.5383727639930755,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004773827730367375,
|
|
"loss": 5.8993,
|
|
"mean_token_accuracy": 0.1841868206858635,
|
|
"num_tokens": 33777264.0,
|
|
"step": 13330
|
|
},
|
|
{
|
|
"entropy": 6.242207384109497,
|
|
"epoch": 1.5389497980380842,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047736473859674955,
|
|
"loss": 5.8134,
|
|
"mean_token_accuracy": 0.1927764505147934,
|
|
"num_tokens": 33789837.0,
|
|
"step": 13335
|
|
},
|
|
{
|
|
"entropy": 6.089216327667236,
|
|
"epoch": 1.539526832083093,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00047734669735032404,
|
|
"loss": 5.7171,
|
|
"mean_token_accuracy": 0.19926753938198088,
|
|
"num_tokens": 33801666.0,
|
|
"step": 13340
|
|
},
|
|
{
|
|
"entropy": 6.197734022140503,
|
|
"epoch": 1.5401038661281015,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00047732864929806796,
|
|
"loss": 5.8392,
|
|
"mean_token_accuracy": 0.1812909036874771,
|
|
"num_tokens": 33813909.0,
|
|
"step": 13345
|
|
},
|
|
{
|
|
"entropy": 6.198130559921265,
|
|
"epoch": 1.5406809001731103,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004773105944405883,
|
|
"loss": 5.8364,
|
|
"mean_token_accuracy": 0.19269849210977555,
|
|
"num_tokens": 33827081.0,
|
|
"step": 13350
|
|
},
|
|
{
|
|
"entropy": 6.183778619766235,
|
|
"epoch": 1.5412579342181187,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00047729253277849226,
|
|
"loss": 5.7523,
|
|
"mean_token_accuracy": 0.1987853080034256,
|
|
"num_tokens": 33838261.0,
|
|
"step": 13355
|
|
},
|
|
{
|
|
"entropy": 6.254490613937378,
|
|
"epoch": 1.5418349682631276,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00047727446431238734,
|
|
"loss": 5.9129,
|
|
"mean_token_accuracy": 0.18299975246191025,
|
|
"num_tokens": 33850189.0,
|
|
"step": 13360
|
|
},
|
|
{
|
|
"entropy": 6.303029108047485,
|
|
"epoch": 1.542412002308136,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004772563890428813,
|
|
"loss": 5.8937,
|
|
"mean_token_accuracy": 0.18921637237071992,
|
|
"num_tokens": 33863570.0,
|
|
"step": 13365
|
|
},
|
|
{
|
|
"entropy": 6.217037868499756,
|
|
"epoch": 1.5429890363531449,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004772383069705821,
|
|
"loss": 5.8257,
|
|
"mean_token_accuracy": 0.18908795416355134,
|
|
"num_tokens": 33876583.0,
|
|
"step": 13370
|
|
},
|
|
{
|
|
"entropy": 6.289787244796753,
|
|
"epoch": 1.5435660703981535,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004772202180960978,
|
|
"loss": 5.8502,
|
|
"mean_token_accuracy": 0.1855199694633484,
|
|
"num_tokens": 33889744.0,
|
|
"step": 13375
|
|
},
|
|
{
|
|
"entropy": 6.285410022735595,
|
|
"epoch": 1.5441431044431622,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00047720212242003703,
|
|
"loss": 5.8729,
|
|
"mean_token_accuracy": 0.19419652074575425,
|
|
"num_tokens": 33904129.0,
|
|
"step": 13380
|
|
},
|
|
{
|
|
"entropy": 6.162698411941529,
|
|
"epoch": 1.5447201384881708,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047718401994300825,
|
|
"loss": 5.7692,
|
|
"mean_token_accuracy": 0.19252093583345414,
|
|
"num_tokens": 33916277.0,
|
|
"step": 13385
|
|
},
|
|
{
|
|
"entropy": 6.2117432117462155,
|
|
"epoch": 1.5452971725331794,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00047716591066562043,
|
|
"loss": 5.8584,
|
|
"mean_token_accuracy": 0.188547345995903,
|
|
"num_tokens": 33929434.0,
|
|
"step": 13390
|
|
},
|
|
{
|
|
"entropy": 6.270015859603882,
|
|
"epoch": 1.545874206578188,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00047714779458848255,
|
|
"loss": 5.8328,
|
|
"mean_token_accuracy": 0.18586413711309432,
|
|
"num_tokens": 33942376.0,
|
|
"step": 13395
|
|
},
|
|
{
|
|
"entropy": 6.264356374740601,
|
|
"epoch": 1.5464512406231967,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004771296717122041,
|
|
"loss": 5.8404,
|
|
"mean_token_accuracy": 0.19098608046770096,
|
|
"num_tokens": 33955013.0,
|
|
"step": 13400
|
|
},
|
|
{
|
|
"entropy": 6.240370368957519,
|
|
"epoch": 1.5470282746682056,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004771115420373945,
|
|
"loss": 5.8445,
|
|
"mean_token_accuracy": 0.1863965794444084,
|
|
"num_tokens": 33966673.0,
|
|
"step": 13405
|
|
},
|
|
{
|
|
"entropy": 6.177231168746948,
|
|
"epoch": 1.547605308713214,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00047709340556466366,
|
|
"loss": 5.769,
|
|
"mean_token_accuracy": 0.1987849310040474,
|
|
"num_tokens": 33978400.0,
|
|
"step": 13410
|
|
},
|
|
{
|
|
"entropy": 6.298257875442505,
|
|
"epoch": 1.5481823427582229,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00047707526229462144,
|
|
"loss": 5.9266,
|
|
"mean_token_accuracy": 0.18126586228609085,
|
|
"num_tokens": 33990690.0,
|
|
"step": 13415
|
|
},
|
|
{
|
|
"entropy": 6.25822606086731,
|
|
"epoch": 1.5487593768032313,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00047705711222787816,
|
|
"loss": 5.8267,
|
|
"mean_token_accuracy": 0.1906663656234741,
|
|
"num_tokens": 34003992.0,
|
|
"step": 13420
|
|
},
|
|
{
|
|
"entropy": 6.256418752670288,
|
|
"epoch": 1.5493364108482401,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00047703895536504423,
|
|
"loss": 5.8242,
|
|
"mean_token_accuracy": 0.18806500285863875,
|
|
"num_tokens": 34016075.0,
|
|
"step": 13425
|
|
},
|
|
{
|
|
"entropy": 6.231338977813721,
|
|
"epoch": 1.5499134448932486,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004770207917067305,
|
|
"loss": 5.7882,
|
|
"mean_token_accuracy": 0.18892282098531724,
|
|
"num_tokens": 34029143.0,
|
|
"step": 13430
|
|
},
|
|
{
|
|
"entropy": 6.201420450210572,
|
|
"epoch": 1.5504904789382574,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047700262125354765,
|
|
"loss": 5.8749,
|
|
"mean_token_accuracy": 0.19344826638698578,
|
|
"num_tokens": 34041269.0,
|
|
"step": 13435
|
|
},
|
|
{
|
|
"entropy": 6.238750314712524,
|
|
"epoch": 1.551067512983266,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047698444400610707,
|
|
"loss": 5.8859,
|
|
"mean_token_accuracy": 0.18998730182647705,
|
|
"num_tokens": 34054561.0,
|
|
"step": 13440
|
|
},
|
|
{
|
|
"entropy": 6.205687665939331,
|
|
"epoch": 1.5516445470282747,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047696625996502,
|
|
"loss": 5.7521,
|
|
"mean_token_accuracy": 0.1924416869878769,
|
|
"num_tokens": 34068009.0,
|
|
"step": 13445
|
|
},
|
|
{
|
|
"entropy": 6.221275329589844,
|
|
"epoch": 1.5522215810732833,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00047694806913089815,
|
|
"loss": 5.891,
|
|
"mean_token_accuracy": 0.1905246526002884,
|
|
"num_tokens": 34081217.0,
|
|
"step": 13450
|
|
},
|
|
{
|
|
"entropy": 6.277045774459839,
|
|
"epoch": 1.552798615118292,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004769298715043533,
|
|
"loss": 5.8023,
|
|
"mean_token_accuracy": 0.18520487993955612,
|
|
"num_tokens": 34093903.0,
|
|
"step": 13455
|
|
},
|
|
{
|
|
"entropy": 6.28056845664978,
|
|
"epoch": 1.5533756491633006,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004769116670859975,
|
|
"loss": 5.8674,
|
|
"mean_token_accuracy": 0.18978661596775054,
|
|
"num_tokens": 34105891.0,
|
|
"step": 13460
|
|
},
|
|
{
|
|
"entropy": 6.244111442565918,
|
|
"epoch": 1.5539526832083093,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00047689345587644314,
|
|
"loss": 5.8749,
|
|
"mean_token_accuracy": 0.19215874820947648,
|
|
"num_tokens": 34118438.0,
|
|
"step": 13465
|
|
},
|
|
{
|
|
"entropy": 6.191610431671142,
|
|
"epoch": 1.554529717253318,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00047687523787630256,
|
|
"loss": 5.736,
|
|
"mean_token_accuracy": 0.19659065455198288,
|
|
"num_tokens": 34130383.0,
|
|
"step": 13470
|
|
},
|
|
{
|
|
"entropy": 6.189245986938476,
|
|
"epoch": 1.5551067512983265,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004768570130861887,
|
|
"loss": 5.8577,
|
|
"mean_token_accuracy": 0.19298865050077438,
|
|
"num_tokens": 34143805.0,
|
|
"step": 13475
|
|
},
|
|
{
|
|
"entropy": 6.23731164932251,
|
|
"epoch": 1.5556837853433354,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004768387815067144,
|
|
"loss": 5.7135,
|
|
"mean_token_accuracy": 0.20021907836198807,
|
|
"num_tokens": 34157053.0,
|
|
"step": 13480
|
|
},
|
|
{
|
|
"entropy": 6.2790198802948,
|
|
"epoch": 1.5562608193883438,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00047682054313849304,
|
|
"loss": 5.8953,
|
|
"mean_token_accuracy": 0.1879524365067482,
|
|
"num_tokens": 34168804.0,
|
|
"step": 13485
|
|
},
|
|
{
|
|
"entropy": 6.2272436141967775,
|
|
"epoch": 1.5568378534333527,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004768022979821379,
|
|
"loss": 5.9036,
|
|
"mean_token_accuracy": 0.18060447722673417,
|
|
"num_tokens": 34181201.0,
|
|
"step": 13490
|
|
},
|
|
{
|
|
"entropy": 6.2782214164733885,
|
|
"epoch": 1.557414887478361,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004767840460382628,
|
|
"loss": 5.8846,
|
|
"mean_token_accuracy": 0.18991439938545226,
|
|
"num_tokens": 34193906.0,
|
|
"step": 13495
|
|
},
|
|
{
|
|
"entropy": 6.245473003387451,
|
|
"epoch": 1.55799192152337,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004767657873074815,
|
|
"loss": 5.8902,
|
|
"mean_token_accuracy": 0.18845838755369188,
|
|
"num_tokens": 34207462.0,
|
|
"step": 13500
|
|
},
|
|
{
|
|
"entropy": 6.18796181678772,
|
|
"epoch": 1.5585689555683784,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004767475217904081,
|
|
"loss": 5.7363,
|
|
"mean_token_accuracy": 0.19420798420906066,
|
|
"num_tokens": 34219696.0,
|
|
"step": 13505
|
|
},
|
|
{
|
|
"entropy": 6.205419874191284,
|
|
"epoch": 1.5591459896133872,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00047672924948765705,
|
|
"loss": 5.79,
|
|
"mean_token_accuracy": 0.1927314206957817,
|
|
"num_tokens": 34232413.0,
|
|
"step": 13510
|
|
},
|
|
{
|
|
"entropy": 6.259201574325561,
|
|
"epoch": 1.5597230236583959,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00047671097039984293,
|
|
"loss": 5.8829,
|
|
"mean_token_accuracy": 0.1864104762673378,
|
|
"num_tokens": 34245150.0,
|
|
"step": 13515
|
|
},
|
|
{
|
|
"entropy": 6.23311071395874,
|
|
"epoch": 1.5603000577034045,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00047669268452758053,
|
|
"loss": 5.7247,
|
|
"mean_token_accuracy": 0.1986491337418556,
|
|
"num_tokens": 34257416.0,
|
|
"step": 13520
|
|
},
|
|
{
|
|
"entropy": 6.192863082885742,
|
|
"epoch": 1.5608770917484132,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00047667439187148476,
|
|
"loss": 5.7546,
|
|
"mean_token_accuracy": 0.1986703172326088,
|
|
"num_tokens": 34269518.0,
|
|
"step": 13525
|
|
},
|
|
{
|
|
"entropy": 6.2323802471160885,
|
|
"epoch": 1.5614541257934218,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004766560924321711,
|
|
"loss": 5.7942,
|
|
"mean_token_accuracy": 0.19780726730823517,
|
|
"num_tokens": 34280965.0,
|
|
"step": 13530
|
|
},
|
|
{
|
|
"entropy": 6.22453088760376,
|
|
"epoch": 1.5620311598384304,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.00047663778621025496,
|
|
"loss": 5.8313,
|
|
"mean_token_accuracy": 0.19148373305797578,
|
|
"num_tokens": 34294051.0,
|
|
"step": 13535
|
|
},
|
|
{
|
|
"entropy": 6.268961334228516,
|
|
"epoch": 1.562608193883439,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004766194732063519,
|
|
"loss": 5.863,
|
|
"mean_token_accuracy": 0.18264816850423812,
|
|
"num_tokens": 34308052.0,
|
|
"step": 13540
|
|
},
|
|
{
|
|
"entropy": 6.285745286941529,
|
|
"epoch": 1.563185227928448,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.00047660115342107814,
|
|
"loss": 5.7969,
|
|
"mean_token_accuracy": 0.19112218767404557,
|
|
"num_tokens": 34321802.0,
|
|
"step": 13545
|
|
},
|
|
{
|
|
"entropy": 6.193321275711059,
|
|
"epoch": 1.5637622619734564,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.00047658282685504973,
|
|
"loss": 5.7602,
|
|
"mean_token_accuracy": 0.19718139320611955,
|
|
"num_tokens": 34334789.0,
|
|
"step": 13550
|
|
},
|
|
{
|
|
"entropy": 6.235433149337768,
|
|
"epoch": 1.5643392960184652,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000476564493508883,
|
|
"loss": 5.7801,
|
|
"mean_token_accuracy": 0.19197132885456086,
|
|
"num_tokens": 34347167.0,
|
|
"step": 13555
|
|
},
|
|
{
|
|
"entropy": 6.285042762756348,
|
|
"epoch": 1.5649163300634736,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00047654615338319466,
|
|
"loss": 5.9097,
|
|
"mean_token_accuracy": 0.1878646969795227,
|
|
"num_tokens": 34360468.0,
|
|
"step": 13560
|
|
},
|
|
{
|
|
"entropy": 6.280793809890747,
|
|
"epoch": 1.5654933641084825,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004765278064786016,
|
|
"loss": 5.8745,
|
|
"mean_token_accuracy": 0.18344386219978331,
|
|
"num_tokens": 34373835.0,
|
|
"step": 13565
|
|
},
|
|
{
|
|
"entropy": 6.2916289329528805,
|
|
"epoch": 1.566070398153491,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00047650945279572085,
|
|
"loss": 5.8593,
|
|
"mean_token_accuracy": 0.19200937896966935,
|
|
"num_tokens": 34385591.0,
|
|
"step": 13570
|
|
},
|
|
{
|
|
"entropy": 6.280641365051269,
|
|
"epoch": 1.5666474321984998,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004764910923351698,
|
|
"loss": 5.8864,
|
|
"mean_token_accuracy": 0.183075650036335,
|
|
"num_tokens": 34398980.0,
|
|
"step": 13575
|
|
},
|
|
{
|
|
"entropy": 6.257032251358032,
|
|
"epoch": 1.5672244662435084,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00047647272509756584,
|
|
"loss": 5.869,
|
|
"mean_token_accuracy": 0.18773055970668792,
|
|
"num_tokens": 34412274.0,
|
|
"step": 13580
|
|
},
|
|
{
|
|
"entropy": 6.243408870697022,
|
|
"epoch": 1.567801500288517,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004764543510835269,
|
|
"loss": 5.8246,
|
|
"mean_token_accuracy": 0.19365275353193284,
|
|
"num_tokens": 34425043.0,
|
|
"step": 13585
|
|
},
|
|
{
|
|
"entropy": 6.239257192611694,
|
|
"epoch": 1.5683785343335257,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000476435970293671,
|
|
"loss": 5.8773,
|
|
"mean_token_accuracy": 0.19190652072429656,
|
|
"num_tokens": 34437022.0,
|
|
"step": 13590
|
|
},
|
|
{
|
|
"entropy": 6.168194198608399,
|
|
"epoch": 1.5689555683785343,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.00047641758272861626,
|
|
"loss": 5.6913,
|
|
"mean_token_accuracy": 0.1997967079281807,
|
|
"num_tokens": 34449668.0,
|
|
"step": 13595
|
|
},
|
|
{
|
|
"entropy": 6.230442905426026,
|
|
"epoch": 1.569532602423543,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004763991883889811,
|
|
"loss": 5.7525,
|
|
"mean_token_accuracy": 0.19202667623758315,
|
|
"num_tokens": 34461588.0,
|
|
"step": 13600
|
|
},
|
|
{
|
|
"entropy": 6.194968223571777,
|
|
"epoch": 1.5701096364685516,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004763807872753843,
|
|
"loss": 5.7956,
|
|
"mean_token_accuracy": 0.19065721333026886,
|
|
"num_tokens": 34474696.0,
|
|
"step": 13605
|
|
},
|
|
{
|
|
"entropy": 6.2662159442901615,
|
|
"epoch": 1.5706866705135603,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00047636237938844484,
|
|
"loss": 5.8088,
|
|
"mean_token_accuracy": 0.19261950701475145,
|
|
"num_tokens": 34488477.0,
|
|
"step": 13610
|
|
},
|
|
{
|
|
"entropy": 6.20445556640625,
|
|
"epoch": 1.571263704558569,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004763439647287817,
|
|
"loss": 5.7521,
|
|
"mean_token_accuracy": 0.19336534291505814,
|
|
"num_tokens": 34502159.0,
|
|
"step": 13615
|
|
},
|
|
{
|
|
"entropy": 6.188671398162842,
|
|
"epoch": 1.5718407386035778,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004763255432970144,
|
|
"loss": 5.788,
|
|
"mean_token_accuracy": 0.1959633484482765,
|
|
"num_tokens": 34516247.0,
|
|
"step": 13620
|
|
},
|
|
{
|
|
"entropy": 6.190359258651734,
|
|
"epoch": 1.5724177726485862,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00047630711509376235,
|
|
"loss": 5.6789,
|
|
"mean_token_accuracy": 0.20005650967359542,
|
|
"num_tokens": 34528599.0,
|
|
"step": 13625
|
|
},
|
|
{
|
|
"entropy": 6.272625064849853,
|
|
"epoch": 1.572994806693595,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004762886801196455,
|
|
"loss": 5.8926,
|
|
"mean_token_accuracy": 0.17960608005523682,
|
|
"num_tokens": 34541346.0,
|
|
"step": 13630
|
|
},
|
|
{
|
|
"entropy": 6.311180162429809,
|
|
"epoch": 1.5735718407386035,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00047627023837528386,
|
|
"loss": 5.845,
|
|
"mean_token_accuracy": 0.18619453758001328,
|
|
"num_tokens": 34553934.0,
|
|
"step": 13635
|
|
},
|
|
{
|
|
"entropy": 6.243749475479126,
|
|
"epoch": 1.5741488747836123,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00047625178986129775,
|
|
"loss": 5.8856,
|
|
"mean_token_accuracy": 0.1931193843483925,
|
|
"num_tokens": 34565739.0,
|
|
"step": 13640
|
|
},
|
|
{
|
|
"entropy": 6.188317966461182,
|
|
"epoch": 1.5747259088286207,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004762333345783078,
|
|
"loss": 5.8081,
|
|
"mean_token_accuracy": 0.19340444803237916,
|
|
"num_tokens": 34579062.0,
|
|
"step": 13645
|
|
},
|
|
{
|
|
"entropy": 6.227141380310059,
|
|
"epoch": 1.5753029428736296,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00047621487252693436,
|
|
"loss": 5.8652,
|
|
"mean_token_accuracy": 0.18909793645143508,
|
|
"num_tokens": 34592090.0,
|
|
"step": 13650
|
|
},
|
|
{
|
|
"entropy": 6.149709033966064,
|
|
"epoch": 1.5758799769186382,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00047619640370779876,
|
|
"loss": 5.7026,
|
|
"mean_token_accuracy": 0.19682869613170623,
|
|
"num_tokens": 34604626.0,
|
|
"step": 13655
|
|
},
|
|
{
|
|
"entropy": 6.2658247470855715,
|
|
"epoch": 1.5764570109636469,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047617792812152207,
|
|
"loss": 5.8458,
|
|
"mean_token_accuracy": 0.18907229751348495,
|
|
"num_tokens": 34617174.0,
|
|
"step": 13660
|
|
},
|
|
{
|
|
"entropy": 6.185346984863282,
|
|
"epoch": 1.5770340450086555,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004761594457687256,
|
|
"loss": 5.7213,
|
|
"mean_token_accuracy": 0.19811177551746367,
|
|
"num_tokens": 34629909.0,
|
|
"step": 13665
|
|
},
|
|
{
|
|
"entropy": 6.198504495620727,
|
|
"epoch": 1.5776110790536642,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004761409566500313,
|
|
"loss": 5.7826,
|
|
"mean_token_accuracy": 0.1974416196346283,
|
|
"num_tokens": 34643640.0,
|
|
"step": 13670
|
|
},
|
|
{
|
|
"entropy": 6.230290460586548,
|
|
"epoch": 1.5781881130986728,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00047612246076606066,
|
|
"loss": 5.7578,
|
|
"mean_token_accuracy": 0.1851365178823471,
|
|
"num_tokens": 34655250.0,
|
|
"step": 13675
|
|
},
|
|
{
|
|
"entropy": 6.257380104064941,
|
|
"epoch": 1.5787651471436814,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.00047610395811743594,
|
|
"loss": 5.7802,
|
|
"mean_token_accuracy": 0.1935951068997383,
|
|
"num_tokens": 34669318.0,
|
|
"step": 13680
|
|
},
|
|
{
|
|
"entropy": 6.212140512466431,
|
|
"epoch": 1.5793421811886903,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047608544870477956,
|
|
"loss": 5.8145,
|
|
"mean_token_accuracy": 0.1901389628648758,
|
|
"num_tokens": 34680932.0,
|
|
"step": 13685
|
|
},
|
|
{
|
|
"entropy": 6.2297382831573485,
|
|
"epoch": 1.5799192152336987,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00047606693252871395,
|
|
"loss": 5.9309,
|
|
"mean_token_accuracy": 0.18365089148283004,
|
|
"num_tokens": 34693091.0,
|
|
"step": 13690
|
|
},
|
|
{
|
|
"entropy": 6.239744043350219,
|
|
"epoch": 1.5804962492787076,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.000476048409589862,
|
|
"loss": 5.8484,
|
|
"mean_token_accuracy": 0.19662028700113296,
|
|
"num_tokens": 34706645.0,
|
|
"step": 13695
|
|
},
|
|
{
|
|
"entropy": 6.262181663513184,
|
|
"epoch": 1.581073283323716,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004760298798888466,
|
|
"loss": 5.9018,
|
|
"mean_token_accuracy": 0.18771067559719085,
|
|
"num_tokens": 34718974.0,
|
|
"step": 13700
|
|
},
|
|
{
|
|
"entropy": 6.192539691925049,
|
|
"epoch": 1.5816503173687249,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004760113434262911,
|
|
"loss": 5.8369,
|
|
"mean_token_accuracy": 0.18986850529909133,
|
|
"num_tokens": 34732424.0,
|
|
"step": 13705
|
|
},
|
|
{
|
|
"entropy": 6.183119106292724,
|
|
"epoch": 1.5822273514137333,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047599280020281894,
|
|
"loss": 5.7694,
|
|
"mean_token_accuracy": 0.1920637682080269,
|
|
"num_tokens": 34743865.0,
|
|
"step": 13710
|
|
},
|
|
{
|
|
"entropy": 6.195568656921386,
|
|
"epoch": 1.5828043854587421,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00047597425021905364,
|
|
"loss": 5.714,
|
|
"mean_token_accuracy": 0.1968247890472412,
|
|
"num_tokens": 34756415.0,
|
|
"step": 13715
|
|
},
|
|
{
|
|
"entropy": 6.307136392593383,
|
|
"epoch": 1.5833814195037508,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004759556934756194,
|
|
"loss": 5.851,
|
|
"mean_token_accuracy": 0.18275767266750337,
|
|
"num_tokens": 34769666.0,
|
|
"step": 13720
|
|
},
|
|
{
|
|
"entropy": 6.103635835647583,
|
|
"epoch": 1.5839584535487594,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00047593712997314017,
|
|
"loss": 5.6843,
|
|
"mean_token_accuracy": 0.20277404189109802,
|
|
"num_tokens": 34781523.0,
|
|
"step": 13725
|
|
},
|
|
{
|
|
"entropy": 6.193688011169433,
|
|
"epoch": 1.584535487593768,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00047591855971224035,
|
|
"loss": 5.7348,
|
|
"mean_token_accuracy": 0.20058793425559998,
|
|
"num_tokens": 34794597.0,
|
|
"step": 13730
|
|
},
|
|
{
|
|
"entropy": 6.22872748374939,
|
|
"epoch": 1.5851125216387767,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004758999826935446,
|
|
"loss": 5.8807,
|
|
"mean_token_accuracy": 0.18744026124477386,
|
|
"num_tokens": 34807791.0,
|
|
"step": 13735
|
|
},
|
|
{
|
|
"entropy": 6.279449033737182,
|
|
"epoch": 1.5856895556837853,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004758813989176778,
|
|
"loss": 5.8438,
|
|
"mean_token_accuracy": 0.1967759609222412,
|
|
"num_tokens": 34821456.0,
|
|
"step": 13740
|
|
},
|
|
{
|
|
"entropy": 6.221560335159301,
|
|
"epoch": 1.586266589728794,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00047586280838526483,
|
|
"loss": 5.7788,
|
|
"mean_token_accuracy": 0.19918196201324462,
|
|
"num_tokens": 34834786.0,
|
|
"step": 13745
|
|
},
|
|
{
|
|
"entropy": 6.23402967453003,
|
|
"epoch": 1.5868436237738026,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004758442110969312,
|
|
"loss": 5.8089,
|
|
"mean_token_accuracy": 0.1831536501646042,
|
|
"num_tokens": 34846125.0,
|
|
"step": 13750
|
|
},
|
|
{
|
|
"entropy": 6.30714054107666,
|
|
"epoch": 1.5874206578188113,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004758256070533022,
|
|
"loss": 5.8854,
|
|
"mean_token_accuracy": 0.18437816053628922,
|
|
"num_tokens": 34858438.0,
|
|
"step": 13755
|
|
},
|
|
{
|
|
"entropy": 6.2490949630737305,
|
|
"epoch": 1.5879976918638201,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004758069962550037,
|
|
"loss": 5.8674,
|
|
"mean_token_accuracy": 0.18302336782217027,
|
|
"num_tokens": 34871340.0,
|
|
"step": 13760
|
|
},
|
|
{
|
|
"entropy": 6.250127840042114,
|
|
"epoch": 1.5885747259088285,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00047578837870266156,
|
|
"loss": 5.8296,
|
|
"mean_token_accuracy": 0.18722266256809234,
|
|
"num_tokens": 34882111.0,
|
|
"step": 13765
|
|
},
|
|
{
|
|
"entropy": 6.2264612197875975,
|
|
"epoch": 1.5891517599538374,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00047576975439690206,
|
|
"loss": 5.8497,
|
|
"mean_token_accuracy": 0.18753604739904403,
|
|
"num_tokens": 34895539.0,
|
|
"step": 13770
|
|
},
|
|
{
|
|
"entropy": 6.245386600494385,
|
|
"epoch": 1.5897287939988458,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00047575112333835164,
|
|
"loss": 5.7943,
|
|
"mean_token_accuracy": 0.1940807059407234,
|
|
"num_tokens": 34907860.0,
|
|
"step": 13775
|
|
},
|
|
{
|
|
"entropy": 6.318158340454102,
|
|
"epoch": 1.5903058280438547,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00047573248552763684,
|
|
"loss": 5.9049,
|
|
"mean_token_accuracy": 0.18691892623901368,
|
|
"num_tokens": 34920595.0,
|
|
"step": 13780
|
|
},
|
|
{
|
|
"entropy": 6.237708854675293,
|
|
"epoch": 1.590882862088863,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00047571384096538474,
|
|
"loss": 5.8353,
|
|
"mean_token_accuracy": 0.19281982034444808,
|
|
"num_tokens": 34933458.0,
|
|
"step": 13785
|
|
},
|
|
{
|
|
"entropy": 6.154352331161499,
|
|
"epoch": 1.591459896133872,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004756951896522222,
|
|
"loss": 5.7572,
|
|
"mean_token_accuracy": 0.19540754407644273,
|
|
"num_tokens": 34946872.0,
|
|
"step": 13790
|
|
},
|
|
{
|
|
"entropy": 6.236962699890137,
|
|
"epoch": 1.5920369301788806,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004756765315887766,
|
|
"loss": 5.8304,
|
|
"mean_token_accuracy": 0.1889364406466484,
|
|
"num_tokens": 34959384.0,
|
|
"step": 13795
|
|
},
|
|
{
|
|
"entropy": 6.282778406143189,
|
|
"epoch": 1.5926139642238892,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004756578667756756,
|
|
"loss": 5.8797,
|
|
"mean_token_accuracy": 0.18420573323965073,
|
|
"num_tokens": 34971571.0,
|
|
"step": 13800
|
|
},
|
|
{
|
|
"entropy": 6.234209203720093,
|
|
"epoch": 1.5931909982688979,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004756391952135469,
|
|
"loss": 5.7703,
|
|
"mean_token_accuracy": 0.20292106419801711,
|
|
"num_tokens": 34984897.0,
|
|
"step": 13805
|
|
},
|
|
{
|
|
"entropy": 6.226548194885254,
|
|
"epoch": 1.5937680323139065,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00047562051690301855,
|
|
"loss": 5.8317,
|
|
"mean_token_accuracy": 0.19043446183204651,
|
|
"num_tokens": 34998185.0,
|
|
"step": 13810
|
|
},
|
|
{
|
|
"entropy": 6.307507181167603,
|
|
"epoch": 1.5943450663589152,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00047560183184471873,
|
|
"loss": 5.8377,
|
|
"mean_token_accuracy": 0.18937501907348633,
|
|
"num_tokens": 35010985.0,
|
|
"step": 13815
|
|
},
|
|
{
|
|
"entropy": 6.25484938621521,
|
|
"epoch": 1.5949221004039238,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.000475583140039276,
|
|
"loss": 5.8375,
|
|
"mean_token_accuracy": 0.19109233766794204,
|
|
"num_tokens": 35023785.0,
|
|
"step": 13820
|
|
},
|
|
{
|
|
"entropy": 6.301526784896851,
|
|
"epoch": 1.5954991344489324,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00047556444148731897,
|
|
"loss": 5.8994,
|
|
"mean_token_accuracy": 0.17948832660913466,
|
|
"num_tokens": 35035926.0,
|
|
"step": 13825
|
|
},
|
|
{
|
|
"entropy": 6.276957702636719,
|
|
"epoch": 1.596076168493941,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004755457361894766,
|
|
"loss": 5.832,
|
|
"mean_token_accuracy": 0.19143660515546798,
|
|
"num_tokens": 35048290.0,
|
|
"step": 13830
|
|
},
|
|
{
|
|
"entropy": 6.166981220245361,
|
|
"epoch": 1.59665320253895,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00047552702414637793,
|
|
"loss": 5.7645,
|
|
"mean_token_accuracy": 0.19035774618387222,
|
|
"num_tokens": 35059883.0,
|
|
"step": 13835
|
|
},
|
|
{
|
|
"entropy": 6.277225303649902,
|
|
"epoch": 1.5972302365839584,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00047550830535865245,
|
|
"loss": 5.8617,
|
|
"mean_token_accuracy": 0.1807610049843788,
|
|
"num_tokens": 35071747.0,
|
|
"step": 13840
|
|
},
|
|
{
|
|
"entropy": 6.190814876556397,
|
|
"epoch": 1.5978072706289672,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00047548957982692974,
|
|
"loss": 5.8134,
|
|
"mean_token_accuracy": 0.1871611699461937,
|
|
"num_tokens": 35083774.0,
|
|
"step": 13845
|
|
},
|
|
{
|
|
"entropy": 6.200519466400147,
|
|
"epoch": 1.5983843046739756,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004754708475518396,
|
|
"loss": 5.811,
|
|
"mean_token_accuracy": 0.19500787407159806,
|
|
"num_tokens": 35095757.0,
|
|
"step": 13850
|
|
},
|
|
{
|
|
"entropy": 6.238155698776245,
|
|
"epoch": 1.5989613387189845,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.00047545210853401214,
|
|
"loss": 5.7967,
|
|
"mean_token_accuracy": 0.19086273461580278,
|
|
"num_tokens": 35108788.0,
|
|
"step": 13855
|
|
},
|
|
{
|
|
"entropy": 6.29552264213562,
|
|
"epoch": 1.599538372763993,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00047543336277407753,
|
|
"loss": 5.9095,
|
|
"mean_token_accuracy": 0.18491909354925157,
|
|
"num_tokens": 35121641.0,
|
|
"step": 13860
|
|
},
|
|
{
|
|
"entropy": 6.298146390914917,
|
|
"epoch": 1.6001154068090018,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00047541461027266624,
|
|
"loss": 5.872,
|
|
"mean_token_accuracy": 0.18402589708566666,
|
|
"num_tokens": 35133960.0,
|
|
"step": 13865
|
|
},
|
|
{
|
|
"entropy": 6.290952396392822,
|
|
"epoch": 1.6006924408540104,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004753958510304091,
|
|
"loss": 5.8602,
|
|
"mean_token_accuracy": 0.19193972200155257,
|
|
"num_tokens": 35146027.0,
|
|
"step": 13870
|
|
},
|
|
{
|
|
"entropy": 6.268626737594604,
|
|
"epoch": 1.601269474899019,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00047537708504793714,
|
|
"loss": 5.8229,
|
|
"mean_token_accuracy": 0.19206952154636384,
|
|
"num_tokens": 35158728.0,
|
|
"step": 13875
|
|
},
|
|
{
|
|
"entropy": 6.216690492630005,
|
|
"epoch": 1.6018465089440277,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00047535831232588146,
|
|
"loss": 5.8518,
|
|
"mean_token_accuracy": 0.18720198273658753,
|
|
"num_tokens": 35171734.0,
|
|
"step": 13880
|
|
},
|
|
{
|
|
"entropy": 6.28776330947876,
|
|
"epoch": 1.6024235429890363,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00047533953286487345,
|
|
"loss": 5.8469,
|
|
"mean_token_accuracy": 0.1826049879193306,
|
|
"num_tokens": 35185074.0,
|
|
"step": 13885
|
|
},
|
|
{
|
|
"entropy": 6.27451376914978,
|
|
"epoch": 1.603000577034045,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004753207466655447,
|
|
"loss": 5.8782,
|
|
"mean_token_accuracy": 0.19072716683149338,
|
|
"num_tokens": 35197972.0,
|
|
"step": 13890
|
|
},
|
|
{
|
|
"entropy": 6.271556949615478,
|
|
"epoch": 1.6035776110790536,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004753019537285273,
|
|
"loss": 5.8383,
|
|
"mean_token_accuracy": 0.19148626625537873,
|
|
"num_tokens": 35210939.0,
|
|
"step": 13895
|
|
},
|
|
{
|
|
"entropy": 6.355197715759277,
|
|
"epoch": 1.6041546451240625,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00047528315405445296,
|
|
"loss": 5.8933,
|
|
"mean_token_accuracy": 0.18523967564105986,
|
|
"num_tokens": 35223521.0,
|
|
"step": 13900
|
|
},
|
|
{
|
|
"entropy": 6.283075332641602,
|
|
"epoch": 1.604731679169071,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00047526434764395435,
|
|
"loss": 5.8874,
|
|
"mean_token_accuracy": 0.19085699915885926,
|
|
"num_tokens": 35235713.0,
|
|
"step": 13905
|
|
},
|
|
{
|
|
"entropy": 6.227591133117675,
|
|
"epoch": 1.6053087132140798,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00047524553449766386,
|
|
"loss": 5.8254,
|
|
"mean_token_accuracy": 0.1942302703857422,
|
|
"num_tokens": 35248938.0,
|
|
"step": 13910
|
|
},
|
|
{
|
|
"entropy": 6.268484354019165,
|
|
"epoch": 1.6058857472590882,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00047522671461621433,
|
|
"loss": 5.8516,
|
|
"mean_token_accuracy": 0.18590108901262284,
|
|
"num_tokens": 35260916.0,
|
|
"step": 13915
|
|
},
|
|
{
|
|
"entropy": 6.279177951812744,
|
|
"epoch": 1.606462781304097,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004752078880002386,
|
|
"loss": 5.7918,
|
|
"mean_token_accuracy": 0.19422025829553605,
|
|
"num_tokens": 35273529.0,
|
|
"step": 13920
|
|
},
|
|
{
|
|
"entropy": 6.256890106201172,
|
|
"epoch": 1.6070398153491054,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00047518905465037005,
|
|
"loss": 5.7895,
|
|
"mean_token_accuracy": 0.1899741917848587,
|
|
"num_tokens": 35285500.0,
|
|
"step": 13925
|
|
},
|
|
{
|
|
"entropy": 6.217769765853882,
|
|
"epoch": 1.6076168493941143,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00047517021456724214,
|
|
"loss": 5.8204,
|
|
"mean_token_accuracy": 0.18706730306148528,
|
|
"num_tokens": 35300039.0,
|
|
"step": 13930
|
|
},
|
|
{
|
|
"entropy": 6.256122732162476,
|
|
"epoch": 1.608193883439123,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00047515136775148843,
|
|
"loss": 5.9094,
|
|
"mean_token_accuracy": 0.17840041369199752,
|
|
"num_tokens": 35313091.0,
|
|
"step": 13935
|
|
},
|
|
{
|
|
"entropy": 6.28008508682251,
|
|
"epoch": 1.6087709174841316,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004751325142037429,
|
|
"loss": 5.8688,
|
|
"mean_token_accuracy": 0.1876186579465866,
|
|
"num_tokens": 35325890.0,
|
|
"step": 13940
|
|
},
|
|
{
|
|
"entropy": 6.198402643203735,
|
|
"epoch": 1.6093479515291402,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.00047511365392463974,
|
|
"loss": 5.7532,
|
|
"mean_token_accuracy": 0.1986751899123192,
|
|
"num_tokens": 35339395.0,
|
|
"step": 13945
|
|
},
|
|
{
|
|
"entropy": 6.235682106018066,
|
|
"epoch": 1.6099249855741489,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00047509478691481317,
|
|
"loss": 5.8111,
|
|
"mean_token_accuracy": 0.19092074632644654,
|
|
"num_tokens": 35351163.0,
|
|
"step": 13950
|
|
},
|
|
{
|
|
"entropy": 6.245539283752441,
|
|
"epoch": 1.6105020196191575,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047507591317489783,
|
|
"loss": 5.7374,
|
|
"mean_token_accuracy": 0.20853773206472398,
|
|
"num_tokens": 35364099.0,
|
|
"step": 13955
|
|
},
|
|
{
|
|
"entropy": 6.257050561904907,
|
|
"epoch": 1.6110790536641661,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004750570327055286,
|
|
"loss": 5.7902,
|
|
"mean_token_accuracy": 0.19092931747436523,
|
|
"num_tokens": 35376768.0,
|
|
"step": 13960
|
|
},
|
|
{
|
|
"entropy": 6.275674676895141,
|
|
"epoch": 1.6116560877091748,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00047503814550734034,
|
|
"loss": 5.8654,
|
|
"mean_token_accuracy": 0.18828979283571243,
|
|
"num_tokens": 35388892.0,
|
|
"step": 13965
|
|
},
|
|
{
|
|
"entropy": 6.308603286743164,
|
|
"epoch": 1.6122331217541834,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004750192515809685,
|
|
"loss": 5.9013,
|
|
"mean_token_accuracy": 0.18381124287843703,
|
|
"num_tokens": 35401573.0,
|
|
"step": 13970
|
|
},
|
|
{
|
|
"entropy": 6.255910587310791,
|
|
"epoch": 1.6128101557991923,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047500035092704843,
|
|
"loss": 5.7872,
|
|
"mean_token_accuracy": 0.19008346199989318,
|
|
"num_tokens": 35415073.0,
|
|
"step": 13975
|
|
},
|
|
{
|
|
"entropy": 6.209208059310913,
|
|
"epoch": 1.6133871898442007,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004749814435462159,
|
|
"loss": 5.7701,
|
|
"mean_token_accuracy": 0.19700252562761306,
|
|
"num_tokens": 35428756.0,
|
|
"step": 13980
|
|
},
|
|
{
|
|
"entropy": 6.309863519668579,
|
|
"epoch": 1.6139642238892096,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004749625294391069,
|
|
"loss": 5.775,
|
|
"mean_token_accuracy": 0.19249810576438903,
|
|
"num_tokens": 35440387.0,
|
|
"step": 13985
|
|
},
|
|
{
|
|
"entropy": 6.164202404022217,
|
|
"epoch": 1.614541257934218,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.00047494360860635755,
|
|
"loss": 5.7059,
|
|
"mean_token_accuracy": 0.20623115003108977,
|
|
"num_tokens": 35454105.0,
|
|
"step": 13990
|
|
},
|
|
{
|
|
"entropy": 6.217005205154419,
|
|
"epoch": 1.6151182919792268,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004749246810486042,
|
|
"loss": 5.859,
|
|
"mean_token_accuracy": 0.19571419805288315,
|
|
"num_tokens": 35467775.0,
|
|
"step": 13995
|
|
},
|
|
{
|
|
"entropy": 6.2699981212615965,
|
|
"epoch": 1.6156953260242353,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004749057467664836,
|
|
"loss": 5.8614,
|
|
"mean_token_accuracy": 0.18756910860538484,
|
|
"num_tokens": 35479217.0,
|
|
"step": 14000
|
|
},
|
|
{
|
|
"entropy": 6.258079528808594,
|
|
"epoch": 1.6162723600692441,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00047488680576063247,
|
|
"loss": 5.8267,
|
|
"mean_token_accuracy": 0.20054476708173752,
|
|
"num_tokens": 35490676.0,
|
|
"step": 14005
|
|
},
|
|
{
|
|
"entropy": 6.22015151977539,
|
|
"epoch": 1.6168493941142528,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004748678580316878,
|
|
"loss": 5.7543,
|
|
"mean_token_accuracy": 0.19434951543807982,
|
|
"num_tokens": 35503440.0,
|
|
"step": 14010
|
|
},
|
|
{
|
|
"entropy": 6.183001565933227,
|
|
"epoch": 1.6174264281592614,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00047484890358028714,
|
|
"loss": 5.7756,
|
|
"mean_token_accuracy": 0.19921866208314895,
|
|
"num_tokens": 35515717.0,
|
|
"step": 14015
|
|
},
|
|
{
|
|
"entropy": 6.2771368503570555,
|
|
"epoch": 1.61800346220427,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004748299424070678,
|
|
"loss": 5.7939,
|
|
"mean_token_accuracy": 0.1896692395210266,
|
|
"num_tokens": 35528445.0,
|
|
"step": 14020
|
|
},
|
|
{
|
|
"entropy": 6.1768638610839846,
|
|
"epoch": 1.6185804962492787,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004748109745126677,
|
|
"loss": 5.7165,
|
|
"mean_token_accuracy": 0.19463213682174682,
|
|
"num_tokens": 35541652.0,
|
|
"step": 14025
|
|
},
|
|
{
|
|
"entropy": 6.125383138656616,
|
|
"epoch": 1.6191575302942873,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047479199989772464,
|
|
"loss": 5.7204,
|
|
"mean_token_accuracy": 0.2015412136912346,
|
|
"num_tokens": 35555310.0,
|
|
"step": 14030
|
|
},
|
|
{
|
|
"entropy": 6.320287895202637,
|
|
"epoch": 1.619734564339296,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000474773018562877,
|
|
"loss": 5.8361,
|
|
"mean_token_accuracy": 0.18703369945287704,
|
|
"num_tokens": 35567830.0,
|
|
"step": 14035
|
|
},
|
|
{
|
|
"entropy": 6.232371616363525,
|
|
"epoch": 1.6203115983843048,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00047475403050876297,
|
|
"loss": 5.8173,
|
|
"mean_token_accuracy": 0.19013205021619797,
|
|
"num_tokens": 35579054.0,
|
|
"step": 14040
|
|
},
|
|
{
|
|
"entropy": 6.305903196334839,
|
|
"epoch": 1.6208886324293132,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004747350357360214,
|
|
"loss": 5.92,
|
|
"mean_token_accuracy": 0.18613108694553376,
|
|
"num_tokens": 35592463.0,
|
|
"step": 14045
|
|
},
|
|
{
|
|
"entropy": 6.2606062412261965,
|
|
"epoch": 1.621465666474322,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004747160342452912,
|
|
"loss": 5.8242,
|
|
"mean_token_accuracy": 0.1944044604897499,
|
|
"num_tokens": 35605127.0,
|
|
"step": 14050
|
|
},
|
|
{
|
|
"entropy": 6.210332012176513,
|
|
"epoch": 1.6220427005193305,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00047469702603721134,
|
|
"loss": 5.7752,
|
|
"mean_token_accuracy": 0.19872388392686843,
|
|
"num_tokens": 35617509.0,
|
|
"step": 14055
|
|
},
|
|
{
|
|
"entropy": 6.21488995552063,
|
|
"epoch": 1.6226197345643394,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004746780111124212,
|
|
"loss": 5.796,
|
|
"mean_token_accuracy": 0.19262754619121553,
|
|
"num_tokens": 35630788.0,
|
|
"step": 14060
|
|
},
|
|
{
|
|
"entropy": 6.336267614364624,
|
|
"epoch": 1.6231967686093478,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00047465898947156033,
|
|
"loss": 5.8856,
|
|
"mean_token_accuracy": 0.1877436563372612,
|
|
"num_tokens": 35643613.0,
|
|
"step": 14065
|
|
},
|
|
{
|
|
"entropy": 6.2986588954925535,
|
|
"epoch": 1.6237738026543567,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00047463996111526854,
|
|
"loss": 5.8275,
|
|
"mean_token_accuracy": 0.189494089782238,
|
|
"num_tokens": 35656495.0,
|
|
"step": 14070
|
|
},
|
|
{
|
|
"entropy": 6.242229413986206,
|
|
"epoch": 1.6243508366993653,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00047462092604418576,
|
|
"loss": 5.9166,
|
|
"mean_token_accuracy": 0.18053760081529618,
|
|
"num_tokens": 35669661.0,
|
|
"step": 14075
|
|
},
|
|
{
|
|
"entropy": 6.240379905700683,
|
|
"epoch": 1.624927870744374,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00047460188425895236,
|
|
"loss": 5.8252,
|
|
"mean_token_accuracy": 0.18926533162593842,
|
|
"num_tokens": 35682675.0,
|
|
"step": 14080
|
|
},
|
|
{
|
|
"entropy": 6.289512968063354,
|
|
"epoch": 1.6255049047893826,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00047458283576020874,
|
|
"loss": 5.8646,
|
|
"mean_token_accuracy": 0.1920921802520752,
|
|
"num_tokens": 35694571.0,
|
|
"step": 14085
|
|
},
|
|
{
|
|
"entropy": 6.22381739616394,
|
|
"epoch": 1.6260819388343912,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00047456378054859554,
|
|
"loss": 5.7493,
|
|
"mean_token_accuracy": 0.19590264409780503,
|
|
"num_tokens": 35707196.0,
|
|
"step": 14090
|
|
},
|
|
{
|
|
"entropy": 6.2018373012542725,
|
|
"epoch": 1.6266589728793999,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00047454471862475375,
|
|
"loss": 5.7632,
|
|
"mean_token_accuracy": 0.195886792242527,
|
|
"num_tokens": 35719682.0,
|
|
"step": 14095
|
|
},
|
|
{
|
|
"entropy": 6.229247808456421,
|
|
"epoch": 1.6272360069244085,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047452564998932446,
|
|
"loss": 5.8639,
|
|
"mean_token_accuracy": 0.18924974799156188,
|
|
"num_tokens": 35732595.0,
|
|
"step": 14100
|
|
},
|
|
{
|
|
"entropy": 6.275307750701904,
|
|
"epoch": 1.6278130409694171,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.000474506574642949,
|
|
"loss": 5.8004,
|
|
"mean_token_accuracy": 0.19364307522773744,
|
|
"num_tokens": 35744611.0,
|
|
"step": 14105
|
|
},
|
|
{
|
|
"entropy": 6.194735336303711,
|
|
"epoch": 1.6283900750144258,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.000474487492586269,
|
|
"loss": 5.8052,
|
|
"mean_token_accuracy": 0.19076161533594133,
|
|
"num_tokens": 35757288.0,
|
|
"step": 14110
|
|
},
|
|
{
|
|
"entropy": 6.270211219787598,
|
|
"epoch": 1.6289671090594346,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004744684038199263,
|
|
"loss": 5.8733,
|
|
"mean_token_accuracy": 0.18648385405540466,
|
|
"num_tokens": 35769747.0,
|
|
"step": 14115
|
|
},
|
|
{
|
|
"entropy": 6.315110445022583,
|
|
"epoch": 1.629544143104443,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00047444930834456293,
|
|
"loss": 5.8978,
|
|
"mean_token_accuracy": 0.19017856419086457,
|
|
"num_tokens": 35781656.0,
|
|
"step": 14120
|
|
},
|
|
{
|
|
"entropy": 6.277868747711182,
|
|
"epoch": 1.630121177149452,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004744302061608212,
|
|
"loss": 5.8544,
|
|
"mean_token_accuracy": 0.19737848043441772,
|
|
"num_tokens": 35794618.0,
|
|
"step": 14125
|
|
},
|
|
{
|
|
"entropy": 6.253666496276855,
|
|
"epoch": 1.6306982111944603,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047441109726934345,
|
|
"loss": 5.7741,
|
|
"mean_token_accuracy": 0.19238534420728684,
|
|
"num_tokens": 35807504.0,
|
|
"step": 14130
|
|
},
|
|
{
|
|
"entropy": 6.165348815917969,
|
|
"epoch": 1.6312752452394692,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00047439198167077256,
|
|
"loss": 5.7917,
|
|
"mean_token_accuracy": 0.19519294947385787,
|
|
"num_tokens": 35819668.0,
|
|
"step": 14135
|
|
},
|
|
{
|
|
"entropy": 6.2695183753967285,
|
|
"epoch": 1.6318522792844776,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004743728593657514,
|
|
"loss": 5.8348,
|
|
"mean_token_accuracy": 0.1945918545126915,
|
|
"num_tokens": 35832078.0,
|
|
"step": 14140
|
|
},
|
|
{
|
|
"entropy": 6.178915405273438,
|
|
"epoch": 1.6324293133294865,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004743537303549231,
|
|
"loss": 5.7189,
|
|
"mean_token_accuracy": 0.19973592162132264,
|
|
"num_tokens": 35843580.0,
|
|
"step": 14145
|
|
},
|
|
{
|
|
"entropy": 6.201517915725708,
|
|
"epoch": 1.6330063473744951,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004743345946389311,
|
|
"loss": 5.7507,
|
|
"mean_token_accuracy": 0.2023004561662674,
|
|
"num_tokens": 35857146.0,
|
|
"step": 14150
|
|
},
|
|
{
|
|
"entropy": 6.266290998458862,
|
|
"epoch": 1.6335833814195038,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00047431545221841907,
|
|
"loss": 5.7991,
|
|
"mean_token_accuracy": 0.1934083268046379,
|
|
"num_tokens": 35869374.0,
|
|
"step": 14155
|
|
},
|
|
{
|
|
"entropy": 6.319689178466797,
|
|
"epoch": 1.6341604154645124,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00047429630309403086,
|
|
"loss": 5.8254,
|
|
"mean_token_accuracy": 0.1859660416841507,
|
|
"num_tokens": 35881882.0,
|
|
"step": 14160
|
|
},
|
|
{
|
|
"entropy": 6.082709503173828,
|
|
"epoch": 1.634737449509521,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00047427714726641044,
|
|
"loss": 5.6478,
|
|
"mean_token_accuracy": 0.20330152064561843,
|
|
"num_tokens": 35895512.0,
|
|
"step": 14165
|
|
},
|
|
{
|
|
"entropy": 6.1116431713104244,
|
|
"epoch": 1.6353144835545297,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.00047425798473620215,
|
|
"loss": 5.6909,
|
|
"mean_token_accuracy": 0.19648269861936568,
|
|
"num_tokens": 35908020.0,
|
|
"step": 14170
|
|
},
|
|
{
|
|
"entropy": 6.265104627609253,
|
|
"epoch": 1.6358915175995383,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004742388155040505,
|
|
"loss": 5.7543,
|
|
"mean_token_accuracy": 0.19779868721961974,
|
|
"num_tokens": 35920261.0,
|
|
"step": 14175
|
|
},
|
|
{
|
|
"entropy": 6.288595819473267,
|
|
"epoch": 1.6364685516445472,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00047421963957060026,
|
|
"loss": 5.9132,
|
|
"mean_token_accuracy": 0.18365271687507628,
|
|
"num_tokens": 35932135.0,
|
|
"step": 14180
|
|
},
|
|
{
|
|
"entropy": 6.19545316696167,
|
|
"epoch": 1.6370455856895556,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004742004569364964,
|
|
"loss": 5.7862,
|
|
"mean_token_accuracy": 0.19036284685134888,
|
|
"num_tokens": 35944574.0,
|
|
"step": 14185
|
|
},
|
|
{
|
|
"entropy": 6.272937345504761,
|
|
"epoch": 1.6376226197345645,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.00047418126760238416,
|
|
"loss": 5.7716,
|
|
"mean_token_accuracy": 0.19476332664489746,
|
|
"num_tokens": 35956877.0,
|
|
"step": 14190
|
|
},
|
|
{
|
|
"entropy": 6.306672048568726,
|
|
"epoch": 1.6381996537795729,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00047416207156890887,
|
|
"loss": 5.8893,
|
|
"mean_token_accuracy": 0.18866454511880876,
|
|
"num_tokens": 35968616.0,
|
|
"step": 14195
|
|
},
|
|
{
|
|
"entropy": 6.216367101669311,
|
|
"epoch": 1.6387766878245817,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004741428688367164,
|
|
"loss": 5.8467,
|
|
"mean_token_accuracy": 0.19205766469240187,
|
|
"num_tokens": 35982401.0,
|
|
"step": 14200
|
|
},
|
|
{
|
|
"entropy": 6.269579744338989,
|
|
"epoch": 1.6393537218695902,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00047412365940645225,
|
|
"loss": 5.7995,
|
|
"mean_token_accuracy": 0.19650813192129135,
|
|
"num_tokens": 35994907.0,
|
|
"step": 14205
|
|
},
|
|
{
|
|
"entropy": 6.257475233078003,
|
|
"epoch": 1.639930755914599,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00047410444327876286,
|
|
"loss": 5.7485,
|
|
"mean_token_accuracy": 0.19474590718746185,
|
|
"num_tokens": 36007109.0,
|
|
"step": 14210
|
|
},
|
|
{
|
|
"entropy": 6.236335754394531,
|
|
"epoch": 1.6405077899596077,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00047408522045429426,
|
|
"loss": 5.8324,
|
|
"mean_token_accuracy": 0.1903609052300453,
|
|
"num_tokens": 36018734.0,
|
|
"step": 14215
|
|
},
|
|
{
|
|
"entropy": 6.257100391387939,
|
|
"epoch": 1.6410848240046163,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004740659909336933,
|
|
"loss": 5.7787,
|
|
"mean_token_accuracy": 0.2008269727230072,
|
|
"num_tokens": 36031427.0,
|
|
"step": 14220
|
|
},
|
|
{
|
|
"entropy": 6.285252904891967,
|
|
"epoch": 1.641661858049625,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00047404675471760655,
|
|
"loss": 5.8026,
|
|
"mean_token_accuracy": 0.1962312713265419,
|
|
"num_tokens": 36044726.0,
|
|
"step": 14225
|
|
},
|
|
{
|
|
"entropy": 6.20171971321106,
|
|
"epoch": 1.6422388920946336,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004740275118066811,
|
|
"loss": 5.8143,
|
|
"mean_token_accuracy": 0.18700166642665864,
|
|
"num_tokens": 36056882.0,
|
|
"step": 14230
|
|
},
|
|
{
|
|
"entropy": 6.2923260688781735,
|
|
"epoch": 1.6428159261396422,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00047400826220156416,
|
|
"loss": 5.8656,
|
|
"mean_token_accuracy": 0.18483263552188872,
|
|
"num_tokens": 36068548.0,
|
|
"step": 14235
|
|
},
|
|
{
|
|
"entropy": 6.342332458496093,
|
|
"epoch": 1.6433929601846509,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00047398900590290313,
|
|
"loss": 5.7777,
|
|
"mean_token_accuracy": 0.18994950652122497,
|
|
"num_tokens": 36080652.0,
|
|
"step": 14240
|
|
},
|
|
{
|
|
"entropy": 6.206917762756348,
|
|
"epoch": 1.6439699942296595,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00047396974291134575,
|
|
"loss": 5.8173,
|
|
"mean_token_accuracy": 0.1934569150209427,
|
|
"num_tokens": 36093372.0,
|
|
"step": 14245
|
|
},
|
|
{
|
|
"entropy": 6.2440855503082275,
|
|
"epoch": 1.6445470282746681,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00047395047322754,
|
|
"loss": 5.8276,
|
|
"mean_token_accuracy": 0.1925554320216179,
|
|
"num_tokens": 36106023.0,
|
|
"step": 14250
|
|
},
|
|
{
|
|
"entropy": 6.222019481658935,
|
|
"epoch": 1.645124062319677,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00047393119685213374,
|
|
"loss": 5.7587,
|
|
"mean_token_accuracy": 0.20053549259901046,
|
|
"num_tokens": 36119627.0,
|
|
"step": 14255
|
|
},
|
|
{
|
|
"entropy": 6.09753794670105,
|
|
"epoch": 1.6457010963646854,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004739119137857756,
|
|
"loss": 5.6112,
|
|
"mean_token_accuracy": 0.20973964035511017,
|
|
"num_tokens": 36132835.0,
|
|
"step": 14260
|
|
},
|
|
{
|
|
"entropy": 6.277415990829468,
|
|
"epoch": 1.6462781304096943,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00047389262402911404,
|
|
"loss": 5.7902,
|
|
"mean_token_accuracy": 0.19406622946262359,
|
|
"num_tokens": 36144234.0,
|
|
"step": 14265
|
|
},
|
|
{
|
|
"entropy": 6.198006725311279,
|
|
"epoch": 1.6468551644547027,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00047387332758279784,
|
|
"loss": 5.7493,
|
|
"mean_token_accuracy": 0.19753192216157914,
|
|
"num_tokens": 36158556.0,
|
|
"step": 14270
|
|
},
|
|
{
|
|
"entropy": 6.210707807540894,
|
|
"epoch": 1.6474321984997116,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00047385402444747606,
|
|
"loss": 5.8218,
|
|
"mean_token_accuracy": 0.1887941062450409,
|
|
"num_tokens": 36171698.0,
|
|
"step": 14275
|
|
},
|
|
{
|
|
"entropy": 6.213572263717651,
|
|
"epoch": 1.64800923254472,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00047383471462379803,
|
|
"loss": 5.8067,
|
|
"mean_token_accuracy": 0.19627797454595566,
|
|
"num_tokens": 36184649.0,
|
|
"step": 14280
|
|
},
|
|
{
|
|
"entropy": 6.271010494232177,
|
|
"epoch": 1.6485862665897288,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.000473815398112413,
|
|
"loss": 5.7599,
|
|
"mean_token_accuracy": 0.19666724503040314,
|
|
"num_tokens": 36197127.0,
|
|
"step": 14285
|
|
},
|
|
{
|
|
"entropy": 6.229652214050293,
|
|
"epoch": 1.6491633006347375,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004737960749139708,
|
|
"loss": 5.7883,
|
|
"mean_token_accuracy": 0.19295482188463212,
|
|
"num_tokens": 36209471.0,
|
|
"step": 14290
|
|
},
|
|
{
|
|
"entropy": 6.301067876815796,
|
|
"epoch": 1.6497403346797461,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004737767450291215,
|
|
"loss": 5.8443,
|
|
"mean_token_accuracy": 0.19018818587064742,
|
|
"num_tokens": 36221798.0,
|
|
"step": 14295
|
|
},
|
|
{
|
|
"entropy": 6.232090139389038,
|
|
"epoch": 1.6503173687247548,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00047375740845851506,
|
|
"loss": 5.7485,
|
|
"mean_token_accuracy": 0.19451043158769607,
|
|
"num_tokens": 36235758.0,
|
|
"step": 14300
|
|
},
|
|
{
|
|
"entropy": 6.224923515319825,
|
|
"epoch": 1.6508944027697634,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004737380652028019,
|
|
"loss": 5.8011,
|
|
"mean_token_accuracy": 0.19222778230905532,
|
|
"num_tokens": 36248484.0,
|
|
"step": 14305
|
|
},
|
|
{
|
|
"entropy": 6.099427223205566,
|
|
"epoch": 1.651471436814772,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00047371871526263263,
|
|
"loss": 5.6429,
|
|
"mean_token_accuracy": 0.2055506318807602,
|
|
"num_tokens": 36260796.0,
|
|
"step": 14310
|
|
},
|
|
{
|
|
"entropy": 6.171128606796264,
|
|
"epoch": 1.6520484708597807,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004736993586386581,
|
|
"loss": 5.7813,
|
|
"mean_token_accuracy": 0.19944193214178085,
|
|
"num_tokens": 36273617.0,
|
|
"step": 14315
|
|
},
|
|
{
|
|
"entropy": 6.160193538665771,
|
|
"epoch": 1.6526255049047895,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00047367999533152934,
|
|
"loss": 5.7129,
|
|
"mean_token_accuracy": 0.2024203896522522,
|
|
"num_tokens": 36286285.0,
|
|
"step": 14320
|
|
},
|
|
{
|
|
"entropy": 6.3143633842468265,
|
|
"epoch": 1.653202538949798,
|
|
"grad_norm": 1.9921875,
|
|
"learning_rate": 0.00047366062534189756,
|
|
"loss": 5.8611,
|
|
"mean_token_accuracy": 0.18911528140306472,
|
|
"num_tokens": 36298970.0,
|
|
"step": 14325
|
|
},
|
|
{
|
|
"entropy": 6.190754985809326,
|
|
"epoch": 1.6537795729948068,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00047364124867041446,
|
|
"loss": 5.7636,
|
|
"mean_token_accuracy": 0.19722063839435577,
|
|
"num_tokens": 36312684.0,
|
|
"step": 14330
|
|
},
|
|
{
|
|
"entropy": 6.189275121688842,
|
|
"epoch": 1.6543566070398152,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00047362186531773156,
|
|
"loss": 5.8586,
|
|
"mean_token_accuracy": 0.18725836277008057,
|
|
"num_tokens": 36326300.0,
|
|
"step": 14335
|
|
},
|
|
{
|
|
"entropy": 6.228783130645752,
|
|
"epoch": 1.654933641084824,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004736024752845008,
|
|
"loss": 5.7745,
|
|
"mean_token_accuracy": 0.18818582445383072,
|
|
"num_tokens": 36338234.0,
|
|
"step": 14340
|
|
},
|
|
{
|
|
"entropy": 6.295052719116211,
|
|
"epoch": 1.6555106751298325,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004735830785713746,
|
|
"loss": 5.839,
|
|
"mean_token_accuracy": 0.18417955487966536,
|
|
"num_tokens": 36351032.0,
|
|
"step": 14345
|
|
},
|
|
{
|
|
"entropy": 6.242326784133911,
|
|
"epoch": 1.6560877091748414,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004735636751790051,
|
|
"loss": 5.7387,
|
|
"mean_token_accuracy": 0.1901518702507019,
|
|
"num_tokens": 36363267.0,
|
|
"step": 14350
|
|
},
|
|
{
|
|
"entropy": 6.219479417800903,
|
|
"epoch": 1.65666474321985,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000473544265108045,
|
|
"loss": 5.8147,
|
|
"mean_token_accuracy": 0.19406894594430923,
|
|
"num_tokens": 36375628.0,
|
|
"step": 14355
|
|
},
|
|
{
|
|
"entropy": 6.241999006271362,
|
|
"epoch": 1.6572417772648587,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00047352484835914716,
|
|
"loss": 5.8367,
|
|
"mean_token_accuracy": 0.18755433857440948,
|
|
"num_tokens": 36388161.0,
|
|
"step": 14360
|
|
},
|
|
{
|
|
"entropy": 6.253871107101441,
|
|
"epoch": 1.6578188113098673,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004735054249329647,
|
|
"loss": 5.7901,
|
|
"mean_token_accuracy": 0.19120151847600936,
|
|
"num_tokens": 36400287.0,
|
|
"step": 14365
|
|
},
|
|
{
|
|
"entropy": 6.257974624633789,
|
|
"epoch": 1.658395845354876,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00047348599483015087,
|
|
"loss": 5.8799,
|
|
"mean_token_accuracy": 0.19049407839775084,
|
|
"num_tokens": 36413896.0,
|
|
"step": 14370
|
|
},
|
|
{
|
|
"entropy": 6.253906106948852,
|
|
"epoch": 1.6589728793998846,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00047346655805135916,
|
|
"loss": 5.7927,
|
|
"mean_token_accuracy": 0.19061724245548248,
|
|
"num_tokens": 36425812.0,
|
|
"step": 14375
|
|
},
|
|
{
|
|
"entropy": 6.214411783218384,
|
|
"epoch": 1.6595499134448932,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004734471145972434,
|
|
"loss": 5.7935,
|
|
"mean_token_accuracy": 0.18819109499454498,
|
|
"num_tokens": 36438977.0,
|
|
"step": 14380
|
|
},
|
|
{
|
|
"entropy": 6.262951374053955,
|
|
"epoch": 1.6601269474899019,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00047342766446845753,
|
|
"loss": 5.8245,
|
|
"mean_token_accuracy": 0.1869310572743416,
|
|
"num_tokens": 36453173.0,
|
|
"step": 14385
|
|
},
|
|
{
|
|
"entropy": 6.281124496459961,
|
|
"epoch": 1.6607039815349105,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004734082076656557,
|
|
"loss": 5.7762,
|
|
"mean_token_accuracy": 0.1942988872528076,
|
|
"num_tokens": 36464977.0,
|
|
"step": 14390
|
|
},
|
|
{
|
|
"entropy": 6.250260543823242,
|
|
"epoch": 1.6612810155799194,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00047338874418949235,
|
|
"loss": 5.896,
|
|
"mean_token_accuracy": 0.18223095685243607,
|
|
"num_tokens": 36476951.0,
|
|
"step": 14395
|
|
},
|
|
{
|
|
"entropy": 6.25014476776123,
|
|
"epoch": 1.6618580496249278,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.00047336927404062213,
|
|
"loss": 5.876,
|
|
"mean_token_accuracy": 0.18608336001634598,
|
|
"num_tokens": 36490387.0,
|
|
"step": 14400
|
|
},
|
|
{
|
|
"entropy": 6.303406810760498,
|
|
"epoch": 1.6624350836699366,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00047334979721969995,
|
|
"loss": 5.8402,
|
|
"mean_token_accuracy": 0.18937479555606843,
|
|
"num_tokens": 36501958.0,
|
|
"step": 14405
|
|
},
|
|
{
|
|
"entropy": 6.3160100936889645,
|
|
"epoch": 1.663012117714945,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004733303137273808,
|
|
"loss": 5.8947,
|
|
"mean_token_accuracy": 0.18646145313978196,
|
|
"num_tokens": 36515355.0,
|
|
"step": 14410
|
|
},
|
|
{
|
|
"entropy": 6.299543190002441,
|
|
"epoch": 1.663589151759954,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00047331082356432015,
|
|
"loss": 5.8883,
|
|
"mean_token_accuracy": 0.18837940245866774,
|
|
"num_tokens": 36528288.0,
|
|
"step": 14415
|
|
},
|
|
{
|
|
"entropy": 6.350749063491821,
|
|
"epoch": 1.6641661858049623,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004732913267311734,
|
|
"loss": 5.8876,
|
|
"mean_token_accuracy": 0.18897933512926102,
|
|
"num_tokens": 36541577.0,
|
|
"step": 14420
|
|
},
|
|
{
|
|
"entropy": 6.26870493888855,
|
|
"epoch": 1.6647432198499712,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004732718232285964,
|
|
"loss": 5.8037,
|
|
"mean_token_accuracy": 0.19384131133556365,
|
|
"num_tokens": 36554802.0,
|
|
"step": 14425
|
|
},
|
|
{
|
|
"entropy": 6.243334054946899,
|
|
"epoch": 1.6653202538949798,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00047325231305724507,
|
|
"loss": 5.7683,
|
|
"mean_token_accuracy": 0.19212243258953093,
|
|
"num_tokens": 36567175.0,
|
|
"step": 14430
|
|
},
|
|
{
|
|
"entropy": 6.189241361618042,
|
|
"epoch": 1.6658972879399885,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004732327962177757,
|
|
"loss": 5.7606,
|
|
"mean_token_accuracy": 0.20297178626060486,
|
|
"num_tokens": 36579391.0,
|
|
"step": 14435
|
|
},
|
|
{
|
|
"entropy": 6.300449275970459,
|
|
"epoch": 1.6664743219849971,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004732132727108447,
|
|
"loss": 5.8576,
|
|
"mean_token_accuracy": 0.18773895353078843,
|
|
"num_tokens": 36592684.0,
|
|
"step": 14440
|
|
},
|
|
{
|
|
"entropy": 6.249213838577271,
|
|
"epoch": 1.6670513560300058,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00047319374253710874,
|
|
"loss": 5.8894,
|
|
"mean_token_accuracy": 0.1900160625576973,
|
|
"num_tokens": 36604996.0,
|
|
"step": 14445
|
|
},
|
|
{
|
|
"entropy": 6.278888511657715,
|
|
"epoch": 1.6676283900750144,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004731742056972247,
|
|
"loss": 5.7876,
|
|
"mean_token_accuracy": 0.19654055088758468,
|
|
"num_tokens": 36618914.0,
|
|
"step": 14450
|
|
},
|
|
{
|
|
"entropy": 6.2485129833221436,
|
|
"epoch": 1.668205424120023,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004731546621918497,
|
|
"loss": 5.7587,
|
|
"mean_token_accuracy": 0.19068465381860733,
|
|
"num_tokens": 36630527.0,
|
|
"step": 14455
|
|
},
|
|
{
|
|
"entropy": 6.2103640079498295,
|
|
"epoch": 1.668782458165032,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.000473135112021641,
|
|
"loss": 5.8591,
|
|
"mean_token_accuracy": 0.18707639425992967,
|
|
"num_tokens": 36642605.0,
|
|
"step": 14460
|
|
},
|
|
{
|
|
"entropy": 6.25440354347229,
|
|
"epoch": 1.6693594922100403,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00047311555518725617,
|
|
"loss": 5.7669,
|
|
"mean_token_accuracy": 0.19207081943750381,
|
|
"num_tokens": 36655075.0,
|
|
"step": 14465
|
|
},
|
|
{
|
|
"entropy": 6.2060243606567385,
|
|
"epoch": 1.6699365262550492,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047309599168935323,
|
|
"loss": 5.7996,
|
|
"mean_token_accuracy": 0.19139713943004608,
|
|
"num_tokens": 36667684.0,
|
|
"step": 14470
|
|
},
|
|
{
|
|
"entropy": 6.264299297332764,
|
|
"epoch": 1.6705135603000576,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047307642152858993,
|
|
"loss": 5.8135,
|
|
"mean_token_accuracy": 0.19109832346439362,
|
|
"num_tokens": 36679656.0,
|
|
"step": 14475
|
|
},
|
|
{
|
|
"entropy": 6.1772970199584964,
|
|
"epoch": 1.6710905943450665,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00047305684470562453,
|
|
"loss": 5.755,
|
|
"mean_token_accuracy": 0.19919458031654358,
|
|
"num_tokens": 36691691.0,
|
|
"step": 14480
|
|
},
|
|
{
|
|
"entropy": 6.228798484802246,
|
|
"epoch": 1.6716676283900749,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004730372612211156,
|
|
"loss": 5.8375,
|
|
"mean_token_accuracy": 0.19381739795207978,
|
|
"num_tokens": 36703615.0,
|
|
"step": 14485
|
|
},
|
|
{
|
|
"entropy": 6.282718276977539,
|
|
"epoch": 1.6722446624350837,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00047301767107572174,
|
|
"loss": 5.8186,
|
|
"mean_token_accuracy": 0.1860135242342949,
|
|
"num_tokens": 36716299.0,
|
|
"step": 14490
|
|
},
|
|
{
|
|
"entropy": 6.275322389602661,
|
|
"epoch": 1.6728216964800924,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004729980742701018,
|
|
"loss": 5.8049,
|
|
"mean_token_accuracy": 0.18858209103345872,
|
|
"num_tokens": 36727723.0,
|
|
"step": 14495
|
|
},
|
|
{
|
|
"entropy": 6.198411750793457,
|
|
"epoch": 1.673398730525101,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004729784708049151,
|
|
"loss": 5.6589,
|
|
"mean_token_accuracy": 0.20318579077720642,
|
|
"num_tokens": 36740497.0,
|
|
"step": 14500
|
|
},
|
|
{
|
|
"entropy": 6.123383331298828,
|
|
"epoch": 1.6739757645701097,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004729588606808209,
|
|
"loss": 5.7248,
|
|
"mean_token_accuracy": 0.19112390279769897,
|
|
"num_tokens": 36752862.0,
|
|
"step": 14505
|
|
},
|
|
{
|
|
"entropy": 6.287880277633667,
|
|
"epoch": 1.6745527986151183,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00047293924389847864,
|
|
"loss": 5.7944,
|
|
"mean_token_accuracy": 0.19351442903280258,
|
|
"num_tokens": 36765948.0,
|
|
"step": 14510
|
|
},
|
|
{
|
|
"entropy": 6.265487384796143,
|
|
"epoch": 1.675129832660127,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004729196204585483,
|
|
"loss": 5.8009,
|
|
"mean_token_accuracy": 0.19770944267511367,
|
|
"num_tokens": 36778768.0,
|
|
"step": 14515
|
|
},
|
|
{
|
|
"entropy": 6.250596046447754,
|
|
"epoch": 1.6757068667051356,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00047289999036168983,
|
|
"loss": 5.8277,
|
|
"mean_token_accuracy": 0.18962397873401643,
|
|
"num_tokens": 36790941.0,
|
|
"step": 14520
|
|
},
|
|
{
|
|
"entropy": 6.276755619049072,
|
|
"epoch": 1.6762839007501442,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004728803536085634,
|
|
"loss": 5.8926,
|
|
"mean_token_accuracy": 0.1894552379846573,
|
|
"num_tokens": 36803984.0,
|
|
"step": 14525
|
|
},
|
|
{
|
|
"entropy": 6.22985348701477,
|
|
"epoch": 1.6768609347951529,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00047286071019982974,
|
|
"loss": 5.7018,
|
|
"mean_token_accuracy": 0.20174630880355834,
|
|
"num_tokens": 36815079.0,
|
|
"step": 14530
|
|
},
|
|
{
|
|
"entropy": 6.265960168838501,
|
|
"epoch": 1.6774379688401617,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00047284106013614926,
|
|
"loss": 5.8432,
|
|
"mean_token_accuracy": 0.19024327546358108,
|
|
"num_tokens": 36828007.0,
|
|
"step": 14535
|
|
},
|
|
{
|
|
"entropy": 6.286230373382568,
|
|
"epoch": 1.6780150028851701,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000472821403418183,
|
|
"loss": 5.9272,
|
|
"mean_token_accuracy": 0.18469211161136628,
|
|
"num_tokens": 36841762.0,
|
|
"step": 14540
|
|
},
|
|
{
|
|
"entropy": 6.2628261089324955,
|
|
"epoch": 1.678592036930179,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004728017400465921,
|
|
"loss": 5.7975,
|
|
"mean_token_accuracy": 0.1922488570213318,
|
|
"num_tokens": 36854624.0,
|
|
"step": 14545
|
|
},
|
|
{
|
|
"entropy": 6.246957540512085,
|
|
"epoch": 1.6791690709751874,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00047278207002203796,
|
|
"loss": 5.7187,
|
|
"mean_token_accuracy": 0.1921593114733696,
|
|
"num_tokens": 36866266.0,
|
|
"step": 14550
|
|
},
|
|
{
|
|
"entropy": 6.253695058822632,
|
|
"epoch": 1.6797461050201963,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00047276239334518216,
|
|
"loss": 5.858,
|
|
"mean_token_accuracy": 0.19074209034442902,
|
|
"num_tokens": 36878813.0,
|
|
"step": 14555
|
|
},
|
|
{
|
|
"entropy": 6.23266019821167,
|
|
"epoch": 1.6803231390652047,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00047274271001668646,
|
|
"loss": 5.798,
|
|
"mean_token_accuracy": 0.1866303414106369,
|
|
"num_tokens": 36891848.0,
|
|
"step": 14560
|
|
},
|
|
{
|
|
"entropy": 6.179357194900513,
|
|
"epoch": 1.6809001731102136,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00047272302003721286,
|
|
"loss": 5.799,
|
|
"mean_token_accuracy": 0.190840882062912,
|
|
"num_tokens": 36903861.0,
|
|
"step": 14565
|
|
},
|
|
{
|
|
"entropy": 6.256790113449097,
|
|
"epoch": 1.6814772071552222,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00047270332340742377,
|
|
"loss": 5.8563,
|
|
"mean_token_accuracy": 0.18791476786136627,
|
|
"num_tokens": 36916849.0,
|
|
"step": 14570
|
|
},
|
|
{
|
|
"entropy": 6.325413751602173,
|
|
"epoch": 1.6820542412002308,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00047268362012798157,
|
|
"loss": 5.8472,
|
|
"mean_token_accuracy": 0.18315469324588776,
|
|
"num_tokens": 36929559.0,
|
|
"step": 14575
|
|
},
|
|
{
|
|
"entropy": 6.102227115631104,
|
|
"epoch": 1.6826312752452395,
|
|
"grad_norm": 1.703125,
|
|
"learning_rate": 0.0004726639101995491,
|
|
"loss": 5.5979,
|
|
"mean_token_accuracy": 0.20988662987947465,
|
|
"num_tokens": 36943958.0,
|
|
"step": 14580
|
|
},
|
|
{
|
|
"entropy": 6.208522462844849,
|
|
"epoch": 1.6832083092902481,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00047264419362278906,
|
|
"loss": 5.7652,
|
|
"mean_token_accuracy": 0.19693288952112198,
|
|
"num_tokens": 36956542.0,
|
|
"step": 14585
|
|
},
|
|
{
|
|
"entropy": 6.227226400375367,
|
|
"epoch": 1.6837853433352568,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00047262447039836484,
|
|
"loss": 5.8169,
|
|
"mean_token_accuracy": 0.19118765741586685,
|
|
"num_tokens": 36968872.0,
|
|
"step": 14590
|
|
},
|
|
{
|
|
"entropy": 6.201617908477783,
|
|
"epoch": 1.6843623773802654,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047260474052693963,
|
|
"loss": 5.7863,
|
|
"mean_token_accuracy": 0.1912344291806221,
|
|
"num_tokens": 36982234.0,
|
|
"step": 14595
|
|
},
|
|
{
|
|
"entropy": 6.216722536087036,
|
|
"epoch": 1.684939411425274,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00047258500400917724,
|
|
"loss": 5.7898,
|
|
"mean_token_accuracy": 0.19123946577310563,
|
|
"num_tokens": 36994407.0,
|
|
"step": 14600
|
|
},
|
|
{
|
|
"entropy": 6.290629053115845,
|
|
"epoch": 1.6855164454702827,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00047256526084574137,
|
|
"loss": 5.831,
|
|
"mean_token_accuracy": 0.1835671290755272,
|
|
"num_tokens": 37006147.0,
|
|
"step": 14605
|
|
},
|
|
{
|
|
"entropy": 6.270266962051392,
|
|
"epoch": 1.6860934795152915,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00047254551103729597,
|
|
"loss": 5.766,
|
|
"mean_token_accuracy": 0.19732389599084854,
|
|
"num_tokens": 37018206.0,
|
|
"step": 14610
|
|
},
|
|
{
|
|
"entropy": 6.258600664138794,
|
|
"epoch": 1.6866705135603,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004725257545845055,
|
|
"loss": 5.8646,
|
|
"mean_token_accuracy": 0.18402135372161865,
|
|
"num_tokens": 37030632.0,
|
|
"step": 14615
|
|
},
|
|
{
|
|
"entropy": 6.138081741333008,
|
|
"epoch": 1.6872475476053088,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00047250599148803443,
|
|
"loss": 5.6794,
|
|
"mean_token_accuracy": 0.199339559674263,
|
|
"num_tokens": 37041700.0,
|
|
"step": 14620
|
|
},
|
|
{
|
|
"entropy": 6.236639738082886,
|
|
"epoch": 1.6878245816503172,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00047248622174854746,
|
|
"loss": 5.8093,
|
|
"mean_token_accuracy": 0.1956299975514412,
|
|
"num_tokens": 37054467.0,
|
|
"step": 14625
|
|
},
|
|
{
|
|
"entropy": 6.167034578323364,
|
|
"epoch": 1.688401615695326,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004724664453667094,
|
|
"loss": 5.7254,
|
|
"mean_token_accuracy": 0.1935678869485855,
|
|
"num_tokens": 37066596.0,
|
|
"step": 14630
|
|
},
|
|
{
|
|
"entropy": 6.227866506576538,
|
|
"epoch": 1.6889786497403345,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004724466623431857,
|
|
"loss": 5.856,
|
|
"mean_token_accuracy": 0.18633525371551513,
|
|
"num_tokens": 37078812.0,
|
|
"step": 14635
|
|
},
|
|
{
|
|
"entropy": 6.278513717651367,
|
|
"epoch": 1.6895556837853434,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004724268726786415,
|
|
"loss": 5.8192,
|
|
"mean_token_accuracy": 0.1916288822889328,
|
|
"num_tokens": 37090916.0,
|
|
"step": 14640
|
|
},
|
|
{
|
|
"entropy": 6.161556243896484,
|
|
"epoch": 1.690132717830352,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004724070763737424,
|
|
"loss": 5.6629,
|
|
"mean_token_accuracy": 0.20890249609947203,
|
|
"num_tokens": 37104687.0,
|
|
"step": 14645
|
|
},
|
|
{
|
|
"entropy": 6.254812526702881,
|
|
"epoch": 1.6907097518753607,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004723872734291545,
|
|
"loss": 5.867,
|
|
"mean_token_accuracy": 0.19037088453769685,
|
|
"num_tokens": 37117763.0,
|
|
"step": 14650
|
|
},
|
|
{
|
|
"entropy": 6.245172071456909,
|
|
"epoch": 1.6912867859203693,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00047236746384554364,
|
|
"loss": 5.7302,
|
|
"mean_token_accuracy": 0.19735212624073029,
|
|
"num_tokens": 37130355.0,
|
|
"step": 14655
|
|
},
|
|
{
|
|
"entropy": 6.27752685546875,
|
|
"epoch": 1.691863819965378,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004723476476235762,
|
|
"loss": 5.7599,
|
|
"mean_token_accuracy": 0.19666002839803695,
|
|
"num_tokens": 37142116.0,
|
|
"step": 14660
|
|
},
|
|
{
|
|
"entropy": 6.163359785079956,
|
|
"epoch": 1.6924408540103866,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004723278247639186,
|
|
"loss": 5.741,
|
|
"mean_token_accuracy": 0.19864833503961563,
|
|
"num_tokens": 37153841.0,
|
|
"step": 14665
|
|
},
|
|
{
|
|
"entropy": 6.198128128051758,
|
|
"epoch": 1.6930178880553952,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004723079952672377,
|
|
"loss": 5.7553,
|
|
"mean_token_accuracy": 0.19592914432287217,
|
|
"num_tokens": 37165119.0,
|
|
"step": 14670
|
|
},
|
|
{
|
|
"entropy": 6.284871768951416,
|
|
"epoch": 1.693594922100404,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00047228815913420035,
|
|
"loss": 5.8468,
|
|
"mean_token_accuracy": 0.19341864287853242,
|
|
"num_tokens": 37178188.0,
|
|
"step": 14675
|
|
},
|
|
{
|
|
"entropy": 6.171255970001221,
|
|
"epoch": 1.6941719561454125,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004722683163654738,
|
|
"loss": 5.716,
|
|
"mean_token_accuracy": 0.20382838249206542,
|
|
"num_tokens": 37190211.0,
|
|
"step": 14680
|
|
},
|
|
{
|
|
"entropy": 6.188739013671875,
|
|
"epoch": 1.6947489901904214,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004722484669617254,
|
|
"loss": 5.7178,
|
|
"mean_token_accuracy": 0.19711641371250152,
|
|
"num_tokens": 37202408.0,
|
|
"step": 14685
|
|
},
|
|
{
|
|
"entropy": 6.259600734710693,
|
|
"epoch": 1.6953260242354298,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00047222861092362277,
|
|
"loss": 5.8085,
|
|
"mean_token_accuracy": 0.190089850127697,
|
|
"num_tokens": 37214393.0,
|
|
"step": 14690
|
|
},
|
|
{
|
|
"entropy": 6.2397665023803714,
|
|
"epoch": 1.6959030582804386,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047220874825183387,
|
|
"loss": 5.7293,
|
|
"mean_token_accuracy": 0.19584015309810637,
|
|
"num_tokens": 37227212.0,
|
|
"step": 14695
|
|
},
|
|
{
|
|
"entropy": 6.1494776725769045,
|
|
"epoch": 1.696480092325447,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00047218887894702656,
|
|
"loss": 5.7782,
|
|
"mean_token_accuracy": 0.1920495629310608,
|
|
"num_tokens": 37239742.0,
|
|
"step": 14700
|
|
},
|
|
{
|
|
"entropy": 6.268459510803223,
|
|
"epoch": 1.697057126370456,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004721690030098693,
|
|
"loss": 5.8354,
|
|
"mean_token_accuracy": 0.1878738060593605,
|
|
"num_tokens": 37254037.0,
|
|
"step": 14705
|
|
},
|
|
{
|
|
"entropy": 6.303516960144043,
|
|
"epoch": 1.6976341604154646,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004721491204410305,
|
|
"loss": 5.8516,
|
|
"mean_token_accuracy": 0.18976494073867797,
|
|
"num_tokens": 37265221.0,
|
|
"step": 14710
|
|
},
|
|
{
|
|
"entropy": 6.296883869171142,
|
|
"epoch": 1.6982111944604732,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00047212923124117915,
|
|
"loss": 5.8096,
|
|
"mean_token_accuracy": 0.19008704870939255,
|
|
"num_tokens": 37277992.0,
|
|
"step": 14715
|
|
},
|
|
{
|
|
"entropy": 6.190418481826782,
|
|
"epoch": 1.6987882285054818,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004721093354109839,
|
|
"loss": 5.7514,
|
|
"mean_token_accuracy": 0.1978226602077484,
|
|
"num_tokens": 37291608.0,
|
|
"step": 14720
|
|
},
|
|
{
|
|
"entropy": 6.243216705322266,
|
|
"epoch": 1.6993652625504905,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00047208943295111406,
|
|
"loss": 5.805,
|
|
"mean_token_accuracy": 0.18855539560317994,
|
|
"num_tokens": 37303619.0,
|
|
"step": 14725
|
|
},
|
|
{
|
|
"entropy": 6.267891263961792,
|
|
"epoch": 1.6999422965954991,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047206952386223905,
|
|
"loss": 5.8398,
|
|
"mean_token_accuracy": 0.1896793693304062,
|
|
"num_tokens": 37316215.0,
|
|
"step": 14730
|
|
},
|
|
{
|
|
"entropy": 6.196926593780518,
|
|
"epoch": 1.7005193306405078,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004720496081450285,
|
|
"loss": 5.8059,
|
|
"mean_token_accuracy": 0.19608232825994493,
|
|
"num_tokens": 37328643.0,
|
|
"step": 14735
|
|
},
|
|
{
|
|
"entropy": 6.205492639541626,
|
|
"epoch": 1.7010963646855164,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00047202968580015224,
|
|
"loss": 5.7457,
|
|
"mean_token_accuracy": 0.19729107320308686,
|
|
"num_tokens": 37340792.0,
|
|
"step": 14740
|
|
},
|
|
{
|
|
"entropy": 6.328804779052734,
|
|
"epoch": 1.701673398730525,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00047200975682828045,
|
|
"loss": 5.7846,
|
|
"mean_token_accuracy": 0.18756407052278518,
|
|
"num_tokens": 37353866.0,
|
|
"step": 14745
|
|
},
|
|
{
|
|
"entropy": 6.197791004180909,
|
|
"epoch": 1.702250432775534,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004719898212300832,
|
|
"loss": 5.7893,
|
|
"mean_token_accuracy": 0.1926332965493202,
|
|
"num_tokens": 37365403.0,
|
|
"step": 14750
|
|
},
|
|
{
|
|
"entropy": 6.213804912567139,
|
|
"epoch": 1.7028274668205423,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00047196987900623134,
|
|
"loss": 5.7799,
|
|
"mean_token_accuracy": 0.1956440106034279,
|
|
"num_tokens": 37379487.0,
|
|
"step": 14755
|
|
},
|
|
{
|
|
"entropy": 6.288925409317017,
|
|
"epoch": 1.7034045008655512,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00047194993015739527,
|
|
"loss": 5.7255,
|
|
"mean_token_accuracy": 0.19549834579229355,
|
|
"num_tokens": 37392497.0,
|
|
"step": 14760
|
|
},
|
|
{
|
|
"entropy": 6.151324367523193,
|
|
"epoch": 1.7039815349105596,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00047192997468424624,
|
|
"loss": 5.6554,
|
|
"mean_token_accuracy": 0.2037911593914032,
|
|
"num_tokens": 37407126.0,
|
|
"step": 14765
|
|
},
|
|
{
|
|
"entropy": 6.107523441314697,
|
|
"epoch": 1.7045585689555685,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004719100125874553,
|
|
"loss": 5.7359,
|
|
"mean_token_accuracy": 0.20345260202884674,
|
|
"num_tokens": 37419768.0,
|
|
"step": 14770
|
|
},
|
|
{
|
|
"entropy": 6.216525936126709,
|
|
"epoch": 1.7051356030005769,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004718900438676939,
|
|
"loss": 5.7706,
|
|
"mean_token_accuracy": 0.1966918244957924,
|
|
"num_tokens": 37432512.0,
|
|
"step": 14775
|
|
},
|
|
{
|
|
"entropy": 6.280521440505981,
|
|
"epoch": 1.7057126370455857,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004718700685256337,
|
|
"loss": 5.8818,
|
|
"mean_token_accuracy": 0.19116677343845367,
|
|
"num_tokens": 37445006.0,
|
|
"step": 14780
|
|
},
|
|
{
|
|
"entropy": 6.279793214797974,
|
|
"epoch": 1.7062896710905944,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004718500865619465,
|
|
"loss": 5.8623,
|
|
"mean_token_accuracy": 0.18711167126893996,
|
|
"num_tokens": 37457386.0,
|
|
"step": 14785
|
|
},
|
|
{
|
|
"entropy": 6.241596269607544,
|
|
"epoch": 1.706866705135603,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004718300979773044,
|
|
"loss": 5.7351,
|
|
"mean_token_accuracy": 0.2007654130458832,
|
|
"num_tokens": 37469773.0,
|
|
"step": 14790
|
|
},
|
|
{
|
|
"entropy": 6.293059015274048,
|
|
"epoch": 1.7074437391806117,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00047181010277237977,
|
|
"loss": 5.7562,
|
|
"mean_token_accuracy": 0.20070116072893143,
|
|
"num_tokens": 37483301.0,
|
|
"step": 14795
|
|
},
|
|
{
|
|
"entropy": 6.245371294021607,
|
|
"epoch": 1.7080207732256203,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004717901009478451,
|
|
"loss": 5.821,
|
|
"mean_token_accuracy": 0.19299632906913758,
|
|
"num_tokens": 37495110.0,
|
|
"step": 14800
|
|
},
|
|
{
|
|
"entropy": 6.242628049850464,
|
|
"epoch": 1.708597807270629,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00047177009250437313,
|
|
"loss": 5.7363,
|
|
"mean_token_accuracy": 0.20338231921195984,
|
|
"num_tokens": 37509281.0,
|
|
"step": 14805
|
|
},
|
|
{
|
|
"entropy": 6.195139837265015,
|
|
"epoch": 1.7091748413156376,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00047175007744263683,
|
|
"loss": 5.7811,
|
|
"mean_token_accuracy": 0.19870874732732774,
|
|
"num_tokens": 37522690.0,
|
|
"step": 14810
|
|
},
|
|
{
|
|
"entropy": 6.209357118606567,
|
|
"epoch": 1.7097518753606464,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00047173005576330935,
|
|
"loss": 5.7857,
|
|
"mean_token_accuracy": 0.19668878614902496,
|
|
"num_tokens": 37534737.0,
|
|
"step": 14815
|
|
},
|
|
{
|
|
"entropy": 6.265194892883301,
|
|
"epoch": 1.7103289094056549,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00047171002746706424,
|
|
"loss": 5.8194,
|
|
"mean_token_accuracy": 0.19461351931095122,
|
|
"num_tokens": 37547486.0,
|
|
"step": 14820
|
|
},
|
|
{
|
|
"entropy": 6.374362993240356,
|
|
"epoch": 1.7109059434506637,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00047168999255457506,
|
|
"loss": 5.8569,
|
|
"mean_token_accuracy": 0.1927626445889473,
|
|
"num_tokens": 37560083.0,
|
|
"step": 14825
|
|
},
|
|
{
|
|
"entropy": 6.199889993667602,
|
|
"epoch": 1.7114829774956721,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00047166995102651565,
|
|
"loss": 5.75,
|
|
"mean_token_accuracy": 0.19805205762386321,
|
|
"num_tokens": 37573260.0,
|
|
"step": 14830
|
|
},
|
|
{
|
|
"entropy": 6.248316097259521,
|
|
"epoch": 1.712060011540681,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004716499028835601,
|
|
"loss": 5.8518,
|
|
"mean_token_accuracy": 0.19746263325214386,
|
|
"num_tokens": 37586403.0,
|
|
"step": 14835
|
|
},
|
|
{
|
|
"entropy": 6.225171422958374,
|
|
"epoch": 1.7126370455856894,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004716298481263828,
|
|
"loss": 5.7769,
|
|
"mean_token_accuracy": 0.2004181981086731,
|
|
"num_tokens": 37600771.0,
|
|
"step": 14840
|
|
},
|
|
{
|
|
"entropy": 6.297064113616943,
|
|
"epoch": 1.7132140796306983,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004716097867556583,
|
|
"loss": 5.7504,
|
|
"mean_token_accuracy": 0.19541673809289933,
|
|
"num_tokens": 37613623.0,
|
|
"step": 14845
|
|
},
|
|
{
|
|
"entropy": 6.210472059249878,
|
|
"epoch": 1.713791113675707,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00047158971877206114,
|
|
"loss": 5.7217,
|
|
"mean_token_accuracy": 0.19584263861179352,
|
|
"num_tokens": 37624539.0,
|
|
"step": 14850
|
|
},
|
|
{
|
|
"entropy": 6.214003038406372,
|
|
"epoch": 1.7143681477207156,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004715696441762665,
|
|
"loss": 5.8254,
|
|
"mean_token_accuracy": 0.18597609251737596,
|
|
"num_tokens": 37636556.0,
|
|
"step": 14855
|
|
},
|
|
{
|
|
"entropy": 6.274157619476318,
|
|
"epoch": 1.7149451817657242,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00047154956296894954,
|
|
"loss": 5.7861,
|
|
"mean_token_accuracy": 0.1940763294696808,
|
|
"num_tokens": 37648369.0,
|
|
"step": 14860
|
|
},
|
|
{
|
|
"entropy": 6.290304517745971,
|
|
"epoch": 1.7155222158107328,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004715294751507856,
|
|
"loss": 5.8648,
|
|
"mean_token_accuracy": 0.18487513512372972,
|
|
"num_tokens": 37661118.0,
|
|
"step": 14865
|
|
},
|
|
{
|
|
"entropy": 6.264235591888427,
|
|
"epoch": 1.7160992498557415,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004715093807224505,
|
|
"loss": 5.7724,
|
|
"mean_token_accuracy": 0.19355957508087157,
|
|
"num_tokens": 37673915.0,
|
|
"step": 14870
|
|
},
|
|
{
|
|
"entropy": 6.220427656173706,
|
|
"epoch": 1.71667628390075,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.00047148927968462,
|
|
"loss": 5.786,
|
|
"mean_token_accuracy": 0.1952811747789383,
|
|
"num_tokens": 37687359.0,
|
|
"step": 14875
|
|
},
|
|
{
|
|
"entropy": 6.213399982452392,
|
|
"epoch": 1.7172533179457588,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00047146917203797,
|
|
"loss": 5.7825,
|
|
"mean_token_accuracy": 0.19128514379262923,
|
|
"num_tokens": 37700111.0,
|
|
"step": 14880
|
|
},
|
|
{
|
|
"entropy": 6.358771228790284,
|
|
"epoch": 1.7178303519907674,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004714490577831771,
|
|
"loss": 5.932,
|
|
"mean_token_accuracy": 0.18157403022050858,
|
|
"num_tokens": 37712707.0,
|
|
"step": 14885
|
|
},
|
|
{
|
|
"entropy": 6.3575211524963375,
|
|
"epoch": 1.7184073860357763,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004714289369209177,
|
|
"loss": 5.8625,
|
|
"mean_token_accuracy": 0.1848388597369194,
|
|
"num_tokens": 37724242.0,
|
|
"step": 14890
|
|
},
|
|
{
|
|
"entropy": 6.273309421539307,
|
|
"epoch": 1.7189844200807847,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00047140880945186863,
|
|
"loss": 5.7986,
|
|
"mean_token_accuracy": 0.19703706353902817,
|
|
"num_tokens": 37737451.0,
|
|
"step": 14895
|
|
},
|
|
{
|
|
"entropy": 6.281686735153198,
|
|
"epoch": 1.7195614541257935,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00047138867537670676,
|
|
"loss": 5.8386,
|
|
"mean_token_accuracy": 0.18533087223768235,
|
|
"num_tokens": 37749968.0,
|
|
"step": 14900
|
|
},
|
|
{
|
|
"entropy": 6.230262804031372,
|
|
"epoch": 1.720138488170802,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00047136853469610933,
|
|
"loss": 5.748,
|
|
"mean_token_accuracy": 0.20007234215736389,
|
|
"num_tokens": 37761961.0,
|
|
"step": 14905
|
|
},
|
|
{
|
|
"entropy": 6.231614208221435,
|
|
"epoch": 1.7207155222158108,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00047134838741075383,
|
|
"loss": 5.784,
|
|
"mean_token_accuracy": 0.19633534252643586,
|
|
"num_tokens": 37775089.0,
|
|
"step": 14910
|
|
},
|
|
{
|
|
"entropy": 6.256774854660034,
|
|
"epoch": 1.7212925562608192,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00047132823352131787,
|
|
"loss": 5.8697,
|
|
"mean_token_accuracy": 0.18893859386444092,
|
|
"num_tokens": 37787072.0,
|
|
"step": 14915
|
|
},
|
|
{
|
|
"entropy": 6.238740253448486,
|
|
"epoch": 1.721869590305828,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004713080730284793,
|
|
"loss": 5.7746,
|
|
"mean_token_accuracy": 0.1915179818868637,
|
|
"num_tokens": 37799162.0,
|
|
"step": 14920
|
|
},
|
|
{
|
|
"entropy": 6.227374458312989,
|
|
"epoch": 1.7224466243508367,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00047128790593291617,
|
|
"loss": 5.8036,
|
|
"mean_token_accuracy": 0.1961027055978775,
|
|
"num_tokens": 37811560.0,
|
|
"step": 14925
|
|
},
|
|
{
|
|
"entropy": 6.2812048435211185,
|
|
"epoch": 1.7230236583958454,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00047126773223530677,
|
|
"loss": 5.7289,
|
|
"mean_token_accuracy": 0.1987067461013794,
|
|
"num_tokens": 37823832.0,
|
|
"step": 14930
|
|
},
|
|
{
|
|
"entropy": 6.285789251327515,
|
|
"epoch": 1.723600692440854,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00047124755193632975,
|
|
"loss": 5.8148,
|
|
"mean_token_accuracy": 0.19008388817310334,
|
|
"num_tokens": 37836718.0,
|
|
"step": 14935
|
|
},
|
|
{
|
|
"entropy": 6.151156234741211,
|
|
"epoch": 1.7241777264858626,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00047122736503666377,
|
|
"loss": 5.7345,
|
|
"mean_token_accuracy": 0.19504396617412567,
|
|
"num_tokens": 37850001.0,
|
|
"step": 14940
|
|
},
|
|
{
|
|
"entropy": 6.159657716751099,
|
|
"epoch": 1.7247547605308713,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004712071715369878,
|
|
"loss": 5.6801,
|
|
"mean_token_accuracy": 0.2019476920366287,
|
|
"num_tokens": 37862425.0,
|
|
"step": 14945
|
|
},
|
|
{
|
|
"entropy": 6.231092023849487,
|
|
"epoch": 1.72533179457588,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004711869714379812,
|
|
"loss": 5.7032,
|
|
"mean_token_accuracy": 0.19919241815805436,
|
|
"num_tokens": 37874429.0,
|
|
"step": 14950
|
|
},
|
|
{
|
|
"entropy": 6.18427791595459,
|
|
"epoch": 1.7259088286208888,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004711667647403232,
|
|
"loss": 5.7714,
|
|
"mean_token_accuracy": 0.1992158979177475,
|
|
"num_tokens": 37888317.0,
|
|
"step": 14955
|
|
},
|
|
{
|
|
"entropy": 6.216259098052978,
|
|
"epoch": 1.7264858626658972,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00047114655144469354,
|
|
"loss": 5.7637,
|
|
"mean_token_accuracy": 0.19563002586364747,
|
|
"num_tokens": 37901101.0,
|
|
"step": 14960
|
|
},
|
|
{
|
|
"entropy": 6.275106811523438,
|
|
"epoch": 1.727062896710906,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00047112633155177203,
|
|
"loss": 5.8041,
|
|
"mean_token_accuracy": 0.19201582670211792,
|
|
"num_tokens": 37914013.0,
|
|
"step": 14965
|
|
},
|
|
{
|
|
"entropy": 6.162282419204712,
|
|
"epoch": 1.7276399307559145,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004711061050622388,
|
|
"loss": 5.7177,
|
|
"mean_token_accuracy": 0.20372351109981537,
|
|
"num_tokens": 37926799.0,
|
|
"step": 14970
|
|
},
|
|
{
|
|
"entropy": 6.157208204269409,
|
|
"epoch": 1.7282169648009233,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00047108587197677404,
|
|
"loss": 5.6915,
|
|
"mean_token_accuracy": 0.20362317562103271,
|
|
"num_tokens": 37939173.0,
|
|
"step": 14975
|
|
},
|
|
{
|
|
"entropy": 6.303074741363526,
|
|
"epoch": 1.7287939988459318,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00047106563229605845,
|
|
"loss": 5.8849,
|
|
"mean_token_accuracy": 0.1878253310918808,
|
|
"num_tokens": 37951030.0,
|
|
"step": 14980
|
|
},
|
|
{
|
|
"entropy": 6.284793043136597,
|
|
"epoch": 1.7293710328909406,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00047104538602077276,
|
|
"loss": 5.8565,
|
|
"mean_token_accuracy": 0.18910656869411469,
|
|
"num_tokens": 37964005.0,
|
|
"step": 14985
|
|
},
|
|
{
|
|
"entropy": 6.2199421405792235,
|
|
"epoch": 1.7299480669359493,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004710251331515978,
|
|
"loss": 5.8242,
|
|
"mean_token_accuracy": 0.18915827125310897,
|
|
"num_tokens": 37975851.0,
|
|
"step": 14990
|
|
},
|
|
{
|
|
"entropy": 6.276341295242309,
|
|
"epoch": 1.730525100980958,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00047100487368921485,
|
|
"loss": 5.8071,
|
|
"mean_token_accuracy": 0.1844043716788292,
|
|
"num_tokens": 37988008.0,
|
|
"step": 14995
|
|
},
|
|
{
|
|
"entropy": 6.245677185058594,
|
|
"epoch": 1.7311021350259665,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004709846076343055,
|
|
"loss": 5.8426,
|
|
"mean_token_accuracy": 0.19950297027826308,
|
|
"num_tokens": 38000915.0,
|
|
"step": 15000
|
|
},
|
|
{
|
|
"epoch": 1.7311021350259665,
|
|
"eval_entropy": 6.027668285749499,
|
|
"eval_loss": 5.859091758728027,
|
|
"eval_mean_token_accuracy": 0.198191051585094,
|
|
"eval_num_tokens": 38000915.0,
|
|
"eval_runtime": 17.5708,
|
|
"eval_samples_per_second": 1601.292,
|
|
"eval_steps_per_second": 200.162,
|
|
"step": 15000
|
|
},
|
|
{
|
|
"entropy": 6.1998467445373535,
|
|
"epoch": 1.7316791690709752,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00047096433498755103,
|
|
"loss": 5.7945,
|
|
"mean_token_accuracy": 0.19635732620954513,
|
|
"num_tokens": 38013109.0,
|
|
"step": 15005
|
|
},
|
|
{
|
|
"entropy": 6.225084114074707,
|
|
"epoch": 1.7322562031159838,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00047094405574963364,
|
|
"loss": 5.7896,
|
|
"mean_token_accuracy": 0.194148051738739,
|
|
"num_tokens": 38025969.0,
|
|
"step": 15010
|
|
},
|
|
{
|
|
"entropy": 6.260206031799316,
|
|
"epoch": 1.7328332371609925,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00047092376992123516,
|
|
"loss": 5.7628,
|
|
"mean_token_accuracy": 0.19929637908935546,
|
|
"num_tokens": 38039104.0,
|
|
"step": 15015
|
|
},
|
|
{
|
|
"entropy": 6.228306007385254,
|
|
"epoch": 1.733410271206001,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00047090347750303803,
|
|
"loss": 5.8441,
|
|
"mean_token_accuracy": 0.1936349615454674,
|
|
"num_tokens": 38053453.0,
|
|
"step": 15020
|
|
},
|
|
{
|
|
"entropy": 6.302817726135254,
|
|
"epoch": 1.7339873052510097,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004708831784957247,
|
|
"loss": 5.8718,
|
|
"mean_token_accuracy": 0.18640264719724656,
|
|
"num_tokens": 38064932.0,
|
|
"step": 15025
|
|
},
|
|
{
|
|
"entropy": 6.2317393779754635,
|
|
"epoch": 1.7345643392960186,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004708628728999781,
|
|
"loss": 5.7555,
|
|
"mean_token_accuracy": 0.1919494777917862,
|
|
"num_tokens": 38078904.0,
|
|
"step": 15030
|
|
},
|
|
{
|
|
"entropy": 6.292373132705689,
|
|
"epoch": 1.735141373341027,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004708425607164809,
|
|
"loss": 5.8553,
|
|
"mean_token_accuracy": 0.18859525322914122,
|
|
"num_tokens": 38092605.0,
|
|
"step": 15035
|
|
},
|
|
{
|
|
"entropy": 6.221016931533813,
|
|
"epoch": 1.7357184073860359,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004708222419459165,
|
|
"loss": 5.7408,
|
|
"mean_token_accuracy": 0.2024005964398384,
|
|
"num_tokens": 38105953.0,
|
|
"step": 15040
|
|
},
|
|
{
|
|
"entropy": 6.250510501861572,
|
|
"epoch": 1.7362954414310443,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004708019165889683,
|
|
"loss": 5.9294,
|
|
"mean_token_accuracy": 0.1820162132382393,
|
|
"num_tokens": 38118485.0,
|
|
"step": 15045
|
|
},
|
|
{
|
|
"entropy": 6.306356477737427,
|
|
"epoch": 1.7368724754760532,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004707815846463199,
|
|
"loss": 5.8671,
|
|
"mean_token_accuracy": 0.18989114910364152,
|
|
"num_tokens": 38131220.0,
|
|
"step": 15050
|
|
},
|
|
{
|
|
"entropy": 6.206059408187866,
|
|
"epoch": 1.7374495095210616,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004707612461186552,
|
|
"loss": 5.7749,
|
|
"mean_token_accuracy": 0.1962239608168602,
|
|
"num_tokens": 38143012.0,
|
|
"step": 15055
|
|
},
|
|
{
|
|
"entropy": 6.170250272750854,
|
|
"epoch": 1.7380265435660704,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00047074090100665805,
|
|
"loss": 5.6875,
|
|
"mean_token_accuracy": 0.20471351891756057,
|
|
"num_tokens": 38155810.0,
|
|
"step": 15060
|
|
},
|
|
{
|
|
"entropy": 6.262243032455444,
|
|
"epoch": 1.738603577611079,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00047072054931101306,
|
|
"loss": 5.8278,
|
|
"mean_token_accuracy": 0.18701076209545137,
|
|
"num_tokens": 38169183.0,
|
|
"step": 15065
|
|
},
|
|
{
|
|
"entropy": 6.228375577926636,
|
|
"epoch": 1.7391806116560877,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004707001910324046,
|
|
"loss": 5.8259,
|
|
"mean_token_accuracy": 0.18984763771295549,
|
|
"num_tokens": 38182098.0,
|
|
"step": 15070
|
|
},
|
|
{
|
|
"entropy": 6.3191286563873295,
|
|
"epoch": 1.7397576457010964,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047067982617151737,
|
|
"loss": 5.8301,
|
|
"mean_token_accuracy": 0.18910346925258636,
|
|
"num_tokens": 38194950.0,
|
|
"step": 15075
|
|
},
|
|
{
|
|
"entropy": 6.264245414733887,
|
|
"epoch": 1.740334679746105,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004706594547290365,
|
|
"loss": 5.7909,
|
|
"mean_token_accuracy": 0.19904323369264604,
|
|
"num_tokens": 38207600.0,
|
|
"step": 15080
|
|
},
|
|
{
|
|
"entropy": 6.226841163635254,
|
|
"epoch": 1.7409117137911136,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00047063907670564695,
|
|
"loss": 5.7119,
|
|
"mean_token_accuracy": 0.2084239214658737,
|
|
"num_tokens": 38219489.0,
|
|
"step": 15085
|
|
},
|
|
{
|
|
"entropy": 6.228709650039673,
|
|
"epoch": 1.7414887478361223,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004706186921020342,
|
|
"loss": 5.7838,
|
|
"mean_token_accuracy": 0.19626915454864502,
|
|
"num_tokens": 38233240.0,
|
|
"step": 15090
|
|
},
|
|
{
|
|
"entropy": 6.255122900009155,
|
|
"epoch": 1.7420657818811311,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00047059830091888407,
|
|
"loss": 5.7584,
|
|
"mean_token_accuracy": 0.19674482345581054,
|
|
"num_tokens": 38245967.0,
|
|
"step": 15095
|
|
},
|
|
{
|
|
"entropy": 6.243045997619629,
|
|
"epoch": 1.7426428159261396,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004705779031568821,
|
|
"loss": 5.7768,
|
|
"mean_token_accuracy": 0.18915130496025084,
|
|
"num_tokens": 38258586.0,
|
|
"step": 15100
|
|
},
|
|
{
|
|
"entropy": 6.210542440414429,
|
|
"epoch": 1.7432198499711484,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00047055749881671463,
|
|
"loss": 5.8401,
|
|
"mean_token_accuracy": 0.19314245879650116,
|
|
"num_tokens": 38270007.0,
|
|
"step": 15105
|
|
},
|
|
{
|
|
"entropy": 6.282091379165649,
|
|
"epoch": 1.7437968840161568,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004705370878990677,
|
|
"loss": 5.744,
|
|
"mean_token_accuracy": 0.19978414922952653,
|
|
"num_tokens": 38282580.0,
|
|
"step": 15110
|
|
},
|
|
{
|
|
"entropy": 6.2048032760620115,
|
|
"epoch": 1.7443739180611657,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00047051667040462806,
|
|
"loss": 5.6943,
|
|
"mean_token_accuracy": 0.20065076798200607,
|
|
"num_tokens": 38295577.0,
|
|
"step": 15115
|
|
},
|
|
{
|
|
"entropy": 6.218212985992432,
|
|
"epoch": 1.7449509521061741,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00047049624633408224,
|
|
"loss": 5.8663,
|
|
"mean_token_accuracy": 0.18592003136873245,
|
|
"num_tokens": 38307924.0,
|
|
"step": 15120
|
|
},
|
|
{
|
|
"entropy": 6.316382169723511,
|
|
"epoch": 1.745527986151183,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00047047581568811724,
|
|
"loss": 5.7687,
|
|
"mean_token_accuracy": 0.1929919019341469,
|
|
"num_tokens": 38321573.0,
|
|
"step": 15125
|
|
},
|
|
{
|
|
"entropy": 6.251517629623413,
|
|
"epoch": 1.7461050201961916,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047045537846742043,
|
|
"loss": 5.7673,
|
|
"mean_token_accuracy": 0.19639647901058196,
|
|
"num_tokens": 38333953.0,
|
|
"step": 15130
|
|
},
|
|
{
|
|
"entropy": 6.224976444244385,
|
|
"epoch": 1.7466820542412003,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.000470434934672679,
|
|
"loss": 5.8044,
|
|
"mean_token_accuracy": 0.18785583078861237,
|
|
"num_tokens": 38346028.0,
|
|
"step": 15135
|
|
},
|
|
{
|
|
"entropy": 6.290715026855469,
|
|
"epoch": 1.747259088286209,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00047041448430458054,
|
|
"loss": 5.7369,
|
|
"mean_token_accuracy": 0.19406510293483734,
|
|
"num_tokens": 38358806.0,
|
|
"step": 15140
|
|
},
|
|
{
|
|
"entropy": 6.217677211761474,
|
|
"epoch": 1.7478361223312175,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00047039402736381305,
|
|
"loss": 5.6909,
|
|
"mean_token_accuracy": 0.19793135076761245,
|
|
"num_tokens": 38370396.0,
|
|
"step": 15145
|
|
},
|
|
{
|
|
"entropy": 6.251976537704468,
|
|
"epoch": 1.7484131563762262,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004703735638510645,
|
|
"loss": 5.9143,
|
|
"mean_token_accuracy": 0.19204719215631486,
|
|
"num_tokens": 38383747.0,
|
|
"step": 15150
|
|
},
|
|
{
|
|
"entropy": 6.297483825683594,
|
|
"epoch": 1.7489901904212348,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004703530937670232,
|
|
"loss": 5.8218,
|
|
"mean_token_accuracy": 0.18911525160074233,
|
|
"num_tokens": 38396611.0,
|
|
"step": 15155
|
|
},
|
|
{
|
|
"entropy": 6.242986965179443,
|
|
"epoch": 1.7495672244662435,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004703326171123776,
|
|
"loss": 5.831,
|
|
"mean_token_accuracy": 0.19013755023479462,
|
|
"num_tokens": 38407627.0,
|
|
"step": 15160
|
|
},
|
|
{
|
|
"entropy": 6.129948234558105,
|
|
"epoch": 1.750144258511252,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004703121338878164,
|
|
"loss": 5.7308,
|
|
"mean_token_accuracy": 0.1990264892578125,
|
|
"num_tokens": 38420522.0,
|
|
"step": 15165
|
|
},
|
|
{
|
|
"entropy": 6.264822196960449,
|
|
"epoch": 1.750721292556261,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004702916440940286,
|
|
"loss": 5.8135,
|
|
"mean_token_accuracy": 0.19269165843725206,
|
|
"num_tokens": 38433968.0,
|
|
"step": 15170
|
|
},
|
|
{
|
|
"entropy": 6.245396900177002,
|
|
"epoch": 1.7512983266012694,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004702711477317034,
|
|
"loss": 5.8251,
|
|
"mean_token_accuracy": 0.1896095395088196,
|
|
"num_tokens": 38445819.0,
|
|
"step": 15175
|
|
},
|
|
{
|
|
"entropy": 6.314490032196045,
|
|
"epoch": 1.7518753606462782,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004702506448015301,
|
|
"loss": 5.8087,
|
|
"mean_token_accuracy": 0.19271332770586014,
|
|
"num_tokens": 38458823.0,
|
|
"step": 15180
|
|
},
|
|
{
|
|
"entropy": 6.226051235198975,
|
|
"epoch": 1.7524523946912867,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00047023013530419843,
|
|
"loss": 5.7935,
|
|
"mean_token_accuracy": 0.1927502915263176,
|
|
"num_tokens": 38472553.0,
|
|
"step": 15185
|
|
},
|
|
{
|
|
"entropy": 6.272993087768555,
|
|
"epoch": 1.7530294287362955,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004702096192403981,
|
|
"loss": 5.764,
|
|
"mean_token_accuracy": 0.19805403649806977,
|
|
"num_tokens": 38484143.0,
|
|
"step": 15190
|
|
},
|
|
{
|
|
"entropy": 6.22825927734375,
|
|
"epoch": 1.753606462781304,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004701890966108192,
|
|
"loss": 5.7884,
|
|
"mean_token_accuracy": 0.18909399807453156,
|
|
"num_tokens": 38496795.0,
|
|
"step": 15195
|
|
},
|
|
{
|
|
"entropy": 6.199388647079468,
|
|
"epoch": 1.7541834968263128,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000470168567416152,
|
|
"loss": 5.6885,
|
|
"mean_token_accuracy": 0.20440283715724944,
|
|
"num_tokens": 38509548.0,
|
|
"step": 15200
|
|
},
|
|
{
|
|
"entropy": 6.237175512313843,
|
|
"epoch": 1.7547605308713214,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004701480316570869,
|
|
"loss": 5.772,
|
|
"mean_token_accuracy": 0.19347795844078064,
|
|
"num_tokens": 38524011.0,
|
|
"step": 15205
|
|
},
|
|
{
|
|
"entropy": 6.263273048400879,
|
|
"epoch": 1.75533756491633,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004701274893343147,
|
|
"loss": 5.7944,
|
|
"mean_token_accuracy": 0.19191619306802749,
|
|
"num_tokens": 38536913.0,
|
|
"step": 15210
|
|
},
|
|
{
|
|
"entropy": 6.1626180648803714,
|
|
"epoch": 1.7559145989613387,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00047010694044852643,
|
|
"loss": 5.7562,
|
|
"mean_token_accuracy": 0.1957879841327667,
|
|
"num_tokens": 38548759.0,
|
|
"step": 15215
|
|
},
|
|
{
|
|
"entropy": 6.243113422393799,
|
|
"epoch": 1.7564916330063474,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000470086385000413,
|
|
"loss": 5.7656,
|
|
"mean_token_accuracy": 0.19853851497173308,
|
|
"num_tokens": 38562071.0,
|
|
"step": 15220
|
|
},
|
|
{
|
|
"entropy": 6.2278694152832035,
|
|
"epoch": 1.757068667051356,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004700658229906661,
|
|
"loss": 5.7928,
|
|
"mean_token_accuracy": 0.18952999264001846,
|
|
"num_tokens": 38573816.0,
|
|
"step": 15225
|
|
},
|
|
{
|
|
"entropy": 6.30017786026001,
|
|
"epoch": 1.7576457010963646,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00047004525441997694,
|
|
"loss": 5.8938,
|
|
"mean_token_accuracy": 0.1860449954867363,
|
|
"num_tokens": 38586625.0,
|
|
"step": 15230
|
|
},
|
|
{
|
|
"entropy": 6.262595701217651,
|
|
"epoch": 1.7582227351413735,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004700246792890376,
|
|
"loss": 5.8262,
|
|
"mean_token_accuracy": 0.19520506411790847,
|
|
"num_tokens": 38599391.0,
|
|
"step": 15235
|
|
},
|
|
{
|
|
"entropy": 6.215628337860108,
|
|
"epoch": 1.758799769186382,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004700040975985401,
|
|
"loss": 5.7351,
|
|
"mean_token_accuracy": 0.20383531004190444,
|
|
"num_tokens": 38610822.0,
|
|
"step": 15240
|
|
},
|
|
{
|
|
"entropy": 6.207050704956055,
|
|
"epoch": 1.7593768032313908,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00046998350934917654,
|
|
"loss": 5.7472,
|
|
"mean_token_accuracy": 0.19348314255475998,
|
|
"num_tokens": 38623886.0,
|
|
"step": 15245
|
|
},
|
|
{
|
|
"entropy": 6.198969173431396,
|
|
"epoch": 1.7599538372763992,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00046996291454163956,
|
|
"loss": 5.7118,
|
|
"mean_token_accuracy": 0.20203371942043305,
|
|
"num_tokens": 38636680.0,
|
|
"step": 15250
|
|
},
|
|
{
|
|
"entropy": 6.212174940109253,
|
|
"epoch": 1.760530871321408,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004699423131766218,
|
|
"loss": 5.7779,
|
|
"mean_token_accuracy": 0.2040209636092186,
|
|
"num_tokens": 38648841.0,
|
|
"step": 15255
|
|
},
|
|
{
|
|
"entropy": 6.171669149398804,
|
|
"epoch": 1.7611079053664165,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004699217052548161,
|
|
"loss": 5.7539,
|
|
"mean_token_accuracy": 0.2005374625325203,
|
|
"num_tokens": 38660603.0,
|
|
"step": 15260
|
|
},
|
|
{
|
|
"entropy": 6.237819528579712,
|
|
"epoch": 1.7616849394114253,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00046990109077691577,
|
|
"loss": 5.7766,
|
|
"mean_token_accuracy": 0.19491585344076157,
|
|
"num_tokens": 38674082.0,
|
|
"step": 15265
|
|
},
|
|
{
|
|
"entropy": 6.217108345031738,
|
|
"epoch": 1.762261973456434,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00046988046974361406,
|
|
"loss": 5.7206,
|
|
"mean_token_accuracy": 0.1978909581899643,
|
|
"num_tokens": 38686274.0,
|
|
"step": 15270
|
|
},
|
|
{
|
|
"entropy": 6.280757188796997,
|
|
"epoch": 1.7628390075014426,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004698598421556045,
|
|
"loss": 5.7949,
|
|
"mean_token_accuracy": 0.1977719321846962,
|
|
"num_tokens": 38699260.0,
|
|
"step": 15275
|
|
},
|
|
{
|
|
"entropy": 6.249194383621216,
|
|
"epoch": 1.7634160415464513,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004698392080135809,
|
|
"loss": 5.7858,
|
|
"mean_token_accuracy": 0.18940508514642715,
|
|
"num_tokens": 38712054.0,
|
|
"step": 15280
|
|
},
|
|
{
|
|
"entropy": 6.188735914230347,
|
|
"epoch": 1.76399307559146,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004698185673182374,
|
|
"loss": 5.7338,
|
|
"mean_token_accuracy": 0.20237622261047364,
|
|
"num_tokens": 38724634.0,
|
|
"step": 15285
|
|
},
|
|
{
|
|
"entropy": 6.214454269409179,
|
|
"epoch": 1.7645701096364685,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00046979792007026817,
|
|
"loss": 5.7185,
|
|
"mean_token_accuracy": 0.19849735498428345,
|
|
"num_tokens": 38737294.0,
|
|
"step": 15290
|
|
},
|
|
{
|
|
"entropy": 6.324564361572266,
|
|
"epoch": 1.7651471436814772,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004697772662703676,
|
|
"loss": 5.8993,
|
|
"mean_token_accuracy": 0.18402630239725112,
|
|
"num_tokens": 38749578.0,
|
|
"step": 15295
|
|
},
|
|
{
|
|
"entropy": 6.2132916927337645,
|
|
"epoch": 1.7657241777264858,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00046975660591923047,
|
|
"loss": 5.7805,
|
|
"mean_token_accuracy": 0.1883055880665779,
|
|
"num_tokens": 38762282.0,
|
|
"step": 15300
|
|
},
|
|
{
|
|
"entropy": 6.30076117515564,
|
|
"epoch": 1.7663012117714945,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004697359390175516,
|
|
"loss": 5.7676,
|
|
"mean_token_accuracy": 0.1952459216117859,
|
|
"num_tokens": 38773861.0,
|
|
"step": 15305
|
|
},
|
|
{
|
|
"entropy": 6.275486326217651,
|
|
"epoch": 1.7668782458165033,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00046971526556602625,
|
|
"loss": 5.8716,
|
|
"mean_token_accuracy": 0.18915152549743652,
|
|
"num_tokens": 38786427.0,
|
|
"step": 15310
|
|
},
|
|
{
|
|
"entropy": 6.263535261154175,
|
|
"epoch": 1.7674552798615117,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004696945855653495,
|
|
"loss": 5.856,
|
|
"mean_token_accuracy": 0.1845775306224823,
|
|
"num_tokens": 38798496.0,
|
|
"step": 15315
|
|
},
|
|
{
|
|
"entropy": 6.221828889846802,
|
|
"epoch": 1.7680323139065206,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004696738990162172,
|
|
"loss": 5.8379,
|
|
"mean_token_accuracy": 0.18447502553462983,
|
|
"num_tokens": 38812069.0,
|
|
"step": 15320
|
|
},
|
|
{
|
|
"entropy": 6.265704488754272,
|
|
"epoch": 1.768609347951529,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.000469653205919325,
|
|
"loss": 5.8781,
|
|
"mean_token_accuracy": 0.19169940948486328,
|
|
"num_tokens": 38824465.0,
|
|
"step": 15325
|
|
},
|
|
{
|
|
"entropy": 6.294767951965332,
|
|
"epoch": 1.7691863819965379,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00046963250627536884,
|
|
"loss": 5.8166,
|
|
"mean_token_accuracy": 0.1910833165049553,
|
|
"num_tokens": 38837328.0,
|
|
"step": 15330
|
|
},
|
|
{
|
|
"entropy": 6.208098030090332,
|
|
"epoch": 1.7697634160415463,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004696118000850451,
|
|
"loss": 5.7961,
|
|
"mean_token_accuracy": 0.19421351402997972,
|
|
"num_tokens": 38849238.0,
|
|
"step": 15335
|
|
},
|
|
{
|
|
"entropy": 6.192309045791626,
|
|
"epoch": 1.7703404500865552,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00046959108734905003,
|
|
"loss": 5.7641,
|
|
"mean_token_accuracy": 0.1998672679066658,
|
|
"num_tokens": 38861479.0,
|
|
"step": 15340
|
|
},
|
|
{
|
|
"entropy": 6.215923213958741,
|
|
"epoch": 1.7709174841315638,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00046957036806808045,
|
|
"loss": 5.7414,
|
|
"mean_token_accuracy": 0.19977018386125564,
|
|
"num_tokens": 38874342.0,
|
|
"step": 15345
|
|
},
|
|
{
|
|
"entropy": 6.221998167037964,
|
|
"epoch": 1.7714945181765724,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004695496422428332,
|
|
"loss": 5.7593,
|
|
"mean_token_accuracy": 0.19942527562379836,
|
|
"num_tokens": 38886595.0,
|
|
"step": 15350
|
|
},
|
|
{
|
|
"entropy": 6.248060798645019,
|
|
"epoch": 1.772071552221581,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004695289098740054,
|
|
"loss": 5.7896,
|
|
"mean_token_accuracy": 0.1939016655087471,
|
|
"num_tokens": 38899338.0,
|
|
"step": 15355
|
|
},
|
|
{
|
|
"entropy": 6.270295238494873,
|
|
"epoch": 1.7726485862665897,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004695081709622943,
|
|
"loss": 5.7699,
|
|
"mean_token_accuracy": 0.19445489048957826,
|
|
"num_tokens": 38911765.0,
|
|
"step": 15360
|
|
},
|
|
{
|
|
"entropy": 6.197941398620605,
|
|
"epoch": 1.7732256203115984,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00046948742550839744,
|
|
"loss": 5.7401,
|
|
"mean_token_accuracy": 0.2035606637597084,
|
|
"num_tokens": 38924137.0,
|
|
"step": 15365
|
|
},
|
|
{
|
|
"entropy": 6.26130781173706,
|
|
"epoch": 1.773802654356607,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004694666735130127,
|
|
"loss": 5.7189,
|
|
"mean_token_accuracy": 0.19911470264196396,
|
|
"num_tokens": 38936401.0,
|
|
"step": 15370
|
|
},
|
|
{
|
|
"entropy": 6.235423421859741,
|
|
"epoch": 1.7743796884016156,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.000469445914976838,
|
|
"loss": 5.8188,
|
|
"mean_token_accuracy": 0.19015101790428163,
|
|
"num_tokens": 38948224.0,
|
|
"step": 15375
|
|
},
|
|
{
|
|
"entropy": 6.26864709854126,
|
|
"epoch": 1.7749567224466243,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004694251499005715,
|
|
"loss": 5.7659,
|
|
"mean_token_accuracy": 0.19516605734825135,
|
|
"num_tokens": 38959924.0,
|
|
"step": 15380
|
|
},
|
|
{
|
|
"entropy": 6.2285974502563475,
|
|
"epoch": 1.7755337564916331,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004694043782849116,
|
|
"loss": 5.8013,
|
|
"mean_token_accuracy": 0.1916235476732254,
|
|
"num_tokens": 38973018.0,
|
|
"step": 15385
|
|
},
|
|
{
|
|
"entropy": 6.259120655059815,
|
|
"epoch": 1.7761107905366416,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00046938360013055715,
|
|
"loss": 5.8607,
|
|
"mean_token_accuracy": 0.18584455102682113,
|
|
"num_tokens": 38985634.0,
|
|
"step": 15390
|
|
},
|
|
{
|
|
"entropy": 6.284410619735718,
|
|
"epoch": 1.7766878245816504,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00046936281543820673,
|
|
"loss": 5.8258,
|
|
"mean_token_accuracy": 0.19096557646989823,
|
|
"num_tokens": 38999446.0,
|
|
"step": 15395
|
|
},
|
|
{
|
|
"entropy": 6.295167303085327,
|
|
"epoch": 1.7772648586266588,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00046934202420855967,
|
|
"loss": 5.8469,
|
|
"mean_token_accuracy": 0.19223827719688416,
|
|
"num_tokens": 39012974.0,
|
|
"step": 15400
|
|
},
|
|
{
|
|
"entropy": 6.223930025100708,
|
|
"epoch": 1.7778418926716677,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00046932122644231507,
|
|
"loss": 5.7461,
|
|
"mean_token_accuracy": 0.1959339052438736,
|
|
"num_tokens": 39025316.0,
|
|
"step": 15405
|
|
},
|
|
{
|
|
"entropy": 6.226829528808594,
|
|
"epoch": 1.7784189267166761,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00046930042214017256,
|
|
"loss": 5.6983,
|
|
"mean_token_accuracy": 0.20610239058732988,
|
|
"num_tokens": 39038174.0,
|
|
"step": 15410
|
|
},
|
|
{
|
|
"entropy": 6.30842137336731,
|
|
"epoch": 1.778995960761685,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004692796113028319,
|
|
"loss": 5.8718,
|
|
"mean_token_accuracy": 0.18104784041643143,
|
|
"num_tokens": 39051943.0,
|
|
"step": 15415
|
|
},
|
|
{
|
|
"entropy": 6.2169633388519285,
|
|
"epoch": 1.7795729948066936,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.000469258793930993,
|
|
"loss": 5.7505,
|
|
"mean_token_accuracy": 0.19396419674158097,
|
|
"num_tokens": 39064765.0,
|
|
"step": 15420
|
|
},
|
|
{
|
|
"entropy": 6.24879035949707,
|
|
"epoch": 1.7801500288517023,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00046923797002535605,
|
|
"loss": 5.8594,
|
|
"mean_token_accuracy": 0.18545962870121002,
|
|
"num_tokens": 39077326.0,
|
|
"step": 15425
|
|
},
|
|
{
|
|
"entropy": 6.255417680740356,
|
|
"epoch": 1.780727062896711,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004692171395866214,
|
|
"loss": 5.749,
|
|
"mean_token_accuracy": 0.19588208943605423,
|
|
"num_tokens": 39090049.0,
|
|
"step": 15430
|
|
},
|
|
{
|
|
"entropy": 6.237002658843994,
|
|
"epoch": 1.7813040969417195,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00046919630261548986,
|
|
"loss": 5.7838,
|
|
"mean_token_accuracy": 0.1968626856803894,
|
|
"num_tokens": 39102805.0,
|
|
"step": 15435
|
|
},
|
|
{
|
|
"entropy": 6.096398401260376,
|
|
"epoch": 1.7818811309867282,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00046917545911266207,
|
|
"loss": 5.688,
|
|
"mean_token_accuracy": 0.2085106134414673,
|
|
"num_tokens": 39115966.0,
|
|
"step": 15440
|
|
},
|
|
{
|
|
"entropy": 6.211426210403443,
|
|
"epoch": 1.7824581650317368,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046915460907883923,
|
|
"loss": 5.8036,
|
|
"mean_token_accuracy": 0.1936090975999832,
|
|
"num_tokens": 39128417.0,
|
|
"step": 15445
|
|
},
|
|
{
|
|
"entropy": 6.230034494400025,
|
|
"epoch": 1.7830351990767457,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00046913375251472246,
|
|
"loss": 5.7544,
|
|
"mean_token_accuracy": 0.19787432253360748,
|
|
"num_tokens": 39142338.0,
|
|
"step": 15450
|
|
},
|
|
{
|
|
"entropy": 6.252493810653687,
|
|
"epoch": 1.783612233121754,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00046911288942101345,
|
|
"loss": 5.8178,
|
|
"mean_token_accuracy": 0.19384605288505555,
|
|
"num_tokens": 39155055.0,
|
|
"step": 15455
|
|
},
|
|
{
|
|
"entropy": 6.257091951370239,
|
|
"epoch": 1.784189267166763,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004690920197984138,
|
|
"loss": 5.7942,
|
|
"mean_token_accuracy": 0.19681064337491988,
|
|
"num_tokens": 39167170.0,
|
|
"step": 15460
|
|
},
|
|
{
|
|
"entropy": 6.360779237747193,
|
|
"epoch": 1.7847663012117714,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004690711436476254,
|
|
"loss": 5.9037,
|
|
"mean_token_accuracy": 0.18777545541524887,
|
|
"num_tokens": 39181389.0,
|
|
"step": 15465
|
|
},
|
|
{
|
|
"entropy": 6.374752235412598,
|
|
"epoch": 1.7853433352567802,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00046905026096935056,
|
|
"loss": 5.8728,
|
|
"mean_token_accuracy": 0.18601856380701065,
|
|
"num_tokens": 39194728.0,
|
|
"step": 15470
|
|
},
|
|
{
|
|
"entropy": 6.148594760894776,
|
|
"epoch": 1.7859203693017887,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004690293717642916,
|
|
"loss": 5.7134,
|
|
"mean_token_accuracy": 0.20158033221960067,
|
|
"num_tokens": 39207945.0,
|
|
"step": 15475
|
|
},
|
|
{
|
|
"entropy": 6.253357934951782,
|
|
"epoch": 1.7864974033467975,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000469008476033151,
|
|
"loss": 5.8538,
|
|
"mean_token_accuracy": 0.1929816037416458,
|
|
"num_tokens": 39221314.0,
|
|
"step": 15480
|
|
},
|
|
{
|
|
"entropy": 6.276904487609864,
|
|
"epoch": 1.7870744373918062,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046898757377663176,
|
|
"loss": 5.8024,
|
|
"mean_token_accuracy": 0.1935829922556877,
|
|
"num_tokens": 39233910.0,
|
|
"step": 15485
|
|
},
|
|
{
|
|
"entropy": 6.246221685409546,
|
|
"epoch": 1.7876514714368148,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00046896666499543683,
|
|
"loss": 5.8003,
|
|
"mean_token_accuracy": 0.19562088698148727,
|
|
"num_tokens": 39246027.0,
|
|
"step": 15490
|
|
},
|
|
{
|
|
"entropy": 6.209698486328125,
|
|
"epoch": 1.7882285054818234,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00046894574969026946,
|
|
"loss": 5.7485,
|
|
"mean_token_accuracy": 0.1964795932173729,
|
|
"num_tokens": 39258456.0,
|
|
"step": 15495
|
|
},
|
|
{
|
|
"entropy": 6.284151840209961,
|
|
"epoch": 1.788805539526832,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00046892482786183313,
|
|
"loss": 5.8465,
|
|
"mean_token_accuracy": 0.1841995060443878,
|
|
"num_tokens": 39270624.0,
|
|
"step": 15500
|
|
},
|
|
{
|
|
"entropy": 6.2593241214752195,
|
|
"epoch": 1.7893825735718407,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00046890389951083155,
|
|
"loss": 5.7329,
|
|
"mean_token_accuracy": 0.19568620026111602,
|
|
"num_tokens": 39283350.0,
|
|
"step": 15505
|
|
},
|
|
{
|
|
"entropy": 6.287080955505371,
|
|
"epoch": 1.7899596076168494,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00046888296463796857,
|
|
"loss": 5.8432,
|
|
"mean_token_accuracy": 0.19254444241523744,
|
|
"num_tokens": 39296321.0,
|
|
"step": 15510
|
|
},
|
|
{
|
|
"entropy": 6.232756280899048,
|
|
"epoch": 1.790536641661858,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004688620232439485,
|
|
"loss": 5.7017,
|
|
"mean_token_accuracy": 0.20558897256851197,
|
|
"num_tokens": 39309223.0,
|
|
"step": 15515
|
|
},
|
|
{
|
|
"entropy": 6.22496485710144,
|
|
"epoch": 1.7911136757068666,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.00046884107532947547,
|
|
"loss": 5.6886,
|
|
"mean_token_accuracy": 0.19321909546852112,
|
|
"num_tokens": 39322348.0,
|
|
"step": 15520
|
|
},
|
|
{
|
|
"entropy": 6.227154541015625,
|
|
"epoch": 1.7916907097518755,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00046882012089525415,
|
|
"loss": 5.786,
|
|
"mean_token_accuracy": 0.18817334324121476,
|
|
"num_tokens": 39335375.0,
|
|
"step": 15525
|
|
},
|
|
{
|
|
"entropy": 6.265221357345581,
|
|
"epoch": 1.792267743796884,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004687991599419895,
|
|
"loss": 5.8031,
|
|
"mean_token_accuracy": 0.19223275780677795,
|
|
"num_tokens": 39347865.0,
|
|
"step": 15530
|
|
},
|
|
{
|
|
"entropy": 6.249596834182739,
|
|
"epoch": 1.7928447778418928,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00046877819247038624,
|
|
"loss": 5.8487,
|
|
"mean_token_accuracy": 0.19005428701639177,
|
|
"num_tokens": 39361402.0,
|
|
"step": 15535
|
|
},
|
|
{
|
|
"entropy": 6.221106147766113,
|
|
"epoch": 1.7934218118869012,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004687572184811497,
|
|
"loss": 5.7079,
|
|
"mean_token_accuracy": 0.19553205221891404,
|
|
"num_tokens": 39372839.0,
|
|
"step": 15540
|
|
},
|
|
{
|
|
"entropy": 6.2046037197113035,
|
|
"epoch": 1.79399884593191,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00046873623797498545,
|
|
"loss": 5.7399,
|
|
"mean_token_accuracy": 0.19506264925003053,
|
|
"num_tokens": 39385189.0,
|
|
"step": 15545
|
|
},
|
|
{
|
|
"entropy": 6.323671007156372,
|
|
"epoch": 1.7945758799769185,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.000468715250952599,
|
|
"loss": 5.8881,
|
|
"mean_token_accuracy": 0.18917421698570253,
|
|
"num_tokens": 39397871.0,
|
|
"step": 15550
|
|
},
|
|
{
|
|
"entropy": 6.302221441268921,
|
|
"epoch": 1.7951529140219273,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00046869425741469635,
|
|
"loss": 5.8359,
|
|
"mean_token_accuracy": 0.18804299235343933,
|
|
"num_tokens": 39411222.0,
|
|
"step": 15555
|
|
},
|
|
{
|
|
"entropy": 6.259333372116089,
|
|
"epoch": 1.795729948066936,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004686732573619835,
|
|
"loss": 5.8319,
|
|
"mean_token_accuracy": 0.19109850972890854,
|
|
"num_tokens": 39423614.0,
|
|
"step": 15560
|
|
},
|
|
{
|
|
"entropy": 6.249478197097778,
|
|
"epoch": 1.7963069821119446,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004686522507951669,
|
|
"loss": 5.7548,
|
|
"mean_token_accuracy": 0.19278013855218887,
|
|
"num_tokens": 39436299.0,
|
|
"step": 15565
|
|
},
|
|
{
|
|
"entropy": 6.260821914672851,
|
|
"epoch": 1.7968840161569533,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004686312377149531,
|
|
"loss": 5.8271,
|
|
"mean_token_accuracy": 0.18958440274000168,
|
|
"num_tokens": 39448994.0,
|
|
"step": 15570
|
|
},
|
|
{
|
|
"entropy": 6.273134469985962,
|
|
"epoch": 1.797461050201962,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00046861021812204874,
|
|
"loss": 5.8248,
|
|
"mean_token_accuracy": 0.18644514679908752,
|
|
"num_tokens": 39462387.0,
|
|
"step": 15575
|
|
},
|
|
{
|
|
"entropy": 6.307193422317505,
|
|
"epoch": 1.7980380842469705,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00046858919201716085,
|
|
"loss": 5.8047,
|
|
"mean_token_accuracy": 0.1928827852010727,
|
|
"num_tokens": 39475082.0,
|
|
"step": 15580
|
|
},
|
|
{
|
|
"entropy": 6.258175945281982,
|
|
"epoch": 1.7986151182919792,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004685681594009966,
|
|
"loss": 5.7914,
|
|
"mean_token_accuracy": 0.19656720608472825,
|
|
"num_tokens": 39487272.0,
|
|
"step": 15585
|
|
},
|
|
{
|
|
"entropy": 6.236111068725586,
|
|
"epoch": 1.799192152336988,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00046854712027426357,
|
|
"loss": 5.7724,
|
|
"mean_token_accuracy": 0.19646389186382293,
|
|
"num_tokens": 39502499.0,
|
|
"step": 15590
|
|
},
|
|
{
|
|
"entropy": 6.346733856201172,
|
|
"epoch": 1.7997691863819965,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00046852607463766923,
|
|
"loss": 5.8429,
|
|
"mean_token_accuracy": 0.1886493071913719,
|
|
"num_tokens": 39514652.0,
|
|
"step": 15595
|
|
},
|
|
{
|
|
"entropy": 6.34684190750122,
|
|
"epoch": 1.8003462204270053,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004685050224919215,
|
|
"loss": 5.8995,
|
|
"mean_token_accuracy": 0.1818003237247467,
|
|
"num_tokens": 39527859.0,
|
|
"step": 15600
|
|
},
|
|
{
|
|
"entropy": 6.262502241134643,
|
|
"epoch": 1.8009232544720137,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00046848396383772844,
|
|
"loss": 5.7547,
|
|
"mean_token_accuracy": 0.18986964374780654,
|
|
"num_tokens": 39541099.0,
|
|
"step": 15605
|
|
},
|
|
{
|
|
"entropy": 6.20468487739563,
|
|
"epoch": 1.8015002885170226,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004684628986757984,
|
|
"loss": 5.7604,
|
|
"mean_token_accuracy": 0.19289609640836716,
|
|
"num_tokens": 39553233.0,
|
|
"step": 15610
|
|
},
|
|
{
|
|
"entropy": 6.250316047668457,
|
|
"epoch": 1.802077322562031,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004684418270068398,
|
|
"loss": 5.7442,
|
|
"mean_token_accuracy": 0.19790587574243546,
|
|
"num_tokens": 39565379.0,
|
|
"step": 15615
|
|
},
|
|
{
|
|
"entropy": 6.201472282409668,
|
|
"epoch": 1.8026543566070399,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004684207488315615,
|
|
"loss": 5.7217,
|
|
"mean_token_accuracy": 0.2005346715450287,
|
|
"num_tokens": 39577509.0,
|
|
"step": 15620
|
|
},
|
|
{
|
|
"entropy": 6.294105386734008,
|
|
"epoch": 1.8032313906520485,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004683996641506724,
|
|
"loss": 5.8205,
|
|
"mean_token_accuracy": 0.19148968160152435,
|
|
"num_tokens": 39589960.0,
|
|
"step": 15625
|
|
},
|
|
{
|
|
"entropy": 6.219392347335815,
|
|
"epoch": 1.8038084246970572,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00046837857296488163,
|
|
"loss": 5.7143,
|
|
"mean_token_accuracy": 0.20224729776382447,
|
|
"num_tokens": 39602231.0,
|
|
"step": 15630
|
|
},
|
|
{
|
|
"entropy": 6.256589317321778,
|
|
"epoch": 1.8043854587420658,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00046835747527489857,
|
|
"loss": 5.8016,
|
|
"mean_token_accuracy": 0.20258677154779434,
|
|
"num_tokens": 39615756.0,
|
|
"step": 15635
|
|
},
|
|
{
|
|
"entropy": 6.315097427368164,
|
|
"epoch": 1.8049624927870744,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000468336371081433,
|
|
"loss": 5.8292,
|
|
"mean_token_accuracy": 0.18631367534399032,
|
|
"num_tokens": 39627810.0,
|
|
"step": 15640
|
|
},
|
|
{
|
|
"entropy": 6.2539315700531,
|
|
"epoch": 1.805539526832083,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00046831526038519444,
|
|
"loss": 5.7982,
|
|
"mean_token_accuracy": 0.19546411484479903,
|
|
"num_tokens": 39640930.0,
|
|
"step": 15645
|
|
},
|
|
{
|
|
"entropy": 6.206079769134521,
|
|
"epoch": 1.8061165608770917,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004682941431868933,
|
|
"loss": 5.7518,
|
|
"mean_token_accuracy": 0.19276881515979766,
|
|
"num_tokens": 39652146.0,
|
|
"step": 15650
|
|
},
|
|
{
|
|
"entropy": 6.151435089111328,
|
|
"epoch": 1.8066935949221004,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046827301948723963,
|
|
"loss": 5.6683,
|
|
"mean_token_accuracy": 0.20766518861055375,
|
|
"num_tokens": 39665156.0,
|
|
"step": 15655
|
|
},
|
|
{
|
|
"entropy": 6.266790294647217,
|
|
"epoch": 1.807270628967109,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046825188928694393,
|
|
"loss": 5.7792,
|
|
"mean_token_accuracy": 0.19093467444181442,
|
|
"num_tokens": 39677346.0,
|
|
"step": 15660
|
|
},
|
|
{
|
|
"entropy": 6.283413410186768,
|
|
"epoch": 1.8078476630121179,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004682307525867169,
|
|
"loss": 5.746,
|
|
"mean_token_accuracy": 0.2032680407166481,
|
|
"num_tokens": 39690613.0,
|
|
"step": 15665
|
|
},
|
|
{
|
|
"entropy": 6.268688201904297,
|
|
"epoch": 1.8084246970571263,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004682096093872695,
|
|
"loss": 5.7572,
|
|
"mean_token_accuracy": 0.1922956645488739,
|
|
"num_tokens": 39703111.0,
|
|
"step": 15670
|
|
},
|
|
{
|
|
"entropy": 6.247060823440552,
|
|
"epoch": 1.8090017311021351,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00046818845968931284,
|
|
"loss": 5.7806,
|
|
"mean_token_accuracy": 0.19447221159934996,
|
|
"num_tokens": 39715441.0,
|
|
"step": 15675
|
|
},
|
|
{
|
|
"entropy": 6.275709629058838,
|
|
"epoch": 1.8095787651471436,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00046816730349355843,
|
|
"loss": 5.7405,
|
|
"mean_token_accuracy": 0.19862063527107238,
|
|
"num_tokens": 39728437.0,
|
|
"step": 15680
|
|
},
|
|
{
|
|
"entropy": 6.24822850227356,
|
|
"epoch": 1.8101557991921524,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00046814614080071756,
|
|
"loss": 5.7679,
|
|
"mean_token_accuracy": 0.1967908799648285,
|
|
"num_tokens": 39740324.0,
|
|
"step": 15685
|
|
},
|
|
{
|
|
"entropy": 6.227537345886231,
|
|
"epoch": 1.8107328332371608,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00046812497161150224,
|
|
"loss": 5.7457,
|
|
"mean_token_accuracy": 0.1954813316464424,
|
|
"num_tokens": 39752158.0,
|
|
"step": 15690
|
|
},
|
|
{
|
|
"entropy": 6.251756763458252,
|
|
"epoch": 1.8113098672821697,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00046810379592662445,
|
|
"loss": 5.8004,
|
|
"mean_token_accuracy": 0.1957491382956505,
|
|
"num_tokens": 39766296.0,
|
|
"step": 15695
|
|
},
|
|
{
|
|
"entropy": 6.246879053115845,
|
|
"epoch": 1.8118869013271783,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.00046808261374679637,
|
|
"loss": 5.8144,
|
|
"mean_token_accuracy": 0.1933879092335701,
|
|
"num_tokens": 39779690.0,
|
|
"step": 15700
|
|
},
|
|
{
|
|
"entropy": 6.275369453430176,
|
|
"epoch": 1.812463935372187,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004680614250727305,
|
|
"loss": 5.7709,
|
|
"mean_token_accuracy": 0.19698434323072433,
|
|
"num_tokens": 39790617.0,
|
|
"step": 15705
|
|
},
|
|
{
|
|
"entropy": 6.237313270568848,
|
|
"epoch": 1.8130409694171956,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004680402299051395,
|
|
"loss": 5.7519,
|
|
"mean_token_accuracy": 0.19757142066955566,
|
|
"num_tokens": 39802994.0,
|
|
"step": 15710
|
|
},
|
|
{
|
|
"entropy": 6.248507452011109,
|
|
"epoch": 1.8136180034622043,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004680190282447363,
|
|
"loss": 5.7598,
|
|
"mean_token_accuracy": 0.1952964574098587,
|
|
"num_tokens": 39815618.0,
|
|
"step": 15715
|
|
},
|
|
{
|
|
"entropy": 6.251852369308471,
|
|
"epoch": 1.814195037507213,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004679978200922339,
|
|
"loss": 5.7412,
|
|
"mean_token_accuracy": 0.20035985261201858,
|
|
"num_tokens": 39827283.0,
|
|
"step": 15720
|
|
},
|
|
{
|
|
"entropy": 6.2605846405029295,
|
|
"epoch": 1.8147720715522215,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004679766054483457,
|
|
"loss": 5.725,
|
|
"mean_token_accuracy": 0.20251115262508393,
|
|
"num_tokens": 39840116.0,
|
|
"step": 15725
|
|
},
|
|
{
|
|
"entropy": 6.193558406829834,
|
|
"epoch": 1.8153491055972304,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004679553843137852,
|
|
"loss": 5.7173,
|
|
"mean_token_accuracy": 0.20594813525676728,
|
|
"num_tokens": 39851770.0,
|
|
"step": 15730
|
|
},
|
|
{
|
|
"entropy": 6.180267715454102,
|
|
"epoch": 1.8159261396422388,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00046793415668926625,
|
|
"loss": 5.6866,
|
|
"mean_token_accuracy": 0.19606250077486037,
|
|
"num_tokens": 39863803.0,
|
|
"step": 15735
|
|
},
|
|
{
|
|
"entropy": 6.238861560821533,
|
|
"epoch": 1.8165031736872477,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004679129225755028,
|
|
"loss": 5.7202,
|
|
"mean_token_accuracy": 0.20054381489753723,
|
|
"num_tokens": 39875713.0,
|
|
"step": 15740
|
|
},
|
|
{
|
|
"entropy": 6.170565223693847,
|
|
"epoch": 1.817080207732256,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.000467891681973209,
|
|
"loss": 5.6841,
|
|
"mean_token_accuracy": 0.20006590634584426,
|
|
"num_tokens": 39888670.0,
|
|
"step": 15745
|
|
},
|
|
{
|
|
"entropy": 6.164975118637085,
|
|
"epoch": 1.817657241777265,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00046787043488309926,
|
|
"loss": 5.7258,
|
|
"mean_token_accuracy": 0.20983980894088744,
|
|
"num_tokens": 39900845.0,
|
|
"step": 15750
|
|
},
|
|
{
|
|
"entropy": 6.346622896194458,
|
|
"epoch": 1.8182342758222734,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004678491813058882,
|
|
"loss": 5.8179,
|
|
"mean_token_accuracy": 0.18947956562042237,
|
|
"num_tokens": 39912268.0,
|
|
"step": 15755
|
|
},
|
|
{
|
|
"entropy": 6.255692625045777,
|
|
"epoch": 1.8188113098672822,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004678279212422908,
|
|
"loss": 5.7643,
|
|
"mean_token_accuracy": 0.19456629902124406,
|
|
"num_tokens": 39924213.0,
|
|
"step": 15760
|
|
},
|
|
{
|
|
"entropy": 6.241471672058106,
|
|
"epoch": 1.8193883439122909,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004678066546930221,
|
|
"loss": 5.7905,
|
|
"mean_token_accuracy": 0.19173450469970704,
|
|
"num_tokens": 39937069.0,
|
|
"step": 15765
|
|
},
|
|
{
|
|
"entropy": 6.219423055648804,
|
|
"epoch": 1.8199653779572995,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00046778538165879725,
|
|
"loss": 5.7404,
|
|
"mean_token_accuracy": 0.19059522300958634,
|
|
"num_tokens": 39948988.0,
|
|
"step": 15770
|
|
},
|
|
{
|
|
"entropy": 6.256737899780274,
|
|
"epoch": 1.8205424120023082,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00046776410214033185,
|
|
"loss": 5.8356,
|
|
"mean_token_accuracy": 0.19304797798395157,
|
|
"num_tokens": 39962177.0,
|
|
"step": 15775
|
|
},
|
|
{
|
|
"entropy": 6.300885152816773,
|
|
"epoch": 1.8211194460473168,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004677428161383417,
|
|
"loss": 5.7657,
|
|
"mean_token_accuracy": 0.19903772473335266,
|
|
"num_tokens": 39975329.0,
|
|
"step": 15780
|
|
},
|
|
{
|
|
"entropy": 6.271979188919067,
|
|
"epoch": 1.8216964800923254,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004677215236535426,
|
|
"loss": 5.7524,
|
|
"mean_token_accuracy": 0.19273924678564072,
|
|
"num_tokens": 39987923.0,
|
|
"step": 15785
|
|
},
|
|
{
|
|
"entropy": 6.2564263343811035,
|
|
"epoch": 1.822273514137334,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004677002246866508,
|
|
"loss": 5.8236,
|
|
"mean_token_accuracy": 0.19519684463739395,
|
|
"num_tokens": 40001596.0,
|
|
"step": 15790
|
|
},
|
|
{
|
|
"entropy": 6.253862953186035,
|
|
"epoch": 1.8228505481823427,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00046767891923838264,
|
|
"loss": 5.7486,
|
|
"mean_token_accuracy": 0.19953580796718598,
|
|
"num_tokens": 40014207.0,
|
|
"step": 15795
|
|
},
|
|
{
|
|
"entropy": 6.338621330261231,
|
|
"epoch": 1.8234275822273514,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004676576073094548,
|
|
"loss": 5.7948,
|
|
"mean_token_accuracy": 0.19075928777456283,
|
|
"num_tokens": 40027931.0,
|
|
"step": 15800
|
|
},
|
|
{
|
|
"entropy": 6.266003274917603,
|
|
"epoch": 1.8240046162723602,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00046763628890058396,
|
|
"loss": 5.8163,
|
|
"mean_token_accuracy": 0.19684889763593674,
|
|
"num_tokens": 40040463.0,
|
|
"step": 15805
|
|
},
|
|
{
|
|
"entropy": 6.170436954498291,
|
|
"epoch": 1.8245816503173686,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.00046761496401248734,
|
|
"loss": 5.7001,
|
|
"mean_token_accuracy": 0.20084349513053895,
|
|
"num_tokens": 40053085.0,
|
|
"step": 15810
|
|
},
|
|
{
|
|
"entropy": 6.3198305606842045,
|
|
"epoch": 1.8251586843623775,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.000467593632645882,
|
|
"loss": 5.8855,
|
|
"mean_token_accuracy": 0.19249660074710845,
|
|
"num_tokens": 40065771.0,
|
|
"step": 15815
|
|
},
|
|
{
|
|
"entropy": 6.291195583343506,
|
|
"epoch": 1.825735718407386,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004675722948014855,
|
|
"loss": 5.7948,
|
|
"mean_token_accuracy": 0.19111389964818953,
|
|
"num_tokens": 40078939.0,
|
|
"step": 15820
|
|
},
|
|
{
|
|
"entropy": 6.223949861526489,
|
|
"epoch": 1.8263127524523948,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046755095048001556,
|
|
"loss": 5.6987,
|
|
"mean_token_accuracy": 0.20104024261236192,
|
|
"num_tokens": 40091565.0,
|
|
"step": 15825
|
|
},
|
|
{
|
|
"entropy": 6.170585823059082,
|
|
"epoch": 1.8268897864974032,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004675295996821899,
|
|
"loss": 5.7365,
|
|
"mean_token_accuracy": 0.19630666822195053,
|
|
"num_tokens": 40103619.0,
|
|
"step": 15830
|
|
},
|
|
{
|
|
"entropy": 6.311802721023559,
|
|
"epoch": 1.827466820542412,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.000467508242408727,
|
|
"loss": 5.8102,
|
|
"mean_token_accuracy": 0.18986732810735701,
|
|
"num_tokens": 40116370.0,
|
|
"step": 15835
|
|
},
|
|
{
|
|
"entropy": 6.246032047271728,
|
|
"epoch": 1.8280438545874207,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004674868786603448,
|
|
"loss": 5.6837,
|
|
"mean_token_accuracy": 0.19883956760168076,
|
|
"num_tokens": 40129015.0,
|
|
"step": 15840
|
|
},
|
|
{
|
|
"entropy": 6.241017913818359,
|
|
"epoch": 1.8286208886324293,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004674655084377622,
|
|
"loss": 5.717,
|
|
"mean_token_accuracy": 0.19837751537561416,
|
|
"num_tokens": 40141437.0,
|
|
"step": 15845
|
|
},
|
|
{
|
|
"entropy": 6.206828451156616,
|
|
"epoch": 1.829197922677438,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004674441317416978,
|
|
"loss": 5.7643,
|
|
"mean_token_accuracy": 0.19043355137109758,
|
|
"num_tokens": 40154516.0,
|
|
"step": 15850
|
|
},
|
|
{
|
|
"entropy": 6.179724311828613,
|
|
"epoch": 1.8297749567224466,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00046742274857287057,
|
|
"loss": 5.6333,
|
|
"mean_token_accuracy": 0.20223019868135453,
|
|
"num_tokens": 40166598.0,
|
|
"step": 15855
|
|
},
|
|
{
|
|
"entropy": 6.229026031494141,
|
|
"epoch": 1.8303519907674553,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004674013589319998,
|
|
"loss": 5.7543,
|
|
"mean_token_accuracy": 0.19870882034301757,
|
|
"num_tokens": 40178905.0,
|
|
"step": 15860
|
|
},
|
|
{
|
|
"entropy": 6.321389770507812,
|
|
"epoch": 1.830929024812464,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004673799628198049,
|
|
"loss": 5.8371,
|
|
"mean_token_accuracy": 0.19208986014127732,
|
|
"num_tokens": 40191678.0,
|
|
"step": 15865
|
|
},
|
|
{
|
|
"entropy": 6.245724630355835,
|
|
"epoch": 1.8315060588574728,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00046735856023700546,
|
|
"loss": 5.7539,
|
|
"mean_token_accuracy": 0.19165848046541215,
|
|
"num_tokens": 40204680.0,
|
|
"step": 15870
|
|
},
|
|
{
|
|
"entropy": 6.180008220672607,
|
|
"epoch": 1.8320830929024812,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004673371511843215,
|
|
"loss": 5.8064,
|
|
"mean_token_accuracy": 0.20063277781009675,
|
|
"num_tokens": 40217026.0,
|
|
"step": 15875
|
|
},
|
|
{
|
|
"entropy": 6.242175817489624,
|
|
"epoch": 1.83266012694749,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004673157356624729,
|
|
"loss": 5.7377,
|
|
"mean_token_accuracy": 0.19302880316972731,
|
|
"num_tokens": 40228950.0,
|
|
"step": 15880
|
|
},
|
|
{
|
|
"entropy": 6.2919378757476805,
|
|
"epoch": 1.8332371609924984,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004672943136721801,
|
|
"loss": 5.8163,
|
|
"mean_token_accuracy": 0.1909077376127243,
|
|
"num_tokens": 40241294.0,
|
|
"step": 15885
|
|
},
|
|
{
|
|
"entropy": 6.323341321945191,
|
|
"epoch": 1.8338141950375073,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004672728852141636,
|
|
"loss": 5.8536,
|
|
"mean_token_accuracy": 0.18982188850641252,
|
|
"num_tokens": 40253331.0,
|
|
"step": 15890
|
|
},
|
|
{
|
|
"entropy": 6.28448715209961,
|
|
"epoch": 1.8343912290825157,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046725145028914404,
|
|
"loss": 5.8079,
|
|
"mean_token_accuracy": 0.19301552474498748,
|
|
"num_tokens": 40266059.0,
|
|
"step": 15895
|
|
},
|
|
{
|
|
"entropy": 6.252271842956543,
|
|
"epoch": 1.8349682631275246,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004672300088978425,
|
|
"loss": 5.7363,
|
|
"mean_token_accuracy": 0.2031920611858368,
|
|
"num_tokens": 40278732.0,
|
|
"step": 15900
|
|
},
|
|
{
|
|
"entropy": 6.182538175582886,
|
|
"epoch": 1.8355452971725332,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004672085610409801,
|
|
"loss": 5.6966,
|
|
"mean_token_accuracy": 0.20496753305196763,
|
|
"num_tokens": 40290428.0,
|
|
"step": 15905
|
|
},
|
|
{
|
|
"entropy": 6.202089929580689,
|
|
"epoch": 1.8361223312175419,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046718710671927815,
|
|
"loss": 5.7778,
|
|
"mean_token_accuracy": 0.19897102266550065,
|
|
"num_tokens": 40302153.0,
|
|
"step": 15910
|
|
},
|
|
{
|
|
"entropy": 6.2814734935760494,
|
|
"epoch": 1.8366993652625505,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00046716564593345843,
|
|
"loss": 5.743,
|
|
"mean_token_accuracy": 0.1985234797000885,
|
|
"num_tokens": 40315493.0,
|
|
"step": 15915
|
|
},
|
|
{
|
|
"entropy": 6.283923673629761,
|
|
"epoch": 1.8372763993075591,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00046714417868424265,
|
|
"loss": 5.7986,
|
|
"mean_token_accuracy": 0.1846300795674324,
|
|
"num_tokens": 40328157.0,
|
|
"step": 15920
|
|
},
|
|
{
|
|
"entropy": 6.262593412399292,
|
|
"epoch": 1.8378534333525678,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00046712270497235284,
|
|
"loss": 5.8082,
|
|
"mean_token_accuracy": 0.1937829002737999,
|
|
"num_tokens": 40341684.0,
|
|
"step": 15925
|
|
},
|
|
{
|
|
"entropy": 6.3377039432525635,
|
|
"epoch": 1.8384304673975764,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004671012247985112,
|
|
"loss": 5.8578,
|
|
"mean_token_accuracy": 0.18830958604812623,
|
|
"num_tokens": 40354002.0,
|
|
"step": 15930
|
|
},
|
|
{
|
|
"entropy": 6.204885721206665,
|
|
"epoch": 1.839007501442585,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00046707973816344044,
|
|
"loss": 5.7634,
|
|
"mean_token_accuracy": 0.20010476559400558,
|
|
"num_tokens": 40366211.0,
|
|
"step": 15935
|
|
},
|
|
{
|
|
"entropy": 6.284234189987183,
|
|
"epoch": 1.8395845354875937,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00046705824506786304,
|
|
"loss": 5.8542,
|
|
"mean_token_accuracy": 0.19239040166139604,
|
|
"num_tokens": 40377957.0,
|
|
"step": 15940
|
|
},
|
|
{
|
|
"entropy": 6.301759529113769,
|
|
"epoch": 1.8401615695326026,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00046703674551250193,
|
|
"loss": 5.802,
|
|
"mean_token_accuracy": 0.19346368908882142,
|
|
"num_tokens": 40391018.0,
|
|
"step": 15945
|
|
},
|
|
{
|
|
"entropy": 6.218786287307739,
|
|
"epoch": 1.840738603577611,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004670152394980803,
|
|
"loss": 5.7965,
|
|
"mean_token_accuracy": 0.19256123006343842,
|
|
"num_tokens": 40405134.0,
|
|
"step": 15950
|
|
},
|
|
{
|
|
"entropy": 6.305995988845825,
|
|
"epoch": 1.8413156376226198,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004669937270253214,
|
|
"loss": 5.8067,
|
|
"mean_token_accuracy": 0.19366917610168458,
|
|
"num_tokens": 40418131.0,
|
|
"step": 15955
|
|
},
|
|
{
|
|
"entropy": 6.268421268463134,
|
|
"epoch": 1.8418926716676283,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.000466972208094949,
|
|
"loss": 5.7485,
|
|
"mean_token_accuracy": 0.1956111580133438,
|
|
"num_tokens": 40430614.0,
|
|
"step": 15960
|
|
},
|
|
{
|
|
"entropy": 6.332875061035156,
|
|
"epoch": 1.8424697057126371,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00046695068270768665,
|
|
"loss": 5.7761,
|
|
"mean_token_accuracy": 0.19068144708871843,
|
|
"num_tokens": 40443200.0,
|
|
"step": 15965
|
|
},
|
|
{
|
|
"entropy": 6.184208965301513,
|
|
"epoch": 1.8430467397576455,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00046692915086425846,
|
|
"loss": 5.735,
|
|
"mean_token_accuracy": 0.19420334547758103,
|
|
"num_tokens": 40455662.0,
|
|
"step": 15970
|
|
},
|
|
{
|
|
"entropy": 6.239500045776367,
|
|
"epoch": 1.8436237738026544,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00046690761256538857,
|
|
"loss": 5.7007,
|
|
"mean_token_accuracy": 0.20253938138484956,
|
|
"num_tokens": 40468247.0,
|
|
"step": 15975
|
|
},
|
|
{
|
|
"entropy": 6.316354751586914,
|
|
"epoch": 1.844200807847663,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004668860678118015,
|
|
"loss": 5.8784,
|
|
"mean_token_accuracy": 0.1913073852658272,
|
|
"num_tokens": 40480607.0,
|
|
"step": 15980
|
|
},
|
|
{
|
|
"entropy": 6.30676498413086,
|
|
"epoch": 1.8447778418926717,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00046686451660422185,
|
|
"loss": 5.7809,
|
|
"mean_token_accuracy": 0.1933899149298668,
|
|
"num_tokens": 40492140.0,
|
|
"step": 15985
|
|
},
|
|
{
|
|
"entropy": 6.29900894165039,
|
|
"epoch": 1.8453548759376803,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00046684295894337455,
|
|
"loss": 5.8328,
|
|
"mean_token_accuracy": 0.19052439033985138,
|
|
"num_tokens": 40504513.0,
|
|
"step": 15990
|
|
},
|
|
{
|
|
"entropy": 6.217627811431885,
|
|
"epoch": 1.845931909982689,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004668213948299845,
|
|
"loss": 5.7376,
|
|
"mean_token_accuracy": 0.1955086499452591,
|
|
"num_tokens": 40517258.0,
|
|
"step": 15995
|
|
},
|
|
{
|
|
"entropy": 6.232381010055542,
|
|
"epoch": 1.8465089440276976,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004667998242647772,
|
|
"loss": 5.7692,
|
|
"mean_token_accuracy": 0.1925689846277237,
|
|
"num_tokens": 40529092.0,
|
|
"step": 16000
|
|
},
|
|
{
|
|
"entropy": 6.237630987167359,
|
|
"epoch": 1.8470859780727062,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.000466778247248478,
|
|
"loss": 5.7287,
|
|
"mean_token_accuracy": 0.1985825851559639,
|
|
"num_tokens": 40543586.0,
|
|
"step": 16005
|
|
},
|
|
{
|
|
"entropy": 6.311019611358643,
|
|
"epoch": 1.847663012117715,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00046675666378181275,
|
|
"loss": 5.794,
|
|
"mean_token_accuracy": 0.19712699204683304,
|
|
"num_tokens": 40555721.0,
|
|
"step": 16010
|
|
},
|
|
{
|
|
"entropy": 6.333885526657104,
|
|
"epoch": 1.8482400461627235,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004667350738655074,
|
|
"loss": 5.871,
|
|
"mean_token_accuracy": 0.18650257140398024,
|
|
"num_tokens": 40567547.0,
|
|
"step": 16015
|
|
},
|
|
{
|
|
"entropy": 6.246447324752808,
|
|
"epoch": 1.8488170802077324,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00046671347750028806,
|
|
"loss": 5.712,
|
|
"mean_token_accuracy": 0.1954139679670334,
|
|
"num_tokens": 40579498.0,
|
|
"step": 16020
|
|
},
|
|
{
|
|
"entropy": 6.294281148910523,
|
|
"epoch": 1.8493941142527408,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004666918746868811,
|
|
"loss": 5.8376,
|
|
"mean_token_accuracy": 0.18255259990692138,
|
|
"num_tokens": 40593853.0,
|
|
"step": 16025
|
|
},
|
|
{
|
|
"entropy": 6.21675066947937,
|
|
"epoch": 1.8499711482977497,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004666702654260133,
|
|
"loss": 5.7154,
|
|
"mean_token_accuracy": 0.1969263732433319,
|
|
"num_tokens": 40605737.0,
|
|
"step": 16030
|
|
},
|
|
{
|
|
"entropy": 6.190192651748657,
|
|
"epoch": 1.850548182342758,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00046664864971841113,
|
|
"loss": 5.697,
|
|
"mean_token_accuracy": 0.2019049718976021,
|
|
"num_tokens": 40617839.0,
|
|
"step": 16035
|
|
},
|
|
{
|
|
"entropy": 6.243142032623291,
|
|
"epoch": 1.851125216387767,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00046662702756480195,
|
|
"loss": 5.769,
|
|
"mean_token_accuracy": 0.196391262114048,
|
|
"num_tokens": 40630247.0,
|
|
"step": 16040
|
|
},
|
|
{
|
|
"entropy": 6.155957269668579,
|
|
"epoch": 1.8517022504327756,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00046660539896591286,
|
|
"loss": 5.6666,
|
|
"mean_token_accuracy": 0.2063628390431404,
|
|
"num_tokens": 40643869.0,
|
|
"step": 16045
|
|
},
|
|
{
|
|
"entropy": 6.268722629547119,
|
|
"epoch": 1.8522792844777842,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004665837639224713,
|
|
"loss": 5.7752,
|
|
"mean_token_accuracy": 0.19113756120204925,
|
|
"num_tokens": 40655389.0,
|
|
"step": 16050
|
|
},
|
|
{
|
|
"entropy": 6.285340595245361,
|
|
"epoch": 1.8528563185227929,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00046656212243520505,
|
|
"loss": 5.7934,
|
|
"mean_token_accuracy": 0.18825832307338713,
|
|
"num_tokens": 40667663.0,
|
|
"step": 16055
|
|
},
|
|
{
|
|
"entropy": 6.273303270339966,
|
|
"epoch": 1.8534333525678015,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00046654047450484193,
|
|
"loss": 5.7277,
|
|
"mean_token_accuracy": 0.19776127189397813,
|
|
"num_tokens": 40680623.0,
|
|
"step": 16060
|
|
},
|
|
{
|
|
"entropy": 6.216945171356201,
|
|
"epoch": 1.8540103866128101,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004665188201321102,
|
|
"loss": 5.7082,
|
|
"mean_token_accuracy": 0.19727377593517303,
|
|
"num_tokens": 40692679.0,
|
|
"step": 16065
|
|
},
|
|
{
|
|
"entropy": 6.272071456909179,
|
|
"epoch": 1.8545874206578188,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00046649715931773795,
|
|
"loss": 5.8786,
|
|
"mean_token_accuracy": 0.19242863059043885,
|
|
"num_tokens": 40705187.0,
|
|
"step": 16070
|
|
},
|
|
{
|
|
"entropy": 6.28022871017456,
|
|
"epoch": 1.8551644547028274,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.000466475492062454,
|
|
"loss": 5.8193,
|
|
"mean_token_accuracy": 0.19652820974588395,
|
|
"num_tokens": 40717854.0,
|
|
"step": 16075
|
|
},
|
|
{
|
|
"entropy": 6.257518720626831,
|
|
"epoch": 1.855741488747836,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00046645381836698684,
|
|
"loss": 5.8047,
|
|
"mean_token_accuracy": 0.19478076994419097,
|
|
"num_tokens": 40731039.0,
|
|
"step": 16080
|
|
},
|
|
{
|
|
"entropy": 6.252432584762573,
|
|
"epoch": 1.856318522792845,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004664321382320657,
|
|
"loss": 5.742,
|
|
"mean_token_accuracy": 0.19954000115394593,
|
|
"num_tokens": 40745065.0,
|
|
"step": 16085
|
|
},
|
|
{
|
|
"entropy": 6.2835486888885494,
|
|
"epoch": 1.8568955568378533,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00046641045165841965,
|
|
"loss": 5.8538,
|
|
"mean_token_accuracy": 0.18943217396736145,
|
|
"num_tokens": 40758107.0,
|
|
"step": 16090
|
|
},
|
|
{
|
|
"entropy": 6.31345567703247,
|
|
"epoch": 1.8574725908828622,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00046638875864677814,
|
|
"loss": 5.8626,
|
|
"mean_token_accuracy": 0.18975879997015,
|
|
"num_tokens": 40771082.0,
|
|
"step": 16095
|
|
},
|
|
{
|
|
"entropy": 6.294506025314331,
|
|
"epoch": 1.8580496249278706,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004663670591978708,
|
|
"loss": 5.7806,
|
|
"mean_token_accuracy": 0.18993891030550003,
|
|
"num_tokens": 40784165.0,
|
|
"step": 16100
|
|
},
|
|
{
|
|
"entropy": 6.175074863433838,
|
|
"epoch": 1.8586266589728795,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004663453533124275,
|
|
"loss": 5.6254,
|
|
"mean_token_accuracy": 0.21204764991998673,
|
|
"num_tokens": 40796279.0,
|
|
"step": 16105
|
|
},
|
|
{
|
|
"entropy": 6.217782354354858,
|
|
"epoch": 1.859203693017888,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004663236409911783,
|
|
"loss": 5.7205,
|
|
"mean_token_accuracy": 0.19833692610263826,
|
|
"num_tokens": 40809074.0,
|
|
"step": 16110
|
|
},
|
|
{
|
|
"entropy": 6.194740915298462,
|
|
"epoch": 1.8597807270628968,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00046630192223485345,
|
|
"loss": 5.6586,
|
|
"mean_token_accuracy": 0.20452403873205185,
|
|
"num_tokens": 40821086.0,
|
|
"step": 16115
|
|
},
|
|
{
|
|
"entropy": 6.311218357086181,
|
|
"epoch": 1.8603577611079054,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00046628019704418345,
|
|
"loss": 5.7747,
|
|
"mean_token_accuracy": 0.19277962148189545,
|
|
"num_tokens": 40832697.0,
|
|
"step": 16120
|
|
},
|
|
{
|
|
"entropy": 6.1826904773712155,
|
|
"epoch": 1.860934795152914,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.000466258465419899,
|
|
"loss": 5.7908,
|
|
"mean_token_accuracy": 0.19389365762472152,
|
|
"num_tokens": 40845268.0,
|
|
"step": 16125
|
|
},
|
|
{
|
|
"entropy": 6.3233559131622314,
|
|
"epoch": 1.8615118291979227,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004662367273627312,
|
|
"loss": 5.8121,
|
|
"mean_token_accuracy": 0.1891919642686844,
|
|
"num_tokens": 40858314.0,
|
|
"step": 16130
|
|
},
|
|
{
|
|
"entropy": 6.302750968933106,
|
|
"epoch": 1.8620888632429313,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.000466214982873411,
|
|
"loss": 5.7606,
|
|
"mean_token_accuracy": 0.19642114788293838,
|
|
"num_tokens": 40869982.0,
|
|
"step": 16135
|
|
},
|
|
{
|
|
"entropy": 6.234612894058228,
|
|
"epoch": 1.86266589728794,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00046619323195266975,
|
|
"loss": 5.7159,
|
|
"mean_token_accuracy": 0.20078064352273942,
|
|
"num_tokens": 40881831.0,
|
|
"step": 16140
|
|
},
|
|
{
|
|
"entropy": 6.17855396270752,
|
|
"epoch": 1.8632429313329486,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004661714746012392,
|
|
"loss": 5.7297,
|
|
"mean_token_accuracy": 0.19786572009325026,
|
|
"num_tokens": 40894279.0,
|
|
"step": 16145
|
|
},
|
|
{
|
|
"entropy": 6.281162405014038,
|
|
"epoch": 1.8638199653779572,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.000466149710819851,
|
|
"loss": 5.7957,
|
|
"mean_token_accuracy": 0.1955430254340172,
|
|
"num_tokens": 40906960.0,
|
|
"step": 16150
|
|
},
|
|
{
|
|
"entropy": 6.305213737487793,
|
|
"epoch": 1.8643969994229659,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004661279406092373,
|
|
"loss": 5.8203,
|
|
"mean_token_accuracy": 0.18938140720129013,
|
|
"num_tokens": 40920688.0,
|
|
"step": 16155
|
|
},
|
|
{
|
|
"entropy": 6.323654222488403,
|
|
"epoch": 1.8649740334679747,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00046610616397013027,
|
|
"loss": 5.826,
|
|
"mean_token_accuracy": 0.19093446284532548,
|
|
"num_tokens": 40933017.0,
|
|
"step": 16160
|
|
},
|
|
{
|
|
"entropy": 6.247139501571655,
|
|
"epoch": 1.8655510675129832,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004660843809032623,
|
|
"loss": 5.6878,
|
|
"mean_token_accuracy": 0.20525743216276168,
|
|
"num_tokens": 40947179.0,
|
|
"step": 16165
|
|
},
|
|
{
|
|
"entropy": 6.2831775665283205,
|
|
"epoch": 1.866128101557992,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004660625914093661,
|
|
"loss": 5.8344,
|
|
"mean_token_accuracy": 0.18841950744390487,
|
|
"num_tokens": 40958806.0,
|
|
"step": 16170
|
|
},
|
|
{
|
|
"entropy": 6.3006516456604,
|
|
"epoch": 1.8667051356030004,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004660407954891745,
|
|
"loss": 5.7546,
|
|
"mean_token_accuracy": 0.19830986261367797,
|
|
"num_tokens": 40970667.0,
|
|
"step": 16175
|
|
},
|
|
{
|
|
"entropy": 6.27160415649414,
|
|
"epoch": 1.8672821696480093,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004660189931434207,
|
|
"loss": 5.7809,
|
|
"mean_token_accuracy": 0.1949162170290947,
|
|
"num_tokens": 40982663.0,
|
|
"step": 16180
|
|
},
|
|
{
|
|
"entropy": 6.185522985458374,
|
|
"epoch": 1.8678592036930177,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004659971843728379,
|
|
"loss": 5.7236,
|
|
"mean_token_accuracy": 0.20043258517980575,
|
|
"num_tokens": 40995168.0,
|
|
"step": 16185
|
|
},
|
|
{
|
|
"entropy": 6.284909343719482,
|
|
"epoch": 1.8684362377380266,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004659753691781597,
|
|
"loss": 5.8185,
|
|
"mean_token_accuracy": 0.1912219762802124,
|
|
"num_tokens": 41007159.0,
|
|
"step": 16190
|
|
},
|
|
{
|
|
"entropy": 6.213361740112305,
|
|
"epoch": 1.8690132717830352,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004659535475601198,
|
|
"loss": 5.683,
|
|
"mean_token_accuracy": 0.19469626247882843,
|
|
"num_tokens": 41019860.0,
|
|
"step": 16195
|
|
},
|
|
{
|
|
"entropy": 6.234416866302491,
|
|
"epoch": 1.8695903058280439,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00046593171951945226,
|
|
"loss": 5.76,
|
|
"mean_token_accuracy": 0.19812550395727158,
|
|
"num_tokens": 41031635.0,
|
|
"step": 16200
|
|
},
|
|
{
|
|
"entropy": 6.286600160598755,
|
|
"epoch": 1.8701673398730525,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00046590988505689114,
|
|
"loss": 5.8125,
|
|
"mean_token_accuracy": 0.19126126021146775,
|
|
"num_tokens": 41044678.0,
|
|
"step": 16205
|
|
},
|
|
{
|
|
"entropy": 6.305450344085694,
|
|
"epoch": 1.8707443739180611,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00046588804417317084,
|
|
"loss": 5.857,
|
|
"mean_token_accuracy": 0.19345226287841796,
|
|
"num_tokens": 41056799.0,
|
|
"step": 16210
|
|
},
|
|
{
|
|
"entropy": 6.275042295455933,
|
|
"epoch": 1.8713214079630698,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00046586619686902597,
|
|
"loss": 5.814,
|
|
"mean_token_accuracy": 0.1963962972164154,
|
|
"num_tokens": 41069700.0,
|
|
"step": 16215
|
|
},
|
|
{
|
|
"entropy": 6.318129396438598,
|
|
"epoch": 1.8718984420080784,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00046584434314519144,
|
|
"loss": 5.7263,
|
|
"mean_token_accuracy": 0.19932073950767518,
|
|
"num_tokens": 41081427.0,
|
|
"step": 16220
|
|
},
|
|
{
|
|
"entropy": 6.261219692230225,
|
|
"epoch": 1.8724754760530873,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004658224830024022,
|
|
"loss": 5.7052,
|
|
"mean_token_accuracy": 0.2031535804271698,
|
|
"num_tokens": 41094770.0,
|
|
"step": 16225
|
|
},
|
|
{
|
|
"entropy": 6.250154447555542,
|
|
"epoch": 1.8730525100980957,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004658006164413935,
|
|
"loss": 5.7422,
|
|
"mean_token_accuracy": 0.19554442614316941,
|
|
"num_tokens": 41106802.0,
|
|
"step": 16230
|
|
},
|
|
{
|
|
"entropy": 6.230137729644776,
|
|
"epoch": 1.8736295441431046,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004657787434629009,
|
|
"loss": 5.8139,
|
|
"mean_token_accuracy": 0.20067144930362701,
|
|
"num_tokens": 41120125.0,
|
|
"step": 16235
|
|
},
|
|
{
|
|
"entropy": 6.221140146255493,
|
|
"epoch": 1.874206578188113,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.00046575686406765993,
|
|
"loss": 5.7643,
|
|
"mean_token_accuracy": 0.20250476002693177,
|
|
"num_tokens": 41134267.0,
|
|
"step": 16240
|
|
},
|
|
{
|
|
"entropy": 6.312375211715699,
|
|
"epoch": 1.8747836122331218,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00046573497825640664,
|
|
"loss": 5.7214,
|
|
"mean_token_accuracy": 0.19941470474004747,
|
|
"num_tokens": 41147266.0,
|
|
"step": 16245
|
|
},
|
|
{
|
|
"entropy": 6.245394372940064,
|
|
"epoch": 1.8753606462781303,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004657130860298771,
|
|
"loss": 5.7564,
|
|
"mean_token_accuracy": 0.19797106981277465,
|
|
"num_tokens": 41159666.0,
|
|
"step": 16250
|
|
},
|
|
{
|
|
"entropy": 6.305567932128906,
|
|
"epoch": 1.8759376803231391,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004656911873888077,
|
|
"loss": 5.8111,
|
|
"mean_token_accuracy": 0.194146266579628,
|
|
"num_tokens": 41171947.0,
|
|
"step": 16255
|
|
},
|
|
{
|
|
"entropy": 6.2310679912567135,
|
|
"epoch": 1.8765147143681478,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004656692823339349,
|
|
"loss": 5.7744,
|
|
"mean_token_accuracy": 0.20527701675891877,
|
|
"num_tokens": 41186376.0,
|
|
"step": 16260
|
|
},
|
|
{
|
|
"entropy": 6.251262378692627,
|
|
"epoch": 1.8770917484131564,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004656473708659955,
|
|
"loss": 5.8127,
|
|
"mean_token_accuracy": 0.19876704216003419,
|
|
"num_tokens": 41199730.0,
|
|
"step": 16265
|
|
},
|
|
{
|
|
"entropy": 6.275247240066529,
|
|
"epoch": 1.877668782458165,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00046562545298572646,
|
|
"loss": 5.7252,
|
|
"mean_token_accuracy": 0.20782668739557267,
|
|
"num_tokens": 41212502.0,
|
|
"step": 16270
|
|
},
|
|
{
|
|
"entropy": 6.231871271133423,
|
|
"epoch": 1.8782458165031737,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.000465603528693865,
|
|
"loss": 5.7218,
|
|
"mean_token_accuracy": 0.1999581292271614,
|
|
"num_tokens": 41226006.0,
|
|
"step": 16275
|
|
},
|
|
{
|
|
"entropy": 6.290467929840088,
|
|
"epoch": 1.8788228505481823,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00046558159799114853,
|
|
"loss": 5.7759,
|
|
"mean_token_accuracy": 0.19554868936538697,
|
|
"num_tokens": 41239172.0,
|
|
"step": 16280
|
|
},
|
|
{
|
|
"entropy": 6.234803247451782,
|
|
"epoch": 1.879399884593191,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004655596608783147,
|
|
"loss": 5.6807,
|
|
"mean_token_accuracy": 0.20324462056159973,
|
|
"num_tokens": 41251307.0,
|
|
"step": 16285
|
|
},
|
|
{
|
|
"entropy": 6.256707239151001,
|
|
"epoch": 1.8799769186381996,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046553771735610136,
|
|
"loss": 5.7335,
|
|
"mean_token_accuracy": 0.1982148304581642,
|
|
"num_tokens": 41264634.0,
|
|
"step": 16290
|
|
},
|
|
{
|
|
"entropy": 6.3179339408874515,
|
|
"epoch": 1.8805539526832082,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004655157674252465,
|
|
"loss": 5.7985,
|
|
"mean_token_accuracy": 0.18980283737182618,
|
|
"num_tokens": 41278205.0,
|
|
"step": 16295
|
|
},
|
|
{
|
|
"entropy": 6.348180198669434,
|
|
"epoch": 1.881130986728217,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00046549381108648843,
|
|
"loss": 5.8224,
|
|
"mean_token_accuracy": 0.19358165115118026,
|
|
"num_tokens": 41290447.0,
|
|
"step": 16300
|
|
},
|
|
{
|
|
"entropy": 6.262139749526978,
|
|
"epoch": 1.8817080207732255,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004654718483405656,
|
|
"loss": 5.7144,
|
|
"mean_token_accuracy": 0.20273840427398682,
|
|
"num_tokens": 41302948.0,
|
|
"step": 16305
|
|
},
|
|
{
|
|
"entropy": 6.263070011138916,
|
|
"epoch": 1.8822850548182344,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00046544987918821685,
|
|
"loss": 5.8237,
|
|
"mean_token_accuracy": 0.18879707604646684,
|
|
"num_tokens": 41315237.0,
|
|
"step": 16310
|
|
},
|
|
{
|
|
"entropy": 6.133535957336425,
|
|
"epoch": 1.8828620888632428,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000465427903630181,
|
|
"loss": 5.5638,
|
|
"mean_token_accuracy": 0.2196532055735588,
|
|
"num_tokens": 41327426.0,
|
|
"step": 16315
|
|
},
|
|
{
|
|
"entropy": 6.307161808013916,
|
|
"epoch": 1.8834391229082517,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004654059216671972,
|
|
"loss": 5.8517,
|
|
"mean_token_accuracy": 0.18843885362148285,
|
|
"num_tokens": 41340517.0,
|
|
"step": 16320
|
|
},
|
|
{
|
|
"entropy": 6.236600637435913,
|
|
"epoch": 1.88401615695326,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004653839333000048,
|
|
"loss": 5.7559,
|
|
"mean_token_accuracy": 0.20001779347658158,
|
|
"num_tokens": 41353520.0,
|
|
"step": 16325
|
|
},
|
|
{
|
|
"entropy": 6.285597038269043,
|
|
"epoch": 1.884593190998269,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00046536193852934334,
|
|
"loss": 5.7969,
|
|
"mean_token_accuracy": 0.19169134944677352,
|
|
"num_tokens": 41366326.0,
|
|
"step": 16330
|
|
},
|
|
{
|
|
"entropy": 6.229726505279541,
|
|
"epoch": 1.8851702250432776,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00046533993735595273,
|
|
"loss": 5.7167,
|
|
"mean_token_accuracy": 0.19942979216575624,
|
|
"num_tokens": 41377405.0,
|
|
"step": 16335
|
|
},
|
|
{
|
|
"entropy": 6.325794410705567,
|
|
"epoch": 1.8857472590882862,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00046531792978057277,
|
|
"loss": 5.8318,
|
|
"mean_token_accuracy": 0.19330891519784926,
|
|
"num_tokens": 41391038.0,
|
|
"step": 16340
|
|
},
|
|
{
|
|
"entropy": 6.256032085418701,
|
|
"epoch": 1.8863242931332949,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004652959158039438,
|
|
"loss": 5.7934,
|
|
"mean_token_accuracy": 0.19577520489692687,
|
|
"num_tokens": 41404069.0,
|
|
"step": 16345
|
|
},
|
|
{
|
|
"entropy": 6.223421478271485,
|
|
"epoch": 1.8869013271783035,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004652738954268062,
|
|
"loss": 5.7639,
|
|
"mean_token_accuracy": 0.19806374460458756,
|
|
"num_tokens": 41416698.0,
|
|
"step": 16350
|
|
},
|
|
{
|
|
"entropy": 6.249164390563965,
|
|
"epoch": 1.8874783612233121,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00046525186864990073,
|
|
"loss": 5.7403,
|
|
"mean_token_accuracy": 0.20115036368370057,
|
|
"num_tokens": 41429953.0,
|
|
"step": 16355
|
|
},
|
|
{
|
|
"entropy": 6.211552906036377,
|
|
"epoch": 1.8880553952683208,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00046522983547396806,
|
|
"loss": 5.7539,
|
|
"mean_token_accuracy": 0.1969211846590042,
|
|
"num_tokens": 41442824.0,
|
|
"step": 16360
|
|
},
|
|
{
|
|
"entropy": 6.246453046798706,
|
|
"epoch": 1.8886324293133296,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004652077958997494,
|
|
"loss": 5.7936,
|
|
"mean_token_accuracy": 0.19895950108766555,
|
|
"num_tokens": 41455062.0,
|
|
"step": 16365
|
|
},
|
|
{
|
|
"entropy": 6.222312116622925,
|
|
"epoch": 1.889209463358338,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00046518574992798604,
|
|
"loss": 5.6555,
|
|
"mean_token_accuracy": 0.2099636271595955,
|
|
"num_tokens": 41468147.0,
|
|
"step": 16370
|
|
},
|
|
{
|
|
"entropy": 6.223028945922851,
|
|
"epoch": 1.889786497403347,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00046516369755941945,
|
|
"loss": 5.7131,
|
|
"mean_token_accuracy": 0.19650413542985917,
|
|
"num_tokens": 41480664.0,
|
|
"step": 16375
|
|
},
|
|
{
|
|
"entropy": 6.2845159530639645,
|
|
"epoch": 1.8903635314483553,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004651416387947914,
|
|
"loss": 5.7874,
|
|
"mean_token_accuracy": 0.19323295950889588,
|
|
"num_tokens": 41494578.0,
|
|
"step": 16380
|
|
},
|
|
{
|
|
"entropy": 6.292543506622314,
|
|
"epoch": 1.8909405654933642,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004651195736348437,
|
|
"loss": 5.8311,
|
|
"mean_token_accuracy": 0.19104174971580506,
|
|
"num_tokens": 41506528.0,
|
|
"step": 16385
|
|
},
|
|
{
|
|
"entropy": 6.3199584007263185,
|
|
"epoch": 1.8915175995383726,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004650975020803186,
|
|
"loss": 5.8854,
|
|
"mean_token_accuracy": 0.18843409717082976,
|
|
"num_tokens": 41520861.0,
|
|
"step": 16390
|
|
},
|
|
{
|
|
"entropy": 6.2749334335327145,
|
|
"epoch": 1.8920946335833815,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004650754241319584,
|
|
"loss": 5.7578,
|
|
"mean_token_accuracy": 0.19465109407901765,
|
|
"num_tokens": 41533811.0,
|
|
"step": 16395
|
|
},
|
|
{
|
|
"entropy": 6.295410919189453,
|
|
"epoch": 1.8926716676283901,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00046505333979050573,
|
|
"loss": 5.8309,
|
|
"mean_token_accuracy": 0.18629831969738006,
|
|
"num_tokens": 41546291.0,
|
|
"step": 16400
|
|
},
|
|
{
|
|
"entropy": 6.229169321060181,
|
|
"epoch": 1.8932487016733988,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004650312490567035,
|
|
"loss": 5.6885,
|
|
"mean_token_accuracy": 0.20371766537427902,
|
|
"num_tokens": 41558157.0,
|
|
"step": 16405
|
|
},
|
|
{
|
|
"entropy": 6.260204553604126,
|
|
"epoch": 1.8938257357184074,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004650091519312945,
|
|
"loss": 5.7904,
|
|
"mean_token_accuracy": 0.19707432389259338,
|
|
"num_tokens": 41571346.0,
|
|
"step": 16410
|
|
},
|
|
{
|
|
"entropy": 6.290263605117798,
|
|
"epoch": 1.894402769763416,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00046498704841502203,
|
|
"loss": 5.8656,
|
|
"mean_token_accuracy": 0.1875235214829445,
|
|
"num_tokens": 41583973.0,
|
|
"step": 16415
|
|
},
|
|
{
|
|
"entropy": 6.2632382869720455,
|
|
"epoch": 1.8949798038084247,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004649649385086296,
|
|
"loss": 5.7809,
|
|
"mean_token_accuracy": 0.1917982280254364,
|
|
"num_tokens": 41596210.0,
|
|
"step": 16420
|
|
},
|
|
{
|
|
"entropy": 6.269391632080078,
|
|
"epoch": 1.8955568378534333,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004649428222128608,
|
|
"loss": 5.8774,
|
|
"mean_token_accuracy": 0.1920461028814316,
|
|
"num_tokens": 41608297.0,
|
|
"step": 16425
|
|
},
|
|
{
|
|
"entropy": 6.2635517597198485,
|
|
"epoch": 1.896133871898442,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00046492069952845953,
|
|
"loss": 5.8159,
|
|
"mean_token_accuracy": 0.19155189394950867,
|
|
"num_tokens": 41621319.0,
|
|
"step": 16430
|
|
},
|
|
{
|
|
"entropy": 6.256300735473633,
|
|
"epoch": 1.8967109059434506,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00046489857045617,
|
|
"loss": 5.7019,
|
|
"mean_token_accuracy": 0.1957299679517746,
|
|
"num_tokens": 41633282.0,
|
|
"step": 16435
|
|
},
|
|
{
|
|
"entropy": 6.198005723953247,
|
|
"epoch": 1.8972879399884595,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046487643499673625,
|
|
"loss": 5.7409,
|
|
"mean_token_accuracy": 0.19980133175849915,
|
|
"num_tokens": 41646573.0,
|
|
"step": 16440
|
|
},
|
|
{
|
|
"entropy": 6.209664535522461,
|
|
"epoch": 1.8978649740334679,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004648542931509029,
|
|
"loss": 5.7305,
|
|
"mean_token_accuracy": 0.1976473018527031,
|
|
"num_tokens": 41659596.0,
|
|
"step": 16445
|
|
},
|
|
{
|
|
"entropy": 6.271393918991089,
|
|
"epoch": 1.8984420080784767,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004648321449194148,
|
|
"loss": 5.7343,
|
|
"mean_token_accuracy": 0.19791839867830277,
|
|
"num_tokens": 41673612.0,
|
|
"step": 16450
|
|
},
|
|
{
|
|
"entropy": 6.33080906867981,
|
|
"epoch": 1.8990190421234852,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00046480999030301673,
|
|
"loss": 5.8707,
|
|
"mean_token_accuracy": 0.19741834253072738,
|
|
"num_tokens": 41686583.0,
|
|
"step": 16455
|
|
},
|
|
{
|
|
"entropy": 6.2306641101837155,
|
|
"epoch": 1.899596076168494,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00046478782930245395,
|
|
"loss": 5.7818,
|
|
"mean_token_accuracy": 0.19308353811502457,
|
|
"num_tokens": 41698542.0,
|
|
"step": 16460
|
|
},
|
|
{
|
|
"entropy": 6.272447824478149,
|
|
"epoch": 1.9001731102135024,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00046476566191847176,
|
|
"loss": 5.7652,
|
|
"mean_token_accuracy": 0.19157506674528121,
|
|
"num_tokens": 41712461.0,
|
|
"step": 16465
|
|
},
|
|
{
|
|
"entropy": 6.274053525924683,
|
|
"epoch": 1.9007501442585113,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004647434881518159,
|
|
"loss": 5.7936,
|
|
"mean_token_accuracy": 0.19418258666992189,
|
|
"num_tokens": 41725450.0,
|
|
"step": 16470
|
|
},
|
|
{
|
|
"entropy": 6.304055404663086,
|
|
"epoch": 1.90132717830352,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00046472130800323194,
|
|
"loss": 5.7928,
|
|
"mean_token_accuracy": 0.1953343480825424,
|
|
"num_tokens": 41737255.0,
|
|
"step": 16475
|
|
},
|
|
{
|
|
"entropy": 6.237203598022461,
|
|
"epoch": 1.9019042123485286,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004646991214734661,
|
|
"loss": 5.8467,
|
|
"mean_token_accuracy": 0.18810160607099533,
|
|
"num_tokens": 41749459.0,
|
|
"step": 16480
|
|
},
|
|
{
|
|
"entropy": 6.266273927688599,
|
|
"epoch": 1.9024812463935372,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004646769285632645,
|
|
"loss": 5.7854,
|
|
"mean_token_accuracy": 0.19517850428819655,
|
|
"num_tokens": 41761603.0,
|
|
"step": 16485
|
|
},
|
|
{
|
|
"entropy": 6.29341402053833,
|
|
"epoch": 1.9030582804385459,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004646547292733737,
|
|
"loss": 5.866,
|
|
"mean_token_accuracy": 0.19031329154968263,
|
|
"num_tokens": 41774865.0,
|
|
"step": 16490
|
|
},
|
|
{
|
|
"entropy": 6.235404348373413,
|
|
"epoch": 1.9036353144835545,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004646325236045402,
|
|
"loss": 5.7926,
|
|
"mean_token_accuracy": 0.19833193123340606,
|
|
"num_tokens": 41787558.0,
|
|
"step": 16495
|
|
},
|
|
{
|
|
"entropy": 6.243685007095337,
|
|
"epoch": 1.9042123485285631,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.000464610311557511,
|
|
"loss": 5.719,
|
|
"mean_token_accuracy": 0.20007752627134323,
|
|
"num_tokens": 41800754.0,
|
|
"step": 16500
|
|
},
|
|
{
|
|
"entropy": 6.226137685775757,
|
|
"epoch": 1.904789382573572,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004645880931330331,
|
|
"loss": 5.6967,
|
|
"mean_token_accuracy": 0.20966541022062302,
|
|
"num_tokens": 41813133.0,
|
|
"step": 16505
|
|
},
|
|
{
|
|
"entropy": 6.233737277984619,
|
|
"epoch": 1.9053664166185804,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004645658683318539,
|
|
"loss": 5.8035,
|
|
"mean_token_accuracy": 0.18930404186248778,
|
|
"num_tokens": 41825288.0,
|
|
"step": 16510
|
|
},
|
|
{
|
|
"entropy": 6.292668104171753,
|
|
"epoch": 1.9059434506635893,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004645436371547209,
|
|
"loss": 5.8451,
|
|
"mean_token_accuracy": 0.19418457448482512,
|
|
"num_tokens": 41837331.0,
|
|
"step": 16515
|
|
},
|
|
{
|
|
"entropy": 6.341061973571778,
|
|
"epoch": 1.9065204847085977,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00046452139960238186,
|
|
"loss": 5.8377,
|
|
"mean_token_accuracy": 0.19629154950380326,
|
|
"num_tokens": 41850536.0,
|
|
"step": 16520
|
|
},
|
|
{
|
|
"entropy": 6.257677698135376,
|
|
"epoch": 1.9070975187536066,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00046449915567558467,
|
|
"loss": 5.7741,
|
|
"mean_token_accuracy": 0.20220681130886078,
|
|
"num_tokens": 41862199.0,
|
|
"step": 16525
|
|
},
|
|
{
|
|
"entropy": 6.220550918579102,
|
|
"epoch": 1.907674552798615,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004644769053750775,
|
|
"loss": 5.7688,
|
|
"mean_token_accuracy": 0.196894970536232,
|
|
"num_tokens": 41872945.0,
|
|
"step": 16530
|
|
},
|
|
{
|
|
"entropy": 6.280444192886352,
|
|
"epoch": 1.9082515868436238,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004644546487016087,
|
|
"loss": 5.7714,
|
|
"mean_token_accuracy": 0.18869336992502211,
|
|
"num_tokens": 41884223.0,
|
|
"step": 16535
|
|
},
|
|
{
|
|
"entropy": 6.260154581069946,
|
|
"epoch": 1.9088286208886325,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00046443238565592687,
|
|
"loss": 5.7942,
|
|
"mean_token_accuracy": 0.19114427119493485,
|
|
"num_tokens": 41896997.0,
|
|
"step": 16540
|
|
},
|
|
{
|
|
"entropy": 6.2543297290802,
|
|
"epoch": 1.9094056549336411,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00046441011623878087,
|
|
"loss": 5.8051,
|
|
"mean_token_accuracy": 0.1990337774157524,
|
|
"num_tokens": 41910210.0,
|
|
"step": 16545
|
|
},
|
|
{
|
|
"entropy": 6.144182586669922,
|
|
"epoch": 1.9099826889786498,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004643878404509197,
|
|
"loss": 5.6173,
|
|
"mean_token_accuracy": 0.20534706264734268,
|
|
"num_tokens": 41922882.0,
|
|
"step": 16550
|
|
},
|
|
{
|
|
"entropy": 6.211149787902832,
|
|
"epoch": 1.9105597230236584,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00046436555829309264,
|
|
"loss": 5.6609,
|
|
"mean_token_accuracy": 0.20721425265073776,
|
|
"num_tokens": 41934655.0,
|
|
"step": 16555
|
|
},
|
|
{
|
|
"entropy": 6.271144676208496,
|
|
"epoch": 1.911136757068667,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.000464343269766049,
|
|
"loss": 5.7733,
|
|
"mean_token_accuracy": 0.19531577229499816,
|
|
"num_tokens": 41947946.0,
|
|
"step": 16560
|
|
},
|
|
{
|
|
"entropy": 6.307552719116211,
|
|
"epoch": 1.9117137911136757,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00046432097487053857,
|
|
"loss": 5.8634,
|
|
"mean_token_accuracy": 0.19490341544151307,
|
|
"num_tokens": 41962316.0,
|
|
"step": 16565
|
|
},
|
|
{
|
|
"entropy": 6.244507789611816,
|
|
"epoch": 1.9122908251586843,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00046429867360731124,
|
|
"loss": 5.7511,
|
|
"mean_token_accuracy": 0.20181444138288498,
|
|
"num_tokens": 41976076.0,
|
|
"step": 16570
|
|
},
|
|
{
|
|
"entropy": 6.296638822555542,
|
|
"epoch": 1.912867859203693,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00046427636597711695,
|
|
"loss": 5.7693,
|
|
"mean_token_accuracy": 0.19726170897483825,
|
|
"num_tokens": 41988762.0,
|
|
"step": 16575
|
|
},
|
|
{
|
|
"entropy": 6.256453800201416,
|
|
"epoch": 1.9134448932487018,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00046425405198070624,
|
|
"loss": 5.7026,
|
|
"mean_token_accuracy": 0.19614930152893068,
|
|
"num_tokens": 42000525.0,
|
|
"step": 16580
|
|
},
|
|
{
|
|
"entropy": 6.15288553237915,
|
|
"epoch": 1.9140219272937102,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00046423173161882944,
|
|
"loss": 5.6421,
|
|
"mean_token_accuracy": 0.20159791260957718,
|
|
"num_tokens": 42013716.0,
|
|
"step": 16585
|
|
},
|
|
{
|
|
"entropy": 6.256470537185669,
|
|
"epoch": 1.914598961338719,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00046420940489223735,
|
|
"loss": 5.7567,
|
|
"mean_token_accuracy": 0.198087240755558,
|
|
"num_tokens": 42026689.0,
|
|
"step": 16590
|
|
},
|
|
{
|
|
"entropy": 6.285912227630615,
|
|
"epoch": 1.9151759953837275,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004641870718016809,
|
|
"loss": 5.82,
|
|
"mean_token_accuracy": 0.18809255659580232,
|
|
"num_tokens": 42039907.0,
|
|
"step": 16595
|
|
},
|
|
{
|
|
"entropy": 6.284678554534912,
|
|
"epoch": 1.9157530294287364,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004641647323479113,
|
|
"loss": 5.7782,
|
|
"mean_token_accuracy": 0.20078144371509551,
|
|
"num_tokens": 42052781.0,
|
|
"step": 16600
|
|
},
|
|
{
|
|
"entropy": 6.257567262649536,
|
|
"epoch": 1.9163300634737448,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004641423865316798,
|
|
"loss": 5.7372,
|
|
"mean_token_accuracy": 0.2022291049361229,
|
|
"num_tokens": 42066695.0,
|
|
"step": 16605
|
|
},
|
|
{
|
|
"entropy": 6.1644511222839355,
|
|
"epoch": 1.9169070975187537,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004641200343537381,
|
|
"loss": 5.6759,
|
|
"mean_token_accuracy": 0.20373013019561767,
|
|
"num_tokens": 42079315.0,
|
|
"step": 16610
|
|
},
|
|
{
|
|
"entropy": 6.284307432174683,
|
|
"epoch": 1.9174841315637623,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000464097675814838,
|
|
"loss": 5.8274,
|
|
"mean_token_accuracy": 0.18814072906970977,
|
|
"num_tokens": 42091915.0,
|
|
"step": 16615
|
|
},
|
|
{
|
|
"entropy": 6.281247520446778,
|
|
"epoch": 1.918061165608771,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004640753109157316,
|
|
"loss": 5.8094,
|
|
"mean_token_accuracy": 0.19566377103328705,
|
|
"num_tokens": 42105316.0,
|
|
"step": 16620
|
|
},
|
|
{
|
|
"entropy": 6.255827951431274,
|
|
"epoch": 1.9186381996537796,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00046405293965717093,
|
|
"loss": 5.719,
|
|
"mean_token_accuracy": 0.19903454780578614,
|
|
"num_tokens": 42118078.0,
|
|
"step": 16625
|
|
},
|
|
{
|
|
"entropy": 6.236255788803101,
|
|
"epoch": 1.9192152336987882,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004640305620399086,
|
|
"loss": 5.6829,
|
|
"mean_token_accuracy": 0.20465412139892578,
|
|
"num_tokens": 42130845.0,
|
|
"step": 16630
|
|
},
|
|
{
|
|
"entropy": 6.2283731460571286,
|
|
"epoch": 1.9197922677437969,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004640081780646971,
|
|
"loss": 5.7412,
|
|
"mean_token_accuracy": 0.20514567643404008,
|
|
"num_tokens": 42142487.0,
|
|
"step": 16635
|
|
},
|
|
{
|
|
"entropy": 6.188979005813598,
|
|
"epoch": 1.9203693017888055,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00046398578773228954,
|
|
"loss": 5.7959,
|
|
"mean_token_accuracy": 0.1916016846895218,
|
|
"num_tokens": 42154747.0,
|
|
"step": 16640
|
|
},
|
|
{
|
|
"entropy": 6.3480628490447994,
|
|
"epoch": 1.9209463358338144,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00046396339104343886,
|
|
"loss": 5.7897,
|
|
"mean_token_accuracy": 0.1906105950474739,
|
|
"num_tokens": 42167697.0,
|
|
"step": 16645
|
|
},
|
|
{
|
|
"entropy": 6.264107656478882,
|
|
"epoch": 1.9215233698788228,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004639409879988984,
|
|
"loss": 5.7672,
|
|
"mean_token_accuracy": 0.19499629139900207,
|
|
"num_tokens": 42179874.0,
|
|
"step": 16650
|
|
},
|
|
{
|
|
"entropy": 6.344415950775146,
|
|
"epoch": 1.9221004039238316,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004639185785994216,
|
|
"loss": 5.8445,
|
|
"mean_token_accuracy": 0.19568451046943663,
|
|
"num_tokens": 42192747.0,
|
|
"step": 16655
|
|
},
|
|
{
|
|
"entropy": 6.209359455108642,
|
|
"epoch": 1.92267743796884,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00046389616284576226,
|
|
"loss": 5.7244,
|
|
"mean_token_accuracy": 0.20322487354278565,
|
|
"num_tokens": 42205534.0,
|
|
"step": 16660
|
|
},
|
|
{
|
|
"entropy": 6.236516332626342,
|
|
"epoch": 1.923254472013849,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00046387374073867435,
|
|
"loss": 5.7807,
|
|
"mean_token_accuracy": 0.1965228259563446,
|
|
"num_tokens": 42217825.0,
|
|
"step": 16665
|
|
},
|
|
{
|
|
"entropy": 6.307939052581787,
|
|
"epoch": 1.9238315060588573,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00046385131227891197,
|
|
"loss": 5.7686,
|
|
"mean_token_accuracy": 0.19342057555913925,
|
|
"num_tokens": 42230162.0,
|
|
"step": 16670
|
|
},
|
|
{
|
|
"entropy": 6.219927167892456,
|
|
"epoch": 1.9244085401038662,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004638288774672295,
|
|
"loss": 5.7397,
|
|
"mean_token_accuracy": 0.20268993824720383,
|
|
"num_tokens": 42242458.0,
|
|
"step": 16675
|
|
},
|
|
{
|
|
"entropy": 6.157504272460938,
|
|
"epoch": 1.9249855741488748,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004638064363043816,
|
|
"loss": 5.7236,
|
|
"mean_token_accuracy": 0.19436694234609603,
|
|
"num_tokens": 42254389.0,
|
|
"step": 16680
|
|
},
|
|
{
|
|
"entropy": 6.249301719665527,
|
|
"epoch": 1.9255626081938835,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00046378398879112293,
|
|
"loss": 5.7496,
|
|
"mean_token_accuracy": 0.20150014460086824,
|
|
"num_tokens": 42266421.0,
|
|
"step": 16685
|
|
},
|
|
{
|
|
"entropy": 6.132052278518676,
|
|
"epoch": 1.9261396422388921,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004637615349282086,
|
|
"loss": 5.7148,
|
|
"mean_token_accuracy": 0.19750168770551682,
|
|
"num_tokens": 42279189.0,
|
|
"step": 16690
|
|
},
|
|
{
|
|
"entropy": 6.267314481735229,
|
|
"epoch": 1.9267166762839008,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004637390747163938,
|
|
"loss": 5.7576,
|
|
"mean_token_accuracy": 0.19890677481889724,
|
|
"num_tokens": 42291970.0,
|
|
"step": 16695
|
|
},
|
|
{
|
|
"entropy": 6.314395475387573,
|
|
"epoch": 1.9272937103289094,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004637166081564339,
|
|
"loss": 5.8416,
|
|
"mean_token_accuracy": 0.19406890869140625,
|
|
"num_tokens": 42305185.0,
|
|
"step": 16700
|
|
},
|
|
{
|
|
"entropy": 6.290263223648071,
|
|
"epoch": 1.927870744373918,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00046369413524908473,
|
|
"loss": 5.7873,
|
|
"mean_token_accuracy": 0.20269953310489655,
|
|
"num_tokens": 42317823.0,
|
|
"step": 16705
|
|
},
|
|
{
|
|
"entropy": 6.241884231567383,
|
|
"epoch": 1.9284477784189267,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00046367165599510207,
|
|
"loss": 5.8062,
|
|
"mean_token_accuracy": 0.1951628655195236,
|
|
"num_tokens": 42330540.0,
|
|
"step": 16710
|
|
},
|
|
{
|
|
"entropy": 6.224489212036133,
|
|
"epoch": 1.9290248124639353,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004636491703952419,
|
|
"loss": 5.6006,
|
|
"mean_token_accuracy": 0.20743975341320037,
|
|
"num_tokens": 42342347.0,
|
|
"step": 16715
|
|
},
|
|
{
|
|
"entropy": 6.207153224945069,
|
|
"epoch": 1.9296018465089442,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00046362667845026057,
|
|
"loss": 5.7571,
|
|
"mean_token_accuracy": 0.20456219017505645,
|
|
"num_tokens": 42355004.0,
|
|
"step": 16720
|
|
},
|
|
{
|
|
"entropy": 6.225836229324341,
|
|
"epoch": 1.9301788805539526,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00046360418016091467,
|
|
"loss": 5.7263,
|
|
"mean_token_accuracy": 0.19706103801727295,
|
|
"num_tokens": 42366700.0,
|
|
"step": 16725
|
|
},
|
|
{
|
|
"entropy": 6.230300235748291,
|
|
"epoch": 1.9307559145989615,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00046358167552796085,
|
|
"loss": 5.7861,
|
|
"mean_token_accuracy": 0.19526439011096955,
|
|
"num_tokens": 42379723.0,
|
|
"step": 16730
|
|
},
|
|
{
|
|
"entropy": 6.215284585952759,
|
|
"epoch": 1.9313329486439699,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00046355916455215597,
|
|
"loss": 5.7475,
|
|
"mean_token_accuracy": 0.20507837533950807,
|
|
"num_tokens": 42393505.0,
|
|
"step": 16735
|
|
},
|
|
{
|
|
"entropy": 6.2595137596130375,
|
|
"epoch": 1.9319099826889787,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004635366472342573,
|
|
"loss": 5.7536,
|
|
"mean_token_accuracy": 0.1928567260503769,
|
|
"num_tokens": 42406334.0,
|
|
"step": 16740
|
|
},
|
|
{
|
|
"entropy": 6.250863933563233,
|
|
"epoch": 1.9324870167339872,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004635141235750222,
|
|
"loss": 5.7826,
|
|
"mean_token_accuracy": 0.19470173269510269,
|
|
"num_tokens": 42418585.0,
|
|
"step": 16745
|
|
},
|
|
{
|
|
"entropy": 6.236263465881348,
|
|
"epoch": 1.933064050778996,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00046349159357520815,
|
|
"loss": 5.6911,
|
|
"mean_token_accuracy": 0.20743900984525682,
|
|
"num_tokens": 42430741.0,
|
|
"step": 16750
|
|
},
|
|
{
|
|
"entropy": 6.18456621170044,
|
|
"epoch": 1.9336410848240047,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.000463469057235573,
|
|
"loss": 5.6973,
|
|
"mean_token_accuracy": 0.21004330068826677,
|
|
"num_tokens": 42443241.0,
|
|
"step": 16755
|
|
},
|
|
{
|
|
"entropy": 6.249989223480225,
|
|
"epoch": 1.9342181188690133,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00046344651455687476,
|
|
"loss": 5.7941,
|
|
"mean_token_accuracy": 0.19664210975170135,
|
|
"num_tokens": 42456476.0,
|
|
"step": 16760
|
|
},
|
|
{
|
|
"entropy": 6.355844640731812,
|
|
"epoch": 1.934795152914022,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00046342396553987155,
|
|
"loss": 5.7991,
|
|
"mean_token_accuracy": 0.19460918456315995,
|
|
"num_tokens": 42468875.0,
|
|
"step": 16765
|
|
},
|
|
{
|
|
"entropy": 6.318538808822632,
|
|
"epoch": 1.9353721869590306,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00046340141018532186,
|
|
"loss": 5.7436,
|
|
"mean_token_accuracy": 0.19695119559764862,
|
|
"num_tokens": 42483300.0,
|
|
"step": 16770
|
|
},
|
|
{
|
|
"entropy": 6.241217947006225,
|
|
"epoch": 1.9359492210040392,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004633788484939843,
|
|
"loss": 5.8172,
|
|
"mean_token_accuracy": 0.19264088720083236,
|
|
"num_tokens": 42497748.0,
|
|
"step": 16775
|
|
},
|
|
{
|
|
"entropy": 6.202336645126342,
|
|
"epoch": 1.9365262550490479,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.00046335628046661776,
|
|
"loss": 5.8135,
|
|
"mean_token_accuracy": 0.1930590033531189,
|
|
"num_tokens": 42510464.0,
|
|
"step": 16780
|
|
},
|
|
{
|
|
"entropy": 6.34554967880249,
|
|
"epoch": 1.9371032890940567,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00046333370610398135,
|
|
"loss": 5.8634,
|
|
"mean_token_accuracy": 0.18837577253580093,
|
|
"num_tokens": 42522298.0,
|
|
"step": 16785
|
|
},
|
|
{
|
|
"entropy": 6.321823215484619,
|
|
"epoch": 1.9376803231390651,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004633111254068342,
|
|
"loss": 5.732,
|
|
"mean_token_accuracy": 0.20026923716068268,
|
|
"num_tokens": 42535094.0,
|
|
"step": 16790
|
|
},
|
|
{
|
|
"entropy": 6.171190404891968,
|
|
"epoch": 1.938257357184074,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004632885383759359,
|
|
"loss": 5.7286,
|
|
"mean_token_accuracy": 0.20176013112068175,
|
|
"num_tokens": 42547272.0,
|
|
"step": 16795
|
|
},
|
|
{
|
|
"entropy": 6.122797870635987,
|
|
"epoch": 1.9388343912290824,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00046326594501204624,
|
|
"loss": 5.6462,
|
|
"mean_token_accuracy": 0.20535439550876616,
|
|
"num_tokens": 42559568.0,
|
|
"step": 16800
|
|
},
|
|
{
|
|
"entropy": 6.31897931098938,
|
|
"epoch": 1.9394114252740913,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.000463243345315925,
|
|
"loss": 5.7954,
|
|
"mean_token_accuracy": 0.19426541924476623,
|
|
"num_tokens": 42573177.0,
|
|
"step": 16805
|
|
},
|
|
{
|
|
"entropy": 6.238536357879639,
|
|
"epoch": 1.9399884593190997,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00046322073928833224,
|
|
"loss": 5.7324,
|
|
"mean_token_accuracy": 0.19810742139816284,
|
|
"num_tokens": 42585436.0,
|
|
"step": 16810
|
|
},
|
|
{
|
|
"entropy": 6.25981593132019,
|
|
"epoch": 1.9405654933641086,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004631981269300285,
|
|
"loss": 5.7486,
|
|
"mean_token_accuracy": 0.19752792567014693,
|
|
"num_tokens": 42599826.0,
|
|
"step": 16815
|
|
},
|
|
{
|
|
"entropy": 6.23888201713562,
|
|
"epoch": 1.9411425274091172,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004631755082417742,
|
|
"loss": 5.7861,
|
|
"mean_token_accuracy": 0.19362489581108094,
|
|
"num_tokens": 42613901.0,
|
|
"step": 16820
|
|
},
|
|
{
|
|
"entropy": 6.338619804382324,
|
|
"epoch": 1.9417195614541258,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004631528832243302,
|
|
"loss": 5.7823,
|
|
"mean_token_accuracy": 0.193868550658226,
|
|
"num_tokens": 42626592.0,
|
|
"step": 16825
|
|
},
|
|
{
|
|
"entropy": 6.2455222606658936,
|
|
"epoch": 1.9422965954991345,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00046313025187845735,
|
|
"loss": 5.7098,
|
|
"mean_token_accuracy": 0.2027307316660881,
|
|
"num_tokens": 42639754.0,
|
|
"step": 16830
|
|
},
|
|
{
|
|
"entropy": 6.237716293334961,
|
|
"epoch": 1.942873629544143,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00046310761420491705,
|
|
"loss": 5.694,
|
|
"mean_token_accuracy": 0.2055831789970398,
|
|
"num_tokens": 42651321.0,
|
|
"step": 16835
|
|
},
|
|
{
|
|
"entropy": 6.281747102737427,
|
|
"epoch": 1.9434506635891518,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004630849702044705,
|
|
"loss": 5.7825,
|
|
"mean_token_accuracy": 0.1963137060403824,
|
|
"num_tokens": 42664188.0,
|
|
"step": 16840
|
|
},
|
|
{
|
|
"entropy": 6.190065813064575,
|
|
"epoch": 1.9440276976341604,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00046306231987787937,
|
|
"loss": 5.7493,
|
|
"mean_token_accuracy": 0.1937461093068123,
|
|
"num_tokens": 42677882.0,
|
|
"step": 16845
|
|
},
|
|
{
|
|
"entropy": 6.177444744110107,
|
|
"epoch": 1.944604731679169,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00046303966322590556,
|
|
"loss": 5.6669,
|
|
"mean_token_accuracy": 0.2031422659754753,
|
|
"num_tokens": 42690595.0,
|
|
"step": 16850
|
|
},
|
|
{
|
|
"entropy": 6.147070264816284,
|
|
"epoch": 1.9451817657241777,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004630170002493111,
|
|
"loss": 5.6277,
|
|
"mean_token_accuracy": 0.205380442738533,
|
|
"num_tokens": 42704784.0,
|
|
"step": 16855
|
|
},
|
|
{
|
|
"entropy": 6.207528877258301,
|
|
"epoch": 1.9457587997691865,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00046299433094885826,
|
|
"loss": 5.7333,
|
|
"mean_token_accuracy": 0.1969046950340271,
|
|
"num_tokens": 42717012.0,
|
|
"step": 16860
|
|
},
|
|
{
|
|
"entropy": 6.309299516677856,
|
|
"epoch": 1.946335833814195,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046297165532530944,
|
|
"loss": 5.7849,
|
|
"mean_token_accuracy": 0.1904382139444351,
|
|
"num_tokens": 42728879.0,
|
|
"step": 16865
|
|
},
|
|
{
|
|
"entropy": 6.261871433258056,
|
|
"epoch": 1.9469128678592038,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004629489733794274,
|
|
"loss": 5.793,
|
|
"mean_token_accuracy": 0.19949239790439605,
|
|
"num_tokens": 42742688.0,
|
|
"step": 16870
|
|
},
|
|
{
|
|
"entropy": 6.28302321434021,
|
|
"epoch": 1.9474899019042122,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.000462926285111975,
|
|
"loss": 5.744,
|
|
"mean_token_accuracy": 0.19738974422216415,
|
|
"num_tokens": 42754955.0,
|
|
"step": 16875
|
|
},
|
|
{
|
|
"entropy": 6.240672779083252,
|
|
"epoch": 1.948066935949221,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00046290359052371535,
|
|
"loss": 5.8072,
|
|
"mean_token_accuracy": 0.19272707402706146,
|
|
"num_tokens": 42767760.0,
|
|
"step": 16880
|
|
},
|
|
{
|
|
"entropy": 6.249153757095337,
|
|
"epoch": 1.9486439699942295,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004628808896154117,
|
|
"loss": 5.765,
|
|
"mean_token_accuracy": 0.1935882583260536,
|
|
"num_tokens": 42779683.0,
|
|
"step": 16885
|
|
},
|
|
{
|
|
"entropy": 6.273938417434692,
|
|
"epoch": 1.9492210040392384,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004628581823878277,
|
|
"loss": 5.7644,
|
|
"mean_token_accuracy": 0.1917514681816101,
|
|
"num_tokens": 42791289.0,
|
|
"step": 16890
|
|
},
|
|
{
|
|
"entropy": 6.281899070739746,
|
|
"epoch": 1.949798038084247,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.000462835468841727,
|
|
"loss": 5.8156,
|
|
"mean_token_accuracy": 0.19286248087882996,
|
|
"num_tokens": 42803318.0,
|
|
"step": 16895
|
|
},
|
|
{
|
|
"entropy": 6.225988864898682,
|
|
"epoch": 1.9503750721292556,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004628127489778737,
|
|
"loss": 5.7822,
|
|
"mean_token_accuracy": 0.19895075708627702,
|
|
"num_tokens": 42815935.0,
|
|
"step": 16900
|
|
},
|
|
{
|
|
"entropy": 6.2690986633300785,
|
|
"epoch": 1.9509521061742643,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004627900227970318,
|
|
"loss": 5.7592,
|
|
"mean_token_accuracy": 0.2022063061594963,
|
|
"num_tokens": 42827759.0,
|
|
"step": 16905
|
|
},
|
|
{
|
|
"entropy": 6.2387683391571045,
|
|
"epoch": 1.951529140219273,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00046276729029996576,
|
|
"loss": 5.7649,
|
|
"mean_token_accuracy": 0.19421954751014708,
|
|
"num_tokens": 42840479.0,
|
|
"step": 16910
|
|
},
|
|
{
|
|
"entropy": 6.255968284606934,
|
|
"epoch": 1.9521061742642816,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.00046274455148744025,
|
|
"loss": 5.8335,
|
|
"mean_token_accuracy": 0.1934561923146248,
|
|
"num_tokens": 42853972.0,
|
|
"step": 16915
|
|
},
|
|
{
|
|
"entropy": 6.2588348388671875,
|
|
"epoch": 1.9526832083092902,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00046272180636022,
|
|
"loss": 5.7313,
|
|
"mean_token_accuracy": 0.2022838994860649,
|
|
"num_tokens": 42866192.0,
|
|
"step": 16920
|
|
},
|
|
{
|
|
"entropy": 6.218838548660278,
|
|
"epoch": 1.953260242354299,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00046269905491907,
|
|
"loss": 5.7531,
|
|
"mean_token_accuracy": 0.20053910315036774,
|
|
"num_tokens": 42878661.0,
|
|
"step": 16925
|
|
},
|
|
{
|
|
"entropy": 6.17126088142395,
|
|
"epoch": 1.9538372763993075,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004626762971647555,
|
|
"loss": 5.7495,
|
|
"mean_token_accuracy": 0.1976466402411461,
|
|
"num_tokens": 42891498.0,
|
|
"step": 16930
|
|
},
|
|
{
|
|
"entropy": 6.24580078125,
|
|
"epoch": 1.9544143104443163,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00046265353309804205,
|
|
"loss": 5.6829,
|
|
"mean_token_accuracy": 0.20284637361764907,
|
|
"num_tokens": 42904657.0,
|
|
"step": 16935
|
|
},
|
|
{
|
|
"entropy": 6.273250246047974,
|
|
"epoch": 1.9549913444893248,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004626307627196952,
|
|
"loss": 5.7381,
|
|
"mean_token_accuracy": 0.20008694678544997,
|
|
"num_tokens": 42916824.0,
|
|
"step": 16940
|
|
},
|
|
{
|
|
"entropy": 6.279068374633789,
|
|
"epoch": 1.9555683785343336,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004626079860304808,
|
|
"loss": 5.8076,
|
|
"mean_token_accuracy": 0.20154052823781968,
|
|
"num_tokens": 42929366.0,
|
|
"step": 16945
|
|
},
|
|
{
|
|
"entropy": 6.146010112762451,
|
|
"epoch": 1.956145412579342,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00046258520303116496,
|
|
"loss": 5.649,
|
|
"mean_token_accuracy": 0.20451925396919252,
|
|
"num_tokens": 42941955.0,
|
|
"step": 16950
|
|
},
|
|
{
|
|
"entropy": 6.277160882949829,
|
|
"epoch": 1.956722446624351,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004625624137225141,
|
|
"loss": 5.8494,
|
|
"mean_token_accuracy": 0.18529517501592635,
|
|
"num_tokens": 42954302.0,
|
|
"step": 16955
|
|
},
|
|
{
|
|
"entropy": 6.32279372215271,
|
|
"epoch": 1.9572994806693593,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004625396181052945,
|
|
"loss": 5.7328,
|
|
"mean_token_accuracy": 0.19855155050754547,
|
|
"num_tokens": 42967225.0,
|
|
"step": 16960
|
|
},
|
|
{
|
|
"entropy": 6.244097757339477,
|
|
"epoch": 1.9578765147143682,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00046251681618027316,
|
|
"loss": 5.7671,
|
|
"mean_token_accuracy": 0.2019764319062233,
|
|
"num_tokens": 42981388.0,
|
|
"step": 16965
|
|
},
|
|
{
|
|
"entropy": 6.2767432689666744,
|
|
"epoch": 1.9584535487593768,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004624940079482167,
|
|
"loss": 5.7902,
|
|
"mean_token_accuracy": 0.1942693993449211,
|
|
"num_tokens": 42993110.0,
|
|
"step": 16970
|
|
},
|
|
{
|
|
"entropy": 6.224786043167114,
|
|
"epoch": 1.9590305828043855,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00046247119340989254,
|
|
"loss": 5.7964,
|
|
"mean_token_accuracy": 0.18906237035989762,
|
|
"num_tokens": 43007309.0,
|
|
"step": 16975
|
|
},
|
|
{
|
|
"entropy": 6.243825435638428,
|
|
"epoch": 1.959607616849394,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004624483725660678,
|
|
"loss": 5.6601,
|
|
"mean_token_accuracy": 0.21698321104049684,
|
|
"num_tokens": 43020813.0,
|
|
"step": 16980
|
|
},
|
|
{
|
|
"entropy": 6.279694986343384,
|
|
"epoch": 1.9601846508944027,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004624255454175102,
|
|
"loss": 5.7775,
|
|
"mean_token_accuracy": 0.19770735502243042,
|
|
"num_tokens": 43033357.0,
|
|
"step": 16985
|
|
},
|
|
{
|
|
"entropy": 6.240402030944824,
|
|
"epoch": 1.9607616849394114,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004624027119649875,
|
|
"loss": 5.8401,
|
|
"mean_token_accuracy": 0.19352957457304001,
|
|
"num_tokens": 43046685.0,
|
|
"step": 16990
|
|
},
|
|
{
|
|
"entropy": 6.277683067321777,
|
|
"epoch": 1.96133871898442,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00046237987220926766,
|
|
"loss": 5.8113,
|
|
"mean_token_accuracy": 0.19058777391910553,
|
|
"num_tokens": 43059670.0,
|
|
"step": 16995
|
|
},
|
|
{
|
|
"entropy": 6.229287195205688,
|
|
"epoch": 1.9619157530294289,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00046235702615111886,
|
|
"loss": 5.6756,
|
|
"mean_token_accuracy": 0.20468678921461106,
|
|
"num_tokens": 43073515.0,
|
|
"step": 17000
|
|
},
|
|
{
|
|
"entropy": 6.26941409111023,
|
|
"epoch": 1.9624927870744373,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004623341737913096,
|
|
"loss": 5.7838,
|
|
"mean_token_accuracy": 0.19650481641292572,
|
|
"num_tokens": 43086046.0,
|
|
"step": 17005
|
|
},
|
|
{
|
|
"entropy": 6.222126197814942,
|
|
"epoch": 1.9630698211194462,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004623113151306085,
|
|
"loss": 5.6846,
|
|
"mean_token_accuracy": 0.19888866394758226,
|
|
"num_tokens": 43097703.0,
|
|
"step": 17010
|
|
},
|
|
{
|
|
"entropy": 6.213971853256226,
|
|
"epoch": 1.9636468551644546,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00046228845016978425,
|
|
"loss": 5.7542,
|
|
"mean_token_accuracy": 0.19422128796577454,
|
|
"num_tokens": 43110378.0,
|
|
"step": 17015
|
|
},
|
|
{
|
|
"entropy": 6.270879411697388,
|
|
"epoch": 1.9642238892094634,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004622655789096061,
|
|
"loss": 5.7468,
|
|
"mean_token_accuracy": 0.19963121861219407,
|
|
"num_tokens": 43122978.0,
|
|
"step": 17020
|
|
},
|
|
{
|
|
"entropy": 6.333521223068237,
|
|
"epoch": 1.9648009232544719,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00046224270135084315,
|
|
"loss": 5.8301,
|
|
"mean_token_accuracy": 0.19587821811437606,
|
|
"num_tokens": 43135371.0,
|
|
"step": 17025
|
|
},
|
|
{
|
|
"entropy": 6.176549243927002,
|
|
"epoch": 1.9653779572994807,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00046221981749426503,
|
|
"loss": 5.7494,
|
|
"mean_token_accuracy": 0.195055790245533,
|
|
"num_tokens": 43147251.0,
|
|
"step": 17030
|
|
},
|
|
{
|
|
"entropy": 6.231923294067383,
|
|
"epoch": 1.9659549913444894,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00046219692734064124,
|
|
"loss": 5.728,
|
|
"mean_token_accuracy": 0.19381537437438964,
|
|
"num_tokens": 43160276.0,
|
|
"step": 17035
|
|
},
|
|
{
|
|
"entropy": 6.3147297382354735,
|
|
"epoch": 1.966532025389498,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004621740308907419,
|
|
"loss": 5.7714,
|
|
"mean_token_accuracy": 0.19927388578653335,
|
|
"num_tokens": 43172443.0,
|
|
"step": 17040
|
|
},
|
|
{
|
|
"entropy": 6.29047212600708,
|
|
"epoch": 1.9671090594345066,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004621511281453369,
|
|
"loss": 5.8044,
|
|
"mean_token_accuracy": 0.19463059306144714,
|
|
"num_tokens": 43186350.0,
|
|
"step": 17045
|
|
},
|
|
{
|
|
"entropy": 6.209466171264649,
|
|
"epoch": 1.9676860934795153,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004621282191051967,
|
|
"loss": 5.7387,
|
|
"mean_token_accuracy": 0.2009575068950653,
|
|
"num_tokens": 43198936.0,
|
|
"step": 17050
|
|
},
|
|
{
|
|
"entropy": 6.32681713104248,
|
|
"epoch": 1.968263127524524,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004621053037710918,
|
|
"loss": 5.7827,
|
|
"mean_token_accuracy": 0.19598435312509538,
|
|
"num_tokens": 43211793.0,
|
|
"step": 17055
|
|
},
|
|
{
|
|
"entropy": 6.263002681732178,
|
|
"epoch": 1.9688401615695326,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.000462082382143793,
|
|
"loss": 5.7579,
|
|
"mean_token_accuracy": 0.19923101365566254,
|
|
"num_tokens": 43223817.0,
|
|
"step": 17060
|
|
},
|
|
{
|
|
"entropy": 6.261463308334351,
|
|
"epoch": 1.9694171956145412,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00046205945422407113,
|
|
"loss": 5.7671,
|
|
"mean_token_accuracy": 0.1999775692820549,
|
|
"num_tokens": 43235769.0,
|
|
"step": 17065
|
|
},
|
|
{
|
|
"entropy": 6.275276851654053,
|
|
"epoch": 1.9699942296595498,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00046203652001269754,
|
|
"loss": 5.7892,
|
|
"mean_token_accuracy": 0.19710277765989304,
|
|
"num_tokens": 43249309.0,
|
|
"step": 17070
|
|
},
|
|
{
|
|
"entropy": 6.237096548080444,
|
|
"epoch": 1.9705712637045587,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00046201357951044337,
|
|
"loss": 5.7608,
|
|
"mean_token_accuracy": 0.19623759686946868,
|
|
"num_tokens": 43262814.0,
|
|
"step": 17075
|
|
},
|
|
{
|
|
"entropy": 6.283816623687744,
|
|
"epoch": 1.9711482977495671,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00046199063271808047,
|
|
"loss": 5.8196,
|
|
"mean_token_accuracy": 0.19353357702493668,
|
|
"num_tokens": 43276898.0,
|
|
"step": 17080
|
|
},
|
|
{
|
|
"entropy": 6.243425130844116,
|
|
"epoch": 1.971725331794576,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004619676796363804,
|
|
"loss": 5.7573,
|
|
"mean_token_accuracy": 0.2017611876130104,
|
|
"num_tokens": 43288902.0,
|
|
"step": 17085
|
|
},
|
|
{
|
|
"entropy": 6.289148283004761,
|
|
"epoch": 1.9723023658395844,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00046194472026611546,
|
|
"loss": 5.7532,
|
|
"mean_token_accuracy": 0.1987377718091011,
|
|
"num_tokens": 43301644.0,
|
|
"step": 17090
|
|
},
|
|
{
|
|
"entropy": 6.246998453140259,
|
|
"epoch": 1.9728793998845933,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004619217546080576,
|
|
"loss": 5.7426,
|
|
"mean_token_accuracy": 0.19673261046409607,
|
|
"num_tokens": 43315550.0,
|
|
"step": 17095
|
|
},
|
|
{
|
|
"entropy": 6.379453182220459,
|
|
"epoch": 1.9734564339296017,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004618987826629794,
|
|
"loss": 5.855,
|
|
"mean_token_accuracy": 0.18522174060344695,
|
|
"num_tokens": 43328095.0,
|
|
"step": 17100
|
|
},
|
|
{
|
|
"entropy": 6.251423120498657,
|
|
"epoch": 1.9740334679746105,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00046187580443165344,
|
|
"loss": 5.7599,
|
|
"mean_token_accuracy": 0.20047521889209746,
|
|
"num_tokens": 43340461.0,
|
|
"step": 17105
|
|
},
|
|
{
|
|
"entropy": 6.297940587997436,
|
|
"epoch": 1.9746105020196192,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004618528199148527,
|
|
"loss": 5.7534,
|
|
"mean_token_accuracy": 0.2036628544330597,
|
|
"num_tokens": 43352322.0,
|
|
"step": 17110
|
|
},
|
|
{
|
|
"entropy": 6.291927099227905,
|
|
"epoch": 1.9751875360646278,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.00046182982911335016,
|
|
"loss": 5.7743,
|
|
"mean_token_accuracy": 0.19787712693214415,
|
|
"num_tokens": 43366212.0,
|
|
"step": 17115
|
|
},
|
|
{
|
|
"entropy": 6.322417783737182,
|
|
"epoch": 1.9757645701096365,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00046180683202791905,
|
|
"loss": 5.8686,
|
|
"mean_token_accuracy": 0.19052491784095765,
|
|
"num_tokens": 43379123.0,
|
|
"step": 17120
|
|
},
|
|
{
|
|
"entropy": 6.338251638412475,
|
|
"epoch": 1.976341604154645,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.000461783828659333,
|
|
"loss": 5.8762,
|
|
"mean_token_accuracy": 0.18852563202381134,
|
|
"num_tokens": 43393188.0,
|
|
"step": 17125
|
|
},
|
|
{
|
|
"entropy": 6.377630805969238,
|
|
"epoch": 1.9769186381996537,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00046176081900836565,
|
|
"loss": 5.7829,
|
|
"mean_token_accuracy": 0.19455361515283584,
|
|
"num_tokens": 43407448.0,
|
|
"step": 17130
|
|
},
|
|
{
|
|
"entropy": 6.2423668384552,
|
|
"epoch": 1.9774956722446624,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00046173780307579086,
|
|
"loss": 5.7254,
|
|
"mean_token_accuracy": 0.19675862044095993,
|
|
"num_tokens": 43420202.0,
|
|
"step": 17135
|
|
},
|
|
{
|
|
"entropy": 6.218957424163818,
|
|
"epoch": 1.9780727062896712,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004617147808623829,
|
|
"loss": 5.7939,
|
|
"mean_token_accuracy": 0.18706247061491013,
|
|
"num_tokens": 43433218.0,
|
|
"step": 17140
|
|
},
|
|
{
|
|
"entropy": 6.2471057891845705,
|
|
"epoch": 1.9786497403346797,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00046169175236891605,
|
|
"loss": 5.7828,
|
|
"mean_token_accuracy": 0.19302263110876083,
|
|
"num_tokens": 43445721.0,
|
|
"step": 17145
|
|
},
|
|
{
|
|
"entropy": 6.32406005859375,
|
|
"epoch": 1.9792267743796885,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004616687175961648,
|
|
"loss": 5.7908,
|
|
"mean_token_accuracy": 0.19397074580192566,
|
|
"num_tokens": 43457470.0,
|
|
"step": 17150
|
|
},
|
|
{
|
|
"entropy": 6.276082611083984,
|
|
"epoch": 1.979803808424697,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004616456765449039,
|
|
"loss": 5.7838,
|
|
"mean_token_accuracy": 0.20368654876947404,
|
|
"num_tokens": 43470693.0,
|
|
"step": 17155
|
|
},
|
|
{
|
|
"entropy": 6.248766613006592,
|
|
"epoch": 1.9803808424697058,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00046162262921590845,
|
|
"loss": 5.8039,
|
|
"mean_token_accuracy": 0.19646263122558594,
|
|
"num_tokens": 43482890.0,
|
|
"step": 17160
|
|
},
|
|
{
|
|
"entropy": 6.372063541412354,
|
|
"epoch": 1.9809578765147142,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004615995756099535,
|
|
"loss": 5.8375,
|
|
"mean_token_accuracy": 0.18987953066825866,
|
|
"num_tokens": 43495444.0,
|
|
"step": 17165
|
|
},
|
|
{
|
|
"entropy": 6.262853002548217,
|
|
"epoch": 1.981534910559723,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004615765157278146,
|
|
"loss": 5.7935,
|
|
"mean_token_accuracy": 0.19052637368440628,
|
|
"num_tokens": 43507415.0,
|
|
"step": 17170
|
|
},
|
|
{
|
|
"entropy": 6.274124622344971,
|
|
"epoch": 1.9821119446047317,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00046155344957026726,
|
|
"loss": 5.813,
|
|
"mean_token_accuracy": 0.19190335720777513,
|
|
"num_tokens": 43520832.0,
|
|
"step": 17175
|
|
},
|
|
{
|
|
"entropy": 6.275217294692993,
|
|
"epoch": 1.9826889786497404,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004615303771380873,
|
|
"loss": 5.7534,
|
|
"mean_token_accuracy": 0.1979634016752243,
|
|
"num_tokens": 43534459.0,
|
|
"step": 17180
|
|
},
|
|
{
|
|
"entropy": 6.1655778884887695,
|
|
"epoch": 1.983266012694749,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00046150729843205077,
|
|
"loss": 5.5974,
|
|
"mean_token_accuracy": 0.20756071358919143,
|
|
"num_tokens": 43546466.0,
|
|
"step": 17185
|
|
},
|
|
{
|
|
"entropy": 6.217870903015137,
|
|
"epoch": 1.9838430467397576,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00046148421345293384,
|
|
"loss": 5.6775,
|
|
"mean_token_accuracy": 0.2055698052048683,
|
|
"num_tokens": 43558285.0,
|
|
"step": 17190
|
|
},
|
|
{
|
|
"entropy": 6.171381568908691,
|
|
"epoch": 1.9844200807847663,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004614611222015131,
|
|
"loss": 5.6587,
|
|
"mean_token_accuracy": 0.20381601601839067,
|
|
"num_tokens": 43572117.0,
|
|
"step": 17195
|
|
},
|
|
{
|
|
"entropy": 6.258411312103272,
|
|
"epoch": 1.984997114829775,
|
|
"grad_norm": 1.96875,
|
|
"learning_rate": 0.00046143802467856507,
|
|
"loss": 5.8139,
|
|
"mean_token_accuracy": 0.1962540939450264,
|
|
"num_tokens": 43586951.0,
|
|
"step": 17200
|
|
},
|
|
{
|
|
"entropy": 6.271241092681885,
|
|
"epoch": 1.9855741488747836,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046141492088486673,
|
|
"loss": 5.6846,
|
|
"mean_token_accuracy": 0.2100219815969467,
|
|
"num_tokens": 43600542.0,
|
|
"step": 17205
|
|
},
|
|
{
|
|
"entropy": 6.2649232864379885,
|
|
"epoch": 1.9861511829197922,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004613918108211951,
|
|
"loss": 5.78,
|
|
"mean_token_accuracy": 0.19840521961450577,
|
|
"num_tokens": 43612928.0,
|
|
"step": 17210
|
|
},
|
|
{
|
|
"entropy": 6.304554271697998,
|
|
"epoch": 1.986728216964801,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004613686944883275,
|
|
"loss": 5.7714,
|
|
"mean_token_accuracy": 0.1991189256310463,
|
|
"num_tokens": 43625362.0,
|
|
"step": 17215
|
|
},
|
|
{
|
|
"entropy": 6.205133724212646,
|
|
"epoch": 1.9873052510098095,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00046134557188704146,
|
|
"loss": 5.7749,
|
|
"mean_token_accuracy": 0.20026649087667464,
|
|
"num_tokens": 43638165.0,
|
|
"step": 17220
|
|
},
|
|
{
|
|
"entropy": 6.192930030822754,
|
|
"epoch": 1.9878822850548183,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00046132244301811466,
|
|
"loss": 5.7093,
|
|
"mean_token_accuracy": 0.19966957122087478,
|
|
"num_tokens": 43650688.0,
|
|
"step": 17225
|
|
},
|
|
{
|
|
"entropy": 6.329173803329468,
|
|
"epoch": 1.9884593190998268,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00046129930788232497,
|
|
"loss": 5.8168,
|
|
"mean_token_accuracy": 0.19335910826921462,
|
|
"num_tokens": 43663168.0,
|
|
"step": 17230
|
|
},
|
|
{
|
|
"entropy": 6.296715450286865,
|
|
"epoch": 1.9890363531448356,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00046127616648045073,
|
|
"loss": 5.7725,
|
|
"mean_token_accuracy": 0.1897001937031746,
|
|
"num_tokens": 43676391.0,
|
|
"step": 17235
|
|
},
|
|
{
|
|
"entropy": 6.32203950881958,
|
|
"epoch": 1.989613387189844,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00046125301881327007,
|
|
"loss": 5.7157,
|
|
"mean_token_accuracy": 0.20050082802772523,
|
|
"num_tokens": 43689631.0,
|
|
"step": 17240
|
|
},
|
|
{
|
|
"entropy": 6.231979131698608,
|
|
"epoch": 1.990190421234853,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00046122986488156167,
|
|
"loss": 5.7623,
|
|
"mean_token_accuracy": 0.1993554025888443,
|
|
"num_tokens": 43703176.0,
|
|
"step": 17245
|
|
},
|
|
{
|
|
"entropy": 6.319428777694702,
|
|
"epoch": 1.9907674552798615,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00046120670468610426,
|
|
"loss": 5.8701,
|
|
"mean_token_accuracy": 0.188443386554718,
|
|
"num_tokens": 43717439.0,
|
|
"step": 17250
|
|
},
|
|
{
|
|
"entropy": 6.282275867462158,
|
|
"epoch": 1.9913444893248702,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00046118353822767683,
|
|
"loss": 5.7261,
|
|
"mean_token_accuracy": 0.1940552920103073,
|
|
"num_tokens": 43730500.0,
|
|
"step": 17255
|
|
},
|
|
{
|
|
"entropy": 6.191128492355347,
|
|
"epoch": 1.9919215233698788,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004611603655070586,
|
|
"loss": 5.6687,
|
|
"mean_token_accuracy": 0.20141230076551436,
|
|
"num_tokens": 43744807.0,
|
|
"step": 17260
|
|
},
|
|
{
|
|
"entropy": 6.251776790618896,
|
|
"epoch": 1.9924985574148875,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00046113718652502896,
|
|
"loss": 5.7171,
|
|
"mean_token_accuracy": 0.20194613486528395,
|
|
"num_tokens": 43756748.0,
|
|
"step": 17265
|
|
},
|
|
{
|
|
"entropy": 6.261544942855835,
|
|
"epoch": 1.993075591459896,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004611140012823675,
|
|
"loss": 5.8213,
|
|
"mean_token_accuracy": 0.1938079223036766,
|
|
"num_tokens": 43769309.0,
|
|
"step": 17270
|
|
},
|
|
{
|
|
"entropy": 6.259779262542724,
|
|
"epoch": 1.9936526255049047,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046109080977985395,
|
|
"loss": 5.7859,
|
|
"mean_token_accuracy": 0.19742500483989717,
|
|
"num_tokens": 43781057.0,
|
|
"step": 17275
|
|
},
|
|
{
|
|
"entropy": 6.273036813735962,
|
|
"epoch": 1.9942296595499136,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00046106761201826854,
|
|
"loss": 5.7762,
|
|
"mean_token_accuracy": 0.1962513282895088,
|
|
"num_tokens": 43794504.0,
|
|
"step": 17280
|
|
},
|
|
{
|
|
"entropy": 6.09191312789917,
|
|
"epoch": 1.994806693594922,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00046104440799839145,
|
|
"loss": 5.5921,
|
|
"mean_token_accuracy": 0.21330432295799256,
|
|
"num_tokens": 43810214.0,
|
|
"step": 17285
|
|
},
|
|
{
|
|
"entropy": 6.263599395751953,
|
|
"epoch": 1.9953837276399309,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000461021197721003,
|
|
"loss": 5.7689,
|
|
"mean_token_accuracy": 0.19516006261110305,
|
|
"num_tokens": 43822197.0,
|
|
"step": 17290
|
|
},
|
|
{
|
|
"entropy": 6.319225835800171,
|
|
"epoch": 1.9959607616849393,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00046099798118688407,
|
|
"loss": 5.7714,
|
|
"mean_token_accuracy": 0.1970426231622696,
|
|
"num_tokens": 43835585.0,
|
|
"step": 17295
|
|
},
|
|
{
|
|
"entropy": 6.279296588897705,
|
|
"epoch": 1.9965377957299482,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004609747583968154,
|
|
"loss": 5.7179,
|
|
"mean_token_accuracy": 0.19605442583560945,
|
|
"num_tokens": 43848542.0,
|
|
"step": 17300
|
|
},
|
|
{
|
|
"entropy": 6.251367807388306,
|
|
"epoch": 1.9971148297749566,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004609515293515781,
|
|
"loss": 5.7954,
|
|
"mean_token_accuracy": 0.19522191137075423,
|
|
"num_tokens": 43860717.0,
|
|
"step": 17305
|
|
},
|
|
{
|
|
"entropy": 6.326177597045898,
|
|
"epoch": 1.9976918638199654,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004609282940519535,
|
|
"loss": 5.8277,
|
|
"mean_token_accuracy": 0.19656899571418762,
|
|
"num_tokens": 43873193.0,
|
|
"step": 17310
|
|
},
|
|
{
|
|
"entropy": 6.328842449188232,
|
|
"epoch": 1.998268897864974,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004609050524987231,
|
|
"loss": 5.8062,
|
|
"mean_token_accuracy": 0.1906093955039978,
|
|
"num_tokens": 43886241.0,
|
|
"step": 17315
|
|
},
|
|
{
|
|
"entropy": 6.262535762786865,
|
|
"epoch": 1.9988459319099827,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004608818046926686,
|
|
"loss": 5.7307,
|
|
"mean_token_accuracy": 0.2026408925652504,
|
|
"num_tokens": 43899429.0,
|
|
"step": 17320
|
|
},
|
|
{
|
|
"entropy": 6.2589469909667965,
|
|
"epoch": 1.9994229659549914,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004608585506345719,
|
|
"loss": 5.7517,
|
|
"mean_token_accuracy": 0.19680778086185455,
|
|
"num_tokens": 43913073.0,
|
|
"step": 17325
|
|
},
|
|
{
|
|
"entropy": 6.259429550170898,
|
|
"epoch": 2.0,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004608352903252152,
|
|
"loss": 5.7745,
|
|
"mean_token_accuracy": 0.19805550575256348,
|
|
"num_tokens": 43926234.0,
|
|
"step": 17330
|
|
},
|
|
{
|
|
"entropy": 6.2702301979064945,
|
|
"epoch": 2.000577034045009,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00046081202376538084,
|
|
"loss": 5.7334,
|
|
"mean_token_accuracy": 0.19711553305387497,
|
|
"num_tokens": 43937787.0,
|
|
"step": 17335
|
|
},
|
|
{
|
|
"entropy": 6.249440240859985,
|
|
"epoch": 2.0011540680900173,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004607887509558513,
|
|
"loss": 5.7267,
|
|
"mean_token_accuracy": 0.19739107191562652,
|
|
"num_tokens": 43951429.0,
|
|
"step": 17340
|
|
},
|
|
{
|
|
"entropy": 6.297765922546387,
|
|
"epoch": 2.001731102135026,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004607654718974094,
|
|
"loss": 5.7265,
|
|
"mean_token_accuracy": 0.20845312774181365,
|
|
"num_tokens": 43964257.0,
|
|
"step": 17345
|
|
},
|
|
{
|
|
"entropy": 6.3072456359863285,
|
|
"epoch": 2.0023081361800346,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004607421865908382,
|
|
"loss": 5.6704,
|
|
"mean_token_accuracy": 0.1962365910410881,
|
|
"num_tokens": 43975995.0,
|
|
"step": 17350
|
|
},
|
|
{
|
|
"entropy": 6.21532130241394,
|
|
"epoch": 2.0028851702250434,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004607188950369207,
|
|
"loss": 5.6302,
|
|
"mean_token_accuracy": 0.2015035480260849,
|
|
"num_tokens": 43989191.0,
|
|
"step": 17355
|
|
},
|
|
{
|
|
"entropy": 6.310169506072998,
|
|
"epoch": 2.003462204270052,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004606955972364405,
|
|
"loss": 5.741,
|
|
"mean_token_accuracy": 0.1927739202976227,
|
|
"num_tokens": 44000583.0,
|
|
"step": 17360
|
|
},
|
|
{
|
|
"entropy": 6.1655200004577635,
|
|
"epoch": 2.0040392383150607,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004606722931901812,
|
|
"loss": 5.5746,
|
|
"mean_token_accuracy": 0.213130159676075,
|
|
"num_tokens": 44013894.0,
|
|
"step": 17365
|
|
},
|
|
{
|
|
"entropy": 6.234589576721191,
|
|
"epoch": 2.004616272360069,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004606489828989264,
|
|
"loss": 5.6487,
|
|
"mean_token_accuracy": 0.20046643614768983,
|
|
"num_tokens": 44026701.0,
|
|
"step": 17370
|
|
},
|
|
{
|
|
"entropy": 6.233416175842285,
|
|
"epoch": 2.005193306405078,
|
|
"grad_norm": 2.890625,
|
|
"learning_rate": 0.0004606256663634604,
|
|
"loss": 5.7082,
|
|
"mean_token_accuracy": 0.2018497332930565,
|
|
"num_tokens": 44039775.0,
|
|
"step": 17375
|
|
},
|
|
{
|
|
"entropy": 6.285129690170288,
|
|
"epoch": 2.0057703404500864,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004606023435845672,
|
|
"loss": 5.7138,
|
|
"mean_token_accuracy": 0.19541945606470107,
|
|
"num_tokens": 44052352.0,
|
|
"step": 17380
|
|
},
|
|
{
|
|
"entropy": 6.250522422790527,
|
|
"epoch": 2.0063473744950953,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004605790145630314,
|
|
"loss": 5.6477,
|
|
"mean_token_accuracy": 0.20282730013132094,
|
|
"num_tokens": 44066147.0,
|
|
"step": 17385
|
|
},
|
|
{
|
|
"entropy": 6.255536270141602,
|
|
"epoch": 2.0069244085401037,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004605556792996377,
|
|
"loss": 5.6965,
|
|
"mean_token_accuracy": 0.19819739013910292,
|
|
"num_tokens": 44078692.0,
|
|
"step": 17390
|
|
},
|
|
{
|
|
"entropy": 6.340232467651367,
|
|
"epoch": 2.0075014425851125,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004605323377951709,
|
|
"loss": 5.7362,
|
|
"mean_token_accuracy": 0.19044993668794633,
|
|
"num_tokens": 44091511.0,
|
|
"step": 17395
|
|
},
|
|
{
|
|
"entropy": 6.270852994918823,
|
|
"epoch": 2.008078476630121,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000460508990050416,
|
|
"loss": 5.6915,
|
|
"mean_token_accuracy": 0.195805923640728,
|
|
"num_tokens": 44103423.0,
|
|
"step": 17400
|
|
},
|
|
{
|
|
"entropy": 6.149043035507202,
|
|
"epoch": 2.00865551067513,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004604856360661584,
|
|
"loss": 5.5513,
|
|
"mean_token_accuracy": 0.2083790898323059,
|
|
"num_tokens": 44116024.0,
|
|
"step": 17405
|
|
},
|
|
{
|
|
"entropy": 6.153539705276489,
|
|
"epoch": 2.0092325447201387,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004604622758431835,
|
|
"loss": 5.624,
|
|
"mean_token_accuracy": 0.20394142121076583,
|
|
"num_tokens": 44128595.0,
|
|
"step": 17410
|
|
},
|
|
{
|
|
"entropy": 6.3305881977081295,
|
|
"epoch": 2.009809578765147,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00046043890938227724,
|
|
"loss": 5.7351,
|
|
"mean_token_accuracy": 0.19998015761375426,
|
|
"num_tokens": 44140104.0,
|
|
"step": 17415
|
|
},
|
|
{
|
|
"entropy": 6.2825438499450685,
|
|
"epoch": 2.010386612810156,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00046041553668422526,
|
|
"loss": 5.6918,
|
|
"mean_token_accuracy": 0.2034749060869217,
|
|
"num_tokens": 44152681.0,
|
|
"step": 17420
|
|
},
|
|
{
|
|
"entropy": 6.181905794143677,
|
|
"epoch": 2.0109636468551644,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046039215774981376,
|
|
"loss": 5.665,
|
|
"mean_token_accuracy": 0.2073669031262398,
|
|
"num_tokens": 44165728.0,
|
|
"step": 17425
|
|
},
|
|
{
|
|
"entropy": 6.301576805114746,
|
|
"epoch": 2.0115406809001732,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00046036877257982917,
|
|
"loss": 5.7453,
|
|
"mean_token_accuracy": 0.19096045196056366,
|
|
"num_tokens": 44178182.0,
|
|
"step": 17430
|
|
},
|
|
{
|
|
"entropy": 6.300556945800781,
|
|
"epoch": 2.0121177149451817,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.000460345381175058,
|
|
"loss": 5.6624,
|
|
"mean_token_accuracy": 0.20269179046154023,
|
|
"num_tokens": 44190954.0,
|
|
"step": 17435
|
|
},
|
|
{
|
|
"entropy": 6.262827301025391,
|
|
"epoch": 2.0126947489901905,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.000460321983536287,
|
|
"loss": 5.6572,
|
|
"mean_token_accuracy": 0.20790137648582457,
|
|
"num_tokens": 44204123.0,
|
|
"step": 17440
|
|
},
|
|
{
|
|
"entropy": 6.1826049327850345,
|
|
"epoch": 2.013271783035199,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00046029857966430315,
|
|
"loss": 5.6442,
|
|
"mean_token_accuracy": 0.2049027442932129,
|
|
"num_tokens": 44218656.0,
|
|
"step": 17445
|
|
},
|
|
{
|
|
"entropy": 6.227021884918213,
|
|
"epoch": 2.013848817080208,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00046027516955989364,
|
|
"loss": 5.6779,
|
|
"mean_token_accuracy": 0.20515901893377303,
|
|
"num_tokens": 44231191.0,
|
|
"step": 17450
|
|
},
|
|
{
|
|
"entropy": 6.304461097717285,
|
|
"epoch": 2.014425851125216,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00046025175322384577,
|
|
"loss": 5.695,
|
|
"mean_token_accuracy": 0.2019312486052513,
|
|
"num_tokens": 44244564.0,
|
|
"step": 17455
|
|
},
|
|
{
|
|
"entropy": 6.298606538772583,
|
|
"epoch": 2.015002885170225,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00046022833065694727,
|
|
"loss": 5.7057,
|
|
"mean_token_accuracy": 0.20222496688365937,
|
|
"num_tokens": 44257545.0,
|
|
"step": 17460
|
|
},
|
|
{
|
|
"entropy": 6.224299478530884,
|
|
"epoch": 2.0155799192152335,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046020490185998575,
|
|
"loss": 5.6246,
|
|
"mean_token_accuracy": 0.20759887993335724,
|
|
"num_tokens": 44270416.0,
|
|
"step": 17465
|
|
},
|
|
{
|
|
"entropy": 6.2018883228302,
|
|
"epoch": 2.0161569532602424,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004601814668337495,
|
|
"loss": 5.6589,
|
|
"mean_token_accuracy": 0.20551549792289733,
|
|
"num_tokens": 44283366.0,
|
|
"step": 17470
|
|
},
|
|
{
|
|
"entropy": 6.226172876358032,
|
|
"epoch": 2.016733987305251,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00046015802557902654,
|
|
"loss": 5.7103,
|
|
"mean_token_accuracy": 0.19451249092817308,
|
|
"num_tokens": 44296079.0,
|
|
"step": 17475
|
|
},
|
|
{
|
|
"entropy": 6.285435914993286,
|
|
"epoch": 2.0173110213502596,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00046013457809660537,
|
|
"loss": 5.6955,
|
|
"mean_token_accuracy": 0.1941556990146637,
|
|
"num_tokens": 44308409.0,
|
|
"step": 17480
|
|
},
|
|
{
|
|
"entropy": 6.292135524749756,
|
|
"epoch": 2.0178880553952685,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00046011112438727454,
|
|
"loss": 5.7379,
|
|
"mean_token_accuracy": 0.19877717196941375,
|
|
"num_tokens": 44321826.0,
|
|
"step": 17485
|
|
},
|
|
{
|
|
"entropy": 6.256671524047851,
|
|
"epoch": 2.018465089440277,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004600876644518231,
|
|
"loss": 5.7023,
|
|
"mean_token_accuracy": 0.198341403901577,
|
|
"num_tokens": 44335630.0,
|
|
"step": 17490
|
|
},
|
|
{
|
|
"entropy": 6.040377807617188,
|
|
"epoch": 2.0190421234852858,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00046006419829104,
|
|
"loss": 5.4867,
|
|
"mean_token_accuracy": 0.2133197918534279,
|
|
"num_tokens": 44349059.0,
|
|
"step": 17495
|
|
},
|
|
{
|
|
"entropy": 6.241903305053711,
|
|
"epoch": 2.019619157530294,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004600407259057145,
|
|
"loss": 5.5888,
|
|
"mean_token_accuracy": 0.2037927582859993,
|
|
"num_tokens": 44361908.0,
|
|
"step": 17500
|
|
},
|
|
{
|
|
"entropy": 6.257413721084594,
|
|
"epoch": 2.020196191575303,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004600172472966361,
|
|
"loss": 5.7417,
|
|
"mean_token_accuracy": 0.18895848095417023,
|
|
"num_tokens": 44375487.0,
|
|
"step": 17505
|
|
},
|
|
{
|
|
"entropy": 6.220084714889526,
|
|
"epoch": 2.0207732256203115,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00045999376246459446,
|
|
"loss": 5.642,
|
|
"mean_token_accuracy": 0.20260559767484665,
|
|
"num_tokens": 44387881.0,
|
|
"step": 17510
|
|
},
|
|
{
|
|
"entropy": 6.247606992721558,
|
|
"epoch": 2.0213502596653203,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004599702714103795,
|
|
"loss": 5.6491,
|
|
"mean_token_accuracy": 0.1996355265378952,
|
|
"num_tokens": 44400609.0,
|
|
"step": 17515
|
|
},
|
|
{
|
|
"entropy": 6.159318733215332,
|
|
"epoch": 2.0219272937103288,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004599467741347814,
|
|
"loss": 5.599,
|
|
"mean_token_accuracy": 0.2111167222261429,
|
|
"num_tokens": 44413341.0,
|
|
"step": 17520
|
|
},
|
|
{
|
|
"entropy": 6.272531366348266,
|
|
"epoch": 2.0225043277553376,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004599232706385904,
|
|
"loss": 5.7392,
|
|
"mean_token_accuracy": 0.20063333660364152,
|
|
"num_tokens": 44425790.0,
|
|
"step": 17525
|
|
},
|
|
{
|
|
"entropy": 6.1971056938171385,
|
|
"epoch": 2.023081361800346,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.000459899760922597,
|
|
"loss": 5.6528,
|
|
"mean_token_accuracy": 0.20446180999279023,
|
|
"num_tokens": 44438204.0,
|
|
"step": 17530
|
|
},
|
|
{
|
|
"entropy": 6.2362587451934814,
|
|
"epoch": 2.023658395845355,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004598762449875921,
|
|
"loss": 5.6295,
|
|
"mean_token_accuracy": 0.2001257747411728,
|
|
"num_tokens": 44450717.0,
|
|
"step": 17535
|
|
},
|
|
{
|
|
"entropy": 6.257264757156372,
|
|
"epoch": 2.0242354298903633,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004598527228343665,
|
|
"loss": 5.6385,
|
|
"mean_token_accuracy": 0.20419044196605682,
|
|
"num_tokens": 44463391.0,
|
|
"step": 17540
|
|
},
|
|
{
|
|
"entropy": 6.196162414550781,
|
|
"epoch": 2.024812463935372,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004598291944637112,
|
|
"loss": 5.6029,
|
|
"mean_token_accuracy": 0.2064843252301216,
|
|
"num_tokens": 44477022.0,
|
|
"step": 17545
|
|
},
|
|
{
|
|
"entropy": 6.270995855331421,
|
|
"epoch": 2.025389497980381,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00045980565987641797,
|
|
"loss": 5.7092,
|
|
"mean_token_accuracy": 0.19913180619478227,
|
|
"num_tokens": 44490616.0,
|
|
"step": 17550
|
|
},
|
|
{
|
|
"entropy": 6.2656354904174805,
|
|
"epoch": 2.0259665320253895,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00045978211907327804,
|
|
"loss": 5.7152,
|
|
"mean_token_accuracy": 0.19898659586906434,
|
|
"num_tokens": 44503307.0,
|
|
"step": 17555
|
|
},
|
|
{
|
|
"entropy": 6.278667783737182,
|
|
"epoch": 2.0265435660703983,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004597585720550834,
|
|
"loss": 5.6925,
|
|
"mean_token_accuracy": 0.20318609178066255,
|
|
"num_tokens": 44516078.0,
|
|
"step": 17560
|
|
},
|
|
{
|
|
"entropy": 6.279894495010376,
|
|
"epoch": 2.0271206001154067,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.000459735018822626,
|
|
"loss": 5.6674,
|
|
"mean_token_accuracy": 0.20145113617181779,
|
|
"num_tokens": 44528485.0,
|
|
"step": 17565
|
|
},
|
|
{
|
|
"entropy": 6.2945067405700685,
|
|
"epoch": 2.0276976341604156,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00045971145937669794,
|
|
"loss": 5.6317,
|
|
"mean_token_accuracy": 0.20258528739213943,
|
|
"num_tokens": 44539946.0,
|
|
"step": 17570
|
|
},
|
|
{
|
|
"entropy": 6.19449815750122,
|
|
"epoch": 2.028274668205424,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004596878937180917,
|
|
"loss": 5.6912,
|
|
"mean_token_accuracy": 0.19609050452709198,
|
|
"num_tokens": 44552828.0,
|
|
"step": 17575
|
|
},
|
|
{
|
|
"entropy": 6.280514240264893,
|
|
"epoch": 2.028851702250433,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004596643218475999,
|
|
"loss": 5.7072,
|
|
"mean_token_accuracy": 0.20018178075551987,
|
|
"num_tokens": 44564930.0,
|
|
"step": 17580
|
|
},
|
|
{
|
|
"entropy": 6.261544609069825,
|
|
"epoch": 2.0294287362954413,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00045964074376601534,
|
|
"loss": 5.703,
|
|
"mean_token_accuracy": 0.19716645330190657,
|
|
"num_tokens": 44578226.0,
|
|
"step": 17585
|
|
},
|
|
{
|
|
"entropy": 6.227256774902344,
|
|
"epoch": 2.03000577034045,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00045961715947413106,
|
|
"loss": 5.6875,
|
|
"mean_token_accuracy": 0.20446657538414,
|
|
"num_tokens": 44590704.0,
|
|
"step": 17590
|
|
},
|
|
{
|
|
"entropy": 6.264931344985962,
|
|
"epoch": 2.0305828043854586,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004595935689727404,
|
|
"loss": 5.6814,
|
|
"mean_token_accuracy": 0.20432521104812623,
|
|
"num_tokens": 44602758.0,
|
|
"step": 17595
|
|
},
|
|
{
|
|
"entropy": 6.119540214538574,
|
|
"epoch": 2.0311598384304674,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004595699722626367,
|
|
"loss": 5.6584,
|
|
"mean_token_accuracy": 0.20234377831220626,
|
|
"num_tokens": 44614733.0,
|
|
"step": 17600
|
|
},
|
|
{
|
|
"entropy": 6.288922500610352,
|
|
"epoch": 2.031736872475476,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00045954636934461367,
|
|
"loss": 5.7345,
|
|
"mean_token_accuracy": 0.19667449444532395,
|
|
"num_tokens": 44628339.0,
|
|
"step": 17605
|
|
},
|
|
{
|
|
"entropy": 6.261105537414551,
|
|
"epoch": 2.0323139065204847,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004595227602194652,
|
|
"loss": 5.6611,
|
|
"mean_token_accuracy": 0.2022185817360878,
|
|
"num_tokens": 44641382.0,
|
|
"step": 17610
|
|
},
|
|
{
|
|
"entropy": 6.185283756256103,
|
|
"epoch": 2.0328909405654936,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004594991448879853,
|
|
"loss": 5.6176,
|
|
"mean_token_accuracy": 0.2082076221704483,
|
|
"num_tokens": 44654618.0,
|
|
"step": 17615
|
|
},
|
|
{
|
|
"entropy": 6.333975410461425,
|
|
"epoch": 2.033467974610502,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004594755233509683,
|
|
"loss": 5.7901,
|
|
"mean_token_accuracy": 0.18755829632282256,
|
|
"num_tokens": 44667961.0,
|
|
"step": 17620
|
|
},
|
|
{
|
|
"entropy": 6.243668031692505,
|
|
"epoch": 2.034045008655511,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00045945189560920875,
|
|
"loss": 5.6792,
|
|
"mean_token_accuracy": 0.19908062219619752,
|
|
"num_tokens": 44682185.0,
|
|
"step": 17625
|
|
},
|
|
{
|
|
"entropy": 6.279232978820801,
|
|
"epoch": 2.0346220427005193,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004594282616635013,
|
|
"loss": 5.7007,
|
|
"mean_token_accuracy": 0.20215352922677993,
|
|
"num_tokens": 44695513.0,
|
|
"step": 17630
|
|
},
|
|
{
|
|
"entropy": 6.235209274291992,
|
|
"epoch": 2.035199076745528,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004594046215146409,
|
|
"loss": 5.7065,
|
|
"mean_token_accuracy": 0.2029103457927704,
|
|
"num_tokens": 44707051.0,
|
|
"step": 17635
|
|
},
|
|
{
|
|
"entropy": 6.230711984634399,
|
|
"epoch": 2.0357761107905366,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00045938097516342257,
|
|
"loss": 5.6739,
|
|
"mean_token_accuracy": 0.2068231835961342,
|
|
"num_tokens": 44719915.0,
|
|
"step": 17640
|
|
},
|
|
{
|
|
"entropy": 6.116800594329834,
|
|
"epoch": 2.0363531448355454,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00045935732261064184,
|
|
"loss": 5.57,
|
|
"mean_token_accuracy": 0.21224127411842347,
|
|
"num_tokens": 44733115.0,
|
|
"step": 17645
|
|
},
|
|
{
|
|
"entropy": 6.2326884269714355,
|
|
"epoch": 2.036930178880554,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00045933366385709405,
|
|
"loss": 5.7019,
|
|
"mean_token_accuracy": 0.20067428946495056,
|
|
"num_tokens": 44744480.0,
|
|
"step": 17650
|
|
},
|
|
{
|
|
"entropy": 6.285044431686401,
|
|
"epoch": 2.0375072129255627,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004593099989035751,
|
|
"loss": 5.7403,
|
|
"mean_token_accuracy": 0.1993875503540039,
|
|
"num_tokens": 44758200.0,
|
|
"step": 17655
|
|
},
|
|
{
|
|
"entropy": 6.3262560844421385,
|
|
"epoch": 2.038084246970571,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004592863277508809,
|
|
"loss": 5.7758,
|
|
"mean_token_accuracy": 0.1939818263053894,
|
|
"num_tokens": 44771407.0,
|
|
"step": 17660
|
|
},
|
|
{
|
|
"entropy": 6.25794620513916,
|
|
"epoch": 2.03866128101558,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004592626503998076,
|
|
"loss": 5.6232,
|
|
"mean_token_accuracy": 0.20941001623868943,
|
|
"num_tokens": 44783765.0,
|
|
"step": 17665
|
|
},
|
|
{
|
|
"entropy": 6.296916103363037,
|
|
"epoch": 2.0392383150605884,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004592389668511515,
|
|
"loss": 5.7197,
|
|
"mean_token_accuracy": 0.20150339752435684,
|
|
"num_tokens": 44796550.0,
|
|
"step": 17670
|
|
},
|
|
{
|
|
"entropy": 6.217992353439331,
|
|
"epoch": 2.0398153491055973,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004592152771057093,
|
|
"loss": 5.7022,
|
|
"mean_token_accuracy": 0.2003367841243744,
|
|
"num_tokens": 44808802.0,
|
|
"step": 17675
|
|
},
|
|
{
|
|
"entropy": 6.215272855758667,
|
|
"epoch": 2.0403923831506057,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00045919158116427785,
|
|
"loss": 5.638,
|
|
"mean_token_accuracy": 0.20298593789339064,
|
|
"num_tokens": 44821023.0,
|
|
"step": 17680
|
|
},
|
|
{
|
|
"entropy": 6.254412078857422,
|
|
"epoch": 2.0409694171956145,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00045916787902765396,
|
|
"loss": 5.6491,
|
|
"mean_token_accuracy": 0.19988745003938674,
|
|
"num_tokens": 44833822.0,
|
|
"step": 17685
|
|
},
|
|
{
|
|
"entropy": 6.23627610206604,
|
|
"epoch": 2.0415464512406234,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004591441706966349,
|
|
"loss": 5.6825,
|
|
"mean_token_accuracy": 0.1998839184641838,
|
|
"num_tokens": 44846440.0,
|
|
"step": 17690
|
|
},
|
|
{
|
|
"entropy": 6.276790714263916,
|
|
"epoch": 2.042123485285632,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004591204561720183,
|
|
"loss": 5.6926,
|
|
"mean_token_accuracy": 0.19255058020353316,
|
|
"num_tokens": 44858257.0,
|
|
"step": 17695
|
|
},
|
|
{
|
|
"entropy": 6.261844110488892,
|
|
"epoch": 2.0427005193306407,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004590967354546015,
|
|
"loss": 5.7283,
|
|
"mean_token_accuracy": 0.1950898662209511,
|
|
"num_tokens": 44871339.0,
|
|
"step": 17700
|
|
},
|
|
{
|
|
"entropy": 6.237417697906494,
|
|
"epoch": 2.043277553375649,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004590730085451824,
|
|
"loss": 5.6583,
|
|
"mean_token_accuracy": 0.2076822802424431,
|
|
"num_tokens": 44884190.0,
|
|
"step": 17705
|
|
},
|
|
{
|
|
"entropy": 6.1819751262664795,
|
|
"epoch": 2.043854587420658,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00045904927544455914,
|
|
"loss": 5.5837,
|
|
"mean_token_accuracy": 0.20263769328594208,
|
|
"num_tokens": 44897530.0,
|
|
"step": 17710
|
|
},
|
|
{
|
|
"entropy": 6.191201496124267,
|
|
"epoch": 2.0444316214656664,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00045902553615353005,
|
|
"loss": 5.564,
|
|
"mean_token_accuracy": 0.21978026032447814,
|
|
"num_tokens": 44910428.0,
|
|
"step": 17715
|
|
},
|
|
{
|
|
"entropy": 6.256063032150268,
|
|
"epoch": 2.0450086555106752,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004590017906728933,
|
|
"loss": 5.6913,
|
|
"mean_token_accuracy": 0.19929961115121841,
|
|
"num_tokens": 44922904.0,
|
|
"step": 17720
|
|
},
|
|
{
|
|
"entropy": 6.164769124984741,
|
|
"epoch": 2.0455856895556837,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045897803900344774,
|
|
"loss": 5.5864,
|
|
"mean_token_accuracy": 0.20878782421350478,
|
|
"num_tokens": 44935541.0,
|
|
"step": 17725
|
|
},
|
|
{
|
|
"entropy": 6.212556028366089,
|
|
"epoch": 2.0461627236006925,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004589542811459923,
|
|
"loss": 5.6593,
|
|
"mean_token_accuracy": 0.2079017162322998,
|
|
"num_tokens": 44948483.0,
|
|
"step": 17730
|
|
},
|
|
{
|
|
"entropy": 6.228823947906494,
|
|
"epoch": 2.046739757645701,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004589305171013259,
|
|
"loss": 5.6415,
|
|
"mean_token_accuracy": 0.2076267421245575,
|
|
"num_tokens": 44961797.0,
|
|
"step": 17735
|
|
},
|
|
{
|
|
"entropy": 6.2405421257019045,
|
|
"epoch": 2.04731679169071,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000458906746870248,
|
|
"loss": 5.6364,
|
|
"mean_token_accuracy": 0.20770105421543122,
|
|
"num_tokens": 44975426.0,
|
|
"step": 17740
|
|
},
|
|
{
|
|
"entropy": 6.236284351348877,
|
|
"epoch": 2.047893825735718,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.000458882970453558,
|
|
"loss": 5.6621,
|
|
"mean_token_accuracy": 0.20310534834861754,
|
|
"num_tokens": 44988272.0,
|
|
"step": 17745
|
|
},
|
|
{
|
|
"entropy": 6.204120826721192,
|
|
"epoch": 2.048470859780727,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004588591878520556,
|
|
"loss": 5.6221,
|
|
"mean_token_accuracy": 0.2064763769507408,
|
|
"num_tokens": 45000609.0,
|
|
"step": 17750
|
|
},
|
|
{
|
|
"entropy": 6.364516687393189,
|
|
"epoch": 2.049047893825736,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004588353990665407,
|
|
"loss": 5.7849,
|
|
"mean_token_accuracy": 0.1859120637178421,
|
|
"num_tokens": 45012651.0,
|
|
"step": 17755
|
|
},
|
|
{
|
|
"entropy": 6.253702116012573,
|
|
"epoch": 2.0496249278707444,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004588116040978136,
|
|
"loss": 5.727,
|
|
"mean_token_accuracy": 0.20087929517030717,
|
|
"num_tokens": 45025237.0,
|
|
"step": 17760
|
|
},
|
|
{
|
|
"entropy": 6.250041151046753,
|
|
"epoch": 2.050201961915753,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00045878780294667437,
|
|
"loss": 5.7408,
|
|
"mean_token_accuracy": 0.1949314743280411,
|
|
"num_tokens": 45038329.0,
|
|
"step": 17765
|
|
},
|
|
{
|
|
"entropy": 6.277400636672974,
|
|
"epoch": 2.0507789959607616,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004587639956139237,
|
|
"loss": 5.6204,
|
|
"mean_token_accuracy": 0.2077370211482048,
|
|
"num_tokens": 45050251.0,
|
|
"step": 17770
|
|
},
|
|
{
|
|
"entropy": 6.254482460021973,
|
|
"epoch": 2.0513560300057705,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004587401821003624,
|
|
"loss": 5.7033,
|
|
"mean_token_accuracy": 0.1997854605317116,
|
|
"num_tokens": 45062701.0,
|
|
"step": 17775
|
|
},
|
|
{
|
|
"entropy": 6.180520868301391,
|
|
"epoch": 2.051933064050779,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00045871636240679133,
|
|
"loss": 5.6361,
|
|
"mean_token_accuracy": 0.21148186773061753,
|
|
"num_tokens": 45077059.0,
|
|
"step": 17780
|
|
},
|
|
{
|
|
"entropy": 6.262282276153565,
|
|
"epoch": 2.0525100980957878,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004586925365340117,
|
|
"loss": 5.6733,
|
|
"mean_token_accuracy": 0.1936696618795395,
|
|
"num_tokens": 45089571.0,
|
|
"step": 17785
|
|
},
|
|
{
|
|
"entropy": 6.203660869598389,
|
|
"epoch": 2.053087132140796,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004586687044828247,
|
|
"loss": 5.6444,
|
|
"mean_token_accuracy": 0.20130022913217543,
|
|
"num_tokens": 45101085.0,
|
|
"step": 17790
|
|
},
|
|
{
|
|
"entropy": 6.230860996246338,
|
|
"epoch": 2.053664166185805,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004586448662540322,
|
|
"loss": 5.7041,
|
|
"mean_token_accuracy": 0.19646845906972885,
|
|
"num_tokens": 45113844.0,
|
|
"step": 17795
|
|
},
|
|
{
|
|
"entropy": 6.234907388687134,
|
|
"epoch": 2.0542412002308135,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004586210218484358,
|
|
"loss": 5.7351,
|
|
"mean_token_accuracy": 0.19803052842617036,
|
|
"num_tokens": 45126297.0,
|
|
"step": 17800
|
|
},
|
|
{
|
|
"entropy": 6.268433570861816,
|
|
"epoch": 2.0548182342758223,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00045859717126683745,
|
|
"loss": 5.5848,
|
|
"mean_token_accuracy": 0.2124189928174019,
|
|
"num_tokens": 45139337.0,
|
|
"step": 17805
|
|
},
|
|
{
|
|
"entropy": 6.254764461517334,
|
|
"epoch": 2.0553952683208307,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00045857331451003953,
|
|
"loss": 5.7644,
|
|
"mean_token_accuracy": 0.18940299451351167,
|
|
"num_tokens": 45151698.0,
|
|
"step": 17810
|
|
},
|
|
{
|
|
"entropy": 6.168803453445435,
|
|
"epoch": 2.0559723023658396,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00045854945157884435,
|
|
"loss": 5.6336,
|
|
"mean_token_accuracy": 0.20379126965999603,
|
|
"num_tokens": 45164615.0,
|
|
"step": 17815
|
|
},
|
|
{
|
|
"entropy": 6.227227401733399,
|
|
"epoch": 2.056549336410848,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00045852558247405455,
|
|
"loss": 5.6802,
|
|
"mean_token_accuracy": 0.2069242015480995,
|
|
"num_tokens": 45176630.0,
|
|
"step": 17820
|
|
},
|
|
{
|
|
"entropy": 6.247831106185913,
|
|
"epoch": 2.057126370455857,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00045850170719647287,
|
|
"loss": 5.6404,
|
|
"mean_token_accuracy": 0.20814504474401474,
|
|
"num_tokens": 45188879.0,
|
|
"step": 17825
|
|
},
|
|
{
|
|
"entropy": 6.256878614425659,
|
|
"epoch": 2.0577034045008658,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00045847782574690254,
|
|
"loss": 5.6535,
|
|
"mean_token_accuracy": 0.20146367996931075,
|
|
"num_tokens": 45201694.0,
|
|
"step": 17830
|
|
},
|
|
{
|
|
"entropy": 6.211376094818116,
|
|
"epoch": 2.058280438545874,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00045845393812614664,
|
|
"loss": 5.6302,
|
|
"mean_token_accuracy": 0.19902247041463852,
|
|
"num_tokens": 45215873.0,
|
|
"step": 17835
|
|
},
|
|
{
|
|
"entropy": 6.303824377059937,
|
|
"epoch": 2.058857472590883,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004584300443350086,
|
|
"loss": 5.6714,
|
|
"mean_token_accuracy": 0.20408975183963776,
|
|
"num_tokens": 45229660.0,
|
|
"step": 17840
|
|
},
|
|
{
|
|
"entropy": 6.2332484245300295,
|
|
"epoch": 2.0594345066358914,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004584061443742922,
|
|
"loss": 5.6223,
|
|
"mean_token_accuracy": 0.19964006692171096,
|
|
"num_tokens": 45243257.0,
|
|
"step": 17845
|
|
},
|
|
{
|
|
"entropy": 6.192412042617798,
|
|
"epoch": 2.0600115406809003,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00045838223824480124,
|
|
"loss": 5.6241,
|
|
"mean_token_accuracy": 0.20478377789258956,
|
|
"num_tokens": 45256212.0,
|
|
"step": 17850
|
|
},
|
|
{
|
|
"entropy": 6.274218940734864,
|
|
"epoch": 2.0605885747259087,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004583583259473397,
|
|
"loss": 5.6856,
|
|
"mean_token_accuracy": 0.2076691582798958,
|
|
"num_tokens": 45268292.0,
|
|
"step": 17855
|
|
},
|
|
{
|
|
"entropy": 6.105169582366943,
|
|
"epoch": 2.0611656087709176,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00045833440748271203,
|
|
"loss": 5.5239,
|
|
"mean_token_accuracy": 0.22912171930074693,
|
|
"num_tokens": 45284112.0,
|
|
"step": 17860
|
|
},
|
|
{
|
|
"entropy": 6.246973180770874,
|
|
"epoch": 2.061742642815926,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00045831048285172266,
|
|
"loss": 5.6515,
|
|
"mean_token_accuracy": 0.20367234200239182,
|
|
"num_tokens": 45295839.0,
|
|
"step": 17865
|
|
},
|
|
{
|
|
"entropy": 6.171870565414428,
|
|
"epoch": 2.062319676860935,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004582865520551762,
|
|
"loss": 5.6701,
|
|
"mean_token_accuracy": 0.19572561234235764,
|
|
"num_tokens": 45309142.0,
|
|
"step": 17870
|
|
},
|
|
{
|
|
"entropy": 6.244421911239624,
|
|
"epoch": 2.0628967109059433,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00045826261509387755,
|
|
"loss": 5.6564,
|
|
"mean_token_accuracy": 0.21014538258314133,
|
|
"num_tokens": 45322096.0,
|
|
"step": 17875
|
|
},
|
|
{
|
|
"entropy": 6.287837028503418,
|
|
"epoch": 2.063473744950952,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00045823867196863197,
|
|
"loss": 5.7293,
|
|
"mean_token_accuracy": 0.20398633629083635,
|
|
"num_tokens": 45333685.0,
|
|
"step": 17880
|
|
},
|
|
{
|
|
"entropy": 6.210242366790771,
|
|
"epoch": 2.0640507789959606,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004582147226802446,
|
|
"loss": 5.6763,
|
|
"mean_token_accuracy": 0.20469199120998383,
|
|
"num_tokens": 45345417.0,
|
|
"step": 17885
|
|
},
|
|
{
|
|
"entropy": 6.220725202560425,
|
|
"epoch": 2.0646278130409694,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004581907672295211,
|
|
"loss": 5.7159,
|
|
"mean_token_accuracy": 0.19976982325315476,
|
|
"num_tokens": 45357156.0,
|
|
"step": 17890
|
|
},
|
|
{
|
|
"entropy": 6.291027307510376,
|
|
"epoch": 2.065204847085978,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00045816680561726716,
|
|
"loss": 5.6847,
|
|
"mean_token_accuracy": 0.1986474186182022,
|
|
"num_tokens": 45369627.0,
|
|
"step": 17895
|
|
},
|
|
{
|
|
"entropy": 6.234702730178833,
|
|
"epoch": 2.0657818811309867,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004581428378442886,
|
|
"loss": 5.6624,
|
|
"mean_token_accuracy": 0.19629377871751785,
|
|
"num_tokens": 45380603.0,
|
|
"step": 17900
|
|
},
|
|
{
|
|
"entropy": 6.188916254043579,
|
|
"epoch": 2.0663589151759956,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00045811886391139173,
|
|
"loss": 5.6211,
|
|
"mean_token_accuracy": 0.21858908087015153,
|
|
"num_tokens": 45394923.0,
|
|
"step": 17905
|
|
},
|
|
{
|
|
"entropy": 6.277084445953369,
|
|
"epoch": 2.066935949221004,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00045809488381938284,
|
|
"loss": 5.6794,
|
|
"mean_token_accuracy": 0.19687334448099136,
|
|
"num_tokens": 45407351.0,
|
|
"step": 17910
|
|
},
|
|
{
|
|
"entropy": 6.161598968505859,
|
|
"epoch": 2.067512983266013,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004580708975690684,
|
|
"loss": 5.6493,
|
|
"mean_token_accuracy": 0.20021425932645798,
|
|
"num_tokens": 45420783.0,
|
|
"step": 17915
|
|
},
|
|
{
|
|
"entropy": 6.197072887420655,
|
|
"epoch": 2.0680900173110213,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004580469051612554,
|
|
"loss": 5.5548,
|
|
"mean_token_accuracy": 0.2188750311732292,
|
|
"num_tokens": 45433208.0,
|
|
"step": 17920
|
|
},
|
|
{
|
|
"entropy": 6.294715929031372,
|
|
"epoch": 2.06866705135603,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00045802290659675057,
|
|
"loss": 5.8009,
|
|
"mean_token_accuracy": 0.18830355405807495,
|
|
"num_tokens": 45445872.0,
|
|
"step": 17925
|
|
},
|
|
{
|
|
"entropy": 6.255209302902221,
|
|
"epoch": 2.0692440854010385,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00045799890187636123,
|
|
"loss": 5.6859,
|
|
"mean_token_accuracy": 0.20325401276350022,
|
|
"num_tokens": 45458844.0,
|
|
"step": 17930
|
|
},
|
|
{
|
|
"entropy": 6.223239803314209,
|
|
"epoch": 2.0698211194460474,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00045797489100089464,
|
|
"loss": 5.6922,
|
|
"mean_token_accuracy": 0.2008743941783905,
|
|
"num_tokens": 45471919.0,
|
|
"step": 17935
|
|
},
|
|
{
|
|
"entropy": 6.23684606552124,
|
|
"epoch": 2.070398153491056,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004579508739711585,
|
|
"loss": 5.6973,
|
|
"mean_token_accuracy": 0.20341706275939941,
|
|
"num_tokens": 45483769.0,
|
|
"step": 17940
|
|
},
|
|
{
|
|
"entropy": 6.298162937164307,
|
|
"epoch": 2.0709751875360647,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00045792685078796075,
|
|
"loss": 5.7812,
|
|
"mean_token_accuracy": 0.19754380136728286,
|
|
"num_tokens": 45497077.0,
|
|
"step": 17945
|
|
},
|
|
{
|
|
"entropy": 6.258854103088379,
|
|
"epoch": 2.071552221581073,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000457902821452109,
|
|
"loss": 5.7308,
|
|
"mean_token_accuracy": 0.20346533358097077,
|
|
"num_tokens": 45509229.0,
|
|
"step": 17950
|
|
},
|
|
{
|
|
"entropy": 6.259493160247803,
|
|
"epoch": 2.072129255626082,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00045787878596441193,
|
|
"loss": 5.6678,
|
|
"mean_token_accuracy": 0.20220885127782823,
|
|
"num_tokens": 45521654.0,
|
|
"step": 17955
|
|
},
|
|
{
|
|
"entropy": 6.260926580429077,
|
|
"epoch": 2.0727062896710904,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004578547443256776,
|
|
"loss": 5.7121,
|
|
"mean_token_accuracy": 0.19537041634321212,
|
|
"num_tokens": 45533488.0,
|
|
"step": 17960
|
|
},
|
|
{
|
|
"entropy": 6.268562984466553,
|
|
"epoch": 2.0732833237160992,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004578306965367148,
|
|
"loss": 5.6245,
|
|
"mean_token_accuracy": 0.20668937861919404,
|
|
"num_tokens": 45544938.0,
|
|
"step": 17965
|
|
},
|
|
{
|
|
"entropy": 6.247487020492554,
|
|
"epoch": 2.073860357761108,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00045780664259833235,
|
|
"loss": 5.6844,
|
|
"mean_token_accuracy": 0.20103041976690292,
|
|
"num_tokens": 45557085.0,
|
|
"step": 17970
|
|
},
|
|
{
|
|
"entropy": 6.240365791320801,
|
|
"epoch": 2.0744373918061165,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00045778258251133924,
|
|
"loss": 5.6562,
|
|
"mean_token_accuracy": 0.20293182879686356,
|
|
"num_tokens": 45570174.0,
|
|
"step": 17975
|
|
},
|
|
{
|
|
"entropy": 6.269809722900391,
|
|
"epoch": 2.0750144258511254,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00045775851627654474,
|
|
"loss": 5.6711,
|
|
"mean_token_accuracy": 0.20361365973949433,
|
|
"num_tokens": 45582174.0,
|
|
"step": 17980
|
|
},
|
|
{
|
|
"entropy": 6.240131282806397,
|
|
"epoch": 2.075591459896134,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004577344438947584,
|
|
"loss": 5.7361,
|
|
"mean_token_accuracy": 0.19098032414913177,
|
|
"num_tokens": 45595732.0,
|
|
"step": 17985
|
|
},
|
|
{
|
|
"entropy": 6.214056825637817,
|
|
"epoch": 2.0761684939411427,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00045771036536678984,
|
|
"loss": 5.6625,
|
|
"mean_token_accuracy": 0.20121949464082717,
|
|
"num_tokens": 45609675.0,
|
|
"step": 17990
|
|
},
|
|
{
|
|
"entropy": 6.315131139755249,
|
|
"epoch": 2.076745527986151,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00045768628069344885,
|
|
"loss": 5.7055,
|
|
"mean_token_accuracy": 0.19686917960643768,
|
|
"num_tokens": 45622467.0,
|
|
"step": 17995
|
|
},
|
|
{
|
|
"entropy": 6.263897705078125,
|
|
"epoch": 2.07732256203116,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004576621898755455,
|
|
"loss": 5.739,
|
|
"mean_token_accuracy": 0.19382344782352448,
|
|
"num_tokens": 45636246.0,
|
|
"step": 18000
|
|
},
|
|
{
|
|
"epoch": 2.07732256203116,
|
|
"eval_entropy": 6.069619185822167,
|
|
"eval_loss": 5.804035663604736,
|
|
"eval_mean_token_accuracy": 0.20375993807384635,
|
|
"eval_num_tokens": 45636246.0,
|
|
"eval_runtime": 17.5172,
|
|
"eval_samples_per_second": 1606.191,
|
|
"eval_steps_per_second": 200.774,
|
|
"step": 18000
|
|
},
|
|
{
|
|
"entropy": 6.246134519577026,
|
|
"epoch": 2.0778995960761684,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00045763809291389024,
|
|
"loss": 5.6481,
|
|
"mean_token_accuracy": 0.20348013937473297,
|
|
"num_tokens": 45649127.0,
|
|
"step": 18005
|
|
},
|
|
{
|
|
"entropy": 6.264445734024048,
|
|
"epoch": 2.0784766301211772,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004576139898092933,
|
|
"loss": 5.6794,
|
|
"mean_token_accuracy": 0.19997181594371796,
|
|
"num_tokens": 45661633.0,
|
|
"step": 18010
|
|
},
|
|
{
|
|
"entropy": 6.222084331512451,
|
|
"epoch": 2.0790536641661856,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004575898805625657,
|
|
"loss": 5.6185,
|
|
"mean_token_accuracy": 0.20518322587013244,
|
|
"num_tokens": 45673643.0,
|
|
"step": 18015
|
|
},
|
|
{
|
|
"entropy": 6.335010671615601,
|
|
"epoch": 2.0796306982111945,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00045756576517451804,
|
|
"loss": 5.7725,
|
|
"mean_token_accuracy": 0.19150546044111252,
|
|
"num_tokens": 45686125.0,
|
|
"step": 18020
|
|
},
|
|
{
|
|
"entropy": 6.257683420181275,
|
|
"epoch": 2.080207732256203,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00045754164364596156,
|
|
"loss": 5.6225,
|
|
"mean_token_accuracy": 0.20368454307317735,
|
|
"num_tokens": 45697919.0,
|
|
"step": 18025
|
|
},
|
|
{
|
|
"entropy": 6.219502353668213,
|
|
"epoch": 2.080784766301212,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004575175159777076,
|
|
"loss": 5.7023,
|
|
"mean_token_accuracy": 0.19955314546823502,
|
|
"num_tokens": 45709450.0,
|
|
"step": 18030
|
|
},
|
|
{
|
|
"entropy": 6.245679044723511,
|
|
"epoch": 2.0813618003462206,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004574933821705676,
|
|
"loss": 5.6477,
|
|
"mean_token_accuracy": 0.20409499555826188,
|
|
"num_tokens": 45721464.0,
|
|
"step": 18035
|
|
},
|
|
{
|
|
"entropy": 6.304778718948365,
|
|
"epoch": 2.081938834391229,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004574692422253534,
|
|
"loss": 5.7526,
|
|
"mean_token_accuracy": 0.19708194881677626,
|
|
"num_tokens": 45733397.0,
|
|
"step": 18040
|
|
},
|
|
{
|
|
"entropy": 6.216876220703125,
|
|
"epoch": 2.082515868436238,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00045744509614287687,
|
|
"loss": 5.7058,
|
|
"mean_token_accuracy": 0.19746667742729188,
|
|
"num_tokens": 45744953.0,
|
|
"step": 18045
|
|
},
|
|
{
|
|
"entropy": 6.250694465637207,
|
|
"epoch": 2.0830929024812463,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004574209439239501,
|
|
"loss": 5.6636,
|
|
"mean_token_accuracy": 0.20134249180555344,
|
|
"num_tokens": 45756914.0,
|
|
"step": 18050
|
|
},
|
|
{
|
|
"entropy": 6.23657341003418,
|
|
"epoch": 2.083669936526255,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00045739678556938563,
|
|
"loss": 5.6809,
|
|
"mean_token_accuracy": 0.21226089149713517,
|
|
"num_tokens": 45770888.0,
|
|
"step": 18055
|
|
},
|
|
{
|
|
"entropy": 6.235244607925415,
|
|
"epoch": 2.0842469705712636,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045737262107999575,
|
|
"loss": 5.6767,
|
|
"mean_token_accuracy": 0.2019466146826744,
|
|
"num_tokens": 45783551.0,
|
|
"step": 18060
|
|
},
|
|
{
|
|
"entropy": 6.26384391784668,
|
|
"epoch": 2.0848240046162725,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004573484504565934,
|
|
"loss": 5.6601,
|
|
"mean_token_accuracy": 0.20924518406391143,
|
|
"num_tokens": 45795700.0,
|
|
"step": 18065
|
|
},
|
|
{
|
|
"entropy": 6.19308066368103,
|
|
"epoch": 2.085401038661281,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004573242736999915,
|
|
"loss": 5.6641,
|
|
"mean_token_accuracy": 0.20257942378520966,
|
|
"num_tokens": 45808414.0,
|
|
"step": 18070
|
|
},
|
|
{
|
|
"entropy": 6.195266485214233,
|
|
"epoch": 2.0859780727062898,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00045730009081100314,
|
|
"loss": 5.614,
|
|
"mean_token_accuracy": 0.2057153984904289,
|
|
"num_tokens": 45821710.0,
|
|
"step": 18075
|
|
},
|
|
{
|
|
"entropy": 6.121374559402466,
|
|
"epoch": 2.086555106751298,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00045727590179044195,
|
|
"loss": 5.6034,
|
|
"mean_token_accuracy": 0.20624669641256332,
|
|
"num_tokens": 45835812.0,
|
|
"step": 18080
|
|
},
|
|
{
|
|
"entropy": 6.274444627761841,
|
|
"epoch": 2.087132140796307,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004572517066391211,
|
|
"loss": 5.6767,
|
|
"mean_token_accuracy": 0.20413774400949478,
|
|
"num_tokens": 45849076.0,
|
|
"step": 18085
|
|
},
|
|
{
|
|
"entropy": 6.242035007476806,
|
|
"epoch": 2.0877091748413155,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00045722750535785484,
|
|
"loss": 5.6815,
|
|
"mean_token_accuracy": 0.20116450935602187,
|
|
"num_tokens": 45861375.0,
|
|
"step": 18090
|
|
},
|
|
{
|
|
"entropy": 6.2057653903961185,
|
|
"epoch": 2.0882862088863243,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00045720329794745685,
|
|
"loss": 5.6527,
|
|
"mean_token_accuracy": 0.2060537040233612,
|
|
"num_tokens": 45872096.0,
|
|
"step": 18095
|
|
},
|
|
{
|
|
"entropy": 6.1792665958404545,
|
|
"epoch": 2.0888632429313327,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004571790844087415,
|
|
"loss": 5.5907,
|
|
"mean_token_accuracy": 0.21414544433355331,
|
|
"num_tokens": 45884843.0,
|
|
"step": 18100
|
|
},
|
|
{
|
|
"entropy": 6.267030906677246,
|
|
"epoch": 2.0894402769763416,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004571548647425231,
|
|
"loss": 5.6587,
|
|
"mean_token_accuracy": 0.19904158115386963,
|
|
"num_tokens": 45896644.0,
|
|
"step": 18105
|
|
},
|
|
{
|
|
"entropy": 6.324420690536499,
|
|
"epoch": 2.0900173110213505,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004571306389496164,
|
|
"loss": 5.7546,
|
|
"mean_token_accuracy": 0.19744710773229598,
|
|
"num_tokens": 45910204.0,
|
|
"step": 18110
|
|
},
|
|
{
|
|
"entropy": 6.239924144744873,
|
|
"epoch": 2.090594345066359,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00045710640703083594,
|
|
"loss": 5.6235,
|
|
"mean_token_accuracy": 0.20362144559621811,
|
|
"num_tokens": 45923332.0,
|
|
"step": 18115
|
|
},
|
|
{
|
|
"entropy": 6.175708246231079,
|
|
"epoch": 2.0911713791113677,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00045708216898699707,
|
|
"loss": 5.669,
|
|
"mean_token_accuracy": 0.21027057766914367,
|
|
"num_tokens": 45937322.0,
|
|
"step": 18120
|
|
},
|
|
{
|
|
"entropy": 6.245549440383911,
|
|
"epoch": 2.091748413156376,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00045705792481891483,
|
|
"loss": 5.661,
|
|
"mean_token_accuracy": 0.19952643513679505,
|
|
"num_tokens": 45950369.0,
|
|
"step": 18125
|
|
},
|
|
{
|
|
"entropy": 6.313686466217041,
|
|
"epoch": 2.092325447201385,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00045703367452740477,
|
|
"loss": 5.8022,
|
|
"mean_token_accuracy": 0.19890412092208862,
|
|
"num_tokens": 45963402.0,
|
|
"step": 18130
|
|
},
|
|
{
|
|
"entropy": 6.282650661468506,
|
|
"epoch": 2.0929024812463934,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00045700941811328247,
|
|
"loss": 5.7317,
|
|
"mean_token_accuracy": 0.1945398658514023,
|
|
"num_tokens": 45976979.0,
|
|
"step": 18135
|
|
},
|
|
{
|
|
"entropy": 6.272404193878174,
|
|
"epoch": 2.0934795152914023,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00045698515557736374,
|
|
"loss": 5.7198,
|
|
"mean_token_accuracy": 0.19928032010793686,
|
|
"num_tokens": 45990334.0,
|
|
"step": 18140
|
|
},
|
|
{
|
|
"entropy": 6.185986185073853,
|
|
"epoch": 2.0940565493364107,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00045696088692046477,
|
|
"loss": 5.6245,
|
|
"mean_token_accuracy": 0.20934058129787445,
|
|
"num_tokens": 46002322.0,
|
|
"step": 18145
|
|
},
|
|
{
|
|
"entropy": 6.240342664718628,
|
|
"epoch": 2.0946335833814196,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00045693661214340174,
|
|
"loss": 5.722,
|
|
"mean_token_accuracy": 0.19595017284154892,
|
|
"num_tokens": 46014136.0,
|
|
"step": 18150
|
|
},
|
|
{
|
|
"entropy": 6.332130861282349,
|
|
"epoch": 2.095210617426428,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00045691233124699117,
|
|
"loss": 5.7533,
|
|
"mean_token_accuracy": 0.19440668374300002,
|
|
"num_tokens": 46026686.0,
|
|
"step": 18155
|
|
},
|
|
{
|
|
"entropy": 6.238727474212647,
|
|
"epoch": 2.095787651471437,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004568880442320497,
|
|
"loss": 5.6499,
|
|
"mean_token_accuracy": 0.2080206796526909,
|
|
"num_tokens": 46038462.0,
|
|
"step": 18160
|
|
},
|
|
{
|
|
"entropy": 6.305221891403198,
|
|
"epoch": 2.0963646855164453,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045686375109939417,
|
|
"loss": 5.7261,
|
|
"mean_token_accuracy": 0.19346963614225388,
|
|
"num_tokens": 46051549.0,
|
|
"step": 18165
|
|
},
|
|
{
|
|
"entropy": 6.252967166900635,
|
|
"epoch": 2.096941719561454,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004568394518498417,
|
|
"loss": 5.693,
|
|
"mean_token_accuracy": 0.20137814581394195,
|
|
"num_tokens": 46065282.0,
|
|
"step": 18170
|
|
},
|
|
{
|
|
"entropy": 6.2782073497772215,
|
|
"epoch": 2.0975187536064626,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045681514648420965,
|
|
"loss": 5.7062,
|
|
"mean_token_accuracy": 0.19837625026702882,
|
|
"num_tokens": 46077238.0,
|
|
"step": 18175
|
|
},
|
|
{
|
|
"entropy": 6.325450277328491,
|
|
"epoch": 2.0980957876514714,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004567908350033154,
|
|
"loss": 5.6915,
|
|
"mean_token_accuracy": 0.2042577013373375,
|
|
"num_tokens": 46089044.0,
|
|
"step": 18180
|
|
},
|
|
{
|
|
"entropy": 6.248745012283325,
|
|
"epoch": 2.0986728216964803,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004567665174079767,
|
|
"loss": 5.7329,
|
|
"mean_token_accuracy": 0.20117929577827454,
|
|
"num_tokens": 46101246.0,
|
|
"step": 18185
|
|
},
|
|
{
|
|
"entropy": 6.282928800582885,
|
|
"epoch": 2.0992498557414887,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00045674219369901153,
|
|
"loss": 5.7487,
|
|
"mean_token_accuracy": 0.19632016271352767,
|
|
"num_tokens": 46112735.0,
|
|
"step": 18190
|
|
},
|
|
{
|
|
"entropy": 6.255322742462158,
|
|
"epoch": 2.0998268897864976,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004567178638772379,
|
|
"loss": 5.802,
|
|
"mean_token_accuracy": 0.19112858474254607,
|
|
"num_tokens": 46125547.0,
|
|
"step": 18195
|
|
},
|
|
{
|
|
"entropy": 6.31384596824646,
|
|
"epoch": 2.100403923831506,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004566935279434742,
|
|
"loss": 5.7593,
|
|
"mean_token_accuracy": 0.19314925372600555,
|
|
"num_tokens": 46137356.0,
|
|
"step": 18200
|
|
},
|
|
{
|
|
"entropy": 6.22183141708374,
|
|
"epoch": 2.100980957876515,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00045666918589853895,
|
|
"loss": 5.6608,
|
|
"mean_token_accuracy": 0.20413845479488374,
|
|
"num_tokens": 46149935.0,
|
|
"step": 18205
|
|
},
|
|
{
|
|
"entropy": 6.188861894607544,
|
|
"epoch": 2.1015579919215233,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00045664483774325094,
|
|
"loss": 5.5989,
|
|
"mean_token_accuracy": 0.2077876254916191,
|
|
"num_tokens": 46162186.0,
|
|
"step": 18210
|
|
},
|
|
{
|
|
"entropy": 6.222089576721191,
|
|
"epoch": 2.102135025966532,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004566204834784289,
|
|
"loss": 5.6059,
|
|
"mean_token_accuracy": 0.20326893627643586,
|
|
"num_tokens": 46175221.0,
|
|
"step": 18215
|
|
},
|
|
{
|
|
"entropy": 6.195293712615967,
|
|
"epoch": 2.1027120600115405,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00045659612310489225,
|
|
"loss": 5.762,
|
|
"mean_token_accuracy": 0.19867088049650192,
|
|
"num_tokens": 46187898.0,
|
|
"step": 18220
|
|
},
|
|
{
|
|
"entropy": 6.246435070037842,
|
|
"epoch": 2.1032890940565494,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00045657175662346014,
|
|
"loss": 5.665,
|
|
"mean_token_accuracy": 0.20157117545604705,
|
|
"num_tokens": 46200792.0,
|
|
"step": 18225
|
|
},
|
|
{
|
|
"entropy": 6.260198020935059,
|
|
"epoch": 2.103866128101558,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004565473840349522,
|
|
"loss": 5.6957,
|
|
"mean_token_accuracy": 0.19887917637825012,
|
|
"num_tokens": 46213791.0,
|
|
"step": 18230
|
|
},
|
|
{
|
|
"entropy": 6.264036750793457,
|
|
"epoch": 2.1044431621465667,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00045652300534018816,
|
|
"loss": 5.6782,
|
|
"mean_token_accuracy": 0.2033469021320343,
|
|
"num_tokens": 46226229.0,
|
|
"step": 18235
|
|
},
|
|
{
|
|
"entropy": 6.277313184738159,
|
|
"epoch": 2.105020196191575,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.000456498620539988,
|
|
"loss": 5.6742,
|
|
"mean_token_accuracy": 0.20586120039224626,
|
|
"num_tokens": 46239253.0,
|
|
"step": 18240
|
|
},
|
|
{
|
|
"entropy": 6.210960912704468,
|
|
"epoch": 2.105597230236584,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004564742296351719,
|
|
"loss": 5.7082,
|
|
"mean_token_accuracy": 0.20025913417339325,
|
|
"num_tokens": 46251578.0,
|
|
"step": 18245
|
|
},
|
|
{
|
|
"entropy": 6.309379816055298,
|
|
"epoch": 2.106174264281593,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00045644983262656014,
|
|
"loss": 5.7046,
|
|
"mean_token_accuracy": 0.20009643882513045,
|
|
"num_tokens": 46265421.0,
|
|
"step": 18250
|
|
},
|
|
{
|
|
"entropy": 6.279318809509277,
|
|
"epoch": 2.1067512983266012,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004564254295149735,
|
|
"loss": 5.7543,
|
|
"mean_token_accuracy": 0.19517963677644729,
|
|
"num_tokens": 46277480.0,
|
|
"step": 18255
|
|
},
|
|
{
|
|
"entropy": 6.281505012512207,
|
|
"epoch": 2.10732833237161,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00045640102030123264,
|
|
"loss": 5.7272,
|
|
"mean_token_accuracy": 0.1994670122861862,
|
|
"num_tokens": 46289793.0,
|
|
"step": 18260
|
|
},
|
|
{
|
|
"entropy": 6.272510528564453,
|
|
"epoch": 2.1079053664166185,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00045637660498615865,
|
|
"loss": 5.6853,
|
|
"mean_token_accuracy": 0.20521128475666045,
|
|
"num_tokens": 46301653.0,
|
|
"step": 18265
|
|
},
|
|
{
|
|
"entropy": 6.129175043106079,
|
|
"epoch": 2.1084824004616274,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004563521835705725,
|
|
"loss": 5.578,
|
|
"mean_token_accuracy": 0.21452680677175523,
|
|
"num_tokens": 46314368.0,
|
|
"step": 18270
|
|
},
|
|
{
|
|
"entropy": 6.310157346725464,
|
|
"epoch": 2.109059434506636,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00045632775605529587,
|
|
"loss": 5.7247,
|
|
"mean_token_accuracy": 0.19462078511714936,
|
|
"num_tokens": 46327446.0,
|
|
"step": 18275
|
|
},
|
|
{
|
|
"entropy": 6.319844436645508,
|
|
"epoch": 2.1096364685516447,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004563033224411501,
|
|
"loss": 5.728,
|
|
"mean_token_accuracy": 0.1939805880188942,
|
|
"num_tokens": 46340370.0,
|
|
"step": 18280
|
|
},
|
|
{
|
|
"entropy": 6.22706356048584,
|
|
"epoch": 2.110213502596653,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004562788827289572,
|
|
"loss": 5.7025,
|
|
"mean_token_accuracy": 0.20296211242675782,
|
|
"num_tokens": 46352675.0,
|
|
"step": 18285
|
|
},
|
|
{
|
|
"entropy": 6.148489570617675,
|
|
"epoch": 2.110790536641662,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00045625443691953914,
|
|
"loss": 5.5886,
|
|
"mean_token_accuracy": 0.20904678702354432,
|
|
"num_tokens": 46365404.0,
|
|
"step": 18290
|
|
},
|
|
{
|
|
"entropy": 6.284792232513428,
|
|
"epoch": 2.1113675706866704,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004562299850137181,
|
|
"loss": 5.652,
|
|
"mean_token_accuracy": 0.20398799926042557,
|
|
"num_tokens": 46377544.0,
|
|
"step": 18295
|
|
},
|
|
{
|
|
"entropy": 6.247260618209839,
|
|
"epoch": 2.111944604731679,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004562055270123166,
|
|
"loss": 5.7487,
|
|
"mean_token_accuracy": 0.2020320326089859,
|
|
"num_tokens": 46390425.0,
|
|
"step": 18300
|
|
},
|
|
{
|
|
"entropy": 6.210721588134765,
|
|
"epoch": 2.1125216387766876,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00045618106291615715,
|
|
"loss": 5.6716,
|
|
"mean_token_accuracy": 0.2000151827931404,
|
|
"num_tokens": 46403359.0,
|
|
"step": 18305
|
|
},
|
|
{
|
|
"entropy": 6.296349716186524,
|
|
"epoch": 2.1130986728216965,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004561565927260627,
|
|
"loss": 5.7571,
|
|
"mean_token_accuracy": 0.2024470806121826,
|
|
"num_tokens": 46414700.0,
|
|
"step": 18310
|
|
},
|
|
{
|
|
"entropy": 6.317724514007568,
|
|
"epoch": 2.1136757068667054,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004561321164428561,
|
|
"loss": 5.7405,
|
|
"mean_token_accuracy": 0.19626646637916564,
|
|
"num_tokens": 46427199.0,
|
|
"step": 18315
|
|
},
|
|
{
|
|
"entropy": 6.291296052932739,
|
|
"epoch": 2.114252740911714,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004561076340673609,
|
|
"loss": 5.6788,
|
|
"mean_token_accuracy": 0.2070443406701088,
|
|
"num_tokens": 46440143.0,
|
|
"step": 18320
|
|
},
|
|
{
|
|
"entropy": 6.296773862838745,
|
|
"epoch": 2.1148297749567226,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004560831456004003,
|
|
"loss": 5.6809,
|
|
"mean_token_accuracy": 0.19323974549770356,
|
|
"num_tokens": 46452868.0,
|
|
"step": 18325
|
|
},
|
|
{
|
|
"entropy": 6.2290812015533445,
|
|
"epoch": 2.115406809001731,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004560586510427981,
|
|
"loss": 5.5906,
|
|
"mean_token_accuracy": 0.21004874557256697,
|
|
"num_tokens": 46465648.0,
|
|
"step": 18330
|
|
},
|
|
{
|
|
"entropy": 6.190475177764893,
|
|
"epoch": 2.11598384304674,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004560341503953781,
|
|
"loss": 5.7048,
|
|
"mean_token_accuracy": 0.20484923124313353,
|
|
"num_tokens": 46478282.0,
|
|
"step": 18335
|
|
},
|
|
{
|
|
"entropy": 6.218627786636352,
|
|
"epoch": 2.1165608770917483,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004560096436589643,
|
|
"loss": 5.6113,
|
|
"mean_token_accuracy": 0.2062837600708008,
|
|
"num_tokens": 46490299.0,
|
|
"step": 18340
|
|
},
|
|
{
|
|
"entropy": 6.244489526748657,
|
|
"epoch": 2.117137911136757,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00045598513083438115,
|
|
"loss": 5.6169,
|
|
"mean_token_accuracy": 0.21169881969690324,
|
|
"num_tokens": 46502165.0,
|
|
"step": 18345
|
|
},
|
|
{
|
|
"entropy": 6.214208650588989,
|
|
"epoch": 2.1177149451817656,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00045596061192245297,
|
|
"loss": 5.7166,
|
|
"mean_token_accuracy": 0.20201748758554458,
|
|
"num_tokens": 46514954.0,
|
|
"step": 18350
|
|
},
|
|
{
|
|
"entropy": 6.290360975265503,
|
|
"epoch": 2.1182919792267745,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004559360869240045,
|
|
"loss": 5.7851,
|
|
"mean_token_accuracy": 0.18993605077266693,
|
|
"num_tokens": 46527088.0,
|
|
"step": 18355
|
|
},
|
|
{
|
|
"entropy": 6.313471698760987,
|
|
"epoch": 2.118869013271783,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004559115558398606,
|
|
"loss": 5.7399,
|
|
"mean_token_accuracy": 0.19302885234355927,
|
|
"num_tokens": 46538737.0,
|
|
"step": 18360
|
|
},
|
|
{
|
|
"entropy": 6.245953607559204,
|
|
"epoch": 2.1194460473167918,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004558870186708465,
|
|
"loss": 5.652,
|
|
"mean_token_accuracy": 0.20305613279342652,
|
|
"num_tokens": 46551963.0,
|
|
"step": 18365
|
|
},
|
|
{
|
|
"entropy": 6.245628738403321,
|
|
"epoch": 2.1200230813618,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00045586247541778724,
|
|
"loss": 5.7255,
|
|
"mean_token_accuracy": 0.20636988282203675,
|
|
"num_tokens": 46564247.0,
|
|
"step": 18370
|
|
},
|
|
{
|
|
"entropy": 6.240551710128784,
|
|
"epoch": 2.120600115406809,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004558379260815085,
|
|
"loss": 5.6995,
|
|
"mean_token_accuracy": 0.20225383788347245,
|
|
"num_tokens": 46578491.0,
|
|
"step": 18375
|
|
},
|
|
{
|
|
"entropy": 6.269914007186889,
|
|
"epoch": 2.1211771494518175,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004558133706628359,
|
|
"loss": 5.6906,
|
|
"mean_token_accuracy": 0.20203321278095246,
|
|
"num_tokens": 46591528.0,
|
|
"step": 18380
|
|
},
|
|
{
|
|
"entropy": 6.32675838470459,
|
|
"epoch": 2.1217541834968263,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00045578880916259554,
|
|
"loss": 5.771,
|
|
"mean_token_accuracy": 0.193904410302639,
|
|
"num_tokens": 46605028.0,
|
|
"step": 18385
|
|
},
|
|
{
|
|
"entropy": 6.199621963500976,
|
|
"epoch": 2.122331217541835,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004557642415816132,
|
|
"loss": 5.6377,
|
|
"mean_token_accuracy": 0.2080541417002678,
|
|
"num_tokens": 46617713.0,
|
|
"step": 18390
|
|
},
|
|
{
|
|
"entropy": 6.285545921325683,
|
|
"epoch": 2.1229082515868436,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004557396679207155,
|
|
"loss": 5.7865,
|
|
"mean_token_accuracy": 0.19203791320323943,
|
|
"num_tokens": 46631897.0,
|
|
"step": 18395
|
|
},
|
|
{
|
|
"entropy": 6.303127717971802,
|
|
"epoch": 2.1234852856318525,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00045571508818072887,
|
|
"loss": 5.7481,
|
|
"mean_token_accuracy": 0.19187881350517272,
|
|
"num_tokens": 46645457.0,
|
|
"step": 18400
|
|
},
|
|
{
|
|
"entropy": 6.339938688278198,
|
|
"epoch": 2.124062319676861,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004556905023624799,
|
|
"loss": 5.7318,
|
|
"mean_token_accuracy": 0.19835630059242249,
|
|
"num_tokens": 46657779.0,
|
|
"step": 18405
|
|
},
|
|
{
|
|
"entropy": 6.2173059463500975,
|
|
"epoch": 2.1246393537218697,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00045566591046679577,
|
|
"loss": 5.6775,
|
|
"mean_token_accuracy": 0.2003285899758339,
|
|
"num_tokens": 46670590.0,
|
|
"step": 18410
|
|
},
|
|
{
|
|
"entropy": 6.223220014572144,
|
|
"epoch": 2.125216387766878,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.00045564131249450343,
|
|
"loss": 5.6518,
|
|
"mean_token_accuracy": 0.20317054986953736,
|
|
"num_tokens": 46683369.0,
|
|
"step": 18415
|
|
},
|
|
{
|
|
"entropy": 6.314276504516601,
|
|
"epoch": 2.125793421811887,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004556167084464302,
|
|
"loss": 5.6898,
|
|
"mean_token_accuracy": 0.19398971945047377,
|
|
"num_tokens": 46695371.0,
|
|
"step": 18420
|
|
},
|
|
{
|
|
"entropy": 6.185404968261719,
|
|
"epoch": 2.1263704558568954,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004555920983234038,
|
|
"loss": 5.6048,
|
|
"mean_token_accuracy": 0.20488648414611815,
|
|
"num_tokens": 46708422.0,
|
|
"step": 18425
|
|
},
|
|
{
|
|
"entropy": 6.131176233291626,
|
|
"epoch": 2.1269474899019043,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00045556748212625183,
|
|
"loss": 5.5992,
|
|
"mean_token_accuracy": 0.21085411310195923,
|
|
"num_tokens": 46722236.0,
|
|
"step": 18430
|
|
},
|
|
{
|
|
"entropy": 6.335385847091675,
|
|
"epoch": 2.1275245239469127,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004555428598558023,
|
|
"loss": 5.6881,
|
|
"mean_token_accuracy": 0.2015898957848549,
|
|
"num_tokens": 46733084.0,
|
|
"step": 18435
|
|
},
|
|
{
|
|
"entropy": 6.235428047180176,
|
|
"epoch": 2.1281015579919216,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004555182315128833,
|
|
"loss": 5.6943,
|
|
"mean_token_accuracy": 0.19690838754177092,
|
|
"num_tokens": 46745174.0,
|
|
"step": 18440
|
|
},
|
|
{
|
|
"entropy": 6.291813564300537,
|
|
"epoch": 2.12867859203693,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004554935970983234,
|
|
"loss": 5.7371,
|
|
"mean_token_accuracy": 0.20212126523256302,
|
|
"num_tokens": 46758134.0,
|
|
"step": 18445
|
|
},
|
|
{
|
|
"entropy": 6.26134991645813,
|
|
"epoch": 2.129255626081939,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004554689566129509,
|
|
"loss": 5.6282,
|
|
"mean_token_accuracy": 0.20178801715373992,
|
|
"num_tokens": 46770941.0,
|
|
"step": 18450
|
|
},
|
|
{
|
|
"entropy": 6.253507900238037,
|
|
"epoch": 2.1298326601269473,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00045544431005759467,
|
|
"loss": 5.7037,
|
|
"mean_token_accuracy": 0.20702736973762512,
|
|
"num_tokens": 46782532.0,
|
|
"step": 18455
|
|
},
|
|
{
|
|
"entropy": 6.190967559814453,
|
|
"epoch": 2.130409694171956,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00045541965743308376,
|
|
"loss": 5.6673,
|
|
"mean_token_accuracy": 0.20353056937456132,
|
|
"num_tokens": 46794636.0,
|
|
"step": 18460
|
|
},
|
|
{
|
|
"entropy": 6.23766188621521,
|
|
"epoch": 2.130986728216965,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004553949987402473,
|
|
"loss": 5.7034,
|
|
"mean_token_accuracy": 0.1964999184012413,
|
|
"num_tokens": 46807797.0,
|
|
"step": 18465
|
|
},
|
|
{
|
|
"entropy": 6.3087376117706295,
|
|
"epoch": 2.1315637622619734,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004553703339799146,
|
|
"loss": 5.6631,
|
|
"mean_token_accuracy": 0.1988433212041855,
|
|
"num_tokens": 46819838.0,
|
|
"step": 18470
|
|
},
|
|
{
|
|
"entropy": 6.15626368522644,
|
|
"epoch": 2.1321407963069823,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004553456631529154,
|
|
"loss": 5.6281,
|
|
"mean_token_accuracy": 0.20693209618330002,
|
|
"num_tokens": 46832172.0,
|
|
"step": 18475
|
|
},
|
|
{
|
|
"entropy": 6.262816905975342,
|
|
"epoch": 2.1327178303519907,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004553209862600794,
|
|
"loss": 5.7047,
|
|
"mean_token_accuracy": 0.20258551687002183,
|
|
"num_tokens": 46844457.0,
|
|
"step": 18480
|
|
},
|
|
{
|
|
"entropy": 6.217689561843872,
|
|
"epoch": 2.1332948643969996,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004552963033022365,
|
|
"loss": 5.6269,
|
|
"mean_token_accuracy": 0.20258189141750335,
|
|
"num_tokens": 46857256.0,
|
|
"step": 18485
|
|
},
|
|
{
|
|
"entropy": 6.245373678207398,
|
|
"epoch": 2.133871898442008,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00045527161428021706,
|
|
"loss": 5.6878,
|
|
"mean_token_accuracy": 0.2011040687561035,
|
|
"num_tokens": 46870971.0,
|
|
"step": 18490
|
|
},
|
|
{
|
|
"entropy": 6.261890983581543,
|
|
"epoch": 2.134448932487017,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004552469191948514,
|
|
"loss": 5.6446,
|
|
"mean_token_accuracy": 0.20959553867578506,
|
|
"num_tokens": 46882911.0,
|
|
"step": 18495
|
|
},
|
|
{
|
|
"entropy": 6.253646564483643,
|
|
"epoch": 2.1350259665320253,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004552222180469702,
|
|
"loss": 5.693,
|
|
"mean_token_accuracy": 0.20216709077358247,
|
|
"num_tokens": 46895927.0,
|
|
"step": 18500
|
|
},
|
|
{
|
|
"entropy": 6.187870836257934,
|
|
"epoch": 2.135603000577034,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00045519751083740413,
|
|
"loss": 5.6568,
|
|
"mean_token_accuracy": 0.20425989031791686,
|
|
"num_tokens": 46908210.0,
|
|
"step": 18505
|
|
},
|
|
{
|
|
"entropy": 6.299504232406616,
|
|
"epoch": 2.1361800346220425,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00045517279756698435,
|
|
"loss": 5.7277,
|
|
"mean_token_accuracy": 0.1984967589378357,
|
|
"num_tokens": 46920197.0,
|
|
"step": 18510
|
|
},
|
|
{
|
|
"entropy": 6.272176742553711,
|
|
"epoch": 2.1367570686670514,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00045514807823654203,
|
|
"loss": 5.6717,
|
|
"mean_token_accuracy": 0.2022643879055977,
|
|
"num_tokens": 46932628.0,
|
|
"step": 18515
|
|
},
|
|
{
|
|
"entropy": 6.2229221820831295,
|
|
"epoch": 2.13733410271206,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004551233528469086,
|
|
"loss": 5.6484,
|
|
"mean_token_accuracy": 0.20244522541761398,
|
|
"num_tokens": 46945479.0,
|
|
"step": 18520
|
|
},
|
|
{
|
|
"entropy": 6.249539518356324,
|
|
"epoch": 2.1379111367570687,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00045509862139891553,
|
|
"loss": 5.6598,
|
|
"mean_token_accuracy": 0.20135302245616912,
|
|
"num_tokens": 46958178.0,
|
|
"step": 18525
|
|
},
|
|
{
|
|
"entropy": 6.303174018859863,
|
|
"epoch": 2.138488170802077,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00045507388389339496,
|
|
"loss": 5.7638,
|
|
"mean_token_accuracy": 0.19554962664842607,
|
|
"num_tokens": 46972959.0,
|
|
"step": 18530
|
|
},
|
|
{
|
|
"entropy": 6.301294231414795,
|
|
"epoch": 2.139065204847086,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00045504914033117866,
|
|
"loss": 5.731,
|
|
"mean_token_accuracy": 0.2034759998321533,
|
|
"num_tokens": 46985506.0,
|
|
"step": 18535
|
|
},
|
|
{
|
|
"entropy": 6.185574340820312,
|
|
"epoch": 2.139642238892095,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00045502439071309897,
|
|
"loss": 5.6738,
|
|
"mean_token_accuracy": 0.2004707098007202,
|
|
"num_tokens": 46997928.0,
|
|
"step": 18540
|
|
},
|
|
{
|
|
"entropy": 6.144084739685058,
|
|
"epoch": 2.1402192729371032,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00045499963503998835,
|
|
"loss": 5.5515,
|
|
"mean_token_accuracy": 0.21737504452466966,
|
|
"num_tokens": 47010097.0,
|
|
"step": 18545
|
|
},
|
|
{
|
|
"entropy": 6.288726758956909,
|
|
"epoch": 2.140796306982112,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004549748733126794,
|
|
"loss": 5.7374,
|
|
"mean_token_accuracy": 0.1894450679421425,
|
|
"num_tokens": 47021230.0,
|
|
"step": 18550
|
|
},
|
|
{
|
|
"entropy": 6.350382137298584,
|
|
"epoch": 2.1413733410271205,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.000454950105532005,
|
|
"loss": 5.7337,
|
|
"mean_token_accuracy": 0.20369782149791718,
|
|
"num_tokens": 47034433.0,
|
|
"step": 18555
|
|
},
|
|
{
|
|
"entropy": 6.285674619674682,
|
|
"epoch": 2.1419503750721294,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045492533169879816,
|
|
"loss": 5.6853,
|
|
"mean_token_accuracy": 0.2005313515663147,
|
|
"num_tokens": 47046824.0,
|
|
"step": 18560
|
|
},
|
|
{
|
|
"entropy": 6.15918869972229,
|
|
"epoch": 2.142527409117138,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00045490055181389216,
|
|
"loss": 5.6169,
|
|
"mean_token_accuracy": 0.21414333134889602,
|
|
"num_tokens": 47058868.0,
|
|
"step": 18565
|
|
},
|
|
{
|
|
"entropy": 6.236881732940674,
|
|
"epoch": 2.1431044431621467,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00045487576587812046,
|
|
"loss": 5.7218,
|
|
"mean_token_accuracy": 0.1932273432612419,
|
|
"num_tokens": 47070898.0,
|
|
"step": 18570
|
|
},
|
|
{
|
|
"entropy": 6.288231134414673,
|
|
"epoch": 2.143681477207155,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00045485097389231675,
|
|
"loss": 5.7072,
|
|
"mean_token_accuracy": 0.20229474306106568,
|
|
"num_tokens": 47083739.0,
|
|
"step": 18575
|
|
},
|
|
{
|
|
"entropy": 6.256460046768188,
|
|
"epoch": 2.144258511252164,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004548261758573149,
|
|
"loss": 5.6604,
|
|
"mean_token_accuracy": 0.19764898717403412,
|
|
"num_tokens": 47095595.0,
|
|
"step": 18580
|
|
},
|
|
{
|
|
"entropy": 6.3134369373321535,
|
|
"epoch": 2.1448355452971724,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004548013717739489,
|
|
"loss": 5.7906,
|
|
"mean_token_accuracy": 0.1963936612010002,
|
|
"num_tokens": 47108326.0,
|
|
"step": 18585
|
|
},
|
|
{
|
|
"entropy": 6.267605018615723,
|
|
"epoch": 2.145412579342181,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004547765616430531,
|
|
"loss": 5.6946,
|
|
"mean_token_accuracy": 0.2020091712474823,
|
|
"num_tokens": 47120494.0,
|
|
"step": 18590
|
|
},
|
|
{
|
|
"entropy": 6.253426933288575,
|
|
"epoch": 2.14598961338719,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004547517454654619,
|
|
"loss": 5.7123,
|
|
"mean_token_accuracy": 0.19711664468050002,
|
|
"num_tokens": 47133116.0,
|
|
"step": 18595
|
|
},
|
|
{
|
|
"entropy": 6.2377996921539305,
|
|
"epoch": 2.1465666474321985,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00045472692324201005,
|
|
"loss": 5.6745,
|
|
"mean_token_accuracy": 0.20328953266143798,
|
|
"num_tokens": 47145208.0,
|
|
"step": 18600
|
|
},
|
|
{
|
|
"entropy": 6.2594903945922855,
|
|
"epoch": 2.1471436814772074,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00045470209497353243,
|
|
"loss": 5.6525,
|
|
"mean_token_accuracy": 0.20197178572416305,
|
|
"num_tokens": 47159217.0,
|
|
"step": 18605
|
|
},
|
|
{
|
|
"entropy": 6.259916639328003,
|
|
"epoch": 2.1477207155222158,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004546772606608641,
|
|
"loss": 5.7191,
|
|
"mean_token_accuracy": 0.19843529015779496,
|
|
"num_tokens": 47171781.0,
|
|
"step": 18610
|
|
},
|
|
{
|
|
"entropy": 6.272399759292602,
|
|
"epoch": 2.1482977495672246,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004546524203048404,
|
|
"loss": 5.7301,
|
|
"mean_token_accuracy": 0.20068282037973403,
|
|
"num_tokens": 47184045.0,
|
|
"step": 18615
|
|
},
|
|
{
|
|
"entropy": 6.256565856933594,
|
|
"epoch": 2.148874783612233,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004546275739062967,
|
|
"loss": 5.6422,
|
|
"mean_token_accuracy": 0.20642626881599427,
|
|
"num_tokens": 47195511.0,
|
|
"step": 18620
|
|
},
|
|
{
|
|
"entropy": 6.235472393035889,
|
|
"epoch": 2.149451817657242,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004546027214660688,
|
|
"loss": 5.6918,
|
|
"mean_token_accuracy": 0.2010675698518753,
|
|
"num_tokens": 47206977.0,
|
|
"step": 18625
|
|
},
|
|
{
|
|
"entropy": 6.2369743347167965,
|
|
"epoch": 2.1500288517022503,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004545778629849926,
|
|
"loss": 5.6698,
|
|
"mean_token_accuracy": 0.19845179915428163,
|
|
"num_tokens": 47218748.0,
|
|
"step": 18630
|
|
},
|
|
{
|
|
"entropy": 6.347124624252319,
|
|
"epoch": 2.150605885747259,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004545529984639042,
|
|
"loss": 5.7865,
|
|
"mean_token_accuracy": 0.1867247551679611,
|
|
"num_tokens": 47230651.0,
|
|
"step": 18635
|
|
},
|
|
{
|
|
"entropy": 6.214054298400879,
|
|
"epoch": 2.1511829197922676,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004545281279036398,
|
|
"loss": 5.6591,
|
|
"mean_token_accuracy": 0.2055197224020958,
|
|
"num_tokens": 47242959.0,
|
|
"step": 18640
|
|
},
|
|
{
|
|
"entropy": 6.25451807975769,
|
|
"epoch": 2.1517599538372765,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004545032513050361,
|
|
"loss": 5.6808,
|
|
"mean_token_accuracy": 0.19695733934640886,
|
|
"num_tokens": 47255113.0,
|
|
"step": 18645
|
|
},
|
|
{
|
|
"entropy": 6.290202808380127,
|
|
"epoch": 2.152336987882285,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004544783686689296,
|
|
"loss": 5.7893,
|
|
"mean_token_accuracy": 0.19497634023427962,
|
|
"num_tokens": 47266873.0,
|
|
"step": 18650
|
|
},
|
|
{
|
|
"entropy": 6.329517269134522,
|
|
"epoch": 2.1529140219272938,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00045445347999615736,
|
|
"loss": 5.7372,
|
|
"mean_token_accuracy": 0.20065853744745255,
|
|
"num_tokens": 47278685.0,
|
|
"step": 18655
|
|
},
|
|
{
|
|
"entropy": 6.251347064971924,
|
|
"epoch": 2.153491055972302,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00045442858528755653,
|
|
"loss": 5.7136,
|
|
"mean_token_accuracy": 0.20842838436365127,
|
|
"num_tokens": 47291553.0,
|
|
"step": 18660
|
|
},
|
|
{
|
|
"entropy": 6.250447130203247,
|
|
"epoch": 2.154068090017311,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00045440368454396435,
|
|
"loss": 5.6378,
|
|
"mean_token_accuracy": 0.20666613578796386,
|
|
"num_tokens": 47303890.0,
|
|
"step": 18665
|
|
},
|
|
{
|
|
"entropy": 6.201526117324829,
|
|
"epoch": 2.15464512406232,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004543787777662183,
|
|
"loss": 5.6181,
|
|
"mean_token_accuracy": 0.21246950477361679,
|
|
"num_tokens": 47316990.0,
|
|
"step": 18670
|
|
},
|
|
{
|
|
"entropy": 6.260347652435303,
|
|
"epoch": 2.1552221581073283,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00045435386495515617,
|
|
"loss": 5.7288,
|
|
"mean_token_accuracy": 0.2012850522994995,
|
|
"num_tokens": 47330568.0,
|
|
"step": 18675
|
|
},
|
|
{
|
|
"entropy": 6.274090385437011,
|
|
"epoch": 2.155799192152337,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004543289461116159,
|
|
"loss": 5.6548,
|
|
"mean_token_accuracy": 0.20304317623376847,
|
|
"num_tokens": 47343563.0,
|
|
"step": 18680
|
|
},
|
|
{
|
|
"entropy": 6.274822044372558,
|
|
"epoch": 2.1563762261973456,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004543040212364356,
|
|
"loss": 5.7077,
|
|
"mean_token_accuracy": 0.19780379682779312,
|
|
"num_tokens": 47356272.0,
|
|
"step": 18685
|
|
},
|
|
{
|
|
"entropy": 6.162377452850341,
|
|
"epoch": 2.1569532602423545,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004542790903304536,
|
|
"loss": 5.6503,
|
|
"mean_token_accuracy": 0.20433313250541688,
|
|
"num_tokens": 47370244.0,
|
|
"step": 18690
|
|
},
|
|
{
|
|
"entropy": 6.270251655578614,
|
|
"epoch": 2.157530294287363,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004542541533945085,
|
|
"loss": 5.6845,
|
|
"mean_token_accuracy": 0.20407705754041672,
|
|
"num_tokens": 47383120.0,
|
|
"step": 18695
|
|
},
|
|
{
|
|
"entropy": 6.325912189483643,
|
|
"epoch": 2.1581073283323717,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00045422921042943885,
|
|
"loss": 5.7731,
|
|
"mean_token_accuracy": 0.19510978758335112,
|
|
"num_tokens": 47397274.0,
|
|
"step": 18700
|
|
},
|
|
{
|
|
"entropy": 6.282104444503784,
|
|
"epoch": 2.15868436237738,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.000454204261436084,
|
|
"loss": 5.6718,
|
|
"mean_token_accuracy": 0.19389674961566924,
|
|
"num_tokens": 47409611.0,
|
|
"step": 18705
|
|
},
|
|
{
|
|
"entropy": 6.2637886047363285,
|
|
"epoch": 2.159261396422389,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00045417930641528255,
|
|
"loss": 5.6857,
|
|
"mean_token_accuracy": 0.19976329952478408,
|
|
"num_tokens": 47421435.0,
|
|
"step": 18710
|
|
},
|
|
{
|
|
"entropy": 6.322576427459717,
|
|
"epoch": 2.1598384304673974,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00045415434536787424,
|
|
"loss": 5.7587,
|
|
"mean_token_accuracy": 0.19851334244012833,
|
|
"num_tokens": 47434749.0,
|
|
"step": 18715
|
|
},
|
|
{
|
|
"entropy": 6.275216150283813,
|
|
"epoch": 2.1604154645124063,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004541293782946985,
|
|
"loss": 5.7258,
|
|
"mean_token_accuracy": 0.19765596836805344,
|
|
"num_tokens": 47446477.0,
|
|
"step": 18720
|
|
},
|
|
{
|
|
"entropy": 6.1962462902069095,
|
|
"epoch": 2.1609924985574147,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004541044051965952,
|
|
"loss": 5.5981,
|
|
"mean_token_accuracy": 0.2038559779524803,
|
|
"num_tokens": 47459547.0,
|
|
"step": 18725
|
|
},
|
|
{
|
|
"entropy": 6.297658157348633,
|
|
"epoch": 2.1615695326024236,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004540794260744041,
|
|
"loss": 5.751,
|
|
"mean_token_accuracy": 0.19317446351051332,
|
|
"num_tokens": 47472294.0,
|
|
"step": 18730
|
|
},
|
|
{
|
|
"entropy": 6.24362964630127,
|
|
"epoch": 2.162146566647432,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004540544409289655,
|
|
"loss": 5.6429,
|
|
"mean_token_accuracy": 0.20526028126478196,
|
|
"num_tokens": 47484240.0,
|
|
"step": 18735
|
|
},
|
|
{
|
|
"entropy": 6.266336107254029,
|
|
"epoch": 2.162723600692441,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004540294497611197,
|
|
"loss": 5.7104,
|
|
"mean_token_accuracy": 0.20812188535928727,
|
|
"num_tokens": 47498179.0,
|
|
"step": 18740
|
|
},
|
|
{
|
|
"entropy": 6.240371036529541,
|
|
"epoch": 2.1633006347374497,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00045400445257170725,
|
|
"loss": 5.6758,
|
|
"mean_token_accuracy": 0.2001010537147522,
|
|
"num_tokens": 47511354.0,
|
|
"step": 18745
|
|
},
|
|
{
|
|
"entropy": 6.279890441894532,
|
|
"epoch": 2.163877668782458,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004539794493615689,
|
|
"loss": 5.7464,
|
|
"mean_token_accuracy": 0.20213051587343217,
|
|
"num_tokens": 47523589.0,
|
|
"step": 18750
|
|
},
|
|
{
|
|
"entropy": 6.195033931732178,
|
|
"epoch": 2.164454702827467,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004539544401315458,
|
|
"loss": 5.6927,
|
|
"mean_token_accuracy": 0.20695994198322296,
|
|
"num_tokens": 47536784.0,
|
|
"step": 18755
|
|
},
|
|
{
|
|
"entropy": 6.260665416717529,
|
|
"epoch": 2.1650317368724754,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000453929424882479,
|
|
"loss": 5.633,
|
|
"mean_token_accuracy": 0.20660437643527985,
|
|
"num_tokens": 47550560.0,
|
|
"step": 18760
|
|
},
|
|
{
|
|
"entropy": 6.246667957305908,
|
|
"epoch": 2.1656087709174843,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045390440361520987,
|
|
"loss": 5.5635,
|
|
"mean_token_accuracy": 0.22506728023290634,
|
|
"num_tokens": 47564069.0,
|
|
"step": 18765
|
|
},
|
|
{
|
|
"entropy": 6.2478800296783445,
|
|
"epoch": 2.1661858049624927,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004538793763305799,
|
|
"loss": 5.6714,
|
|
"mean_token_accuracy": 0.19922966212034227,
|
|
"num_tokens": 47577570.0,
|
|
"step": 18770
|
|
},
|
|
{
|
|
"entropy": 6.254863834381103,
|
|
"epoch": 2.1667628390075016,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00045385434302943104,
|
|
"loss": 5.7292,
|
|
"mean_token_accuracy": 0.2031453251838684,
|
|
"num_tokens": 47590199.0,
|
|
"step": 18775
|
|
},
|
|
{
|
|
"entropy": 6.285591554641724,
|
|
"epoch": 2.16733987305251,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004538293037126052,
|
|
"loss": 5.6744,
|
|
"mean_token_accuracy": 0.20117084085941314,
|
|
"num_tokens": 47601697.0,
|
|
"step": 18780
|
|
},
|
|
{
|
|
"entropy": 6.296120595932007,
|
|
"epoch": 2.167916907097519,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00045380425838094444,
|
|
"loss": 5.7184,
|
|
"mean_token_accuracy": 0.19993578642606735,
|
|
"num_tokens": 47615331.0,
|
|
"step": 18785
|
|
},
|
|
{
|
|
"entropy": 6.217986249923706,
|
|
"epoch": 2.1684939411425272,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00045377920703529133,
|
|
"loss": 5.6688,
|
|
"mean_token_accuracy": 0.20416014790534973,
|
|
"num_tokens": 47628455.0,
|
|
"step": 18790
|
|
},
|
|
{
|
|
"entropy": 6.236662530899048,
|
|
"epoch": 2.169070975187536,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004537541496764885,
|
|
"loss": 5.632,
|
|
"mean_token_accuracy": 0.20659274458885193,
|
|
"num_tokens": 47642078.0,
|
|
"step": 18795
|
|
},
|
|
{
|
|
"entropy": 6.258144998550415,
|
|
"epoch": 2.1696480092325445,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004537290863053786,
|
|
"loss": 5.6747,
|
|
"mean_token_accuracy": 0.2031049832701683,
|
|
"num_tokens": 47653672.0,
|
|
"step": 18800
|
|
},
|
|
{
|
|
"entropy": 6.120979070663452,
|
|
"epoch": 2.1702250432775534,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00045370401692280455,
|
|
"loss": 5.5686,
|
|
"mean_token_accuracy": 0.20843469351530075,
|
|
"num_tokens": 47666085.0,
|
|
"step": 18805
|
|
},
|
|
{
|
|
"entropy": 6.304890823364258,
|
|
"epoch": 2.170802077322562,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00045367894152960976,
|
|
"loss": 5.7797,
|
|
"mean_token_accuracy": 0.19347210079431534,
|
|
"num_tokens": 47678180.0,
|
|
"step": 18810
|
|
},
|
|
{
|
|
"entropy": 6.284006977081299,
|
|
"epoch": 2.1713791113675707,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00045365386012663744,
|
|
"loss": 5.7109,
|
|
"mean_token_accuracy": 0.19503520876169206,
|
|
"num_tokens": 47690631.0,
|
|
"step": 18815
|
|
},
|
|
{
|
|
"entropy": 6.259499502182007,
|
|
"epoch": 2.1719561454125795,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00045362877271473137,
|
|
"loss": 5.6326,
|
|
"mean_token_accuracy": 0.20334458649158477,
|
|
"num_tokens": 47702577.0,
|
|
"step": 18820
|
|
},
|
|
{
|
|
"entropy": 6.2635283946990965,
|
|
"epoch": 2.172533179457588,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00045360367929473517,
|
|
"loss": 5.6859,
|
|
"mean_token_accuracy": 0.20750661194324493,
|
|
"num_tokens": 47714683.0,
|
|
"step": 18825
|
|
},
|
|
{
|
|
"entropy": 6.2828991413116455,
|
|
"epoch": 2.173110213502597,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.000453578579867493,
|
|
"loss": 5.6273,
|
|
"mean_token_accuracy": 0.20380921959877013,
|
|
"num_tokens": 47726202.0,
|
|
"step": 18830
|
|
},
|
|
{
|
|
"entropy": 6.223279047012329,
|
|
"epoch": 2.1736872475476052,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00045355347443384896,
|
|
"loss": 5.6476,
|
|
"mean_token_accuracy": 0.20528243482112885,
|
|
"num_tokens": 47740178.0,
|
|
"step": 18835
|
|
},
|
|
{
|
|
"entropy": 6.244608068466187,
|
|
"epoch": 2.174264281592614,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00045352836299464755,
|
|
"loss": 5.6788,
|
|
"mean_token_accuracy": 0.20205701440572738,
|
|
"num_tokens": 47752710.0,
|
|
"step": 18840
|
|
},
|
|
{
|
|
"entropy": 6.250746059417724,
|
|
"epoch": 2.1748413156376225,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004535032455507333,
|
|
"loss": 5.6218,
|
|
"mean_token_accuracy": 0.2027655079960823,
|
|
"num_tokens": 47765292.0,
|
|
"step": 18845
|
|
},
|
|
{
|
|
"entropy": 6.254888486862183,
|
|
"epoch": 2.1754183496826314,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00045347812210295107,
|
|
"loss": 5.6778,
|
|
"mean_token_accuracy": 0.19805543571710588,
|
|
"num_tokens": 47777799.0,
|
|
"step": 18850
|
|
},
|
|
{
|
|
"entropy": 6.272021627426147,
|
|
"epoch": 2.17599538372764,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00045345299265214583,
|
|
"loss": 5.6492,
|
|
"mean_token_accuracy": 0.20628771483898162,
|
|
"num_tokens": 47790705.0,
|
|
"step": 18855
|
|
},
|
|
{
|
|
"entropy": 6.225584030151367,
|
|
"epoch": 2.1765724177726486,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00045342785719916284,
|
|
"loss": 5.5986,
|
|
"mean_token_accuracy": 0.19875137656927108,
|
|
"num_tokens": 47802169.0,
|
|
"step": 18860
|
|
},
|
|
{
|
|
"entropy": 6.155571317672729,
|
|
"epoch": 2.177149451817657,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00045340271574484755,
|
|
"loss": 5.5336,
|
|
"mean_token_accuracy": 0.20996356904506683,
|
|
"num_tokens": 47815832.0,
|
|
"step": 18865
|
|
},
|
|
{
|
|
"entropy": 6.340555238723755,
|
|
"epoch": 2.177726485862666,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004533775682900454,
|
|
"loss": 5.7641,
|
|
"mean_token_accuracy": 0.19792629182338714,
|
|
"num_tokens": 47828967.0,
|
|
"step": 18870
|
|
},
|
|
{
|
|
"entropy": 6.216424942016602,
|
|
"epoch": 2.1783035199076743,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004533524148356025,
|
|
"loss": 5.6142,
|
|
"mean_token_accuracy": 0.21056083738803863,
|
|
"num_tokens": 47842114.0,
|
|
"step": 18875
|
|
},
|
|
{
|
|
"entropy": 6.117310237884522,
|
|
"epoch": 2.178880553952683,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004533272553823646,
|
|
"loss": 5.5741,
|
|
"mean_token_accuracy": 0.20430090874433518,
|
|
"num_tokens": 47855808.0,
|
|
"step": 18880
|
|
},
|
|
{
|
|
"entropy": 6.302039957046508,
|
|
"epoch": 2.179457587997692,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00045330208993117816,
|
|
"loss": 5.7289,
|
|
"mean_token_accuracy": 0.19179463237524033,
|
|
"num_tokens": 47866866.0,
|
|
"step": 18885
|
|
},
|
|
{
|
|
"entropy": 6.286647701263428,
|
|
"epoch": 2.1800346220427005,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004532769184828894,
|
|
"loss": 5.6727,
|
|
"mean_token_accuracy": 0.2016996130347252,
|
|
"num_tokens": 47878823.0,
|
|
"step": 18890
|
|
},
|
|
{
|
|
"entropy": 6.268312454223633,
|
|
"epoch": 2.1806116560877093,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004532517410383451,
|
|
"loss": 5.7583,
|
|
"mean_token_accuracy": 0.1968337342143059,
|
|
"num_tokens": 47890512.0,
|
|
"step": 18895
|
|
},
|
|
{
|
|
"entropy": 6.242161893844605,
|
|
"epoch": 2.1811886901327178,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000453226557598392,
|
|
"loss": 5.708,
|
|
"mean_token_accuracy": 0.19775693565607072,
|
|
"num_tokens": 47903728.0,
|
|
"step": 18900
|
|
},
|
|
{
|
|
"entropy": 6.29580249786377,
|
|
"epoch": 2.1817657241777266,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004532013681638771,
|
|
"loss": 5.7467,
|
|
"mean_token_accuracy": 0.1998975858092308,
|
|
"num_tokens": 47914742.0,
|
|
"step": 18905
|
|
},
|
|
{
|
|
"entropy": 6.32392201423645,
|
|
"epoch": 2.182342758222735,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004531761727356478,
|
|
"loss": 5.7328,
|
|
"mean_token_accuracy": 0.19939059615135193,
|
|
"num_tokens": 47926737.0,
|
|
"step": 18910
|
|
},
|
|
{
|
|
"entropy": 6.257878255844116,
|
|
"epoch": 2.182919792267744,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004531509713145514,
|
|
"loss": 5.6638,
|
|
"mean_token_accuracy": 0.20171019285917283,
|
|
"num_tokens": 47941207.0,
|
|
"step": 18915
|
|
},
|
|
{
|
|
"entropy": 6.257398414611816,
|
|
"epoch": 2.1834968263127523,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00045312576390143557,
|
|
"loss": 5.7509,
|
|
"mean_token_accuracy": 0.19138018190860748,
|
|
"num_tokens": 47953640.0,
|
|
"step": 18920
|
|
},
|
|
{
|
|
"entropy": 6.2764183521270756,
|
|
"epoch": 2.184073860357761,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00045310055049714815,
|
|
"loss": 5.7342,
|
|
"mean_token_accuracy": 0.20488953590393066,
|
|
"num_tokens": 47966399.0,
|
|
"step": 18925
|
|
},
|
|
{
|
|
"entropy": 6.283313941955567,
|
|
"epoch": 2.1846508944027696,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00045307533110253726,
|
|
"loss": 5.6533,
|
|
"mean_token_accuracy": 0.20482224971055984,
|
|
"num_tokens": 47979521.0,
|
|
"step": 18930
|
|
},
|
|
{
|
|
"entropy": 6.287374973297119,
|
|
"epoch": 2.1852279284477785,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045305010571845096,
|
|
"loss": 5.7341,
|
|
"mean_token_accuracy": 0.20170841217041016,
|
|
"num_tokens": 47992780.0,
|
|
"step": 18935
|
|
},
|
|
{
|
|
"entropy": 6.314225530624389,
|
|
"epoch": 2.185804962492787,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004530248743457378,
|
|
"loss": 5.7519,
|
|
"mean_token_accuracy": 0.19808263331651688,
|
|
"num_tokens": 48005548.0,
|
|
"step": 18940
|
|
},
|
|
{
|
|
"entropy": 6.2541357517242435,
|
|
"epoch": 2.1863819965377957,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004529996369852465,
|
|
"loss": 5.6555,
|
|
"mean_token_accuracy": 0.2016634613275528,
|
|
"num_tokens": 48017352.0,
|
|
"step": 18945
|
|
},
|
|
{
|
|
"entropy": 6.124024057388306,
|
|
"epoch": 2.1869590305828046,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00045297439363782576,
|
|
"loss": 5.4849,
|
|
"mean_token_accuracy": 0.21912779062986373,
|
|
"num_tokens": 48029252.0,
|
|
"step": 18950
|
|
},
|
|
{
|
|
"entropy": 6.261006593704224,
|
|
"epoch": 2.187536064627813,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004529491443043247,
|
|
"loss": 5.7477,
|
|
"mean_token_accuracy": 0.20232635885477065,
|
|
"num_tokens": 48041534.0,
|
|
"step": 18955
|
|
},
|
|
{
|
|
"entropy": 6.252580547332764,
|
|
"epoch": 2.188113098672822,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004529238889855926,
|
|
"loss": 5.7354,
|
|
"mean_token_accuracy": 0.19888463020324706,
|
|
"num_tokens": 48054396.0,
|
|
"step": 18960
|
|
},
|
|
{
|
|
"entropy": 6.259010362625122,
|
|
"epoch": 2.1886901327178303,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004528986276824789,
|
|
"loss": 5.7195,
|
|
"mean_token_accuracy": 0.1986936628818512,
|
|
"num_tokens": 48066785.0,
|
|
"step": 18965
|
|
},
|
|
{
|
|
"entropy": 6.207064390182495,
|
|
"epoch": 2.189267166762839,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004528733603958331,
|
|
"loss": 5.6582,
|
|
"mean_token_accuracy": 0.20980920046567916,
|
|
"num_tokens": 48079837.0,
|
|
"step": 18970
|
|
},
|
|
{
|
|
"entropy": 6.275537204742432,
|
|
"epoch": 2.1898442008078476,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004528480871265053,
|
|
"loss": 5.659,
|
|
"mean_token_accuracy": 0.20257765352725982,
|
|
"num_tokens": 48091670.0,
|
|
"step": 18975
|
|
},
|
|
{
|
|
"entropy": 6.2916429996490475,
|
|
"epoch": 2.1904212348528564,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00045282280787534537,
|
|
"loss": 5.7575,
|
|
"mean_token_accuracy": 0.19688573181629182,
|
|
"num_tokens": 48105261.0,
|
|
"step": 18980
|
|
},
|
|
{
|
|
"entropy": 6.2920839309692385,
|
|
"epoch": 2.190998268897865,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004527975226432036,
|
|
"loss": 5.6593,
|
|
"mean_token_accuracy": 0.1986699342727661,
|
|
"num_tokens": 48118272.0,
|
|
"step": 18985
|
|
},
|
|
{
|
|
"entropy": 6.237543535232544,
|
|
"epoch": 2.1915753029428737,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00045277223143093057,
|
|
"loss": 5.7048,
|
|
"mean_token_accuracy": 0.199216428399086,
|
|
"num_tokens": 48130413.0,
|
|
"step": 18990
|
|
},
|
|
{
|
|
"entropy": 6.267915391921997,
|
|
"epoch": 2.192152336987882,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00045274693423937674,
|
|
"loss": 5.6509,
|
|
"mean_token_accuracy": 0.2026078313589096,
|
|
"num_tokens": 48143308.0,
|
|
"step": 18995
|
|
},
|
|
{
|
|
"entropy": 6.2021924495697025,
|
|
"epoch": 2.192729371032891,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00045272163106939314,
|
|
"loss": 5.6053,
|
|
"mean_token_accuracy": 0.21072281152009964,
|
|
"num_tokens": 48155832.0,
|
|
"step": 19000
|
|
},
|
|
{
|
|
"entropy": 6.262426471710205,
|
|
"epoch": 2.1933064050778994,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00045269632192183076,
|
|
"loss": 5.7341,
|
|
"mean_token_accuracy": 0.1992826998233795,
|
|
"num_tokens": 48168390.0,
|
|
"step": 19005
|
|
},
|
|
{
|
|
"entropy": 6.279296064376831,
|
|
"epoch": 2.1938834391229083,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045267100679754075,
|
|
"loss": 5.7556,
|
|
"mean_token_accuracy": 0.19007308334112166,
|
|
"num_tokens": 48180918.0,
|
|
"step": 19010
|
|
},
|
|
{
|
|
"entropy": 6.300954580307007,
|
|
"epoch": 2.1944604731679167,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004526456856973748,
|
|
"loss": 5.702,
|
|
"mean_token_accuracy": 0.2015950232744217,
|
|
"num_tokens": 48194251.0,
|
|
"step": 19015
|
|
},
|
|
{
|
|
"entropy": 6.320611667633057,
|
|
"epoch": 2.1950375072129256,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004526203586221844,
|
|
"loss": 5.6978,
|
|
"mean_token_accuracy": 0.19965052008628845,
|
|
"num_tokens": 48206704.0,
|
|
"step": 19020
|
|
},
|
|
{
|
|
"entropy": 6.252124881744384,
|
|
"epoch": 2.1956145412579344,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00045259502557282145,
|
|
"loss": 5.6983,
|
|
"mean_token_accuracy": 0.20150818079710006,
|
|
"num_tokens": 48219390.0,
|
|
"step": 19025
|
|
},
|
|
{
|
|
"entropy": 6.201693296432495,
|
|
"epoch": 2.196191575302943,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004525696865501381,
|
|
"loss": 5.6442,
|
|
"mean_token_accuracy": 0.20039039254188537,
|
|
"num_tokens": 48231555.0,
|
|
"step": 19030
|
|
},
|
|
{
|
|
"entropy": 6.316070938110352,
|
|
"epoch": 2.1967686093479517,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004525443415549865,
|
|
"loss": 5.7185,
|
|
"mean_token_accuracy": 0.1988256499171257,
|
|
"num_tokens": 48243763.0,
|
|
"step": 19035
|
|
},
|
|
{
|
|
"entropy": 6.276049470901489,
|
|
"epoch": 2.19734564339296,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00045251899058821915,
|
|
"loss": 5.7118,
|
|
"mean_token_accuracy": 0.1995232343673706,
|
|
"num_tokens": 48257567.0,
|
|
"step": 19040
|
|
},
|
|
{
|
|
"entropy": 6.211150360107422,
|
|
"epoch": 2.197922677437969,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004524936336506887,
|
|
"loss": 5.62,
|
|
"mean_token_accuracy": 0.20634069442749023,
|
|
"num_tokens": 48270313.0,
|
|
"step": 19045
|
|
},
|
|
{
|
|
"entropy": 6.260643768310547,
|
|
"epoch": 2.1984997114829774,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004524682707432482,
|
|
"loss": 5.6012,
|
|
"mean_token_accuracy": 0.20677340775728226,
|
|
"num_tokens": 48282768.0,
|
|
"step": 19050
|
|
},
|
|
{
|
|
"entropy": 6.219102239608764,
|
|
"epoch": 2.1990767455279863,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00045244290186675034,
|
|
"loss": 5.6517,
|
|
"mean_token_accuracy": 0.20461307764053344,
|
|
"num_tokens": 48293861.0,
|
|
"step": 19055
|
|
},
|
|
{
|
|
"entropy": 6.2349823951721195,
|
|
"epoch": 2.1996537795729947,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004524175270220489,
|
|
"loss": 5.5988,
|
|
"mean_token_accuracy": 0.21154738813638688,
|
|
"num_tokens": 48306062.0,
|
|
"step": 19060
|
|
},
|
|
{
|
|
"entropy": 6.280507040023804,
|
|
"epoch": 2.2002308136180035,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00045239214620999683,
|
|
"loss": 5.7174,
|
|
"mean_token_accuracy": 0.1978029727935791,
|
|
"num_tokens": 48318777.0,
|
|
"step": 19065
|
|
},
|
|
{
|
|
"entropy": 6.264151763916016,
|
|
"epoch": 2.200807847663012,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004523667594314481,
|
|
"loss": 5.6984,
|
|
"mean_token_accuracy": 0.1989084467291832,
|
|
"num_tokens": 48330575.0,
|
|
"step": 19070
|
|
},
|
|
{
|
|
"entropy": 6.1020753383636475,
|
|
"epoch": 2.201384881708021,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00045234136668725655,
|
|
"loss": 5.5308,
|
|
"mean_token_accuracy": 0.21237103641033173,
|
|
"num_tokens": 48343980.0,
|
|
"step": 19075
|
|
},
|
|
{
|
|
"entropy": 6.1847601413726805,
|
|
"epoch": 2.2019619157530292,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00045231596797827616,
|
|
"loss": 5.6036,
|
|
"mean_token_accuracy": 0.2041487902402878,
|
|
"num_tokens": 48356140.0,
|
|
"step": 19080
|
|
},
|
|
{
|
|
"entropy": 6.245753765106201,
|
|
"epoch": 2.202538949798038,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00045229056330536134,
|
|
"loss": 5.6988,
|
|
"mean_token_accuracy": 0.20395198315382004,
|
|
"num_tokens": 48367756.0,
|
|
"step": 19085
|
|
},
|
|
{
|
|
"entropy": 6.229965162277222,
|
|
"epoch": 2.2031159838430465,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00045226515266936644,
|
|
"loss": 5.6839,
|
|
"mean_token_accuracy": 0.19726950377225877,
|
|
"num_tokens": 48381637.0,
|
|
"step": 19090
|
|
},
|
|
{
|
|
"entropy": 6.252473640441894,
|
|
"epoch": 2.2036930178880554,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004522397360711462,
|
|
"loss": 5.6362,
|
|
"mean_token_accuracy": 0.20076129734516143,
|
|
"num_tokens": 48394593.0,
|
|
"step": 19095
|
|
},
|
|
{
|
|
"entropy": 6.203752708435059,
|
|
"epoch": 2.2042700519330642,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004522143135115555,
|
|
"loss": 5.6111,
|
|
"mean_token_accuracy": 0.20537707656621934,
|
|
"num_tokens": 48408555.0,
|
|
"step": 19100
|
|
},
|
|
{
|
|
"entropy": 6.2377259731292725,
|
|
"epoch": 2.2048470859780727,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00045218888499144933,
|
|
"loss": 5.6602,
|
|
"mean_token_accuracy": 0.2072727635502815,
|
|
"num_tokens": 48420359.0,
|
|
"step": 19105
|
|
},
|
|
{
|
|
"entropy": 6.29434232711792,
|
|
"epoch": 2.2054241200230815,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00045216345051168314,
|
|
"loss": 5.7992,
|
|
"mean_token_accuracy": 0.1885974407196045,
|
|
"num_tokens": 48432516.0,
|
|
"step": 19110
|
|
},
|
|
{
|
|
"entropy": 6.259411954879761,
|
|
"epoch": 2.20600115406809,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004521380100731122,
|
|
"loss": 5.6699,
|
|
"mean_token_accuracy": 0.2050180107355118,
|
|
"num_tokens": 48444355.0,
|
|
"step": 19115
|
|
},
|
|
{
|
|
"entropy": 6.1959943771362305,
|
|
"epoch": 2.206578188113099,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00045211256367659234,
|
|
"loss": 5.5727,
|
|
"mean_token_accuracy": 0.21873999536037445,
|
|
"num_tokens": 48458341.0,
|
|
"step": 19120
|
|
},
|
|
{
|
|
"entropy": 6.244530487060547,
|
|
"epoch": 2.207155222158107,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004520871113229793,
|
|
"loss": 5.6865,
|
|
"mean_token_accuracy": 0.20000386238098145,
|
|
"num_tokens": 48471473.0,
|
|
"step": 19125
|
|
},
|
|
{
|
|
"entropy": 6.241182041168213,
|
|
"epoch": 2.207732256203116,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00045206165301312927,
|
|
"loss": 5.6741,
|
|
"mean_token_accuracy": 0.20176537930965424,
|
|
"num_tokens": 48483149.0,
|
|
"step": 19130
|
|
},
|
|
{
|
|
"entropy": 6.240596342086792,
|
|
"epoch": 2.2083092902481245,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004520361887478985,
|
|
"loss": 5.6755,
|
|
"mean_token_accuracy": 0.20530891567468643,
|
|
"num_tokens": 48495617.0,
|
|
"step": 19135
|
|
},
|
|
{
|
|
"entropy": 6.135921144485474,
|
|
"epoch": 2.2088863242931334,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004520107185281435,
|
|
"loss": 5.632,
|
|
"mean_token_accuracy": 0.20589762777090073,
|
|
"num_tokens": 48509391.0,
|
|
"step": 19140
|
|
},
|
|
{
|
|
"entropy": 6.165386486053467,
|
|
"epoch": 2.209463358338142,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004519852423547208,
|
|
"loss": 5.5958,
|
|
"mean_token_accuracy": 0.21079403162002563,
|
|
"num_tokens": 48523127.0,
|
|
"step": 19145
|
|
},
|
|
{
|
|
"entropy": 6.156606769561767,
|
|
"epoch": 2.2100403923831506,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004519597602284875,
|
|
"loss": 5.569,
|
|
"mean_token_accuracy": 0.21757976710796356,
|
|
"num_tokens": 48536797.0,
|
|
"step": 19150
|
|
},
|
|
{
|
|
"entropy": 6.263695287704468,
|
|
"epoch": 2.210617426428159,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004519342721503005,
|
|
"loss": 5.6717,
|
|
"mean_token_accuracy": 0.20158991515636443,
|
|
"num_tokens": 48549088.0,
|
|
"step": 19155
|
|
},
|
|
{
|
|
"entropy": 6.259319400787353,
|
|
"epoch": 2.211194460473168,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004519087781210171,
|
|
"loss": 5.6259,
|
|
"mean_token_accuracy": 0.20565885156393052,
|
|
"num_tokens": 48560451.0,
|
|
"step": 19160
|
|
},
|
|
{
|
|
"entropy": 6.2218138694763185,
|
|
"epoch": 2.2117714945181763,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.000451883278141495,
|
|
"loss": 5.6,
|
|
"mean_token_accuracy": 0.2046360641717911,
|
|
"num_tokens": 48572870.0,
|
|
"step": 19165
|
|
},
|
|
{
|
|
"entropy": 6.205379390716553,
|
|
"epoch": 2.212348528563185,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00045185777221259157,
|
|
"loss": 5.6622,
|
|
"mean_token_accuracy": 0.19950393736362457,
|
|
"num_tokens": 48585909.0,
|
|
"step": 19170
|
|
},
|
|
{
|
|
"entropy": 6.264685201644897,
|
|
"epoch": 2.212925562608194,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004518322603351648,
|
|
"loss": 5.649,
|
|
"mean_token_accuracy": 0.20917298644781113,
|
|
"num_tokens": 48599157.0,
|
|
"step": 19175
|
|
},
|
|
{
|
|
"entropy": 6.264721012115478,
|
|
"epoch": 2.2135025966532025,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00045180674251007287,
|
|
"loss": 5.6516,
|
|
"mean_token_accuracy": 0.20502317547798157,
|
|
"num_tokens": 48611740.0,
|
|
"step": 19180
|
|
},
|
|
{
|
|
"entropy": 6.279746770858765,
|
|
"epoch": 2.2140796306982113,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00045178121873817395,
|
|
"loss": 5.7617,
|
|
"mean_token_accuracy": 0.19199493378400803,
|
|
"num_tokens": 48624893.0,
|
|
"step": 19185
|
|
},
|
|
{
|
|
"entropy": 6.243294429779053,
|
|
"epoch": 2.2146566647432198,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004517556890203265,
|
|
"loss": 5.6802,
|
|
"mean_token_accuracy": 0.19957953989505767,
|
|
"num_tokens": 48636414.0,
|
|
"step": 19190
|
|
},
|
|
{
|
|
"entropy": 6.1810681343078615,
|
|
"epoch": 2.2152336987882286,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00045173015335738925,
|
|
"loss": 5.6405,
|
|
"mean_token_accuracy": 0.2053627386689186,
|
|
"num_tokens": 48649936.0,
|
|
"step": 19195
|
|
},
|
|
{
|
|
"entropy": 6.246352767944336,
|
|
"epoch": 2.215810732833237,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00045170461175022116,
|
|
"loss": 5.6136,
|
|
"mean_token_accuracy": 0.2143157973885536,
|
|
"num_tokens": 48662857.0,
|
|
"step": 19200
|
|
},
|
|
{
|
|
"entropy": 6.24592604637146,
|
|
"epoch": 2.216387766878246,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004516790641996812,
|
|
"loss": 5.6692,
|
|
"mean_token_accuracy": 0.2003368243575096,
|
|
"num_tokens": 48675087.0,
|
|
"step": 19205
|
|
},
|
|
{
|
|
"entropy": 6.176522159576416,
|
|
"epoch": 2.2169648009232543,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004516535107066286,
|
|
"loss": 5.5978,
|
|
"mean_token_accuracy": 0.20065319836139678,
|
|
"num_tokens": 48687575.0,
|
|
"step": 19210
|
|
},
|
|
{
|
|
"entropy": 6.234763860702515,
|
|
"epoch": 2.217541834968263,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00045162795127192296,
|
|
"loss": 5.6368,
|
|
"mean_token_accuracy": 0.19902375042438508,
|
|
"num_tokens": 48701115.0,
|
|
"step": 19215
|
|
},
|
|
{
|
|
"entropy": 6.293993902206421,
|
|
"epoch": 2.2181188690132716,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.000451602385896424,
|
|
"loss": 5.7558,
|
|
"mean_token_accuracy": 0.1977062702178955,
|
|
"num_tokens": 48713738.0,
|
|
"step": 19220
|
|
},
|
|
{
|
|
"entropy": 6.202127361297608,
|
|
"epoch": 2.2186959030582805,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00045157681458099145,
|
|
"loss": 5.5793,
|
|
"mean_token_accuracy": 0.20735561102628708,
|
|
"num_tokens": 48725282.0,
|
|
"step": 19225
|
|
},
|
|
{
|
|
"entropy": 6.219801712036133,
|
|
"epoch": 2.2192729371032893,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004515512373264854,
|
|
"loss": 5.6486,
|
|
"mean_token_accuracy": 0.2041847363114357,
|
|
"num_tokens": 48738476.0,
|
|
"step": 19230
|
|
},
|
|
{
|
|
"entropy": 6.260962247848511,
|
|
"epoch": 2.2198499711482977,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00045152565413376623,
|
|
"loss": 5.6571,
|
|
"mean_token_accuracy": 0.2018562912940979,
|
|
"num_tokens": 48751447.0,
|
|
"step": 19235
|
|
},
|
|
{
|
|
"entropy": 6.275470876693726,
|
|
"epoch": 2.2204270051933066,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004515000650036944,
|
|
"loss": 5.7167,
|
|
"mean_token_accuracy": 0.19641314595937728,
|
|
"num_tokens": 48764124.0,
|
|
"step": 19240
|
|
},
|
|
{
|
|
"entropy": 6.284907484054566,
|
|
"epoch": 2.221004039238315,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004514744699371305,
|
|
"loss": 5.7523,
|
|
"mean_token_accuracy": 0.1944175183773041,
|
|
"num_tokens": 48776414.0,
|
|
"step": 19245
|
|
},
|
|
{
|
|
"entropy": 6.267220830917358,
|
|
"epoch": 2.221581073283324,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00045144886893493547,
|
|
"loss": 5.6725,
|
|
"mean_token_accuracy": 0.1995649054646492,
|
|
"num_tokens": 48789318.0,
|
|
"step": 19250
|
|
},
|
|
{
|
|
"entropy": 6.132220125198364,
|
|
"epoch": 2.2221581073283323,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00045142326199797047,
|
|
"loss": 5.6118,
|
|
"mean_token_accuracy": 0.21107657998800278,
|
|
"num_tokens": 48801773.0,
|
|
"step": 19255
|
|
},
|
|
{
|
|
"entropy": 6.277349853515625,
|
|
"epoch": 2.222735141373341,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00045139764912709656,
|
|
"loss": 5.6264,
|
|
"mean_token_accuracy": 0.20283719897270203,
|
|
"num_tokens": 48814137.0,
|
|
"step": 19260
|
|
},
|
|
{
|
|
"entropy": 6.262899732589721,
|
|
"epoch": 2.2233121754183496,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004513720303231754,
|
|
"loss": 5.6507,
|
|
"mean_token_accuracy": 0.20469385832548143,
|
|
"num_tokens": 48826129.0,
|
|
"step": 19265
|
|
},
|
|
{
|
|
"entropy": 6.253290843963623,
|
|
"epoch": 2.2238892094633584,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045134640558706864,
|
|
"loss": 5.6963,
|
|
"mean_token_accuracy": 0.20241008698940277,
|
|
"num_tokens": 48838930.0,
|
|
"step": 19270
|
|
},
|
|
{
|
|
"entropy": 6.318625593185425,
|
|
"epoch": 2.224466243508367,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000451320774919638,
|
|
"loss": 5.6563,
|
|
"mean_token_accuracy": 0.19929049760103226,
|
|
"num_tokens": 48851506.0,
|
|
"step": 19275
|
|
},
|
|
{
|
|
"entropy": 6.214009761810303,
|
|
"epoch": 2.2250432775533757,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00045129513832174587,
|
|
"loss": 5.5768,
|
|
"mean_token_accuracy": 0.21026210784912108,
|
|
"num_tokens": 48865267.0,
|
|
"step": 19280
|
|
},
|
|
{
|
|
"entropy": 6.187762832641601,
|
|
"epoch": 2.225620311598384,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00045126949579425414,
|
|
"loss": 5.6747,
|
|
"mean_token_accuracy": 0.2047516793012619,
|
|
"num_tokens": 48877642.0,
|
|
"step": 19285
|
|
},
|
|
{
|
|
"entropy": 6.310758638381958,
|
|
"epoch": 2.226197345643393,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045124384733802563,
|
|
"loss": 5.7544,
|
|
"mean_token_accuracy": 0.19669358879327775,
|
|
"num_tokens": 48891135.0,
|
|
"step": 19290
|
|
},
|
|
{
|
|
"entropy": 6.310164165496826,
|
|
"epoch": 2.2267743796884014,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004512181929539228,
|
|
"loss": 5.7155,
|
|
"mean_token_accuracy": 0.1991264522075653,
|
|
"num_tokens": 48904361.0,
|
|
"step": 19295
|
|
},
|
|
{
|
|
"entropy": 6.211184453964234,
|
|
"epoch": 2.2273514137334103,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00045119253264280855,
|
|
"loss": 5.7157,
|
|
"mean_token_accuracy": 0.20109605193138122,
|
|
"num_tokens": 48916497.0,
|
|
"step": 19300
|
|
},
|
|
{
|
|
"entropy": 6.246825551986694,
|
|
"epoch": 2.227928447778419,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00045116686640554607,
|
|
"loss": 5.6756,
|
|
"mean_token_accuracy": 0.2026742219924927,
|
|
"num_tokens": 48928476.0,
|
|
"step": 19305
|
|
},
|
|
{
|
|
"entropy": 6.254496431350708,
|
|
"epoch": 2.2285054818234276,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00045114119424299843,
|
|
"loss": 5.6985,
|
|
"mean_token_accuracy": 0.20265805274248122,
|
|
"num_tokens": 48942153.0,
|
|
"step": 19310
|
|
},
|
|
{
|
|
"entropy": 6.306353569030762,
|
|
"epoch": 2.2290825158684364,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004511155161560293,
|
|
"loss": 5.7238,
|
|
"mean_token_accuracy": 0.20385703891515733,
|
|
"num_tokens": 48955313.0,
|
|
"step": 19315
|
|
},
|
|
{
|
|
"entropy": 6.243967485427857,
|
|
"epoch": 2.229659549913445,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00045108983214550225,
|
|
"loss": 5.6316,
|
|
"mean_token_accuracy": 0.2051597759127617,
|
|
"num_tokens": 48967875.0,
|
|
"step": 19320
|
|
},
|
|
{
|
|
"entropy": 6.336811971664429,
|
|
"epoch": 2.2302365839584537,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004510641422122811,
|
|
"loss": 5.7014,
|
|
"mean_token_accuracy": 0.196072755753994,
|
|
"num_tokens": 48979534.0,
|
|
"step": 19325
|
|
},
|
|
{
|
|
"entropy": 6.326515102386475,
|
|
"epoch": 2.230813618003462,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045103844635723005,
|
|
"loss": 5.731,
|
|
"mean_token_accuracy": 0.19862714260816575,
|
|
"num_tokens": 48991425.0,
|
|
"step": 19330
|
|
},
|
|
{
|
|
"entropy": 6.201512050628662,
|
|
"epoch": 2.231390652048471,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00045101274458121335,
|
|
"loss": 5.6194,
|
|
"mean_token_accuracy": 0.20665293782949448,
|
|
"num_tokens": 49003783.0,
|
|
"step": 19335
|
|
},
|
|
{
|
|
"entropy": 6.269555282592774,
|
|
"epoch": 2.2319676860934794,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00045098703688509537,
|
|
"loss": 5.7233,
|
|
"mean_token_accuracy": 0.1967211216688156,
|
|
"num_tokens": 49017998.0,
|
|
"step": 19340
|
|
},
|
|
{
|
|
"entropy": 6.313391923904419,
|
|
"epoch": 2.2325447201384883,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004509613232697408,
|
|
"loss": 5.7499,
|
|
"mean_token_accuracy": 0.19863232374191284,
|
|
"num_tokens": 49030429.0,
|
|
"step": 19345
|
|
},
|
|
{
|
|
"entropy": 6.254202842712402,
|
|
"epoch": 2.2331217541834967,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004509356037360145,
|
|
"loss": 5.6359,
|
|
"mean_token_accuracy": 0.2076195076107979,
|
|
"num_tokens": 49043619.0,
|
|
"step": 19350
|
|
},
|
|
{
|
|
"entropy": 6.298452854156494,
|
|
"epoch": 2.2336987882285055,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004509098782847816,
|
|
"loss": 5.6961,
|
|
"mean_token_accuracy": 0.19885571599006652,
|
|
"num_tokens": 49056674.0,
|
|
"step": 19355
|
|
},
|
|
{
|
|
"entropy": 6.241327381134033,
|
|
"epoch": 2.234275822273514,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004508841469169073,
|
|
"loss": 5.7308,
|
|
"mean_token_accuracy": 0.1998901277780533,
|
|
"num_tokens": 49069616.0,
|
|
"step": 19360
|
|
},
|
|
{
|
|
"entropy": 6.208149719238281,
|
|
"epoch": 2.234852856318523,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00045085840963325716,
|
|
"loss": 5.6743,
|
|
"mean_token_accuracy": 0.20631023645401,
|
|
"num_tokens": 49082001.0,
|
|
"step": 19365
|
|
},
|
|
{
|
|
"entropy": 6.286288022994995,
|
|
"epoch": 2.2354298903635312,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004508326664346967,
|
|
"loss": 5.6213,
|
|
"mean_token_accuracy": 0.20303625017404556,
|
|
"num_tokens": 49094433.0,
|
|
"step": 19370
|
|
},
|
|
{
|
|
"entropy": 6.2155601501464846,
|
|
"epoch": 2.23600692440854,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00045080691732209176,
|
|
"loss": 5.6239,
|
|
"mean_token_accuracy": 0.20596866607666015,
|
|
"num_tokens": 49106152.0,
|
|
"step": 19375
|
|
},
|
|
{
|
|
"entropy": 6.198886299133301,
|
|
"epoch": 2.236583958453549,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00045078116229630864,
|
|
"loss": 5.7094,
|
|
"mean_token_accuracy": 0.20838077068328859,
|
|
"num_tokens": 49120402.0,
|
|
"step": 19380
|
|
},
|
|
{
|
|
"entropy": 6.408450603485107,
|
|
"epoch": 2.2371609924985574,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00045075540135821343,
|
|
"loss": 5.8063,
|
|
"mean_token_accuracy": 0.19086912870407105,
|
|
"num_tokens": 49133571.0,
|
|
"step": 19385
|
|
},
|
|
{
|
|
"entropy": 6.3284543514251705,
|
|
"epoch": 2.2377380265435662,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004507296345086725,
|
|
"loss": 5.7951,
|
|
"mean_token_accuracy": 0.19179506003856658,
|
|
"num_tokens": 49147268.0,
|
|
"step": 19390
|
|
},
|
|
{
|
|
"entropy": 6.211698198318482,
|
|
"epoch": 2.2383150605885747,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004507038617485526,
|
|
"loss": 5.5474,
|
|
"mean_token_accuracy": 0.2093621775507927,
|
|
"num_tokens": 49159043.0,
|
|
"step": 19395
|
|
},
|
|
{
|
|
"entropy": 6.28239483833313,
|
|
"epoch": 2.2388920946335835,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00045067808307872064,
|
|
"loss": 5.6941,
|
|
"mean_token_accuracy": 0.20465970486402513,
|
|
"num_tokens": 49172164.0,
|
|
"step": 19400
|
|
},
|
|
{
|
|
"entropy": 6.266603231430054,
|
|
"epoch": 2.239469128678592,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00045065229850004365,
|
|
"loss": 5.6229,
|
|
"mean_token_accuracy": 0.20876996964216232,
|
|
"num_tokens": 49185023.0,
|
|
"step": 19405
|
|
},
|
|
{
|
|
"entropy": 6.300706672668457,
|
|
"epoch": 2.240046162723601,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004506265080133888,
|
|
"loss": 5.6982,
|
|
"mean_token_accuracy": 0.1954214468598366,
|
|
"num_tokens": 49198411.0,
|
|
"step": 19410
|
|
},
|
|
{
|
|
"entropy": 6.233200168609619,
|
|
"epoch": 2.240623196768609,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00045060071161962364,
|
|
"loss": 5.6973,
|
|
"mean_token_accuracy": 0.20337700098752975,
|
|
"num_tokens": 49211162.0,
|
|
"step": 19415
|
|
},
|
|
{
|
|
"entropy": 6.248962163925171,
|
|
"epoch": 2.241200230813618,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004505749093196158,
|
|
"loss": 5.7028,
|
|
"mean_token_accuracy": 0.2015640914440155,
|
|
"num_tokens": 49223808.0,
|
|
"step": 19420
|
|
},
|
|
{
|
|
"entropy": 6.173385334014893,
|
|
"epoch": 2.2417772648586265,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.000450549101114233,
|
|
"loss": 5.6418,
|
|
"mean_token_accuracy": 0.20374636054039003,
|
|
"num_tokens": 49236947.0,
|
|
"step": 19425
|
|
},
|
|
{
|
|
"entropy": 6.301487636566162,
|
|
"epoch": 2.2423542989036354,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004505232870043434,
|
|
"loss": 5.7153,
|
|
"mean_token_accuracy": 0.19642379581928254,
|
|
"num_tokens": 49249932.0,
|
|
"step": 19430
|
|
},
|
|
{
|
|
"entropy": 6.284289312362671,
|
|
"epoch": 2.2429313329486438,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004504974669908152,
|
|
"loss": 5.7306,
|
|
"mean_token_accuracy": 0.1982482597231865,
|
|
"num_tokens": 49261783.0,
|
|
"step": 19435
|
|
},
|
|
{
|
|
"entropy": 6.331235694885254,
|
|
"epoch": 2.2435083669936526,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00045047164107451696,
|
|
"loss": 5.7267,
|
|
"mean_token_accuracy": 0.19769036918878555,
|
|
"num_tokens": 49274495.0,
|
|
"step": 19440
|
|
},
|
|
{
|
|
"entropy": 6.240282869338989,
|
|
"epoch": 2.244085401038661,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004504458092563172,
|
|
"loss": 5.6726,
|
|
"mean_token_accuracy": 0.19854051172733306,
|
|
"num_tokens": 49288450.0,
|
|
"step": 19445
|
|
},
|
|
{
|
|
"entropy": 6.273891544342041,
|
|
"epoch": 2.24466243508367,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00045041997153708475,
|
|
"loss": 5.7222,
|
|
"mean_token_accuracy": 0.1992565721273422,
|
|
"num_tokens": 49300612.0,
|
|
"step": 19450
|
|
},
|
|
{
|
|
"entropy": 6.257104921340942,
|
|
"epoch": 2.2452394691286788,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00045039412791768877,
|
|
"loss": 5.7277,
|
|
"mean_token_accuracy": 0.19571390450000764,
|
|
"num_tokens": 49313860.0,
|
|
"step": 19455
|
|
},
|
|
{
|
|
"entropy": 6.289849805831909,
|
|
"epoch": 2.245816503173687,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00045036827839899833,
|
|
"loss": 5.6777,
|
|
"mean_token_accuracy": 0.20335286408662795,
|
|
"num_tokens": 49326864.0,
|
|
"step": 19460
|
|
},
|
|
{
|
|
"entropy": 6.28691840171814,
|
|
"epoch": 2.246393537218696,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00045034242298188303,
|
|
"loss": 5.7374,
|
|
"mean_token_accuracy": 0.19382706582546233,
|
|
"num_tokens": 49339444.0,
|
|
"step": 19465
|
|
},
|
|
{
|
|
"entropy": 6.206280183792114,
|
|
"epoch": 2.2469705712637045,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004503165616672124,
|
|
"loss": 5.6207,
|
|
"mean_token_accuracy": 0.2063739761710167,
|
|
"num_tokens": 49352999.0,
|
|
"step": 19470
|
|
},
|
|
{
|
|
"entropy": 6.250473546981811,
|
|
"epoch": 2.2475476053087133,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004502906944558563,
|
|
"loss": 5.6508,
|
|
"mean_token_accuracy": 0.20927198231220245,
|
|
"num_tokens": 49365600.0,
|
|
"step": 19475
|
|
},
|
|
{
|
|
"entropy": 6.343959617614746,
|
|
"epoch": 2.2481246393537218,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004502648213486848,
|
|
"loss": 5.7295,
|
|
"mean_token_accuracy": 0.20067790150642395,
|
|
"num_tokens": 49378121.0,
|
|
"step": 19480
|
|
},
|
|
{
|
|
"entropy": 6.210190200805664,
|
|
"epoch": 2.2487016733987306,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00045023894234656807,
|
|
"loss": 5.7057,
|
|
"mean_token_accuracy": 0.20189868211746215,
|
|
"num_tokens": 49390889.0,
|
|
"step": 19485
|
|
},
|
|
{
|
|
"entropy": 6.330983686447143,
|
|
"epoch": 2.249278707443739,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004502130574503766,
|
|
"loss": 5.7592,
|
|
"mean_token_accuracy": 0.20028941184282303,
|
|
"num_tokens": 49404613.0,
|
|
"step": 19490
|
|
},
|
|
{
|
|
"entropy": 6.301862335205078,
|
|
"epoch": 2.249855741488748,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004501871666609809,
|
|
"loss": 5.7354,
|
|
"mean_token_accuracy": 0.19650717377662658,
|
|
"num_tokens": 49416142.0,
|
|
"step": 19495
|
|
},
|
|
{
|
|
"entropy": 6.2688291549682615,
|
|
"epoch": 2.2504327755337563,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004501612699792519,
|
|
"loss": 5.642,
|
|
"mean_token_accuracy": 0.198591947555542,
|
|
"num_tokens": 49427848.0,
|
|
"step": 19500
|
|
},
|
|
{
|
|
"entropy": 6.340646886825562,
|
|
"epoch": 2.251009809578765,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004501353674060606,
|
|
"loss": 5.8278,
|
|
"mean_token_accuracy": 0.1921554610133171,
|
|
"num_tokens": 49442338.0,
|
|
"step": 19505
|
|
},
|
|
{
|
|
"entropy": 6.329627513885498,
|
|
"epoch": 2.251586843623774,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004501094589422782,
|
|
"loss": 5.6851,
|
|
"mean_token_accuracy": 0.20651307106018066,
|
|
"num_tokens": 49455565.0,
|
|
"step": 19510
|
|
},
|
|
{
|
|
"entropy": 6.277817964553833,
|
|
"epoch": 2.2521638776687825,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00045008354458877614,
|
|
"loss": 5.6897,
|
|
"mean_token_accuracy": 0.20428113937377929,
|
|
"num_tokens": 49468894.0,
|
|
"step": 19515
|
|
},
|
|
{
|
|
"entropy": 6.164229202270508,
|
|
"epoch": 2.252740911713791,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000450057624346426,
|
|
"loss": 5.5589,
|
|
"mean_token_accuracy": 0.21396252065896987,
|
|
"num_tokens": 49480324.0,
|
|
"step": 19520
|
|
},
|
|
{
|
|
"entropy": 6.2618499279022215,
|
|
"epoch": 2.2533179457587997,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00045003169821609967,
|
|
"loss": 5.6568,
|
|
"mean_token_accuracy": 0.2036493256688118,
|
|
"num_tokens": 49493823.0,
|
|
"step": 19525
|
|
},
|
|
{
|
|
"entropy": 6.278878498077392,
|
|
"epoch": 2.2538949798038086,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00045000576619866914,
|
|
"loss": 5.6117,
|
|
"mean_token_accuracy": 0.2137911170721054,
|
|
"num_tokens": 49506512.0,
|
|
"step": 19530
|
|
},
|
|
{
|
|
"entropy": 6.312352418899536,
|
|
"epoch": 2.254472013848817,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00044997982829500657,
|
|
"loss": 5.6839,
|
|
"mean_token_accuracy": 0.19806260019540786,
|
|
"num_tokens": 49518424.0,
|
|
"step": 19535
|
|
},
|
|
{
|
|
"entropy": 6.261477041244507,
|
|
"epoch": 2.255049047893826,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00044995388450598436,
|
|
"loss": 5.7309,
|
|
"mean_token_accuracy": 0.20388685017824174,
|
|
"num_tokens": 49531828.0,
|
|
"step": 19540
|
|
},
|
|
{
|
|
"entropy": 6.279758405685425,
|
|
"epoch": 2.2556260819388343,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004499279348324751,
|
|
"loss": 5.649,
|
|
"mean_token_accuracy": 0.19457512497901916,
|
|
"num_tokens": 49545502.0,
|
|
"step": 19545
|
|
},
|
|
{
|
|
"entropy": 6.206504154205322,
|
|
"epoch": 2.256203115983843,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00044990197927535173,
|
|
"loss": 5.6958,
|
|
"mean_token_accuracy": 0.19898426085710524,
|
|
"num_tokens": 49557323.0,
|
|
"step": 19550
|
|
},
|
|
{
|
|
"entropy": 6.1493871212005615,
|
|
"epoch": 2.2567801500288516,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00044987601783548703,
|
|
"loss": 5.5645,
|
|
"mean_token_accuracy": 0.21585829854011535,
|
|
"num_tokens": 49570149.0,
|
|
"step": 19555
|
|
},
|
|
{
|
|
"entropy": 6.267534399032593,
|
|
"epoch": 2.2573571840738604,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004498500505137545,
|
|
"loss": 5.6328,
|
|
"mean_token_accuracy": 0.20815033465623856,
|
|
"num_tokens": 49581866.0,
|
|
"step": 19560
|
|
},
|
|
{
|
|
"entropy": 6.190386343002319,
|
|
"epoch": 2.257934218118869,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004498240773110273,
|
|
"loss": 5.6434,
|
|
"mean_token_accuracy": 0.20312456637620926,
|
|
"num_tokens": 49592785.0,
|
|
"step": 19565
|
|
},
|
|
{
|
|
"entropy": 6.30643949508667,
|
|
"epoch": 2.2585112521638777,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004497980982281791,
|
|
"loss": 5.7865,
|
|
"mean_token_accuracy": 0.2009749099612236,
|
|
"num_tokens": 49604925.0,
|
|
"step": 19570
|
|
},
|
|
{
|
|
"entropy": 6.350605583190918,
|
|
"epoch": 2.259088286208886,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004497721132660837,
|
|
"loss": 5.7244,
|
|
"mean_token_accuracy": 0.19735192358493805,
|
|
"num_tokens": 49618548.0,
|
|
"step": 19575
|
|
},
|
|
{
|
|
"entropy": 6.258015203475952,
|
|
"epoch": 2.259665320253895,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00044974612242561516,
|
|
"loss": 5.6902,
|
|
"mean_token_accuracy": 0.20283384919166564,
|
|
"num_tokens": 49631968.0,
|
|
"step": 19580
|
|
},
|
|
{
|
|
"entropy": 6.256459474563599,
|
|
"epoch": 2.260242354298904,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004497201257076475,
|
|
"loss": 5.7116,
|
|
"mean_token_accuracy": 0.2024211421608925,
|
|
"num_tokens": 49645269.0,
|
|
"step": 19585
|
|
},
|
|
{
|
|
"entropy": 6.270970821380615,
|
|
"epoch": 2.2608193883439123,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004496941231130552,
|
|
"loss": 5.6926,
|
|
"mean_token_accuracy": 0.20178208351135254,
|
|
"num_tokens": 49655903.0,
|
|
"step": 19590
|
|
},
|
|
{
|
|
"entropy": 6.352920770645142,
|
|
"epoch": 2.261396422388921,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004496681146427129,
|
|
"loss": 5.7618,
|
|
"mean_token_accuracy": 0.1929154336452484,
|
|
"num_tokens": 49667982.0,
|
|
"step": 19595
|
|
},
|
|
{
|
|
"entropy": 6.259737825393676,
|
|
"epoch": 2.2619734564339296,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00044964210029749523,
|
|
"loss": 5.6242,
|
|
"mean_token_accuracy": 0.20513436794281006,
|
|
"num_tokens": 49681441.0,
|
|
"step": 19600
|
|
},
|
|
{
|
|
"entropy": 6.19245285987854,
|
|
"epoch": 2.2625504904789384,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00044961608007827736,
|
|
"loss": 5.6149,
|
|
"mean_token_accuracy": 0.21164268255233765,
|
|
"num_tokens": 49695805.0,
|
|
"step": 19605
|
|
},
|
|
{
|
|
"entropy": 6.3116106510162355,
|
|
"epoch": 2.263127524523947,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004495900539859344,
|
|
"loss": 5.7453,
|
|
"mean_token_accuracy": 0.2014342427253723,
|
|
"num_tokens": 49708762.0,
|
|
"step": 19610
|
|
},
|
|
{
|
|
"entropy": 6.244855976104736,
|
|
"epoch": 2.2637045585689557,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00044956402202134157,
|
|
"loss": 5.6769,
|
|
"mean_token_accuracy": 0.21064395904541017,
|
|
"num_tokens": 49724570.0,
|
|
"step": 19615
|
|
},
|
|
{
|
|
"entropy": 6.311522483825684,
|
|
"epoch": 2.264281592613964,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00044953798418537465,
|
|
"loss": 5.7421,
|
|
"mean_token_accuracy": 0.19412882030010223,
|
|
"num_tokens": 49736060.0,
|
|
"step": 19620
|
|
},
|
|
{
|
|
"entropy": 6.288136529922485,
|
|
"epoch": 2.264858626658973,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004495119404789093,
|
|
"loss": 5.6887,
|
|
"mean_token_accuracy": 0.20001592338085175,
|
|
"num_tokens": 49748520.0,
|
|
"step": 19625
|
|
},
|
|
{
|
|
"entropy": 6.259233474731445,
|
|
"epoch": 2.2654356607039814,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004494858909028216,
|
|
"loss": 5.7547,
|
|
"mean_token_accuracy": 0.19457891583442688,
|
|
"num_tokens": 49761097.0,
|
|
"step": 19630
|
|
},
|
|
{
|
|
"entropy": 6.243998432159424,
|
|
"epoch": 2.2660126947489903,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004494598354579875,
|
|
"loss": 5.6599,
|
|
"mean_token_accuracy": 0.2039832279086113,
|
|
"num_tokens": 49773430.0,
|
|
"step": 19635
|
|
},
|
|
{
|
|
"entropy": 6.283785581588745,
|
|
"epoch": 2.2665897287939987,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004494337741452836,
|
|
"loss": 5.6964,
|
|
"mean_token_accuracy": 0.20121050328016282,
|
|
"num_tokens": 49785525.0,
|
|
"step": 19640
|
|
},
|
|
{
|
|
"entropy": 6.272574615478516,
|
|
"epoch": 2.2671667628390075,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004494077069655863,
|
|
"loss": 5.7104,
|
|
"mean_token_accuracy": 0.20026218593120576,
|
|
"num_tokens": 49796650.0,
|
|
"step": 19645
|
|
},
|
|
{
|
|
"entropy": 6.2548116683959964,
|
|
"epoch": 2.267743796884016,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004493816339197724,
|
|
"loss": 5.6775,
|
|
"mean_token_accuracy": 0.20387378036975862,
|
|
"num_tokens": 49808191.0,
|
|
"step": 19650
|
|
},
|
|
{
|
|
"entropy": 6.276640319824219,
|
|
"epoch": 2.268320830929025,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00044935555500871897,
|
|
"loss": 5.7046,
|
|
"mean_token_accuracy": 0.20125204026699067,
|
|
"num_tokens": 49820051.0,
|
|
"step": 19655
|
|
},
|
|
{
|
|
"entropy": 6.295619058609009,
|
|
"epoch": 2.2688978649740337,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.000449329470233303,
|
|
"loss": 5.7228,
|
|
"mean_token_accuracy": 0.19812791794538498,
|
|
"num_tokens": 49835392.0,
|
|
"step": 19660
|
|
},
|
|
{
|
|
"entropy": 6.222367143630981,
|
|
"epoch": 2.269474899019042,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00044930337959440183,
|
|
"loss": 5.6577,
|
|
"mean_token_accuracy": 0.20379606783390045,
|
|
"num_tokens": 49847344.0,
|
|
"step": 19665
|
|
},
|
|
{
|
|
"entropy": 6.295651435852051,
|
|
"epoch": 2.270051933064051,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004492772830928931,
|
|
"loss": 5.7302,
|
|
"mean_token_accuracy": 0.19512915164232253,
|
|
"num_tokens": 49859741.0,
|
|
"step": 19670
|
|
},
|
|
{
|
|
"entropy": 6.276036500930786,
|
|
"epoch": 2.2706289671090594,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00044925118072965456,
|
|
"loss": 5.6989,
|
|
"mean_token_accuracy": 0.20129497200250626,
|
|
"num_tokens": 49871565.0,
|
|
"step": 19675
|
|
},
|
|
{
|
|
"entropy": 6.219705247879029,
|
|
"epoch": 2.2712060011540682,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.000449225072505564,
|
|
"loss": 5.645,
|
|
"mean_token_accuracy": 0.20144531279802322,
|
|
"num_tokens": 49883405.0,
|
|
"step": 19680
|
|
},
|
|
{
|
|
"entropy": 6.287055253982544,
|
|
"epoch": 2.2717830351990767,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00044919895842149976,
|
|
"loss": 5.7471,
|
|
"mean_token_accuracy": 0.19765210449695586,
|
|
"num_tokens": 49895924.0,
|
|
"step": 19685
|
|
},
|
|
{
|
|
"entropy": 6.23684401512146,
|
|
"epoch": 2.2723600692440855,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00044917283847834005,
|
|
"loss": 5.6523,
|
|
"mean_token_accuracy": 0.19993764013051987,
|
|
"num_tokens": 49908506.0,
|
|
"step": 19690
|
|
},
|
|
{
|
|
"entropy": 6.29704647064209,
|
|
"epoch": 2.272937103289094,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004491467126769635,
|
|
"loss": 5.7223,
|
|
"mean_token_accuracy": 0.1992749884724617,
|
|
"num_tokens": 49919917.0,
|
|
"step": 19695
|
|
},
|
|
{
|
|
"entropy": 6.228441858291626,
|
|
"epoch": 2.273514137334103,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00044912058101824866,
|
|
"loss": 5.6465,
|
|
"mean_token_accuracy": 0.20652550756931304,
|
|
"num_tokens": 49932508.0,
|
|
"step": 19700
|
|
},
|
|
{
|
|
"entropy": 6.2381360054016115,
|
|
"epoch": 2.274091171379111,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00044909444350307463,
|
|
"loss": 5.7107,
|
|
"mean_token_accuracy": 0.20327081233263017,
|
|
"num_tokens": 49945065.0,
|
|
"step": 19705
|
|
},
|
|
{
|
|
"entropy": 6.2598044872283936,
|
|
"epoch": 2.27466820542412,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004490683001323205,
|
|
"loss": 5.6279,
|
|
"mean_token_accuracy": 0.2084788978099823,
|
|
"num_tokens": 49957530.0,
|
|
"step": 19710
|
|
},
|
|
{
|
|
"entropy": 6.201219892501831,
|
|
"epoch": 2.2752452394691285,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00044904215090686554,
|
|
"loss": 5.5949,
|
|
"mean_token_accuracy": 0.20651741623878478,
|
|
"num_tokens": 49969760.0,
|
|
"step": 19715
|
|
},
|
|
{
|
|
"entropy": 6.252209281921386,
|
|
"epoch": 2.2758222735141374,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00044901599582758926,
|
|
"loss": 5.7175,
|
|
"mean_token_accuracy": 0.20343547612428664,
|
|
"num_tokens": 49983151.0,
|
|
"step": 19720
|
|
},
|
|
{
|
|
"entropy": 6.259750556945801,
|
|
"epoch": 2.2763993075591458,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00044898983489537143,
|
|
"loss": 5.6256,
|
|
"mean_token_accuracy": 0.2036111459136009,
|
|
"num_tokens": 49995262.0,
|
|
"step": 19725
|
|
},
|
|
{
|
|
"entropy": 6.289621210098266,
|
|
"epoch": 2.2769763416041546,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000448963668111092,
|
|
"loss": 5.6857,
|
|
"mean_token_accuracy": 0.19986894577741623,
|
|
"num_tokens": 50007153.0,
|
|
"step": 19730
|
|
},
|
|
{
|
|
"entropy": 6.1917328357696535,
|
|
"epoch": 2.2775533756491635,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00044893749547563085,
|
|
"loss": 5.6719,
|
|
"mean_token_accuracy": 0.20763412564992906,
|
|
"num_tokens": 50020145.0,
|
|
"step": 19735
|
|
},
|
|
{
|
|
"entropy": 6.243492603302002,
|
|
"epoch": 2.278130409694172,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00044891131698986846,
|
|
"loss": 5.6842,
|
|
"mean_token_accuracy": 0.19811105132102966,
|
|
"num_tokens": 50032741.0,
|
|
"step": 19740
|
|
},
|
|
{
|
|
"entropy": 6.239491748809814,
|
|
"epoch": 2.2787074437391808,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004488851326546854,
|
|
"loss": 5.7194,
|
|
"mean_token_accuracy": 0.19922717809677123,
|
|
"num_tokens": 50046112.0,
|
|
"step": 19745
|
|
},
|
|
{
|
|
"entropy": 6.275479888916015,
|
|
"epoch": 2.279284477784189,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004488589424709622,
|
|
"loss": 5.6932,
|
|
"mean_token_accuracy": 0.20576501041650772,
|
|
"num_tokens": 50058718.0,
|
|
"step": 19750
|
|
},
|
|
{
|
|
"entropy": 6.196004152297974,
|
|
"epoch": 2.279861511829198,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004488327464395799,
|
|
"loss": 5.6223,
|
|
"mean_token_accuracy": 0.20243488848209382,
|
|
"num_tokens": 50071759.0,
|
|
"step": 19755
|
|
},
|
|
{
|
|
"entropy": 6.277880620956421,
|
|
"epoch": 2.2804385458742065,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004488065445614195,
|
|
"loss": 5.6598,
|
|
"mean_token_accuracy": 0.2045716404914856,
|
|
"num_tokens": 50083948.0,
|
|
"step": 19760
|
|
},
|
|
{
|
|
"entropy": 6.241612482070923,
|
|
"epoch": 2.2810155799192153,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004487803368373623,
|
|
"loss": 5.6438,
|
|
"mean_token_accuracy": 0.20779716223478317,
|
|
"num_tokens": 50097310.0,
|
|
"step": 19765
|
|
},
|
|
{
|
|
"entropy": 6.1986939907073975,
|
|
"epoch": 2.2815926139642237,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004487541232682898,
|
|
"loss": 5.6918,
|
|
"mean_token_accuracy": 0.20480042099952697,
|
|
"num_tokens": 50109939.0,
|
|
"step": 19770
|
|
},
|
|
{
|
|
"entropy": 6.297293043136596,
|
|
"epoch": 2.2821696480092326,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004487279038550836,
|
|
"loss": 5.7475,
|
|
"mean_token_accuracy": 0.19697188287973405,
|
|
"num_tokens": 50120651.0,
|
|
"step": 19775
|
|
},
|
|
{
|
|
"entropy": 6.284278392791748,
|
|
"epoch": 2.282746682054241,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004487016785986258,
|
|
"loss": 5.6821,
|
|
"mean_token_accuracy": 0.20540768802165985,
|
|
"num_tokens": 50133180.0,
|
|
"step": 19780
|
|
},
|
|
{
|
|
"entropy": 6.259939765930175,
|
|
"epoch": 2.28332371609925,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00044867544749979817,
|
|
"loss": 5.6934,
|
|
"mean_token_accuracy": 0.2011975407600403,
|
|
"num_tokens": 50144808.0,
|
|
"step": 19785
|
|
},
|
|
{
|
|
"entropy": 6.242081022262573,
|
|
"epoch": 2.2839007501442588,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00044864921055948317,
|
|
"loss": 5.648,
|
|
"mean_token_accuracy": 0.20324725955724715,
|
|
"num_tokens": 50157487.0,
|
|
"step": 19790
|
|
},
|
|
{
|
|
"entropy": 6.274213600158691,
|
|
"epoch": 2.284477784189267,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00044862296777856326,
|
|
"loss": 5.7191,
|
|
"mean_token_accuracy": 0.19910815358161926,
|
|
"num_tokens": 50171837.0,
|
|
"step": 19795
|
|
},
|
|
{
|
|
"entropy": 6.262651777267456,
|
|
"epoch": 2.2850548182342756,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004485967191579211,
|
|
"loss": 5.6147,
|
|
"mean_token_accuracy": 0.21335643529891968,
|
|
"num_tokens": 50184802.0,
|
|
"step": 19800
|
|
},
|
|
{
|
|
"entropy": 6.248020982742309,
|
|
"epoch": 2.2856318522792844,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004485704646984394,
|
|
"loss": 5.6945,
|
|
"mean_token_accuracy": 0.1977355048060417,
|
|
"num_tokens": 50196433.0,
|
|
"step": 19805
|
|
},
|
|
{
|
|
"entropy": 6.22298641204834,
|
|
"epoch": 2.2862088863242933,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004485442044010015,
|
|
"loss": 5.632,
|
|
"mean_token_accuracy": 0.21534291952848433,
|
|
"num_tokens": 50209549.0,
|
|
"step": 19810
|
|
},
|
|
{
|
|
"entropy": 6.359181070327759,
|
|
"epoch": 2.2867859203693017,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004485179382664904,
|
|
"loss": 5.7947,
|
|
"mean_token_accuracy": 0.19366897642612457,
|
|
"num_tokens": 50220691.0,
|
|
"step": 19815
|
|
},
|
|
{
|
|
"entropy": 6.368267250061035,
|
|
"epoch": 2.2873629544143106,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004484916662957896,
|
|
"loss": 5.7792,
|
|
"mean_token_accuracy": 0.19695059061050416,
|
|
"num_tokens": 50233003.0,
|
|
"step": 19820
|
|
},
|
|
{
|
|
"entropy": 6.260522842407227,
|
|
"epoch": 2.287939988459319,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004484653884897829,
|
|
"loss": 5.6793,
|
|
"mean_token_accuracy": 0.1978773593902588,
|
|
"num_tokens": 50244742.0,
|
|
"step": 19825
|
|
},
|
|
{
|
|
"entropy": 6.151585578918457,
|
|
"epoch": 2.288517022504328,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00044843910484935394,
|
|
"loss": 5.5735,
|
|
"mean_token_accuracy": 0.2117750972509384,
|
|
"num_tokens": 50258188.0,
|
|
"step": 19830
|
|
},
|
|
{
|
|
"entropy": 6.287138366699219,
|
|
"epoch": 2.2890940565493363,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004484128153753868,
|
|
"loss": 5.7306,
|
|
"mean_token_accuracy": 0.20295771360397338,
|
|
"num_tokens": 50271155.0,
|
|
"step": 19835
|
|
},
|
|
{
|
|
"entropy": 6.346404504776001,
|
|
"epoch": 2.289671090594345,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00044838652006876583,
|
|
"loss": 5.7226,
|
|
"mean_token_accuracy": 0.20089610815048217,
|
|
"num_tokens": 50283518.0,
|
|
"step": 19840
|
|
},
|
|
{
|
|
"entropy": 6.179970598220825,
|
|
"epoch": 2.2902481246393536,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00044836021893037537,
|
|
"loss": 5.6065,
|
|
"mean_token_accuracy": 0.21166497617959976,
|
|
"num_tokens": 50296208.0,
|
|
"step": 19845
|
|
},
|
|
{
|
|
"entropy": 6.183140087127685,
|
|
"epoch": 2.2908251586843624,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004483339119611001,
|
|
"loss": 5.62,
|
|
"mean_token_accuracy": 0.21188974529504775,
|
|
"num_tokens": 50309111.0,
|
|
"step": 19850
|
|
},
|
|
{
|
|
"entropy": 6.266731452941895,
|
|
"epoch": 2.291402192729371,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00044830759916182476,
|
|
"loss": 5.7215,
|
|
"mean_token_accuracy": 0.19990355223417283,
|
|
"num_tokens": 50321895.0,
|
|
"step": 19855
|
|
},
|
|
{
|
|
"entropy": 6.300902700424194,
|
|
"epoch": 2.2919792267743797,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004482812805334344,
|
|
"loss": 5.7463,
|
|
"mean_token_accuracy": 0.19138864129781724,
|
|
"num_tokens": 50335769.0,
|
|
"step": 19860
|
|
},
|
|
{
|
|
"entropy": 6.308612489700318,
|
|
"epoch": 2.2925562608193886,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004482549560768142,
|
|
"loss": 5.6856,
|
|
"mean_token_accuracy": 0.20473549962043763,
|
|
"num_tokens": 50348576.0,
|
|
"step": 19865
|
|
},
|
|
{
|
|
"entropy": 6.246194124221802,
|
|
"epoch": 2.293133294864397,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004482286257928497,
|
|
"loss": 5.7056,
|
|
"mean_token_accuracy": 0.1999507576227188,
|
|
"num_tokens": 50360652.0,
|
|
"step": 19870
|
|
},
|
|
{
|
|
"entropy": 6.179588699340821,
|
|
"epoch": 2.293710328909406,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004482022896824263,
|
|
"loss": 5.6761,
|
|
"mean_token_accuracy": 0.19982111304998398,
|
|
"num_tokens": 50373256.0,
|
|
"step": 19875
|
|
},
|
|
{
|
|
"entropy": 6.262630033493042,
|
|
"epoch": 2.2942873629544143,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00044817594774643004,
|
|
"loss": 5.6015,
|
|
"mean_token_accuracy": 0.20998111516237258,
|
|
"num_tokens": 50385245.0,
|
|
"step": 19880
|
|
},
|
|
{
|
|
"entropy": 6.278105211257935,
|
|
"epoch": 2.294864396999423,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00044814959998574675,
|
|
"loss": 5.7173,
|
|
"mean_token_accuracy": 0.19566212147474288,
|
|
"num_tokens": 50397276.0,
|
|
"step": 19885
|
|
},
|
|
{
|
|
"entropy": 6.310760498046875,
|
|
"epoch": 2.2954414310444315,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00044812324640126265,
|
|
"loss": 5.7995,
|
|
"mean_token_accuracy": 0.19371946156024933,
|
|
"num_tokens": 50409725.0,
|
|
"step": 19890
|
|
},
|
|
{
|
|
"entropy": 6.30986967086792,
|
|
"epoch": 2.2960184650894404,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004480968869938642,
|
|
"loss": 5.7358,
|
|
"mean_token_accuracy": 0.19498946964740754,
|
|
"num_tokens": 50421987.0,
|
|
"step": 19895
|
|
},
|
|
{
|
|
"entropy": 6.255093336105347,
|
|
"epoch": 2.296595499134449,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00044807052176443793,
|
|
"loss": 5.6393,
|
|
"mean_token_accuracy": 0.21141475737094878,
|
|
"num_tokens": 50436153.0,
|
|
"step": 19900
|
|
},
|
|
{
|
|
"entropy": 6.2507484436035154,
|
|
"epoch": 2.2971725331794577,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00044804415071387067,
|
|
"loss": 5.7516,
|
|
"mean_token_accuracy": 0.20144218802452088,
|
|
"num_tokens": 50449683.0,
|
|
"step": 19905
|
|
},
|
|
{
|
|
"entropy": 6.172179746627807,
|
|
"epoch": 2.297749567224466,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004480177738430492,
|
|
"loss": 5.5576,
|
|
"mean_token_accuracy": 0.21170271188020706,
|
|
"num_tokens": 50461535.0,
|
|
"step": 19910
|
|
},
|
|
{
|
|
"entropy": 6.247416591644287,
|
|
"epoch": 2.298326601269475,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00044799139115286104,
|
|
"loss": 5.6759,
|
|
"mean_token_accuracy": 0.1969045430421829,
|
|
"num_tokens": 50476094.0,
|
|
"step": 19915
|
|
},
|
|
{
|
|
"entropy": 6.292913627624512,
|
|
"epoch": 2.2989036353144834,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004479650026441933,
|
|
"loss": 5.6821,
|
|
"mean_token_accuracy": 0.19706797301769258,
|
|
"num_tokens": 50488751.0,
|
|
"step": 19920
|
|
},
|
|
{
|
|
"entropy": 6.302343368530273,
|
|
"epoch": 2.2994806693594922,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00044793860831793356,
|
|
"loss": 5.667,
|
|
"mean_token_accuracy": 0.20249564349651336,
|
|
"num_tokens": 50502272.0,
|
|
"step": 19925
|
|
},
|
|
{
|
|
"entropy": 6.268003511428833,
|
|
"epoch": 2.3000577034045007,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00044791220817496963,
|
|
"loss": 5.6962,
|
|
"mean_token_accuracy": 0.19340673238039016,
|
|
"num_tokens": 50514792.0,
|
|
"step": 19930
|
|
},
|
|
{
|
|
"entropy": 6.189672327041626,
|
|
"epoch": 2.3006347374495095,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004478858022161895,
|
|
"loss": 5.6096,
|
|
"mean_token_accuracy": 0.2113632693886757,
|
|
"num_tokens": 50528484.0,
|
|
"step": 19935
|
|
},
|
|
{
|
|
"entropy": 6.3625153541564945,
|
|
"epoch": 2.3012117714945184,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004478593904424813,
|
|
"loss": 5.7847,
|
|
"mean_token_accuracy": 0.1942471295595169,
|
|
"num_tokens": 50540737.0,
|
|
"step": 19940
|
|
},
|
|
{
|
|
"entropy": 6.25290060043335,
|
|
"epoch": 2.301788805539527,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004478329728547334,
|
|
"loss": 5.6936,
|
|
"mean_token_accuracy": 0.20512138158082963,
|
|
"num_tokens": 50553819.0,
|
|
"step": 19945
|
|
},
|
|
{
|
|
"entropy": 6.2829841613769535,
|
|
"epoch": 2.3023658395845357,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00044780654945383424,
|
|
"loss": 5.7354,
|
|
"mean_token_accuracy": 0.2017420634627342,
|
|
"num_tokens": 50566275.0,
|
|
"step": 19950
|
|
},
|
|
{
|
|
"entropy": 6.278318548202515,
|
|
"epoch": 2.302942873629544,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00044778012024067267,
|
|
"loss": 5.681,
|
|
"mean_token_accuracy": 0.20539594292640687,
|
|
"num_tokens": 50577653.0,
|
|
"step": 19955
|
|
},
|
|
{
|
|
"entropy": 6.310393190383911,
|
|
"epoch": 2.303519907674553,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004477536852161376,
|
|
"loss": 5.7271,
|
|
"mean_token_accuracy": 0.1932803899049759,
|
|
"num_tokens": 50590237.0,
|
|
"step": 19960
|
|
},
|
|
{
|
|
"entropy": 6.186036014556885,
|
|
"epoch": 2.3040969417195614,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004477272443811181,
|
|
"loss": 5.6042,
|
|
"mean_token_accuracy": 0.19824027866125107,
|
|
"num_tokens": 50602333.0,
|
|
"step": 19965
|
|
},
|
|
{
|
|
"entropy": 6.335505819320678,
|
|
"epoch": 2.3046739757645702,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004477007977365035,
|
|
"loss": 5.7524,
|
|
"mean_token_accuracy": 0.19401074647903443,
|
|
"num_tokens": 50614232.0,
|
|
"step": 19970
|
|
},
|
|
{
|
|
"entropy": 6.3040093898773195,
|
|
"epoch": 2.3052510098095786,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004476743452831834,
|
|
"loss": 5.6889,
|
|
"mean_token_accuracy": 0.2003216937184334,
|
|
"num_tokens": 50627959.0,
|
|
"step": 19975
|
|
},
|
|
{
|
|
"entropy": 6.198862886428833,
|
|
"epoch": 2.3058280438545875,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00044764788702204747,
|
|
"loss": 5.587,
|
|
"mean_token_accuracy": 0.21014727056026458,
|
|
"num_tokens": 50639962.0,
|
|
"step": 19980
|
|
},
|
|
{
|
|
"entropy": 6.264612627029419,
|
|
"epoch": 2.306405077899596,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004476214229539856,
|
|
"loss": 5.6996,
|
|
"mean_token_accuracy": 0.20357227176427842,
|
|
"num_tokens": 50652291.0,
|
|
"step": 19985
|
|
},
|
|
{
|
|
"entropy": 6.288990640640259,
|
|
"epoch": 2.306982111944605,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004475949530798879,
|
|
"loss": 5.6989,
|
|
"mean_token_accuracy": 0.19868904054164888,
|
|
"num_tokens": 50664993.0,
|
|
"step": 19990
|
|
},
|
|
{
|
|
"entropy": 6.187899351119995,
|
|
"epoch": 2.307559145989613,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00044756847740064475,
|
|
"loss": 5.5424,
|
|
"mean_token_accuracy": 0.19761182218790055,
|
|
"num_tokens": 50677846.0,
|
|
"step": 19995
|
|
},
|
|
{
|
|
"entropy": 6.221263217926025,
|
|
"epoch": 2.308136180034622,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004475419959171465,
|
|
"loss": 5.6128,
|
|
"mean_token_accuracy": 0.21344971507787705,
|
|
"num_tokens": 50691068.0,
|
|
"step": 20000
|
|
},
|
|
{
|
|
"entropy": 6.230750799179077,
|
|
"epoch": 2.3087132140796305,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.000447515508630284,
|
|
"loss": 5.6977,
|
|
"mean_token_accuracy": 0.20123774111270903,
|
|
"num_tokens": 50703663.0,
|
|
"step": 20005
|
|
},
|
|
{
|
|
"entropy": 6.312432861328125,
|
|
"epoch": 2.3092902481246393,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00044748901554094806,
|
|
"loss": 5.6947,
|
|
"mean_token_accuracy": 0.20297775119543077,
|
|
"num_tokens": 50715709.0,
|
|
"step": 20010
|
|
},
|
|
{
|
|
"entropy": 6.248737716674805,
|
|
"epoch": 2.309867282169648,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004474625166500297,
|
|
"loss": 5.6769,
|
|
"mean_token_accuracy": 0.2087046891450882,
|
|
"num_tokens": 50727700.0,
|
|
"step": 20015
|
|
},
|
|
{
|
|
"entropy": 6.259288597106933,
|
|
"epoch": 2.3104443162146566,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00044743601195842026,
|
|
"loss": 5.6259,
|
|
"mean_token_accuracy": 0.20704087764024734,
|
|
"num_tokens": 50740604.0,
|
|
"step": 20020
|
|
},
|
|
{
|
|
"entropy": 6.351035213470459,
|
|
"epoch": 2.3110213502596655,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00044740950146701127,
|
|
"loss": 5.774,
|
|
"mean_token_accuracy": 0.1978513553738594,
|
|
"num_tokens": 50753666.0,
|
|
"step": 20025
|
|
},
|
|
{
|
|
"entropy": 6.229120397567749,
|
|
"epoch": 2.311598384304674,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004473829851766943,
|
|
"loss": 5.7331,
|
|
"mean_token_accuracy": 0.1979401797056198,
|
|
"num_tokens": 50766324.0,
|
|
"step": 20030
|
|
},
|
|
{
|
|
"entropy": 6.312212944030762,
|
|
"epoch": 2.3121754183496828,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004473564630883612,
|
|
"loss": 5.7301,
|
|
"mean_token_accuracy": 0.2022898778319359,
|
|
"num_tokens": 50779037.0,
|
|
"step": 20035
|
|
},
|
|
{
|
|
"entropy": 6.262638854980469,
|
|
"epoch": 2.312752452394691,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004473299352029042,
|
|
"loss": 5.6611,
|
|
"mean_token_accuracy": 0.20583394020795823,
|
|
"num_tokens": 50791089.0,
|
|
"step": 20040
|
|
},
|
|
{
|
|
"entropy": 6.221489095687867,
|
|
"epoch": 2.3133294864397,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004473034015212154,
|
|
"loss": 5.6526,
|
|
"mean_token_accuracy": 0.1966189831495285,
|
|
"num_tokens": 50803608.0,
|
|
"step": 20045
|
|
},
|
|
{
|
|
"entropy": 6.242483282089234,
|
|
"epoch": 2.3139065204847085,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004472768620441872,
|
|
"loss": 5.6904,
|
|
"mean_token_accuracy": 0.19912586808204652,
|
|
"num_tokens": 50815712.0,
|
|
"step": 20050
|
|
},
|
|
{
|
|
"entropy": 6.3092294216156,
|
|
"epoch": 2.3144835545297173,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00044725031677271234,
|
|
"loss": 5.6188,
|
|
"mean_token_accuracy": 0.2108631983399391,
|
|
"num_tokens": 50827409.0,
|
|
"step": 20055
|
|
},
|
|
{
|
|
"entropy": 6.226622200012207,
|
|
"epoch": 2.3150605885747257,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004472237657076837,
|
|
"loss": 5.6465,
|
|
"mean_token_accuracy": 0.20455507636070253,
|
|
"num_tokens": 50840901.0,
|
|
"step": 20060
|
|
},
|
|
{
|
|
"entropy": 6.299163818359375,
|
|
"epoch": 2.3156376226197346,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004471972088499942,
|
|
"loss": 5.7315,
|
|
"mean_token_accuracy": 0.1961276039481163,
|
|
"num_tokens": 50854453.0,
|
|
"step": 20065
|
|
},
|
|
{
|
|
"entropy": 6.350008344650268,
|
|
"epoch": 2.3162146566647435,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004471706462005371,
|
|
"loss": 5.6954,
|
|
"mean_token_accuracy": 0.19643843322992324,
|
|
"num_tokens": 50866566.0,
|
|
"step": 20070
|
|
},
|
|
{
|
|
"entropy": 6.212463426589966,
|
|
"epoch": 2.316791690709752,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004471440777602059,
|
|
"loss": 5.6575,
|
|
"mean_token_accuracy": 0.20321660935878755,
|
|
"num_tokens": 50879695.0,
|
|
"step": 20075
|
|
},
|
|
{
|
|
"entropy": 6.194079113006592,
|
|
"epoch": 2.3173687247547603,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00044711750352989407,
|
|
"loss": 5.5996,
|
|
"mean_token_accuracy": 0.20679421722888947,
|
|
"num_tokens": 50892350.0,
|
|
"step": 20080
|
|
},
|
|
{
|
|
"entropy": 6.2928242683410645,
|
|
"epoch": 2.317945758799769,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004470909235104956,
|
|
"loss": 5.7393,
|
|
"mean_token_accuracy": 0.2002371221780777,
|
|
"num_tokens": 50905899.0,
|
|
"step": 20085
|
|
},
|
|
{
|
|
"entropy": 6.287396478652954,
|
|
"epoch": 2.318522792844778,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004470643377029043,
|
|
"loss": 5.6599,
|
|
"mean_token_accuracy": 0.20983583927154542,
|
|
"num_tokens": 50919698.0,
|
|
"step": 20090
|
|
},
|
|
{
|
|
"entropy": 6.309205389022827,
|
|
"epoch": 2.3190998268897864,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004470377461080145,
|
|
"loss": 5.744,
|
|
"mean_token_accuracy": 0.20514176189899444,
|
|
"num_tokens": 50932236.0,
|
|
"step": 20095
|
|
},
|
|
{
|
|
"entropy": 6.264718341827392,
|
|
"epoch": 2.3196768609347953,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004470111487267206,
|
|
"loss": 5.6731,
|
|
"mean_token_accuracy": 0.20396852046251296,
|
|
"num_tokens": 50945403.0,
|
|
"step": 20100
|
|
},
|
|
{
|
|
"entropy": 6.269400930404663,
|
|
"epoch": 2.3202538949798037,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004469845455599171,
|
|
"loss": 5.6767,
|
|
"mean_token_accuracy": 0.19957065880298613,
|
|
"num_tokens": 50958854.0,
|
|
"step": 20105
|
|
},
|
|
{
|
|
"entropy": 6.345641183853149,
|
|
"epoch": 2.3208309290248126,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004469579366084989,
|
|
"loss": 5.7477,
|
|
"mean_token_accuracy": 0.19639746844768524,
|
|
"num_tokens": 50971545.0,
|
|
"step": 20110
|
|
},
|
|
{
|
|
"entropy": 6.304386758804322,
|
|
"epoch": 2.321407963069821,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00044693132187336094,
|
|
"loss": 5.7429,
|
|
"mean_token_accuracy": 0.19700338542461396,
|
|
"num_tokens": 50985282.0,
|
|
"step": 20115
|
|
},
|
|
{
|
|
"entropy": 6.257296991348267,
|
|
"epoch": 2.32198499711483,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004469047013553983,
|
|
"loss": 5.6737,
|
|
"mean_token_accuracy": 0.20432363003492354,
|
|
"num_tokens": 50998063.0,
|
|
"step": 20120
|
|
},
|
|
{
|
|
"entropy": 6.239012908935547,
|
|
"epoch": 2.3225620311598383,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00044687807505550646,
|
|
"loss": 5.6595,
|
|
"mean_token_accuracy": 0.20608614087104798,
|
|
"num_tokens": 51011413.0,
|
|
"step": 20125
|
|
},
|
|
{
|
|
"entropy": 6.223509073257446,
|
|
"epoch": 2.323139065204847,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00044685144297458096,
|
|
"loss": 5.6548,
|
|
"mean_token_accuracy": 0.20884050726890563,
|
|
"num_tokens": 51023861.0,
|
|
"step": 20130
|
|
},
|
|
{
|
|
"entropy": 6.280037975311279,
|
|
"epoch": 2.3237160992498556,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00044682480511351754,
|
|
"loss": 5.6432,
|
|
"mean_token_accuracy": 0.20675942450761794,
|
|
"num_tokens": 51035891.0,
|
|
"step": 20135
|
|
},
|
|
{
|
|
"entropy": 6.2503454208374025,
|
|
"epoch": 2.3242931332948644,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004467981614732121,
|
|
"loss": 5.6414,
|
|
"mean_token_accuracy": 0.2052238777279854,
|
|
"num_tokens": 51048115.0,
|
|
"step": 20140
|
|
},
|
|
{
|
|
"entropy": 6.263721990585327,
|
|
"epoch": 2.3248701673398733,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00044677151205456086,
|
|
"loss": 5.6669,
|
|
"mean_token_accuracy": 0.19978864639997482,
|
|
"num_tokens": 51061503.0,
|
|
"step": 20145
|
|
},
|
|
{
|
|
"entropy": 6.283975648880005,
|
|
"epoch": 2.3254472013848817,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004467448568584601,
|
|
"loss": 5.7173,
|
|
"mean_token_accuracy": 0.2011381208896637,
|
|
"num_tokens": 51074052.0,
|
|
"step": 20150
|
|
},
|
|
{
|
|
"entropy": 6.3093095302581785,
|
|
"epoch": 2.32602423542989,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004467181958858064,
|
|
"loss": 5.7431,
|
|
"mean_token_accuracy": 0.20208009481430053,
|
|
"num_tokens": 51089456.0,
|
|
"step": 20155
|
|
},
|
|
{
|
|
"entropy": 6.306753873825073,
|
|
"epoch": 2.326601269474899,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004466915291374965,
|
|
"loss": 5.7069,
|
|
"mean_token_accuracy": 0.19960661828517914,
|
|
"num_tokens": 51102835.0,
|
|
"step": 20160
|
|
},
|
|
{
|
|
"entropy": 6.306112909317017,
|
|
"epoch": 2.327178303519908,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004466648566144273,
|
|
"loss": 5.7314,
|
|
"mean_token_accuracy": 0.19776588380336763,
|
|
"num_tokens": 51115472.0,
|
|
"step": 20165
|
|
},
|
|
{
|
|
"entropy": 6.299116325378418,
|
|
"epoch": 2.3277553375649163,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000446638178317496,
|
|
"loss": 5.6569,
|
|
"mean_token_accuracy": 0.2033730775117874,
|
|
"num_tokens": 51129768.0,
|
|
"step": 20170
|
|
},
|
|
{
|
|
"entropy": 6.275330448150635,
|
|
"epoch": 2.328332371609925,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00044661149424759974,
|
|
"loss": 5.6706,
|
|
"mean_token_accuracy": 0.20418451279401778,
|
|
"num_tokens": 51143517.0,
|
|
"step": 20175
|
|
},
|
|
{
|
|
"entropy": 6.206835556030273,
|
|
"epoch": 2.3289094056549335,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004465848044056361,
|
|
"loss": 5.5095,
|
|
"mean_token_accuracy": 0.21552657186985016,
|
|
"num_tokens": 51157235.0,
|
|
"step": 20180
|
|
},
|
|
{
|
|
"entropy": 6.281242322921753,
|
|
"epoch": 2.3294864396999424,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004465581087925028,
|
|
"loss": 5.6846,
|
|
"mean_token_accuracy": 0.20341511964797973,
|
|
"num_tokens": 51169061.0,
|
|
"step": 20185
|
|
},
|
|
{
|
|
"entropy": 6.2411112785339355,
|
|
"epoch": 2.330063473744951,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004465314074090978,
|
|
"loss": 5.6873,
|
|
"mean_token_accuracy": 0.19719644337892533,
|
|
"num_tokens": 51181063.0,
|
|
"step": 20190
|
|
},
|
|
{
|
|
"entropy": 6.25082573890686,
|
|
"epoch": 2.3306405077899597,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00044650470025631904,
|
|
"loss": 5.6214,
|
|
"mean_token_accuracy": 0.20618860125541688,
|
|
"num_tokens": 51193536.0,
|
|
"step": 20195
|
|
},
|
|
{
|
|
"entropy": 6.234523773193359,
|
|
"epoch": 2.331217541834968,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004464779873350649,
|
|
"loss": 5.6142,
|
|
"mean_token_accuracy": 0.21316068172454833,
|
|
"num_tokens": 51205960.0,
|
|
"step": 20200
|
|
},
|
|
{
|
|
"entropy": 6.296325969696045,
|
|
"epoch": 2.331794575879977,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004464512686462339,
|
|
"loss": 5.7834,
|
|
"mean_token_accuracy": 0.20003315955400466,
|
|
"num_tokens": 51219227.0,
|
|
"step": 20205
|
|
},
|
|
{
|
|
"entropy": 6.323716688156128,
|
|
"epoch": 2.3323716099249854,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00044642454419072455,
|
|
"loss": 5.6514,
|
|
"mean_token_accuracy": 0.2024744465947151,
|
|
"num_tokens": 51232781.0,
|
|
"step": 20210
|
|
},
|
|
{
|
|
"entropy": 6.2382483959198,
|
|
"epoch": 2.3329486439699942,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004463978139694358,
|
|
"loss": 5.6744,
|
|
"mean_token_accuracy": 0.20180849730968475,
|
|
"num_tokens": 51245574.0,
|
|
"step": 20215
|
|
},
|
|
{
|
|
"entropy": 6.261038494110108,
|
|
"epoch": 2.333525678015003,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00044637107798326675,
|
|
"loss": 5.7009,
|
|
"mean_token_accuracy": 0.1989492028951645,
|
|
"num_tokens": 51258710.0,
|
|
"step": 20220
|
|
},
|
|
{
|
|
"entropy": 6.362938356399536,
|
|
"epoch": 2.3341027120600115,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004463443362331166,
|
|
"loss": 5.7797,
|
|
"mean_token_accuracy": 0.20133419930934907,
|
|
"num_tokens": 51270382.0,
|
|
"step": 20225
|
|
},
|
|
{
|
|
"entropy": 6.2769464492797855,
|
|
"epoch": 2.3346797461050204,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00044631758871988486,
|
|
"loss": 5.7646,
|
|
"mean_token_accuracy": 0.19585290253162385,
|
|
"num_tokens": 51283923.0,
|
|
"step": 20230
|
|
},
|
|
{
|
|
"entropy": 6.329458999633789,
|
|
"epoch": 2.335256780150029,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004462908354444711,
|
|
"loss": 5.7254,
|
|
"mean_token_accuracy": 0.1990818738937378,
|
|
"num_tokens": 51297671.0,
|
|
"step": 20235
|
|
},
|
|
{
|
|
"entropy": 6.3086357593536375,
|
|
"epoch": 2.3358338141950377,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004462640764077751,
|
|
"loss": 5.6835,
|
|
"mean_token_accuracy": 0.2007381275296211,
|
|
"num_tokens": 51309339.0,
|
|
"step": 20240
|
|
},
|
|
{
|
|
"entropy": 6.273665523529052,
|
|
"epoch": 2.336410848240046,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004462373116106971,
|
|
"loss": 5.7941,
|
|
"mean_token_accuracy": 0.1993747517466545,
|
|
"num_tokens": 51321479.0,
|
|
"step": 20245
|
|
},
|
|
{
|
|
"entropy": 6.256979846954346,
|
|
"epoch": 2.336987882285055,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00044621054105413704,
|
|
"loss": 5.7192,
|
|
"mean_token_accuracy": 0.19843647629022598,
|
|
"num_tokens": 51335135.0,
|
|
"step": 20250
|
|
},
|
|
{
|
|
"entropy": 6.226361513137817,
|
|
"epoch": 2.3375649163300634,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00044618376473899555,
|
|
"loss": 5.6681,
|
|
"mean_token_accuracy": 0.20416603982448578,
|
|
"num_tokens": 51346556.0,
|
|
"step": 20255
|
|
},
|
|
{
|
|
"entropy": 6.18687252998352,
|
|
"epoch": 2.338141950375072,
|
|
"grad_norm": 1.734375,
|
|
"learning_rate": 0.0004461569826661732,
|
|
"loss": 5.5636,
|
|
"mean_token_accuracy": 0.21304285377264023,
|
|
"num_tokens": 51359692.0,
|
|
"step": 20260
|
|
},
|
|
{
|
|
"entropy": 6.295094442367554,
|
|
"epoch": 2.3387189844200806,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004461301948365707,
|
|
"loss": 5.6772,
|
|
"mean_token_accuracy": 0.19782449454069137,
|
|
"num_tokens": 51371682.0,
|
|
"step": 20265
|
|
},
|
|
{
|
|
"entropy": 6.272954797744751,
|
|
"epoch": 2.3392960184650895,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004461034012510891,
|
|
"loss": 5.725,
|
|
"mean_token_accuracy": 0.20265191793441772,
|
|
"num_tokens": 51383533.0,
|
|
"step": 20270
|
|
},
|
|
{
|
|
"entropy": 6.267000722885132,
|
|
"epoch": 2.339873052510098,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00044607660191062963,
|
|
"loss": 5.6615,
|
|
"mean_token_accuracy": 0.20510787516832352,
|
|
"num_tokens": 51395696.0,
|
|
"step": 20275
|
|
},
|
|
{
|
|
"entropy": 6.215906572341919,
|
|
"epoch": 2.340450086555107,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00044604979681609364,
|
|
"loss": 5.6255,
|
|
"mean_token_accuracy": 0.20820956826210021,
|
|
"num_tokens": 51408460.0,
|
|
"step": 20280
|
|
},
|
|
{
|
|
"entropy": 6.187142848968506,
|
|
"epoch": 2.341027120600115,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00044602298596838264,
|
|
"loss": 5.619,
|
|
"mean_token_accuracy": 0.20651773512363433,
|
|
"num_tokens": 51420768.0,
|
|
"step": 20285
|
|
},
|
|
{
|
|
"entropy": 6.261281728744507,
|
|
"epoch": 2.341604154645124,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00044599616936839853,
|
|
"loss": 5.6743,
|
|
"mean_token_accuracy": 0.20559660345315933,
|
|
"num_tokens": 51434429.0,
|
|
"step": 20290
|
|
},
|
|
{
|
|
"entropy": 6.310505104064942,
|
|
"epoch": 2.342181188690133,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004459693470170432,
|
|
"loss": 5.7352,
|
|
"mean_token_accuracy": 0.20220571756362915,
|
|
"num_tokens": 51447146.0,
|
|
"step": 20295
|
|
},
|
|
{
|
|
"entropy": 6.275731611251831,
|
|
"epoch": 2.3427582227351413,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004459425189152187,
|
|
"loss": 5.6227,
|
|
"mean_token_accuracy": 0.20923758745193483,
|
|
"num_tokens": 51458656.0,
|
|
"step": 20300
|
|
},
|
|
{
|
|
"entropy": 6.15320463180542,
|
|
"epoch": 2.34333525678015,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00044591568506382757,
|
|
"loss": 5.5173,
|
|
"mean_token_accuracy": 0.21781913489103316,
|
|
"num_tokens": 51473350.0,
|
|
"step": 20305
|
|
},
|
|
{
|
|
"entropy": 6.280113744735718,
|
|
"epoch": 2.3439122908251586,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00044588884546377226,
|
|
"loss": 5.6646,
|
|
"mean_token_accuracy": 0.2047184869647026,
|
|
"num_tokens": 51486801.0,
|
|
"step": 20310
|
|
},
|
|
{
|
|
"entropy": 6.246380805969238,
|
|
"epoch": 2.3444893248701675,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004458620001159555,
|
|
"loss": 5.6899,
|
|
"mean_token_accuracy": 0.2027744859457016,
|
|
"num_tokens": 51499217.0,
|
|
"step": 20315
|
|
},
|
|
{
|
|
"entropy": 6.26472282409668,
|
|
"epoch": 2.345066358915176,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004458351490212803,
|
|
"loss": 5.7649,
|
|
"mean_token_accuracy": 0.19978072494268417,
|
|
"num_tokens": 51511714.0,
|
|
"step": 20320
|
|
},
|
|
{
|
|
"entropy": 6.229470682144165,
|
|
"epoch": 2.3456433929601848,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00044580829218064964,
|
|
"loss": 5.6106,
|
|
"mean_token_accuracy": 0.20698875188827515,
|
|
"num_tokens": 51522725.0,
|
|
"step": 20325
|
|
},
|
|
{
|
|
"entropy": 6.3298228740692135,
|
|
"epoch": 2.346220427005193,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000445781429594967,
|
|
"loss": 5.6844,
|
|
"mean_token_accuracy": 0.20495259165763854,
|
|
"num_tokens": 51535178.0,
|
|
"step": 20330
|
|
},
|
|
{
|
|
"entropy": 6.310057067871094,
|
|
"epoch": 2.346797461050202,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004457545612651357,
|
|
"loss": 5.7986,
|
|
"mean_token_accuracy": 0.1921558916568756,
|
|
"num_tokens": 51546859.0,
|
|
"step": 20335
|
|
},
|
|
{
|
|
"entropy": 6.307834815979004,
|
|
"epoch": 2.3473744950952105,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00044572768719205964,
|
|
"loss": 5.6828,
|
|
"mean_token_accuracy": 0.20095667690038682,
|
|
"num_tokens": 51558719.0,
|
|
"step": 20340
|
|
},
|
|
{
|
|
"entropy": 6.312375783920288,
|
|
"epoch": 2.3479515291402193,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00044570080737664264,
|
|
"loss": 5.7476,
|
|
"mean_token_accuracy": 0.1949980840086937,
|
|
"num_tokens": 51570630.0,
|
|
"step": 20345
|
|
},
|
|
{
|
|
"entropy": 6.309825801849366,
|
|
"epoch": 2.3485285631852277,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00044567392181978874,
|
|
"loss": 5.6623,
|
|
"mean_token_accuracy": 0.1984606221318245,
|
|
"num_tokens": 51583463.0,
|
|
"step": 20350
|
|
},
|
|
{
|
|
"entropy": 6.279160451889038,
|
|
"epoch": 2.3491055972302366,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00044564703052240223,
|
|
"loss": 5.7259,
|
|
"mean_token_accuracy": 0.19899120777845383,
|
|
"num_tokens": 51597090.0,
|
|
"step": 20355
|
|
},
|
|
{
|
|
"entropy": 6.219781351089478,
|
|
"epoch": 2.349682631275245,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004456201334853876,
|
|
"loss": 5.6265,
|
|
"mean_token_accuracy": 0.20903219729661943,
|
|
"num_tokens": 51609288.0,
|
|
"step": 20360
|
|
},
|
|
{
|
|
"entropy": 6.171813535690307,
|
|
"epoch": 2.350259665320254,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00044559323070964956,
|
|
"loss": 5.611,
|
|
"mean_token_accuracy": 0.2132205694913864,
|
|
"num_tokens": 51622269.0,
|
|
"step": 20365
|
|
},
|
|
{
|
|
"entropy": 6.281157636642456,
|
|
"epoch": 2.3508366993652627,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000445566322196093,
|
|
"loss": 5.7412,
|
|
"mean_token_accuracy": 0.19239043891429902,
|
|
"num_tokens": 51634222.0,
|
|
"step": 20370
|
|
},
|
|
{
|
|
"entropy": 6.292509889602661,
|
|
"epoch": 2.351413733410271,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004455394079456228,
|
|
"loss": 5.7057,
|
|
"mean_token_accuracy": 0.19713842421770095,
|
|
"num_tokens": 51646933.0,
|
|
"step": 20375
|
|
},
|
|
{
|
|
"entropy": 6.2920444965362545,
|
|
"epoch": 2.35199076745528,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00044551248795914446,
|
|
"loss": 5.6773,
|
|
"mean_token_accuracy": 0.20137425810098647,
|
|
"num_tokens": 51658987.0,
|
|
"step": 20380
|
|
},
|
|
{
|
|
"entropy": 6.240331506729126,
|
|
"epoch": 2.3525678015002884,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004454855622375632,
|
|
"loss": 5.7234,
|
|
"mean_token_accuracy": 0.20117460191249847,
|
|
"num_tokens": 51669513.0,
|
|
"step": 20385
|
|
},
|
|
{
|
|
"entropy": 6.302077150344848,
|
|
"epoch": 2.3531448355452973,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004454586307817848,
|
|
"loss": 5.6721,
|
|
"mean_token_accuracy": 0.20111125260591506,
|
|
"num_tokens": 51682084.0,
|
|
"step": 20390
|
|
},
|
|
{
|
|
"entropy": 6.271924304962158,
|
|
"epoch": 2.3537218695903057,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.000445431693592715,
|
|
"loss": 5.7122,
|
|
"mean_token_accuracy": 0.20097984075546266,
|
|
"num_tokens": 51695335.0,
|
|
"step": 20395
|
|
},
|
|
{
|
|
"entropy": 6.301687812805175,
|
|
"epoch": 2.3542989036353146,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004454047506712598,
|
|
"loss": 5.7827,
|
|
"mean_token_accuracy": 0.19593358039855957,
|
|
"num_tokens": 51707856.0,
|
|
"step": 20400
|
|
},
|
|
{
|
|
"entropy": 6.273509550094604,
|
|
"epoch": 2.354875937680323,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00044537780201832545,
|
|
"loss": 5.677,
|
|
"mean_token_accuracy": 0.1995402529835701,
|
|
"num_tokens": 51719716.0,
|
|
"step": 20405
|
|
},
|
|
{
|
|
"entropy": 6.19102635383606,
|
|
"epoch": 2.355452971725332,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004453508476348184,
|
|
"loss": 5.6402,
|
|
"mean_token_accuracy": 0.21555724292993544,
|
|
"num_tokens": 51733263.0,
|
|
"step": 20410
|
|
},
|
|
{
|
|
"entropy": 6.248130130767822,
|
|
"epoch": 2.3560300057703403,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004453238875216452,
|
|
"loss": 5.6175,
|
|
"mean_token_accuracy": 0.20646194070577623,
|
|
"num_tokens": 51745143.0,
|
|
"step": 20415
|
|
},
|
|
{
|
|
"entropy": 6.306704330444336,
|
|
"epoch": 2.356607039815349,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004452969216797127,
|
|
"loss": 5.7435,
|
|
"mean_token_accuracy": 0.19763799011707306,
|
|
"num_tokens": 51757155.0,
|
|
"step": 20420
|
|
},
|
|
{
|
|
"entropy": 6.18883695602417,
|
|
"epoch": 2.357184073860358,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004452699501099277,
|
|
"loss": 5.6381,
|
|
"mean_token_accuracy": 0.20822127610445024,
|
|
"num_tokens": 51769170.0,
|
|
"step": 20425
|
|
},
|
|
{
|
|
"entropy": 6.280981349945068,
|
|
"epoch": 2.3577611079053664,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00044524297281319766,
|
|
"loss": 5.7259,
|
|
"mean_token_accuracy": 0.1986905887722969,
|
|
"num_tokens": 51781254.0,
|
|
"step": 20430
|
|
},
|
|
{
|
|
"entropy": 6.318002128601075,
|
|
"epoch": 2.358338141950375,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00044521598979042963,
|
|
"loss": 5.7523,
|
|
"mean_token_accuracy": 0.1985146164894104,
|
|
"num_tokens": 51793425.0,
|
|
"step": 20435
|
|
},
|
|
{
|
|
"entropy": 6.250660800933838,
|
|
"epoch": 2.3589151759953837,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00044518900104253154,
|
|
"loss": 5.6707,
|
|
"mean_token_accuracy": 0.20157449394464494,
|
|
"num_tokens": 51806196.0,
|
|
"step": 20440
|
|
},
|
|
{
|
|
"entropy": 6.210059547424317,
|
|
"epoch": 2.3594922100403926,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004451620065704108,
|
|
"loss": 5.6892,
|
|
"mean_token_accuracy": 0.20226312130689622,
|
|
"num_tokens": 51819137.0,
|
|
"step": 20445
|
|
},
|
|
{
|
|
"entropy": 6.339330101013184,
|
|
"epoch": 2.360069244085401,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00044513500637497546,
|
|
"loss": 5.7755,
|
|
"mean_token_accuracy": 0.19646340757608413,
|
|
"num_tokens": 51830924.0,
|
|
"step": 20450
|
|
},
|
|
{
|
|
"entropy": 6.3239030838012695,
|
|
"epoch": 2.36064627813041,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00044510800045713373,
|
|
"loss": 5.66,
|
|
"mean_token_accuracy": 0.19947621822357178,
|
|
"num_tokens": 51843503.0,
|
|
"step": 20455
|
|
},
|
|
{
|
|
"entropy": 6.277648830413819,
|
|
"epoch": 2.3612233121754183,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00044508098881779396,
|
|
"loss": 5.7303,
|
|
"mean_token_accuracy": 0.19973205924034118,
|
|
"num_tokens": 51855818.0,
|
|
"step": 20460
|
|
},
|
|
{
|
|
"entropy": 6.27275915145874,
|
|
"epoch": 2.361800346220427,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004450539714578645,
|
|
"loss": 5.6837,
|
|
"mean_token_accuracy": 0.20204851776361465,
|
|
"num_tokens": 51867033.0,
|
|
"step": 20465
|
|
},
|
|
{
|
|
"entropy": 6.309321117401123,
|
|
"epoch": 2.3623773802654355,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004450269483782543,
|
|
"loss": 5.6707,
|
|
"mean_token_accuracy": 0.2012152075767517,
|
|
"num_tokens": 51880845.0,
|
|
"step": 20470
|
|
},
|
|
{
|
|
"entropy": 6.276156616210938,
|
|
"epoch": 2.3629544143104444,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004449999195798721,
|
|
"loss": 5.7645,
|
|
"mean_token_accuracy": 0.1931744247674942,
|
|
"num_tokens": 51893761.0,
|
|
"step": 20475
|
|
},
|
|
{
|
|
"entropy": 6.266883802413941,
|
|
"epoch": 2.363531448355453,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00044497288506362706,
|
|
"loss": 5.6604,
|
|
"mean_token_accuracy": 0.20568044781684874,
|
|
"num_tokens": 51907478.0,
|
|
"step": 20480
|
|
},
|
|
{
|
|
"entropy": 6.320327377319336,
|
|
"epoch": 2.3641084824004617,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004449458448304284,
|
|
"loss": 5.6667,
|
|
"mean_token_accuracy": 0.21099235564470292,
|
|
"num_tokens": 51919242.0,
|
|
"step": 20485
|
|
},
|
|
{
|
|
"entropy": 6.3270317077636715,
|
|
"epoch": 2.36468551644547,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00044491879888118574,
|
|
"loss": 5.7595,
|
|
"mean_token_accuracy": 0.19944236427545547,
|
|
"num_tokens": 51930791.0,
|
|
"step": 20490
|
|
},
|
|
{
|
|
"entropy": 6.123858451843262,
|
|
"epoch": 2.365262550490479,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004448917472168087,
|
|
"loss": 5.5088,
|
|
"mean_token_accuracy": 0.21103607267141342,
|
|
"num_tokens": 51943848.0,
|
|
"step": 20495
|
|
},
|
|
{
|
|
"entropy": 6.274829006195068,
|
|
"epoch": 2.365839584535488,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00044486468983820707,
|
|
"loss": 5.7413,
|
|
"mean_token_accuracy": 0.19155209511518478,
|
|
"num_tokens": 51956648.0,
|
|
"step": 20500
|
|
},
|
|
{
|
|
"entropy": 6.305342388153076,
|
|
"epoch": 2.3664166185804962,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.000444837626746291,
|
|
"loss": 5.6963,
|
|
"mean_token_accuracy": 0.20333817601203918,
|
|
"num_tokens": 51969068.0,
|
|
"step": 20505
|
|
},
|
|
{
|
|
"entropy": 6.26474609375,
|
|
"epoch": 2.366993652625505,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004448105579419707,
|
|
"loss": 5.6934,
|
|
"mean_token_accuracy": 0.2022864505648613,
|
|
"num_tokens": 51981856.0,
|
|
"step": 20510
|
|
},
|
|
{
|
|
"entropy": 6.335216236114502,
|
|
"epoch": 2.3675706866705135,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004447834834261567,
|
|
"loss": 5.7573,
|
|
"mean_token_accuracy": 0.19250386953353882,
|
|
"num_tokens": 51994428.0,
|
|
"step": 20515
|
|
},
|
|
{
|
|
"entropy": 6.23250002861023,
|
|
"epoch": 2.3681477207155224,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004447564031997595,
|
|
"loss": 5.5865,
|
|
"mean_token_accuracy": 0.21269481927156447,
|
|
"num_tokens": 52007875.0,
|
|
"step": 20520
|
|
},
|
|
{
|
|
"entropy": 6.257858562469482,
|
|
"epoch": 2.368724754760531,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00044472931726369,
|
|
"loss": 5.5938,
|
|
"mean_token_accuracy": 0.20823481380939485,
|
|
"num_tokens": 52020876.0,
|
|
"step": 20525
|
|
},
|
|
{
|
|
"entropy": 6.346431732177734,
|
|
"epoch": 2.3693017888055397,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.00044470222561885926,
|
|
"loss": 5.7454,
|
|
"mean_token_accuracy": 0.19151533842086793,
|
|
"num_tokens": 52032056.0,
|
|
"step": 20530
|
|
},
|
|
{
|
|
"entropy": 6.249010372161865,
|
|
"epoch": 2.369878822850548,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00044467512826617845,
|
|
"loss": 5.6792,
|
|
"mean_token_accuracy": 0.19966776221990584,
|
|
"num_tokens": 52044488.0,
|
|
"step": 20535
|
|
},
|
|
{
|
|
"entropy": 6.271060562133789,
|
|
"epoch": 2.370455856895557,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00044464802520655897,
|
|
"loss": 5.749,
|
|
"mean_token_accuracy": 0.1937350869178772,
|
|
"num_tokens": 52056186.0,
|
|
"step": 20540
|
|
},
|
|
{
|
|
"entropy": 6.317001819610596,
|
|
"epoch": 2.3710328909405654,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004446209164409124,
|
|
"loss": 5.6653,
|
|
"mean_token_accuracy": 0.20406524538993837,
|
|
"num_tokens": 52068218.0,
|
|
"step": 20545
|
|
},
|
|
{
|
|
"entropy": 6.200478410720825,
|
|
"epoch": 2.371609924985574,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004445938019701506,
|
|
"loss": 5.6092,
|
|
"mean_token_accuracy": 0.21559022963047028,
|
|
"num_tokens": 52081854.0,
|
|
"step": 20550
|
|
},
|
|
{
|
|
"entropy": 6.200952386856079,
|
|
"epoch": 2.3721869590305826,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004445666817951855,
|
|
"loss": 5.6137,
|
|
"mean_token_accuracy": 0.20615407526493074,
|
|
"num_tokens": 52094022.0,
|
|
"step": 20555
|
|
},
|
|
{
|
|
"entropy": 6.251945877075196,
|
|
"epoch": 2.3727639930755915,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004445395559169293,
|
|
"loss": 5.6581,
|
|
"mean_token_accuracy": 0.2025573045015335,
|
|
"num_tokens": 52105677.0,
|
|
"step": 20560
|
|
},
|
|
{
|
|
"entropy": 6.342857313156128,
|
|
"epoch": 2.3733410271206,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004445124243362943,
|
|
"loss": 5.7209,
|
|
"mean_token_accuracy": 0.19989970624446868,
|
|
"num_tokens": 52118039.0,
|
|
"step": 20565
|
|
},
|
|
{
|
|
"entropy": 6.2887485980987545,
|
|
"epoch": 2.3739180611656088,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004444852870541932,
|
|
"loss": 5.6851,
|
|
"mean_token_accuracy": 0.20365866869688035,
|
|
"num_tokens": 52131519.0,
|
|
"step": 20570
|
|
},
|
|
{
|
|
"entropy": 6.292483949661255,
|
|
"epoch": 2.3744950952106176,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004444581440715386,
|
|
"loss": 5.7147,
|
|
"mean_token_accuracy": 0.19802933037281037,
|
|
"num_tokens": 52143240.0,
|
|
"step": 20575
|
|
},
|
|
{
|
|
"entropy": 6.233852577209473,
|
|
"epoch": 2.375072129255626,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00044443099538924347,
|
|
"loss": 5.6081,
|
|
"mean_token_accuracy": 0.20580997467041015,
|
|
"num_tokens": 52155977.0,
|
|
"step": 20580
|
|
},
|
|
{
|
|
"entropy": 6.2496278285980225,
|
|
"epoch": 2.375649163300635,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004444038410082211,
|
|
"loss": 5.6534,
|
|
"mean_token_accuracy": 0.2096467509865761,
|
|
"num_tokens": 52169388.0,
|
|
"step": 20585
|
|
},
|
|
{
|
|
"entropy": 6.230743551254273,
|
|
"epoch": 2.3762261973456433,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004443766809293846,
|
|
"loss": 5.6276,
|
|
"mean_token_accuracy": 0.20324479788541794,
|
|
"num_tokens": 52181830.0,
|
|
"step": 20590
|
|
},
|
|
{
|
|
"entropy": 6.186213684082031,
|
|
"epoch": 2.376803231390652,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004443495151536475,
|
|
"loss": 5.6136,
|
|
"mean_token_accuracy": 0.20966268330812454,
|
|
"num_tokens": 52194255.0,
|
|
"step": 20595
|
|
},
|
|
{
|
|
"entropy": 6.273720645904541,
|
|
"epoch": 2.3773802654356606,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004443223436819237,
|
|
"loss": 5.7053,
|
|
"mean_token_accuracy": 0.19739032685756683,
|
|
"num_tokens": 52205646.0,
|
|
"step": 20600
|
|
},
|
|
{
|
|
"entropy": 6.291301012039185,
|
|
"epoch": 2.3779572994806695,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00044429516651512687,
|
|
"loss": 5.6598,
|
|
"mean_token_accuracy": 0.20497027933597564,
|
|
"num_tokens": 52217519.0,
|
|
"step": 20605
|
|
},
|
|
{
|
|
"entropy": 6.243464994430542,
|
|
"epoch": 2.378534333525678,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00044426798365417133,
|
|
"loss": 5.6906,
|
|
"mean_token_accuracy": 0.20207190364599228,
|
|
"num_tokens": 52230139.0,
|
|
"step": 20610
|
|
},
|
|
{
|
|
"entropy": 6.26615309715271,
|
|
"epoch": 2.3791113675706868,
|
|
"grad_norm": 1.8359375,
|
|
"learning_rate": 0.00044424079509997104,
|
|
"loss": 5.7295,
|
|
"mean_token_accuracy": 0.20137403905391693,
|
|
"num_tokens": 52244049.0,
|
|
"step": 20615
|
|
},
|
|
{
|
|
"entropy": 6.293638372421265,
|
|
"epoch": 2.379688401615695,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004442136008534409,
|
|
"loss": 5.6727,
|
|
"mean_token_accuracy": 0.20594702959060668,
|
|
"num_tokens": 52257180.0,
|
|
"step": 20620
|
|
},
|
|
{
|
|
"entropy": 6.24235258102417,
|
|
"epoch": 2.380265435660704,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00044418640091549525,
|
|
"loss": 5.6548,
|
|
"mean_token_accuracy": 0.20861252397298813,
|
|
"num_tokens": 52270260.0,
|
|
"step": 20625
|
|
},
|
|
{
|
|
"entropy": 6.227157783508301,
|
|
"epoch": 2.3808424697057124,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000444159195287049,
|
|
"loss": 5.6543,
|
|
"mean_token_accuracy": 0.20346338003873826,
|
|
"num_tokens": 52282335.0,
|
|
"step": 20630
|
|
},
|
|
{
|
|
"entropy": 6.2641314506530765,
|
|
"epoch": 2.3814195037507213,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004441319839690173,
|
|
"loss": 5.6318,
|
|
"mean_token_accuracy": 0.20761382728815078,
|
|
"num_tokens": 52296547.0,
|
|
"step": 20635
|
|
},
|
|
{
|
|
"entropy": 6.274429273605347,
|
|
"epoch": 2.3819965377957297,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004441047669623153,
|
|
"loss": 5.7007,
|
|
"mean_token_accuracy": 0.19969301372766496,
|
|
"num_tokens": 52309523.0,
|
|
"step": 20640
|
|
},
|
|
{
|
|
"entropy": 6.261510848999023,
|
|
"epoch": 2.3825735718407386,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00044407754426785845,
|
|
"loss": 5.6465,
|
|
"mean_token_accuracy": 0.21056678593158723,
|
|
"num_tokens": 52322476.0,
|
|
"step": 20645
|
|
},
|
|
{
|
|
"entropy": 6.191774082183838,
|
|
"epoch": 2.3831506058857475,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004440503158865625,
|
|
"loss": 5.6031,
|
|
"mean_token_accuracy": 0.20663601756095887,
|
|
"num_tokens": 52335919.0,
|
|
"step": 20650
|
|
},
|
|
{
|
|
"entropy": 6.260403728485107,
|
|
"epoch": 2.383727639930756,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00044402308181934295,
|
|
"loss": 5.6911,
|
|
"mean_token_accuracy": 0.2050690621137619,
|
|
"num_tokens": 52347636.0,
|
|
"step": 20655
|
|
},
|
|
{
|
|
"entropy": 6.317034482955933,
|
|
"epoch": 2.3843046739757647,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004439958420671162,
|
|
"loss": 5.6786,
|
|
"mean_token_accuracy": 0.20000161081552506,
|
|
"num_tokens": 52360181.0,
|
|
"step": 20660
|
|
},
|
|
{
|
|
"entropy": 6.254880428314209,
|
|
"epoch": 2.384881708020773,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00044396859663079814,
|
|
"loss": 5.6601,
|
|
"mean_token_accuracy": 0.2131296619772911,
|
|
"num_tokens": 52373525.0,
|
|
"step": 20665
|
|
},
|
|
{
|
|
"entropy": 6.20746111869812,
|
|
"epoch": 2.385458742065782,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00044394134551130533,
|
|
"loss": 5.6036,
|
|
"mean_token_accuracy": 0.20687361806631088,
|
|
"num_tokens": 52386252.0,
|
|
"step": 20670
|
|
},
|
|
{
|
|
"entropy": 6.233136701583862,
|
|
"epoch": 2.3860357761107904,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004439140887095542,
|
|
"loss": 5.662,
|
|
"mean_token_accuracy": 0.1992241472005844,
|
|
"num_tokens": 52398056.0,
|
|
"step": 20675
|
|
},
|
|
{
|
|
"entropy": 6.248224925994873,
|
|
"epoch": 2.3866128101557993,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00044388682622646165,
|
|
"loss": 5.6832,
|
|
"mean_token_accuracy": 0.20441022962331773,
|
|
"num_tokens": 52409861.0,
|
|
"step": 20680
|
|
},
|
|
{
|
|
"entropy": 6.205007266998291,
|
|
"epoch": 2.3871898442008077,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004438595580629446,
|
|
"loss": 5.6461,
|
|
"mean_token_accuracy": 0.20737055987119674,
|
|
"num_tokens": 52423252.0,
|
|
"step": 20685
|
|
},
|
|
{
|
|
"entropy": 6.254592943191528,
|
|
"epoch": 2.3877668782458166,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004438322842199202,
|
|
"loss": 5.6072,
|
|
"mean_token_accuracy": 0.2115780532360077,
|
|
"num_tokens": 52435950.0,
|
|
"step": 20690
|
|
},
|
|
{
|
|
"entropy": 6.291515111923218,
|
|
"epoch": 2.388343912290825,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004438050046983057,
|
|
"loss": 5.6623,
|
|
"mean_token_accuracy": 0.20793629735708236,
|
|
"num_tokens": 52449257.0,
|
|
"step": 20695
|
|
},
|
|
{
|
|
"entropy": 6.258818960189819,
|
|
"epoch": 2.388920946335834,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00044377771949901876,
|
|
"loss": 5.6852,
|
|
"mean_token_accuracy": 0.20355032831430436,
|
|
"num_tokens": 52461543.0,
|
|
"step": 20700
|
|
},
|
|
{
|
|
"entropy": 6.125908517837525,
|
|
"epoch": 2.3894979803808427,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00044375042862297703,
|
|
"loss": 5.6012,
|
|
"mean_token_accuracy": 0.20494010001420976,
|
|
"num_tokens": 52473752.0,
|
|
"step": 20705
|
|
},
|
|
{
|
|
"entropy": 6.346489143371582,
|
|
"epoch": 2.390075014425851,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00044372313207109856,
|
|
"loss": 5.7409,
|
|
"mean_token_accuracy": 0.1928962856531143,
|
|
"num_tokens": 52485885.0,
|
|
"step": 20710
|
|
},
|
|
{
|
|
"entropy": 6.292835807800293,
|
|
"epoch": 2.3906520484708595,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00044369582984430127,
|
|
"loss": 5.6892,
|
|
"mean_token_accuracy": 0.20104454159736634,
|
|
"num_tokens": 52498389.0,
|
|
"step": 20715
|
|
},
|
|
{
|
|
"entropy": 6.241178131103515,
|
|
"epoch": 2.3912290825158684,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00044366852194350354,
|
|
"loss": 5.6892,
|
|
"mean_token_accuracy": 0.20661631524562835,
|
|
"num_tokens": 52511176.0,
|
|
"step": 20720
|
|
},
|
|
{
|
|
"entropy": 6.2766162872314455,
|
|
"epoch": 2.3918061165608773,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004436412083696239,
|
|
"loss": 5.6704,
|
|
"mean_token_accuracy": 0.1999954655766487,
|
|
"num_tokens": 52523173.0,
|
|
"step": 20725
|
|
},
|
|
{
|
|
"entropy": 6.2250009059906,
|
|
"epoch": 2.3923831506058857,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00044361388912358095,
|
|
"loss": 5.6023,
|
|
"mean_token_accuracy": 0.20575390607118607,
|
|
"num_tokens": 52535776.0,
|
|
"step": 20730
|
|
},
|
|
{
|
|
"entropy": 6.0612109184265135,
|
|
"epoch": 2.3929601846508946,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004435865642062936,
|
|
"loss": 5.4344,
|
|
"mean_token_accuracy": 0.22326288521289825,
|
|
"num_tokens": 52549416.0,
|
|
"step": 20735
|
|
},
|
|
{
|
|
"entropy": 6.210688829421997,
|
|
"epoch": 2.393537218695903,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004435592336186809,
|
|
"loss": 5.6426,
|
|
"mean_token_accuracy": 0.20971183031797408,
|
|
"num_tokens": 52562300.0,
|
|
"step": 20740
|
|
},
|
|
{
|
|
"entropy": 6.315302419662475,
|
|
"epoch": 2.394114252740912,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004435318973616622,
|
|
"loss": 5.7355,
|
|
"mean_token_accuracy": 0.1986914187669754,
|
|
"num_tokens": 52573906.0,
|
|
"step": 20745
|
|
},
|
|
{
|
|
"entropy": 6.260455179214477,
|
|
"epoch": 2.3946912867859202,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00044350455543615665,
|
|
"loss": 5.6618,
|
|
"mean_token_accuracy": 0.20642436891794205,
|
|
"num_tokens": 52586138.0,
|
|
"step": 20750
|
|
},
|
|
{
|
|
"entropy": 6.289743185043335,
|
|
"epoch": 2.395268320830929,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004434772078430843,
|
|
"loss": 5.7052,
|
|
"mean_token_accuracy": 0.20260262489318848,
|
|
"num_tokens": 52599705.0,
|
|
"step": 20755
|
|
},
|
|
{
|
|
"entropy": 6.261003541946411,
|
|
"epoch": 2.3958453548759375,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004434498545833646,
|
|
"loss": 5.7523,
|
|
"mean_token_accuracy": 0.19939430058002472,
|
|
"num_tokens": 52612041.0,
|
|
"step": 20760
|
|
},
|
|
{
|
|
"entropy": 6.310602378845215,
|
|
"epoch": 2.3964223889209464,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004434224956579177,
|
|
"loss": 5.7021,
|
|
"mean_token_accuracy": 0.20172154903411865,
|
|
"num_tokens": 52625634.0,
|
|
"step": 20765
|
|
},
|
|
{
|
|
"entropy": 6.172333574295044,
|
|
"epoch": 2.396999422965955,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004433951310676639,
|
|
"loss": 5.5445,
|
|
"mean_token_accuracy": 0.21477589756250381,
|
|
"num_tokens": 52638706.0,
|
|
"step": 20770
|
|
},
|
|
{
|
|
"entropy": 6.18256368637085,
|
|
"epoch": 2.3975764570109637,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00044336776081352347,
|
|
"loss": 5.6921,
|
|
"mean_token_accuracy": 0.2102103739976883,
|
|
"num_tokens": 52650876.0,
|
|
"step": 20775
|
|
},
|
|
{
|
|
"entropy": 6.233721828460693,
|
|
"epoch": 2.3981534910559725,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00044334038489641706,
|
|
"loss": 5.6333,
|
|
"mean_token_accuracy": 0.20763159096240996,
|
|
"num_tokens": 52663664.0,
|
|
"step": 20780
|
|
},
|
|
{
|
|
"entropy": 6.34328670501709,
|
|
"epoch": 2.398730525100981,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00044331300331726544,
|
|
"loss": 5.7688,
|
|
"mean_token_accuracy": 0.19594075679779052,
|
|
"num_tokens": 52675870.0,
|
|
"step": 20785
|
|
},
|
|
{
|
|
"entropy": 6.2657371997833256,
|
|
"epoch": 2.3993075591459894,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00044328561607698947,
|
|
"loss": 5.6955,
|
|
"mean_token_accuracy": 0.19709624648094176,
|
|
"num_tokens": 52687029.0,
|
|
"step": 20790
|
|
},
|
|
{
|
|
"entropy": 6.190671730041504,
|
|
"epoch": 2.3998845931909982,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004432582231765105,
|
|
"loss": 5.5523,
|
|
"mean_token_accuracy": 0.20293704867362977,
|
|
"num_tokens": 52700242.0,
|
|
"step": 20795
|
|
},
|
|
{
|
|
"entropy": 6.263112306594849,
|
|
"epoch": 2.400461627236007,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00044323082461674974,
|
|
"loss": 5.6512,
|
|
"mean_token_accuracy": 0.2004449725151062,
|
|
"num_tokens": 52711561.0,
|
|
"step": 20800
|
|
},
|
|
{
|
|
"entropy": 6.163639688491822,
|
|
"epoch": 2.4010386612810155,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004432034203986287,
|
|
"loss": 5.5826,
|
|
"mean_token_accuracy": 0.20719403624534607,
|
|
"num_tokens": 52725101.0,
|
|
"step": 20805
|
|
},
|
|
{
|
|
"entropy": 6.299870204925537,
|
|
"epoch": 2.4016156953260244,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004431760105230693,
|
|
"loss": 5.7036,
|
|
"mean_token_accuracy": 0.19972139000892639,
|
|
"num_tokens": 52738315.0,
|
|
"step": 20810
|
|
},
|
|
{
|
|
"entropy": 6.311771631240845,
|
|
"epoch": 2.402192729371033,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00044314859499099325,
|
|
"loss": 5.768,
|
|
"mean_token_accuracy": 0.20132242143154144,
|
|
"num_tokens": 52752547.0,
|
|
"step": 20815
|
|
},
|
|
{
|
|
"entropy": 6.3200325012207035,
|
|
"epoch": 2.4027697634160416,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00044312117380332274,
|
|
"loss": 5.7677,
|
|
"mean_token_accuracy": 0.19519882798194885,
|
|
"num_tokens": 52765831.0,
|
|
"step": 20820
|
|
},
|
|
{
|
|
"entropy": 6.276677131652832,
|
|
"epoch": 2.40334679746105,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00044309374696098,
|
|
"loss": 5.6135,
|
|
"mean_token_accuracy": 0.2075101539492607,
|
|
"num_tokens": 52779144.0,
|
|
"step": 20825
|
|
},
|
|
{
|
|
"entropy": 6.27869553565979,
|
|
"epoch": 2.403923831506059,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004430663144648876,
|
|
"loss": 5.6549,
|
|
"mean_token_accuracy": 0.21143777966499328,
|
|
"num_tokens": 52790956.0,
|
|
"step": 20830
|
|
},
|
|
{
|
|
"entropy": 6.254818725585937,
|
|
"epoch": 2.4045008655510673,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00044303887631596823,
|
|
"loss": 5.6933,
|
|
"mean_token_accuracy": 0.2000236004590988,
|
|
"num_tokens": 52804057.0,
|
|
"step": 20835
|
|
},
|
|
{
|
|
"entropy": 6.275049161911011,
|
|
"epoch": 2.405077899596076,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004430114325151447,
|
|
"loss": 5.602,
|
|
"mean_token_accuracy": 0.20146780759096145,
|
|
"num_tokens": 52817197.0,
|
|
"step": 20840
|
|
},
|
|
{
|
|
"entropy": 6.312943840026856,
|
|
"epoch": 2.4056549336410846,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004429839830633401,
|
|
"loss": 5.6878,
|
|
"mean_token_accuracy": 0.20596786588430405,
|
|
"num_tokens": 52830162.0,
|
|
"step": 20845
|
|
},
|
|
{
|
|
"entropy": 6.244770193099976,
|
|
"epoch": 2.4062319676860935,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004429565279614777,
|
|
"loss": 5.6855,
|
|
"mean_token_accuracy": 0.20993798077106476,
|
|
"num_tokens": 52843681.0,
|
|
"step": 20850
|
|
},
|
|
{
|
|
"entropy": 6.273213005065918,
|
|
"epoch": 2.4068090017311023,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00044292906721048094,
|
|
"loss": 5.6646,
|
|
"mean_token_accuracy": 0.21043166220188142,
|
|
"num_tokens": 52857297.0,
|
|
"step": 20855
|
|
},
|
|
{
|
|
"entropy": 6.102078199386597,
|
|
"epoch": 2.4073860357761108,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004429016008112733,
|
|
"loss": 5.453,
|
|
"mean_token_accuracy": 0.21661452054977418,
|
|
"num_tokens": 52870551.0,
|
|
"step": 20860
|
|
},
|
|
{
|
|
"entropy": 6.232694149017334,
|
|
"epoch": 2.4079630698211196,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004428741287647788,
|
|
"loss": 5.6018,
|
|
"mean_token_accuracy": 0.21334003508090973,
|
|
"num_tokens": 52884628.0,
|
|
"step": 20865
|
|
},
|
|
{
|
|
"entropy": 6.258617401123047,
|
|
"epoch": 2.408540103866128,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00044284665107192136,
|
|
"loss": 5.6018,
|
|
"mean_token_accuracy": 0.21635719537734985,
|
|
"num_tokens": 52897079.0,
|
|
"step": 20870
|
|
},
|
|
{
|
|
"entropy": 6.207066011428833,
|
|
"epoch": 2.409117137911137,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004428191677336251,
|
|
"loss": 5.6794,
|
|
"mean_token_accuracy": 0.205386246740818,
|
|
"num_tokens": 52909990.0,
|
|
"step": 20875
|
|
},
|
|
{
|
|
"entropy": 6.230048990249633,
|
|
"epoch": 2.4096941719561453,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004427916787508146,
|
|
"loss": 5.685,
|
|
"mean_token_accuracy": 0.20320132970809937,
|
|
"num_tokens": 52922732.0,
|
|
"step": 20880
|
|
},
|
|
{
|
|
"entropy": 6.353757715225219,
|
|
"epoch": 2.410271206001154,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004427641841244144,
|
|
"loss": 5.7219,
|
|
"mean_token_accuracy": 0.19882332533597946,
|
|
"num_tokens": 52934648.0,
|
|
"step": 20885
|
|
},
|
|
{
|
|
"entropy": 6.306688976287842,
|
|
"epoch": 2.4108482400461626,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000442736683855349,
|
|
"loss": 5.7502,
|
|
"mean_token_accuracy": 0.19999517798423766,
|
|
"num_tokens": 52947913.0,
|
|
"step": 20890
|
|
},
|
|
{
|
|
"entropy": 6.265348243713379,
|
|
"epoch": 2.4114252740911715,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004427091779445437,
|
|
"loss": 5.693,
|
|
"mean_token_accuracy": 0.20397568345069886,
|
|
"num_tokens": 52960491.0,
|
|
"step": 20895
|
|
},
|
|
{
|
|
"entropy": 6.3150794506073,
|
|
"epoch": 2.41200230813618,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004426816663929235,
|
|
"loss": 5.6529,
|
|
"mean_token_accuracy": 0.2066299334168434,
|
|
"num_tokens": 52972813.0,
|
|
"step": 20900
|
|
},
|
|
{
|
|
"entropy": 6.30979208946228,
|
|
"epoch": 2.4125793421811887,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00044265414920141366,
|
|
"loss": 5.7035,
|
|
"mean_token_accuracy": 0.19975962191820146,
|
|
"num_tokens": 52985548.0,
|
|
"step": 20905
|
|
},
|
|
{
|
|
"entropy": 6.237899971008301,
|
|
"epoch": 2.413156376226197,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00044262662637093987,
|
|
"loss": 5.5775,
|
|
"mean_token_accuracy": 0.21558093875646592,
|
|
"num_tokens": 52998911.0,
|
|
"step": 20910
|
|
},
|
|
{
|
|
"entropy": 6.182219457626343,
|
|
"epoch": 2.413733410271206,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00044259909790242776,
|
|
"loss": 5.6054,
|
|
"mean_token_accuracy": 0.2133312329649925,
|
|
"num_tokens": 53011205.0,
|
|
"step": 20915
|
|
},
|
|
{
|
|
"entropy": 6.237178754806519,
|
|
"epoch": 2.4143104443162144,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004425715637968032,
|
|
"loss": 5.7037,
|
|
"mean_token_accuracy": 0.2034172847867012,
|
|
"num_tokens": 53023428.0,
|
|
"step": 20920
|
|
},
|
|
{
|
|
"entropy": 6.351958084106445,
|
|
"epoch": 2.4148874783612233,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004425440240549923,
|
|
"loss": 5.7983,
|
|
"mean_token_accuracy": 0.19115305542945862,
|
|
"num_tokens": 53035488.0,
|
|
"step": 20925
|
|
},
|
|
{
|
|
"entropy": 6.189400720596313,
|
|
"epoch": 2.415464512406232,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00044251647867792147,
|
|
"loss": 5.5431,
|
|
"mean_token_accuracy": 0.2178526610136032,
|
|
"num_tokens": 53048416.0,
|
|
"step": 20930
|
|
},
|
|
{
|
|
"entropy": 6.261590957641602,
|
|
"epoch": 2.4160415464512406,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00044248892766651706,
|
|
"loss": 5.7911,
|
|
"mean_token_accuracy": 0.19820116460323334,
|
|
"num_tokens": 53061763.0,
|
|
"step": 20935
|
|
},
|
|
{
|
|
"entropy": 6.231258487701416,
|
|
"epoch": 2.4166185804962494,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004424613710217057,
|
|
"loss": 5.608,
|
|
"mean_token_accuracy": 0.20854777544736863,
|
|
"num_tokens": 53073666.0,
|
|
"step": 20940
|
|
},
|
|
{
|
|
"entropy": 6.165039777755737,
|
|
"epoch": 2.417195614541258,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00044243380874441437,
|
|
"loss": 5.5893,
|
|
"mean_token_accuracy": 0.2164393588900566,
|
|
"num_tokens": 53087155.0,
|
|
"step": 20945
|
|
},
|
|
{
|
|
"entropy": 6.291706848144531,
|
|
"epoch": 2.4177726485862667,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00044240624083557,
|
|
"loss": 5.7532,
|
|
"mean_token_accuracy": 0.20198543518781661,
|
|
"num_tokens": 53099199.0,
|
|
"step": 20950
|
|
},
|
|
{
|
|
"entropy": 6.27391939163208,
|
|
"epoch": 2.418349682631275,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00044237866729609994,
|
|
"loss": 5.7253,
|
|
"mean_token_accuracy": 0.19764039665460587,
|
|
"num_tokens": 53111997.0,
|
|
"step": 20955
|
|
},
|
|
{
|
|
"entropy": 6.1567870616912845,
|
|
"epoch": 2.418926716676284,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004423510881269315,
|
|
"loss": 5.6611,
|
|
"mean_token_accuracy": 0.20668234825134277,
|
|
"num_tokens": 53123812.0,
|
|
"step": 20960
|
|
},
|
|
{
|
|
"entropy": 6.306679534912109,
|
|
"epoch": 2.4195037507212924,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004423235033289924,
|
|
"loss": 5.7441,
|
|
"mean_token_accuracy": 0.19693725556135178,
|
|
"num_tokens": 53137232.0,
|
|
"step": 20965
|
|
},
|
|
{
|
|
"entropy": 6.320231342315674,
|
|
"epoch": 2.4200807847663013,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004422959129032103,
|
|
"loss": 5.6684,
|
|
"mean_token_accuracy": 0.20223398357629777,
|
|
"num_tokens": 53149183.0,
|
|
"step": 20970
|
|
},
|
|
{
|
|
"entropy": 6.1804546356201175,
|
|
"epoch": 2.4206578188113097,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00044226831685051333,
|
|
"loss": 5.5951,
|
|
"mean_token_accuracy": 0.20293668061494827,
|
|
"num_tokens": 53163187.0,
|
|
"step": 20975
|
|
},
|
|
{
|
|
"entropy": 6.322501182556152,
|
|
"epoch": 2.4212348528563186,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004422407151718296,
|
|
"loss": 5.6621,
|
|
"mean_token_accuracy": 0.21300754696130753,
|
|
"num_tokens": 53178441.0,
|
|
"step": 20980
|
|
},
|
|
{
|
|
"entropy": 6.309228181838989,
|
|
"epoch": 2.4218118869013274,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00044221310786808746,
|
|
"loss": 5.6753,
|
|
"mean_token_accuracy": 0.20587997883558273,
|
|
"num_tokens": 53190042.0,
|
|
"step": 20985
|
|
},
|
|
{
|
|
"entropy": 6.260992860794067,
|
|
"epoch": 2.422388920946336,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004421854949402155,
|
|
"loss": 5.6765,
|
|
"mean_token_accuracy": 0.20409729927778245,
|
|
"num_tokens": 53201724.0,
|
|
"step": 20990
|
|
},
|
|
{
|
|
"entropy": 6.2162477493286135,
|
|
"epoch": 2.4229659549913443,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00044215787638914245,
|
|
"loss": 5.6576,
|
|
"mean_token_accuracy": 0.20342174768447877,
|
|
"num_tokens": 53213415.0,
|
|
"step": 20995
|
|
},
|
|
{
|
|
"entropy": 6.2664031982421875,
|
|
"epoch": 2.423542989036353,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004421302522157973,
|
|
"loss": 5.6785,
|
|
"mean_token_accuracy": 0.20658696591854095,
|
|
"num_tokens": 53227324.0,
|
|
"step": 21000
|
|
},
|
|
{
|
|
"epoch": 2.423542989036353,
|
|
"eval_entropy": 6.088870966742925,
|
|
"eval_loss": 5.776307106018066,
|
|
"eval_mean_token_accuracy": 0.20609371489316927,
|
|
"eval_num_tokens": 53227324.0,
|
|
"eval_runtime": 17.4445,
|
|
"eval_samples_per_second": 1612.888,
|
|
"eval_steps_per_second": 201.611,
|
|
"step": 21000
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 86650,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 10,
|
|
"save_steps": 3000,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 1.16435681353728e+16,
|
|
"train_batch_size": 16,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|