60145 lines
1.6 MiB
60145 lines
1.6 MiB
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 3.462204270051933,
|
|
"eval_steps": 3000,
|
|
"global_step": 30000,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 10.742519760131836,
|
|
"epoch": 0.0005770340450086555,
|
|
"grad_norm": 4.78125,
|
|
"learning_rate": 2e-06,
|
|
"loss": 10.7834,
|
|
"mean_token_accuracy": 0.0,
|
|
"num_tokens": 11955.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 10.742532062530518,
|
|
"epoch": 0.001154068090017311,
|
|
"grad_norm": 5.15625,
|
|
"learning_rate": 4.5e-06,
|
|
"loss": 10.7821,
|
|
"mean_token_accuracy": 7.552870083600282e-05,
|
|
"num_tokens": 24473.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 10.742538166046142,
|
|
"epoch": 0.0017311021350259665,
|
|
"grad_norm": 5.4375,
|
|
"learning_rate": 7e-06,
|
|
"loss": 10.7615,
|
|
"mean_token_accuracy": 0.00016723573207855225,
|
|
"num_tokens": 36716.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 10.742550373077393,
|
|
"epoch": 0.002308136180034622,
|
|
"grad_norm": 5.125,
|
|
"learning_rate": 9.5e-06,
|
|
"loss": 10.7088,
|
|
"mean_token_accuracy": 0.0010991264251060783,
|
|
"num_tokens": 49747.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 10.742451667785645,
|
|
"epoch": 0.0028851702250432777,
|
|
"grad_norm": 4.71875,
|
|
"learning_rate": 1.2e-05,
|
|
"loss": 10.6029,
|
|
"mean_token_accuracy": 0.01508477891329676,
|
|
"num_tokens": 61991.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 10.741979122161865,
|
|
"epoch": 0.003462204270051933,
|
|
"grad_norm": 3.875,
|
|
"learning_rate": 1.4500000000000002e-05,
|
|
"loss": 10.4994,
|
|
"mean_token_accuracy": 0.0400444071739912,
|
|
"num_tokens": 74918.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 10.740076923370362,
|
|
"epoch": 0.004039238315060588,
|
|
"grad_norm": 3.109375,
|
|
"learning_rate": 1.7000000000000003e-05,
|
|
"loss": 10.3732,
|
|
"mean_token_accuracy": 0.05369483157992363,
|
|
"num_tokens": 87833.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 10.733743858337402,
|
|
"epoch": 0.004616272360069244,
|
|
"grad_norm": 2.53125,
|
|
"learning_rate": 1.95e-05,
|
|
"loss": 10.2264,
|
|
"mean_token_accuracy": 0.0561745673418045,
|
|
"num_tokens": 101031.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 10.72265920639038,
|
|
"epoch": 0.0051933064050779,
|
|
"grad_norm": 2.296875,
|
|
"learning_rate": 2.2e-05,
|
|
"loss": 10.1107,
|
|
"mean_token_accuracy": 0.05086057800799608,
|
|
"num_tokens": 114085.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 10.712560367584228,
|
|
"epoch": 0.005770340450086555,
|
|
"grad_norm": 2.046875,
|
|
"learning_rate": 2.4500000000000003e-05,
|
|
"loss": 10.0728,
|
|
"mean_token_accuracy": 0.05095174703747034,
|
|
"num_tokens": 126190.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 10.708724021911621,
|
|
"epoch": 0.006347374495095211,
|
|
"grad_norm": 1.9453125,
|
|
"learning_rate": 2.7e-05,
|
|
"loss": 9.9872,
|
|
"mean_token_accuracy": 0.05040723979473114,
|
|
"num_tokens": 138933.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 10.705632781982422,
|
|
"epoch": 0.006924408540103866,
|
|
"grad_norm": 1.96875,
|
|
"learning_rate": 2.95e-05,
|
|
"loss": 9.9165,
|
|
"mean_token_accuracy": 0.05702933557331562,
|
|
"num_tokens": 150542.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 10.699434947967529,
|
|
"epoch": 0.0075014425851125215,
|
|
"grad_norm": 1.9609375,
|
|
"learning_rate": 3.2e-05,
|
|
"loss": 9.9117,
|
|
"mean_token_accuracy": 0.05192887857556343,
|
|
"num_tokens": 163507.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 10.691042518615722,
|
|
"epoch": 0.008078476630121177,
|
|
"grad_norm": 2.3125,
|
|
"learning_rate": 3.4500000000000005e-05,
|
|
"loss": 9.8663,
|
|
"mean_token_accuracy": 0.0556206401437521,
|
|
"num_tokens": 176668.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 10.68201036453247,
|
|
"epoch": 0.008655510675129832,
|
|
"grad_norm": 1.921875,
|
|
"learning_rate": 3.7e-05,
|
|
"loss": 9.8051,
|
|
"mean_token_accuracy": 0.05544878952205181,
|
|
"num_tokens": 191413.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 10.66737766265869,
|
|
"epoch": 0.009232544720138488,
|
|
"grad_norm": 1.859375,
|
|
"learning_rate": 3.95e-05,
|
|
"loss": 9.739,
|
|
"mean_token_accuracy": 0.06524630598723888,
|
|
"num_tokens": 204176.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 10.650106525421142,
|
|
"epoch": 0.009809578765147143,
|
|
"grad_norm": 2.015625,
|
|
"learning_rate": 4.2000000000000004e-05,
|
|
"loss": 9.6842,
|
|
"mean_token_accuracy": 0.06752815209329129,
|
|
"num_tokens": 216851.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 10.636476421356202,
|
|
"epoch": 0.0103866128101558,
|
|
"grad_norm": 1.8125,
|
|
"learning_rate": 4.45e-05,
|
|
"loss": 9.6572,
|
|
"mean_token_accuracy": 0.0653569109737873,
|
|
"num_tokens": 229621.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 10.622958183288574,
|
|
"epoch": 0.010963646855164455,
|
|
"grad_norm": 1.953125,
|
|
"learning_rate": 4.7000000000000004e-05,
|
|
"loss": 9.6025,
|
|
"mean_token_accuracy": 0.06540683954954148,
|
|
"num_tokens": 242074.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 10.592237091064453,
|
|
"epoch": 0.01154068090017311,
|
|
"grad_norm": 1.703125,
|
|
"learning_rate": 4.9500000000000004e-05,
|
|
"loss": 9.474,
|
|
"mean_token_accuracy": 0.07080609016120434,
|
|
"num_tokens": 254094.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 10.51324234008789,
|
|
"epoch": 0.012117714945181766,
|
|
"grad_norm": 2.046875,
|
|
"learning_rate": 5.2e-05,
|
|
"loss": 9.4787,
|
|
"mean_token_accuracy": 0.07307280339300633,
|
|
"num_tokens": 267560.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 10.503196525573731,
|
|
"epoch": 0.012694748990190421,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 5.45e-05,
|
|
"loss": 9.4426,
|
|
"mean_token_accuracy": 0.07156955860555173,
|
|
"num_tokens": 280717.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 10.523096179962158,
|
|
"epoch": 0.013271783035199077,
|
|
"grad_norm": 1.7421875,
|
|
"learning_rate": 5.7e-05,
|
|
"loss": 9.3915,
|
|
"mean_token_accuracy": 0.07147992886602879,
|
|
"num_tokens": 293856.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 10.484137058258057,
|
|
"epoch": 0.013848817080207732,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 5.9499999999999996e-05,
|
|
"loss": 9.2251,
|
|
"mean_token_accuracy": 0.07240887582302094,
|
|
"num_tokens": 305191.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 10.420050239562988,
|
|
"epoch": 0.014425851125216388,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 6.2e-05,
|
|
"loss": 9.2288,
|
|
"mean_token_accuracy": 0.07244622334837914,
|
|
"num_tokens": 318544.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 10.332412433624267,
|
|
"epoch": 0.015002885170225043,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 6.450000000000001e-05,
|
|
"loss": 9.0584,
|
|
"mean_token_accuracy": 0.08713233023881913,
|
|
"num_tokens": 331445.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 10.288755512237548,
|
|
"epoch": 0.015579919215233698,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 6.7e-05,
|
|
"loss": 9.0833,
|
|
"mean_token_accuracy": 0.07415068708360195,
|
|
"num_tokens": 344775.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 10.267962074279785,
|
|
"epoch": 0.016156953260242354,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 6.950000000000001e-05,
|
|
"loss": 8.9864,
|
|
"mean_token_accuracy": 0.07388804033398629,
|
|
"num_tokens": 357804.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 10.174692630767822,
|
|
"epoch": 0.01673398730525101,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 7.2e-05,
|
|
"loss": 8.8543,
|
|
"mean_token_accuracy": 0.08084411099553108,
|
|
"num_tokens": 369826.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 10.011744403839112,
|
|
"epoch": 0.017311021350259664,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 7.45e-05,
|
|
"loss": 8.7823,
|
|
"mean_token_accuracy": 0.08401374593377113,
|
|
"num_tokens": 382768.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 9.914338493347168,
|
|
"epoch": 0.01788805539526832,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 7.7e-05,
|
|
"loss": 8.7625,
|
|
"mean_token_accuracy": 0.08076213970780373,
|
|
"num_tokens": 395910.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 9.87332878112793,
|
|
"epoch": 0.018465089440276975,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 7.950000000000001e-05,
|
|
"loss": 8.725,
|
|
"mean_token_accuracy": 0.07417598105967045,
|
|
"num_tokens": 408140.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 9.752376747131347,
|
|
"epoch": 0.019042123485285632,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 8.2e-05,
|
|
"loss": 8.5835,
|
|
"mean_token_accuracy": 0.08260673955082894,
|
|
"num_tokens": 420486.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 9.501761531829834,
|
|
"epoch": 0.019619157530294286,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 8.450000000000001e-05,
|
|
"loss": 8.5107,
|
|
"mean_token_accuracy": 0.09241977110505104,
|
|
"num_tokens": 433207.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 9.351601791381835,
|
|
"epoch": 0.020196191575302943,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 8.7e-05,
|
|
"loss": 8.4638,
|
|
"mean_token_accuracy": 0.08450455963611603,
|
|
"num_tokens": 444880.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 9.297267818450928,
|
|
"epoch": 0.0207732256203116,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 8.95e-05,
|
|
"loss": 8.4926,
|
|
"mean_token_accuracy": 0.08199871554970742,
|
|
"num_tokens": 456650.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 9.096736717224122,
|
|
"epoch": 0.021350259665320254,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 9.2e-05,
|
|
"loss": 8.4572,
|
|
"mean_token_accuracy": 0.08327073007822036,
|
|
"num_tokens": 469667.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 9.029964542388916,
|
|
"epoch": 0.02192729371032891,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 9.45e-05,
|
|
"loss": 8.3783,
|
|
"mean_token_accuracy": 0.09304521456360818,
|
|
"num_tokens": 481952.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 8.89255895614624,
|
|
"epoch": 0.022504327755337564,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 9.7e-05,
|
|
"loss": 8.399,
|
|
"mean_token_accuracy": 0.09114565178751946,
|
|
"num_tokens": 494352.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 8.913476753234864,
|
|
"epoch": 0.02308136180034622,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 9.95e-05,
|
|
"loss": 8.3105,
|
|
"mean_token_accuracy": 0.0925761379301548,
|
|
"num_tokens": 506937.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 8.781428337097168,
|
|
"epoch": 0.023658395845354875,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.000102,
|
|
"loss": 8.303,
|
|
"mean_token_accuracy": 0.0928865760564804,
|
|
"num_tokens": 519552.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 8.800222492218017,
|
|
"epoch": 0.024235429890363532,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00010449999999999999,
|
|
"loss": 8.3412,
|
|
"mean_token_accuracy": 0.08962251469492913,
|
|
"num_tokens": 531359.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 8.806383419036866,
|
|
"epoch": 0.024812463935372186,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000107,
|
|
"loss": 8.3542,
|
|
"mean_token_accuracy": 0.09396427646279334,
|
|
"num_tokens": 544197.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 8.8606746673584,
|
|
"epoch": 0.025389497980380843,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0001095,
|
|
"loss": 8.3106,
|
|
"mean_token_accuracy": 0.09081738814711571,
|
|
"num_tokens": 556818.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 8.742358875274657,
|
|
"epoch": 0.025966532025389497,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.000112,
|
|
"loss": 8.3253,
|
|
"mean_token_accuracy": 0.0934368498623371,
|
|
"num_tokens": 569363.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 8.80865125656128,
|
|
"epoch": 0.026543566070398154,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0001145,
|
|
"loss": 8.3076,
|
|
"mean_token_accuracy": 0.09487870410084724,
|
|
"num_tokens": 581645.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 8.763648796081544,
|
|
"epoch": 0.027120600115406807,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.00011700000000000001,
|
|
"loss": 8.259,
|
|
"mean_token_accuracy": 0.08925148844718933,
|
|
"num_tokens": 593501.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 8.715390586853028,
|
|
"epoch": 0.027697634160415464,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00011949999999999999,
|
|
"loss": 8.2462,
|
|
"mean_token_accuracy": 0.09425812289118767,
|
|
"num_tokens": 606328.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 8.573129081726075,
|
|
"epoch": 0.02827466820542412,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000122,
|
|
"loss": 8.1457,
|
|
"mean_token_accuracy": 0.1065749242901802,
|
|
"num_tokens": 619003.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 8.62852210998535,
|
|
"epoch": 0.028851702250432775,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0001245,
|
|
"loss": 8.2725,
|
|
"mean_token_accuracy": 0.09227693155407905,
|
|
"num_tokens": 632910.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 8.616901016235351,
|
|
"epoch": 0.029428736295441432,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.000127,
|
|
"loss": 8.2065,
|
|
"mean_token_accuracy": 0.09859882518649102,
|
|
"num_tokens": 645959.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 8.623135948181153,
|
|
"epoch": 0.030005770340450086,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0001295,
|
|
"loss": 8.1911,
|
|
"mean_token_accuracy": 0.10357227995991707,
|
|
"num_tokens": 658620.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 8.548318576812743,
|
|
"epoch": 0.030582804385458743,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000132,
|
|
"loss": 8.1897,
|
|
"mean_token_accuracy": 0.10186770558357239,
|
|
"num_tokens": 670804.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 8.512144851684571,
|
|
"epoch": 0.031159838430467397,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.00013450000000000002,
|
|
"loss": 8.191,
|
|
"mean_token_accuracy": 0.09745052307844163,
|
|
"num_tokens": 683656.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 8.583205032348634,
|
|
"epoch": 0.031736872475476054,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00013700000000000002,
|
|
"loss": 8.1635,
|
|
"mean_token_accuracy": 0.10382118448615074,
|
|
"num_tokens": 696629.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 8.513082599639892,
|
|
"epoch": 0.03231390652048471,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0001395,
|
|
"loss": 8.1849,
|
|
"mean_token_accuracy": 0.0984301395714283,
|
|
"num_tokens": 709053.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 8.52897834777832,
|
|
"epoch": 0.03289094056549336,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00014199999999999998,
|
|
"loss": 8.1378,
|
|
"mean_token_accuracy": 0.101743233948946,
|
|
"num_tokens": 721947.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 8.485254192352295,
|
|
"epoch": 0.03346797461050202,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0001445,
|
|
"loss": 8.1318,
|
|
"mean_token_accuracy": 0.10095292180776597,
|
|
"num_tokens": 734495.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 8.4556489944458,
|
|
"epoch": 0.034045008655510675,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.000147,
|
|
"loss": 8.1574,
|
|
"mean_token_accuracy": 0.09864982217550278,
|
|
"num_tokens": 746965.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 8.541684627532959,
|
|
"epoch": 0.03462204270051933,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0001495,
|
|
"loss": 8.1759,
|
|
"mean_token_accuracy": 0.09848161116242408,
|
|
"num_tokens": 760105.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 8.439905643463135,
|
|
"epoch": 0.03519907674552799,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.000152,
|
|
"loss": 8.0742,
|
|
"mean_token_accuracy": 0.1082187220454216,
|
|
"num_tokens": 771765.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 8.54954652786255,
|
|
"epoch": 0.03577611079053664,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00015450000000000001,
|
|
"loss": 8.1565,
|
|
"mean_token_accuracy": 0.10081454515457153,
|
|
"num_tokens": 784895.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 8.430934238433839,
|
|
"epoch": 0.0363531448355453,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000157,
|
|
"loss": 8.0908,
|
|
"mean_token_accuracy": 0.10850713253021241,
|
|
"num_tokens": 797139.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 8.501363563537598,
|
|
"epoch": 0.03693017888055395,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0001595,
|
|
"loss": 8.0515,
|
|
"mean_token_accuracy": 0.11537543162703515,
|
|
"num_tokens": 809169.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 8.328963375091552,
|
|
"epoch": 0.03750721292556261,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.000162,
|
|
"loss": 8.1059,
|
|
"mean_token_accuracy": 0.10505361780524254,
|
|
"num_tokens": 821737.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 8.49581003189087,
|
|
"epoch": 0.038084246970571264,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00016450000000000001,
|
|
"loss": 8.019,
|
|
"mean_token_accuracy": 0.1122775912284851,
|
|
"num_tokens": 834365.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 8.393208026885986,
|
|
"epoch": 0.03866128101557992,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00016700000000000002,
|
|
"loss": 8.0675,
|
|
"mean_token_accuracy": 0.10942035019397736,
|
|
"num_tokens": 846445.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 8.460633182525635,
|
|
"epoch": 0.03923831506058857,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00016950000000000003,
|
|
"loss": 8.1142,
|
|
"mean_token_accuracy": 0.10697392895817756,
|
|
"num_tokens": 858558.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 8.396363449096679,
|
|
"epoch": 0.03981534910559723,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00017199999999999998,
|
|
"loss": 8.1058,
|
|
"mean_token_accuracy": 0.10723683908581734,
|
|
"num_tokens": 871209.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 8.491197395324708,
|
|
"epoch": 0.040392383150605886,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00017449999999999999,
|
|
"loss": 8.0555,
|
|
"mean_token_accuracy": 0.10949232503771782,
|
|
"num_tokens": 883270.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 8.352670478820801,
|
|
"epoch": 0.04096941719561454,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000177,
|
|
"loss": 8.0601,
|
|
"mean_token_accuracy": 0.10984272882342339,
|
|
"num_tokens": 895468.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 8.47718162536621,
|
|
"epoch": 0.0415464512406232,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0001795,
|
|
"loss": 8.0213,
|
|
"mean_token_accuracy": 0.11185759902000428,
|
|
"num_tokens": 907900.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 8.211096382141113,
|
|
"epoch": 0.042123485285631854,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000182,
|
|
"loss": 8.0331,
|
|
"mean_token_accuracy": 0.11285770758986473,
|
|
"num_tokens": 920036.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 8.389335536956787,
|
|
"epoch": 0.04270051933064051,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0001845,
|
|
"loss": 7.9946,
|
|
"mean_token_accuracy": 0.11674289256334305,
|
|
"num_tokens": 932525.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 8.290297317504884,
|
|
"epoch": 0.04327755337564916,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000187,
|
|
"loss": 7.9705,
|
|
"mean_token_accuracy": 0.11729388907551766,
|
|
"num_tokens": 943581.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 8.457341861724853,
|
|
"epoch": 0.04385458742065782,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0001895,
|
|
"loss": 8.0767,
|
|
"mean_token_accuracy": 0.10796716287732125,
|
|
"num_tokens": 956270.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 8.334104824066163,
|
|
"epoch": 0.044431621465666475,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.000192,
|
|
"loss": 8.0281,
|
|
"mean_token_accuracy": 0.11211411207914353,
|
|
"num_tokens": 967631.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 8.407048511505128,
|
|
"epoch": 0.04500865551067513,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0001945,
|
|
"loss": 8.037,
|
|
"mean_token_accuracy": 0.10723293125629425,
|
|
"num_tokens": 980999.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 8.267741298675537,
|
|
"epoch": 0.04558568955568378,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00019700000000000002,
|
|
"loss": 7.9457,
|
|
"mean_token_accuracy": 0.11497977301478386,
|
|
"num_tokens": 993404.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 8.311189937591553,
|
|
"epoch": 0.04616272360069244,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00019950000000000002,
|
|
"loss": 7.959,
|
|
"mean_token_accuracy": 0.11699348911643029,
|
|
"num_tokens": 1006009.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 8.301223659515381,
|
|
"epoch": 0.0467397576457011,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.000202,
|
|
"loss": 8.0537,
|
|
"mean_token_accuracy": 0.1106877088546753,
|
|
"num_tokens": 1019644.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 8.281110191345215,
|
|
"epoch": 0.04731679169070975,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.00020449999999999998,
|
|
"loss": 7.9529,
|
|
"mean_token_accuracy": 0.12168486937880515,
|
|
"num_tokens": 1032196.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 8.194720458984374,
|
|
"epoch": 0.04789382573571841,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000207,
|
|
"loss": 7.9104,
|
|
"mean_token_accuracy": 0.12571991384029388,
|
|
"num_tokens": 1044211.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 8.374266242980957,
|
|
"epoch": 0.048470859780727064,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0002095,
|
|
"loss": 7.9692,
|
|
"mean_token_accuracy": 0.11775951310992241,
|
|
"num_tokens": 1055743.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 8.280481624603272,
|
|
"epoch": 0.04904789382573572,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.000212,
|
|
"loss": 7.9728,
|
|
"mean_token_accuracy": 0.11407571211457253,
|
|
"num_tokens": 1068550.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 8.259190368652344,
|
|
"epoch": 0.04962492787074437,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0002145,
|
|
"loss": 7.876,
|
|
"mean_token_accuracy": 0.12458330690860749,
|
|
"num_tokens": 1079878.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 8.264352798461914,
|
|
"epoch": 0.05020196191575303,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00021700000000000002,
|
|
"loss": 7.9461,
|
|
"mean_token_accuracy": 0.11022370159626008,
|
|
"num_tokens": 1093331.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 8.320549201965331,
|
|
"epoch": 0.050778995960761686,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0002195,
|
|
"loss": 7.8988,
|
|
"mean_token_accuracy": 0.12245648875832557,
|
|
"num_tokens": 1105830.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 8.242807865142822,
|
|
"epoch": 0.05135603000577034,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.000222,
|
|
"loss": 7.9022,
|
|
"mean_token_accuracy": 0.1231141023337841,
|
|
"num_tokens": 1118071.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 8.150061178207398,
|
|
"epoch": 0.05193306405077899,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0002245,
|
|
"loss": 7.9205,
|
|
"mean_token_accuracy": 0.11648782640695572,
|
|
"num_tokens": 1129781.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 8.264570999145509,
|
|
"epoch": 0.052510098095787654,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00022700000000000002,
|
|
"loss": 7.9593,
|
|
"mean_token_accuracy": 0.11766693964600564,
|
|
"num_tokens": 1142750.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 8.244252777099609,
|
|
"epoch": 0.05308713214079631,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00022950000000000002,
|
|
"loss": 7.8898,
|
|
"mean_token_accuracy": 0.11929678991436958,
|
|
"num_tokens": 1154314.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 8.212209606170655,
|
|
"epoch": 0.05366416618580496,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00023200000000000003,
|
|
"loss": 7.9087,
|
|
"mean_token_accuracy": 0.12657537683844566,
|
|
"num_tokens": 1167199.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 8.202026081085204,
|
|
"epoch": 0.054241200230813615,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00023449999999999998,
|
|
"loss": 7.8846,
|
|
"mean_token_accuracy": 0.12224558740854263,
|
|
"num_tokens": 1179654.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 8.187808513641357,
|
|
"epoch": 0.054818234275822275,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.000237,
|
|
"loss": 7.867,
|
|
"mean_token_accuracy": 0.12207963541150094,
|
|
"num_tokens": 1190713.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 8.158800506591797,
|
|
"epoch": 0.05539526832083093,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0002395,
|
|
"loss": 7.8509,
|
|
"mean_token_accuracy": 0.12055787444114685,
|
|
"num_tokens": 1203881.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 8.259974384307862,
|
|
"epoch": 0.05597230236583958,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000242,
|
|
"loss": 7.9146,
|
|
"mean_token_accuracy": 0.11428983137011528,
|
|
"num_tokens": 1215795.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 8.06658124923706,
|
|
"epoch": 0.05654933641084824,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0002445,
|
|
"loss": 7.8294,
|
|
"mean_token_accuracy": 0.12558024376630783,
|
|
"num_tokens": 1227773.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 8.268111038208009,
|
|
"epoch": 0.0571263704558569,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000247,
|
|
"loss": 7.8281,
|
|
"mean_token_accuracy": 0.12732664570212365,
|
|
"num_tokens": 1240217.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 8.184942293167115,
|
|
"epoch": 0.05770340450086555,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0002495,
|
|
"loss": 7.8963,
|
|
"mean_token_accuracy": 0.12094444781541824,
|
|
"num_tokens": 1253324.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 8.097318315505982,
|
|
"epoch": 0.058280438545874204,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000252,
|
|
"loss": 7.8021,
|
|
"mean_token_accuracy": 0.11756076738238334,
|
|
"num_tokens": 1266007.0,
|
|
"step": 505
|
|
},
|
|
{
|
|
"entropy": 8.119937992095947,
|
|
"epoch": 0.058857472590882864,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0002545,
|
|
"loss": 7.8449,
|
|
"mean_token_accuracy": 0.12364009171724319,
|
|
"num_tokens": 1278403.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 8.165720081329345,
|
|
"epoch": 0.05943450663589152,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000257,
|
|
"loss": 7.8565,
|
|
"mean_token_accuracy": 0.12108651399612427,
|
|
"num_tokens": 1290352.0,
|
|
"step": 515
|
|
},
|
|
{
|
|
"entropy": 8.166333532333374,
|
|
"epoch": 0.06001154068090017,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0002595,
|
|
"loss": 7.8677,
|
|
"mean_token_accuracy": 0.11767618358135223,
|
|
"num_tokens": 1302304.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 8.154673862457276,
|
|
"epoch": 0.060588574725908825,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000262,
|
|
"loss": 7.8293,
|
|
"mean_token_accuracy": 0.1254723496735096,
|
|
"num_tokens": 1314014.0,
|
|
"step": 525
|
|
},
|
|
{
|
|
"entropy": 8.189765071868896,
|
|
"epoch": 0.061165608770917486,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00026450000000000003,
|
|
"loss": 7.8617,
|
|
"mean_token_accuracy": 0.11876866742968559,
|
|
"num_tokens": 1326751.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 8.086573696136474,
|
|
"epoch": 0.06174264281592614,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00026700000000000004,
|
|
"loss": 7.7429,
|
|
"mean_token_accuracy": 0.1276994377374649,
|
|
"num_tokens": 1339070.0,
|
|
"step": 535
|
|
},
|
|
{
|
|
"entropy": 8.00021333694458,
|
|
"epoch": 0.06231967686093479,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00026950000000000005,
|
|
"loss": 7.7617,
|
|
"mean_token_accuracy": 0.12492593899369239,
|
|
"num_tokens": 1351345.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 8.155957984924317,
|
|
"epoch": 0.06289671090594345,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00027200000000000005,
|
|
"loss": 7.8454,
|
|
"mean_token_accuracy": 0.11729749515652657,
|
|
"num_tokens": 1364331.0,
|
|
"step": 545
|
|
},
|
|
{
|
|
"entropy": 7.948654079437256,
|
|
"epoch": 0.06347374495095211,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0002745,
|
|
"loss": 7.7274,
|
|
"mean_token_accuracy": 0.1307520568370819,
|
|
"num_tokens": 1377426.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 8.21699333190918,
|
|
"epoch": 0.06405077899596076,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000277,
|
|
"loss": 7.8456,
|
|
"mean_token_accuracy": 0.11890435740351676,
|
|
"num_tokens": 1391553.0,
|
|
"step": 555
|
|
},
|
|
{
|
|
"entropy": 8.080363225936889,
|
|
"epoch": 0.06462781304096941,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0002795,
|
|
"loss": 7.83,
|
|
"mean_token_accuracy": 0.12511808127164842,
|
|
"num_tokens": 1405526.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 8.142201614379882,
|
|
"epoch": 0.06520484708597807,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00028199999999999997,
|
|
"loss": 7.8219,
|
|
"mean_token_accuracy": 0.12369688302278518,
|
|
"num_tokens": 1417868.0,
|
|
"step": 565
|
|
},
|
|
{
|
|
"entropy": 7.928612327575683,
|
|
"epoch": 0.06578188113098672,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0002845,
|
|
"loss": 7.7407,
|
|
"mean_token_accuracy": 0.12715482115745544,
|
|
"num_tokens": 1429907.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 8.15863070487976,
|
|
"epoch": 0.06635891517599539,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000287,
|
|
"loss": 7.751,
|
|
"mean_token_accuracy": 0.12095296233892441,
|
|
"num_tokens": 1442552.0,
|
|
"step": 575
|
|
},
|
|
{
|
|
"entropy": 8.045605039596557,
|
|
"epoch": 0.06693594922100404,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0002895,
|
|
"loss": 7.8095,
|
|
"mean_token_accuracy": 0.12216803878545761,
|
|
"num_tokens": 1455717.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 8.157436180114747,
|
|
"epoch": 0.0675129832660127,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.000292,
|
|
"loss": 7.8052,
|
|
"mean_token_accuracy": 0.11941280439496041,
|
|
"num_tokens": 1468263.0,
|
|
"step": 585
|
|
},
|
|
{
|
|
"entropy": 7.988013124465942,
|
|
"epoch": 0.06809001731102135,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0002945,
|
|
"loss": 7.7479,
|
|
"mean_token_accuracy": 0.12465541884303093,
|
|
"num_tokens": 1481632.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 8.01614761352539,
|
|
"epoch": 0.06866705135603,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000297,
|
|
"loss": 7.7005,
|
|
"mean_token_accuracy": 0.12634204924106598,
|
|
"num_tokens": 1495121.0,
|
|
"step": 595
|
|
},
|
|
{
|
|
"entropy": 7.969437456130981,
|
|
"epoch": 0.06924408540103866,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0002995,
|
|
"loss": 7.7509,
|
|
"mean_token_accuracy": 0.1271022602915764,
|
|
"num_tokens": 1507669.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 8.026603889465331,
|
|
"epoch": 0.06982111944604731,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000302,
|
|
"loss": 7.7853,
|
|
"mean_token_accuracy": 0.12059543505311013,
|
|
"num_tokens": 1520707.0,
|
|
"step": 605
|
|
},
|
|
{
|
|
"entropy": 7.99562668800354,
|
|
"epoch": 0.07039815349105598,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0003045,
|
|
"loss": 7.696,
|
|
"mean_token_accuracy": 0.12601862624287605,
|
|
"num_tokens": 1532974.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 7.974084091186524,
|
|
"epoch": 0.07097518753606463,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.000307,
|
|
"loss": 7.682,
|
|
"mean_token_accuracy": 0.12723494321107864,
|
|
"num_tokens": 1544085.0,
|
|
"step": 615
|
|
},
|
|
{
|
|
"entropy": 7.9744525909423825,
|
|
"epoch": 0.07155222158107329,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0003095,
|
|
"loss": 7.7045,
|
|
"mean_token_accuracy": 0.1308353565633297,
|
|
"num_tokens": 1556945.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 7.941751766204834,
|
|
"epoch": 0.07212925562608194,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000312,
|
|
"loss": 7.6518,
|
|
"mean_token_accuracy": 0.13126163482666015,
|
|
"num_tokens": 1569570.0,
|
|
"step": 625
|
|
},
|
|
{
|
|
"entropy": 7.943236637115478,
|
|
"epoch": 0.0727062896710906,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0003145,
|
|
"loss": 7.7317,
|
|
"mean_token_accuracy": 0.12612373903393745,
|
|
"num_tokens": 1582529.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 7.964515161514282,
|
|
"epoch": 0.07328332371609925,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.000317,
|
|
"loss": 7.6504,
|
|
"mean_token_accuracy": 0.13465792536735535,
|
|
"num_tokens": 1595976.0,
|
|
"step": 635
|
|
},
|
|
{
|
|
"entropy": 7.939415836334229,
|
|
"epoch": 0.0738603577611079,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0003195,
|
|
"loss": 7.6945,
|
|
"mean_token_accuracy": 0.12841632589697838,
|
|
"num_tokens": 1609093.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 7.928447484970093,
|
|
"epoch": 0.07443739180611655,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000322,
|
|
"loss": 7.6804,
|
|
"mean_token_accuracy": 0.12497531697154045,
|
|
"num_tokens": 1622233.0,
|
|
"step": 645
|
|
},
|
|
{
|
|
"entropy": 8.020674419403075,
|
|
"epoch": 0.07501442585112522,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00032450000000000003,
|
|
"loss": 7.728,
|
|
"mean_token_accuracy": 0.1262144438922405,
|
|
"num_tokens": 1635354.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 7.9559979915618895,
|
|
"epoch": 0.07559145989613388,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.00032700000000000003,
|
|
"loss": 7.7083,
|
|
"mean_token_accuracy": 0.12276372462511062,
|
|
"num_tokens": 1648223.0,
|
|
"step": 655
|
|
},
|
|
{
|
|
"entropy": 7.932180786132813,
|
|
"epoch": 0.07616849394114253,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00032950000000000004,
|
|
"loss": 7.695,
|
|
"mean_token_accuracy": 0.12331497594714165,
|
|
"num_tokens": 1661652.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 7.91778302192688,
|
|
"epoch": 0.07674552798615118,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00033200000000000005,
|
|
"loss": 7.598,
|
|
"mean_token_accuracy": 0.13565101027488707,
|
|
"num_tokens": 1674778.0,
|
|
"step": 665
|
|
},
|
|
{
|
|
"entropy": 7.959203672409058,
|
|
"epoch": 0.07732256203115984,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00033450000000000005,
|
|
"loss": 7.6853,
|
|
"mean_token_accuracy": 0.1240819051861763,
|
|
"num_tokens": 1686966.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 7.902504253387451,
|
|
"epoch": 0.07789959607616849,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000337,
|
|
"loss": 7.6563,
|
|
"mean_token_accuracy": 0.13484344854950905,
|
|
"num_tokens": 1699979.0,
|
|
"step": 675
|
|
},
|
|
{
|
|
"entropy": 7.8624763011932375,
|
|
"epoch": 0.07847663012117714,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0003395,
|
|
"loss": 7.5949,
|
|
"mean_token_accuracy": 0.12701699286699294,
|
|
"num_tokens": 1712306.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 7.84359302520752,
|
|
"epoch": 0.07905366416618581,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000342,
|
|
"loss": 7.6427,
|
|
"mean_token_accuracy": 0.12926456406712533,
|
|
"num_tokens": 1724670.0,
|
|
"step": 685
|
|
},
|
|
{
|
|
"entropy": 7.9609299659729,
|
|
"epoch": 0.07963069821119446,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00034449999999999997,
|
|
"loss": 7.7196,
|
|
"mean_token_accuracy": 0.12713819071650506,
|
|
"num_tokens": 1736987.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 7.934039688110351,
|
|
"epoch": 0.08020773225620312,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.000347,
|
|
"loss": 7.6931,
|
|
"mean_token_accuracy": 0.126790152490139,
|
|
"num_tokens": 1750587.0,
|
|
"step": 695
|
|
},
|
|
{
|
|
"entropy": 7.82976803779602,
|
|
"epoch": 0.08078476630121177,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003495,
|
|
"loss": 7.6356,
|
|
"mean_token_accuracy": 0.12186335176229476,
|
|
"num_tokens": 1763432.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 7.907923984527588,
|
|
"epoch": 0.08136180034622043,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.000352,
|
|
"loss": 7.5615,
|
|
"mean_token_accuracy": 0.13086110800504686,
|
|
"num_tokens": 1777705.0,
|
|
"step": 705
|
|
},
|
|
{
|
|
"entropy": 7.8514200210571286,
|
|
"epoch": 0.08193883439122908,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0003545,
|
|
"loss": 7.6198,
|
|
"mean_token_accuracy": 0.13134256303310393,
|
|
"num_tokens": 1790673.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 7.8153650760650635,
|
|
"epoch": 0.08251586843623773,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000357,
|
|
"loss": 7.6619,
|
|
"mean_token_accuracy": 0.12541591748595238,
|
|
"num_tokens": 1803258.0,
|
|
"step": 715
|
|
},
|
|
{
|
|
"entropy": 7.950216341018677,
|
|
"epoch": 0.0830929024812464,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0003595,
|
|
"loss": 7.6293,
|
|
"mean_token_accuracy": 0.12917107716202736,
|
|
"num_tokens": 1816534.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 7.836187028884888,
|
|
"epoch": 0.08366993652625505,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000362,
|
|
"loss": 7.5809,
|
|
"mean_token_accuracy": 0.12518987879157067,
|
|
"num_tokens": 1828335.0,
|
|
"step": 725
|
|
},
|
|
{
|
|
"entropy": 7.771939277648926,
|
|
"epoch": 0.08424697057126371,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0003645,
|
|
"loss": 7.5899,
|
|
"mean_token_accuracy": 0.134027336537838,
|
|
"num_tokens": 1839327.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 7.924041652679444,
|
|
"epoch": 0.08482400461627236,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000367,
|
|
"loss": 7.6636,
|
|
"mean_token_accuracy": 0.12406575530767441,
|
|
"num_tokens": 1851168.0,
|
|
"step": 735
|
|
},
|
|
{
|
|
"entropy": 7.836169338226318,
|
|
"epoch": 0.08540103866128101,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0003695,
|
|
"loss": 7.6255,
|
|
"mean_token_accuracy": 0.1251351036131382,
|
|
"num_tokens": 1863875.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 7.870956707000732,
|
|
"epoch": 0.08597807270628967,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000372,
|
|
"loss": 7.5523,
|
|
"mean_token_accuracy": 0.12497681528329849,
|
|
"num_tokens": 1876613.0,
|
|
"step": 745
|
|
},
|
|
{
|
|
"entropy": 7.877524900436401,
|
|
"epoch": 0.08655510675129832,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0003745,
|
|
"loss": 7.6508,
|
|
"mean_token_accuracy": 0.12530745193362236,
|
|
"num_tokens": 1890311.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 7.7698094844818115,
|
|
"epoch": 0.08713214079630698,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000377,
|
|
"loss": 7.6137,
|
|
"mean_token_accuracy": 0.12359317764639854,
|
|
"num_tokens": 1902925.0,
|
|
"step": 755
|
|
},
|
|
{
|
|
"entropy": 7.891464757919311,
|
|
"epoch": 0.08770917484131564,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003795,
|
|
"loss": 7.5955,
|
|
"mean_token_accuracy": 0.12298363819718361,
|
|
"num_tokens": 1915186.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 7.836678600311279,
|
|
"epoch": 0.0882862088863243,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000382,
|
|
"loss": 7.5912,
|
|
"mean_token_accuracy": 0.1303836189210415,
|
|
"num_tokens": 1927184.0,
|
|
"step": 765
|
|
},
|
|
{
|
|
"entropy": 7.795164489746094,
|
|
"epoch": 0.08886324293133295,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003845,
|
|
"loss": 7.5682,
|
|
"mean_token_accuracy": 0.1343364216387272,
|
|
"num_tokens": 1940275.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 7.860983610153198,
|
|
"epoch": 0.0894402769763416,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00038700000000000003,
|
|
"loss": 7.6057,
|
|
"mean_token_accuracy": 0.1272793047130108,
|
|
"num_tokens": 1952583.0,
|
|
"step": 775
|
|
},
|
|
{
|
|
"entropy": 7.830558156967163,
|
|
"epoch": 0.09001731102135026,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00038950000000000003,
|
|
"loss": 7.5118,
|
|
"mean_token_accuracy": 0.12738451659679412,
|
|
"num_tokens": 1965219.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 7.71030740737915,
|
|
"epoch": 0.09059434506635891,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00039200000000000004,
|
|
"loss": 7.5456,
|
|
"mean_token_accuracy": 0.13100098669528962,
|
|
"num_tokens": 1977193.0,
|
|
"step": 785
|
|
},
|
|
{
|
|
"entropy": 7.909699869155884,
|
|
"epoch": 0.09117137911136756,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00039450000000000005,
|
|
"loss": 7.4505,
|
|
"mean_token_accuracy": 0.13711674883961678,
|
|
"num_tokens": 1988955.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 7.730215835571289,
|
|
"epoch": 0.09174841315637623,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00039700000000000005,
|
|
"loss": 7.5988,
|
|
"mean_token_accuracy": 0.12491806000471115,
|
|
"num_tokens": 2001647.0,
|
|
"step": 795
|
|
},
|
|
{
|
|
"entropy": 7.779358577728272,
|
|
"epoch": 0.09232544720138489,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0003995,
|
|
"loss": 7.5131,
|
|
"mean_token_accuracy": 0.13641507402062417,
|
|
"num_tokens": 2015185.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 7.82036943435669,
|
|
"epoch": 0.09290248124639354,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000402,
|
|
"loss": 7.6135,
|
|
"mean_token_accuracy": 0.12739918157458305,
|
|
"num_tokens": 2027257.0,
|
|
"step": 805
|
|
},
|
|
{
|
|
"entropy": 7.603882265090943,
|
|
"epoch": 0.0934795152914022,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004045,
|
|
"loss": 7.4517,
|
|
"mean_token_accuracy": 0.13969765827059746,
|
|
"num_tokens": 2040716.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 7.850926303863526,
|
|
"epoch": 0.09405654933641085,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00040699999999999997,
|
|
"loss": 7.5796,
|
|
"mean_token_accuracy": 0.12389181852340699,
|
|
"num_tokens": 2053240.0,
|
|
"step": 815
|
|
},
|
|
{
|
|
"entropy": 7.774610376358032,
|
|
"epoch": 0.0946335833814195,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004095,
|
|
"loss": 7.5473,
|
|
"mean_token_accuracy": 0.12548824697732924,
|
|
"num_tokens": 2065693.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 7.716372299194336,
|
|
"epoch": 0.09521061742642815,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000412,
|
|
"loss": 7.5014,
|
|
"mean_token_accuracy": 0.1397644318640232,
|
|
"num_tokens": 2077649.0,
|
|
"step": 825
|
|
},
|
|
{
|
|
"entropy": 7.756848621368408,
|
|
"epoch": 0.09578765147143682,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004145,
|
|
"loss": 7.5233,
|
|
"mean_token_accuracy": 0.1290776789188385,
|
|
"num_tokens": 2090780.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 7.749186420440674,
|
|
"epoch": 0.09636468551644548,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000417,
|
|
"loss": 7.5311,
|
|
"mean_token_accuracy": 0.13137806951999664,
|
|
"num_tokens": 2104096.0,
|
|
"step": 835
|
|
},
|
|
{
|
|
"entropy": 7.7773672580719,
|
|
"epoch": 0.09694171956145413,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004195,
|
|
"loss": 7.527,
|
|
"mean_token_accuracy": 0.12679293751716614,
|
|
"num_tokens": 2117157.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 7.73278284072876,
|
|
"epoch": 0.09751875360646278,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.000422,
|
|
"loss": 7.4858,
|
|
"mean_token_accuracy": 0.12687554210424423,
|
|
"num_tokens": 2129309.0,
|
|
"step": 845
|
|
},
|
|
{
|
|
"entropy": 7.768968677520752,
|
|
"epoch": 0.09809578765147144,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004245,
|
|
"loss": 7.5307,
|
|
"mean_token_accuracy": 0.13160400986671447,
|
|
"num_tokens": 2142344.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 7.714959239959716,
|
|
"epoch": 0.09867282169648009,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000427,
|
|
"loss": 7.5686,
|
|
"mean_token_accuracy": 0.1227949745953083,
|
|
"num_tokens": 2155059.0,
|
|
"step": 855
|
|
},
|
|
{
|
|
"entropy": 7.734045362472534,
|
|
"epoch": 0.09924985574148874,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004295,
|
|
"loss": 7.567,
|
|
"mean_token_accuracy": 0.12749878615140914,
|
|
"num_tokens": 2168901.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 7.731997871398926,
|
|
"epoch": 0.0998268897864974,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.000432,
|
|
"loss": 7.3702,
|
|
"mean_token_accuracy": 0.14134701043367387,
|
|
"num_tokens": 2180953.0,
|
|
"step": 865
|
|
},
|
|
{
|
|
"entropy": 7.591903018951416,
|
|
"epoch": 0.10040392383150606,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004345,
|
|
"loss": 7.4942,
|
|
"mean_token_accuracy": 0.1371511548757553,
|
|
"num_tokens": 2194097.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 7.695831298828125,
|
|
"epoch": 0.10098095787651472,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.000437,
|
|
"loss": 7.4334,
|
|
"mean_token_accuracy": 0.13365770354866982,
|
|
"num_tokens": 2206475.0,
|
|
"step": 875
|
|
},
|
|
{
|
|
"entropy": 7.78225154876709,
|
|
"epoch": 0.10155799192152337,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004395,
|
|
"loss": 7.4645,
|
|
"mean_token_accuracy": 0.1278185375034809,
|
|
"num_tokens": 2220006.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 7.65887417793274,
|
|
"epoch": 0.10213502596653203,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000442,
|
|
"loss": 7.5351,
|
|
"mean_token_accuracy": 0.12350780516862869,
|
|
"num_tokens": 2234082.0,
|
|
"step": 885
|
|
},
|
|
{
|
|
"entropy": 7.669657945632935,
|
|
"epoch": 0.10271206001154068,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004445,
|
|
"loss": 7.5227,
|
|
"mean_token_accuracy": 0.12489003017544746,
|
|
"num_tokens": 2246871.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 7.669128274917602,
|
|
"epoch": 0.10328909405654933,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.000447,
|
|
"loss": 7.4567,
|
|
"mean_token_accuracy": 0.13411386385560037,
|
|
"num_tokens": 2260172.0,
|
|
"step": 895
|
|
},
|
|
{
|
|
"entropy": 7.77032732963562,
|
|
"epoch": 0.10386612810155799,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00044950000000000003,
|
|
"loss": 7.5057,
|
|
"mean_token_accuracy": 0.11949166432023048,
|
|
"num_tokens": 2272848.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 7.673234939575195,
|
|
"epoch": 0.10444316214656665,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00045200000000000004,
|
|
"loss": 7.452,
|
|
"mean_token_accuracy": 0.12722696289420127,
|
|
"num_tokens": 2285673.0,
|
|
"step": 905
|
|
},
|
|
{
|
|
"entropy": 7.741328477859497,
|
|
"epoch": 0.10502019619157531,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045450000000000004,
|
|
"loss": 7.489,
|
|
"mean_token_accuracy": 0.12697241380810736,
|
|
"num_tokens": 2298459.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 7.641606569290161,
|
|
"epoch": 0.10559723023658396,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00045700000000000005,
|
|
"loss": 7.448,
|
|
"mean_token_accuracy": 0.13017196208238602,
|
|
"num_tokens": 2311226.0,
|
|
"step": 915
|
|
},
|
|
{
|
|
"entropy": 7.574088287353516,
|
|
"epoch": 0.10617426428159261,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00045950000000000006,
|
|
"loss": 7.3847,
|
|
"mean_token_accuracy": 0.1277943417429924,
|
|
"num_tokens": 2323481.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 7.646576309204102,
|
|
"epoch": 0.10675129832660127,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.000462,
|
|
"loss": 7.414,
|
|
"mean_token_accuracy": 0.1307280629873276,
|
|
"num_tokens": 2336181.0,
|
|
"step": 925
|
|
},
|
|
{
|
|
"entropy": 7.636479043960572,
|
|
"epoch": 0.10732833237160992,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004645,
|
|
"loss": 7.3716,
|
|
"mean_token_accuracy": 0.13296475633978844,
|
|
"num_tokens": 2348941.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 7.661097192764283,
|
|
"epoch": 0.10790536641661858,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.000467,
|
|
"loss": 7.3294,
|
|
"mean_token_accuracy": 0.12712401077151297,
|
|
"num_tokens": 2361618.0,
|
|
"step": 935
|
|
},
|
|
{
|
|
"entropy": 7.540031290054321,
|
|
"epoch": 0.10848240046162723,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004695,
|
|
"loss": 7.2806,
|
|
"mean_token_accuracy": 0.14269692525267602,
|
|
"num_tokens": 2376108.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 7.573352289199829,
|
|
"epoch": 0.1090594345066359,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000472,
|
|
"loss": 7.382,
|
|
"mean_token_accuracy": 0.13606224954128265,
|
|
"num_tokens": 2387774.0,
|
|
"step": 945
|
|
},
|
|
{
|
|
"entropy": 7.616125917434692,
|
|
"epoch": 0.10963646855164455,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004745,
|
|
"loss": 7.4187,
|
|
"mean_token_accuracy": 0.13490517437458038,
|
|
"num_tokens": 2400816.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 7.538399982452392,
|
|
"epoch": 0.1102135025966532,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.000477,
|
|
"loss": 7.3513,
|
|
"mean_token_accuracy": 0.13397277891635895,
|
|
"num_tokens": 2412970.0,
|
|
"step": 955
|
|
},
|
|
{
|
|
"entropy": 7.531917762756348,
|
|
"epoch": 0.11079053664166186,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004795,
|
|
"loss": 7.3595,
|
|
"mean_token_accuracy": 0.13522982075810433,
|
|
"num_tokens": 2424622.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 7.65097861289978,
|
|
"epoch": 0.11136757068667051,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.000482,
|
|
"loss": 7.4384,
|
|
"mean_token_accuracy": 0.13235584348440171,
|
|
"num_tokens": 2437293.0,
|
|
"step": 965
|
|
},
|
|
{
|
|
"entropy": 7.556930351257324,
|
|
"epoch": 0.11194460473167916,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004845,
|
|
"loss": 7.3101,
|
|
"mean_token_accuracy": 0.13271362110972404,
|
|
"num_tokens": 2449934.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 7.62783989906311,
|
|
"epoch": 0.11252163877668782,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.000487,
|
|
"loss": 7.3979,
|
|
"mean_token_accuracy": 0.12683349400758742,
|
|
"num_tokens": 2463139.0,
|
|
"step": 975
|
|
},
|
|
{
|
|
"entropy": 7.5757801055908205,
|
|
"epoch": 0.11309867282169649,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004895,
|
|
"loss": 7.4281,
|
|
"mean_token_accuracy": 0.1270056739449501,
|
|
"num_tokens": 2474273.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 7.627140283584595,
|
|
"epoch": 0.11367570686670514,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000492,
|
|
"loss": 7.381,
|
|
"mean_token_accuracy": 0.1371190808713436,
|
|
"num_tokens": 2486643.0,
|
|
"step": 985
|
|
},
|
|
{
|
|
"entropy": 7.516345596313476,
|
|
"epoch": 0.1142527409117138,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004945,
|
|
"loss": 7.3769,
|
|
"mean_token_accuracy": 0.12875159829854965,
|
|
"num_tokens": 2499018.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 7.49490532875061,
|
|
"epoch": 0.11482977495672245,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000497,
|
|
"loss": 7.3419,
|
|
"mean_token_accuracy": 0.1379355698823929,
|
|
"num_tokens": 2510463.0,
|
|
"step": 995
|
|
},
|
|
{
|
|
"entropy": 7.580066394805908,
|
|
"epoch": 0.1154068090017311,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004995,
|
|
"loss": 7.3689,
|
|
"mean_token_accuracy": 0.13574447557330133,
|
|
"num_tokens": 2522671.0,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"entropy": 7.525820398330689,
|
|
"epoch": 0.11598384304673975,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004999999975783157,
|
|
"loss": 7.3706,
|
|
"mean_token_accuracy": 0.1312769442796707,
|
|
"num_tokens": 2534508.0,
|
|
"step": 1005
|
|
},
|
|
{
|
|
"entropy": 7.571441793441773,
|
|
"epoch": 0.11656087709174841,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004999999877402236,
|
|
"loss": 7.3274,
|
|
"mean_token_accuracy": 0.13784680590033532,
|
|
"num_tokens": 2546804.0,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"entropy": 7.521267461776733,
|
|
"epoch": 0.11713791113675708,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004999999703343686,
|
|
"loss": 7.3429,
|
|
"mean_token_accuracy": 0.13090137392282486,
|
|
"num_tokens": 2558786.0,
|
|
"step": 1015
|
|
},
|
|
{
|
|
"entropy": 7.574562740325928,
|
|
"epoch": 0.11771494518176573,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004999999453607515,
|
|
"loss": 7.3165,
|
|
"mean_token_accuracy": 0.13034487813711165,
|
|
"num_tokens": 2570834.0,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"entropy": 7.461473798751831,
|
|
"epoch": 0.11829197922677438,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004999999128193729,
|
|
"loss": 7.2709,
|
|
"mean_token_accuracy": 0.14077538400888442,
|
|
"num_tokens": 2583342.0,
|
|
"step": 1025
|
|
},
|
|
{
|
|
"entropy": 7.511537408828735,
|
|
"epoch": 0.11886901327178304,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000499999872710234,
|
|
"loss": 7.3162,
|
|
"mean_token_accuracy": 0.1330413155257702,
|
|
"num_tokens": 2594878.0,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"entropy": 7.390342903137207,
|
|
"epoch": 0.11944604731679169,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004999998250333361,
|
|
"loss": 7.281,
|
|
"mean_token_accuracy": 0.13540845960378647,
|
|
"num_tokens": 2607070.0,
|
|
"step": 1035
|
|
},
|
|
{
|
|
"entropy": 7.526187515258789,
|
|
"epoch": 0.12002308136180034,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.000499999769788681,
|
|
"loss": 7.3157,
|
|
"mean_token_accuracy": 0.13957726508378981,
|
|
"num_tokens": 2620761.0,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"entropy": 7.498535776138306,
|
|
"epoch": 0.120600115406809,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004999997069762703,
|
|
"loss": 7.3307,
|
|
"mean_token_accuracy": 0.1318868264555931,
|
|
"num_tokens": 2634161.0,
|
|
"step": 1045
|
|
},
|
|
{
|
|
"entropy": 7.453407907485962,
|
|
"epoch": 0.12117714945181765,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004999996365961062,
|
|
"loss": 7.2874,
|
|
"mean_token_accuracy": 0.1383284404873848,
|
|
"num_tokens": 2647459.0,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"entropy": 7.446234273910522,
|
|
"epoch": 0.12175418349682632,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004999995586481912,
|
|
"loss": 7.2872,
|
|
"mean_token_accuracy": 0.1340254984796047,
|
|
"num_tokens": 2660840.0,
|
|
"step": 1055
|
|
},
|
|
{
|
|
"entropy": 7.483492088317871,
|
|
"epoch": 0.12233121754183497,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004999994731325276,
|
|
"loss": 7.2865,
|
|
"mean_token_accuracy": 0.13337128460407258,
|
|
"num_tokens": 2672673.0,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"entropy": 7.395563697814941,
|
|
"epoch": 0.12290825158684363,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004999993800491187,
|
|
"loss": 7.2987,
|
|
"mean_token_accuracy": 0.13419368714094163,
|
|
"num_tokens": 2685744.0,
|
|
"step": 1065
|
|
},
|
|
{
|
|
"entropy": 7.416986179351807,
|
|
"epoch": 0.12348528563185228,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004999992793979672,
|
|
"loss": 7.2196,
|
|
"mean_token_accuracy": 0.14943781048059462,
|
|
"num_tokens": 2697068.0,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"entropy": 7.524578285217285,
|
|
"epoch": 0.12406231967686093,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004999991711790769,
|
|
"loss": 7.3467,
|
|
"mean_token_accuracy": 0.12948699221014975,
|
|
"num_tokens": 2710418.0,
|
|
"step": 1075
|
|
},
|
|
{
|
|
"entropy": 7.54997706413269,
|
|
"epoch": 0.12463935372186959,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004999990553924511,
|
|
"loss": 7.3065,
|
|
"mean_token_accuracy": 0.12690478786826134,
|
|
"num_tokens": 2722440.0,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"entropy": 7.381335258483887,
|
|
"epoch": 0.12521638776687824,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004999989320380939,
|
|
"loss": 7.2963,
|
|
"mean_token_accuracy": 0.12917414531111718,
|
|
"num_tokens": 2735486.0,
|
|
"step": 1085
|
|
},
|
|
{
|
|
"entropy": 7.532785177230835,
|
|
"epoch": 0.1257934218118869,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004999988011160094,
|
|
"loss": 7.3223,
|
|
"mean_token_accuracy": 0.13123588562011718,
|
|
"num_tokens": 2747620.0,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"entropy": 7.407538604736328,
|
|
"epoch": 0.12637045585689555,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.000499998662626202,
|
|
"loss": 7.2571,
|
|
"mean_token_accuracy": 0.1341471828520298,
|
|
"num_tokens": 2760987.0,
|
|
"step": 1095
|
|
},
|
|
{
|
|
"entropy": 7.483826351165772,
|
|
"epoch": 0.12694748990190421,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004999985165686764,
|
|
"loss": 7.234,
|
|
"mean_token_accuracy": 0.1353903256356716,
|
|
"num_tokens": 2773161.0,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"entropy": 7.336683225631714,
|
|
"epoch": 0.12752452394691285,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004999983629434373,
|
|
"loss": 7.1573,
|
|
"mean_token_accuracy": 0.15311394929885863,
|
|
"num_tokens": 2786179.0,
|
|
"step": 1105
|
|
},
|
|
{
|
|
"entropy": 7.440242195129395,
|
|
"epoch": 0.12810155799192152,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004999982017504901,
|
|
"loss": 7.1926,
|
|
"mean_token_accuracy": 0.14265231788158417,
|
|
"num_tokens": 2798859.0,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"entropy": 7.385885190963745,
|
|
"epoch": 0.1286785920369302,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004999980329898401,
|
|
"loss": 7.2944,
|
|
"mean_token_accuracy": 0.1360294461250305,
|
|
"num_tokens": 2813048.0,
|
|
"step": 1115
|
|
},
|
|
{
|
|
"entropy": 7.456379127502442,
|
|
"epoch": 0.12925562608193883,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.000499997856661493,
|
|
"loss": 7.2612,
|
|
"mean_token_accuracy": 0.13587961345911026,
|
|
"num_tokens": 2826032.0,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"entropy": 7.430348825454712,
|
|
"epoch": 0.1298326601269475,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.000499997672765455,
|
|
"loss": 7.2962,
|
|
"mean_token_accuracy": 0.13529185801744462,
|
|
"num_tokens": 2839253.0,
|
|
"step": 1125
|
|
},
|
|
{
|
|
"entropy": 7.3566066265106205,
|
|
"epoch": 0.13040969417195614,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004999974813017318,
|
|
"loss": 7.2183,
|
|
"mean_token_accuracy": 0.14149424508213998,
|
|
"num_tokens": 2852542.0,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"entropy": 7.3935285091400145,
|
|
"epoch": 0.1309867282169648,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004999972822703301,
|
|
"loss": 7.2395,
|
|
"mean_token_accuracy": 0.14146022573113443,
|
|
"num_tokens": 2863967.0,
|
|
"step": 1135
|
|
},
|
|
{
|
|
"entropy": 7.422988605499268,
|
|
"epoch": 0.13156376226197344,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004999970756712567,
|
|
"loss": 7.3171,
|
|
"mean_token_accuracy": 0.13306807354092598,
|
|
"num_tokens": 2876141.0,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"entropy": 7.2979803562164305,
|
|
"epoch": 0.1321407963069821,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004999968615045183,
|
|
"loss": 7.145,
|
|
"mean_token_accuracy": 0.14133854061365128,
|
|
"num_tokens": 2888395.0,
|
|
"step": 1145
|
|
},
|
|
{
|
|
"entropy": 7.431983804702758,
|
|
"epoch": 0.13271783035199078,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004999966397701222,
|
|
"loss": 7.3261,
|
|
"mean_token_accuracy": 0.12834407463669778,
|
|
"num_tokens": 2902399.0,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"entropy": 7.406958770751953,
|
|
"epoch": 0.13329486439699942,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004999964104680759,
|
|
"loss": 7.0835,
|
|
"mean_token_accuracy": 0.1402672976255417,
|
|
"num_tokens": 2914999.0,
|
|
"step": 1155
|
|
},
|
|
{
|
|
"entropy": 7.348841714859009,
|
|
"epoch": 0.13387189844200809,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004999961735983871,
|
|
"loss": 7.0785,
|
|
"mean_token_accuracy": 0.1498357504606247,
|
|
"num_tokens": 2928091.0,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"entropy": 7.33998703956604,
|
|
"epoch": 0.13444893248701673,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004999959291610639,
|
|
"loss": 7.2138,
|
|
"mean_token_accuracy": 0.1341881737112999,
|
|
"num_tokens": 2940840.0,
|
|
"step": 1165
|
|
},
|
|
{
|
|
"entropy": 7.289854049682617,
|
|
"epoch": 0.1350259665320254,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004999956771561143,
|
|
"loss": 7.1303,
|
|
"mean_token_accuracy": 0.14412761703133584,
|
|
"num_tokens": 2952980.0,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"entropy": 7.357520866394043,
|
|
"epoch": 0.13560300057703403,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004999954175835469,
|
|
"loss": 7.1748,
|
|
"mean_token_accuracy": 0.13631198480725287,
|
|
"num_tokens": 2965437.0,
|
|
"step": 1175
|
|
},
|
|
{
|
|
"entropy": 7.3787942886352536,
|
|
"epoch": 0.1361800346220427,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004999951504433703,
|
|
"loss": 7.2047,
|
|
"mean_token_accuracy": 0.1348996601998806,
|
|
"num_tokens": 2978077.0,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"entropy": 7.40587363243103,
|
|
"epoch": 0.13675706866705137,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004999948757355935,
|
|
"loss": 7.298,
|
|
"mean_token_accuracy": 0.13351393342018128,
|
|
"num_tokens": 2990498.0,
|
|
"step": 1185
|
|
},
|
|
{
|
|
"entropy": 7.413915586471558,
|
|
"epoch": 0.13733410271206,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.000499994593460226,
|
|
"loss": 7.2412,
|
|
"mean_token_accuracy": 0.1355881556868553,
|
|
"num_tokens": 3002784.0,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"entropy": 7.372391653060913,
|
|
"epoch": 0.13791113675706868,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004999943036172771,
|
|
"loss": 7.1807,
|
|
"mean_token_accuracy": 0.13228997811675072,
|
|
"num_tokens": 3015689.0,
|
|
"step": 1195
|
|
},
|
|
{
|
|
"entropy": 7.241599178314209,
|
|
"epoch": 0.13848817080207732,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004999940062067565,
|
|
"loss": 7.1264,
|
|
"mean_token_accuracy": 0.1455356404185295,
|
|
"num_tokens": 3026623.0,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"entropy": 7.376918649673462,
|
|
"epoch": 0.13906520484708598,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004999937012286742,
|
|
"loss": 7.1615,
|
|
"mean_token_accuracy": 0.1412371888756752,
|
|
"num_tokens": 3039769.0,
|
|
"step": 1205
|
|
},
|
|
{
|
|
"entropy": 7.27626667022705,
|
|
"epoch": 0.13964223889209462,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004999933886830405,
|
|
"loss": 7.1505,
|
|
"mean_token_accuracy": 0.13528102561831473,
|
|
"num_tokens": 3052044.0,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"entropy": 7.345494079589844,
|
|
"epoch": 0.1402192729371033,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000499993068569866,
|
|
"loss": 7.1241,
|
|
"mean_token_accuracy": 0.1391813077032566,
|
|
"num_tokens": 3063937.0,
|
|
"step": 1215
|
|
},
|
|
{
|
|
"entropy": 7.187998628616333,
|
|
"epoch": 0.14079630698211196,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999927408891614,
|
|
"loss": 7.0939,
|
|
"mean_token_accuracy": 0.14361393451690674,
|
|
"num_tokens": 3076645.0,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"entropy": 7.401137399673462,
|
|
"epoch": 0.1413733410271206,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004999924056409378,
|
|
"loss": 7.1542,
|
|
"mean_token_accuracy": 0.13744900077581407,
|
|
"num_tokens": 3088985.0,
|
|
"step": 1225
|
|
},
|
|
{
|
|
"entropy": 7.271087980270385,
|
|
"epoch": 0.14195037507212926,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004999920628252063,
|
|
"loss": 7.1543,
|
|
"mean_token_accuracy": 0.1385358177125454,
|
|
"num_tokens": 3101270.0,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"entropy": 7.236308813095093,
|
|
"epoch": 0.1425274091171379,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004999917124419785,
|
|
"loss": 7.1713,
|
|
"mean_token_accuracy": 0.13507955446839331,
|
|
"num_tokens": 3115420.0,
|
|
"step": 1235
|
|
},
|
|
{
|
|
"entropy": 7.414693069458008,
|
|
"epoch": 0.14310444316214657,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004999913544912664,
|
|
"loss": 7.1106,
|
|
"mean_token_accuracy": 0.13970131129026414,
|
|
"num_tokens": 3126176.0,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"entropy": 7.252271461486816,
|
|
"epoch": 0.1436814772071552,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004999909889730817,
|
|
"loss": 7.1516,
|
|
"mean_token_accuracy": 0.14178458228707314,
|
|
"num_tokens": 3139136.0,
|
|
"step": 1245
|
|
},
|
|
{
|
|
"entropy": 7.280838823318481,
|
|
"epoch": 0.14425851125216388,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004999906158874368,
|
|
"loss": 7.1044,
|
|
"mean_token_accuracy": 0.1472743645310402,
|
|
"num_tokens": 3152036.0,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"entropy": 7.349875354766846,
|
|
"epoch": 0.14483554529717255,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004999902352343444,
|
|
"loss": 7.1386,
|
|
"mean_token_accuracy": 0.14143830314278602,
|
|
"num_tokens": 3164060.0,
|
|
"step": 1255
|
|
},
|
|
{
|
|
"entropy": 7.355139827728271,
|
|
"epoch": 0.1454125793421812,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004999898470138171,
|
|
"loss": 7.206,
|
|
"mean_token_accuracy": 0.12975897416472434,
|
|
"num_tokens": 3176410.0,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"entropy": 7.291885662078857,
|
|
"epoch": 0.14598961338718985,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004999894512258681,
|
|
"loss": 7.2261,
|
|
"mean_token_accuracy": 0.13479177728295327,
|
|
"num_tokens": 3189784.0,
|
|
"step": 1265
|
|
},
|
|
{
|
|
"entropy": 7.3698536396026615,
|
|
"epoch": 0.1465666474321985,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004999890478705107,
|
|
"loss": 7.1471,
|
|
"mean_token_accuracy": 0.1365978240966797,
|
|
"num_tokens": 3202274.0,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"entropy": 7.3492168426513675,
|
|
"epoch": 0.14714368147720716,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004999886369477585,
|
|
"loss": 7.2021,
|
|
"mean_token_accuracy": 0.13651041984558104,
|
|
"num_tokens": 3215593.0,
|
|
"step": 1275
|
|
},
|
|
{
|
|
"entropy": 7.264506483078003,
|
|
"epoch": 0.1477207155222158,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004999882184576251,
|
|
"loss": 7.1145,
|
|
"mean_token_accuracy": 0.1358187846839428,
|
|
"num_tokens": 3228307.0,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"entropy": 7.262033987045288,
|
|
"epoch": 0.14829774956722447,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004999877924001248,
|
|
"loss": 7.0714,
|
|
"mean_token_accuracy": 0.13908419981598855,
|
|
"num_tokens": 3241676.0,
|
|
"step": 1285
|
|
},
|
|
{
|
|
"entropy": 7.289368486404419,
|
|
"epoch": 0.1488747836122331,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004999873587752718,
|
|
"loss": 7.1412,
|
|
"mean_token_accuracy": 0.13665730655193328,
|
|
"num_tokens": 3255190.0,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"entropy": 7.299326705932617,
|
|
"epoch": 0.14945181765724178,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004999869175830808,
|
|
"loss": 7.1635,
|
|
"mean_token_accuracy": 0.13522787094116212,
|
|
"num_tokens": 3268236.0,
|
|
"step": 1295
|
|
},
|
|
{
|
|
"entropy": 7.349583387374878,
|
|
"epoch": 0.15002885170225044,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004999864688235666,
|
|
"loss": 7.1786,
|
|
"mean_token_accuracy": 0.13588001057505608,
|
|
"num_tokens": 3281316.0,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"entropy": 7.291733837127685,
|
|
"epoch": 0.15060588574725908,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004999860124967442,
|
|
"loss": 7.0853,
|
|
"mean_token_accuracy": 0.1390770271420479,
|
|
"num_tokens": 3293517.0,
|
|
"step": 1305
|
|
},
|
|
{
|
|
"entropy": 7.185279273986817,
|
|
"epoch": 0.15118291979226775,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004999855486026291,
|
|
"loss": 7.0715,
|
|
"mean_token_accuracy": 0.14518356174230576,
|
|
"num_tokens": 3306814.0,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"entropy": 7.301711988449097,
|
|
"epoch": 0.1517599538372764,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004999850771412369,
|
|
"loss": 7.1333,
|
|
"mean_token_accuracy": 0.13459300100803376,
|
|
"num_tokens": 3318722.0,
|
|
"step": 1315
|
|
},
|
|
{
|
|
"entropy": 7.199785852432251,
|
|
"epoch": 0.15233698788228506,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004999845981125832,
|
|
"loss": 7.0873,
|
|
"mean_token_accuracy": 0.14142397046089172,
|
|
"num_tokens": 3331212.0,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"entropy": 7.31465106010437,
|
|
"epoch": 0.1529140219272937,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004999841115166844,
|
|
"loss": 7.0661,
|
|
"mean_token_accuracy": 0.13654675781726838,
|
|
"num_tokens": 3343999.0,
|
|
"step": 1325
|
|
},
|
|
{
|
|
"entropy": 7.124961471557617,
|
|
"epoch": 0.15349105597230236,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004999836173535568,
|
|
"loss": 7.0068,
|
|
"mean_token_accuracy": 0.14172771871089934,
|
|
"num_tokens": 3356281.0,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"entropy": 7.201707267761231,
|
|
"epoch": 0.15406809001731103,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004999831156232169,
|
|
"loss": 7.0726,
|
|
"mean_token_accuracy": 0.1406794235110283,
|
|
"num_tokens": 3369370.0,
|
|
"step": 1335
|
|
},
|
|
{
|
|
"entropy": 7.341475009918213,
|
|
"epoch": 0.15464512406231967,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004999826063256818,
|
|
"loss": 7.2012,
|
|
"mean_token_accuracy": 0.13309285268187523,
|
|
"num_tokens": 3382400.0,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"entropy": 7.232538366317749,
|
|
"epoch": 0.15522215810732834,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004999820894609683,
|
|
"loss": 7.0778,
|
|
"mean_token_accuracy": 0.13890645131468773,
|
|
"num_tokens": 3393666.0,
|
|
"step": 1345
|
|
},
|
|
{
|
|
"entropy": 7.243199300765991,
|
|
"epoch": 0.15579919215233698,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004999815650290941,
|
|
"loss": 7.0914,
|
|
"mean_token_accuracy": 0.1401012994349003,
|
|
"num_tokens": 3405920.0,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"entropy": 7.1591578960418705,
|
|
"epoch": 0.15637622619734565,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004999810330300766,
|
|
"loss": 6.9923,
|
|
"mean_token_accuracy": 0.14642595648765563,
|
|
"num_tokens": 3417886.0,
|
|
"step": 1355
|
|
},
|
|
{
|
|
"entropy": 7.254940557479858,
|
|
"epoch": 0.1569532602423543,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.000499980493463934,
|
|
"loss": 7.1075,
|
|
"mean_token_accuracy": 0.13476622179150582,
|
|
"num_tokens": 3430626.0,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"entropy": 7.202736520767212,
|
|
"epoch": 0.15753029428736295,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004999799463306841,
|
|
"loss": 7.0076,
|
|
"mean_token_accuracy": 0.1388716422021389,
|
|
"num_tokens": 3443248.0,
|
|
"step": 1365
|
|
},
|
|
{
|
|
"entropy": 7.213499069213867,
|
|
"epoch": 0.15810732833237162,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004999793916303455,
|
|
"loss": 7.0503,
|
|
"mean_token_accuracy": 0.13839739933609962,
|
|
"num_tokens": 3456163.0,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"entropy": 7.167108821868896,
|
|
"epoch": 0.15868436237738026,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004999788293629368,
|
|
"loss": 7.0754,
|
|
"mean_token_accuracy": 0.13633116707205772,
|
|
"num_tokens": 3468862.0,
|
|
"step": 1375
|
|
},
|
|
{
|
|
"entropy": 7.2402849197387695,
|
|
"epoch": 0.15926139642238893,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.000499978259528477,
|
|
"loss": 7.0663,
|
|
"mean_token_accuracy": 0.14658810272812844,
|
|
"num_tokens": 3481516.0,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"entropy": 7.265804767608643,
|
|
"epoch": 0.15983843046739757,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004999776821269852,
|
|
"loss": 7.1273,
|
|
"mean_token_accuracy": 0.12971169799566268,
|
|
"num_tokens": 3493063.0,
|
|
"step": 1385
|
|
},
|
|
{
|
|
"entropy": 7.229140663146973,
|
|
"epoch": 0.16041546451240624,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004999770971584807,
|
|
"loss": 7.0123,
|
|
"mean_token_accuracy": 0.13699770867824554,
|
|
"num_tokens": 3505460.0,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"entropy": 7.235083723068238,
|
|
"epoch": 0.16099249855741488,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004999765046229834,
|
|
"loss": 7.1218,
|
|
"mean_token_accuracy": 0.13258355781435965,
|
|
"num_tokens": 3519232.0,
|
|
"step": 1395
|
|
},
|
|
{
|
|
"entropy": 7.22713418006897,
|
|
"epoch": 0.16156953260242354,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000499975904520513,
|
|
"loss": 7.0295,
|
|
"mean_token_accuracy": 0.1445997752249241,
|
|
"num_tokens": 3531759.0,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"entropy": 7.201732730865478,
|
|
"epoch": 0.1621465666474322,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00049997529685109,
|
|
"loss": 6.9829,
|
|
"mean_token_accuracy": 0.15084661841392516,
|
|
"num_tokens": 3543457.0,
|
|
"step": 1405
|
|
},
|
|
{
|
|
"entropy": 7.160426235198974,
|
|
"epoch": 0.16272360069244085,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004999746816147344,
|
|
"loss": 7.1195,
|
|
"mean_token_accuracy": 0.1298399582505226,
|
|
"num_tokens": 3557036.0,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"entropy": 7.306451225280762,
|
|
"epoch": 0.16330063473744952,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004999740588114673,
|
|
"loss": 7.0716,
|
|
"mean_token_accuracy": 0.1405071273446083,
|
|
"num_tokens": 3569415.0,
|
|
"step": 1415
|
|
},
|
|
{
|
|
"entropy": 7.171466588973999,
|
|
"epoch": 0.16387766878245816,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004999734284413095,
|
|
"loss": 7.0696,
|
|
"mean_token_accuracy": 0.13537402525544168,
|
|
"num_tokens": 3581452.0,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"entropy": 7.184612178802491,
|
|
"epoch": 0.16445470282746683,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.000499972790504282,
|
|
"loss": 7.094,
|
|
"mean_token_accuracy": 0.13849470168352127,
|
|
"num_tokens": 3593482.0,
|
|
"step": 1425
|
|
},
|
|
{
|
|
"entropy": 7.202459335327148,
|
|
"epoch": 0.16503173687247547,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004999721450004067,
|
|
"loss": 7.0864,
|
|
"mean_token_accuracy": 0.13760560154914855,
|
|
"num_tokens": 3606062.0,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"entropy": 7.222452545166016,
|
|
"epoch": 0.16560877091748413,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004999714919297049,
|
|
"loss": 7.0499,
|
|
"mean_token_accuracy": 0.14111001044511795,
|
|
"num_tokens": 3619210.0,
|
|
"step": 1435
|
|
},
|
|
{
|
|
"entropy": 7.180074310302734,
|
|
"epoch": 0.1661858049624928,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004999708312921987,
|
|
"loss": 7.0919,
|
|
"mean_token_accuracy": 0.13837566673755647,
|
|
"num_tokens": 3631952.0,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"entropy": 7.17976598739624,
|
|
"epoch": 0.16676283900750144,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004999701630879103,
|
|
"loss": 6.9734,
|
|
"mean_token_accuracy": 0.14263298735022545,
|
|
"num_tokens": 3644864.0,
|
|
"step": 1445
|
|
},
|
|
{
|
|
"entropy": 7.166555690765381,
|
|
"epoch": 0.1673398730525101,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004999694873168623,
|
|
"loss": 7.0507,
|
|
"mean_token_accuracy": 0.1378322072327137,
|
|
"num_tokens": 3657504.0,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"entropy": 7.19564905166626,
|
|
"epoch": 0.16791690709751875,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004999688039790773,
|
|
"loss": 6.9587,
|
|
"mean_token_accuracy": 0.14702803492546082,
|
|
"num_tokens": 3670304.0,
|
|
"step": 1455
|
|
},
|
|
{
|
|
"entropy": 7.150408220291138,
|
|
"epoch": 0.16849394114252741,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004999681130745784,
|
|
"loss": 6.9859,
|
|
"mean_token_accuracy": 0.13595322594046594,
|
|
"num_tokens": 3681503.0,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"entropy": 7.162327766418457,
|
|
"epoch": 0.16907097518753605,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004999674146033888,
|
|
"loss": 7.0123,
|
|
"mean_token_accuracy": 0.137976536154747,
|
|
"num_tokens": 3693248.0,
|
|
"step": 1465
|
|
},
|
|
{
|
|
"entropy": 7.136591291427612,
|
|
"epoch": 0.16964800923254472,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004999667085655318,
|
|
"loss": 7.0248,
|
|
"mean_token_accuracy": 0.14202336519956588,
|
|
"num_tokens": 3705285.0,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"entropy": 7.1525966167449955,
|
|
"epoch": 0.1702250432775534,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004999659949610313,
|
|
"loss": 7.0489,
|
|
"mean_token_accuracy": 0.13094842061400414,
|
|
"num_tokens": 3719025.0,
|
|
"step": 1475
|
|
},
|
|
{
|
|
"entropy": 7.2398560523986815,
|
|
"epoch": 0.17080207732256203,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004999652737899114,
|
|
"loss": 7.0371,
|
|
"mean_token_accuracy": 0.14026156663894654,
|
|
"num_tokens": 3732054.0,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"entropy": 7.175600671768189,
|
|
"epoch": 0.1713791113675707,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004999645450521963,
|
|
"loss": 7.0023,
|
|
"mean_token_accuracy": 0.141888265311718,
|
|
"num_tokens": 3744080.0,
|
|
"step": 1485
|
|
},
|
|
{
|
|
"entropy": 7.114497375488281,
|
|
"epoch": 0.17195614541257934,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004999638087479104,
|
|
"loss": 7.0391,
|
|
"mean_token_accuracy": 0.13951010257005692,
|
|
"num_tokens": 3756371.0,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"entropy": 7.245286512374878,
|
|
"epoch": 0.172533179457588,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004999630648770786,
|
|
"loss": 6.9683,
|
|
"mean_token_accuracy": 0.1364215262234211,
|
|
"num_tokens": 3769307.0,
|
|
"step": 1495
|
|
},
|
|
{
|
|
"entropy": 7.008484745025635,
|
|
"epoch": 0.17311021350259664,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004999623134397257,
|
|
"loss": 6.9637,
|
|
"mean_token_accuracy": 0.14434833228588104,
|
|
"num_tokens": 3782826.0,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"entropy": 7.155062961578369,
|
|
"epoch": 0.1736872475476053,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004999615544358774,
|
|
"loss": 6.969,
|
|
"mean_token_accuracy": 0.13818738386034965,
|
|
"num_tokens": 3794566.0,
|
|
"step": 1505
|
|
},
|
|
{
|
|
"entropy": 7.102244281768799,
|
|
"epoch": 0.17426428159261395,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004999607878655587,
|
|
"loss": 7.0508,
|
|
"mean_token_accuracy": 0.13246384710073472,
|
|
"num_tokens": 3807058.0,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"entropy": 7.190773010253906,
|
|
"epoch": 0.17484131563762262,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004999600137287958,
|
|
"loss": 6.9966,
|
|
"mean_token_accuracy": 0.1451525256037712,
|
|
"num_tokens": 3819836.0,
|
|
"step": 1515
|
|
},
|
|
{
|
|
"entropy": 7.112970066070557,
|
|
"epoch": 0.17541834968263129,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004999592320256146,
|
|
"loss": 7.0526,
|
|
"mean_token_accuracy": 0.13325869366526605,
|
|
"num_tokens": 3832081.0,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"entropy": 7.19920711517334,
|
|
"epoch": 0.17599538372763993,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004999584427560412,
|
|
"loss": 6.9666,
|
|
"mean_token_accuracy": 0.14759944379329681,
|
|
"num_tokens": 3843279.0,
|
|
"step": 1525
|
|
},
|
|
{
|
|
"entropy": 7.110972738265991,
|
|
"epoch": 0.1765724177726486,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004999576459201024,
|
|
"loss": 7.0377,
|
|
"mean_token_accuracy": 0.14277849197387696,
|
|
"num_tokens": 3855479.0,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"entropy": 7.166525030136109,
|
|
"epoch": 0.17714945181765723,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.000499956841517825,
|
|
"loss": 7.0261,
|
|
"mean_token_accuracy": 0.14007299840450288,
|
|
"num_tokens": 3868111.0,
|
|
"step": 1535
|
|
},
|
|
{
|
|
"entropy": 7.039232683181763,
|
|
"epoch": 0.1777264858626659,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000499956029549236,
|
|
"loss": 6.9523,
|
|
"mean_token_accuracy": 0.14354307875037192,
|
|
"num_tokens": 3880062.0,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"entropy": 7.2218320846557615,
|
|
"epoch": 0.17830351990767454,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004999552100143625,
|
|
"loss": 7.038,
|
|
"mean_token_accuracy": 0.1351063035428524,
|
|
"num_tokens": 3892293.0,
|
|
"step": 1545
|
|
},
|
|
{
|
|
"entropy": 7.088453531265259,
|
|
"epoch": 0.1788805539526832,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004999543829132324,
|
|
"loss": 6.9011,
|
|
"mean_token_accuracy": 0.14455311074852945,
|
|
"num_tokens": 3904549.0,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"entropy": 7.0796609878540036,
|
|
"epoch": 0.17945758799769188,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004999535482458734,
|
|
"loss": 6.952,
|
|
"mean_token_accuracy": 0.14381684213876725,
|
|
"num_tokens": 3916693.0,
|
|
"step": 1555
|
|
},
|
|
{
|
|
"entropy": 7.087669706344604,
|
|
"epoch": 0.18003462204270052,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004999527060123135,
|
|
"loss": 6.9651,
|
|
"mean_token_accuracy": 0.13298058956861497,
|
|
"num_tokens": 3930488.0,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"entropy": 7.125672006607056,
|
|
"epoch": 0.18061165608770918,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004999518562125811,
|
|
"loss": 6.9626,
|
|
"mean_token_accuracy": 0.14101526886224747,
|
|
"num_tokens": 3942353.0,
|
|
"step": 1565
|
|
},
|
|
{
|
|
"entropy": 7.161968660354614,
|
|
"epoch": 0.18118869013271782,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004999509988467047,
|
|
"loss": 7.0103,
|
|
"mean_token_accuracy": 0.13919673189520837,
|
|
"num_tokens": 3953868.0,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"entropy": 7.124320602416992,
|
|
"epoch": 0.1817657241777265,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004999501339147132,
|
|
"loss": 7.0217,
|
|
"mean_token_accuracy": 0.1360984094440937,
|
|
"num_tokens": 3965148.0,
|
|
"step": 1575
|
|
},
|
|
{
|
|
"entropy": 7.110309076309204,
|
|
"epoch": 0.18234275822273513,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004999492614166357,
|
|
"loss": 6.9888,
|
|
"mean_token_accuracy": 0.14489941596984862,
|
|
"num_tokens": 3977323.0,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"entropy": 7.14143214225769,
|
|
"epoch": 0.1829197922677438,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004999483813525014,
|
|
"loss": 6.9486,
|
|
"mean_token_accuracy": 0.14665654599666594,
|
|
"num_tokens": 3990076.0,
|
|
"step": 1585
|
|
},
|
|
{
|
|
"entropy": 7.0736024379730225,
|
|
"epoch": 0.18349682631275246,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004999474937223403,
|
|
"loss": 6.958,
|
|
"mean_token_accuracy": 0.13847637176513672,
|
|
"num_tokens": 4001996.0,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"entropy": 7.1584230899810795,
|
|
"epoch": 0.1840738603577611,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004999465985261818,
|
|
"loss": 6.996,
|
|
"mean_token_accuracy": 0.13838272169232368,
|
|
"num_tokens": 4015095.0,
|
|
"step": 1595
|
|
},
|
|
{
|
|
"entropy": 7.085082769393921,
|
|
"epoch": 0.18465089440276977,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004999456957640562,
|
|
"loss": 6.8885,
|
|
"mean_token_accuracy": 0.14849510788917542,
|
|
"num_tokens": 4028633.0,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"entropy": 7.059274530410766,
|
|
"epoch": 0.1852279284477784,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004999447854359939,
|
|
"loss": 6.9902,
|
|
"mean_token_accuracy": 0.14084767922759056,
|
|
"num_tokens": 4042265.0,
|
|
"step": 1605
|
|
},
|
|
{
|
|
"entropy": 7.04382438659668,
|
|
"epoch": 0.18580496249278708,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004999438675420255,
|
|
"loss": 6.9434,
|
|
"mean_token_accuracy": 0.14098646268248557,
|
|
"num_tokens": 4054467.0,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"entropy": 7.100906753540039,
|
|
"epoch": 0.18638199653779572,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004999429420821818,
|
|
"loss": 6.9422,
|
|
"mean_token_accuracy": 0.14708167761564256,
|
|
"num_tokens": 4068053.0,
|
|
"step": 1615
|
|
},
|
|
{
|
|
"entropy": 6.988407993316651,
|
|
"epoch": 0.1869590305828044,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000499942009056494,
|
|
"loss": 6.9174,
|
|
"mean_token_accuracy": 0.14443018585443496,
|
|
"num_tokens": 4080867.0,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"entropy": 7.123555755615234,
|
|
"epoch": 0.18753606462781305,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004999410684649935,
|
|
"loss": 6.9813,
|
|
"mean_token_accuracy": 0.13821664601564407,
|
|
"num_tokens": 4093228.0,
|
|
"step": 1625
|
|
},
|
|
{
|
|
"entropy": 7.086485910415649,
|
|
"epoch": 0.1881130986728217,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004999401203077119,
|
|
"loss": 6.9764,
|
|
"mean_token_accuracy": 0.14208749383687974,
|
|
"num_tokens": 4104929.0,
|
|
"step": 1630
|
|
},
|
|
{
|
|
"entropy": 7.062161016464233,
|
|
"epoch": 0.18869013271783036,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.000499939164584681,
|
|
"loss": 6.9907,
|
|
"mean_token_accuracy": 0.15021519139409065,
|
|
"num_tokens": 4119445.0,
|
|
"step": 1635
|
|
},
|
|
{
|
|
"entropy": 7.106227540969849,
|
|
"epoch": 0.189267166762839,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004999382012959331,
|
|
"loss": 6.8918,
|
|
"mean_token_accuracy": 0.15079083889722825,
|
|
"num_tokens": 4131558.0,
|
|
"step": 1640
|
|
},
|
|
{
|
|
"entropy": 7.123133182525635,
|
|
"epoch": 0.18984420080784767,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004999372304415005,
|
|
"loss": 7.0313,
|
|
"mean_token_accuracy": 0.12920064106583595,
|
|
"num_tokens": 4144566.0,
|
|
"step": 1645
|
|
},
|
|
{
|
|
"entropy": 7.113665962219239,
|
|
"epoch": 0.1904212348528563,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004999362520214159,
|
|
"loss": 6.9219,
|
|
"mean_token_accuracy": 0.14697587639093398,
|
|
"num_tokens": 4157295.0,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"entropy": 7.081795692443848,
|
|
"epoch": 0.19099826889786498,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004999352660357122,
|
|
"loss": 6.9574,
|
|
"mean_token_accuracy": 0.1411465436220169,
|
|
"num_tokens": 4170229.0,
|
|
"step": 1655
|
|
},
|
|
{
|
|
"entropy": 7.1123281955719,
|
|
"epoch": 0.19157530294287364,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004999342724844226,
|
|
"loss": 6.9703,
|
|
"mean_token_accuracy": 0.13845267817378043,
|
|
"num_tokens": 4182906.0,
|
|
"step": 1660
|
|
},
|
|
{
|
|
"entropy": 7.087953901290893,
|
|
"epoch": 0.19215233698788228,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004999332713675804,
|
|
"loss": 6.9325,
|
|
"mean_token_accuracy": 0.143193506449461,
|
|
"num_tokens": 4195556.0,
|
|
"step": 1665
|
|
},
|
|
{
|
|
"entropy": 7.084608936309815,
|
|
"epoch": 0.19272937103289095,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004999322626852193,
|
|
"loss": 6.902,
|
|
"mean_token_accuracy": 0.13993172571063042,
|
|
"num_tokens": 4207616.0,
|
|
"step": 1670
|
|
},
|
|
{
|
|
"entropy": 7.025543546676635,
|
|
"epoch": 0.1933064050778996,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004999312464373734,
|
|
"loss": 6.8576,
|
|
"mean_token_accuracy": 0.14821547120809556,
|
|
"num_tokens": 4219299.0,
|
|
"step": 1675
|
|
},
|
|
{
|
|
"entropy": 7.017240190505982,
|
|
"epoch": 0.19388343912290826,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004999302226240767,
|
|
"loss": 6.997,
|
|
"mean_token_accuracy": 0.13786116614937782,
|
|
"num_tokens": 4232098.0,
|
|
"step": 1680
|
|
},
|
|
{
|
|
"entropy": 7.080112934112549,
|
|
"epoch": 0.1944604731679169,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004999291912453637,
|
|
"loss": 6.8995,
|
|
"mean_token_accuracy": 0.14469338953495026,
|
|
"num_tokens": 4243879.0,
|
|
"step": 1685
|
|
},
|
|
{
|
|
"entropy": 7.064555072784424,
|
|
"epoch": 0.19503750721292556,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004999281523012691,
|
|
"loss": 6.9828,
|
|
"mean_token_accuracy": 0.13740749657154083,
|
|
"num_tokens": 4256507.0,
|
|
"step": 1690
|
|
},
|
|
{
|
|
"entropy": 7.218221855163574,
|
|
"epoch": 0.1956145412579342,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004999271057918278,
|
|
"loss": 7.0398,
|
|
"mean_token_accuracy": 0.13457229733467102,
|
|
"num_tokens": 4270763.0,
|
|
"step": 1695
|
|
},
|
|
{
|
|
"entropy": 7.035730075836182,
|
|
"epoch": 0.19619157530294287,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004999260517170751,
|
|
"loss": 6.9131,
|
|
"mean_token_accuracy": 0.14340217858552934,
|
|
"num_tokens": 4284380.0,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"entropy": 7.1246764183044435,
|
|
"epoch": 0.19676860934795154,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004999249900770463,
|
|
"loss": 7.0215,
|
|
"mean_token_accuracy": 0.13842824175953866,
|
|
"num_tokens": 4297812.0,
|
|
"step": 1705
|
|
},
|
|
{
|
|
"entropy": 7.021434783935547,
|
|
"epoch": 0.19734564339296018,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004999239208717772,
|
|
"loss": 6.9875,
|
|
"mean_token_accuracy": 0.14540473818778993,
|
|
"num_tokens": 4310374.0,
|
|
"step": 1710
|
|
},
|
|
{
|
|
"entropy": 7.130036401748657,
|
|
"epoch": 0.19792267743796885,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004999228441013037,
|
|
"loss": 6.9861,
|
|
"mean_token_accuracy": 0.13793584629893302,
|
|
"num_tokens": 4322330.0,
|
|
"step": 1715
|
|
},
|
|
{
|
|
"entropy": 7.092807817459106,
|
|
"epoch": 0.1984997114829775,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.000499921759765662,
|
|
"loss": 6.9437,
|
|
"mean_token_accuracy": 0.14130837395787238,
|
|
"num_tokens": 4335204.0,
|
|
"step": 1720
|
|
},
|
|
{
|
|
"entropy": 6.928855037689209,
|
|
"epoch": 0.19907674552798615,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004999206678648888,
|
|
"loss": 6.8285,
|
|
"mean_token_accuracy": 0.14999809116125107,
|
|
"num_tokens": 4347339.0,
|
|
"step": 1725
|
|
},
|
|
{
|
|
"entropy": 7.080965518951416,
|
|
"epoch": 0.1996537795729948,
|
|
"grad_norm": 1.71875,
|
|
"learning_rate": 0.0004999195683990206,
|
|
"loss": 6.8898,
|
|
"mean_token_accuracy": 0.14809404462575912,
|
|
"num_tokens": 4360273.0,
|
|
"step": 1730
|
|
},
|
|
{
|
|
"entropy": 7.013464021682739,
|
|
"epoch": 0.20023081361800346,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004999184613680945,
|
|
"loss": 6.9012,
|
|
"mean_token_accuracy": 0.14106058850884437,
|
|
"num_tokens": 4373424.0,
|
|
"step": 1735
|
|
},
|
|
{
|
|
"entropy": 7.049986457824707,
|
|
"epoch": 0.20080784766301213,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004999173467721476,
|
|
"loss": 6.8544,
|
|
"mean_token_accuracy": 0.15058322101831437,
|
|
"num_tokens": 4386125.0,
|
|
"step": 1740
|
|
},
|
|
{
|
|
"entropy": 7.018032741546631,
|
|
"epoch": 0.20138488170802077,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004999162246112175,
|
|
"loss": 6.9365,
|
|
"mean_token_accuracy": 0.13854823932051658,
|
|
"num_tokens": 4399214.0,
|
|
"step": 1745
|
|
},
|
|
{
|
|
"entropy": 6.9998067855834964,
|
|
"epoch": 0.20196191575302944,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004999150948853419,
|
|
"loss": 6.8127,
|
|
"mean_token_accuracy": 0.14680370092391967,
|
|
"num_tokens": 4411282.0,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"entropy": 6.969420385360718,
|
|
"epoch": 0.20253894979803808,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004999139575945587,
|
|
"loss": 6.909,
|
|
"mean_token_accuracy": 0.14443379119038582,
|
|
"num_tokens": 4423448.0,
|
|
"step": 1755
|
|
},
|
|
{
|
|
"entropy": 7.101949882507324,
|
|
"epoch": 0.20311598384304674,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004999128127389065,
|
|
"loss": 6.8176,
|
|
"mean_token_accuracy": 0.15111797004938127,
|
|
"num_tokens": 4436498.0,
|
|
"step": 1760
|
|
},
|
|
{
|
|
"entropy": 6.992865753173828,
|
|
"epoch": 0.20369301788805538,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004999116603184233,
|
|
"loss": 6.8342,
|
|
"mean_token_accuracy": 0.1466807797551155,
|
|
"num_tokens": 4448641.0,
|
|
"step": 1765
|
|
},
|
|
{
|
|
"entropy": 6.9575080394744875,
|
|
"epoch": 0.20427005193306405,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004999105003331482,
|
|
"loss": 6.8404,
|
|
"mean_token_accuracy": 0.1423793762922287,
|
|
"num_tokens": 4460539.0,
|
|
"step": 1770
|
|
},
|
|
{
|
|
"entropy": 7.0623860359191895,
|
|
"epoch": 0.20484708597807272,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004999093327831202,
|
|
"loss": 6.8898,
|
|
"mean_token_accuracy": 0.14088162109255792,
|
|
"num_tokens": 4472487.0,
|
|
"step": 1775
|
|
},
|
|
{
|
|
"entropy": 6.952205657958984,
|
|
"epoch": 0.20542412002308136,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004999081576683784,
|
|
"loss": 6.8802,
|
|
"mean_token_accuracy": 0.1421337030827999,
|
|
"num_tokens": 4485164.0,
|
|
"step": 1780
|
|
},
|
|
{
|
|
"entropy": 7.1306853771209715,
|
|
"epoch": 0.20600115406809003,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004999069749889626,
|
|
"loss": 6.8973,
|
|
"mean_token_accuracy": 0.14712294787168503,
|
|
"num_tokens": 4497708.0,
|
|
"step": 1785
|
|
},
|
|
{
|
|
"entropy": 6.940166759490967,
|
|
"epoch": 0.20657818811309867,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004999057847449123,
|
|
"loss": 6.9329,
|
|
"mean_token_accuracy": 0.1391274891793728,
|
|
"num_tokens": 4510648.0,
|
|
"step": 1790
|
|
},
|
|
{
|
|
"entropy": 7.065713214874267,
|
|
"epoch": 0.20715522215810733,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004999045869362678,
|
|
"loss": 6.8511,
|
|
"mean_token_accuracy": 0.14565493836998938,
|
|
"num_tokens": 4522699.0,
|
|
"step": 1795
|
|
},
|
|
{
|
|
"entropy": 6.939832353591919,
|
|
"epoch": 0.20773225620311597,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.000499903381563069,
|
|
"loss": 6.8936,
|
|
"mean_token_accuracy": 0.13873664960265158,
|
|
"num_tokens": 4536060.0,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"entropy": 6.97990312576294,
|
|
"epoch": 0.20830929024812464,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004999021686253568,
|
|
"loss": 6.8257,
|
|
"mean_token_accuracy": 0.13769187703728675,
|
|
"num_tokens": 4549876.0,
|
|
"step": 1805
|
|
},
|
|
{
|
|
"entropy": 7.080778312683106,
|
|
"epoch": 0.2088863242931333,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004999009481231719,
|
|
"loss": 6.8655,
|
|
"mean_token_accuracy": 0.14449936226010324,
|
|
"num_tokens": 4563638.0,
|
|
"step": 1810
|
|
},
|
|
{
|
|
"entropy": 6.9409098625183105,
|
|
"epoch": 0.20946335833814195,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004998997200565553,
|
|
"loss": 6.8057,
|
|
"mean_token_accuracy": 0.14341058060526848,
|
|
"num_tokens": 4575396.0,
|
|
"step": 1815
|
|
},
|
|
{
|
|
"entropy": 6.935875415802002,
|
|
"epoch": 0.21004039238315061,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004998984844255483,
|
|
"loss": 6.8199,
|
|
"mean_token_accuracy": 0.14724263399839402,
|
|
"num_tokens": 4587261.0,
|
|
"step": 1820
|
|
},
|
|
{
|
|
"entropy": 7.076818370819092,
|
|
"epoch": 0.21061742642815925,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004998972412301925,
|
|
"loss": 6.9409,
|
|
"mean_token_accuracy": 0.14100464209914207,
|
|
"num_tokens": 4600086.0,
|
|
"step": 1825
|
|
},
|
|
{
|
|
"entropy": 7.006335687637329,
|
|
"epoch": 0.21119446047316792,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004998959904705297,
|
|
"loss": 6.8993,
|
|
"mean_token_accuracy": 0.14008133336901665,
|
|
"num_tokens": 4612320.0,
|
|
"step": 1830
|
|
},
|
|
{
|
|
"entropy": 6.99210262298584,
|
|
"epoch": 0.21177149451817656,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004998947321466021,
|
|
"loss": 6.8464,
|
|
"mean_token_accuracy": 0.14648700058460234,
|
|
"num_tokens": 4623545.0,
|
|
"step": 1835
|
|
},
|
|
{
|
|
"entropy": 6.954314517974853,
|
|
"epoch": 0.21234852856318523,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004998934662584518,
|
|
"loss": 6.7498,
|
|
"mean_token_accuracy": 0.1578306920826435,
|
|
"num_tokens": 4637223.0,
|
|
"step": 1840
|
|
},
|
|
{
|
|
"entropy": 6.826448059082031,
|
|
"epoch": 0.2129255626081939,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004998921928061214,
|
|
"loss": 6.837,
|
|
"mean_token_accuracy": 0.14694164842367172,
|
|
"num_tokens": 4649748.0,
|
|
"step": 1845
|
|
},
|
|
{
|
|
"entropy": 7.0238566398620605,
|
|
"epoch": 0.21350259665320254,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004998909117896539,
|
|
"loss": 6.8732,
|
|
"mean_token_accuracy": 0.1458170548081398,
|
|
"num_tokens": 4662441.0,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"entropy": 6.895988988876343,
|
|
"epoch": 0.2140796306982112,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004998896232090922,
|
|
"loss": 6.8337,
|
|
"mean_token_accuracy": 0.15489335879683494,
|
|
"num_tokens": 4675546.0,
|
|
"step": 1855
|
|
},
|
|
{
|
|
"entropy": 7.177361154556275,
|
|
"epoch": 0.21465666474321984,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004998883270644798,
|
|
"loss": 6.9068,
|
|
"mean_token_accuracy": 0.13811369463801385,
|
|
"num_tokens": 4687601.0,
|
|
"step": 1860
|
|
},
|
|
{
|
|
"entropy": 6.91638216972351,
|
|
"epoch": 0.2152336987882285,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004998870233558602,
|
|
"loss": 6.7837,
|
|
"mean_token_accuracy": 0.15353625565767287,
|
|
"num_tokens": 4699336.0,
|
|
"step": 1865
|
|
},
|
|
{
|
|
"entropy": 6.911949300765992,
|
|
"epoch": 0.21581073283323715,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004998857120832774,
|
|
"loss": 6.9744,
|
|
"mean_token_accuracy": 0.13845321610569955,
|
|
"num_tokens": 4714312.0,
|
|
"step": 1870
|
|
},
|
|
{
|
|
"entropy": 6.956019687652588,
|
|
"epoch": 0.21638776687824582,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004998843932467751,
|
|
"loss": 6.7036,
|
|
"mean_token_accuracy": 0.15298319831490517,
|
|
"num_tokens": 4726436.0,
|
|
"step": 1875
|
|
},
|
|
{
|
|
"entropy": 6.97105393409729,
|
|
"epoch": 0.21696480092325446,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004998830668463982,
|
|
"loss": 6.9324,
|
|
"mean_token_accuracy": 0.13379157483577728,
|
|
"num_tokens": 4739821.0,
|
|
"step": 1880
|
|
},
|
|
{
|
|
"entropy": 7.089961147308349,
|
|
"epoch": 0.21754183496826313,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004998817328821909,
|
|
"loss": 6.9187,
|
|
"mean_token_accuracy": 0.13890728428959848,
|
|
"num_tokens": 4752701.0,
|
|
"step": 1885
|
|
},
|
|
{
|
|
"entropy": 6.965564870834351,
|
|
"epoch": 0.2181188690132718,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004998803913541983,
|
|
"loss": 6.9329,
|
|
"mean_token_accuracy": 0.14065297245979308,
|
|
"num_tokens": 4766755.0,
|
|
"step": 1890
|
|
},
|
|
{
|
|
"entropy": 7.006665802001953,
|
|
"epoch": 0.21869590305828043,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004998790422624654,
|
|
"loss": 6.8586,
|
|
"mean_token_accuracy": 0.1429077446460724,
|
|
"num_tokens": 4780201.0,
|
|
"step": 1895
|
|
},
|
|
{
|
|
"entropy": 6.957398748397827,
|
|
"epoch": 0.2192729371032891,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004998776856070376,
|
|
"loss": 6.81,
|
|
"mean_token_accuracy": 0.1421031355857849,
|
|
"num_tokens": 4792488.0,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"entropy": 6.996427440643311,
|
|
"epoch": 0.21984997114829774,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004998763213879606,
|
|
"loss": 6.7886,
|
|
"mean_token_accuracy": 0.14664288908243178,
|
|
"num_tokens": 4805154.0,
|
|
"step": 1905
|
|
},
|
|
{
|
|
"entropy": 6.966566801071167,
|
|
"epoch": 0.2204270051933064,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004998749496052803,
|
|
"loss": 6.8471,
|
|
"mean_token_accuracy": 0.14108580872416496,
|
|
"num_tokens": 4817947.0,
|
|
"step": 1910
|
|
},
|
|
{
|
|
"entropy": 6.996940803527832,
|
|
"epoch": 0.22100403923831505,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004998735702590426,
|
|
"loss": 6.828,
|
|
"mean_token_accuracy": 0.1447738878428936,
|
|
"num_tokens": 4830296.0,
|
|
"step": 1915
|
|
},
|
|
{
|
|
"entropy": 6.933389377593994,
|
|
"epoch": 0.22158107328332372,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004998721833492942,
|
|
"loss": 6.8253,
|
|
"mean_token_accuracy": 0.14365117698907853,
|
|
"num_tokens": 4841210.0,
|
|
"step": 1920
|
|
},
|
|
{
|
|
"entropy": 7.029626893997192,
|
|
"epoch": 0.22215810732833238,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004998707888760816,
|
|
"loss": 6.8996,
|
|
"mean_token_accuracy": 0.13317479714751243,
|
|
"num_tokens": 4854406.0,
|
|
"step": 1925
|
|
},
|
|
{
|
|
"entropy": 6.965882301330566,
|
|
"epoch": 0.22273514137334102,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004998693868394516,
|
|
"loss": 6.8706,
|
|
"mean_token_accuracy": 0.14146279469132422,
|
|
"num_tokens": 4868156.0,
|
|
"step": 1930
|
|
},
|
|
{
|
|
"entropy": 7.022164821624756,
|
|
"epoch": 0.2233121754183497,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004998679772394516,
|
|
"loss": 6.804,
|
|
"mean_token_accuracy": 0.15072066336870193,
|
|
"num_tokens": 4880314.0,
|
|
"step": 1935
|
|
},
|
|
{
|
|
"entropy": 6.920300674438477,
|
|
"epoch": 0.22388920946335833,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004998665600761289,
|
|
"loss": 6.813,
|
|
"mean_token_accuracy": 0.14527895897626877,
|
|
"num_tokens": 4892652.0,
|
|
"step": 1940
|
|
},
|
|
{
|
|
"entropy": 7.060734128952026,
|
|
"epoch": 0.224466243508367,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.000499865135349531,
|
|
"loss": 6.9048,
|
|
"mean_token_accuracy": 0.13892186135053636,
|
|
"num_tokens": 4905791.0,
|
|
"step": 1945
|
|
},
|
|
{
|
|
"entropy": 6.940855360031128,
|
|
"epoch": 0.22504327755337564,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004998637030597061,
|
|
"loss": 6.8723,
|
|
"mean_token_accuracy": 0.14380484744906424,
|
|
"num_tokens": 4917359.0,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"entropy": 7.036824655532837,
|
|
"epoch": 0.2256203115983843,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004998622632067022,
|
|
"loss": 6.8305,
|
|
"mean_token_accuracy": 0.14697285592556,
|
|
"num_tokens": 4928762.0,
|
|
"step": 1955
|
|
},
|
|
{
|
|
"entropy": 6.926147079467773,
|
|
"epoch": 0.22619734564339297,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004998608157905678,
|
|
"loss": 6.8447,
|
|
"mean_token_accuracy": 0.14583281725645064,
|
|
"num_tokens": 4940879.0,
|
|
"step": 1960
|
|
},
|
|
{
|
|
"entropy": 7.006029081344605,
|
|
"epoch": 0.2267743796884016,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004998593608113515,
|
|
"loss": 6.8538,
|
|
"mean_token_accuracy": 0.14606458991765975,
|
|
"num_tokens": 4952979.0,
|
|
"step": 1965
|
|
},
|
|
{
|
|
"entropy": 6.918392038345337,
|
|
"epoch": 0.22735141373341028,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004998578982691024,
|
|
"loss": 6.7524,
|
|
"mean_token_accuracy": 0.1569880038499832,
|
|
"num_tokens": 4965465.0,
|
|
"step": 1970
|
|
},
|
|
{
|
|
"entropy": 6.9123780727386475,
|
|
"epoch": 0.22792844777841892,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004998564281638694,
|
|
"loss": 6.8233,
|
|
"mean_token_accuracy": 0.14547210037708283,
|
|
"num_tokens": 4977960.0,
|
|
"step": 1975
|
|
},
|
|
{
|
|
"entropy": 6.97648549079895,
|
|
"epoch": 0.2285054818234276,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004998549504957023,
|
|
"loss": 6.8274,
|
|
"mean_token_accuracy": 0.14264762550592422,
|
|
"num_tokens": 4990732.0,
|
|
"step": 1980
|
|
},
|
|
{
|
|
"entropy": 6.921519327163696,
|
|
"epoch": 0.22908251586843623,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004998534652646506,
|
|
"loss": 6.7678,
|
|
"mean_token_accuracy": 0.14480722099542617,
|
|
"num_tokens": 5002482.0,
|
|
"step": 1985
|
|
},
|
|
{
|
|
"entropy": 6.902936887741089,
|
|
"epoch": 0.2296595499134449,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004998519724707642,
|
|
"loss": 6.7529,
|
|
"mean_token_accuracy": 0.14723773747682573,
|
|
"num_tokens": 5014932.0,
|
|
"step": 1990
|
|
},
|
|
{
|
|
"entropy": 6.885674381256104,
|
|
"epoch": 0.23023658395845356,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004998504721140934,
|
|
"loss": 6.8837,
|
|
"mean_token_accuracy": 0.138965655118227,
|
|
"num_tokens": 5027661.0,
|
|
"step": 1995
|
|
},
|
|
{
|
|
"entropy": 6.906474590301514,
|
|
"epoch": 0.2308136180034622,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004998489641946887,
|
|
"loss": 6.6331,
|
|
"mean_token_accuracy": 0.1527172051370144,
|
|
"num_tokens": 5040657.0,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"entropy": 6.975762939453125,
|
|
"epoch": 0.23139065204847087,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004998474487126009,
|
|
"loss": 6.9063,
|
|
"mean_token_accuracy": 0.13616069480776788,
|
|
"num_tokens": 5054408.0,
|
|
"step": 2005
|
|
},
|
|
{
|
|
"entropy": 6.98120608329773,
|
|
"epoch": 0.2319676860934795,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004998459256678806,
|
|
"loss": 6.7998,
|
|
"mean_token_accuracy": 0.14582831785082817,
|
|
"num_tokens": 5065499.0,
|
|
"step": 2010
|
|
},
|
|
{
|
|
"entropy": 6.935510063171387,
|
|
"epoch": 0.23254472013848818,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004998443950605796,
|
|
"loss": 6.7508,
|
|
"mean_token_accuracy": 0.15238589197397232,
|
|
"num_tokens": 5077009.0,
|
|
"step": 2015
|
|
},
|
|
{
|
|
"entropy": 6.931089639663696,
|
|
"epoch": 0.23312175418349682,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004998428568907488,
|
|
"loss": 6.925,
|
|
"mean_token_accuracy": 0.13808261305093766,
|
|
"num_tokens": 5089462.0,
|
|
"step": 2020
|
|
},
|
|
{
|
|
"entropy": 6.99543948173523,
|
|
"epoch": 0.23369878822850548,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004998413111584403,
|
|
"loss": 6.8333,
|
|
"mean_token_accuracy": 0.1430407203733921,
|
|
"num_tokens": 5101816.0,
|
|
"step": 2025
|
|
},
|
|
{
|
|
"entropy": 6.949823617935181,
|
|
"epoch": 0.23427582227351415,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004998397578637059,
|
|
"loss": 6.7939,
|
|
"mean_token_accuracy": 0.1399306148290634,
|
|
"num_tokens": 5115085.0,
|
|
"step": 2030
|
|
},
|
|
{
|
|
"entropy": 6.912753963470459,
|
|
"epoch": 0.2348528563185228,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.000499838197006598,
|
|
"loss": 6.8265,
|
|
"mean_token_accuracy": 0.1417170412838459,
|
|
"num_tokens": 5127705.0,
|
|
"step": 2035
|
|
},
|
|
{
|
|
"entropy": 6.916851139068603,
|
|
"epoch": 0.23542989036353146,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.000499836628587169,
|
|
"loss": 6.786,
|
|
"mean_token_accuracy": 0.1507592000067234,
|
|
"num_tokens": 5140509.0,
|
|
"step": 2040
|
|
},
|
|
{
|
|
"entropy": 6.963552236557007,
|
|
"epoch": 0.2360069244085401,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004998350526054716,
|
|
"loss": 6.8285,
|
|
"mean_token_accuracy": 0.1409867897629738,
|
|
"num_tokens": 5153538.0,
|
|
"step": 2045
|
|
},
|
|
{
|
|
"entropy": 6.918388509750367,
|
|
"epoch": 0.23658395845354876,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004998334690615591,
|
|
"loss": 6.7526,
|
|
"mean_token_accuracy": 0.14691582769155503,
|
|
"num_tokens": 5166181.0,
|
|
"step": 2050
|
|
},
|
|
{
|
|
"entropy": 6.877604293823242,
|
|
"epoch": 0.2371609924985574,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004998318779554844,
|
|
"loss": 6.7855,
|
|
"mean_token_accuracy": 0.14772634357213973,
|
|
"num_tokens": 5177209.0,
|
|
"step": 2055
|
|
},
|
|
{
|
|
"entropy": 6.908311414718628,
|
|
"epoch": 0.23773802654356607,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004998302792873012,
|
|
"loss": 6.8049,
|
|
"mean_token_accuracy": 0.14239051789045334,
|
|
"num_tokens": 5189786.0,
|
|
"step": 2060
|
|
},
|
|
{
|
|
"entropy": 6.952730369567871,
|
|
"epoch": 0.23831506058857474,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004998286730570631,
|
|
"loss": 6.7892,
|
|
"mean_token_accuracy": 0.1510260708630085,
|
|
"num_tokens": 5202629.0,
|
|
"step": 2065
|
|
},
|
|
{
|
|
"entropy": 6.907465410232544,
|
|
"epoch": 0.23889209463358338,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004998270592648245,
|
|
"loss": 6.8561,
|
|
"mean_token_accuracy": 0.13883134126663207,
|
|
"num_tokens": 5215339.0,
|
|
"step": 2070
|
|
},
|
|
{
|
|
"entropy": 6.9621459484100345,
|
|
"epoch": 0.23946912867859205,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004998254379106394,
|
|
"loss": 6.7359,
|
|
"mean_token_accuracy": 0.14754440188407897,
|
|
"num_tokens": 5227666.0,
|
|
"step": 2075
|
|
},
|
|
{
|
|
"entropy": 6.7812415599823,
|
|
"epoch": 0.2400461627236007,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004998238089945622,
|
|
"loss": 6.7107,
|
|
"mean_token_accuracy": 0.1521335408091545,
|
|
"num_tokens": 5238200.0,
|
|
"step": 2080
|
|
},
|
|
{
|
|
"entropy": 6.852583646774292,
|
|
"epoch": 0.24062319676860935,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004998221725166479,
|
|
"loss": 6.6654,
|
|
"mean_token_accuracy": 0.15192302465438842,
|
|
"num_tokens": 5250023.0,
|
|
"step": 2085
|
|
},
|
|
{
|
|
"entropy": 6.927479076385498,
|
|
"epoch": 0.241200230813618,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004998205284769516,
|
|
"loss": 6.8416,
|
|
"mean_token_accuracy": 0.1361626349389553,
|
|
"num_tokens": 5262634.0,
|
|
"step": 2090
|
|
},
|
|
{
|
|
"entropy": 6.945438241958618,
|
|
"epoch": 0.24177726485862666,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004998188768755285,
|
|
"loss": 6.8404,
|
|
"mean_token_accuracy": 0.1391704946756363,
|
|
"num_tokens": 5275739.0,
|
|
"step": 2095
|
|
},
|
|
{
|
|
"entropy": 6.907373285293579,
|
|
"epoch": 0.2423542989036353,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004998172177124341,
|
|
"loss": 6.8036,
|
|
"mean_token_accuracy": 0.14423199594020844,
|
|
"num_tokens": 5289223.0,
|
|
"step": 2100
|
|
},
|
|
{
|
|
"entropy": 6.921164560317993,
|
|
"epoch": 0.24293133294864397,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004998155509877242,
|
|
"loss": 6.7918,
|
|
"mean_token_accuracy": 0.14191285520792007,
|
|
"num_tokens": 5301869.0,
|
|
"step": 2105
|
|
},
|
|
{
|
|
"entropy": 6.931911897659302,
|
|
"epoch": 0.24350836699365264,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.000499813876701455,
|
|
"loss": 6.8142,
|
|
"mean_token_accuracy": 0.140006385743618,
|
|
"num_tokens": 5314999.0,
|
|
"step": 2110
|
|
},
|
|
{
|
|
"entropy": 6.918317890167236,
|
|
"epoch": 0.24408540103866128,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004998121948536828,
|
|
"loss": 6.8173,
|
|
"mean_token_accuracy": 0.14651304483413696,
|
|
"num_tokens": 5328247.0,
|
|
"step": 2115
|
|
},
|
|
{
|
|
"entropy": 6.985309028625489,
|
|
"epoch": 0.24466243508366994,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004998105054444639,
|
|
"loss": 6.804,
|
|
"mean_token_accuracy": 0.13474133610725403,
|
|
"num_tokens": 5341054.0,
|
|
"step": 2120
|
|
},
|
|
{
|
|
"entropy": 6.888967895507813,
|
|
"epoch": 0.24523946912867858,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004998088084738555,
|
|
"loss": 6.8269,
|
|
"mean_token_accuracy": 0.14804685413837432,
|
|
"num_tokens": 5353857.0,
|
|
"step": 2125
|
|
},
|
|
{
|
|
"entropy": 6.884988164901733,
|
|
"epoch": 0.24581650317368725,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004998071039419144,
|
|
"loss": 6.7622,
|
|
"mean_token_accuracy": 0.14388485997915268,
|
|
"num_tokens": 5366072.0,
|
|
"step": 2130
|
|
},
|
|
{
|
|
"entropy": 6.902663278579712,
|
|
"epoch": 0.2463935372186959,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000499805391848698,
|
|
"loss": 6.7641,
|
|
"mean_token_accuracy": 0.1469337075948715,
|
|
"num_tokens": 5379613.0,
|
|
"step": 2135
|
|
},
|
|
{
|
|
"entropy": 6.88670859336853,
|
|
"epoch": 0.24697057126370456,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.000499803672194264,
|
|
"loss": 6.8005,
|
|
"mean_token_accuracy": 0.14418511241674423,
|
|
"num_tokens": 5392394.0,
|
|
"step": 2140
|
|
},
|
|
{
|
|
"entropy": 6.805346250534058,
|
|
"epoch": 0.24754760530871323,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004998019449786701,
|
|
"loss": 6.77,
|
|
"mean_token_accuracy": 0.14892241209745408,
|
|
"num_tokens": 5404127.0,
|
|
"step": 2145
|
|
},
|
|
{
|
|
"entropy": 7.025264120101928,
|
|
"epoch": 0.24812463935372187,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004998002102019744,
|
|
"loss": 6.8739,
|
|
"mean_token_accuracy": 0.13671603947877883,
|
|
"num_tokens": 5417317.0,
|
|
"step": 2150
|
|
},
|
|
{
|
|
"entropy": 6.881466197967529,
|
|
"epoch": 0.24870167339873053,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004997984678642354,
|
|
"loss": 6.7279,
|
|
"mean_token_accuracy": 0.1475033514201641,
|
|
"num_tokens": 5429991.0,
|
|
"step": 2155
|
|
},
|
|
{
|
|
"entropy": 6.890996217727661,
|
|
"epoch": 0.24927870744373917,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004997967179655115,
|
|
"loss": 6.7702,
|
|
"mean_token_accuracy": 0.13975565731525422,
|
|
"num_tokens": 5442661.0,
|
|
"step": 2160
|
|
},
|
|
{
|
|
"entropy": 6.903371953964234,
|
|
"epoch": 0.24985574148874784,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004997949605058617,
|
|
"loss": 6.7731,
|
|
"mean_token_accuracy": 0.1479140818119049,
|
|
"num_tokens": 5455876.0,
|
|
"step": 2165
|
|
},
|
|
{
|
|
"entropy": 6.838821744918823,
|
|
"epoch": 0.2504327755337565,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004997931954853451,
|
|
"loss": 6.7326,
|
|
"mean_token_accuracy": 0.1502830758690834,
|
|
"num_tokens": 5468151.0,
|
|
"step": 2170
|
|
},
|
|
{
|
|
"entropy": 6.829051685333252,
|
|
"epoch": 0.2510098095787651,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.000499791422904021,
|
|
"loss": 6.7642,
|
|
"mean_token_accuracy": 0.15258670300245286,
|
|
"num_tokens": 5481327.0,
|
|
"step": 2175
|
|
},
|
|
{
|
|
"entropy": 6.854774093627929,
|
|
"epoch": 0.2515868436237738,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004997896427619491,
|
|
"loss": 6.726,
|
|
"mean_token_accuracy": 0.14523358941078185,
|
|
"num_tokens": 5493794.0,
|
|
"step": 2180
|
|
},
|
|
{
|
|
"entropy": 6.833822202682495,
|
|
"epoch": 0.25216387766878245,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004997878550591892,
|
|
"loss": 6.7622,
|
|
"mean_token_accuracy": 0.14095828533172608,
|
|
"num_tokens": 5506831.0,
|
|
"step": 2185
|
|
},
|
|
{
|
|
"entropy": 6.8861846923828125,
|
|
"epoch": 0.2527409117137911,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004997860597958013,
|
|
"loss": 6.6629,
|
|
"mean_token_accuracy": 0.15049846321344376,
|
|
"num_tokens": 5518988.0,
|
|
"step": 2190
|
|
},
|
|
{
|
|
"entropy": 6.720967817306518,
|
|
"epoch": 0.2533179457587998,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004997842569718461,
|
|
"loss": 6.6284,
|
|
"mean_token_accuracy": 0.15226881206035614,
|
|
"num_tokens": 5530757.0,
|
|
"step": 2195
|
|
},
|
|
{
|
|
"entropy": 6.8386878490448,
|
|
"epoch": 0.25389497980380843,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000499782446587384,
|
|
"loss": 6.7462,
|
|
"mean_token_accuracy": 0.14984930008649827,
|
|
"num_tokens": 5542819.0,
|
|
"step": 2200
|
|
},
|
|
{
|
|
"entropy": 6.887057685852051,
|
|
"epoch": 0.25447201384881707,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.000499780628642476,
|
|
"loss": 6.7516,
|
|
"mean_token_accuracy": 0.1436480388045311,
|
|
"num_tokens": 5555797.0,
|
|
"step": 2205
|
|
},
|
|
{
|
|
"entropy": 6.8565185546875,
|
|
"epoch": 0.2550490478938257,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004997788031371834,
|
|
"loss": 6.8377,
|
|
"mean_token_accuracy": 0.13526439368724824,
|
|
"num_tokens": 5570086.0,
|
|
"step": 2210
|
|
},
|
|
{
|
|
"entropy": 6.880842208862305,
|
|
"epoch": 0.2556260819388344,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004997769700715672,
|
|
"loss": 6.6616,
|
|
"mean_token_accuracy": 0.15116312801837922,
|
|
"num_tokens": 5582182.0,
|
|
"step": 2215
|
|
},
|
|
{
|
|
"entropy": 6.771800470352173,
|
|
"epoch": 0.25620311598384304,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004997751294456892,
|
|
"loss": 6.7557,
|
|
"mean_token_accuracy": 0.1484261780977249,
|
|
"num_tokens": 5595395.0,
|
|
"step": 2220
|
|
},
|
|
{
|
|
"entropy": 6.907889366149902,
|
|
"epoch": 0.2567801500288517,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004997732812596114,
|
|
"loss": 6.7655,
|
|
"mean_token_accuracy": 0.14601099640130996,
|
|
"num_tokens": 5608555.0,
|
|
"step": 2225
|
|
},
|
|
{
|
|
"entropy": 6.852161073684693,
|
|
"epoch": 0.2573571840738604,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004997714255133961,
|
|
"loss": 6.7211,
|
|
"mean_token_accuracy": 0.14606622010469436,
|
|
"num_tokens": 5620933.0,
|
|
"step": 2230
|
|
},
|
|
{
|
|
"entropy": 6.908066129684448,
|
|
"epoch": 0.257934218118869,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004997695622071054,
|
|
"loss": 6.7645,
|
|
"mean_token_accuracy": 0.14898824393749238,
|
|
"num_tokens": 5634061.0,
|
|
"step": 2235
|
|
},
|
|
{
|
|
"entropy": 6.929029846191407,
|
|
"epoch": 0.25851125216387766,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004997676913408021,
|
|
"loss": 6.7291,
|
|
"mean_token_accuracy": 0.1483811229467392,
|
|
"num_tokens": 5646617.0,
|
|
"step": 2240
|
|
},
|
|
{
|
|
"entropy": 6.87813811302185,
|
|
"epoch": 0.2590882862088863,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004997658129145493,
|
|
"loss": 6.811,
|
|
"mean_token_accuracy": 0.14377271234989167,
|
|
"num_tokens": 5659361.0,
|
|
"step": 2245
|
|
},
|
|
{
|
|
"entropy": 6.849423265457153,
|
|
"epoch": 0.259665320253895,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004997639269284099,
|
|
"loss": 6.6528,
|
|
"mean_token_accuracy": 0.15414825975894927,
|
|
"num_tokens": 5670591.0,
|
|
"step": 2250
|
|
},
|
|
{
|
|
"entropy": 6.851912260055542,
|
|
"epoch": 0.26024235429890363,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004997620333824476,
|
|
"loss": 6.7722,
|
|
"mean_token_accuracy": 0.14549338743090628,
|
|
"num_tokens": 5683211.0,
|
|
"step": 2255
|
|
},
|
|
{
|
|
"entropy": 6.851926565170288,
|
|
"epoch": 0.2608193883439123,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004997601322767258,
|
|
"loss": 6.7653,
|
|
"mean_token_accuracy": 0.145635487139225,
|
|
"num_tokens": 5695654.0,
|
|
"step": 2260
|
|
},
|
|
{
|
|
"entropy": 6.795074939727783,
|
|
"epoch": 0.26139642238892097,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004997582236113087,
|
|
"loss": 6.6557,
|
|
"mean_token_accuracy": 0.15083891600370408,
|
|
"num_tokens": 5707776.0,
|
|
"step": 2265
|
|
},
|
|
{
|
|
"entropy": 6.822677946090698,
|
|
"epoch": 0.2619734564339296,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004997563073862603,
|
|
"loss": 6.7076,
|
|
"mean_token_accuracy": 0.14838095828890802,
|
|
"num_tokens": 5719895.0,
|
|
"step": 2270
|
|
},
|
|
{
|
|
"entropy": 6.895277500152588,
|
|
"epoch": 0.26255049047893825,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004997543836016453,
|
|
"loss": 6.7302,
|
|
"mean_token_accuracy": 0.15407091453671456,
|
|
"num_tokens": 5733280.0,
|
|
"step": 2275
|
|
},
|
|
{
|
|
"entropy": 6.825756692886353,
|
|
"epoch": 0.2631275245239469,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004997524522575281,
|
|
"loss": 6.7713,
|
|
"mean_token_accuracy": 0.14787696152925492,
|
|
"num_tokens": 5746563.0,
|
|
"step": 2280
|
|
},
|
|
{
|
|
"entropy": 6.933543157577515,
|
|
"epoch": 0.2637045585689556,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004997505133539738,
|
|
"loss": 6.8251,
|
|
"mean_token_accuracy": 0.14116834327578545,
|
|
"num_tokens": 5760735.0,
|
|
"step": 2285
|
|
},
|
|
{
|
|
"entropy": 6.7919364929199215,
|
|
"epoch": 0.2642815926139642,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004997485668910476,
|
|
"loss": 6.7403,
|
|
"mean_token_accuracy": 0.13866735473275185,
|
|
"num_tokens": 5774304.0,
|
|
"step": 2290
|
|
},
|
|
{
|
|
"entropy": 6.707546329498291,
|
|
"epoch": 0.26485862665897286,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004997466128688151,
|
|
"loss": 6.6343,
|
|
"mean_token_accuracy": 0.1520386144518852,
|
|
"num_tokens": 5786045.0,
|
|
"step": 2295
|
|
},
|
|
{
|
|
"entropy": 6.8912115573883055,
|
|
"epoch": 0.26543566070398156,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.000499744651287342,
|
|
"loss": 6.7038,
|
|
"mean_token_accuracy": 0.1507314458489418,
|
|
"num_tokens": 5798126.0,
|
|
"step": 2300
|
|
},
|
|
{
|
|
"entropy": 6.800000524520874,
|
|
"epoch": 0.2660126947489902,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.000499742682146694,
|
|
"loss": 6.708,
|
|
"mean_token_accuracy": 0.15146253854036332,
|
|
"num_tokens": 5809778.0,
|
|
"step": 2305
|
|
},
|
|
{
|
|
"entropy": 6.887187433242798,
|
|
"epoch": 0.26658972879399884,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004997407054469377,
|
|
"loss": 6.7913,
|
|
"mean_token_accuracy": 0.14095485657453538,
|
|
"num_tokens": 5821902.0,
|
|
"step": 2310
|
|
},
|
|
{
|
|
"entropy": 6.898465633392334,
|
|
"epoch": 0.2671667628390075,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004997387211881392,
|
|
"loss": 6.7311,
|
|
"mean_token_accuracy": 0.14221810474991797,
|
|
"num_tokens": 5835162.0,
|
|
"step": 2315
|
|
},
|
|
{
|
|
"entropy": 6.761828851699829,
|
|
"epoch": 0.26774379688401617,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004997367293703656,
|
|
"loss": 6.7284,
|
|
"mean_token_accuracy": 0.1507745712995529,
|
|
"num_tokens": 5847708.0,
|
|
"step": 2320
|
|
},
|
|
{
|
|
"entropy": 6.91298017501831,
|
|
"epoch": 0.2683208309290248,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004997347299936837,
|
|
"loss": 6.7346,
|
|
"mean_token_accuracy": 0.14922600761055946,
|
|
"num_tokens": 5860983.0,
|
|
"step": 2325
|
|
},
|
|
{
|
|
"entropy": 6.769803524017334,
|
|
"epoch": 0.26889786497403345,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004997327230581608,
|
|
"loss": 6.6998,
|
|
"mean_token_accuracy": 0.1437514305114746,
|
|
"num_tokens": 5873878.0,
|
|
"step": 2330
|
|
},
|
|
{
|
|
"entropy": 6.783571243286133,
|
|
"epoch": 0.26947489901904215,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004997307085638644,
|
|
"loss": 6.7147,
|
|
"mean_token_accuracy": 0.14909254312515258,
|
|
"num_tokens": 5886577.0,
|
|
"step": 2335
|
|
},
|
|
{
|
|
"entropy": 6.906566333770752,
|
|
"epoch": 0.2700519330640508,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004997286865108621,
|
|
"loss": 6.7362,
|
|
"mean_token_accuracy": 0.13940049409866334,
|
|
"num_tokens": 5900373.0,
|
|
"step": 2340
|
|
},
|
|
{
|
|
"entropy": 6.771531581878662,
|
|
"epoch": 0.2706289671090594,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004997266568992222,
|
|
"loss": 6.708,
|
|
"mean_token_accuracy": 0.14844308495521547,
|
|
"num_tokens": 5913038.0,
|
|
"step": 2345
|
|
},
|
|
{
|
|
"entropy": 6.791477632522583,
|
|
"epoch": 0.27120600115406807,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004997246197290128,
|
|
"loss": 6.6815,
|
|
"mean_token_accuracy": 0.1516631633043289,
|
|
"num_tokens": 5926096.0,
|
|
"step": 2350
|
|
},
|
|
{
|
|
"entropy": 6.820218896865844,
|
|
"epoch": 0.27178303519907676,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004997225750003024,
|
|
"loss": 6.6836,
|
|
"mean_token_accuracy": 0.15230127722024916,
|
|
"num_tokens": 5937992.0,
|
|
"step": 2355
|
|
},
|
|
{
|
|
"entropy": 6.786269426345825,
|
|
"epoch": 0.2723600692440854,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004997205227131599,
|
|
"loss": 6.6959,
|
|
"mean_token_accuracy": 0.15331070870161057,
|
|
"num_tokens": 5949685.0,
|
|
"step": 2360
|
|
},
|
|
{
|
|
"entropy": 6.8500142097473145,
|
|
"epoch": 0.27293710328909404,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004997184628676542,
|
|
"loss": 6.77,
|
|
"mean_token_accuracy": 0.14370569810271264,
|
|
"num_tokens": 5962751.0,
|
|
"step": 2365
|
|
},
|
|
{
|
|
"entropy": 6.743644428253174,
|
|
"epoch": 0.27351413733410274,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004997163954638546,
|
|
"loss": 6.5676,
|
|
"mean_token_accuracy": 0.15582787990570068,
|
|
"num_tokens": 5976043.0,
|
|
"step": 2370
|
|
},
|
|
{
|
|
"entropy": 6.826035118103027,
|
|
"epoch": 0.2740911713791114,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004997143205018306,
|
|
"loss": 6.7138,
|
|
"mean_token_accuracy": 0.14594173580408096,
|
|
"num_tokens": 5988146.0,
|
|
"step": 2375
|
|
},
|
|
{
|
|
"entropy": 6.795579051971435,
|
|
"epoch": 0.27466820542412,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004997122379816523,
|
|
"loss": 6.6587,
|
|
"mean_token_accuracy": 0.15158178210258483,
|
|
"num_tokens": 6000542.0,
|
|
"step": 2380
|
|
},
|
|
{
|
|
"entropy": 6.742963075637817,
|
|
"epoch": 0.27524523946912866,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004997101479033893,
|
|
"loss": 6.7064,
|
|
"mean_token_accuracy": 0.14576518833637236,
|
|
"num_tokens": 6013574.0,
|
|
"step": 2385
|
|
},
|
|
{
|
|
"entropy": 6.739541244506836,
|
|
"epoch": 0.27582227351413735,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004997080502671122,
|
|
"loss": 6.594,
|
|
"mean_token_accuracy": 0.15022992491722106,
|
|
"num_tokens": 6025391.0,
|
|
"step": 2390
|
|
},
|
|
{
|
|
"entropy": 6.859225606918335,
|
|
"epoch": 0.276399307559146,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004997059450728913,
|
|
"loss": 6.7201,
|
|
"mean_token_accuracy": 0.14635233953595161,
|
|
"num_tokens": 6036595.0,
|
|
"step": 2395
|
|
},
|
|
{
|
|
"entropy": 6.836587810516358,
|
|
"epoch": 0.27697634160415463,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004997038323207977,
|
|
"loss": 6.8146,
|
|
"mean_token_accuracy": 0.1395593300461769,
|
|
"num_tokens": 6048852.0,
|
|
"step": 2400
|
|
},
|
|
{
|
|
"entropy": 6.825769519805908,
|
|
"epoch": 0.2775533756491633,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004997017120109022,
|
|
"loss": 6.6492,
|
|
"mean_token_accuracy": 0.15694630444049834,
|
|
"num_tokens": 6061694.0,
|
|
"step": 2405
|
|
},
|
|
{
|
|
"entropy": 6.7436662197113035,
|
|
"epoch": 0.27813040969417197,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004996995841432762,
|
|
"loss": 6.725,
|
|
"mean_token_accuracy": 0.15039588510990143,
|
|
"num_tokens": 6074244.0,
|
|
"step": 2410
|
|
},
|
|
{
|
|
"entropy": 6.894833898544311,
|
|
"epoch": 0.2787074437391806,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004996974487179915,
|
|
"loss": 6.7051,
|
|
"mean_token_accuracy": 0.1497049979865551,
|
|
"num_tokens": 6085550.0,
|
|
"step": 2415
|
|
},
|
|
{
|
|
"entropy": 6.791318702697754,
|
|
"epoch": 0.27928447778418924,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004996953057351195,
|
|
"loss": 6.7501,
|
|
"mean_token_accuracy": 0.14439913034439086,
|
|
"num_tokens": 6096749.0,
|
|
"step": 2420
|
|
},
|
|
{
|
|
"entropy": 6.856110286712647,
|
|
"epoch": 0.27986151182919794,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004996931551947327,
|
|
"loss": 6.6462,
|
|
"mean_token_accuracy": 0.14740088433027268,
|
|
"num_tokens": 6109490.0,
|
|
"step": 2425
|
|
},
|
|
{
|
|
"entropy": 6.801775121688843,
|
|
"epoch": 0.2804385458742066,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004996909970969031,
|
|
"loss": 6.8126,
|
|
"mean_token_accuracy": 0.13891539573669434,
|
|
"num_tokens": 6122656.0,
|
|
"step": 2430
|
|
},
|
|
{
|
|
"entropy": 6.949873161315918,
|
|
"epoch": 0.2810155799192152,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004996888314417034,
|
|
"loss": 6.7062,
|
|
"mean_token_accuracy": 0.14734956696629525,
|
|
"num_tokens": 6135461.0,
|
|
"step": 2435
|
|
},
|
|
{
|
|
"entropy": 6.737766313552856,
|
|
"epoch": 0.2815926139642239,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004996866582292067,
|
|
"loss": 6.7563,
|
|
"mean_token_accuracy": 0.1486450642347336,
|
|
"num_tokens": 6147698.0,
|
|
"step": 2440
|
|
},
|
|
{
|
|
"entropy": 6.906767129898071,
|
|
"epoch": 0.28216964800923255,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004996844774594856,
|
|
"loss": 6.6995,
|
|
"mean_token_accuracy": 0.15024199485778808,
|
|
"num_tokens": 6160456.0,
|
|
"step": 2445
|
|
},
|
|
{
|
|
"entropy": 6.721561002731323,
|
|
"epoch": 0.2827466820542412,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004996822891326138,
|
|
"loss": 6.6952,
|
|
"mean_token_accuracy": 0.14862452447414398,
|
|
"num_tokens": 6173606.0,
|
|
"step": 2450
|
|
},
|
|
{
|
|
"entropy": 6.840061807632447,
|
|
"epoch": 0.28332371609924983,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004996800932486648,
|
|
"loss": 6.7195,
|
|
"mean_token_accuracy": 0.14363468587398528,
|
|
"num_tokens": 6185355.0,
|
|
"step": 2455
|
|
},
|
|
{
|
|
"entropy": 6.82087197303772,
|
|
"epoch": 0.28390075014425853,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004996778898077126,
|
|
"loss": 6.7452,
|
|
"mean_token_accuracy": 0.14526572227478027,
|
|
"num_tokens": 6198154.0,
|
|
"step": 2460
|
|
},
|
|
{
|
|
"entropy": 6.825610780715943,
|
|
"epoch": 0.28447778418926717,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004996756788098309,
|
|
"loss": 6.6295,
|
|
"mean_token_accuracy": 0.1540285274386406,
|
|
"num_tokens": 6209901.0,
|
|
"step": 2465
|
|
},
|
|
{
|
|
"entropy": 6.724011659622192,
|
|
"epoch": 0.2850548182342758,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004996734602550945,
|
|
"loss": 6.6914,
|
|
"mean_token_accuracy": 0.14896469041705132,
|
|
"num_tokens": 6222052.0,
|
|
"step": 2470
|
|
},
|
|
{
|
|
"entropy": 6.822287702560425,
|
|
"epoch": 0.2856318522792845,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004996712341435779,
|
|
"loss": 6.6874,
|
|
"mean_token_accuracy": 0.1531086578965187,
|
|
"num_tokens": 6235112.0,
|
|
"step": 2475
|
|
},
|
|
{
|
|
"entropy": 6.779771232604981,
|
|
"epoch": 0.28620888632429314,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004996690004753559,
|
|
"loss": 6.7241,
|
|
"mean_token_accuracy": 0.1425678864121437,
|
|
"num_tokens": 6248225.0,
|
|
"step": 2480
|
|
},
|
|
{
|
|
"entropy": 6.827151918411255,
|
|
"epoch": 0.2867859203693018,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004996667592505037,
|
|
"loss": 6.6731,
|
|
"mean_token_accuracy": 0.15249393209815026,
|
|
"num_tokens": 6259518.0,
|
|
"step": 2485
|
|
},
|
|
{
|
|
"entropy": 6.752045726776123,
|
|
"epoch": 0.2873629544143104,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004996645104690967,
|
|
"loss": 6.6827,
|
|
"mean_token_accuracy": 0.1392819695174694,
|
|
"num_tokens": 6271832.0,
|
|
"step": 2490
|
|
},
|
|
{
|
|
"entropy": 6.84897813796997,
|
|
"epoch": 0.2879399884593191,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004996622541312103,
|
|
"loss": 6.7198,
|
|
"mean_token_accuracy": 0.1458892524242401,
|
|
"num_tokens": 6284328.0,
|
|
"step": 2495
|
|
},
|
|
{
|
|
"entropy": 6.746988677978516,
|
|
"epoch": 0.28851702250432776,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004996599902369207,
|
|
"loss": 6.6617,
|
|
"mean_token_accuracy": 0.1465374030172825,
|
|
"num_tokens": 6296100.0,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"entropy": 6.685969734191895,
|
|
"epoch": 0.2890940565493364,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004996577187863039,
|
|
"loss": 6.6493,
|
|
"mean_token_accuracy": 0.15570555478334427,
|
|
"num_tokens": 6308262.0,
|
|
"step": 2505
|
|
},
|
|
{
|
|
"entropy": 6.827516984939575,
|
|
"epoch": 0.2896710905943451,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0004996554397794364,
|
|
"loss": 6.6959,
|
|
"mean_token_accuracy": 0.1382772818207741,
|
|
"num_tokens": 6319953.0,
|
|
"step": 2510
|
|
},
|
|
{
|
|
"entropy": 6.807676601409912,
|
|
"epoch": 0.29024812463935373,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004996531532163947,
|
|
"loss": 6.6329,
|
|
"mean_token_accuracy": 0.15100528299808502,
|
|
"num_tokens": 6332953.0,
|
|
"step": 2515
|
|
},
|
|
{
|
|
"entropy": 6.77238130569458,
|
|
"epoch": 0.2908251586843624,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004996508590972558,
|
|
"loss": 6.6873,
|
|
"mean_token_accuracy": 0.1495242863893509,
|
|
"num_tokens": 6345692.0,
|
|
"step": 2520
|
|
},
|
|
{
|
|
"entropy": 6.78111777305603,
|
|
"epoch": 0.291402192729371,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004996485574220969,
|
|
"loss": 6.6698,
|
|
"mean_token_accuracy": 0.14763007685542107,
|
|
"num_tokens": 6358058.0,
|
|
"step": 2525
|
|
},
|
|
{
|
|
"entropy": 6.842091226577759,
|
|
"epoch": 0.2919792267743797,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004996462481909953,
|
|
"loss": 6.7157,
|
|
"mean_token_accuracy": 0.149982488155365,
|
|
"num_tokens": 6370469.0,
|
|
"step": 2530
|
|
},
|
|
{
|
|
"entropy": 6.7619242668151855,
|
|
"epoch": 0.29255626081938835,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004996439314040287,
|
|
"loss": 6.7762,
|
|
"mean_token_accuracy": 0.1360616222023964,
|
|
"num_tokens": 6384333.0,
|
|
"step": 2535
|
|
},
|
|
{
|
|
"entropy": 6.855607652664185,
|
|
"epoch": 0.293133294864397,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.000499641607061275,
|
|
"loss": 6.7016,
|
|
"mean_token_accuracy": 0.1434970736503601,
|
|
"num_tokens": 6397688.0,
|
|
"step": 2540
|
|
},
|
|
{
|
|
"entropy": 6.819028520584107,
|
|
"epoch": 0.2937103289094057,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004996392751628126,
|
|
"loss": 6.6602,
|
|
"mean_token_accuracy": 0.14889983236789703,
|
|
"num_tokens": 6410188.0,
|
|
"step": 2545
|
|
},
|
|
{
|
|
"entropy": 6.722808504104615,
|
|
"epoch": 0.2942873629544143,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004996369357087196,
|
|
"loss": 6.6805,
|
|
"mean_token_accuracy": 0.14856439232826232,
|
|
"num_tokens": 6423313.0,
|
|
"step": 2550
|
|
},
|
|
{
|
|
"entropy": 6.845215559005737,
|
|
"epoch": 0.29486439699942296,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.000499634588699075,
|
|
"loss": 6.7135,
|
|
"mean_token_accuracy": 0.14631582498550416,
|
|
"num_tokens": 6435853.0,
|
|
"step": 2555
|
|
},
|
|
{
|
|
"entropy": 6.713652801513672,
|
|
"epoch": 0.2954414310444316,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004996322341339575,
|
|
"loss": 6.6397,
|
|
"mean_token_accuracy": 0.14477873146533965,
|
|
"num_tokens": 6448659.0,
|
|
"step": 2560
|
|
},
|
|
{
|
|
"entropy": 6.7395094871521,
|
|
"epoch": 0.2960184650894403,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004996298720134465,
|
|
"loss": 6.6985,
|
|
"mean_token_accuracy": 0.14935118854045867,
|
|
"num_tokens": 6460534.0,
|
|
"step": 2565
|
|
},
|
|
{
|
|
"entropy": 6.828916740417481,
|
|
"epoch": 0.29659549913444894,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004996275023376213,
|
|
"loss": 6.6741,
|
|
"mean_token_accuracy": 0.14743488729000093,
|
|
"num_tokens": 6472368.0,
|
|
"step": 2570
|
|
},
|
|
{
|
|
"entropy": 6.772326993942261,
|
|
"epoch": 0.2971725331794576,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004996251251065615,
|
|
"loss": 6.6763,
|
|
"mean_token_accuracy": 0.14429058134555817,
|
|
"num_tokens": 6485430.0,
|
|
"step": 2575
|
|
},
|
|
{
|
|
"entropy": 6.764473915100098,
|
|
"epoch": 0.2977495672244662,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004996227403203473,
|
|
"loss": 6.656,
|
|
"mean_token_accuracy": 0.15102906972169877,
|
|
"num_tokens": 6497303.0,
|
|
"step": 2580
|
|
},
|
|
{
|
|
"entropy": 6.816898822784424,
|
|
"epoch": 0.2983266012694749,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004996203479790589,
|
|
"loss": 6.7282,
|
|
"mean_token_accuracy": 0.15129706114530564,
|
|
"num_tokens": 6510154.0,
|
|
"step": 2585
|
|
},
|
|
{
|
|
"entropy": 6.819794940948486,
|
|
"epoch": 0.29890363531448355,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004996179480827764,
|
|
"loss": 6.7073,
|
|
"mean_token_accuracy": 0.14853841662406922,
|
|
"num_tokens": 6523091.0,
|
|
"step": 2590
|
|
},
|
|
{
|
|
"entropy": 6.845903539657593,
|
|
"epoch": 0.2994806693594922,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000499615540631581,
|
|
"loss": 6.6167,
|
|
"mean_token_accuracy": 0.15361105501651764,
|
|
"num_tokens": 6536043.0,
|
|
"step": 2595
|
|
},
|
|
{
|
|
"entropy": 6.660343933105469,
|
|
"epoch": 0.3000577034045009,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004996131256255534,
|
|
"loss": 6.6328,
|
|
"mean_token_accuracy": 0.15334705710411073,
|
|
"num_tokens": 6548227.0,
|
|
"step": 2600
|
|
},
|
|
{
|
|
"entropy": 6.819034004211426,
|
|
"epoch": 0.3006347374495095,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004996107030647749,
|
|
"loss": 6.692,
|
|
"mean_token_accuracy": 0.14152004942297935,
|
|
"num_tokens": 6560204.0,
|
|
"step": 2605
|
|
},
|
|
{
|
|
"entropy": 6.756571340560913,
|
|
"epoch": 0.30121177149451817,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004996082729493269,
|
|
"loss": 6.6744,
|
|
"mean_token_accuracy": 0.15325141996145247,
|
|
"num_tokens": 6573235.0,
|
|
"step": 2610
|
|
},
|
|
{
|
|
"entropy": 6.73859806060791,
|
|
"epoch": 0.3017888055395268,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004996058352792913,
|
|
"loss": 6.7054,
|
|
"mean_token_accuracy": 0.14550871774554253,
|
|
"num_tokens": 6585118.0,
|
|
"step": 2615
|
|
},
|
|
{
|
|
"entropy": 6.755663061141968,
|
|
"epoch": 0.3023658395845355,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00049960339005475,
|
|
"loss": 6.5996,
|
|
"mean_token_accuracy": 0.14909390211105347,
|
|
"num_tokens": 6596690.0,
|
|
"step": 2620
|
|
},
|
|
{
|
|
"entropy": 6.764217233657837,
|
|
"epoch": 0.30294287362954414,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004996009372757852,
|
|
"loss": 6.5965,
|
|
"mean_token_accuracy": 0.1569955661892891,
|
|
"num_tokens": 6609076.0,
|
|
"step": 2625
|
|
},
|
|
{
|
|
"entropy": 6.729177474975586,
|
|
"epoch": 0.3035199076745528,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004995984769424795,
|
|
"loss": 6.7118,
|
|
"mean_token_accuracy": 0.14563166871666908,
|
|
"num_tokens": 6621352.0,
|
|
"step": 2630
|
|
},
|
|
{
|
|
"entropy": 6.814102125167847,
|
|
"epoch": 0.3040969417195615,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004995960090549155,
|
|
"loss": 6.5982,
|
|
"mean_token_accuracy": 0.1499995172023773,
|
|
"num_tokens": 6633924.0,
|
|
"step": 2635
|
|
},
|
|
{
|
|
"entropy": 6.754621171951294,
|
|
"epoch": 0.3046739757645701,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004995935336131764,
|
|
"loss": 6.7238,
|
|
"mean_token_accuracy": 0.1473952054977417,
|
|
"num_tokens": 6646490.0,
|
|
"step": 2640
|
|
},
|
|
{
|
|
"entropy": 6.8332771301269535,
|
|
"epoch": 0.30525100980957875,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004995910506173452,
|
|
"loss": 6.6893,
|
|
"mean_token_accuracy": 0.14203061014413834,
|
|
"num_tokens": 6660171.0,
|
|
"step": 2645
|
|
},
|
|
{
|
|
"entropy": 6.768089628219604,
|
|
"epoch": 0.3058280438545874,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004995885600675059,
|
|
"loss": 6.7052,
|
|
"mean_token_accuracy": 0.1487940713763237,
|
|
"num_tokens": 6673505.0,
|
|
"step": 2650
|
|
},
|
|
{
|
|
"entropy": 6.782451200485229,
|
|
"epoch": 0.3064050778995961,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004995860619637415,
|
|
"loss": 6.7004,
|
|
"mean_token_accuracy": 0.1495489463210106,
|
|
"num_tokens": 6685798.0,
|
|
"step": 2655
|
|
},
|
|
{
|
|
"entropy": 6.705468416213989,
|
|
"epoch": 0.30698211194460473,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004995835563061367,
|
|
"loss": 6.5514,
|
|
"mean_token_accuracy": 0.15502395033836364,
|
|
"num_tokens": 6699254.0,
|
|
"step": 2660
|
|
},
|
|
{
|
|
"entropy": 6.736592388153076,
|
|
"epoch": 0.30755914598961337,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004995810430947756,
|
|
"loss": 6.6154,
|
|
"mean_token_accuracy": 0.15057491064071654,
|
|
"num_tokens": 6711088.0,
|
|
"step": 2665
|
|
},
|
|
{
|
|
"entropy": 6.759505414962769,
|
|
"epoch": 0.30813618003462206,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004995785223297426,
|
|
"loss": 6.6807,
|
|
"mean_token_accuracy": 0.14461947679519654,
|
|
"num_tokens": 6723373.0,
|
|
"step": 2670
|
|
},
|
|
{
|
|
"entropy": 6.741917705535888,
|
|
"epoch": 0.3087132140796307,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0004995759940111225,
|
|
"loss": 6.6848,
|
|
"mean_token_accuracy": 0.14381011575460434,
|
|
"num_tokens": 6737984.0,
|
|
"step": 2675
|
|
},
|
|
{
|
|
"entropy": 6.773638963699341,
|
|
"epoch": 0.30929024812463934,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004995734581390005,
|
|
"loss": 6.6328,
|
|
"mean_token_accuracy": 0.14959122091531754,
|
|
"num_tokens": 6751283.0,
|
|
"step": 2680
|
|
},
|
|
{
|
|
"entropy": 6.680616760253907,
|
|
"epoch": 0.309867282169648,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004995709147134617,
|
|
"loss": 6.6046,
|
|
"mean_token_accuracy": 0.15074616074562072,
|
|
"num_tokens": 6765012.0,
|
|
"step": 2685
|
|
},
|
|
{
|
|
"entropy": 6.775850296020508,
|
|
"epoch": 0.3104443162146567,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004995683637345919,
|
|
"loss": 6.6392,
|
|
"mean_token_accuracy": 0.15261454582214357,
|
|
"num_tokens": 6777708.0,
|
|
"step": 2690
|
|
},
|
|
{
|
|
"entropy": 6.7052594184875485,
|
|
"epoch": 0.3110213502596653,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004995658052024765,
|
|
"loss": 6.5669,
|
|
"mean_token_accuracy": 0.16054244190454484,
|
|
"num_tokens": 6791325.0,
|
|
"step": 2695
|
|
},
|
|
{
|
|
"entropy": 6.722959423065186,
|
|
"epoch": 0.31159838430467396,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004995632391172019,
|
|
"loss": 6.718,
|
|
"mean_token_accuracy": 0.13914413154125213,
|
|
"num_tokens": 6805659.0,
|
|
"step": 2700
|
|
},
|
|
{
|
|
"entropy": 6.812787103652954,
|
|
"epoch": 0.31217541834968265,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004995606654788543,
|
|
"loss": 6.637,
|
|
"mean_token_accuracy": 0.14895061701536177,
|
|
"num_tokens": 6818110.0,
|
|
"step": 2705
|
|
},
|
|
{
|
|
"entropy": 6.727897787094117,
|
|
"epoch": 0.3127524523946913,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004995580842875202,
|
|
"loss": 6.6378,
|
|
"mean_token_accuracy": 0.14641101211309432,
|
|
"num_tokens": 6830959.0,
|
|
"step": 2710
|
|
},
|
|
{
|
|
"entropy": 6.807159328460694,
|
|
"epoch": 0.31332948643969993,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004995554955432866,
|
|
"loss": 6.6977,
|
|
"mean_token_accuracy": 0.14908618479967117,
|
|
"num_tokens": 6843318.0,
|
|
"step": 2715
|
|
},
|
|
{
|
|
"entropy": 6.718437242507934,
|
|
"epoch": 0.3139065204847086,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004995528992462404,
|
|
"loss": 6.5811,
|
|
"mean_token_accuracy": 0.1510560542345047,
|
|
"num_tokens": 6855154.0,
|
|
"step": 2720
|
|
},
|
|
{
|
|
"entropy": 6.71838641166687,
|
|
"epoch": 0.31448355452971727,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.000499550295396469,
|
|
"loss": 6.6456,
|
|
"mean_token_accuracy": 0.14983784556388854,
|
|
"num_tokens": 6867428.0,
|
|
"step": 2725
|
|
},
|
|
{
|
|
"entropy": 6.756401872634887,
|
|
"epoch": 0.3150605885747259,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004995476839940598,
|
|
"loss": 6.6363,
|
|
"mean_token_accuracy": 0.15786276906728744,
|
|
"num_tokens": 6879989.0,
|
|
"step": 2730
|
|
},
|
|
{
|
|
"entropy": 6.777546310424805,
|
|
"epoch": 0.31563762261973455,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.000499545065039101,
|
|
"loss": 6.6447,
|
|
"mean_token_accuracy": 0.1432705909013748,
|
|
"num_tokens": 6893179.0,
|
|
"step": 2735
|
|
},
|
|
{
|
|
"entropy": 6.786166429519653,
|
|
"epoch": 0.31621465666474324,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004995424385316803,
|
|
"loss": 6.6354,
|
|
"mean_token_accuracy": 0.1462482675909996,
|
|
"num_tokens": 6905647.0,
|
|
"step": 2740
|
|
},
|
|
{
|
|
"entropy": 6.713575553894043,
|
|
"epoch": 0.3167916907097519,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004995398044718863,
|
|
"loss": 6.6146,
|
|
"mean_token_accuracy": 0.15827973783016205,
|
|
"num_tokens": 6917361.0,
|
|
"step": 2745
|
|
},
|
|
{
|
|
"entropy": 6.780123996734619,
|
|
"epoch": 0.3173687247547605,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004995371628598074,
|
|
"loss": 6.6339,
|
|
"mean_token_accuracy": 0.14651651680469513,
|
|
"num_tokens": 6929515.0,
|
|
"step": 2750
|
|
},
|
|
{
|
|
"entropy": 6.748660898208618,
|
|
"epoch": 0.31794575879976916,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004995345136955328,
|
|
"loss": 6.6036,
|
|
"mean_token_accuracy": 0.15300127118825912,
|
|
"num_tokens": 6942265.0,
|
|
"step": 2755
|
|
},
|
|
{
|
|
"entropy": 6.7021361827850345,
|
|
"epoch": 0.31852279284477786,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004995318569791512,
|
|
"loss": 6.661,
|
|
"mean_token_accuracy": 0.15360585749149322,
|
|
"num_tokens": 6955151.0,
|
|
"step": 2760
|
|
},
|
|
{
|
|
"entropy": 6.784101343154907,
|
|
"epoch": 0.3190998268897865,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004995291927107522,
|
|
"loss": 6.6172,
|
|
"mean_token_accuracy": 0.1502458855509758,
|
|
"num_tokens": 6968378.0,
|
|
"step": 2765
|
|
},
|
|
{
|
|
"entropy": 6.669129657745361,
|
|
"epoch": 0.31967686093479514,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004995265208904252,
|
|
"loss": 6.6216,
|
|
"mean_token_accuracy": 0.14923231303691864,
|
|
"num_tokens": 6980083.0,
|
|
"step": 2770
|
|
},
|
|
{
|
|
"entropy": 6.747028255462647,
|
|
"epoch": 0.32025389497980383,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004995238415182603,
|
|
"loss": 6.6581,
|
|
"mean_token_accuracy": 0.1432106763124466,
|
|
"num_tokens": 6992981.0,
|
|
"step": 2775
|
|
},
|
|
{
|
|
"entropy": 6.844202852249145,
|
|
"epoch": 0.3208309290248125,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004995211545943476,
|
|
"loss": 6.6409,
|
|
"mean_token_accuracy": 0.14744580015540124,
|
|
"num_tokens": 7006115.0,
|
|
"step": 2780
|
|
},
|
|
{
|
|
"entropy": 6.653217697143555,
|
|
"epoch": 0.3214079630698211,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004995184601187772,
|
|
"loss": 6.6014,
|
|
"mean_token_accuracy": 0.15577706843614578,
|
|
"num_tokens": 7019176.0,
|
|
"step": 2785
|
|
},
|
|
{
|
|
"entropy": 6.641081857681274,
|
|
"epoch": 0.32198499711482975,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00049951575809164,
|
|
"loss": 6.5282,
|
|
"mean_token_accuracy": 0.16437966525554656,
|
|
"num_tokens": 7031214.0,
|
|
"step": 2790
|
|
},
|
|
{
|
|
"entropy": 6.66480655670166,
|
|
"epoch": 0.32256203115983845,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004995130485130269,
|
|
"loss": 6.6088,
|
|
"mean_token_accuracy": 0.15185024589300156,
|
|
"num_tokens": 7044702.0,
|
|
"step": 2795
|
|
},
|
|
{
|
|
"entropy": 6.752944231033325,
|
|
"epoch": 0.3231390652048471,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004995103313830289,
|
|
"loss": 6.6018,
|
|
"mean_token_accuracy": 0.15165336132049562,
|
|
"num_tokens": 7056489.0,
|
|
"step": 2800
|
|
},
|
|
{
|
|
"entropy": 6.729215812683106,
|
|
"epoch": 0.3237160992498557,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004995076067017373,
|
|
"loss": 6.6406,
|
|
"mean_token_accuracy": 0.14547208398580552,
|
|
"num_tokens": 7068972.0,
|
|
"step": 2805
|
|
},
|
|
{
|
|
"entropy": 6.74854302406311,
|
|
"epoch": 0.3242931332948644,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004995048744692439,
|
|
"loss": 6.5746,
|
|
"mean_token_accuracy": 0.15244885683059692,
|
|
"num_tokens": 7080894.0,
|
|
"step": 2810
|
|
},
|
|
{
|
|
"entropy": 6.713599061965942,
|
|
"epoch": 0.32487016733987306,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004995021346856405,
|
|
"loss": 6.6122,
|
|
"mean_token_accuracy": 0.14793540984392167,
|
|
"num_tokens": 7094427.0,
|
|
"step": 2815
|
|
},
|
|
{
|
|
"entropy": 6.65841121673584,
|
|
"epoch": 0.3254472013848817,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004994993873510196,
|
|
"loss": 6.5596,
|
|
"mean_token_accuracy": 0.16087264865636824,
|
|
"num_tokens": 7105710.0,
|
|
"step": 2820
|
|
},
|
|
{
|
|
"entropy": 6.793656873703003,
|
|
"epoch": 0.32602423542989034,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004994966324654731,
|
|
"loss": 6.5838,
|
|
"mean_token_accuracy": 0.14802931025624275,
|
|
"num_tokens": 7119042.0,
|
|
"step": 2825
|
|
},
|
|
{
|
|
"entropy": 6.634446716308593,
|
|
"epoch": 0.32660126947489904,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.000499493870029094,
|
|
"loss": 6.6077,
|
|
"mean_token_accuracy": 0.148269946873188,
|
|
"num_tokens": 7132146.0,
|
|
"step": 2830
|
|
},
|
|
{
|
|
"entropy": 6.726744699478149,
|
|
"epoch": 0.3271783035199077,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004994911000419749,
|
|
"loss": 6.562,
|
|
"mean_token_accuracy": 0.15012803077697753,
|
|
"num_tokens": 7144805.0,
|
|
"step": 2835
|
|
},
|
|
{
|
|
"entropy": 6.6751384258270265,
|
|
"epoch": 0.3277553375649163,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004994883225042093,
|
|
"loss": 6.5475,
|
|
"mean_token_accuracy": 0.16178591400384904,
|
|
"num_tokens": 7156906.0,
|
|
"step": 2840
|
|
},
|
|
{
|
|
"entropy": 6.753067064285278,
|
|
"epoch": 0.328332371609925,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004994855374158905,
|
|
"loss": 6.5298,
|
|
"mean_token_accuracy": 0.15081926435232162,
|
|
"num_tokens": 7169451.0,
|
|
"step": 2845
|
|
},
|
|
{
|
|
"entropy": 6.7513651847839355,
|
|
"epoch": 0.32890940565493365,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.000499482744777112,
|
|
"loss": 6.675,
|
|
"mean_token_accuracy": 0.14404026567935943,
|
|
"num_tokens": 7183211.0,
|
|
"step": 2850
|
|
},
|
|
{
|
|
"entropy": 6.7373758316040036,
|
|
"epoch": 0.3294864396999423,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.000499479944587968,
|
|
"loss": 6.6147,
|
|
"mean_token_accuracy": 0.1517378196120262,
|
|
"num_tokens": 7196062.0,
|
|
"step": 2855
|
|
},
|
|
{
|
|
"entropy": 6.794651794433594,
|
|
"epoch": 0.33006347374495093,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004994771368485526,
|
|
"loss": 6.7089,
|
|
"mean_token_accuracy": 0.14450829550623895,
|
|
"num_tokens": 7208079.0,
|
|
"step": 2860
|
|
},
|
|
{
|
|
"entropy": 6.799776029586792,
|
|
"epoch": 0.3306405077899596,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004994743215589602,
|
|
"loss": 6.656,
|
|
"mean_token_accuracy": 0.14721468538045884,
|
|
"num_tokens": 7221537.0,
|
|
"step": 2865
|
|
},
|
|
{
|
|
"entropy": 6.66144700050354,
|
|
"epoch": 0.33121754183496827,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004994714987192854,
|
|
"loss": 6.6285,
|
|
"mean_token_accuracy": 0.14779918044805526,
|
|
"num_tokens": 7234472.0,
|
|
"step": 2870
|
|
},
|
|
{
|
|
"entropy": 6.707424116134644,
|
|
"epoch": 0.3317945758799769,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004994686683296234,
|
|
"loss": 6.5847,
|
|
"mean_token_accuracy": 0.15313812494277954,
|
|
"num_tokens": 7247818.0,
|
|
"step": 2875
|
|
},
|
|
{
|
|
"entropy": 6.695041847229004,
|
|
"epoch": 0.3323716099249856,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0004994658303900691,
|
|
"loss": 6.6729,
|
|
"mean_token_accuracy": 0.15236686170101166,
|
|
"num_tokens": 7261351.0,
|
|
"step": 2880
|
|
},
|
|
{
|
|
"entropy": 6.677237319946289,
|
|
"epoch": 0.33294864396999424,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004994629849007182,
|
|
"loss": 6.5247,
|
|
"mean_token_accuracy": 0.15475201308727266,
|
|
"num_tokens": 7274310.0,
|
|
"step": 2885
|
|
},
|
|
{
|
|
"entropy": 6.6607647895812985,
|
|
"epoch": 0.3335256780150029,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004994601318616663,
|
|
"loss": 6.5631,
|
|
"mean_token_accuracy": 0.15157887637615203,
|
|
"num_tokens": 7286560.0,
|
|
"step": 2890
|
|
},
|
|
{
|
|
"entropy": 6.811610126495362,
|
|
"epoch": 0.3341027120600115,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004994572712730092,
|
|
"loss": 6.6486,
|
|
"mean_token_accuracy": 0.14426497519016265,
|
|
"num_tokens": 7300337.0,
|
|
"step": 2895
|
|
},
|
|
{
|
|
"entropy": 6.691228675842285,
|
|
"epoch": 0.3346797461050202,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004994544031348434,
|
|
"loss": 6.6194,
|
|
"mean_token_accuracy": 0.1486266866326332,
|
|
"num_tokens": 7313436.0,
|
|
"step": 2900
|
|
},
|
|
{
|
|
"entropy": 6.666589450836182,
|
|
"epoch": 0.33525678015002885,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004994515274472653,
|
|
"loss": 6.4758,
|
|
"mean_token_accuracy": 0.16475249975919723,
|
|
"num_tokens": 7325766.0,
|
|
"step": 2905
|
|
},
|
|
{
|
|
"entropy": 6.611915159225464,
|
|
"epoch": 0.3358338141950375,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004994486442103715,
|
|
"loss": 6.5599,
|
|
"mean_token_accuracy": 0.14973128736019134,
|
|
"num_tokens": 7337904.0,
|
|
"step": 2910
|
|
},
|
|
{
|
|
"entropy": 6.648727655410767,
|
|
"epoch": 0.3364108482400462,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.000499445753424259,
|
|
"loss": 6.5601,
|
|
"mean_token_accuracy": 0.15160418599843978,
|
|
"num_tokens": 7350448.0,
|
|
"step": 2915
|
|
},
|
|
{
|
|
"entropy": 6.7852109432220455,
|
|
"epoch": 0.33698788228505483,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004994428550890251,
|
|
"loss": 6.5957,
|
|
"mean_token_accuracy": 0.1476546384394169,
|
|
"num_tokens": 7363859.0,
|
|
"step": 2920
|
|
},
|
|
{
|
|
"entropy": 6.703492069244385,
|
|
"epoch": 0.33756491633006347,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004994399492047672,
|
|
"loss": 6.6148,
|
|
"mean_token_accuracy": 0.1489669606089592,
|
|
"num_tokens": 7376963.0,
|
|
"step": 2925
|
|
},
|
|
{
|
|
"entropy": 6.677239227294922,
|
|
"epoch": 0.3381419503750721,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004994370357715832,
|
|
"loss": 6.6462,
|
|
"mean_token_accuracy": 0.14910098984837533,
|
|
"num_tokens": 7390370.0,
|
|
"step": 2930
|
|
},
|
|
{
|
|
"entropy": 6.712501335144043,
|
|
"epoch": 0.3387189844200808,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.000499434114789571,
|
|
"loss": 6.5836,
|
|
"mean_token_accuracy": 0.15484795421361924,
|
|
"num_tokens": 7402851.0,
|
|
"step": 2935
|
|
},
|
|
{
|
|
"entropy": 6.638098287582397,
|
|
"epoch": 0.33929601846508944,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004994311862588286,
|
|
"loss": 6.6003,
|
|
"mean_token_accuracy": 0.14664260819554328,
|
|
"num_tokens": 7415428.0,
|
|
"step": 2940
|
|
},
|
|
{
|
|
"entropy": 6.786514616012573,
|
|
"epoch": 0.3398730525100981,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004994282501794551,
|
|
"loss": 6.5911,
|
|
"mean_token_accuracy": 0.15048429667949675,
|
|
"num_tokens": 7428420.0,
|
|
"step": 2945
|
|
},
|
|
{
|
|
"entropy": 6.686578941345215,
|
|
"epoch": 0.3404500865551068,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004994253065515486,
|
|
"loss": 6.6436,
|
|
"mean_token_accuracy": 0.15113215446472167,
|
|
"num_tokens": 7439626.0,
|
|
"step": 2950
|
|
},
|
|
{
|
|
"entropy": 6.725645685195923,
|
|
"epoch": 0.3410271206001154,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004994223553752084,
|
|
"loss": 6.5901,
|
|
"mean_token_accuracy": 0.1514264941215515,
|
|
"num_tokens": 7452797.0,
|
|
"step": 2955
|
|
},
|
|
{
|
|
"entropy": 6.65960373878479,
|
|
"epoch": 0.34160415464512406,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004994193966505339,
|
|
"loss": 6.5682,
|
|
"mean_token_accuracy": 0.15812762975692748,
|
|
"num_tokens": 7464311.0,
|
|
"step": 2960
|
|
},
|
|
{
|
|
"entropy": 6.6784382343292235,
|
|
"epoch": 0.3421811886901327,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004994164303776244,
|
|
"loss": 6.5852,
|
|
"mean_token_accuracy": 0.15011241137981415,
|
|
"num_tokens": 7475706.0,
|
|
"step": 2965
|
|
},
|
|
{
|
|
"entropy": 6.7143481254577635,
|
|
"epoch": 0.3427582227351414,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004994134565565797,
|
|
"loss": 6.6579,
|
|
"mean_token_accuracy": 0.1478770911693573,
|
|
"num_tokens": 7489077.0,
|
|
"step": 2970
|
|
},
|
|
{
|
|
"entropy": 6.736965751647949,
|
|
"epoch": 0.34333525678015003,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004994104751875,
|
|
"loss": 6.6074,
|
|
"mean_token_accuracy": 0.15452702343463898,
|
|
"num_tokens": 7501598.0,
|
|
"step": 2975
|
|
},
|
|
{
|
|
"entropy": 6.608485174179077,
|
|
"epoch": 0.3439122908251587,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004994074862704854,
|
|
"loss": 6.4109,
|
|
"mean_token_accuracy": 0.16355000287294388,
|
|
"num_tokens": 7514776.0,
|
|
"step": 2980
|
|
},
|
|
{
|
|
"entropy": 6.584009838104248,
|
|
"epoch": 0.3444893248701673,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004994044898056363,
|
|
"loss": 6.5766,
|
|
"mean_token_accuracy": 0.15253832191228867,
|
|
"num_tokens": 7527795.0,
|
|
"step": 2985
|
|
},
|
|
{
|
|
"entropy": 6.702622604370117,
|
|
"epoch": 0.345066358915176,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004994014857930538,
|
|
"loss": 6.4427,
|
|
"mean_token_accuracy": 0.1624614641070366,
|
|
"num_tokens": 7541392.0,
|
|
"step": 2990
|
|
},
|
|
{
|
|
"entropy": 6.615006446838379,
|
|
"epoch": 0.34564339296018465,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004993984742328387,
|
|
"loss": 6.601,
|
|
"mean_token_accuracy": 0.15036358386278154,
|
|
"num_tokens": 7554369.0,
|
|
"step": 2995
|
|
},
|
|
{
|
|
"entropy": 6.672338581085205,
|
|
"epoch": 0.3462204270051933,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004993954551250925,
|
|
"loss": 6.603,
|
|
"mean_token_accuracy": 0.154202963411808,
|
|
"num_tokens": 7567528.0,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"epoch": 0.3462204270051933,
|
|
"eval_entropy": 6.5903391438110805,
|
|
"eval_loss": 6.633339881896973,
|
|
"eval_mean_token_accuracy": 0.15343972800560624,
|
|
"eval_num_tokens": 7567528.0,
|
|
"eval_runtime": 17.6947,
|
|
"eval_samples_per_second": 1590.081,
|
|
"eval_steps_per_second": 198.76,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"entropy": 6.706592988967896,
|
|
"epoch": 0.346797461050202,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004993924284699165,
|
|
"loss": 6.5524,
|
|
"mean_token_accuracy": 0.15312376469373704,
|
|
"num_tokens": 7579146.0,
|
|
"step": 3005
|
|
},
|
|
{
|
|
"entropy": 6.66014552116394,
|
|
"epoch": 0.3473744950952106,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004993893942674127,
|
|
"loss": 6.64,
|
|
"mean_token_accuracy": 0.1477951481938362,
|
|
"num_tokens": 7591902.0,
|
|
"step": 3010
|
|
},
|
|
{
|
|
"entropy": 6.799589061737061,
|
|
"epoch": 0.34795152914021926,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.000499386352517683,
|
|
"loss": 6.6448,
|
|
"mean_token_accuracy": 0.1552356779575348,
|
|
"num_tokens": 7605565.0,
|
|
"step": 3015
|
|
},
|
|
{
|
|
"entropy": 6.7373872756958,
|
|
"epoch": 0.3485285631852279,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.00049938330322083,
|
|
"loss": 6.5734,
|
|
"mean_token_accuracy": 0.15451606512069702,
|
|
"num_tokens": 7618380.0,
|
|
"step": 3020
|
|
},
|
|
{
|
|
"entropy": 6.653174638748169,
|
|
"epoch": 0.3491055972302366,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004993802463769558,
|
|
"loss": 6.6035,
|
|
"mean_token_accuracy": 0.14853976368904115,
|
|
"num_tokens": 7632092.0,
|
|
"step": 3025
|
|
},
|
|
{
|
|
"entropy": 6.6859503269195555,
|
|
"epoch": 0.34968263127524524,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004993771819861636,
|
|
"loss": 6.6097,
|
|
"mean_token_accuracy": 0.14797925502061843,
|
|
"num_tokens": 7644185.0,
|
|
"step": 3030
|
|
},
|
|
{
|
|
"entropy": 6.741736364364624,
|
|
"epoch": 0.3502596653202539,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004993741100485564,
|
|
"loss": 6.5012,
|
|
"mean_token_accuracy": 0.15530159771442414,
|
|
"num_tokens": 7656635.0,
|
|
"step": 3035
|
|
},
|
|
{
|
|
"entropy": 6.64942421913147,
|
|
"epoch": 0.35083669936526257,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004993710305642374,
|
|
"loss": 6.5621,
|
|
"mean_token_accuracy": 0.15173622369766235,
|
|
"num_tokens": 7669643.0,
|
|
"step": 3040
|
|
},
|
|
{
|
|
"entropy": 6.688398933410644,
|
|
"epoch": 0.3514137334102712,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004993679435333102,
|
|
"loss": 6.5822,
|
|
"mean_token_accuracy": 0.14759134352207184,
|
|
"num_tokens": 7682489.0,
|
|
"step": 3045
|
|
},
|
|
{
|
|
"entropy": 6.630285358428955,
|
|
"epoch": 0.35199076745527985,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004993648489558788,
|
|
"loss": 6.5269,
|
|
"mean_token_accuracy": 0.15159836709499358,
|
|
"num_tokens": 7696670.0,
|
|
"step": 3050
|
|
},
|
|
{
|
|
"entropy": 6.6929933547973635,
|
|
"epoch": 0.3525678015002885,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004993617468320471,
|
|
"loss": 6.5451,
|
|
"mean_token_accuracy": 0.15906845778226852,
|
|
"num_tokens": 7709054.0,
|
|
"step": 3055
|
|
},
|
|
{
|
|
"entropy": 6.634079313278198,
|
|
"epoch": 0.3531448355452972,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004993586371619193,
|
|
"loss": 6.5548,
|
|
"mean_token_accuracy": 0.15278329253196715,
|
|
"num_tokens": 7721710.0,
|
|
"step": 3060
|
|
},
|
|
{
|
|
"entropy": 6.722148132324219,
|
|
"epoch": 0.3537218695903058,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004993555199456004,
|
|
"loss": 6.6095,
|
|
"mean_token_accuracy": 0.1526441752910614,
|
|
"num_tokens": 7733689.0,
|
|
"step": 3065
|
|
},
|
|
{
|
|
"entropy": 6.66739444732666,
|
|
"epoch": 0.35429890363531447,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004993523951831949,
|
|
"loss": 6.5803,
|
|
"mean_token_accuracy": 0.1555978015065193,
|
|
"num_tokens": 7745735.0,
|
|
"step": 3070
|
|
},
|
|
{
|
|
"entropy": 6.7588379859924315,
|
|
"epoch": 0.35487593768032316,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004993492628748081,
|
|
"loss": 6.5894,
|
|
"mean_token_accuracy": 0.14369118213653564,
|
|
"num_tokens": 7757352.0,
|
|
"step": 3075
|
|
},
|
|
{
|
|
"entropy": 6.6846785068511965,
|
|
"epoch": 0.3554529717253318,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004993461230205453,
|
|
"loss": 6.5369,
|
|
"mean_token_accuracy": 0.14949805587530135,
|
|
"num_tokens": 7768363.0,
|
|
"step": 3080
|
|
},
|
|
{
|
|
"entropy": 6.668369150161743,
|
|
"epoch": 0.35603000577034044,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004993429756205121,
|
|
"loss": 6.6618,
|
|
"mean_token_accuracy": 0.14399161487817763,
|
|
"num_tokens": 7781133.0,
|
|
"step": 3085
|
|
},
|
|
{
|
|
"entropy": 6.810355234146118,
|
|
"epoch": 0.3566070398153491,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004993398206748142,
|
|
"loss": 6.6461,
|
|
"mean_token_accuracy": 0.14326538443565368,
|
|
"num_tokens": 7794445.0,
|
|
"step": 3090
|
|
},
|
|
{
|
|
"entropy": 6.689512538909912,
|
|
"epoch": 0.3571840738603578,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004993366581835581,
|
|
"loss": 6.5431,
|
|
"mean_token_accuracy": 0.15431275665760041,
|
|
"num_tokens": 7807601.0,
|
|
"step": 3095
|
|
},
|
|
{
|
|
"entropy": 6.592484951019287,
|
|
"epoch": 0.3577611079053664,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004993334881468498,
|
|
"loss": 6.5139,
|
|
"mean_token_accuracy": 0.1561570018529892,
|
|
"num_tokens": 7819821.0,
|
|
"step": 3100
|
|
},
|
|
{
|
|
"entropy": 6.691237831115723,
|
|
"epoch": 0.35833814195037506,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004993303105647961,
|
|
"loss": 6.5343,
|
|
"mean_token_accuracy": 0.15187687054276466,
|
|
"num_tokens": 7832214.0,
|
|
"step": 3105
|
|
},
|
|
{
|
|
"entropy": 6.638499784469604,
|
|
"epoch": 0.35891517599538375,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004993271254375038,
|
|
"loss": 6.5741,
|
|
"mean_token_accuracy": 0.16051387637853623,
|
|
"num_tokens": 7844566.0,
|
|
"step": 3110
|
|
},
|
|
{
|
|
"entropy": 6.710163545608521,
|
|
"epoch": 0.3594922100403924,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.00049932393276508,
|
|
"loss": 6.5434,
|
|
"mean_token_accuracy": 0.15657812282443045,
|
|
"num_tokens": 7857965.0,
|
|
"step": 3115
|
|
},
|
|
{
|
|
"entropy": 6.603605270385742,
|
|
"epoch": 0.36006924408540103,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004993207325476323,
|
|
"loss": 6.5691,
|
|
"mean_token_accuracy": 0.1569638028740883,
|
|
"num_tokens": 7870902.0,
|
|
"step": 3120
|
|
},
|
|
{
|
|
"entropy": 6.778155136108398,
|
|
"epoch": 0.36064627813040967,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004993175247852681,
|
|
"loss": 6.6299,
|
|
"mean_token_accuracy": 0.14303801953792572,
|
|
"num_tokens": 7883694.0,
|
|
"step": 3125
|
|
},
|
|
{
|
|
"entropy": 6.624432468414307,
|
|
"epoch": 0.36122331217541837,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004993143094780954,
|
|
"loss": 6.52,
|
|
"mean_token_accuracy": 0.1570071041584015,
|
|
"num_tokens": 7896693.0,
|
|
"step": 3130
|
|
},
|
|
{
|
|
"entropy": 6.6653848648071286,
|
|
"epoch": 0.361800346220427,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004993110866262224,
|
|
"loss": 6.519,
|
|
"mean_token_accuracy": 0.15744696259498597,
|
|
"num_tokens": 7910010.0,
|
|
"step": 3135
|
|
},
|
|
{
|
|
"entropy": 6.7992534160614015,
|
|
"epoch": 0.36237738026543564,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004993078562297573,
|
|
"loss": 6.6268,
|
|
"mean_token_accuracy": 0.13919368460774423,
|
|
"num_tokens": 7922026.0,
|
|
"step": 3140
|
|
},
|
|
{
|
|
"entropy": 6.626803922653198,
|
|
"epoch": 0.36295441431044434,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004993046182888089,
|
|
"loss": 6.5974,
|
|
"mean_token_accuracy": 0.14518485516309737,
|
|
"num_tokens": 7934633.0,
|
|
"step": 3145
|
|
},
|
|
{
|
|
"entropy": 6.703473472595215,
|
|
"epoch": 0.363531448355453,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004993013728034861,
|
|
"loss": 6.5012,
|
|
"mean_token_accuracy": 0.15910948514938356,
|
|
"num_tokens": 7947189.0,
|
|
"step": 3150
|
|
},
|
|
{
|
|
"entropy": 6.645997714996338,
|
|
"epoch": 0.3641084824004616,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.000499298119773898,
|
|
"loss": 6.5815,
|
|
"mean_token_accuracy": 0.15228615552186966,
|
|
"num_tokens": 7961283.0,
|
|
"step": 3155
|
|
},
|
|
{
|
|
"entropy": 6.584298086166382,
|
|
"epoch": 0.36468551644547026,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004992948592001541,
|
|
"loss": 6.549,
|
|
"mean_token_accuracy": 0.157489425688982,
|
|
"num_tokens": 7974589.0,
|
|
"step": 3160
|
|
},
|
|
{
|
|
"entropy": 6.723839282989502,
|
|
"epoch": 0.36526255049047895,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.000499291591082364,
|
|
"loss": 6.5873,
|
|
"mean_token_accuracy": 0.1510259687900543,
|
|
"num_tokens": 7987148.0,
|
|
"step": 3165
|
|
},
|
|
{
|
|
"entropy": 6.713741779327393,
|
|
"epoch": 0.3658395845354876,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004992883154206377,
|
|
"loss": 6.6151,
|
|
"mean_token_accuracy": 0.15011707395315171,
|
|
"num_tokens": 8000679.0,
|
|
"step": 3170
|
|
},
|
|
{
|
|
"entropy": 6.601009368896484,
|
|
"epoch": 0.36641661858049623,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004992850322150853,
|
|
"loss": 6.4989,
|
|
"mean_token_accuracy": 0.1541821539402008,
|
|
"num_tokens": 8014011.0,
|
|
"step": 3175
|
|
},
|
|
{
|
|
"entropy": 6.708580017089844,
|
|
"epoch": 0.36699365262550493,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004992817414658172,
|
|
"loss": 6.5279,
|
|
"mean_token_accuracy": 0.1508907914161682,
|
|
"num_tokens": 8026022.0,
|
|
"step": 3180
|
|
},
|
|
{
|
|
"entropy": 6.696759557723999,
|
|
"epoch": 0.36757068667051357,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004992784431729442,
|
|
"loss": 6.5946,
|
|
"mean_token_accuracy": 0.15226232409477233,
|
|
"num_tokens": 8040123.0,
|
|
"step": 3185
|
|
},
|
|
{
|
|
"entropy": 6.711783027648925,
|
|
"epoch": 0.3681477207155222,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004992751373365771,
|
|
"loss": 6.5655,
|
|
"mean_token_accuracy": 0.1614807665348053,
|
|
"num_tokens": 8053320.0,
|
|
"step": 3190
|
|
},
|
|
{
|
|
"entropy": 6.583008337020874,
|
|
"epoch": 0.36872475476053085,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004992718239568273,
|
|
"loss": 6.5506,
|
|
"mean_token_accuracy": 0.15854466408491136,
|
|
"num_tokens": 8066682.0,
|
|
"step": 3195
|
|
},
|
|
{
|
|
"entropy": 6.743299245834351,
|
|
"epoch": 0.36930178880553954,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.000499268503033806,
|
|
"loss": 6.5441,
|
|
"mean_token_accuracy": 0.15438564270734786,
|
|
"num_tokens": 8078887.0,
|
|
"step": 3200
|
|
},
|
|
{
|
|
"entropy": 6.632726764678955,
|
|
"epoch": 0.3698788228505482,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004992651745676249,
|
|
"loss": 6.5254,
|
|
"mean_token_accuracy": 0.14970515072345733,
|
|
"num_tokens": 8090801.0,
|
|
"step": 3205
|
|
},
|
|
{
|
|
"entropy": 6.689233827590942,
|
|
"epoch": 0.3704558568955568,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004992618385583962,
|
|
"loss": 6.6118,
|
|
"mean_token_accuracy": 0.150309057533741,
|
|
"num_tokens": 8103387.0,
|
|
"step": 3210
|
|
},
|
|
{
|
|
"entropy": 6.599812173843384,
|
|
"epoch": 0.3710328909405655,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004992584950062319,
|
|
"loss": 6.4614,
|
|
"mean_token_accuracy": 0.15385584011673928,
|
|
"num_tokens": 8115356.0,
|
|
"step": 3215
|
|
},
|
|
{
|
|
"entropy": 6.6642804622650145,
|
|
"epoch": 0.37160992498557416,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004992551439112446,
|
|
"loss": 6.5755,
|
|
"mean_token_accuracy": 0.15292710214853286,
|
|
"num_tokens": 8129141.0,
|
|
"step": 3220
|
|
},
|
|
{
|
|
"entropy": 6.788556814193726,
|
|
"epoch": 0.3721869590305828,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004992517852735469,
|
|
"loss": 6.6057,
|
|
"mean_token_accuracy": 0.15070945620536805,
|
|
"num_tokens": 8142453.0,
|
|
"step": 3225
|
|
},
|
|
{
|
|
"entropy": 6.635298871994019,
|
|
"epoch": 0.37276399307559144,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004992484190932517,
|
|
"loss": 6.5671,
|
|
"mean_token_accuracy": 0.15121689140796662,
|
|
"num_tokens": 8154361.0,
|
|
"step": 3230
|
|
},
|
|
{
|
|
"entropy": 6.688446187973023,
|
|
"epoch": 0.37334102712060013,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004992450453704723,
|
|
"loss": 6.6194,
|
|
"mean_token_accuracy": 0.1466634377837181,
|
|
"num_tokens": 8168354.0,
|
|
"step": 3235
|
|
},
|
|
{
|
|
"entropy": 6.704189300537109,
|
|
"epoch": 0.3739180611656088,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004992416641053223,
|
|
"loss": 6.561,
|
|
"mean_token_accuracy": 0.1562179759144783,
|
|
"num_tokens": 8180700.0,
|
|
"step": 3240
|
|
},
|
|
{
|
|
"entropy": 6.630801677703857,
|
|
"epoch": 0.3744950952106174,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004992382752979153,
|
|
"loss": 6.5558,
|
|
"mean_token_accuracy": 0.15030025094747543,
|
|
"num_tokens": 8193987.0,
|
|
"step": 3245
|
|
},
|
|
{
|
|
"entropy": 6.665634822845459,
|
|
"epoch": 0.3750721292556261,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004992348789483651,
|
|
"loss": 6.6435,
|
|
"mean_token_accuracy": 0.15180691108107566,
|
|
"num_tokens": 8207150.0,
|
|
"step": 3250
|
|
},
|
|
{
|
|
"entropy": 6.734830856323242,
|
|
"epoch": 0.37564916330063475,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004992314750567864,
|
|
"loss": 6.5991,
|
|
"mean_token_accuracy": 0.1455582395195961,
|
|
"num_tokens": 8221050.0,
|
|
"step": 3255
|
|
},
|
|
{
|
|
"entropy": 6.682382249832154,
|
|
"epoch": 0.3762261973456434,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004992280636232933,
|
|
"loss": 6.5269,
|
|
"mean_token_accuracy": 0.1531355321407318,
|
|
"num_tokens": 8233641.0,
|
|
"step": 3260
|
|
},
|
|
{
|
|
"entropy": 6.685485553741455,
|
|
"epoch": 0.376803231390652,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004992246446480007,
|
|
"loss": 6.5393,
|
|
"mean_token_accuracy": 0.1599086806178093,
|
|
"num_tokens": 8246717.0,
|
|
"step": 3265
|
|
},
|
|
{
|
|
"entropy": 6.670789384841919,
|
|
"epoch": 0.3773802654356607,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004992212181310235,
|
|
"loss": 6.5781,
|
|
"mean_token_accuracy": 0.1480855494737625,
|
|
"num_tokens": 8258549.0,
|
|
"step": 3270
|
|
},
|
|
{
|
|
"entropy": 6.667711162567139,
|
|
"epoch": 0.37795729948066936,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000499217784072477,
|
|
"loss": 6.5681,
|
|
"mean_token_accuracy": 0.15179934725165367,
|
|
"num_tokens": 8271580.0,
|
|
"step": 3275
|
|
},
|
|
{
|
|
"entropy": 6.632532358169556,
|
|
"epoch": 0.378534333525678,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004992143424724768,
|
|
"loss": 6.5012,
|
|
"mean_token_accuracy": 0.16231818795204161,
|
|
"num_tokens": 8283866.0,
|
|
"step": 3280
|
|
},
|
|
{
|
|
"entropy": 6.666814136505127,
|
|
"epoch": 0.3791113675706867,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004992108933311385,
|
|
"loss": 6.546,
|
|
"mean_token_accuracy": 0.1500297874212265,
|
|
"num_tokens": 8296141.0,
|
|
"step": 3285
|
|
},
|
|
{
|
|
"entropy": 6.701229381561279,
|
|
"epoch": 0.37968840161569534,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004992074366485782,
|
|
"loss": 6.5113,
|
|
"mean_token_accuracy": 0.15184457004070281,
|
|
"num_tokens": 8309028.0,
|
|
"step": 3290
|
|
},
|
|
{
|
|
"entropy": 6.686760330200196,
|
|
"epoch": 0.380265435660704,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.000499203972424912,
|
|
"loss": 6.498,
|
|
"mean_token_accuracy": 0.15328776091337204,
|
|
"num_tokens": 8321268.0,
|
|
"step": 3295
|
|
},
|
|
{
|
|
"entropy": 6.590341329574585,
|
|
"epoch": 0.3808424697057126,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004992005006602567,
|
|
"loss": 6.507,
|
|
"mean_token_accuracy": 0.16145216226577758,
|
|
"num_tokens": 8333518.0,
|
|
"step": 3300
|
|
},
|
|
{
|
|
"entropy": 6.609353303909302,
|
|
"epoch": 0.3814195037507213,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004991970213547289,
|
|
"loss": 6.5272,
|
|
"mean_token_accuracy": 0.15743554830551149,
|
|
"num_tokens": 8345639.0,
|
|
"step": 3305
|
|
},
|
|
{
|
|
"entropy": 6.561810779571533,
|
|
"epoch": 0.38199653779572995,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004991935345084457,
|
|
"loss": 6.4193,
|
|
"mean_token_accuracy": 0.15771780014038086,
|
|
"num_tokens": 8358136.0,
|
|
"step": 3310
|
|
},
|
|
{
|
|
"entropy": 6.7044079303741455,
|
|
"epoch": 0.3825735718407386,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004991900401215243,
|
|
"loss": 6.5946,
|
|
"mean_token_accuracy": 0.14319533258676528,
|
|
"num_tokens": 8370480.0,
|
|
"step": 3315
|
|
},
|
|
{
|
|
"entropy": 6.665462303161621,
|
|
"epoch": 0.3831506058857473,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004991865381940822,
|
|
"loss": 6.5106,
|
|
"mean_token_accuracy": 0.15779313147068025,
|
|
"num_tokens": 8382894.0,
|
|
"step": 3320
|
|
},
|
|
{
|
|
"entropy": 6.643408632278442,
|
|
"epoch": 0.3837276399307559,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004991830287262374,
|
|
"loss": 6.603,
|
|
"mean_token_accuracy": 0.15157458335161209,
|
|
"num_tokens": 8395864.0,
|
|
"step": 3325
|
|
},
|
|
{
|
|
"entropy": 6.72900710105896,
|
|
"epoch": 0.38430467397576457,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004991795117181077,
|
|
"loss": 6.6255,
|
|
"mean_token_accuracy": 0.14565462321043016,
|
|
"num_tokens": 8408242.0,
|
|
"step": 3330
|
|
},
|
|
{
|
|
"entropy": 6.697143411636352,
|
|
"epoch": 0.3848817080207732,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004991759871698113,
|
|
"loss": 6.5052,
|
|
"mean_token_accuracy": 0.15765076875686646,
|
|
"num_tokens": 8420677.0,
|
|
"step": 3335
|
|
},
|
|
{
|
|
"entropy": 6.566110467910766,
|
|
"epoch": 0.3854587420657819,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004991724550814671,
|
|
"loss": 6.5212,
|
|
"mean_token_accuracy": 0.16033077090978623,
|
|
"num_tokens": 8434505.0,
|
|
"step": 3340
|
|
},
|
|
{
|
|
"entropy": 6.772804021835327,
|
|
"epoch": 0.38603577611079054,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004991689154531937,
|
|
"loss": 6.5408,
|
|
"mean_token_accuracy": 0.1514905296266079,
|
|
"num_tokens": 8447393.0,
|
|
"step": 3345
|
|
},
|
|
{
|
|
"entropy": 6.630925416946411,
|
|
"epoch": 0.3866128101557992,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004991653682851102,
|
|
"loss": 6.4492,
|
|
"mean_token_accuracy": 0.15575905442237853,
|
|
"num_tokens": 8459659.0,
|
|
"step": 3350
|
|
},
|
|
{
|
|
"entropy": 6.618975067138672,
|
|
"epoch": 0.3871898442008078,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.000499161813577336,
|
|
"loss": 6.5953,
|
|
"mean_token_accuracy": 0.1454840660095215,
|
|
"num_tokens": 8473783.0,
|
|
"step": 3355
|
|
},
|
|
{
|
|
"entropy": 6.637290287017822,
|
|
"epoch": 0.3877668782458165,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004991582513299903,
|
|
"loss": 6.38,
|
|
"mean_token_accuracy": 0.15462302714586257,
|
|
"num_tokens": 8486532.0,
|
|
"step": 3360
|
|
},
|
|
{
|
|
"entropy": 6.563358974456787,
|
|
"epoch": 0.38834391229082516,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004991546815431932,
|
|
"loss": 6.5613,
|
|
"mean_token_accuracy": 0.15162240266799926,
|
|
"num_tokens": 8499133.0,
|
|
"step": 3365
|
|
},
|
|
{
|
|
"entropy": 6.700711011886597,
|
|
"epoch": 0.3889209463358338,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.000499151104217065,
|
|
"loss": 6.5991,
|
|
"mean_token_accuracy": 0.1459987446665764,
|
|
"num_tokens": 8513391.0,
|
|
"step": 3370
|
|
},
|
|
{
|
|
"entropy": 6.657787609100342,
|
|
"epoch": 0.3894979803808425,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004991475193517254,
|
|
"loss": 6.5366,
|
|
"mean_token_accuracy": 0.1531873255968094,
|
|
"num_tokens": 8527191.0,
|
|
"step": 3375
|
|
},
|
|
{
|
|
"entropy": 6.656068611145019,
|
|
"epoch": 0.39007501442585113,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004991439269472956,
|
|
"loss": 6.5855,
|
|
"mean_token_accuracy": 0.15025382339954377,
|
|
"num_tokens": 8541328.0,
|
|
"step": 3380
|
|
},
|
|
{
|
|
"entropy": 6.641211032867432,
|
|
"epoch": 0.39065204847085977,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004991403270038961,
|
|
"loss": 6.493,
|
|
"mean_token_accuracy": 0.14907428622245789,
|
|
"num_tokens": 8553381.0,
|
|
"step": 3385
|
|
},
|
|
{
|
|
"entropy": 6.629001951217651,
|
|
"epoch": 0.3912290825158684,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000499136719521648,
|
|
"loss": 6.5109,
|
|
"mean_token_accuracy": 0.14996647387742995,
|
|
"num_tokens": 8565149.0,
|
|
"step": 3390
|
|
},
|
|
{
|
|
"entropy": 6.6479668617248535,
|
|
"epoch": 0.3918061165608771,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004991331045006726,
|
|
"loss": 6.5134,
|
|
"mean_token_accuracy": 0.1577385514974594,
|
|
"num_tokens": 8576767.0,
|
|
"step": 3395
|
|
},
|
|
{
|
|
"entropy": 6.707239389419556,
|
|
"epoch": 0.39238315060588574,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004991294819410916,
|
|
"loss": 6.5702,
|
|
"mean_token_accuracy": 0.15049649626016617,
|
|
"num_tokens": 8589948.0,
|
|
"step": 3400
|
|
},
|
|
{
|
|
"entropy": 6.554754066467285,
|
|
"epoch": 0.3929601846508944,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004991258518430268,
|
|
"loss": 6.4066,
|
|
"mean_token_accuracy": 0.1551789790391922,
|
|
"num_tokens": 8602233.0,
|
|
"step": 3405
|
|
},
|
|
{
|
|
"entropy": 6.66826901435852,
|
|
"epoch": 0.3935372186959031,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004991222142066003,
|
|
"loss": 6.4969,
|
|
"mean_token_accuracy": 0.15271663516759873,
|
|
"num_tokens": 8614938.0,
|
|
"step": 3410
|
|
},
|
|
{
|
|
"entropy": 6.688100671768188,
|
|
"epoch": 0.3941142527409117,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004991185690319345,
|
|
"loss": 6.5324,
|
|
"mean_token_accuracy": 0.1585379496216774,
|
|
"num_tokens": 8628203.0,
|
|
"step": 3415
|
|
},
|
|
{
|
|
"entropy": 6.593408536911011,
|
|
"epoch": 0.39469128678592036,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.000499114916319152,
|
|
"loss": 6.5038,
|
|
"mean_token_accuracy": 0.1594579190015793,
|
|
"num_tokens": 8640959.0,
|
|
"step": 3420
|
|
},
|
|
{
|
|
"entropy": 6.617645931243897,
|
|
"epoch": 0.395268320830929,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0004991112560683755,
|
|
"loss": 6.5159,
|
|
"mean_token_accuracy": 0.15616845935583115,
|
|
"num_tokens": 8656995.0,
|
|
"step": 3425
|
|
},
|
|
{
|
|
"entropy": 6.678982210159302,
|
|
"epoch": 0.3958453548759377,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004991075882797283,
|
|
"loss": 6.5291,
|
|
"mean_token_accuracy": 0.15549861565232276,
|
|
"num_tokens": 8671476.0,
|
|
"step": 3430
|
|
},
|
|
{
|
|
"entropy": 6.627415466308594,
|
|
"epoch": 0.39642238892094633,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004991039129533337,
|
|
"loss": 6.5481,
|
|
"mean_token_accuracy": 0.1529051437973976,
|
|
"num_tokens": 8683667.0,
|
|
"step": 3435
|
|
},
|
|
{
|
|
"entropy": 6.644215297698975,
|
|
"epoch": 0.396999422965955,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004991002300893152,
|
|
"loss": 6.5546,
|
|
"mean_token_accuracy": 0.1545812577009201,
|
|
"num_tokens": 8696564.0,
|
|
"step": 3440
|
|
},
|
|
{
|
|
"entropy": 6.669400453567505,
|
|
"epoch": 0.39757645701096367,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004990965396877969,
|
|
"loss": 6.4865,
|
|
"mean_token_accuracy": 0.15339938551187515,
|
|
"num_tokens": 8708512.0,
|
|
"step": 3445
|
|
},
|
|
{
|
|
"entropy": 6.609234380722046,
|
|
"epoch": 0.3981534910559723,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004990928417489027,
|
|
"loss": 6.3673,
|
|
"mean_token_accuracy": 0.16587528437376023,
|
|
"num_tokens": 8721015.0,
|
|
"step": 3450
|
|
},
|
|
{
|
|
"entropy": 6.567390012741089,
|
|
"epoch": 0.39873052510098095,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004990891362727572,
|
|
"loss": 6.4854,
|
|
"mean_token_accuracy": 0.15047257542610168,
|
|
"num_tokens": 8732538.0,
|
|
"step": 3455
|
|
},
|
|
{
|
|
"entropy": 6.679238510131836,
|
|
"epoch": 0.3993075591459896,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004990854232594848,
|
|
"loss": 6.5582,
|
|
"mean_token_accuracy": 0.15114261358976364,
|
|
"num_tokens": 8745093.0,
|
|
"step": 3460
|
|
},
|
|
{
|
|
"entropy": 6.634946250915528,
|
|
"epoch": 0.3998845931909983,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004990817027092106,
|
|
"loss": 6.4983,
|
|
"mean_token_accuracy": 0.15687089264392853,
|
|
"num_tokens": 8757441.0,
|
|
"step": 3465
|
|
},
|
|
{
|
|
"entropy": 6.660363864898682,
|
|
"epoch": 0.4004616272360069,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004990779746220595,
|
|
"loss": 6.5185,
|
|
"mean_token_accuracy": 0.15596205741167068,
|
|
"num_tokens": 8770307.0,
|
|
"step": 3470
|
|
},
|
|
{
|
|
"entropy": 6.5660014152526855,
|
|
"epoch": 0.40103866128101556,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004990742389981572,
|
|
"loss": 6.5366,
|
|
"mean_token_accuracy": 0.1550653576850891,
|
|
"num_tokens": 8782575.0,
|
|
"step": 3475
|
|
},
|
|
{
|
|
"entropy": 6.664673566818237,
|
|
"epoch": 0.40161569532602426,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.000499070495837629,
|
|
"loss": 6.5848,
|
|
"mean_token_accuracy": 0.14479815810918809,
|
|
"num_tokens": 8794962.0,
|
|
"step": 3480
|
|
},
|
|
{
|
|
"entropy": 6.661259126663208,
|
|
"epoch": 0.4021927293710329,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004990667451406012,
|
|
"loss": 6.5674,
|
|
"mean_token_accuracy": 0.1521621063351631,
|
|
"num_tokens": 8807434.0,
|
|
"step": 3485
|
|
},
|
|
{
|
|
"entropy": 6.673516368865966,
|
|
"epoch": 0.40276976341604154,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004990629869071995,
|
|
"loss": 6.5391,
|
|
"mean_token_accuracy": 0.14591969475150107,
|
|
"num_tokens": 8820748.0,
|
|
"step": 3490
|
|
},
|
|
{
|
|
"entropy": 6.604957246780396,
|
|
"epoch": 0.4033467974610502,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004990592211375506,
|
|
"loss": 6.465,
|
|
"mean_token_accuracy": 0.15596169531345366,
|
|
"num_tokens": 8833428.0,
|
|
"step": 3495
|
|
},
|
|
{
|
|
"entropy": 6.66051025390625,
|
|
"epoch": 0.4039238315060589,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004990554478317811,
|
|
"loss": 6.5121,
|
|
"mean_token_accuracy": 0.14970427826046945,
|
|
"num_tokens": 8845892.0,
|
|
"step": 3500
|
|
},
|
|
{
|
|
"entropy": 6.575010538101196,
|
|
"epoch": 0.4045008655510675,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004990516669900179,
|
|
"loss": 6.4569,
|
|
"mean_token_accuracy": 0.155875825881958,
|
|
"num_tokens": 8857508.0,
|
|
"step": 3505
|
|
},
|
|
{
|
|
"entropy": 6.607421207427978,
|
|
"epoch": 0.40507789959607615,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004990478786123882,
|
|
"loss": 6.492,
|
|
"mean_token_accuracy": 0.1571622833609581,
|
|
"num_tokens": 8868730.0,
|
|
"step": 3510
|
|
},
|
|
{
|
|
"entropy": 6.664318418502807,
|
|
"epoch": 0.40565493364108485,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0004990440826990193,
|
|
"loss": 6.4882,
|
|
"mean_token_accuracy": 0.14911171048879623,
|
|
"num_tokens": 8882687.0,
|
|
"step": 3515
|
|
},
|
|
{
|
|
"entropy": 6.578036642074585,
|
|
"epoch": 0.4062319676860935,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004990402792500392,
|
|
"loss": 6.5032,
|
|
"mean_token_accuracy": 0.15692729353904725,
|
|
"num_tokens": 8894723.0,
|
|
"step": 3520
|
|
},
|
|
{
|
|
"entropy": 6.5801005363464355,
|
|
"epoch": 0.4068090017311021,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004990364682655754,
|
|
"loss": 6.4722,
|
|
"mean_token_accuracy": 0.15482148230075837,
|
|
"num_tokens": 8906373.0,
|
|
"step": 3525
|
|
},
|
|
{
|
|
"entropy": 6.604721021652222,
|
|
"epoch": 0.40738603577611077,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004990326497457564,
|
|
"loss": 6.4737,
|
|
"mean_token_accuracy": 0.15373015254735947,
|
|
"num_tokens": 8918681.0,
|
|
"step": 3530
|
|
},
|
|
{
|
|
"entropy": 6.652784156799316,
|
|
"epoch": 0.40796306982111946,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004990288236907104,
|
|
"loss": 6.5282,
|
|
"mean_token_accuracy": 0.1494688406586647,
|
|
"num_tokens": 8930232.0,
|
|
"step": 3535
|
|
},
|
|
{
|
|
"entropy": 6.576983118057251,
|
|
"epoch": 0.4085401038661281,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004990249901005661,
|
|
"loss": 6.4193,
|
|
"mean_token_accuracy": 0.15579718947410584,
|
|
"num_tokens": 8942264.0,
|
|
"step": 3540
|
|
},
|
|
{
|
|
"entropy": 6.643110370635986,
|
|
"epoch": 0.40911713791113674,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004990211489754527,
|
|
"loss": 6.5992,
|
|
"mean_token_accuracy": 0.1467343896627426,
|
|
"num_tokens": 8955679.0,
|
|
"step": 3545
|
|
},
|
|
{
|
|
"entropy": 6.642524147033692,
|
|
"epoch": 0.40969417195614544,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004990173003154993,
|
|
"loss": 6.4317,
|
|
"mean_token_accuracy": 0.1543587066233158,
|
|
"num_tokens": 8968421.0,
|
|
"step": 3550
|
|
},
|
|
{
|
|
"entropy": 6.565263557434082,
|
|
"epoch": 0.4102712060011541,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004990134441208351,
|
|
"loss": 6.5003,
|
|
"mean_token_accuracy": 0.15063199996948243,
|
|
"num_tokens": 8981063.0,
|
|
"step": 3555
|
|
},
|
|
{
|
|
"entropy": 6.604219722747803,
|
|
"epoch": 0.4108482400461627,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004990095803915901,
|
|
"loss": 6.4315,
|
|
"mean_token_accuracy": 0.16306943893432618,
|
|
"num_tokens": 8993740.0,
|
|
"step": 3560
|
|
},
|
|
{
|
|
"entropy": 6.59393835067749,
|
|
"epoch": 0.41142527409117136,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004990057091278942,
|
|
"loss": 6.4888,
|
|
"mean_token_accuracy": 0.14942816495895386,
|
|
"num_tokens": 9007135.0,
|
|
"step": 3565
|
|
},
|
|
{
|
|
"entropy": 6.600633573532105,
|
|
"epoch": 0.41200230813618005,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004990018303298773,
|
|
"loss": 6.5045,
|
|
"mean_token_accuracy": 0.15680433362722396,
|
|
"num_tokens": 9021596.0,
|
|
"step": 3570
|
|
},
|
|
{
|
|
"entropy": 6.61022539138794,
|
|
"epoch": 0.4125793421811887,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004989979439976703,
|
|
"loss": 6.44,
|
|
"mean_token_accuracy": 0.16000102311372758,
|
|
"num_tokens": 9033523.0,
|
|
"step": 3575
|
|
},
|
|
{
|
|
"entropy": 6.593396806716919,
|
|
"epoch": 0.41315637622619733,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004989940501314037,
|
|
"loss": 6.4126,
|
|
"mean_token_accuracy": 0.15999998301267623,
|
|
"num_tokens": 9045690.0,
|
|
"step": 3580
|
|
},
|
|
{
|
|
"entropy": 6.580743408203125,
|
|
"epoch": 0.413733410271206,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004989901487312084,
|
|
"loss": 6.4811,
|
|
"mean_token_accuracy": 0.1552786871790886,
|
|
"num_tokens": 9057672.0,
|
|
"step": 3585
|
|
},
|
|
{
|
|
"entropy": 6.589711141586304,
|
|
"epoch": 0.41431044431621467,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004989862397972157,
|
|
"loss": 6.537,
|
|
"mean_token_accuracy": 0.15031036734580994,
|
|
"num_tokens": 9070004.0,
|
|
"step": 3590
|
|
},
|
|
{
|
|
"entropy": 6.658974361419678,
|
|
"epoch": 0.4148874783612233,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004989823233295572,
|
|
"loss": 6.4971,
|
|
"mean_token_accuracy": 0.15876225233078003,
|
|
"num_tokens": 9082453.0,
|
|
"step": 3595
|
|
},
|
|
{
|
|
"entropy": 6.593294286727906,
|
|
"epoch": 0.41546451240623195,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004989783993283644,
|
|
"loss": 6.5122,
|
|
"mean_token_accuracy": 0.1508851870894432,
|
|
"num_tokens": 9095839.0,
|
|
"step": 3600
|
|
},
|
|
{
|
|
"entropy": 6.563176059722901,
|
|
"epoch": 0.41604154645124064,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004989744677937694,
|
|
"loss": 6.4782,
|
|
"mean_token_accuracy": 0.1590025931596756,
|
|
"num_tokens": 9109476.0,
|
|
"step": 3605
|
|
},
|
|
{
|
|
"entropy": 6.619072437286377,
|
|
"epoch": 0.4166185804962493,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004989705287259046,
|
|
"loss": 6.4072,
|
|
"mean_token_accuracy": 0.1609771430492401,
|
|
"num_tokens": 9122354.0,
|
|
"step": 3610
|
|
},
|
|
{
|
|
"entropy": 6.532887077331543,
|
|
"epoch": 0.4171956145412579,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004989665821249021,
|
|
"loss": 6.4261,
|
|
"mean_token_accuracy": 0.16253601163625717,
|
|
"num_tokens": 9135502.0,
|
|
"step": 3615
|
|
},
|
|
{
|
|
"entropy": 6.664855527877807,
|
|
"epoch": 0.4177726485862666,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.000498962627990895,
|
|
"loss": 6.5659,
|
|
"mean_token_accuracy": 0.15357777327299119,
|
|
"num_tokens": 9147654.0,
|
|
"step": 3620
|
|
},
|
|
{
|
|
"entropy": 6.56908655166626,
|
|
"epoch": 0.41834968263127525,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004989586663240161,
|
|
"loss": 6.4847,
|
|
"mean_token_accuracy": 0.1522589549422264,
|
|
"num_tokens": 9161907.0,
|
|
"step": 3625
|
|
},
|
|
{
|
|
"entropy": 6.620093536376953,
|
|
"epoch": 0.4189267166762839,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004989546971243988,
|
|
"loss": 6.513,
|
|
"mean_token_accuracy": 0.14616103172302247,
|
|
"num_tokens": 9175395.0,
|
|
"step": 3630
|
|
},
|
|
{
|
|
"entropy": 6.614277410507202,
|
|
"epoch": 0.41950375072129253,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004989507203921763,
|
|
"loss": 6.4278,
|
|
"mean_token_accuracy": 0.1567081741988659,
|
|
"num_tokens": 9187688.0,
|
|
"step": 3635
|
|
},
|
|
{
|
|
"entropy": 6.550759267807007,
|
|
"epoch": 0.42008078476630123,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004989467361274828,
|
|
"loss": 6.4669,
|
|
"mean_token_accuracy": 0.15715653598308563,
|
|
"num_tokens": 9199773.0,
|
|
"step": 3640
|
|
},
|
|
{
|
|
"entropy": 6.521318578720093,
|
|
"epoch": 0.42065781881130987,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 0.0004989427443304519,
|
|
"loss": 6.4367,
|
|
"mean_token_accuracy": 0.1557897448539734,
|
|
"num_tokens": 9213997.0,
|
|
"step": 3645
|
|
},
|
|
{
|
|
"entropy": 6.621791362762451,
|
|
"epoch": 0.4212348528563185,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000498938745001218,
|
|
"loss": 6.4908,
|
|
"mean_token_accuracy": 0.15198236405849458,
|
|
"num_tokens": 9227187.0,
|
|
"step": 3650
|
|
},
|
|
{
|
|
"entropy": 6.67909688949585,
|
|
"epoch": 0.4218118869013272,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004989347381399158,
|
|
"loss": 6.5423,
|
|
"mean_token_accuracy": 0.1490216538310051,
|
|
"num_tokens": 9240860.0,
|
|
"step": 3655
|
|
},
|
|
{
|
|
"entropy": 6.584900903701782,
|
|
"epoch": 0.42238892094633584,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004989307237466799,
|
|
"loss": 6.436,
|
|
"mean_token_accuracy": 0.15650416314601898,
|
|
"num_tokens": 9253771.0,
|
|
"step": 3660
|
|
},
|
|
{
|
|
"entropy": 6.587461662292481,
|
|
"epoch": 0.4229659549913445,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004989267018216453,
|
|
"loss": 6.4773,
|
|
"mean_token_accuracy": 0.15263158679008484,
|
|
"num_tokens": 9268380.0,
|
|
"step": 3665
|
|
},
|
|
{
|
|
"entropy": 6.588645076751709,
|
|
"epoch": 0.4235429890363531,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004989226723649473,
|
|
"loss": 6.4562,
|
|
"mean_token_accuracy": 0.1565222844481468,
|
|
"num_tokens": 9279911.0,
|
|
"step": 3670
|
|
},
|
|
{
|
|
"entropy": 6.556595277786255,
|
|
"epoch": 0.4241200230813618,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004989186353767214,
|
|
"loss": 6.446,
|
|
"mean_token_accuracy": 0.16146985441446304,
|
|
"num_tokens": 9292105.0,
|
|
"step": 3675
|
|
},
|
|
{
|
|
"entropy": 6.591396760940552,
|
|
"epoch": 0.42469705712637046,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004989145908571035,
|
|
"loss": 6.5677,
|
|
"mean_token_accuracy": 0.15078672766685486,
|
|
"num_tokens": 9305503.0,
|
|
"step": 3680
|
|
},
|
|
{
|
|
"entropy": 6.630074405670166,
|
|
"epoch": 0.4252740911713791,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004989105388062295,
|
|
"loss": 6.4605,
|
|
"mean_token_accuracy": 0.1556406855583191,
|
|
"num_tokens": 9317978.0,
|
|
"step": 3685
|
|
},
|
|
{
|
|
"entropy": 6.619613599777222,
|
|
"epoch": 0.4258511252163878,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004989064792242358,
|
|
"loss": 6.5252,
|
|
"mean_token_accuracy": 0.15357265770435333,
|
|
"num_tokens": 9332676.0,
|
|
"step": 3690
|
|
},
|
|
{
|
|
"entropy": 6.579876184463501,
|
|
"epoch": 0.42642815926139643,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004989024121112589,
|
|
"loss": 6.426,
|
|
"mean_token_accuracy": 0.1560150146484375,
|
|
"num_tokens": 9345594.0,
|
|
"step": 3695
|
|
},
|
|
{
|
|
"entropy": 6.6138917922973635,
|
|
"epoch": 0.4270051933064051,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004988983374674356,
|
|
"loss": 6.5109,
|
|
"mean_token_accuracy": 0.1485238753259182,
|
|
"num_tokens": 9358303.0,
|
|
"step": 3700
|
|
},
|
|
{
|
|
"entropy": 6.520889186859131,
|
|
"epoch": 0.4275822273514137,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004988942552929029,
|
|
"loss": 6.3956,
|
|
"mean_token_accuracy": 0.16093592643737792,
|
|
"num_tokens": 9370953.0,
|
|
"step": 3705
|
|
},
|
|
{
|
|
"entropy": 6.522710132598877,
|
|
"epoch": 0.4281592613964224,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004988901655877981,
|
|
"loss": 6.4721,
|
|
"mean_token_accuracy": 0.15702161937952042,
|
|
"num_tokens": 9384563.0,
|
|
"step": 3710
|
|
},
|
|
{
|
|
"entropy": 6.60606837272644,
|
|
"epoch": 0.42873629544143105,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004988860683522589,
|
|
"loss": 6.4222,
|
|
"mean_token_accuracy": 0.16118086278438568,
|
|
"num_tokens": 9396401.0,
|
|
"step": 3715
|
|
},
|
|
{
|
|
"entropy": 6.555063343048095,
|
|
"epoch": 0.4293133294864397,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000498881963586423,
|
|
"loss": 6.4308,
|
|
"mean_token_accuracy": 0.15848347842693328,
|
|
"num_tokens": 9408520.0,
|
|
"step": 3720
|
|
},
|
|
{
|
|
"entropy": 6.4073954105377195,
|
|
"epoch": 0.4298903635314484,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004988778512904282,
|
|
"loss": 6.3381,
|
|
"mean_token_accuracy": 0.16240834444761276,
|
|
"num_tokens": 9421431.0,
|
|
"step": 3725
|
|
},
|
|
{
|
|
"entropy": 6.549575996398926,
|
|
"epoch": 0.430467397576457,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004988737314644134,
|
|
"loss": 6.4617,
|
|
"mean_token_accuracy": 0.15462952852249146,
|
|
"num_tokens": 9432566.0,
|
|
"step": 3730
|
|
},
|
|
{
|
|
"entropy": 6.6500896453857425,
|
|
"epoch": 0.43104443162146566,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004988696041085168,
|
|
"loss": 6.5593,
|
|
"mean_token_accuracy": 0.15154415518045425,
|
|
"num_tokens": 9444885.0,
|
|
"step": 3735
|
|
},
|
|
{
|
|
"entropy": 6.667054796218872,
|
|
"epoch": 0.4316214656664743,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004988654692228772,
|
|
"loss": 6.5498,
|
|
"mean_token_accuracy": 0.15102049708366394,
|
|
"num_tokens": 9457823.0,
|
|
"step": 3740
|
|
},
|
|
{
|
|
"entropy": 6.563848447799683,
|
|
"epoch": 0.432198499711483,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004988613268076335,
|
|
"loss": 6.3991,
|
|
"mean_token_accuracy": 0.16212892681360244,
|
|
"num_tokens": 9470799.0,
|
|
"step": 3745
|
|
},
|
|
{
|
|
"entropy": 6.535583543777466,
|
|
"epoch": 0.43277553375649164,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004988571768629257,
|
|
"loss": 6.4583,
|
|
"mean_token_accuracy": 0.16189608722925186,
|
|
"num_tokens": 9484175.0,
|
|
"step": 3750
|
|
},
|
|
{
|
|
"entropy": 6.63653335571289,
|
|
"epoch": 0.4333525678015003,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004988530193888927,
|
|
"loss": 6.5043,
|
|
"mean_token_accuracy": 0.15041833072900773,
|
|
"num_tokens": 9497809.0,
|
|
"step": 3755
|
|
},
|
|
{
|
|
"entropy": 6.56855206489563,
|
|
"epoch": 0.4339296018465089,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004988488543856747,
|
|
"loss": 6.4451,
|
|
"mean_token_accuracy": 0.15440599322319032,
|
|
"num_tokens": 9509755.0,
|
|
"step": 3760
|
|
},
|
|
{
|
|
"entropy": 6.524028348922729,
|
|
"epoch": 0.4345066358915176,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0004988446818534115,
|
|
"loss": 6.4522,
|
|
"mean_token_accuracy": 0.15307800620794296,
|
|
"num_tokens": 9523801.0,
|
|
"step": 3765
|
|
},
|
|
{
|
|
"entropy": 6.563017177581787,
|
|
"epoch": 0.43508366993652625,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004988405017922438,
|
|
"loss": 6.4373,
|
|
"mean_token_accuracy": 0.16271546185016633,
|
|
"num_tokens": 9535846.0,
|
|
"step": 3770
|
|
},
|
|
{
|
|
"entropy": 6.650265073776245,
|
|
"epoch": 0.4356607039815349,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.000498836314202312,
|
|
"loss": 6.5108,
|
|
"mean_token_accuracy": 0.15331310480833055,
|
|
"num_tokens": 9548194.0,
|
|
"step": 3775
|
|
},
|
|
{
|
|
"entropy": 6.523101472854615,
|
|
"epoch": 0.4362377380265436,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004988321190837568,
|
|
"loss": 6.4047,
|
|
"mean_token_accuracy": 0.15477531999349595,
|
|
"num_tokens": 9561069.0,
|
|
"step": 3780
|
|
},
|
|
{
|
|
"entropy": 6.466052484512329,
|
|
"epoch": 0.4368147720715522,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004988279164367196,
|
|
"loss": 6.3793,
|
|
"mean_token_accuracy": 0.15896909236907958,
|
|
"num_tokens": 9573778.0,
|
|
"step": 3785
|
|
},
|
|
{
|
|
"entropy": 6.535996627807617,
|
|
"epoch": 0.43739180611656087,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004988237062613415,
|
|
"loss": 6.3608,
|
|
"mean_token_accuracy": 0.1710158884525299,
|
|
"num_tokens": 9586616.0,
|
|
"step": 3790
|
|
},
|
|
{
|
|
"entropy": 6.576893711090088,
|
|
"epoch": 0.4379688401615695,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004988194885577644,
|
|
"loss": 6.4697,
|
|
"mean_token_accuracy": 0.1554633378982544,
|
|
"num_tokens": 9597943.0,
|
|
"step": 3795
|
|
},
|
|
{
|
|
"entropy": 6.500680875778198,
|
|
"epoch": 0.4385458742065782,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004988152633261299,
|
|
"loss": 6.4066,
|
|
"mean_token_accuracy": 0.16017991304397583,
|
|
"num_tokens": 9609861.0,
|
|
"step": 3800
|
|
},
|
|
{
|
|
"entropy": 6.532161569595337,
|
|
"epoch": 0.43912290825158684,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.00049881103056658,
|
|
"loss": 6.4607,
|
|
"mean_token_accuracy": 0.16110374480485917,
|
|
"num_tokens": 9623307.0,
|
|
"step": 3805
|
|
},
|
|
{
|
|
"entropy": 6.590618324279785,
|
|
"epoch": 0.4396999422965955,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004988067902792575,
|
|
"loss": 6.4706,
|
|
"mean_token_accuracy": 0.15618328303098677,
|
|
"num_tokens": 9635827.0,
|
|
"step": 3810
|
|
},
|
|
{
|
|
"entropy": 6.584213638305664,
|
|
"epoch": 0.4402769763416042,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004988025424643047,
|
|
"loss": 6.5281,
|
|
"mean_token_accuracy": 0.15362918823957444,
|
|
"num_tokens": 9649422.0,
|
|
"step": 3815
|
|
},
|
|
{
|
|
"entropy": 6.539908409118652,
|
|
"epoch": 0.4408540103866128,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004987982871218645,
|
|
"loss": 6.4985,
|
|
"mean_token_accuracy": 0.16369809061288834,
|
|
"num_tokens": 9661542.0,
|
|
"step": 3820
|
|
},
|
|
{
|
|
"entropy": 6.592797899246216,
|
|
"epoch": 0.44143104443162146,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004987940242520802,
|
|
"loss": 6.4823,
|
|
"mean_token_accuracy": 0.15268328189849853,
|
|
"num_tokens": 9674684.0,
|
|
"step": 3825
|
|
},
|
|
{
|
|
"entropy": 6.680898857116699,
|
|
"epoch": 0.4420080784766301,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.000498789753855095,
|
|
"loss": 6.5,
|
|
"mean_token_accuracy": 0.1492106169462204,
|
|
"num_tokens": 9687522.0,
|
|
"step": 3830
|
|
},
|
|
{
|
|
"entropy": 6.574478960037231,
|
|
"epoch": 0.4425851125216388,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004987854759310526,
|
|
"loss": 6.4528,
|
|
"mean_token_accuracy": 0.15816389620304108,
|
|
"num_tokens": 9699518.0,
|
|
"step": 3835
|
|
},
|
|
{
|
|
"entropy": 6.567315101623535,
|
|
"epoch": 0.44316214656664743,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004987811904800968,
|
|
"loss": 6.5127,
|
|
"mean_token_accuracy": 0.15438069850206376,
|
|
"num_tokens": 9711918.0,
|
|
"step": 3840
|
|
},
|
|
{
|
|
"entropy": 6.596231937408447,
|
|
"epoch": 0.44373918061165607,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0004987768975023719,
|
|
"loss": 6.3862,
|
|
"mean_token_accuracy": 0.15680329352617264,
|
|
"num_tokens": 9725643.0,
|
|
"step": 3845
|
|
},
|
|
{
|
|
"entropy": 6.530617141723633,
|
|
"epoch": 0.44431621465666477,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004987725969980222,
|
|
"loss": 6.403,
|
|
"mean_token_accuracy": 0.1597583845257759,
|
|
"num_tokens": 9738871.0,
|
|
"step": 3850
|
|
},
|
|
{
|
|
"entropy": 6.540352916717529,
|
|
"epoch": 0.4448932487016734,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004987682889671923,
|
|
"loss": 6.3894,
|
|
"mean_token_accuracy": 0.1617853969335556,
|
|
"num_tokens": 9751166.0,
|
|
"step": 3855
|
|
},
|
|
{
|
|
"entropy": 6.512079095840454,
|
|
"epoch": 0.44547028274668204,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004987639734100272,
|
|
"loss": 6.3536,
|
|
"mean_token_accuracy": 0.16155828088521956,
|
|
"num_tokens": 9765165.0,
|
|
"step": 3860
|
|
},
|
|
{
|
|
"entropy": 6.56067123413086,
|
|
"epoch": 0.4460473167916907,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004987596503266721,
|
|
"loss": 6.4014,
|
|
"mean_token_accuracy": 0.1621742233633995,
|
|
"num_tokens": 9776625.0,
|
|
"step": 3865
|
|
},
|
|
{
|
|
"entropy": 6.538637399673462,
|
|
"epoch": 0.4466243508366994,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004987553197172722,
|
|
"loss": 6.4152,
|
|
"mean_token_accuracy": 0.16095769703388213,
|
|
"num_tokens": 9789689.0,
|
|
"step": 3870
|
|
},
|
|
{
|
|
"entropy": 6.617307853698731,
|
|
"epoch": 0.447201384881708,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004987509815819732,
|
|
"loss": 6.5181,
|
|
"mean_token_accuracy": 0.15431652069091797,
|
|
"num_tokens": 9801124.0,
|
|
"step": 3875
|
|
},
|
|
{
|
|
"entropy": 6.545049571990967,
|
|
"epoch": 0.44777841892671666,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004987466359209213,
|
|
"loss": 6.4654,
|
|
"mean_token_accuracy": 0.1531405434012413,
|
|
"num_tokens": 9814264.0,
|
|
"step": 3880
|
|
},
|
|
{
|
|
"entropy": 6.532504224777222,
|
|
"epoch": 0.44835545297172535,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004987422827342622,
|
|
"loss": 6.3939,
|
|
"mean_token_accuracy": 0.16244966238737107,
|
|
"num_tokens": 9826149.0,
|
|
"step": 3885
|
|
},
|
|
{
|
|
"entropy": 6.605834484100342,
|
|
"epoch": 0.448932487016734,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004987379220221426,
|
|
"loss": 6.4765,
|
|
"mean_token_accuracy": 0.15153736919164656,
|
|
"num_tokens": 9838485.0,
|
|
"step": 3890
|
|
},
|
|
{
|
|
"entropy": 6.5250184535980225,
|
|
"epoch": 0.44950952106174263,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004987335537847092,
|
|
"loss": 6.4029,
|
|
"mean_token_accuracy": 0.1562870755791664,
|
|
"num_tokens": 9851371.0,
|
|
"step": 3895
|
|
},
|
|
{
|
|
"entropy": 6.563957357406617,
|
|
"epoch": 0.4500865551067513,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004987291780221088,
|
|
"loss": 6.4599,
|
|
"mean_token_accuracy": 0.15669308006763458,
|
|
"num_tokens": 9864371.0,
|
|
"step": 3900
|
|
},
|
|
{
|
|
"entropy": 6.585865068435669,
|
|
"epoch": 0.45066358915175997,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004987247947344887,
|
|
"loss": 6.4487,
|
|
"mean_token_accuracy": 0.15703559517860413,
|
|
"num_tokens": 9876086.0,
|
|
"step": 3905
|
|
},
|
|
{
|
|
"entropy": 6.544737100601196,
|
|
"epoch": 0.4512406231967686,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004987204039219962,
|
|
"loss": 6.4455,
|
|
"mean_token_accuracy": 0.15367899984121322,
|
|
"num_tokens": 9888850.0,
|
|
"step": 3910
|
|
},
|
|
{
|
|
"entropy": 6.561423492431641,
|
|
"epoch": 0.45181765724177725,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004987160055847791,
|
|
"loss": 6.4777,
|
|
"mean_token_accuracy": 0.15599952191114425,
|
|
"num_tokens": 9901467.0,
|
|
"step": 3915
|
|
},
|
|
{
|
|
"entropy": 6.574502992630005,
|
|
"epoch": 0.45239469128678594,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004987115997229852,
|
|
"loss": 6.4479,
|
|
"mean_token_accuracy": 0.15445881485939025,
|
|
"num_tokens": 9914431.0,
|
|
"step": 3920
|
|
},
|
|
{
|
|
"entropy": 6.613849687576294,
|
|
"epoch": 0.4529717253317946,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004987071863367629,
|
|
"loss": 6.4776,
|
|
"mean_token_accuracy": 0.15640159994363784,
|
|
"num_tokens": 9926863.0,
|
|
"step": 3925
|
|
},
|
|
{
|
|
"entropy": 6.555788230895996,
|
|
"epoch": 0.4535487593768032,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004987027654262604,
|
|
"loss": 6.4231,
|
|
"mean_token_accuracy": 0.1610432580113411,
|
|
"num_tokens": 9939064.0,
|
|
"step": 3930
|
|
},
|
|
{
|
|
"entropy": 6.492784738540649,
|
|
"epoch": 0.45412579342181186,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004986983369916264,
|
|
"loss": 6.4221,
|
|
"mean_token_accuracy": 0.15522423386573792,
|
|
"num_tokens": 9950897.0,
|
|
"step": 3935
|
|
},
|
|
{
|
|
"entropy": 6.640955543518066,
|
|
"epoch": 0.45470282746682056,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004986939010330102,
|
|
"loss": 6.4711,
|
|
"mean_token_accuracy": 0.15500133484601974,
|
|
"num_tokens": 9964388.0,
|
|
"step": 3940
|
|
},
|
|
{
|
|
"entropy": 6.412693643569947,
|
|
"epoch": 0.4552798615118292,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004986894575505606,
|
|
"loss": 6.2872,
|
|
"mean_token_accuracy": 0.1698276601731777,
|
|
"num_tokens": 9977363.0,
|
|
"step": 3945
|
|
},
|
|
{
|
|
"entropy": 6.545732498168945,
|
|
"epoch": 0.45585689555683784,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004986850065444272,
|
|
"loss": 6.3485,
|
|
"mean_token_accuracy": 0.16417437195777893,
|
|
"num_tokens": 9989691.0,
|
|
"step": 3950
|
|
},
|
|
{
|
|
"entropy": 6.592774343490601,
|
|
"epoch": 0.45643392960184653,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004986805480147598,
|
|
"loss": 6.4064,
|
|
"mean_token_accuracy": 0.15252988934516906,
|
|
"num_tokens": 10002177.0,
|
|
"step": 3955
|
|
},
|
|
{
|
|
"entropy": 6.508685827255249,
|
|
"epoch": 0.4570109636468552,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004986760819617082,
|
|
"loss": 6.4662,
|
|
"mean_token_accuracy": 0.15122403651475907,
|
|
"num_tokens": 10014844.0,
|
|
"step": 3960
|
|
},
|
|
{
|
|
"entropy": 6.652512836456299,
|
|
"epoch": 0.4575879976918638,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004986716083854228,
|
|
"loss": 6.4914,
|
|
"mean_token_accuracy": 0.1520856276154518,
|
|
"num_tokens": 10028351.0,
|
|
"step": 3965
|
|
},
|
|
{
|
|
"entropy": 6.521466636657715,
|
|
"epoch": 0.45816503173687245,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004986671272860538,
|
|
"loss": 6.3913,
|
|
"mean_token_accuracy": 0.15310998558998107,
|
|
"num_tokens": 10041318.0,
|
|
"step": 3970
|
|
},
|
|
{
|
|
"entropy": 6.557436227798462,
|
|
"epoch": 0.45874206578188115,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004986626386637521,
|
|
"loss": 6.4107,
|
|
"mean_token_accuracy": 0.1517535850405693,
|
|
"num_tokens": 10054985.0,
|
|
"step": 3975
|
|
},
|
|
{
|
|
"entropy": 6.552952146530151,
|
|
"epoch": 0.4593190998268898,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004986581425186688,
|
|
"loss": 6.4803,
|
|
"mean_token_accuracy": 0.1568808764219284,
|
|
"num_tokens": 10067528.0,
|
|
"step": 3980
|
|
},
|
|
{
|
|
"entropy": 6.526756238937378,
|
|
"epoch": 0.4598961338718984,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0004986536388509548,
|
|
"loss": 6.3925,
|
|
"mean_token_accuracy": 0.15640367493033408,
|
|
"num_tokens": 10080210.0,
|
|
"step": 3985
|
|
},
|
|
{
|
|
"entropy": 6.520599222183227,
|
|
"epoch": 0.4604731679169071,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004986491276607618,
|
|
"loss": 6.4428,
|
|
"mean_token_accuracy": 0.15482764691114426,
|
|
"num_tokens": 10092040.0,
|
|
"step": 3990
|
|
},
|
|
{
|
|
"entropy": 6.584397268295288,
|
|
"epoch": 0.46105020196191576,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004986446089482416,
|
|
"loss": 6.399,
|
|
"mean_token_accuracy": 0.1545254573225975,
|
|
"num_tokens": 10104923.0,
|
|
"step": 3995
|
|
},
|
|
{
|
|
"entropy": 6.528775930404663,
|
|
"epoch": 0.4616272360069244,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004986400827135459,
|
|
"loss": 6.3908,
|
|
"mean_token_accuracy": 0.15947159230709076,
|
|
"num_tokens": 10118963.0,
|
|
"step": 4000
|
|
},
|
|
{
|
|
"entropy": 6.557057237625122,
|
|
"epoch": 0.46220427005193304,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004986355489568272,
|
|
"loss": 6.3496,
|
|
"mean_token_accuracy": 0.16494845151901244,
|
|
"num_tokens": 10131457.0,
|
|
"step": 4005
|
|
},
|
|
{
|
|
"entropy": 6.524343824386596,
|
|
"epoch": 0.46278130409694174,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004986310076782379,
|
|
"loss": 6.4309,
|
|
"mean_token_accuracy": 0.15816483348608018,
|
|
"num_tokens": 10143796.0,
|
|
"step": 4010
|
|
},
|
|
{
|
|
"entropy": 6.474204587936401,
|
|
"epoch": 0.4633583381419504,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004986264588779307,
|
|
"loss": 6.4078,
|
|
"mean_token_accuracy": 0.161160147190094,
|
|
"num_tokens": 10156723.0,
|
|
"step": 4015
|
|
},
|
|
{
|
|
"entropy": 6.524495840072632,
|
|
"epoch": 0.463935372186959,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004986219025560586,
|
|
"loss": 6.4278,
|
|
"mean_token_accuracy": 0.15114813968539237,
|
|
"num_tokens": 10168701.0,
|
|
"step": 4020
|
|
},
|
|
{
|
|
"entropy": 6.57913761138916,
|
|
"epoch": 0.4645124062319677,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.000498617338712775,
|
|
"loss": 6.3816,
|
|
"mean_token_accuracy": 0.16238873600959777,
|
|
"num_tokens": 10182308.0,
|
|
"step": 4025
|
|
},
|
|
{
|
|
"entropy": 6.52322735786438,
|
|
"epoch": 0.46508944027697635,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004986127673482332,
|
|
"loss": 6.371,
|
|
"mean_token_accuracy": 0.16324072778224946,
|
|
"num_tokens": 10194237.0,
|
|
"step": 4030
|
|
},
|
|
{
|
|
"entropy": 6.512039661407471,
|
|
"epoch": 0.465666474321985,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004986081884625871,
|
|
"loss": 6.4611,
|
|
"mean_token_accuracy": 0.15732699781656265,
|
|
"num_tokens": 10208570.0,
|
|
"step": 4035
|
|
},
|
|
{
|
|
"entropy": 6.647953844070434,
|
|
"epoch": 0.46624350836699363,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004986036020559906,
|
|
"loss": 6.4109,
|
|
"mean_token_accuracy": 0.15890434235334397,
|
|
"num_tokens": 10221079.0,
|
|
"step": 4040
|
|
},
|
|
{
|
|
"entropy": 6.42305359840393,
|
|
"epoch": 0.4668205424120023,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.000498599008128598,
|
|
"loss": 6.3319,
|
|
"mean_token_accuracy": 0.1590804174542427,
|
|
"num_tokens": 10233473.0,
|
|
"step": 4045
|
|
},
|
|
{
|
|
"entropy": 6.588786363601685,
|
|
"epoch": 0.46739757645701097,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0004985944066805639,
|
|
"loss": 6.4683,
|
|
"mean_token_accuracy": 0.1552932158112526,
|
|
"num_tokens": 10247840.0,
|
|
"step": 4050
|
|
},
|
|
{
|
|
"entropy": 6.566417503356933,
|
|
"epoch": 0.4679746105020196,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.000498589797712043,
|
|
"loss": 6.3949,
|
|
"mean_token_accuracy": 0.16800516694784165,
|
|
"num_tokens": 10261471.0,
|
|
"step": 4055
|
|
},
|
|
{
|
|
"entropy": 6.484035158157349,
|
|
"epoch": 0.4685516445470283,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004985851812231903,
|
|
"loss": 6.3991,
|
|
"mean_token_accuracy": 0.1583906292915344,
|
|
"num_tokens": 10274386.0,
|
|
"step": 4060
|
|
},
|
|
{
|
|
"entropy": 6.553869724273682,
|
|
"epoch": 0.46912867859203694,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004985805572141611,
|
|
"loss": 6.4131,
|
|
"mean_token_accuracy": 0.15777539014816283,
|
|
"num_tokens": 10286405.0,
|
|
"step": 4065
|
|
},
|
|
{
|
|
"entropy": 6.558121299743652,
|
|
"epoch": 0.4697057126370456,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004985759256851108,
|
|
"loss": 6.4603,
|
|
"mean_token_accuracy": 0.15484957844018937,
|
|
"num_tokens": 10300084.0,
|
|
"step": 4070
|
|
},
|
|
{
|
|
"entropy": 6.565396356582641,
|
|
"epoch": 0.4702827466820542,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004985712866361954,
|
|
"loss": 6.4674,
|
|
"mean_token_accuracy": 0.16278457939624785,
|
|
"num_tokens": 10312558.0,
|
|
"step": 4075
|
|
},
|
|
{
|
|
"entropy": 6.541759634017945,
|
|
"epoch": 0.4708597807270629,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004985666400675709,
|
|
"loss": 6.3687,
|
|
"mean_token_accuracy": 0.16311410516500474,
|
|
"num_tokens": 10324185.0,
|
|
"step": 4080
|
|
},
|
|
{
|
|
"entropy": 6.4401655197143555,
|
|
"epoch": 0.47143681477207156,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0004985619859793934,
|
|
"loss": 6.4018,
|
|
"mean_token_accuracy": 0.15202204287052154,
|
|
"num_tokens": 10338634.0,
|
|
"step": 4085
|
|
},
|
|
{
|
|
"entropy": 6.673071384429932,
|
|
"epoch": 0.4720138488170802,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004985573243718195,
|
|
"loss": 6.4702,
|
|
"mean_token_accuracy": 0.1487300381064415,
|
|
"num_tokens": 10351272.0,
|
|
"step": 4090
|
|
},
|
|
{
|
|
"entropy": 6.562505865097046,
|
|
"epoch": 0.4725908828620889,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004985526552450061,
|
|
"loss": 6.4052,
|
|
"mean_token_accuracy": 0.15442484468221665,
|
|
"num_tokens": 10362894.0,
|
|
"step": 4095
|
|
},
|
|
{
|
|
"entropy": 6.557220220565796,
|
|
"epoch": 0.47316791690709753,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004985479785991103,
|
|
"loss": 6.5136,
|
|
"mean_token_accuracy": 0.15173576027154922,
|
|
"num_tokens": 10376120.0,
|
|
"step": 4100
|
|
},
|
|
{
|
|
"entropy": 6.551002073287964,
|
|
"epoch": 0.47374495095210617,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004985432944342892,
|
|
"loss": 6.4281,
|
|
"mean_token_accuracy": 0.15780509859323502,
|
|
"num_tokens": 10387986.0,
|
|
"step": 4105
|
|
},
|
|
{
|
|
"entropy": 6.5132355213165285,
|
|
"epoch": 0.4743219849971148,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004985386027507003,
|
|
"loss": 6.4441,
|
|
"mean_token_accuracy": 0.1574099436402321,
|
|
"num_tokens": 10400920.0,
|
|
"step": 4110
|
|
},
|
|
{
|
|
"entropy": 6.636253833770752,
|
|
"epoch": 0.4748990190421235,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004985339035485018,
|
|
"loss": 6.4511,
|
|
"mean_token_accuracy": 0.1540090411901474,
|
|
"num_tokens": 10413835.0,
|
|
"step": 4115
|
|
},
|
|
{
|
|
"entropy": 6.511466121673584,
|
|
"epoch": 0.47547605308713214,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 0.0004985291968278513,
|
|
"loss": 6.4537,
|
|
"mean_token_accuracy": 0.15455947071313858,
|
|
"num_tokens": 10426959.0,
|
|
"step": 4120
|
|
},
|
|
{
|
|
"entropy": 6.5830864906311035,
|
|
"epoch": 0.4760530871321408,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004985244825889074,
|
|
"loss": 6.4912,
|
|
"mean_token_accuracy": 0.15826078802347182,
|
|
"num_tokens": 10440319.0,
|
|
"step": 4125
|
|
},
|
|
{
|
|
"entropy": 6.533916664123535,
|
|
"epoch": 0.4766301211771495,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004985197608318284,
|
|
"loss": 6.4479,
|
|
"mean_token_accuracy": 0.15521639585494995,
|
|
"num_tokens": 10453715.0,
|
|
"step": 4130
|
|
},
|
|
{
|
|
"entropy": 6.575965356826782,
|
|
"epoch": 0.4772071552221581,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004985150315567735,
|
|
"loss": 6.4414,
|
|
"mean_token_accuracy": 0.15350656658411027,
|
|
"num_tokens": 10465574.0,
|
|
"step": 4135
|
|
},
|
|
{
|
|
"entropy": 6.519655561447143,
|
|
"epoch": 0.47778418926716676,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004985102947639013,
|
|
"loss": 6.4083,
|
|
"mean_token_accuracy": 0.15839099436998366,
|
|
"num_tokens": 10478105.0,
|
|
"step": 4140
|
|
},
|
|
{
|
|
"entropy": 6.4816258430480955,
|
|
"epoch": 0.4783612233121754,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004985055504533715,
|
|
"loss": 6.4284,
|
|
"mean_token_accuracy": 0.15900716781616211,
|
|
"num_tokens": 10490723.0,
|
|
"step": 4145
|
|
},
|
|
{
|
|
"entropy": 6.624292707443237,
|
|
"epoch": 0.4789382573571841,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004985007986253435,
|
|
"loss": 6.452,
|
|
"mean_token_accuracy": 0.15452224612236024,
|
|
"num_tokens": 10503155.0,
|
|
"step": 4150
|
|
},
|
|
{
|
|
"entropy": 6.526167535781861,
|
|
"epoch": 0.47951529140219273,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004984960392799772,
|
|
"loss": 6.4215,
|
|
"mean_token_accuracy": 0.14876818060874938,
|
|
"num_tokens": 10515077.0,
|
|
"step": 4155
|
|
},
|
|
{
|
|
"entropy": 6.6001299858093265,
|
|
"epoch": 0.4800923254472014,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004984912724174326,
|
|
"loss": 6.3883,
|
|
"mean_token_accuracy": 0.15346773862838745,
|
|
"num_tokens": 10528445.0,
|
|
"step": 4160
|
|
},
|
|
{
|
|
"entropy": 6.559596395492553,
|
|
"epoch": 0.48066935949221,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004984864980378701,
|
|
"loss": 6.4379,
|
|
"mean_token_accuracy": 0.15837605893611909,
|
|
"num_tokens": 10541877.0,
|
|
"step": 4165
|
|
},
|
|
{
|
|
"entropy": 6.54767746925354,
|
|
"epoch": 0.4812463935372187,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004984817161414502,
|
|
"loss": 6.4044,
|
|
"mean_token_accuracy": 0.15747998505830765,
|
|
"num_tokens": 10553527.0,
|
|
"step": 4170
|
|
},
|
|
{
|
|
"entropy": 6.479561614990234,
|
|
"epoch": 0.48182342758222735,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004984769267283338,
|
|
"loss": 6.4136,
|
|
"mean_token_accuracy": 0.15314011722803117,
|
|
"num_tokens": 10566492.0,
|
|
"step": 4175
|
|
},
|
|
{
|
|
"entropy": 6.467929792404175,
|
|
"epoch": 0.482400461627236,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004984721297986819,
|
|
"loss": 6.3739,
|
|
"mean_token_accuracy": 0.15953933745622634,
|
|
"num_tokens": 10578962.0,
|
|
"step": 4180
|
|
},
|
|
{
|
|
"entropy": 6.5416004180908205,
|
|
"epoch": 0.4829774956722447,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004984673253526561,
|
|
"loss": 6.3665,
|
|
"mean_token_accuracy": 0.15812182426452637,
|
|
"num_tokens": 10591254.0,
|
|
"step": 4185
|
|
},
|
|
{
|
|
"entropy": 6.557770919799805,
|
|
"epoch": 0.4835545297172533,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004984625133904176,
|
|
"loss": 6.4061,
|
|
"mean_token_accuracy": 0.1579806312918663,
|
|
"num_tokens": 10604961.0,
|
|
"step": 4190
|
|
},
|
|
{
|
|
"entropy": 6.499729299545288,
|
|
"epoch": 0.48413156376226196,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004984576939121286,
|
|
"loss": 6.3885,
|
|
"mean_token_accuracy": 0.16066249012947081,
|
|
"num_tokens": 10617419.0,
|
|
"step": 4195
|
|
},
|
|
{
|
|
"entropy": 6.50909194946289,
|
|
"epoch": 0.4847085978072706,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004984528669179511,
|
|
"loss": 6.4186,
|
|
"mean_token_accuracy": 0.15439673513174057,
|
|
"num_tokens": 10629721.0,
|
|
"step": 4200
|
|
},
|
|
{
|
|
"entropy": 6.625107002258301,
|
|
"epoch": 0.4852856318522793,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004984480324080472,
|
|
"loss": 6.4535,
|
|
"mean_token_accuracy": 0.15551864504814147,
|
|
"num_tokens": 10643869.0,
|
|
"step": 4205
|
|
},
|
|
{
|
|
"entropy": 6.590443325042725,
|
|
"epoch": 0.48586266589728794,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.00049844319038258,
|
|
"loss": 6.5082,
|
|
"mean_token_accuracy": 0.14841593205928802,
|
|
"num_tokens": 10658418.0,
|
|
"step": 4210
|
|
},
|
|
{
|
|
"entropy": 6.542080116271973,
|
|
"epoch": 0.4864396999422966,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004984383408417119,
|
|
"loss": 6.3939,
|
|
"mean_token_accuracy": 0.16221137195825577,
|
|
"num_tokens": 10671105.0,
|
|
"step": 4215
|
|
},
|
|
{
|
|
"entropy": 6.542936706542969,
|
|
"epoch": 0.4870167339873053,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004984334837856064,
|
|
"loss": 6.4929,
|
|
"mean_token_accuracy": 0.15168781727552413,
|
|
"num_tokens": 10683862.0,
|
|
"step": 4220
|
|
},
|
|
{
|
|
"entropy": 6.539501905441284,
|
|
"epoch": 0.4875937680323139,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004984286192144263,
|
|
"loss": 6.3919,
|
|
"mean_token_accuracy": 0.1602101057767868,
|
|
"num_tokens": 10696559.0,
|
|
"step": 4225
|
|
},
|
|
{
|
|
"entropy": 6.5565080642700195,
|
|
"epoch": 0.48817080207732255,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004984237471283359,
|
|
"loss": 6.4623,
|
|
"mean_token_accuracy": 0.157669498026371,
|
|
"num_tokens": 10710227.0,
|
|
"step": 4230
|
|
},
|
|
{
|
|
"entropy": 6.489563083648681,
|
|
"epoch": 0.4887478361223312,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004984188675274986,
|
|
"loss": 6.4311,
|
|
"mean_token_accuracy": 0.15578922182321547,
|
|
"num_tokens": 10722761.0,
|
|
"step": 4235
|
|
},
|
|
{
|
|
"entropy": 6.552829694747925,
|
|
"epoch": 0.4893248701673399,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004984139804120787,
|
|
"loss": 6.3864,
|
|
"mean_token_accuracy": 0.15277379006147385,
|
|
"num_tokens": 10734126.0,
|
|
"step": 4240
|
|
},
|
|
{
|
|
"entropy": 6.524606513977051,
|
|
"epoch": 0.4899019042123485,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004984090857822406,
|
|
"loss": 6.4398,
|
|
"mean_token_accuracy": 0.15711746215820313,
|
|
"num_tokens": 10747570.0,
|
|
"step": 4245
|
|
},
|
|
{
|
|
"entropy": 6.61868577003479,
|
|
"epoch": 0.49047893825735717,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 0.0004984041836381488,
|
|
"loss": 6.5498,
|
|
"mean_token_accuracy": 0.14832186549901963,
|
|
"num_tokens": 10762975.0,
|
|
"step": 4250
|
|
},
|
|
{
|
|
"entropy": 6.625642156600952,
|
|
"epoch": 0.49105597230236586,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004983992739799682,
|
|
"loss": 6.3846,
|
|
"mean_token_accuracy": 0.1586022138595581,
|
|
"num_tokens": 10774520.0,
|
|
"step": 4255
|
|
},
|
|
{
|
|
"entropy": 6.455063724517823,
|
|
"epoch": 0.4916330063473745,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004983943568078642,
|
|
"loss": 6.3108,
|
|
"mean_token_accuracy": 0.16183219701051713,
|
|
"num_tokens": 10786250.0,
|
|
"step": 4260
|
|
},
|
|
{
|
|
"entropy": 6.565676832199097,
|
|
"epoch": 0.49221004039238314,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004983894321220017,
|
|
"loss": 6.4387,
|
|
"mean_token_accuracy": 0.15883514136075974,
|
|
"num_tokens": 10799831.0,
|
|
"step": 4265
|
|
},
|
|
{
|
|
"entropy": 6.5317785263061525,
|
|
"epoch": 0.4927870744373918,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004983844999225468,
|
|
"loss": 6.3715,
|
|
"mean_token_accuracy": 0.16067612767219544,
|
|
"num_tokens": 10812803.0,
|
|
"step": 4270
|
|
},
|
|
{
|
|
"entropy": 6.497241115570068,
|
|
"epoch": 0.4933641084824005,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004983795602096651,
|
|
"loss": 6.3904,
|
|
"mean_token_accuracy": 0.1601540118455887,
|
|
"num_tokens": 10825150.0,
|
|
"step": 4275
|
|
},
|
|
{
|
|
"entropy": 6.598751640319824,
|
|
"epoch": 0.4939411425274091,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.000498374612983523,
|
|
"loss": 6.506,
|
|
"mean_token_accuracy": 0.15289822071790696,
|
|
"num_tokens": 10838337.0,
|
|
"step": 4280
|
|
},
|
|
{
|
|
"entropy": 6.5518717765808105,
|
|
"epoch": 0.49451817657241776,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004983696582442866,
|
|
"loss": 6.334,
|
|
"mean_token_accuracy": 0.17550577819347382,
|
|
"num_tokens": 10852288.0,
|
|
"step": 4285
|
|
},
|
|
{
|
|
"entropy": 6.514918279647827,
|
|
"epoch": 0.49509521061742645,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004983646959921227,
|
|
"loss": 6.439,
|
|
"mean_token_accuracy": 0.15471772402524947,
|
|
"num_tokens": 10864189.0,
|
|
"step": 4290
|
|
},
|
|
{
|
|
"entropy": 6.618105697631836,
|
|
"epoch": 0.4956722446624351,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004983597262271984,
|
|
"loss": 6.4346,
|
|
"mean_token_accuracy": 0.1550702318549156,
|
|
"num_tokens": 10877410.0,
|
|
"step": 4295
|
|
},
|
|
{
|
|
"entropy": 6.503079223632812,
|
|
"epoch": 0.49624927870744373,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004983547489496804,
|
|
"loss": 6.4053,
|
|
"mean_token_accuracy": 0.15499556958675384,
|
|
"num_tokens": 10889757.0,
|
|
"step": 4300
|
|
},
|
|
{
|
|
"entropy": 6.490525484085083,
|
|
"epoch": 0.49682631275245237,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004983497641597365,
|
|
"loss": 6.3195,
|
|
"mean_token_accuracy": 0.16428075432777406,
|
|
"num_tokens": 10901636.0,
|
|
"step": 4305
|
|
},
|
|
{
|
|
"entropy": 6.480206155776978,
|
|
"epoch": 0.49740334679746107,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004983447718575342,
|
|
"loss": 6.3544,
|
|
"mean_token_accuracy": 0.1630442336201668,
|
|
"num_tokens": 10914063.0,
|
|
"step": 4310
|
|
},
|
|
{
|
|
"entropy": 6.595718622207642,
|
|
"epoch": 0.4979803808424697,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004983397720432414,
|
|
"loss": 6.3886,
|
|
"mean_token_accuracy": 0.16058591455221177,
|
|
"num_tokens": 10927730.0,
|
|
"step": 4315
|
|
},
|
|
{
|
|
"entropy": 6.534880208969116,
|
|
"epoch": 0.49855741488747835,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004983347647170264,
|
|
"loss": 6.4898,
|
|
"mean_token_accuracy": 0.15413855165243148,
|
|
"num_tokens": 10942440.0,
|
|
"step": 4320
|
|
},
|
|
{
|
|
"entropy": 6.512958288192749,
|
|
"epoch": 0.49913444893248704,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004983297498790574,
|
|
"loss": 6.3992,
|
|
"mean_token_accuracy": 0.156264328956604,
|
|
"num_tokens": 10955801.0,
|
|
"step": 4325
|
|
},
|
|
{
|
|
"entropy": 6.5469934940338135,
|
|
"epoch": 0.4997114829774957,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004983247275295034,
|
|
"loss": 6.3887,
|
|
"mean_token_accuracy": 0.1580841600894928,
|
|
"num_tokens": 10967918.0,
|
|
"step": 4330
|
|
},
|
|
{
|
|
"entropy": 6.508872032165527,
|
|
"epoch": 0.5002885170225043,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004983196976685329,
|
|
"loss": 6.3267,
|
|
"mean_token_accuracy": 0.16289351582527162,
|
|
"num_tokens": 10979652.0,
|
|
"step": 4335
|
|
},
|
|
{
|
|
"entropy": 6.387019300460816,
|
|
"epoch": 0.500865551067513,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004983146602963155,
|
|
"loss": 6.2607,
|
|
"mean_token_accuracy": 0.17579997777938844,
|
|
"num_tokens": 10991433.0,
|
|
"step": 4340
|
|
},
|
|
{
|
|
"entropy": 6.460304498672485,
|
|
"epoch": 0.5014425851125216,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004983096154130203,
|
|
"loss": 6.4603,
|
|
"mean_token_accuracy": 0.15860795527696608,
|
|
"num_tokens": 11003976.0,
|
|
"step": 4345
|
|
},
|
|
{
|
|
"entropy": 6.599706220626831,
|
|
"epoch": 0.5020196191575302,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004983045630188171,
|
|
"loss": 6.4366,
|
|
"mean_token_accuracy": 0.15410916805267333,
|
|
"num_tokens": 11018848.0,
|
|
"step": 4350
|
|
},
|
|
{
|
|
"entropy": 6.57402777671814,
|
|
"epoch": 0.502596653202539,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004982995031138759,
|
|
"loss": 6.4038,
|
|
"mean_token_accuracy": 0.15641804337501525,
|
|
"num_tokens": 11030803.0,
|
|
"step": 4355
|
|
},
|
|
{
|
|
"entropy": 6.586047887802124,
|
|
"epoch": 0.5031736872475476,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004982944356983666,
|
|
"loss": 6.4921,
|
|
"mean_token_accuracy": 0.15291229784488677,
|
|
"num_tokens": 11044688.0,
|
|
"step": 4360
|
|
},
|
|
{
|
|
"entropy": 6.524409008026123,
|
|
"epoch": 0.5037507212925563,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004982893607724602,
|
|
"loss": 6.4306,
|
|
"mean_token_accuracy": 0.15263819694519043,
|
|
"num_tokens": 11057026.0,
|
|
"step": 4365
|
|
},
|
|
{
|
|
"entropy": 6.639001178741455,
|
|
"epoch": 0.5043277553375649,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.000498284278336327,
|
|
"loss": 6.4538,
|
|
"mean_token_accuracy": 0.15304491817951202,
|
|
"num_tokens": 11070407.0,
|
|
"step": 4370
|
|
},
|
|
{
|
|
"entropy": 6.5000138759613035,
|
|
"epoch": 0.5049047893825735,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004982791883901379,
|
|
"loss": 6.3616,
|
|
"mean_token_accuracy": 0.16394442021846772,
|
|
"num_tokens": 11082655.0,
|
|
"step": 4375
|
|
},
|
|
{
|
|
"entropy": 6.462573575973511,
|
|
"epoch": 0.5054818234275822,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004982740909340643,
|
|
"loss": 6.3301,
|
|
"mean_token_accuracy": 0.16755695044994354,
|
|
"num_tokens": 11095948.0,
|
|
"step": 4380
|
|
},
|
|
{
|
|
"entropy": 6.589680433273315,
|
|
"epoch": 0.5060588574725908,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004982689859682775,
|
|
"loss": 6.382,
|
|
"mean_token_accuracy": 0.15594714432954787,
|
|
"num_tokens": 11108105.0,
|
|
"step": 4385
|
|
},
|
|
{
|
|
"entropy": 6.5538736343383786,
|
|
"epoch": 0.5066358915175996,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004982638734929492,
|
|
"loss": 6.4291,
|
|
"mean_token_accuracy": 0.15332048535346984,
|
|
"num_tokens": 11120322.0,
|
|
"step": 4390
|
|
},
|
|
{
|
|
"entropy": 6.386771297454834,
|
|
"epoch": 0.5072129255626082,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0004982587535082515,
|
|
"loss": 6.2161,
|
|
"mean_token_accuracy": 0.16631432473659516,
|
|
"num_tokens": 11133903.0,
|
|
"step": 4395
|
|
},
|
|
{
|
|
"entropy": 6.46461238861084,
|
|
"epoch": 0.5077899596076169,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004982536260143565,
|
|
"loss": 6.2861,
|
|
"mean_token_accuracy": 0.16543451994657515,
|
|
"num_tokens": 11145607.0,
|
|
"step": 4400
|
|
},
|
|
{
|
|
"entropy": 6.536594581604004,
|
|
"epoch": 0.5083669936526255,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004982484910114367,
|
|
"loss": 6.391,
|
|
"mean_token_accuracy": 0.15751007944345474,
|
|
"num_tokens": 11157332.0,
|
|
"step": 4405
|
|
},
|
|
{
|
|
"entropy": 6.527062559127808,
|
|
"epoch": 0.5089440276976341,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004982433484996648,
|
|
"loss": 6.4747,
|
|
"mean_token_accuracy": 0.1585505411028862,
|
|
"num_tokens": 11169404.0,
|
|
"step": 4410
|
|
},
|
|
{
|
|
"entropy": 6.553807020187378,
|
|
"epoch": 0.5095210617426428,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004982381984792138,
|
|
"loss": 6.3707,
|
|
"mean_token_accuracy": 0.15870761573314668,
|
|
"num_tokens": 11182506.0,
|
|
"step": 4415
|
|
},
|
|
{
|
|
"entropy": 6.516544485092163,
|
|
"epoch": 0.5100980957876514,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004982330409502568,
|
|
"loss": 6.3395,
|
|
"mean_token_accuracy": 0.1521760679781437,
|
|
"num_tokens": 11195507.0,
|
|
"step": 4420
|
|
},
|
|
{
|
|
"entropy": 6.505952548980713,
|
|
"epoch": 0.5106751298326602,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004982278759129674,
|
|
"loss": 6.3472,
|
|
"mean_token_accuracy": 0.16159432679414748,
|
|
"num_tokens": 11207219.0,
|
|
"step": 4425
|
|
},
|
|
{
|
|
"entropy": 6.456001710891724,
|
|
"epoch": 0.5112521638776688,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004982227033675194,
|
|
"loss": 6.3242,
|
|
"mean_token_accuracy": 0.16376312375068663,
|
|
"num_tokens": 11219301.0,
|
|
"step": 4430
|
|
},
|
|
{
|
|
"entropy": 6.460791826248169,
|
|
"epoch": 0.5118291979226774,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004982175233140865,
|
|
"loss": 6.3282,
|
|
"mean_token_accuracy": 0.16003126353025438,
|
|
"num_tokens": 11230957.0,
|
|
"step": 4435
|
|
},
|
|
{
|
|
"entropy": 6.537653398513794,
|
|
"epoch": 0.5124062319676861,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004982123357528431,
|
|
"loss": 6.3529,
|
|
"mean_token_accuracy": 0.15861166417598724,
|
|
"num_tokens": 11242813.0,
|
|
"step": 4440
|
|
},
|
|
{
|
|
"entropy": 6.4945403099060055,
|
|
"epoch": 0.5129832660126947,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004982071406839636,
|
|
"loss": 6.3613,
|
|
"mean_token_accuracy": 0.1551041141152382,
|
|
"num_tokens": 11255193.0,
|
|
"step": 4445
|
|
},
|
|
{
|
|
"entropy": 6.403803586959839,
|
|
"epoch": 0.5135603000577034,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004982019381076229,
|
|
"loss": 6.336,
|
|
"mean_token_accuracy": 0.16265275329351425,
|
|
"num_tokens": 11267988.0,
|
|
"step": 4450
|
|
},
|
|
{
|
|
"entropy": 6.558556795120239,
|
|
"epoch": 0.514137334102712,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004981967280239958,
|
|
"loss": 6.4116,
|
|
"mean_token_accuracy": 0.15306541174650193,
|
|
"num_tokens": 11280456.0,
|
|
"step": 4455
|
|
},
|
|
{
|
|
"entropy": 6.527243995666504,
|
|
"epoch": 0.5147143681477208,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004981915104332578,
|
|
"loss": 6.4394,
|
|
"mean_token_accuracy": 0.15262870788574218,
|
|
"num_tokens": 11293304.0,
|
|
"step": 4460
|
|
},
|
|
{
|
|
"entropy": 6.479492855072022,
|
|
"epoch": 0.5152914021927294,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.000498186285335584,
|
|
"loss": 6.3962,
|
|
"mean_token_accuracy": 0.15405147820711135,
|
|
"num_tokens": 11305936.0,
|
|
"step": 4465
|
|
},
|
|
{
|
|
"entropy": 6.617494297027588,
|
|
"epoch": 0.515868436237738,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004981810527311505,
|
|
"loss": 6.4403,
|
|
"mean_token_accuracy": 0.1522215947508812,
|
|
"num_tokens": 11319991.0,
|
|
"step": 4470
|
|
},
|
|
{
|
|
"entropy": 6.508704996109008,
|
|
"epoch": 0.5164454702827467,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.000498175812620133,
|
|
"loss": 6.3465,
|
|
"mean_token_accuracy": 0.16412411332130433,
|
|
"num_tokens": 11332572.0,
|
|
"step": 4475
|
|
},
|
|
{
|
|
"entropy": 6.460049343109131,
|
|
"epoch": 0.5170225043277553,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004981705650027081,
|
|
"loss": 6.3431,
|
|
"mean_token_accuracy": 0.16454764157533647,
|
|
"num_tokens": 11344435.0,
|
|
"step": 4480
|
|
},
|
|
{
|
|
"entropy": 6.47212586402893,
|
|
"epoch": 0.517599538372764,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000498165309879052,
|
|
"loss": 6.273,
|
|
"mean_token_accuracy": 0.16744499206542968,
|
|
"num_tokens": 11356078.0,
|
|
"step": 4485
|
|
},
|
|
{
|
|
"entropy": 6.43641505241394,
|
|
"epoch": 0.5181765724177726,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004981600472493415,
|
|
"loss": 6.3231,
|
|
"mean_token_accuracy": 0.16197210550308228,
|
|
"num_tokens": 11368933.0,
|
|
"step": 4490
|
|
},
|
|
{
|
|
"entropy": 6.587095832824707,
|
|
"epoch": 0.5187536064627813,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004981547771137537,
|
|
"loss": 6.4412,
|
|
"mean_token_accuracy": 0.15295076966285706,
|
|
"num_tokens": 11380810.0,
|
|
"step": 4495
|
|
},
|
|
{
|
|
"entropy": 6.448738145828247,
|
|
"epoch": 0.51933064050779,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004981494994724658,
|
|
"loss": 6.3362,
|
|
"mean_token_accuracy": 0.16053746342658998,
|
|
"num_tokens": 11392447.0,
|
|
"step": 4500
|
|
},
|
|
{
|
|
"entropy": 6.471343231201172,
|
|
"epoch": 0.5199076745527986,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004981442143256554,
|
|
"loss": 6.3946,
|
|
"mean_token_accuracy": 0.1577278733253479,
|
|
"num_tokens": 11405237.0,
|
|
"step": 4505
|
|
},
|
|
{
|
|
"entropy": 6.582560443878174,
|
|
"epoch": 0.5204847085978073,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004981389216735001,
|
|
"loss": 6.5039,
|
|
"mean_token_accuracy": 0.14747137874364852,
|
|
"num_tokens": 11418951.0,
|
|
"step": 4510
|
|
},
|
|
{
|
|
"entropy": 6.54022970199585,
|
|
"epoch": 0.5210617426428159,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.000498133621516178,
|
|
"loss": 6.4038,
|
|
"mean_token_accuracy": 0.15998345464468003,
|
|
"num_tokens": 11432587.0,
|
|
"step": 4515
|
|
},
|
|
{
|
|
"entropy": 6.507716655731201,
|
|
"epoch": 0.5216387766878245,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004981283138538675,
|
|
"loss": 6.4289,
|
|
"mean_token_accuracy": 0.15074404031038285,
|
|
"num_tokens": 11445572.0,
|
|
"step": 4520
|
|
},
|
|
{
|
|
"entropy": 6.524649286270142,
|
|
"epoch": 0.5222158107328332,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.000498122998686747,
|
|
"loss": 6.3821,
|
|
"mean_token_accuracy": 0.16107590049505233,
|
|
"num_tokens": 11457469.0,
|
|
"step": 4525
|
|
},
|
|
{
|
|
"entropy": 6.531647729873657,
|
|
"epoch": 0.5227928447778419,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004981176760149951,
|
|
"loss": 6.4269,
|
|
"mean_token_accuracy": 0.1588137172162533,
|
|
"num_tokens": 11470306.0,
|
|
"step": 4530
|
|
},
|
|
{
|
|
"entropy": 6.553733444213867,
|
|
"epoch": 0.5233698788228506,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004981123458387911,
|
|
"loss": 6.4024,
|
|
"mean_token_accuracy": 0.16188153773546218,
|
|
"num_tokens": 11483839.0,
|
|
"step": 4535
|
|
},
|
|
{
|
|
"entropy": 6.549627828598022,
|
|
"epoch": 0.5239469128678592,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004981070081583142,
|
|
"loss": 6.3946,
|
|
"mean_token_accuracy": 0.15353466868400573,
|
|
"num_tokens": 11495703.0,
|
|
"step": 4540
|
|
},
|
|
{
|
|
"entropy": 6.5704262256622314,
|
|
"epoch": 0.5245239469128679,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.000498101662973744,
|
|
"loss": 6.4888,
|
|
"mean_token_accuracy": 0.15426429733633995,
|
|
"num_tokens": 11508061.0,
|
|
"step": 4545
|
|
},
|
|
{
|
|
"entropy": 6.487470436096191,
|
|
"epoch": 0.5251009809578765,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.00049809631028526,
|
|
"loss": 6.3195,
|
|
"mean_token_accuracy": 0.16369524449110032,
|
|
"num_tokens": 11520135.0,
|
|
"step": 4550
|
|
},
|
|
{
|
|
"entropy": 6.492602396011352,
|
|
"epoch": 0.5256780150028851,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004980909500930424,
|
|
"loss": 6.3946,
|
|
"mean_token_accuracy": 0.15684450417757034,
|
|
"num_tokens": 11532255.0,
|
|
"step": 4555
|
|
},
|
|
{
|
|
"entropy": 6.544296550750732,
|
|
"epoch": 0.5262550490478938,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004980855823972717,
|
|
"loss": 6.3394,
|
|
"mean_token_accuracy": 0.1619937911629677,
|
|
"num_tokens": 11544596.0,
|
|
"step": 4560
|
|
},
|
|
{
|
|
"entropy": 6.4948595523834225,
|
|
"epoch": 0.5268320830929025,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.000498080207198128,
|
|
"loss": 6.4627,
|
|
"mean_token_accuracy": 0.1510115385055542,
|
|
"num_tokens": 11556758.0,
|
|
"step": 4565
|
|
},
|
|
{
|
|
"entropy": 6.56593132019043,
|
|
"epoch": 0.5274091171379112,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004980748244957925,
|
|
"loss": 6.4435,
|
|
"mean_token_accuracy": 0.14832553789019584,
|
|
"num_tokens": 11570070.0,
|
|
"step": 4570
|
|
},
|
|
{
|
|
"entropy": 6.518224000930786,
|
|
"epoch": 0.5279861511829198,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004980694342904461,
|
|
"loss": 6.3229,
|
|
"mean_token_accuracy": 0.16714330315589904,
|
|
"num_tokens": 11582566.0,
|
|
"step": 4575
|
|
},
|
|
{
|
|
"entropy": 6.45475206375122,
|
|
"epoch": 0.5285631852279284,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004980640365822701,
|
|
"loss": 6.2754,
|
|
"mean_token_accuracy": 0.16809093654155732,
|
|
"num_tokens": 11595238.0,
|
|
"step": 4580
|
|
},
|
|
{
|
|
"entropy": 6.546554517745972,
|
|
"epoch": 0.5291402192729371,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.000498058631371446,
|
|
"loss": 6.4037,
|
|
"mean_token_accuracy": 0.1609138697385788,
|
|
"num_tokens": 11608646.0,
|
|
"step": 4585
|
|
},
|
|
{
|
|
"entropy": 6.4840919971466064,
|
|
"epoch": 0.5297172533179457,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004980532186581555,
|
|
"loss": 6.3518,
|
|
"mean_token_accuracy": 0.1566994830965996,
|
|
"num_tokens": 11619610.0,
|
|
"step": 4590
|
|
},
|
|
{
|
|
"entropy": 6.437766647338867,
|
|
"epoch": 0.5302942873629544,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.000498047798442581,
|
|
"loss": 6.2399,
|
|
"mean_token_accuracy": 0.17291501462459563,
|
|
"num_tokens": 11631691.0,
|
|
"step": 4595
|
|
},
|
|
{
|
|
"entropy": 6.4640161991119385,
|
|
"epoch": 0.5308713214079631,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004980423707249044,
|
|
"loss": 6.286,
|
|
"mean_token_accuracy": 0.16628182977437972,
|
|
"num_tokens": 11644330.0,
|
|
"step": 4600
|
|
},
|
|
{
|
|
"entropy": 6.56778769493103,
|
|
"epoch": 0.5314483554529718,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004980369355053086,
|
|
"loss": 6.4038,
|
|
"mean_token_accuracy": 0.15543297529220582,
|
|
"num_tokens": 11656826.0,
|
|
"step": 4605
|
|
},
|
|
{
|
|
"entropy": 6.468916130065918,
|
|
"epoch": 0.5320253894979804,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004980314927839763,
|
|
"loss": 6.3838,
|
|
"mean_token_accuracy": 0.1545664668083191,
|
|
"num_tokens": 11668669.0,
|
|
"step": 4610
|
|
},
|
|
{
|
|
"entropy": 6.521239757537842,
|
|
"epoch": 0.532602423542989,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004980260425610903,
|
|
"loss": 6.3392,
|
|
"mean_token_accuracy": 0.15642919391393661,
|
|
"num_tokens": 11681237.0,
|
|
"step": 4615
|
|
},
|
|
{
|
|
"entropy": 6.442376375198364,
|
|
"epoch": 0.5331794575879977,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004980205848368343,
|
|
"loss": 6.3934,
|
|
"mean_token_accuracy": 0.15855768769979478,
|
|
"num_tokens": 11693953.0,
|
|
"step": 4620
|
|
},
|
|
{
|
|
"entropy": 6.447347021102905,
|
|
"epoch": 0.5337564916330063,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004980151196113917,
|
|
"loss": 6.3594,
|
|
"mean_token_accuracy": 0.1600581720471382,
|
|
"num_tokens": 11705364.0,
|
|
"step": 4625
|
|
},
|
|
{
|
|
"entropy": 6.5338707447052,
|
|
"epoch": 0.534333525678015,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004980096468849464,
|
|
"loss": 6.3732,
|
|
"mean_token_accuracy": 0.15663958638906478,
|
|
"num_tokens": 11717664.0,
|
|
"step": 4630
|
|
},
|
|
{
|
|
"entropy": 6.507907485961914,
|
|
"epoch": 0.5349105597230237,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004980041666576823,
|
|
"loss": 6.3688,
|
|
"mean_token_accuracy": 0.15612590909004212,
|
|
"num_tokens": 11731143.0,
|
|
"step": 4635
|
|
},
|
|
{
|
|
"entropy": 6.513534021377564,
|
|
"epoch": 0.5354875937680323,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004979986789297837,
|
|
"loss": 6.3105,
|
|
"mean_token_accuracy": 0.1600772351026535,
|
|
"num_tokens": 11743904.0,
|
|
"step": 4640
|
|
},
|
|
{
|
|
"entropy": 6.3788543224334715,
|
|
"epoch": 0.536064627813041,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004979931837014355,
|
|
"loss": 6.1961,
|
|
"mean_token_accuracy": 0.16465394496917723,
|
|
"num_tokens": 11756731.0,
|
|
"step": 4645
|
|
},
|
|
{
|
|
"entropy": 6.432486915588379,
|
|
"epoch": 0.5366416618580496,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004979876809728223,
|
|
"loss": 6.3189,
|
|
"mean_token_accuracy": 0.16390772312879562,
|
|
"num_tokens": 11768597.0,
|
|
"step": 4650
|
|
},
|
|
{
|
|
"entropy": 6.424148178100586,
|
|
"epoch": 0.5372186959030583,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004979821707441292,
|
|
"loss": 6.2386,
|
|
"mean_token_accuracy": 0.1694170728325844,
|
|
"num_tokens": 11781464.0,
|
|
"step": 4655
|
|
},
|
|
{
|
|
"entropy": 6.385573053359986,
|
|
"epoch": 0.5377957299480669,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004979766530155416,
|
|
"loss": 6.2189,
|
|
"mean_token_accuracy": 0.17261924147605895,
|
|
"num_tokens": 11794215.0,
|
|
"step": 4660
|
|
},
|
|
{
|
|
"entropy": 6.4749983787536625,
|
|
"epoch": 0.5383727639930755,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004979711277872449,
|
|
"loss": 6.444,
|
|
"mean_token_accuracy": 0.15245128124952317,
|
|
"num_tokens": 11807456.0,
|
|
"step": 4665
|
|
},
|
|
{
|
|
"entropy": 6.4587053775787355,
|
|
"epoch": 0.5389497980380843,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004979655950594252,
|
|
"loss": 6.337,
|
|
"mean_token_accuracy": 0.1637497663497925,
|
|
"num_tokens": 11819730.0,
|
|
"step": 4670
|
|
},
|
|
{
|
|
"entropy": 6.460689640045166,
|
|
"epoch": 0.5395268320830929,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004979600548322684,
|
|
"loss": 6.3466,
|
|
"mean_token_accuracy": 0.17143890559673308,
|
|
"num_tokens": 11831892.0,
|
|
"step": 4675
|
|
},
|
|
{
|
|
"entropy": 6.456334400177002,
|
|
"epoch": 0.5401038661281016,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.000497954507105961,
|
|
"loss": 6.3654,
|
|
"mean_token_accuracy": 0.15969292372465133,
|
|
"num_tokens": 11844114.0,
|
|
"step": 4680
|
|
},
|
|
{
|
|
"entropy": 6.526745080947876,
|
|
"epoch": 0.5406809001731102,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004979489518806893,
|
|
"loss": 6.3234,
|
|
"mean_token_accuracy": 0.15686967074871064,
|
|
"num_tokens": 11855832.0,
|
|
"step": 4685
|
|
},
|
|
{
|
|
"entropy": 6.465781307220459,
|
|
"epoch": 0.5412579342181189,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0004979433891566405,
|
|
"loss": 6.4208,
|
|
"mean_token_accuracy": 0.15778311640024184,
|
|
"num_tokens": 11868837.0,
|
|
"step": 4690
|
|
},
|
|
{
|
|
"entropy": 6.4877008438110355,
|
|
"epoch": 0.5418349682631275,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004979378189340015,
|
|
"loss": 6.3289,
|
|
"mean_token_accuracy": 0.16794711649417876,
|
|
"num_tokens": 11880608.0,
|
|
"step": 4695
|
|
},
|
|
{
|
|
"entropy": 6.476086235046386,
|
|
"epoch": 0.5424120023081361,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004979322412129597,
|
|
"loss": 6.344,
|
|
"mean_token_accuracy": 0.15937476307153703,
|
|
"num_tokens": 11892652.0,
|
|
"step": 4700
|
|
},
|
|
{
|
|
"entropy": 6.458676815032959,
|
|
"epoch": 0.5429890363531449,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004979266559937028,
|
|
"loss": 6.2977,
|
|
"mean_token_accuracy": 0.15880679041147233,
|
|
"num_tokens": 11904572.0,
|
|
"step": 4705
|
|
},
|
|
{
|
|
"entropy": 6.5893689632415775,
|
|
"epoch": 0.5435660703981535,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004979210632764185,
|
|
"loss": 6.4386,
|
|
"mean_token_accuracy": 0.15327975898981094,
|
|
"num_tokens": 11917794.0,
|
|
"step": 4710
|
|
},
|
|
{
|
|
"entropy": 6.511403131484985,
|
|
"epoch": 0.5441431044431622,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004979154630612949,
|
|
"loss": 6.3223,
|
|
"mean_token_accuracy": 0.156440269947052,
|
|
"num_tokens": 11930403.0,
|
|
"step": 4715
|
|
},
|
|
{
|
|
"entropy": 6.556756973266602,
|
|
"epoch": 0.5447201384881708,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004979098553485205,
|
|
"loss": 6.4268,
|
|
"mean_token_accuracy": 0.15392898991703988,
|
|
"num_tokens": 11943974.0,
|
|
"step": 4720
|
|
},
|
|
{
|
|
"entropy": 6.528595209121704,
|
|
"epoch": 0.5452971725331794,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004979042401382838,
|
|
"loss": 6.4272,
|
|
"mean_token_accuracy": 0.14962007254362106,
|
|
"num_tokens": 11956887.0,
|
|
"step": 4725
|
|
},
|
|
{
|
|
"entropy": 6.554116296768188,
|
|
"epoch": 0.5458742065781881,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004978986174307737,
|
|
"loss": 6.2719,
|
|
"mean_token_accuracy": 0.1685679391026497,
|
|
"num_tokens": 11969504.0,
|
|
"step": 4730
|
|
},
|
|
{
|
|
"entropy": 6.43930287361145,
|
|
"epoch": 0.5464512406231967,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004978929872261794,
|
|
"loss": 6.326,
|
|
"mean_token_accuracy": 0.16304372251033783,
|
|
"num_tokens": 11983432.0,
|
|
"step": 4735
|
|
},
|
|
{
|
|
"entropy": 6.510177850723267,
|
|
"epoch": 0.5470282746682055,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004978873495246901,
|
|
"loss": 6.3165,
|
|
"mean_token_accuracy": 0.1688837394118309,
|
|
"num_tokens": 11995915.0,
|
|
"step": 4740
|
|
},
|
|
{
|
|
"entropy": 6.414366436004639,
|
|
"epoch": 0.5476053087132141,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.0004978817043264955,
|
|
"loss": 6.3199,
|
|
"mean_token_accuracy": 0.1632016494870186,
|
|
"num_tokens": 12008395.0,
|
|
"step": 4745
|
|
},
|
|
{
|
|
"entropy": 6.401845407485962,
|
|
"epoch": 0.5481823427582228,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004978760516317856,
|
|
"loss": 6.2892,
|
|
"mean_token_accuracy": 0.16130719035863877,
|
|
"num_tokens": 12021179.0,
|
|
"step": 4750
|
|
},
|
|
{
|
|
"entropy": 6.523613595962525,
|
|
"epoch": 0.5487593768032314,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004978703914407503,
|
|
"loss": 6.3688,
|
|
"mean_token_accuracy": 0.1535087063908577,
|
|
"num_tokens": 12033798.0,
|
|
"step": 4755
|
|
},
|
|
{
|
|
"entropy": 6.5373670101165775,
|
|
"epoch": 0.54933641084824,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004978647237535802,
|
|
"loss": 6.3837,
|
|
"mean_token_accuracy": 0.15837208032608033,
|
|
"num_tokens": 12045720.0,
|
|
"step": 4760
|
|
},
|
|
{
|
|
"entropy": 6.5291375637054445,
|
|
"epoch": 0.5499134448932487,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004978590485704657,
|
|
"loss": 6.3069,
|
|
"mean_token_accuracy": 0.16414411664009093,
|
|
"num_tokens": 12058616.0,
|
|
"step": 4765
|
|
},
|
|
{
|
|
"entropy": 6.459080219268799,
|
|
"epoch": 0.5504904789382573,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004978533658915979,
|
|
"loss": 6.4107,
|
|
"mean_token_accuracy": 0.15961592346429826,
|
|
"num_tokens": 12070173.0,
|
|
"step": 4770
|
|
},
|
|
{
|
|
"entropy": 6.411388826370239,
|
|
"epoch": 0.5510675129832661,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004978476757171678,
|
|
"loss": 6.2896,
|
|
"mean_token_accuracy": 0.17188112884759904,
|
|
"num_tokens": 12083499.0,
|
|
"step": 4775
|
|
},
|
|
{
|
|
"entropy": 6.456639385223388,
|
|
"epoch": 0.5516445470282747,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004978419780473668,
|
|
"loss": 6.3513,
|
|
"mean_token_accuracy": 0.16023088991641998,
|
|
"num_tokens": 12095773.0,
|
|
"step": 4780
|
|
},
|
|
{
|
|
"entropy": 6.460473442077637,
|
|
"epoch": 0.5522215810732833,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004978362728823865,
|
|
"loss": 6.3514,
|
|
"mean_token_accuracy": 0.16689216941595078,
|
|
"num_tokens": 12107640.0,
|
|
"step": 4785
|
|
},
|
|
{
|
|
"entropy": 6.499213218688965,
|
|
"epoch": 0.552798615118292,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004978305602224189,
|
|
"loss": 6.297,
|
|
"mean_token_accuracy": 0.15836577117443085,
|
|
"num_tokens": 12120433.0,
|
|
"step": 4790
|
|
},
|
|
{
|
|
"entropy": 6.43018364906311,
|
|
"epoch": 0.5533756491633006,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004978248400676562,
|
|
"loss": 6.2886,
|
|
"mean_token_accuracy": 0.16459263265132903,
|
|
"num_tokens": 12133326.0,
|
|
"step": 4795
|
|
},
|
|
{
|
|
"entropy": 6.528225231170654,
|
|
"epoch": 0.5539526832083093,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004978191124182905,
|
|
"loss": 6.3795,
|
|
"mean_token_accuracy": 0.15583104342222215,
|
|
"num_tokens": 12145119.0,
|
|
"step": 4800
|
|
},
|
|
{
|
|
"entropy": 6.500142383575439,
|
|
"epoch": 0.5545297172533179,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004978133772745149,
|
|
"loss": 6.3437,
|
|
"mean_token_accuracy": 0.1544487237930298,
|
|
"num_tokens": 12157414.0,
|
|
"step": 4805
|
|
},
|
|
{
|
|
"entropy": 6.3837847232818605,
|
|
"epoch": 0.5551067512983267,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004978076346365218,
|
|
"loss": 6.2201,
|
|
"mean_token_accuracy": 0.16513165831565857,
|
|
"num_tokens": 12170226.0,
|
|
"step": 4810
|
|
},
|
|
{
|
|
"entropy": 6.448636436462403,
|
|
"epoch": 0.5556837853433353,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004978018845045047,
|
|
"loss": 6.2578,
|
|
"mean_token_accuracy": 0.16587026715278624,
|
|
"num_tokens": 12182804.0,
|
|
"step": 4815
|
|
},
|
|
{
|
|
"entropy": 6.569641876220703,
|
|
"epoch": 0.5562608193883439,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004977961268786568,
|
|
"loss": 6.3685,
|
|
"mean_token_accuracy": 0.16015153974294663,
|
|
"num_tokens": 12194795.0,
|
|
"step": 4820
|
|
},
|
|
{
|
|
"entropy": 6.4354218482971195,
|
|
"epoch": 0.5568378534333526,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004977903617591719,
|
|
"loss": 6.3301,
|
|
"mean_token_accuracy": 0.16911077052354812,
|
|
"num_tokens": 12207880.0,
|
|
"step": 4825
|
|
},
|
|
{
|
|
"entropy": 6.479910516738892,
|
|
"epoch": 0.5574148874783612,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004977845891462439,
|
|
"loss": 6.3835,
|
|
"mean_token_accuracy": 0.15894741415977479,
|
|
"num_tokens": 12219434.0,
|
|
"step": 4830
|
|
},
|
|
{
|
|
"entropy": 6.427562856674195,
|
|
"epoch": 0.5579919215233698,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004977788090400668,
|
|
"loss": 6.3085,
|
|
"mean_token_accuracy": 0.16785141825675964,
|
|
"num_tokens": 12232775.0,
|
|
"step": 4835
|
|
},
|
|
{
|
|
"entropy": 6.477736520767212,
|
|
"epoch": 0.5585689555683785,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004977730214408352,
|
|
"loss": 6.2896,
|
|
"mean_token_accuracy": 0.16171760335564614,
|
|
"num_tokens": 12245306.0,
|
|
"step": 4840
|
|
},
|
|
{
|
|
"entropy": 6.389444780349732,
|
|
"epoch": 0.5591459896133872,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004977672263487435,
|
|
"loss": 6.2348,
|
|
"mean_token_accuracy": 0.1595480427145958,
|
|
"num_tokens": 12257553.0,
|
|
"step": 4845
|
|
},
|
|
{
|
|
"entropy": 6.3948791980743405,
|
|
"epoch": 0.5597230236583959,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.000497761423763987,
|
|
"loss": 6.2974,
|
|
"mean_token_accuracy": 0.16309260874986647,
|
|
"num_tokens": 12269626.0,
|
|
"step": 4850
|
|
},
|
|
{
|
|
"entropy": 6.498226833343506,
|
|
"epoch": 0.5603000577034045,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004977556136867606,
|
|
"loss": 6.3464,
|
|
"mean_token_accuracy": 0.1585548087954521,
|
|
"num_tokens": 12282180.0,
|
|
"step": 4855
|
|
},
|
|
{
|
|
"entropy": 6.541059827804565,
|
|
"epoch": 0.5608770917484132,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004977497961172598,
|
|
"loss": 6.381,
|
|
"mean_token_accuracy": 0.16513874679803847,
|
|
"num_tokens": 12296315.0,
|
|
"step": 4860
|
|
},
|
|
{
|
|
"entropy": 6.445973348617554,
|
|
"epoch": 0.5614541257934218,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004977439710556802,
|
|
"loss": 6.3057,
|
|
"mean_token_accuracy": 0.15708381831645965,
|
|
"num_tokens": 12308800.0,
|
|
"step": 4865
|
|
},
|
|
{
|
|
"entropy": 6.436301040649414,
|
|
"epoch": 0.5620311598384304,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0004977381385022179,
|
|
"loss": 6.3618,
|
|
"mean_token_accuracy": 0.16087310016155243,
|
|
"num_tokens": 12321717.0,
|
|
"step": 4870
|
|
},
|
|
{
|
|
"entropy": 6.537671327590942,
|
|
"epoch": 0.5626081938834391,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004977322984570688,
|
|
"loss": 6.3885,
|
|
"mean_token_accuracy": 0.15361500531435013,
|
|
"num_tokens": 12335446.0,
|
|
"step": 4875
|
|
},
|
|
{
|
|
"entropy": 6.453512048721313,
|
|
"epoch": 0.5631852279284478,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004977264509204296,
|
|
"loss": 6.3143,
|
|
"mean_token_accuracy": 0.1592903256416321,
|
|
"num_tokens": 12348677.0,
|
|
"step": 4880
|
|
},
|
|
{
|
|
"entropy": 6.4898766040802,
|
|
"epoch": 0.5637622619734565,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004977205958924967,
|
|
"loss": 6.3472,
|
|
"mean_token_accuracy": 0.16099169105291367,
|
|
"num_tokens": 12360934.0,
|
|
"step": 4885
|
|
},
|
|
{
|
|
"entropy": 6.5359296798706055,
|
|
"epoch": 0.5643392960184651,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004977147333734673,
|
|
"loss": 6.4269,
|
|
"mean_token_accuracy": 0.156376850605011,
|
|
"num_tokens": 12373538.0,
|
|
"step": 4890
|
|
},
|
|
{
|
|
"entropy": 6.398646211624145,
|
|
"epoch": 0.5649163300634737,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004977088633635385,
|
|
"loss": 6.332,
|
|
"mean_token_accuracy": 0.15687417089939118,
|
|
"num_tokens": 12385291.0,
|
|
"step": 4895
|
|
},
|
|
{
|
|
"entropy": 6.582235097885132,
|
|
"epoch": 0.5654933641084824,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004977029858629076,
|
|
"loss": 6.3601,
|
|
"mean_token_accuracy": 0.15636546015739441,
|
|
"num_tokens": 12398324.0,
|
|
"step": 4900
|
|
},
|
|
{
|
|
"entropy": 6.457294559478759,
|
|
"epoch": 0.566070398153491,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004976971008717726,
|
|
"loss": 6.3267,
|
|
"mean_token_accuracy": 0.15693403780460358,
|
|
"num_tokens": 12409807.0,
|
|
"step": 4905
|
|
},
|
|
{
|
|
"entropy": 6.483905696868897,
|
|
"epoch": 0.5666474321984997,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004976912083903309,
|
|
"loss": 6.4167,
|
|
"mean_token_accuracy": 0.1543364331126213,
|
|
"num_tokens": 12422658.0,
|
|
"step": 4910
|
|
},
|
|
{
|
|
"entropy": 6.564264154434204,
|
|
"epoch": 0.5672244662435084,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004976853084187814,
|
|
"loss": 6.335,
|
|
"mean_token_accuracy": 0.15391853898763658,
|
|
"num_tokens": 12435912.0,
|
|
"step": 4915
|
|
},
|
|
{
|
|
"entropy": 6.4374730587005615,
|
|
"epoch": 0.5678015002885171,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004976794009573219,
|
|
"loss": 6.3374,
|
|
"mean_token_accuracy": 0.16345978677272796,
|
|
"num_tokens": 12448382.0,
|
|
"step": 4920
|
|
},
|
|
{
|
|
"entropy": 6.52530608177185,
|
|
"epoch": 0.5683785343335257,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004976734860061515,
|
|
"loss": 6.4579,
|
|
"mean_token_accuracy": 0.1543452709913254,
|
|
"num_tokens": 12461355.0,
|
|
"step": 4925
|
|
},
|
|
{
|
|
"entropy": 6.517202425003052,
|
|
"epoch": 0.5689555683785343,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004976675635654688,
|
|
"loss": 6.2824,
|
|
"mean_token_accuracy": 0.16503604203462602,
|
|
"num_tokens": 12473931.0,
|
|
"step": 4930
|
|
},
|
|
{
|
|
"entropy": 6.439925289154052,
|
|
"epoch": 0.569532602423543,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004976616336354733,
|
|
"loss": 6.336,
|
|
"mean_token_accuracy": 0.16363679096102715,
|
|
"num_tokens": 12486130.0,
|
|
"step": 4935
|
|
},
|
|
{
|
|
"entropy": 6.407979440689087,
|
|
"epoch": 0.5701096364685516,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004976556962163645,
|
|
"loss": 6.2576,
|
|
"mean_token_accuracy": 0.16573751717805862,
|
|
"num_tokens": 12499336.0,
|
|
"step": 4940
|
|
},
|
|
{
|
|
"entropy": 6.503925704956055,
|
|
"epoch": 0.5706866705135603,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004976497513083419,
|
|
"loss": 6.2713,
|
|
"mean_token_accuracy": 0.16759575754404069,
|
|
"num_tokens": 12512875.0,
|
|
"step": 4945
|
|
},
|
|
{
|
|
"entropy": 6.4720992088317875,
|
|
"epoch": 0.571263704558569,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004976437989116055,
|
|
"loss": 6.3864,
|
|
"mean_token_accuracy": 0.15907713323831557,
|
|
"num_tokens": 12524985.0,
|
|
"step": 4950
|
|
},
|
|
{
|
|
"entropy": 6.469041061401367,
|
|
"epoch": 0.5718407386035776,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004976378390263554,
|
|
"loss": 6.3316,
|
|
"mean_token_accuracy": 0.16550833880901336,
|
|
"num_tokens": 12538244.0,
|
|
"step": 4955
|
|
},
|
|
{
|
|
"entropy": 6.539459848403931,
|
|
"epoch": 0.5724177726485863,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004976318716527924,
|
|
"loss": 6.3286,
|
|
"mean_token_accuracy": 0.16238382309675217,
|
|
"num_tokens": 12550769.0,
|
|
"step": 4960
|
|
},
|
|
{
|
|
"entropy": 6.3982970237731935,
|
|
"epoch": 0.5729948066935949,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004976258967911168,
|
|
"loss": 6.3497,
|
|
"mean_token_accuracy": 0.16136492043733597,
|
|
"num_tokens": 12563294.0,
|
|
"step": 4965
|
|
},
|
|
{
|
|
"entropy": 6.467198228836059,
|
|
"epoch": 0.5735718407386036,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004976199144415298,
|
|
"loss": 6.3404,
|
|
"mean_token_accuracy": 0.1579903855919838,
|
|
"num_tokens": 12575857.0,
|
|
"step": 4970
|
|
},
|
|
{
|
|
"entropy": 6.509387397766114,
|
|
"epoch": 0.5741488747836122,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004976139246042325,
|
|
"loss": 6.2934,
|
|
"mean_token_accuracy": 0.16424267292022704,
|
|
"num_tokens": 12589881.0,
|
|
"step": 4975
|
|
},
|
|
{
|
|
"entropy": 6.504959058761597,
|
|
"epoch": 0.5747259088286208,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004976079272794265,
|
|
"loss": 6.3632,
|
|
"mean_token_accuracy": 0.15701202750205995,
|
|
"num_tokens": 12604100.0,
|
|
"step": 4980
|
|
},
|
|
{
|
|
"entropy": 6.4913969993591305,
|
|
"epoch": 0.5753029428736296,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004976019224673134,
|
|
"loss": 6.3798,
|
|
"mean_token_accuracy": 0.1594866156578064,
|
|
"num_tokens": 12616643.0,
|
|
"step": 4985
|
|
},
|
|
{
|
|
"entropy": 6.417438554763794,
|
|
"epoch": 0.5758799769186382,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004975959101680953,
|
|
"loss": 6.3119,
|
|
"mean_token_accuracy": 0.16797322630882264,
|
|
"num_tokens": 12627676.0,
|
|
"step": 4990
|
|
},
|
|
{
|
|
"entropy": 6.41131820678711,
|
|
"epoch": 0.5764570109636469,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004975898903819742,
|
|
"loss": 6.2615,
|
|
"mean_token_accuracy": 0.16815593391656875,
|
|
"num_tokens": 12639352.0,
|
|
"step": 4995
|
|
},
|
|
{
|
|
"entropy": 6.454370927810669,
|
|
"epoch": 0.5770340450086555,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004975838631091527,
|
|
"loss": 6.2447,
|
|
"mean_token_accuracy": 0.1643560364842415,
|
|
"num_tokens": 12652102.0,
|
|
"step": 5000
|
|
},
|
|
{
|
|
"entropy": 6.509260559082032,
|
|
"epoch": 0.5776110790536642,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004975778283498336,
|
|
"loss": 6.3592,
|
|
"mean_token_accuracy": 0.1578929305076599,
|
|
"num_tokens": 12665084.0,
|
|
"step": 5005
|
|
},
|
|
{
|
|
"entropy": 6.360739755630493,
|
|
"epoch": 0.5781881130986728,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004975717861042198,
|
|
"loss": 6.2652,
|
|
"mean_token_accuracy": 0.16091600209474563,
|
|
"num_tokens": 12677512.0,
|
|
"step": 5010
|
|
},
|
|
{
|
|
"entropy": 6.524038887023925,
|
|
"epoch": 0.5787651471436814,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004975657363725146,
|
|
"loss": 6.3909,
|
|
"mean_token_accuracy": 0.1512112334370613,
|
|
"num_tokens": 12690488.0,
|
|
"step": 5015
|
|
},
|
|
{
|
|
"entropy": 6.54783821105957,
|
|
"epoch": 0.5793421811886902,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004975596791549213,
|
|
"loss": 6.3248,
|
|
"mean_token_accuracy": 0.15481803715229034,
|
|
"num_tokens": 12703830.0,
|
|
"step": 5020
|
|
},
|
|
{
|
|
"entropy": 6.459069347381591,
|
|
"epoch": 0.5799192152336988,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004975536144516437,
|
|
"loss": 6.3317,
|
|
"mean_token_accuracy": 0.16206814646720885,
|
|
"num_tokens": 12716020.0,
|
|
"step": 5025
|
|
},
|
|
{
|
|
"entropy": 6.49042387008667,
|
|
"epoch": 0.5804962492787075,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.000497547542262886,
|
|
"loss": 6.3974,
|
|
"mean_token_accuracy": 0.15198142379522322,
|
|
"num_tokens": 12728989.0,
|
|
"step": 5030
|
|
},
|
|
{
|
|
"entropy": 6.5610472679138185,
|
|
"epoch": 0.5810732833237161,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004975414625888521,
|
|
"loss": 6.2683,
|
|
"mean_token_accuracy": 0.1594917967915535,
|
|
"num_tokens": 12741090.0,
|
|
"step": 5035
|
|
},
|
|
{
|
|
"entropy": 6.464597845077515,
|
|
"epoch": 0.5816503173687247,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004975353754297468,
|
|
"loss": 6.3082,
|
|
"mean_token_accuracy": 0.16099455803632737,
|
|
"num_tokens": 12754176.0,
|
|
"step": 5040
|
|
},
|
|
{
|
|
"entropy": 6.39254412651062,
|
|
"epoch": 0.5822273514137334,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004975292807857745,
|
|
"loss": 6.2864,
|
|
"mean_token_accuracy": 0.15810506939888,
|
|
"num_tokens": 12766149.0,
|
|
"step": 5045
|
|
},
|
|
{
|
|
"entropy": 6.485265731811523,
|
|
"epoch": 0.582804385458742,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004975231786571406,
|
|
"loss": 6.3554,
|
|
"mean_token_accuracy": 0.16003530323505402,
|
|
"num_tokens": 12778337.0,
|
|
"step": 5050
|
|
},
|
|
{
|
|
"entropy": 6.46652660369873,
|
|
"epoch": 0.5833814195037508,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004975170690440499,
|
|
"loss": 6.2617,
|
|
"mean_token_accuracy": 0.16169480085372925,
|
|
"num_tokens": 12790146.0,
|
|
"step": 5055
|
|
},
|
|
{
|
|
"entropy": 6.452705526351929,
|
|
"epoch": 0.5839584535487594,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004975109519467083,
|
|
"loss": 6.249,
|
|
"mean_token_accuracy": 0.16325473338365554,
|
|
"num_tokens": 12802821.0,
|
|
"step": 5060
|
|
},
|
|
{
|
|
"entropy": 6.394228124618531,
|
|
"epoch": 0.584535487593768,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004975048273653212,
|
|
"loss": 6.397,
|
|
"mean_token_accuracy": 0.16143627166748048,
|
|
"num_tokens": 12814409.0,
|
|
"step": 5065
|
|
},
|
|
{
|
|
"entropy": 6.498150205612182,
|
|
"epoch": 0.5851125216387767,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004974986953000948,
|
|
"loss": 6.3009,
|
|
"mean_token_accuracy": 0.15540309697389604,
|
|
"num_tokens": 12827398.0,
|
|
"step": 5070
|
|
},
|
|
{
|
|
"entropy": 6.4518615245819095,
|
|
"epoch": 0.5856895556837853,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004974925557512354,
|
|
"loss": 6.2709,
|
|
"mean_token_accuracy": 0.16093710511922837,
|
|
"num_tokens": 12840378.0,
|
|
"step": 5075
|
|
},
|
|
{
|
|
"entropy": 6.448571586608887,
|
|
"epoch": 0.586266589728794,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004974864087189493,
|
|
"loss": 6.357,
|
|
"mean_token_accuracy": 0.16484926640987396,
|
|
"num_tokens": 12853493.0,
|
|
"step": 5080
|
|
},
|
|
{
|
|
"entropy": 6.437574625015259,
|
|
"epoch": 0.5868436237738026,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004974802542034434,
|
|
"loss": 6.2316,
|
|
"mean_token_accuracy": 0.1698588877916336,
|
|
"num_tokens": 12865052.0,
|
|
"step": 5085
|
|
},
|
|
{
|
|
"entropy": 6.47462739944458,
|
|
"epoch": 0.5874206578188114,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004974740922049246,
|
|
"loss": 6.3696,
|
|
"mean_token_accuracy": 0.15433994829654693,
|
|
"num_tokens": 12878095.0,
|
|
"step": 5090
|
|
},
|
|
{
|
|
"entropy": 6.512469148635864,
|
|
"epoch": 0.58799769186382,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004974679227236004,
|
|
"loss": 6.2207,
|
|
"mean_token_accuracy": 0.17119740098714828,
|
|
"num_tokens": 12890855.0,
|
|
"step": 5095
|
|
},
|
|
{
|
|
"entropy": 6.409336709976197,
|
|
"epoch": 0.5885747259088286,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004974617457596779,
|
|
"loss": 6.2785,
|
|
"mean_token_accuracy": 0.1650840535759926,
|
|
"num_tokens": 12903833.0,
|
|
"step": 5100
|
|
},
|
|
{
|
|
"entropy": 6.506627464294434,
|
|
"epoch": 0.5891517599538373,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004974555613133652,
|
|
"loss": 6.4079,
|
|
"mean_token_accuracy": 0.15667158514261245,
|
|
"num_tokens": 12917579.0,
|
|
"step": 5105
|
|
},
|
|
{
|
|
"entropy": 6.480052518844604,
|
|
"epoch": 0.5897287939988459,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004974493693848702,
|
|
"loss": 6.3818,
|
|
"mean_token_accuracy": 0.1637255698442459,
|
|
"num_tokens": 12929718.0,
|
|
"step": 5110
|
|
},
|
|
{
|
|
"entropy": 6.324490737915039,
|
|
"epoch": 0.5903058280438546,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004974431699744011,
|
|
"loss": 6.221,
|
|
"mean_token_accuracy": 0.16753413528203964,
|
|
"num_tokens": 12943031.0,
|
|
"step": 5115
|
|
},
|
|
{
|
|
"entropy": 6.465872192382813,
|
|
"epoch": 0.5908828620888632,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004974369630821665,
|
|
"loss": 6.3385,
|
|
"mean_token_accuracy": 0.1643362522125244,
|
|
"num_tokens": 12954843.0,
|
|
"step": 5120
|
|
},
|
|
{
|
|
"entropy": 6.429745864868164,
|
|
"epoch": 0.5914598961338718,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004974307487083752,
|
|
"loss": 6.3302,
|
|
"mean_token_accuracy": 0.16157597452402114,
|
|
"num_tokens": 12966915.0,
|
|
"step": 5125
|
|
},
|
|
{
|
|
"entropy": 6.483998966217041,
|
|
"epoch": 0.5920369301788806,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004974245268532361,
|
|
"loss": 6.3713,
|
|
"mean_token_accuracy": 0.1558799222111702,
|
|
"num_tokens": 12979941.0,
|
|
"step": 5130
|
|
},
|
|
{
|
|
"entropy": 6.499818563461304,
|
|
"epoch": 0.5926139642238892,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004974182975169585,
|
|
"loss": 6.2561,
|
|
"mean_token_accuracy": 0.16042693704366684,
|
|
"num_tokens": 12992836.0,
|
|
"step": 5135
|
|
},
|
|
{
|
|
"entropy": 6.474150991439819,
|
|
"epoch": 0.5931909982688979,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000497412060699752,
|
|
"loss": 6.3075,
|
|
"mean_token_accuracy": 0.16249936521053315,
|
|
"num_tokens": 13005246.0,
|
|
"step": 5140
|
|
},
|
|
{
|
|
"entropy": 6.422859621047974,
|
|
"epoch": 0.5937680323139065,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004974058164018263,
|
|
"loss": 6.2729,
|
|
"mean_token_accuracy": 0.159485824406147,
|
|
"num_tokens": 13016842.0,
|
|
"step": 5145
|
|
},
|
|
{
|
|
"entropy": 6.379044771194458,
|
|
"epoch": 0.5943450663589152,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004973995646233914,
|
|
"loss": 6.277,
|
|
"mean_token_accuracy": 0.16455476433038713,
|
|
"num_tokens": 13028388.0,
|
|
"step": 5150
|
|
},
|
|
{
|
|
"entropy": 6.483341646194458,
|
|
"epoch": 0.5949221004039238,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004973933053646576,
|
|
"loss": 6.2963,
|
|
"mean_token_accuracy": 0.16036218404769897,
|
|
"num_tokens": 13041895.0,
|
|
"step": 5155
|
|
},
|
|
{
|
|
"entropy": 6.4746462345123295,
|
|
"epoch": 0.5954991344489324,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004973870386258355,
|
|
"loss": 6.3554,
|
|
"mean_token_accuracy": 0.16368395537137986,
|
|
"num_tokens": 13055984.0,
|
|
"step": 5160
|
|
},
|
|
{
|
|
"entropy": 6.484179830551147,
|
|
"epoch": 0.5960761684939412,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004973807644071357,
|
|
"loss": 6.303,
|
|
"mean_token_accuracy": 0.16322016417980195,
|
|
"num_tokens": 13068735.0,
|
|
"step": 5165
|
|
},
|
|
{
|
|
"entropy": 6.49740834236145,
|
|
"epoch": 0.5966532025389498,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004973744827087695,
|
|
"loss": 6.3685,
|
|
"mean_token_accuracy": 0.160064959526062,
|
|
"num_tokens": 13081564.0,
|
|
"step": 5170
|
|
},
|
|
{
|
|
"entropy": 6.477915859222412,
|
|
"epoch": 0.5972302365839585,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.000497368193530948,
|
|
"loss": 6.2975,
|
|
"mean_token_accuracy": 0.16501372158527375,
|
|
"num_tokens": 13094146.0,
|
|
"step": 5175
|
|
},
|
|
{
|
|
"entropy": 6.37415885925293,
|
|
"epoch": 0.5978072706289671,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004973618968738828,
|
|
"loss": 6.2557,
|
|
"mean_token_accuracy": 0.16740904450416566,
|
|
"num_tokens": 13106753.0,
|
|
"step": 5180
|
|
},
|
|
{
|
|
"entropy": 6.414618730545044,
|
|
"epoch": 0.5983843046739757,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004973555927377856,
|
|
"loss": 6.217,
|
|
"mean_token_accuracy": 0.17282827198505402,
|
|
"num_tokens": 13118645.0,
|
|
"step": 5185
|
|
},
|
|
{
|
|
"entropy": 6.46846227645874,
|
|
"epoch": 0.5989613387189844,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004973492811228685,
|
|
"loss": 6.344,
|
|
"mean_token_accuracy": 0.16316265612840652,
|
|
"num_tokens": 13132250.0,
|
|
"step": 5190
|
|
},
|
|
{
|
|
"entropy": 6.466949081420898,
|
|
"epoch": 0.599538372763993,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004973429620293438,
|
|
"loss": 6.3362,
|
|
"mean_token_accuracy": 0.15950386077165604,
|
|
"num_tokens": 13145069.0,
|
|
"step": 5195
|
|
},
|
|
{
|
|
"entropy": 6.456646823883057,
|
|
"epoch": 0.6001154068090018,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004973366354574239,
|
|
"loss": 6.3034,
|
|
"mean_token_accuracy": 0.16648412495851517,
|
|
"num_tokens": 13158244.0,
|
|
"step": 5200
|
|
},
|
|
{
|
|
"entropy": 6.455355453491211,
|
|
"epoch": 0.6006924408540104,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004973303014073219,
|
|
"loss": 6.3623,
|
|
"mean_token_accuracy": 0.15627395808696748,
|
|
"num_tokens": 13171810.0,
|
|
"step": 5205
|
|
},
|
|
{
|
|
"entropy": 6.448964262008667,
|
|
"epoch": 0.601269474899019,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004973239598792504,
|
|
"loss": 6.1955,
|
|
"mean_token_accuracy": 0.1658018559217453,
|
|
"num_tokens": 13184448.0,
|
|
"step": 5210
|
|
},
|
|
{
|
|
"entropy": 6.448535013198852,
|
|
"epoch": 0.6018465089440277,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004973176108734232,
|
|
"loss": 6.3448,
|
|
"mean_token_accuracy": 0.15199785232543944,
|
|
"num_tokens": 13198350.0,
|
|
"step": 5215
|
|
},
|
|
{
|
|
"entropy": 6.465864801406861,
|
|
"epoch": 0.6024235429890363,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004973112543900535,
|
|
"loss": 6.2841,
|
|
"mean_token_accuracy": 0.16358843743801116,
|
|
"num_tokens": 13210660.0,
|
|
"step": 5220
|
|
},
|
|
{
|
|
"entropy": 6.406602478027343,
|
|
"epoch": 0.603000577034045,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004973048904293551,
|
|
"loss": 6.2393,
|
|
"mean_token_accuracy": 0.1710536241531372,
|
|
"num_tokens": 13222991.0,
|
|
"step": 5225
|
|
},
|
|
{
|
|
"entropy": 6.444959449768066,
|
|
"epoch": 0.6035776110790536,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004972985189915422,
|
|
"loss": 6.3254,
|
|
"mean_token_accuracy": 0.16002852469682693,
|
|
"num_tokens": 13237693.0,
|
|
"step": 5230
|
|
},
|
|
{
|
|
"entropy": 6.444726753234863,
|
|
"epoch": 0.6041546451240624,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.000497292140076829,
|
|
"loss": 6.3317,
|
|
"mean_token_accuracy": 0.1622207522392273,
|
|
"num_tokens": 13249843.0,
|
|
"step": 5235
|
|
},
|
|
{
|
|
"entropy": 6.439457941055298,
|
|
"epoch": 0.604731679169071,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004972857536854301,
|
|
"loss": 6.3119,
|
|
"mean_token_accuracy": 0.16525271087884902,
|
|
"num_tokens": 13262185.0,
|
|
"step": 5240
|
|
},
|
|
{
|
|
"entropy": 6.4337084770202635,
|
|
"epoch": 0.6053087132140796,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004972793598175603,
|
|
"loss": 6.3505,
|
|
"mean_token_accuracy": 0.15734633207321166,
|
|
"num_tokens": 13275344.0,
|
|
"step": 5245
|
|
},
|
|
{
|
|
"entropy": 6.473100423812866,
|
|
"epoch": 0.6058857472590883,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004972729584734347,
|
|
"loss": 6.2688,
|
|
"mean_token_accuracy": 0.15891817957162857,
|
|
"num_tokens": 13287741.0,
|
|
"step": 5250
|
|
},
|
|
{
|
|
"entropy": 6.470854473114014,
|
|
"epoch": 0.6064627813040969,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004972665496532685,
|
|
"loss": 6.2701,
|
|
"mean_token_accuracy": 0.16430861055850982,
|
|
"num_tokens": 13299918.0,
|
|
"step": 5255
|
|
},
|
|
{
|
|
"entropy": 6.368015956878662,
|
|
"epoch": 0.6070398153491056,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004972601333572774,
|
|
"loss": 6.2533,
|
|
"mean_token_accuracy": 0.15958417505025863,
|
|
"num_tokens": 13312765.0,
|
|
"step": 5260
|
|
},
|
|
{
|
|
"entropy": 6.462191009521485,
|
|
"epoch": 0.6076168493941142,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004972537095856769,
|
|
"loss": 6.2398,
|
|
"mean_token_accuracy": 0.16111138761043547,
|
|
"num_tokens": 13325324.0,
|
|
"step": 5265
|
|
},
|
|
{
|
|
"entropy": 6.485791730880737,
|
|
"epoch": 0.608193883439123,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004972472783386834,
|
|
"loss": 6.3451,
|
|
"mean_token_accuracy": 0.15810697078704833,
|
|
"num_tokens": 13337578.0,
|
|
"step": 5270
|
|
},
|
|
{
|
|
"entropy": 6.464807462692261,
|
|
"epoch": 0.6087709174841316,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004972408396165132,
|
|
"loss": 6.3088,
|
|
"mean_token_accuracy": 0.1609449043869972,
|
|
"num_tokens": 13349218.0,
|
|
"step": 5275
|
|
},
|
|
{
|
|
"entropy": 6.441641569137573,
|
|
"epoch": 0.6093479515291402,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004972343934193826,
|
|
"loss": 6.2705,
|
|
"mean_token_accuracy": 0.1591146320104599,
|
|
"num_tokens": 13362221.0,
|
|
"step": 5280
|
|
},
|
|
{
|
|
"entropy": 6.434703302383423,
|
|
"epoch": 0.6099249855741489,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004972279397475086,
|
|
"loss": 6.2645,
|
|
"mean_token_accuracy": 0.17187120169401168,
|
|
"num_tokens": 13374147.0,
|
|
"step": 5285
|
|
},
|
|
{
|
|
"entropy": 6.378955316543579,
|
|
"epoch": 0.6105020196191575,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004972214786011083,
|
|
"loss": 6.2197,
|
|
"mean_token_accuracy": 0.16266336888074875,
|
|
"num_tokens": 13386077.0,
|
|
"step": 5290
|
|
},
|
|
{
|
|
"entropy": 6.500459098815918,
|
|
"epoch": 0.6110790536641661,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.000497215009980399,
|
|
"loss": 6.297,
|
|
"mean_token_accuracy": 0.16877201348543167,
|
|
"num_tokens": 13398442.0,
|
|
"step": 5295
|
|
},
|
|
{
|
|
"entropy": 6.4331823825836185,
|
|
"epoch": 0.6116560877091748,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.000497208533885598,
|
|
"loss": 6.3029,
|
|
"mean_token_accuracy": 0.16564711034297944,
|
|
"num_tokens": 13411249.0,
|
|
"step": 5300
|
|
},
|
|
{
|
|
"entropy": 6.43955626487732,
|
|
"epoch": 0.6122331217541835,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004972020503169235,
|
|
"loss": 6.2878,
|
|
"mean_token_accuracy": 0.16612933129072188,
|
|
"num_tokens": 13424518.0,
|
|
"step": 5305
|
|
},
|
|
{
|
|
"entropy": 6.467305707931518,
|
|
"epoch": 0.6128101557991922,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004971955592745934,
|
|
"loss": 6.3069,
|
|
"mean_token_accuracy": 0.1545131728053093,
|
|
"num_tokens": 13438530.0,
|
|
"step": 5310
|
|
},
|
|
{
|
|
"entropy": 6.410894584655762,
|
|
"epoch": 0.6133871898442008,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.000497189060758826,
|
|
"loss": 6.2452,
|
|
"mean_token_accuracy": 0.16825231909751892,
|
|
"num_tokens": 13451154.0,
|
|
"step": 5315
|
|
},
|
|
{
|
|
"entropy": 6.409408855438232,
|
|
"epoch": 0.6139642238892095,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00049718255476984,
|
|
"loss": 6.2859,
|
|
"mean_token_accuracy": 0.16544894725084305,
|
|
"num_tokens": 13461938.0,
|
|
"step": 5320
|
|
},
|
|
{
|
|
"entropy": 6.377069711685181,
|
|
"epoch": 0.6145412579342181,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004971760413078539,
|
|
"loss": 6.2693,
|
|
"mean_token_accuracy": 0.1646272733807564,
|
|
"num_tokens": 13474423.0,
|
|
"step": 5325
|
|
},
|
|
{
|
|
"entropy": 6.502867031097412,
|
|
"epoch": 0.6151182919792267,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004971695203730872,
|
|
"loss": 6.2578,
|
|
"mean_token_accuracy": 0.17385480105876921,
|
|
"num_tokens": 13486882.0,
|
|
"step": 5330
|
|
},
|
|
{
|
|
"entropy": 6.399074077606201,
|
|
"epoch": 0.6156953260242354,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.000497162991965759,
|
|
"loss": 6.2091,
|
|
"mean_token_accuracy": 0.16568703651428224,
|
|
"num_tokens": 13499692.0,
|
|
"step": 5335
|
|
},
|
|
{
|
|
"entropy": 6.454089546203614,
|
|
"epoch": 0.6162723600692441,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004971564560860889,
|
|
"loss": 6.2921,
|
|
"mean_token_accuracy": 0.1587091013789177,
|
|
"num_tokens": 13512995.0,
|
|
"step": 5340
|
|
},
|
|
{
|
|
"entropy": 6.335466384887695,
|
|
"epoch": 0.6168493941142528,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004971499127342968,
|
|
"loss": 6.1969,
|
|
"mean_token_accuracy": 0.1680700197815895,
|
|
"num_tokens": 13525804.0,
|
|
"step": 5345
|
|
},
|
|
{
|
|
"entropy": 6.4052308082580565,
|
|
"epoch": 0.6174264281592614,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004971433619106027,
|
|
"loss": 6.3092,
|
|
"mean_token_accuracy": 0.16079850047826766,
|
|
"num_tokens": 13537807.0,
|
|
"step": 5350
|
|
},
|
|
{
|
|
"entropy": 6.485114002227784,
|
|
"epoch": 0.61800346220427,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.000497136803615227,
|
|
"loss": 6.3762,
|
|
"mean_token_accuracy": 0.1530951127409935,
|
|
"num_tokens": 13550765.0,
|
|
"step": 5355
|
|
},
|
|
{
|
|
"entropy": 6.4439774513244625,
|
|
"epoch": 0.6185804962492787,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004971302378483902,
|
|
"loss": 6.2689,
|
|
"mean_token_accuracy": 0.165410552918911,
|
|
"num_tokens": 13565084.0,
|
|
"step": 5360
|
|
},
|
|
{
|
|
"entropy": 6.476373338699341,
|
|
"epoch": 0.6191575302942873,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004971236646103132,
|
|
"loss": 6.2655,
|
|
"mean_token_accuracy": 0.16471700817346574,
|
|
"num_tokens": 13578851.0,
|
|
"step": 5365
|
|
},
|
|
{
|
|
"entropy": 6.406863832473755,
|
|
"epoch": 0.619734564339296,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004971170839012171,
|
|
"loss": 6.1939,
|
|
"mean_token_accuracy": 0.17038790881633759,
|
|
"num_tokens": 13589984.0,
|
|
"step": 5370
|
|
},
|
|
{
|
|
"entropy": 6.3514081001281735,
|
|
"epoch": 0.6203115983843047,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004971104957213233,
|
|
"loss": 6.2624,
|
|
"mean_token_accuracy": 0.16135939061641694,
|
|
"num_tokens": 13602899.0,
|
|
"step": 5375
|
|
},
|
|
{
|
|
"entropy": 6.490747451782227,
|
|
"epoch": 0.6208886324293134,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004971039000708531,
|
|
"loss": 6.418,
|
|
"mean_token_accuracy": 0.1528172329068184,
|
|
"num_tokens": 13617672.0,
|
|
"step": 5380
|
|
},
|
|
{
|
|
"entropy": 6.473091506958008,
|
|
"epoch": 0.621465666474322,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004970972969500286,
|
|
"loss": 6.2773,
|
|
"mean_token_accuracy": 0.1603806808590889,
|
|
"num_tokens": 13630029.0,
|
|
"step": 5385
|
|
},
|
|
{
|
|
"entropy": 6.401896953582764,
|
|
"epoch": 0.6220427005193306,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.000497090686359072,
|
|
"loss": 6.2523,
|
|
"mean_token_accuracy": 0.1648557275533676,
|
|
"num_tokens": 13643091.0,
|
|
"step": 5390
|
|
},
|
|
{
|
|
"entropy": 6.350330066680908,
|
|
"epoch": 0.6226197345643393,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004970840682982054,
|
|
"loss": 6.1293,
|
|
"mean_token_accuracy": 0.17030057311058044,
|
|
"num_tokens": 13654790.0,
|
|
"step": 5395
|
|
},
|
|
{
|
|
"entropy": 6.439556312561035,
|
|
"epoch": 0.6231967686093479,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004970774427676514,
|
|
"loss": 6.2464,
|
|
"mean_token_accuracy": 0.16800362020730972,
|
|
"num_tokens": 13667425.0,
|
|
"step": 5400
|
|
},
|
|
{
|
|
"entropy": 6.429106521606445,
|
|
"epoch": 0.6237738026543566,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.000497070809767633,
|
|
"loss": 6.3099,
|
|
"mean_token_accuracy": 0.16256403923034668,
|
|
"num_tokens": 13680199.0,
|
|
"step": 5405
|
|
},
|
|
{
|
|
"entropy": 6.471726417541504,
|
|
"epoch": 0.6243508366993653,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004970641692983731,
|
|
"loss": 6.3267,
|
|
"mean_token_accuracy": 0.16009956300258638,
|
|
"num_tokens": 13693613.0,
|
|
"step": 5410
|
|
},
|
|
{
|
|
"entropy": 6.32947187423706,
|
|
"epoch": 0.624927870744374,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004970575213600954,
|
|
"loss": 6.2661,
|
|
"mean_token_accuracy": 0.160757178068161,
|
|
"num_tokens": 13706809.0,
|
|
"step": 5415
|
|
},
|
|
{
|
|
"entropy": 6.40821270942688,
|
|
"epoch": 0.6255049047893826,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004970508659530231,
|
|
"loss": 6.2302,
|
|
"mean_token_accuracy": 0.16359151303768157,
|
|
"num_tokens": 13718976.0,
|
|
"step": 5420
|
|
},
|
|
{
|
|
"entropy": 6.440737009048462,
|
|
"epoch": 0.6260819388343912,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004970442030773802,
|
|
"loss": 6.2155,
|
|
"mean_token_accuracy": 0.1657729595899582,
|
|
"num_tokens": 13731037.0,
|
|
"step": 5425
|
|
},
|
|
{
|
|
"entropy": 6.358583593368531,
|
|
"epoch": 0.6266589728793999,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004970375327333909,
|
|
"loss": 6.2887,
|
|
"mean_token_accuracy": 0.16418557167053222,
|
|
"num_tokens": 13743816.0,
|
|
"step": 5430
|
|
},
|
|
{
|
|
"entropy": 6.3964362144470215,
|
|
"epoch": 0.6272360069244085,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0004970308549212796,
|
|
"loss": 6.282,
|
|
"mean_token_accuracy": 0.16759266555309296,
|
|
"num_tokens": 13757165.0,
|
|
"step": 5435
|
|
},
|
|
{
|
|
"entropy": 6.450726795196533,
|
|
"epoch": 0.6278130409694171,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004970241696412705,
|
|
"loss": 6.2452,
|
|
"mean_token_accuracy": 0.17060438096523284,
|
|
"num_tokens": 13769982.0,
|
|
"step": 5440
|
|
},
|
|
{
|
|
"entropy": 6.434137296676636,
|
|
"epoch": 0.6283900750144259,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.000497017476893589,
|
|
"loss": 6.272,
|
|
"mean_token_accuracy": 0.16804485619068146,
|
|
"num_tokens": 13782922.0,
|
|
"step": 5445
|
|
},
|
|
{
|
|
"entropy": 6.38315167427063,
|
|
"epoch": 0.6289671090594345,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004970107766784598,
|
|
"loss": 6.2659,
|
|
"mean_token_accuracy": 0.1645989775657654,
|
|
"num_tokens": 13795683.0,
|
|
"step": 5450
|
|
},
|
|
{
|
|
"entropy": 6.467908000946045,
|
|
"epoch": 0.6295441431044432,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004970040689961084,
|
|
"loss": 6.3515,
|
|
"mean_token_accuracy": 0.16600358933210374,
|
|
"num_tokens": 13808332.0,
|
|
"step": 5455
|
|
},
|
|
{
|
|
"entropy": 6.430469560623169,
|
|
"epoch": 0.6301211771494518,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004969973538467605,
|
|
"loss": 6.3109,
|
|
"mean_token_accuracy": 0.16642144173383713,
|
|
"num_tokens": 13820949.0,
|
|
"step": 5460
|
|
},
|
|
{
|
|
"entropy": 6.349089574813843,
|
|
"epoch": 0.6306982111944605,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004969906312306419,
|
|
"loss": 6.2808,
|
|
"mean_token_accuracy": 0.16602863222360612,
|
|
"num_tokens": 13833623.0,
|
|
"step": 5465
|
|
},
|
|
{
|
|
"entropy": 6.47224531173706,
|
|
"epoch": 0.6312752452394691,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004969839011479786,
|
|
"loss": 6.2311,
|
|
"mean_token_accuracy": 0.17260048240423204,
|
|
"num_tokens": 13844368.0,
|
|
"step": 5470
|
|
},
|
|
{
|
|
"entropy": 6.46555233001709,
|
|
"epoch": 0.6318522792844777,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.000496977163598997,
|
|
"loss": 6.2693,
|
|
"mean_token_accuracy": 0.16359723955392838,
|
|
"num_tokens": 13857261.0,
|
|
"step": 5475
|
|
},
|
|
{
|
|
"entropy": 6.241572618484497,
|
|
"epoch": 0.6324293133294865,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004969704185839239,
|
|
"loss": 6.1323,
|
|
"mean_token_accuracy": 0.16393650248646735,
|
|
"num_tokens": 13869438.0,
|
|
"step": 5480
|
|
},
|
|
{
|
|
"entropy": 6.454886245727539,
|
|
"epoch": 0.6330063473744951,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004969636661029859,
|
|
"loss": 6.3533,
|
|
"mean_token_accuracy": 0.15374770537018775,
|
|
"num_tokens": 13883353.0,
|
|
"step": 5485
|
|
},
|
|
{
|
|
"entropy": 6.484453201293945,
|
|
"epoch": 0.6335833814195038,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004969569061564103,
|
|
"loss": 6.2837,
|
|
"mean_token_accuracy": 0.168526728451252,
|
|
"num_tokens": 13896950.0,
|
|
"step": 5490
|
|
},
|
|
{
|
|
"entropy": 6.4666359424591064,
|
|
"epoch": 0.6341604154645124,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0004969501387444245,
|
|
"loss": 6.2937,
|
|
"mean_token_accuracy": 0.16304062455892562,
|
|
"num_tokens": 13910447.0,
|
|
"step": 5495
|
|
},
|
|
{
|
|
"entropy": 6.418818473815918,
|
|
"epoch": 0.634737449509521,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004969433638672559,
|
|
"loss": 6.2849,
|
|
"mean_token_accuracy": 0.17183531671762467,
|
|
"num_tokens": 13922894.0,
|
|
"step": 5500
|
|
},
|
|
{
|
|
"entropy": 6.437852239608764,
|
|
"epoch": 0.6353144835545297,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004969365815251325,
|
|
"loss": 6.3015,
|
|
"mean_token_accuracy": 0.16050758361816406,
|
|
"num_tokens": 13936558.0,
|
|
"step": 5505
|
|
},
|
|
{
|
|
"entropy": 6.433607149124145,
|
|
"epoch": 0.6358915175995383,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004969297917182825,
|
|
"loss": 6.2436,
|
|
"mean_token_accuracy": 0.16257888972759246,
|
|
"num_tokens": 13949005.0,
|
|
"step": 5510
|
|
},
|
|
{
|
|
"entropy": 6.431810188293457,
|
|
"epoch": 0.6364685516445471,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004969229944469342,
|
|
"loss": 6.2808,
|
|
"mean_token_accuracy": 0.15686439871788024,
|
|
"num_tokens": 13962285.0,
|
|
"step": 5515
|
|
},
|
|
{
|
|
"entropy": 6.484597444534302,
|
|
"epoch": 0.6370455856895557,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004969161897113162,
|
|
"loss": 6.2797,
|
|
"mean_token_accuracy": 0.16125818341970444,
|
|
"num_tokens": 13976037.0,
|
|
"step": 5520
|
|
},
|
|
{
|
|
"entropy": 6.454035043716431,
|
|
"epoch": 0.6376226197345644,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004969093775116574,
|
|
"loss": 6.2329,
|
|
"mean_token_accuracy": 0.16799202859401702,
|
|
"num_tokens": 13989028.0,
|
|
"step": 5525
|
|
},
|
|
{
|
|
"entropy": 6.353673887252808,
|
|
"epoch": 0.638199653779573,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004969025578481869,
|
|
"loss": 6.2199,
|
|
"mean_token_accuracy": 0.16663924157619475,
|
|
"num_tokens": 14001814.0,
|
|
"step": 5530
|
|
},
|
|
{
|
|
"entropy": 6.490426683425904,
|
|
"epoch": 0.6387766878245816,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.000496895730721134,
|
|
"loss": 6.3185,
|
|
"mean_token_accuracy": 0.15284908413887024,
|
|
"num_tokens": 14014305.0,
|
|
"step": 5535
|
|
},
|
|
{
|
|
"entropy": 6.4198565006256105,
|
|
"epoch": 0.6393537218695903,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004968888961307286,
|
|
"loss": 6.1901,
|
|
"mean_token_accuracy": 0.17025423794984818,
|
|
"num_tokens": 14027475.0,
|
|
"step": 5540
|
|
},
|
|
{
|
|
"entropy": 6.402793550491333,
|
|
"epoch": 0.6399307559145989,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004968820540772003,
|
|
"loss": 6.2554,
|
|
"mean_token_accuracy": 0.16645244061946868,
|
|
"num_tokens": 14041031.0,
|
|
"step": 5545
|
|
},
|
|
{
|
|
"entropy": 6.391665887832642,
|
|
"epoch": 0.6405077899596077,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004968752045607794,
|
|
"loss": 6.212,
|
|
"mean_token_accuracy": 0.1631389558315277,
|
|
"num_tokens": 14054138.0,
|
|
"step": 5550
|
|
},
|
|
{
|
|
"entropy": 6.474399709701538,
|
|
"epoch": 0.6410848240046163,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004968683475816961,
|
|
"loss": 6.2339,
|
|
"mean_token_accuracy": 0.16551497131586074,
|
|
"num_tokens": 14066708.0,
|
|
"step": 5555
|
|
},
|
|
{
|
|
"entropy": 6.412665510177613,
|
|
"epoch": 0.641661858049625,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004968614831401811,
|
|
"loss": 6.319,
|
|
"mean_token_accuracy": 0.15504314005374908,
|
|
"num_tokens": 14080251.0,
|
|
"step": 5560
|
|
},
|
|
{
|
|
"entropy": 6.486737298965454,
|
|
"epoch": 0.6422388920946336,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004968546112364654,
|
|
"loss": 6.2944,
|
|
"mean_token_accuracy": 0.156815817207098,
|
|
"num_tokens": 14092622.0,
|
|
"step": 5565
|
|
},
|
|
{
|
|
"entropy": 6.457394075393677,
|
|
"epoch": 0.6428159261396422,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.00049684773187078,
|
|
"loss": 6.3607,
|
|
"mean_token_accuracy": 0.15759846270084382,
|
|
"num_tokens": 14107033.0,
|
|
"step": 5570
|
|
},
|
|
{
|
|
"entropy": 6.415627193450928,
|
|
"epoch": 0.6433929601846509,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004968408450433565,
|
|
"loss": 6.0985,
|
|
"mean_token_accuracy": 0.16721982806921004,
|
|
"num_tokens": 14119264.0,
|
|
"step": 5575
|
|
},
|
|
{
|
|
"entropy": 6.409555053710937,
|
|
"epoch": 0.6439699942296595,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004968339507544263,
|
|
"loss": 6.2658,
|
|
"mean_token_accuracy": 0.16522011756896973,
|
|
"num_tokens": 14131360.0,
|
|
"step": 5580
|
|
},
|
|
{
|
|
"entropy": 6.331378602981568,
|
|
"epoch": 0.6445470282746683,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004968270490042212,
|
|
"loss": 6.2574,
|
|
"mean_token_accuracy": 0.16861171871423722,
|
|
"num_tokens": 14143236.0,
|
|
"step": 5585
|
|
},
|
|
{
|
|
"entropy": 6.466990947723389,
|
|
"epoch": 0.6451240623196769,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004968201397929737,
|
|
"loss": 6.2703,
|
|
"mean_token_accuracy": 0.16277870833873748,
|
|
"num_tokens": 14156470.0,
|
|
"step": 5590
|
|
},
|
|
{
|
|
"entropy": 6.471270656585693,
|
|
"epoch": 0.6457010963646855,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004968132231209158,
|
|
"loss": 6.3218,
|
|
"mean_token_accuracy": 0.157097789645195,
|
|
"num_tokens": 14169359.0,
|
|
"step": 5595
|
|
},
|
|
{
|
|
"entropy": 6.400879669189453,
|
|
"epoch": 0.6462781304096942,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004968062989882803,
|
|
"loss": 6.3446,
|
|
"mean_token_accuracy": 0.15832698345184326,
|
|
"num_tokens": 14181980.0,
|
|
"step": 5600
|
|
},
|
|
{
|
|
"entropy": 6.470687961578369,
|
|
"epoch": 0.6468551644547028,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004967993673953003,
|
|
"loss": 6.2859,
|
|
"mean_token_accuracy": 0.16663094758987426,
|
|
"num_tokens": 14195456.0,
|
|
"step": 5605
|
|
},
|
|
{
|
|
"entropy": 6.371501111984253,
|
|
"epoch": 0.6474321984997115,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004967924283422087,
|
|
"loss": 6.1873,
|
|
"mean_token_accuracy": 0.1712810918688774,
|
|
"num_tokens": 14208269.0,
|
|
"step": 5610
|
|
},
|
|
{
|
|
"entropy": 6.420989894866944,
|
|
"epoch": 0.6480092325447201,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.000496785481829239,
|
|
"loss": 6.302,
|
|
"mean_token_accuracy": 0.16031478866934776,
|
|
"num_tokens": 14221474.0,
|
|
"step": 5615
|
|
},
|
|
{
|
|
"entropy": 6.473630666732788,
|
|
"epoch": 0.6485862665897288,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004967785278566245,
|
|
"loss": 6.2696,
|
|
"mean_token_accuracy": 0.16501279324293136,
|
|
"num_tokens": 14234185.0,
|
|
"step": 5620
|
|
},
|
|
{
|
|
"entropy": 6.3897919178009035,
|
|
"epoch": 0.6491633006347375,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004967715664245997,
|
|
"loss": 6.238,
|
|
"mean_token_accuracy": 0.1660897359251976,
|
|
"num_tokens": 14246853.0,
|
|
"step": 5625
|
|
},
|
|
{
|
|
"entropy": 6.398458003997803,
|
|
"epoch": 0.6497403346797461,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004967645975333983,
|
|
"loss": 6.3224,
|
|
"mean_token_accuracy": 0.16524122506380082,
|
|
"num_tokens": 14260047.0,
|
|
"step": 5630
|
|
},
|
|
{
|
|
"entropy": 6.4040333271026615,
|
|
"epoch": 0.6503173687247548,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004967576211832548,
|
|
"loss": 6.1934,
|
|
"mean_token_accuracy": 0.1748912051320076,
|
|
"num_tokens": 14273478.0,
|
|
"step": 5635
|
|
},
|
|
{
|
|
"entropy": 6.471810722351075,
|
|
"epoch": 0.6508944027697634,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004967506373744039,
|
|
"loss": 6.2874,
|
|
"mean_token_accuracy": 0.15878912657499314,
|
|
"num_tokens": 14286085.0,
|
|
"step": 5640
|
|
},
|
|
{
|
|
"entropy": 6.379119968414306,
|
|
"epoch": 0.651471436814772,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004967436461070805,
|
|
"loss": 6.2396,
|
|
"mean_token_accuracy": 0.1718211367726326,
|
|
"num_tokens": 14299472.0,
|
|
"step": 5645
|
|
},
|
|
{
|
|
"entropy": 6.398261547088623,
|
|
"epoch": 0.6520484708597807,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0004967366473815196,
|
|
"loss": 6.2043,
|
|
"mean_token_accuracy": 0.16658677011728287,
|
|
"num_tokens": 14312624.0,
|
|
"step": 5650
|
|
},
|
|
{
|
|
"entropy": 6.396186256408692,
|
|
"epoch": 0.6526255049047894,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004967296411979568,
|
|
"loss": 6.1951,
|
|
"mean_token_accuracy": 0.17445577383041383,
|
|
"num_tokens": 14325418.0,
|
|
"step": 5655
|
|
},
|
|
{
|
|
"entropy": 6.32066240310669,
|
|
"epoch": 0.6532025389497981,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004967226275566275,
|
|
"loss": 6.239,
|
|
"mean_token_accuracy": 0.166211299598217,
|
|
"num_tokens": 14337360.0,
|
|
"step": 5660
|
|
},
|
|
{
|
|
"entropy": 6.44496717453003,
|
|
"epoch": 0.6537795729948067,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.000496715606457768,
|
|
"loss": 6.222,
|
|
"mean_token_accuracy": 0.16578047275543212,
|
|
"num_tokens": 14349119.0,
|
|
"step": 5665
|
|
},
|
|
{
|
|
"entropy": 6.448485326766968,
|
|
"epoch": 0.6543566070398154,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004967085779016142,
|
|
"loss": 6.2683,
|
|
"mean_token_accuracy": 0.17126621007919313,
|
|
"num_tokens": 14361760.0,
|
|
"step": 5670
|
|
},
|
|
{
|
|
"entropy": 6.330710077285767,
|
|
"epoch": 0.654933641084824,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004967015418884022,
|
|
"loss": 6.2345,
|
|
"mean_token_accuracy": 0.16232049018144606,
|
|
"num_tokens": 14374725.0,
|
|
"step": 5675
|
|
},
|
|
{
|
|
"entropy": 6.394761943817139,
|
|
"epoch": 0.6555106751298326,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004966944984183692,
|
|
"loss": 6.1996,
|
|
"mean_token_accuracy": 0.16768215894699096,
|
|
"num_tokens": 14387267.0,
|
|
"step": 5680
|
|
},
|
|
{
|
|
"entropy": 6.432275915145874,
|
|
"epoch": 0.6560877091748413,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004966874474917518,
|
|
"loss": 6.2603,
|
|
"mean_token_accuracy": 0.1640935719013214,
|
|
"num_tokens": 14400531.0,
|
|
"step": 5685
|
|
},
|
|
{
|
|
"entropy": 6.437908411026001,
|
|
"epoch": 0.65666474321985,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004966803891087873,
|
|
"loss": 6.2716,
|
|
"mean_token_accuracy": 0.15894663482904434,
|
|
"num_tokens": 14412507.0,
|
|
"step": 5690
|
|
},
|
|
{
|
|
"entropy": 6.434341669082642,
|
|
"epoch": 0.6572417772648587,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.000496673323269713,
|
|
"loss": 6.2589,
|
|
"mean_token_accuracy": 0.16347626149654387,
|
|
"num_tokens": 14424934.0,
|
|
"step": 5695
|
|
},
|
|
{
|
|
"entropy": 6.457496786117554,
|
|
"epoch": 0.6578188113098673,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004966662499747666,
|
|
"loss": 6.3639,
|
|
"mean_token_accuracy": 0.15038072019815446,
|
|
"num_tokens": 14438875.0,
|
|
"step": 5700
|
|
},
|
|
{
|
|
"entropy": 6.40140323638916,
|
|
"epoch": 0.6583958453548759,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004966591692241859,
|
|
"loss": 6.1693,
|
|
"mean_token_accuracy": 0.1677701637148857,
|
|
"num_tokens": 14451089.0,
|
|
"step": 5705
|
|
},
|
|
{
|
|
"entropy": 6.424305438995361,
|
|
"epoch": 0.6589728793998846,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004966520810182092,
|
|
"loss": 6.2889,
|
|
"mean_token_accuracy": 0.1674267664551735,
|
|
"num_tokens": 14463557.0,
|
|
"step": 5710
|
|
},
|
|
{
|
|
"entropy": 6.356392765045166,
|
|
"epoch": 0.6595499134448932,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004966449853570749,
|
|
"loss": 6.1922,
|
|
"mean_token_accuracy": 0.1630517616868019,
|
|
"num_tokens": 14475865.0,
|
|
"step": 5715
|
|
},
|
|
{
|
|
"entropy": 6.433615684509277,
|
|
"epoch": 0.6601269474899019,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004966378822410215,
|
|
"loss": 6.2999,
|
|
"mean_token_accuracy": 0.16027793437242507,
|
|
"num_tokens": 14487534.0,
|
|
"step": 5720
|
|
},
|
|
{
|
|
"entropy": 6.4160982131958,
|
|
"epoch": 0.6607039815349106,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004966307716702881,
|
|
"loss": 6.2466,
|
|
"mean_token_accuracy": 0.1649463638663292,
|
|
"num_tokens": 14500006.0,
|
|
"step": 5725
|
|
},
|
|
{
|
|
"entropy": 6.478086137771607,
|
|
"epoch": 0.6612810155799193,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004966236536451138,
|
|
"loss": 6.3556,
|
|
"mean_token_accuracy": 0.15748382806777955,
|
|
"num_tokens": 14512844.0,
|
|
"step": 5730
|
|
},
|
|
{
|
|
"entropy": 6.474676275253296,
|
|
"epoch": 0.6618580496249279,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.000496616528165738,
|
|
"loss": 6.3073,
|
|
"mean_token_accuracy": 0.15954205095767976,
|
|
"num_tokens": 14525555.0,
|
|
"step": 5735
|
|
},
|
|
{
|
|
"entropy": 6.387700939178467,
|
|
"epoch": 0.6624350836699365,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004966093952324003,
|
|
"loss": 6.2908,
|
|
"mean_token_accuracy": 0.15595891401171685,
|
|
"num_tokens": 14537861.0,
|
|
"step": 5740
|
|
},
|
|
{
|
|
"entropy": 6.43832688331604,
|
|
"epoch": 0.6630121177149452,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004966022548453406,
|
|
"loss": 6.254,
|
|
"mean_token_accuracy": 0.16284551173448564,
|
|
"num_tokens": 14550116.0,
|
|
"step": 5745
|
|
},
|
|
{
|
|
"entropy": 6.444856739044189,
|
|
"epoch": 0.6635891517599538,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004965951070047993,
|
|
"loss": 6.2261,
|
|
"mean_token_accuracy": 0.16848643720149994,
|
|
"num_tokens": 14561841.0,
|
|
"step": 5750
|
|
},
|
|
{
|
|
"entropy": 6.411498022079468,
|
|
"epoch": 0.6641661858049625,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004965879517110166,
|
|
"loss": 6.2768,
|
|
"mean_token_accuracy": 0.16119781583547593,
|
|
"num_tokens": 14574889.0,
|
|
"step": 5755
|
|
},
|
|
{
|
|
"entropy": 6.336085510253906,
|
|
"epoch": 0.6647432198499712,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004965807889642333,
|
|
"loss": 6.2622,
|
|
"mean_token_accuracy": 0.16737145632505418,
|
|
"num_tokens": 14587032.0,
|
|
"step": 5760
|
|
},
|
|
{
|
|
"entropy": 6.412449836730957,
|
|
"epoch": 0.6653202538949798,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.00049657361876469,
|
|
"loss": 6.2303,
|
|
"mean_token_accuracy": 0.16632368713617324,
|
|
"num_tokens": 14599654.0,
|
|
"step": 5765
|
|
},
|
|
{
|
|
"entropy": 6.332269334793091,
|
|
"epoch": 0.6658972879399885,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004965664411126282,
|
|
"loss": 6.1506,
|
|
"mean_token_accuracy": 0.17118496000766753,
|
|
"num_tokens": 14611740.0,
|
|
"step": 5770
|
|
},
|
|
{
|
|
"entropy": 6.410775899887085,
|
|
"epoch": 0.6664743219849971,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.0004965592560082894,
|
|
"loss": 6.2481,
|
|
"mean_token_accuracy": 0.16527822315692903,
|
|
"num_tokens": 14625038.0,
|
|
"step": 5775
|
|
},
|
|
{
|
|
"entropy": 6.458446931838989,
|
|
"epoch": 0.6670513560300058,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004965520634519149,
|
|
"loss": 6.3134,
|
|
"mean_token_accuracy": 0.15978550016880036,
|
|
"num_tokens": 14638318.0,
|
|
"step": 5780
|
|
},
|
|
{
|
|
"entropy": 6.399044179916382,
|
|
"epoch": 0.6676283900750144,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004965448634437468,
|
|
"loss": 6.2815,
|
|
"mean_token_accuracy": 0.15635018050670624,
|
|
"num_tokens": 14651519.0,
|
|
"step": 5785
|
|
},
|
|
{
|
|
"entropy": 6.4846090316772464,
|
|
"epoch": 0.668205424120023,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004965376559840272,
|
|
"loss": 6.2521,
|
|
"mean_token_accuracy": 0.16233301162719727,
|
|
"num_tokens": 14662994.0,
|
|
"step": 5790
|
|
},
|
|
{
|
|
"entropy": 6.413419342041015,
|
|
"epoch": 0.6687824581650318,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004965304410729986,
|
|
"loss": 6.2138,
|
|
"mean_token_accuracy": 0.169295796751976,
|
|
"num_tokens": 14675488.0,
|
|
"step": 5795
|
|
},
|
|
{
|
|
"entropy": 6.341550636291504,
|
|
"epoch": 0.6693594922100404,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004965232187109037,
|
|
"loss": 6.1536,
|
|
"mean_token_accuracy": 0.1739507034420967,
|
|
"num_tokens": 14688512.0,
|
|
"step": 5800
|
|
},
|
|
{
|
|
"entropy": 6.425643396377564,
|
|
"epoch": 0.6699365262550491,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004965159888979854,
|
|
"loss": 6.2133,
|
|
"mean_token_accuracy": 0.1665024146437645,
|
|
"num_tokens": 14700740.0,
|
|
"step": 5805
|
|
},
|
|
{
|
|
"entropy": 6.373208665847779,
|
|
"epoch": 0.6705135603000577,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004965087516344869,
|
|
"loss": 6.2559,
|
|
"mean_token_accuracy": 0.16404303461313247,
|
|
"num_tokens": 14713769.0,
|
|
"step": 5810
|
|
},
|
|
{
|
|
"entropy": 6.37481460571289,
|
|
"epoch": 0.6710905943450663,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004965015069206515,
|
|
"loss": 6.1449,
|
|
"mean_token_accuracy": 0.17123078256845475,
|
|
"num_tokens": 14725710.0,
|
|
"step": 5815
|
|
},
|
|
{
|
|
"entropy": 6.382030820846557,
|
|
"epoch": 0.671667628390075,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.000496494254756723,
|
|
"loss": 6.1415,
|
|
"mean_token_accuracy": 0.17618792951107026,
|
|
"num_tokens": 14738504.0,
|
|
"step": 5820
|
|
},
|
|
{
|
|
"entropy": 6.413110065460205,
|
|
"epoch": 0.6722446624350836,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004964869951429451,
|
|
"loss": 6.2643,
|
|
"mean_token_accuracy": 0.16108937114477156,
|
|
"num_tokens": 14750344.0,
|
|
"step": 5825
|
|
},
|
|
{
|
|
"entropy": 6.433046150207519,
|
|
"epoch": 0.6728216964800924,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004964797280795622,
|
|
"loss": 6.3041,
|
|
"mean_token_accuracy": 0.16477554887533188,
|
|
"num_tokens": 14764316.0,
|
|
"step": 5830
|
|
},
|
|
{
|
|
"entropy": 6.371626186370849,
|
|
"epoch": 0.673398730525101,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004964724535668188,
|
|
"loss": 6.2249,
|
|
"mean_token_accuracy": 0.1627054274082184,
|
|
"num_tokens": 14776404.0,
|
|
"step": 5835
|
|
},
|
|
{
|
|
"entropy": 6.490979194641113,
|
|
"epoch": 0.6739757645701097,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004964651716049593,
|
|
"loss": 6.2583,
|
|
"mean_token_accuracy": 0.16423558443784714,
|
|
"num_tokens": 14788843.0,
|
|
"step": 5840
|
|
},
|
|
{
|
|
"entropy": 6.37471375465393,
|
|
"epoch": 0.6745527986151183,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004964578821942288,
|
|
"loss": 6.1898,
|
|
"mean_token_accuracy": 0.1714974358677864,
|
|
"num_tokens": 14802662.0,
|
|
"step": 5845
|
|
},
|
|
{
|
|
"entropy": 6.375233840942383,
|
|
"epoch": 0.6751298326601269,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004964505853348724,
|
|
"loss": 6.2682,
|
|
"mean_token_accuracy": 0.1575095996260643,
|
|
"num_tokens": 14814354.0,
|
|
"step": 5850
|
|
},
|
|
{
|
|
"entropy": 6.404491424560547,
|
|
"epoch": 0.6757068667051356,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004964432810271356,
|
|
"loss": 6.169,
|
|
"mean_token_accuracy": 0.17374546974897384,
|
|
"num_tokens": 14826404.0,
|
|
"step": 5855
|
|
},
|
|
{
|
|
"entropy": 6.397090053558349,
|
|
"epoch": 0.6762839007501442,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0004964359692712641,
|
|
"loss": 6.2305,
|
|
"mean_token_accuracy": 0.16469545364379884,
|
|
"num_tokens": 14840046.0,
|
|
"step": 5860
|
|
},
|
|
{
|
|
"entropy": 6.359001588821411,
|
|
"epoch": 0.676860934795153,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004964286500675037,
|
|
"loss": 6.2521,
|
|
"mean_token_accuracy": 0.15627662539482118,
|
|
"num_tokens": 14853566.0,
|
|
"step": 5865
|
|
},
|
|
{
|
|
"entropy": 6.397631883621216,
|
|
"epoch": 0.6774379688401616,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004964213234161007,
|
|
"loss": 6.1925,
|
|
"mean_token_accuracy": 0.16885973513126373,
|
|
"num_tokens": 14866538.0,
|
|
"step": 5870
|
|
},
|
|
{
|
|
"entropy": 6.3361509323120115,
|
|
"epoch": 0.6780150028851702,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004964139893173014,
|
|
"loss": 6.1521,
|
|
"mean_token_accuracy": 0.17438876032829284,
|
|
"num_tokens": 14879237.0,
|
|
"step": 5875
|
|
},
|
|
{
|
|
"entropy": 6.442409992218018,
|
|
"epoch": 0.6785920369301789,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004964066477713525,
|
|
"loss": 6.2748,
|
|
"mean_token_accuracy": 0.1616318017244339,
|
|
"num_tokens": 14891295.0,
|
|
"step": 5880
|
|
},
|
|
{
|
|
"entropy": 6.412937259674072,
|
|
"epoch": 0.6791690709751875,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004963992987785011,
|
|
"loss": 6.2673,
|
|
"mean_token_accuracy": 0.16440023183822633,
|
|
"num_tokens": 14902927.0,
|
|
"step": 5885
|
|
},
|
|
{
|
|
"entropy": 6.350733757019043,
|
|
"epoch": 0.6797461050201962,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004963919423389942,
|
|
"loss": 6.2349,
|
|
"mean_token_accuracy": 0.16148411780595778,
|
|
"num_tokens": 14915203.0,
|
|
"step": 5890
|
|
},
|
|
{
|
|
"entropy": 6.369336748123169,
|
|
"epoch": 0.6803231390652048,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004963845784530794,
|
|
"loss": 6.099,
|
|
"mean_token_accuracy": 0.17276938557624816,
|
|
"num_tokens": 14927428.0,
|
|
"step": 5895
|
|
},
|
|
{
|
|
"entropy": 6.338372755050659,
|
|
"epoch": 0.6809001731102136,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.000496377207121004,
|
|
"loss": 6.2514,
|
|
"mean_token_accuracy": 0.16943022161722182,
|
|
"num_tokens": 14939979.0,
|
|
"step": 5900
|
|
},
|
|
{
|
|
"entropy": 6.460256767272949,
|
|
"epoch": 0.6814772071552222,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004963698283430164,
|
|
"loss": 6.2375,
|
|
"mean_token_accuracy": 0.1650419846177101,
|
|
"num_tokens": 14952292.0,
|
|
"step": 5905
|
|
},
|
|
{
|
|
"entropy": 6.392317628860473,
|
|
"epoch": 0.6820542412002308,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004963624421193646,
|
|
"loss": 6.2536,
|
|
"mean_token_accuracy": 0.15970679968595505,
|
|
"num_tokens": 14964942.0,
|
|
"step": 5910
|
|
},
|
|
{
|
|
"entropy": 6.431348752975464,
|
|
"epoch": 0.6826312752452395,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.000496355048450297,
|
|
"loss": 6.3675,
|
|
"mean_token_accuracy": 0.15923905968666077,
|
|
"num_tokens": 14979196.0,
|
|
"step": 5915
|
|
},
|
|
{
|
|
"entropy": 6.4473936557769775,
|
|
"epoch": 0.6832083092902481,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004963476473360623,
|
|
"loss": 6.2204,
|
|
"mean_token_accuracy": 0.16636578887701034,
|
|
"num_tokens": 14991162.0,
|
|
"step": 5920
|
|
},
|
|
{
|
|
"entropy": 6.332076978683472,
|
|
"epoch": 0.6837853433352568,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004963402387769094,
|
|
"loss": 6.2417,
|
|
"mean_token_accuracy": 0.16846334040164948,
|
|
"num_tokens": 15003207.0,
|
|
"step": 5925
|
|
},
|
|
{
|
|
"entropy": 6.35644760131836,
|
|
"epoch": 0.6843623773802654,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004963328227730876,
|
|
"loss": 6.2604,
|
|
"mean_token_accuracy": 0.1596489131450653,
|
|
"num_tokens": 15016633.0,
|
|
"step": 5930
|
|
},
|
|
{
|
|
"entropy": 6.392962121963501,
|
|
"epoch": 0.684939411425274,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004963253993248461,
|
|
"loss": 6.198,
|
|
"mean_token_accuracy": 0.17046815901994705,
|
|
"num_tokens": 15029256.0,
|
|
"step": 5935
|
|
},
|
|
{
|
|
"entropy": 6.344196081161499,
|
|
"epoch": 0.6855164454702828,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004963179684324349,
|
|
"loss": 6.1649,
|
|
"mean_token_accuracy": 0.17169316112995148,
|
|
"num_tokens": 15041162.0,
|
|
"step": 5940
|
|
},
|
|
{
|
|
"entropy": 6.346894645690918,
|
|
"epoch": 0.6860934795152914,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004963105300961036,
|
|
"loss": 6.2151,
|
|
"mean_token_accuracy": 0.17179548889398574,
|
|
"num_tokens": 15054122.0,
|
|
"step": 5945
|
|
},
|
|
{
|
|
"entropy": 6.368085193634033,
|
|
"epoch": 0.6866705135603001,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004963030843161026,
|
|
"loss": 6.2176,
|
|
"mean_token_accuracy": 0.1642700269818306,
|
|
"num_tokens": 15066123.0,
|
|
"step": 5950
|
|
},
|
|
{
|
|
"entropy": 6.261136484146118,
|
|
"epoch": 0.6872475476053087,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004962956310926823,
|
|
"loss": 6.1427,
|
|
"mean_token_accuracy": 0.1735681861639023,
|
|
"num_tokens": 15078192.0,
|
|
"step": 5955
|
|
},
|
|
{
|
|
"entropy": 6.413783311843872,
|
|
"epoch": 0.6878245816503173,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004962881704260934,
|
|
"loss": 6.1818,
|
|
"mean_token_accuracy": 0.1730615571141243,
|
|
"num_tokens": 15090227.0,
|
|
"step": 5960
|
|
},
|
|
{
|
|
"entropy": 6.358871221542358,
|
|
"epoch": 0.688401615695326,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004962807023165868,
|
|
"loss": 6.3066,
|
|
"mean_token_accuracy": 0.1696085214614868,
|
|
"num_tokens": 15104093.0,
|
|
"step": 5965
|
|
},
|
|
{
|
|
"entropy": 6.3496081829071045,
|
|
"epoch": 0.6889786497403346,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004962732267644138,
|
|
"loss": 6.2006,
|
|
"mean_token_accuracy": 0.16877583116292955,
|
|
"num_tokens": 15118064.0,
|
|
"step": 5970
|
|
},
|
|
{
|
|
"entropy": 6.392092323303222,
|
|
"epoch": 0.6895556837853434,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004962657437698254,
|
|
"loss": 6.0972,
|
|
"mean_token_accuracy": 0.17405418753623964,
|
|
"num_tokens": 15131686.0,
|
|
"step": 5975
|
|
},
|
|
{
|
|
"entropy": 6.378844308853149,
|
|
"epoch": 0.690132717830352,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004962582533330739,
|
|
"loss": 6.2949,
|
|
"mean_token_accuracy": 0.15710055381059645,
|
|
"num_tokens": 15143920.0,
|
|
"step": 5980
|
|
},
|
|
{
|
|
"entropy": 6.44266266822815,
|
|
"epoch": 0.6907097518753607,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004962507554544109,
|
|
"loss": 6.2552,
|
|
"mean_token_accuracy": 0.16559473276138306,
|
|
"num_tokens": 15156989.0,
|
|
"step": 5985
|
|
},
|
|
{
|
|
"entropy": 6.503173542022705,
|
|
"epoch": 0.6912867859203693,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004962432501340886,
|
|
"loss": 6.3219,
|
|
"mean_token_accuracy": 0.15267299860715866,
|
|
"num_tokens": 15169068.0,
|
|
"step": 5990
|
|
},
|
|
{
|
|
"entropy": 6.377065753936767,
|
|
"epoch": 0.6918638199653779,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004962357373723596,
|
|
"loss": 6.2871,
|
|
"mean_token_accuracy": 0.16362386345863342,
|
|
"num_tokens": 15182081.0,
|
|
"step": 5995
|
|
},
|
|
{
|
|
"entropy": 6.492167615890503,
|
|
"epoch": 0.6924408540103866,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004962282171694763,
|
|
"loss": 6.2605,
|
|
"mean_token_accuracy": 0.16491686552762985,
|
|
"num_tokens": 15194474.0,
|
|
"step": 6000
|
|
},
|
|
{
|
|
"epoch": 0.6924408540103866,
|
|
"eval_entropy": 6.244893937006504,
|
|
"eval_loss": 6.277975559234619,
|
|
"eval_mean_token_accuracy": 0.16690639868687931,
|
|
"eval_num_tokens": 15194474.0,
|
|
"eval_runtime": 17.4205,
|
|
"eval_samples_per_second": 1615.111,
|
|
"eval_steps_per_second": 201.889,
|
|
"step": 6000
|
|
},
|
|
{
|
|
"entropy": 6.419049692153931,
|
|
"epoch": 0.6930178880553952,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004962206895256919,
|
|
"loss": 6.2318,
|
|
"mean_token_accuracy": 0.16573894619941712,
|
|
"num_tokens": 15206371.0,
|
|
"step": 6005
|
|
},
|
|
{
|
|
"entropy": 6.34908356666565,
|
|
"epoch": 0.693594922100404,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004962131544412595,
|
|
"loss": 6.2544,
|
|
"mean_token_accuracy": 0.16422042697668077,
|
|
"num_tokens": 15218913.0,
|
|
"step": 6010
|
|
},
|
|
{
|
|
"entropy": 6.471472215652466,
|
|
"epoch": 0.6941719561454126,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004962056119164325,
|
|
"loss": 6.2344,
|
|
"mean_token_accuracy": 0.1708833560347557,
|
|
"num_tokens": 15231647.0,
|
|
"step": 6015
|
|
},
|
|
{
|
|
"entropy": 6.392230892181397,
|
|
"epoch": 0.6947489901904212,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004961980619514646,
|
|
"loss": 6.2363,
|
|
"mean_token_accuracy": 0.16547508537769318,
|
|
"num_tokens": 15243764.0,
|
|
"step": 6020
|
|
},
|
|
{
|
|
"entropy": 6.415359783172607,
|
|
"epoch": 0.6953260242354299,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004961905045466098,
|
|
"loss": 6.2948,
|
|
"mean_token_accuracy": 0.15680457055568695,
|
|
"num_tokens": 15256165.0,
|
|
"step": 6025
|
|
},
|
|
{
|
|
"entropy": 6.357501459121704,
|
|
"epoch": 0.6959030582804385,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004961829397021222,
|
|
"loss": 6.169,
|
|
"mean_token_accuracy": 0.16878628879785537,
|
|
"num_tokens": 15269169.0,
|
|
"step": 6030
|
|
},
|
|
{
|
|
"entropy": 6.377862071990966,
|
|
"epoch": 0.6964800923254472,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0004961753674182564,
|
|
"loss": 6.2119,
|
|
"mean_token_accuracy": 0.16564356088638305,
|
|
"num_tokens": 15281530.0,
|
|
"step": 6035
|
|
},
|
|
{
|
|
"entropy": 6.375745582580566,
|
|
"epoch": 0.6970571263704558,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004961677876952669,
|
|
"loss": 6.1756,
|
|
"mean_token_accuracy": 0.16821483224630357,
|
|
"num_tokens": 15295578.0,
|
|
"step": 6040
|
|
},
|
|
{
|
|
"entropy": 6.376891565322876,
|
|
"epoch": 0.6976341604154646,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004961602005334087,
|
|
"loss": 6.2514,
|
|
"mean_token_accuracy": 0.16718253195285798,
|
|
"num_tokens": 15308258.0,
|
|
"step": 6045
|
|
},
|
|
{
|
|
"entropy": 6.4180299758911135,
|
|
"epoch": 0.6982111944604732,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.000496152605932937,
|
|
"loss": 6.2718,
|
|
"mean_token_accuracy": 0.1603887066245079,
|
|
"num_tokens": 15320370.0,
|
|
"step": 6050
|
|
},
|
|
{
|
|
"entropy": 6.440406322479248,
|
|
"epoch": 0.6987882285054818,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004961450038941074,
|
|
"loss": 6.2492,
|
|
"mean_token_accuracy": 0.16523093432188035,
|
|
"num_tokens": 15332350.0,
|
|
"step": 6055
|
|
},
|
|
{
|
|
"entropy": 6.333216190338135,
|
|
"epoch": 0.6993652625504905,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004961373944171754,
|
|
"loss": 6.1742,
|
|
"mean_token_accuracy": 0.1691560611128807,
|
|
"num_tokens": 15343424.0,
|
|
"step": 6060
|
|
},
|
|
{
|
|
"entropy": 6.359563398361206,
|
|
"epoch": 0.6999422965954991,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004961297775023968,
|
|
"loss": 6.1927,
|
|
"mean_token_accuracy": 0.1697380304336548,
|
|
"num_tokens": 15356126.0,
|
|
"step": 6065
|
|
},
|
|
{
|
|
"entropy": 6.346981000900269,
|
|
"epoch": 0.7005193306405078,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.000496122153150028,
|
|
"loss": 6.0971,
|
|
"mean_token_accuracy": 0.17148021459579468,
|
|
"num_tokens": 15369253.0,
|
|
"step": 6070
|
|
},
|
|
{
|
|
"entropy": 6.4445713520050045,
|
|
"epoch": 0.7010963646855164,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004961145213603255,
|
|
"loss": 6.2621,
|
|
"mean_token_accuracy": 0.16077155470848084,
|
|
"num_tokens": 15382679.0,
|
|
"step": 6075
|
|
},
|
|
{
|
|
"entropy": 6.3669038772583,
|
|
"epoch": 0.7016733987305251,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 0.000496106882133546,
|
|
"loss": 6.276,
|
|
"mean_token_accuracy": 0.1646697610616684,
|
|
"num_tokens": 15396052.0,
|
|
"step": 6080
|
|
},
|
|
{
|
|
"entropy": 6.421784114837647,
|
|
"epoch": 0.7022504327755338,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004960992354699463,
|
|
"loss": 6.2941,
|
|
"mean_token_accuracy": 0.15852054804563523,
|
|
"num_tokens": 15409249.0,
|
|
"step": 6085
|
|
},
|
|
{
|
|
"entropy": 6.455357551574707,
|
|
"epoch": 0.7028274668205424,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004960915813697836,
|
|
"loss": 6.1779,
|
|
"mean_token_accuracy": 0.16108503490686416,
|
|
"num_tokens": 15421060.0,
|
|
"step": 6090
|
|
},
|
|
{
|
|
"entropy": 6.378384447097778,
|
|
"epoch": 0.7034045008655511,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0004960839198333154,
|
|
"loss": 6.2629,
|
|
"mean_token_accuracy": 0.16128408163785934,
|
|
"num_tokens": 15433083.0,
|
|
"step": 6095
|
|
},
|
|
{
|
|
"entropy": 6.3820489883422855,
|
|
"epoch": 0.7039815349105597,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004960762508607994,
|
|
"loss": 6.08,
|
|
"mean_token_accuracy": 0.17403190284967424,
|
|
"num_tokens": 15446664.0,
|
|
"step": 6100
|
|
},
|
|
{
|
|
"entropy": 6.398230504989624,
|
|
"epoch": 0.7045585689555683,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004960685744524934,
|
|
"loss": 6.243,
|
|
"mean_token_accuracy": 0.1608691543340683,
|
|
"num_tokens": 15458609.0,
|
|
"step": 6105
|
|
},
|
|
{
|
|
"entropy": 6.359479999542236,
|
|
"epoch": 0.705135603000577,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004960608906086558,
|
|
"loss": 6.144,
|
|
"mean_token_accuracy": 0.17022748589515685,
|
|
"num_tokens": 15470091.0,
|
|
"step": 6110
|
|
},
|
|
{
|
|
"entropy": 6.411485767364502,
|
|
"epoch": 0.7057126370455857,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.000496053199329545,
|
|
"loss": 6.2529,
|
|
"mean_token_accuracy": 0.16091013103723525,
|
|
"num_tokens": 15483557.0,
|
|
"step": 6115
|
|
},
|
|
{
|
|
"entropy": 6.395710134506226,
|
|
"epoch": 0.7062896710905944,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004960455006154196,
|
|
"loss": 6.211,
|
|
"mean_token_accuracy": 0.16187724471092224,
|
|
"num_tokens": 15497437.0,
|
|
"step": 6120
|
|
},
|
|
{
|
|
"entropy": 6.403597688674926,
|
|
"epoch": 0.706866705135603,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004960377944665386,
|
|
"loss": 6.2439,
|
|
"mean_token_accuracy": 0.16568287909030915,
|
|
"num_tokens": 15509942.0,
|
|
"step": 6125
|
|
},
|
|
{
|
|
"entropy": 6.3745523452758786,
|
|
"epoch": 0.7074437391806117,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004960300808831611,
|
|
"loss": 6.194,
|
|
"mean_token_accuracy": 0.17037154287099837,
|
|
"num_tokens": 15522866.0,
|
|
"step": 6130
|
|
},
|
|
{
|
|
"entropy": 6.407792663574218,
|
|
"epoch": 0.7080207732256203,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004960223598655467,
|
|
"loss": 6.1858,
|
|
"mean_token_accuracy": 0.1648655503988266,
|
|
"num_tokens": 15534731.0,
|
|
"step": 6135
|
|
},
|
|
{
|
|
"entropy": 6.34327073097229,
|
|
"epoch": 0.7085978072706289,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.000496014631413955,
|
|
"loss": 6.223,
|
|
"mean_token_accuracy": 0.16448917090892792,
|
|
"num_tokens": 15546401.0,
|
|
"step": 6140
|
|
},
|
|
{
|
|
"entropy": 6.450383615493775,
|
|
"epoch": 0.7091748413156376,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004960068955286459,
|
|
"loss": 6.2292,
|
|
"mean_token_accuracy": 0.16138217896223067,
|
|
"num_tokens": 15559532.0,
|
|
"step": 6145
|
|
},
|
|
{
|
|
"entropy": 6.38635630607605,
|
|
"epoch": 0.7097518753606463,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004959991522098797,
|
|
"loss": 6.1771,
|
|
"mean_token_accuracy": 0.1652152955532074,
|
|
"num_tokens": 15572426.0,
|
|
"step": 6150
|
|
},
|
|
{
|
|
"entropy": 6.419304513931275,
|
|
"epoch": 0.710328909405655,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004959914014579168,
|
|
"loss": 6.2391,
|
|
"mean_token_accuracy": 0.162534636259079,
|
|
"num_tokens": 15584422.0,
|
|
"step": 6155
|
|
},
|
|
{
|
|
"entropy": 6.413751649856567,
|
|
"epoch": 0.7109059434506636,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004959836432730178,
|
|
"loss": 6.231,
|
|
"mean_token_accuracy": 0.16499146223068237,
|
|
"num_tokens": 15595538.0,
|
|
"step": 6160
|
|
},
|
|
{
|
|
"entropy": 6.337444114685058,
|
|
"epoch": 0.7114829774956722,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004959758776554438,
|
|
"loss": 6.1783,
|
|
"mean_token_accuracy": 0.17357258945703508,
|
|
"num_tokens": 15608315.0,
|
|
"step": 6165
|
|
},
|
|
{
|
|
"entropy": 6.39624662399292,
|
|
"epoch": 0.7120600115406809,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.000495968104605456,
|
|
"loss": 6.2659,
|
|
"mean_token_accuracy": 0.16520965546369554,
|
|
"num_tokens": 15620181.0,
|
|
"step": 6170
|
|
},
|
|
{
|
|
"entropy": 6.34517502784729,
|
|
"epoch": 0.7126370455856895,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004959603241233157,
|
|
"loss": 6.1166,
|
|
"mean_token_accuracy": 0.16953941881656648,
|
|
"num_tokens": 15632100.0,
|
|
"step": 6175
|
|
},
|
|
{
|
|
"entropy": 6.311384630203247,
|
|
"epoch": 0.7132140796306982,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004959525362092846,
|
|
"loss": 6.1495,
|
|
"mean_token_accuracy": 0.16864179223775863,
|
|
"num_tokens": 15644185.0,
|
|
"step": 6180
|
|
},
|
|
{
|
|
"entropy": 6.354869842529297,
|
|
"epoch": 0.7137911136757069,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004959447408636247,
|
|
"loss": 6.1944,
|
|
"mean_token_accuracy": 0.1726676657795906,
|
|
"num_tokens": 15657761.0,
|
|
"step": 6185
|
|
},
|
|
{
|
|
"entropy": 6.350826025009155,
|
|
"epoch": 0.7143681477207156,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004959369380865983,
|
|
"loss": 6.2315,
|
|
"mean_token_accuracy": 0.15910745710134505,
|
|
"num_tokens": 15671135.0,
|
|
"step": 6190
|
|
},
|
|
{
|
|
"entropy": 6.378980588912964,
|
|
"epoch": 0.7149451817657242,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004959291278784676,
|
|
"loss": 6.1955,
|
|
"mean_token_accuracy": 0.15981043577194215,
|
|
"num_tokens": 15683286.0,
|
|
"step": 6195
|
|
},
|
|
{
|
|
"entropy": 6.351711416244507,
|
|
"epoch": 0.7155222158107328,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004959213102394954,
|
|
"loss": 6.1165,
|
|
"mean_token_accuracy": 0.1762665629386902,
|
|
"num_tokens": 15697535.0,
|
|
"step": 6200
|
|
},
|
|
{
|
|
"entropy": 6.344398021697998,
|
|
"epoch": 0.7160992498557415,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004959134851699449,
|
|
"loss": 6.2067,
|
|
"mean_token_accuracy": 0.16598029881715776,
|
|
"num_tokens": 15708748.0,
|
|
"step": 6205
|
|
},
|
|
{
|
|
"entropy": 6.413574361801148,
|
|
"epoch": 0.7166762839007501,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004959056526700788,
|
|
"loss": 6.1852,
|
|
"mean_token_accuracy": 0.16717519015073776,
|
|
"num_tokens": 15721720.0,
|
|
"step": 6210
|
|
},
|
|
{
|
|
"entropy": 6.368403530120849,
|
|
"epoch": 0.7172533179457588,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004958978127401609,
|
|
"loss": 6.1315,
|
|
"mean_token_accuracy": 0.17073239833116532,
|
|
"num_tokens": 15734854.0,
|
|
"step": 6215
|
|
},
|
|
{
|
|
"entropy": 6.339862442016601,
|
|
"epoch": 0.7178303519907675,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004958899653804548,
|
|
"loss": 6.1926,
|
|
"mean_token_accuracy": 0.16976216584444045,
|
|
"num_tokens": 15747575.0,
|
|
"step": 6220
|
|
},
|
|
{
|
|
"entropy": 6.308337545394897,
|
|
"epoch": 0.7184073860357761,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004958821105912246,
|
|
"loss": 6.2057,
|
|
"mean_token_accuracy": 0.16995695233345032,
|
|
"num_tokens": 15760917.0,
|
|
"step": 6225
|
|
},
|
|
{
|
|
"entropy": 6.464078569412232,
|
|
"epoch": 0.7189844200807848,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.000495874248372734,
|
|
"loss": 6.279,
|
|
"mean_token_accuracy": 0.15709616243839264,
|
|
"num_tokens": 15774045.0,
|
|
"step": 6230
|
|
},
|
|
{
|
|
"entropy": 6.406183242797852,
|
|
"epoch": 0.7195614541257934,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.000495866378725248,
|
|
"loss": 6.1858,
|
|
"mean_token_accuracy": 0.1691389873623848,
|
|
"num_tokens": 15786006.0,
|
|
"step": 6235
|
|
},
|
|
{
|
|
"entropy": 6.314851379394531,
|
|
"epoch": 0.7201384881708021,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.000495858501649031,
|
|
"loss": 6.1934,
|
|
"mean_token_accuracy": 0.16714197844266893,
|
|
"num_tokens": 15798078.0,
|
|
"step": 6240
|
|
},
|
|
{
|
|
"entropy": 6.398427200317383,
|
|
"epoch": 0.7207155222158107,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.000495850617144348,
|
|
"loss": 6.1999,
|
|
"mean_token_accuracy": 0.167718106508255,
|
|
"num_tokens": 15810281.0,
|
|
"step": 6245
|
|
},
|
|
{
|
|
"entropy": 6.419170761108399,
|
|
"epoch": 0.7212925562608193,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.0004958427252114643,
|
|
"loss": 6.2836,
|
|
"mean_token_accuracy": 0.1600424215197563,
|
|
"num_tokens": 15822593.0,
|
|
"step": 6250
|
|
},
|
|
{
|
|
"entropy": 6.408493232727051,
|
|
"epoch": 0.7218695903058281,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.000495834825850645,
|
|
"loss": 6.2203,
|
|
"mean_token_accuracy": 0.1696522206068039,
|
|
"num_tokens": 15835181.0,
|
|
"step": 6255
|
|
},
|
|
{
|
|
"entropy": 6.452267456054687,
|
|
"epoch": 0.7224466243508367,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0004958269190621562,
|
|
"loss": 6.2164,
|
|
"mean_token_accuracy": 0.16248857825994492,
|
|
"num_tokens": 15847679.0,
|
|
"step": 6260
|
|
},
|
|
{
|
|
"entropy": 6.379993677139282,
|
|
"epoch": 0.7230236583958454,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004958190048462637,
|
|
"loss": 6.2552,
|
|
"mean_token_accuracy": 0.16551875323057175,
|
|
"num_tokens": 15860209.0,
|
|
"step": 6265
|
|
},
|
|
{
|
|
"entropy": 6.4074663639068605,
|
|
"epoch": 0.723600692440854,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004958110832032336,
|
|
"loss": 6.2241,
|
|
"mean_token_accuracy": 0.1634237140417099,
|
|
"num_tokens": 15873165.0,
|
|
"step": 6270
|
|
},
|
|
{
|
|
"entropy": 6.370559549331665,
|
|
"epoch": 0.7241777264858626,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004958031541333322,
|
|
"loss": 6.2481,
|
|
"mean_token_accuracy": 0.16408838033676149,
|
|
"num_tokens": 15885201.0,
|
|
"step": 6275
|
|
},
|
|
{
|
|
"entropy": 6.477904367446899,
|
|
"epoch": 0.7247547605308713,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004957952176368267,
|
|
"loss": 6.2923,
|
|
"mean_token_accuracy": 0.16007572412490845,
|
|
"num_tokens": 15899071.0,
|
|
"step": 6280
|
|
},
|
|
{
|
|
"entropy": 6.339187717437744,
|
|
"epoch": 0.7253317945758799,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004957872737139836,
|
|
"loss": 6.1956,
|
|
"mean_token_accuracy": 0.16685390919446946,
|
|
"num_tokens": 15912274.0,
|
|
"step": 6285
|
|
},
|
|
{
|
|
"entropy": 6.358347415924072,
|
|
"epoch": 0.7259088286208887,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004957793223650702,
|
|
"loss": 6.1697,
|
|
"mean_token_accuracy": 0.17283968180418013,
|
|
"num_tokens": 15925302.0,
|
|
"step": 6290
|
|
},
|
|
{
|
|
"entropy": 6.350992727279663,
|
|
"epoch": 0.7264858626658973,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.000495771363590354,
|
|
"loss": 6.2221,
|
|
"mean_token_accuracy": 0.16327236741781234,
|
|
"num_tokens": 15938226.0,
|
|
"step": 6295
|
|
},
|
|
{
|
|
"entropy": 6.3598075866699215,
|
|
"epoch": 0.727062896710906,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004957633973901027,
|
|
"loss": 6.2529,
|
|
"mean_token_accuracy": 0.16555078625679015,
|
|
"num_tokens": 15951136.0,
|
|
"step": 6300
|
|
},
|
|
{
|
|
"entropy": 6.5036924362182615,
|
|
"epoch": 0.7276399307559146,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004957554237645841,
|
|
"loss": 6.182,
|
|
"mean_token_accuracy": 0.16397586315870286,
|
|
"num_tokens": 15962820.0,
|
|
"step": 6305
|
|
},
|
|
{
|
|
"entropy": 6.3505518436431885,
|
|
"epoch": 0.7282169648009232,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004957474427140665,
|
|
"loss": 6.1517,
|
|
"mean_token_accuracy": 0.16915166974067689,
|
|
"num_tokens": 15974871.0,
|
|
"step": 6310
|
|
},
|
|
{
|
|
"entropy": 6.292996549606324,
|
|
"epoch": 0.7287939988459319,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004957394542388182,
|
|
"loss": 6.1424,
|
|
"mean_token_accuracy": 0.16711995154619216,
|
|
"num_tokens": 15986916.0,
|
|
"step": 6315
|
|
},
|
|
{
|
|
"entropy": 6.4575494766235355,
|
|
"epoch": 0.7293710328909405,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004957314583391082,
|
|
"loss": 6.2829,
|
|
"mean_token_accuracy": 0.1611138626933098,
|
|
"num_tokens": 15999735.0,
|
|
"step": 6320
|
|
},
|
|
{
|
|
"entropy": 6.395171499252319,
|
|
"epoch": 0.7299480669359493,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004957234550152052,
|
|
"loss": 6.1495,
|
|
"mean_token_accuracy": 0.16820143014192582,
|
|
"num_tokens": 16013137.0,
|
|
"step": 6325
|
|
},
|
|
{
|
|
"entropy": 6.411394023895264,
|
|
"epoch": 0.7305251009809579,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004957154442673784,
|
|
"loss": 6.1912,
|
|
"mean_token_accuracy": 0.1681437909603119,
|
|
"num_tokens": 16026750.0,
|
|
"step": 6330
|
|
},
|
|
{
|
|
"entropy": 6.4092567443847654,
|
|
"epoch": 0.7311021350259665,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004957074260958972,
|
|
"loss": 6.2858,
|
|
"mean_token_accuracy": 0.16070856600999833,
|
|
"num_tokens": 16039028.0,
|
|
"step": 6335
|
|
},
|
|
{
|
|
"entropy": 6.334304571151733,
|
|
"epoch": 0.7316791690709752,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004956994005010315,
|
|
"loss": 6.1644,
|
|
"mean_token_accuracy": 0.16928236484527587,
|
|
"num_tokens": 16051349.0,
|
|
"step": 6340
|
|
},
|
|
{
|
|
"entropy": 6.428053951263427,
|
|
"epoch": 0.7322562031159838,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.000495691367483051,
|
|
"loss": 6.1938,
|
|
"mean_token_accuracy": 0.16701492369174958,
|
|
"num_tokens": 16064015.0,
|
|
"step": 6345
|
|
},
|
|
{
|
|
"entropy": 6.399576091766358,
|
|
"epoch": 0.7328332371609925,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004956833270422259,
|
|
"loss": 6.2058,
|
|
"mean_token_accuracy": 0.16545607447624205,
|
|
"num_tokens": 16075571.0,
|
|
"step": 6350
|
|
},
|
|
{
|
|
"entropy": 6.313619899749756,
|
|
"epoch": 0.7334102712060011,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004956752791788269,
|
|
"loss": 6.2174,
|
|
"mean_token_accuracy": 0.17301566898822784,
|
|
"num_tokens": 16088176.0,
|
|
"step": 6355
|
|
},
|
|
{
|
|
"entropy": 6.446109962463379,
|
|
"epoch": 0.7339873052510099,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004956672238931244,
|
|
"loss": 6.2416,
|
|
"mean_token_accuracy": 0.16300074756145477,
|
|
"num_tokens": 16099933.0,
|
|
"step": 6360
|
|
},
|
|
{
|
|
"entropy": 6.3145325660705565,
|
|
"epoch": 0.7345643392960185,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004956591611853894,
|
|
"loss": 6.0568,
|
|
"mean_token_accuracy": 0.17523580491542817,
|
|
"num_tokens": 16113200.0,
|
|
"step": 6365
|
|
},
|
|
{
|
|
"entropy": 6.3287248611450195,
|
|
"epoch": 0.7351413733410271,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004956510910558931,
|
|
"loss": 6.226,
|
|
"mean_token_accuracy": 0.1691768139600754,
|
|
"num_tokens": 16125532.0,
|
|
"step": 6370
|
|
},
|
|
{
|
|
"entropy": 6.4246572971344,
|
|
"epoch": 0.7357184073860358,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004956430135049071,
|
|
"loss": 6.1668,
|
|
"mean_token_accuracy": 0.16189181953668594,
|
|
"num_tokens": 16137197.0,
|
|
"step": 6375
|
|
},
|
|
{
|
|
"entropy": 6.420309734344483,
|
|
"epoch": 0.7362954414310444,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004956349285327028,
|
|
"loss": 6.2291,
|
|
"mean_token_accuracy": 0.170423786342144,
|
|
"num_tokens": 16150481.0,
|
|
"step": 6380
|
|
},
|
|
{
|
|
"entropy": 6.436809253692627,
|
|
"epoch": 0.7368724754760531,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004956268361395523,
|
|
"loss": 6.243,
|
|
"mean_token_accuracy": 0.16785213947296143,
|
|
"num_tokens": 16162395.0,
|
|
"step": 6385
|
|
},
|
|
{
|
|
"entropy": 6.395518732070923,
|
|
"epoch": 0.7374495095210617,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004956187363257278,
|
|
"loss": 6.2114,
|
|
"mean_token_accuracy": 0.16164291948080062,
|
|
"num_tokens": 16174550.0,
|
|
"step": 6390
|
|
},
|
|
{
|
|
"entropy": 6.441514873504639,
|
|
"epoch": 0.7380265435660704,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004956106290915017,
|
|
"loss": 6.224,
|
|
"mean_token_accuracy": 0.16265684217214585,
|
|
"num_tokens": 16187571.0,
|
|
"step": 6395
|
|
},
|
|
{
|
|
"entropy": 6.387861871719361,
|
|
"epoch": 0.7386035776110791,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004956025144371467,
|
|
"loss": 6.2354,
|
|
"mean_token_accuracy": 0.16527050733566284,
|
|
"num_tokens": 16199684.0,
|
|
"step": 6400
|
|
},
|
|
{
|
|
"entropy": 6.3519782543182375,
|
|
"epoch": 0.7391806116560877,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004955943923629356,
|
|
"loss": 6.209,
|
|
"mean_token_accuracy": 0.1613857090473175,
|
|
"num_tokens": 16211935.0,
|
|
"step": 6405
|
|
},
|
|
{
|
|
"entropy": 6.381722450256348,
|
|
"epoch": 0.7397576457010964,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004955862628691417,
|
|
"loss": 6.2057,
|
|
"mean_token_accuracy": 0.16139667183160783,
|
|
"num_tokens": 16224346.0,
|
|
"step": 6410
|
|
},
|
|
{
|
|
"entropy": 6.384852361679077,
|
|
"epoch": 0.740334679746105,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004955781259560386,
|
|
"loss": 6.2382,
|
|
"mean_token_accuracy": 0.16073639541864396,
|
|
"num_tokens": 16238137.0,
|
|
"step": 6415
|
|
},
|
|
{
|
|
"entropy": 6.42009801864624,
|
|
"epoch": 0.7409117137911136,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004955699816238995,
|
|
"loss": 6.2115,
|
|
"mean_token_accuracy": 0.1616441637277603,
|
|
"num_tokens": 16250777.0,
|
|
"step": 6420
|
|
},
|
|
{
|
|
"entropy": 6.490957832336425,
|
|
"epoch": 0.7414887478361223,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004955618298729988,
|
|
"loss": 6.216,
|
|
"mean_token_accuracy": 0.16838435977697372,
|
|
"num_tokens": 16262440.0,
|
|
"step": 6425
|
|
},
|
|
{
|
|
"entropy": 6.3685378074646,
|
|
"epoch": 0.742065781881131,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004955536707036105,
|
|
"loss": 6.1605,
|
|
"mean_token_accuracy": 0.1693017989397049,
|
|
"num_tokens": 16275227.0,
|
|
"step": 6430
|
|
},
|
|
{
|
|
"entropy": 6.362598896026611,
|
|
"epoch": 0.7426428159261397,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.000495545504116009,
|
|
"loss": 6.2191,
|
|
"mean_token_accuracy": 0.16907331794500352,
|
|
"num_tokens": 16287246.0,
|
|
"step": 6435
|
|
},
|
|
{
|
|
"entropy": 6.334651374816895,
|
|
"epoch": 0.7432198499711483,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004955373301104691,
|
|
"loss": 6.0844,
|
|
"mean_token_accuracy": 0.1756950169801712,
|
|
"num_tokens": 16298779.0,
|
|
"step": 6440
|
|
},
|
|
{
|
|
"entropy": 6.257397556304932,
|
|
"epoch": 0.743796884016157,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004955291486872657,
|
|
"loss": 6.094,
|
|
"mean_token_accuracy": 0.17155533283948898,
|
|
"num_tokens": 16310965.0,
|
|
"step": 6445
|
|
},
|
|
{
|
|
"entropy": 6.422209453582764,
|
|
"epoch": 0.7443739180611656,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004955209598466738,
|
|
"loss": 6.1489,
|
|
"mean_token_accuracy": 0.16697419285774232,
|
|
"num_tokens": 16324025.0,
|
|
"step": 6450
|
|
},
|
|
{
|
|
"entropy": 6.4021642208099365,
|
|
"epoch": 0.7449509521061742,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.000495512763588969,
|
|
"loss": 6.1812,
|
|
"mean_token_accuracy": 0.1613484129309654,
|
|
"num_tokens": 16336152.0,
|
|
"step": 6455
|
|
},
|
|
{
|
|
"entropy": 6.3049877166748045,
|
|
"epoch": 0.7455279861511829,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004955045599144269,
|
|
"loss": 6.1725,
|
|
"mean_token_accuracy": 0.16346538215875625,
|
|
"num_tokens": 16349118.0,
|
|
"step": 6460
|
|
},
|
|
{
|
|
"entropy": 6.290837526321411,
|
|
"epoch": 0.7461050201961916,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004954963488233235,
|
|
"loss": 6.1527,
|
|
"mean_token_accuracy": 0.16980938464403153,
|
|
"num_tokens": 16362986.0,
|
|
"step": 6465
|
|
},
|
|
{
|
|
"entropy": 6.390332794189453,
|
|
"epoch": 0.7466820542412003,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.000495488130315935,
|
|
"loss": 6.2864,
|
|
"mean_token_accuracy": 0.15601871460676192,
|
|
"num_tokens": 16376384.0,
|
|
"step": 6470
|
|
},
|
|
{
|
|
"entropy": 6.3824310302734375,
|
|
"epoch": 0.7472590882862089,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004954799043925377,
|
|
"loss": 6.0944,
|
|
"mean_token_accuracy": 0.16927106827497482,
|
|
"num_tokens": 16388137.0,
|
|
"step": 6475
|
|
},
|
|
{
|
|
"entropy": 6.397792720794678,
|
|
"epoch": 0.7478361223312175,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004954716710534082,
|
|
"loss": 6.2386,
|
|
"mean_token_accuracy": 0.15695064812898635,
|
|
"num_tokens": 16400037.0,
|
|
"step": 6480
|
|
},
|
|
{
|
|
"entropy": 6.404593467712402,
|
|
"epoch": 0.7484131563762262,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004954634302988237,
|
|
"loss": 6.1692,
|
|
"mean_token_accuracy": 0.16684277951717377,
|
|
"num_tokens": 16412065.0,
|
|
"step": 6485
|
|
},
|
|
{
|
|
"entropy": 6.392002153396606,
|
|
"epoch": 0.7489901904212348,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004954551821290612,
|
|
"loss": 6.1886,
|
|
"mean_token_accuracy": 0.1650811791419983,
|
|
"num_tokens": 16424345.0,
|
|
"step": 6490
|
|
},
|
|
{
|
|
"entropy": 6.408037185668945,
|
|
"epoch": 0.7495672244662435,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004954469265443981,
|
|
"loss": 6.2616,
|
|
"mean_token_accuracy": 0.16495269536972046,
|
|
"num_tokens": 16436423.0,
|
|
"step": 6495
|
|
},
|
|
{
|
|
"entropy": 6.3400726318359375,
|
|
"epoch": 0.7501442585112522,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004954386635451123,
|
|
"loss": 6.1597,
|
|
"mean_token_accuracy": 0.16760794222354888,
|
|
"num_tokens": 16449496.0,
|
|
"step": 6500
|
|
},
|
|
{
|
|
"entropy": 6.373304224014282,
|
|
"epoch": 0.7507212925562609,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004954303931314814,
|
|
"loss": 6.1806,
|
|
"mean_token_accuracy": 0.16673036217689513,
|
|
"num_tokens": 16462193.0,
|
|
"step": 6505
|
|
},
|
|
{
|
|
"entropy": 6.355952978134155,
|
|
"epoch": 0.7512983266012695,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004954221153037837,
|
|
"loss": 6.2043,
|
|
"mean_token_accuracy": 0.1631313681602478,
|
|
"num_tokens": 16474470.0,
|
|
"step": 6510
|
|
},
|
|
{
|
|
"entropy": 6.425698757171631,
|
|
"epoch": 0.7518753606462781,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004954138300622978,
|
|
"loss": 6.1706,
|
|
"mean_token_accuracy": 0.17431595772504807,
|
|
"num_tokens": 16487231.0,
|
|
"step": 6515
|
|
},
|
|
{
|
|
"entropy": 6.373720026016235,
|
|
"epoch": 0.7524523946912868,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.000495405537407302,
|
|
"loss": 6.2687,
|
|
"mean_token_accuracy": 0.16340657472610473,
|
|
"num_tokens": 16500822.0,
|
|
"step": 6520
|
|
},
|
|
{
|
|
"entropy": 6.301622486114502,
|
|
"epoch": 0.7530294287362954,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004953972373390755,
|
|
"loss": 6.2006,
|
|
"mean_token_accuracy": 0.16783786863088607,
|
|
"num_tokens": 16514529.0,
|
|
"step": 6525
|
|
},
|
|
{
|
|
"entropy": 6.352727317810059,
|
|
"epoch": 0.753606462781304,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004953889298578975,
|
|
"loss": 6.1729,
|
|
"mean_token_accuracy": 0.1620926558971405,
|
|
"num_tokens": 16527281.0,
|
|
"step": 6530
|
|
},
|
|
{
|
|
"entropy": 6.431893682479858,
|
|
"epoch": 0.7541834968263128,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004953806149640473,
|
|
"loss": 6.1662,
|
|
"mean_token_accuracy": 0.16912026554346085,
|
|
"num_tokens": 16539763.0,
|
|
"step": 6535
|
|
},
|
|
{
|
|
"entropy": 6.268726921081543,
|
|
"epoch": 0.7547605308713214,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0004953722926578045,
|
|
"loss": 6.1403,
|
|
"mean_token_accuracy": 0.17996453493833542,
|
|
"num_tokens": 16552197.0,
|
|
"step": 6540
|
|
},
|
|
{
|
|
"entropy": 6.44415316581726,
|
|
"epoch": 0.7553375649163301,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004953639629394492,
|
|
"loss": 6.2006,
|
|
"mean_token_accuracy": 0.16660022884607315,
|
|
"num_tokens": 16563988.0,
|
|
"step": 6545
|
|
},
|
|
{
|
|
"entropy": 6.337887763977051,
|
|
"epoch": 0.7559145989613387,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0004953556258092613,
|
|
"loss": 6.1856,
|
|
"mean_token_accuracy": 0.16377629339694977,
|
|
"num_tokens": 16576982.0,
|
|
"step": 6550
|
|
},
|
|
{
|
|
"entropy": 6.3525402545928955,
|
|
"epoch": 0.7564916330063474,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004953472812675216,
|
|
"loss": 6.2339,
|
|
"mean_token_accuracy": 0.16399967223405837,
|
|
"num_tokens": 16590268.0,
|
|
"step": 6555
|
|
},
|
|
{
|
|
"entropy": 6.381183433532715,
|
|
"epoch": 0.757068667051356,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004953389293145104,
|
|
"loss": 6.0784,
|
|
"mean_token_accuracy": 0.1773386687040329,
|
|
"num_tokens": 16602599.0,
|
|
"step": 6560
|
|
},
|
|
{
|
|
"entropy": 6.38706521987915,
|
|
"epoch": 0.7576457010963646,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004953305699505088,
|
|
"loss": 6.1784,
|
|
"mean_token_accuracy": 0.16482038497924806,
|
|
"num_tokens": 16614278.0,
|
|
"step": 6565
|
|
},
|
|
{
|
|
"entropy": 6.376954698562622,
|
|
"epoch": 0.7582227351413734,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004953222031757979,
|
|
"loss": 6.1969,
|
|
"mean_token_accuracy": 0.16000646650791167,
|
|
"num_tokens": 16626810.0,
|
|
"step": 6570
|
|
},
|
|
{
|
|
"entropy": 6.30605149269104,
|
|
"epoch": 0.758799769186382,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004953138289906592,
|
|
"loss": 6.147,
|
|
"mean_token_accuracy": 0.16598434895277023,
|
|
"num_tokens": 16639134.0,
|
|
"step": 6575
|
|
},
|
|
{
|
|
"entropy": 6.401002597808838,
|
|
"epoch": 0.7593768032313907,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004953054473953742,
|
|
"loss": 6.174,
|
|
"mean_token_accuracy": 0.16408377885818481,
|
|
"num_tokens": 16652724.0,
|
|
"step": 6580
|
|
},
|
|
{
|
|
"entropy": 6.300872707366944,
|
|
"epoch": 0.7599538372763993,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004952970583902251,
|
|
"loss": 6.1405,
|
|
"mean_token_accuracy": 0.16957145929336548,
|
|
"num_tokens": 16666045.0,
|
|
"step": 6585
|
|
},
|
|
{
|
|
"entropy": 6.358345413208008,
|
|
"epoch": 0.760530871321408,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004952886619754937,
|
|
"loss": 6.2554,
|
|
"mean_token_accuracy": 0.16089996993541716,
|
|
"num_tokens": 16678422.0,
|
|
"step": 6590
|
|
},
|
|
{
|
|
"entropy": 6.361907529830932,
|
|
"epoch": 0.7611079053664166,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004952802581514625,
|
|
"loss": 6.1704,
|
|
"mean_token_accuracy": 0.17014944702386856,
|
|
"num_tokens": 16690243.0,
|
|
"step": 6595
|
|
},
|
|
{
|
|
"entropy": 6.311407661437988,
|
|
"epoch": 0.7616849394114252,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004952718469184144,
|
|
"loss": 6.1312,
|
|
"mean_token_accuracy": 0.17277286797761918,
|
|
"num_tokens": 16702418.0,
|
|
"step": 6600
|
|
},
|
|
{
|
|
"entropy": 6.436389970779419,
|
|
"epoch": 0.762261973456434,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004952634282766322,
|
|
"loss": 6.2206,
|
|
"mean_token_accuracy": 0.15880272090435027,
|
|
"num_tokens": 16713974.0,
|
|
"step": 6605
|
|
},
|
|
{
|
|
"entropy": 6.349586820602417,
|
|
"epoch": 0.7628390075014426,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004952550022263988,
|
|
"loss": 6.1066,
|
|
"mean_token_accuracy": 0.17593667209148406,
|
|
"num_tokens": 16726518.0,
|
|
"step": 6610
|
|
},
|
|
{
|
|
"entropy": 6.310934448242188,
|
|
"epoch": 0.7634160415464513,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004952465687679979,
|
|
"loss": 6.1369,
|
|
"mean_token_accuracy": 0.17361938208341599,
|
|
"num_tokens": 16738701.0,
|
|
"step": 6615
|
|
},
|
|
{
|
|
"entropy": 6.3912577629089355,
|
|
"epoch": 0.7639930755914599,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.000495238127901713,
|
|
"loss": 6.186,
|
|
"mean_token_accuracy": 0.1613457351922989,
|
|
"num_tokens": 16751251.0,
|
|
"step": 6620
|
|
},
|
|
{
|
|
"entropy": 6.388515663146973,
|
|
"epoch": 0.7645701096364685,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004952296796278282,
|
|
"loss": 6.1779,
|
|
"mean_token_accuracy": 0.16940819919109346,
|
|
"num_tokens": 16764233.0,
|
|
"step": 6625
|
|
},
|
|
{
|
|
"entropy": 6.276236534118652,
|
|
"epoch": 0.7651471436814772,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004952212239466274,
|
|
"loss": 6.1759,
|
|
"mean_token_accuracy": 0.1788155049085617,
|
|
"num_tokens": 16778408.0,
|
|
"step": 6630
|
|
},
|
|
{
|
|
"entropy": 6.3944172859191895,
|
|
"epoch": 0.7657241777264858,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004952127608583953,
|
|
"loss": 6.2105,
|
|
"mean_token_accuracy": 0.16523972898721695,
|
|
"num_tokens": 16789863.0,
|
|
"step": 6635
|
|
},
|
|
{
|
|
"entropy": 6.392884111404419,
|
|
"epoch": 0.7663012117714946,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004952042903634162,
|
|
"loss": 6.1331,
|
|
"mean_token_accuracy": 0.17282791584730148,
|
|
"num_tokens": 16804448.0,
|
|
"step": 6640
|
|
},
|
|
{
|
|
"entropy": 6.314636993408203,
|
|
"epoch": 0.7668782458165032,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004951958124619752,
|
|
"loss": 6.231,
|
|
"mean_token_accuracy": 0.16494413763284682,
|
|
"num_tokens": 16817922.0,
|
|
"step": 6645
|
|
},
|
|
{
|
|
"entropy": 6.392580652236939,
|
|
"epoch": 0.7674552798615119,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0004951873271543573,
|
|
"loss": 6.2165,
|
|
"mean_token_accuracy": 0.16729218661785125,
|
|
"num_tokens": 16830322.0,
|
|
"step": 6650
|
|
},
|
|
{
|
|
"entropy": 6.465516519546509,
|
|
"epoch": 0.7680323139065205,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004951788344408483,
|
|
"loss": 6.2252,
|
|
"mean_token_accuracy": 0.16338257789611815,
|
|
"num_tokens": 16843489.0,
|
|
"step": 6655
|
|
},
|
|
{
|
|
"entropy": 6.345834875106812,
|
|
"epoch": 0.7686093479515291,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004951703343217335,
|
|
"loss": 6.1887,
|
|
"mean_token_accuracy": 0.16055528968572616,
|
|
"num_tokens": 16855256.0,
|
|
"step": 6660
|
|
},
|
|
{
|
|
"entropy": 6.285180187225341,
|
|
"epoch": 0.7691863819965378,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004951618267972987,
|
|
"loss": 6.171,
|
|
"mean_token_accuracy": 0.1670081600546837,
|
|
"num_tokens": 16869927.0,
|
|
"step": 6665
|
|
},
|
|
{
|
|
"entropy": 6.294586229324341,
|
|
"epoch": 0.7697634160415464,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004951533118678304,
|
|
"loss": 6.0723,
|
|
"mean_token_accuracy": 0.18153493106365204,
|
|
"num_tokens": 16882095.0,
|
|
"step": 6670
|
|
},
|
|
{
|
|
"entropy": 6.4467226505279545,
|
|
"epoch": 0.7703404500865552,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004951447895336147,
|
|
"loss": 6.2758,
|
|
"mean_token_accuracy": 0.16662507206201554,
|
|
"num_tokens": 16893338.0,
|
|
"step": 6675
|
|
},
|
|
{
|
|
"entropy": 6.349839162826538,
|
|
"epoch": 0.7709174841315638,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004951362597949384,
|
|
"loss": 6.2421,
|
|
"mean_token_accuracy": 0.16923239529132844,
|
|
"num_tokens": 16907138.0,
|
|
"step": 6680
|
|
},
|
|
{
|
|
"entropy": 6.409167861938476,
|
|
"epoch": 0.7714945181765724,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004951277226520883,
|
|
"loss": 6.1483,
|
|
"mean_token_accuracy": 0.16991439014673232,
|
|
"num_tokens": 16919756.0,
|
|
"step": 6685
|
|
},
|
|
{
|
|
"entropy": 6.386492919921875,
|
|
"epoch": 0.7720715522215811,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004951191781053517,
|
|
"loss": 6.104,
|
|
"mean_token_accuracy": 0.17598668336868287,
|
|
"num_tokens": 16932059.0,
|
|
"step": 6690
|
|
},
|
|
{
|
|
"entropy": 6.321619033813477,
|
|
"epoch": 0.7726485862665897,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004951106261550157,
|
|
"loss": 6.2057,
|
|
"mean_token_accuracy": 0.16631946563720704,
|
|
"num_tokens": 16944777.0,
|
|
"step": 6695
|
|
},
|
|
{
|
|
"entropy": 6.380236434936523,
|
|
"epoch": 0.7732256203115984,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004951020668013683,
|
|
"loss": 6.1656,
|
|
"mean_token_accuracy": 0.17202370017766952,
|
|
"num_tokens": 16957111.0,
|
|
"step": 6700
|
|
},
|
|
{
|
|
"entropy": 6.385104084014893,
|
|
"epoch": 0.773802654356607,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004950935000446972,
|
|
"loss": 6.2429,
|
|
"mean_token_accuracy": 0.15982713252305986,
|
|
"num_tokens": 16968663.0,
|
|
"step": 6705
|
|
},
|
|
{
|
|
"entropy": 6.359501457214355,
|
|
"epoch": 0.7743796884016156,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004950849258852905,
|
|
"loss": 6.168,
|
|
"mean_token_accuracy": 0.16180971562862395,
|
|
"num_tokens": 16980668.0,
|
|
"step": 6710
|
|
},
|
|
{
|
|
"entropy": 6.346779251098633,
|
|
"epoch": 0.7749567224466244,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004950763443234366,
|
|
"loss": 6.2033,
|
|
"mean_token_accuracy": 0.16977418661117555,
|
|
"num_tokens": 16993537.0,
|
|
"step": 6715
|
|
},
|
|
{
|
|
"entropy": 6.372853565216064,
|
|
"epoch": 0.775533756491633,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004950677553594243,
|
|
"loss": 6.18,
|
|
"mean_token_accuracy": 0.16297179460525513,
|
|
"num_tokens": 17006268.0,
|
|
"step": 6720
|
|
},
|
|
{
|
|
"entropy": 6.383951425552368,
|
|
"epoch": 0.7761107905366417,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004950591589935422,
|
|
"loss": 6.1762,
|
|
"mean_token_accuracy": 0.1659395158290863,
|
|
"num_tokens": 17018643.0,
|
|
"step": 6725
|
|
},
|
|
{
|
|
"entropy": 6.294509315490723,
|
|
"epoch": 0.7766878245816503,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004950505552260798,
|
|
"loss": 6.1452,
|
|
"mean_token_accuracy": 0.17016030550003053,
|
|
"num_tokens": 17030670.0,
|
|
"step": 6730
|
|
},
|
|
{
|
|
"entropy": 6.4208496570587155,
|
|
"epoch": 0.777264858626659,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004950419440573261,
|
|
"loss": 6.155,
|
|
"mean_token_accuracy": 0.17145975232124328,
|
|
"num_tokens": 17042617.0,
|
|
"step": 6735
|
|
},
|
|
{
|
|
"entropy": 6.289498710632325,
|
|
"epoch": 0.7778418926716676,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.000495033325487571,
|
|
"loss": 6.2014,
|
|
"mean_token_accuracy": 0.16481405943632127,
|
|
"num_tokens": 17055217.0,
|
|
"step": 6740
|
|
},
|
|
{
|
|
"entropy": 6.231577014923095,
|
|
"epoch": 0.7784189267166762,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004950246995171042,
|
|
"loss": 6.054,
|
|
"mean_token_accuracy": 0.18304862976074218,
|
|
"num_tokens": 17068614.0,
|
|
"step": 6745
|
|
},
|
|
{
|
|
"entropy": 6.345638132095337,
|
|
"epoch": 0.778995960761685,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.000495016066146216,
|
|
"loss": 6.089,
|
|
"mean_token_accuracy": 0.17975687980651855,
|
|
"num_tokens": 17079892.0,
|
|
"step": 6750
|
|
},
|
|
{
|
|
"entropy": 6.320506286621094,
|
|
"epoch": 0.7795729948066936,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004950074253751968,
|
|
"loss": 6.187,
|
|
"mean_token_accuracy": 0.17330573499202728,
|
|
"num_tokens": 17092113.0,
|
|
"step": 6755
|
|
},
|
|
{
|
|
"entropy": 6.373245906829834,
|
|
"epoch": 0.7801500288517023,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000494998777204337,
|
|
"loss": 6.1624,
|
|
"mean_token_accuracy": 0.1723353922367096,
|
|
"num_tokens": 17103387.0,
|
|
"step": 6760
|
|
},
|
|
{
|
|
"entropy": 6.408647680282593,
|
|
"epoch": 0.7807270628967109,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004949901216339276,
|
|
"loss": 6.2118,
|
|
"mean_token_accuracy": 0.16432149559259415,
|
|
"num_tokens": 17116008.0,
|
|
"step": 6765
|
|
},
|
|
{
|
|
"entropy": 6.3029053688049315,
|
|
"epoch": 0.7813040969417195,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004949814586642598,
|
|
"loss": 6.0949,
|
|
"mean_token_accuracy": 0.1802838459610939,
|
|
"num_tokens": 17129224.0,
|
|
"step": 6770
|
|
},
|
|
{
|
|
"entropy": 6.2848211288452145,
|
|
"epoch": 0.7818811309867282,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.000494972788295625,
|
|
"loss": 6.0943,
|
|
"mean_token_accuracy": 0.16807924062013627,
|
|
"num_tokens": 17141357.0,
|
|
"step": 6775
|
|
},
|
|
{
|
|
"entropy": 6.308895206451416,
|
|
"epoch": 0.7824581650317368,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004949641105283144,
|
|
"loss": 6.1263,
|
|
"mean_token_accuracy": 0.17011737823486328,
|
|
"num_tokens": 17153672.0,
|
|
"step": 6780
|
|
},
|
|
{
|
|
"entropy": 6.329161548614502,
|
|
"epoch": 0.7830351990767456,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004949554253626205,
|
|
"loss": 6.1984,
|
|
"mean_token_accuracy": 0.16174544990062714,
|
|
"num_tokens": 17168429.0,
|
|
"step": 6785
|
|
},
|
|
{
|
|
"entropy": 6.412427520751953,
|
|
"epoch": 0.7836122331217542,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004949467327988351,
|
|
"loss": 6.1309,
|
|
"mean_token_accuracy": 0.16915023773908616,
|
|
"num_tokens": 17181000.0,
|
|
"step": 6790
|
|
},
|
|
{
|
|
"entropy": 6.298403978347778,
|
|
"epoch": 0.7841892671667628,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004949380328372505,
|
|
"loss": 6.1312,
|
|
"mean_token_accuracy": 0.16709219068288803,
|
|
"num_tokens": 17193984.0,
|
|
"step": 6795
|
|
},
|
|
{
|
|
"entropy": 6.35187873840332,
|
|
"epoch": 0.7847663012117715,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004949293254781595,
|
|
"loss": 6.1563,
|
|
"mean_token_accuracy": 0.17206377685070037,
|
|
"num_tokens": 17207289.0,
|
|
"step": 6800
|
|
},
|
|
{
|
|
"entropy": 6.3366005420684814,
|
|
"epoch": 0.7853433352567801,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004949206107218547,
|
|
"loss": 6.207,
|
|
"mean_token_accuracy": 0.16879773288965225,
|
|
"num_tokens": 17220785.0,
|
|
"step": 6805
|
|
},
|
|
{
|
|
"entropy": 6.426763868331909,
|
|
"epoch": 0.7859203693017888,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004949118885686296,
|
|
"loss": 6.1794,
|
|
"mean_token_accuracy": 0.1629263088107109,
|
|
"num_tokens": 17233475.0,
|
|
"step": 6810
|
|
},
|
|
{
|
|
"entropy": 6.387394714355469,
|
|
"epoch": 0.7864974033467974,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004949031590187774,
|
|
"loss": 6.154,
|
|
"mean_token_accuracy": 0.1672731891274452,
|
|
"num_tokens": 17246652.0,
|
|
"step": 6815
|
|
},
|
|
{
|
|
"entropy": 6.331944465637207,
|
|
"epoch": 0.7870744373918062,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004948944220725915,
|
|
"loss": 6.1632,
|
|
"mean_token_accuracy": 0.1671597495675087,
|
|
"num_tokens": 17259966.0,
|
|
"step": 6820
|
|
},
|
|
{
|
|
"entropy": 6.285306072235107,
|
|
"epoch": 0.7876514714368148,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.000494885677730366,
|
|
"loss": 6.0972,
|
|
"mean_token_accuracy": 0.1782669961452484,
|
|
"num_tokens": 17272556.0,
|
|
"step": 6825
|
|
},
|
|
{
|
|
"entropy": 6.356509113311768,
|
|
"epoch": 0.7882285054818234,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.000494876925992395,
|
|
"loss": 6.1213,
|
|
"mean_token_accuracy": 0.1762054055929184,
|
|
"num_tokens": 17285960.0,
|
|
"step": 6830
|
|
},
|
|
{
|
|
"entropy": 6.398293352127075,
|
|
"epoch": 0.7888055395268321,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004948681668589728,
|
|
"loss": 6.2315,
|
|
"mean_token_accuracy": 0.15961660146713258,
|
|
"num_tokens": 17299743.0,
|
|
"step": 6835
|
|
},
|
|
{
|
|
"entropy": 6.301696109771728,
|
|
"epoch": 0.7893825735718407,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.000494859400330394,
|
|
"loss": 6.1103,
|
|
"mean_token_accuracy": 0.16794033199548722,
|
|
"num_tokens": 17312317.0,
|
|
"step": 6840
|
|
},
|
|
{
|
|
"entropy": 6.351978206634522,
|
|
"epoch": 0.7899596076168494,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004948506264069535,
|
|
"loss": 6.1624,
|
|
"mean_token_accuracy": 0.167983041703701,
|
|
"num_tokens": 17326204.0,
|
|
"step": 6845
|
|
},
|
|
{
|
|
"entropy": 6.338317823410034,
|
|
"epoch": 0.790536641661858,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004948418450889464,
|
|
"loss": 6.1077,
|
|
"mean_token_accuracy": 0.1751476228237152,
|
|
"num_tokens": 17338362.0,
|
|
"step": 6850
|
|
},
|
|
{
|
|
"entropy": 6.257613039016723,
|
|
"epoch": 0.7911136757068667,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.000494833056376668,
|
|
"loss": 6.1526,
|
|
"mean_token_accuracy": 0.1725895255804062,
|
|
"num_tokens": 17350713.0,
|
|
"step": 6855
|
|
},
|
|
{
|
|
"entropy": 6.426647043228149,
|
|
"epoch": 0.7916907097518754,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004948242602704139,
|
|
"loss": 6.185,
|
|
"mean_token_accuracy": 0.16246354728937148,
|
|
"num_tokens": 17364055.0,
|
|
"step": 6860
|
|
},
|
|
{
|
|
"entropy": 6.354440021514892,
|
|
"epoch": 0.792267743796884,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004948154567704801,
|
|
"loss": 6.2338,
|
|
"mean_token_accuracy": 0.1697024703025818,
|
|
"num_tokens": 17377940.0,
|
|
"step": 6865
|
|
},
|
|
{
|
|
"entropy": 6.37884521484375,
|
|
"epoch": 0.7928447778418927,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004948066458771625,
|
|
"loss": 6.1571,
|
|
"mean_token_accuracy": 0.17270761132240295,
|
|
"num_tokens": 17390348.0,
|
|
"step": 6870
|
|
},
|
|
{
|
|
"entropy": 6.355157947540283,
|
|
"epoch": 0.7934218118869013,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004947978275907577,
|
|
"loss": 6.1631,
|
|
"mean_token_accuracy": 0.17038169950246812,
|
|
"num_tokens": 17403406.0,
|
|
"step": 6875
|
|
},
|
|
{
|
|
"entropy": 6.323590803146362,
|
|
"epoch": 0.79399884593191,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.000494789001911562,
|
|
"loss": 6.1659,
|
|
"mean_token_accuracy": 0.16402290314435958,
|
|
"num_tokens": 17415306.0,
|
|
"step": 6880
|
|
},
|
|
{
|
|
"entropy": 6.354849624633789,
|
|
"epoch": 0.7945758799769186,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004947801688398725,
|
|
"loss": 6.2131,
|
|
"mean_token_accuracy": 0.16550301611423493,
|
|
"num_tokens": 17427901.0,
|
|
"step": 6885
|
|
},
|
|
{
|
|
"entropy": 6.385193347930908,
|
|
"epoch": 0.7951529140219273,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004947713283759862,
|
|
"loss": 6.1557,
|
|
"mean_token_accuracy": 0.16478197127580643,
|
|
"num_tokens": 17439812.0,
|
|
"step": 6890
|
|
},
|
|
{
|
|
"entropy": 6.380311965942383,
|
|
"epoch": 0.795729948066936,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004947624805202003,
|
|
"loss": 6.2637,
|
|
"mean_token_accuracy": 0.16673970818519593,
|
|
"num_tokens": 17453317.0,
|
|
"step": 6895
|
|
},
|
|
{
|
|
"entropy": 6.315207052230835,
|
|
"epoch": 0.7963069821119446,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004947536252728126,
|
|
"loss": 6.1383,
|
|
"mean_token_accuracy": 0.16237509697675706,
|
|
"num_tokens": 17465563.0,
|
|
"step": 6900
|
|
},
|
|
{
|
|
"entropy": 6.343274450302124,
|
|
"epoch": 0.7968840161569533,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004947447626341209,
|
|
"loss": 6.2019,
|
|
"mean_token_accuracy": 0.16558388322591783,
|
|
"num_tokens": 17477672.0,
|
|
"step": 6905
|
|
},
|
|
{
|
|
"entropy": 6.394934368133545,
|
|
"epoch": 0.7974610502019619,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004947358926044232,
|
|
"loss": 6.168,
|
|
"mean_token_accuracy": 0.16697321683168412,
|
|
"num_tokens": 17489061.0,
|
|
"step": 6910
|
|
},
|
|
{
|
|
"entropy": 6.357774353027343,
|
|
"epoch": 0.7980380842469705,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004947270151840179,
|
|
"loss": 6.1935,
|
|
"mean_token_accuracy": 0.1671817809343338,
|
|
"num_tokens": 17501734.0,
|
|
"step": 6915
|
|
},
|
|
{
|
|
"entropy": 6.3456621170043945,
|
|
"epoch": 0.7986151182919792,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004947181303732038,
|
|
"loss": 6.1014,
|
|
"mean_token_accuracy": 0.16575353741645812,
|
|
"num_tokens": 17514387.0,
|
|
"step": 6920
|
|
},
|
|
{
|
|
"entropy": 6.3213715076446535,
|
|
"epoch": 0.7991921523369879,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004947092381722793,
|
|
"loss": 6.1093,
|
|
"mean_token_accuracy": 0.176436585187912,
|
|
"num_tokens": 17526483.0,
|
|
"step": 6925
|
|
},
|
|
{
|
|
"entropy": 6.3709863185882565,
|
|
"epoch": 0.7997691863819966,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004947003385815438,
|
|
"loss": 6.1283,
|
|
"mean_token_accuracy": 0.17597151696681976,
|
|
"num_tokens": 17539809.0,
|
|
"step": 6930
|
|
},
|
|
{
|
|
"entropy": 6.328467512130738,
|
|
"epoch": 0.8003462204270052,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004946914316012964,
|
|
"loss": 6.1598,
|
|
"mean_token_accuracy": 0.16539319902658461,
|
|
"num_tokens": 17552973.0,
|
|
"step": 6935
|
|
},
|
|
{
|
|
"entropy": 6.3325916767120365,
|
|
"epoch": 0.8009232544720138,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.000494682517231837,
|
|
"loss": 6.1964,
|
|
"mean_token_accuracy": 0.16823789924383165,
|
|
"num_tokens": 17567803.0,
|
|
"step": 6940
|
|
},
|
|
{
|
|
"entropy": 6.404011678695679,
|
|
"epoch": 0.8015002885170225,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004946735954734652,
|
|
"loss": 6.1555,
|
|
"mean_token_accuracy": 0.16666851192712784,
|
|
"num_tokens": 17579718.0,
|
|
"step": 6945
|
|
},
|
|
{
|
|
"entropy": 6.385808038711548,
|
|
"epoch": 0.8020773225620311,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004946646663264811,
|
|
"loss": 6.1333,
|
|
"mean_token_accuracy": 0.1694340467453003,
|
|
"num_tokens": 17592384.0,
|
|
"step": 6950
|
|
},
|
|
{
|
|
"entropy": 6.309904003143311,
|
|
"epoch": 0.8026543566070398,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004946557297911852,
|
|
"loss": 6.0212,
|
|
"mean_token_accuracy": 0.17547217458486558,
|
|
"num_tokens": 17604292.0,
|
|
"step": 6955
|
|
},
|
|
{
|
|
"entropy": 6.287991714477539,
|
|
"epoch": 0.8032313906520485,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004946467858678777,
|
|
"loss": 6.075,
|
|
"mean_token_accuracy": 0.17394087314605713,
|
|
"num_tokens": 17616638.0,
|
|
"step": 6960
|
|
},
|
|
{
|
|
"entropy": 6.383854913711548,
|
|
"epoch": 0.8038084246970572,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004946378345568597,
|
|
"loss": 6.1799,
|
|
"mean_token_accuracy": 0.16211076080799103,
|
|
"num_tokens": 17630672.0,
|
|
"step": 6965
|
|
},
|
|
{
|
|
"entropy": 6.366672039031982,
|
|
"epoch": 0.8043854587420658,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004946288758584324,
|
|
"loss": 6.1695,
|
|
"mean_token_accuracy": 0.16282691508531572,
|
|
"num_tokens": 17644215.0,
|
|
"step": 6970
|
|
},
|
|
{
|
|
"entropy": 6.3507161140441895,
|
|
"epoch": 0.8049624927870744,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004946199097728968,
|
|
"loss": 6.2385,
|
|
"mean_token_accuracy": 0.1637930914759636,
|
|
"num_tokens": 17655982.0,
|
|
"step": 6975
|
|
},
|
|
{
|
|
"entropy": 6.403667640686035,
|
|
"epoch": 0.8055395268320831,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004946109363005548,
|
|
"loss": 6.1556,
|
|
"mean_token_accuracy": 0.16717308312654494,
|
|
"num_tokens": 17668059.0,
|
|
"step": 6980
|
|
},
|
|
{
|
|
"entropy": 6.378528499603272,
|
|
"epoch": 0.8061165608770917,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.000494601955441708,
|
|
"loss": 6.1703,
|
|
"mean_token_accuracy": 0.17550845742225646,
|
|
"num_tokens": 17680924.0,
|
|
"step": 6985
|
|
},
|
|
{
|
|
"entropy": 6.313846302032471,
|
|
"epoch": 0.8066935949221004,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004945929671966585,
|
|
"loss": 6.1863,
|
|
"mean_token_accuracy": 0.1592755913734436,
|
|
"num_tokens": 17693381.0,
|
|
"step": 6990
|
|
},
|
|
{
|
|
"entropy": 6.293050956726074,
|
|
"epoch": 0.8072706289671091,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004945839715657085,
|
|
"loss": 6.0838,
|
|
"mean_token_accuracy": 0.1738973081111908,
|
|
"num_tokens": 17705900.0,
|
|
"step": 6995
|
|
},
|
|
{
|
|
"entropy": 6.292917346954345,
|
|
"epoch": 0.8078476630121177,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004945749685491607,
|
|
"loss": 6.0748,
|
|
"mean_token_accuracy": 0.17757318913936615,
|
|
"num_tokens": 17719139.0,
|
|
"step": 7000
|
|
},
|
|
{
|
|
"entropy": 6.337329006195068,
|
|
"epoch": 0.8084246970571264,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0004945659581473181,
|
|
"loss": 6.0884,
|
|
"mean_token_accuracy": 0.17271215915679933,
|
|
"num_tokens": 17734312.0,
|
|
"step": 7005
|
|
},
|
|
{
|
|
"entropy": 6.381900072097778,
|
|
"epoch": 0.809001731102135,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004945569403604833,
|
|
"loss": 6.1688,
|
|
"mean_token_accuracy": 0.16242203563451768,
|
|
"num_tokens": 17746137.0,
|
|
"step": 7010
|
|
},
|
|
{
|
|
"entropy": 6.320837736129761,
|
|
"epoch": 0.8095787651471437,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004945479151889601,
|
|
"loss": 5.9999,
|
|
"mean_token_accuracy": 0.17752463966608048,
|
|
"num_tokens": 17758879.0,
|
|
"step": 7015
|
|
},
|
|
{
|
|
"entropy": 6.252843236923217,
|
|
"epoch": 0.8101557991921523,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004945388826330517,
|
|
"loss": 6.1388,
|
|
"mean_token_accuracy": 0.1744886964559555,
|
|
"num_tokens": 17770820.0,
|
|
"step": 7020
|
|
},
|
|
{
|
|
"entropy": 6.382633686065674,
|
|
"epoch": 0.8107328332371609,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004945298426930621,
|
|
"loss": 6.1936,
|
|
"mean_token_accuracy": 0.16758178621530534,
|
|
"num_tokens": 17783495.0,
|
|
"step": 7025
|
|
},
|
|
{
|
|
"entropy": 6.428963232040405,
|
|
"epoch": 0.8113098672821697,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004945207953692952,
|
|
"loss": 6.1614,
|
|
"mean_token_accuracy": 0.1685134768486023,
|
|
"num_tokens": 17795780.0,
|
|
"step": 7030
|
|
},
|
|
{
|
|
"entropy": 6.311816883087158,
|
|
"epoch": 0.8118869013271783,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004945117406620556,
|
|
"loss": 6.1866,
|
|
"mean_token_accuracy": 0.1712436020374298,
|
|
"num_tokens": 17809684.0,
|
|
"step": 7035
|
|
},
|
|
{
|
|
"entropy": 6.322688293457031,
|
|
"epoch": 0.812463935372187,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004945026785716474,
|
|
"loss": 6.1805,
|
|
"mean_token_accuracy": 0.16512720435857772,
|
|
"num_tokens": 17822719.0,
|
|
"step": 7040
|
|
},
|
|
{
|
|
"entropy": 6.381142044067383,
|
|
"epoch": 0.8130409694171956,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004944936090983757,
|
|
"loss": 6.2109,
|
|
"mean_token_accuracy": 0.16516452431678771,
|
|
"num_tokens": 17834883.0,
|
|
"step": 7045
|
|
},
|
|
{
|
|
"entropy": 6.307264518737793,
|
|
"epoch": 0.8136180034622043,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004944845322425455,
|
|
"loss": 6.1272,
|
|
"mean_token_accuracy": 0.1770351156592369,
|
|
"num_tokens": 17847009.0,
|
|
"step": 7050
|
|
},
|
|
{
|
|
"entropy": 6.375383043289185,
|
|
"epoch": 0.8141950375072129,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004944754480044621,
|
|
"loss": 6.152,
|
|
"mean_token_accuracy": 0.1666557177901268,
|
|
"num_tokens": 17859106.0,
|
|
"step": 7055
|
|
},
|
|
{
|
|
"entropy": 6.412518787384033,
|
|
"epoch": 0.8147720715522215,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004944663563844311,
|
|
"loss": 6.1608,
|
|
"mean_token_accuracy": 0.16627125889062883,
|
|
"num_tokens": 17871418.0,
|
|
"step": 7060
|
|
},
|
|
{
|
|
"entropy": 6.2879682064056395,
|
|
"epoch": 0.8153491055972303,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0004944572573827581,
|
|
"loss": 6.1249,
|
|
"mean_token_accuracy": 0.17137539982795716,
|
|
"num_tokens": 17884219.0,
|
|
"step": 7065
|
|
},
|
|
{
|
|
"entropy": 6.307466506958008,
|
|
"epoch": 0.8159261396422389,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004944481509997494,
|
|
"loss": 6.131,
|
|
"mean_token_accuracy": 0.1689067393541336,
|
|
"num_tokens": 17896206.0,
|
|
"step": 7070
|
|
},
|
|
{
|
|
"entropy": 6.3939979553222654,
|
|
"epoch": 0.8165031736872476,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.000494439037235711,
|
|
"loss": 6.2326,
|
|
"mean_token_accuracy": 0.16438301056623458,
|
|
"num_tokens": 17909488.0,
|
|
"step": 7075
|
|
},
|
|
{
|
|
"entropy": 6.375418043136596,
|
|
"epoch": 0.8170802077322562,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004944299160909495,
|
|
"loss": 6.1777,
|
|
"mean_token_accuracy": 0.16011893153190612,
|
|
"num_tokens": 17922851.0,
|
|
"step": 7080
|
|
},
|
|
{
|
|
"entropy": 6.360374975204468,
|
|
"epoch": 0.8176572417772648,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000494420787565772,
|
|
"loss": 6.0912,
|
|
"mean_token_accuracy": 0.1776879087090492,
|
|
"num_tokens": 17934586.0,
|
|
"step": 7085
|
|
},
|
|
{
|
|
"entropy": 6.310594892501831,
|
|
"epoch": 0.8182342758222735,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004944116516604852,
|
|
"loss": 6.1938,
|
|
"mean_token_accuracy": 0.16266183257102967,
|
|
"num_tokens": 17947637.0,
|
|
"step": 7090
|
|
},
|
|
{
|
|
"entropy": 6.354241228103637,
|
|
"epoch": 0.8188113098672821,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004944025083753965,
|
|
"loss": 6.1478,
|
|
"mean_token_accuracy": 0.16983843892812728,
|
|
"num_tokens": 17959601.0,
|
|
"step": 7095
|
|
},
|
|
{
|
|
"entropy": 6.352024364471435,
|
|
"epoch": 0.8193883439122909,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004943933577108133,
|
|
"loss": 6.1451,
|
|
"mean_token_accuracy": 0.17091177701950072,
|
|
"num_tokens": 17972568.0,
|
|
"step": 7100
|
|
},
|
|
{
|
|
"entropy": 6.36655969619751,
|
|
"epoch": 0.8199653779572995,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004943841996670436,
|
|
"loss": 6.1432,
|
|
"mean_token_accuracy": 0.17002700716257096,
|
|
"num_tokens": 17984665.0,
|
|
"step": 7105
|
|
},
|
|
{
|
|
"entropy": 6.368354558944702,
|
|
"epoch": 0.8205424120023082,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004943750342443953,
|
|
"loss": 6.1736,
|
|
"mean_token_accuracy": 0.1608754187822342,
|
|
"num_tokens": 17997140.0,
|
|
"step": 7110
|
|
},
|
|
{
|
|
"entropy": 6.355606889724731,
|
|
"epoch": 0.8211194460473168,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004943658614431767,
|
|
"loss": 6.1686,
|
|
"mean_token_accuracy": 0.17113997787237167,
|
|
"num_tokens": 18009361.0,
|
|
"step": 7115
|
|
},
|
|
{
|
|
"entropy": 6.314159536361695,
|
|
"epoch": 0.8216964800923254,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004943566812636963,
|
|
"loss": 6.1279,
|
|
"mean_token_accuracy": 0.16654883027076722,
|
|
"num_tokens": 18021233.0,
|
|
"step": 7120
|
|
},
|
|
{
|
|
"entropy": 6.274408292770386,
|
|
"epoch": 0.8222735141373341,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.000494347493706263,
|
|
"loss": 5.995,
|
|
"mean_token_accuracy": 0.18178044259548187,
|
|
"num_tokens": 18034086.0,
|
|
"step": 7125
|
|
},
|
|
{
|
|
"entropy": 6.336907291412354,
|
|
"epoch": 0.8228505481823427,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004943382987711856,
|
|
"loss": 6.0874,
|
|
"mean_token_accuracy": 0.1737489327788353,
|
|
"num_tokens": 18046604.0,
|
|
"step": 7130
|
|
},
|
|
{
|
|
"entropy": 6.3122608184814455,
|
|
"epoch": 0.8234275822273515,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004943290964587734,
|
|
"loss": 6.1347,
|
|
"mean_token_accuracy": 0.17065211534500122,
|
|
"num_tokens": 18059185.0,
|
|
"step": 7135
|
|
},
|
|
{
|
|
"entropy": 6.315145111083984,
|
|
"epoch": 0.8240046162723601,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.0004943198867693361,
|
|
"loss": 6.0646,
|
|
"mean_token_accuracy": 0.16893559992313384,
|
|
"num_tokens": 18071707.0,
|
|
"step": 7140
|
|
},
|
|
{
|
|
"entropy": 6.3502250671386715,
|
|
"epoch": 0.8245816503173687,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004943106697031833,
|
|
"loss": 6.2012,
|
|
"mean_token_accuracy": 0.16397445499897004,
|
|
"num_tokens": 18084657.0,
|
|
"step": 7145
|
|
},
|
|
{
|
|
"entropy": 6.363767099380493,
|
|
"epoch": 0.8251586843623774,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004943014452606251,
|
|
"loss": 6.1819,
|
|
"mean_token_accuracy": 0.1693504735827446,
|
|
"num_tokens": 18097084.0,
|
|
"step": 7150
|
|
},
|
|
{
|
|
"entropy": 6.316252565383911,
|
|
"epoch": 0.825735718407386,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004942922134419717,
|
|
"loss": 6.1042,
|
|
"mean_token_accuracy": 0.1739456221461296,
|
|
"num_tokens": 18109306.0,
|
|
"step": 7155
|
|
},
|
|
{
|
|
"entropy": 6.270631885528564,
|
|
"epoch": 0.8263127524523947,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004942829742475336,
|
|
"loss": 6.0179,
|
|
"mean_token_accuracy": 0.1746932238340378,
|
|
"num_tokens": 18120300.0,
|
|
"step": 7160
|
|
},
|
|
{
|
|
"entropy": 6.370210361480713,
|
|
"epoch": 0.8268897864974033,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004942737276776217,
|
|
"loss": 6.1463,
|
|
"mean_token_accuracy": 0.16830987781286239,
|
|
"num_tokens": 18132251.0,
|
|
"step": 7165
|
|
},
|
|
{
|
|
"entropy": 6.304517507553101,
|
|
"epoch": 0.827466820542412,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004942644737325468,
|
|
"loss": 6.0868,
|
|
"mean_token_accuracy": 0.17027855664491653,
|
|
"num_tokens": 18146198.0,
|
|
"step": 7170
|
|
},
|
|
{
|
|
"entropy": 6.336374759674072,
|
|
"epoch": 0.8280438545874207,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004942552124126202,
|
|
"loss": 6.1675,
|
|
"mean_token_accuracy": 0.16987940073013305,
|
|
"num_tokens": 18159493.0,
|
|
"step": 7175
|
|
},
|
|
{
|
|
"entropy": 6.277276945114136,
|
|
"epoch": 0.8286208886324293,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004942459437181535,
|
|
"loss": 6.0566,
|
|
"mean_token_accuracy": 0.17661636918783188,
|
|
"num_tokens": 18172120.0,
|
|
"step": 7180
|
|
},
|
|
{
|
|
"entropy": 6.330974435806274,
|
|
"epoch": 0.829197922677438,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004942366676494584,
|
|
"loss": 6.0871,
|
|
"mean_token_accuracy": 0.17477403432130814,
|
|
"num_tokens": 18184704.0,
|
|
"step": 7185
|
|
},
|
|
{
|
|
"entropy": 6.365555334091186,
|
|
"epoch": 0.8297749567224466,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004942273842068469,
|
|
"loss": 6.2001,
|
|
"mean_token_accuracy": 0.16935209333896636,
|
|
"num_tokens": 18196770.0,
|
|
"step": 7190
|
|
},
|
|
{
|
|
"entropy": 6.337525033950806,
|
|
"epoch": 0.8303519907674553,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004942180933906311,
|
|
"loss": 6.1627,
|
|
"mean_token_accuracy": 0.1656957224011421,
|
|
"num_tokens": 18209987.0,
|
|
"step": 7195
|
|
},
|
|
{
|
|
"entropy": 6.353645181655883,
|
|
"epoch": 0.8309290248124639,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004942087952011237,
|
|
"loss": 6.1678,
|
|
"mean_token_accuracy": 0.16775988191366195,
|
|
"num_tokens": 18224864.0,
|
|
"step": 7200
|
|
},
|
|
{
|
|
"entropy": 6.3907112121582035,
|
|
"epoch": 0.8315060588574726,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004941994896386374,
|
|
"loss": 6.1344,
|
|
"mean_token_accuracy": 0.17219291627407074,
|
|
"num_tokens": 18237270.0,
|
|
"step": 7205
|
|
},
|
|
{
|
|
"entropy": 6.274297666549683,
|
|
"epoch": 0.8320830929024813,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004941901767034851,
|
|
"loss": 6.1408,
|
|
"mean_token_accuracy": 0.16556089669466018,
|
|
"num_tokens": 18251227.0,
|
|
"step": 7210
|
|
},
|
|
{
|
|
"entropy": 6.282907962799072,
|
|
"epoch": 0.8326601269474899,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004941808563959802,
|
|
"loss": 6.0705,
|
|
"mean_token_accuracy": 0.17843919098377228,
|
|
"num_tokens": 18264762.0,
|
|
"step": 7215
|
|
},
|
|
{
|
|
"entropy": 6.360298109054566,
|
|
"epoch": 0.8332371609924986,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004941715287164359,
|
|
"loss": 6.1437,
|
|
"mean_token_accuracy": 0.16581116169691085,
|
|
"num_tokens": 18276836.0,
|
|
"step": 7220
|
|
},
|
|
{
|
|
"entropy": 6.303939580917358,
|
|
"epoch": 0.8338141950375072,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004941621936651661,
|
|
"loss": 6.1484,
|
|
"mean_token_accuracy": 0.1756073772907257,
|
|
"num_tokens": 18290362.0,
|
|
"step": 7225
|
|
},
|
|
{
|
|
"entropy": 6.3812695980072025,
|
|
"epoch": 0.8343912290825158,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004941528512424849,
|
|
"loss": 6.1855,
|
|
"mean_token_accuracy": 0.1699386864900589,
|
|
"num_tokens": 18303924.0,
|
|
"step": 7230
|
|
},
|
|
{
|
|
"entropy": 6.256930303573609,
|
|
"epoch": 0.8349682631275245,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004941435014487064,
|
|
"loss": 6.0611,
|
|
"mean_token_accuracy": 0.17561491429805756,
|
|
"num_tokens": 18316490.0,
|
|
"step": 7235
|
|
},
|
|
{
|
|
"entropy": 6.353484201431274,
|
|
"epoch": 0.8355452971725332,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.000494134144284145,
|
|
"loss": 6.1025,
|
|
"mean_token_accuracy": 0.1660989746451378,
|
|
"num_tokens": 18328819.0,
|
|
"step": 7240
|
|
},
|
|
{
|
|
"entropy": 6.304037189483642,
|
|
"epoch": 0.8361223312175419,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004941247797491156,
|
|
"loss": 6.0602,
|
|
"mean_token_accuracy": 0.1737822934985161,
|
|
"num_tokens": 18341872.0,
|
|
"step": 7245
|
|
},
|
|
{
|
|
"entropy": 6.340513896942139,
|
|
"epoch": 0.8366993652625505,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004941154078439329,
|
|
"loss": 6.1038,
|
|
"mean_token_accuracy": 0.16772937178611755,
|
|
"num_tokens": 18354644.0,
|
|
"step": 7250
|
|
},
|
|
{
|
|
"entropy": 6.343120098114014,
|
|
"epoch": 0.8372763993075591,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004941060285689126,
|
|
"loss": 6.1118,
|
|
"mean_token_accuracy": 0.16333391666412353,
|
|
"num_tokens": 18367581.0,
|
|
"step": 7255
|
|
},
|
|
{
|
|
"entropy": 6.312895965576172,
|
|
"epoch": 0.8378534333525678,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004940966419243695,
|
|
"loss": 6.1211,
|
|
"mean_token_accuracy": 0.17633418142795562,
|
|
"num_tokens": 18381123.0,
|
|
"step": 7260
|
|
},
|
|
{
|
|
"entropy": 6.286964797973633,
|
|
"epoch": 0.8384304673975764,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.00049408724791062,
|
|
"loss": 6.0478,
|
|
"mean_token_accuracy": 0.17762214839458465,
|
|
"num_tokens": 18395711.0,
|
|
"step": 7265
|
|
},
|
|
{
|
|
"entropy": 6.341670942306519,
|
|
"epoch": 0.8390075014425851,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004940778465279797,
|
|
"loss": 6.182,
|
|
"mean_token_accuracy": 0.16106790006160737,
|
|
"num_tokens": 18409434.0,
|
|
"step": 7270
|
|
},
|
|
{
|
|
"entropy": 6.362900352478027,
|
|
"epoch": 0.8395845354875938,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004940684377767647,
|
|
"loss": 6.1384,
|
|
"mean_token_accuracy": 0.16549608409404754,
|
|
"num_tokens": 18423138.0,
|
|
"step": 7275
|
|
},
|
|
{
|
|
"entropy": 6.352203893661499,
|
|
"epoch": 0.8401615695326025,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004940590216572916,
|
|
"loss": 6.1294,
|
|
"mean_token_accuracy": 0.1653735965490341,
|
|
"num_tokens": 18435655.0,
|
|
"step": 7280
|
|
},
|
|
{
|
|
"entropy": 6.256585645675659,
|
|
"epoch": 0.8407386035776111,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004940495981698772,
|
|
"loss": 6.0172,
|
|
"mean_token_accuracy": 0.1793304905295372,
|
|
"num_tokens": 18448344.0,
|
|
"step": 7285
|
|
},
|
|
{
|
|
"entropy": 6.291251516342163,
|
|
"epoch": 0.8413156376226197,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004940401673148384,
|
|
"loss": 6.0295,
|
|
"mean_token_accuracy": 0.1761486664414406,
|
|
"num_tokens": 18460409.0,
|
|
"step": 7290
|
|
},
|
|
{
|
|
"entropy": 6.3027403354644775,
|
|
"epoch": 0.8418926716676284,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004940307290924923,
|
|
"loss": 6.1387,
|
|
"mean_token_accuracy": 0.16713238060474395,
|
|
"num_tokens": 18473650.0,
|
|
"step": 7295
|
|
},
|
|
{
|
|
"entropy": 6.2306482791900635,
|
|
"epoch": 0.842469705712637,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004940212835031565,
|
|
"loss": 6.0544,
|
|
"mean_token_accuracy": 0.17755862772464753,
|
|
"num_tokens": 18487108.0,
|
|
"step": 7300
|
|
},
|
|
{
|
|
"entropy": 6.340290069580078,
|
|
"epoch": 0.8430467397576457,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004940118305471486,
|
|
"loss": 6.0866,
|
|
"mean_token_accuracy": 0.17275313138961793,
|
|
"num_tokens": 18500377.0,
|
|
"step": 7305
|
|
},
|
|
{
|
|
"entropy": 6.35522575378418,
|
|
"epoch": 0.8436237738026544,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004940023702247866,
|
|
"loss": 6.151,
|
|
"mean_token_accuracy": 0.16355671882629394,
|
|
"num_tokens": 18513257.0,
|
|
"step": 7310
|
|
},
|
|
{
|
|
"entropy": 6.301067304611206,
|
|
"epoch": 0.844200807847663,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004939929025363886,
|
|
"loss": 6.1754,
|
|
"mean_token_accuracy": 0.16708555519580842,
|
|
"num_tokens": 18525438.0,
|
|
"step": 7315
|
|
},
|
|
{
|
|
"entropy": 6.382996892929077,
|
|
"epoch": 0.8447778418926717,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004939834274822731,
|
|
"loss": 6.1996,
|
|
"mean_token_accuracy": 0.16973353773355485,
|
|
"num_tokens": 18537937.0,
|
|
"step": 7320
|
|
},
|
|
{
|
|
"entropy": 6.446295928955078,
|
|
"epoch": 0.8453548759376803,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004939739450627588,
|
|
"loss": 6.2119,
|
|
"mean_token_accuracy": 0.1619974046945572,
|
|
"num_tokens": 18551629.0,
|
|
"step": 7325
|
|
},
|
|
{
|
|
"entropy": 6.287714242935181,
|
|
"epoch": 0.845931909982689,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004939644552781647,
|
|
"loss": 6.1511,
|
|
"mean_token_accuracy": 0.16715734750032424,
|
|
"num_tokens": 18564549.0,
|
|
"step": 7330
|
|
},
|
|
{
|
|
"entropy": 6.365425777435303,
|
|
"epoch": 0.8465089440276976,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004939549581288099,
|
|
"loss": 6.1246,
|
|
"mean_token_accuracy": 0.17667931765317918,
|
|
"num_tokens": 18576536.0,
|
|
"step": 7335
|
|
},
|
|
{
|
|
"entropy": 6.259944009780884,
|
|
"epoch": 0.8470859780727062,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004939454536150138,
|
|
"loss": 6.1022,
|
|
"mean_token_accuracy": 0.1768004596233368,
|
|
"num_tokens": 18588655.0,
|
|
"step": 7340
|
|
},
|
|
{
|
|
"entropy": 6.272363328933716,
|
|
"epoch": 0.847663012117715,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.000493935941737096,
|
|
"loss": 6.0528,
|
|
"mean_token_accuracy": 0.18020471781492234,
|
|
"num_tokens": 18602152.0,
|
|
"step": 7345
|
|
},
|
|
{
|
|
"entropy": 6.318509721755982,
|
|
"epoch": 0.8482400461627236,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004939264224953768,
|
|
"loss": 6.0656,
|
|
"mean_token_accuracy": 0.17690059542655945,
|
|
"num_tokens": 18615391.0,
|
|
"step": 7350
|
|
},
|
|
{
|
|
"entropy": 6.310171890258789,
|
|
"epoch": 0.8488170802077323,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.000493916895890176,
|
|
"loss": 6.1261,
|
|
"mean_token_accuracy": 0.16611895263195037,
|
|
"num_tokens": 18629987.0,
|
|
"step": 7355
|
|
},
|
|
{
|
|
"entropy": 6.41483244895935,
|
|
"epoch": 0.8493941142527409,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.000493907361921814,
|
|
"loss": 6.2245,
|
|
"mean_token_accuracy": 0.16478994786739348,
|
|
"num_tokens": 18643064.0,
|
|
"step": 7360
|
|
},
|
|
{
|
|
"entropy": 6.428786897659302,
|
|
"epoch": 0.8499711482977496,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004938978205906118,
|
|
"loss": 6.1505,
|
|
"mean_token_accuracy": 0.16683144271373748,
|
|
"num_tokens": 18654950.0,
|
|
"step": 7365
|
|
},
|
|
{
|
|
"entropy": 6.333185768127441,
|
|
"epoch": 0.8505481823427582,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004938882718968901,
|
|
"loss": 6.1116,
|
|
"mean_token_accuracy": 0.16756715178489684,
|
|
"num_tokens": 18666318.0,
|
|
"step": 7370
|
|
},
|
|
{
|
|
"entropy": 6.29099555015564,
|
|
"epoch": 0.8511252163877668,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004938787158409702,
|
|
"loss": 6.0553,
|
|
"mean_token_accuracy": 0.17675474882125855,
|
|
"num_tokens": 18677357.0,
|
|
"step": 7375
|
|
},
|
|
{
|
|
"entropy": 6.326018810272217,
|
|
"epoch": 0.8517022504327756,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004938691524231733,
|
|
"loss": 6.089,
|
|
"mean_token_accuracy": 0.17274203151464462,
|
|
"num_tokens": 18689563.0,
|
|
"step": 7380
|
|
},
|
|
{
|
|
"entropy": 6.243793678283692,
|
|
"epoch": 0.8522792844777842,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004938595816438212,
|
|
"loss": 6.0914,
|
|
"mean_token_accuracy": 0.17055510282516478,
|
|
"num_tokens": 18701442.0,
|
|
"step": 7385
|
|
},
|
|
{
|
|
"entropy": 6.345879173278808,
|
|
"epoch": 0.8528563185227929,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004938500035032358,
|
|
"loss": 6.1358,
|
|
"mean_token_accuracy": 0.16795708388090133,
|
|
"num_tokens": 18714942.0,
|
|
"step": 7390
|
|
},
|
|
{
|
|
"entropy": 6.301207065582275,
|
|
"epoch": 0.8534333525678015,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004938404180017392,
|
|
"loss": 6.1479,
|
|
"mean_token_accuracy": 0.17592194825410842,
|
|
"num_tokens": 18727752.0,
|
|
"step": 7395
|
|
},
|
|
{
|
|
"entropy": 6.375054931640625,
|
|
"epoch": 0.8540103866128101,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004938308251396539,
|
|
"loss": 6.1466,
|
|
"mean_token_accuracy": 0.1679084911942482,
|
|
"num_tokens": 18741719.0,
|
|
"step": 7400
|
|
},
|
|
{
|
|
"entropy": 6.36941819190979,
|
|
"epoch": 0.8545874206578188,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004938212249173024,
|
|
"loss": 6.1028,
|
|
"mean_token_accuracy": 0.16361988335847855,
|
|
"num_tokens": 18754472.0,
|
|
"step": 7405
|
|
},
|
|
{
|
|
"entropy": 6.340943050384522,
|
|
"epoch": 0.8551644547028274,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004938116173350078,
|
|
"loss": 6.1826,
|
|
"mean_token_accuracy": 0.17019001990556717,
|
|
"num_tokens": 18766691.0,
|
|
"step": 7410
|
|
},
|
|
{
|
|
"entropy": 6.338998222351075,
|
|
"epoch": 0.8557414887478362,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004938020023930932,
|
|
"loss": 6.1005,
|
|
"mean_token_accuracy": 0.17442042529582977,
|
|
"num_tokens": 18780083.0,
|
|
"step": 7415
|
|
},
|
|
{
|
|
"entropy": 6.400058031082153,
|
|
"epoch": 0.8563185227928448,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004937923800918817,
|
|
"loss": 6.1818,
|
|
"mean_token_accuracy": 0.16902839243412018,
|
|
"num_tokens": 18792559.0,
|
|
"step": 7420
|
|
},
|
|
{
|
|
"entropy": 6.251423120498657,
|
|
"epoch": 0.8568955568378535,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004937827504316974,
|
|
"loss": 6.0284,
|
|
"mean_token_accuracy": 0.18225133568048477,
|
|
"num_tokens": 18805089.0,
|
|
"step": 7425
|
|
},
|
|
{
|
|
"entropy": 6.211493444442749,
|
|
"epoch": 0.8574725908828621,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004937731134128639,
|
|
"loss": 6.0332,
|
|
"mean_token_accuracy": 0.1719786286354065,
|
|
"num_tokens": 18818476.0,
|
|
"step": 7430
|
|
},
|
|
{
|
|
"entropy": 6.3511707305908205,
|
|
"epoch": 0.8580496249278707,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004937634690357054,
|
|
"loss": 6.2004,
|
|
"mean_token_accuracy": 0.16616718769073485,
|
|
"num_tokens": 18830785.0,
|
|
"step": 7435
|
|
},
|
|
{
|
|
"entropy": 6.408740901947022,
|
|
"epoch": 0.8586266589728794,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004937538173005462,
|
|
"loss": 6.1835,
|
|
"mean_token_accuracy": 0.16461452692747117,
|
|
"num_tokens": 18844029.0,
|
|
"step": 7440
|
|
},
|
|
{
|
|
"entropy": 6.291387891769409,
|
|
"epoch": 0.859203693017888,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004937441582077111,
|
|
"loss": 6.1483,
|
|
"mean_token_accuracy": 0.17121766805648803,
|
|
"num_tokens": 18857468.0,
|
|
"step": 7445
|
|
},
|
|
{
|
|
"entropy": 6.330543279647827,
|
|
"epoch": 0.8597807270628968,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0004937344917575249,
|
|
"loss": 6.0788,
|
|
"mean_token_accuracy": 0.16908426731824874,
|
|
"num_tokens": 18870487.0,
|
|
"step": 7450
|
|
},
|
|
{
|
|
"entropy": 6.330011510848999,
|
|
"epoch": 0.8603577611079054,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004937248179503127,
|
|
"loss": 6.1243,
|
|
"mean_token_accuracy": 0.16731321513652803,
|
|
"num_tokens": 18883273.0,
|
|
"step": 7455
|
|
},
|
|
{
|
|
"entropy": 6.275924921035767,
|
|
"epoch": 0.860934795152914,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004937151367863998,
|
|
"loss": 6.1026,
|
|
"mean_token_accuracy": 0.1796159490942955,
|
|
"num_tokens": 18895863.0,
|
|
"step": 7460
|
|
},
|
|
{
|
|
"entropy": 6.320479679107666,
|
|
"epoch": 0.8615118291979227,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.000493705448266112,
|
|
"loss": 6.1605,
|
|
"mean_token_accuracy": 0.17161056995391846,
|
|
"num_tokens": 18909406.0,
|
|
"step": 7465
|
|
},
|
|
{
|
|
"entropy": 6.242699718475341,
|
|
"epoch": 0.8620888632429313,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004936957523897752,
|
|
"loss": 6.0972,
|
|
"mean_token_accuracy": 0.17375921010971068,
|
|
"num_tokens": 18922794.0,
|
|
"step": 7470
|
|
},
|
|
{
|
|
"entropy": 6.2935127258300785,
|
|
"epoch": 0.86266589728794,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004936860491577153,
|
|
"loss": 6.1127,
|
|
"mean_token_accuracy": 0.17393147498369216,
|
|
"num_tokens": 18936511.0,
|
|
"step": 7475
|
|
},
|
|
{
|
|
"entropy": 6.371639537811279,
|
|
"epoch": 0.8632429313329486,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004936763385702588,
|
|
"loss": 6.1866,
|
|
"mean_token_accuracy": 0.16243817955255507,
|
|
"num_tokens": 18948164.0,
|
|
"step": 7480
|
|
},
|
|
{
|
|
"entropy": 6.3689943790435795,
|
|
"epoch": 0.8638199653779572,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004936666206277322,
|
|
"loss": 6.1756,
|
|
"mean_token_accuracy": 0.16454965472221375,
|
|
"num_tokens": 18960608.0,
|
|
"step": 7485
|
|
},
|
|
{
|
|
"entropy": 6.296132802963257,
|
|
"epoch": 0.864396999422966,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004936568953304624,
|
|
"loss": 6.031,
|
|
"mean_token_accuracy": 0.18456006944179534,
|
|
"num_tokens": 18972266.0,
|
|
"step": 7490
|
|
},
|
|
{
|
|
"entropy": 6.284459924697876,
|
|
"epoch": 0.8649740334679746,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004936471626787766,
|
|
"loss": 6.0742,
|
|
"mean_token_accuracy": 0.17050421088933945,
|
|
"num_tokens": 18984518.0,
|
|
"step": 7495
|
|
},
|
|
{
|
|
"entropy": 6.2937500953674315,
|
|
"epoch": 0.8655510675129833,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004936374226730022,
|
|
"loss": 6.1031,
|
|
"mean_token_accuracy": 0.17538830041885375,
|
|
"num_tokens": 18998611.0,
|
|
"step": 7500
|
|
},
|
|
{
|
|
"entropy": 6.312690019607544,
|
|
"epoch": 0.8661281015579919,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004936276753134666,
|
|
"loss": 6.0866,
|
|
"mean_token_accuracy": 0.17135524600744248,
|
|
"num_tokens": 19012117.0,
|
|
"step": 7505
|
|
},
|
|
{
|
|
"entropy": 6.209308815002442,
|
|
"epoch": 0.8667051356030006,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004936179206004976,
|
|
"loss": 6.003,
|
|
"mean_token_accuracy": 0.1783718004822731,
|
|
"num_tokens": 19024075.0,
|
|
"step": 7510
|
|
},
|
|
{
|
|
"entropy": 6.337769603729248,
|
|
"epoch": 0.8672821696480092,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004936081585344236,
|
|
"loss": 6.1795,
|
|
"mean_token_accuracy": 0.16607438176870346,
|
|
"num_tokens": 19037350.0,
|
|
"step": 7515
|
|
},
|
|
{
|
|
"entropy": 6.41182656288147,
|
|
"epoch": 0.8678592036930178,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004935983891155727,
|
|
"loss": 6.1854,
|
|
"mean_token_accuracy": 0.1657259300351143,
|
|
"num_tokens": 19049438.0,
|
|
"step": 7520
|
|
},
|
|
{
|
|
"entropy": 6.26032190322876,
|
|
"epoch": 0.8684362377380266,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004935886123442737,
|
|
"loss": 6.139,
|
|
"mean_token_accuracy": 0.1676519051194191,
|
|
"num_tokens": 19061689.0,
|
|
"step": 7525
|
|
},
|
|
{
|
|
"entropy": 6.391968154907227,
|
|
"epoch": 0.8690132717830352,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004935788282208551,
|
|
"loss": 6.1892,
|
|
"mean_token_accuracy": 0.1616821691393852,
|
|
"num_tokens": 19075606.0,
|
|
"step": 7530
|
|
},
|
|
{
|
|
"entropy": 6.353225660324097,
|
|
"epoch": 0.8695903058280439,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004935690367456464,
|
|
"loss": 6.1027,
|
|
"mean_token_accuracy": 0.17230516970157622,
|
|
"num_tokens": 19088248.0,
|
|
"step": 7535
|
|
},
|
|
{
|
|
"entropy": 6.297004318237304,
|
|
"epoch": 0.8701673398730525,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004935592379189766,
|
|
"loss": 6.0805,
|
|
"mean_token_accuracy": 0.17194265127182007,
|
|
"num_tokens": 19102480.0,
|
|
"step": 7540
|
|
},
|
|
{
|
|
"entropy": 6.260242652893067,
|
|
"epoch": 0.8707443739180611,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004935494317411754,
|
|
"loss": 6.0698,
|
|
"mean_token_accuracy": 0.18137836903333665,
|
|
"num_tokens": 19114454.0,
|
|
"step": 7545
|
|
},
|
|
{
|
|
"entropy": 6.308724689483642,
|
|
"epoch": 0.8713214079630698,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004935396182125726,
|
|
"loss": 6.1046,
|
|
"mean_token_accuracy": 0.17647117376327515,
|
|
"num_tokens": 19126709.0,
|
|
"step": 7550
|
|
},
|
|
{
|
|
"entropy": 6.270776891708374,
|
|
"epoch": 0.8718984420080784,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004935297973334983,
|
|
"loss": 6.1159,
|
|
"mean_token_accuracy": 0.17235394865274428,
|
|
"num_tokens": 19138831.0,
|
|
"step": 7555
|
|
},
|
|
{
|
|
"entropy": 6.326720905303955,
|
|
"epoch": 0.8724754760530872,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004935199691042828,
|
|
"loss": 5.9959,
|
|
"mean_token_accuracy": 0.1755734920501709,
|
|
"num_tokens": 19151555.0,
|
|
"step": 7560
|
|
},
|
|
{
|
|
"entropy": 6.307219934463501,
|
|
"epoch": 0.8730525100980958,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004935101335252568,
|
|
"loss": 6.0574,
|
|
"mean_token_accuracy": 0.17710819989442825,
|
|
"num_tokens": 19164557.0,
|
|
"step": 7565
|
|
},
|
|
{
|
|
"entropy": 6.3488623142242435,
|
|
"epoch": 0.8736295441431045,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004935002905967509,
|
|
"loss": 6.1943,
|
|
"mean_token_accuracy": 0.1654577985405922,
|
|
"num_tokens": 19177081.0,
|
|
"step": 7570
|
|
},
|
|
{
|
|
"entropy": 6.294558429718018,
|
|
"epoch": 0.8742065781881131,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004934904403190963,
|
|
"loss": 6.0486,
|
|
"mean_token_accuracy": 0.17522133886814117,
|
|
"num_tokens": 19190209.0,
|
|
"step": 7575
|
|
},
|
|
{
|
|
"entropy": 6.328292036056519,
|
|
"epoch": 0.8747836122331217,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004934805826926242,
|
|
"loss": 6.097,
|
|
"mean_token_accuracy": 0.1691294565796852,
|
|
"num_tokens": 19202262.0,
|
|
"step": 7580
|
|
},
|
|
{
|
|
"entropy": 6.295896530151367,
|
|
"epoch": 0.8753606462781304,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004934707177176663,
|
|
"loss": 6.1196,
|
|
"mean_token_accuracy": 0.17082754224538804,
|
|
"num_tokens": 19214752.0,
|
|
"step": 7585
|
|
},
|
|
{
|
|
"entropy": 6.347747945785523,
|
|
"epoch": 0.875937680323139,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004934608453945543,
|
|
"loss": 6.1597,
|
|
"mean_token_accuracy": 0.16672886908054352,
|
|
"num_tokens": 19227320.0,
|
|
"step": 7590
|
|
},
|
|
{
|
|
"entropy": 6.350468921661377,
|
|
"epoch": 0.8765147143681478,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004934509657236203,
|
|
"loss": 6.1475,
|
|
"mean_token_accuracy": 0.16858987361192704,
|
|
"num_tokens": 19239571.0,
|
|
"step": 7595
|
|
},
|
|
{
|
|
"entropy": 6.335233497619629,
|
|
"epoch": 0.8770917484131564,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004934410787051965,
|
|
"loss": 6.0903,
|
|
"mean_token_accuracy": 0.1747870922088623,
|
|
"num_tokens": 19252242.0,
|
|
"step": 7600
|
|
},
|
|
{
|
|
"entropy": 6.353438425064087,
|
|
"epoch": 0.877668782458165,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004934311843396157,
|
|
"loss": 6.1536,
|
|
"mean_token_accuracy": 0.16885416358709335,
|
|
"num_tokens": 19265501.0,
|
|
"step": 7605
|
|
},
|
|
{
|
|
"entropy": 6.254431247711182,
|
|
"epoch": 0.8782458165031737,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004934212826272104,
|
|
"loss": 6.0048,
|
|
"mean_token_accuracy": 0.18254768401384353,
|
|
"num_tokens": 19278152.0,
|
|
"step": 7610
|
|
},
|
|
{
|
|
"entropy": 6.249722099304199,
|
|
"epoch": 0.8788228505481823,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004934113735683137,
|
|
"loss": 6.1195,
|
|
"mean_token_accuracy": 0.1660146526992321,
|
|
"num_tokens": 19290555.0,
|
|
"step": 7615
|
|
},
|
|
{
|
|
"entropy": 6.320179605484009,
|
|
"epoch": 0.879399884593191,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.000493401457163259,
|
|
"loss": 6.0742,
|
|
"mean_token_accuracy": 0.17674531638622284,
|
|
"num_tokens": 19302866.0,
|
|
"step": 7620
|
|
},
|
|
{
|
|
"entropy": 6.364961194992065,
|
|
"epoch": 0.8799769186381996,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004933915334123798,
|
|
"loss": 6.1585,
|
|
"mean_token_accuracy": 0.16327778846025467,
|
|
"num_tokens": 19315577.0,
|
|
"step": 7625
|
|
},
|
|
{
|
|
"entropy": 6.353976726531982,
|
|
"epoch": 0.8805539526832084,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004933816023160099,
|
|
"loss": 6.1489,
|
|
"mean_token_accuracy": 0.16975017488002778,
|
|
"num_tokens": 19328593.0,
|
|
"step": 7630
|
|
},
|
|
{
|
|
"entropy": 6.3438011646270756,
|
|
"epoch": 0.881130986728217,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004933716638744832,
|
|
"loss": 6.1096,
|
|
"mean_token_accuracy": 0.17835207879543305,
|
|
"num_tokens": 19341669.0,
|
|
"step": 7635
|
|
},
|
|
{
|
|
"entropy": 6.283733320236206,
|
|
"epoch": 0.8817080207732256,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.000493361718088134,
|
|
"loss": 6.0937,
|
|
"mean_token_accuracy": 0.17275342345237732,
|
|
"num_tokens": 19354268.0,
|
|
"step": 7640
|
|
},
|
|
{
|
|
"entropy": 6.345350837707519,
|
|
"epoch": 0.8822850548182343,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.000493351764957297,
|
|
"loss": 6.1448,
|
|
"mean_token_accuracy": 0.16772449910640716,
|
|
"num_tokens": 19367676.0,
|
|
"step": 7645
|
|
},
|
|
{
|
|
"entropy": 6.375120687484741,
|
|
"epoch": 0.8828620888632429,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004933418044823068,
|
|
"loss": 6.0982,
|
|
"mean_token_accuracy": 0.17239805161952973,
|
|
"num_tokens": 19380726.0,
|
|
"step": 7650
|
|
},
|
|
{
|
|
"entropy": 6.311630487442017,
|
|
"epoch": 0.8834391229082516,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004933318366634984,
|
|
"loss": 6.1146,
|
|
"mean_token_accuracy": 0.16780938059091569,
|
|
"num_tokens": 19392917.0,
|
|
"step": 7655
|
|
},
|
|
{
|
|
"entropy": 6.36509075164795,
|
|
"epoch": 0.8840161569532602,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004933218615012072,
|
|
"loss": 6.1418,
|
|
"mean_token_accuracy": 0.17104663252830504,
|
|
"num_tokens": 19406026.0,
|
|
"step": 7660
|
|
},
|
|
{
|
|
"entropy": 6.322006559371948,
|
|
"epoch": 0.8845931909982689,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004933118789957687,
|
|
"loss": 6.1075,
|
|
"mean_token_accuracy": 0.17266625314950942,
|
|
"num_tokens": 19418612.0,
|
|
"step": 7665
|
|
},
|
|
{
|
|
"entropy": 6.3031665802001955,
|
|
"epoch": 0.8851702250432776,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004933018891475186,
|
|
"loss": 6.1445,
|
|
"mean_token_accuracy": 0.16820344775915147,
|
|
"num_tokens": 19430746.0,
|
|
"step": 7670
|
|
},
|
|
{
|
|
"entropy": 6.3470458984375,
|
|
"epoch": 0.8857472590882862,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004932918919567927,
|
|
"loss": 6.1882,
|
|
"mean_token_accuracy": 0.16353080421686172,
|
|
"num_tokens": 19443043.0,
|
|
"step": 7675
|
|
},
|
|
{
|
|
"entropy": 6.37825984954834,
|
|
"epoch": 0.8863242931332949,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0004932818874239275,
|
|
"loss": 6.1202,
|
|
"mean_token_accuracy": 0.1737432137131691,
|
|
"num_tokens": 19456463.0,
|
|
"step": 7680
|
|
},
|
|
{
|
|
"entropy": 6.364214897155762,
|
|
"epoch": 0.8869013271783035,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004932718755492595,
|
|
"loss": 6.1201,
|
|
"mean_token_accuracy": 0.1649479940533638,
|
|
"num_tokens": 19468108.0,
|
|
"step": 7685
|
|
},
|
|
{
|
|
"entropy": 6.3020881652832035,
|
|
"epoch": 0.8874783612233121,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004932618563331254,
|
|
"loss": 6.1433,
|
|
"mean_token_accuracy": 0.16941626369953156,
|
|
"num_tokens": 19480741.0,
|
|
"step": 7690
|
|
},
|
|
{
|
|
"entropy": 6.326077938079834,
|
|
"epoch": 0.8880553952683208,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004932518297758622,
|
|
"loss": 6.076,
|
|
"mean_token_accuracy": 0.17261420786380768,
|
|
"num_tokens": 19492996.0,
|
|
"step": 7695
|
|
},
|
|
{
|
|
"entropy": 6.355397272109985,
|
|
"epoch": 0.8886324293133295,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004932417958778071,
|
|
"loss": 6.0986,
|
|
"mean_token_accuracy": 0.17076902687549592,
|
|
"num_tokens": 19505513.0,
|
|
"step": 7700
|
|
},
|
|
{
|
|
"entropy": 6.336492681503296,
|
|
"epoch": 0.8892094633583382,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004932317546392976,
|
|
"loss": 6.21,
|
|
"mean_token_accuracy": 0.16580649316310883,
|
|
"num_tokens": 19518244.0,
|
|
"step": 7705
|
|
},
|
|
{
|
|
"entropy": 6.319612598419189,
|
|
"epoch": 0.8897864974033468,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004932217060606714,
|
|
"loss": 6.1084,
|
|
"mean_token_accuracy": 0.17041295915842056,
|
|
"num_tokens": 19530987.0,
|
|
"step": 7710
|
|
},
|
|
{
|
|
"entropy": 6.298898792266845,
|
|
"epoch": 0.8903635314483554,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004932116501422665,
|
|
"loss": 6.0194,
|
|
"mean_token_accuracy": 0.17620886564254762,
|
|
"num_tokens": 19543546.0,
|
|
"step": 7715
|
|
},
|
|
{
|
|
"entropy": 6.3706581592559814,
|
|
"epoch": 0.8909405654933641,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004932015868844211,
|
|
"loss": 6.1005,
|
|
"mean_token_accuracy": 0.16944789588451387,
|
|
"num_tokens": 19556867.0,
|
|
"step": 7720
|
|
},
|
|
{
|
|
"entropy": 6.28508243560791,
|
|
"epoch": 0.8915175995383727,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004931915162874738,
|
|
"loss": 6.0956,
|
|
"mean_token_accuracy": 0.1710782304406166,
|
|
"num_tokens": 19569738.0,
|
|
"step": 7725
|
|
},
|
|
{
|
|
"entropy": 6.323682594299316,
|
|
"epoch": 0.8920946335833814,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004931814383517632,
|
|
"loss": 6.1219,
|
|
"mean_token_accuracy": 0.1682348594069481,
|
|
"num_tokens": 19581701.0,
|
|
"step": 7730
|
|
},
|
|
{
|
|
"entropy": 6.300376987457275,
|
|
"epoch": 0.8926716676283901,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004931713530776284,
|
|
"loss": 6.0451,
|
|
"mean_token_accuracy": 0.1782558888196945,
|
|
"num_tokens": 19593698.0,
|
|
"step": 7735
|
|
},
|
|
{
|
|
"entropy": 6.293739461898804,
|
|
"epoch": 0.8932487016733988,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004931612604654083,
|
|
"loss": 6.111,
|
|
"mean_token_accuracy": 0.17010954022407532,
|
|
"num_tokens": 19605323.0,
|
|
"step": 7740
|
|
},
|
|
{
|
|
"entropy": 6.367745971679687,
|
|
"epoch": 0.8938257357184074,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004931511605154428,
|
|
"loss": 6.149,
|
|
"mean_token_accuracy": 0.16876049041748048,
|
|
"num_tokens": 19616577.0,
|
|
"step": 7745
|
|
},
|
|
{
|
|
"entropy": 6.328808069229126,
|
|
"epoch": 0.894402769763416,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004931410532280711,
|
|
"loss": 6.0588,
|
|
"mean_token_accuracy": 0.17267925143241883,
|
|
"num_tokens": 19629177.0,
|
|
"step": 7750
|
|
},
|
|
{
|
|
"entropy": 6.28749303817749,
|
|
"epoch": 0.8949798038084247,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004931309386036337,
|
|
"loss": 6.0895,
|
|
"mean_token_accuracy": 0.16957223564386367,
|
|
"num_tokens": 19642170.0,
|
|
"step": 7755
|
|
},
|
|
{
|
|
"entropy": 6.2514848709106445,
|
|
"epoch": 0.8955568378534333,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004931208166424704,
|
|
"loss": 6.0435,
|
|
"mean_token_accuracy": 0.17608153969049453,
|
|
"num_tokens": 19655648.0,
|
|
"step": 7760
|
|
},
|
|
{
|
|
"entropy": 6.278182458877564,
|
|
"epoch": 0.896133871898442,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0004931106873449219,
|
|
"loss": 6.0284,
|
|
"mean_token_accuracy": 0.17348928600549698,
|
|
"num_tokens": 19667941.0,
|
|
"step": 7765
|
|
},
|
|
{
|
|
"entropy": 6.33781328201294,
|
|
"epoch": 0.8967109059434507,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004931005507113285,
|
|
"loss": 6.1276,
|
|
"mean_token_accuracy": 0.17680104076862335,
|
|
"num_tokens": 19680523.0,
|
|
"step": 7770
|
|
},
|
|
{
|
|
"entropy": 6.186305379867553,
|
|
"epoch": 0.8972879399884593,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004930904067420317,
|
|
"loss": 6.0853,
|
|
"mean_token_accuracy": 0.17290082722902297,
|
|
"num_tokens": 19692984.0,
|
|
"step": 7775
|
|
},
|
|
{
|
|
"entropy": 6.357298135757446,
|
|
"epoch": 0.897864974033468,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004930802554373723,
|
|
"loss": 6.0333,
|
|
"mean_token_accuracy": 0.17422391027212142,
|
|
"num_tokens": 19705926.0,
|
|
"step": 7780
|
|
},
|
|
{
|
|
"entropy": 6.330864429473877,
|
|
"epoch": 0.8984420080784766,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004930700967976918,
|
|
"loss": 6.1001,
|
|
"mean_token_accuracy": 0.17609639912843705,
|
|
"num_tokens": 19717322.0,
|
|
"step": 7785
|
|
},
|
|
{
|
|
"entropy": 6.271629285812378,
|
|
"epoch": 0.8990190421234853,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.000493059930823332,
|
|
"loss": 6.1051,
|
|
"mean_token_accuracy": 0.1606309935450554,
|
|
"num_tokens": 19730577.0,
|
|
"step": 7790
|
|
},
|
|
{
|
|
"entropy": 6.341148757934571,
|
|
"epoch": 0.8995960761684939,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004930497575146346,
|
|
"loss": 6.1059,
|
|
"mean_token_accuracy": 0.17063196897506713,
|
|
"num_tokens": 19744054.0,
|
|
"step": 7795
|
|
},
|
|
{
|
|
"entropy": 6.293493986129761,
|
|
"epoch": 0.9001731102135025,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004930395768719421,
|
|
"loss": 6.1121,
|
|
"mean_token_accuracy": 0.16904201358556747,
|
|
"num_tokens": 19755898.0,
|
|
"step": 7800
|
|
},
|
|
{
|
|
"entropy": 6.325391483306885,
|
|
"epoch": 0.9007501442585113,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0004930293888955966,
|
|
"loss": 6.1668,
|
|
"mean_token_accuracy": 0.1650414600968361,
|
|
"num_tokens": 19769599.0,
|
|
"step": 7805
|
|
},
|
|
{
|
|
"entropy": 6.402347612380981,
|
|
"epoch": 0.9013271783035199,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.000493019193585941,
|
|
"loss": 6.1494,
|
|
"mean_token_accuracy": 0.16273540258407593,
|
|
"num_tokens": 19783442.0,
|
|
"step": 7810
|
|
},
|
|
{
|
|
"entropy": 6.3388293266296385,
|
|
"epoch": 0.9019042123485286,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000493008990943318,
|
|
"loss": 6.1781,
|
|
"mean_token_accuracy": 0.16862280368804933,
|
|
"num_tokens": 19796039.0,
|
|
"step": 7815
|
|
},
|
|
{
|
|
"entropy": 6.331880807876587,
|
|
"epoch": 0.9024812463935372,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004929987809680709,
|
|
"loss": 6.1204,
|
|
"mean_token_accuracy": 0.17673451751470565,
|
|
"num_tokens": 19808695.0,
|
|
"step": 7820
|
|
},
|
|
{
|
|
"entropy": 6.3146881580352785,
|
|
"epoch": 0.9030582804385459,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004929885636605432,
|
|
"loss": 6.0867,
|
|
"mean_token_accuracy": 0.17208350598812103,
|
|
"num_tokens": 19821173.0,
|
|
"step": 7825
|
|
},
|
|
{
|
|
"entropy": 6.29907455444336,
|
|
"epoch": 0.9036353144835545,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004929783390210784,
|
|
"loss": 6.1543,
|
|
"mean_token_accuracy": 0.1662888213992119,
|
|
"num_tokens": 19833804.0,
|
|
"step": 7830
|
|
},
|
|
{
|
|
"entropy": 6.392211389541626,
|
|
"epoch": 0.9042123485285631,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004929681070500204,
|
|
"loss": 6.093,
|
|
"mean_token_accuracy": 0.16855536997318268,
|
|
"num_tokens": 19845690.0,
|
|
"step": 7835
|
|
},
|
|
{
|
|
"entropy": 6.29790940284729,
|
|
"epoch": 0.9047893825735719,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004929578677477135,
|
|
"loss": 6.1018,
|
|
"mean_token_accuracy": 0.16329824179410934,
|
|
"num_tokens": 19859463.0,
|
|
"step": 7840
|
|
},
|
|
{
|
|
"entropy": 6.232066822052002,
|
|
"epoch": 0.9053664166185805,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004929476211145019,
|
|
"loss": 5.9956,
|
|
"mean_token_accuracy": 0.1839672550559044,
|
|
"num_tokens": 19872168.0,
|
|
"step": 7845
|
|
},
|
|
{
|
|
"entropy": 6.315573358535767,
|
|
"epoch": 0.9059434506635892,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004929373671507303,
|
|
"loss": 6.077,
|
|
"mean_token_accuracy": 0.1776381567120552,
|
|
"num_tokens": 19884927.0,
|
|
"step": 7850
|
|
},
|
|
{
|
|
"entropy": 6.283964967727661,
|
|
"epoch": 0.9065204847085978,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004929271058567436,
|
|
"loss": 6.0684,
|
|
"mean_token_accuracy": 0.17240298688411712,
|
|
"num_tokens": 19897105.0,
|
|
"step": 7855
|
|
},
|
|
{
|
|
"entropy": 6.282452011108399,
|
|
"epoch": 0.9070975187536064,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.000492916837232887,
|
|
"loss": 6.0928,
|
|
"mean_token_accuracy": 0.1691648006439209,
|
|
"num_tokens": 19909973.0,
|
|
"step": 7860
|
|
},
|
|
{
|
|
"entropy": 6.319969892501831,
|
|
"epoch": 0.9076745527986151,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004929065612795058,
|
|
"loss": 6.0996,
|
|
"mean_token_accuracy": 0.1771798312664032,
|
|
"num_tokens": 19923674.0,
|
|
"step": 7865
|
|
},
|
|
{
|
|
"entropy": 6.378555679321289,
|
|
"epoch": 0.9082515868436237,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004928962779969456,
|
|
"loss": 6.1113,
|
|
"mean_token_accuracy": 0.16915464848279954,
|
|
"num_tokens": 19935742.0,
|
|
"step": 7870
|
|
},
|
|
{
|
|
"entropy": 6.290113019943237,
|
|
"epoch": 0.9088286208886325,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004928859873855524,
|
|
"loss": 6.0995,
|
|
"mean_token_accuracy": 0.16852633357048036,
|
|
"num_tokens": 19947945.0,
|
|
"step": 7875
|
|
},
|
|
{
|
|
"entropy": 6.3777001857757565,
|
|
"epoch": 0.9094056549336411,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004928756894456723,
|
|
"loss": 6.0505,
|
|
"mean_token_accuracy": 0.1752867430448532,
|
|
"num_tokens": 19961275.0,
|
|
"step": 7880
|
|
},
|
|
{
|
|
"entropy": 6.3458672046661375,
|
|
"epoch": 0.9099826889786498,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004928653841776515,
|
|
"loss": 6.1244,
|
|
"mean_token_accuracy": 0.16841503977775574,
|
|
"num_tokens": 19973634.0,
|
|
"step": 7885
|
|
},
|
|
{
|
|
"entropy": 6.317721605300903,
|
|
"epoch": 0.9105597230236584,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004928550715818368,
|
|
"loss": 6.1288,
|
|
"mean_token_accuracy": 0.17065613716840744,
|
|
"num_tokens": 19985920.0,
|
|
"step": 7890
|
|
},
|
|
{
|
|
"entropy": 6.338268184661866,
|
|
"epoch": 0.911136757068667,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004928447516585749,
|
|
"loss": 6.1363,
|
|
"mean_token_accuracy": 0.16494126617908478,
|
|
"num_tokens": 19999081.0,
|
|
"step": 7895
|
|
},
|
|
{
|
|
"entropy": 6.207415676116943,
|
|
"epoch": 0.9117137911136757,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.000492834424408213,
|
|
"loss": 6.0687,
|
|
"mean_token_accuracy": 0.1764218255877495,
|
|
"num_tokens": 20012801.0,
|
|
"step": 7900
|
|
},
|
|
{
|
|
"entropy": 6.397945928573608,
|
|
"epoch": 0.9122908251586843,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004928240898310984,
|
|
"loss": 6.1504,
|
|
"mean_token_accuracy": 0.16762229204177856,
|
|
"num_tokens": 20024618.0,
|
|
"step": 7905
|
|
},
|
|
{
|
|
"entropy": 6.352006244659424,
|
|
"epoch": 0.9128678592036931,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004928137479275789,
|
|
"loss": 6.1202,
|
|
"mean_token_accuracy": 0.1704690560698509,
|
|
"num_tokens": 20038587.0,
|
|
"step": 7910
|
|
},
|
|
{
|
|
"entropy": 6.303599882125854,
|
|
"epoch": 0.9134448932487017,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.000492803398698002,
|
|
"loss": 6.1108,
|
|
"mean_token_accuracy": 0.16644177809357644,
|
|
"num_tokens": 20051811.0,
|
|
"step": 7915
|
|
},
|
|
{
|
|
"entropy": 6.360376930236816,
|
|
"epoch": 0.9140219272937103,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004927930421427161,
|
|
"loss": 6.1152,
|
|
"mean_token_accuracy": 0.16769687086343765,
|
|
"num_tokens": 20064463.0,
|
|
"step": 7920
|
|
},
|
|
{
|
|
"entropy": 6.255197620391845,
|
|
"epoch": 0.914598961338719,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004927826782620694,
|
|
"loss": 6.1075,
|
|
"mean_token_accuracy": 0.16811060458421706,
|
|
"num_tokens": 20076614.0,
|
|
"step": 7925
|
|
},
|
|
{
|
|
"entropy": 6.415706443786621,
|
|
"epoch": 0.9151759953837276,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004927723070564104,
|
|
"loss": 6.1995,
|
|
"mean_token_accuracy": 0.16223038583993912,
|
|
"num_tokens": 20090395.0,
|
|
"step": 7930
|
|
},
|
|
{
|
|
"entropy": 6.371805334091187,
|
|
"epoch": 0.9157530294287363,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004927619285260881,
|
|
"loss": 6.1335,
|
|
"mean_token_accuracy": 0.16719916462898254,
|
|
"num_tokens": 20102736.0,
|
|
"step": 7935
|
|
},
|
|
{
|
|
"entropy": 6.344775104522705,
|
|
"epoch": 0.9163300634737449,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004927515426714515,
|
|
"loss": 6.1302,
|
|
"mean_token_accuracy": 0.1690652996301651,
|
|
"num_tokens": 20116516.0,
|
|
"step": 7940
|
|
},
|
|
{
|
|
"entropy": 6.320330667495727,
|
|
"epoch": 0.9169070975187537,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.00049274114949285,
|
|
"loss": 6.1174,
|
|
"mean_token_accuracy": 0.17018368244171142,
|
|
"num_tokens": 20128742.0,
|
|
"step": 7945
|
|
},
|
|
{
|
|
"entropy": 6.328971815109253,
|
|
"epoch": 0.9174841315637623,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.000492730748990633,
|
|
"loss": 6.078,
|
|
"mean_token_accuracy": 0.16928218305110931,
|
|
"num_tokens": 20140590.0,
|
|
"step": 7950
|
|
},
|
|
{
|
|
"entropy": 6.284335279464722,
|
|
"epoch": 0.9180611656087709,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004927203411651504,
|
|
"loss": 6.0797,
|
|
"mean_token_accuracy": 0.16228621900081636,
|
|
"num_tokens": 20153748.0,
|
|
"step": 7955
|
|
},
|
|
{
|
|
"entropy": 6.353853940963745,
|
|
"epoch": 0.9186381996537796,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004927099260167523,
|
|
"loss": 6.0904,
|
|
"mean_token_accuracy": 0.1736527130007744,
|
|
"num_tokens": 20167094.0,
|
|
"step": 7960
|
|
},
|
|
{
|
|
"entropy": 6.308283567428589,
|
|
"epoch": 0.9192152336987882,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004926995035457889,
|
|
"loss": 6.0619,
|
|
"mean_token_accuracy": 0.16892513036727905,
|
|
"num_tokens": 20180716.0,
|
|
"step": 7965
|
|
},
|
|
{
|
|
"entropy": 6.339779663085937,
|
|
"epoch": 0.9197922677437969,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000492689073752611,
|
|
"loss": 6.1033,
|
|
"mean_token_accuracy": 0.17131576538085938,
|
|
"num_tokens": 20192214.0,
|
|
"step": 7970
|
|
},
|
|
{
|
|
"entropy": 6.226183223724365,
|
|
"epoch": 0.9203693017888055,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004926786366375691,
|
|
"loss": 5.991,
|
|
"mean_token_accuracy": 0.17104701697826385,
|
|
"num_tokens": 20204789.0,
|
|
"step": 7975
|
|
},
|
|
{
|
|
"entropy": 6.316816425323486,
|
|
"epoch": 0.9209463358338142,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004926681922010145,
|
|
"loss": 6.095,
|
|
"mean_token_accuracy": 0.16920481026172637,
|
|
"num_tokens": 20217318.0,
|
|
"step": 7980
|
|
},
|
|
{
|
|
"entropy": 6.4085766792297365,
|
|
"epoch": 0.9215233698788229,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004926577404432982,
|
|
"loss": 6.0992,
|
|
"mean_token_accuracy": 0.16753261983394624,
|
|
"num_tokens": 20229757.0,
|
|
"step": 7985
|
|
},
|
|
{
|
|
"entropy": 6.276189374923706,
|
|
"epoch": 0.9221004039238315,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004926472813647721,
|
|
"loss": 6.1228,
|
|
"mean_token_accuracy": 0.1687633216381073,
|
|
"num_tokens": 20242042.0,
|
|
"step": 7990
|
|
},
|
|
{
|
|
"entropy": 6.2141529560089115,
|
|
"epoch": 0.9226774379688402,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004926368149657876,
|
|
"loss": 6.0106,
|
|
"mean_token_accuracy": 0.18093141317367553,
|
|
"num_tokens": 20255188.0,
|
|
"step": 7995
|
|
},
|
|
{
|
|
"entropy": 6.415900802612304,
|
|
"epoch": 0.9232544720138488,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004926263412466972,
|
|
"loss": 6.0902,
|
|
"mean_token_accuracy": 0.17318245768547058,
|
|
"num_tokens": 20267359.0,
|
|
"step": 8000
|
|
},
|
|
{
|
|
"entropy": 6.35699143409729,
|
|
"epoch": 0.9238315060588574,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004926158602078527,
|
|
"loss": 6.1837,
|
|
"mean_token_accuracy": 0.16548164188861847,
|
|
"num_tokens": 20280023.0,
|
|
"step": 8005
|
|
},
|
|
{
|
|
"entropy": 6.307455205917359,
|
|
"epoch": 0.9244085401038661,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004926053718496069,
|
|
"loss": 6.0779,
|
|
"mean_token_accuracy": 0.17290998697280885,
|
|
"num_tokens": 20293043.0,
|
|
"step": 8010
|
|
},
|
|
{
|
|
"entropy": 6.2883072853088375,
|
|
"epoch": 0.9249855741488748,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004925948761723126,
|
|
"loss": 6.0607,
|
|
"mean_token_accuracy": 0.16693697571754457,
|
|
"num_tokens": 20304929.0,
|
|
"step": 8015
|
|
},
|
|
{
|
|
"entropy": 6.302173900604248,
|
|
"epoch": 0.9255626081938835,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004925843731763226,
|
|
"loss": 6.067,
|
|
"mean_token_accuracy": 0.16893115490674973,
|
|
"num_tokens": 20317024.0,
|
|
"step": 8020
|
|
},
|
|
{
|
|
"entropy": 6.374800300598144,
|
|
"epoch": 0.9261396422388921,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004925738628619904,
|
|
"loss": 6.1205,
|
|
"mean_token_accuracy": 0.1658678874373436,
|
|
"num_tokens": 20329909.0,
|
|
"step": 8025
|
|
},
|
|
{
|
|
"entropy": 6.241035079956054,
|
|
"epoch": 0.9267166762839008,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004925633452296693,
|
|
"loss": 6.0841,
|
|
"mean_token_accuracy": 0.16910781860351562,
|
|
"num_tokens": 20344224.0,
|
|
"step": 8030
|
|
},
|
|
{
|
|
"entropy": 6.371493101119995,
|
|
"epoch": 0.9272937103289094,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004925528202797131,
|
|
"loss": 6.0854,
|
|
"mean_token_accuracy": 0.16615129262208939,
|
|
"num_tokens": 20357393.0,
|
|
"step": 8035
|
|
},
|
|
{
|
|
"entropy": 6.349489068984985,
|
|
"epoch": 0.927870744373918,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004925422880124761,
|
|
"loss": 6.1113,
|
|
"mean_token_accuracy": 0.16972048878669738,
|
|
"num_tokens": 20369551.0,
|
|
"step": 8040
|
|
},
|
|
{
|
|
"entropy": 6.298521709442139,
|
|
"epoch": 0.9284477784189267,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004925317484283121,
|
|
"loss": 6.2078,
|
|
"mean_token_accuracy": 0.16394488960504533,
|
|
"num_tokens": 20382639.0,
|
|
"step": 8045
|
|
},
|
|
{
|
|
"entropy": 6.349614477157592,
|
|
"epoch": 0.9290248124639354,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004925212015275758,
|
|
"loss": 6.0278,
|
|
"mean_token_accuracy": 0.178650863468647,
|
|
"num_tokens": 20394751.0,
|
|
"step": 8050
|
|
},
|
|
{
|
|
"entropy": 6.232526731491089,
|
|
"epoch": 0.9296018465089441,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.000492510647310622,
|
|
"loss": 6.0768,
|
|
"mean_token_accuracy": 0.17546522319316865,
|
|
"num_tokens": 20408235.0,
|
|
"step": 8055
|
|
},
|
|
{
|
|
"entropy": 6.31773829460144,
|
|
"epoch": 0.9301788805539527,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004925000857778055,
|
|
"loss": 6.1095,
|
|
"mean_token_accuracy": 0.169540336728096,
|
|
"num_tokens": 20423063.0,
|
|
"step": 8060
|
|
},
|
|
{
|
|
"entropy": 6.342768430709839,
|
|
"epoch": 0.9307559145989613,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004924895169294818,
|
|
"loss": 6.0142,
|
|
"mean_token_accuracy": 0.17308391481637955,
|
|
"num_tokens": 20436225.0,
|
|
"step": 8065
|
|
},
|
|
{
|
|
"entropy": 6.319842863082886,
|
|
"epoch": 0.93133294864397,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004924789407660062,
|
|
"loss": 6.1361,
|
|
"mean_token_accuracy": 0.17381656765937806,
|
|
"num_tokens": 20447957.0,
|
|
"step": 8070
|
|
},
|
|
{
|
|
"entropy": 6.298751926422119,
|
|
"epoch": 0.9319099826889786,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004924683572877345,
|
|
"loss": 6.0219,
|
|
"mean_token_accuracy": 0.17717759013175965,
|
|
"num_tokens": 20459836.0,
|
|
"step": 8075
|
|
},
|
|
{
|
|
"entropy": 6.402027034759522,
|
|
"epoch": 0.9324870167339873,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004924577664950225,
|
|
"loss": 6.1794,
|
|
"mean_token_accuracy": 0.16712668389081956,
|
|
"num_tokens": 20471907.0,
|
|
"step": 8080
|
|
},
|
|
{
|
|
"entropy": 6.325817441940307,
|
|
"epoch": 0.933064050778996,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004924471683882266,
|
|
"loss": 6.1608,
|
|
"mean_token_accuracy": 0.16859893202781678,
|
|
"num_tokens": 20485166.0,
|
|
"step": 8085
|
|
},
|
|
{
|
|
"entropy": 6.3150599002838135,
|
|
"epoch": 0.9336410848240047,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004924365629677031,
|
|
"loss": 6.0038,
|
|
"mean_token_accuracy": 0.17864430248737334,
|
|
"num_tokens": 20498973.0,
|
|
"step": 8090
|
|
},
|
|
{
|
|
"entropy": 6.290228700637817,
|
|
"epoch": 0.9342181188690133,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.000492425950233809,
|
|
"loss": 6.033,
|
|
"mean_token_accuracy": 0.18096119910478592,
|
|
"num_tokens": 20511615.0,
|
|
"step": 8095
|
|
},
|
|
{
|
|
"entropy": 6.306623554229736,
|
|
"epoch": 0.9347951529140219,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000492415330186901,
|
|
"loss": 6.0824,
|
|
"mean_token_accuracy": 0.1683804363012314,
|
|
"num_tokens": 20523615.0,
|
|
"step": 8100
|
|
},
|
|
{
|
|
"entropy": 6.372899293899536,
|
|
"epoch": 0.9353721869590306,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004924047028273364,
|
|
"loss": 6.007,
|
|
"mean_token_accuracy": 0.1787632629275322,
|
|
"num_tokens": 20537048.0,
|
|
"step": 8105
|
|
},
|
|
{
|
|
"entropy": 6.285822963714599,
|
|
"epoch": 0.9359492210040392,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004923940681554725,
|
|
"loss": 6.0922,
|
|
"mean_token_accuracy": 0.1766421005129814,
|
|
"num_tokens": 20551041.0,
|
|
"step": 8110
|
|
},
|
|
{
|
|
"entropy": 6.348171663284302,
|
|
"epoch": 0.9365262550490479,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004923834261716672,
|
|
"loss": 6.1496,
|
|
"mean_token_accuracy": 0.1679307132959366,
|
|
"num_tokens": 20563123.0,
|
|
"step": 8115
|
|
},
|
|
{
|
|
"entropy": 6.331095409393311,
|
|
"epoch": 0.9371032890940566,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004923727768762782,
|
|
"loss": 6.048,
|
|
"mean_token_accuracy": 0.18366726487874985,
|
|
"num_tokens": 20577487.0,
|
|
"step": 8120
|
|
},
|
|
{
|
|
"entropy": 6.275611782073975,
|
|
"epoch": 0.9376803231390652,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.000492362120269664,
|
|
"loss": 6.0773,
|
|
"mean_token_accuracy": 0.17474426031112672,
|
|
"num_tokens": 20590125.0,
|
|
"step": 8125
|
|
},
|
|
{
|
|
"entropy": 6.328644275665283,
|
|
"epoch": 0.9382573571840739,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004923514563521827,
|
|
"loss": 6.1126,
|
|
"mean_token_accuracy": 0.1696262091398239,
|
|
"num_tokens": 20603035.0,
|
|
"step": 8130
|
|
},
|
|
{
|
|
"entropy": 6.3141919612884525,
|
|
"epoch": 0.9388343912290825,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004923407851241933,
|
|
"loss": 6.094,
|
|
"mean_token_accuracy": 0.16628068536520005,
|
|
"num_tokens": 20615280.0,
|
|
"step": 8135
|
|
},
|
|
{
|
|
"entropy": 6.332769775390625,
|
|
"epoch": 0.9394114252740912,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004923301065860545,
|
|
"loss": 6.0693,
|
|
"mean_token_accuracy": 0.16870561093091965,
|
|
"num_tokens": 20627800.0,
|
|
"step": 8140
|
|
},
|
|
{
|
|
"entropy": 6.297971963882446,
|
|
"epoch": 0.9399884593190998,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004923194207381254,
|
|
"loss": 6.0941,
|
|
"mean_token_accuracy": 0.16942809224128724,
|
|
"num_tokens": 20639264.0,
|
|
"step": 8145
|
|
},
|
|
{
|
|
"entropy": 6.198244857788086,
|
|
"epoch": 0.9405654933641084,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004923087275807656,
|
|
"loss": 6.0176,
|
|
"mean_token_accuracy": 0.18265498876571656,
|
|
"num_tokens": 20652155.0,
|
|
"step": 8150
|
|
},
|
|
{
|
|
"entropy": 6.3499046802520756,
|
|
"epoch": 0.9411425274091172,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004922980271143347,
|
|
"loss": 6.0793,
|
|
"mean_token_accuracy": 0.1729395642876625,
|
|
"num_tokens": 20665642.0,
|
|
"step": 8155
|
|
},
|
|
{
|
|
"entropy": 6.345331525802612,
|
|
"epoch": 0.9417195614541258,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004922873193391927,
|
|
"loss": 6.0618,
|
|
"mean_token_accuracy": 0.17080418467521669,
|
|
"num_tokens": 20678685.0,
|
|
"step": 8160
|
|
},
|
|
{
|
|
"entropy": 6.239529323577881,
|
|
"epoch": 0.9422965954991345,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004922766042556994,
|
|
"loss": 6.0014,
|
|
"mean_token_accuracy": 0.17112986594438553,
|
|
"num_tokens": 20690714.0,
|
|
"step": 8165
|
|
},
|
|
{
|
|
"entropy": 6.3647966384887695,
|
|
"epoch": 0.9428736295441431,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004922658818642156,
|
|
"loss": 6.0995,
|
|
"mean_token_accuracy": 0.16545148491859435,
|
|
"num_tokens": 20703316.0,
|
|
"step": 8170
|
|
},
|
|
{
|
|
"entropy": 6.249971199035644,
|
|
"epoch": 0.9434506635891518,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004922551521651018,
|
|
"loss": 5.9891,
|
|
"mean_token_accuracy": 0.18353118002414703,
|
|
"num_tokens": 20716144.0,
|
|
"step": 8175
|
|
},
|
|
{
|
|
"entropy": 6.328268146514892,
|
|
"epoch": 0.9440276976341604,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004922444151587189,
|
|
"loss": 6.0374,
|
|
"mean_token_accuracy": 0.1707102119922638,
|
|
"num_tokens": 20728089.0,
|
|
"step": 8180
|
|
},
|
|
{
|
|
"entropy": 6.219746112823486,
|
|
"epoch": 0.944604731679169,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004922336708454279,
|
|
"loss": 6.0499,
|
|
"mean_token_accuracy": 0.18127028048038482,
|
|
"num_tokens": 20741684.0,
|
|
"step": 8185
|
|
},
|
|
{
|
|
"entropy": 6.337989234924317,
|
|
"epoch": 0.9451817657241778,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004922229192255903,
|
|
"loss": 6.1007,
|
|
"mean_token_accuracy": 0.16950066089630128,
|
|
"num_tokens": 20754840.0,
|
|
"step": 8190
|
|
},
|
|
{
|
|
"entropy": 6.272415828704834,
|
|
"epoch": 0.9457587997691864,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004922121602995678,
|
|
"loss": 5.9846,
|
|
"mean_token_accuracy": 0.18377467840909958,
|
|
"num_tokens": 20767528.0,
|
|
"step": 8195
|
|
},
|
|
{
|
|
"entropy": 6.244569110870361,
|
|
"epoch": 0.9463358338141951,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004922013940677221,
|
|
"loss": 6.0685,
|
|
"mean_token_accuracy": 0.1787708282470703,
|
|
"num_tokens": 20778886.0,
|
|
"step": 8200
|
|
},
|
|
{
|
|
"entropy": 6.314958715438843,
|
|
"epoch": 0.9469128678592037,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004921906205304155,
|
|
"loss": 6.0274,
|
|
"mean_token_accuracy": 0.16707849353551865,
|
|
"num_tokens": 20792928.0,
|
|
"step": 8205
|
|
},
|
|
{
|
|
"entropy": 6.276573610305786,
|
|
"epoch": 0.9474899019042123,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004921798396880101,
|
|
"loss": 6.0222,
|
|
"mean_token_accuracy": 0.17047245651483536,
|
|
"num_tokens": 20805766.0,
|
|
"step": 8210
|
|
},
|
|
{
|
|
"entropy": 6.332600259780884,
|
|
"epoch": 0.948066935949221,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004921690515408688,
|
|
"loss": 6.0799,
|
|
"mean_token_accuracy": 0.17117798924446107,
|
|
"num_tokens": 20819008.0,
|
|
"step": 8215
|
|
},
|
|
{
|
|
"entropy": 6.297818374633789,
|
|
"epoch": 0.9486439699942296,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004921582560893543,
|
|
"loss": 6.1285,
|
|
"mean_token_accuracy": 0.1678549811244011,
|
|
"num_tokens": 20832706.0,
|
|
"step": 8220
|
|
},
|
|
{
|
|
"entropy": 6.29673662185669,
|
|
"epoch": 0.9492210040392384,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004921474533338297,
|
|
"loss": 6.0616,
|
|
"mean_token_accuracy": 0.1708410307765007,
|
|
"num_tokens": 20844568.0,
|
|
"step": 8225
|
|
},
|
|
{
|
|
"entropy": 6.305984210968018,
|
|
"epoch": 0.949798038084247,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004921366432746585,
|
|
"loss": 6.0623,
|
|
"mean_token_accuracy": 0.17219894528388976,
|
|
"num_tokens": 20856157.0,
|
|
"step": 8230
|
|
},
|
|
{
|
|
"entropy": 6.256311988830566,
|
|
"epoch": 0.9503750721292556,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000492125825912204,
|
|
"loss": 6.0552,
|
|
"mean_token_accuracy": 0.1725418046116829,
|
|
"num_tokens": 20868039.0,
|
|
"step": 8235
|
|
},
|
|
{
|
|
"entropy": 6.362317228317261,
|
|
"epoch": 0.9509521061742643,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004921150012468302,
|
|
"loss": 6.0623,
|
|
"mean_token_accuracy": 0.17292184233665467,
|
|
"num_tokens": 20880190.0,
|
|
"step": 8240
|
|
},
|
|
{
|
|
"entropy": 6.240530061721802,
|
|
"epoch": 0.9515291402192729,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004921041692789013,
|
|
"loss": 6.0576,
|
|
"mean_token_accuracy": 0.17715438902378083,
|
|
"num_tokens": 20892996.0,
|
|
"step": 8245
|
|
},
|
|
{
|
|
"entropy": 6.327496719360352,
|
|
"epoch": 0.9521061742642816,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004920933300087813,
|
|
"loss": 6.1245,
|
|
"mean_token_accuracy": 0.170589879155159,
|
|
"num_tokens": 20906080.0,
|
|
"step": 8250
|
|
},
|
|
{
|
|
"entropy": 6.35455002784729,
|
|
"epoch": 0.9526832083092902,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004920824834368353,
|
|
"loss": 6.1527,
|
|
"mean_token_accuracy": 0.1672087237238884,
|
|
"num_tokens": 20917944.0,
|
|
"step": 8255
|
|
},
|
|
{
|
|
"entropy": 6.2974732398986815,
|
|
"epoch": 0.953260242354299,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004920716295634275,
|
|
"loss": 6.0226,
|
|
"mean_token_accuracy": 0.18663843721151352,
|
|
"num_tokens": 20929046.0,
|
|
"step": 8260
|
|
},
|
|
{
|
|
"entropy": 6.309549474716187,
|
|
"epoch": 0.9538372763993076,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004920607683889235,
|
|
"loss": 6.204,
|
|
"mean_token_accuracy": 0.16842423677444457,
|
|
"num_tokens": 20941643.0,
|
|
"step": 8265
|
|
},
|
|
{
|
|
"entropy": 6.374490642547608,
|
|
"epoch": 0.9544143104443162,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004920498999136882,
|
|
"loss": 6.12,
|
|
"mean_token_accuracy": 0.17137401849031447,
|
|
"num_tokens": 20954620.0,
|
|
"step": 8270
|
|
},
|
|
{
|
|
"entropy": 6.301665258407593,
|
|
"epoch": 0.9549913444893249,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004920390241380874,
|
|
"loss": 6.1383,
|
|
"mean_token_accuracy": 0.16496547162532807,
|
|
"num_tokens": 20968033.0,
|
|
"step": 8275
|
|
},
|
|
{
|
|
"entropy": 6.316059875488281,
|
|
"epoch": 0.9555683785343335,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004920281410624868,
|
|
"loss": 6.0528,
|
|
"mean_token_accuracy": 0.17812226861715316,
|
|
"num_tokens": 20980586.0,
|
|
"step": 8280
|
|
},
|
|
{
|
|
"entropy": 6.237458086013794,
|
|
"epoch": 0.9561454125793422,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004920172506872525,
|
|
"loss": 5.9906,
|
|
"mean_token_accuracy": 0.17724904865026475,
|
|
"num_tokens": 20992346.0,
|
|
"step": 8285
|
|
},
|
|
{
|
|
"entropy": 6.203985404968262,
|
|
"epoch": 0.9567224466243508,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004920063530127508,
|
|
"loss": 5.9545,
|
|
"mean_token_accuracy": 0.18309845626354218,
|
|
"num_tokens": 21004399.0,
|
|
"step": 8290
|
|
},
|
|
{
|
|
"entropy": 6.386181783676148,
|
|
"epoch": 0.9572994806693594,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004919954480393482,
|
|
"loss": 6.1593,
|
|
"mean_token_accuracy": 0.16094251722097397,
|
|
"num_tokens": 21017066.0,
|
|
"step": 8295
|
|
},
|
|
{
|
|
"entropy": 6.379828882217407,
|
|
"epoch": 0.9578765147143682,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004919845357674114,
|
|
"loss": 6.2121,
|
|
"mean_token_accuracy": 0.1594449073076248,
|
|
"num_tokens": 21031664.0,
|
|
"step": 8300
|
|
},
|
|
{
|
|
"entropy": 6.345889616012573,
|
|
"epoch": 0.9584535487593768,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004919736161973076,
|
|
"loss": 6.0684,
|
|
"mean_token_accuracy": 0.18007687032222747,
|
|
"num_tokens": 21043980.0,
|
|
"step": 8305
|
|
},
|
|
{
|
|
"entropy": 6.341425609588623,
|
|
"epoch": 0.9590305828043855,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.000491962689329404,
|
|
"loss": 6.0708,
|
|
"mean_token_accuracy": 0.17116846591234208,
|
|
"num_tokens": 21056916.0,
|
|
"step": 8310
|
|
},
|
|
{
|
|
"entropy": 6.38311505317688,
|
|
"epoch": 0.9596076168493941,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004919517551640681,
|
|
"loss": 6.1542,
|
|
"mean_token_accuracy": 0.1650987982749939,
|
|
"num_tokens": 21070027.0,
|
|
"step": 8315
|
|
},
|
|
{
|
|
"entropy": 6.336155128479004,
|
|
"epoch": 0.9601846508944027,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004919408137016677,
|
|
"loss": 6.12,
|
|
"mean_token_accuracy": 0.1708296701312065,
|
|
"num_tokens": 21082596.0,
|
|
"step": 8320
|
|
},
|
|
{
|
|
"entropy": 6.15516300201416,
|
|
"epoch": 0.9607616849394114,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004919298649425708,
|
|
"loss": 5.9459,
|
|
"mean_token_accuracy": 0.17924613356590272,
|
|
"num_tokens": 21098160.0,
|
|
"step": 8325
|
|
},
|
|
{
|
|
"entropy": 6.3055689334869385,
|
|
"epoch": 0.96133871898442,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004919189088871456,
|
|
"loss": 6.041,
|
|
"mean_token_accuracy": 0.17082750350236892,
|
|
"num_tokens": 21111562.0,
|
|
"step": 8330
|
|
},
|
|
{
|
|
"entropy": 6.309827613830566,
|
|
"epoch": 0.9619157530294288,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004919079455357608,
|
|
"loss": 6.051,
|
|
"mean_token_accuracy": 0.1726277843117714,
|
|
"num_tokens": 21123177.0,
|
|
"step": 8335
|
|
},
|
|
{
|
|
"entropy": 6.272983598709106,
|
|
"epoch": 0.9624927870744374,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004918969748887847,
|
|
"loss": 6.1106,
|
|
"mean_token_accuracy": 0.1684108003973961,
|
|
"num_tokens": 21135390.0,
|
|
"step": 8340
|
|
},
|
|
{
|
|
"entropy": 6.303555488586426,
|
|
"epoch": 0.9630698211194461,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004918859969465868,
|
|
"loss": 6.0524,
|
|
"mean_token_accuracy": 0.1788319617509842,
|
|
"num_tokens": 21148718.0,
|
|
"step": 8345
|
|
},
|
|
{
|
|
"entropy": 6.348038244247436,
|
|
"epoch": 0.9636468551644547,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004918750117095361,
|
|
"loss": 6.0769,
|
|
"mean_token_accuracy": 0.16928021162748336,
|
|
"num_tokens": 21161057.0,
|
|
"step": 8350
|
|
},
|
|
{
|
|
"entropy": 6.333800172805786,
|
|
"epoch": 0.9642238892094633,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004918640191780021,
|
|
"loss": 6.0314,
|
|
"mean_token_accuracy": 0.1733250930905342,
|
|
"num_tokens": 21175048.0,
|
|
"step": 8355
|
|
},
|
|
{
|
|
"entropy": 6.298459768295288,
|
|
"epoch": 0.964800923254472,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004918530193523546,
|
|
"loss": 6.0075,
|
|
"mean_token_accuracy": 0.17219914495944977,
|
|
"num_tokens": 21187995.0,
|
|
"step": 8360
|
|
},
|
|
{
|
|
"entropy": 6.2210142612457275,
|
|
"epoch": 0.9653779572994806,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004918420122329634,
|
|
"loss": 5.9762,
|
|
"mean_token_accuracy": 0.17670271098613738,
|
|
"num_tokens": 21200685.0,
|
|
"step": 8365
|
|
},
|
|
{
|
|
"entropy": 6.269420576095581,
|
|
"epoch": 0.9659549913444894,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004918309978201989,
|
|
"loss": 6.0031,
|
|
"mean_token_accuracy": 0.17940095961093902,
|
|
"num_tokens": 21212709.0,
|
|
"step": 8370
|
|
},
|
|
{
|
|
"entropy": 6.3614483833312985,
|
|
"epoch": 0.966532025389498,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004918199761144315,
|
|
"loss": 6.1414,
|
|
"mean_token_accuracy": 0.16158217340707778,
|
|
"num_tokens": 21224846.0,
|
|
"step": 8375
|
|
},
|
|
{
|
|
"entropy": 6.342139053344726,
|
|
"epoch": 0.9671090594345066,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004918089471160318,
|
|
"loss": 6.1078,
|
|
"mean_token_accuracy": 0.17495157569646835,
|
|
"num_tokens": 21238490.0,
|
|
"step": 8380
|
|
},
|
|
{
|
|
"entropy": 6.297436285018921,
|
|
"epoch": 0.9676860934795153,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004917979108253709,
|
|
"loss": 6.0186,
|
|
"mean_token_accuracy": 0.17175852954387666,
|
|
"num_tokens": 21250064.0,
|
|
"step": 8385
|
|
},
|
|
{
|
|
"entropy": 6.319163703918457,
|
|
"epoch": 0.9682631275245239,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00049178686724282,
|
|
"loss": 5.9838,
|
|
"mean_token_accuracy": 0.17822523713111876,
|
|
"num_tokens": 21262777.0,
|
|
"step": 8390
|
|
},
|
|
{
|
|
"entropy": 6.2587940216064455,
|
|
"epoch": 0.9688401615695326,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004917758163687506,
|
|
"loss": 6.0596,
|
|
"mean_token_accuracy": 0.18015512079000473,
|
|
"num_tokens": 21274837.0,
|
|
"step": 8395
|
|
},
|
|
{
|
|
"entropy": 6.299158430099487,
|
|
"epoch": 0.9694171956145412,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004917647582035341,
|
|
"loss": 6.1477,
|
|
"mean_token_accuracy": 0.16546362787485122,
|
|
"num_tokens": 21287683.0,
|
|
"step": 8400
|
|
},
|
|
{
|
|
"entropy": 6.276169300079346,
|
|
"epoch": 0.96999422965955,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004917536927475428,
|
|
"loss": 5.9704,
|
|
"mean_token_accuracy": 0.17683717012405395,
|
|
"num_tokens": 21300053.0,
|
|
"step": 8405
|
|
},
|
|
{
|
|
"entropy": 6.322388982772827,
|
|
"epoch": 0.9705712637045586,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004917426200011486,
|
|
"loss": 6.0606,
|
|
"mean_token_accuracy": 0.17437842041254042,
|
|
"num_tokens": 21312143.0,
|
|
"step": 8410
|
|
},
|
|
{
|
|
"entropy": 6.308571004867554,
|
|
"epoch": 0.9711482977495672,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.000491731539964724,
|
|
"loss": 6.064,
|
|
"mean_token_accuracy": 0.17512849271297454,
|
|
"num_tokens": 21324530.0,
|
|
"step": 8415
|
|
},
|
|
{
|
|
"entropy": 6.308686065673828,
|
|
"epoch": 0.9717253317945759,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004917204526386418,
|
|
"loss": 6.1158,
|
|
"mean_token_accuracy": 0.17519305050373077,
|
|
"num_tokens": 21337766.0,
|
|
"step": 8420
|
|
},
|
|
{
|
|
"entropy": 6.3296489238739015,
|
|
"epoch": 0.9723023658395845,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004917093580232748,
|
|
"loss": 6.0457,
|
|
"mean_token_accuracy": 0.17636967301368714,
|
|
"num_tokens": 21350304.0,
|
|
"step": 8425
|
|
},
|
|
{
|
|
"entropy": 6.264460182189941,
|
|
"epoch": 0.9728793998845932,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004916982561189962,
|
|
"loss": 6.0781,
|
|
"mean_token_accuracy": 0.17243474572896958,
|
|
"num_tokens": 21362030.0,
|
|
"step": 8430
|
|
},
|
|
{
|
|
"entropy": 6.325700092315674,
|
|
"epoch": 0.9734564339296018,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004916871469261794,
|
|
"loss": 6.088,
|
|
"mean_token_accuracy": 0.1718950316309929,
|
|
"num_tokens": 21374279.0,
|
|
"step": 8435
|
|
},
|
|
{
|
|
"entropy": 6.3129064559936525,
|
|
"epoch": 0.9740334679746105,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.000491676030445198,
|
|
"loss": 6.074,
|
|
"mean_token_accuracy": 0.18431381583213807,
|
|
"num_tokens": 21388220.0,
|
|
"step": 8440
|
|
},
|
|
{
|
|
"entropy": 6.319225549697876,
|
|
"epoch": 0.9746105020196192,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004916649066764259,
|
|
"loss": 6.0279,
|
|
"mean_token_accuracy": 0.17508506923913955,
|
|
"num_tokens": 21400770.0,
|
|
"step": 8445
|
|
},
|
|
{
|
|
"entropy": 6.299949407577515,
|
|
"epoch": 0.9751875360646278,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004916537756202375,
|
|
"loss": 6.0692,
|
|
"mean_token_accuracy": 0.1750455766916275,
|
|
"num_tokens": 21413078.0,
|
|
"step": 8450
|
|
},
|
|
{
|
|
"entropy": 6.322778272628784,
|
|
"epoch": 0.9757645701096365,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004916426372770069,
|
|
"loss": 6.0912,
|
|
"mean_token_accuracy": 0.16818054616451264,
|
|
"num_tokens": 21427285.0,
|
|
"step": 8455
|
|
},
|
|
{
|
|
"entropy": 6.3555844783782955,
|
|
"epoch": 0.9763416041546451,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004916314916471087,
|
|
"loss": 6.0548,
|
|
"mean_token_accuracy": 0.17514651268720627,
|
|
"num_tokens": 21440659.0,
|
|
"step": 8460
|
|
},
|
|
{
|
|
"entropy": 6.283309412002564,
|
|
"epoch": 0.9769186381996537,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004916203387309179,
|
|
"loss": 6.0336,
|
|
"mean_token_accuracy": 0.1689162462949753,
|
|
"num_tokens": 21452301.0,
|
|
"step": 8465
|
|
},
|
|
{
|
|
"entropy": 6.186957979202271,
|
|
"epoch": 0.9774956722446624,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004916091785288096,
|
|
"loss": 5.9807,
|
|
"mean_token_accuracy": 0.18105768263339997,
|
|
"num_tokens": 21466716.0,
|
|
"step": 8470
|
|
},
|
|
{
|
|
"entropy": 6.330410099029541,
|
|
"epoch": 0.9780727062896711,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004915980110411593,
|
|
"loss": 6.0875,
|
|
"mean_token_accuracy": 0.17375342547893524,
|
|
"num_tokens": 21479314.0,
|
|
"step": 8475
|
|
},
|
|
{
|
|
"entropy": 6.277654647827148,
|
|
"epoch": 0.9786497403346798,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004915868362683425,
|
|
"loss": 5.9829,
|
|
"mean_token_accuracy": 0.18661958277225493,
|
|
"num_tokens": 21491968.0,
|
|
"step": 8480
|
|
},
|
|
{
|
|
"entropy": 6.172560930252075,
|
|
"epoch": 0.9792267743796884,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004915756542107349,
|
|
"loss": 6.0973,
|
|
"mean_token_accuracy": 0.1710505172610283,
|
|
"num_tokens": 21505744.0,
|
|
"step": 8485
|
|
},
|
|
{
|
|
"entropy": 6.331524133682251,
|
|
"epoch": 0.979803808424697,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004915644648687127,
|
|
"loss": 6.1035,
|
|
"mean_token_accuracy": 0.17333952337503433,
|
|
"num_tokens": 21520981.0,
|
|
"step": 8490
|
|
},
|
|
{
|
|
"entropy": 6.351734685897827,
|
|
"epoch": 0.9803808424697057,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004915532682426524,
|
|
"loss": 6.067,
|
|
"mean_token_accuracy": 0.17047810107469558,
|
|
"num_tokens": 21533712.0,
|
|
"step": 8495
|
|
},
|
|
{
|
|
"entropy": 6.18950400352478,
|
|
"epoch": 0.9809578765147143,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004915420643329306,
|
|
"loss": 5.9703,
|
|
"mean_token_accuracy": 0.1750311180949211,
|
|
"num_tokens": 21546875.0,
|
|
"step": 8500
|
|
},
|
|
{
|
|
"entropy": 6.286129379272461,
|
|
"epoch": 0.981534910559723,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.000491530853139924,
|
|
"loss": 6.0195,
|
|
"mean_token_accuracy": 0.17821505516767502,
|
|
"num_tokens": 21559154.0,
|
|
"step": 8505
|
|
},
|
|
{
|
|
"entropy": 6.3540106296539305,
|
|
"epoch": 0.9821119446047317,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004915196346640095,
|
|
"loss": 6.1033,
|
|
"mean_token_accuracy": 0.16890120655298232,
|
|
"num_tokens": 21573164.0,
|
|
"step": 8510
|
|
},
|
|
{
|
|
"entropy": 6.343676900863647,
|
|
"epoch": 0.9826889786497404,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004915084089055648,
|
|
"loss": 6.1093,
|
|
"mean_token_accuracy": 0.16497408002614974,
|
|
"num_tokens": 21585449.0,
|
|
"step": 8515
|
|
},
|
|
{
|
|
"entropy": 6.205972909927368,
|
|
"epoch": 0.983266012694749,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004914971758649673,
|
|
"loss": 6.0408,
|
|
"mean_token_accuracy": 0.18363562375307083,
|
|
"num_tokens": 21598120.0,
|
|
"step": 8520
|
|
},
|
|
{
|
|
"entropy": 6.2844775199890135,
|
|
"epoch": 0.9838430467397576,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004914859355425948,
|
|
"loss": 6.0986,
|
|
"mean_token_accuracy": 0.17075739353895186,
|
|
"num_tokens": 21609912.0,
|
|
"step": 8525
|
|
},
|
|
{
|
|
"entropy": 6.362640714645385,
|
|
"epoch": 0.9844200807847663,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004914746879388255,
|
|
"loss": 6.0341,
|
|
"mean_token_accuracy": 0.17460228204727174,
|
|
"num_tokens": 21623242.0,
|
|
"step": 8530
|
|
},
|
|
{
|
|
"entropy": 6.252819156646728,
|
|
"epoch": 0.9849971148297749,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004914634330540373,
|
|
"loss": 6.0749,
|
|
"mean_token_accuracy": 0.17560923844575882,
|
|
"num_tokens": 21635527.0,
|
|
"step": 8535
|
|
},
|
|
{
|
|
"entropy": 6.27526888847351,
|
|
"epoch": 0.9855741488747836,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004914521708886093,
|
|
"loss": 6.0472,
|
|
"mean_token_accuracy": 0.16989225745201111,
|
|
"num_tokens": 21648994.0,
|
|
"step": 8540
|
|
},
|
|
{
|
|
"entropy": 6.324329948425293,
|
|
"epoch": 0.9861511829197923,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004914409014429201,
|
|
"loss": 6.0489,
|
|
"mean_token_accuracy": 0.17544470131397247,
|
|
"num_tokens": 21661512.0,
|
|
"step": 8545
|
|
},
|
|
{
|
|
"entropy": 6.28133864402771,
|
|
"epoch": 0.986728216964801,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004914296247173486,
|
|
"loss": 6.1108,
|
|
"mean_token_accuracy": 0.16970574706792832,
|
|
"num_tokens": 21674900.0,
|
|
"step": 8550
|
|
},
|
|
{
|
|
"entropy": 6.445541143417358,
|
|
"epoch": 0.9873052510098096,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004914183407122741,
|
|
"loss": 6.2304,
|
|
"mean_token_accuracy": 0.1670519694685936,
|
|
"num_tokens": 21688451.0,
|
|
"step": 8555
|
|
},
|
|
{
|
|
"entropy": 6.338979005813599,
|
|
"epoch": 0.9878822850548182,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004914070494280763,
|
|
"loss": 6.0895,
|
|
"mean_token_accuracy": 0.1686733365058899,
|
|
"num_tokens": 21700350.0,
|
|
"step": 8560
|
|
},
|
|
{
|
|
"entropy": 6.2714245319366455,
|
|
"epoch": 0.9884593190998269,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004913957508651349,
|
|
"loss": 6.0558,
|
|
"mean_token_accuracy": 0.17865381836891175,
|
|
"num_tokens": 21713211.0,
|
|
"step": 8565
|
|
},
|
|
{
|
|
"entropy": 6.273990535736084,
|
|
"epoch": 0.9890363531448355,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.0004913844450238299,
|
|
"loss": 5.9724,
|
|
"mean_token_accuracy": 0.1822005182504654,
|
|
"num_tokens": 21726105.0,
|
|
"step": 8570
|
|
},
|
|
{
|
|
"entropy": 6.251226806640625,
|
|
"epoch": 0.9896133871898442,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004913731319045416,
|
|
"loss": 6.062,
|
|
"mean_token_accuracy": 0.1773639664053917,
|
|
"num_tokens": 21738075.0,
|
|
"step": 8575
|
|
},
|
|
{
|
|
"entropy": 6.292670202255249,
|
|
"epoch": 0.9901904212348529,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004913618115076505,
|
|
"loss": 6.0441,
|
|
"mean_token_accuracy": 0.17401732057332991,
|
|
"num_tokens": 21750614.0,
|
|
"step": 8580
|
|
},
|
|
{
|
|
"entropy": 6.221653270721435,
|
|
"epoch": 0.9907674552798615,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004913504838335372,
|
|
"loss": 6.0495,
|
|
"mean_token_accuracy": 0.17573998719453812,
|
|
"num_tokens": 21763670.0,
|
|
"step": 8585
|
|
},
|
|
{
|
|
"entropy": 6.303406429290772,
|
|
"epoch": 0.9913444893248702,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004913391488825829,
|
|
"loss": 6.0334,
|
|
"mean_token_accuracy": 0.1794967070221901,
|
|
"num_tokens": 21776623.0,
|
|
"step": 8590
|
|
},
|
|
{
|
|
"entropy": 6.308801317214966,
|
|
"epoch": 0.9919215233698788,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004913278066551689,
|
|
"loss": 6.0141,
|
|
"mean_token_accuracy": 0.17606466710567475,
|
|
"num_tokens": 21787903.0,
|
|
"step": 8595
|
|
},
|
|
{
|
|
"entropy": 6.230136156082153,
|
|
"epoch": 0.9924985574148875,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004913164571516765,
|
|
"loss": 5.9398,
|
|
"mean_token_accuracy": 0.18365363031625748,
|
|
"num_tokens": 21800409.0,
|
|
"step": 8600
|
|
},
|
|
{
|
|
"entropy": 6.320093202590942,
|
|
"epoch": 0.9930755914598961,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004913051003724876,
|
|
"loss": 6.1418,
|
|
"mean_token_accuracy": 0.17018114328384398,
|
|
"num_tokens": 21812741.0,
|
|
"step": 8605
|
|
},
|
|
{
|
|
"entropy": 6.295933103561401,
|
|
"epoch": 0.9936526255049047,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004912937363179839,
|
|
"loss": 6.0716,
|
|
"mean_token_accuracy": 0.17680844217538833,
|
|
"num_tokens": 21826180.0,
|
|
"step": 8610
|
|
},
|
|
{
|
|
"entropy": 6.28583836555481,
|
|
"epoch": 0.9942296595499135,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.000491282364988548,
|
|
"loss": 6.1301,
|
|
"mean_token_accuracy": 0.17232027649879456,
|
|
"num_tokens": 21838961.0,
|
|
"step": 8615
|
|
},
|
|
{
|
|
"entropy": 6.3287606716156,
|
|
"epoch": 0.9948066935949221,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004912709863845621,
|
|
"loss": 6.0813,
|
|
"mean_token_accuracy": 0.1688533142209053,
|
|
"num_tokens": 21850942.0,
|
|
"step": 8620
|
|
},
|
|
{
|
|
"entropy": 6.358766841888428,
|
|
"epoch": 0.9953837276399308,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.000491259600506409,
|
|
"loss": 6.0008,
|
|
"mean_token_accuracy": 0.18225180059671403,
|
|
"num_tokens": 21862666.0,
|
|
"step": 8625
|
|
},
|
|
{
|
|
"entropy": 6.225011587142944,
|
|
"epoch": 0.9959607616849394,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004912482073544716,
|
|
"loss": 6.0263,
|
|
"mean_token_accuracy": 0.181974658370018,
|
|
"num_tokens": 21874866.0,
|
|
"step": 8630
|
|
},
|
|
{
|
|
"entropy": 6.300230407714844,
|
|
"epoch": 0.996537795729948,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004912368069291333,
|
|
"loss": 6.0987,
|
|
"mean_token_accuracy": 0.17124349176883696,
|
|
"num_tokens": 21887886.0,
|
|
"step": 8635
|
|
},
|
|
{
|
|
"entropy": 6.385247230529785,
|
|
"epoch": 0.9971148297749567,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004912253992307773,
|
|
"loss": 6.0614,
|
|
"mean_token_accuracy": 0.1666038528084755,
|
|
"num_tokens": 21901096.0,
|
|
"step": 8640
|
|
},
|
|
{
|
|
"entropy": 6.307227563858032,
|
|
"epoch": 0.9976918638199653,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004912139842597875,
|
|
"loss": 6.1417,
|
|
"mean_token_accuracy": 0.17292022854089736,
|
|
"num_tokens": 21914018.0,
|
|
"step": 8645
|
|
},
|
|
{
|
|
"entropy": 6.3174644947052006,
|
|
"epoch": 0.9982688978649741,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004912025620165477,
|
|
"loss": 6.0544,
|
|
"mean_token_accuracy": 0.1787086993455887,
|
|
"num_tokens": 21925488.0,
|
|
"step": 8650
|
|
},
|
|
{
|
|
"entropy": 6.379308795928955,
|
|
"epoch": 0.9988459319099827,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004911911325014421,
|
|
"loss": 6.1228,
|
|
"mean_token_accuracy": 0.1627660095691681,
|
|
"num_tokens": 21938268.0,
|
|
"step": 8655
|
|
},
|
|
{
|
|
"entropy": 6.32840895652771,
|
|
"epoch": 0.9994229659549914,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004911796957148552,
|
|
"loss": 6.1073,
|
|
"mean_token_accuracy": 0.17420676499605178,
|
|
"num_tokens": 21951219.0,
|
|
"step": 8660
|
|
},
|
|
{
|
|
"entropy": 6.355043363571167,
|
|
"epoch": 1.0,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004911682516571715,
|
|
"loss": 6.0847,
|
|
"mean_token_accuracy": 0.1745709404349327,
|
|
"num_tokens": 21963117.0,
|
|
"step": 8665
|
|
},
|
|
{
|
|
"entropy": 6.3443841457366945,
|
|
"epoch": 1.0005770340450086,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004911568003287761,
|
|
"loss": 6.0131,
|
|
"mean_token_accuracy": 0.17631109207868575,
|
|
"num_tokens": 21974187.0,
|
|
"step": 8670
|
|
},
|
|
{
|
|
"entropy": 6.301740312576294,
|
|
"epoch": 1.0011540680900173,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004911453417300541,
|
|
"loss": 6.0218,
|
|
"mean_token_accuracy": 0.1745710179209709,
|
|
"num_tokens": 21987393.0,
|
|
"step": 8675
|
|
},
|
|
{
|
|
"entropy": 6.29511661529541,
|
|
"epoch": 1.001731102135026,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004911338758613909,
|
|
"loss": 5.9168,
|
|
"mean_token_accuracy": 0.18078290671110153,
|
|
"num_tokens": 21998638.0,
|
|
"step": 8680
|
|
},
|
|
{
|
|
"entropy": 6.239432239532471,
|
|
"epoch": 1.0023081361800346,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004911224027231722,
|
|
"loss": 5.9525,
|
|
"mean_token_accuracy": 0.17768344581127166,
|
|
"num_tokens": 22012231.0,
|
|
"step": 8685
|
|
},
|
|
{
|
|
"entropy": 6.150865840911865,
|
|
"epoch": 1.0028851702250432,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004911109223157838,
|
|
"loss": 5.7963,
|
|
"mean_token_accuracy": 0.19489599764347076,
|
|
"num_tokens": 22024929.0,
|
|
"step": 8690
|
|
},
|
|
{
|
|
"entropy": 6.238634347915649,
|
|
"epoch": 1.0034622042700518,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004910994346396118,
|
|
"loss": 5.9051,
|
|
"mean_token_accuracy": 0.18360282331705094,
|
|
"num_tokens": 22037873.0,
|
|
"step": 8695
|
|
},
|
|
{
|
|
"entropy": 6.286004877090454,
|
|
"epoch": 1.0040392383150605,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004910879396950427,
|
|
"loss": 5.8986,
|
|
"mean_token_accuracy": 0.18249017894268035,
|
|
"num_tokens": 22049572.0,
|
|
"step": 8700
|
|
},
|
|
{
|
|
"entropy": 6.319458055496216,
|
|
"epoch": 1.0046162723600693,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.000491076437482463,
|
|
"loss": 5.9874,
|
|
"mean_token_accuracy": 0.17467263340950012,
|
|
"num_tokens": 22063290.0,
|
|
"step": 8705
|
|
},
|
|
{
|
|
"entropy": 6.137618780136108,
|
|
"epoch": 1.005193306405078,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004910649280022599,
|
|
"loss": 5.8664,
|
|
"mean_token_accuracy": 0.18574946224689484,
|
|
"num_tokens": 22076387.0,
|
|
"step": 8710
|
|
},
|
|
{
|
|
"entropy": 6.30208010673523,
|
|
"epoch": 1.0057703404500866,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004910534112548201,
|
|
"loss": 5.9577,
|
|
"mean_token_accuracy": 0.17944232672452926,
|
|
"num_tokens": 22088780.0,
|
|
"step": 8715
|
|
},
|
|
{
|
|
"entropy": 6.154451704025268,
|
|
"epoch": 1.0063473744950953,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004910418872405312,
|
|
"loss": 5.8374,
|
|
"mean_token_accuracy": 0.1871345892548561,
|
|
"num_tokens": 22102150.0,
|
|
"step": 8720
|
|
},
|
|
{
|
|
"entropy": 6.243637466430664,
|
|
"epoch": 1.006924408540104,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004910303559597806,
|
|
"loss": 5.9346,
|
|
"mean_token_accuracy": 0.1791851580142975,
|
|
"num_tokens": 22115250.0,
|
|
"step": 8725
|
|
},
|
|
{
|
|
"entropy": 6.302803611755371,
|
|
"epoch": 1.0075014425851125,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004910188174129564,
|
|
"loss": 5.9405,
|
|
"mean_token_accuracy": 0.17347067594528198,
|
|
"num_tokens": 22129015.0,
|
|
"step": 8730
|
|
},
|
|
{
|
|
"entropy": 6.2511063575744625,
|
|
"epoch": 1.0080784766301212,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004910072716004466,
|
|
"loss": 5.9659,
|
|
"mean_token_accuracy": 0.17493045777082444,
|
|
"num_tokens": 22141716.0,
|
|
"step": 8735
|
|
},
|
|
{
|
|
"entropy": 6.333795022964478,
|
|
"epoch": 1.0086555106751298,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004909957185226394,
|
|
"loss": 6.0124,
|
|
"mean_token_accuracy": 0.16725752502679825,
|
|
"num_tokens": 22153568.0,
|
|
"step": 8740
|
|
},
|
|
{
|
|
"entropy": 6.315547466278076,
|
|
"epoch": 1.0092325447201385,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004909841581799236,
|
|
"loss": 6.0358,
|
|
"mean_token_accuracy": 0.17059850841760635,
|
|
"num_tokens": 22165443.0,
|
|
"step": 8745
|
|
},
|
|
{
|
|
"entropy": 6.297538089752197,
|
|
"epoch": 1.009809578765147,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004909725905726879,
|
|
"loss": 5.9411,
|
|
"mean_token_accuracy": 0.18054274767637252,
|
|
"num_tokens": 22179068.0,
|
|
"step": 8750
|
|
},
|
|
{
|
|
"entropy": 6.290983438491821,
|
|
"epoch": 1.0103866128101557,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004909610157013214,
|
|
"loss": 6.0418,
|
|
"mean_token_accuracy": 0.16726665794849396,
|
|
"num_tokens": 22191597.0,
|
|
"step": 8755
|
|
},
|
|
{
|
|
"entropy": 6.272359132766724,
|
|
"epoch": 1.0109636468551644,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004909494335662134,
|
|
"loss": 5.9777,
|
|
"mean_token_accuracy": 0.17593691051006316,
|
|
"num_tokens": 22203724.0,
|
|
"step": 8760
|
|
},
|
|
{
|
|
"entropy": 6.268367767333984,
|
|
"epoch": 1.011540680900173,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004909378441677535,
|
|
"loss": 5.9386,
|
|
"mean_token_accuracy": 0.1802491694688797,
|
|
"num_tokens": 22216100.0,
|
|
"step": 8765
|
|
},
|
|
{
|
|
"entropy": 6.311220264434814,
|
|
"epoch": 1.0121177149451817,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004909262475063314,
|
|
"loss": 5.9342,
|
|
"mean_token_accuracy": 0.17636322379112243,
|
|
"num_tokens": 22228162.0,
|
|
"step": 8770
|
|
},
|
|
{
|
|
"entropy": 6.266244554519654,
|
|
"epoch": 1.0126947489901905,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004909146435823373,
|
|
"loss": 5.9254,
|
|
"mean_token_accuracy": 0.1820003569126129,
|
|
"num_tokens": 22239756.0,
|
|
"step": 8775
|
|
},
|
|
{
|
|
"entropy": 6.258756494522094,
|
|
"epoch": 1.0132717830351992,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004909030323961613,
|
|
"loss": 5.9261,
|
|
"mean_token_accuracy": 0.1728573277592659,
|
|
"num_tokens": 22252781.0,
|
|
"step": 8780
|
|
},
|
|
{
|
|
"entropy": 6.24869384765625,
|
|
"epoch": 1.0138488170802078,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004908914139481942,
|
|
"loss": 6.0004,
|
|
"mean_token_accuracy": 0.17384298741817475,
|
|
"num_tokens": 22265171.0,
|
|
"step": 8785
|
|
},
|
|
{
|
|
"entropy": 6.272542905807495,
|
|
"epoch": 1.0144258511252164,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004908797882388265,
|
|
"loss": 5.9308,
|
|
"mean_token_accuracy": 0.1815079167485237,
|
|
"num_tokens": 22278121.0,
|
|
"step": 8790
|
|
},
|
|
{
|
|
"entropy": 6.188515949249267,
|
|
"epoch": 1.015002885170225,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004908681552684495,
|
|
"loss": 5.8076,
|
|
"mean_token_accuracy": 0.1845837727189064,
|
|
"num_tokens": 22290074.0,
|
|
"step": 8795
|
|
},
|
|
{
|
|
"entropy": 6.237634563446045,
|
|
"epoch": 1.0155799192152337,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004908565150374542,
|
|
"loss": 5.9317,
|
|
"mean_token_accuracy": 0.18133609592914582,
|
|
"num_tokens": 22303088.0,
|
|
"step": 8800
|
|
},
|
|
{
|
|
"entropy": 6.322842741012574,
|
|
"epoch": 1.0161569532602424,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004908448675462323,
|
|
"loss": 5.9863,
|
|
"mean_token_accuracy": 0.1694008842110634,
|
|
"num_tokens": 22317693.0,
|
|
"step": 8805
|
|
},
|
|
{
|
|
"entropy": 6.229022693634033,
|
|
"epoch": 1.016733987305251,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004908332127951756,
|
|
"loss": 5.9442,
|
|
"mean_token_accuracy": 0.17924002856016158,
|
|
"num_tokens": 22330876.0,
|
|
"step": 8810
|
|
},
|
|
{
|
|
"entropy": 6.266847419738769,
|
|
"epoch": 1.0173110213502596,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004908215507846757,
|
|
"loss": 5.9253,
|
|
"mean_token_accuracy": 0.17635516226291656,
|
|
"num_tokens": 22342620.0,
|
|
"step": 8815
|
|
},
|
|
{
|
|
"entropy": 6.242235136032105,
|
|
"epoch": 1.0178880553952683,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004908098815151254,
|
|
"loss": 5.9486,
|
|
"mean_token_accuracy": 0.1775849163532257,
|
|
"num_tokens": 22353733.0,
|
|
"step": 8820
|
|
},
|
|
{
|
|
"entropy": 6.282942867279052,
|
|
"epoch": 1.018465089440277,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004907982049869168,
|
|
"loss": 5.9636,
|
|
"mean_token_accuracy": 0.17333447337150573,
|
|
"num_tokens": 22366857.0,
|
|
"step": 8825
|
|
},
|
|
{
|
|
"entropy": 6.205226278305053,
|
|
"epoch": 1.0190421234852856,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004907865212004428,
|
|
"loss": 5.8306,
|
|
"mean_token_accuracy": 0.18225234746932983,
|
|
"num_tokens": 22377658.0,
|
|
"step": 8830
|
|
},
|
|
{
|
|
"entropy": 6.268972778320313,
|
|
"epoch": 1.0196191575302942,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004907748301560963,
|
|
"loss": 5.9864,
|
|
"mean_token_accuracy": 0.17106507569551468,
|
|
"num_tokens": 22390060.0,
|
|
"step": 8835
|
|
},
|
|
{
|
|
"entropy": 6.259017467498779,
|
|
"epoch": 1.0201961915753028,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004907631318542707,
|
|
"loss": 5.9534,
|
|
"mean_token_accuracy": 0.17372174561023712,
|
|
"num_tokens": 22402903.0,
|
|
"step": 8840
|
|
},
|
|
{
|
|
"entropy": 6.163227939605713,
|
|
"epoch": 1.0207732256203117,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004907514262953594,
|
|
"loss": 5.8908,
|
|
"mean_token_accuracy": 0.18323398977518082,
|
|
"num_tokens": 22416036.0,
|
|
"step": 8845
|
|
},
|
|
{
|
|
"entropy": 6.34295973777771,
|
|
"epoch": 1.0213502596653203,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004907397134797559,
|
|
"loss": 5.9372,
|
|
"mean_token_accuracy": 0.1771351918578148,
|
|
"num_tokens": 22428000.0,
|
|
"step": 8850
|
|
},
|
|
{
|
|
"entropy": 6.236253643035889,
|
|
"epoch": 1.021927293710329,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004907279934078543,
|
|
"loss": 5.943,
|
|
"mean_token_accuracy": 0.1795724704861641,
|
|
"num_tokens": 22440029.0,
|
|
"step": 8855
|
|
},
|
|
{
|
|
"entropy": 6.244734859466552,
|
|
"epoch": 1.0225043277553376,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004907162660800488,
|
|
"loss": 5.9615,
|
|
"mean_token_accuracy": 0.1742117166519165,
|
|
"num_tokens": 22452906.0,
|
|
"step": 8860
|
|
},
|
|
{
|
|
"entropy": 6.252014303207398,
|
|
"epoch": 1.0230813618003463,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004907045314967338,
|
|
"loss": 5.8512,
|
|
"mean_token_accuracy": 0.18662992119789124,
|
|
"num_tokens": 22465853.0,
|
|
"step": 8865
|
|
},
|
|
{
|
|
"entropy": 6.251199388504029,
|
|
"epoch": 1.023658395845355,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004906927896583041,
|
|
"loss": 5.9166,
|
|
"mean_token_accuracy": 0.17843791097402573,
|
|
"num_tokens": 22478583.0,
|
|
"step": 8870
|
|
},
|
|
{
|
|
"entropy": 6.2310069561004635,
|
|
"epoch": 1.0242354298903635,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004906810405651546,
|
|
"loss": 5.9514,
|
|
"mean_token_accuracy": 0.1803251400589943,
|
|
"num_tokens": 22491665.0,
|
|
"step": 8875
|
|
},
|
|
{
|
|
"entropy": 6.290026569366455,
|
|
"epoch": 1.0248124639353722,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004906692842176803,
|
|
"loss": 5.9343,
|
|
"mean_token_accuracy": 0.1794249892234802,
|
|
"num_tokens": 22504015.0,
|
|
"step": 8880
|
|
},
|
|
{
|
|
"entropy": 6.278184032440185,
|
|
"epoch": 1.0253894979803808,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004906575206162769,
|
|
"loss": 6.0169,
|
|
"mean_token_accuracy": 0.1696304887533188,
|
|
"num_tokens": 22516385.0,
|
|
"step": 8885
|
|
},
|
|
{
|
|
"entropy": 6.293035173416138,
|
|
"epoch": 1.0259665320253895,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004906457497613399,
|
|
"loss": 5.9412,
|
|
"mean_token_accuracy": 0.17702967971563338,
|
|
"num_tokens": 22527988.0,
|
|
"step": 8890
|
|
},
|
|
{
|
|
"entropy": 6.225295543670654,
|
|
"epoch": 1.026543566070398,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004906339716532651,
|
|
"loss": 5.9193,
|
|
"mean_token_accuracy": 0.1842564597725868,
|
|
"num_tokens": 22540613.0,
|
|
"step": 8895
|
|
},
|
|
{
|
|
"entropy": 6.214762258529663,
|
|
"epoch": 1.0271206001154067,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004906221862924488,
|
|
"loss": 5.8908,
|
|
"mean_token_accuracy": 0.18303754180669785,
|
|
"num_tokens": 22552137.0,
|
|
"step": 8900
|
|
},
|
|
{
|
|
"entropy": 6.297317934036255,
|
|
"epoch": 1.0276976341604154,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004906103936792875,
|
|
"loss": 5.9925,
|
|
"mean_token_accuracy": 0.16877427697181702,
|
|
"num_tokens": 22564677.0,
|
|
"step": 8905
|
|
},
|
|
{
|
|
"entropy": 6.28624005317688,
|
|
"epoch": 1.028274668205424,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004905985938141777,
|
|
"loss": 5.9234,
|
|
"mean_token_accuracy": 0.18351348042488097,
|
|
"num_tokens": 22578236.0,
|
|
"step": 8910
|
|
},
|
|
{
|
|
"entropy": 6.232121229171753,
|
|
"epoch": 1.0288517022504329,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.0004905867866975163,
|
|
"loss": 5.9395,
|
|
"mean_token_accuracy": 0.18483252376317977,
|
|
"num_tokens": 22592533.0,
|
|
"step": 8915
|
|
},
|
|
{
|
|
"entropy": 6.336761236190796,
|
|
"epoch": 1.0294287362954415,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004905749723297003,
|
|
"loss": 5.9954,
|
|
"mean_token_accuracy": 0.17142664939165114,
|
|
"num_tokens": 22606062.0,
|
|
"step": 8920
|
|
},
|
|
{
|
|
"entropy": 6.330969190597534,
|
|
"epoch": 1.0300057703404502,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004905631507111271,
|
|
"loss": 6.0044,
|
|
"mean_token_accuracy": 0.1759049713611603,
|
|
"num_tokens": 22619342.0,
|
|
"step": 8925
|
|
},
|
|
{
|
|
"entropy": 6.278731107711792,
|
|
"epoch": 1.0305828043854588,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004905513218421946,
|
|
"loss": 5.9213,
|
|
"mean_token_accuracy": 0.1838388368487358,
|
|
"num_tokens": 22632003.0,
|
|
"step": 8930
|
|
},
|
|
{
|
|
"entropy": 6.2721892356872555,
|
|
"epoch": 1.0311598384304674,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004905394857233004,
|
|
"loss": 5.9619,
|
|
"mean_token_accuracy": 0.18194596022367476,
|
|
"num_tokens": 22644179.0,
|
|
"step": 8935
|
|
},
|
|
{
|
|
"entropy": 6.2627777576446535,
|
|
"epoch": 1.031736872475476,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004905276423548426,
|
|
"loss": 5.9137,
|
|
"mean_token_accuracy": 0.18379924744367598,
|
|
"num_tokens": 22657544.0,
|
|
"step": 8940
|
|
},
|
|
{
|
|
"entropy": 6.312189292907715,
|
|
"epoch": 1.0323139065204847,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004905157917372197,
|
|
"loss": 6.032,
|
|
"mean_token_accuracy": 0.16942367404699327,
|
|
"num_tokens": 22670789.0,
|
|
"step": 8945
|
|
},
|
|
{
|
|
"entropy": 6.268924760818481,
|
|
"epoch": 1.0328909405654934,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004905039338708302,
|
|
"loss": 5.9336,
|
|
"mean_token_accuracy": 0.1744486227631569,
|
|
"num_tokens": 22682491.0,
|
|
"step": 8950
|
|
},
|
|
{
|
|
"entropy": 6.331513929367065,
|
|
"epoch": 1.033467974610502,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004904920687560728,
|
|
"loss": 5.958,
|
|
"mean_token_accuracy": 0.17775530517101287,
|
|
"num_tokens": 22695235.0,
|
|
"step": 8955
|
|
},
|
|
{
|
|
"entropy": 6.240482997894287,
|
|
"epoch": 1.0340450086555106,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004904801963933469,
|
|
"loss": 5.9817,
|
|
"mean_token_accuracy": 0.1754314720630646,
|
|
"num_tokens": 22707222.0,
|
|
"step": 8960
|
|
},
|
|
{
|
|
"entropy": 6.281684684753418,
|
|
"epoch": 1.0346220427005193,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004904683167830515,
|
|
"loss": 5.9881,
|
|
"mean_token_accuracy": 0.17204625010490418,
|
|
"num_tokens": 22718820.0,
|
|
"step": 8965
|
|
},
|
|
{
|
|
"entropy": 6.3858250141143795,
|
|
"epoch": 1.035199076745528,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004904564299255862,
|
|
"loss": 5.9487,
|
|
"mean_token_accuracy": 0.1777167558670044,
|
|
"num_tokens": 22731265.0,
|
|
"step": 8970
|
|
},
|
|
{
|
|
"entropy": 6.2346197128295895,
|
|
"epoch": 1.0357761107905366,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004904445358213511,
|
|
"loss": 5.8784,
|
|
"mean_token_accuracy": 0.18681784719228745,
|
|
"num_tokens": 22744222.0,
|
|
"step": 8975
|
|
},
|
|
{
|
|
"entropy": 6.2135519027709964,
|
|
"epoch": 1.0363531448355452,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004904326344707461,
|
|
"loss": 5.9367,
|
|
"mean_token_accuracy": 0.17929679304361343,
|
|
"num_tokens": 22756190.0,
|
|
"step": 8980
|
|
},
|
|
{
|
|
"entropy": 6.2172692775726315,
|
|
"epoch": 1.036930178880554,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004904207258741712,
|
|
"loss": 5.8621,
|
|
"mean_token_accuracy": 0.18134094625711442,
|
|
"num_tokens": 22767943.0,
|
|
"step": 8985
|
|
},
|
|
{
|
|
"entropy": 6.245588541030884,
|
|
"epoch": 1.0375072129255627,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004904088100320274,
|
|
"loss": 5.926,
|
|
"mean_token_accuracy": 0.18322079628705978,
|
|
"num_tokens": 22780972.0,
|
|
"step": 8990
|
|
},
|
|
{
|
|
"entropy": 6.313575077056885,
|
|
"epoch": 1.0380842469705713,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004903968869447151,
|
|
"loss": 6.0264,
|
|
"mean_token_accuracy": 0.17490241527557374,
|
|
"num_tokens": 22792584.0,
|
|
"step": 8995
|
|
},
|
|
{
|
|
"entropy": 6.190945482254028,
|
|
"epoch": 1.03866128101558,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004903849566126356,
|
|
"loss": 5.9896,
|
|
"mean_token_accuracy": 0.18099549263715745,
|
|
"num_tokens": 22807385.0,
|
|
"step": 9000
|
|
},
|
|
{
|
|
"epoch": 1.03866128101558,
|
|
"eval_entropy": 6.084721145014346,
|
|
"eval_loss": 6.074094295501709,
|
|
"eval_mean_token_accuracy": 0.17770804125441725,
|
|
"eval_num_tokens": 22807385.0,
|
|
"eval_runtime": 17.4178,
|
|
"eval_samples_per_second": 1615.359,
|
|
"eval_steps_per_second": 201.92,
|
|
"step": 9000
|
|
},
|
|
{
|
|
"entropy": 6.313442659378052,
|
|
"epoch": 1.0392383150605886,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004903730190361902,
|
|
"loss": 5.9632,
|
|
"mean_token_accuracy": 0.17392656654119493,
|
|
"num_tokens": 22820655.0,
|
|
"step": 9005
|
|
},
|
|
{
|
|
"entropy": 6.274996948242188,
|
|
"epoch": 1.0398153491055973,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00049036107421578,
|
|
"loss": 5.875,
|
|
"mean_token_accuracy": 0.185438571870327,
|
|
"num_tokens": 22833043.0,
|
|
"step": 9010
|
|
},
|
|
{
|
|
"entropy": 6.250527429580688,
|
|
"epoch": 1.040392383150606,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004903491221518073,
|
|
"loss": 5.9999,
|
|
"mean_token_accuracy": 0.17539497166872026,
|
|
"num_tokens": 22844414.0,
|
|
"step": 9015
|
|
},
|
|
{
|
|
"entropy": 6.217691421508789,
|
|
"epoch": 1.0409694171956145,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004903371628446737,
|
|
"loss": 5.8996,
|
|
"mean_token_accuracy": 0.17889068573713302,
|
|
"num_tokens": 22855966.0,
|
|
"step": 9020
|
|
},
|
|
{
|
|
"entropy": 6.195151519775391,
|
|
"epoch": 1.0415464512406232,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004903251962947817,
|
|
"loss": 5.8646,
|
|
"mean_token_accuracy": 0.1914926216006279,
|
|
"num_tokens": 22869300.0,
|
|
"step": 9025
|
|
},
|
|
{
|
|
"entropy": 6.31218843460083,
|
|
"epoch": 1.0421234852856318,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004903132225025335,
|
|
"loss": 5.9627,
|
|
"mean_token_accuracy": 0.17988667339086534,
|
|
"num_tokens": 22881040.0,
|
|
"step": 9030
|
|
},
|
|
{
|
|
"entropy": 6.275069904327393,
|
|
"epoch": 1.0427005193306405,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004903012414683322,
|
|
"loss": 5.8637,
|
|
"mean_token_accuracy": 0.1878153622150421,
|
|
"num_tokens": 22892367.0,
|
|
"step": 9035
|
|
},
|
|
{
|
|
"entropy": 6.274021911621094,
|
|
"epoch": 1.043277553375649,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004902892531925805,
|
|
"loss": 6.0153,
|
|
"mean_token_accuracy": 0.17131800800561905,
|
|
"num_tokens": 22904737.0,
|
|
"step": 9040
|
|
},
|
|
{
|
|
"entropy": 6.24939112663269,
|
|
"epoch": 1.0438545874206577,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004902772576756818,
|
|
"loss": 6.0132,
|
|
"mean_token_accuracy": 0.17432661205530167,
|
|
"num_tokens": 22917775.0,
|
|
"step": 9045
|
|
},
|
|
{
|
|
"entropy": 6.313559484481812,
|
|
"epoch": 1.0444316214656664,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004902652549180394,
|
|
"loss": 6.0118,
|
|
"mean_token_accuracy": 0.17096944749355317,
|
|
"num_tokens": 22930496.0,
|
|
"step": 9050
|
|
},
|
|
{
|
|
"entropy": 6.278980875015259,
|
|
"epoch": 1.0450086555106752,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004902532449200571,
|
|
"loss": 5.9626,
|
|
"mean_token_accuracy": 0.17596296668052674,
|
|
"num_tokens": 22943787.0,
|
|
"step": 9055
|
|
},
|
|
{
|
|
"entropy": 6.249150037765503,
|
|
"epoch": 1.0455856895556839,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004902412276821386,
|
|
"loss": 5.9539,
|
|
"mean_token_accuracy": 0.1785372719168663,
|
|
"num_tokens": 22956399.0,
|
|
"step": 9060
|
|
},
|
|
{
|
|
"entropy": 6.36644868850708,
|
|
"epoch": 1.0461627236006925,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004902292032046887,
|
|
"loss": 6.031,
|
|
"mean_token_accuracy": 0.1718607723712921,
|
|
"num_tokens": 22969993.0,
|
|
"step": 9065
|
|
},
|
|
{
|
|
"entropy": 6.401646375656128,
|
|
"epoch": 1.0467397576457012,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004902171714881112,
|
|
"loss": 6.0586,
|
|
"mean_token_accuracy": 0.1708688423037529,
|
|
"num_tokens": 22983807.0,
|
|
"step": 9070
|
|
},
|
|
{
|
|
"entropy": 6.274668025970459,
|
|
"epoch": 1.0473167916907098,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004902051325328112,
|
|
"loss": 6.004,
|
|
"mean_token_accuracy": 0.1766917884349823,
|
|
"num_tokens": 22996238.0,
|
|
"step": 9075
|
|
},
|
|
{
|
|
"entropy": 6.275001811981201,
|
|
"epoch": 1.0478938257357184,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004901930863391934,
|
|
"loss": 6.0022,
|
|
"mean_token_accuracy": 0.17750514149665833,
|
|
"num_tokens": 23009084.0,
|
|
"step": 9080
|
|
},
|
|
{
|
|
"entropy": 6.3538471221923825,
|
|
"epoch": 1.048470859780727,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.000490181032907663,
|
|
"loss": 6.0333,
|
|
"mean_token_accuracy": 0.1733698308467865,
|
|
"num_tokens": 23022799.0,
|
|
"step": 9085
|
|
},
|
|
{
|
|
"entropy": 6.252536058425903,
|
|
"epoch": 1.0490478938257357,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004901689722386255,
|
|
"loss": 5.9922,
|
|
"mean_token_accuracy": 0.17759983390569686,
|
|
"num_tokens": 23035566.0,
|
|
"step": 9090
|
|
},
|
|
{
|
|
"entropy": 6.217030572891235,
|
|
"epoch": 1.0496249278707444,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0004901569043324864,
|
|
"loss": 5.8551,
|
|
"mean_token_accuracy": 0.18937528282403945,
|
|
"num_tokens": 23050156.0,
|
|
"step": 9095
|
|
},
|
|
{
|
|
"entropy": 6.304140615463257,
|
|
"epoch": 1.050201961915753,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004901448291896518,
|
|
"loss": 5.964,
|
|
"mean_token_accuracy": 0.17621853202581406,
|
|
"num_tokens": 23063121.0,
|
|
"step": 9100
|
|
},
|
|
{
|
|
"entropy": 6.211063194274902,
|
|
"epoch": 1.0507789959607616,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004901327468105277,
|
|
"loss": 5.8365,
|
|
"mean_token_accuracy": 0.18590471446514129,
|
|
"num_tokens": 23075236.0,
|
|
"step": 9105
|
|
},
|
|
{
|
|
"entropy": 6.220917272567749,
|
|
"epoch": 1.0513560300057703,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004901206571955205,
|
|
"loss": 6.011,
|
|
"mean_token_accuracy": 0.17641226947307587,
|
|
"num_tokens": 23089091.0,
|
|
"step": 9110
|
|
},
|
|
{
|
|
"entropy": 6.319421052932739,
|
|
"epoch": 1.051933064050779,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004901085603450369,
|
|
"loss": 5.9762,
|
|
"mean_token_accuracy": 0.17164439111948013,
|
|
"num_tokens": 23101642.0,
|
|
"step": 9115
|
|
},
|
|
{
|
|
"entropy": 6.340474700927734,
|
|
"epoch": 1.0525100980957875,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004900964562594838,
|
|
"loss": 5.9078,
|
|
"mean_token_accuracy": 0.1801260828971863,
|
|
"num_tokens": 23113427.0,
|
|
"step": 9120
|
|
},
|
|
{
|
|
"entropy": 6.2288182258605955,
|
|
"epoch": 1.0530871321407964,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.000490084344939268,
|
|
"loss": 5.883,
|
|
"mean_token_accuracy": 0.18409405052661895,
|
|
"num_tokens": 23125857.0,
|
|
"step": 9125
|
|
},
|
|
{
|
|
"entropy": 6.2246747493743895,
|
|
"epoch": 1.053664166185805,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004900722263847973,
|
|
"loss": 5.9355,
|
|
"mean_token_accuracy": 0.1781703308224678,
|
|
"num_tokens": 23138541.0,
|
|
"step": 9130
|
|
},
|
|
{
|
|
"entropy": 6.216336917877197,
|
|
"epoch": 1.0542412002308137,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004900601005964791,
|
|
"loss": 5.9201,
|
|
"mean_token_accuracy": 0.18445058017969132,
|
|
"num_tokens": 23151155.0,
|
|
"step": 9135
|
|
},
|
|
{
|
|
"entropy": 6.2328308582305905,
|
|
"epoch": 1.0548182342758223,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004900479675747212,
|
|
"loss": 5.9428,
|
|
"mean_token_accuracy": 0.1755356252193451,
|
|
"num_tokens": 23165478.0,
|
|
"step": 9140
|
|
},
|
|
{
|
|
"entropy": 6.286372423171997,
|
|
"epoch": 1.055395268320831,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004900358273199316,
|
|
"loss": 5.9476,
|
|
"mean_token_accuracy": 0.17133285999298095,
|
|
"num_tokens": 23178120.0,
|
|
"step": 9145
|
|
},
|
|
{
|
|
"entropy": 6.308216190338134,
|
|
"epoch": 1.0559723023658396,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.000490023679832519,
|
|
"loss": 5.9634,
|
|
"mean_token_accuracy": 0.17226850390434265,
|
|
"num_tokens": 23191275.0,
|
|
"step": 9150
|
|
},
|
|
{
|
|
"entropy": 6.207145166397095,
|
|
"epoch": 1.0565493364108482,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004900115251128916,
|
|
"loss": 5.9664,
|
|
"mean_token_accuracy": 0.17270159721374512,
|
|
"num_tokens": 23204518.0,
|
|
"step": 9155
|
|
},
|
|
{
|
|
"entropy": 6.368451738357544,
|
|
"epoch": 1.057126370455857,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004899993631614583,
|
|
"loss": 6.0091,
|
|
"mean_token_accuracy": 0.17063124030828475,
|
|
"num_tokens": 23217488.0,
|
|
"step": 9160
|
|
},
|
|
{
|
|
"entropy": 6.297813034057617,
|
|
"epoch": 1.0577034045008655,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004899871939786283,
|
|
"loss": 5.9517,
|
|
"mean_token_accuracy": 0.17866510897874832,
|
|
"num_tokens": 23230101.0,
|
|
"step": 9165
|
|
},
|
|
{
|
|
"entropy": 6.250898981094361,
|
|
"epoch": 1.0582804385458742,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004899750175648107,
|
|
"loss": 6.1023,
|
|
"mean_token_accuracy": 0.16902584880590438,
|
|
"num_tokens": 23243747.0,
|
|
"step": 9170
|
|
},
|
|
{
|
|
"entropy": 6.296909427642822,
|
|
"epoch": 1.0588574725908828,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004899628339204154,
|
|
"loss": 5.8954,
|
|
"mean_token_accuracy": 0.18030100166797638,
|
|
"num_tokens": 23256593.0,
|
|
"step": 9175
|
|
},
|
|
{
|
|
"entropy": 6.293514776229858,
|
|
"epoch": 1.0594345066358914,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004899506430458518,
|
|
"loss": 6.0224,
|
|
"mean_token_accuracy": 0.17253340929746627,
|
|
"num_tokens": 23269359.0,
|
|
"step": 9180
|
|
},
|
|
{
|
|
"entropy": 6.199410676956177,
|
|
"epoch": 1.0600115406809,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004899384449415302,
|
|
"loss": 5.8559,
|
|
"mean_token_accuracy": 0.1903077781200409,
|
|
"num_tokens": 23283462.0,
|
|
"step": 9185
|
|
},
|
|
{
|
|
"entropy": 6.2551408290863035,
|
|
"epoch": 1.0605885747259087,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004899262396078606,
|
|
"loss": 5.96,
|
|
"mean_token_accuracy": 0.17357292026281357,
|
|
"num_tokens": 23295920.0,
|
|
"step": 9190
|
|
},
|
|
{
|
|
"entropy": 6.3527368068695065,
|
|
"epoch": 1.0611656087709176,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004899140270452539,
|
|
"loss": 5.9859,
|
|
"mean_token_accuracy": 0.17623718380928038,
|
|
"num_tokens": 23307433.0,
|
|
"step": 9195
|
|
},
|
|
{
|
|
"entropy": 6.2791832447052,
|
|
"epoch": 1.0617426428159262,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004899018072541204,
|
|
"loss": 5.9317,
|
|
"mean_token_accuracy": 0.17714277356863023,
|
|
"num_tokens": 23320265.0,
|
|
"step": 9200
|
|
},
|
|
{
|
|
"entropy": 6.240837335586548,
|
|
"epoch": 1.0623196768609349,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004898895802348715,
|
|
"loss": 5.8086,
|
|
"mean_token_accuracy": 0.18867361545562744,
|
|
"num_tokens": 23331951.0,
|
|
"step": 9205
|
|
},
|
|
{
|
|
"entropy": 6.241315603256226,
|
|
"epoch": 1.0628967109059435,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004898773459879183,
|
|
"loss": 5.9554,
|
|
"mean_token_accuracy": 0.17665793150663375,
|
|
"num_tokens": 23344862.0,
|
|
"step": 9210
|
|
},
|
|
{
|
|
"entropy": 6.263033628463745,
|
|
"epoch": 1.0634737449509521,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004898651045136724,
|
|
"loss": 5.9015,
|
|
"mean_token_accuracy": 0.1770300403237343,
|
|
"num_tokens": 23357212.0,
|
|
"step": 9215
|
|
},
|
|
{
|
|
"entropy": 6.239983558654785,
|
|
"epoch": 1.0640507789959608,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004898528558125453,
|
|
"loss": 5.9122,
|
|
"mean_token_accuracy": 0.1855781152844429,
|
|
"num_tokens": 23370114.0,
|
|
"step": 9220
|
|
},
|
|
{
|
|
"entropy": 6.2795045375823975,
|
|
"epoch": 1.0646278130409694,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004898405998849492,
|
|
"loss": 5.9202,
|
|
"mean_token_accuracy": 0.17944572120904922,
|
|
"num_tokens": 23382295.0,
|
|
"step": 9225
|
|
},
|
|
{
|
|
"entropy": 6.242071914672851,
|
|
"epoch": 1.065204847085978,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004898283367312962,
|
|
"loss": 5.9646,
|
|
"mean_token_accuracy": 0.18123720586299896,
|
|
"num_tokens": 23395477.0,
|
|
"step": 9230
|
|
},
|
|
{
|
|
"entropy": 6.255929803848266,
|
|
"epoch": 1.0657818811309867,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004898160663519988,
|
|
"loss": 5.8941,
|
|
"mean_token_accuracy": 0.18162889778614044,
|
|
"num_tokens": 23407868.0,
|
|
"step": 9235
|
|
},
|
|
{
|
|
"entropy": 6.257204484939575,
|
|
"epoch": 1.0663589151759953,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004898037887474697,
|
|
"loss": 5.9754,
|
|
"mean_token_accuracy": 0.17620085179805756,
|
|
"num_tokens": 23422156.0,
|
|
"step": 9240
|
|
},
|
|
{
|
|
"entropy": 6.26265287399292,
|
|
"epoch": 1.066935949221004,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004897915039181219,
|
|
"loss": 5.9044,
|
|
"mean_token_accuracy": 0.18346980959177017,
|
|
"num_tokens": 23433951.0,
|
|
"step": 9245
|
|
},
|
|
{
|
|
"entropy": 6.230978536605835,
|
|
"epoch": 1.0675129832660126,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004897792118643685,
|
|
"loss": 5.9532,
|
|
"mean_token_accuracy": 0.18462717086076735,
|
|
"num_tokens": 23447174.0,
|
|
"step": 9250
|
|
},
|
|
{
|
|
"entropy": 6.2545677661895756,
|
|
"epoch": 1.0680900173110213,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004897669125866231,
|
|
"loss": 5.9351,
|
|
"mean_token_accuracy": 0.18284523487091064,
|
|
"num_tokens": 23458502.0,
|
|
"step": 9255
|
|
},
|
|
{
|
|
"entropy": 6.270356178283691,
|
|
"epoch": 1.06866705135603,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004897546060852993,
|
|
"loss": 6.0253,
|
|
"mean_token_accuracy": 0.17326220422983168,
|
|
"num_tokens": 23471572.0,
|
|
"step": 9260
|
|
},
|
|
{
|
|
"entropy": 6.228240203857422,
|
|
"epoch": 1.0692440854010385,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004897422923608108,
|
|
"loss": 5.8997,
|
|
"mean_token_accuracy": 0.1773914650082588,
|
|
"num_tokens": 23484454.0,
|
|
"step": 9265
|
|
},
|
|
{
|
|
"entropy": 6.254168748855591,
|
|
"epoch": 1.0698211194460474,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004897299714135721,
|
|
"loss": 5.9925,
|
|
"mean_token_accuracy": 0.17173787504434584,
|
|
"num_tokens": 23497022.0,
|
|
"step": 9270
|
|
},
|
|
{
|
|
"entropy": 6.310999917984009,
|
|
"epoch": 1.070398153491056,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004897176432439974,
|
|
"loss": 5.9631,
|
|
"mean_token_accuracy": 0.18117151111364366,
|
|
"num_tokens": 23510714.0,
|
|
"step": 9275
|
|
},
|
|
{
|
|
"entropy": 6.266863012313843,
|
|
"epoch": 1.0709751875360647,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004897053078525016,
|
|
"loss": 5.9645,
|
|
"mean_token_accuracy": 0.17361937761306762,
|
|
"num_tokens": 23522927.0,
|
|
"step": 9280
|
|
},
|
|
{
|
|
"entropy": 6.237617301940918,
|
|
"epoch": 1.0715522215810733,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004896929652394993,
|
|
"loss": 5.861,
|
|
"mean_token_accuracy": 0.1824570968747139,
|
|
"num_tokens": 23536042.0,
|
|
"step": 9285
|
|
},
|
|
{
|
|
"entropy": 6.3404463768005375,
|
|
"epoch": 1.072129255626082,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004896806154054057,
|
|
"loss": 5.9772,
|
|
"mean_token_accuracy": 0.17799821645021438,
|
|
"num_tokens": 23549002.0,
|
|
"step": 9290
|
|
},
|
|
{
|
|
"entropy": 6.2474583148956295,
|
|
"epoch": 1.0727062896710906,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004896682583506363,
|
|
"loss": 6.0185,
|
|
"mean_token_accuracy": 0.17269163578748703,
|
|
"num_tokens": 23563080.0,
|
|
"step": 9295
|
|
},
|
|
{
|
|
"entropy": 6.307273435592651,
|
|
"epoch": 1.0732833237160992,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004896558940756067,
|
|
"loss": 5.9423,
|
|
"mean_token_accuracy": 0.176519912481308,
|
|
"num_tokens": 23577431.0,
|
|
"step": 9300
|
|
},
|
|
{
|
|
"entropy": 6.2496092319488525,
|
|
"epoch": 1.0738603577611079,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004896435225807327,
|
|
"loss": 5.8596,
|
|
"mean_token_accuracy": 0.1761957362294197,
|
|
"num_tokens": 23591191.0,
|
|
"step": 9305
|
|
},
|
|
{
|
|
"entropy": 6.230933475494385,
|
|
"epoch": 1.0744373918061165,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004896311438664304,
|
|
"loss": 5.8573,
|
|
"mean_token_accuracy": 0.18647629022598267,
|
|
"num_tokens": 23603195.0,
|
|
"step": 9310
|
|
},
|
|
{
|
|
"entropy": 6.254529142379761,
|
|
"epoch": 1.0750144258511252,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004896187579331163,
|
|
"loss": 5.9028,
|
|
"mean_token_accuracy": 0.1798198029398918,
|
|
"num_tokens": 23615278.0,
|
|
"step": 9315
|
|
},
|
|
{
|
|
"entropy": 6.273842239379883,
|
|
"epoch": 1.0755914598961338,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004896063647812068,
|
|
"loss": 5.9939,
|
|
"mean_token_accuracy": 0.1774792715907097,
|
|
"num_tokens": 23627311.0,
|
|
"step": 9320
|
|
},
|
|
{
|
|
"entropy": 6.239826726913452,
|
|
"epoch": 1.0761684939411424,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004895939644111189,
|
|
"loss": 5.9215,
|
|
"mean_token_accuracy": 0.18126792460680008,
|
|
"num_tokens": 23640338.0,
|
|
"step": 9325
|
|
},
|
|
{
|
|
"entropy": 6.3032557487487795,
|
|
"epoch": 1.076745527986151,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004895815568232694,
|
|
"loss": 6.0196,
|
|
"mean_token_accuracy": 0.17663963586091996,
|
|
"num_tokens": 23654541.0,
|
|
"step": 9330
|
|
},
|
|
{
|
|
"entropy": 6.281169319152832,
|
|
"epoch": 1.07732256203116,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004895691420180759,
|
|
"loss": 5.9846,
|
|
"mean_token_accuracy": 0.1778423696756363,
|
|
"num_tokens": 23666837.0,
|
|
"step": 9335
|
|
},
|
|
{
|
|
"entropy": 6.35228910446167,
|
|
"epoch": 1.0778995960761686,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000489556719995956,
|
|
"loss": 5.97,
|
|
"mean_token_accuracy": 0.1766431748867035,
|
|
"num_tokens": 23679270.0,
|
|
"step": 9340
|
|
},
|
|
{
|
|
"entropy": 6.268666172027588,
|
|
"epoch": 1.0784766301211772,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004895442907573274,
|
|
"loss": 5.9574,
|
|
"mean_token_accuracy": 0.178663232922554,
|
|
"num_tokens": 23691640.0,
|
|
"step": 9345
|
|
},
|
|
{
|
|
"entropy": 6.240317010879517,
|
|
"epoch": 1.0790536641661859,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.000489531854302608,
|
|
"loss": 5.9613,
|
|
"mean_token_accuracy": 0.17662242352962493,
|
|
"num_tokens": 23704545.0,
|
|
"step": 9350
|
|
},
|
|
{
|
|
"entropy": 6.238865852355957,
|
|
"epoch": 1.0796306982111945,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004895194106322164,
|
|
"loss": 5.9033,
|
|
"mean_token_accuracy": 0.1860482156276703,
|
|
"num_tokens": 23716319.0,
|
|
"step": 9355
|
|
},
|
|
{
|
|
"entropy": 6.265583896636963,
|
|
"epoch": 1.0802077322562031,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004895069597465709,
|
|
"loss": 5.9715,
|
|
"mean_token_accuracy": 0.1786327689886093,
|
|
"num_tokens": 23728633.0,
|
|
"step": 9360
|
|
},
|
|
{
|
|
"entropy": 6.3230654239654545,
|
|
"epoch": 1.0807847663012118,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004894945016460904,
|
|
"loss": 5.9901,
|
|
"mean_token_accuracy": 0.1795554667711258,
|
|
"num_tokens": 23741370.0,
|
|
"step": 9365
|
|
},
|
|
{
|
|
"entropy": 6.235442304611206,
|
|
"epoch": 1.0813618003462204,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004894820363311938,
|
|
"loss": 5.917,
|
|
"mean_token_accuracy": 0.185208560526371,
|
|
"num_tokens": 23754026.0,
|
|
"step": 9370
|
|
},
|
|
{
|
|
"entropy": 6.2940778732299805,
|
|
"epoch": 1.081938834391229,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004894695638023005,
|
|
"loss": 6.017,
|
|
"mean_token_accuracy": 0.16951347440481185,
|
|
"num_tokens": 23766950.0,
|
|
"step": 9375
|
|
},
|
|
{
|
|
"entropy": 6.275958490371704,
|
|
"epoch": 1.0825158684362377,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.00048945708405983,
|
|
"loss": 5.9975,
|
|
"mean_token_accuracy": 0.17893885672092438,
|
|
"num_tokens": 23780858.0,
|
|
"step": 9380
|
|
},
|
|
{
|
|
"entropy": 6.270656681060791,
|
|
"epoch": 1.0830929024812463,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004894445971042019,
|
|
"loss": 5.9415,
|
|
"mean_token_accuracy": 0.17487251460552217,
|
|
"num_tokens": 23793213.0,
|
|
"step": 9385
|
|
},
|
|
{
|
|
"entropy": 6.233089923858643,
|
|
"epoch": 1.083669936526255,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004894321029358364,
|
|
"loss": 5.9367,
|
|
"mean_token_accuracy": 0.17659147530794145,
|
|
"num_tokens": 23804754.0,
|
|
"step": 9390
|
|
},
|
|
{
|
|
"entropy": 6.246839284896851,
|
|
"epoch": 1.0842469705712636,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004894196015551536,
|
|
"loss": 5.9952,
|
|
"mean_token_accuracy": 0.17514082789421082,
|
|
"num_tokens": 23817503.0,
|
|
"step": 9395
|
|
},
|
|
{
|
|
"entropy": 6.269915151596069,
|
|
"epoch": 1.0848240046162723,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.000489407092962574,
|
|
"loss": 5.9739,
|
|
"mean_token_accuracy": 0.17312580794095994,
|
|
"num_tokens": 23830263.0,
|
|
"step": 9400
|
|
},
|
|
{
|
|
"entropy": 6.2076012134552006,
|
|
"epoch": 1.085401038661281,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004893945771585183,
|
|
"loss": 5.8892,
|
|
"mean_token_accuracy": 0.18111756443977356,
|
|
"num_tokens": 23843734.0,
|
|
"step": 9405
|
|
},
|
|
{
|
|
"entropy": 6.334919023513794,
|
|
"epoch": 1.0859780727062898,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004893820541434075,
|
|
"loss": 5.994,
|
|
"mean_token_accuracy": 0.1769810661673546,
|
|
"num_tokens": 23856857.0,
|
|
"step": 9410
|
|
},
|
|
{
|
|
"entropy": 6.277773189544678,
|
|
"epoch": 1.0865551067512984,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004893695239176629,
|
|
"loss": 5.8815,
|
|
"mean_token_accuracy": 0.18349405825138093,
|
|
"num_tokens": 23869961.0,
|
|
"step": 9415
|
|
},
|
|
{
|
|
"entropy": 6.309881114959717,
|
|
"epoch": 1.087132140796307,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004893569864817057,
|
|
"loss": 5.9669,
|
|
"mean_token_accuracy": 0.17408453524112702,
|
|
"num_tokens": 23884551.0,
|
|
"step": 9420
|
|
},
|
|
{
|
|
"entropy": 6.270121240615845,
|
|
"epoch": 1.0877091748413157,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004893444418359579,
|
|
"loss": 6.0336,
|
|
"mean_token_accuracy": 0.17170625180006027,
|
|
"num_tokens": 23897240.0,
|
|
"step": 9425
|
|
},
|
|
{
|
|
"entropy": 6.264082288742065,
|
|
"epoch": 1.0882862088863243,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.000489331889980841,
|
|
"loss": 5.9237,
|
|
"mean_token_accuracy": 0.17865306586027146,
|
|
"num_tokens": 23909677.0,
|
|
"step": 9430
|
|
},
|
|
{
|
|
"entropy": 6.2898622989654545,
|
|
"epoch": 1.088863242931333,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004893193309167778,
|
|
"loss": 5.9709,
|
|
"mean_token_accuracy": 0.1740755632519722,
|
|
"num_tokens": 23921552.0,
|
|
"step": 9435
|
|
},
|
|
{
|
|
"entropy": 6.293569660186767,
|
|
"epoch": 1.0894402769763416,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004893067646441902,
|
|
"loss": 5.9893,
|
|
"mean_token_accuracy": 0.1750696122646332,
|
|
"num_tokens": 23936315.0,
|
|
"step": 9440
|
|
},
|
|
{
|
|
"entropy": 6.2551616668701175,
|
|
"epoch": 1.0900173110213502,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.000489294191163501,
|
|
"loss": 5.989,
|
|
"mean_token_accuracy": 0.1700183093547821,
|
|
"num_tokens": 23948939.0,
|
|
"step": 9445
|
|
},
|
|
{
|
|
"entropy": 6.315537405014038,
|
|
"epoch": 1.0905943450663589,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004892816104751331,
|
|
"loss": 5.9714,
|
|
"mean_token_accuracy": 0.17250317335128784,
|
|
"num_tokens": 23961657.0,
|
|
"step": 9450
|
|
},
|
|
{
|
|
"entropy": 6.379075288772583,
|
|
"epoch": 1.0911713791113675,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004892690225795096,
|
|
"loss": 6.0779,
|
|
"mean_token_accuracy": 0.16363574415445328,
|
|
"num_tokens": 23974085.0,
|
|
"step": 9455
|
|
},
|
|
{
|
|
"entropy": 6.226323127746582,
|
|
"epoch": 1.0917484131563762,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004892564274770542,
|
|
"loss": 5.8984,
|
|
"mean_token_accuracy": 0.18159161359071732,
|
|
"num_tokens": 23987038.0,
|
|
"step": 9460
|
|
},
|
|
{
|
|
"entropy": 6.324076747894287,
|
|
"epoch": 1.0923254472013848,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004892438251681901,
|
|
"loss": 5.9539,
|
|
"mean_token_accuracy": 0.1822775423526764,
|
|
"num_tokens": 24001051.0,
|
|
"step": 9465
|
|
},
|
|
{
|
|
"entropy": 6.249374294281006,
|
|
"epoch": 1.0929024812463934,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004892312156533413,
|
|
"loss": 5.9418,
|
|
"mean_token_accuracy": 0.17759458720684052,
|
|
"num_tokens": 24013817.0,
|
|
"step": 9470
|
|
},
|
|
{
|
|
"entropy": 6.213703584671021,
|
|
"epoch": 1.0934795152914023,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004892185989329321,
|
|
"loss": 5.9026,
|
|
"mean_token_accuracy": 0.18459791988134383,
|
|
"num_tokens": 24025810.0,
|
|
"step": 9475
|
|
},
|
|
{
|
|
"entropy": 6.205026483535766,
|
|
"epoch": 1.094056549336411,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004892059750073868,
|
|
"loss": 5.8696,
|
|
"mean_token_accuracy": 0.18799868524074553,
|
|
"num_tokens": 24039796.0,
|
|
"step": 9480
|
|
},
|
|
{
|
|
"entropy": 6.299359941482544,
|
|
"epoch": 1.0946335833814196,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004891933438771299,
|
|
"loss": 5.9544,
|
|
"mean_token_accuracy": 0.18001185804605485,
|
|
"num_tokens": 24052721.0,
|
|
"step": 9485
|
|
},
|
|
{
|
|
"entropy": 6.223298168182373,
|
|
"epoch": 1.0952106174264282,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004891807055425862,
|
|
"loss": 5.8763,
|
|
"mean_token_accuracy": 0.18155607432127,
|
|
"num_tokens": 24064515.0,
|
|
"step": 9490
|
|
},
|
|
{
|
|
"entropy": 6.23270058631897,
|
|
"epoch": 1.0957876514714369,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004891680600041809,
|
|
"loss": 5.8902,
|
|
"mean_token_accuracy": 0.18266638964414597,
|
|
"num_tokens": 24078537.0,
|
|
"step": 9495
|
|
},
|
|
{
|
|
"entropy": 6.345634460449219,
|
|
"epoch": 1.0963646855164455,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004891554072623392,
|
|
"loss": 6.0158,
|
|
"mean_token_accuracy": 0.17161341458559037,
|
|
"num_tokens": 24092067.0,
|
|
"step": 9500
|
|
},
|
|
{
|
|
"entropy": 6.255663776397705,
|
|
"epoch": 1.0969417195614541,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004891427473174869,
|
|
"loss": 5.9806,
|
|
"mean_token_accuracy": 0.17526648789644242,
|
|
"num_tokens": 24105625.0,
|
|
"step": 9505
|
|
},
|
|
{
|
|
"entropy": 6.310681390762329,
|
|
"epoch": 1.0975187536064628,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004891300801700496,
|
|
"loss": 5.9889,
|
|
"mean_token_accuracy": 0.1670171231031418,
|
|
"num_tokens": 24119714.0,
|
|
"step": 9510
|
|
},
|
|
{
|
|
"entropy": 6.2422620296478275,
|
|
"epoch": 1.0980957876514714,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004891174058204534,
|
|
"loss": 5.9128,
|
|
"mean_token_accuracy": 0.17377041578292846,
|
|
"num_tokens": 24132873.0,
|
|
"step": 9515
|
|
},
|
|
{
|
|
"entropy": 6.1889232158660885,
|
|
"epoch": 1.09867282169648,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004891047242691246,
|
|
"loss": 5.8912,
|
|
"mean_token_accuracy": 0.17926355302333832,
|
|
"num_tokens": 24145550.0,
|
|
"step": 9520
|
|
},
|
|
{
|
|
"entropy": 6.221427726745605,
|
|
"epoch": 1.0992498557414887,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004890920355164897,
|
|
"loss": 5.9078,
|
|
"mean_token_accuracy": 0.17647993713617324,
|
|
"num_tokens": 24158232.0,
|
|
"step": 9525
|
|
},
|
|
{
|
|
"entropy": 6.305940246582031,
|
|
"epoch": 1.0998268897864973,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004890793395629756,
|
|
"loss": 6.049,
|
|
"mean_token_accuracy": 0.16808070093393326,
|
|
"num_tokens": 24170780.0,
|
|
"step": 9530
|
|
},
|
|
{
|
|
"entropy": 6.220670223236084,
|
|
"epoch": 1.100403923831506,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004890666364090093,
|
|
"loss": 5.9178,
|
|
"mean_token_accuracy": 0.18042859733104705,
|
|
"num_tokens": 24182347.0,
|
|
"step": 9535
|
|
},
|
|
{
|
|
"entropy": 6.292816114425659,
|
|
"epoch": 1.1009809578765146,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004890539260550181,
|
|
"loss": 6.0075,
|
|
"mean_token_accuracy": 0.1743740364909172,
|
|
"num_tokens": 24195215.0,
|
|
"step": 9540
|
|
},
|
|
{
|
|
"entropy": 6.28514461517334,
|
|
"epoch": 1.1015579919215233,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004890412085014292,
|
|
"loss": 5.9182,
|
|
"mean_token_accuracy": 0.18192071616649627,
|
|
"num_tokens": 24208214.0,
|
|
"step": 9545
|
|
},
|
|
{
|
|
"entropy": 6.272170162200927,
|
|
"epoch": 1.1021350259665321,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004890284837486706,
|
|
"loss": 5.9363,
|
|
"mean_token_accuracy": 0.17845190614461898,
|
|
"num_tokens": 24220883.0,
|
|
"step": 9550
|
|
},
|
|
{
|
|
"entropy": 6.224795198440551,
|
|
"epoch": 1.1027120600115408,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004890157517971704,
|
|
"loss": 5.8637,
|
|
"mean_token_accuracy": 0.18637510240077973,
|
|
"num_tokens": 24233918.0,
|
|
"step": 9555
|
|
},
|
|
{
|
|
"entropy": 6.2827919006347654,
|
|
"epoch": 1.1032890940565494,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004890030126473566,
|
|
"loss": 6.0017,
|
|
"mean_token_accuracy": 0.17295387089252473,
|
|
"num_tokens": 24247307.0,
|
|
"step": 9560
|
|
},
|
|
{
|
|
"entropy": 6.262751674652099,
|
|
"epoch": 1.103866128101558,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004889902662996578,
|
|
"loss": 5.8885,
|
|
"mean_token_accuracy": 0.18006763756275176,
|
|
"num_tokens": 24260149.0,
|
|
"step": 9565
|
|
},
|
|
{
|
|
"entropy": 6.2460860252380375,
|
|
"epoch": 1.1044431621465667,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004889775127545027,
|
|
"loss": 5.9753,
|
|
"mean_token_accuracy": 0.17819419503211975,
|
|
"num_tokens": 24273675.0,
|
|
"step": 9570
|
|
},
|
|
{
|
|
"entropy": 6.273380994796753,
|
|
"epoch": 1.1050201961915753,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004889647520123202,
|
|
"loss": 5.8817,
|
|
"mean_token_accuracy": 0.18066975921392442,
|
|
"num_tokens": 24285575.0,
|
|
"step": 9575
|
|
},
|
|
{
|
|
"entropy": 6.266949462890625,
|
|
"epoch": 1.105597230236584,
|
|
"grad_norm": 1.984375,
|
|
"learning_rate": 0.0004889519840735396,
|
|
"loss": 5.9146,
|
|
"mean_token_accuracy": 0.19424535930156708,
|
|
"num_tokens": 24297908.0,
|
|
"step": 9580
|
|
},
|
|
{
|
|
"entropy": 6.182698535919189,
|
|
"epoch": 1.1061742642815926,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004889392089385903,
|
|
"loss": 5.8977,
|
|
"mean_token_accuracy": 0.18063640892505645,
|
|
"num_tokens": 24310714.0,
|
|
"step": 9585
|
|
},
|
|
{
|
|
"entropy": 6.233695125579834,
|
|
"epoch": 1.1067512983266012,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004889264266079019,
|
|
"loss": 5.9384,
|
|
"mean_token_accuracy": 0.18608282655477523,
|
|
"num_tokens": 24322367.0,
|
|
"step": 9590
|
|
},
|
|
{
|
|
"entropy": 6.27492094039917,
|
|
"epoch": 1.1073283323716099,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004889136370819045,
|
|
"loss": 5.9241,
|
|
"mean_token_accuracy": 0.17917955815792083,
|
|
"num_tokens": 24334256.0,
|
|
"step": 9595
|
|
},
|
|
{
|
|
"entropy": 6.238777923583984,
|
|
"epoch": 1.1079053664166185,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004889008403610281,
|
|
"loss": 5.9273,
|
|
"mean_token_accuracy": 0.18196589946746827,
|
|
"num_tokens": 24346968.0,
|
|
"step": 9600
|
|
},
|
|
{
|
|
"entropy": 6.318524122238159,
|
|
"epoch": 1.1084824004616272,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004888880364457033,
|
|
"loss": 5.9858,
|
|
"mean_token_accuracy": 0.18197154253721237,
|
|
"num_tokens": 24360468.0,
|
|
"step": 9605
|
|
},
|
|
{
|
|
"entropy": 6.250274705886841,
|
|
"epoch": 1.1090594345066358,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004888752253363604,
|
|
"loss": 5.9434,
|
|
"mean_token_accuracy": 0.1844514176249504,
|
|
"num_tokens": 24372330.0,
|
|
"step": 9610
|
|
},
|
|
{
|
|
"entropy": 6.191738557815552,
|
|
"epoch": 1.1096364685516447,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004888624070334308,
|
|
"loss": 5.9206,
|
|
"mean_token_accuracy": 0.17861685305833816,
|
|
"num_tokens": 24384864.0,
|
|
"step": 9615
|
|
},
|
|
{
|
|
"entropy": 6.206880760192871,
|
|
"epoch": 1.1102135025966533,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004888495815373452,
|
|
"loss": 5.8315,
|
|
"mean_token_accuracy": 0.18677129745483398,
|
|
"num_tokens": 24397408.0,
|
|
"step": 9620
|
|
},
|
|
{
|
|
"entropy": 6.244317722320557,
|
|
"epoch": 1.110790536641662,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004888367488485351,
|
|
"loss": 5.8915,
|
|
"mean_token_accuracy": 0.18083362877368928,
|
|
"num_tokens": 24409113.0,
|
|
"step": 9625
|
|
},
|
|
{
|
|
"entropy": 6.221122789382934,
|
|
"epoch": 1.1113675706866706,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004888239089674323,
|
|
"loss": 5.8999,
|
|
"mean_token_accuracy": 0.17989745289087294,
|
|
"num_tokens": 24420818.0,
|
|
"step": 9630
|
|
},
|
|
{
|
|
"entropy": 6.320473575592041,
|
|
"epoch": 1.1119446047316792,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004888110618944686,
|
|
"loss": 6.0477,
|
|
"mean_token_accuracy": 0.16832794100046158,
|
|
"num_tokens": 24434452.0,
|
|
"step": 9635
|
|
},
|
|
{
|
|
"entropy": 6.317052507400513,
|
|
"epoch": 1.1125216387766879,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004887982076300759,
|
|
"loss": 6.018,
|
|
"mean_token_accuracy": 0.17300770580768585,
|
|
"num_tokens": 24448674.0,
|
|
"step": 9640
|
|
},
|
|
{
|
|
"entropy": 6.278442859649658,
|
|
"epoch": 1.1130986728216965,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004887853461746867,
|
|
"loss": 5.9311,
|
|
"mean_token_accuracy": 0.17755277156829835,
|
|
"num_tokens": 24461388.0,
|
|
"step": 9645
|
|
},
|
|
{
|
|
"entropy": 6.260433673858643,
|
|
"epoch": 1.1136757068667051,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004887724775287336,
|
|
"loss": 5.8879,
|
|
"mean_token_accuracy": 0.18106852620840072,
|
|
"num_tokens": 24474304.0,
|
|
"step": 9650
|
|
},
|
|
{
|
|
"entropy": 6.193238162994385,
|
|
"epoch": 1.1142527409117138,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004887596016926494,
|
|
"loss": 5.8876,
|
|
"mean_token_accuracy": 0.1843292832374573,
|
|
"num_tokens": 24487175.0,
|
|
"step": 9655
|
|
},
|
|
{
|
|
"entropy": 6.247819232940674,
|
|
"epoch": 1.1148297749567224,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004887467186668673,
|
|
"loss": 5.9165,
|
|
"mean_token_accuracy": 0.17582756131887436,
|
|
"num_tokens": 24500160.0,
|
|
"step": 9660
|
|
},
|
|
{
|
|
"entropy": 6.303691053390503,
|
|
"epoch": 1.115406809001731,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004887338284518204,
|
|
"loss": 6.0161,
|
|
"mean_token_accuracy": 0.17239674627780915,
|
|
"num_tokens": 24513358.0,
|
|
"step": 9665
|
|
},
|
|
{
|
|
"entropy": 6.237333631515503,
|
|
"epoch": 1.1159838430467397,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004887209310479423,
|
|
"loss": 5.9054,
|
|
"mean_token_accuracy": 0.18612945675849915,
|
|
"num_tokens": 24526254.0,
|
|
"step": 9670
|
|
},
|
|
{
|
|
"entropy": 6.213815975189209,
|
|
"epoch": 1.1165608770917483,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004887080264556668,
|
|
"loss": 5.8248,
|
|
"mean_token_accuracy": 0.18724657446146012,
|
|
"num_tokens": 24540023.0,
|
|
"step": 9675
|
|
},
|
|
{
|
|
"entropy": 6.252214860916138,
|
|
"epoch": 1.117137911136757,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004886951146754282,
|
|
"loss": 5.9475,
|
|
"mean_token_accuracy": 0.17748111933469773,
|
|
"num_tokens": 24553270.0,
|
|
"step": 9680
|
|
},
|
|
{
|
|
"entropy": 6.2683617115020756,
|
|
"epoch": 1.1177149451817656,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004886821957076603,
|
|
"loss": 5.9217,
|
|
"mean_token_accuracy": 0.181137290596962,
|
|
"num_tokens": 24565576.0,
|
|
"step": 9685
|
|
},
|
|
{
|
|
"entropy": 6.23697943687439,
|
|
"epoch": 1.1182919792267745,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.000488669269552798,
|
|
"loss": 6.0058,
|
|
"mean_token_accuracy": 0.17781507223844528,
|
|
"num_tokens": 24578825.0,
|
|
"step": 9690
|
|
},
|
|
{
|
|
"entropy": 6.2838945388793945,
|
|
"epoch": 1.1188690132717831,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.000488656336211276,
|
|
"loss": 6.0018,
|
|
"mean_token_accuracy": 0.17679450809955596,
|
|
"num_tokens": 24592058.0,
|
|
"step": 9695
|
|
},
|
|
{
|
|
"entropy": 6.310996246337891,
|
|
"epoch": 1.1194460473167918,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004886433956835292,
|
|
"loss": 5.8804,
|
|
"mean_token_accuracy": 0.18037169873714448,
|
|
"num_tokens": 24605956.0,
|
|
"step": 9700
|
|
},
|
|
{
|
|
"entropy": 6.2612090587615965,
|
|
"epoch": 1.1200230813618004,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004886304479699929,
|
|
"loss": 5.9197,
|
|
"mean_token_accuracy": 0.18407063484191893,
|
|
"num_tokens": 24618904.0,
|
|
"step": 9705
|
|
},
|
|
{
|
|
"entropy": 6.2928119659423825,
|
|
"epoch": 1.120600115406809,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004886174930711027,
|
|
"loss": 6.0456,
|
|
"mean_token_accuracy": 0.17686478793621063,
|
|
"num_tokens": 24632720.0,
|
|
"step": 9710
|
|
},
|
|
{
|
|
"entropy": 6.260981178283691,
|
|
"epoch": 1.1211771494518177,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004886045309872941,
|
|
"loss": 5.9979,
|
|
"mean_token_accuracy": 0.17472656220197677,
|
|
"num_tokens": 24644863.0,
|
|
"step": 9715
|
|
},
|
|
{
|
|
"entropy": 6.306377601623535,
|
|
"epoch": 1.1217541834968263,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004885915617190034,
|
|
"loss": 5.9805,
|
|
"mean_token_accuracy": 0.17594851553440094,
|
|
"num_tokens": 24656884.0,
|
|
"step": 9720
|
|
},
|
|
{
|
|
"entropy": 6.281054592132568,
|
|
"epoch": 1.122331217541835,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004885785852666664,
|
|
"loss": 5.9456,
|
|
"mean_token_accuracy": 0.17910037338733673,
|
|
"num_tokens": 24671008.0,
|
|
"step": 9725
|
|
},
|
|
{
|
|
"entropy": 6.2424633502960205,
|
|
"epoch": 1.1229082515868436,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004885656016307199,
|
|
"loss": 5.9427,
|
|
"mean_token_accuracy": 0.17576711028814315,
|
|
"num_tokens": 24685787.0,
|
|
"step": 9730
|
|
},
|
|
{
|
|
"entropy": 6.344523096084595,
|
|
"epoch": 1.1234852856318522,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004885526108116004,
|
|
"loss": 6.0128,
|
|
"mean_token_accuracy": 0.17457142174243928,
|
|
"num_tokens": 24697233.0,
|
|
"step": 9735
|
|
},
|
|
{
|
|
"entropy": 6.26629490852356,
|
|
"epoch": 1.1240623196768609,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000488539612809745,
|
|
"loss": 5.9203,
|
|
"mean_token_accuracy": 0.18147749304771424,
|
|
"num_tokens": 24709409.0,
|
|
"step": 9740
|
|
},
|
|
{
|
|
"entropy": 6.288652181625366,
|
|
"epoch": 1.1246393537218695,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004885266076255907,
|
|
"loss": 5.9991,
|
|
"mean_token_accuracy": 0.17411095947027205,
|
|
"num_tokens": 24722006.0,
|
|
"step": 9745
|
|
},
|
|
{
|
|
"entropy": 6.341065502166748,
|
|
"epoch": 1.1252163877668782,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.000488513595259575,
|
|
"loss": 5.9978,
|
|
"mean_token_accuracy": 0.16869597434997557,
|
|
"num_tokens": 24736060.0,
|
|
"step": 9750
|
|
},
|
|
{
|
|
"entropy": 6.306094789505005,
|
|
"epoch": 1.125793421811887,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004885005757121357,
|
|
"loss": 5.9776,
|
|
"mean_token_accuracy": 0.17298872172832488,
|
|
"num_tokens": 24748008.0,
|
|
"step": 9755
|
|
},
|
|
{
|
|
"entropy": 6.277267408370972,
|
|
"epoch": 1.1263704558568954,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004884875489837105,
|
|
"loss": 5.9418,
|
|
"mean_token_accuracy": 0.1754933163523674,
|
|
"num_tokens": 24760631.0,
|
|
"step": 9760
|
|
},
|
|
{
|
|
"entropy": 6.109272480010986,
|
|
"epoch": 1.1269474899019043,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004884745150747378,
|
|
"loss": 5.8061,
|
|
"mean_token_accuracy": 0.1959839642047882,
|
|
"num_tokens": 24772646.0,
|
|
"step": 9765
|
|
},
|
|
{
|
|
"entropy": 6.2138436794281,
|
|
"epoch": 1.127524523946913,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004884614739856556,
|
|
"loss": 5.9671,
|
|
"mean_token_accuracy": 0.17570037841796876,
|
|
"num_tokens": 24784571.0,
|
|
"step": 9770
|
|
},
|
|
{
|
|
"entropy": 6.336449003219604,
|
|
"epoch": 1.1281015579919216,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004884484257169028,
|
|
"loss": 5.9631,
|
|
"mean_token_accuracy": 0.17928054183721542,
|
|
"num_tokens": 24797810.0,
|
|
"step": 9775
|
|
},
|
|
{
|
|
"entropy": 6.231250190734864,
|
|
"epoch": 1.1286785920369302,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004884353702689183,
|
|
"loss": 5.92,
|
|
"mean_token_accuracy": 0.17948038578033448,
|
|
"num_tokens": 24810677.0,
|
|
"step": 9780
|
|
},
|
|
{
|
|
"entropy": 6.246661615371704,
|
|
"epoch": 1.1292556260819389,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004884223076421411,
|
|
"loss": 5.8837,
|
|
"mean_token_accuracy": 0.1834596186876297,
|
|
"num_tokens": 24823138.0,
|
|
"step": 9785
|
|
},
|
|
{
|
|
"entropy": 6.161348485946656,
|
|
"epoch": 1.1298326601269475,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004884092378370106,
|
|
"loss": 5.8994,
|
|
"mean_token_accuracy": 0.19012928754091263,
|
|
"num_tokens": 24834548.0,
|
|
"step": 9790
|
|
},
|
|
{
|
|
"entropy": 6.260898113250732,
|
|
"epoch": 1.1304096941719561,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004883961608539664,
|
|
"loss": 5.9793,
|
|
"mean_token_accuracy": 0.1769823431968689,
|
|
"num_tokens": 24847326.0,
|
|
"step": 9795
|
|
},
|
|
{
|
|
"entropy": 6.243139791488647,
|
|
"epoch": 1.1309867282169648,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004883830766934484,
|
|
"loss": 5.7928,
|
|
"mean_token_accuracy": 0.1948003813624382,
|
|
"num_tokens": 24860417.0,
|
|
"step": 9800
|
|
},
|
|
{
|
|
"entropy": 6.203162908554077,
|
|
"epoch": 1.1315637622619734,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004883699853558965,
|
|
"loss": 5.9125,
|
|
"mean_token_accuracy": 0.17804983854293824,
|
|
"num_tokens": 24872759.0,
|
|
"step": 9805
|
|
},
|
|
{
|
|
"entropy": 6.2547111988067625,
|
|
"epoch": 1.132140796306982,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004883568868417511,
|
|
"loss": 5.8794,
|
|
"mean_token_accuracy": 0.17914481908082963,
|
|
"num_tokens": 24885278.0,
|
|
"step": 9810
|
|
},
|
|
{
|
|
"entropy": 6.285055685043335,
|
|
"epoch": 1.1327178303519907,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004883437811514528,
|
|
"loss": 6.0068,
|
|
"mean_token_accuracy": 0.1728021264076233,
|
|
"num_tokens": 24898596.0,
|
|
"step": 9815
|
|
},
|
|
{
|
|
"entropy": 6.273211240768433,
|
|
"epoch": 1.1332948643969993,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004883306682854424,
|
|
"loss": 5.931,
|
|
"mean_token_accuracy": 0.18046294897794724,
|
|
"num_tokens": 24911755.0,
|
|
"step": 9820
|
|
},
|
|
{
|
|
"entropy": 6.307237911224365,
|
|
"epoch": 1.133871898442008,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004883175482441611,
|
|
"loss": 5.9945,
|
|
"mean_token_accuracy": 0.17272798269987105,
|
|
"num_tokens": 24925197.0,
|
|
"step": 9825
|
|
},
|
|
{
|
|
"entropy": 6.180803823471069,
|
|
"epoch": 1.1344489324870168,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004883044210280499,
|
|
"loss": 5.8241,
|
|
"mean_token_accuracy": 0.18567555099725724,
|
|
"num_tokens": 24938204.0,
|
|
"step": 9830
|
|
},
|
|
{
|
|
"entropy": 6.20053653717041,
|
|
"epoch": 1.1350259665320255,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004882912866375505,
|
|
"loss": 5.9601,
|
|
"mean_token_accuracy": 0.18451820313930511,
|
|
"num_tokens": 24949382.0,
|
|
"step": 9835
|
|
},
|
|
{
|
|
"entropy": 6.2447374820709225,
|
|
"epoch": 1.1356030005770341,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00048827814507310455,
|
|
"loss": 5.9229,
|
|
"mean_token_accuracy": 0.17463673502206803,
|
|
"num_tokens": 24961685.0,
|
|
"step": 9840
|
|
},
|
|
{
|
|
"entropy": 6.234250545501709,
|
|
"epoch": 1.1361800346220428,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048826499633515416,
|
|
"loss": 5.9051,
|
|
"mean_token_accuracy": 0.18329232782125474,
|
|
"num_tokens": 24973619.0,
|
|
"step": 9845
|
|
},
|
|
{
|
|
"entropy": 6.21411657333374,
|
|
"epoch": 1.1367570686670514,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048825184042414156,
|
|
"loss": 5.9044,
|
|
"mean_token_accuracy": 0.18802542388439178,
|
|
"num_tokens": 24985156.0,
|
|
"step": 9850
|
|
},
|
|
{
|
|
"entropy": 6.160888385772705,
|
|
"epoch": 1.13733410271206,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004882386773405092,
|
|
"loss": 5.9201,
|
|
"mean_token_accuracy": 0.1874276265501976,
|
|
"num_tokens": 24997891.0,
|
|
"step": 9855
|
|
},
|
|
{
|
|
"entropy": 6.3374419689178465,
|
|
"epoch": 1.1379111367570687,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004882255070846999,
|
|
"loss": 5.9334,
|
|
"mean_token_accuracy": 0.17814454138278962,
|
|
"num_tokens": 25009824.0,
|
|
"step": 9860
|
|
},
|
|
{
|
|
"entropy": 6.28568754196167,
|
|
"epoch": 1.1384881708020773,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00048821232965715663,
|
|
"loss": 5.9641,
|
|
"mean_token_accuracy": 0.17603467255830765,
|
|
"num_tokens": 25021574.0,
|
|
"step": 9865
|
|
},
|
|
{
|
|
"entropy": 6.247843408584595,
|
|
"epoch": 1.139065204847086,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004881991450583225,
|
|
"loss": 5.8774,
|
|
"mean_token_accuracy": 0.18148830235004426,
|
|
"num_tokens": 25033315.0,
|
|
"step": 9870
|
|
},
|
|
{
|
|
"entropy": 6.207533264160157,
|
|
"epoch": 1.1396422388920946,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.000488185953288641,
|
|
"loss": 5.9337,
|
|
"mean_token_accuracy": 0.1857161581516266,
|
|
"num_tokens": 25046284.0,
|
|
"step": 9875
|
|
},
|
|
{
|
|
"entropy": 6.271518850326538,
|
|
"epoch": 1.1402192729371032,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004881727543485559,
|
|
"loss": 5.9082,
|
|
"mean_token_accuracy": 0.18233485966920854,
|
|
"num_tokens": 25058484.0,
|
|
"step": 9880
|
|
},
|
|
{
|
|
"entropy": 6.22105860710144,
|
|
"epoch": 1.1407963069821119,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00048815954823851107,
|
|
"loss": 5.8425,
|
|
"mean_token_accuracy": 0.18622921258211136,
|
|
"num_tokens": 25070555.0,
|
|
"step": 9885
|
|
},
|
|
{
|
|
"entropy": 6.322746706008911,
|
|
"epoch": 1.1413733410271205,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00048814633495895067,
|
|
"loss": 6.0142,
|
|
"mean_token_accuracy": 0.17440420240163804,
|
|
"num_tokens": 25083492.0,
|
|
"step": 9890
|
|
},
|
|
{
|
|
"entropy": 6.308733797073364,
|
|
"epoch": 1.1419503750721294,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004881331145103192,
|
|
"loss": 5.9921,
|
|
"mean_token_accuracy": 0.17199164181947707,
|
|
"num_tokens": 25096332.0,
|
|
"step": 9895
|
|
},
|
|
{
|
|
"entropy": 6.276531744003296,
|
|
"epoch": 1.1425274091171378,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004881198868930614,
|
|
"loss": 5.896,
|
|
"mean_token_accuracy": 0.17704352885484695,
|
|
"num_tokens": 25110447.0,
|
|
"step": 9900
|
|
},
|
|
{
|
|
"entropy": 6.309626197814941,
|
|
"epoch": 1.1431044431621467,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00048810665210762195,
|
|
"loss": 5.9725,
|
|
"mean_token_accuracy": 0.17967149913311004,
|
|
"num_tokens": 25123852.0,
|
|
"step": 9905
|
|
},
|
|
{
|
|
"entropy": 6.262395286560059,
|
|
"epoch": 1.1436814772071553,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.00048809341015444615,
|
|
"loss": 5.9666,
|
|
"mean_token_accuracy": 0.1768372818827629,
|
|
"num_tokens": 25136151.0,
|
|
"step": 9910
|
|
},
|
|
{
|
|
"entropy": 6.243071460723877,
|
|
"epoch": 1.144258511252164,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00048808016103397934,
|
|
"loss": 5.9179,
|
|
"mean_token_accuracy": 0.1830576628446579,
|
|
"num_tokens": 25149642.0,
|
|
"step": 9915
|
|
},
|
|
{
|
|
"entropy": 6.218459749221802,
|
|
"epoch": 1.1448355452971726,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004880669047466671,
|
|
"loss": 5.8823,
|
|
"mean_token_accuracy": 0.18505503088235856,
|
|
"num_tokens": 25162022.0,
|
|
"step": 9920
|
|
},
|
|
{
|
|
"entropy": 6.280695390701294,
|
|
"epoch": 1.1454125793421812,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048805364129295554,
|
|
"loss": 6.0116,
|
|
"mean_token_accuracy": 0.17475848346948625,
|
|
"num_tokens": 25175404.0,
|
|
"step": 9925
|
|
},
|
|
{
|
|
"entropy": 6.253636407852173,
|
|
"epoch": 1.1459896133871899,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.00048804037067329037,
|
|
"loss": 5.8558,
|
|
"mean_token_accuracy": 0.18484980762004852,
|
|
"num_tokens": 25188148.0,
|
|
"step": 9930
|
|
},
|
|
{
|
|
"entropy": 6.230699157714843,
|
|
"epoch": 1.1465666474321985,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004880270928881183,
|
|
"loss": 5.9347,
|
|
"mean_token_accuracy": 0.18091728538274765,
|
|
"num_tokens": 25199960.0,
|
|
"step": 9935
|
|
},
|
|
{
|
|
"entropy": 6.191056203842163,
|
|
"epoch": 1.1471436814772071,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004880138079378857,
|
|
"loss": 5.8846,
|
|
"mean_token_accuracy": 0.17917097955942154,
|
|
"num_tokens": 25211054.0,
|
|
"step": 9940
|
|
},
|
|
{
|
|
"entropy": 6.249275350570679,
|
|
"epoch": 1.1477207155222158,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004880005158230395,
|
|
"loss": 5.8641,
|
|
"mean_token_accuracy": 0.1871132269501686,
|
|
"num_tokens": 25222553.0,
|
|
"step": 9945
|
|
},
|
|
{
|
|
"entropy": 6.205245733261108,
|
|
"epoch": 1.1482977495672244,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004879872165440268,
|
|
"loss": 5.9152,
|
|
"mean_token_accuracy": 0.1780821532011032,
|
|
"num_tokens": 25235472.0,
|
|
"step": 9950
|
|
},
|
|
{
|
|
"entropy": 6.222427892684936,
|
|
"epoch": 1.148874783612233,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004879739101012948,
|
|
"loss": 5.9795,
|
|
"mean_token_accuracy": 0.17801414877176286,
|
|
"num_tokens": 25250209.0,
|
|
"step": 9955
|
|
},
|
|
{
|
|
"entropy": 6.301009178161621,
|
|
"epoch": 1.1494518176572417,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004879605964952911,
|
|
"loss": 6.0067,
|
|
"mean_token_accuracy": 0.17522571235895157,
|
|
"num_tokens": 25262064.0,
|
|
"step": 9960
|
|
},
|
|
{
|
|
"entropy": 6.322479486465454,
|
|
"epoch": 1.1500288517022503,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00048794727572646366,
|
|
"loss": 5.9427,
|
|
"mean_token_accuracy": 0.17829561233520508,
|
|
"num_tokens": 25274833.0,
|
|
"step": 9965
|
|
},
|
|
{
|
|
"entropy": 6.252580785751343,
|
|
"epoch": 1.1506058857472592,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004879339477952603,
|
|
"loss": 5.9259,
|
|
"mean_token_accuracy": 0.1844586282968521,
|
|
"num_tokens": 25288397.0,
|
|
"step": 9970
|
|
},
|
|
{
|
|
"entropy": 6.206064081192016,
|
|
"epoch": 1.1511829197922678,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048792061270212935,
|
|
"loss": 5.8926,
|
|
"mean_token_accuracy": 0.1864775836467743,
|
|
"num_tokens": 25300887.0,
|
|
"step": 9975
|
|
},
|
|
{
|
|
"entropy": 6.300720739364624,
|
|
"epoch": 1.1517599538372765,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004879072704475193,
|
|
"loss": 5.9774,
|
|
"mean_token_accuracy": 0.1777906149625778,
|
|
"num_tokens": 25314686.0,
|
|
"step": 9980
|
|
},
|
|
{
|
|
"entropy": 6.324214887619019,
|
|
"epoch": 1.1523369878822851,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00048789392103187906,
|
|
"loss": 6.0028,
|
|
"mean_token_accuracy": 0.17738907784223557,
|
|
"num_tokens": 25328253.0,
|
|
"step": 9985
|
|
},
|
|
{
|
|
"entropy": 6.282991886138916,
|
|
"epoch": 1.1529140219272938,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004878805644556575,
|
|
"loss": 5.9538,
|
|
"mean_token_accuracy": 0.18188581615686417,
|
|
"num_tokens": 25340583.0,
|
|
"step": 9990
|
|
},
|
|
{
|
|
"entropy": 6.180060386657715,
|
|
"epoch": 1.1534910559723024,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000487867200719304,
|
|
"loss": 5.8756,
|
|
"mean_token_accuracy": 0.18232353776693344,
|
|
"num_tokens": 25352513.0,
|
|
"step": 9995
|
|
},
|
|
{
|
|
"entropy": 6.269026517868042,
|
|
"epoch": 1.154068090017311,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004878538298232678,
|
|
"loss": 5.9893,
|
|
"mean_token_accuracy": 0.1770420104265213,
|
|
"num_tokens": 25365044.0,
|
|
"step": 10000
|
|
},
|
|
{
|
|
"entropy": 6.310076713562012,
|
|
"epoch": 1.1546451240623197,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004878404517679988,
|
|
"loss": 5.9366,
|
|
"mean_token_accuracy": 0.17858017683029176,
|
|
"num_tokens": 25377381.0,
|
|
"step": 10005
|
|
},
|
|
{
|
|
"entropy": 6.238185453414917,
|
|
"epoch": 1.1552221581073283,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00048782706655394695,
|
|
"loss": 5.938,
|
|
"mean_token_accuracy": 0.1837088868021965,
|
|
"num_tokens": 25390723.0,
|
|
"step": 10010
|
|
},
|
|
{
|
|
"entropy": 6.173210191726684,
|
|
"epoch": 1.155799192152337,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004878136741815624,
|
|
"loss": 5.8564,
|
|
"mean_token_accuracy": 0.1824432611465454,
|
|
"num_tokens": 25403501.0,
|
|
"step": 10015
|
|
},
|
|
{
|
|
"entropy": 6.213417387008667,
|
|
"epoch": 1.1563762261973456,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004878002746512956,
|
|
"loss": 5.8816,
|
|
"mean_token_accuracy": 0.18476981669664383,
|
|
"num_tokens": 25415565.0,
|
|
"step": 10020
|
|
},
|
|
{
|
|
"entropy": 6.226587963104248,
|
|
"epoch": 1.1569532602423542,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004877868679635974,
|
|
"loss": 5.9289,
|
|
"mean_token_accuracy": 0.18405697494745255,
|
|
"num_tokens": 25428261.0,
|
|
"step": 10025
|
|
},
|
|
{
|
|
"entropy": 6.28510012626648,
|
|
"epoch": 1.1575302942873629,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004877734541189185,
|
|
"loss": 5.9355,
|
|
"mean_token_accuracy": 0.17490267604589463,
|
|
"num_tokens": 25439758.0,
|
|
"step": 10030
|
|
},
|
|
{
|
|
"entropy": 6.253132295608521,
|
|
"epoch": 1.1581073283323717,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00048776003311771013,
|
|
"loss": 5.9766,
|
|
"mean_token_accuracy": 0.1719038173556328,
|
|
"num_tokens": 25452162.0,
|
|
"step": 10035
|
|
},
|
|
{
|
|
"entropy": 6.34536337852478,
|
|
"epoch": 1.1586843623773802,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004877466049604238,
|
|
"loss": 6.0224,
|
|
"mean_token_accuracy": 0.17633402347564697,
|
|
"num_tokens": 25463741.0,
|
|
"step": 10040
|
|
},
|
|
{
|
|
"entropy": 6.273688936233521,
|
|
"epoch": 1.159261396422389,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.00048773316964751106,
|
|
"loss": 5.9607,
|
|
"mean_token_accuracy": 0.17500015050172807,
|
|
"num_tokens": 25476466.0,
|
|
"step": 10045
|
|
},
|
|
{
|
|
"entropy": 6.3328968524932865,
|
|
"epoch": 1.1598384304673977,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004877197271794239,
|
|
"loss": 5.948,
|
|
"mean_token_accuracy": 0.1761259838938713,
|
|
"num_tokens": 25488453.0,
|
|
"step": 10050
|
|
},
|
|
{
|
|
"entropy": 6.298605442047119,
|
|
"epoch": 1.1604154645124063,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004877062775566142,
|
|
"loss": 5.9443,
|
|
"mean_token_accuracy": 0.17435207664966584,
|
|
"num_tokens": 25501803.0,
|
|
"step": 10055
|
|
},
|
|
{
|
|
"entropy": 6.273298692703247,
|
|
"epoch": 1.160992498557415,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.00048769282077953464,
|
|
"loss": 6.0359,
|
|
"mean_token_accuracy": 0.17547617107629776,
|
|
"num_tokens": 25515844.0,
|
|
"step": 10060
|
|
},
|
|
{
|
|
"entropy": 6.312673854827881,
|
|
"epoch": 1.1615695326024236,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048767935684863775,
|
|
"loss": 5.9276,
|
|
"mean_token_accuracy": 0.18142150789499284,
|
|
"num_tokens": 25528529.0,
|
|
"step": 10065
|
|
},
|
|
{
|
|
"entropy": 6.302729988098145,
|
|
"epoch": 1.1621465666474322,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004876658857643762,
|
|
"loss": 5.9732,
|
|
"mean_token_accuracy": 0.17344674915075303,
|
|
"num_tokens": 25540110.0,
|
|
"step": 10070
|
|
},
|
|
{
|
|
"entropy": 6.254207420349121,
|
|
"epoch": 1.1627236006924409,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004876524075272034,
|
|
"loss": 5.9334,
|
|
"mean_token_accuracy": 0.17588380724191666,
|
|
"num_tokens": 25553332.0,
|
|
"step": 10075
|
|
},
|
|
{
|
|
"entropy": 6.286834716796875,
|
|
"epoch": 1.1633006347374495,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048763892213757234,
|
|
"loss": 5.9005,
|
|
"mean_token_accuracy": 0.17941419333219527,
|
|
"num_tokens": 25565852.0,
|
|
"step": 10080
|
|
},
|
|
{
|
|
"entropy": 6.242973041534424,
|
|
"epoch": 1.1638776687824581,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.00048762542959593683,
|
|
"loss": 5.9185,
|
|
"mean_token_accuracy": 0.18208333104848862,
|
|
"num_tokens": 25579642.0,
|
|
"step": 10085
|
|
},
|
|
{
|
|
"entropy": 6.223715496063233,
|
|
"epoch": 1.1644547028274668,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004876119299027506,
|
|
"loss": 5.9185,
|
|
"mean_token_accuracy": 0.18511994779109955,
|
|
"num_tokens": 25591452.0,
|
|
"step": 10090
|
|
},
|
|
{
|
|
"entropy": 6.221129322052002,
|
|
"epoch": 1.1650317368724754,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00048759842305846766,
|
|
"loss": 5.8732,
|
|
"mean_token_accuracy": 0.17986828535795213,
|
|
"num_tokens": 25603426.0,
|
|
"step": 10095
|
|
},
|
|
{
|
|
"entropy": 6.264230966567993,
|
|
"epoch": 1.165608770917484,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004875849090635425,
|
|
"loss": 5.9774,
|
|
"mean_token_accuracy": 0.17824428528547287,
|
|
"num_tokens": 25617014.0,
|
|
"step": 10100
|
|
},
|
|
{
|
|
"entropy": 6.293786478042603,
|
|
"epoch": 1.1661858049624927,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00048757138791842943,
|
|
"loss": 5.9394,
|
|
"mean_token_accuracy": 0.18343609422445298,
|
|
"num_tokens": 25629916.0,
|
|
"step": 10105
|
|
},
|
|
{
|
|
"entropy": 6.2851982593536375,
|
|
"epoch": 1.1667628390075016,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004875578596235832,
|
|
"loss": 5.9229,
|
|
"mean_token_accuracy": 0.18201591074466705,
|
|
"num_tokens": 25642301.0,
|
|
"step": 10110
|
|
},
|
|
{
|
|
"entropy": 6.254937362670899,
|
|
"epoch": 1.1673398730525102,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004875443241794591,
|
|
"loss": 5.9005,
|
|
"mean_token_accuracy": 0.18076282739639282,
|
|
"num_tokens": 25653976.0,
|
|
"step": 10115
|
|
},
|
|
{
|
|
"entropy": 6.266515922546387,
|
|
"epoch": 1.1679169070975188,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00048753078158651227,
|
|
"loss": 5.9433,
|
|
"mean_token_accuracy": 0.17355138510465623,
|
|
"num_tokens": 25666078.0,
|
|
"step": 10120
|
|
},
|
|
{
|
|
"entropy": 6.299070167541504,
|
|
"epoch": 1.1684939411425275,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000487517231845198,
|
|
"loss": 5.9608,
|
|
"mean_token_accuracy": 0.17447977215051652,
|
|
"num_tokens": 25679780.0,
|
|
"step": 10125
|
|
},
|
|
{
|
|
"entropy": 6.330364561080932,
|
|
"epoch": 1.169070975187536,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004875036749559724,
|
|
"loss": 5.921,
|
|
"mean_token_accuracy": 0.1767667144536972,
|
|
"num_tokens": 25694179.0,
|
|
"step": 10130
|
|
},
|
|
{
|
|
"entropy": 6.173453760147095,
|
|
"epoch": 1.1696480092325447,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00048749011091929115,
|
|
"loss": 5.9132,
|
|
"mean_token_accuracy": 0.18746515810489656,
|
|
"num_tokens": 25707281.0,
|
|
"step": 10135
|
|
},
|
|
{
|
|
"entropy": 6.262874364852905,
|
|
"epoch": 1.1702250432775534,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004874765397356105,
|
|
"loss": 5.9428,
|
|
"mean_token_accuracy": 0.18233703523874284,
|
|
"num_tokens": 25719901.0,
|
|
"step": 10140
|
|
},
|
|
{
|
|
"entropy": 6.302816724777221,
|
|
"epoch": 1.170802077322562,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004874629614053871,
|
|
"loss": 5.9542,
|
|
"mean_token_accuracy": 0.18035022020339966,
|
|
"num_tokens": 25732063.0,
|
|
"step": 10145
|
|
},
|
|
{
|
|
"entropy": 6.217515897750855,
|
|
"epoch": 1.1713791113675707,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004874493759290775,
|
|
"loss": 5.9195,
|
|
"mean_token_accuracy": 0.17959170192480087,
|
|
"num_tokens": 25743966.0,
|
|
"step": 10150
|
|
},
|
|
{
|
|
"entropy": 6.033494472503662,
|
|
"epoch": 1.1719561454125793,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00048743578330713854,
|
|
"loss": 5.6624,
|
|
"mean_token_accuracy": 0.20419865399599074,
|
|
"num_tokens": 25757053.0,
|
|
"step": 10155
|
|
},
|
|
{
|
|
"entropy": 6.10223126411438,
|
|
"epoch": 1.172533179457588,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004874221835400277,
|
|
"loss": 5.7981,
|
|
"mean_token_accuracy": 0.1875803977251053,
|
|
"num_tokens": 25769430.0,
|
|
"step": 10160
|
|
},
|
|
{
|
|
"entropy": 6.264477682113648,
|
|
"epoch": 1.1731102135025966,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004874085766282022,
|
|
"loss": 5.894,
|
|
"mean_token_accuracy": 0.18658676594495774,
|
|
"num_tokens": 25781687.0,
|
|
"step": 10165
|
|
},
|
|
{
|
|
"entropy": 6.178972053527832,
|
|
"epoch": 1.1736872475476052,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00048739496257211966,
|
|
"loss": 5.9109,
|
|
"mean_token_accuracy": 0.1858760565519333,
|
|
"num_tokens": 25793646.0,
|
|
"step": 10170
|
|
},
|
|
{
|
|
"entropy": 6.226661348342896,
|
|
"epoch": 1.1742642815926139,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00048738134137223815,
|
|
"loss": 5.9739,
|
|
"mean_token_accuracy": 0.1752454936504364,
|
|
"num_tokens": 25807757.0,
|
|
"step": 10175
|
|
},
|
|
{
|
|
"entropy": 6.282738161087036,
|
|
"epoch": 1.1748413156376225,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00048736771302901566,
|
|
"loss": 5.9495,
|
|
"mean_token_accuracy": 0.17936586141586303,
|
|
"num_tokens": 25820063.0,
|
|
"step": 10180
|
|
},
|
|
{
|
|
"entropy": 6.234112787246704,
|
|
"epoch": 1.1754183496826314,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.00048735407754291063,
|
|
"loss": 5.8828,
|
|
"mean_token_accuracy": 0.18974555730819703,
|
|
"num_tokens": 25832974.0,
|
|
"step": 10185
|
|
},
|
|
{
|
|
"entropy": 6.292014217376709,
|
|
"epoch": 1.17599538372764,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048734043491438175,
|
|
"loss": 5.9219,
|
|
"mean_token_accuracy": 0.17494470328092576,
|
|
"num_tokens": 25845939.0,
|
|
"step": 10190
|
|
},
|
|
{
|
|
"entropy": 6.2192240238189695,
|
|
"epoch": 1.1765724177726486,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048732678514388773,
|
|
"loss": 5.8873,
|
|
"mean_token_accuracy": 0.17836469560861587,
|
|
"num_tokens": 25857480.0,
|
|
"step": 10195
|
|
},
|
|
{
|
|
"entropy": 6.162649917602539,
|
|
"epoch": 1.1771494518176573,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004873131282318878,
|
|
"loss": 5.8513,
|
|
"mean_token_accuracy": 0.18638965040445327,
|
|
"num_tokens": 25869384.0,
|
|
"step": 10200
|
|
},
|
|
{
|
|
"entropy": 6.183882331848144,
|
|
"epoch": 1.177726485862666,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00048729946417884126,
|
|
"loss": 5.9408,
|
|
"mean_token_accuracy": 0.17680127024650574,
|
|
"num_tokens": 25881705.0,
|
|
"step": 10205
|
|
},
|
|
{
|
|
"entropy": 6.290098524093628,
|
|
"epoch": 1.1783035199076746,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004872857929852076,
|
|
"loss": 5.9349,
|
|
"mean_token_accuracy": 0.1714819997549057,
|
|
"num_tokens": 25894072.0,
|
|
"step": 10210
|
|
},
|
|
{
|
|
"entropy": 6.232169818878174,
|
|
"epoch": 1.1788805539526832,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004872721146514469,
|
|
"loss": 5.803,
|
|
"mean_token_accuracy": 0.1882660523056984,
|
|
"num_tokens": 25907358.0,
|
|
"step": 10215
|
|
},
|
|
{
|
|
"entropy": 6.194604921340942,
|
|
"epoch": 1.1794575879976918,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.000487258429178019,
|
|
"loss": 5.9219,
|
|
"mean_token_accuracy": 0.18903794139623642,
|
|
"num_tokens": 25918746.0,
|
|
"step": 10220
|
|
},
|
|
{
|
|
"entropy": 6.2296899318695065,
|
|
"epoch": 1.1800346220427005,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048724473656538427,
|
|
"loss": 5.913,
|
|
"mean_token_accuracy": 0.18672333359718324,
|
|
"num_tokens": 25930759.0,
|
|
"step": 10225
|
|
},
|
|
{
|
|
"entropy": 6.188735485076904,
|
|
"epoch": 1.1806116560877091,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004872310368140032,
|
|
"loss": 5.8568,
|
|
"mean_token_accuracy": 0.18429872691631316,
|
|
"num_tokens": 25942364.0,
|
|
"step": 10230
|
|
},
|
|
{
|
|
"entropy": 6.206774473190308,
|
|
"epoch": 1.1811886901327178,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004872173299243368,
|
|
"loss": 5.8708,
|
|
"mean_token_accuracy": 0.19336009174585342,
|
|
"num_tokens": 25954254.0,
|
|
"step": 10235
|
|
},
|
|
{
|
|
"entropy": 6.222011852264404,
|
|
"epoch": 1.1817657241777264,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00048720361589684575,
|
|
"loss": 5.9605,
|
|
"mean_token_accuracy": 0.18331651240587235,
|
|
"num_tokens": 25966708.0,
|
|
"step": 10240
|
|
},
|
|
{
|
|
"entropy": 6.236669921875,
|
|
"epoch": 1.182342758222735,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00048718989473199147,
|
|
"loss": 5.9233,
|
|
"mean_token_accuracy": 0.17969653010368347,
|
|
"num_tokens": 25979301.0,
|
|
"step": 10245
|
|
},
|
|
{
|
|
"entropy": 6.237456798553467,
|
|
"epoch": 1.182919792267744,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004871761664302356,
|
|
"loss": 5.9068,
|
|
"mean_token_accuracy": 0.18412716388702394,
|
|
"num_tokens": 25992195.0,
|
|
"step": 10250
|
|
},
|
|
{
|
|
"entropy": 6.177877140045166,
|
|
"epoch": 1.1834968263127525,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004871624309920397,
|
|
"loss": 5.7765,
|
|
"mean_token_accuracy": 0.19591953456401826,
|
|
"num_tokens": 26005078.0,
|
|
"step": 10255
|
|
},
|
|
{
|
|
"entropy": 6.2200273990631105,
|
|
"epoch": 1.1840738603577612,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00048714868841786586,
|
|
"loss": 5.9096,
|
|
"mean_token_accuracy": 0.179879729449749,
|
|
"num_tokens": 26017227.0,
|
|
"step": 10260
|
|
},
|
|
{
|
|
"entropy": 6.244432067871093,
|
|
"epoch": 1.1846508944027698,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00048713493870817626,
|
|
"loss": 5.9489,
|
|
"mean_token_accuracy": 0.18269521296024321,
|
|
"num_tokens": 26030782.0,
|
|
"step": 10265
|
|
},
|
|
{
|
|
"entropy": 6.180662345886231,
|
|
"epoch": 1.1852279284477785,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00048712118186343336,
|
|
"loss": 5.8563,
|
|
"mean_token_accuracy": 0.18943388164043426,
|
|
"num_tokens": 26042327.0,
|
|
"step": 10270
|
|
},
|
|
{
|
|
"entropy": 6.27462363243103,
|
|
"epoch": 1.185804962492787,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.00048710741788409985,
|
|
"loss": 5.9541,
|
|
"mean_token_accuracy": 0.17806721180677415,
|
|
"num_tokens": 26055298.0,
|
|
"step": 10275
|
|
},
|
|
{
|
|
"entropy": 6.273777961730957,
|
|
"epoch": 1.1863819965377957,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004870936467706387,
|
|
"loss": 5.9837,
|
|
"mean_token_accuracy": 0.17382072806358337,
|
|
"num_tokens": 26067389.0,
|
|
"step": 10280
|
|
},
|
|
{
|
|
"entropy": 6.225218200683594,
|
|
"epoch": 1.1869590305828044,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004870798685235131,
|
|
"loss": 5.8962,
|
|
"mean_token_accuracy": 0.18277426362037658,
|
|
"num_tokens": 26080527.0,
|
|
"step": 10285
|
|
},
|
|
{
|
|
"entropy": 6.250852823257446,
|
|
"epoch": 1.187536064627813,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048706608314318654,
|
|
"loss": 5.9648,
|
|
"mean_token_accuracy": 0.17581128627061843,
|
|
"num_tokens": 26093684.0,
|
|
"step": 10290
|
|
},
|
|
{
|
|
"entropy": 6.270060634613037,
|
|
"epoch": 1.1881130986728217,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004870522906301225,
|
|
"loss": 5.9021,
|
|
"mean_token_accuracy": 0.1825753018260002,
|
|
"num_tokens": 26105235.0,
|
|
"step": 10295
|
|
},
|
|
{
|
|
"entropy": 6.226347017288208,
|
|
"epoch": 1.1886901327178303,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000487038490984785,
|
|
"loss": 5.8919,
|
|
"mean_token_accuracy": 0.18395963162183762,
|
|
"num_tokens": 26117542.0,
|
|
"step": 10300
|
|
},
|
|
{
|
|
"entropy": 6.262145042419434,
|
|
"epoch": 1.189267166762839,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00048702468420763826,
|
|
"loss": 6.0085,
|
|
"mean_token_accuracy": 0.17625221163034438,
|
|
"num_tokens": 26130722.0,
|
|
"step": 10305
|
|
},
|
|
{
|
|
"entropy": 6.264938068389893,
|
|
"epoch": 1.1898442008078476,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.00048701087029914657,
|
|
"loss": 5.8314,
|
|
"mean_token_accuracy": 0.18314649015665055,
|
|
"num_tokens": 26143420.0,
|
|
"step": 10310
|
|
},
|
|
{
|
|
"entropy": 6.301358938217163,
|
|
"epoch": 1.1904212348528562,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004869970492597745,
|
|
"loss": 6.0332,
|
|
"mean_token_accuracy": 0.16742831021547316,
|
|
"num_tokens": 26156041.0,
|
|
"step": 10315
|
|
},
|
|
{
|
|
"entropy": 6.172136878967285,
|
|
"epoch": 1.1909982688978649,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004869832210899871,
|
|
"loss": 5.845,
|
|
"mean_token_accuracy": 0.18829168230295182,
|
|
"num_tokens": 26168075.0,
|
|
"step": 10320
|
|
},
|
|
{
|
|
"entropy": 6.214507341384888,
|
|
"epoch": 1.1915753029428737,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.00048696938579024927,
|
|
"loss": 5.8632,
|
|
"mean_token_accuracy": 0.18680178970098496,
|
|
"num_tokens": 26180285.0,
|
|
"step": 10325
|
|
},
|
|
{
|
|
"entropy": 6.155381202697754,
|
|
"epoch": 1.1921523369878824,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.00048695554336102644,
|
|
"loss": 5.8601,
|
|
"mean_token_accuracy": 0.18196229487657548,
|
|
"num_tokens": 26193095.0,
|
|
"step": 10330
|
|
},
|
|
{
|
|
"entropy": 6.198613977432251,
|
|
"epoch": 1.192729371032891,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00048694169380278417,
|
|
"loss": 5.9061,
|
|
"mean_token_accuracy": 0.19160285741090774,
|
|
"num_tokens": 26205477.0,
|
|
"step": 10335
|
|
},
|
|
{
|
|
"entropy": 6.220333862304687,
|
|
"epoch": 1.1933064050778996,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004869278371159884,
|
|
"loss": 5.8512,
|
|
"mean_token_accuracy": 0.18946202248334884,
|
|
"num_tokens": 26220057.0,
|
|
"step": 10340
|
|
},
|
|
{
|
|
"entropy": 6.298282432556152,
|
|
"epoch": 1.1938834391229083,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00048691397330110503,
|
|
"loss": 5.9385,
|
|
"mean_token_accuracy": 0.17706281840801238,
|
|
"num_tokens": 26232327.0,
|
|
"step": 10345
|
|
},
|
|
{
|
|
"entropy": 6.19044942855835,
|
|
"epoch": 1.194460473167917,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004869001023586005,
|
|
"loss": 5.8664,
|
|
"mean_token_accuracy": 0.1862966775894165,
|
|
"num_tokens": 26245087.0,
|
|
"step": 10350
|
|
},
|
|
{
|
|
"entropy": 6.27628083229065,
|
|
"epoch": 1.1950375072129256,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004868862242889413,
|
|
"loss": 5.9464,
|
|
"mean_token_accuracy": 0.1738221064209938,
|
|
"num_tokens": 26258041.0,
|
|
"step": 10355
|
|
},
|
|
{
|
|
"entropy": 6.253827428817749,
|
|
"epoch": 1.1956145412579342,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.000486872339092594,
|
|
"loss": 5.9329,
|
|
"mean_token_accuracy": 0.1788163736462593,
|
|
"num_tokens": 26270443.0,
|
|
"step": 10360
|
|
},
|
|
{
|
|
"entropy": 6.221220397949219,
|
|
"epoch": 1.1961915753029428,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.000486858446770026,
|
|
"loss": 5.8764,
|
|
"mean_token_accuracy": 0.1764179676771164,
|
|
"num_tokens": 26282685.0,
|
|
"step": 10365
|
|
},
|
|
{
|
|
"entropy": 6.259880018234253,
|
|
"epoch": 1.1967686093479515,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004868445473217043,
|
|
"loss": 5.9615,
|
|
"mean_token_accuracy": 0.17861454635858537,
|
|
"num_tokens": 26296003.0,
|
|
"step": 10370
|
|
},
|
|
{
|
|
"entropy": 6.142031145095825,
|
|
"epoch": 1.1973456433929601,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004868306407480965,
|
|
"loss": 5.802,
|
|
"mean_token_accuracy": 0.18455828428268434,
|
|
"num_tokens": 26309102.0,
|
|
"step": 10375
|
|
},
|
|
{
|
|
"entropy": 6.2524937152862545,
|
|
"epoch": 1.1979226774379688,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00048681672704967036,
|
|
"loss": 5.9077,
|
|
"mean_token_accuracy": 0.1821337327361107,
|
|
"num_tokens": 26321571.0,
|
|
"step": 10380
|
|
},
|
|
{
|
|
"entropy": 6.342026090621948,
|
|
"epoch": 1.1984997114829774,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004868028062268938,
|
|
"loss": 5.9821,
|
|
"mean_token_accuracy": 0.17679037153720856,
|
|
"num_tokens": 26334761.0,
|
|
"step": 10385
|
|
},
|
|
{
|
|
"entropy": 6.182615852355957,
|
|
"epoch": 1.1990767455279863,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00048678887828023504,
|
|
"loss": 5.794,
|
|
"mean_token_accuracy": 0.18676298409700393,
|
|
"num_tokens": 26348815.0,
|
|
"step": 10390
|
|
},
|
|
{
|
|
"entropy": 6.205089139938354,
|
|
"epoch": 1.1996537795729947,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004867749432101626,
|
|
"loss": 5.915,
|
|
"mean_token_accuracy": 0.17840406000614167,
|
|
"num_tokens": 26361675.0,
|
|
"step": 10395
|
|
},
|
|
{
|
|
"entropy": 6.274042654037475,
|
|
"epoch": 1.2002308136180035,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004867610010171451,
|
|
"loss": 6.0051,
|
|
"mean_token_accuracy": 0.17303507626056672,
|
|
"num_tokens": 26375010.0,
|
|
"step": 10400
|
|
},
|
|
{
|
|
"entropy": 6.292940378189087,
|
|
"epoch": 1.2008078476630122,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00048674705170165147,
|
|
"loss": 5.9732,
|
|
"mean_token_accuracy": 0.17850806564092636,
|
|
"num_tokens": 26388217.0,
|
|
"step": 10405
|
|
},
|
|
{
|
|
"entropy": 6.195116758346558,
|
|
"epoch": 1.2013848817080208,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.000486733095264151,
|
|
"loss": 5.9038,
|
|
"mean_token_accuracy": 0.1861647993326187,
|
|
"num_tokens": 26402088.0,
|
|
"step": 10410
|
|
},
|
|
{
|
|
"entropy": 6.1927567481994625,
|
|
"epoch": 1.2019619157530295,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00048671913170511306,
|
|
"loss": 5.8926,
|
|
"mean_token_accuracy": 0.1835414081811905,
|
|
"num_tokens": 26414816.0,
|
|
"step": 10415
|
|
},
|
|
{
|
|
"entropy": 6.251120758056641,
|
|
"epoch": 1.202538949798038,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004867051610250073,
|
|
"loss": 5.8567,
|
|
"mean_token_accuracy": 0.18279548734426498,
|
|
"num_tokens": 26426345.0,
|
|
"step": 10420
|
|
},
|
|
{
|
|
"entropy": 6.1436532497406,
|
|
"epoch": 1.2031159838430467,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004866911832243035,
|
|
"loss": 5.6708,
|
|
"mean_token_accuracy": 0.19303337335586548,
|
|
"num_tokens": 26437982.0,
|
|
"step": 10425
|
|
},
|
|
{
|
|
"entropy": 6.1232579231262205,
|
|
"epoch": 1.2036930178880554,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048667719830347203,
|
|
"loss": 5.9154,
|
|
"mean_token_accuracy": 0.17632388174533845,
|
|
"num_tokens": 26449855.0,
|
|
"step": 10430
|
|
},
|
|
{
|
|
"entropy": 6.299041652679444,
|
|
"epoch": 1.204270051933064,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00048666320626298307,
|
|
"loss": 5.92,
|
|
"mean_token_accuracy": 0.18459949046373367,
|
|
"num_tokens": 26462927.0,
|
|
"step": 10435
|
|
},
|
|
{
|
|
"entropy": 6.25364203453064,
|
|
"epoch": 1.2048470859780727,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00048664920710330735,
|
|
"loss": 5.9653,
|
|
"mean_token_accuracy": 0.1775884971022606,
|
|
"num_tokens": 26475022.0,
|
|
"step": 10440
|
|
},
|
|
{
|
|
"entropy": 6.214952230453491,
|
|
"epoch": 1.2054241200230813,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00048663520082491564,
|
|
"loss": 5.8916,
|
|
"mean_token_accuracy": 0.18937628716230392,
|
|
"num_tokens": 26486959.0,
|
|
"step": 10445
|
|
},
|
|
{
|
|
"entropy": 6.240479230880737,
|
|
"epoch": 1.20600115406809,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004866211874282791,
|
|
"loss": 5.9576,
|
|
"mean_token_accuracy": 0.1838987112045288,
|
|
"num_tokens": 26500345.0,
|
|
"step": 10450
|
|
},
|
|
{
|
|
"entropy": 6.267888355255127,
|
|
"epoch": 1.2065781881130986,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.000486607166913869,
|
|
"loss": 5.9311,
|
|
"mean_token_accuracy": 0.18621276021003724,
|
|
"num_tokens": 26511625.0,
|
|
"step": 10455
|
|
},
|
|
{
|
|
"entropy": 6.242213773727417,
|
|
"epoch": 1.2071552221581072,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00048659313928215705,
|
|
"loss": 5.9358,
|
|
"mean_token_accuracy": 0.1800112694501877,
|
|
"num_tokens": 26523764.0,
|
|
"step": 10460
|
|
},
|
|
{
|
|
"entropy": 6.233942937850952,
|
|
"epoch": 1.207732256203116,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004865791045336149,
|
|
"loss": 5.9028,
|
|
"mean_token_accuracy": 0.1811545193195343,
|
|
"num_tokens": 26536925.0,
|
|
"step": 10465
|
|
},
|
|
{
|
|
"entropy": 6.169159698486328,
|
|
"epoch": 1.2083092902481247,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004865650626687146,
|
|
"loss": 5.7468,
|
|
"mean_token_accuracy": 0.19598589539527894,
|
|
"num_tokens": 26549201.0,
|
|
"step": 10470
|
|
},
|
|
{
|
|
"entropy": 6.203572702407837,
|
|
"epoch": 1.2088863242931334,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00048655101368792866,
|
|
"loss": 5.9031,
|
|
"mean_token_accuracy": 0.18499507009983063,
|
|
"num_tokens": 26561495.0,
|
|
"step": 10475
|
|
},
|
|
{
|
|
"entropy": 6.237302017211914,
|
|
"epoch": 1.209463358338142,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004865369575917293,
|
|
"loss": 5.9454,
|
|
"mean_token_accuracy": 0.17504747658967973,
|
|
"num_tokens": 26573820.0,
|
|
"step": 10480
|
|
},
|
|
{
|
|
"entropy": 6.256232976913452,
|
|
"epoch": 1.2100403923831506,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048652289438058953,
|
|
"loss": 5.9242,
|
|
"mean_token_accuracy": 0.18367512822151183,
|
|
"num_tokens": 26587468.0,
|
|
"step": 10485
|
|
},
|
|
{
|
|
"entropy": 6.191364383697509,
|
|
"epoch": 1.2106174264281593,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00048650882405498226,
|
|
"loss": 5.9536,
|
|
"mean_token_accuracy": 0.17529995739459991,
|
|
"num_tokens": 26599884.0,
|
|
"step": 10490
|
|
},
|
|
{
|
|
"entropy": 6.18445987701416,
|
|
"epoch": 1.211194460473168,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004864947466153808,
|
|
"loss": 5.8633,
|
|
"mean_token_accuracy": 0.1881292626261711,
|
|
"num_tokens": 26612501.0,
|
|
"step": 10495
|
|
},
|
|
{
|
|
"entropy": 6.330709075927734,
|
|
"epoch": 1.2117714945181766,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004864806620622585,
|
|
"loss": 5.8942,
|
|
"mean_token_accuracy": 0.18237232863903047,
|
|
"num_tokens": 26624559.0,
|
|
"step": 10500
|
|
},
|
|
{
|
|
"entropy": 6.27984037399292,
|
|
"epoch": 1.2123485285631852,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004864665703960892,
|
|
"loss": 5.9248,
|
|
"mean_token_accuracy": 0.1735801711678505,
|
|
"num_tokens": 26636903.0,
|
|
"step": 10505
|
|
},
|
|
{
|
|
"entropy": 6.253863048553467,
|
|
"epoch": 1.2129255626081938,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004864524716173469,
|
|
"loss": 5.8581,
|
|
"mean_token_accuracy": 0.18250663876533507,
|
|
"num_tokens": 26649393.0,
|
|
"step": 10510
|
|
},
|
|
{
|
|
"entropy": 6.182285356521606,
|
|
"epoch": 1.2135025966532025,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004864383657265058,
|
|
"loss": 5.8711,
|
|
"mean_token_accuracy": 0.18657347857952117,
|
|
"num_tokens": 26661134.0,
|
|
"step": 10515
|
|
},
|
|
{
|
|
"entropy": 6.233286142349243,
|
|
"epoch": 1.2140796306982111,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00048642425272404016,
|
|
"loss": 5.948,
|
|
"mean_token_accuracy": 0.17871742993593215,
|
|
"num_tokens": 26674451.0,
|
|
"step": 10520
|
|
},
|
|
{
|
|
"entropy": 6.293264722824096,
|
|
"epoch": 1.2146566647432198,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004864101326104248,
|
|
"loss": 5.8934,
|
|
"mean_token_accuracy": 0.18119763284921647,
|
|
"num_tokens": 26686382.0,
|
|
"step": 10525
|
|
},
|
|
{
|
|
"entropy": 6.174519824981689,
|
|
"epoch": 1.2152336987882286,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004863960053861348,
|
|
"loss": 5.8629,
|
|
"mean_token_accuracy": 0.18694709986448288,
|
|
"num_tokens": 26698491.0,
|
|
"step": 10530
|
|
},
|
|
{
|
|
"entropy": 6.153842973709106,
|
|
"epoch": 1.215810732833237,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00048638187105164507,
|
|
"loss": 5.8853,
|
|
"mean_token_accuracy": 0.18205370157957076,
|
|
"num_tokens": 26710836.0,
|
|
"step": 10535
|
|
},
|
|
{
|
|
"entropy": 6.2186424255371096,
|
|
"epoch": 1.216387766878246,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004863677296074311,
|
|
"loss": 5.8716,
|
|
"mean_token_accuracy": 0.1870691657066345,
|
|
"num_tokens": 26723195.0,
|
|
"step": 10540
|
|
},
|
|
{
|
|
"entropy": 6.250338935852051,
|
|
"epoch": 1.2169648009232545,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004863535810539686,
|
|
"loss": 5.8641,
|
|
"mean_token_accuracy": 0.19379239678382873,
|
|
"num_tokens": 26736048.0,
|
|
"step": 10545
|
|
},
|
|
{
|
|
"entropy": 6.230413436889648,
|
|
"epoch": 1.2175418349682632,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00048633942539173325,
|
|
"loss": 5.9696,
|
|
"mean_token_accuracy": 0.1795030802488327,
|
|
"num_tokens": 26748712.0,
|
|
"step": 10550
|
|
},
|
|
{
|
|
"entropy": 6.303004455566406,
|
|
"epoch": 1.2181188690132718,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00048632526262120144,
|
|
"loss": 5.9658,
|
|
"mean_token_accuracy": 0.17351969033479692,
|
|
"num_tokens": 26760546.0,
|
|
"step": 10555
|
|
},
|
|
{
|
|
"entropy": 6.282928037643432,
|
|
"epoch": 1.2186959030582805,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004863110927428493,
|
|
"loss": 5.8626,
|
|
"mean_token_accuracy": 0.18044263273477554,
|
|
"num_tokens": 26772792.0,
|
|
"step": 10560
|
|
},
|
|
{
|
|
"entropy": 6.124064779281616,
|
|
"epoch": 1.219272937103289,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004862969157571536,
|
|
"loss": 5.7745,
|
|
"mean_token_accuracy": 0.194984470307827,
|
|
"num_tokens": 26785321.0,
|
|
"step": 10565
|
|
},
|
|
{
|
|
"entropy": 6.213613271713257,
|
|
"epoch": 1.2198499711482977,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048628273166459105,
|
|
"loss": 5.818,
|
|
"mean_token_accuracy": 0.18542979061603546,
|
|
"num_tokens": 26797481.0,
|
|
"step": 10570
|
|
},
|
|
{
|
|
"entropy": 6.285091686248779,
|
|
"epoch": 1.2204270051933064,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00048626854046563876,
|
|
"loss": 5.9554,
|
|
"mean_token_accuracy": 0.18456581830978394,
|
|
"num_tokens": 26810644.0,
|
|
"step": 10575
|
|
},
|
|
{
|
|
"entropy": 6.297290182113647,
|
|
"epoch": 1.221004039238315,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00048625434216077404,
|
|
"loss": 5.8977,
|
|
"mean_token_accuracy": 0.18243593573570252,
|
|
"num_tokens": 26822545.0,
|
|
"step": 10580
|
|
},
|
|
{
|
|
"entropy": 6.200481605529785,
|
|
"epoch": 1.2215810732833237,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00048624013675047453,
|
|
"loss": 5.8957,
|
|
"mean_token_accuracy": 0.18178013414144517,
|
|
"num_tokens": 26836221.0,
|
|
"step": 10585
|
|
},
|
|
{
|
|
"entropy": 6.284975624084472,
|
|
"epoch": 1.2221581073283323,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00048622592423521783,
|
|
"loss": 5.9676,
|
|
"mean_token_accuracy": 0.1788189336657524,
|
|
"num_tokens": 26848543.0,
|
|
"step": 10590
|
|
},
|
|
{
|
|
"entropy": 6.295896053314209,
|
|
"epoch": 1.222735141373341,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004862117046154822,
|
|
"loss": 5.9408,
|
|
"mean_token_accuracy": 0.18014086037874222,
|
|
"num_tokens": 26859833.0,
|
|
"step": 10595
|
|
},
|
|
{
|
|
"entropy": 6.240191459655762,
|
|
"epoch": 1.2233121754183496,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.00048619747789174577,
|
|
"loss": 5.9005,
|
|
"mean_token_accuracy": 0.18657582402229309,
|
|
"num_tokens": 26873450.0,
|
|
"step": 10600
|
|
},
|
|
{
|
|
"entropy": 6.201486682891845,
|
|
"epoch": 1.2238892094633584,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004861832440644871,
|
|
"loss": 5.8684,
|
|
"mean_token_accuracy": 0.17937362045049668,
|
|
"num_tokens": 26886545.0,
|
|
"step": 10605
|
|
},
|
|
{
|
|
"entropy": 6.2080159187316895,
|
|
"epoch": 1.224466243508367,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00048616900313418486,
|
|
"loss": 5.8221,
|
|
"mean_token_accuracy": 0.18913633227348328,
|
|
"num_tokens": 26898394.0,
|
|
"step": 10610
|
|
},
|
|
{
|
|
"entropy": 6.235791397094727,
|
|
"epoch": 1.2250432775533757,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00048615475510131815,
|
|
"loss": 5.8854,
|
|
"mean_token_accuracy": 0.18782524019479752,
|
|
"num_tokens": 26910172.0,
|
|
"step": 10615
|
|
},
|
|
{
|
|
"entropy": 6.1328874111175535,
|
|
"epoch": 1.2256203115983844,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00048614049996636614,
|
|
"loss": 5.7541,
|
|
"mean_token_accuracy": 0.19627405554056168,
|
|
"num_tokens": 26922496.0,
|
|
"step": 10620
|
|
},
|
|
{
|
|
"entropy": 6.186247682571411,
|
|
"epoch": 1.226197345643393,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00048612623772980825,
|
|
"loss": 5.8499,
|
|
"mean_token_accuracy": 0.18871124386787413,
|
|
"num_tokens": 26935264.0,
|
|
"step": 10625
|
|
},
|
|
{
|
|
"entropy": 6.2213846206665036,
|
|
"epoch": 1.2267743796884016,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048611196839212426,
|
|
"loss": 5.8391,
|
|
"mean_token_accuracy": 0.1925579398870468,
|
|
"num_tokens": 26949006.0,
|
|
"step": 10630
|
|
},
|
|
{
|
|
"entropy": 6.088655662536621,
|
|
"epoch": 1.2273514137334103,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.000486097691953794,
|
|
"loss": 5.7191,
|
|
"mean_token_accuracy": 0.18999349772930146,
|
|
"num_tokens": 26961305.0,
|
|
"step": 10635
|
|
},
|
|
{
|
|
"entropy": 6.256745481491089,
|
|
"epoch": 1.227928447778419,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00048608340841529784,
|
|
"loss": 5.9247,
|
|
"mean_token_accuracy": 0.17799484431743623,
|
|
"num_tokens": 26973445.0,
|
|
"step": 10640
|
|
},
|
|
{
|
|
"entropy": 6.2267831325531,
|
|
"epoch": 1.2285054818234276,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.000486069117777116,
|
|
"loss": 5.8593,
|
|
"mean_token_accuracy": 0.18302432596683502,
|
|
"num_tokens": 26986286.0,
|
|
"step": 10645
|
|
},
|
|
{
|
|
"entropy": 6.250400066375732,
|
|
"epoch": 1.2290825158684362,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004860548200397293,
|
|
"loss": 5.9002,
|
|
"mean_token_accuracy": 0.18009741902351378,
|
|
"num_tokens": 26999281.0,
|
|
"step": 10650
|
|
},
|
|
{
|
|
"entropy": 6.267655229568481,
|
|
"epoch": 1.2296595499134448,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00048604051520361846,
|
|
"loss": 6.0407,
|
|
"mean_token_accuracy": 0.17532236725091935,
|
|
"num_tokens": 27011916.0,
|
|
"step": 10655
|
|
},
|
|
{
|
|
"entropy": 6.297758436203003,
|
|
"epoch": 1.2302365839584535,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00048602620326926484,
|
|
"loss": 5.9231,
|
|
"mean_token_accuracy": 0.18180691152811052,
|
|
"num_tokens": 27024442.0,
|
|
"step": 10660
|
|
},
|
|
{
|
|
"entropy": 6.320510053634644,
|
|
"epoch": 1.2308136180034621,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00048601188423714965,
|
|
"loss": 6.0015,
|
|
"mean_token_accuracy": 0.17772735059261321,
|
|
"num_tokens": 27037978.0,
|
|
"step": 10665
|
|
},
|
|
{
|
|
"entropy": 6.302739143371582,
|
|
"epoch": 1.231390652048471,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004859975581077545,
|
|
"loss": 6.0218,
|
|
"mean_token_accuracy": 0.17019021958112718,
|
|
"num_tokens": 27049447.0,
|
|
"step": 10670
|
|
},
|
|
{
|
|
"entropy": 6.216468811035156,
|
|
"epoch": 1.2319676860934794,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004859832248815614,
|
|
"loss": 5.8897,
|
|
"mean_token_accuracy": 0.1882360503077507,
|
|
"num_tokens": 27062961.0,
|
|
"step": 10675
|
|
},
|
|
{
|
|
"entropy": 6.275489568710327,
|
|
"epoch": 1.2325447201384883,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004859688845590522,
|
|
"loss": 5.9641,
|
|
"mean_token_accuracy": 0.17728179842233657,
|
|
"num_tokens": 27076297.0,
|
|
"step": 10680
|
|
},
|
|
{
|
|
"entropy": 6.293725633621216,
|
|
"epoch": 1.233121754183497,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00048595453714070944,
|
|
"loss": 5.9957,
|
|
"mean_token_accuracy": 0.17474785596132278,
|
|
"num_tokens": 27088496.0,
|
|
"step": 10685
|
|
},
|
|
{
|
|
"entropy": 6.297595357894897,
|
|
"epoch": 1.2336987882285055,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004859401826270156,
|
|
"loss": 5.956,
|
|
"mean_token_accuracy": 0.1806192636489868,
|
|
"num_tokens": 27100695.0,
|
|
"step": 10690
|
|
},
|
|
{
|
|
"entropy": 6.236401987075806,
|
|
"epoch": 1.2342758222735142,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004859258210184536,
|
|
"loss": 5.958,
|
|
"mean_token_accuracy": 0.18606834709644318,
|
|
"num_tokens": 27113703.0,
|
|
"step": 10695
|
|
},
|
|
{
|
|
"entropy": 6.303116703033448,
|
|
"epoch": 1.2348528563185228,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.00048591145231550623,
|
|
"loss": 5.949,
|
|
"mean_token_accuracy": 0.17845748662948607,
|
|
"num_tokens": 27128669.0,
|
|
"step": 10700
|
|
},
|
|
{
|
|
"entropy": 6.2689940452575685,
|
|
"epoch": 1.2354298903635315,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00048589707651865697,
|
|
"loss": 5.9483,
|
|
"mean_token_accuracy": 0.17878946512937546,
|
|
"num_tokens": 27141311.0,
|
|
"step": 10705
|
|
},
|
|
{
|
|
"entropy": 6.3080309391021725,
|
|
"epoch": 1.23600692440854,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004858826936283893,
|
|
"loss": 5.9311,
|
|
"mean_token_accuracy": 0.18167731910943985,
|
|
"num_tokens": 27152935.0,
|
|
"step": 10710
|
|
},
|
|
{
|
|
"entropy": 6.186159563064575,
|
|
"epoch": 1.2365839584535487,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.000485868303645187,
|
|
"loss": 5.7991,
|
|
"mean_token_accuracy": 0.18926886171102525,
|
|
"num_tokens": 27166775.0,
|
|
"step": 10715
|
|
},
|
|
{
|
|
"entropy": 6.144335985183716,
|
|
"epoch": 1.2371609924985574,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00048585390656953397,
|
|
"loss": 5.8706,
|
|
"mean_token_accuracy": 0.18486643135547637,
|
|
"num_tokens": 27179406.0,
|
|
"step": 10720
|
|
},
|
|
{
|
|
"entropy": 6.277384281158447,
|
|
"epoch": 1.237738026543566,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004858395024019147,
|
|
"loss": 5.8926,
|
|
"mean_token_accuracy": 0.1846141442656517,
|
|
"num_tokens": 27191562.0,
|
|
"step": 10725
|
|
},
|
|
{
|
|
"entropy": 6.242267036437989,
|
|
"epoch": 1.2383150605885747,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004858250911428133,
|
|
"loss": 5.9116,
|
|
"mean_token_accuracy": 0.17939815521240235,
|
|
"num_tokens": 27203827.0,
|
|
"step": 10730
|
|
},
|
|
{
|
|
"entropy": 6.236856460571289,
|
|
"epoch": 1.2388920946335833,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004858106727927148,
|
|
"loss": 5.8727,
|
|
"mean_token_accuracy": 0.18083032816648484,
|
|
"num_tokens": 27217645.0,
|
|
"step": 10735
|
|
},
|
|
{
|
|
"entropy": 6.257790279388428,
|
|
"epoch": 1.239469128678592,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.000485796247352104,
|
|
"loss": 5.9408,
|
|
"mean_token_accuracy": 0.187166827917099,
|
|
"num_tokens": 27230794.0,
|
|
"step": 10740
|
|
},
|
|
{
|
|
"entropy": 6.275010776519776,
|
|
"epoch": 1.2400461627236008,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004857818148214662,
|
|
"loss": 5.9672,
|
|
"mean_token_accuracy": 0.17526779770851136,
|
|
"num_tokens": 27243965.0,
|
|
"step": 10745
|
|
},
|
|
{
|
|
"entropy": 6.313845252990722,
|
|
"epoch": 1.2406231967686094,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004857673752012866,
|
|
"loss": 5.9307,
|
|
"mean_token_accuracy": 0.17886531203985215,
|
|
"num_tokens": 27256951.0,
|
|
"step": 10750
|
|
},
|
|
{
|
|
"entropy": 6.283997392654419,
|
|
"epoch": 1.241200230813618,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00048575292849205114,
|
|
"loss": 5.9792,
|
|
"mean_token_accuracy": 0.1764329567551613,
|
|
"num_tokens": 27268556.0,
|
|
"step": 10755
|
|
},
|
|
{
|
|
"entropy": 6.223181200027466,
|
|
"epoch": 1.2417772648586267,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004857384746942456,
|
|
"loss": 5.8171,
|
|
"mean_token_accuracy": 0.18010614514350892,
|
|
"num_tokens": 27280367.0,
|
|
"step": 10760
|
|
},
|
|
{
|
|
"entropy": 6.2159076690673825,
|
|
"epoch": 1.2423542989036354,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004857240138083562,
|
|
"loss": 5.9008,
|
|
"mean_token_accuracy": 0.18687991052865982,
|
|
"num_tokens": 27293727.0,
|
|
"step": 10765
|
|
},
|
|
{
|
|
"entropy": 6.280245590209961,
|
|
"epoch": 1.242931332948644,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004857095458348692,
|
|
"loss": 5.964,
|
|
"mean_token_accuracy": 0.1840096592903137,
|
|
"num_tokens": 27306677.0,
|
|
"step": 10770
|
|
},
|
|
{
|
|
"entropy": 6.303292608261108,
|
|
"epoch": 1.2435083669936526,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00048569507077427134,
|
|
"loss": 5.9332,
|
|
"mean_token_accuracy": 0.1819072499871254,
|
|
"num_tokens": 27319317.0,
|
|
"step": 10775
|
|
},
|
|
{
|
|
"entropy": 6.264583969116211,
|
|
"epoch": 1.2440854010386613,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004856805886270494,
|
|
"loss": 5.905,
|
|
"mean_token_accuracy": 0.18524052053689957,
|
|
"num_tokens": 27332021.0,
|
|
"step": 10780
|
|
},
|
|
{
|
|
"entropy": 6.156681680679322,
|
|
"epoch": 1.24466243508367,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004856660993936905,
|
|
"loss": 5.7563,
|
|
"mean_token_accuracy": 0.201753930747509,
|
|
"num_tokens": 27343972.0,
|
|
"step": 10785
|
|
},
|
|
{
|
|
"entropy": 6.273656749725342,
|
|
"epoch": 1.2452394691286786,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.000485651603074682,
|
|
"loss": 5.9718,
|
|
"mean_token_accuracy": 0.1731579691171646,
|
|
"num_tokens": 27356712.0,
|
|
"step": 10790
|
|
},
|
|
{
|
|
"entropy": 6.211948394775391,
|
|
"epoch": 1.2458165031736872,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004856370996705115,
|
|
"loss": 5.8361,
|
|
"mean_token_accuracy": 0.18876608461141586,
|
|
"num_tokens": 27369028.0,
|
|
"step": 10795
|
|
},
|
|
{
|
|
"entropy": 6.217354869842529,
|
|
"epoch": 1.2463935372186958,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004856225891816667,
|
|
"loss": 5.8618,
|
|
"mean_token_accuracy": 0.18710222393274306,
|
|
"num_tokens": 27380789.0,
|
|
"step": 10800
|
|
},
|
|
{
|
|
"entropy": 6.251491403579712,
|
|
"epoch": 1.2469705712637045,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004856080716086358,
|
|
"loss": 5.8166,
|
|
"mean_token_accuracy": 0.1833536610007286,
|
|
"num_tokens": 27394098.0,
|
|
"step": 10805
|
|
},
|
|
{
|
|
"entropy": 6.221289253234863,
|
|
"epoch": 1.2475476053087133,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.000485593546951907,
|
|
"loss": 5.9253,
|
|
"mean_token_accuracy": 0.18810599744319917,
|
|
"num_tokens": 27407270.0,
|
|
"step": 10810
|
|
},
|
|
{
|
|
"entropy": 6.242495155334472,
|
|
"epoch": 1.2481246393537218,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004855790152119688,
|
|
"loss": 5.8755,
|
|
"mean_token_accuracy": 0.18733642101287842,
|
|
"num_tokens": 27420397.0,
|
|
"step": 10815
|
|
},
|
|
{
|
|
"entropy": 6.273569202423095,
|
|
"epoch": 1.2487016733987306,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004855644763893102,
|
|
"loss": 5.9575,
|
|
"mean_token_accuracy": 0.1822887822985649,
|
|
"num_tokens": 27433007.0,
|
|
"step": 10820
|
|
},
|
|
{
|
|
"entropy": 6.296523666381836,
|
|
"epoch": 1.2492787074437393,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00048554993048441987,
|
|
"loss": 5.9286,
|
|
"mean_token_accuracy": 0.17798348218202592,
|
|
"num_tokens": 27446683.0,
|
|
"step": 10825
|
|
},
|
|
{
|
|
"entropy": 6.2345174789428714,
|
|
"epoch": 1.249855741488748,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004855353774977873,
|
|
"loss": 5.9498,
|
|
"mean_token_accuracy": 0.1765942618250847,
|
|
"num_tokens": 27459298.0,
|
|
"step": 10830
|
|
},
|
|
{
|
|
"entropy": 6.222336292266846,
|
|
"epoch": 1.2504327755337565,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00048552081742990184,
|
|
"loss": 5.9103,
|
|
"mean_token_accuracy": 0.18254689276218414,
|
|
"num_tokens": 27472287.0,
|
|
"step": 10835
|
|
},
|
|
{
|
|
"entropy": 6.276287794113159,
|
|
"epoch": 1.2510098095787652,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048550625028125327,
|
|
"loss": 5.8996,
|
|
"mean_token_accuracy": 0.18219816386699678,
|
|
"num_tokens": 27484808.0,
|
|
"step": 10840
|
|
},
|
|
{
|
|
"entropy": 6.2211394786834715,
|
|
"epoch": 1.2515868436237738,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004854916760523315,
|
|
"loss": 5.8676,
|
|
"mean_token_accuracy": 0.18489859700202943,
|
|
"num_tokens": 27496980.0,
|
|
"step": 10845
|
|
},
|
|
{
|
|
"entropy": 6.2227785110473635,
|
|
"epoch": 1.2521638776687825,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00048547709474362684,
|
|
"loss": 5.9122,
|
|
"mean_token_accuracy": 0.17859497368335725,
|
|
"num_tokens": 27509969.0,
|
|
"step": 10850
|
|
},
|
|
{
|
|
"entropy": 6.25306191444397,
|
|
"epoch": 1.252740911713791,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004854625063556296,
|
|
"loss": 5.8834,
|
|
"mean_token_accuracy": 0.1868899032473564,
|
|
"num_tokens": 27523410.0,
|
|
"step": 10855
|
|
},
|
|
{
|
|
"entropy": 6.227614545822144,
|
|
"epoch": 1.2533179457587997,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004854479108888305,
|
|
"loss": 5.8827,
|
|
"mean_token_accuracy": 0.18421921283006668,
|
|
"num_tokens": 27535183.0,
|
|
"step": 10860
|
|
},
|
|
{
|
|
"entropy": 6.256004571914673,
|
|
"epoch": 1.2538949798038084,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00048543330834372047,
|
|
"loss": 5.9298,
|
|
"mean_token_accuracy": 0.17713305205106736,
|
|
"num_tokens": 27548028.0,
|
|
"step": 10865
|
|
},
|
|
{
|
|
"entropy": 6.250798034667969,
|
|
"epoch": 1.254472013848817,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00048541869872079064,
|
|
"loss": 5.8519,
|
|
"mean_token_accuracy": 0.18728440403938293,
|
|
"num_tokens": 27561302.0,
|
|
"step": 10870
|
|
},
|
|
{
|
|
"entropy": 6.191199779510498,
|
|
"epoch": 1.2550490478938257,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004854040820205324,
|
|
"loss": 5.771,
|
|
"mean_token_accuracy": 0.1891787514090538,
|
|
"num_tokens": 27572933.0,
|
|
"step": 10875
|
|
},
|
|
{
|
|
"entropy": 6.267033433914184,
|
|
"epoch": 1.2556260819388343,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004853894582434373,
|
|
"loss": 5.9594,
|
|
"mean_token_accuracy": 0.18094786554574965,
|
|
"num_tokens": 27586373.0,
|
|
"step": 10880
|
|
},
|
|
{
|
|
"entropy": 6.212432479858398,
|
|
"epoch": 1.2562031159838432,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004853748273899974,
|
|
"loss": 5.8121,
|
|
"mean_token_accuracy": 0.1917188748717308,
|
|
"num_tokens": 27599236.0,
|
|
"step": 10885
|
|
},
|
|
{
|
|
"entropy": 6.199079370498657,
|
|
"epoch": 1.2567801500288516,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004853601894607046,
|
|
"loss": 5.8198,
|
|
"mean_token_accuracy": 0.1882639765739441,
|
|
"num_tokens": 27611904.0,
|
|
"step": 10890
|
|
},
|
|
{
|
|
"entropy": 6.141427040100098,
|
|
"epoch": 1.2573571840738604,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004853455444560514,
|
|
"loss": 5.7666,
|
|
"mean_token_accuracy": 0.1835411846637726,
|
|
"num_tokens": 27625778.0,
|
|
"step": 10895
|
|
},
|
|
{
|
|
"entropy": 6.264633512496948,
|
|
"epoch": 1.257934218118869,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004853308923765302,
|
|
"loss": 5.9298,
|
|
"mean_token_accuracy": 0.1849829599261284,
|
|
"num_tokens": 27638359.0,
|
|
"step": 10900
|
|
},
|
|
{
|
|
"entropy": 6.22053279876709,
|
|
"epoch": 1.2585112521638777,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.000485316233222634,
|
|
"loss": 5.809,
|
|
"mean_token_accuracy": 0.19588791131973265,
|
|
"num_tokens": 27651107.0,
|
|
"step": 10905
|
|
},
|
|
{
|
|
"entropy": 6.263698863983154,
|
|
"epoch": 1.2590882862088864,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004853015669948557,
|
|
"loss": 5.9405,
|
|
"mean_token_accuracy": 0.1806721031665802,
|
|
"num_tokens": 27664060.0,
|
|
"step": 10910
|
|
},
|
|
{
|
|
"entropy": 6.198569345474243,
|
|
"epoch": 1.259665320253895,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00048528689369368863,
|
|
"loss": 5.8714,
|
|
"mean_token_accuracy": 0.18663408011198043,
|
|
"num_tokens": 27676678.0,
|
|
"step": 10915
|
|
},
|
|
{
|
|
"entropy": 6.27892484664917,
|
|
"epoch": 1.2602423542989036,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004852722133196264,
|
|
"loss": 5.9284,
|
|
"mean_token_accuracy": 0.17606211006641387,
|
|
"num_tokens": 27689696.0,
|
|
"step": 10920
|
|
},
|
|
{
|
|
"entropy": 6.214528560638428,
|
|
"epoch": 1.2608193883439123,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004852575258731627,
|
|
"loss": 5.8139,
|
|
"mean_token_accuracy": 0.18999661058187484,
|
|
"num_tokens": 27702144.0,
|
|
"step": 10925
|
|
},
|
|
{
|
|
"entropy": 6.267048263549805,
|
|
"epoch": 1.261396422388921,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004852428313547916,
|
|
"loss": 5.9585,
|
|
"mean_token_accuracy": 0.17625246644020082,
|
|
"num_tokens": 27714618.0,
|
|
"step": 10930
|
|
},
|
|
{
|
|
"entropy": 6.254409265518189,
|
|
"epoch": 1.2619734564339296,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00048522812976500726,
|
|
"loss": 5.8882,
|
|
"mean_token_accuracy": 0.1819372683763504,
|
|
"num_tokens": 27727002.0,
|
|
"step": 10935
|
|
},
|
|
{
|
|
"entropy": 6.285655307769775,
|
|
"epoch": 1.2625504904789382,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00048521342110430417,
|
|
"loss": 5.9194,
|
|
"mean_token_accuracy": 0.1847675174474716,
|
|
"num_tokens": 27739506.0,
|
|
"step": 10940
|
|
},
|
|
{
|
|
"entropy": 6.199552774429321,
|
|
"epoch": 1.2631275245239468,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00048519870537317713,
|
|
"loss": 5.7879,
|
|
"mean_token_accuracy": 0.18768482953310012,
|
|
"num_tokens": 27751959.0,
|
|
"step": 10945
|
|
},
|
|
{
|
|
"entropy": 6.188604736328125,
|
|
"epoch": 1.2637045585689557,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048518398257212103,
|
|
"loss": 5.8612,
|
|
"mean_token_accuracy": 0.18423410803079604,
|
|
"num_tokens": 27762938.0,
|
|
"step": 10950
|
|
},
|
|
{
|
|
"entropy": 6.242674493789673,
|
|
"epoch": 1.2642815926139641,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004851692527016311,
|
|
"loss": 5.9281,
|
|
"mean_token_accuracy": 0.1746857702732086,
|
|
"num_tokens": 27776288.0,
|
|
"step": 10955
|
|
},
|
|
{
|
|
"entropy": 6.300945043563843,
|
|
"epoch": 1.264858626658973,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004851545157622027,
|
|
"loss": 5.9403,
|
|
"mean_token_accuracy": 0.16904095262289048,
|
|
"num_tokens": 27788311.0,
|
|
"step": 10960
|
|
},
|
|
{
|
|
"entropy": 6.292170190811158,
|
|
"epoch": 1.2654356607039816,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004851397717543316,
|
|
"loss": 5.9153,
|
|
"mean_token_accuracy": 0.1774510622024536,
|
|
"num_tokens": 27799589.0,
|
|
"step": 10965
|
|
},
|
|
{
|
|
"entropy": 6.163033199310303,
|
|
"epoch": 1.2660126947489903,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004851250206785137,
|
|
"loss": 5.7982,
|
|
"mean_token_accuracy": 0.18300086855888367,
|
|
"num_tokens": 27813057.0,
|
|
"step": 10970
|
|
},
|
|
{
|
|
"entropy": 6.1811439990997314,
|
|
"epoch": 1.266589728793999,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00048511026253524503,
|
|
"loss": 5.8343,
|
|
"mean_token_accuracy": 0.1845756396651268,
|
|
"num_tokens": 27826465.0,
|
|
"step": 10975
|
|
},
|
|
{
|
|
"entropy": 6.239641380310059,
|
|
"epoch": 1.2671667628390075,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004850954973250221,
|
|
"loss": 5.9186,
|
|
"mean_token_accuracy": 0.183623206615448,
|
|
"num_tokens": 27837157.0,
|
|
"step": 10980
|
|
},
|
|
{
|
|
"entropy": 6.2734949588775635,
|
|
"epoch": 1.2677437968840162,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00048508072504834144,
|
|
"loss": 5.9733,
|
|
"mean_token_accuracy": 0.18870452791452408,
|
|
"num_tokens": 27850101.0,
|
|
"step": 10985
|
|
},
|
|
{
|
|
"entropy": 6.257879447937012,
|
|
"epoch": 1.2683208309290248,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.00048506594570569997,
|
|
"loss": 5.9163,
|
|
"mean_token_accuracy": 0.1761870115995407,
|
|
"num_tokens": 27862786.0,
|
|
"step": 10990
|
|
},
|
|
{
|
|
"entropy": 6.310289525985718,
|
|
"epoch": 1.2688978649740335,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004850511592975947,
|
|
"loss": 5.921,
|
|
"mean_token_accuracy": 0.1836473450064659,
|
|
"num_tokens": 27875196.0,
|
|
"step": 10995
|
|
},
|
|
{
|
|
"entropy": 6.256885623931884,
|
|
"epoch": 1.269474899019042,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004850363658245231,
|
|
"loss": 5.9931,
|
|
"mean_token_accuracy": 0.17773234248161315,
|
|
"num_tokens": 27888348.0,
|
|
"step": 11000
|
|
},
|
|
{
|
|
"entropy": 6.264603042602539,
|
|
"epoch": 1.2700519330640507,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004850215652869826,
|
|
"loss": 5.9415,
|
|
"mean_token_accuracy": 0.18163408041000367,
|
|
"num_tokens": 27901301.0,
|
|
"step": 11005
|
|
},
|
|
{
|
|
"entropy": 6.26677885055542,
|
|
"epoch": 1.2706289671090594,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004850067576854711,
|
|
"loss": 5.9245,
|
|
"mean_token_accuracy": 0.18035585135221482,
|
|
"num_tokens": 27915665.0,
|
|
"step": 11010
|
|
},
|
|
{
|
|
"entropy": 6.204976367950439,
|
|
"epoch": 1.271206001154068,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004849919430204867,
|
|
"loss": 5.899,
|
|
"mean_token_accuracy": 0.18384966850280762,
|
|
"num_tokens": 27928333.0,
|
|
"step": 11015
|
|
},
|
|
{
|
|
"entropy": 6.2638813018798825,
|
|
"epoch": 1.2717830351990767,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004849771212925275,
|
|
"loss": 5.8452,
|
|
"mean_token_accuracy": 0.18147977739572524,
|
|
"num_tokens": 27940429.0,
|
|
"step": 11020
|
|
},
|
|
{
|
|
"entropy": 6.264388513565064,
|
|
"epoch": 1.2723600692440855,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00048496229250209223,
|
|
"loss": 5.9614,
|
|
"mean_token_accuracy": 0.18041146397590638,
|
|
"num_tokens": 27953846.0,
|
|
"step": 11025
|
|
},
|
|
{
|
|
"entropy": 6.211956357955932,
|
|
"epoch": 1.272937103289094,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004849474566496795,
|
|
"loss": 5.8087,
|
|
"mean_token_accuracy": 0.19337970167398452,
|
|
"num_tokens": 27966393.0,
|
|
"step": 11030
|
|
},
|
|
{
|
|
"entropy": 6.157489681243897,
|
|
"epoch": 1.2735141373341028,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004849326137357883,
|
|
"loss": 5.7524,
|
|
"mean_token_accuracy": 0.20423612147569656,
|
|
"num_tokens": 27979928.0,
|
|
"step": 11035
|
|
},
|
|
{
|
|
"entropy": 6.274266529083252,
|
|
"epoch": 1.2740911713791114,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.000484917763760918,
|
|
"loss": 5.8724,
|
|
"mean_token_accuracy": 0.17999066561460494,
|
|
"num_tokens": 27991450.0,
|
|
"step": 11040
|
|
},
|
|
{
|
|
"entropy": 6.249115896224976,
|
|
"epoch": 1.27466820542412,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00048490290672556784,
|
|
"loss": 5.9163,
|
|
"mean_token_accuracy": 0.17860014736652374,
|
|
"num_tokens": 28003696.0,
|
|
"step": 11045
|
|
},
|
|
{
|
|
"entropy": 6.121306085586548,
|
|
"epoch": 1.2752452394691287,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004848880426302378,
|
|
"loss": 5.8191,
|
|
"mean_token_accuracy": 0.1887667015194893,
|
|
"num_tokens": 28015886.0,
|
|
"step": 11050
|
|
},
|
|
{
|
|
"entropy": 6.220458936691284,
|
|
"epoch": 1.2758222735141374,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004848731714754277,
|
|
"loss": 5.87,
|
|
"mean_token_accuracy": 0.18536427319049836,
|
|
"num_tokens": 28029552.0,
|
|
"step": 11055
|
|
},
|
|
{
|
|
"entropy": 6.2172283172607425,
|
|
"epoch": 1.276399307559146,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004848582932616377,
|
|
"loss": 5.9559,
|
|
"mean_token_accuracy": 0.17716862708330156,
|
|
"num_tokens": 28042275.0,
|
|
"step": 11060
|
|
},
|
|
{
|
|
"entropy": 6.174749374389648,
|
|
"epoch": 1.2769763416041546,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004848434079893682,
|
|
"loss": 5.8283,
|
|
"mean_token_accuracy": 0.19337797313928604,
|
|
"num_tokens": 28054840.0,
|
|
"step": 11065
|
|
},
|
|
{
|
|
"entropy": 6.320803117752075,
|
|
"epoch": 1.2775533756491633,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004848285156591201,
|
|
"loss": 5.9848,
|
|
"mean_token_accuracy": 0.17735466361045837,
|
|
"num_tokens": 28068052.0,
|
|
"step": 11070
|
|
},
|
|
{
|
|
"entropy": 6.317575454711914,
|
|
"epoch": 1.278130409694172,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00048481361627139384,
|
|
"loss": 5.9607,
|
|
"mean_token_accuracy": 0.17917237877845765,
|
|
"num_tokens": 28081157.0,
|
|
"step": 11075
|
|
},
|
|
{
|
|
"entropy": 6.264458179473877,
|
|
"epoch": 1.2787074437391805,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00048479870982669096,
|
|
"loss": 5.9992,
|
|
"mean_token_accuracy": 0.17882073372602464,
|
|
"num_tokens": 28093842.0,
|
|
"step": 11080
|
|
},
|
|
{
|
|
"entropy": 6.269530010223389,
|
|
"epoch": 1.2792844777841892,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00048478379632551266,
|
|
"loss": 5.8656,
|
|
"mean_token_accuracy": 0.1861704871058464,
|
|
"num_tokens": 28107529.0,
|
|
"step": 11085
|
|
},
|
|
{
|
|
"entropy": 6.3019171237945555,
|
|
"epoch": 1.279861511829198,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004847688757683606,
|
|
"loss": 5.9586,
|
|
"mean_token_accuracy": 0.17826474457979202,
|
|
"num_tokens": 28119650.0,
|
|
"step": 11090
|
|
},
|
|
{
|
|
"entropy": 6.197647523880005,
|
|
"epoch": 1.2804385458742065,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004847539481557366,
|
|
"loss": 5.8936,
|
|
"mean_token_accuracy": 0.18941795378923415,
|
|
"num_tokens": 28131209.0,
|
|
"step": 11095
|
|
},
|
|
{
|
|
"entropy": 6.21189546585083,
|
|
"epoch": 1.2810155799192153,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00048473901348814277,
|
|
"loss": 5.9072,
|
|
"mean_token_accuracy": 0.18758580833673477,
|
|
"num_tokens": 28143624.0,
|
|
"step": 11100
|
|
},
|
|
{
|
|
"entropy": 6.333727693557739,
|
|
"epoch": 1.281592613964224,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004847240717660814,
|
|
"loss": 5.9187,
|
|
"mean_token_accuracy": 0.18257874101400376,
|
|
"num_tokens": 28156752.0,
|
|
"step": 11105
|
|
},
|
|
{
|
|
"entropy": 6.148864364624023,
|
|
"epoch": 1.2821696480092326,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.00048470912299005493,
|
|
"loss": 5.7846,
|
|
"mean_token_accuracy": 0.1917967677116394,
|
|
"num_tokens": 28169288.0,
|
|
"step": 11110
|
|
},
|
|
{
|
|
"entropy": 6.202798795700073,
|
|
"epoch": 1.2827466820542412,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00048469416716056635,
|
|
"loss": 5.8863,
|
|
"mean_token_accuracy": 0.18294143825769424,
|
|
"num_tokens": 28181739.0,
|
|
"step": 11115
|
|
},
|
|
{
|
|
"entropy": 6.241795825958252,
|
|
"epoch": 1.28332371609925,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004846792042781187,
|
|
"loss": 5.8472,
|
|
"mean_token_accuracy": 0.18725763261318207,
|
|
"num_tokens": 28193861.0,
|
|
"step": 11120
|
|
},
|
|
{
|
|
"entropy": 6.167054653167725,
|
|
"epoch": 1.2839007501442585,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00048466423434321513,
|
|
"loss": 5.799,
|
|
"mean_token_accuracy": 0.19221861511468888,
|
|
"num_tokens": 28205453.0,
|
|
"step": 11125
|
|
},
|
|
{
|
|
"entropy": 6.213259506225586,
|
|
"epoch": 1.2844777841892672,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048464925735635907,
|
|
"loss": 5.866,
|
|
"mean_token_accuracy": 0.18240144699811936,
|
|
"num_tokens": 28217554.0,
|
|
"step": 11130
|
|
},
|
|
{
|
|
"entropy": 6.326313447952271,
|
|
"epoch": 1.2850548182342758,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00048463427331805445,
|
|
"loss": 5.9837,
|
|
"mean_token_accuracy": 0.17859313935041427,
|
|
"num_tokens": 28230091.0,
|
|
"step": 11135
|
|
},
|
|
{
|
|
"entropy": 6.196951007843017,
|
|
"epoch": 1.2856318522792844,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004846192822288052,
|
|
"loss": 5.8606,
|
|
"mean_token_accuracy": 0.19161761701107025,
|
|
"num_tokens": 28243285.0,
|
|
"step": 11140
|
|
},
|
|
{
|
|
"entropy": 6.159520244598388,
|
|
"epoch": 1.286208886324293,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004846042840891155,
|
|
"loss": 5.7559,
|
|
"mean_token_accuracy": 0.19518305808305741,
|
|
"num_tokens": 28256210.0,
|
|
"step": 11145
|
|
},
|
|
{
|
|
"entropy": 6.202442598342896,
|
|
"epoch": 1.2867859203693017,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004845892788994899,
|
|
"loss": 5.8393,
|
|
"mean_token_accuracy": 0.1925252139568329,
|
|
"num_tokens": 28268291.0,
|
|
"step": 11150
|
|
},
|
|
{
|
|
"entropy": 6.127519702911377,
|
|
"epoch": 1.2873629544143104,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004845742666604329,
|
|
"loss": 5.802,
|
|
"mean_token_accuracy": 0.19252759367227554,
|
|
"num_tokens": 28281462.0,
|
|
"step": 11155
|
|
},
|
|
{
|
|
"entropy": 6.261201524734497,
|
|
"epoch": 1.287939988459319,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00048455924737244953,
|
|
"loss": 5.9527,
|
|
"mean_token_accuracy": 0.1794736549258232,
|
|
"num_tokens": 28292766.0,
|
|
"step": 11160
|
|
},
|
|
{
|
|
"entropy": 6.165164470672607,
|
|
"epoch": 1.2885170225043279,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048454422103604505,
|
|
"loss": 5.8265,
|
|
"mean_token_accuracy": 0.1932087242603302,
|
|
"num_tokens": 28304500.0,
|
|
"step": 11165
|
|
},
|
|
{
|
|
"entropy": 6.250514936447144,
|
|
"epoch": 1.2890940565493363,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004845291876517247,
|
|
"loss": 5.9187,
|
|
"mean_token_accuracy": 0.1889398217201233,
|
|
"num_tokens": 28317262.0,
|
|
"step": 11170
|
|
},
|
|
{
|
|
"entropy": 6.167955780029297,
|
|
"epoch": 1.2896710905943451,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00048451414721999424,
|
|
"loss": 5.79,
|
|
"mean_token_accuracy": 0.1927010953426361,
|
|
"num_tokens": 28330313.0,
|
|
"step": 11175
|
|
},
|
|
{
|
|
"entropy": 6.192044591903686,
|
|
"epoch": 1.2902481246393538,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00048449909974135954,
|
|
"loss": 5.8116,
|
|
"mean_token_accuracy": 0.18487345725297927,
|
|
"num_tokens": 28344058.0,
|
|
"step": 11180
|
|
},
|
|
{
|
|
"entropy": 6.202538776397705,
|
|
"epoch": 1.2908251586843624,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004844840452163267,
|
|
"loss": 5.8816,
|
|
"mean_token_accuracy": 0.18409787267446517,
|
|
"num_tokens": 28356664.0,
|
|
"step": 11185
|
|
},
|
|
{
|
|
"entropy": 6.264059352874756,
|
|
"epoch": 1.291402192729371,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.000484468983645402,
|
|
"loss": 5.9159,
|
|
"mean_token_accuracy": 0.1831672191619873,
|
|
"num_tokens": 28369040.0,
|
|
"step": 11190
|
|
},
|
|
{
|
|
"entropy": 6.198862314224243,
|
|
"epoch": 1.2919792267743797,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00048445391502909213,
|
|
"loss": 5.8845,
|
|
"mean_token_accuracy": 0.17770082056522368,
|
|
"num_tokens": 28381788.0,
|
|
"step": 11195
|
|
},
|
|
{
|
|
"entropy": 6.235758447647095,
|
|
"epoch": 1.2925562608193883,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00048443883936790386,
|
|
"loss": 5.9364,
|
|
"mean_token_accuracy": 0.18272285610437394,
|
|
"num_tokens": 28394531.0,
|
|
"step": 11200
|
|
},
|
|
{
|
|
"entropy": 6.215797090530396,
|
|
"epoch": 1.293133294864397,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00048442375666234427,
|
|
"loss": 5.8094,
|
|
"mean_token_accuracy": 0.18736853450536728,
|
|
"num_tokens": 28407766.0,
|
|
"step": 11205
|
|
},
|
|
{
|
|
"entropy": 6.2450777053833,
|
|
"epoch": 1.2937103289094056,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004844086669129206,
|
|
"loss": 5.9169,
|
|
"mean_token_accuracy": 0.18248326927423478,
|
|
"num_tokens": 28420185.0,
|
|
"step": 11210
|
|
},
|
|
{
|
|
"entropy": 6.302453470230103,
|
|
"epoch": 1.2942873629544143,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00048439357012014045,
|
|
"loss": 5.875,
|
|
"mean_token_accuracy": 0.1817401424050331,
|
|
"num_tokens": 28432781.0,
|
|
"step": 11215
|
|
},
|
|
{
|
|
"entropy": 6.239097166061401,
|
|
"epoch": 1.294864396999423,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004843784662845116,
|
|
"loss": 5.8712,
|
|
"mean_token_accuracy": 0.18863223046064376,
|
|
"num_tokens": 28446181.0,
|
|
"step": 11220
|
|
},
|
|
{
|
|
"entropy": 6.22045316696167,
|
|
"epoch": 1.2954414310444315,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000484363355406542,
|
|
"loss": 5.7876,
|
|
"mean_token_accuracy": 0.1905339851975441,
|
|
"num_tokens": 28457959.0,
|
|
"step": 11225
|
|
},
|
|
{
|
|
"entropy": 6.223681545257568,
|
|
"epoch": 1.2960184650894404,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00048434823748674,
|
|
"loss": 5.9161,
|
|
"mean_token_accuracy": 0.18176539540290831,
|
|
"num_tokens": 28470656.0,
|
|
"step": 11230
|
|
},
|
|
{
|
|
"entropy": 6.253976678848266,
|
|
"epoch": 1.2965954991344488,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.00048433311252561403,
|
|
"loss": 5.9463,
|
|
"mean_token_accuracy": 0.18163900822401047,
|
|
"num_tokens": 28483359.0,
|
|
"step": 11235
|
|
},
|
|
{
|
|
"entropy": 6.231476640701294,
|
|
"epoch": 1.2971725331794577,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004843179805236728,
|
|
"loss": 5.8509,
|
|
"mean_token_accuracy": 0.1812107414007187,
|
|
"num_tokens": 28495984.0,
|
|
"step": 11240
|
|
},
|
|
{
|
|
"entropy": 6.214840412139893,
|
|
"epoch": 1.297749567224466,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00048430284148142516,
|
|
"loss": 5.9283,
|
|
"mean_token_accuracy": 0.18338681906461715,
|
|
"num_tokens": 28508629.0,
|
|
"step": 11245
|
|
},
|
|
{
|
|
"entropy": 6.251529169082642,
|
|
"epoch": 1.298326601269475,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004842876953993805,
|
|
"loss": 5.9368,
|
|
"mean_token_accuracy": 0.1814151406288147,
|
|
"num_tokens": 28521952.0,
|
|
"step": 11250
|
|
},
|
|
{
|
|
"entropy": 6.235261106491089,
|
|
"epoch": 1.2989036353144836,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004842725422780482,
|
|
"loss": 5.8472,
|
|
"mean_token_accuracy": 0.1838516652584076,
|
|
"num_tokens": 28535210.0,
|
|
"step": 11255
|
|
},
|
|
{
|
|
"entropy": 6.2960120677948,
|
|
"epoch": 1.2994806693594922,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004842573821179378,
|
|
"loss": 5.9481,
|
|
"mean_token_accuracy": 0.17584086060523987,
|
|
"num_tokens": 28547294.0,
|
|
"step": 11260
|
|
},
|
|
{
|
|
"entropy": 6.314822959899902,
|
|
"epoch": 1.3000577034045009,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004842422149195593,
|
|
"loss": 5.9818,
|
|
"mean_token_accuracy": 0.1747643157839775,
|
|
"num_tokens": 28558934.0,
|
|
"step": 11265
|
|
},
|
|
{
|
|
"entropy": 6.228778266906739,
|
|
"epoch": 1.3006347374495095,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00048422704068342294,
|
|
"loss": 5.8457,
|
|
"mean_token_accuracy": 0.18052484542131425,
|
|
"num_tokens": 28571897.0,
|
|
"step": 11270
|
|
},
|
|
{
|
|
"entropy": 6.207079267501831,
|
|
"epoch": 1.3012117714945182,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004842118594100389,
|
|
"loss": 5.8526,
|
|
"mean_token_accuracy": 0.18636152595281602,
|
|
"num_tokens": 28584320.0,
|
|
"step": 11275
|
|
},
|
|
{
|
|
"entropy": 6.174588394165039,
|
|
"epoch": 1.3017888055395268,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00048419667109991793,
|
|
"loss": 5.8066,
|
|
"mean_token_accuracy": 0.1909553661942482,
|
|
"num_tokens": 28597018.0,
|
|
"step": 11280
|
|
},
|
|
{
|
|
"entropy": 6.1673197746276855,
|
|
"epoch": 1.3023658395845354,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00048418147575357085,
|
|
"loss": 5.82,
|
|
"mean_token_accuracy": 0.1927016168832779,
|
|
"num_tokens": 28609145.0,
|
|
"step": 11285
|
|
},
|
|
{
|
|
"entropy": 6.213823366165161,
|
|
"epoch": 1.302942873629544,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004841662733715087,
|
|
"loss": 5.8258,
|
|
"mean_token_accuracy": 0.18956251591444015,
|
|
"num_tokens": 28622208.0,
|
|
"step": 11290
|
|
},
|
|
{
|
|
"entropy": 6.168881797790528,
|
|
"epoch": 1.3035199076745527,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00048415106395424294,
|
|
"loss": 5.8299,
|
|
"mean_token_accuracy": 0.18110065758228303,
|
|
"num_tokens": 28634719.0,
|
|
"step": 11295
|
|
},
|
|
{
|
|
"entropy": 6.242797899246216,
|
|
"epoch": 1.3040969417195614,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00048413584750228494,
|
|
"loss": 5.9193,
|
|
"mean_token_accuracy": 0.18366942554712296,
|
|
"num_tokens": 28647138.0,
|
|
"step": 11300
|
|
},
|
|
{
|
|
"entropy": 6.160969686508179,
|
|
"epoch": 1.3046739757645702,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00048412062401614653,
|
|
"loss": 5.8142,
|
|
"mean_token_accuracy": 0.19241383224725722,
|
|
"num_tokens": 28660898.0,
|
|
"step": 11305
|
|
},
|
|
{
|
|
"entropy": 6.281964683532715,
|
|
"epoch": 1.3052510098095786,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00048410539349634,
|
|
"loss": 5.9567,
|
|
"mean_token_accuracy": 0.18592915683984756,
|
|
"num_tokens": 28672898.0,
|
|
"step": 11310
|
|
},
|
|
{
|
|
"entropy": 6.223157262802124,
|
|
"epoch": 1.3058280438545875,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00048409015594337725,
|
|
"loss": 5.9526,
|
|
"mean_token_accuracy": 0.1888653665781021,
|
|
"num_tokens": 28684608.0,
|
|
"step": 11315
|
|
},
|
|
{
|
|
"entropy": 6.212820672988892,
|
|
"epoch": 1.3064050778995961,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.000484074911357771,
|
|
"loss": 5.8609,
|
|
"mean_token_accuracy": 0.18949985653162002,
|
|
"num_tokens": 28696867.0,
|
|
"step": 11320
|
|
},
|
|
{
|
|
"entropy": 6.2286797046661375,
|
|
"epoch": 1.3069821119446048,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00048405965974003404,
|
|
"loss": 5.9359,
|
|
"mean_token_accuracy": 0.17696356326341628,
|
|
"num_tokens": 28709533.0,
|
|
"step": 11325
|
|
},
|
|
{
|
|
"entropy": 6.2534784317016605,
|
|
"epoch": 1.3075591459896134,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00048404440109067927,
|
|
"loss": 5.8694,
|
|
"mean_token_accuracy": 0.17698248773813247,
|
|
"num_tokens": 28721647.0,
|
|
"step": 11330
|
|
},
|
|
{
|
|
"entropy": 6.255917501449585,
|
|
"epoch": 1.308136180034622,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004840291354102198,
|
|
"loss": 5.8925,
|
|
"mean_token_accuracy": 0.18085959553718567,
|
|
"num_tokens": 28735261.0,
|
|
"step": 11335
|
|
},
|
|
{
|
|
"entropy": 6.202675867080688,
|
|
"epoch": 1.3087132140796307,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004840138626991693,
|
|
"loss": 5.9353,
|
|
"mean_token_accuracy": 0.18194161504507064,
|
|
"num_tokens": 28747930.0,
|
|
"step": 11340
|
|
},
|
|
{
|
|
"entropy": 6.258759212493897,
|
|
"epoch": 1.3092902481246393,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004839985829580413,
|
|
"loss": 5.9106,
|
|
"mean_token_accuracy": 0.18136637806892394,
|
|
"num_tokens": 28760497.0,
|
|
"step": 11345
|
|
},
|
|
{
|
|
"entropy": 6.320033216476441,
|
|
"epoch": 1.309867282169648,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00048398329618734977,
|
|
"loss": 5.9464,
|
|
"mean_token_accuracy": 0.17641042470932006,
|
|
"num_tokens": 28772787.0,
|
|
"step": 11350
|
|
},
|
|
{
|
|
"entropy": 6.200205707550049,
|
|
"epoch": 1.3104443162146566,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004839680023876089,
|
|
"loss": 5.8531,
|
|
"mean_token_accuracy": 0.18295872509479522,
|
|
"num_tokens": 28784901.0,
|
|
"step": 11355
|
|
},
|
|
{
|
|
"entropy": 6.262151050567627,
|
|
"epoch": 1.3110213502596653,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004839527015593331,
|
|
"loss": 5.9302,
|
|
"mean_token_accuracy": 0.178282168507576,
|
|
"num_tokens": 28797376.0,
|
|
"step": 11360
|
|
},
|
|
{
|
|
"entropy": 6.249820327758789,
|
|
"epoch": 1.311598384304674,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00048393739370303684,
|
|
"loss": 5.8711,
|
|
"mean_token_accuracy": 0.1843525782227516,
|
|
"num_tokens": 28808805.0,
|
|
"step": 11365
|
|
},
|
|
{
|
|
"entropy": 6.219827556610108,
|
|
"epoch": 1.3121754183496828,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004839220788192353,
|
|
"loss": 5.9671,
|
|
"mean_token_accuracy": 0.17647455185651778,
|
|
"num_tokens": 28821734.0,
|
|
"step": 11370
|
|
},
|
|
{
|
|
"entropy": 6.2617974281311035,
|
|
"epoch": 1.3127524523946912,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00048390675690844335,
|
|
"loss": 5.8399,
|
|
"mean_token_accuracy": 0.1810166746377945,
|
|
"num_tokens": 28834864.0,
|
|
"step": 11375
|
|
},
|
|
{
|
|
"entropy": 6.158445119857788,
|
|
"epoch": 1.3133294864397,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004838914279711764,
|
|
"loss": 5.8065,
|
|
"mean_token_accuracy": 0.18591468781232834,
|
|
"num_tokens": 28848154.0,
|
|
"step": 11380
|
|
},
|
|
{
|
|
"entropy": 6.175825357437134,
|
|
"epoch": 1.3139065204847085,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.00048387609200795003,
|
|
"loss": 5.8917,
|
|
"mean_token_accuracy": 0.18650826215744018,
|
|
"num_tokens": 28861562.0,
|
|
"step": 11385
|
|
},
|
|
{
|
|
"entropy": 6.272245788574219,
|
|
"epoch": 1.3144835545297173,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00048386074901928,
|
|
"loss": 5.8496,
|
|
"mean_token_accuracy": 0.18694826662540437,
|
|
"num_tokens": 28873921.0,
|
|
"step": 11390
|
|
},
|
|
{
|
|
"entropy": 6.255329275131226,
|
|
"epoch": 1.315060588574726,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004838453990056825,
|
|
"loss": 5.9349,
|
|
"mean_token_accuracy": 0.1798590064048767,
|
|
"num_tokens": 28886126.0,
|
|
"step": 11395
|
|
},
|
|
{
|
|
"entropy": 6.220553064346314,
|
|
"epoch": 1.3156376226197346,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048383004196767373,
|
|
"loss": 5.8019,
|
|
"mean_token_accuracy": 0.1911833941936493,
|
|
"num_tokens": 28897980.0,
|
|
"step": 11400
|
|
},
|
|
{
|
|
"entropy": 6.265301656723023,
|
|
"epoch": 1.3162146566647432,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004838146779057702,
|
|
"loss": 5.8514,
|
|
"mean_token_accuracy": 0.18370553553104402,
|
|
"num_tokens": 28910105.0,
|
|
"step": 11405
|
|
},
|
|
{
|
|
"entropy": 6.238138055801391,
|
|
"epoch": 1.3167916907097519,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004837993068204887,
|
|
"loss": 5.9089,
|
|
"mean_token_accuracy": 0.18176488429307938,
|
|
"num_tokens": 28922004.0,
|
|
"step": 11410
|
|
},
|
|
{
|
|
"entropy": 6.176228141784668,
|
|
"epoch": 1.3173687247547605,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.00048378392871234634,
|
|
"loss": 5.767,
|
|
"mean_token_accuracy": 0.19638804495334625,
|
|
"num_tokens": 28935990.0,
|
|
"step": 11415
|
|
},
|
|
{
|
|
"entropy": 6.256175231933594,
|
|
"epoch": 1.3179457587997692,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004837685435818601,
|
|
"loss": 5.8387,
|
|
"mean_token_accuracy": 0.1891574367880821,
|
|
"num_tokens": 28948274.0,
|
|
"step": 11420
|
|
},
|
|
{
|
|
"entropy": 6.233545589447021,
|
|
"epoch": 1.3185227928447778,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004837531514295477,
|
|
"loss": 5.9423,
|
|
"mean_token_accuracy": 0.17450683414936066,
|
|
"num_tokens": 28960101.0,
|
|
"step": 11425
|
|
},
|
|
{
|
|
"entropy": 6.260594320297241,
|
|
"epoch": 1.3190998268897864,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004837377522559267,
|
|
"loss": 5.9553,
|
|
"mean_token_accuracy": 0.18921227008104324,
|
|
"num_tokens": 28972408.0,
|
|
"step": 11430
|
|
},
|
|
{
|
|
"entropy": 6.249463510513306,
|
|
"epoch": 1.319676860934795,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.00048372234606151507,
|
|
"loss": 5.8905,
|
|
"mean_token_accuracy": 0.18161126375198364,
|
|
"num_tokens": 28985025.0,
|
|
"step": 11435
|
|
},
|
|
{
|
|
"entropy": 6.256546449661255,
|
|
"epoch": 1.3202538949798037,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00048370693284683106,
|
|
"loss": 5.9632,
|
|
"mean_token_accuracy": 0.18379874676465988,
|
|
"num_tokens": 28997568.0,
|
|
"step": 11440
|
|
},
|
|
{
|
|
"entropy": 6.281197547912598,
|
|
"epoch": 1.3208309290248126,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00048369151261239303,
|
|
"loss": 5.973,
|
|
"mean_token_accuracy": 0.17523153275251388,
|
|
"num_tokens": 29009567.0,
|
|
"step": 11445
|
|
},
|
|
{
|
|
"entropy": 6.239495086669922,
|
|
"epoch": 1.321407963069821,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004836760853587196,
|
|
"loss": 5.8738,
|
|
"mean_token_accuracy": 0.17971327304840087,
|
|
"num_tokens": 29021403.0,
|
|
"step": 11450
|
|
},
|
|
{
|
|
"entropy": 6.231962966918945,
|
|
"epoch": 1.3219849971148299,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00048366065108632967,
|
|
"loss": 5.8515,
|
|
"mean_token_accuracy": 0.1861049070954323,
|
|
"num_tokens": 29033430.0,
|
|
"step": 11455
|
|
},
|
|
{
|
|
"entropy": 6.187495756149292,
|
|
"epoch": 1.3225620311598385,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00048364520979574246,
|
|
"loss": 5.8723,
|
|
"mean_token_accuracy": 0.18128441423177719,
|
|
"num_tokens": 29045659.0,
|
|
"step": 11460
|
|
},
|
|
{
|
|
"entropy": 6.204320430755615,
|
|
"epoch": 1.3231390652048471,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00048362976148747715,
|
|
"loss": 5.8202,
|
|
"mean_token_accuracy": 0.1851746380329132,
|
|
"num_tokens": 29058962.0,
|
|
"step": 11465
|
|
},
|
|
{
|
|
"entropy": 6.236425065994263,
|
|
"epoch": 1.3237160992498558,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004836143061620536,
|
|
"loss": 5.7613,
|
|
"mean_token_accuracy": 0.1951758399605751,
|
|
"num_tokens": 29072009.0,
|
|
"step": 11470
|
|
},
|
|
{
|
|
"entropy": 6.150970411300659,
|
|
"epoch": 1.3242931332948644,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004835988438199914,
|
|
"loss": 5.7753,
|
|
"mean_token_accuracy": 0.19481099843978883,
|
|
"num_tokens": 29084174.0,
|
|
"step": 11475
|
|
},
|
|
{
|
|
"entropy": 6.225009822845459,
|
|
"epoch": 1.324870167339873,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004835833744618107,
|
|
"loss": 5.8656,
|
|
"mean_token_accuracy": 0.185127791762352,
|
|
"num_tokens": 29096189.0,
|
|
"step": 11480
|
|
},
|
|
{
|
|
"entropy": 6.202565431594849,
|
|
"epoch": 1.3254472013848817,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004835678980880318,
|
|
"loss": 5.8374,
|
|
"mean_token_accuracy": 0.18455548584461212,
|
|
"num_tokens": 29108212.0,
|
|
"step": 11485
|
|
},
|
|
{
|
|
"entropy": 6.263130712509155,
|
|
"epoch": 1.3260242354298903,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004835524146991753,
|
|
"loss": 5.8032,
|
|
"mean_token_accuracy": 0.19258994311094285,
|
|
"num_tokens": 29121058.0,
|
|
"step": 11490
|
|
},
|
|
{
|
|
"entropy": 6.197894430160522,
|
|
"epoch": 1.326601269474899,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00048353692429576185,
|
|
"loss": 5.9338,
|
|
"mean_token_accuracy": 0.1838608577847481,
|
|
"num_tokens": 29132981.0,
|
|
"step": 11495
|
|
},
|
|
{
|
|
"entropy": 6.250746345520019,
|
|
"epoch": 1.3271783035199076,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004835214268783126,
|
|
"loss": 5.8847,
|
|
"mean_token_accuracy": 0.18033799827098845,
|
|
"num_tokens": 29145143.0,
|
|
"step": 11500
|
|
},
|
|
{
|
|
"entropy": 6.2464357852935795,
|
|
"epoch": 1.3277553375649163,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00048350592244734866,
|
|
"loss": 5.8415,
|
|
"mean_token_accuracy": 0.18740762770175934,
|
|
"num_tokens": 29157548.0,
|
|
"step": 11505
|
|
},
|
|
{
|
|
"entropy": 6.139885425567627,
|
|
"epoch": 1.3283323716099251,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004834904110033917,
|
|
"loss": 5.7547,
|
|
"mean_token_accuracy": 0.195901720225811,
|
|
"num_tokens": 29170243.0,
|
|
"step": 11510
|
|
},
|
|
{
|
|
"entropy": 6.218726301193238,
|
|
"epoch": 1.3289094056549335,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00048347489254696327,
|
|
"loss": 5.8636,
|
|
"mean_token_accuracy": 0.18377334475517274,
|
|
"num_tokens": 29181769.0,
|
|
"step": 11515
|
|
},
|
|
{
|
|
"entropy": 6.258484029769898,
|
|
"epoch": 1.3294864396999424,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004834593670785854,
|
|
"loss": 5.9648,
|
|
"mean_token_accuracy": 0.17879902422428132,
|
|
"num_tokens": 29194196.0,
|
|
"step": 11520
|
|
},
|
|
{
|
|
"entropy": 6.22721004486084,
|
|
"epoch": 1.3300634737449508,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00048344383459878024,
|
|
"loss": 5.8595,
|
|
"mean_token_accuracy": 0.18442352563142778,
|
|
"num_tokens": 29206101.0,
|
|
"step": 11525
|
|
},
|
|
{
|
|
"entropy": 6.183701848983764,
|
|
"epoch": 1.3306405077899597,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00048342829510807024,
|
|
"loss": 5.836,
|
|
"mean_token_accuracy": 0.18734344989061355,
|
|
"num_tokens": 29217851.0,
|
|
"step": 11530
|
|
},
|
|
{
|
|
"entropy": 6.154987382888794,
|
|
"epoch": 1.3312175418349683,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.000483412748606978,
|
|
"loss": 5.8028,
|
|
"mean_token_accuracy": 0.19526472836732864,
|
|
"num_tokens": 29231497.0,
|
|
"step": 11535
|
|
},
|
|
{
|
|
"entropy": 6.315514087677002,
|
|
"epoch": 1.331794575879977,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004833971950960266,
|
|
"loss": 5.9461,
|
|
"mean_token_accuracy": 0.18248422145843507,
|
|
"num_tokens": 29245227.0,
|
|
"step": 11540
|
|
},
|
|
{
|
|
"entropy": 6.224634885787964,
|
|
"epoch": 1.3323716099249856,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004833816345757391,
|
|
"loss": 5.8547,
|
|
"mean_token_accuracy": 0.1854404926300049,
|
|
"num_tokens": 29259403.0,
|
|
"step": 11545
|
|
},
|
|
{
|
|
"entropy": 6.249810361862183,
|
|
"epoch": 1.3329486439699942,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004833660670466387,
|
|
"loss": 5.8565,
|
|
"mean_token_accuracy": 0.18590396046638488,
|
|
"num_tokens": 29270938.0,
|
|
"step": 11550
|
|
},
|
|
{
|
|
"entropy": 6.258982610702515,
|
|
"epoch": 1.3335256780150029,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004833504925092492,
|
|
"loss": 5.8566,
|
|
"mean_token_accuracy": 0.19000206291675567,
|
|
"num_tokens": 29284078.0,
|
|
"step": 11555
|
|
},
|
|
{
|
|
"entropy": 6.223692846298218,
|
|
"epoch": 1.3341027120600115,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004833349109640944,
|
|
"loss": 5.8385,
|
|
"mean_token_accuracy": 0.1834432601928711,
|
|
"num_tokens": 29295698.0,
|
|
"step": 11560
|
|
},
|
|
{
|
|
"entropy": 6.235724020004272,
|
|
"epoch": 1.3346797461050202,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004833193224116983,
|
|
"loss": 5.8652,
|
|
"mean_token_accuracy": 0.1862700179219246,
|
|
"num_tokens": 29307585.0,
|
|
"step": 11565
|
|
},
|
|
{
|
|
"entropy": 6.237357521057129,
|
|
"epoch": 1.3352567801500288,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048330372685258526,
|
|
"loss": 5.8703,
|
|
"mean_token_accuracy": 0.18552322387695314,
|
|
"num_tokens": 29321027.0,
|
|
"step": 11570
|
|
},
|
|
{
|
|
"entropy": 6.273429441452026,
|
|
"epoch": 1.3358338141950374,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004832881242872799,
|
|
"loss": 5.9237,
|
|
"mean_token_accuracy": 0.1840517833828926,
|
|
"num_tokens": 29333121.0,
|
|
"step": 11575
|
|
},
|
|
{
|
|
"entropy": 6.21780743598938,
|
|
"epoch": 1.336410848240046,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004832725147163069,
|
|
"loss": 5.894,
|
|
"mean_token_accuracy": 0.1825244978070259,
|
|
"num_tokens": 29346120.0,
|
|
"step": 11580
|
|
},
|
|
{
|
|
"entropy": 6.25745325088501,
|
|
"epoch": 1.336987882285055,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00048325689814019134,
|
|
"loss": 5.8643,
|
|
"mean_token_accuracy": 0.18377418518066407,
|
|
"num_tokens": 29357872.0,
|
|
"step": 11585
|
|
},
|
|
{
|
|
"entropy": 6.281948804855347,
|
|
"epoch": 1.3375649163300634,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004832412745594585,
|
|
"loss": 5.9228,
|
|
"mean_token_accuracy": 0.18576952517032624,
|
|
"num_tokens": 29370657.0,
|
|
"step": 11590
|
|
},
|
|
{
|
|
"entropy": 6.170208215713501,
|
|
"epoch": 1.3381419503750722,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00048322564397463376,
|
|
"loss": 5.8472,
|
|
"mean_token_accuracy": 0.19092058688402175,
|
|
"num_tokens": 29384880.0,
|
|
"step": 11595
|
|
},
|
|
{
|
|
"entropy": 6.258925104141236,
|
|
"epoch": 1.3387189844200809,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00048321000638624296,
|
|
"loss": 5.8543,
|
|
"mean_token_accuracy": 0.18395190089941024,
|
|
"num_tokens": 29397215.0,
|
|
"step": 11600
|
|
},
|
|
{
|
|
"entropy": 6.2219925880432125,
|
|
"epoch": 1.3392960184650895,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000483194361794812,
|
|
"loss": 5.8089,
|
|
"mean_token_accuracy": 0.19121019542217255,
|
|
"num_tokens": 29409634.0,
|
|
"step": 11605
|
|
},
|
|
{
|
|
"entropy": 6.226755666732788,
|
|
"epoch": 1.3398730525100981,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.000483178710200867,
|
|
"loss": 5.7865,
|
|
"mean_token_accuracy": 0.19461841881275177,
|
|
"num_tokens": 29422404.0,
|
|
"step": 11610
|
|
},
|
|
{
|
|
"entropy": 6.2323966979980465,
|
|
"epoch": 1.3404500865551068,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004831630516049346,
|
|
"loss": 5.9668,
|
|
"mean_token_accuracy": 0.18530030250549318,
|
|
"num_tokens": 29434727.0,
|
|
"step": 11615
|
|
},
|
|
{
|
|
"entropy": 6.253775358200073,
|
|
"epoch": 1.3410271206001154,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004831473860075414,
|
|
"loss": 5.8695,
|
|
"mean_token_accuracy": 0.18326867818832399,
|
|
"num_tokens": 29447176.0,
|
|
"step": 11620
|
|
},
|
|
{
|
|
"entropy": 6.214875221252441,
|
|
"epoch": 1.341604154645124,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00048313171340921417,
|
|
"loss": 5.8307,
|
|
"mean_token_accuracy": 0.1961693212389946,
|
|
"num_tokens": 29460080.0,
|
|
"step": 11625
|
|
},
|
|
{
|
|
"entropy": 6.183676052093506,
|
|
"epoch": 1.3421811886901327,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00048311603381048025,
|
|
"loss": 5.8363,
|
|
"mean_token_accuracy": 0.19140980392694473,
|
|
"num_tokens": 29472503.0,
|
|
"step": 11630
|
|
},
|
|
{
|
|
"entropy": 6.234938287734986,
|
|
"epoch": 1.3427582227351413,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004831003472118668,
|
|
"loss": 5.8351,
|
|
"mean_token_accuracy": 0.18842962384223938,
|
|
"num_tokens": 29485139.0,
|
|
"step": 11635
|
|
},
|
|
{
|
|
"entropy": 6.310397815704346,
|
|
"epoch": 1.34333525678015,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004830846536139016,
|
|
"loss": 5.9381,
|
|
"mean_token_accuracy": 0.18417907506227493,
|
|
"num_tokens": 29497455.0,
|
|
"step": 11640
|
|
},
|
|
{
|
|
"entropy": 6.260405540466309,
|
|
"epoch": 1.3439122908251586,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004830689530171124,
|
|
"loss": 5.8747,
|
|
"mean_token_accuracy": 0.1892422318458557,
|
|
"num_tokens": 29509859.0,
|
|
"step": 11645
|
|
},
|
|
{
|
|
"entropy": 6.264926242828369,
|
|
"epoch": 1.3444893248701673,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004830532454220273,
|
|
"loss": 5.9185,
|
|
"mean_token_accuracy": 0.18690085262060166,
|
|
"num_tokens": 29523117.0,
|
|
"step": 11650
|
|
},
|
|
{
|
|
"entropy": 6.162897396087646,
|
|
"epoch": 1.345066358915176,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.00048303753082917474,
|
|
"loss": 5.8265,
|
|
"mean_token_accuracy": 0.19078432023525238,
|
|
"num_tokens": 29535943.0,
|
|
"step": 11655
|
|
},
|
|
{
|
|
"entropy": 6.277468681335449,
|
|
"epoch": 1.3456433929601848,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048302180923908306,
|
|
"loss": 5.9204,
|
|
"mean_token_accuracy": 0.18410737067461014,
|
|
"num_tokens": 29549036.0,
|
|
"step": 11660
|
|
},
|
|
{
|
|
"entropy": 6.163658857345581,
|
|
"epoch": 1.3462204270051932,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00048300608065228126,
|
|
"loss": 5.8297,
|
|
"mean_token_accuracy": 0.1890963688492775,
|
|
"num_tokens": 29563465.0,
|
|
"step": 11665
|
|
},
|
|
{
|
|
"entropy": 6.210170888900757,
|
|
"epoch": 1.346797461050202,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048299034506929815,
|
|
"loss": 5.7719,
|
|
"mean_token_accuracy": 0.19281139075756074,
|
|
"num_tokens": 29575891.0,
|
|
"step": 11670
|
|
},
|
|
{
|
|
"entropy": 6.244243478775024,
|
|
"epoch": 1.3473744950952107,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048297460249066315,
|
|
"loss": 5.9787,
|
|
"mean_token_accuracy": 0.17319456934928895,
|
|
"num_tokens": 29589162.0,
|
|
"step": 11675
|
|
},
|
|
{
|
|
"entropy": 6.291163921356201,
|
|
"epoch": 1.3479515291402193,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004829588529169057,
|
|
"loss": 5.8233,
|
|
"mean_token_accuracy": 0.1888448789715767,
|
|
"num_tokens": 29602735.0,
|
|
"step": 11680
|
|
},
|
|
{
|
|
"entropy": 6.167922639846802,
|
|
"epoch": 1.348528563185228,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004829430963485555,
|
|
"loss": 5.7813,
|
|
"mean_token_accuracy": 0.19492802619934083,
|
|
"num_tokens": 29615683.0,
|
|
"step": 11685
|
|
},
|
|
{
|
|
"entropy": 6.25222225189209,
|
|
"epoch": 1.3491055972302366,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004829273327861426,
|
|
"loss": 5.8556,
|
|
"mean_token_accuracy": 0.18927911818027496,
|
|
"num_tokens": 29629606.0,
|
|
"step": 11690
|
|
},
|
|
{
|
|
"entropy": 6.201506853103638,
|
|
"epoch": 1.3496826312752452,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004829115622301971,
|
|
"loss": 5.838,
|
|
"mean_token_accuracy": 0.19121850728988649,
|
|
"num_tokens": 29642250.0,
|
|
"step": 11695
|
|
},
|
|
{
|
|
"entropy": 6.28028507232666,
|
|
"epoch": 1.3502596653202539,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.00048289578468124956,
|
|
"loss": 5.9316,
|
|
"mean_token_accuracy": 0.1848507806658745,
|
|
"num_tokens": 29655689.0,
|
|
"step": 11700
|
|
},
|
|
{
|
|
"entropy": 6.116147565841675,
|
|
"epoch": 1.3508366993652625,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00048288000013983046,
|
|
"loss": 5.8409,
|
|
"mean_token_accuracy": 0.182951357960701,
|
|
"num_tokens": 29670084.0,
|
|
"step": 11705
|
|
},
|
|
{
|
|
"entropy": 6.25054349899292,
|
|
"epoch": 1.3514137334102712,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00048286420860647086,
|
|
"loss": 5.8952,
|
|
"mean_token_accuracy": 0.19066344499588012,
|
|
"num_tokens": 29683453.0,
|
|
"step": 11710
|
|
},
|
|
{
|
|
"entropy": 6.269110584259034,
|
|
"epoch": 1.3519907674552798,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00048284841008170185,
|
|
"loss": 5.8098,
|
|
"mean_token_accuracy": 0.18684105575084686,
|
|
"num_tokens": 29695514.0,
|
|
"step": 11715
|
|
},
|
|
{
|
|
"entropy": 6.265933084487915,
|
|
"epoch": 1.3525678015002884,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.00048283260456605487,
|
|
"loss": 5.8765,
|
|
"mean_token_accuracy": 0.18586160689592363,
|
|
"num_tokens": 29708544.0,
|
|
"step": 11720
|
|
},
|
|
{
|
|
"entropy": 6.3004742622375485,
|
|
"epoch": 1.3531448355452973,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004828167920600614,
|
|
"loss": 5.8174,
|
|
"mean_token_accuracy": 0.18437671512365342,
|
|
"num_tokens": 29721310.0,
|
|
"step": 11725
|
|
},
|
|
{
|
|
"entropy": 6.225083684921264,
|
|
"epoch": 1.3537218695903057,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004828009725642534,
|
|
"loss": 5.8666,
|
|
"mean_token_accuracy": 0.18544016480445863,
|
|
"num_tokens": 29733995.0,
|
|
"step": 11730
|
|
},
|
|
{
|
|
"entropy": 6.239916563034058,
|
|
"epoch": 1.3542989036353146,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004827851460791628,
|
|
"loss": 5.9539,
|
|
"mean_token_accuracy": 0.17822468280792236,
|
|
"num_tokens": 29745896.0,
|
|
"step": 11735
|
|
},
|
|
{
|
|
"entropy": 6.290875339508057,
|
|
"epoch": 1.3548759376803232,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00048276931260532213,
|
|
"loss": 5.8275,
|
|
"mean_token_accuracy": 0.18893493413925172,
|
|
"num_tokens": 29758967.0,
|
|
"step": 11740
|
|
},
|
|
{
|
|
"entropy": 6.263391494750977,
|
|
"epoch": 1.3554529717253319,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004827534721432639,
|
|
"loss": 5.8954,
|
|
"mean_token_accuracy": 0.17974050343036652,
|
|
"num_tokens": 29772167.0,
|
|
"step": 11745
|
|
},
|
|
{
|
|
"entropy": 6.1805259704589846,
|
|
"epoch": 1.3560300057703405,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004827376246935207,
|
|
"loss": 5.825,
|
|
"mean_token_accuracy": 0.18858230412006377,
|
|
"num_tokens": 29783841.0,
|
|
"step": 11750
|
|
},
|
|
{
|
|
"entropy": 6.261368370056152,
|
|
"epoch": 1.3566070398153491,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004827217702566257,
|
|
"loss": 5.9518,
|
|
"mean_token_accuracy": 0.18142978847026825,
|
|
"num_tokens": 29795993.0,
|
|
"step": 11755
|
|
},
|
|
{
|
|
"entropy": 6.229633855819702,
|
|
"epoch": 1.3571840738603578,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00048270590883311217,
|
|
"loss": 5.8547,
|
|
"mean_token_accuracy": 0.19509654194116594,
|
|
"num_tokens": 29807692.0,
|
|
"step": 11760
|
|
},
|
|
{
|
|
"entropy": 6.246022510528564,
|
|
"epoch": 1.3577611079053664,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00048269004042351363,
|
|
"loss": 5.9361,
|
|
"mean_token_accuracy": 0.18227415829896926,
|
|
"num_tokens": 29820778.0,
|
|
"step": 11765
|
|
},
|
|
{
|
|
"entropy": 6.227572441101074,
|
|
"epoch": 1.358338141950375,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004826741650283637,
|
|
"loss": 5.8178,
|
|
"mean_token_accuracy": 0.18706079721450805,
|
|
"num_tokens": 29833976.0,
|
|
"step": 11770
|
|
},
|
|
{
|
|
"entropy": 6.193403339385986,
|
|
"epoch": 1.3589151759953837,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004826582826481963,
|
|
"loss": 5.8272,
|
|
"mean_token_accuracy": 0.1925640806555748,
|
|
"num_tokens": 29846226.0,
|
|
"step": 11775
|
|
},
|
|
{
|
|
"entropy": 6.178399324417114,
|
|
"epoch": 1.3594922100403923,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004826423932835458,
|
|
"loss": 5.8157,
|
|
"mean_token_accuracy": 0.19034133553504945,
|
|
"num_tokens": 29858483.0,
|
|
"step": 11780
|
|
},
|
|
{
|
|
"entropy": 6.2385763168334964,
|
|
"epoch": 1.360069244085401,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.00048262649693494653,
|
|
"loss": 5.8547,
|
|
"mean_token_accuracy": 0.18518402725458144,
|
|
"num_tokens": 29871178.0,
|
|
"step": 11785
|
|
},
|
|
{
|
|
"entropy": 6.2989908218383786,
|
|
"epoch": 1.3606462781304096,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004826105936029332,
|
|
"loss": 5.9334,
|
|
"mean_token_accuracy": 0.17897191941738128,
|
|
"num_tokens": 29885477.0,
|
|
"step": 11790
|
|
},
|
|
{
|
|
"entropy": 6.24438328742981,
|
|
"epoch": 1.3612233121754183,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004825946832880406,
|
|
"loss": 5.8913,
|
|
"mean_token_accuracy": 0.17726410627365113,
|
|
"num_tokens": 29897917.0,
|
|
"step": 11795
|
|
},
|
|
{
|
|
"entropy": 6.250182342529297,
|
|
"epoch": 1.3618003462204271,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00048257876599080404,
|
|
"loss": 5.9065,
|
|
"mean_token_accuracy": 0.1838986322283745,
|
|
"num_tokens": 29911321.0,
|
|
"step": 11800
|
|
},
|
|
{
|
|
"entropy": 6.223178100585938,
|
|
"epoch": 1.3623773802654355,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00048256284171175874,
|
|
"loss": 5.8162,
|
|
"mean_token_accuracy": 0.1923563465476036,
|
|
"num_tokens": 29924651.0,
|
|
"step": 11805
|
|
},
|
|
{
|
|
"entropy": 6.130005931854248,
|
|
"epoch": 1.3629544143104444,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.00048254691045144035,
|
|
"loss": 5.7646,
|
|
"mean_token_accuracy": 0.19032905250787735,
|
|
"num_tokens": 29937334.0,
|
|
"step": 11810
|
|
},
|
|
{
|
|
"entropy": 6.1727530002594,
|
|
"epoch": 1.363531448355453,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004825309722103848,
|
|
"loss": 5.8041,
|
|
"mean_token_accuracy": 0.1924701526761055,
|
|
"num_tokens": 29949751.0,
|
|
"step": 11815
|
|
},
|
|
{
|
|
"entropy": 6.165993022918701,
|
|
"epoch": 1.3641084824004617,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.000482515026989128,
|
|
"loss": 5.8309,
|
|
"mean_token_accuracy": 0.19365983903408052,
|
|
"num_tokens": 29961675.0,
|
|
"step": 11820
|
|
},
|
|
{
|
|
"entropy": 6.295892810821533,
|
|
"epoch": 1.3646855164454703,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00048249907478820634,
|
|
"loss": 5.9528,
|
|
"mean_token_accuracy": 0.17994977831840514,
|
|
"num_tokens": 29973222.0,
|
|
"step": 11825
|
|
},
|
|
{
|
|
"entropy": 6.31345272064209,
|
|
"epoch": 1.365262550490479,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.00048248311560815637,
|
|
"loss": 5.959,
|
|
"mean_token_accuracy": 0.17840566635131835,
|
|
"num_tokens": 29985845.0,
|
|
"step": 11830
|
|
},
|
|
{
|
|
"entropy": 6.251032972335816,
|
|
"epoch": 1.3658395845354876,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004824671494495149,
|
|
"loss": 5.895,
|
|
"mean_token_accuracy": 0.18573582470417022,
|
|
"num_tokens": 29998252.0,
|
|
"step": 11835
|
|
},
|
|
{
|
|
"entropy": 6.248889064788818,
|
|
"epoch": 1.3664166185804962,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004824511763128189,
|
|
"loss": 5.861,
|
|
"mean_token_accuracy": 0.18926439434289932,
|
|
"num_tokens": 30011150.0,
|
|
"step": 11840
|
|
},
|
|
{
|
|
"entropy": 6.287919282913208,
|
|
"epoch": 1.3669936526255049,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.00048243519619860567,
|
|
"loss": 5.9662,
|
|
"mean_token_accuracy": 0.17687484472990037,
|
|
"num_tokens": 30024750.0,
|
|
"step": 11845
|
|
},
|
|
{
|
|
"entropy": 6.197072124481201,
|
|
"epoch": 1.3675706866705135,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004824192091074126,
|
|
"loss": 5.7818,
|
|
"mean_token_accuracy": 0.19744647443294525,
|
|
"num_tokens": 30038317.0,
|
|
"step": 11850
|
|
},
|
|
{
|
|
"entropy": 6.201137447357178,
|
|
"epoch": 1.3681477207155222,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004824032150397775,
|
|
"loss": 5.9135,
|
|
"mean_token_accuracy": 0.19055497795343398,
|
|
"num_tokens": 30052156.0,
|
|
"step": 11855
|
|
},
|
|
{
|
|
"entropy": 6.2688305377960205,
|
|
"epoch": 1.3687247547605308,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00048238721399623824,
|
|
"loss": 5.8899,
|
|
"mean_token_accuracy": 0.1839185744524002,
|
|
"num_tokens": 30063463.0,
|
|
"step": 11860
|
|
},
|
|
{
|
|
"entropy": 6.20152473449707,
|
|
"epoch": 1.3693017888055397,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00048237120597733316,
|
|
"loss": 5.8278,
|
|
"mean_token_accuracy": 0.19133645594120025,
|
|
"num_tokens": 30075090.0,
|
|
"step": 11865
|
|
},
|
|
{
|
|
"entropy": 6.1734706401824955,
|
|
"epoch": 1.369878822850548,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004823551909836005,
|
|
"loss": 5.8125,
|
|
"mean_token_accuracy": 0.18438569009304046,
|
|
"num_tokens": 30087618.0,
|
|
"step": 11870
|
|
},
|
|
{
|
|
"entropy": 6.269489002227783,
|
|
"epoch": 1.370455856895557,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00048233916901557896,
|
|
"loss": 5.847,
|
|
"mean_token_accuracy": 0.18638927936553956,
|
|
"num_tokens": 30098781.0,
|
|
"step": 11875
|
|
},
|
|
{
|
|
"entropy": 6.193616151809692,
|
|
"epoch": 1.3710328909405656,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00048232314007380753,
|
|
"loss": 5.8945,
|
|
"mean_token_accuracy": 0.1961129903793335,
|
|
"num_tokens": 30111163.0,
|
|
"step": 11880
|
|
},
|
|
{
|
|
"entropy": 6.20051646232605,
|
|
"epoch": 1.3716099249855742,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00048230710415882524,
|
|
"loss": 5.8787,
|
|
"mean_token_accuracy": 0.18906668871641158,
|
|
"num_tokens": 30124609.0,
|
|
"step": 11885
|
|
},
|
|
{
|
|
"entropy": 6.268427467346191,
|
|
"epoch": 1.3721869590305829,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00048229106127117144,
|
|
"loss": 5.9442,
|
|
"mean_token_accuracy": 0.18480219542980195,
|
|
"num_tokens": 30137823.0,
|
|
"step": 11890
|
|
},
|
|
{
|
|
"entropy": 6.26952748298645,
|
|
"epoch": 1.3727639930755915,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004822750114113858,
|
|
"loss": 5.8328,
|
|
"mean_token_accuracy": 0.18708803802728652,
|
|
"num_tokens": 30150295.0,
|
|
"step": 11895
|
|
},
|
|
{
|
|
"entropy": 6.1457456111907955,
|
|
"epoch": 1.3733410271206001,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004822589545800081,
|
|
"loss": 5.8049,
|
|
"mean_token_accuracy": 0.18936679661273956,
|
|
"num_tokens": 30163533.0,
|
|
"step": 11900
|
|
},
|
|
{
|
|
"entropy": 6.278868198394775,
|
|
"epoch": 1.3739180611656088,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004822428907775784,
|
|
"loss": 5.8765,
|
|
"mean_token_accuracy": 0.18396926969289779,
|
|
"num_tokens": 30176437.0,
|
|
"step": 11905
|
|
},
|
|
{
|
|
"entropy": 6.214042472839355,
|
|
"epoch": 1.3744950952106174,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048222682000463704,
|
|
"loss": 5.803,
|
|
"mean_token_accuracy": 0.1939064934849739,
|
|
"num_tokens": 30190181.0,
|
|
"step": 11910
|
|
},
|
|
{
|
|
"entropy": 6.17984972000122,
|
|
"epoch": 1.375072129255626,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004822107422617245,
|
|
"loss": 5.8492,
|
|
"mean_token_accuracy": 0.1890665829181671,
|
|
"num_tokens": 30202374.0,
|
|
"step": 11915
|
|
},
|
|
{
|
|
"entropy": 6.156255531311035,
|
|
"epoch": 1.3756491633006347,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00048219465754938156,
|
|
"loss": 5.7737,
|
|
"mean_token_accuracy": 0.18826987594366074,
|
|
"num_tokens": 30215009.0,
|
|
"step": 11920
|
|
},
|
|
{
|
|
"entropy": 6.279652118682861,
|
|
"epoch": 1.3762261973456433,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00048217856586814926,
|
|
"loss": 5.88,
|
|
"mean_token_accuracy": 0.18167006224393845,
|
|
"num_tokens": 30226688.0,
|
|
"step": 11925
|
|
},
|
|
{
|
|
"entropy": 6.277508211135864,
|
|
"epoch": 1.376803231390652,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00048216246721856875,
|
|
"loss": 5.9408,
|
|
"mean_token_accuracy": 0.18304099887609482,
|
|
"num_tokens": 30238501.0,
|
|
"step": 11930
|
|
},
|
|
{
|
|
"entropy": 6.257796669006348,
|
|
"epoch": 1.3773802654356606,
|
|
"grad_norm": 1.7265625,
|
|
"learning_rate": 0.00048214636160118164,
|
|
"loss": 5.8067,
|
|
"mean_token_accuracy": 0.19265892803668977,
|
|
"num_tokens": 30250216.0,
|
|
"step": 11935
|
|
},
|
|
{
|
|
"entropy": 6.2177825450897215,
|
|
"epoch": 1.3779572994806695,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004821302490165295,
|
|
"loss": 5.8605,
|
|
"mean_token_accuracy": 0.18837961107492446,
|
|
"num_tokens": 30262555.0,
|
|
"step": 11940
|
|
},
|
|
{
|
|
"entropy": 6.170514822006226,
|
|
"epoch": 1.378534333525678,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004821141294651544,
|
|
"loss": 5.7819,
|
|
"mean_token_accuracy": 0.19309227615594865,
|
|
"num_tokens": 30274593.0,
|
|
"step": 11945
|
|
},
|
|
{
|
|
"entropy": 6.200426197052002,
|
|
"epoch": 1.3791113675706868,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00048209800294759836,
|
|
"loss": 5.7778,
|
|
"mean_token_accuracy": 0.19841670393943786,
|
|
"num_tokens": 30286579.0,
|
|
"step": 11950
|
|
},
|
|
{
|
|
"entropy": 6.261295652389526,
|
|
"epoch": 1.3796884016156954,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004820818694644039,
|
|
"loss": 5.8622,
|
|
"mean_token_accuracy": 0.18498462438583374,
|
|
"num_tokens": 30299186.0,
|
|
"step": 11955
|
|
},
|
|
{
|
|
"entropy": 6.345550584793091,
|
|
"epoch": 1.380265435660704,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048206572901611364,
|
|
"loss": 5.9244,
|
|
"mean_token_accuracy": 0.18031724393367768,
|
|
"num_tokens": 30311429.0,
|
|
"step": 11960
|
|
},
|
|
{
|
|
"entropy": 6.304241085052491,
|
|
"epoch": 1.3808424697057127,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00048204958160327034,
|
|
"loss": 5.8993,
|
|
"mean_token_accuracy": 0.18167479634284972,
|
|
"num_tokens": 30323323.0,
|
|
"step": 11965
|
|
},
|
|
{
|
|
"entropy": 6.236213731765747,
|
|
"epoch": 1.3814195037507213,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00048203342722641726,
|
|
"loss": 5.8821,
|
|
"mean_token_accuracy": 0.18929619193077088,
|
|
"num_tokens": 30335815.0,
|
|
"step": 11970
|
|
},
|
|
{
|
|
"entropy": 6.213303899765014,
|
|
"epoch": 1.38199653779573,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00048201726588609776,
|
|
"loss": 5.786,
|
|
"mean_token_accuracy": 0.18967500627040862,
|
|
"num_tokens": 30347426.0,
|
|
"step": 11975
|
|
},
|
|
{
|
|
"entropy": 6.25053596496582,
|
|
"epoch": 1.3825735718407386,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.00048200109758285534,
|
|
"loss": 5.8717,
|
|
"mean_token_accuracy": 0.18591604977846146,
|
|
"num_tokens": 30359781.0,
|
|
"step": 11980
|
|
},
|
|
{
|
|
"entropy": 6.257670783996582,
|
|
"epoch": 1.3831506058857472,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0004819849223172337,
|
|
"loss": 5.8721,
|
|
"mean_token_accuracy": 0.18719411343336106,
|
|
"num_tokens": 30373399.0,
|
|
"step": 11985
|
|
},
|
|
{
|
|
"entropy": 6.16593222618103,
|
|
"epoch": 1.3837276399307559,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00048196874008977716,
|
|
"loss": 5.8336,
|
|
"mean_token_accuracy": 0.1932594060897827,
|
|
"num_tokens": 30386296.0,
|
|
"step": 11990
|
|
},
|
|
{
|
|
"entropy": 6.265296363830567,
|
|
"epoch": 1.3843046739757645,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004819525509010298,
|
|
"loss": 5.8941,
|
|
"mean_token_accuracy": 0.190611732006073,
|
|
"num_tokens": 30399496.0,
|
|
"step": 11995
|
|
},
|
|
{
|
|
"entropy": 6.225067758560181,
|
|
"epoch": 1.3848817080207732,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004819363547515361,
|
|
"loss": 5.7934,
|
|
"mean_token_accuracy": 0.188978311419487,
|
|
"num_tokens": 30412491.0,
|
|
"step": 12000
|
|
},
|
|
{
|
|
"epoch": 1.3848817080207732,
|
|
"eval_entropy": 6.072817668204352,
|
|
"eval_loss": 5.934172630310059,
|
|
"eval_mean_token_accuracy": 0.1899097032309053,
|
|
"eval_num_tokens": 30412491.0,
|
|
"eval_runtime": 17.6284,
|
|
"eval_samples_per_second": 1596.06,
|
|
"eval_steps_per_second": 199.508,
|
|
"step": 12000
|
|
},
|
|
{
|
|
"entropy": 6.301853895187378,
|
|
"epoch": 1.385458742065782,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.000481920151641841,
|
|
"loss": 5.9354,
|
|
"mean_token_accuracy": 0.18052596896886824,
|
|
"num_tokens": 30427600.0,
|
|
"step": 12005
|
|
},
|
|
{
|
|
"entropy": 6.260950231552124,
|
|
"epoch": 1.3860357761107904,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048190394157248935,
|
|
"loss": 5.8174,
|
|
"mean_token_accuracy": 0.19201486110687255,
|
|
"num_tokens": 30440534.0,
|
|
"step": 12010
|
|
},
|
|
{
|
|
"entropy": 6.197269535064697,
|
|
"epoch": 1.3866128101557993,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004818877245440264,
|
|
"loss": 5.8068,
|
|
"mean_token_accuracy": 0.19823089689016343,
|
|
"num_tokens": 30453996.0,
|
|
"step": 12015
|
|
},
|
|
{
|
|
"entropy": 6.251287364959717,
|
|
"epoch": 1.3871898442008077,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00048187150055699763,
|
|
"loss": 5.8891,
|
|
"mean_token_accuracy": 0.18284614086151124,
|
|
"num_tokens": 30465667.0,
|
|
"step": 12020
|
|
},
|
|
{
|
|
"entropy": 6.2809501647949215,
|
|
"epoch": 1.3877668782458166,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004818552696119487,
|
|
"loss": 5.9209,
|
|
"mean_token_accuracy": 0.18133794516324997,
|
|
"num_tokens": 30478950.0,
|
|
"step": 12025
|
|
},
|
|
{
|
|
"entropy": 6.175559759140015,
|
|
"epoch": 1.3883439122908252,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004818390317094255,
|
|
"loss": 5.7649,
|
|
"mean_token_accuracy": 0.19492525309324266,
|
|
"num_tokens": 30490979.0,
|
|
"step": 12030
|
|
},
|
|
{
|
|
"entropy": 6.242245292663574,
|
|
"epoch": 1.3889209463358339,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004818227868499742,
|
|
"loss": 5.8052,
|
|
"mean_token_accuracy": 0.19470774233341218,
|
|
"num_tokens": 30504242.0,
|
|
"step": 12035
|
|
},
|
|
{
|
|
"entropy": 6.216363430023193,
|
|
"epoch": 1.3894979803808425,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004818065350341412,
|
|
"loss": 5.9003,
|
|
"mean_token_accuracy": 0.18019478619098664,
|
|
"num_tokens": 30515739.0,
|
|
"step": 12040
|
|
},
|
|
{
|
|
"entropy": 6.287183237075806,
|
|
"epoch": 1.3900750144258511,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00048179027626247325,
|
|
"loss": 5.8576,
|
|
"mean_token_accuracy": 0.18424582928419114,
|
|
"num_tokens": 30528338.0,
|
|
"step": 12045
|
|
},
|
|
{
|
|
"entropy": 6.294361686706543,
|
|
"epoch": 1.3906520484708598,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004817740105355169,
|
|
"loss": 5.9078,
|
|
"mean_token_accuracy": 0.18659729063510894,
|
|
"num_tokens": 30540572.0,
|
|
"step": 12050
|
|
},
|
|
{
|
|
"entropy": 6.259363889694214,
|
|
"epoch": 1.3912290825158684,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00048175773785381947,
|
|
"loss": 5.9115,
|
|
"mean_token_accuracy": 0.1899486929178238,
|
|
"num_tokens": 30554317.0,
|
|
"step": 12055
|
|
},
|
|
{
|
|
"entropy": 6.24990553855896,
|
|
"epoch": 1.391806116560877,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00048174145821792833,
|
|
"loss": 5.8755,
|
|
"mean_token_accuracy": 0.1851966544985771,
|
|
"num_tokens": 30567177.0,
|
|
"step": 12060
|
|
},
|
|
{
|
|
"entropy": 6.32722430229187,
|
|
"epoch": 1.3923831506058857,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004817251716283908,
|
|
"loss": 5.8673,
|
|
"mean_token_accuracy": 0.18701709061861038,
|
|
"num_tokens": 30577948.0,
|
|
"step": 12065
|
|
},
|
|
{
|
|
"entropy": 6.19557638168335,
|
|
"epoch": 1.3929601846508943,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004817088780857548,
|
|
"loss": 5.8476,
|
|
"mean_token_accuracy": 0.18737161308526992,
|
|
"num_tokens": 30590548.0,
|
|
"step": 12070
|
|
},
|
|
{
|
|
"entropy": 6.2240033626556395,
|
|
"epoch": 1.393537218695903,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00048169257759056845,
|
|
"loss": 5.7913,
|
|
"mean_token_accuracy": 0.19839557707309724,
|
|
"num_tokens": 30602735.0,
|
|
"step": 12075
|
|
},
|
|
{
|
|
"entropy": 6.259526157379151,
|
|
"epoch": 1.3941142527409118,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048167627014337994,
|
|
"loss": 5.9117,
|
|
"mean_token_accuracy": 0.18355602622032166,
|
|
"num_tokens": 30615112.0,
|
|
"step": 12080
|
|
},
|
|
{
|
|
"entropy": 6.180841445922852,
|
|
"epoch": 1.3946912867859202,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00048165995574473764,
|
|
"loss": 5.835,
|
|
"mean_token_accuracy": 0.1852560117840767,
|
|
"num_tokens": 30627406.0,
|
|
"step": 12085
|
|
},
|
|
{
|
|
"entropy": 6.213917303085327,
|
|
"epoch": 1.395268320830929,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00048164363439519043,
|
|
"loss": 5.8516,
|
|
"mean_token_accuracy": 0.19082715213298798,
|
|
"num_tokens": 30639764.0,
|
|
"step": 12090
|
|
},
|
|
{
|
|
"entropy": 6.253957509994507,
|
|
"epoch": 1.3958453548759377,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004816273060952873,
|
|
"loss": 5.8598,
|
|
"mean_token_accuracy": 0.18492789268493653,
|
|
"num_tokens": 30652181.0,
|
|
"step": 12095
|
|
},
|
|
{
|
|
"entropy": 6.233830738067627,
|
|
"epoch": 1.3964223889209464,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00048161097084557726,
|
|
"loss": 5.8424,
|
|
"mean_token_accuracy": 0.18780053853988649,
|
|
"num_tokens": 30663586.0,
|
|
"step": 12100
|
|
},
|
|
{
|
|
"entropy": 6.323609018325806,
|
|
"epoch": 1.396999422965955,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00048159462864660993,
|
|
"loss": 5.9321,
|
|
"mean_token_accuracy": 0.18068586885929108,
|
|
"num_tokens": 30676218.0,
|
|
"step": 12105
|
|
},
|
|
{
|
|
"entropy": 6.298351240158081,
|
|
"epoch": 1.3975764570109637,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004815782794989348,
|
|
"loss": 5.9088,
|
|
"mean_token_accuracy": 0.1828354611992836,
|
|
"num_tokens": 30688532.0,
|
|
"step": 12110
|
|
},
|
|
{
|
|
"entropy": 6.219765090942383,
|
|
"epoch": 1.3981534910559723,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004815619234031019,
|
|
"loss": 5.8698,
|
|
"mean_token_accuracy": 0.1810378611087799,
|
|
"num_tokens": 30700698.0,
|
|
"step": 12115
|
|
},
|
|
{
|
|
"entropy": 6.214390087127685,
|
|
"epoch": 1.398730525100981,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004815455603596613,
|
|
"loss": 5.8682,
|
|
"mean_token_accuracy": 0.1863407924771309,
|
|
"num_tokens": 30713032.0,
|
|
"step": 12120
|
|
},
|
|
{
|
|
"entropy": 6.20099720954895,
|
|
"epoch": 1.3993075591459896,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004815291903691634,
|
|
"loss": 5.8065,
|
|
"mean_token_accuracy": 0.19326940029859543,
|
|
"num_tokens": 30726829.0,
|
|
"step": 12125
|
|
},
|
|
{
|
|
"entropy": 6.300219249725342,
|
|
"epoch": 1.3998845931909982,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00048151281343215873,
|
|
"loss": 5.9029,
|
|
"mean_token_accuracy": 0.1824083521962166,
|
|
"num_tokens": 30740280.0,
|
|
"step": 12130
|
|
},
|
|
{
|
|
"entropy": 6.16341199874878,
|
|
"epoch": 1.4004616272360069,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004814964295491982,
|
|
"loss": 5.7467,
|
|
"mean_token_accuracy": 0.19635725021362305,
|
|
"num_tokens": 30753467.0,
|
|
"step": 12135
|
|
},
|
|
{
|
|
"entropy": 6.192393827438354,
|
|
"epoch": 1.4010386612810155,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00048148003872083286,
|
|
"loss": 5.8313,
|
|
"mean_token_accuracy": 0.19740188717842103,
|
|
"num_tokens": 30766958.0,
|
|
"step": 12140
|
|
},
|
|
{
|
|
"entropy": 6.251896476745605,
|
|
"epoch": 1.4016156953260244,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00048146364094761384,
|
|
"loss": 5.9156,
|
|
"mean_token_accuracy": 0.18174671679735183,
|
|
"num_tokens": 30779114.0,
|
|
"step": 12145
|
|
},
|
|
{
|
|
"entropy": 6.271113157272339,
|
|
"epoch": 1.4021927293710328,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00048144723623009297,
|
|
"loss": 5.813,
|
|
"mean_token_accuracy": 0.1902441129088402,
|
|
"num_tokens": 30792063.0,
|
|
"step": 12150
|
|
},
|
|
{
|
|
"entropy": 6.254286670684815,
|
|
"epoch": 1.4027697634160416,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004814308245688218,
|
|
"loss": 5.8958,
|
|
"mean_token_accuracy": 0.18653863221406936,
|
|
"num_tokens": 30804404.0,
|
|
"step": 12155
|
|
},
|
|
{
|
|
"entropy": 6.170608806610107,
|
|
"epoch": 1.40334679746105,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00048141440596435235,
|
|
"loss": 5.8196,
|
|
"mean_token_accuracy": 0.19177932739257814,
|
|
"num_tokens": 30817607.0,
|
|
"step": 12160
|
|
},
|
|
{
|
|
"entropy": 6.21555871963501,
|
|
"epoch": 1.403923831506059,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004813979804172369,
|
|
"loss": 5.893,
|
|
"mean_token_accuracy": 0.18380023390054703,
|
|
"num_tokens": 30831077.0,
|
|
"step": 12165
|
|
},
|
|
{
|
|
"entropy": 6.276795530319214,
|
|
"epoch": 1.4045008655510676,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048138154792802795,
|
|
"loss": 5.983,
|
|
"mean_token_accuracy": 0.18137128055095672,
|
|
"num_tokens": 30844096.0,
|
|
"step": 12170
|
|
},
|
|
{
|
|
"entropy": 6.295123624801636,
|
|
"epoch": 1.4050778995960762,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004813651084972781,
|
|
"loss": 5.8887,
|
|
"mean_token_accuracy": 0.18827279955148696,
|
|
"num_tokens": 30856147.0,
|
|
"step": 12175
|
|
},
|
|
{
|
|
"entropy": 6.258724975585937,
|
|
"epoch": 1.4056549336410848,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00048134866212554036,
|
|
"loss": 5.8853,
|
|
"mean_token_accuracy": 0.17940700948238372,
|
|
"num_tokens": 30869436.0,
|
|
"step": 12180
|
|
},
|
|
{
|
|
"entropy": 6.209239101409912,
|
|
"epoch": 1.4062319676860935,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004813322088133679,
|
|
"loss": 5.8189,
|
|
"mean_token_accuracy": 0.19204139113426208,
|
|
"num_tokens": 30882313.0,
|
|
"step": 12185
|
|
},
|
|
{
|
|
"entropy": 6.2562541484832765,
|
|
"epoch": 1.4068090017311021,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00048131574856131407,
|
|
"loss": 5.8396,
|
|
"mean_token_accuracy": 0.1857314497232437,
|
|
"num_tokens": 30895062.0,
|
|
"step": 12190
|
|
},
|
|
{
|
|
"entropy": 6.227566480636597,
|
|
"epoch": 1.4073860357761108,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004812992813699324,
|
|
"loss": 5.8386,
|
|
"mean_token_accuracy": 0.18683320432901382,
|
|
"num_tokens": 30907736.0,
|
|
"step": 12195
|
|
},
|
|
{
|
|
"entropy": 6.220577239990234,
|
|
"epoch": 1.4079630698211194,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.000481282807239777,
|
|
"loss": 5.8431,
|
|
"mean_token_accuracy": 0.19073092341423034,
|
|
"num_tokens": 30920462.0,
|
|
"step": 12200
|
|
},
|
|
{
|
|
"entropy": 6.217762279510498,
|
|
"epoch": 1.408540103866128,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004812663261714019,
|
|
"loss": 5.7836,
|
|
"mean_token_accuracy": 0.19252836406230928,
|
|
"num_tokens": 30933501.0,
|
|
"step": 12205
|
|
},
|
|
{
|
|
"entropy": 6.223458099365234,
|
|
"epoch": 1.4091171379111367,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004812498381653613,
|
|
"loss": 5.7691,
|
|
"mean_token_accuracy": 0.19711357057094575,
|
|
"num_tokens": 30944780.0,
|
|
"step": 12210
|
|
},
|
|
{
|
|
"entropy": 6.21431188583374,
|
|
"epoch": 1.4096941719561453,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004812333432222098,
|
|
"loss": 5.8125,
|
|
"mean_token_accuracy": 0.19472504109144212,
|
|
"num_tokens": 30957730.0,
|
|
"step": 12215
|
|
},
|
|
{
|
|
"entropy": 6.009715795516968,
|
|
"epoch": 1.4102712060011542,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004812168413425023,
|
|
"loss": 5.6882,
|
|
"mean_token_accuracy": 0.20412740260362625,
|
|
"num_tokens": 30969371.0,
|
|
"step": 12220
|
|
},
|
|
{
|
|
"entropy": 6.231176328659058,
|
|
"epoch": 1.4108482400461626,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00048120033252679374,
|
|
"loss": 5.8924,
|
|
"mean_token_accuracy": 0.18615046590566636,
|
|
"num_tokens": 30983662.0,
|
|
"step": 12225
|
|
},
|
|
{
|
|
"entropy": 6.312102746963501,
|
|
"epoch": 1.4114252740911715,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00048118381677563946,
|
|
"loss": 5.8878,
|
|
"mean_token_accuracy": 0.18438036888837814,
|
|
"num_tokens": 30995641.0,
|
|
"step": 12230
|
|
},
|
|
{
|
|
"entropy": 6.28008394241333,
|
|
"epoch": 1.41200230813618,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004811672940895949,
|
|
"loss": 5.9443,
|
|
"mean_token_accuracy": 0.18446469008922578,
|
|
"num_tokens": 31008508.0,
|
|
"step": 12235
|
|
},
|
|
{
|
|
"entropy": 6.293724393844604,
|
|
"epoch": 1.4125793421811887,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004811507644692158,
|
|
"loss": 5.9187,
|
|
"mean_token_accuracy": 0.18171917498111725,
|
|
"num_tokens": 31020903.0,
|
|
"step": 12240
|
|
},
|
|
{
|
|
"entropy": 6.257511377334595,
|
|
"epoch": 1.4131563762261974,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004811342279150581,
|
|
"loss": 5.8593,
|
|
"mean_token_accuracy": 0.190650050342083,
|
|
"num_tokens": 31033668.0,
|
|
"step": 12245
|
|
},
|
|
{
|
|
"entropy": 6.258108806610108,
|
|
"epoch": 1.413733410271206,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004811176844276781,
|
|
"loss": 5.9092,
|
|
"mean_token_accuracy": 0.1842113733291626,
|
|
"num_tokens": 31046980.0,
|
|
"step": 12250
|
|
},
|
|
{
|
|
"entropy": 6.205495929718017,
|
|
"epoch": 1.4143104443162147,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004811011340076322,
|
|
"loss": 5.8128,
|
|
"mean_token_accuracy": 0.186430487036705,
|
|
"num_tokens": 31059023.0,
|
|
"step": 12255
|
|
},
|
|
{
|
|
"entropy": 6.267776298522949,
|
|
"epoch": 1.4148874783612233,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048108457665547695,
|
|
"loss": 5.8526,
|
|
"mean_token_accuracy": 0.18937126398086548,
|
|
"num_tokens": 31070449.0,
|
|
"step": 12260
|
|
},
|
|
{
|
|
"entropy": 6.198201084136963,
|
|
"epoch": 1.415464512406232,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004810680123717694,
|
|
"loss": 5.8053,
|
|
"mean_token_accuracy": 0.19537163823843,
|
|
"num_tokens": 31081974.0,
|
|
"step": 12265
|
|
},
|
|
{
|
|
"entropy": 6.23746509552002,
|
|
"epoch": 1.4160415464512406,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004810514411570666,
|
|
"loss": 5.8773,
|
|
"mean_token_accuracy": 0.18206487745046615,
|
|
"num_tokens": 31094825.0,
|
|
"step": 12270
|
|
},
|
|
{
|
|
"entropy": 6.164452695846558,
|
|
"epoch": 1.4166185804962492,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004810348630119259,
|
|
"loss": 5.8424,
|
|
"mean_token_accuracy": 0.18676037788391114,
|
|
"num_tokens": 31106589.0,
|
|
"step": 12275
|
|
},
|
|
{
|
|
"entropy": 6.306876564025879,
|
|
"epoch": 1.4171956145412579,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00048101827793690493,
|
|
"loss": 5.8616,
|
|
"mean_token_accuracy": 0.17967692017555237,
|
|
"num_tokens": 31118228.0,
|
|
"step": 12280
|
|
},
|
|
{
|
|
"entropy": 6.314551591873169,
|
|
"epoch": 1.4177726485862667,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004810016859325615,
|
|
"loss": 5.9554,
|
|
"mean_token_accuracy": 0.18243657797574997,
|
|
"num_tokens": 31131396.0,
|
|
"step": 12285
|
|
},
|
|
{
|
|
"entropy": 6.237841653823852,
|
|
"epoch": 1.4183496826312751,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004809850869994537,
|
|
"loss": 5.8619,
|
|
"mean_token_accuracy": 0.1885082244873047,
|
|
"num_tokens": 31145524.0,
|
|
"step": 12290
|
|
},
|
|
{
|
|
"entropy": 6.274528551101684,
|
|
"epoch": 1.418926716676284,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004809684811381398,
|
|
"loss": 5.8248,
|
|
"mean_token_accuracy": 0.1977459728717804,
|
|
"num_tokens": 31157866.0,
|
|
"step": 12295
|
|
},
|
|
{
|
|
"entropy": 6.155285167694092,
|
|
"epoch": 1.4195037507212924,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004809518683491785,
|
|
"loss": 5.7666,
|
|
"mean_token_accuracy": 0.19823187589645386,
|
|
"num_tokens": 31170634.0,
|
|
"step": 12300
|
|
},
|
|
{
|
|
"entropy": 6.192041683197021,
|
|
"epoch": 1.4200807847663013,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00048093524863312823,
|
|
"loss": 5.8119,
|
|
"mean_token_accuracy": 0.18903475552797316,
|
|
"num_tokens": 31183585.0,
|
|
"step": 12305
|
|
},
|
|
{
|
|
"entropy": 6.261973333358765,
|
|
"epoch": 1.42065781881131,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004809186219905482,
|
|
"loss": 5.8426,
|
|
"mean_token_accuracy": 0.18727468997240065,
|
|
"num_tokens": 31196375.0,
|
|
"step": 12310
|
|
},
|
|
{
|
|
"entropy": 6.18221230506897,
|
|
"epoch": 1.4212348528563186,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004809019884219976,
|
|
"loss": 5.8249,
|
|
"mean_token_accuracy": 0.19580861926078796,
|
|
"num_tokens": 31209797.0,
|
|
"step": 12315
|
|
},
|
|
{
|
|
"entropy": 6.166803169250488,
|
|
"epoch": 1.4218118869013272,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00048088534792803595,
|
|
"loss": 5.7396,
|
|
"mean_token_accuracy": 0.19430786818265916,
|
|
"num_tokens": 31221196.0,
|
|
"step": 12320
|
|
},
|
|
{
|
|
"entropy": 6.259878826141358,
|
|
"epoch": 1.4223889209463358,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00048086870050922286,
|
|
"loss": 5.8522,
|
|
"mean_token_accuracy": 0.18935182839632034,
|
|
"num_tokens": 31234126.0,
|
|
"step": 12325
|
|
},
|
|
{
|
|
"entropy": 6.252271556854248,
|
|
"epoch": 1.4229659549913445,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00048085204616611833,
|
|
"loss": 5.873,
|
|
"mean_token_accuracy": 0.18678005188703536,
|
|
"num_tokens": 31245933.0,
|
|
"step": 12330
|
|
},
|
|
{
|
|
"entropy": 6.192243480682373,
|
|
"epoch": 1.4235429890363531,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048083538489928246,
|
|
"loss": 5.8689,
|
|
"mean_token_accuracy": 0.18617866486310958,
|
|
"num_tokens": 31258734.0,
|
|
"step": 12335
|
|
},
|
|
{
|
|
"entropy": 6.227387714385986,
|
|
"epoch": 1.4241200230813618,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004808187167092757,
|
|
"loss": 5.7521,
|
|
"mean_token_accuracy": 0.18657746613025666,
|
|
"num_tokens": 31272487.0,
|
|
"step": 12340
|
|
},
|
|
{
|
|
"entropy": 6.213850641250611,
|
|
"epoch": 1.4246970571263704,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004808020415966586,
|
|
"loss": 5.8346,
|
|
"mean_token_accuracy": 0.18490028977394105,
|
|
"num_tokens": 31285117.0,
|
|
"step": 12345
|
|
},
|
|
{
|
|
"entropy": 6.222880744934082,
|
|
"epoch": 1.425274091171379,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.000480785359561992,
|
|
"loss": 5.809,
|
|
"mean_token_accuracy": 0.19161065220832824,
|
|
"num_tokens": 31297772.0,
|
|
"step": 12350
|
|
},
|
|
{
|
|
"entropy": 6.2099446773529055,
|
|
"epoch": 1.4258511252163877,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00048076867060583704,
|
|
"loss": 5.8379,
|
|
"mean_token_accuracy": 0.1893964871764183,
|
|
"num_tokens": 31310901.0,
|
|
"step": 12355
|
|
},
|
|
{
|
|
"entropy": 6.23720760345459,
|
|
"epoch": 1.4264281592613965,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004807519747287551,
|
|
"loss": 5.8364,
|
|
"mean_token_accuracy": 0.18434469103813172,
|
|
"num_tokens": 31323090.0,
|
|
"step": 12360
|
|
},
|
|
{
|
|
"entropy": 6.192369842529297,
|
|
"epoch": 1.427005193306405,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004807352719313078,
|
|
"loss": 5.7538,
|
|
"mean_token_accuracy": 0.1981295555830002,
|
|
"num_tokens": 31335883.0,
|
|
"step": 12365
|
|
},
|
|
{
|
|
"entropy": 6.29363317489624,
|
|
"epoch": 1.4275822273514138,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004807185622140567,
|
|
"loss": 5.9025,
|
|
"mean_token_accuracy": 0.18681400418281555,
|
|
"num_tokens": 31348237.0,
|
|
"step": 12370
|
|
},
|
|
{
|
|
"entropy": 6.159489631652832,
|
|
"epoch": 1.4281592613964225,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00048070184557756396,
|
|
"loss": 5.7452,
|
|
"mean_token_accuracy": 0.1910381242632866,
|
|
"num_tokens": 31360414.0,
|
|
"step": 12375
|
|
},
|
|
{
|
|
"entropy": 6.228966617584229,
|
|
"epoch": 1.428736295441431,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00048068512202239177,
|
|
"loss": 5.8706,
|
|
"mean_token_accuracy": 0.18762275874614714,
|
|
"num_tokens": 31372765.0,
|
|
"step": 12380
|
|
},
|
|
{
|
|
"entropy": 6.2343464374542235,
|
|
"epoch": 1.4293133294864397,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004806683915491028,
|
|
"loss": 5.8246,
|
|
"mean_token_accuracy": 0.19126800447702408,
|
|
"num_tokens": 31386176.0,
|
|
"step": 12385
|
|
},
|
|
{
|
|
"entropy": 6.275753688812256,
|
|
"epoch": 1.4298903635314484,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004806516541582596,
|
|
"loss": 5.9217,
|
|
"mean_token_accuracy": 0.1823081776499748,
|
|
"num_tokens": 31398385.0,
|
|
"step": 12390
|
|
},
|
|
{
|
|
"entropy": 6.1845824241638185,
|
|
"epoch": 1.430467397576457,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.00048063490985042506,
|
|
"loss": 5.768,
|
|
"mean_token_accuracy": 0.1930743232369423,
|
|
"num_tokens": 31410841.0,
|
|
"step": 12395
|
|
},
|
|
{
|
|
"entropy": 6.193290281295776,
|
|
"epoch": 1.4310444316214657,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004806181586261626,
|
|
"loss": 5.7982,
|
|
"mean_token_accuracy": 0.19314497709274292,
|
|
"num_tokens": 31425586.0,
|
|
"step": 12400
|
|
},
|
|
{
|
|
"entropy": 6.232039213180542,
|
|
"epoch": 1.4316214656664743,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00048060140048603544,
|
|
"loss": 5.8241,
|
|
"mean_token_accuracy": 0.19228676557540894,
|
|
"num_tokens": 31438943.0,
|
|
"step": 12405
|
|
},
|
|
{
|
|
"entropy": 6.189572191238403,
|
|
"epoch": 1.432198499711483,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004805846354306073,
|
|
"loss": 5.7794,
|
|
"mean_token_accuracy": 0.19570462852716447,
|
|
"num_tokens": 31452284.0,
|
|
"step": 12410
|
|
},
|
|
{
|
|
"entropy": 6.265307140350342,
|
|
"epoch": 1.4327755337564916,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048056786346044214,
|
|
"loss": 5.9258,
|
|
"mean_token_accuracy": 0.1752777561545372,
|
|
"num_tokens": 31466311.0,
|
|
"step": 12415
|
|
},
|
|
{
|
|
"entropy": 6.276501178741455,
|
|
"epoch": 1.4333525678015002,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00048055108457610395,
|
|
"loss": 5.7913,
|
|
"mean_token_accuracy": 0.19310199171304704,
|
|
"num_tokens": 31478916.0,
|
|
"step": 12420
|
|
},
|
|
{
|
|
"entropy": 6.2271256923675535,
|
|
"epoch": 1.4339296018465089,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004805342987781571,
|
|
"loss": 5.8388,
|
|
"mean_token_accuracy": 0.18540789186954498,
|
|
"num_tokens": 31490337.0,
|
|
"step": 12425
|
|
},
|
|
{
|
|
"entropy": 6.191142988204956,
|
|
"epoch": 1.4345066358915175,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004805175060671663,
|
|
"loss": 5.837,
|
|
"mean_token_accuracy": 0.1861076056957245,
|
|
"num_tokens": 31502625.0,
|
|
"step": 12430
|
|
},
|
|
{
|
|
"entropy": 6.269933652877808,
|
|
"epoch": 1.4350836699365264,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004805007064436962,
|
|
"loss": 5.8688,
|
|
"mean_token_accuracy": 0.18913554698228835,
|
|
"num_tokens": 31515440.0,
|
|
"step": 12435
|
|
},
|
|
{
|
|
"entropy": 6.261519908905029,
|
|
"epoch": 1.4356607039815348,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004804838999083119,
|
|
"loss": 5.8387,
|
|
"mean_token_accuracy": 0.18860826641321182,
|
|
"num_tokens": 31527812.0,
|
|
"step": 12440
|
|
},
|
|
{
|
|
"entropy": 6.2459697246551515,
|
|
"epoch": 1.4362377380265436,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004804670864615787,
|
|
"loss": 5.8288,
|
|
"mean_token_accuracy": 0.18852628469467164,
|
|
"num_tokens": 31540249.0,
|
|
"step": 12445
|
|
},
|
|
{
|
|
"entropy": 6.170604562759399,
|
|
"epoch": 1.4368147720715523,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00048045026610406223,
|
|
"loss": 5.7808,
|
|
"mean_token_accuracy": 0.19519326835870743,
|
|
"num_tokens": 31552312.0,
|
|
"step": 12450
|
|
},
|
|
{
|
|
"entropy": 6.271270418167115,
|
|
"epoch": 1.437391806116561,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.000480433438836328,
|
|
"loss": 5.8401,
|
|
"mean_token_accuracy": 0.1857555016875267,
|
|
"num_tokens": 31564496.0,
|
|
"step": 12455
|
|
},
|
|
{
|
|
"entropy": 6.26390962600708,
|
|
"epoch": 1.4379688401615696,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00048041660465894206,
|
|
"loss": 5.8391,
|
|
"mean_token_accuracy": 0.18578193783760072,
|
|
"num_tokens": 31577705.0,
|
|
"step": 12460
|
|
},
|
|
{
|
|
"entropy": 6.277010202407837,
|
|
"epoch": 1.4385458742065782,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004803997635724707,
|
|
"loss": 5.8735,
|
|
"mean_token_accuracy": 0.1823616862297058,
|
|
"num_tokens": 31589566.0,
|
|
"step": 12465
|
|
},
|
|
{
|
|
"entropy": 6.256769752502441,
|
|
"epoch": 1.4391229082515868,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004803829155774804,
|
|
"loss": 5.8826,
|
|
"mean_token_accuracy": 0.1852583885192871,
|
|
"num_tokens": 31602379.0,
|
|
"step": 12470
|
|
},
|
|
{
|
|
"entropy": 6.250380563735962,
|
|
"epoch": 1.4396999422965955,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004803660606745377,
|
|
"loss": 5.8274,
|
|
"mean_token_accuracy": 0.19224091172218322,
|
|
"num_tokens": 31615469.0,
|
|
"step": 12475
|
|
},
|
|
{
|
|
"entropy": 6.2556861400604244,
|
|
"epoch": 1.4402769763416041,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00048034919886420953,
|
|
"loss": 5.932,
|
|
"mean_token_accuracy": 0.18619346469640732,
|
|
"num_tokens": 31627129.0,
|
|
"step": 12480
|
|
},
|
|
{
|
|
"entropy": 6.294282674789429,
|
|
"epoch": 1.4408540103866128,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.00048033233014706304,
|
|
"loss": 5.8952,
|
|
"mean_token_accuracy": 0.18746394217014312,
|
|
"num_tokens": 31639564.0,
|
|
"step": 12485
|
|
},
|
|
{
|
|
"entropy": 6.1616355895996096,
|
|
"epoch": 1.4414310444316214,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00048031545452366565,
|
|
"loss": 5.8522,
|
|
"mean_token_accuracy": 0.18221624940633774,
|
|
"num_tokens": 31651984.0,
|
|
"step": 12490
|
|
},
|
|
{
|
|
"entropy": 6.274483489990234,
|
|
"epoch": 1.44200807847663,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00048029857199458493,
|
|
"loss": 5.8248,
|
|
"mean_token_accuracy": 0.1933693617582321,
|
|
"num_tokens": 31664850.0,
|
|
"step": 12495
|
|
},
|
|
{
|
|
"entropy": 6.172151279449463,
|
|
"epoch": 1.442585112521639,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048028168256038873,
|
|
"loss": 5.8083,
|
|
"mean_token_accuracy": 0.19690240025520325,
|
|
"num_tokens": 31676993.0,
|
|
"step": 12500
|
|
},
|
|
{
|
|
"entropy": 6.241194343566894,
|
|
"epoch": 1.4431621465666473,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00048026478622164513,
|
|
"loss": 5.9103,
|
|
"mean_token_accuracy": 0.19012573957443238,
|
|
"num_tokens": 31689632.0,
|
|
"step": 12505
|
|
},
|
|
{
|
|
"entropy": 6.277917289733887,
|
|
"epoch": 1.4437391806116562,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00048024788297892234,
|
|
"loss": 5.8514,
|
|
"mean_token_accuracy": 0.18539552241563798,
|
|
"num_tokens": 31701610.0,
|
|
"step": 12510
|
|
},
|
|
{
|
|
"entropy": 6.220233011245727,
|
|
"epoch": 1.4443162146566648,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000480230972832789,
|
|
"loss": 5.8238,
|
|
"mean_token_accuracy": 0.18775998800992966,
|
|
"num_tokens": 31713838.0,
|
|
"step": 12515
|
|
},
|
|
{
|
|
"entropy": 6.17543592453003,
|
|
"epoch": 1.4448932487016735,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00048021405578381384,
|
|
"loss": 5.78,
|
|
"mean_token_accuracy": 0.19356610178947448,
|
|
"num_tokens": 31726097.0,
|
|
"step": 12520
|
|
},
|
|
{
|
|
"entropy": 6.206122636795044,
|
|
"epoch": 1.445470282746682,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004801971318325659,
|
|
"loss": 5.8184,
|
|
"mean_token_accuracy": 0.1879914492368698,
|
|
"num_tokens": 31739646.0,
|
|
"step": 12525
|
|
},
|
|
{
|
|
"entropy": 6.21998233795166,
|
|
"epoch": 1.4460473167916907,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004801802009796142,
|
|
"loss": 5.8003,
|
|
"mean_token_accuracy": 0.19319549351930618,
|
|
"num_tokens": 31752161.0,
|
|
"step": 12530
|
|
},
|
|
{
|
|
"entropy": 6.206159591674805,
|
|
"epoch": 1.4466243508366994,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004801632632255285,
|
|
"loss": 5.8059,
|
|
"mean_token_accuracy": 0.18725275844335557,
|
|
"num_tokens": 31764498.0,
|
|
"step": 12535
|
|
},
|
|
{
|
|
"entropy": 6.285904359817505,
|
|
"epoch": 1.447201384881708,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004801463185708783,
|
|
"loss": 5.8608,
|
|
"mean_token_accuracy": 0.18627117872238158,
|
|
"num_tokens": 31776453.0,
|
|
"step": 12540
|
|
},
|
|
{
|
|
"entropy": 6.210245609283447,
|
|
"epoch": 1.4477784189267167,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00048012936701623363,
|
|
"loss": 5.9274,
|
|
"mean_token_accuracy": 0.18175046145915985,
|
|
"num_tokens": 31789761.0,
|
|
"step": 12545
|
|
},
|
|
{
|
|
"entropy": 6.2855147361755375,
|
|
"epoch": 1.4483554529717253,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00048011240856216456,
|
|
"loss": 5.9142,
|
|
"mean_token_accuracy": 0.18825961649417877,
|
|
"num_tokens": 31802689.0,
|
|
"step": 12550
|
|
},
|
|
{
|
|
"entropy": 6.23141303062439,
|
|
"epoch": 1.448932487016734,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048009544320924154,
|
|
"loss": 5.8918,
|
|
"mean_token_accuracy": 0.18411456793546677,
|
|
"num_tokens": 31816768.0,
|
|
"step": 12555
|
|
},
|
|
{
|
|
"entropy": 6.213440322875977,
|
|
"epoch": 1.4495095210617426,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004800784709580351,
|
|
"loss": 5.8276,
|
|
"mean_token_accuracy": 0.1924056515097618,
|
|
"num_tokens": 31828920.0,
|
|
"step": 12560
|
|
},
|
|
{
|
|
"entropy": 6.235508108139038,
|
|
"epoch": 1.4500865551067512,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004800614918091161,
|
|
"loss": 5.8868,
|
|
"mean_token_accuracy": 0.18438960909843444,
|
|
"num_tokens": 31841467.0,
|
|
"step": 12565
|
|
},
|
|
{
|
|
"entropy": 6.269950532913208,
|
|
"epoch": 1.4506635891517599,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004800445057630558,
|
|
"loss": 5.8879,
|
|
"mean_token_accuracy": 0.18824739307165145,
|
|
"num_tokens": 31855254.0,
|
|
"step": 12570
|
|
},
|
|
{
|
|
"entropy": 6.227955436706543,
|
|
"epoch": 1.4512406231967687,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004800275128204254,
|
|
"loss": 5.823,
|
|
"mean_token_accuracy": 0.1889019101858139,
|
|
"num_tokens": 31868234.0,
|
|
"step": 12575
|
|
},
|
|
{
|
|
"entropy": 6.259027624130249,
|
|
"epoch": 1.4518176572417771,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00048001051298179637,
|
|
"loss": 5.8882,
|
|
"mean_token_accuracy": 0.19090647697448732,
|
|
"num_tokens": 31880014.0,
|
|
"step": 12580
|
|
},
|
|
{
|
|
"entropy": 6.228473424911499,
|
|
"epoch": 1.452394691286786,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004799935062477407,
|
|
"loss": 5.8329,
|
|
"mean_token_accuracy": 0.18438107669353485,
|
|
"num_tokens": 31892019.0,
|
|
"step": 12585
|
|
},
|
|
{
|
|
"entropy": 6.267324924468994,
|
|
"epoch": 1.4529717253317946,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00047997649261883013,
|
|
"loss": 5.8476,
|
|
"mean_token_accuracy": 0.18466779142618178,
|
|
"num_tokens": 31905837.0,
|
|
"step": 12590
|
|
},
|
|
{
|
|
"entropy": 6.244672107696533,
|
|
"epoch": 1.4535487593768033,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004799594720956371,
|
|
"loss": 5.8252,
|
|
"mean_token_accuracy": 0.18755768984556198,
|
|
"num_tokens": 31917823.0,
|
|
"step": 12595
|
|
},
|
|
{
|
|
"entropy": 6.280782175064087,
|
|
"epoch": 1.454125793421812,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00047994244467873407,
|
|
"loss": 5.8977,
|
|
"mean_token_accuracy": 0.1816701665520668,
|
|
"num_tokens": 31931221.0,
|
|
"step": 12600
|
|
},
|
|
{
|
|
"entropy": 6.224785327911377,
|
|
"epoch": 1.4547028274668206,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00047992541036869364,
|
|
"loss": 5.8497,
|
|
"mean_token_accuracy": 0.18835566192865372,
|
|
"num_tokens": 31943739.0,
|
|
"step": 12605
|
|
},
|
|
{
|
|
"entropy": 6.2321693897247314,
|
|
"epoch": 1.4552798615118292,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004799083691660889,
|
|
"loss": 5.9111,
|
|
"mean_token_accuracy": 0.1834364727139473,
|
|
"num_tokens": 31957805.0,
|
|
"step": 12610
|
|
},
|
|
{
|
|
"entropy": 6.254454278945923,
|
|
"epoch": 1.4558568955568378,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004798913210714929,
|
|
"loss": 5.8623,
|
|
"mean_token_accuracy": 0.19286692887544632,
|
|
"num_tokens": 31970983.0,
|
|
"step": 12615
|
|
},
|
|
{
|
|
"entropy": 6.22641954421997,
|
|
"epoch": 1.4564339296018465,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00047987426608547915,
|
|
"loss": 5.8475,
|
|
"mean_token_accuracy": 0.19006728231906891,
|
|
"num_tokens": 31982985.0,
|
|
"step": 12620
|
|
},
|
|
{
|
|
"entropy": 6.202101469039917,
|
|
"epoch": 1.4570109636468551,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004798572042086212,
|
|
"loss": 5.8051,
|
|
"mean_token_accuracy": 0.18875966370105743,
|
|
"num_tokens": 31994854.0,
|
|
"step": 12625
|
|
},
|
|
{
|
|
"entropy": 6.293975305557251,
|
|
"epoch": 1.4575879976918638,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047984013544149286,
|
|
"loss": 5.9473,
|
|
"mean_token_accuracy": 0.178886578977108,
|
|
"num_tokens": 32007476.0,
|
|
"step": 12630
|
|
},
|
|
{
|
|
"entropy": 6.299429178237915,
|
|
"epoch": 1.4581650317368724,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00047982305978466836,
|
|
"loss": 5.8671,
|
|
"mean_token_accuracy": 0.19250797629356384,
|
|
"num_tokens": 32021417.0,
|
|
"step": 12635
|
|
},
|
|
{
|
|
"entropy": 6.179995727539063,
|
|
"epoch": 1.4587420657818813,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00047980597723872205,
|
|
"loss": 5.8372,
|
|
"mean_token_accuracy": 0.18427969366312028,
|
|
"num_tokens": 32033997.0,
|
|
"step": 12640
|
|
},
|
|
{
|
|
"entropy": 6.194073438644409,
|
|
"epoch": 1.4593190998268897,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004797888878042283,
|
|
"loss": 5.8245,
|
|
"mean_token_accuracy": 0.1968119978904724,
|
|
"num_tokens": 32046797.0,
|
|
"step": 12645
|
|
},
|
|
{
|
|
"entropy": 6.255892372131347,
|
|
"epoch": 1.4598961338718985,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00047977179148176217,
|
|
"loss": 5.8042,
|
|
"mean_token_accuracy": 0.19345609843730927,
|
|
"num_tokens": 32060797.0,
|
|
"step": 12650
|
|
},
|
|
{
|
|
"entropy": 6.2575019836425785,
|
|
"epoch": 1.4604731679169072,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004797546882718985,
|
|
"loss": 5.913,
|
|
"mean_token_accuracy": 0.18159203082323075,
|
|
"num_tokens": 32073936.0,
|
|
"step": 12655
|
|
},
|
|
{
|
|
"entropy": 6.197871112823487,
|
|
"epoch": 1.4610502019619158,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.00047973757817521256,
|
|
"loss": 5.7969,
|
|
"mean_token_accuracy": 0.1944518953561783,
|
|
"num_tokens": 32086730.0,
|
|
"step": 12660
|
|
},
|
|
{
|
|
"entropy": 6.288273477554322,
|
|
"epoch": 1.4616272360069245,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004797204611922799,
|
|
"loss": 5.888,
|
|
"mean_token_accuracy": 0.18709647357463838,
|
|
"num_tokens": 32099201.0,
|
|
"step": 12665
|
|
},
|
|
{
|
|
"entropy": 6.1809022426605225,
|
|
"epoch": 1.462204270051933,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047970333732367626,
|
|
"loss": 5.8571,
|
|
"mean_token_accuracy": 0.1861635446548462,
|
|
"num_tokens": 32112475.0,
|
|
"step": 12670
|
|
},
|
|
{
|
|
"entropy": 6.263620090484619,
|
|
"epoch": 1.4627813040969417,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00047968620656997754,
|
|
"loss": 5.8877,
|
|
"mean_token_accuracy": 0.1819758251309395,
|
|
"num_tokens": 32124411.0,
|
|
"step": 12675
|
|
},
|
|
{
|
|
"entropy": 6.225598430633545,
|
|
"epoch": 1.4633583381419504,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00047966906893175994,
|
|
"loss": 5.8729,
|
|
"mean_token_accuracy": 0.19142432063817977,
|
|
"num_tokens": 32136665.0,
|
|
"step": 12680
|
|
},
|
|
{
|
|
"entropy": 6.324308729171753,
|
|
"epoch": 1.463935372186959,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004796519244095998,
|
|
"loss": 5.8716,
|
|
"mean_token_accuracy": 0.1902136892080307,
|
|
"num_tokens": 32149546.0,
|
|
"step": 12685
|
|
},
|
|
{
|
|
"entropy": 6.188792324066162,
|
|
"epoch": 1.4645124062319677,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00047963477300407394,
|
|
"loss": 5.8044,
|
|
"mean_token_accuracy": 0.18858650773763658,
|
|
"num_tokens": 32161327.0,
|
|
"step": 12690
|
|
},
|
|
{
|
|
"entropy": 6.267832660675049,
|
|
"epoch": 1.4650894402769763,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00047961761471575903,
|
|
"loss": 5.808,
|
|
"mean_token_accuracy": 0.18862345516681672,
|
|
"num_tokens": 32173678.0,
|
|
"step": 12695
|
|
},
|
|
{
|
|
"entropy": 6.154121351242066,
|
|
"epoch": 1.465666474321985,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00047960044954523237,
|
|
"loss": 5.7554,
|
|
"mean_token_accuracy": 0.1918697848916054,
|
|
"num_tokens": 32186834.0,
|
|
"step": 12700
|
|
},
|
|
{
|
|
"entropy": 6.250173807144165,
|
|
"epoch": 1.4662435083669936,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00047958327749307117,
|
|
"loss": 5.8994,
|
|
"mean_token_accuracy": 0.18794130235910417,
|
|
"num_tokens": 32198876.0,
|
|
"step": 12705
|
|
},
|
|
{
|
|
"entropy": 6.236554574966431,
|
|
"epoch": 1.4668205424120022,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00047956609855985305,
|
|
"loss": 5.7503,
|
|
"mean_token_accuracy": 0.19117399752140046,
|
|
"num_tokens": 32212190.0,
|
|
"step": 12710
|
|
},
|
|
{
|
|
"entropy": 6.200174570083618,
|
|
"epoch": 1.467397576457011,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004795489127461559,
|
|
"loss": 5.7932,
|
|
"mean_token_accuracy": 0.19743801206350325,
|
|
"num_tokens": 32226129.0,
|
|
"step": 12715
|
|
},
|
|
{
|
|
"entropy": 6.19217324256897,
|
|
"epoch": 1.4679746105020195,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00047953172005255756,
|
|
"loss": 5.8725,
|
|
"mean_token_accuracy": 0.1850110799074173,
|
|
"num_tokens": 32240116.0,
|
|
"step": 12720
|
|
},
|
|
{
|
|
"entropy": 6.265895223617553,
|
|
"epoch": 1.4685516445470284,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004795145204796365,
|
|
"loss": 5.7838,
|
|
"mean_token_accuracy": 0.1934996247291565,
|
|
"num_tokens": 32252781.0,
|
|
"step": 12725
|
|
},
|
|
{
|
|
"entropy": 6.201068782806397,
|
|
"epoch": 1.469128678592037,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004794973140279711,
|
|
"loss": 5.7902,
|
|
"mean_token_accuracy": 0.192179936170578,
|
|
"num_tokens": 32265625.0,
|
|
"step": 12730
|
|
},
|
|
{
|
|
"entropy": 6.210565710067749,
|
|
"epoch": 1.4697057126370456,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00047948010069814005,
|
|
"loss": 5.8399,
|
|
"mean_token_accuracy": 0.19595302790403366,
|
|
"num_tokens": 32278942.0,
|
|
"step": 12735
|
|
},
|
|
{
|
|
"entropy": 6.247366428375244,
|
|
"epoch": 1.4702827466820543,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004794628804907225,
|
|
"loss": 5.8417,
|
|
"mean_token_accuracy": 0.19263463318347931,
|
|
"num_tokens": 32292085.0,
|
|
"step": 12740
|
|
},
|
|
{
|
|
"entropy": 6.258548021316528,
|
|
"epoch": 1.470859780727063,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00047944565340629755,
|
|
"loss": 5.882,
|
|
"mean_token_accuracy": 0.19039649814367293,
|
|
"num_tokens": 32303880.0,
|
|
"step": 12745
|
|
},
|
|
{
|
|
"entropy": 6.15313949584961,
|
|
"epoch": 1.4714368147720716,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00047942841944544453,
|
|
"loss": 5.7886,
|
|
"mean_token_accuracy": 0.1929144263267517,
|
|
"num_tokens": 32315711.0,
|
|
"step": 12750
|
|
},
|
|
{
|
|
"entropy": 6.289398336410523,
|
|
"epoch": 1.4720138488170802,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004794111786087431,
|
|
"loss": 5.8802,
|
|
"mean_token_accuracy": 0.18687772899866104,
|
|
"num_tokens": 32329344.0,
|
|
"step": 12755
|
|
},
|
|
{
|
|
"entropy": 6.329669618606568,
|
|
"epoch": 1.4725908828620888,
|
|
"grad_norm": 3.171875,
|
|
"learning_rate": 0.0004793939308967733,
|
|
"loss": 5.8453,
|
|
"mean_token_accuracy": 0.18983658850193025,
|
|
"num_tokens": 32343335.0,
|
|
"step": 12760
|
|
},
|
|
{
|
|
"entropy": 6.150098705291748,
|
|
"epoch": 1.4731679169070975,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004793766763101152,
|
|
"loss": 5.7208,
|
|
"mean_token_accuracy": 0.19836216270923615,
|
|
"num_tokens": 32357663.0,
|
|
"step": 12765
|
|
},
|
|
{
|
|
"entropy": 6.231173849105835,
|
|
"epoch": 1.4737449509521061,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047935941484934905,
|
|
"loss": 5.8432,
|
|
"mean_token_accuracy": 0.1936136767268181,
|
|
"num_tokens": 32369310.0,
|
|
"step": 12770
|
|
},
|
|
{
|
|
"entropy": 6.182768821716309,
|
|
"epoch": 1.4743219849971148,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00047934214651505547,
|
|
"loss": 5.8167,
|
|
"mean_token_accuracy": 0.19123019874095917,
|
|
"num_tokens": 32381478.0,
|
|
"step": 12775
|
|
},
|
|
{
|
|
"entropy": 6.159084224700928,
|
|
"epoch": 1.4748990190421236,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00047932487130781533,
|
|
"loss": 5.7626,
|
|
"mean_token_accuracy": 0.20197259783744811,
|
|
"num_tokens": 32394697.0,
|
|
"step": 12780
|
|
},
|
|
{
|
|
"entropy": 6.140364646911621,
|
|
"epoch": 1.475476053087132,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004793075892282097,
|
|
"loss": 5.7113,
|
|
"mean_token_accuracy": 0.1971853882074356,
|
|
"num_tokens": 32405456.0,
|
|
"step": 12785
|
|
},
|
|
{
|
|
"entropy": 6.184367847442627,
|
|
"epoch": 1.476053087132141,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004792903002768197,
|
|
"loss": 5.831,
|
|
"mean_token_accuracy": 0.18514325618743896,
|
|
"num_tokens": 32416772.0,
|
|
"step": 12790
|
|
},
|
|
{
|
|
"entropy": 6.148500156402588,
|
|
"epoch": 1.4766301211771495,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047927300445422687,
|
|
"loss": 5.7444,
|
|
"mean_token_accuracy": 0.19996704906225204,
|
|
"num_tokens": 32429319.0,
|
|
"step": 12795
|
|
},
|
|
{
|
|
"entropy": 6.150080442428589,
|
|
"epoch": 1.4772071552221582,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004792557017610131,
|
|
"loss": 5.7314,
|
|
"mean_token_accuracy": 0.20687794983386992,
|
|
"num_tokens": 32442017.0,
|
|
"step": 12800
|
|
},
|
|
{
|
|
"entropy": 6.148825454711914,
|
|
"epoch": 1.4777841892671668,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00047923839219776027,
|
|
"loss": 5.7583,
|
|
"mean_token_accuracy": 0.1933480203151703,
|
|
"num_tokens": 32454255.0,
|
|
"step": 12805
|
|
},
|
|
{
|
|
"entropy": 6.160013580322266,
|
|
"epoch": 1.4783612233121755,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004792210757650506,
|
|
"loss": 5.7797,
|
|
"mean_token_accuracy": 0.1943795472383499,
|
|
"num_tokens": 32465471.0,
|
|
"step": 12810
|
|
},
|
|
{
|
|
"entropy": 6.197701454162598,
|
|
"epoch": 1.478938257357184,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00047920375246346636,
|
|
"loss": 5.8182,
|
|
"mean_token_accuracy": 0.187069371342659,
|
|
"num_tokens": 32478271.0,
|
|
"step": 12815
|
|
},
|
|
{
|
|
"entropy": 6.247473955154419,
|
|
"epoch": 1.4795152914021927,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00047918642229359044,
|
|
"loss": 5.8331,
|
|
"mean_token_accuracy": 0.18895274102687837,
|
|
"num_tokens": 32490239.0,
|
|
"step": 12820
|
|
},
|
|
{
|
|
"entropy": 6.2366992950439455,
|
|
"epoch": 1.4800923254472014,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004791690852560056,
|
|
"loss": 5.8719,
|
|
"mean_token_accuracy": 0.18945563733577728,
|
|
"num_tokens": 32503511.0,
|
|
"step": 12825
|
|
},
|
|
{
|
|
"entropy": 6.193121337890625,
|
|
"epoch": 1.48066935949221,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.000479151741351295,
|
|
"loss": 5.8729,
|
|
"mean_token_accuracy": 0.1820230945944786,
|
|
"num_tokens": 32515652.0,
|
|
"step": 12830
|
|
},
|
|
{
|
|
"entropy": 6.272677850723267,
|
|
"epoch": 1.4812463935372187,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.000479134390580042,
|
|
"loss": 5.8576,
|
|
"mean_token_accuracy": 0.18222525715827942,
|
|
"num_tokens": 32527620.0,
|
|
"step": 12835
|
|
},
|
|
{
|
|
"entropy": 6.333395481109619,
|
|
"epoch": 1.4818234275822273,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047911703294283015,
|
|
"loss": 5.8595,
|
|
"mean_token_accuracy": 0.1895024448633194,
|
|
"num_tokens": 32540948.0,
|
|
"step": 12840
|
|
},
|
|
{
|
|
"entropy": 6.189630079269409,
|
|
"epoch": 1.482400461627236,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.00047909966844024334,
|
|
"loss": 5.8242,
|
|
"mean_token_accuracy": 0.19464778155088425,
|
|
"num_tokens": 32553311.0,
|
|
"step": 12845
|
|
},
|
|
{
|
|
"entropy": 6.1735701084136965,
|
|
"epoch": 1.4829774956722446,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00047908229707286547,
|
|
"loss": 5.7488,
|
|
"mean_token_accuracy": 0.1950527086853981,
|
|
"num_tokens": 32564639.0,
|
|
"step": 12850
|
|
},
|
|
{
|
|
"entropy": 6.22589693069458,
|
|
"epoch": 1.4835545297172534,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.000479064918841281,
|
|
"loss": 5.8654,
|
|
"mean_token_accuracy": 0.1862518757581711,
|
|
"num_tokens": 32577255.0,
|
|
"step": 12855
|
|
},
|
|
{
|
|
"entropy": 6.181830739974975,
|
|
"epoch": 1.4841315637622619,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00047904753374607427,
|
|
"loss": 5.8111,
|
|
"mean_token_accuracy": 0.19516809582710265,
|
|
"num_tokens": 32590201.0,
|
|
"step": 12860
|
|
},
|
|
{
|
|
"entropy": 6.255477809906006,
|
|
"epoch": 1.4847085978072707,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00047903014178783015,
|
|
"loss": 5.7877,
|
|
"mean_token_accuracy": 0.18771864622831344,
|
|
"num_tokens": 32603010.0,
|
|
"step": 12865
|
|
},
|
|
{
|
|
"entropy": 6.286900043487549,
|
|
"epoch": 1.4852856318522794,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004790127429671335,
|
|
"loss": 5.8502,
|
|
"mean_token_accuracy": 0.1860107198357582,
|
|
"num_tokens": 32614579.0,
|
|
"step": 12870
|
|
},
|
|
{
|
|
"entropy": 6.219177675247193,
|
|
"epoch": 1.485862665897288,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004789953372845697,
|
|
"loss": 5.7603,
|
|
"mean_token_accuracy": 0.1955152302980423,
|
|
"num_tokens": 32627696.0,
|
|
"step": 12875
|
|
},
|
|
{
|
|
"entropy": 6.239347314834594,
|
|
"epoch": 1.4864396999422966,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.000478977924740724,
|
|
"loss": 5.9017,
|
|
"mean_token_accuracy": 0.18081731498241424,
|
|
"num_tokens": 32640824.0,
|
|
"step": 12880
|
|
},
|
|
{
|
|
"entropy": 6.249517917633057,
|
|
"epoch": 1.4870167339873053,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004789605053361821,
|
|
"loss": 5.789,
|
|
"mean_token_accuracy": 0.19380044490098952,
|
|
"num_tokens": 32654373.0,
|
|
"step": 12885
|
|
},
|
|
{
|
|
"entropy": 6.3021715641021725,
|
|
"epoch": 1.487593768032314,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004789430790715299,
|
|
"loss": 5.9189,
|
|
"mean_token_accuracy": 0.182830311357975,
|
|
"num_tokens": 32667717.0,
|
|
"step": 12890
|
|
},
|
|
{
|
|
"entropy": 6.217434310913086,
|
|
"epoch": 1.4881708020773226,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00047892564594735355,
|
|
"loss": 5.8393,
|
|
"mean_token_accuracy": 0.18886099755764008,
|
|
"num_tokens": 32681529.0,
|
|
"step": 12895
|
|
},
|
|
{
|
|
"entropy": 6.300730133056641,
|
|
"epoch": 1.4887478361223312,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00047890820596423943,
|
|
"loss": 5.9136,
|
|
"mean_token_accuracy": 0.18771759420633316,
|
|
"num_tokens": 32694883.0,
|
|
"step": 12900
|
|
},
|
|
{
|
|
"entropy": 6.236034631729126,
|
|
"epoch": 1.4893248701673398,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.000478890759122774,
|
|
"loss": 5.7976,
|
|
"mean_token_accuracy": 0.19470180720090866,
|
|
"num_tokens": 32706908.0,
|
|
"step": 12905
|
|
},
|
|
{
|
|
"entropy": 6.279126119613648,
|
|
"epoch": 1.4899019042123485,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004788733054235443,
|
|
"loss": 5.8185,
|
|
"mean_token_accuracy": 0.18948618620634078,
|
|
"num_tokens": 32720057.0,
|
|
"step": 12910
|
|
},
|
|
{
|
|
"entropy": 6.199473190307617,
|
|
"epoch": 1.4904789382573571,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00047885584486713717,
|
|
"loss": 5.823,
|
|
"mean_token_accuracy": 0.19341208040714264,
|
|
"num_tokens": 32732200.0,
|
|
"step": 12915
|
|
},
|
|
{
|
|
"entropy": 6.187557029724121,
|
|
"epoch": 1.491055972302366,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004788383774541399,
|
|
"loss": 5.7755,
|
|
"mean_token_accuracy": 0.20056941658258437,
|
|
"num_tokens": 32745144.0,
|
|
"step": 12920
|
|
},
|
|
{
|
|
"entropy": 6.1955255508422855,
|
|
"epoch": 1.4916330063473744,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004788209031851402,
|
|
"loss": 5.8306,
|
|
"mean_token_accuracy": 0.19000527113676072,
|
|
"num_tokens": 32757495.0,
|
|
"step": 12925
|
|
},
|
|
{
|
|
"entropy": 6.109148597717285,
|
|
"epoch": 1.4922100403923833,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004788034220607256,
|
|
"loss": 5.7325,
|
|
"mean_token_accuracy": 0.1950483053922653,
|
|
"num_tokens": 32769562.0,
|
|
"step": 12930
|
|
},
|
|
{
|
|
"entropy": 6.2173021793365475,
|
|
"epoch": 1.4927870744373917,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00047878593408148405,
|
|
"loss": 5.7953,
|
|
"mean_token_accuracy": 0.19607421159744262,
|
|
"num_tokens": 32782234.0,
|
|
"step": 12935
|
|
},
|
|
{
|
|
"entropy": 6.2127049446105955,
|
|
"epoch": 1.4933641084824005,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00047876843924800393,
|
|
"loss": 5.8,
|
|
"mean_token_accuracy": 0.18992753624916076,
|
|
"num_tokens": 32795274.0,
|
|
"step": 12940
|
|
},
|
|
{
|
|
"entropy": 6.185367918014526,
|
|
"epoch": 1.4939411425274092,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004787509375608735,
|
|
"loss": 5.7714,
|
|
"mean_token_accuracy": 0.19010636657476426,
|
|
"num_tokens": 32808338.0,
|
|
"step": 12945
|
|
},
|
|
{
|
|
"entropy": 6.238684892654419,
|
|
"epoch": 1.4945181765724178,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00047873342902068157,
|
|
"loss": 5.8263,
|
|
"mean_token_accuracy": 0.18555284589529036,
|
|
"num_tokens": 32820204.0,
|
|
"step": 12950
|
|
},
|
|
{
|
|
"entropy": 6.266605186462402,
|
|
"epoch": 1.4950952106174265,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00047871591362801694,
|
|
"loss": 5.8544,
|
|
"mean_token_accuracy": 0.18671264350414277,
|
|
"num_tokens": 32832998.0,
|
|
"step": 12955
|
|
},
|
|
{
|
|
"entropy": 6.13381404876709,
|
|
"epoch": 1.495672244662435,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004786983913834687,
|
|
"loss": 5.8379,
|
|
"mean_token_accuracy": 0.188638374209404,
|
|
"num_tokens": 32845484.0,
|
|
"step": 12960
|
|
},
|
|
{
|
|
"entropy": 6.316340970993042,
|
|
"epoch": 1.4962492787074437,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00047868086228762633,
|
|
"loss": 5.9324,
|
|
"mean_token_accuracy": 0.18515325337648392,
|
|
"num_tokens": 32857718.0,
|
|
"step": 12965
|
|
},
|
|
{
|
|
"entropy": 6.281667041778564,
|
|
"epoch": 1.4968263127524524,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00047866332634107926,
|
|
"loss": 5.8123,
|
|
"mean_token_accuracy": 0.19124829024076462,
|
|
"num_tokens": 32869908.0,
|
|
"step": 12970
|
|
},
|
|
{
|
|
"entropy": 6.1783287525177,
|
|
"epoch": 1.497403346797461,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00047864578354441743,
|
|
"loss": 5.8322,
|
|
"mean_token_accuracy": 0.19004736691713334,
|
|
"num_tokens": 32882549.0,
|
|
"step": 12975
|
|
},
|
|
{
|
|
"entropy": 6.186053657531739,
|
|
"epoch": 1.4979803808424696,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004786282338982308,
|
|
"loss": 5.773,
|
|
"mean_token_accuracy": 0.1942482754588127,
|
|
"num_tokens": 32894587.0,
|
|
"step": 12980
|
|
},
|
|
{
|
|
"entropy": 6.266414165496826,
|
|
"epoch": 1.4985574148874783,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004786106774031096,
|
|
"loss": 5.8358,
|
|
"mean_token_accuracy": 0.1882964327931404,
|
|
"num_tokens": 32907001.0,
|
|
"step": 12985
|
|
},
|
|
{
|
|
"entropy": 6.235092544555664,
|
|
"epoch": 1.499134448932487,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004785931140596445,
|
|
"loss": 5.8035,
|
|
"mean_token_accuracy": 0.19003380984067916,
|
|
"num_tokens": 32919498.0,
|
|
"step": 12990
|
|
},
|
|
{
|
|
"entropy": 6.293325567245484,
|
|
"epoch": 1.4997114829774958,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047857554386842606,
|
|
"loss": 5.9188,
|
|
"mean_token_accuracy": 0.18067218661308287,
|
|
"num_tokens": 32932611.0,
|
|
"step": 12995
|
|
},
|
|
{
|
|
"entropy": 6.19683198928833,
|
|
"epoch": 1.5002885170225042,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00047855796683004534,
|
|
"loss": 5.7998,
|
|
"mean_token_accuracy": 0.18689163625240326,
|
|
"num_tokens": 32944845.0,
|
|
"step": 13000
|
|
},
|
|
{
|
|
"entropy": 6.271070766448974,
|
|
"epoch": 1.500865551067513,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00047854038294509356,
|
|
"loss": 5.8457,
|
|
"mean_token_accuracy": 0.17760048061609268,
|
|
"num_tokens": 32958076.0,
|
|
"step": 13005
|
|
},
|
|
{
|
|
"entropy": 6.289440774917603,
|
|
"epoch": 1.5014425851125215,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004785227922141621,
|
|
"loss": 5.8597,
|
|
"mean_token_accuracy": 0.19118052423000337,
|
|
"num_tokens": 32968984.0,
|
|
"step": 13010
|
|
},
|
|
{
|
|
"entropy": 6.310905838012696,
|
|
"epoch": 1.5020196191575304,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00047850519463784263,
|
|
"loss": 5.9457,
|
|
"mean_token_accuracy": 0.1839376851916313,
|
|
"num_tokens": 32981488.0,
|
|
"step": 13015
|
|
},
|
|
{
|
|
"entropy": 6.229884433746338,
|
|
"epoch": 1.502596653202539,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00047848759021672693,
|
|
"loss": 5.8199,
|
|
"mean_token_accuracy": 0.19131330102682115,
|
|
"num_tokens": 32994156.0,
|
|
"step": 13020
|
|
},
|
|
{
|
|
"entropy": 6.235915327072144,
|
|
"epoch": 1.5031736872475476,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004784699789514073,
|
|
"loss": 5.8013,
|
|
"mean_token_accuracy": 0.18914027214050294,
|
|
"num_tokens": 33007135.0,
|
|
"step": 13025
|
|
},
|
|
{
|
|
"entropy": 6.28277621269226,
|
|
"epoch": 1.5037507212925563,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.000478452360842476,
|
|
"loss": 5.9116,
|
|
"mean_token_accuracy": 0.18403880894184113,
|
|
"num_tokens": 33021259.0,
|
|
"step": 13030
|
|
},
|
|
{
|
|
"entropy": 6.236955165863037,
|
|
"epoch": 1.504327755337565,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00047843473589052557,
|
|
"loss": 5.84,
|
|
"mean_token_accuracy": 0.18680391758680343,
|
|
"num_tokens": 33033690.0,
|
|
"step": 13035
|
|
},
|
|
{
|
|
"entropy": 6.26040506362915,
|
|
"epoch": 1.5049047893825735,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00047841710409614893,
|
|
"loss": 5.823,
|
|
"mean_token_accuracy": 0.1852077528834343,
|
|
"num_tokens": 33045744.0,
|
|
"step": 13040
|
|
},
|
|
{
|
|
"entropy": 6.271863794326782,
|
|
"epoch": 1.5054818234275822,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004783994654599389,
|
|
"loss": 5.8906,
|
|
"mean_token_accuracy": 0.17971572130918503,
|
|
"num_tokens": 33058307.0,
|
|
"step": 13045
|
|
},
|
|
{
|
|
"entropy": 6.303907442092895,
|
|
"epoch": 1.5060588574725908,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00047838181998248897,
|
|
"loss": 5.9115,
|
|
"mean_token_accuracy": 0.181523796916008,
|
|
"num_tokens": 33073622.0,
|
|
"step": 13050
|
|
},
|
|
{
|
|
"entropy": 6.216773843765258,
|
|
"epoch": 1.5066358915175995,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004783641676643925,
|
|
"loss": 5.7545,
|
|
"mean_token_accuracy": 0.19235570430755616,
|
|
"num_tokens": 33087286.0,
|
|
"step": 13055
|
|
},
|
|
{
|
|
"entropy": 6.204124641418457,
|
|
"epoch": 1.5072129255626083,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.00047834650850624334,
|
|
"loss": 5.8409,
|
|
"mean_token_accuracy": 0.19425424188375473,
|
|
"num_tokens": 33100333.0,
|
|
"step": 13060
|
|
},
|
|
{
|
|
"entropy": 6.163000631332397,
|
|
"epoch": 1.5077899596076167,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004783288425086353,
|
|
"loss": 5.8379,
|
|
"mean_token_accuracy": 0.18831825852394105,
|
|
"num_tokens": 33111318.0,
|
|
"step": 13065
|
|
},
|
|
{
|
|
"entropy": 6.296581697463989,
|
|
"epoch": 1.5083669936526256,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004783111696721627,
|
|
"loss": 5.9124,
|
|
"mean_token_accuracy": 0.1840219795703888,
|
|
"num_tokens": 33123766.0,
|
|
"step": 13070
|
|
},
|
|
{
|
|
"entropy": 6.241482782363891,
|
|
"epoch": 1.508944027697634,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004782934899974199,
|
|
"loss": 5.7843,
|
|
"mean_token_accuracy": 0.19748201221227646,
|
|
"num_tokens": 33136042.0,
|
|
"step": 13075
|
|
},
|
|
{
|
|
"entropy": 6.191297292709351,
|
|
"epoch": 1.5095210617426429,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00047827580348500147,
|
|
"loss": 5.7749,
|
|
"mean_token_accuracy": 0.19063863754272461,
|
|
"num_tokens": 33148451.0,
|
|
"step": 13080
|
|
},
|
|
{
|
|
"entropy": 6.206788158416748,
|
|
"epoch": 1.5100980957876513,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00047825811013550246,
|
|
"loss": 5.8011,
|
|
"mean_token_accuracy": 0.19754028767347337,
|
|
"num_tokens": 33161886.0,
|
|
"step": 13085
|
|
},
|
|
{
|
|
"entropy": 6.217094087600708,
|
|
"epoch": 1.5106751298326602,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00047824040994951786,
|
|
"loss": 5.8841,
|
|
"mean_token_accuracy": 0.19206815510988234,
|
|
"num_tokens": 33174812.0,
|
|
"step": 13090
|
|
},
|
|
{
|
|
"entropy": 6.256129360198974,
|
|
"epoch": 1.5112521638776688,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004782227029276429,
|
|
"loss": 5.8011,
|
|
"mean_token_accuracy": 0.1992778956890106,
|
|
"num_tokens": 33187389.0,
|
|
"step": 13095
|
|
},
|
|
{
|
|
"entropy": 6.154243993759155,
|
|
"epoch": 1.5118291979226774,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00047820498907047345,
|
|
"loss": 5.7544,
|
|
"mean_token_accuracy": 0.19293652325868607,
|
|
"num_tokens": 33200106.0,
|
|
"step": 13100
|
|
},
|
|
{
|
|
"entropy": 6.208034801483154,
|
|
"epoch": 1.512406231967686,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.000478187268378605,
|
|
"loss": 5.7489,
|
|
"mean_token_accuracy": 0.19893669188022614,
|
|
"num_tokens": 33212929.0,
|
|
"step": 13105
|
|
},
|
|
{
|
|
"entropy": 6.18809814453125,
|
|
"epoch": 1.5129832660126947,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00047816954085263375,
|
|
"loss": 5.8521,
|
|
"mean_token_accuracy": 0.19083169847726822,
|
|
"num_tokens": 33226068.0,
|
|
"step": 13110
|
|
},
|
|
{
|
|
"entropy": 6.156454467773438,
|
|
"epoch": 1.5135603000577034,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004781518064931559,
|
|
"loss": 5.7753,
|
|
"mean_token_accuracy": 0.19173873215913773,
|
|
"num_tokens": 33237677.0,
|
|
"step": 13115
|
|
},
|
|
{
|
|
"entropy": 6.252213764190674,
|
|
"epoch": 1.514137334102712,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.000478134065300768,
|
|
"loss": 5.8582,
|
|
"mean_token_accuracy": 0.1917392447590828,
|
|
"num_tokens": 33250640.0,
|
|
"step": 13120
|
|
},
|
|
{
|
|
"entropy": 6.208042573928833,
|
|
"epoch": 1.5147143681477209,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004781163172760667,
|
|
"loss": 5.785,
|
|
"mean_token_accuracy": 0.1916109725832939,
|
|
"num_tokens": 33262899.0,
|
|
"step": 13125
|
|
},
|
|
{
|
|
"entropy": 6.271803617477417,
|
|
"epoch": 1.5152914021927293,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00047809856241964893,
|
|
"loss": 5.8185,
|
|
"mean_token_accuracy": 0.19186412245035173,
|
|
"num_tokens": 33275073.0,
|
|
"step": 13130
|
|
},
|
|
{
|
|
"entropy": 6.194020318984985,
|
|
"epoch": 1.5158684362377381,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004780808007321119,
|
|
"loss": 5.8097,
|
|
"mean_token_accuracy": 0.18588352501392363,
|
|
"num_tokens": 33286285.0,
|
|
"step": 13135
|
|
},
|
|
{
|
|
"entropy": 6.280729103088379,
|
|
"epoch": 1.5164454702827466,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004780630322140531,
|
|
"loss": 5.8053,
|
|
"mean_token_accuracy": 0.19529957920312882,
|
|
"num_tokens": 33297745.0,
|
|
"step": 13140
|
|
},
|
|
{
|
|
"entropy": 6.28461332321167,
|
|
"epoch": 1.5170225043277554,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00047804525686607,
|
|
"loss": 5.862,
|
|
"mean_token_accuracy": 0.17993441820144654,
|
|
"num_tokens": 33309463.0,
|
|
"step": 13145
|
|
},
|
|
{
|
|
"entropy": 6.230080080032349,
|
|
"epoch": 1.5175995383727638,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004780274746887606,
|
|
"loss": 5.8296,
|
|
"mean_token_accuracy": 0.18709089905023574,
|
|
"num_tokens": 33322352.0,
|
|
"step": 13150
|
|
},
|
|
{
|
|
"entropy": 6.254903411865234,
|
|
"epoch": 1.5181765724177727,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00047800968568272284,
|
|
"loss": 5.8897,
|
|
"mean_token_accuracy": 0.1886549025774002,
|
|
"num_tokens": 33336051.0,
|
|
"step": 13155
|
|
},
|
|
{
|
|
"entropy": 6.218223762512207,
|
|
"epoch": 1.5187536064627813,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004779918898485551,
|
|
"loss": 5.8053,
|
|
"mean_token_accuracy": 0.18849124908447265,
|
|
"num_tokens": 33350321.0,
|
|
"step": 13160
|
|
},
|
|
{
|
|
"entropy": 6.225475931167603,
|
|
"epoch": 1.51933064050779,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.00047797408718685614,
|
|
"loss": 5.7767,
|
|
"mean_token_accuracy": 0.19050310999155046,
|
|
"num_tokens": 33363637.0,
|
|
"step": 13165
|
|
},
|
|
{
|
|
"entropy": 6.214481449127197,
|
|
"epoch": 1.5199076745527986,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047795627769822447,
|
|
"loss": 5.7798,
|
|
"mean_token_accuracy": 0.19742291122674943,
|
|
"num_tokens": 33376257.0,
|
|
"step": 13170
|
|
},
|
|
{
|
|
"entropy": 6.135192155838013,
|
|
"epoch": 1.5204847085978073,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00047793846138325925,
|
|
"loss": 5.7453,
|
|
"mean_token_accuracy": 0.1947900339961052,
|
|
"num_tokens": 33388812.0,
|
|
"step": 13175
|
|
},
|
|
{
|
|
"entropy": 6.2147955894470215,
|
|
"epoch": 1.521061742642816,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004779206382425598,
|
|
"loss": 5.8117,
|
|
"mean_token_accuracy": 0.1930110424757004,
|
|
"num_tokens": 33401141.0,
|
|
"step": 13180
|
|
},
|
|
{
|
|
"entropy": 6.252952575683594,
|
|
"epoch": 1.5216387766878245,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004779028082767253,
|
|
"loss": 5.8197,
|
|
"mean_token_accuracy": 0.19050996899604797,
|
|
"num_tokens": 33412821.0,
|
|
"step": 13185
|
|
},
|
|
{
|
|
"entropy": 6.212389230728149,
|
|
"epoch": 1.5222158107328332,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004778849714863557,
|
|
"loss": 5.8589,
|
|
"mean_token_accuracy": 0.183637772500515,
|
|
"num_tokens": 33424709.0,
|
|
"step": 13190
|
|
},
|
|
{
|
|
"entropy": 6.235611343383789,
|
|
"epoch": 1.5227928447778418,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004778671278720508,
|
|
"loss": 5.8681,
|
|
"mean_token_accuracy": 0.186078442633152,
|
|
"num_tokens": 33437069.0,
|
|
"step": 13195
|
|
},
|
|
{
|
|
"entropy": 6.228446388244629,
|
|
"epoch": 1.5233698788228507,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004778492774344109,
|
|
"loss": 5.7122,
|
|
"mean_token_accuracy": 0.19611677676439285,
|
|
"num_tokens": 33449441.0,
|
|
"step": 13200
|
|
},
|
|
{
|
|
"entropy": 6.274533605575561,
|
|
"epoch": 1.523946912867859,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004778314201740363,
|
|
"loss": 5.8927,
|
|
"mean_token_accuracy": 0.1851292923092842,
|
|
"num_tokens": 33463184.0,
|
|
"step": 13205
|
|
},
|
|
{
|
|
"entropy": 6.205833292007446,
|
|
"epoch": 1.524523946912868,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00047781355609152764,
|
|
"loss": 5.7542,
|
|
"mean_token_accuracy": 0.19649343192577362,
|
|
"num_tokens": 33476118.0,
|
|
"step": 13210
|
|
},
|
|
{
|
|
"entropy": 6.192588806152344,
|
|
"epoch": 1.5251009809578764,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004777956851874858,
|
|
"loss": 5.7489,
|
|
"mean_token_accuracy": 0.1931898131966591,
|
|
"num_tokens": 33487575.0,
|
|
"step": 13215
|
|
},
|
|
{
|
|
"entropy": 6.272642326354981,
|
|
"epoch": 1.5256780150028852,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00047777780746251176,
|
|
"loss": 5.8292,
|
|
"mean_token_accuracy": 0.18742457628250123,
|
|
"num_tokens": 33499507.0,
|
|
"step": 13220
|
|
},
|
|
{
|
|
"entropy": 6.195057535171509,
|
|
"epoch": 1.5262550490478937,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00047775992291720687,
|
|
"loss": 5.8102,
|
|
"mean_token_accuracy": 0.19332896620035173,
|
|
"num_tokens": 33513818.0,
|
|
"step": 13225
|
|
},
|
|
{
|
|
"entropy": 6.250328063964844,
|
|
"epoch": 1.5268320830929025,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004777420315521728,
|
|
"loss": 5.8313,
|
|
"mean_token_accuracy": 0.186712084710598,
|
|
"num_tokens": 33525762.0,
|
|
"step": 13230
|
|
},
|
|
{
|
|
"entropy": 6.17367377281189,
|
|
"epoch": 1.5274091171379112,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004777241333680111,
|
|
"loss": 5.7218,
|
|
"mean_token_accuracy": 0.198297181725502,
|
|
"num_tokens": 33537469.0,
|
|
"step": 13235
|
|
},
|
|
{
|
|
"entropy": 6.186795091629028,
|
|
"epoch": 1.5279861511829198,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004777062283653239,
|
|
"loss": 5.8291,
|
|
"mean_token_accuracy": 0.19145113229751587,
|
|
"num_tokens": 33550226.0,
|
|
"step": 13240
|
|
},
|
|
{
|
|
"entropy": 6.280914831161499,
|
|
"epoch": 1.5285631852279284,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047768831654471333,
|
|
"loss": 5.8919,
|
|
"mean_token_accuracy": 0.18494420349597931,
|
|
"num_tokens": 33564164.0,
|
|
"step": 13245
|
|
},
|
|
{
|
|
"entropy": 6.200793647766114,
|
|
"epoch": 1.529140219272937,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00047767039790678204,
|
|
"loss": 5.7056,
|
|
"mean_token_accuracy": 0.19484343230724335,
|
|
"num_tokens": 33576295.0,
|
|
"step": 13250
|
|
},
|
|
{
|
|
"entropy": 6.15148024559021,
|
|
"epoch": 1.5297172533179457,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00047765247245213255,
|
|
"loss": 5.708,
|
|
"mean_token_accuracy": 0.20231665521860123,
|
|
"num_tokens": 33587950.0,
|
|
"step": 13255
|
|
},
|
|
{
|
|
"entropy": 6.191800355911255,
|
|
"epoch": 1.5302942873629544,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004776345401813678,
|
|
"loss": 5.8057,
|
|
"mean_token_accuracy": 0.19851236641407013,
|
|
"num_tokens": 33600201.0,
|
|
"step": 13260
|
|
},
|
|
{
|
|
"entropy": 6.243471622467041,
|
|
"epoch": 1.5308713214079632,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00047761660109509095,
|
|
"loss": 5.8596,
|
|
"mean_token_accuracy": 0.19617122262716294,
|
|
"num_tokens": 33612355.0,
|
|
"step": 13265
|
|
},
|
|
{
|
|
"entropy": 6.280506610870361,
|
|
"epoch": 1.5314483554529716,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004775986551939054,
|
|
"loss": 5.8599,
|
|
"mean_token_accuracy": 0.18742733150720597,
|
|
"num_tokens": 33626322.0,
|
|
"step": 13270
|
|
},
|
|
{
|
|
"entropy": 6.191336297988892,
|
|
"epoch": 1.5320253894979805,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00047758070247841465,
|
|
"loss": 5.7776,
|
|
"mean_token_accuracy": 0.19153404384851455,
|
|
"num_tokens": 33638433.0,
|
|
"step": 13275
|
|
},
|
|
{
|
|
"entropy": 6.221687507629395,
|
|
"epoch": 1.532602423542989,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00047756274294922266,
|
|
"loss": 5.8007,
|
|
"mean_token_accuracy": 0.1957632526755333,
|
|
"num_tokens": 33651743.0,
|
|
"step": 13280
|
|
},
|
|
{
|
|
"entropy": 6.283531665802002,
|
|
"epoch": 1.5331794575879978,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004775447766069334,
|
|
"loss": 5.8932,
|
|
"mean_token_accuracy": 0.1905313104391098,
|
|
"num_tokens": 33663546.0,
|
|
"step": 13285
|
|
},
|
|
{
|
|
"entropy": 6.255209875106812,
|
|
"epoch": 1.5337564916330062,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00047752680345215115,
|
|
"loss": 5.8374,
|
|
"mean_token_accuracy": 0.18721415102481842,
|
|
"num_tokens": 33675358.0,
|
|
"step": 13290
|
|
},
|
|
{
|
|
"entropy": 6.268837118148804,
|
|
"epoch": 1.534333525678015,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004775088234854805,
|
|
"loss": 5.7914,
|
|
"mean_token_accuracy": 0.18973737806081772,
|
|
"num_tokens": 33688066.0,
|
|
"step": 13295
|
|
},
|
|
{
|
|
"entropy": 6.1976690769195555,
|
|
"epoch": 1.5349105597230237,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004774908367075262,
|
|
"loss": 5.8236,
|
|
"mean_token_accuracy": 0.19111677557229995,
|
|
"num_tokens": 33700829.0,
|
|
"step": 13300
|
|
},
|
|
{
|
|
"entropy": 6.174250936508178,
|
|
"epoch": 1.5354875937680323,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004774728431188931,
|
|
"loss": 5.7823,
|
|
"mean_token_accuracy": 0.18667507469654082,
|
|
"num_tokens": 33714049.0,
|
|
"step": 13305
|
|
},
|
|
{
|
|
"entropy": 6.153797626495361,
|
|
"epoch": 1.536064627813041,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00047745484272018664,
|
|
"loss": 5.7376,
|
|
"mean_token_accuracy": 0.1966078385710716,
|
|
"num_tokens": 33727026.0,
|
|
"step": 13310
|
|
},
|
|
{
|
|
"entropy": 6.212672233581543,
|
|
"epoch": 1.5366416618580496,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004774368355120119,
|
|
"loss": 5.7338,
|
|
"mean_token_accuracy": 0.20255094915628433,
|
|
"num_tokens": 33740400.0,
|
|
"step": 13315
|
|
},
|
|
{
|
|
"entropy": 6.047137498855591,
|
|
"epoch": 1.5372186959030583,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.000477418821494975,
|
|
"loss": 5.6107,
|
|
"mean_token_accuracy": 0.20713855773210527,
|
|
"num_tokens": 33753621.0,
|
|
"step": 13320
|
|
},
|
|
{
|
|
"entropy": 6.251862668991089,
|
|
"epoch": 1.537795729948067,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004774008006696814,
|
|
"loss": 5.8651,
|
|
"mean_token_accuracy": 0.18378251641988755,
|
|
"num_tokens": 33765458.0,
|
|
"step": 13325
|
|
},
|
|
{
|
|
"entropy": 6.323590993881226,
|
|
"epoch": 1.5383727639930755,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004773827730367375,
|
|
"loss": 5.8993,
|
|
"mean_token_accuracy": 0.1841868206858635,
|
|
"num_tokens": 33777264.0,
|
|
"step": 13330
|
|
},
|
|
{
|
|
"entropy": 6.242207384109497,
|
|
"epoch": 1.5389497980380842,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047736473859674955,
|
|
"loss": 5.8134,
|
|
"mean_token_accuracy": 0.1927764505147934,
|
|
"num_tokens": 33789837.0,
|
|
"step": 13335
|
|
},
|
|
{
|
|
"entropy": 6.089216327667236,
|
|
"epoch": 1.539526832083093,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00047734669735032404,
|
|
"loss": 5.7171,
|
|
"mean_token_accuracy": 0.19926753938198088,
|
|
"num_tokens": 33801666.0,
|
|
"step": 13340
|
|
},
|
|
{
|
|
"entropy": 6.197734022140503,
|
|
"epoch": 1.5401038661281015,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00047732864929806796,
|
|
"loss": 5.8392,
|
|
"mean_token_accuracy": 0.1812909036874771,
|
|
"num_tokens": 33813909.0,
|
|
"step": 13345
|
|
},
|
|
{
|
|
"entropy": 6.198130559921265,
|
|
"epoch": 1.5406809001731103,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004773105944405883,
|
|
"loss": 5.8364,
|
|
"mean_token_accuracy": 0.19269849210977555,
|
|
"num_tokens": 33827081.0,
|
|
"step": 13350
|
|
},
|
|
{
|
|
"entropy": 6.183778619766235,
|
|
"epoch": 1.5412579342181187,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00047729253277849226,
|
|
"loss": 5.7523,
|
|
"mean_token_accuracy": 0.1987853080034256,
|
|
"num_tokens": 33838261.0,
|
|
"step": 13355
|
|
},
|
|
{
|
|
"entropy": 6.254490613937378,
|
|
"epoch": 1.5418349682631276,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00047727446431238734,
|
|
"loss": 5.9129,
|
|
"mean_token_accuracy": 0.18299975246191025,
|
|
"num_tokens": 33850189.0,
|
|
"step": 13360
|
|
},
|
|
{
|
|
"entropy": 6.303029108047485,
|
|
"epoch": 1.542412002308136,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004772563890428813,
|
|
"loss": 5.8937,
|
|
"mean_token_accuracy": 0.18921637237071992,
|
|
"num_tokens": 33863570.0,
|
|
"step": 13365
|
|
},
|
|
{
|
|
"entropy": 6.217037868499756,
|
|
"epoch": 1.5429890363531449,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004772383069705821,
|
|
"loss": 5.8257,
|
|
"mean_token_accuracy": 0.18908795416355134,
|
|
"num_tokens": 33876583.0,
|
|
"step": 13370
|
|
},
|
|
{
|
|
"entropy": 6.289787244796753,
|
|
"epoch": 1.5435660703981535,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004772202180960978,
|
|
"loss": 5.8502,
|
|
"mean_token_accuracy": 0.1855199694633484,
|
|
"num_tokens": 33889744.0,
|
|
"step": 13375
|
|
},
|
|
{
|
|
"entropy": 6.285410022735595,
|
|
"epoch": 1.5441431044431622,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00047720212242003703,
|
|
"loss": 5.8729,
|
|
"mean_token_accuracy": 0.19419652074575425,
|
|
"num_tokens": 33904129.0,
|
|
"step": 13380
|
|
},
|
|
{
|
|
"entropy": 6.162698411941529,
|
|
"epoch": 1.5447201384881708,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047718401994300825,
|
|
"loss": 5.7692,
|
|
"mean_token_accuracy": 0.19252093583345414,
|
|
"num_tokens": 33916277.0,
|
|
"step": 13385
|
|
},
|
|
{
|
|
"entropy": 6.2117432117462155,
|
|
"epoch": 1.5452971725331794,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00047716591066562043,
|
|
"loss": 5.8584,
|
|
"mean_token_accuracy": 0.188547345995903,
|
|
"num_tokens": 33929434.0,
|
|
"step": 13390
|
|
},
|
|
{
|
|
"entropy": 6.270015859603882,
|
|
"epoch": 1.545874206578188,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00047714779458848255,
|
|
"loss": 5.8328,
|
|
"mean_token_accuracy": 0.18586413711309432,
|
|
"num_tokens": 33942376.0,
|
|
"step": 13395
|
|
},
|
|
{
|
|
"entropy": 6.264356374740601,
|
|
"epoch": 1.5464512406231967,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004771296717122041,
|
|
"loss": 5.8404,
|
|
"mean_token_accuracy": 0.19098608046770096,
|
|
"num_tokens": 33955013.0,
|
|
"step": 13400
|
|
},
|
|
{
|
|
"entropy": 6.240370368957519,
|
|
"epoch": 1.5470282746682056,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004771115420373945,
|
|
"loss": 5.8445,
|
|
"mean_token_accuracy": 0.1863965794444084,
|
|
"num_tokens": 33966673.0,
|
|
"step": 13405
|
|
},
|
|
{
|
|
"entropy": 6.177231168746948,
|
|
"epoch": 1.547605308713214,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00047709340556466366,
|
|
"loss": 5.769,
|
|
"mean_token_accuracy": 0.1987849310040474,
|
|
"num_tokens": 33978400.0,
|
|
"step": 13410
|
|
},
|
|
{
|
|
"entropy": 6.298257875442505,
|
|
"epoch": 1.5481823427582229,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00047707526229462144,
|
|
"loss": 5.9266,
|
|
"mean_token_accuracy": 0.18126586228609085,
|
|
"num_tokens": 33990690.0,
|
|
"step": 13415
|
|
},
|
|
{
|
|
"entropy": 6.25822606086731,
|
|
"epoch": 1.5487593768032313,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00047705711222787816,
|
|
"loss": 5.8267,
|
|
"mean_token_accuracy": 0.1906663656234741,
|
|
"num_tokens": 34003992.0,
|
|
"step": 13420
|
|
},
|
|
{
|
|
"entropy": 6.256418752670288,
|
|
"epoch": 1.5493364108482401,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00047703895536504423,
|
|
"loss": 5.8242,
|
|
"mean_token_accuracy": 0.18806500285863875,
|
|
"num_tokens": 34016075.0,
|
|
"step": 13425
|
|
},
|
|
{
|
|
"entropy": 6.231338977813721,
|
|
"epoch": 1.5499134448932486,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004770207917067305,
|
|
"loss": 5.7882,
|
|
"mean_token_accuracy": 0.18892282098531724,
|
|
"num_tokens": 34029143.0,
|
|
"step": 13430
|
|
},
|
|
{
|
|
"entropy": 6.201420450210572,
|
|
"epoch": 1.5504904789382574,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047700262125354765,
|
|
"loss": 5.8749,
|
|
"mean_token_accuracy": 0.19344826638698578,
|
|
"num_tokens": 34041269.0,
|
|
"step": 13435
|
|
},
|
|
{
|
|
"entropy": 6.238750314712524,
|
|
"epoch": 1.551067512983266,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047698444400610707,
|
|
"loss": 5.8859,
|
|
"mean_token_accuracy": 0.18998730182647705,
|
|
"num_tokens": 34054561.0,
|
|
"step": 13440
|
|
},
|
|
{
|
|
"entropy": 6.205687665939331,
|
|
"epoch": 1.5516445470282747,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047696625996502,
|
|
"loss": 5.7521,
|
|
"mean_token_accuracy": 0.1924416869878769,
|
|
"num_tokens": 34068009.0,
|
|
"step": 13445
|
|
},
|
|
{
|
|
"entropy": 6.221275329589844,
|
|
"epoch": 1.5522215810732833,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00047694806913089815,
|
|
"loss": 5.891,
|
|
"mean_token_accuracy": 0.1905246526002884,
|
|
"num_tokens": 34081217.0,
|
|
"step": 13450
|
|
},
|
|
{
|
|
"entropy": 6.277045774459839,
|
|
"epoch": 1.552798615118292,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004769298715043533,
|
|
"loss": 5.8023,
|
|
"mean_token_accuracy": 0.18520487993955612,
|
|
"num_tokens": 34093903.0,
|
|
"step": 13455
|
|
},
|
|
{
|
|
"entropy": 6.28056845664978,
|
|
"epoch": 1.5533756491633006,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004769116670859975,
|
|
"loss": 5.8674,
|
|
"mean_token_accuracy": 0.18978661596775054,
|
|
"num_tokens": 34105891.0,
|
|
"step": 13460
|
|
},
|
|
{
|
|
"entropy": 6.244111442565918,
|
|
"epoch": 1.5539526832083093,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00047689345587644314,
|
|
"loss": 5.8749,
|
|
"mean_token_accuracy": 0.19215874820947648,
|
|
"num_tokens": 34118438.0,
|
|
"step": 13465
|
|
},
|
|
{
|
|
"entropy": 6.191610431671142,
|
|
"epoch": 1.554529717253318,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00047687523787630256,
|
|
"loss": 5.736,
|
|
"mean_token_accuracy": 0.19659065455198288,
|
|
"num_tokens": 34130383.0,
|
|
"step": 13470
|
|
},
|
|
{
|
|
"entropy": 6.189245986938476,
|
|
"epoch": 1.5551067512983265,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004768570130861887,
|
|
"loss": 5.8577,
|
|
"mean_token_accuracy": 0.19298865050077438,
|
|
"num_tokens": 34143805.0,
|
|
"step": 13475
|
|
},
|
|
{
|
|
"entropy": 6.23731164932251,
|
|
"epoch": 1.5556837853433354,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004768387815067144,
|
|
"loss": 5.7135,
|
|
"mean_token_accuracy": 0.20021907836198807,
|
|
"num_tokens": 34157053.0,
|
|
"step": 13480
|
|
},
|
|
{
|
|
"entropy": 6.2790198802948,
|
|
"epoch": 1.5562608193883438,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00047682054313849304,
|
|
"loss": 5.8953,
|
|
"mean_token_accuracy": 0.1879524365067482,
|
|
"num_tokens": 34168804.0,
|
|
"step": 13485
|
|
},
|
|
{
|
|
"entropy": 6.2272436141967775,
|
|
"epoch": 1.5568378534333527,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004768022979821379,
|
|
"loss": 5.9036,
|
|
"mean_token_accuracy": 0.18060447722673417,
|
|
"num_tokens": 34181201.0,
|
|
"step": 13490
|
|
},
|
|
{
|
|
"entropy": 6.2782214164733885,
|
|
"epoch": 1.557414887478361,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004767840460382628,
|
|
"loss": 5.8846,
|
|
"mean_token_accuracy": 0.18991439938545226,
|
|
"num_tokens": 34193906.0,
|
|
"step": 13495
|
|
},
|
|
{
|
|
"entropy": 6.245473003387451,
|
|
"epoch": 1.55799192152337,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004767657873074815,
|
|
"loss": 5.8902,
|
|
"mean_token_accuracy": 0.18845838755369188,
|
|
"num_tokens": 34207462.0,
|
|
"step": 13500
|
|
},
|
|
{
|
|
"entropy": 6.18796181678772,
|
|
"epoch": 1.5585689555683784,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004767475217904081,
|
|
"loss": 5.7363,
|
|
"mean_token_accuracy": 0.19420798420906066,
|
|
"num_tokens": 34219696.0,
|
|
"step": 13505
|
|
},
|
|
{
|
|
"entropy": 6.205419874191284,
|
|
"epoch": 1.5591459896133872,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00047672924948765705,
|
|
"loss": 5.79,
|
|
"mean_token_accuracy": 0.1927314206957817,
|
|
"num_tokens": 34232413.0,
|
|
"step": 13510
|
|
},
|
|
{
|
|
"entropy": 6.259201574325561,
|
|
"epoch": 1.5597230236583959,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00047671097039984293,
|
|
"loss": 5.8829,
|
|
"mean_token_accuracy": 0.1864104762673378,
|
|
"num_tokens": 34245150.0,
|
|
"step": 13515
|
|
},
|
|
{
|
|
"entropy": 6.23311071395874,
|
|
"epoch": 1.5603000577034045,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00047669268452758053,
|
|
"loss": 5.7247,
|
|
"mean_token_accuracy": 0.1986491337418556,
|
|
"num_tokens": 34257416.0,
|
|
"step": 13520
|
|
},
|
|
{
|
|
"entropy": 6.192863082885742,
|
|
"epoch": 1.5608770917484132,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00047667439187148476,
|
|
"loss": 5.7546,
|
|
"mean_token_accuracy": 0.1986703172326088,
|
|
"num_tokens": 34269518.0,
|
|
"step": 13525
|
|
},
|
|
{
|
|
"entropy": 6.2323802471160885,
|
|
"epoch": 1.5614541257934218,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004766560924321711,
|
|
"loss": 5.7942,
|
|
"mean_token_accuracy": 0.19780726730823517,
|
|
"num_tokens": 34280965.0,
|
|
"step": 13530
|
|
},
|
|
{
|
|
"entropy": 6.22453088760376,
|
|
"epoch": 1.5620311598384304,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.00047663778621025496,
|
|
"loss": 5.8313,
|
|
"mean_token_accuracy": 0.19148373305797578,
|
|
"num_tokens": 34294051.0,
|
|
"step": 13535
|
|
},
|
|
{
|
|
"entropy": 6.268961334228516,
|
|
"epoch": 1.562608193883439,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004766194732063519,
|
|
"loss": 5.863,
|
|
"mean_token_accuracy": 0.18264816850423812,
|
|
"num_tokens": 34308052.0,
|
|
"step": 13540
|
|
},
|
|
{
|
|
"entropy": 6.285745286941529,
|
|
"epoch": 1.563185227928448,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.00047660115342107814,
|
|
"loss": 5.7969,
|
|
"mean_token_accuracy": 0.19112218767404557,
|
|
"num_tokens": 34321802.0,
|
|
"step": 13545
|
|
},
|
|
{
|
|
"entropy": 6.193321275711059,
|
|
"epoch": 1.5637622619734564,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.00047658282685504973,
|
|
"loss": 5.7602,
|
|
"mean_token_accuracy": 0.19718139320611955,
|
|
"num_tokens": 34334789.0,
|
|
"step": 13550
|
|
},
|
|
{
|
|
"entropy": 6.235433149337768,
|
|
"epoch": 1.5643392960184652,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000476564493508883,
|
|
"loss": 5.7801,
|
|
"mean_token_accuracy": 0.19197132885456086,
|
|
"num_tokens": 34347167.0,
|
|
"step": 13555
|
|
},
|
|
{
|
|
"entropy": 6.285042762756348,
|
|
"epoch": 1.5649163300634736,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00047654615338319466,
|
|
"loss": 5.9097,
|
|
"mean_token_accuracy": 0.1878646969795227,
|
|
"num_tokens": 34360468.0,
|
|
"step": 13560
|
|
},
|
|
{
|
|
"entropy": 6.280793809890747,
|
|
"epoch": 1.5654933641084825,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004765278064786016,
|
|
"loss": 5.8745,
|
|
"mean_token_accuracy": 0.18344386219978331,
|
|
"num_tokens": 34373835.0,
|
|
"step": 13565
|
|
},
|
|
{
|
|
"entropy": 6.2916289329528805,
|
|
"epoch": 1.566070398153491,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00047650945279572085,
|
|
"loss": 5.8593,
|
|
"mean_token_accuracy": 0.19200937896966935,
|
|
"num_tokens": 34385591.0,
|
|
"step": 13570
|
|
},
|
|
{
|
|
"entropy": 6.280641365051269,
|
|
"epoch": 1.5666474321984998,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004764910923351698,
|
|
"loss": 5.8864,
|
|
"mean_token_accuracy": 0.183075650036335,
|
|
"num_tokens": 34398980.0,
|
|
"step": 13575
|
|
},
|
|
{
|
|
"entropy": 6.257032251358032,
|
|
"epoch": 1.5672244662435084,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00047647272509756584,
|
|
"loss": 5.869,
|
|
"mean_token_accuracy": 0.18773055970668792,
|
|
"num_tokens": 34412274.0,
|
|
"step": 13580
|
|
},
|
|
{
|
|
"entropy": 6.243408870697022,
|
|
"epoch": 1.567801500288517,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004764543510835269,
|
|
"loss": 5.8246,
|
|
"mean_token_accuracy": 0.19365275353193284,
|
|
"num_tokens": 34425043.0,
|
|
"step": 13585
|
|
},
|
|
{
|
|
"entropy": 6.239257192611694,
|
|
"epoch": 1.5683785343335257,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000476435970293671,
|
|
"loss": 5.8773,
|
|
"mean_token_accuracy": 0.19190652072429656,
|
|
"num_tokens": 34437022.0,
|
|
"step": 13590
|
|
},
|
|
{
|
|
"entropy": 6.168194198608399,
|
|
"epoch": 1.5689555683785343,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.00047641758272861626,
|
|
"loss": 5.6913,
|
|
"mean_token_accuracy": 0.1997967079281807,
|
|
"num_tokens": 34449668.0,
|
|
"step": 13595
|
|
},
|
|
{
|
|
"entropy": 6.230442905426026,
|
|
"epoch": 1.569532602423543,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004763991883889811,
|
|
"loss": 5.7525,
|
|
"mean_token_accuracy": 0.19202667623758315,
|
|
"num_tokens": 34461588.0,
|
|
"step": 13600
|
|
},
|
|
{
|
|
"entropy": 6.194968223571777,
|
|
"epoch": 1.5701096364685516,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004763807872753843,
|
|
"loss": 5.7956,
|
|
"mean_token_accuracy": 0.19065721333026886,
|
|
"num_tokens": 34474696.0,
|
|
"step": 13605
|
|
},
|
|
{
|
|
"entropy": 6.2662159442901615,
|
|
"epoch": 1.5706866705135603,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00047636237938844484,
|
|
"loss": 5.8088,
|
|
"mean_token_accuracy": 0.19261950701475145,
|
|
"num_tokens": 34488477.0,
|
|
"step": 13610
|
|
},
|
|
{
|
|
"entropy": 6.20445556640625,
|
|
"epoch": 1.571263704558569,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004763439647287817,
|
|
"loss": 5.7521,
|
|
"mean_token_accuracy": 0.19336534291505814,
|
|
"num_tokens": 34502159.0,
|
|
"step": 13615
|
|
},
|
|
{
|
|
"entropy": 6.188671398162842,
|
|
"epoch": 1.5718407386035778,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004763255432970144,
|
|
"loss": 5.788,
|
|
"mean_token_accuracy": 0.1959633484482765,
|
|
"num_tokens": 34516247.0,
|
|
"step": 13620
|
|
},
|
|
{
|
|
"entropy": 6.190359258651734,
|
|
"epoch": 1.5724177726485862,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00047630711509376235,
|
|
"loss": 5.6789,
|
|
"mean_token_accuracy": 0.20005650967359542,
|
|
"num_tokens": 34528599.0,
|
|
"step": 13625
|
|
},
|
|
{
|
|
"entropy": 6.272625064849853,
|
|
"epoch": 1.572994806693595,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004762886801196455,
|
|
"loss": 5.8926,
|
|
"mean_token_accuracy": 0.17960608005523682,
|
|
"num_tokens": 34541346.0,
|
|
"step": 13630
|
|
},
|
|
{
|
|
"entropy": 6.311180162429809,
|
|
"epoch": 1.5735718407386035,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00047627023837528386,
|
|
"loss": 5.845,
|
|
"mean_token_accuracy": 0.18619453758001328,
|
|
"num_tokens": 34553934.0,
|
|
"step": 13635
|
|
},
|
|
{
|
|
"entropy": 6.243749475479126,
|
|
"epoch": 1.5741488747836123,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00047625178986129775,
|
|
"loss": 5.8856,
|
|
"mean_token_accuracy": 0.1931193843483925,
|
|
"num_tokens": 34565739.0,
|
|
"step": 13640
|
|
},
|
|
{
|
|
"entropy": 6.188317966461182,
|
|
"epoch": 1.5747259088286207,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004762333345783078,
|
|
"loss": 5.8081,
|
|
"mean_token_accuracy": 0.19340444803237916,
|
|
"num_tokens": 34579062.0,
|
|
"step": 13645
|
|
},
|
|
{
|
|
"entropy": 6.227141380310059,
|
|
"epoch": 1.5753029428736296,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00047621487252693436,
|
|
"loss": 5.8652,
|
|
"mean_token_accuracy": 0.18909793645143508,
|
|
"num_tokens": 34592090.0,
|
|
"step": 13650
|
|
},
|
|
{
|
|
"entropy": 6.149709033966064,
|
|
"epoch": 1.5758799769186382,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00047619640370779876,
|
|
"loss": 5.7026,
|
|
"mean_token_accuracy": 0.19682869613170623,
|
|
"num_tokens": 34604626.0,
|
|
"step": 13655
|
|
},
|
|
{
|
|
"entropy": 6.2658247470855715,
|
|
"epoch": 1.5764570109636469,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047617792812152207,
|
|
"loss": 5.8458,
|
|
"mean_token_accuracy": 0.18907229751348495,
|
|
"num_tokens": 34617174.0,
|
|
"step": 13660
|
|
},
|
|
{
|
|
"entropy": 6.185346984863282,
|
|
"epoch": 1.5770340450086555,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004761594457687256,
|
|
"loss": 5.7213,
|
|
"mean_token_accuracy": 0.19811177551746367,
|
|
"num_tokens": 34629909.0,
|
|
"step": 13665
|
|
},
|
|
{
|
|
"entropy": 6.198504495620727,
|
|
"epoch": 1.5776110790536642,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004761409566500313,
|
|
"loss": 5.7826,
|
|
"mean_token_accuracy": 0.1974416196346283,
|
|
"num_tokens": 34643640.0,
|
|
"step": 13670
|
|
},
|
|
{
|
|
"entropy": 6.230290460586548,
|
|
"epoch": 1.5781881130986728,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00047612246076606066,
|
|
"loss": 5.7578,
|
|
"mean_token_accuracy": 0.1851365178823471,
|
|
"num_tokens": 34655250.0,
|
|
"step": 13675
|
|
},
|
|
{
|
|
"entropy": 6.257380104064941,
|
|
"epoch": 1.5787651471436814,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.00047610395811743594,
|
|
"loss": 5.7802,
|
|
"mean_token_accuracy": 0.1935951068997383,
|
|
"num_tokens": 34669318.0,
|
|
"step": 13680
|
|
},
|
|
{
|
|
"entropy": 6.212140512466431,
|
|
"epoch": 1.5793421811886903,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047608544870477956,
|
|
"loss": 5.8145,
|
|
"mean_token_accuracy": 0.1901389628648758,
|
|
"num_tokens": 34680932.0,
|
|
"step": 13685
|
|
},
|
|
{
|
|
"entropy": 6.2297382831573485,
|
|
"epoch": 1.5799192152336987,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00047606693252871395,
|
|
"loss": 5.9309,
|
|
"mean_token_accuracy": 0.18365089148283004,
|
|
"num_tokens": 34693091.0,
|
|
"step": 13690
|
|
},
|
|
{
|
|
"entropy": 6.239744043350219,
|
|
"epoch": 1.5804962492787076,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.000476048409589862,
|
|
"loss": 5.8484,
|
|
"mean_token_accuracy": 0.19662028700113296,
|
|
"num_tokens": 34706645.0,
|
|
"step": 13695
|
|
},
|
|
{
|
|
"entropy": 6.262181663513184,
|
|
"epoch": 1.581073283323716,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004760298798888466,
|
|
"loss": 5.9018,
|
|
"mean_token_accuracy": 0.18771067559719085,
|
|
"num_tokens": 34718974.0,
|
|
"step": 13700
|
|
},
|
|
{
|
|
"entropy": 6.192539691925049,
|
|
"epoch": 1.5816503173687249,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004760113434262911,
|
|
"loss": 5.8369,
|
|
"mean_token_accuracy": 0.18986850529909133,
|
|
"num_tokens": 34732424.0,
|
|
"step": 13705
|
|
},
|
|
{
|
|
"entropy": 6.183119106292724,
|
|
"epoch": 1.5822273514137333,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047599280020281894,
|
|
"loss": 5.7694,
|
|
"mean_token_accuracy": 0.1920637682080269,
|
|
"num_tokens": 34743865.0,
|
|
"step": 13710
|
|
},
|
|
{
|
|
"entropy": 6.195568656921386,
|
|
"epoch": 1.5828043854587421,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00047597425021905364,
|
|
"loss": 5.714,
|
|
"mean_token_accuracy": 0.1968247890472412,
|
|
"num_tokens": 34756415.0,
|
|
"step": 13715
|
|
},
|
|
{
|
|
"entropy": 6.307136392593383,
|
|
"epoch": 1.5833814195037508,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004759556934756194,
|
|
"loss": 5.851,
|
|
"mean_token_accuracy": 0.18275767266750337,
|
|
"num_tokens": 34769666.0,
|
|
"step": 13720
|
|
},
|
|
{
|
|
"entropy": 6.103635835647583,
|
|
"epoch": 1.5839584535487594,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00047593712997314017,
|
|
"loss": 5.6843,
|
|
"mean_token_accuracy": 0.20277404189109802,
|
|
"num_tokens": 34781523.0,
|
|
"step": 13725
|
|
},
|
|
{
|
|
"entropy": 6.193688011169433,
|
|
"epoch": 1.584535487593768,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00047591855971224035,
|
|
"loss": 5.7348,
|
|
"mean_token_accuracy": 0.20058793425559998,
|
|
"num_tokens": 34794597.0,
|
|
"step": 13730
|
|
},
|
|
{
|
|
"entropy": 6.22872748374939,
|
|
"epoch": 1.5851125216387767,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004758999826935446,
|
|
"loss": 5.8807,
|
|
"mean_token_accuracy": 0.18744026124477386,
|
|
"num_tokens": 34807791.0,
|
|
"step": 13735
|
|
},
|
|
{
|
|
"entropy": 6.279449033737182,
|
|
"epoch": 1.5856895556837853,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004758813989176778,
|
|
"loss": 5.8438,
|
|
"mean_token_accuracy": 0.1967759609222412,
|
|
"num_tokens": 34821456.0,
|
|
"step": 13740
|
|
},
|
|
{
|
|
"entropy": 6.221560335159301,
|
|
"epoch": 1.586266589728794,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00047586280838526483,
|
|
"loss": 5.7788,
|
|
"mean_token_accuracy": 0.19918196201324462,
|
|
"num_tokens": 34834786.0,
|
|
"step": 13745
|
|
},
|
|
{
|
|
"entropy": 6.23402967453003,
|
|
"epoch": 1.5868436237738026,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004758442110969312,
|
|
"loss": 5.8089,
|
|
"mean_token_accuracy": 0.1831536501646042,
|
|
"num_tokens": 34846125.0,
|
|
"step": 13750
|
|
},
|
|
{
|
|
"entropy": 6.30714054107666,
|
|
"epoch": 1.5874206578188113,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004758256070533022,
|
|
"loss": 5.8854,
|
|
"mean_token_accuracy": 0.18437816053628922,
|
|
"num_tokens": 34858438.0,
|
|
"step": 13755
|
|
},
|
|
{
|
|
"entropy": 6.2490949630737305,
|
|
"epoch": 1.5879976918638201,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004758069962550037,
|
|
"loss": 5.8674,
|
|
"mean_token_accuracy": 0.18302336782217027,
|
|
"num_tokens": 34871340.0,
|
|
"step": 13760
|
|
},
|
|
{
|
|
"entropy": 6.250127840042114,
|
|
"epoch": 1.5885747259088285,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00047578837870266156,
|
|
"loss": 5.8296,
|
|
"mean_token_accuracy": 0.18722266256809234,
|
|
"num_tokens": 34882111.0,
|
|
"step": 13765
|
|
},
|
|
{
|
|
"entropy": 6.2264612197875975,
|
|
"epoch": 1.5891517599538374,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00047576975439690206,
|
|
"loss": 5.8497,
|
|
"mean_token_accuracy": 0.18753604739904403,
|
|
"num_tokens": 34895539.0,
|
|
"step": 13770
|
|
},
|
|
{
|
|
"entropy": 6.245386600494385,
|
|
"epoch": 1.5897287939988458,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00047575112333835164,
|
|
"loss": 5.7943,
|
|
"mean_token_accuracy": 0.1940807059407234,
|
|
"num_tokens": 34907860.0,
|
|
"step": 13775
|
|
},
|
|
{
|
|
"entropy": 6.318158340454102,
|
|
"epoch": 1.5903058280438547,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00047573248552763684,
|
|
"loss": 5.9049,
|
|
"mean_token_accuracy": 0.18691892623901368,
|
|
"num_tokens": 34920595.0,
|
|
"step": 13780
|
|
},
|
|
{
|
|
"entropy": 6.237708854675293,
|
|
"epoch": 1.590882862088863,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00047571384096538474,
|
|
"loss": 5.8353,
|
|
"mean_token_accuracy": 0.19281982034444808,
|
|
"num_tokens": 34933458.0,
|
|
"step": 13785
|
|
},
|
|
{
|
|
"entropy": 6.154352331161499,
|
|
"epoch": 1.591459896133872,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004756951896522222,
|
|
"loss": 5.7572,
|
|
"mean_token_accuracy": 0.19540754407644273,
|
|
"num_tokens": 34946872.0,
|
|
"step": 13790
|
|
},
|
|
{
|
|
"entropy": 6.236962699890137,
|
|
"epoch": 1.5920369301788806,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004756765315887766,
|
|
"loss": 5.8304,
|
|
"mean_token_accuracy": 0.1889364406466484,
|
|
"num_tokens": 34959384.0,
|
|
"step": 13795
|
|
},
|
|
{
|
|
"entropy": 6.282778406143189,
|
|
"epoch": 1.5926139642238892,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004756578667756756,
|
|
"loss": 5.8797,
|
|
"mean_token_accuracy": 0.18420573323965073,
|
|
"num_tokens": 34971571.0,
|
|
"step": 13800
|
|
},
|
|
{
|
|
"entropy": 6.234209203720093,
|
|
"epoch": 1.5931909982688979,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004756391952135469,
|
|
"loss": 5.7703,
|
|
"mean_token_accuracy": 0.20292106419801711,
|
|
"num_tokens": 34984897.0,
|
|
"step": 13805
|
|
},
|
|
{
|
|
"entropy": 6.226548194885254,
|
|
"epoch": 1.5937680323139065,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00047562051690301855,
|
|
"loss": 5.8317,
|
|
"mean_token_accuracy": 0.19043446183204651,
|
|
"num_tokens": 34998185.0,
|
|
"step": 13810
|
|
},
|
|
{
|
|
"entropy": 6.307507181167603,
|
|
"epoch": 1.5943450663589152,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00047560183184471873,
|
|
"loss": 5.8377,
|
|
"mean_token_accuracy": 0.18937501907348633,
|
|
"num_tokens": 35010985.0,
|
|
"step": 13815
|
|
},
|
|
{
|
|
"entropy": 6.25484938621521,
|
|
"epoch": 1.5949221004039238,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.000475583140039276,
|
|
"loss": 5.8375,
|
|
"mean_token_accuracy": 0.19109233766794204,
|
|
"num_tokens": 35023785.0,
|
|
"step": 13820
|
|
},
|
|
{
|
|
"entropy": 6.301526784896851,
|
|
"epoch": 1.5954991344489324,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00047556444148731897,
|
|
"loss": 5.8994,
|
|
"mean_token_accuracy": 0.17948832660913466,
|
|
"num_tokens": 35035926.0,
|
|
"step": 13825
|
|
},
|
|
{
|
|
"entropy": 6.276957702636719,
|
|
"epoch": 1.596076168493941,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004755457361894766,
|
|
"loss": 5.832,
|
|
"mean_token_accuracy": 0.19143660515546798,
|
|
"num_tokens": 35048290.0,
|
|
"step": 13830
|
|
},
|
|
{
|
|
"entropy": 6.166981220245361,
|
|
"epoch": 1.59665320253895,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00047552702414637793,
|
|
"loss": 5.7645,
|
|
"mean_token_accuracy": 0.19035774618387222,
|
|
"num_tokens": 35059883.0,
|
|
"step": 13835
|
|
},
|
|
{
|
|
"entropy": 6.277225303649902,
|
|
"epoch": 1.5972302365839584,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00047550830535865245,
|
|
"loss": 5.8617,
|
|
"mean_token_accuracy": 0.1807610049843788,
|
|
"num_tokens": 35071747.0,
|
|
"step": 13840
|
|
},
|
|
{
|
|
"entropy": 6.190814876556397,
|
|
"epoch": 1.5978072706289672,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00047548957982692974,
|
|
"loss": 5.8134,
|
|
"mean_token_accuracy": 0.1871611699461937,
|
|
"num_tokens": 35083774.0,
|
|
"step": 13845
|
|
},
|
|
{
|
|
"entropy": 6.200519466400147,
|
|
"epoch": 1.5983843046739756,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004754708475518396,
|
|
"loss": 5.811,
|
|
"mean_token_accuracy": 0.19500787407159806,
|
|
"num_tokens": 35095757.0,
|
|
"step": 13850
|
|
},
|
|
{
|
|
"entropy": 6.238155698776245,
|
|
"epoch": 1.5989613387189845,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.00047545210853401214,
|
|
"loss": 5.7967,
|
|
"mean_token_accuracy": 0.19086273461580278,
|
|
"num_tokens": 35108788.0,
|
|
"step": 13855
|
|
},
|
|
{
|
|
"entropy": 6.29552264213562,
|
|
"epoch": 1.599538372763993,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00047543336277407753,
|
|
"loss": 5.9095,
|
|
"mean_token_accuracy": 0.18491909354925157,
|
|
"num_tokens": 35121641.0,
|
|
"step": 13860
|
|
},
|
|
{
|
|
"entropy": 6.298146390914917,
|
|
"epoch": 1.6001154068090018,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00047541461027266624,
|
|
"loss": 5.872,
|
|
"mean_token_accuracy": 0.18402589708566666,
|
|
"num_tokens": 35133960.0,
|
|
"step": 13865
|
|
},
|
|
{
|
|
"entropy": 6.290952396392822,
|
|
"epoch": 1.6006924408540104,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004753958510304091,
|
|
"loss": 5.8602,
|
|
"mean_token_accuracy": 0.19193972200155257,
|
|
"num_tokens": 35146027.0,
|
|
"step": 13870
|
|
},
|
|
{
|
|
"entropy": 6.268626737594604,
|
|
"epoch": 1.601269474899019,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00047537708504793714,
|
|
"loss": 5.8229,
|
|
"mean_token_accuracy": 0.19206952154636384,
|
|
"num_tokens": 35158728.0,
|
|
"step": 13875
|
|
},
|
|
{
|
|
"entropy": 6.216690492630005,
|
|
"epoch": 1.6018465089440277,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00047535831232588146,
|
|
"loss": 5.8518,
|
|
"mean_token_accuracy": 0.18720198273658753,
|
|
"num_tokens": 35171734.0,
|
|
"step": 13880
|
|
},
|
|
{
|
|
"entropy": 6.28776330947876,
|
|
"epoch": 1.6024235429890363,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00047533953286487345,
|
|
"loss": 5.8469,
|
|
"mean_token_accuracy": 0.1826049879193306,
|
|
"num_tokens": 35185074.0,
|
|
"step": 13885
|
|
},
|
|
{
|
|
"entropy": 6.27451376914978,
|
|
"epoch": 1.603000577034045,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004753207466655447,
|
|
"loss": 5.8782,
|
|
"mean_token_accuracy": 0.19072716683149338,
|
|
"num_tokens": 35197972.0,
|
|
"step": 13890
|
|
},
|
|
{
|
|
"entropy": 6.271556949615478,
|
|
"epoch": 1.6035776110790536,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004753019537285273,
|
|
"loss": 5.8383,
|
|
"mean_token_accuracy": 0.19148626625537873,
|
|
"num_tokens": 35210939.0,
|
|
"step": 13895
|
|
},
|
|
{
|
|
"entropy": 6.355197715759277,
|
|
"epoch": 1.6041546451240625,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00047528315405445296,
|
|
"loss": 5.8933,
|
|
"mean_token_accuracy": 0.18523967564105986,
|
|
"num_tokens": 35223521.0,
|
|
"step": 13900
|
|
},
|
|
{
|
|
"entropy": 6.283075332641602,
|
|
"epoch": 1.604731679169071,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00047526434764395435,
|
|
"loss": 5.8874,
|
|
"mean_token_accuracy": 0.19085699915885926,
|
|
"num_tokens": 35235713.0,
|
|
"step": 13905
|
|
},
|
|
{
|
|
"entropy": 6.227591133117675,
|
|
"epoch": 1.6053087132140798,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00047524553449766386,
|
|
"loss": 5.8254,
|
|
"mean_token_accuracy": 0.1942302703857422,
|
|
"num_tokens": 35248938.0,
|
|
"step": 13910
|
|
},
|
|
{
|
|
"entropy": 6.268484354019165,
|
|
"epoch": 1.6058857472590882,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00047522671461621433,
|
|
"loss": 5.8516,
|
|
"mean_token_accuracy": 0.18590108901262284,
|
|
"num_tokens": 35260916.0,
|
|
"step": 13915
|
|
},
|
|
{
|
|
"entropy": 6.279177951812744,
|
|
"epoch": 1.606462781304097,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004752078880002386,
|
|
"loss": 5.7918,
|
|
"mean_token_accuracy": 0.19422025829553605,
|
|
"num_tokens": 35273529.0,
|
|
"step": 13920
|
|
},
|
|
{
|
|
"entropy": 6.256890106201172,
|
|
"epoch": 1.6070398153491054,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00047518905465037005,
|
|
"loss": 5.7895,
|
|
"mean_token_accuracy": 0.1899741917848587,
|
|
"num_tokens": 35285500.0,
|
|
"step": 13925
|
|
},
|
|
{
|
|
"entropy": 6.217769765853882,
|
|
"epoch": 1.6076168493941143,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00047517021456724214,
|
|
"loss": 5.8204,
|
|
"mean_token_accuracy": 0.18706730306148528,
|
|
"num_tokens": 35300039.0,
|
|
"step": 13930
|
|
},
|
|
{
|
|
"entropy": 6.256122732162476,
|
|
"epoch": 1.608193883439123,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00047515136775148843,
|
|
"loss": 5.9094,
|
|
"mean_token_accuracy": 0.17840041369199752,
|
|
"num_tokens": 35313091.0,
|
|
"step": 13935
|
|
},
|
|
{
|
|
"entropy": 6.28008508682251,
|
|
"epoch": 1.6087709174841316,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004751325142037429,
|
|
"loss": 5.8688,
|
|
"mean_token_accuracy": 0.1876186579465866,
|
|
"num_tokens": 35325890.0,
|
|
"step": 13940
|
|
},
|
|
{
|
|
"entropy": 6.198402643203735,
|
|
"epoch": 1.6093479515291402,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.00047511365392463974,
|
|
"loss": 5.7532,
|
|
"mean_token_accuracy": 0.1986751899123192,
|
|
"num_tokens": 35339395.0,
|
|
"step": 13945
|
|
},
|
|
{
|
|
"entropy": 6.235682106018066,
|
|
"epoch": 1.6099249855741489,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00047509478691481317,
|
|
"loss": 5.8111,
|
|
"mean_token_accuracy": 0.19092074632644654,
|
|
"num_tokens": 35351163.0,
|
|
"step": 13950
|
|
},
|
|
{
|
|
"entropy": 6.245539283752441,
|
|
"epoch": 1.6105020196191575,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047507591317489783,
|
|
"loss": 5.7374,
|
|
"mean_token_accuracy": 0.20853773206472398,
|
|
"num_tokens": 35364099.0,
|
|
"step": 13955
|
|
},
|
|
{
|
|
"entropy": 6.257050561904907,
|
|
"epoch": 1.6110790536641661,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004750570327055286,
|
|
"loss": 5.7902,
|
|
"mean_token_accuracy": 0.19092931747436523,
|
|
"num_tokens": 35376768.0,
|
|
"step": 13960
|
|
},
|
|
{
|
|
"entropy": 6.275674676895141,
|
|
"epoch": 1.6116560877091748,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00047503814550734034,
|
|
"loss": 5.8654,
|
|
"mean_token_accuracy": 0.18828979283571243,
|
|
"num_tokens": 35388892.0,
|
|
"step": 13965
|
|
},
|
|
{
|
|
"entropy": 6.308603286743164,
|
|
"epoch": 1.6122331217541834,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004750192515809685,
|
|
"loss": 5.9013,
|
|
"mean_token_accuracy": 0.18381124287843703,
|
|
"num_tokens": 35401573.0,
|
|
"step": 13970
|
|
},
|
|
{
|
|
"entropy": 6.255910587310791,
|
|
"epoch": 1.6128101557991923,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047500035092704843,
|
|
"loss": 5.7872,
|
|
"mean_token_accuracy": 0.19008346199989318,
|
|
"num_tokens": 35415073.0,
|
|
"step": 13975
|
|
},
|
|
{
|
|
"entropy": 6.209208059310913,
|
|
"epoch": 1.6133871898442007,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004749814435462159,
|
|
"loss": 5.7701,
|
|
"mean_token_accuracy": 0.19700252562761306,
|
|
"num_tokens": 35428756.0,
|
|
"step": 13980
|
|
},
|
|
{
|
|
"entropy": 6.309863519668579,
|
|
"epoch": 1.6139642238892096,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004749625294391069,
|
|
"loss": 5.775,
|
|
"mean_token_accuracy": 0.19249810576438903,
|
|
"num_tokens": 35440387.0,
|
|
"step": 13985
|
|
},
|
|
{
|
|
"entropy": 6.164202404022217,
|
|
"epoch": 1.614541257934218,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.00047494360860635755,
|
|
"loss": 5.7059,
|
|
"mean_token_accuracy": 0.20623115003108977,
|
|
"num_tokens": 35454105.0,
|
|
"step": 13990
|
|
},
|
|
{
|
|
"entropy": 6.217005205154419,
|
|
"epoch": 1.6151182919792268,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004749246810486042,
|
|
"loss": 5.859,
|
|
"mean_token_accuracy": 0.19571419805288315,
|
|
"num_tokens": 35467775.0,
|
|
"step": 13995
|
|
},
|
|
{
|
|
"entropy": 6.2699981212615965,
|
|
"epoch": 1.6156953260242353,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004749057467664836,
|
|
"loss": 5.8614,
|
|
"mean_token_accuracy": 0.18756910860538484,
|
|
"num_tokens": 35479217.0,
|
|
"step": 14000
|
|
},
|
|
{
|
|
"entropy": 6.258079528808594,
|
|
"epoch": 1.6162723600692441,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00047488680576063247,
|
|
"loss": 5.8267,
|
|
"mean_token_accuracy": 0.20054476708173752,
|
|
"num_tokens": 35490676.0,
|
|
"step": 14005
|
|
},
|
|
{
|
|
"entropy": 6.22015151977539,
|
|
"epoch": 1.6168493941142528,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004748678580316878,
|
|
"loss": 5.7543,
|
|
"mean_token_accuracy": 0.19434951543807982,
|
|
"num_tokens": 35503440.0,
|
|
"step": 14010
|
|
},
|
|
{
|
|
"entropy": 6.183001565933227,
|
|
"epoch": 1.6174264281592614,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00047484890358028714,
|
|
"loss": 5.7756,
|
|
"mean_token_accuracy": 0.19921866208314895,
|
|
"num_tokens": 35515717.0,
|
|
"step": 14015
|
|
},
|
|
{
|
|
"entropy": 6.2771368503570555,
|
|
"epoch": 1.61800346220427,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004748299424070678,
|
|
"loss": 5.7939,
|
|
"mean_token_accuracy": 0.1896692395210266,
|
|
"num_tokens": 35528445.0,
|
|
"step": 14020
|
|
},
|
|
{
|
|
"entropy": 6.1768638610839846,
|
|
"epoch": 1.6185804962492787,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004748109745126677,
|
|
"loss": 5.7165,
|
|
"mean_token_accuracy": 0.19463213682174682,
|
|
"num_tokens": 35541652.0,
|
|
"step": 14025
|
|
},
|
|
{
|
|
"entropy": 6.125383138656616,
|
|
"epoch": 1.6191575302942873,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047479199989772464,
|
|
"loss": 5.7204,
|
|
"mean_token_accuracy": 0.2015412136912346,
|
|
"num_tokens": 35555310.0,
|
|
"step": 14030
|
|
},
|
|
{
|
|
"entropy": 6.320287895202637,
|
|
"epoch": 1.619734564339296,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000474773018562877,
|
|
"loss": 5.8361,
|
|
"mean_token_accuracy": 0.18703369945287704,
|
|
"num_tokens": 35567830.0,
|
|
"step": 14035
|
|
},
|
|
{
|
|
"entropy": 6.232371616363525,
|
|
"epoch": 1.6203115983843048,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00047475403050876297,
|
|
"loss": 5.8173,
|
|
"mean_token_accuracy": 0.19013205021619797,
|
|
"num_tokens": 35579054.0,
|
|
"step": 14040
|
|
},
|
|
{
|
|
"entropy": 6.305903196334839,
|
|
"epoch": 1.6208886324293132,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004747350357360214,
|
|
"loss": 5.92,
|
|
"mean_token_accuracy": 0.18613108694553376,
|
|
"num_tokens": 35592463.0,
|
|
"step": 14045
|
|
},
|
|
{
|
|
"entropy": 6.2606062412261965,
|
|
"epoch": 1.621465666474322,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004747160342452912,
|
|
"loss": 5.8242,
|
|
"mean_token_accuracy": 0.1944044604897499,
|
|
"num_tokens": 35605127.0,
|
|
"step": 14050
|
|
},
|
|
{
|
|
"entropy": 6.210332012176513,
|
|
"epoch": 1.6220427005193305,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00047469702603721134,
|
|
"loss": 5.7752,
|
|
"mean_token_accuracy": 0.19872388392686843,
|
|
"num_tokens": 35617509.0,
|
|
"step": 14055
|
|
},
|
|
{
|
|
"entropy": 6.21488995552063,
|
|
"epoch": 1.6226197345643394,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004746780111124212,
|
|
"loss": 5.796,
|
|
"mean_token_accuracy": 0.19262754619121553,
|
|
"num_tokens": 35630788.0,
|
|
"step": 14060
|
|
},
|
|
{
|
|
"entropy": 6.336267614364624,
|
|
"epoch": 1.6231967686093478,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00047465898947156033,
|
|
"loss": 5.8856,
|
|
"mean_token_accuracy": 0.1877436563372612,
|
|
"num_tokens": 35643613.0,
|
|
"step": 14065
|
|
},
|
|
{
|
|
"entropy": 6.2986588954925535,
|
|
"epoch": 1.6237738026543567,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00047463996111526854,
|
|
"loss": 5.8275,
|
|
"mean_token_accuracy": 0.189494089782238,
|
|
"num_tokens": 35656495.0,
|
|
"step": 14070
|
|
},
|
|
{
|
|
"entropy": 6.242229413986206,
|
|
"epoch": 1.6243508366993653,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00047462092604418576,
|
|
"loss": 5.9166,
|
|
"mean_token_accuracy": 0.18053760081529618,
|
|
"num_tokens": 35669661.0,
|
|
"step": 14075
|
|
},
|
|
{
|
|
"entropy": 6.240379905700683,
|
|
"epoch": 1.624927870744374,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00047460188425895236,
|
|
"loss": 5.8252,
|
|
"mean_token_accuracy": 0.18926533162593842,
|
|
"num_tokens": 35682675.0,
|
|
"step": 14080
|
|
},
|
|
{
|
|
"entropy": 6.289512968063354,
|
|
"epoch": 1.6255049047893826,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00047458283576020874,
|
|
"loss": 5.8646,
|
|
"mean_token_accuracy": 0.1920921802520752,
|
|
"num_tokens": 35694571.0,
|
|
"step": 14085
|
|
},
|
|
{
|
|
"entropy": 6.22381739616394,
|
|
"epoch": 1.6260819388343912,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00047456378054859554,
|
|
"loss": 5.7493,
|
|
"mean_token_accuracy": 0.19590264409780503,
|
|
"num_tokens": 35707196.0,
|
|
"step": 14090
|
|
},
|
|
{
|
|
"entropy": 6.2018373012542725,
|
|
"epoch": 1.6266589728793999,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00047454471862475375,
|
|
"loss": 5.7632,
|
|
"mean_token_accuracy": 0.195886792242527,
|
|
"num_tokens": 35719682.0,
|
|
"step": 14095
|
|
},
|
|
{
|
|
"entropy": 6.229247808456421,
|
|
"epoch": 1.6272360069244085,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047452564998932446,
|
|
"loss": 5.8639,
|
|
"mean_token_accuracy": 0.18924974799156188,
|
|
"num_tokens": 35732595.0,
|
|
"step": 14100
|
|
},
|
|
{
|
|
"entropy": 6.275307750701904,
|
|
"epoch": 1.6278130409694171,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.000474506574642949,
|
|
"loss": 5.8004,
|
|
"mean_token_accuracy": 0.19364307522773744,
|
|
"num_tokens": 35744611.0,
|
|
"step": 14105
|
|
},
|
|
{
|
|
"entropy": 6.194735336303711,
|
|
"epoch": 1.6283900750144258,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.000474487492586269,
|
|
"loss": 5.8052,
|
|
"mean_token_accuracy": 0.19076161533594133,
|
|
"num_tokens": 35757288.0,
|
|
"step": 14110
|
|
},
|
|
{
|
|
"entropy": 6.270211219787598,
|
|
"epoch": 1.6289671090594346,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004744684038199263,
|
|
"loss": 5.8733,
|
|
"mean_token_accuracy": 0.18648385405540466,
|
|
"num_tokens": 35769747.0,
|
|
"step": 14115
|
|
},
|
|
{
|
|
"entropy": 6.315110445022583,
|
|
"epoch": 1.629544143104443,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00047444930834456293,
|
|
"loss": 5.8978,
|
|
"mean_token_accuracy": 0.19017856419086457,
|
|
"num_tokens": 35781656.0,
|
|
"step": 14120
|
|
},
|
|
{
|
|
"entropy": 6.277868747711182,
|
|
"epoch": 1.630121177149452,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004744302061608212,
|
|
"loss": 5.8544,
|
|
"mean_token_accuracy": 0.19737848043441772,
|
|
"num_tokens": 35794618.0,
|
|
"step": 14125
|
|
},
|
|
{
|
|
"entropy": 6.253666496276855,
|
|
"epoch": 1.6306982111944603,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047441109726934345,
|
|
"loss": 5.7741,
|
|
"mean_token_accuracy": 0.19238534420728684,
|
|
"num_tokens": 35807504.0,
|
|
"step": 14130
|
|
},
|
|
{
|
|
"entropy": 6.165348815917969,
|
|
"epoch": 1.6312752452394692,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00047439198167077256,
|
|
"loss": 5.7917,
|
|
"mean_token_accuracy": 0.19519294947385787,
|
|
"num_tokens": 35819668.0,
|
|
"step": 14135
|
|
},
|
|
{
|
|
"entropy": 6.2695183753967285,
|
|
"epoch": 1.6318522792844776,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004743728593657514,
|
|
"loss": 5.8348,
|
|
"mean_token_accuracy": 0.1945918545126915,
|
|
"num_tokens": 35832078.0,
|
|
"step": 14140
|
|
},
|
|
{
|
|
"entropy": 6.178915405273438,
|
|
"epoch": 1.6324293133294865,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004743537303549231,
|
|
"loss": 5.7189,
|
|
"mean_token_accuracy": 0.19973592162132264,
|
|
"num_tokens": 35843580.0,
|
|
"step": 14145
|
|
},
|
|
{
|
|
"entropy": 6.201517915725708,
|
|
"epoch": 1.6330063473744951,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004743345946389311,
|
|
"loss": 5.7507,
|
|
"mean_token_accuracy": 0.2023004561662674,
|
|
"num_tokens": 35857146.0,
|
|
"step": 14150
|
|
},
|
|
{
|
|
"entropy": 6.266290998458862,
|
|
"epoch": 1.6335833814195038,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00047431545221841907,
|
|
"loss": 5.7991,
|
|
"mean_token_accuracy": 0.1934083268046379,
|
|
"num_tokens": 35869374.0,
|
|
"step": 14155
|
|
},
|
|
{
|
|
"entropy": 6.319689178466797,
|
|
"epoch": 1.6341604154645124,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00047429630309403086,
|
|
"loss": 5.8254,
|
|
"mean_token_accuracy": 0.1859660416841507,
|
|
"num_tokens": 35881882.0,
|
|
"step": 14160
|
|
},
|
|
{
|
|
"entropy": 6.082709503173828,
|
|
"epoch": 1.634737449509521,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00047427714726641044,
|
|
"loss": 5.6478,
|
|
"mean_token_accuracy": 0.20330152064561843,
|
|
"num_tokens": 35895512.0,
|
|
"step": 14165
|
|
},
|
|
{
|
|
"entropy": 6.1116431713104244,
|
|
"epoch": 1.6353144835545297,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.00047425798473620215,
|
|
"loss": 5.6909,
|
|
"mean_token_accuracy": 0.19648269861936568,
|
|
"num_tokens": 35908020.0,
|
|
"step": 14170
|
|
},
|
|
{
|
|
"entropy": 6.265104627609253,
|
|
"epoch": 1.6358915175995383,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004742388155040505,
|
|
"loss": 5.7543,
|
|
"mean_token_accuracy": 0.19779868721961974,
|
|
"num_tokens": 35920261.0,
|
|
"step": 14175
|
|
},
|
|
{
|
|
"entropy": 6.288595819473267,
|
|
"epoch": 1.6364685516445472,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00047421963957060026,
|
|
"loss": 5.9132,
|
|
"mean_token_accuracy": 0.18365271687507628,
|
|
"num_tokens": 35932135.0,
|
|
"step": 14180
|
|
},
|
|
{
|
|
"entropy": 6.19545316696167,
|
|
"epoch": 1.6370455856895556,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004742004569364964,
|
|
"loss": 5.7862,
|
|
"mean_token_accuracy": 0.19036284685134888,
|
|
"num_tokens": 35944574.0,
|
|
"step": 14185
|
|
},
|
|
{
|
|
"entropy": 6.272937345504761,
|
|
"epoch": 1.6376226197345645,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.00047418126760238416,
|
|
"loss": 5.7716,
|
|
"mean_token_accuracy": 0.19476332664489746,
|
|
"num_tokens": 35956877.0,
|
|
"step": 14190
|
|
},
|
|
{
|
|
"entropy": 6.306672048568726,
|
|
"epoch": 1.6381996537795729,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00047416207156890887,
|
|
"loss": 5.8893,
|
|
"mean_token_accuracy": 0.18866454511880876,
|
|
"num_tokens": 35968616.0,
|
|
"step": 14195
|
|
},
|
|
{
|
|
"entropy": 6.216367101669311,
|
|
"epoch": 1.6387766878245817,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004741428688367164,
|
|
"loss": 5.8467,
|
|
"mean_token_accuracy": 0.19205766469240187,
|
|
"num_tokens": 35982401.0,
|
|
"step": 14200
|
|
},
|
|
{
|
|
"entropy": 6.269579744338989,
|
|
"epoch": 1.6393537218695902,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00047412365940645225,
|
|
"loss": 5.7995,
|
|
"mean_token_accuracy": 0.19650813192129135,
|
|
"num_tokens": 35994907.0,
|
|
"step": 14205
|
|
},
|
|
{
|
|
"entropy": 6.257475233078003,
|
|
"epoch": 1.639930755914599,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00047410444327876286,
|
|
"loss": 5.7485,
|
|
"mean_token_accuracy": 0.19474590718746185,
|
|
"num_tokens": 36007109.0,
|
|
"step": 14210
|
|
},
|
|
{
|
|
"entropy": 6.236335754394531,
|
|
"epoch": 1.6405077899596077,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00047408522045429426,
|
|
"loss": 5.8324,
|
|
"mean_token_accuracy": 0.1903609052300453,
|
|
"num_tokens": 36018734.0,
|
|
"step": 14215
|
|
},
|
|
{
|
|
"entropy": 6.257100391387939,
|
|
"epoch": 1.6410848240046163,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004740659909336933,
|
|
"loss": 5.7787,
|
|
"mean_token_accuracy": 0.2008269727230072,
|
|
"num_tokens": 36031427.0,
|
|
"step": 14220
|
|
},
|
|
{
|
|
"entropy": 6.285252904891967,
|
|
"epoch": 1.641661858049625,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00047404675471760655,
|
|
"loss": 5.8026,
|
|
"mean_token_accuracy": 0.1962312713265419,
|
|
"num_tokens": 36044726.0,
|
|
"step": 14225
|
|
},
|
|
{
|
|
"entropy": 6.20171971321106,
|
|
"epoch": 1.6422388920946336,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004740275118066811,
|
|
"loss": 5.8143,
|
|
"mean_token_accuracy": 0.18700166642665864,
|
|
"num_tokens": 36056882.0,
|
|
"step": 14230
|
|
},
|
|
{
|
|
"entropy": 6.2923260688781735,
|
|
"epoch": 1.6428159261396422,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00047400826220156416,
|
|
"loss": 5.8656,
|
|
"mean_token_accuracy": 0.18483263552188872,
|
|
"num_tokens": 36068548.0,
|
|
"step": 14235
|
|
},
|
|
{
|
|
"entropy": 6.342332458496093,
|
|
"epoch": 1.6433929601846509,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00047398900590290313,
|
|
"loss": 5.7777,
|
|
"mean_token_accuracy": 0.18994950652122497,
|
|
"num_tokens": 36080652.0,
|
|
"step": 14240
|
|
},
|
|
{
|
|
"entropy": 6.206917762756348,
|
|
"epoch": 1.6439699942296595,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00047396974291134575,
|
|
"loss": 5.8173,
|
|
"mean_token_accuracy": 0.1934569150209427,
|
|
"num_tokens": 36093372.0,
|
|
"step": 14245
|
|
},
|
|
{
|
|
"entropy": 6.2440855503082275,
|
|
"epoch": 1.6445470282746681,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00047395047322754,
|
|
"loss": 5.8276,
|
|
"mean_token_accuracy": 0.1925554320216179,
|
|
"num_tokens": 36106023.0,
|
|
"step": 14250
|
|
},
|
|
{
|
|
"entropy": 6.222019481658935,
|
|
"epoch": 1.645124062319677,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00047393119685213374,
|
|
"loss": 5.7587,
|
|
"mean_token_accuracy": 0.20053549259901046,
|
|
"num_tokens": 36119627.0,
|
|
"step": 14255
|
|
},
|
|
{
|
|
"entropy": 6.09753794670105,
|
|
"epoch": 1.6457010963646854,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004739119137857756,
|
|
"loss": 5.6112,
|
|
"mean_token_accuracy": 0.20973964035511017,
|
|
"num_tokens": 36132835.0,
|
|
"step": 14260
|
|
},
|
|
{
|
|
"entropy": 6.277415990829468,
|
|
"epoch": 1.6462781304096943,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00047389262402911404,
|
|
"loss": 5.7902,
|
|
"mean_token_accuracy": 0.19406622946262359,
|
|
"num_tokens": 36144234.0,
|
|
"step": 14265
|
|
},
|
|
{
|
|
"entropy": 6.198006725311279,
|
|
"epoch": 1.6468551644547027,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00047387332758279784,
|
|
"loss": 5.7493,
|
|
"mean_token_accuracy": 0.19753192216157914,
|
|
"num_tokens": 36158556.0,
|
|
"step": 14270
|
|
},
|
|
{
|
|
"entropy": 6.210707807540894,
|
|
"epoch": 1.6474321984997116,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00047385402444747606,
|
|
"loss": 5.8218,
|
|
"mean_token_accuracy": 0.1887941062450409,
|
|
"num_tokens": 36171698.0,
|
|
"step": 14275
|
|
},
|
|
{
|
|
"entropy": 6.213572263717651,
|
|
"epoch": 1.64800923254472,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00047383471462379803,
|
|
"loss": 5.8067,
|
|
"mean_token_accuracy": 0.19627797454595566,
|
|
"num_tokens": 36184649.0,
|
|
"step": 14280
|
|
},
|
|
{
|
|
"entropy": 6.271010494232177,
|
|
"epoch": 1.6485862665897288,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.000473815398112413,
|
|
"loss": 5.7599,
|
|
"mean_token_accuracy": 0.19666724503040314,
|
|
"num_tokens": 36197127.0,
|
|
"step": 14285
|
|
},
|
|
{
|
|
"entropy": 6.229652214050293,
|
|
"epoch": 1.6491633006347375,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004737960749139708,
|
|
"loss": 5.7883,
|
|
"mean_token_accuracy": 0.19295482188463212,
|
|
"num_tokens": 36209471.0,
|
|
"step": 14290
|
|
},
|
|
{
|
|
"entropy": 6.301067876815796,
|
|
"epoch": 1.6497403346797461,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004737767450291215,
|
|
"loss": 5.8443,
|
|
"mean_token_accuracy": 0.19018818587064742,
|
|
"num_tokens": 36221798.0,
|
|
"step": 14295
|
|
},
|
|
{
|
|
"entropy": 6.232090139389038,
|
|
"epoch": 1.6503173687247548,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00047375740845851506,
|
|
"loss": 5.7485,
|
|
"mean_token_accuracy": 0.19451043158769607,
|
|
"num_tokens": 36235758.0,
|
|
"step": 14300
|
|
},
|
|
{
|
|
"entropy": 6.224923515319825,
|
|
"epoch": 1.6508944027697634,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004737380652028019,
|
|
"loss": 5.8011,
|
|
"mean_token_accuracy": 0.19222778230905532,
|
|
"num_tokens": 36248484.0,
|
|
"step": 14305
|
|
},
|
|
{
|
|
"entropy": 6.099427223205566,
|
|
"epoch": 1.651471436814772,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00047371871526263263,
|
|
"loss": 5.6429,
|
|
"mean_token_accuracy": 0.2055506318807602,
|
|
"num_tokens": 36260796.0,
|
|
"step": 14310
|
|
},
|
|
{
|
|
"entropy": 6.171128606796264,
|
|
"epoch": 1.6520484708597807,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004736993586386581,
|
|
"loss": 5.7813,
|
|
"mean_token_accuracy": 0.19944193214178085,
|
|
"num_tokens": 36273617.0,
|
|
"step": 14315
|
|
},
|
|
{
|
|
"entropy": 6.160193538665771,
|
|
"epoch": 1.6526255049047895,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00047367999533152934,
|
|
"loss": 5.7129,
|
|
"mean_token_accuracy": 0.2024203896522522,
|
|
"num_tokens": 36286285.0,
|
|
"step": 14320
|
|
},
|
|
{
|
|
"entropy": 6.3143633842468265,
|
|
"epoch": 1.653202538949798,
|
|
"grad_norm": 1.9921875,
|
|
"learning_rate": 0.00047366062534189756,
|
|
"loss": 5.8611,
|
|
"mean_token_accuracy": 0.18911528140306472,
|
|
"num_tokens": 36298970.0,
|
|
"step": 14325
|
|
},
|
|
{
|
|
"entropy": 6.190754985809326,
|
|
"epoch": 1.6537795729948068,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00047364124867041446,
|
|
"loss": 5.7636,
|
|
"mean_token_accuracy": 0.19722063839435577,
|
|
"num_tokens": 36312684.0,
|
|
"step": 14330
|
|
},
|
|
{
|
|
"entropy": 6.189275121688842,
|
|
"epoch": 1.6543566070398152,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00047362186531773156,
|
|
"loss": 5.8586,
|
|
"mean_token_accuracy": 0.18725836277008057,
|
|
"num_tokens": 36326300.0,
|
|
"step": 14335
|
|
},
|
|
{
|
|
"entropy": 6.228783130645752,
|
|
"epoch": 1.654933641084824,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004736024752845008,
|
|
"loss": 5.7745,
|
|
"mean_token_accuracy": 0.18818582445383072,
|
|
"num_tokens": 36338234.0,
|
|
"step": 14340
|
|
},
|
|
{
|
|
"entropy": 6.295052719116211,
|
|
"epoch": 1.6555106751298325,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004735830785713746,
|
|
"loss": 5.839,
|
|
"mean_token_accuracy": 0.18417955487966536,
|
|
"num_tokens": 36351032.0,
|
|
"step": 14345
|
|
},
|
|
{
|
|
"entropy": 6.242326784133911,
|
|
"epoch": 1.6560877091748414,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004735636751790051,
|
|
"loss": 5.7387,
|
|
"mean_token_accuracy": 0.1901518702507019,
|
|
"num_tokens": 36363267.0,
|
|
"step": 14350
|
|
},
|
|
{
|
|
"entropy": 6.219479417800903,
|
|
"epoch": 1.65666474321985,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000473544265108045,
|
|
"loss": 5.8147,
|
|
"mean_token_accuracy": 0.19406894594430923,
|
|
"num_tokens": 36375628.0,
|
|
"step": 14355
|
|
},
|
|
{
|
|
"entropy": 6.241999006271362,
|
|
"epoch": 1.6572417772648587,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00047352484835914716,
|
|
"loss": 5.8367,
|
|
"mean_token_accuracy": 0.18755433857440948,
|
|
"num_tokens": 36388161.0,
|
|
"step": 14360
|
|
},
|
|
{
|
|
"entropy": 6.253871107101441,
|
|
"epoch": 1.6578188113098673,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004735054249329647,
|
|
"loss": 5.7901,
|
|
"mean_token_accuracy": 0.19120151847600936,
|
|
"num_tokens": 36400287.0,
|
|
"step": 14365
|
|
},
|
|
{
|
|
"entropy": 6.257974624633789,
|
|
"epoch": 1.658395845354876,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00047348599483015087,
|
|
"loss": 5.8799,
|
|
"mean_token_accuracy": 0.19049407839775084,
|
|
"num_tokens": 36413896.0,
|
|
"step": 14370
|
|
},
|
|
{
|
|
"entropy": 6.253906106948852,
|
|
"epoch": 1.6589728793998846,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00047346655805135916,
|
|
"loss": 5.7927,
|
|
"mean_token_accuracy": 0.19061724245548248,
|
|
"num_tokens": 36425812.0,
|
|
"step": 14375
|
|
},
|
|
{
|
|
"entropy": 6.214411783218384,
|
|
"epoch": 1.6595499134448932,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004734471145972434,
|
|
"loss": 5.7935,
|
|
"mean_token_accuracy": 0.18819109499454498,
|
|
"num_tokens": 36438977.0,
|
|
"step": 14380
|
|
},
|
|
{
|
|
"entropy": 6.262951374053955,
|
|
"epoch": 1.6601269474899019,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00047342766446845753,
|
|
"loss": 5.8245,
|
|
"mean_token_accuracy": 0.1869310572743416,
|
|
"num_tokens": 36453173.0,
|
|
"step": 14385
|
|
},
|
|
{
|
|
"entropy": 6.281124496459961,
|
|
"epoch": 1.6607039815349105,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004734082076656557,
|
|
"loss": 5.7762,
|
|
"mean_token_accuracy": 0.1942988872528076,
|
|
"num_tokens": 36464977.0,
|
|
"step": 14390
|
|
},
|
|
{
|
|
"entropy": 6.250260543823242,
|
|
"epoch": 1.6612810155799194,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00047338874418949235,
|
|
"loss": 5.896,
|
|
"mean_token_accuracy": 0.18223095685243607,
|
|
"num_tokens": 36476951.0,
|
|
"step": 14395
|
|
},
|
|
{
|
|
"entropy": 6.25014476776123,
|
|
"epoch": 1.6618580496249278,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.00047336927404062213,
|
|
"loss": 5.876,
|
|
"mean_token_accuracy": 0.18608336001634598,
|
|
"num_tokens": 36490387.0,
|
|
"step": 14400
|
|
},
|
|
{
|
|
"entropy": 6.303406810760498,
|
|
"epoch": 1.6624350836699366,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00047334979721969995,
|
|
"loss": 5.8402,
|
|
"mean_token_accuracy": 0.18937479555606843,
|
|
"num_tokens": 36501958.0,
|
|
"step": 14405
|
|
},
|
|
{
|
|
"entropy": 6.3160100936889645,
|
|
"epoch": 1.663012117714945,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004733303137273808,
|
|
"loss": 5.8947,
|
|
"mean_token_accuracy": 0.18646145313978196,
|
|
"num_tokens": 36515355.0,
|
|
"step": 14410
|
|
},
|
|
{
|
|
"entropy": 6.299543190002441,
|
|
"epoch": 1.663589151759954,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00047331082356432015,
|
|
"loss": 5.8883,
|
|
"mean_token_accuracy": 0.18837940245866774,
|
|
"num_tokens": 36528288.0,
|
|
"step": 14415
|
|
},
|
|
{
|
|
"entropy": 6.350749063491821,
|
|
"epoch": 1.6641661858049623,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004732913267311734,
|
|
"loss": 5.8876,
|
|
"mean_token_accuracy": 0.18897933512926102,
|
|
"num_tokens": 36541577.0,
|
|
"step": 14420
|
|
},
|
|
{
|
|
"entropy": 6.26870493888855,
|
|
"epoch": 1.6647432198499712,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004732718232285964,
|
|
"loss": 5.8037,
|
|
"mean_token_accuracy": 0.19384131133556365,
|
|
"num_tokens": 36554802.0,
|
|
"step": 14425
|
|
},
|
|
{
|
|
"entropy": 6.243334054946899,
|
|
"epoch": 1.6653202538949798,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00047325231305724507,
|
|
"loss": 5.7683,
|
|
"mean_token_accuracy": 0.19212243258953093,
|
|
"num_tokens": 36567175.0,
|
|
"step": 14430
|
|
},
|
|
{
|
|
"entropy": 6.189241361618042,
|
|
"epoch": 1.6658972879399885,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004732327962177757,
|
|
"loss": 5.7606,
|
|
"mean_token_accuracy": 0.20297178626060486,
|
|
"num_tokens": 36579391.0,
|
|
"step": 14435
|
|
},
|
|
{
|
|
"entropy": 6.300449275970459,
|
|
"epoch": 1.6664743219849971,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004732132727108447,
|
|
"loss": 5.8576,
|
|
"mean_token_accuracy": 0.18773895353078843,
|
|
"num_tokens": 36592684.0,
|
|
"step": 14440
|
|
},
|
|
{
|
|
"entropy": 6.249213838577271,
|
|
"epoch": 1.6670513560300058,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00047319374253710874,
|
|
"loss": 5.8894,
|
|
"mean_token_accuracy": 0.1900160625576973,
|
|
"num_tokens": 36604996.0,
|
|
"step": 14445
|
|
},
|
|
{
|
|
"entropy": 6.278888511657715,
|
|
"epoch": 1.6676283900750144,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004731742056972247,
|
|
"loss": 5.7876,
|
|
"mean_token_accuracy": 0.19654055088758468,
|
|
"num_tokens": 36618914.0,
|
|
"step": 14450
|
|
},
|
|
{
|
|
"entropy": 6.2485129833221436,
|
|
"epoch": 1.668205424120023,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004731546621918497,
|
|
"loss": 5.7587,
|
|
"mean_token_accuracy": 0.19068465381860733,
|
|
"num_tokens": 36630527.0,
|
|
"step": 14455
|
|
},
|
|
{
|
|
"entropy": 6.2103640079498295,
|
|
"epoch": 1.668782458165032,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.000473135112021641,
|
|
"loss": 5.8591,
|
|
"mean_token_accuracy": 0.18707639425992967,
|
|
"num_tokens": 36642605.0,
|
|
"step": 14460
|
|
},
|
|
{
|
|
"entropy": 6.25440354347229,
|
|
"epoch": 1.6693594922100403,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00047311555518725617,
|
|
"loss": 5.7669,
|
|
"mean_token_accuracy": 0.19207081943750381,
|
|
"num_tokens": 36655075.0,
|
|
"step": 14465
|
|
},
|
|
{
|
|
"entropy": 6.2060243606567385,
|
|
"epoch": 1.6699365262550492,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00047309599168935323,
|
|
"loss": 5.7996,
|
|
"mean_token_accuracy": 0.19139713943004608,
|
|
"num_tokens": 36667684.0,
|
|
"step": 14470
|
|
},
|
|
{
|
|
"entropy": 6.264299297332764,
|
|
"epoch": 1.6705135603000576,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047307642152858993,
|
|
"loss": 5.8135,
|
|
"mean_token_accuracy": 0.19109832346439362,
|
|
"num_tokens": 36679656.0,
|
|
"step": 14475
|
|
},
|
|
{
|
|
"entropy": 6.1772970199584964,
|
|
"epoch": 1.6710905943450665,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00047305684470562453,
|
|
"loss": 5.755,
|
|
"mean_token_accuracy": 0.19919458031654358,
|
|
"num_tokens": 36691691.0,
|
|
"step": 14480
|
|
},
|
|
{
|
|
"entropy": 6.228798484802246,
|
|
"epoch": 1.6716676283900749,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004730372612211156,
|
|
"loss": 5.8375,
|
|
"mean_token_accuracy": 0.19381739795207978,
|
|
"num_tokens": 36703615.0,
|
|
"step": 14485
|
|
},
|
|
{
|
|
"entropy": 6.282718276977539,
|
|
"epoch": 1.6722446624350837,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00047301767107572174,
|
|
"loss": 5.8186,
|
|
"mean_token_accuracy": 0.1860135242342949,
|
|
"num_tokens": 36716299.0,
|
|
"step": 14490
|
|
},
|
|
{
|
|
"entropy": 6.275322389602661,
|
|
"epoch": 1.6728216964800924,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004729980742701018,
|
|
"loss": 5.8049,
|
|
"mean_token_accuracy": 0.18858209103345872,
|
|
"num_tokens": 36727723.0,
|
|
"step": 14495
|
|
},
|
|
{
|
|
"entropy": 6.198411750793457,
|
|
"epoch": 1.673398730525101,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004729784708049151,
|
|
"loss": 5.6589,
|
|
"mean_token_accuracy": 0.20318579077720642,
|
|
"num_tokens": 36740497.0,
|
|
"step": 14500
|
|
},
|
|
{
|
|
"entropy": 6.123383331298828,
|
|
"epoch": 1.6739757645701097,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004729588606808209,
|
|
"loss": 5.7248,
|
|
"mean_token_accuracy": 0.19112390279769897,
|
|
"num_tokens": 36752862.0,
|
|
"step": 14505
|
|
},
|
|
{
|
|
"entropy": 6.287880277633667,
|
|
"epoch": 1.6745527986151183,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00047293924389847864,
|
|
"loss": 5.7944,
|
|
"mean_token_accuracy": 0.19351442903280258,
|
|
"num_tokens": 36765948.0,
|
|
"step": 14510
|
|
},
|
|
{
|
|
"entropy": 6.265487384796143,
|
|
"epoch": 1.675129832660127,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004729196204585483,
|
|
"loss": 5.8009,
|
|
"mean_token_accuracy": 0.19770944267511367,
|
|
"num_tokens": 36778768.0,
|
|
"step": 14515
|
|
},
|
|
{
|
|
"entropy": 6.250596046447754,
|
|
"epoch": 1.6757068667051356,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00047289999036168983,
|
|
"loss": 5.8277,
|
|
"mean_token_accuracy": 0.18962397873401643,
|
|
"num_tokens": 36790941.0,
|
|
"step": 14520
|
|
},
|
|
{
|
|
"entropy": 6.276755619049072,
|
|
"epoch": 1.6762839007501442,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004728803536085634,
|
|
"loss": 5.8926,
|
|
"mean_token_accuracy": 0.1894552379846573,
|
|
"num_tokens": 36803984.0,
|
|
"step": 14525
|
|
},
|
|
{
|
|
"entropy": 6.22985348701477,
|
|
"epoch": 1.6768609347951529,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00047286071019982974,
|
|
"loss": 5.7018,
|
|
"mean_token_accuracy": 0.20174630880355834,
|
|
"num_tokens": 36815079.0,
|
|
"step": 14530
|
|
},
|
|
{
|
|
"entropy": 6.265960168838501,
|
|
"epoch": 1.6774379688401617,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00047284106013614926,
|
|
"loss": 5.8432,
|
|
"mean_token_accuracy": 0.19024327546358108,
|
|
"num_tokens": 36828007.0,
|
|
"step": 14535
|
|
},
|
|
{
|
|
"entropy": 6.286230373382568,
|
|
"epoch": 1.6780150028851701,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000472821403418183,
|
|
"loss": 5.9272,
|
|
"mean_token_accuracy": 0.18469211161136628,
|
|
"num_tokens": 36841762.0,
|
|
"step": 14540
|
|
},
|
|
{
|
|
"entropy": 6.2628261089324955,
|
|
"epoch": 1.678592036930179,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004728017400465921,
|
|
"loss": 5.7975,
|
|
"mean_token_accuracy": 0.1922488570213318,
|
|
"num_tokens": 36854624.0,
|
|
"step": 14545
|
|
},
|
|
{
|
|
"entropy": 6.246957540512085,
|
|
"epoch": 1.6791690709751874,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00047278207002203796,
|
|
"loss": 5.7187,
|
|
"mean_token_accuracy": 0.1921593114733696,
|
|
"num_tokens": 36866266.0,
|
|
"step": 14550
|
|
},
|
|
{
|
|
"entropy": 6.253695058822632,
|
|
"epoch": 1.6797461050201963,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00047276239334518216,
|
|
"loss": 5.858,
|
|
"mean_token_accuracy": 0.19074209034442902,
|
|
"num_tokens": 36878813.0,
|
|
"step": 14555
|
|
},
|
|
{
|
|
"entropy": 6.23266019821167,
|
|
"epoch": 1.6803231390652047,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00047274271001668646,
|
|
"loss": 5.798,
|
|
"mean_token_accuracy": 0.1866303414106369,
|
|
"num_tokens": 36891848.0,
|
|
"step": 14560
|
|
},
|
|
{
|
|
"entropy": 6.179357194900513,
|
|
"epoch": 1.6809001731102136,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00047272302003721286,
|
|
"loss": 5.799,
|
|
"mean_token_accuracy": 0.190840882062912,
|
|
"num_tokens": 36903861.0,
|
|
"step": 14565
|
|
},
|
|
{
|
|
"entropy": 6.256790113449097,
|
|
"epoch": 1.6814772071552222,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00047270332340742377,
|
|
"loss": 5.8563,
|
|
"mean_token_accuracy": 0.18791476786136627,
|
|
"num_tokens": 36916849.0,
|
|
"step": 14570
|
|
},
|
|
{
|
|
"entropy": 6.325413751602173,
|
|
"epoch": 1.6820542412002308,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00047268362012798157,
|
|
"loss": 5.8472,
|
|
"mean_token_accuracy": 0.18315469324588776,
|
|
"num_tokens": 36929559.0,
|
|
"step": 14575
|
|
},
|
|
{
|
|
"entropy": 6.102227115631104,
|
|
"epoch": 1.6826312752452395,
|
|
"grad_norm": 1.703125,
|
|
"learning_rate": 0.0004726639101995491,
|
|
"loss": 5.5979,
|
|
"mean_token_accuracy": 0.20988662987947465,
|
|
"num_tokens": 36943958.0,
|
|
"step": 14580
|
|
},
|
|
{
|
|
"entropy": 6.208522462844849,
|
|
"epoch": 1.6832083092902481,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00047264419362278906,
|
|
"loss": 5.7652,
|
|
"mean_token_accuracy": 0.19693288952112198,
|
|
"num_tokens": 36956542.0,
|
|
"step": 14585
|
|
},
|
|
{
|
|
"entropy": 6.227226400375367,
|
|
"epoch": 1.6837853433352568,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00047262447039836484,
|
|
"loss": 5.8169,
|
|
"mean_token_accuracy": 0.19118765741586685,
|
|
"num_tokens": 36968872.0,
|
|
"step": 14590
|
|
},
|
|
{
|
|
"entropy": 6.201617908477783,
|
|
"epoch": 1.6843623773802654,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047260474052693963,
|
|
"loss": 5.7863,
|
|
"mean_token_accuracy": 0.1912344291806221,
|
|
"num_tokens": 36982234.0,
|
|
"step": 14595
|
|
},
|
|
{
|
|
"entropy": 6.216722536087036,
|
|
"epoch": 1.684939411425274,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00047258500400917724,
|
|
"loss": 5.7898,
|
|
"mean_token_accuracy": 0.19123946577310563,
|
|
"num_tokens": 36994407.0,
|
|
"step": 14600
|
|
},
|
|
{
|
|
"entropy": 6.290629053115845,
|
|
"epoch": 1.6855164454702827,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00047256526084574137,
|
|
"loss": 5.831,
|
|
"mean_token_accuracy": 0.1835671290755272,
|
|
"num_tokens": 37006147.0,
|
|
"step": 14605
|
|
},
|
|
{
|
|
"entropy": 6.270266962051392,
|
|
"epoch": 1.6860934795152915,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00047254551103729597,
|
|
"loss": 5.766,
|
|
"mean_token_accuracy": 0.19732389599084854,
|
|
"num_tokens": 37018206.0,
|
|
"step": 14610
|
|
},
|
|
{
|
|
"entropy": 6.258600664138794,
|
|
"epoch": 1.6866705135603,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004725257545845055,
|
|
"loss": 5.8646,
|
|
"mean_token_accuracy": 0.18402135372161865,
|
|
"num_tokens": 37030632.0,
|
|
"step": 14615
|
|
},
|
|
{
|
|
"entropy": 6.138081741333008,
|
|
"epoch": 1.6872475476053088,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00047250599148803443,
|
|
"loss": 5.6794,
|
|
"mean_token_accuracy": 0.199339559674263,
|
|
"num_tokens": 37041700.0,
|
|
"step": 14620
|
|
},
|
|
{
|
|
"entropy": 6.236639738082886,
|
|
"epoch": 1.6878245816503172,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00047248622174854746,
|
|
"loss": 5.8093,
|
|
"mean_token_accuracy": 0.1956299975514412,
|
|
"num_tokens": 37054467.0,
|
|
"step": 14625
|
|
},
|
|
{
|
|
"entropy": 6.167034578323364,
|
|
"epoch": 1.688401615695326,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004724664453667094,
|
|
"loss": 5.7254,
|
|
"mean_token_accuracy": 0.1935678869485855,
|
|
"num_tokens": 37066596.0,
|
|
"step": 14630
|
|
},
|
|
{
|
|
"entropy": 6.227866506576538,
|
|
"epoch": 1.6889786497403345,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004724466623431857,
|
|
"loss": 5.856,
|
|
"mean_token_accuracy": 0.18633525371551513,
|
|
"num_tokens": 37078812.0,
|
|
"step": 14635
|
|
},
|
|
{
|
|
"entropy": 6.278513717651367,
|
|
"epoch": 1.6895556837853434,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004724268726786415,
|
|
"loss": 5.8192,
|
|
"mean_token_accuracy": 0.1916288822889328,
|
|
"num_tokens": 37090916.0,
|
|
"step": 14640
|
|
},
|
|
{
|
|
"entropy": 6.161556243896484,
|
|
"epoch": 1.690132717830352,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004724070763737424,
|
|
"loss": 5.6629,
|
|
"mean_token_accuracy": 0.20890249609947203,
|
|
"num_tokens": 37104687.0,
|
|
"step": 14645
|
|
},
|
|
{
|
|
"entropy": 6.254812526702881,
|
|
"epoch": 1.6907097518753607,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004723872734291545,
|
|
"loss": 5.867,
|
|
"mean_token_accuracy": 0.19037088453769685,
|
|
"num_tokens": 37117763.0,
|
|
"step": 14650
|
|
},
|
|
{
|
|
"entropy": 6.245172071456909,
|
|
"epoch": 1.6912867859203693,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00047236746384554364,
|
|
"loss": 5.7302,
|
|
"mean_token_accuracy": 0.19735212624073029,
|
|
"num_tokens": 37130355.0,
|
|
"step": 14655
|
|
},
|
|
{
|
|
"entropy": 6.27752685546875,
|
|
"epoch": 1.691863819965378,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004723476476235762,
|
|
"loss": 5.7599,
|
|
"mean_token_accuracy": 0.19666002839803695,
|
|
"num_tokens": 37142116.0,
|
|
"step": 14660
|
|
},
|
|
{
|
|
"entropy": 6.163359785079956,
|
|
"epoch": 1.6924408540103866,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004723278247639186,
|
|
"loss": 5.741,
|
|
"mean_token_accuracy": 0.19864833503961563,
|
|
"num_tokens": 37153841.0,
|
|
"step": 14665
|
|
},
|
|
{
|
|
"entropy": 6.198128128051758,
|
|
"epoch": 1.6930178880553952,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004723079952672377,
|
|
"loss": 5.7553,
|
|
"mean_token_accuracy": 0.19592914432287217,
|
|
"num_tokens": 37165119.0,
|
|
"step": 14670
|
|
},
|
|
{
|
|
"entropy": 6.284871768951416,
|
|
"epoch": 1.693594922100404,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00047228815913420035,
|
|
"loss": 5.8468,
|
|
"mean_token_accuracy": 0.19341864287853242,
|
|
"num_tokens": 37178188.0,
|
|
"step": 14675
|
|
},
|
|
{
|
|
"entropy": 6.171255970001221,
|
|
"epoch": 1.6941719561454125,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004722683163654738,
|
|
"loss": 5.716,
|
|
"mean_token_accuracy": 0.20382838249206542,
|
|
"num_tokens": 37190211.0,
|
|
"step": 14680
|
|
},
|
|
{
|
|
"entropy": 6.188739013671875,
|
|
"epoch": 1.6947489901904214,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004722484669617254,
|
|
"loss": 5.7178,
|
|
"mean_token_accuracy": 0.19711641371250152,
|
|
"num_tokens": 37202408.0,
|
|
"step": 14685
|
|
},
|
|
{
|
|
"entropy": 6.259600734710693,
|
|
"epoch": 1.6953260242354298,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00047222861092362277,
|
|
"loss": 5.8085,
|
|
"mean_token_accuracy": 0.190089850127697,
|
|
"num_tokens": 37214393.0,
|
|
"step": 14690
|
|
},
|
|
{
|
|
"entropy": 6.2397665023803714,
|
|
"epoch": 1.6959030582804386,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047220874825183387,
|
|
"loss": 5.7293,
|
|
"mean_token_accuracy": 0.19584015309810637,
|
|
"num_tokens": 37227212.0,
|
|
"step": 14695
|
|
},
|
|
{
|
|
"entropy": 6.1494776725769045,
|
|
"epoch": 1.696480092325447,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00047218887894702656,
|
|
"loss": 5.7782,
|
|
"mean_token_accuracy": 0.1920495629310608,
|
|
"num_tokens": 37239742.0,
|
|
"step": 14700
|
|
},
|
|
{
|
|
"entropy": 6.268459510803223,
|
|
"epoch": 1.697057126370456,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004721690030098693,
|
|
"loss": 5.8354,
|
|
"mean_token_accuracy": 0.1878738060593605,
|
|
"num_tokens": 37254037.0,
|
|
"step": 14705
|
|
},
|
|
{
|
|
"entropy": 6.303516960144043,
|
|
"epoch": 1.6976341604154646,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004721491204410305,
|
|
"loss": 5.8516,
|
|
"mean_token_accuracy": 0.18976494073867797,
|
|
"num_tokens": 37265221.0,
|
|
"step": 14710
|
|
},
|
|
{
|
|
"entropy": 6.296883869171142,
|
|
"epoch": 1.6982111944604732,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00047212923124117915,
|
|
"loss": 5.8096,
|
|
"mean_token_accuracy": 0.19008704870939255,
|
|
"num_tokens": 37277992.0,
|
|
"step": 14715
|
|
},
|
|
{
|
|
"entropy": 6.190418481826782,
|
|
"epoch": 1.6987882285054818,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004721093354109839,
|
|
"loss": 5.7514,
|
|
"mean_token_accuracy": 0.1978226602077484,
|
|
"num_tokens": 37291608.0,
|
|
"step": 14720
|
|
},
|
|
{
|
|
"entropy": 6.243216705322266,
|
|
"epoch": 1.6993652625504905,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00047208943295111406,
|
|
"loss": 5.805,
|
|
"mean_token_accuracy": 0.18855539560317994,
|
|
"num_tokens": 37303619.0,
|
|
"step": 14725
|
|
},
|
|
{
|
|
"entropy": 6.267891263961792,
|
|
"epoch": 1.6999422965954991,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047206952386223905,
|
|
"loss": 5.8398,
|
|
"mean_token_accuracy": 0.1896793693304062,
|
|
"num_tokens": 37316215.0,
|
|
"step": 14730
|
|
},
|
|
{
|
|
"entropy": 6.196926593780518,
|
|
"epoch": 1.7005193306405078,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004720496081450285,
|
|
"loss": 5.8059,
|
|
"mean_token_accuracy": 0.19608232825994493,
|
|
"num_tokens": 37328643.0,
|
|
"step": 14735
|
|
},
|
|
{
|
|
"entropy": 6.205492639541626,
|
|
"epoch": 1.7010963646855164,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00047202968580015224,
|
|
"loss": 5.7457,
|
|
"mean_token_accuracy": 0.19729107320308686,
|
|
"num_tokens": 37340792.0,
|
|
"step": 14740
|
|
},
|
|
{
|
|
"entropy": 6.328804779052734,
|
|
"epoch": 1.701673398730525,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00047200975682828045,
|
|
"loss": 5.7846,
|
|
"mean_token_accuracy": 0.18756407052278518,
|
|
"num_tokens": 37353866.0,
|
|
"step": 14745
|
|
},
|
|
{
|
|
"entropy": 6.197791004180909,
|
|
"epoch": 1.702250432775534,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004719898212300832,
|
|
"loss": 5.7893,
|
|
"mean_token_accuracy": 0.1926332965493202,
|
|
"num_tokens": 37365403.0,
|
|
"step": 14750
|
|
},
|
|
{
|
|
"entropy": 6.213804912567139,
|
|
"epoch": 1.7028274668205423,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00047196987900623134,
|
|
"loss": 5.7799,
|
|
"mean_token_accuracy": 0.1956440106034279,
|
|
"num_tokens": 37379487.0,
|
|
"step": 14755
|
|
},
|
|
{
|
|
"entropy": 6.288925409317017,
|
|
"epoch": 1.7034045008655512,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00047194993015739527,
|
|
"loss": 5.7255,
|
|
"mean_token_accuracy": 0.19549834579229355,
|
|
"num_tokens": 37392497.0,
|
|
"step": 14760
|
|
},
|
|
{
|
|
"entropy": 6.151324367523193,
|
|
"epoch": 1.7039815349105596,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00047192997468424624,
|
|
"loss": 5.6554,
|
|
"mean_token_accuracy": 0.2037911593914032,
|
|
"num_tokens": 37407126.0,
|
|
"step": 14765
|
|
},
|
|
{
|
|
"entropy": 6.107523441314697,
|
|
"epoch": 1.7045585689555685,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004719100125874553,
|
|
"loss": 5.7359,
|
|
"mean_token_accuracy": 0.20345260202884674,
|
|
"num_tokens": 37419768.0,
|
|
"step": 14770
|
|
},
|
|
{
|
|
"entropy": 6.216525936126709,
|
|
"epoch": 1.7051356030005769,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004718900438676939,
|
|
"loss": 5.7706,
|
|
"mean_token_accuracy": 0.1966918244957924,
|
|
"num_tokens": 37432512.0,
|
|
"step": 14775
|
|
},
|
|
{
|
|
"entropy": 6.280521440505981,
|
|
"epoch": 1.7057126370455857,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004718700685256337,
|
|
"loss": 5.8818,
|
|
"mean_token_accuracy": 0.19116677343845367,
|
|
"num_tokens": 37445006.0,
|
|
"step": 14780
|
|
},
|
|
{
|
|
"entropy": 6.279793214797974,
|
|
"epoch": 1.7062896710905944,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004718500865619465,
|
|
"loss": 5.8623,
|
|
"mean_token_accuracy": 0.18711167126893996,
|
|
"num_tokens": 37457386.0,
|
|
"step": 14785
|
|
},
|
|
{
|
|
"entropy": 6.241596269607544,
|
|
"epoch": 1.706866705135603,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004718300979773044,
|
|
"loss": 5.7351,
|
|
"mean_token_accuracy": 0.2007654130458832,
|
|
"num_tokens": 37469773.0,
|
|
"step": 14790
|
|
},
|
|
{
|
|
"entropy": 6.293059015274048,
|
|
"epoch": 1.7074437391806117,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00047181010277237977,
|
|
"loss": 5.7562,
|
|
"mean_token_accuracy": 0.20070116072893143,
|
|
"num_tokens": 37483301.0,
|
|
"step": 14795
|
|
},
|
|
{
|
|
"entropy": 6.245371294021607,
|
|
"epoch": 1.7080207732256203,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004717901009478451,
|
|
"loss": 5.821,
|
|
"mean_token_accuracy": 0.19299632906913758,
|
|
"num_tokens": 37495110.0,
|
|
"step": 14800
|
|
},
|
|
{
|
|
"entropy": 6.242628049850464,
|
|
"epoch": 1.708597807270629,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00047177009250437313,
|
|
"loss": 5.7363,
|
|
"mean_token_accuracy": 0.20338231921195984,
|
|
"num_tokens": 37509281.0,
|
|
"step": 14805
|
|
},
|
|
{
|
|
"entropy": 6.195139837265015,
|
|
"epoch": 1.7091748413156376,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00047175007744263683,
|
|
"loss": 5.7811,
|
|
"mean_token_accuracy": 0.19870874732732774,
|
|
"num_tokens": 37522690.0,
|
|
"step": 14810
|
|
},
|
|
{
|
|
"entropy": 6.209357118606567,
|
|
"epoch": 1.7097518753606464,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00047173005576330935,
|
|
"loss": 5.7857,
|
|
"mean_token_accuracy": 0.19668878614902496,
|
|
"num_tokens": 37534737.0,
|
|
"step": 14815
|
|
},
|
|
{
|
|
"entropy": 6.265194892883301,
|
|
"epoch": 1.7103289094056549,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00047171002746706424,
|
|
"loss": 5.8194,
|
|
"mean_token_accuracy": 0.19461351931095122,
|
|
"num_tokens": 37547486.0,
|
|
"step": 14820
|
|
},
|
|
{
|
|
"entropy": 6.374362993240356,
|
|
"epoch": 1.7109059434506637,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00047168999255457506,
|
|
"loss": 5.8569,
|
|
"mean_token_accuracy": 0.1927626445889473,
|
|
"num_tokens": 37560083.0,
|
|
"step": 14825
|
|
},
|
|
{
|
|
"entropy": 6.199889993667602,
|
|
"epoch": 1.7114829774956721,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00047166995102651565,
|
|
"loss": 5.75,
|
|
"mean_token_accuracy": 0.19805205762386321,
|
|
"num_tokens": 37573260.0,
|
|
"step": 14830
|
|
},
|
|
{
|
|
"entropy": 6.248316097259521,
|
|
"epoch": 1.712060011540681,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004716499028835601,
|
|
"loss": 5.8518,
|
|
"mean_token_accuracy": 0.19746263325214386,
|
|
"num_tokens": 37586403.0,
|
|
"step": 14835
|
|
},
|
|
{
|
|
"entropy": 6.225171422958374,
|
|
"epoch": 1.7126370455856894,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004716298481263828,
|
|
"loss": 5.7769,
|
|
"mean_token_accuracy": 0.2004181981086731,
|
|
"num_tokens": 37600771.0,
|
|
"step": 14840
|
|
},
|
|
{
|
|
"entropy": 6.297064113616943,
|
|
"epoch": 1.7132140796306983,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004716097867556583,
|
|
"loss": 5.7504,
|
|
"mean_token_accuracy": 0.19541673809289933,
|
|
"num_tokens": 37613623.0,
|
|
"step": 14845
|
|
},
|
|
{
|
|
"entropy": 6.210472059249878,
|
|
"epoch": 1.713791113675707,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00047158971877206114,
|
|
"loss": 5.7217,
|
|
"mean_token_accuracy": 0.19584263861179352,
|
|
"num_tokens": 37624539.0,
|
|
"step": 14850
|
|
},
|
|
{
|
|
"entropy": 6.214003038406372,
|
|
"epoch": 1.7143681477207156,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004715696441762665,
|
|
"loss": 5.8254,
|
|
"mean_token_accuracy": 0.18597609251737596,
|
|
"num_tokens": 37636556.0,
|
|
"step": 14855
|
|
},
|
|
{
|
|
"entropy": 6.274157619476318,
|
|
"epoch": 1.7149451817657242,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00047154956296894954,
|
|
"loss": 5.7861,
|
|
"mean_token_accuracy": 0.1940763294696808,
|
|
"num_tokens": 37648369.0,
|
|
"step": 14860
|
|
},
|
|
{
|
|
"entropy": 6.290304517745971,
|
|
"epoch": 1.7155222158107328,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004715294751507856,
|
|
"loss": 5.8648,
|
|
"mean_token_accuracy": 0.18487513512372972,
|
|
"num_tokens": 37661118.0,
|
|
"step": 14865
|
|
},
|
|
{
|
|
"entropy": 6.264235591888427,
|
|
"epoch": 1.7160992498557415,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004715093807224505,
|
|
"loss": 5.7724,
|
|
"mean_token_accuracy": 0.19355957508087157,
|
|
"num_tokens": 37673915.0,
|
|
"step": 14870
|
|
},
|
|
{
|
|
"entropy": 6.220427656173706,
|
|
"epoch": 1.71667628390075,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.00047148927968462,
|
|
"loss": 5.786,
|
|
"mean_token_accuracy": 0.1952811747789383,
|
|
"num_tokens": 37687359.0,
|
|
"step": 14875
|
|
},
|
|
{
|
|
"entropy": 6.213399982452392,
|
|
"epoch": 1.7172533179457588,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00047146917203797,
|
|
"loss": 5.7825,
|
|
"mean_token_accuracy": 0.19128514379262923,
|
|
"num_tokens": 37700111.0,
|
|
"step": 14880
|
|
},
|
|
{
|
|
"entropy": 6.358771228790284,
|
|
"epoch": 1.7178303519907674,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004714490577831771,
|
|
"loss": 5.932,
|
|
"mean_token_accuracy": 0.18157403022050858,
|
|
"num_tokens": 37712707.0,
|
|
"step": 14885
|
|
},
|
|
{
|
|
"entropy": 6.3575211524963375,
|
|
"epoch": 1.7184073860357763,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004714289369209177,
|
|
"loss": 5.8625,
|
|
"mean_token_accuracy": 0.1848388597369194,
|
|
"num_tokens": 37724242.0,
|
|
"step": 14890
|
|
},
|
|
{
|
|
"entropy": 6.273309421539307,
|
|
"epoch": 1.7189844200807847,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00047140880945186863,
|
|
"loss": 5.7986,
|
|
"mean_token_accuracy": 0.19703706353902817,
|
|
"num_tokens": 37737451.0,
|
|
"step": 14895
|
|
},
|
|
{
|
|
"entropy": 6.281686735153198,
|
|
"epoch": 1.7195614541257935,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00047138867537670676,
|
|
"loss": 5.8386,
|
|
"mean_token_accuracy": 0.18533087223768235,
|
|
"num_tokens": 37749968.0,
|
|
"step": 14900
|
|
},
|
|
{
|
|
"entropy": 6.230262804031372,
|
|
"epoch": 1.720138488170802,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00047136853469610933,
|
|
"loss": 5.748,
|
|
"mean_token_accuracy": 0.20007234215736389,
|
|
"num_tokens": 37761961.0,
|
|
"step": 14905
|
|
},
|
|
{
|
|
"entropy": 6.231614208221435,
|
|
"epoch": 1.7207155222158108,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00047134838741075383,
|
|
"loss": 5.784,
|
|
"mean_token_accuracy": 0.19633534252643586,
|
|
"num_tokens": 37775089.0,
|
|
"step": 14910
|
|
},
|
|
{
|
|
"entropy": 6.256774854660034,
|
|
"epoch": 1.7212925562608192,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00047132823352131787,
|
|
"loss": 5.8697,
|
|
"mean_token_accuracy": 0.18893859386444092,
|
|
"num_tokens": 37787072.0,
|
|
"step": 14915
|
|
},
|
|
{
|
|
"entropy": 6.238740253448486,
|
|
"epoch": 1.721869590305828,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004713080730284793,
|
|
"loss": 5.7746,
|
|
"mean_token_accuracy": 0.1915179818868637,
|
|
"num_tokens": 37799162.0,
|
|
"step": 14920
|
|
},
|
|
{
|
|
"entropy": 6.227374458312989,
|
|
"epoch": 1.7224466243508367,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00047128790593291617,
|
|
"loss": 5.8036,
|
|
"mean_token_accuracy": 0.1961027055978775,
|
|
"num_tokens": 37811560.0,
|
|
"step": 14925
|
|
},
|
|
{
|
|
"entropy": 6.2812048435211185,
|
|
"epoch": 1.7230236583958454,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00047126773223530677,
|
|
"loss": 5.7289,
|
|
"mean_token_accuracy": 0.1987067461013794,
|
|
"num_tokens": 37823832.0,
|
|
"step": 14930
|
|
},
|
|
{
|
|
"entropy": 6.285789251327515,
|
|
"epoch": 1.723600692440854,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00047124755193632975,
|
|
"loss": 5.8148,
|
|
"mean_token_accuracy": 0.19008388817310334,
|
|
"num_tokens": 37836718.0,
|
|
"step": 14935
|
|
},
|
|
{
|
|
"entropy": 6.151156234741211,
|
|
"epoch": 1.7241777264858626,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00047122736503666377,
|
|
"loss": 5.7345,
|
|
"mean_token_accuracy": 0.19504396617412567,
|
|
"num_tokens": 37850001.0,
|
|
"step": 14940
|
|
},
|
|
{
|
|
"entropy": 6.159657716751099,
|
|
"epoch": 1.7247547605308713,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004712071715369878,
|
|
"loss": 5.6801,
|
|
"mean_token_accuracy": 0.2019476920366287,
|
|
"num_tokens": 37862425.0,
|
|
"step": 14945
|
|
},
|
|
{
|
|
"entropy": 6.231092023849487,
|
|
"epoch": 1.72533179457588,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004711869714379812,
|
|
"loss": 5.7032,
|
|
"mean_token_accuracy": 0.19919241815805436,
|
|
"num_tokens": 37874429.0,
|
|
"step": 14950
|
|
},
|
|
{
|
|
"entropy": 6.18427791595459,
|
|
"epoch": 1.7259088286208888,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004711667647403232,
|
|
"loss": 5.7714,
|
|
"mean_token_accuracy": 0.1992158979177475,
|
|
"num_tokens": 37888317.0,
|
|
"step": 14955
|
|
},
|
|
{
|
|
"entropy": 6.216259098052978,
|
|
"epoch": 1.7264858626658972,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00047114655144469354,
|
|
"loss": 5.7637,
|
|
"mean_token_accuracy": 0.19563002586364747,
|
|
"num_tokens": 37901101.0,
|
|
"step": 14960
|
|
},
|
|
{
|
|
"entropy": 6.275106811523438,
|
|
"epoch": 1.727062896710906,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00047112633155177203,
|
|
"loss": 5.8041,
|
|
"mean_token_accuracy": 0.19201582670211792,
|
|
"num_tokens": 37914013.0,
|
|
"step": 14965
|
|
},
|
|
{
|
|
"entropy": 6.162282419204712,
|
|
"epoch": 1.7276399307559145,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004711061050622388,
|
|
"loss": 5.7177,
|
|
"mean_token_accuracy": 0.20372351109981537,
|
|
"num_tokens": 37926799.0,
|
|
"step": 14970
|
|
},
|
|
{
|
|
"entropy": 6.157208204269409,
|
|
"epoch": 1.7282169648009233,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00047108587197677404,
|
|
"loss": 5.6915,
|
|
"mean_token_accuracy": 0.20362317562103271,
|
|
"num_tokens": 37939173.0,
|
|
"step": 14975
|
|
},
|
|
{
|
|
"entropy": 6.303074741363526,
|
|
"epoch": 1.7287939988459318,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00047106563229605845,
|
|
"loss": 5.8849,
|
|
"mean_token_accuracy": 0.1878253310918808,
|
|
"num_tokens": 37951030.0,
|
|
"step": 14980
|
|
},
|
|
{
|
|
"entropy": 6.284793043136597,
|
|
"epoch": 1.7293710328909406,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00047104538602077276,
|
|
"loss": 5.8565,
|
|
"mean_token_accuracy": 0.18910656869411469,
|
|
"num_tokens": 37964005.0,
|
|
"step": 14985
|
|
},
|
|
{
|
|
"entropy": 6.2199421405792235,
|
|
"epoch": 1.7299480669359493,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004710251331515978,
|
|
"loss": 5.8242,
|
|
"mean_token_accuracy": 0.18915827125310897,
|
|
"num_tokens": 37975851.0,
|
|
"step": 14990
|
|
},
|
|
{
|
|
"entropy": 6.276341295242309,
|
|
"epoch": 1.730525100980958,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00047100487368921485,
|
|
"loss": 5.8071,
|
|
"mean_token_accuracy": 0.1844043716788292,
|
|
"num_tokens": 37988008.0,
|
|
"step": 14995
|
|
},
|
|
{
|
|
"entropy": 6.245677185058594,
|
|
"epoch": 1.7311021350259665,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004709846076343055,
|
|
"loss": 5.8426,
|
|
"mean_token_accuracy": 0.19950297027826308,
|
|
"num_tokens": 38000915.0,
|
|
"step": 15000
|
|
},
|
|
{
|
|
"epoch": 1.7311021350259665,
|
|
"eval_entropy": 6.027668285749499,
|
|
"eval_loss": 5.859091758728027,
|
|
"eval_mean_token_accuracy": 0.198191051585094,
|
|
"eval_num_tokens": 38000915.0,
|
|
"eval_runtime": 17.5708,
|
|
"eval_samples_per_second": 1601.292,
|
|
"eval_steps_per_second": 200.162,
|
|
"step": 15000
|
|
},
|
|
{
|
|
"entropy": 6.1998467445373535,
|
|
"epoch": 1.7316791690709752,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00047096433498755103,
|
|
"loss": 5.7945,
|
|
"mean_token_accuracy": 0.19635732620954513,
|
|
"num_tokens": 38013109.0,
|
|
"step": 15005
|
|
},
|
|
{
|
|
"entropy": 6.225084114074707,
|
|
"epoch": 1.7322562031159838,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00047094405574963364,
|
|
"loss": 5.7896,
|
|
"mean_token_accuracy": 0.194148051738739,
|
|
"num_tokens": 38025969.0,
|
|
"step": 15010
|
|
},
|
|
{
|
|
"entropy": 6.260206031799316,
|
|
"epoch": 1.7328332371609925,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00047092376992123516,
|
|
"loss": 5.7628,
|
|
"mean_token_accuracy": 0.19929637908935546,
|
|
"num_tokens": 38039104.0,
|
|
"step": 15015
|
|
},
|
|
{
|
|
"entropy": 6.228306007385254,
|
|
"epoch": 1.733410271206001,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00047090347750303803,
|
|
"loss": 5.8441,
|
|
"mean_token_accuracy": 0.1936349615454674,
|
|
"num_tokens": 38053453.0,
|
|
"step": 15020
|
|
},
|
|
{
|
|
"entropy": 6.302817726135254,
|
|
"epoch": 1.7339873052510097,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004708831784957247,
|
|
"loss": 5.8718,
|
|
"mean_token_accuracy": 0.18640264719724656,
|
|
"num_tokens": 38064932.0,
|
|
"step": 15025
|
|
},
|
|
{
|
|
"entropy": 6.2317393779754635,
|
|
"epoch": 1.7345643392960186,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004708628728999781,
|
|
"loss": 5.7555,
|
|
"mean_token_accuracy": 0.1919494777917862,
|
|
"num_tokens": 38078904.0,
|
|
"step": 15030
|
|
},
|
|
{
|
|
"entropy": 6.292373132705689,
|
|
"epoch": 1.735141373341027,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004708425607164809,
|
|
"loss": 5.8553,
|
|
"mean_token_accuracy": 0.18859525322914122,
|
|
"num_tokens": 38092605.0,
|
|
"step": 15035
|
|
},
|
|
{
|
|
"entropy": 6.221016931533813,
|
|
"epoch": 1.7357184073860359,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004708222419459165,
|
|
"loss": 5.7408,
|
|
"mean_token_accuracy": 0.2024005964398384,
|
|
"num_tokens": 38105953.0,
|
|
"step": 15040
|
|
},
|
|
{
|
|
"entropy": 6.250510501861572,
|
|
"epoch": 1.7362954414310443,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004708019165889683,
|
|
"loss": 5.9294,
|
|
"mean_token_accuracy": 0.1820162132382393,
|
|
"num_tokens": 38118485.0,
|
|
"step": 15045
|
|
},
|
|
{
|
|
"entropy": 6.306356477737427,
|
|
"epoch": 1.7368724754760532,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004707815846463199,
|
|
"loss": 5.8671,
|
|
"mean_token_accuracy": 0.18989114910364152,
|
|
"num_tokens": 38131220.0,
|
|
"step": 15050
|
|
},
|
|
{
|
|
"entropy": 6.206059408187866,
|
|
"epoch": 1.7374495095210616,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004707612461186552,
|
|
"loss": 5.7749,
|
|
"mean_token_accuracy": 0.1962239608168602,
|
|
"num_tokens": 38143012.0,
|
|
"step": 15055
|
|
},
|
|
{
|
|
"entropy": 6.170250272750854,
|
|
"epoch": 1.7380265435660704,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00047074090100665805,
|
|
"loss": 5.6875,
|
|
"mean_token_accuracy": 0.20471351891756057,
|
|
"num_tokens": 38155810.0,
|
|
"step": 15060
|
|
},
|
|
{
|
|
"entropy": 6.262243032455444,
|
|
"epoch": 1.738603577611079,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00047072054931101306,
|
|
"loss": 5.8278,
|
|
"mean_token_accuracy": 0.18701076209545137,
|
|
"num_tokens": 38169183.0,
|
|
"step": 15065
|
|
},
|
|
{
|
|
"entropy": 6.228375577926636,
|
|
"epoch": 1.7391806116560877,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004707001910324046,
|
|
"loss": 5.8259,
|
|
"mean_token_accuracy": 0.18984763771295549,
|
|
"num_tokens": 38182098.0,
|
|
"step": 15070
|
|
},
|
|
{
|
|
"entropy": 6.3191286563873295,
|
|
"epoch": 1.7397576457010964,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047067982617151737,
|
|
"loss": 5.8301,
|
|
"mean_token_accuracy": 0.18910346925258636,
|
|
"num_tokens": 38194950.0,
|
|
"step": 15075
|
|
},
|
|
{
|
|
"entropy": 6.264245414733887,
|
|
"epoch": 1.740334679746105,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004706594547290365,
|
|
"loss": 5.7909,
|
|
"mean_token_accuracy": 0.19904323369264604,
|
|
"num_tokens": 38207600.0,
|
|
"step": 15080
|
|
},
|
|
{
|
|
"entropy": 6.226841163635254,
|
|
"epoch": 1.7409117137911136,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00047063907670564695,
|
|
"loss": 5.7119,
|
|
"mean_token_accuracy": 0.2084239214658737,
|
|
"num_tokens": 38219489.0,
|
|
"step": 15085
|
|
},
|
|
{
|
|
"entropy": 6.228709650039673,
|
|
"epoch": 1.7414887478361223,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004706186921020342,
|
|
"loss": 5.7838,
|
|
"mean_token_accuracy": 0.19626915454864502,
|
|
"num_tokens": 38233240.0,
|
|
"step": 15090
|
|
},
|
|
{
|
|
"entropy": 6.255122900009155,
|
|
"epoch": 1.7420657818811311,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00047059830091888407,
|
|
"loss": 5.7584,
|
|
"mean_token_accuracy": 0.19674482345581054,
|
|
"num_tokens": 38245967.0,
|
|
"step": 15095
|
|
},
|
|
{
|
|
"entropy": 6.243045997619629,
|
|
"epoch": 1.7426428159261396,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004705779031568821,
|
|
"loss": 5.7768,
|
|
"mean_token_accuracy": 0.18915130496025084,
|
|
"num_tokens": 38258586.0,
|
|
"step": 15100
|
|
},
|
|
{
|
|
"entropy": 6.210542440414429,
|
|
"epoch": 1.7432198499711484,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00047055749881671463,
|
|
"loss": 5.8401,
|
|
"mean_token_accuracy": 0.19314245879650116,
|
|
"num_tokens": 38270007.0,
|
|
"step": 15105
|
|
},
|
|
{
|
|
"entropy": 6.282091379165649,
|
|
"epoch": 1.7437968840161568,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004705370878990677,
|
|
"loss": 5.744,
|
|
"mean_token_accuracy": 0.19978414922952653,
|
|
"num_tokens": 38282580.0,
|
|
"step": 15110
|
|
},
|
|
{
|
|
"entropy": 6.2048032760620115,
|
|
"epoch": 1.7443739180611657,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00047051667040462806,
|
|
"loss": 5.6943,
|
|
"mean_token_accuracy": 0.20065076798200607,
|
|
"num_tokens": 38295577.0,
|
|
"step": 15115
|
|
},
|
|
{
|
|
"entropy": 6.218212985992432,
|
|
"epoch": 1.7449509521061741,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00047049624633408224,
|
|
"loss": 5.8663,
|
|
"mean_token_accuracy": 0.18592003136873245,
|
|
"num_tokens": 38307924.0,
|
|
"step": 15120
|
|
},
|
|
{
|
|
"entropy": 6.316382169723511,
|
|
"epoch": 1.745527986151183,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00047047581568811724,
|
|
"loss": 5.7687,
|
|
"mean_token_accuracy": 0.1929919019341469,
|
|
"num_tokens": 38321573.0,
|
|
"step": 15125
|
|
},
|
|
{
|
|
"entropy": 6.251517629623413,
|
|
"epoch": 1.7461050201961916,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00047045537846742043,
|
|
"loss": 5.7673,
|
|
"mean_token_accuracy": 0.19639647901058196,
|
|
"num_tokens": 38333953.0,
|
|
"step": 15130
|
|
},
|
|
{
|
|
"entropy": 6.224976444244385,
|
|
"epoch": 1.7466820542412003,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.000470434934672679,
|
|
"loss": 5.8044,
|
|
"mean_token_accuracy": 0.18785583078861237,
|
|
"num_tokens": 38346028.0,
|
|
"step": 15135
|
|
},
|
|
{
|
|
"entropy": 6.290715026855469,
|
|
"epoch": 1.747259088286209,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00047041448430458054,
|
|
"loss": 5.7369,
|
|
"mean_token_accuracy": 0.19406510293483734,
|
|
"num_tokens": 38358806.0,
|
|
"step": 15140
|
|
},
|
|
{
|
|
"entropy": 6.217677211761474,
|
|
"epoch": 1.7478361223312175,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00047039402736381305,
|
|
"loss": 5.6909,
|
|
"mean_token_accuracy": 0.19793135076761245,
|
|
"num_tokens": 38370396.0,
|
|
"step": 15145
|
|
},
|
|
{
|
|
"entropy": 6.251976537704468,
|
|
"epoch": 1.7484131563762262,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004703735638510645,
|
|
"loss": 5.9143,
|
|
"mean_token_accuracy": 0.19204719215631486,
|
|
"num_tokens": 38383747.0,
|
|
"step": 15150
|
|
},
|
|
{
|
|
"entropy": 6.297483825683594,
|
|
"epoch": 1.7489901904212348,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004703530937670232,
|
|
"loss": 5.8218,
|
|
"mean_token_accuracy": 0.18911525160074233,
|
|
"num_tokens": 38396611.0,
|
|
"step": 15155
|
|
},
|
|
{
|
|
"entropy": 6.242986965179443,
|
|
"epoch": 1.7495672244662435,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004703326171123776,
|
|
"loss": 5.831,
|
|
"mean_token_accuracy": 0.19013755023479462,
|
|
"num_tokens": 38407627.0,
|
|
"step": 15160
|
|
},
|
|
{
|
|
"entropy": 6.129948234558105,
|
|
"epoch": 1.750144258511252,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004703121338878164,
|
|
"loss": 5.7308,
|
|
"mean_token_accuracy": 0.1990264892578125,
|
|
"num_tokens": 38420522.0,
|
|
"step": 15165
|
|
},
|
|
{
|
|
"entropy": 6.264822196960449,
|
|
"epoch": 1.750721292556261,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004702916440940286,
|
|
"loss": 5.8135,
|
|
"mean_token_accuracy": 0.19269165843725206,
|
|
"num_tokens": 38433968.0,
|
|
"step": 15170
|
|
},
|
|
{
|
|
"entropy": 6.245396900177002,
|
|
"epoch": 1.7512983266012694,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004702711477317034,
|
|
"loss": 5.8251,
|
|
"mean_token_accuracy": 0.1896095395088196,
|
|
"num_tokens": 38445819.0,
|
|
"step": 15175
|
|
},
|
|
{
|
|
"entropy": 6.314490032196045,
|
|
"epoch": 1.7518753606462782,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004702506448015301,
|
|
"loss": 5.8087,
|
|
"mean_token_accuracy": 0.19271332770586014,
|
|
"num_tokens": 38458823.0,
|
|
"step": 15180
|
|
},
|
|
{
|
|
"entropy": 6.226051235198975,
|
|
"epoch": 1.7524523946912867,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00047023013530419843,
|
|
"loss": 5.7935,
|
|
"mean_token_accuracy": 0.1927502915263176,
|
|
"num_tokens": 38472553.0,
|
|
"step": 15185
|
|
},
|
|
{
|
|
"entropy": 6.272993087768555,
|
|
"epoch": 1.7530294287362955,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004702096192403981,
|
|
"loss": 5.764,
|
|
"mean_token_accuracy": 0.19805403649806977,
|
|
"num_tokens": 38484143.0,
|
|
"step": 15190
|
|
},
|
|
{
|
|
"entropy": 6.22825927734375,
|
|
"epoch": 1.753606462781304,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004701890966108192,
|
|
"loss": 5.7884,
|
|
"mean_token_accuracy": 0.18909399807453156,
|
|
"num_tokens": 38496795.0,
|
|
"step": 15195
|
|
},
|
|
{
|
|
"entropy": 6.199388647079468,
|
|
"epoch": 1.7541834968263128,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000470168567416152,
|
|
"loss": 5.6885,
|
|
"mean_token_accuracy": 0.20440283715724944,
|
|
"num_tokens": 38509548.0,
|
|
"step": 15200
|
|
},
|
|
{
|
|
"entropy": 6.237175512313843,
|
|
"epoch": 1.7547605308713214,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004701480316570869,
|
|
"loss": 5.772,
|
|
"mean_token_accuracy": 0.19347795844078064,
|
|
"num_tokens": 38524011.0,
|
|
"step": 15205
|
|
},
|
|
{
|
|
"entropy": 6.263273048400879,
|
|
"epoch": 1.75533756491633,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004701274893343147,
|
|
"loss": 5.7944,
|
|
"mean_token_accuracy": 0.19191619306802749,
|
|
"num_tokens": 38536913.0,
|
|
"step": 15210
|
|
},
|
|
{
|
|
"entropy": 6.1626180648803714,
|
|
"epoch": 1.7559145989613387,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00047010694044852643,
|
|
"loss": 5.7562,
|
|
"mean_token_accuracy": 0.1957879841327667,
|
|
"num_tokens": 38548759.0,
|
|
"step": 15215
|
|
},
|
|
{
|
|
"entropy": 6.243113422393799,
|
|
"epoch": 1.7564916330063474,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000470086385000413,
|
|
"loss": 5.7656,
|
|
"mean_token_accuracy": 0.19853851497173308,
|
|
"num_tokens": 38562071.0,
|
|
"step": 15220
|
|
},
|
|
{
|
|
"entropy": 6.2278694152832035,
|
|
"epoch": 1.757068667051356,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004700658229906661,
|
|
"loss": 5.7928,
|
|
"mean_token_accuracy": 0.18952999264001846,
|
|
"num_tokens": 38573816.0,
|
|
"step": 15225
|
|
},
|
|
{
|
|
"entropy": 6.30017786026001,
|
|
"epoch": 1.7576457010963646,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00047004525441997694,
|
|
"loss": 5.8938,
|
|
"mean_token_accuracy": 0.1860449954867363,
|
|
"num_tokens": 38586625.0,
|
|
"step": 15230
|
|
},
|
|
{
|
|
"entropy": 6.262595701217651,
|
|
"epoch": 1.7582227351413735,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004700246792890376,
|
|
"loss": 5.8262,
|
|
"mean_token_accuracy": 0.19520506411790847,
|
|
"num_tokens": 38599391.0,
|
|
"step": 15235
|
|
},
|
|
{
|
|
"entropy": 6.215628337860108,
|
|
"epoch": 1.758799769186382,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004700040975985401,
|
|
"loss": 5.7351,
|
|
"mean_token_accuracy": 0.20383531004190444,
|
|
"num_tokens": 38610822.0,
|
|
"step": 15240
|
|
},
|
|
{
|
|
"entropy": 6.207050704956055,
|
|
"epoch": 1.7593768032313908,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00046998350934917654,
|
|
"loss": 5.7472,
|
|
"mean_token_accuracy": 0.19348314255475998,
|
|
"num_tokens": 38623886.0,
|
|
"step": 15245
|
|
},
|
|
{
|
|
"entropy": 6.198969173431396,
|
|
"epoch": 1.7599538372763992,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00046996291454163956,
|
|
"loss": 5.7118,
|
|
"mean_token_accuracy": 0.20203371942043305,
|
|
"num_tokens": 38636680.0,
|
|
"step": 15250
|
|
},
|
|
{
|
|
"entropy": 6.212174940109253,
|
|
"epoch": 1.760530871321408,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004699423131766218,
|
|
"loss": 5.7779,
|
|
"mean_token_accuracy": 0.2040209636092186,
|
|
"num_tokens": 38648841.0,
|
|
"step": 15255
|
|
},
|
|
{
|
|
"entropy": 6.171669149398804,
|
|
"epoch": 1.7611079053664165,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004699217052548161,
|
|
"loss": 5.7539,
|
|
"mean_token_accuracy": 0.2005374625325203,
|
|
"num_tokens": 38660603.0,
|
|
"step": 15260
|
|
},
|
|
{
|
|
"entropy": 6.237819528579712,
|
|
"epoch": 1.7616849394114253,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00046990109077691577,
|
|
"loss": 5.7766,
|
|
"mean_token_accuracy": 0.19491585344076157,
|
|
"num_tokens": 38674082.0,
|
|
"step": 15265
|
|
},
|
|
{
|
|
"entropy": 6.217108345031738,
|
|
"epoch": 1.762261973456434,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00046988046974361406,
|
|
"loss": 5.7206,
|
|
"mean_token_accuracy": 0.1978909581899643,
|
|
"num_tokens": 38686274.0,
|
|
"step": 15270
|
|
},
|
|
{
|
|
"entropy": 6.280757188796997,
|
|
"epoch": 1.7628390075014426,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004698598421556045,
|
|
"loss": 5.7949,
|
|
"mean_token_accuracy": 0.1977719321846962,
|
|
"num_tokens": 38699260.0,
|
|
"step": 15275
|
|
},
|
|
{
|
|
"entropy": 6.249194383621216,
|
|
"epoch": 1.7634160415464513,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004698392080135809,
|
|
"loss": 5.7858,
|
|
"mean_token_accuracy": 0.18940508514642715,
|
|
"num_tokens": 38712054.0,
|
|
"step": 15280
|
|
},
|
|
{
|
|
"entropy": 6.188735914230347,
|
|
"epoch": 1.76399307559146,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004698185673182374,
|
|
"loss": 5.7338,
|
|
"mean_token_accuracy": 0.20237622261047364,
|
|
"num_tokens": 38724634.0,
|
|
"step": 15285
|
|
},
|
|
{
|
|
"entropy": 6.214454269409179,
|
|
"epoch": 1.7645701096364685,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00046979792007026817,
|
|
"loss": 5.7185,
|
|
"mean_token_accuracy": 0.19849735498428345,
|
|
"num_tokens": 38737294.0,
|
|
"step": 15290
|
|
},
|
|
{
|
|
"entropy": 6.324564361572266,
|
|
"epoch": 1.7651471436814772,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004697772662703676,
|
|
"loss": 5.8993,
|
|
"mean_token_accuracy": 0.18402630239725112,
|
|
"num_tokens": 38749578.0,
|
|
"step": 15295
|
|
},
|
|
{
|
|
"entropy": 6.2132916927337645,
|
|
"epoch": 1.7657241777264858,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00046975660591923047,
|
|
"loss": 5.7805,
|
|
"mean_token_accuracy": 0.1883055880665779,
|
|
"num_tokens": 38762282.0,
|
|
"step": 15300
|
|
},
|
|
{
|
|
"entropy": 6.30076117515564,
|
|
"epoch": 1.7663012117714945,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004697359390175516,
|
|
"loss": 5.7676,
|
|
"mean_token_accuracy": 0.1952459216117859,
|
|
"num_tokens": 38773861.0,
|
|
"step": 15305
|
|
},
|
|
{
|
|
"entropy": 6.275486326217651,
|
|
"epoch": 1.7668782458165033,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00046971526556602625,
|
|
"loss": 5.8716,
|
|
"mean_token_accuracy": 0.18915152549743652,
|
|
"num_tokens": 38786427.0,
|
|
"step": 15310
|
|
},
|
|
{
|
|
"entropy": 6.263535261154175,
|
|
"epoch": 1.7674552798615117,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004696945855653495,
|
|
"loss": 5.856,
|
|
"mean_token_accuracy": 0.1845775306224823,
|
|
"num_tokens": 38798496.0,
|
|
"step": 15315
|
|
},
|
|
{
|
|
"entropy": 6.221828889846802,
|
|
"epoch": 1.7680323139065206,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004696738990162172,
|
|
"loss": 5.8379,
|
|
"mean_token_accuracy": 0.18447502553462983,
|
|
"num_tokens": 38812069.0,
|
|
"step": 15320
|
|
},
|
|
{
|
|
"entropy": 6.265704488754272,
|
|
"epoch": 1.768609347951529,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.000469653205919325,
|
|
"loss": 5.8781,
|
|
"mean_token_accuracy": 0.19169940948486328,
|
|
"num_tokens": 38824465.0,
|
|
"step": 15325
|
|
},
|
|
{
|
|
"entropy": 6.294767951965332,
|
|
"epoch": 1.7691863819965379,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00046963250627536884,
|
|
"loss": 5.8166,
|
|
"mean_token_accuracy": 0.1910833165049553,
|
|
"num_tokens": 38837328.0,
|
|
"step": 15330
|
|
},
|
|
{
|
|
"entropy": 6.208098030090332,
|
|
"epoch": 1.7697634160415463,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004696118000850451,
|
|
"loss": 5.7961,
|
|
"mean_token_accuracy": 0.19421351402997972,
|
|
"num_tokens": 38849238.0,
|
|
"step": 15335
|
|
},
|
|
{
|
|
"entropy": 6.192309045791626,
|
|
"epoch": 1.7703404500865552,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00046959108734905003,
|
|
"loss": 5.7641,
|
|
"mean_token_accuracy": 0.1998672679066658,
|
|
"num_tokens": 38861479.0,
|
|
"step": 15340
|
|
},
|
|
{
|
|
"entropy": 6.215923213958741,
|
|
"epoch": 1.7709174841315638,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00046957036806808045,
|
|
"loss": 5.7414,
|
|
"mean_token_accuracy": 0.19977018386125564,
|
|
"num_tokens": 38874342.0,
|
|
"step": 15345
|
|
},
|
|
{
|
|
"entropy": 6.221998167037964,
|
|
"epoch": 1.7714945181765724,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004695496422428332,
|
|
"loss": 5.7593,
|
|
"mean_token_accuracy": 0.19942527562379836,
|
|
"num_tokens": 38886595.0,
|
|
"step": 15350
|
|
},
|
|
{
|
|
"entropy": 6.248060798645019,
|
|
"epoch": 1.772071552221581,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004695289098740054,
|
|
"loss": 5.7896,
|
|
"mean_token_accuracy": 0.1939016655087471,
|
|
"num_tokens": 38899338.0,
|
|
"step": 15355
|
|
},
|
|
{
|
|
"entropy": 6.270295238494873,
|
|
"epoch": 1.7726485862665897,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004695081709622943,
|
|
"loss": 5.7699,
|
|
"mean_token_accuracy": 0.19445489048957826,
|
|
"num_tokens": 38911765.0,
|
|
"step": 15360
|
|
},
|
|
{
|
|
"entropy": 6.197941398620605,
|
|
"epoch": 1.7732256203115984,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00046948742550839744,
|
|
"loss": 5.7401,
|
|
"mean_token_accuracy": 0.2035606637597084,
|
|
"num_tokens": 38924137.0,
|
|
"step": 15365
|
|
},
|
|
{
|
|
"entropy": 6.26130781173706,
|
|
"epoch": 1.773802654356607,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004694666735130127,
|
|
"loss": 5.7189,
|
|
"mean_token_accuracy": 0.19911470264196396,
|
|
"num_tokens": 38936401.0,
|
|
"step": 15370
|
|
},
|
|
{
|
|
"entropy": 6.235423421859741,
|
|
"epoch": 1.7743796884016156,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.000469445914976838,
|
|
"loss": 5.8188,
|
|
"mean_token_accuracy": 0.19015101790428163,
|
|
"num_tokens": 38948224.0,
|
|
"step": 15375
|
|
},
|
|
{
|
|
"entropy": 6.26864709854126,
|
|
"epoch": 1.7749567224466243,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004694251499005715,
|
|
"loss": 5.7659,
|
|
"mean_token_accuracy": 0.19516605734825135,
|
|
"num_tokens": 38959924.0,
|
|
"step": 15380
|
|
},
|
|
{
|
|
"entropy": 6.2285974502563475,
|
|
"epoch": 1.7755337564916331,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004694043782849116,
|
|
"loss": 5.8013,
|
|
"mean_token_accuracy": 0.1916235476732254,
|
|
"num_tokens": 38973018.0,
|
|
"step": 15385
|
|
},
|
|
{
|
|
"entropy": 6.259120655059815,
|
|
"epoch": 1.7761107905366416,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00046938360013055715,
|
|
"loss": 5.8607,
|
|
"mean_token_accuracy": 0.18584455102682113,
|
|
"num_tokens": 38985634.0,
|
|
"step": 15390
|
|
},
|
|
{
|
|
"entropy": 6.284410619735718,
|
|
"epoch": 1.7766878245816504,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00046936281543820673,
|
|
"loss": 5.8258,
|
|
"mean_token_accuracy": 0.19096557646989823,
|
|
"num_tokens": 38999446.0,
|
|
"step": 15395
|
|
},
|
|
{
|
|
"entropy": 6.295167303085327,
|
|
"epoch": 1.7772648586266588,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00046934202420855967,
|
|
"loss": 5.8469,
|
|
"mean_token_accuracy": 0.19223827719688416,
|
|
"num_tokens": 39012974.0,
|
|
"step": 15400
|
|
},
|
|
{
|
|
"entropy": 6.223930025100708,
|
|
"epoch": 1.7778418926716677,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00046932122644231507,
|
|
"loss": 5.7461,
|
|
"mean_token_accuracy": 0.1959339052438736,
|
|
"num_tokens": 39025316.0,
|
|
"step": 15405
|
|
},
|
|
{
|
|
"entropy": 6.226829528808594,
|
|
"epoch": 1.7784189267166761,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00046930042214017256,
|
|
"loss": 5.6983,
|
|
"mean_token_accuracy": 0.20610239058732988,
|
|
"num_tokens": 39038174.0,
|
|
"step": 15410
|
|
},
|
|
{
|
|
"entropy": 6.30842137336731,
|
|
"epoch": 1.778995960761685,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004692796113028319,
|
|
"loss": 5.8718,
|
|
"mean_token_accuracy": 0.18104784041643143,
|
|
"num_tokens": 39051943.0,
|
|
"step": 15415
|
|
},
|
|
{
|
|
"entropy": 6.2169633388519285,
|
|
"epoch": 1.7795729948066936,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.000469258793930993,
|
|
"loss": 5.7505,
|
|
"mean_token_accuracy": 0.19396419674158097,
|
|
"num_tokens": 39064765.0,
|
|
"step": 15420
|
|
},
|
|
{
|
|
"entropy": 6.24879035949707,
|
|
"epoch": 1.7801500288517023,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00046923797002535605,
|
|
"loss": 5.8594,
|
|
"mean_token_accuracy": 0.18545962870121002,
|
|
"num_tokens": 39077326.0,
|
|
"step": 15425
|
|
},
|
|
{
|
|
"entropy": 6.255417680740356,
|
|
"epoch": 1.780727062896711,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004692171395866214,
|
|
"loss": 5.749,
|
|
"mean_token_accuracy": 0.19588208943605423,
|
|
"num_tokens": 39090049.0,
|
|
"step": 15430
|
|
},
|
|
{
|
|
"entropy": 6.237002658843994,
|
|
"epoch": 1.7813040969417195,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00046919630261548986,
|
|
"loss": 5.7838,
|
|
"mean_token_accuracy": 0.1968626856803894,
|
|
"num_tokens": 39102805.0,
|
|
"step": 15435
|
|
},
|
|
{
|
|
"entropy": 6.096398401260376,
|
|
"epoch": 1.7818811309867282,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00046917545911266207,
|
|
"loss": 5.688,
|
|
"mean_token_accuracy": 0.2085106134414673,
|
|
"num_tokens": 39115966.0,
|
|
"step": 15440
|
|
},
|
|
{
|
|
"entropy": 6.211426210403443,
|
|
"epoch": 1.7824581650317368,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046915460907883923,
|
|
"loss": 5.8036,
|
|
"mean_token_accuracy": 0.1936090975999832,
|
|
"num_tokens": 39128417.0,
|
|
"step": 15445
|
|
},
|
|
{
|
|
"entropy": 6.230034494400025,
|
|
"epoch": 1.7830351990767457,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00046913375251472246,
|
|
"loss": 5.7544,
|
|
"mean_token_accuracy": 0.19787432253360748,
|
|
"num_tokens": 39142338.0,
|
|
"step": 15450
|
|
},
|
|
{
|
|
"entropy": 6.252493810653687,
|
|
"epoch": 1.783612233121754,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00046911288942101345,
|
|
"loss": 5.8178,
|
|
"mean_token_accuracy": 0.19384605288505555,
|
|
"num_tokens": 39155055.0,
|
|
"step": 15455
|
|
},
|
|
{
|
|
"entropy": 6.257091951370239,
|
|
"epoch": 1.784189267166763,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004690920197984138,
|
|
"loss": 5.7942,
|
|
"mean_token_accuracy": 0.19681064337491988,
|
|
"num_tokens": 39167170.0,
|
|
"step": 15460
|
|
},
|
|
{
|
|
"entropy": 6.360779237747193,
|
|
"epoch": 1.7847663012117714,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004690711436476254,
|
|
"loss": 5.9037,
|
|
"mean_token_accuracy": 0.18777545541524887,
|
|
"num_tokens": 39181389.0,
|
|
"step": 15465
|
|
},
|
|
{
|
|
"entropy": 6.374752235412598,
|
|
"epoch": 1.7853433352567802,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00046905026096935056,
|
|
"loss": 5.8728,
|
|
"mean_token_accuracy": 0.18601856380701065,
|
|
"num_tokens": 39194728.0,
|
|
"step": 15470
|
|
},
|
|
{
|
|
"entropy": 6.148594760894776,
|
|
"epoch": 1.7859203693017887,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004690293717642916,
|
|
"loss": 5.7134,
|
|
"mean_token_accuracy": 0.20158033221960067,
|
|
"num_tokens": 39207945.0,
|
|
"step": 15475
|
|
},
|
|
{
|
|
"entropy": 6.253357934951782,
|
|
"epoch": 1.7864974033467975,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000469008476033151,
|
|
"loss": 5.8538,
|
|
"mean_token_accuracy": 0.1929816037416458,
|
|
"num_tokens": 39221314.0,
|
|
"step": 15480
|
|
},
|
|
{
|
|
"entropy": 6.276904487609864,
|
|
"epoch": 1.7870744373918062,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046898757377663176,
|
|
"loss": 5.8024,
|
|
"mean_token_accuracy": 0.1935829922556877,
|
|
"num_tokens": 39233910.0,
|
|
"step": 15485
|
|
},
|
|
{
|
|
"entropy": 6.246221685409546,
|
|
"epoch": 1.7876514714368148,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00046896666499543683,
|
|
"loss": 5.8003,
|
|
"mean_token_accuracy": 0.19562088698148727,
|
|
"num_tokens": 39246027.0,
|
|
"step": 15490
|
|
},
|
|
{
|
|
"entropy": 6.209698486328125,
|
|
"epoch": 1.7882285054818234,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00046894574969026946,
|
|
"loss": 5.7485,
|
|
"mean_token_accuracy": 0.1964795932173729,
|
|
"num_tokens": 39258456.0,
|
|
"step": 15495
|
|
},
|
|
{
|
|
"entropy": 6.284151840209961,
|
|
"epoch": 1.788805539526832,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00046892482786183313,
|
|
"loss": 5.8465,
|
|
"mean_token_accuracy": 0.1841995060443878,
|
|
"num_tokens": 39270624.0,
|
|
"step": 15500
|
|
},
|
|
{
|
|
"entropy": 6.2593241214752195,
|
|
"epoch": 1.7893825735718407,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00046890389951083155,
|
|
"loss": 5.7329,
|
|
"mean_token_accuracy": 0.19568620026111602,
|
|
"num_tokens": 39283350.0,
|
|
"step": 15505
|
|
},
|
|
{
|
|
"entropy": 6.287080955505371,
|
|
"epoch": 1.7899596076168494,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00046888296463796857,
|
|
"loss": 5.8432,
|
|
"mean_token_accuracy": 0.19254444241523744,
|
|
"num_tokens": 39296321.0,
|
|
"step": 15510
|
|
},
|
|
{
|
|
"entropy": 6.232756280899048,
|
|
"epoch": 1.790536641661858,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004688620232439485,
|
|
"loss": 5.7017,
|
|
"mean_token_accuracy": 0.20558897256851197,
|
|
"num_tokens": 39309223.0,
|
|
"step": 15515
|
|
},
|
|
{
|
|
"entropy": 6.22496485710144,
|
|
"epoch": 1.7911136757068666,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.00046884107532947547,
|
|
"loss": 5.6886,
|
|
"mean_token_accuracy": 0.19321909546852112,
|
|
"num_tokens": 39322348.0,
|
|
"step": 15520
|
|
},
|
|
{
|
|
"entropy": 6.227154541015625,
|
|
"epoch": 1.7916907097518755,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00046882012089525415,
|
|
"loss": 5.786,
|
|
"mean_token_accuracy": 0.18817334324121476,
|
|
"num_tokens": 39335375.0,
|
|
"step": 15525
|
|
},
|
|
{
|
|
"entropy": 6.265221357345581,
|
|
"epoch": 1.792267743796884,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004687991599419895,
|
|
"loss": 5.8031,
|
|
"mean_token_accuracy": 0.19223275780677795,
|
|
"num_tokens": 39347865.0,
|
|
"step": 15530
|
|
},
|
|
{
|
|
"entropy": 6.249596834182739,
|
|
"epoch": 1.7928447778418928,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00046877819247038624,
|
|
"loss": 5.8487,
|
|
"mean_token_accuracy": 0.19005428701639177,
|
|
"num_tokens": 39361402.0,
|
|
"step": 15535
|
|
},
|
|
{
|
|
"entropy": 6.221106147766113,
|
|
"epoch": 1.7934218118869012,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004687572184811497,
|
|
"loss": 5.7079,
|
|
"mean_token_accuracy": 0.19553205221891404,
|
|
"num_tokens": 39372839.0,
|
|
"step": 15540
|
|
},
|
|
{
|
|
"entropy": 6.2046037197113035,
|
|
"epoch": 1.79399884593191,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00046873623797498545,
|
|
"loss": 5.7399,
|
|
"mean_token_accuracy": 0.19506264925003053,
|
|
"num_tokens": 39385189.0,
|
|
"step": 15545
|
|
},
|
|
{
|
|
"entropy": 6.323671007156372,
|
|
"epoch": 1.7945758799769185,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.000468715250952599,
|
|
"loss": 5.8881,
|
|
"mean_token_accuracy": 0.18917421698570253,
|
|
"num_tokens": 39397871.0,
|
|
"step": 15550
|
|
},
|
|
{
|
|
"entropy": 6.302221441268921,
|
|
"epoch": 1.7951529140219273,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00046869425741469635,
|
|
"loss": 5.8359,
|
|
"mean_token_accuracy": 0.18804299235343933,
|
|
"num_tokens": 39411222.0,
|
|
"step": 15555
|
|
},
|
|
{
|
|
"entropy": 6.259333372116089,
|
|
"epoch": 1.795729948066936,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004686732573619835,
|
|
"loss": 5.8319,
|
|
"mean_token_accuracy": 0.19109850972890854,
|
|
"num_tokens": 39423614.0,
|
|
"step": 15560
|
|
},
|
|
{
|
|
"entropy": 6.249478197097778,
|
|
"epoch": 1.7963069821119446,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004686522507951669,
|
|
"loss": 5.7548,
|
|
"mean_token_accuracy": 0.19278013855218887,
|
|
"num_tokens": 39436299.0,
|
|
"step": 15565
|
|
},
|
|
{
|
|
"entropy": 6.260821914672851,
|
|
"epoch": 1.7968840161569533,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004686312377149531,
|
|
"loss": 5.8271,
|
|
"mean_token_accuracy": 0.18958440274000168,
|
|
"num_tokens": 39448994.0,
|
|
"step": 15570
|
|
},
|
|
{
|
|
"entropy": 6.273134469985962,
|
|
"epoch": 1.797461050201962,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00046861021812204874,
|
|
"loss": 5.8248,
|
|
"mean_token_accuracy": 0.18644514679908752,
|
|
"num_tokens": 39462387.0,
|
|
"step": 15575
|
|
},
|
|
{
|
|
"entropy": 6.307193422317505,
|
|
"epoch": 1.7980380842469705,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00046858919201716085,
|
|
"loss": 5.8047,
|
|
"mean_token_accuracy": 0.1928827852010727,
|
|
"num_tokens": 39475082.0,
|
|
"step": 15580
|
|
},
|
|
{
|
|
"entropy": 6.258175945281982,
|
|
"epoch": 1.7986151182919792,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004685681594009966,
|
|
"loss": 5.7914,
|
|
"mean_token_accuracy": 0.19656720608472825,
|
|
"num_tokens": 39487272.0,
|
|
"step": 15585
|
|
},
|
|
{
|
|
"entropy": 6.236111068725586,
|
|
"epoch": 1.799192152336988,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00046854712027426357,
|
|
"loss": 5.7724,
|
|
"mean_token_accuracy": 0.19646389186382293,
|
|
"num_tokens": 39502499.0,
|
|
"step": 15590
|
|
},
|
|
{
|
|
"entropy": 6.346733856201172,
|
|
"epoch": 1.7997691863819965,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00046852607463766923,
|
|
"loss": 5.8429,
|
|
"mean_token_accuracy": 0.1886493071913719,
|
|
"num_tokens": 39514652.0,
|
|
"step": 15595
|
|
},
|
|
{
|
|
"entropy": 6.34684190750122,
|
|
"epoch": 1.8003462204270053,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004685050224919215,
|
|
"loss": 5.8995,
|
|
"mean_token_accuracy": 0.1818003237247467,
|
|
"num_tokens": 39527859.0,
|
|
"step": 15600
|
|
},
|
|
{
|
|
"entropy": 6.262502241134643,
|
|
"epoch": 1.8009232544720137,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00046848396383772844,
|
|
"loss": 5.7547,
|
|
"mean_token_accuracy": 0.18986964374780654,
|
|
"num_tokens": 39541099.0,
|
|
"step": 15605
|
|
},
|
|
{
|
|
"entropy": 6.20468487739563,
|
|
"epoch": 1.8015002885170226,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004684628986757984,
|
|
"loss": 5.7604,
|
|
"mean_token_accuracy": 0.19289609640836716,
|
|
"num_tokens": 39553233.0,
|
|
"step": 15610
|
|
},
|
|
{
|
|
"entropy": 6.250316047668457,
|
|
"epoch": 1.802077322562031,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004684418270068398,
|
|
"loss": 5.7442,
|
|
"mean_token_accuracy": 0.19790587574243546,
|
|
"num_tokens": 39565379.0,
|
|
"step": 15615
|
|
},
|
|
{
|
|
"entropy": 6.201472282409668,
|
|
"epoch": 1.8026543566070399,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004684207488315615,
|
|
"loss": 5.7217,
|
|
"mean_token_accuracy": 0.2005346715450287,
|
|
"num_tokens": 39577509.0,
|
|
"step": 15620
|
|
},
|
|
{
|
|
"entropy": 6.294105386734008,
|
|
"epoch": 1.8032313906520485,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004683996641506724,
|
|
"loss": 5.8205,
|
|
"mean_token_accuracy": 0.19148968160152435,
|
|
"num_tokens": 39589960.0,
|
|
"step": 15625
|
|
},
|
|
{
|
|
"entropy": 6.219392347335815,
|
|
"epoch": 1.8038084246970572,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00046837857296488163,
|
|
"loss": 5.7143,
|
|
"mean_token_accuracy": 0.20224729776382447,
|
|
"num_tokens": 39602231.0,
|
|
"step": 15630
|
|
},
|
|
{
|
|
"entropy": 6.256589317321778,
|
|
"epoch": 1.8043854587420658,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00046835747527489857,
|
|
"loss": 5.8016,
|
|
"mean_token_accuracy": 0.20258677154779434,
|
|
"num_tokens": 39615756.0,
|
|
"step": 15635
|
|
},
|
|
{
|
|
"entropy": 6.315097427368164,
|
|
"epoch": 1.8049624927870744,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000468336371081433,
|
|
"loss": 5.8292,
|
|
"mean_token_accuracy": 0.18631367534399032,
|
|
"num_tokens": 39627810.0,
|
|
"step": 15640
|
|
},
|
|
{
|
|
"entropy": 6.2539315700531,
|
|
"epoch": 1.805539526832083,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00046831526038519444,
|
|
"loss": 5.7982,
|
|
"mean_token_accuracy": 0.19546411484479903,
|
|
"num_tokens": 39640930.0,
|
|
"step": 15645
|
|
},
|
|
{
|
|
"entropy": 6.206079769134521,
|
|
"epoch": 1.8061165608770917,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004682941431868933,
|
|
"loss": 5.7518,
|
|
"mean_token_accuracy": 0.19276881515979766,
|
|
"num_tokens": 39652146.0,
|
|
"step": 15650
|
|
},
|
|
{
|
|
"entropy": 6.151435089111328,
|
|
"epoch": 1.8066935949221004,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046827301948723963,
|
|
"loss": 5.6683,
|
|
"mean_token_accuracy": 0.20766518861055375,
|
|
"num_tokens": 39665156.0,
|
|
"step": 15655
|
|
},
|
|
{
|
|
"entropy": 6.266790294647217,
|
|
"epoch": 1.807270628967109,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046825188928694393,
|
|
"loss": 5.7792,
|
|
"mean_token_accuracy": 0.19093467444181442,
|
|
"num_tokens": 39677346.0,
|
|
"step": 15660
|
|
},
|
|
{
|
|
"entropy": 6.283413410186768,
|
|
"epoch": 1.8078476630121179,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004682307525867169,
|
|
"loss": 5.746,
|
|
"mean_token_accuracy": 0.2032680407166481,
|
|
"num_tokens": 39690613.0,
|
|
"step": 15665
|
|
},
|
|
{
|
|
"entropy": 6.268688201904297,
|
|
"epoch": 1.8084246970571263,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004682096093872695,
|
|
"loss": 5.7572,
|
|
"mean_token_accuracy": 0.1922956645488739,
|
|
"num_tokens": 39703111.0,
|
|
"step": 15670
|
|
},
|
|
{
|
|
"entropy": 6.247060823440552,
|
|
"epoch": 1.8090017311021351,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00046818845968931284,
|
|
"loss": 5.7806,
|
|
"mean_token_accuracy": 0.19447221159934996,
|
|
"num_tokens": 39715441.0,
|
|
"step": 15675
|
|
},
|
|
{
|
|
"entropy": 6.275709629058838,
|
|
"epoch": 1.8095787651471436,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00046816730349355843,
|
|
"loss": 5.7405,
|
|
"mean_token_accuracy": 0.19862063527107238,
|
|
"num_tokens": 39728437.0,
|
|
"step": 15680
|
|
},
|
|
{
|
|
"entropy": 6.24822850227356,
|
|
"epoch": 1.8101557991921524,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00046814614080071756,
|
|
"loss": 5.7679,
|
|
"mean_token_accuracy": 0.1967908799648285,
|
|
"num_tokens": 39740324.0,
|
|
"step": 15685
|
|
},
|
|
{
|
|
"entropy": 6.227537345886231,
|
|
"epoch": 1.8107328332371608,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00046812497161150224,
|
|
"loss": 5.7457,
|
|
"mean_token_accuracy": 0.1954813316464424,
|
|
"num_tokens": 39752158.0,
|
|
"step": 15690
|
|
},
|
|
{
|
|
"entropy": 6.251756763458252,
|
|
"epoch": 1.8113098672821697,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00046810379592662445,
|
|
"loss": 5.8004,
|
|
"mean_token_accuracy": 0.1957491382956505,
|
|
"num_tokens": 39766296.0,
|
|
"step": 15695
|
|
},
|
|
{
|
|
"entropy": 6.246879053115845,
|
|
"epoch": 1.8118869013271783,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.00046808261374679637,
|
|
"loss": 5.8144,
|
|
"mean_token_accuracy": 0.1933879092335701,
|
|
"num_tokens": 39779690.0,
|
|
"step": 15700
|
|
},
|
|
{
|
|
"entropy": 6.275369453430176,
|
|
"epoch": 1.812463935372187,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004680614250727305,
|
|
"loss": 5.7709,
|
|
"mean_token_accuracy": 0.19698434323072433,
|
|
"num_tokens": 39790617.0,
|
|
"step": 15705
|
|
},
|
|
{
|
|
"entropy": 6.237313270568848,
|
|
"epoch": 1.8130409694171956,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004680402299051395,
|
|
"loss": 5.7519,
|
|
"mean_token_accuracy": 0.19757142066955566,
|
|
"num_tokens": 39802994.0,
|
|
"step": 15710
|
|
},
|
|
{
|
|
"entropy": 6.248507452011109,
|
|
"epoch": 1.8136180034622043,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004680190282447363,
|
|
"loss": 5.7598,
|
|
"mean_token_accuracy": 0.1952964574098587,
|
|
"num_tokens": 39815618.0,
|
|
"step": 15715
|
|
},
|
|
{
|
|
"entropy": 6.251852369308471,
|
|
"epoch": 1.814195037507213,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004679978200922339,
|
|
"loss": 5.7412,
|
|
"mean_token_accuracy": 0.20035985261201858,
|
|
"num_tokens": 39827283.0,
|
|
"step": 15720
|
|
},
|
|
{
|
|
"entropy": 6.2605846405029295,
|
|
"epoch": 1.8147720715522215,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004679766054483457,
|
|
"loss": 5.725,
|
|
"mean_token_accuracy": 0.20251115262508393,
|
|
"num_tokens": 39840116.0,
|
|
"step": 15725
|
|
},
|
|
{
|
|
"entropy": 6.193558406829834,
|
|
"epoch": 1.8153491055972304,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004679553843137852,
|
|
"loss": 5.7173,
|
|
"mean_token_accuracy": 0.20594813525676728,
|
|
"num_tokens": 39851770.0,
|
|
"step": 15730
|
|
},
|
|
{
|
|
"entropy": 6.180267715454102,
|
|
"epoch": 1.8159261396422388,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00046793415668926625,
|
|
"loss": 5.6866,
|
|
"mean_token_accuracy": 0.19606250077486037,
|
|
"num_tokens": 39863803.0,
|
|
"step": 15735
|
|
},
|
|
{
|
|
"entropy": 6.238861560821533,
|
|
"epoch": 1.8165031736872477,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004679129225755028,
|
|
"loss": 5.7202,
|
|
"mean_token_accuracy": 0.20054381489753723,
|
|
"num_tokens": 39875713.0,
|
|
"step": 15740
|
|
},
|
|
{
|
|
"entropy": 6.170565223693847,
|
|
"epoch": 1.817080207732256,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.000467891681973209,
|
|
"loss": 5.6841,
|
|
"mean_token_accuracy": 0.20006590634584426,
|
|
"num_tokens": 39888670.0,
|
|
"step": 15745
|
|
},
|
|
{
|
|
"entropy": 6.164975118637085,
|
|
"epoch": 1.817657241777265,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00046787043488309926,
|
|
"loss": 5.7258,
|
|
"mean_token_accuracy": 0.20983980894088744,
|
|
"num_tokens": 39900845.0,
|
|
"step": 15750
|
|
},
|
|
{
|
|
"entropy": 6.346622896194458,
|
|
"epoch": 1.8182342758222734,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004678491813058882,
|
|
"loss": 5.8179,
|
|
"mean_token_accuracy": 0.18947956562042237,
|
|
"num_tokens": 39912268.0,
|
|
"step": 15755
|
|
},
|
|
{
|
|
"entropy": 6.255692625045777,
|
|
"epoch": 1.8188113098672822,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004678279212422908,
|
|
"loss": 5.7643,
|
|
"mean_token_accuracy": 0.19456629902124406,
|
|
"num_tokens": 39924213.0,
|
|
"step": 15760
|
|
},
|
|
{
|
|
"entropy": 6.241471672058106,
|
|
"epoch": 1.8193883439122909,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004678066546930221,
|
|
"loss": 5.7905,
|
|
"mean_token_accuracy": 0.19173450469970704,
|
|
"num_tokens": 39937069.0,
|
|
"step": 15765
|
|
},
|
|
{
|
|
"entropy": 6.219423055648804,
|
|
"epoch": 1.8199653779572995,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00046778538165879725,
|
|
"loss": 5.7404,
|
|
"mean_token_accuracy": 0.19059522300958634,
|
|
"num_tokens": 39948988.0,
|
|
"step": 15770
|
|
},
|
|
{
|
|
"entropy": 6.256737899780274,
|
|
"epoch": 1.8205424120023082,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00046776410214033185,
|
|
"loss": 5.8356,
|
|
"mean_token_accuracy": 0.19304797798395157,
|
|
"num_tokens": 39962177.0,
|
|
"step": 15775
|
|
},
|
|
{
|
|
"entropy": 6.300885152816773,
|
|
"epoch": 1.8211194460473168,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004677428161383417,
|
|
"loss": 5.7657,
|
|
"mean_token_accuracy": 0.19903772473335266,
|
|
"num_tokens": 39975329.0,
|
|
"step": 15780
|
|
},
|
|
{
|
|
"entropy": 6.271979188919067,
|
|
"epoch": 1.8216964800923254,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004677215236535426,
|
|
"loss": 5.7524,
|
|
"mean_token_accuracy": 0.19273924678564072,
|
|
"num_tokens": 39987923.0,
|
|
"step": 15785
|
|
},
|
|
{
|
|
"entropy": 6.2564263343811035,
|
|
"epoch": 1.822273514137334,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004677002246866508,
|
|
"loss": 5.8236,
|
|
"mean_token_accuracy": 0.19519684463739395,
|
|
"num_tokens": 40001596.0,
|
|
"step": 15790
|
|
},
|
|
{
|
|
"entropy": 6.253862953186035,
|
|
"epoch": 1.8228505481823427,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00046767891923838264,
|
|
"loss": 5.7486,
|
|
"mean_token_accuracy": 0.19953580796718598,
|
|
"num_tokens": 40014207.0,
|
|
"step": 15795
|
|
},
|
|
{
|
|
"entropy": 6.338621330261231,
|
|
"epoch": 1.8234275822273514,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004676576073094548,
|
|
"loss": 5.7948,
|
|
"mean_token_accuracy": 0.19075928777456283,
|
|
"num_tokens": 40027931.0,
|
|
"step": 15800
|
|
},
|
|
{
|
|
"entropy": 6.266003274917603,
|
|
"epoch": 1.8240046162723602,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00046763628890058396,
|
|
"loss": 5.8163,
|
|
"mean_token_accuracy": 0.19684889763593674,
|
|
"num_tokens": 40040463.0,
|
|
"step": 15805
|
|
},
|
|
{
|
|
"entropy": 6.170436954498291,
|
|
"epoch": 1.8245816503173686,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.00046761496401248734,
|
|
"loss": 5.7001,
|
|
"mean_token_accuracy": 0.20084349513053895,
|
|
"num_tokens": 40053085.0,
|
|
"step": 15810
|
|
},
|
|
{
|
|
"entropy": 6.3198305606842045,
|
|
"epoch": 1.8251586843623775,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.000467593632645882,
|
|
"loss": 5.8855,
|
|
"mean_token_accuracy": 0.19249660074710845,
|
|
"num_tokens": 40065771.0,
|
|
"step": 15815
|
|
},
|
|
{
|
|
"entropy": 6.291195583343506,
|
|
"epoch": 1.825735718407386,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004675722948014855,
|
|
"loss": 5.7948,
|
|
"mean_token_accuracy": 0.19111389964818953,
|
|
"num_tokens": 40078939.0,
|
|
"step": 15820
|
|
},
|
|
{
|
|
"entropy": 6.223949861526489,
|
|
"epoch": 1.8263127524523948,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046755095048001556,
|
|
"loss": 5.6987,
|
|
"mean_token_accuracy": 0.20104024261236192,
|
|
"num_tokens": 40091565.0,
|
|
"step": 15825
|
|
},
|
|
{
|
|
"entropy": 6.170585823059082,
|
|
"epoch": 1.8268897864974032,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004675295996821899,
|
|
"loss": 5.7365,
|
|
"mean_token_accuracy": 0.19630666822195053,
|
|
"num_tokens": 40103619.0,
|
|
"step": 15830
|
|
},
|
|
{
|
|
"entropy": 6.311802721023559,
|
|
"epoch": 1.827466820542412,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.000467508242408727,
|
|
"loss": 5.8102,
|
|
"mean_token_accuracy": 0.18986732810735701,
|
|
"num_tokens": 40116370.0,
|
|
"step": 15835
|
|
},
|
|
{
|
|
"entropy": 6.246032047271728,
|
|
"epoch": 1.8280438545874207,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004674868786603448,
|
|
"loss": 5.6837,
|
|
"mean_token_accuracy": 0.19883956760168076,
|
|
"num_tokens": 40129015.0,
|
|
"step": 15840
|
|
},
|
|
{
|
|
"entropy": 6.241017913818359,
|
|
"epoch": 1.8286208886324293,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004674655084377622,
|
|
"loss": 5.717,
|
|
"mean_token_accuracy": 0.19837751537561416,
|
|
"num_tokens": 40141437.0,
|
|
"step": 15845
|
|
},
|
|
{
|
|
"entropy": 6.206828451156616,
|
|
"epoch": 1.829197922677438,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004674441317416978,
|
|
"loss": 5.7643,
|
|
"mean_token_accuracy": 0.19043355137109758,
|
|
"num_tokens": 40154516.0,
|
|
"step": 15850
|
|
},
|
|
{
|
|
"entropy": 6.179724311828613,
|
|
"epoch": 1.8297749567224466,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00046742274857287057,
|
|
"loss": 5.6333,
|
|
"mean_token_accuracy": 0.20223019868135453,
|
|
"num_tokens": 40166598.0,
|
|
"step": 15855
|
|
},
|
|
{
|
|
"entropy": 6.229026031494141,
|
|
"epoch": 1.8303519907674553,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004674013589319998,
|
|
"loss": 5.7543,
|
|
"mean_token_accuracy": 0.19870882034301757,
|
|
"num_tokens": 40178905.0,
|
|
"step": 15860
|
|
},
|
|
{
|
|
"entropy": 6.321389770507812,
|
|
"epoch": 1.830929024812464,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004673799628198049,
|
|
"loss": 5.8371,
|
|
"mean_token_accuracy": 0.19208986014127732,
|
|
"num_tokens": 40191678.0,
|
|
"step": 15865
|
|
},
|
|
{
|
|
"entropy": 6.245724630355835,
|
|
"epoch": 1.8315060588574728,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00046735856023700546,
|
|
"loss": 5.7539,
|
|
"mean_token_accuracy": 0.19165848046541215,
|
|
"num_tokens": 40204680.0,
|
|
"step": 15870
|
|
},
|
|
{
|
|
"entropy": 6.180008220672607,
|
|
"epoch": 1.8320830929024812,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004673371511843215,
|
|
"loss": 5.8064,
|
|
"mean_token_accuracy": 0.20063277781009675,
|
|
"num_tokens": 40217026.0,
|
|
"step": 15875
|
|
},
|
|
{
|
|
"entropy": 6.242175817489624,
|
|
"epoch": 1.83266012694749,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004673157356624729,
|
|
"loss": 5.7377,
|
|
"mean_token_accuracy": 0.19302880316972731,
|
|
"num_tokens": 40228950.0,
|
|
"step": 15880
|
|
},
|
|
{
|
|
"entropy": 6.2919378757476805,
|
|
"epoch": 1.8332371609924984,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004672943136721801,
|
|
"loss": 5.8163,
|
|
"mean_token_accuracy": 0.1909077376127243,
|
|
"num_tokens": 40241294.0,
|
|
"step": 15885
|
|
},
|
|
{
|
|
"entropy": 6.323341321945191,
|
|
"epoch": 1.8338141950375073,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004672728852141636,
|
|
"loss": 5.8536,
|
|
"mean_token_accuracy": 0.18982188850641252,
|
|
"num_tokens": 40253331.0,
|
|
"step": 15890
|
|
},
|
|
{
|
|
"entropy": 6.28448715209961,
|
|
"epoch": 1.8343912290825157,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046725145028914404,
|
|
"loss": 5.8079,
|
|
"mean_token_accuracy": 0.19301552474498748,
|
|
"num_tokens": 40266059.0,
|
|
"step": 15895
|
|
},
|
|
{
|
|
"entropy": 6.252271842956543,
|
|
"epoch": 1.8349682631275246,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004672300088978425,
|
|
"loss": 5.7363,
|
|
"mean_token_accuracy": 0.2031920611858368,
|
|
"num_tokens": 40278732.0,
|
|
"step": 15900
|
|
},
|
|
{
|
|
"entropy": 6.182538175582886,
|
|
"epoch": 1.8355452971725332,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004672085610409801,
|
|
"loss": 5.6966,
|
|
"mean_token_accuracy": 0.20496753305196763,
|
|
"num_tokens": 40290428.0,
|
|
"step": 15905
|
|
},
|
|
{
|
|
"entropy": 6.202089929580689,
|
|
"epoch": 1.8361223312175419,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046718710671927815,
|
|
"loss": 5.7778,
|
|
"mean_token_accuracy": 0.19897102266550065,
|
|
"num_tokens": 40302153.0,
|
|
"step": 15910
|
|
},
|
|
{
|
|
"entropy": 6.2814734935760494,
|
|
"epoch": 1.8366993652625505,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00046716564593345843,
|
|
"loss": 5.743,
|
|
"mean_token_accuracy": 0.1985234797000885,
|
|
"num_tokens": 40315493.0,
|
|
"step": 15915
|
|
},
|
|
{
|
|
"entropy": 6.283923673629761,
|
|
"epoch": 1.8372763993075591,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00046714417868424265,
|
|
"loss": 5.7986,
|
|
"mean_token_accuracy": 0.1846300795674324,
|
|
"num_tokens": 40328157.0,
|
|
"step": 15920
|
|
},
|
|
{
|
|
"entropy": 6.262593412399292,
|
|
"epoch": 1.8378534333525678,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00046712270497235284,
|
|
"loss": 5.8082,
|
|
"mean_token_accuracy": 0.1937829002737999,
|
|
"num_tokens": 40341684.0,
|
|
"step": 15925
|
|
},
|
|
{
|
|
"entropy": 6.3377039432525635,
|
|
"epoch": 1.8384304673975764,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004671012247985112,
|
|
"loss": 5.8578,
|
|
"mean_token_accuracy": 0.18830958604812623,
|
|
"num_tokens": 40354002.0,
|
|
"step": 15930
|
|
},
|
|
{
|
|
"entropy": 6.204885721206665,
|
|
"epoch": 1.839007501442585,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00046707973816344044,
|
|
"loss": 5.7634,
|
|
"mean_token_accuracy": 0.20010476559400558,
|
|
"num_tokens": 40366211.0,
|
|
"step": 15935
|
|
},
|
|
{
|
|
"entropy": 6.284234189987183,
|
|
"epoch": 1.8395845354875937,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00046705824506786304,
|
|
"loss": 5.8542,
|
|
"mean_token_accuracy": 0.19239040166139604,
|
|
"num_tokens": 40377957.0,
|
|
"step": 15940
|
|
},
|
|
{
|
|
"entropy": 6.301759529113769,
|
|
"epoch": 1.8401615695326026,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00046703674551250193,
|
|
"loss": 5.802,
|
|
"mean_token_accuracy": 0.19346368908882142,
|
|
"num_tokens": 40391018.0,
|
|
"step": 15945
|
|
},
|
|
{
|
|
"entropy": 6.218786287307739,
|
|
"epoch": 1.840738603577611,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004670152394980803,
|
|
"loss": 5.7965,
|
|
"mean_token_accuracy": 0.19256123006343842,
|
|
"num_tokens": 40405134.0,
|
|
"step": 15950
|
|
},
|
|
{
|
|
"entropy": 6.305995988845825,
|
|
"epoch": 1.8413156376226198,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004669937270253214,
|
|
"loss": 5.8067,
|
|
"mean_token_accuracy": 0.19366917610168458,
|
|
"num_tokens": 40418131.0,
|
|
"step": 15955
|
|
},
|
|
{
|
|
"entropy": 6.268421268463134,
|
|
"epoch": 1.8418926716676283,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.000466972208094949,
|
|
"loss": 5.7485,
|
|
"mean_token_accuracy": 0.1956111580133438,
|
|
"num_tokens": 40430614.0,
|
|
"step": 15960
|
|
},
|
|
{
|
|
"entropy": 6.332875061035156,
|
|
"epoch": 1.8424697057126371,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00046695068270768665,
|
|
"loss": 5.7761,
|
|
"mean_token_accuracy": 0.19068144708871843,
|
|
"num_tokens": 40443200.0,
|
|
"step": 15965
|
|
},
|
|
{
|
|
"entropy": 6.184208965301513,
|
|
"epoch": 1.8430467397576455,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00046692915086425846,
|
|
"loss": 5.735,
|
|
"mean_token_accuracy": 0.19420334547758103,
|
|
"num_tokens": 40455662.0,
|
|
"step": 15970
|
|
},
|
|
{
|
|
"entropy": 6.239500045776367,
|
|
"epoch": 1.8436237738026544,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00046690761256538857,
|
|
"loss": 5.7007,
|
|
"mean_token_accuracy": 0.20253938138484956,
|
|
"num_tokens": 40468247.0,
|
|
"step": 15975
|
|
},
|
|
{
|
|
"entropy": 6.316354751586914,
|
|
"epoch": 1.844200807847663,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004668860678118015,
|
|
"loss": 5.8784,
|
|
"mean_token_accuracy": 0.1913073852658272,
|
|
"num_tokens": 40480607.0,
|
|
"step": 15980
|
|
},
|
|
{
|
|
"entropy": 6.30676498413086,
|
|
"epoch": 1.8447778418926717,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00046686451660422185,
|
|
"loss": 5.7809,
|
|
"mean_token_accuracy": 0.1933899149298668,
|
|
"num_tokens": 40492140.0,
|
|
"step": 15985
|
|
},
|
|
{
|
|
"entropy": 6.29900894165039,
|
|
"epoch": 1.8453548759376803,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00046684295894337455,
|
|
"loss": 5.8328,
|
|
"mean_token_accuracy": 0.19052439033985138,
|
|
"num_tokens": 40504513.0,
|
|
"step": 15990
|
|
},
|
|
{
|
|
"entropy": 6.217627811431885,
|
|
"epoch": 1.845931909982689,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004668213948299845,
|
|
"loss": 5.7376,
|
|
"mean_token_accuracy": 0.1955086499452591,
|
|
"num_tokens": 40517258.0,
|
|
"step": 15995
|
|
},
|
|
{
|
|
"entropy": 6.232381010055542,
|
|
"epoch": 1.8465089440276976,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004667998242647772,
|
|
"loss": 5.7692,
|
|
"mean_token_accuracy": 0.1925689846277237,
|
|
"num_tokens": 40529092.0,
|
|
"step": 16000
|
|
},
|
|
{
|
|
"entropy": 6.237630987167359,
|
|
"epoch": 1.8470859780727062,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.000466778247248478,
|
|
"loss": 5.7287,
|
|
"mean_token_accuracy": 0.1985825851559639,
|
|
"num_tokens": 40543586.0,
|
|
"step": 16005
|
|
},
|
|
{
|
|
"entropy": 6.311019611358643,
|
|
"epoch": 1.847663012117715,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00046675666378181275,
|
|
"loss": 5.794,
|
|
"mean_token_accuracy": 0.19712699204683304,
|
|
"num_tokens": 40555721.0,
|
|
"step": 16010
|
|
},
|
|
{
|
|
"entropy": 6.333885526657104,
|
|
"epoch": 1.8482400461627235,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004667350738655074,
|
|
"loss": 5.871,
|
|
"mean_token_accuracy": 0.18650257140398024,
|
|
"num_tokens": 40567547.0,
|
|
"step": 16015
|
|
},
|
|
{
|
|
"entropy": 6.246447324752808,
|
|
"epoch": 1.8488170802077324,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00046671347750028806,
|
|
"loss": 5.712,
|
|
"mean_token_accuracy": 0.1954139679670334,
|
|
"num_tokens": 40579498.0,
|
|
"step": 16020
|
|
},
|
|
{
|
|
"entropy": 6.294281148910523,
|
|
"epoch": 1.8493941142527408,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004666918746868811,
|
|
"loss": 5.8376,
|
|
"mean_token_accuracy": 0.18255259990692138,
|
|
"num_tokens": 40593853.0,
|
|
"step": 16025
|
|
},
|
|
{
|
|
"entropy": 6.21675066947937,
|
|
"epoch": 1.8499711482977497,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004666702654260133,
|
|
"loss": 5.7154,
|
|
"mean_token_accuracy": 0.1969263732433319,
|
|
"num_tokens": 40605737.0,
|
|
"step": 16030
|
|
},
|
|
{
|
|
"entropy": 6.190192651748657,
|
|
"epoch": 1.850548182342758,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00046664864971841113,
|
|
"loss": 5.697,
|
|
"mean_token_accuracy": 0.2019049718976021,
|
|
"num_tokens": 40617839.0,
|
|
"step": 16035
|
|
},
|
|
{
|
|
"entropy": 6.243142032623291,
|
|
"epoch": 1.851125216387767,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00046662702756480195,
|
|
"loss": 5.769,
|
|
"mean_token_accuracy": 0.196391262114048,
|
|
"num_tokens": 40630247.0,
|
|
"step": 16040
|
|
},
|
|
{
|
|
"entropy": 6.155957269668579,
|
|
"epoch": 1.8517022504327756,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00046660539896591286,
|
|
"loss": 5.6666,
|
|
"mean_token_accuracy": 0.2063628390431404,
|
|
"num_tokens": 40643869.0,
|
|
"step": 16045
|
|
},
|
|
{
|
|
"entropy": 6.268722629547119,
|
|
"epoch": 1.8522792844777842,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004665837639224713,
|
|
"loss": 5.7752,
|
|
"mean_token_accuracy": 0.19113756120204925,
|
|
"num_tokens": 40655389.0,
|
|
"step": 16050
|
|
},
|
|
{
|
|
"entropy": 6.285340595245361,
|
|
"epoch": 1.8528563185227929,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00046656212243520505,
|
|
"loss": 5.7934,
|
|
"mean_token_accuracy": 0.18825832307338713,
|
|
"num_tokens": 40667663.0,
|
|
"step": 16055
|
|
},
|
|
{
|
|
"entropy": 6.273303270339966,
|
|
"epoch": 1.8534333525678015,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00046654047450484193,
|
|
"loss": 5.7277,
|
|
"mean_token_accuracy": 0.19776127189397813,
|
|
"num_tokens": 40680623.0,
|
|
"step": 16060
|
|
},
|
|
{
|
|
"entropy": 6.216945171356201,
|
|
"epoch": 1.8540103866128101,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004665188201321102,
|
|
"loss": 5.7082,
|
|
"mean_token_accuracy": 0.19727377593517303,
|
|
"num_tokens": 40692679.0,
|
|
"step": 16065
|
|
},
|
|
{
|
|
"entropy": 6.272071456909179,
|
|
"epoch": 1.8545874206578188,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00046649715931773795,
|
|
"loss": 5.8786,
|
|
"mean_token_accuracy": 0.19242863059043885,
|
|
"num_tokens": 40705187.0,
|
|
"step": 16070
|
|
},
|
|
{
|
|
"entropy": 6.28022871017456,
|
|
"epoch": 1.8551644547028274,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.000466475492062454,
|
|
"loss": 5.8193,
|
|
"mean_token_accuracy": 0.19652820974588395,
|
|
"num_tokens": 40717854.0,
|
|
"step": 16075
|
|
},
|
|
{
|
|
"entropy": 6.257518720626831,
|
|
"epoch": 1.855741488747836,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00046645381836698684,
|
|
"loss": 5.8047,
|
|
"mean_token_accuracy": 0.19478076994419097,
|
|
"num_tokens": 40731039.0,
|
|
"step": 16080
|
|
},
|
|
{
|
|
"entropy": 6.252432584762573,
|
|
"epoch": 1.856318522792845,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004664321382320657,
|
|
"loss": 5.742,
|
|
"mean_token_accuracy": 0.19954000115394593,
|
|
"num_tokens": 40745065.0,
|
|
"step": 16085
|
|
},
|
|
{
|
|
"entropy": 6.2835486888885494,
|
|
"epoch": 1.8568955568378533,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00046641045165841965,
|
|
"loss": 5.8538,
|
|
"mean_token_accuracy": 0.18943217396736145,
|
|
"num_tokens": 40758107.0,
|
|
"step": 16090
|
|
},
|
|
{
|
|
"entropy": 6.31345567703247,
|
|
"epoch": 1.8574725908828622,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00046638875864677814,
|
|
"loss": 5.8626,
|
|
"mean_token_accuracy": 0.18975879997015,
|
|
"num_tokens": 40771082.0,
|
|
"step": 16095
|
|
},
|
|
{
|
|
"entropy": 6.294506025314331,
|
|
"epoch": 1.8580496249278706,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004663670591978708,
|
|
"loss": 5.7806,
|
|
"mean_token_accuracy": 0.18993891030550003,
|
|
"num_tokens": 40784165.0,
|
|
"step": 16100
|
|
},
|
|
{
|
|
"entropy": 6.175074863433838,
|
|
"epoch": 1.8586266589728795,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004663453533124275,
|
|
"loss": 5.6254,
|
|
"mean_token_accuracy": 0.21204764991998673,
|
|
"num_tokens": 40796279.0,
|
|
"step": 16105
|
|
},
|
|
{
|
|
"entropy": 6.217782354354858,
|
|
"epoch": 1.859203693017888,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004663236409911783,
|
|
"loss": 5.7205,
|
|
"mean_token_accuracy": 0.19833692610263826,
|
|
"num_tokens": 40809074.0,
|
|
"step": 16110
|
|
},
|
|
{
|
|
"entropy": 6.194740915298462,
|
|
"epoch": 1.8597807270628968,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00046630192223485345,
|
|
"loss": 5.6586,
|
|
"mean_token_accuracy": 0.20452403873205185,
|
|
"num_tokens": 40821086.0,
|
|
"step": 16115
|
|
},
|
|
{
|
|
"entropy": 6.311218357086181,
|
|
"epoch": 1.8603577611079054,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00046628019704418345,
|
|
"loss": 5.7747,
|
|
"mean_token_accuracy": 0.19277962148189545,
|
|
"num_tokens": 40832697.0,
|
|
"step": 16120
|
|
},
|
|
{
|
|
"entropy": 6.1826904773712155,
|
|
"epoch": 1.860934795152914,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.000466258465419899,
|
|
"loss": 5.7908,
|
|
"mean_token_accuracy": 0.19389365762472152,
|
|
"num_tokens": 40845268.0,
|
|
"step": 16125
|
|
},
|
|
{
|
|
"entropy": 6.3233559131622314,
|
|
"epoch": 1.8615118291979227,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004662367273627312,
|
|
"loss": 5.8121,
|
|
"mean_token_accuracy": 0.1891919642686844,
|
|
"num_tokens": 40858314.0,
|
|
"step": 16130
|
|
},
|
|
{
|
|
"entropy": 6.302750968933106,
|
|
"epoch": 1.8620888632429313,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.000466214982873411,
|
|
"loss": 5.7606,
|
|
"mean_token_accuracy": 0.19642114788293838,
|
|
"num_tokens": 40869982.0,
|
|
"step": 16135
|
|
},
|
|
{
|
|
"entropy": 6.234612894058228,
|
|
"epoch": 1.86266589728794,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00046619323195266975,
|
|
"loss": 5.7159,
|
|
"mean_token_accuracy": 0.20078064352273942,
|
|
"num_tokens": 40881831.0,
|
|
"step": 16140
|
|
},
|
|
{
|
|
"entropy": 6.17855396270752,
|
|
"epoch": 1.8632429313329486,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004661714746012392,
|
|
"loss": 5.7297,
|
|
"mean_token_accuracy": 0.19786572009325026,
|
|
"num_tokens": 40894279.0,
|
|
"step": 16145
|
|
},
|
|
{
|
|
"entropy": 6.281162405014038,
|
|
"epoch": 1.8638199653779572,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.000466149710819851,
|
|
"loss": 5.7957,
|
|
"mean_token_accuracy": 0.1955430254340172,
|
|
"num_tokens": 40906960.0,
|
|
"step": 16150
|
|
},
|
|
{
|
|
"entropy": 6.305213737487793,
|
|
"epoch": 1.8643969994229659,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004661279406092373,
|
|
"loss": 5.8203,
|
|
"mean_token_accuracy": 0.18938140720129013,
|
|
"num_tokens": 40920688.0,
|
|
"step": 16155
|
|
},
|
|
{
|
|
"entropy": 6.323654222488403,
|
|
"epoch": 1.8649740334679747,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00046610616397013027,
|
|
"loss": 5.826,
|
|
"mean_token_accuracy": 0.19093446284532548,
|
|
"num_tokens": 40933017.0,
|
|
"step": 16160
|
|
},
|
|
{
|
|
"entropy": 6.247139501571655,
|
|
"epoch": 1.8655510675129832,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004660843809032623,
|
|
"loss": 5.6878,
|
|
"mean_token_accuracy": 0.20525743216276168,
|
|
"num_tokens": 40947179.0,
|
|
"step": 16165
|
|
},
|
|
{
|
|
"entropy": 6.2831775665283205,
|
|
"epoch": 1.866128101557992,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004660625914093661,
|
|
"loss": 5.8344,
|
|
"mean_token_accuracy": 0.18841950744390487,
|
|
"num_tokens": 40958806.0,
|
|
"step": 16170
|
|
},
|
|
{
|
|
"entropy": 6.3006516456604,
|
|
"epoch": 1.8667051356030004,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004660407954891745,
|
|
"loss": 5.7546,
|
|
"mean_token_accuracy": 0.19830986261367797,
|
|
"num_tokens": 40970667.0,
|
|
"step": 16175
|
|
},
|
|
{
|
|
"entropy": 6.27160415649414,
|
|
"epoch": 1.8672821696480093,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004660189931434207,
|
|
"loss": 5.7809,
|
|
"mean_token_accuracy": 0.1949162170290947,
|
|
"num_tokens": 40982663.0,
|
|
"step": 16180
|
|
},
|
|
{
|
|
"entropy": 6.185522985458374,
|
|
"epoch": 1.8678592036930177,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004659971843728379,
|
|
"loss": 5.7236,
|
|
"mean_token_accuracy": 0.20043258517980575,
|
|
"num_tokens": 40995168.0,
|
|
"step": 16185
|
|
},
|
|
{
|
|
"entropy": 6.284909343719482,
|
|
"epoch": 1.8684362377380266,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004659753691781597,
|
|
"loss": 5.8185,
|
|
"mean_token_accuracy": 0.1912219762802124,
|
|
"num_tokens": 41007159.0,
|
|
"step": 16190
|
|
},
|
|
{
|
|
"entropy": 6.213361740112305,
|
|
"epoch": 1.8690132717830352,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004659535475601198,
|
|
"loss": 5.683,
|
|
"mean_token_accuracy": 0.19469626247882843,
|
|
"num_tokens": 41019860.0,
|
|
"step": 16195
|
|
},
|
|
{
|
|
"entropy": 6.234416866302491,
|
|
"epoch": 1.8695903058280439,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00046593171951945226,
|
|
"loss": 5.76,
|
|
"mean_token_accuracy": 0.19812550395727158,
|
|
"num_tokens": 41031635.0,
|
|
"step": 16200
|
|
},
|
|
{
|
|
"entropy": 6.286600160598755,
|
|
"epoch": 1.8701673398730525,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00046590988505689114,
|
|
"loss": 5.8125,
|
|
"mean_token_accuracy": 0.19126126021146775,
|
|
"num_tokens": 41044678.0,
|
|
"step": 16205
|
|
},
|
|
{
|
|
"entropy": 6.305450344085694,
|
|
"epoch": 1.8707443739180611,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00046588804417317084,
|
|
"loss": 5.857,
|
|
"mean_token_accuracy": 0.19345226287841796,
|
|
"num_tokens": 41056799.0,
|
|
"step": 16210
|
|
},
|
|
{
|
|
"entropy": 6.275042295455933,
|
|
"epoch": 1.8713214079630698,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00046586619686902597,
|
|
"loss": 5.814,
|
|
"mean_token_accuracy": 0.1963962972164154,
|
|
"num_tokens": 41069700.0,
|
|
"step": 16215
|
|
},
|
|
{
|
|
"entropy": 6.318129396438598,
|
|
"epoch": 1.8718984420080784,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00046584434314519144,
|
|
"loss": 5.7263,
|
|
"mean_token_accuracy": 0.19932073950767518,
|
|
"num_tokens": 41081427.0,
|
|
"step": 16220
|
|
},
|
|
{
|
|
"entropy": 6.261219692230225,
|
|
"epoch": 1.8724754760530873,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004658224830024022,
|
|
"loss": 5.7052,
|
|
"mean_token_accuracy": 0.2031535804271698,
|
|
"num_tokens": 41094770.0,
|
|
"step": 16225
|
|
},
|
|
{
|
|
"entropy": 6.250154447555542,
|
|
"epoch": 1.8730525100980957,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004658006164413935,
|
|
"loss": 5.7422,
|
|
"mean_token_accuracy": 0.19554442614316941,
|
|
"num_tokens": 41106802.0,
|
|
"step": 16230
|
|
},
|
|
{
|
|
"entropy": 6.230137729644776,
|
|
"epoch": 1.8736295441431046,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004657787434629009,
|
|
"loss": 5.8139,
|
|
"mean_token_accuracy": 0.20067144930362701,
|
|
"num_tokens": 41120125.0,
|
|
"step": 16235
|
|
},
|
|
{
|
|
"entropy": 6.221140146255493,
|
|
"epoch": 1.874206578188113,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.00046575686406765993,
|
|
"loss": 5.7643,
|
|
"mean_token_accuracy": 0.20250476002693177,
|
|
"num_tokens": 41134267.0,
|
|
"step": 16240
|
|
},
|
|
{
|
|
"entropy": 6.312375211715699,
|
|
"epoch": 1.8747836122331218,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00046573497825640664,
|
|
"loss": 5.7214,
|
|
"mean_token_accuracy": 0.19941470474004747,
|
|
"num_tokens": 41147266.0,
|
|
"step": 16245
|
|
},
|
|
{
|
|
"entropy": 6.245394372940064,
|
|
"epoch": 1.8753606462781303,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004657130860298771,
|
|
"loss": 5.7564,
|
|
"mean_token_accuracy": 0.19797106981277465,
|
|
"num_tokens": 41159666.0,
|
|
"step": 16250
|
|
},
|
|
{
|
|
"entropy": 6.305567932128906,
|
|
"epoch": 1.8759376803231391,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004656911873888077,
|
|
"loss": 5.8111,
|
|
"mean_token_accuracy": 0.194146266579628,
|
|
"num_tokens": 41171947.0,
|
|
"step": 16255
|
|
},
|
|
{
|
|
"entropy": 6.2310679912567135,
|
|
"epoch": 1.8765147143681478,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004656692823339349,
|
|
"loss": 5.7744,
|
|
"mean_token_accuracy": 0.20527701675891877,
|
|
"num_tokens": 41186376.0,
|
|
"step": 16260
|
|
},
|
|
{
|
|
"entropy": 6.251262378692627,
|
|
"epoch": 1.8770917484131564,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004656473708659955,
|
|
"loss": 5.8127,
|
|
"mean_token_accuracy": 0.19876704216003419,
|
|
"num_tokens": 41199730.0,
|
|
"step": 16265
|
|
},
|
|
{
|
|
"entropy": 6.275247240066529,
|
|
"epoch": 1.877668782458165,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00046562545298572646,
|
|
"loss": 5.7252,
|
|
"mean_token_accuracy": 0.20782668739557267,
|
|
"num_tokens": 41212502.0,
|
|
"step": 16270
|
|
},
|
|
{
|
|
"entropy": 6.231871271133423,
|
|
"epoch": 1.8782458165031737,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.000465603528693865,
|
|
"loss": 5.7218,
|
|
"mean_token_accuracy": 0.1999581292271614,
|
|
"num_tokens": 41226006.0,
|
|
"step": 16275
|
|
},
|
|
{
|
|
"entropy": 6.290467929840088,
|
|
"epoch": 1.8788228505481823,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00046558159799114853,
|
|
"loss": 5.7759,
|
|
"mean_token_accuracy": 0.19554868936538697,
|
|
"num_tokens": 41239172.0,
|
|
"step": 16280
|
|
},
|
|
{
|
|
"entropy": 6.234803247451782,
|
|
"epoch": 1.879399884593191,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004655596608783147,
|
|
"loss": 5.6807,
|
|
"mean_token_accuracy": 0.20324462056159973,
|
|
"num_tokens": 41251307.0,
|
|
"step": 16285
|
|
},
|
|
{
|
|
"entropy": 6.256707239151001,
|
|
"epoch": 1.8799769186381996,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046553771735610136,
|
|
"loss": 5.7335,
|
|
"mean_token_accuracy": 0.1982148304581642,
|
|
"num_tokens": 41264634.0,
|
|
"step": 16290
|
|
},
|
|
{
|
|
"entropy": 6.3179339408874515,
|
|
"epoch": 1.8805539526832082,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004655157674252465,
|
|
"loss": 5.7985,
|
|
"mean_token_accuracy": 0.18980283737182618,
|
|
"num_tokens": 41278205.0,
|
|
"step": 16295
|
|
},
|
|
{
|
|
"entropy": 6.348180198669434,
|
|
"epoch": 1.881130986728217,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00046549381108648843,
|
|
"loss": 5.8224,
|
|
"mean_token_accuracy": 0.19358165115118026,
|
|
"num_tokens": 41290447.0,
|
|
"step": 16300
|
|
},
|
|
{
|
|
"entropy": 6.262139749526978,
|
|
"epoch": 1.8817080207732255,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004654718483405656,
|
|
"loss": 5.7144,
|
|
"mean_token_accuracy": 0.20273840427398682,
|
|
"num_tokens": 41302948.0,
|
|
"step": 16305
|
|
},
|
|
{
|
|
"entropy": 6.263070011138916,
|
|
"epoch": 1.8822850548182344,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00046544987918821685,
|
|
"loss": 5.8237,
|
|
"mean_token_accuracy": 0.18879707604646684,
|
|
"num_tokens": 41315237.0,
|
|
"step": 16310
|
|
},
|
|
{
|
|
"entropy": 6.133535957336425,
|
|
"epoch": 1.8828620888632428,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000465427903630181,
|
|
"loss": 5.5638,
|
|
"mean_token_accuracy": 0.2196532055735588,
|
|
"num_tokens": 41327426.0,
|
|
"step": 16315
|
|
},
|
|
{
|
|
"entropy": 6.307161808013916,
|
|
"epoch": 1.8834391229082517,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004654059216671972,
|
|
"loss": 5.8517,
|
|
"mean_token_accuracy": 0.18843885362148285,
|
|
"num_tokens": 41340517.0,
|
|
"step": 16320
|
|
},
|
|
{
|
|
"entropy": 6.236600637435913,
|
|
"epoch": 1.88401615695326,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004653839333000048,
|
|
"loss": 5.7559,
|
|
"mean_token_accuracy": 0.20001779347658158,
|
|
"num_tokens": 41353520.0,
|
|
"step": 16325
|
|
},
|
|
{
|
|
"entropy": 6.285597038269043,
|
|
"epoch": 1.884593190998269,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00046536193852934334,
|
|
"loss": 5.7969,
|
|
"mean_token_accuracy": 0.19169134944677352,
|
|
"num_tokens": 41366326.0,
|
|
"step": 16330
|
|
},
|
|
{
|
|
"entropy": 6.229726505279541,
|
|
"epoch": 1.8851702250432776,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00046533993735595273,
|
|
"loss": 5.7167,
|
|
"mean_token_accuracy": 0.19942979216575624,
|
|
"num_tokens": 41377405.0,
|
|
"step": 16335
|
|
},
|
|
{
|
|
"entropy": 6.325794410705567,
|
|
"epoch": 1.8857472590882862,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00046531792978057277,
|
|
"loss": 5.8318,
|
|
"mean_token_accuracy": 0.19330891519784926,
|
|
"num_tokens": 41391038.0,
|
|
"step": 16340
|
|
},
|
|
{
|
|
"entropy": 6.256032085418701,
|
|
"epoch": 1.8863242931332949,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004652959158039438,
|
|
"loss": 5.7934,
|
|
"mean_token_accuracy": 0.19577520489692687,
|
|
"num_tokens": 41404069.0,
|
|
"step": 16345
|
|
},
|
|
{
|
|
"entropy": 6.223421478271485,
|
|
"epoch": 1.8869013271783035,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004652738954268062,
|
|
"loss": 5.7639,
|
|
"mean_token_accuracy": 0.19806374460458756,
|
|
"num_tokens": 41416698.0,
|
|
"step": 16350
|
|
},
|
|
{
|
|
"entropy": 6.249164390563965,
|
|
"epoch": 1.8874783612233121,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00046525186864990073,
|
|
"loss": 5.7403,
|
|
"mean_token_accuracy": 0.20115036368370057,
|
|
"num_tokens": 41429953.0,
|
|
"step": 16355
|
|
},
|
|
{
|
|
"entropy": 6.211552906036377,
|
|
"epoch": 1.8880553952683208,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00046522983547396806,
|
|
"loss": 5.7539,
|
|
"mean_token_accuracy": 0.1969211846590042,
|
|
"num_tokens": 41442824.0,
|
|
"step": 16360
|
|
},
|
|
{
|
|
"entropy": 6.246453046798706,
|
|
"epoch": 1.8886324293133296,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004652077958997494,
|
|
"loss": 5.7936,
|
|
"mean_token_accuracy": 0.19895950108766555,
|
|
"num_tokens": 41455062.0,
|
|
"step": 16365
|
|
},
|
|
{
|
|
"entropy": 6.222312116622925,
|
|
"epoch": 1.889209463358338,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00046518574992798604,
|
|
"loss": 5.6555,
|
|
"mean_token_accuracy": 0.2099636271595955,
|
|
"num_tokens": 41468147.0,
|
|
"step": 16370
|
|
},
|
|
{
|
|
"entropy": 6.223028945922851,
|
|
"epoch": 1.889786497403347,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00046516369755941945,
|
|
"loss": 5.7131,
|
|
"mean_token_accuracy": 0.19650413542985917,
|
|
"num_tokens": 41480664.0,
|
|
"step": 16375
|
|
},
|
|
{
|
|
"entropy": 6.2845159530639645,
|
|
"epoch": 1.8903635314483553,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004651416387947914,
|
|
"loss": 5.7874,
|
|
"mean_token_accuracy": 0.19323295950889588,
|
|
"num_tokens": 41494578.0,
|
|
"step": 16380
|
|
},
|
|
{
|
|
"entropy": 6.292543506622314,
|
|
"epoch": 1.8909405654933642,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004651195736348437,
|
|
"loss": 5.8311,
|
|
"mean_token_accuracy": 0.19104174971580506,
|
|
"num_tokens": 41506528.0,
|
|
"step": 16385
|
|
},
|
|
{
|
|
"entropy": 6.3199584007263185,
|
|
"epoch": 1.8915175995383726,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004650975020803186,
|
|
"loss": 5.8854,
|
|
"mean_token_accuracy": 0.18843409717082976,
|
|
"num_tokens": 41520861.0,
|
|
"step": 16390
|
|
},
|
|
{
|
|
"entropy": 6.2749334335327145,
|
|
"epoch": 1.8920946335833815,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004650754241319584,
|
|
"loss": 5.7578,
|
|
"mean_token_accuracy": 0.19465109407901765,
|
|
"num_tokens": 41533811.0,
|
|
"step": 16395
|
|
},
|
|
{
|
|
"entropy": 6.295410919189453,
|
|
"epoch": 1.8926716676283901,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00046505333979050573,
|
|
"loss": 5.8309,
|
|
"mean_token_accuracy": 0.18629831969738006,
|
|
"num_tokens": 41546291.0,
|
|
"step": 16400
|
|
},
|
|
{
|
|
"entropy": 6.229169321060181,
|
|
"epoch": 1.8932487016733988,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004650312490567035,
|
|
"loss": 5.6885,
|
|
"mean_token_accuracy": 0.20371766537427902,
|
|
"num_tokens": 41558157.0,
|
|
"step": 16405
|
|
},
|
|
{
|
|
"entropy": 6.260204553604126,
|
|
"epoch": 1.8938257357184074,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004650091519312945,
|
|
"loss": 5.7904,
|
|
"mean_token_accuracy": 0.19707432389259338,
|
|
"num_tokens": 41571346.0,
|
|
"step": 16410
|
|
},
|
|
{
|
|
"entropy": 6.290263605117798,
|
|
"epoch": 1.894402769763416,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00046498704841502203,
|
|
"loss": 5.8656,
|
|
"mean_token_accuracy": 0.1875235214829445,
|
|
"num_tokens": 41583973.0,
|
|
"step": 16415
|
|
},
|
|
{
|
|
"entropy": 6.2632382869720455,
|
|
"epoch": 1.8949798038084247,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004649649385086296,
|
|
"loss": 5.7809,
|
|
"mean_token_accuracy": 0.1917982280254364,
|
|
"num_tokens": 41596210.0,
|
|
"step": 16420
|
|
},
|
|
{
|
|
"entropy": 6.269391632080078,
|
|
"epoch": 1.8955568378534333,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004649428222128608,
|
|
"loss": 5.8774,
|
|
"mean_token_accuracy": 0.1920461028814316,
|
|
"num_tokens": 41608297.0,
|
|
"step": 16425
|
|
},
|
|
{
|
|
"entropy": 6.2635517597198485,
|
|
"epoch": 1.896133871898442,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00046492069952845953,
|
|
"loss": 5.8159,
|
|
"mean_token_accuracy": 0.19155189394950867,
|
|
"num_tokens": 41621319.0,
|
|
"step": 16430
|
|
},
|
|
{
|
|
"entropy": 6.256300735473633,
|
|
"epoch": 1.8967109059434506,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00046489857045617,
|
|
"loss": 5.7019,
|
|
"mean_token_accuracy": 0.1957299679517746,
|
|
"num_tokens": 41633282.0,
|
|
"step": 16435
|
|
},
|
|
{
|
|
"entropy": 6.198005723953247,
|
|
"epoch": 1.8972879399884595,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046487643499673625,
|
|
"loss": 5.7409,
|
|
"mean_token_accuracy": 0.19980133175849915,
|
|
"num_tokens": 41646573.0,
|
|
"step": 16440
|
|
},
|
|
{
|
|
"entropy": 6.209664535522461,
|
|
"epoch": 1.8978649740334679,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004648542931509029,
|
|
"loss": 5.7305,
|
|
"mean_token_accuracy": 0.1976473018527031,
|
|
"num_tokens": 41659596.0,
|
|
"step": 16445
|
|
},
|
|
{
|
|
"entropy": 6.271393918991089,
|
|
"epoch": 1.8984420080784767,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004648321449194148,
|
|
"loss": 5.7343,
|
|
"mean_token_accuracy": 0.19791839867830277,
|
|
"num_tokens": 41673612.0,
|
|
"step": 16450
|
|
},
|
|
{
|
|
"entropy": 6.33080906867981,
|
|
"epoch": 1.8990190421234852,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00046480999030301673,
|
|
"loss": 5.8707,
|
|
"mean_token_accuracy": 0.19741834253072738,
|
|
"num_tokens": 41686583.0,
|
|
"step": 16455
|
|
},
|
|
{
|
|
"entropy": 6.2306641101837155,
|
|
"epoch": 1.899596076168494,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00046478782930245395,
|
|
"loss": 5.7818,
|
|
"mean_token_accuracy": 0.19308353811502457,
|
|
"num_tokens": 41698542.0,
|
|
"step": 16460
|
|
},
|
|
{
|
|
"entropy": 6.272447824478149,
|
|
"epoch": 1.9001731102135024,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00046476566191847176,
|
|
"loss": 5.7652,
|
|
"mean_token_accuracy": 0.19157506674528121,
|
|
"num_tokens": 41712461.0,
|
|
"step": 16465
|
|
},
|
|
{
|
|
"entropy": 6.274053525924683,
|
|
"epoch": 1.9007501442585113,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004647434881518159,
|
|
"loss": 5.7936,
|
|
"mean_token_accuracy": 0.19418258666992189,
|
|
"num_tokens": 41725450.0,
|
|
"step": 16470
|
|
},
|
|
{
|
|
"entropy": 6.304055404663086,
|
|
"epoch": 1.90132717830352,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00046472130800323194,
|
|
"loss": 5.7928,
|
|
"mean_token_accuracy": 0.1953343480825424,
|
|
"num_tokens": 41737255.0,
|
|
"step": 16475
|
|
},
|
|
{
|
|
"entropy": 6.237203598022461,
|
|
"epoch": 1.9019042123485286,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004646991214734661,
|
|
"loss": 5.8467,
|
|
"mean_token_accuracy": 0.18810160607099533,
|
|
"num_tokens": 41749459.0,
|
|
"step": 16480
|
|
},
|
|
{
|
|
"entropy": 6.266273927688599,
|
|
"epoch": 1.9024812463935372,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004646769285632645,
|
|
"loss": 5.7854,
|
|
"mean_token_accuracy": 0.19517850428819655,
|
|
"num_tokens": 41761603.0,
|
|
"step": 16485
|
|
},
|
|
{
|
|
"entropy": 6.29341402053833,
|
|
"epoch": 1.9030582804385459,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004646547292733737,
|
|
"loss": 5.866,
|
|
"mean_token_accuracy": 0.19031329154968263,
|
|
"num_tokens": 41774865.0,
|
|
"step": 16490
|
|
},
|
|
{
|
|
"entropy": 6.235404348373413,
|
|
"epoch": 1.9036353144835545,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004646325236045402,
|
|
"loss": 5.7926,
|
|
"mean_token_accuracy": 0.19833193123340606,
|
|
"num_tokens": 41787558.0,
|
|
"step": 16495
|
|
},
|
|
{
|
|
"entropy": 6.243685007095337,
|
|
"epoch": 1.9042123485285631,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.000464610311557511,
|
|
"loss": 5.719,
|
|
"mean_token_accuracy": 0.20007752627134323,
|
|
"num_tokens": 41800754.0,
|
|
"step": 16500
|
|
},
|
|
{
|
|
"entropy": 6.226137685775757,
|
|
"epoch": 1.904789382573572,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004645880931330331,
|
|
"loss": 5.6967,
|
|
"mean_token_accuracy": 0.20966541022062302,
|
|
"num_tokens": 41813133.0,
|
|
"step": 16505
|
|
},
|
|
{
|
|
"entropy": 6.233737277984619,
|
|
"epoch": 1.9053664166185804,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004645658683318539,
|
|
"loss": 5.8035,
|
|
"mean_token_accuracy": 0.18930404186248778,
|
|
"num_tokens": 41825288.0,
|
|
"step": 16510
|
|
},
|
|
{
|
|
"entropy": 6.292668104171753,
|
|
"epoch": 1.9059434506635893,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004645436371547209,
|
|
"loss": 5.8451,
|
|
"mean_token_accuracy": 0.19418457448482512,
|
|
"num_tokens": 41837331.0,
|
|
"step": 16515
|
|
},
|
|
{
|
|
"entropy": 6.341061973571778,
|
|
"epoch": 1.9065204847085977,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00046452139960238186,
|
|
"loss": 5.8377,
|
|
"mean_token_accuracy": 0.19629154950380326,
|
|
"num_tokens": 41850536.0,
|
|
"step": 16520
|
|
},
|
|
{
|
|
"entropy": 6.257677698135376,
|
|
"epoch": 1.9070975187536066,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00046449915567558467,
|
|
"loss": 5.7741,
|
|
"mean_token_accuracy": 0.20220681130886078,
|
|
"num_tokens": 41862199.0,
|
|
"step": 16525
|
|
},
|
|
{
|
|
"entropy": 6.220550918579102,
|
|
"epoch": 1.907674552798615,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004644769053750775,
|
|
"loss": 5.7688,
|
|
"mean_token_accuracy": 0.196894970536232,
|
|
"num_tokens": 41872945.0,
|
|
"step": 16530
|
|
},
|
|
{
|
|
"entropy": 6.280444192886352,
|
|
"epoch": 1.9082515868436238,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004644546487016087,
|
|
"loss": 5.7714,
|
|
"mean_token_accuracy": 0.18869336992502211,
|
|
"num_tokens": 41884223.0,
|
|
"step": 16535
|
|
},
|
|
{
|
|
"entropy": 6.260154581069946,
|
|
"epoch": 1.9088286208886325,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00046443238565592687,
|
|
"loss": 5.7942,
|
|
"mean_token_accuracy": 0.19114427119493485,
|
|
"num_tokens": 41896997.0,
|
|
"step": 16540
|
|
},
|
|
{
|
|
"entropy": 6.2543297290802,
|
|
"epoch": 1.9094056549336411,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00046441011623878087,
|
|
"loss": 5.8051,
|
|
"mean_token_accuracy": 0.1990337774157524,
|
|
"num_tokens": 41910210.0,
|
|
"step": 16545
|
|
},
|
|
{
|
|
"entropy": 6.144182586669922,
|
|
"epoch": 1.9099826889786498,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004643878404509197,
|
|
"loss": 5.6173,
|
|
"mean_token_accuracy": 0.20534706264734268,
|
|
"num_tokens": 41922882.0,
|
|
"step": 16550
|
|
},
|
|
{
|
|
"entropy": 6.211149787902832,
|
|
"epoch": 1.9105597230236584,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00046436555829309264,
|
|
"loss": 5.6609,
|
|
"mean_token_accuracy": 0.20721425265073776,
|
|
"num_tokens": 41934655.0,
|
|
"step": 16555
|
|
},
|
|
{
|
|
"entropy": 6.271144676208496,
|
|
"epoch": 1.911136757068667,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.000464343269766049,
|
|
"loss": 5.7733,
|
|
"mean_token_accuracy": 0.19531577229499816,
|
|
"num_tokens": 41947946.0,
|
|
"step": 16560
|
|
},
|
|
{
|
|
"entropy": 6.307552719116211,
|
|
"epoch": 1.9117137911136757,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00046432097487053857,
|
|
"loss": 5.8634,
|
|
"mean_token_accuracy": 0.19490341544151307,
|
|
"num_tokens": 41962316.0,
|
|
"step": 16565
|
|
},
|
|
{
|
|
"entropy": 6.244507789611816,
|
|
"epoch": 1.9122908251586843,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00046429867360731124,
|
|
"loss": 5.7511,
|
|
"mean_token_accuracy": 0.20181444138288498,
|
|
"num_tokens": 41976076.0,
|
|
"step": 16570
|
|
},
|
|
{
|
|
"entropy": 6.296638822555542,
|
|
"epoch": 1.912867859203693,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00046427636597711695,
|
|
"loss": 5.7693,
|
|
"mean_token_accuracy": 0.19726170897483825,
|
|
"num_tokens": 41988762.0,
|
|
"step": 16575
|
|
},
|
|
{
|
|
"entropy": 6.256453800201416,
|
|
"epoch": 1.9134448932487018,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00046425405198070624,
|
|
"loss": 5.7026,
|
|
"mean_token_accuracy": 0.19614930152893068,
|
|
"num_tokens": 42000525.0,
|
|
"step": 16580
|
|
},
|
|
{
|
|
"entropy": 6.15288553237915,
|
|
"epoch": 1.9140219272937102,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00046423173161882944,
|
|
"loss": 5.6421,
|
|
"mean_token_accuracy": 0.20159791260957718,
|
|
"num_tokens": 42013716.0,
|
|
"step": 16585
|
|
},
|
|
{
|
|
"entropy": 6.256470537185669,
|
|
"epoch": 1.914598961338719,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00046420940489223735,
|
|
"loss": 5.7567,
|
|
"mean_token_accuracy": 0.198087240755558,
|
|
"num_tokens": 42026689.0,
|
|
"step": 16590
|
|
},
|
|
{
|
|
"entropy": 6.285912227630615,
|
|
"epoch": 1.9151759953837275,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004641870718016809,
|
|
"loss": 5.82,
|
|
"mean_token_accuracy": 0.18809255659580232,
|
|
"num_tokens": 42039907.0,
|
|
"step": 16595
|
|
},
|
|
{
|
|
"entropy": 6.284678554534912,
|
|
"epoch": 1.9157530294287364,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004641647323479113,
|
|
"loss": 5.7782,
|
|
"mean_token_accuracy": 0.20078144371509551,
|
|
"num_tokens": 42052781.0,
|
|
"step": 16600
|
|
},
|
|
{
|
|
"entropy": 6.257567262649536,
|
|
"epoch": 1.9163300634737448,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004641423865316798,
|
|
"loss": 5.7372,
|
|
"mean_token_accuracy": 0.2022291049361229,
|
|
"num_tokens": 42066695.0,
|
|
"step": 16605
|
|
},
|
|
{
|
|
"entropy": 6.1644511222839355,
|
|
"epoch": 1.9169070975187537,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004641200343537381,
|
|
"loss": 5.6759,
|
|
"mean_token_accuracy": 0.20373013019561767,
|
|
"num_tokens": 42079315.0,
|
|
"step": 16610
|
|
},
|
|
{
|
|
"entropy": 6.284307432174683,
|
|
"epoch": 1.9174841315637623,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000464097675814838,
|
|
"loss": 5.8274,
|
|
"mean_token_accuracy": 0.18814072906970977,
|
|
"num_tokens": 42091915.0,
|
|
"step": 16615
|
|
},
|
|
{
|
|
"entropy": 6.281247520446778,
|
|
"epoch": 1.918061165608771,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004640753109157316,
|
|
"loss": 5.8094,
|
|
"mean_token_accuracy": 0.19566377103328705,
|
|
"num_tokens": 42105316.0,
|
|
"step": 16620
|
|
},
|
|
{
|
|
"entropy": 6.255827951431274,
|
|
"epoch": 1.9186381996537796,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00046405293965717093,
|
|
"loss": 5.719,
|
|
"mean_token_accuracy": 0.19903454780578614,
|
|
"num_tokens": 42118078.0,
|
|
"step": 16625
|
|
},
|
|
{
|
|
"entropy": 6.236255788803101,
|
|
"epoch": 1.9192152336987882,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004640305620399086,
|
|
"loss": 5.6829,
|
|
"mean_token_accuracy": 0.20465412139892578,
|
|
"num_tokens": 42130845.0,
|
|
"step": 16630
|
|
},
|
|
{
|
|
"entropy": 6.2283731460571286,
|
|
"epoch": 1.9197922677437969,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004640081780646971,
|
|
"loss": 5.7412,
|
|
"mean_token_accuracy": 0.20514567643404008,
|
|
"num_tokens": 42142487.0,
|
|
"step": 16635
|
|
},
|
|
{
|
|
"entropy": 6.188979005813598,
|
|
"epoch": 1.9203693017888055,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00046398578773228954,
|
|
"loss": 5.7959,
|
|
"mean_token_accuracy": 0.1916016846895218,
|
|
"num_tokens": 42154747.0,
|
|
"step": 16640
|
|
},
|
|
{
|
|
"entropy": 6.3480628490447994,
|
|
"epoch": 1.9209463358338144,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00046396339104343886,
|
|
"loss": 5.7897,
|
|
"mean_token_accuracy": 0.1906105950474739,
|
|
"num_tokens": 42167697.0,
|
|
"step": 16645
|
|
},
|
|
{
|
|
"entropy": 6.264107656478882,
|
|
"epoch": 1.9215233698788228,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004639409879988984,
|
|
"loss": 5.7672,
|
|
"mean_token_accuracy": 0.19499629139900207,
|
|
"num_tokens": 42179874.0,
|
|
"step": 16650
|
|
},
|
|
{
|
|
"entropy": 6.344415950775146,
|
|
"epoch": 1.9221004039238316,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004639185785994216,
|
|
"loss": 5.8445,
|
|
"mean_token_accuracy": 0.19568451046943663,
|
|
"num_tokens": 42192747.0,
|
|
"step": 16655
|
|
},
|
|
{
|
|
"entropy": 6.209359455108642,
|
|
"epoch": 1.92267743796884,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00046389616284576226,
|
|
"loss": 5.7244,
|
|
"mean_token_accuracy": 0.20322487354278565,
|
|
"num_tokens": 42205534.0,
|
|
"step": 16660
|
|
},
|
|
{
|
|
"entropy": 6.236516332626342,
|
|
"epoch": 1.923254472013849,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00046387374073867435,
|
|
"loss": 5.7807,
|
|
"mean_token_accuracy": 0.1965228259563446,
|
|
"num_tokens": 42217825.0,
|
|
"step": 16665
|
|
},
|
|
{
|
|
"entropy": 6.307939052581787,
|
|
"epoch": 1.9238315060588573,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00046385131227891197,
|
|
"loss": 5.7686,
|
|
"mean_token_accuracy": 0.19342057555913925,
|
|
"num_tokens": 42230162.0,
|
|
"step": 16670
|
|
},
|
|
{
|
|
"entropy": 6.219927167892456,
|
|
"epoch": 1.9244085401038662,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004638288774672295,
|
|
"loss": 5.7397,
|
|
"mean_token_accuracy": 0.20268993824720383,
|
|
"num_tokens": 42242458.0,
|
|
"step": 16675
|
|
},
|
|
{
|
|
"entropy": 6.157504272460938,
|
|
"epoch": 1.9249855741488748,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004638064363043816,
|
|
"loss": 5.7236,
|
|
"mean_token_accuracy": 0.19436694234609603,
|
|
"num_tokens": 42254389.0,
|
|
"step": 16680
|
|
},
|
|
{
|
|
"entropy": 6.249301719665527,
|
|
"epoch": 1.9255626081938835,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00046378398879112293,
|
|
"loss": 5.7496,
|
|
"mean_token_accuracy": 0.20150014460086824,
|
|
"num_tokens": 42266421.0,
|
|
"step": 16685
|
|
},
|
|
{
|
|
"entropy": 6.132052278518676,
|
|
"epoch": 1.9261396422388921,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004637615349282086,
|
|
"loss": 5.7148,
|
|
"mean_token_accuracy": 0.19750168770551682,
|
|
"num_tokens": 42279189.0,
|
|
"step": 16690
|
|
},
|
|
{
|
|
"entropy": 6.267314481735229,
|
|
"epoch": 1.9267166762839008,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004637390747163938,
|
|
"loss": 5.7576,
|
|
"mean_token_accuracy": 0.19890677481889724,
|
|
"num_tokens": 42291970.0,
|
|
"step": 16695
|
|
},
|
|
{
|
|
"entropy": 6.314395475387573,
|
|
"epoch": 1.9272937103289094,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004637166081564339,
|
|
"loss": 5.8416,
|
|
"mean_token_accuracy": 0.19406890869140625,
|
|
"num_tokens": 42305185.0,
|
|
"step": 16700
|
|
},
|
|
{
|
|
"entropy": 6.290263223648071,
|
|
"epoch": 1.927870744373918,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00046369413524908473,
|
|
"loss": 5.7873,
|
|
"mean_token_accuracy": 0.20269953310489655,
|
|
"num_tokens": 42317823.0,
|
|
"step": 16705
|
|
},
|
|
{
|
|
"entropy": 6.241884231567383,
|
|
"epoch": 1.9284477784189267,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00046367165599510207,
|
|
"loss": 5.8062,
|
|
"mean_token_accuracy": 0.1951628655195236,
|
|
"num_tokens": 42330540.0,
|
|
"step": 16710
|
|
},
|
|
{
|
|
"entropy": 6.224489212036133,
|
|
"epoch": 1.9290248124639353,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004636491703952419,
|
|
"loss": 5.6006,
|
|
"mean_token_accuracy": 0.20743975341320037,
|
|
"num_tokens": 42342347.0,
|
|
"step": 16715
|
|
},
|
|
{
|
|
"entropy": 6.207153224945069,
|
|
"epoch": 1.9296018465089442,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00046362667845026057,
|
|
"loss": 5.7571,
|
|
"mean_token_accuracy": 0.20456219017505645,
|
|
"num_tokens": 42355004.0,
|
|
"step": 16720
|
|
},
|
|
{
|
|
"entropy": 6.225836229324341,
|
|
"epoch": 1.9301788805539526,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00046360418016091467,
|
|
"loss": 5.7263,
|
|
"mean_token_accuracy": 0.19706103801727295,
|
|
"num_tokens": 42366700.0,
|
|
"step": 16725
|
|
},
|
|
{
|
|
"entropy": 6.230300235748291,
|
|
"epoch": 1.9307559145989615,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00046358167552796085,
|
|
"loss": 5.7861,
|
|
"mean_token_accuracy": 0.19526439011096955,
|
|
"num_tokens": 42379723.0,
|
|
"step": 16730
|
|
},
|
|
{
|
|
"entropy": 6.215284585952759,
|
|
"epoch": 1.9313329486439699,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00046355916455215597,
|
|
"loss": 5.7475,
|
|
"mean_token_accuracy": 0.20507837533950807,
|
|
"num_tokens": 42393505.0,
|
|
"step": 16735
|
|
},
|
|
{
|
|
"entropy": 6.2595137596130375,
|
|
"epoch": 1.9319099826889787,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004635366472342573,
|
|
"loss": 5.7536,
|
|
"mean_token_accuracy": 0.1928567260503769,
|
|
"num_tokens": 42406334.0,
|
|
"step": 16740
|
|
},
|
|
{
|
|
"entropy": 6.250863933563233,
|
|
"epoch": 1.9324870167339872,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004635141235750222,
|
|
"loss": 5.7826,
|
|
"mean_token_accuracy": 0.19470173269510269,
|
|
"num_tokens": 42418585.0,
|
|
"step": 16745
|
|
},
|
|
{
|
|
"entropy": 6.236263465881348,
|
|
"epoch": 1.933064050778996,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00046349159357520815,
|
|
"loss": 5.6911,
|
|
"mean_token_accuracy": 0.20743900984525682,
|
|
"num_tokens": 42430741.0,
|
|
"step": 16750
|
|
},
|
|
{
|
|
"entropy": 6.18456621170044,
|
|
"epoch": 1.9336410848240047,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.000463469057235573,
|
|
"loss": 5.6973,
|
|
"mean_token_accuracy": 0.21004330068826677,
|
|
"num_tokens": 42443241.0,
|
|
"step": 16755
|
|
},
|
|
{
|
|
"entropy": 6.249989223480225,
|
|
"epoch": 1.9342181188690133,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00046344651455687476,
|
|
"loss": 5.7941,
|
|
"mean_token_accuracy": 0.19664210975170135,
|
|
"num_tokens": 42456476.0,
|
|
"step": 16760
|
|
},
|
|
{
|
|
"entropy": 6.355844640731812,
|
|
"epoch": 1.934795152914022,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00046342396553987155,
|
|
"loss": 5.7991,
|
|
"mean_token_accuracy": 0.19460918456315995,
|
|
"num_tokens": 42468875.0,
|
|
"step": 16765
|
|
},
|
|
{
|
|
"entropy": 6.318538808822632,
|
|
"epoch": 1.9353721869590306,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00046340141018532186,
|
|
"loss": 5.7436,
|
|
"mean_token_accuracy": 0.19695119559764862,
|
|
"num_tokens": 42483300.0,
|
|
"step": 16770
|
|
},
|
|
{
|
|
"entropy": 6.241217947006225,
|
|
"epoch": 1.9359492210040392,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004633788484939843,
|
|
"loss": 5.8172,
|
|
"mean_token_accuracy": 0.19264088720083236,
|
|
"num_tokens": 42497748.0,
|
|
"step": 16775
|
|
},
|
|
{
|
|
"entropy": 6.202336645126342,
|
|
"epoch": 1.9365262550490479,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.00046335628046661776,
|
|
"loss": 5.8135,
|
|
"mean_token_accuracy": 0.1930590033531189,
|
|
"num_tokens": 42510464.0,
|
|
"step": 16780
|
|
},
|
|
{
|
|
"entropy": 6.34554967880249,
|
|
"epoch": 1.9371032890940567,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00046333370610398135,
|
|
"loss": 5.8634,
|
|
"mean_token_accuracy": 0.18837577253580093,
|
|
"num_tokens": 42522298.0,
|
|
"step": 16785
|
|
},
|
|
{
|
|
"entropy": 6.321823215484619,
|
|
"epoch": 1.9376803231390651,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004633111254068342,
|
|
"loss": 5.732,
|
|
"mean_token_accuracy": 0.20026923716068268,
|
|
"num_tokens": 42535094.0,
|
|
"step": 16790
|
|
},
|
|
{
|
|
"entropy": 6.171190404891968,
|
|
"epoch": 1.938257357184074,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004632885383759359,
|
|
"loss": 5.7286,
|
|
"mean_token_accuracy": 0.20176013112068175,
|
|
"num_tokens": 42547272.0,
|
|
"step": 16795
|
|
},
|
|
{
|
|
"entropy": 6.122797870635987,
|
|
"epoch": 1.9388343912290824,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00046326594501204624,
|
|
"loss": 5.6462,
|
|
"mean_token_accuracy": 0.20535439550876616,
|
|
"num_tokens": 42559568.0,
|
|
"step": 16800
|
|
},
|
|
{
|
|
"entropy": 6.31897931098938,
|
|
"epoch": 1.9394114252740913,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.000463243345315925,
|
|
"loss": 5.7954,
|
|
"mean_token_accuracy": 0.19426541924476623,
|
|
"num_tokens": 42573177.0,
|
|
"step": 16805
|
|
},
|
|
{
|
|
"entropy": 6.238536357879639,
|
|
"epoch": 1.9399884593190997,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00046322073928833224,
|
|
"loss": 5.7324,
|
|
"mean_token_accuracy": 0.19810742139816284,
|
|
"num_tokens": 42585436.0,
|
|
"step": 16810
|
|
},
|
|
{
|
|
"entropy": 6.25981593132019,
|
|
"epoch": 1.9405654933641086,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004631981269300285,
|
|
"loss": 5.7486,
|
|
"mean_token_accuracy": 0.19752792567014693,
|
|
"num_tokens": 42599826.0,
|
|
"step": 16815
|
|
},
|
|
{
|
|
"entropy": 6.23888201713562,
|
|
"epoch": 1.9411425274091172,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004631755082417742,
|
|
"loss": 5.7861,
|
|
"mean_token_accuracy": 0.19362489581108094,
|
|
"num_tokens": 42613901.0,
|
|
"step": 16820
|
|
},
|
|
{
|
|
"entropy": 6.338619804382324,
|
|
"epoch": 1.9417195614541258,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004631528832243302,
|
|
"loss": 5.7823,
|
|
"mean_token_accuracy": 0.193868550658226,
|
|
"num_tokens": 42626592.0,
|
|
"step": 16825
|
|
},
|
|
{
|
|
"entropy": 6.2455222606658936,
|
|
"epoch": 1.9422965954991345,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00046313025187845735,
|
|
"loss": 5.7098,
|
|
"mean_token_accuracy": 0.2027307316660881,
|
|
"num_tokens": 42639754.0,
|
|
"step": 16830
|
|
},
|
|
{
|
|
"entropy": 6.237716293334961,
|
|
"epoch": 1.942873629544143,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00046310761420491705,
|
|
"loss": 5.694,
|
|
"mean_token_accuracy": 0.2055831789970398,
|
|
"num_tokens": 42651321.0,
|
|
"step": 16835
|
|
},
|
|
{
|
|
"entropy": 6.281747102737427,
|
|
"epoch": 1.9434506635891518,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004630849702044705,
|
|
"loss": 5.7825,
|
|
"mean_token_accuracy": 0.1963137060403824,
|
|
"num_tokens": 42664188.0,
|
|
"step": 16840
|
|
},
|
|
{
|
|
"entropy": 6.190065813064575,
|
|
"epoch": 1.9440276976341604,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00046306231987787937,
|
|
"loss": 5.7493,
|
|
"mean_token_accuracy": 0.1937461093068123,
|
|
"num_tokens": 42677882.0,
|
|
"step": 16845
|
|
},
|
|
{
|
|
"entropy": 6.177444744110107,
|
|
"epoch": 1.944604731679169,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00046303966322590556,
|
|
"loss": 5.6669,
|
|
"mean_token_accuracy": 0.2031422659754753,
|
|
"num_tokens": 42690595.0,
|
|
"step": 16850
|
|
},
|
|
{
|
|
"entropy": 6.147070264816284,
|
|
"epoch": 1.9451817657241777,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004630170002493111,
|
|
"loss": 5.6277,
|
|
"mean_token_accuracy": 0.205380442738533,
|
|
"num_tokens": 42704784.0,
|
|
"step": 16855
|
|
},
|
|
{
|
|
"entropy": 6.207528877258301,
|
|
"epoch": 1.9457587997691865,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00046299433094885826,
|
|
"loss": 5.7333,
|
|
"mean_token_accuracy": 0.1969046950340271,
|
|
"num_tokens": 42717012.0,
|
|
"step": 16860
|
|
},
|
|
{
|
|
"entropy": 6.309299516677856,
|
|
"epoch": 1.946335833814195,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046297165532530944,
|
|
"loss": 5.7849,
|
|
"mean_token_accuracy": 0.1904382139444351,
|
|
"num_tokens": 42728879.0,
|
|
"step": 16865
|
|
},
|
|
{
|
|
"entropy": 6.261871433258056,
|
|
"epoch": 1.9469128678592038,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004629489733794274,
|
|
"loss": 5.793,
|
|
"mean_token_accuracy": 0.19949239790439605,
|
|
"num_tokens": 42742688.0,
|
|
"step": 16870
|
|
},
|
|
{
|
|
"entropy": 6.28302321434021,
|
|
"epoch": 1.9474899019042122,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.000462926285111975,
|
|
"loss": 5.744,
|
|
"mean_token_accuracy": 0.19738974422216415,
|
|
"num_tokens": 42754955.0,
|
|
"step": 16875
|
|
},
|
|
{
|
|
"entropy": 6.240672779083252,
|
|
"epoch": 1.948066935949221,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00046290359052371535,
|
|
"loss": 5.8072,
|
|
"mean_token_accuracy": 0.19272707402706146,
|
|
"num_tokens": 42767760.0,
|
|
"step": 16880
|
|
},
|
|
{
|
|
"entropy": 6.249153757095337,
|
|
"epoch": 1.9486439699942295,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004628808896154117,
|
|
"loss": 5.765,
|
|
"mean_token_accuracy": 0.1935882583260536,
|
|
"num_tokens": 42779683.0,
|
|
"step": 16885
|
|
},
|
|
{
|
|
"entropy": 6.273938417434692,
|
|
"epoch": 1.9492210040392384,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004628581823878277,
|
|
"loss": 5.7644,
|
|
"mean_token_accuracy": 0.1917514681816101,
|
|
"num_tokens": 42791289.0,
|
|
"step": 16890
|
|
},
|
|
{
|
|
"entropy": 6.281899070739746,
|
|
"epoch": 1.949798038084247,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.000462835468841727,
|
|
"loss": 5.8156,
|
|
"mean_token_accuracy": 0.19286248087882996,
|
|
"num_tokens": 42803318.0,
|
|
"step": 16895
|
|
},
|
|
{
|
|
"entropy": 6.225988864898682,
|
|
"epoch": 1.9503750721292556,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004628127489778737,
|
|
"loss": 5.7822,
|
|
"mean_token_accuracy": 0.19895075708627702,
|
|
"num_tokens": 42815935.0,
|
|
"step": 16900
|
|
},
|
|
{
|
|
"entropy": 6.2690986633300785,
|
|
"epoch": 1.9509521061742643,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004627900227970318,
|
|
"loss": 5.7592,
|
|
"mean_token_accuracy": 0.2022063061594963,
|
|
"num_tokens": 42827759.0,
|
|
"step": 16905
|
|
},
|
|
{
|
|
"entropy": 6.2387683391571045,
|
|
"epoch": 1.951529140219273,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00046276729029996576,
|
|
"loss": 5.7649,
|
|
"mean_token_accuracy": 0.19421954751014708,
|
|
"num_tokens": 42840479.0,
|
|
"step": 16910
|
|
},
|
|
{
|
|
"entropy": 6.255968284606934,
|
|
"epoch": 1.9521061742642816,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.00046274455148744025,
|
|
"loss": 5.8335,
|
|
"mean_token_accuracy": 0.1934561923146248,
|
|
"num_tokens": 42853972.0,
|
|
"step": 16915
|
|
},
|
|
{
|
|
"entropy": 6.2588348388671875,
|
|
"epoch": 1.9526832083092902,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00046272180636022,
|
|
"loss": 5.7313,
|
|
"mean_token_accuracy": 0.2022838994860649,
|
|
"num_tokens": 42866192.0,
|
|
"step": 16920
|
|
},
|
|
{
|
|
"entropy": 6.218838548660278,
|
|
"epoch": 1.953260242354299,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00046269905491907,
|
|
"loss": 5.7531,
|
|
"mean_token_accuracy": 0.20053910315036774,
|
|
"num_tokens": 42878661.0,
|
|
"step": 16925
|
|
},
|
|
{
|
|
"entropy": 6.17126088142395,
|
|
"epoch": 1.9538372763993075,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004626762971647555,
|
|
"loss": 5.7495,
|
|
"mean_token_accuracy": 0.1976466402411461,
|
|
"num_tokens": 42891498.0,
|
|
"step": 16930
|
|
},
|
|
{
|
|
"entropy": 6.24580078125,
|
|
"epoch": 1.9544143104443163,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00046265353309804205,
|
|
"loss": 5.6829,
|
|
"mean_token_accuracy": 0.20284637361764907,
|
|
"num_tokens": 42904657.0,
|
|
"step": 16935
|
|
},
|
|
{
|
|
"entropy": 6.273250246047974,
|
|
"epoch": 1.9549913444893248,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004626307627196952,
|
|
"loss": 5.7381,
|
|
"mean_token_accuracy": 0.20008694678544997,
|
|
"num_tokens": 42916824.0,
|
|
"step": 16940
|
|
},
|
|
{
|
|
"entropy": 6.279068374633789,
|
|
"epoch": 1.9555683785343336,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004626079860304808,
|
|
"loss": 5.8076,
|
|
"mean_token_accuracy": 0.20154052823781968,
|
|
"num_tokens": 42929366.0,
|
|
"step": 16945
|
|
},
|
|
{
|
|
"entropy": 6.146010112762451,
|
|
"epoch": 1.956145412579342,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00046258520303116496,
|
|
"loss": 5.649,
|
|
"mean_token_accuracy": 0.20451925396919252,
|
|
"num_tokens": 42941955.0,
|
|
"step": 16950
|
|
},
|
|
{
|
|
"entropy": 6.277160882949829,
|
|
"epoch": 1.956722446624351,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004625624137225141,
|
|
"loss": 5.8494,
|
|
"mean_token_accuracy": 0.18529517501592635,
|
|
"num_tokens": 42954302.0,
|
|
"step": 16955
|
|
},
|
|
{
|
|
"entropy": 6.32279372215271,
|
|
"epoch": 1.9572994806693593,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004625396181052945,
|
|
"loss": 5.7328,
|
|
"mean_token_accuracy": 0.19855155050754547,
|
|
"num_tokens": 42967225.0,
|
|
"step": 16960
|
|
},
|
|
{
|
|
"entropy": 6.244097757339477,
|
|
"epoch": 1.9578765147143682,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00046251681618027316,
|
|
"loss": 5.7671,
|
|
"mean_token_accuracy": 0.2019764319062233,
|
|
"num_tokens": 42981388.0,
|
|
"step": 16965
|
|
},
|
|
{
|
|
"entropy": 6.2767432689666744,
|
|
"epoch": 1.9584535487593768,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004624940079482167,
|
|
"loss": 5.7902,
|
|
"mean_token_accuracy": 0.1942693993449211,
|
|
"num_tokens": 42993110.0,
|
|
"step": 16970
|
|
},
|
|
{
|
|
"entropy": 6.224786043167114,
|
|
"epoch": 1.9590305828043855,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00046247119340989254,
|
|
"loss": 5.7964,
|
|
"mean_token_accuracy": 0.18906237035989762,
|
|
"num_tokens": 43007309.0,
|
|
"step": 16975
|
|
},
|
|
{
|
|
"entropy": 6.243825435638428,
|
|
"epoch": 1.959607616849394,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004624483725660678,
|
|
"loss": 5.6601,
|
|
"mean_token_accuracy": 0.21698321104049684,
|
|
"num_tokens": 43020813.0,
|
|
"step": 16980
|
|
},
|
|
{
|
|
"entropy": 6.279694986343384,
|
|
"epoch": 1.9601846508944027,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004624255454175102,
|
|
"loss": 5.7775,
|
|
"mean_token_accuracy": 0.19770735502243042,
|
|
"num_tokens": 43033357.0,
|
|
"step": 16985
|
|
},
|
|
{
|
|
"entropy": 6.240402030944824,
|
|
"epoch": 1.9607616849394114,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004624027119649875,
|
|
"loss": 5.8401,
|
|
"mean_token_accuracy": 0.19352957457304001,
|
|
"num_tokens": 43046685.0,
|
|
"step": 16990
|
|
},
|
|
{
|
|
"entropy": 6.277683067321777,
|
|
"epoch": 1.96133871898442,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00046237987220926766,
|
|
"loss": 5.8113,
|
|
"mean_token_accuracy": 0.19058777391910553,
|
|
"num_tokens": 43059670.0,
|
|
"step": 16995
|
|
},
|
|
{
|
|
"entropy": 6.229287195205688,
|
|
"epoch": 1.9619157530294289,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00046235702615111886,
|
|
"loss": 5.6756,
|
|
"mean_token_accuracy": 0.20468678921461106,
|
|
"num_tokens": 43073515.0,
|
|
"step": 17000
|
|
},
|
|
{
|
|
"entropy": 6.26941409111023,
|
|
"epoch": 1.9624927870744373,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004623341737913096,
|
|
"loss": 5.7838,
|
|
"mean_token_accuracy": 0.19650481641292572,
|
|
"num_tokens": 43086046.0,
|
|
"step": 17005
|
|
},
|
|
{
|
|
"entropy": 6.222126197814942,
|
|
"epoch": 1.9630698211194462,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004623113151306085,
|
|
"loss": 5.6846,
|
|
"mean_token_accuracy": 0.19888866394758226,
|
|
"num_tokens": 43097703.0,
|
|
"step": 17010
|
|
},
|
|
{
|
|
"entropy": 6.213971853256226,
|
|
"epoch": 1.9636468551644546,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00046228845016978425,
|
|
"loss": 5.7542,
|
|
"mean_token_accuracy": 0.19422128796577454,
|
|
"num_tokens": 43110378.0,
|
|
"step": 17015
|
|
},
|
|
{
|
|
"entropy": 6.270879411697388,
|
|
"epoch": 1.9642238892094634,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004622655789096061,
|
|
"loss": 5.7468,
|
|
"mean_token_accuracy": 0.19963121861219407,
|
|
"num_tokens": 43122978.0,
|
|
"step": 17020
|
|
},
|
|
{
|
|
"entropy": 6.333521223068237,
|
|
"epoch": 1.9648009232544719,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00046224270135084315,
|
|
"loss": 5.8301,
|
|
"mean_token_accuracy": 0.19587821811437606,
|
|
"num_tokens": 43135371.0,
|
|
"step": 17025
|
|
},
|
|
{
|
|
"entropy": 6.176549243927002,
|
|
"epoch": 1.9653779572994807,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00046221981749426503,
|
|
"loss": 5.7494,
|
|
"mean_token_accuracy": 0.195055790245533,
|
|
"num_tokens": 43147251.0,
|
|
"step": 17030
|
|
},
|
|
{
|
|
"entropy": 6.231923294067383,
|
|
"epoch": 1.9659549913444894,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00046219692734064124,
|
|
"loss": 5.728,
|
|
"mean_token_accuracy": 0.19381537437438964,
|
|
"num_tokens": 43160276.0,
|
|
"step": 17035
|
|
},
|
|
{
|
|
"entropy": 6.3147297382354735,
|
|
"epoch": 1.966532025389498,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004621740308907419,
|
|
"loss": 5.7714,
|
|
"mean_token_accuracy": 0.19927388578653335,
|
|
"num_tokens": 43172443.0,
|
|
"step": 17040
|
|
},
|
|
{
|
|
"entropy": 6.29047212600708,
|
|
"epoch": 1.9671090594345066,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004621511281453369,
|
|
"loss": 5.8044,
|
|
"mean_token_accuracy": 0.19463059306144714,
|
|
"num_tokens": 43186350.0,
|
|
"step": 17045
|
|
},
|
|
{
|
|
"entropy": 6.209466171264649,
|
|
"epoch": 1.9676860934795153,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004621282191051967,
|
|
"loss": 5.7387,
|
|
"mean_token_accuracy": 0.2009575068950653,
|
|
"num_tokens": 43198936.0,
|
|
"step": 17050
|
|
},
|
|
{
|
|
"entropy": 6.32681713104248,
|
|
"epoch": 1.968263127524524,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004621053037710918,
|
|
"loss": 5.7827,
|
|
"mean_token_accuracy": 0.19598435312509538,
|
|
"num_tokens": 43211793.0,
|
|
"step": 17055
|
|
},
|
|
{
|
|
"entropy": 6.263002681732178,
|
|
"epoch": 1.9688401615695326,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.000462082382143793,
|
|
"loss": 5.7579,
|
|
"mean_token_accuracy": 0.19923101365566254,
|
|
"num_tokens": 43223817.0,
|
|
"step": 17060
|
|
},
|
|
{
|
|
"entropy": 6.261463308334351,
|
|
"epoch": 1.9694171956145412,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00046205945422407113,
|
|
"loss": 5.7671,
|
|
"mean_token_accuracy": 0.1999775692820549,
|
|
"num_tokens": 43235769.0,
|
|
"step": 17065
|
|
},
|
|
{
|
|
"entropy": 6.275276851654053,
|
|
"epoch": 1.9699942296595498,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00046203652001269754,
|
|
"loss": 5.7892,
|
|
"mean_token_accuracy": 0.19710277765989304,
|
|
"num_tokens": 43249309.0,
|
|
"step": 17070
|
|
},
|
|
{
|
|
"entropy": 6.237096548080444,
|
|
"epoch": 1.9705712637045587,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00046201357951044337,
|
|
"loss": 5.7608,
|
|
"mean_token_accuracy": 0.19623759686946868,
|
|
"num_tokens": 43262814.0,
|
|
"step": 17075
|
|
},
|
|
{
|
|
"entropy": 6.283816623687744,
|
|
"epoch": 1.9711482977495671,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00046199063271808047,
|
|
"loss": 5.8196,
|
|
"mean_token_accuracy": 0.19353357702493668,
|
|
"num_tokens": 43276898.0,
|
|
"step": 17080
|
|
},
|
|
{
|
|
"entropy": 6.243425130844116,
|
|
"epoch": 1.971725331794576,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004619676796363804,
|
|
"loss": 5.7573,
|
|
"mean_token_accuracy": 0.2017611876130104,
|
|
"num_tokens": 43288902.0,
|
|
"step": 17085
|
|
},
|
|
{
|
|
"entropy": 6.289148283004761,
|
|
"epoch": 1.9723023658395844,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00046194472026611546,
|
|
"loss": 5.7532,
|
|
"mean_token_accuracy": 0.1987377718091011,
|
|
"num_tokens": 43301644.0,
|
|
"step": 17090
|
|
},
|
|
{
|
|
"entropy": 6.246998453140259,
|
|
"epoch": 1.9728793998845933,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004619217546080576,
|
|
"loss": 5.7426,
|
|
"mean_token_accuracy": 0.19673261046409607,
|
|
"num_tokens": 43315550.0,
|
|
"step": 17095
|
|
},
|
|
{
|
|
"entropy": 6.379453182220459,
|
|
"epoch": 1.9734564339296017,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004618987826629794,
|
|
"loss": 5.855,
|
|
"mean_token_accuracy": 0.18522174060344695,
|
|
"num_tokens": 43328095.0,
|
|
"step": 17100
|
|
},
|
|
{
|
|
"entropy": 6.251423120498657,
|
|
"epoch": 1.9740334679746105,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00046187580443165344,
|
|
"loss": 5.7599,
|
|
"mean_token_accuracy": 0.20047521889209746,
|
|
"num_tokens": 43340461.0,
|
|
"step": 17105
|
|
},
|
|
{
|
|
"entropy": 6.297940587997436,
|
|
"epoch": 1.9746105020196192,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004618528199148527,
|
|
"loss": 5.7534,
|
|
"mean_token_accuracy": 0.2036628544330597,
|
|
"num_tokens": 43352322.0,
|
|
"step": 17110
|
|
},
|
|
{
|
|
"entropy": 6.291927099227905,
|
|
"epoch": 1.9751875360646278,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.00046182982911335016,
|
|
"loss": 5.7743,
|
|
"mean_token_accuracy": 0.19787712693214415,
|
|
"num_tokens": 43366212.0,
|
|
"step": 17115
|
|
},
|
|
{
|
|
"entropy": 6.322417783737182,
|
|
"epoch": 1.9757645701096365,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00046180683202791905,
|
|
"loss": 5.8686,
|
|
"mean_token_accuracy": 0.19052491784095765,
|
|
"num_tokens": 43379123.0,
|
|
"step": 17120
|
|
},
|
|
{
|
|
"entropy": 6.338251638412475,
|
|
"epoch": 1.976341604154645,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.000461783828659333,
|
|
"loss": 5.8762,
|
|
"mean_token_accuracy": 0.18852563202381134,
|
|
"num_tokens": 43393188.0,
|
|
"step": 17125
|
|
},
|
|
{
|
|
"entropy": 6.377630805969238,
|
|
"epoch": 1.9769186381996537,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00046176081900836565,
|
|
"loss": 5.7829,
|
|
"mean_token_accuracy": 0.19455361515283584,
|
|
"num_tokens": 43407448.0,
|
|
"step": 17130
|
|
},
|
|
{
|
|
"entropy": 6.2423668384552,
|
|
"epoch": 1.9774956722446624,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00046173780307579086,
|
|
"loss": 5.7254,
|
|
"mean_token_accuracy": 0.19675862044095993,
|
|
"num_tokens": 43420202.0,
|
|
"step": 17135
|
|
},
|
|
{
|
|
"entropy": 6.218957424163818,
|
|
"epoch": 1.9780727062896712,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004617147808623829,
|
|
"loss": 5.7939,
|
|
"mean_token_accuracy": 0.18706247061491013,
|
|
"num_tokens": 43433218.0,
|
|
"step": 17140
|
|
},
|
|
{
|
|
"entropy": 6.2471057891845705,
|
|
"epoch": 1.9786497403346797,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00046169175236891605,
|
|
"loss": 5.7828,
|
|
"mean_token_accuracy": 0.19302263110876083,
|
|
"num_tokens": 43445721.0,
|
|
"step": 17145
|
|
},
|
|
{
|
|
"entropy": 6.32406005859375,
|
|
"epoch": 1.9792267743796885,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004616687175961648,
|
|
"loss": 5.7908,
|
|
"mean_token_accuracy": 0.19397074580192566,
|
|
"num_tokens": 43457470.0,
|
|
"step": 17150
|
|
},
|
|
{
|
|
"entropy": 6.276082611083984,
|
|
"epoch": 1.979803808424697,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004616456765449039,
|
|
"loss": 5.7838,
|
|
"mean_token_accuracy": 0.20368654876947404,
|
|
"num_tokens": 43470693.0,
|
|
"step": 17155
|
|
},
|
|
{
|
|
"entropy": 6.248766613006592,
|
|
"epoch": 1.9803808424697058,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00046162262921590845,
|
|
"loss": 5.8039,
|
|
"mean_token_accuracy": 0.19646263122558594,
|
|
"num_tokens": 43482890.0,
|
|
"step": 17160
|
|
},
|
|
{
|
|
"entropy": 6.372063541412354,
|
|
"epoch": 1.9809578765147142,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004615995756099535,
|
|
"loss": 5.8375,
|
|
"mean_token_accuracy": 0.18987953066825866,
|
|
"num_tokens": 43495444.0,
|
|
"step": 17165
|
|
},
|
|
{
|
|
"entropy": 6.262853002548217,
|
|
"epoch": 1.981534910559723,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004615765157278146,
|
|
"loss": 5.7935,
|
|
"mean_token_accuracy": 0.19052637368440628,
|
|
"num_tokens": 43507415.0,
|
|
"step": 17170
|
|
},
|
|
{
|
|
"entropy": 6.274124622344971,
|
|
"epoch": 1.9821119446047317,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00046155344957026726,
|
|
"loss": 5.813,
|
|
"mean_token_accuracy": 0.19190335720777513,
|
|
"num_tokens": 43520832.0,
|
|
"step": 17175
|
|
},
|
|
{
|
|
"entropy": 6.275217294692993,
|
|
"epoch": 1.9826889786497404,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004615303771380873,
|
|
"loss": 5.7534,
|
|
"mean_token_accuracy": 0.1979634016752243,
|
|
"num_tokens": 43534459.0,
|
|
"step": 17180
|
|
},
|
|
{
|
|
"entropy": 6.1655778884887695,
|
|
"epoch": 1.983266012694749,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00046150729843205077,
|
|
"loss": 5.5974,
|
|
"mean_token_accuracy": 0.20756071358919143,
|
|
"num_tokens": 43546466.0,
|
|
"step": 17185
|
|
},
|
|
{
|
|
"entropy": 6.217870903015137,
|
|
"epoch": 1.9838430467397576,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00046148421345293384,
|
|
"loss": 5.6775,
|
|
"mean_token_accuracy": 0.2055698052048683,
|
|
"num_tokens": 43558285.0,
|
|
"step": 17190
|
|
},
|
|
{
|
|
"entropy": 6.171381568908691,
|
|
"epoch": 1.9844200807847663,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004614611222015131,
|
|
"loss": 5.6587,
|
|
"mean_token_accuracy": 0.20381601601839067,
|
|
"num_tokens": 43572117.0,
|
|
"step": 17195
|
|
},
|
|
{
|
|
"entropy": 6.258411312103272,
|
|
"epoch": 1.984997114829775,
|
|
"grad_norm": 1.96875,
|
|
"learning_rate": 0.00046143802467856507,
|
|
"loss": 5.8139,
|
|
"mean_token_accuracy": 0.1962540939450264,
|
|
"num_tokens": 43586951.0,
|
|
"step": 17200
|
|
},
|
|
{
|
|
"entropy": 6.271241092681885,
|
|
"epoch": 1.9855741488747836,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046141492088486673,
|
|
"loss": 5.6846,
|
|
"mean_token_accuracy": 0.2100219815969467,
|
|
"num_tokens": 43600542.0,
|
|
"step": 17205
|
|
},
|
|
{
|
|
"entropy": 6.2649232864379885,
|
|
"epoch": 1.9861511829197922,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004613918108211951,
|
|
"loss": 5.78,
|
|
"mean_token_accuracy": 0.19840521961450577,
|
|
"num_tokens": 43612928.0,
|
|
"step": 17210
|
|
},
|
|
{
|
|
"entropy": 6.304554271697998,
|
|
"epoch": 1.986728216964801,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004613686944883275,
|
|
"loss": 5.7714,
|
|
"mean_token_accuracy": 0.1991189256310463,
|
|
"num_tokens": 43625362.0,
|
|
"step": 17215
|
|
},
|
|
{
|
|
"entropy": 6.205133724212646,
|
|
"epoch": 1.9873052510098095,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00046134557188704146,
|
|
"loss": 5.7749,
|
|
"mean_token_accuracy": 0.20026649087667464,
|
|
"num_tokens": 43638165.0,
|
|
"step": 17220
|
|
},
|
|
{
|
|
"entropy": 6.192930030822754,
|
|
"epoch": 1.9878822850548183,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00046132244301811466,
|
|
"loss": 5.7093,
|
|
"mean_token_accuracy": 0.19966957122087478,
|
|
"num_tokens": 43650688.0,
|
|
"step": 17225
|
|
},
|
|
{
|
|
"entropy": 6.329173803329468,
|
|
"epoch": 1.9884593190998268,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00046129930788232497,
|
|
"loss": 5.8168,
|
|
"mean_token_accuracy": 0.19335910826921462,
|
|
"num_tokens": 43663168.0,
|
|
"step": 17230
|
|
},
|
|
{
|
|
"entropy": 6.296715450286865,
|
|
"epoch": 1.9890363531448356,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00046127616648045073,
|
|
"loss": 5.7725,
|
|
"mean_token_accuracy": 0.1897001937031746,
|
|
"num_tokens": 43676391.0,
|
|
"step": 17235
|
|
},
|
|
{
|
|
"entropy": 6.32203950881958,
|
|
"epoch": 1.989613387189844,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00046125301881327007,
|
|
"loss": 5.7157,
|
|
"mean_token_accuracy": 0.20050082802772523,
|
|
"num_tokens": 43689631.0,
|
|
"step": 17240
|
|
},
|
|
{
|
|
"entropy": 6.231979131698608,
|
|
"epoch": 1.990190421234853,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00046122986488156167,
|
|
"loss": 5.7623,
|
|
"mean_token_accuracy": 0.1993554025888443,
|
|
"num_tokens": 43703176.0,
|
|
"step": 17245
|
|
},
|
|
{
|
|
"entropy": 6.319428777694702,
|
|
"epoch": 1.9907674552798615,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00046120670468610426,
|
|
"loss": 5.8701,
|
|
"mean_token_accuracy": 0.188443386554718,
|
|
"num_tokens": 43717439.0,
|
|
"step": 17250
|
|
},
|
|
{
|
|
"entropy": 6.282275867462158,
|
|
"epoch": 1.9913444893248702,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00046118353822767683,
|
|
"loss": 5.7261,
|
|
"mean_token_accuracy": 0.1940552920103073,
|
|
"num_tokens": 43730500.0,
|
|
"step": 17255
|
|
},
|
|
{
|
|
"entropy": 6.191128492355347,
|
|
"epoch": 1.9919215233698788,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004611603655070586,
|
|
"loss": 5.6687,
|
|
"mean_token_accuracy": 0.20141230076551436,
|
|
"num_tokens": 43744807.0,
|
|
"step": 17260
|
|
},
|
|
{
|
|
"entropy": 6.251776790618896,
|
|
"epoch": 1.9924985574148875,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00046113718652502896,
|
|
"loss": 5.7171,
|
|
"mean_token_accuracy": 0.20194613486528395,
|
|
"num_tokens": 43756748.0,
|
|
"step": 17265
|
|
},
|
|
{
|
|
"entropy": 6.261544942855835,
|
|
"epoch": 1.993075591459896,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004611140012823675,
|
|
"loss": 5.8213,
|
|
"mean_token_accuracy": 0.1938079223036766,
|
|
"num_tokens": 43769309.0,
|
|
"step": 17270
|
|
},
|
|
{
|
|
"entropy": 6.259779262542724,
|
|
"epoch": 1.9936526255049047,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046109080977985395,
|
|
"loss": 5.7859,
|
|
"mean_token_accuracy": 0.19742500483989717,
|
|
"num_tokens": 43781057.0,
|
|
"step": 17275
|
|
},
|
|
{
|
|
"entropy": 6.273036813735962,
|
|
"epoch": 1.9942296595499136,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00046106761201826854,
|
|
"loss": 5.7762,
|
|
"mean_token_accuracy": 0.1962513282895088,
|
|
"num_tokens": 43794504.0,
|
|
"step": 17280
|
|
},
|
|
{
|
|
"entropy": 6.09191312789917,
|
|
"epoch": 1.994806693594922,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00046104440799839145,
|
|
"loss": 5.5921,
|
|
"mean_token_accuracy": 0.21330432295799256,
|
|
"num_tokens": 43810214.0,
|
|
"step": 17285
|
|
},
|
|
{
|
|
"entropy": 6.263599395751953,
|
|
"epoch": 1.9953837276399309,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000461021197721003,
|
|
"loss": 5.7689,
|
|
"mean_token_accuracy": 0.19516006261110305,
|
|
"num_tokens": 43822197.0,
|
|
"step": 17290
|
|
},
|
|
{
|
|
"entropy": 6.319225835800171,
|
|
"epoch": 1.9959607616849393,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00046099798118688407,
|
|
"loss": 5.7714,
|
|
"mean_token_accuracy": 0.1970426231622696,
|
|
"num_tokens": 43835585.0,
|
|
"step": 17295
|
|
},
|
|
{
|
|
"entropy": 6.279296588897705,
|
|
"epoch": 1.9965377957299482,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004609747583968154,
|
|
"loss": 5.7179,
|
|
"mean_token_accuracy": 0.19605442583560945,
|
|
"num_tokens": 43848542.0,
|
|
"step": 17300
|
|
},
|
|
{
|
|
"entropy": 6.251367807388306,
|
|
"epoch": 1.9971148297749566,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004609515293515781,
|
|
"loss": 5.7954,
|
|
"mean_token_accuracy": 0.19522191137075423,
|
|
"num_tokens": 43860717.0,
|
|
"step": 17305
|
|
},
|
|
{
|
|
"entropy": 6.326177597045898,
|
|
"epoch": 1.9976918638199654,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004609282940519535,
|
|
"loss": 5.8277,
|
|
"mean_token_accuracy": 0.19656899571418762,
|
|
"num_tokens": 43873193.0,
|
|
"step": 17310
|
|
},
|
|
{
|
|
"entropy": 6.328842449188232,
|
|
"epoch": 1.998268897864974,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004609050524987231,
|
|
"loss": 5.8062,
|
|
"mean_token_accuracy": 0.1906093955039978,
|
|
"num_tokens": 43886241.0,
|
|
"step": 17315
|
|
},
|
|
{
|
|
"entropy": 6.262535762786865,
|
|
"epoch": 1.9988459319099827,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004608818046926686,
|
|
"loss": 5.7307,
|
|
"mean_token_accuracy": 0.2026408925652504,
|
|
"num_tokens": 43899429.0,
|
|
"step": 17320
|
|
},
|
|
{
|
|
"entropy": 6.2589469909667965,
|
|
"epoch": 1.9994229659549914,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004608585506345719,
|
|
"loss": 5.7517,
|
|
"mean_token_accuracy": 0.19680778086185455,
|
|
"num_tokens": 43913073.0,
|
|
"step": 17325
|
|
},
|
|
{
|
|
"entropy": 6.259429550170898,
|
|
"epoch": 2.0,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004608352903252152,
|
|
"loss": 5.7745,
|
|
"mean_token_accuracy": 0.19805550575256348,
|
|
"num_tokens": 43926234.0,
|
|
"step": 17330
|
|
},
|
|
{
|
|
"entropy": 6.2702301979064945,
|
|
"epoch": 2.000577034045009,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00046081202376538084,
|
|
"loss": 5.7334,
|
|
"mean_token_accuracy": 0.19711553305387497,
|
|
"num_tokens": 43937787.0,
|
|
"step": 17335
|
|
},
|
|
{
|
|
"entropy": 6.249440240859985,
|
|
"epoch": 2.0011540680900173,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004607887509558513,
|
|
"loss": 5.7267,
|
|
"mean_token_accuracy": 0.19739107191562652,
|
|
"num_tokens": 43951429.0,
|
|
"step": 17340
|
|
},
|
|
{
|
|
"entropy": 6.297765922546387,
|
|
"epoch": 2.001731102135026,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004607654718974094,
|
|
"loss": 5.7265,
|
|
"mean_token_accuracy": 0.20845312774181365,
|
|
"num_tokens": 43964257.0,
|
|
"step": 17345
|
|
},
|
|
{
|
|
"entropy": 6.3072456359863285,
|
|
"epoch": 2.0023081361800346,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004607421865908382,
|
|
"loss": 5.6704,
|
|
"mean_token_accuracy": 0.1962365910410881,
|
|
"num_tokens": 43975995.0,
|
|
"step": 17350
|
|
},
|
|
{
|
|
"entropy": 6.21532130241394,
|
|
"epoch": 2.0028851702250434,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004607188950369207,
|
|
"loss": 5.6302,
|
|
"mean_token_accuracy": 0.2015035480260849,
|
|
"num_tokens": 43989191.0,
|
|
"step": 17355
|
|
},
|
|
{
|
|
"entropy": 6.310169506072998,
|
|
"epoch": 2.003462204270052,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004606955972364405,
|
|
"loss": 5.741,
|
|
"mean_token_accuracy": 0.1927739202976227,
|
|
"num_tokens": 44000583.0,
|
|
"step": 17360
|
|
},
|
|
{
|
|
"entropy": 6.1655200004577635,
|
|
"epoch": 2.0040392383150607,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004606722931901812,
|
|
"loss": 5.5746,
|
|
"mean_token_accuracy": 0.213130159676075,
|
|
"num_tokens": 44013894.0,
|
|
"step": 17365
|
|
},
|
|
{
|
|
"entropy": 6.234589576721191,
|
|
"epoch": 2.004616272360069,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004606489828989264,
|
|
"loss": 5.6487,
|
|
"mean_token_accuracy": 0.20046643614768983,
|
|
"num_tokens": 44026701.0,
|
|
"step": 17370
|
|
},
|
|
{
|
|
"entropy": 6.233416175842285,
|
|
"epoch": 2.005193306405078,
|
|
"grad_norm": 2.890625,
|
|
"learning_rate": 0.0004606256663634604,
|
|
"loss": 5.7082,
|
|
"mean_token_accuracy": 0.2018497332930565,
|
|
"num_tokens": 44039775.0,
|
|
"step": 17375
|
|
},
|
|
{
|
|
"entropy": 6.285129690170288,
|
|
"epoch": 2.0057703404500864,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004606023435845672,
|
|
"loss": 5.7138,
|
|
"mean_token_accuracy": 0.19541945606470107,
|
|
"num_tokens": 44052352.0,
|
|
"step": 17380
|
|
},
|
|
{
|
|
"entropy": 6.250522422790527,
|
|
"epoch": 2.0063473744950953,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004605790145630314,
|
|
"loss": 5.6477,
|
|
"mean_token_accuracy": 0.20282730013132094,
|
|
"num_tokens": 44066147.0,
|
|
"step": 17385
|
|
},
|
|
{
|
|
"entropy": 6.255536270141602,
|
|
"epoch": 2.0069244085401037,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004605556792996377,
|
|
"loss": 5.6965,
|
|
"mean_token_accuracy": 0.19819739013910292,
|
|
"num_tokens": 44078692.0,
|
|
"step": 17390
|
|
},
|
|
{
|
|
"entropy": 6.340232467651367,
|
|
"epoch": 2.0075014425851125,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004605323377951709,
|
|
"loss": 5.7362,
|
|
"mean_token_accuracy": 0.19044993668794633,
|
|
"num_tokens": 44091511.0,
|
|
"step": 17395
|
|
},
|
|
{
|
|
"entropy": 6.270852994918823,
|
|
"epoch": 2.008078476630121,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000460508990050416,
|
|
"loss": 5.6915,
|
|
"mean_token_accuracy": 0.195805923640728,
|
|
"num_tokens": 44103423.0,
|
|
"step": 17400
|
|
},
|
|
{
|
|
"entropy": 6.149043035507202,
|
|
"epoch": 2.00865551067513,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004604856360661584,
|
|
"loss": 5.5513,
|
|
"mean_token_accuracy": 0.2083790898323059,
|
|
"num_tokens": 44116024.0,
|
|
"step": 17405
|
|
},
|
|
{
|
|
"entropy": 6.153539705276489,
|
|
"epoch": 2.0092325447201387,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004604622758431835,
|
|
"loss": 5.624,
|
|
"mean_token_accuracy": 0.20394142121076583,
|
|
"num_tokens": 44128595.0,
|
|
"step": 17410
|
|
},
|
|
{
|
|
"entropy": 6.3305881977081295,
|
|
"epoch": 2.009809578765147,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00046043890938227724,
|
|
"loss": 5.7351,
|
|
"mean_token_accuracy": 0.19998015761375426,
|
|
"num_tokens": 44140104.0,
|
|
"step": 17415
|
|
},
|
|
{
|
|
"entropy": 6.2825438499450685,
|
|
"epoch": 2.010386612810156,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00046041553668422526,
|
|
"loss": 5.6918,
|
|
"mean_token_accuracy": 0.2034749060869217,
|
|
"num_tokens": 44152681.0,
|
|
"step": 17420
|
|
},
|
|
{
|
|
"entropy": 6.181905794143677,
|
|
"epoch": 2.0109636468551644,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046039215774981376,
|
|
"loss": 5.665,
|
|
"mean_token_accuracy": 0.2073669031262398,
|
|
"num_tokens": 44165728.0,
|
|
"step": 17425
|
|
},
|
|
{
|
|
"entropy": 6.301576805114746,
|
|
"epoch": 2.0115406809001732,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00046036877257982917,
|
|
"loss": 5.7453,
|
|
"mean_token_accuracy": 0.19096045196056366,
|
|
"num_tokens": 44178182.0,
|
|
"step": 17430
|
|
},
|
|
{
|
|
"entropy": 6.300556945800781,
|
|
"epoch": 2.0121177149451817,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.000460345381175058,
|
|
"loss": 5.6624,
|
|
"mean_token_accuracy": 0.20269179046154023,
|
|
"num_tokens": 44190954.0,
|
|
"step": 17435
|
|
},
|
|
{
|
|
"entropy": 6.262827301025391,
|
|
"epoch": 2.0126947489901905,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.000460321983536287,
|
|
"loss": 5.6572,
|
|
"mean_token_accuracy": 0.20790137648582457,
|
|
"num_tokens": 44204123.0,
|
|
"step": 17440
|
|
},
|
|
{
|
|
"entropy": 6.1826049327850345,
|
|
"epoch": 2.013271783035199,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00046029857966430315,
|
|
"loss": 5.6442,
|
|
"mean_token_accuracy": 0.2049027442932129,
|
|
"num_tokens": 44218656.0,
|
|
"step": 17445
|
|
},
|
|
{
|
|
"entropy": 6.227021884918213,
|
|
"epoch": 2.013848817080208,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00046027516955989364,
|
|
"loss": 5.6779,
|
|
"mean_token_accuracy": 0.20515901893377303,
|
|
"num_tokens": 44231191.0,
|
|
"step": 17450
|
|
},
|
|
{
|
|
"entropy": 6.304461097717285,
|
|
"epoch": 2.014425851125216,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00046025175322384577,
|
|
"loss": 5.695,
|
|
"mean_token_accuracy": 0.2019312486052513,
|
|
"num_tokens": 44244564.0,
|
|
"step": 17455
|
|
},
|
|
{
|
|
"entropy": 6.298606538772583,
|
|
"epoch": 2.015002885170225,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00046022833065694727,
|
|
"loss": 5.7057,
|
|
"mean_token_accuracy": 0.20222496688365937,
|
|
"num_tokens": 44257545.0,
|
|
"step": 17460
|
|
},
|
|
{
|
|
"entropy": 6.224299478530884,
|
|
"epoch": 2.0155799192152335,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00046020490185998575,
|
|
"loss": 5.6246,
|
|
"mean_token_accuracy": 0.20759887993335724,
|
|
"num_tokens": 44270416.0,
|
|
"step": 17465
|
|
},
|
|
{
|
|
"entropy": 6.2018883228302,
|
|
"epoch": 2.0161569532602424,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004601814668337495,
|
|
"loss": 5.6589,
|
|
"mean_token_accuracy": 0.20551549792289733,
|
|
"num_tokens": 44283366.0,
|
|
"step": 17470
|
|
},
|
|
{
|
|
"entropy": 6.226172876358032,
|
|
"epoch": 2.016733987305251,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00046015802557902654,
|
|
"loss": 5.7103,
|
|
"mean_token_accuracy": 0.19451249092817308,
|
|
"num_tokens": 44296079.0,
|
|
"step": 17475
|
|
},
|
|
{
|
|
"entropy": 6.285435914993286,
|
|
"epoch": 2.0173110213502596,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00046013457809660537,
|
|
"loss": 5.6955,
|
|
"mean_token_accuracy": 0.1941556990146637,
|
|
"num_tokens": 44308409.0,
|
|
"step": 17480
|
|
},
|
|
{
|
|
"entropy": 6.292135524749756,
|
|
"epoch": 2.0178880553952685,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00046011112438727454,
|
|
"loss": 5.7379,
|
|
"mean_token_accuracy": 0.19877717196941375,
|
|
"num_tokens": 44321826.0,
|
|
"step": 17485
|
|
},
|
|
{
|
|
"entropy": 6.256671524047851,
|
|
"epoch": 2.018465089440277,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004600876644518231,
|
|
"loss": 5.7023,
|
|
"mean_token_accuracy": 0.198341403901577,
|
|
"num_tokens": 44335630.0,
|
|
"step": 17490
|
|
},
|
|
{
|
|
"entropy": 6.040377807617188,
|
|
"epoch": 2.0190421234852858,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00046006419829104,
|
|
"loss": 5.4867,
|
|
"mean_token_accuracy": 0.2133197918534279,
|
|
"num_tokens": 44349059.0,
|
|
"step": 17495
|
|
},
|
|
{
|
|
"entropy": 6.241903305053711,
|
|
"epoch": 2.019619157530294,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004600407259057145,
|
|
"loss": 5.5888,
|
|
"mean_token_accuracy": 0.2037927582859993,
|
|
"num_tokens": 44361908.0,
|
|
"step": 17500
|
|
},
|
|
{
|
|
"entropy": 6.257413721084594,
|
|
"epoch": 2.020196191575303,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004600172472966361,
|
|
"loss": 5.7417,
|
|
"mean_token_accuracy": 0.18895848095417023,
|
|
"num_tokens": 44375487.0,
|
|
"step": 17505
|
|
},
|
|
{
|
|
"entropy": 6.220084714889526,
|
|
"epoch": 2.0207732256203115,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00045999376246459446,
|
|
"loss": 5.642,
|
|
"mean_token_accuracy": 0.20260559767484665,
|
|
"num_tokens": 44387881.0,
|
|
"step": 17510
|
|
},
|
|
{
|
|
"entropy": 6.247606992721558,
|
|
"epoch": 2.0213502596653203,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004599702714103795,
|
|
"loss": 5.6491,
|
|
"mean_token_accuracy": 0.1996355265378952,
|
|
"num_tokens": 44400609.0,
|
|
"step": 17515
|
|
},
|
|
{
|
|
"entropy": 6.159318733215332,
|
|
"epoch": 2.0219272937103288,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004599467741347814,
|
|
"loss": 5.599,
|
|
"mean_token_accuracy": 0.2111167222261429,
|
|
"num_tokens": 44413341.0,
|
|
"step": 17520
|
|
},
|
|
{
|
|
"entropy": 6.272531366348266,
|
|
"epoch": 2.0225043277553376,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004599232706385904,
|
|
"loss": 5.7392,
|
|
"mean_token_accuracy": 0.20063333660364152,
|
|
"num_tokens": 44425790.0,
|
|
"step": 17525
|
|
},
|
|
{
|
|
"entropy": 6.1971056938171385,
|
|
"epoch": 2.023081361800346,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.000459899760922597,
|
|
"loss": 5.6528,
|
|
"mean_token_accuracy": 0.20446180999279023,
|
|
"num_tokens": 44438204.0,
|
|
"step": 17530
|
|
},
|
|
{
|
|
"entropy": 6.2362587451934814,
|
|
"epoch": 2.023658395845355,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004598762449875921,
|
|
"loss": 5.6295,
|
|
"mean_token_accuracy": 0.2001257747411728,
|
|
"num_tokens": 44450717.0,
|
|
"step": 17535
|
|
},
|
|
{
|
|
"entropy": 6.257264757156372,
|
|
"epoch": 2.0242354298903633,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004598527228343665,
|
|
"loss": 5.6385,
|
|
"mean_token_accuracy": 0.20419044196605682,
|
|
"num_tokens": 44463391.0,
|
|
"step": 17540
|
|
},
|
|
{
|
|
"entropy": 6.196162414550781,
|
|
"epoch": 2.024812463935372,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004598291944637112,
|
|
"loss": 5.6029,
|
|
"mean_token_accuracy": 0.2064843252301216,
|
|
"num_tokens": 44477022.0,
|
|
"step": 17545
|
|
},
|
|
{
|
|
"entropy": 6.270995855331421,
|
|
"epoch": 2.025389497980381,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00045980565987641797,
|
|
"loss": 5.7092,
|
|
"mean_token_accuracy": 0.19913180619478227,
|
|
"num_tokens": 44490616.0,
|
|
"step": 17550
|
|
},
|
|
{
|
|
"entropy": 6.2656354904174805,
|
|
"epoch": 2.0259665320253895,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00045978211907327804,
|
|
"loss": 5.7152,
|
|
"mean_token_accuracy": 0.19898659586906434,
|
|
"num_tokens": 44503307.0,
|
|
"step": 17555
|
|
},
|
|
{
|
|
"entropy": 6.278667783737182,
|
|
"epoch": 2.0265435660703983,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004597585720550834,
|
|
"loss": 5.6925,
|
|
"mean_token_accuracy": 0.20318609178066255,
|
|
"num_tokens": 44516078.0,
|
|
"step": 17560
|
|
},
|
|
{
|
|
"entropy": 6.279894495010376,
|
|
"epoch": 2.0271206001154067,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.000459735018822626,
|
|
"loss": 5.6674,
|
|
"mean_token_accuracy": 0.20145113617181779,
|
|
"num_tokens": 44528485.0,
|
|
"step": 17565
|
|
},
|
|
{
|
|
"entropy": 6.2945067405700685,
|
|
"epoch": 2.0276976341604156,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00045971145937669794,
|
|
"loss": 5.6317,
|
|
"mean_token_accuracy": 0.20258528739213943,
|
|
"num_tokens": 44539946.0,
|
|
"step": 17570
|
|
},
|
|
{
|
|
"entropy": 6.19449815750122,
|
|
"epoch": 2.028274668205424,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004596878937180917,
|
|
"loss": 5.6912,
|
|
"mean_token_accuracy": 0.19609050452709198,
|
|
"num_tokens": 44552828.0,
|
|
"step": 17575
|
|
},
|
|
{
|
|
"entropy": 6.280514240264893,
|
|
"epoch": 2.028851702250433,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004596643218475999,
|
|
"loss": 5.7072,
|
|
"mean_token_accuracy": 0.20018178075551987,
|
|
"num_tokens": 44564930.0,
|
|
"step": 17580
|
|
},
|
|
{
|
|
"entropy": 6.261544609069825,
|
|
"epoch": 2.0294287362954413,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00045964074376601534,
|
|
"loss": 5.703,
|
|
"mean_token_accuracy": 0.19716645330190657,
|
|
"num_tokens": 44578226.0,
|
|
"step": 17585
|
|
},
|
|
{
|
|
"entropy": 6.227256774902344,
|
|
"epoch": 2.03000577034045,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00045961715947413106,
|
|
"loss": 5.6875,
|
|
"mean_token_accuracy": 0.20446657538414,
|
|
"num_tokens": 44590704.0,
|
|
"step": 17590
|
|
},
|
|
{
|
|
"entropy": 6.264931344985962,
|
|
"epoch": 2.0305828043854586,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004595935689727404,
|
|
"loss": 5.6814,
|
|
"mean_token_accuracy": 0.20432521104812623,
|
|
"num_tokens": 44602758.0,
|
|
"step": 17595
|
|
},
|
|
{
|
|
"entropy": 6.119540214538574,
|
|
"epoch": 2.0311598384304674,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004595699722626367,
|
|
"loss": 5.6584,
|
|
"mean_token_accuracy": 0.20234377831220626,
|
|
"num_tokens": 44614733.0,
|
|
"step": 17600
|
|
},
|
|
{
|
|
"entropy": 6.288922500610352,
|
|
"epoch": 2.031736872475476,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00045954636934461367,
|
|
"loss": 5.7345,
|
|
"mean_token_accuracy": 0.19667449444532395,
|
|
"num_tokens": 44628339.0,
|
|
"step": 17605
|
|
},
|
|
{
|
|
"entropy": 6.261105537414551,
|
|
"epoch": 2.0323139065204847,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004595227602194652,
|
|
"loss": 5.6611,
|
|
"mean_token_accuracy": 0.2022185817360878,
|
|
"num_tokens": 44641382.0,
|
|
"step": 17610
|
|
},
|
|
{
|
|
"entropy": 6.185283756256103,
|
|
"epoch": 2.0328909405654936,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004594991448879853,
|
|
"loss": 5.6176,
|
|
"mean_token_accuracy": 0.2082076221704483,
|
|
"num_tokens": 44654618.0,
|
|
"step": 17615
|
|
},
|
|
{
|
|
"entropy": 6.333975410461425,
|
|
"epoch": 2.033467974610502,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004594755233509683,
|
|
"loss": 5.7901,
|
|
"mean_token_accuracy": 0.18755829632282256,
|
|
"num_tokens": 44667961.0,
|
|
"step": 17620
|
|
},
|
|
{
|
|
"entropy": 6.243668031692505,
|
|
"epoch": 2.034045008655511,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00045945189560920875,
|
|
"loss": 5.6792,
|
|
"mean_token_accuracy": 0.19908062219619752,
|
|
"num_tokens": 44682185.0,
|
|
"step": 17625
|
|
},
|
|
{
|
|
"entropy": 6.279232978820801,
|
|
"epoch": 2.0346220427005193,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004594282616635013,
|
|
"loss": 5.7007,
|
|
"mean_token_accuracy": 0.20215352922677993,
|
|
"num_tokens": 44695513.0,
|
|
"step": 17630
|
|
},
|
|
{
|
|
"entropy": 6.235209274291992,
|
|
"epoch": 2.035199076745528,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004594046215146409,
|
|
"loss": 5.7065,
|
|
"mean_token_accuracy": 0.2029103457927704,
|
|
"num_tokens": 44707051.0,
|
|
"step": 17635
|
|
},
|
|
{
|
|
"entropy": 6.230711984634399,
|
|
"epoch": 2.0357761107905366,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00045938097516342257,
|
|
"loss": 5.6739,
|
|
"mean_token_accuracy": 0.2068231835961342,
|
|
"num_tokens": 44719915.0,
|
|
"step": 17640
|
|
},
|
|
{
|
|
"entropy": 6.116800594329834,
|
|
"epoch": 2.0363531448355454,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00045935732261064184,
|
|
"loss": 5.57,
|
|
"mean_token_accuracy": 0.21224127411842347,
|
|
"num_tokens": 44733115.0,
|
|
"step": 17645
|
|
},
|
|
{
|
|
"entropy": 6.2326884269714355,
|
|
"epoch": 2.036930178880554,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00045933366385709405,
|
|
"loss": 5.7019,
|
|
"mean_token_accuracy": 0.20067428946495056,
|
|
"num_tokens": 44744480.0,
|
|
"step": 17650
|
|
},
|
|
{
|
|
"entropy": 6.285044431686401,
|
|
"epoch": 2.0375072129255627,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004593099989035751,
|
|
"loss": 5.7403,
|
|
"mean_token_accuracy": 0.1993875503540039,
|
|
"num_tokens": 44758200.0,
|
|
"step": 17655
|
|
},
|
|
{
|
|
"entropy": 6.3262560844421385,
|
|
"epoch": 2.038084246970571,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004592863277508809,
|
|
"loss": 5.7758,
|
|
"mean_token_accuracy": 0.1939818263053894,
|
|
"num_tokens": 44771407.0,
|
|
"step": 17660
|
|
},
|
|
{
|
|
"entropy": 6.25794620513916,
|
|
"epoch": 2.03866128101558,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004592626503998076,
|
|
"loss": 5.6232,
|
|
"mean_token_accuracy": 0.20941001623868943,
|
|
"num_tokens": 44783765.0,
|
|
"step": 17665
|
|
},
|
|
{
|
|
"entropy": 6.296916103363037,
|
|
"epoch": 2.0392383150605884,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004592389668511515,
|
|
"loss": 5.7197,
|
|
"mean_token_accuracy": 0.20150339752435684,
|
|
"num_tokens": 44796550.0,
|
|
"step": 17670
|
|
},
|
|
{
|
|
"entropy": 6.217992353439331,
|
|
"epoch": 2.0398153491055973,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004592152771057093,
|
|
"loss": 5.7022,
|
|
"mean_token_accuracy": 0.2003367841243744,
|
|
"num_tokens": 44808802.0,
|
|
"step": 17675
|
|
},
|
|
{
|
|
"entropy": 6.215272855758667,
|
|
"epoch": 2.0403923831506057,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00045919158116427785,
|
|
"loss": 5.638,
|
|
"mean_token_accuracy": 0.20298593789339064,
|
|
"num_tokens": 44821023.0,
|
|
"step": 17680
|
|
},
|
|
{
|
|
"entropy": 6.254412078857422,
|
|
"epoch": 2.0409694171956145,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00045916787902765396,
|
|
"loss": 5.6491,
|
|
"mean_token_accuracy": 0.19988745003938674,
|
|
"num_tokens": 44833822.0,
|
|
"step": 17685
|
|
},
|
|
{
|
|
"entropy": 6.23627610206604,
|
|
"epoch": 2.0415464512406234,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004591441706966349,
|
|
"loss": 5.6825,
|
|
"mean_token_accuracy": 0.1998839184641838,
|
|
"num_tokens": 44846440.0,
|
|
"step": 17690
|
|
},
|
|
{
|
|
"entropy": 6.276790714263916,
|
|
"epoch": 2.042123485285632,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004591204561720183,
|
|
"loss": 5.6926,
|
|
"mean_token_accuracy": 0.19255058020353316,
|
|
"num_tokens": 44858257.0,
|
|
"step": 17695
|
|
},
|
|
{
|
|
"entropy": 6.261844110488892,
|
|
"epoch": 2.0427005193306407,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004590967354546015,
|
|
"loss": 5.7283,
|
|
"mean_token_accuracy": 0.1950898662209511,
|
|
"num_tokens": 44871339.0,
|
|
"step": 17700
|
|
},
|
|
{
|
|
"entropy": 6.237417697906494,
|
|
"epoch": 2.043277553375649,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004590730085451824,
|
|
"loss": 5.6583,
|
|
"mean_token_accuracy": 0.2076822802424431,
|
|
"num_tokens": 44884190.0,
|
|
"step": 17705
|
|
},
|
|
{
|
|
"entropy": 6.1819751262664795,
|
|
"epoch": 2.043854587420658,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00045904927544455914,
|
|
"loss": 5.5837,
|
|
"mean_token_accuracy": 0.20263769328594208,
|
|
"num_tokens": 44897530.0,
|
|
"step": 17710
|
|
},
|
|
{
|
|
"entropy": 6.191201496124267,
|
|
"epoch": 2.0444316214656664,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00045902553615353005,
|
|
"loss": 5.564,
|
|
"mean_token_accuracy": 0.21978026032447814,
|
|
"num_tokens": 44910428.0,
|
|
"step": 17715
|
|
},
|
|
{
|
|
"entropy": 6.256063032150268,
|
|
"epoch": 2.0450086555106752,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004590017906728933,
|
|
"loss": 5.6913,
|
|
"mean_token_accuracy": 0.19929961115121841,
|
|
"num_tokens": 44922904.0,
|
|
"step": 17720
|
|
},
|
|
{
|
|
"entropy": 6.164769124984741,
|
|
"epoch": 2.0455856895556837,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045897803900344774,
|
|
"loss": 5.5864,
|
|
"mean_token_accuracy": 0.20878782421350478,
|
|
"num_tokens": 44935541.0,
|
|
"step": 17725
|
|
},
|
|
{
|
|
"entropy": 6.212556028366089,
|
|
"epoch": 2.0461627236006925,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004589542811459923,
|
|
"loss": 5.6593,
|
|
"mean_token_accuracy": 0.2079017162322998,
|
|
"num_tokens": 44948483.0,
|
|
"step": 17730
|
|
},
|
|
{
|
|
"entropy": 6.228823947906494,
|
|
"epoch": 2.046739757645701,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004589305171013259,
|
|
"loss": 5.6415,
|
|
"mean_token_accuracy": 0.2076267421245575,
|
|
"num_tokens": 44961797.0,
|
|
"step": 17735
|
|
},
|
|
{
|
|
"entropy": 6.2405421257019045,
|
|
"epoch": 2.04731679169071,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000458906746870248,
|
|
"loss": 5.6364,
|
|
"mean_token_accuracy": 0.20770105421543122,
|
|
"num_tokens": 44975426.0,
|
|
"step": 17740
|
|
},
|
|
{
|
|
"entropy": 6.236284351348877,
|
|
"epoch": 2.047893825735718,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.000458882970453558,
|
|
"loss": 5.6621,
|
|
"mean_token_accuracy": 0.20310534834861754,
|
|
"num_tokens": 44988272.0,
|
|
"step": 17745
|
|
},
|
|
{
|
|
"entropy": 6.204120826721192,
|
|
"epoch": 2.048470859780727,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004588591878520556,
|
|
"loss": 5.6221,
|
|
"mean_token_accuracy": 0.2064763769507408,
|
|
"num_tokens": 45000609.0,
|
|
"step": 17750
|
|
},
|
|
{
|
|
"entropy": 6.364516687393189,
|
|
"epoch": 2.049047893825736,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004588353990665407,
|
|
"loss": 5.7849,
|
|
"mean_token_accuracy": 0.1859120637178421,
|
|
"num_tokens": 45012651.0,
|
|
"step": 17755
|
|
},
|
|
{
|
|
"entropy": 6.253702116012573,
|
|
"epoch": 2.0496249278707444,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004588116040978136,
|
|
"loss": 5.727,
|
|
"mean_token_accuracy": 0.20087929517030717,
|
|
"num_tokens": 45025237.0,
|
|
"step": 17760
|
|
},
|
|
{
|
|
"entropy": 6.250041151046753,
|
|
"epoch": 2.050201961915753,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00045878780294667437,
|
|
"loss": 5.7408,
|
|
"mean_token_accuracy": 0.1949314743280411,
|
|
"num_tokens": 45038329.0,
|
|
"step": 17765
|
|
},
|
|
{
|
|
"entropy": 6.277400636672974,
|
|
"epoch": 2.0507789959607616,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004587639956139237,
|
|
"loss": 5.6204,
|
|
"mean_token_accuracy": 0.2077370211482048,
|
|
"num_tokens": 45050251.0,
|
|
"step": 17770
|
|
},
|
|
{
|
|
"entropy": 6.254482460021973,
|
|
"epoch": 2.0513560300057705,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004587401821003624,
|
|
"loss": 5.7033,
|
|
"mean_token_accuracy": 0.1997854605317116,
|
|
"num_tokens": 45062701.0,
|
|
"step": 17775
|
|
},
|
|
{
|
|
"entropy": 6.180520868301391,
|
|
"epoch": 2.051933064050779,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00045871636240679133,
|
|
"loss": 5.6361,
|
|
"mean_token_accuracy": 0.21148186773061753,
|
|
"num_tokens": 45077059.0,
|
|
"step": 17780
|
|
},
|
|
{
|
|
"entropy": 6.262282276153565,
|
|
"epoch": 2.0525100980957878,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004586925365340117,
|
|
"loss": 5.6733,
|
|
"mean_token_accuracy": 0.1936696618795395,
|
|
"num_tokens": 45089571.0,
|
|
"step": 17785
|
|
},
|
|
{
|
|
"entropy": 6.203660869598389,
|
|
"epoch": 2.053087132140796,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004586687044828247,
|
|
"loss": 5.6444,
|
|
"mean_token_accuracy": 0.20130022913217543,
|
|
"num_tokens": 45101085.0,
|
|
"step": 17790
|
|
},
|
|
{
|
|
"entropy": 6.230860996246338,
|
|
"epoch": 2.053664166185805,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004586448662540322,
|
|
"loss": 5.7041,
|
|
"mean_token_accuracy": 0.19646845906972885,
|
|
"num_tokens": 45113844.0,
|
|
"step": 17795
|
|
},
|
|
{
|
|
"entropy": 6.234907388687134,
|
|
"epoch": 2.0542412002308135,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004586210218484358,
|
|
"loss": 5.7351,
|
|
"mean_token_accuracy": 0.19803052842617036,
|
|
"num_tokens": 45126297.0,
|
|
"step": 17800
|
|
},
|
|
{
|
|
"entropy": 6.268433570861816,
|
|
"epoch": 2.0548182342758223,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00045859717126683745,
|
|
"loss": 5.5848,
|
|
"mean_token_accuracy": 0.2124189928174019,
|
|
"num_tokens": 45139337.0,
|
|
"step": 17805
|
|
},
|
|
{
|
|
"entropy": 6.254764461517334,
|
|
"epoch": 2.0553952683208307,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00045857331451003953,
|
|
"loss": 5.7644,
|
|
"mean_token_accuracy": 0.18940299451351167,
|
|
"num_tokens": 45151698.0,
|
|
"step": 17810
|
|
},
|
|
{
|
|
"entropy": 6.168803453445435,
|
|
"epoch": 2.0559723023658396,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00045854945157884435,
|
|
"loss": 5.6336,
|
|
"mean_token_accuracy": 0.20379126965999603,
|
|
"num_tokens": 45164615.0,
|
|
"step": 17815
|
|
},
|
|
{
|
|
"entropy": 6.227227401733399,
|
|
"epoch": 2.056549336410848,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00045852558247405455,
|
|
"loss": 5.6802,
|
|
"mean_token_accuracy": 0.2069242015480995,
|
|
"num_tokens": 45176630.0,
|
|
"step": 17820
|
|
},
|
|
{
|
|
"entropy": 6.247831106185913,
|
|
"epoch": 2.057126370455857,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00045850170719647287,
|
|
"loss": 5.6404,
|
|
"mean_token_accuracy": 0.20814504474401474,
|
|
"num_tokens": 45188879.0,
|
|
"step": 17825
|
|
},
|
|
{
|
|
"entropy": 6.256878614425659,
|
|
"epoch": 2.0577034045008658,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00045847782574690254,
|
|
"loss": 5.6535,
|
|
"mean_token_accuracy": 0.20146367996931075,
|
|
"num_tokens": 45201694.0,
|
|
"step": 17830
|
|
},
|
|
{
|
|
"entropy": 6.211376094818116,
|
|
"epoch": 2.058280438545874,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00045845393812614664,
|
|
"loss": 5.6302,
|
|
"mean_token_accuracy": 0.19902247041463852,
|
|
"num_tokens": 45215873.0,
|
|
"step": 17835
|
|
},
|
|
{
|
|
"entropy": 6.303824377059937,
|
|
"epoch": 2.058857472590883,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004584300443350086,
|
|
"loss": 5.6714,
|
|
"mean_token_accuracy": 0.20408975183963776,
|
|
"num_tokens": 45229660.0,
|
|
"step": 17840
|
|
},
|
|
{
|
|
"entropy": 6.2332484245300295,
|
|
"epoch": 2.0594345066358914,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004584061443742922,
|
|
"loss": 5.6223,
|
|
"mean_token_accuracy": 0.19964006692171096,
|
|
"num_tokens": 45243257.0,
|
|
"step": 17845
|
|
},
|
|
{
|
|
"entropy": 6.192412042617798,
|
|
"epoch": 2.0600115406809003,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00045838223824480124,
|
|
"loss": 5.6241,
|
|
"mean_token_accuracy": 0.20478377789258956,
|
|
"num_tokens": 45256212.0,
|
|
"step": 17850
|
|
},
|
|
{
|
|
"entropy": 6.274218940734864,
|
|
"epoch": 2.0605885747259087,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004583583259473397,
|
|
"loss": 5.6856,
|
|
"mean_token_accuracy": 0.2076691582798958,
|
|
"num_tokens": 45268292.0,
|
|
"step": 17855
|
|
},
|
|
{
|
|
"entropy": 6.105169582366943,
|
|
"epoch": 2.0611656087709176,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00045833440748271203,
|
|
"loss": 5.5239,
|
|
"mean_token_accuracy": 0.22912171930074693,
|
|
"num_tokens": 45284112.0,
|
|
"step": 17860
|
|
},
|
|
{
|
|
"entropy": 6.246973180770874,
|
|
"epoch": 2.061742642815926,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00045831048285172266,
|
|
"loss": 5.6515,
|
|
"mean_token_accuracy": 0.20367234200239182,
|
|
"num_tokens": 45295839.0,
|
|
"step": 17865
|
|
},
|
|
{
|
|
"entropy": 6.171870565414428,
|
|
"epoch": 2.062319676860935,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004582865520551762,
|
|
"loss": 5.6701,
|
|
"mean_token_accuracy": 0.19572561234235764,
|
|
"num_tokens": 45309142.0,
|
|
"step": 17870
|
|
},
|
|
{
|
|
"entropy": 6.244421911239624,
|
|
"epoch": 2.0628967109059433,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00045826261509387755,
|
|
"loss": 5.6564,
|
|
"mean_token_accuracy": 0.21014538258314133,
|
|
"num_tokens": 45322096.0,
|
|
"step": 17875
|
|
},
|
|
{
|
|
"entropy": 6.287837028503418,
|
|
"epoch": 2.063473744950952,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00045823867196863197,
|
|
"loss": 5.7293,
|
|
"mean_token_accuracy": 0.20398633629083635,
|
|
"num_tokens": 45333685.0,
|
|
"step": 17880
|
|
},
|
|
{
|
|
"entropy": 6.210242366790771,
|
|
"epoch": 2.0640507789959606,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004582147226802446,
|
|
"loss": 5.6763,
|
|
"mean_token_accuracy": 0.20469199120998383,
|
|
"num_tokens": 45345417.0,
|
|
"step": 17885
|
|
},
|
|
{
|
|
"entropy": 6.220725202560425,
|
|
"epoch": 2.0646278130409694,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004581907672295211,
|
|
"loss": 5.7159,
|
|
"mean_token_accuracy": 0.19976982325315476,
|
|
"num_tokens": 45357156.0,
|
|
"step": 17890
|
|
},
|
|
{
|
|
"entropy": 6.291027307510376,
|
|
"epoch": 2.065204847085978,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00045816680561726716,
|
|
"loss": 5.6847,
|
|
"mean_token_accuracy": 0.1986474186182022,
|
|
"num_tokens": 45369627.0,
|
|
"step": 17895
|
|
},
|
|
{
|
|
"entropy": 6.234702730178833,
|
|
"epoch": 2.0657818811309867,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004581428378442886,
|
|
"loss": 5.6624,
|
|
"mean_token_accuracy": 0.19629377871751785,
|
|
"num_tokens": 45380603.0,
|
|
"step": 17900
|
|
},
|
|
{
|
|
"entropy": 6.188916254043579,
|
|
"epoch": 2.0663589151759956,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00045811886391139173,
|
|
"loss": 5.6211,
|
|
"mean_token_accuracy": 0.21858908087015153,
|
|
"num_tokens": 45394923.0,
|
|
"step": 17905
|
|
},
|
|
{
|
|
"entropy": 6.277084445953369,
|
|
"epoch": 2.066935949221004,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00045809488381938284,
|
|
"loss": 5.6794,
|
|
"mean_token_accuracy": 0.19687334448099136,
|
|
"num_tokens": 45407351.0,
|
|
"step": 17910
|
|
},
|
|
{
|
|
"entropy": 6.161598968505859,
|
|
"epoch": 2.067512983266013,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004580708975690684,
|
|
"loss": 5.6493,
|
|
"mean_token_accuracy": 0.20021425932645798,
|
|
"num_tokens": 45420783.0,
|
|
"step": 17915
|
|
},
|
|
{
|
|
"entropy": 6.197072887420655,
|
|
"epoch": 2.0680900173110213,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004580469051612554,
|
|
"loss": 5.5548,
|
|
"mean_token_accuracy": 0.2188750311732292,
|
|
"num_tokens": 45433208.0,
|
|
"step": 17920
|
|
},
|
|
{
|
|
"entropy": 6.294715929031372,
|
|
"epoch": 2.06866705135603,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00045802290659675057,
|
|
"loss": 5.8009,
|
|
"mean_token_accuracy": 0.18830355405807495,
|
|
"num_tokens": 45445872.0,
|
|
"step": 17925
|
|
},
|
|
{
|
|
"entropy": 6.255209302902221,
|
|
"epoch": 2.0692440854010385,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00045799890187636123,
|
|
"loss": 5.6859,
|
|
"mean_token_accuracy": 0.20325401276350022,
|
|
"num_tokens": 45458844.0,
|
|
"step": 17930
|
|
},
|
|
{
|
|
"entropy": 6.223239803314209,
|
|
"epoch": 2.0698211194460474,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00045797489100089464,
|
|
"loss": 5.6922,
|
|
"mean_token_accuracy": 0.2008743941783905,
|
|
"num_tokens": 45471919.0,
|
|
"step": 17935
|
|
},
|
|
{
|
|
"entropy": 6.23684606552124,
|
|
"epoch": 2.070398153491056,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004579508739711585,
|
|
"loss": 5.6973,
|
|
"mean_token_accuracy": 0.20341706275939941,
|
|
"num_tokens": 45483769.0,
|
|
"step": 17940
|
|
},
|
|
{
|
|
"entropy": 6.298162937164307,
|
|
"epoch": 2.0709751875360647,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00045792685078796075,
|
|
"loss": 5.7812,
|
|
"mean_token_accuracy": 0.19754380136728286,
|
|
"num_tokens": 45497077.0,
|
|
"step": 17945
|
|
},
|
|
{
|
|
"entropy": 6.258854103088379,
|
|
"epoch": 2.071552221581073,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000457902821452109,
|
|
"loss": 5.7308,
|
|
"mean_token_accuracy": 0.20346533358097077,
|
|
"num_tokens": 45509229.0,
|
|
"step": 17950
|
|
},
|
|
{
|
|
"entropy": 6.259493160247803,
|
|
"epoch": 2.072129255626082,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00045787878596441193,
|
|
"loss": 5.6678,
|
|
"mean_token_accuracy": 0.20220885127782823,
|
|
"num_tokens": 45521654.0,
|
|
"step": 17955
|
|
},
|
|
{
|
|
"entropy": 6.260926580429077,
|
|
"epoch": 2.0727062896710904,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004578547443256776,
|
|
"loss": 5.7121,
|
|
"mean_token_accuracy": 0.19537041634321212,
|
|
"num_tokens": 45533488.0,
|
|
"step": 17960
|
|
},
|
|
{
|
|
"entropy": 6.268562984466553,
|
|
"epoch": 2.0732833237160992,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004578306965367148,
|
|
"loss": 5.6245,
|
|
"mean_token_accuracy": 0.20668937861919404,
|
|
"num_tokens": 45544938.0,
|
|
"step": 17965
|
|
},
|
|
{
|
|
"entropy": 6.247487020492554,
|
|
"epoch": 2.073860357761108,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00045780664259833235,
|
|
"loss": 5.6844,
|
|
"mean_token_accuracy": 0.20103041976690292,
|
|
"num_tokens": 45557085.0,
|
|
"step": 17970
|
|
},
|
|
{
|
|
"entropy": 6.240365791320801,
|
|
"epoch": 2.0744373918061165,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00045778258251133924,
|
|
"loss": 5.6562,
|
|
"mean_token_accuracy": 0.20293182879686356,
|
|
"num_tokens": 45570174.0,
|
|
"step": 17975
|
|
},
|
|
{
|
|
"entropy": 6.269809722900391,
|
|
"epoch": 2.0750144258511254,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00045775851627654474,
|
|
"loss": 5.6711,
|
|
"mean_token_accuracy": 0.20361365973949433,
|
|
"num_tokens": 45582174.0,
|
|
"step": 17980
|
|
},
|
|
{
|
|
"entropy": 6.240131282806397,
|
|
"epoch": 2.075591459896134,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004577344438947584,
|
|
"loss": 5.7361,
|
|
"mean_token_accuracy": 0.19098032414913177,
|
|
"num_tokens": 45595732.0,
|
|
"step": 17985
|
|
},
|
|
{
|
|
"entropy": 6.214056825637817,
|
|
"epoch": 2.0761684939411427,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00045771036536678984,
|
|
"loss": 5.6625,
|
|
"mean_token_accuracy": 0.20121949464082717,
|
|
"num_tokens": 45609675.0,
|
|
"step": 17990
|
|
},
|
|
{
|
|
"entropy": 6.315131139755249,
|
|
"epoch": 2.076745527986151,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00045768628069344885,
|
|
"loss": 5.7055,
|
|
"mean_token_accuracy": 0.19686917960643768,
|
|
"num_tokens": 45622467.0,
|
|
"step": 17995
|
|
},
|
|
{
|
|
"entropy": 6.263897705078125,
|
|
"epoch": 2.07732256203116,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004576621898755455,
|
|
"loss": 5.739,
|
|
"mean_token_accuracy": 0.19382344782352448,
|
|
"num_tokens": 45636246.0,
|
|
"step": 18000
|
|
},
|
|
{
|
|
"epoch": 2.07732256203116,
|
|
"eval_entropy": 6.069619185822167,
|
|
"eval_loss": 5.804035663604736,
|
|
"eval_mean_token_accuracy": 0.20375993807384635,
|
|
"eval_num_tokens": 45636246.0,
|
|
"eval_runtime": 17.5172,
|
|
"eval_samples_per_second": 1606.191,
|
|
"eval_steps_per_second": 200.774,
|
|
"step": 18000
|
|
},
|
|
{
|
|
"entropy": 6.246134519577026,
|
|
"epoch": 2.0778995960761684,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00045763809291389024,
|
|
"loss": 5.6481,
|
|
"mean_token_accuracy": 0.20348013937473297,
|
|
"num_tokens": 45649127.0,
|
|
"step": 18005
|
|
},
|
|
{
|
|
"entropy": 6.264445734024048,
|
|
"epoch": 2.0784766301211772,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004576139898092933,
|
|
"loss": 5.6794,
|
|
"mean_token_accuracy": 0.19997181594371796,
|
|
"num_tokens": 45661633.0,
|
|
"step": 18010
|
|
},
|
|
{
|
|
"entropy": 6.222084331512451,
|
|
"epoch": 2.0790536641661856,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004575898805625657,
|
|
"loss": 5.6185,
|
|
"mean_token_accuracy": 0.20518322587013244,
|
|
"num_tokens": 45673643.0,
|
|
"step": 18015
|
|
},
|
|
{
|
|
"entropy": 6.335010671615601,
|
|
"epoch": 2.0796306982111945,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00045756576517451804,
|
|
"loss": 5.7725,
|
|
"mean_token_accuracy": 0.19150546044111252,
|
|
"num_tokens": 45686125.0,
|
|
"step": 18020
|
|
},
|
|
{
|
|
"entropy": 6.257683420181275,
|
|
"epoch": 2.080207732256203,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00045754164364596156,
|
|
"loss": 5.6225,
|
|
"mean_token_accuracy": 0.20368454307317735,
|
|
"num_tokens": 45697919.0,
|
|
"step": 18025
|
|
},
|
|
{
|
|
"entropy": 6.219502353668213,
|
|
"epoch": 2.080784766301212,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004575175159777076,
|
|
"loss": 5.7023,
|
|
"mean_token_accuracy": 0.19955314546823502,
|
|
"num_tokens": 45709450.0,
|
|
"step": 18030
|
|
},
|
|
{
|
|
"entropy": 6.245679044723511,
|
|
"epoch": 2.0813618003462206,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004574933821705676,
|
|
"loss": 5.6477,
|
|
"mean_token_accuracy": 0.20409499555826188,
|
|
"num_tokens": 45721464.0,
|
|
"step": 18035
|
|
},
|
|
{
|
|
"entropy": 6.304778718948365,
|
|
"epoch": 2.081938834391229,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004574692422253534,
|
|
"loss": 5.7526,
|
|
"mean_token_accuracy": 0.19708194881677626,
|
|
"num_tokens": 45733397.0,
|
|
"step": 18040
|
|
},
|
|
{
|
|
"entropy": 6.216876220703125,
|
|
"epoch": 2.082515868436238,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00045744509614287687,
|
|
"loss": 5.7058,
|
|
"mean_token_accuracy": 0.19746667742729188,
|
|
"num_tokens": 45744953.0,
|
|
"step": 18045
|
|
},
|
|
{
|
|
"entropy": 6.250694465637207,
|
|
"epoch": 2.0830929024812463,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004574209439239501,
|
|
"loss": 5.6636,
|
|
"mean_token_accuracy": 0.20134249180555344,
|
|
"num_tokens": 45756914.0,
|
|
"step": 18050
|
|
},
|
|
{
|
|
"entropy": 6.23657341003418,
|
|
"epoch": 2.083669936526255,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00045739678556938563,
|
|
"loss": 5.6809,
|
|
"mean_token_accuracy": 0.21226089149713517,
|
|
"num_tokens": 45770888.0,
|
|
"step": 18055
|
|
},
|
|
{
|
|
"entropy": 6.235244607925415,
|
|
"epoch": 2.0842469705712636,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045737262107999575,
|
|
"loss": 5.6767,
|
|
"mean_token_accuracy": 0.2019466146826744,
|
|
"num_tokens": 45783551.0,
|
|
"step": 18060
|
|
},
|
|
{
|
|
"entropy": 6.26384391784668,
|
|
"epoch": 2.0848240046162725,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004573484504565934,
|
|
"loss": 5.6601,
|
|
"mean_token_accuracy": 0.20924518406391143,
|
|
"num_tokens": 45795700.0,
|
|
"step": 18065
|
|
},
|
|
{
|
|
"entropy": 6.19308066368103,
|
|
"epoch": 2.085401038661281,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004573242736999915,
|
|
"loss": 5.6641,
|
|
"mean_token_accuracy": 0.20257942378520966,
|
|
"num_tokens": 45808414.0,
|
|
"step": 18070
|
|
},
|
|
{
|
|
"entropy": 6.195266485214233,
|
|
"epoch": 2.0859780727062898,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00045730009081100314,
|
|
"loss": 5.614,
|
|
"mean_token_accuracy": 0.2057153984904289,
|
|
"num_tokens": 45821710.0,
|
|
"step": 18075
|
|
},
|
|
{
|
|
"entropy": 6.121374559402466,
|
|
"epoch": 2.086555106751298,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00045727590179044195,
|
|
"loss": 5.6034,
|
|
"mean_token_accuracy": 0.20624669641256332,
|
|
"num_tokens": 45835812.0,
|
|
"step": 18080
|
|
},
|
|
{
|
|
"entropy": 6.274444627761841,
|
|
"epoch": 2.087132140796307,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004572517066391211,
|
|
"loss": 5.6767,
|
|
"mean_token_accuracy": 0.20413774400949478,
|
|
"num_tokens": 45849076.0,
|
|
"step": 18085
|
|
},
|
|
{
|
|
"entropy": 6.242035007476806,
|
|
"epoch": 2.0877091748413155,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00045722750535785484,
|
|
"loss": 5.6815,
|
|
"mean_token_accuracy": 0.20116450935602187,
|
|
"num_tokens": 45861375.0,
|
|
"step": 18090
|
|
},
|
|
{
|
|
"entropy": 6.2057653903961185,
|
|
"epoch": 2.0882862088863243,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00045720329794745685,
|
|
"loss": 5.6527,
|
|
"mean_token_accuracy": 0.2060537040233612,
|
|
"num_tokens": 45872096.0,
|
|
"step": 18095
|
|
},
|
|
{
|
|
"entropy": 6.1792665958404545,
|
|
"epoch": 2.0888632429313327,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004571790844087415,
|
|
"loss": 5.5907,
|
|
"mean_token_accuracy": 0.21414544433355331,
|
|
"num_tokens": 45884843.0,
|
|
"step": 18100
|
|
},
|
|
{
|
|
"entropy": 6.267030906677246,
|
|
"epoch": 2.0894402769763416,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004571548647425231,
|
|
"loss": 5.6587,
|
|
"mean_token_accuracy": 0.19904158115386963,
|
|
"num_tokens": 45896644.0,
|
|
"step": 18105
|
|
},
|
|
{
|
|
"entropy": 6.324420690536499,
|
|
"epoch": 2.0900173110213505,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004571306389496164,
|
|
"loss": 5.7546,
|
|
"mean_token_accuracy": 0.19744710773229598,
|
|
"num_tokens": 45910204.0,
|
|
"step": 18110
|
|
},
|
|
{
|
|
"entropy": 6.239924144744873,
|
|
"epoch": 2.090594345066359,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00045710640703083594,
|
|
"loss": 5.6235,
|
|
"mean_token_accuracy": 0.20362144559621811,
|
|
"num_tokens": 45923332.0,
|
|
"step": 18115
|
|
},
|
|
{
|
|
"entropy": 6.175708246231079,
|
|
"epoch": 2.0911713791113677,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00045708216898699707,
|
|
"loss": 5.669,
|
|
"mean_token_accuracy": 0.21027057766914367,
|
|
"num_tokens": 45937322.0,
|
|
"step": 18120
|
|
},
|
|
{
|
|
"entropy": 6.245549440383911,
|
|
"epoch": 2.091748413156376,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00045705792481891483,
|
|
"loss": 5.661,
|
|
"mean_token_accuracy": 0.19952643513679505,
|
|
"num_tokens": 45950369.0,
|
|
"step": 18125
|
|
},
|
|
{
|
|
"entropy": 6.313686466217041,
|
|
"epoch": 2.092325447201385,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00045703367452740477,
|
|
"loss": 5.8022,
|
|
"mean_token_accuracy": 0.19890412092208862,
|
|
"num_tokens": 45963402.0,
|
|
"step": 18130
|
|
},
|
|
{
|
|
"entropy": 6.282650661468506,
|
|
"epoch": 2.0929024812463934,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00045700941811328247,
|
|
"loss": 5.7317,
|
|
"mean_token_accuracy": 0.1945398658514023,
|
|
"num_tokens": 45976979.0,
|
|
"step": 18135
|
|
},
|
|
{
|
|
"entropy": 6.272404193878174,
|
|
"epoch": 2.0934795152914023,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00045698515557736374,
|
|
"loss": 5.7198,
|
|
"mean_token_accuracy": 0.19928032010793686,
|
|
"num_tokens": 45990334.0,
|
|
"step": 18140
|
|
},
|
|
{
|
|
"entropy": 6.185986185073853,
|
|
"epoch": 2.0940565493364107,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00045696088692046477,
|
|
"loss": 5.6245,
|
|
"mean_token_accuracy": 0.20934058129787445,
|
|
"num_tokens": 46002322.0,
|
|
"step": 18145
|
|
},
|
|
{
|
|
"entropy": 6.240342664718628,
|
|
"epoch": 2.0946335833814196,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00045693661214340174,
|
|
"loss": 5.722,
|
|
"mean_token_accuracy": 0.19595017284154892,
|
|
"num_tokens": 46014136.0,
|
|
"step": 18150
|
|
},
|
|
{
|
|
"entropy": 6.332130861282349,
|
|
"epoch": 2.095210617426428,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00045691233124699117,
|
|
"loss": 5.7533,
|
|
"mean_token_accuracy": 0.19440668374300002,
|
|
"num_tokens": 46026686.0,
|
|
"step": 18155
|
|
},
|
|
{
|
|
"entropy": 6.238727474212647,
|
|
"epoch": 2.095787651471437,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004568880442320497,
|
|
"loss": 5.6499,
|
|
"mean_token_accuracy": 0.2080206796526909,
|
|
"num_tokens": 46038462.0,
|
|
"step": 18160
|
|
},
|
|
{
|
|
"entropy": 6.305221891403198,
|
|
"epoch": 2.0963646855164453,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045686375109939417,
|
|
"loss": 5.7261,
|
|
"mean_token_accuracy": 0.19346963614225388,
|
|
"num_tokens": 46051549.0,
|
|
"step": 18165
|
|
},
|
|
{
|
|
"entropy": 6.252967166900635,
|
|
"epoch": 2.096941719561454,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004568394518498417,
|
|
"loss": 5.693,
|
|
"mean_token_accuracy": 0.20137814581394195,
|
|
"num_tokens": 46065282.0,
|
|
"step": 18170
|
|
},
|
|
{
|
|
"entropy": 6.2782073497772215,
|
|
"epoch": 2.0975187536064626,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045681514648420965,
|
|
"loss": 5.7062,
|
|
"mean_token_accuracy": 0.19837625026702882,
|
|
"num_tokens": 46077238.0,
|
|
"step": 18175
|
|
},
|
|
{
|
|
"entropy": 6.325450277328491,
|
|
"epoch": 2.0980957876514714,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004567908350033154,
|
|
"loss": 5.6915,
|
|
"mean_token_accuracy": 0.2042577013373375,
|
|
"num_tokens": 46089044.0,
|
|
"step": 18180
|
|
},
|
|
{
|
|
"entropy": 6.248745012283325,
|
|
"epoch": 2.0986728216964803,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004567665174079767,
|
|
"loss": 5.7329,
|
|
"mean_token_accuracy": 0.20117929577827454,
|
|
"num_tokens": 46101246.0,
|
|
"step": 18185
|
|
},
|
|
{
|
|
"entropy": 6.282928800582885,
|
|
"epoch": 2.0992498557414887,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00045674219369901153,
|
|
"loss": 5.7487,
|
|
"mean_token_accuracy": 0.19632016271352767,
|
|
"num_tokens": 46112735.0,
|
|
"step": 18190
|
|
},
|
|
{
|
|
"entropy": 6.255322742462158,
|
|
"epoch": 2.0998268897864976,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004567178638772379,
|
|
"loss": 5.802,
|
|
"mean_token_accuracy": 0.19112858474254607,
|
|
"num_tokens": 46125547.0,
|
|
"step": 18195
|
|
},
|
|
{
|
|
"entropy": 6.31384596824646,
|
|
"epoch": 2.100403923831506,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004566935279434742,
|
|
"loss": 5.7593,
|
|
"mean_token_accuracy": 0.19314925372600555,
|
|
"num_tokens": 46137356.0,
|
|
"step": 18200
|
|
},
|
|
{
|
|
"entropy": 6.22183141708374,
|
|
"epoch": 2.100980957876515,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00045666918589853895,
|
|
"loss": 5.6608,
|
|
"mean_token_accuracy": 0.20413845479488374,
|
|
"num_tokens": 46149935.0,
|
|
"step": 18205
|
|
},
|
|
{
|
|
"entropy": 6.188861894607544,
|
|
"epoch": 2.1015579919215233,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00045664483774325094,
|
|
"loss": 5.5989,
|
|
"mean_token_accuracy": 0.2077876254916191,
|
|
"num_tokens": 46162186.0,
|
|
"step": 18210
|
|
},
|
|
{
|
|
"entropy": 6.222089576721191,
|
|
"epoch": 2.102135025966532,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004566204834784289,
|
|
"loss": 5.6059,
|
|
"mean_token_accuracy": 0.20326893627643586,
|
|
"num_tokens": 46175221.0,
|
|
"step": 18215
|
|
},
|
|
{
|
|
"entropy": 6.195293712615967,
|
|
"epoch": 2.1027120600115405,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00045659612310489225,
|
|
"loss": 5.762,
|
|
"mean_token_accuracy": 0.19867088049650192,
|
|
"num_tokens": 46187898.0,
|
|
"step": 18220
|
|
},
|
|
{
|
|
"entropy": 6.246435070037842,
|
|
"epoch": 2.1032890940565494,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00045657175662346014,
|
|
"loss": 5.665,
|
|
"mean_token_accuracy": 0.20157117545604705,
|
|
"num_tokens": 46200792.0,
|
|
"step": 18225
|
|
},
|
|
{
|
|
"entropy": 6.260198020935059,
|
|
"epoch": 2.103866128101558,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004565473840349522,
|
|
"loss": 5.6957,
|
|
"mean_token_accuracy": 0.19887917637825012,
|
|
"num_tokens": 46213791.0,
|
|
"step": 18230
|
|
},
|
|
{
|
|
"entropy": 6.264036750793457,
|
|
"epoch": 2.1044431621465667,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00045652300534018816,
|
|
"loss": 5.6782,
|
|
"mean_token_accuracy": 0.2033469021320343,
|
|
"num_tokens": 46226229.0,
|
|
"step": 18235
|
|
},
|
|
{
|
|
"entropy": 6.277313184738159,
|
|
"epoch": 2.105020196191575,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.000456498620539988,
|
|
"loss": 5.6742,
|
|
"mean_token_accuracy": 0.20586120039224626,
|
|
"num_tokens": 46239253.0,
|
|
"step": 18240
|
|
},
|
|
{
|
|
"entropy": 6.210960912704468,
|
|
"epoch": 2.105597230236584,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004564742296351719,
|
|
"loss": 5.7082,
|
|
"mean_token_accuracy": 0.20025913417339325,
|
|
"num_tokens": 46251578.0,
|
|
"step": 18245
|
|
},
|
|
{
|
|
"entropy": 6.309379816055298,
|
|
"epoch": 2.106174264281593,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00045644983262656014,
|
|
"loss": 5.7046,
|
|
"mean_token_accuracy": 0.20009643882513045,
|
|
"num_tokens": 46265421.0,
|
|
"step": 18250
|
|
},
|
|
{
|
|
"entropy": 6.279318809509277,
|
|
"epoch": 2.1067512983266012,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004564254295149735,
|
|
"loss": 5.7543,
|
|
"mean_token_accuracy": 0.19517963677644729,
|
|
"num_tokens": 46277480.0,
|
|
"step": 18255
|
|
},
|
|
{
|
|
"entropy": 6.281505012512207,
|
|
"epoch": 2.10732833237161,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00045640102030123264,
|
|
"loss": 5.7272,
|
|
"mean_token_accuracy": 0.1994670122861862,
|
|
"num_tokens": 46289793.0,
|
|
"step": 18260
|
|
},
|
|
{
|
|
"entropy": 6.272510528564453,
|
|
"epoch": 2.1079053664166185,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00045637660498615865,
|
|
"loss": 5.6853,
|
|
"mean_token_accuracy": 0.20521128475666045,
|
|
"num_tokens": 46301653.0,
|
|
"step": 18265
|
|
},
|
|
{
|
|
"entropy": 6.129175043106079,
|
|
"epoch": 2.1084824004616274,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004563521835705725,
|
|
"loss": 5.578,
|
|
"mean_token_accuracy": 0.21452680677175523,
|
|
"num_tokens": 46314368.0,
|
|
"step": 18270
|
|
},
|
|
{
|
|
"entropy": 6.310157346725464,
|
|
"epoch": 2.109059434506636,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00045632775605529587,
|
|
"loss": 5.7247,
|
|
"mean_token_accuracy": 0.19462078511714936,
|
|
"num_tokens": 46327446.0,
|
|
"step": 18275
|
|
},
|
|
{
|
|
"entropy": 6.319844436645508,
|
|
"epoch": 2.1096364685516447,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004563033224411501,
|
|
"loss": 5.728,
|
|
"mean_token_accuracy": 0.1939805880188942,
|
|
"num_tokens": 46340370.0,
|
|
"step": 18280
|
|
},
|
|
{
|
|
"entropy": 6.22706356048584,
|
|
"epoch": 2.110213502596653,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004562788827289572,
|
|
"loss": 5.7025,
|
|
"mean_token_accuracy": 0.20296211242675782,
|
|
"num_tokens": 46352675.0,
|
|
"step": 18285
|
|
},
|
|
{
|
|
"entropy": 6.148489570617675,
|
|
"epoch": 2.110790536641662,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00045625443691953914,
|
|
"loss": 5.5886,
|
|
"mean_token_accuracy": 0.20904678702354432,
|
|
"num_tokens": 46365404.0,
|
|
"step": 18290
|
|
},
|
|
{
|
|
"entropy": 6.284792232513428,
|
|
"epoch": 2.1113675706866704,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004562299850137181,
|
|
"loss": 5.652,
|
|
"mean_token_accuracy": 0.20398799926042557,
|
|
"num_tokens": 46377544.0,
|
|
"step": 18295
|
|
},
|
|
{
|
|
"entropy": 6.247260618209839,
|
|
"epoch": 2.111944604731679,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004562055270123166,
|
|
"loss": 5.7487,
|
|
"mean_token_accuracy": 0.2020320326089859,
|
|
"num_tokens": 46390425.0,
|
|
"step": 18300
|
|
},
|
|
{
|
|
"entropy": 6.210721588134765,
|
|
"epoch": 2.1125216387766876,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00045618106291615715,
|
|
"loss": 5.6716,
|
|
"mean_token_accuracy": 0.2000151827931404,
|
|
"num_tokens": 46403359.0,
|
|
"step": 18305
|
|
},
|
|
{
|
|
"entropy": 6.296349716186524,
|
|
"epoch": 2.1130986728216965,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004561565927260627,
|
|
"loss": 5.7571,
|
|
"mean_token_accuracy": 0.2024470806121826,
|
|
"num_tokens": 46414700.0,
|
|
"step": 18310
|
|
},
|
|
{
|
|
"entropy": 6.317724514007568,
|
|
"epoch": 2.1136757068667054,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004561321164428561,
|
|
"loss": 5.7405,
|
|
"mean_token_accuracy": 0.19626646637916564,
|
|
"num_tokens": 46427199.0,
|
|
"step": 18315
|
|
},
|
|
{
|
|
"entropy": 6.291296052932739,
|
|
"epoch": 2.114252740911714,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004561076340673609,
|
|
"loss": 5.6788,
|
|
"mean_token_accuracy": 0.2070443406701088,
|
|
"num_tokens": 46440143.0,
|
|
"step": 18320
|
|
},
|
|
{
|
|
"entropy": 6.296773862838745,
|
|
"epoch": 2.1148297749567226,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004560831456004003,
|
|
"loss": 5.6809,
|
|
"mean_token_accuracy": 0.19323974549770356,
|
|
"num_tokens": 46452868.0,
|
|
"step": 18325
|
|
},
|
|
{
|
|
"entropy": 6.2290812015533445,
|
|
"epoch": 2.115406809001731,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004560586510427981,
|
|
"loss": 5.5906,
|
|
"mean_token_accuracy": 0.21004874557256697,
|
|
"num_tokens": 46465648.0,
|
|
"step": 18330
|
|
},
|
|
{
|
|
"entropy": 6.190475177764893,
|
|
"epoch": 2.11598384304674,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004560341503953781,
|
|
"loss": 5.7048,
|
|
"mean_token_accuracy": 0.20484923124313353,
|
|
"num_tokens": 46478282.0,
|
|
"step": 18335
|
|
},
|
|
{
|
|
"entropy": 6.218627786636352,
|
|
"epoch": 2.1165608770917483,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004560096436589643,
|
|
"loss": 5.6113,
|
|
"mean_token_accuracy": 0.2062837600708008,
|
|
"num_tokens": 46490299.0,
|
|
"step": 18340
|
|
},
|
|
{
|
|
"entropy": 6.244489526748657,
|
|
"epoch": 2.117137911136757,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00045598513083438115,
|
|
"loss": 5.6169,
|
|
"mean_token_accuracy": 0.21169881969690324,
|
|
"num_tokens": 46502165.0,
|
|
"step": 18345
|
|
},
|
|
{
|
|
"entropy": 6.214208650588989,
|
|
"epoch": 2.1177149451817656,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00045596061192245297,
|
|
"loss": 5.7166,
|
|
"mean_token_accuracy": 0.20201748758554458,
|
|
"num_tokens": 46514954.0,
|
|
"step": 18350
|
|
},
|
|
{
|
|
"entropy": 6.290360975265503,
|
|
"epoch": 2.1182919792267745,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004559360869240045,
|
|
"loss": 5.7851,
|
|
"mean_token_accuracy": 0.18993605077266693,
|
|
"num_tokens": 46527088.0,
|
|
"step": 18355
|
|
},
|
|
{
|
|
"entropy": 6.313471698760987,
|
|
"epoch": 2.118869013271783,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004559115558398606,
|
|
"loss": 5.7399,
|
|
"mean_token_accuracy": 0.19302885234355927,
|
|
"num_tokens": 46538737.0,
|
|
"step": 18360
|
|
},
|
|
{
|
|
"entropy": 6.245953607559204,
|
|
"epoch": 2.1194460473167918,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004558870186708465,
|
|
"loss": 5.652,
|
|
"mean_token_accuracy": 0.20305613279342652,
|
|
"num_tokens": 46551963.0,
|
|
"step": 18365
|
|
},
|
|
{
|
|
"entropy": 6.245628738403321,
|
|
"epoch": 2.1200230813618,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00045586247541778724,
|
|
"loss": 5.7255,
|
|
"mean_token_accuracy": 0.20636988282203675,
|
|
"num_tokens": 46564247.0,
|
|
"step": 18370
|
|
},
|
|
{
|
|
"entropy": 6.240551710128784,
|
|
"epoch": 2.120600115406809,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004558379260815085,
|
|
"loss": 5.6995,
|
|
"mean_token_accuracy": 0.20225383788347245,
|
|
"num_tokens": 46578491.0,
|
|
"step": 18375
|
|
},
|
|
{
|
|
"entropy": 6.269914007186889,
|
|
"epoch": 2.1211771494518175,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004558133706628359,
|
|
"loss": 5.6906,
|
|
"mean_token_accuracy": 0.20203321278095246,
|
|
"num_tokens": 46591528.0,
|
|
"step": 18380
|
|
},
|
|
{
|
|
"entropy": 6.32675838470459,
|
|
"epoch": 2.1217541834968263,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00045578880916259554,
|
|
"loss": 5.771,
|
|
"mean_token_accuracy": 0.193904410302639,
|
|
"num_tokens": 46605028.0,
|
|
"step": 18385
|
|
},
|
|
{
|
|
"entropy": 6.199621963500976,
|
|
"epoch": 2.122331217541835,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004557642415816132,
|
|
"loss": 5.6377,
|
|
"mean_token_accuracy": 0.2080541417002678,
|
|
"num_tokens": 46617713.0,
|
|
"step": 18390
|
|
},
|
|
{
|
|
"entropy": 6.285545921325683,
|
|
"epoch": 2.1229082515868436,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004557396679207155,
|
|
"loss": 5.7865,
|
|
"mean_token_accuracy": 0.19203791320323943,
|
|
"num_tokens": 46631897.0,
|
|
"step": 18395
|
|
},
|
|
{
|
|
"entropy": 6.303127717971802,
|
|
"epoch": 2.1234852856318525,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00045571508818072887,
|
|
"loss": 5.7481,
|
|
"mean_token_accuracy": 0.19187881350517272,
|
|
"num_tokens": 46645457.0,
|
|
"step": 18400
|
|
},
|
|
{
|
|
"entropy": 6.339938688278198,
|
|
"epoch": 2.124062319676861,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004556905023624799,
|
|
"loss": 5.7318,
|
|
"mean_token_accuracy": 0.19835630059242249,
|
|
"num_tokens": 46657779.0,
|
|
"step": 18405
|
|
},
|
|
{
|
|
"entropy": 6.2173059463500975,
|
|
"epoch": 2.1246393537218697,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00045566591046679577,
|
|
"loss": 5.6775,
|
|
"mean_token_accuracy": 0.2003285899758339,
|
|
"num_tokens": 46670590.0,
|
|
"step": 18410
|
|
},
|
|
{
|
|
"entropy": 6.223220014572144,
|
|
"epoch": 2.125216387766878,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.00045564131249450343,
|
|
"loss": 5.6518,
|
|
"mean_token_accuracy": 0.20317054986953736,
|
|
"num_tokens": 46683369.0,
|
|
"step": 18415
|
|
},
|
|
{
|
|
"entropy": 6.314276504516601,
|
|
"epoch": 2.125793421811887,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004556167084464302,
|
|
"loss": 5.6898,
|
|
"mean_token_accuracy": 0.19398971945047377,
|
|
"num_tokens": 46695371.0,
|
|
"step": 18420
|
|
},
|
|
{
|
|
"entropy": 6.185404968261719,
|
|
"epoch": 2.1263704558568954,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004555920983234038,
|
|
"loss": 5.6048,
|
|
"mean_token_accuracy": 0.20488648414611815,
|
|
"num_tokens": 46708422.0,
|
|
"step": 18425
|
|
},
|
|
{
|
|
"entropy": 6.131176233291626,
|
|
"epoch": 2.1269474899019043,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00045556748212625183,
|
|
"loss": 5.5992,
|
|
"mean_token_accuracy": 0.21085411310195923,
|
|
"num_tokens": 46722236.0,
|
|
"step": 18430
|
|
},
|
|
{
|
|
"entropy": 6.335385847091675,
|
|
"epoch": 2.1275245239469127,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004555428598558023,
|
|
"loss": 5.6881,
|
|
"mean_token_accuracy": 0.2015898957848549,
|
|
"num_tokens": 46733084.0,
|
|
"step": 18435
|
|
},
|
|
{
|
|
"entropy": 6.235428047180176,
|
|
"epoch": 2.1281015579919216,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004555182315128833,
|
|
"loss": 5.6943,
|
|
"mean_token_accuracy": 0.19690838754177092,
|
|
"num_tokens": 46745174.0,
|
|
"step": 18440
|
|
},
|
|
{
|
|
"entropy": 6.291813564300537,
|
|
"epoch": 2.12867859203693,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004554935970983234,
|
|
"loss": 5.7371,
|
|
"mean_token_accuracy": 0.20212126523256302,
|
|
"num_tokens": 46758134.0,
|
|
"step": 18445
|
|
},
|
|
{
|
|
"entropy": 6.26134991645813,
|
|
"epoch": 2.129255626081939,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004554689566129509,
|
|
"loss": 5.6282,
|
|
"mean_token_accuracy": 0.20178801715373992,
|
|
"num_tokens": 46770941.0,
|
|
"step": 18450
|
|
},
|
|
{
|
|
"entropy": 6.253507900238037,
|
|
"epoch": 2.1298326601269473,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00045544431005759467,
|
|
"loss": 5.7037,
|
|
"mean_token_accuracy": 0.20702736973762512,
|
|
"num_tokens": 46782532.0,
|
|
"step": 18455
|
|
},
|
|
{
|
|
"entropy": 6.190967559814453,
|
|
"epoch": 2.130409694171956,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00045541965743308376,
|
|
"loss": 5.6673,
|
|
"mean_token_accuracy": 0.20353056937456132,
|
|
"num_tokens": 46794636.0,
|
|
"step": 18460
|
|
},
|
|
{
|
|
"entropy": 6.23766188621521,
|
|
"epoch": 2.130986728216965,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004553949987402473,
|
|
"loss": 5.7034,
|
|
"mean_token_accuracy": 0.1964999184012413,
|
|
"num_tokens": 46807797.0,
|
|
"step": 18465
|
|
},
|
|
{
|
|
"entropy": 6.3087376117706295,
|
|
"epoch": 2.1315637622619734,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004553703339799146,
|
|
"loss": 5.6631,
|
|
"mean_token_accuracy": 0.1988433212041855,
|
|
"num_tokens": 46819838.0,
|
|
"step": 18470
|
|
},
|
|
{
|
|
"entropy": 6.15626368522644,
|
|
"epoch": 2.1321407963069823,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004553456631529154,
|
|
"loss": 5.6281,
|
|
"mean_token_accuracy": 0.20693209618330002,
|
|
"num_tokens": 46832172.0,
|
|
"step": 18475
|
|
},
|
|
{
|
|
"entropy": 6.262816905975342,
|
|
"epoch": 2.1327178303519907,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004553209862600794,
|
|
"loss": 5.7047,
|
|
"mean_token_accuracy": 0.20258551687002183,
|
|
"num_tokens": 46844457.0,
|
|
"step": 18480
|
|
},
|
|
{
|
|
"entropy": 6.217689561843872,
|
|
"epoch": 2.1332948643969996,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004552963033022365,
|
|
"loss": 5.6269,
|
|
"mean_token_accuracy": 0.20258189141750335,
|
|
"num_tokens": 46857256.0,
|
|
"step": 18485
|
|
},
|
|
{
|
|
"entropy": 6.245373678207398,
|
|
"epoch": 2.133871898442008,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00045527161428021706,
|
|
"loss": 5.6878,
|
|
"mean_token_accuracy": 0.2011040687561035,
|
|
"num_tokens": 46870971.0,
|
|
"step": 18490
|
|
},
|
|
{
|
|
"entropy": 6.261890983581543,
|
|
"epoch": 2.134448932487017,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004552469191948514,
|
|
"loss": 5.6446,
|
|
"mean_token_accuracy": 0.20959553867578506,
|
|
"num_tokens": 46882911.0,
|
|
"step": 18495
|
|
},
|
|
{
|
|
"entropy": 6.253646564483643,
|
|
"epoch": 2.1350259665320253,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004552222180469702,
|
|
"loss": 5.693,
|
|
"mean_token_accuracy": 0.20216709077358247,
|
|
"num_tokens": 46895927.0,
|
|
"step": 18500
|
|
},
|
|
{
|
|
"entropy": 6.187870836257934,
|
|
"epoch": 2.135603000577034,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00045519751083740413,
|
|
"loss": 5.6568,
|
|
"mean_token_accuracy": 0.20425989031791686,
|
|
"num_tokens": 46908210.0,
|
|
"step": 18505
|
|
},
|
|
{
|
|
"entropy": 6.299504232406616,
|
|
"epoch": 2.1361800346220425,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00045517279756698435,
|
|
"loss": 5.7277,
|
|
"mean_token_accuracy": 0.1984967589378357,
|
|
"num_tokens": 46920197.0,
|
|
"step": 18510
|
|
},
|
|
{
|
|
"entropy": 6.272176742553711,
|
|
"epoch": 2.1367570686670514,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00045514807823654203,
|
|
"loss": 5.6717,
|
|
"mean_token_accuracy": 0.2022643879055977,
|
|
"num_tokens": 46932628.0,
|
|
"step": 18515
|
|
},
|
|
{
|
|
"entropy": 6.2229221820831295,
|
|
"epoch": 2.13733410271206,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004551233528469086,
|
|
"loss": 5.6484,
|
|
"mean_token_accuracy": 0.20244522541761398,
|
|
"num_tokens": 46945479.0,
|
|
"step": 18520
|
|
},
|
|
{
|
|
"entropy": 6.249539518356324,
|
|
"epoch": 2.1379111367570687,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00045509862139891553,
|
|
"loss": 5.6598,
|
|
"mean_token_accuracy": 0.20135302245616912,
|
|
"num_tokens": 46958178.0,
|
|
"step": 18525
|
|
},
|
|
{
|
|
"entropy": 6.303174018859863,
|
|
"epoch": 2.138488170802077,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00045507388389339496,
|
|
"loss": 5.7638,
|
|
"mean_token_accuracy": 0.19554962664842607,
|
|
"num_tokens": 46972959.0,
|
|
"step": 18530
|
|
},
|
|
{
|
|
"entropy": 6.301294231414795,
|
|
"epoch": 2.139065204847086,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00045504914033117866,
|
|
"loss": 5.731,
|
|
"mean_token_accuracy": 0.2034759998321533,
|
|
"num_tokens": 46985506.0,
|
|
"step": 18535
|
|
},
|
|
{
|
|
"entropy": 6.185574340820312,
|
|
"epoch": 2.139642238892095,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00045502439071309897,
|
|
"loss": 5.6738,
|
|
"mean_token_accuracy": 0.2004707098007202,
|
|
"num_tokens": 46997928.0,
|
|
"step": 18540
|
|
},
|
|
{
|
|
"entropy": 6.144084739685058,
|
|
"epoch": 2.1402192729371032,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00045499963503998835,
|
|
"loss": 5.5515,
|
|
"mean_token_accuracy": 0.21737504452466966,
|
|
"num_tokens": 47010097.0,
|
|
"step": 18545
|
|
},
|
|
{
|
|
"entropy": 6.288726758956909,
|
|
"epoch": 2.140796306982112,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004549748733126794,
|
|
"loss": 5.7374,
|
|
"mean_token_accuracy": 0.1894450679421425,
|
|
"num_tokens": 47021230.0,
|
|
"step": 18550
|
|
},
|
|
{
|
|
"entropy": 6.350382137298584,
|
|
"epoch": 2.1413733410271205,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.000454950105532005,
|
|
"loss": 5.7337,
|
|
"mean_token_accuracy": 0.20369782149791718,
|
|
"num_tokens": 47034433.0,
|
|
"step": 18555
|
|
},
|
|
{
|
|
"entropy": 6.285674619674682,
|
|
"epoch": 2.1419503750721294,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045492533169879816,
|
|
"loss": 5.6853,
|
|
"mean_token_accuracy": 0.2005313515663147,
|
|
"num_tokens": 47046824.0,
|
|
"step": 18560
|
|
},
|
|
{
|
|
"entropy": 6.15918869972229,
|
|
"epoch": 2.142527409117138,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00045490055181389216,
|
|
"loss": 5.6169,
|
|
"mean_token_accuracy": 0.21414333134889602,
|
|
"num_tokens": 47058868.0,
|
|
"step": 18565
|
|
},
|
|
{
|
|
"entropy": 6.236881732940674,
|
|
"epoch": 2.1431044431621467,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00045487576587812046,
|
|
"loss": 5.7218,
|
|
"mean_token_accuracy": 0.1932273432612419,
|
|
"num_tokens": 47070898.0,
|
|
"step": 18570
|
|
},
|
|
{
|
|
"entropy": 6.288231134414673,
|
|
"epoch": 2.143681477207155,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00045485097389231675,
|
|
"loss": 5.7072,
|
|
"mean_token_accuracy": 0.20229474306106568,
|
|
"num_tokens": 47083739.0,
|
|
"step": 18575
|
|
},
|
|
{
|
|
"entropy": 6.256460046768188,
|
|
"epoch": 2.144258511252164,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004548261758573149,
|
|
"loss": 5.6604,
|
|
"mean_token_accuracy": 0.19764898717403412,
|
|
"num_tokens": 47095595.0,
|
|
"step": 18580
|
|
},
|
|
{
|
|
"entropy": 6.3134369373321535,
|
|
"epoch": 2.1448355452971724,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004548013717739489,
|
|
"loss": 5.7906,
|
|
"mean_token_accuracy": 0.1963936612010002,
|
|
"num_tokens": 47108326.0,
|
|
"step": 18585
|
|
},
|
|
{
|
|
"entropy": 6.267605018615723,
|
|
"epoch": 2.145412579342181,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004547765616430531,
|
|
"loss": 5.6946,
|
|
"mean_token_accuracy": 0.2020091712474823,
|
|
"num_tokens": 47120494.0,
|
|
"step": 18590
|
|
},
|
|
{
|
|
"entropy": 6.253426933288575,
|
|
"epoch": 2.14598961338719,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004547517454654619,
|
|
"loss": 5.7123,
|
|
"mean_token_accuracy": 0.19711664468050002,
|
|
"num_tokens": 47133116.0,
|
|
"step": 18595
|
|
},
|
|
{
|
|
"entropy": 6.2377996921539305,
|
|
"epoch": 2.1465666474321985,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00045472692324201005,
|
|
"loss": 5.6745,
|
|
"mean_token_accuracy": 0.20328953266143798,
|
|
"num_tokens": 47145208.0,
|
|
"step": 18600
|
|
},
|
|
{
|
|
"entropy": 6.2594903945922855,
|
|
"epoch": 2.1471436814772074,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00045470209497353243,
|
|
"loss": 5.6525,
|
|
"mean_token_accuracy": 0.20197178572416305,
|
|
"num_tokens": 47159217.0,
|
|
"step": 18605
|
|
},
|
|
{
|
|
"entropy": 6.259916639328003,
|
|
"epoch": 2.1477207155222158,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004546772606608641,
|
|
"loss": 5.7191,
|
|
"mean_token_accuracy": 0.19843529015779496,
|
|
"num_tokens": 47171781.0,
|
|
"step": 18610
|
|
},
|
|
{
|
|
"entropy": 6.272399759292602,
|
|
"epoch": 2.1482977495672246,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004546524203048404,
|
|
"loss": 5.7301,
|
|
"mean_token_accuracy": 0.20068282037973403,
|
|
"num_tokens": 47184045.0,
|
|
"step": 18615
|
|
},
|
|
{
|
|
"entropy": 6.256565856933594,
|
|
"epoch": 2.148874783612233,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004546275739062967,
|
|
"loss": 5.6422,
|
|
"mean_token_accuracy": 0.20642626881599427,
|
|
"num_tokens": 47195511.0,
|
|
"step": 18620
|
|
},
|
|
{
|
|
"entropy": 6.235472393035889,
|
|
"epoch": 2.149451817657242,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004546027214660688,
|
|
"loss": 5.6918,
|
|
"mean_token_accuracy": 0.2010675698518753,
|
|
"num_tokens": 47206977.0,
|
|
"step": 18625
|
|
},
|
|
{
|
|
"entropy": 6.2369743347167965,
|
|
"epoch": 2.1500288517022503,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004545778629849926,
|
|
"loss": 5.6698,
|
|
"mean_token_accuracy": 0.19845179915428163,
|
|
"num_tokens": 47218748.0,
|
|
"step": 18630
|
|
},
|
|
{
|
|
"entropy": 6.347124624252319,
|
|
"epoch": 2.150605885747259,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004545529984639042,
|
|
"loss": 5.7865,
|
|
"mean_token_accuracy": 0.1867247551679611,
|
|
"num_tokens": 47230651.0,
|
|
"step": 18635
|
|
},
|
|
{
|
|
"entropy": 6.214054298400879,
|
|
"epoch": 2.1511829197922676,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004545281279036398,
|
|
"loss": 5.6591,
|
|
"mean_token_accuracy": 0.2055197224020958,
|
|
"num_tokens": 47242959.0,
|
|
"step": 18640
|
|
},
|
|
{
|
|
"entropy": 6.25451807975769,
|
|
"epoch": 2.1517599538372765,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004545032513050361,
|
|
"loss": 5.6808,
|
|
"mean_token_accuracy": 0.19695733934640886,
|
|
"num_tokens": 47255113.0,
|
|
"step": 18645
|
|
},
|
|
{
|
|
"entropy": 6.290202808380127,
|
|
"epoch": 2.152336987882285,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004544783686689296,
|
|
"loss": 5.7893,
|
|
"mean_token_accuracy": 0.19497634023427962,
|
|
"num_tokens": 47266873.0,
|
|
"step": 18650
|
|
},
|
|
{
|
|
"entropy": 6.329517269134522,
|
|
"epoch": 2.1529140219272938,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00045445347999615736,
|
|
"loss": 5.7372,
|
|
"mean_token_accuracy": 0.20065853744745255,
|
|
"num_tokens": 47278685.0,
|
|
"step": 18655
|
|
},
|
|
{
|
|
"entropy": 6.251347064971924,
|
|
"epoch": 2.153491055972302,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00045442858528755653,
|
|
"loss": 5.7136,
|
|
"mean_token_accuracy": 0.20842838436365127,
|
|
"num_tokens": 47291553.0,
|
|
"step": 18660
|
|
},
|
|
{
|
|
"entropy": 6.250447130203247,
|
|
"epoch": 2.154068090017311,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00045440368454396435,
|
|
"loss": 5.6378,
|
|
"mean_token_accuracy": 0.20666613578796386,
|
|
"num_tokens": 47303890.0,
|
|
"step": 18665
|
|
},
|
|
{
|
|
"entropy": 6.201526117324829,
|
|
"epoch": 2.15464512406232,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004543787777662183,
|
|
"loss": 5.6181,
|
|
"mean_token_accuracy": 0.21246950477361679,
|
|
"num_tokens": 47316990.0,
|
|
"step": 18670
|
|
},
|
|
{
|
|
"entropy": 6.260347652435303,
|
|
"epoch": 2.1552221581073283,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00045435386495515617,
|
|
"loss": 5.7288,
|
|
"mean_token_accuracy": 0.2012850522994995,
|
|
"num_tokens": 47330568.0,
|
|
"step": 18675
|
|
},
|
|
{
|
|
"entropy": 6.274090385437011,
|
|
"epoch": 2.155799192152337,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004543289461116159,
|
|
"loss": 5.6548,
|
|
"mean_token_accuracy": 0.20304317623376847,
|
|
"num_tokens": 47343563.0,
|
|
"step": 18680
|
|
},
|
|
{
|
|
"entropy": 6.274822044372558,
|
|
"epoch": 2.1563762261973456,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004543040212364356,
|
|
"loss": 5.7077,
|
|
"mean_token_accuracy": 0.19780379682779312,
|
|
"num_tokens": 47356272.0,
|
|
"step": 18685
|
|
},
|
|
{
|
|
"entropy": 6.162377452850341,
|
|
"epoch": 2.1569532602423545,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004542790903304536,
|
|
"loss": 5.6503,
|
|
"mean_token_accuracy": 0.20433313250541688,
|
|
"num_tokens": 47370244.0,
|
|
"step": 18690
|
|
},
|
|
{
|
|
"entropy": 6.270251655578614,
|
|
"epoch": 2.157530294287363,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004542541533945085,
|
|
"loss": 5.6845,
|
|
"mean_token_accuracy": 0.20407705754041672,
|
|
"num_tokens": 47383120.0,
|
|
"step": 18695
|
|
},
|
|
{
|
|
"entropy": 6.325912189483643,
|
|
"epoch": 2.1581073283323717,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00045422921042943885,
|
|
"loss": 5.7731,
|
|
"mean_token_accuracy": 0.19510978758335112,
|
|
"num_tokens": 47397274.0,
|
|
"step": 18700
|
|
},
|
|
{
|
|
"entropy": 6.282104444503784,
|
|
"epoch": 2.15868436237738,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.000454204261436084,
|
|
"loss": 5.6718,
|
|
"mean_token_accuracy": 0.19389674961566924,
|
|
"num_tokens": 47409611.0,
|
|
"step": 18705
|
|
},
|
|
{
|
|
"entropy": 6.2637886047363285,
|
|
"epoch": 2.159261396422389,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00045417930641528255,
|
|
"loss": 5.6857,
|
|
"mean_token_accuracy": 0.19976329952478408,
|
|
"num_tokens": 47421435.0,
|
|
"step": 18710
|
|
},
|
|
{
|
|
"entropy": 6.322576427459717,
|
|
"epoch": 2.1598384304673974,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00045415434536787424,
|
|
"loss": 5.7587,
|
|
"mean_token_accuracy": 0.19851334244012833,
|
|
"num_tokens": 47434749.0,
|
|
"step": 18715
|
|
},
|
|
{
|
|
"entropy": 6.275216150283813,
|
|
"epoch": 2.1604154645124063,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004541293782946985,
|
|
"loss": 5.7258,
|
|
"mean_token_accuracy": 0.19765596836805344,
|
|
"num_tokens": 47446477.0,
|
|
"step": 18720
|
|
},
|
|
{
|
|
"entropy": 6.1962462902069095,
|
|
"epoch": 2.1609924985574147,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004541044051965952,
|
|
"loss": 5.5981,
|
|
"mean_token_accuracy": 0.2038559779524803,
|
|
"num_tokens": 47459547.0,
|
|
"step": 18725
|
|
},
|
|
{
|
|
"entropy": 6.297658157348633,
|
|
"epoch": 2.1615695326024236,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004540794260744041,
|
|
"loss": 5.751,
|
|
"mean_token_accuracy": 0.19317446351051332,
|
|
"num_tokens": 47472294.0,
|
|
"step": 18730
|
|
},
|
|
{
|
|
"entropy": 6.24362964630127,
|
|
"epoch": 2.162146566647432,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004540544409289655,
|
|
"loss": 5.6429,
|
|
"mean_token_accuracy": 0.20526028126478196,
|
|
"num_tokens": 47484240.0,
|
|
"step": 18735
|
|
},
|
|
{
|
|
"entropy": 6.266336107254029,
|
|
"epoch": 2.162723600692441,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004540294497611197,
|
|
"loss": 5.7104,
|
|
"mean_token_accuracy": 0.20812188535928727,
|
|
"num_tokens": 47498179.0,
|
|
"step": 18740
|
|
},
|
|
{
|
|
"entropy": 6.240371036529541,
|
|
"epoch": 2.1633006347374497,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00045400445257170725,
|
|
"loss": 5.6758,
|
|
"mean_token_accuracy": 0.2001010537147522,
|
|
"num_tokens": 47511354.0,
|
|
"step": 18745
|
|
},
|
|
{
|
|
"entropy": 6.279890441894532,
|
|
"epoch": 2.163877668782458,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004539794493615689,
|
|
"loss": 5.7464,
|
|
"mean_token_accuracy": 0.20213051587343217,
|
|
"num_tokens": 47523589.0,
|
|
"step": 18750
|
|
},
|
|
{
|
|
"entropy": 6.195033931732178,
|
|
"epoch": 2.164454702827467,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004539544401315458,
|
|
"loss": 5.6927,
|
|
"mean_token_accuracy": 0.20695994198322296,
|
|
"num_tokens": 47536784.0,
|
|
"step": 18755
|
|
},
|
|
{
|
|
"entropy": 6.260665416717529,
|
|
"epoch": 2.1650317368724754,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000453929424882479,
|
|
"loss": 5.633,
|
|
"mean_token_accuracy": 0.20660437643527985,
|
|
"num_tokens": 47550560.0,
|
|
"step": 18760
|
|
},
|
|
{
|
|
"entropy": 6.246667957305908,
|
|
"epoch": 2.1656087709174843,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045390440361520987,
|
|
"loss": 5.5635,
|
|
"mean_token_accuracy": 0.22506728023290634,
|
|
"num_tokens": 47564069.0,
|
|
"step": 18765
|
|
},
|
|
{
|
|
"entropy": 6.2478800296783445,
|
|
"epoch": 2.1661858049624927,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004538793763305799,
|
|
"loss": 5.6714,
|
|
"mean_token_accuracy": 0.19922966212034227,
|
|
"num_tokens": 47577570.0,
|
|
"step": 18770
|
|
},
|
|
{
|
|
"entropy": 6.254863834381103,
|
|
"epoch": 2.1667628390075016,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00045385434302943104,
|
|
"loss": 5.7292,
|
|
"mean_token_accuracy": 0.2031453251838684,
|
|
"num_tokens": 47590199.0,
|
|
"step": 18775
|
|
},
|
|
{
|
|
"entropy": 6.285591554641724,
|
|
"epoch": 2.16733987305251,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004538293037126052,
|
|
"loss": 5.6744,
|
|
"mean_token_accuracy": 0.20117084085941314,
|
|
"num_tokens": 47601697.0,
|
|
"step": 18780
|
|
},
|
|
{
|
|
"entropy": 6.296120595932007,
|
|
"epoch": 2.167916907097519,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00045380425838094444,
|
|
"loss": 5.7184,
|
|
"mean_token_accuracy": 0.19993578642606735,
|
|
"num_tokens": 47615331.0,
|
|
"step": 18785
|
|
},
|
|
{
|
|
"entropy": 6.217986249923706,
|
|
"epoch": 2.1684939411425272,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00045377920703529133,
|
|
"loss": 5.6688,
|
|
"mean_token_accuracy": 0.20416014790534973,
|
|
"num_tokens": 47628455.0,
|
|
"step": 18790
|
|
},
|
|
{
|
|
"entropy": 6.236662530899048,
|
|
"epoch": 2.169070975187536,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004537541496764885,
|
|
"loss": 5.632,
|
|
"mean_token_accuracy": 0.20659274458885193,
|
|
"num_tokens": 47642078.0,
|
|
"step": 18795
|
|
},
|
|
{
|
|
"entropy": 6.258144998550415,
|
|
"epoch": 2.1696480092325445,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004537290863053786,
|
|
"loss": 5.6747,
|
|
"mean_token_accuracy": 0.2031049832701683,
|
|
"num_tokens": 47653672.0,
|
|
"step": 18800
|
|
},
|
|
{
|
|
"entropy": 6.120979070663452,
|
|
"epoch": 2.1702250432775534,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00045370401692280455,
|
|
"loss": 5.5686,
|
|
"mean_token_accuracy": 0.20843469351530075,
|
|
"num_tokens": 47666085.0,
|
|
"step": 18805
|
|
},
|
|
{
|
|
"entropy": 6.304890823364258,
|
|
"epoch": 2.170802077322562,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00045367894152960976,
|
|
"loss": 5.7797,
|
|
"mean_token_accuracy": 0.19347210079431534,
|
|
"num_tokens": 47678180.0,
|
|
"step": 18810
|
|
},
|
|
{
|
|
"entropy": 6.284006977081299,
|
|
"epoch": 2.1713791113675707,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00045365386012663744,
|
|
"loss": 5.7109,
|
|
"mean_token_accuracy": 0.19503520876169206,
|
|
"num_tokens": 47690631.0,
|
|
"step": 18815
|
|
},
|
|
{
|
|
"entropy": 6.259499502182007,
|
|
"epoch": 2.1719561454125795,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00045362877271473137,
|
|
"loss": 5.6326,
|
|
"mean_token_accuracy": 0.20334458649158477,
|
|
"num_tokens": 47702577.0,
|
|
"step": 18820
|
|
},
|
|
{
|
|
"entropy": 6.2635283946990965,
|
|
"epoch": 2.172533179457588,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00045360367929473517,
|
|
"loss": 5.6859,
|
|
"mean_token_accuracy": 0.20750661194324493,
|
|
"num_tokens": 47714683.0,
|
|
"step": 18825
|
|
},
|
|
{
|
|
"entropy": 6.2828991413116455,
|
|
"epoch": 2.173110213502597,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.000453578579867493,
|
|
"loss": 5.6273,
|
|
"mean_token_accuracy": 0.20380921959877013,
|
|
"num_tokens": 47726202.0,
|
|
"step": 18830
|
|
},
|
|
{
|
|
"entropy": 6.223279047012329,
|
|
"epoch": 2.1736872475476052,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00045355347443384896,
|
|
"loss": 5.6476,
|
|
"mean_token_accuracy": 0.20528243482112885,
|
|
"num_tokens": 47740178.0,
|
|
"step": 18835
|
|
},
|
|
{
|
|
"entropy": 6.244608068466187,
|
|
"epoch": 2.174264281592614,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00045352836299464755,
|
|
"loss": 5.6788,
|
|
"mean_token_accuracy": 0.20205701440572738,
|
|
"num_tokens": 47752710.0,
|
|
"step": 18840
|
|
},
|
|
{
|
|
"entropy": 6.250746059417724,
|
|
"epoch": 2.1748413156376225,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004535032455507333,
|
|
"loss": 5.6218,
|
|
"mean_token_accuracy": 0.2027655079960823,
|
|
"num_tokens": 47765292.0,
|
|
"step": 18845
|
|
},
|
|
{
|
|
"entropy": 6.254888486862183,
|
|
"epoch": 2.1754183496826314,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00045347812210295107,
|
|
"loss": 5.6778,
|
|
"mean_token_accuracy": 0.19805543571710588,
|
|
"num_tokens": 47777799.0,
|
|
"step": 18850
|
|
},
|
|
{
|
|
"entropy": 6.272021627426147,
|
|
"epoch": 2.17599538372764,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00045345299265214583,
|
|
"loss": 5.6492,
|
|
"mean_token_accuracy": 0.20628771483898162,
|
|
"num_tokens": 47790705.0,
|
|
"step": 18855
|
|
},
|
|
{
|
|
"entropy": 6.225584030151367,
|
|
"epoch": 2.1765724177726486,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00045342785719916284,
|
|
"loss": 5.5986,
|
|
"mean_token_accuracy": 0.19875137656927108,
|
|
"num_tokens": 47802169.0,
|
|
"step": 18860
|
|
},
|
|
{
|
|
"entropy": 6.155571317672729,
|
|
"epoch": 2.177149451817657,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00045340271574484755,
|
|
"loss": 5.5336,
|
|
"mean_token_accuracy": 0.20996356904506683,
|
|
"num_tokens": 47815832.0,
|
|
"step": 18865
|
|
},
|
|
{
|
|
"entropy": 6.340555238723755,
|
|
"epoch": 2.177726485862666,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004533775682900454,
|
|
"loss": 5.7641,
|
|
"mean_token_accuracy": 0.19792629182338714,
|
|
"num_tokens": 47828967.0,
|
|
"step": 18870
|
|
},
|
|
{
|
|
"entropy": 6.216424942016602,
|
|
"epoch": 2.1783035199076743,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004533524148356025,
|
|
"loss": 5.6142,
|
|
"mean_token_accuracy": 0.21056083738803863,
|
|
"num_tokens": 47842114.0,
|
|
"step": 18875
|
|
},
|
|
{
|
|
"entropy": 6.117310237884522,
|
|
"epoch": 2.178880553952683,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004533272553823646,
|
|
"loss": 5.5741,
|
|
"mean_token_accuracy": 0.20430090874433518,
|
|
"num_tokens": 47855808.0,
|
|
"step": 18880
|
|
},
|
|
{
|
|
"entropy": 6.302039957046508,
|
|
"epoch": 2.179457587997692,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00045330208993117816,
|
|
"loss": 5.7289,
|
|
"mean_token_accuracy": 0.19179463237524033,
|
|
"num_tokens": 47866866.0,
|
|
"step": 18885
|
|
},
|
|
{
|
|
"entropy": 6.286647701263428,
|
|
"epoch": 2.1800346220427005,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004532769184828894,
|
|
"loss": 5.6727,
|
|
"mean_token_accuracy": 0.2016996130347252,
|
|
"num_tokens": 47878823.0,
|
|
"step": 18890
|
|
},
|
|
{
|
|
"entropy": 6.268312454223633,
|
|
"epoch": 2.1806116560877093,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004532517410383451,
|
|
"loss": 5.7583,
|
|
"mean_token_accuracy": 0.1968337342143059,
|
|
"num_tokens": 47890512.0,
|
|
"step": 18895
|
|
},
|
|
{
|
|
"entropy": 6.242161893844605,
|
|
"epoch": 2.1811886901327178,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000453226557598392,
|
|
"loss": 5.708,
|
|
"mean_token_accuracy": 0.19775693565607072,
|
|
"num_tokens": 47903728.0,
|
|
"step": 18900
|
|
},
|
|
{
|
|
"entropy": 6.29580249786377,
|
|
"epoch": 2.1817657241777266,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004532013681638771,
|
|
"loss": 5.7467,
|
|
"mean_token_accuracy": 0.1998975858092308,
|
|
"num_tokens": 47914742.0,
|
|
"step": 18905
|
|
},
|
|
{
|
|
"entropy": 6.32392201423645,
|
|
"epoch": 2.182342758222735,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004531761727356478,
|
|
"loss": 5.7328,
|
|
"mean_token_accuracy": 0.19939059615135193,
|
|
"num_tokens": 47926737.0,
|
|
"step": 18910
|
|
},
|
|
{
|
|
"entropy": 6.257878255844116,
|
|
"epoch": 2.182919792267744,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004531509713145514,
|
|
"loss": 5.6638,
|
|
"mean_token_accuracy": 0.20171019285917283,
|
|
"num_tokens": 47941207.0,
|
|
"step": 18915
|
|
},
|
|
{
|
|
"entropy": 6.257398414611816,
|
|
"epoch": 2.1834968263127523,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00045312576390143557,
|
|
"loss": 5.7509,
|
|
"mean_token_accuracy": 0.19138018190860748,
|
|
"num_tokens": 47953640.0,
|
|
"step": 18920
|
|
},
|
|
{
|
|
"entropy": 6.2764183521270756,
|
|
"epoch": 2.184073860357761,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00045310055049714815,
|
|
"loss": 5.7342,
|
|
"mean_token_accuracy": 0.20488953590393066,
|
|
"num_tokens": 47966399.0,
|
|
"step": 18925
|
|
},
|
|
{
|
|
"entropy": 6.283313941955567,
|
|
"epoch": 2.1846508944027696,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00045307533110253726,
|
|
"loss": 5.6533,
|
|
"mean_token_accuracy": 0.20482224971055984,
|
|
"num_tokens": 47979521.0,
|
|
"step": 18930
|
|
},
|
|
{
|
|
"entropy": 6.287374973297119,
|
|
"epoch": 2.1852279284477785,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045305010571845096,
|
|
"loss": 5.7341,
|
|
"mean_token_accuracy": 0.20170841217041016,
|
|
"num_tokens": 47992780.0,
|
|
"step": 18935
|
|
},
|
|
{
|
|
"entropy": 6.314225530624389,
|
|
"epoch": 2.185804962492787,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004530248743457378,
|
|
"loss": 5.7519,
|
|
"mean_token_accuracy": 0.19808263331651688,
|
|
"num_tokens": 48005548.0,
|
|
"step": 18940
|
|
},
|
|
{
|
|
"entropy": 6.2541357517242435,
|
|
"epoch": 2.1863819965377957,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004529996369852465,
|
|
"loss": 5.6555,
|
|
"mean_token_accuracy": 0.2016634613275528,
|
|
"num_tokens": 48017352.0,
|
|
"step": 18945
|
|
},
|
|
{
|
|
"entropy": 6.124024057388306,
|
|
"epoch": 2.1869590305828046,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00045297439363782576,
|
|
"loss": 5.4849,
|
|
"mean_token_accuracy": 0.21912779062986373,
|
|
"num_tokens": 48029252.0,
|
|
"step": 18950
|
|
},
|
|
{
|
|
"entropy": 6.261006593704224,
|
|
"epoch": 2.187536064627813,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004529491443043247,
|
|
"loss": 5.7477,
|
|
"mean_token_accuracy": 0.20232635885477065,
|
|
"num_tokens": 48041534.0,
|
|
"step": 18955
|
|
},
|
|
{
|
|
"entropy": 6.252580547332764,
|
|
"epoch": 2.188113098672822,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004529238889855926,
|
|
"loss": 5.7354,
|
|
"mean_token_accuracy": 0.19888463020324706,
|
|
"num_tokens": 48054396.0,
|
|
"step": 18960
|
|
},
|
|
{
|
|
"entropy": 6.259010362625122,
|
|
"epoch": 2.1886901327178303,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004528986276824789,
|
|
"loss": 5.7195,
|
|
"mean_token_accuracy": 0.1986936628818512,
|
|
"num_tokens": 48066785.0,
|
|
"step": 18965
|
|
},
|
|
{
|
|
"entropy": 6.207064390182495,
|
|
"epoch": 2.189267166762839,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004528733603958331,
|
|
"loss": 5.6582,
|
|
"mean_token_accuracy": 0.20980920046567916,
|
|
"num_tokens": 48079837.0,
|
|
"step": 18970
|
|
},
|
|
{
|
|
"entropy": 6.275537204742432,
|
|
"epoch": 2.1898442008078476,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004528480871265053,
|
|
"loss": 5.659,
|
|
"mean_token_accuracy": 0.20257765352725982,
|
|
"num_tokens": 48091670.0,
|
|
"step": 18975
|
|
},
|
|
{
|
|
"entropy": 6.2916429996490475,
|
|
"epoch": 2.1904212348528564,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00045282280787534537,
|
|
"loss": 5.7575,
|
|
"mean_token_accuracy": 0.19688573181629182,
|
|
"num_tokens": 48105261.0,
|
|
"step": 18980
|
|
},
|
|
{
|
|
"entropy": 6.2920839309692385,
|
|
"epoch": 2.190998268897865,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004527975226432036,
|
|
"loss": 5.6593,
|
|
"mean_token_accuracy": 0.1986699342727661,
|
|
"num_tokens": 48118272.0,
|
|
"step": 18985
|
|
},
|
|
{
|
|
"entropy": 6.237543535232544,
|
|
"epoch": 2.1915753029428737,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00045277223143093057,
|
|
"loss": 5.7048,
|
|
"mean_token_accuracy": 0.199216428399086,
|
|
"num_tokens": 48130413.0,
|
|
"step": 18990
|
|
},
|
|
{
|
|
"entropy": 6.267915391921997,
|
|
"epoch": 2.192152336987882,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00045274693423937674,
|
|
"loss": 5.6509,
|
|
"mean_token_accuracy": 0.2026078313589096,
|
|
"num_tokens": 48143308.0,
|
|
"step": 18995
|
|
},
|
|
{
|
|
"entropy": 6.2021924495697025,
|
|
"epoch": 2.192729371032891,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00045272163106939314,
|
|
"loss": 5.6053,
|
|
"mean_token_accuracy": 0.21072281152009964,
|
|
"num_tokens": 48155832.0,
|
|
"step": 19000
|
|
},
|
|
{
|
|
"entropy": 6.262426471710205,
|
|
"epoch": 2.1933064050778994,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00045269632192183076,
|
|
"loss": 5.7341,
|
|
"mean_token_accuracy": 0.1992826998233795,
|
|
"num_tokens": 48168390.0,
|
|
"step": 19005
|
|
},
|
|
{
|
|
"entropy": 6.279296064376831,
|
|
"epoch": 2.1938834391229083,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045267100679754075,
|
|
"loss": 5.7556,
|
|
"mean_token_accuracy": 0.19007308334112166,
|
|
"num_tokens": 48180918.0,
|
|
"step": 19010
|
|
},
|
|
{
|
|
"entropy": 6.300954580307007,
|
|
"epoch": 2.1944604731679167,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004526456856973748,
|
|
"loss": 5.702,
|
|
"mean_token_accuracy": 0.2015950232744217,
|
|
"num_tokens": 48194251.0,
|
|
"step": 19015
|
|
},
|
|
{
|
|
"entropy": 6.320611667633057,
|
|
"epoch": 2.1950375072129256,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004526203586221844,
|
|
"loss": 5.6978,
|
|
"mean_token_accuracy": 0.19965052008628845,
|
|
"num_tokens": 48206704.0,
|
|
"step": 19020
|
|
},
|
|
{
|
|
"entropy": 6.252124881744384,
|
|
"epoch": 2.1956145412579344,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00045259502557282145,
|
|
"loss": 5.6983,
|
|
"mean_token_accuracy": 0.20150818079710006,
|
|
"num_tokens": 48219390.0,
|
|
"step": 19025
|
|
},
|
|
{
|
|
"entropy": 6.201693296432495,
|
|
"epoch": 2.196191575302943,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004525696865501381,
|
|
"loss": 5.6442,
|
|
"mean_token_accuracy": 0.20039039254188537,
|
|
"num_tokens": 48231555.0,
|
|
"step": 19030
|
|
},
|
|
{
|
|
"entropy": 6.316070938110352,
|
|
"epoch": 2.1967686093479517,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004525443415549865,
|
|
"loss": 5.7185,
|
|
"mean_token_accuracy": 0.1988256499171257,
|
|
"num_tokens": 48243763.0,
|
|
"step": 19035
|
|
},
|
|
{
|
|
"entropy": 6.276049470901489,
|
|
"epoch": 2.19734564339296,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00045251899058821915,
|
|
"loss": 5.7118,
|
|
"mean_token_accuracy": 0.1995232343673706,
|
|
"num_tokens": 48257567.0,
|
|
"step": 19040
|
|
},
|
|
{
|
|
"entropy": 6.211150360107422,
|
|
"epoch": 2.197922677437969,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004524936336506887,
|
|
"loss": 5.62,
|
|
"mean_token_accuracy": 0.20634069442749023,
|
|
"num_tokens": 48270313.0,
|
|
"step": 19045
|
|
},
|
|
{
|
|
"entropy": 6.260643768310547,
|
|
"epoch": 2.1984997114829774,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004524682707432482,
|
|
"loss": 5.6012,
|
|
"mean_token_accuracy": 0.20677340775728226,
|
|
"num_tokens": 48282768.0,
|
|
"step": 19050
|
|
},
|
|
{
|
|
"entropy": 6.219102239608764,
|
|
"epoch": 2.1990767455279863,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00045244290186675034,
|
|
"loss": 5.6517,
|
|
"mean_token_accuracy": 0.20461307764053344,
|
|
"num_tokens": 48293861.0,
|
|
"step": 19055
|
|
},
|
|
{
|
|
"entropy": 6.2349823951721195,
|
|
"epoch": 2.1996537795729947,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004524175270220489,
|
|
"loss": 5.5988,
|
|
"mean_token_accuracy": 0.21154738813638688,
|
|
"num_tokens": 48306062.0,
|
|
"step": 19060
|
|
},
|
|
{
|
|
"entropy": 6.280507040023804,
|
|
"epoch": 2.2002308136180035,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00045239214620999683,
|
|
"loss": 5.7174,
|
|
"mean_token_accuracy": 0.1978029727935791,
|
|
"num_tokens": 48318777.0,
|
|
"step": 19065
|
|
},
|
|
{
|
|
"entropy": 6.264151763916016,
|
|
"epoch": 2.200807847663012,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004523667594314481,
|
|
"loss": 5.6984,
|
|
"mean_token_accuracy": 0.1989084467291832,
|
|
"num_tokens": 48330575.0,
|
|
"step": 19070
|
|
},
|
|
{
|
|
"entropy": 6.1020753383636475,
|
|
"epoch": 2.201384881708021,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00045234136668725655,
|
|
"loss": 5.5308,
|
|
"mean_token_accuracy": 0.21237103641033173,
|
|
"num_tokens": 48343980.0,
|
|
"step": 19075
|
|
},
|
|
{
|
|
"entropy": 6.1847601413726805,
|
|
"epoch": 2.2019619157530292,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00045231596797827616,
|
|
"loss": 5.6036,
|
|
"mean_token_accuracy": 0.2041487902402878,
|
|
"num_tokens": 48356140.0,
|
|
"step": 19080
|
|
},
|
|
{
|
|
"entropy": 6.245753765106201,
|
|
"epoch": 2.202538949798038,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00045229056330536134,
|
|
"loss": 5.6988,
|
|
"mean_token_accuracy": 0.20395198315382004,
|
|
"num_tokens": 48367756.0,
|
|
"step": 19085
|
|
},
|
|
{
|
|
"entropy": 6.229965162277222,
|
|
"epoch": 2.2031159838430465,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00045226515266936644,
|
|
"loss": 5.6839,
|
|
"mean_token_accuracy": 0.19726950377225877,
|
|
"num_tokens": 48381637.0,
|
|
"step": 19090
|
|
},
|
|
{
|
|
"entropy": 6.252473640441894,
|
|
"epoch": 2.2036930178880554,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004522397360711462,
|
|
"loss": 5.6362,
|
|
"mean_token_accuracy": 0.20076129734516143,
|
|
"num_tokens": 48394593.0,
|
|
"step": 19095
|
|
},
|
|
{
|
|
"entropy": 6.203752708435059,
|
|
"epoch": 2.2042700519330642,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004522143135115555,
|
|
"loss": 5.6111,
|
|
"mean_token_accuracy": 0.20537707656621934,
|
|
"num_tokens": 48408555.0,
|
|
"step": 19100
|
|
},
|
|
{
|
|
"entropy": 6.2377259731292725,
|
|
"epoch": 2.2048470859780727,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00045218888499144933,
|
|
"loss": 5.6602,
|
|
"mean_token_accuracy": 0.2072727635502815,
|
|
"num_tokens": 48420359.0,
|
|
"step": 19105
|
|
},
|
|
{
|
|
"entropy": 6.29434232711792,
|
|
"epoch": 2.2054241200230815,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00045216345051168314,
|
|
"loss": 5.7992,
|
|
"mean_token_accuracy": 0.1885974407196045,
|
|
"num_tokens": 48432516.0,
|
|
"step": 19110
|
|
},
|
|
{
|
|
"entropy": 6.259411954879761,
|
|
"epoch": 2.20600115406809,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004521380100731122,
|
|
"loss": 5.6699,
|
|
"mean_token_accuracy": 0.2050180107355118,
|
|
"num_tokens": 48444355.0,
|
|
"step": 19115
|
|
},
|
|
{
|
|
"entropy": 6.1959943771362305,
|
|
"epoch": 2.206578188113099,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00045211256367659234,
|
|
"loss": 5.5727,
|
|
"mean_token_accuracy": 0.21873999536037445,
|
|
"num_tokens": 48458341.0,
|
|
"step": 19120
|
|
},
|
|
{
|
|
"entropy": 6.244530487060547,
|
|
"epoch": 2.207155222158107,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004520871113229793,
|
|
"loss": 5.6865,
|
|
"mean_token_accuracy": 0.20000386238098145,
|
|
"num_tokens": 48471473.0,
|
|
"step": 19125
|
|
},
|
|
{
|
|
"entropy": 6.241182041168213,
|
|
"epoch": 2.207732256203116,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00045206165301312927,
|
|
"loss": 5.6741,
|
|
"mean_token_accuracy": 0.20176537930965424,
|
|
"num_tokens": 48483149.0,
|
|
"step": 19130
|
|
},
|
|
{
|
|
"entropy": 6.240596342086792,
|
|
"epoch": 2.2083092902481245,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004520361887478985,
|
|
"loss": 5.6755,
|
|
"mean_token_accuracy": 0.20530891567468643,
|
|
"num_tokens": 48495617.0,
|
|
"step": 19135
|
|
},
|
|
{
|
|
"entropy": 6.135921144485474,
|
|
"epoch": 2.2088863242931334,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004520107185281435,
|
|
"loss": 5.632,
|
|
"mean_token_accuracy": 0.20589762777090073,
|
|
"num_tokens": 48509391.0,
|
|
"step": 19140
|
|
},
|
|
{
|
|
"entropy": 6.165386486053467,
|
|
"epoch": 2.209463358338142,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004519852423547208,
|
|
"loss": 5.5958,
|
|
"mean_token_accuracy": 0.21079403162002563,
|
|
"num_tokens": 48523127.0,
|
|
"step": 19145
|
|
},
|
|
{
|
|
"entropy": 6.156606769561767,
|
|
"epoch": 2.2100403923831506,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004519597602284875,
|
|
"loss": 5.569,
|
|
"mean_token_accuracy": 0.21757976710796356,
|
|
"num_tokens": 48536797.0,
|
|
"step": 19150
|
|
},
|
|
{
|
|
"entropy": 6.263695287704468,
|
|
"epoch": 2.210617426428159,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004519342721503005,
|
|
"loss": 5.6717,
|
|
"mean_token_accuracy": 0.20158991515636443,
|
|
"num_tokens": 48549088.0,
|
|
"step": 19155
|
|
},
|
|
{
|
|
"entropy": 6.259319400787353,
|
|
"epoch": 2.211194460473168,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004519087781210171,
|
|
"loss": 5.6259,
|
|
"mean_token_accuracy": 0.20565885156393052,
|
|
"num_tokens": 48560451.0,
|
|
"step": 19160
|
|
},
|
|
{
|
|
"entropy": 6.2218138694763185,
|
|
"epoch": 2.2117714945181763,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.000451883278141495,
|
|
"loss": 5.6,
|
|
"mean_token_accuracy": 0.2046360641717911,
|
|
"num_tokens": 48572870.0,
|
|
"step": 19165
|
|
},
|
|
{
|
|
"entropy": 6.205379390716553,
|
|
"epoch": 2.212348528563185,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00045185777221259157,
|
|
"loss": 5.6622,
|
|
"mean_token_accuracy": 0.19950393736362457,
|
|
"num_tokens": 48585909.0,
|
|
"step": 19170
|
|
},
|
|
{
|
|
"entropy": 6.264685201644897,
|
|
"epoch": 2.212925562608194,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004518322603351648,
|
|
"loss": 5.649,
|
|
"mean_token_accuracy": 0.20917298644781113,
|
|
"num_tokens": 48599157.0,
|
|
"step": 19175
|
|
},
|
|
{
|
|
"entropy": 6.264721012115478,
|
|
"epoch": 2.2135025966532025,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00045180674251007287,
|
|
"loss": 5.6516,
|
|
"mean_token_accuracy": 0.20502317547798157,
|
|
"num_tokens": 48611740.0,
|
|
"step": 19180
|
|
},
|
|
{
|
|
"entropy": 6.279746770858765,
|
|
"epoch": 2.2140796306982113,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00045178121873817395,
|
|
"loss": 5.7617,
|
|
"mean_token_accuracy": 0.19199493378400803,
|
|
"num_tokens": 48624893.0,
|
|
"step": 19185
|
|
},
|
|
{
|
|
"entropy": 6.243294429779053,
|
|
"epoch": 2.2146566647432198,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004517556890203265,
|
|
"loss": 5.6802,
|
|
"mean_token_accuracy": 0.19957953989505767,
|
|
"num_tokens": 48636414.0,
|
|
"step": 19190
|
|
},
|
|
{
|
|
"entropy": 6.1810681343078615,
|
|
"epoch": 2.2152336987882286,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00045173015335738925,
|
|
"loss": 5.6405,
|
|
"mean_token_accuracy": 0.2053627386689186,
|
|
"num_tokens": 48649936.0,
|
|
"step": 19195
|
|
},
|
|
{
|
|
"entropy": 6.246352767944336,
|
|
"epoch": 2.215810732833237,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00045170461175022116,
|
|
"loss": 5.6136,
|
|
"mean_token_accuracy": 0.2143157973885536,
|
|
"num_tokens": 48662857.0,
|
|
"step": 19200
|
|
},
|
|
{
|
|
"entropy": 6.24592604637146,
|
|
"epoch": 2.216387766878246,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004516790641996812,
|
|
"loss": 5.6692,
|
|
"mean_token_accuracy": 0.2003368243575096,
|
|
"num_tokens": 48675087.0,
|
|
"step": 19205
|
|
},
|
|
{
|
|
"entropy": 6.176522159576416,
|
|
"epoch": 2.2169648009232543,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004516535107066286,
|
|
"loss": 5.5978,
|
|
"mean_token_accuracy": 0.20065319836139678,
|
|
"num_tokens": 48687575.0,
|
|
"step": 19210
|
|
},
|
|
{
|
|
"entropy": 6.234763860702515,
|
|
"epoch": 2.217541834968263,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00045162795127192296,
|
|
"loss": 5.6368,
|
|
"mean_token_accuracy": 0.19902375042438508,
|
|
"num_tokens": 48701115.0,
|
|
"step": 19215
|
|
},
|
|
{
|
|
"entropy": 6.293993902206421,
|
|
"epoch": 2.2181188690132716,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.000451602385896424,
|
|
"loss": 5.7558,
|
|
"mean_token_accuracy": 0.1977062702178955,
|
|
"num_tokens": 48713738.0,
|
|
"step": 19220
|
|
},
|
|
{
|
|
"entropy": 6.202127361297608,
|
|
"epoch": 2.2186959030582805,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00045157681458099145,
|
|
"loss": 5.5793,
|
|
"mean_token_accuracy": 0.20735561102628708,
|
|
"num_tokens": 48725282.0,
|
|
"step": 19225
|
|
},
|
|
{
|
|
"entropy": 6.219801712036133,
|
|
"epoch": 2.2192729371032893,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004515512373264854,
|
|
"loss": 5.6486,
|
|
"mean_token_accuracy": 0.2041847363114357,
|
|
"num_tokens": 48738476.0,
|
|
"step": 19230
|
|
},
|
|
{
|
|
"entropy": 6.260962247848511,
|
|
"epoch": 2.2198499711482977,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00045152565413376623,
|
|
"loss": 5.6571,
|
|
"mean_token_accuracy": 0.2018562912940979,
|
|
"num_tokens": 48751447.0,
|
|
"step": 19235
|
|
},
|
|
{
|
|
"entropy": 6.275470876693726,
|
|
"epoch": 2.2204270051933066,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004515000650036944,
|
|
"loss": 5.7167,
|
|
"mean_token_accuracy": 0.19641314595937728,
|
|
"num_tokens": 48764124.0,
|
|
"step": 19240
|
|
},
|
|
{
|
|
"entropy": 6.284907484054566,
|
|
"epoch": 2.221004039238315,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004514744699371305,
|
|
"loss": 5.7523,
|
|
"mean_token_accuracy": 0.1944175183773041,
|
|
"num_tokens": 48776414.0,
|
|
"step": 19245
|
|
},
|
|
{
|
|
"entropy": 6.267220830917358,
|
|
"epoch": 2.221581073283324,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00045144886893493547,
|
|
"loss": 5.6725,
|
|
"mean_token_accuracy": 0.1995649054646492,
|
|
"num_tokens": 48789318.0,
|
|
"step": 19250
|
|
},
|
|
{
|
|
"entropy": 6.132220125198364,
|
|
"epoch": 2.2221581073283323,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00045142326199797047,
|
|
"loss": 5.6118,
|
|
"mean_token_accuracy": 0.21107657998800278,
|
|
"num_tokens": 48801773.0,
|
|
"step": 19255
|
|
},
|
|
{
|
|
"entropy": 6.277349853515625,
|
|
"epoch": 2.222735141373341,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00045139764912709656,
|
|
"loss": 5.6264,
|
|
"mean_token_accuracy": 0.20283719897270203,
|
|
"num_tokens": 48814137.0,
|
|
"step": 19260
|
|
},
|
|
{
|
|
"entropy": 6.262899732589721,
|
|
"epoch": 2.2233121754183496,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004513720303231754,
|
|
"loss": 5.6507,
|
|
"mean_token_accuracy": 0.20469385832548143,
|
|
"num_tokens": 48826129.0,
|
|
"step": 19265
|
|
},
|
|
{
|
|
"entropy": 6.253290843963623,
|
|
"epoch": 2.2238892094633584,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045134640558706864,
|
|
"loss": 5.6963,
|
|
"mean_token_accuracy": 0.20241008698940277,
|
|
"num_tokens": 48838930.0,
|
|
"step": 19270
|
|
},
|
|
{
|
|
"entropy": 6.318625593185425,
|
|
"epoch": 2.224466243508367,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000451320774919638,
|
|
"loss": 5.6563,
|
|
"mean_token_accuracy": 0.19929049760103226,
|
|
"num_tokens": 48851506.0,
|
|
"step": 19275
|
|
},
|
|
{
|
|
"entropy": 6.214009761810303,
|
|
"epoch": 2.2250432775533757,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00045129513832174587,
|
|
"loss": 5.5768,
|
|
"mean_token_accuracy": 0.21026210784912108,
|
|
"num_tokens": 48865267.0,
|
|
"step": 19280
|
|
},
|
|
{
|
|
"entropy": 6.187762832641601,
|
|
"epoch": 2.225620311598384,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00045126949579425414,
|
|
"loss": 5.6747,
|
|
"mean_token_accuracy": 0.2047516793012619,
|
|
"num_tokens": 48877642.0,
|
|
"step": 19285
|
|
},
|
|
{
|
|
"entropy": 6.310758638381958,
|
|
"epoch": 2.226197345643393,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045124384733802563,
|
|
"loss": 5.7544,
|
|
"mean_token_accuracy": 0.19669358879327775,
|
|
"num_tokens": 48891135.0,
|
|
"step": 19290
|
|
},
|
|
{
|
|
"entropy": 6.310164165496826,
|
|
"epoch": 2.2267743796884014,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004512181929539228,
|
|
"loss": 5.7155,
|
|
"mean_token_accuracy": 0.1991264522075653,
|
|
"num_tokens": 48904361.0,
|
|
"step": 19295
|
|
},
|
|
{
|
|
"entropy": 6.211184453964234,
|
|
"epoch": 2.2273514137334103,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00045119253264280855,
|
|
"loss": 5.7157,
|
|
"mean_token_accuracy": 0.20109605193138122,
|
|
"num_tokens": 48916497.0,
|
|
"step": 19300
|
|
},
|
|
{
|
|
"entropy": 6.246825551986694,
|
|
"epoch": 2.227928447778419,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00045116686640554607,
|
|
"loss": 5.6756,
|
|
"mean_token_accuracy": 0.2026742219924927,
|
|
"num_tokens": 48928476.0,
|
|
"step": 19305
|
|
},
|
|
{
|
|
"entropy": 6.254496431350708,
|
|
"epoch": 2.2285054818234276,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00045114119424299843,
|
|
"loss": 5.6985,
|
|
"mean_token_accuracy": 0.20265805274248122,
|
|
"num_tokens": 48942153.0,
|
|
"step": 19310
|
|
},
|
|
{
|
|
"entropy": 6.306353569030762,
|
|
"epoch": 2.2290825158684364,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004511155161560293,
|
|
"loss": 5.7238,
|
|
"mean_token_accuracy": 0.20385703891515733,
|
|
"num_tokens": 48955313.0,
|
|
"step": 19315
|
|
},
|
|
{
|
|
"entropy": 6.243967485427857,
|
|
"epoch": 2.229659549913445,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00045108983214550225,
|
|
"loss": 5.6316,
|
|
"mean_token_accuracy": 0.2051597759127617,
|
|
"num_tokens": 48967875.0,
|
|
"step": 19320
|
|
},
|
|
{
|
|
"entropy": 6.336811971664429,
|
|
"epoch": 2.2302365839584537,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004510641422122811,
|
|
"loss": 5.7014,
|
|
"mean_token_accuracy": 0.196072755753994,
|
|
"num_tokens": 48979534.0,
|
|
"step": 19325
|
|
},
|
|
{
|
|
"entropy": 6.326515102386475,
|
|
"epoch": 2.230813618003462,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045103844635723005,
|
|
"loss": 5.731,
|
|
"mean_token_accuracy": 0.19862714260816575,
|
|
"num_tokens": 48991425.0,
|
|
"step": 19330
|
|
},
|
|
{
|
|
"entropy": 6.201512050628662,
|
|
"epoch": 2.231390652048471,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00045101274458121335,
|
|
"loss": 5.6194,
|
|
"mean_token_accuracy": 0.20665293782949448,
|
|
"num_tokens": 49003783.0,
|
|
"step": 19335
|
|
},
|
|
{
|
|
"entropy": 6.269555282592774,
|
|
"epoch": 2.2319676860934794,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00045098703688509537,
|
|
"loss": 5.7233,
|
|
"mean_token_accuracy": 0.1967211216688156,
|
|
"num_tokens": 49017998.0,
|
|
"step": 19340
|
|
},
|
|
{
|
|
"entropy": 6.313391923904419,
|
|
"epoch": 2.2325447201384883,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004509613232697408,
|
|
"loss": 5.7499,
|
|
"mean_token_accuracy": 0.19863232374191284,
|
|
"num_tokens": 49030429.0,
|
|
"step": 19345
|
|
},
|
|
{
|
|
"entropy": 6.254202842712402,
|
|
"epoch": 2.2331217541834967,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004509356037360145,
|
|
"loss": 5.6359,
|
|
"mean_token_accuracy": 0.2076195076107979,
|
|
"num_tokens": 49043619.0,
|
|
"step": 19350
|
|
},
|
|
{
|
|
"entropy": 6.298452854156494,
|
|
"epoch": 2.2336987882285055,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004509098782847816,
|
|
"loss": 5.6961,
|
|
"mean_token_accuracy": 0.19885571599006652,
|
|
"num_tokens": 49056674.0,
|
|
"step": 19355
|
|
},
|
|
{
|
|
"entropy": 6.241327381134033,
|
|
"epoch": 2.234275822273514,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004508841469169073,
|
|
"loss": 5.7308,
|
|
"mean_token_accuracy": 0.1998901277780533,
|
|
"num_tokens": 49069616.0,
|
|
"step": 19360
|
|
},
|
|
{
|
|
"entropy": 6.208149719238281,
|
|
"epoch": 2.234852856318523,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00045085840963325716,
|
|
"loss": 5.6743,
|
|
"mean_token_accuracy": 0.20631023645401,
|
|
"num_tokens": 49082001.0,
|
|
"step": 19365
|
|
},
|
|
{
|
|
"entropy": 6.286288022994995,
|
|
"epoch": 2.2354298903635312,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004508326664346967,
|
|
"loss": 5.6213,
|
|
"mean_token_accuracy": 0.20303625017404556,
|
|
"num_tokens": 49094433.0,
|
|
"step": 19370
|
|
},
|
|
{
|
|
"entropy": 6.2155601501464846,
|
|
"epoch": 2.23600692440854,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00045080691732209176,
|
|
"loss": 5.6239,
|
|
"mean_token_accuracy": 0.20596866607666015,
|
|
"num_tokens": 49106152.0,
|
|
"step": 19375
|
|
},
|
|
{
|
|
"entropy": 6.198886299133301,
|
|
"epoch": 2.236583958453549,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00045078116229630864,
|
|
"loss": 5.7094,
|
|
"mean_token_accuracy": 0.20838077068328859,
|
|
"num_tokens": 49120402.0,
|
|
"step": 19380
|
|
},
|
|
{
|
|
"entropy": 6.408450603485107,
|
|
"epoch": 2.2371609924985574,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00045075540135821343,
|
|
"loss": 5.8063,
|
|
"mean_token_accuracy": 0.19086912870407105,
|
|
"num_tokens": 49133571.0,
|
|
"step": 19385
|
|
},
|
|
{
|
|
"entropy": 6.3284543514251705,
|
|
"epoch": 2.2377380265435662,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004507296345086725,
|
|
"loss": 5.7951,
|
|
"mean_token_accuracy": 0.19179506003856658,
|
|
"num_tokens": 49147268.0,
|
|
"step": 19390
|
|
},
|
|
{
|
|
"entropy": 6.211698198318482,
|
|
"epoch": 2.2383150605885747,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004507038617485526,
|
|
"loss": 5.5474,
|
|
"mean_token_accuracy": 0.2093621775507927,
|
|
"num_tokens": 49159043.0,
|
|
"step": 19395
|
|
},
|
|
{
|
|
"entropy": 6.28239483833313,
|
|
"epoch": 2.2388920946335835,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00045067808307872064,
|
|
"loss": 5.6941,
|
|
"mean_token_accuracy": 0.20465970486402513,
|
|
"num_tokens": 49172164.0,
|
|
"step": 19400
|
|
},
|
|
{
|
|
"entropy": 6.266603231430054,
|
|
"epoch": 2.239469128678592,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00045065229850004365,
|
|
"loss": 5.6229,
|
|
"mean_token_accuracy": 0.20876996964216232,
|
|
"num_tokens": 49185023.0,
|
|
"step": 19405
|
|
},
|
|
{
|
|
"entropy": 6.300706672668457,
|
|
"epoch": 2.240046162723601,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004506265080133888,
|
|
"loss": 5.6982,
|
|
"mean_token_accuracy": 0.1954214468598366,
|
|
"num_tokens": 49198411.0,
|
|
"step": 19410
|
|
},
|
|
{
|
|
"entropy": 6.233200168609619,
|
|
"epoch": 2.240623196768609,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00045060071161962364,
|
|
"loss": 5.6973,
|
|
"mean_token_accuracy": 0.20337700098752975,
|
|
"num_tokens": 49211162.0,
|
|
"step": 19415
|
|
},
|
|
{
|
|
"entropy": 6.248962163925171,
|
|
"epoch": 2.241200230813618,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004505749093196158,
|
|
"loss": 5.7028,
|
|
"mean_token_accuracy": 0.2015640914440155,
|
|
"num_tokens": 49223808.0,
|
|
"step": 19420
|
|
},
|
|
{
|
|
"entropy": 6.173385334014893,
|
|
"epoch": 2.2417772648586265,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.000450549101114233,
|
|
"loss": 5.6418,
|
|
"mean_token_accuracy": 0.20374636054039003,
|
|
"num_tokens": 49236947.0,
|
|
"step": 19425
|
|
},
|
|
{
|
|
"entropy": 6.301487636566162,
|
|
"epoch": 2.2423542989036354,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004505232870043434,
|
|
"loss": 5.7153,
|
|
"mean_token_accuracy": 0.19642379581928254,
|
|
"num_tokens": 49249932.0,
|
|
"step": 19430
|
|
},
|
|
{
|
|
"entropy": 6.284289312362671,
|
|
"epoch": 2.2429313329486438,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004504974669908152,
|
|
"loss": 5.7306,
|
|
"mean_token_accuracy": 0.1982482597231865,
|
|
"num_tokens": 49261783.0,
|
|
"step": 19435
|
|
},
|
|
{
|
|
"entropy": 6.331235694885254,
|
|
"epoch": 2.2435083669936526,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00045047164107451696,
|
|
"loss": 5.7267,
|
|
"mean_token_accuracy": 0.19769036918878555,
|
|
"num_tokens": 49274495.0,
|
|
"step": 19440
|
|
},
|
|
{
|
|
"entropy": 6.240282869338989,
|
|
"epoch": 2.244085401038661,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004504458092563172,
|
|
"loss": 5.6726,
|
|
"mean_token_accuracy": 0.19854051172733306,
|
|
"num_tokens": 49288450.0,
|
|
"step": 19445
|
|
},
|
|
{
|
|
"entropy": 6.273891544342041,
|
|
"epoch": 2.24466243508367,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00045041997153708475,
|
|
"loss": 5.7222,
|
|
"mean_token_accuracy": 0.1992565721273422,
|
|
"num_tokens": 49300612.0,
|
|
"step": 19450
|
|
},
|
|
{
|
|
"entropy": 6.257104921340942,
|
|
"epoch": 2.2452394691286788,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00045039412791768877,
|
|
"loss": 5.7277,
|
|
"mean_token_accuracy": 0.19571390450000764,
|
|
"num_tokens": 49313860.0,
|
|
"step": 19455
|
|
},
|
|
{
|
|
"entropy": 6.289849805831909,
|
|
"epoch": 2.245816503173687,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00045036827839899833,
|
|
"loss": 5.6777,
|
|
"mean_token_accuracy": 0.20335286408662795,
|
|
"num_tokens": 49326864.0,
|
|
"step": 19460
|
|
},
|
|
{
|
|
"entropy": 6.28691840171814,
|
|
"epoch": 2.246393537218696,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00045034242298188303,
|
|
"loss": 5.7374,
|
|
"mean_token_accuracy": 0.19382706582546233,
|
|
"num_tokens": 49339444.0,
|
|
"step": 19465
|
|
},
|
|
{
|
|
"entropy": 6.206280183792114,
|
|
"epoch": 2.2469705712637045,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004503165616672124,
|
|
"loss": 5.6207,
|
|
"mean_token_accuracy": 0.2063739761710167,
|
|
"num_tokens": 49352999.0,
|
|
"step": 19470
|
|
},
|
|
{
|
|
"entropy": 6.250473546981811,
|
|
"epoch": 2.2475476053087133,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004502906944558563,
|
|
"loss": 5.6508,
|
|
"mean_token_accuracy": 0.20927198231220245,
|
|
"num_tokens": 49365600.0,
|
|
"step": 19475
|
|
},
|
|
{
|
|
"entropy": 6.343959617614746,
|
|
"epoch": 2.2481246393537218,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004502648213486848,
|
|
"loss": 5.7295,
|
|
"mean_token_accuracy": 0.20067790150642395,
|
|
"num_tokens": 49378121.0,
|
|
"step": 19480
|
|
},
|
|
{
|
|
"entropy": 6.210190200805664,
|
|
"epoch": 2.2487016733987306,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00045023894234656807,
|
|
"loss": 5.7057,
|
|
"mean_token_accuracy": 0.20189868211746215,
|
|
"num_tokens": 49390889.0,
|
|
"step": 19485
|
|
},
|
|
{
|
|
"entropy": 6.330983686447143,
|
|
"epoch": 2.249278707443739,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004502130574503766,
|
|
"loss": 5.7592,
|
|
"mean_token_accuracy": 0.20028941184282303,
|
|
"num_tokens": 49404613.0,
|
|
"step": 19490
|
|
},
|
|
{
|
|
"entropy": 6.301862335205078,
|
|
"epoch": 2.249855741488748,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004501871666609809,
|
|
"loss": 5.7354,
|
|
"mean_token_accuracy": 0.19650717377662658,
|
|
"num_tokens": 49416142.0,
|
|
"step": 19495
|
|
},
|
|
{
|
|
"entropy": 6.2688291549682615,
|
|
"epoch": 2.2504327755337563,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004501612699792519,
|
|
"loss": 5.642,
|
|
"mean_token_accuracy": 0.198591947555542,
|
|
"num_tokens": 49427848.0,
|
|
"step": 19500
|
|
},
|
|
{
|
|
"entropy": 6.340646886825562,
|
|
"epoch": 2.251009809578765,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004501353674060606,
|
|
"loss": 5.8278,
|
|
"mean_token_accuracy": 0.1921554610133171,
|
|
"num_tokens": 49442338.0,
|
|
"step": 19505
|
|
},
|
|
{
|
|
"entropy": 6.329627513885498,
|
|
"epoch": 2.251586843623774,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004501094589422782,
|
|
"loss": 5.6851,
|
|
"mean_token_accuracy": 0.20651307106018066,
|
|
"num_tokens": 49455565.0,
|
|
"step": 19510
|
|
},
|
|
{
|
|
"entropy": 6.277817964553833,
|
|
"epoch": 2.2521638776687825,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00045008354458877614,
|
|
"loss": 5.6897,
|
|
"mean_token_accuracy": 0.20428113937377929,
|
|
"num_tokens": 49468894.0,
|
|
"step": 19515
|
|
},
|
|
{
|
|
"entropy": 6.164229202270508,
|
|
"epoch": 2.252740911713791,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.000450057624346426,
|
|
"loss": 5.5589,
|
|
"mean_token_accuracy": 0.21396252065896987,
|
|
"num_tokens": 49480324.0,
|
|
"step": 19520
|
|
},
|
|
{
|
|
"entropy": 6.2618499279022215,
|
|
"epoch": 2.2533179457587997,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00045003169821609967,
|
|
"loss": 5.6568,
|
|
"mean_token_accuracy": 0.2036493256688118,
|
|
"num_tokens": 49493823.0,
|
|
"step": 19525
|
|
},
|
|
{
|
|
"entropy": 6.278878498077392,
|
|
"epoch": 2.2538949798038086,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00045000576619866914,
|
|
"loss": 5.6117,
|
|
"mean_token_accuracy": 0.2137911170721054,
|
|
"num_tokens": 49506512.0,
|
|
"step": 19530
|
|
},
|
|
{
|
|
"entropy": 6.312352418899536,
|
|
"epoch": 2.254472013848817,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00044997982829500657,
|
|
"loss": 5.6839,
|
|
"mean_token_accuracy": 0.19806260019540786,
|
|
"num_tokens": 49518424.0,
|
|
"step": 19535
|
|
},
|
|
{
|
|
"entropy": 6.261477041244507,
|
|
"epoch": 2.255049047893826,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00044995388450598436,
|
|
"loss": 5.7309,
|
|
"mean_token_accuracy": 0.20388685017824174,
|
|
"num_tokens": 49531828.0,
|
|
"step": 19540
|
|
},
|
|
{
|
|
"entropy": 6.279758405685425,
|
|
"epoch": 2.2556260819388343,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004499279348324751,
|
|
"loss": 5.649,
|
|
"mean_token_accuracy": 0.19457512497901916,
|
|
"num_tokens": 49545502.0,
|
|
"step": 19545
|
|
},
|
|
{
|
|
"entropy": 6.206504154205322,
|
|
"epoch": 2.256203115983843,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00044990197927535173,
|
|
"loss": 5.6958,
|
|
"mean_token_accuracy": 0.19898426085710524,
|
|
"num_tokens": 49557323.0,
|
|
"step": 19550
|
|
},
|
|
{
|
|
"entropy": 6.1493871212005615,
|
|
"epoch": 2.2567801500288516,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00044987601783548703,
|
|
"loss": 5.5645,
|
|
"mean_token_accuracy": 0.21585829854011535,
|
|
"num_tokens": 49570149.0,
|
|
"step": 19555
|
|
},
|
|
{
|
|
"entropy": 6.267534399032593,
|
|
"epoch": 2.2573571840738604,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004498500505137545,
|
|
"loss": 5.6328,
|
|
"mean_token_accuracy": 0.20815033465623856,
|
|
"num_tokens": 49581866.0,
|
|
"step": 19560
|
|
},
|
|
{
|
|
"entropy": 6.190386343002319,
|
|
"epoch": 2.257934218118869,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004498240773110273,
|
|
"loss": 5.6434,
|
|
"mean_token_accuracy": 0.20312456637620926,
|
|
"num_tokens": 49592785.0,
|
|
"step": 19565
|
|
},
|
|
{
|
|
"entropy": 6.30643949508667,
|
|
"epoch": 2.2585112521638777,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004497980982281791,
|
|
"loss": 5.7865,
|
|
"mean_token_accuracy": 0.2009749099612236,
|
|
"num_tokens": 49604925.0,
|
|
"step": 19570
|
|
},
|
|
{
|
|
"entropy": 6.350605583190918,
|
|
"epoch": 2.259088286208886,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004497721132660837,
|
|
"loss": 5.7244,
|
|
"mean_token_accuracy": 0.19735192358493805,
|
|
"num_tokens": 49618548.0,
|
|
"step": 19575
|
|
},
|
|
{
|
|
"entropy": 6.258015203475952,
|
|
"epoch": 2.259665320253895,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00044974612242561516,
|
|
"loss": 5.6902,
|
|
"mean_token_accuracy": 0.20283384919166564,
|
|
"num_tokens": 49631968.0,
|
|
"step": 19580
|
|
},
|
|
{
|
|
"entropy": 6.256459474563599,
|
|
"epoch": 2.260242354298904,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004497201257076475,
|
|
"loss": 5.7116,
|
|
"mean_token_accuracy": 0.2024211421608925,
|
|
"num_tokens": 49645269.0,
|
|
"step": 19585
|
|
},
|
|
{
|
|
"entropy": 6.270970821380615,
|
|
"epoch": 2.2608193883439123,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004496941231130552,
|
|
"loss": 5.6926,
|
|
"mean_token_accuracy": 0.20178208351135254,
|
|
"num_tokens": 49655903.0,
|
|
"step": 19590
|
|
},
|
|
{
|
|
"entropy": 6.352920770645142,
|
|
"epoch": 2.261396422388921,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004496681146427129,
|
|
"loss": 5.7618,
|
|
"mean_token_accuracy": 0.1929154336452484,
|
|
"num_tokens": 49667982.0,
|
|
"step": 19595
|
|
},
|
|
{
|
|
"entropy": 6.259737825393676,
|
|
"epoch": 2.2619734564339296,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00044964210029749523,
|
|
"loss": 5.6242,
|
|
"mean_token_accuracy": 0.20513436794281006,
|
|
"num_tokens": 49681441.0,
|
|
"step": 19600
|
|
},
|
|
{
|
|
"entropy": 6.19245285987854,
|
|
"epoch": 2.2625504904789384,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00044961608007827736,
|
|
"loss": 5.6149,
|
|
"mean_token_accuracy": 0.21164268255233765,
|
|
"num_tokens": 49695805.0,
|
|
"step": 19605
|
|
},
|
|
{
|
|
"entropy": 6.3116106510162355,
|
|
"epoch": 2.263127524523947,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004495900539859344,
|
|
"loss": 5.7453,
|
|
"mean_token_accuracy": 0.2014342427253723,
|
|
"num_tokens": 49708762.0,
|
|
"step": 19610
|
|
},
|
|
{
|
|
"entropy": 6.244855976104736,
|
|
"epoch": 2.2637045585689557,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00044956402202134157,
|
|
"loss": 5.6769,
|
|
"mean_token_accuracy": 0.21064395904541017,
|
|
"num_tokens": 49724570.0,
|
|
"step": 19615
|
|
},
|
|
{
|
|
"entropy": 6.311522483825684,
|
|
"epoch": 2.264281592613964,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00044953798418537465,
|
|
"loss": 5.7421,
|
|
"mean_token_accuracy": 0.19412882030010223,
|
|
"num_tokens": 49736060.0,
|
|
"step": 19620
|
|
},
|
|
{
|
|
"entropy": 6.288136529922485,
|
|
"epoch": 2.264858626658973,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004495119404789093,
|
|
"loss": 5.6887,
|
|
"mean_token_accuracy": 0.20001592338085175,
|
|
"num_tokens": 49748520.0,
|
|
"step": 19625
|
|
},
|
|
{
|
|
"entropy": 6.259233474731445,
|
|
"epoch": 2.2654356607039814,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004494858909028216,
|
|
"loss": 5.7547,
|
|
"mean_token_accuracy": 0.19457891583442688,
|
|
"num_tokens": 49761097.0,
|
|
"step": 19630
|
|
},
|
|
{
|
|
"entropy": 6.243998432159424,
|
|
"epoch": 2.2660126947489903,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004494598354579875,
|
|
"loss": 5.6599,
|
|
"mean_token_accuracy": 0.2039832279086113,
|
|
"num_tokens": 49773430.0,
|
|
"step": 19635
|
|
},
|
|
{
|
|
"entropy": 6.283785581588745,
|
|
"epoch": 2.2665897287939987,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004494337741452836,
|
|
"loss": 5.6964,
|
|
"mean_token_accuracy": 0.20121050328016282,
|
|
"num_tokens": 49785525.0,
|
|
"step": 19640
|
|
},
|
|
{
|
|
"entropy": 6.272574615478516,
|
|
"epoch": 2.2671667628390075,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004494077069655863,
|
|
"loss": 5.7104,
|
|
"mean_token_accuracy": 0.20026218593120576,
|
|
"num_tokens": 49796650.0,
|
|
"step": 19645
|
|
},
|
|
{
|
|
"entropy": 6.2548116683959964,
|
|
"epoch": 2.267743796884016,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004493816339197724,
|
|
"loss": 5.6775,
|
|
"mean_token_accuracy": 0.20387378036975862,
|
|
"num_tokens": 49808191.0,
|
|
"step": 19650
|
|
},
|
|
{
|
|
"entropy": 6.276640319824219,
|
|
"epoch": 2.268320830929025,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00044935555500871897,
|
|
"loss": 5.7046,
|
|
"mean_token_accuracy": 0.20125204026699067,
|
|
"num_tokens": 49820051.0,
|
|
"step": 19655
|
|
},
|
|
{
|
|
"entropy": 6.295619058609009,
|
|
"epoch": 2.2688978649740337,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.000449329470233303,
|
|
"loss": 5.7228,
|
|
"mean_token_accuracy": 0.19812791794538498,
|
|
"num_tokens": 49835392.0,
|
|
"step": 19660
|
|
},
|
|
{
|
|
"entropy": 6.222367143630981,
|
|
"epoch": 2.269474899019042,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00044930337959440183,
|
|
"loss": 5.6577,
|
|
"mean_token_accuracy": 0.20379606783390045,
|
|
"num_tokens": 49847344.0,
|
|
"step": 19665
|
|
},
|
|
{
|
|
"entropy": 6.295651435852051,
|
|
"epoch": 2.270051933064051,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004492772830928931,
|
|
"loss": 5.7302,
|
|
"mean_token_accuracy": 0.19512915164232253,
|
|
"num_tokens": 49859741.0,
|
|
"step": 19670
|
|
},
|
|
{
|
|
"entropy": 6.276036500930786,
|
|
"epoch": 2.2706289671090594,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00044925118072965456,
|
|
"loss": 5.6989,
|
|
"mean_token_accuracy": 0.20129497200250626,
|
|
"num_tokens": 49871565.0,
|
|
"step": 19675
|
|
},
|
|
{
|
|
"entropy": 6.219705247879029,
|
|
"epoch": 2.2712060011540682,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.000449225072505564,
|
|
"loss": 5.645,
|
|
"mean_token_accuracy": 0.20144531279802322,
|
|
"num_tokens": 49883405.0,
|
|
"step": 19680
|
|
},
|
|
{
|
|
"entropy": 6.287055253982544,
|
|
"epoch": 2.2717830351990767,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00044919895842149976,
|
|
"loss": 5.7471,
|
|
"mean_token_accuracy": 0.19765210449695586,
|
|
"num_tokens": 49895924.0,
|
|
"step": 19685
|
|
},
|
|
{
|
|
"entropy": 6.23684401512146,
|
|
"epoch": 2.2723600692440855,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00044917283847834005,
|
|
"loss": 5.6523,
|
|
"mean_token_accuracy": 0.19993764013051987,
|
|
"num_tokens": 49908506.0,
|
|
"step": 19690
|
|
},
|
|
{
|
|
"entropy": 6.29704647064209,
|
|
"epoch": 2.272937103289094,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004491467126769635,
|
|
"loss": 5.7223,
|
|
"mean_token_accuracy": 0.1992749884724617,
|
|
"num_tokens": 49919917.0,
|
|
"step": 19695
|
|
},
|
|
{
|
|
"entropy": 6.228441858291626,
|
|
"epoch": 2.273514137334103,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00044912058101824866,
|
|
"loss": 5.6465,
|
|
"mean_token_accuracy": 0.20652550756931304,
|
|
"num_tokens": 49932508.0,
|
|
"step": 19700
|
|
},
|
|
{
|
|
"entropy": 6.2381360054016115,
|
|
"epoch": 2.274091171379111,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00044909444350307463,
|
|
"loss": 5.7107,
|
|
"mean_token_accuracy": 0.20327081233263017,
|
|
"num_tokens": 49945065.0,
|
|
"step": 19705
|
|
},
|
|
{
|
|
"entropy": 6.2598044872283936,
|
|
"epoch": 2.27466820542412,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004490683001323205,
|
|
"loss": 5.6279,
|
|
"mean_token_accuracy": 0.2084788978099823,
|
|
"num_tokens": 49957530.0,
|
|
"step": 19710
|
|
},
|
|
{
|
|
"entropy": 6.201219892501831,
|
|
"epoch": 2.2752452394691285,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00044904215090686554,
|
|
"loss": 5.5949,
|
|
"mean_token_accuracy": 0.20651741623878478,
|
|
"num_tokens": 49969760.0,
|
|
"step": 19715
|
|
},
|
|
{
|
|
"entropy": 6.252209281921386,
|
|
"epoch": 2.2758222735141374,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00044901599582758926,
|
|
"loss": 5.7175,
|
|
"mean_token_accuracy": 0.20343547612428664,
|
|
"num_tokens": 49983151.0,
|
|
"step": 19720
|
|
},
|
|
{
|
|
"entropy": 6.259750556945801,
|
|
"epoch": 2.2763993075591458,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00044898983489537143,
|
|
"loss": 5.6256,
|
|
"mean_token_accuracy": 0.2036111459136009,
|
|
"num_tokens": 49995262.0,
|
|
"step": 19725
|
|
},
|
|
{
|
|
"entropy": 6.289621210098266,
|
|
"epoch": 2.2769763416041546,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000448963668111092,
|
|
"loss": 5.6857,
|
|
"mean_token_accuracy": 0.19986894577741623,
|
|
"num_tokens": 50007153.0,
|
|
"step": 19730
|
|
},
|
|
{
|
|
"entropy": 6.1917328357696535,
|
|
"epoch": 2.2775533756491635,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00044893749547563085,
|
|
"loss": 5.6719,
|
|
"mean_token_accuracy": 0.20763412564992906,
|
|
"num_tokens": 50020145.0,
|
|
"step": 19735
|
|
},
|
|
{
|
|
"entropy": 6.243492603302002,
|
|
"epoch": 2.278130409694172,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00044891131698986846,
|
|
"loss": 5.6842,
|
|
"mean_token_accuracy": 0.19811105132102966,
|
|
"num_tokens": 50032741.0,
|
|
"step": 19740
|
|
},
|
|
{
|
|
"entropy": 6.239491748809814,
|
|
"epoch": 2.2787074437391808,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004488851326546854,
|
|
"loss": 5.7194,
|
|
"mean_token_accuracy": 0.19922717809677123,
|
|
"num_tokens": 50046112.0,
|
|
"step": 19745
|
|
},
|
|
{
|
|
"entropy": 6.275479888916015,
|
|
"epoch": 2.279284477784189,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004488589424709622,
|
|
"loss": 5.6932,
|
|
"mean_token_accuracy": 0.20576501041650772,
|
|
"num_tokens": 50058718.0,
|
|
"step": 19750
|
|
},
|
|
{
|
|
"entropy": 6.196004152297974,
|
|
"epoch": 2.279861511829198,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004488327464395799,
|
|
"loss": 5.6223,
|
|
"mean_token_accuracy": 0.20243488848209382,
|
|
"num_tokens": 50071759.0,
|
|
"step": 19755
|
|
},
|
|
{
|
|
"entropy": 6.277880620956421,
|
|
"epoch": 2.2804385458742065,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004488065445614195,
|
|
"loss": 5.6598,
|
|
"mean_token_accuracy": 0.2045716404914856,
|
|
"num_tokens": 50083948.0,
|
|
"step": 19760
|
|
},
|
|
{
|
|
"entropy": 6.241612482070923,
|
|
"epoch": 2.2810155799192153,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004487803368373623,
|
|
"loss": 5.6438,
|
|
"mean_token_accuracy": 0.20779716223478317,
|
|
"num_tokens": 50097310.0,
|
|
"step": 19765
|
|
},
|
|
{
|
|
"entropy": 6.1986939907073975,
|
|
"epoch": 2.2815926139642237,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004487541232682898,
|
|
"loss": 5.6918,
|
|
"mean_token_accuracy": 0.20480042099952697,
|
|
"num_tokens": 50109939.0,
|
|
"step": 19770
|
|
},
|
|
{
|
|
"entropy": 6.297293043136596,
|
|
"epoch": 2.2821696480092326,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004487279038550836,
|
|
"loss": 5.7475,
|
|
"mean_token_accuracy": 0.19697188287973405,
|
|
"num_tokens": 50120651.0,
|
|
"step": 19775
|
|
},
|
|
{
|
|
"entropy": 6.284278392791748,
|
|
"epoch": 2.282746682054241,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004487016785986258,
|
|
"loss": 5.6821,
|
|
"mean_token_accuracy": 0.20540768802165985,
|
|
"num_tokens": 50133180.0,
|
|
"step": 19780
|
|
},
|
|
{
|
|
"entropy": 6.259939765930175,
|
|
"epoch": 2.28332371609925,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00044867544749979817,
|
|
"loss": 5.6934,
|
|
"mean_token_accuracy": 0.2011975407600403,
|
|
"num_tokens": 50144808.0,
|
|
"step": 19785
|
|
},
|
|
{
|
|
"entropy": 6.242081022262573,
|
|
"epoch": 2.2839007501442588,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00044864921055948317,
|
|
"loss": 5.648,
|
|
"mean_token_accuracy": 0.20324725955724715,
|
|
"num_tokens": 50157487.0,
|
|
"step": 19790
|
|
},
|
|
{
|
|
"entropy": 6.274213600158691,
|
|
"epoch": 2.284477784189267,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00044862296777856326,
|
|
"loss": 5.7191,
|
|
"mean_token_accuracy": 0.19910815358161926,
|
|
"num_tokens": 50171837.0,
|
|
"step": 19795
|
|
},
|
|
{
|
|
"entropy": 6.262651777267456,
|
|
"epoch": 2.2850548182342756,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004485967191579211,
|
|
"loss": 5.6147,
|
|
"mean_token_accuracy": 0.21335643529891968,
|
|
"num_tokens": 50184802.0,
|
|
"step": 19800
|
|
},
|
|
{
|
|
"entropy": 6.248020982742309,
|
|
"epoch": 2.2856318522792844,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004485704646984394,
|
|
"loss": 5.6945,
|
|
"mean_token_accuracy": 0.1977355048060417,
|
|
"num_tokens": 50196433.0,
|
|
"step": 19805
|
|
},
|
|
{
|
|
"entropy": 6.22298641204834,
|
|
"epoch": 2.2862088863242933,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004485442044010015,
|
|
"loss": 5.632,
|
|
"mean_token_accuracy": 0.21534291952848433,
|
|
"num_tokens": 50209549.0,
|
|
"step": 19810
|
|
},
|
|
{
|
|
"entropy": 6.359181070327759,
|
|
"epoch": 2.2867859203693017,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004485179382664904,
|
|
"loss": 5.7947,
|
|
"mean_token_accuracy": 0.19366897642612457,
|
|
"num_tokens": 50220691.0,
|
|
"step": 19815
|
|
},
|
|
{
|
|
"entropy": 6.368267250061035,
|
|
"epoch": 2.2873629544143106,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004484916662957896,
|
|
"loss": 5.7792,
|
|
"mean_token_accuracy": 0.19695059061050416,
|
|
"num_tokens": 50233003.0,
|
|
"step": 19820
|
|
},
|
|
{
|
|
"entropy": 6.260522842407227,
|
|
"epoch": 2.287939988459319,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004484653884897829,
|
|
"loss": 5.6793,
|
|
"mean_token_accuracy": 0.1978773593902588,
|
|
"num_tokens": 50244742.0,
|
|
"step": 19825
|
|
},
|
|
{
|
|
"entropy": 6.151585578918457,
|
|
"epoch": 2.288517022504328,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00044843910484935394,
|
|
"loss": 5.5735,
|
|
"mean_token_accuracy": 0.2117750972509384,
|
|
"num_tokens": 50258188.0,
|
|
"step": 19830
|
|
},
|
|
{
|
|
"entropy": 6.287138366699219,
|
|
"epoch": 2.2890940565493363,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004484128153753868,
|
|
"loss": 5.7306,
|
|
"mean_token_accuracy": 0.20295771360397338,
|
|
"num_tokens": 50271155.0,
|
|
"step": 19835
|
|
},
|
|
{
|
|
"entropy": 6.346404504776001,
|
|
"epoch": 2.289671090594345,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00044838652006876583,
|
|
"loss": 5.7226,
|
|
"mean_token_accuracy": 0.20089610815048217,
|
|
"num_tokens": 50283518.0,
|
|
"step": 19840
|
|
},
|
|
{
|
|
"entropy": 6.179970598220825,
|
|
"epoch": 2.2902481246393536,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00044836021893037537,
|
|
"loss": 5.6065,
|
|
"mean_token_accuracy": 0.21166497617959976,
|
|
"num_tokens": 50296208.0,
|
|
"step": 19845
|
|
},
|
|
{
|
|
"entropy": 6.183140087127685,
|
|
"epoch": 2.2908251586843624,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004483339119611001,
|
|
"loss": 5.62,
|
|
"mean_token_accuracy": 0.21188974529504775,
|
|
"num_tokens": 50309111.0,
|
|
"step": 19850
|
|
},
|
|
{
|
|
"entropy": 6.266731452941895,
|
|
"epoch": 2.291402192729371,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00044830759916182476,
|
|
"loss": 5.7215,
|
|
"mean_token_accuracy": 0.19990355223417283,
|
|
"num_tokens": 50321895.0,
|
|
"step": 19855
|
|
},
|
|
{
|
|
"entropy": 6.300902700424194,
|
|
"epoch": 2.2919792267743797,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004482812805334344,
|
|
"loss": 5.7463,
|
|
"mean_token_accuracy": 0.19138864129781724,
|
|
"num_tokens": 50335769.0,
|
|
"step": 19860
|
|
},
|
|
{
|
|
"entropy": 6.308612489700318,
|
|
"epoch": 2.2925562608193886,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004482549560768142,
|
|
"loss": 5.6856,
|
|
"mean_token_accuracy": 0.20473549962043763,
|
|
"num_tokens": 50348576.0,
|
|
"step": 19865
|
|
},
|
|
{
|
|
"entropy": 6.246194124221802,
|
|
"epoch": 2.293133294864397,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004482286257928497,
|
|
"loss": 5.7056,
|
|
"mean_token_accuracy": 0.1999507576227188,
|
|
"num_tokens": 50360652.0,
|
|
"step": 19870
|
|
},
|
|
{
|
|
"entropy": 6.179588699340821,
|
|
"epoch": 2.293710328909406,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004482022896824263,
|
|
"loss": 5.6761,
|
|
"mean_token_accuracy": 0.19982111304998398,
|
|
"num_tokens": 50373256.0,
|
|
"step": 19875
|
|
},
|
|
{
|
|
"entropy": 6.262630033493042,
|
|
"epoch": 2.2942873629544143,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00044817594774643004,
|
|
"loss": 5.6015,
|
|
"mean_token_accuracy": 0.20998111516237258,
|
|
"num_tokens": 50385245.0,
|
|
"step": 19880
|
|
},
|
|
{
|
|
"entropy": 6.278105211257935,
|
|
"epoch": 2.294864396999423,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00044814959998574675,
|
|
"loss": 5.7173,
|
|
"mean_token_accuracy": 0.19566212147474288,
|
|
"num_tokens": 50397276.0,
|
|
"step": 19885
|
|
},
|
|
{
|
|
"entropy": 6.310760498046875,
|
|
"epoch": 2.2954414310444315,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00044812324640126265,
|
|
"loss": 5.7995,
|
|
"mean_token_accuracy": 0.19371946156024933,
|
|
"num_tokens": 50409725.0,
|
|
"step": 19890
|
|
},
|
|
{
|
|
"entropy": 6.30986967086792,
|
|
"epoch": 2.2960184650894404,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004480968869938642,
|
|
"loss": 5.7358,
|
|
"mean_token_accuracy": 0.19498946964740754,
|
|
"num_tokens": 50421987.0,
|
|
"step": 19895
|
|
},
|
|
{
|
|
"entropy": 6.255093336105347,
|
|
"epoch": 2.296595499134449,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00044807052176443793,
|
|
"loss": 5.6393,
|
|
"mean_token_accuracy": 0.21141475737094878,
|
|
"num_tokens": 50436153.0,
|
|
"step": 19900
|
|
},
|
|
{
|
|
"entropy": 6.2507484436035154,
|
|
"epoch": 2.2971725331794577,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00044804415071387067,
|
|
"loss": 5.7516,
|
|
"mean_token_accuracy": 0.20144218802452088,
|
|
"num_tokens": 50449683.0,
|
|
"step": 19905
|
|
},
|
|
{
|
|
"entropy": 6.172179746627807,
|
|
"epoch": 2.297749567224466,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004480177738430492,
|
|
"loss": 5.5576,
|
|
"mean_token_accuracy": 0.21170271188020706,
|
|
"num_tokens": 50461535.0,
|
|
"step": 19910
|
|
},
|
|
{
|
|
"entropy": 6.247416591644287,
|
|
"epoch": 2.298326601269475,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00044799139115286104,
|
|
"loss": 5.6759,
|
|
"mean_token_accuracy": 0.1969045430421829,
|
|
"num_tokens": 50476094.0,
|
|
"step": 19915
|
|
},
|
|
{
|
|
"entropy": 6.292913627624512,
|
|
"epoch": 2.2989036353144834,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004479650026441933,
|
|
"loss": 5.6821,
|
|
"mean_token_accuracy": 0.19706797301769258,
|
|
"num_tokens": 50488751.0,
|
|
"step": 19920
|
|
},
|
|
{
|
|
"entropy": 6.302343368530273,
|
|
"epoch": 2.2994806693594922,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00044793860831793356,
|
|
"loss": 5.667,
|
|
"mean_token_accuracy": 0.20249564349651336,
|
|
"num_tokens": 50502272.0,
|
|
"step": 19925
|
|
},
|
|
{
|
|
"entropy": 6.268003511428833,
|
|
"epoch": 2.3000577034045007,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00044791220817496963,
|
|
"loss": 5.6962,
|
|
"mean_token_accuracy": 0.19340673238039016,
|
|
"num_tokens": 50514792.0,
|
|
"step": 19930
|
|
},
|
|
{
|
|
"entropy": 6.189672327041626,
|
|
"epoch": 2.3006347374495095,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004478858022161895,
|
|
"loss": 5.6096,
|
|
"mean_token_accuracy": 0.2113632693886757,
|
|
"num_tokens": 50528484.0,
|
|
"step": 19935
|
|
},
|
|
{
|
|
"entropy": 6.3625153541564945,
|
|
"epoch": 2.3012117714945184,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004478593904424813,
|
|
"loss": 5.7847,
|
|
"mean_token_accuracy": 0.1942471295595169,
|
|
"num_tokens": 50540737.0,
|
|
"step": 19940
|
|
},
|
|
{
|
|
"entropy": 6.25290060043335,
|
|
"epoch": 2.301788805539527,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004478329728547334,
|
|
"loss": 5.6936,
|
|
"mean_token_accuracy": 0.20512138158082963,
|
|
"num_tokens": 50553819.0,
|
|
"step": 19945
|
|
},
|
|
{
|
|
"entropy": 6.2829841613769535,
|
|
"epoch": 2.3023658395845357,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00044780654945383424,
|
|
"loss": 5.7354,
|
|
"mean_token_accuracy": 0.2017420634627342,
|
|
"num_tokens": 50566275.0,
|
|
"step": 19950
|
|
},
|
|
{
|
|
"entropy": 6.278318548202515,
|
|
"epoch": 2.302942873629544,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00044778012024067267,
|
|
"loss": 5.681,
|
|
"mean_token_accuracy": 0.20539594292640687,
|
|
"num_tokens": 50577653.0,
|
|
"step": 19955
|
|
},
|
|
{
|
|
"entropy": 6.310393190383911,
|
|
"epoch": 2.303519907674553,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004477536852161376,
|
|
"loss": 5.7271,
|
|
"mean_token_accuracy": 0.1932803899049759,
|
|
"num_tokens": 50590237.0,
|
|
"step": 19960
|
|
},
|
|
{
|
|
"entropy": 6.186036014556885,
|
|
"epoch": 2.3040969417195614,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004477272443811181,
|
|
"loss": 5.6042,
|
|
"mean_token_accuracy": 0.19824027866125107,
|
|
"num_tokens": 50602333.0,
|
|
"step": 19965
|
|
},
|
|
{
|
|
"entropy": 6.335505819320678,
|
|
"epoch": 2.3046739757645702,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004477007977365035,
|
|
"loss": 5.7524,
|
|
"mean_token_accuracy": 0.19401074647903443,
|
|
"num_tokens": 50614232.0,
|
|
"step": 19970
|
|
},
|
|
{
|
|
"entropy": 6.3040093898773195,
|
|
"epoch": 2.3052510098095786,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004476743452831834,
|
|
"loss": 5.6889,
|
|
"mean_token_accuracy": 0.2003216937184334,
|
|
"num_tokens": 50627959.0,
|
|
"step": 19975
|
|
},
|
|
{
|
|
"entropy": 6.198862886428833,
|
|
"epoch": 2.3058280438545875,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00044764788702204747,
|
|
"loss": 5.587,
|
|
"mean_token_accuracy": 0.21014727056026458,
|
|
"num_tokens": 50639962.0,
|
|
"step": 19980
|
|
},
|
|
{
|
|
"entropy": 6.264612627029419,
|
|
"epoch": 2.306405077899596,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004476214229539856,
|
|
"loss": 5.6996,
|
|
"mean_token_accuracy": 0.20357227176427842,
|
|
"num_tokens": 50652291.0,
|
|
"step": 19985
|
|
},
|
|
{
|
|
"entropy": 6.288990640640259,
|
|
"epoch": 2.306982111944605,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004475949530798879,
|
|
"loss": 5.6989,
|
|
"mean_token_accuracy": 0.19868904054164888,
|
|
"num_tokens": 50664993.0,
|
|
"step": 19990
|
|
},
|
|
{
|
|
"entropy": 6.187899351119995,
|
|
"epoch": 2.307559145989613,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00044756847740064475,
|
|
"loss": 5.5424,
|
|
"mean_token_accuracy": 0.19761182218790055,
|
|
"num_tokens": 50677846.0,
|
|
"step": 19995
|
|
},
|
|
{
|
|
"entropy": 6.221263217926025,
|
|
"epoch": 2.308136180034622,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004475419959171465,
|
|
"loss": 5.6128,
|
|
"mean_token_accuracy": 0.21344971507787705,
|
|
"num_tokens": 50691068.0,
|
|
"step": 20000
|
|
},
|
|
{
|
|
"entropy": 6.230750799179077,
|
|
"epoch": 2.3087132140796305,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.000447515508630284,
|
|
"loss": 5.6977,
|
|
"mean_token_accuracy": 0.20123774111270903,
|
|
"num_tokens": 50703663.0,
|
|
"step": 20005
|
|
},
|
|
{
|
|
"entropy": 6.312432861328125,
|
|
"epoch": 2.3092902481246393,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00044748901554094806,
|
|
"loss": 5.6947,
|
|
"mean_token_accuracy": 0.20297775119543077,
|
|
"num_tokens": 50715709.0,
|
|
"step": 20010
|
|
},
|
|
{
|
|
"entropy": 6.248737716674805,
|
|
"epoch": 2.309867282169648,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004474625166500297,
|
|
"loss": 5.6769,
|
|
"mean_token_accuracy": 0.2087046891450882,
|
|
"num_tokens": 50727700.0,
|
|
"step": 20015
|
|
},
|
|
{
|
|
"entropy": 6.259288597106933,
|
|
"epoch": 2.3104443162146566,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00044743601195842026,
|
|
"loss": 5.6259,
|
|
"mean_token_accuracy": 0.20704087764024734,
|
|
"num_tokens": 50740604.0,
|
|
"step": 20020
|
|
},
|
|
{
|
|
"entropy": 6.351035213470459,
|
|
"epoch": 2.3110213502596655,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00044740950146701127,
|
|
"loss": 5.774,
|
|
"mean_token_accuracy": 0.1978513553738594,
|
|
"num_tokens": 50753666.0,
|
|
"step": 20025
|
|
},
|
|
{
|
|
"entropy": 6.229120397567749,
|
|
"epoch": 2.311598384304674,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004473829851766943,
|
|
"loss": 5.7331,
|
|
"mean_token_accuracy": 0.1979401797056198,
|
|
"num_tokens": 50766324.0,
|
|
"step": 20030
|
|
},
|
|
{
|
|
"entropy": 6.312212944030762,
|
|
"epoch": 2.3121754183496828,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004473564630883612,
|
|
"loss": 5.7301,
|
|
"mean_token_accuracy": 0.2022898778319359,
|
|
"num_tokens": 50779037.0,
|
|
"step": 20035
|
|
},
|
|
{
|
|
"entropy": 6.262638854980469,
|
|
"epoch": 2.312752452394691,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004473299352029042,
|
|
"loss": 5.6611,
|
|
"mean_token_accuracy": 0.20583394020795823,
|
|
"num_tokens": 50791089.0,
|
|
"step": 20040
|
|
},
|
|
{
|
|
"entropy": 6.221489095687867,
|
|
"epoch": 2.3133294864397,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004473034015212154,
|
|
"loss": 5.6526,
|
|
"mean_token_accuracy": 0.1966189831495285,
|
|
"num_tokens": 50803608.0,
|
|
"step": 20045
|
|
},
|
|
{
|
|
"entropy": 6.242483282089234,
|
|
"epoch": 2.3139065204847085,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004472768620441872,
|
|
"loss": 5.6904,
|
|
"mean_token_accuracy": 0.19912586808204652,
|
|
"num_tokens": 50815712.0,
|
|
"step": 20050
|
|
},
|
|
{
|
|
"entropy": 6.3092294216156,
|
|
"epoch": 2.3144835545297173,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00044725031677271234,
|
|
"loss": 5.6188,
|
|
"mean_token_accuracy": 0.2108631983399391,
|
|
"num_tokens": 50827409.0,
|
|
"step": 20055
|
|
},
|
|
{
|
|
"entropy": 6.226622200012207,
|
|
"epoch": 2.3150605885747257,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004472237657076837,
|
|
"loss": 5.6465,
|
|
"mean_token_accuracy": 0.20455507636070253,
|
|
"num_tokens": 50840901.0,
|
|
"step": 20060
|
|
},
|
|
{
|
|
"entropy": 6.299163818359375,
|
|
"epoch": 2.3156376226197346,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004471972088499942,
|
|
"loss": 5.7315,
|
|
"mean_token_accuracy": 0.1961276039481163,
|
|
"num_tokens": 50854453.0,
|
|
"step": 20065
|
|
},
|
|
{
|
|
"entropy": 6.350008344650268,
|
|
"epoch": 2.3162146566647435,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004471706462005371,
|
|
"loss": 5.6954,
|
|
"mean_token_accuracy": 0.19643843322992324,
|
|
"num_tokens": 50866566.0,
|
|
"step": 20070
|
|
},
|
|
{
|
|
"entropy": 6.212463426589966,
|
|
"epoch": 2.316791690709752,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004471440777602059,
|
|
"loss": 5.6575,
|
|
"mean_token_accuracy": 0.20321660935878755,
|
|
"num_tokens": 50879695.0,
|
|
"step": 20075
|
|
},
|
|
{
|
|
"entropy": 6.194079113006592,
|
|
"epoch": 2.3173687247547603,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00044711750352989407,
|
|
"loss": 5.5996,
|
|
"mean_token_accuracy": 0.20679421722888947,
|
|
"num_tokens": 50892350.0,
|
|
"step": 20080
|
|
},
|
|
{
|
|
"entropy": 6.2928242683410645,
|
|
"epoch": 2.317945758799769,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004470909235104956,
|
|
"loss": 5.7393,
|
|
"mean_token_accuracy": 0.2002371221780777,
|
|
"num_tokens": 50905899.0,
|
|
"step": 20085
|
|
},
|
|
{
|
|
"entropy": 6.287396478652954,
|
|
"epoch": 2.318522792844778,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004470643377029043,
|
|
"loss": 5.6599,
|
|
"mean_token_accuracy": 0.20983583927154542,
|
|
"num_tokens": 50919698.0,
|
|
"step": 20090
|
|
},
|
|
{
|
|
"entropy": 6.309205389022827,
|
|
"epoch": 2.3190998268897864,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004470377461080145,
|
|
"loss": 5.744,
|
|
"mean_token_accuracy": 0.20514176189899444,
|
|
"num_tokens": 50932236.0,
|
|
"step": 20095
|
|
},
|
|
{
|
|
"entropy": 6.264718341827392,
|
|
"epoch": 2.3196768609347953,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004470111487267206,
|
|
"loss": 5.6731,
|
|
"mean_token_accuracy": 0.20396852046251296,
|
|
"num_tokens": 50945403.0,
|
|
"step": 20100
|
|
},
|
|
{
|
|
"entropy": 6.269400930404663,
|
|
"epoch": 2.3202538949798037,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004469845455599171,
|
|
"loss": 5.6767,
|
|
"mean_token_accuracy": 0.19957065880298613,
|
|
"num_tokens": 50958854.0,
|
|
"step": 20105
|
|
},
|
|
{
|
|
"entropy": 6.345641183853149,
|
|
"epoch": 2.3208309290248126,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004469579366084989,
|
|
"loss": 5.7477,
|
|
"mean_token_accuracy": 0.19639746844768524,
|
|
"num_tokens": 50971545.0,
|
|
"step": 20110
|
|
},
|
|
{
|
|
"entropy": 6.304386758804322,
|
|
"epoch": 2.321407963069821,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00044693132187336094,
|
|
"loss": 5.7429,
|
|
"mean_token_accuracy": 0.19700338542461396,
|
|
"num_tokens": 50985282.0,
|
|
"step": 20115
|
|
},
|
|
{
|
|
"entropy": 6.257296991348267,
|
|
"epoch": 2.32198499711483,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004469047013553983,
|
|
"loss": 5.6737,
|
|
"mean_token_accuracy": 0.20432363003492354,
|
|
"num_tokens": 50998063.0,
|
|
"step": 20120
|
|
},
|
|
{
|
|
"entropy": 6.239012908935547,
|
|
"epoch": 2.3225620311598383,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00044687807505550646,
|
|
"loss": 5.6595,
|
|
"mean_token_accuracy": 0.20608614087104798,
|
|
"num_tokens": 51011413.0,
|
|
"step": 20125
|
|
},
|
|
{
|
|
"entropy": 6.223509073257446,
|
|
"epoch": 2.323139065204847,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00044685144297458096,
|
|
"loss": 5.6548,
|
|
"mean_token_accuracy": 0.20884050726890563,
|
|
"num_tokens": 51023861.0,
|
|
"step": 20130
|
|
},
|
|
{
|
|
"entropy": 6.280037975311279,
|
|
"epoch": 2.3237160992498556,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00044682480511351754,
|
|
"loss": 5.6432,
|
|
"mean_token_accuracy": 0.20675942450761794,
|
|
"num_tokens": 51035891.0,
|
|
"step": 20135
|
|
},
|
|
{
|
|
"entropy": 6.2503454208374025,
|
|
"epoch": 2.3242931332948644,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004467981614732121,
|
|
"loss": 5.6414,
|
|
"mean_token_accuracy": 0.2052238777279854,
|
|
"num_tokens": 51048115.0,
|
|
"step": 20140
|
|
},
|
|
{
|
|
"entropy": 6.263721990585327,
|
|
"epoch": 2.3248701673398733,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00044677151205456086,
|
|
"loss": 5.6669,
|
|
"mean_token_accuracy": 0.19978864639997482,
|
|
"num_tokens": 51061503.0,
|
|
"step": 20145
|
|
},
|
|
{
|
|
"entropy": 6.283975648880005,
|
|
"epoch": 2.3254472013848817,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004467448568584601,
|
|
"loss": 5.7173,
|
|
"mean_token_accuracy": 0.2011381208896637,
|
|
"num_tokens": 51074052.0,
|
|
"step": 20150
|
|
},
|
|
{
|
|
"entropy": 6.3093095302581785,
|
|
"epoch": 2.32602423542989,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004467181958858064,
|
|
"loss": 5.7431,
|
|
"mean_token_accuracy": 0.20208009481430053,
|
|
"num_tokens": 51089456.0,
|
|
"step": 20155
|
|
},
|
|
{
|
|
"entropy": 6.306753873825073,
|
|
"epoch": 2.326601269474899,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004466915291374965,
|
|
"loss": 5.7069,
|
|
"mean_token_accuracy": 0.19960661828517914,
|
|
"num_tokens": 51102835.0,
|
|
"step": 20160
|
|
},
|
|
{
|
|
"entropy": 6.306112909317017,
|
|
"epoch": 2.327178303519908,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004466648566144273,
|
|
"loss": 5.7314,
|
|
"mean_token_accuracy": 0.19776588380336763,
|
|
"num_tokens": 51115472.0,
|
|
"step": 20165
|
|
},
|
|
{
|
|
"entropy": 6.299116325378418,
|
|
"epoch": 2.3277553375649163,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000446638178317496,
|
|
"loss": 5.6569,
|
|
"mean_token_accuracy": 0.2033730775117874,
|
|
"num_tokens": 51129768.0,
|
|
"step": 20170
|
|
},
|
|
{
|
|
"entropy": 6.275330448150635,
|
|
"epoch": 2.328332371609925,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00044661149424759974,
|
|
"loss": 5.6706,
|
|
"mean_token_accuracy": 0.20418451279401778,
|
|
"num_tokens": 51143517.0,
|
|
"step": 20175
|
|
},
|
|
{
|
|
"entropy": 6.206835556030273,
|
|
"epoch": 2.3289094056549335,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004465848044056361,
|
|
"loss": 5.5095,
|
|
"mean_token_accuracy": 0.21552657186985016,
|
|
"num_tokens": 51157235.0,
|
|
"step": 20180
|
|
},
|
|
{
|
|
"entropy": 6.281242322921753,
|
|
"epoch": 2.3294864396999424,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004465581087925028,
|
|
"loss": 5.6846,
|
|
"mean_token_accuracy": 0.20341511964797973,
|
|
"num_tokens": 51169061.0,
|
|
"step": 20185
|
|
},
|
|
{
|
|
"entropy": 6.2411112785339355,
|
|
"epoch": 2.330063473744951,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004465314074090978,
|
|
"loss": 5.6873,
|
|
"mean_token_accuracy": 0.19719644337892533,
|
|
"num_tokens": 51181063.0,
|
|
"step": 20190
|
|
},
|
|
{
|
|
"entropy": 6.25082573890686,
|
|
"epoch": 2.3306405077899597,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00044650470025631904,
|
|
"loss": 5.6214,
|
|
"mean_token_accuracy": 0.20618860125541688,
|
|
"num_tokens": 51193536.0,
|
|
"step": 20195
|
|
},
|
|
{
|
|
"entropy": 6.234523773193359,
|
|
"epoch": 2.331217541834968,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004464779873350649,
|
|
"loss": 5.6142,
|
|
"mean_token_accuracy": 0.21316068172454833,
|
|
"num_tokens": 51205960.0,
|
|
"step": 20200
|
|
},
|
|
{
|
|
"entropy": 6.296325969696045,
|
|
"epoch": 2.331794575879977,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004464512686462339,
|
|
"loss": 5.7834,
|
|
"mean_token_accuracy": 0.20003315955400466,
|
|
"num_tokens": 51219227.0,
|
|
"step": 20205
|
|
},
|
|
{
|
|
"entropy": 6.323716688156128,
|
|
"epoch": 2.3323716099249854,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00044642454419072455,
|
|
"loss": 5.6514,
|
|
"mean_token_accuracy": 0.2024744465947151,
|
|
"num_tokens": 51232781.0,
|
|
"step": 20210
|
|
},
|
|
{
|
|
"entropy": 6.2382483959198,
|
|
"epoch": 2.3329486439699942,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004463978139694358,
|
|
"loss": 5.6744,
|
|
"mean_token_accuracy": 0.20180849730968475,
|
|
"num_tokens": 51245574.0,
|
|
"step": 20215
|
|
},
|
|
{
|
|
"entropy": 6.261038494110108,
|
|
"epoch": 2.333525678015003,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00044637107798326675,
|
|
"loss": 5.7009,
|
|
"mean_token_accuracy": 0.1989492028951645,
|
|
"num_tokens": 51258710.0,
|
|
"step": 20220
|
|
},
|
|
{
|
|
"entropy": 6.362938356399536,
|
|
"epoch": 2.3341027120600115,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004463443362331166,
|
|
"loss": 5.7797,
|
|
"mean_token_accuracy": 0.20133419930934907,
|
|
"num_tokens": 51270382.0,
|
|
"step": 20225
|
|
},
|
|
{
|
|
"entropy": 6.2769464492797855,
|
|
"epoch": 2.3346797461050204,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00044631758871988486,
|
|
"loss": 5.7646,
|
|
"mean_token_accuracy": 0.19585290253162385,
|
|
"num_tokens": 51283923.0,
|
|
"step": 20230
|
|
},
|
|
{
|
|
"entropy": 6.329458999633789,
|
|
"epoch": 2.335256780150029,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004462908354444711,
|
|
"loss": 5.7254,
|
|
"mean_token_accuracy": 0.1990818738937378,
|
|
"num_tokens": 51297671.0,
|
|
"step": 20235
|
|
},
|
|
{
|
|
"entropy": 6.3086357593536375,
|
|
"epoch": 2.3358338141950377,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004462640764077751,
|
|
"loss": 5.6835,
|
|
"mean_token_accuracy": 0.2007381275296211,
|
|
"num_tokens": 51309339.0,
|
|
"step": 20240
|
|
},
|
|
{
|
|
"entropy": 6.273665523529052,
|
|
"epoch": 2.336410848240046,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004462373116106971,
|
|
"loss": 5.7941,
|
|
"mean_token_accuracy": 0.1993747517466545,
|
|
"num_tokens": 51321479.0,
|
|
"step": 20245
|
|
},
|
|
{
|
|
"entropy": 6.256979846954346,
|
|
"epoch": 2.336987882285055,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00044621054105413704,
|
|
"loss": 5.7192,
|
|
"mean_token_accuracy": 0.19843647629022598,
|
|
"num_tokens": 51335135.0,
|
|
"step": 20250
|
|
},
|
|
{
|
|
"entropy": 6.226361513137817,
|
|
"epoch": 2.3375649163300634,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00044618376473899555,
|
|
"loss": 5.6681,
|
|
"mean_token_accuracy": 0.20416603982448578,
|
|
"num_tokens": 51346556.0,
|
|
"step": 20255
|
|
},
|
|
{
|
|
"entropy": 6.18687252998352,
|
|
"epoch": 2.338141950375072,
|
|
"grad_norm": 1.734375,
|
|
"learning_rate": 0.0004461569826661732,
|
|
"loss": 5.5636,
|
|
"mean_token_accuracy": 0.21304285377264023,
|
|
"num_tokens": 51359692.0,
|
|
"step": 20260
|
|
},
|
|
{
|
|
"entropy": 6.295094442367554,
|
|
"epoch": 2.3387189844200806,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004461301948365707,
|
|
"loss": 5.6772,
|
|
"mean_token_accuracy": 0.19782449454069137,
|
|
"num_tokens": 51371682.0,
|
|
"step": 20265
|
|
},
|
|
{
|
|
"entropy": 6.272954797744751,
|
|
"epoch": 2.3392960184650895,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004461034012510891,
|
|
"loss": 5.725,
|
|
"mean_token_accuracy": 0.20265191793441772,
|
|
"num_tokens": 51383533.0,
|
|
"step": 20270
|
|
},
|
|
{
|
|
"entropy": 6.267000722885132,
|
|
"epoch": 2.339873052510098,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00044607660191062963,
|
|
"loss": 5.6615,
|
|
"mean_token_accuracy": 0.20510787516832352,
|
|
"num_tokens": 51395696.0,
|
|
"step": 20275
|
|
},
|
|
{
|
|
"entropy": 6.215906572341919,
|
|
"epoch": 2.340450086555107,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00044604979681609364,
|
|
"loss": 5.6255,
|
|
"mean_token_accuracy": 0.20820956826210021,
|
|
"num_tokens": 51408460.0,
|
|
"step": 20280
|
|
},
|
|
{
|
|
"entropy": 6.187142848968506,
|
|
"epoch": 2.341027120600115,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00044602298596838264,
|
|
"loss": 5.619,
|
|
"mean_token_accuracy": 0.20651773512363433,
|
|
"num_tokens": 51420768.0,
|
|
"step": 20285
|
|
},
|
|
{
|
|
"entropy": 6.261281728744507,
|
|
"epoch": 2.341604154645124,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00044599616936839853,
|
|
"loss": 5.6743,
|
|
"mean_token_accuracy": 0.20559660345315933,
|
|
"num_tokens": 51434429.0,
|
|
"step": 20290
|
|
},
|
|
{
|
|
"entropy": 6.310505104064942,
|
|
"epoch": 2.342181188690133,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004459693470170432,
|
|
"loss": 5.7352,
|
|
"mean_token_accuracy": 0.20220571756362915,
|
|
"num_tokens": 51447146.0,
|
|
"step": 20295
|
|
},
|
|
{
|
|
"entropy": 6.275731611251831,
|
|
"epoch": 2.3427582227351413,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004459425189152187,
|
|
"loss": 5.6227,
|
|
"mean_token_accuracy": 0.20923758745193483,
|
|
"num_tokens": 51458656.0,
|
|
"step": 20300
|
|
},
|
|
{
|
|
"entropy": 6.15320463180542,
|
|
"epoch": 2.34333525678015,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00044591568506382757,
|
|
"loss": 5.5173,
|
|
"mean_token_accuracy": 0.21781913489103316,
|
|
"num_tokens": 51473350.0,
|
|
"step": 20305
|
|
},
|
|
{
|
|
"entropy": 6.280113744735718,
|
|
"epoch": 2.3439122908251586,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00044588884546377226,
|
|
"loss": 5.6646,
|
|
"mean_token_accuracy": 0.2047184869647026,
|
|
"num_tokens": 51486801.0,
|
|
"step": 20310
|
|
},
|
|
{
|
|
"entropy": 6.246380805969238,
|
|
"epoch": 2.3444893248701675,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004458620001159555,
|
|
"loss": 5.6899,
|
|
"mean_token_accuracy": 0.2027744859457016,
|
|
"num_tokens": 51499217.0,
|
|
"step": 20315
|
|
},
|
|
{
|
|
"entropy": 6.26472282409668,
|
|
"epoch": 2.345066358915176,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004458351490212803,
|
|
"loss": 5.7649,
|
|
"mean_token_accuracy": 0.19978072494268417,
|
|
"num_tokens": 51511714.0,
|
|
"step": 20320
|
|
},
|
|
{
|
|
"entropy": 6.229470682144165,
|
|
"epoch": 2.3456433929601848,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00044580829218064964,
|
|
"loss": 5.6106,
|
|
"mean_token_accuracy": 0.20698875188827515,
|
|
"num_tokens": 51522725.0,
|
|
"step": 20325
|
|
},
|
|
{
|
|
"entropy": 6.3298228740692135,
|
|
"epoch": 2.346220427005193,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000445781429594967,
|
|
"loss": 5.6844,
|
|
"mean_token_accuracy": 0.20495259165763854,
|
|
"num_tokens": 51535178.0,
|
|
"step": 20330
|
|
},
|
|
{
|
|
"entropy": 6.310057067871094,
|
|
"epoch": 2.346797461050202,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004457545612651357,
|
|
"loss": 5.7986,
|
|
"mean_token_accuracy": 0.1921558916568756,
|
|
"num_tokens": 51546859.0,
|
|
"step": 20335
|
|
},
|
|
{
|
|
"entropy": 6.307834815979004,
|
|
"epoch": 2.3473744950952105,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00044572768719205964,
|
|
"loss": 5.6828,
|
|
"mean_token_accuracy": 0.20095667690038682,
|
|
"num_tokens": 51558719.0,
|
|
"step": 20340
|
|
},
|
|
{
|
|
"entropy": 6.312375783920288,
|
|
"epoch": 2.3479515291402193,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00044570080737664264,
|
|
"loss": 5.7476,
|
|
"mean_token_accuracy": 0.1949980840086937,
|
|
"num_tokens": 51570630.0,
|
|
"step": 20345
|
|
},
|
|
{
|
|
"entropy": 6.309825801849366,
|
|
"epoch": 2.3485285631852277,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00044567392181978874,
|
|
"loss": 5.6623,
|
|
"mean_token_accuracy": 0.1984606221318245,
|
|
"num_tokens": 51583463.0,
|
|
"step": 20350
|
|
},
|
|
{
|
|
"entropy": 6.279160451889038,
|
|
"epoch": 2.3491055972302366,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00044564703052240223,
|
|
"loss": 5.7259,
|
|
"mean_token_accuracy": 0.19899120777845383,
|
|
"num_tokens": 51597090.0,
|
|
"step": 20355
|
|
},
|
|
{
|
|
"entropy": 6.219781351089478,
|
|
"epoch": 2.349682631275245,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004456201334853876,
|
|
"loss": 5.6265,
|
|
"mean_token_accuracy": 0.20903219729661943,
|
|
"num_tokens": 51609288.0,
|
|
"step": 20360
|
|
},
|
|
{
|
|
"entropy": 6.171813535690307,
|
|
"epoch": 2.350259665320254,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00044559323070964956,
|
|
"loss": 5.611,
|
|
"mean_token_accuracy": 0.2132205694913864,
|
|
"num_tokens": 51622269.0,
|
|
"step": 20365
|
|
},
|
|
{
|
|
"entropy": 6.281157636642456,
|
|
"epoch": 2.3508366993652627,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000445566322196093,
|
|
"loss": 5.7412,
|
|
"mean_token_accuracy": 0.19239043891429902,
|
|
"num_tokens": 51634222.0,
|
|
"step": 20370
|
|
},
|
|
{
|
|
"entropy": 6.292509889602661,
|
|
"epoch": 2.351413733410271,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004455394079456228,
|
|
"loss": 5.7057,
|
|
"mean_token_accuracy": 0.19713842421770095,
|
|
"num_tokens": 51646933.0,
|
|
"step": 20375
|
|
},
|
|
{
|
|
"entropy": 6.2920444965362545,
|
|
"epoch": 2.35199076745528,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00044551248795914446,
|
|
"loss": 5.6773,
|
|
"mean_token_accuracy": 0.20137425810098647,
|
|
"num_tokens": 51658987.0,
|
|
"step": 20380
|
|
},
|
|
{
|
|
"entropy": 6.240331506729126,
|
|
"epoch": 2.3525678015002884,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004454855622375632,
|
|
"loss": 5.7234,
|
|
"mean_token_accuracy": 0.20117460191249847,
|
|
"num_tokens": 51669513.0,
|
|
"step": 20385
|
|
},
|
|
{
|
|
"entropy": 6.302077150344848,
|
|
"epoch": 2.3531448355452973,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004454586307817848,
|
|
"loss": 5.6721,
|
|
"mean_token_accuracy": 0.20111125260591506,
|
|
"num_tokens": 51682084.0,
|
|
"step": 20390
|
|
},
|
|
{
|
|
"entropy": 6.271924304962158,
|
|
"epoch": 2.3537218695903057,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.000445431693592715,
|
|
"loss": 5.7122,
|
|
"mean_token_accuracy": 0.20097984075546266,
|
|
"num_tokens": 51695335.0,
|
|
"step": 20395
|
|
},
|
|
{
|
|
"entropy": 6.301687812805175,
|
|
"epoch": 2.3542989036353146,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004454047506712598,
|
|
"loss": 5.7827,
|
|
"mean_token_accuracy": 0.19593358039855957,
|
|
"num_tokens": 51707856.0,
|
|
"step": 20400
|
|
},
|
|
{
|
|
"entropy": 6.273509550094604,
|
|
"epoch": 2.354875937680323,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00044537780201832545,
|
|
"loss": 5.677,
|
|
"mean_token_accuracy": 0.1995402529835701,
|
|
"num_tokens": 51719716.0,
|
|
"step": 20405
|
|
},
|
|
{
|
|
"entropy": 6.19102635383606,
|
|
"epoch": 2.355452971725332,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004453508476348184,
|
|
"loss": 5.6402,
|
|
"mean_token_accuracy": 0.21555724292993544,
|
|
"num_tokens": 51733263.0,
|
|
"step": 20410
|
|
},
|
|
{
|
|
"entropy": 6.248130130767822,
|
|
"epoch": 2.3560300057703403,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004453238875216452,
|
|
"loss": 5.6175,
|
|
"mean_token_accuracy": 0.20646194070577623,
|
|
"num_tokens": 51745143.0,
|
|
"step": 20415
|
|
},
|
|
{
|
|
"entropy": 6.306704330444336,
|
|
"epoch": 2.356607039815349,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004452969216797127,
|
|
"loss": 5.7435,
|
|
"mean_token_accuracy": 0.19763799011707306,
|
|
"num_tokens": 51757155.0,
|
|
"step": 20420
|
|
},
|
|
{
|
|
"entropy": 6.18883695602417,
|
|
"epoch": 2.357184073860358,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004452699501099277,
|
|
"loss": 5.6381,
|
|
"mean_token_accuracy": 0.20822127610445024,
|
|
"num_tokens": 51769170.0,
|
|
"step": 20425
|
|
},
|
|
{
|
|
"entropy": 6.280981349945068,
|
|
"epoch": 2.3577611079053664,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00044524297281319766,
|
|
"loss": 5.7259,
|
|
"mean_token_accuracy": 0.1986905887722969,
|
|
"num_tokens": 51781254.0,
|
|
"step": 20430
|
|
},
|
|
{
|
|
"entropy": 6.318002128601075,
|
|
"epoch": 2.358338141950375,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00044521598979042963,
|
|
"loss": 5.7523,
|
|
"mean_token_accuracy": 0.1985146164894104,
|
|
"num_tokens": 51793425.0,
|
|
"step": 20435
|
|
},
|
|
{
|
|
"entropy": 6.250660800933838,
|
|
"epoch": 2.3589151759953837,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00044518900104253154,
|
|
"loss": 5.6707,
|
|
"mean_token_accuracy": 0.20157449394464494,
|
|
"num_tokens": 51806196.0,
|
|
"step": 20440
|
|
},
|
|
{
|
|
"entropy": 6.210059547424317,
|
|
"epoch": 2.3594922100403926,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004451620065704108,
|
|
"loss": 5.6892,
|
|
"mean_token_accuracy": 0.20226312130689622,
|
|
"num_tokens": 51819137.0,
|
|
"step": 20445
|
|
},
|
|
{
|
|
"entropy": 6.339330101013184,
|
|
"epoch": 2.360069244085401,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00044513500637497546,
|
|
"loss": 5.7755,
|
|
"mean_token_accuracy": 0.19646340757608413,
|
|
"num_tokens": 51830924.0,
|
|
"step": 20450
|
|
},
|
|
{
|
|
"entropy": 6.3239030838012695,
|
|
"epoch": 2.36064627813041,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00044510800045713373,
|
|
"loss": 5.66,
|
|
"mean_token_accuracy": 0.19947621822357178,
|
|
"num_tokens": 51843503.0,
|
|
"step": 20455
|
|
},
|
|
{
|
|
"entropy": 6.277648830413819,
|
|
"epoch": 2.3612233121754183,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00044508098881779396,
|
|
"loss": 5.7303,
|
|
"mean_token_accuracy": 0.19973205924034118,
|
|
"num_tokens": 51855818.0,
|
|
"step": 20460
|
|
},
|
|
{
|
|
"entropy": 6.27275915145874,
|
|
"epoch": 2.361800346220427,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004450539714578645,
|
|
"loss": 5.6837,
|
|
"mean_token_accuracy": 0.20204851776361465,
|
|
"num_tokens": 51867033.0,
|
|
"step": 20465
|
|
},
|
|
{
|
|
"entropy": 6.309321117401123,
|
|
"epoch": 2.3623773802654355,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004450269483782543,
|
|
"loss": 5.6707,
|
|
"mean_token_accuracy": 0.2012152075767517,
|
|
"num_tokens": 51880845.0,
|
|
"step": 20470
|
|
},
|
|
{
|
|
"entropy": 6.276156616210938,
|
|
"epoch": 2.3629544143104444,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004449999195798721,
|
|
"loss": 5.7645,
|
|
"mean_token_accuracy": 0.1931744247674942,
|
|
"num_tokens": 51893761.0,
|
|
"step": 20475
|
|
},
|
|
{
|
|
"entropy": 6.266883802413941,
|
|
"epoch": 2.363531448355453,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00044497288506362706,
|
|
"loss": 5.6604,
|
|
"mean_token_accuracy": 0.20568044781684874,
|
|
"num_tokens": 51907478.0,
|
|
"step": 20480
|
|
},
|
|
{
|
|
"entropy": 6.320327377319336,
|
|
"epoch": 2.3641084824004617,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004449458448304284,
|
|
"loss": 5.6667,
|
|
"mean_token_accuracy": 0.21099235564470292,
|
|
"num_tokens": 51919242.0,
|
|
"step": 20485
|
|
},
|
|
{
|
|
"entropy": 6.3270317077636715,
|
|
"epoch": 2.36468551644547,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00044491879888118574,
|
|
"loss": 5.7595,
|
|
"mean_token_accuracy": 0.19944236427545547,
|
|
"num_tokens": 51930791.0,
|
|
"step": 20490
|
|
},
|
|
{
|
|
"entropy": 6.123858451843262,
|
|
"epoch": 2.365262550490479,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004448917472168087,
|
|
"loss": 5.5088,
|
|
"mean_token_accuracy": 0.21103607267141342,
|
|
"num_tokens": 51943848.0,
|
|
"step": 20495
|
|
},
|
|
{
|
|
"entropy": 6.274829006195068,
|
|
"epoch": 2.365839584535488,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00044486468983820707,
|
|
"loss": 5.7413,
|
|
"mean_token_accuracy": 0.19155209511518478,
|
|
"num_tokens": 51956648.0,
|
|
"step": 20500
|
|
},
|
|
{
|
|
"entropy": 6.305342388153076,
|
|
"epoch": 2.3664166185804962,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.000444837626746291,
|
|
"loss": 5.6963,
|
|
"mean_token_accuracy": 0.20333817601203918,
|
|
"num_tokens": 51969068.0,
|
|
"step": 20505
|
|
},
|
|
{
|
|
"entropy": 6.26474609375,
|
|
"epoch": 2.366993652625505,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004448105579419707,
|
|
"loss": 5.6934,
|
|
"mean_token_accuracy": 0.2022864505648613,
|
|
"num_tokens": 51981856.0,
|
|
"step": 20510
|
|
},
|
|
{
|
|
"entropy": 6.335216236114502,
|
|
"epoch": 2.3675706866705135,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004447834834261567,
|
|
"loss": 5.7573,
|
|
"mean_token_accuracy": 0.19250386953353882,
|
|
"num_tokens": 51994428.0,
|
|
"step": 20515
|
|
},
|
|
{
|
|
"entropy": 6.23250002861023,
|
|
"epoch": 2.3681477207155224,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004447564031997595,
|
|
"loss": 5.5865,
|
|
"mean_token_accuracy": 0.21269481927156447,
|
|
"num_tokens": 52007875.0,
|
|
"step": 20520
|
|
},
|
|
{
|
|
"entropy": 6.257858562469482,
|
|
"epoch": 2.368724754760531,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00044472931726369,
|
|
"loss": 5.5938,
|
|
"mean_token_accuracy": 0.20823481380939485,
|
|
"num_tokens": 52020876.0,
|
|
"step": 20525
|
|
},
|
|
{
|
|
"entropy": 6.346431732177734,
|
|
"epoch": 2.3693017888055397,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.00044470222561885926,
|
|
"loss": 5.7454,
|
|
"mean_token_accuracy": 0.19151533842086793,
|
|
"num_tokens": 52032056.0,
|
|
"step": 20530
|
|
},
|
|
{
|
|
"entropy": 6.249010372161865,
|
|
"epoch": 2.369878822850548,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00044467512826617845,
|
|
"loss": 5.6792,
|
|
"mean_token_accuracy": 0.19966776221990584,
|
|
"num_tokens": 52044488.0,
|
|
"step": 20535
|
|
},
|
|
{
|
|
"entropy": 6.271060562133789,
|
|
"epoch": 2.370455856895557,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00044464802520655897,
|
|
"loss": 5.749,
|
|
"mean_token_accuracy": 0.1937350869178772,
|
|
"num_tokens": 52056186.0,
|
|
"step": 20540
|
|
},
|
|
{
|
|
"entropy": 6.317001819610596,
|
|
"epoch": 2.3710328909405654,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004446209164409124,
|
|
"loss": 5.6653,
|
|
"mean_token_accuracy": 0.20406524538993837,
|
|
"num_tokens": 52068218.0,
|
|
"step": 20545
|
|
},
|
|
{
|
|
"entropy": 6.200478410720825,
|
|
"epoch": 2.371609924985574,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004445938019701506,
|
|
"loss": 5.6092,
|
|
"mean_token_accuracy": 0.21559022963047028,
|
|
"num_tokens": 52081854.0,
|
|
"step": 20550
|
|
},
|
|
{
|
|
"entropy": 6.200952386856079,
|
|
"epoch": 2.3721869590305826,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004445666817951855,
|
|
"loss": 5.6137,
|
|
"mean_token_accuracy": 0.20615407526493074,
|
|
"num_tokens": 52094022.0,
|
|
"step": 20555
|
|
},
|
|
{
|
|
"entropy": 6.251945877075196,
|
|
"epoch": 2.3727639930755915,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004445395559169293,
|
|
"loss": 5.6581,
|
|
"mean_token_accuracy": 0.2025573045015335,
|
|
"num_tokens": 52105677.0,
|
|
"step": 20560
|
|
},
|
|
{
|
|
"entropy": 6.342857313156128,
|
|
"epoch": 2.3733410271206,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004445124243362943,
|
|
"loss": 5.7209,
|
|
"mean_token_accuracy": 0.19989970624446868,
|
|
"num_tokens": 52118039.0,
|
|
"step": 20565
|
|
},
|
|
{
|
|
"entropy": 6.2887485980987545,
|
|
"epoch": 2.3739180611656088,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004444852870541932,
|
|
"loss": 5.6851,
|
|
"mean_token_accuracy": 0.20365866869688035,
|
|
"num_tokens": 52131519.0,
|
|
"step": 20570
|
|
},
|
|
{
|
|
"entropy": 6.292483949661255,
|
|
"epoch": 2.3744950952106176,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004444581440715386,
|
|
"loss": 5.7147,
|
|
"mean_token_accuracy": 0.19802933037281037,
|
|
"num_tokens": 52143240.0,
|
|
"step": 20575
|
|
},
|
|
{
|
|
"entropy": 6.233852577209473,
|
|
"epoch": 2.375072129255626,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00044443099538924347,
|
|
"loss": 5.6081,
|
|
"mean_token_accuracy": 0.20580997467041015,
|
|
"num_tokens": 52155977.0,
|
|
"step": 20580
|
|
},
|
|
{
|
|
"entropy": 6.2496278285980225,
|
|
"epoch": 2.375649163300635,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004444038410082211,
|
|
"loss": 5.6534,
|
|
"mean_token_accuracy": 0.2096467509865761,
|
|
"num_tokens": 52169388.0,
|
|
"step": 20585
|
|
},
|
|
{
|
|
"entropy": 6.230743551254273,
|
|
"epoch": 2.3762261973456433,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004443766809293846,
|
|
"loss": 5.6276,
|
|
"mean_token_accuracy": 0.20324479788541794,
|
|
"num_tokens": 52181830.0,
|
|
"step": 20590
|
|
},
|
|
{
|
|
"entropy": 6.186213684082031,
|
|
"epoch": 2.376803231390652,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004443495151536475,
|
|
"loss": 5.6136,
|
|
"mean_token_accuracy": 0.20966268330812454,
|
|
"num_tokens": 52194255.0,
|
|
"step": 20595
|
|
},
|
|
{
|
|
"entropy": 6.273720645904541,
|
|
"epoch": 2.3773802654356606,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004443223436819237,
|
|
"loss": 5.7053,
|
|
"mean_token_accuracy": 0.19739032685756683,
|
|
"num_tokens": 52205646.0,
|
|
"step": 20600
|
|
},
|
|
{
|
|
"entropy": 6.291301012039185,
|
|
"epoch": 2.3779572994806695,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00044429516651512687,
|
|
"loss": 5.6598,
|
|
"mean_token_accuracy": 0.20497027933597564,
|
|
"num_tokens": 52217519.0,
|
|
"step": 20605
|
|
},
|
|
{
|
|
"entropy": 6.243464994430542,
|
|
"epoch": 2.378534333525678,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00044426798365417133,
|
|
"loss": 5.6906,
|
|
"mean_token_accuracy": 0.20207190364599228,
|
|
"num_tokens": 52230139.0,
|
|
"step": 20610
|
|
},
|
|
{
|
|
"entropy": 6.26615309715271,
|
|
"epoch": 2.3791113675706868,
|
|
"grad_norm": 1.8359375,
|
|
"learning_rate": 0.00044424079509997104,
|
|
"loss": 5.7295,
|
|
"mean_token_accuracy": 0.20137403905391693,
|
|
"num_tokens": 52244049.0,
|
|
"step": 20615
|
|
},
|
|
{
|
|
"entropy": 6.293638372421265,
|
|
"epoch": 2.379688401615695,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004442136008534409,
|
|
"loss": 5.6727,
|
|
"mean_token_accuracy": 0.20594702959060668,
|
|
"num_tokens": 52257180.0,
|
|
"step": 20620
|
|
},
|
|
{
|
|
"entropy": 6.24235258102417,
|
|
"epoch": 2.380265435660704,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00044418640091549525,
|
|
"loss": 5.6548,
|
|
"mean_token_accuracy": 0.20861252397298813,
|
|
"num_tokens": 52270260.0,
|
|
"step": 20625
|
|
},
|
|
{
|
|
"entropy": 6.227157783508301,
|
|
"epoch": 2.3808424697057124,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000444159195287049,
|
|
"loss": 5.6543,
|
|
"mean_token_accuracy": 0.20346338003873826,
|
|
"num_tokens": 52282335.0,
|
|
"step": 20630
|
|
},
|
|
{
|
|
"entropy": 6.2641314506530765,
|
|
"epoch": 2.3814195037507213,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004441319839690173,
|
|
"loss": 5.6318,
|
|
"mean_token_accuracy": 0.20761382728815078,
|
|
"num_tokens": 52296547.0,
|
|
"step": 20635
|
|
},
|
|
{
|
|
"entropy": 6.274429273605347,
|
|
"epoch": 2.3819965377957297,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004441047669623153,
|
|
"loss": 5.7007,
|
|
"mean_token_accuracy": 0.19969301372766496,
|
|
"num_tokens": 52309523.0,
|
|
"step": 20640
|
|
},
|
|
{
|
|
"entropy": 6.261510848999023,
|
|
"epoch": 2.3825735718407386,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00044407754426785845,
|
|
"loss": 5.6465,
|
|
"mean_token_accuracy": 0.21056678593158723,
|
|
"num_tokens": 52322476.0,
|
|
"step": 20645
|
|
},
|
|
{
|
|
"entropy": 6.191774082183838,
|
|
"epoch": 2.3831506058857475,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004440503158865625,
|
|
"loss": 5.6031,
|
|
"mean_token_accuracy": 0.20663601756095887,
|
|
"num_tokens": 52335919.0,
|
|
"step": 20650
|
|
},
|
|
{
|
|
"entropy": 6.260403728485107,
|
|
"epoch": 2.383727639930756,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00044402308181934295,
|
|
"loss": 5.6911,
|
|
"mean_token_accuracy": 0.2050690621137619,
|
|
"num_tokens": 52347636.0,
|
|
"step": 20655
|
|
},
|
|
{
|
|
"entropy": 6.317034482955933,
|
|
"epoch": 2.3843046739757647,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004439958420671162,
|
|
"loss": 5.6786,
|
|
"mean_token_accuracy": 0.20000161081552506,
|
|
"num_tokens": 52360181.0,
|
|
"step": 20660
|
|
},
|
|
{
|
|
"entropy": 6.254880428314209,
|
|
"epoch": 2.384881708020773,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00044396859663079814,
|
|
"loss": 5.6601,
|
|
"mean_token_accuracy": 0.2131296619772911,
|
|
"num_tokens": 52373525.0,
|
|
"step": 20665
|
|
},
|
|
{
|
|
"entropy": 6.20746111869812,
|
|
"epoch": 2.385458742065782,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00044394134551130533,
|
|
"loss": 5.6036,
|
|
"mean_token_accuracy": 0.20687361806631088,
|
|
"num_tokens": 52386252.0,
|
|
"step": 20670
|
|
},
|
|
{
|
|
"entropy": 6.233136701583862,
|
|
"epoch": 2.3860357761107904,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004439140887095542,
|
|
"loss": 5.662,
|
|
"mean_token_accuracy": 0.1992241472005844,
|
|
"num_tokens": 52398056.0,
|
|
"step": 20675
|
|
},
|
|
{
|
|
"entropy": 6.248224925994873,
|
|
"epoch": 2.3866128101557993,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00044388682622646165,
|
|
"loss": 5.6832,
|
|
"mean_token_accuracy": 0.20441022962331773,
|
|
"num_tokens": 52409861.0,
|
|
"step": 20680
|
|
},
|
|
{
|
|
"entropy": 6.205007266998291,
|
|
"epoch": 2.3871898442008077,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004438595580629446,
|
|
"loss": 5.6461,
|
|
"mean_token_accuracy": 0.20737055987119674,
|
|
"num_tokens": 52423252.0,
|
|
"step": 20685
|
|
},
|
|
{
|
|
"entropy": 6.254592943191528,
|
|
"epoch": 2.3877668782458166,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004438322842199202,
|
|
"loss": 5.6072,
|
|
"mean_token_accuracy": 0.2115780532360077,
|
|
"num_tokens": 52435950.0,
|
|
"step": 20690
|
|
},
|
|
{
|
|
"entropy": 6.291515111923218,
|
|
"epoch": 2.388343912290825,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004438050046983057,
|
|
"loss": 5.6623,
|
|
"mean_token_accuracy": 0.20793629735708236,
|
|
"num_tokens": 52449257.0,
|
|
"step": 20695
|
|
},
|
|
{
|
|
"entropy": 6.258818960189819,
|
|
"epoch": 2.388920946335834,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00044377771949901876,
|
|
"loss": 5.6852,
|
|
"mean_token_accuracy": 0.20355032831430436,
|
|
"num_tokens": 52461543.0,
|
|
"step": 20700
|
|
},
|
|
{
|
|
"entropy": 6.125908517837525,
|
|
"epoch": 2.3894979803808427,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00044375042862297703,
|
|
"loss": 5.6012,
|
|
"mean_token_accuracy": 0.20494010001420976,
|
|
"num_tokens": 52473752.0,
|
|
"step": 20705
|
|
},
|
|
{
|
|
"entropy": 6.346489143371582,
|
|
"epoch": 2.390075014425851,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00044372313207109856,
|
|
"loss": 5.7409,
|
|
"mean_token_accuracy": 0.1928962856531143,
|
|
"num_tokens": 52485885.0,
|
|
"step": 20710
|
|
},
|
|
{
|
|
"entropy": 6.292835807800293,
|
|
"epoch": 2.3906520484708595,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00044369582984430127,
|
|
"loss": 5.6892,
|
|
"mean_token_accuracy": 0.20104454159736634,
|
|
"num_tokens": 52498389.0,
|
|
"step": 20715
|
|
},
|
|
{
|
|
"entropy": 6.241178131103515,
|
|
"epoch": 2.3912290825158684,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00044366852194350354,
|
|
"loss": 5.6892,
|
|
"mean_token_accuracy": 0.20661631524562835,
|
|
"num_tokens": 52511176.0,
|
|
"step": 20720
|
|
},
|
|
{
|
|
"entropy": 6.2766162872314455,
|
|
"epoch": 2.3918061165608773,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004436412083696239,
|
|
"loss": 5.6704,
|
|
"mean_token_accuracy": 0.1999954655766487,
|
|
"num_tokens": 52523173.0,
|
|
"step": 20725
|
|
},
|
|
{
|
|
"entropy": 6.2250009059906,
|
|
"epoch": 2.3923831506058857,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00044361388912358095,
|
|
"loss": 5.6023,
|
|
"mean_token_accuracy": 0.20575390607118607,
|
|
"num_tokens": 52535776.0,
|
|
"step": 20730
|
|
},
|
|
{
|
|
"entropy": 6.0612109184265135,
|
|
"epoch": 2.3929601846508946,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004435865642062936,
|
|
"loss": 5.4344,
|
|
"mean_token_accuracy": 0.22326288521289825,
|
|
"num_tokens": 52549416.0,
|
|
"step": 20735
|
|
},
|
|
{
|
|
"entropy": 6.210688829421997,
|
|
"epoch": 2.393537218695903,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004435592336186809,
|
|
"loss": 5.6426,
|
|
"mean_token_accuracy": 0.20971183031797408,
|
|
"num_tokens": 52562300.0,
|
|
"step": 20740
|
|
},
|
|
{
|
|
"entropy": 6.315302419662475,
|
|
"epoch": 2.394114252740912,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004435318973616622,
|
|
"loss": 5.7355,
|
|
"mean_token_accuracy": 0.1986914187669754,
|
|
"num_tokens": 52573906.0,
|
|
"step": 20745
|
|
},
|
|
{
|
|
"entropy": 6.260455179214477,
|
|
"epoch": 2.3946912867859202,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00044350455543615665,
|
|
"loss": 5.6618,
|
|
"mean_token_accuracy": 0.20642436891794205,
|
|
"num_tokens": 52586138.0,
|
|
"step": 20750
|
|
},
|
|
{
|
|
"entropy": 6.289743185043335,
|
|
"epoch": 2.395268320830929,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004434772078430843,
|
|
"loss": 5.7052,
|
|
"mean_token_accuracy": 0.20260262489318848,
|
|
"num_tokens": 52599705.0,
|
|
"step": 20755
|
|
},
|
|
{
|
|
"entropy": 6.261003541946411,
|
|
"epoch": 2.3958453548759375,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004434498545833646,
|
|
"loss": 5.7523,
|
|
"mean_token_accuracy": 0.19939430058002472,
|
|
"num_tokens": 52612041.0,
|
|
"step": 20760
|
|
},
|
|
{
|
|
"entropy": 6.310602378845215,
|
|
"epoch": 2.3964223889209464,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004434224956579177,
|
|
"loss": 5.7021,
|
|
"mean_token_accuracy": 0.20172154903411865,
|
|
"num_tokens": 52625634.0,
|
|
"step": 20765
|
|
},
|
|
{
|
|
"entropy": 6.172333574295044,
|
|
"epoch": 2.396999422965955,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004433951310676639,
|
|
"loss": 5.5445,
|
|
"mean_token_accuracy": 0.21477589756250381,
|
|
"num_tokens": 52638706.0,
|
|
"step": 20770
|
|
},
|
|
{
|
|
"entropy": 6.18256368637085,
|
|
"epoch": 2.3975764570109637,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00044336776081352347,
|
|
"loss": 5.6921,
|
|
"mean_token_accuracy": 0.2102103739976883,
|
|
"num_tokens": 52650876.0,
|
|
"step": 20775
|
|
},
|
|
{
|
|
"entropy": 6.233721828460693,
|
|
"epoch": 2.3981534910559725,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00044334038489641706,
|
|
"loss": 5.6333,
|
|
"mean_token_accuracy": 0.20763159096240996,
|
|
"num_tokens": 52663664.0,
|
|
"step": 20780
|
|
},
|
|
{
|
|
"entropy": 6.34328670501709,
|
|
"epoch": 2.398730525100981,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00044331300331726544,
|
|
"loss": 5.7688,
|
|
"mean_token_accuracy": 0.19594075679779052,
|
|
"num_tokens": 52675870.0,
|
|
"step": 20785
|
|
},
|
|
{
|
|
"entropy": 6.2657371997833256,
|
|
"epoch": 2.3993075591459894,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00044328561607698947,
|
|
"loss": 5.6955,
|
|
"mean_token_accuracy": 0.19709624648094176,
|
|
"num_tokens": 52687029.0,
|
|
"step": 20790
|
|
},
|
|
{
|
|
"entropy": 6.190671730041504,
|
|
"epoch": 2.3998845931909982,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004432582231765105,
|
|
"loss": 5.5523,
|
|
"mean_token_accuracy": 0.20293704867362977,
|
|
"num_tokens": 52700242.0,
|
|
"step": 20795
|
|
},
|
|
{
|
|
"entropy": 6.263112306594849,
|
|
"epoch": 2.400461627236007,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00044323082461674974,
|
|
"loss": 5.6512,
|
|
"mean_token_accuracy": 0.2004449725151062,
|
|
"num_tokens": 52711561.0,
|
|
"step": 20800
|
|
},
|
|
{
|
|
"entropy": 6.163639688491822,
|
|
"epoch": 2.4010386612810155,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004432034203986287,
|
|
"loss": 5.5826,
|
|
"mean_token_accuracy": 0.20719403624534607,
|
|
"num_tokens": 52725101.0,
|
|
"step": 20805
|
|
},
|
|
{
|
|
"entropy": 6.299870204925537,
|
|
"epoch": 2.4016156953260244,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004431760105230693,
|
|
"loss": 5.7036,
|
|
"mean_token_accuracy": 0.19972139000892639,
|
|
"num_tokens": 52738315.0,
|
|
"step": 20810
|
|
},
|
|
{
|
|
"entropy": 6.311771631240845,
|
|
"epoch": 2.402192729371033,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00044314859499099325,
|
|
"loss": 5.768,
|
|
"mean_token_accuracy": 0.20132242143154144,
|
|
"num_tokens": 52752547.0,
|
|
"step": 20815
|
|
},
|
|
{
|
|
"entropy": 6.3200325012207035,
|
|
"epoch": 2.4027697634160416,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00044312117380332274,
|
|
"loss": 5.7677,
|
|
"mean_token_accuracy": 0.19519882798194885,
|
|
"num_tokens": 52765831.0,
|
|
"step": 20820
|
|
},
|
|
{
|
|
"entropy": 6.276677131652832,
|
|
"epoch": 2.40334679746105,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00044309374696098,
|
|
"loss": 5.6135,
|
|
"mean_token_accuracy": 0.2075101539492607,
|
|
"num_tokens": 52779144.0,
|
|
"step": 20825
|
|
},
|
|
{
|
|
"entropy": 6.27869553565979,
|
|
"epoch": 2.403923831506059,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004430663144648876,
|
|
"loss": 5.6549,
|
|
"mean_token_accuracy": 0.21143777966499328,
|
|
"num_tokens": 52790956.0,
|
|
"step": 20830
|
|
},
|
|
{
|
|
"entropy": 6.254818725585937,
|
|
"epoch": 2.4045008655510673,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00044303887631596823,
|
|
"loss": 5.6933,
|
|
"mean_token_accuracy": 0.2000236004590988,
|
|
"num_tokens": 52804057.0,
|
|
"step": 20835
|
|
},
|
|
{
|
|
"entropy": 6.275049161911011,
|
|
"epoch": 2.405077899596076,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004430114325151447,
|
|
"loss": 5.602,
|
|
"mean_token_accuracy": 0.20146780759096145,
|
|
"num_tokens": 52817197.0,
|
|
"step": 20840
|
|
},
|
|
{
|
|
"entropy": 6.312943840026856,
|
|
"epoch": 2.4056549336410846,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004429839830633401,
|
|
"loss": 5.6878,
|
|
"mean_token_accuracy": 0.20596786588430405,
|
|
"num_tokens": 52830162.0,
|
|
"step": 20845
|
|
},
|
|
{
|
|
"entropy": 6.244770193099976,
|
|
"epoch": 2.4062319676860935,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004429565279614777,
|
|
"loss": 5.6855,
|
|
"mean_token_accuracy": 0.20993798077106476,
|
|
"num_tokens": 52843681.0,
|
|
"step": 20850
|
|
},
|
|
{
|
|
"entropy": 6.273213005065918,
|
|
"epoch": 2.4068090017311023,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00044292906721048094,
|
|
"loss": 5.6646,
|
|
"mean_token_accuracy": 0.21043166220188142,
|
|
"num_tokens": 52857297.0,
|
|
"step": 20855
|
|
},
|
|
{
|
|
"entropy": 6.102078199386597,
|
|
"epoch": 2.4073860357761108,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004429016008112733,
|
|
"loss": 5.453,
|
|
"mean_token_accuracy": 0.21661452054977418,
|
|
"num_tokens": 52870551.0,
|
|
"step": 20860
|
|
},
|
|
{
|
|
"entropy": 6.232694149017334,
|
|
"epoch": 2.4079630698211196,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004428741287647788,
|
|
"loss": 5.6018,
|
|
"mean_token_accuracy": 0.21334003508090973,
|
|
"num_tokens": 52884628.0,
|
|
"step": 20865
|
|
},
|
|
{
|
|
"entropy": 6.258617401123047,
|
|
"epoch": 2.408540103866128,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00044284665107192136,
|
|
"loss": 5.6018,
|
|
"mean_token_accuracy": 0.21635719537734985,
|
|
"num_tokens": 52897079.0,
|
|
"step": 20870
|
|
},
|
|
{
|
|
"entropy": 6.207066011428833,
|
|
"epoch": 2.409117137911137,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004428191677336251,
|
|
"loss": 5.6794,
|
|
"mean_token_accuracy": 0.205386246740818,
|
|
"num_tokens": 52909990.0,
|
|
"step": 20875
|
|
},
|
|
{
|
|
"entropy": 6.230048990249633,
|
|
"epoch": 2.4096941719561453,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004427916787508146,
|
|
"loss": 5.685,
|
|
"mean_token_accuracy": 0.20320132970809937,
|
|
"num_tokens": 52922732.0,
|
|
"step": 20880
|
|
},
|
|
{
|
|
"entropy": 6.353757715225219,
|
|
"epoch": 2.410271206001154,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004427641841244144,
|
|
"loss": 5.7219,
|
|
"mean_token_accuracy": 0.19882332533597946,
|
|
"num_tokens": 52934648.0,
|
|
"step": 20885
|
|
},
|
|
{
|
|
"entropy": 6.306688976287842,
|
|
"epoch": 2.4108482400461626,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000442736683855349,
|
|
"loss": 5.7502,
|
|
"mean_token_accuracy": 0.19999517798423766,
|
|
"num_tokens": 52947913.0,
|
|
"step": 20890
|
|
},
|
|
{
|
|
"entropy": 6.265348243713379,
|
|
"epoch": 2.4114252740911715,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004427091779445437,
|
|
"loss": 5.693,
|
|
"mean_token_accuracy": 0.20397568345069886,
|
|
"num_tokens": 52960491.0,
|
|
"step": 20895
|
|
},
|
|
{
|
|
"entropy": 6.3150794506073,
|
|
"epoch": 2.41200230813618,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004426816663929235,
|
|
"loss": 5.6529,
|
|
"mean_token_accuracy": 0.2066299334168434,
|
|
"num_tokens": 52972813.0,
|
|
"step": 20900
|
|
},
|
|
{
|
|
"entropy": 6.30979208946228,
|
|
"epoch": 2.4125793421811887,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00044265414920141366,
|
|
"loss": 5.7035,
|
|
"mean_token_accuracy": 0.19975962191820146,
|
|
"num_tokens": 52985548.0,
|
|
"step": 20905
|
|
},
|
|
{
|
|
"entropy": 6.237899971008301,
|
|
"epoch": 2.413156376226197,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00044262662637093987,
|
|
"loss": 5.5775,
|
|
"mean_token_accuracy": 0.21558093875646592,
|
|
"num_tokens": 52998911.0,
|
|
"step": 20910
|
|
},
|
|
{
|
|
"entropy": 6.182219457626343,
|
|
"epoch": 2.413733410271206,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00044259909790242776,
|
|
"loss": 5.6054,
|
|
"mean_token_accuracy": 0.2133312329649925,
|
|
"num_tokens": 53011205.0,
|
|
"step": 20915
|
|
},
|
|
{
|
|
"entropy": 6.237178754806519,
|
|
"epoch": 2.4143104443162144,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004425715637968032,
|
|
"loss": 5.7037,
|
|
"mean_token_accuracy": 0.2034172847867012,
|
|
"num_tokens": 53023428.0,
|
|
"step": 20920
|
|
},
|
|
{
|
|
"entropy": 6.351958084106445,
|
|
"epoch": 2.4148874783612233,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004425440240549923,
|
|
"loss": 5.7983,
|
|
"mean_token_accuracy": 0.19115305542945862,
|
|
"num_tokens": 53035488.0,
|
|
"step": 20925
|
|
},
|
|
{
|
|
"entropy": 6.189400720596313,
|
|
"epoch": 2.415464512406232,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00044251647867792147,
|
|
"loss": 5.5431,
|
|
"mean_token_accuracy": 0.2178526610136032,
|
|
"num_tokens": 53048416.0,
|
|
"step": 20930
|
|
},
|
|
{
|
|
"entropy": 6.261590957641602,
|
|
"epoch": 2.4160415464512406,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00044248892766651706,
|
|
"loss": 5.7911,
|
|
"mean_token_accuracy": 0.19820116460323334,
|
|
"num_tokens": 53061763.0,
|
|
"step": 20935
|
|
},
|
|
{
|
|
"entropy": 6.231258487701416,
|
|
"epoch": 2.4166185804962494,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004424613710217057,
|
|
"loss": 5.608,
|
|
"mean_token_accuracy": 0.20854777544736863,
|
|
"num_tokens": 53073666.0,
|
|
"step": 20940
|
|
},
|
|
{
|
|
"entropy": 6.165039777755737,
|
|
"epoch": 2.417195614541258,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00044243380874441437,
|
|
"loss": 5.5893,
|
|
"mean_token_accuracy": 0.2164393588900566,
|
|
"num_tokens": 53087155.0,
|
|
"step": 20945
|
|
},
|
|
{
|
|
"entropy": 6.291706848144531,
|
|
"epoch": 2.4177726485862667,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00044240624083557,
|
|
"loss": 5.7532,
|
|
"mean_token_accuracy": 0.20198543518781661,
|
|
"num_tokens": 53099199.0,
|
|
"step": 20950
|
|
},
|
|
{
|
|
"entropy": 6.27391939163208,
|
|
"epoch": 2.418349682631275,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00044237866729609994,
|
|
"loss": 5.7253,
|
|
"mean_token_accuracy": 0.19764039665460587,
|
|
"num_tokens": 53111997.0,
|
|
"step": 20955
|
|
},
|
|
{
|
|
"entropy": 6.1567870616912845,
|
|
"epoch": 2.418926716676284,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004423510881269315,
|
|
"loss": 5.6611,
|
|
"mean_token_accuracy": 0.20668234825134277,
|
|
"num_tokens": 53123812.0,
|
|
"step": 20960
|
|
},
|
|
{
|
|
"entropy": 6.306679534912109,
|
|
"epoch": 2.4195037507212924,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004423235033289924,
|
|
"loss": 5.7441,
|
|
"mean_token_accuracy": 0.19693725556135178,
|
|
"num_tokens": 53137232.0,
|
|
"step": 20965
|
|
},
|
|
{
|
|
"entropy": 6.320231342315674,
|
|
"epoch": 2.4200807847663013,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004422959129032103,
|
|
"loss": 5.6684,
|
|
"mean_token_accuracy": 0.20223398357629777,
|
|
"num_tokens": 53149183.0,
|
|
"step": 20970
|
|
},
|
|
{
|
|
"entropy": 6.1804546356201175,
|
|
"epoch": 2.4206578188113097,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00044226831685051333,
|
|
"loss": 5.5951,
|
|
"mean_token_accuracy": 0.20293668061494827,
|
|
"num_tokens": 53163187.0,
|
|
"step": 20975
|
|
},
|
|
{
|
|
"entropy": 6.322501182556152,
|
|
"epoch": 2.4212348528563186,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004422407151718296,
|
|
"loss": 5.6621,
|
|
"mean_token_accuracy": 0.21300754696130753,
|
|
"num_tokens": 53178441.0,
|
|
"step": 20980
|
|
},
|
|
{
|
|
"entropy": 6.309228181838989,
|
|
"epoch": 2.4218118869013274,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00044221310786808746,
|
|
"loss": 5.6753,
|
|
"mean_token_accuracy": 0.20587997883558273,
|
|
"num_tokens": 53190042.0,
|
|
"step": 20985
|
|
},
|
|
{
|
|
"entropy": 6.260992860794067,
|
|
"epoch": 2.422388920946336,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004421854949402155,
|
|
"loss": 5.6765,
|
|
"mean_token_accuracy": 0.20409729927778245,
|
|
"num_tokens": 53201724.0,
|
|
"step": 20990
|
|
},
|
|
{
|
|
"entropy": 6.2162477493286135,
|
|
"epoch": 2.4229659549913443,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00044215787638914245,
|
|
"loss": 5.6576,
|
|
"mean_token_accuracy": 0.20342174768447877,
|
|
"num_tokens": 53213415.0,
|
|
"step": 20995
|
|
},
|
|
{
|
|
"entropy": 6.2664031982421875,
|
|
"epoch": 2.423542989036353,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004421302522157973,
|
|
"loss": 5.6785,
|
|
"mean_token_accuracy": 0.20658696591854095,
|
|
"num_tokens": 53227324.0,
|
|
"step": 21000
|
|
},
|
|
{
|
|
"epoch": 2.423542989036353,
|
|
"eval_entropy": 6.088870966742925,
|
|
"eval_loss": 5.776307106018066,
|
|
"eval_mean_token_accuracy": 0.20609371489316927,
|
|
"eval_num_tokens": 53227324.0,
|
|
"eval_runtime": 17.4445,
|
|
"eval_samples_per_second": 1612.888,
|
|
"eval_steps_per_second": 201.611,
|
|
"step": 21000
|
|
},
|
|
{
|
|
"entropy": 6.312483072280884,
|
|
"epoch": 2.424120023081362,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004421026224211091,
|
|
"loss": 5.7478,
|
|
"mean_token_accuracy": 0.19414630234241487,
|
|
"num_tokens": 53240325.0,
|
|
"step": 21005
|
|
},
|
|
{
|
|
"entropy": 6.237953758239746,
|
|
"epoch": 2.4246970571263704,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00044207498700600724,
|
|
"loss": 5.5808,
|
|
"mean_token_accuracy": 0.20765155255794526,
|
|
"num_tokens": 53251857.0,
|
|
"step": 21010
|
|
},
|
|
{
|
|
"entropy": 6.281023216247559,
|
|
"epoch": 2.4252740911713793,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00044204734597142115,
|
|
"loss": 5.7391,
|
|
"mean_token_accuracy": 0.20456330627202987,
|
|
"num_tokens": 53266309.0,
|
|
"step": 21015
|
|
},
|
|
{
|
|
"entropy": 6.295359897613525,
|
|
"epoch": 2.4258511252163877,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00044201969931828057,
|
|
"loss": 5.6374,
|
|
"mean_token_accuracy": 0.20940370708703995,
|
|
"num_tokens": 53278085.0,
|
|
"step": 21020
|
|
},
|
|
{
|
|
"entropy": 6.25317792892456,
|
|
"epoch": 2.4264281592613965,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004419920470475154,
|
|
"loss": 5.65,
|
|
"mean_token_accuracy": 0.20308011621236802,
|
|
"num_tokens": 53291395.0,
|
|
"step": 21025
|
|
},
|
|
{
|
|
"entropy": 6.3041338443756105,
|
|
"epoch": 2.427005193306405,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004419643891600556,
|
|
"loss": 5.787,
|
|
"mean_token_accuracy": 0.19857027977705002,
|
|
"num_tokens": 53304735.0,
|
|
"step": 21030
|
|
},
|
|
{
|
|
"entropy": 6.322564315795899,
|
|
"epoch": 2.427582227351414,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00044193672565683153,
|
|
"loss": 5.7251,
|
|
"mean_token_accuracy": 0.2004969224333763,
|
|
"num_tokens": 53316467.0,
|
|
"step": 21035
|
|
},
|
|
{
|
|
"entropy": 6.2362302303314205,
|
|
"epoch": 2.4281592613964222,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004419090565387736,
|
|
"loss": 5.67,
|
|
"mean_token_accuracy": 0.19833118617534637,
|
|
"num_tokens": 53328591.0,
|
|
"step": 21040
|
|
},
|
|
{
|
|
"entropy": 6.326643991470337,
|
|
"epoch": 2.428736295441431,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00044188138180681255,
|
|
"loss": 5.74,
|
|
"mean_token_accuracy": 0.19596015512943268,
|
|
"num_tokens": 53340640.0,
|
|
"step": 21045
|
|
},
|
|
{
|
|
"entropy": 6.313967943191528,
|
|
"epoch": 2.4293133294864395,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000441853701461879,
|
|
"loss": 5.7065,
|
|
"mean_token_accuracy": 0.20161303281784057,
|
|
"num_tokens": 53351798.0,
|
|
"step": 21050
|
|
},
|
|
{
|
|
"entropy": 6.278508710861206,
|
|
"epoch": 2.4298903635314484,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00044182601550490414,
|
|
"loss": 5.7384,
|
|
"mean_token_accuracy": 0.19922790080308914,
|
|
"num_tokens": 53364994.0,
|
|
"step": 21055
|
|
},
|
|
{
|
|
"entropy": 6.394079732894897,
|
|
"epoch": 2.4304673975764572,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004417983239368192,
|
|
"loss": 5.7994,
|
|
"mean_token_accuracy": 0.1930380120873451,
|
|
"num_tokens": 53376729.0,
|
|
"step": 21060
|
|
},
|
|
{
|
|
"entropy": 6.298944997787475,
|
|
"epoch": 2.4310444316214657,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00044177062675855534,
|
|
"loss": 5.7608,
|
|
"mean_token_accuracy": 0.20192819237709045,
|
|
"num_tokens": 53389723.0,
|
|
"step": 21065
|
|
},
|
|
{
|
|
"entropy": 6.321099185943604,
|
|
"epoch": 2.431621465666474,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004417429239710444,
|
|
"loss": 5.7503,
|
|
"mean_token_accuracy": 0.19576003700494765,
|
|
"num_tokens": 53402102.0,
|
|
"step": 21070
|
|
},
|
|
{
|
|
"entropy": 6.146487712860107,
|
|
"epoch": 2.432198499711483,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004417152155752179,
|
|
"loss": 5.5426,
|
|
"mean_token_accuracy": 0.22309158444404603,
|
|
"num_tokens": 53416246.0,
|
|
"step": 21075
|
|
},
|
|
{
|
|
"entropy": 6.2336893558502195,
|
|
"epoch": 2.432775533756492,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004416875015720081,
|
|
"loss": 5.6315,
|
|
"mean_token_accuracy": 0.20447710603475572,
|
|
"num_tokens": 53430666.0,
|
|
"step": 21080
|
|
},
|
|
{
|
|
"entropy": 6.256991147994995,
|
|
"epoch": 2.4333525678015,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004416597819623469,
|
|
"loss": 5.6194,
|
|
"mean_token_accuracy": 0.2086898386478424,
|
|
"num_tokens": 53442302.0,
|
|
"step": 21085
|
|
},
|
|
{
|
|
"entropy": 6.219863796234131,
|
|
"epoch": 2.433929601846509,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00044163205674716666,
|
|
"loss": 5.702,
|
|
"mean_token_accuracy": 0.1993287980556488,
|
|
"num_tokens": 53454288.0,
|
|
"step": 21090
|
|
},
|
|
{
|
|
"entropy": 6.31003966331482,
|
|
"epoch": 2.4345066358915175,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00044160432592740015,
|
|
"loss": 5.7713,
|
|
"mean_token_accuracy": 0.1933869868516922,
|
|
"num_tokens": 53465307.0,
|
|
"step": 21095
|
|
},
|
|
{
|
|
"entropy": 6.230881261825561,
|
|
"epoch": 2.4350836699365264,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00044157658950397965,
|
|
"loss": 5.6166,
|
|
"mean_token_accuracy": 0.20931355357170106,
|
|
"num_tokens": 53478465.0,
|
|
"step": 21100
|
|
},
|
|
{
|
|
"entropy": 6.316826391220093,
|
|
"epoch": 2.435660703981535,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00044154884747783844,
|
|
"loss": 5.6958,
|
|
"mean_token_accuracy": 0.20883227735757828,
|
|
"num_tokens": 53490783.0,
|
|
"step": 21105
|
|
},
|
|
{
|
|
"entropy": 6.258099603652954,
|
|
"epoch": 2.4362377380265436,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00044152109984990954,
|
|
"loss": 5.6167,
|
|
"mean_token_accuracy": 0.20857996642589569,
|
|
"num_tokens": 53502716.0,
|
|
"step": 21110
|
|
},
|
|
{
|
|
"entropy": 6.269389581680298,
|
|
"epoch": 2.436814772071552,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.000441493346621126,
|
|
"loss": 5.7566,
|
|
"mean_token_accuracy": 0.1978018254041672,
|
|
"num_tokens": 53514962.0,
|
|
"step": 21115
|
|
},
|
|
{
|
|
"entropy": 6.368846464157104,
|
|
"epoch": 2.437391806116561,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00044146558779242155,
|
|
"loss": 5.7622,
|
|
"mean_token_accuracy": 0.19363797903060914,
|
|
"num_tokens": 53527741.0,
|
|
"step": 21120
|
|
},
|
|
{
|
|
"entropy": 6.2502247333526615,
|
|
"epoch": 2.4379688401615693,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004414378233647298,
|
|
"loss": 5.7138,
|
|
"mean_token_accuracy": 0.20151958912611007,
|
|
"num_tokens": 53539705.0,
|
|
"step": 21125
|
|
},
|
|
{
|
|
"entropy": 6.230468797683716,
|
|
"epoch": 2.438545874206578,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00044141005333898437,
|
|
"loss": 5.6503,
|
|
"mean_token_accuracy": 0.20231813043355942,
|
|
"num_tokens": 53552310.0,
|
|
"step": 21130
|
|
},
|
|
{
|
|
"entropy": 6.26423978805542,
|
|
"epoch": 2.439122908251587,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004413822777161196,
|
|
"loss": 5.6362,
|
|
"mean_token_accuracy": 0.2111567258834839,
|
|
"num_tokens": 53565553.0,
|
|
"step": 21135
|
|
},
|
|
{
|
|
"entropy": 6.291376638412475,
|
|
"epoch": 2.4396999422965955,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004413544964970695,
|
|
"loss": 5.7161,
|
|
"mean_token_accuracy": 0.1995744913816452,
|
|
"num_tokens": 53578837.0,
|
|
"step": 21140
|
|
},
|
|
{
|
|
"entropy": 6.291012954711914,
|
|
"epoch": 2.4402769763416043,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004413267096827686,
|
|
"loss": 5.6662,
|
|
"mean_token_accuracy": 0.20103991776704788,
|
|
"num_tokens": 53591286.0,
|
|
"step": 21145
|
|
},
|
|
{
|
|
"entropy": 6.2648297309875485,
|
|
"epoch": 2.4408540103866128,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004412989172741514,
|
|
"loss": 5.7057,
|
|
"mean_token_accuracy": 0.20178893357515335,
|
|
"num_tokens": 53603395.0,
|
|
"step": 21150
|
|
},
|
|
{
|
|
"entropy": 6.227371597290039,
|
|
"epoch": 2.4414310444316216,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00044127111927215267,
|
|
"loss": 5.6808,
|
|
"mean_token_accuracy": 0.200730362534523,
|
|
"num_tokens": 53616134.0,
|
|
"step": 21155
|
|
},
|
|
{
|
|
"entropy": 6.237963628768921,
|
|
"epoch": 2.44200807847663,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00044124331567770746,
|
|
"loss": 5.6208,
|
|
"mean_token_accuracy": 0.2077662467956543,
|
|
"num_tokens": 53628736.0,
|
|
"step": 21160
|
|
},
|
|
{
|
|
"entropy": 6.270305013656616,
|
|
"epoch": 2.442585112521639,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004412155064917509,
|
|
"loss": 5.6535,
|
|
"mean_token_accuracy": 0.21042108088731765,
|
|
"num_tokens": 53640921.0,
|
|
"step": 21165
|
|
},
|
|
{
|
|
"entropy": 6.2315953254699705,
|
|
"epoch": 2.4431621465666473,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00044118769171521836,
|
|
"loss": 5.6457,
|
|
"mean_token_accuracy": 0.20233218371868134,
|
|
"num_tokens": 53653483.0,
|
|
"step": 21170
|
|
},
|
|
{
|
|
"entropy": 6.296618032455444,
|
|
"epoch": 2.443739180611656,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00044115987134904543,
|
|
"loss": 5.6322,
|
|
"mean_token_accuracy": 0.20625920444726945,
|
|
"num_tokens": 53666175.0,
|
|
"step": 21175
|
|
},
|
|
{
|
|
"entropy": 6.184669017791748,
|
|
"epoch": 2.4443162146566646,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00044113204539416776,
|
|
"loss": 5.6012,
|
|
"mean_token_accuracy": 0.2075907915830612,
|
|
"num_tokens": 53678509.0,
|
|
"step": 21180
|
|
},
|
|
{
|
|
"entropy": 6.267242860794068,
|
|
"epoch": 2.4448932487016735,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004411042138515212,
|
|
"loss": 5.7051,
|
|
"mean_token_accuracy": 0.2035290628671646,
|
|
"num_tokens": 53690825.0,
|
|
"step": 21185
|
|
},
|
|
{
|
|
"entropy": 6.222609138488769,
|
|
"epoch": 2.445470282746682,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004410763767220419,
|
|
"loss": 5.6547,
|
|
"mean_token_accuracy": 0.20375724583864213,
|
|
"num_tokens": 53703730.0,
|
|
"step": 21190
|
|
},
|
|
{
|
|
"entropy": 6.290456485748291,
|
|
"epoch": 2.4460473167916907,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004410485340066662,
|
|
"loss": 5.7173,
|
|
"mean_token_accuracy": 0.20021379441022874,
|
|
"num_tokens": 53715467.0,
|
|
"step": 21195
|
|
},
|
|
{
|
|
"entropy": 6.29947681427002,
|
|
"epoch": 2.446624350836699,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004410206857063305,
|
|
"loss": 5.6739,
|
|
"mean_token_accuracy": 0.1997717872262001,
|
|
"num_tokens": 53728559.0,
|
|
"step": 21200
|
|
},
|
|
{
|
|
"entropy": 6.301295328140259,
|
|
"epoch": 2.447201384881708,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004409928318219715,
|
|
"loss": 5.7095,
|
|
"mean_token_accuracy": 0.19815954715013503,
|
|
"num_tokens": 53740862.0,
|
|
"step": 21205
|
|
},
|
|
{
|
|
"entropy": 6.203379106521607,
|
|
"epoch": 2.447778418926717,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004409649723545262,
|
|
"loss": 5.6662,
|
|
"mean_token_accuracy": 0.20121219009160995,
|
|
"num_tokens": 53753026.0,
|
|
"step": 21210
|
|
},
|
|
{
|
|
"entropy": 6.337033319473266,
|
|
"epoch": 2.4483554529717253,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004409371073049313,
|
|
"loss": 5.723,
|
|
"mean_token_accuracy": 0.19286224544048308,
|
|
"num_tokens": 53765318.0,
|
|
"step": 21215
|
|
},
|
|
{
|
|
"entropy": 6.32131028175354,
|
|
"epoch": 2.448932487016734,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004409092366741243,
|
|
"loss": 5.704,
|
|
"mean_token_accuracy": 0.2025526612997055,
|
|
"num_tokens": 53777199.0,
|
|
"step": 21220
|
|
},
|
|
{
|
|
"entropy": 6.197504281997681,
|
|
"epoch": 2.4495095210617426,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004408813604630425,
|
|
"loss": 5.6356,
|
|
"mean_token_accuracy": 0.2067818224430084,
|
|
"num_tokens": 53790229.0,
|
|
"step": 21225
|
|
},
|
|
{
|
|
"entropy": 6.187977647781372,
|
|
"epoch": 2.4500865551067514,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004408534786726236,
|
|
"loss": 5.5821,
|
|
"mean_token_accuracy": 0.2129516839981079,
|
|
"num_tokens": 53803194.0,
|
|
"step": 21230
|
|
},
|
|
{
|
|
"entropy": 6.229814291000366,
|
|
"epoch": 2.45066358915176,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004408255913038053,
|
|
"loss": 5.6338,
|
|
"mean_token_accuracy": 0.20349528044462203,
|
|
"num_tokens": 53815710.0,
|
|
"step": 21235
|
|
},
|
|
{
|
|
"entropy": 6.326226615905762,
|
|
"epoch": 2.4512406231967687,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004407976983575256,
|
|
"loss": 5.771,
|
|
"mean_token_accuracy": 0.20141251534223556,
|
|
"num_tokens": 53829427.0,
|
|
"step": 21240
|
|
},
|
|
{
|
|
"entropy": 6.2482832908630375,
|
|
"epoch": 2.451817657241777,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004407697998347227,
|
|
"loss": 5.6381,
|
|
"mean_token_accuracy": 0.20633713901042938,
|
|
"num_tokens": 53842515.0,
|
|
"step": 21245
|
|
},
|
|
{
|
|
"entropy": 6.303839778900146,
|
|
"epoch": 2.452394691286786,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004407418957363349,
|
|
"loss": 5.7108,
|
|
"mean_token_accuracy": 0.197301509976387,
|
|
"num_tokens": 53855913.0,
|
|
"step": 21250
|
|
},
|
|
{
|
|
"entropy": 6.237850475311279,
|
|
"epoch": 2.4529717253317944,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00044071398606330075,
|
|
"loss": 5.6464,
|
|
"mean_token_accuracy": 0.20977152436971663,
|
|
"num_tokens": 53869354.0,
|
|
"step": 21255
|
|
},
|
|
{
|
|
"entropy": 6.22046389579773,
|
|
"epoch": 2.4535487593768033,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.000440686070816559,
|
|
"loss": 5.6568,
|
|
"mean_token_accuracy": 0.20675353854894638,
|
|
"num_tokens": 53881149.0,
|
|
"step": 21260
|
|
},
|
|
{
|
|
"entropy": 6.239455699920654,
|
|
"epoch": 2.4541257934218117,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004406581499970486,
|
|
"loss": 5.7009,
|
|
"mean_token_accuracy": 0.2066504493355751,
|
|
"num_tokens": 53893930.0,
|
|
"step": 21265
|
|
},
|
|
{
|
|
"entropy": 6.248563194274903,
|
|
"epoch": 2.4547028274668206,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004406302236057086,
|
|
"loss": 5.6105,
|
|
"mean_token_accuracy": 0.2089455634355545,
|
|
"num_tokens": 53905306.0,
|
|
"step": 21270
|
|
},
|
|
{
|
|
"entropy": 6.2968238353729244,
|
|
"epoch": 2.455279861511829,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00044060229164347826,
|
|
"loss": 5.766,
|
|
"mean_token_accuracy": 0.2041410818696022,
|
|
"num_tokens": 53918405.0,
|
|
"step": 21275
|
|
},
|
|
{
|
|
"entropy": 6.232977771759034,
|
|
"epoch": 2.455856895556838,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00044057435411129714,
|
|
"loss": 5.6028,
|
|
"mean_token_accuracy": 0.2104605257511139,
|
|
"num_tokens": 53932931.0,
|
|
"step": 21280
|
|
},
|
|
{
|
|
"entropy": 6.3614284038543705,
|
|
"epoch": 2.4564339296018467,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00044054641101010485,
|
|
"loss": 5.7377,
|
|
"mean_token_accuracy": 0.19399367719888688,
|
|
"num_tokens": 53945438.0,
|
|
"step": 21285
|
|
},
|
|
{
|
|
"entropy": 6.278663492202758,
|
|
"epoch": 2.457010963646855,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00044051846234084127,
|
|
"loss": 5.7098,
|
|
"mean_token_accuracy": 0.1993136301636696,
|
|
"num_tokens": 53958552.0,
|
|
"step": 21290
|
|
},
|
|
{
|
|
"entropy": 6.271420240402222,
|
|
"epoch": 2.457587997691864,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004404905081044464,
|
|
"loss": 5.6425,
|
|
"mean_token_accuracy": 0.2112942561507225,
|
|
"num_tokens": 53970776.0,
|
|
"step": 21295
|
|
},
|
|
{
|
|
"entropy": 6.264316415786743,
|
|
"epoch": 2.4581650317368724,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004404625483018605,
|
|
"loss": 5.8199,
|
|
"mean_token_accuracy": 0.19840810298919678,
|
|
"num_tokens": 53982667.0,
|
|
"step": 21300
|
|
},
|
|
{
|
|
"entropy": 6.283908653259277,
|
|
"epoch": 2.4587420657818813,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000440434582934024,
|
|
"loss": 5.6904,
|
|
"mean_token_accuracy": 0.20617727637290956,
|
|
"num_tokens": 53994603.0,
|
|
"step": 21305
|
|
},
|
|
{
|
|
"entropy": 6.293340635299683,
|
|
"epoch": 2.4593190998268897,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00044040661200187746,
|
|
"loss": 5.6937,
|
|
"mean_token_accuracy": 0.2004096567630768,
|
|
"num_tokens": 54007499.0,
|
|
"step": 21310
|
|
},
|
|
{
|
|
"entropy": 6.275390863418579,
|
|
"epoch": 2.4598961338718985,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00044037863550636173,
|
|
"loss": 5.7046,
|
|
"mean_token_accuracy": 0.20319158285856248,
|
|
"num_tokens": 54019471.0,
|
|
"step": 21315
|
|
},
|
|
{
|
|
"entropy": 6.252910089492798,
|
|
"epoch": 2.460473167916907,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00044035065344841766,
|
|
"loss": 5.6701,
|
|
"mean_token_accuracy": 0.20786895602941513,
|
|
"num_tokens": 54032352.0,
|
|
"step": 21320
|
|
},
|
|
{
|
|
"entropy": 6.218403291702271,
|
|
"epoch": 2.461050201961916,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00044032266582898655,
|
|
"loss": 5.6843,
|
|
"mean_token_accuracy": 0.20879226177930832,
|
|
"num_tokens": 54046284.0,
|
|
"step": 21325
|
|
},
|
|
{
|
|
"entropy": 6.221643924713135,
|
|
"epoch": 2.4616272360069242,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004402946726490097,
|
|
"loss": 5.6287,
|
|
"mean_token_accuracy": 0.20637412667274474,
|
|
"num_tokens": 54058867.0,
|
|
"step": 21330
|
|
},
|
|
{
|
|
"entropy": 6.259546375274658,
|
|
"epoch": 2.462204270051933,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00044026667390942867,
|
|
"loss": 5.6165,
|
|
"mean_token_accuracy": 0.19865330457687377,
|
|
"num_tokens": 54070587.0,
|
|
"step": 21335
|
|
},
|
|
{
|
|
"entropy": 6.210058164596558,
|
|
"epoch": 2.462781304096942,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004402386696111851,
|
|
"loss": 5.5813,
|
|
"mean_token_accuracy": 0.20929396599531175,
|
|
"num_tokens": 54083707.0,
|
|
"step": 21340
|
|
},
|
|
{
|
|
"entropy": 6.24297685623169,
|
|
"epoch": 2.4633583381419504,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00044021065975522096,
|
|
"loss": 5.634,
|
|
"mean_token_accuracy": 0.20413876473903655,
|
|
"num_tokens": 54095166.0,
|
|
"step": 21345
|
|
},
|
|
{
|
|
"entropy": 6.241056060791015,
|
|
"epoch": 2.463935372186959,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004401826443424784,
|
|
"loss": 5.6951,
|
|
"mean_token_accuracy": 0.2041725903749466,
|
|
"num_tokens": 54108329.0,
|
|
"step": 21350
|
|
},
|
|
{
|
|
"entropy": 6.32603964805603,
|
|
"epoch": 2.4645124062319677,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00044015462337389954,
|
|
"loss": 5.7056,
|
|
"mean_token_accuracy": 0.20443324446678163,
|
|
"num_tokens": 54120799.0,
|
|
"step": 21355
|
|
},
|
|
{
|
|
"entropy": 6.294125080108643,
|
|
"epoch": 2.4650894402769765,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00044012659685042704,
|
|
"loss": 5.7189,
|
|
"mean_token_accuracy": 0.19507095217704773,
|
|
"num_tokens": 54133346.0,
|
|
"step": 21360
|
|
},
|
|
{
|
|
"entropy": 6.238120603561401,
|
|
"epoch": 2.465666474321985,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004400985647730034,
|
|
"loss": 5.656,
|
|
"mean_token_accuracy": 0.20855870246887206,
|
|
"num_tokens": 54146633.0,
|
|
"step": 21365
|
|
},
|
|
{
|
|
"entropy": 6.2709743022918705,
|
|
"epoch": 2.466243508366994,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00044007052714257165,
|
|
"loss": 5.6035,
|
|
"mean_token_accuracy": 0.21423779875040055,
|
|
"num_tokens": 54158708.0,
|
|
"step": 21370
|
|
},
|
|
{
|
|
"entropy": 6.165133333206176,
|
|
"epoch": 2.466820542412002,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004400424839600747,
|
|
"loss": 5.6051,
|
|
"mean_token_accuracy": 0.20930253118276596,
|
|
"num_tokens": 54171707.0,
|
|
"step": 21375
|
|
},
|
|
{
|
|
"entropy": 6.268130159378051,
|
|
"epoch": 2.467397576457011,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00044001443522645575,
|
|
"loss": 5.6419,
|
|
"mean_token_accuracy": 0.20065221935510635,
|
|
"num_tokens": 54184778.0,
|
|
"step": 21380
|
|
},
|
|
{
|
|
"entropy": 6.248182010650635,
|
|
"epoch": 2.4679746105020195,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004399863809426582,
|
|
"loss": 5.7037,
|
|
"mean_token_accuracy": 0.20327770411968232,
|
|
"num_tokens": 54197199.0,
|
|
"step": 21385
|
|
},
|
|
{
|
|
"entropy": 6.23556170463562,
|
|
"epoch": 2.4685516445470284,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00043995832110962576,
|
|
"loss": 5.6574,
|
|
"mean_token_accuracy": 0.20107316821813584,
|
|
"num_tokens": 54211277.0,
|
|
"step": 21390
|
|
},
|
|
{
|
|
"entropy": 6.311593770980835,
|
|
"epoch": 2.4691286785920368,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00043993025572830203,
|
|
"loss": 5.6853,
|
|
"mean_token_accuracy": 0.19876616299152375,
|
|
"num_tokens": 54224342.0,
|
|
"step": 21395
|
|
},
|
|
{
|
|
"entropy": 6.282620668411255,
|
|
"epoch": 2.4697057126370456,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00043990218479963115,
|
|
"loss": 5.6545,
|
|
"mean_token_accuracy": 0.20636463463306426,
|
|
"num_tokens": 54236115.0,
|
|
"step": 21400
|
|
},
|
|
{
|
|
"entropy": 6.19582896232605,
|
|
"epoch": 2.470282746682054,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00043987410832455715,
|
|
"loss": 5.5492,
|
|
"mean_token_accuracy": 0.21263561248779297,
|
|
"num_tokens": 54248665.0,
|
|
"step": 21405
|
|
},
|
|
{
|
|
"entropy": 6.241684436798096,
|
|
"epoch": 2.470859780727063,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00043984602630402447,
|
|
"loss": 5.6487,
|
|
"mean_token_accuracy": 0.20438491851091384,
|
|
"num_tokens": 54260280.0,
|
|
"step": 21410
|
|
},
|
|
{
|
|
"entropy": 6.288365221023559,
|
|
"epoch": 2.4714368147720718,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00043981793873897756,
|
|
"loss": 5.6513,
|
|
"mean_token_accuracy": 0.20701223611831665,
|
|
"num_tokens": 54271057.0,
|
|
"step": 21415
|
|
},
|
|
{
|
|
"entropy": 6.173783445358277,
|
|
"epoch": 2.47201384881708,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004397898456303612,
|
|
"loss": 5.5435,
|
|
"mean_token_accuracy": 0.20986566841602325,
|
|
"num_tokens": 54284568.0,
|
|
"step": 21420
|
|
},
|
|
{
|
|
"entropy": 6.103800201416016,
|
|
"epoch": 2.472590882862089,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00043976174697912015,
|
|
"loss": 5.5207,
|
|
"mean_token_accuracy": 0.21506765633821487,
|
|
"num_tokens": 54297722.0,
|
|
"step": 21425
|
|
},
|
|
{
|
|
"entropy": 6.244740390777588,
|
|
"epoch": 2.4731679169070975,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0004397336427861996,
|
|
"loss": 5.6819,
|
|
"mean_token_accuracy": 0.2026373028755188,
|
|
"num_tokens": 54310992.0,
|
|
"step": 21430
|
|
},
|
|
{
|
|
"entropy": 6.342148685455323,
|
|
"epoch": 2.4737449509521063,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004397055330525448,
|
|
"loss": 5.7462,
|
|
"mean_token_accuracy": 0.20157698839902877,
|
|
"num_tokens": 54323540.0,
|
|
"step": 21435
|
|
},
|
|
{
|
|
"entropy": 6.247800493240357,
|
|
"epoch": 2.4743219849971148,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004396774177791012,
|
|
"loss": 5.676,
|
|
"mean_token_accuracy": 0.19401325434446334,
|
|
"num_tokens": 54335522.0,
|
|
"step": 21440
|
|
},
|
|
{
|
|
"entropy": 6.293228483200073,
|
|
"epoch": 2.4748990190421236,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00043964929696681444,
|
|
"loss": 5.6632,
|
|
"mean_token_accuracy": 0.20479120314121246,
|
|
"num_tokens": 54347216.0,
|
|
"step": 21445
|
|
},
|
|
{
|
|
"entropy": 6.268267822265625,
|
|
"epoch": 2.475476053087132,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004396211706166305,
|
|
"loss": 5.6559,
|
|
"mean_token_accuracy": 0.20086243599653245,
|
|
"num_tokens": 54360261.0,
|
|
"step": 21450
|
|
},
|
|
{
|
|
"entropy": 6.210558652877808,
|
|
"epoch": 2.476053087132141,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004395930387294951,
|
|
"loss": 5.6239,
|
|
"mean_token_accuracy": 0.20676281154155732,
|
|
"num_tokens": 54373279.0,
|
|
"step": 21455
|
|
},
|
|
{
|
|
"entropy": 6.266401481628418,
|
|
"epoch": 2.4766301211771493,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004395649013063546,
|
|
"loss": 5.655,
|
|
"mean_token_accuracy": 0.20939665138721467,
|
|
"num_tokens": 54386266.0,
|
|
"step": 21460
|
|
},
|
|
{
|
|
"entropy": 6.2839456558227536,
|
|
"epoch": 2.477207155222158,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004395367583481554,
|
|
"loss": 5.6755,
|
|
"mean_token_accuracy": 0.2034483477473259,
|
|
"num_tokens": 54398839.0,
|
|
"step": 21465
|
|
},
|
|
{
|
|
"entropy": 6.203616285324097,
|
|
"epoch": 2.4777841892671666,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00043950860985584423,
|
|
"loss": 5.5436,
|
|
"mean_token_accuracy": 0.20790673643350602,
|
|
"num_tokens": 54409879.0,
|
|
"step": 21470
|
|
},
|
|
{
|
|
"entropy": 6.144044399261475,
|
|
"epoch": 2.4783612233121755,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004394804558303675,
|
|
"loss": 5.6325,
|
|
"mean_token_accuracy": 0.19502133280038833,
|
|
"num_tokens": 54421641.0,
|
|
"step": 21475
|
|
},
|
|
{
|
|
"entropy": 6.348276662826538,
|
|
"epoch": 2.478938257357184,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004394522962726724,
|
|
"loss": 5.7115,
|
|
"mean_token_accuracy": 0.19986581355333327,
|
|
"num_tokens": 54434169.0,
|
|
"step": 21480
|
|
},
|
|
{
|
|
"entropy": 6.310571575164795,
|
|
"epoch": 2.4795152914021927,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00043942413118370604,
|
|
"loss": 5.6587,
|
|
"mean_token_accuracy": 0.20168741345405578,
|
|
"num_tokens": 54447814.0,
|
|
"step": 21485
|
|
},
|
|
{
|
|
"entropy": 6.220139122009277,
|
|
"epoch": 2.4800923254472016,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004393959605644157,
|
|
"loss": 5.7196,
|
|
"mean_token_accuracy": 0.20173066705465317,
|
|
"num_tokens": 54460589.0,
|
|
"step": 21490
|
|
},
|
|
{
|
|
"entropy": 6.287173557281494,
|
|
"epoch": 2.48066935949221,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004393677844157488,
|
|
"loss": 5.6398,
|
|
"mean_token_accuracy": 0.20987317860126495,
|
|
"num_tokens": 54473328.0,
|
|
"step": 21495
|
|
},
|
|
{
|
|
"entropy": 6.273700904846192,
|
|
"epoch": 2.481246393537219,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004393396027386532,
|
|
"loss": 5.7089,
|
|
"mean_token_accuracy": 0.20238712877035142,
|
|
"num_tokens": 54486763.0,
|
|
"step": 21500
|
|
},
|
|
{
|
|
"entropy": 6.198573303222656,
|
|
"epoch": 2.4818234275822273,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00043931141553407667,
|
|
"loss": 5.6154,
|
|
"mean_token_accuracy": 0.2096557453274727,
|
|
"num_tokens": 54499081.0,
|
|
"step": 21505
|
|
},
|
|
{
|
|
"entropy": 6.21187744140625,
|
|
"epoch": 2.482400461627236,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004392832228029672,
|
|
"loss": 5.6042,
|
|
"mean_token_accuracy": 0.20737080723047258,
|
|
"num_tokens": 54511776.0,
|
|
"step": 21510
|
|
},
|
|
{
|
|
"entropy": 6.20880446434021,
|
|
"epoch": 2.4829774956722446,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00043925502454627327,
|
|
"loss": 5.6387,
|
|
"mean_token_accuracy": 0.2091591477394104,
|
|
"num_tokens": 54524784.0,
|
|
"step": 21515
|
|
},
|
|
{
|
|
"entropy": 6.267707586288452,
|
|
"epoch": 2.4835545297172534,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004392268207649431,
|
|
"loss": 5.6897,
|
|
"mean_token_accuracy": 0.20304359644651412,
|
|
"num_tokens": 54537028.0,
|
|
"step": 21520
|
|
},
|
|
{
|
|
"entropy": 6.349531173706055,
|
|
"epoch": 2.484131563762262,
|
|
"grad_norm": 3.28125,
|
|
"learning_rate": 0.00043919861145992546,
|
|
"loss": 5.8255,
|
|
"mean_token_accuracy": 0.19426349252462388,
|
|
"num_tokens": 54550889.0,
|
|
"step": 21525
|
|
},
|
|
{
|
|
"entropy": 6.262312555313111,
|
|
"epoch": 2.4847085978072707,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000439170396632169,
|
|
"loss": 5.7531,
|
|
"mean_token_accuracy": 0.19775451868772506,
|
|
"num_tokens": 54565218.0,
|
|
"step": 21530
|
|
},
|
|
{
|
|
"entropy": 6.275810718536377,
|
|
"epoch": 2.485285631852279,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004391421762826229,
|
|
"loss": 5.6717,
|
|
"mean_token_accuracy": 0.20421192646026612,
|
|
"num_tokens": 54577622.0,
|
|
"step": 21535
|
|
},
|
|
{
|
|
"entropy": 6.255017280578613,
|
|
"epoch": 2.485862665897288,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004391139504122362,
|
|
"loss": 5.6674,
|
|
"mean_token_accuracy": 0.2107362762093544,
|
|
"num_tokens": 54590213.0,
|
|
"step": 21540
|
|
},
|
|
{
|
|
"entropy": 6.198934412002563,
|
|
"epoch": 2.4864396999422964,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00043908571902195827,
|
|
"loss": 5.6707,
|
|
"mean_token_accuracy": 0.20420194268226624,
|
|
"num_tokens": 54603615.0,
|
|
"step": 21545
|
|
},
|
|
{
|
|
"entropy": 6.271377468109131,
|
|
"epoch": 2.4870167339873053,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00043905748211273864,
|
|
"loss": 5.6319,
|
|
"mean_token_accuracy": 0.20598290711641312,
|
|
"num_tokens": 54615924.0,
|
|
"step": 21550
|
|
},
|
|
{
|
|
"entropy": 6.283806180953979,
|
|
"epoch": 2.4875937680323137,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00043902923968552714,
|
|
"loss": 5.6355,
|
|
"mean_token_accuracy": 0.20139225870370864,
|
|
"num_tokens": 54629184.0,
|
|
"step": 21555
|
|
},
|
|
{
|
|
"entropy": 6.251756906509399,
|
|
"epoch": 2.4881708020773226,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004390009917412737,
|
|
"loss": 5.7187,
|
|
"mean_token_accuracy": 0.20357324182987213,
|
|
"num_tokens": 54642669.0,
|
|
"step": 21560
|
|
},
|
|
{
|
|
"entropy": 6.2144698143005375,
|
|
"epoch": 2.4887478361223314,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00043897273828092824,
|
|
"loss": 5.6449,
|
|
"mean_token_accuracy": 0.20835326462984086,
|
|
"num_tokens": 54655229.0,
|
|
"step": 21565
|
|
},
|
|
{
|
|
"entropy": 6.266665077209472,
|
|
"epoch": 2.48932487016734,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004389444793054413,
|
|
"loss": 5.7187,
|
|
"mean_token_accuracy": 0.20160499662160875,
|
|
"num_tokens": 54667516.0,
|
|
"step": 21570
|
|
},
|
|
{
|
|
"entropy": 6.256263494491577,
|
|
"epoch": 2.4899019042123487,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00043891621481576324,
|
|
"loss": 5.604,
|
|
"mean_token_accuracy": 0.20716971307992935,
|
|
"num_tokens": 54679832.0,
|
|
"step": 21575
|
|
},
|
|
{
|
|
"entropy": 6.15153546333313,
|
|
"epoch": 2.490478938257357,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004388879448128446,
|
|
"loss": 5.4434,
|
|
"mean_token_accuracy": 0.22404341250658036,
|
|
"num_tokens": 54693943.0,
|
|
"step": 21580
|
|
},
|
|
{
|
|
"entropy": 6.214800024032593,
|
|
"epoch": 2.491055972302366,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00043885966929763635,
|
|
"loss": 5.6085,
|
|
"mean_token_accuracy": 0.2090763807296753,
|
|
"num_tokens": 54706404.0,
|
|
"step": 21585
|
|
},
|
|
{
|
|
"entropy": 6.24335823059082,
|
|
"epoch": 2.4916330063473744,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00043883138827108964,
|
|
"loss": 5.6839,
|
|
"mean_token_accuracy": 0.20451874285936356,
|
|
"num_tokens": 54718323.0,
|
|
"step": 21590
|
|
},
|
|
{
|
|
"entropy": 6.280545473098755,
|
|
"epoch": 2.4922100403923833,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004388031017341555,
|
|
"loss": 5.7459,
|
|
"mean_token_accuracy": 0.1975752130150795,
|
|
"num_tokens": 54730128.0,
|
|
"step": 21595
|
|
},
|
|
{
|
|
"entropy": 6.210818719863892,
|
|
"epoch": 2.4927870744373917,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00043877480968778536,
|
|
"loss": 5.6288,
|
|
"mean_token_accuracy": 0.21254943758249284,
|
|
"num_tokens": 54743437.0,
|
|
"step": 21600
|
|
},
|
|
{
|
|
"entropy": 6.246246719360352,
|
|
"epoch": 2.4933641084824005,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004387465121329309,
|
|
"loss": 5.6872,
|
|
"mean_token_accuracy": 0.2016007959842682,
|
|
"num_tokens": 54755573.0,
|
|
"step": 21605
|
|
},
|
|
{
|
|
"entropy": 6.30978045463562,
|
|
"epoch": 2.493941142527409,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00043871820907054375,
|
|
"loss": 5.7158,
|
|
"mean_token_accuracy": 0.1985887572169304,
|
|
"num_tokens": 54768071.0,
|
|
"step": 21610
|
|
},
|
|
{
|
|
"entropy": 6.356828069686889,
|
|
"epoch": 2.494518176572418,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00043868990050157617,
|
|
"loss": 5.6958,
|
|
"mean_token_accuracy": 0.19723668396472932,
|
|
"num_tokens": 54782245.0,
|
|
"step": 21615
|
|
},
|
|
{
|
|
"entropy": 6.221127367019653,
|
|
"epoch": 2.4950952106174267,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004386615864269799,
|
|
"loss": 5.59,
|
|
"mean_token_accuracy": 0.2138514205813408,
|
|
"num_tokens": 54794335.0,
|
|
"step": 21620
|
|
},
|
|
{
|
|
"entropy": 6.173128604888916,
|
|
"epoch": 2.495672244662435,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00043863326684770746,
|
|
"loss": 5.6865,
|
|
"mean_token_accuracy": 0.19914306104183196,
|
|
"num_tokens": 54807015.0,
|
|
"step": 21625
|
|
},
|
|
{
|
|
"entropy": 6.269874620437622,
|
|
"epoch": 2.4962492787074435,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004386049417647115,
|
|
"loss": 5.6012,
|
|
"mean_token_accuracy": 0.19981160759925842,
|
|
"num_tokens": 54821278.0,
|
|
"step": 21630
|
|
},
|
|
{
|
|
"entropy": 6.30454535484314,
|
|
"epoch": 2.4968263127524524,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004385766111789445,
|
|
"loss": 5.718,
|
|
"mean_token_accuracy": 0.20572731792926788,
|
|
"num_tokens": 54834905.0,
|
|
"step": 21635
|
|
},
|
|
{
|
|
"entropy": 6.178166723251342,
|
|
"epoch": 2.4974033467974612,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004385482750913595,
|
|
"loss": 5.639,
|
|
"mean_token_accuracy": 0.20674082785844802,
|
|
"num_tokens": 54847597.0,
|
|
"step": 21640
|
|
},
|
|
{
|
|
"entropy": 6.216948652267456,
|
|
"epoch": 2.4979803808424696,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004385199335029094,
|
|
"loss": 5.5596,
|
|
"mean_token_accuracy": 0.2129942297935486,
|
|
"num_tokens": 54859747.0,
|
|
"step": 21645
|
|
},
|
|
{
|
|
"entropy": 6.232190179824829,
|
|
"epoch": 2.4985574148874785,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00043849158641454767,
|
|
"loss": 5.6783,
|
|
"mean_token_accuracy": 0.2044348508119583,
|
|
"num_tokens": 54873025.0,
|
|
"step": 21650
|
|
},
|
|
{
|
|
"entropy": 6.259733438491821,
|
|
"epoch": 2.499134448932487,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00043846323382722765,
|
|
"loss": 5.6256,
|
|
"mean_token_accuracy": 0.20907966494560243,
|
|
"num_tokens": 54884718.0,
|
|
"step": 21655
|
|
},
|
|
{
|
|
"entropy": 6.214492225646973,
|
|
"epoch": 2.499711482977496,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00043843487574190285,
|
|
"loss": 5.5752,
|
|
"mean_token_accuracy": 0.20774000585079194,
|
|
"num_tokens": 54896557.0,
|
|
"step": 21660
|
|
},
|
|
{
|
|
"entropy": 6.324304914474487,
|
|
"epoch": 2.500288517022504,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00043840651215952726,
|
|
"loss": 5.7751,
|
|
"mean_token_accuracy": 0.19258875250816346,
|
|
"num_tokens": 54909608.0,
|
|
"step": 21665
|
|
},
|
|
{
|
|
"entropy": 6.266649770736694,
|
|
"epoch": 2.500865551067513,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00043837814308105477,
|
|
"loss": 5.6315,
|
|
"mean_token_accuracy": 0.20246251821517944,
|
|
"num_tokens": 54921794.0,
|
|
"step": 21670
|
|
},
|
|
{
|
|
"entropy": 6.2931750297546385,
|
|
"epoch": 2.5014425851125215,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00043834976850743964,
|
|
"loss": 5.7481,
|
|
"mean_token_accuracy": 0.1991678699851036,
|
|
"num_tokens": 54934527.0,
|
|
"step": 21675
|
|
},
|
|
{
|
|
"entropy": 6.220940685272216,
|
|
"epoch": 2.5020196191575304,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004383213884396361,
|
|
"loss": 5.6211,
|
|
"mean_token_accuracy": 0.21188863217830659,
|
|
"num_tokens": 54947074.0,
|
|
"step": 21680
|
|
},
|
|
{
|
|
"entropy": 6.255278253555298,
|
|
"epoch": 2.5025966532025388,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004382930028785989,
|
|
"loss": 5.6925,
|
|
"mean_token_accuracy": 0.200669726729393,
|
|
"num_tokens": 54958677.0,
|
|
"step": 21685
|
|
},
|
|
{
|
|
"entropy": 6.225498390197754,
|
|
"epoch": 2.5031736872475476,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004382646118252826,
|
|
"loss": 5.6129,
|
|
"mean_token_accuracy": 0.21261499375104903,
|
|
"num_tokens": 54972067.0,
|
|
"step": 21690
|
|
},
|
|
{
|
|
"entropy": 6.2196948528289795,
|
|
"epoch": 2.5037507212925565,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00043823621528064216,
|
|
"loss": 5.6831,
|
|
"mean_token_accuracy": 0.20225461721420288,
|
|
"num_tokens": 54985010.0,
|
|
"step": 21695
|
|
},
|
|
{
|
|
"entropy": 6.319216060638428,
|
|
"epoch": 2.504327755337565,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00043820781324563276,
|
|
"loss": 5.7134,
|
|
"mean_token_accuracy": 0.2030886098742485,
|
|
"num_tokens": 54998731.0,
|
|
"step": 21700
|
|
},
|
|
{
|
|
"entropy": 6.222128963470459,
|
|
"epoch": 2.5049047893825733,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00043817940572120963,
|
|
"loss": 5.578,
|
|
"mean_token_accuracy": 0.20969972908496856,
|
|
"num_tokens": 55011288.0,
|
|
"step": 21705
|
|
},
|
|
{
|
|
"entropy": 6.185530328750611,
|
|
"epoch": 2.505481823427582,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00043815099270832814,
|
|
"loss": 5.6708,
|
|
"mean_token_accuracy": 0.20557806491851807,
|
|
"num_tokens": 55023718.0,
|
|
"step": 21710
|
|
},
|
|
{
|
|
"entropy": 6.189114046096802,
|
|
"epoch": 2.506058857472591,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00043812257420794415,
|
|
"loss": 5.6052,
|
|
"mean_token_accuracy": 0.20728044211864471,
|
|
"num_tokens": 55036628.0,
|
|
"step": 21715
|
|
},
|
|
{
|
|
"entropy": 6.283075141906738,
|
|
"epoch": 2.5066358915175995,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00043809415022101335,
|
|
"loss": 5.7177,
|
|
"mean_token_accuracy": 0.19747090339660645,
|
|
"num_tokens": 55049765.0,
|
|
"step": 21720
|
|
},
|
|
{
|
|
"entropy": 6.187809133529663,
|
|
"epoch": 2.5072129255626083,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004380657207484919,
|
|
"loss": 5.6208,
|
|
"mean_token_accuracy": 0.20721892565488814,
|
|
"num_tokens": 55061852.0,
|
|
"step": 21725
|
|
},
|
|
{
|
|
"entropy": 6.2997811794281,
|
|
"epoch": 2.5077899596076167,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00043803728579133586,
|
|
"loss": 5.8328,
|
|
"mean_token_accuracy": 0.19276068806648256,
|
|
"num_tokens": 55074560.0,
|
|
"step": 21730
|
|
},
|
|
{
|
|
"entropy": 6.263022184371948,
|
|
"epoch": 2.5083669936526256,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004380088453505017,
|
|
"loss": 5.6204,
|
|
"mean_token_accuracy": 0.20828365981578828,
|
|
"num_tokens": 55086886.0,
|
|
"step": 21735
|
|
},
|
|
{
|
|
"entropy": 6.230650949478149,
|
|
"epoch": 2.508944027697634,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00043798039942694603,
|
|
"loss": 5.6362,
|
|
"mean_token_accuracy": 0.20490192621946335,
|
|
"num_tokens": 55100503.0,
|
|
"step": 21740
|
|
},
|
|
{
|
|
"entropy": 6.236802244186402,
|
|
"epoch": 2.509521061742643,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00043795194802162557,
|
|
"loss": 5.5986,
|
|
"mean_token_accuracy": 0.2043326035141945,
|
|
"num_tokens": 55113212.0,
|
|
"step": 21745
|
|
},
|
|
{
|
|
"entropy": 6.345450305938721,
|
|
"epoch": 2.5100980957876513,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004379234911354973,
|
|
"loss": 5.8065,
|
|
"mean_token_accuracy": 0.19290619790554048,
|
|
"num_tokens": 55127391.0,
|
|
"step": 21750
|
|
},
|
|
{
|
|
"entropy": 6.275871086120605,
|
|
"epoch": 2.51067512983266,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00043789502876951834,
|
|
"loss": 5.6751,
|
|
"mean_token_accuracy": 0.20199310332536696,
|
|
"num_tokens": 55139990.0,
|
|
"step": 21755
|
|
},
|
|
{
|
|
"entropy": 6.179691314697266,
|
|
"epoch": 2.5112521638776686,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004378665609246459,
|
|
"loss": 5.5643,
|
|
"mean_token_accuracy": 0.20908699184656143,
|
|
"num_tokens": 55152472.0,
|
|
"step": 21760
|
|
},
|
|
{
|
|
"entropy": 6.307994270324707,
|
|
"epoch": 2.5118291979226774,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00043783808760183764,
|
|
"loss": 5.6479,
|
|
"mean_token_accuracy": 0.20827796757221223,
|
|
"num_tokens": 55166342.0,
|
|
"step": 21765
|
|
},
|
|
{
|
|
"entropy": 6.3008218765258786,
|
|
"epoch": 2.5124062319676863,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00043780960880205125,
|
|
"loss": 5.6837,
|
|
"mean_token_accuracy": 0.20346897542476655,
|
|
"num_tokens": 55177925.0,
|
|
"step": 21770
|
|
},
|
|
{
|
|
"entropy": 6.254274559020996,
|
|
"epoch": 2.5129832660126947,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00043778112452624445,
|
|
"loss": 5.6753,
|
|
"mean_token_accuracy": 0.20544296503067017,
|
|
"num_tokens": 55189179.0,
|
|
"step": 21775
|
|
},
|
|
{
|
|
"entropy": 6.2946208953857425,
|
|
"epoch": 2.513560300057703,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00043775263477537546,
|
|
"loss": 5.7016,
|
|
"mean_token_accuracy": 0.20156548619270326,
|
|
"num_tokens": 55202244.0,
|
|
"step": 21780
|
|
},
|
|
{
|
|
"entropy": 6.274223327636719,
|
|
"epoch": 2.514137334102712,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004377241395504024,
|
|
"loss": 5.6769,
|
|
"mean_token_accuracy": 0.19610415995121003,
|
|
"num_tokens": 55214545.0,
|
|
"step": 21785
|
|
},
|
|
{
|
|
"entropy": 6.219307136535645,
|
|
"epoch": 2.514714368147721,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004376956388522837,
|
|
"loss": 5.5756,
|
|
"mean_token_accuracy": 0.20902545005083084,
|
|
"num_tokens": 55227766.0,
|
|
"step": 21790
|
|
},
|
|
{
|
|
"entropy": 6.286997318267822,
|
|
"epoch": 2.5152914021927293,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004376671326819781,
|
|
"loss": 5.7425,
|
|
"mean_token_accuracy": 0.20105674713850022,
|
|
"num_tokens": 55239841.0,
|
|
"step": 21795
|
|
},
|
|
{
|
|
"entropy": 6.1693737506866455,
|
|
"epoch": 2.515868436237738,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00043763862104044424,
|
|
"loss": 5.5362,
|
|
"mean_token_accuracy": 0.2162746459245682,
|
|
"num_tokens": 55253440.0,
|
|
"step": 21800
|
|
},
|
|
{
|
|
"entropy": 6.296313810348511,
|
|
"epoch": 2.5164454702827466,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00043761010392864114,
|
|
"loss": 5.6761,
|
|
"mean_token_accuracy": 0.2012680545449257,
|
|
"num_tokens": 55264698.0,
|
|
"step": 21805
|
|
},
|
|
{
|
|
"entropy": 6.271151304244995,
|
|
"epoch": 2.5170225043277554,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00043758158134752793,
|
|
"loss": 5.6467,
|
|
"mean_token_accuracy": 0.2005464479327202,
|
|
"num_tokens": 55276923.0,
|
|
"step": 21810
|
|
},
|
|
{
|
|
"entropy": 6.255463409423828,
|
|
"epoch": 2.517599538372764,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004375530532980642,
|
|
"loss": 5.7302,
|
|
"mean_token_accuracy": 0.1985969439148903,
|
|
"num_tokens": 55289774.0,
|
|
"step": 21815
|
|
},
|
|
{
|
|
"entropy": 6.2912153720855715,
|
|
"epoch": 2.5181765724177727,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.000437524519781209,
|
|
"loss": 5.7077,
|
|
"mean_token_accuracy": 0.20262335389852523,
|
|
"num_tokens": 55301877.0,
|
|
"step": 21820
|
|
},
|
|
{
|
|
"entropy": 6.237303686141968,
|
|
"epoch": 2.5187536064627816,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004374959807979224,
|
|
"loss": 5.6419,
|
|
"mean_token_accuracy": 0.2098629280924797,
|
|
"num_tokens": 55314680.0,
|
|
"step": 21825
|
|
},
|
|
{
|
|
"entropy": 6.290822076797485,
|
|
"epoch": 2.51933064050779,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004374674363491642,
|
|
"loss": 5.7023,
|
|
"mean_token_accuracy": 0.1993727758526802,
|
|
"num_tokens": 55326874.0,
|
|
"step": 21830
|
|
},
|
|
{
|
|
"entropy": 6.204987907409668,
|
|
"epoch": 2.5199076745527984,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00043743888643589453,
|
|
"loss": 5.6069,
|
|
"mean_token_accuracy": 0.216358046233654,
|
|
"num_tokens": 55339281.0,
|
|
"step": 21835
|
|
},
|
|
{
|
|
"entropy": 6.270220756530762,
|
|
"epoch": 2.5204847085978073,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00043741033105907355,
|
|
"loss": 5.6715,
|
|
"mean_token_accuracy": 0.20801110714673995,
|
|
"num_tokens": 55351187.0,
|
|
"step": 21840
|
|
},
|
|
{
|
|
"entropy": 6.280450439453125,
|
|
"epoch": 2.521061742642816,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004373817702196618,
|
|
"loss": 5.6109,
|
|
"mean_token_accuracy": 0.21126186698675156,
|
|
"num_tokens": 55365122.0,
|
|
"step": 21845
|
|
},
|
|
{
|
|
"entropy": 6.200860071182251,
|
|
"epoch": 2.5216387766878245,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00043735320391861986,
|
|
"loss": 5.6885,
|
|
"mean_token_accuracy": 0.1996615156531334,
|
|
"num_tokens": 55376494.0,
|
|
"step": 21850
|
|
},
|
|
{
|
|
"entropy": 6.321745252609253,
|
|
"epoch": 2.522215810732833,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004373246321569085,
|
|
"loss": 5.7292,
|
|
"mean_token_accuracy": 0.19809221029281615,
|
|
"num_tokens": 55388037.0,
|
|
"step": 21855
|
|
},
|
|
{
|
|
"entropy": 6.215386056900025,
|
|
"epoch": 2.522792844777842,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004372960549354888,
|
|
"loss": 5.6028,
|
|
"mean_token_accuracy": 0.2100651130080223,
|
|
"num_tokens": 55401356.0,
|
|
"step": 21860
|
|
},
|
|
{
|
|
"entropy": 6.036681222915649,
|
|
"epoch": 2.5233698788228507,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00043726747225532195,
|
|
"loss": 5.4782,
|
|
"mean_token_accuracy": 0.21606544107198716,
|
|
"num_tokens": 55414332.0,
|
|
"step": 21865
|
|
},
|
|
{
|
|
"entropy": 6.244798469543457,
|
|
"epoch": 2.523946912867859,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004372388841173692,
|
|
"loss": 5.6783,
|
|
"mean_token_accuracy": 0.20633822977542876,
|
|
"num_tokens": 55426886.0,
|
|
"step": 21870
|
|
},
|
|
{
|
|
"entropy": 6.310350322723389,
|
|
"epoch": 2.524523946912868,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004372102905225922,
|
|
"loss": 5.6655,
|
|
"mean_token_accuracy": 0.20246700048446656,
|
|
"num_tokens": 55439688.0,
|
|
"step": 21875
|
|
},
|
|
{
|
|
"entropy": 6.225999355316162,
|
|
"epoch": 2.5251009809578764,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00043718169147195275,
|
|
"loss": 5.6463,
|
|
"mean_token_accuracy": 0.20482247471809387,
|
|
"num_tokens": 55451597.0,
|
|
"step": 21880
|
|
},
|
|
{
|
|
"entropy": 6.198139810562134,
|
|
"epoch": 2.5256780150028852,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00043715308696641255,
|
|
"loss": 5.6717,
|
|
"mean_token_accuracy": 0.19832488298416137,
|
|
"num_tokens": 55463627.0,
|
|
"step": 21885
|
|
},
|
|
{
|
|
"entropy": 6.3617720127105715,
|
|
"epoch": 2.5262550490478937,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004371244770069338,
|
|
"loss": 5.7348,
|
|
"mean_token_accuracy": 0.1924797773361206,
|
|
"num_tokens": 55477071.0,
|
|
"step": 21890
|
|
},
|
|
{
|
|
"entropy": 6.242027854919433,
|
|
"epoch": 2.5268320830929025,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00043709586159447884,
|
|
"loss": 5.6197,
|
|
"mean_token_accuracy": 0.20154710710048676,
|
|
"num_tokens": 55489338.0,
|
|
"step": 21895
|
|
},
|
|
{
|
|
"entropy": 6.254389476776123,
|
|
"epoch": 2.5274091171379114,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00043706724073001017,
|
|
"loss": 5.6602,
|
|
"mean_token_accuracy": 0.20467365980148317,
|
|
"num_tokens": 55503770.0,
|
|
"step": 21900
|
|
},
|
|
{
|
|
"entropy": 6.238600206375122,
|
|
"epoch": 2.52798615118292,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004370386144144902,
|
|
"loss": 5.6742,
|
|
"mean_token_accuracy": 0.19940884560346603,
|
|
"num_tokens": 55516832.0,
|
|
"step": 21905
|
|
},
|
|
{
|
|
"entropy": 6.331838369369507,
|
|
"epoch": 2.5285631852279282,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004370099826488821,
|
|
"loss": 5.7105,
|
|
"mean_token_accuracy": 0.19989215433597565,
|
|
"num_tokens": 55530280.0,
|
|
"step": 21910
|
|
},
|
|
{
|
|
"entropy": 6.152864646911621,
|
|
"epoch": 2.529140219272937,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004369813454341486,
|
|
"loss": 5.6147,
|
|
"mean_token_accuracy": 0.20575493723154067,
|
|
"num_tokens": 55542688.0,
|
|
"step": 21915
|
|
},
|
|
{
|
|
"entropy": 6.173724412918091,
|
|
"epoch": 2.529717253317946,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00043695270277125303,
|
|
"loss": 5.5892,
|
|
"mean_token_accuracy": 0.21401990056037903,
|
|
"num_tokens": 55555921.0,
|
|
"step": 21920
|
|
},
|
|
{
|
|
"entropy": 6.242677402496338,
|
|
"epoch": 2.5302942873629544,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004369240546611587,
|
|
"loss": 5.6478,
|
|
"mean_token_accuracy": 0.2048686310648918,
|
|
"num_tokens": 55569667.0,
|
|
"step": 21925
|
|
},
|
|
{
|
|
"entropy": 6.283534240722656,
|
|
"epoch": 2.5308713214079632,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00043689540110482933,
|
|
"loss": 5.7008,
|
|
"mean_token_accuracy": 0.20173778980970383,
|
|
"num_tokens": 55582170.0,
|
|
"step": 21930
|
|
},
|
|
{
|
|
"entropy": 6.283069610595703,
|
|
"epoch": 2.5314483554529716,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004368667421032285,
|
|
"loss": 5.7133,
|
|
"mean_token_accuracy": 0.20289769768714905,
|
|
"num_tokens": 55595170.0,
|
|
"step": 21935
|
|
},
|
|
{
|
|
"entropy": 6.278153276443481,
|
|
"epoch": 2.5320253894979805,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00043683807765732013,
|
|
"loss": 5.6695,
|
|
"mean_token_accuracy": 0.2047768324613571,
|
|
"num_tokens": 55606794.0,
|
|
"step": 21940
|
|
},
|
|
{
|
|
"entropy": 6.257738065719605,
|
|
"epoch": 2.532602423542989,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00043680940776806847,
|
|
"loss": 5.6518,
|
|
"mean_token_accuracy": 0.2036538690328598,
|
|
"num_tokens": 55619423.0,
|
|
"step": 21945
|
|
},
|
|
{
|
|
"entropy": 6.2475591659545895,
|
|
"epoch": 2.533179457587998,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004367807324364378,
|
|
"loss": 5.6697,
|
|
"mean_token_accuracy": 0.2001153528690338,
|
|
"num_tokens": 55630934.0,
|
|
"step": 21950
|
|
},
|
|
{
|
|
"entropy": 6.267770147323608,
|
|
"epoch": 2.533756491633006,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00043675205166339247,
|
|
"loss": 5.7134,
|
|
"mean_token_accuracy": 0.1972763642668724,
|
|
"num_tokens": 55643781.0,
|
|
"step": 21955
|
|
},
|
|
{
|
|
"entropy": 6.320543956756592,
|
|
"epoch": 2.534333525678015,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004367233654498973,
|
|
"loss": 5.8011,
|
|
"mean_token_accuracy": 0.19383646547794342,
|
|
"num_tokens": 55655564.0,
|
|
"step": 21960
|
|
},
|
|
{
|
|
"entropy": 6.28122034072876,
|
|
"epoch": 2.5349105597230235,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004366946737969171,
|
|
"loss": 5.7218,
|
|
"mean_token_accuracy": 0.20238550156354904,
|
|
"num_tokens": 55667408.0,
|
|
"step": 21965
|
|
},
|
|
{
|
|
"entropy": 6.2371869564056395,
|
|
"epoch": 2.5354875937680323,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004366659767054168,
|
|
"loss": 5.5596,
|
|
"mean_token_accuracy": 0.20951034128665924,
|
|
"num_tokens": 55680876.0,
|
|
"step": 21970
|
|
},
|
|
{
|
|
"entropy": 6.239698314666748,
|
|
"epoch": 2.536064627813041,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00043663727417636166,
|
|
"loss": 5.6025,
|
|
"mean_token_accuracy": 0.2063738688826561,
|
|
"num_tokens": 55694639.0,
|
|
"step": 21975
|
|
},
|
|
{
|
|
"entropy": 6.179608869552612,
|
|
"epoch": 2.5366416618580496,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004366085662107171,
|
|
"loss": 5.6228,
|
|
"mean_token_accuracy": 0.20993367284536363,
|
|
"num_tokens": 55707221.0,
|
|
"step": 21980
|
|
},
|
|
{
|
|
"entropy": 6.304040718078613,
|
|
"epoch": 2.537218695903058,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00043657985280944875,
|
|
"loss": 5.6145,
|
|
"mean_token_accuracy": 0.2112744152545929,
|
|
"num_tokens": 55720750.0,
|
|
"step": 21985
|
|
},
|
|
{
|
|
"entropy": 6.270797348022461,
|
|
"epoch": 2.537795729948067,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004365511339735223,
|
|
"loss": 5.6923,
|
|
"mean_token_accuracy": 0.2032615840435028,
|
|
"num_tokens": 55732550.0,
|
|
"step": 21990
|
|
},
|
|
{
|
|
"entropy": 6.2165101051330565,
|
|
"epoch": 2.5383727639930758,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004365224097039036,
|
|
"loss": 5.6489,
|
|
"mean_token_accuracy": 0.20692258179187775,
|
|
"num_tokens": 55745468.0,
|
|
"step": 21995
|
|
},
|
|
{
|
|
"entropy": 6.198334550857544,
|
|
"epoch": 2.538949798038084,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000436493680001559,
|
|
"loss": 5.6648,
|
|
"mean_token_accuracy": 0.20468035489320754,
|
|
"num_tokens": 55757193.0,
|
|
"step": 22000
|
|
},
|
|
{
|
|
"entropy": 6.244527673721313,
|
|
"epoch": 2.539526832083093,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00043646494486745464,
|
|
"loss": 5.6595,
|
|
"mean_token_accuracy": 0.2026069477200508,
|
|
"num_tokens": 55770185.0,
|
|
"step": 22005
|
|
},
|
|
{
|
|
"entropy": 6.272916173934936,
|
|
"epoch": 2.5401038661281015,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004364362043025571,
|
|
"loss": 5.6532,
|
|
"mean_token_accuracy": 0.2028561934828758,
|
|
"num_tokens": 55782204.0,
|
|
"step": 22010
|
|
},
|
|
{
|
|
"entropy": 6.178328990936279,
|
|
"epoch": 2.5406809001731103,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00043640745830783297,
|
|
"loss": 5.5757,
|
|
"mean_token_accuracy": 0.20987578332424164,
|
|
"num_tokens": 55795077.0,
|
|
"step": 22015
|
|
},
|
|
{
|
|
"entropy": 6.270701599121094,
|
|
"epoch": 2.5412579342181187,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004363787068842491,
|
|
"loss": 5.6363,
|
|
"mean_token_accuracy": 0.21340528428554534,
|
|
"num_tokens": 55808876.0,
|
|
"step": 22020
|
|
},
|
|
{
|
|
"entropy": 6.327560901641846,
|
|
"epoch": 2.5418349682631276,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004363499500327727,
|
|
"loss": 5.7614,
|
|
"mean_token_accuracy": 0.19813940078020095,
|
|
"num_tokens": 55822861.0,
|
|
"step": 22025
|
|
},
|
|
{
|
|
"entropy": 6.256553268432617,
|
|
"epoch": 2.542412002308136,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00043632118775437085,
|
|
"loss": 5.6651,
|
|
"mean_token_accuracy": 0.20089796036481858,
|
|
"num_tokens": 55835523.0,
|
|
"step": 22030
|
|
},
|
|
{
|
|
"entropy": 6.266847419738769,
|
|
"epoch": 2.542989036353145,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00043629242005001096,
|
|
"loss": 5.7063,
|
|
"mean_token_accuracy": 0.19951148480176925,
|
|
"num_tokens": 55848377.0,
|
|
"step": 22035
|
|
},
|
|
{
|
|
"entropy": 6.341313457489013,
|
|
"epoch": 2.5435660703981533,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004362636469206607,
|
|
"loss": 5.7602,
|
|
"mean_token_accuracy": 0.19608056247234346,
|
|
"num_tokens": 55862074.0,
|
|
"step": 22040
|
|
},
|
|
{
|
|
"entropy": 6.232118225097656,
|
|
"epoch": 2.544143104443162,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004362348683672877,
|
|
"loss": 5.6627,
|
|
"mean_token_accuracy": 0.19688585698604583,
|
|
"num_tokens": 55874816.0,
|
|
"step": 22045
|
|
},
|
|
{
|
|
"entropy": 6.312012147903443,
|
|
"epoch": 2.544720138488171,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004362060843908601,
|
|
"loss": 5.7316,
|
|
"mean_token_accuracy": 0.200949464738369,
|
|
"num_tokens": 55887424.0,
|
|
"step": 22050
|
|
},
|
|
{
|
|
"entropy": 6.265195035934449,
|
|
"epoch": 2.5452971725331794,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004361772949923458,
|
|
"loss": 5.6968,
|
|
"mean_token_accuracy": 0.20014529079198837,
|
|
"num_tokens": 55900532.0,
|
|
"step": 22055
|
|
},
|
|
{
|
|
"entropy": 6.273292350769043,
|
|
"epoch": 2.545874206578188,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004361485001727132,
|
|
"loss": 5.6842,
|
|
"mean_token_accuracy": 0.20204830914735794,
|
|
"num_tokens": 55912599.0,
|
|
"step": 22060
|
|
},
|
|
{
|
|
"entropy": 6.291330242156983,
|
|
"epoch": 2.5464512406231967,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.000436119699932931,
|
|
"loss": 5.7034,
|
|
"mean_token_accuracy": 0.20001255422830583,
|
|
"num_tokens": 55925012.0,
|
|
"step": 22065
|
|
},
|
|
{
|
|
"entropy": 6.226291131973267,
|
|
"epoch": 2.5470282746682056,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00043609089427396763,
|
|
"loss": 5.6404,
|
|
"mean_token_accuracy": 0.21029446870088578,
|
|
"num_tokens": 55938058.0,
|
|
"step": 22070
|
|
},
|
|
{
|
|
"entropy": 6.282356548309326,
|
|
"epoch": 2.547605308713214,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00043606208319679215,
|
|
"loss": 5.7489,
|
|
"mean_token_accuracy": 0.1997848466038704,
|
|
"num_tokens": 55951439.0,
|
|
"step": 22075
|
|
},
|
|
{
|
|
"entropy": 6.219042015075684,
|
|
"epoch": 2.548182342758223,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004360332667023734,
|
|
"loss": 5.5914,
|
|
"mean_token_accuracy": 0.21249673515558243,
|
|
"num_tokens": 55964583.0,
|
|
"step": 22080
|
|
},
|
|
{
|
|
"entropy": 6.158158445358277,
|
|
"epoch": 2.5487593768032313,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00043600444479168084,
|
|
"loss": 5.5608,
|
|
"mean_token_accuracy": 0.21451905071735383,
|
|
"num_tokens": 55978072.0,
|
|
"step": 22085
|
|
},
|
|
{
|
|
"entropy": 6.228409147262573,
|
|
"epoch": 2.54933641084824,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004359756174656836,
|
|
"loss": 5.6167,
|
|
"mean_token_accuracy": 0.21293352097272872,
|
|
"num_tokens": 55990278.0,
|
|
"step": 22090
|
|
},
|
|
{
|
|
"entropy": 6.220971727371216,
|
|
"epoch": 2.5499134448932486,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00043594678472535153,
|
|
"loss": 5.6669,
|
|
"mean_token_accuracy": 0.1993907481431961,
|
|
"num_tokens": 56003303.0,
|
|
"step": 22095
|
|
},
|
|
{
|
|
"entropy": 6.256470966339111,
|
|
"epoch": 2.5504904789382574,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00043591794657165425,
|
|
"loss": 5.6397,
|
|
"mean_token_accuracy": 0.2146317794919014,
|
|
"num_tokens": 56015131.0,
|
|
"step": 22100
|
|
},
|
|
{
|
|
"entropy": 6.207059574127197,
|
|
"epoch": 2.5510675129832663,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004358891030055617,
|
|
"loss": 5.6164,
|
|
"mean_token_accuracy": 0.20772802382707595,
|
|
"num_tokens": 56027804.0,
|
|
"step": 22105
|
|
},
|
|
{
|
|
"entropy": 6.328710889816284,
|
|
"epoch": 2.5516445470282747,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004358602540280443,
|
|
"loss": 5.7683,
|
|
"mean_token_accuracy": 0.19766588211059571,
|
|
"num_tokens": 56040485.0,
|
|
"step": 22110
|
|
},
|
|
{
|
|
"entropy": 6.345161628723145,
|
|
"epoch": 2.552221581073283,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00043583139964007203,
|
|
"loss": 5.7004,
|
|
"mean_token_accuracy": 0.19818729907274246,
|
|
"num_tokens": 56052091.0,
|
|
"step": 22115
|
|
},
|
|
{
|
|
"entropy": 6.230707883834839,
|
|
"epoch": 2.552798615118292,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00043580253984261554,
|
|
"loss": 5.616,
|
|
"mean_token_accuracy": 0.21017952263355255,
|
|
"num_tokens": 56063291.0,
|
|
"step": 22120
|
|
},
|
|
{
|
|
"entropy": 6.209798955917359,
|
|
"epoch": 2.553375649163301,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00043577367463664546,
|
|
"loss": 5.6857,
|
|
"mean_token_accuracy": 0.19613204300403594,
|
|
"num_tokens": 56074219.0,
|
|
"step": 22125
|
|
},
|
|
{
|
|
"entropy": 6.210433530807495,
|
|
"epoch": 2.5539526832083093,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004357448040231327,
|
|
"loss": 5.6115,
|
|
"mean_token_accuracy": 0.20355152934789658,
|
|
"num_tokens": 56088126.0,
|
|
"step": 22130
|
|
},
|
|
{
|
|
"entropy": 6.378800106048584,
|
|
"epoch": 2.5545297172533177,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004357159280030483,
|
|
"loss": 5.7079,
|
|
"mean_token_accuracy": 0.2006726622581482,
|
|
"num_tokens": 56101686.0,
|
|
"step": 22135
|
|
},
|
|
{
|
|
"entropy": 6.2526123046875,
|
|
"epoch": 2.5551067512983265,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004356870465773635,
|
|
"loss": 5.7186,
|
|
"mean_token_accuracy": 0.20398495048284532,
|
|
"num_tokens": 56114605.0,
|
|
"step": 22140
|
|
},
|
|
{
|
|
"entropy": 6.168740701675415,
|
|
"epoch": 2.5556837853433354,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00043565815974704974,
|
|
"loss": 5.573,
|
|
"mean_token_accuracy": 0.2081254780292511,
|
|
"num_tokens": 56127955.0,
|
|
"step": 22145
|
|
},
|
|
{
|
|
"entropy": 6.382021141052246,
|
|
"epoch": 2.556260819388344,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00043562926751307857,
|
|
"loss": 5.8001,
|
|
"mean_token_accuracy": 0.19422426521778108,
|
|
"num_tokens": 56140691.0,
|
|
"step": 22150
|
|
},
|
|
{
|
|
"entropy": 6.26363320350647,
|
|
"epoch": 2.5568378534333527,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00043560036987642177,
|
|
"loss": 5.6568,
|
|
"mean_token_accuracy": 0.20106588900089264,
|
|
"num_tokens": 56153815.0,
|
|
"step": 22155
|
|
},
|
|
{
|
|
"entropy": 6.287132501602173,
|
|
"epoch": 2.557414887478361,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00043557146683805134,
|
|
"loss": 5.6756,
|
|
"mean_token_accuracy": 0.20819469094276427,
|
|
"num_tokens": 56167186.0,
|
|
"step": 22160
|
|
},
|
|
{
|
|
"entropy": 6.265668487548828,
|
|
"epoch": 2.55799192152337,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004355425583989393,
|
|
"loss": 5.683,
|
|
"mean_token_accuracy": 0.20115176886320113,
|
|
"num_tokens": 56179307.0,
|
|
"step": 22165
|
|
},
|
|
{
|
|
"entropy": 6.318639707565308,
|
|
"epoch": 2.5585689555683784,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00043551364456005816,
|
|
"loss": 5.7153,
|
|
"mean_token_accuracy": 0.19732150733470916,
|
|
"num_tokens": 56191398.0,
|
|
"step": 22170
|
|
},
|
|
{
|
|
"entropy": 6.215137052536011,
|
|
"epoch": 2.5591459896133872,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00043548472532238015,
|
|
"loss": 5.6051,
|
|
"mean_token_accuracy": 0.2094906821846962,
|
|
"num_tokens": 56203871.0,
|
|
"step": 22175
|
|
},
|
|
{
|
|
"entropy": 6.178353118896484,
|
|
"epoch": 2.559723023658396,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00043545580068687836,
|
|
"loss": 5.6493,
|
|
"mean_token_accuracy": 0.2003050848841667,
|
|
"num_tokens": 56215262.0,
|
|
"step": 22180
|
|
},
|
|
{
|
|
"entropy": 6.236694097518921,
|
|
"epoch": 2.5603000577034045,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004354268706545252,
|
|
"loss": 5.6292,
|
|
"mean_token_accuracy": 0.2125608891248703,
|
|
"num_tokens": 56230190.0,
|
|
"step": 22185
|
|
},
|
|
{
|
|
"entropy": 6.2028497695922855,
|
|
"epoch": 2.560877091748413,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00043539793522629405,
|
|
"loss": 5.5752,
|
|
"mean_token_accuracy": 0.21496107280254365,
|
|
"num_tokens": 56243841.0,
|
|
"step": 22190
|
|
},
|
|
{
|
|
"entropy": 6.262893390655518,
|
|
"epoch": 2.561454125793422,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00043536899440315796,
|
|
"loss": 5.6524,
|
|
"mean_token_accuracy": 0.20673952549695968,
|
|
"num_tokens": 56257500.0,
|
|
"step": 22195
|
|
},
|
|
{
|
|
"entropy": 6.274878883361817,
|
|
"epoch": 2.5620311598384307,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004353400481860904,
|
|
"loss": 5.6407,
|
|
"mean_token_accuracy": 0.20147757828235627,
|
|
"num_tokens": 56269732.0,
|
|
"step": 22200
|
|
},
|
|
{
|
|
"entropy": 6.292238998413086,
|
|
"epoch": 2.562608193883439,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00043531109657606504,
|
|
"loss": 5.7121,
|
|
"mean_token_accuracy": 0.1995270237326622,
|
|
"num_tokens": 56283192.0,
|
|
"step": 22205
|
|
},
|
|
{
|
|
"entropy": 6.2072947978973385,
|
|
"epoch": 2.563185227928448,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004352821395740555,
|
|
"loss": 5.6509,
|
|
"mean_token_accuracy": 0.20001816153526306,
|
|
"num_tokens": 56296312.0,
|
|
"step": 22210
|
|
},
|
|
{
|
|
"entropy": 6.310428857803345,
|
|
"epoch": 2.5637622619734564,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004352531771810359,
|
|
"loss": 5.6707,
|
|
"mean_token_accuracy": 0.20241052210330962,
|
|
"num_tokens": 56309964.0,
|
|
"step": 22215
|
|
},
|
|
{
|
|
"entropy": 6.230297374725342,
|
|
"epoch": 2.564339296018465,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004352242093979802,
|
|
"loss": 5.6745,
|
|
"mean_token_accuracy": 0.20699879378080369,
|
|
"num_tokens": 56324002.0,
|
|
"step": 22220
|
|
},
|
|
{
|
|
"entropy": 6.283534288406372,
|
|
"epoch": 2.5649163300634736,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004351952362258628,
|
|
"loss": 5.6904,
|
|
"mean_token_accuracy": 0.1992029994726181,
|
|
"num_tokens": 56336339.0,
|
|
"step": 22225
|
|
},
|
|
{
|
|
"entropy": 6.271181678771972,
|
|
"epoch": 2.5654933641084825,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00043516625766565825,
|
|
"loss": 5.6853,
|
|
"mean_token_accuracy": 0.20188935101032257,
|
|
"num_tokens": 56347819.0,
|
|
"step": 22230
|
|
},
|
|
{
|
|
"entropy": 6.3224749088287355,
|
|
"epoch": 2.566070398153491,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004351372737183412,
|
|
"loss": 5.6653,
|
|
"mean_token_accuracy": 0.19866761267185212,
|
|
"num_tokens": 56360764.0,
|
|
"step": 22235
|
|
},
|
|
{
|
|
"entropy": 6.262296724319458,
|
|
"epoch": 2.5666474321985,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004351082843848865,
|
|
"loss": 5.6915,
|
|
"mean_token_accuracy": 0.19294437319040297,
|
|
"num_tokens": 56372731.0,
|
|
"step": 22240
|
|
},
|
|
{
|
|
"entropy": 6.226365852355957,
|
|
"epoch": 2.567224466243508,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00043507928966626916,
|
|
"loss": 5.6529,
|
|
"mean_token_accuracy": 0.19948222488164902,
|
|
"num_tokens": 56385650.0,
|
|
"step": 22245
|
|
},
|
|
{
|
|
"entropy": 6.267301321029663,
|
|
"epoch": 2.567801500288517,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004350502895634644,
|
|
"loss": 5.6468,
|
|
"mean_token_accuracy": 0.20801960527896882,
|
|
"num_tokens": 56397076.0,
|
|
"step": 22250
|
|
},
|
|
{
|
|
"entropy": 6.253646421432495,
|
|
"epoch": 2.568378534333526,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004350212840774476,
|
|
"loss": 5.6116,
|
|
"mean_token_accuracy": 0.20903352200984954,
|
|
"num_tokens": 56409779.0,
|
|
"step": 22255
|
|
},
|
|
{
|
|
"entropy": 6.3054948329925535,
|
|
"epoch": 2.5689555683785343,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00043499227320919456,
|
|
"loss": 5.7234,
|
|
"mean_token_accuracy": 0.1943468287587166,
|
|
"num_tokens": 56423204.0,
|
|
"step": 22260
|
|
},
|
|
{
|
|
"entropy": 6.291591644287109,
|
|
"epoch": 2.5695326024235428,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00043496325695968076,
|
|
"loss": 5.7115,
|
|
"mean_token_accuracy": 0.2068028509616852,
|
|
"num_tokens": 56436379.0,
|
|
"step": 22265
|
|
},
|
|
{
|
|
"entropy": 6.275308132171631,
|
|
"epoch": 2.5701096364685516,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004349342353298823,
|
|
"loss": 5.6661,
|
|
"mean_token_accuracy": 0.20189398825168609,
|
|
"num_tokens": 56449558.0,
|
|
"step": 22270
|
|
},
|
|
{
|
|
"entropy": 6.256720972061157,
|
|
"epoch": 2.5706866705135605,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004349052083207753,
|
|
"loss": 5.6755,
|
|
"mean_token_accuracy": 0.20200487673282624,
|
|
"num_tokens": 56463541.0,
|
|
"step": 22275
|
|
},
|
|
{
|
|
"entropy": 6.403251314163208,
|
|
"epoch": 2.571263704558569,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.000434876175933336,
|
|
"loss": 5.8167,
|
|
"mean_token_accuracy": 0.19026020169258118,
|
|
"num_tokens": 56476849.0,
|
|
"step": 22280
|
|
},
|
|
{
|
|
"entropy": 6.254389524459839,
|
|
"epoch": 2.5718407386035778,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00043484713816854093,
|
|
"loss": 5.6296,
|
|
"mean_token_accuracy": 0.2059500753879547,
|
|
"num_tokens": 56490089.0,
|
|
"step": 22285
|
|
},
|
|
{
|
|
"entropy": 6.2421732425689695,
|
|
"epoch": 2.572417772648586,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004348180950273668,
|
|
"loss": 5.6231,
|
|
"mean_token_accuracy": 0.20976163148880006,
|
|
"num_tokens": 56501392.0,
|
|
"step": 22290
|
|
},
|
|
{
|
|
"entropy": 6.219451189041138,
|
|
"epoch": 2.572994806693595,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004347890465107905,
|
|
"loss": 5.5656,
|
|
"mean_token_accuracy": 0.21205515861511232,
|
|
"num_tokens": 56513573.0,
|
|
"step": 22295
|
|
},
|
|
{
|
|
"entropy": 6.270431661605835,
|
|
"epoch": 2.5735718407386035,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00043475999261978894,
|
|
"loss": 5.6635,
|
|
"mean_token_accuracy": 0.20469413846731185,
|
|
"num_tokens": 56526762.0,
|
|
"step": 22300
|
|
},
|
|
{
|
|
"entropy": 6.231783866882324,
|
|
"epoch": 2.5741488747836123,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004347309333553393,
|
|
"loss": 5.6629,
|
|
"mean_token_accuracy": 0.20476937890052796,
|
|
"num_tokens": 56538264.0,
|
|
"step": 22305
|
|
},
|
|
{
|
|
"entropy": 6.313006258010864,
|
|
"epoch": 2.5747259088286207,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00043470186871841915,
|
|
"loss": 5.7382,
|
|
"mean_token_accuracy": 0.19123051762580873,
|
|
"num_tokens": 56550296.0,
|
|
"step": 22310
|
|
},
|
|
{
|
|
"entropy": 6.272767353057861,
|
|
"epoch": 2.5753029428736296,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000434672798710006,
|
|
"loss": 5.6627,
|
|
"mean_token_accuracy": 0.20164896100759505,
|
|
"num_tokens": 56563542.0,
|
|
"step": 22315
|
|
},
|
|
{
|
|
"entropy": 6.180900287628174,
|
|
"epoch": 2.575879976918638,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00043464372333107756,
|
|
"loss": 5.6222,
|
|
"mean_token_accuracy": 0.21378878206014634,
|
|
"num_tokens": 56576992.0,
|
|
"step": 22320
|
|
},
|
|
{
|
|
"entropy": 6.305271196365356,
|
|
"epoch": 2.576457010963647,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00043461464258261174,
|
|
"loss": 5.6436,
|
|
"mean_token_accuracy": 0.2100139304995537,
|
|
"num_tokens": 56589271.0,
|
|
"step": 22325
|
|
},
|
|
{
|
|
"entropy": 6.096579265594483,
|
|
"epoch": 2.5770340450086557,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004345855564655867,
|
|
"loss": 5.3381,
|
|
"mean_token_accuracy": 0.23082049638032914,
|
|
"num_tokens": 56600796.0,
|
|
"step": 22330
|
|
},
|
|
{
|
|
"entropy": 6.154261302947998,
|
|
"epoch": 2.577611079053664,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.00043455646498098075,
|
|
"loss": 5.5601,
|
|
"mean_token_accuracy": 0.22364532202482224,
|
|
"num_tokens": 56613327.0,
|
|
"step": 22335
|
|
},
|
|
{
|
|
"entropy": 6.216110801696777,
|
|
"epoch": 2.5781881130986726,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00043452736812977236,
|
|
"loss": 5.6268,
|
|
"mean_token_accuracy": 0.20740117281675338,
|
|
"num_tokens": 56626554.0,
|
|
"step": 22340
|
|
},
|
|
{
|
|
"entropy": 6.301758813858032,
|
|
"epoch": 2.5787651471436814,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004344982659129402,
|
|
"loss": 5.6516,
|
|
"mean_token_accuracy": 0.20795178562402725,
|
|
"num_tokens": 56639960.0,
|
|
"step": 22345
|
|
},
|
|
{
|
|
"entropy": 6.220022344589234,
|
|
"epoch": 2.5793421811886903,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004344691583314631,
|
|
"loss": 5.6642,
|
|
"mean_token_accuracy": 0.20658115595579146,
|
|
"num_tokens": 56651330.0,
|
|
"step": 22350
|
|
},
|
|
{
|
|
"entropy": 6.320055055618286,
|
|
"epoch": 2.5799192152336987,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00043444004538632005,
|
|
"loss": 5.7811,
|
|
"mean_token_accuracy": 0.19568791687488557,
|
|
"num_tokens": 56664359.0,
|
|
"step": 22355
|
|
},
|
|
{
|
|
"entropy": 6.260113191604614,
|
|
"epoch": 2.5804962492787076,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00043441092707849024,
|
|
"loss": 5.6809,
|
|
"mean_token_accuracy": 0.19256843030452728,
|
|
"num_tokens": 56676095.0,
|
|
"step": 22360
|
|
},
|
|
{
|
|
"entropy": 6.245993804931641,
|
|
"epoch": 2.581073283323716,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00043438180340895315,
|
|
"loss": 5.7382,
|
|
"mean_token_accuracy": 0.20092551559209823,
|
|
"num_tokens": 56689918.0,
|
|
"step": 22365
|
|
},
|
|
{
|
|
"entropy": 6.314111948013306,
|
|
"epoch": 2.581650317368725,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00043435267437868825,
|
|
"loss": 5.7167,
|
|
"mean_token_accuracy": 0.19776170402765275,
|
|
"num_tokens": 56702308.0,
|
|
"step": 22370
|
|
},
|
|
{
|
|
"entropy": 6.279919195175171,
|
|
"epoch": 2.5822273514137333,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004343235399886753,
|
|
"loss": 5.6808,
|
|
"mean_token_accuracy": 0.2025884211063385,
|
|
"num_tokens": 56713928.0,
|
|
"step": 22375
|
|
},
|
|
{
|
|
"entropy": 6.313197612762451,
|
|
"epoch": 2.582804385458742,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004342944002398942,
|
|
"loss": 5.7338,
|
|
"mean_token_accuracy": 0.20102918148040771,
|
|
"num_tokens": 56727065.0,
|
|
"step": 22380
|
|
},
|
|
{
|
|
"entropy": 6.219231986999512,
|
|
"epoch": 2.583381419503751,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004342652551333251,
|
|
"loss": 5.6926,
|
|
"mean_token_accuracy": 0.2002527579665184,
|
|
"num_tokens": 56739517.0,
|
|
"step": 22385
|
|
},
|
|
{
|
|
"entropy": 6.218995571136475,
|
|
"epoch": 2.5839584535487594,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004342361046699482,
|
|
"loss": 5.6592,
|
|
"mean_token_accuracy": 0.20271196961402893,
|
|
"num_tokens": 56753044.0,
|
|
"step": 22390
|
|
},
|
|
{
|
|
"entropy": 6.279383802413941,
|
|
"epoch": 2.584535487593768,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004342069488507441,
|
|
"loss": 5.6647,
|
|
"mean_token_accuracy": 0.2001708671450615,
|
|
"num_tokens": 56765500.0,
|
|
"step": 22395
|
|
},
|
|
{
|
|
"entropy": 6.3404487609863285,
|
|
"epoch": 2.5851125216387767,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004341777876766933,
|
|
"loss": 5.7543,
|
|
"mean_token_accuracy": 0.19143348187208176,
|
|
"num_tokens": 56777895.0,
|
|
"step": 22400
|
|
},
|
|
{
|
|
"entropy": 6.305113029479981,
|
|
"epoch": 2.5856895556837856,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004341486211487767,
|
|
"loss": 5.6089,
|
|
"mean_token_accuracy": 0.2092020481824875,
|
|
"num_tokens": 56791523.0,
|
|
"step": 22405
|
|
},
|
|
{
|
|
"entropy": 6.248012638092041,
|
|
"epoch": 2.586266589728794,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004341194492679753,
|
|
"loss": 5.6925,
|
|
"mean_token_accuracy": 0.20056382268667222,
|
|
"num_tokens": 56803490.0,
|
|
"step": 22410
|
|
},
|
|
{
|
|
"entropy": 6.2818280220031735,
|
|
"epoch": 2.5868436237738024,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00043409027203527016,
|
|
"loss": 5.6988,
|
|
"mean_token_accuracy": 0.20019769668579102,
|
|
"num_tokens": 56814398.0,
|
|
"step": 22415
|
|
},
|
|
{
|
|
"entropy": 6.171245193481445,
|
|
"epoch": 2.5874206578188113,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00043406108945164283,
|
|
"loss": 5.6304,
|
|
"mean_token_accuracy": 0.21150241196155548,
|
|
"num_tokens": 56826591.0,
|
|
"step": 22420
|
|
},
|
|
{
|
|
"entropy": 6.223255968093872,
|
|
"epoch": 2.58799769186382,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00043403190151807474,
|
|
"loss": 5.6583,
|
|
"mean_token_accuracy": 0.1956866815686226,
|
|
"num_tokens": 56839208.0,
|
|
"step": 22425
|
|
},
|
|
{
|
|
"entropy": 6.3081676959991455,
|
|
"epoch": 2.5885747259088285,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004340027082355477,
|
|
"loss": 5.6619,
|
|
"mean_token_accuracy": 0.19987513720989228,
|
|
"num_tokens": 56852211.0,
|
|
"step": 22430
|
|
},
|
|
{
|
|
"entropy": 6.222271680831909,
|
|
"epoch": 2.5891517599538374,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004339735096050434,
|
|
"loss": 5.6073,
|
|
"mean_token_accuracy": 0.202955661714077,
|
|
"num_tokens": 56864691.0,
|
|
"step": 22435
|
|
},
|
|
{
|
|
"entropy": 6.230732583999634,
|
|
"epoch": 2.589728793998846,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004339443056275443,
|
|
"loss": 5.586,
|
|
"mean_token_accuracy": 0.2181745320558548,
|
|
"num_tokens": 56877473.0,
|
|
"step": 22440
|
|
},
|
|
{
|
|
"entropy": 6.302584171295166,
|
|
"epoch": 2.5903058280438547,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00043391509630403224,
|
|
"loss": 5.7247,
|
|
"mean_token_accuracy": 0.20378457903862,
|
|
"num_tokens": 56889852.0,
|
|
"step": 22445
|
|
},
|
|
{
|
|
"entropy": 6.319608592987061,
|
|
"epoch": 2.590882862088863,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00043388588163549,
|
|
"loss": 5.7673,
|
|
"mean_token_accuracy": 0.19541571885347367,
|
|
"num_tokens": 56901882.0,
|
|
"step": 22450
|
|
},
|
|
{
|
|
"entropy": 6.304369354248047,
|
|
"epoch": 2.591459896133872,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00043385666162289995,
|
|
"loss": 5.6942,
|
|
"mean_token_accuracy": 0.2035412758588791,
|
|
"num_tokens": 56913212.0,
|
|
"step": 22455
|
|
},
|
|
{
|
|
"entropy": 6.28717679977417,
|
|
"epoch": 2.592036930178881,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00043382743626724506,
|
|
"loss": 5.7174,
|
|
"mean_token_accuracy": 0.19611125141382219,
|
|
"num_tokens": 56924490.0,
|
|
"step": 22460
|
|
},
|
|
{
|
|
"entropy": 6.302191925048828,
|
|
"epoch": 2.5926139642238892,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004337982055695082,
|
|
"loss": 5.795,
|
|
"mean_token_accuracy": 0.19198362976312638,
|
|
"num_tokens": 56937558.0,
|
|
"step": 22465
|
|
},
|
|
{
|
|
"entropy": 6.243434572219849,
|
|
"epoch": 2.5931909982688977,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004337689695306726,
|
|
"loss": 5.69,
|
|
"mean_token_accuracy": 0.20614712983369826,
|
|
"num_tokens": 56950544.0,
|
|
"step": 22470
|
|
},
|
|
{
|
|
"entropy": 6.339292383193969,
|
|
"epoch": 2.5937680323139065,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004337397281517215,
|
|
"loss": 5.6716,
|
|
"mean_token_accuracy": 0.2014582559466362,
|
|
"num_tokens": 56962972.0,
|
|
"step": 22475
|
|
},
|
|
{
|
|
"entropy": 6.2792774677276615,
|
|
"epoch": 2.5943450663589154,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004337104814336386,
|
|
"loss": 5.6624,
|
|
"mean_token_accuracy": 0.2001517191529274,
|
|
"num_tokens": 56975972.0,
|
|
"step": 22480
|
|
},
|
|
{
|
|
"entropy": 6.303111886978149,
|
|
"epoch": 2.594922100403924,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004336812293774075,
|
|
"loss": 5.7709,
|
|
"mean_token_accuracy": 0.19594867676496505,
|
|
"num_tokens": 56989106.0,
|
|
"step": 22485
|
|
},
|
|
{
|
|
"entropy": 6.286650085449219,
|
|
"epoch": 2.595499134448932,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00043365197198401195,
|
|
"loss": 5.6554,
|
|
"mean_token_accuracy": 0.2046741396188736,
|
|
"num_tokens": 57002544.0,
|
|
"step": 22490
|
|
},
|
|
{
|
|
"entropy": 6.355883836746216,
|
|
"epoch": 2.596076168493941,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004336227092544362,
|
|
"loss": 5.7445,
|
|
"mean_token_accuracy": 0.19667317122220992,
|
|
"num_tokens": 57016526.0,
|
|
"step": 22495
|
|
},
|
|
{
|
|
"entropy": 6.32221302986145,
|
|
"epoch": 2.59665320253895,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004335934411896644,
|
|
"loss": 5.6869,
|
|
"mean_token_accuracy": 0.2055511876940727,
|
|
"num_tokens": 57029817.0,
|
|
"step": 22500
|
|
},
|
|
{
|
|
"entropy": 6.2109943389892575,
|
|
"epoch": 2.5972302365839584,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.000433564167790681,
|
|
"loss": 5.6698,
|
|
"mean_token_accuracy": 0.2063784584403038,
|
|
"num_tokens": 57042189.0,
|
|
"step": 22505
|
|
},
|
|
{
|
|
"entropy": 6.24761929512024,
|
|
"epoch": 2.597807270628967,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004335348890584706,
|
|
"loss": 5.6843,
|
|
"mean_token_accuracy": 0.19666637927293779,
|
|
"num_tokens": 57054297.0,
|
|
"step": 22510
|
|
},
|
|
{
|
|
"entropy": 6.288054037094116,
|
|
"epoch": 2.5983843046739756,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00043350560499401793,
|
|
"loss": 5.66,
|
|
"mean_token_accuracy": 0.20568008124828338,
|
|
"num_tokens": 57067530.0,
|
|
"step": 22515
|
|
},
|
|
{
|
|
"entropy": 6.31848177909851,
|
|
"epoch": 2.5989613387189845,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004334763155983079,
|
|
"loss": 5.7608,
|
|
"mean_token_accuracy": 0.19461397528648378,
|
|
"num_tokens": 57080877.0,
|
|
"step": 22520
|
|
},
|
|
{
|
|
"entropy": 6.29225344657898,
|
|
"epoch": 2.599538372763993,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00043344702087232584,
|
|
"loss": 5.6792,
|
|
"mean_token_accuracy": 0.20767224729061126,
|
|
"num_tokens": 57092716.0,
|
|
"step": 22525
|
|
},
|
|
{
|
|
"entropy": 6.193208980560303,
|
|
"epoch": 2.6001154068090018,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004334177208170569,
|
|
"loss": 5.6159,
|
|
"mean_token_accuracy": 0.20914204120635987,
|
|
"num_tokens": 57107335.0,
|
|
"step": 22530
|
|
},
|
|
{
|
|
"entropy": 6.280509567260742,
|
|
"epoch": 2.6006924408540106,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00043338841543348654,
|
|
"loss": 5.6465,
|
|
"mean_token_accuracy": 0.2092574030160904,
|
|
"num_tokens": 57121691.0,
|
|
"step": 22535
|
|
},
|
|
{
|
|
"entropy": 6.325465726852417,
|
|
"epoch": 2.601269474899019,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00043335910472260057,
|
|
"loss": 5.7343,
|
|
"mean_token_accuracy": 0.19246442764997482,
|
|
"num_tokens": 57134536.0,
|
|
"step": 22540
|
|
},
|
|
{
|
|
"entropy": 6.290104150772095,
|
|
"epoch": 2.6018465089440275,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00043332978868538483,
|
|
"loss": 5.6518,
|
|
"mean_token_accuracy": 0.20202865302562714,
|
|
"num_tokens": 57147141.0,
|
|
"step": 22545
|
|
},
|
|
{
|
|
"entropy": 6.205418395996094,
|
|
"epoch": 2.6024235429890363,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00043330046732282515,
|
|
"loss": 5.6241,
|
|
"mean_token_accuracy": 0.21425416469573974,
|
|
"num_tokens": 57160097.0,
|
|
"step": 22550
|
|
},
|
|
{
|
|
"entropy": 6.144654846191406,
|
|
"epoch": 2.603000577034045,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00043327114063590797,
|
|
"loss": 5.5539,
|
|
"mean_token_accuracy": 0.2236112490296364,
|
|
"num_tokens": 57173378.0,
|
|
"step": 22555
|
|
},
|
|
{
|
|
"entropy": 6.259184217453003,
|
|
"epoch": 2.6035776110790536,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004332418086256196,
|
|
"loss": 5.6346,
|
|
"mean_token_accuracy": 0.21564380526542665,
|
|
"num_tokens": 57187957.0,
|
|
"step": 22560
|
|
},
|
|
{
|
|
"entropy": 6.26995882987976,
|
|
"epoch": 2.6041546451240625,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004332124712929466,
|
|
"loss": 5.69,
|
|
"mean_token_accuracy": 0.20136985182762146,
|
|
"num_tokens": 57202186.0,
|
|
"step": 22565
|
|
},
|
|
{
|
|
"entropy": 6.347912549972534,
|
|
"epoch": 2.604731679169071,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00043318312863887566,
|
|
"loss": 5.6956,
|
|
"mean_token_accuracy": 0.19911793023347854,
|
|
"num_tokens": 57213841.0,
|
|
"step": 22570
|
|
},
|
|
{
|
|
"entropy": 6.273216676712036,
|
|
"epoch": 2.6053087132140798,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00043315378066439384,
|
|
"loss": 5.6397,
|
|
"mean_token_accuracy": 0.21021705567836763,
|
|
"num_tokens": 57226445.0,
|
|
"step": 22575
|
|
},
|
|
{
|
|
"entropy": 6.241339874267578,
|
|
"epoch": 2.605885747259088,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004331244273704881,
|
|
"loss": 5.6547,
|
|
"mean_token_accuracy": 0.20707382261753082,
|
|
"num_tokens": 57238913.0,
|
|
"step": 22580
|
|
},
|
|
{
|
|
"entropy": 6.246391677856446,
|
|
"epoch": 2.606462781304097,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004330950687581458,
|
|
"loss": 5.6589,
|
|
"mean_token_accuracy": 0.2090754434466362,
|
|
"num_tokens": 57251082.0,
|
|
"step": 22585
|
|
},
|
|
{
|
|
"entropy": 6.262573862075806,
|
|
"epoch": 2.6070398153491054,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00043306570482835443,
|
|
"loss": 5.6858,
|
|
"mean_token_accuracy": 0.20205187648534775,
|
|
"num_tokens": 57263267.0,
|
|
"step": 22590
|
|
},
|
|
{
|
|
"entropy": 6.275821495056152,
|
|
"epoch": 2.6076168493941143,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004330363355821016,
|
|
"loss": 5.678,
|
|
"mean_token_accuracy": 0.2027643546462059,
|
|
"num_tokens": 57277053.0,
|
|
"step": 22595
|
|
},
|
|
{
|
|
"entropy": 6.257179307937622,
|
|
"epoch": 2.6081938834391227,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004330069610203751,
|
|
"loss": 5.6088,
|
|
"mean_token_accuracy": 0.20768820494413376,
|
|
"num_tokens": 57289962.0,
|
|
"step": 22600
|
|
},
|
|
{
|
|
"entropy": 6.271624517440796,
|
|
"epoch": 2.6087709174841316,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004329775811441629,
|
|
"loss": 5.7195,
|
|
"mean_token_accuracy": 0.19985413551330566,
|
|
"num_tokens": 57302397.0,
|
|
"step": 22605
|
|
},
|
|
{
|
|
"entropy": 6.269496059417724,
|
|
"epoch": 2.6093479515291405,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00043294819595445324,
|
|
"loss": 5.5804,
|
|
"mean_token_accuracy": 0.210008142888546,
|
|
"num_tokens": 57316645.0,
|
|
"step": 22610
|
|
},
|
|
{
|
|
"entropy": 6.249709272384644,
|
|
"epoch": 2.609924985574149,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004329188054522345,
|
|
"loss": 5.6394,
|
|
"mean_token_accuracy": 0.20307956784963607,
|
|
"num_tokens": 57329714.0,
|
|
"step": 22615
|
|
},
|
|
{
|
|
"entropy": 6.286224317550659,
|
|
"epoch": 2.6105020196191573,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004328894096384952,
|
|
"loss": 5.7385,
|
|
"mean_token_accuracy": 0.19608159065246583,
|
|
"num_tokens": 57342940.0,
|
|
"step": 22620
|
|
},
|
|
{
|
|
"entropy": 6.2166234970092775,
|
|
"epoch": 2.611079053664166,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.000432860008514224,
|
|
"loss": 5.5537,
|
|
"mean_token_accuracy": 0.20784184634685515,
|
|
"num_tokens": 57354729.0,
|
|
"step": 22625
|
|
},
|
|
{
|
|
"entropy": 6.323954248428345,
|
|
"epoch": 2.611656087709175,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004328306020804099,
|
|
"loss": 5.701,
|
|
"mean_token_accuracy": 0.19504350870847703,
|
|
"num_tokens": 57368778.0,
|
|
"step": 22630
|
|
},
|
|
{
|
|
"entropy": 6.238502120971679,
|
|
"epoch": 2.6122331217541834,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00043280119033804184,
|
|
"loss": 5.6654,
|
|
"mean_token_accuracy": 0.2013169050216675,
|
|
"num_tokens": 57382266.0,
|
|
"step": 22635
|
|
},
|
|
{
|
|
"entropy": 6.250040483474732,
|
|
"epoch": 2.6128101557991923,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00043277177328810914,
|
|
"loss": 5.6643,
|
|
"mean_token_accuracy": 0.1974584236741066,
|
|
"num_tokens": 57394127.0,
|
|
"step": 22640
|
|
},
|
|
{
|
|
"entropy": 6.332312345504761,
|
|
"epoch": 2.6133871898442007,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004327423509316012,
|
|
"loss": 5.6688,
|
|
"mean_token_accuracy": 0.1991739809513092,
|
|
"num_tokens": 57405711.0,
|
|
"step": 22645
|
|
},
|
|
{
|
|
"entropy": 6.264088773727417,
|
|
"epoch": 2.6139642238892096,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00043271292326950764,
|
|
"loss": 5.7613,
|
|
"mean_token_accuracy": 0.19248290807008744,
|
|
"num_tokens": 57418603.0,
|
|
"step": 22650
|
|
},
|
|
{
|
|
"entropy": 6.272280979156494,
|
|
"epoch": 2.614541257934218,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004326834903028182,
|
|
"loss": 5.5502,
|
|
"mean_token_accuracy": 0.20965935289859772,
|
|
"num_tokens": 57430582.0,
|
|
"step": 22655
|
|
},
|
|
{
|
|
"entropy": 6.2619311809539795,
|
|
"epoch": 2.615118291979227,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000432654052032523,
|
|
"loss": 5.6241,
|
|
"mean_token_accuracy": 0.207902193069458,
|
|
"num_tokens": 57442592.0,
|
|
"step": 22660
|
|
},
|
|
{
|
|
"entropy": 6.202816152572632,
|
|
"epoch": 2.6156953260242353,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.000432624608459612,
|
|
"loss": 5.6863,
|
|
"mean_token_accuracy": 0.20486091822385788,
|
|
"num_tokens": 57455016.0,
|
|
"step": 22665
|
|
},
|
|
{
|
|
"entropy": 6.267038154602051,
|
|
"epoch": 2.616272360069244,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004325951595850756,
|
|
"loss": 5.6036,
|
|
"mean_token_accuracy": 0.20657484531402587,
|
|
"num_tokens": 57467228.0,
|
|
"step": 22670
|
|
},
|
|
{
|
|
"entropy": 6.221673488616943,
|
|
"epoch": 2.6168493941142525,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00043256570540990425,
|
|
"loss": 5.6217,
|
|
"mean_token_accuracy": 0.20301116406917571,
|
|
"num_tokens": 57479654.0,
|
|
"step": 22675
|
|
},
|
|
{
|
|
"entropy": 6.31744351387024,
|
|
"epoch": 2.6174264281592614,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004325362459350888,
|
|
"loss": 5.7184,
|
|
"mean_token_accuracy": 0.19860568791627883,
|
|
"num_tokens": 57492695.0,
|
|
"step": 22680
|
|
},
|
|
{
|
|
"entropy": 6.299160766601562,
|
|
"epoch": 2.6180034622042703,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00043250678116161985,
|
|
"loss": 5.7515,
|
|
"mean_token_accuracy": 0.19840242266654967,
|
|
"num_tokens": 57504619.0,
|
|
"step": 22685
|
|
},
|
|
{
|
|
"entropy": 6.343087005615234,
|
|
"epoch": 2.6185804962492787,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00043247731109048856,
|
|
"loss": 5.7129,
|
|
"mean_token_accuracy": 0.2044762924313545,
|
|
"num_tokens": 57517141.0,
|
|
"step": 22690
|
|
},
|
|
{
|
|
"entropy": 6.233465623855591,
|
|
"epoch": 2.619157530294287,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004324478357226861,
|
|
"loss": 5.6561,
|
|
"mean_token_accuracy": 0.21039279997348787,
|
|
"num_tokens": 57529759.0,
|
|
"step": 22695
|
|
},
|
|
{
|
|
"entropy": 6.254852676391602,
|
|
"epoch": 2.619734564339296,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00043241835505920405,
|
|
"loss": 5.6131,
|
|
"mean_token_accuracy": 0.20840972810983657,
|
|
"num_tokens": 57542587.0,
|
|
"step": 22700
|
|
},
|
|
{
|
|
"entropy": 6.295852327346802,
|
|
"epoch": 2.620311598384305,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004323888691010337,
|
|
"loss": 5.6756,
|
|
"mean_token_accuracy": 0.20226601958274842,
|
|
"num_tokens": 57554539.0,
|
|
"step": 22705
|
|
},
|
|
{
|
|
"entropy": 6.336152648925781,
|
|
"epoch": 2.6208886324293132,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00043235937784916694,
|
|
"loss": 5.6335,
|
|
"mean_token_accuracy": 0.21046138554811478,
|
|
"num_tokens": 57567436.0,
|
|
"step": 22710
|
|
},
|
|
{
|
|
"entropy": 6.150939273834228,
|
|
"epoch": 2.621465666474322,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00043232988130459567,
|
|
"loss": 5.575,
|
|
"mean_token_accuracy": 0.21034395843744277,
|
|
"num_tokens": 57579656.0,
|
|
"step": 22715
|
|
},
|
|
{
|
|
"entropy": 6.16340184211731,
|
|
"epoch": 2.6220427005193305,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000432300379468312,
|
|
"loss": 5.5711,
|
|
"mean_token_accuracy": 0.21272343397140503,
|
|
"num_tokens": 57591794.0,
|
|
"step": 22720
|
|
},
|
|
{
|
|
"entropy": 6.247255039215088,
|
|
"epoch": 2.6226197345643394,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004322708723413082,
|
|
"loss": 5.6292,
|
|
"mean_token_accuracy": 0.20397938042879105,
|
|
"num_tokens": 57603982.0,
|
|
"step": 22725
|
|
},
|
|
{
|
|
"entropy": 6.327027750015259,
|
|
"epoch": 2.623196768609348,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00043224135992457667,
|
|
"loss": 5.7316,
|
|
"mean_token_accuracy": 0.20336923599243165,
|
|
"num_tokens": 57616769.0,
|
|
"step": 22730
|
|
},
|
|
{
|
|
"entropy": 6.211414194107055,
|
|
"epoch": 2.6237738026543567,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004322118422191102,
|
|
"loss": 5.5889,
|
|
"mean_token_accuracy": 0.21541313976049423,
|
|
"num_tokens": 57628995.0,
|
|
"step": 22735
|
|
},
|
|
{
|
|
"entropy": 6.293388414382934,
|
|
"epoch": 2.6243508366993655,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00043218231922590144,
|
|
"loss": 5.67,
|
|
"mean_token_accuracy": 0.21189197301864623,
|
|
"num_tokens": 57642417.0,
|
|
"step": 22740
|
|
},
|
|
{
|
|
"entropy": 6.17652907371521,
|
|
"epoch": 2.624927870744374,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004321527909459435,
|
|
"loss": 5.4995,
|
|
"mean_token_accuracy": 0.20457690209150314,
|
|
"num_tokens": 57654395.0,
|
|
"step": 22745
|
|
},
|
|
{
|
|
"entropy": 6.278538560867309,
|
|
"epoch": 2.6255049047893824,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00043212325738022946,
|
|
"loss": 5.6971,
|
|
"mean_token_accuracy": 0.20291548520326613,
|
|
"num_tokens": 57667010.0,
|
|
"step": 22750
|
|
},
|
|
{
|
|
"entropy": 6.1786078929901125,
|
|
"epoch": 2.6260819388343912,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004320937185297527,
|
|
"loss": 5.6521,
|
|
"mean_token_accuracy": 0.2073186531662941,
|
|
"num_tokens": 57678726.0,
|
|
"step": 22755
|
|
},
|
|
{
|
|
"entropy": 6.251133775711059,
|
|
"epoch": 2.6266589728794,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00043206417439550684,
|
|
"loss": 5.6846,
|
|
"mean_token_accuracy": 0.21055704951286316,
|
|
"num_tokens": 57692386.0,
|
|
"step": 22760
|
|
},
|
|
{
|
|
"entropy": 6.283049011230469,
|
|
"epoch": 2.6272360069244085,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00043203462497848534,
|
|
"loss": 5.644,
|
|
"mean_token_accuracy": 0.20648513734340668,
|
|
"num_tokens": 57704647.0,
|
|
"step": 22765
|
|
},
|
|
{
|
|
"entropy": 6.207054328918457,
|
|
"epoch": 2.627813040969417,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00043200507027968236,
|
|
"loss": 5.5495,
|
|
"mean_token_accuracy": 0.217336106300354,
|
|
"num_tokens": 57717652.0,
|
|
"step": 22770
|
|
},
|
|
{
|
|
"entropy": 6.298383712768555,
|
|
"epoch": 2.628390075014426,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004319755103000918,
|
|
"loss": 5.6754,
|
|
"mean_token_accuracy": 0.212310691177845,
|
|
"num_tokens": 57730531.0,
|
|
"step": 22775
|
|
},
|
|
{
|
|
"entropy": 6.1505271911621096,
|
|
"epoch": 2.6289671090594346,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004319459450407079,
|
|
"loss": 5.4999,
|
|
"mean_token_accuracy": 0.21630412936210633,
|
|
"num_tokens": 57742627.0,
|
|
"step": 22780
|
|
},
|
|
{
|
|
"entropy": 6.236985588073731,
|
|
"epoch": 2.629544143104443,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00043191637450252514,
|
|
"loss": 5.6695,
|
|
"mean_token_accuracy": 0.20145389437675476,
|
|
"num_tokens": 57755894.0,
|
|
"step": 22785
|
|
},
|
|
{
|
|
"entropy": 6.262485504150391,
|
|
"epoch": 2.630121177149452,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.000431886798686538,
|
|
"loss": 5.6909,
|
|
"mean_token_accuracy": 0.2014373555779457,
|
|
"num_tokens": 57769003.0,
|
|
"step": 22790
|
|
},
|
|
{
|
|
"entropy": 6.245550298690796,
|
|
"epoch": 2.6306982111944603,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004318572175937414,
|
|
"loss": 5.6747,
|
|
"mean_token_accuracy": 0.2051383748650551,
|
|
"num_tokens": 57781230.0,
|
|
"step": 22795
|
|
},
|
|
{
|
|
"entropy": 6.323966646194458,
|
|
"epoch": 2.631275245239469,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004318276312251301,
|
|
"loss": 5.6328,
|
|
"mean_token_accuracy": 0.20099893659353257,
|
|
"num_tokens": 57793167.0,
|
|
"step": 22800
|
|
},
|
|
{
|
|
"entropy": 6.2881913661956785,
|
|
"epoch": 2.6318522792844776,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004317980395816994,
|
|
"loss": 5.6258,
|
|
"mean_token_accuracy": 0.20426172763109207,
|
|
"num_tokens": 57805306.0,
|
|
"step": 22805
|
|
},
|
|
{
|
|
"entropy": 6.1830394744873045,
|
|
"epoch": 2.6324293133294865,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004317684426644445,
|
|
"loss": 5.5704,
|
|
"mean_token_accuracy": 0.21088261306285858,
|
|
"num_tokens": 57818844.0,
|
|
"step": 22810
|
|
},
|
|
{
|
|
"entropy": 6.304635906219483,
|
|
"epoch": 2.6330063473744953,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00043173884047436093,
|
|
"loss": 5.7599,
|
|
"mean_token_accuracy": 0.19517519026994706,
|
|
"num_tokens": 57832017.0,
|
|
"step": 22815
|
|
},
|
|
{
|
|
"entropy": 6.328797817230225,
|
|
"epoch": 2.6335833814195038,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004317092330124443,
|
|
"loss": 5.6917,
|
|
"mean_token_accuracy": 0.2012387380003929,
|
|
"num_tokens": 57844900.0,
|
|
"step": 22820
|
|
},
|
|
{
|
|
"entropy": 6.268989944458008,
|
|
"epoch": 2.634160415464512,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00043167962027969043,
|
|
"loss": 5.6506,
|
|
"mean_token_accuracy": 0.20048178732395172,
|
|
"num_tokens": 57858297.0,
|
|
"step": 22825
|
|
},
|
|
{
|
|
"entropy": 6.284164094924927,
|
|
"epoch": 2.634737449509521,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004316500022770954,
|
|
"loss": 5.6704,
|
|
"mean_token_accuracy": 0.20351176112890243,
|
|
"num_tokens": 57870613.0,
|
|
"step": 22830
|
|
},
|
|
{
|
|
"entropy": 6.301393985748291,
|
|
"epoch": 2.63531448355453,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00043162037900565533,
|
|
"loss": 5.7056,
|
|
"mean_token_accuracy": 0.19776366353034974,
|
|
"num_tokens": 57883991.0,
|
|
"step": 22835
|
|
},
|
|
{
|
|
"entropy": 6.355542469024658,
|
|
"epoch": 2.6358915175995383,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00043159075046636666,
|
|
"loss": 5.7299,
|
|
"mean_token_accuracy": 0.2018307089805603,
|
|
"num_tokens": 57896400.0,
|
|
"step": 22840
|
|
},
|
|
{
|
|
"entropy": 6.214745759963989,
|
|
"epoch": 2.636468551644547,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004315611166602258,
|
|
"loss": 5.6003,
|
|
"mean_token_accuracy": 0.21431663930416106,
|
|
"num_tokens": 57908558.0,
|
|
"step": 22845
|
|
},
|
|
{
|
|
"entropy": 6.154470062255859,
|
|
"epoch": 2.6370455856895556,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00043153147758822957,
|
|
"loss": 5.5719,
|
|
"mean_token_accuracy": 0.20363485664129258,
|
|
"num_tokens": 57922312.0,
|
|
"step": 22850
|
|
},
|
|
{
|
|
"entropy": 6.278415203094482,
|
|
"epoch": 2.6376226197345645,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004315018332513749,
|
|
"loss": 5.5829,
|
|
"mean_token_accuracy": 0.21154605448246003,
|
|
"num_tokens": 57934406.0,
|
|
"step": 22855
|
|
},
|
|
{
|
|
"entropy": 6.30584683418274,
|
|
"epoch": 2.638199653779573,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004314721836506587,
|
|
"loss": 5.71,
|
|
"mean_token_accuracy": 0.2009185791015625,
|
|
"num_tokens": 57946854.0,
|
|
"step": 22860
|
|
},
|
|
{
|
|
"entropy": 6.282307863235474,
|
|
"epoch": 2.6387766878245817,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00043144252878707845,
|
|
"loss": 5.7605,
|
|
"mean_token_accuracy": 0.1999088540673256,
|
|
"num_tokens": 57959075.0,
|
|
"step": 22865
|
|
},
|
|
{
|
|
"entropy": 6.193558835983277,
|
|
"epoch": 2.63935372186959,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004314128686616314,
|
|
"loss": 5.5549,
|
|
"mean_token_accuracy": 0.21254508793354035,
|
|
"num_tokens": 57970501.0,
|
|
"step": 22870
|
|
},
|
|
{
|
|
"entropy": 6.232211923599243,
|
|
"epoch": 2.639930755914599,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004313832032753152,
|
|
"loss": 5.5784,
|
|
"mean_token_accuracy": 0.21439823657274246,
|
|
"num_tokens": 57983683.0,
|
|
"step": 22875
|
|
},
|
|
{
|
|
"entropy": 6.302011585235595,
|
|
"epoch": 2.6405077899596074,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00043135353262912764,
|
|
"loss": 5.6673,
|
|
"mean_token_accuracy": 0.20713330209255218,
|
|
"num_tokens": 57997603.0,
|
|
"step": 22880
|
|
},
|
|
{
|
|
"entropy": 6.353400325775146,
|
|
"epoch": 2.6410848240046163,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00043132385672406664,
|
|
"loss": 5.7894,
|
|
"mean_token_accuracy": 0.19122136980295182,
|
|
"num_tokens": 58010225.0,
|
|
"step": 22885
|
|
},
|
|
{
|
|
"entropy": 6.2074424743652346,
|
|
"epoch": 2.641661858049625,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004312941755611305,
|
|
"loss": 5.5631,
|
|
"mean_token_accuracy": 0.21678799986839295,
|
|
"num_tokens": 58023581.0,
|
|
"step": 22890
|
|
},
|
|
{
|
|
"entropy": 6.299075794219971,
|
|
"epoch": 2.6422388920946336,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043126448914131724,
|
|
"loss": 5.7034,
|
|
"mean_token_accuracy": 0.19979101568460464,
|
|
"num_tokens": 58035508.0,
|
|
"step": 22895
|
|
},
|
|
{
|
|
"entropy": 6.314969825744629,
|
|
"epoch": 2.642815926139642,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004312347974656256,
|
|
"loss": 5.6694,
|
|
"mean_token_accuracy": 0.20162132978439332,
|
|
"num_tokens": 58046762.0,
|
|
"step": 22900
|
|
},
|
|
{
|
|
"entropy": 6.291796875,
|
|
"epoch": 2.643392960184651,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004312051005350541,
|
|
"loss": 5.739,
|
|
"mean_token_accuracy": 0.20134472101926804,
|
|
"num_tokens": 58059626.0,
|
|
"step": 22905
|
|
},
|
|
{
|
|
"entropy": 6.242621660232544,
|
|
"epoch": 2.6439699942296597,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00043117539835060164,
|
|
"loss": 5.6098,
|
|
"mean_token_accuracy": 0.21246901154518127,
|
|
"num_tokens": 58073482.0,
|
|
"step": 22910
|
|
},
|
|
{
|
|
"entropy": 6.248900032043457,
|
|
"epoch": 2.644547028274668,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004311456909132673,
|
|
"loss": 5.66,
|
|
"mean_token_accuracy": 0.20471634864807128,
|
|
"num_tokens": 58086375.0,
|
|
"step": 22915
|
|
},
|
|
{
|
|
"entropy": 6.377197265625,
|
|
"epoch": 2.645124062319677,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004311159782240502,
|
|
"loss": 5.7129,
|
|
"mean_token_accuracy": 0.19768913239240646,
|
|
"num_tokens": 58097953.0,
|
|
"step": 22920
|
|
},
|
|
{
|
|
"entropy": 6.271704053878784,
|
|
"epoch": 2.6457010963646854,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004310862602839496,
|
|
"loss": 5.6685,
|
|
"mean_token_accuracy": 0.21075234413146973,
|
|
"num_tokens": 58109602.0,
|
|
"step": 22925
|
|
},
|
|
{
|
|
"entropy": 6.12292594909668,
|
|
"epoch": 2.6462781304096943,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004310565370939653,
|
|
"loss": 5.5783,
|
|
"mean_token_accuracy": 0.21067596077919007,
|
|
"num_tokens": 58123033.0,
|
|
"step": 22930
|
|
},
|
|
{
|
|
"entropy": 6.271344995498657,
|
|
"epoch": 2.6468551644547027,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00043102680865509687,
|
|
"loss": 5.7176,
|
|
"mean_token_accuracy": 0.1978677123785019,
|
|
"num_tokens": 58135629.0,
|
|
"step": 22935
|
|
},
|
|
{
|
|
"entropy": 6.319137811660767,
|
|
"epoch": 2.6474321984997116,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004309970749683442,
|
|
"loss": 5.6748,
|
|
"mean_token_accuracy": 0.19844325482845307,
|
|
"num_tokens": 58149178.0,
|
|
"step": 22940
|
|
},
|
|
{
|
|
"entropy": 6.237157869338989,
|
|
"epoch": 2.64800923254472,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00043096733603470737,
|
|
"loss": 5.5979,
|
|
"mean_token_accuracy": 0.20821484178304672,
|
|
"num_tokens": 58160752.0,
|
|
"step": 22945
|
|
},
|
|
{
|
|
"entropy": 6.297159481048584,
|
|
"epoch": 2.648586266589729,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00043093759185518677,
|
|
"loss": 5.7428,
|
|
"mean_token_accuracy": 0.19882768392562866,
|
|
"num_tokens": 58174680.0,
|
|
"step": 22950
|
|
},
|
|
{
|
|
"entropy": 6.314711475372315,
|
|
"epoch": 2.6491633006347373,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00043090784243078264,
|
|
"loss": 5.7161,
|
|
"mean_token_accuracy": 0.2027699589729309,
|
|
"num_tokens": 58186945.0,
|
|
"step": 22955
|
|
},
|
|
{
|
|
"entropy": 6.330440807342529,
|
|
"epoch": 2.649740334679746,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004308780877624957,
|
|
"loss": 5.6728,
|
|
"mean_token_accuracy": 0.2026678666472435,
|
|
"num_tokens": 58198940.0,
|
|
"step": 22960
|
|
},
|
|
{
|
|
"entropy": 6.291716527938843,
|
|
"epoch": 2.650317368724755,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004308483278513267,
|
|
"loss": 5.7107,
|
|
"mean_token_accuracy": 0.2002701297402382,
|
|
"num_tokens": 58212778.0,
|
|
"step": 22965
|
|
},
|
|
{
|
|
"entropy": 6.258058977127075,
|
|
"epoch": 2.6508944027697634,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00043081856269827656,
|
|
"loss": 5.665,
|
|
"mean_token_accuracy": 0.20611117035150528,
|
|
"num_tokens": 58225378.0,
|
|
"step": 22970
|
|
},
|
|
{
|
|
"entropy": 6.27512264251709,
|
|
"epoch": 2.651471436814772,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004307887923043465,
|
|
"loss": 5.6337,
|
|
"mean_token_accuracy": 0.21207512319087982,
|
|
"num_tokens": 58238012.0,
|
|
"step": 22975
|
|
},
|
|
{
|
|
"entropy": 6.353584337234497,
|
|
"epoch": 2.6520484708597807,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004307590166705379,
|
|
"loss": 5.784,
|
|
"mean_token_accuracy": 0.1949862241744995,
|
|
"num_tokens": 58250527.0,
|
|
"step": 22980
|
|
},
|
|
{
|
|
"entropy": 6.275035572052002,
|
|
"epoch": 2.6526255049047895,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00043072923579785203,
|
|
"loss": 5.62,
|
|
"mean_token_accuracy": 0.2094905972480774,
|
|
"num_tokens": 58262805.0,
|
|
"step": 22985
|
|
},
|
|
{
|
|
"entropy": 6.314037179946899,
|
|
"epoch": 2.653202538949798,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004306994496872907,
|
|
"loss": 5.7358,
|
|
"mean_token_accuracy": 0.2017763674259186,
|
|
"num_tokens": 58275622.0,
|
|
"step": 22990
|
|
},
|
|
{
|
|
"entropy": 6.248733568191528,
|
|
"epoch": 2.653779572994807,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00043066965833985567,
|
|
"loss": 5.7132,
|
|
"mean_token_accuracy": 0.20611511319875717,
|
|
"num_tokens": 58288505.0,
|
|
"step": 22995
|
|
},
|
|
{
|
|
"entropy": 6.28912672996521,
|
|
"epoch": 2.6543566070398152,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00043063986175654906,
|
|
"loss": 5.6163,
|
|
"mean_token_accuracy": 0.20809512436389924,
|
|
"num_tokens": 58301083.0,
|
|
"step": 23000
|
|
},
|
|
{
|
|
"entropy": 6.267097139358521,
|
|
"epoch": 2.654933641084824,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00043061005993837306,
|
|
"loss": 5.5804,
|
|
"mean_token_accuracy": 0.21096228212118148,
|
|
"num_tokens": 58313494.0,
|
|
"step": 23005
|
|
},
|
|
{
|
|
"entropy": 6.218910360336304,
|
|
"epoch": 2.6555106751298325,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00043058025288632995,
|
|
"loss": 5.6464,
|
|
"mean_token_accuracy": 0.2139564037322998,
|
|
"num_tokens": 58327350.0,
|
|
"step": 23010
|
|
},
|
|
{
|
|
"entropy": 6.296138858795166,
|
|
"epoch": 2.6560877091748414,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00043055044060142224,
|
|
"loss": 5.7018,
|
|
"mean_token_accuracy": 0.20362894833087922,
|
|
"num_tokens": 58340664.0,
|
|
"step": 23015
|
|
},
|
|
{
|
|
"entropy": 6.2510560035705565,
|
|
"epoch": 2.6566647432198502,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00043052062308465277,
|
|
"loss": 5.6334,
|
|
"mean_token_accuracy": 0.20036092549562454,
|
|
"num_tokens": 58353461.0,
|
|
"step": 23020
|
|
},
|
|
{
|
|
"entropy": 6.2866783618927,
|
|
"epoch": 2.6572417772648587,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004304908003370244,
|
|
"loss": 5.678,
|
|
"mean_token_accuracy": 0.20230236947536467,
|
|
"num_tokens": 58366872.0,
|
|
"step": 23025
|
|
},
|
|
{
|
|
"entropy": 6.293186187744141,
|
|
"epoch": 2.657818811309867,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00043046097235954024,
|
|
"loss": 5.6571,
|
|
"mean_token_accuracy": 0.2049702823162079,
|
|
"num_tokens": 58378587.0,
|
|
"step": 23030
|
|
},
|
|
{
|
|
"entropy": 6.235872220993042,
|
|
"epoch": 2.658395845354876,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00043043113915320345,
|
|
"loss": 5.6077,
|
|
"mean_token_accuracy": 0.2042545422911644,
|
|
"num_tokens": 58390368.0,
|
|
"step": 23035
|
|
},
|
|
{
|
|
"entropy": 6.259229373931885,
|
|
"epoch": 2.658972879399885,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00043040130071901747,
|
|
"loss": 5.6922,
|
|
"mean_token_accuracy": 0.2030926451086998,
|
|
"num_tokens": 58403803.0,
|
|
"step": 23040
|
|
},
|
|
{
|
|
"entropy": 6.328202247619629,
|
|
"epoch": 2.659549913444893,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00043037145705798605,
|
|
"loss": 5.7047,
|
|
"mean_token_accuracy": 0.20516854673624038,
|
|
"num_tokens": 58416819.0,
|
|
"step": 23045
|
|
},
|
|
{
|
|
"entropy": 6.274123859405518,
|
|
"epoch": 2.6601269474899016,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00043034160817111275,
|
|
"loss": 5.6676,
|
|
"mean_token_accuracy": 0.20921874344348906,
|
|
"num_tokens": 58428681.0,
|
|
"step": 23050
|
|
},
|
|
{
|
|
"entropy": 6.275136852264405,
|
|
"epoch": 2.6607039815349105,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00043031175405940157,
|
|
"loss": 5.6858,
|
|
"mean_token_accuracy": 0.20518484711647034,
|
|
"num_tokens": 58440235.0,
|
|
"step": 23055
|
|
},
|
|
{
|
|
"entropy": 6.312169122695923,
|
|
"epoch": 2.6612810155799194,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004302818947238568,
|
|
"loss": 5.6967,
|
|
"mean_token_accuracy": 0.2041396901011467,
|
|
"num_tokens": 58452547.0,
|
|
"step": 23060
|
|
},
|
|
{
|
|
"entropy": 6.220282793045044,
|
|
"epoch": 2.661858049624928,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00043025203016548263,
|
|
"loss": 5.5714,
|
|
"mean_token_accuracy": 0.2108326017856598,
|
|
"num_tokens": 58466683.0,
|
|
"step": 23065
|
|
},
|
|
{
|
|
"entropy": 6.225747060775757,
|
|
"epoch": 2.6624350836699366,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00043022216038528347,
|
|
"loss": 5.6824,
|
|
"mean_token_accuracy": 0.20147724449634552,
|
|
"num_tokens": 58480353.0,
|
|
"step": 23070
|
|
},
|
|
{
|
|
"entropy": 6.287279987335205,
|
|
"epoch": 2.663012117714945,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00043019228538426416,
|
|
"loss": 5.6474,
|
|
"mean_token_accuracy": 0.21137156337499619,
|
|
"num_tokens": 58493213.0,
|
|
"step": 23075
|
|
},
|
|
{
|
|
"entropy": 6.279957628250122,
|
|
"epoch": 2.663589151759954,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00043016240516342933,
|
|
"loss": 5.7345,
|
|
"mean_token_accuracy": 0.19688349962234497,
|
|
"num_tokens": 58505386.0,
|
|
"step": 23080
|
|
},
|
|
{
|
|
"entropy": 6.256546258926392,
|
|
"epoch": 2.6641661858049623,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00043013251972378404,
|
|
"loss": 5.6466,
|
|
"mean_token_accuracy": 0.2033926010131836,
|
|
"num_tokens": 58518067.0,
|
|
"step": 23085
|
|
},
|
|
{
|
|
"entropy": 6.247279357910156,
|
|
"epoch": 2.664743219849971,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00043010262906633355,
|
|
"loss": 5.7076,
|
|
"mean_token_accuracy": 0.20013732314109803,
|
|
"num_tokens": 58532138.0,
|
|
"step": 23090
|
|
},
|
|
{
|
|
"entropy": 6.298268747329712,
|
|
"epoch": 2.66532025389498,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00043007273319208326,
|
|
"loss": 5.6962,
|
|
"mean_token_accuracy": 0.20593311488628388,
|
|
"num_tokens": 58546464.0,
|
|
"step": 23095
|
|
},
|
|
{
|
|
"entropy": 6.349994087219239,
|
|
"epoch": 2.6658972879399885,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004300428321020385,
|
|
"loss": 5.7186,
|
|
"mean_token_accuracy": 0.19804898053407669,
|
|
"num_tokens": 58559463.0,
|
|
"step": 23100
|
|
},
|
|
{
|
|
"entropy": 6.356606721878052,
|
|
"epoch": 2.666474321984997,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00043001292579720514,
|
|
"loss": 5.7467,
|
|
"mean_token_accuracy": 0.2000097006559372,
|
|
"num_tokens": 58572125.0,
|
|
"step": 23105
|
|
},
|
|
{
|
|
"entropy": 6.19702000617981,
|
|
"epoch": 2.6670513560300058,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.000429983014278589,
|
|
"loss": 5.5854,
|
|
"mean_token_accuracy": 0.21476079374551774,
|
|
"num_tokens": 58585312.0,
|
|
"step": 23110
|
|
},
|
|
{
|
|
"entropy": 6.254775333404541,
|
|
"epoch": 2.6676283900750146,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004299530975471962,
|
|
"loss": 5.6161,
|
|
"mean_token_accuracy": 0.20645468682050705,
|
|
"num_tokens": 58598006.0,
|
|
"step": 23115
|
|
},
|
|
{
|
|
"entropy": 6.220469188690186,
|
|
"epoch": 2.668205424120023,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004299231756040329,
|
|
"loss": 5.6383,
|
|
"mean_token_accuracy": 0.2015657216310501,
|
|
"num_tokens": 58609741.0,
|
|
"step": 23120
|
|
},
|
|
{
|
|
"entropy": 6.251720333099366,
|
|
"epoch": 2.668782458165032,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004298932484501055,
|
|
"loss": 5.6401,
|
|
"mean_token_accuracy": 0.20331525802612305,
|
|
"num_tokens": 58623076.0,
|
|
"step": 23125
|
|
},
|
|
{
|
|
"entropy": 6.292484331130981,
|
|
"epoch": 2.6693594922100403,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00042986331608642076,
|
|
"loss": 5.6964,
|
|
"mean_token_accuracy": 0.20706587731838227,
|
|
"num_tokens": 58634558.0,
|
|
"step": 23130
|
|
},
|
|
{
|
|
"entropy": 6.139598417282104,
|
|
"epoch": 2.669936526255049,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00042983337851398525,
|
|
"loss": 5.6088,
|
|
"mean_token_accuracy": 0.21362140476703645,
|
|
"num_tokens": 58647305.0,
|
|
"step": 23135
|
|
},
|
|
{
|
|
"entropy": 6.308789682388306,
|
|
"epoch": 2.6705135603000576,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00042980343573380595,
|
|
"loss": 5.6655,
|
|
"mean_token_accuracy": 0.20182024091482162,
|
|
"num_tokens": 58659723.0,
|
|
"step": 23140
|
|
},
|
|
{
|
|
"entropy": 6.26707820892334,
|
|
"epoch": 2.6710905943450665,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00042977348774688996,
|
|
"loss": 5.7175,
|
|
"mean_token_accuracy": 0.2077040433883667,
|
|
"num_tokens": 58670932.0,
|
|
"step": 23145
|
|
},
|
|
{
|
|
"entropy": 6.307320547103882,
|
|
"epoch": 2.671667628390075,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004297435345542445,
|
|
"loss": 5.6992,
|
|
"mean_token_accuracy": 0.19667290151119232,
|
|
"num_tokens": 58682337.0,
|
|
"step": 23150
|
|
},
|
|
{
|
|
"entropy": 6.30943489074707,
|
|
"epoch": 2.6722446624350837,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004297135761568773,
|
|
"loss": 5.6671,
|
|
"mean_token_accuracy": 0.2028686672449112,
|
|
"num_tokens": 58694667.0,
|
|
"step": 23155
|
|
},
|
|
{
|
|
"entropy": 6.235695505142212,
|
|
"epoch": 2.672821696480092,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00042968361255579573,
|
|
"loss": 5.6743,
|
|
"mean_token_accuracy": 0.20561211854219436,
|
|
"num_tokens": 58707478.0,
|
|
"step": 23160
|
|
},
|
|
{
|
|
"entropy": 6.275328350067139,
|
|
"epoch": 2.673398730525101,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00042965364375200765,
|
|
"loss": 5.6357,
|
|
"mean_token_accuracy": 0.20758238285779954,
|
|
"num_tokens": 58720660.0,
|
|
"step": 23165
|
|
},
|
|
{
|
|
"entropy": 6.274713230133057,
|
|
"epoch": 2.67397576457011,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004296236697465212,
|
|
"loss": 5.6245,
|
|
"mean_token_accuracy": 0.20462825149297714,
|
|
"num_tokens": 58732835.0,
|
|
"step": 23170
|
|
},
|
|
{
|
|
"entropy": 6.254044485092163,
|
|
"epoch": 2.6745527986151183,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004295936905403444,
|
|
"loss": 5.6496,
|
|
"mean_token_accuracy": 0.2025674521923065,
|
|
"num_tokens": 58745432.0,
|
|
"step": 23175
|
|
},
|
|
{
|
|
"entropy": 6.217653846740722,
|
|
"epoch": 2.6751298326601267,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004295637061344855,
|
|
"loss": 5.6051,
|
|
"mean_token_accuracy": 0.21028079241514205,
|
|
"num_tokens": 58758837.0,
|
|
"step": 23180
|
|
},
|
|
{
|
|
"entropy": 6.229355716705323,
|
|
"epoch": 2.6757068667051356,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004295337165299532,
|
|
"loss": 5.5746,
|
|
"mean_token_accuracy": 0.20917143821716308,
|
|
"num_tokens": 58772347.0,
|
|
"step": 23185
|
|
},
|
|
{
|
|
"entropy": 6.266680431365967,
|
|
"epoch": 2.6762839007501444,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00042950372172775614,
|
|
"loss": 5.6672,
|
|
"mean_token_accuracy": 0.19717866480350493,
|
|
"num_tokens": 58784278.0,
|
|
"step": 23190
|
|
},
|
|
{
|
|
"entropy": 6.246124410629273,
|
|
"epoch": 2.676860934795153,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.000429473721728903,
|
|
"loss": 5.6171,
|
|
"mean_token_accuracy": 0.20709141939878464,
|
|
"num_tokens": 58795788.0,
|
|
"step": 23195
|
|
},
|
|
{
|
|
"entropy": 6.312361192703247,
|
|
"epoch": 2.6774379688401617,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004294437165344031,
|
|
"loss": 5.6419,
|
|
"mean_token_accuracy": 0.20924709588289261,
|
|
"num_tokens": 58808394.0,
|
|
"step": 23200
|
|
},
|
|
{
|
|
"entropy": 6.264779949188233,
|
|
"epoch": 2.67801500288517,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00042941370614526554,
|
|
"loss": 5.6509,
|
|
"mean_token_accuracy": 0.20569271296262742,
|
|
"num_tokens": 58819570.0,
|
|
"step": 23205
|
|
},
|
|
{
|
|
"entropy": 6.244002771377564,
|
|
"epoch": 2.678592036930179,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004293836905624996,
|
|
"loss": 5.6884,
|
|
"mean_token_accuracy": 0.20581271946430207,
|
|
"num_tokens": 58831049.0,
|
|
"step": 23210
|
|
},
|
|
{
|
|
"entropy": 6.363770866394043,
|
|
"epoch": 2.6791690709751874,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00042935366978711487,
|
|
"loss": 5.781,
|
|
"mean_token_accuracy": 0.19009294360876083,
|
|
"num_tokens": 58844753.0,
|
|
"step": 23215
|
|
},
|
|
{
|
|
"entropy": 6.262354230880737,
|
|
"epoch": 2.6797461050201963,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00042932364382012125,
|
|
"loss": 5.6575,
|
|
"mean_token_accuracy": 0.20529476851224898,
|
|
"num_tokens": 58856796.0,
|
|
"step": 23220
|
|
},
|
|
{
|
|
"entropy": 6.3362815380096436,
|
|
"epoch": 2.6803231390652047,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00042929361266252843,
|
|
"loss": 5.7056,
|
|
"mean_token_accuracy": 0.20687489211559296,
|
|
"num_tokens": 58869046.0,
|
|
"step": 23225
|
|
},
|
|
{
|
|
"entropy": 6.28935055732727,
|
|
"epoch": 2.6809001731102136,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004292635763153466,
|
|
"loss": 5.697,
|
|
"mean_token_accuracy": 0.19666288197040557,
|
|
"num_tokens": 58880993.0,
|
|
"step": 23230
|
|
},
|
|
{
|
|
"entropy": 6.31868257522583,
|
|
"epoch": 2.681477207155222,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00042923353477958607,
|
|
"loss": 5.6548,
|
|
"mean_token_accuracy": 0.2014218583703041,
|
|
"num_tokens": 58893519.0,
|
|
"step": 23235
|
|
},
|
|
{
|
|
"entropy": 6.271314239501953,
|
|
"epoch": 2.682054241200231,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00042920348805625716,
|
|
"loss": 5.6468,
|
|
"mean_token_accuracy": 0.2041264072060585,
|
|
"num_tokens": 58905904.0,
|
|
"step": 23240
|
|
},
|
|
{
|
|
"entropy": 6.26501202583313,
|
|
"epoch": 2.6826312752452397,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00042917343614637057,
|
|
"loss": 5.6673,
|
|
"mean_token_accuracy": 0.21047159135341645,
|
|
"num_tokens": 58918271.0,
|
|
"step": 23245
|
|
},
|
|
{
|
|
"entropy": 6.323797702789307,
|
|
"epoch": 2.683208309290248,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00042914337905093695,
|
|
"loss": 5.6914,
|
|
"mean_token_accuracy": 0.19798275977373123,
|
|
"num_tokens": 58930381.0,
|
|
"step": 23250
|
|
},
|
|
{
|
|
"entropy": 6.304523134231568,
|
|
"epoch": 2.6837853433352565,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004291133167709674,
|
|
"loss": 5.563,
|
|
"mean_token_accuracy": 0.20906126499176025,
|
|
"num_tokens": 58942506.0,
|
|
"step": 23255
|
|
},
|
|
{
|
|
"entropy": 6.238390254974365,
|
|
"epoch": 2.6843623773802654,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00042908324930747297,
|
|
"loss": 5.7296,
|
|
"mean_token_accuracy": 0.19948620647192,
|
|
"num_tokens": 58954383.0,
|
|
"step": 23260
|
|
},
|
|
{
|
|
"entropy": 6.302935314178467,
|
|
"epoch": 2.6849394114252743,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00042905317666146496,
|
|
"loss": 5.7804,
|
|
"mean_token_accuracy": 0.19750493615865708,
|
|
"num_tokens": 58967110.0,
|
|
"step": 23265
|
|
},
|
|
{
|
|
"entropy": 6.325434780120849,
|
|
"epoch": 2.6855164454702827,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00042902309883395497,
|
|
"loss": 5.6191,
|
|
"mean_token_accuracy": 0.20996397882699966,
|
|
"num_tokens": 58980314.0,
|
|
"step": 23270
|
|
},
|
|
{
|
|
"entropy": 6.29250955581665,
|
|
"epoch": 2.6860934795152915,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004289930158259545,
|
|
"loss": 5.7363,
|
|
"mean_token_accuracy": 0.1980000615119934,
|
|
"num_tokens": 58993544.0,
|
|
"step": 23275
|
|
},
|
|
{
|
|
"entropy": 6.293111515045166,
|
|
"epoch": 2.6866705135603,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00042896292763847544,
|
|
"loss": 5.6871,
|
|
"mean_token_accuracy": 0.21700167059898376,
|
|
"num_tokens": 59006043.0,
|
|
"step": 23280
|
|
},
|
|
{
|
|
"entropy": 6.326320219039917,
|
|
"epoch": 2.687247547605309,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00042893283427252984,
|
|
"loss": 5.7065,
|
|
"mean_token_accuracy": 0.20482681542634965,
|
|
"num_tokens": 59018691.0,
|
|
"step": 23285
|
|
},
|
|
{
|
|
"entropy": 6.257688999176025,
|
|
"epoch": 2.6878245816503172,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004289027357291297,
|
|
"loss": 5.6764,
|
|
"mean_token_accuracy": 0.20068340748548508,
|
|
"num_tokens": 59031493.0,
|
|
"step": 23290
|
|
},
|
|
{
|
|
"entropy": 6.149775600433349,
|
|
"epoch": 2.688401615695326,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004288726320092876,
|
|
"loss": 5.5325,
|
|
"mean_token_accuracy": 0.21733584702014924,
|
|
"num_tokens": 59045464.0,
|
|
"step": 23295
|
|
},
|
|
{
|
|
"entropy": 6.340857601165771,
|
|
"epoch": 2.6889786497403345,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004288425231140159,
|
|
"loss": 5.6418,
|
|
"mean_token_accuracy": 0.2090865731239319,
|
|
"num_tokens": 59057391.0,
|
|
"step": 23300
|
|
},
|
|
{
|
|
"entropy": 6.16346697807312,
|
|
"epoch": 2.6895556837853434,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00042881240904432737,
|
|
"loss": 5.485,
|
|
"mean_token_accuracy": 0.22404691725969314,
|
|
"num_tokens": 59070175.0,
|
|
"step": 23305
|
|
},
|
|
{
|
|
"entropy": 6.243716669082642,
|
|
"epoch": 2.690132717830352,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004287822898012348,
|
|
"loss": 5.6631,
|
|
"mean_token_accuracy": 0.2095588833093643,
|
|
"num_tokens": 59083605.0,
|
|
"step": 23310
|
|
},
|
|
{
|
|
"entropy": 6.2253077030181885,
|
|
"epoch": 2.6907097518753607,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004287521653857514,
|
|
"loss": 5.6054,
|
|
"mean_token_accuracy": 0.21301105469465256,
|
|
"num_tokens": 59095799.0,
|
|
"step": 23315
|
|
},
|
|
{
|
|
"entropy": 6.264061689376831,
|
|
"epoch": 2.6912867859203695,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00042872203579889025,
|
|
"loss": 5.6543,
|
|
"mean_token_accuracy": 0.20737292021512985,
|
|
"num_tokens": 59109982.0,
|
|
"step": 23320
|
|
},
|
|
{
|
|
"entropy": 6.3398514747619625,
|
|
"epoch": 2.691863819965378,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00042869190104166476,
|
|
"loss": 5.7354,
|
|
"mean_token_accuracy": 0.19639517962932587,
|
|
"num_tokens": 59122478.0,
|
|
"step": 23325
|
|
},
|
|
{
|
|
"entropy": 6.295503187179565,
|
|
"epoch": 2.6924408540103864,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004286617611150886,
|
|
"loss": 5.6999,
|
|
"mean_token_accuracy": 0.20524403899908067,
|
|
"num_tokens": 59134342.0,
|
|
"step": 23330
|
|
},
|
|
{
|
|
"entropy": 6.33144474029541,
|
|
"epoch": 2.693017888055395,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00042863161602017536,
|
|
"loss": 5.7349,
|
|
"mean_token_accuracy": 0.19833346754312514,
|
|
"num_tokens": 59146628.0,
|
|
"step": 23335
|
|
},
|
|
{
|
|
"entropy": 6.211947345733643,
|
|
"epoch": 2.693594922100404,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004286014657579391,
|
|
"loss": 5.5898,
|
|
"mean_token_accuracy": 0.21698537915945054,
|
|
"num_tokens": 59160043.0,
|
|
"step": 23340
|
|
},
|
|
{
|
|
"entropy": 6.291817855834961,
|
|
"epoch": 2.6941719561454125,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004285713103293938,
|
|
"loss": 5.7023,
|
|
"mean_token_accuracy": 0.19340800791978835,
|
|
"num_tokens": 59173710.0,
|
|
"step": 23345
|
|
},
|
|
{
|
|
"entropy": 6.266803407669068,
|
|
"epoch": 2.6947489901904214,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004285411497355537,
|
|
"loss": 5.6119,
|
|
"mean_token_accuracy": 0.20450152307748795,
|
|
"num_tokens": 59186069.0,
|
|
"step": 23350
|
|
},
|
|
{
|
|
"entropy": 6.28459939956665,
|
|
"epoch": 2.6953260242354298,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00042851098397743334,
|
|
"loss": 5.702,
|
|
"mean_token_accuracy": 0.20162524729967118,
|
|
"num_tokens": 59199305.0,
|
|
"step": 23355
|
|
},
|
|
{
|
|
"entropy": 6.2840124607086185,
|
|
"epoch": 2.6959030582804386,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004284808130560473,
|
|
"loss": 5.6151,
|
|
"mean_token_accuracy": 0.20331996381282808,
|
|
"num_tokens": 59212135.0,
|
|
"step": 23360
|
|
},
|
|
{
|
|
"entropy": 6.260687160491943,
|
|
"epoch": 2.696480092325447,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.00042845063697241034,
|
|
"loss": 5.6328,
|
|
"mean_token_accuracy": 0.21078159511089326,
|
|
"num_tokens": 59226651.0,
|
|
"step": 23365
|
|
},
|
|
{
|
|
"entropy": 6.266849708557129,
|
|
"epoch": 2.697057126370456,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004284204557275374,
|
|
"loss": 5.6909,
|
|
"mean_token_accuracy": 0.1944417104125023,
|
|
"num_tokens": 59238630.0,
|
|
"step": 23370
|
|
},
|
|
{
|
|
"entropy": 6.279628562927246,
|
|
"epoch": 2.6976341604154648,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004283902693224437,
|
|
"loss": 5.6558,
|
|
"mean_token_accuracy": 0.2056453973054886,
|
|
"num_tokens": 59251465.0,
|
|
"step": 23375
|
|
},
|
|
{
|
|
"entropy": 6.245777320861817,
|
|
"epoch": 2.698211194460473,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00042836007775814446,
|
|
"loss": 5.6277,
|
|
"mean_token_accuracy": 0.2122541829943657,
|
|
"num_tokens": 59264058.0,
|
|
"step": 23380
|
|
},
|
|
{
|
|
"entropy": 6.208443832397461,
|
|
"epoch": 2.6987882285054816,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004283298810356551,
|
|
"loss": 5.5731,
|
|
"mean_token_accuracy": 0.20889013707637788,
|
|
"num_tokens": 59276937.0,
|
|
"step": 23385
|
|
},
|
|
{
|
|
"entropy": 6.251581239700317,
|
|
"epoch": 2.6993652625504905,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004282996791559914,
|
|
"loss": 5.6631,
|
|
"mean_token_accuracy": 0.20480236262083054,
|
|
"num_tokens": 59288747.0,
|
|
"step": 23390
|
|
},
|
|
{
|
|
"entropy": 6.272038221359253,
|
|
"epoch": 2.6999422965954993,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00042826947212016924,
|
|
"loss": 5.6577,
|
|
"mean_token_accuracy": 0.20462431609630585,
|
|
"num_tokens": 59301690.0,
|
|
"step": 23395
|
|
},
|
|
{
|
|
"entropy": 6.247110033035279,
|
|
"epoch": 2.7005193306405078,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004282392599292045,
|
|
"loss": 5.6028,
|
|
"mean_token_accuracy": 0.20915947556495668,
|
|
"num_tokens": 59312964.0,
|
|
"step": 23400
|
|
},
|
|
{
|
|
"entropy": 6.298863124847412,
|
|
"epoch": 2.701096364685516,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004282090425841133,
|
|
"loss": 5.7446,
|
|
"mean_token_accuracy": 0.19965172708034515,
|
|
"num_tokens": 59325242.0,
|
|
"step": 23405
|
|
},
|
|
{
|
|
"entropy": 6.264981603622436,
|
|
"epoch": 2.701673398730525,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004281788200859121,
|
|
"loss": 5.6687,
|
|
"mean_token_accuracy": 0.20080586522817612,
|
|
"num_tokens": 59337877.0,
|
|
"step": 23410
|
|
},
|
|
{
|
|
"entropy": 6.311196041107178,
|
|
"epoch": 2.702250432775534,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00042814859243561727,
|
|
"loss": 5.6762,
|
|
"mean_token_accuracy": 0.20247143059968947,
|
|
"num_tokens": 59349757.0,
|
|
"step": 23415
|
|
},
|
|
{
|
|
"entropy": 6.231512641906738,
|
|
"epoch": 2.7028274668205423,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00042811835963424573,
|
|
"loss": 5.6043,
|
|
"mean_token_accuracy": 0.20845805406570433,
|
|
"num_tokens": 59364268.0,
|
|
"step": 23420
|
|
},
|
|
{
|
|
"entropy": 6.310456562042236,
|
|
"epoch": 2.703404500865551,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00042808812168281413,
|
|
"loss": 5.7325,
|
|
"mean_token_accuracy": 0.19985125064849854,
|
|
"num_tokens": 59376896.0,
|
|
"step": 23425
|
|
},
|
|
{
|
|
"entropy": 6.317259025573731,
|
|
"epoch": 2.7039815349105596,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00042805787858233966,
|
|
"loss": 5.6996,
|
|
"mean_token_accuracy": 0.20080113261938096,
|
|
"num_tokens": 59390905.0,
|
|
"step": 23430
|
|
},
|
|
{
|
|
"entropy": 6.236316204071045,
|
|
"epoch": 2.7045585689555685,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004280276303338395,
|
|
"loss": 5.6251,
|
|
"mean_token_accuracy": 0.2090424567461014,
|
|
"num_tokens": 59403896.0,
|
|
"step": 23435
|
|
},
|
|
{
|
|
"entropy": 6.261244630813598,
|
|
"epoch": 2.705135603000577,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.000427997376938331,
|
|
"loss": 5.6078,
|
|
"mean_token_accuracy": 0.20800320357084273,
|
|
"num_tokens": 59416050.0,
|
|
"step": 23440
|
|
},
|
|
{
|
|
"entropy": 6.230799293518066,
|
|
"epoch": 2.7057126370455857,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004279671183968317,
|
|
"loss": 5.6468,
|
|
"mean_token_accuracy": 0.2083706632256508,
|
|
"num_tokens": 59428127.0,
|
|
"step": 23445
|
|
},
|
|
{
|
|
"entropy": 6.22346715927124,
|
|
"epoch": 2.7062896710905946,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004279368547103593,
|
|
"loss": 5.6133,
|
|
"mean_token_accuracy": 0.21240148842334747,
|
|
"num_tokens": 59442708.0,
|
|
"step": 23450
|
|
},
|
|
{
|
|
"entropy": 6.260948991775512,
|
|
"epoch": 2.706866705135603,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004279065858799318,
|
|
"loss": 5.6911,
|
|
"mean_token_accuracy": 0.2062714472413063,
|
|
"num_tokens": 59456126.0,
|
|
"step": 23455
|
|
},
|
|
{
|
|
"entropy": 6.211365652084351,
|
|
"epoch": 2.7074437391806114,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00042787631190656725,
|
|
"loss": 5.6634,
|
|
"mean_token_accuracy": 0.2032617747783661,
|
|
"num_tokens": 59469331.0,
|
|
"step": 23460
|
|
},
|
|
{
|
|
"entropy": 6.160763549804687,
|
|
"epoch": 2.7080207732256203,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00042784603279128386,
|
|
"loss": 5.5741,
|
|
"mean_token_accuracy": 0.2161744087934494,
|
|
"num_tokens": 59483084.0,
|
|
"step": 23465
|
|
},
|
|
{
|
|
"entropy": 6.318073701858521,
|
|
"epoch": 2.708597807270629,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004278157485351001,
|
|
"loss": 5.7092,
|
|
"mean_token_accuracy": 0.19910414069890975,
|
|
"num_tokens": 59494746.0,
|
|
"step": 23470
|
|
},
|
|
{
|
|
"entropy": 6.335538387298584,
|
|
"epoch": 2.7091748413156376,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00042778545913903454,
|
|
"loss": 5.7004,
|
|
"mean_token_accuracy": 0.20272629708051682,
|
|
"num_tokens": 59507266.0,
|
|
"step": 23475
|
|
},
|
|
{
|
|
"entropy": 6.320228576660156,
|
|
"epoch": 2.7097518753606464,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00042775516460410594,
|
|
"loss": 5.7136,
|
|
"mean_token_accuracy": 0.20056245774030684,
|
|
"num_tokens": 59521876.0,
|
|
"step": 23480
|
|
},
|
|
{
|
|
"entropy": 6.268406105041504,
|
|
"epoch": 2.710328909405655,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004277248649313333,
|
|
"loss": 5.681,
|
|
"mean_token_accuracy": 0.2026807874441147,
|
|
"num_tokens": 59535512.0,
|
|
"step": 23485
|
|
},
|
|
{
|
|
"entropy": 6.318011522293091,
|
|
"epoch": 2.7109059434506637,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004276945601217357,
|
|
"loss": 5.8201,
|
|
"mean_token_accuracy": 0.18915471136569978,
|
|
"num_tokens": 59549596.0,
|
|
"step": 23490
|
|
},
|
|
{
|
|
"entropy": 6.338709878921509,
|
|
"epoch": 2.711482977495672,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00042766425017633236,
|
|
"loss": 5.7194,
|
|
"mean_token_accuracy": 0.20283689945936204,
|
|
"num_tokens": 59562455.0,
|
|
"step": 23495
|
|
},
|
|
{
|
|
"entropy": 6.193594741821289,
|
|
"epoch": 2.712060011540681,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00042763393509614284,
|
|
"loss": 5.6052,
|
|
"mean_token_accuracy": 0.20570549070835115,
|
|
"num_tokens": 59574897.0,
|
|
"step": 23500
|
|
},
|
|
{
|
|
"entropy": 6.288909292221069,
|
|
"epoch": 2.7126370455856894,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004276036148821867,
|
|
"loss": 5.6515,
|
|
"mean_token_accuracy": 0.2052280440926552,
|
|
"num_tokens": 59586472.0,
|
|
"step": 23505
|
|
},
|
|
{
|
|
"entropy": 6.272292280197144,
|
|
"epoch": 2.7132140796306983,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00042757328953548385,
|
|
"loss": 5.6611,
|
|
"mean_token_accuracy": 0.2009549006819725,
|
|
"num_tokens": 59597788.0,
|
|
"step": 23510
|
|
},
|
|
{
|
|
"entropy": 6.198528718948364,
|
|
"epoch": 2.7137911136757067,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004275429590570541,
|
|
"loss": 5.6376,
|
|
"mean_token_accuracy": 0.20184379070997238,
|
|
"num_tokens": 59611045.0,
|
|
"step": 23515
|
|
},
|
|
{
|
|
"entropy": 6.126999616622925,
|
|
"epoch": 2.7143681477207156,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.00042751262344791776,
|
|
"loss": 5.4657,
|
|
"mean_token_accuracy": 0.2194235935807228,
|
|
"num_tokens": 59624251.0,
|
|
"step": 23520
|
|
},
|
|
{
|
|
"entropy": 6.278477668762207,
|
|
"epoch": 2.7149451817657244,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000427482282709095,
|
|
"loss": 5.639,
|
|
"mean_token_accuracy": 0.2047446921467781,
|
|
"num_tokens": 59635604.0,
|
|
"step": 23525
|
|
},
|
|
{
|
|
"entropy": 6.282340574264526,
|
|
"epoch": 2.715522215810733,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004274519368416065,
|
|
"loss": 5.5885,
|
|
"mean_token_accuracy": 0.20595853626728058,
|
|
"num_tokens": 59647591.0,
|
|
"step": 23530
|
|
},
|
|
{
|
|
"entropy": 6.327120304107666,
|
|
"epoch": 2.7160992498557412,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004274215858464727,
|
|
"loss": 5.7324,
|
|
"mean_token_accuracy": 0.19737906903028488,
|
|
"num_tokens": 59660693.0,
|
|
"step": 23535
|
|
},
|
|
{
|
|
"entropy": 6.2593787670135494,
|
|
"epoch": 2.71667628390075,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00042739122972471473,
|
|
"loss": 5.6372,
|
|
"mean_token_accuracy": 0.20199968963861464,
|
|
"num_tokens": 59673792.0,
|
|
"step": 23540
|
|
},
|
|
{
|
|
"entropy": 6.048742198944092,
|
|
"epoch": 2.717253317945759,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004273608684773534,
|
|
"loss": 5.4494,
|
|
"mean_token_accuracy": 0.23110448867082595,
|
|
"num_tokens": 59687415.0,
|
|
"step": 23545
|
|
},
|
|
{
|
|
"entropy": 6.2260983943939205,
|
|
"epoch": 2.7178303519907674,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00042733050210540984,
|
|
"loss": 5.6217,
|
|
"mean_token_accuracy": 0.20999803394079208,
|
|
"num_tokens": 59699721.0,
|
|
"step": 23550
|
|
},
|
|
{
|
|
"entropy": 6.2923996925354,
|
|
"epoch": 2.7184073860357763,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004273001306099056,
|
|
"loss": 5.6548,
|
|
"mean_token_accuracy": 0.20920408815145491,
|
|
"num_tokens": 59712517.0,
|
|
"step": 23555
|
|
},
|
|
{
|
|
"entropy": 6.178339099884033,
|
|
"epoch": 2.7189844200807847,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004272697539918621,
|
|
"loss": 5.6173,
|
|
"mean_token_accuracy": 0.21732170283794403,
|
|
"num_tokens": 59725132.0,
|
|
"step": 23560
|
|
},
|
|
{
|
|
"entropy": 6.204169654846192,
|
|
"epoch": 2.7195614541257935,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004272393722523011,
|
|
"loss": 5.6254,
|
|
"mean_token_accuracy": 0.21480109989643098,
|
|
"num_tokens": 59738515.0,
|
|
"step": 23565
|
|
},
|
|
{
|
|
"entropy": 6.259692049026489,
|
|
"epoch": 2.720138488170802,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00042720898539224436,
|
|
"loss": 5.5806,
|
|
"mean_token_accuracy": 0.21188097447156906,
|
|
"num_tokens": 59750141.0,
|
|
"step": 23570
|
|
},
|
|
{
|
|
"entropy": 6.360567188262939,
|
|
"epoch": 2.720715522215811,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004271785934127141,
|
|
"loss": 5.8596,
|
|
"mean_token_accuracy": 0.19407681226730347,
|
|
"num_tokens": 59762580.0,
|
|
"step": 23575
|
|
},
|
|
{
|
|
"entropy": 6.319754648208618,
|
|
"epoch": 2.7212925562608192,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00042714819631473234,
|
|
"loss": 5.6993,
|
|
"mean_token_accuracy": 0.2017399176955223,
|
|
"num_tokens": 59776039.0,
|
|
"step": 23580
|
|
},
|
|
{
|
|
"entropy": 6.29428071975708,
|
|
"epoch": 2.721869590305828,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00042711779409932164,
|
|
"loss": 5.6888,
|
|
"mean_token_accuracy": 0.2055966556072235,
|
|
"num_tokens": 59789305.0,
|
|
"step": 23585
|
|
},
|
|
{
|
|
"entropy": 6.199136638641358,
|
|
"epoch": 2.7224466243508365,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00042708738676750446,
|
|
"loss": 5.6016,
|
|
"mean_token_accuracy": 0.21147399842739106,
|
|
"num_tokens": 59801771.0,
|
|
"step": 23590
|
|
},
|
|
{
|
|
"entropy": 6.264022970199585,
|
|
"epoch": 2.7230236583958454,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004270569743203036,
|
|
"loss": 5.6445,
|
|
"mean_token_accuracy": 0.2004895731806755,
|
|
"num_tokens": 59815281.0,
|
|
"step": 23595
|
|
},
|
|
{
|
|
"entropy": 6.299907112121582,
|
|
"epoch": 2.7236006924408542,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004270265567587419,
|
|
"loss": 5.6484,
|
|
"mean_token_accuracy": 0.2042030870914459,
|
|
"num_tokens": 59827292.0,
|
|
"step": 23600
|
|
},
|
|
{
|
|
"entropy": 6.239239597320557,
|
|
"epoch": 2.7241777264858626,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00042699613408384246,
|
|
"loss": 5.5868,
|
|
"mean_token_accuracy": 0.21466063112020492,
|
|
"num_tokens": 59840024.0,
|
|
"step": 23605
|
|
},
|
|
{
|
|
"entropy": 6.30584602355957,
|
|
"epoch": 2.724754760530871,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004269657062966286,
|
|
"loss": 5.7265,
|
|
"mean_token_accuracy": 0.1973255068063736,
|
|
"num_tokens": 59851499.0,
|
|
"step": 23610
|
|
},
|
|
{
|
|
"entropy": 6.228437662124634,
|
|
"epoch": 2.72533179457588,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004269352733981238,
|
|
"loss": 5.6423,
|
|
"mean_token_accuracy": 0.2052161753177643,
|
|
"num_tokens": 59863057.0,
|
|
"step": 23615
|
|
},
|
|
{
|
|
"entropy": 6.2251458168029785,
|
|
"epoch": 2.725908828620889,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00042690483538935137,
|
|
"loss": 5.632,
|
|
"mean_token_accuracy": 0.20314138233661652,
|
|
"num_tokens": 59876132.0,
|
|
"step": 23620
|
|
},
|
|
{
|
|
"entropy": 6.241136646270752,
|
|
"epoch": 2.726485862665897,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004268743922713354,
|
|
"loss": 5.6921,
|
|
"mean_token_accuracy": 0.20126574635505676,
|
|
"num_tokens": 59888543.0,
|
|
"step": 23625
|
|
},
|
|
{
|
|
"entropy": 6.3047160625457765,
|
|
"epoch": 2.727062896710906,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00042684394404509957,
|
|
"loss": 5.6401,
|
|
"mean_token_accuracy": 0.20428135395050048,
|
|
"num_tokens": 59900508.0,
|
|
"step": 23630
|
|
},
|
|
{
|
|
"entropy": 6.227706384658814,
|
|
"epoch": 2.7276399307559145,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00042681349071166814,
|
|
"loss": 5.6787,
|
|
"mean_token_accuracy": 0.20204531401395798,
|
|
"num_tokens": 59913065.0,
|
|
"step": 23635
|
|
},
|
|
{
|
|
"entropy": 6.274850463867187,
|
|
"epoch": 2.7282169648009233,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00042678303227206536,
|
|
"loss": 5.7177,
|
|
"mean_token_accuracy": 0.19515222012996675,
|
|
"num_tokens": 59926173.0,
|
|
"step": 23640
|
|
},
|
|
{
|
|
"entropy": 6.327705192565918,
|
|
"epoch": 2.7287939988459318,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004267525687273157,
|
|
"loss": 5.7154,
|
|
"mean_token_accuracy": 0.20294611006975175,
|
|
"num_tokens": 59939206.0,
|
|
"step": 23645
|
|
},
|
|
{
|
|
"entropy": 6.346580505371094,
|
|
"epoch": 2.7293710328909406,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00042672210007844383,
|
|
"loss": 5.7268,
|
|
"mean_token_accuracy": 0.20070762783288956,
|
|
"num_tokens": 59951093.0,
|
|
"step": 23650
|
|
},
|
|
{
|
|
"entropy": 6.236078214645386,
|
|
"epoch": 2.7299480669359495,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00042669162632647434,
|
|
"loss": 5.6824,
|
|
"mean_token_accuracy": 0.19879934340715408,
|
|
"num_tokens": 59962804.0,
|
|
"step": 23655
|
|
},
|
|
{
|
|
"entropy": 6.2937720775604244,
|
|
"epoch": 2.730525100980958,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00042666114747243243,
|
|
"loss": 5.7043,
|
|
"mean_token_accuracy": 0.20073767602443696,
|
|
"num_tokens": 59975649.0,
|
|
"step": 23660
|
|
},
|
|
{
|
|
"entropy": 6.272326326370239,
|
|
"epoch": 2.7311021350259663,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004266306635173432,
|
|
"loss": 5.6308,
|
|
"mean_token_accuracy": 0.20969946533441544,
|
|
"num_tokens": 59989496.0,
|
|
"step": 23665
|
|
},
|
|
{
|
|
"entropy": 6.3147646427154545,
|
|
"epoch": 2.731679169070975,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004266001744622319,
|
|
"loss": 5.7649,
|
|
"mean_token_accuracy": 0.19873626083135604,
|
|
"num_tokens": 60002125.0,
|
|
"step": 23670
|
|
},
|
|
{
|
|
"entropy": 6.32417893409729,
|
|
"epoch": 2.732256203115984,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.000426569680308124,
|
|
"loss": 5.6956,
|
|
"mean_token_accuracy": 0.200134214758873,
|
|
"num_tokens": 60013395.0,
|
|
"step": 23675
|
|
},
|
|
{
|
|
"entropy": 6.288641023635864,
|
|
"epoch": 2.7328332371609925,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00042653918105604524,
|
|
"loss": 5.6454,
|
|
"mean_token_accuracy": 0.20771630555391313,
|
|
"num_tokens": 60026527.0,
|
|
"step": 23680
|
|
},
|
|
{
|
|
"entropy": 6.301353025436401,
|
|
"epoch": 2.733410271206001,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00042650867670702123,
|
|
"loss": 5.7366,
|
|
"mean_token_accuracy": 0.2027778595685959,
|
|
"num_tokens": 60039671.0,
|
|
"step": 23685
|
|
},
|
|
{
|
|
"entropy": 6.2609710693359375,
|
|
"epoch": 2.7339873052510097,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004264781672620783,
|
|
"loss": 5.6496,
|
|
"mean_token_accuracy": 0.21786354780197142,
|
|
"num_tokens": 60051908.0,
|
|
"step": 23690
|
|
},
|
|
{
|
|
"entropy": 6.298049688339233,
|
|
"epoch": 2.7345643392960186,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004264476527222425,
|
|
"loss": 5.6988,
|
|
"mean_token_accuracy": 0.20431626886129378,
|
|
"num_tokens": 60065295.0,
|
|
"step": 23695
|
|
},
|
|
{
|
|
"entropy": 6.262032985687256,
|
|
"epoch": 2.735141373341027,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004264171330885401,
|
|
"loss": 5.6079,
|
|
"mean_token_accuracy": 0.21089257746934892,
|
|
"num_tokens": 60076903.0,
|
|
"step": 23700
|
|
},
|
|
{
|
|
"entropy": 6.259629154205323,
|
|
"epoch": 2.735718407386036,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00042638660836199756,
|
|
"loss": 5.6487,
|
|
"mean_token_accuracy": 0.19859280288219452,
|
|
"num_tokens": 60089091.0,
|
|
"step": 23705
|
|
},
|
|
{
|
|
"entropy": 6.2708330154418945,
|
|
"epoch": 2.7362954414310443,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00042635607854364166,
|
|
"loss": 5.5625,
|
|
"mean_token_accuracy": 0.21616168171167374,
|
|
"num_tokens": 60100986.0,
|
|
"step": 23710
|
|
},
|
|
{
|
|
"entropy": 6.202017736434937,
|
|
"epoch": 2.736872475476053,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00042632554363449926,
|
|
"loss": 5.5887,
|
|
"mean_token_accuracy": 0.21216881573200225,
|
|
"num_tokens": 60113806.0,
|
|
"step": 23715
|
|
},
|
|
{
|
|
"entropy": 6.262396669387817,
|
|
"epoch": 2.7374495095210616,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00042629500363559734,
|
|
"loss": 5.6377,
|
|
"mean_token_accuracy": 0.21196930706501008,
|
|
"num_tokens": 60126076.0,
|
|
"step": 23720
|
|
},
|
|
{
|
|
"entropy": 6.272845602035522,
|
|
"epoch": 2.7380265435660704,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00042626445854796326,
|
|
"loss": 5.6889,
|
|
"mean_token_accuracy": 0.20665962845087052,
|
|
"num_tokens": 60139435.0,
|
|
"step": 23725
|
|
},
|
|
{
|
|
"entropy": 6.284993743896484,
|
|
"epoch": 2.7386035776110793,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004262339083726241,
|
|
"loss": 5.6964,
|
|
"mean_token_accuracy": 0.2010929748415947,
|
|
"num_tokens": 60152252.0,
|
|
"step": 23730
|
|
},
|
|
{
|
|
"entropy": 6.211569738388062,
|
|
"epoch": 2.7391806116560877,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004262033531106076,
|
|
"loss": 5.5155,
|
|
"mean_token_accuracy": 0.21815283000469207,
|
|
"num_tokens": 60164575.0,
|
|
"step": 23735
|
|
},
|
|
{
|
|
"entropy": 6.308486747741699,
|
|
"epoch": 2.739757645701096,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00042617279276294145,
|
|
"loss": 5.7031,
|
|
"mean_token_accuracy": 0.19314163327217101,
|
|
"num_tokens": 60177085.0,
|
|
"step": 23740
|
|
},
|
|
{
|
|
"entropy": 6.280835056304932,
|
|
"epoch": 2.740334679746105,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004261422273306535,
|
|
"loss": 5.6404,
|
|
"mean_token_accuracy": 0.2063989207148552,
|
|
"num_tokens": 60188923.0,
|
|
"step": 23745
|
|
},
|
|
{
|
|
"entropy": 6.253396987915039,
|
|
"epoch": 2.740911713791114,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004261116568147718,
|
|
"loss": 5.6644,
|
|
"mean_token_accuracy": 0.21163987666368483,
|
|
"num_tokens": 60200439.0,
|
|
"step": 23750
|
|
},
|
|
{
|
|
"entropy": 6.20761342048645,
|
|
"epoch": 2.7414887478361223,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004260810812163246,
|
|
"loss": 5.5886,
|
|
"mean_token_accuracy": 0.21744026094675065,
|
|
"num_tokens": 60213618.0,
|
|
"step": 23755
|
|
},
|
|
{
|
|
"entropy": 6.335954999923706,
|
|
"epoch": 2.742065781881131,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00042605050053634027,
|
|
"loss": 5.7175,
|
|
"mean_token_accuracy": 0.2039960116147995,
|
|
"num_tokens": 60225617.0,
|
|
"step": 23760
|
|
},
|
|
{
|
|
"entropy": 6.281629753112793,
|
|
"epoch": 2.7426428159261396,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004260199147758474,
|
|
"loss": 5.6602,
|
|
"mean_token_accuracy": 0.1970086544752121,
|
|
"num_tokens": 60238406.0,
|
|
"step": 23765
|
|
},
|
|
{
|
|
"entropy": 6.280141830444336,
|
|
"epoch": 2.7432198499711484,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004259893239358747,
|
|
"loss": 5.7339,
|
|
"mean_token_accuracy": 0.19506382048130036,
|
|
"num_tokens": 60250733.0,
|
|
"step": 23770
|
|
},
|
|
{
|
|
"entropy": 6.276529216766358,
|
|
"epoch": 2.743796884016157,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00042595872801745106,
|
|
"loss": 5.6441,
|
|
"mean_token_accuracy": 0.20533547550439835,
|
|
"num_tokens": 60262625.0,
|
|
"step": 23775
|
|
},
|
|
{
|
|
"entropy": 6.3179021835327145,
|
|
"epoch": 2.7443739180611657,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004259281270216056,
|
|
"loss": 5.7471,
|
|
"mean_token_accuracy": 0.20365326702594758,
|
|
"num_tokens": 60274428.0,
|
|
"step": 23780
|
|
},
|
|
{
|
|
"entropy": 6.310861539840698,
|
|
"epoch": 2.744950952106174,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00042589752094936763,
|
|
"loss": 5.7721,
|
|
"mean_token_accuracy": 0.19572871178388596,
|
|
"num_tokens": 60286131.0,
|
|
"step": 23785
|
|
},
|
|
{
|
|
"entropy": 6.233788299560547,
|
|
"epoch": 2.745527986151183,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004258669098017664,
|
|
"loss": 5.6389,
|
|
"mean_token_accuracy": 0.20572750866413117,
|
|
"num_tokens": 60299151.0,
|
|
"step": 23790
|
|
},
|
|
{
|
|
"entropy": 6.191610383987427,
|
|
"epoch": 2.7461050201961914,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00042583629357983164,
|
|
"loss": 5.5379,
|
|
"mean_token_accuracy": 0.20696640610694886,
|
|
"num_tokens": 60311557.0,
|
|
"step": 23795
|
|
},
|
|
{
|
|
"entropy": 6.29091215133667,
|
|
"epoch": 2.7466820542412003,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00042580567228459303,
|
|
"loss": 5.7033,
|
|
"mean_token_accuracy": 0.20055586993694305,
|
|
"num_tokens": 60324364.0,
|
|
"step": 23800
|
|
},
|
|
{
|
|
"entropy": 6.30074143409729,
|
|
"epoch": 2.747259088286209,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004257750459170806,
|
|
"loss": 5.7023,
|
|
"mean_token_accuracy": 0.2062767282128334,
|
|
"num_tokens": 60336141.0,
|
|
"step": 23805
|
|
},
|
|
{
|
|
"entropy": 6.339053010940551,
|
|
"epoch": 2.7478361223312175,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00042574441447832436,
|
|
"loss": 5.7202,
|
|
"mean_token_accuracy": 0.1978342816233635,
|
|
"num_tokens": 60349006.0,
|
|
"step": 23810
|
|
},
|
|
{
|
|
"entropy": 6.3109832286834715,
|
|
"epoch": 2.748413156376226,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004257137779693546,
|
|
"loss": 5.703,
|
|
"mean_token_accuracy": 0.20051915794610978,
|
|
"num_tokens": 60361361.0,
|
|
"step": 23815
|
|
},
|
|
{
|
|
"entropy": 6.207128381729126,
|
|
"epoch": 2.748990190421235,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004256831363912018,
|
|
"loss": 5.6403,
|
|
"mean_token_accuracy": 0.20841150134801864,
|
|
"num_tokens": 60375261.0,
|
|
"step": 23820
|
|
},
|
|
{
|
|
"entropy": 6.271187877655029,
|
|
"epoch": 2.7495672244662437,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00042565248974489654,
|
|
"loss": 5.574,
|
|
"mean_token_accuracy": 0.216634601354599,
|
|
"num_tokens": 60387129.0,
|
|
"step": 23825
|
|
},
|
|
{
|
|
"entropy": 6.272358846664429,
|
|
"epoch": 2.750144258511252,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004256218380314697,
|
|
"loss": 5.6216,
|
|
"mean_token_accuracy": 0.2099366381764412,
|
|
"num_tokens": 60398581.0,
|
|
"step": 23830
|
|
},
|
|
{
|
|
"entropy": 6.247166442871094,
|
|
"epoch": 2.750721292556261,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004255911812519521,
|
|
"loss": 5.7058,
|
|
"mean_token_accuracy": 0.19849096536636351,
|
|
"num_tokens": 60412105.0,
|
|
"step": 23835
|
|
},
|
|
{
|
|
"entropy": 6.341522312164306,
|
|
"epoch": 2.7512983266012694,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004255605194073749,
|
|
"loss": 5.6501,
|
|
"mean_token_accuracy": 0.20663839280605317,
|
|
"num_tokens": 60423880.0,
|
|
"step": 23840
|
|
},
|
|
{
|
|
"entropy": 6.335871458053589,
|
|
"epoch": 2.7518753606462782,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004255298524987695,
|
|
"loss": 5.7219,
|
|
"mean_token_accuracy": 0.1964716672897339,
|
|
"num_tokens": 60435968.0,
|
|
"step": 23845
|
|
},
|
|
{
|
|
"entropy": 6.231741857528687,
|
|
"epoch": 2.7524523946912867,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004254991805271672,
|
|
"loss": 5.7028,
|
|
"mean_token_accuracy": 0.1948447659611702,
|
|
"num_tokens": 60449003.0,
|
|
"step": 23850
|
|
},
|
|
{
|
|
"entropy": 6.324371814727783,
|
|
"epoch": 2.7530294287362955,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00042546850349359976,
|
|
"loss": 5.6727,
|
|
"mean_token_accuracy": 0.20406218469142914,
|
|
"num_tokens": 60462083.0,
|
|
"step": 23855
|
|
},
|
|
{
|
|
"entropy": 6.326699686050415,
|
|
"epoch": 2.753606462781304,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00042543782139909894,
|
|
"loss": 5.6505,
|
|
"mean_token_accuracy": 0.20653390437364577,
|
|
"num_tokens": 60473804.0,
|
|
"step": 23860
|
|
},
|
|
{
|
|
"entropy": 6.321713638305664,
|
|
"epoch": 2.754183496826313,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00042540713424469667,
|
|
"loss": 5.7184,
|
|
"mean_token_accuracy": 0.20550071597099304,
|
|
"num_tokens": 60486361.0,
|
|
"step": 23865
|
|
},
|
|
{
|
|
"entropy": 6.243905878067016,
|
|
"epoch": 2.7547605308713212,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00042537644203142523,
|
|
"loss": 5.6029,
|
|
"mean_token_accuracy": 0.20950179547071457,
|
|
"num_tokens": 60498522.0,
|
|
"step": 23870
|
|
},
|
|
{
|
|
"entropy": 6.289014625549316,
|
|
"epoch": 2.75533756491633,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00042534574476031683,
|
|
"loss": 5.7649,
|
|
"mean_token_accuracy": 0.19460297524929046,
|
|
"num_tokens": 60510974.0,
|
|
"step": 23875
|
|
},
|
|
{
|
|
"entropy": 6.361392211914063,
|
|
"epoch": 2.755914598961339,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000425315042432404,
|
|
"loss": 5.7034,
|
|
"mean_token_accuracy": 0.20635935068130493,
|
|
"num_tokens": 60524756.0,
|
|
"step": 23880
|
|
},
|
|
{
|
|
"entropy": 6.182318925857544,
|
|
"epoch": 2.7564916330063474,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00042528433504871935,
|
|
"loss": 5.5843,
|
|
"mean_token_accuracy": 0.21223890632390977,
|
|
"num_tokens": 60536286.0,
|
|
"step": 23885
|
|
},
|
|
{
|
|
"entropy": 6.316730642318726,
|
|
"epoch": 2.757068667051356,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004252536226102958,
|
|
"loss": 5.6981,
|
|
"mean_token_accuracy": 0.20179191827774048,
|
|
"num_tokens": 60548971.0,
|
|
"step": 23890
|
|
},
|
|
{
|
|
"entropy": 6.328762531280518,
|
|
"epoch": 2.7576457010963646,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004252229051181662,
|
|
"loss": 5.6994,
|
|
"mean_token_accuracy": 0.20119510889053344,
|
|
"num_tokens": 60562078.0,
|
|
"step": 23895
|
|
},
|
|
{
|
|
"entropy": 6.300843286514282,
|
|
"epoch": 2.7582227351413735,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00042519218257336383,
|
|
"loss": 5.6442,
|
|
"mean_token_accuracy": 0.20707331448793412,
|
|
"num_tokens": 60575378.0,
|
|
"step": 23900
|
|
},
|
|
{
|
|
"entropy": 6.179822492599487,
|
|
"epoch": 2.758799769186382,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00042516145497692204,
|
|
"loss": 5.6434,
|
|
"mean_token_accuracy": 0.20570089668035507,
|
|
"num_tokens": 60588958.0,
|
|
"step": 23905
|
|
},
|
|
{
|
|
"entropy": 6.214246940612793,
|
|
"epoch": 2.759376803231391,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00042513072232987426,
|
|
"loss": 5.6052,
|
|
"mean_token_accuracy": 0.21524664312601088,
|
|
"num_tokens": 60600904.0,
|
|
"step": 23910
|
|
},
|
|
{
|
|
"entropy": 6.33005723953247,
|
|
"epoch": 2.759953837276399,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004250999846332543,
|
|
"loss": 5.665,
|
|
"mean_token_accuracy": 0.20459192544221877,
|
|
"num_tokens": 60612655.0,
|
|
"step": 23915
|
|
},
|
|
{
|
|
"entropy": 6.312617826461792,
|
|
"epoch": 2.760530871321408,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00042506924188809574,
|
|
"loss": 5.7153,
|
|
"mean_token_accuracy": 0.19724390357732774,
|
|
"num_tokens": 60625491.0,
|
|
"step": 23920
|
|
},
|
|
{
|
|
"entropy": 6.249608325958252,
|
|
"epoch": 2.7611079053664165,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.000425038494095433,
|
|
"loss": 5.6777,
|
|
"mean_token_accuracy": 0.20205020159482956,
|
|
"num_tokens": 60637814.0,
|
|
"step": 23925
|
|
},
|
|
{
|
|
"entropy": 6.292912578582763,
|
|
"epoch": 2.7616849394114253,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00042500774125629986,
|
|
"loss": 5.6434,
|
|
"mean_token_accuracy": 0.20771353244781493,
|
|
"num_tokens": 60650031.0,
|
|
"step": 23930
|
|
},
|
|
{
|
|
"entropy": 6.306258964538574,
|
|
"epoch": 2.762261973456434,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004249769833717309,
|
|
"loss": 5.7137,
|
|
"mean_token_accuracy": 0.19796977788209916,
|
|
"num_tokens": 60662257.0,
|
|
"step": 23935
|
|
},
|
|
{
|
|
"entropy": 6.316214609146118,
|
|
"epoch": 2.7628390075014426,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00042494622044276066,
|
|
"loss": 5.6888,
|
|
"mean_token_accuracy": 0.20688740015029908,
|
|
"num_tokens": 60675557.0,
|
|
"step": 23940
|
|
},
|
|
{
|
|
"entropy": 6.277747631072998,
|
|
"epoch": 2.763416041546451,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004249154524704237,
|
|
"loss": 5.6658,
|
|
"mean_token_accuracy": 0.19813719540834426,
|
|
"num_tokens": 60686984.0,
|
|
"step": 23945
|
|
},
|
|
{
|
|
"entropy": 6.320740032196045,
|
|
"epoch": 2.76399307559146,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000424884679455755,
|
|
"loss": 5.7406,
|
|
"mean_token_accuracy": 0.19347584545612334,
|
|
"num_tokens": 60698904.0,
|
|
"step": 23950
|
|
},
|
|
{
|
|
"entropy": 6.268014812469483,
|
|
"epoch": 2.7645701096364688,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00042485390139978955,
|
|
"loss": 5.6473,
|
|
"mean_token_accuracy": 0.20635816901922227,
|
|
"num_tokens": 60710972.0,
|
|
"step": 23955
|
|
},
|
|
{
|
|
"entropy": 6.30289306640625,
|
|
"epoch": 2.765147143681477,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004248231183035626,
|
|
"loss": 5.7619,
|
|
"mean_token_accuracy": 0.198407444357872,
|
|
"num_tokens": 60723780.0,
|
|
"step": 23960
|
|
},
|
|
{
|
|
"entropy": 6.287156391143799,
|
|
"epoch": 2.7657241777264856,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004247923301681095,
|
|
"loss": 5.6551,
|
|
"mean_token_accuracy": 0.20431240499019623,
|
|
"num_tokens": 60735381.0,
|
|
"step": 23965
|
|
},
|
|
{
|
|
"entropy": 6.203852224349975,
|
|
"epoch": 2.7663012117714945,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00042476153699446567,
|
|
"loss": 5.6283,
|
|
"mean_token_accuracy": 0.21327733844518662,
|
|
"num_tokens": 60748495.0,
|
|
"step": 23970
|
|
},
|
|
{
|
|
"entropy": 6.330010414123535,
|
|
"epoch": 2.7668782458165033,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00042473073878366695,
|
|
"loss": 5.7307,
|
|
"mean_token_accuracy": 0.1915600687265396,
|
|
"num_tokens": 60761984.0,
|
|
"step": 23975
|
|
},
|
|
{
|
|
"entropy": 6.345406007766724,
|
|
"epoch": 2.7674552798615117,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004246999355367493,
|
|
"loss": 5.7353,
|
|
"mean_token_accuracy": 0.19715495705604552,
|
|
"num_tokens": 60774590.0,
|
|
"step": 23980
|
|
},
|
|
{
|
|
"entropy": 6.315189361572266,
|
|
"epoch": 2.7680323139065206,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00042466912725474865,
|
|
"loss": 5.7136,
|
|
"mean_token_accuracy": 0.19998075664043427,
|
|
"num_tokens": 60788647.0,
|
|
"step": 23985
|
|
},
|
|
{
|
|
"entropy": 6.30523271560669,
|
|
"epoch": 2.768609347951529,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00042463831393870123,
|
|
"loss": 5.6892,
|
|
"mean_token_accuracy": 0.2055213987827301,
|
|
"num_tokens": 60799913.0,
|
|
"step": 23990
|
|
},
|
|
{
|
|
"entropy": 6.2970543384552,
|
|
"epoch": 2.769186381996538,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00042460749558964346,
|
|
"loss": 5.7672,
|
|
"mean_token_accuracy": 0.19577331990003585,
|
|
"num_tokens": 60812343.0,
|
|
"step": 23995
|
|
},
|
|
{
|
|
"entropy": 6.337021923065185,
|
|
"epoch": 2.7697634160415463,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004245766722086118,
|
|
"loss": 5.6738,
|
|
"mean_token_accuracy": 0.20110151767730713,
|
|
"num_tokens": 60824677.0,
|
|
"step": 24000
|
|
},
|
|
{
|
|
"epoch": 2.7697634160415463,
|
|
"eval_entropy": 6.110137078922717,
|
|
"eval_loss": 5.747303485870361,
|
|
"eval_mean_token_accuracy": 0.20855002860038974,
|
|
"eval_num_tokens": 60824677.0,
|
|
"eval_runtime": 17.6486,
|
|
"eval_samples_per_second": 1594.23,
|
|
"eval_steps_per_second": 199.279,
|
|
"step": 24000
|
|
},
|
|
{
|
|
"entropy": 6.284476852416992,
|
|
"epoch": 2.770340450086555,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00042454584379664326,
|
|
"loss": 5.6663,
|
|
"mean_token_accuracy": 0.20679705291986467,
|
|
"num_tokens": 60837453.0,
|
|
"step": 24005
|
|
},
|
|
{
|
|
"entropy": 6.259833097457886,
|
|
"epoch": 2.770917484131564,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004245150103547744,
|
|
"loss": 5.6373,
|
|
"mean_token_accuracy": 0.2060678169131279,
|
|
"num_tokens": 60850229.0,
|
|
"step": 24010
|
|
},
|
|
{
|
|
"entropy": 6.309430360794067,
|
|
"epoch": 2.7714945181765724,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00042448417188404246,
|
|
"loss": 5.6543,
|
|
"mean_token_accuracy": 0.20605955719947816,
|
|
"num_tokens": 60862108.0,
|
|
"step": 24015
|
|
},
|
|
{
|
|
"entropy": 6.277496576309204,
|
|
"epoch": 2.772071552221581,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004244533283854847,
|
|
"loss": 5.668,
|
|
"mean_token_accuracy": 0.2087453633546829,
|
|
"num_tokens": 60875339.0,
|
|
"step": 24020
|
|
},
|
|
{
|
|
"entropy": 6.264426898956299,
|
|
"epoch": 2.7726485862665897,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004244224798601385,
|
|
"loss": 5.6427,
|
|
"mean_token_accuracy": 0.2064829498529434,
|
|
"num_tokens": 60888869.0,
|
|
"step": 24025
|
|
},
|
|
{
|
|
"entropy": 6.299762201309204,
|
|
"epoch": 2.7732256203115986,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00042439162630904134,
|
|
"loss": 5.7245,
|
|
"mean_token_accuracy": 0.19883949011564256,
|
|
"num_tokens": 60902344.0,
|
|
"step": 24030
|
|
},
|
|
{
|
|
"entropy": 6.338087320327759,
|
|
"epoch": 2.773802654356607,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004243607677332311,
|
|
"loss": 5.6958,
|
|
"mean_token_accuracy": 0.20551479160785674,
|
|
"num_tokens": 60915114.0,
|
|
"step": 24035
|
|
},
|
|
{
|
|
"entropy": 6.297605419158936,
|
|
"epoch": 2.7743796884016154,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00042432990413374556,
|
|
"loss": 5.6204,
|
|
"mean_token_accuracy": 0.2090611755847931,
|
|
"num_tokens": 60928228.0,
|
|
"step": 24040
|
|
},
|
|
{
|
|
"entropy": 6.22783317565918,
|
|
"epoch": 2.7749567224466243,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00042429903551162283,
|
|
"loss": 5.5906,
|
|
"mean_token_accuracy": 0.21181854158639907,
|
|
"num_tokens": 60941923.0,
|
|
"step": 24045
|
|
},
|
|
{
|
|
"entropy": 6.270639657974243,
|
|
"epoch": 2.775533756491633,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004242681618679013,
|
|
"loss": 5.6272,
|
|
"mean_token_accuracy": 0.20153675526380538,
|
|
"num_tokens": 60955537.0,
|
|
"step": 24050
|
|
},
|
|
{
|
|
"entropy": 6.2936859130859375,
|
|
"epoch": 2.7761107905366416,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00042423728320361924,
|
|
"loss": 5.699,
|
|
"mean_token_accuracy": 0.2062570795416832,
|
|
"num_tokens": 60968121.0,
|
|
"step": 24055
|
|
},
|
|
{
|
|
"entropy": 6.27194995880127,
|
|
"epoch": 2.7766878245816504,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00042420639951981534,
|
|
"loss": 5.6683,
|
|
"mean_token_accuracy": 0.20090533196926116,
|
|
"num_tokens": 60980256.0,
|
|
"step": 24060
|
|
},
|
|
{
|
|
"entropy": 6.348288202285767,
|
|
"epoch": 2.777264858626659,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00042417551081752825,
|
|
"loss": 5.7514,
|
|
"mean_token_accuracy": 0.1990349069237709,
|
|
"num_tokens": 60992989.0,
|
|
"step": 24065
|
|
},
|
|
{
|
|
"entropy": 6.305077838897705,
|
|
"epoch": 2.7778418926716677,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00042414461709779696,
|
|
"loss": 5.6905,
|
|
"mean_token_accuracy": 0.20279713571071625,
|
|
"num_tokens": 61005792.0,
|
|
"step": 24070
|
|
},
|
|
{
|
|
"entropy": 6.2336523056030275,
|
|
"epoch": 2.778418926716676,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004241137183616606,
|
|
"loss": 5.7335,
|
|
"mean_token_accuracy": 0.20249888598918914,
|
|
"num_tokens": 61019448.0,
|
|
"step": 24075
|
|
},
|
|
{
|
|
"entropy": 6.267611646652222,
|
|
"epoch": 2.778995960761685,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004240828146101584,
|
|
"loss": 5.605,
|
|
"mean_token_accuracy": 0.2151130497455597,
|
|
"num_tokens": 61033449.0,
|
|
"step": 24080
|
|
},
|
|
{
|
|
"entropy": 6.348956489562989,
|
|
"epoch": 2.779572994806694,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00042405190584432966,
|
|
"loss": 5.7031,
|
|
"mean_token_accuracy": 0.20749318450689316,
|
|
"num_tokens": 61044912.0,
|
|
"step": 24085
|
|
},
|
|
{
|
|
"entropy": 6.268578290939331,
|
|
"epoch": 2.7801500288517023,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004240209920652142,
|
|
"loss": 5.6348,
|
|
"mean_token_accuracy": 0.20811071544885634,
|
|
"num_tokens": 61057003.0,
|
|
"step": 24090
|
|
},
|
|
{
|
|
"entropy": 6.250166559219361,
|
|
"epoch": 2.7807270628967107,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00042399007327385173,
|
|
"loss": 5.6576,
|
|
"mean_token_accuracy": 0.20405267179012299,
|
|
"num_tokens": 61068721.0,
|
|
"step": 24095
|
|
},
|
|
{
|
|
"entropy": 6.294403982162476,
|
|
"epoch": 2.7813040969417195,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004239591494712821,
|
|
"loss": 5.6385,
|
|
"mean_token_accuracy": 0.20323246717453003,
|
|
"num_tokens": 61081938.0,
|
|
"step": 24100
|
|
},
|
|
{
|
|
"entropy": 6.304669809341431,
|
|
"epoch": 2.7818811309867284,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004239282206585455,
|
|
"loss": 5.7135,
|
|
"mean_token_accuracy": 0.20087448507547379,
|
|
"num_tokens": 61094918.0,
|
|
"step": 24105
|
|
},
|
|
{
|
|
"entropy": 6.21914119720459,
|
|
"epoch": 2.782458165031737,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004238972868366822,
|
|
"loss": 5.6173,
|
|
"mean_token_accuracy": 0.2061501756310463,
|
|
"num_tokens": 61107201.0,
|
|
"step": 24110
|
|
},
|
|
{
|
|
"entropy": 6.22398419380188,
|
|
"epoch": 2.7830351990767457,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00042386634800673255,
|
|
"loss": 5.5526,
|
|
"mean_token_accuracy": 0.22002862095832826,
|
|
"num_tokens": 61121092.0,
|
|
"step": 24115
|
|
},
|
|
{
|
|
"entropy": 6.282371902465821,
|
|
"epoch": 2.783612233121754,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004238354041697372,
|
|
"loss": 5.7345,
|
|
"mean_token_accuracy": 0.202226223051548,
|
|
"num_tokens": 61133819.0,
|
|
"step": 24120
|
|
},
|
|
{
|
|
"entropy": 6.358414554595948,
|
|
"epoch": 2.784189267166763,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00042380445532673705,
|
|
"loss": 5.7812,
|
|
"mean_token_accuracy": 0.19016314148902894,
|
|
"num_tokens": 61147182.0,
|
|
"step": 24125
|
|
},
|
|
{
|
|
"entropy": 6.3676787376403805,
|
|
"epoch": 2.7847663012117714,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004237735014787729,
|
|
"loss": 5.7575,
|
|
"mean_token_accuracy": 0.1920229971408844,
|
|
"num_tokens": 61159729.0,
|
|
"step": 24130
|
|
},
|
|
{
|
|
"entropy": 6.327588510513306,
|
|
"epoch": 2.7853433352567802,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000423742542626886,
|
|
"loss": 5.6802,
|
|
"mean_token_accuracy": 0.19857446253299713,
|
|
"num_tokens": 61172528.0,
|
|
"step": 24135
|
|
},
|
|
{
|
|
"entropy": 6.345280122756958,
|
|
"epoch": 2.7859203693017887,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004237115787721176,
|
|
"loss": 5.7884,
|
|
"mean_token_accuracy": 0.19298231601715088,
|
|
"num_tokens": 61186874.0,
|
|
"step": 24140
|
|
},
|
|
{
|
|
"entropy": 6.297798490524292,
|
|
"epoch": 2.7864974033467975,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00042368060991550895,
|
|
"loss": 5.6613,
|
|
"mean_token_accuracy": 0.20616599619388581,
|
|
"num_tokens": 61199353.0,
|
|
"step": 24145
|
|
},
|
|
{
|
|
"entropy": 6.23702039718628,
|
|
"epoch": 2.787074437391806,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004236496360581019,
|
|
"loss": 5.6345,
|
|
"mean_token_accuracy": 0.2091902107000351,
|
|
"num_tokens": 61211799.0,
|
|
"step": 24150
|
|
},
|
|
{
|
|
"entropy": 6.307335996627808,
|
|
"epoch": 2.787651471436815,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00042361865720093826,
|
|
"loss": 5.7135,
|
|
"mean_token_accuracy": 0.1990026205778122,
|
|
"num_tokens": 61225029.0,
|
|
"step": 24155
|
|
},
|
|
{
|
|
"entropy": 6.220220851898193,
|
|
"epoch": 2.7882285054818237,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00042358767334505984,
|
|
"loss": 5.5554,
|
|
"mean_token_accuracy": 0.21232929229736328,
|
|
"num_tokens": 61238415.0,
|
|
"step": 24160
|
|
},
|
|
{
|
|
"entropy": 6.230034112930298,
|
|
"epoch": 2.788805539526832,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00042355668449150884,
|
|
"loss": 5.6989,
|
|
"mean_token_accuracy": 0.20503691583871841,
|
|
"num_tokens": 61251193.0,
|
|
"step": 24165
|
|
},
|
|
{
|
|
"entropy": 6.296474838256836,
|
|
"epoch": 2.7893825735718405,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00042352569064132756,
|
|
"loss": 5.6618,
|
|
"mean_token_accuracy": 0.20571379959583283,
|
|
"num_tokens": 61264752.0,
|
|
"step": 24170
|
|
},
|
|
{
|
|
"entropy": 6.247052478790283,
|
|
"epoch": 2.7899596076168494,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00042349469179555845,
|
|
"loss": 5.6284,
|
|
"mean_token_accuracy": 0.21326312869787217,
|
|
"num_tokens": 61277409.0,
|
|
"step": 24175
|
|
},
|
|
{
|
|
"entropy": 6.2341193675994875,
|
|
"epoch": 2.790536641661858,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00042346368795524416,
|
|
"loss": 5.6303,
|
|
"mean_token_accuracy": 0.20684327483177184,
|
|
"num_tokens": 61288810.0,
|
|
"step": 24180
|
|
},
|
|
{
|
|
"entropy": 6.302008771896363,
|
|
"epoch": 2.7911136757068666,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004234326791214274,
|
|
"loss": 5.6144,
|
|
"mean_token_accuracy": 0.2089575007557869,
|
|
"num_tokens": 61301080.0,
|
|
"step": 24185
|
|
},
|
|
{
|
|
"entropy": 6.2551158428192135,
|
|
"epoch": 2.7916907097518755,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004234016652951513,
|
|
"loss": 5.7156,
|
|
"mean_token_accuracy": 0.1981436714529991,
|
|
"num_tokens": 61313202.0,
|
|
"step": 24190
|
|
},
|
|
{
|
|
"entropy": 6.194552946090698,
|
|
"epoch": 2.792267743796884,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00042337064647745887,
|
|
"loss": 5.6274,
|
|
"mean_token_accuracy": 0.2018851786851883,
|
|
"num_tokens": 61326090.0,
|
|
"step": 24195
|
|
},
|
|
{
|
|
"entropy": 6.362614488601684,
|
|
"epoch": 2.792844777841893,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00042333962266939343,
|
|
"loss": 5.6812,
|
|
"mean_token_accuracy": 0.20519627928733825,
|
|
"num_tokens": 61338640.0,
|
|
"step": 24200
|
|
},
|
|
{
|
|
"entropy": 6.285013437271118,
|
|
"epoch": 2.793421811886901,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00042330859387199846,
|
|
"loss": 5.6404,
|
|
"mean_token_accuracy": 0.20869287550449372,
|
|
"num_tokens": 61351324.0,
|
|
"step": 24205
|
|
},
|
|
{
|
|
"entropy": 6.235303783416748,
|
|
"epoch": 2.79399884593191,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004232775600863176,
|
|
"loss": 5.6128,
|
|
"mean_token_accuracy": 0.2099598154425621,
|
|
"num_tokens": 61362547.0,
|
|
"step": 24210
|
|
},
|
|
{
|
|
"entropy": 6.08439793586731,
|
|
"epoch": 2.7945758799769185,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00042324652131339475,
|
|
"loss": 5.4899,
|
|
"mean_token_accuracy": 0.2195163905620575,
|
|
"num_tokens": 61376084.0,
|
|
"step": 24215
|
|
},
|
|
{
|
|
"entropy": 6.283570337295532,
|
|
"epoch": 2.7951529140219273,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004232154775542737,
|
|
"loss": 5.6718,
|
|
"mean_token_accuracy": 0.2047012820839882,
|
|
"num_tokens": 61388440.0,
|
|
"step": 24220
|
|
},
|
|
{
|
|
"entropy": 6.361893844604492,
|
|
"epoch": 2.7957299480669358,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004231844288099987,
|
|
"loss": 5.6906,
|
|
"mean_token_accuracy": 0.20226762741804122,
|
|
"num_tokens": 61402255.0,
|
|
"step": 24225
|
|
},
|
|
{
|
|
"entropy": 6.254204273223877,
|
|
"epoch": 2.7963069821119446,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00042315337508161405,
|
|
"loss": 5.618,
|
|
"mean_token_accuracy": 0.20347914099693298,
|
|
"num_tokens": 61414871.0,
|
|
"step": 24230
|
|
},
|
|
{
|
|
"entropy": 6.256125640869141,
|
|
"epoch": 2.7968840161569535,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00042312231637016423,
|
|
"loss": 5.6558,
|
|
"mean_token_accuracy": 0.20951410830020906,
|
|
"num_tokens": 61427127.0,
|
|
"step": 24235
|
|
},
|
|
{
|
|
"entropy": 6.295227813720703,
|
|
"epoch": 2.797461050201962,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00042309125267669386,
|
|
"loss": 5.6366,
|
|
"mean_token_accuracy": 0.20522981137037277,
|
|
"num_tokens": 61439191.0,
|
|
"step": 24240
|
|
},
|
|
{
|
|
"entropy": 6.260116291046143,
|
|
"epoch": 2.7980380842469703,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004230601840022478,
|
|
"loss": 5.598,
|
|
"mean_token_accuracy": 0.20718367993831635,
|
|
"num_tokens": 61452508.0,
|
|
"step": 24245
|
|
},
|
|
{
|
|
"entropy": 6.2847388744354244,
|
|
"epoch": 2.798615118291979,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.000423029110347871,
|
|
"loss": 5.69,
|
|
"mean_token_accuracy": 0.19786419868469238,
|
|
"num_tokens": 61466475.0,
|
|
"step": 24250
|
|
},
|
|
{
|
|
"entropy": 6.280850267410278,
|
|
"epoch": 2.799192152336988,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00042299803171460854,
|
|
"loss": 5.6152,
|
|
"mean_token_accuracy": 0.20788534432649614,
|
|
"num_tokens": 61478523.0,
|
|
"step": 24255
|
|
},
|
|
{
|
|
"entropy": 6.298039436340332,
|
|
"epoch": 2.7997691863819965,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00042296694810350585,
|
|
"loss": 5.6654,
|
|
"mean_token_accuracy": 0.20121956020593643,
|
|
"num_tokens": 61490591.0,
|
|
"step": 24260
|
|
},
|
|
{
|
|
"entropy": 6.282038068771362,
|
|
"epoch": 2.8003462204270053,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004229358595156083,
|
|
"loss": 5.6791,
|
|
"mean_token_accuracy": 0.20370960831642151,
|
|
"num_tokens": 61503414.0,
|
|
"step": 24265
|
|
},
|
|
{
|
|
"entropy": 6.2678296089172365,
|
|
"epoch": 2.8009232544720137,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004229047659519617,
|
|
"loss": 5.6124,
|
|
"mean_token_accuracy": 0.21066644191741943,
|
|
"num_tokens": 61516655.0,
|
|
"step": 24270
|
|
},
|
|
{
|
|
"entropy": 6.343933391571045,
|
|
"epoch": 2.8015002885170226,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004228736674136117,
|
|
"loss": 5.7567,
|
|
"mean_token_accuracy": 0.2028947114944458,
|
|
"num_tokens": 61529589.0,
|
|
"step": 24275
|
|
},
|
|
{
|
|
"entropy": 6.292514181137085,
|
|
"epoch": 2.802077322562031,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004228425639016044,
|
|
"loss": 5.642,
|
|
"mean_token_accuracy": 0.20794799029827118,
|
|
"num_tokens": 61541648.0,
|
|
"step": 24280
|
|
},
|
|
{
|
|
"entropy": 6.330664873123169,
|
|
"epoch": 2.80265435660704,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004228114554169858,
|
|
"loss": 5.7039,
|
|
"mean_token_accuracy": 0.20170037001371383,
|
|
"num_tokens": 61552864.0,
|
|
"step": 24285
|
|
},
|
|
{
|
|
"entropy": 6.269150066375732,
|
|
"epoch": 2.8032313906520487,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004227803419608024,
|
|
"loss": 5.7633,
|
|
"mean_token_accuracy": 0.19741745740175248,
|
|
"num_tokens": 61565179.0,
|
|
"step": 24290
|
|
},
|
|
{
|
|
"entropy": 6.345161008834839,
|
|
"epoch": 2.803808424697057,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00042274922353410056,
|
|
"loss": 5.7193,
|
|
"mean_token_accuracy": 0.20393816977739335,
|
|
"num_tokens": 61577386.0,
|
|
"step": 24295
|
|
},
|
|
{
|
|
"entropy": 6.29252290725708,
|
|
"epoch": 2.8043854587420656,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00042271810013792696,
|
|
"loss": 5.6661,
|
|
"mean_token_accuracy": 0.2079485058784485,
|
|
"num_tokens": 61590519.0,
|
|
"step": 24300
|
|
},
|
|
{
|
|
"entropy": 6.251400947570801,
|
|
"epoch": 2.8049624927870744,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004226869717733285,
|
|
"loss": 5.6936,
|
|
"mean_token_accuracy": 0.2089969366788864,
|
|
"num_tokens": 61603323.0,
|
|
"step": 24305
|
|
},
|
|
{
|
|
"entropy": 6.306489896774292,
|
|
"epoch": 2.8055395268320833,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00042265583844135207,
|
|
"loss": 5.6193,
|
|
"mean_token_accuracy": 0.2089267373085022,
|
|
"num_tokens": 61615637.0,
|
|
"step": 24310
|
|
},
|
|
{
|
|
"entropy": 6.2073057174682615,
|
|
"epoch": 2.8061165608770917,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00042262470014304486,
|
|
"loss": 5.6268,
|
|
"mean_token_accuracy": 0.21037256121635436,
|
|
"num_tokens": 61628004.0,
|
|
"step": 24315
|
|
},
|
|
{
|
|
"entropy": 6.236581945419312,
|
|
"epoch": 2.8066935949221,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004225935568794542,
|
|
"loss": 5.5705,
|
|
"mean_token_accuracy": 0.2150061771273613,
|
|
"num_tokens": 61641274.0,
|
|
"step": 24320
|
|
},
|
|
{
|
|
"entropy": 6.332412910461426,
|
|
"epoch": 2.807270628967109,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00042256240865162764,
|
|
"loss": 5.7743,
|
|
"mean_token_accuracy": 0.19612537920475007,
|
|
"num_tokens": 61654398.0,
|
|
"step": 24325
|
|
},
|
|
{
|
|
"entropy": 6.316621160507202,
|
|
"epoch": 2.807847663012118,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00042253125546061265,
|
|
"loss": 5.7339,
|
|
"mean_token_accuracy": 0.19748370349407196,
|
|
"num_tokens": 61667261.0,
|
|
"step": 24330
|
|
},
|
|
{
|
|
"entropy": 6.342468929290772,
|
|
"epoch": 2.8084246970571263,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004225000973074572,
|
|
"loss": 5.75,
|
|
"mean_token_accuracy": 0.2020742267370224,
|
|
"num_tokens": 61678871.0,
|
|
"step": 24335
|
|
},
|
|
{
|
|
"entropy": 6.234073162078857,
|
|
"epoch": 2.809001731102135,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00042246893419320923,
|
|
"loss": 5.6711,
|
|
"mean_token_accuracy": 0.20948117077350617,
|
|
"num_tokens": 61692124.0,
|
|
"step": 24340
|
|
},
|
|
{
|
|
"entropy": 6.29853925704956,
|
|
"epoch": 2.8095787651471436,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.000422437766118917,
|
|
"loss": 5.7242,
|
|
"mean_token_accuracy": 0.20716237127780915,
|
|
"num_tokens": 61704164.0,
|
|
"step": 24345
|
|
},
|
|
{
|
|
"entropy": 6.2400322437286375,
|
|
"epoch": 2.8101557991921524,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004224065930856286,
|
|
"loss": 5.6403,
|
|
"mean_token_accuracy": 0.20508529245853424,
|
|
"num_tokens": 61716031.0,
|
|
"step": 24350
|
|
},
|
|
{
|
|
"entropy": 6.344346237182617,
|
|
"epoch": 2.810732833237161,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004223754150943927,
|
|
"loss": 5.6539,
|
|
"mean_token_accuracy": 0.20611535310745238,
|
|
"num_tokens": 61728663.0,
|
|
"step": 24355
|
|
},
|
|
{
|
|
"entropy": 6.263796091079712,
|
|
"epoch": 2.8113098672821697,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.000422344232146258,
|
|
"loss": 5.6412,
|
|
"mean_token_accuracy": 0.20716868191957474,
|
|
"num_tokens": 61740998.0,
|
|
"step": 24360
|
|
},
|
|
{
|
|
"entropy": 6.237046337127685,
|
|
"epoch": 2.8118869013271786,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00042231304424227315,
|
|
"loss": 5.6886,
|
|
"mean_token_accuracy": 0.2063811257481575,
|
|
"num_tokens": 61753231.0,
|
|
"step": 24365
|
|
},
|
|
{
|
|
"entropy": 6.324074983596802,
|
|
"epoch": 2.812463935372187,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00042228185138348736,
|
|
"loss": 5.7336,
|
|
"mean_token_accuracy": 0.1959283396601677,
|
|
"num_tokens": 61765046.0,
|
|
"step": 24370
|
|
},
|
|
{
|
|
"entropy": 6.2668980121612545,
|
|
"epoch": 2.8130409694171954,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004222506535709496,
|
|
"loss": 5.6143,
|
|
"mean_token_accuracy": 0.20766304880380632,
|
|
"num_tokens": 61776705.0,
|
|
"step": 24375
|
|
},
|
|
{
|
|
"entropy": 6.307502126693725,
|
|
"epoch": 2.8136180034622043,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004222194508057092,
|
|
"loss": 5.6314,
|
|
"mean_token_accuracy": 0.2077794000506401,
|
|
"num_tokens": 61790682.0,
|
|
"step": 24380
|
|
},
|
|
{
|
|
"entropy": 6.258563995361328,
|
|
"epoch": 2.814195037507213,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004221882430888157,
|
|
"loss": 5.6172,
|
|
"mean_token_accuracy": 0.20497007369995118,
|
|
"num_tokens": 61803329.0,
|
|
"step": 24385
|
|
},
|
|
{
|
|
"entropy": 6.252021741867066,
|
|
"epoch": 2.8147720715522215,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00042215703042131883,
|
|
"loss": 5.6648,
|
|
"mean_token_accuracy": 0.20551086813211442,
|
|
"num_tokens": 61815996.0,
|
|
"step": 24390
|
|
},
|
|
{
|
|
"entropy": 6.202037620544433,
|
|
"epoch": 2.8153491055972304,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004221258128042682,
|
|
"loss": 5.6426,
|
|
"mean_token_accuracy": 0.20972182750701904,
|
|
"num_tokens": 61828281.0,
|
|
"step": 24395
|
|
},
|
|
{
|
|
"entropy": 6.340979957580567,
|
|
"epoch": 2.815926139642239,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00042209459023871405,
|
|
"loss": 5.7422,
|
|
"mean_token_accuracy": 0.19639548361301423,
|
|
"num_tokens": 61840894.0,
|
|
"step": 24400
|
|
},
|
|
{
|
|
"entropy": 6.357145166397094,
|
|
"epoch": 2.8165031736872477,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00042206336272570643,
|
|
"loss": 5.7013,
|
|
"mean_token_accuracy": 0.19916598945856095,
|
|
"num_tokens": 61852767.0,
|
|
"step": 24405
|
|
},
|
|
{
|
|
"entropy": 6.318993282318115,
|
|
"epoch": 2.817080207732256,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00042203213026629566,
|
|
"loss": 5.5828,
|
|
"mean_token_accuracy": 0.21256356686353683,
|
|
"num_tokens": 61866497.0,
|
|
"step": 24410
|
|
},
|
|
{
|
|
"entropy": 6.289728450775146,
|
|
"epoch": 2.817657241777265,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00042200089286153217,
|
|
"loss": 5.7335,
|
|
"mean_token_accuracy": 0.19933657944202424,
|
|
"num_tokens": 61879024.0,
|
|
"step": 24415
|
|
},
|
|
{
|
|
"entropy": 6.253601789474487,
|
|
"epoch": 2.8182342758222734,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004219696505124667,
|
|
"loss": 5.6089,
|
|
"mean_token_accuracy": 0.20932333767414094,
|
|
"num_tokens": 61890582.0,
|
|
"step": 24420
|
|
},
|
|
{
|
|
"entropy": 6.246962022781372,
|
|
"epoch": 2.8188113098672822,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00042193840322015,
|
|
"loss": 5.6266,
|
|
"mean_token_accuracy": 0.21130513697862624,
|
|
"num_tokens": 61903140.0,
|
|
"step": 24425
|
|
},
|
|
{
|
|
"entropy": 6.233370590209961,
|
|
"epoch": 2.8193883439122907,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00042190715098563313,
|
|
"loss": 5.5819,
|
|
"mean_token_accuracy": 0.20736135691404342,
|
|
"num_tokens": 61915953.0,
|
|
"step": 24430
|
|
},
|
|
{
|
|
"entropy": 6.262146759033203,
|
|
"epoch": 2.8199653779572995,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004218758938099672,
|
|
"loss": 5.7307,
|
|
"mean_token_accuracy": 0.20075396001338958,
|
|
"num_tokens": 61928120.0,
|
|
"step": 24435
|
|
},
|
|
{
|
|
"entropy": 6.330214595794677,
|
|
"epoch": 2.8205424120023084,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004218446316942035,
|
|
"loss": 5.6734,
|
|
"mean_token_accuracy": 0.20727865844964982,
|
|
"num_tokens": 61941164.0,
|
|
"step": 24440
|
|
},
|
|
{
|
|
"entropy": 6.265660810470581,
|
|
"epoch": 2.821119446047317,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004218133646393937,
|
|
"loss": 5.6247,
|
|
"mean_token_accuracy": 0.21138952672481537,
|
|
"num_tokens": 61954310.0,
|
|
"step": 24445
|
|
},
|
|
{
|
|
"entropy": 6.284226608276367,
|
|
"epoch": 2.821696480092325,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004217820926465892,
|
|
"loss": 5.7095,
|
|
"mean_token_accuracy": 0.1988588824868202,
|
|
"num_tokens": 61966952.0,
|
|
"step": 24450
|
|
},
|
|
{
|
|
"entropy": 6.279386186599732,
|
|
"epoch": 2.822273514137334,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004217508157168418,
|
|
"loss": 5.6556,
|
|
"mean_token_accuracy": 0.20097137987613678,
|
|
"num_tokens": 61979547.0,
|
|
"step": 24455
|
|
},
|
|
{
|
|
"entropy": 6.272848749160767,
|
|
"epoch": 2.822850548182343,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00042171953385120384,
|
|
"loss": 5.6802,
|
|
"mean_token_accuracy": 0.20549411624670028,
|
|
"num_tokens": 61992188.0,
|
|
"step": 24460
|
|
},
|
|
{
|
|
"entropy": 6.369096899032593,
|
|
"epoch": 2.8234275822273514,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00042168824705072713,
|
|
"loss": 5.6707,
|
|
"mean_token_accuracy": 0.21178066730499268,
|
|
"num_tokens": 62005426.0,
|
|
"step": 24465
|
|
},
|
|
{
|
|
"entropy": 6.2482623100280765,
|
|
"epoch": 2.82400461627236,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004216569553164641,
|
|
"loss": 5.6037,
|
|
"mean_token_accuracy": 0.20939172506332399,
|
|
"num_tokens": 62018247.0,
|
|
"step": 24470
|
|
},
|
|
{
|
|
"entropy": 6.184626674652099,
|
|
"epoch": 2.8245816503173686,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00042162565864946723,
|
|
"loss": 5.6698,
|
|
"mean_token_accuracy": 0.20358436554670334,
|
|
"num_tokens": 62030503.0,
|
|
"step": 24475
|
|
},
|
|
{
|
|
"entropy": 6.364025545120239,
|
|
"epoch": 2.8251586843623775,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004215943570507891,
|
|
"loss": 5.7156,
|
|
"mean_token_accuracy": 0.2002929612994194,
|
|
"num_tokens": 62043453.0,
|
|
"step": 24480
|
|
},
|
|
{
|
|
"entropy": 6.253956508636475,
|
|
"epoch": 2.825735718407386,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00042156305052148263,
|
|
"loss": 5.5994,
|
|
"mean_token_accuracy": 0.21289331018924712,
|
|
"num_tokens": 62057317.0,
|
|
"step": 24485
|
|
},
|
|
{
|
|
"entropy": 6.284417963027954,
|
|
"epoch": 2.8263127524523948,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00042153173906260083,
|
|
"loss": 5.6658,
|
|
"mean_token_accuracy": 0.20268275886774062,
|
|
"num_tokens": 62069360.0,
|
|
"step": 24490
|
|
},
|
|
{
|
|
"entropy": 6.23651156425476,
|
|
"epoch": 2.826889786497403,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00042150042267519665,
|
|
"loss": 5.6499,
|
|
"mean_token_accuracy": 0.2069375067949295,
|
|
"num_tokens": 62082157.0,
|
|
"step": 24495
|
|
},
|
|
{
|
|
"entropy": 6.277358722686768,
|
|
"epoch": 2.827466820542412,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00042146910136032367,
|
|
"loss": 5.6122,
|
|
"mean_token_accuracy": 0.21059834212064743,
|
|
"num_tokens": 62094268.0,
|
|
"step": 24500
|
|
},
|
|
{
|
|
"entropy": 6.333056020736694,
|
|
"epoch": 2.8280438545874205,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00042143777511903513,
|
|
"loss": 5.643,
|
|
"mean_token_accuracy": 0.2073887199163437,
|
|
"num_tokens": 62107610.0,
|
|
"step": 24505
|
|
},
|
|
{
|
|
"entropy": 6.268117427825928,
|
|
"epoch": 2.8286208886324293,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00042140644395238477,
|
|
"loss": 5.6479,
|
|
"mean_token_accuracy": 0.2062526151537895,
|
|
"num_tokens": 62120279.0,
|
|
"step": 24510
|
|
},
|
|
{
|
|
"entropy": 6.152829599380493,
|
|
"epoch": 2.829197922677438,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004213751078614264,
|
|
"loss": 5.5002,
|
|
"mean_token_accuracy": 0.22233829498291016,
|
|
"num_tokens": 62134204.0,
|
|
"step": 24515
|
|
},
|
|
{
|
|
"entropy": 6.2259644031524655,
|
|
"epoch": 2.8297749567224466,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000421343766847214,
|
|
"loss": 5.5897,
|
|
"mean_token_accuracy": 0.21484220623970032,
|
|
"num_tokens": 62147241.0,
|
|
"step": 24520
|
|
},
|
|
{
|
|
"entropy": 6.293903541564942,
|
|
"epoch": 2.830351990767455,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004213124209108016,
|
|
"loss": 5.5868,
|
|
"mean_token_accuracy": 0.21121748834848403,
|
|
"num_tokens": 62159935.0,
|
|
"step": 24525
|
|
},
|
|
{
|
|
"entropy": 6.21681432723999,
|
|
"epoch": 2.830929024812464,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004212810700532437,
|
|
"loss": 5.6291,
|
|
"mean_token_accuracy": 0.20893940329551697,
|
|
"num_tokens": 62172498.0,
|
|
"step": 24530
|
|
},
|
|
{
|
|
"entropy": 6.242179489135742,
|
|
"epoch": 2.8315060588574728,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004212497142755947,
|
|
"loss": 5.6528,
|
|
"mean_token_accuracy": 0.19786501675844193,
|
|
"num_tokens": 62186150.0,
|
|
"step": 24535
|
|
},
|
|
{
|
|
"entropy": 6.378966569900513,
|
|
"epoch": 2.832083092902481,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00042121835357890916,
|
|
"loss": 5.7332,
|
|
"mean_token_accuracy": 0.2044931173324585,
|
|
"num_tokens": 62199455.0,
|
|
"step": 24540
|
|
},
|
|
{
|
|
"entropy": 6.354912233352661,
|
|
"epoch": 2.83266012694749,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004211869879642419,
|
|
"loss": 5.6594,
|
|
"mean_token_accuracy": 0.19967105239629745,
|
|
"num_tokens": 62213459.0,
|
|
"step": 24545
|
|
},
|
|
{
|
|
"entropy": 6.321961402893066,
|
|
"epoch": 2.8332371609924984,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00042115561743264797,
|
|
"loss": 5.6446,
|
|
"mean_token_accuracy": 0.20219760835170747,
|
|
"num_tokens": 62225250.0,
|
|
"step": 24550
|
|
},
|
|
{
|
|
"entropy": 6.22512674331665,
|
|
"epoch": 2.8338141950375073,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004211242419851824,
|
|
"loss": 5.624,
|
|
"mean_token_accuracy": 0.21420508474111558,
|
|
"num_tokens": 62238334.0,
|
|
"step": 24555
|
|
},
|
|
{
|
|
"entropy": 6.309490633010864,
|
|
"epoch": 2.8343912290825157,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00042109286162290055,
|
|
"loss": 5.6877,
|
|
"mean_token_accuracy": 0.20504627972841263,
|
|
"num_tokens": 62251498.0,
|
|
"step": 24560
|
|
},
|
|
{
|
|
"entropy": 6.325494813919067,
|
|
"epoch": 2.8349682631275246,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004210614763468579,
|
|
"loss": 5.726,
|
|
"mean_token_accuracy": 0.20420906692743301,
|
|
"num_tokens": 62264423.0,
|
|
"step": 24565
|
|
},
|
|
{
|
|
"entropy": 6.269174289703369,
|
|
"epoch": 2.8355452971725335,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00042103008615811,
|
|
"loss": 5.593,
|
|
"mean_token_accuracy": 0.20907282531261445,
|
|
"num_tokens": 62276889.0,
|
|
"step": 24570
|
|
},
|
|
{
|
|
"entropy": 6.279245376586914,
|
|
"epoch": 2.836122331217542,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004209986910577127,
|
|
"loss": 5.706,
|
|
"mean_token_accuracy": 0.20422278642654418,
|
|
"num_tokens": 62289043.0,
|
|
"step": 24575
|
|
},
|
|
{
|
|
"entropy": 6.275703096389771,
|
|
"epoch": 2.8366993652625503,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00042096729104672194,
|
|
"loss": 5.6908,
|
|
"mean_token_accuracy": 0.2076078861951828,
|
|
"num_tokens": 62301445.0,
|
|
"step": 24580
|
|
},
|
|
{
|
|
"entropy": 6.3255805492401125,
|
|
"epoch": 2.837276399307559,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00042093588612619385,
|
|
"loss": 5.7215,
|
|
"mean_token_accuracy": 0.1976776137948036,
|
|
"num_tokens": 62314263.0,
|
|
"step": 24585
|
|
},
|
|
{
|
|
"entropy": 6.34928183555603,
|
|
"epoch": 2.837853433352568,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004209044762971847,
|
|
"loss": 5.6373,
|
|
"mean_token_accuracy": 0.20834840536117555,
|
|
"num_tokens": 62327873.0,
|
|
"step": 24590
|
|
},
|
|
{
|
|
"entropy": 6.314883995056152,
|
|
"epoch": 2.8384304673975764,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000420873061560751,
|
|
"loss": 5.6626,
|
|
"mean_token_accuracy": 0.20366329252719878,
|
|
"num_tokens": 62340827.0,
|
|
"step": 24595
|
|
},
|
|
{
|
|
"entropy": 6.3202063083648685,
|
|
"epoch": 2.839007501442585,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004208416419179494,
|
|
"loss": 5.7832,
|
|
"mean_token_accuracy": 0.1992715761065483,
|
|
"num_tokens": 62352995.0,
|
|
"step": 24600
|
|
},
|
|
{
|
|
"entropy": 6.302844524383545,
|
|
"epoch": 2.8395845354875937,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00042081021736983657,
|
|
"loss": 5.7126,
|
|
"mean_token_accuracy": 0.19662009328603744,
|
|
"num_tokens": 62365647.0,
|
|
"step": 24605
|
|
},
|
|
{
|
|
"entropy": 6.300964212417602,
|
|
"epoch": 2.8401615695326026,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004207787879174695,
|
|
"loss": 5.6523,
|
|
"mean_token_accuracy": 0.2037101209163666,
|
|
"num_tokens": 62377277.0,
|
|
"step": 24610
|
|
},
|
|
{
|
|
"entropy": 6.243743419647217,
|
|
"epoch": 2.840738603577611,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00042074735356190525,
|
|
"loss": 5.6541,
|
|
"mean_token_accuracy": 0.20436837524175644,
|
|
"num_tokens": 62389338.0,
|
|
"step": 24615
|
|
},
|
|
{
|
|
"entropy": 6.3411744117736815,
|
|
"epoch": 2.84131563762262,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004207159143042012,
|
|
"loss": 5.7048,
|
|
"mean_token_accuracy": 0.1987220361828804,
|
|
"num_tokens": 62401933.0,
|
|
"step": 24620
|
|
},
|
|
{
|
|
"entropy": 6.2420275688171385,
|
|
"epoch": 2.8418926716676283,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004206844701454148,
|
|
"loss": 5.5858,
|
|
"mean_token_accuracy": 0.219431734085083,
|
|
"num_tokens": 62414738.0,
|
|
"step": 24625
|
|
},
|
|
{
|
|
"entropy": 6.373111343383789,
|
|
"epoch": 2.842469705712637,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00042065302108660355,
|
|
"loss": 5.759,
|
|
"mean_token_accuracy": 0.1910221442580223,
|
|
"num_tokens": 62426565.0,
|
|
"step": 24630
|
|
},
|
|
{
|
|
"entropy": 6.204355192184448,
|
|
"epoch": 2.8430467397576455,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004206215671288253,
|
|
"loss": 5.6209,
|
|
"mean_token_accuracy": 0.2179600015282631,
|
|
"num_tokens": 62438992.0,
|
|
"step": 24635
|
|
},
|
|
{
|
|
"entropy": 6.239711618423462,
|
|
"epoch": 2.8436237738026544,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00042059010827313794,
|
|
"loss": 5.6451,
|
|
"mean_token_accuracy": 0.2075016126036644,
|
|
"num_tokens": 62453004.0,
|
|
"step": 24640
|
|
},
|
|
{
|
|
"entropy": 6.3646704196929935,
|
|
"epoch": 2.8442008078476633,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00042055864452059967,
|
|
"loss": 5.7463,
|
|
"mean_token_accuracy": 0.20036121755838393,
|
|
"num_tokens": 62466367.0,
|
|
"step": 24645
|
|
},
|
|
{
|
|
"entropy": 6.276161336898804,
|
|
"epoch": 2.8447778418926717,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004205271758722687,
|
|
"loss": 5.5291,
|
|
"mean_token_accuracy": 0.2173529088497162,
|
|
"num_tokens": 62479881.0,
|
|
"step": 24650
|
|
},
|
|
{
|
|
"entropy": 6.3450093269348145,
|
|
"epoch": 2.84535487593768,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004204957023292034,
|
|
"loss": 5.8201,
|
|
"mean_token_accuracy": 0.19415062218904494,
|
|
"num_tokens": 62493634.0,
|
|
"step": 24655
|
|
},
|
|
{
|
|
"entropy": 6.288174247741699,
|
|
"epoch": 2.845931909982689,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00042046422389246246,
|
|
"loss": 5.5844,
|
|
"mean_token_accuracy": 0.21541155278682708,
|
|
"num_tokens": 62505045.0,
|
|
"step": 24660
|
|
},
|
|
{
|
|
"entropy": 6.310085296630859,
|
|
"epoch": 2.846508944027698,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00042043274056310454,
|
|
"loss": 5.6949,
|
|
"mean_token_accuracy": 0.19860265105962754,
|
|
"num_tokens": 62517403.0,
|
|
"step": 24665
|
|
},
|
|
{
|
|
"entropy": 6.257347440719604,
|
|
"epoch": 2.8470859780727062,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004204012523421888,
|
|
"loss": 5.6304,
|
|
"mean_token_accuracy": 0.20549745559692384,
|
|
"num_tokens": 62529276.0,
|
|
"step": 24670
|
|
},
|
|
{
|
|
"entropy": 6.18459005355835,
|
|
"epoch": 2.847663012117715,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.000420369759230774,
|
|
"loss": 5.5296,
|
|
"mean_token_accuracy": 0.21557887345552446,
|
|
"num_tokens": 62542705.0,
|
|
"step": 24675
|
|
},
|
|
{
|
|
"entropy": 6.266983890533448,
|
|
"epoch": 2.8482400461627235,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00042033826122991956,
|
|
"loss": 5.6478,
|
|
"mean_token_accuracy": 0.20268526524305344,
|
|
"num_tokens": 62555547.0,
|
|
"step": 24680
|
|
},
|
|
{
|
|
"entropy": 6.182284307479859,
|
|
"epoch": 2.8488170802077324,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.000420306758340685,
|
|
"loss": 5.5529,
|
|
"mean_token_accuracy": 0.2156699165701866,
|
|
"num_tokens": 62569118.0,
|
|
"step": 24685
|
|
},
|
|
{
|
|
"entropy": 6.212188291549682,
|
|
"epoch": 2.849394114252741,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00042027525056412973,
|
|
"loss": 5.5834,
|
|
"mean_token_accuracy": 0.20967470556497575,
|
|
"num_tokens": 62580632.0,
|
|
"step": 24690
|
|
},
|
|
{
|
|
"entropy": 6.215041160583496,
|
|
"epoch": 2.8499711482977497,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004202437379013136,
|
|
"loss": 5.4767,
|
|
"mean_token_accuracy": 0.22377861440181732,
|
|
"num_tokens": 62593554.0,
|
|
"step": 24695
|
|
},
|
|
{
|
|
"entropy": 6.26546721458435,
|
|
"epoch": 2.850548182342758,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004202122203532965,
|
|
"loss": 5.6695,
|
|
"mean_token_accuracy": 0.20374905169010163,
|
|
"num_tokens": 62606454.0,
|
|
"step": 24700
|
|
},
|
|
{
|
|
"entropy": 6.267917537689209,
|
|
"epoch": 2.851125216387767,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00042018069792113845,
|
|
"loss": 5.6619,
|
|
"mean_token_accuracy": 0.2080647259950638,
|
|
"num_tokens": 62620665.0,
|
|
"step": 24705
|
|
},
|
|
{
|
|
"entropy": 6.220990753173828,
|
|
"epoch": 2.8517022504327754,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004201491706058998,
|
|
"loss": 5.6061,
|
|
"mean_token_accuracy": 0.21244151890277863,
|
|
"num_tokens": 62632849.0,
|
|
"step": 24710
|
|
},
|
|
{
|
|
"entropy": 6.270468616485596,
|
|
"epoch": 2.8522792844777842,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004201176384086408,
|
|
"loss": 5.6692,
|
|
"mean_token_accuracy": 0.20357554852962495,
|
|
"num_tokens": 62644355.0,
|
|
"step": 24715
|
|
},
|
|
{
|
|
"entropy": 6.273852300643921,
|
|
"epoch": 2.852856318522793,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004200861013304222,
|
|
"loss": 5.6589,
|
|
"mean_token_accuracy": 0.2070357844233513,
|
|
"num_tokens": 62656642.0,
|
|
"step": 24720
|
|
},
|
|
{
|
|
"entropy": 6.284038448333741,
|
|
"epoch": 2.8534333525678015,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00042005455937230466,
|
|
"loss": 5.5908,
|
|
"mean_token_accuracy": 0.21206920742988586,
|
|
"num_tokens": 62669993.0,
|
|
"step": 24725
|
|
},
|
|
{
|
|
"entropy": 6.2940301418304445,
|
|
"epoch": 2.85401038661281,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000420023012535349,
|
|
"loss": 5.693,
|
|
"mean_token_accuracy": 0.20228539407253265,
|
|
"num_tokens": 62682336.0,
|
|
"step": 24730
|
|
},
|
|
{
|
|
"entropy": 6.356509494781494,
|
|
"epoch": 2.854587420657819,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004199914608206164,
|
|
"loss": 5.7358,
|
|
"mean_token_accuracy": 0.2026624709367752,
|
|
"num_tokens": 62694893.0,
|
|
"step": 24735
|
|
},
|
|
{
|
|
"entropy": 6.345118188858033,
|
|
"epoch": 2.8551644547028276,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.000419959904229168,
|
|
"loss": 5.6528,
|
|
"mean_token_accuracy": 0.2035708174109459,
|
|
"num_tokens": 62707486.0,
|
|
"step": 24740
|
|
},
|
|
{
|
|
"entropy": 6.3470494747161865,
|
|
"epoch": 2.855741488747836,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004199283427620653,
|
|
"loss": 5.7498,
|
|
"mean_token_accuracy": 0.2006876677274704,
|
|
"num_tokens": 62721350.0,
|
|
"step": 24745
|
|
},
|
|
{
|
|
"entropy": 6.197284698486328,
|
|
"epoch": 2.856318522792845,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00041989677642036973,
|
|
"loss": 5.5509,
|
|
"mean_token_accuracy": 0.2134019762277603,
|
|
"num_tokens": 62734133.0,
|
|
"step": 24750
|
|
},
|
|
{
|
|
"entropy": 6.275422620773315,
|
|
"epoch": 2.8568955568378533,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00041986520520514303,
|
|
"loss": 5.5844,
|
|
"mean_token_accuracy": 0.21036942452192306,
|
|
"num_tokens": 62746218.0,
|
|
"step": 24755
|
|
},
|
|
{
|
|
"entropy": 6.307258892059326,
|
|
"epoch": 2.857472590882862,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00041983362911744715,
|
|
"loss": 5.7225,
|
|
"mean_token_accuracy": 0.20028795301914215,
|
|
"num_tokens": 62759137.0,
|
|
"step": 24760
|
|
},
|
|
{
|
|
"entropy": 6.290567445755005,
|
|
"epoch": 2.8580496249278706,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004198020481583441,
|
|
"loss": 5.659,
|
|
"mean_token_accuracy": 0.20359014421701432,
|
|
"num_tokens": 62772287.0,
|
|
"step": 24765
|
|
},
|
|
{
|
|
"entropy": 6.3574377536773685,
|
|
"epoch": 2.8586266589728795,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00041977046232889606,
|
|
"loss": 5.6756,
|
|
"mean_token_accuracy": 0.20389679819345474,
|
|
"num_tokens": 62785354.0,
|
|
"step": 24770
|
|
},
|
|
{
|
|
"entropy": 6.278729104995728,
|
|
"epoch": 2.859203693017888,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00041973887163016546,
|
|
"loss": 5.6538,
|
|
"mean_token_accuracy": 0.2123601943254471,
|
|
"num_tokens": 62798356.0,
|
|
"step": 24775
|
|
},
|
|
{
|
|
"entropy": 6.250250339508057,
|
|
"epoch": 2.8597807270628968,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004197072760632147,
|
|
"loss": 5.5915,
|
|
"mean_token_accuracy": 0.21125935167074203,
|
|
"num_tokens": 62809966.0,
|
|
"step": 24780
|
|
},
|
|
{
|
|
"entropy": 6.272337818145752,
|
|
"epoch": 2.860357761107905,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00041967567562910675,
|
|
"loss": 5.6177,
|
|
"mean_token_accuracy": 0.20405017733573913,
|
|
"num_tokens": 62821833.0,
|
|
"step": 24785
|
|
},
|
|
{
|
|
"entropy": 6.259753942489624,
|
|
"epoch": 2.860934795152914,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00041964407032890426,
|
|
"loss": 5.6199,
|
|
"mean_token_accuracy": 0.21314382702112197,
|
|
"num_tokens": 62833619.0,
|
|
"step": 24790
|
|
},
|
|
{
|
|
"entropy": 6.236772203445435,
|
|
"epoch": 2.861511829197923,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00041961246016367033,
|
|
"loss": 5.6469,
|
|
"mean_token_accuracy": 0.20206320583820342,
|
|
"num_tokens": 62846373.0,
|
|
"step": 24795
|
|
},
|
|
{
|
|
"entropy": 6.320559930801392,
|
|
"epoch": 2.8620888632429313,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00041958084513446807,
|
|
"loss": 5.7146,
|
|
"mean_token_accuracy": 0.2090005874633789,
|
|
"num_tokens": 62859311.0,
|
|
"step": 24800
|
|
},
|
|
{
|
|
"entropy": 6.312822151184082,
|
|
"epoch": 2.8626658972879397,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.000419549225242361,
|
|
"loss": 5.7147,
|
|
"mean_token_accuracy": 0.20246246010065078,
|
|
"num_tokens": 62871824.0,
|
|
"step": 24805
|
|
},
|
|
{
|
|
"entropy": 6.253323793411255,
|
|
"epoch": 2.8632429313329486,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004195176004884124,
|
|
"loss": 5.6527,
|
|
"mean_token_accuracy": 0.20027650147676468,
|
|
"num_tokens": 62883795.0,
|
|
"step": 24810
|
|
},
|
|
{
|
|
"entropy": 6.299838066101074,
|
|
"epoch": 2.8638199653779575,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004194859708736863,
|
|
"loss": 5.7037,
|
|
"mean_token_accuracy": 0.20411465167999268,
|
|
"num_tokens": 62896331.0,
|
|
"step": 24815
|
|
},
|
|
{
|
|
"entropy": 6.359110164642334,
|
|
"epoch": 2.864396999422966,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00041945433639924617,
|
|
"loss": 5.7471,
|
|
"mean_token_accuracy": 0.19504598826169967,
|
|
"num_tokens": 62907656.0,
|
|
"step": 24820
|
|
},
|
|
{
|
|
"entropy": 6.23306794166565,
|
|
"epoch": 2.8649740334679747,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00041942269706615623,
|
|
"loss": 5.5512,
|
|
"mean_token_accuracy": 0.20998361557722092,
|
|
"num_tokens": 62921132.0,
|
|
"step": 24825
|
|
},
|
|
{
|
|
"entropy": 6.258009910583496,
|
|
"epoch": 2.865551067512983,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00041939105287548055,
|
|
"loss": 5.6305,
|
|
"mean_token_accuracy": 0.20799764841794968,
|
|
"num_tokens": 62933989.0,
|
|
"step": 24830
|
|
},
|
|
{
|
|
"entropy": 6.282893800735474,
|
|
"epoch": 2.866128101557992,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00041935940382828365,
|
|
"loss": 5.7253,
|
|
"mean_token_accuracy": 0.19343871176242827,
|
|
"num_tokens": 62946284.0,
|
|
"step": 24835
|
|
},
|
|
{
|
|
"entropy": 6.266582918167114,
|
|
"epoch": 2.8667051356030004,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004193277499256299,
|
|
"loss": 5.6599,
|
|
"mean_token_accuracy": 0.20717596411705017,
|
|
"num_tokens": 62958690.0,
|
|
"step": 24840
|
|
},
|
|
{
|
|
"entropy": 6.308058261871338,
|
|
"epoch": 2.8672821696480093,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00041929609116858385,
|
|
"loss": 5.6963,
|
|
"mean_token_accuracy": 0.20280860513448715,
|
|
"num_tokens": 62970374.0,
|
|
"step": 24845
|
|
},
|
|
{
|
|
"entropy": 6.2022570133209225,
|
|
"epoch": 2.8678592036930177,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00041926442755821055,
|
|
"loss": 5.6103,
|
|
"mean_token_accuracy": 0.20930901616811753,
|
|
"num_tokens": 62982245.0,
|
|
"step": 24850
|
|
},
|
|
{
|
|
"entropy": 6.2994811058044435,
|
|
"epoch": 2.8684362377380266,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004192327590955748,
|
|
"loss": 5.6147,
|
|
"mean_token_accuracy": 0.2089069440960884,
|
|
"num_tokens": 62995546.0,
|
|
"step": 24855
|
|
},
|
|
{
|
|
"entropy": 6.340536451339721,
|
|
"epoch": 2.869013271783035,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00041920108578174197,
|
|
"loss": 5.7206,
|
|
"mean_token_accuracy": 0.20035638958215712,
|
|
"num_tokens": 63006937.0,
|
|
"step": 24860
|
|
},
|
|
{
|
|
"entropy": 6.307915115356446,
|
|
"epoch": 2.869590305828044,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004191694076177772,
|
|
"loss": 5.6292,
|
|
"mean_token_accuracy": 0.20403328388929368,
|
|
"num_tokens": 63019722.0,
|
|
"step": 24865
|
|
},
|
|
{
|
|
"entropy": 6.307921838760376,
|
|
"epoch": 2.8701673398730527,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00041913772460474603,
|
|
"loss": 5.73,
|
|
"mean_token_accuracy": 0.20368449240922928,
|
|
"num_tokens": 63031627.0,
|
|
"step": 24870
|
|
},
|
|
{
|
|
"entropy": 6.309134531021118,
|
|
"epoch": 2.870744373918061,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00041910603674371406,
|
|
"loss": 5.7545,
|
|
"mean_token_accuracy": 0.19816228598356248,
|
|
"num_tokens": 63043781.0,
|
|
"step": 24875
|
|
},
|
|
{
|
|
"entropy": 6.291825199127198,
|
|
"epoch": 2.8713214079630696,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004190743440357471,
|
|
"loss": 5.617,
|
|
"mean_token_accuracy": 0.21208431869745253,
|
|
"num_tokens": 63057196.0,
|
|
"step": 24880
|
|
},
|
|
{
|
|
"entropy": 6.294701671600341,
|
|
"epoch": 2.8718984420080784,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004190426464819112,
|
|
"loss": 5.6079,
|
|
"mean_token_accuracy": 0.20768255591392518,
|
|
"num_tokens": 63070013.0,
|
|
"step": 24885
|
|
},
|
|
{
|
|
"entropy": 6.311951398849487,
|
|
"epoch": 2.8724754760530873,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004190109440832724,
|
|
"loss": 5.6923,
|
|
"mean_token_accuracy": 0.20715832859277725,
|
|
"num_tokens": 63082733.0,
|
|
"step": 24890
|
|
},
|
|
{
|
|
"entropy": 6.309356737136841,
|
|
"epoch": 2.8730525100980957,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00041897923684089714,
|
|
"loss": 5.72,
|
|
"mean_token_accuracy": 0.20285115540027618,
|
|
"num_tokens": 63095275.0,
|
|
"step": 24895
|
|
},
|
|
{
|
|
"entropy": 6.279475688934326,
|
|
"epoch": 2.8736295441431046,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004189475247558516,
|
|
"loss": 5.6876,
|
|
"mean_token_accuracy": 0.20379520654678346,
|
|
"num_tokens": 63108184.0,
|
|
"step": 24900
|
|
},
|
|
{
|
|
"entropy": 6.276606702804566,
|
|
"epoch": 2.874206578188113,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00041891580782920263,
|
|
"loss": 5.5598,
|
|
"mean_token_accuracy": 0.20674587935209274,
|
|
"num_tokens": 63120157.0,
|
|
"step": 24905
|
|
},
|
|
{
|
|
"entropy": 6.277227163314819,
|
|
"epoch": 2.874783612233122,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00041888408606201695,
|
|
"loss": 5.6688,
|
|
"mean_token_accuracy": 0.2045833110809326,
|
|
"num_tokens": 63132390.0,
|
|
"step": 24910
|
|
},
|
|
{
|
|
"entropy": 6.23179259300232,
|
|
"epoch": 2.8753606462781303,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004188523594553615,
|
|
"loss": 5.675,
|
|
"mean_token_accuracy": 0.20663324296474456,
|
|
"num_tokens": 63145567.0,
|
|
"step": 24915
|
|
},
|
|
{
|
|
"entropy": 6.268257427215576,
|
|
"epoch": 2.875937680323139,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004188206280103034,
|
|
"loss": 5.7025,
|
|
"mean_token_accuracy": 0.20715190321207047,
|
|
"num_tokens": 63157921.0,
|
|
"step": 24920
|
|
},
|
|
{
|
|
"entropy": 6.3320948600769045,
|
|
"epoch": 2.876514714368148,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00041878889172790995,
|
|
"loss": 5.6404,
|
|
"mean_token_accuracy": 0.2083456799387932,
|
|
"num_tokens": 63169848.0,
|
|
"step": 24925
|
|
},
|
|
{
|
|
"entropy": 6.342430162429809,
|
|
"epoch": 2.8770917484131564,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004187571506092485,
|
|
"loss": 5.7672,
|
|
"mean_token_accuracy": 0.20046480745077133,
|
|
"num_tokens": 63182827.0,
|
|
"step": 24930
|
|
},
|
|
{
|
|
"entropy": 6.308949422836304,
|
|
"epoch": 2.877668782458165,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004187254046553867,
|
|
"loss": 5.6689,
|
|
"mean_token_accuracy": 0.2035600498318672,
|
|
"num_tokens": 63195636.0,
|
|
"step": 24935
|
|
},
|
|
{
|
|
"entropy": 6.350260829925537,
|
|
"epoch": 2.8782458165031737,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00041869365386739234,
|
|
"loss": 5.6717,
|
|
"mean_token_accuracy": 0.20271206945180892,
|
|
"num_tokens": 63210045.0,
|
|
"step": 24940
|
|
},
|
|
{
|
|
"entropy": 6.2679845809936525,
|
|
"epoch": 2.8788228505481825,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00041866189824633335,
|
|
"loss": 5.5876,
|
|
"mean_token_accuracy": 0.2063237264752388,
|
|
"num_tokens": 63223696.0,
|
|
"step": 24945
|
|
},
|
|
{
|
|
"entropy": 6.26953272819519,
|
|
"epoch": 2.879399884593191,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004186301377932777,
|
|
"loss": 5.6568,
|
|
"mean_token_accuracy": 0.20177958458662032,
|
|
"num_tokens": 63236325.0,
|
|
"step": 24950
|
|
},
|
|
{
|
|
"entropy": 6.3240350723266605,
|
|
"epoch": 2.8799769186381994,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004185983725092937,
|
|
"loss": 5.7185,
|
|
"mean_token_accuracy": 0.19612749069929122,
|
|
"num_tokens": 63249099.0,
|
|
"step": 24955
|
|
},
|
|
{
|
|
"entropy": 6.3994958877563475,
|
|
"epoch": 2.8805539526832082,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004185666023954498,
|
|
"loss": 5.7666,
|
|
"mean_token_accuracy": 0.19652038663625718,
|
|
"num_tokens": 63261346.0,
|
|
"step": 24960
|
|
},
|
|
{
|
|
"entropy": 6.262199020385742,
|
|
"epoch": 2.881130986728217,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004185348274528146,
|
|
"loss": 5.5768,
|
|
"mean_token_accuracy": 0.2146102100610733,
|
|
"num_tokens": 63274574.0,
|
|
"step": 24965
|
|
},
|
|
{
|
|
"entropy": 6.219927263259888,
|
|
"epoch": 2.8817080207732255,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00041850304768245675,
|
|
"loss": 5.5797,
|
|
"mean_token_accuracy": 0.21395696699619293,
|
|
"num_tokens": 63286708.0,
|
|
"step": 24970
|
|
},
|
|
{
|
|
"entropy": 6.306724119186401,
|
|
"epoch": 2.8822850548182344,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004184712630854451,
|
|
"loss": 5.6186,
|
|
"mean_token_accuracy": 0.2058671236038208,
|
|
"num_tokens": 63298769.0,
|
|
"step": 24975
|
|
},
|
|
{
|
|
"entropy": 6.302718639373779,
|
|
"epoch": 2.882862088863243,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004184394736628488,
|
|
"loss": 5.6893,
|
|
"mean_token_accuracy": 0.20315046459436417,
|
|
"num_tokens": 63311228.0,
|
|
"step": 24980
|
|
},
|
|
{
|
|
"entropy": 6.334771203994751,
|
|
"epoch": 2.8834391229082517,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004184076794157371,
|
|
"loss": 5.7165,
|
|
"mean_token_accuracy": 0.20398392379283906,
|
|
"num_tokens": 63323450.0,
|
|
"step": 24985
|
|
},
|
|
{
|
|
"entropy": 6.252768898010254,
|
|
"epoch": 2.88401615695326,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004183758803451793,
|
|
"loss": 5.5926,
|
|
"mean_token_accuracy": 0.21564585566520691,
|
|
"num_tokens": 63336948.0,
|
|
"step": 24990
|
|
},
|
|
{
|
|
"entropy": 6.296437835693359,
|
|
"epoch": 2.884593190998269,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00041834407645224505,
|
|
"loss": 5.6923,
|
|
"mean_token_accuracy": 0.20159712433815002,
|
|
"num_tokens": 63348328.0,
|
|
"step": 24995
|
|
},
|
|
{
|
|
"entropy": 6.278706169128418,
|
|
"epoch": 2.885170225043278,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004183122677380039,
|
|
"loss": 5.6423,
|
|
"mean_token_accuracy": 0.20447832196950913,
|
|
"num_tokens": 63359761.0,
|
|
"step": 25000
|
|
},
|
|
{
|
|
"entropy": 6.290283679962158,
|
|
"epoch": 2.885747259088286,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00041828045420352585,
|
|
"loss": 5.6413,
|
|
"mean_token_accuracy": 0.20627966821193694,
|
|
"num_tokens": 63371949.0,
|
|
"step": 25005
|
|
},
|
|
{
|
|
"entropy": 6.267902565002442,
|
|
"epoch": 2.8863242931332946,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00041824863584988086,
|
|
"loss": 5.6944,
|
|
"mean_token_accuracy": 0.1980934739112854,
|
|
"num_tokens": 63385021.0,
|
|
"step": 25010
|
|
},
|
|
{
|
|
"entropy": 6.250814914703369,
|
|
"epoch": 2.8869013271783035,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004182168126781392,
|
|
"loss": 5.6008,
|
|
"mean_token_accuracy": 0.20583415329456328,
|
|
"num_tokens": 63398391.0,
|
|
"step": 25015
|
|
},
|
|
{
|
|
"entropy": 6.383827161788941,
|
|
"epoch": 2.8874783612233124,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004181849846893712,
|
|
"loss": 5.7315,
|
|
"mean_token_accuracy": 0.19851785153150558,
|
|
"num_tokens": 63411161.0,
|
|
"step": 25020
|
|
},
|
|
{
|
|
"entropy": 6.233171463012695,
|
|
"epoch": 2.888055395268321,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004181531518846474,
|
|
"loss": 5.6527,
|
|
"mean_token_accuracy": 0.2105906769633293,
|
|
"num_tokens": 63424686.0,
|
|
"step": 25025
|
|
},
|
|
{
|
|
"entropy": 6.2565630912780765,
|
|
"epoch": 2.8886324293133296,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00041812131426503834,
|
|
"loss": 5.696,
|
|
"mean_token_accuracy": 0.20227278023958206,
|
|
"num_tokens": 63437424.0,
|
|
"step": 25030
|
|
},
|
|
{
|
|
"entropy": 6.321119737625122,
|
|
"epoch": 2.889209463358338,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004180894718316151,
|
|
"loss": 5.7472,
|
|
"mean_token_accuracy": 0.19942276179790497,
|
|
"num_tokens": 63452194.0,
|
|
"step": 25035
|
|
},
|
|
{
|
|
"entropy": 6.320767450332641,
|
|
"epoch": 2.889786497403347,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00041805762458544846,
|
|
"loss": 5.6174,
|
|
"mean_token_accuracy": 0.21162911653518676,
|
|
"num_tokens": 63465113.0,
|
|
"step": 25040
|
|
},
|
|
{
|
|
"entropy": 6.323999691009521,
|
|
"epoch": 2.8903635314483553,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00041802577252760963,
|
|
"loss": 5.7113,
|
|
"mean_token_accuracy": 0.2057264119386673,
|
|
"num_tokens": 63477791.0,
|
|
"step": 25045
|
|
},
|
|
{
|
|
"entropy": 6.314538049697876,
|
|
"epoch": 2.890940565493364,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00041799391565917,
|
|
"loss": 5.6595,
|
|
"mean_token_accuracy": 0.202808278799057,
|
|
"num_tokens": 63490280.0,
|
|
"step": 25050
|
|
},
|
|
{
|
|
"entropy": 6.342606496810913,
|
|
"epoch": 2.8915175995383726,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00041796205398120115,
|
|
"loss": 5.7064,
|
|
"mean_token_accuracy": 0.19900117665529252,
|
|
"num_tokens": 63502617.0,
|
|
"step": 25055
|
|
},
|
|
{
|
|
"entropy": 6.23744478225708,
|
|
"epoch": 2.8920946335833815,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00041793018749477454,
|
|
"loss": 5.5131,
|
|
"mean_token_accuracy": 0.2126069873571396,
|
|
"num_tokens": 63515209.0,
|
|
"step": 25060
|
|
},
|
|
{
|
|
"entropy": 6.281412935256958,
|
|
"epoch": 2.89267166762839,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004178983162009621,
|
|
"loss": 5.7413,
|
|
"mean_token_accuracy": 0.20017960220575332,
|
|
"num_tokens": 63527870.0,
|
|
"step": 25065
|
|
},
|
|
{
|
|
"entropy": 6.291341400146484,
|
|
"epoch": 2.8932487016733988,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004178664401008358,
|
|
"loss": 5.6286,
|
|
"mean_token_accuracy": 0.20657579898834227,
|
|
"num_tokens": 63541187.0,
|
|
"step": 25070
|
|
},
|
|
{
|
|
"entropy": 6.305284452438355,
|
|
"epoch": 2.8938257357184076,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00041783455919546767,
|
|
"loss": 5.6671,
|
|
"mean_token_accuracy": 0.20378590226173401,
|
|
"num_tokens": 63553892.0,
|
|
"step": 25075
|
|
},
|
|
{
|
|
"entropy": 6.229226446151733,
|
|
"epoch": 2.894402769763416,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00041780267348593016,
|
|
"loss": 5.58,
|
|
"mean_token_accuracy": 0.21682365089654923,
|
|
"num_tokens": 63565149.0,
|
|
"step": 25080
|
|
},
|
|
{
|
|
"entropy": 6.2576981544494625,
|
|
"epoch": 2.8949798038084245,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004177707829732956,
|
|
"loss": 5.6572,
|
|
"mean_token_accuracy": 0.20821669995784758,
|
|
"num_tokens": 63577114.0,
|
|
"step": 25085
|
|
},
|
|
{
|
|
"entropy": 6.257887601852417,
|
|
"epoch": 2.8955568378534333,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00041773888765863677,
|
|
"loss": 5.5964,
|
|
"mean_token_accuracy": 0.20918401032686235,
|
|
"num_tokens": 63589689.0,
|
|
"step": 25090
|
|
},
|
|
{
|
|
"entropy": 6.353279685974121,
|
|
"epoch": 2.896133871898442,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004177069875430263,
|
|
"loss": 5.7044,
|
|
"mean_token_accuracy": 0.1995902866125107,
|
|
"num_tokens": 63601888.0,
|
|
"step": 25095
|
|
},
|
|
{
|
|
"entropy": 6.284457778930664,
|
|
"epoch": 2.8967109059434506,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004176750826275372,
|
|
"loss": 5.7,
|
|
"mean_token_accuracy": 0.20063745975494385,
|
|
"num_tokens": 63614663.0,
|
|
"step": 25100
|
|
},
|
|
{
|
|
"entropy": 6.247959566116333,
|
|
"epoch": 2.8972879399884595,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004176431729132426,
|
|
"loss": 5.6406,
|
|
"mean_token_accuracy": 0.20677649974822998,
|
|
"num_tokens": 63626191.0,
|
|
"step": 25105
|
|
},
|
|
{
|
|
"entropy": 6.322126960754394,
|
|
"epoch": 2.897864974033468,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00041761125840121565,
|
|
"loss": 5.6353,
|
|
"mean_token_accuracy": 0.20748212635517121,
|
|
"num_tokens": 63638778.0,
|
|
"step": 25110
|
|
},
|
|
{
|
|
"entropy": 6.267091894149781,
|
|
"epoch": 2.8984420080784767,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004175793390925299,
|
|
"loss": 5.5495,
|
|
"mean_token_accuracy": 0.21032895594835282,
|
|
"num_tokens": 63653369.0,
|
|
"step": 25115
|
|
},
|
|
{
|
|
"entropy": 6.270925760269165,
|
|
"epoch": 2.899019042123485,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004175474149882589,
|
|
"loss": 5.6505,
|
|
"mean_token_accuracy": 0.20176509916782379,
|
|
"num_tokens": 63665442.0,
|
|
"step": 25120
|
|
},
|
|
{
|
|
"entropy": 6.214730930328369,
|
|
"epoch": 2.899596076168494,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004175154860894765,
|
|
"loss": 5.6018,
|
|
"mean_token_accuracy": 0.2154811978340149,
|
|
"num_tokens": 63678221.0,
|
|
"step": 25125
|
|
},
|
|
{
|
|
"entropy": 6.254687404632568,
|
|
"epoch": 2.9001731102135024,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004174835523972563,
|
|
"loss": 5.5894,
|
|
"mean_token_accuracy": 0.2155776649713516,
|
|
"num_tokens": 63690619.0,
|
|
"step": 25130
|
|
},
|
|
{
|
|
"entropy": 6.290982675552368,
|
|
"epoch": 2.9007501442585113,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00041745161391267276,
|
|
"loss": 5.667,
|
|
"mean_token_accuracy": 0.20212687999010087,
|
|
"num_tokens": 63703742.0,
|
|
"step": 25135
|
|
},
|
|
{
|
|
"entropy": 6.295825242996216,
|
|
"epoch": 2.9013271783035197,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00041741967063679993,
|
|
"loss": 5.6507,
|
|
"mean_token_accuracy": 0.2055546075105667,
|
|
"num_tokens": 63716929.0,
|
|
"step": 25140
|
|
},
|
|
{
|
|
"entropy": 6.243985223770141,
|
|
"epoch": 2.9019042123485286,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00041738772257071216,
|
|
"loss": 5.608,
|
|
"mean_token_accuracy": 0.20904375463724137,
|
|
"num_tokens": 63730301.0,
|
|
"step": 25145
|
|
},
|
|
{
|
|
"entropy": 6.203047370910644,
|
|
"epoch": 2.9024812463935374,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004173557697154841,
|
|
"loss": 5.5069,
|
|
"mean_token_accuracy": 0.21487298756837844,
|
|
"num_tokens": 63744294.0,
|
|
"step": 25150
|
|
},
|
|
{
|
|
"entropy": 6.284126710891724,
|
|
"epoch": 2.903058280438546,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00041732381207219046,
|
|
"loss": 5.6966,
|
|
"mean_token_accuracy": 0.19748999327421188,
|
|
"num_tokens": 63756634.0,
|
|
"step": 25155
|
|
},
|
|
{
|
|
"entropy": 6.298375034332276,
|
|
"epoch": 2.9036353144835543,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00041729184964190607,
|
|
"loss": 5.6317,
|
|
"mean_token_accuracy": 0.20705596804618837,
|
|
"num_tokens": 63768920.0,
|
|
"step": 25160
|
|
},
|
|
{
|
|
"entropy": 6.236512804031372,
|
|
"epoch": 2.904212348528563,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00041725988242570603,
|
|
"loss": 5.5932,
|
|
"mean_token_accuracy": 0.2102369487285614,
|
|
"num_tokens": 63781315.0,
|
|
"step": 25165
|
|
},
|
|
{
|
|
"entropy": 6.294569826126098,
|
|
"epoch": 2.904789382573572,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00041722791042466545,
|
|
"loss": 5.7104,
|
|
"mean_token_accuracy": 0.19871323555707932,
|
|
"num_tokens": 63793453.0,
|
|
"step": 25170
|
|
},
|
|
{
|
|
"entropy": 6.421709585189819,
|
|
"epoch": 2.9053664166185804,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004171959336398598,
|
|
"loss": 5.706,
|
|
"mean_token_accuracy": 0.20061707198619844,
|
|
"num_tokens": 63806929.0,
|
|
"step": 25175
|
|
},
|
|
{
|
|
"entropy": 6.258252239227295,
|
|
"epoch": 2.9059434506635893,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004171639520723646,
|
|
"loss": 5.6061,
|
|
"mean_token_accuracy": 0.20822567492723465,
|
|
"num_tokens": 63819794.0,
|
|
"step": 25180
|
|
},
|
|
{
|
|
"entropy": 6.231323909759522,
|
|
"epoch": 2.9065204847085977,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004171319657232554,
|
|
"loss": 5.5822,
|
|
"mean_token_accuracy": 0.21523085236549377,
|
|
"num_tokens": 63831494.0,
|
|
"step": 25185
|
|
},
|
|
{
|
|
"entropy": 6.296552467346191,
|
|
"epoch": 2.9070975187536066,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004170999745936082,
|
|
"loss": 5.6534,
|
|
"mean_token_accuracy": 0.1993444100022316,
|
|
"num_tokens": 63844472.0,
|
|
"step": 25190
|
|
},
|
|
{
|
|
"entropy": 6.312586736679077,
|
|
"epoch": 2.907674552798615,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004170679786844989,
|
|
"loss": 5.6671,
|
|
"mean_token_accuracy": 0.19803964495658874,
|
|
"num_tokens": 63856028.0,
|
|
"step": 25195
|
|
},
|
|
{
|
|
"entropy": 6.2204302787780765,
|
|
"epoch": 2.908251586843624,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004170359779970037,
|
|
"loss": 5.6369,
|
|
"mean_token_accuracy": 0.19928001016378402,
|
|
"num_tokens": 63870137.0,
|
|
"step": 25200
|
|
},
|
|
{
|
|
"entropy": 6.349273538589477,
|
|
"epoch": 2.9088286208886327,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004170039725321989,
|
|
"loss": 5.7079,
|
|
"mean_token_accuracy": 0.20070801079273223,
|
|
"num_tokens": 63882152.0,
|
|
"step": 25205
|
|
},
|
|
{
|
|
"entropy": 6.2704503536224365,
|
|
"epoch": 2.909405654933641,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00041697196229116106,
|
|
"loss": 5.6066,
|
|
"mean_token_accuracy": 0.2054191052913666,
|
|
"num_tokens": 63894624.0,
|
|
"step": 25210
|
|
},
|
|
{
|
|
"entropy": 6.150464868545532,
|
|
"epoch": 2.9099826889786495,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004169399472749668,
|
|
"loss": 5.4453,
|
|
"mean_token_accuracy": 0.22304238826036454,
|
|
"num_tokens": 63907439.0,
|
|
"step": 25215
|
|
},
|
|
{
|
|
"entropy": 6.3068078517913815,
|
|
"epoch": 2.9105597230236584,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000416907927484693,
|
|
"loss": 5.7186,
|
|
"mean_token_accuracy": 0.20052140653133393,
|
|
"num_tokens": 63920432.0,
|
|
"step": 25220
|
|
},
|
|
{
|
|
"entropy": 6.310074043273926,
|
|
"epoch": 2.9111367570686673,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00041687590292141644,
|
|
"loss": 5.6325,
|
|
"mean_token_accuracy": 0.21428772509098054,
|
|
"num_tokens": 63935682.0,
|
|
"step": 25225
|
|
},
|
|
{
|
|
"entropy": 6.214284944534302,
|
|
"epoch": 2.9117137911136757,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00041684387358621435,
|
|
"loss": 5.6399,
|
|
"mean_token_accuracy": 0.21525498926639558,
|
|
"num_tokens": 63949109.0,
|
|
"step": 25230
|
|
},
|
|
{
|
|
"entropy": 6.316666793823242,
|
|
"epoch": 2.912290825158684,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00041681183948016404,
|
|
"loss": 5.6169,
|
|
"mean_token_accuracy": 0.20855890363454818,
|
|
"num_tokens": 63962859.0,
|
|
"step": 25235
|
|
},
|
|
{
|
|
"entropy": 6.368614053726196,
|
|
"epoch": 2.912867859203693,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000416779800604343,
|
|
"loss": 5.7406,
|
|
"mean_token_accuracy": 0.19653613567352296,
|
|
"num_tokens": 63975641.0,
|
|
"step": 25240
|
|
},
|
|
{
|
|
"entropy": 6.332232809066772,
|
|
"epoch": 2.913444893248702,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00041674775695982883,
|
|
"loss": 5.6948,
|
|
"mean_token_accuracy": 0.2006824254989624,
|
|
"num_tokens": 63988419.0,
|
|
"step": 25245
|
|
},
|
|
{
|
|
"entropy": 6.245564317703247,
|
|
"epoch": 2.9140219272937102,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004167157085476992,
|
|
"loss": 5.6549,
|
|
"mean_token_accuracy": 0.20331034064292908,
|
|
"num_tokens": 64000217.0,
|
|
"step": 25250
|
|
},
|
|
{
|
|
"entropy": 6.298387670516968,
|
|
"epoch": 2.914598961338719,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004166836553690321,
|
|
"loss": 5.6973,
|
|
"mean_token_accuracy": 0.205794295668602,
|
|
"num_tokens": 64013083.0,
|
|
"step": 25255
|
|
},
|
|
{
|
|
"entropy": 6.235529375076294,
|
|
"epoch": 2.9151759953837275,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004166515974249056,
|
|
"loss": 5.6077,
|
|
"mean_token_accuracy": 0.2072654575109482,
|
|
"num_tokens": 64025769.0,
|
|
"step": 25260
|
|
},
|
|
{
|
|
"entropy": 6.291547393798828,
|
|
"epoch": 2.9157530294287364,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00041661953471639797,
|
|
"loss": 5.6649,
|
|
"mean_token_accuracy": 0.2001086875796318,
|
|
"num_tokens": 64037526.0,
|
|
"step": 25265
|
|
},
|
|
{
|
|
"entropy": 6.226619243621826,
|
|
"epoch": 2.916330063473745,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00041658746724458775,
|
|
"loss": 5.6182,
|
|
"mean_token_accuracy": 0.21015765219926835,
|
|
"num_tokens": 64050542.0,
|
|
"step": 25270
|
|
},
|
|
{
|
|
"entropy": 6.261485433578491,
|
|
"epoch": 2.9169070975187537,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00041655539501055333,
|
|
"loss": 5.5603,
|
|
"mean_token_accuracy": 0.21315181851387024,
|
|
"num_tokens": 64063097.0,
|
|
"step": 25275
|
|
},
|
|
{
|
|
"entropy": 6.29876217842102,
|
|
"epoch": 2.9174841315637625,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004165233180153735,
|
|
"loss": 5.683,
|
|
"mean_token_accuracy": 0.20762786865234376,
|
|
"num_tokens": 64076104.0,
|
|
"step": 25280
|
|
},
|
|
{
|
|
"entropy": 6.311828708648681,
|
|
"epoch": 2.918061165608771,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004164912362601272,
|
|
"loss": 5.6517,
|
|
"mean_token_accuracy": 0.20843846797943116,
|
|
"num_tokens": 64090351.0,
|
|
"step": 25285
|
|
},
|
|
{
|
|
"entropy": 6.193958377838134,
|
|
"epoch": 2.9186381996537794,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00041645914974589347,
|
|
"loss": 5.5268,
|
|
"mean_token_accuracy": 0.2083866134285927,
|
|
"num_tokens": 64103408.0,
|
|
"step": 25290
|
|
},
|
|
{
|
|
"entropy": 6.161638975143433,
|
|
"epoch": 2.919215233698788,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00041642705847375137,
|
|
"loss": 5.55,
|
|
"mean_token_accuracy": 0.2145008385181427,
|
|
"num_tokens": 64116733.0,
|
|
"step": 25295
|
|
},
|
|
{
|
|
"entropy": 6.28320426940918,
|
|
"epoch": 2.919792267743797,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004163949624447806,
|
|
"loss": 5.6113,
|
|
"mean_token_accuracy": 0.21087300330400466,
|
|
"num_tokens": 64129040.0,
|
|
"step": 25300
|
|
},
|
|
{
|
|
"entropy": 6.266964054107666,
|
|
"epoch": 2.9203693017888055,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00041636286166006045,
|
|
"loss": 5.6651,
|
|
"mean_token_accuracy": 0.19479360282421113,
|
|
"num_tokens": 64140437.0,
|
|
"step": 25305
|
|
},
|
|
{
|
|
"entropy": 6.207163143157959,
|
|
"epoch": 2.9209463358338144,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004163307561206706,
|
|
"loss": 5.5464,
|
|
"mean_token_accuracy": 0.22069514393806458,
|
|
"num_tokens": 64153771.0,
|
|
"step": 25310
|
|
},
|
|
{
|
|
"entropy": 6.305130672454834,
|
|
"epoch": 2.9215233698788228,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.000416298645827691,
|
|
"loss": 5.6568,
|
|
"mean_token_accuracy": 0.20214859396219254,
|
|
"num_tokens": 64165492.0,
|
|
"step": 25315
|
|
},
|
|
{
|
|
"entropy": 6.280672073364258,
|
|
"epoch": 2.9221004039238316,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004162665307822016,
|
|
"loss": 5.6495,
|
|
"mean_token_accuracy": 0.204375259578228,
|
|
"num_tokens": 64178898.0,
|
|
"step": 25320
|
|
},
|
|
{
|
|
"entropy": 6.369881057739258,
|
|
"epoch": 2.92267743796884,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00041623441098528267,
|
|
"loss": 5.6825,
|
|
"mean_token_accuracy": 0.20088574439287185,
|
|
"num_tokens": 64190529.0,
|
|
"step": 25325
|
|
},
|
|
{
|
|
"entropy": 6.341379117965698,
|
|
"epoch": 2.923254472013849,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00041620228643801443,
|
|
"loss": 5.559,
|
|
"mean_token_accuracy": 0.21933011561632157,
|
|
"num_tokens": 64203073.0,
|
|
"step": 25330
|
|
},
|
|
{
|
|
"entropy": 6.30789999961853,
|
|
"epoch": 2.9238315060588573,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004161701571414775,
|
|
"loss": 5.7238,
|
|
"mean_token_accuracy": 0.2001798763871193,
|
|
"num_tokens": 64216103.0,
|
|
"step": 25335
|
|
},
|
|
{
|
|
"entropy": 6.322685050964355,
|
|
"epoch": 2.924408540103866,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00041613802309675235,
|
|
"loss": 5.728,
|
|
"mean_token_accuracy": 0.20137911289930344,
|
|
"num_tokens": 64228451.0,
|
|
"step": 25340
|
|
},
|
|
{
|
|
"entropy": 6.256172609329224,
|
|
"epoch": 2.9249855741488746,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00041610588430492,
|
|
"loss": 5.5963,
|
|
"mean_token_accuracy": 0.20898182839155197,
|
|
"num_tokens": 64239858.0,
|
|
"step": 25345
|
|
},
|
|
{
|
|
"entropy": 6.244179439544678,
|
|
"epoch": 2.9255626081938835,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00041607374076706123,
|
|
"loss": 5.576,
|
|
"mean_token_accuracy": 0.2131747007369995,
|
|
"num_tokens": 64252150.0,
|
|
"step": 25350
|
|
},
|
|
{
|
|
"entropy": 6.35038423538208,
|
|
"epoch": 2.9261396422388923,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00041604159248425737,
|
|
"loss": 5.7922,
|
|
"mean_token_accuracy": 0.20044759660959244,
|
|
"num_tokens": 64264600.0,
|
|
"step": 25355
|
|
},
|
|
{
|
|
"entropy": 6.3089861392974855,
|
|
"epoch": 2.9267166762839008,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004160094394575896,
|
|
"loss": 5.6529,
|
|
"mean_token_accuracy": 0.2060518443584442,
|
|
"num_tokens": 64276533.0,
|
|
"step": 25360
|
|
},
|
|
{
|
|
"entropy": 6.287888813018799,
|
|
"epoch": 2.927293710328909,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004159772816881393,
|
|
"loss": 5.6338,
|
|
"mean_token_accuracy": 0.21313919872045517,
|
|
"num_tokens": 64288628.0,
|
|
"step": 25365
|
|
},
|
|
{
|
|
"entropy": 6.270704889297486,
|
|
"epoch": 2.927870744373918,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00041594511917698813,
|
|
"loss": 5.658,
|
|
"mean_token_accuracy": 0.2082279995083809,
|
|
"num_tokens": 64301584.0,
|
|
"step": 25370
|
|
},
|
|
{
|
|
"entropy": 6.308985233306885,
|
|
"epoch": 2.928447778418927,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00041591295192521796,
|
|
"loss": 5.6972,
|
|
"mean_token_accuracy": 0.20279430896043776,
|
|
"num_tokens": 64313363.0,
|
|
"step": 25375
|
|
},
|
|
{
|
|
"entropy": 6.257787036895752,
|
|
"epoch": 2.9290248124639353,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004158807799339107,
|
|
"loss": 5.6222,
|
|
"mean_token_accuracy": 0.21045085191726684,
|
|
"num_tokens": 64325284.0,
|
|
"step": 25380
|
|
},
|
|
{
|
|
"entropy": 6.334829711914063,
|
|
"epoch": 2.929601846508944,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00041584860320414827,
|
|
"loss": 5.6845,
|
|
"mean_token_accuracy": 0.20261002331972122,
|
|
"num_tokens": 64336886.0,
|
|
"step": 25385
|
|
},
|
|
{
|
|
"entropy": 6.28106427192688,
|
|
"epoch": 2.9301788805539526,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00041581642173701305,
|
|
"loss": 5.6076,
|
|
"mean_token_accuracy": 0.20906456261873246,
|
|
"num_tokens": 64349299.0,
|
|
"step": 25390
|
|
},
|
|
{
|
|
"entropy": 6.20555567741394,
|
|
"epoch": 2.9307559145989615,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00041578423553358747,
|
|
"loss": 5.6507,
|
|
"mean_token_accuracy": 0.2086244523525238,
|
|
"num_tokens": 64360997.0,
|
|
"step": 25395
|
|
},
|
|
{
|
|
"entropy": 6.328874254226685,
|
|
"epoch": 2.93133294864397,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00041575204459495406,
|
|
"loss": 5.6697,
|
|
"mean_token_accuracy": 0.21014914363622667,
|
|
"num_tokens": 64375083.0,
|
|
"step": 25400
|
|
},
|
|
{
|
|
"entropy": 6.319454526901245,
|
|
"epoch": 2.9319099826889787,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00041571984892219556,
|
|
"loss": 5.7403,
|
|
"mean_token_accuracy": 0.19645586162805556,
|
|
"num_tokens": 64387882.0,
|
|
"step": 25405
|
|
},
|
|
{
|
|
"entropy": 6.180776166915893,
|
|
"epoch": 2.932487016733987,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004156876485163948,
|
|
"loss": 5.5577,
|
|
"mean_token_accuracy": 0.21098477095365525,
|
|
"num_tokens": 64399876.0,
|
|
"step": 25410
|
|
},
|
|
{
|
|
"entropy": 6.2463685989379885,
|
|
"epoch": 2.933064050778996,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00041565544337863493,
|
|
"loss": 5.6152,
|
|
"mean_token_accuracy": 0.21049430817365647,
|
|
"num_tokens": 64411479.0,
|
|
"step": 25415
|
|
},
|
|
{
|
|
"entropy": 6.22052264213562,
|
|
"epoch": 2.9336410848240044,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.000415623233509999,
|
|
"loss": 5.5956,
|
|
"mean_token_accuracy": 0.20906442403793335,
|
|
"num_tokens": 64425009.0,
|
|
"step": 25420
|
|
},
|
|
{
|
|
"entropy": 6.243103075027466,
|
|
"epoch": 2.9342181188690133,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004155910189115705,
|
|
"loss": 5.611,
|
|
"mean_token_accuracy": 0.20894427597522736,
|
|
"num_tokens": 64436635.0,
|
|
"step": 25425
|
|
},
|
|
{
|
|
"entropy": 6.1785839080810545,
|
|
"epoch": 2.934795152914022,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00041555879958443296,
|
|
"loss": 5.5635,
|
|
"mean_token_accuracy": 0.20670849233865737,
|
|
"num_tokens": 64449338.0,
|
|
"step": 25430
|
|
},
|
|
{
|
|
"entropy": 6.327011680603027,
|
|
"epoch": 2.9353721869590306,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00041552657552967,
|
|
"loss": 5.7647,
|
|
"mean_token_accuracy": 0.1948007568717003,
|
|
"num_tokens": 64461124.0,
|
|
"step": 25435
|
|
},
|
|
{
|
|
"entropy": 6.31681456565857,
|
|
"epoch": 2.935949221004039,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004154943467483654,
|
|
"loss": 5.6932,
|
|
"mean_token_accuracy": 0.21050745993852615,
|
|
"num_tokens": 64474093.0,
|
|
"step": 25440
|
|
},
|
|
{
|
|
"entropy": 6.303525590896607,
|
|
"epoch": 2.936526255049048,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004154621132416033,
|
|
"loss": 5.634,
|
|
"mean_token_accuracy": 0.19663692861795426,
|
|
"num_tokens": 64486408.0,
|
|
"step": 25445
|
|
},
|
|
{
|
|
"entropy": 6.21959547996521,
|
|
"epoch": 2.9371032890940567,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00041542987501046777,
|
|
"loss": 5.6172,
|
|
"mean_token_accuracy": 0.2132948637008667,
|
|
"num_tokens": 64499390.0,
|
|
"step": 25450
|
|
},
|
|
{
|
|
"entropy": 6.2744190216064455,
|
|
"epoch": 2.937680323139065,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00041539763205604316,
|
|
"loss": 5.61,
|
|
"mean_token_accuracy": 0.20902493596076965,
|
|
"num_tokens": 64511307.0,
|
|
"step": 25455
|
|
},
|
|
{
|
|
"entropy": 6.253611993789673,
|
|
"epoch": 2.938257357184074,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004153653843794139,
|
|
"loss": 5.6043,
|
|
"mean_token_accuracy": 0.2056280106306076,
|
|
"num_tokens": 64523027.0,
|
|
"step": 25460
|
|
},
|
|
{
|
|
"entropy": 6.324916362762451,
|
|
"epoch": 2.9388343912290824,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004153331319816647,
|
|
"loss": 5.7842,
|
|
"mean_token_accuracy": 0.19520133435726167,
|
|
"num_tokens": 64535472.0,
|
|
"step": 25465
|
|
},
|
|
{
|
|
"entropy": 6.283449745178222,
|
|
"epoch": 2.9394114252740913,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004153008748638803,
|
|
"loss": 5.6359,
|
|
"mean_token_accuracy": 0.20759779512882232,
|
|
"num_tokens": 64547935.0,
|
|
"step": 25470
|
|
},
|
|
{
|
|
"entropy": 6.344536066055298,
|
|
"epoch": 2.9399884593190997,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004152686130271457,
|
|
"loss": 5.7483,
|
|
"mean_token_accuracy": 0.19507116228342056,
|
|
"num_tokens": 64561773.0,
|
|
"step": 25475
|
|
},
|
|
{
|
|
"entropy": 6.301615428924561,
|
|
"epoch": 2.9405654933641086,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00041523634647254595,
|
|
"loss": 5.5888,
|
|
"mean_token_accuracy": 0.2167532831430435,
|
|
"num_tokens": 64576465.0,
|
|
"step": 25480
|
|
},
|
|
{
|
|
"entropy": 6.284997415542603,
|
|
"epoch": 2.9411425274091174,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00041520407520116633,
|
|
"loss": 5.6407,
|
|
"mean_token_accuracy": 0.2057218983769417,
|
|
"num_tokens": 64589890.0,
|
|
"step": 25485
|
|
},
|
|
{
|
|
"entropy": 6.243203163146973,
|
|
"epoch": 2.941719561454126,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004151717992140923,
|
|
"loss": 5.6131,
|
|
"mean_token_accuracy": 0.2093499183654785,
|
|
"num_tokens": 64601423.0,
|
|
"step": 25490
|
|
},
|
|
{
|
|
"entropy": 6.301845121383667,
|
|
"epoch": 2.9422965954991342,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00041513951851240947,
|
|
"loss": 5.6969,
|
|
"mean_token_accuracy": 0.20259795039892198,
|
|
"num_tokens": 64614532.0,
|
|
"step": 25495
|
|
},
|
|
{
|
|
"entropy": 6.263013124465942,
|
|
"epoch": 2.942873629544143,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00041510723309720344,
|
|
"loss": 5.6491,
|
|
"mean_token_accuracy": 0.2088204249739647,
|
|
"num_tokens": 64628260.0,
|
|
"step": 25500
|
|
},
|
|
{
|
|
"entropy": 6.295760536193848,
|
|
"epoch": 2.943450663589152,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004150749429695603,
|
|
"loss": 5.6274,
|
|
"mean_token_accuracy": 0.2134072333574295,
|
|
"num_tokens": 64640913.0,
|
|
"step": 25505
|
|
},
|
|
{
|
|
"entropy": 6.203280401229859,
|
|
"epoch": 2.9440276976341604,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00041504264813056605,
|
|
"loss": 5.5821,
|
|
"mean_token_accuracy": 0.21433833688497544,
|
|
"num_tokens": 64653438.0,
|
|
"step": 25510
|
|
},
|
|
{
|
|
"entropy": 6.237936210632324,
|
|
"epoch": 2.944604731679169,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00041501034858130683,
|
|
"loss": 5.5674,
|
|
"mean_token_accuracy": 0.20707983374595643,
|
|
"num_tokens": 64665753.0,
|
|
"step": 25515
|
|
},
|
|
{
|
|
"entropy": 6.354833269119263,
|
|
"epoch": 2.9451817657241777,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00041497804432286914,
|
|
"loss": 5.7698,
|
|
"mean_token_accuracy": 0.1939437985420227,
|
|
"num_tokens": 64676872.0,
|
|
"step": 25520
|
|
},
|
|
{
|
|
"entropy": 6.238164663314819,
|
|
"epoch": 2.9457587997691865,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004149457353563394,
|
|
"loss": 5.575,
|
|
"mean_token_accuracy": 0.214619280397892,
|
|
"num_tokens": 64690216.0,
|
|
"step": 25525
|
|
},
|
|
{
|
|
"entropy": 6.273436498641968,
|
|
"epoch": 2.946335833814195,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00041491342168280444,
|
|
"loss": 5.6442,
|
|
"mean_token_accuracy": 0.2059035509824753,
|
|
"num_tokens": 64704210.0,
|
|
"step": 25530
|
|
},
|
|
{
|
|
"entropy": 6.357722043991089,
|
|
"epoch": 2.946912867859204,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00041488110330335093,
|
|
"loss": 5.6623,
|
|
"mean_token_accuracy": 0.206794635951519,
|
|
"num_tokens": 64717142.0,
|
|
"step": 25535
|
|
},
|
|
{
|
|
"entropy": 6.195057678222656,
|
|
"epoch": 2.9474899019042122,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00041484878021906605,
|
|
"loss": 5.5168,
|
|
"mean_token_accuracy": 0.21917226314544677,
|
|
"num_tokens": 64729783.0,
|
|
"step": 25540
|
|
},
|
|
{
|
|
"entropy": 6.257410621643066,
|
|
"epoch": 2.948066935949221,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00041481645243103695,
|
|
"loss": 5.7009,
|
|
"mean_token_accuracy": 0.19696040451526642,
|
|
"num_tokens": 64742179.0,
|
|
"step": 25545
|
|
},
|
|
{
|
|
"entropy": 6.354957199096679,
|
|
"epoch": 2.9486439699942295,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00041478411994035086,
|
|
"loss": 5.6867,
|
|
"mean_token_accuracy": 0.20391977578401566,
|
|
"num_tokens": 64754925.0,
|
|
"step": 25550
|
|
},
|
|
{
|
|
"entropy": 6.212768602371216,
|
|
"epoch": 2.9492210040392384,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00041475178274809544,
|
|
"loss": 5.62,
|
|
"mean_token_accuracy": 0.21312485188245772,
|
|
"num_tokens": 64768341.0,
|
|
"step": 25555
|
|
},
|
|
{
|
|
"entropy": 6.271695184707641,
|
|
"epoch": 2.9497980380842472,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00041471944085535805,
|
|
"loss": 5.7087,
|
|
"mean_token_accuracy": 0.2032159000635147,
|
|
"num_tokens": 64780780.0,
|
|
"step": 25560
|
|
},
|
|
{
|
|
"entropy": 6.327548217773438,
|
|
"epoch": 2.9503750721292556,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004146870942632268,
|
|
"loss": 5.7243,
|
|
"mean_token_accuracy": 0.19584056437015535,
|
|
"num_tokens": 64792495.0,
|
|
"step": 25565
|
|
},
|
|
{
|
|
"entropy": 6.352340650558472,
|
|
"epoch": 2.950952106174264,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00041465474297278955,
|
|
"loss": 5.6543,
|
|
"mean_token_accuracy": 0.20511318296194075,
|
|
"num_tokens": 64804696.0,
|
|
"step": 25570
|
|
},
|
|
{
|
|
"entropy": 6.26220121383667,
|
|
"epoch": 2.951529140219273,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004146223869851343,
|
|
"loss": 5.6101,
|
|
"mean_token_accuracy": 0.2076292708516121,
|
|
"num_tokens": 64817146.0,
|
|
"step": 25575
|
|
},
|
|
{
|
|
"entropy": 6.244441318511963,
|
|
"epoch": 2.952106174264282,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004145900263013494,
|
|
"loss": 5.6828,
|
|
"mean_token_accuracy": 0.19858550876379014,
|
|
"num_tokens": 64828833.0,
|
|
"step": 25580
|
|
},
|
|
{
|
|
"entropy": 6.269702816009522,
|
|
"epoch": 2.95268320830929,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004145576609225234,
|
|
"loss": 5.6128,
|
|
"mean_token_accuracy": 0.210699462890625,
|
|
"num_tokens": 64843811.0,
|
|
"step": 25585
|
|
},
|
|
{
|
|
"entropy": 6.235076093673706,
|
|
"epoch": 2.953260242354299,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004145252908497448,
|
|
"loss": 5.5635,
|
|
"mean_token_accuracy": 0.21662232279777527,
|
|
"num_tokens": 64856829.0,
|
|
"step": 25590
|
|
},
|
|
{
|
|
"entropy": 6.172655820846558,
|
|
"epoch": 2.9538372763993075,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00041449291608410227,
|
|
"loss": 5.518,
|
|
"mean_token_accuracy": 0.21411291807889937,
|
|
"num_tokens": 64869044.0,
|
|
"step": 25595
|
|
},
|
|
{
|
|
"entropy": 6.286331462860107,
|
|
"epoch": 2.9544143104443163,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00041446053662668483,
|
|
"loss": 5.6676,
|
|
"mean_token_accuracy": 0.2148498073220253,
|
|
"num_tokens": 64882330.0,
|
|
"step": 25600
|
|
},
|
|
{
|
|
"entropy": 6.321403741836548,
|
|
"epoch": 2.9549913444893248,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004144281524785815,
|
|
"loss": 5.685,
|
|
"mean_token_accuracy": 0.20126740038394927,
|
|
"num_tokens": 64894609.0,
|
|
"step": 25605
|
|
},
|
|
{
|
|
"entropy": 6.238070821762085,
|
|
"epoch": 2.9555683785343336,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004143957636408815,
|
|
"loss": 5.6441,
|
|
"mean_token_accuracy": 0.20944760888814926,
|
|
"num_tokens": 64907251.0,
|
|
"step": 25610
|
|
},
|
|
{
|
|
"entropy": 6.30707483291626,
|
|
"epoch": 2.956145412579342,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00041436337011467426,
|
|
"loss": 5.6714,
|
|
"mean_token_accuracy": 0.20430303514003753,
|
|
"num_tokens": 64919114.0,
|
|
"step": 25615
|
|
},
|
|
{
|
|
"entropy": 6.326687479019165,
|
|
"epoch": 2.956722446624351,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00041433097190104936,
|
|
"loss": 5.7068,
|
|
"mean_token_accuracy": 0.19574066251516342,
|
|
"num_tokens": 64933064.0,
|
|
"step": 25620
|
|
},
|
|
{
|
|
"entropy": 6.323204088211059,
|
|
"epoch": 2.9572994806693593,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00041429856900109636,
|
|
"loss": 5.6509,
|
|
"mean_token_accuracy": 0.21202523857355118,
|
|
"num_tokens": 64946625.0,
|
|
"step": 25625
|
|
},
|
|
{
|
|
"entropy": 6.2345046043396,
|
|
"epoch": 2.957876514714368,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004142661614159051,
|
|
"loss": 5.5543,
|
|
"mean_token_accuracy": 0.2094992905855179,
|
|
"num_tokens": 64958577.0,
|
|
"step": 25630
|
|
},
|
|
{
|
|
"entropy": 6.293367576599121,
|
|
"epoch": 2.958453548759377,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00041423374914656587,
|
|
"loss": 5.7551,
|
|
"mean_token_accuracy": 0.19674378186464309,
|
|
"num_tokens": 64971588.0,
|
|
"step": 25635
|
|
},
|
|
{
|
|
"entropy": 6.334738874435425,
|
|
"epoch": 2.9590305828043855,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004142013321941685,
|
|
"loss": 5.7271,
|
|
"mean_token_accuracy": 0.1985373690724373,
|
|
"num_tokens": 64984448.0,
|
|
"step": 25640
|
|
},
|
|
{
|
|
"entropy": 6.271935701370239,
|
|
"epoch": 2.959607616849394,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00041416891055980347,
|
|
"loss": 5.6657,
|
|
"mean_token_accuracy": 0.2038862705230713,
|
|
"num_tokens": 64996759.0,
|
|
"step": 25645
|
|
},
|
|
{
|
|
"entropy": 6.312621402740478,
|
|
"epoch": 2.9601846508944027,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00041413648424456134,
|
|
"loss": 5.7138,
|
|
"mean_token_accuracy": 0.20117763578891754,
|
|
"num_tokens": 65009732.0,
|
|
"step": 25650
|
|
},
|
|
{
|
|
"entropy": 6.3216746807098385,
|
|
"epoch": 2.9607616849394116,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00041410405324953265,
|
|
"loss": 5.731,
|
|
"mean_token_accuracy": 0.19510290920734405,
|
|
"num_tokens": 65021479.0,
|
|
"step": 25655
|
|
},
|
|
{
|
|
"entropy": 6.3738302230834964,
|
|
"epoch": 2.96133871898442,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004140716175758082,
|
|
"loss": 5.7174,
|
|
"mean_token_accuracy": 0.20308305621147155,
|
|
"num_tokens": 65034782.0,
|
|
"step": 25660
|
|
},
|
|
{
|
|
"entropy": 6.302497673034668,
|
|
"epoch": 2.961915753029429,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00041403917722447896,
|
|
"loss": 5.7015,
|
|
"mean_token_accuracy": 0.2005263790488243,
|
|
"num_tokens": 65047427.0,
|
|
"step": 25665
|
|
},
|
|
{
|
|
"entropy": 6.295998573303223,
|
|
"epoch": 2.9624927870744373,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004140067321966361,
|
|
"loss": 5.6478,
|
|
"mean_token_accuracy": 0.20671470314264298,
|
|
"num_tokens": 65060867.0,
|
|
"step": 25670
|
|
},
|
|
{
|
|
"entropy": 6.283916234970093,
|
|
"epoch": 2.963069821119446,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004139742824933709,
|
|
"loss": 5.5742,
|
|
"mean_token_accuracy": 0.21723517775535583,
|
|
"num_tokens": 65074394.0,
|
|
"step": 25675
|
|
},
|
|
{
|
|
"entropy": 6.178877544403076,
|
|
"epoch": 2.9636468551644546,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004139418281157747,
|
|
"loss": 5.5702,
|
|
"mean_token_accuracy": 0.2180158719420433,
|
|
"num_tokens": 65088352.0,
|
|
"step": 25680
|
|
},
|
|
{
|
|
"entropy": 6.30589804649353,
|
|
"epoch": 2.9642238892094634,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004139093690649391,
|
|
"loss": 5.6499,
|
|
"mean_token_accuracy": 0.20713800936937332,
|
|
"num_tokens": 65101113.0,
|
|
"step": 25685
|
|
},
|
|
{
|
|
"entropy": 6.342813348770141,
|
|
"epoch": 2.964800923254472,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00041387690534195584,
|
|
"loss": 5.6695,
|
|
"mean_token_accuracy": 0.19723428189754486,
|
|
"num_tokens": 65112894.0,
|
|
"step": 25690
|
|
},
|
|
{
|
|
"entropy": 6.289703464508056,
|
|
"epoch": 2.9653779572994807,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004138444369479169,
|
|
"loss": 5.6817,
|
|
"mean_token_accuracy": 0.19636846631765364,
|
|
"num_tokens": 65125087.0,
|
|
"step": 25695
|
|
},
|
|
{
|
|
"entropy": 6.251219797134399,
|
|
"epoch": 2.965954991344489,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004138119638839143,
|
|
"loss": 5.6019,
|
|
"mean_token_accuracy": 0.21457798779010773,
|
|
"num_tokens": 65138345.0,
|
|
"step": 25700
|
|
},
|
|
{
|
|
"entropy": 6.319249820709229,
|
|
"epoch": 2.966532025389498,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00041377948615104024,
|
|
"loss": 5.6596,
|
|
"mean_token_accuracy": 0.20217411518096923,
|
|
"num_tokens": 65151337.0,
|
|
"step": 25705
|
|
},
|
|
{
|
|
"entropy": 6.196638488769532,
|
|
"epoch": 2.967109059434507,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004137470037503871,
|
|
"loss": 5.5192,
|
|
"mean_token_accuracy": 0.21449989527463914,
|
|
"num_tokens": 65163061.0,
|
|
"step": 25710
|
|
},
|
|
{
|
|
"entropy": 6.283056449890137,
|
|
"epoch": 2.9676860934795153,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004137145166830474,
|
|
"loss": 5.6466,
|
|
"mean_token_accuracy": 0.20333010107278823,
|
|
"num_tokens": 65176358.0,
|
|
"step": 25715
|
|
},
|
|
{
|
|
"entropy": 6.308832359313965,
|
|
"epoch": 2.9682631275245237,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004136820249501139,
|
|
"loss": 5.6641,
|
|
"mean_token_accuracy": 0.20226604342460633,
|
|
"num_tokens": 65188189.0,
|
|
"step": 25720
|
|
},
|
|
{
|
|
"entropy": 6.323771142959595,
|
|
"epoch": 2.9688401615695326,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004136495285526792,
|
|
"loss": 5.6671,
|
|
"mean_token_accuracy": 0.200624980032444,
|
|
"num_tokens": 65200748.0,
|
|
"step": 25725
|
|
},
|
|
{
|
|
"entropy": 6.258511638641357,
|
|
"epoch": 2.9694171956145414,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00041361702749183663,
|
|
"loss": 5.6335,
|
|
"mean_token_accuracy": 0.21438468098640442,
|
|
"num_tokens": 65212871.0,
|
|
"step": 25730
|
|
},
|
|
{
|
|
"entropy": 6.214915657043457,
|
|
"epoch": 2.96999422965955,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004135845217686791,
|
|
"loss": 5.5867,
|
|
"mean_token_accuracy": 0.2147510290145874,
|
|
"num_tokens": 65224604.0,
|
|
"step": 25735
|
|
},
|
|
{
|
|
"entropy": 6.263328313827515,
|
|
"epoch": 2.9705712637045587,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004135520113843001,
|
|
"loss": 5.6254,
|
|
"mean_token_accuracy": 0.207444928586483,
|
|
"num_tokens": 65236757.0,
|
|
"step": 25740
|
|
},
|
|
{
|
|
"entropy": 6.29366135597229,
|
|
"epoch": 2.971148297749567,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000413519496339793,
|
|
"loss": 5.616,
|
|
"mean_token_accuracy": 0.20270009934902192,
|
|
"num_tokens": 65250735.0,
|
|
"step": 25745
|
|
},
|
|
{
|
|
"entropy": 6.1594696044921875,
|
|
"epoch": 2.971725331794576,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00041348697663625144,
|
|
"loss": 5.5477,
|
|
"mean_token_accuracy": 0.21594086289405823,
|
|
"num_tokens": 65263543.0,
|
|
"step": 25750
|
|
},
|
|
{
|
|
"entropy": 6.2606017112731935,
|
|
"epoch": 2.9723023658395844,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004134544522747692,
|
|
"loss": 5.7098,
|
|
"mean_token_accuracy": 0.20271752327680587,
|
|
"num_tokens": 65275637.0,
|
|
"step": 25755
|
|
},
|
|
{
|
|
"entropy": 6.249564170837402,
|
|
"epoch": 2.9728793998845933,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00041342192325644024,
|
|
"loss": 5.5608,
|
|
"mean_token_accuracy": 0.2182687610387802,
|
|
"num_tokens": 65287564.0,
|
|
"step": 25760
|
|
},
|
|
{
|
|
"entropy": 6.243921279907227,
|
|
"epoch": 2.9734564339296017,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004133893895823586,
|
|
"loss": 5.6974,
|
|
"mean_token_accuracy": 0.20399138182401658,
|
|
"num_tokens": 65299255.0,
|
|
"step": 25765
|
|
},
|
|
{
|
|
"entropy": 6.371900606155395,
|
|
"epoch": 2.9740334679746105,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004133568512536187,
|
|
"loss": 5.6831,
|
|
"mean_token_accuracy": 0.19976160824298858,
|
|
"num_tokens": 65311749.0,
|
|
"step": 25770
|
|
},
|
|
{
|
|
"entropy": 6.259573650360108,
|
|
"epoch": 2.974610502019619,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00041332430827131474,
|
|
"loss": 5.5949,
|
|
"mean_token_accuracy": 0.21548307687044144,
|
|
"num_tokens": 65325391.0,
|
|
"step": 25775
|
|
},
|
|
{
|
|
"entropy": 6.271563100814819,
|
|
"epoch": 2.975187536064628,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00041329176063654137,
|
|
"loss": 5.7084,
|
|
"mean_token_accuracy": 0.19745705425739288,
|
|
"num_tokens": 65338640.0,
|
|
"step": 25780
|
|
},
|
|
{
|
|
"entropy": 6.2037018775939945,
|
|
"epoch": 2.9757645701096367,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00041325920835039344,
|
|
"loss": 5.5242,
|
|
"mean_token_accuracy": 0.2089156210422516,
|
|
"num_tokens": 65351378.0,
|
|
"step": 25785
|
|
},
|
|
{
|
|
"entropy": 6.3744340419769285,
|
|
"epoch": 2.976341604154645,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004132266514139656,
|
|
"loss": 5.7382,
|
|
"mean_token_accuracy": 0.19670574516057968,
|
|
"num_tokens": 65364072.0,
|
|
"step": 25790
|
|
},
|
|
{
|
|
"entropy": 6.277193927764893,
|
|
"epoch": 2.9769186381996535,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00041319408982835306,
|
|
"loss": 5.5956,
|
|
"mean_token_accuracy": 0.21373799443244934,
|
|
"num_tokens": 65377019.0,
|
|
"step": 25795
|
|
},
|
|
{
|
|
"entropy": 6.261798095703125,
|
|
"epoch": 2.9774956722446624,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00041316152359465087,
|
|
"loss": 5.6108,
|
|
"mean_token_accuracy": 0.20962859243154525,
|
|
"num_tokens": 65390465.0,
|
|
"step": 25800
|
|
},
|
|
{
|
|
"entropy": 6.326480770111084,
|
|
"epoch": 2.9780727062896712,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00041312895271395457,
|
|
"loss": 5.6323,
|
|
"mean_token_accuracy": 0.2056095376610756,
|
|
"num_tokens": 65402947.0,
|
|
"step": 25805
|
|
},
|
|
{
|
|
"entropy": 6.33512806892395,
|
|
"epoch": 2.9786497403346797,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004130963771873595,
|
|
"loss": 5.727,
|
|
"mean_token_accuracy": 0.19411673098802568,
|
|
"num_tokens": 65414725.0,
|
|
"step": 25810
|
|
},
|
|
{
|
|
"entropy": 6.308678102493286,
|
|
"epoch": 2.9792267743796885,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00041306379701596134,
|
|
"loss": 5.5769,
|
|
"mean_token_accuracy": 0.2155775710940361,
|
|
"num_tokens": 65427417.0,
|
|
"step": 25815
|
|
},
|
|
{
|
|
"entropy": 6.197731161117554,
|
|
"epoch": 2.979803808424697,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00041303121220085607,
|
|
"loss": 5.6034,
|
|
"mean_token_accuracy": 0.21742600947618484,
|
|
"num_tokens": 65440151.0,
|
|
"step": 25820
|
|
},
|
|
{
|
|
"entropy": 6.309122371673584,
|
|
"epoch": 2.980380842469706,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004129986227431394,
|
|
"loss": 5.6473,
|
|
"mean_token_accuracy": 0.21159778088331221,
|
|
"num_tokens": 65453774.0,
|
|
"step": 25825
|
|
},
|
|
{
|
|
"entropy": 6.33005108833313,
|
|
"epoch": 2.9809578765147142,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004129660286439077,
|
|
"loss": 5.7137,
|
|
"mean_token_accuracy": 0.20314548164606094,
|
|
"num_tokens": 65466523.0,
|
|
"step": 25830
|
|
},
|
|
{
|
|
"entropy": 6.357762384414673,
|
|
"epoch": 2.981534910559723,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00041293342990425714,
|
|
"loss": 5.7724,
|
|
"mean_token_accuracy": 0.19125755578279496,
|
|
"num_tokens": 65480728.0,
|
|
"step": 25835
|
|
},
|
|
{
|
|
"entropy": 6.277348613739013,
|
|
"epoch": 2.982111944604732,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00041290082652528415,
|
|
"loss": 5.7036,
|
|
"mean_token_accuracy": 0.2025367572903633,
|
|
"num_tokens": 65494086.0,
|
|
"step": 25840
|
|
},
|
|
{
|
|
"entropy": 6.253962755203247,
|
|
"epoch": 2.9826889786497404,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004128682185080854,
|
|
"loss": 5.5619,
|
|
"mean_token_accuracy": 0.21577923148870468,
|
|
"num_tokens": 65508079.0,
|
|
"step": 25845
|
|
},
|
|
{
|
|
"entropy": 6.286971712112427,
|
|
"epoch": 2.983266012694749,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004128356058537576,
|
|
"loss": 5.5966,
|
|
"mean_token_accuracy": 0.21383341550827026,
|
|
"num_tokens": 65523511.0,
|
|
"step": 25850
|
|
},
|
|
{
|
|
"entropy": 6.2471840381622314,
|
|
"epoch": 2.9838430467397576,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00041280298856339763,
|
|
"loss": 5.5598,
|
|
"mean_token_accuracy": 0.20990967899560928,
|
|
"num_tokens": 65535968.0,
|
|
"step": 25855
|
|
},
|
|
{
|
|
"entropy": 6.306111860275268,
|
|
"epoch": 2.9844200807847665,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00041277036663810266,
|
|
"loss": 5.6623,
|
|
"mean_token_accuracy": 0.20458658933639526,
|
|
"num_tokens": 65548009.0,
|
|
"step": 25860
|
|
},
|
|
{
|
|
"entropy": 6.325979709625244,
|
|
"epoch": 2.984997114829775,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00041273774007896983,
|
|
"loss": 5.6071,
|
|
"mean_token_accuracy": 0.2063138112425804,
|
|
"num_tokens": 65561076.0,
|
|
"step": 25865
|
|
},
|
|
{
|
|
"entropy": 6.230418300628662,
|
|
"epoch": 2.9855741488747833,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004127051088870964,
|
|
"loss": 5.5067,
|
|
"mean_token_accuracy": 0.22357941865921022,
|
|
"num_tokens": 65573982.0,
|
|
"step": 25870
|
|
},
|
|
{
|
|
"entropy": 6.285738325119018,
|
|
"epoch": 2.986151182919792,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004126724730635801,
|
|
"loss": 5.7223,
|
|
"mean_token_accuracy": 0.20286625921726226,
|
|
"num_tokens": 65585923.0,
|
|
"step": 25875
|
|
},
|
|
{
|
|
"entropy": 6.229119300842285,
|
|
"epoch": 2.986728216964801,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00041263983260951857,
|
|
"loss": 5.613,
|
|
"mean_token_accuracy": 0.20859452039003373,
|
|
"num_tokens": 65597366.0,
|
|
"step": 25880
|
|
},
|
|
{
|
|
"entropy": 6.340452051162719,
|
|
"epoch": 2.9873052510098095,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004126071875260097,
|
|
"loss": 5.7447,
|
|
"mean_token_accuracy": 0.20515882223844528,
|
|
"num_tokens": 65610200.0,
|
|
"step": 25885
|
|
},
|
|
{
|
|
"entropy": 6.298042058944702,
|
|
"epoch": 2.9878822850548183,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004125745378141513,
|
|
"loss": 5.6547,
|
|
"mean_token_accuracy": 0.20677776783704757,
|
|
"num_tokens": 65623270.0,
|
|
"step": 25890
|
|
},
|
|
{
|
|
"entropy": 6.225648260116577,
|
|
"epoch": 2.9884593190998268,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004125418834750418,
|
|
"loss": 5.5337,
|
|
"mean_token_accuracy": 0.21896230131387712,
|
|
"num_tokens": 65637443.0,
|
|
"step": 25895
|
|
},
|
|
{
|
|
"entropy": 6.337515020370484,
|
|
"epoch": 2.9890363531448356,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004125092245097793,
|
|
"loss": 5.7285,
|
|
"mean_token_accuracy": 0.19507541358470917,
|
|
"num_tokens": 65650004.0,
|
|
"step": 25900
|
|
},
|
|
{
|
|
"entropy": 6.271553802490234,
|
|
"epoch": 2.989613387189844,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00041247656091946235,
|
|
"loss": 5.6071,
|
|
"mean_token_accuracy": 0.20877954214811326,
|
|
"num_tokens": 65662832.0,
|
|
"step": 25905
|
|
},
|
|
{
|
|
"entropy": 6.280275058746338,
|
|
"epoch": 2.990190421234853,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004124438927051895,
|
|
"loss": 5.6657,
|
|
"mean_token_accuracy": 0.20590980648994445,
|
|
"num_tokens": 65675545.0,
|
|
"step": 25910
|
|
},
|
|
{
|
|
"entropy": 6.358057975769043,
|
|
"epoch": 2.9907674552798618,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004124112198680597,
|
|
"loss": 5.696,
|
|
"mean_token_accuracy": 0.20087795704603195,
|
|
"num_tokens": 65688194.0,
|
|
"step": 25915
|
|
},
|
|
{
|
|
"entropy": 6.3559104919433596,
|
|
"epoch": 2.99134448932487,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004123785424091717,
|
|
"loss": 5.7451,
|
|
"mean_token_accuracy": 0.2025293454527855,
|
|
"num_tokens": 65701410.0,
|
|
"step": 25920
|
|
},
|
|
{
|
|
"entropy": 6.331898546218872,
|
|
"epoch": 2.9919215233698786,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004123458603296247,
|
|
"loss": 5.7145,
|
|
"mean_token_accuracy": 0.20038911402225495,
|
|
"num_tokens": 65714540.0,
|
|
"step": 25925
|
|
},
|
|
{
|
|
"entropy": 6.301794004440308,
|
|
"epoch": 2.9924985574148875,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004123131736305178,
|
|
"loss": 5.7115,
|
|
"mean_token_accuracy": 0.20683306753635405,
|
|
"num_tokens": 65727774.0,
|
|
"step": 25930
|
|
},
|
|
{
|
|
"entropy": 6.301877212524414,
|
|
"epoch": 2.9930755914598963,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004122804823129507,
|
|
"loss": 5.7429,
|
|
"mean_token_accuracy": 0.19962307214736938,
|
|
"num_tokens": 65740040.0,
|
|
"step": 25935
|
|
},
|
|
{
|
|
"entropy": 6.346859502792358,
|
|
"epoch": 2.9936526255049047,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004122477863780227,
|
|
"loss": 5.7342,
|
|
"mean_token_accuracy": 0.1995064437389374,
|
|
"num_tokens": 65751188.0,
|
|
"step": 25940
|
|
},
|
|
{
|
|
"entropy": 6.332697916030884,
|
|
"epoch": 2.9942296595499136,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004122150858268335,
|
|
"loss": 5.6977,
|
|
"mean_token_accuracy": 0.2011364296078682,
|
|
"num_tokens": 65762960.0,
|
|
"step": 25945
|
|
},
|
|
{
|
|
"entropy": 6.383401489257812,
|
|
"epoch": 2.994806693594922,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00041218238066048315,
|
|
"loss": 5.7226,
|
|
"mean_token_accuracy": 0.20306685119867324,
|
|
"num_tokens": 65775069.0,
|
|
"step": 25950
|
|
},
|
|
{
|
|
"entropy": 6.3422754287719725,
|
|
"epoch": 2.995383727639931,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004121496708800715,
|
|
"loss": 5.7434,
|
|
"mean_token_accuracy": 0.19918805807828904,
|
|
"num_tokens": 65788181.0,
|
|
"step": 25955
|
|
},
|
|
{
|
|
"entropy": 6.243724536895752,
|
|
"epoch": 2.9959607616849393,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00041211695648669884,
|
|
"loss": 5.5917,
|
|
"mean_token_accuracy": 0.22524938136339187,
|
|
"num_tokens": 65801038.0,
|
|
"step": 25960
|
|
},
|
|
{
|
|
"entropy": 6.262827444076538,
|
|
"epoch": 2.996537795729948,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004120842374814654,
|
|
"loss": 5.5981,
|
|
"mean_token_accuracy": 0.21240645796060562,
|
|
"num_tokens": 65813631.0,
|
|
"step": 25965
|
|
},
|
|
{
|
|
"entropy": 6.334351873397827,
|
|
"epoch": 2.9971148297749566,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00041205151386547174,
|
|
"loss": 5.6898,
|
|
"mean_token_accuracy": 0.20400844365358353,
|
|
"num_tokens": 65825345.0,
|
|
"step": 25970
|
|
},
|
|
{
|
|
"entropy": 6.307204008102417,
|
|
"epoch": 2.9976918638199654,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00041201878563981855,
|
|
"loss": 5.6407,
|
|
"mean_token_accuracy": 0.21226872205734254,
|
|
"num_tokens": 65837144.0,
|
|
"step": 25975
|
|
},
|
|
{
|
|
"entropy": 6.175499200820923,
|
|
"epoch": 2.998268897864974,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00041198605280560655,
|
|
"loss": 5.604,
|
|
"mean_token_accuracy": 0.21598082184791564,
|
|
"num_tokens": 65850458.0,
|
|
"step": 25980
|
|
},
|
|
{
|
|
"entropy": 6.375832653045654,
|
|
"epoch": 2.9988459319099827,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004119533153639367,
|
|
"loss": 5.7134,
|
|
"mean_token_accuracy": 0.20451305508613588,
|
|
"num_tokens": 65863659.0,
|
|
"step": 25985
|
|
},
|
|
{
|
|
"entropy": 6.256896257400513,
|
|
"epoch": 2.9994229659549916,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00041192057331591,
|
|
"loss": 5.6304,
|
|
"mean_token_accuracy": 0.20684415698051453,
|
|
"num_tokens": 65877129.0,
|
|
"step": 25990
|
|
},
|
|
{
|
|
"entropy": 6.334898900985718,
|
|
"epoch": 3.0,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.000411887826662628,
|
|
"loss": 5.7223,
|
|
"mean_token_accuracy": 0.20037208050489425,
|
|
"num_tokens": 65889351.0,
|
|
"step": 25995
|
|
},
|
|
{
|
|
"entropy": 6.271771049499511,
|
|
"epoch": 3.000577034045009,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004118550754051919,
|
|
"loss": 5.6075,
|
|
"mean_token_accuracy": 0.21018291264772415,
|
|
"num_tokens": 65901967.0,
|
|
"step": 26000
|
|
},
|
|
{
|
|
"entropy": 6.188441038131714,
|
|
"epoch": 3.0011540680900173,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004118223195447033,
|
|
"loss": 5.464,
|
|
"mean_token_accuracy": 0.2211235821247101,
|
|
"num_tokens": 65915259.0,
|
|
"step": 26005
|
|
},
|
|
{
|
|
"entropy": 6.269023323059082,
|
|
"epoch": 3.001731102135026,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00041178955908226396,
|
|
"loss": 5.6069,
|
|
"mean_token_accuracy": 0.20748948007822038,
|
|
"num_tokens": 65928236.0,
|
|
"step": 26010
|
|
},
|
|
{
|
|
"entropy": 6.28645429611206,
|
|
"epoch": 3.0023081361800346,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004117567940189757,
|
|
"loss": 5.6014,
|
|
"mean_token_accuracy": 0.2083831548690796,
|
|
"num_tokens": 65941290.0,
|
|
"step": 26015
|
|
},
|
|
{
|
|
"entropy": 6.303457403182984,
|
|
"epoch": 3.0028851702250434,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004117240243559406,
|
|
"loss": 5.6672,
|
|
"mean_token_accuracy": 0.19726393669843673,
|
|
"num_tokens": 65954301.0,
|
|
"step": 26020
|
|
},
|
|
{
|
|
"entropy": 6.314698886871338,
|
|
"epoch": 3.003462204270052,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004116912500942609,
|
|
"loss": 5.6589,
|
|
"mean_token_accuracy": 0.20999360233545303,
|
|
"num_tokens": 65966406.0,
|
|
"step": 26025
|
|
},
|
|
{
|
|
"entropy": 6.204772567749023,
|
|
"epoch": 3.0040392383150607,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004116584712350389,
|
|
"loss": 5.5635,
|
|
"mean_token_accuracy": 0.2126577839255333,
|
|
"num_tokens": 65979177.0,
|
|
"step": 26030
|
|
},
|
|
{
|
|
"entropy": 6.220018148422241,
|
|
"epoch": 3.004616272360069,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004116256877793771,
|
|
"loss": 5.5343,
|
|
"mean_token_accuracy": 0.21496824771165848,
|
|
"num_tokens": 65992326.0,
|
|
"step": 26035
|
|
},
|
|
{
|
|
"entropy": 6.352341747283935,
|
|
"epoch": 3.005193306405078,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00041159289972837813,
|
|
"loss": 5.6209,
|
|
"mean_token_accuracy": 0.20606656223535538,
|
|
"num_tokens": 66003481.0,
|
|
"step": 26040
|
|
},
|
|
{
|
|
"entropy": 6.354292726516723,
|
|
"epoch": 3.0057703404500864,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00041156010708314487,
|
|
"loss": 5.6809,
|
|
"mean_token_accuracy": 0.19980886876583098,
|
|
"num_tokens": 66015552.0,
|
|
"step": 26045
|
|
},
|
|
{
|
|
"entropy": 6.340355634689331,
|
|
"epoch": 3.0063473744950953,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004115273098447802,
|
|
"loss": 5.6062,
|
|
"mean_token_accuracy": 0.210785011947155,
|
|
"num_tokens": 66028506.0,
|
|
"step": 26050
|
|
},
|
|
{
|
|
"entropy": 6.2917341709136965,
|
|
"epoch": 3.0069244085401037,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00041149450801438727,
|
|
"loss": 5.5796,
|
|
"mean_token_accuracy": 0.20746909976005554,
|
|
"num_tokens": 66040938.0,
|
|
"step": 26055
|
|
},
|
|
{
|
|
"entropy": 6.222816085815429,
|
|
"epoch": 3.0075014425851125,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00041146170159306946,
|
|
"loss": 5.5247,
|
|
"mean_token_accuracy": 0.20411389768123628,
|
|
"num_tokens": 66052838.0,
|
|
"step": 26060
|
|
},
|
|
{
|
|
"entropy": 6.2691624641418455,
|
|
"epoch": 3.008078476630121,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00041142889058193,
|
|
"loss": 5.586,
|
|
"mean_token_accuracy": 0.21158916205167771,
|
|
"num_tokens": 66065286.0,
|
|
"step": 26065
|
|
},
|
|
{
|
|
"entropy": 6.31137113571167,
|
|
"epoch": 3.00865551067513,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00041139607498207265,
|
|
"loss": 5.6282,
|
|
"mean_token_accuracy": 0.20725145787000657,
|
|
"num_tokens": 66077174.0,
|
|
"step": 26070
|
|
},
|
|
{
|
|
"entropy": 6.289990091323853,
|
|
"epoch": 3.0092325447201387,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000411363254794601,
|
|
"loss": 5.6711,
|
|
"mean_token_accuracy": 0.21055749356746672,
|
|
"num_tokens": 66092510.0,
|
|
"step": 26075
|
|
},
|
|
{
|
|
"entropy": 6.314852380752564,
|
|
"epoch": 3.009809578765147,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000411330430020619,
|
|
"loss": 5.6052,
|
|
"mean_token_accuracy": 0.21417870968580247,
|
|
"num_tokens": 66105001.0,
|
|
"step": 26080
|
|
},
|
|
{
|
|
"entropy": 6.306997489929199,
|
|
"epoch": 3.010386612810156,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004112976006612308,
|
|
"loss": 5.6054,
|
|
"mean_token_accuracy": 0.21196512877941132,
|
|
"num_tokens": 66117264.0,
|
|
"step": 26085
|
|
},
|
|
{
|
|
"entropy": 6.278022289276123,
|
|
"epoch": 3.0109636468551644,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00041126476671754037,
|
|
"loss": 5.6256,
|
|
"mean_token_accuracy": 0.2071828290820122,
|
|
"num_tokens": 66130954.0,
|
|
"step": 26090
|
|
},
|
|
{
|
|
"entropy": 6.288168048858642,
|
|
"epoch": 3.0115406809001732,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00041123192819065234,
|
|
"loss": 5.627,
|
|
"mean_token_accuracy": 0.20207304805517196,
|
|
"num_tokens": 66143560.0,
|
|
"step": 26095
|
|
},
|
|
{
|
|
"entropy": 6.335284614562989,
|
|
"epoch": 3.0121177149451817,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.000411199085081671,
|
|
"loss": 5.656,
|
|
"mean_token_accuracy": 0.20828541815280915,
|
|
"num_tokens": 66157169.0,
|
|
"step": 26100
|
|
},
|
|
{
|
|
"entropy": 6.280328464508057,
|
|
"epoch": 3.0126947489901905,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00041116623739170105,
|
|
"loss": 5.6095,
|
|
"mean_token_accuracy": 0.205639611184597,
|
|
"num_tokens": 66171331.0,
|
|
"step": 26105
|
|
},
|
|
{
|
|
"entropy": 6.316393756866455,
|
|
"epoch": 3.013271783035199,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004111333851218474,
|
|
"loss": 5.6404,
|
|
"mean_token_accuracy": 0.21143314093351365,
|
|
"num_tokens": 66184428.0,
|
|
"step": 26110
|
|
},
|
|
{
|
|
"entropy": 6.345386552810669,
|
|
"epoch": 3.013848817080208,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00041110052827321496,
|
|
"loss": 5.6107,
|
|
"mean_token_accuracy": 0.21014196425676346,
|
|
"num_tokens": 66196602.0,
|
|
"step": 26115
|
|
},
|
|
{
|
|
"entropy": 6.215306949615479,
|
|
"epoch": 3.014425851125216,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00041106766684690884,
|
|
"loss": 5.5403,
|
|
"mean_token_accuracy": 0.21772221177816392,
|
|
"num_tokens": 66209603.0,
|
|
"step": 26120
|
|
},
|
|
{
|
|
"entropy": 6.288187837600708,
|
|
"epoch": 3.015002885170225,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004110348008440344,
|
|
"loss": 5.6307,
|
|
"mean_token_accuracy": 0.20573665350675582,
|
|
"num_tokens": 66221587.0,
|
|
"step": 26125
|
|
},
|
|
{
|
|
"entropy": 6.375280523300171,
|
|
"epoch": 3.0155799192152335,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00041100193026569686,
|
|
"loss": 5.6975,
|
|
"mean_token_accuracy": 0.1963917374610901,
|
|
"num_tokens": 66233243.0,
|
|
"step": 26130
|
|
},
|
|
{
|
|
"entropy": 6.293908357620239,
|
|
"epoch": 3.0161569532602424,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00041096905511300207,
|
|
"loss": 5.6049,
|
|
"mean_token_accuracy": 0.21014516949653625,
|
|
"num_tokens": 66245831.0,
|
|
"step": 26135
|
|
},
|
|
{
|
|
"entropy": 6.352449607849121,
|
|
"epoch": 3.016733987305251,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004109361753870556,
|
|
"loss": 5.6453,
|
|
"mean_token_accuracy": 0.2042999804019928,
|
|
"num_tokens": 66259113.0,
|
|
"step": 26140
|
|
},
|
|
{
|
|
"entropy": 6.218417072296143,
|
|
"epoch": 3.0173110213502596,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004109032910889635,
|
|
"loss": 5.5424,
|
|
"mean_token_accuracy": 0.21769150197505951,
|
|
"num_tokens": 66272633.0,
|
|
"step": 26145
|
|
},
|
|
{
|
|
"entropy": 6.342810106277466,
|
|
"epoch": 3.0178880553952685,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004108704022198316,
|
|
"loss": 5.5805,
|
|
"mean_token_accuracy": 0.21097620725631713,
|
|
"num_tokens": 66286100.0,
|
|
"step": 26150
|
|
},
|
|
{
|
|
"entropy": 6.256284618377686,
|
|
"epoch": 3.018465089440277,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00041083750878076627,
|
|
"loss": 5.5414,
|
|
"mean_token_accuracy": 0.20592065453529357,
|
|
"num_tokens": 66297623.0,
|
|
"step": 26155
|
|
},
|
|
{
|
|
"entropy": 6.229187631607056,
|
|
"epoch": 3.0190421234852858,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004108046107728737,
|
|
"loss": 5.5722,
|
|
"mean_token_accuracy": 0.21466021686792375,
|
|
"num_tokens": 66311688.0,
|
|
"step": 26160
|
|
},
|
|
{
|
|
"entropy": 6.313253021240234,
|
|
"epoch": 3.019619157530294,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00041077170819726064,
|
|
"loss": 5.6218,
|
|
"mean_token_accuracy": 0.20113654881715776,
|
|
"num_tokens": 66324317.0,
|
|
"step": 26165
|
|
},
|
|
{
|
|
"entropy": 6.279792308807373,
|
|
"epoch": 3.020196191575303,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00041073880105503346,
|
|
"loss": 5.5815,
|
|
"mean_token_accuracy": 0.20794297754764557,
|
|
"num_tokens": 66337152.0,
|
|
"step": 26170
|
|
},
|
|
{
|
|
"entropy": 6.423946714401245,
|
|
"epoch": 3.0207732256203115,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00041070588934729923,
|
|
"loss": 5.7063,
|
|
"mean_token_accuracy": 0.20094469487667083,
|
|
"num_tokens": 66349043.0,
|
|
"step": 26175
|
|
},
|
|
{
|
|
"entropy": 6.203110790252685,
|
|
"epoch": 3.0213502596653203,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004106729730751649,
|
|
"loss": 5.505,
|
|
"mean_token_accuracy": 0.22535888403654097,
|
|
"num_tokens": 66362283.0,
|
|
"step": 26180
|
|
},
|
|
{
|
|
"entropy": 6.199810600280761,
|
|
"epoch": 3.0219272937103288,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00041064005223973737,
|
|
"loss": 5.4623,
|
|
"mean_token_accuracy": 0.22339493036270142,
|
|
"num_tokens": 66376919.0,
|
|
"step": 26185
|
|
},
|
|
{
|
|
"entropy": 6.195854759216308,
|
|
"epoch": 3.0225043277553376,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004106071268421241,
|
|
"loss": 5.5036,
|
|
"mean_token_accuracy": 0.22148491740226744,
|
|
"num_tokens": 66389285.0,
|
|
"step": 26190
|
|
},
|
|
{
|
|
"entropy": 6.286485004425049,
|
|
"epoch": 3.023081361800346,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00041057419688343255,
|
|
"loss": 5.6512,
|
|
"mean_token_accuracy": 0.21040226370096207,
|
|
"num_tokens": 66402196.0,
|
|
"step": 26195
|
|
},
|
|
{
|
|
"entropy": 6.196857213973999,
|
|
"epoch": 3.023658395845355,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004105412623647702,
|
|
"loss": 5.5168,
|
|
"mean_token_accuracy": 0.21355133205652238,
|
|
"num_tokens": 66414334.0,
|
|
"step": 26200
|
|
},
|
|
{
|
|
"entropy": 6.311949443817139,
|
|
"epoch": 3.0242354298903633,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00041050832328724476,
|
|
"loss": 5.6612,
|
|
"mean_token_accuracy": 0.2038459986448288,
|
|
"num_tokens": 66425975.0,
|
|
"step": 26205
|
|
},
|
|
{
|
|
"entropy": 6.208622121810913,
|
|
"epoch": 3.024812463935372,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004104753796519642,
|
|
"loss": 5.5072,
|
|
"mean_token_accuracy": 0.21797531247138976,
|
|
"num_tokens": 66438841.0,
|
|
"step": 26210
|
|
},
|
|
{
|
|
"entropy": 6.357542991638184,
|
|
"epoch": 3.025389497980381,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004104424314600365,
|
|
"loss": 5.6308,
|
|
"mean_token_accuracy": 0.20647292733192443,
|
|
"num_tokens": 66451100.0,
|
|
"step": 26215
|
|
},
|
|
{
|
|
"entropy": 6.294093465805053,
|
|
"epoch": 3.0259665320253895,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00041040947871257,
|
|
"loss": 5.5965,
|
|
"mean_token_accuracy": 0.21580876111984254,
|
|
"num_tokens": 66463613.0,
|
|
"step": 26220
|
|
},
|
|
{
|
|
"entropy": 6.261159944534302,
|
|
"epoch": 3.0265435660703983,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00041037652141067294,
|
|
"loss": 5.5677,
|
|
"mean_token_accuracy": 0.21328930258750917,
|
|
"num_tokens": 66476676.0,
|
|
"step": 26225
|
|
},
|
|
{
|
|
"entropy": 6.365573835372925,
|
|
"epoch": 3.0271206001154067,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00041034355955545375,
|
|
"loss": 5.6351,
|
|
"mean_token_accuracy": 0.20695917308330536,
|
|
"num_tokens": 66489577.0,
|
|
"step": 26230
|
|
},
|
|
{
|
|
"entropy": 6.325640869140625,
|
|
"epoch": 3.0276976341604156,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00041031059314802114,
|
|
"loss": 5.6073,
|
|
"mean_token_accuracy": 0.20309820920228958,
|
|
"num_tokens": 66500732.0,
|
|
"step": 26235
|
|
},
|
|
{
|
|
"entropy": 6.200937271118164,
|
|
"epoch": 3.028274668205424,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00041027762218948403,
|
|
"loss": 5.5563,
|
|
"mean_token_accuracy": 0.22017048746347428,
|
|
"num_tokens": 66512342.0,
|
|
"step": 26240
|
|
},
|
|
{
|
|
"entropy": 6.231833362579346,
|
|
"epoch": 3.028851702250433,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00041024464668095123,
|
|
"loss": 5.614,
|
|
"mean_token_accuracy": 0.20844051688909532,
|
|
"num_tokens": 66526042.0,
|
|
"step": 26245
|
|
},
|
|
{
|
|
"entropy": 6.313551187515259,
|
|
"epoch": 3.0294287362954413,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.000410211666623532,
|
|
"loss": 5.5879,
|
|
"mean_token_accuracy": 0.20504943877458573,
|
|
"num_tokens": 66537995.0,
|
|
"step": 26250
|
|
},
|
|
{
|
|
"entropy": 6.3144855976104735,
|
|
"epoch": 3.03000577034045,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00041017868201833545,
|
|
"loss": 5.6817,
|
|
"mean_token_accuracy": 0.20526231080293655,
|
|
"num_tokens": 66550684.0,
|
|
"step": 26255
|
|
},
|
|
{
|
|
"entropy": 6.275561714172364,
|
|
"epoch": 3.0305828043854586,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004101456928664711,
|
|
"loss": 5.5671,
|
|
"mean_token_accuracy": 0.2107621967792511,
|
|
"num_tokens": 66563940.0,
|
|
"step": 26260
|
|
},
|
|
{
|
|
"entropy": 6.23382248878479,
|
|
"epoch": 3.0311598384304674,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004101126991690485,
|
|
"loss": 5.554,
|
|
"mean_token_accuracy": 0.21120525449514388,
|
|
"num_tokens": 66577411.0,
|
|
"step": 26265
|
|
},
|
|
{
|
|
"entropy": 6.281537055969238,
|
|
"epoch": 3.031736872475476,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004100797009271774,
|
|
"loss": 5.6648,
|
|
"mean_token_accuracy": 0.20595156401395798,
|
|
"num_tokens": 66589520.0,
|
|
"step": 26270
|
|
},
|
|
{
|
|
"entropy": 6.294972276687622,
|
|
"epoch": 3.0323139065204847,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004100466981419676,
|
|
"loss": 5.6161,
|
|
"mean_token_accuracy": 0.20933601260185242,
|
|
"num_tokens": 66602573.0,
|
|
"step": 26275
|
|
},
|
|
{
|
|
"entropy": 6.2128125667572025,
|
|
"epoch": 3.0328909405654936,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00041001369081452926,
|
|
"loss": 5.4939,
|
|
"mean_token_accuracy": 0.2178487792611122,
|
|
"num_tokens": 66614739.0,
|
|
"step": 26280
|
|
},
|
|
{
|
|
"entropy": 6.293660640716553,
|
|
"epoch": 3.033467974610502,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00040998067894597247,
|
|
"loss": 5.6798,
|
|
"mean_token_accuracy": 0.20268747359514236,
|
|
"num_tokens": 66628635.0,
|
|
"step": 26285
|
|
},
|
|
{
|
|
"entropy": 6.37081732749939,
|
|
"epoch": 3.034045008655511,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00040994766253740756,
|
|
"loss": 5.6974,
|
|
"mean_token_accuracy": 0.20565842539072038,
|
|
"num_tokens": 66640911.0,
|
|
"step": 26290
|
|
},
|
|
{
|
|
"entropy": 6.231580066680908,
|
|
"epoch": 3.0346220427005193,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00040991464158994506,
|
|
"loss": 5.4611,
|
|
"mean_token_accuracy": 0.2243095114827156,
|
|
"num_tokens": 66654150.0,
|
|
"step": 26295
|
|
},
|
|
{
|
|
"entropy": 6.268218088150024,
|
|
"epoch": 3.035199076745528,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004098816161046956,
|
|
"loss": 5.6428,
|
|
"mean_token_accuracy": 0.20836785584688186,
|
|
"num_tokens": 66666026.0,
|
|
"step": 26300
|
|
},
|
|
{
|
|
"entropy": 6.2532610416412355,
|
|
"epoch": 3.0357761107905366,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00040984858608277,
|
|
"loss": 5.5198,
|
|
"mean_token_accuracy": 0.2120579108595848,
|
|
"num_tokens": 66679446.0,
|
|
"step": 26305
|
|
},
|
|
{
|
|
"entropy": 6.339039707183838,
|
|
"epoch": 3.0363531448355454,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004098155515252793,
|
|
"loss": 5.6883,
|
|
"mean_token_accuracy": 0.20390957444906235,
|
|
"num_tokens": 66692689.0,
|
|
"step": 26310
|
|
},
|
|
{
|
|
"entropy": 6.286600780487061,
|
|
"epoch": 3.036930178880554,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004097825124333343,
|
|
"loss": 5.5079,
|
|
"mean_token_accuracy": 0.21896414160728456,
|
|
"num_tokens": 66705765.0,
|
|
"step": 26315
|
|
},
|
|
{
|
|
"entropy": 6.240317153930664,
|
|
"epoch": 3.0375072129255627,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004097494688080466,
|
|
"loss": 5.5589,
|
|
"mean_token_accuracy": 0.21114757806062698,
|
|
"num_tokens": 66718856.0,
|
|
"step": 26320
|
|
},
|
|
{
|
|
"entropy": 6.284965229034424,
|
|
"epoch": 3.038084246970571,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00040971642065052734,
|
|
"loss": 5.6203,
|
|
"mean_token_accuracy": 0.2039854884147644,
|
|
"num_tokens": 66731330.0,
|
|
"step": 26325
|
|
},
|
|
{
|
|
"entropy": 6.29327278137207,
|
|
"epoch": 3.03866128101558,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004096833679618882,
|
|
"loss": 5.632,
|
|
"mean_token_accuracy": 0.20642514377832413,
|
|
"num_tokens": 66743676.0,
|
|
"step": 26330
|
|
},
|
|
{
|
|
"entropy": 6.262419843673706,
|
|
"epoch": 3.0392383150605884,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00040965031074324094,
|
|
"loss": 5.5404,
|
|
"mean_token_accuracy": 0.2147010639309883,
|
|
"num_tokens": 66757663.0,
|
|
"step": 26335
|
|
},
|
|
{
|
|
"entropy": 6.248820018768311,
|
|
"epoch": 3.0398153491055973,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004096172489956973,
|
|
"loss": 5.5863,
|
|
"mean_token_accuracy": 0.2091632679104805,
|
|
"num_tokens": 66770149.0,
|
|
"step": 26340
|
|
},
|
|
{
|
|
"entropy": 6.297977876663208,
|
|
"epoch": 3.0403923831506057,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004095841827203694,
|
|
"loss": 5.5757,
|
|
"mean_token_accuracy": 0.20999882072210313,
|
|
"num_tokens": 66781754.0,
|
|
"step": 26345
|
|
},
|
|
{
|
|
"entropy": 6.172789239883423,
|
|
"epoch": 3.0409694171956145,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004095511119183693,
|
|
"loss": 5.4202,
|
|
"mean_token_accuracy": 0.22781498581171036,
|
|
"num_tokens": 66795213.0,
|
|
"step": 26350
|
|
},
|
|
{
|
|
"entropy": 6.293553447723388,
|
|
"epoch": 3.0415464512406234,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004095180365908094,
|
|
"loss": 5.6169,
|
|
"mean_token_accuracy": 0.20672335475683212,
|
|
"num_tokens": 66808514.0,
|
|
"step": 26355
|
|
},
|
|
{
|
|
"entropy": 6.148056077957153,
|
|
"epoch": 3.042123485285632,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004094849567388022,
|
|
"loss": 5.4267,
|
|
"mean_token_accuracy": 0.22933701276779175,
|
|
"num_tokens": 66821665.0,
|
|
"step": 26360
|
|
},
|
|
{
|
|
"entropy": 6.275964403152466,
|
|
"epoch": 3.0427005193306407,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004094518723634603,
|
|
"loss": 5.6099,
|
|
"mean_token_accuracy": 0.2027961641550064,
|
|
"num_tokens": 66834447.0,
|
|
"step": 26365
|
|
},
|
|
{
|
|
"entropy": 6.287026834487915,
|
|
"epoch": 3.043277553375649,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004094187834658964,
|
|
"loss": 5.6531,
|
|
"mean_token_accuracy": 0.20614831596612931,
|
|
"num_tokens": 66846199.0,
|
|
"step": 26370
|
|
},
|
|
{
|
|
"entropy": 6.291844654083252,
|
|
"epoch": 3.043854587420658,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004093856900472236,
|
|
"loss": 5.6191,
|
|
"mean_token_accuracy": 0.20398256033658982,
|
|
"num_tokens": 66858055.0,
|
|
"step": 26375
|
|
},
|
|
{
|
|
"entropy": 6.345899248123169,
|
|
"epoch": 3.0444316214656664,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00040935259210855477,
|
|
"loss": 5.5941,
|
|
"mean_token_accuracy": 0.20623804926872252,
|
|
"num_tokens": 66870779.0,
|
|
"step": 26380
|
|
},
|
|
{
|
|
"entropy": 6.267033910751342,
|
|
"epoch": 3.0450086555106752,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004093194896510033,
|
|
"loss": 5.5972,
|
|
"mean_token_accuracy": 0.21205492466688156,
|
|
"num_tokens": 66883212.0,
|
|
"step": 26385
|
|
},
|
|
{
|
|
"entropy": 6.217557621002197,
|
|
"epoch": 3.0455856895556837,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00040928638267568245,
|
|
"loss": 5.5152,
|
|
"mean_token_accuracy": 0.22204977720975877,
|
|
"num_tokens": 66897019.0,
|
|
"step": 26390
|
|
},
|
|
{
|
|
"entropy": 6.2959636688232425,
|
|
"epoch": 3.0461627236006925,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00040925327118370586,
|
|
"loss": 5.6428,
|
|
"mean_token_accuracy": 0.20535663962364198,
|
|
"num_tokens": 66909415.0,
|
|
"step": 26395
|
|
},
|
|
{
|
|
"entropy": 6.288059043884277,
|
|
"epoch": 3.046739757645701,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00040922015517618724,
|
|
"loss": 5.6221,
|
|
"mean_token_accuracy": 0.2076485812664032,
|
|
"num_tokens": 66921459.0,
|
|
"step": 26400
|
|
},
|
|
{
|
|
"entropy": 6.290098094940186,
|
|
"epoch": 3.04731679169071,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004091870346542403,
|
|
"loss": 5.5152,
|
|
"mean_token_accuracy": 0.2207404688000679,
|
|
"num_tokens": 66933558.0,
|
|
"step": 26405
|
|
},
|
|
{
|
|
"entropy": 6.257703018188477,
|
|
"epoch": 3.047893825735718,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004091539096189791,
|
|
"loss": 5.6355,
|
|
"mean_token_accuracy": 0.21042755246162415,
|
|
"num_tokens": 66945950.0,
|
|
"step": 26410
|
|
},
|
|
{
|
|
"entropy": 6.250019454956055,
|
|
"epoch": 3.048470859780727,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00040912078007151776,
|
|
"loss": 5.561,
|
|
"mean_token_accuracy": 0.21184205114841462,
|
|
"num_tokens": 66958848.0,
|
|
"step": 26415
|
|
},
|
|
{
|
|
"entropy": 6.262427711486817,
|
|
"epoch": 3.049047893825736,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00040908764601297064,
|
|
"loss": 5.5064,
|
|
"mean_token_accuracy": 0.21647935807704927,
|
|
"num_tokens": 66970302.0,
|
|
"step": 26420
|
|
},
|
|
{
|
|
"entropy": 6.299281120300293,
|
|
"epoch": 3.0496249278707444,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004090545074444522,
|
|
"loss": 5.6113,
|
|
"mean_token_accuracy": 0.20946595668792725,
|
|
"num_tokens": 66984465.0,
|
|
"step": 26425
|
|
},
|
|
{
|
|
"entropy": 6.260265302658081,
|
|
"epoch": 3.050201961915753,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00040902136436707696,
|
|
"loss": 5.5605,
|
|
"mean_token_accuracy": 0.21218328326940536,
|
|
"num_tokens": 66995555.0,
|
|
"step": 26430
|
|
},
|
|
{
|
|
"entropy": 6.292082214355469,
|
|
"epoch": 3.0507789959607616,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004089882167819596,
|
|
"loss": 5.6152,
|
|
"mean_token_accuracy": 0.20912145376205443,
|
|
"num_tokens": 67007823.0,
|
|
"step": 26435
|
|
},
|
|
{
|
|
"entropy": 6.278995847702026,
|
|
"epoch": 3.0513560300057705,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004089550646902153,
|
|
"loss": 5.5621,
|
|
"mean_token_accuracy": 0.21164837777614592,
|
|
"num_tokens": 67019963.0,
|
|
"step": 26440
|
|
},
|
|
{
|
|
"entropy": 6.138621997833252,
|
|
"epoch": 3.051933064050779,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00040892190809295876,
|
|
"loss": 5.4154,
|
|
"mean_token_accuracy": 0.22769575715065002,
|
|
"num_tokens": 67032721.0,
|
|
"step": 26445
|
|
},
|
|
{
|
|
"entropy": 6.309451580047607,
|
|
"epoch": 3.0525100980957878,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004088887469913055,
|
|
"loss": 5.5475,
|
|
"mean_token_accuracy": 0.2151325225830078,
|
|
"num_tokens": 67046713.0,
|
|
"step": 26450
|
|
},
|
|
{
|
|
"entropy": 6.318570518493653,
|
|
"epoch": 3.053087132140796,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004088555813863707,
|
|
"loss": 5.6684,
|
|
"mean_token_accuracy": 0.19995037466287613,
|
|
"num_tokens": 67059874.0,
|
|
"step": 26455
|
|
},
|
|
{
|
|
"entropy": 6.310893869400024,
|
|
"epoch": 3.053664166185805,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004088224112792699,
|
|
"loss": 5.6293,
|
|
"mean_token_accuracy": 0.20947664827108384,
|
|
"num_tokens": 67071897.0,
|
|
"step": 26460
|
|
},
|
|
{
|
|
"entropy": 6.197533702850341,
|
|
"epoch": 3.0542412002308135,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00040878923667111874,
|
|
"loss": 5.5167,
|
|
"mean_token_accuracy": 0.21583057790994645,
|
|
"num_tokens": 67084489.0,
|
|
"step": 26465
|
|
},
|
|
{
|
|
"entropy": 6.289182519912719,
|
|
"epoch": 3.0548182342758223,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00040875605756303314,
|
|
"loss": 5.6302,
|
|
"mean_token_accuracy": 0.2038386955857277,
|
|
"num_tokens": 67095812.0,
|
|
"step": 26470
|
|
},
|
|
{
|
|
"entropy": 6.270604801177979,
|
|
"epoch": 3.0553952683208307,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004087228739561289,
|
|
"loss": 5.5218,
|
|
"mean_token_accuracy": 0.21248275339603423,
|
|
"num_tokens": 67108551.0,
|
|
"step": 26475
|
|
},
|
|
{
|
|
"entropy": 6.2919573307037355,
|
|
"epoch": 3.0559723023658396,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004086896858515223,
|
|
"loss": 5.5931,
|
|
"mean_token_accuracy": 0.20523792058229445,
|
|
"num_tokens": 67120887.0,
|
|
"step": 26480
|
|
},
|
|
{
|
|
"entropy": 6.257938718795776,
|
|
"epoch": 3.056549336410848,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004086564932503294,
|
|
"loss": 5.56,
|
|
"mean_token_accuracy": 0.21586377322673797,
|
|
"num_tokens": 67133758.0,
|
|
"step": 26485
|
|
},
|
|
{
|
|
"entropy": 6.247624731063842,
|
|
"epoch": 3.057126370455857,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004086232961536669,
|
|
"loss": 5.5366,
|
|
"mean_token_accuracy": 0.21546427309513091,
|
|
"num_tokens": 67145880.0,
|
|
"step": 26490
|
|
},
|
|
{
|
|
"entropy": 6.314199209213257,
|
|
"epoch": 3.0577034045008658,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00040859009456265113,
|
|
"loss": 5.5745,
|
|
"mean_token_accuracy": 0.21231828331947328,
|
|
"num_tokens": 67158104.0,
|
|
"step": 26495
|
|
},
|
|
{
|
|
"entropy": 6.342816638946533,
|
|
"epoch": 3.058280438545874,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00040855688847839884,
|
|
"loss": 5.6298,
|
|
"mean_token_accuracy": 0.20446190536022185,
|
|
"num_tokens": 67170179.0,
|
|
"step": 26500
|
|
},
|
|
{
|
|
"entropy": 6.318542051315307,
|
|
"epoch": 3.058857472590883,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00040852367790202693,
|
|
"loss": 5.691,
|
|
"mean_token_accuracy": 0.20332907289266586,
|
|
"num_tokens": 67182318.0,
|
|
"step": 26505
|
|
},
|
|
{
|
|
"entropy": 6.346238660812378,
|
|
"epoch": 3.0594345066358914,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004084904628346525,
|
|
"loss": 5.6676,
|
|
"mean_token_accuracy": 0.20278288275003434,
|
|
"num_tokens": 67195302.0,
|
|
"step": 26510
|
|
},
|
|
{
|
|
"entropy": 6.3941949844360355,
|
|
"epoch": 3.0600115406809003,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00040845724327739273,
|
|
"loss": 5.6493,
|
|
"mean_token_accuracy": 0.20670333951711656,
|
|
"num_tokens": 67208191.0,
|
|
"step": 26515
|
|
},
|
|
{
|
|
"entropy": 6.22595796585083,
|
|
"epoch": 3.0605885747259087,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00040842401923136477,
|
|
"loss": 5.5638,
|
|
"mean_token_accuracy": 0.21933917701244354,
|
|
"num_tokens": 67221410.0,
|
|
"step": 26520
|
|
},
|
|
{
|
|
"entropy": 6.236261510848999,
|
|
"epoch": 3.0611656087709176,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00040839079069768627,
|
|
"loss": 5.6017,
|
|
"mean_token_accuracy": 0.2151765674352646,
|
|
"num_tokens": 67233958.0,
|
|
"step": 26525
|
|
},
|
|
{
|
|
"entropy": 6.229293346405029,
|
|
"epoch": 3.061742642815926,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004083575576774747,
|
|
"loss": 5.5625,
|
|
"mean_token_accuracy": 0.21519405394792557,
|
|
"num_tokens": 67246622.0,
|
|
"step": 26530
|
|
},
|
|
{
|
|
"entropy": 6.298185157775879,
|
|
"epoch": 3.062319676860935,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00040832432017184797,
|
|
"loss": 5.61,
|
|
"mean_token_accuracy": 0.2117377355694771,
|
|
"num_tokens": 67258942.0,
|
|
"step": 26535
|
|
},
|
|
{
|
|
"entropy": 6.313986682891846,
|
|
"epoch": 3.0628967109059433,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000408291078181924,
|
|
"loss": 5.6135,
|
|
"mean_token_accuracy": 0.20603590309619904,
|
|
"num_tokens": 67271094.0,
|
|
"step": 26540
|
|
},
|
|
{
|
|
"entropy": 6.258365535736084,
|
|
"epoch": 3.063473744950952,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00040825783170882077,
|
|
"loss": 5.5953,
|
|
"mean_token_accuracy": 0.20930705666542054,
|
|
"num_tokens": 67284715.0,
|
|
"step": 26545
|
|
},
|
|
{
|
|
"entropy": 6.335294961929321,
|
|
"epoch": 3.0640507789959606,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00040822458075365654,
|
|
"loss": 5.5996,
|
|
"mean_token_accuracy": 0.20791435539722442,
|
|
"num_tokens": 67298096.0,
|
|
"step": 26550
|
|
},
|
|
{
|
|
"entropy": 6.255341958999634,
|
|
"epoch": 3.0646278130409694,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004081913253175498,
|
|
"loss": 5.5707,
|
|
"mean_token_accuracy": 0.20443811863660813,
|
|
"num_tokens": 67310548.0,
|
|
"step": 26555
|
|
},
|
|
{
|
|
"entropy": 6.287162160873413,
|
|
"epoch": 3.065204847085978,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00040815806540161895,
|
|
"loss": 5.5859,
|
|
"mean_token_accuracy": 0.20791420638561248,
|
|
"num_tokens": 67322771.0,
|
|
"step": 26560
|
|
},
|
|
{
|
|
"entropy": 6.215455961227417,
|
|
"epoch": 3.0657818811309867,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004081248010069827,
|
|
"loss": 5.4892,
|
|
"mean_token_accuracy": 0.22401677966117858,
|
|
"num_tokens": 67336565.0,
|
|
"step": 26565
|
|
},
|
|
{
|
|
"entropy": 6.234211397171021,
|
|
"epoch": 3.0663589151759956,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00040809153213475983,
|
|
"loss": 5.6015,
|
|
"mean_token_accuracy": 0.21106755137443542,
|
|
"num_tokens": 67348390.0,
|
|
"step": 26570
|
|
},
|
|
{
|
|
"entropy": 6.296108770370483,
|
|
"epoch": 3.066935949221004,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00040805825878606944,
|
|
"loss": 5.5503,
|
|
"mean_token_accuracy": 0.21435806155204773,
|
|
"num_tokens": 67360686.0,
|
|
"step": 26575
|
|
},
|
|
{
|
|
"entropy": 6.271973609924316,
|
|
"epoch": 3.067512983266013,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004080249809620307,
|
|
"loss": 5.6313,
|
|
"mean_token_accuracy": 0.20743607729673386,
|
|
"num_tokens": 67372092.0,
|
|
"step": 26580
|
|
},
|
|
{
|
|
"entropy": 6.2365264892578125,
|
|
"epoch": 3.0680900173110213,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00040799169866376266,
|
|
"loss": 5.5287,
|
|
"mean_token_accuracy": 0.20823565274477004,
|
|
"num_tokens": 67386017.0,
|
|
"step": 26585
|
|
},
|
|
{
|
|
"entropy": 6.307186079025269,
|
|
"epoch": 3.06866705135603,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00040795841189238504,
|
|
"loss": 5.6645,
|
|
"mean_token_accuracy": 0.2065518781542778,
|
|
"num_tokens": 67397987.0,
|
|
"step": 26590
|
|
},
|
|
{
|
|
"entropy": 6.3421399116516115,
|
|
"epoch": 3.0692440854010385,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00040792512064901715,
|
|
"loss": 5.6887,
|
|
"mean_token_accuracy": 0.20427913069725037,
|
|
"num_tokens": 67410756.0,
|
|
"step": 26595
|
|
},
|
|
{
|
|
"entropy": 6.381599283218383,
|
|
"epoch": 3.0698211194460474,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00040789182493477887,
|
|
"loss": 5.6933,
|
|
"mean_token_accuracy": 0.20366443544626237,
|
|
"num_tokens": 67423528.0,
|
|
"step": 26600
|
|
},
|
|
{
|
|
"entropy": 6.284521007537842,
|
|
"epoch": 3.070398153491056,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00040785852475079017,
|
|
"loss": 5.6301,
|
|
"mean_token_accuracy": 0.2137070819735527,
|
|
"num_tokens": 67436131.0,
|
|
"step": 26605
|
|
},
|
|
{
|
|
"entropy": 6.201169872283936,
|
|
"epoch": 3.0709751875360647,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004078252200981709,
|
|
"loss": 5.5822,
|
|
"mean_token_accuracy": 0.21634653210639954,
|
|
"num_tokens": 67449422.0,
|
|
"step": 26610
|
|
},
|
|
{
|
|
"entropy": 6.336655712127685,
|
|
"epoch": 3.071552221581073,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00040779191097804133,
|
|
"loss": 5.6333,
|
|
"mean_token_accuracy": 0.20627949833869935,
|
|
"num_tokens": 67461997.0,
|
|
"step": 26615
|
|
},
|
|
{
|
|
"entropy": 6.388158845901489,
|
|
"epoch": 3.072129255626082,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00040775859739152187,
|
|
"loss": 5.7183,
|
|
"mean_token_accuracy": 0.19750173836946489,
|
|
"num_tokens": 67474758.0,
|
|
"step": 26620
|
|
},
|
|
{
|
|
"entropy": 6.166131782531738,
|
|
"epoch": 3.0727062896710904,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004077252793397329,
|
|
"loss": 5.5186,
|
|
"mean_token_accuracy": 0.21558744609355926,
|
|
"num_tokens": 67487437.0,
|
|
"step": 26625
|
|
},
|
|
{
|
|
"entropy": 6.255899381637573,
|
|
"epoch": 3.0732833237160992,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000407691956823795,
|
|
"loss": 5.5671,
|
|
"mean_token_accuracy": 0.20595701932907104,
|
|
"num_tokens": 67500850.0,
|
|
"step": 26630
|
|
},
|
|
{
|
|
"entropy": 6.261994981765747,
|
|
"epoch": 3.073860357761108,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00040765862984482916,
|
|
"loss": 5.5322,
|
|
"mean_token_accuracy": 0.2156509444117546,
|
|
"num_tokens": 67512303.0,
|
|
"step": 26635
|
|
},
|
|
{
|
|
"entropy": 6.2904016971588135,
|
|
"epoch": 3.0744373918061165,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004076252984039561,
|
|
"loss": 5.6758,
|
|
"mean_token_accuracy": 0.20718962103128433,
|
|
"num_tokens": 67524561.0,
|
|
"step": 26640
|
|
},
|
|
{
|
|
"entropy": 6.270637369155883,
|
|
"epoch": 3.0750144258511254,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00040759196250229706,
|
|
"loss": 5.6387,
|
|
"mean_token_accuracy": 0.20272543728351594,
|
|
"num_tokens": 67536859.0,
|
|
"step": 26645
|
|
},
|
|
{
|
|
"entropy": 6.366744041442871,
|
|
"epoch": 3.075591459896134,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00040755862214097326,
|
|
"loss": 5.669,
|
|
"mean_token_accuracy": 0.19989955723285674,
|
|
"num_tokens": 67549265.0,
|
|
"step": 26650
|
|
},
|
|
{
|
|
"entropy": 6.241109037399292,
|
|
"epoch": 3.0761684939411427,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.000407525277321106,
|
|
"loss": 5.6078,
|
|
"mean_token_accuracy": 0.20316141843795776,
|
|
"num_tokens": 67562630.0,
|
|
"step": 26655
|
|
},
|
|
{
|
|
"entropy": 6.346157169342041,
|
|
"epoch": 3.076745527986151,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004074919280438169,
|
|
"loss": 5.6247,
|
|
"mean_token_accuracy": 0.21059015095233918,
|
|
"num_tokens": 67574358.0,
|
|
"step": 26660
|
|
},
|
|
{
|
|
"entropy": 6.334058618545532,
|
|
"epoch": 3.07732256203116,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00040745857431022755,
|
|
"loss": 5.7274,
|
|
"mean_token_accuracy": 0.193741874396801,
|
|
"num_tokens": 67587514.0,
|
|
"step": 26665
|
|
},
|
|
{
|
|
"entropy": 6.362461090087891,
|
|
"epoch": 3.0778995960761684,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00040742521612145986,
|
|
"loss": 5.7422,
|
|
"mean_token_accuracy": 0.19783520102500915,
|
|
"num_tokens": 67600406.0,
|
|
"step": 26670
|
|
},
|
|
{
|
|
"entropy": 6.242453098297119,
|
|
"epoch": 3.0784766301211772,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00040739185347863586,
|
|
"loss": 5.5621,
|
|
"mean_token_accuracy": 0.21015131026506423,
|
|
"num_tokens": 67612988.0,
|
|
"step": 26675
|
|
},
|
|
{
|
|
"entropy": 6.21263427734375,
|
|
"epoch": 3.0790536641661856,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004073584863828776,
|
|
"loss": 5.5984,
|
|
"mean_token_accuracy": 0.21391842663288116,
|
|
"num_tokens": 67625949.0,
|
|
"step": 26680
|
|
},
|
|
{
|
|
"entropy": 6.308975744247436,
|
|
"epoch": 3.0796306982111945,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004073251148353074,
|
|
"loss": 5.6118,
|
|
"mean_token_accuracy": 0.2122059568762779,
|
|
"num_tokens": 67637971.0,
|
|
"step": 26685
|
|
},
|
|
{
|
|
"entropy": 6.306326818466187,
|
|
"epoch": 3.080207732256203,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004072917388370477,
|
|
"loss": 5.5911,
|
|
"mean_token_accuracy": 0.20893189460039138,
|
|
"num_tokens": 67650311.0,
|
|
"step": 26690
|
|
},
|
|
{
|
|
"entropy": 6.2741917133331295,
|
|
"epoch": 3.080784766301212,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00040725835838922105,
|
|
"loss": 5.6391,
|
|
"mean_token_accuracy": 0.20775288641452788,
|
|
"num_tokens": 67662812.0,
|
|
"step": 26695
|
|
},
|
|
{
|
|
"entropy": 6.31061372756958,
|
|
"epoch": 3.0813618003462206,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004072249734929502,
|
|
"loss": 5.6693,
|
|
"mean_token_accuracy": 0.2010042130947113,
|
|
"num_tokens": 67674878.0,
|
|
"step": 26700
|
|
},
|
|
{
|
|
"entropy": 6.33792085647583,
|
|
"epoch": 3.081938834391229,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00040719158414935806,
|
|
"loss": 5.6254,
|
|
"mean_token_accuracy": 0.21054066121578216,
|
|
"num_tokens": 67687562.0,
|
|
"step": 26705
|
|
},
|
|
{
|
|
"entropy": 6.403550624847412,
|
|
"epoch": 3.082515868436238,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004071581903595677,
|
|
"loss": 5.735,
|
|
"mean_token_accuracy": 0.19697750061750413,
|
|
"num_tokens": 67699546.0,
|
|
"step": 26710
|
|
},
|
|
{
|
|
"entropy": 6.225512599945068,
|
|
"epoch": 3.0830929024812463,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00040712479212470223,
|
|
"loss": 5.4766,
|
|
"mean_token_accuracy": 0.21983350217342376,
|
|
"num_tokens": 67711247.0,
|
|
"step": 26715
|
|
},
|
|
{
|
|
"entropy": 6.2588818073272705,
|
|
"epoch": 3.083669936526255,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.000407091389445885,
|
|
"loss": 5.6276,
|
|
"mean_token_accuracy": 0.2034992754459381,
|
|
"num_tokens": 67724305.0,
|
|
"step": 26720
|
|
},
|
|
{
|
|
"entropy": 6.288345861434936,
|
|
"epoch": 3.0842469705712636,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004070579823242395,
|
|
"loss": 5.6149,
|
|
"mean_token_accuracy": 0.2088824287056923,
|
|
"num_tokens": 67737015.0,
|
|
"step": 26725
|
|
},
|
|
{
|
|
"entropy": 6.320836973190308,
|
|
"epoch": 3.0848240046162725,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00040702457076088937,
|
|
"loss": 5.6597,
|
|
"mean_token_accuracy": 0.2043188765645027,
|
|
"num_tokens": 67748883.0,
|
|
"step": 26730
|
|
},
|
|
{
|
|
"entropy": 6.286766862869262,
|
|
"epoch": 3.085401038661281,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004069911547569584,
|
|
"loss": 5.5883,
|
|
"mean_token_accuracy": 0.21148181706666946,
|
|
"num_tokens": 67761278.0,
|
|
"step": 26735
|
|
},
|
|
{
|
|
"entropy": 6.301794528961182,
|
|
"epoch": 3.0859780727062898,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00040695773431357034,
|
|
"loss": 5.6446,
|
|
"mean_token_accuracy": 0.20632142275571824,
|
|
"num_tokens": 67772823.0,
|
|
"step": 26740
|
|
},
|
|
{
|
|
"entropy": 6.3208190441131595,
|
|
"epoch": 3.086555106751298,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004069243094318496,
|
|
"loss": 5.6531,
|
|
"mean_token_accuracy": 0.20843892991542817,
|
|
"num_tokens": 67786490.0,
|
|
"step": 26745
|
|
},
|
|
{
|
|
"entropy": 6.269235992431641,
|
|
"epoch": 3.087132140796307,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00040689088011292024,
|
|
"loss": 5.5917,
|
|
"mean_token_accuracy": 0.21143887490034102,
|
|
"num_tokens": 67799123.0,
|
|
"step": 26750
|
|
},
|
|
{
|
|
"entropy": 6.215679550170899,
|
|
"epoch": 3.0877091748413155,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004068574463579066,
|
|
"loss": 5.5017,
|
|
"mean_token_accuracy": 0.2142403930425644,
|
|
"num_tokens": 67811860.0,
|
|
"step": 26755
|
|
},
|
|
{
|
|
"entropy": 6.2468273639678955,
|
|
"epoch": 3.0882862088863243,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00040682400816793326,
|
|
"loss": 5.6421,
|
|
"mean_token_accuracy": 0.20616656690835952,
|
|
"num_tokens": 67824251.0,
|
|
"step": 26760
|
|
},
|
|
{
|
|
"entropy": 6.42441086769104,
|
|
"epoch": 3.0888632429313327,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00040679056554412485,
|
|
"loss": 5.7213,
|
|
"mean_token_accuracy": 0.19424006193876267,
|
|
"num_tokens": 67837316.0,
|
|
"step": 26765
|
|
},
|
|
{
|
|
"entropy": 6.404419660568237,
|
|
"epoch": 3.0894402769763416,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004067571184876063,
|
|
"loss": 5.6994,
|
|
"mean_token_accuracy": 0.2053467094898224,
|
|
"num_tokens": 67850257.0,
|
|
"step": 26770
|
|
},
|
|
{
|
|
"entropy": 6.319451093673706,
|
|
"epoch": 3.0900173110213505,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00040672366699950245,
|
|
"loss": 5.647,
|
|
"mean_token_accuracy": 0.207024285197258,
|
|
"num_tokens": 67862715.0,
|
|
"step": 26775
|
|
},
|
|
{
|
|
"entropy": 6.322743654251099,
|
|
"epoch": 3.090594345066359,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00040669021108093856,
|
|
"loss": 5.6136,
|
|
"mean_token_accuracy": 0.2107048138976097,
|
|
"num_tokens": 67875282.0,
|
|
"step": 26780
|
|
},
|
|
{
|
|
"entropy": 6.268998336791992,
|
|
"epoch": 3.0911713791113677,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004066567507330398,
|
|
"loss": 5.5868,
|
|
"mean_token_accuracy": 0.20780618041753768,
|
|
"num_tokens": 67886797.0,
|
|
"step": 26785
|
|
},
|
|
{
|
|
"entropy": 6.194073963165283,
|
|
"epoch": 3.091748413156376,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004066232859569316,
|
|
"loss": 5.5679,
|
|
"mean_token_accuracy": 0.21105572134256362,
|
|
"num_tokens": 67899581.0,
|
|
"step": 26790
|
|
},
|
|
{
|
|
"entropy": 6.253467845916748,
|
|
"epoch": 3.092325447201385,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004065898167537396,
|
|
"loss": 5.59,
|
|
"mean_token_accuracy": 0.2104534313082695,
|
|
"num_tokens": 67911640.0,
|
|
"step": 26795
|
|
},
|
|
{
|
|
"entropy": 6.316712427139282,
|
|
"epoch": 3.0929024812463934,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004065563431245895,
|
|
"loss": 5.6276,
|
|
"mean_token_accuracy": 0.2063811480998993,
|
|
"num_tokens": 67925094.0,
|
|
"step": 26800
|
|
},
|
|
{
|
|
"entropy": 6.223725509643555,
|
|
"epoch": 3.0934795152914023,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004065228650706071,
|
|
"loss": 5.5569,
|
|
"mean_token_accuracy": 0.21724656075239182,
|
|
"num_tokens": 67937774.0,
|
|
"step": 26805
|
|
},
|
|
{
|
|
"entropy": 6.316356611251831,
|
|
"epoch": 3.0940565493364107,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00040648938259291845,
|
|
"loss": 5.5845,
|
|
"mean_token_accuracy": 0.20829292088747026,
|
|
"num_tokens": 67950240.0,
|
|
"step": 26810
|
|
},
|
|
{
|
|
"entropy": 6.3174293518066404,
|
|
"epoch": 3.0946335833814196,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004064558956926497,
|
|
"loss": 5.5696,
|
|
"mean_token_accuracy": 0.21278978884220123,
|
|
"num_tokens": 67963503.0,
|
|
"step": 26815
|
|
},
|
|
{
|
|
"entropy": 6.278504800796509,
|
|
"epoch": 3.095210617426428,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004064224043709273,
|
|
"loss": 5.64,
|
|
"mean_token_accuracy": 0.20538755208253862,
|
|
"num_tokens": 67974610.0,
|
|
"step": 26820
|
|
},
|
|
{
|
|
"entropy": 6.256296539306641,
|
|
"epoch": 3.095787651471437,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004063889086288776,
|
|
"loss": 5.5452,
|
|
"mean_token_accuracy": 0.21689425259828568,
|
|
"num_tokens": 67988172.0,
|
|
"step": 26825
|
|
},
|
|
{
|
|
"entropy": 6.221217346191406,
|
|
"epoch": 3.0963646855164453,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00040635540846762713,
|
|
"loss": 5.5981,
|
|
"mean_token_accuracy": 0.21151813119649887,
|
|
"num_tokens": 68001489.0,
|
|
"step": 26830
|
|
},
|
|
{
|
|
"entropy": 6.257963991165161,
|
|
"epoch": 3.096941719561454,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004063219038883028,
|
|
"loss": 5.6441,
|
|
"mean_token_accuracy": 0.2055899903178215,
|
|
"num_tokens": 68014291.0,
|
|
"step": 26835
|
|
},
|
|
{
|
|
"entropy": 6.312999582290649,
|
|
"epoch": 3.0975187536064626,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00040628839489203144,
|
|
"loss": 5.6224,
|
|
"mean_token_accuracy": 0.20165366679430008,
|
|
"num_tokens": 68026735.0,
|
|
"step": 26840
|
|
},
|
|
{
|
|
"entropy": 6.395564174652099,
|
|
"epoch": 3.0980957876514714,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00040625488147994025,
|
|
"loss": 5.7203,
|
|
"mean_token_accuracy": 0.20286059230566025,
|
|
"num_tokens": 68039943.0,
|
|
"step": 26845
|
|
},
|
|
{
|
|
"entropy": 6.242623996734619,
|
|
"epoch": 3.0986728216964803,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00040622136365315616,
|
|
"loss": 5.5723,
|
|
"mean_token_accuracy": 0.20576858520507812,
|
|
"num_tokens": 68053358.0,
|
|
"step": 26850
|
|
},
|
|
{
|
|
"entropy": 6.281509256362915,
|
|
"epoch": 3.0992498557414887,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00040618784141280674,
|
|
"loss": 5.5501,
|
|
"mean_token_accuracy": 0.2129257708787918,
|
|
"num_tokens": 68066002.0,
|
|
"step": 26855
|
|
},
|
|
{
|
|
"entropy": 6.269101333618164,
|
|
"epoch": 3.0998268897864976,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00040615431476001947,
|
|
"loss": 5.5464,
|
|
"mean_token_accuracy": 0.2171017050743103,
|
|
"num_tokens": 68079221.0,
|
|
"step": 26860
|
|
},
|
|
{
|
|
"entropy": 6.297637557983398,
|
|
"epoch": 3.100403923831506,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004061207836959219,
|
|
"loss": 5.6611,
|
|
"mean_token_accuracy": 0.20073664635419847,
|
|
"num_tokens": 68091388.0,
|
|
"step": 26865
|
|
},
|
|
{
|
|
"entropy": 6.322658920288086,
|
|
"epoch": 3.100980957876515,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00040608724822164193,
|
|
"loss": 5.6885,
|
|
"mean_token_accuracy": 0.20526121109724044,
|
|
"num_tokens": 68104016.0,
|
|
"step": 26870
|
|
},
|
|
{
|
|
"entropy": 6.3422407627105715,
|
|
"epoch": 3.1015579919215233,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004060537083383076,
|
|
"loss": 5.5402,
|
|
"mean_token_accuracy": 0.220103819668293,
|
|
"num_tokens": 68117762.0,
|
|
"step": 26875
|
|
},
|
|
{
|
|
"entropy": 6.277603197097778,
|
|
"epoch": 3.102135025966532,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00040602016404704666,
|
|
"loss": 5.5711,
|
|
"mean_token_accuracy": 0.216977059841156,
|
|
"num_tokens": 68129913.0,
|
|
"step": 26880
|
|
},
|
|
{
|
|
"entropy": 6.286070489883423,
|
|
"epoch": 3.1027120600115405,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004059866153489878,
|
|
"loss": 5.6288,
|
|
"mean_token_accuracy": 0.2114587515592575,
|
|
"num_tokens": 68142582.0,
|
|
"step": 26885
|
|
},
|
|
{
|
|
"entropy": 6.320161962509156,
|
|
"epoch": 3.1032890940565494,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00040595306224525904,
|
|
"loss": 5.6212,
|
|
"mean_token_accuracy": 0.20695806592702864,
|
|
"num_tokens": 68156233.0,
|
|
"step": 26890
|
|
},
|
|
{
|
|
"entropy": 6.293744659423828,
|
|
"epoch": 3.103866128101558,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004059195047369892,
|
|
"loss": 5.6006,
|
|
"mean_token_accuracy": 0.2089747115969658,
|
|
"num_tokens": 68168672.0,
|
|
"step": 26895
|
|
},
|
|
{
|
|
"entropy": 6.263481998443604,
|
|
"epoch": 3.1044431621465667,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004058859428253068,
|
|
"loss": 5.6813,
|
|
"mean_token_accuracy": 0.20044244974851608,
|
|
"num_tokens": 68180934.0,
|
|
"step": 26900
|
|
},
|
|
{
|
|
"entropy": 6.312734699249267,
|
|
"epoch": 3.105020196191575,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004058523765113407,
|
|
"loss": 5.6401,
|
|
"mean_token_accuracy": 0.20222071856260299,
|
|
"num_tokens": 68193788.0,
|
|
"step": 26905
|
|
},
|
|
{
|
|
"entropy": 6.3454853057861325,
|
|
"epoch": 3.105597230236584,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00040581880579621996,
|
|
"loss": 5.6096,
|
|
"mean_token_accuracy": 0.21167981922626494,
|
|
"num_tokens": 68204908.0,
|
|
"step": 26910
|
|
},
|
|
{
|
|
"entropy": 6.287997817993164,
|
|
"epoch": 3.106174264281593,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00040578523068107367,
|
|
"loss": 5.6049,
|
|
"mean_token_accuracy": 0.2047601029276848,
|
|
"num_tokens": 68217956.0,
|
|
"step": 26915
|
|
},
|
|
{
|
|
"entropy": 6.251047515869141,
|
|
"epoch": 3.1067512983266012,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00040575165116703103,
|
|
"loss": 5.5547,
|
|
"mean_token_accuracy": 0.21678354144096373,
|
|
"num_tokens": 68229755.0,
|
|
"step": 26920
|
|
},
|
|
{
|
|
"entropy": 6.366534852981568,
|
|
"epoch": 3.10732833237161,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00040571806725522164,
|
|
"loss": 5.6726,
|
|
"mean_token_accuracy": 0.19861685782670974,
|
|
"num_tokens": 68242620.0,
|
|
"step": 26925
|
|
},
|
|
{
|
|
"entropy": 6.205610275268555,
|
|
"epoch": 3.1079053664166185,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00040568447894677494,
|
|
"loss": 5.5295,
|
|
"mean_token_accuracy": 0.21443583071231842,
|
|
"num_tokens": 68256045.0,
|
|
"step": 26930
|
|
},
|
|
{
|
|
"entropy": 6.230793380737305,
|
|
"epoch": 3.1084824004616274,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00040565088624282074,
|
|
"loss": 5.5463,
|
|
"mean_token_accuracy": 0.22139399796724318,
|
|
"num_tokens": 68269378.0,
|
|
"step": 26935
|
|
},
|
|
{
|
|
"entropy": 6.297155570983887,
|
|
"epoch": 3.109059434506636,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004056172891444889,
|
|
"loss": 5.6032,
|
|
"mean_token_accuracy": 0.21124844998121262,
|
|
"num_tokens": 68281575.0,
|
|
"step": 26940
|
|
},
|
|
{
|
|
"entropy": 6.2774590969085695,
|
|
"epoch": 3.1096364685516447,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00040558368765290933,
|
|
"loss": 5.5628,
|
|
"mean_token_accuracy": 0.2149987816810608,
|
|
"num_tokens": 68293690.0,
|
|
"step": 26945
|
|
},
|
|
{
|
|
"entropy": 6.312121057510376,
|
|
"epoch": 3.110213502596653,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00040555008176921235,
|
|
"loss": 5.6832,
|
|
"mean_token_accuracy": 0.198262020945549,
|
|
"num_tokens": 68305200.0,
|
|
"step": 26950
|
|
},
|
|
{
|
|
"entropy": 6.27874345779419,
|
|
"epoch": 3.110790536641662,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004055164714945282,
|
|
"loss": 5.58,
|
|
"mean_token_accuracy": 0.20776597410440445,
|
|
"num_tokens": 68317259.0,
|
|
"step": 26955
|
|
},
|
|
{
|
|
"entropy": 6.221082973480224,
|
|
"epoch": 3.1113675706866704,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00040548285682998736,
|
|
"loss": 5.5965,
|
|
"mean_token_accuracy": 0.21113041192293167,
|
|
"num_tokens": 68330101.0,
|
|
"step": 26960
|
|
},
|
|
{
|
|
"entropy": 6.268272924423218,
|
|
"epoch": 3.111944604731679,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00040544923777672046,
|
|
"loss": 5.6255,
|
|
"mean_token_accuracy": 0.20694927275180816,
|
|
"num_tokens": 68342438.0,
|
|
"step": 26965
|
|
},
|
|
{
|
|
"entropy": 6.254476547241211,
|
|
"epoch": 3.1125216387766876,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004054156143358583,
|
|
"loss": 5.5652,
|
|
"mean_token_accuracy": 0.21165869385004044,
|
|
"num_tokens": 68355202.0,
|
|
"step": 26970
|
|
},
|
|
{
|
|
"entropy": 6.256032466888428,
|
|
"epoch": 3.1130986728216965,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00040538198650853156,
|
|
"loss": 5.5237,
|
|
"mean_token_accuracy": 0.2181511029601097,
|
|
"num_tokens": 68366586.0,
|
|
"step": 26975
|
|
},
|
|
{
|
|
"entropy": 6.278728389739991,
|
|
"epoch": 3.1136757068667054,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004053483542958717,
|
|
"loss": 5.6075,
|
|
"mean_token_accuracy": 0.21161859333515168,
|
|
"num_tokens": 68381132.0,
|
|
"step": 26980
|
|
},
|
|
{
|
|
"entropy": 6.2968181610107425,
|
|
"epoch": 3.114252740911714,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00040531471769900953,
|
|
"loss": 5.6488,
|
|
"mean_token_accuracy": 0.20676520466804504,
|
|
"num_tokens": 68392691.0,
|
|
"step": 26985
|
|
},
|
|
{
|
|
"entropy": 6.323524904251099,
|
|
"epoch": 3.1148297749567226,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004052810767190766,
|
|
"loss": 5.6334,
|
|
"mean_token_accuracy": 0.20840916633605958,
|
|
"num_tokens": 68405499.0,
|
|
"step": 26990
|
|
},
|
|
{
|
|
"entropy": 6.269959115982056,
|
|
"epoch": 3.115406809001731,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00040524743135720437,
|
|
"loss": 5.6687,
|
|
"mean_token_accuracy": 0.20600219815969467,
|
|
"num_tokens": 68418485.0,
|
|
"step": 26995
|
|
},
|
|
{
|
|
"entropy": 6.303348588943481,
|
|
"epoch": 3.11598384304674,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004052137816145245,
|
|
"loss": 5.6196,
|
|
"mean_token_accuracy": 0.21286799609661103,
|
|
"num_tokens": 68432409.0,
|
|
"step": 27000
|
|
},
|
|
{
|
|
"epoch": 3.11598384304674,
|
|
"eval_entropy": 6.111329440674661,
|
|
"eval_loss": 5.734144687652588,
|
|
"eval_mean_token_accuracy": 0.2103794835187984,
|
|
"eval_num_tokens": 68432409.0,
|
|
"eval_runtime": 17.6048,
|
|
"eval_samples_per_second": 1598.202,
|
|
"eval_steps_per_second": 199.775,
|
|
"step": 27000
|
|
},
|
|
{
|
|
"entropy": 6.280648279190063,
|
|
"epoch": 3.1165608770917483,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004051801274921688,
|
|
"loss": 5.5451,
|
|
"mean_token_accuracy": 0.2142835646867752,
|
|
"num_tokens": 68444516.0,
|
|
"step": 27005
|
|
},
|
|
{
|
|
"entropy": 6.30614652633667,
|
|
"epoch": 3.117137911136757,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00040514646899126905,
|
|
"loss": 5.6206,
|
|
"mean_token_accuracy": 0.21314135789871216,
|
|
"num_tokens": 68458326.0,
|
|
"step": 27010
|
|
},
|
|
{
|
|
"entropy": 6.315762376785278,
|
|
"epoch": 3.1177149451817656,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004051128061129576,
|
|
"loss": 5.6058,
|
|
"mean_token_accuracy": 0.20220823884010314,
|
|
"num_tokens": 68472500.0,
|
|
"step": 27015
|
|
},
|
|
{
|
|
"entropy": 6.326185512542724,
|
|
"epoch": 3.1182919792267745,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00040507913885836646,
|
|
"loss": 5.6628,
|
|
"mean_token_accuracy": 0.20913977324962615,
|
|
"num_tokens": 68485280.0,
|
|
"step": 27020
|
|
},
|
|
{
|
|
"entropy": 6.285567951202393,
|
|
"epoch": 3.118869013271783,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004050454672286281,
|
|
"loss": 5.6055,
|
|
"mean_token_accuracy": 0.20629969984292984,
|
|
"num_tokens": 68497792.0,
|
|
"step": 27025
|
|
},
|
|
{
|
|
"entropy": 6.25209608078003,
|
|
"epoch": 3.1194460473167918,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004050117912248751,
|
|
"loss": 5.5523,
|
|
"mean_token_accuracy": 0.2163981691002846,
|
|
"num_tokens": 68510444.0,
|
|
"step": 27030
|
|
},
|
|
{
|
|
"entropy": 6.301897144317627,
|
|
"epoch": 3.1200230813618,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00040497811084824005,
|
|
"loss": 5.5838,
|
|
"mean_token_accuracy": 0.21023460626602172,
|
|
"num_tokens": 68522414.0,
|
|
"step": 27035
|
|
},
|
|
{
|
|
"entropy": 6.297055292129516,
|
|
"epoch": 3.120600115406809,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004049444260998558,
|
|
"loss": 5.5945,
|
|
"mean_token_accuracy": 0.21373381614685058,
|
|
"num_tokens": 68534389.0,
|
|
"step": 27040
|
|
},
|
|
{
|
|
"entropy": 6.256057167053223,
|
|
"epoch": 3.1211771494518175,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004049107369808553,
|
|
"loss": 5.5951,
|
|
"mean_token_accuracy": 0.2072221338748932,
|
|
"num_tokens": 68545881.0,
|
|
"step": 27045
|
|
},
|
|
{
|
|
"entropy": 6.377020168304443,
|
|
"epoch": 3.1217541834968263,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00040487704349237175,
|
|
"loss": 5.6331,
|
|
"mean_token_accuracy": 0.20621429085731507,
|
|
"num_tokens": 68558758.0,
|
|
"step": 27050
|
|
},
|
|
{
|
|
"entropy": 6.280807542800903,
|
|
"epoch": 3.122331217541835,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00040484334563553836,
|
|
"loss": 5.5778,
|
|
"mean_token_accuracy": 0.21310425251722337,
|
|
"num_tokens": 68570551.0,
|
|
"step": 27055
|
|
},
|
|
{
|
|
"entropy": 6.282730054855347,
|
|
"epoch": 3.1229082515868436,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004048096434114885,
|
|
"loss": 5.6846,
|
|
"mean_token_accuracy": 0.20090981274843217,
|
|
"num_tokens": 68583012.0,
|
|
"step": 27060
|
|
},
|
|
{
|
|
"entropy": 6.2662280082702635,
|
|
"epoch": 3.1234852856318525,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00040477593682135575,
|
|
"loss": 5.6107,
|
|
"mean_token_accuracy": 0.20896279960870742,
|
|
"num_tokens": 68594235.0,
|
|
"step": 27065
|
|
},
|
|
{
|
|
"entropy": 6.322656631469727,
|
|
"epoch": 3.124062319676861,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004047422258662739,
|
|
"loss": 5.6175,
|
|
"mean_token_accuracy": 0.20987924039363862,
|
|
"num_tokens": 68605978.0,
|
|
"step": 27070
|
|
},
|
|
{
|
|
"entropy": 6.2886497497558596,
|
|
"epoch": 3.1246393537218697,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00040470851054737666,
|
|
"loss": 5.6292,
|
|
"mean_token_accuracy": 0.20789242088794707,
|
|
"num_tokens": 68619385.0,
|
|
"step": 27075
|
|
},
|
|
{
|
|
"entropy": 6.237132835388183,
|
|
"epoch": 3.125216387766878,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004046747908657982,
|
|
"loss": 5.5813,
|
|
"mean_token_accuracy": 0.21472299993038177,
|
|
"num_tokens": 68631986.0,
|
|
"step": 27080
|
|
},
|
|
{
|
|
"entropy": 6.287612104415894,
|
|
"epoch": 3.125793421811887,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00040464106682267236,
|
|
"loss": 5.5862,
|
|
"mean_token_accuracy": 0.2068384975194931,
|
|
"num_tokens": 68644262.0,
|
|
"step": 27085
|
|
},
|
|
{
|
|
"entropy": 6.306993055343628,
|
|
"epoch": 3.1263704558568954,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004046073384191338,
|
|
"loss": 5.6298,
|
|
"mean_token_accuracy": 0.20488440245389938,
|
|
"num_tokens": 68656941.0,
|
|
"step": 27090
|
|
},
|
|
{
|
|
"entropy": 6.323420238494873,
|
|
"epoch": 3.1269474899019043,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00040457360565631674,
|
|
"loss": 5.719,
|
|
"mean_token_accuracy": 0.19765298217535018,
|
|
"num_tokens": 68669231.0,
|
|
"step": 27095
|
|
},
|
|
{
|
|
"entropy": 6.328269195556641,
|
|
"epoch": 3.1275245239469127,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00040453986853535587,
|
|
"loss": 5.6179,
|
|
"mean_token_accuracy": 0.20387021601200103,
|
|
"num_tokens": 68681882.0,
|
|
"step": 27100
|
|
},
|
|
{
|
|
"entropy": 6.246067857742309,
|
|
"epoch": 3.1281015579919216,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004045061270573858,
|
|
"loss": 5.4575,
|
|
"mean_token_accuracy": 0.2327384665608406,
|
|
"num_tokens": 68693970.0,
|
|
"step": 27105
|
|
},
|
|
{
|
|
"entropy": 6.185442352294922,
|
|
"epoch": 3.12867859203693,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00040447238122354146,
|
|
"loss": 5.5217,
|
|
"mean_token_accuracy": 0.21264556050300598,
|
|
"num_tokens": 68706367.0,
|
|
"step": 27110
|
|
},
|
|
{
|
|
"entropy": 6.35885705947876,
|
|
"epoch": 3.129255626081939,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004044386310349579,
|
|
"loss": 5.705,
|
|
"mean_token_accuracy": 0.19846862852573394,
|
|
"num_tokens": 68718644.0,
|
|
"step": 27115
|
|
},
|
|
{
|
|
"entropy": 6.287991571426391,
|
|
"epoch": 3.1298326601269473,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00040440487649277037,
|
|
"loss": 5.5664,
|
|
"mean_token_accuracy": 0.20847989916801452,
|
|
"num_tokens": 68730545.0,
|
|
"step": 27120
|
|
},
|
|
{
|
|
"entropy": 6.325038433074951,
|
|
"epoch": 3.130409694171956,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00040437111759811397,
|
|
"loss": 5.6503,
|
|
"mean_token_accuracy": 0.20560305565595627,
|
|
"num_tokens": 68743093.0,
|
|
"step": 27125
|
|
},
|
|
{
|
|
"entropy": 6.284808731079101,
|
|
"epoch": 3.130986728216965,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00040433735435212436,
|
|
"loss": 5.6422,
|
|
"mean_token_accuracy": 0.20637041032314302,
|
|
"num_tokens": 68756437.0,
|
|
"step": 27130
|
|
},
|
|
{
|
|
"entropy": 6.25931339263916,
|
|
"epoch": 3.1315637622619734,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004043035867559371,
|
|
"loss": 5.5998,
|
|
"mean_token_accuracy": 0.20996748358011247,
|
|
"num_tokens": 68769380.0,
|
|
"step": 27135
|
|
},
|
|
{
|
|
"entropy": 6.315062427520752,
|
|
"epoch": 3.1321407963069823,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00040426981481068785,
|
|
"loss": 5.604,
|
|
"mean_token_accuracy": 0.21612405329942702,
|
|
"num_tokens": 68782390.0,
|
|
"step": 27140
|
|
},
|
|
{
|
|
"entropy": 6.234471654891967,
|
|
"epoch": 3.1327178303519907,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00040423603851751273,
|
|
"loss": 5.4933,
|
|
"mean_token_accuracy": 0.21778270304203035,
|
|
"num_tokens": 68793931.0,
|
|
"step": 27145
|
|
},
|
|
{
|
|
"entropy": 6.275991010665893,
|
|
"epoch": 3.1332948643969996,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00040420225787754754,
|
|
"loss": 5.6477,
|
|
"mean_token_accuracy": 0.21105570048093797,
|
|
"num_tokens": 68806020.0,
|
|
"step": 27150
|
|
},
|
|
{
|
|
"entropy": 6.364288234710694,
|
|
"epoch": 3.133871898442008,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004041684728919286,
|
|
"loss": 5.6954,
|
|
"mean_token_accuracy": 0.20201407819986344,
|
|
"num_tokens": 68818616.0,
|
|
"step": 27155
|
|
},
|
|
{
|
|
"entropy": 6.313132047653198,
|
|
"epoch": 3.134448932487017,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00040413468356179224,
|
|
"loss": 5.6306,
|
|
"mean_token_accuracy": 0.20861747562885286,
|
|
"num_tokens": 68831549.0,
|
|
"step": 27160
|
|
},
|
|
{
|
|
"entropy": 6.322439289093017,
|
|
"epoch": 3.1350259665320253,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000404100889888275,
|
|
"loss": 5.6161,
|
|
"mean_token_accuracy": 0.21228354126214982,
|
|
"num_tokens": 68842551.0,
|
|
"step": 27165
|
|
},
|
|
{
|
|
"entropy": 6.309630107879639,
|
|
"epoch": 3.135603000577034,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004040670918725133,
|
|
"loss": 5.6659,
|
|
"mean_token_accuracy": 0.20545456558465958,
|
|
"num_tokens": 68855525.0,
|
|
"step": 27170
|
|
},
|
|
{
|
|
"entropy": 6.260705471038818,
|
|
"epoch": 3.1361800346220425,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004040332895156443,
|
|
"loss": 5.6306,
|
|
"mean_token_accuracy": 0.2126890242099762,
|
|
"num_tokens": 68869570.0,
|
|
"step": 27175
|
|
},
|
|
{
|
|
"entropy": 6.3734245777130125,
|
|
"epoch": 3.1367570686670514,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004039994828188045,
|
|
"loss": 5.5997,
|
|
"mean_token_accuracy": 0.21026987731456756,
|
|
"num_tokens": 68881392.0,
|
|
"step": 27180
|
|
},
|
|
{
|
|
"entropy": 6.2442690372467045,
|
|
"epoch": 3.13733410271206,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00040396567178313124,
|
|
"loss": 5.6076,
|
|
"mean_token_accuracy": 0.2057003930211067,
|
|
"num_tokens": 68894107.0,
|
|
"step": 27185
|
|
},
|
|
{
|
|
"entropy": 6.3343194961547855,
|
|
"epoch": 3.1379111367570687,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00040393185640976174,
|
|
"loss": 5.682,
|
|
"mean_token_accuracy": 0.2076703578233719,
|
|
"num_tokens": 68905734.0,
|
|
"step": 27190
|
|
},
|
|
{
|
|
"entropy": 6.378166532516479,
|
|
"epoch": 3.138488170802077,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004038980366998332,
|
|
"loss": 5.6769,
|
|
"mean_token_accuracy": 0.2014593482017517,
|
|
"num_tokens": 68918996.0,
|
|
"step": 27195
|
|
},
|
|
{
|
|
"entropy": 6.24856595993042,
|
|
"epoch": 3.139065204847086,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004038642126544833,
|
|
"loss": 5.5731,
|
|
"mean_token_accuracy": 0.2124515637755394,
|
|
"num_tokens": 68931381.0,
|
|
"step": 27200
|
|
},
|
|
{
|
|
"entropy": 6.327910089492798,
|
|
"epoch": 3.139642238892095,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004038303842748496,
|
|
"loss": 5.6765,
|
|
"mean_token_accuracy": 0.2026467964053154,
|
|
"num_tokens": 68943615.0,
|
|
"step": 27205
|
|
},
|
|
{
|
|
"entropy": 6.26311993598938,
|
|
"epoch": 3.1402192729371032,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00040379655156206983,
|
|
"loss": 5.5374,
|
|
"mean_token_accuracy": 0.21101761609315872,
|
|
"num_tokens": 68955115.0,
|
|
"step": 27210
|
|
},
|
|
{
|
|
"entropy": 6.240866613388062,
|
|
"epoch": 3.140796306982112,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004037627145172822,
|
|
"loss": 5.5374,
|
|
"mean_token_accuracy": 0.215702523291111,
|
|
"num_tokens": 68968042.0,
|
|
"step": 27215
|
|
},
|
|
{
|
|
"entropy": 6.255788373947143,
|
|
"epoch": 3.1413733410271205,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004037288731416245,
|
|
"loss": 5.5534,
|
|
"mean_token_accuracy": 0.22251269370317459,
|
|
"num_tokens": 68982178.0,
|
|
"step": 27220
|
|
},
|
|
{
|
|
"entropy": 6.20533504486084,
|
|
"epoch": 3.1419503750721294,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004036950274362351,
|
|
"loss": 5.65,
|
|
"mean_token_accuracy": 0.20214638411998748,
|
|
"num_tokens": 68994546.0,
|
|
"step": 27225
|
|
},
|
|
{
|
|
"entropy": 6.292791414260864,
|
|
"epoch": 3.142527409117138,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004036611774022524,
|
|
"loss": 5.5935,
|
|
"mean_token_accuracy": 0.21236942410469056,
|
|
"num_tokens": 69007134.0,
|
|
"step": 27230
|
|
},
|
|
{
|
|
"entropy": 6.287568378448486,
|
|
"epoch": 3.1431044431621467,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004036273230408149,
|
|
"loss": 5.5923,
|
|
"mean_token_accuracy": 0.21577005237340927,
|
|
"num_tokens": 69019668.0,
|
|
"step": 27235
|
|
},
|
|
{
|
|
"entropy": 6.362149858474732,
|
|
"epoch": 3.143681477207155,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004035934643530613,
|
|
"loss": 5.6395,
|
|
"mean_token_accuracy": 0.20839455872774124,
|
|
"num_tokens": 69032127.0,
|
|
"step": 27240
|
|
},
|
|
{
|
|
"entropy": 6.29371223449707,
|
|
"epoch": 3.144258511252164,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00040355960134013036,
|
|
"loss": 5.6232,
|
|
"mean_token_accuracy": 0.2055112600326538,
|
|
"num_tokens": 69044926.0,
|
|
"step": 27245
|
|
},
|
|
{
|
|
"entropy": 6.2748801708221436,
|
|
"epoch": 3.1448355452971724,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004035257340031611,
|
|
"loss": 5.5724,
|
|
"mean_token_accuracy": 0.20583218187093735,
|
|
"num_tokens": 69056326.0,
|
|
"step": 27250
|
|
},
|
|
{
|
|
"entropy": 6.312306118011475,
|
|
"epoch": 3.145412579342181,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004034918623432926,
|
|
"loss": 5.646,
|
|
"mean_token_accuracy": 0.2112944945693016,
|
|
"num_tokens": 69069696.0,
|
|
"step": 27255
|
|
},
|
|
{
|
|
"entropy": 6.334290647506714,
|
|
"epoch": 3.14598961338719,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00040345798636166424,
|
|
"loss": 5.6318,
|
|
"mean_token_accuracy": 0.2068129673600197,
|
|
"num_tokens": 69082517.0,
|
|
"step": 27260
|
|
},
|
|
{
|
|
"entropy": 6.2480260848999025,
|
|
"epoch": 3.1465666474321985,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00040342410605941526,
|
|
"loss": 5.5472,
|
|
"mean_token_accuracy": 0.2148619621992111,
|
|
"num_tokens": 69095774.0,
|
|
"step": 27265
|
|
},
|
|
{
|
|
"entropy": 6.298188066482544,
|
|
"epoch": 3.1471436814772074,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00040339022143768524,
|
|
"loss": 5.5898,
|
|
"mean_token_accuracy": 0.21208614110946655,
|
|
"num_tokens": 69109575.0,
|
|
"step": 27270
|
|
},
|
|
{
|
|
"entropy": 6.243906927108765,
|
|
"epoch": 3.1477207155222158,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00040335633249761387,
|
|
"loss": 5.5799,
|
|
"mean_token_accuracy": 0.21195167005062104,
|
|
"num_tokens": 69123365.0,
|
|
"step": 27275
|
|
},
|
|
{
|
|
"entropy": 6.338882541656494,
|
|
"epoch": 3.1482977495672246,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00040332243924034105,
|
|
"loss": 5.6604,
|
|
"mean_token_accuracy": 0.2088367983698845,
|
|
"num_tokens": 69136187.0,
|
|
"step": 27280
|
|
},
|
|
{
|
|
"entropy": 6.282512283325195,
|
|
"epoch": 3.148874783612233,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004032885416670068,
|
|
"loss": 5.5935,
|
|
"mean_token_accuracy": 0.22153957486152648,
|
|
"num_tokens": 69150271.0,
|
|
"step": 27285
|
|
},
|
|
{
|
|
"entropy": 6.333517932891846,
|
|
"epoch": 3.149451817657242,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004032546397787511,
|
|
"loss": 5.6389,
|
|
"mean_token_accuracy": 0.20589299947023393,
|
|
"num_tokens": 69161906.0,
|
|
"step": 27290
|
|
},
|
|
{
|
|
"entropy": 6.280667018890381,
|
|
"epoch": 3.1500288517022503,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004032207335767142,
|
|
"loss": 5.5795,
|
|
"mean_token_accuracy": 0.21173085421323776,
|
|
"num_tokens": 69174367.0,
|
|
"step": 27295
|
|
},
|
|
{
|
|
"entropy": 6.243854427337647,
|
|
"epoch": 3.150605885747259,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004031868230620368,
|
|
"loss": 5.6477,
|
|
"mean_token_accuracy": 0.20793964266777037,
|
|
"num_tokens": 69186970.0,
|
|
"step": 27300
|
|
},
|
|
{
|
|
"entropy": 6.281678962707519,
|
|
"epoch": 3.1511829197922676,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004031529082358592,
|
|
"loss": 5.6472,
|
|
"mean_token_accuracy": 0.20949608385562896,
|
|
"num_tokens": 69199347.0,
|
|
"step": 27305
|
|
},
|
|
{
|
|
"entropy": 6.241601276397705,
|
|
"epoch": 3.1517599538372765,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004031189890993222,
|
|
"loss": 5.5751,
|
|
"mean_token_accuracy": 0.20498041808605194,
|
|
"num_tokens": 69211710.0,
|
|
"step": 27310
|
|
},
|
|
{
|
|
"entropy": 6.297597169876099,
|
|
"epoch": 3.152336987882285,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00040308506565356664,
|
|
"loss": 5.5975,
|
|
"mean_token_accuracy": 0.21405226439237596,
|
|
"num_tokens": 69224153.0,
|
|
"step": 27315
|
|
},
|
|
{
|
|
"entropy": 6.34023232460022,
|
|
"epoch": 3.1529140219272938,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00040305113789973354,
|
|
"loss": 5.645,
|
|
"mean_token_accuracy": 0.20358144491910934,
|
|
"num_tokens": 69236046.0,
|
|
"step": 27320
|
|
},
|
|
{
|
|
"entropy": 6.246219491958618,
|
|
"epoch": 3.153491055972302,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004030172058389639,
|
|
"loss": 5.5723,
|
|
"mean_token_accuracy": 0.2068645492196083,
|
|
"num_tokens": 69247997.0,
|
|
"step": 27325
|
|
},
|
|
{
|
|
"entropy": 6.273966836929321,
|
|
"epoch": 3.154068090017311,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00040298326947239935,
|
|
"loss": 5.5728,
|
|
"mean_token_accuracy": 0.21226352006196975,
|
|
"num_tokens": 69261189.0,
|
|
"step": 27330
|
|
},
|
|
{
|
|
"entropy": 6.333410930633545,
|
|
"epoch": 3.15464512406232,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004029493288011809,
|
|
"loss": 5.6356,
|
|
"mean_token_accuracy": 0.21208658814430237,
|
|
"num_tokens": 69274039.0,
|
|
"step": 27335
|
|
},
|
|
{
|
|
"entropy": 6.183732175827027,
|
|
"epoch": 3.1552221581073283,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004029153838264504,
|
|
"loss": 5.6122,
|
|
"mean_token_accuracy": 0.2141499936580658,
|
|
"num_tokens": 69286759.0,
|
|
"step": 27340
|
|
},
|
|
{
|
|
"entropy": 6.285881471633911,
|
|
"epoch": 3.155799192152337,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004028814345493496,
|
|
"loss": 5.6168,
|
|
"mean_token_accuracy": 0.20552818775177,
|
|
"num_tokens": 69299619.0,
|
|
"step": 27345
|
|
},
|
|
{
|
|
"entropy": 6.2541381359100345,
|
|
"epoch": 3.1563762261973456,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00040284748097102013,
|
|
"loss": 5.491,
|
|
"mean_token_accuracy": 0.2218945398926735,
|
|
"num_tokens": 69311593.0,
|
|
"step": 27350
|
|
},
|
|
{
|
|
"entropy": 6.320835304260254,
|
|
"epoch": 3.1569532602423545,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00040281352309260414,
|
|
"loss": 5.6198,
|
|
"mean_token_accuracy": 0.2023709625005722,
|
|
"num_tokens": 69324686.0,
|
|
"step": 27355
|
|
},
|
|
{
|
|
"entropy": 6.303699207305908,
|
|
"epoch": 3.157530294287363,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004027795609152439,
|
|
"loss": 5.5737,
|
|
"mean_token_accuracy": 0.21024078875780106,
|
|
"num_tokens": 69337042.0,
|
|
"step": 27360
|
|
},
|
|
{
|
|
"entropy": 6.222508955001831,
|
|
"epoch": 3.1581073283323717,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004027455944400815,
|
|
"loss": 5.511,
|
|
"mean_token_accuracy": 0.2153483435511589,
|
|
"num_tokens": 69350244.0,
|
|
"step": 27365
|
|
},
|
|
{
|
|
"entropy": 6.307140731811524,
|
|
"epoch": 3.15868436237738,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004027116236682596,
|
|
"loss": 5.6919,
|
|
"mean_token_accuracy": 0.19986989647150039,
|
|
"num_tokens": 69362813.0,
|
|
"step": 27370
|
|
},
|
|
{
|
|
"entropy": 6.389883422851563,
|
|
"epoch": 3.159261396422389,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004026776486009206,
|
|
"loss": 5.7189,
|
|
"mean_token_accuracy": 0.20044562071561814,
|
|
"num_tokens": 69375397.0,
|
|
"step": 27375
|
|
},
|
|
{
|
|
"entropy": 6.325269365310669,
|
|
"epoch": 3.1598384304673974,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00040264366923920735,
|
|
"loss": 5.6805,
|
|
"mean_token_accuracy": 0.19771179258823396,
|
|
"num_tokens": 69388107.0,
|
|
"step": 27380
|
|
},
|
|
{
|
|
"entropy": 6.2651458263397215,
|
|
"epoch": 3.1604154645124063,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00040260968558426265,
|
|
"loss": 5.5942,
|
|
"mean_token_accuracy": 0.2146643355488777,
|
|
"num_tokens": 69401894.0,
|
|
"step": 27385
|
|
},
|
|
{
|
|
"entropy": 6.25369029045105,
|
|
"epoch": 3.1609924985574147,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004025756976372296,
|
|
"loss": 5.5708,
|
|
"mean_token_accuracy": 0.21594186127185822,
|
|
"num_tokens": 69414581.0,
|
|
"step": 27390
|
|
},
|
|
{
|
|
"entropy": 6.283107089996338,
|
|
"epoch": 3.1615695326024236,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004025417053992513,
|
|
"loss": 5.6035,
|
|
"mean_token_accuracy": 0.21063990145921707,
|
|
"num_tokens": 69428943.0,
|
|
"step": 27395
|
|
},
|
|
{
|
|
"entropy": 6.342917823791504,
|
|
"epoch": 3.162146566647432,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004025077088714711,
|
|
"loss": 5.6683,
|
|
"mean_token_accuracy": 0.20282259434461594,
|
|
"num_tokens": 69442670.0,
|
|
"step": 27400
|
|
},
|
|
{
|
|
"entropy": 6.319306087493897,
|
|
"epoch": 3.162723600692441,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004024737080550324,
|
|
"loss": 5.6156,
|
|
"mean_token_accuracy": 0.20407814383506775,
|
|
"num_tokens": 69454784.0,
|
|
"step": 27405
|
|
},
|
|
{
|
|
"entropy": 6.283424520492554,
|
|
"epoch": 3.1633006347374497,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004024397029510789,
|
|
"loss": 5.5761,
|
|
"mean_token_accuracy": 0.21451566219329835,
|
|
"num_tokens": 69467683.0,
|
|
"step": 27410
|
|
},
|
|
{
|
|
"entropy": 6.2876091480255125,
|
|
"epoch": 3.163877668782458,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004024056935607543,
|
|
"loss": 5.5655,
|
|
"mean_token_accuracy": 0.2107386812567711,
|
|
"num_tokens": 69480741.0,
|
|
"step": 27415
|
|
},
|
|
{
|
|
"entropy": 6.334782838821411,
|
|
"epoch": 3.164454702827467,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00040237167988520245,
|
|
"loss": 5.6334,
|
|
"mean_token_accuracy": 0.2045477345585823,
|
|
"num_tokens": 69493130.0,
|
|
"step": 27420
|
|
},
|
|
{
|
|
"entropy": 6.264880704879761,
|
|
"epoch": 3.1650317368724754,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004023376619255674,
|
|
"loss": 5.6278,
|
|
"mean_token_accuracy": 0.209275920689106,
|
|
"num_tokens": 69504962.0,
|
|
"step": 27425
|
|
},
|
|
{
|
|
"entropy": 6.2241119861602785,
|
|
"epoch": 3.1656087709174843,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00040230363968299344,
|
|
"loss": 5.5925,
|
|
"mean_token_accuracy": 0.2078658312559128,
|
|
"num_tokens": 69517295.0,
|
|
"step": 27430
|
|
},
|
|
{
|
|
"entropy": 6.340341234207154,
|
|
"epoch": 3.1661858049624927,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004022696131586247,
|
|
"loss": 5.6574,
|
|
"mean_token_accuracy": 0.2020434707403183,
|
|
"num_tokens": 69529768.0,
|
|
"step": 27435
|
|
},
|
|
{
|
|
"entropy": 6.27340874671936,
|
|
"epoch": 3.1667628390075016,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004022355823536058,
|
|
"loss": 5.6221,
|
|
"mean_token_accuracy": 0.21082742512226105,
|
|
"num_tokens": 69541746.0,
|
|
"step": 27440
|
|
},
|
|
{
|
|
"entropy": 6.336371278762817,
|
|
"epoch": 3.16733987305251,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00040220154726908127,
|
|
"loss": 5.6364,
|
|
"mean_token_accuracy": 0.20949186533689498,
|
|
"num_tokens": 69553778.0,
|
|
"step": 27445
|
|
},
|
|
{
|
|
"entropy": 6.347769927978516,
|
|
"epoch": 3.167916907097519,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004021675079061959,
|
|
"loss": 5.616,
|
|
"mean_token_accuracy": 0.20534560680389405,
|
|
"num_tokens": 69566317.0,
|
|
"step": 27450
|
|
},
|
|
{
|
|
"entropy": 6.252782678604126,
|
|
"epoch": 3.1684939411425272,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00040213346426609453,
|
|
"loss": 5.5741,
|
|
"mean_token_accuracy": 0.21533328890800477,
|
|
"num_tokens": 69577656.0,
|
|
"step": 27455
|
|
},
|
|
{
|
|
"entropy": 6.247058582305908,
|
|
"epoch": 3.169070975187536,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00040209941634992226,
|
|
"loss": 5.636,
|
|
"mean_token_accuracy": 0.20528533160686493,
|
|
"num_tokens": 69589020.0,
|
|
"step": 27460
|
|
},
|
|
{
|
|
"entropy": 6.313159418106079,
|
|
"epoch": 3.1696480092325445,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004020653641588242,
|
|
"loss": 5.5357,
|
|
"mean_token_accuracy": 0.20915761291980745,
|
|
"num_tokens": 69602003.0,
|
|
"step": 27465
|
|
},
|
|
{
|
|
"entropy": 6.373856019973755,
|
|
"epoch": 3.1702250432775534,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004020313076939458,
|
|
"loss": 5.6616,
|
|
"mean_token_accuracy": 0.20044861137866973,
|
|
"num_tokens": 69614123.0,
|
|
"step": 27470
|
|
},
|
|
{
|
|
"entropy": 6.242585468292236,
|
|
"epoch": 3.170802077322562,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004019972469564325,
|
|
"loss": 5.4299,
|
|
"mean_token_accuracy": 0.23054350465536116,
|
|
"num_tokens": 69628490.0,
|
|
"step": 27475
|
|
},
|
|
{
|
|
"entropy": 6.280749320983887,
|
|
"epoch": 3.1713791113675707,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00040196318194742975,
|
|
"loss": 5.6037,
|
|
"mean_token_accuracy": 0.20541918128728867,
|
|
"num_tokens": 69641313.0,
|
|
"step": 27480
|
|
},
|
|
{
|
|
"entropy": 6.206954908370972,
|
|
"epoch": 3.1719561454125795,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00040192911266808356,
|
|
"loss": 5.4818,
|
|
"mean_token_accuracy": 0.21847744137048722,
|
|
"num_tokens": 69652849.0,
|
|
"step": 27485
|
|
},
|
|
{
|
|
"entropy": 6.232199478149414,
|
|
"epoch": 3.172533179457588,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004018950391195397,
|
|
"loss": 5.6218,
|
|
"mean_token_accuracy": 0.20890334695577623,
|
|
"num_tokens": 69664396.0,
|
|
"step": 27490
|
|
},
|
|
{
|
|
"entropy": 6.285357141494751,
|
|
"epoch": 3.173110213502597,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004018609613029442,
|
|
"loss": 5.5782,
|
|
"mean_token_accuracy": 0.20930920541286469,
|
|
"num_tokens": 69677022.0,
|
|
"step": 27495
|
|
},
|
|
{
|
|
"entropy": 6.323891353607178,
|
|
"epoch": 3.1736872475476052,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004018268792194433,
|
|
"loss": 5.6336,
|
|
"mean_token_accuracy": 0.20908631831407548,
|
|
"num_tokens": 69689132.0,
|
|
"step": 27500
|
|
},
|
|
{
|
|
"entropy": 6.304812049865722,
|
|
"epoch": 3.174264281592614,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00040179279287018334,
|
|
"loss": 5.6298,
|
|
"mean_token_accuracy": 0.21073980033397674,
|
|
"num_tokens": 69701704.0,
|
|
"step": 27505
|
|
},
|
|
{
|
|
"entropy": 6.332776212692261,
|
|
"epoch": 3.1748413156376225,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00040175870225631066,
|
|
"loss": 5.6905,
|
|
"mean_token_accuracy": 0.20020752251148224,
|
|
"num_tokens": 69715362.0,
|
|
"step": 27510
|
|
},
|
|
{
|
|
"entropy": 6.301869249343872,
|
|
"epoch": 3.1754183496826314,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004017246073789721,
|
|
"loss": 5.5674,
|
|
"mean_token_accuracy": 0.21162350177764894,
|
|
"num_tokens": 69726745.0,
|
|
"step": 27515
|
|
},
|
|
{
|
|
"entropy": 6.2439533233642575,
|
|
"epoch": 3.17599538372764,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004016905082393143,
|
|
"loss": 5.5599,
|
|
"mean_token_accuracy": 0.2112882673740387,
|
|
"num_tokens": 69740074.0,
|
|
"step": 27520
|
|
},
|
|
{
|
|
"entropy": 6.263936328887939,
|
|
"epoch": 3.1765724177726486,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00040165640483848415,
|
|
"loss": 5.6397,
|
|
"mean_token_accuracy": 0.20963733941316604,
|
|
"num_tokens": 69751220.0,
|
|
"step": 27525
|
|
},
|
|
{
|
|
"entropy": 6.283355474472046,
|
|
"epoch": 3.177149451817657,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00040162229717762883,
|
|
"loss": 5.671,
|
|
"mean_token_accuracy": 0.20413481444120407,
|
|
"num_tokens": 69764532.0,
|
|
"step": 27530
|
|
},
|
|
{
|
|
"entropy": 6.324439239501953,
|
|
"epoch": 3.177726485862666,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004015881852578953,
|
|
"loss": 5.6126,
|
|
"mean_token_accuracy": 0.21073076426982879,
|
|
"num_tokens": 69776862.0,
|
|
"step": 27535
|
|
},
|
|
{
|
|
"entropy": 6.224767017364502,
|
|
"epoch": 3.1783035199076743,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00040155406908043114,
|
|
"loss": 5.5527,
|
|
"mean_token_accuracy": 0.21479014605283736,
|
|
"num_tokens": 69789667.0,
|
|
"step": 27540
|
|
},
|
|
{
|
|
"entropy": 6.252235460281372,
|
|
"epoch": 3.178880553952683,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004015199486463837,
|
|
"loss": 5.5906,
|
|
"mean_token_accuracy": 0.20748069733381272,
|
|
"num_tokens": 69802112.0,
|
|
"step": 27545
|
|
},
|
|
{
|
|
"entropy": 6.264982891082764,
|
|
"epoch": 3.179457587997692,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004014858239569006,
|
|
"loss": 5.6207,
|
|
"mean_token_accuracy": 0.20792896747589112,
|
|
"num_tokens": 69813908.0,
|
|
"step": 27550
|
|
},
|
|
{
|
|
"entropy": 6.266288805007934,
|
|
"epoch": 3.1800346220427005,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00040145169501312966,
|
|
"loss": 5.5262,
|
|
"mean_token_accuracy": 0.2130235105752945,
|
|
"num_tokens": 69825920.0,
|
|
"step": 27555
|
|
},
|
|
{
|
|
"entropy": 6.2486350536346436,
|
|
"epoch": 3.1806116560877093,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004014175618162188,
|
|
"loss": 5.5743,
|
|
"mean_token_accuracy": 0.21307513862848282,
|
|
"num_tokens": 69839657.0,
|
|
"step": 27560
|
|
},
|
|
{
|
|
"entropy": 6.318980026245117,
|
|
"epoch": 3.1811886901327178,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00040138342436731603,
|
|
"loss": 5.6132,
|
|
"mean_token_accuracy": 0.21092232167720795,
|
|
"num_tokens": 69851778.0,
|
|
"step": 27565
|
|
},
|
|
{
|
|
"entropy": 6.321287345886231,
|
|
"epoch": 3.1817657241777266,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00040134928266756954,
|
|
"loss": 5.6269,
|
|
"mean_token_accuracy": 0.21056060791015624,
|
|
"num_tokens": 69865011.0,
|
|
"step": 27570
|
|
},
|
|
{
|
|
"entropy": 6.273618221282959,
|
|
"epoch": 3.182342758222735,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004013151367181277,
|
|
"loss": 5.6523,
|
|
"mean_token_accuracy": 0.19915929585695266,
|
|
"num_tokens": 69877740.0,
|
|
"step": 27575
|
|
},
|
|
{
|
|
"entropy": 6.346502494812012,
|
|
"epoch": 3.182919792267744,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004012809865201391,
|
|
"loss": 5.636,
|
|
"mean_token_accuracy": 0.20563179701566697,
|
|
"num_tokens": 69890102.0,
|
|
"step": 27580
|
|
},
|
|
{
|
|
"entropy": 6.264924144744873,
|
|
"epoch": 3.1834968263127523,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00040124683207475205,
|
|
"loss": 5.5374,
|
|
"mean_token_accuracy": 0.20749433487653732,
|
|
"num_tokens": 69902500.0,
|
|
"step": 27585
|
|
},
|
|
{
|
|
"entropy": 6.2506874084472654,
|
|
"epoch": 3.184073860357761,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00040121267338311556,
|
|
"loss": 5.6448,
|
|
"mean_token_accuracy": 0.20517605543136597,
|
|
"num_tokens": 69915013.0,
|
|
"step": 27590
|
|
},
|
|
{
|
|
"entropy": 6.2499970436096195,
|
|
"epoch": 3.1846508944027696,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00040117851044637855,
|
|
"loss": 5.4712,
|
|
"mean_token_accuracy": 0.23161206990480424,
|
|
"num_tokens": 69927149.0,
|
|
"step": 27595
|
|
},
|
|
{
|
|
"entropy": 6.360048389434814,
|
|
"epoch": 3.1852279284477785,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00040114434326569005,
|
|
"loss": 5.5944,
|
|
"mean_token_accuracy": 0.210802061855793,
|
|
"num_tokens": 69939924.0,
|
|
"step": 27600
|
|
},
|
|
{
|
|
"entropy": 6.280166292190552,
|
|
"epoch": 3.185804962492787,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00040111017184219915,
|
|
"loss": 5.5985,
|
|
"mean_token_accuracy": 0.2071852743625641,
|
|
"num_tokens": 69952068.0,
|
|
"step": 27605
|
|
},
|
|
{
|
|
"entropy": 6.2078742504119875,
|
|
"epoch": 3.1863819965377957,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00040107599617705527,
|
|
"loss": 5.5557,
|
|
"mean_token_accuracy": 0.2157674178481102,
|
|
"num_tokens": 69965270.0,
|
|
"step": 27610
|
|
},
|
|
{
|
|
"entropy": 6.338355827331543,
|
|
"epoch": 3.1869590305828046,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000401041816271408,
|
|
"loss": 5.6781,
|
|
"mean_token_accuracy": 0.2052323579788208,
|
|
"num_tokens": 69977138.0,
|
|
"step": 27615
|
|
},
|
|
{
|
|
"entropy": 6.320180177688599,
|
|
"epoch": 3.187536064627813,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00040100763212640666,
|
|
"loss": 5.6616,
|
|
"mean_token_accuracy": 0.19994750171899794,
|
|
"num_tokens": 69989599.0,
|
|
"step": 27620
|
|
},
|
|
{
|
|
"entropy": 6.358773803710937,
|
|
"epoch": 3.188113098672822,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004009734437432013,
|
|
"loss": 5.6823,
|
|
"mean_token_accuracy": 0.20146895945072174,
|
|
"num_tokens": 70000887.0,
|
|
"step": 27625
|
|
},
|
|
{
|
|
"entropy": 6.226112937927246,
|
|
"epoch": 3.1886901327178303,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00040093925112294173,
|
|
"loss": 5.5712,
|
|
"mean_token_accuracy": 0.21095245629549025,
|
|
"num_tokens": 70013868.0,
|
|
"step": 27630
|
|
},
|
|
{
|
|
"entropy": 6.331230592727661,
|
|
"epoch": 3.189267166762839,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.000400905054266778,
|
|
"loss": 5.5941,
|
|
"mean_token_accuracy": 0.20924849212169647,
|
|
"num_tokens": 70026307.0,
|
|
"step": 27635
|
|
},
|
|
{
|
|
"entropy": 6.142955780029297,
|
|
"epoch": 3.1898442008078476,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004008708531758603,
|
|
"loss": 5.4904,
|
|
"mean_token_accuracy": 0.22738755792379378,
|
|
"num_tokens": 70040481.0,
|
|
"step": 27640
|
|
},
|
|
{
|
|
"entropy": 6.222723340988159,
|
|
"epoch": 3.1904212348528564,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000400836647851339,
|
|
"loss": 5.5182,
|
|
"mean_token_accuracy": 0.21491173952817916,
|
|
"num_tokens": 70052067.0,
|
|
"step": 27645
|
|
},
|
|
{
|
|
"entropy": 6.338092613220215,
|
|
"epoch": 3.190998268897865,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004008024382943645,
|
|
"loss": 5.7041,
|
|
"mean_token_accuracy": 0.19662541896104813,
|
|
"num_tokens": 70064513.0,
|
|
"step": 27650
|
|
},
|
|
{
|
|
"entropy": 6.270896959304809,
|
|
"epoch": 3.1915753029428737,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00040076822450608757,
|
|
"loss": 5.5628,
|
|
"mean_token_accuracy": 0.2107571467757225,
|
|
"num_tokens": 70077496.0,
|
|
"step": 27655
|
|
},
|
|
{
|
|
"entropy": 6.271143531799316,
|
|
"epoch": 3.192152336987882,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004007340064876588,
|
|
"loss": 5.65,
|
|
"mean_token_accuracy": 0.20753124058246614,
|
|
"num_tokens": 70091035.0,
|
|
"step": 27660
|
|
},
|
|
{
|
|
"entropy": 6.325913524627685,
|
|
"epoch": 3.192729371032891,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004006997842402292,
|
|
"loss": 5.6868,
|
|
"mean_token_accuracy": 0.21040206849575044,
|
|
"num_tokens": 70104773.0,
|
|
"step": 27665
|
|
},
|
|
{
|
|
"entropy": 6.315602350234985,
|
|
"epoch": 3.1933064050778994,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004006655577649498,
|
|
"loss": 5.6489,
|
|
"mean_token_accuracy": 0.20770303755998612,
|
|
"num_tokens": 70118019.0,
|
|
"step": 27670
|
|
},
|
|
{
|
|
"entropy": 6.219042682647705,
|
|
"epoch": 3.1938834391229083,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004006313270629718,
|
|
"loss": 5.6185,
|
|
"mean_token_accuracy": 0.20558024644851686,
|
|
"num_tokens": 70130642.0,
|
|
"step": 27675
|
|
},
|
|
{
|
|
"entropy": 6.247573614120483,
|
|
"epoch": 3.1944604731679167,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00040059709213544656,
|
|
"loss": 5.4989,
|
|
"mean_token_accuracy": 0.21556481420993806,
|
|
"num_tokens": 70144053.0,
|
|
"step": 27680
|
|
},
|
|
{
|
|
"entropy": 6.30216064453125,
|
|
"epoch": 3.1950375072129256,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004005628529835255,
|
|
"loss": 5.5967,
|
|
"mean_token_accuracy": 0.21224593371152878,
|
|
"num_tokens": 70156765.0,
|
|
"step": 27685
|
|
},
|
|
{
|
|
"entropy": 6.253412389755249,
|
|
"epoch": 3.1956145412579344,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004005286096083602,
|
|
"loss": 5.5677,
|
|
"mean_token_accuracy": 0.2115750342607498,
|
|
"num_tokens": 70169515.0,
|
|
"step": 27690
|
|
},
|
|
{
|
|
"entropy": 6.2662559986114506,
|
|
"epoch": 3.196191575302943,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00040049436201110246,
|
|
"loss": 5.6026,
|
|
"mean_token_accuracy": 0.2084380328655243,
|
|
"num_tokens": 70183958.0,
|
|
"step": 27695
|
|
},
|
|
{
|
|
"entropy": 6.354892635345459,
|
|
"epoch": 3.1967686093479517,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00040046011019290417,
|
|
"loss": 5.6594,
|
|
"mean_token_accuracy": 0.20018485486507415,
|
|
"num_tokens": 70196381.0,
|
|
"step": 27700
|
|
},
|
|
{
|
|
"entropy": 6.2231262683868405,
|
|
"epoch": 3.19734564339296,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00040042585415491747,
|
|
"loss": 5.6192,
|
|
"mean_token_accuracy": 0.20663388222455978,
|
|
"num_tokens": 70208685.0,
|
|
"step": 27705
|
|
},
|
|
{
|
|
"entropy": 6.333509063720703,
|
|
"epoch": 3.197922677437969,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004003915938982944,
|
|
"loss": 5.6745,
|
|
"mean_token_accuracy": 0.19874417632818223,
|
|
"num_tokens": 70220651.0,
|
|
"step": 27710
|
|
},
|
|
{
|
|
"entropy": 6.340093517303467,
|
|
"epoch": 3.1984997114829774,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004003573294241875,
|
|
"loss": 5.6571,
|
|
"mean_token_accuracy": 0.20003794878721237,
|
|
"num_tokens": 70233315.0,
|
|
"step": 27715
|
|
},
|
|
{
|
|
"entropy": 6.289077997207642,
|
|
"epoch": 3.1990767455279863,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00040032306073374893,
|
|
"loss": 5.576,
|
|
"mean_token_accuracy": 0.2127383291721344,
|
|
"num_tokens": 70244845.0,
|
|
"step": 27720
|
|
},
|
|
{
|
|
"entropy": 6.2947831630706785,
|
|
"epoch": 3.1996537795729947,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004002887878281315,
|
|
"loss": 5.646,
|
|
"mean_token_accuracy": 0.20544152855873107,
|
|
"num_tokens": 70258242.0,
|
|
"step": 27725
|
|
},
|
|
{
|
|
"entropy": 6.349194049835205,
|
|
"epoch": 3.2002308136180035,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00040025451070848793,
|
|
"loss": 5.6876,
|
|
"mean_token_accuracy": 0.1993110626935959,
|
|
"num_tokens": 70270568.0,
|
|
"step": 27730
|
|
},
|
|
{
|
|
"entropy": 6.300068759918213,
|
|
"epoch": 3.200807847663012,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00040022022937597114,
|
|
"loss": 5.5714,
|
|
"mean_token_accuracy": 0.2096689373254776,
|
|
"num_tokens": 70284180.0,
|
|
"step": 27735
|
|
},
|
|
{
|
|
"entropy": 6.359479761123657,
|
|
"epoch": 3.201384881708021,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00040018594383173407,
|
|
"loss": 5.69,
|
|
"mean_token_accuracy": 0.20331769734621047,
|
|
"num_tokens": 70296970.0,
|
|
"step": 27740
|
|
},
|
|
{
|
|
"entropy": 6.3019129753112795,
|
|
"epoch": 3.2019619157530292,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00040015165407693005,
|
|
"loss": 5.5914,
|
|
"mean_token_accuracy": 0.20650949329137802,
|
|
"num_tokens": 70308814.0,
|
|
"step": 27745
|
|
},
|
|
{
|
|
"entropy": 6.270701169967651,
|
|
"epoch": 3.202538949798038,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004001173601127123,
|
|
"loss": 5.6116,
|
|
"mean_token_accuracy": 0.2111584186553955,
|
|
"num_tokens": 70320608.0,
|
|
"step": 27750
|
|
},
|
|
{
|
|
"entropy": 6.176051235198974,
|
|
"epoch": 3.2031159838430465,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00040008306194023427,
|
|
"loss": 5.565,
|
|
"mean_token_accuracy": 0.21348786652088164,
|
|
"num_tokens": 70333550.0,
|
|
"step": 27755
|
|
},
|
|
{
|
|
"entropy": 6.268049192428589,
|
|
"epoch": 3.2036930178880554,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004000487595606496,
|
|
"loss": 5.5364,
|
|
"mean_token_accuracy": 0.21447824239730834,
|
|
"num_tokens": 70346417.0,
|
|
"step": 27760
|
|
},
|
|
{
|
|
"entropy": 6.297869777679443,
|
|
"epoch": 3.2042700519330642,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004000144529751119,
|
|
"loss": 5.5939,
|
|
"mean_token_accuracy": 0.20830464810132981,
|
|
"num_tokens": 70359820.0,
|
|
"step": 27765
|
|
},
|
|
{
|
|
"entropy": 6.267748165130615,
|
|
"epoch": 3.2048470859780727,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003999801421847753,
|
|
"loss": 5.6366,
|
|
"mean_token_accuracy": 0.21027962416410445,
|
|
"num_tokens": 70373835.0,
|
|
"step": 27770
|
|
},
|
|
{
|
|
"entropy": 6.256307220458984,
|
|
"epoch": 3.2054241200230815,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00039994582719079364,
|
|
"loss": 5.5618,
|
|
"mean_token_accuracy": 0.213333335518837,
|
|
"num_tokens": 70387162.0,
|
|
"step": 27775
|
|
},
|
|
{
|
|
"entropy": 6.318533182144165,
|
|
"epoch": 3.20600115406809,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00039991150799432117,
|
|
"loss": 5.6341,
|
|
"mean_token_accuracy": 0.20636617988348008,
|
|
"num_tokens": 70399443.0,
|
|
"step": 27780
|
|
},
|
|
{
|
|
"entropy": 6.282486343383789,
|
|
"epoch": 3.206578188113099,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003998771845965122,
|
|
"loss": 5.5634,
|
|
"mean_token_accuracy": 0.21318477839231492,
|
|
"num_tokens": 70411256.0,
|
|
"step": 27785
|
|
},
|
|
{
|
|
"entropy": 6.239754247665405,
|
|
"epoch": 3.207155222158107,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00039984285699852116,
|
|
"loss": 5.5767,
|
|
"mean_token_accuracy": 0.21819828897714616,
|
|
"num_tokens": 70424327.0,
|
|
"step": 27790
|
|
},
|
|
{
|
|
"entropy": 6.26032509803772,
|
|
"epoch": 3.207732256203116,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00039980852520150255,
|
|
"loss": 5.5725,
|
|
"mean_token_accuracy": 0.21529716551303862,
|
|
"num_tokens": 70436869.0,
|
|
"step": 27795
|
|
},
|
|
{
|
|
"entropy": 6.261692047119141,
|
|
"epoch": 3.2083092902481245,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0003997741892066113,
|
|
"loss": 5.6179,
|
|
"mean_token_accuracy": 0.2112206056714058,
|
|
"num_tokens": 70449803.0,
|
|
"step": 27800
|
|
},
|
|
{
|
|
"entropy": 6.292197179794312,
|
|
"epoch": 3.2088863242931334,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0003997398490150021,
|
|
"loss": 5.6243,
|
|
"mean_token_accuracy": 0.20314894914627074,
|
|
"num_tokens": 70461822.0,
|
|
"step": 27805
|
|
},
|
|
{
|
|
"entropy": 6.2733073234558105,
|
|
"epoch": 3.209463358338142,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003997055046278301,
|
|
"loss": 5.5934,
|
|
"mean_token_accuracy": 0.20994288921356202,
|
|
"num_tokens": 70473906.0,
|
|
"step": 27810
|
|
},
|
|
{
|
|
"entropy": 6.158846473693847,
|
|
"epoch": 3.2100403923831506,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003996711560462503,
|
|
"loss": 5.5009,
|
|
"mean_token_accuracy": 0.22262994050979615,
|
|
"num_tokens": 70486915.0,
|
|
"step": 27815
|
|
},
|
|
{
|
|
"entropy": 6.341830444335938,
|
|
"epoch": 3.210617426428159,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003996368032714182,
|
|
"loss": 5.6136,
|
|
"mean_token_accuracy": 0.21167494505643844,
|
|
"num_tokens": 70500180.0,
|
|
"step": 27820
|
|
},
|
|
{
|
|
"entropy": 6.248844385147095,
|
|
"epoch": 3.211194460473168,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0003996024463044891,
|
|
"loss": 5.5626,
|
|
"mean_token_accuracy": 0.2101464420557022,
|
|
"num_tokens": 70512785.0,
|
|
"step": 27825
|
|
},
|
|
{
|
|
"entropy": 6.281163167953491,
|
|
"epoch": 3.2117714945181763,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003995680851466186,
|
|
"loss": 5.6491,
|
|
"mean_token_accuracy": 0.20411243438720703,
|
|
"num_tokens": 70525187.0,
|
|
"step": 27830
|
|
},
|
|
{
|
|
"entropy": 6.297643566131592,
|
|
"epoch": 3.212348528563185,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003995337197989624,
|
|
"loss": 5.6097,
|
|
"mean_token_accuracy": 0.20550436079502105,
|
|
"num_tokens": 70538252.0,
|
|
"step": 27835
|
|
},
|
|
{
|
|
"entropy": 6.200496339797974,
|
|
"epoch": 3.212925562608194,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00039949935026267644,
|
|
"loss": 5.6193,
|
|
"mean_token_accuracy": 0.208396115899086,
|
|
"num_tokens": 70549826.0,
|
|
"step": 27840
|
|
},
|
|
{
|
|
"entropy": 6.328450870513916,
|
|
"epoch": 3.2135025966532025,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00039946497653891666,
|
|
"loss": 5.5831,
|
|
"mean_token_accuracy": 0.21371688395738603,
|
|
"num_tokens": 70561580.0,
|
|
"step": 27845
|
|
},
|
|
{
|
|
"entropy": 6.355673456192017,
|
|
"epoch": 3.2140796306982113,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00039943059862883925,
|
|
"loss": 5.7416,
|
|
"mean_token_accuracy": 0.1989153578877449,
|
|
"num_tokens": 70575246.0,
|
|
"step": 27850
|
|
},
|
|
{
|
|
"entropy": 6.368279218673706,
|
|
"epoch": 3.2146566647432198,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00039939621653360045,
|
|
"loss": 5.7283,
|
|
"mean_token_accuracy": 0.20136324614286422,
|
|
"num_tokens": 70588457.0,
|
|
"step": 27855
|
|
},
|
|
{
|
|
"entropy": 6.3300799369812015,
|
|
"epoch": 3.2152336987882286,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003993618302543566,
|
|
"loss": 5.6379,
|
|
"mean_token_accuracy": 0.20687256753444672,
|
|
"num_tokens": 70599772.0,
|
|
"step": 27860
|
|
},
|
|
{
|
|
"entropy": 6.266088533401489,
|
|
"epoch": 3.215810732833237,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0003993274397922645,
|
|
"loss": 5.5567,
|
|
"mean_token_accuracy": 0.21045310646295548,
|
|
"num_tokens": 70611901.0,
|
|
"step": 27865
|
|
},
|
|
{
|
|
"entropy": 6.253934097290039,
|
|
"epoch": 3.216387766878246,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0003992930451484807,
|
|
"loss": 5.58,
|
|
"mean_token_accuracy": 0.21429014801979065,
|
|
"num_tokens": 70625613.0,
|
|
"step": 27870
|
|
},
|
|
{
|
|
"entropy": 6.341644430160523,
|
|
"epoch": 3.2169648009232543,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.000399258646324162,
|
|
"loss": 5.7207,
|
|
"mean_token_accuracy": 0.204912930727005,
|
|
"num_tokens": 70639286.0,
|
|
"step": 27875
|
|
},
|
|
{
|
|
"entropy": 6.345269680023193,
|
|
"epoch": 3.217541834968263,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0003992242433204655,
|
|
"loss": 5.6471,
|
|
"mean_token_accuracy": 0.20461164116859437,
|
|
"num_tokens": 70651021.0,
|
|
"step": 27880
|
|
},
|
|
{
|
|
"entropy": 6.308106279373169,
|
|
"epoch": 3.2181188690132716,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00039918983613854825,
|
|
"loss": 5.5943,
|
|
"mean_token_accuracy": 0.21146236062049867,
|
|
"num_tokens": 70664417.0,
|
|
"step": 27885
|
|
},
|
|
{
|
|
"entropy": 6.263552618026734,
|
|
"epoch": 3.2186959030582805,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0003991554247795676,
|
|
"loss": 5.5909,
|
|
"mean_token_accuracy": 0.20829192996025087,
|
|
"num_tokens": 70677517.0,
|
|
"step": 27890
|
|
},
|
|
{
|
|
"entropy": 6.308443307876587,
|
|
"epoch": 3.2192729371032893,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003991210092446808,
|
|
"loss": 5.624,
|
|
"mean_token_accuracy": 0.2079137921333313,
|
|
"num_tokens": 70689746.0,
|
|
"step": 27895
|
|
},
|
|
{
|
|
"entropy": 6.295773315429687,
|
|
"epoch": 3.2198499711482977,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00039908658953504567,
|
|
"loss": 5.6715,
|
|
"mean_token_accuracy": 0.2030926451086998,
|
|
"num_tokens": 70702356.0,
|
|
"step": 27900
|
|
},
|
|
{
|
|
"entropy": 6.12532901763916,
|
|
"epoch": 3.2204270051933066,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00039905216565181963,
|
|
"loss": 5.4842,
|
|
"mean_token_accuracy": 0.22245388329029084,
|
|
"num_tokens": 70715147.0,
|
|
"step": 27905
|
|
},
|
|
{
|
|
"entropy": 6.380943965911865,
|
|
"epoch": 3.221004039238315,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0003990177375961607,
|
|
"loss": 5.7468,
|
|
"mean_token_accuracy": 0.20233649611473084,
|
|
"num_tokens": 70727951.0,
|
|
"step": 27910
|
|
},
|
|
{
|
|
"entropy": 6.2903014659881595,
|
|
"epoch": 3.221581073283324,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00039898330536922665,
|
|
"loss": 5.5551,
|
|
"mean_token_accuracy": 0.20987427979707718,
|
|
"num_tokens": 70740823.0,
|
|
"step": 27915
|
|
},
|
|
{
|
|
"entropy": 6.329444456100464,
|
|
"epoch": 3.2221581073283323,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003989488689721758,
|
|
"loss": 5.5988,
|
|
"mean_token_accuracy": 0.20744044780731202,
|
|
"num_tokens": 70753323.0,
|
|
"step": 27920
|
|
},
|
|
{
|
|
"entropy": 6.2619959831237795,
|
|
"epoch": 3.222735141373341,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0003989144284061662,
|
|
"loss": 5.5746,
|
|
"mean_token_accuracy": 0.2115836262702942,
|
|
"num_tokens": 70765546.0,
|
|
"step": 27925
|
|
},
|
|
{
|
|
"entropy": 6.2213132858276365,
|
|
"epoch": 3.2233121754183496,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0003988799836723565,
|
|
"loss": 5.5977,
|
|
"mean_token_accuracy": 0.2093339666724205,
|
|
"num_tokens": 70778869.0,
|
|
"step": 27930
|
|
},
|
|
{
|
|
"entropy": 6.262832975387573,
|
|
"epoch": 3.2238892094633584,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000398845534771905,
|
|
"loss": 5.5693,
|
|
"mean_token_accuracy": 0.21546707451343536,
|
|
"num_tokens": 70792227.0,
|
|
"step": 27935
|
|
},
|
|
{
|
|
"entropy": 6.37469630241394,
|
|
"epoch": 3.224466243508367,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0003988110817059705,
|
|
"loss": 5.6839,
|
|
"mean_token_accuracy": 0.20589757710695267,
|
|
"num_tokens": 70804979.0,
|
|
"step": 27940
|
|
},
|
|
{
|
|
"entropy": 6.250352668762207,
|
|
"epoch": 3.2250432775533757,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003987766244757117,
|
|
"loss": 5.6006,
|
|
"mean_token_accuracy": 0.2121186524629593,
|
|
"num_tokens": 70817538.0,
|
|
"step": 27945
|
|
},
|
|
{
|
|
"entropy": 6.312923622131348,
|
|
"epoch": 3.225620311598384,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00039874216308228764,
|
|
"loss": 5.6607,
|
|
"mean_token_accuracy": 0.2053826630115509,
|
|
"num_tokens": 70830186.0,
|
|
"step": 27950
|
|
},
|
|
{
|
|
"entropy": 6.2706263065338135,
|
|
"epoch": 3.226197345643393,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00039870769752685744,
|
|
"loss": 5.6436,
|
|
"mean_token_accuracy": 0.20785950124263763,
|
|
"num_tokens": 70841367.0,
|
|
"step": 27955
|
|
},
|
|
{
|
|
"entropy": 6.311527585983276,
|
|
"epoch": 3.2267743796884014,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00039867322781058024,
|
|
"loss": 5.5655,
|
|
"mean_token_accuracy": 0.21646139323711394,
|
|
"num_tokens": 70853630.0,
|
|
"step": 27960
|
|
},
|
|
{
|
|
"entropy": 6.343416309356689,
|
|
"epoch": 3.2273514137334103,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00039863875393461546,
|
|
"loss": 5.7074,
|
|
"mean_token_accuracy": 0.20554562658071518,
|
|
"num_tokens": 70866966.0,
|
|
"step": 27965
|
|
},
|
|
{
|
|
"entropy": 6.289302349090576,
|
|
"epoch": 3.227928447778419,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0003986042759001226,
|
|
"loss": 5.6117,
|
|
"mean_token_accuracy": 0.20529442876577378,
|
|
"num_tokens": 70879287.0,
|
|
"step": 27970
|
|
},
|
|
{
|
|
"entropy": 6.241036605834961,
|
|
"epoch": 3.2285054818234276,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0003985697937082613,
|
|
"loss": 5.5459,
|
|
"mean_token_accuracy": 0.21563542932271956,
|
|
"num_tokens": 70892749.0,
|
|
"step": 27975
|
|
},
|
|
{
|
|
"entropy": 6.311645650863648,
|
|
"epoch": 3.2290825158684364,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00039853530736019143,
|
|
"loss": 5.5984,
|
|
"mean_token_accuracy": 0.21169278621673585,
|
|
"num_tokens": 70905463.0,
|
|
"step": 27980
|
|
},
|
|
{
|
|
"entropy": 6.3477307796478275,
|
|
"epoch": 3.229659549913445,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003985008168570728,
|
|
"loss": 5.5974,
|
|
"mean_token_accuracy": 0.2101701855659485,
|
|
"num_tokens": 70919630.0,
|
|
"step": 27985
|
|
},
|
|
{
|
|
"entropy": 6.27520055770874,
|
|
"epoch": 3.2302365839584537,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003984663222000656,
|
|
"loss": 5.5627,
|
|
"mean_token_accuracy": 0.21044061034917833,
|
|
"num_tokens": 70931810.0,
|
|
"step": 27990
|
|
},
|
|
{
|
|
"entropy": 6.233928871154785,
|
|
"epoch": 3.230813618003462,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00039843182339032997,
|
|
"loss": 5.604,
|
|
"mean_token_accuracy": 0.20826649367809297,
|
|
"num_tokens": 70945003.0,
|
|
"step": 27995
|
|
},
|
|
{
|
|
"entropy": 6.278956174850464,
|
|
"epoch": 3.231390652048471,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003983973204290263,
|
|
"loss": 5.5805,
|
|
"mean_token_accuracy": 0.22130182087421418,
|
|
"num_tokens": 70958889.0,
|
|
"step": 28000
|
|
},
|
|
{
|
|
"entropy": 6.269268035888672,
|
|
"epoch": 3.2319676860934794,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00039836281331731495,
|
|
"loss": 5.5308,
|
|
"mean_token_accuracy": 0.21276628226041794,
|
|
"num_tokens": 70972003.0,
|
|
"step": 28005
|
|
},
|
|
{
|
|
"entropy": 6.324998950958252,
|
|
"epoch": 3.2325447201384883,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00039832830205635675,
|
|
"loss": 5.662,
|
|
"mean_token_accuracy": 0.1976704940199852,
|
|
"num_tokens": 70984269.0,
|
|
"step": 28010
|
|
},
|
|
{
|
|
"entropy": 6.238791275024414,
|
|
"epoch": 3.2331217541834967,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00039829378664731226,
|
|
"loss": 5.5839,
|
|
"mean_token_accuracy": 0.20920709371566773,
|
|
"num_tokens": 70998602.0,
|
|
"step": 28015
|
|
},
|
|
{
|
|
"entropy": 6.357817316055298,
|
|
"epoch": 3.2336987882285055,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00039825926709134257,
|
|
"loss": 5.6212,
|
|
"mean_token_accuracy": 0.21046290844678878,
|
|
"num_tokens": 71011095.0,
|
|
"step": 28020
|
|
},
|
|
{
|
|
"entropy": 6.33611650466919,
|
|
"epoch": 3.234275822273514,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003982247433896087,
|
|
"loss": 5.6622,
|
|
"mean_token_accuracy": 0.2019645854830742,
|
|
"num_tokens": 71022610.0,
|
|
"step": 28025
|
|
},
|
|
{
|
|
"entropy": 6.31957311630249,
|
|
"epoch": 3.234852856318523,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00039819021554327174,
|
|
"loss": 5.6771,
|
|
"mean_token_accuracy": 0.20578875839710237,
|
|
"num_tokens": 71035896.0,
|
|
"step": 28030
|
|
},
|
|
{
|
|
"entropy": 6.3138000011444095,
|
|
"epoch": 3.2354298903635312,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0003981556835534931,
|
|
"loss": 5.6395,
|
|
"mean_token_accuracy": 0.20976679176092147,
|
|
"num_tokens": 71047793.0,
|
|
"step": 28035
|
|
},
|
|
{
|
|
"entropy": 6.342609310150147,
|
|
"epoch": 3.23600692440854,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003981211474214342,
|
|
"loss": 5.6558,
|
|
"mean_token_accuracy": 0.20807725340127944,
|
|
"num_tokens": 71060481.0,
|
|
"step": 28040
|
|
},
|
|
{
|
|
"entropy": 6.3144979000091555,
|
|
"epoch": 3.236583958453549,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0003980866071482566,
|
|
"loss": 5.6154,
|
|
"mean_token_accuracy": 0.21544622182846068,
|
|
"num_tokens": 71073757.0,
|
|
"step": 28045
|
|
},
|
|
{
|
|
"entropy": 6.278196096420288,
|
|
"epoch": 3.2371609924985574,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0003980520627351222,
|
|
"loss": 5.6371,
|
|
"mean_token_accuracy": 0.2110177367925644,
|
|
"num_tokens": 71087158.0,
|
|
"step": 28050
|
|
},
|
|
{
|
|
"entropy": 6.293360805511474,
|
|
"epoch": 3.2377380265435662,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003980175141831928,
|
|
"loss": 5.6586,
|
|
"mean_token_accuracy": 0.20277148783206939,
|
|
"num_tokens": 71099242.0,
|
|
"step": 28055
|
|
},
|
|
{
|
|
"entropy": 6.3236627101898195,
|
|
"epoch": 3.2383150605885747,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00039798296149363033,
|
|
"loss": 5.5717,
|
|
"mean_token_accuracy": 0.21038787364959716,
|
|
"num_tokens": 71110971.0,
|
|
"step": 28060
|
|
},
|
|
{
|
|
"entropy": 6.296569919586181,
|
|
"epoch": 3.2388920946335835,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00039794840466759714,
|
|
"loss": 5.6877,
|
|
"mean_token_accuracy": 0.20707605481147767,
|
|
"num_tokens": 71125024.0,
|
|
"step": 28065
|
|
},
|
|
{
|
|
"entropy": 6.233076190948486,
|
|
"epoch": 3.239469128678592,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00039791384370625537,
|
|
"loss": 5.5003,
|
|
"mean_token_accuracy": 0.21342584788799285,
|
|
"num_tokens": 71138030.0,
|
|
"step": 28070
|
|
},
|
|
{
|
|
"entropy": 6.321987152099609,
|
|
"epoch": 3.240046162723601,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0003978792786107675,
|
|
"loss": 5.675,
|
|
"mean_token_accuracy": 0.20538391321897506,
|
|
"num_tokens": 71150763.0,
|
|
"step": 28075
|
|
},
|
|
{
|
|
"entropy": 6.2939611911773685,
|
|
"epoch": 3.240623196768609,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00039784470938229624,
|
|
"loss": 5.5428,
|
|
"mean_token_accuracy": 0.21491851210594176,
|
|
"num_tokens": 71163235.0,
|
|
"step": 28080
|
|
},
|
|
{
|
|
"entropy": 6.229140186309815,
|
|
"epoch": 3.241200230813618,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00039781013602200406,
|
|
"loss": 5.5898,
|
|
"mean_token_accuracy": 0.2084824711084366,
|
|
"num_tokens": 71176119.0,
|
|
"step": 28085
|
|
},
|
|
{
|
|
"entropy": 6.285769939422607,
|
|
"epoch": 3.2417772648586265,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0003977755585310541,
|
|
"loss": 5.5387,
|
|
"mean_token_accuracy": 0.21307590901851653,
|
|
"num_tokens": 71190919.0,
|
|
"step": 28090
|
|
},
|
|
{
|
|
"entropy": 6.356187438964843,
|
|
"epoch": 3.2423542989036354,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0003977409769106091,
|
|
"loss": 5.6566,
|
|
"mean_token_accuracy": 0.20235351622104644,
|
|
"num_tokens": 71202589.0,
|
|
"step": 28095
|
|
},
|
|
{
|
|
"entropy": 6.2381542205810545,
|
|
"epoch": 3.2429313329486438,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003977063911618323,
|
|
"loss": 5.593,
|
|
"mean_token_accuracy": 0.21057060956954957,
|
|
"num_tokens": 71214632.0,
|
|
"step": 28100
|
|
},
|
|
{
|
|
"entropy": 6.2058404922485355,
|
|
"epoch": 3.2435083669936526,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003976718012858871,
|
|
"loss": 5.5624,
|
|
"mean_token_accuracy": 0.21571868062019348,
|
|
"num_tokens": 71226864.0,
|
|
"step": 28105
|
|
},
|
|
{
|
|
"entropy": 6.311150979995728,
|
|
"epoch": 3.244085401038661,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003976372072839367,
|
|
"loss": 5.5871,
|
|
"mean_token_accuracy": 0.2063691273331642,
|
|
"num_tokens": 71239254.0,
|
|
"step": 28110
|
|
},
|
|
{
|
|
"entropy": 6.275713491439819,
|
|
"epoch": 3.24466243508367,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0003976026091571448,
|
|
"loss": 5.6598,
|
|
"mean_token_accuracy": 0.2048112466931343,
|
|
"num_tokens": 71252215.0,
|
|
"step": 28115
|
|
},
|
|
{
|
|
"entropy": 6.249961233139038,
|
|
"epoch": 3.2452394691286788,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00039756800690667505,
|
|
"loss": 5.6184,
|
|
"mean_token_accuracy": 0.21261906772851943,
|
|
"num_tokens": 71263733.0,
|
|
"step": 28120
|
|
},
|
|
{
|
|
"entropy": 6.299106931686401,
|
|
"epoch": 3.245816503173687,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00039753340053369116,
|
|
"loss": 5.6331,
|
|
"mean_token_accuracy": 0.2125547230243683,
|
|
"num_tokens": 71277556.0,
|
|
"step": 28125
|
|
},
|
|
{
|
|
"entropy": 6.373852252960205,
|
|
"epoch": 3.246393537218696,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00039749879003935743,
|
|
"loss": 5.6853,
|
|
"mean_token_accuracy": 0.20810510367155075,
|
|
"num_tokens": 71289942.0,
|
|
"step": 28130
|
|
},
|
|
{
|
|
"entropy": 6.4134961605072025,
|
|
"epoch": 3.2469705712637045,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003974641754248375,
|
|
"loss": 5.7578,
|
|
"mean_token_accuracy": 0.19679180830717086,
|
|
"num_tokens": 71302517.0,
|
|
"step": 28135
|
|
},
|
|
{
|
|
"entropy": 6.2775185108184814,
|
|
"epoch": 3.2475476053087133,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00039742955669129607,
|
|
"loss": 5.6319,
|
|
"mean_token_accuracy": 0.20732229799032212,
|
|
"num_tokens": 71315022.0,
|
|
"step": 28140
|
|
},
|
|
{
|
|
"entropy": 6.203256368637085,
|
|
"epoch": 3.2481246393537218,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00039739493383989714,
|
|
"loss": 5.4919,
|
|
"mean_token_accuracy": 0.21541567146778107,
|
|
"num_tokens": 71329335.0,
|
|
"step": 28145
|
|
},
|
|
{
|
|
"entropy": 6.2658182144165036,
|
|
"epoch": 3.2487016733987306,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0003973603068718055,
|
|
"loss": 5.6549,
|
|
"mean_token_accuracy": 0.20978374183177947,
|
|
"num_tokens": 71342739.0,
|
|
"step": 28150
|
|
},
|
|
{
|
|
"entropy": 6.2376518726348875,
|
|
"epoch": 3.249278707443739,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00039732567578818574,
|
|
"loss": 5.5415,
|
|
"mean_token_accuracy": 0.2126510486006737,
|
|
"num_tokens": 71355367.0,
|
|
"step": 28155
|
|
},
|
|
{
|
|
"entropy": 6.30504207611084,
|
|
"epoch": 3.249855741488748,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0003972910405902026,
|
|
"loss": 5.5888,
|
|
"mean_token_accuracy": 0.21027828454971315,
|
|
"num_tokens": 71367163.0,
|
|
"step": 28160
|
|
},
|
|
{
|
|
"entropy": 6.241604042053223,
|
|
"epoch": 3.2504327755337563,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0003972564012790211,
|
|
"loss": 5.6166,
|
|
"mean_token_accuracy": 0.21602712273597718,
|
|
"num_tokens": 71379424.0,
|
|
"step": 28165
|
|
},
|
|
{
|
|
"entropy": 6.386188888549805,
|
|
"epoch": 3.251009809578765,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00039722175785580617,
|
|
"loss": 5.695,
|
|
"mean_token_accuracy": 0.2048676922917366,
|
|
"num_tokens": 71392115.0,
|
|
"step": 28170
|
|
},
|
|
{
|
|
"entropy": 6.262509059906006,
|
|
"epoch": 3.251586843623774,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0003971871103217232,
|
|
"loss": 5.6078,
|
|
"mean_token_accuracy": 0.21166991591453552,
|
|
"num_tokens": 71404339.0,
|
|
"step": 28175
|
|
},
|
|
{
|
|
"entropy": 6.269883871078491,
|
|
"epoch": 3.2521638776687825,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00039715245867793744,
|
|
"loss": 5.6025,
|
|
"mean_token_accuracy": 0.20796633809804915,
|
|
"num_tokens": 71416331.0,
|
|
"step": 28180
|
|
},
|
|
{
|
|
"entropy": 6.26036958694458,
|
|
"epoch": 3.252740911713791,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0003971178029256144,
|
|
"loss": 5.5712,
|
|
"mean_token_accuracy": 0.2210211470723152,
|
|
"num_tokens": 71428511.0,
|
|
"step": 28185
|
|
},
|
|
{
|
|
"entropy": 6.354671812057495,
|
|
"epoch": 3.2533179457587997,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00039708314306591974,
|
|
"loss": 5.617,
|
|
"mean_token_accuracy": 0.21025803238153457,
|
|
"num_tokens": 71440708.0,
|
|
"step": 28190
|
|
},
|
|
{
|
|
"entropy": 6.301226568222046,
|
|
"epoch": 3.2538949798038086,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00039704847910001926,
|
|
"loss": 5.5897,
|
|
"mean_token_accuracy": 0.20650502443313598,
|
|
"num_tokens": 71453363.0,
|
|
"step": 28195
|
|
},
|
|
{
|
|
"entropy": 6.2294361114501955,
|
|
"epoch": 3.254472013848817,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0003970138110290787,
|
|
"loss": 5.5215,
|
|
"mean_token_accuracy": 0.21542776972055436,
|
|
"num_tokens": 71465390.0,
|
|
"step": 28200
|
|
},
|
|
{
|
|
"entropy": 6.371427297592163,
|
|
"epoch": 3.255049047893826,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00039697913885426424,
|
|
"loss": 5.7302,
|
|
"mean_token_accuracy": 0.19866631031036378,
|
|
"num_tokens": 71478148.0,
|
|
"step": 28205
|
|
},
|
|
{
|
|
"entropy": 6.30023946762085,
|
|
"epoch": 3.2556260819388343,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00039694446257674203,
|
|
"loss": 5.5723,
|
|
"mean_token_accuracy": 0.213987797498703,
|
|
"num_tokens": 71490604.0,
|
|
"step": 28210
|
|
},
|
|
{
|
|
"entropy": 6.262583780288696,
|
|
"epoch": 3.256203115983843,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00039690978219767846,
|
|
"loss": 5.7053,
|
|
"mean_token_accuracy": 0.2008213445544243,
|
|
"num_tokens": 71503379.0,
|
|
"step": 28215
|
|
},
|
|
{
|
|
"entropy": 6.402316427230835,
|
|
"epoch": 3.2567801500288516,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0003968750977182399,
|
|
"loss": 5.62,
|
|
"mean_token_accuracy": 0.20850620418787003,
|
|
"num_tokens": 71516350.0,
|
|
"step": 28220
|
|
},
|
|
{
|
|
"entropy": 6.365092945098877,
|
|
"epoch": 3.2573571840738604,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00039684040913959295,
|
|
"loss": 5.589,
|
|
"mean_token_accuracy": 0.2070809483528137,
|
|
"num_tokens": 71528314.0,
|
|
"step": 28225
|
|
},
|
|
{
|
|
"entropy": 6.276582288742065,
|
|
"epoch": 3.257934218118869,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0003968057164629043,
|
|
"loss": 5.5833,
|
|
"mean_token_accuracy": 0.21616800129413605,
|
|
"num_tokens": 71540987.0,
|
|
"step": 28230
|
|
},
|
|
{
|
|
"entropy": 6.217281007766724,
|
|
"epoch": 3.2585112521638777,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000396771019689341,
|
|
"loss": 5.5284,
|
|
"mean_token_accuracy": 0.21362587809562683,
|
|
"num_tokens": 71553605.0,
|
|
"step": 28235
|
|
},
|
|
{
|
|
"entropy": 6.310392999649048,
|
|
"epoch": 3.259088286208886,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00039673631882006986,
|
|
"loss": 5.6373,
|
|
"mean_token_accuracy": 0.20066867768764496,
|
|
"num_tokens": 71565744.0,
|
|
"step": 28240
|
|
},
|
|
{
|
|
"entropy": 6.402947950363159,
|
|
"epoch": 3.259665320253895,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00039670161385625815,
|
|
"loss": 5.6934,
|
|
"mean_token_accuracy": 0.20391651690006257,
|
|
"num_tokens": 71577756.0,
|
|
"step": 28245
|
|
},
|
|
{
|
|
"entropy": 6.296461915969848,
|
|
"epoch": 3.260242354298904,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00039666690479907307,
|
|
"loss": 5.6156,
|
|
"mean_token_accuracy": 0.20750511139631272,
|
|
"num_tokens": 71590814.0,
|
|
"step": 28250
|
|
},
|
|
{
|
|
"entropy": 6.323584318161011,
|
|
"epoch": 3.2608193883439123,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00039663219164968213,
|
|
"loss": 5.6439,
|
|
"mean_token_accuracy": 0.2042109489440918,
|
|
"num_tokens": 71602960.0,
|
|
"step": 28255
|
|
},
|
|
{
|
|
"entropy": 6.382558441162109,
|
|
"epoch": 3.261396422388921,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00039659747440925277,
|
|
"loss": 5.7449,
|
|
"mean_token_accuracy": 0.2041376531124115,
|
|
"num_tokens": 71614568.0,
|
|
"step": 28260
|
|
},
|
|
{
|
|
"entropy": 6.349368572235107,
|
|
"epoch": 3.2619734564339296,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00039656275307895286,
|
|
"loss": 5.6593,
|
|
"mean_token_accuracy": 0.2042471721768379,
|
|
"num_tokens": 71628103.0,
|
|
"step": 28265
|
|
},
|
|
{
|
|
"entropy": 6.226234436035156,
|
|
"epoch": 3.2625504904789384,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00039652802765995006,
|
|
"loss": 5.5222,
|
|
"mean_token_accuracy": 0.22037243247032165,
|
|
"num_tokens": 71640343.0,
|
|
"step": 28270
|
|
},
|
|
{
|
|
"entropy": 6.284339237213135,
|
|
"epoch": 3.263127524523947,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00039649329815341243,
|
|
"loss": 5.5367,
|
|
"mean_token_accuracy": 0.2122778132557869,
|
|
"num_tokens": 71653430.0,
|
|
"step": 28275
|
|
},
|
|
{
|
|
"entropy": 6.251771783828735,
|
|
"epoch": 3.2637045585689557,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00039645856456050813,
|
|
"loss": 5.5544,
|
|
"mean_token_accuracy": 0.21104687750339507,
|
|
"num_tokens": 71665635.0,
|
|
"step": 28280
|
|
},
|
|
{
|
|
"entropy": 6.115922975540161,
|
|
"epoch": 3.264281592613964,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0003964238268824052,
|
|
"loss": 5.4733,
|
|
"mean_token_accuracy": 0.2292627215385437,
|
|
"num_tokens": 71679190.0,
|
|
"step": 28285
|
|
},
|
|
{
|
|
"entropy": 6.281512355804443,
|
|
"epoch": 3.264858626658973,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0003963890851202723,
|
|
"loss": 5.5939,
|
|
"mean_token_accuracy": 0.20890509635210036,
|
|
"num_tokens": 71693938.0,
|
|
"step": 28290
|
|
},
|
|
{
|
|
"entropy": 6.298290634155274,
|
|
"epoch": 3.2654356607039814,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00039635433927527776,
|
|
"loss": 5.5475,
|
|
"mean_token_accuracy": 0.2174872040748596,
|
|
"num_tokens": 71706682.0,
|
|
"step": 28295
|
|
},
|
|
{
|
|
"entropy": 6.353816890716553,
|
|
"epoch": 3.2660126947489903,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00039631958934859023,
|
|
"loss": 5.6395,
|
|
"mean_token_accuracy": 0.20739321559667587,
|
|
"num_tokens": 71718454.0,
|
|
"step": 28300
|
|
},
|
|
{
|
|
"entropy": 6.301565790176392,
|
|
"epoch": 3.2665897287939987,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00039628483534137865,
|
|
"loss": 5.6563,
|
|
"mean_token_accuracy": 0.20906370431184768,
|
|
"num_tokens": 71731270.0,
|
|
"step": 28305
|
|
},
|
|
{
|
|
"entropy": 6.321493816375733,
|
|
"epoch": 3.2671667628390075,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00039625007725481193,
|
|
"loss": 5.6601,
|
|
"mean_token_accuracy": 0.20504939258098603,
|
|
"num_tokens": 71744086.0,
|
|
"step": 28310
|
|
},
|
|
{
|
|
"entropy": 6.3168529033660885,
|
|
"epoch": 3.267743796884016,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.000396215315090059,
|
|
"loss": 5.6191,
|
|
"mean_token_accuracy": 0.20653242766857147,
|
|
"num_tokens": 71756496.0,
|
|
"step": 28315
|
|
},
|
|
{
|
|
"entropy": 6.298025798797608,
|
|
"epoch": 3.268320830929025,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00039618054884828924,
|
|
"loss": 5.594,
|
|
"mean_token_accuracy": 0.21338528543710708,
|
|
"num_tokens": 71768939.0,
|
|
"step": 28320
|
|
},
|
|
{
|
|
"entropy": 6.266501379013062,
|
|
"epoch": 3.2688978649740337,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003961457785306719,
|
|
"loss": 5.5855,
|
|
"mean_token_accuracy": 0.20346922129392625,
|
|
"num_tokens": 71780555.0,
|
|
"step": 28325
|
|
},
|
|
{
|
|
"entropy": 6.305908346176148,
|
|
"epoch": 3.269474899019042,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0003961110041383764,
|
|
"loss": 5.6928,
|
|
"mean_token_accuracy": 0.20813469141721724,
|
|
"num_tokens": 71795705.0,
|
|
"step": 28330
|
|
},
|
|
{
|
|
"entropy": 6.321779251098633,
|
|
"epoch": 3.270051933064051,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0003960762256725725,
|
|
"loss": 5.6055,
|
|
"mean_token_accuracy": 0.21335887610912324,
|
|
"num_tokens": 71807582.0,
|
|
"step": 28335
|
|
},
|
|
{
|
|
"entropy": 6.317763423919677,
|
|
"epoch": 3.2706289671090594,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00039604144313442984,
|
|
"loss": 5.6862,
|
|
"mean_token_accuracy": 0.20522436499595642,
|
|
"num_tokens": 71819349.0,
|
|
"step": 28340
|
|
},
|
|
{
|
|
"entropy": 6.3391406536102295,
|
|
"epoch": 3.2712060011540682,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00039600665652511836,
|
|
"loss": 5.609,
|
|
"mean_token_accuracy": 0.2161785677075386,
|
|
"num_tokens": 71832443.0,
|
|
"step": 28345
|
|
},
|
|
{
|
|
"entropy": 6.266803836822509,
|
|
"epoch": 3.2717830351990767,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00039597186584580814,
|
|
"loss": 5.6412,
|
|
"mean_token_accuracy": 0.20091271549463272,
|
|
"num_tokens": 71844961.0,
|
|
"step": 28350
|
|
},
|
|
{
|
|
"entropy": 6.302772092819214,
|
|
"epoch": 3.2723600692440855,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0003959370710976693,
|
|
"loss": 5.6517,
|
|
"mean_token_accuracy": 0.21341511160135268,
|
|
"num_tokens": 71858158.0,
|
|
"step": 28355
|
|
},
|
|
{
|
|
"entropy": 6.321320819854736,
|
|
"epoch": 3.272937103289094,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00039590227228187213,
|
|
"loss": 5.6196,
|
|
"mean_token_accuracy": 0.21146986484527588,
|
|
"num_tokens": 71870985.0,
|
|
"step": 28360
|
|
},
|
|
{
|
|
"entropy": 6.334778118133545,
|
|
"epoch": 3.273514137334103,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0003958674693995871,
|
|
"loss": 5.6444,
|
|
"mean_token_accuracy": 0.20949940234422684,
|
|
"num_tokens": 71883687.0,
|
|
"step": 28365
|
|
},
|
|
{
|
|
"entropy": 6.31767053604126,
|
|
"epoch": 3.274091171379111,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0003958326624519848,
|
|
"loss": 5.689,
|
|
"mean_token_accuracy": 0.19600140750408174,
|
|
"num_tokens": 71896678.0,
|
|
"step": 28370
|
|
},
|
|
{
|
|
"entropy": 6.3334630012512205,
|
|
"epoch": 3.27466820542412,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00039579785144023595,
|
|
"loss": 5.5967,
|
|
"mean_token_accuracy": 0.21396450698375702,
|
|
"num_tokens": 71910722.0,
|
|
"step": 28375
|
|
},
|
|
{
|
|
"entropy": 6.2932604312896725,
|
|
"epoch": 3.2752452394691285,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0003957630363655113,
|
|
"loss": 5.5878,
|
|
"mean_token_accuracy": 0.21288826912641526,
|
|
"num_tokens": 71922849.0,
|
|
"step": 28380
|
|
},
|
|
{
|
|
"entropy": 6.221535110473633,
|
|
"epoch": 3.2758222735141374,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00039572821722898185,
|
|
"loss": 5.5486,
|
|
"mean_token_accuracy": 0.2145315259695053,
|
|
"num_tokens": 71937106.0,
|
|
"step": 28385
|
|
},
|
|
{
|
|
"entropy": 6.326622486114502,
|
|
"epoch": 3.2763993075591458,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003956933940318189,
|
|
"loss": 5.6437,
|
|
"mean_token_accuracy": 0.2034468799829483,
|
|
"num_tokens": 71949384.0,
|
|
"step": 28390
|
|
},
|
|
{
|
|
"entropy": 6.321100330352783,
|
|
"epoch": 3.2769763416041546,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003956585667751935,
|
|
"loss": 5.5822,
|
|
"mean_token_accuracy": 0.20939769297838212,
|
|
"num_tokens": 71961906.0,
|
|
"step": 28395
|
|
},
|
|
{
|
|
"entropy": 6.267369508743286,
|
|
"epoch": 3.2775533756491635,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00039562373546027726,
|
|
"loss": 5.5635,
|
|
"mean_token_accuracy": 0.21035708487033844,
|
|
"num_tokens": 71974684.0,
|
|
"step": 28400
|
|
},
|
|
{
|
|
"entropy": 6.311018276214599,
|
|
"epoch": 3.278130409694172,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0003955889000882415,
|
|
"loss": 5.6123,
|
|
"mean_token_accuracy": 0.20001862496137618,
|
|
"num_tokens": 71987410.0,
|
|
"step": 28405
|
|
},
|
|
{
|
|
"entropy": 6.2740397453308105,
|
|
"epoch": 3.2787074437391808,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00039555406066025796,
|
|
"loss": 5.5943,
|
|
"mean_token_accuracy": 0.21315019875764846,
|
|
"num_tokens": 72000155.0,
|
|
"step": 28410
|
|
},
|
|
{
|
|
"entropy": 6.311759328842163,
|
|
"epoch": 3.279284477784189,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003955192171774986,
|
|
"loss": 5.6447,
|
|
"mean_token_accuracy": 0.20422276705503464,
|
|
"num_tokens": 72013057.0,
|
|
"step": 28415
|
|
},
|
|
{
|
|
"entropy": 6.305330419540406,
|
|
"epoch": 3.279861511829198,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0003954843696411351,
|
|
"loss": 5.5944,
|
|
"mean_token_accuracy": 0.19949475824832916,
|
|
"num_tokens": 72024875.0,
|
|
"step": 28420
|
|
},
|
|
{
|
|
"entropy": 6.347391080856323,
|
|
"epoch": 3.2804385458742065,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0003954495180523397,
|
|
"loss": 5.5981,
|
|
"mean_token_accuracy": 0.21122613549232483,
|
|
"num_tokens": 72036932.0,
|
|
"step": 28425
|
|
},
|
|
{
|
|
"entropy": 6.330396604537964,
|
|
"epoch": 3.2810155799192153,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00039541466241228466,
|
|
"loss": 5.6304,
|
|
"mean_token_accuracy": 0.2088005691766739,
|
|
"num_tokens": 72049081.0,
|
|
"step": 28430
|
|
},
|
|
{
|
|
"entropy": 6.296348190307617,
|
|
"epoch": 3.2815926139642237,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00039537980272214224,
|
|
"loss": 5.5489,
|
|
"mean_token_accuracy": 0.21346697509288787,
|
|
"num_tokens": 72061334.0,
|
|
"step": 28435
|
|
},
|
|
{
|
|
"entropy": 6.257789039611817,
|
|
"epoch": 3.2821696480092326,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0003953449389830849,
|
|
"loss": 5.5764,
|
|
"mean_token_accuracy": 0.20823515057563782,
|
|
"num_tokens": 72073446.0,
|
|
"step": 28440
|
|
},
|
|
{
|
|
"entropy": 6.271277856826782,
|
|
"epoch": 3.282746682054241,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0003953100711962853,
|
|
"loss": 5.5721,
|
|
"mean_token_accuracy": 0.21907315403223038,
|
|
"num_tokens": 72086219.0,
|
|
"step": 28445
|
|
},
|
|
{
|
|
"entropy": 6.343201446533203,
|
|
"epoch": 3.28332371609925,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00039527519936291626,
|
|
"loss": 5.6411,
|
|
"mean_token_accuracy": 0.20770083367824554,
|
|
"num_tokens": 72098442.0,
|
|
"step": 28450
|
|
},
|
|
{
|
|
"entropy": 6.3261542320251465,
|
|
"epoch": 3.2839007501442588,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00039524032348415075,
|
|
"loss": 5.6325,
|
|
"mean_token_accuracy": 0.20712635964155196,
|
|
"num_tokens": 72111416.0,
|
|
"step": 28455
|
|
},
|
|
{
|
|
"entropy": 6.254213809967041,
|
|
"epoch": 3.284477784189267,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0003952054435611615,
|
|
"loss": 5.5763,
|
|
"mean_token_accuracy": 0.2146853193640709,
|
|
"num_tokens": 72124077.0,
|
|
"step": 28460
|
|
},
|
|
{
|
|
"entropy": 6.353698968887329,
|
|
"epoch": 3.2850548182342756,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00039517055959512195,
|
|
"loss": 5.6646,
|
|
"mean_token_accuracy": 0.21170907318592072,
|
|
"num_tokens": 72136170.0,
|
|
"step": 28465
|
|
},
|
|
{
|
|
"entropy": 6.211856555938721,
|
|
"epoch": 3.2856318522792844,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003951356715872053,
|
|
"loss": 5.5862,
|
|
"mean_token_accuracy": 0.21495466977357863,
|
|
"num_tokens": 72148868.0,
|
|
"step": 28470
|
|
},
|
|
{
|
|
"entropy": 6.290690898895264,
|
|
"epoch": 3.2862088863242933,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.000395100779538585,
|
|
"loss": 5.5978,
|
|
"mean_token_accuracy": 0.2139120116829872,
|
|
"num_tokens": 72162225.0,
|
|
"step": 28475
|
|
},
|
|
{
|
|
"entropy": 6.304388809204101,
|
|
"epoch": 3.2867859203693017,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0003950658834504347,
|
|
"loss": 5.6722,
|
|
"mean_token_accuracy": 0.21038593649864196,
|
|
"num_tokens": 72174424.0,
|
|
"step": 28480
|
|
},
|
|
{
|
|
"entropy": 6.3301740169525145,
|
|
"epoch": 3.2873629544143106,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.000395030983323928,
|
|
"loss": 5.6076,
|
|
"mean_token_accuracy": 0.2123726263642311,
|
|
"num_tokens": 72187672.0,
|
|
"step": 28485
|
|
},
|
|
{
|
|
"entropy": 6.2454267024993895,
|
|
"epoch": 3.287939988459319,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00039499607916023885,
|
|
"loss": 5.4726,
|
|
"mean_token_accuracy": 0.2202191784977913,
|
|
"num_tokens": 72201575.0,
|
|
"step": 28490
|
|
},
|
|
{
|
|
"entropy": 6.173577785491943,
|
|
"epoch": 3.288517022504328,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003949611709605411,
|
|
"loss": 5.4764,
|
|
"mean_token_accuracy": 0.21634161323308945,
|
|
"num_tokens": 72215035.0,
|
|
"step": 28495
|
|
},
|
|
{
|
|
"entropy": 6.324765253067016,
|
|
"epoch": 3.2890940565493363,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000394926258726009,
|
|
"loss": 5.6657,
|
|
"mean_token_accuracy": 0.2094937264919281,
|
|
"num_tokens": 72227152.0,
|
|
"step": 28500
|
|
},
|
|
{
|
|
"entropy": 6.287936162948609,
|
|
"epoch": 3.289671090594345,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0003948913424578168,
|
|
"loss": 5.57,
|
|
"mean_token_accuracy": 0.20812568068504333,
|
|
"num_tokens": 72240770.0,
|
|
"step": 28505
|
|
},
|
|
{
|
|
"entropy": 6.300960063934326,
|
|
"epoch": 3.2902481246393536,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0003948564221571388,
|
|
"loss": 5.5923,
|
|
"mean_token_accuracy": 0.2148391678929329,
|
|
"num_tokens": 72253254.0,
|
|
"step": 28510
|
|
},
|
|
{
|
|
"entropy": 6.233442401885986,
|
|
"epoch": 3.2908251586843624,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00039482149782514955,
|
|
"loss": 5.5526,
|
|
"mean_token_accuracy": 0.2195778876543045,
|
|
"num_tokens": 72267863.0,
|
|
"step": 28515
|
|
},
|
|
{
|
|
"entropy": 6.288657808303833,
|
|
"epoch": 3.291402192729371,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003947865694630238,
|
|
"loss": 5.5872,
|
|
"mean_token_accuracy": 0.20951843559741973,
|
|
"num_tokens": 72279867.0,
|
|
"step": 28520
|
|
},
|
|
{
|
|
"entropy": 6.121821498870849,
|
|
"epoch": 3.2919792267743797,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0003947516370719362,
|
|
"loss": 5.4292,
|
|
"mean_token_accuracy": 0.23044759631156922,
|
|
"num_tokens": 72293347.0,
|
|
"step": 28525
|
|
},
|
|
{
|
|
"entropy": 6.306554985046387,
|
|
"epoch": 3.2925562608193886,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0003947167006530618,
|
|
"loss": 5.6513,
|
|
"mean_token_accuracy": 0.20109457820653914,
|
|
"num_tokens": 72306216.0,
|
|
"step": 28530
|
|
},
|
|
{
|
|
"entropy": 6.319903612136841,
|
|
"epoch": 3.293133294864397,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00039468176020757573,
|
|
"loss": 5.6551,
|
|
"mean_token_accuracy": 0.20395729839801788,
|
|
"num_tokens": 72318253.0,
|
|
"step": 28535
|
|
},
|
|
{
|
|
"entropy": 6.246758031845093,
|
|
"epoch": 3.293710328909406,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000394646815736653,
|
|
"loss": 5.61,
|
|
"mean_token_accuracy": 0.2142129048705101,
|
|
"num_tokens": 72331451.0,
|
|
"step": 28540
|
|
},
|
|
{
|
|
"entropy": 6.304188871383667,
|
|
"epoch": 3.2942873629544143,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003946118672414692,
|
|
"loss": 5.6661,
|
|
"mean_token_accuracy": 0.20401847809553147,
|
|
"num_tokens": 72343532.0,
|
|
"step": 28545
|
|
},
|
|
{
|
|
"entropy": 6.3445291996002195,
|
|
"epoch": 3.294864396999423,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00039457691472319953,
|
|
"loss": 5.6631,
|
|
"mean_token_accuracy": 0.20179695039987564,
|
|
"num_tokens": 72355803.0,
|
|
"step": 28550
|
|
},
|
|
{
|
|
"entropy": 6.27111029624939,
|
|
"epoch": 3.2954414310444315,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003945419581830197,
|
|
"loss": 5.5426,
|
|
"mean_token_accuracy": 0.20842572599649428,
|
|
"num_tokens": 72370056.0,
|
|
"step": 28555
|
|
},
|
|
{
|
|
"entropy": 6.202527236938477,
|
|
"epoch": 3.2960184650894404,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00039450699762210556,
|
|
"loss": 5.496,
|
|
"mean_token_accuracy": 0.2111549496650696,
|
|
"num_tokens": 72382444.0,
|
|
"step": 28560
|
|
},
|
|
{
|
|
"entropy": 6.231189775466919,
|
|
"epoch": 3.296595499134449,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00039447203304163295,
|
|
"loss": 5.553,
|
|
"mean_token_accuracy": 0.21933628171682357,
|
|
"num_tokens": 72396773.0,
|
|
"step": 28565
|
|
},
|
|
{
|
|
"entropy": 6.241081380844117,
|
|
"epoch": 3.2971725331794577,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003944370644427777,
|
|
"loss": 5.4939,
|
|
"mean_token_accuracy": 0.2228922963142395,
|
|
"num_tokens": 72409922.0,
|
|
"step": 28570
|
|
},
|
|
{
|
|
"entropy": 6.38632640838623,
|
|
"epoch": 3.297749567224466,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003944020918267163,
|
|
"loss": 5.6128,
|
|
"mean_token_accuracy": 0.2153082400560379,
|
|
"num_tokens": 72423011.0,
|
|
"step": 28575
|
|
},
|
|
{
|
|
"entropy": 6.243960905075073,
|
|
"epoch": 3.298326601269475,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00039436711519462474,
|
|
"loss": 5.5743,
|
|
"mean_token_accuracy": 0.2115711137652397,
|
|
"num_tokens": 72434888.0,
|
|
"step": 28580
|
|
},
|
|
{
|
|
"entropy": 6.231947946548462,
|
|
"epoch": 3.2989036353144834,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003943321345476796,
|
|
"loss": 5.5585,
|
|
"mean_token_accuracy": 0.2197302371263504,
|
|
"num_tokens": 72447202.0,
|
|
"step": 28585
|
|
},
|
|
{
|
|
"entropy": 6.1306623935699465,
|
|
"epoch": 3.2994806693594922,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00039429714988705735,
|
|
"loss": 5.5184,
|
|
"mean_token_accuracy": 0.2186478778719902,
|
|
"num_tokens": 72460232.0,
|
|
"step": 28590
|
|
},
|
|
{
|
|
"entropy": 6.314109134674072,
|
|
"epoch": 3.3000577034045007,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00039426216121393477,
|
|
"loss": 5.6066,
|
|
"mean_token_accuracy": 0.2105715125799179,
|
|
"num_tokens": 72472665.0,
|
|
"step": 28595
|
|
},
|
|
{
|
|
"entropy": 6.2340672492980955,
|
|
"epoch": 3.3006347374495095,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003942271685294886,
|
|
"loss": 5.6259,
|
|
"mean_token_accuracy": 0.2148941531777382,
|
|
"num_tokens": 72484766.0,
|
|
"step": 28600
|
|
},
|
|
{
|
|
"entropy": 6.334250164031983,
|
|
"epoch": 3.3012117714945184,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00039419217183489594,
|
|
"loss": 5.6571,
|
|
"mean_token_accuracy": 0.20254969745874404,
|
|
"num_tokens": 72497352.0,
|
|
"step": 28605
|
|
},
|
|
{
|
|
"entropy": 6.396239566802978,
|
|
"epoch": 3.301788805539527,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00039415717113133356,
|
|
"loss": 5.7095,
|
|
"mean_token_accuracy": 0.2039184495806694,
|
|
"num_tokens": 72509057.0,
|
|
"step": 28610
|
|
},
|
|
{
|
|
"entropy": 6.33972954750061,
|
|
"epoch": 3.3023658395845357,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003941221664199791,
|
|
"loss": 5.6589,
|
|
"mean_token_accuracy": 0.20284920781850815,
|
|
"num_tokens": 72521624.0,
|
|
"step": 28615
|
|
},
|
|
{
|
|
"entropy": 6.291444396972656,
|
|
"epoch": 3.302942873629544,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00039408715770200976,
|
|
"loss": 5.5941,
|
|
"mean_token_accuracy": 0.2105130597949028,
|
|
"num_tokens": 72534078.0,
|
|
"step": 28620
|
|
},
|
|
{
|
|
"entropy": 6.296972131729126,
|
|
"epoch": 3.303519907674553,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00039405214497860295,
|
|
"loss": 5.5726,
|
|
"mean_token_accuracy": 0.21531585305929185,
|
|
"num_tokens": 72547310.0,
|
|
"step": 28625
|
|
},
|
|
{
|
|
"entropy": 6.33482174873352,
|
|
"epoch": 3.3040969417195614,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003940171282509363,
|
|
"loss": 5.6194,
|
|
"mean_token_accuracy": 0.20922723412513733,
|
|
"num_tokens": 72559758.0,
|
|
"step": 28630
|
|
},
|
|
{
|
|
"entropy": 6.283375835418701,
|
|
"epoch": 3.3046739757645702,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003939821075201878,
|
|
"loss": 5.6565,
|
|
"mean_token_accuracy": 0.2039285272359848,
|
|
"num_tokens": 72571365.0,
|
|
"step": 28635
|
|
},
|
|
{
|
|
"entropy": 6.3861391067504885,
|
|
"epoch": 3.3052510098095786,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0003939470827875352,
|
|
"loss": 5.679,
|
|
"mean_token_accuracy": 0.20217571407556534,
|
|
"num_tokens": 72583425.0,
|
|
"step": 28640
|
|
},
|
|
{
|
|
"entropy": 6.304543113708496,
|
|
"epoch": 3.3058280438545875,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003939120540541565,
|
|
"loss": 5.5548,
|
|
"mean_token_accuracy": 0.21870865672826767,
|
|
"num_tokens": 72595743.0,
|
|
"step": 28645
|
|
},
|
|
{
|
|
"entropy": 6.311944198608399,
|
|
"epoch": 3.306405077899596,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00039387702132122993,
|
|
"loss": 5.6586,
|
|
"mean_token_accuracy": 0.21095039695501328,
|
|
"num_tokens": 72608510.0,
|
|
"step": 28650
|
|
},
|
|
{
|
|
"entropy": 6.247580528259277,
|
|
"epoch": 3.306982111944605,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00039384198458993386,
|
|
"loss": 5.5274,
|
|
"mean_token_accuracy": 0.21772662103176116,
|
|
"num_tokens": 72620681.0,
|
|
"step": 28655
|
|
},
|
|
{
|
|
"entropy": 6.3383677959442135,
|
|
"epoch": 3.307559145989613,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00039380694386144665,
|
|
"loss": 5.6358,
|
|
"mean_token_accuracy": 0.20355518609285356,
|
|
"num_tokens": 72632970.0,
|
|
"step": 28660
|
|
},
|
|
{
|
|
"entropy": 6.286139631271363,
|
|
"epoch": 3.308136180034622,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00039377189913694687,
|
|
"loss": 5.6588,
|
|
"mean_token_accuracy": 0.2043263331055641,
|
|
"num_tokens": 72647953.0,
|
|
"step": 28665
|
|
},
|
|
{
|
|
"entropy": 6.423627948760986,
|
|
"epoch": 3.3087132140796305,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00039373685041761323,
|
|
"loss": 5.6223,
|
|
"mean_token_accuracy": 0.20799154341220855,
|
|
"num_tokens": 72660333.0,
|
|
"step": 28670
|
|
},
|
|
{
|
|
"entropy": 6.305422258377075,
|
|
"epoch": 3.3092902481246393,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003937017977046247,
|
|
"loss": 5.5582,
|
|
"mean_token_accuracy": 0.21382996439933777,
|
|
"num_tokens": 72673620.0,
|
|
"step": 28675
|
|
},
|
|
{
|
|
"entropy": 6.316384983062744,
|
|
"epoch": 3.309867282169648,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00039366674099916007,
|
|
"loss": 5.71,
|
|
"mean_token_accuracy": 0.19985205084085464,
|
|
"num_tokens": 72686285.0,
|
|
"step": 28680
|
|
},
|
|
{
|
|
"entropy": 6.201228284835816,
|
|
"epoch": 3.3104443162146566,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003936316803023986,
|
|
"loss": 5.4412,
|
|
"mean_token_accuracy": 0.217347614467144,
|
|
"num_tokens": 72699209.0,
|
|
"step": 28685
|
|
},
|
|
{
|
|
"entropy": 6.315252780914307,
|
|
"epoch": 3.3110213502596655,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00039359661561551946,
|
|
"loss": 5.6236,
|
|
"mean_token_accuracy": 0.20603403747081755,
|
|
"num_tokens": 72711825.0,
|
|
"step": 28690
|
|
},
|
|
{
|
|
"entropy": 6.250441837310791,
|
|
"epoch": 3.311598384304674,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00039356154693970214,
|
|
"loss": 5.5352,
|
|
"mean_token_accuracy": 0.21349995732307434,
|
|
"num_tokens": 72724908.0,
|
|
"step": 28695
|
|
},
|
|
{
|
|
"entropy": 6.301689529418946,
|
|
"epoch": 3.3121754183496828,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00039352647427612597,
|
|
"loss": 5.608,
|
|
"mean_token_accuracy": 0.21204435974359512,
|
|
"num_tokens": 72738431.0,
|
|
"step": 28700
|
|
},
|
|
{
|
|
"entropy": 6.301755142211914,
|
|
"epoch": 3.312752452394691,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0003934913976259709,
|
|
"loss": 5.6144,
|
|
"mean_token_accuracy": 0.20495393723249436,
|
|
"num_tokens": 72750800.0,
|
|
"step": 28705
|
|
},
|
|
{
|
|
"entropy": 6.272404670715332,
|
|
"epoch": 3.3133294864397,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003934563169904164,
|
|
"loss": 5.559,
|
|
"mean_token_accuracy": 0.21818749606609344,
|
|
"num_tokens": 72763343.0,
|
|
"step": 28710
|
|
},
|
|
{
|
|
"entropy": 6.266006422042847,
|
|
"epoch": 3.3139065204847085,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0003934212323706425,
|
|
"loss": 5.5614,
|
|
"mean_token_accuracy": 0.21694438010454178,
|
|
"num_tokens": 72775865.0,
|
|
"step": 28715
|
|
},
|
|
{
|
|
"entropy": 6.256735754013062,
|
|
"epoch": 3.3144835545297173,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003933861437678292,
|
|
"loss": 5.6031,
|
|
"mean_token_accuracy": 0.2109078049659729,
|
|
"num_tokens": 72789579.0,
|
|
"step": 28720
|
|
},
|
|
{
|
|
"entropy": 6.228157711029053,
|
|
"epoch": 3.3150605885747257,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0003933510511831569,
|
|
"loss": 5.5452,
|
|
"mean_token_accuracy": 0.2175717368721962,
|
|
"num_tokens": 72802952.0,
|
|
"step": 28725
|
|
},
|
|
{
|
|
"entropy": 6.265851402282715,
|
|
"epoch": 3.3156376226197346,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00039331595461780574,
|
|
"loss": 5.5828,
|
|
"mean_token_accuracy": 0.20740180909633638,
|
|
"num_tokens": 72816571.0,
|
|
"step": 28730
|
|
},
|
|
{
|
|
"entropy": 6.280122232437134,
|
|
"epoch": 3.3162146566647435,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00039328085407295616,
|
|
"loss": 5.5308,
|
|
"mean_token_accuracy": 0.21138013154268265,
|
|
"num_tokens": 72829077.0,
|
|
"step": 28735
|
|
},
|
|
{
|
|
"entropy": 6.267831516265869,
|
|
"epoch": 3.316791690709752,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00039324574954978885,
|
|
"loss": 5.5794,
|
|
"mean_token_accuracy": 0.20756455957889558,
|
|
"num_tokens": 72842530.0,
|
|
"step": 28740
|
|
},
|
|
{
|
|
"entropy": 6.369338464736939,
|
|
"epoch": 3.3173687247547603,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00039321064104948456,
|
|
"loss": 5.6666,
|
|
"mean_token_accuracy": 0.20300383269786834,
|
|
"num_tokens": 72854534.0,
|
|
"step": 28745
|
|
},
|
|
{
|
|
"entropy": 6.2939684867858885,
|
|
"epoch": 3.317945758799769,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00039317552857322404,
|
|
"loss": 5.6751,
|
|
"mean_token_accuracy": 0.20655760020017624,
|
|
"num_tokens": 72866860.0,
|
|
"step": 28750
|
|
},
|
|
{
|
|
"entropy": 6.354185485839844,
|
|
"epoch": 3.318522792844778,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00039314041212218826,
|
|
"loss": 5.6651,
|
|
"mean_token_accuracy": 0.2040335550904274,
|
|
"num_tokens": 72879074.0,
|
|
"step": 28755
|
|
},
|
|
{
|
|
"entropy": 6.288358592987061,
|
|
"epoch": 3.3190998268897864,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003931052916975584,
|
|
"loss": 5.5308,
|
|
"mean_token_accuracy": 0.21582938134670257,
|
|
"num_tokens": 72890981.0,
|
|
"step": 28760
|
|
},
|
|
{
|
|
"entropy": 6.314363431930542,
|
|
"epoch": 3.3196768609347953,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00039307016730051576,
|
|
"loss": 5.5984,
|
|
"mean_token_accuracy": 0.21466825604438783,
|
|
"num_tokens": 72903068.0,
|
|
"step": 28765
|
|
},
|
|
{
|
|
"entropy": 6.21572265625,
|
|
"epoch": 3.3202538949798037,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0003930350389322417,
|
|
"loss": 5.6058,
|
|
"mean_token_accuracy": 0.2111571878194809,
|
|
"num_tokens": 72917805.0,
|
|
"step": 28770
|
|
},
|
|
{
|
|
"entropy": 6.226862192153931,
|
|
"epoch": 3.3208309290248126,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003929999065939177,
|
|
"loss": 5.5403,
|
|
"mean_token_accuracy": 0.2209217965602875,
|
|
"num_tokens": 72930665.0,
|
|
"step": 28775
|
|
},
|
|
{
|
|
"entropy": 6.338307046890259,
|
|
"epoch": 3.321407963069821,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00039296477028672545,
|
|
"loss": 5.5974,
|
|
"mean_token_accuracy": 0.20715759545564652,
|
|
"num_tokens": 72943841.0,
|
|
"step": 28780
|
|
},
|
|
{
|
|
"entropy": 6.307508039474487,
|
|
"epoch": 3.32198499711483,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00039292963001184676,
|
|
"loss": 5.6364,
|
|
"mean_token_accuracy": 0.20984548181295395,
|
|
"num_tokens": 72957886.0,
|
|
"step": 28785
|
|
},
|
|
{
|
|
"entropy": 6.26527099609375,
|
|
"epoch": 3.3225620311598383,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0003928944857704636,
|
|
"loss": 5.578,
|
|
"mean_token_accuracy": 0.21370171308517455,
|
|
"num_tokens": 72969698.0,
|
|
"step": 28790
|
|
},
|
|
{
|
|
"entropy": 6.197018384933472,
|
|
"epoch": 3.323139065204847,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00039285933756375794,
|
|
"loss": 5.4694,
|
|
"mean_token_accuracy": 0.22086730897426604,
|
|
"num_tokens": 72983356.0,
|
|
"step": 28795
|
|
},
|
|
{
|
|
"entropy": 6.281574630737305,
|
|
"epoch": 3.3237160992498556,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0003928241853929119,
|
|
"loss": 5.6184,
|
|
"mean_token_accuracy": 0.21011638194322585,
|
|
"num_tokens": 72995839.0,
|
|
"step": 28800
|
|
},
|
|
{
|
|
"entropy": 6.251098680496216,
|
|
"epoch": 3.3242931332948644,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00039278902925910815,
|
|
"loss": 5.592,
|
|
"mean_token_accuracy": 0.21045335233211518,
|
|
"num_tokens": 73008337.0,
|
|
"step": 28805
|
|
},
|
|
{
|
|
"entropy": 6.3050446033477785,
|
|
"epoch": 3.3248701673398733,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00039275386916352866,
|
|
"loss": 5.6491,
|
|
"mean_token_accuracy": 0.2042829543352127,
|
|
"num_tokens": 73020262.0,
|
|
"step": 28810
|
|
},
|
|
{
|
|
"entropy": 6.3645820140838625,
|
|
"epoch": 3.3254472013848817,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0003927187051073564,
|
|
"loss": 5.7083,
|
|
"mean_token_accuracy": 0.19844236224889755,
|
|
"num_tokens": 73034142.0,
|
|
"step": 28815
|
|
},
|
|
{
|
|
"entropy": 6.365460300445557,
|
|
"epoch": 3.32602423542989,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00039268353709177395,
|
|
"loss": 5.6254,
|
|
"mean_token_accuracy": 0.20819768756628038,
|
|
"num_tokens": 73046973.0,
|
|
"step": 28820
|
|
},
|
|
{
|
|
"entropy": 6.267800617218017,
|
|
"epoch": 3.326601269474899,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003926483651179642,
|
|
"loss": 5.5941,
|
|
"mean_token_accuracy": 0.20798975676298143,
|
|
"num_tokens": 73060036.0,
|
|
"step": 28825
|
|
},
|
|
{
|
|
"entropy": 6.2191040992736815,
|
|
"epoch": 3.327178303519908,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0003926131891871101,
|
|
"loss": 5.5461,
|
|
"mean_token_accuracy": 0.2155445083975792,
|
|
"num_tokens": 73072017.0,
|
|
"step": 28830
|
|
},
|
|
{
|
|
"entropy": 6.269107151031494,
|
|
"epoch": 3.3277553375649163,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00039257800930039485,
|
|
"loss": 5.5088,
|
|
"mean_token_accuracy": 0.21526906341314317,
|
|
"num_tokens": 73083937.0,
|
|
"step": 28835
|
|
},
|
|
{
|
|
"entropy": 6.269366598129272,
|
|
"epoch": 3.328332371609925,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0003925428254590016,
|
|
"loss": 5.6474,
|
|
"mean_token_accuracy": 0.20849194526672363,
|
|
"num_tokens": 73096084.0,
|
|
"step": 28840
|
|
},
|
|
{
|
|
"entropy": 6.333763122558594,
|
|
"epoch": 3.3289094056549335,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00039250763766411384,
|
|
"loss": 5.6942,
|
|
"mean_token_accuracy": 0.20730239450931548,
|
|
"num_tokens": 73109109.0,
|
|
"step": 28845
|
|
},
|
|
{
|
|
"entropy": 6.2818211078643795,
|
|
"epoch": 3.3294864396999424,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00039247244591691504,
|
|
"loss": 5.5469,
|
|
"mean_token_accuracy": 0.21710605770349503,
|
|
"num_tokens": 73121843.0,
|
|
"step": 28850
|
|
},
|
|
{
|
|
"entropy": 6.315488624572754,
|
|
"epoch": 3.330063473744951,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00039243725021858894,
|
|
"loss": 5.669,
|
|
"mean_token_accuracy": 0.19905203878879546,
|
|
"num_tokens": 73135102.0,
|
|
"step": 28855
|
|
},
|
|
{
|
|
"entropy": 6.2173418521881105,
|
|
"epoch": 3.3306405077899597,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0003924020505703191,
|
|
"loss": 5.5253,
|
|
"mean_token_accuracy": 0.21410955488681793,
|
|
"num_tokens": 73148575.0,
|
|
"step": 28860
|
|
},
|
|
{
|
|
"entropy": 6.348320531845093,
|
|
"epoch": 3.331217541834968,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00039236684697328974,
|
|
"loss": 5.6996,
|
|
"mean_token_accuracy": 0.20049867033958435,
|
|
"num_tokens": 73160795.0,
|
|
"step": 28865
|
|
},
|
|
{
|
|
"entropy": 6.277620077133179,
|
|
"epoch": 3.331794575879977,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00039233163942868475,
|
|
"loss": 5.5648,
|
|
"mean_token_accuracy": 0.2185143306851387,
|
|
"num_tokens": 73173407.0,
|
|
"step": 28870
|
|
},
|
|
{
|
|
"entropy": 6.239258527755737,
|
|
"epoch": 3.3323716099249854,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003922964279376883,
|
|
"loss": 5.5398,
|
|
"mean_token_accuracy": 0.22159578949213027,
|
|
"num_tokens": 73187781.0,
|
|
"step": 28875
|
|
},
|
|
{
|
|
"entropy": 6.352889060974121,
|
|
"epoch": 3.3329486439699942,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0003922612125014848,
|
|
"loss": 5.671,
|
|
"mean_token_accuracy": 0.20447573512792588,
|
|
"num_tokens": 73201701.0,
|
|
"step": 28880
|
|
},
|
|
{
|
|
"entropy": 6.290695428848267,
|
|
"epoch": 3.333525678015003,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00039222599312125874,
|
|
"loss": 5.6585,
|
|
"mean_token_accuracy": 0.20172215700149537,
|
|
"num_tokens": 73214144.0,
|
|
"step": 28885
|
|
},
|
|
{
|
|
"entropy": 6.236335515975952,
|
|
"epoch": 3.3341027120600115,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003921907697981946,
|
|
"loss": 5.486,
|
|
"mean_token_accuracy": 0.21916661113500596,
|
|
"num_tokens": 73227314.0,
|
|
"step": 28890
|
|
},
|
|
{
|
|
"entropy": 6.329765510559082,
|
|
"epoch": 3.3346797461050204,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00039215554253347706,
|
|
"loss": 5.6259,
|
|
"mean_token_accuracy": 0.2066568061709404,
|
|
"num_tokens": 73240285.0,
|
|
"step": 28895
|
|
},
|
|
{
|
|
"entropy": 6.335150289535522,
|
|
"epoch": 3.335256780150029,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003921203113282911,
|
|
"loss": 5.6678,
|
|
"mean_token_accuracy": 0.2058093160390854,
|
|
"num_tokens": 73252839.0,
|
|
"step": 28900
|
|
},
|
|
{
|
|
"entropy": 6.238126277923584,
|
|
"epoch": 3.3358338141950377,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0003920850761838216,
|
|
"loss": 5.5637,
|
|
"mean_token_accuracy": 0.21956949681043625,
|
|
"num_tokens": 73266894.0,
|
|
"step": 28905
|
|
},
|
|
{
|
|
"entropy": 6.315386867523193,
|
|
"epoch": 3.336410848240046,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00039204983710125377,
|
|
"loss": 5.6431,
|
|
"mean_token_accuracy": 0.21124201714992524,
|
|
"num_tokens": 73279867.0,
|
|
"step": 28910
|
|
},
|
|
{
|
|
"entropy": 6.315626192092895,
|
|
"epoch": 3.336987882285055,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00039201459408177275,
|
|
"loss": 5.6362,
|
|
"mean_token_accuracy": 0.20166702568531036,
|
|
"num_tokens": 73292080.0,
|
|
"step": 28915
|
|
},
|
|
{
|
|
"entropy": 6.266161108016968,
|
|
"epoch": 3.3375649163300634,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003919793471265641,
|
|
"loss": 5.5673,
|
|
"mean_token_accuracy": 0.20920253694057464,
|
|
"num_tokens": 73303502.0,
|
|
"step": 28920
|
|
},
|
|
{
|
|
"entropy": 6.204082059860229,
|
|
"epoch": 3.338141950375072,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00039194409623681303,
|
|
"loss": 5.5279,
|
|
"mean_token_accuracy": 0.21414923667907715,
|
|
"num_tokens": 73316169.0,
|
|
"step": 28925
|
|
},
|
|
{
|
|
"entropy": 6.3536553382873535,
|
|
"epoch": 3.3387189844200806,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00039190884141370553,
|
|
"loss": 5.6224,
|
|
"mean_token_accuracy": 0.21155633628368378,
|
|
"num_tokens": 73327929.0,
|
|
"step": 28930
|
|
},
|
|
{
|
|
"entropy": 6.236387729644775,
|
|
"epoch": 3.3392960184650895,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00039187358265842714,
|
|
"loss": 5.5578,
|
|
"mean_token_accuracy": 0.21335231959819795,
|
|
"num_tokens": 73339951.0,
|
|
"step": 28935
|
|
},
|
|
{
|
|
"entropy": 6.267559289932251,
|
|
"epoch": 3.339873052510098,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00039183831997216393,
|
|
"loss": 5.5054,
|
|
"mean_token_accuracy": 0.21591550707817078,
|
|
"num_tokens": 73351959.0,
|
|
"step": 28940
|
|
},
|
|
{
|
|
"entropy": 6.166514873504639,
|
|
"epoch": 3.340450086555107,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0003918030533561018,
|
|
"loss": 5.5017,
|
|
"mean_token_accuracy": 0.21913562268018721,
|
|
"num_tokens": 73366727.0,
|
|
"step": 28945
|
|
},
|
|
{
|
|
"entropy": 6.295221138000488,
|
|
"epoch": 3.341027120600115,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00039176778281142696,
|
|
"loss": 5.5545,
|
|
"mean_token_accuracy": 0.2120455339550972,
|
|
"num_tokens": 73378429.0,
|
|
"step": 28950
|
|
},
|
|
{
|
|
"entropy": 6.261827564239502,
|
|
"epoch": 3.341604154645124,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00039173250833932576,
|
|
"loss": 5.5199,
|
|
"mean_token_accuracy": 0.21612753421068193,
|
|
"num_tokens": 73391901.0,
|
|
"step": 28955
|
|
},
|
|
{
|
|
"entropy": 6.233904266357422,
|
|
"epoch": 3.342181188690133,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.00039169722994098464,
|
|
"loss": 5.5898,
|
|
"mean_token_accuracy": 0.2087406948208809,
|
|
"num_tokens": 73404827.0,
|
|
"step": 28960
|
|
},
|
|
{
|
|
"entropy": 6.317486238479614,
|
|
"epoch": 3.3427582227351413,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00039166194761759015,
|
|
"loss": 5.6282,
|
|
"mean_token_accuracy": 0.21186717301607133,
|
|
"num_tokens": 73417941.0,
|
|
"step": 28965
|
|
},
|
|
{
|
|
"entropy": 6.332821369171143,
|
|
"epoch": 3.34333525678015,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00039162666137032906,
|
|
"loss": 5.6344,
|
|
"mean_token_accuracy": 0.20793080925941468,
|
|
"num_tokens": 73429838.0,
|
|
"step": 28970
|
|
},
|
|
{
|
|
"entropy": 6.388521528244018,
|
|
"epoch": 3.3439122908251586,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0003915913712003882,
|
|
"loss": 5.6481,
|
|
"mean_token_accuracy": 0.20011728554964064,
|
|
"num_tokens": 73441559.0,
|
|
"step": 28975
|
|
},
|
|
{
|
|
"entropy": 6.366645193099975,
|
|
"epoch": 3.3444893248701675,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0003915560771089543,
|
|
"loss": 5.6669,
|
|
"mean_token_accuracy": 0.19910821914672852,
|
|
"num_tokens": 73454665.0,
|
|
"step": 28980
|
|
},
|
|
{
|
|
"entropy": 6.266955423355102,
|
|
"epoch": 3.345066358915176,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003915207790972147,
|
|
"loss": 5.5731,
|
|
"mean_token_accuracy": 0.21302271485328675,
|
|
"num_tokens": 73466969.0,
|
|
"step": 28985
|
|
},
|
|
{
|
|
"entropy": 6.312905740737915,
|
|
"epoch": 3.3456433929601848,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0003914854771663567,
|
|
"loss": 5.6313,
|
|
"mean_token_accuracy": 0.20756600201129913,
|
|
"num_tokens": 73481939.0,
|
|
"step": 28990
|
|
},
|
|
{
|
|
"entropy": 6.339122533798218,
|
|
"epoch": 3.346220427005193,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00039145017131756745,
|
|
"loss": 5.6146,
|
|
"mean_token_accuracy": 0.20963889211416245,
|
|
"num_tokens": 73496650.0,
|
|
"step": 28995
|
|
},
|
|
{
|
|
"entropy": 6.264911556243897,
|
|
"epoch": 3.346797461050202,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003914148615520345,
|
|
"loss": 5.5765,
|
|
"mean_token_accuracy": 0.2172787755727768,
|
|
"num_tokens": 73508363.0,
|
|
"step": 29000
|
|
},
|
|
{
|
|
"entropy": 6.251505756378174,
|
|
"epoch": 3.3473744950952105,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00039137954787094546,
|
|
"loss": 5.5461,
|
|
"mean_token_accuracy": 0.21059478223323821,
|
|
"num_tokens": 73522530.0,
|
|
"step": 29005
|
|
},
|
|
{
|
|
"entropy": 6.231379795074463,
|
|
"epoch": 3.3479515291402193,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00039134423027548825,
|
|
"loss": 5.5389,
|
|
"mean_token_accuracy": 0.21510165929794312,
|
|
"num_tokens": 73535204.0,
|
|
"step": 29010
|
|
},
|
|
{
|
|
"entropy": 6.315020036697388,
|
|
"epoch": 3.3485285631852277,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00039130890876685066,
|
|
"loss": 5.6274,
|
|
"mean_token_accuracy": 0.2129904106259346,
|
|
"num_tokens": 73547783.0,
|
|
"step": 29015
|
|
},
|
|
{
|
|
"entropy": 6.311100053787231,
|
|
"epoch": 3.3491055972302366,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003912735833462206,
|
|
"loss": 5.727,
|
|
"mean_token_accuracy": 0.20269781798124314,
|
|
"num_tokens": 73559707.0,
|
|
"step": 29020
|
|
},
|
|
{
|
|
"entropy": 6.310127544403076,
|
|
"epoch": 3.349682631275245,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00039123825401478633,
|
|
"loss": 5.6341,
|
|
"mean_token_accuracy": 0.21402271836996078,
|
|
"num_tokens": 73571749.0,
|
|
"step": 29025
|
|
},
|
|
{
|
|
"entropy": 6.221773624420166,
|
|
"epoch": 3.350259665320254,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0003912029207737363,
|
|
"loss": 5.584,
|
|
"mean_token_accuracy": 0.21729437708854676,
|
|
"num_tokens": 73583876.0,
|
|
"step": 29030
|
|
},
|
|
{
|
|
"entropy": 6.2178009986877445,
|
|
"epoch": 3.3508366993652627,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00039116758362425856,
|
|
"loss": 5.5013,
|
|
"mean_token_accuracy": 0.21648983359336854,
|
|
"num_tokens": 73596899.0,
|
|
"step": 29035
|
|
},
|
|
{
|
|
"entropy": 6.309064960479736,
|
|
"epoch": 3.351413733410271,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003911322425675419,
|
|
"loss": 5.5464,
|
|
"mean_token_accuracy": 0.2164706915616989,
|
|
"num_tokens": 73609190.0,
|
|
"step": 29040
|
|
},
|
|
{
|
|
"entropy": 6.304746150970459,
|
|
"epoch": 3.35199076745528,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0003910968976047749,
|
|
"loss": 5.624,
|
|
"mean_token_accuracy": 0.20457190573215484,
|
|
"num_tokens": 73622410.0,
|
|
"step": 29045
|
|
},
|
|
{
|
|
"entropy": 6.124352550506591,
|
|
"epoch": 3.3525678015002884,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003910615487371465,
|
|
"loss": 5.4342,
|
|
"mean_token_accuracy": 0.2284320190548897,
|
|
"num_tokens": 73634540.0,
|
|
"step": 29050
|
|
},
|
|
{
|
|
"entropy": 6.237605285644531,
|
|
"epoch": 3.3531448355452973,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003910261959658455,
|
|
"loss": 5.5898,
|
|
"mean_token_accuracy": 0.21332017034292222,
|
|
"num_tokens": 73646392.0,
|
|
"step": 29055
|
|
},
|
|
{
|
|
"entropy": 6.291895580291748,
|
|
"epoch": 3.3537218695903057,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003909908392920611,
|
|
"loss": 5.621,
|
|
"mean_token_accuracy": 0.21053441017866134,
|
|
"num_tokens": 73657929.0,
|
|
"step": 29060
|
|
},
|
|
{
|
|
"entropy": 6.241759777069092,
|
|
"epoch": 3.3542989036353146,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00039095547871698236,
|
|
"loss": 5.6305,
|
|
"mean_token_accuracy": 0.21316324323415756,
|
|
"num_tokens": 73670190.0,
|
|
"step": 29065
|
|
},
|
|
{
|
|
"entropy": 6.207334184646607,
|
|
"epoch": 3.354875937680323,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00039092011424179875,
|
|
"loss": 5.5684,
|
|
"mean_token_accuracy": 0.2182879403233528,
|
|
"num_tokens": 73682634.0,
|
|
"step": 29070
|
|
},
|
|
{
|
|
"entropy": 6.327158451080322,
|
|
"epoch": 3.355452971725332,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003908847458676996,
|
|
"loss": 5.551,
|
|
"mean_token_accuracy": 0.21544651687145233,
|
|
"num_tokens": 73694627.0,
|
|
"step": 29075
|
|
},
|
|
{
|
|
"entropy": 6.374857568740845,
|
|
"epoch": 3.3560300057703403,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0003908493735958747,
|
|
"loss": 5.7531,
|
|
"mean_token_accuracy": 0.1976550430059433,
|
|
"num_tokens": 73707618.0,
|
|
"step": 29080
|
|
},
|
|
{
|
|
"entropy": 6.226210451126098,
|
|
"epoch": 3.356607039815349,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00039081399742751363,
|
|
"loss": 5.4982,
|
|
"mean_token_accuracy": 0.2130536124110222,
|
|
"num_tokens": 73719354.0,
|
|
"step": 29085
|
|
},
|
|
{
|
|
"entropy": 6.291107034683227,
|
|
"epoch": 3.357184073860358,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00039077861736380617,
|
|
"loss": 5.5644,
|
|
"mean_token_accuracy": 0.2162878096103668,
|
|
"num_tokens": 73731586.0,
|
|
"step": 29090
|
|
},
|
|
{
|
|
"entropy": 6.328617763519287,
|
|
"epoch": 3.3577611079053664,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00039074323340594256,
|
|
"loss": 5.6655,
|
|
"mean_token_accuracy": 0.20485673397779464,
|
|
"num_tokens": 73745907.0,
|
|
"step": 29095
|
|
},
|
|
{
|
|
"entropy": 6.1780870914459225,
|
|
"epoch": 3.358338141950375,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00039070784555511276,
|
|
"loss": 5.4009,
|
|
"mean_token_accuracy": 0.23351363241672515,
|
|
"num_tokens": 73759458.0,
|
|
"step": 29100
|
|
},
|
|
{
|
|
"entropy": 6.293235921859742,
|
|
"epoch": 3.3589151759953837,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000390672453812507,
|
|
"loss": 5.6002,
|
|
"mean_token_accuracy": 0.2132267564535141,
|
|
"num_tokens": 73771116.0,
|
|
"step": 29105
|
|
},
|
|
{
|
|
"entropy": 6.258170795440674,
|
|
"epoch": 3.3594922100403926,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00039063705817931574,
|
|
"loss": 5.644,
|
|
"mean_token_accuracy": 0.20458761602640152,
|
|
"num_tokens": 73784573.0,
|
|
"step": 29110
|
|
},
|
|
{
|
|
"entropy": 6.317970895767212,
|
|
"epoch": 3.360069244085401,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003906016586567295,
|
|
"loss": 5.5966,
|
|
"mean_token_accuracy": 0.21305181533098222,
|
|
"num_tokens": 73797402.0,
|
|
"step": 29115
|
|
},
|
|
{
|
|
"entropy": 6.387864828109741,
|
|
"epoch": 3.36064627813041,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0003905662552459389,
|
|
"loss": 5.6948,
|
|
"mean_token_accuracy": 0.20252969413995742,
|
|
"num_tokens": 73810924.0,
|
|
"step": 29120
|
|
},
|
|
{
|
|
"entropy": 6.302251100540161,
|
|
"epoch": 3.3612233121754183,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00039053084794813466,
|
|
"loss": 5.6035,
|
|
"mean_token_accuracy": 0.2099481776356697,
|
|
"num_tokens": 73824439.0,
|
|
"step": 29125
|
|
},
|
|
{
|
|
"entropy": 6.284896755218506,
|
|
"epoch": 3.361800346220427,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00039049543676450773,
|
|
"loss": 5.6332,
|
|
"mean_token_accuracy": 0.20873839408159256,
|
|
"num_tokens": 73838322.0,
|
|
"step": 29130
|
|
},
|
|
{
|
|
"entropy": 6.344274425506592,
|
|
"epoch": 3.3623773802654355,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0003904600216962491,
|
|
"loss": 5.6234,
|
|
"mean_token_accuracy": 0.20376986116170884,
|
|
"num_tokens": 73850598.0,
|
|
"step": 29135
|
|
},
|
|
{
|
|
"entropy": 6.305895709991455,
|
|
"epoch": 3.3629544143104444,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003904246027445501,
|
|
"loss": 5.592,
|
|
"mean_token_accuracy": 0.21357525289058685,
|
|
"num_tokens": 73863335.0,
|
|
"step": 29140
|
|
},
|
|
{
|
|
"entropy": 6.3073609352111815,
|
|
"epoch": 3.363531448355453,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00039038917991060187,
|
|
"loss": 5.6708,
|
|
"mean_token_accuracy": 0.20324818640947342,
|
|
"num_tokens": 73876638.0,
|
|
"step": 29145
|
|
},
|
|
{
|
|
"entropy": 6.313017749786377,
|
|
"epoch": 3.3641084824004617,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003903537531955959,
|
|
"loss": 5.67,
|
|
"mean_token_accuracy": 0.20317320078611373,
|
|
"num_tokens": 73889640.0,
|
|
"step": 29150
|
|
},
|
|
{
|
|
"entropy": 6.2704041481018065,
|
|
"epoch": 3.36468551644547,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003903183226007237,
|
|
"loss": 5.6395,
|
|
"mean_token_accuracy": 0.21060781478881835,
|
|
"num_tokens": 73901883.0,
|
|
"step": 29155
|
|
},
|
|
{
|
|
"entropy": 6.273696184158325,
|
|
"epoch": 3.365262550490479,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00039028288812717715,
|
|
"loss": 5.5562,
|
|
"mean_token_accuracy": 0.2176042005419731,
|
|
"num_tokens": 73913717.0,
|
|
"step": 29160
|
|
},
|
|
{
|
|
"entropy": 6.253102350234985,
|
|
"epoch": 3.365839584535488,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003902474497761478,
|
|
"loss": 5.5406,
|
|
"mean_token_accuracy": 0.2185870036482811,
|
|
"num_tokens": 73928057.0,
|
|
"step": 29165
|
|
},
|
|
{
|
|
"entropy": 6.316777992248535,
|
|
"epoch": 3.3664166185804962,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00039021200754882774,
|
|
"loss": 5.6718,
|
|
"mean_token_accuracy": 0.20434031784534454,
|
|
"num_tokens": 73941184.0,
|
|
"step": 29170
|
|
},
|
|
{
|
|
"entropy": 6.373852920532227,
|
|
"epoch": 3.366993652625505,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.000390176561446409,
|
|
"loss": 5.7058,
|
|
"mean_token_accuracy": 0.19581802636384965,
|
|
"num_tokens": 73953607.0,
|
|
"step": 29175
|
|
},
|
|
{
|
|
"entropy": 6.34294171333313,
|
|
"epoch": 3.3675706866705135,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0003901411114700839,
|
|
"loss": 5.5525,
|
|
"mean_token_accuracy": 0.2188389390707016,
|
|
"num_tokens": 73965238.0,
|
|
"step": 29180
|
|
},
|
|
{
|
|
"entropy": 6.253246164321899,
|
|
"epoch": 3.3681477207155224,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003901056576210447,
|
|
"loss": 5.5534,
|
|
"mean_token_accuracy": 0.21227256804704667,
|
|
"num_tokens": 73979213.0,
|
|
"step": 29185
|
|
},
|
|
{
|
|
"entropy": 6.292891979217529,
|
|
"epoch": 3.368724754760531,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00039007019990048387,
|
|
"loss": 5.6074,
|
|
"mean_token_accuracy": 0.2082306757569313,
|
|
"num_tokens": 73991852.0,
|
|
"step": 29190
|
|
},
|
|
{
|
|
"entropy": 6.355215454101563,
|
|
"epoch": 3.3693017888055397,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00039003473830959395,
|
|
"loss": 5.7018,
|
|
"mean_token_accuracy": 0.20693040788173675,
|
|
"num_tokens": 74005244.0,
|
|
"step": 29195
|
|
},
|
|
{
|
|
"entropy": 6.163452577590943,
|
|
"epoch": 3.369878822850548,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00038999927284956784,
|
|
"loss": 5.3986,
|
|
"mean_token_accuracy": 0.22728914320468901,
|
|
"num_tokens": 74018163.0,
|
|
"step": 29200
|
|
},
|
|
{
|
|
"entropy": 6.3070777416229244,
|
|
"epoch": 3.370455856895557,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00038996380352159833,
|
|
"loss": 5.6454,
|
|
"mean_token_accuracy": 0.20188517421483992,
|
|
"num_tokens": 74030857.0,
|
|
"step": 29205
|
|
},
|
|
{
|
|
"entropy": 6.245661926269531,
|
|
"epoch": 3.3710328909405654,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00038992833032687837,
|
|
"loss": 5.5407,
|
|
"mean_token_accuracy": 0.21168410927057266,
|
|
"num_tokens": 74042659.0,
|
|
"step": 29210
|
|
},
|
|
{
|
|
"entropy": 6.368112468719483,
|
|
"epoch": 3.371609924985574,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000389892853266601,
|
|
"loss": 5.6554,
|
|
"mean_token_accuracy": 0.20354679375886917,
|
|
"num_tokens": 74055412.0,
|
|
"step": 29215
|
|
},
|
|
{
|
|
"entropy": 6.305950927734375,
|
|
"epoch": 3.3721869590305826,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00038985737234195975,
|
|
"loss": 5.6232,
|
|
"mean_token_accuracy": 0.20782013535499572,
|
|
"num_tokens": 74068160.0,
|
|
"step": 29220
|
|
},
|
|
{
|
|
"entropy": 6.305010604858398,
|
|
"epoch": 3.3727639930755915,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00038982188755414774,
|
|
"loss": 5.5695,
|
|
"mean_token_accuracy": 0.21423800736665727,
|
|
"num_tokens": 74080119.0,
|
|
"step": 29225
|
|
},
|
|
{
|
|
"entropy": 6.3191142082214355,
|
|
"epoch": 3.3733410271206,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00038978639890435853,
|
|
"loss": 5.6688,
|
|
"mean_token_accuracy": 0.20283762663602828,
|
|
"num_tokens": 74091768.0,
|
|
"step": 29230
|
|
},
|
|
{
|
|
"entropy": 6.344225311279297,
|
|
"epoch": 3.3739180611656088,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003897509063937859,
|
|
"loss": 5.6332,
|
|
"mean_token_accuracy": 0.20785654336214066,
|
|
"num_tokens": 74104265.0,
|
|
"step": 29235
|
|
},
|
|
{
|
|
"entropy": 6.45944652557373,
|
|
"epoch": 3.3744950952106176,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003897154100236235,
|
|
"loss": 5.7061,
|
|
"mean_token_accuracy": 0.2042423352599144,
|
|
"num_tokens": 74116322.0,
|
|
"step": 29240
|
|
},
|
|
{
|
|
"entropy": 6.380822086334229,
|
|
"epoch": 3.375072129255626,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0003896799097950653,
|
|
"loss": 5.7077,
|
|
"mean_token_accuracy": 0.19910952299833298,
|
|
"num_tokens": 74127665.0,
|
|
"step": 29245
|
|
},
|
|
{
|
|
"entropy": 6.285206890106201,
|
|
"epoch": 3.375649163300635,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003896444057093052,
|
|
"loss": 5.6139,
|
|
"mean_token_accuracy": 0.2076934590935707,
|
|
"num_tokens": 74140860.0,
|
|
"step": 29250
|
|
},
|
|
{
|
|
"entropy": 6.3377604484558105,
|
|
"epoch": 3.3762261973456433,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00038960889776753756,
|
|
"loss": 5.6929,
|
|
"mean_token_accuracy": 0.19695894718170165,
|
|
"num_tokens": 74153049.0,
|
|
"step": 29255
|
|
},
|
|
{
|
|
"entropy": 6.382846069335938,
|
|
"epoch": 3.376803231390652,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0003895733859709565,
|
|
"loss": 5.7235,
|
|
"mean_token_accuracy": 0.20099511742591858,
|
|
"num_tokens": 74166701.0,
|
|
"step": 29260
|
|
},
|
|
{
|
|
"entropy": 6.321712636947632,
|
|
"epoch": 3.3773802654356606,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0003895378703207566,
|
|
"loss": 5.5985,
|
|
"mean_token_accuracy": 0.2049229100346565,
|
|
"num_tokens": 74178995.0,
|
|
"step": 29265
|
|
},
|
|
{
|
|
"entropy": 6.277365446090698,
|
|
"epoch": 3.3779572994806695,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003895023508181323,
|
|
"loss": 5.5512,
|
|
"mean_token_accuracy": 0.21110071390867233,
|
|
"num_tokens": 74191579.0,
|
|
"step": 29270
|
|
},
|
|
{
|
|
"entropy": 6.257118463516235,
|
|
"epoch": 3.378534333525678,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00038946682746427824,
|
|
"loss": 5.5664,
|
|
"mean_token_accuracy": 0.21131363064050673,
|
|
"num_tokens": 74206241.0,
|
|
"step": 29275
|
|
},
|
|
{
|
|
"entropy": 6.352369785308838,
|
|
"epoch": 3.3791113675706868,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00038943130026038934,
|
|
"loss": 5.6726,
|
|
"mean_token_accuracy": 0.20147279351949693,
|
|
"num_tokens": 74218380.0,
|
|
"step": 29280
|
|
},
|
|
{
|
|
"entropy": 6.309469175338745,
|
|
"epoch": 3.379688401615695,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003893957692076605,
|
|
"loss": 5.5261,
|
|
"mean_token_accuracy": 0.21474277824163437,
|
|
"num_tokens": 74230352.0,
|
|
"step": 29285
|
|
},
|
|
{
|
|
"entropy": 6.182438516616822,
|
|
"epoch": 3.380265435660704,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.00038936023430728684,
|
|
"loss": 5.4973,
|
|
"mean_token_accuracy": 0.2120675638318062,
|
|
"num_tokens": 74242817.0,
|
|
"step": 29290
|
|
},
|
|
{
|
|
"entropy": 6.257054948806763,
|
|
"epoch": 3.3808424697057124,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003893246955604635,
|
|
"loss": 5.5765,
|
|
"mean_token_accuracy": 0.21418164372444154,
|
|
"num_tokens": 74255937.0,
|
|
"step": 29295
|
|
},
|
|
{
|
|
"entropy": 6.229521226882935,
|
|
"epoch": 3.3814195037507213,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003892891529683857,
|
|
"loss": 5.5407,
|
|
"mean_token_accuracy": 0.21864060312509537,
|
|
"num_tokens": 74269179.0,
|
|
"step": 29300
|
|
},
|
|
{
|
|
"entropy": 6.189294242858887,
|
|
"epoch": 3.3819965377957297,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00038925360653224906,
|
|
"loss": 5.5841,
|
|
"mean_token_accuracy": 0.21910252571105956,
|
|
"num_tokens": 74281623.0,
|
|
"step": 29305
|
|
},
|
|
{
|
|
"entropy": 6.245767068862915,
|
|
"epoch": 3.3825735718407386,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003892180562532491,
|
|
"loss": 5.5496,
|
|
"mean_token_accuracy": 0.21509899646043779,
|
|
"num_tokens": 74293079.0,
|
|
"step": 29310
|
|
},
|
|
{
|
|
"entropy": 6.337989568710327,
|
|
"epoch": 3.3831506058857475,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0003891825021325817,
|
|
"loss": 5.6571,
|
|
"mean_token_accuracy": 0.2040598288178444,
|
|
"num_tokens": 74306034.0,
|
|
"step": 29315
|
|
},
|
|
{
|
|
"entropy": 6.235533857345581,
|
|
"epoch": 3.383727639930756,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00038914694417144235,
|
|
"loss": 5.5737,
|
|
"mean_token_accuracy": 0.21559108793735504,
|
|
"num_tokens": 74318576.0,
|
|
"step": 29320
|
|
},
|
|
{
|
|
"entropy": 6.281343412399292,
|
|
"epoch": 3.3843046739757647,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00038911138237102735,
|
|
"loss": 5.61,
|
|
"mean_token_accuracy": 0.20341164916753768,
|
|
"num_tokens": 74330856.0,
|
|
"step": 29325
|
|
},
|
|
{
|
|
"entropy": 6.326974201202392,
|
|
"epoch": 3.384881708020773,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0003890758167325327,
|
|
"loss": 5.6328,
|
|
"mean_token_accuracy": 0.20842041671276093,
|
|
"num_tokens": 74343488.0,
|
|
"step": 29330
|
|
},
|
|
{
|
|
"entropy": 6.330953454971313,
|
|
"epoch": 3.385458742065782,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00038904024725715453,
|
|
"loss": 5.7245,
|
|
"mean_token_accuracy": 0.20046576112508774,
|
|
"num_tokens": 74356592.0,
|
|
"step": 29335
|
|
},
|
|
{
|
|
"entropy": 6.339637804031372,
|
|
"epoch": 3.3860357761107904,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00038900467394608934,
|
|
"loss": 5.6044,
|
|
"mean_token_accuracy": 0.21115469187498093,
|
|
"num_tokens": 74369987.0,
|
|
"step": 29340
|
|
},
|
|
{
|
|
"entropy": 6.357370090484619,
|
|
"epoch": 3.3866128101557993,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0003889690968005336,
|
|
"loss": 5.6077,
|
|
"mean_token_accuracy": 0.2118179455399513,
|
|
"num_tokens": 74382186.0,
|
|
"step": 29345
|
|
},
|
|
{
|
|
"entropy": 6.2282380104064945,
|
|
"epoch": 3.3871898442008077,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00038893351582168387,
|
|
"loss": 5.5482,
|
|
"mean_token_accuracy": 0.2183238998055458,
|
|
"num_tokens": 74395486.0,
|
|
"step": 29350
|
|
},
|
|
{
|
|
"entropy": 6.247542905807495,
|
|
"epoch": 3.3877668782458166,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00038889793101073696,
|
|
"loss": 5.6093,
|
|
"mean_token_accuracy": 0.20752064734697342,
|
|
"num_tokens": 74407641.0,
|
|
"step": 29355
|
|
},
|
|
{
|
|
"entropy": 6.304482173919678,
|
|
"epoch": 3.388343912290825,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00038886234236888966,
|
|
"loss": 5.6331,
|
|
"mean_token_accuracy": 0.21097840070724488,
|
|
"num_tokens": 74420036.0,
|
|
"step": 29360
|
|
},
|
|
{
|
|
"entropy": 6.192506265640259,
|
|
"epoch": 3.388920946335834,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003888267498973391,
|
|
"loss": 5.4903,
|
|
"mean_token_accuracy": 0.22967896163463591,
|
|
"num_tokens": 74433682.0,
|
|
"step": 29365
|
|
},
|
|
{
|
|
"entropy": 6.313870143890381,
|
|
"epoch": 3.3894979803808427,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003887911535972823,
|
|
"loss": 5.7228,
|
|
"mean_token_accuracy": 0.19508129060268403,
|
|
"num_tokens": 74445127.0,
|
|
"step": 29370
|
|
},
|
|
{
|
|
"entropy": 6.252066802978516,
|
|
"epoch": 3.390075014425851,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003887555534699166,
|
|
"loss": 5.5199,
|
|
"mean_token_accuracy": 0.22077775299549102,
|
|
"num_tokens": 74458445.0,
|
|
"step": 29375
|
|
},
|
|
{
|
|
"entropy": 6.292688179016113,
|
|
"epoch": 3.3906520484708595,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.0003887199495164393,
|
|
"loss": 5.5921,
|
|
"mean_token_accuracy": 0.21258362531661987,
|
|
"num_tokens": 74472025.0,
|
|
"step": 29380
|
|
},
|
|
{
|
|
"entropy": 6.355944061279297,
|
|
"epoch": 3.3912290825158684,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.000388684341738048,
|
|
"loss": 5.6391,
|
|
"mean_token_accuracy": 0.20603423267602922,
|
|
"num_tokens": 74485016.0,
|
|
"step": 29385
|
|
},
|
|
{
|
|
"entropy": 6.360045957565307,
|
|
"epoch": 3.3918061165608773,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00038864873013594043,
|
|
"loss": 5.6788,
|
|
"mean_token_accuracy": 0.20285647809505464,
|
|
"num_tokens": 74498762.0,
|
|
"step": 29390
|
|
},
|
|
{
|
|
"entropy": 6.339653730392456,
|
|
"epoch": 3.3923831506058857,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003886131147113143,
|
|
"loss": 5.7165,
|
|
"mean_token_accuracy": 0.19749857783317565,
|
|
"num_tokens": 74511864.0,
|
|
"step": 29395
|
|
},
|
|
{
|
|
"entropy": 6.327062940597534,
|
|
"epoch": 3.3929601846508946,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0003885774954653673,
|
|
"loss": 5.626,
|
|
"mean_token_accuracy": 0.20828536450862883,
|
|
"num_tokens": 74524887.0,
|
|
"step": 29400
|
|
},
|
|
{
|
|
"entropy": 6.33983211517334,
|
|
"epoch": 3.393537218695903,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0003885418723992977,
|
|
"loss": 5.5351,
|
|
"mean_token_accuracy": 0.21684535443782807,
|
|
"num_tokens": 74537490.0,
|
|
"step": 29405
|
|
},
|
|
{
|
|
"entropy": 6.209836053848266,
|
|
"epoch": 3.394114252740912,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0003885062455143038,
|
|
"loss": 5.4681,
|
|
"mean_token_accuracy": 0.22164985537528992,
|
|
"num_tokens": 74550027.0,
|
|
"step": 29410
|
|
},
|
|
{
|
|
"entropy": 6.181258821487427,
|
|
"epoch": 3.3946912867859202,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00038847061481158356,
|
|
"loss": 5.5538,
|
|
"mean_token_accuracy": 0.22363968640565873,
|
|
"num_tokens": 74562318.0,
|
|
"step": 29415
|
|
},
|
|
{
|
|
"entropy": 6.3764732837677,
|
|
"epoch": 3.395268320830929,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00038843498029233553,
|
|
"loss": 5.6746,
|
|
"mean_token_accuracy": 0.19934020489454268,
|
|
"num_tokens": 74575316.0,
|
|
"step": 29420
|
|
},
|
|
{
|
|
"entropy": 6.325499582290649,
|
|
"epoch": 3.3958453548759375,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0003883993419577584,
|
|
"loss": 5.602,
|
|
"mean_token_accuracy": 0.21570999324321746,
|
|
"num_tokens": 74589043.0,
|
|
"step": 29425
|
|
},
|
|
{
|
|
"entropy": 6.146814489364624,
|
|
"epoch": 3.3964223889209464,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0003883636998090507,
|
|
"loss": 5.4613,
|
|
"mean_token_accuracy": 0.22435485273599626,
|
|
"num_tokens": 74602796.0,
|
|
"step": 29430
|
|
},
|
|
{
|
|
"entropy": 6.28871636390686,
|
|
"epoch": 3.396999422965955,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00038832805384741124,
|
|
"loss": 5.6011,
|
|
"mean_token_accuracy": 0.2117253214120865,
|
|
"num_tokens": 74615987.0,
|
|
"step": 29435
|
|
},
|
|
{
|
|
"entropy": 6.409949016571045,
|
|
"epoch": 3.3975764570109637,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0003882924040740389,
|
|
"loss": 5.7041,
|
|
"mean_token_accuracy": 0.194938026368618,
|
|
"num_tokens": 74627940.0,
|
|
"step": 29440
|
|
},
|
|
{
|
|
"entropy": 6.381073713302612,
|
|
"epoch": 3.3981534910559725,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.000388256750490133,
|
|
"loss": 5.6366,
|
|
"mean_token_accuracy": 0.19963338524103164,
|
|
"num_tokens": 74641977.0,
|
|
"step": 29445
|
|
},
|
|
{
|
|
"entropy": 6.32768440246582,
|
|
"epoch": 3.398730525100981,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0003882210930968924,
|
|
"loss": 5.6012,
|
|
"mean_token_accuracy": 0.21206954568624498,
|
|
"num_tokens": 74655119.0,
|
|
"step": 29450
|
|
},
|
|
{
|
|
"entropy": 6.321794843673706,
|
|
"epoch": 3.3993075591459894,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003881854318955167,
|
|
"loss": 5.6695,
|
|
"mean_token_accuracy": 0.2061930701136589,
|
|
"num_tokens": 74667548.0,
|
|
"step": 29455
|
|
},
|
|
{
|
|
"entropy": 6.2855182647705075,
|
|
"epoch": 3.3998845931909982,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00038814976688720523,
|
|
"loss": 5.5898,
|
|
"mean_token_accuracy": 0.2132022961974144,
|
|
"num_tokens": 74679365.0,
|
|
"step": 29460
|
|
},
|
|
{
|
|
"entropy": 6.30374321937561,
|
|
"epoch": 3.400461627236007,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00038811409807315746,
|
|
"loss": 5.6332,
|
|
"mean_token_accuracy": 0.2022397294640541,
|
|
"num_tokens": 74690713.0,
|
|
"step": 29465
|
|
},
|
|
{
|
|
"entropy": 6.272971820831299,
|
|
"epoch": 3.4010386612810155,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0003880784254545732,
|
|
"loss": 5.5458,
|
|
"mean_token_accuracy": 0.21517499685287475,
|
|
"num_tokens": 74703106.0,
|
|
"step": 29470
|
|
},
|
|
{
|
|
"entropy": 6.360751104354859,
|
|
"epoch": 3.4016156953260244,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00038804274903265226,
|
|
"loss": 5.6711,
|
|
"mean_token_accuracy": 0.20268727838993073,
|
|
"num_tokens": 74715602.0,
|
|
"step": 29475
|
|
},
|
|
{
|
|
"entropy": 6.2980457782745365,
|
|
"epoch": 3.402192729371033,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0003880070688085947,
|
|
"loss": 5.5957,
|
|
"mean_token_accuracy": 0.20691435635089875,
|
|
"num_tokens": 74727842.0,
|
|
"step": 29480
|
|
},
|
|
{
|
|
"entropy": 6.2922975540161135,
|
|
"epoch": 3.4027697634160416,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0003879713847836004,
|
|
"loss": 5.6019,
|
|
"mean_token_accuracy": 0.20711803287267685,
|
|
"num_tokens": 74740480.0,
|
|
"step": 29485
|
|
},
|
|
{
|
|
"entropy": 6.217147350311279,
|
|
"epoch": 3.40334679746105,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00038793569695886964,
|
|
"loss": 5.4724,
|
|
"mean_token_accuracy": 0.21813528537750243,
|
|
"num_tokens": 74753939.0,
|
|
"step": 29490
|
|
},
|
|
{
|
|
"entropy": 6.196096611022949,
|
|
"epoch": 3.403923831506059,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000387900005335603,
|
|
"loss": 5.4674,
|
|
"mean_token_accuracy": 0.21555966585874559,
|
|
"num_tokens": 74767055.0,
|
|
"step": 29495
|
|
},
|
|
{
|
|
"entropy": 6.229111671447754,
|
|
"epoch": 3.4045008655510673,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00038786430991500064,
|
|
"loss": 5.4951,
|
|
"mean_token_accuracy": 0.22055580019950866,
|
|
"num_tokens": 74779927.0,
|
|
"step": 29500
|
|
},
|
|
{
|
|
"entropy": 6.29156985282898,
|
|
"epoch": 3.405077899596076,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00038782861069826323,
|
|
"loss": 5.6585,
|
|
"mean_token_accuracy": 0.20177193284034728,
|
|
"num_tokens": 74792845.0,
|
|
"step": 29505
|
|
},
|
|
{
|
|
"entropy": 6.257110595703125,
|
|
"epoch": 3.4056549336410846,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0003877929076865917,
|
|
"loss": 5.537,
|
|
"mean_token_accuracy": 0.21649485528469087,
|
|
"num_tokens": 74807288.0,
|
|
"step": 29510
|
|
},
|
|
{
|
|
"entropy": 6.393070030212402,
|
|
"epoch": 3.4062319676860935,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00038775720088118665,
|
|
"loss": 5.6739,
|
|
"mean_token_accuracy": 0.205543415248394,
|
|
"num_tokens": 74819537.0,
|
|
"step": 29515
|
|
},
|
|
{
|
|
"entropy": 6.389664363861084,
|
|
"epoch": 3.4068090017311023,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00038772149028324916,
|
|
"loss": 5.6992,
|
|
"mean_token_accuracy": 0.20014040172100067,
|
|
"num_tokens": 74830890.0,
|
|
"step": 29520
|
|
},
|
|
{
|
|
"entropy": 6.347593021392822,
|
|
"epoch": 3.4073860357761108,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00038768577589398033,
|
|
"loss": 5.6379,
|
|
"mean_token_accuracy": 0.21419069170951843,
|
|
"num_tokens": 74843286.0,
|
|
"step": 29525
|
|
},
|
|
{
|
|
"entropy": 6.305737638473511,
|
|
"epoch": 3.4079630698211196,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00038765005771458145,
|
|
"loss": 5.582,
|
|
"mean_token_accuracy": 0.21106716692447663,
|
|
"num_tokens": 74854743.0,
|
|
"step": 29530
|
|
},
|
|
{
|
|
"entropy": 6.25415449142456,
|
|
"epoch": 3.408540103866128,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0003876143357462538,
|
|
"loss": 5.612,
|
|
"mean_token_accuracy": 0.2041926935315132,
|
|
"num_tokens": 74867031.0,
|
|
"step": 29535
|
|
},
|
|
{
|
|
"entropy": 6.266235494613648,
|
|
"epoch": 3.409117137911137,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0003875786099901989,
|
|
"loss": 5.5281,
|
|
"mean_token_accuracy": 0.21584420055150985,
|
|
"num_tokens": 74880045.0,
|
|
"step": 29540
|
|
},
|
|
{
|
|
"entropy": 6.326585865020752,
|
|
"epoch": 3.4096941719561453,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00038754288044761835,
|
|
"loss": 5.6547,
|
|
"mean_token_accuracy": 0.19908049404621125,
|
|
"num_tokens": 74893671.0,
|
|
"step": 29545
|
|
},
|
|
{
|
|
"entropy": 6.384521341323852,
|
|
"epoch": 3.410271206001154,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00038750714711971397,
|
|
"loss": 5.6807,
|
|
"mean_token_accuracy": 0.20197383761405946,
|
|
"num_tokens": 74906580.0,
|
|
"step": 29550
|
|
},
|
|
{
|
|
"entropy": 6.338169574737549,
|
|
"epoch": 3.4108482400461626,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00038747141000768754,
|
|
"loss": 5.6643,
|
|
"mean_token_accuracy": 0.20538965463638306,
|
|
"num_tokens": 74919540.0,
|
|
"step": 29555
|
|
},
|
|
{
|
|
"entropy": 6.299989700317383,
|
|
"epoch": 3.4114252740911715,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00038743566911274117,
|
|
"loss": 5.5633,
|
|
"mean_token_accuracy": 0.20932378768920898,
|
|
"num_tokens": 74930931.0,
|
|
"step": 29560
|
|
},
|
|
{
|
|
"entropy": 6.259969234466553,
|
|
"epoch": 3.41200230813618,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00038739992443607686,
|
|
"loss": 5.5544,
|
|
"mean_token_accuracy": 0.2169748529791832,
|
|
"num_tokens": 74943531.0,
|
|
"step": 29565
|
|
},
|
|
{
|
|
"entropy": 6.285850095748901,
|
|
"epoch": 3.4125793421811887,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00038736417597889694,
|
|
"loss": 5.654,
|
|
"mean_token_accuracy": 0.20867855548858644,
|
|
"num_tokens": 74955808.0,
|
|
"step": 29570
|
|
},
|
|
{
|
|
"entropy": 6.324159574508667,
|
|
"epoch": 3.413156376226197,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0003873284237424038,
|
|
"loss": 5.6081,
|
|
"mean_token_accuracy": 0.21392519325017928,
|
|
"num_tokens": 74967412.0,
|
|
"step": 29575
|
|
},
|
|
{
|
|
"entropy": 6.305287456512451,
|
|
"epoch": 3.413733410271206,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00038729266772779994,
|
|
"loss": 5.5997,
|
|
"mean_token_accuracy": 0.20736124664545058,
|
|
"num_tokens": 74979889.0,
|
|
"step": 29580
|
|
},
|
|
{
|
|
"entropy": 6.27784276008606,
|
|
"epoch": 3.4143104443162144,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00038725690793628794,
|
|
"loss": 5.5634,
|
|
"mean_token_accuracy": 0.21148323714733125,
|
|
"num_tokens": 74992550.0,
|
|
"step": 29585
|
|
},
|
|
{
|
|
"entropy": 6.25721173286438,
|
|
"epoch": 3.4148874783612233,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00038722114436907056,
|
|
"loss": 5.5935,
|
|
"mean_token_accuracy": 0.2108869358897209,
|
|
"num_tokens": 75005940.0,
|
|
"step": 29590
|
|
},
|
|
{
|
|
"entropy": 6.240416812896728,
|
|
"epoch": 3.415464512406232,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003871853770273508,
|
|
"loss": 5.5303,
|
|
"mean_token_accuracy": 0.21673659086227418,
|
|
"num_tokens": 75018102.0,
|
|
"step": 29595
|
|
},
|
|
{
|
|
"entropy": 6.335780286788941,
|
|
"epoch": 3.4160415464512406,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003871496059123316,
|
|
"loss": 5.5938,
|
|
"mean_token_accuracy": 0.21495284736156464,
|
|
"num_tokens": 75031192.0,
|
|
"step": 29600
|
|
},
|
|
{
|
|
"entropy": 6.339282655715943,
|
|
"epoch": 3.4166185804962494,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0003871138310252161,
|
|
"loss": 5.6708,
|
|
"mean_token_accuracy": 0.2129219025373459,
|
|
"num_tokens": 75042791.0,
|
|
"step": 29605
|
|
},
|
|
{
|
|
"entropy": 6.33289213180542,
|
|
"epoch": 3.417195614541258,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0003870780523672075,
|
|
"loss": 5.6398,
|
|
"mean_token_accuracy": 0.20587825030088425,
|
|
"num_tokens": 75055649.0,
|
|
"step": 29610
|
|
},
|
|
{
|
|
"entropy": 6.24309663772583,
|
|
"epoch": 3.4177726485862667,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0003870422699395094,
|
|
"loss": 5.5502,
|
|
"mean_token_accuracy": 0.21617501080036164,
|
|
"num_tokens": 75068209.0,
|
|
"step": 29615
|
|
},
|
|
{
|
|
"entropy": 6.298670101165771,
|
|
"epoch": 3.418349682631275,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00038700648374332514,
|
|
"loss": 5.5738,
|
|
"mean_token_accuracy": 0.2167545586824417,
|
|
"num_tokens": 75080606.0,
|
|
"step": 29620
|
|
},
|
|
{
|
|
"entropy": 6.348202323913574,
|
|
"epoch": 3.418926716676284,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0003869706937798585,
|
|
"loss": 5.6634,
|
|
"mean_token_accuracy": 0.20921919494867325,
|
|
"num_tokens": 75094585.0,
|
|
"step": 29625
|
|
},
|
|
{
|
|
"entropy": 6.346184730529785,
|
|
"epoch": 3.4195037507212924,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00038693490005031316,
|
|
"loss": 5.7287,
|
|
"mean_token_accuracy": 0.2047036036849022,
|
|
"num_tokens": 75106953.0,
|
|
"step": 29630
|
|
},
|
|
{
|
|
"entropy": 6.314962339401245,
|
|
"epoch": 3.4200807847663013,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00038689910255589304,
|
|
"loss": 5.671,
|
|
"mean_token_accuracy": 0.2018256515264511,
|
|
"num_tokens": 75119506.0,
|
|
"step": 29635
|
|
},
|
|
{
|
|
"entropy": 6.284228801727295,
|
|
"epoch": 3.4206578188113097,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00038686330129780223,
|
|
"loss": 5.5172,
|
|
"mean_token_accuracy": 0.21206527948379517,
|
|
"num_tokens": 75132219.0,
|
|
"step": 29640
|
|
},
|
|
{
|
|
"entropy": 6.320038986206055,
|
|
"epoch": 3.4212348528563186,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00038682749627724485,
|
|
"loss": 5.6747,
|
|
"mean_token_accuracy": 0.20254862904548646,
|
|
"num_tokens": 75143880.0,
|
|
"step": 29645
|
|
},
|
|
{
|
|
"entropy": 6.242632293701172,
|
|
"epoch": 3.4218118869013274,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003867916874954251,
|
|
"loss": 5.5538,
|
|
"mean_token_accuracy": 0.2164613664150238,
|
|
"num_tokens": 75156673.0,
|
|
"step": 29650
|
|
},
|
|
{
|
|
"entropy": 6.285417270660401,
|
|
"epoch": 3.422388920946336,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0003867558749535475,
|
|
"loss": 5.5404,
|
|
"mean_token_accuracy": 0.21470536440610885,
|
|
"num_tokens": 75168846.0,
|
|
"step": 29655
|
|
},
|
|
{
|
|
"entropy": 6.305616283416748,
|
|
"epoch": 3.4229659549913443,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003867200586528166,
|
|
"loss": 5.6283,
|
|
"mean_token_accuracy": 0.21201475709676743,
|
|
"num_tokens": 75181046.0,
|
|
"step": 29660
|
|
},
|
|
{
|
|
"entropy": 6.250073099136353,
|
|
"epoch": 3.423542989036353,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00038668423859443705,
|
|
"loss": 5.5899,
|
|
"mean_token_accuracy": 0.21246559470891951,
|
|
"num_tokens": 75193266.0,
|
|
"step": 29665
|
|
},
|
|
{
|
|
"entropy": 6.225381755828858,
|
|
"epoch": 3.424120023081362,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0003866484147796136,
|
|
"loss": 5.478,
|
|
"mean_token_accuracy": 0.2194352462887764,
|
|
"num_tokens": 75204267.0,
|
|
"step": 29670
|
|
},
|
|
{
|
|
"entropy": 6.2832659721374515,
|
|
"epoch": 3.4246970571263704,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00038661258720955105,
|
|
"loss": 5.6402,
|
|
"mean_token_accuracy": 0.21196531355381013,
|
|
"num_tokens": 75216932.0,
|
|
"step": 29675
|
|
},
|
|
{
|
|
"entropy": 6.261052036285401,
|
|
"epoch": 3.4252740911713793,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00038657675588545467,
|
|
"loss": 5.5414,
|
|
"mean_token_accuracy": 0.21436585038900374,
|
|
"num_tokens": 75229084.0,
|
|
"step": 29680
|
|
},
|
|
{
|
|
"entropy": 6.255423307418823,
|
|
"epoch": 3.4258511252163877,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0003865409208085295,
|
|
"loss": 5.627,
|
|
"mean_token_accuracy": 0.20741465836763381,
|
|
"num_tokens": 75241356.0,
|
|
"step": 29685
|
|
},
|
|
{
|
|
"entropy": 6.254886054992676,
|
|
"epoch": 3.4264281592613965,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00038650508197998095,
|
|
"loss": 5.5736,
|
|
"mean_token_accuracy": 0.21291148960590361,
|
|
"num_tokens": 75252768.0,
|
|
"step": 29690
|
|
},
|
|
{
|
|
"entropy": 6.2614960193634035,
|
|
"epoch": 3.427005193306405,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0003864692394010143,
|
|
"loss": 5.5819,
|
|
"mean_token_accuracy": 0.21272424906492232,
|
|
"num_tokens": 75265517.0,
|
|
"step": 29695
|
|
},
|
|
{
|
|
"entropy": 6.375015211105347,
|
|
"epoch": 3.427582227351414,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00038643339307283507,
|
|
"loss": 5.7599,
|
|
"mean_token_accuracy": 0.19434330016374587,
|
|
"num_tokens": 75278191.0,
|
|
"step": 29700
|
|
},
|
|
{
|
|
"entropy": 6.273368644714355,
|
|
"epoch": 3.4281592613964222,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00038639754299664913,
|
|
"loss": 5.5163,
|
|
"mean_token_accuracy": 0.21345360279083253,
|
|
"num_tokens": 75290794.0,
|
|
"step": 29705
|
|
},
|
|
{
|
|
"entropy": 6.284481382369995,
|
|
"epoch": 3.428736295441431,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00038636168917366214,
|
|
"loss": 5.6454,
|
|
"mean_token_accuracy": 0.20390833616256715,
|
|
"num_tokens": 75303438.0,
|
|
"step": 29710
|
|
},
|
|
{
|
|
"entropy": 6.250480604171753,
|
|
"epoch": 3.4293133294864395,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00038632583160508,
|
|
"loss": 5.5653,
|
|
"mean_token_accuracy": 0.21113053411245347,
|
|
"num_tokens": 75317336.0,
|
|
"step": 29715
|
|
},
|
|
{
|
|
"entropy": 6.305090618133545,
|
|
"epoch": 3.4298903635314484,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00038628997029210887,
|
|
"loss": 5.6129,
|
|
"mean_token_accuracy": 0.20843510776758195,
|
|
"num_tokens": 75328952.0,
|
|
"step": 29720
|
|
},
|
|
{
|
|
"entropy": 6.371630573272705,
|
|
"epoch": 3.4304673975764572,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00038625410523595487,
|
|
"loss": 5.7006,
|
|
"mean_token_accuracy": 0.20116952210664749,
|
|
"num_tokens": 75341116.0,
|
|
"step": 29725
|
|
},
|
|
{
|
|
"entropy": 6.358349990844727,
|
|
"epoch": 3.4310444316214657,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00038621823643782426,
|
|
"loss": 5.6605,
|
|
"mean_token_accuracy": 0.20419360250234603,
|
|
"num_tokens": 75354150.0,
|
|
"step": 29730
|
|
},
|
|
{
|
|
"entropy": 6.345208692550659,
|
|
"epoch": 3.431621465666474,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003861823638989235,
|
|
"loss": 5.5843,
|
|
"mean_token_accuracy": 0.21923115253448486,
|
|
"num_tokens": 75367809.0,
|
|
"step": 29735
|
|
},
|
|
{
|
|
"entropy": 6.126128005981445,
|
|
"epoch": 3.432198499711483,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00038614648762045923,
|
|
"loss": 5.4591,
|
|
"mean_token_accuracy": 0.22471146434545516,
|
|
"num_tokens": 75380536.0,
|
|
"step": 29740
|
|
},
|
|
{
|
|
"entropy": 6.193651533126831,
|
|
"epoch": 3.432775533756492,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000386110607603638,
|
|
"loss": 5.5073,
|
|
"mean_token_accuracy": 0.2140814945101738,
|
|
"num_tokens": 75392994.0,
|
|
"step": 29745
|
|
},
|
|
{
|
|
"entropy": 6.3105395317077635,
|
|
"epoch": 3.4333525678015,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0003860747238496667,
|
|
"loss": 5.5952,
|
|
"mean_token_accuracy": 0.20901768654584885,
|
|
"num_tokens": 75405344.0,
|
|
"step": 29750
|
|
},
|
|
{
|
|
"entropy": 6.379081201553345,
|
|
"epoch": 3.433929601846509,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00038603883635975224,
|
|
"loss": 5.6961,
|
|
"mean_token_accuracy": 0.20255425572395325,
|
|
"num_tokens": 75418059.0,
|
|
"step": 29755
|
|
},
|
|
{
|
|
"entropy": 6.312580347061157,
|
|
"epoch": 3.4345066358915175,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0003860029451351016,
|
|
"loss": 5.6511,
|
|
"mean_token_accuracy": 0.2055727183818817,
|
|
"num_tokens": 75431316.0,
|
|
"step": 29760
|
|
},
|
|
{
|
|
"entropy": 6.288564014434814,
|
|
"epoch": 3.4350836699365264,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00038596705017692216,
|
|
"loss": 5.5918,
|
|
"mean_token_accuracy": 0.205415803194046,
|
|
"num_tokens": 75443542.0,
|
|
"step": 29765
|
|
},
|
|
{
|
|
"entropy": 6.295324802398682,
|
|
"epoch": 3.435660703981535,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00038593115148642107,
|
|
"loss": 5.6561,
|
|
"mean_token_accuracy": 0.20467182248830795,
|
|
"num_tokens": 75455422.0,
|
|
"step": 29770
|
|
},
|
|
{
|
|
"entropy": 6.263564157485962,
|
|
"epoch": 3.4362377380265436,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00038589524906480576,
|
|
"loss": 5.5884,
|
|
"mean_token_accuracy": 0.2191532015800476,
|
|
"num_tokens": 75468702.0,
|
|
"step": 29775
|
|
},
|
|
{
|
|
"entropy": 6.2329939842224125,
|
|
"epoch": 3.436814772071552,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003858593429132838,
|
|
"loss": 5.5074,
|
|
"mean_token_accuracy": 0.21822710931301117,
|
|
"num_tokens": 75480217.0,
|
|
"step": 29780
|
|
},
|
|
{
|
|
"entropy": 6.314549779891967,
|
|
"epoch": 3.437391806116561,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00038582343303306306,
|
|
"loss": 5.6449,
|
|
"mean_token_accuracy": 0.20735921561717988,
|
|
"num_tokens": 75492826.0,
|
|
"step": 29785
|
|
},
|
|
{
|
|
"entropy": 6.335971117019653,
|
|
"epoch": 3.4379688401615693,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0003857875194253511,
|
|
"loss": 5.6719,
|
|
"mean_token_accuracy": 0.20562490820884705,
|
|
"num_tokens": 75504398.0,
|
|
"step": 29790
|
|
},
|
|
{
|
|
"entropy": 6.301286411285401,
|
|
"epoch": 3.438545874206578,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003857516020913559,
|
|
"loss": 5.6096,
|
|
"mean_token_accuracy": 0.20939625799655914,
|
|
"num_tokens": 75516028.0,
|
|
"step": 29795
|
|
},
|
|
{
|
|
"entropy": 6.356657791137695,
|
|
"epoch": 3.439122908251587,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00038571568103228565,
|
|
"loss": 5.6362,
|
|
"mean_token_accuracy": 0.2080766960978508,
|
|
"num_tokens": 75528811.0,
|
|
"step": 29800
|
|
},
|
|
{
|
|
"entropy": 6.262935161590576,
|
|
"epoch": 3.4396999422965955,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003856797562493485,
|
|
"loss": 5.4981,
|
|
"mean_token_accuracy": 0.2227972701191902,
|
|
"num_tokens": 75542784.0,
|
|
"step": 29805
|
|
},
|
|
{
|
|
"entropy": 6.331818962097168,
|
|
"epoch": 3.4402769763416043,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003856438277437527,
|
|
"loss": 5.6531,
|
|
"mean_token_accuracy": 0.20507561415433884,
|
|
"num_tokens": 75555295.0,
|
|
"step": 29810
|
|
},
|
|
{
|
|
"entropy": 6.315788984298706,
|
|
"epoch": 3.4408540103866128,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00038560789551670663,
|
|
"loss": 5.663,
|
|
"mean_token_accuracy": 0.2064618617296219,
|
|
"num_tokens": 75568234.0,
|
|
"step": 29815
|
|
},
|
|
{
|
|
"entropy": 6.329085111618042,
|
|
"epoch": 3.4414310444316216,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00038557195956941896,
|
|
"loss": 5.6242,
|
|
"mean_token_accuracy": 0.2060800760984421,
|
|
"num_tokens": 75580865.0,
|
|
"step": 29820
|
|
},
|
|
{
|
|
"entropy": 6.348110628128052,
|
|
"epoch": 3.44200807847663,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00038553601990309845,
|
|
"loss": 5.6714,
|
|
"mean_token_accuracy": 0.202749402821064,
|
|
"num_tokens": 75593679.0,
|
|
"step": 29825
|
|
},
|
|
{
|
|
"entropy": 6.402059602737427,
|
|
"epoch": 3.442585112521639,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00038550007651895376,
|
|
"loss": 5.7096,
|
|
"mean_token_accuracy": 0.20487726628780364,
|
|
"num_tokens": 75607061.0,
|
|
"step": 29830
|
|
},
|
|
{
|
|
"entropy": 6.36814603805542,
|
|
"epoch": 3.4431621465666473,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00038546412941819385,
|
|
"loss": 5.6144,
|
|
"mean_token_accuracy": 0.20971840471029282,
|
|
"num_tokens": 75619729.0,
|
|
"step": 29835
|
|
},
|
|
{
|
|
"entropy": 6.399398851394653,
|
|
"epoch": 3.443739180611656,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003854281786020279,
|
|
"loss": 5.7028,
|
|
"mean_token_accuracy": 0.1975073590874672,
|
|
"num_tokens": 75631942.0,
|
|
"step": 29840
|
|
},
|
|
{
|
|
"entropy": 6.295283699035645,
|
|
"epoch": 3.4443162146566646,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00038539222407166495,
|
|
"loss": 5.6169,
|
|
"mean_token_accuracy": 0.21209257692098618,
|
|
"num_tokens": 75646181.0,
|
|
"step": 29845
|
|
},
|
|
{
|
|
"entropy": 6.254492378234863,
|
|
"epoch": 3.4448932487016735,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003853562658283144,
|
|
"loss": 5.5081,
|
|
"mean_token_accuracy": 0.21548499912023544,
|
|
"num_tokens": 75657808.0,
|
|
"step": 29850
|
|
},
|
|
{
|
|
"entropy": 6.264165353775025,
|
|
"epoch": 3.445470282746682,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00038532030387318565,
|
|
"loss": 5.5936,
|
|
"mean_token_accuracy": 0.2183812826871872,
|
|
"num_tokens": 75670166.0,
|
|
"step": 29855
|
|
},
|
|
{
|
|
"entropy": 6.330345010757446,
|
|
"epoch": 3.4460473167916907,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00038528433820748833,
|
|
"loss": 5.7231,
|
|
"mean_token_accuracy": 0.2001278281211853,
|
|
"num_tokens": 75682511.0,
|
|
"step": 29860
|
|
},
|
|
{
|
|
"entropy": 6.417759704589844,
|
|
"epoch": 3.446624350836699,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00038524836883243197,
|
|
"loss": 5.6952,
|
|
"mean_token_accuracy": 0.20468641966581344,
|
|
"num_tokens": 75694785.0,
|
|
"step": 29865
|
|
},
|
|
{
|
|
"entropy": 6.36159200668335,
|
|
"epoch": 3.447201384881708,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00038521239574922664,
|
|
"loss": 5.6774,
|
|
"mean_token_accuracy": 0.2047070547938347,
|
|
"num_tokens": 75707908.0,
|
|
"step": 29870
|
|
},
|
|
{
|
|
"entropy": 6.293680858612061,
|
|
"epoch": 3.447778418926717,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000385176418959082,
|
|
"loss": 5.5882,
|
|
"mean_token_accuracy": 0.2066198170185089,
|
|
"num_tokens": 75720733.0,
|
|
"step": 29875
|
|
},
|
|
{
|
|
"entropy": 6.2677295207977295,
|
|
"epoch": 3.4483554529717253,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00038514043846320825,
|
|
"loss": 5.5091,
|
|
"mean_token_accuracy": 0.21238078325986862,
|
|
"num_tokens": 75732511.0,
|
|
"step": 29880
|
|
},
|
|
{
|
|
"entropy": 6.29506287574768,
|
|
"epoch": 3.448932487016734,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00038510445426281556,
|
|
"loss": 5.5981,
|
|
"mean_token_accuracy": 0.21783992946147918,
|
|
"num_tokens": 75744949.0,
|
|
"step": 29885
|
|
},
|
|
{
|
|
"entropy": 6.230957317352295,
|
|
"epoch": 3.4495095210617426,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003850684663591143,
|
|
"loss": 5.6077,
|
|
"mean_token_accuracy": 0.20808719098567963,
|
|
"num_tokens": 75758049.0,
|
|
"step": 29890
|
|
},
|
|
{
|
|
"entropy": 6.276919937133789,
|
|
"epoch": 3.4500865551067514,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003850324747533148,
|
|
"loss": 5.53,
|
|
"mean_token_accuracy": 0.21354656666517258,
|
|
"num_tokens": 75772242.0,
|
|
"step": 29895
|
|
},
|
|
{
|
|
"entropy": 6.276070690155029,
|
|
"epoch": 3.45066358915176,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0003849964794466277,
|
|
"loss": 5.5506,
|
|
"mean_token_accuracy": 0.21536167860031127,
|
|
"num_tokens": 75784711.0,
|
|
"step": 29900
|
|
},
|
|
{
|
|
"entropy": 6.395268726348877,
|
|
"epoch": 3.4512406231967687,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0003849604804402636,
|
|
"loss": 5.7082,
|
|
"mean_token_accuracy": 0.1957272246479988,
|
|
"num_tokens": 75796757.0,
|
|
"step": 29905
|
|
},
|
|
{
|
|
"entropy": 6.316126155853271,
|
|
"epoch": 3.451817657241777,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00038492447773543344,
|
|
"loss": 5.6576,
|
|
"mean_token_accuracy": 0.20480319410562514,
|
|
"num_tokens": 75810195.0,
|
|
"step": 29910
|
|
},
|
|
{
|
|
"entropy": 6.31956467628479,
|
|
"epoch": 3.452394691286786,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000384888471333348,
|
|
"loss": 5.6286,
|
|
"mean_token_accuracy": 0.21470877677202224,
|
|
"num_tokens": 75822645.0,
|
|
"step": 29915
|
|
},
|
|
{
|
|
"entropy": 6.280429458618164,
|
|
"epoch": 3.4529717253317944,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003848524612352184,
|
|
"loss": 5.6554,
|
|
"mean_token_accuracy": 0.2015328586101532,
|
|
"num_tokens": 75834277.0,
|
|
"step": 29920
|
|
},
|
|
{
|
|
"entropy": 6.344773292541504,
|
|
"epoch": 3.4535487593768033,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0003848164474422559,
|
|
"loss": 5.6418,
|
|
"mean_token_accuracy": 0.2047449991106987,
|
|
"num_tokens": 75846111.0,
|
|
"step": 29925
|
|
},
|
|
{
|
|
"entropy": 6.395335388183594,
|
|
"epoch": 3.4541257934218117,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00038478042995567175,
|
|
"loss": 5.661,
|
|
"mean_token_accuracy": 0.20329206585884094,
|
|
"num_tokens": 75858453.0,
|
|
"step": 29930
|
|
},
|
|
{
|
|
"entropy": 6.306465101242066,
|
|
"epoch": 3.4547028274668206,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003847444087766773,
|
|
"loss": 5.6715,
|
|
"mean_token_accuracy": 0.20226105749607087,
|
|
"num_tokens": 75870127.0,
|
|
"step": 29935
|
|
},
|
|
{
|
|
"entropy": 6.2155303955078125,
|
|
"epoch": 3.455279861511829,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00038470838390648423,
|
|
"loss": 5.4805,
|
|
"mean_token_accuracy": 0.21685548573732377,
|
|
"num_tokens": 75883320.0,
|
|
"step": 29940
|
|
},
|
|
{
|
|
"entropy": 6.2545592308044435,
|
|
"epoch": 3.455856895556838,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00038467235534630405,
|
|
"loss": 5.6003,
|
|
"mean_token_accuracy": 0.20251470059156418,
|
|
"num_tokens": 75897433.0,
|
|
"step": 29945
|
|
},
|
|
{
|
|
"entropy": 6.314982748031616,
|
|
"epoch": 3.4564339296018467,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003846363230973488,
|
|
"loss": 5.5994,
|
|
"mean_token_accuracy": 0.21036150753498079,
|
|
"num_tokens": 75909919.0,
|
|
"step": 29950
|
|
},
|
|
{
|
|
"entropy": 6.345373725891113,
|
|
"epoch": 3.457010963646855,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00038460028716083024,
|
|
"loss": 5.6588,
|
|
"mean_token_accuracy": 0.2088895246386528,
|
|
"num_tokens": 75923101.0,
|
|
"step": 29955
|
|
},
|
|
{
|
|
"entropy": 6.235252046585083,
|
|
"epoch": 3.457587997691864,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0003845642475379605,
|
|
"loss": 5.567,
|
|
"mean_token_accuracy": 0.2051964893937111,
|
|
"num_tokens": 75936331.0,
|
|
"step": 29960
|
|
},
|
|
{
|
|
"entropy": 6.280921506881714,
|
|
"epoch": 3.4581650317368724,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0003845282042299516,
|
|
"loss": 5.5579,
|
|
"mean_token_accuracy": 0.21245438307523729,
|
|
"num_tokens": 75947921.0,
|
|
"step": 29965
|
|
},
|
|
{
|
|
"entropy": 6.3211565017700195,
|
|
"epoch": 3.4587420657818813,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0003844921572380161,
|
|
"loss": 5.5818,
|
|
"mean_token_accuracy": 0.20676211565732955,
|
|
"num_tokens": 75960454.0,
|
|
"step": 29970
|
|
},
|
|
{
|
|
"entropy": 6.284748172760009,
|
|
"epoch": 3.4593190998268897,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003844561065633662,
|
|
"loss": 5.6675,
|
|
"mean_token_accuracy": 0.19994053095579148,
|
|
"num_tokens": 75972909.0,
|
|
"step": 29975
|
|
},
|
|
{
|
|
"entropy": 6.305700969696045,
|
|
"epoch": 3.4598961338718985,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0003844200522072145,
|
|
"loss": 5.5809,
|
|
"mean_token_accuracy": 0.20914534330368043,
|
|
"num_tokens": 75985360.0,
|
|
"step": 29980
|
|
},
|
|
{
|
|
"entropy": 6.333784914016723,
|
|
"epoch": 3.460473167916907,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003843839941707738,
|
|
"loss": 5.5613,
|
|
"mean_token_accuracy": 0.2130906105041504,
|
|
"num_tokens": 75996434.0,
|
|
"step": 29985
|
|
},
|
|
{
|
|
"entropy": 6.3065221309661865,
|
|
"epoch": 3.461050201961916,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003843479324552567,
|
|
"loss": 5.5781,
|
|
"mean_token_accuracy": 0.20661005079746247,
|
|
"num_tokens": 76008721.0,
|
|
"step": 29990
|
|
},
|
|
{
|
|
"entropy": 6.31390962600708,
|
|
"epoch": 3.4616272360069242,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00038431186706187626,
|
|
"loss": 5.6427,
|
|
"mean_token_accuracy": 0.20778784155845642,
|
|
"num_tokens": 76021775.0,
|
|
"step": 29995
|
|
},
|
|
{
|
|
"entropy": 6.303632926940918,
|
|
"epoch": 3.462204270051933,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00038427579799184546,
|
|
"loss": 5.5825,
|
|
"mean_token_accuracy": 0.2140277534723282,
|
|
"num_tokens": 76034607.0,
|
|
"step": 30000
|
|
},
|
|
{
|
|
"epoch": 3.462204270051933,
|
|
"eval_entropy": 6.1142602748480375,
|
|
"eval_loss": 5.721312999725342,
|
|
"eval_mean_token_accuracy": 0.21227686378743657,
|
|
"eval_num_tokens": 76034607.0,
|
|
"eval_runtime": 17.4567,
|
|
"eval_samples_per_second": 1611.759,
|
|
"eval_steps_per_second": 201.47,
|
|
"step": 30000
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 86650,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 10,
|
|
"save_steps": 3000,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 1.662910440505344e+16,
|
|
"train_batch_size": 16,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|