6275 lines
179 KiB
JSON
6275 lines
179 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 1.0,
|
|
"eval_steps": 500,
|
|
"global_step": 6241,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 1.8924221977591515,
|
|
"epoch": 0.0016025320005608862,
|
|
"grad_norm": 47.75,
|
|
"learning_rate": 2.884615384615385e-07,
|
|
"loss": 2.6188112258911134,
|
|
"mean_token_accuracy": 0.5233313746750354,
|
|
"num_tokens": 66651.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 1.922156248986721,
|
|
"epoch": 0.0032050640011217725,
|
|
"grad_norm": 46.75,
|
|
"learning_rate": 6.08974358974359e-07,
|
|
"loss": 2.563404655456543,
|
|
"mean_token_accuracy": 0.5188336454331874,
|
|
"num_tokens": 137940.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 1.9010927319526671,
|
|
"epoch": 0.004807596001682658,
|
|
"grad_norm": 38.0,
|
|
"learning_rate": 9.294871794871796e-07,
|
|
"loss": 2.5269372940063475,
|
|
"mean_token_accuracy": 0.5221607111394405,
|
|
"num_tokens": 208682.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 1.8908767253160477,
|
|
"epoch": 0.006410128002243545,
|
|
"grad_norm": 34.5,
|
|
"learning_rate": 1.25e-06,
|
|
"loss": 2.4589189529418944,
|
|
"mean_token_accuracy": 0.5292409997433424,
|
|
"num_tokens": 277911.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 1.9242432832717895,
|
|
"epoch": 0.008012660002804432,
|
|
"grad_norm": 21.25,
|
|
"learning_rate": 1.5705128205128206e-06,
|
|
"loss": 2.40079402923584,
|
|
"mean_token_accuracy": 0.5290395379066467,
|
|
"num_tokens": 348454.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 1.9205047577619552,
|
|
"epoch": 0.009615192003365317,
|
|
"grad_norm": 15.1875,
|
|
"learning_rate": 1.891025641025641e-06,
|
|
"loss": 2.2803781509399412,
|
|
"mean_token_accuracy": 0.5345041077584028,
|
|
"num_tokens": 417679.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 1.8985449492931366,
|
|
"epoch": 0.011217724003926203,
|
|
"grad_norm": 11.4375,
|
|
"learning_rate": 2.211538461538462e-06,
|
|
"loss": 2.1747177124023436,
|
|
"mean_token_accuracy": 0.5503359518945217,
|
|
"num_tokens": 484356.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 1.902299603074789,
|
|
"epoch": 0.01282025600448709,
|
|
"grad_norm": 5.65625,
|
|
"learning_rate": 2.5320512820512823e-06,
|
|
"loss": 2.114341163635254,
|
|
"mean_token_accuracy": 0.5579096399247646,
|
|
"num_tokens": 553094.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 1.939731851965189,
|
|
"epoch": 0.014422788005047977,
|
|
"grad_norm": 4.875,
|
|
"learning_rate": 2.852564102564103e-06,
|
|
"loss": 2.1059520721435545,
|
|
"mean_token_accuracy": 0.5593277081847191,
|
|
"num_tokens": 622016.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 1.876069898158312,
|
|
"epoch": 0.016025320005608863,
|
|
"grad_norm": 3.875,
|
|
"learning_rate": 3.1730769230769233e-06,
|
|
"loss": 2.016912269592285,
|
|
"mean_token_accuracy": 0.5697586502879858,
|
|
"num_tokens": 691175.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 1.8731758743524551,
|
|
"epoch": 0.017627852006169748,
|
|
"grad_norm": 3.484375,
|
|
"learning_rate": 3.4935897435897438e-06,
|
|
"loss": 1.9954225540161132,
|
|
"mean_token_accuracy": 0.5712465867400169,
|
|
"num_tokens": 757429.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 1.8756513863801956,
|
|
"epoch": 0.019230384006730633,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 3.8141025641025643e-06,
|
|
"loss": 2.0083831787109374,
|
|
"mean_token_accuracy": 0.5699114728718996,
|
|
"num_tokens": 826035.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 1.8890732847154141,
|
|
"epoch": 0.02083291600729152,
|
|
"grad_norm": 3.15625,
|
|
"learning_rate": 4.134615384615385e-06,
|
|
"loss": 2.042840766906738,
|
|
"mean_token_accuracy": 0.5750202693045139,
|
|
"num_tokens": 894823.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 1.9485681891441344,
|
|
"epoch": 0.022435448007852406,
|
|
"grad_norm": 2.9375,
|
|
"learning_rate": 4.455128205128206e-06,
|
|
"loss": 2.033138656616211,
|
|
"mean_token_accuracy": 0.5648796543478966,
|
|
"num_tokens": 967782.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 1.88450263813138,
|
|
"epoch": 0.02403798000841329,
|
|
"grad_norm": 3.28125,
|
|
"learning_rate": 4.775641025641027e-06,
|
|
"loss": 1.9986297607421875,
|
|
"mean_token_accuracy": 0.5769022148102522,
|
|
"num_tokens": 1035926.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 1.9446559742093086,
|
|
"epoch": 0.02564051200897418,
|
|
"grad_norm": 3.203125,
|
|
"learning_rate": 5.096153846153846e-06,
|
|
"loss": 2.0234989166259765,
|
|
"mean_token_accuracy": 0.5664361469447613,
|
|
"num_tokens": 1107073.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 1.883225505053997,
|
|
"epoch": 0.027243044009535065,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 5.416666666666667e-06,
|
|
"loss": 1.9557977676391602,
|
|
"mean_token_accuracy": 0.5763147968798876,
|
|
"num_tokens": 1176735.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 1.9516266271471978,
|
|
"epoch": 0.028845576010095953,
|
|
"grad_norm": 2.921875,
|
|
"learning_rate": 5.737179487179487e-06,
|
|
"loss": 1.9794040679931642,
|
|
"mean_token_accuracy": 0.5643045194447041,
|
|
"num_tokens": 1249349.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 1.9053485810756683,
|
|
"epoch": 0.030448108010656838,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 6.057692307692308e-06,
|
|
"loss": 1.9960391998291016,
|
|
"mean_token_accuracy": 0.5730757340788841,
|
|
"num_tokens": 1317928.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 1.8806858271360398,
|
|
"epoch": 0.032050640011217726,
|
|
"grad_norm": 2.703125,
|
|
"learning_rate": 6.378205128205129e-06,
|
|
"loss": 1.957114028930664,
|
|
"mean_token_accuracy": 0.5820898830890655,
|
|
"num_tokens": 1385138.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 1.887659776210785,
|
|
"epoch": 0.03365317201177861,
|
|
"grad_norm": 2.828125,
|
|
"learning_rate": 6.698717948717949e-06,
|
|
"loss": 1.9600671768188476,
|
|
"mean_token_accuracy": 0.5803815096616745,
|
|
"num_tokens": 1454703.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 1.867220865190029,
|
|
"epoch": 0.035255704012339496,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 7.01923076923077e-06,
|
|
"loss": 1.937087631225586,
|
|
"mean_token_accuracy": 0.579859958216548,
|
|
"num_tokens": 1520990.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 1.9226368859410286,
|
|
"epoch": 0.036858236012900385,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 7.33974358974359e-06,
|
|
"loss": 1.9694780349731444,
|
|
"mean_token_accuracy": 0.5732789397239685,
|
|
"num_tokens": 1591028.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 1.840953428298235,
|
|
"epoch": 0.038460768013461266,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 7.660256410256411e-06,
|
|
"loss": 1.9297588348388672,
|
|
"mean_token_accuracy": 0.5849139843136072,
|
|
"num_tokens": 1656272.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 1.852292013913393,
|
|
"epoch": 0.040063300014022155,
|
|
"grad_norm": 3.140625,
|
|
"learning_rate": 7.980769230769232e-06,
|
|
"loss": 1.932406234741211,
|
|
"mean_token_accuracy": 0.5815942466259003,
|
|
"num_tokens": 1724103.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 1.9237169787287711,
|
|
"epoch": 0.04166583201458304,
|
|
"grad_norm": 2.84375,
|
|
"learning_rate": 8.301282051282052e-06,
|
|
"loss": 1.9780784606933595,
|
|
"mean_token_accuracy": 0.5724721662700176,
|
|
"num_tokens": 1793809.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 1.9092090293765067,
|
|
"epoch": 0.043268364015143924,
|
|
"grad_norm": 2.75,
|
|
"learning_rate": 8.621794871794873e-06,
|
|
"loss": 1.9296005249023438,
|
|
"mean_token_accuracy": 0.5794690005481243,
|
|
"num_tokens": 1862546.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 1.8140447169542313,
|
|
"epoch": 0.04487089601570481,
|
|
"grad_norm": 2.6875,
|
|
"learning_rate": 8.942307692307693e-06,
|
|
"loss": 1.9155027389526367,
|
|
"mean_token_accuracy": 0.58444296233356,
|
|
"num_tokens": 1928555.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 1.8786520659923553,
|
|
"epoch": 0.0464734280162657,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 9.262820512820514e-06,
|
|
"loss": 1.9598024368286133,
|
|
"mean_token_accuracy": 0.5811394732445478,
|
|
"num_tokens": 1997148.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 1.8962267510592938,
|
|
"epoch": 0.04807596001682658,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 9.583333333333335e-06,
|
|
"loss": 1.9487903594970704,
|
|
"mean_token_accuracy": 0.5800880625844002,
|
|
"num_tokens": 2065063.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 1.8655135102570057,
|
|
"epoch": 0.04967849201738747,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 9.903846153846155e-06,
|
|
"loss": 1.9372148513793945,
|
|
"mean_token_accuracy": 0.5815446004271507,
|
|
"num_tokens": 2132637.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 1.89379173964262,
|
|
"epoch": 0.05128102401794836,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 9.988193624557261e-06,
|
|
"loss": 1.9456815719604492,
|
|
"mean_token_accuracy": 0.5783611986786127,
|
|
"num_tokens": 2200340.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 1.851027710735798,
|
|
"epoch": 0.05288355601850925,
|
|
"grad_norm": 2.953125,
|
|
"learning_rate": 9.971327373924778e-06,
|
|
"loss": 1.9404556274414062,
|
|
"mean_token_accuracy": 0.5844585198909045,
|
|
"num_tokens": 2268721.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 1.9101853892207146,
|
|
"epoch": 0.05448608801907013,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 9.954461123292292e-06,
|
|
"loss": 1.9825191497802734,
|
|
"mean_token_accuracy": 0.5763120006769895,
|
|
"num_tokens": 2337381.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 1.8936392977833747,
|
|
"epoch": 0.05608862001963102,
|
|
"grad_norm": 3.21875,
|
|
"learning_rate": 9.937594872659809e-06,
|
|
"loss": 1.9490802764892579,
|
|
"mean_token_accuracy": 0.5789993833750486,
|
|
"num_tokens": 2405770.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 1.8573398821055889,
|
|
"epoch": 0.057691152020191906,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 9.920728622027325e-06,
|
|
"loss": 1.9417463302612306,
|
|
"mean_token_accuracy": 0.5814387623220683,
|
|
"num_tokens": 2473102.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 1.8687433026731015,
|
|
"epoch": 0.05929368402075279,
|
|
"grad_norm": 2.9375,
|
|
"learning_rate": 9.90386237139484e-06,
|
|
"loss": 1.9335454940795898,
|
|
"mean_token_accuracy": 0.5852543283253908,
|
|
"num_tokens": 2540880.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 1.8238108970224858,
|
|
"epoch": 0.060896216021313676,
|
|
"grad_norm": 3.609375,
|
|
"learning_rate": 9.886996120762356e-06,
|
|
"loss": 1.9002412796020507,
|
|
"mean_token_accuracy": 0.5933637998998165,
|
|
"num_tokens": 2605971.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 1.8098725199699401,
|
|
"epoch": 0.062498748021874564,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 9.87012987012987e-06,
|
|
"loss": 1.8953941345214844,
|
|
"mean_token_accuracy": 0.5905886631458998,
|
|
"num_tokens": 2669950.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 1.8483323730528354,
|
|
"epoch": 0.06410128002243545,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 9.853263619497387e-06,
|
|
"loss": 1.9442218780517577,
|
|
"mean_token_accuracy": 0.5866008169949055,
|
|
"num_tokens": 2735420.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 1.9439873054623604,
|
|
"epoch": 0.06570381202299633,
|
|
"grad_norm": 2.828125,
|
|
"learning_rate": 9.836397368864901e-06,
|
|
"loss": 2.0032651901245115,
|
|
"mean_token_accuracy": 0.5694192741066217,
|
|
"num_tokens": 2804603.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 1.872369658946991,
|
|
"epoch": 0.06730634402355722,
|
|
"grad_norm": 2.625,
|
|
"learning_rate": 9.819531118232418e-06,
|
|
"loss": 1.9437833786010743,
|
|
"mean_token_accuracy": 0.5829788766801357,
|
|
"num_tokens": 2872064.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 1.886989878118038,
|
|
"epoch": 0.0689088760241181,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 9.802664867599934e-06,
|
|
"loss": 1.9446407318115235,
|
|
"mean_token_accuracy": 0.5787219580262899,
|
|
"num_tokens": 2940272.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 1.9421475365757943,
|
|
"epoch": 0.07051140802467899,
|
|
"grad_norm": 2.640625,
|
|
"learning_rate": 9.785798616967448e-06,
|
|
"loss": 2.000010871887207,
|
|
"mean_token_accuracy": 0.567750496044755,
|
|
"num_tokens": 3010674.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 1.881090347468853,
|
|
"epoch": 0.07211394002523988,
|
|
"grad_norm": 2.953125,
|
|
"learning_rate": 9.768932366334965e-06,
|
|
"loss": 1.9491590499877929,
|
|
"mean_token_accuracy": 0.5847097650170326,
|
|
"num_tokens": 3078595.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 1.870892095565796,
|
|
"epoch": 0.07371647202580077,
|
|
"grad_norm": 2.609375,
|
|
"learning_rate": 9.75206611570248e-06,
|
|
"loss": 1.9273197174072265,
|
|
"mean_token_accuracy": 0.5815099891275167,
|
|
"num_tokens": 3144455.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 1.8761539243161678,
|
|
"epoch": 0.07531900402636166,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 9.735199865069996e-06,
|
|
"loss": 1.9557538986206056,
|
|
"mean_token_accuracy": 0.5829537663608789,
|
|
"num_tokens": 3214310.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 1.855475628376007,
|
|
"epoch": 0.07692153602692253,
|
|
"grad_norm": 2.953125,
|
|
"learning_rate": 9.718333614437512e-06,
|
|
"loss": 1.9161636352539062,
|
|
"mean_token_accuracy": 0.5863808520138264,
|
|
"num_tokens": 3285062.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 1.8617834381759166,
|
|
"epoch": 0.07852406802748342,
|
|
"grad_norm": 2.84375,
|
|
"learning_rate": 9.701467363805027e-06,
|
|
"loss": 1.9468860626220703,
|
|
"mean_token_accuracy": 0.580999382585287,
|
|
"num_tokens": 3353498.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 1.8763719350099564,
|
|
"epoch": 0.08012660002804431,
|
|
"grad_norm": 3.359375,
|
|
"learning_rate": 9.684601113172543e-06,
|
|
"loss": 1.9362581253051758,
|
|
"mean_token_accuracy": 0.5832551945000887,
|
|
"num_tokens": 3422255.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 1.8736688300967217,
|
|
"epoch": 0.0817291320286052,
|
|
"grad_norm": 3.140625,
|
|
"learning_rate": 9.667734862540057e-06,
|
|
"loss": 1.9376916885375977,
|
|
"mean_token_accuracy": 0.5802027761936188,
|
|
"num_tokens": 3491741.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 1.8863457903265952,
|
|
"epoch": 0.08333166402916609,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 9.650868611907574e-06,
|
|
"loss": 1.942121696472168,
|
|
"mean_token_accuracy": 0.5779230989515781,
|
|
"num_tokens": 3560075.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 1.8802876263856887,
|
|
"epoch": 0.08493419602972697,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 9.634002361275088e-06,
|
|
"loss": 1.9324022293090821,
|
|
"mean_token_accuracy": 0.5816225569695235,
|
|
"num_tokens": 3627966.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 1.9352840840816499,
|
|
"epoch": 0.08653672803028785,
|
|
"grad_norm": 2.828125,
|
|
"learning_rate": 9.617136110642605e-06,
|
|
"loss": 1.990936279296875,
|
|
"mean_token_accuracy": 0.5724680010229349,
|
|
"num_tokens": 3700177.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 1.8702165111899376,
|
|
"epoch": 0.08813926003084874,
|
|
"grad_norm": 3.5,
|
|
"learning_rate": 9.600269860010121e-06,
|
|
"loss": 1.9451469421386718,
|
|
"mean_token_accuracy": 0.5830163966864348,
|
|
"num_tokens": 3768640.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 1.938204861432314,
|
|
"epoch": 0.08974179203140963,
|
|
"grad_norm": 2.828125,
|
|
"learning_rate": 9.583403609377636e-06,
|
|
"loss": 1.9839460372924804,
|
|
"mean_token_accuracy": 0.5680067148059607,
|
|
"num_tokens": 3841684.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 1.891503432393074,
|
|
"epoch": 0.09134432403197051,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 9.566537358745152e-06,
|
|
"loss": 1.9441808700561523,
|
|
"mean_token_accuracy": 0.576492153853178,
|
|
"num_tokens": 3911490.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 1.8403802424669267,
|
|
"epoch": 0.0929468560325314,
|
|
"grad_norm": 3.109375,
|
|
"learning_rate": 9.549671108112666e-06,
|
|
"loss": 1.8948766708374023,
|
|
"mean_token_accuracy": 0.5904972556978464,
|
|
"num_tokens": 3975499.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 1.8935207590460776,
|
|
"epoch": 0.09454938803309229,
|
|
"grad_norm": 2.671875,
|
|
"learning_rate": 9.532804857480183e-06,
|
|
"loss": 1.9514276504516601,
|
|
"mean_token_accuracy": 0.5731811784207821,
|
|
"num_tokens": 4046256.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 1.9148340128362178,
|
|
"epoch": 0.09615192003365317,
|
|
"grad_norm": 2.625,
|
|
"learning_rate": 9.515938606847699e-06,
|
|
"loss": 1.9665313720703126,
|
|
"mean_token_accuracy": 0.5750534620136023,
|
|
"num_tokens": 4113801.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 1.9208699256181716,
|
|
"epoch": 0.09775445203421405,
|
|
"grad_norm": 2.734375,
|
|
"learning_rate": 9.499072356215214e-06,
|
|
"loss": 1.9486780166625977,
|
|
"mean_token_accuracy": 0.5765438359230757,
|
|
"num_tokens": 4184745.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 1.8517391234636307,
|
|
"epoch": 0.09935698403477494,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 9.48220610558273e-06,
|
|
"loss": 1.9088247299194336,
|
|
"mean_token_accuracy": 0.5816758945584297,
|
|
"num_tokens": 4253087.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 1.8575052984058857,
|
|
"epoch": 0.10095951603533583,
|
|
"grad_norm": 3.0,
|
|
"learning_rate": 9.465339854950245e-06,
|
|
"loss": 1.937776756286621,
|
|
"mean_token_accuracy": 0.5789704568684101,
|
|
"num_tokens": 4323264.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 1.8845683336257935,
|
|
"epoch": 0.10256204803589672,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 9.44847360431776e-06,
|
|
"loss": 1.919915008544922,
|
|
"mean_token_accuracy": 0.5774315193295478,
|
|
"num_tokens": 4394313.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 1.935458205640316,
|
|
"epoch": 0.10416458003645761,
|
|
"grad_norm": 2.9375,
|
|
"learning_rate": 9.431607353685277e-06,
|
|
"loss": 1.9815744400024413,
|
|
"mean_token_accuracy": 0.5703229490667582,
|
|
"num_tokens": 4465024.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 1.8699700206518173,
|
|
"epoch": 0.1057671120370185,
|
|
"grad_norm": 2.84375,
|
|
"learning_rate": 9.414741103052792e-06,
|
|
"loss": 1.9298105239868164,
|
|
"mean_token_accuracy": 0.5819987580180168,
|
|
"num_tokens": 4532056.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 1.9036673031747342,
|
|
"epoch": 0.10736964403757937,
|
|
"grad_norm": 2.71875,
|
|
"learning_rate": 9.397874852420308e-06,
|
|
"loss": 1.9606338500976563,
|
|
"mean_token_accuracy": 0.5763357635587454,
|
|
"num_tokens": 4603061.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 1.9236982017755508,
|
|
"epoch": 0.10897217603814026,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 9.381008601787823e-06,
|
|
"loss": 1.9731718063354493,
|
|
"mean_token_accuracy": 0.572434800863266,
|
|
"num_tokens": 4672934.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 1.8915662527084351,
|
|
"epoch": 0.11057470803870115,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 9.364142351155339e-06,
|
|
"loss": 1.944301223754883,
|
|
"mean_token_accuracy": 0.5777950916439295,
|
|
"num_tokens": 4742347.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 1.8608257569372655,
|
|
"epoch": 0.11217724003926204,
|
|
"grad_norm": 2.9375,
|
|
"learning_rate": 9.347276100522854e-06,
|
|
"loss": 1.9187082290649413,
|
|
"mean_token_accuracy": 0.5854316674172878,
|
|
"num_tokens": 4810740.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 1.91349808126688,
|
|
"epoch": 0.11377977203982292,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 9.33040984989037e-06,
|
|
"loss": 1.9557458877563476,
|
|
"mean_token_accuracy": 0.5716337092220783,
|
|
"num_tokens": 4880950.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 1.880832690000534,
|
|
"epoch": 0.11538230404038381,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 9.313543599257886e-06,
|
|
"loss": 1.9095714569091797,
|
|
"mean_token_accuracy": 0.5788472425192595,
|
|
"num_tokens": 4951319.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 1.8958022996783257,
|
|
"epoch": 0.11698483604094469,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 9.2966773486254e-06,
|
|
"loss": 1.9588214874267578,
|
|
"mean_token_accuracy": 0.5734254062175751,
|
|
"num_tokens": 5021246.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 1.8561491340398788,
|
|
"epoch": 0.11858736804150558,
|
|
"grad_norm": 3.015625,
|
|
"learning_rate": 9.279811097992917e-06,
|
|
"loss": 1.9234004974365235,
|
|
"mean_token_accuracy": 0.5828992377966642,
|
|
"num_tokens": 5090404.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 1.8721059411764145,
|
|
"epoch": 0.12018990004206646,
|
|
"grad_norm": 2.890625,
|
|
"learning_rate": 9.262944847360432e-06,
|
|
"loss": 1.9204557418823243,
|
|
"mean_token_accuracy": 0.5793162997812032,
|
|
"num_tokens": 5161693.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 1.8398379385471344,
|
|
"epoch": 0.12179243204262735,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 9.246078596727948e-06,
|
|
"loss": 1.9257741928100587,
|
|
"mean_token_accuracy": 0.5886994216591119,
|
|
"num_tokens": 5229347.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 1.8623432606458663,
|
|
"epoch": 0.12339496404318824,
|
|
"grad_norm": 2.671875,
|
|
"learning_rate": 9.229212346095464e-06,
|
|
"loss": 1.9316108703613282,
|
|
"mean_token_accuracy": 0.5846644170582295,
|
|
"num_tokens": 5295808.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 1.9330397233366967,
|
|
"epoch": 0.12499749604374913,
|
|
"grad_norm": 2.734375,
|
|
"learning_rate": 9.212346095462979e-06,
|
|
"loss": 2.002008628845215,
|
|
"mean_token_accuracy": 0.572395284473896,
|
|
"num_tokens": 5366468.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 1.9373800560832024,
|
|
"epoch": 0.12660002804431,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 9.195479844830495e-06,
|
|
"loss": 1.9589813232421875,
|
|
"mean_token_accuracy": 0.5738775081932544,
|
|
"num_tokens": 5439525.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 1.7744886934757234,
|
|
"epoch": 0.1282025600448709,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 9.17861359419801e-06,
|
|
"loss": 1.887784194946289,
|
|
"mean_token_accuracy": 0.5975198157131671,
|
|
"num_tokens": 5503717.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 1.8438941523432733,
|
|
"epoch": 0.12980509204543178,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 9.161747343565526e-06,
|
|
"loss": 1.8990644454956054,
|
|
"mean_token_accuracy": 0.5871534280478954,
|
|
"num_tokens": 5571371.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 1.8703908935189246,
|
|
"epoch": 0.13140762404599265,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 9.144881092933042e-06,
|
|
"loss": 1.8979808807373046,
|
|
"mean_token_accuracy": 0.5822482641786337,
|
|
"num_tokens": 5639191.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 1.8991154111921786,
|
|
"epoch": 0.13301015604655356,
|
|
"grad_norm": 2.75,
|
|
"learning_rate": 9.128014842300557e-06,
|
|
"loss": 1.9707365036010742,
|
|
"mean_token_accuracy": 0.5750925965607167,
|
|
"num_tokens": 5710612.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 1.8629533924162387,
|
|
"epoch": 0.13461268804711443,
|
|
"grad_norm": 3.078125,
|
|
"learning_rate": 9.111148591668073e-06,
|
|
"loss": 1.9318613052368163,
|
|
"mean_token_accuracy": 0.5863455723971128,
|
|
"num_tokens": 5778215.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 1.8538881994783878,
|
|
"epoch": 0.13621522004767533,
|
|
"grad_norm": 2.71875,
|
|
"learning_rate": 9.094282341035588e-06,
|
|
"loss": 1.9297039031982421,
|
|
"mean_token_accuracy": 0.5876705326139927,
|
|
"num_tokens": 5844726.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 1.8883967280387879,
|
|
"epoch": 0.1378177520482362,
|
|
"grad_norm": 3.015625,
|
|
"learning_rate": 9.077416090403104e-06,
|
|
"loss": 1.9285591125488282,
|
|
"mean_token_accuracy": 0.581361586973071,
|
|
"num_tokens": 5911163.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 1.9187811121344567,
|
|
"epoch": 0.1394202840487971,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 9.060549839770619e-06,
|
|
"loss": 1.9877191543579102,
|
|
"mean_token_accuracy": 0.5746748749166727,
|
|
"num_tokens": 5983080.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 1.8208863891661167,
|
|
"epoch": 0.14102281604935799,
|
|
"grad_norm": 2.921875,
|
|
"learning_rate": 9.043683589138137e-06,
|
|
"loss": 1.9087957382202148,
|
|
"mean_token_accuracy": 0.5921023800969124,
|
|
"num_tokens": 6048505.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 1.881580389291048,
|
|
"epoch": 0.14262534804991886,
|
|
"grad_norm": 2.703125,
|
|
"learning_rate": 9.026817338505651e-06,
|
|
"loss": 1.9579143524169922,
|
|
"mean_token_accuracy": 0.5844397276639939,
|
|
"num_tokens": 6117893.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 1.8939740881323814,
|
|
"epoch": 0.14422788005047976,
|
|
"grad_norm": 2.640625,
|
|
"learning_rate": 9.009951087873166e-06,
|
|
"loss": 1.9614486694335938,
|
|
"mean_token_accuracy": 0.5774324163794518,
|
|
"num_tokens": 6186567.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 1.9027862668037414,
|
|
"epoch": 0.14583041205104064,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 8.993084837240682e-06,
|
|
"loss": 1.9565067291259766,
|
|
"mean_token_accuracy": 0.5787767164409161,
|
|
"num_tokens": 6255217.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 1.8023764699697495,
|
|
"epoch": 0.14743294405160154,
|
|
"grad_norm": 3.546875,
|
|
"learning_rate": 8.976218586608197e-06,
|
|
"loss": 1.8847948074340821,
|
|
"mean_token_accuracy": 0.591859758272767,
|
|
"num_tokens": 6322616.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 1.8418046914041042,
|
|
"epoch": 0.1490354760521624,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 8.959352335975713e-06,
|
|
"loss": 1.9159833908081054,
|
|
"mean_token_accuracy": 0.5902243491262198,
|
|
"num_tokens": 6388938.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 1.8638654142618178,
|
|
"epoch": 0.15063800805272332,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 8.94248608534323e-06,
|
|
"loss": 1.9090038299560548,
|
|
"mean_token_accuracy": 0.5827893916517496,
|
|
"num_tokens": 6457677.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 1.8738030433654784,
|
|
"epoch": 0.1522405400532842,
|
|
"grad_norm": 2.78125,
|
|
"learning_rate": 8.925619834710744e-06,
|
|
"loss": 1.9343568801879882,
|
|
"mean_token_accuracy": 0.5813350416719913,
|
|
"num_tokens": 6525311.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 1.9377205684781074,
|
|
"epoch": 0.15384307205384506,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 8.90875358407826e-06,
|
|
"loss": 1.9584550857543945,
|
|
"mean_token_accuracy": 0.5714080754667521,
|
|
"num_tokens": 6597450.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 1.8600458979606629,
|
|
"epoch": 0.15544560405440597,
|
|
"grad_norm": 2.75,
|
|
"learning_rate": 8.891887333445775e-06,
|
|
"loss": 1.9290195465087892,
|
|
"mean_token_accuracy": 0.5868209339678288,
|
|
"num_tokens": 6663402.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 1.9053997635841369,
|
|
"epoch": 0.15704813605496684,
|
|
"grad_norm": 3.0,
|
|
"learning_rate": 8.875021082813291e-06,
|
|
"loss": 1.9616933822631837,
|
|
"mean_token_accuracy": 0.5766319941729308,
|
|
"num_tokens": 6731993.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 1.8353831797838212,
|
|
"epoch": 0.15865066805552774,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 8.858154832180806e-06,
|
|
"loss": 1.8858226776123046,
|
|
"mean_token_accuracy": 0.5917053803801536,
|
|
"num_tokens": 6797163.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 1.8678475245833397,
|
|
"epoch": 0.16025320005608862,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 8.841288581548324e-06,
|
|
"loss": 1.9242422103881835,
|
|
"mean_token_accuracy": 0.5828753683716059,
|
|
"num_tokens": 6865343.0,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"entropy": 1.8927664116024971,
|
|
"epoch": 0.1618557320566495,
|
|
"grad_norm": 2.890625,
|
|
"learning_rate": 8.824422330915838e-06,
|
|
"loss": 1.9455862045288086,
|
|
"mean_token_accuracy": 0.5737755268812179,
|
|
"num_tokens": 6936619.0,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"entropy": 1.898373506963253,
|
|
"epoch": 0.1634582640572104,
|
|
"grad_norm": 2.734375,
|
|
"learning_rate": 8.807556080283353e-06,
|
|
"loss": 1.945164108276367,
|
|
"mean_token_accuracy": 0.5796486139297485,
|
|
"num_tokens": 7007010.0,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"entropy": 1.9343734487891198,
|
|
"epoch": 0.16506079605777127,
|
|
"grad_norm": 3.03125,
|
|
"learning_rate": 8.79068982965087e-06,
|
|
"loss": 1.9623563766479493,
|
|
"mean_token_accuracy": 0.5699514087289572,
|
|
"num_tokens": 7078618.0,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"entropy": 1.8613235905766488,
|
|
"epoch": 0.16666332805833217,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 8.773823579018384e-06,
|
|
"loss": 1.9177135467529296,
|
|
"mean_token_accuracy": 0.5824566155672073,
|
|
"num_tokens": 7150683.0,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"entropy": 1.8925682470202445,
|
|
"epoch": 0.16826586005889305,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 8.756957328385902e-06,
|
|
"loss": 1.937409019470215,
|
|
"mean_token_accuracy": 0.5796560771763325,
|
|
"num_tokens": 7219740.0,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"entropy": 1.907762125879526,
|
|
"epoch": 0.16986839205945395,
|
|
"grad_norm": 2.65625,
|
|
"learning_rate": 8.740091077753416e-06,
|
|
"loss": 1.9718206405639649,
|
|
"mean_token_accuracy": 0.5761904675513506,
|
|
"num_tokens": 7291651.0,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"entropy": 1.9134493544697762,
|
|
"epoch": 0.17147092406001482,
|
|
"grad_norm": 2.75,
|
|
"learning_rate": 8.723224827120931e-06,
|
|
"loss": 1.9625492095947266,
|
|
"mean_token_accuracy": 0.5768929973244667,
|
|
"num_tokens": 7361274.0,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"entropy": 1.8504062108695507,
|
|
"epoch": 0.1730734560605757,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 8.706358576488447e-06,
|
|
"loss": 1.9088239669799805,
|
|
"mean_token_accuracy": 0.5906189180910587,
|
|
"num_tokens": 7428468.0,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"entropy": 1.7697254791855812,
|
|
"epoch": 0.1746759880611366,
|
|
"grad_norm": 3.15625,
|
|
"learning_rate": 8.689492325855962e-06,
|
|
"loss": 1.8501579284667968,
|
|
"mean_token_accuracy": 0.6005081288516522,
|
|
"num_tokens": 7493525.0,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"entropy": 1.8452809199690818,
|
|
"epoch": 0.17627852006169747,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 8.672626075223478e-06,
|
|
"loss": 1.8861875534057617,
|
|
"mean_token_accuracy": 0.5867275305092334,
|
|
"num_tokens": 7560512.0,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"entropy": 1.8703631803393364,
|
|
"epoch": 0.17788105206225838,
|
|
"grad_norm": 2.515625,
|
|
"learning_rate": 8.655759824590995e-06,
|
|
"loss": 1.9371749877929687,
|
|
"mean_token_accuracy": 0.5801950611174107,
|
|
"num_tokens": 7628328.0,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"entropy": 1.8785244509577752,
|
|
"epoch": 0.17948358406281925,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 8.63889357395851e-06,
|
|
"loss": 1.9185890197753905,
|
|
"mean_token_accuracy": 0.5809588603675365,
|
|
"num_tokens": 7697279.0,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"entropy": 1.8575244888663291,
|
|
"epoch": 0.18108611606338015,
|
|
"grad_norm": 3.296875,
|
|
"learning_rate": 8.622027323326025e-06,
|
|
"loss": 1.9352190017700195,
|
|
"mean_token_accuracy": 0.5921396233141423,
|
|
"num_tokens": 7762443.0,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"entropy": 1.8575579948723315,
|
|
"epoch": 0.18268864806394103,
|
|
"grad_norm": 2.703125,
|
|
"learning_rate": 8.60516107269354e-06,
|
|
"loss": 1.907987403869629,
|
|
"mean_token_accuracy": 0.5868944473564625,
|
|
"num_tokens": 7828726.0,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"entropy": 1.861622007191181,
|
|
"epoch": 0.1842911800645019,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 8.588294822061056e-06,
|
|
"loss": 1.9466941833496094,
|
|
"mean_token_accuracy": 0.5817751791328192,
|
|
"num_tokens": 7900221.0,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"entropy": 1.8293386019766331,
|
|
"epoch": 0.1858937120650628,
|
|
"grad_norm": 2.84375,
|
|
"learning_rate": 8.571428571428571e-06,
|
|
"loss": 1.910441017150879,
|
|
"mean_token_accuracy": 0.5914882928133011,
|
|
"num_tokens": 7966663.0,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"entropy": 1.8395947359502316,
|
|
"epoch": 0.18749624406562368,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 8.554562320796089e-06,
|
|
"loss": 1.8976837158203126,
|
|
"mean_token_accuracy": 0.5871709201484918,
|
|
"num_tokens": 8033258.0,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"entropy": 1.8713413566350936,
|
|
"epoch": 0.18909877606618458,
|
|
"grad_norm": 2.734375,
|
|
"learning_rate": 8.537696070163604e-06,
|
|
"loss": 1.9238271713256836,
|
|
"mean_token_accuracy": 0.5826620697975159,
|
|
"num_tokens": 8103587.0,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"entropy": 1.8392857059836387,
|
|
"epoch": 0.19070130806674546,
|
|
"grad_norm": 2.703125,
|
|
"learning_rate": 8.52082981953112e-06,
|
|
"loss": 1.8789087295532227,
|
|
"mean_token_accuracy": 0.5865398772060871,
|
|
"num_tokens": 8170084.0,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"entropy": 1.7883897237479687,
|
|
"epoch": 0.19230384006730633,
|
|
"grad_norm": 3.109375,
|
|
"learning_rate": 8.503963568898634e-06,
|
|
"loss": 1.8636220932006835,
|
|
"mean_token_accuracy": 0.594975196197629,
|
|
"num_tokens": 8237006.0,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"entropy": 1.8488180570304393,
|
|
"epoch": 0.19390637206786723,
|
|
"grad_norm": 2.546875,
|
|
"learning_rate": 8.487097318266149e-06,
|
|
"loss": 1.8888103485107421,
|
|
"mean_token_accuracy": 0.5853704828768969,
|
|
"num_tokens": 8307626.0,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"entropy": 1.9011844545602798,
|
|
"epoch": 0.1955089040684281,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 8.470231067633665e-06,
|
|
"loss": 1.9513782501220702,
|
|
"mean_token_accuracy": 0.5754769399762154,
|
|
"num_tokens": 8377805.0,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"entropy": 1.8066915586590766,
|
|
"epoch": 0.197111436068989,
|
|
"grad_norm": 2.828125,
|
|
"learning_rate": 8.453364817001182e-06,
|
|
"loss": 1.8805229187011718,
|
|
"mean_token_accuracy": 0.5928327728062868,
|
|
"num_tokens": 8443983.0,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"entropy": 1.871665959060192,
|
|
"epoch": 0.19871396806954988,
|
|
"grad_norm": 3.25,
|
|
"learning_rate": 8.436498566368698e-06,
|
|
"loss": 1.9741409301757813,
|
|
"mean_token_accuracy": 0.5794212404638529,
|
|
"num_tokens": 8513223.0,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"entropy": 1.865108135342598,
|
|
"epoch": 0.2003165000701108,
|
|
"grad_norm": 2.71875,
|
|
"learning_rate": 8.419632315736212e-06,
|
|
"loss": 1.9343843460083008,
|
|
"mean_token_accuracy": 0.5839380633085967,
|
|
"num_tokens": 8582195.0,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"entropy": 1.8534103907644748,
|
|
"epoch": 0.20191903207067166,
|
|
"grad_norm": 2.890625,
|
|
"learning_rate": 8.402766065103727e-06,
|
|
"loss": 1.9067815780639648,
|
|
"mean_token_accuracy": 0.5907664895057678,
|
|
"num_tokens": 8650209.0,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"entropy": 1.838461622595787,
|
|
"epoch": 0.20352156407123254,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 8.385899814471243e-06,
|
|
"loss": 1.9203620910644532,
|
|
"mean_token_accuracy": 0.5879400692880153,
|
|
"num_tokens": 8717155.0,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"entropy": 1.8598333410918713,
|
|
"epoch": 0.20512409607179344,
|
|
"grad_norm": 3.5,
|
|
"learning_rate": 8.36903356383876e-06,
|
|
"loss": 1.9286680221557617,
|
|
"mean_token_accuracy": 0.5832295440137386,
|
|
"num_tokens": 8787194.0,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"entropy": 1.8951888650655746,
|
|
"epoch": 0.2067266280723543,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 8.352167313206276e-06,
|
|
"loss": 1.9325904846191406,
|
|
"mean_token_accuracy": 0.5815673552453517,
|
|
"num_tokens": 8855366.0,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"entropy": 1.8783101707696914,
|
|
"epoch": 0.20832916007291521,
|
|
"grad_norm": 3.109375,
|
|
"learning_rate": 8.33530106257379e-06,
|
|
"loss": 1.9420047760009767,
|
|
"mean_token_accuracy": 0.5779575191438198,
|
|
"num_tokens": 8923477.0,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"entropy": 1.8716580137610435,
|
|
"epoch": 0.2099316920734761,
|
|
"grad_norm": 2.78125,
|
|
"learning_rate": 8.318434811941307e-06,
|
|
"loss": 1.9265146255493164,
|
|
"mean_token_accuracy": 0.5784675717353821,
|
|
"num_tokens": 8994430.0,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"entropy": 1.845998640358448,
|
|
"epoch": 0.211534224074037,
|
|
"grad_norm": 2.578125,
|
|
"learning_rate": 8.301568561308821e-06,
|
|
"loss": 1.8925792694091796,
|
|
"mean_token_accuracy": 0.5861931763589382,
|
|
"num_tokens": 9063282.0,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"entropy": 1.9150121569633485,
|
|
"epoch": 0.21313675607459787,
|
|
"grad_norm": 2.828125,
|
|
"learning_rate": 8.284702310676336e-06,
|
|
"loss": 1.9562612533569337,
|
|
"mean_token_accuracy": 0.5711025543510914,
|
|
"num_tokens": 9135759.0,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"entropy": 1.8666348904371262,
|
|
"epoch": 0.21473928807515874,
|
|
"grad_norm": 3.09375,
|
|
"learning_rate": 8.267836060043854e-06,
|
|
"loss": 1.926978302001953,
|
|
"mean_token_accuracy": 0.584542565792799,
|
|
"num_tokens": 9203135.0,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"entropy": 1.8651721760630608,
|
|
"epoch": 0.21634182007571964,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 8.250969809411369e-06,
|
|
"loss": 1.9122041702270507,
|
|
"mean_token_accuracy": 0.5834652718156577,
|
|
"num_tokens": 9271143.0,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"entropy": 1.8746020525693894,
|
|
"epoch": 0.21794435207628052,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 8.234103558778885e-06,
|
|
"loss": 1.9327991485595704,
|
|
"mean_token_accuracy": 0.5790342222899199,
|
|
"num_tokens": 9340073.0,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"entropy": 1.8262140899896622,
|
|
"epoch": 0.21954688407684142,
|
|
"grad_norm": 3.109375,
|
|
"learning_rate": 8.2172373081464e-06,
|
|
"loss": 1.8879671096801758,
|
|
"mean_token_accuracy": 0.5903897985816002,
|
|
"num_tokens": 9404239.0,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"entropy": 1.9080289155244827,
|
|
"epoch": 0.2211494160774023,
|
|
"grad_norm": 2.828125,
|
|
"learning_rate": 8.200371057513916e-06,
|
|
"loss": 1.9651382446289063,
|
|
"mean_token_accuracy": 0.5774695828557015,
|
|
"num_tokens": 9474625.0,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"entropy": 1.9039118118584155,
|
|
"epoch": 0.22275194807796317,
|
|
"grad_norm": 2.75,
|
|
"learning_rate": 8.18350480688143e-06,
|
|
"loss": 1.9804235458374024,
|
|
"mean_token_accuracy": 0.5771529369056225,
|
|
"num_tokens": 9543238.0,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"entropy": 1.923792737722397,
|
|
"epoch": 0.22435448007852407,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 8.166638556248947e-06,
|
|
"loss": 1.971097183227539,
|
|
"mean_token_accuracy": 0.5753923650830984,
|
|
"num_tokens": 9614795.0,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"entropy": 1.900741594284773,
|
|
"epoch": 0.22595701207908495,
|
|
"grad_norm": 2.671875,
|
|
"learning_rate": 8.149772305616463e-06,
|
|
"loss": 1.9472780227661133,
|
|
"mean_token_accuracy": 0.5738981295377016,
|
|
"num_tokens": 9685473.0,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"entropy": 1.7839085057377815,
|
|
"epoch": 0.22755954407964585,
|
|
"grad_norm": 3.109375,
|
|
"learning_rate": 8.132906054983978e-06,
|
|
"loss": 1.8761466979980468,
|
|
"mean_token_accuracy": 0.6003258183598519,
|
|
"num_tokens": 9750896.0,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"entropy": 1.8837758690118789,
|
|
"epoch": 0.22916207608020672,
|
|
"grad_norm": 2.671875,
|
|
"learning_rate": 8.116039804351494e-06,
|
|
"loss": 1.9476690292358398,
|
|
"mean_token_accuracy": 0.5777528025209904,
|
|
"num_tokens": 9820689.0,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"entropy": 1.8235812917351724,
|
|
"epoch": 0.23076460808076762,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 8.099173553719009e-06,
|
|
"loss": 1.9014440536499024,
|
|
"mean_token_accuracy": 0.5898288045078516,
|
|
"num_tokens": 9889123.0,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"entropy": 1.8353725761175155,
|
|
"epoch": 0.2323671400813285,
|
|
"grad_norm": 2.921875,
|
|
"learning_rate": 8.082307303086523e-06,
|
|
"loss": 1.9187559127807616,
|
|
"mean_token_accuracy": 0.5885863654315472,
|
|
"num_tokens": 9956951.0,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"entropy": 1.8732848450541497,
|
|
"epoch": 0.23396967208188937,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 8.065441052454041e-06,
|
|
"loss": 1.918014144897461,
|
|
"mean_token_accuracy": 0.582071066647768,
|
|
"num_tokens": 10026782.0,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"entropy": 1.8279739156365395,
|
|
"epoch": 0.23557220408245028,
|
|
"grad_norm": 2.84375,
|
|
"learning_rate": 8.048574801821556e-06,
|
|
"loss": 1.8961336135864257,
|
|
"mean_token_accuracy": 0.5900806449353695,
|
|
"num_tokens": 10092330.0,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"entropy": 1.866368069499731,
|
|
"epoch": 0.23717473608301115,
|
|
"grad_norm": 2.515625,
|
|
"learning_rate": 8.031708551189072e-06,
|
|
"loss": 1.911445426940918,
|
|
"mean_token_accuracy": 0.5842766858637333,
|
|
"num_tokens": 10159870.0,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"entropy": 1.8581906087696551,
|
|
"epoch": 0.23877726808357205,
|
|
"grad_norm": 2.734375,
|
|
"learning_rate": 8.014842300556587e-06,
|
|
"loss": 1.9097118377685547,
|
|
"mean_token_accuracy": 0.5794223874807358,
|
|
"num_tokens": 10228867.0,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"entropy": 1.9131202585995197,
|
|
"epoch": 0.24037980008413293,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 7.997976049924103e-06,
|
|
"loss": 1.9654075622558593,
|
|
"mean_token_accuracy": 0.5745159700512886,
|
|
"num_tokens": 10298784.0,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"entropy": 1.8233014531433582,
|
|
"epoch": 0.24198233208469383,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 7.98110979929162e-06,
|
|
"loss": 1.885025405883789,
|
|
"mean_token_accuracy": 0.5910658553242684,
|
|
"num_tokens": 10367846.0,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"entropy": 1.887587697803974,
|
|
"epoch": 0.2435848640852547,
|
|
"grad_norm": 2.9375,
|
|
"learning_rate": 7.964243548659134e-06,
|
|
"loss": 1.9407854080200195,
|
|
"mean_token_accuracy": 0.5792762577533722,
|
|
"num_tokens": 10436720.0,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"entropy": 1.8616327196359634,
|
|
"epoch": 0.24518739608581558,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 7.94737729802665e-06,
|
|
"loss": 1.9142820358276367,
|
|
"mean_token_accuracy": 0.586741553992033,
|
|
"num_tokens": 10505441.0,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"entropy": 1.8891624853014946,
|
|
"epoch": 0.24678992808637648,
|
|
"grad_norm": 3.140625,
|
|
"learning_rate": 7.930511047394165e-06,
|
|
"loss": 1.9602279663085938,
|
|
"mean_token_accuracy": 0.5789007391780615,
|
|
"num_tokens": 10574984.0,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"entropy": 1.8885827243328095,
|
|
"epoch": 0.24839246008693736,
|
|
"grad_norm": 3.1875,
|
|
"learning_rate": 7.913644796761681e-06,
|
|
"loss": 1.9428186416625977,
|
|
"mean_token_accuracy": 0.5796796213835478,
|
|
"num_tokens": 10642811.0,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"entropy": 1.9047790303826333,
|
|
"epoch": 0.24999499208749826,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 7.896778546129196e-06,
|
|
"loss": 1.9613679885864257,
|
|
"mean_token_accuracy": 0.5768419545143842,
|
|
"num_tokens": 10710253.0,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"entropy": 1.9039989359676839,
|
|
"epoch": 0.25159752408805913,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 7.879912295496712e-06,
|
|
"loss": 1.9505096435546876,
|
|
"mean_token_accuracy": 0.5804939832538366,
|
|
"num_tokens": 10781429.0,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"entropy": 1.84059092476964,
|
|
"epoch": 0.25320005608862,
|
|
"grad_norm": 2.71875,
|
|
"learning_rate": 7.863046044864228e-06,
|
|
"loss": 1.8826757431030274,
|
|
"mean_token_accuracy": 0.5863708309829235,
|
|
"num_tokens": 10850423.0,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"entropy": 1.8954490289092063,
|
|
"epoch": 0.2548025880891809,
|
|
"grad_norm": 2.953125,
|
|
"learning_rate": 7.846179794231743e-06,
|
|
"loss": 1.9409446716308594,
|
|
"mean_token_accuracy": 0.5763602871447802,
|
|
"num_tokens": 10920772.0,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"entropy": 1.8355828106403351,
|
|
"epoch": 0.2564051200897418,
|
|
"grad_norm": 3.3125,
|
|
"learning_rate": 7.829313543599259e-06,
|
|
"loss": 1.8861097335815429,
|
|
"mean_token_accuracy": 0.5863994915038347,
|
|
"num_tokens": 10988848.0,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"entropy": 1.8317218028008937,
|
|
"epoch": 0.2580076520903027,
|
|
"grad_norm": 2.9375,
|
|
"learning_rate": 7.812447292966774e-06,
|
|
"loss": 1.8998790740966798,
|
|
"mean_token_accuracy": 0.5882123652845621,
|
|
"num_tokens": 11056733.0,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"entropy": 1.8588479906320572,
|
|
"epoch": 0.25961018409086356,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 7.79558104233429e-06,
|
|
"loss": 1.9099315643310546,
|
|
"mean_token_accuracy": 0.5861722633242608,
|
|
"num_tokens": 11124887.0,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"entropy": 1.8629890352487564,
|
|
"epoch": 0.26121271609142444,
|
|
"grad_norm": 2.734375,
|
|
"learning_rate": 7.778714791701806e-06,
|
|
"loss": 1.912135696411133,
|
|
"mean_token_accuracy": 0.5804708641022444,
|
|
"num_tokens": 11195170.0,
|
|
"step": 1630
|
|
},
|
|
{
|
|
"entropy": 1.816237111389637,
|
|
"epoch": 0.2628152480919853,
|
|
"grad_norm": 3.546875,
|
|
"learning_rate": 7.761848541069321e-06,
|
|
"loss": 1.8762163162231444,
|
|
"mean_token_accuracy": 0.5928201671689749,
|
|
"num_tokens": 11264229.0,
|
|
"step": 1640
|
|
},
|
|
{
|
|
"entropy": 1.8452992513775826,
|
|
"epoch": 0.26441778009254624,
|
|
"grad_norm": 3.0,
|
|
"learning_rate": 7.744982290436837e-06,
|
|
"loss": 1.906076431274414,
|
|
"mean_token_accuracy": 0.5822683598846197,
|
|
"num_tokens": 11331030.0,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"entropy": 1.8707348950207234,
|
|
"epoch": 0.2660203120931071,
|
|
"grad_norm": 2.640625,
|
|
"learning_rate": 7.728116039804352e-06,
|
|
"loss": 1.9349163055419922,
|
|
"mean_token_accuracy": 0.5821274347603321,
|
|
"num_tokens": 11400398.0,
|
|
"step": 1660
|
|
},
|
|
{
|
|
"entropy": 1.8705995842814445,
|
|
"epoch": 0.267622844093668,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 7.711249789171868e-06,
|
|
"loss": 1.9275938034057618,
|
|
"mean_token_accuracy": 0.5826949592679739,
|
|
"num_tokens": 11470626.0,
|
|
"step": 1670
|
|
},
|
|
{
|
|
"entropy": 1.8418460339307785,
|
|
"epoch": 0.26922537609422886,
|
|
"grad_norm": 2.640625,
|
|
"learning_rate": 7.694383538539383e-06,
|
|
"loss": 1.8914478302001954,
|
|
"mean_token_accuracy": 0.586404300481081,
|
|
"num_tokens": 11538310.0,
|
|
"step": 1680
|
|
},
|
|
{
|
|
"entropy": 1.8754889234900474,
|
|
"epoch": 0.2708279080947898,
|
|
"grad_norm": 2.953125,
|
|
"learning_rate": 7.677517287906899e-06,
|
|
"loss": 1.913292121887207,
|
|
"mean_token_accuracy": 0.5795420207083225,
|
|
"num_tokens": 11608431.0,
|
|
"step": 1690
|
|
},
|
|
{
|
|
"entropy": 1.830224046856165,
|
|
"epoch": 0.27243044009535067,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 7.660651037274415e-06,
|
|
"loss": 1.906071090698242,
|
|
"mean_token_accuracy": 0.5909698359668255,
|
|
"num_tokens": 11674388.0,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"entropy": 1.9046216011047363,
|
|
"epoch": 0.27403297209591154,
|
|
"grad_norm": 2.65625,
|
|
"learning_rate": 7.64378478664193e-06,
|
|
"loss": 1.9777605056762695,
|
|
"mean_token_accuracy": 0.5790138378739357,
|
|
"num_tokens": 11744014.0,
|
|
"step": 1710
|
|
},
|
|
{
|
|
"entropy": 1.868183906376362,
|
|
"epoch": 0.2756355040964724,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 7.626918536009445e-06,
|
|
"loss": 1.9261510848999024,
|
|
"mean_token_accuracy": 0.583817745372653,
|
|
"num_tokens": 11812668.0,
|
|
"step": 1720
|
|
},
|
|
{
|
|
"entropy": 1.8261702857911586,
|
|
"epoch": 0.2772380360970333,
|
|
"grad_norm": 2.9375,
|
|
"learning_rate": 7.610052285376961e-06,
|
|
"loss": 1.908711814880371,
|
|
"mean_token_accuracy": 0.592133792489767,
|
|
"num_tokens": 11879531.0,
|
|
"step": 1730
|
|
},
|
|
{
|
|
"entropy": 1.8486380100250244,
|
|
"epoch": 0.2788405680975942,
|
|
"grad_norm": 2.953125,
|
|
"learning_rate": 7.593186034744477e-06,
|
|
"loss": 1.8812387466430665,
|
|
"mean_token_accuracy": 0.586352600902319,
|
|
"num_tokens": 11947698.0,
|
|
"step": 1740
|
|
},
|
|
{
|
|
"entropy": 1.8807709991931916,
|
|
"epoch": 0.2804431000981551,
|
|
"grad_norm": 2.53125,
|
|
"learning_rate": 7.5763197841119926e-06,
|
|
"loss": 1.9278867721557618,
|
|
"mean_token_accuracy": 0.5796640980988741,
|
|
"num_tokens": 12017344.0,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"entropy": 1.909091053903103,
|
|
"epoch": 0.28204563209871597,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 7.559453533479508e-06,
|
|
"loss": 1.9685272216796874,
|
|
"mean_token_accuracy": 0.5725758314132691,
|
|
"num_tokens": 12088032.0,
|
|
"step": 1760
|
|
},
|
|
{
|
|
"entropy": 1.8329421862959863,
|
|
"epoch": 0.28364816409927684,
|
|
"grad_norm": 3.078125,
|
|
"learning_rate": 7.5425872828470234e-06,
|
|
"loss": 1.8844343185424806,
|
|
"mean_token_accuracy": 0.5897137314081192,
|
|
"num_tokens": 12155663.0,
|
|
"step": 1770
|
|
},
|
|
{
|
|
"entropy": 1.8978062078356743,
|
|
"epoch": 0.2852506960998377,
|
|
"grad_norm": 2.6875,
|
|
"learning_rate": 7.525721032214539e-06,
|
|
"loss": 1.9374212265014648,
|
|
"mean_token_accuracy": 0.5814625948667527,
|
|
"num_tokens": 12226721.0,
|
|
"step": 1780
|
|
},
|
|
{
|
|
"entropy": 1.9012648209929466,
|
|
"epoch": 0.28685322810039865,
|
|
"grad_norm": 2.6875,
|
|
"learning_rate": 7.508854781582054e-06,
|
|
"loss": 1.9738529205322266,
|
|
"mean_token_accuracy": 0.5740793786942959,
|
|
"num_tokens": 12297877.0,
|
|
"step": 1790
|
|
},
|
|
{
|
|
"entropy": 1.7530992463231088,
|
|
"epoch": 0.2884557601009595,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 7.491988530949571e-06,
|
|
"loss": 1.8373693466186523,
|
|
"mean_token_accuracy": 0.6050250265747309,
|
|
"num_tokens": 12362195.0,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"entropy": 1.8632172025740146,
|
|
"epoch": 0.2900582921015204,
|
|
"grad_norm": 2.703125,
|
|
"learning_rate": 7.475122280317086e-06,
|
|
"loss": 1.9394594192504884,
|
|
"mean_token_accuracy": 0.5822290167212486,
|
|
"num_tokens": 12430326.0,
|
|
"step": 1810
|
|
},
|
|
{
|
|
"entropy": 1.8754028275609016,
|
|
"epoch": 0.2916608241020813,
|
|
"grad_norm": 2.703125,
|
|
"learning_rate": 7.4582560296846015e-06,
|
|
"loss": 1.9305736541748046,
|
|
"mean_token_accuracy": 0.5800044223666191,
|
|
"num_tokens": 12499188.0,
|
|
"step": 1820
|
|
},
|
|
{
|
|
"entropy": 1.8500325188040734,
|
|
"epoch": 0.29326335610264215,
|
|
"grad_norm": 2.6875,
|
|
"learning_rate": 7.441389779052117e-06,
|
|
"loss": 1.8774026870727538,
|
|
"mean_token_accuracy": 0.5874969720840454,
|
|
"num_tokens": 12568303.0,
|
|
"step": 1830
|
|
},
|
|
{
|
|
"entropy": 1.8548648901283742,
|
|
"epoch": 0.2948658881032031,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 7.4245235284196324e-06,
|
|
"loss": 1.9144201278686523,
|
|
"mean_token_accuracy": 0.5831612091511488,
|
|
"num_tokens": 12636247.0,
|
|
"step": 1840
|
|
},
|
|
{
|
|
"entropy": 1.8950597792863846,
|
|
"epoch": 0.29646842010376395,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 7.407657277787148e-06,
|
|
"loss": 1.9446081161499023,
|
|
"mean_token_accuracy": 0.5763969462364912,
|
|
"num_tokens": 12705371.0,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"entropy": 1.7729586772620678,
|
|
"epoch": 0.2980709521043248,
|
|
"grad_norm": 2.921875,
|
|
"learning_rate": 7.390791027154664e-06,
|
|
"loss": 1.8617670059204101,
|
|
"mean_token_accuracy": 0.6009736400097608,
|
|
"num_tokens": 12769491.0,
|
|
"step": 1860
|
|
},
|
|
{
|
|
"entropy": 1.8554501563310624,
|
|
"epoch": 0.2996734841048857,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 7.37392477652218e-06,
|
|
"loss": 1.9138887405395508,
|
|
"mean_token_accuracy": 0.584252281486988,
|
|
"num_tokens": 12838699.0,
|
|
"step": 1870
|
|
},
|
|
{
|
|
"entropy": 1.8460036411881446,
|
|
"epoch": 0.30127601610544663,
|
|
"grad_norm": 3.3125,
|
|
"learning_rate": 7.357058525889695e-06,
|
|
"loss": 1.9024799346923829,
|
|
"mean_token_accuracy": 0.588448590785265,
|
|
"num_tokens": 12906506.0,
|
|
"step": 1880
|
|
},
|
|
{
|
|
"entropy": 1.8696325168013572,
|
|
"epoch": 0.3028785481060075,
|
|
"grad_norm": 3.03125,
|
|
"learning_rate": 7.3401922752572105e-06,
|
|
"loss": 1.9234735488891601,
|
|
"mean_token_accuracy": 0.5802949018776417,
|
|
"num_tokens": 12976600.0,
|
|
"step": 1890
|
|
},
|
|
{
|
|
"entropy": 1.8285135440528393,
|
|
"epoch": 0.3044810801065684,
|
|
"grad_norm": 2.9375,
|
|
"learning_rate": 7.323326024624726e-06,
|
|
"loss": 1.900416374206543,
|
|
"mean_token_accuracy": 0.5928496561944485,
|
|
"num_tokens": 13042794.0,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"entropy": 1.8411840848624705,
|
|
"epoch": 0.30608361210712925,
|
|
"grad_norm": 2.65625,
|
|
"learning_rate": 7.3064597739922414e-06,
|
|
"loss": 1.9251216888427733,
|
|
"mean_token_accuracy": 0.5873684994876385,
|
|
"num_tokens": 13109346.0,
|
|
"step": 1910
|
|
},
|
|
{
|
|
"entropy": 1.8464361891150474,
|
|
"epoch": 0.30768614410769013,
|
|
"grad_norm": 2.6875,
|
|
"learning_rate": 7.289593523359758e-06,
|
|
"loss": 1.8957292556762695,
|
|
"mean_token_accuracy": 0.5861016932874918,
|
|
"num_tokens": 13179256.0,
|
|
"step": 1920
|
|
},
|
|
{
|
|
"entropy": 1.8939056366682052,
|
|
"epoch": 0.30928867610825106,
|
|
"grad_norm": 2.828125,
|
|
"learning_rate": 7.272727272727273e-06,
|
|
"loss": 1.9547037124633788,
|
|
"mean_token_accuracy": 0.5808741740882397,
|
|
"num_tokens": 13248340.0,
|
|
"step": 1930
|
|
},
|
|
{
|
|
"entropy": 1.8270376928150653,
|
|
"epoch": 0.31089120810881193,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 7.255861022094789e-06,
|
|
"loss": 1.9034496307373048,
|
|
"mean_token_accuracy": 0.592013492435217,
|
|
"num_tokens": 13314229.0,
|
|
"step": 1940
|
|
},
|
|
{
|
|
"entropy": 1.873492280393839,
|
|
"epoch": 0.3124937401093728,
|
|
"grad_norm": 2.71875,
|
|
"learning_rate": 7.238994771462304e-06,
|
|
"loss": 1.9518108367919922,
|
|
"mean_token_accuracy": 0.5799564849585295,
|
|
"num_tokens": 13384091.0,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"entropy": 1.8474222376942635,
|
|
"epoch": 0.3140962721099337,
|
|
"grad_norm": 2.734375,
|
|
"learning_rate": 7.2221285208298195e-06,
|
|
"loss": 1.9209667205810548,
|
|
"mean_token_accuracy": 0.5850665267556906,
|
|
"num_tokens": 13452310.0,
|
|
"step": 1960
|
|
},
|
|
{
|
|
"entropy": 1.881131139397621,
|
|
"epoch": 0.31569880411049456,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 7.205262270197337e-06,
|
|
"loss": 1.904586410522461,
|
|
"mean_token_accuracy": 0.5779978223145008,
|
|
"num_tokens": 13521281.0,
|
|
"step": 1970
|
|
},
|
|
{
|
|
"entropy": 1.8433863066136837,
|
|
"epoch": 0.3173013361110555,
|
|
"grad_norm": 3.0,
|
|
"learning_rate": 7.188396019564851e-06,
|
|
"loss": 1.9178913116455079,
|
|
"mean_token_accuracy": 0.5882460463792085,
|
|
"num_tokens": 13590196.0,
|
|
"step": 1980
|
|
},
|
|
{
|
|
"entropy": 1.8311151549220086,
|
|
"epoch": 0.31890386811161636,
|
|
"grad_norm": 3.15625,
|
|
"learning_rate": 7.171529768932367e-06,
|
|
"loss": 1.9058528900146485,
|
|
"mean_token_accuracy": 0.5885777480900287,
|
|
"num_tokens": 13656542.0,
|
|
"step": 1990
|
|
},
|
|
{
|
|
"entropy": 1.8787899039685727,
|
|
"epoch": 0.32050640011217724,
|
|
"grad_norm": 2.921875,
|
|
"learning_rate": 7.154663518299882e-06,
|
|
"loss": 1.9221023559570312,
|
|
"mean_token_accuracy": 0.5850845731794834,
|
|
"num_tokens": 13725850.0,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"entropy": 1.8783811405301094,
|
|
"epoch": 0.3221089321127381,
|
|
"grad_norm": 3.296875,
|
|
"learning_rate": 7.137797267667398e-06,
|
|
"loss": 1.9362503051757813,
|
|
"mean_token_accuracy": 0.5805343955755233,
|
|
"num_tokens": 13794498.0,
|
|
"step": 2010
|
|
},
|
|
{
|
|
"entropy": 1.8898996517062188,
|
|
"epoch": 0.323711464113299,
|
|
"grad_norm": 2.84375,
|
|
"learning_rate": 7.120931017034913e-06,
|
|
"loss": 1.9480035781860352,
|
|
"mean_token_accuracy": 0.5791302386671304,
|
|
"num_tokens": 13864359.0,
|
|
"step": 2020
|
|
},
|
|
{
|
|
"entropy": 1.7916542790830134,
|
|
"epoch": 0.3253139961138599,
|
|
"grad_norm": 2.953125,
|
|
"learning_rate": 7.10406476640243e-06,
|
|
"loss": 1.8486898422241211,
|
|
"mean_token_accuracy": 0.5971706237643957,
|
|
"num_tokens": 13931370.0,
|
|
"step": 2030
|
|
},
|
|
{
|
|
"entropy": 1.865858867764473,
|
|
"epoch": 0.3269165281144208,
|
|
"grad_norm": 2.640625,
|
|
"learning_rate": 7.087198515769945e-06,
|
|
"loss": 1.9063629150390624,
|
|
"mean_token_accuracy": 0.5809760253876448,
|
|
"num_tokens": 14000913.0,
|
|
"step": 2040
|
|
},
|
|
{
|
|
"entropy": 1.8851099610328674,
|
|
"epoch": 0.32851906011498166,
|
|
"grad_norm": 3.03125,
|
|
"learning_rate": 7.07033226513746e-06,
|
|
"loss": 1.938603401184082,
|
|
"mean_token_accuracy": 0.5784780897200108,
|
|
"num_tokens": 14069557.0,
|
|
"step": 2050
|
|
},
|
|
{
|
|
"entropy": 1.9176052078604697,
|
|
"epoch": 0.33012159211554254,
|
|
"grad_norm": 2.703125,
|
|
"learning_rate": 7.053466014504976e-06,
|
|
"loss": 1.9561405181884766,
|
|
"mean_token_accuracy": 0.5729512359946967,
|
|
"num_tokens": 14141660.0,
|
|
"step": 2060
|
|
},
|
|
{
|
|
"entropy": 1.8795430816709995,
|
|
"epoch": 0.33172412411610347,
|
|
"grad_norm": 2.609375,
|
|
"learning_rate": 7.036599763872491e-06,
|
|
"loss": 1.930160140991211,
|
|
"mean_token_accuracy": 0.5816898390650749,
|
|
"num_tokens": 14209466.0,
|
|
"step": 2070
|
|
},
|
|
{
|
|
"entropy": 1.8757113859057426,
|
|
"epoch": 0.33332665611666434,
|
|
"grad_norm": 3.4375,
|
|
"learning_rate": 7.019733513240007e-06,
|
|
"loss": 1.9418207168579102,
|
|
"mean_token_accuracy": 0.5815501570701599,
|
|
"num_tokens": 14279109.0,
|
|
"step": 2080
|
|
},
|
|
{
|
|
"entropy": 1.9274300292134285,
|
|
"epoch": 0.3349291881172252,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 7.002867262607524e-06,
|
|
"loss": 1.9555702209472656,
|
|
"mean_token_accuracy": 0.5733671579509974,
|
|
"num_tokens": 14351031.0,
|
|
"step": 2090
|
|
},
|
|
{
|
|
"entropy": 1.8100173577666283,
|
|
"epoch": 0.3365317201177861,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 6.986001011975039e-06,
|
|
"loss": 1.868393325805664,
|
|
"mean_token_accuracy": 0.5990545708686114,
|
|
"num_tokens": 14415016.0,
|
|
"step": 2100
|
|
},
|
|
{
|
|
"entropy": 1.8206559799611568,
|
|
"epoch": 0.33813425211834697,
|
|
"grad_norm": 2.75,
|
|
"learning_rate": 6.969134761342554e-06,
|
|
"loss": 1.8662199020385741,
|
|
"mean_token_accuracy": 0.5882071249186993,
|
|
"num_tokens": 14483513.0,
|
|
"step": 2110
|
|
},
|
|
{
|
|
"entropy": 1.8442789621651172,
|
|
"epoch": 0.3397367841189079,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 6.952268510710069e-06,
|
|
"loss": 1.9212806701660157,
|
|
"mean_token_accuracy": 0.5897382352501154,
|
|
"num_tokens": 14550786.0,
|
|
"step": 2120
|
|
},
|
|
{
|
|
"entropy": 1.833724681288004,
|
|
"epoch": 0.34133931611946877,
|
|
"grad_norm": 3.140625,
|
|
"learning_rate": 6.935402260077585e-06,
|
|
"loss": 1.8911985397338866,
|
|
"mean_token_accuracy": 0.5906524024903774,
|
|
"num_tokens": 14619432.0,
|
|
"step": 2130
|
|
},
|
|
{
|
|
"entropy": 1.8132789947092534,
|
|
"epoch": 0.34294184812002965,
|
|
"grad_norm": 2.75,
|
|
"learning_rate": 6.9185360094451e-06,
|
|
"loss": 1.9041032791137695,
|
|
"mean_token_accuracy": 0.5969481058418751,
|
|
"num_tokens": 14684677.0,
|
|
"step": 2140
|
|
},
|
|
{
|
|
"entropy": 1.875623344630003,
|
|
"epoch": 0.3445443801205905,
|
|
"grad_norm": 3.09375,
|
|
"learning_rate": 6.901669758812617e-06,
|
|
"loss": 1.931635856628418,
|
|
"mean_token_accuracy": 0.5816898342221976,
|
|
"num_tokens": 14753856.0,
|
|
"step": 2150
|
|
},
|
|
{
|
|
"entropy": 1.9176507964730263,
|
|
"epoch": 0.3461469121211514,
|
|
"grad_norm": 3.03125,
|
|
"learning_rate": 6.884803508180133e-06,
|
|
"loss": 1.970164680480957,
|
|
"mean_token_accuracy": 0.5698140971362591,
|
|
"num_tokens": 14829029.0,
|
|
"step": 2160
|
|
},
|
|
{
|
|
"entropy": 1.867189484834671,
|
|
"epoch": 0.3477494441217123,
|
|
"grad_norm": 2.671875,
|
|
"learning_rate": 6.867937257547647e-06,
|
|
"loss": 1.9144952774047852,
|
|
"mean_token_accuracy": 0.5880186032503844,
|
|
"num_tokens": 14896701.0,
|
|
"step": 2170
|
|
},
|
|
{
|
|
"entropy": 1.8927301332354545,
|
|
"epoch": 0.3493519761222732,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 6.851071006915163e-06,
|
|
"loss": 1.9222103118896485,
|
|
"mean_token_accuracy": 0.5790928430855274,
|
|
"num_tokens": 14969268.0,
|
|
"step": 2180
|
|
},
|
|
{
|
|
"entropy": 1.863588874042034,
|
|
"epoch": 0.3509545081228341,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 6.834204756282678e-06,
|
|
"loss": 1.9339506149291992,
|
|
"mean_token_accuracy": 0.5797934107482433,
|
|
"num_tokens": 15037697.0,
|
|
"step": 2190
|
|
},
|
|
{
|
|
"entropy": 1.8574811123311519,
|
|
"epoch": 0.35255704012339495,
|
|
"grad_norm": 3.265625,
|
|
"learning_rate": 6.817338505650195e-06,
|
|
"loss": 1.9404556274414062,
|
|
"mean_token_accuracy": 0.5782970868051052,
|
|
"num_tokens": 15108557.0,
|
|
"step": 2200
|
|
},
|
|
{
|
|
"entropy": 1.8824990913271904,
|
|
"epoch": 0.3541595721239558,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 6.800472255017711e-06,
|
|
"loss": 1.9320140838623048,
|
|
"mean_token_accuracy": 0.5829423192888499,
|
|
"num_tokens": 15177520.0,
|
|
"step": 2210
|
|
},
|
|
{
|
|
"entropy": 1.8936009645462035,
|
|
"epoch": 0.35576210412451675,
|
|
"grad_norm": 3.015625,
|
|
"learning_rate": 6.783606004385226e-06,
|
|
"loss": 1.9541767120361329,
|
|
"mean_token_accuracy": 0.5792703408747911,
|
|
"num_tokens": 15250167.0,
|
|
"step": 2220
|
|
},
|
|
{
|
|
"entropy": 1.858391472697258,
|
|
"epoch": 0.35736463612507763,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 6.766739753752741e-06,
|
|
"loss": 1.9123594284057617,
|
|
"mean_token_accuracy": 0.5811858758330345,
|
|
"num_tokens": 15319761.0,
|
|
"step": 2230
|
|
},
|
|
{
|
|
"entropy": 1.825581496208906,
|
|
"epoch": 0.3589671681256385,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 6.749873503120256e-06,
|
|
"loss": 1.8857872009277343,
|
|
"mean_token_accuracy": 0.5892566710710525,
|
|
"num_tokens": 15386569.0,
|
|
"step": 2240
|
|
},
|
|
{
|
|
"entropy": 1.8254388399422168,
|
|
"epoch": 0.3605697001261994,
|
|
"grad_norm": 2.828125,
|
|
"learning_rate": 6.733007252487772e-06,
|
|
"loss": 1.8876169204711915,
|
|
"mean_token_accuracy": 0.5917335107922554,
|
|
"num_tokens": 15452970.0,
|
|
"step": 2250
|
|
},
|
|
{
|
|
"entropy": 1.834766410291195,
|
|
"epoch": 0.3621722321267603,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 6.716141001855289e-06,
|
|
"loss": 1.8933477401733398,
|
|
"mean_token_accuracy": 0.5864639330655337,
|
|
"num_tokens": 15522607.0,
|
|
"step": 2260
|
|
},
|
|
{
|
|
"entropy": 1.861782355606556,
|
|
"epoch": 0.3637747641273212,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 6.699274751222804e-06,
|
|
"loss": 1.945047378540039,
|
|
"mean_token_accuracy": 0.5846532471477985,
|
|
"num_tokens": 15592431.0,
|
|
"step": 2270
|
|
},
|
|
{
|
|
"entropy": 1.8507339976727963,
|
|
"epoch": 0.36537729612788206,
|
|
"grad_norm": 2.9375,
|
|
"learning_rate": 6.68240850059032e-06,
|
|
"loss": 1.8829397201538085,
|
|
"mean_token_accuracy": 0.5838924575597048,
|
|
"num_tokens": 15660961.0,
|
|
"step": 2280
|
|
},
|
|
{
|
|
"entropy": 1.8665653564035893,
|
|
"epoch": 0.36697982812844293,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 6.665542249957835e-06,
|
|
"loss": 1.9256706237792969,
|
|
"mean_token_accuracy": 0.5818109232932329,
|
|
"num_tokens": 15732019.0,
|
|
"step": 2290
|
|
},
|
|
{
|
|
"entropy": 1.8203022845089436,
|
|
"epoch": 0.3685823601290038,
|
|
"grad_norm": 2.9375,
|
|
"learning_rate": 6.64867599932535e-06,
|
|
"loss": 1.8997062683105468,
|
|
"mean_token_accuracy": 0.5923520758748054,
|
|
"num_tokens": 15799902.0,
|
|
"step": 2300
|
|
},
|
|
{
|
|
"entropy": 1.7739195488393307,
|
|
"epoch": 0.37018489212956474,
|
|
"grad_norm": 2.609375,
|
|
"learning_rate": 6.631809748692865e-06,
|
|
"loss": 1.8644765853881835,
|
|
"mean_token_accuracy": 0.6021988991647959,
|
|
"num_tokens": 15864613.0,
|
|
"step": 2310
|
|
},
|
|
{
|
|
"entropy": 1.8488979011774063,
|
|
"epoch": 0.3717874241301256,
|
|
"grad_norm": 2.78125,
|
|
"learning_rate": 6.6149434980603824e-06,
|
|
"loss": 1.8930198669433593,
|
|
"mean_token_accuracy": 0.5810744848102332,
|
|
"num_tokens": 15932591.0,
|
|
"step": 2320
|
|
},
|
|
{
|
|
"entropy": 1.832446900755167,
|
|
"epoch": 0.3733899561306865,
|
|
"grad_norm": 3.421875,
|
|
"learning_rate": 6.598077247427898e-06,
|
|
"loss": 1.9018989562988282,
|
|
"mean_token_accuracy": 0.5864586193114519,
|
|
"num_tokens": 16001143.0,
|
|
"step": 2330
|
|
},
|
|
{
|
|
"entropy": 1.825374136865139,
|
|
"epoch": 0.37499248813124736,
|
|
"grad_norm": 3.4375,
|
|
"learning_rate": 6.581210996795413e-06,
|
|
"loss": 1.8895555496215821,
|
|
"mean_token_accuracy": 0.5906005047261715,
|
|
"num_tokens": 16069332.0,
|
|
"step": 2340
|
|
},
|
|
{
|
|
"entropy": 1.8373838283121586,
|
|
"epoch": 0.37659502013180823,
|
|
"grad_norm": 2.921875,
|
|
"learning_rate": 6.564344746162929e-06,
|
|
"loss": 1.924220085144043,
|
|
"mean_token_accuracy": 0.5885270729660987,
|
|
"num_tokens": 16135459.0,
|
|
"step": 2350
|
|
},
|
|
{
|
|
"entropy": 1.863863729685545,
|
|
"epoch": 0.37819755213236916,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 6.547478495530443e-06,
|
|
"loss": 1.9460079193115234,
|
|
"mean_token_accuracy": 0.5869121756404638,
|
|
"num_tokens": 16202998.0,
|
|
"step": 2360
|
|
},
|
|
{
|
|
"entropy": 1.89323253557086,
|
|
"epoch": 0.37980008413293004,
|
|
"grad_norm": 2.6875,
|
|
"learning_rate": 6.530612244897959e-06,
|
|
"loss": 1.929962158203125,
|
|
"mean_token_accuracy": 0.5782414205372334,
|
|
"num_tokens": 16271840.0,
|
|
"step": 2370
|
|
},
|
|
{
|
|
"entropy": 1.8196432545781136,
|
|
"epoch": 0.3814026161334909,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 6.513745994265476e-06,
|
|
"loss": 1.861398696899414,
|
|
"mean_token_accuracy": 0.5919506680220366,
|
|
"num_tokens": 16338327.0,
|
|
"step": 2380
|
|
},
|
|
{
|
|
"entropy": 1.8163256019353866,
|
|
"epoch": 0.3830051481340518,
|
|
"grad_norm": 2.671875,
|
|
"learning_rate": 6.4968797436329914e-06,
|
|
"loss": 1.8722827911376954,
|
|
"mean_token_accuracy": 0.5892269656062126,
|
|
"num_tokens": 16404422.0,
|
|
"step": 2390
|
|
},
|
|
{
|
|
"entropy": 1.8725082725286484,
|
|
"epoch": 0.38460768013461266,
|
|
"grad_norm": 3.140625,
|
|
"learning_rate": 6.480013493000507e-06,
|
|
"loss": 1.9314796447753906,
|
|
"mean_token_accuracy": 0.5786304190754891,
|
|
"num_tokens": 16474783.0,
|
|
"step": 2400
|
|
},
|
|
{
|
|
"entropy": 1.780524667352438,
|
|
"epoch": 0.3862102121351736,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 6.463147242368022e-06,
|
|
"loss": 1.8242341995239257,
|
|
"mean_token_accuracy": 0.6014976523816585,
|
|
"num_tokens": 16538442.0,
|
|
"step": 2410
|
|
},
|
|
{
|
|
"entropy": 1.8381457321345807,
|
|
"epoch": 0.38781274413573447,
|
|
"grad_norm": 3.109375,
|
|
"learning_rate": 6.446280991735537e-06,
|
|
"loss": 1.9019351959228517,
|
|
"mean_token_accuracy": 0.5861563563346863,
|
|
"num_tokens": 16604392.0,
|
|
"step": 2420
|
|
},
|
|
{
|
|
"entropy": 1.862081041932106,
|
|
"epoch": 0.38941527613629534,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 6.429414741103054e-06,
|
|
"loss": 1.9009132385253906,
|
|
"mean_token_accuracy": 0.5874000541865826,
|
|
"num_tokens": 16672112.0,
|
|
"step": 2430
|
|
},
|
|
{
|
|
"entropy": 1.8587382271885873,
|
|
"epoch": 0.3910178081368562,
|
|
"grad_norm": 2.65625,
|
|
"learning_rate": 6.4125484904705695e-06,
|
|
"loss": 1.895541000366211,
|
|
"mean_token_accuracy": 0.5839630082249642,
|
|
"num_tokens": 16741056.0,
|
|
"step": 2440
|
|
},
|
|
{
|
|
"entropy": 1.8325805217027664,
|
|
"epoch": 0.39262034013741715,
|
|
"grad_norm": 3.109375,
|
|
"learning_rate": 6.395682239838085e-06,
|
|
"loss": 1.9115198135375977,
|
|
"mean_token_accuracy": 0.5885306518524885,
|
|
"num_tokens": 16807450.0,
|
|
"step": 2450
|
|
},
|
|
{
|
|
"entropy": 1.9020752415060997,
|
|
"epoch": 0.394222872137978,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 6.3788159892056e-06,
|
|
"loss": 1.9247831344604491,
|
|
"mean_token_accuracy": 0.5807623241096735,
|
|
"num_tokens": 16874716.0,
|
|
"step": 2460
|
|
},
|
|
{
|
|
"entropy": 1.824447751790285,
|
|
"epoch": 0.3958254041385389,
|
|
"grad_norm": 3.40625,
|
|
"learning_rate": 6.361949738573116e-06,
|
|
"loss": 1.9011926651000977,
|
|
"mean_token_accuracy": 0.5913017760962248,
|
|
"num_tokens": 16940753.0,
|
|
"step": 2470
|
|
},
|
|
{
|
|
"entropy": 1.8734217897057532,
|
|
"epoch": 0.39742793613909977,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 6.345083487940631e-06,
|
|
"loss": 1.9072031021118163,
|
|
"mean_token_accuracy": 0.5824517548084259,
|
|
"num_tokens": 17011670.0,
|
|
"step": 2480
|
|
},
|
|
{
|
|
"entropy": 1.882775531709194,
|
|
"epoch": 0.39903046813966064,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 6.328217237308148e-06,
|
|
"loss": 1.9223293304443358,
|
|
"mean_token_accuracy": 0.5763808127492667,
|
|
"num_tokens": 17081373.0,
|
|
"step": 2490
|
|
},
|
|
{
|
|
"entropy": 1.8312932297587394,
|
|
"epoch": 0.4006330001402216,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 6.311350986675663e-06,
|
|
"loss": 1.8834392547607421,
|
|
"mean_token_accuracy": 0.5890156481415033,
|
|
"num_tokens": 17148423.0,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"entropy": 1.8463823966681958,
|
|
"epoch": 0.40223553214078245,
|
|
"grad_norm": 3.109375,
|
|
"learning_rate": 6.2944847360431785e-06,
|
|
"loss": 1.8855321884155274,
|
|
"mean_token_accuracy": 0.5882707864046097,
|
|
"num_tokens": 17215730.0,
|
|
"step": 2510
|
|
},
|
|
{
|
|
"entropy": 1.8465096279978752,
|
|
"epoch": 0.4038380641413433,
|
|
"grad_norm": 2.78125,
|
|
"learning_rate": 6.277618485410694e-06,
|
|
"loss": 1.9089530944824218,
|
|
"mean_token_accuracy": 0.5890189308673144,
|
|
"num_tokens": 17283905.0,
|
|
"step": 2520
|
|
},
|
|
{
|
|
"entropy": 1.789325623959303,
|
|
"epoch": 0.4054405961419042,
|
|
"grad_norm": 2.703125,
|
|
"learning_rate": 6.260752234778209e-06,
|
|
"loss": 1.8789407730102539,
|
|
"mean_token_accuracy": 0.6008992414921522,
|
|
"num_tokens": 17347380.0,
|
|
"step": 2530
|
|
},
|
|
{
|
|
"entropy": 1.9213061038404704,
|
|
"epoch": 0.40704312814246507,
|
|
"grad_norm": 2.640625,
|
|
"learning_rate": 6.243885984145725e-06,
|
|
"loss": 1.9735231399536133,
|
|
"mean_token_accuracy": 0.5743049286305905,
|
|
"num_tokens": 17419874.0,
|
|
"step": 2540
|
|
},
|
|
{
|
|
"entropy": 1.8554375410079955,
|
|
"epoch": 0.408645660143026,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 6.227019733513241e-06,
|
|
"loss": 1.9063846588134765,
|
|
"mean_token_accuracy": 0.5845744274556637,
|
|
"num_tokens": 17489879.0,
|
|
"step": 2550
|
|
},
|
|
{
|
|
"entropy": 1.8458185702562333,
|
|
"epoch": 0.4102481921435869,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 6.210153482880757e-06,
|
|
"loss": 1.8916229248046874,
|
|
"mean_token_accuracy": 0.586842879652977,
|
|
"num_tokens": 17557261.0,
|
|
"step": 2560
|
|
},
|
|
{
|
|
"entropy": 1.8558879360556602,
|
|
"epoch": 0.41185072414414775,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 6.193287232248272e-06,
|
|
"loss": 1.9234607696533204,
|
|
"mean_token_accuracy": 0.5813111860305071,
|
|
"num_tokens": 17625792.0,
|
|
"step": 2570
|
|
},
|
|
{
|
|
"entropy": 1.8427653566002846,
|
|
"epoch": 0.4134532561447086,
|
|
"grad_norm": 3.171875,
|
|
"learning_rate": 6.1764209816157875e-06,
|
|
"loss": 1.912209701538086,
|
|
"mean_token_accuracy": 0.588098294660449,
|
|
"num_tokens": 17693209.0,
|
|
"step": 2580
|
|
},
|
|
{
|
|
"entropy": 1.80966489687562,
|
|
"epoch": 0.4150557881452695,
|
|
"grad_norm": 2.65625,
|
|
"learning_rate": 6.159554730983303e-06,
|
|
"loss": 1.8694408416748047,
|
|
"mean_token_accuracy": 0.5923740215599537,
|
|
"num_tokens": 17761999.0,
|
|
"step": 2590
|
|
},
|
|
{
|
|
"entropy": 1.8303676053881646,
|
|
"epoch": 0.41665832014583043,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 6.142688480350818e-06,
|
|
"loss": 1.9028659820556642,
|
|
"mean_token_accuracy": 0.5906838051974773,
|
|
"num_tokens": 17830724.0,
|
|
"step": 2600
|
|
},
|
|
{
|
|
"entropy": 1.9149459421634674,
|
|
"epoch": 0.4182608521463913,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 6.125822229718335e-06,
|
|
"loss": 1.96752872467041,
|
|
"mean_token_accuracy": 0.574995793774724,
|
|
"num_tokens": 17900433.0,
|
|
"step": 2610
|
|
},
|
|
{
|
|
"entropy": 1.808657655864954,
|
|
"epoch": 0.4198633841469522,
|
|
"grad_norm": 3.125,
|
|
"learning_rate": 6.10895597908585e-06,
|
|
"loss": 1.8747655868530273,
|
|
"mean_token_accuracy": 0.5923097655177116,
|
|
"num_tokens": 17967759.0,
|
|
"step": 2620
|
|
},
|
|
{
|
|
"entropy": 1.8198106482625007,
|
|
"epoch": 0.42146591614751305,
|
|
"grad_norm": 3.0,
|
|
"learning_rate": 6.092089728453366e-06,
|
|
"loss": 1.8572179794311523,
|
|
"mean_token_accuracy": 0.5907534711062908,
|
|
"num_tokens": 18033433.0,
|
|
"step": 2630
|
|
},
|
|
{
|
|
"entropy": 1.8586710482835769,
|
|
"epoch": 0.423068448148074,
|
|
"grad_norm": 2.59375,
|
|
"learning_rate": 6.075223477820881e-06,
|
|
"loss": 1.925465202331543,
|
|
"mean_token_accuracy": 0.5850045710802079,
|
|
"num_tokens": 18102813.0,
|
|
"step": 2640
|
|
},
|
|
{
|
|
"entropy": 1.8994694516062736,
|
|
"epoch": 0.42467098014863486,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 6.0583572271883965e-06,
|
|
"loss": 1.9421836853027343,
|
|
"mean_token_accuracy": 0.574908834323287,
|
|
"num_tokens": 18175905.0,
|
|
"step": 2650
|
|
},
|
|
{
|
|
"entropy": 1.8027544744312762,
|
|
"epoch": 0.42627351214919573,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 6.041490976555913e-06,
|
|
"loss": 1.8755990982055664,
|
|
"mean_token_accuracy": 0.5987543936818838,
|
|
"num_tokens": 18242701.0,
|
|
"step": 2660
|
|
},
|
|
{
|
|
"entropy": 1.8242316350340844,
|
|
"epoch": 0.4278760441497566,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 6.024624725923428e-06,
|
|
"loss": 1.9025865554809571,
|
|
"mean_token_accuracy": 0.5926646631211042,
|
|
"num_tokens": 18309115.0,
|
|
"step": 2670
|
|
},
|
|
{
|
|
"entropy": 1.8555085845291615,
|
|
"epoch": 0.4294785761503175,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 6.007758475290944e-06,
|
|
"loss": 1.9329267501831056,
|
|
"mean_token_accuracy": 0.5813577599823475,
|
|
"num_tokens": 18380520.0,
|
|
"step": 2680
|
|
},
|
|
{
|
|
"entropy": 1.8312315061688422,
|
|
"epoch": 0.4310811081508784,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 5.990892224658459e-06,
|
|
"loss": 1.9179895401000977,
|
|
"mean_token_accuracy": 0.5868359692394733,
|
|
"num_tokens": 18449662.0,
|
|
"step": 2690
|
|
},
|
|
{
|
|
"entropy": 1.862812553346157,
|
|
"epoch": 0.4326836401514393,
|
|
"grad_norm": 2.78125,
|
|
"learning_rate": 5.9740259740259746e-06,
|
|
"loss": 1.912089729309082,
|
|
"mean_token_accuracy": 0.5835570193827152,
|
|
"num_tokens": 18517870.0,
|
|
"step": 2700
|
|
},
|
|
{
|
|
"entropy": 1.8445881478488446,
|
|
"epoch": 0.43428617215200016,
|
|
"grad_norm": 3.15625,
|
|
"learning_rate": 5.95715972339349e-06,
|
|
"loss": 1.9296016693115234,
|
|
"mean_token_accuracy": 0.5899791497737169,
|
|
"num_tokens": 18585466.0,
|
|
"step": 2710
|
|
},
|
|
{
|
|
"entropy": 1.8312980830669403,
|
|
"epoch": 0.43588870415256104,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 5.940293472761006e-06,
|
|
"loss": 1.8721866607666016,
|
|
"mean_token_accuracy": 0.5901631616055966,
|
|
"num_tokens": 18650210.0,
|
|
"step": 2720
|
|
},
|
|
{
|
|
"entropy": 1.810354943573475,
|
|
"epoch": 0.4374912361531219,
|
|
"grad_norm": 3.09375,
|
|
"learning_rate": 5.923427222128522e-06,
|
|
"loss": 1.848921775817871,
|
|
"mean_token_accuracy": 0.5946807909756899,
|
|
"num_tokens": 18714978.0,
|
|
"step": 2730
|
|
},
|
|
{
|
|
"entropy": 1.882994955778122,
|
|
"epoch": 0.43909376815368284,
|
|
"grad_norm": 2.9375,
|
|
"learning_rate": 5.906560971496037e-06,
|
|
"loss": 1.9537870407104492,
|
|
"mean_token_accuracy": 0.5792578358203173,
|
|
"num_tokens": 18782585.0,
|
|
"step": 2740
|
|
},
|
|
{
|
|
"entropy": 1.881935852020979,
|
|
"epoch": 0.4406963001542437,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 5.889694720863553e-06,
|
|
"loss": 1.927790069580078,
|
|
"mean_token_accuracy": 0.5773686055094004,
|
|
"num_tokens": 18852965.0,
|
|
"step": 2750
|
|
},
|
|
{
|
|
"entropy": 1.8925419092178344,
|
|
"epoch": 0.4422988321548046,
|
|
"grad_norm": 2.921875,
|
|
"learning_rate": 5.872828470231068e-06,
|
|
"loss": 1.942881202697754,
|
|
"mean_token_accuracy": 0.5796595361083746,
|
|
"num_tokens": 18921226.0,
|
|
"step": 2760
|
|
},
|
|
{
|
|
"entropy": 1.7830379381775856,
|
|
"epoch": 0.44390136415536546,
|
|
"grad_norm": 2.890625,
|
|
"learning_rate": 5.8559622195985836e-06,
|
|
"loss": 1.8563718795776367,
|
|
"mean_token_accuracy": 0.596837505698204,
|
|
"num_tokens": 18986799.0,
|
|
"step": 2770
|
|
},
|
|
{
|
|
"entropy": 1.8433029428124428,
|
|
"epoch": 0.44550389615592634,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 5.8390959689661e-06,
|
|
"loss": 1.911284828186035,
|
|
"mean_token_accuracy": 0.5852627001702786,
|
|
"num_tokens": 19056284.0,
|
|
"step": 2780
|
|
},
|
|
{
|
|
"entropy": 1.9118391960859298,
|
|
"epoch": 0.44710642815648727,
|
|
"grad_norm": 2.84375,
|
|
"learning_rate": 5.822229718333615e-06,
|
|
"loss": 1.9613269805908202,
|
|
"mean_token_accuracy": 0.5728709891438484,
|
|
"num_tokens": 19127350.0,
|
|
"step": 2790
|
|
},
|
|
{
|
|
"entropy": 1.8576175361871718,
|
|
"epoch": 0.44870896015704814,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 5.805363467701131e-06,
|
|
"loss": 1.891185188293457,
|
|
"mean_token_accuracy": 0.5836143758147955,
|
|
"num_tokens": 19199605.0,
|
|
"step": 2800
|
|
},
|
|
{
|
|
"entropy": 1.8335268676280976,
|
|
"epoch": 0.450311492157609,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 5.788497217068646e-06,
|
|
"loss": 1.8964523315429687,
|
|
"mean_token_accuracy": 0.591438103839755,
|
|
"num_tokens": 19269442.0,
|
|
"step": 2810
|
|
},
|
|
{
|
|
"entropy": 1.865811436623335,
|
|
"epoch": 0.4519140241581699,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 5.771630966436162e-06,
|
|
"loss": 1.9232105255126952,
|
|
"mean_token_accuracy": 0.5796146471053362,
|
|
"num_tokens": 19338371.0,
|
|
"step": 2820
|
|
},
|
|
{
|
|
"entropy": 1.8866727635264398,
|
|
"epoch": 0.4535165561587308,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 5.754764715803677e-06,
|
|
"loss": 1.9480762481689453,
|
|
"mean_token_accuracy": 0.5735677890479565,
|
|
"num_tokens": 19407321.0,
|
|
"step": 2830
|
|
},
|
|
{
|
|
"entropy": 1.8429814919829368,
|
|
"epoch": 0.4551190881592917,
|
|
"grad_norm": 2.78125,
|
|
"learning_rate": 5.737898465171193e-06,
|
|
"loss": 1.9041376113891602,
|
|
"mean_token_accuracy": 0.586334315687418,
|
|
"num_tokens": 19476059.0,
|
|
"step": 2840
|
|
},
|
|
{
|
|
"entropy": 1.857156838476658,
|
|
"epoch": 0.45672162015985257,
|
|
"grad_norm": 3.15625,
|
|
"learning_rate": 5.721032214538709e-06,
|
|
"loss": 1.915693473815918,
|
|
"mean_token_accuracy": 0.5839728847146034,
|
|
"num_tokens": 19544213.0,
|
|
"step": 2850
|
|
},
|
|
{
|
|
"entropy": 1.864296567440033,
|
|
"epoch": 0.45832415216041344,
|
|
"grad_norm": 2.78125,
|
|
"learning_rate": 5.704165963906224e-06,
|
|
"loss": 1.905698585510254,
|
|
"mean_token_accuracy": 0.5868626192212105,
|
|
"num_tokens": 19611371.0,
|
|
"step": 2860
|
|
},
|
|
{
|
|
"entropy": 1.8460254110395908,
|
|
"epoch": 0.4599266841609743,
|
|
"grad_norm": 2.953125,
|
|
"learning_rate": 5.68729971327374e-06,
|
|
"loss": 1.905874252319336,
|
|
"mean_token_accuracy": 0.584000188484788,
|
|
"num_tokens": 19680184.0,
|
|
"step": 2870
|
|
},
|
|
{
|
|
"entropy": 1.8271512754261494,
|
|
"epoch": 0.46152921616153525,
|
|
"grad_norm": 2.734375,
|
|
"learning_rate": 5.670433462641255e-06,
|
|
"loss": 1.9141311645507812,
|
|
"mean_token_accuracy": 0.5897762086242437,
|
|
"num_tokens": 19749348.0,
|
|
"step": 2880
|
|
},
|
|
{
|
|
"entropy": 1.889108157157898,
|
|
"epoch": 0.4631317481620961,
|
|
"grad_norm": 2.828125,
|
|
"learning_rate": 5.6535672120087715e-06,
|
|
"loss": 1.9251979827880858,
|
|
"mean_token_accuracy": 0.5813889559358358,
|
|
"num_tokens": 19820299.0,
|
|
"step": 2890
|
|
},
|
|
{
|
|
"entropy": 1.8363960474729537,
|
|
"epoch": 0.464734280162657,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 5.636700961376287e-06,
|
|
"loss": 1.8978172302246095,
|
|
"mean_token_accuracy": 0.5845275580883026,
|
|
"num_tokens": 19887799.0,
|
|
"step": 2900
|
|
},
|
|
{
|
|
"entropy": 1.877197700738907,
|
|
"epoch": 0.4663368121632179,
|
|
"grad_norm": 2.921875,
|
|
"learning_rate": 5.619834710743802e-06,
|
|
"loss": 1.9254043579101563,
|
|
"mean_token_accuracy": 0.581829895451665,
|
|
"num_tokens": 19956245.0,
|
|
"step": 2910
|
|
},
|
|
{
|
|
"entropy": 1.845394493639469,
|
|
"epoch": 0.46793934416377875,
|
|
"grad_norm": 2.71875,
|
|
"learning_rate": 5.602968460111318e-06,
|
|
"loss": 1.9196294784545898,
|
|
"mean_token_accuracy": 0.590549175068736,
|
|
"num_tokens": 20023326.0,
|
|
"step": 2920
|
|
},
|
|
{
|
|
"entropy": 1.8792662344872952,
|
|
"epoch": 0.4695418761643397,
|
|
"grad_norm": 3.15625,
|
|
"learning_rate": 5.586102209478833e-06,
|
|
"loss": 1.9388086318969726,
|
|
"mean_token_accuracy": 0.5791543461382389,
|
|
"num_tokens": 20094220.0,
|
|
"step": 2930
|
|
},
|
|
{
|
|
"entropy": 1.8718859672546386,
|
|
"epoch": 0.47114440816490055,
|
|
"grad_norm": 2.84375,
|
|
"learning_rate": 5.569235958846349e-06,
|
|
"loss": 1.9154325485229493,
|
|
"mean_token_accuracy": 0.5803413491696119,
|
|
"num_tokens": 20163723.0,
|
|
"step": 2940
|
|
},
|
|
{
|
|
"entropy": 1.9110450595617294,
|
|
"epoch": 0.4727469401654614,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 5.552369708213865e-06,
|
|
"loss": 1.9459632873535155,
|
|
"mean_token_accuracy": 0.5762019760906696,
|
|
"num_tokens": 20235101.0,
|
|
"step": 2950
|
|
},
|
|
{
|
|
"entropy": 1.8887835063040257,
|
|
"epoch": 0.4743494721660223,
|
|
"grad_norm": 2.78125,
|
|
"learning_rate": 5.5355034575813805e-06,
|
|
"loss": 1.9171342849731445,
|
|
"mean_token_accuracy": 0.5793264780193568,
|
|
"num_tokens": 20304564.0,
|
|
"step": 2960
|
|
},
|
|
{
|
|
"entropy": 1.9018400639295578,
|
|
"epoch": 0.4759520041665832,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 5.518637206948896e-06,
|
|
"loss": 1.9300537109375,
|
|
"mean_token_accuracy": 0.5778403412550688,
|
|
"num_tokens": 20373203.0,
|
|
"step": 2970
|
|
},
|
|
{
|
|
"entropy": 1.7895628839731217,
|
|
"epoch": 0.4775545361671441,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 5.501770956316411e-06,
|
|
"loss": 1.8884479522705078,
|
|
"mean_token_accuracy": 0.5980903979390859,
|
|
"num_tokens": 20437375.0,
|
|
"step": 2980
|
|
},
|
|
{
|
|
"entropy": 1.8900270894169808,
|
|
"epoch": 0.479157068167705,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 5.484904705683927e-06,
|
|
"loss": 1.931725311279297,
|
|
"mean_token_accuracy": 0.57785121537745,
|
|
"num_tokens": 20504799.0,
|
|
"step": 2990
|
|
},
|
|
{
|
|
"entropy": 1.8562400430440902,
|
|
"epoch": 0.48075960016826585,
|
|
"grad_norm": 2.921875,
|
|
"learning_rate": 5.468038455051442e-06,
|
|
"loss": 1.9025707244873047,
|
|
"mean_token_accuracy": 0.5844077534973622,
|
|
"num_tokens": 20575140.0,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"entropy": 1.8393971025943756,
|
|
"epoch": 0.48236213216882673,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 5.4511722044189586e-06,
|
|
"loss": 1.8763370513916016,
|
|
"mean_token_accuracy": 0.5868513479828834,
|
|
"num_tokens": 20642816.0,
|
|
"step": 3010
|
|
},
|
|
{
|
|
"entropy": 1.8503380201756954,
|
|
"epoch": 0.48396466416938766,
|
|
"grad_norm": 2.953125,
|
|
"learning_rate": 5.434305953786474e-06,
|
|
"loss": 1.927678108215332,
|
|
"mean_token_accuracy": 0.5839967612177134,
|
|
"num_tokens": 20713553.0,
|
|
"step": 3020
|
|
},
|
|
{
|
|
"entropy": 1.8344844073057174,
|
|
"epoch": 0.48556719616994853,
|
|
"grad_norm": 2.578125,
|
|
"learning_rate": 5.4174397031539895e-06,
|
|
"loss": 1.885507583618164,
|
|
"mean_token_accuracy": 0.5878067553043366,
|
|
"num_tokens": 20783309.0,
|
|
"step": 3030
|
|
},
|
|
{
|
|
"entropy": 1.8160213552415372,
|
|
"epoch": 0.4871697281705094,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 5.400573452521505e-06,
|
|
"loss": 1.8787452697753906,
|
|
"mean_token_accuracy": 0.5898300107568503,
|
|
"num_tokens": 20850485.0,
|
|
"step": 3040
|
|
},
|
|
{
|
|
"entropy": 1.8818404108285904,
|
|
"epoch": 0.4887722601710703,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 5.38370720188902e-06,
|
|
"loss": 1.9195350646972655,
|
|
"mean_token_accuracy": 0.5788391418755054,
|
|
"num_tokens": 20920923.0,
|
|
"step": 3050
|
|
},
|
|
{
|
|
"entropy": 1.8369183473289012,
|
|
"epoch": 0.49037479217163116,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 5.366840951256536e-06,
|
|
"loss": 1.9277904510498047,
|
|
"mean_token_accuracy": 0.5910786610096693,
|
|
"num_tokens": 20989809.0,
|
|
"step": 3060
|
|
},
|
|
{
|
|
"entropy": 1.7957973316311837,
|
|
"epoch": 0.4919773241721921,
|
|
"grad_norm": 2.671875,
|
|
"learning_rate": 5.349974700624052e-06,
|
|
"loss": 1.828994369506836,
|
|
"mean_token_accuracy": 0.5928265832364559,
|
|
"num_tokens": 21055057.0,
|
|
"step": 3070
|
|
},
|
|
{
|
|
"entropy": 1.8879523053765297,
|
|
"epoch": 0.49357985617275296,
|
|
"grad_norm": 2.921875,
|
|
"learning_rate": 5.3331084499915675e-06,
|
|
"loss": 1.9327852249145507,
|
|
"mean_token_accuracy": 0.5796903323382139,
|
|
"num_tokens": 21123165.0,
|
|
"step": 3080
|
|
},
|
|
{
|
|
"entropy": 1.900216892361641,
|
|
"epoch": 0.49518238817331384,
|
|
"grad_norm": 2.890625,
|
|
"learning_rate": 5.316242199359083e-06,
|
|
"loss": 1.9367078781127929,
|
|
"mean_token_accuracy": 0.5748460162431002,
|
|
"num_tokens": 21192984.0,
|
|
"step": 3090
|
|
},
|
|
{
|
|
"entropy": 1.9121940307319165,
|
|
"epoch": 0.4967849201738747,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 5.2993759487265984e-06,
|
|
"loss": 1.9564058303833007,
|
|
"mean_token_accuracy": 0.577494065463543,
|
|
"num_tokens": 21262418.0,
|
|
"step": 3100
|
|
},
|
|
{
|
|
"entropy": 1.7955867640674115,
|
|
"epoch": 0.4983874521744356,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 5.282509698094114e-06,
|
|
"loss": 1.848398780822754,
|
|
"mean_token_accuracy": 0.5978333078324795,
|
|
"num_tokens": 21327925.0,
|
|
"step": 3110
|
|
},
|
|
{
|
|
"entropy": 1.8336094319820404,
|
|
"epoch": 0.4999899841749965,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 5.26564344746163e-06,
|
|
"loss": 1.8984619140625,
|
|
"mean_token_accuracy": 0.5879204269498587,
|
|
"num_tokens": 21393942.0,
|
|
"step": 3120
|
|
},
|
|
{
|
|
"entropy": 1.8322543017566204,
|
|
"epoch": 0.5015925161755573,
|
|
"grad_norm": 2.734375,
|
|
"learning_rate": 5.248777196829146e-06,
|
|
"loss": 1.8764625549316407,
|
|
"mean_token_accuracy": 0.5878861173987389,
|
|
"num_tokens": 21462106.0,
|
|
"step": 3130
|
|
},
|
|
{
|
|
"entropy": 1.7941844053566456,
|
|
"epoch": 0.5031950481761183,
|
|
"grad_norm": 3.15625,
|
|
"learning_rate": 5.231910946196661e-06,
|
|
"loss": 1.8972002029418946,
|
|
"mean_token_accuracy": 0.592497718334198,
|
|
"num_tokens": 21529516.0,
|
|
"step": 3140
|
|
},
|
|
{
|
|
"entropy": 1.8582370266318322,
|
|
"epoch": 0.5047975801766792,
|
|
"grad_norm": 2.609375,
|
|
"learning_rate": 5.2150446955641765e-06,
|
|
"loss": 1.9111324310302735,
|
|
"mean_token_accuracy": 0.5843363590538502,
|
|
"num_tokens": 21599252.0,
|
|
"step": 3150
|
|
},
|
|
{
|
|
"entropy": 1.830164335668087,
|
|
"epoch": 0.50640011217724,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 5.198178444931692e-06,
|
|
"loss": 1.8945926666259765,
|
|
"mean_token_accuracy": 0.5922736659646034,
|
|
"num_tokens": 21665924.0,
|
|
"step": 3160
|
|
},
|
|
{
|
|
"entropy": 1.9132280111312867,
|
|
"epoch": 0.5080026441778009,
|
|
"grad_norm": 2.953125,
|
|
"learning_rate": 5.1813121942992074e-06,
|
|
"loss": 1.9597476959228515,
|
|
"mean_token_accuracy": 0.5744776498526335,
|
|
"num_tokens": 21739563.0,
|
|
"step": 3170
|
|
},
|
|
{
|
|
"entropy": 1.8639399752020835,
|
|
"epoch": 0.5096051761783618,
|
|
"grad_norm": 3.078125,
|
|
"learning_rate": 5.164445943666724e-06,
|
|
"loss": 1.920318031311035,
|
|
"mean_token_accuracy": 0.5860882043838501,
|
|
"num_tokens": 21809001.0,
|
|
"step": 3180
|
|
},
|
|
{
|
|
"entropy": 1.8148264288902283,
|
|
"epoch": 0.5112077081789227,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 5.147579693034239e-06,
|
|
"loss": 1.8659805297851562,
|
|
"mean_token_accuracy": 0.5945463448762893,
|
|
"num_tokens": 21875311.0,
|
|
"step": 3190
|
|
},
|
|
{
|
|
"entropy": 1.7990412935614586,
|
|
"epoch": 0.5128102401794836,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 5.130713442401755e-06,
|
|
"loss": 1.865718460083008,
|
|
"mean_token_accuracy": 0.5927905708551406,
|
|
"num_tokens": 21941984.0,
|
|
"step": 3200
|
|
},
|
|
{
|
|
"entropy": 1.859583093225956,
|
|
"epoch": 0.5144127721800444,
|
|
"grad_norm": 3.140625,
|
|
"learning_rate": 5.11384719176927e-06,
|
|
"loss": 1.9168724060058593,
|
|
"mean_token_accuracy": 0.5831061247736216,
|
|
"num_tokens": 22010341.0,
|
|
"step": 3210
|
|
},
|
|
{
|
|
"entropy": 1.8411869630217552,
|
|
"epoch": 0.5160153041806054,
|
|
"grad_norm": 3.09375,
|
|
"learning_rate": 5.0969809411367855e-06,
|
|
"loss": 1.9032838821411133,
|
|
"mean_token_accuracy": 0.5862697619944811,
|
|
"num_tokens": 22078255.0,
|
|
"step": 3220
|
|
},
|
|
{
|
|
"entropy": 1.8429126217961311,
|
|
"epoch": 0.5176178361811662,
|
|
"grad_norm": 2.6875,
|
|
"learning_rate": 5.080114690504301e-06,
|
|
"loss": 1.8853023529052735,
|
|
"mean_token_accuracy": 0.5895553410053254,
|
|
"num_tokens": 22145488.0,
|
|
"step": 3230
|
|
},
|
|
{
|
|
"entropy": 1.885491119325161,
|
|
"epoch": 0.5192203681817271,
|
|
"grad_norm": 3.109375,
|
|
"learning_rate": 5.063248439871817e-06,
|
|
"loss": 1.9154699325561524,
|
|
"mean_token_accuracy": 0.5776723183691501,
|
|
"num_tokens": 22215282.0,
|
|
"step": 3240
|
|
},
|
|
{
|
|
"entropy": 1.8708842188119887,
|
|
"epoch": 0.520822900182288,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 5.046382189239333e-06,
|
|
"loss": 1.9112281799316406,
|
|
"mean_token_accuracy": 0.5818539954721927,
|
|
"num_tokens": 22282862.0,
|
|
"step": 3250
|
|
},
|
|
{
|
|
"entropy": 1.8231175325810909,
|
|
"epoch": 0.5224254321828489,
|
|
"grad_norm": 2.53125,
|
|
"learning_rate": 5.029515938606848e-06,
|
|
"loss": 1.8751091003417968,
|
|
"mean_token_accuracy": 0.5905714184045792,
|
|
"num_tokens": 22350290.0,
|
|
"step": 3260
|
|
},
|
|
{
|
|
"entropy": 1.8113183729350566,
|
|
"epoch": 0.5240279641834098,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 5.012649687974364e-06,
|
|
"loss": 1.897282600402832,
|
|
"mean_token_accuracy": 0.5939208552241325,
|
|
"num_tokens": 22417435.0,
|
|
"step": 3270
|
|
},
|
|
{
|
|
"entropy": 1.8155881494283677,
|
|
"epoch": 0.5256304961839706,
|
|
"grad_norm": 2.734375,
|
|
"learning_rate": 4.99578343734188e-06,
|
|
"loss": 1.8791780471801758,
|
|
"mean_token_accuracy": 0.5893838539719581,
|
|
"num_tokens": 22486402.0,
|
|
"step": 3280
|
|
},
|
|
{
|
|
"entropy": 1.903946729004383,
|
|
"epoch": 0.5272330281845315,
|
|
"grad_norm": 2.703125,
|
|
"learning_rate": 4.978917186709395e-06,
|
|
"loss": 1.9404390335083008,
|
|
"mean_token_accuracy": 0.5766887858510017,
|
|
"num_tokens": 22556511.0,
|
|
"step": 3290
|
|
},
|
|
{
|
|
"entropy": 1.8609099626541137,
|
|
"epoch": 0.5288355601850925,
|
|
"grad_norm": 2.59375,
|
|
"learning_rate": 4.96205093607691e-06,
|
|
"loss": 1.9064706802368163,
|
|
"mean_token_accuracy": 0.5823613096028566,
|
|
"num_tokens": 22625934.0,
|
|
"step": 3300
|
|
},
|
|
{
|
|
"entropy": 1.8036007642745973,
|
|
"epoch": 0.5304380921856533,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 4.945184685444426e-06,
|
|
"loss": 1.8651018142700195,
|
|
"mean_token_accuracy": 0.5906497817486525,
|
|
"num_tokens": 22695222.0,
|
|
"step": 3310
|
|
},
|
|
{
|
|
"entropy": 1.8944967277348042,
|
|
"epoch": 0.5320406241862142,
|
|
"grad_norm": 2.828125,
|
|
"learning_rate": 4.928318434811942e-06,
|
|
"loss": 1.9579627990722657,
|
|
"mean_token_accuracy": 0.5770516272634267,
|
|
"num_tokens": 22764978.0,
|
|
"step": 3320
|
|
},
|
|
{
|
|
"entropy": 1.827626084536314,
|
|
"epoch": 0.5336431561867752,
|
|
"grad_norm": 2.890625,
|
|
"learning_rate": 4.911452184179457e-06,
|
|
"loss": 1.8864225387573241,
|
|
"mean_token_accuracy": 0.5910983499139547,
|
|
"num_tokens": 22831462.0,
|
|
"step": 3330
|
|
},
|
|
{
|
|
"entropy": 1.8530403889715672,
|
|
"epoch": 0.535245688187336,
|
|
"grad_norm": 3.09375,
|
|
"learning_rate": 4.8945859335469734e-06,
|
|
"loss": 1.893623161315918,
|
|
"mean_token_accuracy": 0.5863074962049722,
|
|
"num_tokens": 22902702.0,
|
|
"step": 3340
|
|
},
|
|
{
|
|
"entropy": 1.8771760039031506,
|
|
"epoch": 0.5368482201878969,
|
|
"grad_norm": 3.15625,
|
|
"learning_rate": 4.877719682914489e-06,
|
|
"loss": 1.9317413330078126,
|
|
"mean_token_accuracy": 0.5844787560403347,
|
|
"num_tokens": 22972838.0,
|
|
"step": 3350
|
|
},
|
|
{
|
|
"entropy": 1.8093865230679511,
|
|
"epoch": 0.5384507521884577,
|
|
"grad_norm": 3.125,
|
|
"learning_rate": 4.8608534322820035e-06,
|
|
"loss": 1.8382366180419922,
|
|
"mean_token_accuracy": 0.5946755729615688,
|
|
"num_tokens": 23039852.0,
|
|
"step": 3360
|
|
},
|
|
{
|
|
"entropy": 1.8227481991052628,
|
|
"epoch": 0.5400532841890187,
|
|
"grad_norm": 2.71875,
|
|
"learning_rate": 4.84398718164952e-06,
|
|
"loss": 1.8795154571533204,
|
|
"mean_token_accuracy": 0.5877833373844623,
|
|
"num_tokens": 23109196.0,
|
|
"step": 3370
|
|
},
|
|
{
|
|
"entropy": 1.7931410901248455,
|
|
"epoch": 0.5416558161895796,
|
|
"grad_norm": 3.15625,
|
|
"learning_rate": 4.827120931017035e-06,
|
|
"loss": 1.8591276168823243,
|
|
"mean_token_accuracy": 0.5954682864248753,
|
|
"num_tokens": 23174720.0,
|
|
"step": 3380
|
|
},
|
|
{
|
|
"entropy": 1.810715451091528,
|
|
"epoch": 0.5432583481901404,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 4.810254680384551e-06,
|
|
"loss": 1.884342575073242,
|
|
"mean_token_accuracy": 0.5896463751792907,
|
|
"num_tokens": 23241017.0,
|
|
"step": 3390
|
|
},
|
|
{
|
|
"entropy": 1.8730248123407365,
|
|
"epoch": 0.5448608801907013,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 4.793388429752067e-06,
|
|
"loss": 1.9179431915283203,
|
|
"mean_token_accuracy": 0.5850767388939857,
|
|
"num_tokens": 23309999.0,
|
|
"step": 3400
|
|
},
|
|
{
|
|
"entropy": 1.8814474999904633,
|
|
"epoch": 0.5464634121912622,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 4.7765221791195824e-06,
|
|
"loss": 1.9308740615844726,
|
|
"mean_token_accuracy": 0.5797040991485118,
|
|
"num_tokens": 23380827.0,
|
|
"step": 3410
|
|
},
|
|
{
|
|
"entropy": 1.8731833666563034,
|
|
"epoch": 0.5480659441918231,
|
|
"grad_norm": 2.703125,
|
|
"learning_rate": 4.759655928487097e-06,
|
|
"loss": 1.937031364440918,
|
|
"mean_token_accuracy": 0.5782224997878075,
|
|
"num_tokens": 23450401.0,
|
|
"step": 3420
|
|
},
|
|
{
|
|
"entropy": 1.8374334543943405,
|
|
"epoch": 0.549668476192384,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 4.742789677854613e-06,
|
|
"loss": 1.8725309371948242,
|
|
"mean_token_accuracy": 0.58929248675704,
|
|
"num_tokens": 23517968.0,
|
|
"step": 3430
|
|
},
|
|
{
|
|
"entropy": 1.888993863761425,
|
|
"epoch": 0.5512710081929448,
|
|
"grad_norm": 3.0,
|
|
"learning_rate": 4.725923427222129e-06,
|
|
"loss": 1.9277978897094727,
|
|
"mean_token_accuracy": 0.5754599675536156,
|
|
"num_tokens": 23589020.0,
|
|
"step": 3440
|
|
},
|
|
{
|
|
"entropy": 1.8315568715333939,
|
|
"epoch": 0.5528735401935058,
|
|
"grad_norm": 2.734375,
|
|
"learning_rate": 4.709057176589644e-06,
|
|
"loss": 1.8970975875854492,
|
|
"mean_token_accuracy": 0.5894832197576761,
|
|
"num_tokens": 23655586.0,
|
|
"step": 3450
|
|
},
|
|
{
|
|
"entropy": 1.8086498454213142,
|
|
"epoch": 0.5544760721940666,
|
|
"grad_norm": 3.171875,
|
|
"learning_rate": 4.6921909259571605e-06,
|
|
"loss": 1.8923715591430663,
|
|
"mean_token_accuracy": 0.5938830282539129,
|
|
"num_tokens": 23721568.0,
|
|
"step": 3460
|
|
},
|
|
{
|
|
"entropy": 1.8702815189957618,
|
|
"epoch": 0.5560786041946275,
|
|
"grad_norm": 2.734375,
|
|
"learning_rate": 4.675324675324676e-06,
|
|
"loss": 1.912058448791504,
|
|
"mean_token_accuracy": 0.5766608223319054,
|
|
"num_tokens": 23792474.0,
|
|
"step": 3470
|
|
},
|
|
{
|
|
"entropy": 1.8467231094837189,
|
|
"epoch": 0.5576811361951884,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 4.658458424692191e-06,
|
|
"loss": 1.9086189270019531,
|
|
"mean_token_accuracy": 0.5887116767466068,
|
|
"num_tokens": 23857874.0,
|
|
"step": 3480
|
|
},
|
|
{
|
|
"entropy": 1.8486532710492611,
|
|
"epoch": 0.5592836681957493,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 4.641592174059707e-06,
|
|
"loss": 1.8958675384521484,
|
|
"mean_token_accuracy": 0.5825589634478092,
|
|
"num_tokens": 23927414.0,
|
|
"step": 3490
|
|
},
|
|
{
|
|
"entropy": 1.8610327310860157,
|
|
"epoch": 0.5608862001963102,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 4.624725923427222e-06,
|
|
"loss": 1.9029279708862306,
|
|
"mean_token_accuracy": 0.5831367287784814,
|
|
"num_tokens": 23995081.0,
|
|
"step": 3500
|
|
},
|
|
{
|
|
"entropy": 1.8732392929494381,
|
|
"epoch": 0.562488732196871,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 4.607859672794739e-06,
|
|
"loss": 1.9352720260620118,
|
|
"mean_token_accuracy": 0.5802403304725885,
|
|
"num_tokens": 24064995.0,
|
|
"step": 3510
|
|
},
|
|
{
|
|
"entropy": 1.8747488550841809,
|
|
"epoch": 0.5640912641974319,
|
|
"grad_norm": 2.9375,
|
|
"learning_rate": 4.590993422162254e-06,
|
|
"loss": 1.9249692916870118,
|
|
"mean_token_accuracy": 0.5802885986864567,
|
|
"num_tokens": 24137888.0,
|
|
"step": 3520
|
|
},
|
|
{
|
|
"entropy": 1.8377225518226623,
|
|
"epoch": 0.5656937961979929,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 4.5741271715297695e-06,
|
|
"loss": 1.8629825592041016,
|
|
"mean_token_accuracy": 0.587927145510912,
|
|
"num_tokens": 24205350.0,
|
|
"step": 3530
|
|
},
|
|
{
|
|
"entropy": 1.862581817060709,
|
|
"epoch": 0.5672963281985537,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 4.557260920897285e-06,
|
|
"loss": 1.933199119567871,
|
|
"mean_token_accuracy": 0.5822917714715004,
|
|
"num_tokens": 24274637.0,
|
|
"step": 3540
|
|
},
|
|
{
|
|
"entropy": 1.8414349660277367,
|
|
"epoch": 0.5688988601991146,
|
|
"grad_norm": 2.953125,
|
|
"learning_rate": 4.5403946702648e-06,
|
|
"loss": 1.8869396209716798,
|
|
"mean_token_accuracy": 0.5826878268271685,
|
|
"num_tokens": 24343142.0,
|
|
"step": 3550
|
|
},
|
|
{
|
|
"entropy": 1.8475224629044533,
|
|
"epoch": 0.5705013921996754,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 4.523528419632316e-06,
|
|
"loss": 1.9176437377929687,
|
|
"mean_token_accuracy": 0.5875023037195206,
|
|
"num_tokens": 24409182.0,
|
|
"step": 3560
|
|
},
|
|
{
|
|
"entropy": 1.8767376720905304,
|
|
"epoch": 0.5721039242002364,
|
|
"grad_norm": 2.953125,
|
|
"learning_rate": 4.506662168999832e-06,
|
|
"loss": 1.9157390594482422,
|
|
"mean_token_accuracy": 0.5804454453289509,
|
|
"num_tokens": 24478294.0,
|
|
"step": 3570
|
|
},
|
|
{
|
|
"entropy": 1.8539368592202663,
|
|
"epoch": 0.5737064562007973,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 4.489795918367348e-06,
|
|
"loss": 1.9065256118774414,
|
|
"mean_token_accuracy": 0.5849509820342064,
|
|
"num_tokens": 24547908.0,
|
|
"step": 3580
|
|
},
|
|
{
|
|
"entropy": 1.8835485830903054,
|
|
"epoch": 0.5753089882013581,
|
|
"grad_norm": 2.890625,
|
|
"learning_rate": 4.472929667734863e-06,
|
|
"loss": 1.9412755966186523,
|
|
"mean_token_accuracy": 0.5793763112276793,
|
|
"num_tokens": 24618029.0,
|
|
"step": 3590
|
|
},
|
|
{
|
|
"entropy": 1.869025533646345,
|
|
"epoch": 0.576911520201919,
|
|
"grad_norm": 3.0,
|
|
"learning_rate": 4.4560634171023785e-06,
|
|
"loss": 1.913435935974121,
|
|
"mean_token_accuracy": 0.5836379799991847,
|
|
"num_tokens": 24686681.0,
|
|
"step": 3600
|
|
},
|
|
{
|
|
"entropy": 1.832342056185007,
|
|
"epoch": 0.5785140522024799,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 4.439197166469894e-06,
|
|
"loss": 1.8887754440307618,
|
|
"mean_token_accuracy": 0.5894854720681906,
|
|
"num_tokens": 24754343.0,
|
|
"step": 3610
|
|
},
|
|
{
|
|
"entropy": 1.8395591847598554,
|
|
"epoch": 0.5801165842030408,
|
|
"grad_norm": 2.9375,
|
|
"learning_rate": 4.422330915837409e-06,
|
|
"loss": 1.9002063751220704,
|
|
"mean_token_accuracy": 0.5841349400579929,
|
|
"num_tokens": 24822232.0,
|
|
"step": 3620
|
|
},
|
|
{
|
|
"entropy": 1.8473046600818634,
|
|
"epoch": 0.5817191162036017,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 4.405464665204926e-06,
|
|
"loss": 1.9122318267822265,
|
|
"mean_token_accuracy": 0.5860261067748069,
|
|
"num_tokens": 24891946.0,
|
|
"step": 3630
|
|
},
|
|
{
|
|
"entropy": 1.8386360064148903,
|
|
"epoch": 0.5833216482041625,
|
|
"grad_norm": 2.734375,
|
|
"learning_rate": 4.388598414572441e-06,
|
|
"loss": 1.8892175674438476,
|
|
"mean_token_accuracy": 0.5868268880993128,
|
|
"num_tokens": 24957974.0,
|
|
"step": 3640
|
|
},
|
|
{
|
|
"entropy": 1.8272941276431083,
|
|
"epoch": 0.5849241802047235,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 4.371732163939957e-06,
|
|
"loss": 1.8862226486206055,
|
|
"mean_token_accuracy": 0.5928803119808436,
|
|
"num_tokens": 25024594.0,
|
|
"step": 3650
|
|
},
|
|
{
|
|
"entropy": 1.8759762145578862,
|
|
"epoch": 0.5865267122052843,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 4.354865913307472e-06,
|
|
"loss": 1.931888961791992,
|
|
"mean_token_accuracy": 0.5769379314035177,
|
|
"num_tokens": 25094620.0,
|
|
"step": 3660
|
|
},
|
|
{
|
|
"entropy": 1.8491356074810028,
|
|
"epoch": 0.5881292442058452,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 4.3379996626749875e-06,
|
|
"loss": 1.914997673034668,
|
|
"mean_token_accuracy": 0.5848333861678838,
|
|
"num_tokens": 25164112.0,
|
|
"step": 3670
|
|
},
|
|
{
|
|
"entropy": 1.8535669289529324,
|
|
"epoch": 0.5897317762064062,
|
|
"grad_norm": 2.921875,
|
|
"learning_rate": 4.321133412042503e-06,
|
|
"loss": 1.9279930114746093,
|
|
"mean_token_accuracy": 0.5833786878734827,
|
|
"num_tokens": 25233582.0,
|
|
"step": 3680
|
|
},
|
|
{
|
|
"entropy": 1.8587990984320641,
|
|
"epoch": 0.591334308206967,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 4.304267161410019e-06,
|
|
"loss": 1.9063568115234375,
|
|
"mean_token_accuracy": 0.580756638199091,
|
|
"num_tokens": 25304298.0,
|
|
"step": 3690
|
|
},
|
|
{
|
|
"entropy": 1.847524681687355,
|
|
"epoch": 0.5929368402075279,
|
|
"grad_norm": 2.6875,
|
|
"learning_rate": 4.287400910777535e-06,
|
|
"loss": 1.8817052841186523,
|
|
"mean_token_accuracy": 0.5853028532117606,
|
|
"num_tokens": 25371793.0,
|
|
"step": 3700
|
|
},
|
|
{
|
|
"entropy": 1.7811777122318744,
|
|
"epoch": 0.5945393722080888,
|
|
"grad_norm": 2.78125,
|
|
"learning_rate": 4.27053466014505e-06,
|
|
"loss": 1.8650287628173827,
|
|
"mean_token_accuracy": 0.5995365470647812,
|
|
"num_tokens": 25437476.0,
|
|
"step": 3710
|
|
},
|
|
{
|
|
"entropy": 1.8484894543886186,
|
|
"epoch": 0.5961419042086497,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 4.2536684095125656e-06,
|
|
"loss": 1.8962841033935547,
|
|
"mean_token_accuracy": 0.584038731828332,
|
|
"num_tokens": 25505490.0,
|
|
"step": 3720
|
|
},
|
|
{
|
|
"entropy": 1.8471211820840836,
|
|
"epoch": 0.5977444362092106,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 4.236802158880081e-06,
|
|
"loss": 1.8902151107788085,
|
|
"mean_token_accuracy": 0.5868056703358888,
|
|
"num_tokens": 25573449.0,
|
|
"step": 3730
|
|
},
|
|
{
|
|
"entropy": 1.8298789858818054,
|
|
"epoch": 0.5993469682097714,
|
|
"grad_norm": 2.625,
|
|
"learning_rate": 4.219935908247597e-06,
|
|
"loss": 1.8739568710327148,
|
|
"mean_token_accuracy": 0.5878440275788307,
|
|
"num_tokens": 25640814.0,
|
|
"step": 3740
|
|
},
|
|
{
|
|
"entropy": 1.7966152891516685,
|
|
"epoch": 0.6009495002103323,
|
|
"grad_norm": 2.671875,
|
|
"learning_rate": 4.203069657615113e-06,
|
|
"loss": 1.8355796813964844,
|
|
"mean_token_accuracy": 0.5947290062904358,
|
|
"num_tokens": 25707760.0,
|
|
"step": 3750
|
|
},
|
|
{
|
|
"entropy": 1.920249554514885,
|
|
"epoch": 0.6025520322108933,
|
|
"grad_norm": 3.015625,
|
|
"learning_rate": 4.186203406982628e-06,
|
|
"loss": 1.9803874969482422,
|
|
"mean_token_accuracy": 0.571630297228694,
|
|
"num_tokens": 25778390.0,
|
|
"step": 3760
|
|
},
|
|
{
|
|
"entropy": 1.8823009133338928,
|
|
"epoch": 0.6041545642114541,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 4.169337156350144e-06,
|
|
"loss": 1.9324773788452148,
|
|
"mean_token_accuracy": 0.5821881555020809,
|
|
"num_tokens": 25850137.0,
|
|
"step": 3770
|
|
},
|
|
{
|
|
"entropy": 1.8832687310874463,
|
|
"epoch": 0.605757096212015,
|
|
"grad_norm": 2.78125,
|
|
"learning_rate": 4.152470905717659e-06,
|
|
"loss": 1.925374984741211,
|
|
"mean_token_accuracy": 0.5806475289165973,
|
|
"num_tokens": 25920517.0,
|
|
"step": 3780
|
|
},
|
|
{
|
|
"entropy": 1.8682250641286373,
|
|
"epoch": 0.6073596282125758,
|
|
"grad_norm": 2.78125,
|
|
"learning_rate": 4.1356046550851746e-06,
|
|
"loss": 1.9021371841430663,
|
|
"mean_token_accuracy": 0.5809845846146345,
|
|
"num_tokens": 25990445.0,
|
|
"step": 3790
|
|
},
|
|
{
|
|
"entropy": 1.8415281191468238,
|
|
"epoch": 0.6089621602131368,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 4.118738404452691e-06,
|
|
"loss": 1.8859903335571289,
|
|
"mean_token_accuracy": 0.5898528724908829,
|
|
"num_tokens": 26054835.0,
|
|
"step": 3800
|
|
},
|
|
{
|
|
"entropy": 1.8924433827400207,
|
|
"epoch": 0.6105646922136977,
|
|
"grad_norm": 3.0,
|
|
"learning_rate": 4.101872153820206e-06,
|
|
"loss": 1.9476310729980468,
|
|
"mean_token_accuracy": 0.5753111571073533,
|
|
"num_tokens": 26124843.0,
|
|
"step": 3810
|
|
},
|
|
{
|
|
"entropy": 1.8384124413132668,
|
|
"epoch": 0.6121672242142585,
|
|
"grad_norm": 3.015625,
|
|
"learning_rate": 4.085005903187722e-06,
|
|
"loss": 1.8944419860839843,
|
|
"mean_token_accuracy": 0.5857999432832003,
|
|
"num_tokens": 26192380.0,
|
|
"step": 3820
|
|
},
|
|
{
|
|
"entropy": 1.9009744957089425,
|
|
"epoch": 0.6137697562148194,
|
|
"grad_norm": 2.703125,
|
|
"learning_rate": 4.068139652555237e-06,
|
|
"loss": 1.9390430450439453,
|
|
"mean_token_accuracy": 0.5778307665139437,
|
|
"num_tokens": 26263193.0,
|
|
"step": 3830
|
|
},
|
|
{
|
|
"entropy": 1.8429256439208985,
|
|
"epoch": 0.6153722882153803,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 4.051273401922753e-06,
|
|
"loss": 1.9250511169433593,
|
|
"mean_token_accuracy": 0.5913165871053934,
|
|
"num_tokens": 26328954.0,
|
|
"step": 3840
|
|
},
|
|
{
|
|
"entropy": 1.8886337257921695,
|
|
"epoch": 0.6169748202159412,
|
|
"grad_norm": 2.84375,
|
|
"learning_rate": 4.034407151290268e-06,
|
|
"loss": 1.9294986724853516,
|
|
"mean_token_accuracy": 0.5790377296507359,
|
|
"num_tokens": 26398415.0,
|
|
"step": 3850
|
|
},
|
|
{
|
|
"entropy": 1.8385604590177536,
|
|
"epoch": 0.6185773522165021,
|
|
"grad_norm": 2.671875,
|
|
"learning_rate": 4.017540900657784e-06,
|
|
"loss": 1.8972116470336915,
|
|
"mean_token_accuracy": 0.5878618601709604,
|
|
"num_tokens": 26467637.0,
|
|
"step": 3860
|
|
},
|
|
{
|
|
"entropy": 1.9100745365023613,
|
|
"epoch": 0.6201798842170629,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 4.0006746500253e-06,
|
|
"loss": 1.981870460510254,
|
|
"mean_token_accuracy": 0.5758707467466593,
|
|
"num_tokens": 26535877.0,
|
|
"step": 3870
|
|
},
|
|
{
|
|
"entropy": 1.9046914495527745,
|
|
"epoch": 0.6217824162176239,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 3.983808399392815e-06,
|
|
"loss": 1.9622364044189453,
|
|
"mean_token_accuracy": 0.5798295836895704,
|
|
"num_tokens": 26607844.0,
|
|
"step": 3880
|
|
},
|
|
{
|
|
"entropy": 1.8779021188616754,
|
|
"epoch": 0.6233849482181847,
|
|
"grad_norm": 2.78125,
|
|
"learning_rate": 3.966942148760331e-06,
|
|
"loss": 1.9223901748657226,
|
|
"mean_token_accuracy": 0.5800982560962439,
|
|
"num_tokens": 26677111.0,
|
|
"step": 3890
|
|
},
|
|
{
|
|
"entropy": 1.8721623986959457,
|
|
"epoch": 0.6249874802187456,
|
|
"grad_norm": 3.078125,
|
|
"learning_rate": 3.950075898127846e-06,
|
|
"loss": 1.9060981750488282,
|
|
"mean_token_accuracy": 0.5845723442733288,
|
|
"num_tokens": 26745167.0,
|
|
"step": 3900
|
|
},
|
|
{
|
|
"entropy": 1.8842680297791958,
|
|
"epoch": 0.6265900122193065,
|
|
"grad_norm": 3.03125,
|
|
"learning_rate": 3.933209647495362e-06,
|
|
"loss": 1.9447505950927735,
|
|
"mean_token_accuracy": 0.5788533575832844,
|
|
"num_tokens": 26814737.0,
|
|
"step": 3910
|
|
},
|
|
{
|
|
"entropy": 1.8723237678408622,
|
|
"epoch": 0.6281925442198674,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 3.916343396862878e-06,
|
|
"loss": 1.9061521530151366,
|
|
"mean_token_accuracy": 0.5807973630726337,
|
|
"num_tokens": 26885009.0,
|
|
"step": 3920
|
|
},
|
|
{
|
|
"entropy": 1.80911298468709,
|
|
"epoch": 0.6297950762204283,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 3.899477146230393e-06,
|
|
"loss": 1.87274227142334,
|
|
"mean_token_accuracy": 0.5926986195147037,
|
|
"num_tokens": 26953328.0,
|
|
"step": 3930
|
|
},
|
|
{
|
|
"entropy": 1.7731514915823936,
|
|
"epoch": 0.6313976082209891,
|
|
"grad_norm": 2.734375,
|
|
"learning_rate": 3.882610895597909e-06,
|
|
"loss": 1.8349546432495116,
|
|
"mean_token_accuracy": 0.5997257970273495,
|
|
"num_tokens": 27018951.0,
|
|
"step": 3940
|
|
},
|
|
{
|
|
"entropy": 1.8358073227107525,
|
|
"epoch": 0.63300014022155,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 3.865744644965424e-06,
|
|
"loss": 1.8858596801757812,
|
|
"mean_token_accuracy": 0.5876387380063534,
|
|
"num_tokens": 27086370.0,
|
|
"step": 3950
|
|
},
|
|
{
|
|
"entropy": 1.8649689063429833,
|
|
"epoch": 0.634602672222111,
|
|
"grad_norm": 2.78125,
|
|
"learning_rate": 3.84887839433294e-06,
|
|
"loss": 1.9156248092651367,
|
|
"mean_token_accuracy": 0.5837285362184048,
|
|
"num_tokens": 27155131.0,
|
|
"step": 3960
|
|
},
|
|
{
|
|
"entropy": 1.8766348496079446,
|
|
"epoch": 0.6362052042226718,
|
|
"grad_norm": 2.609375,
|
|
"learning_rate": 3.832012143700456e-06,
|
|
"loss": 1.9406532287597655,
|
|
"mean_token_accuracy": 0.5804110359400511,
|
|
"num_tokens": 27225164.0,
|
|
"step": 3970
|
|
},
|
|
{
|
|
"entropy": 1.8654035195708274,
|
|
"epoch": 0.6378077362232327,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 3.8151458930679715e-06,
|
|
"loss": 1.893624496459961,
|
|
"mean_token_accuracy": 0.5834946081042289,
|
|
"num_tokens": 27295122.0,
|
|
"step": 3980
|
|
},
|
|
{
|
|
"entropy": 1.9283578127622605,
|
|
"epoch": 0.6394102682237935,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 3.798279642435487e-06,
|
|
"loss": 1.9532358169555664,
|
|
"mean_token_accuracy": 0.5727495942264795,
|
|
"num_tokens": 27366790.0,
|
|
"step": 3990
|
|
},
|
|
{
|
|
"entropy": 1.85790873169899,
|
|
"epoch": 0.6410128002243545,
|
|
"grad_norm": 3.171875,
|
|
"learning_rate": 3.781413391803003e-06,
|
|
"loss": 1.8932832717895507,
|
|
"mean_token_accuracy": 0.5854593172669411,
|
|
"num_tokens": 27435744.0,
|
|
"step": 4000
|
|
},
|
|
{
|
|
"entropy": 1.8387853726744652,
|
|
"epoch": 0.6426153322249154,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 3.7645471411705182e-06,
|
|
"loss": 1.886970329284668,
|
|
"mean_token_accuracy": 0.5850338660180568,
|
|
"num_tokens": 27505901.0,
|
|
"step": 4010
|
|
},
|
|
{
|
|
"entropy": 1.9090761132538319,
|
|
"epoch": 0.6442178642254762,
|
|
"grad_norm": 2.703125,
|
|
"learning_rate": 3.7476808905380337e-06,
|
|
"loss": 1.9542694091796875,
|
|
"mean_token_accuracy": 0.5762960381805897,
|
|
"num_tokens": 27576637.0,
|
|
"step": 4020
|
|
},
|
|
{
|
|
"entropy": 1.8114977724850179,
|
|
"epoch": 0.6458203962260372,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 3.7308146399055496e-06,
|
|
"loss": 1.8777925491333007,
|
|
"mean_token_accuracy": 0.5919980019330978,
|
|
"num_tokens": 27645081.0,
|
|
"step": 4030
|
|
},
|
|
{
|
|
"entropy": 1.8588636852800846,
|
|
"epoch": 0.647422928226598,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 3.713948389273065e-06,
|
|
"loss": 1.9345163345336913,
|
|
"mean_token_accuracy": 0.5856771107763052,
|
|
"num_tokens": 27716654.0,
|
|
"step": 4040
|
|
},
|
|
{
|
|
"entropy": 1.8071557343006135,
|
|
"epoch": 0.6490254602271589,
|
|
"grad_norm": 3.109375,
|
|
"learning_rate": 3.6970821386405805e-06,
|
|
"loss": 1.8865779876708983,
|
|
"mean_token_accuracy": 0.5963869657367468,
|
|
"num_tokens": 27781907.0,
|
|
"step": 4050
|
|
},
|
|
{
|
|
"entropy": 1.8470010980963707,
|
|
"epoch": 0.6506279922277198,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 3.6802158880080963e-06,
|
|
"loss": 1.915898323059082,
|
|
"mean_token_accuracy": 0.58299705311656,
|
|
"num_tokens": 27849927.0,
|
|
"step": 4060
|
|
},
|
|
{
|
|
"entropy": 1.8855213105678559,
|
|
"epoch": 0.6522305242282807,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 3.6633496373756118e-06,
|
|
"loss": 1.9473722457885743,
|
|
"mean_token_accuracy": 0.5766369249671698,
|
|
"num_tokens": 27921805.0,
|
|
"step": 4070
|
|
},
|
|
{
|
|
"entropy": 1.8205056108534337,
|
|
"epoch": 0.6538330562288416,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 3.6464833867431272e-06,
|
|
"loss": 1.868624496459961,
|
|
"mean_token_accuracy": 0.5868720389902592,
|
|
"num_tokens": 27989223.0,
|
|
"step": 4080
|
|
},
|
|
{
|
|
"entropy": 1.8420435622334481,
|
|
"epoch": 0.6554355882294025,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 3.629617136110643e-06,
|
|
"loss": 1.8833166122436524,
|
|
"mean_token_accuracy": 0.5918383941054344,
|
|
"num_tokens": 28055631.0,
|
|
"step": 4090
|
|
},
|
|
{
|
|
"entropy": 1.8503759488463403,
|
|
"epoch": 0.6570381202299633,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 3.6127508854781586e-06,
|
|
"loss": 1.9118997573852539,
|
|
"mean_token_accuracy": 0.588625418022275,
|
|
"num_tokens": 28123056.0,
|
|
"step": 4100
|
|
},
|
|
{
|
|
"entropy": 1.8946703895926476,
|
|
"epoch": 0.6586406522305243,
|
|
"grad_norm": 2.671875,
|
|
"learning_rate": 3.595884634845674e-06,
|
|
"loss": 1.924124526977539,
|
|
"mean_token_accuracy": 0.5777648027986289,
|
|
"num_tokens": 28193705.0,
|
|
"step": 4110
|
|
},
|
|
{
|
|
"entropy": 1.857002855092287,
|
|
"epoch": 0.6602431842310851,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 3.57901838421319e-06,
|
|
"loss": 1.921992874145508,
|
|
"mean_token_accuracy": 0.585981798171997,
|
|
"num_tokens": 28262128.0,
|
|
"step": 4120
|
|
},
|
|
{
|
|
"entropy": 1.9027111411094666,
|
|
"epoch": 0.661845716231646,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 3.5621521335807053e-06,
|
|
"loss": 1.9402679443359374,
|
|
"mean_token_accuracy": 0.5746401138603687,
|
|
"num_tokens": 28334805.0,
|
|
"step": 4130
|
|
},
|
|
{
|
|
"entropy": 1.835258822888136,
|
|
"epoch": 0.6634482482322069,
|
|
"grad_norm": 3.109375,
|
|
"learning_rate": 3.5452858829482208e-06,
|
|
"loss": 1.9036882400512696,
|
|
"mean_token_accuracy": 0.5913544304668903,
|
|
"num_tokens": 28400153.0,
|
|
"step": 4140
|
|
},
|
|
{
|
|
"entropy": 1.8309452913701534,
|
|
"epoch": 0.6650507802327678,
|
|
"grad_norm": 2.921875,
|
|
"learning_rate": 3.5284196323157366e-06,
|
|
"loss": 1.898341178894043,
|
|
"mean_token_accuracy": 0.589846097677946,
|
|
"num_tokens": 28468130.0,
|
|
"step": 4150
|
|
},
|
|
{
|
|
"entropy": 1.7959118835628032,
|
|
"epoch": 0.6666533122333287,
|
|
"grad_norm": 3.265625,
|
|
"learning_rate": 3.511553381683252e-06,
|
|
"loss": 1.8534683227539062,
|
|
"mean_token_accuracy": 0.5948268000036478,
|
|
"num_tokens": 28536745.0,
|
|
"step": 4160
|
|
},
|
|
{
|
|
"entropy": 1.7979405872523784,
|
|
"epoch": 0.6682558442338895,
|
|
"grad_norm": 2.671875,
|
|
"learning_rate": 3.494687131050768e-06,
|
|
"loss": 1.8724647521972657,
|
|
"mean_token_accuracy": 0.5950725205242634,
|
|
"num_tokens": 28604849.0,
|
|
"step": 4170
|
|
},
|
|
{
|
|
"entropy": 1.8711092531681062,
|
|
"epoch": 0.6698583762344504,
|
|
"grad_norm": 2.671875,
|
|
"learning_rate": 3.4778208804182834e-06,
|
|
"loss": 1.9114248275756835,
|
|
"mean_token_accuracy": 0.583422476798296,
|
|
"num_tokens": 28673688.0,
|
|
"step": 4180
|
|
},
|
|
{
|
|
"entropy": 1.892587960511446,
|
|
"epoch": 0.6714609082350114,
|
|
"grad_norm": 3.015625,
|
|
"learning_rate": 3.460954629785799e-06,
|
|
"loss": 1.9401971817016601,
|
|
"mean_token_accuracy": 0.5767185620963573,
|
|
"num_tokens": 28743571.0,
|
|
"step": 4190
|
|
},
|
|
{
|
|
"entropy": 1.8978145480155946,
|
|
"epoch": 0.6730634402355722,
|
|
"grad_norm": 2.578125,
|
|
"learning_rate": 3.4440883791533147e-06,
|
|
"loss": 1.9398605346679687,
|
|
"mean_token_accuracy": 0.5744742628186941,
|
|
"num_tokens": 28814004.0,
|
|
"step": 4200
|
|
},
|
|
{
|
|
"entropy": 1.8904282376170158,
|
|
"epoch": 0.6746659722361331,
|
|
"grad_norm": 2.890625,
|
|
"learning_rate": 3.42722212852083e-06,
|
|
"loss": 1.9394752502441406,
|
|
"mean_token_accuracy": 0.579630171135068,
|
|
"num_tokens": 28888419.0,
|
|
"step": 4210
|
|
},
|
|
{
|
|
"entropy": 1.821556354314089,
|
|
"epoch": 0.6762685042366939,
|
|
"grad_norm": 2.703125,
|
|
"learning_rate": 3.4103558778883456e-06,
|
|
"loss": 1.8964935302734376,
|
|
"mean_token_accuracy": 0.5887388437986374,
|
|
"num_tokens": 28954657.0,
|
|
"step": 4220
|
|
},
|
|
{
|
|
"entropy": 1.7560958586633206,
|
|
"epoch": 0.6778710362372549,
|
|
"grad_norm": 3.015625,
|
|
"learning_rate": 3.3934896272558615e-06,
|
|
"loss": 1.8420488357543945,
|
|
"mean_token_accuracy": 0.6024362590163946,
|
|
"num_tokens": 29020174.0,
|
|
"step": 4230
|
|
},
|
|
{
|
|
"entropy": 1.8498153872787952,
|
|
"epoch": 0.6794735682378158,
|
|
"grad_norm": 2.734375,
|
|
"learning_rate": 3.376623376623377e-06,
|
|
"loss": 1.9001192092895507,
|
|
"mean_token_accuracy": 0.578879962861538,
|
|
"num_tokens": 29090973.0,
|
|
"step": 4240
|
|
},
|
|
{
|
|
"entropy": 1.8873520374298096,
|
|
"epoch": 0.6810761002383766,
|
|
"grad_norm": 2.78125,
|
|
"learning_rate": 3.3597571259908924e-06,
|
|
"loss": 1.9619806289672852,
|
|
"mean_token_accuracy": 0.5761936750262976,
|
|
"num_tokens": 29161675.0,
|
|
"step": 4250
|
|
},
|
|
{
|
|
"entropy": 1.8612853288650513,
|
|
"epoch": 0.6826786322389375,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 3.3428908753584083e-06,
|
|
"loss": 1.9202625274658203,
|
|
"mean_token_accuracy": 0.5825033310800791,
|
|
"num_tokens": 29229458.0,
|
|
"step": 4260
|
|
},
|
|
{
|
|
"entropy": 1.8753561928868294,
|
|
"epoch": 0.6842811642394984,
|
|
"grad_norm": 2.5625,
|
|
"learning_rate": 3.3260246247259237e-06,
|
|
"loss": 1.9131437301635743,
|
|
"mean_token_accuracy": 0.5833288405090571,
|
|
"num_tokens": 29298070.0,
|
|
"step": 4270
|
|
},
|
|
{
|
|
"entropy": 1.7987837627530099,
|
|
"epoch": 0.6858836962400593,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 3.309158374093439e-06,
|
|
"loss": 1.8557870864868165,
|
|
"mean_token_accuracy": 0.5962090812623501,
|
|
"num_tokens": 29363949.0,
|
|
"step": 4280
|
|
},
|
|
{
|
|
"entropy": 1.8736120633780957,
|
|
"epoch": 0.6874862282406202,
|
|
"grad_norm": 3.15625,
|
|
"learning_rate": 3.292292123460955e-06,
|
|
"loss": 1.9229534149169922,
|
|
"mean_token_accuracy": 0.5777334328740835,
|
|
"num_tokens": 29435535.0,
|
|
"step": 4290
|
|
},
|
|
{
|
|
"entropy": 1.879132377356291,
|
|
"epoch": 0.689088760241181,
|
|
"grad_norm": 2.71875,
|
|
"learning_rate": 3.2754258728284705e-06,
|
|
"loss": 1.9337249755859376,
|
|
"mean_token_accuracy": 0.5785136640071868,
|
|
"num_tokens": 29504164.0,
|
|
"step": 4300
|
|
},
|
|
{
|
|
"entropy": 1.8871854215860366,
|
|
"epoch": 0.690691292241742,
|
|
"grad_norm": 2.828125,
|
|
"learning_rate": 3.258559622195986e-06,
|
|
"loss": 1.9246557235717774,
|
|
"mean_token_accuracy": 0.5791821502149105,
|
|
"num_tokens": 29572809.0,
|
|
"step": 4310
|
|
},
|
|
{
|
|
"entropy": 1.867794480919838,
|
|
"epoch": 0.6922938242423028,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 3.241693371563502e-06,
|
|
"loss": 1.9245538711547852,
|
|
"mean_token_accuracy": 0.585183822363615,
|
|
"num_tokens": 29640253.0,
|
|
"step": 4320
|
|
},
|
|
{
|
|
"entropy": 1.8319248631596565,
|
|
"epoch": 0.6938963562428637,
|
|
"grad_norm": 3.515625,
|
|
"learning_rate": 3.2248271209310173e-06,
|
|
"loss": 1.9025934219360352,
|
|
"mean_token_accuracy": 0.5880723088979721,
|
|
"num_tokens": 29708282.0,
|
|
"step": 4330
|
|
},
|
|
{
|
|
"entropy": 1.8819570675492288,
|
|
"epoch": 0.6954988882434247,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 3.2079608702985327e-06,
|
|
"loss": 1.9437738418579102,
|
|
"mean_token_accuracy": 0.578991699591279,
|
|
"num_tokens": 29775422.0,
|
|
"step": 4340
|
|
},
|
|
{
|
|
"entropy": 1.8296003483235836,
|
|
"epoch": 0.6971014202439855,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 3.1910946196660486e-06,
|
|
"loss": 1.9154447555541991,
|
|
"mean_token_accuracy": 0.5931405682116747,
|
|
"num_tokens": 29844864.0,
|
|
"step": 4350
|
|
},
|
|
{
|
|
"entropy": 1.7935851775109768,
|
|
"epoch": 0.6987039522445464,
|
|
"grad_norm": 2.6875,
|
|
"learning_rate": 3.174228369033564e-06,
|
|
"loss": 1.8333089828491211,
|
|
"mean_token_accuracy": 0.5960859883576631,
|
|
"num_tokens": 29912079.0,
|
|
"step": 4360
|
|
},
|
|
{
|
|
"entropy": 1.8747857213020325,
|
|
"epoch": 0.7003064842451072,
|
|
"grad_norm": 3.125,
|
|
"learning_rate": 3.1573621184010795e-06,
|
|
"loss": 1.931085205078125,
|
|
"mean_token_accuracy": 0.578602023422718,
|
|
"num_tokens": 29982490.0,
|
|
"step": 4370
|
|
},
|
|
{
|
|
"entropy": 1.8096578311175109,
|
|
"epoch": 0.7019090162456681,
|
|
"grad_norm": 3.15625,
|
|
"learning_rate": 3.1404958677685953e-06,
|
|
"loss": 1.87011775970459,
|
|
"mean_token_accuracy": 0.601407915353775,
|
|
"num_tokens": 30048423.0,
|
|
"step": 4380
|
|
},
|
|
{
|
|
"entropy": 1.8461608737707138,
|
|
"epoch": 0.7035115482462291,
|
|
"grad_norm": 2.921875,
|
|
"learning_rate": 3.123629617136111e-06,
|
|
"loss": 1.8947601318359375,
|
|
"mean_token_accuracy": 0.5874628745019436,
|
|
"num_tokens": 30116819.0,
|
|
"step": 4390
|
|
},
|
|
{
|
|
"entropy": 1.8574359193444252,
|
|
"epoch": 0.7051140802467899,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 3.1067633665036267e-06,
|
|
"loss": 1.9097387313842773,
|
|
"mean_token_accuracy": 0.5841793101280928,
|
|
"num_tokens": 30185743.0,
|
|
"step": 4400
|
|
},
|
|
{
|
|
"entropy": 1.796320417523384,
|
|
"epoch": 0.7067166122473508,
|
|
"grad_norm": 3.03125,
|
|
"learning_rate": 3.089897115871142e-06,
|
|
"loss": 1.8411190032958984,
|
|
"mean_token_accuracy": 0.5962270520627498,
|
|
"num_tokens": 30250772.0,
|
|
"step": 4410
|
|
},
|
|
{
|
|
"entropy": 1.8903830736875533,
|
|
"epoch": 0.7083191442479116,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 3.0730308652386576e-06,
|
|
"loss": 1.9433307647705078,
|
|
"mean_token_accuracy": 0.5788230109959841,
|
|
"num_tokens": 30322456.0,
|
|
"step": 4420
|
|
},
|
|
{
|
|
"entropy": 1.8906516812741756,
|
|
"epoch": 0.7099216762484726,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 3.0561646146061734e-06,
|
|
"loss": 1.949106788635254,
|
|
"mean_token_accuracy": 0.5781694982200861,
|
|
"num_tokens": 30390641.0,
|
|
"step": 4430
|
|
},
|
|
{
|
|
"entropy": 1.7996213018894196,
|
|
"epoch": 0.7115242082490335,
|
|
"grad_norm": 2.828125,
|
|
"learning_rate": 3.039298363973689e-06,
|
|
"loss": 1.8633939743041992,
|
|
"mean_token_accuracy": 0.5935101728886366,
|
|
"num_tokens": 30457494.0,
|
|
"step": 4440
|
|
},
|
|
{
|
|
"entropy": 1.8619076699018478,
|
|
"epoch": 0.7131267402495943,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 3.0224321133412043e-06,
|
|
"loss": 1.934151840209961,
|
|
"mean_token_accuracy": 0.5796947993338109,
|
|
"num_tokens": 30526804.0,
|
|
"step": 4450
|
|
},
|
|
{
|
|
"entropy": 1.7975557282567025,
|
|
"epoch": 0.7147292722501553,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 3.00556586270872e-06,
|
|
"loss": 1.8760286331176759,
|
|
"mean_token_accuracy": 0.5939261231571435,
|
|
"num_tokens": 30592498.0,
|
|
"step": 4460
|
|
},
|
|
{
|
|
"entropy": 1.8446580216288566,
|
|
"epoch": 0.7163318042507162,
|
|
"grad_norm": 3.015625,
|
|
"learning_rate": 2.9886996120762357e-06,
|
|
"loss": 1.8737337112426757,
|
|
"mean_token_accuracy": 0.5900526240468025,
|
|
"num_tokens": 30659144.0,
|
|
"step": 4470
|
|
},
|
|
{
|
|
"entropy": 1.853717105090618,
|
|
"epoch": 0.717934336251277,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 2.971833361443751e-06,
|
|
"loss": 1.8939176559448243,
|
|
"mean_token_accuracy": 0.5849155694246292,
|
|
"num_tokens": 30727301.0,
|
|
"step": 4480
|
|
},
|
|
{
|
|
"entropy": 1.9284060686826705,
|
|
"epoch": 0.7195368682518379,
|
|
"grad_norm": 2.890625,
|
|
"learning_rate": 2.954967110811267e-06,
|
|
"loss": 1.9791166305541992,
|
|
"mean_token_accuracy": 0.5722882691770792,
|
|
"num_tokens": 30799212.0,
|
|
"step": 4490
|
|
},
|
|
{
|
|
"entropy": 1.797964096814394,
|
|
"epoch": 0.7211394002523988,
|
|
"grad_norm": 3.296875,
|
|
"learning_rate": 2.9381008601787824e-06,
|
|
"loss": 1.8483495712280273,
|
|
"mean_token_accuracy": 0.5944610767066478,
|
|
"num_tokens": 30866936.0,
|
|
"step": 4500
|
|
},
|
|
{
|
|
"entropy": 1.9101737931370735,
|
|
"epoch": 0.7227419322529597,
|
|
"grad_norm": 2.6875,
|
|
"learning_rate": 2.921234609546298e-06,
|
|
"loss": 1.9717981338500976,
|
|
"mean_token_accuracy": 0.5766745507717133,
|
|
"num_tokens": 30939177.0,
|
|
"step": 4510
|
|
},
|
|
{
|
|
"entropy": 1.899225589632988,
|
|
"epoch": 0.7243444642535206,
|
|
"grad_norm": 2.75,
|
|
"learning_rate": 2.9043683589138137e-06,
|
|
"loss": 1.942579460144043,
|
|
"mean_token_accuracy": 0.5780370756983757,
|
|
"num_tokens": 31010329.0,
|
|
"step": 4520
|
|
},
|
|
{
|
|
"entropy": 1.8574948862195015,
|
|
"epoch": 0.7259469962540814,
|
|
"grad_norm": 3.3125,
|
|
"learning_rate": 2.887502108281329e-06,
|
|
"loss": 1.9129962921142578,
|
|
"mean_token_accuracy": 0.5802199840545654,
|
|
"num_tokens": 31079276.0,
|
|
"step": 4530
|
|
},
|
|
{
|
|
"entropy": 1.8531811386346817,
|
|
"epoch": 0.7275495282546424,
|
|
"grad_norm": 3.09375,
|
|
"learning_rate": 2.8706358576488446e-06,
|
|
"loss": 1.8707773208618164,
|
|
"mean_token_accuracy": 0.5845135271549224,
|
|
"num_tokens": 31149692.0,
|
|
"step": 4540
|
|
},
|
|
{
|
|
"entropy": 1.8767701983451843,
|
|
"epoch": 0.7291520602552032,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 2.8537696070163605e-06,
|
|
"loss": 1.932365608215332,
|
|
"mean_token_accuracy": 0.5770091351121664,
|
|
"num_tokens": 31220597.0,
|
|
"step": 4550
|
|
},
|
|
{
|
|
"entropy": 1.837051272392273,
|
|
"epoch": 0.7307545922557641,
|
|
"grad_norm": 3.28125,
|
|
"learning_rate": 2.836903356383876e-06,
|
|
"loss": 1.9031335830688476,
|
|
"mean_token_accuracy": 0.5894479807466269,
|
|
"num_tokens": 31288332.0,
|
|
"step": 4560
|
|
},
|
|
{
|
|
"entropy": 1.8541367374360562,
|
|
"epoch": 0.732357124256325,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 2.8200371057513914e-06,
|
|
"loss": 1.906287956237793,
|
|
"mean_token_accuracy": 0.5865425508469343,
|
|
"num_tokens": 31356335.0,
|
|
"step": 4570
|
|
},
|
|
{
|
|
"entropy": 1.8312122486531734,
|
|
"epoch": 0.7339596562568859,
|
|
"grad_norm": 3.015625,
|
|
"learning_rate": 2.8031708551189073e-06,
|
|
"loss": 1.91760311126709,
|
|
"mean_token_accuracy": 0.5876502882689237,
|
|
"num_tokens": 31426261.0,
|
|
"step": 4580
|
|
},
|
|
{
|
|
"entropy": 1.8157531134784222,
|
|
"epoch": 0.7355621882574468,
|
|
"grad_norm": 2.65625,
|
|
"learning_rate": 2.7863046044864227e-06,
|
|
"loss": 1.8741228103637695,
|
|
"mean_token_accuracy": 0.5895969212055207,
|
|
"num_tokens": 31493295.0,
|
|
"step": 4590
|
|
},
|
|
{
|
|
"entropy": 1.862128420174122,
|
|
"epoch": 0.7371647202580076,
|
|
"grad_norm": 2.71875,
|
|
"learning_rate": 2.769438353853938e-06,
|
|
"loss": 1.9290430068969726,
|
|
"mean_token_accuracy": 0.5843666099011898,
|
|
"num_tokens": 31562680.0,
|
|
"step": 4600
|
|
},
|
|
{
|
|
"entropy": 1.7904260948300361,
|
|
"epoch": 0.7387672522585685,
|
|
"grad_norm": 2.75,
|
|
"learning_rate": 2.752572103221454e-06,
|
|
"loss": 1.8450855255126952,
|
|
"mean_token_accuracy": 0.5969460435211659,
|
|
"num_tokens": 31627777.0,
|
|
"step": 4610
|
|
},
|
|
{
|
|
"entropy": 1.8627801559865476,
|
|
"epoch": 0.7403697842591295,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 2.7357058525889695e-06,
|
|
"loss": 1.9175779342651367,
|
|
"mean_token_accuracy": 0.5832827895879745,
|
|
"num_tokens": 31696447.0,
|
|
"step": 4620
|
|
},
|
|
{
|
|
"entropy": 1.7895106546580792,
|
|
"epoch": 0.7419723162596903,
|
|
"grad_norm": 2.703125,
|
|
"learning_rate": 2.7188396019564854e-06,
|
|
"loss": 1.8732286453247071,
|
|
"mean_token_accuracy": 0.6013656318187713,
|
|
"num_tokens": 31762723.0,
|
|
"step": 4630
|
|
},
|
|
{
|
|
"entropy": 1.8264621473848819,
|
|
"epoch": 0.7435748482602512,
|
|
"grad_norm": 3.1875,
|
|
"learning_rate": 2.701973351324001e-06,
|
|
"loss": 1.8991756439208984,
|
|
"mean_token_accuracy": 0.5955311380326748,
|
|
"num_tokens": 31828494.0,
|
|
"step": 4640
|
|
},
|
|
{
|
|
"entropy": 1.907581451535225,
|
|
"epoch": 0.745177380260812,
|
|
"grad_norm": 2.84375,
|
|
"learning_rate": 2.6851071006915163e-06,
|
|
"loss": 1.9553951263427733,
|
|
"mean_token_accuracy": 0.5728101029992103,
|
|
"num_tokens": 31899128.0,
|
|
"step": 4650
|
|
},
|
|
{
|
|
"entropy": 1.8415529295802116,
|
|
"epoch": 0.746779912261373,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 2.668240850059032e-06,
|
|
"loss": 1.9126508712768555,
|
|
"mean_token_accuracy": 0.5831385359168053,
|
|
"num_tokens": 31966401.0,
|
|
"step": 4660
|
|
},
|
|
{
|
|
"entropy": 1.8863008134067059,
|
|
"epoch": 0.7483824442619339,
|
|
"grad_norm": 2.78125,
|
|
"learning_rate": 2.6513745994265476e-06,
|
|
"loss": 1.9363431930541992,
|
|
"mean_token_accuracy": 0.5793558444827795,
|
|
"num_tokens": 32036907.0,
|
|
"step": 4670
|
|
},
|
|
{
|
|
"entropy": 1.823825690150261,
|
|
"epoch": 0.7499849762624947,
|
|
"grad_norm": 2.953125,
|
|
"learning_rate": 2.634508348794063e-06,
|
|
"loss": 1.888538932800293,
|
|
"mean_token_accuracy": 0.5882374349981546,
|
|
"num_tokens": 32103892.0,
|
|
"step": 4680
|
|
},
|
|
{
|
|
"entropy": 1.8487841807305814,
|
|
"epoch": 0.7515875082630556,
|
|
"grad_norm": 3.5,
|
|
"learning_rate": 2.617642098161579e-06,
|
|
"loss": 1.883224868774414,
|
|
"mean_token_accuracy": 0.5878496304154396,
|
|
"num_tokens": 32170790.0,
|
|
"step": 4690
|
|
},
|
|
{
|
|
"entropy": 1.8293106988072396,
|
|
"epoch": 0.7531900402636165,
|
|
"grad_norm": 3.09375,
|
|
"learning_rate": 2.6007758475290944e-06,
|
|
"loss": 1.8674444198608398,
|
|
"mean_token_accuracy": 0.590721195936203,
|
|
"num_tokens": 32237508.0,
|
|
"step": 4700
|
|
},
|
|
{
|
|
"entropy": 1.8427614197134972,
|
|
"epoch": 0.7547925722641774,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 2.58390959689661e-06,
|
|
"loss": 1.931664276123047,
|
|
"mean_token_accuracy": 0.585081772506237,
|
|
"num_tokens": 32304433.0,
|
|
"step": 4710
|
|
},
|
|
{
|
|
"entropy": 1.8339687652885914,
|
|
"epoch": 0.7563951042647383,
|
|
"grad_norm": 3.109375,
|
|
"learning_rate": 2.5670433462641257e-06,
|
|
"loss": 1.8750896453857422,
|
|
"mean_token_accuracy": 0.5903500825166702,
|
|
"num_tokens": 32372527.0,
|
|
"step": 4720
|
|
},
|
|
{
|
|
"entropy": 1.8150975018739701,
|
|
"epoch": 0.7579976362652991,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 2.550177095631641e-06,
|
|
"loss": 1.8547204971313476,
|
|
"mean_token_accuracy": 0.5925628982484341,
|
|
"num_tokens": 32439016.0,
|
|
"step": 4730
|
|
},
|
|
{
|
|
"entropy": 1.8668007925152779,
|
|
"epoch": 0.7596001682658601,
|
|
"grad_norm": 2.703125,
|
|
"learning_rate": 2.5333108449991566e-06,
|
|
"loss": 1.9275758743286133,
|
|
"mean_token_accuracy": 0.5824221331626177,
|
|
"num_tokens": 32508193.0,
|
|
"step": 4740
|
|
},
|
|
{
|
|
"entropy": 1.8837640598416328,
|
|
"epoch": 0.7612027002664209,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 2.5164445943666725e-06,
|
|
"loss": 1.962438201904297,
|
|
"mean_token_accuracy": 0.5787151921540499,
|
|
"num_tokens": 32578305.0,
|
|
"step": 4750
|
|
},
|
|
{
|
|
"entropy": 1.823105738312006,
|
|
"epoch": 0.7628052322669818,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 2.499578343734188e-06,
|
|
"loss": 1.877680778503418,
|
|
"mean_token_accuracy": 0.5912107802927494,
|
|
"num_tokens": 32646587.0,
|
|
"step": 4760
|
|
},
|
|
{
|
|
"entropy": 1.8075616881251335,
|
|
"epoch": 0.7644077642675428,
|
|
"grad_norm": 2.921875,
|
|
"learning_rate": 2.4827120931017038e-06,
|
|
"loss": 1.8594440460205077,
|
|
"mean_token_accuracy": 0.5939967796206475,
|
|
"num_tokens": 32712758.0,
|
|
"step": 4770
|
|
},
|
|
{
|
|
"entropy": 1.8341136962175368,
|
|
"epoch": 0.7660102962681036,
|
|
"grad_norm": 3.1875,
|
|
"learning_rate": 2.4658458424692192e-06,
|
|
"loss": 1.8853012084960938,
|
|
"mean_token_accuracy": 0.5875776465982199,
|
|
"num_tokens": 32779513.0,
|
|
"step": 4780
|
|
},
|
|
{
|
|
"entropy": 1.8376713953912258,
|
|
"epoch": 0.7676128282686645,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 2.4489795918367347e-06,
|
|
"loss": 1.8840415954589844,
|
|
"mean_token_accuracy": 0.5857285771518945,
|
|
"num_tokens": 32848465.0,
|
|
"step": 4790
|
|
},
|
|
{
|
|
"entropy": 1.857311400771141,
|
|
"epoch": 0.7692153602692253,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 2.4321133412042505e-06,
|
|
"loss": 1.915665626525879,
|
|
"mean_token_accuracy": 0.5853688273578882,
|
|
"num_tokens": 32916117.0,
|
|
"step": 4800
|
|
},
|
|
{
|
|
"entropy": 1.8423568911850452,
|
|
"epoch": 0.7708178922697863,
|
|
"grad_norm": 2.578125,
|
|
"learning_rate": 2.4152470905717664e-06,
|
|
"loss": 1.9055423736572266,
|
|
"mean_token_accuracy": 0.5882505733519793,
|
|
"num_tokens": 32984183.0,
|
|
"step": 4810
|
|
},
|
|
{
|
|
"entropy": 1.835125819593668,
|
|
"epoch": 0.7724204242703472,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 2.3983808399392814e-06,
|
|
"loss": 1.9093955993652343,
|
|
"mean_token_accuracy": 0.5893498983234167,
|
|
"num_tokens": 33052722.0,
|
|
"step": 4820
|
|
},
|
|
{
|
|
"entropy": 1.8223372012376786,
|
|
"epoch": 0.774022956270908,
|
|
"grad_norm": 3.078125,
|
|
"learning_rate": 2.3815145893067973e-06,
|
|
"loss": 1.8917829513549804,
|
|
"mean_token_accuracy": 0.5907191261649132,
|
|
"num_tokens": 33121558.0,
|
|
"step": 4830
|
|
},
|
|
{
|
|
"entropy": 1.8190541714429855,
|
|
"epoch": 0.7756254882714689,
|
|
"grad_norm": 2.828125,
|
|
"learning_rate": 2.364648338674313e-06,
|
|
"loss": 1.8961849212646484,
|
|
"mean_token_accuracy": 0.5917201146483422,
|
|
"num_tokens": 33190162.0,
|
|
"step": 4840
|
|
},
|
|
{
|
|
"entropy": 1.8600998565554618,
|
|
"epoch": 0.7772280202720299,
|
|
"grad_norm": 2.734375,
|
|
"learning_rate": 2.347782088041828e-06,
|
|
"loss": 1.8977258682250977,
|
|
"mean_token_accuracy": 0.5800701964646577,
|
|
"num_tokens": 33260039.0,
|
|
"step": 4850
|
|
},
|
|
{
|
|
"entropy": 1.7787691496312619,
|
|
"epoch": 0.7788305522725907,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 2.330915837409344e-06,
|
|
"loss": 1.8467596054077149,
|
|
"mean_token_accuracy": 0.60061249807477,
|
|
"num_tokens": 33323447.0,
|
|
"step": 4860
|
|
},
|
|
{
|
|
"entropy": 1.8592630334198474,
|
|
"epoch": 0.7804330842731516,
|
|
"grad_norm": 3.015625,
|
|
"learning_rate": 2.31404958677686e-06,
|
|
"loss": 1.8995931625366211,
|
|
"mean_token_accuracy": 0.585073859244585,
|
|
"num_tokens": 33392525.0,
|
|
"step": 4870
|
|
},
|
|
{
|
|
"entropy": 1.844882532209158,
|
|
"epoch": 0.7820356162737124,
|
|
"grad_norm": 2.890625,
|
|
"learning_rate": 2.297183336144375e-06,
|
|
"loss": 1.9015777587890625,
|
|
"mean_token_accuracy": 0.5880853958427906,
|
|
"num_tokens": 33460290.0,
|
|
"step": 4880
|
|
},
|
|
{
|
|
"entropy": 1.845929805189371,
|
|
"epoch": 0.7836381482742734,
|
|
"grad_norm": 2.84375,
|
|
"learning_rate": 2.280317085511891e-06,
|
|
"loss": 1.917535400390625,
|
|
"mean_token_accuracy": 0.583182455226779,
|
|
"num_tokens": 33530065.0,
|
|
"step": 4890
|
|
},
|
|
{
|
|
"entropy": 1.8467786006629467,
|
|
"epoch": 0.7852406802748343,
|
|
"grad_norm": 3.03125,
|
|
"learning_rate": 2.2634508348794067e-06,
|
|
"loss": 1.9201107025146484,
|
|
"mean_token_accuracy": 0.589047035202384,
|
|
"num_tokens": 33598388.0,
|
|
"step": 4900
|
|
},
|
|
{
|
|
"entropy": 1.8024130068719386,
|
|
"epoch": 0.7868432122753951,
|
|
"grad_norm": 2.921875,
|
|
"learning_rate": 2.246584584246922e-06,
|
|
"loss": 1.8678976058959962,
|
|
"mean_token_accuracy": 0.5942654374986887,
|
|
"num_tokens": 33668337.0,
|
|
"step": 4910
|
|
},
|
|
{
|
|
"entropy": 1.8550097823143006,
|
|
"epoch": 0.788445744275956,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 2.2297183336144376e-06,
|
|
"loss": 1.8873409271240233,
|
|
"mean_token_accuracy": 0.5828581850975751,
|
|
"num_tokens": 33737823.0,
|
|
"step": 4920
|
|
},
|
|
{
|
|
"entropy": 1.8001336701214314,
|
|
"epoch": 0.7900482762765169,
|
|
"grad_norm": 3.171875,
|
|
"learning_rate": 2.2128520829819535e-06,
|
|
"loss": 1.8621498107910157,
|
|
"mean_token_accuracy": 0.5943111833184958,
|
|
"num_tokens": 33802844.0,
|
|
"step": 4930
|
|
},
|
|
{
|
|
"entropy": 1.8257937185466289,
|
|
"epoch": 0.7916508082770778,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 2.195985832349469e-06,
|
|
"loss": 1.9113481521606446,
|
|
"mean_token_accuracy": 0.5905203901231288,
|
|
"num_tokens": 33872731.0,
|
|
"step": 4940
|
|
},
|
|
{
|
|
"entropy": 1.8191636987030506,
|
|
"epoch": 0.7932533402776387,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 2.1791195817169844e-06,
|
|
"loss": 1.8932903289794922,
|
|
"mean_token_accuracy": 0.5920727163553238,
|
|
"num_tokens": 33940292.0,
|
|
"step": 4950
|
|
},
|
|
{
|
|
"entropy": 1.786191315948963,
|
|
"epoch": 0.7948558722781995,
|
|
"grad_norm": 3.234375,
|
|
"learning_rate": 2.1622533310845003e-06,
|
|
"loss": 1.843625831604004,
|
|
"mean_token_accuracy": 0.5974460437893867,
|
|
"num_tokens": 34005383.0,
|
|
"step": 4960
|
|
},
|
|
{
|
|
"entropy": 1.8545084938406944,
|
|
"epoch": 0.7964584042787605,
|
|
"grad_norm": 2.75,
|
|
"learning_rate": 2.1453870804520157e-06,
|
|
"loss": 1.9135856628417969,
|
|
"mean_token_accuracy": 0.5837194677442312,
|
|
"num_tokens": 34075792.0,
|
|
"step": 4970
|
|
},
|
|
{
|
|
"entropy": 1.871314498782158,
|
|
"epoch": 0.7980609362793213,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 2.128520829819531e-06,
|
|
"loss": 1.9335128784179687,
|
|
"mean_token_accuracy": 0.5792830560356379,
|
|
"num_tokens": 34146039.0,
|
|
"step": 4980
|
|
},
|
|
{
|
|
"entropy": 1.8142223849892616,
|
|
"epoch": 0.7996634682798822,
|
|
"grad_norm": 3.078125,
|
|
"learning_rate": 2.111654579187047e-06,
|
|
"loss": 1.8717248916625977,
|
|
"mean_token_accuracy": 0.5912014968693257,
|
|
"num_tokens": 34213756.0,
|
|
"step": 4990
|
|
},
|
|
{
|
|
"entropy": 1.8623139068484307,
|
|
"epoch": 0.8012660002804431,
|
|
"grad_norm": 2.75,
|
|
"learning_rate": 2.0947883285545625e-06,
|
|
"loss": 1.8864187240600585,
|
|
"mean_token_accuracy": 0.5801310263574123,
|
|
"num_tokens": 34282925.0,
|
|
"step": 5000
|
|
},
|
|
{
|
|
"entropy": 1.9080819115042686,
|
|
"epoch": 0.802868532281004,
|
|
"grad_norm": 2.9375,
|
|
"learning_rate": 2.0779220779220784e-06,
|
|
"loss": 1.9643669128417969,
|
|
"mean_token_accuracy": 0.5719181023538112,
|
|
"num_tokens": 34354376.0,
|
|
"step": 5010
|
|
},
|
|
{
|
|
"entropy": 1.8581409096717834,
|
|
"epoch": 0.8044710642815649,
|
|
"grad_norm": 2.75,
|
|
"learning_rate": 2.061055827289594e-06,
|
|
"loss": 1.9315671920776367,
|
|
"mean_token_accuracy": 0.5858389385044575,
|
|
"num_tokens": 34425581.0,
|
|
"step": 5020
|
|
},
|
|
{
|
|
"entropy": 1.8516808852553368,
|
|
"epoch": 0.8060735962821257,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 2.0441895766571092e-06,
|
|
"loss": 1.888896369934082,
|
|
"mean_token_accuracy": 0.5831075765192508,
|
|
"num_tokens": 34493276.0,
|
|
"step": 5030
|
|
},
|
|
{
|
|
"entropy": 1.928952093422413,
|
|
"epoch": 0.8076761282826866,
|
|
"grad_norm": 2.71875,
|
|
"learning_rate": 2.027323326024625e-06,
|
|
"loss": 1.9985475540161133,
|
|
"mean_token_accuracy": 0.5690149266272784,
|
|
"num_tokens": 34568048.0,
|
|
"step": 5040
|
|
},
|
|
{
|
|
"entropy": 1.8902572244405746,
|
|
"epoch": 0.8092786602832476,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 2.0104570753921406e-06,
|
|
"loss": 1.9458175659179688,
|
|
"mean_token_accuracy": 0.579744578525424,
|
|
"num_tokens": 34637422.0,
|
|
"step": 5050
|
|
},
|
|
{
|
|
"entropy": 1.9189714342355728,
|
|
"epoch": 0.8108811922838084,
|
|
"grad_norm": 2.921875,
|
|
"learning_rate": 1.993590824759656e-06,
|
|
"loss": 1.9847827911376954,
|
|
"mean_token_accuracy": 0.5708337672054767,
|
|
"num_tokens": 34708012.0,
|
|
"step": 5060
|
|
},
|
|
{
|
|
"entropy": 1.8283629328012467,
|
|
"epoch": 0.8124837242843693,
|
|
"grad_norm": 2.84375,
|
|
"learning_rate": 1.976724574127172e-06,
|
|
"loss": 1.8860307693481446,
|
|
"mean_token_accuracy": 0.5901182591915131,
|
|
"num_tokens": 34776908.0,
|
|
"step": 5070
|
|
},
|
|
{
|
|
"entropy": 1.8660996221005917,
|
|
"epoch": 0.8140862562849301,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 1.9598583234946873e-06,
|
|
"loss": 1.9303264617919922,
|
|
"mean_token_accuracy": 0.5811872001737356,
|
|
"num_tokens": 34845348.0,
|
|
"step": 5080
|
|
},
|
|
{
|
|
"entropy": 1.8891982451081275,
|
|
"epoch": 0.8156887882854911,
|
|
"grad_norm": 2.921875,
|
|
"learning_rate": 1.9429920728622028e-06,
|
|
"loss": 1.9262752532958984,
|
|
"mean_token_accuracy": 0.5712238024920225,
|
|
"num_tokens": 34917326.0,
|
|
"step": 5090
|
|
},
|
|
{
|
|
"entropy": 1.8782757677137851,
|
|
"epoch": 0.817291320286052,
|
|
"grad_norm": 2.734375,
|
|
"learning_rate": 1.9261258222297187e-06,
|
|
"loss": 1.9394376754760743,
|
|
"mean_token_accuracy": 0.5833391141146421,
|
|
"num_tokens": 34987233.0,
|
|
"step": 5100
|
|
},
|
|
{
|
|
"entropy": 1.836723731458187,
|
|
"epoch": 0.8188938522866128,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 1.909259571597234e-06,
|
|
"loss": 1.8888580322265625,
|
|
"mean_token_accuracy": 0.5898743011057377,
|
|
"num_tokens": 35054390.0,
|
|
"step": 5110
|
|
},
|
|
{
|
|
"entropy": 1.8592747025191785,
|
|
"epoch": 0.8204963842871738,
|
|
"grad_norm": 2.75,
|
|
"learning_rate": 1.8923933209647496e-06,
|
|
"loss": 1.918815803527832,
|
|
"mean_token_accuracy": 0.5785074956715107,
|
|
"num_tokens": 35124783.0,
|
|
"step": 5120
|
|
},
|
|
{
|
|
"entropy": 1.802715352922678,
|
|
"epoch": 0.8220989162877346,
|
|
"grad_norm": 2.890625,
|
|
"learning_rate": 1.8755270703322654e-06,
|
|
"loss": 1.9023824691772462,
|
|
"mean_token_accuracy": 0.5942517884075642,
|
|
"num_tokens": 35192523.0,
|
|
"step": 5130
|
|
},
|
|
{
|
|
"entropy": 1.8116022616624832,
|
|
"epoch": 0.8237014482882955,
|
|
"grad_norm": 2.71875,
|
|
"learning_rate": 1.858660819699781e-06,
|
|
"loss": 1.871706771850586,
|
|
"mean_token_accuracy": 0.5937372047454119,
|
|
"num_tokens": 35260988.0,
|
|
"step": 5140
|
|
},
|
|
{
|
|
"entropy": 1.8106999851763248,
|
|
"epoch": 0.8253039802888564,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 1.8417945690672963e-06,
|
|
"loss": 1.8581106185913085,
|
|
"mean_token_accuracy": 0.5908673726022243,
|
|
"num_tokens": 35327982.0,
|
|
"step": 5150
|
|
},
|
|
{
|
|
"entropy": 1.8918942615389824,
|
|
"epoch": 0.8269065122894173,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 1.8249283184348122e-06,
|
|
"loss": 1.9652887344360352,
|
|
"mean_token_accuracy": 0.5815871477127075,
|
|
"num_tokens": 35397549.0,
|
|
"step": 5160
|
|
},
|
|
{
|
|
"entropy": 1.8354435302317142,
|
|
"epoch": 0.8285090442899782,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 1.8080620678023279e-06,
|
|
"loss": 1.8734939575195313,
|
|
"mean_token_accuracy": 0.5881023917347192,
|
|
"num_tokens": 35466217.0,
|
|
"step": 5170
|
|
},
|
|
{
|
|
"entropy": 1.8706816494464875,
|
|
"epoch": 0.830111576290539,
|
|
"grad_norm": 2.828125,
|
|
"learning_rate": 1.791195817169843e-06,
|
|
"loss": 1.9151870727539062,
|
|
"mean_token_accuracy": 0.5856871705502271,
|
|
"num_tokens": 35536080.0,
|
|
"step": 5180
|
|
},
|
|
{
|
|
"entropy": 1.8841779872775077,
|
|
"epoch": 0.8317141082910999,
|
|
"grad_norm": 3.09375,
|
|
"learning_rate": 1.774329566537359e-06,
|
|
"loss": 1.942214584350586,
|
|
"mean_token_accuracy": 0.5793454956263304,
|
|
"num_tokens": 35608158.0,
|
|
"step": 5190
|
|
},
|
|
{
|
|
"entropy": 1.848481398075819,
|
|
"epoch": 0.8333166402916609,
|
|
"grad_norm": 2.9375,
|
|
"learning_rate": 1.7574633159048746e-06,
|
|
"loss": 1.9140625,
|
|
"mean_token_accuracy": 0.5864365387707948,
|
|
"num_tokens": 35676010.0,
|
|
"step": 5200
|
|
},
|
|
{
|
|
"entropy": 1.7927502900362016,
|
|
"epoch": 0.8349191722922217,
|
|
"grad_norm": 3.265625,
|
|
"learning_rate": 1.74059706527239e-06,
|
|
"loss": 1.8784461975097657,
|
|
"mean_token_accuracy": 0.5948816005140543,
|
|
"num_tokens": 35743360.0,
|
|
"step": 5210
|
|
},
|
|
{
|
|
"entropy": 1.8374880060553551,
|
|
"epoch": 0.8365217042927826,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 1.7237308146399057e-06,
|
|
"loss": 1.8934955596923828,
|
|
"mean_token_accuracy": 0.5864754639565944,
|
|
"num_tokens": 35812001.0,
|
|
"step": 5220
|
|
},
|
|
{
|
|
"entropy": 1.9162466913461684,
|
|
"epoch": 0.8381242362933434,
|
|
"grad_norm": 3.015625,
|
|
"learning_rate": 1.7068645640074214e-06,
|
|
"loss": 1.989309310913086,
|
|
"mean_token_accuracy": 0.5767899330705404,
|
|
"num_tokens": 35883914.0,
|
|
"step": 5230
|
|
},
|
|
{
|
|
"entropy": 1.8502981126308442,
|
|
"epoch": 0.8397267682939044,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 1.689998313374937e-06,
|
|
"loss": 1.9092756271362306,
|
|
"mean_token_accuracy": 0.5868145152926445,
|
|
"num_tokens": 35951633.0,
|
|
"step": 5240
|
|
},
|
|
{
|
|
"entropy": 1.8918419994413853,
|
|
"epoch": 0.8413293002944653,
|
|
"grad_norm": 2.703125,
|
|
"learning_rate": 1.6731320627424525e-06,
|
|
"loss": 1.9371561050415038,
|
|
"mean_token_accuracy": 0.5782828338444232,
|
|
"num_tokens": 36022240.0,
|
|
"step": 5250
|
|
},
|
|
{
|
|
"entropy": 1.858195111900568,
|
|
"epoch": 0.8429318322950261,
|
|
"grad_norm": 3.09375,
|
|
"learning_rate": 1.6562658121099682e-06,
|
|
"loss": 1.9401632308959962,
|
|
"mean_token_accuracy": 0.5855324938893318,
|
|
"num_tokens": 36089230.0,
|
|
"step": 5260
|
|
},
|
|
{
|
|
"entropy": 1.9209559485316277,
|
|
"epoch": 0.844534364295587,
|
|
"grad_norm": 3.03125,
|
|
"learning_rate": 1.6393995614774838e-06,
|
|
"loss": 1.9692459106445312,
|
|
"mean_token_accuracy": 0.5720816683024168,
|
|
"num_tokens": 36158834.0,
|
|
"step": 5270
|
|
},
|
|
{
|
|
"entropy": 1.8659572064876557,
|
|
"epoch": 0.846136896296148,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 1.6225333108449993e-06,
|
|
"loss": 1.890706443786621,
|
|
"mean_token_accuracy": 0.5827448319643735,
|
|
"num_tokens": 36229727.0,
|
|
"step": 5280
|
|
},
|
|
{
|
|
"entropy": 1.8979657620191575,
|
|
"epoch": 0.8477394282967088,
|
|
"grad_norm": 3.21875,
|
|
"learning_rate": 1.605667060212515e-06,
|
|
"loss": 1.9233301162719727,
|
|
"mean_token_accuracy": 0.5765829961746931,
|
|
"num_tokens": 36298130.0,
|
|
"step": 5290
|
|
},
|
|
{
|
|
"entropy": 1.8676749154925347,
|
|
"epoch": 0.8493419602972697,
|
|
"grad_norm": 3.203125,
|
|
"learning_rate": 1.5888008095800306e-06,
|
|
"loss": 1.9104772567749024,
|
|
"mean_token_accuracy": 0.5829620614647866,
|
|
"num_tokens": 36368506.0,
|
|
"step": 5300
|
|
},
|
|
{
|
|
"entropy": 1.894658635556698,
|
|
"epoch": 0.8509444922978305,
|
|
"grad_norm": 3.0,
|
|
"learning_rate": 1.571934558947546e-06,
|
|
"loss": 1.939011001586914,
|
|
"mean_token_accuracy": 0.5757065914571285,
|
|
"num_tokens": 36437738.0,
|
|
"step": 5310
|
|
},
|
|
{
|
|
"entropy": 1.8023961640894413,
|
|
"epoch": 0.8525470242983915,
|
|
"grad_norm": 2.53125,
|
|
"learning_rate": 1.5550683083150617e-06,
|
|
"loss": 1.8812477111816406,
|
|
"mean_token_accuracy": 0.5942258331924677,
|
|
"num_tokens": 36504934.0,
|
|
"step": 5320
|
|
},
|
|
{
|
|
"entropy": 1.8514545068144799,
|
|
"epoch": 0.8541495562989524,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 1.5382020576825774e-06,
|
|
"loss": 1.8894914627075194,
|
|
"mean_token_accuracy": 0.580870047956705,
|
|
"num_tokens": 36573640.0,
|
|
"step": 5330
|
|
},
|
|
{
|
|
"entropy": 1.87561452165246,
|
|
"epoch": 0.8557520882995132,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 1.5213358070500928e-06,
|
|
"loss": 1.9121932983398438,
|
|
"mean_token_accuracy": 0.5853728234767914,
|
|
"num_tokens": 36643224.0,
|
|
"step": 5340
|
|
},
|
|
{
|
|
"entropy": 1.8336880192160607,
|
|
"epoch": 0.8573546203000741,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 1.5044695564176085e-06,
|
|
"loss": 1.8873580932617187,
|
|
"mean_token_accuracy": 0.5845846958458424,
|
|
"num_tokens": 36712263.0,
|
|
"step": 5350
|
|
},
|
|
{
|
|
"entropy": 1.8954137042164803,
|
|
"epoch": 0.858957152300635,
|
|
"grad_norm": 3.015625,
|
|
"learning_rate": 1.4876033057851241e-06,
|
|
"loss": 1.9475727081298828,
|
|
"mean_token_accuracy": 0.5799393642693758,
|
|
"num_tokens": 36781564.0,
|
|
"step": 5360
|
|
},
|
|
{
|
|
"entropy": 1.8517433993518353,
|
|
"epoch": 0.8605596843011959,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 1.4707370551526398e-06,
|
|
"loss": 1.9321174621582031,
|
|
"mean_token_accuracy": 0.5853044964373112,
|
|
"num_tokens": 36849659.0,
|
|
"step": 5370
|
|
},
|
|
{
|
|
"entropy": 1.8717767260968685,
|
|
"epoch": 0.8621622163017568,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 1.4538708045201552e-06,
|
|
"loss": 1.9176826477050781,
|
|
"mean_token_accuracy": 0.5836375288665294,
|
|
"num_tokens": 36919377.0,
|
|
"step": 5380
|
|
},
|
|
{
|
|
"entropy": 1.8603466354310512,
|
|
"epoch": 0.8637647483023176,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 1.437004553887671e-06,
|
|
"loss": 1.9242975234985351,
|
|
"mean_token_accuracy": 0.5835679214447737,
|
|
"num_tokens": 36989574.0,
|
|
"step": 5390
|
|
},
|
|
{
|
|
"entropy": 1.880230689048767,
|
|
"epoch": 0.8653672803028786,
|
|
"grad_norm": 2.71875,
|
|
"learning_rate": 1.4201383032551866e-06,
|
|
"loss": 1.9477001190185548,
|
|
"mean_token_accuracy": 0.5788057737052441,
|
|
"num_tokens": 37058313.0,
|
|
"step": 5400
|
|
},
|
|
{
|
|
"entropy": 1.8516812466084958,
|
|
"epoch": 0.8669698123034394,
|
|
"grad_norm": 2.625,
|
|
"learning_rate": 1.403272052622702e-06,
|
|
"loss": 1.9131620407104493,
|
|
"mean_token_accuracy": 0.5865709237754345,
|
|
"num_tokens": 37127963.0,
|
|
"step": 5410
|
|
},
|
|
{
|
|
"entropy": 1.875563132762909,
|
|
"epoch": 0.8685723443040003,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 1.3864058019902177e-06,
|
|
"loss": 1.9106025695800781,
|
|
"mean_token_accuracy": 0.57944978736341,
|
|
"num_tokens": 37198896.0,
|
|
"step": 5420
|
|
},
|
|
{
|
|
"entropy": 1.8328796833753587,
|
|
"epoch": 0.8701748763045613,
|
|
"grad_norm": 2.78125,
|
|
"learning_rate": 1.3695395513577333e-06,
|
|
"loss": 1.8999868392944337,
|
|
"mean_token_accuracy": 0.5887691337615252,
|
|
"num_tokens": 37266555.0,
|
|
"step": 5430
|
|
},
|
|
{
|
|
"entropy": 1.8776087261736394,
|
|
"epoch": 0.8717774083051221,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 1.3526733007252488e-06,
|
|
"loss": 1.9219970703125,
|
|
"mean_token_accuracy": 0.5799083292484284,
|
|
"num_tokens": 37337861.0,
|
|
"step": 5440
|
|
},
|
|
{
|
|
"entropy": 1.9137307450175285,
|
|
"epoch": 0.873379940305683,
|
|
"grad_norm": 2.6875,
|
|
"learning_rate": 1.3358070500927644e-06,
|
|
"loss": 1.9520265579223632,
|
|
"mean_token_accuracy": 0.5753105688840151,
|
|
"num_tokens": 37408519.0,
|
|
"step": 5450
|
|
},
|
|
{
|
|
"entropy": 1.8622472748160361,
|
|
"epoch": 0.8749824723062438,
|
|
"grad_norm": 3.234375,
|
|
"learning_rate": 1.31894079946028e-06,
|
|
"loss": 1.899980354309082,
|
|
"mean_token_accuracy": 0.5822821542620659,
|
|
"num_tokens": 37476669.0,
|
|
"step": 5460
|
|
},
|
|
{
|
|
"entropy": 1.8612875059247016,
|
|
"epoch": 0.8765850043068047,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 1.3020745488277958e-06,
|
|
"loss": 1.911638069152832,
|
|
"mean_token_accuracy": 0.5831337984651327,
|
|
"num_tokens": 37546286.0,
|
|
"step": 5470
|
|
},
|
|
{
|
|
"entropy": 1.8205799013376236,
|
|
"epoch": 0.8781875363073657,
|
|
"grad_norm": 2.84375,
|
|
"learning_rate": 1.2852082981953112e-06,
|
|
"loss": 1.8920133590698243,
|
|
"mean_token_accuracy": 0.5909904126077891,
|
|
"num_tokens": 37617453.0,
|
|
"step": 5480
|
|
},
|
|
{
|
|
"entropy": 1.8669624656438828,
|
|
"epoch": 0.8797900683079265,
|
|
"grad_norm": 3.171875,
|
|
"learning_rate": 1.2683420475628269e-06,
|
|
"loss": 1.9207725524902344,
|
|
"mean_token_accuracy": 0.5827377833425998,
|
|
"num_tokens": 37687831.0,
|
|
"step": 5490
|
|
},
|
|
{
|
|
"entropy": 1.8486655861139298,
|
|
"epoch": 0.8813926003084874,
|
|
"grad_norm": 2.78125,
|
|
"learning_rate": 1.2514757969303425e-06,
|
|
"loss": 1.881540870666504,
|
|
"mean_token_accuracy": 0.5863363519310951,
|
|
"num_tokens": 37755218.0,
|
|
"step": 5500
|
|
},
|
|
{
|
|
"entropy": 1.844733679294586,
|
|
"epoch": 0.8829951323090482,
|
|
"grad_norm": 3.015625,
|
|
"learning_rate": 1.2346095462978582e-06,
|
|
"loss": 1.910595703125,
|
|
"mean_token_accuracy": 0.5841306939721107,
|
|
"num_tokens": 37824810.0,
|
|
"step": 5510
|
|
},
|
|
{
|
|
"entropy": 1.812732180953026,
|
|
"epoch": 0.8845976643096092,
|
|
"grad_norm": 2.921875,
|
|
"learning_rate": 1.2177432956653736e-06,
|
|
"loss": 1.8701910018920898,
|
|
"mean_token_accuracy": 0.5909413047134876,
|
|
"num_tokens": 37890678.0,
|
|
"step": 5520
|
|
},
|
|
{
|
|
"entropy": 1.892632459849119,
|
|
"epoch": 0.8862001963101701,
|
|
"grad_norm": 3.078125,
|
|
"learning_rate": 1.2008770450328893e-06,
|
|
"loss": 1.9323055267333984,
|
|
"mean_token_accuracy": 0.5802071906626225,
|
|
"num_tokens": 37961740.0,
|
|
"step": 5530
|
|
},
|
|
{
|
|
"entropy": 1.7887009508907794,
|
|
"epoch": 0.8878027283107309,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 1.184010794400405e-06,
|
|
"loss": 1.8533214569091796,
|
|
"mean_token_accuracy": 0.5976423732936382,
|
|
"num_tokens": 38026435.0,
|
|
"step": 5540
|
|
},
|
|
{
|
|
"entropy": 1.8592222422361373,
|
|
"epoch": 0.8894052603112919,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 1.1671445437679204e-06,
|
|
"loss": 1.9166738510131835,
|
|
"mean_token_accuracy": 0.5843483276665211,
|
|
"num_tokens": 38093902.0,
|
|
"step": 5550
|
|
},
|
|
{
|
|
"entropy": 1.8362051859498023,
|
|
"epoch": 0.8910077923118527,
|
|
"grad_norm": 2.75,
|
|
"learning_rate": 1.150278293135436e-06,
|
|
"loss": 1.8831689834594727,
|
|
"mean_token_accuracy": 0.5898423045873642,
|
|
"num_tokens": 38159392.0,
|
|
"step": 5560
|
|
},
|
|
{
|
|
"entropy": 1.8008449248969556,
|
|
"epoch": 0.8926103243124136,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 1.1334120425029517e-06,
|
|
"loss": 1.8782642364501954,
|
|
"mean_token_accuracy": 0.5952645525336265,
|
|
"num_tokens": 38227315.0,
|
|
"step": 5570
|
|
},
|
|
{
|
|
"entropy": 1.8333451189100742,
|
|
"epoch": 0.8942128563129745,
|
|
"grad_norm": 3.015625,
|
|
"learning_rate": 1.1165457918704672e-06,
|
|
"loss": 1.881983757019043,
|
|
"mean_token_accuracy": 0.5908118661493063,
|
|
"num_tokens": 38293521.0,
|
|
"step": 5580
|
|
},
|
|
{
|
|
"entropy": 1.802014109492302,
|
|
"epoch": 0.8958153883135354,
|
|
"grad_norm": 2.734375,
|
|
"learning_rate": 1.0996795412379828e-06,
|
|
"loss": 1.8676593780517579,
|
|
"mean_token_accuracy": 0.5922972787171602,
|
|
"num_tokens": 38360577.0,
|
|
"step": 5590
|
|
},
|
|
{
|
|
"entropy": 1.8505891650915145,
|
|
"epoch": 0.8974179203140963,
|
|
"grad_norm": 2.953125,
|
|
"learning_rate": 1.0828132906054985e-06,
|
|
"loss": 1.9128009796142578,
|
|
"mean_token_accuracy": 0.5826629012823105,
|
|
"num_tokens": 38428404.0,
|
|
"step": 5600
|
|
},
|
|
{
|
|
"entropy": 1.8447042502462865,
|
|
"epoch": 0.8990204523146571,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 1.065947039973014e-06,
|
|
"loss": 1.8999542236328124,
|
|
"mean_token_accuracy": 0.5868043266236782,
|
|
"num_tokens": 38494320.0,
|
|
"step": 5610
|
|
},
|
|
{
|
|
"entropy": 1.8725532680749892,
|
|
"epoch": 0.900622984315218,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 1.0490807893405296e-06,
|
|
"loss": 1.9284070968627929,
|
|
"mean_token_accuracy": 0.5785685375332832,
|
|
"num_tokens": 38565397.0,
|
|
"step": 5620
|
|
},
|
|
{
|
|
"entropy": 1.788800986111164,
|
|
"epoch": 0.902225516315779,
|
|
"grad_norm": 2.921875,
|
|
"learning_rate": 1.0322145387080453e-06,
|
|
"loss": 1.8518497467041015,
|
|
"mean_token_accuracy": 0.5960364241153002,
|
|
"num_tokens": 38631352.0,
|
|
"step": 5630
|
|
},
|
|
{
|
|
"entropy": 1.8663704261183738,
|
|
"epoch": 0.9038280483163398,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 1.015348288075561e-06,
|
|
"loss": 1.9133312225341796,
|
|
"mean_token_accuracy": 0.580243082344532,
|
|
"num_tokens": 38703513.0,
|
|
"step": 5640
|
|
},
|
|
{
|
|
"entropy": 1.8696530893445016,
|
|
"epoch": 0.9054305803169007,
|
|
"grad_norm": 3.078125,
|
|
"learning_rate": 9.984820374430764e-07,
|
|
"loss": 1.9072153091430664,
|
|
"mean_token_accuracy": 0.5836617544293403,
|
|
"num_tokens": 38771109.0,
|
|
"step": 5650
|
|
},
|
|
{
|
|
"entropy": 1.8581979684531689,
|
|
"epoch": 0.9070331123174616,
|
|
"grad_norm": 3.203125,
|
|
"learning_rate": 9.81615786810592e-07,
|
|
"loss": 1.9353012084960937,
|
|
"mean_token_accuracy": 0.58640504963696,
|
|
"num_tokens": 38840595.0,
|
|
"step": 5660
|
|
},
|
|
{
|
|
"entropy": 1.8999485149979591,
|
|
"epoch": 0.9086356443180225,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 9.647495361781077e-07,
|
|
"loss": 1.9293127059936523,
|
|
"mean_token_accuracy": 0.5741612739861012,
|
|
"num_tokens": 38911161.0,
|
|
"step": 5670
|
|
},
|
|
{
|
|
"entropy": 1.8909139916300775,
|
|
"epoch": 0.9102381763185834,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 9.478832855456233e-07,
|
|
"loss": 1.943209457397461,
|
|
"mean_token_accuracy": 0.5803187564015388,
|
|
"num_tokens": 38979663.0,
|
|
"step": 5680
|
|
},
|
|
{
|
|
"entropy": 1.8345882877707482,
|
|
"epoch": 0.9118407083191442,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 9.310170349131389e-07,
|
|
"loss": 1.8940544128417969,
|
|
"mean_token_accuracy": 0.5828323502093553,
|
|
"num_tokens": 39050266.0,
|
|
"step": 5690
|
|
},
|
|
{
|
|
"entropy": 1.8535967022180557,
|
|
"epoch": 0.9134432403197051,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 9.141507842806545e-07,
|
|
"loss": 1.9206104278564453,
|
|
"mean_token_accuracy": 0.5844812471419573,
|
|
"num_tokens": 39118119.0,
|
|
"step": 5700
|
|
},
|
|
{
|
|
"entropy": 1.8310791112482547,
|
|
"epoch": 0.9150457723202661,
|
|
"grad_norm": 3.125,
|
|
"learning_rate": 8.9728453364817e-07,
|
|
"loss": 1.8925857543945312,
|
|
"mean_token_accuracy": 0.591274730116129,
|
|
"num_tokens": 39184397.0,
|
|
"step": 5710
|
|
},
|
|
{
|
|
"entropy": 1.8014666005969047,
|
|
"epoch": 0.9166483043208269,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 8.804182830156857e-07,
|
|
"loss": 1.8689302444458007,
|
|
"mean_token_accuracy": 0.5962204236537219,
|
|
"num_tokens": 39250312.0,
|
|
"step": 5720
|
|
},
|
|
{
|
|
"entropy": 1.8697697766125203,
|
|
"epoch": 0.9182508363213878,
|
|
"grad_norm": 2.890625,
|
|
"learning_rate": 8.635520323832012e-07,
|
|
"loss": 1.9139211654663086,
|
|
"mean_token_accuracy": 0.5804957438260316,
|
|
"num_tokens": 39320105.0,
|
|
"step": 5730
|
|
},
|
|
{
|
|
"entropy": 1.8676650166511535,
|
|
"epoch": 0.9198533683219486,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 8.466857817507169e-07,
|
|
"loss": 1.9182451248168946,
|
|
"mean_token_accuracy": 0.5818617131561041,
|
|
"num_tokens": 39387355.0,
|
|
"step": 5740
|
|
},
|
|
{
|
|
"entropy": 1.8362473480403423,
|
|
"epoch": 0.9214559003225096,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 8.298195311182325e-07,
|
|
"loss": 1.8849479675292968,
|
|
"mean_token_accuracy": 0.5921859316527843,
|
|
"num_tokens": 39453933.0,
|
|
"step": 5750
|
|
},
|
|
{
|
|
"entropy": 1.8936782360076905,
|
|
"epoch": 0.9230584323230705,
|
|
"grad_norm": 3.765625,
|
|
"learning_rate": 8.12953280485748e-07,
|
|
"loss": 1.94251708984375,
|
|
"mean_token_accuracy": 0.5773557811975479,
|
|
"num_tokens": 39523210.0,
|
|
"step": 5760
|
|
},
|
|
{
|
|
"entropy": 1.8765916638076305,
|
|
"epoch": 0.9246609643236313,
|
|
"grad_norm": 3.09375,
|
|
"learning_rate": 7.960870298532637e-07,
|
|
"loss": 1.9312158584594727,
|
|
"mean_token_accuracy": 0.5803747341036797,
|
|
"num_tokens": 39595139.0,
|
|
"step": 5770
|
|
},
|
|
{
|
|
"entropy": 1.8852329470217228,
|
|
"epoch": 0.9262634963241922,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 7.792207792207792e-07,
|
|
"loss": 1.9441871643066406,
|
|
"mean_token_accuracy": 0.5775437675416469,
|
|
"num_tokens": 39666767.0,
|
|
"step": 5780
|
|
},
|
|
{
|
|
"entropy": 1.8359283626079559,
|
|
"epoch": 0.9278660283247531,
|
|
"grad_norm": 2.828125,
|
|
"learning_rate": 7.62354528588295e-07,
|
|
"loss": 1.8917394638061524,
|
|
"mean_token_accuracy": 0.5900426283478737,
|
|
"num_tokens": 39733631.0,
|
|
"step": 5790
|
|
},
|
|
{
|
|
"entropy": 1.8818567633628844,
|
|
"epoch": 0.929468560325314,
|
|
"grad_norm": 3.03125,
|
|
"learning_rate": 7.454882779558105e-07,
|
|
"loss": 1.9617582321166993,
|
|
"mean_token_accuracy": 0.5813181817531585,
|
|
"num_tokens": 39803663.0,
|
|
"step": 5800
|
|
},
|
|
{
|
|
"entropy": 1.839282288402319,
|
|
"epoch": 0.9310710923258749,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 7.28622027323326e-07,
|
|
"loss": 1.9438974380493164,
|
|
"mean_token_accuracy": 0.5880431465804576,
|
|
"num_tokens": 39874603.0,
|
|
"step": 5810
|
|
},
|
|
{
|
|
"entropy": 1.8572435699403287,
|
|
"epoch": 0.9326736243264357,
|
|
"grad_norm": 2.890625,
|
|
"learning_rate": 7.117557766908418e-07,
|
|
"loss": 1.9279142379760743,
|
|
"mean_token_accuracy": 0.5857914865016938,
|
|
"num_tokens": 39944298.0,
|
|
"step": 5820
|
|
},
|
|
{
|
|
"entropy": 1.832928830385208,
|
|
"epoch": 0.9342761563269967,
|
|
"grad_norm": 3.015625,
|
|
"learning_rate": 6.948895260583573e-07,
|
|
"loss": 1.8981988906860352,
|
|
"mean_token_accuracy": 0.5886461935937405,
|
|
"num_tokens": 40013681.0,
|
|
"step": 5830
|
|
},
|
|
{
|
|
"entropy": 1.8386280879378318,
|
|
"epoch": 0.9358786883275575,
|
|
"grad_norm": 2.75,
|
|
"learning_rate": 6.780232754258729e-07,
|
|
"loss": 1.8867168426513672,
|
|
"mean_token_accuracy": 0.5850611589848995,
|
|
"num_tokens": 40081484.0,
|
|
"step": 5840
|
|
},
|
|
{
|
|
"entropy": 1.826653690636158,
|
|
"epoch": 0.9374812203281184,
|
|
"grad_norm": 3.09375,
|
|
"learning_rate": 6.611570247933885e-07,
|
|
"loss": 1.8758953094482422,
|
|
"mean_token_accuracy": 0.5902330029755831,
|
|
"num_tokens": 40147306.0,
|
|
"step": 5850
|
|
},
|
|
{
|
|
"entropy": 1.8569243192672729,
|
|
"epoch": 0.9390837523286794,
|
|
"grad_norm": 2.6875,
|
|
"learning_rate": 6.442907741609041e-07,
|
|
"loss": 1.9039873123168944,
|
|
"mean_token_accuracy": 0.5841257013380527,
|
|
"num_tokens": 40217272.0,
|
|
"step": 5860
|
|
},
|
|
{
|
|
"entropy": 1.8387947618961333,
|
|
"epoch": 0.9406862843292402,
|
|
"grad_norm": 2.734375,
|
|
"learning_rate": 6.274245235284197e-07,
|
|
"loss": 1.9156251907348634,
|
|
"mean_token_accuracy": 0.5889201257377863,
|
|
"num_tokens": 40284855.0,
|
|
"step": 5870
|
|
},
|
|
{
|
|
"entropy": 1.8239695675671102,
|
|
"epoch": 0.9422888163298011,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 6.105582728959353e-07,
|
|
"loss": 1.8879735946655274,
|
|
"mean_token_accuracy": 0.591039814800024,
|
|
"num_tokens": 40351023.0,
|
|
"step": 5880
|
|
},
|
|
{
|
|
"entropy": 1.7918000653386117,
|
|
"epoch": 0.9438913483303619,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 5.936920222634509e-07,
|
|
"loss": 1.8323190689086915,
|
|
"mean_token_accuracy": 0.5958353541791439,
|
|
"num_tokens": 40415218.0,
|
|
"step": 5890
|
|
},
|
|
{
|
|
"entropy": 1.8455849036574363,
|
|
"epoch": 0.9454938803309229,
|
|
"grad_norm": 2.84375,
|
|
"learning_rate": 5.768257716309665e-07,
|
|
"loss": 1.8803943634033202,
|
|
"mean_token_accuracy": 0.5886748474091291,
|
|
"num_tokens": 40482300.0,
|
|
"step": 5900
|
|
},
|
|
{
|
|
"entropy": 1.8429814413189889,
|
|
"epoch": 0.9470964123314838,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 5.599595209984821e-07,
|
|
"loss": 1.903822135925293,
|
|
"mean_token_accuracy": 0.590263594314456,
|
|
"num_tokens": 40549426.0,
|
|
"step": 5910
|
|
},
|
|
{
|
|
"entropy": 1.8786433458328247,
|
|
"epoch": 0.9486989443320446,
|
|
"grad_norm": 2.953125,
|
|
"learning_rate": 5.430932703659976e-07,
|
|
"loss": 1.9294485092163085,
|
|
"mean_token_accuracy": 0.5808563213795424,
|
|
"num_tokens": 40615905.0,
|
|
"step": 5920
|
|
},
|
|
{
|
|
"entropy": 1.8201900728046894,
|
|
"epoch": 0.9503014763326055,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 5.262270197335133e-07,
|
|
"loss": 1.8631288528442382,
|
|
"mean_token_accuracy": 0.5932236719876528,
|
|
"num_tokens": 40682893.0,
|
|
"step": 5930
|
|
},
|
|
{
|
|
"entropy": 1.890999047458172,
|
|
"epoch": 0.9519040083331664,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 5.093607691010289e-07,
|
|
"loss": 1.9362371444702149,
|
|
"mean_token_accuracy": 0.5777292806655169,
|
|
"num_tokens": 40750336.0,
|
|
"step": 5940
|
|
},
|
|
{
|
|
"entropy": 1.8011705093085766,
|
|
"epoch": 0.9535065403337273,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 4.924945184685445e-07,
|
|
"loss": 1.8577068328857422,
|
|
"mean_token_accuracy": 0.5976326711475849,
|
|
"num_tokens": 40816136.0,
|
|
"step": 5950
|
|
},
|
|
{
|
|
"entropy": 1.8403367862105369,
|
|
"epoch": 0.9551090723342882,
|
|
"grad_norm": 2.9375,
|
|
"learning_rate": 4.7562826783606005e-07,
|
|
"loss": 1.9028356552124024,
|
|
"mean_token_accuracy": 0.5863358832895755,
|
|
"num_tokens": 40884407.0,
|
|
"step": 5960
|
|
},
|
|
{
|
|
"entropy": 1.8023689292371272,
|
|
"epoch": 0.956711604334849,
|
|
"grad_norm": 2.6875,
|
|
"learning_rate": 4.5876201720357566e-07,
|
|
"loss": 1.8804582595825194,
|
|
"mean_token_accuracy": 0.595867944508791,
|
|
"num_tokens": 40953133.0,
|
|
"step": 5970
|
|
},
|
|
{
|
|
"entropy": 1.8206961631774903,
|
|
"epoch": 0.95831413633541,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 4.4189576657109127e-07,
|
|
"loss": 1.900848388671875,
|
|
"mean_token_accuracy": 0.5918670609593392,
|
|
"num_tokens": 41020901.0,
|
|
"step": 5980
|
|
},
|
|
{
|
|
"entropy": 1.831934504956007,
|
|
"epoch": 0.9599166683359708,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 4.250295159386069e-07,
|
|
"loss": 1.8994543075561523,
|
|
"mean_token_accuracy": 0.588746365904808,
|
|
"num_tokens": 41089718.0,
|
|
"step": 5990
|
|
},
|
|
{
|
|
"entropy": 1.8424327656626702,
|
|
"epoch": 0.9615192003365317,
|
|
"grad_norm": 2.96875,
|
|
"learning_rate": 4.0816326530612243e-07,
|
|
"loss": 1.8773746490478516,
|
|
"mean_token_accuracy": 0.5854915887117386,
|
|
"num_tokens": 41159377.0,
|
|
"step": 6000
|
|
},
|
|
{
|
|
"entropy": 1.775068336725235,
|
|
"epoch": 0.9631217323370926,
|
|
"grad_norm": 3.015625,
|
|
"learning_rate": 3.912970146736381e-07,
|
|
"loss": 1.8501998901367187,
|
|
"mean_token_accuracy": 0.5993145342916251,
|
|
"num_tokens": 41224229.0,
|
|
"step": 6010
|
|
},
|
|
{
|
|
"entropy": 1.8535139806568623,
|
|
"epoch": 0.9647242643376535,
|
|
"grad_norm": 2.65625,
|
|
"learning_rate": 3.744307640411537e-07,
|
|
"loss": 1.9236631393432617,
|
|
"mean_token_accuracy": 0.5842952460050583,
|
|
"num_tokens": 41293701.0,
|
|
"step": 6020
|
|
},
|
|
{
|
|
"entropy": 1.8634035423398019,
|
|
"epoch": 0.9663267963382144,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 3.575645134086693e-07,
|
|
"loss": 1.901199722290039,
|
|
"mean_token_accuracy": 0.5833870090544224,
|
|
"num_tokens": 41362831.0,
|
|
"step": 6030
|
|
},
|
|
{
|
|
"entropy": 1.8594874814152718,
|
|
"epoch": 0.9679293283387753,
|
|
"grad_norm": 2.828125,
|
|
"learning_rate": 3.406982627761849e-07,
|
|
"loss": 1.908275032043457,
|
|
"mean_token_accuracy": 0.5845970336347819,
|
|
"num_tokens": 41430854.0,
|
|
"step": 6040
|
|
},
|
|
{
|
|
"entropy": 1.8676169857382774,
|
|
"epoch": 0.9695318603393361,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 3.2383201214370046e-07,
|
|
"loss": 1.9279546737670898,
|
|
"mean_token_accuracy": 0.5803915828466415,
|
|
"num_tokens": 41500576.0,
|
|
"step": 6050
|
|
},
|
|
{
|
|
"entropy": 1.9107640534639359,
|
|
"epoch": 0.9711343923398971,
|
|
"grad_norm": 3.21875,
|
|
"learning_rate": 3.0696576151121607e-07,
|
|
"loss": 1.960128402709961,
|
|
"mean_token_accuracy": 0.5723039723932744,
|
|
"num_tokens": 41570197.0,
|
|
"step": 6060
|
|
},
|
|
{
|
|
"entropy": 1.852728360891342,
|
|
"epoch": 0.9727369243404579,
|
|
"grad_norm": 2.828125,
|
|
"learning_rate": 2.900995108787317e-07,
|
|
"loss": 1.9074199676513672,
|
|
"mean_token_accuracy": 0.5860687278211116,
|
|
"num_tokens": 41637859.0,
|
|
"step": 6070
|
|
},
|
|
{
|
|
"entropy": 1.8482899755239486,
|
|
"epoch": 0.9743394563410188,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 2.732332602462473e-07,
|
|
"loss": 1.9062208175659179,
|
|
"mean_token_accuracy": 0.5821232583373785,
|
|
"num_tokens": 41707538.0,
|
|
"step": 6080
|
|
},
|
|
{
|
|
"entropy": 1.8607835844159126,
|
|
"epoch": 0.9759419883415797,
|
|
"grad_norm": 2.734375,
|
|
"learning_rate": 2.563670096137629e-07,
|
|
"loss": 1.9100791931152343,
|
|
"mean_token_accuracy": 0.5810363296419382,
|
|
"num_tokens": 41777379.0,
|
|
"step": 6090
|
|
},
|
|
{
|
|
"entropy": 1.8598943777382373,
|
|
"epoch": 0.9775445203421406,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 2.395007589812785e-07,
|
|
"loss": 1.9228595733642577,
|
|
"mean_token_accuracy": 0.5857084028422832,
|
|
"num_tokens": 41843062.0,
|
|
"step": 6100
|
|
},
|
|
{
|
|
"entropy": 1.8349303409457207,
|
|
"epoch": 0.9791470523427015,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 2.2263450834879408e-07,
|
|
"loss": 1.8791229248046875,
|
|
"mean_token_accuracy": 0.590753136947751,
|
|
"num_tokens": 41910227.0,
|
|
"step": 6110
|
|
},
|
|
{
|
|
"entropy": 1.7299993604421615,
|
|
"epoch": 0.9807495843432623,
|
|
"grad_norm": 2.890625,
|
|
"learning_rate": 2.057682577163097e-07,
|
|
"loss": 1.8145219802856445,
|
|
"mean_token_accuracy": 0.6077951058745384,
|
|
"num_tokens": 41974421.0,
|
|
"step": 6120
|
|
},
|
|
{
|
|
"entropy": 1.9011049136519431,
|
|
"epoch": 0.9823521163438232,
|
|
"grad_norm": 2.9375,
|
|
"learning_rate": 1.8890200708382527e-07,
|
|
"loss": 1.9380456924438476,
|
|
"mean_token_accuracy": 0.5766681145876646,
|
|
"num_tokens": 42045797.0,
|
|
"step": 6130
|
|
},
|
|
{
|
|
"entropy": 1.8033956550061703,
|
|
"epoch": 0.9839546483443842,
|
|
"grad_norm": 2.8125,
|
|
"learning_rate": 1.7203575645134088e-07,
|
|
"loss": 1.8644264221191407,
|
|
"mean_token_accuracy": 0.5904493033885956,
|
|
"num_tokens": 42112332.0,
|
|
"step": 6140
|
|
},
|
|
{
|
|
"entropy": 1.8577637001872063,
|
|
"epoch": 0.985557180344945,
|
|
"grad_norm": 3.25,
|
|
"learning_rate": 1.5516950581885649e-07,
|
|
"loss": 1.9165401458740234,
|
|
"mean_token_accuracy": 0.5841254234313965,
|
|
"num_tokens": 42181504.0,
|
|
"step": 6150
|
|
},
|
|
{
|
|
"entropy": 1.8639202922582627,
|
|
"epoch": 0.9871597123455059,
|
|
"grad_norm": 3.09375,
|
|
"learning_rate": 1.383032551863721e-07,
|
|
"loss": 1.9187042236328125,
|
|
"mean_token_accuracy": 0.5859580975025892,
|
|
"num_tokens": 42247650.0,
|
|
"step": 6160
|
|
},
|
|
{
|
|
"entropy": 1.9042673364281655,
|
|
"epoch": 0.9887622443460667,
|
|
"grad_norm": 3.109375,
|
|
"learning_rate": 1.2143700455388767e-07,
|
|
"loss": 1.9495109558105468,
|
|
"mean_token_accuracy": 0.5765886418521404,
|
|
"num_tokens": 42318033.0,
|
|
"step": 6170
|
|
},
|
|
{
|
|
"entropy": 1.8380866006016732,
|
|
"epoch": 0.9903647763466277,
|
|
"grad_norm": 2.6875,
|
|
"learning_rate": 1.0457075392140328e-07,
|
|
"loss": 1.9063236236572265,
|
|
"mean_token_accuracy": 0.5875726152211428,
|
|
"num_tokens": 42386158.0,
|
|
"step": 6180
|
|
},
|
|
{
|
|
"entropy": 1.871013981103897,
|
|
"epoch": 0.9919673083471886,
|
|
"grad_norm": 2.921875,
|
|
"learning_rate": 8.770450328891888e-08,
|
|
"loss": 1.9296409606933593,
|
|
"mean_token_accuracy": 0.5827766362577677,
|
|
"num_tokens": 42456203.0,
|
|
"step": 6190
|
|
},
|
|
{
|
|
"entropy": 1.84286737293005,
|
|
"epoch": 0.9935698403477494,
|
|
"grad_norm": 3.1875,
|
|
"learning_rate": 7.083825265643448e-08,
|
|
"loss": 1.9174055099487304,
|
|
"mean_token_accuracy": 0.5898357950150966,
|
|
"num_tokens": 42523293.0,
|
|
"step": 6200
|
|
},
|
|
{
|
|
"entropy": 1.8976394981145859,
|
|
"epoch": 0.9951723723483104,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 5.397200202395008e-08,
|
|
"loss": 1.966810417175293,
|
|
"mean_token_accuracy": 0.5724526148289442,
|
|
"num_tokens": 42595973.0,
|
|
"step": 6210
|
|
},
|
|
{
|
|
"entropy": 1.8372694373130798,
|
|
"epoch": 0.9967749043488712,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 3.710575139146568e-08,
|
|
"loss": 1.8860355377197267,
|
|
"mean_token_accuracy": 0.5865787580609322,
|
|
"num_tokens": 42663904.0,
|
|
"step": 6220
|
|
},
|
|
{
|
|
"entropy": 1.8298647806048394,
|
|
"epoch": 0.9983774363494321,
|
|
"grad_norm": 2.5625,
|
|
"learning_rate": 2.023950075898128e-08,
|
|
"loss": 1.8837800979614259,
|
|
"mean_token_accuracy": 0.5879415862262249,
|
|
"num_tokens": 42732619.0,
|
|
"step": 6230
|
|
},
|
|
{
|
|
"entropy": 1.8752723596990108,
|
|
"epoch": 0.999979968349993,
|
|
"grad_norm": 2.984375,
|
|
"learning_rate": 3.37325012649688e-09,
|
|
"loss": 1.9457399368286132,
|
|
"mean_token_accuracy": 0.5779070716351271,
|
|
"num_tokens": 42805759.0,
|
|
"step": 6240
|
|
}
|
|
],
|
|
"logging_steps": 10,
|
|
"max_steps": 6241,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 1,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": true
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 4.338653249407058e+17,
|
|
"train_batch_size": 2,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|