Files
dan-latn-10mb-100mb_seed3407/checkpoint-3000/trainer_state.json
ModelHub XC cc5255ece4 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/dan-latn-10mb-100mb_seed3407
Source: Original Platform
2026-08-03 16:17:23 +08:00

6046 lines
164 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.25058469762779817,
"eval_steps": 3000,
"global_step": 3000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.742597389221192,
"epoch": 0.000417641162712997,
"grad_norm": 5.3125,
"learning_rate": 2e-06,
"loss": 10.7497,
"mean_token_accuracy": 0.00011876485077664257,
"num_tokens": 9371.0,
"step": 5
},
{
"entropy": 10.742581462860107,
"epoch": 0.000835282325425994,
"grad_norm": 5.15625,
"learning_rate": 4.5e-06,
"loss": 10.7312,
"mean_token_accuracy": 0.0,
"num_tokens": 18155.0,
"step": 10
},
{
"entropy": 10.742617225646972,
"epoch": 0.001252923488138991,
"grad_norm": 4.96875,
"learning_rate": 7e-06,
"loss": 10.7253,
"mean_token_accuracy": 9.920635493472218e-05,
"num_tokens": 27776.0,
"step": 15
},
{
"entropy": 10.742653942108154,
"epoch": 0.001670564650851988,
"grad_norm": 5.09375,
"learning_rate": 9.5e-06,
"loss": 10.6672,
"mean_token_accuracy": 0.0005802143830806016,
"num_tokens": 37166.0,
"step": 20
},
{
"entropy": 10.74262170791626,
"epoch": 0.002088205813564985,
"grad_norm": 5.09375,
"learning_rate": 1.2e-05,
"loss": 10.5444,
"mean_token_accuracy": 0.010037525719963015,
"num_tokens": 46667.0,
"step": 25
},
{
"entropy": 10.742273426055908,
"epoch": 0.002505846976277982,
"grad_norm": 4.1875,
"learning_rate": 1.4500000000000002e-05,
"loss": 10.4193,
"mean_token_accuracy": 0.0329294515773654,
"num_tokens": 55738.0,
"step": 30
},
{
"entropy": 10.74118251800537,
"epoch": 0.002923488138990979,
"grad_norm": 3.234375,
"learning_rate": 1.7000000000000003e-05,
"loss": 10.3134,
"mean_token_accuracy": 0.04002654887735844,
"num_tokens": 65303.0,
"step": 35
},
{
"entropy": 10.738407230377197,
"epoch": 0.003341129301703976,
"grad_norm": 2.78125,
"learning_rate": 1.95e-05,
"loss": 10.1216,
"mean_token_accuracy": 0.041297851502895354,
"num_tokens": 74876.0,
"step": 40
},
{
"entropy": 10.734228038787842,
"epoch": 0.003758770464416973,
"grad_norm": 2.203125,
"learning_rate": 2.2e-05,
"loss": 10.0124,
"mean_token_accuracy": 0.04665607586503029,
"num_tokens": 84683.0,
"step": 45
},
{
"entropy": 10.730060386657716,
"epoch": 0.00417641162712997,
"grad_norm": 2.25,
"learning_rate": 2.4500000000000003e-05,
"loss": 9.9446,
"mean_token_accuracy": 0.04418331272900104,
"num_tokens": 94511.0,
"step": 50
},
{
"entropy": 10.727671051025391,
"epoch": 0.004594052789842967,
"grad_norm": 2.015625,
"learning_rate": 2.7e-05,
"loss": 9.8593,
"mean_token_accuracy": 0.04506920985877514,
"num_tokens": 103820.0,
"step": 55
},
{
"entropy": 10.72537727355957,
"epoch": 0.005011693952555964,
"grad_norm": 1.984375,
"learning_rate": 2.95e-05,
"loss": 9.8006,
"mean_token_accuracy": 0.04406389705836773,
"num_tokens": 112398.0,
"step": 60
},
{
"entropy": 10.723227405548096,
"epoch": 0.005429335115268961,
"grad_norm": 2.046875,
"learning_rate": 3.2e-05,
"loss": 9.7404,
"mean_token_accuracy": 0.041664719581604004,
"num_tokens": 121167.0,
"step": 65
},
{
"entropy": 10.721342849731446,
"epoch": 0.005846976277981958,
"grad_norm": 1.9765625,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.67,
"mean_token_accuracy": 0.04505793582648039,
"num_tokens": 129399.0,
"step": 70
},
{
"entropy": 10.717985439300538,
"epoch": 0.006264617440694955,
"grad_norm": 2.03125,
"learning_rate": 3.7e-05,
"loss": 9.6274,
"mean_token_accuracy": 0.043670152127742765,
"num_tokens": 138512.0,
"step": 75
},
{
"entropy": 10.714579200744629,
"epoch": 0.006682258603407952,
"grad_norm": 1.84375,
"learning_rate": 3.95e-05,
"loss": 9.5989,
"mean_token_accuracy": 0.0400418970733881,
"num_tokens": 147712.0,
"step": 80
},
{
"entropy": 10.709438896179199,
"epoch": 0.007099899766120949,
"grad_norm": 1.9140625,
"learning_rate": 4.2000000000000004e-05,
"loss": 9.5111,
"mean_token_accuracy": 0.04463256634771824,
"num_tokens": 156759.0,
"step": 85
},
{
"entropy": 10.70057258605957,
"epoch": 0.007517540928833946,
"grad_norm": 2.0,
"learning_rate": 4.45e-05,
"loss": 9.4327,
"mean_token_accuracy": 0.044699374586343765,
"num_tokens": 166395.0,
"step": 90
},
{
"entropy": 10.690051460266114,
"epoch": 0.007935182091546943,
"grad_norm": 1.9609375,
"learning_rate": 4.7000000000000004e-05,
"loss": 9.3248,
"mean_token_accuracy": 0.05507284291088581,
"num_tokens": 174739.0,
"step": 95
},
{
"entropy": 10.674839115142822,
"epoch": 0.00835282325425994,
"grad_norm": 1.890625,
"learning_rate": 4.9500000000000004e-05,
"loss": 9.1931,
"mean_token_accuracy": 0.05993704758584499,
"num_tokens": 183010.0,
"step": 100
},
{
"entropy": 10.653488159179688,
"epoch": 0.008770464416972937,
"grad_norm": 1.8671875,
"learning_rate": 5.2e-05,
"loss": 9.16,
"mean_token_accuracy": 0.053666260465979575,
"num_tokens": 192589.0,
"step": 105
},
{
"entropy": 10.622858619689941,
"epoch": 0.009188105579685933,
"grad_norm": 1.890625,
"learning_rate": 5.45e-05,
"loss": 9.013,
"mean_token_accuracy": 0.06004327610135078,
"num_tokens": 201638.0,
"step": 110
},
{
"entropy": 10.569721031188966,
"epoch": 0.00960574674239893,
"grad_norm": 1.9296875,
"learning_rate": 5.7e-05,
"loss": 8.89,
"mean_token_accuracy": 0.05817726403474808,
"num_tokens": 209862.0,
"step": 115
},
{
"entropy": 10.519128704071045,
"epoch": 0.010023387905111928,
"grad_norm": 1.703125,
"learning_rate": 5.9499999999999996e-05,
"loss": 8.8803,
"mean_token_accuracy": 0.04828422553837299,
"num_tokens": 218897.0,
"step": 120
},
{
"entropy": 10.48040943145752,
"epoch": 0.010441029067824925,
"grad_norm": 1.7109375,
"learning_rate": 6.2e-05,
"loss": 8.7326,
"mean_token_accuracy": 0.057341094315052035,
"num_tokens": 227682.0,
"step": 125
},
{
"entropy": 10.404988002777099,
"epoch": 0.010858670230537921,
"grad_norm": 1.734375,
"learning_rate": 6.450000000000001e-05,
"loss": 8.5531,
"mean_token_accuracy": 0.05646193064749241,
"num_tokens": 236170.0,
"step": 130
},
{
"entropy": 10.337473011016845,
"epoch": 0.011276311393250919,
"grad_norm": 1.53125,
"learning_rate": 6.7e-05,
"loss": 8.5016,
"mean_token_accuracy": 0.054118812829256055,
"num_tokens": 245710.0,
"step": 135
},
{
"entropy": 10.269655227661133,
"epoch": 0.011693952555963916,
"grad_norm": 1.7421875,
"learning_rate": 6.950000000000001e-05,
"loss": 8.3193,
"mean_token_accuracy": 0.06037080101668835,
"num_tokens": 254751.0,
"step": 140
},
{
"entropy": 10.123066329956055,
"epoch": 0.012111593718676913,
"grad_norm": 1.5390625,
"learning_rate": 7.2e-05,
"loss": 8.1922,
"mean_token_accuracy": 0.06263931393623352,
"num_tokens": 264210.0,
"step": 145
},
{
"entropy": 10.026834297180176,
"epoch": 0.01252923488138991,
"grad_norm": 1.5,
"learning_rate": 7.45e-05,
"loss": 8.1098,
"mean_token_accuracy": 0.06494732424616814,
"num_tokens": 272944.0,
"step": 150
},
{
"entropy": 9.923717784881593,
"epoch": 0.012946876044102907,
"grad_norm": 1.5078125,
"learning_rate": 7.7e-05,
"loss": 7.9366,
"mean_token_accuracy": 0.06645521372556687,
"num_tokens": 281311.0,
"step": 155
},
{
"entropy": 9.686262702941894,
"epoch": 0.013364517206815904,
"grad_norm": 1.203125,
"learning_rate": 7.950000000000001e-05,
"loss": 7.8102,
"mean_token_accuracy": 0.06696667969226837,
"num_tokens": 289701.0,
"step": 160
},
{
"entropy": 9.53008050918579,
"epoch": 0.013782158369528901,
"grad_norm": 1.1328125,
"learning_rate": 8.2e-05,
"loss": 7.8033,
"mean_token_accuracy": 0.06480560302734376,
"num_tokens": 299459.0,
"step": 165
},
{
"entropy": 9.334712505340576,
"epoch": 0.014199799532241897,
"grad_norm": 1.125,
"learning_rate": 8.450000000000001e-05,
"loss": 7.7276,
"mean_token_accuracy": 0.06751208230853081,
"num_tokens": 309343.0,
"step": 170
},
{
"entropy": 9.117801856994628,
"epoch": 0.014617440694954895,
"grad_norm": 1.125,
"learning_rate": 8.7e-05,
"loss": 7.6628,
"mean_token_accuracy": 0.06329603157937527,
"num_tokens": 318840.0,
"step": 175
},
{
"entropy": 8.88758544921875,
"epoch": 0.015035081857667892,
"grad_norm": 1.046875,
"learning_rate": 8.95e-05,
"loss": 7.4494,
"mean_token_accuracy": 0.07078598737716675,
"num_tokens": 328689.0,
"step": 180
},
{
"entropy": 8.713505363464355,
"epoch": 0.01545272302038089,
"grad_norm": 1.015625,
"learning_rate": 9.2e-05,
"loss": 7.5296,
"mean_token_accuracy": 0.07133941762149335,
"num_tokens": 338209.0,
"step": 185
},
{
"entropy": 8.533864212036132,
"epoch": 0.015870364183093885,
"grad_norm": 0.875,
"learning_rate": 9.45e-05,
"loss": 7.3715,
"mean_token_accuracy": 0.07491575330495834,
"num_tokens": 347270.0,
"step": 190
},
{
"entropy": 8.331917572021485,
"epoch": 0.016288005345806884,
"grad_norm": 1.21875,
"learning_rate": 9.7e-05,
"loss": 7.3864,
"mean_token_accuracy": 0.07862697467207909,
"num_tokens": 356366.0,
"step": 195
},
{
"entropy": 8.292905139923096,
"epoch": 0.01670564650851988,
"grad_norm": 1.078125,
"learning_rate": 9.95e-05,
"loss": 7.3321,
"mean_token_accuracy": 0.07781913727521897,
"num_tokens": 365980.0,
"step": 200
},
{
"entropy": 8.17343864440918,
"epoch": 0.017123287671232876,
"grad_norm": 0.94140625,
"learning_rate": 0.000102,
"loss": 7.2859,
"mean_token_accuracy": 0.08276912495493889,
"num_tokens": 374591.0,
"step": 205
},
{
"entropy": 8.114312171936035,
"epoch": 0.017540928833945875,
"grad_norm": 0.9609375,
"learning_rate": 0.00010449999999999999,
"loss": 7.2652,
"mean_token_accuracy": 0.08255952596664429,
"num_tokens": 383250.0,
"step": 210
},
{
"entropy": 8.142033052444457,
"epoch": 0.01795856999665887,
"grad_norm": 1.109375,
"learning_rate": 0.000107,
"loss": 7.1955,
"mean_token_accuracy": 0.07966764494776726,
"num_tokens": 391502.0,
"step": 215
},
{
"entropy": 8.033121585845947,
"epoch": 0.018376211159371866,
"grad_norm": 1.140625,
"learning_rate": 0.0001095,
"loss": 7.1094,
"mean_token_accuracy": 0.08625469133257865,
"num_tokens": 400225.0,
"step": 220
},
{
"entropy": 8.037012720108033,
"epoch": 0.018793852322084866,
"grad_norm": 1.0,
"learning_rate": 0.000112,
"loss": 7.3113,
"mean_token_accuracy": 0.07627052702009678,
"num_tokens": 410008.0,
"step": 225
},
{
"entropy": 7.976403427124024,
"epoch": 0.01921149348479786,
"grad_norm": 1.0,
"learning_rate": 0.0001145,
"loss": 7.2122,
"mean_token_accuracy": 0.08434663638472557,
"num_tokens": 418979.0,
"step": 230
},
{
"entropy": 7.954119348526001,
"epoch": 0.01962913464751086,
"grad_norm": 0.953125,
"learning_rate": 0.00011700000000000001,
"loss": 7.1858,
"mean_token_accuracy": 0.08367608934640884,
"num_tokens": 428139.0,
"step": 235
},
{
"entropy": 7.8628496646881105,
"epoch": 0.020046775810223856,
"grad_norm": 1.1171875,
"learning_rate": 0.00011949999999999999,
"loss": 7.1046,
"mean_token_accuracy": 0.08570514917373658,
"num_tokens": 437113.0,
"step": 240
},
{
"entropy": 7.932403039932251,
"epoch": 0.020464416972936852,
"grad_norm": 1.09375,
"learning_rate": 0.000122,
"loss": 7.2954,
"mean_token_accuracy": 0.08083686679601669,
"num_tokens": 446879.0,
"step": 245
},
{
"entropy": 7.807932806015015,
"epoch": 0.02088205813564985,
"grad_norm": 1.03125,
"learning_rate": 0.0001245,
"loss": 7.1784,
"mean_token_accuracy": 0.08404311686754226,
"num_tokens": 456362.0,
"step": 250
},
{
"entropy": 7.829455995559693,
"epoch": 0.021299699298362847,
"grad_norm": 1.25,
"learning_rate": 0.000127,
"loss": 6.9918,
"mean_token_accuracy": 0.09061411544680595,
"num_tokens": 464930.0,
"step": 255
},
{
"entropy": 7.877001619338989,
"epoch": 0.021717340461075842,
"grad_norm": 1.0234375,
"learning_rate": 0.0001295,
"loss": 7.1647,
"mean_token_accuracy": 0.08374429196119308,
"num_tokens": 474303.0,
"step": 260
},
{
"entropy": 7.794501399993896,
"epoch": 0.02213498162378884,
"grad_norm": 0.9921875,
"learning_rate": 0.000132,
"loss": 7.1539,
"mean_token_accuracy": 0.08738574758172035,
"num_tokens": 483750.0,
"step": 265
},
{
"entropy": 7.762907552719116,
"epoch": 0.022552622786501837,
"grad_norm": 1.03125,
"learning_rate": 0.00013450000000000002,
"loss": 7.0529,
"mean_token_accuracy": 0.09093769788742065,
"num_tokens": 493325.0,
"step": 270
},
{
"entropy": 7.741158294677734,
"epoch": 0.022970263949214833,
"grad_norm": 1.078125,
"learning_rate": 0.00013700000000000002,
"loss": 7.0377,
"mean_token_accuracy": 0.08475295156240463,
"num_tokens": 501907.0,
"step": 275
},
{
"entropy": 7.704169273376465,
"epoch": 0.023387905111927832,
"grad_norm": 1.1328125,
"learning_rate": 0.0001395,
"loss": 7.0759,
"mean_token_accuracy": 0.09049696251749992,
"num_tokens": 511522.0,
"step": 280
},
{
"entropy": 7.68439040184021,
"epoch": 0.023805546274640828,
"grad_norm": 0.94921875,
"learning_rate": 0.00014199999999999998,
"loss": 7.0277,
"mean_token_accuracy": 0.08685763627290725,
"num_tokens": 521287.0,
"step": 285
},
{
"entropy": 7.689414691925049,
"epoch": 0.024223187437353827,
"grad_norm": 1.09375,
"learning_rate": 0.0001445,
"loss": 7.1013,
"mean_token_accuracy": 0.08630543872714043,
"num_tokens": 530631.0,
"step": 290
},
{
"entropy": 7.624138498306275,
"epoch": 0.024640828600066823,
"grad_norm": 0.97265625,
"learning_rate": 0.000147,
"loss": 6.9712,
"mean_token_accuracy": 0.09986182302236557,
"num_tokens": 540386.0,
"step": 295
},
{
"entropy": 7.671041774749756,
"epoch": 0.02505846976277982,
"grad_norm": 1.0078125,
"learning_rate": 0.0001495,
"loss": 7.0573,
"mean_token_accuracy": 0.08439475223422051,
"num_tokens": 550121.0,
"step": 300
},
{
"entropy": 7.569111251831055,
"epoch": 0.025476110925492818,
"grad_norm": 0.9921875,
"learning_rate": 0.000152,
"loss": 6.9112,
"mean_token_accuracy": 0.09254205971956253,
"num_tokens": 559460.0,
"step": 305
},
{
"entropy": 7.6026232719421385,
"epoch": 0.025893752088205813,
"grad_norm": 1.0078125,
"learning_rate": 0.00015450000000000001,
"loss": 6.8726,
"mean_token_accuracy": 0.0958409771323204,
"num_tokens": 568392.0,
"step": 310
},
{
"entropy": 7.504022693634033,
"epoch": 0.02631139325091881,
"grad_norm": 0.875,
"learning_rate": 0.000157,
"loss": 6.9599,
"mean_token_accuracy": 0.09224955886602401,
"num_tokens": 578248.0,
"step": 315
},
{
"entropy": 7.5831845760345455,
"epoch": 0.026729034413631808,
"grad_norm": 0.9453125,
"learning_rate": 0.0001595,
"loss": 7.0295,
"mean_token_accuracy": 0.08987967744469642,
"num_tokens": 588164.0,
"step": 320
},
{
"entropy": 7.5552794456481935,
"epoch": 0.027146675576344804,
"grad_norm": 0.8828125,
"learning_rate": 0.000162,
"loss": 6.9487,
"mean_token_accuracy": 0.09430753514170646,
"num_tokens": 598715.0,
"step": 325
},
{
"entropy": 7.5547398090362545,
"epoch": 0.027564316739057803,
"grad_norm": 1.125,
"learning_rate": 0.00016450000000000001,
"loss": 6.8841,
"mean_token_accuracy": 0.09914051964879037,
"num_tokens": 606939.0,
"step": 330
},
{
"entropy": 7.417043685913086,
"epoch": 0.0279819579017708,
"grad_norm": 1.1953125,
"learning_rate": 0.00016700000000000002,
"loss": 6.9714,
"mean_token_accuracy": 0.09765534549951553,
"num_tokens": 615803.0,
"step": 335
},
{
"entropy": 7.536453628540039,
"epoch": 0.028399599064483794,
"grad_norm": 1.203125,
"learning_rate": 0.00016950000000000003,
"loss": 6.8297,
"mean_token_accuracy": 0.09691216871142387,
"num_tokens": 624730.0,
"step": 340
},
{
"entropy": 7.539470243453979,
"epoch": 0.028817240227196794,
"grad_norm": 1.1484375,
"learning_rate": 0.00017199999999999998,
"loss": 6.931,
"mean_token_accuracy": 0.09587549567222595,
"num_tokens": 634082.0,
"step": 345
},
{
"entropy": 7.414178943634033,
"epoch": 0.02923488138990979,
"grad_norm": 0.953125,
"learning_rate": 0.00017449999999999999,
"loss": 6.9083,
"mean_token_accuracy": 0.09485536590218543,
"num_tokens": 643367.0,
"step": 350
},
{
"entropy": 7.387429285049438,
"epoch": 0.029652522552622785,
"grad_norm": 1.015625,
"learning_rate": 0.000177,
"loss": 6.7242,
"mean_token_accuracy": 0.09872433170676231,
"num_tokens": 651861.0,
"step": 355
},
{
"entropy": 7.464349985122681,
"epoch": 0.030070163715335784,
"grad_norm": 0.97265625,
"learning_rate": 0.0001795,
"loss": 6.8556,
"mean_token_accuracy": 0.09326324984431267,
"num_tokens": 661064.0,
"step": 360
},
{
"entropy": 7.392336225509643,
"epoch": 0.03048780487804878,
"grad_norm": 1.0859375,
"learning_rate": 0.000182,
"loss": 6.8352,
"mean_token_accuracy": 0.10462646037340165,
"num_tokens": 669299.0,
"step": 365
},
{
"entropy": 7.248696994781494,
"epoch": 0.03090544604076178,
"grad_norm": 1.109375,
"learning_rate": 0.0001845,
"loss": 6.8988,
"mean_token_accuracy": 0.09198433235287666,
"num_tokens": 678631.0,
"step": 370
},
{
"entropy": 7.445321846008301,
"epoch": 0.03132308720347477,
"grad_norm": 1.046875,
"learning_rate": 0.000187,
"loss": 6.8925,
"mean_token_accuracy": 0.09772585704922676,
"num_tokens": 688511.0,
"step": 375
},
{
"entropy": 7.484406995773315,
"epoch": 0.03174072836618777,
"grad_norm": 1.1640625,
"learning_rate": 0.0001895,
"loss": 6.8465,
"mean_token_accuracy": 0.09334805831313134,
"num_tokens": 697956.0,
"step": 380
},
{
"entropy": 7.3463782787323,
"epoch": 0.03215836952890077,
"grad_norm": 1.140625,
"learning_rate": 0.000192,
"loss": 6.7552,
"mean_token_accuracy": 0.10220230743288994,
"num_tokens": 706779.0,
"step": 385
},
{
"entropy": 7.295664262771607,
"epoch": 0.03257601069161377,
"grad_norm": 1.03125,
"learning_rate": 0.0001945,
"loss": 6.7444,
"mean_token_accuracy": 0.09592411890625954,
"num_tokens": 715749.0,
"step": 390
},
{
"entropy": 7.331249046325683,
"epoch": 0.03299365185432676,
"grad_norm": 1.15625,
"learning_rate": 0.00019700000000000002,
"loss": 6.7177,
"mean_token_accuracy": 0.09796938598155976,
"num_tokens": 724756.0,
"step": 395
},
{
"entropy": 7.257160568237305,
"epoch": 0.03341129301703976,
"grad_norm": 1.1484375,
"learning_rate": 0.00019950000000000002,
"loss": 6.7422,
"mean_token_accuracy": 0.09832950606942177,
"num_tokens": 733288.0,
"step": 400
},
{
"entropy": 7.405258226394653,
"epoch": 0.03382893417975276,
"grad_norm": 1.609375,
"learning_rate": 0.000202,
"loss": 6.8476,
"mean_token_accuracy": 0.0943653255701065,
"num_tokens": 741629.0,
"step": 405
},
{
"entropy": 7.263295269012451,
"epoch": 0.03424657534246575,
"grad_norm": 1.015625,
"learning_rate": 0.00020449999999999998,
"loss": 6.7841,
"mean_token_accuracy": 0.1012955941259861,
"num_tokens": 751336.0,
"step": 410
},
{
"entropy": 7.402045774459839,
"epoch": 0.03466421650517875,
"grad_norm": 1.1796875,
"learning_rate": 0.000207,
"loss": 6.856,
"mean_token_accuracy": 0.09290716797113419,
"num_tokens": 759725.0,
"step": 415
},
{
"entropy": 7.322671508789062,
"epoch": 0.03508185766789175,
"grad_norm": 1.1171875,
"learning_rate": 0.0002095,
"loss": 6.845,
"mean_token_accuracy": 0.09813571646809578,
"num_tokens": 769752.0,
"step": 420
},
{
"entropy": 7.268389272689819,
"epoch": 0.03549949883060474,
"grad_norm": 1.15625,
"learning_rate": 0.000212,
"loss": 6.7365,
"mean_token_accuracy": 0.10029055625200271,
"num_tokens": 779124.0,
"step": 425
},
{
"entropy": 7.208940410614014,
"epoch": 0.03591713999331774,
"grad_norm": 1.2109375,
"learning_rate": 0.0002145,
"loss": 6.7024,
"mean_token_accuracy": 0.10402928516268731,
"num_tokens": 788892.0,
"step": 430
},
{
"entropy": 7.189973258972168,
"epoch": 0.03633478115603074,
"grad_norm": 1.0859375,
"learning_rate": 0.00021700000000000002,
"loss": 6.6662,
"mean_token_accuracy": 0.10119749382138252,
"num_tokens": 798265.0,
"step": 435
},
{
"entropy": 7.194095945358276,
"epoch": 0.03675242231874373,
"grad_norm": 1.1328125,
"learning_rate": 0.0002195,
"loss": 6.6231,
"mean_token_accuracy": 0.10882524475455284,
"num_tokens": 806896.0,
"step": 440
},
{
"entropy": 7.201065158843994,
"epoch": 0.03717006348145673,
"grad_norm": 1.203125,
"learning_rate": 0.000222,
"loss": 6.689,
"mean_token_accuracy": 0.10466736480593682,
"num_tokens": 815540.0,
"step": 445
},
{
"entropy": 7.163028383255005,
"epoch": 0.03758770464416973,
"grad_norm": 1.1484375,
"learning_rate": 0.0002245,
"loss": 6.7443,
"mean_token_accuracy": 0.10173500478267669,
"num_tokens": 824555.0,
"step": 450
},
{
"entropy": 7.269956779479981,
"epoch": 0.03800534580688272,
"grad_norm": 1.171875,
"learning_rate": 0.00022700000000000002,
"loss": 6.7737,
"mean_token_accuracy": 0.10270200073719024,
"num_tokens": 833414.0,
"step": 455
},
{
"entropy": 7.098545503616333,
"epoch": 0.03842298696959572,
"grad_norm": 1.03125,
"learning_rate": 0.00022950000000000002,
"loss": 6.6325,
"mean_token_accuracy": 0.10786343663930893,
"num_tokens": 842644.0,
"step": 460
},
{
"entropy": 7.197147083282471,
"epoch": 0.03884062813230872,
"grad_norm": 1.125,
"learning_rate": 0.00023200000000000003,
"loss": 6.6693,
"mean_token_accuracy": 0.10085522830486297,
"num_tokens": 851786.0,
"step": 465
},
{
"entropy": 7.095899295806885,
"epoch": 0.03925826929502172,
"grad_norm": 0.9921875,
"learning_rate": 0.00023449999999999998,
"loss": 6.7144,
"mean_token_accuracy": 0.1063760556280613,
"num_tokens": 861508.0,
"step": 470
},
{
"entropy": 7.154467391967773,
"epoch": 0.03967591045773471,
"grad_norm": 1.0703125,
"learning_rate": 0.000237,
"loss": 6.5905,
"mean_token_accuracy": 0.10809945836663246,
"num_tokens": 870433.0,
"step": 475
},
{
"entropy": 7.184867238998413,
"epoch": 0.04009355162044771,
"grad_norm": 1.125,
"learning_rate": 0.0002395,
"loss": 6.6928,
"mean_token_accuracy": 0.10560849010944366,
"num_tokens": 879059.0,
"step": 480
},
{
"entropy": 7.1450403213500975,
"epoch": 0.04051119278316071,
"grad_norm": 1.125,
"learning_rate": 0.000242,
"loss": 6.7403,
"mean_token_accuracy": 0.09940413013100624,
"num_tokens": 888009.0,
"step": 485
},
{
"entropy": 7.092233419418335,
"epoch": 0.040928833945873704,
"grad_norm": 1.1953125,
"learning_rate": 0.0002445,
"loss": 6.6089,
"mean_token_accuracy": 0.10285484269261361,
"num_tokens": 897335.0,
"step": 490
},
{
"entropy": 7.264479684829712,
"epoch": 0.0413464751085867,
"grad_norm": 1.0625,
"learning_rate": 0.000247,
"loss": 6.6248,
"mean_token_accuracy": 0.10704769417643548,
"num_tokens": 905802.0,
"step": 495
},
{
"entropy": 7.013559818267822,
"epoch": 0.0417641162712997,
"grad_norm": 1.1484375,
"learning_rate": 0.0002495,
"loss": 6.6091,
"mean_token_accuracy": 0.1084491603076458,
"num_tokens": 914836.0,
"step": 500
},
{
"entropy": 6.988007974624634,
"epoch": 0.042181757434012694,
"grad_norm": 1.09375,
"learning_rate": 0.000252,
"loss": 6.5574,
"mean_token_accuracy": 0.11251411363482475,
"num_tokens": 924254.0,
"step": 505
},
{
"entropy": 7.116152048110962,
"epoch": 0.04259939859672569,
"grad_norm": 1.0546875,
"learning_rate": 0.0002545,
"loss": 6.6555,
"mean_token_accuracy": 0.1060157686471939,
"num_tokens": 933841.0,
"step": 510
},
{
"entropy": 7.129690933227539,
"epoch": 0.04301703975943869,
"grad_norm": 0.99609375,
"learning_rate": 0.000257,
"loss": 6.7157,
"mean_token_accuracy": 0.10084601864218712,
"num_tokens": 943304.0,
"step": 515
},
{
"entropy": 7.06993350982666,
"epoch": 0.043434680922151685,
"grad_norm": 1.21875,
"learning_rate": 0.0002595,
"loss": 6.5385,
"mean_token_accuracy": 0.11060969755053521,
"num_tokens": 952915.0,
"step": 520
},
{
"entropy": 7.076866674423218,
"epoch": 0.043852322084864684,
"grad_norm": 1.0703125,
"learning_rate": 0.000262,
"loss": 6.598,
"mean_token_accuracy": 0.10570925623178482,
"num_tokens": 962752.0,
"step": 525
},
{
"entropy": 7.055672740936279,
"epoch": 0.04426996324757768,
"grad_norm": 1.1875,
"learning_rate": 0.00026450000000000003,
"loss": 6.6226,
"mean_token_accuracy": 0.1023420087993145,
"num_tokens": 971240.0,
"step": 530
},
{
"entropy": 7.108932256698608,
"epoch": 0.044687604410290675,
"grad_norm": 1.0859375,
"learning_rate": 0.00026700000000000004,
"loss": 6.6471,
"mean_token_accuracy": 0.10342941582202911,
"num_tokens": 981391.0,
"step": 535
},
{
"entropy": 7.1047523498535154,
"epoch": 0.045105245573003674,
"grad_norm": 0.96875,
"learning_rate": 0.00026950000000000005,
"loss": 6.6554,
"mean_token_accuracy": 0.10619911253452301,
"num_tokens": 990551.0,
"step": 540
},
{
"entropy": 7.004219102859497,
"epoch": 0.045522886735716674,
"grad_norm": 1.15625,
"learning_rate": 0.00027200000000000005,
"loss": 6.5787,
"mean_token_accuracy": 0.11122526898980141,
"num_tokens": 999593.0,
"step": 545
},
{
"entropy": 7.028263998031616,
"epoch": 0.045940527898429666,
"grad_norm": 1.1796875,
"learning_rate": 0.0002745,
"loss": 6.6418,
"mean_token_accuracy": 0.10322482436895371,
"num_tokens": 1008785.0,
"step": 550
},
{
"entropy": 7.000995635986328,
"epoch": 0.046358169061142665,
"grad_norm": 1.1484375,
"learning_rate": 0.000277,
"loss": 6.632,
"mean_token_accuracy": 0.10688607320189476,
"num_tokens": 1016815.0,
"step": 555
},
{
"entropy": 7.063908100128174,
"epoch": 0.046775810223855664,
"grad_norm": 1.1171875,
"learning_rate": 0.0002795,
"loss": 6.5161,
"mean_token_accuracy": 0.11323921233415604,
"num_tokens": 1026182.0,
"step": 560
},
{
"entropy": 6.97571029663086,
"epoch": 0.04719345138656866,
"grad_norm": 1.2265625,
"learning_rate": 0.00028199999999999997,
"loss": 6.4512,
"mean_token_accuracy": 0.11479591503739357,
"num_tokens": 1034032.0,
"step": 565
},
{
"entropy": 6.954489898681641,
"epoch": 0.047611092549281656,
"grad_norm": 0.98828125,
"learning_rate": 0.0002845,
"loss": 6.6465,
"mean_token_accuracy": 0.10568908601999283,
"num_tokens": 1043493.0,
"step": 570
},
{
"entropy": 7.076480293273926,
"epoch": 0.048028733711994655,
"grad_norm": 1.2265625,
"learning_rate": 0.000287,
"loss": 6.5541,
"mean_token_accuracy": 0.1120546206831932,
"num_tokens": 1052989.0,
"step": 575
},
{
"entropy": 6.9995513439178465,
"epoch": 0.048446374874707654,
"grad_norm": 1.265625,
"learning_rate": 0.0002895,
"loss": 6.5191,
"mean_token_accuracy": 0.10802618637681008,
"num_tokens": 1061803.0,
"step": 580
},
{
"entropy": 6.9974480152130125,
"epoch": 0.048864016037420646,
"grad_norm": 1.0703125,
"learning_rate": 0.000292,
"loss": 6.6256,
"mean_token_accuracy": 0.10830648243427277,
"num_tokens": 1071227.0,
"step": 585
},
{
"entropy": 7.019133281707764,
"epoch": 0.049281657200133645,
"grad_norm": 1.15625,
"learning_rate": 0.0002945,
"loss": 6.6256,
"mean_token_accuracy": 0.1137481078505516,
"num_tokens": 1080082.0,
"step": 590
},
{
"entropy": 6.9460889339447025,
"epoch": 0.049699298362846644,
"grad_norm": 1.2109375,
"learning_rate": 0.000297,
"loss": 6.463,
"mean_token_accuracy": 0.11860100626945495,
"num_tokens": 1089750.0,
"step": 595
},
{
"entropy": 6.8880175113677975,
"epoch": 0.05011693952555964,
"grad_norm": 1.1953125,
"learning_rate": 0.0002995,
"loss": 6.4558,
"mean_token_accuracy": 0.11189346835017204,
"num_tokens": 1098691.0,
"step": 600
},
{
"entropy": 7.010653829574585,
"epoch": 0.050534580688272636,
"grad_norm": 1.1796875,
"learning_rate": 0.000302,
"loss": 6.4992,
"mean_token_accuracy": 0.11314608827233315,
"num_tokens": 1107602.0,
"step": 605
},
{
"entropy": 6.826686143875122,
"epoch": 0.050952221850985635,
"grad_norm": 1.2734375,
"learning_rate": 0.0003045,
"loss": 6.4167,
"mean_token_accuracy": 0.11482465639710426,
"num_tokens": 1116426.0,
"step": 610
},
{
"entropy": 6.978339052200317,
"epoch": 0.05136986301369863,
"grad_norm": 0.94140625,
"learning_rate": 0.000307,
"loss": 6.5929,
"mean_token_accuracy": 0.10989554226398468,
"num_tokens": 1126221.0,
"step": 615
},
{
"entropy": 6.9196573257446286,
"epoch": 0.051787504176411626,
"grad_norm": 1.2734375,
"learning_rate": 0.0003095,
"loss": 6.4681,
"mean_token_accuracy": 0.11944901272654533,
"num_tokens": 1135662.0,
"step": 620
},
{
"entropy": 6.880191802978516,
"epoch": 0.052205145339124626,
"grad_norm": 1.2421875,
"learning_rate": 0.000312,
"loss": 6.5525,
"mean_token_accuracy": 0.11337181329727172,
"num_tokens": 1143963.0,
"step": 625
},
{
"entropy": 6.883874082565308,
"epoch": 0.05262278650183762,
"grad_norm": 1.0546875,
"learning_rate": 0.0003145,
"loss": 6.4554,
"mean_token_accuracy": 0.1215918242931366,
"num_tokens": 1152470.0,
"step": 630
},
{
"entropy": 6.959899091720581,
"epoch": 0.05304042766455062,
"grad_norm": 1.109375,
"learning_rate": 0.000317,
"loss": 6.414,
"mean_token_accuracy": 0.11987600699067116,
"num_tokens": 1161257.0,
"step": 635
},
{
"entropy": 6.86087121963501,
"epoch": 0.053458068827263616,
"grad_norm": 0.99609375,
"learning_rate": 0.0003195,
"loss": 6.533,
"mean_token_accuracy": 0.10690693482756615,
"num_tokens": 1170969.0,
"step": 640
},
{
"entropy": 6.990806341171265,
"epoch": 0.053875709989976615,
"grad_norm": 1.1015625,
"learning_rate": 0.000322,
"loss": 6.6717,
"mean_token_accuracy": 0.11218328699469567,
"num_tokens": 1181127.0,
"step": 645
},
{
"entropy": 6.9073868751525875,
"epoch": 0.05429335115268961,
"grad_norm": 1.015625,
"learning_rate": 0.00032450000000000003,
"loss": 6.4613,
"mean_token_accuracy": 0.11650743409991264,
"num_tokens": 1190260.0,
"step": 650
},
{
"entropy": 6.870417165756225,
"epoch": 0.05471099231540261,
"grad_norm": 1.1328125,
"learning_rate": 0.00032700000000000003,
"loss": 6.5375,
"mean_token_accuracy": 0.11634354665875435,
"num_tokens": 1200013.0,
"step": 655
},
{
"entropy": 6.948531675338745,
"epoch": 0.055128633478115606,
"grad_norm": 1.375,
"learning_rate": 0.00032950000000000004,
"loss": 6.4582,
"mean_token_accuracy": 0.11997871845960617,
"num_tokens": 1209239.0,
"step": 660
},
{
"entropy": 6.796932411193848,
"epoch": 0.0555462746408286,
"grad_norm": 1.1328125,
"learning_rate": 0.00033200000000000005,
"loss": 6.4026,
"mean_token_accuracy": 0.11352865546941757,
"num_tokens": 1218552.0,
"step": 665
},
{
"entropy": 6.817508411407471,
"epoch": 0.0559639158035416,
"grad_norm": 1.109375,
"learning_rate": 0.00033450000000000005,
"loss": 6.4757,
"mean_token_accuracy": 0.11437263563275338,
"num_tokens": 1227632.0,
"step": 670
},
{
"entropy": 6.864944791793823,
"epoch": 0.056381556966254597,
"grad_norm": 1.1484375,
"learning_rate": 0.000337,
"loss": 6.5136,
"mean_token_accuracy": 0.11246693953871727,
"num_tokens": 1236433.0,
"step": 675
},
{
"entropy": 6.802402019500732,
"epoch": 0.05679919812896759,
"grad_norm": 1.2890625,
"learning_rate": 0.0003395,
"loss": 6.5371,
"mean_token_accuracy": 0.1055721789598465,
"num_tokens": 1245700.0,
"step": 680
},
{
"entropy": 6.921284770965576,
"epoch": 0.05721683929168059,
"grad_norm": 1.109375,
"learning_rate": 0.000342,
"loss": 6.3732,
"mean_token_accuracy": 0.11802853867411614,
"num_tokens": 1254206.0,
"step": 685
},
{
"entropy": 6.763827323913574,
"epoch": 0.05763448045439359,
"grad_norm": 1.0390625,
"learning_rate": 0.00034449999999999997,
"loss": 6.4184,
"mean_token_accuracy": 0.1180158130824566,
"num_tokens": 1263302.0,
"step": 690
},
{
"entropy": 6.76256685256958,
"epoch": 0.05805212161710658,
"grad_norm": 1.0078125,
"learning_rate": 0.000347,
"loss": 6.4661,
"mean_token_accuracy": 0.11739929467439651,
"num_tokens": 1272998.0,
"step": 695
},
{
"entropy": 6.8152045726776125,
"epoch": 0.05846976277981958,
"grad_norm": 1.0625,
"learning_rate": 0.0003495,
"loss": 6.4304,
"mean_token_accuracy": 0.1213896095752716,
"num_tokens": 1281955.0,
"step": 700
},
{
"entropy": 6.832838869094848,
"epoch": 0.05888740394253258,
"grad_norm": 1.0546875,
"learning_rate": 0.000352,
"loss": 6.4577,
"mean_token_accuracy": 0.11378672420978546,
"num_tokens": 1291219.0,
"step": 705
},
{
"entropy": 6.797576570510865,
"epoch": 0.05930504510524557,
"grad_norm": 1.0859375,
"learning_rate": 0.0003545,
"loss": 6.4718,
"mean_token_accuracy": 0.11139240860939026,
"num_tokens": 1300963.0,
"step": 710
},
{
"entropy": 6.8802446842193605,
"epoch": 0.05972268626795857,
"grad_norm": 1.109375,
"learning_rate": 0.000357,
"loss": 6.4965,
"mean_token_accuracy": 0.11046546846628189,
"num_tokens": 1310112.0,
"step": 715
},
{
"entropy": 6.775373268127441,
"epoch": 0.06014032743067157,
"grad_norm": 1.046875,
"learning_rate": 0.0003595,
"loss": 6.4278,
"mean_token_accuracy": 0.12265736609697342,
"num_tokens": 1319309.0,
"step": 720
},
{
"entropy": 6.66271562576294,
"epoch": 0.06055796859338457,
"grad_norm": 1.0546875,
"learning_rate": 0.000362,
"loss": 6.3938,
"mean_token_accuracy": 0.11732437312602997,
"num_tokens": 1329049.0,
"step": 725
},
{
"entropy": 6.728451251983643,
"epoch": 0.06097560975609756,
"grad_norm": 1.2578125,
"learning_rate": 0.0003645,
"loss": 6.2447,
"mean_token_accuracy": 0.12135154455900192,
"num_tokens": 1337770.0,
"step": 730
},
{
"entropy": 6.623231744766235,
"epoch": 0.06139325091881056,
"grad_norm": 1.171875,
"learning_rate": 0.000367,
"loss": 6.3446,
"mean_token_accuracy": 0.11998333036899567,
"num_tokens": 1346705.0,
"step": 735
},
{
"entropy": 6.744262742996216,
"epoch": 0.06181089208152356,
"grad_norm": 1.328125,
"learning_rate": 0.0003695,
"loss": 6.405,
"mean_token_accuracy": 0.11962749883532524,
"num_tokens": 1354860.0,
"step": 740
},
{
"entropy": 6.765829467773438,
"epoch": 0.06222853324423655,
"grad_norm": 1.1015625,
"learning_rate": 0.000372,
"loss": 6.3715,
"mean_token_accuracy": 0.11659613028168678,
"num_tokens": 1364140.0,
"step": 745
},
{
"entropy": 6.757311677932739,
"epoch": 0.06264617440694954,
"grad_norm": 1.046875,
"learning_rate": 0.0003745,
"loss": 6.5161,
"mean_token_accuracy": 0.10866649895906448,
"num_tokens": 1373645.0,
"step": 750
},
{
"entropy": 6.791751384735107,
"epoch": 0.06306381556966255,
"grad_norm": 1.0703125,
"learning_rate": 0.000377,
"loss": 6.3843,
"mean_token_accuracy": 0.12191172316670418,
"num_tokens": 1383291.0,
"step": 755
},
{
"entropy": 6.669790124893188,
"epoch": 0.06348145673237554,
"grad_norm": 1.21875,
"learning_rate": 0.0003795,
"loss": 6.3243,
"mean_token_accuracy": 0.12068940699100494,
"num_tokens": 1391172.0,
"step": 760
},
{
"entropy": 6.717700242996216,
"epoch": 0.06389909789508853,
"grad_norm": 1.09375,
"learning_rate": 0.000382,
"loss": 6.3198,
"mean_token_accuracy": 0.12138244062662125,
"num_tokens": 1400864.0,
"step": 765
},
{
"entropy": 6.721026468276977,
"epoch": 0.06431673905780154,
"grad_norm": 1.078125,
"learning_rate": 0.0003845,
"loss": 6.3758,
"mean_token_accuracy": 0.1206473708152771,
"num_tokens": 1410570.0,
"step": 770
},
{
"entropy": 6.632958030700683,
"epoch": 0.06473438022051453,
"grad_norm": 1.09375,
"learning_rate": 0.00038700000000000003,
"loss": 6.35,
"mean_token_accuracy": 0.12267208248376846,
"num_tokens": 1419536.0,
"step": 775
},
{
"entropy": 6.612038612365723,
"epoch": 0.06515202138322754,
"grad_norm": 1.109375,
"learning_rate": 0.00038950000000000003,
"loss": 6.2546,
"mean_token_accuracy": 0.1263652376830578,
"num_tokens": 1428000.0,
"step": 780
},
{
"entropy": 6.690039157867432,
"epoch": 0.06556966254594053,
"grad_norm": 1.1875,
"learning_rate": 0.00039200000000000004,
"loss": 6.4562,
"mean_token_accuracy": 0.12093869373202323,
"num_tokens": 1437789.0,
"step": 785
},
{
"entropy": 6.636522626876831,
"epoch": 0.06598730370865352,
"grad_norm": 1.1875,
"learning_rate": 0.00039450000000000005,
"loss": 6.2563,
"mean_token_accuracy": 0.12446803748607635,
"num_tokens": 1446848.0,
"step": 790
},
{
"entropy": 6.619644260406494,
"epoch": 0.06640494487136653,
"grad_norm": 1.125,
"learning_rate": 0.00039700000000000005,
"loss": 6.3158,
"mean_token_accuracy": 0.12070081159472465,
"num_tokens": 1455749.0,
"step": 795
},
{
"entropy": 6.622030401229859,
"epoch": 0.06682258603407952,
"grad_norm": 1.171875,
"learning_rate": 0.0003995,
"loss": 6.2456,
"mean_token_accuracy": 0.12712132856249808,
"num_tokens": 1464556.0,
"step": 800
},
{
"entropy": 6.697847175598144,
"epoch": 0.06724022719679251,
"grad_norm": 1.140625,
"learning_rate": 0.000402,
"loss": 6.3663,
"mean_token_accuracy": 0.12254888191819191,
"num_tokens": 1473617.0,
"step": 805
},
{
"entropy": 6.679299306869507,
"epoch": 0.06765786835950552,
"grad_norm": 1.0390625,
"learning_rate": 0.0004045,
"loss": 6.3852,
"mean_token_accuracy": 0.12291230112314225,
"num_tokens": 1483006.0,
"step": 810
},
{
"entropy": 6.704338502883911,
"epoch": 0.06807550952221851,
"grad_norm": 1.1953125,
"learning_rate": 0.00040699999999999997,
"loss": 6.4006,
"mean_token_accuracy": 0.12003520801663399,
"num_tokens": 1493009.0,
"step": 815
},
{
"entropy": 6.579654169082642,
"epoch": 0.0684931506849315,
"grad_norm": 1.2421875,
"learning_rate": 0.0004095,
"loss": 6.2912,
"mean_token_accuracy": 0.12424400523304939,
"num_tokens": 1501261.0,
"step": 820
},
{
"entropy": 6.61363673210144,
"epoch": 0.06891079184764451,
"grad_norm": 0.89453125,
"learning_rate": 0.000412,
"loss": 6.394,
"mean_token_accuracy": 0.11899233609437943,
"num_tokens": 1511623.0,
"step": 825
},
{
"entropy": 6.693784141540528,
"epoch": 0.0693284330103575,
"grad_norm": 1.046875,
"learning_rate": 0.0004145,
"loss": 6.3861,
"mean_token_accuracy": 0.11563008949160576,
"num_tokens": 1521741.0,
"step": 830
},
{
"entropy": 6.616790151596069,
"epoch": 0.0697460741730705,
"grad_norm": 0.98828125,
"learning_rate": 0.000417,
"loss": 6.3195,
"mean_token_accuracy": 0.12150524035096169,
"num_tokens": 1530988.0,
"step": 835
},
{
"entropy": 6.543398427963257,
"epoch": 0.0701637153357835,
"grad_norm": 1.1171875,
"learning_rate": 0.0004195,
"loss": 6.158,
"mean_token_accuracy": 0.12872020676732063,
"num_tokens": 1539415.0,
"step": 840
},
{
"entropy": 6.674872541427613,
"epoch": 0.07058135649849649,
"grad_norm": 1.171875,
"learning_rate": 0.000422,
"loss": 6.3627,
"mean_token_accuracy": 0.1207451082766056,
"num_tokens": 1547969.0,
"step": 845
},
{
"entropy": 6.544791841506958,
"epoch": 0.07099899766120948,
"grad_norm": 1.0859375,
"learning_rate": 0.0004245,
"loss": 6.2083,
"mean_token_accuracy": 0.12395204156637192,
"num_tokens": 1557526.0,
"step": 850
},
{
"entropy": 6.56576452255249,
"epoch": 0.07141663882392249,
"grad_norm": 1.1875,
"learning_rate": 0.000427,
"loss": 6.1961,
"mean_token_accuracy": 0.12846603170037268,
"num_tokens": 1565982.0,
"step": 855
},
{
"entropy": 6.504228305816651,
"epoch": 0.07183427998663548,
"grad_norm": 1.0859375,
"learning_rate": 0.0004295,
"loss": 6.2432,
"mean_token_accuracy": 0.13052212223410606,
"num_tokens": 1574492.0,
"step": 860
},
{
"entropy": 6.504011058807373,
"epoch": 0.07225192114934847,
"grad_norm": 1.2421875,
"learning_rate": 0.000432,
"loss": 6.2186,
"mean_token_accuracy": 0.1255444750189781,
"num_tokens": 1583726.0,
"step": 865
},
{
"entropy": 6.531704616546631,
"epoch": 0.07266956231206148,
"grad_norm": 1.234375,
"learning_rate": 0.0004345,
"loss": 6.2342,
"mean_token_accuracy": 0.11796416938304902,
"num_tokens": 1593780.0,
"step": 870
},
{
"entropy": 6.550727891921997,
"epoch": 0.07308720347477447,
"grad_norm": 1.1796875,
"learning_rate": 0.000437,
"loss": 6.2362,
"mean_token_accuracy": 0.1253882236778736,
"num_tokens": 1602746.0,
"step": 875
},
{
"entropy": 6.606376981735229,
"epoch": 0.07350484463748747,
"grad_norm": 1.0234375,
"learning_rate": 0.0004395,
"loss": 6.2635,
"mean_token_accuracy": 0.12688489481806756,
"num_tokens": 1611767.0,
"step": 880
},
{
"entropy": 6.605551767349243,
"epoch": 0.07392248580020047,
"grad_norm": 1.0,
"learning_rate": 0.000442,
"loss": 6.335,
"mean_token_accuracy": 0.12890502512454988,
"num_tokens": 1621568.0,
"step": 885
},
{
"entropy": 6.594180345535278,
"epoch": 0.07434012696291346,
"grad_norm": 1.015625,
"learning_rate": 0.0004445,
"loss": 6.2961,
"mean_token_accuracy": 0.13042845353484153,
"num_tokens": 1630650.0,
"step": 890
},
{
"entropy": 6.582787275314331,
"epoch": 0.07475776812562646,
"grad_norm": 1.15625,
"learning_rate": 0.000447,
"loss": 6.2881,
"mean_token_accuracy": 0.12370246201753617,
"num_tokens": 1640482.0,
"step": 895
},
{
"entropy": 6.651394557952881,
"epoch": 0.07517540928833946,
"grad_norm": 1.203125,
"learning_rate": 0.00044950000000000003,
"loss": 6.3247,
"mean_token_accuracy": 0.12517691105604173,
"num_tokens": 1649344.0,
"step": 900
},
{
"entropy": 6.495271348953247,
"epoch": 0.07559305045105245,
"grad_norm": 1.015625,
"learning_rate": 0.00045200000000000004,
"loss": 6.2618,
"mean_token_accuracy": 0.12706776037812234,
"num_tokens": 1658962.0,
"step": 905
},
{
"entropy": 6.504554367065429,
"epoch": 0.07601069161376545,
"grad_norm": 1.0078125,
"learning_rate": 0.00045450000000000004,
"loss": 6.266,
"mean_token_accuracy": 0.12863868474960327,
"num_tokens": 1668615.0,
"step": 910
},
{
"entropy": 6.574895524978638,
"epoch": 0.07642833277647845,
"grad_norm": 1.1015625,
"learning_rate": 0.00045700000000000005,
"loss": 6.2168,
"mean_token_accuracy": 0.12925311848521231,
"num_tokens": 1679282.0,
"step": 915
},
{
"entropy": 6.466578817367553,
"epoch": 0.07684597393919144,
"grad_norm": 0.99609375,
"learning_rate": 0.00045950000000000006,
"loss": 6.3065,
"mean_token_accuracy": 0.1251588962972164,
"num_tokens": 1688362.0,
"step": 920
},
{
"entropy": 6.553056955337524,
"epoch": 0.07726361510190444,
"grad_norm": 0.890625,
"learning_rate": 0.000462,
"loss": 6.1887,
"mean_token_accuracy": 0.12379047647118568,
"num_tokens": 1697593.0,
"step": 925
},
{
"entropy": 6.501152229309082,
"epoch": 0.07768125626461744,
"grad_norm": 1.125,
"learning_rate": 0.0004645,
"loss": 6.2696,
"mean_token_accuracy": 0.1266642227768898,
"num_tokens": 1706961.0,
"step": 930
},
{
"entropy": 6.591590833663941,
"epoch": 0.07809889742733044,
"grad_norm": 1.09375,
"learning_rate": 0.000467,
"loss": 6.3029,
"mean_token_accuracy": 0.12989042624831199,
"num_tokens": 1716222.0,
"step": 935
},
{
"entropy": 6.465153598785401,
"epoch": 0.07851653859004344,
"grad_norm": 1.109375,
"learning_rate": 0.0004695,
"loss": 6.1681,
"mean_token_accuracy": 0.12083110958337784,
"num_tokens": 1726750.0,
"step": 940
},
{
"entropy": 6.532292890548706,
"epoch": 0.07893417975275643,
"grad_norm": 1.0703125,
"learning_rate": 0.000472,
"loss": 6.281,
"mean_token_accuracy": 0.11997251808643342,
"num_tokens": 1736262.0,
"step": 945
},
{
"entropy": 6.490269708633423,
"epoch": 0.07935182091546943,
"grad_norm": 1.1796875,
"learning_rate": 0.0004745,
"loss": 6.2976,
"mean_token_accuracy": 0.12622648924589158,
"num_tokens": 1745555.0,
"step": 950
},
{
"entropy": 6.346992015838623,
"epoch": 0.07976946207818243,
"grad_norm": 1.3828125,
"learning_rate": 0.000477,
"loss": 6.1624,
"mean_token_accuracy": 0.12778715938329696,
"num_tokens": 1754107.0,
"step": 955
},
{
"entropy": 6.720982551574707,
"epoch": 0.08018710324089542,
"grad_norm": 1.015625,
"learning_rate": 0.0004795,
"loss": 6.3498,
"mean_token_accuracy": 0.12380973473191262,
"num_tokens": 1762982.0,
"step": 960
},
{
"entropy": 6.400809383392334,
"epoch": 0.08060474440360842,
"grad_norm": 1.15625,
"learning_rate": 0.000482,
"loss": 6.2299,
"mean_token_accuracy": 0.12820469886064528,
"num_tokens": 1772545.0,
"step": 965
},
{
"entropy": 6.63186354637146,
"epoch": 0.08102238556632142,
"grad_norm": 1.09375,
"learning_rate": 0.0004845,
"loss": 6.3614,
"mean_token_accuracy": 0.1199867382645607,
"num_tokens": 1782052.0,
"step": 970
},
{
"entropy": 6.447825527191162,
"epoch": 0.08144002672903441,
"grad_norm": 1.0703125,
"learning_rate": 0.000487,
"loss": 6.1631,
"mean_token_accuracy": 0.12513367608189582,
"num_tokens": 1791682.0,
"step": 975
},
{
"entropy": 6.466085052490234,
"epoch": 0.08185766789174741,
"grad_norm": 0.9609375,
"learning_rate": 0.0004895,
"loss": 6.1682,
"mean_token_accuracy": 0.1323828585445881,
"num_tokens": 1800526.0,
"step": 980
},
{
"entropy": 6.538319540023804,
"epoch": 0.08227530905446041,
"grad_norm": 1.078125,
"learning_rate": 0.000492,
"loss": 6.2922,
"mean_token_accuracy": 0.1273337259888649,
"num_tokens": 1810062.0,
"step": 985
},
{
"entropy": 6.485649347305298,
"epoch": 0.0826929502171734,
"grad_norm": 1.1484375,
"learning_rate": 0.0004945,
"loss": 6.2886,
"mean_token_accuracy": 0.12735243514180183,
"num_tokens": 1818909.0,
"step": 990
},
{
"entropy": 6.511818504333496,
"epoch": 0.0831105913798864,
"grad_norm": 1.1875,
"learning_rate": 0.000497,
"loss": 6.2268,
"mean_token_accuracy": 0.1313578575849533,
"num_tokens": 1827978.0,
"step": 995
},
{
"entropy": 6.385158729553223,
"epoch": 0.0835282325425994,
"grad_norm": 1.015625,
"learning_rate": 0.0004995,
"loss": 6.1962,
"mean_token_accuracy": 0.13243770301342012,
"num_tokens": 1837955.0,
"step": 1000
},
{
"entropy": 6.5512267589569095,
"epoch": 0.0839458737053124,
"grad_norm": 1.1796875,
"learning_rate": 0.0004999999987395534,
"loss": 6.2897,
"mean_token_accuracy": 0.1274054653942585,
"num_tokens": 1847699.0,
"step": 1005
},
{
"entropy": 6.498107290267944,
"epoch": 0.08436351486802539,
"grad_norm": 1.078125,
"learning_rate": 0.0004999999936189888,
"loss": 6.2363,
"mean_token_accuracy": 0.12386318743228912,
"num_tokens": 1856490.0,
"step": 1010
},
{
"entropy": 6.442971467971802,
"epoch": 0.0847811560307384,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999999845595285,
"loss": 6.2339,
"mean_token_accuracy": 0.1264282323420048,
"num_tokens": 1865644.0,
"step": 1015
},
{
"entropy": 6.474472713470459,
"epoch": 0.08519879719345139,
"grad_norm": 1.234375,
"learning_rate": 0.0004999999715611727,
"loss": 6.1668,
"mean_token_accuracy": 0.1318289414048195,
"num_tokens": 1874450.0,
"step": 1020
},
{
"entropy": 6.359386444091797,
"epoch": 0.08561643835616438,
"grad_norm": 1.0625,
"learning_rate": 0.0004999999546239215,
"loss": 6.1867,
"mean_token_accuracy": 0.12795957028865815,
"num_tokens": 1883259.0,
"step": 1025
},
{
"entropy": 6.465229320526123,
"epoch": 0.08603407951887738,
"grad_norm": 1.171875,
"learning_rate": 0.0004999999337477753,
"loss": 6.2646,
"mean_token_accuracy": 0.12190999686717988,
"num_tokens": 1891897.0,
"step": 1030
},
{
"entropy": 6.531569147109986,
"epoch": 0.08645172068159038,
"grad_norm": 1.171875,
"learning_rate": 0.0004999999089327344,
"loss": 6.2369,
"mean_token_accuracy": 0.1253485880792141,
"num_tokens": 1901011.0,
"step": 1035
},
{
"entropy": 6.3279060363769535,
"epoch": 0.08686936184430337,
"grad_norm": 1.140625,
"learning_rate": 0.0004999998801787993,
"loss": 6.1475,
"mean_token_accuracy": 0.1359507881104946,
"num_tokens": 1910132.0,
"step": 1040
},
{
"entropy": 6.536592149734497,
"epoch": 0.08728700300701638,
"grad_norm": 1.125,
"learning_rate": 0.0004999998474859704,
"loss": 6.2593,
"mean_token_accuracy": 0.12965355440974236,
"num_tokens": 1919938.0,
"step": 1045
},
{
"entropy": 6.347357130050659,
"epoch": 0.08770464416972937,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999998108542483,
"loss": 6.1286,
"mean_token_accuracy": 0.1264238215982914,
"num_tokens": 1928199.0,
"step": 1050
},
{
"entropy": 6.376512479782105,
"epoch": 0.08812228533244236,
"grad_norm": 1.234375,
"learning_rate": 0.0004999997702836339,
"loss": 6.1175,
"mean_token_accuracy": 0.13022146746516228,
"num_tokens": 1937133.0,
"step": 1055
},
{
"entropy": 6.513174438476563,
"epoch": 0.08853992649515537,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999997257741274,
"loss": 6.2975,
"mean_token_accuracy": 0.1291216015815735,
"num_tokens": 1946580.0,
"step": 1060
},
{
"entropy": 6.365123176574707,
"epoch": 0.08895756765786836,
"grad_norm": 1.125,
"learning_rate": 0.00049999967732573,
"loss": 6.2097,
"mean_token_accuracy": 0.12826794609427453,
"num_tokens": 1955413.0,
"step": 1065
},
{
"entropy": 6.605544090270996,
"epoch": 0.08937520882058135,
"grad_norm": 1.1953125,
"learning_rate": 0.0004999996249384425,
"loss": 6.2843,
"mean_token_accuracy": 0.1293049283325672,
"num_tokens": 1964716.0,
"step": 1070
},
{
"entropy": 6.295011186599732,
"epoch": 0.08979284998329436,
"grad_norm": 1.125,
"learning_rate": 0.0004999995686122657,
"loss": 6.143,
"mean_token_accuracy": 0.1339694581925869,
"num_tokens": 1974081.0,
"step": 1075
},
{
"entropy": 6.302339315414429,
"epoch": 0.09021049114600735,
"grad_norm": 1.1484375,
"learning_rate": 0.0004999995083472006,
"loss": 6.12,
"mean_token_accuracy": 0.1303638242185116,
"num_tokens": 1983035.0,
"step": 1080
},
{
"entropy": 6.41491436958313,
"epoch": 0.09062813230872034,
"grad_norm": 0.9140625,
"learning_rate": 0.0004999994441432481,
"loss": 6.1119,
"mean_token_accuracy": 0.14117980897426605,
"num_tokens": 1992475.0,
"step": 1085
},
{
"entropy": 6.36792368888855,
"epoch": 0.09104577347143335,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999993760004097,
"loss": 6.1813,
"mean_token_accuracy": 0.12746159359812737,
"num_tokens": 2002729.0,
"step": 1090
},
{
"entropy": 6.294451570510864,
"epoch": 0.09146341463414634,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999993039186864,
"loss": 6.0415,
"mean_token_accuracy": 0.13401369303464888,
"num_tokens": 2011319.0,
"step": 1095
},
{
"entropy": 6.397387838363647,
"epoch": 0.09188105579685933,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999992278980794,
"loss": 6.095,
"mean_token_accuracy": 0.1325186774134636,
"num_tokens": 2020456.0,
"step": 1100
},
{
"entropy": 6.282045221328735,
"epoch": 0.09229869695957234,
"grad_norm": 1.1953125,
"learning_rate": 0.0004999991479385901,
"loss": 6.1684,
"mean_token_accuracy": 0.1352491483092308,
"num_tokens": 2029417.0,
"step": 1105
},
{
"entropy": 6.475615835189819,
"epoch": 0.09271633812228533,
"grad_norm": 1.109375,
"learning_rate": 0.0004999990640402198,
"loss": 6.2484,
"mean_token_accuracy": 0.13222716152668,
"num_tokens": 2039290.0,
"step": 1110
},
{
"entropy": 6.398699712753296,
"epoch": 0.09313397928499834,
"grad_norm": 1.1796875,
"learning_rate": 0.0004999989762029701,
"loss": 6.0758,
"mean_token_accuracy": 0.13428714573383332,
"num_tokens": 2048485.0,
"step": 1115
},
{
"entropy": 6.212140274047852,
"epoch": 0.09355162044771133,
"grad_norm": 1.0625,
"learning_rate": 0.0004999988844268425,
"loss": 6.0653,
"mean_token_accuracy": 0.13647278472781182,
"num_tokens": 2057131.0,
"step": 1120
},
{
"entropy": 6.3156208992004395,
"epoch": 0.09396926161042432,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999987887118387,
"loss": 6.0425,
"mean_token_accuracy": 0.13471427783370019,
"num_tokens": 2066295.0,
"step": 1125
},
{
"entropy": 6.2854846000671385,
"epoch": 0.09438690277313733,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999986890579602,
"loss": 6.0529,
"mean_token_accuracy": 0.13778177052736282,
"num_tokens": 2075656.0,
"step": 1130
},
{
"entropy": 6.30756311416626,
"epoch": 0.09480454393585032,
"grad_norm": 0.984375,
"learning_rate": 0.0004999985854652087,
"loss": 6.1868,
"mean_token_accuracy": 0.12809674441814423,
"num_tokens": 2086046.0,
"step": 1135
},
{
"entropy": 6.448493432998657,
"epoch": 0.09522218509856331,
"grad_norm": 1.109375,
"learning_rate": 0.0004999984779335862,
"loss": 6.1931,
"mean_token_accuracy": 0.1333407126367092,
"num_tokens": 2094808.0,
"step": 1140
},
{
"entropy": 6.262913179397583,
"epoch": 0.09563982626127632,
"grad_norm": 1.015625,
"learning_rate": 0.0004999983664630945,
"loss": 6.13,
"mean_token_accuracy": 0.13531602770090104,
"num_tokens": 2104155.0,
"step": 1145
},
{
"entropy": 6.3961437225341795,
"epoch": 0.09605746742398931,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999982510537357,
"loss": 6.031,
"mean_token_accuracy": 0.13656094148755074,
"num_tokens": 2112517.0,
"step": 1150
},
{
"entropy": 6.132482528686523,
"epoch": 0.0964751085867023,
"grad_norm": 1.15625,
"learning_rate": 0.0004999981317055116,
"loss": 5.9808,
"mean_token_accuracy": 0.1375528834760189,
"num_tokens": 2121355.0,
"step": 1155
},
{
"entropy": 6.379729604721069,
"epoch": 0.09689274974941531,
"grad_norm": 1.1796875,
"learning_rate": 0.0004999980084184244,
"loss": 6.1163,
"mean_token_accuracy": 0.1360280379652977,
"num_tokens": 2129278.0,
"step": 1160
},
{
"entropy": 6.3625894546508786,
"epoch": 0.0973103909121283,
"grad_norm": 1.0625,
"learning_rate": 0.0004999978811924762,
"loss": 6.2693,
"mean_token_accuracy": 0.12732002511620522,
"num_tokens": 2139548.0,
"step": 1165
},
{
"entropy": 6.331307220458984,
"epoch": 0.09772803207484129,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999977500276693,
"loss": 6.1653,
"mean_token_accuracy": 0.13200777843594552,
"num_tokens": 2148765.0,
"step": 1170
},
{
"entropy": 6.388595914840698,
"epoch": 0.0981456732375543,
"grad_norm": 1.171875,
"learning_rate": 0.0004999976149240058,
"loss": 6.0868,
"mean_token_accuracy": 0.14182495772838594,
"num_tokens": 2157482.0,
"step": 1175
},
{
"entropy": 6.323437643051148,
"epoch": 0.09856331440026729,
"grad_norm": 1.03125,
"learning_rate": 0.0004999974758814884,
"loss": 6.1771,
"mean_token_accuracy": 0.13111152350902558,
"num_tokens": 2167320.0,
"step": 1180
},
{
"entropy": 6.291384696960449,
"epoch": 0.09898095556298028,
"grad_norm": 1.109375,
"learning_rate": 0.0004999973329001193,
"loss": 6.1273,
"mean_token_accuracy": 0.13208657130599022,
"num_tokens": 2175454.0,
"step": 1185
},
{
"entropy": 6.33533353805542,
"epoch": 0.09939859672569329,
"grad_norm": 1.125,
"learning_rate": 0.0004999971859799009,
"loss": 6.0659,
"mean_token_accuracy": 0.13413866832852364,
"num_tokens": 2184391.0,
"step": 1190
},
{
"entropy": 6.168669271469116,
"epoch": 0.09981623788840628,
"grad_norm": 1.140625,
"learning_rate": 0.0004999970351208361,
"loss": 5.9572,
"mean_token_accuracy": 0.1385273478925228,
"num_tokens": 2193309.0,
"step": 1195
},
{
"entropy": 6.358164358139038,
"epoch": 0.10023387905111927,
"grad_norm": 1.078125,
"learning_rate": 0.0004999968803229275,
"loss": 6.101,
"mean_token_accuracy": 0.12906384244561195,
"num_tokens": 2202057.0,
"step": 1200
},
{
"entropy": 6.238880729675293,
"epoch": 0.10065152021383228,
"grad_norm": 1.109375,
"learning_rate": 0.0004999967215861775,
"loss": 6.1872,
"mean_token_accuracy": 0.12864621803164483,
"num_tokens": 2212384.0,
"step": 1205
},
{
"entropy": 6.409511709213257,
"epoch": 0.10106916137654527,
"grad_norm": 1.0546875,
"learning_rate": 0.000499996558910589,
"loss": 6.1065,
"mean_token_accuracy": 0.13120872378349305,
"num_tokens": 2221451.0,
"step": 1210
},
{
"entropy": 6.193742275238037,
"epoch": 0.10148680253925826,
"grad_norm": 1.15625,
"learning_rate": 0.000499996392296165,
"loss": 5.9994,
"mean_token_accuracy": 0.13083511367440223,
"num_tokens": 2230440.0,
"step": 1215
},
{
"entropy": 6.30219783782959,
"epoch": 0.10190444370197127,
"grad_norm": 1.09375,
"learning_rate": 0.0004999962217429083,
"loss": 6.1816,
"mean_token_accuracy": 0.12673772796988486,
"num_tokens": 2239985.0,
"step": 1220
},
{
"entropy": 6.273440933227539,
"epoch": 0.10232208486468426,
"grad_norm": 1.015625,
"learning_rate": 0.0004999960472508219,
"loss": 6.0561,
"mean_token_accuracy": 0.13513024523854256,
"num_tokens": 2250391.0,
"step": 1225
},
{
"entropy": 6.387974548339844,
"epoch": 0.10273972602739725,
"grad_norm": 1.03125,
"learning_rate": 0.000499995868819909,
"loss": 6.156,
"mean_token_accuracy": 0.13272497951984405,
"num_tokens": 2260620.0,
"step": 1230
},
{
"entropy": 6.299834966659546,
"epoch": 0.10315736719011026,
"grad_norm": 0.98828125,
"learning_rate": 0.0004999956864501725,
"loss": 6.1095,
"mean_token_accuracy": 0.13380565866827965,
"num_tokens": 2271176.0,
"step": 1235
},
{
"entropy": 6.320106744766235,
"epoch": 0.10357500835282325,
"grad_norm": 1.140625,
"learning_rate": 0.0004999955001416156,
"loss": 6.0269,
"mean_token_accuracy": 0.14122135639190675,
"num_tokens": 2280371.0,
"step": 1240
},
{
"entropy": 6.157405948638916,
"epoch": 0.10399264951553625,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999953098942417,
"loss": 5.9988,
"mean_token_accuracy": 0.13865399062633516,
"num_tokens": 2289015.0,
"step": 1245
},
{
"entropy": 6.223317098617554,
"epoch": 0.10441029067824925,
"grad_norm": 1.2421875,
"learning_rate": 0.0004999951157080541,
"loss": 6.0702,
"mean_token_accuracy": 0.13662980124354362,
"num_tokens": 2297409.0,
"step": 1250
},
{
"entropy": 6.225243949890137,
"epoch": 0.10482793184096224,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999949175830561,
"loss": 6.0985,
"mean_token_accuracy": 0.1335413746535778,
"num_tokens": 2307017.0,
"step": 1255
},
{
"entropy": 6.245915412902832,
"epoch": 0.10524557300367524,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999947155192514,
"loss": 5.9299,
"mean_token_accuracy": 0.14725383818149568,
"num_tokens": 2316014.0,
"step": 1260
},
{
"entropy": 6.294537830352783,
"epoch": 0.10566321416638824,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999945095166433,
"loss": 6.0469,
"mean_token_accuracy": 0.13486992120742797,
"num_tokens": 2326326.0,
"step": 1265
},
{
"entropy": 6.358298969268799,
"epoch": 0.10608085532910123,
"grad_norm": 1.1875,
"learning_rate": 0.0004999942995752354,
"loss": 6.1415,
"mean_token_accuracy": 0.13432925343513488,
"num_tokens": 2335108.0,
"step": 1270
},
{
"entropy": 6.230367851257324,
"epoch": 0.10649849649181423,
"grad_norm": 1.125,
"learning_rate": 0.0004999940856950315,
"loss": 6.0451,
"mean_token_accuracy": 0.14503730461001396,
"num_tokens": 2343971.0,
"step": 1275
},
{
"entropy": 6.33094162940979,
"epoch": 0.10691613765452723,
"grad_norm": 0.95703125,
"learning_rate": 0.0004999938678760354,
"loss": 6.1053,
"mean_token_accuracy": 0.13394634500145913,
"num_tokens": 2353742.0,
"step": 1280
},
{
"entropy": 6.234221363067627,
"epoch": 0.10733377881724022,
"grad_norm": 0.9921875,
"learning_rate": 0.0004999936461182507,
"loss": 6.0561,
"mean_token_accuracy": 0.13966468647122382,
"num_tokens": 2363629.0,
"step": 1285
},
{
"entropy": 6.106270885467529,
"epoch": 0.10775141997995323,
"grad_norm": 1.0234375,
"learning_rate": 0.0004999934204216814,
"loss": 5.913,
"mean_token_accuracy": 0.14157691672444345,
"num_tokens": 2372705.0,
"step": 1290
},
{
"entropy": 6.213513946533203,
"epoch": 0.10816906114266622,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999931907863315,
"loss": 6.0353,
"mean_token_accuracy": 0.13727413564920427,
"num_tokens": 2382136.0,
"step": 1295
},
{
"entropy": 6.133555603027344,
"epoch": 0.10858670230537922,
"grad_norm": 1.1484375,
"learning_rate": 0.000499992957212205,
"loss": 6.0034,
"mean_token_accuracy": 0.13713872507214547,
"num_tokens": 2391060.0,
"step": 1300
},
{
"entropy": 6.358161687850952,
"epoch": 0.10900434346809222,
"grad_norm": 0.9921875,
"learning_rate": 0.0004999927196993059,
"loss": 6.1334,
"mean_token_accuracy": 0.13744667619466783,
"num_tokens": 2399885.0,
"step": 1305
},
{
"entropy": 6.278725337982178,
"epoch": 0.10942198463080521,
"grad_norm": 0.96875,
"learning_rate": 0.0004999924782476384,
"loss": 6.0035,
"mean_token_accuracy": 0.14220317751169204,
"num_tokens": 2409654.0,
"step": 1310
},
{
"entropy": 6.199410915374756,
"epoch": 0.1098396257935182,
"grad_norm": 1.140625,
"learning_rate": 0.0004999922328572068,
"loss": 6.0624,
"mean_token_accuracy": 0.13762215226888658,
"num_tokens": 2419342.0,
"step": 1315
},
{
"entropy": 6.141462421417236,
"epoch": 0.11025726695623121,
"grad_norm": 1.0625,
"learning_rate": 0.0004999919835280154,
"loss": 5.9506,
"mean_token_accuracy": 0.1402168832719326,
"num_tokens": 2428845.0,
"step": 1320
},
{
"entropy": 6.255073547363281,
"epoch": 0.1106749081189442,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999917302600684,
"loss": 5.9557,
"mean_token_accuracy": 0.14843129366636276,
"num_tokens": 2437134.0,
"step": 1325
},
{
"entropy": 6.033188390731811,
"epoch": 0.1110925492816572,
"grad_norm": 1.015625,
"learning_rate": 0.0004999914730533704,
"loss": 5.7955,
"mean_token_accuracy": 0.1502596452832222,
"num_tokens": 2445438.0,
"step": 1330
},
{
"entropy": 6.2179426670074465,
"epoch": 0.1115101904443702,
"grad_norm": 0.98046875,
"learning_rate": 0.0004999912119079258,
"loss": 6.1172,
"mean_token_accuracy": 0.13575662672519684,
"num_tokens": 2455039.0,
"step": 1335
},
{
"entropy": 6.263426494598389,
"epoch": 0.1119278316070832,
"grad_norm": 0.98046875,
"learning_rate": 0.0004999909468237393,
"loss": 6.0483,
"mean_token_accuracy": 0.13733413219451904,
"num_tokens": 2465170.0,
"step": 1340
},
{
"entropy": 6.09090895652771,
"epoch": 0.11234547276979619,
"grad_norm": 0.984375,
"learning_rate": 0.0004999906778008153,
"loss": 5.8012,
"mean_token_accuracy": 0.151080884039402,
"num_tokens": 2473688.0,
"step": 1345
},
{
"entropy": 6.165483570098877,
"epoch": 0.11276311393250919,
"grad_norm": 1.078125,
"learning_rate": 0.0004999904048391588,
"loss": 6.0541,
"mean_token_accuracy": 0.14202144667506217,
"num_tokens": 2482335.0,
"step": 1350
},
{
"entropy": 6.1746495246887205,
"epoch": 0.11318075509522219,
"grad_norm": 1.125,
"learning_rate": 0.0004999901279387743,
"loss": 6.0017,
"mean_token_accuracy": 0.14338096156716346,
"num_tokens": 2491808.0,
"step": 1355
},
{
"entropy": 6.3466249942779545,
"epoch": 0.11359839625793518,
"grad_norm": 0.96875,
"learning_rate": 0.0004999898470996669,
"loss": 6.13,
"mean_token_accuracy": 0.13258725851774217,
"num_tokens": 2501422.0,
"step": 1360
},
{
"entropy": 6.159154224395752,
"epoch": 0.11401603742064818,
"grad_norm": 0.91015625,
"learning_rate": 0.0004999895623218415,
"loss": 5.9181,
"mean_token_accuracy": 0.14280597865581512,
"num_tokens": 2511201.0,
"step": 1365
},
{
"entropy": 6.199628210067749,
"epoch": 0.11443367858336118,
"grad_norm": 1.078125,
"learning_rate": 0.0004999892736053027,
"loss": 5.9659,
"mean_token_accuracy": 0.13438230976462365,
"num_tokens": 2519798.0,
"step": 1370
},
{
"entropy": 6.113333225250244,
"epoch": 0.11485131974607417,
"grad_norm": 0.9765625,
"learning_rate": 0.0004999889809500561,
"loss": 5.9528,
"mean_token_accuracy": 0.14371661543846131,
"num_tokens": 2529177.0,
"step": 1375
},
{
"entropy": 6.27652678489685,
"epoch": 0.11526896090878717,
"grad_norm": 1.109375,
"learning_rate": 0.0004999886843561065,
"loss": 5.9321,
"mean_token_accuracy": 0.14615674763917924,
"num_tokens": 2537571.0,
"step": 1380
},
{
"entropy": 6.031244230270386,
"epoch": 0.11568660207150017,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999883838234592,
"loss": 5.8548,
"mean_token_accuracy": 0.14628306329250335,
"num_tokens": 2546258.0,
"step": 1385
},
{
"entropy": 6.165388917922973,
"epoch": 0.11610424323421316,
"grad_norm": 1.0234375,
"learning_rate": 0.0004999880793521194,
"loss": 5.8668,
"mean_token_accuracy": 0.13787785470485686,
"num_tokens": 2555862.0,
"step": 1390
},
{
"entropy": 5.933096837997437,
"epoch": 0.11652188439692616,
"grad_norm": 1.078125,
"learning_rate": 0.0004999877709420924,
"loss": 5.8877,
"mean_token_accuracy": 0.14672486782073973,
"num_tokens": 2564583.0,
"step": 1395
},
{
"entropy": 6.226252937316895,
"epoch": 0.11693952555963916,
"grad_norm": 1.0625,
"learning_rate": 0.0004999874585933837,
"loss": 5.984,
"mean_token_accuracy": 0.1394071787595749,
"num_tokens": 2574217.0,
"step": 1400
},
{
"entropy": 6.08908052444458,
"epoch": 0.11735716672235215,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999871423059987,
"loss": 5.8818,
"mean_token_accuracy": 0.14752811044454575,
"num_tokens": 2582821.0,
"step": 1405
},
{
"entropy": 6.154991292953492,
"epoch": 0.11777480788506516,
"grad_norm": 1.0,
"learning_rate": 0.000499986822079943,
"loss": 6.0467,
"mean_token_accuracy": 0.13607672825455666,
"num_tokens": 2592748.0,
"step": 1410
},
{
"entropy": 6.165617561340332,
"epoch": 0.11819244904777815,
"grad_norm": 0.9765625,
"learning_rate": 0.0004999864979152221,
"loss": 5.9434,
"mean_token_accuracy": 0.14729078263044357,
"num_tokens": 2602053.0,
"step": 1415
},
{
"entropy": 6.102991533279419,
"epoch": 0.11861009021049114,
"grad_norm": 1.0625,
"learning_rate": 0.0004999861698118417,
"loss": 6.0165,
"mean_token_accuracy": 0.14120813012123107,
"num_tokens": 2610557.0,
"step": 1420
},
{
"entropy": 6.1263680934906,
"epoch": 0.11902773137320415,
"grad_norm": 1.015625,
"learning_rate": 0.0004999858377698076,
"loss": 5.9156,
"mean_token_accuracy": 0.13886989206075667,
"num_tokens": 2619628.0,
"step": 1425
},
{
"entropy": 6.326252508163452,
"epoch": 0.11944537253591714,
"grad_norm": 1.109375,
"learning_rate": 0.0004999855017891256,
"loss": 6.083,
"mean_token_accuracy": 0.1396564431488514,
"num_tokens": 2629284.0,
"step": 1430
},
{
"entropy": 6.109390592575073,
"epoch": 0.11986301369863013,
"grad_norm": 1.09375,
"learning_rate": 0.0004999851618698017,
"loss": 5.9736,
"mean_token_accuracy": 0.14895331710577012,
"num_tokens": 2638001.0,
"step": 1435
},
{
"entropy": 6.114994764328003,
"epoch": 0.12028065486134314,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999848180118416,
"loss": 5.9908,
"mean_token_accuracy": 0.14804767146706582,
"num_tokens": 2647071.0,
"step": 1440
},
{
"entropy": 6.187527418136597,
"epoch": 0.12069829602405613,
"grad_norm": 1.03125,
"learning_rate": 0.0004999844702152516,
"loss": 5.9583,
"mean_token_accuracy": 0.1474977269768715,
"num_tokens": 2655826.0,
"step": 1445
},
{
"entropy": 6.12548508644104,
"epoch": 0.12111593718676913,
"grad_norm": 1.0234375,
"learning_rate": 0.0004999841184800374,
"loss": 5.8182,
"mean_token_accuracy": 0.15077890008687972,
"num_tokens": 2664431.0,
"step": 1450
},
{
"entropy": 5.976382827758789,
"epoch": 0.12153357834948213,
"grad_norm": 1.09375,
"learning_rate": 0.0004999837628062055,
"loss": 5.7456,
"mean_token_accuracy": 0.1526419997215271,
"num_tokens": 2673631.0,
"step": 1455
},
{
"entropy": 6.0932858943939205,
"epoch": 0.12195121951219512,
"grad_norm": 0.9609375,
"learning_rate": 0.0004999834031937621,
"loss": 6.0214,
"mean_token_accuracy": 0.1415261410176754,
"num_tokens": 2683363.0,
"step": 1460
},
{
"entropy": 6.140729188919067,
"epoch": 0.12236886067490813,
"grad_norm": 0.984375,
"learning_rate": 0.0004999830396427133,
"loss": 5.9755,
"mean_token_accuracy": 0.13880073204636573,
"num_tokens": 2692533.0,
"step": 1465
},
{
"entropy": 6.100193119049072,
"epoch": 0.12278650183762112,
"grad_norm": 1.1484375,
"learning_rate": 0.0004999826721530657,
"loss": 5.9625,
"mean_token_accuracy": 0.14861070960760117,
"num_tokens": 2701211.0,
"step": 1470
},
{
"entropy": 6.213804006576538,
"epoch": 0.12320414300033411,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999823007248255,
"loss": 5.9654,
"mean_token_accuracy": 0.14508800357580184,
"num_tokens": 2709543.0,
"step": 1475
},
{
"entropy": 6.132544040679932,
"epoch": 0.12362178416304712,
"grad_norm": 1.171875,
"learning_rate": 0.0004999819253579992,
"loss": 5.9665,
"mean_token_accuracy": 0.14124592989683152,
"num_tokens": 2718336.0,
"step": 1480
},
{
"entropy": 6.176914262771606,
"epoch": 0.12403942532576011,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999815460525938,
"loss": 5.9221,
"mean_token_accuracy": 0.14702423065900802,
"num_tokens": 2726504.0,
"step": 1485
},
{
"entropy": 6.065746259689331,
"epoch": 0.1244570664884731,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999811628086155,
"loss": 5.9256,
"mean_token_accuracy": 0.14405364468693732,
"num_tokens": 2736076.0,
"step": 1490
},
{
"entropy": 6.031908082962036,
"epoch": 0.1248747076511861,
"grad_norm": 1.0078125,
"learning_rate": 0.000499980775626071,
"loss": 5.8548,
"mean_token_accuracy": 0.14717004522681237,
"num_tokens": 2745497.0,
"step": 1495
},
{
"entropy": 6.086008548736572,
"epoch": 0.12529234881389908,
"grad_norm": 1.1796875,
"learning_rate": 0.0004999803845049674,
"loss": 6.0051,
"mean_token_accuracy": 0.14198841154575348,
"num_tokens": 2754455.0,
"step": 1500
},
{
"entropy": 6.275413751602173,
"epoch": 0.1257099899766121,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999799894453112,
"loss": 6.0214,
"mean_token_accuracy": 0.14551321789622307,
"num_tokens": 2763603.0,
"step": 1505
},
{
"entropy": 6.12061562538147,
"epoch": 0.1261276311393251,
"grad_norm": 1.140625,
"learning_rate": 0.0004999795904471095,
"loss": 5.8695,
"mean_token_accuracy": 0.14632337167859077,
"num_tokens": 2772152.0,
"step": 1510
},
{
"entropy": 6.125328063964844,
"epoch": 0.12654527230203808,
"grad_norm": 1.03125,
"learning_rate": 0.0004999791875103694,
"loss": 5.9827,
"mean_token_accuracy": 0.14955568239092826,
"num_tokens": 2781459.0,
"step": 1515
},
{
"entropy": 6.160517978668213,
"epoch": 0.12696291346475108,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999787806350977,
"loss": 5.9352,
"mean_token_accuracy": 0.1438853219151497,
"num_tokens": 2791177.0,
"step": 1520
},
{
"entropy": 6.0033468246459964,
"epoch": 0.1273805546274641,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999783698213016,
"loss": 5.926,
"mean_token_accuracy": 0.15096332877874374,
"num_tokens": 2800543.0,
"step": 1525
},
{
"entropy": 6.034644699096679,
"epoch": 0.12779819579017707,
"grad_norm": 1.09375,
"learning_rate": 0.0004999779550689885,
"loss": 5.764,
"mean_token_accuracy": 0.15348498970270158,
"num_tokens": 2809301.0,
"step": 1530
},
{
"entropy": 6.169605159759522,
"epoch": 0.12821583695289007,
"grad_norm": 1.109375,
"learning_rate": 0.0004999775363781654,
"loss": 5.9802,
"mean_token_accuracy": 0.1403758257627487,
"num_tokens": 2818269.0,
"step": 1535
},
{
"entropy": 6.0626365661621096,
"epoch": 0.12863347811560308,
"grad_norm": 1.09375,
"learning_rate": 0.0004999771137488395,
"loss": 5.8292,
"mean_token_accuracy": 0.14809781610965728,
"num_tokens": 2827170.0,
"step": 1540
},
{
"entropy": 6.0085289001464846,
"epoch": 0.12905111927831608,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999766871810188,
"loss": 5.8354,
"mean_token_accuracy": 0.15448207408189774,
"num_tokens": 2835320.0,
"step": 1545
},
{
"entropy": 6.026972770690918,
"epoch": 0.12946876044102906,
"grad_norm": 1.125,
"learning_rate": 0.0004999762566747101,
"loss": 5.9073,
"mean_token_accuracy": 0.14486387148499488,
"num_tokens": 2843755.0,
"step": 1550
},
{
"entropy": 6.129249715805054,
"epoch": 0.12988640160374207,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999758222299214,
"loss": 5.9413,
"mean_token_accuracy": 0.14105947464704513,
"num_tokens": 2853462.0,
"step": 1555
},
{
"entropy": 6.067689990997314,
"epoch": 0.13030404276645507,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999753838466601,
"loss": 5.8489,
"mean_token_accuracy": 0.14596890062093734,
"num_tokens": 2863041.0,
"step": 1560
},
{
"entropy": 6.222100067138672,
"epoch": 0.13072168392916805,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999749415249338,
"loss": 6.0523,
"mean_token_accuracy": 0.14630843549966813,
"num_tokens": 2873019.0,
"step": 1565
},
{
"entropy": 6.015613985061646,
"epoch": 0.13113932509188106,
"grad_norm": 1.046875,
"learning_rate": 0.0004999744952647505,
"loss": 5.8065,
"mean_token_accuracy": 0.1499025270342827,
"num_tokens": 2881467.0,
"step": 1570
},
{
"entropy": 6.0279559135437015,
"epoch": 0.13155696625459407,
"grad_norm": 1.046875,
"learning_rate": 0.0004999740450661176,
"loss": 5.8984,
"mean_token_accuracy": 0.14618548154830932,
"num_tokens": 2890914.0,
"step": 1575
},
{
"entropy": 6.068280839920044,
"epoch": 0.13197460741730704,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999735909290436,
"loss": 5.8159,
"mean_token_accuracy": 0.15112878903746604,
"num_tokens": 2901164.0,
"step": 1580
},
{
"entropy": 6.036407995223999,
"epoch": 0.13239224858002005,
"grad_norm": 1.0234375,
"learning_rate": 0.0004999731328535358,
"loss": 5.9705,
"mean_token_accuracy": 0.14157942086458206,
"num_tokens": 2910560.0,
"step": 1585
},
{
"entropy": 6.0331549644470215,
"epoch": 0.13280988974273306,
"grad_norm": 1.140625,
"learning_rate": 0.0004999726708396026,
"loss": 5.7769,
"mean_token_accuracy": 0.1490756705403328,
"num_tokens": 2918980.0,
"step": 1590
},
{
"entropy": 6.02565450668335,
"epoch": 0.13322753090544603,
"grad_norm": 0.9453125,
"learning_rate": 0.000499972204887252,
"loss": 5.9787,
"mean_token_accuracy": 0.1396894186735153,
"num_tokens": 2929516.0,
"step": 1595
},
{
"entropy": 6.176361989974976,
"epoch": 0.13364517206815904,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999717349964922,
"loss": 6.0518,
"mean_token_accuracy": 0.1366614058613777,
"num_tokens": 2940603.0,
"step": 1600
},
{
"entropy": 6.116162443161011,
"epoch": 0.13406281323087205,
"grad_norm": 1.0,
"learning_rate": 0.0004999712611673313,
"loss": 5.8945,
"mean_token_accuracy": 0.14497055262327194,
"num_tokens": 2950082.0,
"step": 1605
},
{
"entropy": 5.9512824535369875,
"epoch": 0.13448045439358502,
"grad_norm": 1.1484375,
"learning_rate": 0.0004999707833997777,
"loss": 5.7648,
"mean_token_accuracy": 0.15802783519029617,
"num_tokens": 2959098.0,
"step": 1610
},
{
"entropy": 6.146846580505371,
"epoch": 0.13489809555629803,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999703016938398,
"loss": 5.9007,
"mean_token_accuracy": 0.14953137785196305,
"num_tokens": 2968585.0,
"step": 1615
},
{
"entropy": 6.060613203048706,
"epoch": 0.13531573671901104,
"grad_norm": 0.9453125,
"learning_rate": 0.000499969816049526,
"loss": 5.9204,
"mean_token_accuracy": 0.14645206406712533,
"num_tokens": 2978430.0,
"step": 1620
},
{
"entropy": 6.181136131286621,
"epoch": 0.13573337788172402,
"grad_norm": 0.92578125,
"learning_rate": 0.0004999693264668446,
"loss": 5.9891,
"mean_token_accuracy": 0.1384026862680912,
"num_tokens": 2988398.0,
"step": 1625
},
{
"entropy": 6.1024940490722654,
"epoch": 0.13615101904443702,
"grad_norm": 0.9140625,
"learning_rate": 0.0004999688329458045,
"loss": 6.0009,
"mean_token_accuracy": 0.14288765341043472,
"num_tokens": 2999255.0,
"step": 1630
},
{
"entropy": 6.158026123046875,
"epoch": 0.13656866020715003,
"grad_norm": 1.046875,
"learning_rate": 0.0004999683354864141,
"loss": 5.8668,
"mean_token_accuracy": 0.15016328170895576,
"num_tokens": 3008638.0,
"step": 1635
},
{
"entropy": 6.011956262588501,
"epoch": 0.136986301369863,
"grad_norm": 1.046875,
"learning_rate": 0.0004999678340886823,
"loss": 5.8952,
"mean_token_accuracy": 0.14607993140816689,
"num_tokens": 3018070.0,
"step": 1640
},
{
"entropy": 5.984478425979614,
"epoch": 0.137403942532576,
"grad_norm": 0.9765625,
"learning_rate": 0.0004999673287526176,
"loss": 5.862,
"mean_token_accuracy": 0.1520274721086025,
"num_tokens": 3027878.0,
"step": 1645
},
{
"entropy": 6.163523769378662,
"epoch": 0.13782158369528902,
"grad_norm": 1.09375,
"learning_rate": 0.0004999668194782291,
"loss": 6.0371,
"mean_token_accuracy": 0.14080698117613794,
"num_tokens": 3037031.0,
"step": 1650
},
{
"entropy": 6.169953918457031,
"epoch": 0.138239224858002,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999663062655257,
"loss": 5.9905,
"mean_token_accuracy": 0.136997552216053,
"num_tokens": 3046311.0,
"step": 1655
},
{
"entropy": 6.062465858459473,
"epoch": 0.138656866020715,
"grad_norm": 0.96484375,
"learning_rate": 0.0004999657891145162,
"loss": 5.8028,
"mean_token_accuracy": 0.14837437868118286,
"num_tokens": 3055108.0,
"step": 1660
},
{
"entropy": 5.975989055633545,
"epoch": 0.139074507183428,
"grad_norm": 0.9921875,
"learning_rate": 0.0004999652680252099,
"loss": 5.829,
"mean_token_accuracy": 0.15185758844017982,
"num_tokens": 3063492.0,
"step": 1665
},
{
"entropy": 6.1554381370544435,
"epoch": 0.139492148346141,
"grad_norm": 1.015625,
"learning_rate": 0.0004999647429976157,
"loss": 5.8732,
"mean_token_accuracy": 0.152986741065979,
"num_tokens": 3072572.0,
"step": 1670
},
{
"entropy": 6.097223615646362,
"epoch": 0.139909789508854,
"grad_norm": 0.953125,
"learning_rate": 0.0004999642140317429,
"loss": 5.9321,
"mean_token_accuracy": 0.14403018429875375,
"num_tokens": 3082942.0,
"step": 1675
},
{
"entropy": 6.034411334991455,
"epoch": 0.140327430671567,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999636811276007,
"loss": 5.8955,
"mean_token_accuracy": 0.15122605189681054,
"num_tokens": 3091410.0,
"step": 1680
},
{
"entropy": 6.105877351760864,
"epoch": 0.14074507183427998,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999631442851986,
"loss": 5.9586,
"mean_token_accuracy": 0.15086555927991868,
"num_tokens": 3100626.0,
"step": 1685
},
{
"entropy": 6.044166851043701,
"epoch": 0.14116271299699298,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999626035045458,
"loss": 5.7604,
"mean_token_accuracy": 0.15637173503637314,
"num_tokens": 3109339.0,
"step": 1690
},
{
"entropy": 6.087968540191651,
"epoch": 0.141580354159706,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999620587856519,
"loss": 5.879,
"mean_token_accuracy": 0.1442359484732151,
"num_tokens": 3118636.0,
"step": 1695
},
{
"entropy": 5.975955629348755,
"epoch": 0.14199799532241897,
"grad_norm": 1.0,
"learning_rate": 0.0004999615101285262,
"loss": 5.8571,
"mean_token_accuracy": 0.14512152522802352,
"num_tokens": 3128162.0,
"step": 1700
},
{
"entropy": 6.065919256210327,
"epoch": 0.14241563648513197,
"grad_norm": 1.046875,
"learning_rate": 0.0004999609575331786,
"loss": 5.8685,
"mean_token_accuracy": 0.15015122443437576,
"num_tokens": 3136451.0,
"step": 1705
},
{
"entropy": 6.057447052001953,
"epoch": 0.14283327764784498,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999604009996186,
"loss": 5.8614,
"mean_token_accuracy": 0.14777368754148484,
"num_tokens": 3146599.0,
"step": 1710
},
{
"entropy": 6.099114274978637,
"epoch": 0.14325091881055796,
"grad_norm": 1.015625,
"learning_rate": 0.000499959840527856,
"loss": 5.916,
"mean_token_accuracy": 0.14324069395661354,
"num_tokens": 3155941.0,
"step": 1715
},
{
"entropy": 6.0154510021209715,
"epoch": 0.14366855997327097,
"grad_norm": 1.140625,
"learning_rate": 0.0004999592761179007,
"loss": 5.8388,
"mean_token_accuracy": 0.15261219143867494,
"num_tokens": 3164641.0,
"step": 1720
},
{
"entropy": 6.028367567062378,
"epoch": 0.14408620113598397,
"grad_norm": 1.03125,
"learning_rate": 0.0004999587077697624,
"loss": 5.872,
"mean_token_accuracy": 0.15229901447892188,
"num_tokens": 3173701.0,
"step": 1725
},
{
"entropy": 5.903607177734375,
"epoch": 0.14450384229869695,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999581354834512,
"loss": 5.7215,
"mean_token_accuracy": 0.1503341905772686,
"num_tokens": 3182268.0,
"step": 1730
},
{
"entropy": 5.921892786026001,
"epoch": 0.14492148346140996,
"grad_norm": 1.0703125,
"learning_rate": 0.000499957559258977,
"loss": 5.8109,
"mean_token_accuracy": 0.153120157122612,
"num_tokens": 3191513.0,
"step": 1735
},
{
"entropy": 6.026451969146729,
"epoch": 0.14533912462412296,
"grad_norm": 1.0546875,
"learning_rate": 0.00049995697909635,
"loss": 5.7633,
"mean_token_accuracy": 0.15072803422808648,
"num_tokens": 3200580.0,
"step": 1740
},
{
"entropy": 5.919099378585815,
"epoch": 0.14575676578683594,
"grad_norm": 1.078125,
"learning_rate": 0.0004999563949955803,
"loss": 5.8504,
"mean_token_accuracy": 0.15168591886758803,
"num_tokens": 3209053.0,
"step": 1745
},
{
"entropy": 6.004643774032592,
"epoch": 0.14617440694954895,
"grad_norm": 1.0,
"learning_rate": 0.000499955806956678,
"loss": 5.8276,
"mean_token_accuracy": 0.15193051397800444,
"num_tokens": 3218241.0,
"step": 1750
},
{
"entropy": 6.114099073410034,
"epoch": 0.14659204811226195,
"grad_norm": 0.9453125,
"learning_rate": 0.0004999552149796536,
"loss": 5.8861,
"mean_token_accuracy": 0.14796419218182563,
"num_tokens": 3227887.0,
"step": 1755
},
{
"entropy": 5.913031387329101,
"epoch": 0.14700968927497493,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999546190645175,
"loss": 5.7115,
"mean_token_accuracy": 0.15936694741249086,
"num_tokens": 3237281.0,
"step": 1760
},
{
"entropy": 5.936592626571655,
"epoch": 0.14742733043768794,
"grad_norm": 1.015625,
"learning_rate": 0.0004999540192112799,
"loss": 5.7418,
"mean_token_accuracy": 0.1534080371260643,
"num_tokens": 3246907.0,
"step": 1765
},
{
"entropy": 5.903944110870361,
"epoch": 0.14784497160040094,
"grad_norm": 0.94140625,
"learning_rate": 0.0004999534154199514,
"loss": 5.7581,
"mean_token_accuracy": 0.15006715506315232,
"num_tokens": 3256312.0,
"step": 1770
},
{
"entropy": 6.11810793876648,
"epoch": 0.14826261276311392,
"grad_norm": 0.9296875,
"learning_rate": 0.0004999528076905426,
"loss": 5.8535,
"mean_token_accuracy": 0.15088604092597963,
"num_tokens": 3265554.0,
"step": 1775
},
{
"entropy": 5.8378783702850345,
"epoch": 0.14868025392582693,
"grad_norm": 1.078125,
"learning_rate": 0.0004999521960230641,
"loss": 5.6918,
"mean_token_accuracy": 0.1556992784142494,
"num_tokens": 3274731.0,
"step": 1780
},
{
"entropy": 5.91249713897705,
"epoch": 0.14909789508853993,
"grad_norm": 1.078125,
"learning_rate": 0.0004999515804175268,
"loss": 5.8334,
"mean_token_accuracy": 0.14639962017536162,
"num_tokens": 3283518.0,
"step": 1785
},
{
"entropy": 6.047197675704956,
"epoch": 0.1495155362512529,
"grad_norm": 0.93359375,
"learning_rate": 0.000499950960873941,
"loss": 5.8387,
"mean_token_accuracy": 0.15209829434752464,
"num_tokens": 3292244.0,
"step": 1790
},
{
"entropy": 5.9918311595916744,
"epoch": 0.14993317741396592,
"grad_norm": 1.125,
"learning_rate": 0.0004999503373923182,
"loss": 5.8133,
"mean_token_accuracy": 0.1558985084295273,
"num_tokens": 3301198.0,
"step": 1795
},
{
"entropy": 5.999289274215698,
"epoch": 0.15035081857667892,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999497099726687,
"loss": 5.7948,
"mean_token_accuracy": 0.15358459949493408,
"num_tokens": 3309983.0,
"step": 1800
},
{
"entropy": 5.985867929458618,
"epoch": 0.1507684597393919,
"grad_norm": 0.921875,
"learning_rate": 0.0004999490786150039,
"loss": 5.8671,
"mean_token_accuracy": 0.152096726000309,
"num_tokens": 3319313.0,
"step": 1805
},
{
"entropy": 5.97202959060669,
"epoch": 0.1511861009021049,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999484433193348,
"loss": 5.7223,
"mean_token_accuracy": 0.1539360076189041,
"num_tokens": 3327497.0,
"step": 1810
},
{
"entropy": 5.8741857528686525,
"epoch": 0.15160374206481791,
"grad_norm": 1.015625,
"learning_rate": 0.0004999478040856722,
"loss": 5.7321,
"mean_token_accuracy": 0.15889767706394195,
"num_tokens": 3337029.0,
"step": 1815
},
{
"entropy": 5.907070827484131,
"epoch": 0.1520213832275309,
"grad_norm": 1.109375,
"learning_rate": 0.0004999471609140276,
"loss": 5.7154,
"mean_token_accuracy": 0.15107612311840057,
"num_tokens": 3346243.0,
"step": 1820
},
{
"entropy": 6.052509498596192,
"epoch": 0.1524390243902439,
"grad_norm": 1.125,
"learning_rate": 0.0004999465138044122,
"loss": 5.8601,
"mean_token_accuracy": 0.14963715374469758,
"num_tokens": 3354846.0,
"step": 1825
},
{
"entropy": 5.945438528060913,
"epoch": 0.1528566655529569,
"grad_norm": 1.0,
"learning_rate": 0.0004999458627568373,
"loss": 5.8311,
"mean_token_accuracy": 0.14300252199172975,
"num_tokens": 3364683.0,
"step": 1830
},
{
"entropy": 5.997858572006225,
"epoch": 0.15327430671566988,
"grad_norm": 0.9375,
"learning_rate": 0.0004999452077713144,
"loss": 5.7828,
"mean_token_accuracy": 0.1520732045173645,
"num_tokens": 3374652.0,
"step": 1835
},
{
"entropy": 5.954912424087524,
"epoch": 0.1536919478783829,
"grad_norm": 1.03125,
"learning_rate": 0.0004999445488478547,
"loss": 5.7793,
"mean_token_accuracy": 0.1517012432217598,
"num_tokens": 3384040.0,
"step": 1840
},
{
"entropy": 5.916548538208008,
"epoch": 0.1541095890410959,
"grad_norm": 1.1640625,
"learning_rate": 0.00049994388598647,
"loss": 5.8458,
"mean_token_accuracy": 0.15544982850551606,
"num_tokens": 3393185.0,
"step": 1845
},
{
"entropy": 5.950350522994995,
"epoch": 0.15452723020380887,
"grad_norm": 1.0,
"learning_rate": 0.0004999432191871719,
"loss": 5.7796,
"mean_token_accuracy": 0.15568242147564887,
"num_tokens": 3403077.0,
"step": 1850
},
{
"entropy": 5.9900336265563965,
"epoch": 0.15494487136652188,
"grad_norm": 1.0234375,
"learning_rate": 0.0004999425484499718,
"loss": 5.7456,
"mean_token_accuracy": 0.16083690375089646,
"num_tokens": 3412165.0,
"step": 1855
},
{
"entropy": 5.951553058624268,
"epoch": 0.1553625125292349,
"grad_norm": 1.046875,
"learning_rate": 0.0004999418737748817,
"loss": 5.8265,
"mean_token_accuracy": 0.1454428181052208,
"num_tokens": 3421162.0,
"step": 1860
},
{
"entropy": 6.050862407684326,
"epoch": 0.15578015369194786,
"grad_norm": 1.0625,
"learning_rate": 0.0004999411951619134,
"loss": 5.8793,
"mean_token_accuracy": 0.14493936151266099,
"num_tokens": 3430363.0,
"step": 1865
},
{
"entropy": 5.987689018249512,
"epoch": 0.15619779485466087,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999405126110786,
"loss": 5.7929,
"mean_token_accuracy": 0.15352775007486344,
"num_tokens": 3439199.0,
"step": 1870
},
{
"entropy": 6.1002357006073,
"epoch": 0.15661543601737388,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999398261223895,
"loss": 5.9129,
"mean_token_accuracy": 0.14442275017499923,
"num_tokens": 3448720.0,
"step": 1875
},
{
"entropy": 5.99772834777832,
"epoch": 0.15703307718008688,
"grad_norm": 0.9765625,
"learning_rate": 0.0004999391356958579,
"loss": 5.8939,
"mean_token_accuracy": 0.14629118889570236,
"num_tokens": 3458472.0,
"step": 1880
},
{
"entropy": 5.93433518409729,
"epoch": 0.15745071834279986,
"grad_norm": 1.078125,
"learning_rate": 0.000499938441331496,
"loss": 5.8354,
"mean_token_accuracy": 0.1485055461525917,
"num_tokens": 3467140.0,
"step": 1885
},
{
"entropy": 6.078635835647583,
"epoch": 0.15786835950551287,
"grad_norm": 1.0234375,
"learning_rate": 0.0004999377430293159,
"loss": 5.8076,
"mean_token_accuracy": 0.15474040806293488,
"num_tokens": 3476431.0,
"step": 1890
},
{
"entropy": 5.902494716644287,
"epoch": 0.15828600066822587,
"grad_norm": 1.09375,
"learning_rate": 0.0004999370407893299,
"loss": 5.7226,
"mean_token_accuracy": 0.15522852241992952,
"num_tokens": 3485768.0,
"step": 1895
},
{
"entropy": 6.016763544082641,
"epoch": 0.15870364183093885,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999363346115501,
"loss": 5.8796,
"mean_token_accuracy": 0.14450376033782958,
"num_tokens": 3495678.0,
"step": 1900
},
{
"entropy": 6.002452945709228,
"epoch": 0.15912128299365186,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999356244959893,
"loss": 5.8607,
"mean_token_accuracy": 0.14681571200489998,
"num_tokens": 3505168.0,
"step": 1905
},
{
"entropy": 5.89468150138855,
"epoch": 0.15953892415636486,
"grad_norm": 0.9765625,
"learning_rate": 0.0004999349104426594,
"loss": 5.8125,
"mean_token_accuracy": 0.14540216326713562,
"num_tokens": 3514498.0,
"step": 1910
},
{
"entropy": 6.03236985206604,
"epoch": 0.15995656531907784,
"grad_norm": 1.078125,
"learning_rate": 0.0004999341924515732,
"loss": 5.7402,
"mean_token_accuracy": 0.14893507361412048,
"num_tokens": 3524617.0,
"step": 1915
},
{
"entropy": 5.950137090682984,
"epoch": 0.16037420648179085,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999334705227431,
"loss": 5.7038,
"mean_token_accuracy": 0.15793468281626702,
"num_tokens": 3533523.0,
"step": 1920
},
{
"entropy": 5.93976845741272,
"epoch": 0.16079184764450385,
"grad_norm": 0.92578125,
"learning_rate": 0.000499932744656182,
"loss": 5.7803,
"mean_token_accuracy": 0.15535735040903093,
"num_tokens": 3542922.0,
"step": 1925
},
{
"entropy": 5.9716380596160885,
"epoch": 0.16120948880721683,
"grad_norm": 1.0234375,
"learning_rate": 0.0004999320148519024,
"loss": 5.7698,
"mean_token_accuracy": 0.1537807211279869,
"num_tokens": 3551827.0,
"step": 1930
},
{
"entropy": 5.912134122848511,
"epoch": 0.16162712996992984,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999312811099171,
"loss": 5.7424,
"mean_token_accuracy": 0.15665630251169205,
"num_tokens": 3560911.0,
"step": 1935
},
{
"entropy": 5.943596744537354,
"epoch": 0.16204477113264285,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999305434302391,
"loss": 5.774,
"mean_token_accuracy": 0.15078182965517045,
"num_tokens": 3569473.0,
"step": 1940
},
{
"entropy": 5.950336027145386,
"epoch": 0.16246241229535582,
"grad_norm": 1.0546875,
"learning_rate": 0.000499929801812881,
"loss": 5.7669,
"mean_token_accuracy": 0.15755152851343154,
"num_tokens": 3578843.0,
"step": 1945
},
{
"entropy": 5.934217214584351,
"epoch": 0.16288005345806883,
"grad_norm": 1.078125,
"learning_rate": 0.0004999290562578561,
"loss": 5.7788,
"mean_token_accuracy": 0.15204366892576218,
"num_tokens": 3588304.0,
"step": 1950
},
{
"entropy": 5.915329647064209,
"epoch": 0.16329769462078184,
"grad_norm": 1.0234375,
"learning_rate": 0.0004999283067651773,
"loss": 5.8426,
"mean_token_accuracy": 0.15053938925266266,
"num_tokens": 3598354.0,
"step": 1955
},
{
"entropy": 6.05399227142334,
"epoch": 0.16371533578349481,
"grad_norm": 0.984375,
"learning_rate": 0.0004999275533348577,
"loss": 5.8723,
"mean_token_accuracy": 0.15038531348109246,
"num_tokens": 3607503.0,
"step": 1960
},
{
"entropy": 5.811189603805542,
"epoch": 0.16413297694620782,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999267959669106,
"loss": 5.6896,
"mean_token_accuracy": 0.1612261191010475,
"num_tokens": 3617467.0,
"step": 1965
},
{
"entropy": 5.984873485565186,
"epoch": 0.16455061810892083,
"grad_norm": 1.078125,
"learning_rate": 0.0004999260346613491,
"loss": 5.7094,
"mean_token_accuracy": 0.14969066977500917,
"num_tokens": 3627048.0,
"step": 1970
},
{
"entropy": 5.889481449127198,
"epoch": 0.1649682592716338,
"grad_norm": 1.015625,
"learning_rate": 0.0004999252694181867,
"loss": 5.7374,
"mean_token_accuracy": 0.15431074053049088,
"num_tokens": 3636683.0,
"step": 1975
},
{
"entropy": 5.81419415473938,
"epoch": 0.1653859004343468,
"grad_norm": 1.03125,
"learning_rate": 0.0004999245002374367,
"loss": 5.6322,
"mean_token_accuracy": 0.16551566421985625,
"num_tokens": 3645231.0,
"step": 1980
},
{
"entropy": 5.923137855529785,
"epoch": 0.16580354159705982,
"grad_norm": 1.1953125,
"learning_rate": 0.0004999237271191125,
"loss": 5.7184,
"mean_token_accuracy": 0.1556422308087349,
"num_tokens": 3653851.0,
"step": 1985
},
{
"entropy": 5.859198522567749,
"epoch": 0.1662211827597728,
"grad_norm": 1.125,
"learning_rate": 0.0004999229500632279,
"loss": 5.6922,
"mean_token_accuracy": 0.16142508387565613,
"num_tokens": 3662720.0,
"step": 1990
},
{
"entropy": 5.774721765518189,
"epoch": 0.1666388239224858,
"grad_norm": 1.171875,
"learning_rate": 0.0004999221690697961,
"loss": 5.6495,
"mean_token_accuracy": 0.15686668008565902,
"num_tokens": 3671777.0,
"step": 1995
},
{
"entropy": 5.897257137298584,
"epoch": 0.1670564650851988,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999213841388312,
"loss": 5.7188,
"mean_token_accuracy": 0.16273299157619475,
"num_tokens": 3681390.0,
"step": 2000
},
{
"entropy": 5.959281492233276,
"epoch": 0.16747410624791179,
"grad_norm": 1.0625,
"learning_rate": 0.0004999205952703466,
"loss": 5.7871,
"mean_token_accuracy": 0.15210252553224562,
"num_tokens": 3690899.0,
"step": 2005
},
{
"entropy": 6.015440273284912,
"epoch": 0.1678917474106248,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999198024643563,
"loss": 5.8759,
"mean_token_accuracy": 0.14671805500984192,
"num_tokens": 3699891.0,
"step": 2010
},
{
"entropy": 5.827287578582764,
"epoch": 0.1683093885733378,
"grad_norm": 1.015625,
"learning_rate": 0.0004999190057208741,
"loss": 5.6696,
"mean_token_accuracy": 0.1584944322705269,
"num_tokens": 3709860.0,
"step": 2015
},
{
"entropy": 5.938063478469848,
"epoch": 0.16872702973605078,
"grad_norm": 1.0078125,
"learning_rate": 0.000499918205039914,
"loss": 5.803,
"mean_token_accuracy": 0.15343469232320786,
"num_tokens": 3718896.0,
"step": 2020
},
{
"entropy": 5.8418293476104735,
"epoch": 0.16914467089876378,
"grad_norm": 1.0625,
"learning_rate": 0.0004999174004214899,
"loss": 5.6123,
"mean_token_accuracy": 0.1574483186006546,
"num_tokens": 3727355.0,
"step": 2025
},
{
"entropy": 5.841806077957154,
"epoch": 0.1695623120614768,
"grad_norm": 1.03125,
"learning_rate": 0.0004999165918656161,
"loss": 5.7103,
"mean_token_accuracy": 0.15504993572831155,
"num_tokens": 3736191.0,
"step": 2030
},
{
"entropy": 5.958983039855957,
"epoch": 0.16997995322418977,
"grad_norm": 1.0625,
"learning_rate": 0.0004999157793723065,
"loss": 5.7395,
"mean_token_accuracy": 0.1586153984069824,
"num_tokens": 3744832.0,
"step": 2035
},
{
"entropy": 5.84045672416687,
"epoch": 0.17039759438690277,
"grad_norm": 0.9921875,
"learning_rate": 0.0004999149629415755,
"loss": 5.7066,
"mean_token_accuracy": 0.15203840285539627,
"num_tokens": 3753835.0,
"step": 2040
},
{
"entropy": 6.055625247955322,
"epoch": 0.17081523554961578,
"grad_norm": 1.015625,
"learning_rate": 0.0004999141425734374,
"loss": 5.7747,
"mean_token_accuracy": 0.15490478426218032,
"num_tokens": 3762816.0,
"step": 2045
},
{
"entropy": 5.835732316970825,
"epoch": 0.17123287671232876,
"grad_norm": 0.8984375,
"learning_rate": 0.0004999133182679064,
"loss": 5.8155,
"mean_token_accuracy": 0.148703470826149,
"num_tokens": 3773244.0,
"step": 2050
},
{
"entropy": 5.953923606872559,
"epoch": 0.17165051787504176,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999124900249971,
"loss": 5.6763,
"mean_token_accuracy": 0.16193537265062333,
"num_tokens": 3782122.0,
"step": 2055
},
{
"entropy": 5.870869255065918,
"epoch": 0.17206815903775477,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999116578447239,
"loss": 5.6705,
"mean_token_accuracy": 0.1667713090777397,
"num_tokens": 3791303.0,
"step": 2060
},
{
"entropy": 5.876138734817505,
"epoch": 0.17248580020046775,
"grad_norm": 0.9375,
"learning_rate": 0.0004999108217271015,
"loss": 5.7479,
"mean_token_accuracy": 0.15425308793783188,
"num_tokens": 3800991.0,
"step": 2065
},
{
"entropy": 5.857042074203491,
"epoch": 0.17290344136318075,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999099816721444,
"loss": 5.6609,
"mean_token_accuracy": 0.15457299053668977,
"num_tokens": 3811293.0,
"step": 2070
},
{
"entropy": 5.99418363571167,
"epoch": 0.17332108252589376,
"grad_norm": 1.0234375,
"learning_rate": 0.0004999091376798673,
"loss": 5.7568,
"mean_token_accuracy": 0.15130494236946107,
"num_tokens": 3820013.0,
"step": 2075
},
{
"entropy": 5.852330875396729,
"epoch": 0.17373872368860674,
"grad_norm": 0.921875,
"learning_rate": 0.0004999082897502849,
"loss": 5.6497,
"mean_token_accuracy": 0.16134200170636176,
"num_tokens": 3829099.0,
"step": 2080
},
{
"entropy": 5.82087459564209,
"epoch": 0.17415636485131974,
"grad_norm": 0.98046875,
"learning_rate": 0.0004999074378834123,
"loss": 5.7483,
"mean_token_accuracy": 0.15421984121203422,
"num_tokens": 3838308.0,
"step": 2085
},
{
"entropy": 5.92053747177124,
"epoch": 0.17457400601403275,
"grad_norm": 0.95703125,
"learning_rate": 0.0004999065820792644,
"loss": 5.7005,
"mean_token_accuracy": 0.15973791033029555,
"num_tokens": 3847650.0,
"step": 2090
},
{
"entropy": 5.99317421913147,
"epoch": 0.17499164717674573,
"grad_norm": 0.95703125,
"learning_rate": 0.0004999057223378559,
"loss": 5.8778,
"mean_token_accuracy": 0.1442355714738369,
"num_tokens": 3857252.0,
"step": 2095
},
{
"entropy": 5.863450002670288,
"epoch": 0.17540928833945874,
"grad_norm": 1.03125,
"learning_rate": 0.000499904858659202,
"loss": 5.7337,
"mean_token_accuracy": 0.15778396278619766,
"num_tokens": 3865747.0,
"step": 2100
},
{
"entropy": 5.886807632446289,
"epoch": 0.17582692950217174,
"grad_norm": 0.94140625,
"learning_rate": 0.0004999039910433179,
"loss": 5.6976,
"mean_token_accuracy": 0.16511771082878113,
"num_tokens": 3874958.0,
"step": 2105
},
{
"entropy": 5.78854775428772,
"epoch": 0.17624457066488472,
"grad_norm": 0.91015625,
"learning_rate": 0.0004999031194902187,
"loss": 5.6507,
"mean_token_accuracy": 0.16393667757511138,
"num_tokens": 3885216.0,
"step": 2110
},
{
"entropy": 5.815725708007813,
"epoch": 0.17666221182759773,
"grad_norm": 1.046875,
"learning_rate": 0.0004999022439999198,
"loss": 5.6814,
"mean_token_accuracy": 0.16577479541301726,
"num_tokens": 3893973.0,
"step": 2115
},
{
"entropy": 5.971462154388428,
"epoch": 0.17707985299031073,
"grad_norm": 1.078125,
"learning_rate": 0.0004999013645724362,
"loss": 5.7731,
"mean_token_accuracy": 0.1582237407565117,
"num_tokens": 3903532.0,
"step": 2120
},
{
"entropy": 5.9179940700531,
"epoch": 0.1774974941530237,
"grad_norm": 0.94921875,
"learning_rate": 0.0004999004812077836,
"loss": 5.6958,
"mean_token_accuracy": 0.15923276245594026,
"num_tokens": 3913427.0,
"step": 2125
},
{
"entropy": 5.932846403121948,
"epoch": 0.17791513531573672,
"grad_norm": 0.95703125,
"learning_rate": 0.0004998995939059773,
"loss": 5.8206,
"mean_token_accuracy": 0.145328551530838,
"num_tokens": 3923870.0,
"step": 2130
},
{
"entropy": 5.825693130493164,
"epoch": 0.17833277647844972,
"grad_norm": 0.97265625,
"learning_rate": 0.000499898702667033,
"loss": 5.6408,
"mean_token_accuracy": 0.1622411608695984,
"num_tokens": 3933469.0,
"step": 2135
},
{
"entropy": 5.8633805274963375,
"epoch": 0.1787504176411627,
"grad_norm": 1.125,
"learning_rate": 0.0004998978074909661,
"loss": 5.6579,
"mean_token_accuracy": 0.16844791918992996,
"num_tokens": 3942427.0,
"step": 2140
},
{
"entropy": 5.818320178985596,
"epoch": 0.1791680588038757,
"grad_norm": 1.0078125,
"learning_rate": 0.0004998969083777925,
"loss": 5.6925,
"mean_token_accuracy": 0.16658158153295516,
"num_tokens": 3951250.0,
"step": 2145
},
{
"entropy": 5.894375801086426,
"epoch": 0.1795856999665887,
"grad_norm": 1.078125,
"learning_rate": 0.0004998960053275277,
"loss": 5.6894,
"mean_token_accuracy": 0.15957503467798234,
"num_tokens": 3959969.0,
"step": 2150
},
{
"entropy": 5.851364850997925,
"epoch": 0.1800033411293017,
"grad_norm": 1.109375,
"learning_rate": 0.0004998950983401875,
"loss": 5.7232,
"mean_token_accuracy": 0.15560920387506486,
"num_tokens": 3968171.0,
"step": 2155
},
{
"entropy": 5.920967769622803,
"epoch": 0.1804209822920147,
"grad_norm": 1.0703125,
"learning_rate": 0.0004998941874157882,
"loss": 5.6209,
"mean_token_accuracy": 0.16588948369026185,
"num_tokens": 3976686.0,
"step": 2160
},
{
"entropy": 5.743179512023926,
"epoch": 0.1808386234547277,
"grad_norm": 0.96484375,
"learning_rate": 0.0004998932725543453,
"loss": 5.7372,
"mean_token_accuracy": 0.15956501960754393,
"num_tokens": 3986552.0,
"step": 2165
},
{
"entropy": 5.888717126846314,
"epoch": 0.18125626461744068,
"grad_norm": 1.09375,
"learning_rate": 0.0004998923537558749,
"loss": 5.6116,
"mean_token_accuracy": 0.1573790043592453,
"num_tokens": 3995501.0,
"step": 2170
},
{
"entropy": 5.726497554779053,
"epoch": 0.1816739057801537,
"grad_norm": 1.0078125,
"learning_rate": 0.0004998914310203932,
"loss": 5.6075,
"mean_token_accuracy": 0.16367665976285933,
"num_tokens": 4004423.0,
"step": 2175
},
{
"entropy": 5.9079173564910885,
"epoch": 0.1820915469428667,
"grad_norm": 1.03125,
"learning_rate": 0.0004998905043479163,
"loss": 5.796,
"mean_token_accuracy": 0.1520387388765812,
"num_tokens": 4013324.0,
"step": 2180
},
{
"entropy": 5.931830978393554,
"epoch": 0.18250918810557967,
"grad_norm": 1.046875,
"learning_rate": 0.0004998895737384605,
"loss": 5.6804,
"mean_token_accuracy": 0.15867839008569717,
"num_tokens": 4021896.0,
"step": 2185
},
{
"entropy": 5.754932498931884,
"epoch": 0.18292682926829268,
"grad_norm": 0.99609375,
"learning_rate": 0.0004998886391920418,
"loss": 5.66,
"mean_token_accuracy": 0.1559813290834427,
"num_tokens": 4030590.0,
"step": 2190
},
{
"entropy": 5.8287865161895756,
"epoch": 0.18334447043100568,
"grad_norm": 1.0625,
"learning_rate": 0.0004998877007086769,
"loss": 5.5567,
"mean_token_accuracy": 0.17052167057991027,
"num_tokens": 4040041.0,
"step": 2195
},
{
"entropy": 5.837833738327026,
"epoch": 0.18376211159371866,
"grad_norm": 1.0078125,
"learning_rate": 0.0004998867582883821,
"loss": 5.7246,
"mean_token_accuracy": 0.150713437050581,
"num_tokens": 4049119.0,
"step": 2200
},
{
"entropy": 5.864384412765503,
"epoch": 0.18417975275643167,
"grad_norm": 0.9765625,
"learning_rate": 0.0004998858119311739,
"loss": 5.6599,
"mean_token_accuracy": 0.15918856784701346,
"num_tokens": 4059265.0,
"step": 2205
},
{
"entropy": 5.8326281070709225,
"epoch": 0.18459739391914468,
"grad_norm": 0.984375,
"learning_rate": 0.0004998848616370689,
"loss": 5.7001,
"mean_token_accuracy": 0.15809556990861892,
"num_tokens": 4068363.0,
"step": 2210
},
{
"entropy": 5.798278284072876,
"epoch": 0.18501503508185768,
"grad_norm": 0.95703125,
"learning_rate": 0.0004998839074060837,
"loss": 5.5881,
"mean_token_accuracy": 0.16857375651597978,
"num_tokens": 4077390.0,
"step": 2215
},
{
"entropy": 5.79602165222168,
"epoch": 0.18543267624457066,
"grad_norm": 1.0546875,
"learning_rate": 0.000499882949238235,
"loss": 5.6749,
"mean_token_accuracy": 0.15564524084329606,
"num_tokens": 4087331.0,
"step": 2220
},
{
"entropy": 5.975500297546387,
"epoch": 0.18585031740728367,
"grad_norm": 1.015625,
"learning_rate": 0.0004998819871335396,
"loss": 5.8549,
"mean_token_accuracy": 0.15241608321666716,
"num_tokens": 4096425.0,
"step": 2225
},
{
"entropy": 5.81837944984436,
"epoch": 0.18626795856999667,
"grad_norm": 1.015625,
"learning_rate": 0.0004998810210920142,
"loss": 5.6292,
"mean_token_accuracy": 0.15902866423130035,
"num_tokens": 4106056.0,
"step": 2230
},
{
"entropy": 5.7763697624206545,
"epoch": 0.18668559973270965,
"grad_norm": 1.0234375,
"learning_rate": 0.0004998800511136759,
"loss": 5.7116,
"mean_token_accuracy": 0.15947857201099397,
"num_tokens": 4115133.0,
"step": 2235
},
{
"entropy": 5.8516068935394285,
"epoch": 0.18710324089542266,
"grad_norm": 0.95703125,
"learning_rate": 0.0004998790771985417,
"loss": 5.6267,
"mean_token_accuracy": 0.16477923840284348,
"num_tokens": 4123630.0,
"step": 2240
},
{
"entropy": 5.774742317199707,
"epoch": 0.18752088205813566,
"grad_norm": 0.9375,
"learning_rate": 0.0004998780993466284,
"loss": 5.7463,
"mean_token_accuracy": 0.16099598556756972,
"num_tokens": 4133337.0,
"step": 2245
},
{
"entropy": 5.892826843261719,
"epoch": 0.18793852322084864,
"grad_norm": 1.0625,
"learning_rate": 0.0004998771175579534,
"loss": 5.676,
"mean_token_accuracy": 0.1580575130879879,
"num_tokens": 4142240.0,
"step": 2250
},
{
"entropy": 5.782235956192016,
"epoch": 0.18835616438356165,
"grad_norm": 0.984375,
"learning_rate": 0.0004998761318325337,
"loss": 5.6686,
"mean_token_accuracy": 0.156616672873497,
"num_tokens": 4151297.0,
"step": 2255
},
{
"entropy": 5.789702367782593,
"epoch": 0.18877380554627465,
"grad_norm": 1.015625,
"learning_rate": 0.0004998751421703868,
"loss": 5.6215,
"mean_token_accuracy": 0.16046866476535798,
"num_tokens": 4160193.0,
"step": 2260
},
{
"entropy": 5.877978038787842,
"epoch": 0.18919144670898763,
"grad_norm": 0.96484375,
"learning_rate": 0.0004998741485715297,
"loss": 5.7708,
"mean_token_accuracy": 0.15555500686168672,
"num_tokens": 4169948.0,
"step": 2265
},
{
"entropy": 5.985896205902099,
"epoch": 0.18960908787170064,
"grad_norm": 0.9296875,
"learning_rate": 0.00049987315103598,
"loss": 5.7972,
"mean_token_accuracy": 0.15081522166728972,
"num_tokens": 4179981.0,
"step": 2270
},
{
"entropy": 5.81521258354187,
"epoch": 0.19002672903441364,
"grad_norm": 1.03125,
"learning_rate": 0.0004998721495637551,
"loss": 5.7957,
"mean_token_accuracy": 0.15333186388015746,
"num_tokens": 4189172.0,
"step": 2275
},
{
"entropy": 5.865990352630615,
"epoch": 0.19044437019712662,
"grad_norm": 1.0546875,
"learning_rate": 0.0004998711441548726,
"loss": 5.6126,
"mean_token_accuracy": 0.16020057201385499,
"num_tokens": 4197312.0,
"step": 2280
},
{
"entropy": 5.87011022567749,
"epoch": 0.19086201135983963,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998701348093499,
"loss": 5.6706,
"mean_token_accuracy": 0.16028127670288086,
"num_tokens": 4206828.0,
"step": 2285
},
{
"entropy": 5.936899137496948,
"epoch": 0.19127965252255263,
"grad_norm": 1.015625,
"learning_rate": 0.000499869121527205,
"loss": 5.6343,
"mean_token_accuracy": 0.1662514716386795,
"num_tokens": 4214835.0,
"step": 2290
},
{
"entropy": 5.84994478225708,
"epoch": 0.1916972936852656,
"grad_norm": 0.96484375,
"learning_rate": 0.0004998681043084553,
"loss": 5.8139,
"mean_token_accuracy": 0.14824395328760148,
"num_tokens": 4225119.0,
"step": 2295
},
{
"entropy": 5.756076002120972,
"epoch": 0.19211493484797862,
"grad_norm": 1.0078125,
"learning_rate": 0.0004998670831531188,
"loss": 5.6526,
"mean_token_accuracy": 0.15910039842128754,
"num_tokens": 4235257.0,
"step": 2300
},
{
"entropy": 5.82043194770813,
"epoch": 0.19253257601069163,
"grad_norm": 0.91796875,
"learning_rate": 0.0004998660580612135,
"loss": 5.7215,
"mean_token_accuracy": 0.16029210090637208,
"num_tokens": 4244211.0,
"step": 2305
},
{
"entropy": 5.849356603622437,
"epoch": 0.1929502171734046,
"grad_norm": 1.078125,
"learning_rate": 0.0004998650290327569,
"loss": 5.7396,
"mean_token_accuracy": 0.15851273387670517,
"num_tokens": 4253149.0,
"step": 2310
},
{
"entropy": 5.765655517578125,
"epoch": 0.1933678583361176,
"grad_norm": 1.0078125,
"learning_rate": 0.0004998639960677675,
"loss": 5.6319,
"mean_token_accuracy": 0.16373072266578675,
"num_tokens": 4262557.0,
"step": 2315
},
{
"entropy": 5.830093955993652,
"epoch": 0.19378549949883062,
"grad_norm": 0.92578125,
"learning_rate": 0.0004998629591662631,
"loss": 5.6452,
"mean_token_accuracy": 0.15700610876083373,
"num_tokens": 4272881.0,
"step": 2320
},
{
"entropy": 5.771763753890991,
"epoch": 0.1942031406615436,
"grad_norm": 1.1328125,
"learning_rate": 0.000499861918328262,
"loss": 5.643,
"mean_token_accuracy": 0.1647744208574295,
"num_tokens": 4281158.0,
"step": 2325
},
{
"entropy": 5.816524362564087,
"epoch": 0.1946207818242566,
"grad_norm": 1.0,
"learning_rate": 0.0004998608735537822,
"loss": 5.644,
"mean_token_accuracy": 0.15966358929872512,
"num_tokens": 4290319.0,
"step": 2330
},
{
"entropy": 5.839132690429688,
"epoch": 0.1950384229869696,
"grad_norm": 1.0625,
"learning_rate": 0.0004998598248428423,
"loss": 5.7273,
"mean_token_accuracy": 0.16326339393854142,
"num_tokens": 4299276.0,
"step": 2335
},
{
"entropy": 5.8503776550292965,
"epoch": 0.19545606414968258,
"grad_norm": 1.0390625,
"learning_rate": 0.0004998587721954604,
"loss": 5.692,
"mean_token_accuracy": 0.16148559898138046,
"num_tokens": 4308291.0,
"step": 2340
},
{
"entropy": 5.7621392726898195,
"epoch": 0.1958737053123956,
"grad_norm": 1.078125,
"learning_rate": 0.0004998577156116551,
"loss": 5.6517,
"mean_token_accuracy": 0.1572328507900238,
"num_tokens": 4316654.0,
"step": 2345
},
{
"entropy": 5.833258485794067,
"epoch": 0.1962913464751086,
"grad_norm": 1.0234375,
"learning_rate": 0.0004998566550914448,
"loss": 5.5887,
"mean_token_accuracy": 0.15987759977579116,
"num_tokens": 4325911.0,
"step": 2350
},
{
"entropy": 5.780224704742432,
"epoch": 0.19670898763782158,
"grad_norm": 1.015625,
"learning_rate": 0.0004998555906348481,
"loss": 5.77,
"mean_token_accuracy": 0.1557260274887085,
"num_tokens": 4334846.0,
"step": 2355
},
{
"entropy": 5.895426082611084,
"epoch": 0.19712662880053458,
"grad_norm": 1.0546875,
"learning_rate": 0.0004998545222418836,
"loss": 5.6489,
"mean_token_accuracy": 0.16278416961431502,
"num_tokens": 4343728.0,
"step": 2360
},
{
"entropy": 5.813882684707641,
"epoch": 0.1975442699632476,
"grad_norm": 1.03125,
"learning_rate": 0.0004998534499125701,
"loss": 5.6286,
"mean_token_accuracy": 0.1627249151468277,
"num_tokens": 4352774.0,
"step": 2365
},
{
"entropy": 5.867633724212647,
"epoch": 0.19796191112596057,
"grad_norm": 1.078125,
"learning_rate": 0.0004998523736469263,
"loss": 5.7684,
"mean_token_accuracy": 0.15933503061532975,
"num_tokens": 4361663.0,
"step": 2370
},
{
"entropy": 5.789565467834473,
"epoch": 0.19837955228867357,
"grad_norm": 1.046875,
"learning_rate": 0.000499851293444971,
"loss": 5.6116,
"mean_token_accuracy": 0.1717309609055519,
"num_tokens": 4370278.0,
"step": 2375
},
{
"entropy": 5.8761261940002445,
"epoch": 0.19879719345138658,
"grad_norm": 0.96484375,
"learning_rate": 0.0004998502093067231,
"loss": 5.6661,
"mean_token_accuracy": 0.16252981573343278,
"num_tokens": 4379010.0,
"step": 2380
},
{
"entropy": 5.848679161071777,
"epoch": 0.19921483461409956,
"grad_norm": 0.99609375,
"learning_rate": 0.0004998491212322017,
"loss": 5.6362,
"mean_token_accuracy": 0.15828320235013962,
"num_tokens": 4388145.0,
"step": 2385
},
{
"entropy": 5.763821983337403,
"epoch": 0.19963247577681256,
"grad_norm": 1.09375,
"learning_rate": 0.0004998480292214258,
"loss": 5.773,
"mean_token_accuracy": 0.15703087002038957,
"num_tokens": 4396321.0,
"step": 2390
},
{
"entropy": 5.807074356079101,
"epoch": 0.20005011693952557,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998469332744144,
"loss": 5.5447,
"mean_token_accuracy": 0.1663380816578865,
"num_tokens": 4404854.0,
"step": 2395
},
{
"entropy": 5.64944372177124,
"epoch": 0.20046775810223855,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998458333911869,
"loss": 5.5536,
"mean_token_accuracy": 0.16941631883382796,
"num_tokens": 4413890.0,
"step": 2400
},
{
"entropy": 5.781361818313599,
"epoch": 0.20088539926495155,
"grad_norm": 1.0390625,
"learning_rate": 0.0004998447295717624,
"loss": 5.7074,
"mean_token_accuracy": 0.16001133918762206,
"num_tokens": 4423019.0,
"step": 2405
},
{
"entropy": 5.797937536239624,
"epoch": 0.20130304042766456,
"grad_norm": 1.0234375,
"learning_rate": 0.0004998436218161602,
"loss": 5.6408,
"mean_token_accuracy": 0.16225794404745103,
"num_tokens": 4432340.0,
"step": 2410
},
{
"entropy": 5.792998313903809,
"epoch": 0.20172068159037754,
"grad_norm": 0.95703125,
"learning_rate": 0.0004998425101243999,
"loss": 5.6188,
"mean_token_accuracy": 0.16200828105211257,
"num_tokens": 4441834.0,
"step": 2415
},
{
"entropy": 5.766503381729126,
"epoch": 0.20213832275309054,
"grad_norm": 0.95703125,
"learning_rate": 0.0004998413944965007,
"loss": 5.6492,
"mean_token_accuracy": 0.16266501992940902,
"num_tokens": 4450864.0,
"step": 2420
},
{
"entropy": 5.73400182723999,
"epoch": 0.20255596391580355,
"grad_norm": 0.99609375,
"learning_rate": 0.0004998402749324823,
"loss": 5.7124,
"mean_token_accuracy": 0.15515679866075516,
"num_tokens": 4460697.0,
"step": 2425
},
{
"entropy": 5.940784645080567,
"epoch": 0.20297360507851653,
"grad_norm": 0.98828125,
"learning_rate": 0.0004998391514323642,
"loss": 5.7285,
"mean_token_accuracy": 0.15854752361774443,
"num_tokens": 4469926.0,
"step": 2430
},
{
"entropy": 5.7850086212158205,
"epoch": 0.20339124624122953,
"grad_norm": 0.99609375,
"learning_rate": 0.0004998380239961661,
"loss": 5.6548,
"mean_token_accuracy": 0.16090933382511138,
"num_tokens": 4478818.0,
"step": 2435
},
{
"entropy": 5.808289384841919,
"epoch": 0.20380888740394254,
"grad_norm": 0.94140625,
"learning_rate": 0.0004998368926239078,
"loss": 5.5844,
"mean_token_accuracy": 0.16591333746910095,
"num_tokens": 4487451.0,
"step": 2440
},
{
"entropy": 5.759612798690796,
"epoch": 0.20422652856665552,
"grad_norm": 1.0078125,
"learning_rate": 0.000499835757315609,
"loss": 5.6756,
"mean_token_accuracy": 0.15726785063743592,
"num_tokens": 4497674.0,
"step": 2445
},
{
"entropy": 5.7742194652557375,
"epoch": 0.20464416972936852,
"grad_norm": 1.0546875,
"learning_rate": 0.0004998346180712898,
"loss": 5.624,
"mean_token_accuracy": 0.16603823602199555,
"num_tokens": 4507666.0,
"step": 2450
},
{
"entropy": 5.790293836593628,
"epoch": 0.20506181089208153,
"grad_norm": 1.0546875,
"learning_rate": 0.0004998334748909698,
"loss": 5.7295,
"mean_token_accuracy": 0.15739290416240692,
"num_tokens": 4517409.0,
"step": 2455
},
{
"entropy": 5.786230230331421,
"epoch": 0.2054794520547945,
"grad_norm": 1.0234375,
"learning_rate": 0.0004998323277746694,
"loss": 5.5241,
"mean_token_accuracy": 0.16496848613023757,
"num_tokens": 4526495.0,
"step": 2460
},
{
"entropy": 5.7622456550598145,
"epoch": 0.20589709321750752,
"grad_norm": 0.95703125,
"learning_rate": 0.0004998311767224081,
"loss": 5.6131,
"mean_token_accuracy": 0.17294674664735793,
"num_tokens": 4535240.0,
"step": 2465
},
{
"entropy": 5.7548096656799315,
"epoch": 0.20631473438022052,
"grad_norm": 0.88671875,
"learning_rate": 0.0004998300217342067,
"loss": 5.6976,
"mean_token_accuracy": 0.15931780487298966,
"num_tokens": 4544716.0,
"step": 2470
},
{
"entropy": 5.745911979675293,
"epoch": 0.2067323755429335,
"grad_norm": 1.0,
"learning_rate": 0.0004998288628100851,
"loss": 5.6222,
"mean_token_accuracy": 0.16541972160339355,
"num_tokens": 4553867.0,
"step": 2475
},
{
"entropy": 5.8166767120361325,
"epoch": 0.2071500167056465,
"grad_norm": 0.96875,
"learning_rate": 0.0004998276999500636,
"loss": 5.6764,
"mean_token_accuracy": 0.1619221478700638,
"num_tokens": 4562529.0,
"step": 2480
},
{
"entropy": 5.709495973587036,
"epoch": 0.2075676578683595,
"grad_norm": 1.0234375,
"learning_rate": 0.0004998265331541627,
"loss": 5.4687,
"mean_token_accuracy": 0.1788138762116432,
"num_tokens": 4571041.0,
"step": 2485
},
{
"entropy": 5.6762677192687985,
"epoch": 0.2079852990310725,
"grad_norm": 1.078125,
"learning_rate": 0.0004998253624224026,
"loss": 5.5986,
"mean_token_accuracy": 0.1655976355075836,
"num_tokens": 4579914.0,
"step": 2490
},
{
"entropy": 5.769092082977295,
"epoch": 0.2084029401937855,
"grad_norm": 1.2109375,
"learning_rate": 0.000499824187754804,
"loss": 5.6967,
"mean_token_accuracy": 0.1630502760410309,
"num_tokens": 4590277.0,
"step": 2495
},
{
"entropy": 5.757724618911743,
"epoch": 0.2088205813564985,
"grad_norm": 1.046875,
"learning_rate": 0.0004998230091513872,
"loss": 5.6117,
"mean_token_accuracy": 0.16430521458387376,
"num_tokens": 4598719.0,
"step": 2500
},
{
"entropy": 5.7639039039611815,
"epoch": 0.20923822251921148,
"grad_norm": 0.94921875,
"learning_rate": 0.0004998218266121731,
"loss": 5.5588,
"mean_token_accuracy": 0.16492444276809692,
"num_tokens": 4607804.0,
"step": 2505
},
{
"entropy": 5.7059930801391605,
"epoch": 0.2096558636819245,
"grad_norm": 0.96875,
"learning_rate": 0.0004998206401371823,
"loss": 5.5602,
"mean_token_accuracy": 0.16498781740665436,
"num_tokens": 4616529.0,
"step": 2510
},
{
"entropy": 5.782010936737061,
"epoch": 0.2100735048446375,
"grad_norm": 1.078125,
"learning_rate": 0.0004998194497264357,
"loss": 5.6004,
"mean_token_accuracy": 0.16248040944337844,
"num_tokens": 4624545.0,
"step": 2515
},
{
"entropy": 5.7379570484161375,
"epoch": 0.21049114600735047,
"grad_norm": 1.03125,
"learning_rate": 0.0004998182553799538,
"loss": 5.577,
"mean_token_accuracy": 0.16051217615604402,
"num_tokens": 4633316.0,
"step": 2520
},
{
"entropy": 5.7334644317626955,
"epoch": 0.21090878717006348,
"grad_norm": 1.046875,
"learning_rate": 0.0004998170570977579,
"loss": 5.5426,
"mean_token_accuracy": 0.16709231436252595,
"num_tokens": 4643353.0,
"step": 2525
},
{
"entropy": 5.724237775802612,
"epoch": 0.21132642833277648,
"grad_norm": 0.94921875,
"learning_rate": 0.0004998158548798687,
"loss": 5.6328,
"mean_token_accuracy": 0.16201059520244598,
"num_tokens": 4651998.0,
"step": 2530
},
{
"entropy": 5.776553726196289,
"epoch": 0.21174406949548946,
"grad_norm": 1.0546875,
"learning_rate": 0.0004998146487263074,
"loss": 5.6237,
"mean_token_accuracy": 0.16452135294675826,
"num_tokens": 4659937.0,
"step": 2535
},
{
"entropy": 5.748791980743408,
"epoch": 0.21216171065820247,
"grad_norm": 0.9375,
"learning_rate": 0.0004998134386370951,
"loss": 5.6036,
"mean_token_accuracy": 0.16133213490247728,
"num_tokens": 4669396.0,
"step": 2540
},
{
"entropy": 5.822993564605713,
"epoch": 0.21257935182091547,
"grad_norm": 0.9375,
"learning_rate": 0.0004998122246122529,
"loss": 5.675,
"mean_token_accuracy": 0.1632826492190361,
"num_tokens": 4679320.0,
"step": 2545
},
{
"entropy": 5.792739677429199,
"epoch": 0.21299699298362845,
"grad_norm": 0.9609375,
"learning_rate": 0.0004998110066518021,
"loss": 5.5965,
"mean_token_accuracy": 0.16390374004840852,
"num_tokens": 4688807.0,
"step": 2550
},
{
"entropy": 5.798362731933594,
"epoch": 0.21341463414634146,
"grad_norm": 1.0390625,
"learning_rate": 0.000499809784755764,
"loss": 5.6089,
"mean_token_accuracy": 0.17050699889659882,
"num_tokens": 4697819.0,
"step": 2555
},
{
"entropy": 5.6853009223937985,
"epoch": 0.21383227530905446,
"grad_norm": 0.96875,
"learning_rate": 0.00049980855892416,
"loss": 5.5795,
"mean_token_accuracy": 0.16765243858098983,
"num_tokens": 4706931.0,
"step": 2560
},
{
"entropy": 5.7483304977417,
"epoch": 0.21424991647176747,
"grad_norm": 0.9765625,
"learning_rate": 0.0004998073291570116,
"loss": 5.5681,
"mean_token_accuracy": 0.16450838446617128,
"num_tokens": 4716262.0,
"step": 2565
},
{
"entropy": 5.734201574325562,
"epoch": 0.21466755763448045,
"grad_norm": 0.98828125,
"learning_rate": 0.0004998060954543404,
"loss": 5.5834,
"mean_token_accuracy": 0.16493556201457976,
"num_tokens": 4725415.0,
"step": 2570
},
{
"entropy": 5.7109521389007565,
"epoch": 0.21508519879719346,
"grad_norm": 1.0625,
"learning_rate": 0.0004998048578161678,
"loss": 5.6546,
"mean_token_accuracy": 0.16459743529558182,
"num_tokens": 4734580.0,
"step": 2575
},
{
"entropy": 5.665662527084351,
"epoch": 0.21550283995990646,
"grad_norm": 0.98828125,
"learning_rate": 0.0004998036162425155,
"loss": 5.465,
"mean_token_accuracy": 0.17132774442434312,
"num_tokens": 4742966.0,
"step": 2580
},
{
"entropy": 5.726974296569824,
"epoch": 0.21592048112261944,
"grad_norm": 1.0703125,
"learning_rate": 0.0004998023707334055,
"loss": 5.5987,
"mean_token_accuracy": 0.16571207493543624,
"num_tokens": 4751696.0,
"step": 2585
},
{
"entropy": 5.802803802490234,
"epoch": 0.21633812228533245,
"grad_norm": 1.0234375,
"learning_rate": 0.0004998011212888592,
"loss": 5.6628,
"mean_token_accuracy": 0.16626541465520858,
"num_tokens": 4760460.0,
"step": 2590
},
{
"entropy": 5.766793346405029,
"epoch": 0.21675576344804545,
"grad_norm": 0.91015625,
"learning_rate": 0.0004997998679088988,
"loss": 5.5858,
"mean_token_accuracy": 0.165497525036335,
"num_tokens": 4769004.0,
"step": 2595
},
{
"entropy": 5.726294231414795,
"epoch": 0.21717340461075843,
"grad_norm": 0.96875,
"learning_rate": 0.0004997986105935461,
"loss": 5.5707,
"mean_token_accuracy": 0.17018312215805054,
"num_tokens": 4777204.0,
"step": 2600
},
{
"entropy": 5.815764331817627,
"epoch": 0.21759104577347144,
"grad_norm": 0.97265625,
"learning_rate": 0.0004997973493428231,
"loss": 5.7033,
"mean_token_accuracy": 0.16050707995891572,
"num_tokens": 4786766.0,
"step": 2605
},
{
"entropy": 5.666415119171143,
"epoch": 0.21800868693618444,
"grad_norm": 1.03125,
"learning_rate": 0.0004997960841567519,
"loss": 5.5961,
"mean_token_accuracy": 0.16938992440700532,
"num_tokens": 4796676.0,
"step": 2610
},
{
"entropy": 5.901765584945679,
"epoch": 0.21842632809889742,
"grad_norm": 1.078125,
"learning_rate": 0.0004997948150353548,
"loss": 5.5966,
"mean_token_accuracy": 0.1654299795627594,
"num_tokens": 4805514.0,
"step": 2615
},
{
"entropy": 5.714858770370483,
"epoch": 0.21884396926161043,
"grad_norm": 1.0,
"learning_rate": 0.0004997935419786537,
"loss": 5.6752,
"mean_token_accuracy": 0.16269783824682235,
"num_tokens": 4815487.0,
"step": 2620
},
{
"entropy": 5.806606769561768,
"epoch": 0.21926161042432343,
"grad_norm": 0.8828125,
"learning_rate": 0.0004997922649866712,
"loss": 5.6183,
"mean_token_accuracy": 0.16302125453948973,
"num_tokens": 4825044.0,
"step": 2625
},
{
"entropy": 5.651657152175903,
"epoch": 0.2196792515870364,
"grad_norm": 0.9453125,
"learning_rate": 0.0004997909840594294,
"loss": 5.4087,
"mean_token_accuracy": 0.17524338662624359,
"num_tokens": 4833875.0,
"step": 2630
},
{
"entropy": 5.638663101196289,
"epoch": 0.22009689274974942,
"grad_norm": 0.9453125,
"learning_rate": 0.0004997896991969509,
"loss": 5.6418,
"mean_token_accuracy": 0.15811533331871033,
"num_tokens": 4843317.0,
"step": 2635
},
{
"entropy": 5.7495684146881105,
"epoch": 0.22051453391246242,
"grad_norm": 0.9453125,
"learning_rate": 0.0004997884103992581,
"loss": 5.6321,
"mean_token_accuracy": 0.15845716297626494,
"num_tokens": 4852514.0,
"step": 2640
},
{
"entropy": 5.695010948181152,
"epoch": 0.2209321750751754,
"grad_norm": 1.0,
"learning_rate": 0.0004997871176663736,
"loss": 5.5792,
"mean_token_accuracy": 0.16959371864795686,
"num_tokens": 4861260.0,
"step": 2645
},
{
"entropy": 5.708796119689941,
"epoch": 0.2213498162378884,
"grad_norm": 1.0234375,
"learning_rate": 0.0004997858209983201,
"loss": 5.5333,
"mean_token_accuracy": 0.16668965592980384,
"num_tokens": 4869654.0,
"step": 2650
},
{
"entropy": 5.724199867248535,
"epoch": 0.22176745740060141,
"grad_norm": 0.96484375,
"learning_rate": 0.0004997845203951202,
"loss": 5.5937,
"mean_token_accuracy": 0.15722348690032958,
"num_tokens": 4878311.0,
"step": 2655
},
{
"entropy": 5.7917327880859375,
"epoch": 0.2221850985633144,
"grad_norm": 1.078125,
"learning_rate": 0.0004997832158567967,
"loss": 5.6604,
"mean_token_accuracy": 0.15930023267865182,
"num_tokens": 4887251.0,
"step": 2660
},
{
"entropy": 5.709334659576416,
"epoch": 0.2226027397260274,
"grad_norm": 0.94140625,
"learning_rate": 0.0004997819073833724,
"loss": 5.5234,
"mean_token_accuracy": 0.1640756532549858,
"num_tokens": 4896528.0,
"step": 2665
},
{
"entropy": 5.699781513214111,
"epoch": 0.2230203808887404,
"grad_norm": 1.015625,
"learning_rate": 0.0004997805949748702,
"loss": 5.5851,
"mean_token_accuracy": 0.16082951575517654,
"num_tokens": 4904962.0,
"step": 2670
},
{
"entropy": 5.751451635360718,
"epoch": 0.22343802205145338,
"grad_norm": 0.91796875,
"learning_rate": 0.0004997792786313132,
"loss": 5.5949,
"mean_token_accuracy": 0.16221776455640793,
"num_tokens": 4914735.0,
"step": 2675
},
{
"entropy": 5.555906057357788,
"epoch": 0.2238556632141664,
"grad_norm": 0.9765625,
"learning_rate": 0.0004997779583527243,
"loss": 5.4638,
"mean_token_accuracy": 0.1665905386209488,
"num_tokens": 4924271.0,
"step": 2680
},
{
"entropy": 5.8695250988006595,
"epoch": 0.2242733043768794,
"grad_norm": 1.015625,
"learning_rate": 0.0004997766341391268,
"loss": 5.7047,
"mean_token_accuracy": 0.155639585852623,
"num_tokens": 4933928.0,
"step": 2685
},
{
"entropy": 5.705683994293213,
"epoch": 0.22469094553959237,
"grad_norm": 1.046875,
"learning_rate": 0.0004997753059905437,
"loss": 5.4135,
"mean_token_accuracy": 0.1759113550186157,
"num_tokens": 4942714.0,
"step": 2690
},
{
"entropy": 5.6081311225891115,
"epoch": 0.22510858670230538,
"grad_norm": 1.0703125,
"learning_rate": 0.0004997739739069981,
"loss": 5.541,
"mean_token_accuracy": 0.16623980104923247,
"num_tokens": 4952297.0,
"step": 2695
},
{
"entropy": 5.701430177688598,
"epoch": 0.22552622786501839,
"grad_norm": 1.0078125,
"learning_rate": 0.0004997726378885138,
"loss": 5.48,
"mean_token_accuracy": 0.1763035088777542,
"num_tokens": 4960947.0,
"step": 2700
},
{
"entropy": 5.713150548934936,
"epoch": 0.22594386902773136,
"grad_norm": 1.21875,
"learning_rate": 0.0004997712979351137,
"loss": 5.6433,
"mean_token_accuracy": 0.16017448753118516,
"num_tokens": 4969705.0,
"step": 2705
},
{
"entropy": 5.7782330989837645,
"epoch": 0.22636151019044437,
"grad_norm": 1.0390625,
"learning_rate": 0.0004997699540468216,
"loss": 5.6095,
"mean_token_accuracy": 0.16398101300001144,
"num_tokens": 4979112.0,
"step": 2710
},
{
"entropy": 5.707289409637451,
"epoch": 0.22677915135315738,
"grad_norm": 0.9921875,
"learning_rate": 0.0004997686062236609,
"loss": 5.5245,
"mean_token_accuracy": 0.1688684806227684,
"num_tokens": 4987894.0,
"step": 2715
},
{
"entropy": 5.728122043609619,
"epoch": 0.22719679251587035,
"grad_norm": 0.8828125,
"learning_rate": 0.0004997672544656553,
"loss": 5.6685,
"mean_token_accuracy": 0.1611431822180748,
"num_tokens": 4997774.0,
"step": 2720
},
{
"entropy": 5.774860763549805,
"epoch": 0.22761443367858336,
"grad_norm": 1.0,
"learning_rate": 0.0004997658987728283,
"loss": 5.5835,
"mean_token_accuracy": 0.17197922468185425,
"num_tokens": 5006183.0,
"step": 2725
},
{
"entropy": 5.711122512817383,
"epoch": 0.22803207484129637,
"grad_norm": 0.93359375,
"learning_rate": 0.0004997645391452035,
"loss": 5.5795,
"mean_token_accuracy": 0.1666414961218834,
"num_tokens": 5016909.0,
"step": 2730
},
{
"entropy": 5.7371501445770265,
"epoch": 0.22844971600400935,
"grad_norm": 1.0,
"learning_rate": 0.000499763175582805,
"loss": 5.6246,
"mean_token_accuracy": 0.16619712710380555,
"num_tokens": 5027326.0,
"step": 2735
},
{
"entropy": 5.773577308654785,
"epoch": 0.22886735716672235,
"grad_norm": 0.9453125,
"learning_rate": 0.0004997618080856566,
"loss": 5.5787,
"mean_token_accuracy": 0.16747207343578338,
"num_tokens": 5037043.0,
"step": 2740
},
{
"entropy": 5.614604187011719,
"epoch": 0.22928499832943536,
"grad_norm": 0.953125,
"learning_rate": 0.0004997604366537823,
"loss": 5.5621,
"mean_token_accuracy": 0.16502413600683213,
"num_tokens": 5045992.0,
"step": 2745
},
{
"entropy": 5.674044513702393,
"epoch": 0.22970263949214834,
"grad_norm": 0.9921875,
"learning_rate": 0.0004997590612872058,
"loss": 5.5419,
"mean_token_accuracy": 0.16780618876218795,
"num_tokens": 5055568.0,
"step": 2750
},
{
"entropy": 5.761773729324341,
"epoch": 0.23012028065486134,
"grad_norm": 0.8359375,
"learning_rate": 0.0004997576819859515,
"loss": 5.617,
"mean_token_accuracy": 0.1640057623386383,
"num_tokens": 5065512.0,
"step": 2755
},
{
"entropy": 5.6007527828216555,
"epoch": 0.23053792181757435,
"grad_norm": 0.91796875,
"learning_rate": 0.0004997562987500434,
"loss": 5.4683,
"mean_token_accuracy": 0.17772611379623413,
"num_tokens": 5074776.0,
"step": 2760
},
{
"entropy": 5.620506668090821,
"epoch": 0.23095556298028733,
"grad_norm": 0.9375,
"learning_rate": 0.0004997549115795058,
"loss": 5.518,
"mean_token_accuracy": 0.16908519864082336,
"num_tokens": 5084743.0,
"step": 2765
},
{
"entropy": 5.7845690727233885,
"epoch": 0.23137320414300033,
"grad_norm": 0.99609375,
"learning_rate": 0.000499753520474363,
"loss": 5.6789,
"mean_token_accuracy": 0.16238866448402406,
"num_tokens": 5095387.0,
"step": 2770
},
{
"entropy": 5.675830888748169,
"epoch": 0.23179084530571334,
"grad_norm": 0.98828125,
"learning_rate": 0.0004997521254346391,
"loss": 5.5874,
"mean_token_accuracy": 0.16865266785025596,
"num_tokens": 5104628.0,
"step": 2775
},
{
"entropy": 5.757327651977539,
"epoch": 0.23220848646842632,
"grad_norm": 0.953125,
"learning_rate": 0.0004997507264603589,
"loss": 5.5401,
"mean_token_accuracy": 0.16944464445114135,
"num_tokens": 5113169.0,
"step": 2780
},
{
"entropy": 5.695029544830322,
"epoch": 0.23262612763113932,
"grad_norm": 0.96875,
"learning_rate": 0.0004997493235515466,
"loss": 5.601,
"mean_token_accuracy": 0.16851502060890197,
"num_tokens": 5122294.0,
"step": 2785
},
{
"entropy": 5.605187559127808,
"epoch": 0.23304376879385233,
"grad_norm": 0.921875,
"learning_rate": 0.0004997479167082269,
"loss": 5.4361,
"mean_token_accuracy": 0.17638742476701735,
"num_tokens": 5131191.0,
"step": 2790
},
{
"entropy": 5.674936103820801,
"epoch": 0.2334614099565653,
"grad_norm": 0.9296875,
"learning_rate": 0.0004997465059304243,
"loss": 5.6504,
"mean_token_accuracy": 0.167001473903656,
"num_tokens": 5141974.0,
"step": 2795
},
{
"entropy": 5.781553602218628,
"epoch": 0.23387905111927831,
"grad_norm": 0.96484375,
"learning_rate": 0.0004997450912181637,
"loss": 5.5828,
"mean_token_accuracy": 0.16855430603027344,
"num_tokens": 5151412.0,
"step": 2800
},
{
"entropy": 5.66849799156189,
"epoch": 0.23429669228199132,
"grad_norm": 0.92578125,
"learning_rate": 0.0004997436725714696,
"loss": 5.5071,
"mean_token_accuracy": 0.17201763838529588,
"num_tokens": 5160989.0,
"step": 2805
},
{
"entropy": 5.687669134140014,
"epoch": 0.2347143334447043,
"grad_norm": 0.99609375,
"learning_rate": 0.0004997422499903671,
"loss": 5.575,
"mean_token_accuracy": 0.16350428611040116,
"num_tokens": 5170241.0,
"step": 2810
},
{
"entropy": 5.852313756942749,
"epoch": 0.2351319746074173,
"grad_norm": 0.96484375,
"learning_rate": 0.000499740823474881,
"loss": 5.693,
"mean_token_accuracy": 0.15919099301099776,
"num_tokens": 5180247.0,
"step": 2815
},
{
"entropy": 5.683443641662597,
"epoch": 0.2355496157701303,
"grad_norm": 1.0390625,
"learning_rate": 0.0004997393930250363,
"loss": 5.5877,
"mean_token_accuracy": 0.16531823873519896,
"num_tokens": 5189144.0,
"step": 2820
},
{
"entropy": 5.660533905029297,
"epoch": 0.2359672569328433,
"grad_norm": 0.91796875,
"learning_rate": 0.000499737958640858,
"loss": 5.6363,
"mean_token_accuracy": 0.16292943805456161,
"num_tokens": 5199410.0,
"step": 2825
},
{
"entropy": 5.772460985183716,
"epoch": 0.2363848980955563,
"grad_norm": 0.88671875,
"learning_rate": 0.0004997365203223711,
"loss": 5.5163,
"mean_token_accuracy": 0.17269660532474518,
"num_tokens": 5209032.0,
"step": 2830
},
{
"entropy": 5.5716253280639645,
"epoch": 0.2368025392582693,
"grad_norm": 0.98828125,
"learning_rate": 0.000499735078069601,
"loss": 5.4117,
"mean_token_accuracy": 0.17505983710289003,
"num_tokens": 5217787.0,
"step": 2835
},
{
"entropy": 5.610530710220337,
"epoch": 0.23722018042098228,
"grad_norm": 1.0390625,
"learning_rate": 0.0004997336318825728,
"loss": 5.5272,
"mean_token_accuracy": 0.1705465003848076,
"num_tokens": 5226962.0,
"step": 2840
},
{
"entropy": 5.678059244155884,
"epoch": 0.23763782158369529,
"grad_norm": 0.96484375,
"learning_rate": 0.0004997321817613119,
"loss": 5.501,
"mean_token_accuracy": 0.166815347969532,
"num_tokens": 5236111.0,
"step": 2845
},
{
"entropy": 5.748322200775147,
"epoch": 0.2380554627464083,
"grad_norm": 0.875,
"learning_rate": 0.0004997307277058436,
"loss": 5.6462,
"mean_token_accuracy": 0.16232668459415436,
"num_tokens": 5246628.0,
"step": 2850
},
{
"entropy": 5.667980480194092,
"epoch": 0.23847310390912127,
"grad_norm": 0.98046875,
"learning_rate": 0.0004997292697161935,
"loss": 5.5754,
"mean_token_accuracy": 0.16228308975696565,
"num_tokens": 5255543.0,
"step": 2855
},
{
"entropy": 5.61335859298706,
"epoch": 0.23889074507183428,
"grad_norm": 0.9921875,
"learning_rate": 0.000499727807792387,
"loss": 5.4157,
"mean_token_accuracy": 0.1765509083867073,
"num_tokens": 5264559.0,
"step": 2860
},
{
"entropy": 5.593845558166504,
"epoch": 0.23930838623454728,
"grad_norm": 0.91015625,
"learning_rate": 0.0004997263419344495,
"loss": 5.5031,
"mean_token_accuracy": 0.17075306475162505,
"num_tokens": 5274599.0,
"step": 2865
},
{
"entropy": 5.6120987892150875,
"epoch": 0.23972602739726026,
"grad_norm": 1.03125,
"learning_rate": 0.0004997248721424071,
"loss": 5.4684,
"mean_token_accuracy": 0.17607724964618682,
"num_tokens": 5283495.0,
"step": 2870
},
{
"entropy": 5.748496675491333,
"epoch": 0.24014366855997327,
"grad_norm": 1.09375,
"learning_rate": 0.0004997233984162853,
"loss": 5.5206,
"mean_token_accuracy": 0.17262364476919173,
"num_tokens": 5292064.0,
"step": 2875
},
{
"entropy": 5.660027360916137,
"epoch": 0.24056130972268627,
"grad_norm": 0.90625,
"learning_rate": 0.0004997219207561099,
"loss": 5.5373,
"mean_token_accuracy": 0.16632017493247986,
"num_tokens": 5301696.0,
"step": 2880
},
{
"entropy": 5.7199009418487545,
"epoch": 0.24097895088539925,
"grad_norm": 0.8828125,
"learning_rate": 0.0004997204391619068,
"loss": 5.647,
"mean_token_accuracy": 0.15879270881414415,
"num_tokens": 5311427.0,
"step": 2885
},
{
"entropy": 5.826184225082398,
"epoch": 0.24139659204811226,
"grad_norm": 0.94921875,
"learning_rate": 0.0004997189536337018,
"loss": 5.5703,
"mean_token_accuracy": 0.1678813174366951,
"num_tokens": 5321406.0,
"step": 2890
},
{
"entropy": 5.70261926651001,
"epoch": 0.24181423321082526,
"grad_norm": 1.09375,
"learning_rate": 0.0004997174641715211,
"loss": 5.6536,
"mean_token_accuracy": 0.16488752663135528,
"num_tokens": 5332257.0,
"step": 2895
},
{
"entropy": 5.561820459365845,
"epoch": 0.24223187437353827,
"grad_norm": 0.94140625,
"learning_rate": 0.0004997159707753906,
"loss": 5.391,
"mean_token_accuracy": 0.17732247412204744,
"num_tokens": 5341857.0,
"step": 2900
},
{
"entropy": 5.639991235733032,
"epoch": 0.24264951553625125,
"grad_norm": 0.91796875,
"learning_rate": 0.0004997144734453367,
"loss": 5.5403,
"mean_token_accuracy": 0.1736094608902931,
"num_tokens": 5351367.0,
"step": 2905
},
{
"entropy": 5.567778444290161,
"epoch": 0.24306715669896425,
"grad_norm": 0.97265625,
"learning_rate": 0.0004997129721813853,
"loss": 5.3888,
"mean_token_accuracy": 0.17335254251956939,
"num_tokens": 5360627.0,
"step": 2910
},
{
"entropy": 5.627420234680176,
"epoch": 0.24348479786167726,
"grad_norm": 1.015625,
"learning_rate": 0.0004997114669835629,
"loss": 5.4713,
"mean_token_accuracy": 0.17678721398115158,
"num_tokens": 5369703.0,
"step": 2915
},
{
"entropy": 5.658342075347901,
"epoch": 0.24390243902439024,
"grad_norm": 1.109375,
"learning_rate": 0.0004997099578518959,
"loss": 5.5467,
"mean_token_accuracy": 0.16832583546638488,
"num_tokens": 5378432.0,
"step": 2920
},
{
"entropy": 5.573386335372925,
"epoch": 0.24432008018710324,
"grad_norm": 1.125,
"learning_rate": 0.0004997084447864105,
"loss": 5.3981,
"mean_token_accuracy": 0.17398632317781448,
"num_tokens": 5386489.0,
"step": 2925
},
{
"entropy": 5.770393562316895,
"epoch": 0.24473772134981625,
"grad_norm": 0.97265625,
"learning_rate": 0.0004997069277871333,
"loss": 5.6219,
"mean_token_accuracy": 0.16319795697927475,
"num_tokens": 5395908.0,
"step": 2930
},
{
"entropy": 5.763458490371704,
"epoch": 0.24515536251252923,
"grad_norm": 0.99609375,
"learning_rate": 0.0004997054068540908,
"loss": 5.5425,
"mean_token_accuracy": 0.17221789509058,
"num_tokens": 5404822.0,
"step": 2935
},
{
"entropy": 5.60934100151062,
"epoch": 0.24557300367524224,
"grad_norm": 0.9140625,
"learning_rate": 0.0004997038819873098,
"loss": 5.4537,
"mean_token_accuracy": 0.17699288725852966,
"num_tokens": 5413980.0,
"step": 2940
},
{
"entropy": 5.652670669555664,
"epoch": 0.24599064483795524,
"grad_norm": 0.9453125,
"learning_rate": 0.0004997023531868167,
"loss": 5.5227,
"mean_token_accuracy": 0.16705751717090606,
"num_tokens": 5423538.0,
"step": 2945
},
{
"entropy": 5.616042518615723,
"epoch": 0.24640828600066822,
"grad_norm": 0.984375,
"learning_rate": 0.0004997008204526386,
"loss": 5.4503,
"mean_token_accuracy": 0.17180379182100297,
"num_tokens": 5431930.0,
"step": 2950
},
{
"entropy": 5.6258384704589846,
"epoch": 0.24682592716338123,
"grad_norm": 0.90625,
"learning_rate": 0.0004996992837848021,
"loss": 5.4514,
"mean_token_accuracy": 0.17689115405082703,
"num_tokens": 5440721.0,
"step": 2955
},
{
"entropy": 5.611420965194702,
"epoch": 0.24724356832609423,
"grad_norm": 1.0546875,
"learning_rate": 0.0004996977431833342,
"loss": 5.5153,
"mean_token_accuracy": 0.1651511862874031,
"num_tokens": 5449617.0,
"step": 2960
},
{
"entropy": 5.621954154968262,
"epoch": 0.2476612094888072,
"grad_norm": 0.9765625,
"learning_rate": 0.0004996961986482618,
"loss": 5.5521,
"mean_token_accuracy": 0.17019403576850892,
"num_tokens": 5458827.0,
"step": 2965
},
{
"entropy": 5.697111034393311,
"epoch": 0.24807885065152022,
"grad_norm": 1.046875,
"learning_rate": 0.0004996946501796119,
"loss": 5.4353,
"mean_token_accuracy": 0.17367945313453675,
"num_tokens": 5467348.0,
"step": 2970
},
{
"entropy": 5.669052839279175,
"epoch": 0.24849649181423322,
"grad_norm": 0.98046875,
"learning_rate": 0.0004996930977774118,
"loss": 5.505,
"mean_token_accuracy": 0.1617908701300621,
"num_tokens": 5476645.0,
"step": 2975
},
{
"entropy": 5.712230110168457,
"epoch": 0.2489141329769462,
"grad_norm": 0.93359375,
"learning_rate": 0.0004996915414416885,
"loss": 5.5382,
"mean_token_accuracy": 0.16787463724613189,
"num_tokens": 5486120.0,
"step": 2980
},
{
"entropy": 5.698201894760132,
"epoch": 0.2493317741396592,
"grad_norm": 1.0078125,
"learning_rate": 0.0004996899811724693,
"loss": 5.5308,
"mean_token_accuracy": 0.1670474722981453,
"num_tokens": 5495313.0,
"step": 2985
},
{
"entropy": 5.647207641601563,
"epoch": 0.2497494153023722,
"grad_norm": 0.9375,
"learning_rate": 0.0004996884169697816,
"loss": 5.5247,
"mean_token_accuracy": 0.1688663676381111,
"num_tokens": 5504587.0,
"step": 2990
},
{
"entropy": 5.615376949310303,
"epoch": 0.2501670564650852,
"grad_norm": 0.8828125,
"learning_rate": 0.0004996868488336526,
"loss": 5.5488,
"mean_token_accuracy": 0.16672224402427674,
"num_tokens": 5514188.0,
"step": 2995
},
{
"entropy": 5.70684118270874,
"epoch": 0.25058469762779817,
"grad_norm": 1.0234375,
"learning_rate": 0.0004996852767641099,
"loss": 5.5913,
"mean_token_accuracy": 0.15994588136672974,
"num_tokens": 5524075.0,
"step": 3000
},
{
"epoch": 0.25058469762779817,
"eval_entropy": 5.478494798397265,
"eval_loss": 5.498563766479492,
"eval_mean_token_accuracy": 0.17943838510794094,
"eval_num_tokens": 5524075.0,
"eval_runtime": 20.9226,
"eval_samples_per_second": 1804.887,
"eval_steps_per_second": 225.641,
"step": 3000
}
],
"logging_steps": 5,
"max_steps": 119720,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 3000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1208069049876480.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}