Files
eng-latn-100mb-after-ppt-Dp…/checkpoint-6000/trainer_state.json
ModelHub XC dc2b462e34 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/eng-latn-100mb-after-ppt-Dp-10mb-ckpt500_seed455
Source: Original Platform
2026-08-21 19:11:17 +08:00

12101 lines
330 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 6.486749594375338,
"eval_steps": 1000,
"global_step": 6000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 6.745217990875244,
"epoch": 0.005408328826392645,
"grad_norm": 1.1875,
"learning_rate": 2e-06,
"loss": 6.4399,
"mean_token_accuracy": 0.12539481073617936,
"num_tokens": 9564.0,
"step": 5
},
{
"entropy": 6.7341703414917,
"epoch": 0.01081665765278529,
"grad_norm": 1.1484375,
"learning_rate": 4.5e-06,
"loss": 6.4966,
"mean_token_accuracy": 0.12570957243442535,
"num_tokens": 20265.0,
"step": 10
},
{
"entropy": 6.810567569732666,
"epoch": 0.016224986479177934,
"grad_norm": 1.171875,
"learning_rate": 7e-06,
"loss": 6.6044,
"mean_token_accuracy": 0.12070711851119995,
"num_tokens": 30733.0,
"step": 15
},
{
"entropy": 6.691426467895508,
"epoch": 0.02163331530557058,
"grad_norm": 1.1015625,
"learning_rate": 9.5e-06,
"loss": 6.5463,
"mean_token_accuracy": 0.1250626839697361,
"num_tokens": 41633.0,
"step": 20
},
{
"entropy": 6.713900947570801,
"epoch": 0.02704164413196322,
"grad_norm": 1.1484375,
"learning_rate": 1.2e-05,
"loss": 6.6055,
"mean_token_accuracy": 0.12766451835632325,
"num_tokens": 53776.0,
"step": 25
},
{
"entropy": 6.794030284881591,
"epoch": 0.03244997295835587,
"grad_norm": 1.1796875,
"learning_rate": 1.4500000000000002e-05,
"loss": 6.55,
"mean_token_accuracy": 0.13146025240421294,
"num_tokens": 64936.0,
"step": 30
},
{
"entropy": 6.735936450958252,
"epoch": 0.03785830178474851,
"grad_norm": 1.0859375,
"learning_rate": 1.7000000000000003e-05,
"loss": 6.5551,
"mean_token_accuracy": 0.12577222511172295,
"num_tokens": 76664.0,
"step": 35
},
{
"entropy": 6.720685720443726,
"epoch": 0.04326663061114116,
"grad_norm": 1.1171875,
"learning_rate": 1.95e-05,
"loss": 6.4589,
"mean_token_accuracy": 0.12645927220582961,
"num_tokens": 87188.0,
"step": 40
},
{
"entropy": 6.770437097549438,
"epoch": 0.048674959437533805,
"grad_norm": 1.0859375,
"learning_rate": 2.2e-05,
"loss": 6.6097,
"mean_token_accuracy": 0.1324235811829567,
"num_tokens": 99337.0,
"step": 45
},
{
"entropy": 6.7956713199615475,
"epoch": 0.05408328826392644,
"grad_norm": 1.0625,
"learning_rate": 2.4500000000000003e-05,
"loss": 6.5528,
"mean_token_accuracy": 0.1259615793824196,
"num_tokens": 110870.0,
"step": 50
},
{
"entropy": 6.821929407119751,
"epoch": 0.05949161709031909,
"grad_norm": 1.0625,
"learning_rate": 2.7e-05,
"loss": 6.4581,
"mean_token_accuracy": 0.13586550429463387,
"num_tokens": 122183.0,
"step": 55
},
{
"entropy": 6.810019540786743,
"epoch": 0.06489994591671173,
"grad_norm": 1.078125,
"learning_rate": 2.95e-05,
"loss": 6.471,
"mean_token_accuracy": 0.134011822193861,
"num_tokens": 133676.0,
"step": 60
},
{
"entropy": 6.7516721248626705,
"epoch": 0.07030827474310439,
"grad_norm": 1.046875,
"learning_rate": 3.2e-05,
"loss": 6.5101,
"mean_token_accuracy": 0.13094406202435493,
"num_tokens": 144821.0,
"step": 65
},
{
"entropy": 6.73709626197815,
"epoch": 0.07571660356949703,
"grad_norm": 0.98828125,
"learning_rate": 3.4500000000000005e-05,
"loss": 6.4945,
"mean_token_accuracy": 0.13041364997625352,
"num_tokens": 156873.0,
"step": 70
},
{
"entropy": 6.649084663391113,
"epoch": 0.08112493239588967,
"grad_norm": 1.0546875,
"learning_rate": 3.7e-05,
"loss": 6.4459,
"mean_token_accuracy": 0.12853534668684005,
"num_tokens": 168794.0,
"step": 75
},
{
"entropy": 6.839602088928222,
"epoch": 0.08653326122228232,
"grad_norm": 1.0078125,
"learning_rate": 3.95e-05,
"loss": 6.603,
"mean_token_accuracy": 0.12388623431324959,
"num_tokens": 180756.0,
"step": 80
},
{
"entropy": 6.882611703872681,
"epoch": 0.09194159004867496,
"grad_norm": 1.125,
"learning_rate": 4.2000000000000004e-05,
"loss": 6.5729,
"mean_token_accuracy": 0.12938066497445105,
"num_tokens": 191127.0,
"step": 85
},
{
"entropy": 6.704812479019165,
"epoch": 0.09734991887506761,
"grad_norm": 0.90625,
"learning_rate": 4.45e-05,
"loss": 6.455,
"mean_token_accuracy": 0.13043807074427605,
"num_tokens": 203352.0,
"step": 90
},
{
"entropy": 6.752549362182617,
"epoch": 0.10275824770146025,
"grad_norm": 1.2265625,
"learning_rate": 4.7000000000000004e-05,
"loss": 6.4423,
"mean_token_accuracy": 0.1375568687915802,
"num_tokens": 213810.0,
"step": 95
},
{
"entropy": 6.83305549621582,
"epoch": 0.10816657652785289,
"grad_norm": 1.015625,
"learning_rate": 4.9500000000000004e-05,
"loss": 6.5476,
"mean_token_accuracy": 0.1357502222061157,
"num_tokens": 225310.0,
"step": 100
},
{
"entropy": 6.757467412948609,
"epoch": 0.11357490535424554,
"grad_norm": 1.0234375,
"learning_rate": 5.2e-05,
"loss": 6.3829,
"mean_token_accuracy": 0.13580593466758728,
"num_tokens": 236676.0,
"step": 105
},
{
"entropy": 6.749653005599976,
"epoch": 0.11898323418063818,
"grad_norm": 1.1640625,
"learning_rate": 5.45e-05,
"loss": 6.4842,
"mean_token_accuracy": 0.13619382083415985,
"num_tokens": 247453.0,
"step": 110
},
{
"entropy": 6.7436058044433596,
"epoch": 0.12439156300703083,
"grad_norm": 1.2265625,
"learning_rate": 5.7e-05,
"loss": 6.4908,
"mean_token_accuracy": 0.1296382687985897,
"num_tokens": 258267.0,
"step": 115
},
{
"entropy": 6.699334526062012,
"epoch": 0.12979989183342347,
"grad_norm": 1.125,
"learning_rate": 5.9499999999999996e-05,
"loss": 6.5306,
"mean_token_accuracy": 0.1270687237381935,
"num_tokens": 269839.0,
"step": 120
},
{
"entropy": 6.761990737915039,
"epoch": 0.1352082206598161,
"grad_norm": 1.0703125,
"learning_rate": 6.2e-05,
"loss": 6.5192,
"mean_token_accuracy": 0.13135910406708717,
"num_tokens": 281748.0,
"step": 125
},
{
"entropy": 6.810469007492065,
"epoch": 0.14061654948620878,
"grad_norm": 1.0703125,
"learning_rate": 6.450000000000001e-05,
"loss": 6.5302,
"mean_token_accuracy": 0.12570069655776023,
"num_tokens": 292592.0,
"step": 130
},
{
"entropy": 6.8416718482971195,
"epoch": 0.1460248783126014,
"grad_norm": 1.1953125,
"learning_rate": 6.7e-05,
"loss": 6.4401,
"mean_token_accuracy": 0.13145631179213524,
"num_tokens": 303122.0,
"step": 135
},
{
"entropy": 6.692539358139038,
"epoch": 0.15143320713899405,
"grad_norm": 1.1875,
"learning_rate": 6.950000000000001e-05,
"loss": 6.3644,
"mean_token_accuracy": 0.13424549549818038,
"num_tokens": 314728.0,
"step": 140
},
{
"entropy": 6.719494438171386,
"epoch": 0.1568415359653867,
"grad_norm": 1.1328125,
"learning_rate": 7.2e-05,
"loss": 6.5632,
"mean_token_accuracy": 0.13301948606967925,
"num_tokens": 325292.0,
"step": 145
},
{
"entropy": 6.830582857131958,
"epoch": 0.16224986479177933,
"grad_norm": 1.03125,
"learning_rate": 7.45e-05,
"loss": 6.5829,
"mean_token_accuracy": 0.1278594434261322,
"num_tokens": 336140.0,
"step": 150
},
{
"entropy": 6.741078948974609,
"epoch": 0.167658193618172,
"grad_norm": 1.1484375,
"learning_rate": 7.7e-05,
"loss": 6.4212,
"mean_token_accuracy": 0.13609526231884955,
"num_tokens": 346885.0,
"step": 155
},
{
"entropy": 6.667781114578247,
"epoch": 0.17306652244456464,
"grad_norm": 1.203125,
"learning_rate": 7.950000000000001e-05,
"loss": 6.4422,
"mean_token_accuracy": 0.13269152715802193,
"num_tokens": 356630.0,
"step": 160
},
{
"entropy": 6.826272296905517,
"epoch": 0.17847485127095727,
"grad_norm": 1.1015625,
"learning_rate": 8.2e-05,
"loss": 6.4434,
"mean_token_accuracy": 0.13844147995114325,
"num_tokens": 366693.0,
"step": 165
},
{
"entropy": 6.623198461532593,
"epoch": 0.1838831800973499,
"grad_norm": 1.0703125,
"learning_rate": 8.450000000000001e-05,
"loss": 6.3919,
"mean_token_accuracy": 0.12981215193867685,
"num_tokens": 377779.0,
"step": 170
},
{
"entropy": 6.907767629623413,
"epoch": 0.18929150892374255,
"grad_norm": 1.015625,
"learning_rate": 8.7e-05,
"loss": 6.5139,
"mean_token_accuracy": 0.1325360544025898,
"num_tokens": 388482.0,
"step": 175
},
{
"entropy": 6.72784013748169,
"epoch": 0.19469983775013522,
"grad_norm": 1.234375,
"learning_rate": 8.95e-05,
"loss": 6.577,
"mean_token_accuracy": 0.13030516654253005,
"num_tokens": 400110.0,
"step": 180
},
{
"entropy": 6.742452812194824,
"epoch": 0.20010816657652786,
"grad_norm": 1.109375,
"learning_rate": 9.2e-05,
"loss": 6.3125,
"mean_token_accuracy": 0.13682465478777886,
"num_tokens": 412535.0,
"step": 185
},
{
"entropy": 6.676760053634643,
"epoch": 0.2055164954029205,
"grad_norm": 1.1796875,
"learning_rate": 9.45e-05,
"loss": 6.4502,
"mean_token_accuracy": 0.13751535415649413,
"num_tokens": 424309.0,
"step": 190
},
{
"entropy": 6.74865140914917,
"epoch": 0.21092482422931313,
"grad_norm": 1.25,
"learning_rate": 9.7e-05,
"loss": 6.4565,
"mean_token_accuracy": 0.13581018298864364,
"num_tokens": 435592.0,
"step": 195
},
{
"entropy": 6.591330480575562,
"epoch": 0.21633315305570577,
"grad_norm": 1.1328125,
"learning_rate": 9.95e-05,
"loss": 6.3516,
"mean_token_accuracy": 0.1346059188246727,
"num_tokens": 446767.0,
"step": 200
},
{
"entropy": 6.724362230300903,
"epoch": 0.22174148188209844,
"grad_norm": 1.1875,
"learning_rate": 0.000102,
"loss": 6.3719,
"mean_token_accuracy": 0.1348101980984211,
"num_tokens": 457959.0,
"step": 205
},
{
"entropy": 6.5875874042510985,
"epoch": 0.22714981070849108,
"grad_norm": 1.2421875,
"learning_rate": 0.00010449999999999999,
"loss": 6.3364,
"mean_token_accuracy": 0.14194149523973465,
"num_tokens": 468107.0,
"step": 210
},
{
"entropy": 6.896349143981934,
"epoch": 0.23255813953488372,
"grad_norm": 1.2109375,
"learning_rate": 0.000107,
"loss": 6.5223,
"mean_token_accuracy": 0.13508757278323175,
"num_tokens": 478954.0,
"step": 215
},
{
"entropy": 6.597625112533569,
"epoch": 0.23796646836127636,
"grad_norm": 1.1171875,
"learning_rate": 0.0001095,
"loss": 6.436,
"mean_token_accuracy": 0.12944695577025414,
"num_tokens": 490297.0,
"step": 220
},
{
"entropy": 6.734339427947998,
"epoch": 0.24337479718766902,
"grad_norm": 1.2421875,
"learning_rate": 0.000112,
"loss": 6.4306,
"mean_token_accuracy": 0.1379121758043766,
"num_tokens": 501597.0,
"step": 225
},
{
"entropy": 6.699416732788086,
"epoch": 0.24878312601406166,
"grad_norm": 1.1328125,
"learning_rate": 0.0001145,
"loss": 6.4431,
"mean_token_accuracy": 0.13053352981805802,
"num_tokens": 514182.0,
"step": 230
},
{
"entropy": 6.637861156463623,
"epoch": 0.2541914548404543,
"grad_norm": 1.0703125,
"learning_rate": 0.00011700000000000001,
"loss": 6.3907,
"mean_token_accuracy": 0.1391088232398033,
"num_tokens": 525972.0,
"step": 235
},
{
"entropy": 6.706511783599853,
"epoch": 0.25959978366684694,
"grad_norm": 1.140625,
"learning_rate": 0.00011949999999999999,
"loss": 6.3833,
"mean_token_accuracy": 0.1393005795776844,
"num_tokens": 537445.0,
"step": 240
},
{
"entropy": 6.676162910461426,
"epoch": 0.2650081124932396,
"grad_norm": 1.078125,
"learning_rate": 0.000122,
"loss": 6.4325,
"mean_token_accuracy": 0.13711966052651406,
"num_tokens": 548599.0,
"step": 245
},
{
"entropy": 6.67521448135376,
"epoch": 0.2704164413196322,
"grad_norm": 1.21875,
"learning_rate": 0.0001245,
"loss": 6.3094,
"mean_token_accuracy": 0.1379949890077114,
"num_tokens": 559222.0,
"step": 250
},
{
"entropy": 6.713015365600586,
"epoch": 0.27582477014602486,
"grad_norm": 1.3125,
"learning_rate": 0.000127,
"loss": 6.4632,
"mean_token_accuracy": 0.12452752217650413,
"num_tokens": 568949.0,
"step": 255
},
{
"entropy": 6.779383373260498,
"epoch": 0.28123309897241755,
"grad_norm": 1.0625,
"learning_rate": 0.0001295,
"loss": 6.4922,
"mean_token_accuracy": 0.13144948631525039,
"num_tokens": 580029.0,
"step": 260
},
{
"entropy": 6.726202201843262,
"epoch": 0.2866414277988102,
"grad_norm": 1.125,
"learning_rate": 0.000132,
"loss": 6.4077,
"mean_token_accuracy": 0.1364477679133415,
"num_tokens": 591633.0,
"step": 265
},
{
"entropy": 6.753827857971191,
"epoch": 0.2920497566252028,
"grad_norm": 1.25,
"learning_rate": 0.00013450000000000002,
"loss": 6.4197,
"mean_token_accuracy": 0.1380621761083603,
"num_tokens": 602511.0,
"step": 270
},
{
"entropy": 6.733678150177002,
"epoch": 0.29745808545159547,
"grad_norm": 1.265625,
"learning_rate": 0.00013700000000000002,
"loss": 6.4977,
"mean_token_accuracy": 0.1339564248919487,
"num_tokens": 613318.0,
"step": 275
},
{
"entropy": 6.607444524765015,
"epoch": 0.3028664142779881,
"grad_norm": 1.3515625,
"learning_rate": 0.0001395,
"loss": 6.3873,
"mean_token_accuracy": 0.13400006145238877,
"num_tokens": 624043.0,
"step": 280
},
{
"entropy": 6.67069182395935,
"epoch": 0.30827474310438074,
"grad_norm": 1.328125,
"learning_rate": 0.00014199999999999998,
"loss": 6.3469,
"mean_token_accuracy": 0.14132973700761794,
"num_tokens": 634713.0,
"step": 285
},
{
"entropy": 6.528910064697266,
"epoch": 0.3136830719307734,
"grad_norm": 1.125,
"learning_rate": 0.0001445,
"loss": 6.2954,
"mean_token_accuracy": 0.13748166486620902,
"num_tokens": 645491.0,
"step": 290
},
{
"entropy": 6.753203821182251,
"epoch": 0.319091400757166,
"grad_norm": 1.1796875,
"learning_rate": 0.000147,
"loss": 6.4336,
"mean_token_accuracy": 0.13378573432564736,
"num_tokens": 656832.0,
"step": 295
},
{
"entropy": 6.682645654678344,
"epoch": 0.32449972958355866,
"grad_norm": 1.421875,
"learning_rate": 0.0001495,
"loss": 6.3984,
"mean_token_accuracy": 0.13327668309211732,
"num_tokens": 668499.0,
"step": 300
},
{
"entropy": 6.722540235519409,
"epoch": 0.3299080584099513,
"grad_norm": 1.1484375,
"learning_rate": 0.000152,
"loss": 6.4665,
"mean_token_accuracy": 0.1349737487733364,
"num_tokens": 679962.0,
"step": 305
},
{
"entropy": 6.740982961654663,
"epoch": 0.335316387236344,
"grad_norm": 1.0390625,
"learning_rate": 0.00015450000000000001,
"loss": 6.4479,
"mean_token_accuracy": 0.13650912493467332,
"num_tokens": 692170.0,
"step": 310
},
{
"entropy": 6.57421088218689,
"epoch": 0.34072471606273663,
"grad_norm": 1.1875,
"learning_rate": 0.000157,
"loss": 6.3711,
"mean_token_accuracy": 0.13764476627111435,
"num_tokens": 702886.0,
"step": 315
},
{
"entropy": 6.688414525985718,
"epoch": 0.34613304488912927,
"grad_norm": 1.25,
"learning_rate": 0.0001595,
"loss": 6.4313,
"mean_token_accuracy": 0.13261876478791237,
"num_tokens": 714257.0,
"step": 320
},
{
"entropy": 6.638928413391113,
"epoch": 0.3515413737155219,
"grad_norm": 1.1796875,
"learning_rate": 0.000162,
"loss": 6.4197,
"mean_token_accuracy": 0.13729432821273804,
"num_tokens": 725751.0,
"step": 325
},
{
"entropy": 6.782710266113281,
"epoch": 0.35694970254191455,
"grad_norm": 1.234375,
"learning_rate": 0.00016450000000000001,
"loss": 6.4891,
"mean_token_accuracy": 0.1316055290400982,
"num_tokens": 737147.0,
"step": 330
},
{
"entropy": 6.616734218597412,
"epoch": 0.3623580313683072,
"grad_norm": 1.3203125,
"learning_rate": 0.00016700000000000002,
"loss": 6.3442,
"mean_token_accuracy": 0.14010964184999466,
"num_tokens": 748439.0,
"step": 335
},
{
"entropy": 6.645461893081665,
"epoch": 0.3677663601946998,
"grad_norm": 1.171875,
"learning_rate": 0.00016950000000000003,
"loss": 6.3558,
"mean_token_accuracy": 0.1416398137807846,
"num_tokens": 760380.0,
"step": 340
},
{
"entropy": 6.582087898254395,
"epoch": 0.37317468902109246,
"grad_norm": 1.203125,
"learning_rate": 0.00017199999999999998,
"loss": 6.3419,
"mean_token_accuracy": 0.13614206165075302,
"num_tokens": 770827.0,
"step": 345
},
{
"entropy": 6.588772773742676,
"epoch": 0.3785830178474851,
"grad_norm": 1.2890625,
"learning_rate": 0.00017449999999999999,
"loss": 6.371,
"mean_token_accuracy": 0.130119176954031,
"num_tokens": 781887.0,
"step": 350
},
{
"entropy": 6.6461952209472654,
"epoch": 0.3839913466738778,
"grad_norm": 1.296875,
"learning_rate": 0.000177,
"loss": 6.3707,
"mean_token_accuracy": 0.12962670475244523,
"num_tokens": 792676.0,
"step": 355
},
{
"entropy": 6.811271715164184,
"epoch": 0.38939967550027044,
"grad_norm": 1.2734375,
"learning_rate": 0.0001795,
"loss": 6.5791,
"mean_token_accuracy": 0.13036322295665742,
"num_tokens": 804148.0,
"step": 360
},
{
"entropy": 6.647534465789795,
"epoch": 0.3948080043266631,
"grad_norm": 1.1328125,
"learning_rate": 0.000182,
"loss": 6.3464,
"mean_token_accuracy": 0.13733255341649056,
"num_tokens": 815835.0,
"step": 365
},
{
"entropy": 6.539557218551636,
"epoch": 0.4002163331530557,
"grad_norm": 1.1953125,
"learning_rate": 0.0001845,
"loss": 6.2902,
"mean_token_accuracy": 0.14055102020502092,
"num_tokens": 827975.0,
"step": 370
},
{
"entropy": 6.627246284484864,
"epoch": 0.40562466197944835,
"grad_norm": 1.25,
"learning_rate": 0.000187,
"loss": 6.3392,
"mean_token_accuracy": 0.13682809248566627,
"num_tokens": 838982.0,
"step": 375
},
{
"entropy": 6.624072790145874,
"epoch": 0.411032990805841,
"grad_norm": 1.1875,
"learning_rate": 0.0001895,
"loss": 6.4402,
"mean_token_accuracy": 0.13047717586159707,
"num_tokens": 851377.0,
"step": 380
},
{
"entropy": 6.7495063781738285,
"epoch": 0.41644131963223363,
"grad_norm": 1.296875,
"learning_rate": 0.000192,
"loss": 6.4657,
"mean_token_accuracy": 0.13667654022574424,
"num_tokens": 862593.0,
"step": 385
},
{
"entropy": 6.551447343826294,
"epoch": 0.42184964845862627,
"grad_norm": 1.171875,
"learning_rate": 0.0001945,
"loss": 6.3196,
"mean_token_accuracy": 0.1354401208460331,
"num_tokens": 873906.0,
"step": 390
},
{
"entropy": 6.712440156936646,
"epoch": 0.4272579772850189,
"grad_norm": 1.4296875,
"learning_rate": 0.00019700000000000002,
"loss": 6.4657,
"mean_token_accuracy": 0.1353951647877693,
"num_tokens": 884477.0,
"step": 395
},
{
"entropy": 6.659290027618408,
"epoch": 0.43266630611141155,
"grad_norm": 1.1484375,
"learning_rate": 0.00019950000000000002,
"loss": 6.3206,
"mean_token_accuracy": 0.13656646832823754,
"num_tokens": 896151.0,
"step": 400
},
{
"entropy": 6.6360023021698,
"epoch": 0.43807463493780424,
"grad_norm": 1.2890625,
"learning_rate": 0.000202,
"loss": 6.4024,
"mean_token_accuracy": 0.13927194178104402,
"num_tokens": 907580.0,
"step": 405
},
{
"entropy": 6.59203953742981,
"epoch": 0.4434829637641969,
"grad_norm": 1.25,
"learning_rate": 0.00020449999999999998,
"loss": 6.3489,
"mean_token_accuracy": 0.13741599917411804,
"num_tokens": 918141.0,
"step": 410
},
{
"entropy": 6.65588059425354,
"epoch": 0.4488912925905895,
"grad_norm": 1.203125,
"learning_rate": 0.000207,
"loss": 6.3899,
"mean_token_accuracy": 0.14542332291603088,
"num_tokens": 929868.0,
"step": 415
},
{
"entropy": 6.4867551803588865,
"epoch": 0.45429962141698216,
"grad_norm": 1.09375,
"learning_rate": 0.0002095,
"loss": 6.2806,
"mean_token_accuracy": 0.13965032547712325,
"num_tokens": 940582.0,
"step": 420
},
{
"entropy": 6.6291666507720945,
"epoch": 0.4597079502433748,
"grad_norm": 1.0390625,
"learning_rate": 0.000212,
"loss": 6.3463,
"mean_token_accuracy": 0.13679536208510398,
"num_tokens": 952233.0,
"step": 425
},
{
"entropy": 6.669621229171753,
"epoch": 0.46511627906976744,
"grad_norm": 1.515625,
"learning_rate": 0.0002145,
"loss": 6.4395,
"mean_token_accuracy": 0.13214596956968308,
"num_tokens": 964252.0,
"step": 430
},
{
"entropy": 6.623089265823364,
"epoch": 0.4705246078961601,
"grad_norm": 1.1484375,
"learning_rate": 0.00021700000000000002,
"loss": 6.3381,
"mean_token_accuracy": 0.1373963512480259,
"num_tokens": 974692.0,
"step": 435
},
{
"entropy": 6.575704860687256,
"epoch": 0.4759329367225527,
"grad_norm": 1.1328125,
"learning_rate": 0.0002195,
"loss": 6.354,
"mean_token_accuracy": 0.13740625306963922,
"num_tokens": 986019.0,
"step": 440
},
{
"entropy": 6.479989528656006,
"epoch": 0.48134126554894535,
"grad_norm": 1.4453125,
"learning_rate": 0.000222,
"loss": 6.2588,
"mean_token_accuracy": 0.1383764624595642,
"num_tokens": 996701.0,
"step": 445
},
{
"entropy": 6.638360166549683,
"epoch": 0.48674959437533805,
"grad_norm": 1.1484375,
"learning_rate": 0.0002245,
"loss": 6.3562,
"mean_token_accuracy": 0.1420356035232544,
"num_tokens": 1008596.0,
"step": 450
},
{
"entropy": 6.603897285461426,
"epoch": 0.4921579232017307,
"grad_norm": 1.15625,
"learning_rate": 0.00022700000000000002,
"loss": 6.3896,
"mean_token_accuracy": 0.13321260511875152,
"num_tokens": 1019263.0,
"step": 455
},
{
"entropy": 6.627950143814087,
"epoch": 0.4975662520281233,
"grad_norm": 1.296875,
"learning_rate": 0.00022950000000000002,
"loss": 6.3281,
"mean_token_accuracy": 0.13852308169007302,
"num_tokens": 1029460.0,
"step": 460
},
{
"entropy": 6.532049703598022,
"epoch": 0.502974580854516,
"grad_norm": 1.1796875,
"learning_rate": 0.00023200000000000003,
"loss": 6.3947,
"mean_token_accuracy": 0.13395455181598664,
"num_tokens": 1041747.0,
"step": 465
},
{
"entropy": 6.580554580688476,
"epoch": 0.5083829096809086,
"grad_norm": 1.234375,
"learning_rate": 0.00023449999999999998,
"loss": 6.2302,
"mean_token_accuracy": 0.13726723864674567,
"num_tokens": 1051645.0,
"step": 470
},
{
"entropy": 6.394359159469604,
"epoch": 0.5137912385073012,
"grad_norm": 1.3046875,
"learning_rate": 0.000237,
"loss": 6.1471,
"mean_token_accuracy": 0.14182863682508468,
"num_tokens": 1062358.0,
"step": 475
},
{
"entropy": 6.6230544090271,
"epoch": 0.5191995673336939,
"grad_norm": 1.171875,
"learning_rate": 0.0002395,
"loss": 6.3291,
"mean_token_accuracy": 0.13732218518853187,
"num_tokens": 1074234.0,
"step": 480
},
{
"entropy": 6.400064849853516,
"epoch": 0.5246078961600865,
"grad_norm": 1.1640625,
"learning_rate": 0.000242,
"loss": 6.257,
"mean_token_accuracy": 0.1385449767112732,
"num_tokens": 1086608.0,
"step": 485
},
{
"entropy": 6.640989637374878,
"epoch": 0.5300162249864792,
"grad_norm": 1.234375,
"learning_rate": 0.0002445,
"loss": 6.3092,
"mean_token_accuracy": 0.1422146663069725,
"num_tokens": 1096878.0,
"step": 490
},
{
"entropy": 6.501981782913208,
"epoch": 0.5354245538128718,
"grad_norm": 1.125,
"learning_rate": 0.000247,
"loss": 6.3667,
"mean_token_accuracy": 0.14159199818968773,
"num_tokens": 1108089.0,
"step": 495
},
{
"entropy": 6.608476877212524,
"epoch": 0.5408328826392644,
"grad_norm": 1.1796875,
"learning_rate": 0.0002495,
"loss": 6.3983,
"mean_token_accuracy": 0.13436152264475823,
"num_tokens": 1120910.0,
"step": 500
},
{
"entropy": 6.558342504501343,
"epoch": 0.5462412114656571,
"grad_norm": 1.4140625,
"learning_rate": 0.000252,
"loss": 6.2966,
"mean_token_accuracy": 0.13886259347200394,
"num_tokens": 1131685.0,
"step": 505
},
{
"entropy": 6.493104648590088,
"epoch": 0.5516495402920497,
"grad_norm": 1.2578125,
"learning_rate": 0.0002545,
"loss": 6.337,
"mean_token_accuracy": 0.13808612152934074,
"num_tokens": 1142273.0,
"step": 510
},
{
"entropy": 6.593916702270508,
"epoch": 0.5570578691184424,
"grad_norm": 1.3203125,
"learning_rate": 0.000257,
"loss": 6.212,
"mean_token_accuracy": 0.1403546467423439,
"num_tokens": 1152818.0,
"step": 515
},
{
"entropy": 6.4184082508087155,
"epoch": 0.5624661979448351,
"grad_norm": 1.1328125,
"learning_rate": 0.0002595,
"loss": 6.2539,
"mean_token_accuracy": 0.14156585782766343,
"num_tokens": 1163398.0,
"step": 520
},
{
"entropy": 6.639800310134888,
"epoch": 0.5678745267712277,
"grad_norm": 1.2265625,
"learning_rate": 0.000262,
"loss": 6.3113,
"mean_token_accuracy": 0.14177494123578072,
"num_tokens": 1174493.0,
"step": 525
},
{
"entropy": 6.449878311157226,
"epoch": 0.5732828555976204,
"grad_norm": 1.4296875,
"learning_rate": 0.00026450000000000003,
"loss": 6.2964,
"mean_token_accuracy": 0.14197195023298265,
"num_tokens": 1185534.0,
"step": 530
},
{
"entropy": 6.524397659301758,
"epoch": 0.578691184424013,
"grad_norm": 1.46875,
"learning_rate": 0.00026700000000000004,
"loss": 6.2393,
"mean_token_accuracy": 0.14146455824375154,
"num_tokens": 1196488.0,
"step": 535
},
{
"entropy": 6.451419448852539,
"epoch": 0.5840995132504057,
"grad_norm": 1.2578125,
"learning_rate": 0.00026950000000000005,
"loss": 6.3155,
"mean_token_accuracy": 0.139084542542696,
"num_tokens": 1208116.0,
"step": 540
},
{
"entropy": 6.48581862449646,
"epoch": 0.5895078420767983,
"grad_norm": 1.1171875,
"learning_rate": 0.00027200000000000005,
"loss": 6.3035,
"mean_token_accuracy": 0.14370152205228806,
"num_tokens": 1219571.0,
"step": 545
},
{
"entropy": 6.518029594421387,
"epoch": 0.5949161709031909,
"grad_norm": 1.265625,
"learning_rate": 0.0002745,
"loss": 6.2869,
"mean_token_accuracy": 0.13986791446805,
"num_tokens": 1231049.0,
"step": 550
},
{
"entropy": 6.475363636016846,
"epoch": 0.6003244997295836,
"grad_norm": 1.1640625,
"learning_rate": 0.000277,
"loss": 6.3097,
"mean_token_accuracy": 0.1364640511572361,
"num_tokens": 1242507.0,
"step": 555
},
{
"entropy": 6.44856014251709,
"epoch": 0.6057328285559762,
"grad_norm": 1.2578125,
"learning_rate": 0.0002795,
"loss": 6.2934,
"mean_token_accuracy": 0.13697041645646096,
"num_tokens": 1253607.0,
"step": 560
},
{
"entropy": 6.528074312210083,
"epoch": 0.6111411573823688,
"grad_norm": 1.203125,
"learning_rate": 0.00028199999999999997,
"loss": 6.3358,
"mean_token_accuracy": 0.13758110031485557,
"num_tokens": 1266604.0,
"step": 565
},
{
"entropy": 6.573901605606079,
"epoch": 0.6165494862087615,
"grad_norm": 1.234375,
"learning_rate": 0.0002845,
"loss": 6.3815,
"mean_token_accuracy": 0.13712944313883782,
"num_tokens": 1276930.0,
"step": 570
},
{
"entropy": 6.598294305801391,
"epoch": 0.6219578150351541,
"grad_norm": 1.2421875,
"learning_rate": 0.000287,
"loss": 6.3853,
"mean_token_accuracy": 0.13915850892663,
"num_tokens": 1288326.0,
"step": 575
},
{
"entropy": 6.450491666793823,
"epoch": 0.6273661438615468,
"grad_norm": 1.3046875,
"learning_rate": 0.0002895,
"loss": 6.3287,
"mean_token_accuracy": 0.13975025117397308,
"num_tokens": 1298950.0,
"step": 580
},
{
"entropy": 6.524539470672607,
"epoch": 0.6327744726879394,
"grad_norm": 1.1875,
"learning_rate": 0.000292,
"loss": 6.3231,
"mean_token_accuracy": 0.13521830812096597,
"num_tokens": 1311254.0,
"step": 585
},
{
"entropy": 6.515868997573852,
"epoch": 0.638182801514332,
"grad_norm": 1.25,
"learning_rate": 0.0002945,
"loss": 6.2362,
"mean_token_accuracy": 0.13961164206266402,
"num_tokens": 1322723.0,
"step": 590
},
{
"entropy": 6.4743040084838865,
"epoch": 0.6435911303407247,
"grad_norm": 1.1640625,
"learning_rate": 0.000297,
"loss": 6.2488,
"mean_token_accuracy": 0.14040838554501534,
"num_tokens": 1333998.0,
"step": 595
},
{
"entropy": 6.309730291366577,
"epoch": 0.6489994591671173,
"grad_norm": 1.2265625,
"learning_rate": 0.0002995,
"loss": 6.1926,
"mean_token_accuracy": 0.14279944226145744,
"num_tokens": 1345113.0,
"step": 600
},
{
"entropy": 6.439900350570679,
"epoch": 0.65440778799351,
"grad_norm": 1.171875,
"learning_rate": 0.000302,
"loss": 6.2886,
"mean_token_accuracy": 0.14252566993236543,
"num_tokens": 1356850.0,
"step": 605
},
{
"entropy": 6.550169944763184,
"epoch": 0.6598161168199026,
"grad_norm": 1.265625,
"learning_rate": 0.0003045,
"loss": 6.3744,
"mean_token_accuracy": 0.1397650845348835,
"num_tokens": 1369671.0,
"step": 610
},
{
"entropy": 6.427625703811645,
"epoch": 0.6652244456462953,
"grad_norm": 1.2109375,
"learning_rate": 0.000307,
"loss": 6.2835,
"mean_token_accuracy": 0.13882820978760718,
"num_tokens": 1380298.0,
"step": 615
},
{
"entropy": 6.527406787872314,
"epoch": 0.670632774472688,
"grad_norm": 1.15625,
"learning_rate": 0.0003095,
"loss": 6.2763,
"mean_token_accuracy": 0.13872483968734742,
"num_tokens": 1391617.0,
"step": 620
},
{
"entropy": 6.535118579864502,
"epoch": 0.6760411032990806,
"grad_norm": 1.375,
"learning_rate": 0.000312,
"loss": 6.3461,
"mean_token_accuracy": 0.14173057228326796,
"num_tokens": 1403509.0,
"step": 625
},
{
"entropy": 6.511589908599854,
"epoch": 0.6814494321254733,
"grad_norm": 1.21875,
"learning_rate": 0.0003145,
"loss": 6.4039,
"mean_token_accuracy": 0.13432303741574286,
"num_tokens": 1415125.0,
"step": 630
},
{
"entropy": 6.580691337585449,
"epoch": 0.6868577609518659,
"grad_norm": 1.28125,
"learning_rate": 0.000317,
"loss": 6.402,
"mean_token_accuracy": 0.13456533700227738,
"num_tokens": 1426785.0,
"step": 635
},
{
"entropy": 6.480119514465332,
"epoch": 0.6922660897782585,
"grad_norm": 1.1953125,
"learning_rate": 0.0003195,
"loss": 6.3605,
"mean_token_accuracy": 0.12881308048963547,
"num_tokens": 1439013.0,
"step": 640
},
{
"entropy": 6.417783641815186,
"epoch": 0.6976744186046512,
"grad_norm": 1.1953125,
"learning_rate": 0.000322,
"loss": 6.2202,
"mean_token_accuracy": 0.14642192423343658,
"num_tokens": 1449818.0,
"step": 645
},
{
"entropy": 6.413159942626953,
"epoch": 0.7030827474310438,
"grad_norm": 1.1875,
"learning_rate": 0.00032450000000000003,
"loss": 6.1358,
"mean_token_accuracy": 0.1415444567799568,
"num_tokens": 1460681.0,
"step": 650
},
{
"entropy": 6.338744592666626,
"epoch": 0.7084910762574365,
"grad_norm": 1.0859375,
"learning_rate": 0.00032700000000000003,
"loss": 6.2476,
"mean_token_accuracy": 0.13981930315494537,
"num_tokens": 1471840.0,
"step": 655
},
{
"entropy": 6.466752004623413,
"epoch": 0.7138994050838291,
"grad_norm": 1.328125,
"learning_rate": 0.00032950000000000004,
"loss": 6.2436,
"mean_token_accuracy": 0.14259599149227142,
"num_tokens": 1482326.0,
"step": 660
},
{
"entropy": 6.328251123428345,
"epoch": 0.7193077339102217,
"grad_norm": 1.203125,
"learning_rate": 0.00033200000000000005,
"loss": 6.1715,
"mean_token_accuracy": 0.14127768352627754,
"num_tokens": 1493277.0,
"step": 665
},
{
"entropy": 6.4282067775726315,
"epoch": 0.7247160627366144,
"grad_norm": 1.3203125,
"learning_rate": 0.00033450000000000005,
"loss": 6.2511,
"mean_token_accuracy": 0.14475265368819237,
"num_tokens": 1504563.0,
"step": 670
},
{
"entropy": 6.372472429275513,
"epoch": 0.730124391563007,
"grad_norm": 1.2109375,
"learning_rate": 0.000337,
"loss": 6.2369,
"mean_token_accuracy": 0.1476322367787361,
"num_tokens": 1516311.0,
"step": 675
},
{
"entropy": 6.354723262786865,
"epoch": 0.7355327203893997,
"grad_norm": 1.1953125,
"learning_rate": 0.0003395,
"loss": 6.1563,
"mean_token_accuracy": 0.14649124294519425,
"num_tokens": 1527391.0,
"step": 680
},
{
"entropy": 6.439003276824951,
"epoch": 0.7409410492157923,
"grad_norm": 1.1328125,
"learning_rate": 0.000342,
"loss": 6.2846,
"mean_token_accuracy": 0.14316972196102143,
"num_tokens": 1537755.0,
"step": 685
},
{
"entropy": 6.466528415679932,
"epoch": 0.7463493780421849,
"grad_norm": 1.125,
"learning_rate": 0.00034449999999999997,
"loss": 6.3203,
"mean_token_accuracy": 0.1379350833594799,
"num_tokens": 1550525.0,
"step": 690
},
{
"entropy": 6.425952291488647,
"epoch": 0.7517577068685776,
"grad_norm": 1.1953125,
"learning_rate": 0.000347,
"loss": 6.2344,
"mean_token_accuracy": 0.14136113673448564,
"num_tokens": 1561995.0,
"step": 695
},
{
"entropy": 6.384309434890747,
"epoch": 0.7571660356949702,
"grad_norm": 1.078125,
"learning_rate": 0.0003495,
"loss": 6.2363,
"mean_token_accuracy": 0.13751797899603843,
"num_tokens": 1573137.0,
"step": 700
},
{
"entropy": 6.332474660873413,
"epoch": 0.7625743645213628,
"grad_norm": 1.234375,
"learning_rate": 0.000352,
"loss": 6.2516,
"mean_token_accuracy": 0.1449413001537323,
"num_tokens": 1584938.0,
"step": 705
},
{
"entropy": 6.549186563491821,
"epoch": 0.7679826933477556,
"grad_norm": 1.328125,
"learning_rate": 0.0003545,
"loss": 6.308,
"mean_token_accuracy": 0.1355679027736187,
"num_tokens": 1596306.0,
"step": 710
},
{
"entropy": 6.34313998222351,
"epoch": 0.7733910221741482,
"grad_norm": 1.15625,
"learning_rate": 0.000357,
"loss": 6.2934,
"mean_token_accuracy": 0.14217483699321748,
"num_tokens": 1608112.0,
"step": 715
},
{
"entropy": 6.5022155284881595,
"epoch": 0.7787993510005409,
"grad_norm": 1.0625,
"learning_rate": 0.0003595,
"loss": 6.2833,
"mean_token_accuracy": 0.14302016869187356,
"num_tokens": 1618635.0,
"step": 720
},
{
"entropy": 6.277605819702148,
"epoch": 0.7842076798269335,
"grad_norm": 1.171875,
"learning_rate": 0.000362,
"loss": 6.1878,
"mean_token_accuracy": 0.14160637855529784,
"num_tokens": 1629476.0,
"step": 725
},
{
"entropy": 6.544418144226074,
"epoch": 0.7896160086533262,
"grad_norm": 1.1484375,
"learning_rate": 0.0003645,
"loss": 6.2851,
"mean_token_accuracy": 0.14023412466049195,
"num_tokens": 1641305.0,
"step": 730
},
{
"entropy": 6.323581790924072,
"epoch": 0.7950243374797188,
"grad_norm": 1.046875,
"learning_rate": 0.000367,
"loss": 6.228,
"mean_token_accuracy": 0.1453120455145836,
"num_tokens": 1653424.0,
"step": 735
},
{
"entropy": 6.338683032989502,
"epoch": 0.8004326663061114,
"grad_norm": 1.3359375,
"learning_rate": 0.0003695,
"loss": 6.2738,
"mean_token_accuracy": 0.13886456340551376,
"num_tokens": 1664222.0,
"step": 740
},
{
"entropy": 6.45950026512146,
"epoch": 0.8058409951325041,
"grad_norm": 1.21875,
"learning_rate": 0.000372,
"loss": 6.3182,
"mean_token_accuracy": 0.13927288502454757,
"num_tokens": 1676829.0,
"step": 745
},
{
"entropy": 6.389509057998657,
"epoch": 0.8112493239588967,
"grad_norm": 1.1640625,
"learning_rate": 0.0003745,
"loss": 6.2171,
"mean_token_accuracy": 0.13743837997317315,
"num_tokens": 1688534.0,
"step": 750
},
{
"entropy": 6.2615196228027346,
"epoch": 0.8166576527852893,
"grad_norm": 1.171875,
"learning_rate": 0.000377,
"loss": 6.1995,
"mean_token_accuracy": 0.14325060099363326,
"num_tokens": 1699051.0,
"step": 755
},
{
"entropy": 6.446281814575196,
"epoch": 0.822065981611682,
"grad_norm": 1.1796875,
"learning_rate": 0.0003795,
"loss": 6.2276,
"mean_token_accuracy": 0.13753046318888665,
"num_tokens": 1709849.0,
"step": 760
},
{
"entropy": 6.236609411239624,
"epoch": 0.8274743104380746,
"grad_norm": 1.109375,
"learning_rate": 0.000382,
"loss": 6.0689,
"mean_token_accuracy": 0.15064243003726005,
"num_tokens": 1721956.0,
"step": 765
},
{
"entropy": 6.327112913131714,
"epoch": 0.8328826392644673,
"grad_norm": 1.1640625,
"learning_rate": 0.0003845,
"loss": 6.0921,
"mean_token_accuracy": 0.15326208472251893,
"num_tokens": 1733302.0,
"step": 770
},
{
"entropy": 6.198913812637329,
"epoch": 0.8382909680908599,
"grad_norm": 1.140625,
"learning_rate": 0.00038700000000000003,
"loss": 6.041,
"mean_token_accuracy": 0.15577499121427535,
"num_tokens": 1744835.0,
"step": 775
},
{
"entropy": 6.3341676712036135,
"epoch": 0.8436992969172525,
"grad_norm": 1.2109375,
"learning_rate": 0.00038950000000000003,
"loss": 6.1797,
"mean_token_accuracy": 0.14762855991721152,
"num_tokens": 1755174.0,
"step": 780
},
{
"entropy": 6.381376791000366,
"epoch": 0.8491076257436452,
"grad_norm": 1.09375,
"learning_rate": 0.00039200000000000004,
"loss": 6.3989,
"mean_token_accuracy": 0.13875442296266555,
"num_tokens": 1767572.0,
"step": 785
},
{
"entropy": 6.218066310882568,
"epoch": 0.8545159545700378,
"grad_norm": 1.1640625,
"learning_rate": 0.00039450000000000005,
"loss": 6.1405,
"mean_token_accuracy": 0.1449118934571743,
"num_tokens": 1777537.0,
"step": 790
},
{
"entropy": 6.425797414779663,
"epoch": 0.8599242833964305,
"grad_norm": 1.171875,
"learning_rate": 0.00039700000000000005,
"loss": 6.1712,
"mean_token_accuracy": 0.14846592620015145,
"num_tokens": 1789731.0,
"step": 795
},
{
"entropy": 6.419421625137329,
"epoch": 0.8653326122228231,
"grad_norm": 1.1875,
"learning_rate": 0.0003995,
"loss": 6.3029,
"mean_token_accuracy": 0.14081404209136963,
"num_tokens": 1800754.0,
"step": 800
},
{
"entropy": 6.272062110900879,
"epoch": 0.8707409410492158,
"grad_norm": 1.28125,
"learning_rate": 0.000402,
"loss": 6.2734,
"mean_token_accuracy": 0.1466397300362587,
"num_tokens": 1811496.0,
"step": 805
},
{
"entropy": 6.3589723110198975,
"epoch": 0.8761492698756085,
"grad_norm": 1.0703125,
"learning_rate": 0.0004045,
"loss": 6.184,
"mean_token_accuracy": 0.1434461772441864,
"num_tokens": 1822733.0,
"step": 810
},
{
"entropy": 6.342323112487793,
"epoch": 0.8815575987020011,
"grad_norm": 1.1796875,
"learning_rate": 0.00040699999999999997,
"loss": 6.1623,
"mean_token_accuracy": 0.14631599932909012,
"num_tokens": 1834121.0,
"step": 815
},
{
"entropy": 6.243607139587402,
"epoch": 0.8869659275283938,
"grad_norm": 1.28125,
"learning_rate": 0.0004095,
"loss": 6.0895,
"mean_token_accuracy": 0.1486702710390091,
"num_tokens": 1844674.0,
"step": 820
},
{
"entropy": 6.2104573249816895,
"epoch": 0.8923742563547864,
"grad_norm": 1.1015625,
"learning_rate": 0.000412,
"loss": 6.0988,
"mean_token_accuracy": 0.1491689234972,
"num_tokens": 1856692.0,
"step": 825
},
{
"entropy": 6.453680181503296,
"epoch": 0.897782585181179,
"grad_norm": 1.1953125,
"learning_rate": 0.0004145,
"loss": 6.3707,
"mean_token_accuracy": 0.1408935658633709,
"num_tokens": 1867888.0,
"step": 830
},
{
"entropy": 6.105977869033813,
"epoch": 0.9031909140075717,
"grad_norm": 1.2109375,
"learning_rate": 0.000417,
"loss": 6.043,
"mean_token_accuracy": 0.15483584851026536,
"num_tokens": 1877869.0,
"step": 835
},
{
"entropy": 6.322730207443238,
"epoch": 0.9085992428339643,
"grad_norm": 1.2109375,
"learning_rate": 0.0004195,
"loss": 6.1548,
"mean_token_accuracy": 0.1412374958395958,
"num_tokens": 1887975.0,
"step": 840
},
{
"entropy": 6.305921459197998,
"epoch": 0.914007571660357,
"grad_norm": 1.0078125,
"learning_rate": 0.000422,
"loss": 6.1018,
"mean_token_accuracy": 0.14518715515732766,
"num_tokens": 1898289.0,
"step": 845
},
{
"entropy": 6.211407423019409,
"epoch": 0.9194159004867496,
"grad_norm": 1.25,
"learning_rate": 0.0004245,
"loss": 6.2213,
"mean_token_accuracy": 0.15009732991456987,
"num_tokens": 1910038.0,
"step": 850
},
{
"entropy": 6.209096813201905,
"epoch": 0.9248242293131422,
"grad_norm": 1.1640625,
"learning_rate": 0.000427,
"loss": 6.0914,
"mean_token_accuracy": 0.15314256697893142,
"num_tokens": 1920774.0,
"step": 855
},
{
"entropy": 6.293406915664673,
"epoch": 0.9302325581395349,
"grad_norm": 1.203125,
"learning_rate": 0.0004295,
"loss": 6.1251,
"mean_token_accuracy": 0.15404994785785675,
"num_tokens": 1932085.0,
"step": 860
},
{
"entropy": 6.232555866241455,
"epoch": 0.9356408869659275,
"grad_norm": 1.109375,
"learning_rate": 0.000432,
"loss": 6.1331,
"mean_token_accuracy": 0.15166230872273445,
"num_tokens": 1943949.0,
"step": 865
},
{
"entropy": 6.28867917060852,
"epoch": 0.9410492157923201,
"grad_norm": 1.0546875,
"learning_rate": 0.0004345,
"loss": 6.1927,
"mean_token_accuracy": 0.14988541305065156,
"num_tokens": 1956051.0,
"step": 870
},
{
"entropy": 6.260223913192749,
"epoch": 0.9464575446187128,
"grad_norm": 1.140625,
"learning_rate": 0.000437,
"loss": 6.1868,
"mean_token_accuracy": 0.14389916732907296,
"num_tokens": 1967804.0,
"step": 875
},
{
"entropy": 6.208997774124145,
"epoch": 0.9518658734451054,
"grad_norm": 1.1875,
"learning_rate": 0.0004395,
"loss": 6.2995,
"mean_token_accuracy": 0.13391195982694626,
"num_tokens": 1979222.0,
"step": 880
},
{
"entropy": 6.381609487533569,
"epoch": 0.9572742022714981,
"grad_norm": 1.140625,
"learning_rate": 0.000442,
"loss": 6.2248,
"mean_token_accuracy": 0.14088413566350938,
"num_tokens": 1988998.0,
"step": 885
},
{
"entropy": 6.245026969909668,
"epoch": 0.9626825310978907,
"grad_norm": 1.09375,
"learning_rate": 0.0004445,
"loss": 6.1451,
"mean_token_accuracy": 0.14165820479393004,
"num_tokens": 2000539.0,
"step": 890
},
{
"entropy": 6.321556282043457,
"epoch": 0.9680908599242833,
"grad_norm": 1.1171875,
"learning_rate": 0.000447,
"loss": 6.2385,
"mean_token_accuracy": 0.14436768293380736,
"num_tokens": 2012321.0,
"step": 895
},
{
"entropy": 6.173920106887818,
"epoch": 0.9734991887506761,
"grad_norm": 1.09375,
"learning_rate": 0.00044950000000000003,
"loss": 6.1231,
"mean_token_accuracy": 0.14439835995435715,
"num_tokens": 2023330.0,
"step": 900
},
{
"entropy": 6.284840297698975,
"epoch": 0.9789075175770687,
"grad_norm": 1.0703125,
"learning_rate": 0.00045200000000000004,
"loss": 6.1095,
"mean_token_accuracy": 0.13921767249703407,
"num_tokens": 2034655.0,
"step": 905
},
{
"entropy": 6.110538482666016,
"epoch": 0.9843158464034614,
"grad_norm": 1.0625,
"learning_rate": 0.00045450000000000004,
"loss": 6.1513,
"mean_token_accuracy": 0.1441517509520054,
"num_tokens": 2045785.0,
"step": 910
},
{
"entropy": 6.445047616958618,
"epoch": 0.989724175229854,
"grad_norm": 1.03125,
"learning_rate": 0.00045700000000000005,
"loss": 6.2424,
"mean_token_accuracy": 0.14532435238361358,
"num_tokens": 2056038.0,
"step": 915
},
{
"entropy": 6.129134559631348,
"epoch": 0.9951325040562466,
"grad_norm": 1.34375,
"learning_rate": 0.00045950000000000006,
"loss": 6.1023,
"mean_token_accuracy": 0.15468567311763765,
"num_tokens": 2066803.0,
"step": 920
},
{
"entropy": 6.241815196143256,
"epoch": 1.0,
"grad_norm": 1.90625,
"learning_rate": 0.000462,
"loss": 6.2124,
"mean_token_accuracy": 0.14124820878108343,
"num_tokens": 2076889.0,
"step": 925
},
{
"entropy": 6.257176446914673,
"epoch": 1.0054083288263926,
"grad_norm": 1.0625,
"learning_rate": 0.0004645,
"loss": 5.9752,
"mean_token_accuracy": 0.14727601259946824,
"num_tokens": 2089019.0,
"step": 930
},
{
"entropy": 6.028801822662354,
"epoch": 1.0108166576527853,
"grad_norm": 1.1953125,
"learning_rate": 0.000467,
"loss": 5.8447,
"mean_token_accuracy": 0.16022417545318604,
"num_tokens": 2099849.0,
"step": 935
},
{
"entropy": 6.177911376953125,
"epoch": 1.016224986479178,
"grad_norm": 1.234375,
"learning_rate": 0.0004695,
"loss": 6.0094,
"mean_token_accuracy": 0.1548767253756523,
"num_tokens": 2110671.0,
"step": 940
},
{
"entropy": 6.136840963363648,
"epoch": 1.0216333153055706,
"grad_norm": 1.125,
"learning_rate": 0.000472,
"loss": 6.0524,
"mean_token_accuracy": 0.1497804716229439,
"num_tokens": 2122357.0,
"step": 945
},
{
"entropy": 6.268298530578614,
"epoch": 1.0270416441319632,
"grad_norm": 1.1171875,
"learning_rate": 0.0004745,
"loss": 5.9944,
"mean_token_accuracy": 0.14714996218681337,
"num_tokens": 2133878.0,
"step": 950
},
{
"entropy": 6.203853130340576,
"epoch": 1.0324499729583558,
"grad_norm": 1.1171875,
"learning_rate": 0.000477,
"loss": 6.0033,
"mean_token_accuracy": 0.15483788400888443,
"num_tokens": 2145565.0,
"step": 955
},
{
"entropy": 6.0750096321105955,
"epoch": 1.0378583017847485,
"grad_norm": 1.0390625,
"learning_rate": 0.0004795,
"loss": 5.9273,
"mean_token_accuracy": 0.14823657721281053,
"num_tokens": 2157393.0,
"step": 960
},
{
"entropy": 6.056691598892212,
"epoch": 1.043266630611141,
"grad_norm": 1.03125,
"learning_rate": 0.000482,
"loss": 5.7809,
"mean_token_accuracy": 0.1595247745513916,
"num_tokens": 2169318.0,
"step": 965
},
{
"entropy": 6.050301027297974,
"epoch": 1.0486749594375337,
"grad_norm": 1.1015625,
"learning_rate": 0.0004845,
"loss": 5.8674,
"mean_token_accuracy": 0.15364039540290833,
"num_tokens": 2179727.0,
"step": 970
},
{
"entropy": 6.027638483047485,
"epoch": 1.0540832882639264,
"grad_norm": 1.1328125,
"learning_rate": 0.000487,
"loss": 5.9021,
"mean_token_accuracy": 0.1545193985104561,
"num_tokens": 2190119.0,
"step": 975
},
{
"entropy": 6.070952320098877,
"epoch": 1.059491617090319,
"grad_norm": 1.09375,
"learning_rate": 0.0004895,
"loss": 5.9234,
"mean_token_accuracy": 0.15558279752731324,
"num_tokens": 2201077.0,
"step": 980
},
{
"entropy": 6.101561832427978,
"epoch": 1.0648999459167117,
"grad_norm": 1.3203125,
"learning_rate": 0.000492,
"loss": 5.9922,
"mean_token_accuracy": 0.15358568280935286,
"num_tokens": 2211572.0,
"step": 985
},
{
"entropy": 6.181616640090942,
"epoch": 1.0703082747431043,
"grad_norm": 1.0,
"learning_rate": 0.0004945,
"loss": 6.0144,
"mean_token_accuracy": 0.1533959075808525,
"num_tokens": 2223372.0,
"step": 990
},
{
"entropy": 5.968746328353882,
"epoch": 1.075716603569497,
"grad_norm": 1.1171875,
"learning_rate": 0.000497,
"loss": 5.886,
"mean_token_accuracy": 0.154812690615654,
"num_tokens": 2234946.0,
"step": 995
},
{
"entropy": 6.149488687515259,
"epoch": 1.0811249323958896,
"grad_norm": 1.0859375,
"learning_rate": 0.0004995,
"loss": 5.969,
"mean_token_accuracy": 0.14452582895755767,
"num_tokens": 2246608.0,
"step": 1000
},
{
"epoch": 1.0811249323958896,
"eval_entropy": 5.931731963157654,
"eval_loss": 6.293067455291748,
"eval_mean_token_accuracy": 0.14824318431995132,
"eval_num_tokens": 2246608.0,
"eval_runtime": 2.567,
"eval_samples_per_second": 1369.326,
"eval_steps_per_second": 171.409,
"step": 1000
},
{
"entropy": 6.084950351715088,
"epoch": 1.0865332612222822,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999997383518051,
"loss": 6.0811,
"mean_token_accuracy": 0.14338656812906264,
"num_tokens": 2258473.0,
"step": 1005
},
{
"entropy": 6.1302765846252445,
"epoch": 1.0919415900486749,
"grad_norm": 1.2109375,
"learning_rate": 0.0004999986754070562,
"loss": 5.9806,
"mean_token_accuracy": 0.15734953135252,
"num_tokens": 2269235.0,
"step": 1010
},
{
"entropy": 6.098620748519897,
"epoch": 1.0973499188750675,
"grad_norm": 1.15625,
"learning_rate": 0.0004999967948166009,
"loss": 5.9067,
"mean_token_accuracy": 0.15507067888975143,
"num_tokens": 2280369.0,
"step": 1015
},
{
"entropy": 5.965772438049316,
"epoch": 1.1027582477014604,
"grad_norm": 1.2421875,
"learning_rate": 0.0004999940965872734,
"loss": 5.8955,
"mean_token_accuracy": 0.16817984730005264,
"num_tokens": 2289701.0,
"step": 1020
},
{
"entropy": 6.086247968673706,
"epoch": 1.1081665765278528,
"grad_norm": 1.125,
"learning_rate": 0.0004999905807288788,
"loss": 5.9501,
"mean_token_accuracy": 0.15449455082416536,
"num_tokens": 2300820.0,
"step": 1025
},
{
"entropy": 6.2378397464752195,
"epoch": 1.1135749053542456,
"grad_norm": 1.0859375,
"learning_rate": 0.000499986247254194,
"loss": 6.0194,
"mean_token_accuracy": 0.14141876846551896,
"num_tokens": 2311710.0,
"step": 1030
},
{
"entropy": 6.080769062042236,
"epoch": 1.1189832341806383,
"grad_norm": 1.046875,
"learning_rate": 0.0004999810961789667,
"loss": 6.0102,
"mean_token_accuracy": 0.15261175036430358,
"num_tokens": 2324472.0,
"step": 1035
},
{
"entropy": 6.025978469848633,
"epoch": 1.124391563007031,
"grad_norm": 1.1171875,
"learning_rate": 0.000499975127521916,
"loss": 5.8953,
"mean_token_accuracy": 0.15188806802034377,
"num_tokens": 2336016.0,
"step": 1040
},
{
"entropy": 6.085336542129516,
"epoch": 1.1297998918334236,
"grad_norm": 1.125,
"learning_rate": 0.0004999683413047319,
"loss": 5.9726,
"mean_token_accuracy": 0.15661023557186127,
"num_tokens": 2346433.0,
"step": 1045
},
{
"entropy": 6.114025735855103,
"epoch": 1.1352082206598162,
"grad_norm": 1.03125,
"learning_rate": 0.0004999607375520759,
"loss": 5.9346,
"mean_token_accuracy": 0.16011944636702538,
"num_tokens": 2357171.0,
"step": 1050
},
{
"entropy": 5.95264163017273,
"epoch": 1.1406165494862088,
"grad_norm": 1.234375,
"learning_rate": 0.0004999523162915794,
"loss": 5.9868,
"mean_token_accuracy": 0.1551058605313301,
"num_tokens": 2367918.0,
"step": 1055
},
{
"entropy": 6.105375480651856,
"epoch": 1.1460248783126015,
"grad_norm": 1.09375,
"learning_rate": 0.0004999430775538459,
"loss": 5.8611,
"mean_token_accuracy": 0.1594705879688263,
"num_tokens": 2378588.0,
"step": 1060
},
{
"entropy": 5.9998544216156,
"epoch": 1.151433207138994,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999330213724487,
"loss": 5.9136,
"mean_token_accuracy": 0.15627419352531433,
"num_tokens": 2390339.0,
"step": 1065
},
{
"entropy": 6.131874227523804,
"epoch": 1.1568415359653867,
"grad_norm": 1.125,
"learning_rate": 0.0004999221477839319,
"loss": 6.0764,
"mean_token_accuracy": 0.14559624195098878,
"num_tokens": 2401855.0,
"step": 1070
},
{
"entropy": 6.033861970901489,
"epoch": 1.1622498647917794,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999104568278104,
"loss": 5.9031,
"mean_token_accuracy": 0.15754418671131135,
"num_tokens": 2411902.0,
"step": 1075
},
{
"entropy": 6.130727386474609,
"epoch": 1.167658193618172,
"grad_norm": 1.0078125,
"learning_rate": 0.000499897948546569,
"loss": 6.003,
"mean_token_accuracy": 0.15505098104476928,
"num_tokens": 2423275.0,
"step": 1080
},
{
"entropy": 5.969374370574951,
"epoch": 1.1730665224445647,
"grad_norm": 1.0703125,
"learning_rate": 0.0004998846229856629,
"loss": 5.9628,
"mean_token_accuracy": 0.15772853493690492,
"num_tokens": 2434347.0,
"step": 1085
},
{
"entropy": 6.132894992828369,
"epoch": 1.1784748512709573,
"grad_norm": 1.109375,
"learning_rate": 0.0004998704801935171,
"loss": 6.0229,
"mean_token_accuracy": 0.1508957713842392,
"num_tokens": 2446486.0,
"step": 1090
},
{
"entropy": 5.953886795043945,
"epoch": 1.18388318009735,
"grad_norm": 0.98828125,
"learning_rate": 0.0004998555202215267,
"loss": 5.886,
"mean_token_accuracy": 0.15241267830133437,
"num_tokens": 2458864.0,
"step": 1095
},
{
"entropy": 6.058213758468628,
"epoch": 1.1892915089237426,
"grad_norm": 1.046875,
"learning_rate": 0.0004998397431240561,
"loss": 5.8926,
"mean_token_accuracy": 0.15482796281576156,
"num_tokens": 2471225.0,
"step": 1100
},
{
"entropy": 5.991312265396118,
"epoch": 1.1946998377501352,
"grad_norm": 1.1484375,
"learning_rate": 0.0004998231489584395,
"loss": 5.9081,
"mean_token_accuracy": 0.15361883193254472,
"num_tokens": 2481914.0,
"step": 1105
},
{
"entropy": 6.007622146606446,
"epoch": 1.2001081665765279,
"grad_norm": 1.09375,
"learning_rate": 0.00049980573778498,
"loss": 5.9317,
"mean_token_accuracy": 0.1619701385498047,
"num_tokens": 2493391.0,
"step": 1110
},
{
"entropy": 5.986660623550415,
"epoch": 1.2055164954029205,
"grad_norm": 1.09375,
"learning_rate": 0.0004997875096669498,
"loss": 5.8213,
"mean_token_accuracy": 0.15980194956064225,
"num_tokens": 2504576.0,
"step": 1115
},
{
"entropy": 5.949508237838745,
"epoch": 1.2109248242293131,
"grad_norm": 1.1328125,
"learning_rate": 0.0004997684646705901,
"loss": 5.8822,
"mean_token_accuracy": 0.15818627998232843,
"num_tokens": 2516364.0,
"step": 1120
},
{
"entropy": 6.021165227890014,
"epoch": 1.2163331530557058,
"grad_norm": 1.1953125,
"learning_rate": 0.0004997486028651103,
"loss": 5.949,
"mean_token_accuracy": 0.15565033853054047,
"num_tokens": 2526296.0,
"step": 1125
},
{
"entropy": 5.929991960525513,
"epoch": 1.2217414818820984,
"grad_norm": 1.078125,
"learning_rate": 0.0004997279243226884,
"loss": 5.8364,
"mean_token_accuracy": 0.16595554798841478,
"num_tokens": 2537558.0,
"step": 1130
},
{
"entropy": 6.006711053848266,
"epoch": 1.227149810708491,
"grad_norm": 1.109375,
"learning_rate": 0.0004997064291184701,
"loss": 5.9242,
"mean_token_accuracy": 0.15124313682317733,
"num_tokens": 2549109.0,
"step": 1135
},
{
"entropy": 6.145928907394409,
"epoch": 1.2325581395348837,
"grad_norm": 1.25,
"learning_rate": 0.0004996841173305691,
"loss": 6.0694,
"mean_token_accuracy": 0.15124114975333214,
"num_tokens": 2560019.0,
"step": 1140
},
{
"entropy": 5.955758571624756,
"epoch": 1.2379664683612763,
"grad_norm": 1.0546875,
"learning_rate": 0.0004996609890400665,
"loss": 5.9005,
"mean_token_accuracy": 0.15468142032623292,
"num_tokens": 2571455.0,
"step": 1145
},
{
"entropy": 5.977803087234497,
"epoch": 1.243374797187669,
"grad_norm": 1.0703125,
"learning_rate": 0.0004996370443310107,
"loss": 5.8316,
"mean_token_accuracy": 0.1626493364572525,
"num_tokens": 2582827.0,
"step": 1150
},
{
"entropy": 5.962737560272217,
"epoch": 1.2487831260140616,
"grad_norm": 1.0,
"learning_rate": 0.0004996122832904165,
"loss": 5.9224,
"mean_token_accuracy": 0.15286874324083327,
"num_tokens": 2594980.0,
"step": 1155
},
{
"entropy": 6.072302770614624,
"epoch": 1.2541914548404542,
"grad_norm": 1.125,
"learning_rate": 0.0004995867060082658,
"loss": 5.9808,
"mean_token_accuracy": 0.15695970505475998,
"num_tokens": 2605697.0,
"step": 1160
},
{
"entropy": 6.013327169418335,
"epoch": 1.2595997836668469,
"grad_norm": 1.046875,
"learning_rate": 0.0004995603125775065,
"loss": 5.9401,
"mean_token_accuracy": 0.1553099974989891,
"num_tokens": 2617515.0,
"step": 1165
},
{
"entropy": 5.9621072769165036,
"epoch": 1.2650081124932395,
"grad_norm": 1.1796875,
"learning_rate": 0.0004995331030940523,
"loss": 5.9188,
"mean_token_accuracy": 0.1621383920311928,
"num_tokens": 2628293.0,
"step": 1170
},
{
"entropy": 5.955429220199585,
"epoch": 1.2704164413196322,
"grad_norm": 1.0625,
"learning_rate": 0.0004995050776567826,
"loss": 5.8808,
"mean_token_accuracy": 0.14956496506929398,
"num_tokens": 2639949.0,
"step": 1175
},
{
"entropy": 6.067929220199585,
"epoch": 1.2758247701460248,
"grad_norm": 1.015625,
"learning_rate": 0.0004994762363675421,
"loss": 6.0005,
"mean_token_accuracy": 0.15124383419752122,
"num_tokens": 2651186.0,
"step": 1180
},
{
"entropy": 6.039377021789551,
"epoch": 1.2812330989724177,
"grad_norm": 1.078125,
"learning_rate": 0.0004994465793311396,
"loss": 5.9522,
"mean_token_accuracy": 0.14760056138038635,
"num_tokens": 2662452.0,
"step": 1185
},
{
"entropy": 5.962746095657349,
"epoch": 1.28664142779881,
"grad_norm": 1.0625,
"learning_rate": 0.0004994161066553493,
"loss": 5.889,
"mean_token_accuracy": 0.15765392333269118,
"num_tokens": 2673117.0,
"step": 1190
},
{
"entropy": 6.005440950393677,
"epoch": 1.292049756625203,
"grad_norm": 1.1015625,
"learning_rate": 0.0004993848184509086,
"loss": 5.8946,
"mean_token_accuracy": 0.15160483941435815,
"num_tokens": 2685634.0,
"step": 1195
},
{
"entropy": 6.03985481262207,
"epoch": 1.2974580854515954,
"grad_norm": 1.1171875,
"learning_rate": 0.0004993527148315193,
"loss": 5.7672,
"mean_token_accuracy": 0.15762777477502823,
"num_tokens": 2695890.0,
"step": 1200
},
{
"entropy": 5.909327554702759,
"epoch": 1.3028664142779882,
"grad_norm": 1.0703125,
"learning_rate": 0.0004993197959138458,
"loss": 5.9199,
"mean_token_accuracy": 0.16145165413618087,
"num_tokens": 2707169.0,
"step": 1205
},
{
"entropy": 5.963200855255127,
"epoch": 1.3082747431043806,
"grad_norm": 0.984375,
"learning_rate": 0.0004992860618175156,
"loss": 5.8768,
"mean_token_accuracy": 0.1663581445813179,
"num_tokens": 2718118.0,
"step": 1210
},
{
"entropy": 5.981848621368409,
"epoch": 1.3136830719307735,
"grad_norm": 1.0859375,
"learning_rate": 0.0004992515126651184,
"loss": 5.8184,
"mean_token_accuracy": 0.1567670851945877,
"num_tokens": 2728351.0,
"step": 1215
},
{
"entropy": 5.87762303352356,
"epoch": 1.319091400757166,
"grad_norm": 1.1015625,
"learning_rate": 0.0004992161485822059,
"loss": 5.8697,
"mean_token_accuracy": 0.16071014404296874,
"num_tokens": 2739084.0,
"step": 1220
},
{
"entropy": 5.946296977996826,
"epoch": 1.3244997295835588,
"grad_norm": 1.0078125,
"learning_rate": 0.0004991799696972913,
"loss": 5.8888,
"mean_token_accuracy": 0.15838139951229097,
"num_tokens": 2750715.0,
"step": 1225
},
{
"entropy": 5.898415899276733,
"epoch": 1.3299080584099512,
"grad_norm": 1.0078125,
"learning_rate": 0.0004991429761418488,
"loss": 5.8427,
"mean_token_accuracy": 0.16084625273942948,
"num_tokens": 2761483.0,
"step": 1230
},
{
"entropy": 6.078216409683227,
"epoch": 1.335316387236344,
"grad_norm": 1.0546875,
"learning_rate": 0.000499105168050313,
"loss": 5.9922,
"mean_token_accuracy": 0.14723649471998215,
"num_tokens": 2774053.0,
"step": 1235
},
{
"entropy": 5.825717401504517,
"epoch": 1.3407247160627367,
"grad_norm": 1.0859375,
"learning_rate": 0.0004990665455600787,
"loss": 5.751,
"mean_token_accuracy": 0.16435801833868027,
"num_tokens": 2784928.0,
"step": 1240
},
{
"entropy": 6.0135369300842285,
"epoch": 1.3461330448891293,
"grad_norm": 1.09375,
"learning_rate": 0.0004990271088114999,
"loss": 5.8566,
"mean_token_accuracy": 0.1591189458966255,
"num_tokens": 2795839.0,
"step": 1245
},
{
"entropy": 5.885397672653198,
"epoch": 1.351541373715522,
"grad_norm": 1.0390625,
"learning_rate": 0.0004989868579478901,
"loss": 5.7649,
"mean_token_accuracy": 0.1652156174182892,
"num_tokens": 2807624.0,
"step": 1250
},
{
"entropy": 5.896845531463623,
"epoch": 1.3569497025419146,
"grad_norm": 1.0078125,
"learning_rate": 0.0004989457931155209,
"loss": 5.8639,
"mean_token_accuracy": 0.15702212899923323,
"num_tokens": 2819740.0,
"step": 1255
},
{
"entropy": 5.957349491119385,
"epoch": 1.3623580313683072,
"grad_norm": 1.0078125,
"learning_rate": 0.0004989039144636219,
"loss": 5.9088,
"mean_token_accuracy": 0.16128307580947876,
"num_tokens": 2830467.0,
"step": 1260
},
{
"entropy": 6.03181004524231,
"epoch": 1.3677663601946999,
"grad_norm": 1.0546875,
"learning_rate": 0.0004988612221443804,
"loss": 6.0047,
"mean_token_accuracy": 0.15610331892967225,
"num_tokens": 2841978.0,
"step": 1265
},
{
"entropy": 5.989248514175415,
"epoch": 1.3731746890210925,
"grad_norm": 0.9765625,
"learning_rate": 0.0004988177163129403,
"loss": 5.899,
"mean_token_accuracy": 0.15807392299175263,
"num_tokens": 2853760.0,
"step": 1270
},
{
"entropy": 5.99000825881958,
"epoch": 1.3785830178474852,
"grad_norm": 1.09375,
"learning_rate": 0.0004987733971274018,
"loss": 5.9337,
"mean_token_accuracy": 0.15205859392881393,
"num_tokens": 2865734.0,
"step": 1275
},
{
"entropy": 6.0495459079742435,
"epoch": 1.3839913466738778,
"grad_norm": 1.0625,
"learning_rate": 0.0004987282647488211,
"loss": 5.9673,
"mean_token_accuracy": 0.15523016154766084,
"num_tokens": 2877872.0,
"step": 1280
},
{
"entropy": 5.842286205291748,
"epoch": 1.3893996755002704,
"grad_norm": 1.0390625,
"learning_rate": 0.0004986823193412093,
"loss": 5.8175,
"mean_token_accuracy": 0.15781135559082032,
"num_tokens": 2888544.0,
"step": 1285
},
{
"entropy": 5.940902042388916,
"epoch": 1.394808004326663,
"grad_norm": 1.09375,
"learning_rate": 0.000498635561071532,
"loss": 5.8806,
"mean_token_accuracy": 0.1593789353966713,
"num_tokens": 2899635.0,
"step": 1290
},
{
"entropy": 6.046967172622681,
"epoch": 1.4002163331530557,
"grad_norm": 0.9765625,
"learning_rate": 0.000498587990109709,
"loss": 5.8925,
"mean_token_accuracy": 0.15153441727161407,
"num_tokens": 2911514.0,
"step": 1295
},
{
"entropy": 5.935166358947754,
"epoch": 1.4056246619794484,
"grad_norm": 0.9921875,
"learning_rate": 0.0004985396066286133,
"loss": 5.9422,
"mean_token_accuracy": 0.1631091997027397,
"num_tokens": 2922894.0,
"step": 1300
},
{
"entropy": 5.971725797653198,
"epoch": 1.411032990805841,
"grad_norm": 1.1328125,
"learning_rate": 0.0004984904108040706,
"loss": 5.9614,
"mean_token_accuracy": 0.15326455384492874,
"num_tokens": 2934563.0,
"step": 1305
},
{
"entropy": 5.957499170303345,
"epoch": 1.4164413196322336,
"grad_norm": 1.0859375,
"learning_rate": 0.0004984404028148585,
"loss": 5.8413,
"mean_token_accuracy": 0.15767469108104706,
"num_tokens": 2946101.0,
"step": 1310
},
{
"entropy": 5.75806155204773,
"epoch": 1.4218496484586263,
"grad_norm": 1.1171875,
"learning_rate": 0.0004983895828427062,
"loss": 5.8233,
"mean_token_accuracy": 0.15837134867906572,
"num_tokens": 2957110.0,
"step": 1315
},
{
"entropy": 6.118568181991577,
"epoch": 1.427257977285019,
"grad_norm": 0.98828125,
"learning_rate": 0.0004983379510722935,
"loss": 5.8945,
"mean_token_accuracy": 0.16046863794326782,
"num_tokens": 2968110.0,
"step": 1320
},
{
"entropy": 5.905016231536865,
"epoch": 1.4326663061114115,
"grad_norm": 1.265625,
"learning_rate": 0.0004982855076912506,
"loss": 5.8924,
"mean_token_accuracy": 0.1579983189702034,
"num_tokens": 2979176.0,
"step": 1325
},
{
"entropy": 5.90566782951355,
"epoch": 1.4380746349378042,
"grad_norm": 1.0625,
"learning_rate": 0.0004982322528901568,
"loss": 5.8431,
"mean_token_accuracy": 0.16347377896308898,
"num_tokens": 2990613.0,
"step": 1330
},
{
"entropy": 6.004480457305908,
"epoch": 1.4434829637641968,
"grad_norm": 0.96484375,
"learning_rate": 0.00049817818686254,
"loss": 5.8586,
"mean_token_accuracy": 0.1688141405582428,
"num_tokens": 3002469.0,
"step": 1335
},
{
"entropy": 5.884701061248779,
"epoch": 1.4488912925905895,
"grad_norm": 0.98828125,
"learning_rate": 0.0004981233098048765,
"loss": 5.8874,
"mean_token_accuracy": 0.1575832858681679,
"num_tokens": 3013458.0,
"step": 1340
},
{
"entropy": 5.908089876174927,
"epoch": 1.454299621416982,
"grad_norm": 1.140625,
"learning_rate": 0.0004980676219165894,
"loss": 5.7819,
"mean_token_accuracy": 0.16221198439598083,
"num_tokens": 3023435.0,
"step": 1345
},
{
"entropy": 5.851230573654175,
"epoch": 1.4597079502433747,
"grad_norm": 1.015625,
"learning_rate": 0.000498011123400049,
"loss": 5.7953,
"mean_token_accuracy": 0.16473986059427262,
"num_tokens": 3035124.0,
"step": 1350
},
{
"entropy": 5.867345571517944,
"epoch": 1.4651162790697674,
"grad_norm": 0.984375,
"learning_rate": 0.0004979538144605707,
"loss": 5.7913,
"mean_token_accuracy": 0.16175651252269746,
"num_tokens": 3046978.0,
"step": 1355
},
{
"entropy": 5.878073263168335,
"epoch": 1.47052460789616,
"grad_norm": 1.0859375,
"learning_rate": 0.0004978956953064154,
"loss": 5.7709,
"mean_token_accuracy": 0.16673534065485002,
"num_tokens": 3057915.0,
"step": 1360
},
{
"entropy": 5.918510389328003,
"epoch": 1.4759329367225527,
"grad_norm": 1.015625,
"learning_rate": 0.0004978367661487883,
"loss": 5.9289,
"mean_token_accuracy": 0.15895457044243813,
"num_tokens": 3069600.0,
"step": 1365
},
{
"entropy": 5.804135656356811,
"epoch": 1.4813412655489453,
"grad_norm": 0.99609375,
"learning_rate": 0.0004977770272018379,
"loss": 5.7364,
"mean_token_accuracy": 0.16775057166814805,
"num_tokens": 3081057.0,
"step": 1370
},
{
"entropy": 5.953877735137939,
"epoch": 1.486749594375338,
"grad_norm": 0.99609375,
"learning_rate": 0.000497716478682656,
"loss": 5.8342,
"mean_token_accuracy": 0.15982251316308976,
"num_tokens": 3092967.0,
"step": 1375
},
{
"entropy": 5.905659866333008,
"epoch": 1.4921579232017308,
"grad_norm": 0.94921875,
"learning_rate": 0.0004976551208112759,
"loss": 5.8947,
"mean_token_accuracy": 0.15754662826657295,
"num_tokens": 3104728.0,
"step": 1380
},
{
"entropy": 5.974631023406983,
"epoch": 1.4975662520281232,
"grad_norm": 0.97265625,
"learning_rate": 0.0004975929538106721,
"loss": 5.8642,
"mean_token_accuracy": 0.15649076998233796,
"num_tokens": 3115946.0,
"step": 1385
},
{
"entropy": 5.901013946533203,
"epoch": 1.502974580854516,
"grad_norm": 1.015625,
"learning_rate": 0.0004975299779067598,
"loss": 5.8748,
"mean_token_accuracy": 0.16528355479240417,
"num_tokens": 3126880.0,
"step": 1390
},
{
"entropy": 5.802594184875488,
"epoch": 1.5083829096809085,
"grad_norm": 1.046875,
"learning_rate": 0.0004974661933283936,
"loss": 5.8,
"mean_token_accuracy": 0.16498437374830247,
"num_tokens": 3137820.0,
"step": 1395
},
{
"entropy": 5.792008113861084,
"epoch": 1.5137912385073014,
"grad_norm": 1.1171875,
"learning_rate": 0.0004974016003073667,
"loss": 5.7453,
"mean_token_accuracy": 0.16289967000484468,
"num_tokens": 3149620.0,
"step": 1400
},
{
"entropy": 5.800507736206055,
"epoch": 1.5191995673336938,
"grad_norm": 1.0546875,
"learning_rate": 0.0004973361990784104,
"loss": 5.737,
"mean_token_accuracy": 0.16973724961280823,
"num_tokens": 3160205.0,
"step": 1405
},
{
"entropy": 5.9592376232147215,
"epoch": 1.5246078961600866,
"grad_norm": 1.0234375,
"learning_rate": 0.0004972699898791927,
"loss": 5.9833,
"mean_token_accuracy": 0.16072821915149688,
"num_tokens": 3171749.0,
"step": 1410
},
{
"entropy": 5.9620068073272705,
"epoch": 1.530016224986479,
"grad_norm": 1.109375,
"learning_rate": 0.0004972029729503182,
"loss": 5.9394,
"mean_token_accuracy": 0.1557013750076294,
"num_tokens": 3183303.0,
"step": 1415
},
{
"entropy": 6.018831586837768,
"epoch": 1.535424553812872,
"grad_norm": 0.9765625,
"learning_rate": 0.0004971351485353265,
"loss": 5.9681,
"mean_token_accuracy": 0.1568077340722084,
"num_tokens": 3194784.0,
"step": 1420
},
{
"entropy": 5.939594316482544,
"epoch": 1.5408328826392643,
"grad_norm": 1.015625,
"learning_rate": 0.0004970665168806917,
"loss": 5.7919,
"mean_token_accuracy": 0.1602090999484062,
"num_tokens": 3205732.0,
"step": 1425
},
{
"entropy": 5.892387580871582,
"epoch": 1.5462412114656572,
"grad_norm": 1.015625,
"learning_rate": 0.0004969970782358214,
"loss": 5.8812,
"mean_token_accuracy": 0.15621185600757598,
"num_tokens": 3216927.0,
"step": 1430
},
{
"entropy": 5.9382976531982425,
"epoch": 1.5516495402920496,
"grad_norm": 1.03125,
"learning_rate": 0.0004969268328530557,
"loss": 5.8656,
"mean_token_accuracy": 0.16953830569982528,
"num_tokens": 3227464.0,
"step": 1435
},
{
"entropy": 5.889416885375977,
"epoch": 1.5570578691184425,
"grad_norm": 0.9453125,
"learning_rate": 0.0004968557809876666,
"loss": 5.892,
"mean_token_accuracy": 0.1629958361387253,
"num_tokens": 3239357.0,
"step": 1440
},
{
"entropy": 5.872169113159179,
"epoch": 1.562466197944835,
"grad_norm": 1.0546875,
"learning_rate": 0.0004967839228978568,
"loss": 5.6692,
"mean_token_accuracy": 0.16706007570028306,
"num_tokens": 3250893.0,
"step": 1445
},
{
"entropy": 5.700922346115112,
"epoch": 1.5678745267712277,
"grad_norm": 1.078125,
"learning_rate": 0.0004967112588447585,
"loss": 5.7193,
"mean_token_accuracy": 0.17445658445358275,
"num_tokens": 3262081.0,
"step": 1450
},
{
"entropy": 5.831270933151245,
"epoch": 1.5732828555976204,
"grad_norm": 1.0234375,
"learning_rate": 0.0004966377890924332,
"loss": 5.8279,
"mean_token_accuracy": 0.17075785547494887,
"num_tokens": 3273059.0,
"step": 1455
},
{
"entropy": 5.984502220153809,
"epoch": 1.578691184424013,
"grad_norm": 1.1328125,
"learning_rate": 0.0004965635139078704,
"loss": 5.8425,
"mean_token_accuracy": 0.1614866703748703,
"num_tokens": 3283901.0,
"step": 1460
},
{
"entropy": 5.857378387451172,
"epoch": 1.5840995132504057,
"grad_norm": 0.9921875,
"learning_rate": 0.0004964884335609857,
"loss": 5.9535,
"mean_token_accuracy": 0.15531671792268753,
"num_tokens": 3295687.0,
"step": 1465
},
{
"entropy": 5.899958944320678,
"epoch": 1.5895078420767983,
"grad_norm": 1.125,
"learning_rate": 0.0004964125483246218,
"loss": 5.781,
"mean_token_accuracy": 0.16107384413480758,
"num_tokens": 3305600.0,
"step": 1470
},
{
"entropy": 5.8675659656524655,
"epoch": 1.594916170903191,
"grad_norm": 1.0703125,
"learning_rate": 0.0004963358584745457,
"loss": 5.8908,
"mean_token_accuracy": 0.15747047811746598,
"num_tokens": 3316337.0,
"step": 1475
},
{
"entropy": 5.928437662124634,
"epoch": 1.6003244997295836,
"grad_norm": 1.015625,
"learning_rate": 0.0004962583642894482,
"loss": 5.9135,
"mean_token_accuracy": 0.16109205186367034,
"num_tokens": 3327214.0,
"step": 1480
},
{
"entropy": 5.892904615402221,
"epoch": 1.6057328285559762,
"grad_norm": 0.96484375,
"learning_rate": 0.0004961800660509437,
"loss": 5.8,
"mean_token_accuracy": 0.15795575678348542,
"num_tokens": 3338663.0,
"step": 1485
},
{
"entropy": 5.8454772472381595,
"epoch": 1.6111411573823688,
"grad_norm": 0.94921875,
"learning_rate": 0.000496100964043568,
"loss": 5.73,
"mean_token_accuracy": 0.16322666704654692,
"num_tokens": 3351278.0,
"step": 1490
},
{
"entropy": 5.931005859375,
"epoch": 1.6165494862087615,
"grad_norm": 1.125,
"learning_rate": 0.000496021058554778,
"loss": 5.8335,
"mean_token_accuracy": 0.16325978934764862,
"num_tokens": 3363144.0,
"step": 1495
},
{
"entropy": 5.68018856048584,
"epoch": 1.6219578150351541,
"grad_norm": 1.09375,
"learning_rate": 0.0004959403498749505,
"loss": 5.761,
"mean_token_accuracy": 0.16344596147537233,
"num_tokens": 3373565.0,
"step": 1500
},
{
"entropy": 5.926155233383179,
"epoch": 1.6273661438615468,
"grad_norm": 1.03125,
"learning_rate": 0.0004958588382973809,
"loss": 5.8746,
"mean_token_accuracy": 0.16343246549367904,
"num_tokens": 3384486.0,
"step": 1505
},
{
"entropy": 5.84269151687622,
"epoch": 1.6327744726879394,
"grad_norm": 1.0234375,
"learning_rate": 0.0004957765241182826,
"loss": 5.8588,
"mean_token_accuracy": 0.15702430605888368,
"num_tokens": 3395808.0,
"step": 1510
},
{
"entropy": 5.915395021438599,
"epoch": 1.638182801514332,
"grad_norm": 1.1015625,
"learning_rate": 0.0004956934076367854,
"loss": 5.7329,
"mean_token_accuracy": 0.16698796004056932,
"num_tokens": 3406515.0,
"step": 1515
},
{
"entropy": 5.708258962631225,
"epoch": 1.6435911303407247,
"grad_norm": 1.0703125,
"learning_rate": 0.000495609489154935,
"loss": 5.8782,
"mean_token_accuracy": 0.15216176956892014,
"num_tokens": 3416507.0,
"step": 1520
},
{
"entropy": 6.006617736816406,
"epoch": 1.6489994591671173,
"grad_norm": 1.1015625,
"learning_rate": 0.0004955247689776911,
"loss": 5.8751,
"mean_token_accuracy": 0.16319621950387955,
"num_tokens": 3428195.0,
"step": 1525
},
{
"entropy": 5.8480085849761965,
"epoch": 1.65440778799351,
"grad_norm": 1.078125,
"learning_rate": 0.000495439247412927,
"loss": 5.8367,
"mean_token_accuracy": 0.15666660219430922,
"num_tokens": 3439500.0,
"step": 1530
},
{
"entropy": 5.699786853790283,
"epoch": 1.6598161168199026,
"grad_norm": 1.0390625,
"learning_rate": 0.0004953529247714285,
"loss": 5.6818,
"mean_token_accuracy": 0.16468058079481124,
"num_tokens": 3451042.0,
"step": 1535
},
{
"entropy": 5.882201433181763,
"epoch": 1.6652244456462952,
"grad_norm": 1.0703125,
"learning_rate": 0.0004952658013668922,
"loss": 5.9044,
"mean_token_accuracy": 0.16032216250896453,
"num_tokens": 3462286.0,
"step": 1540
},
{
"entropy": 5.886834716796875,
"epoch": 1.670632774472688,
"grad_norm": 1.0390625,
"learning_rate": 0.0004951778775159246,
"loss": 5.794,
"mean_token_accuracy": 0.1650930419564247,
"num_tokens": 3473309.0,
"step": 1545
},
{
"entropy": 5.836314010620117,
"epoch": 1.6760411032990805,
"grad_norm": 1.0,
"learning_rate": 0.0004950891535380414,
"loss": 5.8509,
"mean_token_accuracy": 0.16708696037530898,
"num_tokens": 3485733.0,
"step": 1550
},
{
"entropy": 5.806645298004151,
"epoch": 1.6814494321254734,
"grad_norm": 1.0859375,
"learning_rate": 0.0004949996297556656,
"loss": 5.6799,
"mean_token_accuracy": 0.17222748547792435,
"num_tokens": 3495585.0,
"step": 1555
},
{
"entropy": 5.823585128784179,
"epoch": 1.6868577609518658,
"grad_norm": 0.99609375,
"learning_rate": 0.0004949093064941268,
"loss": 5.919,
"mean_token_accuracy": 0.1641972318291664,
"num_tokens": 3507973.0,
"step": 1560
},
{
"entropy": 5.878605794906616,
"epoch": 1.6922660897782587,
"grad_norm": 1.0078125,
"learning_rate": 0.0004948181840816601,
"loss": 5.8549,
"mean_token_accuracy": 0.15803509652614595,
"num_tokens": 3518276.0,
"step": 1565
},
{
"entropy": 5.7111487865448,
"epoch": 1.697674418604651,
"grad_norm": 1.0234375,
"learning_rate": 0.0004947262628494045,
"loss": 5.5794,
"mean_token_accuracy": 0.16848823577165603,
"num_tokens": 3529786.0,
"step": 1570
},
{
"entropy": 5.778642225265503,
"epoch": 1.703082747431044,
"grad_norm": 1.046875,
"learning_rate": 0.0004946335431314018,
"loss": 5.6825,
"mean_token_accuracy": 0.17200134098529815,
"num_tokens": 3540884.0,
"step": 1575
},
{
"entropy": 5.810184478759766,
"epoch": 1.7084910762574363,
"grad_norm": 0.99609375,
"learning_rate": 0.0004945400252645959,
"loss": 5.8803,
"mean_token_accuracy": 0.16829971969127655,
"num_tokens": 3553246.0,
"step": 1580
},
{
"entropy": 5.857252788543701,
"epoch": 1.7138994050838292,
"grad_norm": 1.0625,
"learning_rate": 0.0004944457095888308,
"loss": 5.7839,
"mean_token_accuracy": 0.16421065777540206,
"num_tokens": 3563626.0,
"step": 1585
},
{
"entropy": 5.899531316757202,
"epoch": 1.7193077339102216,
"grad_norm": 1.0078125,
"learning_rate": 0.00049435059644685,
"loss": 5.7919,
"mean_token_accuracy": 0.16754550635814666,
"num_tokens": 3574221.0,
"step": 1590
},
{
"entropy": 5.7845847606658936,
"epoch": 1.7247160627366145,
"grad_norm": 1.0078125,
"learning_rate": 0.0004942546861842947,
"loss": 5.8729,
"mean_token_accuracy": 0.1651529476046562,
"num_tokens": 3585111.0,
"step": 1595
},
{
"entropy": 5.907976865768433,
"epoch": 1.730124391563007,
"grad_norm": 1.1484375,
"learning_rate": 0.0004941579791497032,
"loss": 5.8713,
"mean_token_accuracy": 0.1592499554157257,
"num_tokens": 3595614.0,
"step": 1600
},
{
"entropy": 5.924918222427368,
"epoch": 1.7355327203893998,
"grad_norm": 1.09375,
"learning_rate": 0.0004940604756945091,
"loss": 5.8245,
"mean_token_accuracy": 0.15840010195970536,
"num_tokens": 3606280.0,
"step": 1605
},
{
"entropy": 5.925652408599854,
"epoch": 1.7409410492157922,
"grad_norm": 1.046875,
"learning_rate": 0.0004939621761730399,
"loss": 6.0454,
"mean_token_accuracy": 0.15688003301620485,
"num_tokens": 3618212.0,
"step": 1610
},
{
"entropy": 5.800121688842774,
"epoch": 1.746349378042185,
"grad_norm": 1.078125,
"learning_rate": 0.0004938630809425166,
"loss": 5.7711,
"mean_token_accuracy": 0.16920888274908066,
"num_tokens": 3629869.0,
"step": 1615
},
{
"entropy": 5.8043921947479244,
"epoch": 1.7517577068685775,
"grad_norm": 1.03125,
"learning_rate": 0.0004937631903630513,
"loss": 5.7201,
"mean_token_accuracy": 0.16540371924638747,
"num_tokens": 3640522.0,
"step": 1620
},
{
"entropy": 5.8789771556854244,
"epoch": 1.7571660356949703,
"grad_norm": 0.94921875,
"learning_rate": 0.0004936625047976468,
"loss": 5.9076,
"mean_token_accuracy": 0.15947771072387695,
"num_tokens": 3652407.0,
"step": 1625
},
{
"entropy": 5.766597938537598,
"epoch": 1.7625743645213627,
"grad_norm": 1.03125,
"learning_rate": 0.0004935610246121944,
"loss": 5.6778,
"mean_token_accuracy": 0.16362657248973847,
"num_tokens": 3663256.0,
"step": 1630
},
{
"entropy": 5.953878927230835,
"epoch": 1.7679826933477556,
"grad_norm": 1.0625,
"learning_rate": 0.0004934587501754736,
"loss": 5.9086,
"mean_token_accuracy": 0.15510267913341522,
"num_tokens": 3675029.0,
"step": 1635
},
{
"entropy": 5.794557094573975,
"epoch": 1.7733910221741482,
"grad_norm": 1.0703125,
"learning_rate": 0.0004933556818591498,
"loss": 5.6824,
"mean_token_accuracy": 0.1662204995751381,
"num_tokens": 3685565.0,
"step": 1640
},
{
"entropy": 5.892733764648438,
"epoch": 1.7787993510005409,
"grad_norm": 1.0234375,
"learning_rate": 0.0004932518200377736,
"loss": 5.973,
"mean_token_accuracy": 0.15337257981300353,
"num_tokens": 3697189.0,
"step": 1645
},
{
"entropy": 5.782190942764283,
"epoch": 1.7842076798269335,
"grad_norm": 0.953125,
"learning_rate": 0.0004931471650887789,
"loss": 5.7113,
"mean_token_accuracy": 0.16868968158960343,
"num_tokens": 3708212.0,
"step": 1650
},
{
"entropy": 5.789211988449097,
"epoch": 1.7896160086533262,
"grad_norm": 0.98046875,
"learning_rate": 0.0004930417173924822,
"loss": 5.8201,
"mean_token_accuracy": 0.16540355384349822,
"num_tokens": 3720282.0,
"step": 1655
},
{
"entropy": 5.806392335891724,
"epoch": 1.7950243374797188,
"grad_norm": 0.96484375,
"learning_rate": 0.0004929354773320806,
"loss": 5.7492,
"mean_token_accuracy": 0.17258062809705735,
"num_tokens": 3731466.0,
"step": 1660
},
{
"entropy": 5.8481114387512205,
"epoch": 1.8004326663061114,
"grad_norm": 1.0546875,
"learning_rate": 0.0004928284452936506,
"loss": 5.7884,
"mean_token_accuracy": 0.15631649047136306,
"num_tokens": 3742875.0,
"step": 1665
},
{
"entropy": 5.81857213973999,
"epoch": 1.805840995132504,
"grad_norm": 1.09375,
"learning_rate": 0.0004927206216661473,
"loss": 5.7782,
"mean_token_accuracy": 0.16983126550912858,
"num_tokens": 3754127.0,
"step": 1670
},
{
"entropy": 5.814593744277954,
"epoch": 1.8112493239588967,
"grad_norm": 0.984375,
"learning_rate": 0.0004926120068414015,
"loss": 5.7363,
"mean_token_accuracy": 0.1717712476849556,
"num_tokens": 3766287.0,
"step": 1675
},
{
"entropy": 5.832261562347412,
"epoch": 1.8166576527852893,
"grad_norm": 0.9921875,
"learning_rate": 0.0004925026012141201,
"loss": 5.7533,
"mean_token_accuracy": 0.16840974539518355,
"num_tokens": 3777701.0,
"step": 1680
},
{
"entropy": 5.688795137405395,
"epoch": 1.822065981611682,
"grad_norm": 1.0625,
"learning_rate": 0.0004923924051818832,
"loss": 5.77,
"mean_token_accuracy": 0.16398487389087676,
"num_tokens": 3789545.0,
"step": 1685
},
{
"entropy": 5.87932186126709,
"epoch": 1.8274743104380746,
"grad_norm": 1.0546875,
"learning_rate": 0.0004922814191451435,
"loss": 5.7877,
"mean_token_accuracy": 0.1675479829311371,
"num_tokens": 3799937.0,
"step": 1690
},
{
"entropy": 5.675029563903808,
"epoch": 1.8328826392644673,
"grad_norm": 0.984375,
"learning_rate": 0.0004921696435072245,
"loss": 5.7024,
"mean_token_accuracy": 0.16483644843101503,
"num_tokens": 3811066.0,
"step": 1695
},
{
"entropy": 5.856202793121338,
"epoch": 1.83829096809086,
"grad_norm": 0.92578125,
"learning_rate": 0.0004920570786743191,
"loss": 5.8093,
"mean_token_accuracy": 0.16380842924118041,
"num_tokens": 3823409.0,
"step": 1700
},
{
"entropy": 5.8508154392242435,
"epoch": 1.8436992969172525,
"grad_norm": 0.99609375,
"learning_rate": 0.0004919437250554882,
"loss": 5.7945,
"mean_token_accuracy": 0.1685192406177521,
"num_tokens": 3835375.0,
"step": 1705
},
{
"entropy": 5.687268495559692,
"epoch": 1.8491076257436452,
"grad_norm": 1.015625,
"learning_rate": 0.0004918295830626592,
"loss": 5.6199,
"mean_token_accuracy": 0.17425741553306578,
"num_tokens": 3845807.0,
"step": 1710
},
{
"entropy": 5.788436841964722,
"epoch": 1.8545159545700378,
"grad_norm": 1.046875,
"learning_rate": 0.0004917146531106242,
"loss": 5.6934,
"mean_token_accuracy": 0.16580729633569719,
"num_tokens": 3857391.0,
"step": 1715
},
{
"entropy": 5.771870946884155,
"epoch": 1.8599242833964305,
"grad_norm": 0.953125,
"learning_rate": 0.0004915989356170389,
"loss": 5.7494,
"mean_token_accuracy": 0.17230032980442048,
"num_tokens": 3869101.0,
"step": 1720
},
{
"entropy": 5.770860576629639,
"epoch": 1.865332612222823,
"grad_norm": 1.03125,
"learning_rate": 0.0004914824310024213,
"loss": 5.7552,
"mean_token_accuracy": 0.17646077275276184,
"num_tokens": 3880516.0,
"step": 1725
},
{
"entropy": 5.802186679840088,
"epoch": 1.870740941049216,
"grad_norm": 1.0234375,
"learning_rate": 0.0004913651396901489,
"loss": 5.7375,
"mean_token_accuracy": 0.17009686082601547,
"num_tokens": 3891869.0,
"step": 1730
},
{
"entropy": 5.660962438583374,
"epoch": 1.8761492698756084,
"grad_norm": 0.94140625,
"learning_rate": 0.000491247062106459,
"loss": 5.6714,
"mean_token_accuracy": 0.17097828686237335,
"num_tokens": 3902621.0,
"step": 1735
},
{
"entropy": 5.697124576568603,
"epoch": 1.8815575987020012,
"grad_norm": 1.15625,
"learning_rate": 0.0004911281986804455,
"loss": 5.6599,
"mean_token_accuracy": 0.1695478856563568,
"num_tokens": 3913052.0,
"step": 1740
},
{
"entropy": 5.864525413513183,
"epoch": 1.8869659275283936,
"grad_norm": 1.0546875,
"learning_rate": 0.0004910085498440587,
"loss": 5.8739,
"mean_token_accuracy": 0.16169072985649108,
"num_tokens": 3924727.0,
"step": 1745
},
{
"entropy": 5.882341718673706,
"epoch": 1.8923742563547865,
"grad_norm": 0.953125,
"learning_rate": 0.0004908881160321025,
"loss": 5.8919,
"mean_token_accuracy": 0.15799911320209503,
"num_tokens": 3938053.0,
"step": 1750
},
{
"entropy": 5.737301301956177,
"epoch": 1.897782585181179,
"grad_norm": 1.0078125,
"learning_rate": 0.0004907668976822338,
"loss": 5.7302,
"mean_token_accuracy": 0.16925743073225022,
"num_tokens": 3949265.0,
"step": 1755
},
{
"entropy": 5.788043117523193,
"epoch": 1.9031909140075718,
"grad_norm": 1.03125,
"learning_rate": 0.0004906448952349603,
"loss": 5.7029,
"mean_token_accuracy": 0.16863157749176025,
"num_tokens": 3958808.0,
"step": 1760
},
{
"entropy": 5.826327991485596,
"epoch": 1.9085992428339642,
"grad_norm": 1.09375,
"learning_rate": 0.0004905221091336392,
"loss": 5.6841,
"mean_token_accuracy": 0.16804007589817047,
"num_tokens": 3970593.0,
"step": 1765
},
{
"entropy": 5.780668926239014,
"epoch": 1.914007571660357,
"grad_norm": 1.0703125,
"learning_rate": 0.0004903985398244753,
"loss": 5.7403,
"mean_token_accuracy": 0.16854489743709564,
"num_tokens": 3981552.0,
"step": 1770
},
{
"entropy": 5.681759595870972,
"epoch": 1.9194159004867495,
"grad_norm": 1.0546875,
"learning_rate": 0.0004902741877565201,
"loss": 5.6348,
"mean_token_accuracy": 0.17166891396045686,
"num_tokens": 3991932.0,
"step": 1775
},
{
"entropy": 5.894567060470581,
"epoch": 1.9248242293131423,
"grad_norm": 1.0703125,
"learning_rate": 0.000490149053381669,
"loss": 5.8364,
"mean_token_accuracy": 0.1588580071926117,
"num_tokens": 4002234.0,
"step": 1780
},
{
"entropy": 5.816265201568603,
"epoch": 1.9302325581395348,
"grad_norm": 1.0546875,
"learning_rate": 0.0004900231371546608,
"loss": 5.669,
"mean_token_accuracy": 0.1731552764773369,
"num_tokens": 4011800.0,
"step": 1785
},
{
"entropy": 5.7900268077850345,
"epoch": 1.9356408869659276,
"grad_norm": 1.0625,
"learning_rate": 0.0004898964395330753,
"loss": 5.8816,
"mean_token_accuracy": 0.1661091312766075,
"num_tokens": 4022503.0,
"step": 1790
},
{
"entropy": 5.808759117126465,
"epoch": 1.94104921579232,
"grad_norm": 1.0703125,
"learning_rate": 0.0004897689609773318,
"loss": 5.7556,
"mean_token_accuracy": 0.16821117252111434,
"num_tokens": 4032310.0,
"step": 1795
},
{
"entropy": 5.823995923995971,
"epoch": 1.946457544618713,
"grad_norm": 1.0625,
"learning_rate": 0.0004896407019506879,
"loss": 5.7947,
"mean_token_accuracy": 0.16529604643583298,
"num_tokens": 4043290.0,
"step": 1800
},
{
"entropy": 5.788540172576904,
"epoch": 1.9518658734451053,
"grad_norm": 1.03125,
"learning_rate": 0.0004895116629192371,
"loss": 5.8935,
"mean_token_accuracy": 0.15940507650375366,
"num_tokens": 4054550.0,
"step": 1805
},
{
"entropy": 5.859425354003906,
"epoch": 1.9572742022714982,
"grad_norm": 1.0078125,
"learning_rate": 0.0004893818443519074,
"loss": 5.6579,
"mean_token_accuracy": 0.17276726216077803,
"num_tokens": 4064740.0,
"step": 1810
},
{
"entropy": 5.77848072052002,
"epoch": 1.9626825310978906,
"grad_norm": 1.078125,
"learning_rate": 0.00048925124672046,
"loss": 5.8104,
"mean_token_accuracy": 0.16045169085264205,
"num_tokens": 4075466.0,
"step": 1815
},
{
"entropy": 5.7506016254425045,
"epoch": 1.9680908599242835,
"grad_norm": 1.046875,
"learning_rate": 0.0004891198704994868,
"loss": 5.7746,
"mean_token_accuracy": 0.16419024467468263,
"num_tokens": 4085794.0,
"step": 1820
},
{
"entropy": 5.774007272720337,
"epoch": 1.973499188750676,
"grad_norm": 1.0,
"learning_rate": 0.0004889877161664096,
"loss": 5.776,
"mean_token_accuracy": 0.16607008278369903,
"num_tokens": 4097587.0,
"step": 1825
},
{
"entropy": 5.8042127132415775,
"epoch": 1.9789075175770687,
"grad_norm": 0.99609375,
"learning_rate": 0.0004888547842014771,
"loss": 5.7397,
"mean_token_accuracy": 0.16423825323581695,
"num_tokens": 4110194.0,
"step": 1830
},
{
"entropy": 5.843971633911133,
"epoch": 1.9843158464034614,
"grad_norm": 0.93359375,
"learning_rate": 0.0004887210750877648,
"loss": 5.788,
"mean_token_accuracy": 0.16245697140693666,
"num_tokens": 4121967.0,
"step": 1835
},
{
"entropy": 5.6416247367858885,
"epoch": 1.989724175229854,
"grad_norm": 1.0546875,
"learning_rate": 0.0004885865893111716,
"loss": 5.6734,
"mean_token_accuracy": 0.17218596786260604,
"num_tokens": 4131457.0,
"step": 1840
},
{
"entropy": 5.8589592456817625,
"epoch": 1.9951325040562466,
"grad_norm": 1.0625,
"learning_rate": 0.0004884513273604195,
"loss": 5.795,
"mean_token_accuracy": 0.1732928141951561,
"num_tokens": 4143820.0,
"step": 1845
},
{
"entropy": 5.841017987993029,
"epoch": 2.0,
"grad_norm": 1.8359375,
"learning_rate": 0.0004883152897270502,
"loss": 5.8574,
"mean_token_accuracy": 0.163099843594763,
"num_tokens": 4153778.0,
"step": 1850
},
{
"entropy": 5.737104320526123,
"epoch": 2.005408328826393,
"grad_norm": 0.953125,
"learning_rate": 0.0004881784769054253,
"loss": 5.4329,
"mean_token_accuracy": 0.1771388202905655,
"num_tokens": 4166682.0,
"step": 1855
},
{
"entropy": 5.7277398109436035,
"epoch": 2.0108166576527853,
"grad_norm": 0.97265625,
"learning_rate": 0.0004880408893927226,
"loss": 5.4478,
"mean_token_accuracy": 0.17328148931264878,
"num_tokens": 4178621.0,
"step": 1860
},
{
"entropy": 5.772768115997314,
"epoch": 2.016224986479178,
"grad_norm": 0.97265625,
"learning_rate": 0.0004879025276889355,
"loss": 5.3683,
"mean_token_accuracy": 0.18826774805784224,
"num_tokens": 4189956.0,
"step": 1865
},
{
"entropy": 5.555465173721314,
"epoch": 2.0216333153055706,
"grad_norm": 0.94140625,
"learning_rate": 0.00048776339229687077,
"loss": 5.3996,
"mean_token_accuracy": 0.17681935131549836,
"num_tokens": 4202547.0,
"step": 1870
},
{
"entropy": 5.801024436950684,
"epoch": 2.0270416441319634,
"grad_norm": 1.09375,
"learning_rate": 0.00048762348372214683,
"loss": 5.3898,
"mean_token_accuracy": 0.18697095662355423,
"num_tokens": 4212416.0,
"step": 1875
},
{
"entropy": 5.594231700897216,
"epoch": 2.032449972958356,
"grad_norm": 1.0546875,
"learning_rate": 0.00048748280247319165,
"loss": 5.3488,
"mean_token_accuracy": 0.17242017537355422,
"num_tokens": 4223710.0,
"step": 1880
},
{
"entropy": 5.726772785186768,
"epoch": 2.0378583017847487,
"grad_norm": 1.03125,
"learning_rate": 0.0004873413490612412,
"loss": 5.4429,
"mean_token_accuracy": 0.17841096520423888,
"num_tokens": 4235245.0,
"step": 1885
},
{
"entropy": 5.665938758850098,
"epoch": 2.043266630611141,
"grad_norm": 1.0078125,
"learning_rate": 0.00048719912400033757,
"loss": 5.3764,
"mean_token_accuracy": 0.18664392828941345,
"num_tokens": 4247113.0,
"step": 1890
},
{
"entropy": 5.736206531524658,
"epoch": 2.048674959437534,
"grad_norm": 0.8984375,
"learning_rate": 0.000487056127807327,
"loss": 5.4366,
"mean_token_accuracy": 0.1796937808394432,
"num_tokens": 4259413.0,
"step": 1895
},
{
"entropy": 5.617617559432984,
"epoch": 2.0540832882639264,
"grad_norm": 1.15625,
"learning_rate": 0.00048691236100185795,
"loss": 5.3371,
"mean_token_accuracy": 0.1845716044306755,
"num_tokens": 4269413.0,
"step": 1900
},
{
"entropy": 5.596398448944091,
"epoch": 2.0594916170903192,
"grad_norm": 1.125,
"learning_rate": 0.0004867678241063792,
"loss": 5.3148,
"mean_token_accuracy": 0.19401925355195998,
"num_tokens": 4279453.0,
"step": 1905
},
{
"entropy": 5.688255643844604,
"epoch": 2.0648999459167117,
"grad_norm": 1.09375,
"learning_rate": 0.00048662251764613833,
"loss": 5.4226,
"mean_token_accuracy": 0.18174491822719574,
"num_tokens": 4290958.0,
"step": 1910
},
{
"entropy": 5.5896929740905765,
"epoch": 2.0703082747431045,
"grad_norm": 1.0078125,
"learning_rate": 0.0004864764421491793,
"loss": 5.3235,
"mean_token_accuracy": 0.18415751457214355,
"num_tokens": 4301867.0,
"step": 1915
},
{
"entropy": 5.628929805755615,
"epoch": 2.075716603569497,
"grad_norm": 0.9765625,
"learning_rate": 0.0004863295981463408,
"loss": 5.3725,
"mean_token_accuracy": 0.17780343294143677,
"num_tokens": 4314890.0,
"step": 1920
},
{
"entropy": 5.734420442581177,
"epoch": 2.08112493239589,
"grad_norm": 1.140625,
"learning_rate": 0.0004861819861712543,
"loss": 5.5296,
"mean_token_accuracy": 0.1750368744134903,
"num_tokens": 4325368.0,
"step": 1925
},
{
"entropy": 5.699685955047608,
"epoch": 2.086533261222282,
"grad_norm": 1.015625,
"learning_rate": 0.00048603360676034203,
"loss": 5.4862,
"mean_token_accuracy": 0.17520413398742676,
"num_tokens": 4337469.0,
"step": 1930
},
{
"entropy": 5.71870493888855,
"epoch": 2.091941590048675,
"grad_norm": 1.03125,
"learning_rate": 0.00048588446045281505,
"loss": 5.411,
"mean_token_accuracy": 0.18186349123716355,
"num_tokens": 4349115.0,
"step": 1935
},
{
"entropy": 5.632260799407959,
"epoch": 2.0973499188750675,
"grad_norm": 1.1015625,
"learning_rate": 0.0004857345477906714,
"loss": 5.3729,
"mean_token_accuracy": 0.18043224960565568,
"num_tokens": 4360287.0,
"step": 1940
},
{
"entropy": 5.676126623153687,
"epoch": 2.1027582477014604,
"grad_norm": 1.03125,
"learning_rate": 0.00048558386931869417,
"loss": 5.5284,
"mean_token_accuracy": 0.17184396237134933,
"num_tokens": 4371966.0,
"step": 1945
},
{
"entropy": 5.658498477935791,
"epoch": 2.1081665765278528,
"grad_norm": 1.0625,
"learning_rate": 0.0004854324255844492,
"loss": 5.4212,
"mean_token_accuracy": 0.18277220278978348,
"num_tokens": 4382837.0,
"step": 1950
},
{
"entropy": 5.5803807258605955,
"epoch": 2.1135749053542456,
"grad_norm": 1.078125,
"learning_rate": 0.00048528021713828336,
"loss": 5.385,
"mean_token_accuracy": 0.18133683502674103,
"num_tokens": 4393970.0,
"step": 1955
},
{
"entropy": 5.634076642990112,
"epoch": 2.118983234180638,
"grad_norm": 1.140625,
"learning_rate": 0.0004851272445333225,
"loss": 5.3915,
"mean_token_accuracy": 0.1862371161580086,
"num_tokens": 4404450.0,
"step": 1960
},
{
"entropy": 5.712316226959229,
"epoch": 2.124391563007031,
"grad_norm": 1.0234375,
"learning_rate": 0.00048497350832546937,
"loss": 5.5442,
"mean_token_accuracy": 0.1754376158118248,
"num_tokens": 4417203.0,
"step": 1965
},
{
"entropy": 5.699717664718628,
"epoch": 2.1297998918334233,
"grad_norm": 1.0703125,
"learning_rate": 0.0004848190090734018,
"loss": 5.4613,
"mean_token_accuracy": 0.17721105217933655,
"num_tokens": 4429458.0,
"step": 1970
},
{
"entropy": 5.758607196807861,
"epoch": 2.135208220659816,
"grad_norm": 0.9609375,
"learning_rate": 0.00048466374733857035,
"loss": 5.5414,
"mean_token_accuracy": 0.16932629495859147,
"num_tokens": 4441445.0,
"step": 1975
},
{
"entropy": 5.592848825454712,
"epoch": 2.1406165494862086,
"grad_norm": 1.046875,
"learning_rate": 0.0004845077236851966,
"loss": 5.425,
"mean_token_accuracy": 0.17384567111730576,
"num_tokens": 4453152.0,
"step": 1980
},
{
"entropy": 5.719186878204345,
"epoch": 2.1460248783126015,
"grad_norm": 1.0390625,
"learning_rate": 0.00048435093868027076,
"loss": 5.3971,
"mean_token_accuracy": 0.18340317606925965,
"num_tokens": 4464478.0,
"step": 1985
},
{
"entropy": 5.505934143066407,
"epoch": 2.151433207138994,
"grad_norm": 1.015625,
"learning_rate": 0.00048419339289354995,
"loss": 5.4474,
"mean_token_accuracy": 0.17782567739486693,
"num_tokens": 4476253.0,
"step": 1990
},
{
"entropy": 5.706979608535766,
"epoch": 2.1568415359653867,
"grad_norm": 0.98046875,
"learning_rate": 0.000484035086897556,
"loss": 5.4232,
"mean_token_accuracy": 0.18010570853948593,
"num_tokens": 4488209.0,
"step": 1995
},
{
"entropy": 5.565637159347534,
"epoch": 2.162249864791779,
"grad_norm": 1.1171875,
"learning_rate": 0.0004838760212675732,
"loss": 5.365,
"mean_token_accuracy": 0.18658868819475175,
"num_tokens": 4499937.0,
"step": 2000
},
{
"epoch": 2.162249864791779,
"eval_entropy": 5.472852083769712,
"eval_loss": 6.006684303283691,
"eval_mean_token_accuracy": 0.16748105433176863,
"eval_num_tokens": 4499937.0,
"eval_runtime": 2.6965,
"eval_samples_per_second": 1303.524,
"eval_steps_per_second": 163.172,
"step": 2000
},
{
"entropy": 5.576435613632202,
"epoch": 2.167658193618172,
"grad_norm": 1.1015625,
"learning_rate": 0.0004837161965816464,
"loss": 5.4196,
"mean_token_accuracy": 0.16989136040210723,
"num_tokens": 4510567.0,
"step": 2005
},
{
"entropy": 5.540714836120605,
"epoch": 2.1730665224445644,
"grad_norm": 1.0390625,
"learning_rate": 0.00048355561342057886,
"loss": 5.351,
"mean_token_accuracy": 0.18173110485076904,
"num_tokens": 4522695.0,
"step": 2010
},
{
"entropy": 5.63709716796875,
"epoch": 2.1784748512709573,
"grad_norm": 1.0703125,
"learning_rate": 0.00048339427236793024,
"loss": 5.3435,
"mean_token_accuracy": 0.18755321353673934,
"num_tokens": 4534642.0,
"step": 2015
},
{
"entropy": 5.672750425338745,
"epoch": 2.1838831800973497,
"grad_norm": 1.0703125,
"learning_rate": 0.0004832321740100143,
"loss": 5.474,
"mean_token_accuracy": 0.17547187954187393,
"num_tokens": 4546021.0,
"step": 2020
},
{
"entropy": 5.571087646484375,
"epoch": 2.1892915089237426,
"grad_norm": 1.078125,
"learning_rate": 0.00048306931893589666,
"loss": 5.3209,
"mean_token_accuracy": 0.17968493103981018,
"num_tokens": 4556814.0,
"step": 2025
},
{
"entropy": 5.581038284301758,
"epoch": 2.194699837750135,
"grad_norm": 1.0546875,
"learning_rate": 0.00048290570773739327,
"loss": 5.3348,
"mean_token_accuracy": 0.18085583597421645,
"num_tokens": 4568595.0,
"step": 2030
},
{
"entropy": 5.618092823028564,
"epoch": 2.200108166576528,
"grad_norm": 1.0625,
"learning_rate": 0.00048274134100906747,
"loss": 5.4454,
"mean_token_accuracy": 0.18696052879095076,
"num_tokens": 4579536.0,
"step": 2035
},
{
"entropy": 5.591726541519165,
"epoch": 2.2055164954029207,
"grad_norm": 0.9921875,
"learning_rate": 0.00048257621934822835,
"loss": 5.3825,
"mean_token_accuracy": 0.19023619443178177,
"num_tokens": 4590497.0,
"step": 2040
},
{
"entropy": 5.658607339859008,
"epoch": 2.210924824229313,
"grad_norm": 1.046875,
"learning_rate": 0.0004824103433549285,
"loss": 5.48,
"mean_token_accuracy": 0.1759459152817726,
"num_tokens": 4601699.0,
"step": 2045
},
{
"entropy": 5.565668439865112,
"epoch": 2.2163331530557056,
"grad_norm": 1.125,
"learning_rate": 0.0004822437136319616,
"loss": 5.3915,
"mean_token_accuracy": 0.17944610118865967,
"num_tokens": 4611857.0,
"step": 2050
},
{
"entropy": 5.6317449569702145,
"epoch": 2.2217414818820984,
"grad_norm": 1.1015625,
"learning_rate": 0.0004820763307848604,
"loss": 5.4326,
"mean_token_accuracy": 0.18303177803754805,
"num_tokens": 4623042.0,
"step": 2055
},
{
"entropy": 5.515517139434815,
"epoch": 2.2271498107084913,
"grad_norm": 1.0078125,
"learning_rate": 0.00048190819542189456,
"loss": 5.4309,
"mean_token_accuracy": 0.1750242218375206,
"num_tokens": 4634398.0,
"step": 2060
},
{
"entropy": 5.572394561767578,
"epoch": 2.2325581395348837,
"grad_norm": 1.03125,
"learning_rate": 0.00048173930815406847,
"loss": 5.3289,
"mean_token_accuracy": 0.1918608710169792,
"num_tokens": 4645140.0,
"step": 2065
},
{
"entropy": 5.510449647903442,
"epoch": 2.2379664683612766,
"grad_norm": 1.0234375,
"learning_rate": 0.0004815696695951187,
"loss": 5.3579,
"mean_token_accuracy": 0.17949569076299668,
"num_tokens": 4657490.0,
"step": 2070
},
{
"entropy": 5.617029333114624,
"epoch": 2.243374797187669,
"grad_norm": 1.0546875,
"learning_rate": 0.0004813992803615123,
"loss": 5.3953,
"mean_token_accuracy": 0.1817226678133011,
"num_tokens": 4670109.0,
"step": 2075
},
{
"entropy": 5.497842073440552,
"epoch": 2.248783126014062,
"grad_norm": 1.0078125,
"learning_rate": 0.00048122814107244414,
"loss": 5.325,
"mean_token_accuracy": 0.19015913605690002,
"num_tokens": 4681498.0,
"step": 2080
},
{
"entropy": 5.674573040008545,
"epoch": 2.2541914548404542,
"grad_norm": 1.078125,
"learning_rate": 0.00048105625234983466,
"loss": 5.5858,
"mean_token_accuracy": 0.1682846337556839,
"num_tokens": 4693351.0,
"step": 2085
},
{
"entropy": 5.653087711334228,
"epoch": 2.259599783666847,
"grad_norm": 0.99609375,
"learning_rate": 0.00048088361481832807,
"loss": 5.522,
"mean_token_accuracy": 0.17714594304561615,
"num_tokens": 4705088.0,
"step": 2090
},
{
"entropy": 5.638476133346558,
"epoch": 2.2650081124932395,
"grad_norm": 0.96875,
"learning_rate": 0.00048071022910528934,
"loss": 5.4,
"mean_token_accuracy": 0.18836630284786224,
"num_tokens": 4716834.0,
"step": 2095
},
{
"entropy": 5.64174747467041,
"epoch": 2.2704164413196324,
"grad_norm": 0.9375,
"learning_rate": 0.00048053609584080274,
"loss": 5.4491,
"mean_token_accuracy": 0.17846577763557434,
"num_tokens": 4728286.0,
"step": 2100
},
{
"entropy": 5.576927280426025,
"epoch": 2.275824770146025,
"grad_norm": 1.0234375,
"learning_rate": 0.00048036121565766876,
"loss": 5.3714,
"mean_token_accuracy": 0.18769163638353348,
"num_tokens": 4739296.0,
"step": 2105
},
{
"entropy": 5.574035024642944,
"epoch": 2.2812330989724177,
"grad_norm": 1.1171875,
"learning_rate": 0.0004801855891914026,
"loss": 5.3497,
"mean_token_accuracy": 0.19533850848674775,
"num_tokens": 4749526.0,
"step": 2110
},
{
"entropy": 5.5547194480896,
"epoch": 2.28664142779881,
"grad_norm": 1.0625,
"learning_rate": 0.00048000921708023117,
"loss": 5.3854,
"mean_token_accuracy": 0.18343230336904526,
"num_tokens": 4760496.0,
"step": 2115
},
{
"entropy": 5.5593877792358395,
"epoch": 2.292049756625203,
"grad_norm": 1.15625,
"learning_rate": 0.0004798320999650911,
"loss": 5.3665,
"mean_token_accuracy": 0.1883173793554306,
"num_tokens": 4771079.0,
"step": 2120
},
{
"entropy": 5.538218402862549,
"epoch": 2.2974580854515954,
"grad_norm": 1.015625,
"learning_rate": 0.00047965423848962636,
"loss": 5.3897,
"mean_token_accuracy": 0.19219416081905366,
"num_tokens": 4781960.0,
"step": 2125
},
{
"entropy": 5.5187544345855715,
"epoch": 2.302866414277988,
"grad_norm": 1.0859375,
"learning_rate": 0.000479475633300186,
"loss": 5.304,
"mean_token_accuracy": 0.18261959850788118,
"num_tokens": 4793174.0,
"step": 2130
},
{
"entropy": 5.629965209960938,
"epoch": 2.3082747431043806,
"grad_norm": 1.0703125,
"learning_rate": 0.00047929628504582173,
"loss": 5.4836,
"mean_token_accuracy": 0.1778162494301796,
"num_tokens": 4804344.0,
"step": 2135
},
{
"entropy": 5.6045232772827145,
"epoch": 2.3136830719307735,
"grad_norm": 1.0078125,
"learning_rate": 0.0004791161943782856,
"loss": 5.4379,
"mean_token_accuracy": 0.18713171631097794,
"num_tokens": 4815838.0,
"step": 2140
},
{
"entropy": 5.535661602020264,
"epoch": 2.319091400757166,
"grad_norm": 1.1328125,
"learning_rate": 0.00047893536195202726,
"loss": 5.3257,
"mean_token_accuracy": 0.18756370097398758,
"num_tokens": 4826153.0,
"step": 2145
},
{
"entropy": 5.4889808177948,
"epoch": 2.3244997295835588,
"grad_norm": 1.0078125,
"learning_rate": 0.0004787537884241923,
"loss": 5.4147,
"mean_token_accuracy": 0.1823410928249359,
"num_tokens": 4838647.0,
"step": 2150
},
{
"entropy": 5.69741678237915,
"epoch": 2.329908058409951,
"grad_norm": 1.0859375,
"learning_rate": 0.00047857147445461943,
"loss": 5.5028,
"mean_token_accuracy": 0.174128720164299,
"num_tokens": 4849320.0,
"step": 2155
},
{
"entropy": 5.574743413925171,
"epoch": 2.335316387236344,
"grad_norm": 1.09375,
"learning_rate": 0.0004783884207058379,
"loss": 5.3685,
"mean_token_accuracy": 0.1826545551419258,
"num_tokens": 4860079.0,
"step": 2160
},
{
"entropy": 5.509880256652832,
"epoch": 2.3407247160627365,
"grad_norm": 1.0234375,
"learning_rate": 0.00047820462784306555,
"loss": 5.3293,
"mean_token_accuracy": 0.1828920543193817,
"num_tokens": 4871073.0,
"step": 2165
},
{
"entropy": 5.555741643905639,
"epoch": 2.3461330448891293,
"grad_norm": 1.1484375,
"learning_rate": 0.000478020096534206,
"loss": 5.3453,
"mean_token_accuracy": 0.18160604387521745,
"num_tokens": 4881517.0,
"step": 2170
},
{
"entropy": 5.546141862869263,
"epoch": 2.3515413737155217,
"grad_norm": 1.0546875,
"learning_rate": 0.00047783482744984644,
"loss": 5.4308,
"mean_token_accuracy": 0.1774826467037201,
"num_tokens": 4892554.0,
"step": 2175
},
{
"entropy": 5.581753587722778,
"epoch": 2.3569497025419146,
"grad_norm": 1.1171875,
"learning_rate": 0.00047764882126325527,
"loss": 5.4502,
"mean_token_accuracy": 0.17918796688318253,
"num_tokens": 4903168.0,
"step": 2180
},
{
"entropy": 5.592440605163574,
"epoch": 2.362358031368307,
"grad_norm": 1.1796875,
"learning_rate": 0.0004774620786503793,
"loss": 5.4973,
"mean_token_accuracy": 0.17680401653051375,
"num_tokens": 4914213.0,
"step": 2185
},
{
"entropy": 5.670473623275757,
"epoch": 2.3677663601947,
"grad_norm": 1.03125,
"learning_rate": 0.0004772746002898417,
"loss": 5.4517,
"mean_token_accuracy": 0.18014305382966994,
"num_tokens": 4926271.0,
"step": 2190
},
{
"entropy": 5.532607746124268,
"epoch": 2.3731746890210923,
"grad_norm": 1.015625,
"learning_rate": 0.00047708638686293903,
"loss": 5.3515,
"mean_token_accuracy": 0.19012952744960784,
"num_tokens": 4938386.0,
"step": 2195
},
{
"entropy": 5.573096704483032,
"epoch": 2.378583017847485,
"grad_norm": 1.03125,
"learning_rate": 0.00047689743905363963,
"loss": 5.3258,
"mean_token_accuracy": 0.18657357543706893,
"num_tokens": 4949920.0,
"step": 2200
},
{
"entropy": 5.493396759033203,
"epoch": 2.383991346673878,
"grad_norm": 1.078125,
"learning_rate": 0.0004767077575485801,
"loss": 5.4508,
"mean_token_accuracy": 0.17724529951810836,
"num_tokens": 4961639.0,
"step": 2205
},
{
"entropy": 5.576059484481812,
"epoch": 2.3893996755002704,
"grad_norm": 1.1015625,
"learning_rate": 0.0004765173430370635,
"loss": 5.3795,
"mean_token_accuracy": 0.1817702829837799,
"num_tokens": 4972863.0,
"step": 2210
},
{
"entropy": 5.557861566543579,
"epoch": 2.394808004326663,
"grad_norm": 1.140625,
"learning_rate": 0.0004763261962110567,
"loss": 5.3465,
"mean_token_accuracy": 0.18829651176929474,
"num_tokens": 4982767.0,
"step": 2215
},
{
"entropy": 5.482148265838623,
"epoch": 2.4002163331530557,
"grad_norm": 1.0,
"learning_rate": 0.0004761343177651875,
"loss": 5.3647,
"mean_token_accuracy": 0.181600858271122,
"num_tokens": 4993610.0,
"step": 2220
},
{
"entropy": 5.647186183929444,
"epoch": 2.4056246619794486,
"grad_norm": 1.1328125,
"learning_rate": 0.0004759417083967428,
"loss": 5.4748,
"mean_token_accuracy": 0.18320268392562866,
"num_tokens": 5004443.0,
"step": 2225
},
{
"entropy": 5.47214641571045,
"epoch": 2.411032990805841,
"grad_norm": 1.109375,
"learning_rate": 0.00047574836880566544,
"loss": 5.322,
"mean_token_accuracy": 0.18720456659793855,
"num_tokens": 5014551.0,
"step": 2230
},
{
"entropy": 5.606646919250489,
"epoch": 2.4164413196322334,
"grad_norm": 1.078125,
"learning_rate": 0.0004755542996945519,
"loss": 5.4073,
"mean_token_accuracy": 0.18585125505924224,
"num_tokens": 5025561.0,
"step": 2235
},
{
"entropy": 5.571566343307495,
"epoch": 2.4218496484586263,
"grad_norm": 1.0546875,
"learning_rate": 0.00047535950176864976,
"loss": 5.3324,
"mean_token_accuracy": 0.19187741875648498,
"num_tokens": 5036515.0,
"step": 2240
},
{
"entropy": 5.440071678161621,
"epoch": 2.427257977285019,
"grad_norm": 0.9921875,
"learning_rate": 0.00047516397573585525,
"loss": 5.3935,
"mean_token_accuracy": 0.17414860427379608,
"num_tokens": 5048228.0,
"step": 2245
},
{
"entropy": 5.583653306961059,
"epoch": 2.4326663061114115,
"grad_norm": 1.1015625,
"learning_rate": 0.00047496772230671034,
"loss": 5.4135,
"mean_token_accuracy": 0.17929787188768387,
"num_tokens": 5059574.0,
"step": 2250
},
{
"entropy": 5.500989532470703,
"epoch": 2.4380746349378044,
"grad_norm": 1.1171875,
"learning_rate": 0.0004747707421944004,
"loss": 5.345,
"mean_token_accuracy": 0.1873723477125168,
"num_tokens": 5070675.0,
"step": 2255
},
{
"entropy": 5.499913167953491,
"epoch": 2.443482963764197,
"grad_norm": 0.92578125,
"learning_rate": 0.0004745730361147517,
"loss": 5.3294,
"mean_token_accuracy": 0.18599451929330826,
"num_tokens": 5082620.0,
"step": 2260
},
{
"entropy": 5.598516607284546,
"epoch": 2.4488912925905897,
"grad_norm": 1.03125,
"learning_rate": 0.0004743746047862286,
"loss": 5.3919,
"mean_token_accuracy": 0.1780677855014801,
"num_tokens": 5094120.0,
"step": 2265
},
{
"entropy": 5.5201959133148195,
"epoch": 2.454299621416982,
"grad_norm": 1.078125,
"learning_rate": 0.0004741754489299309,
"loss": 5.3842,
"mean_token_accuracy": 0.184432190656662,
"num_tokens": 5104681.0,
"step": 2270
},
{
"entropy": 5.505268478393555,
"epoch": 2.459707950243375,
"grad_norm": 1.03125,
"learning_rate": 0.00047397556926959155,
"loss": 5.3815,
"mean_token_accuracy": 0.19052304178476334,
"num_tokens": 5114901.0,
"step": 2275
},
{
"entropy": 5.483372545242309,
"epoch": 2.4651162790697674,
"grad_norm": 1.0234375,
"learning_rate": 0.00047377496653157374,
"loss": 5.3595,
"mean_token_accuracy": 0.18044475913047792,
"num_tokens": 5125947.0,
"step": 2280
},
{
"entropy": 5.68227915763855,
"epoch": 2.4705246078961602,
"grad_norm": 1.1171875,
"learning_rate": 0.00047357364144486806,
"loss": 5.4893,
"mean_token_accuracy": 0.17698677629232407,
"num_tokens": 5137905.0,
"step": 2285
},
{
"entropy": 5.558288478851319,
"epoch": 2.4759329367225527,
"grad_norm": 0.94921875,
"learning_rate": 0.00047337159474109057,
"loss": 5.4702,
"mean_token_accuracy": 0.17549121230840684,
"num_tokens": 5150266.0,
"step": 2290
},
{
"entropy": 5.514402580261231,
"epoch": 2.4813412655489455,
"grad_norm": 1.0703125,
"learning_rate": 0.00047316882715447934,
"loss": 5.4259,
"mean_token_accuracy": 0.18137722760438918,
"num_tokens": 5160909.0,
"step": 2295
},
{
"entropy": 5.480083179473877,
"epoch": 2.486749594375338,
"grad_norm": 1.078125,
"learning_rate": 0.0004729653394218922,
"loss": 5.4046,
"mean_token_accuracy": 0.18145928680896758,
"num_tokens": 5173645.0,
"step": 2300
},
{
"entropy": 5.62817873954773,
"epoch": 2.492157923201731,
"grad_norm": 1.09375,
"learning_rate": 0.00047276113228280427,
"loss": 5.5656,
"mean_token_accuracy": 0.16851997673511504,
"num_tokens": 5186269.0,
"step": 2305
},
{
"entropy": 5.606264257431031,
"epoch": 2.497566252028123,
"grad_norm": 1.140625,
"learning_rate": 0.0004725562064793045,
"loss": 5.3757,
"mean_token_accuracy": 0.19015525728464128,
"num_tokens": 5197061.0,
"step": 2310
},
{
"entropy": 5.458608961105346,
"epoch": 2.502974580854516,
"grad_norm": 1.03125,
"learning_rate": 0.00047235056275609397,
"loss": 5.3967,
"mean_token_accuracy": 0.18642975986003876,
"num_tokens": 5207182.0,
"step": 2315
},
{
"entropy": 5.570804214477539,
"epoch": 2.5083829096809085,
"grad_norm": 1.015625,
"learning_rate": 0.0004721442018604822,
"loss": 5.4118,
"mean_token_accuracy": 0.18205344974994658,
"num_tokens": 5218381.0,
"step": 2320
},
{
"entropy": 5.588907957077026,
"epoch": 2.5137912385073014,
"grad_norm": 1.09375,
"learning_rate": 0.0004719371245423853,
"loss": 5.2995,
"mean_token_accuracy": 0.19421885162591934,
"num_tokens": 5228504.0,
"step": 2325
},
{
"entropy": 5.47154221534729,
"epoch": 2.5191995673336938,
"grad_norm": 1.0703125,
"learning_rate": 0.00047172933155432273,
"loss": 5.4011,
"mean_token_accuracy": 0.1852772742509842,
"num_tokens": 5239145.0,
"step": 2330
},
{
"entropy": 5.434785079956055,
"epoch": 2.5246078961600866,
"grad_norm": 0.9921875,
"learning_rate": 0.00047152082365141466,
"loss": 5.2518,
"mean_token_accuracy": 0.19392025023698806,
"num_tokens": 5250697.0,
"step": 2335
},
{
"entropy": 5.573790073394775,
"epoch": 2.530016224986479,
"grad_norm": 1.0234375,
"learning_rate": 0.0004713116015913794,
"loss": 5.4118,
"mean_token_accuracy": 0.18861660957336426,
"num_tokens": 5262876.0,
"step": 2340
},
{
"entropy": 5.401359987258911,
"epoch": 2.535424553812872,
"grad_norm": 0.98046875,
"learning_rate": 0.00047110166613453016,
"loss": 5.3265,
"mean_token_accuracy": 0.18738412708044053,
"num_tokens": 5273813.0,
"step": 2345
},
{
"entropy": 5.584725189208984,
"epoch": 2.5408328826392643,
"grad_norm": 1.1015625,
"learning_rate": 0.00047089101804377305,
"loss": 5.5047,
"mean_token_accuracy": 0.17414041757583618,
"num_tokens": 5285053.0,
"step": 2350
},
{
"entropy": 5.498822641372681,
"epoch": 2.546241211465657,
"grad_norm": 1.1015625,
"learning_rate": 0.0004706796580846037,
"loss": 5.3338,
"mean_token_accuracy": 0.19276315420866014,
"num_tokens": 5295227.0,
"step": 2355
},
{
"entropy": 5.618280839920044,
"epoch": 2.5516495402920496,
"grad_norm": 1.015625,
"learning_rate": 0.00047046758702510465,
"loss": 5.4182,
"mean_token_accuracy": 0.17885240763425828,
"num_tokens": 5306787.0,
"step": 2360
},
{
"entropy": 5.500233221054077,
"epoch": 2.5570578691184425,
"grad_norm": 1.0625,
"learning_rate": 0.00047025480563594264,
"loss": 5.442,
"mean_token_accuracy": 0.1758480668067932,
"num_tokens": 5317809.0,
"step": 2365
},
{
"entropy": 5.597690486907959,
"epoch": 2.5624661979448353,
"grad_norm": 1.078125,
"learning_rate": 0.00047004131469036576,
"loss": 5.4075,
"mean_token_accuracy": 0.18495803326368332,
"num_tokens": 5327738.0,
"step": 2370
},
{
"entropy": 5.4438732147216795,
"epoch": 2.5678745267712277,
"grad_norm": 1.046875,
"learning_rate": 0.00046982711496420057,
"loss": 5.3914,
"mean_token_accuracy": 0.18428546339273452,
"num_tokens": 5339700.0,
"step": 2375
},
{
"entropy": 5.552294492721558,
"epoch": 2.57328285559762,
"grad_norm": 1.0234375,
"learning_rate": 0.00046961220723584925,
"loss": 5.4092,
"mean_token_accuracy": 0.17879543006420134,
"num_tokens": 5350934.0,
"step": 2380
},
{
"entropy": 5.463089847564698,
"epoch": 2.578691184424013,
"grad_norm": 1.015625,
"learning_rate": 0.00046939659228628725,
"loss": 5.3289,
"mean_token_accuracy": 0.19285490959882737,
"num_tokens": 5361364.0,
"step": 2385
},
{
"entropy": 5.589974069595337,
"epoch": 2.584099513250406,
"grad_norm": 0.96875,
"learning_rate": 0.00046918027089905956,
"loss": 5.5364,
"mean_token_accuracy": 0.18631306886672974,
"num_tokens": 5373376.0,
"step": 2390
},
{
"entropy": 5.527939748764038,
"epoch": 2.5895078420767983,
"grad_norm": 0.98828125,
"learning_rate": 0.00046896324386027873,
"loss": 5.419,
"mean_token_accuracy": 0.1782801240682602,
"num_tokens": 5384422.0,
"step": 2395
},
{
"entropy": 5.6619553565979,
"epoch": 2.5949161709031907,
"grad_norm": 1.03125,
"learning_rate": 0.00046874551195862145,
"loss": 5.4323,
"mean_token_accuracy": 0.18902574479579926,
"num_tokens": 5395834.0,
"step": 2400
},
{
"entropy": 5.517275857925415,
"epoch": 2.6003244997295836,
"grad_norm": 1.0625,
"learning_rate": 0.000468527075985326,
"loss": 5.5484,
"mean_token_accuracy": 0.17533761113882065,
"num_tokens": 5407749.0,
"step": 2405
},
{
"entropy": 5.563359642028809,
"epoch": 2.6057328285559764,
"grad_norm": 1.1171875,
"learning_rate": 0.00046830793673418924,
"loss": 5.4235,
"mean_token_accuracy": 0.18526053428649902,
"num_tokens": 5418035.0,
"step": 2410
},
{
"entropy": 5.5195565700531,
"epoch": 2.611141157382369,
"grad_norm": 0.99609375,
"learning_rate": 0.00046808809500156355,
"loss": 5.3512,
"mean_token_accuracy": 0.1831403434276581,
"num_tokens": 5429027.0,
"step": 2415
},
{
"entropy": 5.454291677474975,
"epoch": 2.6165494862087613,
"grad_norm": 1.0390625,
"learning_rate": 0.0004678675515863545,
"loss": 5.3162,
"mean_token_accuracy": 0.1908747971057892,
"num_tokens": 5440312.0,
"step": 2420
},
{
"entropy": 5.524546337127686,
"epoch": 2.621957815035154,
"grad_norm": 1.1484375,
"learning_rate": 0.0004676463072900173,
"loss": 5.3406,
"mean_token_accuracy": 0.1890124186873436,
"num_tokens": 5451281.0,
"step": 2425
},
{
"entropy": 5.481093072891236,
"epoch": 2.627366143861547,
"grad_norm": 1.140625,
"learning_rate": 0.00046742436291655415,
"loss": 5.3896,
"mean_token_accuracy": 0.1857441246509552,
"num_tokens": 5462958.0,
"step": 2430
},
{
"entropy": 5.560990715026856,
"epoch": 2.6327744726879394,
"grad_norm": 1.0546875,
"learning_rate": 0.00046720171927251155,
"loss": 5.3997,
"mean_token_accuracy": 0.18795904368162156,
"num_tokens": 5473364.0,
"step": 2435
},
{
"entropy": 5.525981903076172,
"epoch": 2.638182801514332,
"grad_norm": 1.0703125,
"learning_rate": 0.0004669783771669769,
"loss": 5.3372,
"mean_token_accuracy": 0.186283440887928,
"num_tokens": 5485141.0,
"step": 2440
},
{
"entropy": 5.501952028274536,
"epoch": 2.6435911303407247,
"grad_norm": 0.94921875,
"learning_rate": 0.000466754337411576,
"loss": 5.4608,
"mean_token_accuracy": 0.17689261436462403,
"num_tokens": 5497802.0,
"step": 2445
},
{
"entropy": 5.52817325592041,
"epoch": 2.6489994591671175,
"grad_norm": 1.203125,
"learning_rate": 0.00046652960082046985,
"loss": 5.3104,
"mean_token_accuracy": 0.18938876837491989,
"num_tokens": 5507735.0,
"step": 2450
},
{
"entropy": 5.457919502258301,
"epoch": 2.65440778799351,
"grad_norm": 1.0234375,
"learning_rate": 0.00046630416821035164,
"loss": 5.4141,
"mean_token_accuracy": 0.18110267370939254,
"num_tokens": 5519625.0,
"step": 2455
},
{
"entropy": 5.532788038253784,
"epoch": 2.6598161168199024,
"grad_norm": 0.9921875,
"learning_rate": 0.0004660780404004441,
"loss": 5.3051,
"mean_token_accuracy": 0.18533146679401397,
"num_tokens": 5531223.0,
"step": 2460
},
{
"entropy": 5.4125641822814945,
"epoch": 2.6652244456462952,
"grad_norm": 1.015625,
"learning_rate": 0.00046585121821249623,
"loss": 5.3335,
"mean_token_accuracy": 0.1871636375784874,
"num_tokens": 5543250.0,
"step": 2465
},
{
"entropy": 5.4998725891113285,
"epoch": 2.670632774472688,
"grad_norm": 1.1484375,
"learning_rate": 0.00046562370247078025,
"loss": 5.3436,
"mean_token_accuracy": 0.18235380053520203,
"num_tokens": 5554817.0,
"step": 2470
},
{
"entropy": 5.529648303985596,
"epoch": 2.6760411032990805,
"grad_norm": 0.9921875,
"learning_rate": 0.000465395494002089,
"loss": 5.4474,
"mean_token_accuracy": 0.1817679688334465,
"num_tokens": 5567716.0,
"step": 2475
},
{
"entropy": 5.515621042251587,
"epoch": 2.6814494321254734,
"grad_norm": 1.1015625,
"learning_rate": 0.0004651665936357325,
"loss": 5.4621,
"mean_token_accuracy": 0.18281052708625795,
"num_tokens": 5579357.0,
"step": 2480
},
{
"entropy": 5.485055685043335,
"epoch": 2.686857760951866,
"grad_norm": 1.03125,
"learning_rate": 0.0004649370022035354,
"loss": 5.3676,
"mean_token_accuracy": 0.19052984565496445,
"num_tokens": 5590206.0,
"step": 2485
},
{
"entropy": 5.473781728744507,
"epoch": 2.6922660897782587,
"grad_norm": 1.0546875,
"learning_rate": 0.0004647067205398332,
"loss": 5.3773,
"mean_token_accuracy": 0.1808069244027138,
"num_tokens": 5601639.0,
"step": 2490
},
{
"entropy": 5.437832450866699,
"epoch": 2.697674418604651,
"grad_norm": 1.015625,
"learning_rate": 0.00046447574948147027,
"loss": 5.3071,
"mean_token_accuracy": 0.18197673112154006,
"num_tokens": 5612915.0,
"step": 2495
},
{
"entropy": 5.569986343383789,
"epoch": 2.703082747431044,
"grad_norm": 1.15625,
"learning_rate": 0.00046424408986779587,
"loss": 5.4836,
"mean_token_accuracy": 0.17870566844940186,
"num_tokens": 5623919.0,
"step": 2500
},
{
"entropy": 5.550902223587036,
"epoch": 2.7084910762574363,
"grad_norm": 1.078125,
"learning_rate": 0.0004640117425406615,
"loss": 5.3881,
"mean_token_accuracy": 0.18566381186246872,
"num_tokens": 5635334.0,
"step": 2505
},
{
"entropy": 5.503871917724609,
"epoch": 2.713899405083829,
"grad_norm": 1.03125,
"learning_rate": 0.000463778708344418,
"loss": 5.3808,
"mean_token_accuracy": 0.18955522179603576,
"num_tokens": 5646053.0,
"step": 2510
},
{
"entropy": 5.507321166992187,
"epoch": 2.7193077339102216,
"grad_norm": 1.09375,
"learning_rate": 0.00046354498812591207,
"loss": 5.3922,
"mean_token_accuracy": 0.18845376521348953,
"num_tokens": 5656445.0,
"step": 2515
},
{
"entropy": 5.598144817352295,
"epoch": 2.7247160627366145,
"grad_norm": 1.0546875,
"learning_rate": 0.00046331058273448364,
"loss": 5.3921,
"mean_token_accuracy": 0.1822582095861435,
"num_tokens": 5667324.0,
"step": 2520
},
{
"entropy": 5.447207260131836,
"epoch": 2.730124391563007,
"grad_norm": 1.1015625,
"learning_rate": 0.0004630754930219624,
"loss": 5.3905,
"mean_token_accuracy": 0.18877604305744172,
"num_tokens": 5677557.0,
"step": 2525
},
{
"entropy": 5.402798748016357,
"epoch": 2.7355327203893998,
"grad_norm": 1.03125,
"learning_rate": 0.0004628397198426648,
"loss": 5.2329,
"mean_token_accuracy": 0.1926985576748848,
"num_tokens": 5688444.0,
"step": 2530
},
{
"entropy": 5.5604699611663815,
"epoch": 2.740941049215792,
"grad_norm": 0.98046875,
"learning_rate": 0.00046260326405339126,
"loss": 5.5044,
"mean_token_accuracy": 0.17508567720651627,
"num_tokens": 5699194.0,
"step": 2535
},
{
"entropy": 5.569923686981201,
"epoch": 2.746349378042185,
"grad_norm": 0.9921875,
"learning_rate": 0.0004623661265134226,
"loss": 5.4671,
"mean_token_accuracy": 0.17520037144422532,
"num_tokens": 5710831.0,
"step": 2540
},
{
"entropy": 5.584377336502075,
"epoch": 2.7517577068685775,
"grad_norm": 1.109375,
"learning_rate": 0.0004621283080845172,
"loss": 5.347,
"mean_token_accuracy": 0.19738965332508088,
"num_tokens": 5721781.0,
"step": 2545
},
{
"entropy": 5.4828346252441404,
"epoch": 2.7571660356949703,
"grad_norm": 0.97265625,
"learning_rate": 0.00046188980963090783,
"loss": 5.3729,
"mean_token_accuracy": 0.18409281522035598,
"num_tokens": 5733303.0,
"step": 2550
},
{
"entropy": 5.446268129348755,
"epoch": 2.7625743645213627,
"grad_norm": 1.125,
"learning_rate": 0.00046165063201929825,
"loss": 5.3689,
"mean_token_accuracy": 0.18689175695180893,
"num_tokens": 5743978.0,
"step": 2555
},
{
"entropy": 5.46161675453186,
"epoch": 2.7679826933477556,
"grad_norm": 1.1953125,
"learning_rate": 0.00046141077611886074,
"loss": 5.3696,
"mean_token_accuracy": 0.18578916043043137,
"num_tokens": 5755465.0,
"step": 2560
},
{
"entropy": 5.4774675369262695,
"epoch": 2.773391022174148,
"grad_norm": 1.0,
"learning_rate": 0.0004611702428012319,
"loss": 5.3051,
"mean_token_accuracy": 0.19155556112527847,
"num_tokens": 5767132.0,
"step": 2565
},
{
"entropy": 5.469518041610717,
"epoch": 2.778799351000541,
"grad_norm": 1.046875,
"learning_rate": 0.00046092903294051057,
"loss": 5.3605,
"mean_token_accuracy": 0.19294181615114211,
"num_tokens": 5777954.0,
"step": 2570
},
{
"entropy": 5.462495136260986,
"epoch": 2.7842076798269337,
"grad_norm": 0.98828125,
"learning_rate": 0.00046068714741325385,
"loss": 5.3367,
"mean_token_accuracy": 0.1882034182548523,
"num_tokens": 5789482.0,
"step": 2575
},
{
"entropy": 5.498905038833618,
"epoch": 2.789616008653326,
"grad_norm": 1.1171875,
"learning_rate": 0.0004604445870984743,
"loss": 5.3336,
"mean_token_accuracy": 0.18698014914989472,
"num_tokens": 5800624.0,
"step": 2580
},
{
"entropy": 5.48365159034729,
"epoch": 2.7950243374797186,
"grad_norm": 1.140625,
"learning_rate": 0.0004602013528776367,
"loss": 5.3472,
"mean_token_accuracy": 0.19222134351730347,
"num_tokens": 5810402.0,
"step": 2585
},
{
"entropy": 5.55194730758667,
"epoch": 2.8004326663061114,
"grad_norm": 0.9609375,
"learning_rate": 0.0004599574456346548,
"loss": 5.4827,
"mean_token_accuracy": 0.18214652687311172,
"num_tokens": 5822596.0,
"step": 2590
},
{
"entropy": 5.495826387405396,
"epoch": 2.8058409951325043,
"grad_norm": 1.109375,
"learning_rate": 0.00045971286625588796,
"loss": 5.3741,
"mean_token_accuracy": 0.18433350175619126,
"num_tokens": 5834201.0,
"step": 2595
},
{
"entropy": 5.492666625976563,
"epoch": 2.8112493239588967,
"grad_norm": 1.0234375,
"learning_rate": 0.0004594676156301383,
"loss": 5.3005,
"mean_token_accuracy": 0.1921772375702858,
"num_tokens": 5846440.0,
"step": 2600
},
{
"entropy": 5.438047790527344,
"epoch": 2.816657652785289,
"grad_norm": 1.0,
"learning_rate": 0.00045922169464864725,
"loss": 5.4765,
"mean_token_accuracy": 0.1770583361387253,
"num_tokens": 5858917.0,
"step": 2605
},
{
"entropy": 5.5323127746582035,
"epoch": 2.822065981611682,
"grad_norm": 1.09375,
"learning_rate": 0.000458975104205092,
"loss": 5.3066,
"mean_token_accuracy": 0.19467224478721618,
"num_tokens": 5869834.0,
"step": 2610
},
{
"entropy": 5.5151975631713865,
"epoch": 2.827474310438075,
"grad_norm": 0.9375,
"learning_rate": 0.00045872784519558304,
"loss": 5.4022,
"mean_token_accuracy": 0.18480263352394105,
"num_tokens": 5881895.0,
"step": 2615
},
{
"entropy": 5.438316297531128,
"epoch": 2.8328826392644673,
"grad_norm": 1.0625,
"learning_rate": 0.0004584799185186599,
"loss": 5.3402,
"mean_token_accuracy": 0.18830967247486113,
"num_tokens": 5892929.0,
"step": 2620
},
{
"entropy": 5.462751626968384,
"epoch": 2.8382909680908597,
"grad_norm": 1.0703125,
"learning_rate": 0.00045823132507528903,
"loss": 5.3173,
"mean_token_accuracy": 0.1983159974217415,
"num_tokens": 5903347.0,
"step": 2625
},
{
"entropy": 5.605246448516846,
"epoch": 2.8436992969172525,
"grad_norm": 0.99609375,
"learning_rate": 0.0004579820657688593,
"loss": 5.4603,
"mean_token_accuracy": 0.18683298975229262,
"num_tokens": 5915025.0,
"step": 2630
},
{
"entropy": 5.528272914886474,
"epoch": 2.8491076257436454,
"grad_norm": 1.1015625,
"learning_rate": 0.0004577321415051798,
"loss": 5.3377,
"mean_token_accuracy": 0.19072499722242356,
"num_tokens": 5925953.0,
"step": 2635
},
{
"entropy": 5.530864620208741,
"epoch": 2.854515954570038,
"grad_norm": 1.0546875,
"learning_rate": 0.00045748155319247564,
"loss": 5.4823,
"mean_token_accuracy": 0.1815452367067337,
"num_tokens": 5938589.0,
"step": 2640
},
{
"entropy": 5.572798442840576,
"epoch": 2.8599242833964302,
"grad_norm": 1.2109375,
"learning_rate": 0.0004572303017413856,
"loss": 5.4122,
"mean_token_accuracy": 0.17687317728996277,
"num_tokens": 5949546.0,
"step": 2645
},
{
"entropy": 5.337789869308471,
"epoch": 2.865332612222823,
"grad_norm": 1.0390625,
"learning_rate": 0.0004569783880649578,
"loss": 5.3594,
"mean_token_accuracy": 0.18260867148637772,
"num_tokens": 5960395.0,
"step": 2650
},
{
"entropy": 5.551058387756347,
"epoch": 2.870740941049216,
"grad_norm": 1.09375,
"learning_rate": 0.0004567258130786474,
"loss": 5.4024,
"mean_token_accuracy": 0.18948372900485994,
"num_tokens": 5969642.0,
"step": 2655
},
{
"entropy": 5.4566559314727785,
"epoch": 2.8761492698756084,
"grad_norm": 1.1171875,
"learning_rate": 0.00045647257770031215,
"loss": 5.3139,
"mean_token_accuracy": 0.18019493967294692,
"num_tokens": 5979001.0,
"step": 2660
},
{
"entropy": 5.621964836120606,
"epoch": 2.8815575987020012,
"grad_norm": 1.0,
"learning_rate": 0.00045621868285021023,
"loss": 5.5441,
"mean_token_accuracy": 0.17837482690811157,
"num_tokens": 5991511.0,
"step": 2665
},
{
"entropy": 5.444990110397339,
"epoch": 2.8869659275283936,
"grad_norm": 1.171875,
"learning_rate": 0.00045596412945099615,
"loss": 5.2747,
"mean_token_accuracy": 0.1955416664481163,
"num_tokens": 6001902.0,
"step": 2670
},
{
"entropy": 5.40801887512207,
"epoch": 2.8923742563547865,
"grad_norm": 1.09375,
"learning_rate": 0.00045570891842771727,
"loss": 5.3791,
"mean_token_accuracy": 0.191572804749012,
"num_tokens": 6012220.0,
"step": 2675
},
{
"entropy": 5.503115224838257,
"epoch": 2.897782585181179,
"grad_norm": 1.046875,
"learning_rate": 0.00045545305070781135,
"loss": 5.3874,
"mean_token_accuracy": 0.18666007816791536,
"num_tokens": 6023795.0,
"step": 2680
},
{
"entropy": 5.490363645553589,
"epoch": 2.903190914007572,
"grad_norm": 1.0703125,
"learning_rate": 0.00045519652722110206,
"loss": 5.34,
"mean_token_accuracy": 0.1851412460207939,
"num_tokens": 6034335.0,
"step": 2685
},
{
"entropy": 5.5544792175292965,
"epoch": 2.908599242833964,
"grad_norm": 1.1171875,
"learning_rate": 0.00045493934889979655,
"loss": 5.4185,
"mean_token_accuracy": 0.18491135239601136,
"num_tokens": 6045435.0,
"step": 2690
},
{
"entropy": 5.475643587112427,
"epoch": 2.914007571660357,
"grad_norm": 1.03125,
"learning_rate": 0.00045468151667848116,
"loss": 5.444,
"mean_token_accuracy": 0.18254784345626832,
"num_tokens": 6057130.0,
"step": 2695
},
{
"entropy": 5.632959985733033,
"epoch": 2.9194159004867495,
"grad_norm": 1.0390625,
"learning_rate": 0.000454423031494119,
"loss": 5.4365,
"mean_token_accuracy": 0.1868360236287117,
"num_tokens": 6068382.0,
"step": 2700
},
{
"entropy": 5.513478803634643,
"epoch": 2.9248242293131423,
"grad_norm": 1.078125,
"learning_rate": 0.0004541638942860458,
"loss": 5.4198,
"mean_token_accuracy": 0.18837159723043442,
"num_tokens": 6078958.0,
"step": 2705
},
{
"entropy": 5.526330518722534,
"epoch": 2.9302325581395348,
"grad_norm": 0.984375,
"learning_rate": 0.0004539041059959667,
"loss": 5.4401,
"mean_token_accuracy": 0.18759401738643647,
"num_tokens": 6091054.0,
"step": 2710
},
{
"entropy": 5.538228273391724,
"epoch": 2.9356408869659276,
"grad_norm": 1.0546875,
"learning_rate": 0.00045364366756795295,
"loss": 5.3236,
"mean_token_accuracy": 0.18440162241458893,
"num_tokens": 6102371.0,
"step": 2715
},
{
"entropy": 5.423747777938843,
"epoch": 2.94104921579232,
"grad_norm": 1.125,
"learning_rate": 0.00045338257994843845,
"loss": 5.3537,
"mean_token_accuracy": 0.19029029160737992,
"num_tokens": 6113468.0,
"step": 2720
},
{
"entropy": 5.476720857620239,
"epoch": 2.946457544618713,
"grad_norm": 1.046875,
"learning_rate": 0.0004531208440862162,
"loss": 5.4001,
"mean_token_accuracy": 0.1901046320796013,
"num_tokens": 6125205.0,
"step": 2725
},
{
"entropy": 5.478125047683716,
"epoch": 2.9518658734451053,
"grad_norm": 1.15625,
"learning_rate": 0.00045285846093243485,
"loss": 5.3179,
"mean_token_accuracy": 0.18634466975927352,
"num_tokens": 6134831.0,
"step": 2730
},
{
"entropy": 5.560326480865479,
"epoch": 2.957274202271498,
"grad_norm": 1.1796875,
"learning_rate": 0.00045259543144059557,
"loss": 5.4177,
"mean_token_accuracy": 0.18014927655458451,
"num_tokens": 6145927.0,
"step": 2735
},
{
"entropy": 5.476049375534058,
"epoch": 2.9626825310978906,
"grad_norm": 1.2578125,
"learning_rate": 0.0004523317565665479,
"loss": 5.4213,
"mean_token_accuracy": 0.18212687522172927,
"num_tokens": 6156054.0,
"step": 2740
},
{
"entropy": 5.437103366851806,
"epoch": 2.9680908599242835,
"grad_norm": 1.078125,
"learning_rate": 0.00045206743726848716,
"loss": 5.3387,
"mean_token_accuracy": 0.18745884001255037,
"num_tokens": 6166157.0,
"step": 2745
},
{
"entropy": 5.491754388809204,
"epoch": 2.973499188750676,
"grad_norm": 1.078125,
"learning_rate": 0.0004518024745069502,
"loss": 5.366,
"mean_token_accuracy": 0.18674905002117156,
"num_tokens": 6178462.0,
"step": 2750
},
{
"entropy": 5.453402280807495,
"epoch": 2.9789075175770687,
"grad_norm": 1.1171875,
"learning_rate": 0.0004515368692448123,
"loss": 5.3232,
"mean_token_accuracy": 0.18855093717575072,
"num_tokens": 6189018.0,
"step": 2755
},
{
"entropy": 5.590845823287964,
"epoch": 2.9843158464034616,
"grad_norm": 1.109375,
"learning_rate": 0.00045127062244728353,
"loss": 5.4735,
"mean_token_accuracy": 0.18126190304756165,
"num_tokens": 6199911.0,
"step": 2760
},
{
"entropy": 5.487865018844604,
"epoch": 2.989724175229854,
"grad_norm": 1.0625,
"learning_rate": 0.0004510037350819055,
"loss": 5.3803,
"mean_token_accuracy": 0.18124324083328247,
"num_tokens": 6211822.0,
"step": 2765
},
{
"entropy": 5.42392144203186,
"epoch": 2.9951325040562464,
"grad_norm": 1.078125,
"learning_rate": 0.00045073620811854744,
"loss": 5.2865,
"mean_token_accuracy": 0.1973293974995613,
"num_tokens": 6222365.0,
"step": 2770
},
{
"entropy": 5.446313963996039,
"epoch": 3.0,
"grad_norm": 2.078125,
"learning_rate": 0.00045046804252940294,
"loss": 5.3448,
"mean_token_accuracy": 0.19321518474155003,
"num_tokens": 6230667.0,
"step": 2775
},
{
"entropy": 5.500533962249756,
"epoch": 3.005408328826393,
"grad_norm": 1.0,
"learning_rate": 0.00045019923928898644,
"loss": 5.0612,
"mean_token_accuracy": 0.19457762837409973,
"num_tokens": 6241678.0,
"step": 2780
},
{
"entropy": 5.321163845062256,
"epoch": 3.0108166576527853,
"grad_norm": 1.015625,
"learning_rate": 0.0004499297993741294,
"loss": 5.0075,
"mean_token_accuracy": 0.19694564640522003,
"num_tokens": 6253541.0,
"step": 2785
},
{
"entropy": 5.432270860671997,
"epoch": 3.016224986479178,
"grad_norm": 1.0390625,
"learning_rate": 0.0004496597237639773,
"loss": 5.0,
"mean_token_accuracy": 0.19926079362630844,
"num_tokens": 6265590.0,
"step": 2790
},
{
"entropy": 5.444063663482666,
"epoch": 3.0216333153055706,
"grad_norm": 1.09375,
"learning_rate": 0.00044938901343998536,
"loss": 5.0456,
"mean_token_accuracy": 0.20204200297594072,
"num_tokens": 6276129.0,
"step": 2795
},
{
"entropy": 5.414129114151001,
"epoch": 3.0270416441319634,
"grad_norm": 1.1171875,
"learning_rate": 0.0004491176693859156,
"loss": 4.9712,
"mean_token_accuracy": 0.2101418912410736,
"num_tokens": 6286770.0,
"step": 2800
},
{
"entropy": 5.4351158618927,
"epoch": 3.032449972958356,
"grad_norm": 1.015625,
"learning_rate": 0.0004488456925878329,
"loss": 5.0645,
"mean_token_accuracy": 0.19975790232419968,
"num_tokens": 6298276.0,
"step": 2805
},
{
"entropy": 5.424533796310425,
"epoch": 3.0378583017847487,
"grad_norm": 1.0859375,
"learning_rate": 0.00044857308403410163,
"loss": 5.0436,
"mean_token_accuracy": 0.20333951115608215,
"num_tokens": 6308856.0,
"step": 2810
},
{
"entropy": 5.381372022628784,
"epoch": 3.043266630611141,
"grad_norm": 1.0078125,
"learning_rate": 0.00044829984471538183,
"loss": 5.0321,
"mean_token_accuracy": 0.2041509985923767,
"num_tokens": 6320386.0,
"step": 2815
},
{
"entropy": 5.4244366645812985,
"epoch": 3.048674959437534,
"grad_norm": 1.046875,
"learning_rate": 0.0004480259756246258,
"loss": 4.9969,
"mean_token_accuracy": 0.19859097748994828,
"num_tokens": 6332164.0,
"step": 2820
},
{
"entropy": 5.294694423675537,
"epoch": 3.0540832882639264,
"grad_norm": 1.0859375,
"learning_rate": 0.00044775147775707465,
"loss": 5.0078,
"mean_token_accuracy": 0.20580752789974213,
"num_tokens": 6343828.0,
"step": 2825
},
{
"entropy": 5.371400594711304,
"epoch": 3.0594916170903192,
"grad_norm": 1.078125,
"learning_rate": 0.000447476352110254,
"loss": 5.0844,
"mean_token_accuracy": 0.19515798091888428,
"num_tokens": 6355366.0,
"step": 2830
},
{
"entropy": 5.433107185363769,
"epoch": 3.0648999459167117,
"grad_norm": 1.1015625,
"learning_rate": 0.0004472005996839712,
"loss": 5.0519,
"mean_token_accuracy": 0.21033187359571456,
"num_tokens": 6365270.0,
"step": 2835
},
{
"entropy": 5.351367807388305,
"epoch": 3.0703082747431045,
"grad_norm": 1.21875,
"learning_rate": 0.0004469242214803112,
"loss": 5.0275,
"mean_token_accuracy": 0.21128651946783067,
"num_tokens": 6376180.0,
"step": 2840
},
{
"entropy": 5.407835197448731,
"epoch": 3.075716603569497,
"grad_norm": 1.1484375,
"learning_rate": 0.0004466472185036331,
"loss": 4.9536,
"mean_token_accuracy": 0.2117062970995903,
"num_tokens": 6387068.0,
"step": 2845
},
{
"entropy": 5.414833641052246,
"epoch": 3.08112493239589,
"grad_norm": 1.125,
"learning_rate": 0.0004463695917605663,
"loss": 5.021,
"mean_token_accuracy": 0.20732709020376205,
"num_tokens": 6397540.0,
"step": 2850
},
{
"entropy": 5.340751600265503,
"epoch": 3.086533261222282,
"grad_norm": 0.98046875,
"learning_rate": 0.000446091342260007,
"loss": 5.1168,
"mean_token_accuracy": 0.19058479368686676,
"num_tokens": 6410039.0,
"step": 2855
},
{
"entropy": 5.416444110870361,
"epoch": 3.091941590048675,
"grad_norm": 1.0546875,
"learning_rate": 0.0004458124710131145,
"loss": 4.9762,
"mean_token_accuracy": 0.20852354317903518,
"num_tokens": 6420964.0,
"step": 2860
},
{
"entropy": 5.380699825286865,
"epoch": 3.0973499188750675,
"grad_norm": 1.1171875,
"learning_rate": 0.00044553297903330766,
"loss": 5.1075,
"mean_token_accuracy": 0.19606724083423616,
"num_tokens": 6432752.0,
"step": 2865
},
{
"entropy": 5.475742959976197,
"epoch": 3.1027582477014604,
"grad_norm": 1.1796875,
"learning_rate": 0.00044525286733626085,
"loss": 5.0334,
"mean_token_accuracy": 0.2051415890455246,
"num_tokens": 6443899.0,
"step": 2870
},
{
"entropy": 5.429310083389282,
"epoch": 3.1081665765278528,
"grad_norm": 1.15625,
"learning_rate": 0.0004449721369399008,
"loss": 5.1134,
"mean_token_accuracy": 0.1922602593898773,
"num_tokens": 6454133.0,
"step": 2875
},
{
"entropy": 5.352643203735352,
"epoch": 3.1135749053542456,
"grad_norm": 1.078125,
"learning_rate": 0.00044469078886440227,
"loss": 5.0354,
"mean_token_accuracy": 0.19823043793439865,
"num_tokens": 6467574.0,
"step": 2880
},
{
"entropy": 5.444091510772705,
"epoch": 3.118983234180638,
"grad_norm": 1.09375,
"learning_rate": 0.00044440882413218484,
"loss": 5.074,
"mean_token_accuracy": 0.19586091190576554,
"num_tokens": 6479399.0,
"step": 2885
},
{
"entropy": 5.340216112136841,
"epoch": 3.124391563007031,
"grad_norm": 1.1328125,
"learning_rate": 0.00044412624376790905,
"loss": 4.8886,
"mean_token_accuracy": 0.21345536708831786,
"num_tokens": 6489590.0,
"step": 2890
},
{
"entropy": 5.401822757720947,
"epoch": 3.1297998918334233,
"grad_norm": 1.125,
"learning_rate": 0.0004438430487984726,
"loss": 5.0282,
"mean_token_accuracy": 0.20397695451974868,
"num_tokens": 6500689.0,
"step": 2895
},
{
"entropy": 5.340320634841919,
"epoch": 3.135208220659816,
"grad_norm": 1.0625,
"learning_rate": 0.0004435592402530066,
"loss": 5.0095,
"mean_token_accuracy": 0.20189974159002305,
"num_tokens": 6511190.0,
"step": 2900
},
{
"entropy": 5.328754806518555,
"epoch": 3.1406165494862086,
"grad_norm": 1.0703125,
"learning_rate": 0.000443274819162872,
"loss": 4.9895,
"mean_token_accuracy": 0.20199992805719375,
"num_tokens": 6522288.0,
"step": 2905
},
{
"entropy": 5.396235084533691,
"epoch": 3.1460248783126015,
"grad_norm": 1.1015625,
"learning_rate": 0.0004429897865616557,
"loss": 5.0095,
"mean_token_accuracy": 0.2032381221652031,
"num_tokens": 6534391.0,
"step": 2910
},
{
"entropy": 5.3877345561981205,
"epoch": 3.151433207138994,
"grad_norm": 1.1015625,
"learning_rate": 0.0004427041434851668,
"loss": 4.9899,
"mean_token_accuracy": 0.207269649207592,
"num_tokens": 6546191.0,
"step": 2915
},
{
"entropy": 5.385879850387573,
"epoch": 3.1568415359653867,
"grad_norm": 1.140625,
"learning_rate": 0.00044241789097143293,
"loss": 5.1539,
"mean_token_accuracy": 0.18838376700878143,
"num_tokens": 6558118.0,
"step": 2920
},
{
"entropy": 5.319383335113526,
"epoch": 3.162249864791779,
"grad_norm": 1.09375,
"learning_rate": 0.00044213103006069635,
"loss": 5.0371,
"mean_token_accuracy": 0.20676176995038986,
"num_tokens": 6568636.0,
"step": 2925
},
{
"entropy": 5.447977113723755,
"epoch": 3.167658193618172,
"grad_norm": 1.15625,
"learning_rate": 0.00044184356179541035,
"loss": 5.0624,
"mean_token_accuracy": 0.20269704908132552,
"num_tokens": 6579710.0,
"step": 2930
},
{
"entropy": 5.385798645019531,
"epoch": 3.1730665224445644,
"grad_norm": 1.1953125,
"learning_rate": 0.0004415554872202352,
"loss": 5.0467,
"mean_token_accuracy": 0.20548543632030486,
"num_tokens": 6590574.0,
"step": 2935
},
{
"entropy": 5.405917978286743,
"epoch": 3.1784748512709573,
"grad_norm": 1.0546875,
"learning_rate": 0.00044126680738203466,
"loss": 5.1356,
"mean_token_accuracy": 0.19349176585674285,
"num_tokens": 6601637.0,
"step": 2940
},
{
"entropy": 5.360622119903565,
"epoch": 3.1838831800973497,
"grad_norm": 1.078125,
"learning_rate": 0.0004409775233298718,
"loss": 4.9065,
"mean_token_accuracy": 0.21671828478574753,
"num_tokens": 6611958.0,
"step": 2945
},
{
"entropy": 5.419522380828857,
"epoch": 3.1892915089237426,
"grad_norm": 1.1953125,
"learning_rate": 0.0004406876361150056,
"loss": 5.1699,
"mean_token_accuracy": 0.1909557670354843,
"num_tokens": 6623228.0,
"step": 2950
},
{
"entropy": 5.399460935592652,
"epoch": 3.194699837750135,
"grad_norm": 1.0859375,
"learning_rate": 0.0004403971467908869,
"loss": 5.0989,
"mean_token_accuracy": 0.199129718542099,
"num_tokens": 6633437.0,
"step": 2955
},
{
"entropy": 5.443213653564453,
"epoch": 3.200108166576528,
"grad_norm": 1.1015625,
"learning_rate": 0.0004401060564131545,
"loss": 5.0749,
"mean_token_accuracy": 0.19572130888700484,
"num_tokens": 6644605.0,
"step": 2960
},
{
"entropy": 5.34327507019043,
"epoch": 3.2055164954029207,
"grad_norm": 1.0390625,
"learning_rate": 0.0004398143660396315,
"loss": 5.1341,
"mean_token_accuracy": 0.19737862199544906,
"num_tokens": 6656457.0,
"step": 2965
},
{
"entropy": 5.454725503921509,
"epoch": 3.210924824229313,
"grad_norm": 1.1953125,
"learning_rate": 0.0004395220767303215,
"loss": 5.0676,
"mean_token_accuracy": 0.20159655213356018,
"num_tokens": 6667741.0,
"step": 2970
},
{
"entropy": 5.313960456848145,
"epoch": 3.2163331530557056,
"grad_norm": 1.15625,
"learning_rate": 0.0004392291895474045,
"loss": 5.0565,
"mean_token_accuracy": 0.20246104747056962,
"num_tokens": 6679111.0,
"step": 2975
},
{
"entropy": 5.359478759765625,
"epoch": 3.2217414818820984,
"grad_norm": 1.1484375,
"learning_rate": 0.0004389357055552331,
"loss": 4.9841,
"mean_token_accuracy": 0.2107232466340065,
"num_tokens": 6689960.0,
"step": 2980
},
{
"entropy": 5.3306825160980225,
"epoch": 3.2271498107084913,
"grad_norm": 1.078125,
"learning_rate": 0.00043864162582032897,
"loss": 5.0199,
"mean_token_accuracy": 0.19566542357206346,
"num_tokens": 6701163.0,
"step": 2985
},
{
"entropy": 5.3011407375335695,
"epoch": 3.2325581395348837,
"grad_norm": 1.1328125,
"learning_rate": 0.0004383469514113784,
"loss": 5.0126,
"mean_token_accuracy": 0.20581124275922774,
"num_tokens": 6712466.0,
"step": 2990
},
{
"entropy": 5.294154405593872,
"epoch": 3.2379664683612766,
"grad_norm": 1.015625,
"learning_rate": 0.0004380516833992289,
"loss": 5.1264,
"mean_token_accuracy": 0.19787818789482117,
"num_tokens": 6724772.0,
"step": 2995
},
{
"entropy": 5.3787847518920895,
"epoch": 3.243374797187669,
"grad_norm": 1.1328125,
"learning_rate": 0.000437755822856885,
"loss": 5.02,
"mean_token_accuracy": 0.20379386097192764,
"num_tokens": 6733953.0,
"step": 3000
},
{
"epoch": 3.243374797187669,
"eval_entropy": 5.224143935333599,
"eval_loss": 5.921028137207031,
"eval_mean_token_accuracy": 0.17506341190839356,
"eval_num_tokens": 6733953.0,
"eval_runtime": 2.5049,
"eval_samples_per_second": 1403.274,
"eval_steps_per_second": 175.659,
"step": 3000
},
{
"entropy": 5.2676568031311035,
"epoch": 3.248783126014062,
"grad_norm": 1.25,
"learning_rate": 0.0004374593708595049,
"loss": 5.0449,
"mean_token_accuracy": 0.2021145209670067,
"num_tokens": 6744547.0,
"step": 3005
},
{
"entropy": 5.396162366867065,
"epoch": 3.2541914548404542,
"grad_norm": 1.15625,
"learning_rate": 0.00043716232848439555,
"loss": 5.0455,
"mean_token_accuracy": 0.1995744898915291,
"num_tokens": 6754449.0,
"step": 3010
},
{
"entropy": 5.330850076675415,
"epoch": 3.259599783666847,
"grad_norm": 1.0859375,
"learning_rate": 0.00043686469681100985,
"loss": 5.0196,
"mean_token_accuracy": 0.2076788067817688,
"num_tokens": 6765928.0,
"step": 3015
},
{
"entropy": 5.3013042449951175,
"epoch": 3.2650081124932395,
"grad_norm": 1.0390625,
"learning_rate": 0.00043656647692094186,
"loss": 5.0802,
"mean_token_accuracy": 0.20154703706502913,
"num_tokens": 6776908.0,
"step": 3020
},
{
"entropy": 5.408453559875488,
"epoch": 3.2704164413196324,
"grad_norm": 1.1328125,
"learning_rate": 0.0004362676698979233,
"loss": 5.1558,
"mean_token_accuracy": 0.19500250667333602,
"num_tokens": 6788175.0,
"step": 3025
},
{
"entropy": 5.39493317604065,
"epoch": 3.275824770146025,
"grad_norm": 1.0625,
"learning_rate": 0.00043596827682781974,
"loss": 5.1343,
"mean_token_accuracy": 0.19319070726633072,
"num_tokens": 6799560.0,
"step": 3030
},
{
"entropy": 5.305244255065918,
"epoch": 3.2812330989724177,
"grad_norm": 1.1328125,
"learning_rate": 0.0004356682987986262,
"loss": 4.9697,
"mean_token_accuracy": 0.20725639313459396,
"num_tokens": 6810145.0,
"step": 3035
},
{
"entropy": 5.386528778076172,
"epoch": 3.28664142779881,
"grad_norm": 1.09375,
"learning_rate": 0.0004353677369004635,
"loss": 5.0744,
"mean_token_accuracy": 0.1908457398414612,
"num_tokens": 6821739.0,
"step": 3040
},
{
"entropy": 5.338420581817627,
"epoch": 3.292049756625203,
"grad_norm": 1.078125,
"learning_rate": 0.00043506659222557426,
"loss": 5.0048,
"mean_token_accuracy": 0.20620973855257035,
"num_tokens": 6832887.0,
"step": 3045
},
{
"entropy": 5.4134704113006595,
"epoch": 3.2974580854515954,
"grad_norm": 1.015625,
"learning_rate": 0.000434764865868319,
"loss": 5.2144,
"mean_token_accuracy": 0.19106176495552063,
"num_tokens": 6845213.0,
"step": 3050
},
{
"entropy": 5.34263505935669,
"epoch": 3.302866414277988,
"grad_norm": 1.109375,
"learning_rate": 0.000434462558925172,
"loss": 4.9743,
"mean_token_accuracy": 0.21372029185295105,
"num_tokens": 6854995.0,
"step": 3055
},
{
"entropy": 5.4191022396087645,
"epoch": 3.3082747431043806,
"grad_norm": 1.1484375,
"learning_rate": 0.00043415967249471734,
"loss": 5.1243,
"mean_token_accuracy": 0.1946757912635803,
"num_tokens": 6866955.0,
"step": 3060
},
{
"entropy": 5.406048107147217,
"epoch": 3.3136830719307735,
"grad_norm": 1.078125,
"learning_rate": 0.000433856207677645,
"loss": 5.0856,
"mean_token_accuracy": 0.20235285609960557,
"num_tokens": 6878616.0,
"step": 3065
},
{
"entropy": 5.3204652786254885,
"epoch": 3.319091400757166,
"grad_norm": 1.0859375,
"learning_rate": 0.000433552165576747,
"loss": 5.0321,
"mean_token_accuracy": 0.2025593638420105,
"num_tokens": 6888782.0,
"step": 3070
},
{
"entropy": 5.351485919952393,
"epoch": 3.3244997295835588,
"grad_norm": 1.0703125,
"learning_rate": 0.00043324754729691275,
"loss": 5.093,
"mean_token_accuracy": 0.1974854663014412,
"num_tokens": 6902210.0,
"step": 3075
},
{
"entropy": 5.401188325881958,
"epoch": 3.329908058409951,
"grad_norm": 1.1015625,
"learning_rate": 0.00043294235394512594,
"loss": 5.0887,
"mean_token_accuracy": 0.19142452329397203,
"num_tokens": 6913401.0,
"step": 3080
},
{
"entropy": 5.354645013809204,
"epoch": 3.335316387236344,
"grad_norm": 1.046875,
"learning_rate": 0.0004326365866304599,
"loss": 5.0617,
"mean_token_accuracy": 0.20191515386104583,
"num_tokens": 6924856.0,
"step": 3085
},
{
"entropy": 5.309537315368653,
"epoch": 3.3407247160627365,
"grad_norm": 1.0625,
"learning_rate": 0.0004323302464640738,
"loss": 5.0893,
"mean_token_accuracy": 0.20091366916894912,
"num_tokens": 6935302.0,
"step": 3090
},
{
"entropy": 5.381866455078125,
"epoch": 3.3461330448891293,
"grad_norm": 1.1171875,
"learning_rate": 0.00043202333455920843,
"loss": 5.0717,
"mean_token_accuracy": 0.198678158223629,
"num_tokens": 6945837.0,
"step": 3095
},
{
"entropy": 5.398984670639038,
"epoch": 3.3515413737155217,
"grad_norm": 1.15625,
"learning_rate": 0.0004317158520311824,
"loss": 5.1032,
"mean_token_accuracy": 0.2020411342382431,
"num_tokens": 6956221.0,
"step": 3100
},
{
"entropy": 5.310973501205444,
"epoch": 3.3569497025419146,
"grad_norm": 0.9921875,
"learning_rate": 0.0004314077999973879,
"loss": 5.0103,
"mean_token_accuracy": 0.20416862070560454,
"num_tokens": 6968317.0,
"step": 3105
},
{
"entropy": 5.393985843658447,
"epoch": 3.362358031368307,
"grad_norm": 1.109375,
"learning_rate": 0.0004310991795772869,
"loss": 5.0689,
"mean_token_accuracy": 0.20844984501600267,
"num_tokens": 6978304.0,
"step": 3110
},
{
"entropy": 5.438141393661499,
"epoch": 3.3677663601947,
"grad_norm": 1.109375,
"learning_rate": 0.0004307899918924065,
"loss": 5.1503,
"mean_token_accuracy": 0.1999391123652458,
"num_tokens": 6989063.0,
"step": 3115
},
{
"entropy": 5.347791481018066,
"epoch": 3.3731746890210923,
"grad_norm": 1.15625,
"learning_rate": 0.0004304802380663356,
"loss": 5.0554,
"mean_token_accuracy": 0.20068423449993134,
"num_tokens": 7000762.0,
"step": 3120
},
{
"entropy": 5.448616695404053,
"epoch": 3.378583017847485,
"grad_norm": 1.078125,
"learning_rate": 0.00043016991922472015,
"loss": 5.2142,
"mean_token_accuracy": 0.1960676819086075,
"num_tokens": 7012238.0,
"step": 3125
},
{
"entropy": 5.358468246459961,
"epoch": 3.383991346673878,
"grad_norm": 1.1796875,
"learning_rate": 0.00042985903649525977,
"loss": 5.0209,
"mean_token_accuracy": 0.21026236861944197,
"num_tokens": 7024349.0,
"step": 3130
},
{
"entropy": 5.253860092163086,
"epoch": 3.3893996755002704,
"grad_norm": 1.1015625,
"learning_rate": 0.00042954759100770275,
"loss": 4.9976,
"mean_token_accuracy": 0.19977659732103348,
"num_tokens": 7035281.0,
"step": 3135
},
{
"entropy": 5.226740074157715,
"epoch": 3.394808004326663,
"grad_norm": 1.0234375,
"learning_rate": 0.00042923558389384303,
"loss": 4.9486,
"mean_token_accuracy": 0.20696604996919632,
"num_tokens": 7046450.0,
"step": 3140
},
{
"entropy": 5.278026151657104,
"epoch": 3.4002163331530557,
"grad_norm": 1.15625,
"learning_rate": 0.0004289230162875149,
"loss": 4.9932,
"mean_token_accuracy": 0.20639362037181855,
"num_tokens": 7056723.0,
"step": 3145
},
{
"entropy": 5.331745910644531,
"epoch": 3.4056246619794486,
"grad_norm": 0.953125,
"learning_rate": 0.00042860988932458987,
"loss": 5.1214,
"mean_token_accuracy": 0.19809407293796538,
"num_tokens": 7068983.0,
"step": 3150
},
{
"entropy": 5.285477256774902,
"epoch": 3.411032990805841,
"grad_norm": 1.2421875,
"learning_rate": 0.0004282962041429721,
"loss": 5.0399,
"mean_token_accuracy": 0.19926306158304213,
"num_tokens": 7079544.0,
"step": 3155
},
{
"entropy": 5.311891651153564,
"epoch": 3.4164413196322334,
"grad_norm": 1.015625,
"learning_rate": 0.00042798196188259427,
"loss": 5.0566,
"mean_token_accuracy": 0.20001289993524551,
"num_tokens": 7091845.0,
"step": 3160
},
{
"entropy": 5.391391372680664,
"epoch": 3.4218496484586263,
"grad_norm": 1.078125,
"learning_rate": 0.0004276671636854133,
"loss": 5.1254,
"mean_token_accuracy": 0.20151020288467408,
"num_tokens": 7103780.0,
"step": 3165
},
{
"entropy": 5.327012395858764,
"epoch": 3.427257977285019,
"grad_norm": 1.0859375,
"learning_rate": 0.00042735181069540677,
"loss": 5.0259,
"mean_token_accuracy": 0.20835089385509492,
"num_tokens": 7116346.0,
"step": 3170
},
{
"entropy": 5.413862466812134,
"epoch": 3.4326663061114115,
"grad_norm": 0.9609375,
"learning_rate": 0.0004270359040585681,
"loss": 5.1559,
"mean_token_accuracy": 0.20038951337337493,
"num_tokens": 7128383.0,
"step": 3175
},
{
"entropy": 5.378864908218384,
"epoch": 3.4380746349378044,
"grad_norm": 1.1640625,
"learning_rate": 0.00042671944492290277,
"loss": 5.0952,
"mean_token_accuracy": 0.19952357262372972,
"num_tokens": 7139841.0,
"step": 3180
},
{
"entropy": 5.44992504119873,
"epoch": 3.443482963764197,
"grad_norm": 0.98828125,
"learning_rate": 0.0004264024344384239,
"loss": 5.2175,
"mean_token_accuracy": 0.1943944960832596,
"num_tokens": 7152363.0,
"step": 3185
},
{
"entropy": 5.180116653442383,
"epoch": 3.4488912925905897,
"grad_norm": 1.1171875,
"learning_rate": 0.00042608487375714847,
"loss": 4.9129,
"mean_token_accuracy": 0.20698372423648834,
"num_tokens": 7162500.0,
"step": 3190
},
{
"entropy": 5.3649712085723875,
"epoch": 3.454299621416982,
"grad_norm": 1.0390625,
"learning_rate": 0.00042576676403309265,
"loss": 5.1567,
"mean_token_accuracy": 0.19376561939716339,
"num_tokens": 7174996.0,
"step": 3195
},
{
"entropy": 5.329015827178955,
"epoch": 3.459707950243375,
"grad_norm": 1.09375,
"learning_rate": 0.0004254481064222679,
"loss": 4.9916,
"mean_token_accuracy": 0.2082139164209366,
"num_tokens": 7185078.0,
"step": 3200
},
{
"entropy": 5.402175378799439,
"epoch": 3.4651162790697674,
"grad_norm": 1.203125,
"learning_rate": 0.00042512890208267677,
"loss": 5.1729,
"mean_token_accuracy": 0.19327713102102279,
"num_tokens": 7196268.0,
"step": 3205
},
{
"entropy": 5.340206575393677,
"epoch": 3.4705246078961602,
"grad_norm": 1.1015625,
"learning_rate": 0.00042480915217430853,
"loss": 5.1294,
"mean_token_accuracy": 0.20094281882047654,
"num_tokens": 7207597.0,
"step": 3210
},
{
"entropy": 5.35001311302185,
"epoch": 3.4759329367225527,
"grad_norm": 1.015625,
"learning_rate": 0.00042448885785913507,
"loss": 5.0338,
"mean_token_accuracy": 0.20565392225980758,
"num_tokens": 7218765.0,
"step": 3215
},
{
"entropy": 5.23657193183899,
"epoch": 3.4813412655489455,
"grad_norm": 1.046875,
"learning_rate": 0.00042416802030110677,
"loss": 5.0378,
"mean_token_accuracy": 0.20561073273420333,
"num_tokens": 7231242.0,
"step": 3220
},
{
"entropy": 5.378603458404541,
"epoch": 3.486749594375338,
"grad_norm": 1.09375,
"learning_rate": 0.00042384664066614787,
"loss": 5.0778,
"mean_token_accuracy": 0.19592965245246888,
"num_tokens": 7241689.0,
"step": 3225
},
{
"entropy": 5.362082147598267,
"epoch": 3.492157923201731,
"grad_norm": 1.09375,
"learning_rate": 0.0004235247201221528,
"loss": 5.1541,
"mean_token_accuracy": 0.19654099494218827,
"num_tokens": 7252565.0,
"step": 3230
},
{
"entropy": 5.372237586975098,
"epoch": 3.497566252028123,
"grad_norm": 1.1640625,
"learning_rate": 0.0004232022598389816,
"loss": 5.0981,
"mean_token_accuracy": 0.19729824960231782,
"num_tokens": 7264520.0,
"step": 3235
},
{
"entropy": 5.373393726348877,
"epoch": 3.502974580854516,
"grad_norm": 1.109375,
"learning_rate": 0.0004228792609884557,
"loss": 5.1104,
"mean_token_accuracy": 0.1994604468345642,
"num_tokens": 7276119.0,
"step": 3240
},
{
"entropy": 5.356141376495361,
"epoch": 3.5083829096809085,
"grad_norm": 0.98828125,
"learning_rate": 0.00042255572474435364,
"loss": 5.0909,
"mean_token_accuracy": 0.1965806797146797,
"num_tokens": 7288181.0,
"step": 3245
},
{
"entropy": 5.311535978317261,
"epoch": 3.5137912385073014,
"grad_norm": 1.1640625,
"learning_rate": 0.0004222316522824069,
"loss": 5.0918,
"mean_token_accuracy": 0.20014596432447435,
"num_tokens": 7299975.0,
"step": 3250
},
{
"entropy": 5.421269941329956,
"epoch": 3.5191995673336938,
"grad_norm": 1.1796875,
"learning_rate": 0.0004219070447802955,
"loss": 5.0964,
"mean_token_accuracy": 0.1998756691813469,
"num_tokens": 7310345.0,
"step": 3255
},
{
"entropy": 5.257654047012329,
"epoch": 3.5246078961600866,
"grad_norm": 1.1328125,
"learning_rate": 0.00042158190341764384,
"loss": 5.0198,
"mean_token_accuracy": 0.20225510150194168,
"num_tokens": 7321018.0,
"step": 3260
},
{
"entropy": 5.247340106964112,
"epoch": 3.530016224986479,
"grad_norm": 1.125,
"learning_rate": 0.00042125622937601645,
"loss": 5.005,
"mean_token_accuracy": 0.21300950646400452,
"num_tokens": 7331509.0,
"step": 3265
},
{
"entropy": 5.320905113220215,
"epoch": 3.535424553812872,
"grad_norm": 1.09375,
"learning_rate": 0.0004209300238389135,
"loss": 4.9758,
"mean_token_accuracy": 0.2097022145986557,
"num_tokens": 7342523.0,
"step": 3270
},
{
"entropy": 5.285821199417114,
"epoch": 3.5408328826392643,
"grad_norm": 1.078125,
"learning_rate": 0.0004206032879917667,
"loss": 5.0686,
"mean_token_accuracy": 0.20199986696243286,
"num_tokens": 7353758.0,
"step": 3275
},
{
"entropy": 5.298578596115112,
"epoch": 3.546241211465657,
"grad_norm": 1.1015625,
"learning_rate": 0.0004202760230219348,
"loss": 5.1172,
"mean_token_accuracy": 0.19739769995212555,
"num_tokens": 7366119.0,
"step": 3280
},
{
"entropy": 5.390467166900635,
"epoch": 3.5516495402920496,
"grad_norm": 1.03125,
"learning_rate": 0.00041994823011869955,
"loss": 5.2313,
"mean_token_accuracy": 0.19639483392238616,
"num_tokens": 7379464.0,
"step": 3285
},
{
"entropy": 5.360622501373291,
"epoch": 3.5570578691184425,
"grad_norm": 1.1328125,
"learning_rate": 0.00041961991047326116,
"loss": 5.0752,
"mean_token_accuracy": 0.2024195298552513,
"num_tokens": 7391825.0,
"step": 3290
},
{
"entropy": 5.323080968856812,
"epoch": 3.5624661979448353,
"grad_norm": 1.171875,
"learning_rate": 0.0004192910652787338,
"loss": 5.0443,
"mean_token_accuracy": 0.20436202883720397,
"num_tokens": 7403187.0,
"step": 3295
},
{
"entropy": 5.304663610458374,
"epoch": 3.5678745267712277,
"grad_norm": 1.0546875,
"learning_rate": 0.0004189616957301419,
"loss": 5.0547,
"mean_token_accuracy": 0.1995916932821274,
"num_tokens": 7414927.0,
"step": 3300
},
{
"entropy": 5.342061185836792,
"epoch": 3.57328285559762,
"grad_norm": 1.078125,
"learning_rate": 0.0004186318030244149,
"loss": 5.0948,
"mean_token_accuracy": 0.1974277138710022,
"num_tokens": 7426894.0,
"step": 3305
},
{
"entropy": 5.338034200668335,
"epoch": 3.578691184424013,
"grad_norm": 1.0625,
"learning_rate": 0.00041830138836038383,
"loss": 4.951,
"mean_token_accuracy": 0.21454257369041443,
"num_tokens": 7437209.0,
"step": 3310
},
{
"entropy": 5.381253337860107,
"epoch": 3.584099513250406,
"grad_norm": 1.2109375,
"learning_rate": 0.0004179704529387763,
"loss": 5.084,
"mean_token_accuracy": 0.20151952058076858,
"num_tokens": 7448560.0,
"step": 3315
},
{
"entropy": 5.238864994049072,
"epoch": 3.5895078420767983,
"grad_norm": 1.0390625,
"learning_rate": 0.0004176389979622125,
"loss": 5.0282,
"mean_token_accuracy": 0.20845210552215576,
"num_tokens": 7460843.0,
"step": 3320
},
{
"entropy": 5.29174280166626,
"epoch": 3.5949161709031907,
"grad_norm": 1.0078125,
"learning_rate": 0.0004173070246352003,
"loss": 5.0307,
"mean_token_accuracy": 0.20860967934131622,
"num_tokens": 7472924.0,
"step": 3325
},
{
"entropy": 5.322065830230713,
"epoch": 3.6003244997295836,
"grad_norm": 1.1328125,
"learning_rate": 0.00041697453416413184,
"loss": 5.112,
"mean_token_accuracy": 0.1986359804868698,
"num_tokens": 7485189.0,
"step": 3330
},
{
"entropy": 5.290145492553711,
"epoch": 3.6057328285559764,
"grad_norm": 1.1328125,
"learning_rate": 0.000416641527757278,
"loss": 5.0885,
"mean_token_accuracy": 0.2006947621703148,
"num_tokens": 7495608.0,
"step": 3335
},
{
"entropy": 5.35534701347351,
"epoch": 3.611141157382369,
"grad_norm": 1.234375,
"learning_rate": 0.00041630800662478514,
"loss": 5.0863,
"mean_token_accuracy": 0.2016560599207878,
"num_tokens": 7506867.0,
"step": 3340
},
{
"entropy": 5.293708848953247,
"epoch": 3.6165494862087613,
"grad_norm": 1.1171875,
"learning_rate": 0.00041597397197866957,
"loss": 5.1283,
"mean_token_accuracy": 0.19478587061166763,
"num_tokens": 7517923.0,
"step": 3345
},
{
"entropy": 5.360723495483398,
"epoch": 3.621957815035154,
"grad_norm": 1.09375,
"learning_rate": 0.0004156394250328141,
"loss": 5.1438,
"mean_token_accuracy": 0.19603629857301713,
"num_tokens": 7528205.0,
"step": 3350
},
{
"entropy": 5.372031354904175,
"epoch": 3.627366143861547,
"grad_norm": 1.1171875,
"learning_rate": 0.000415304367002963,
"loss": 5.0791,
"mean_token_accuracy": 0.2009880319237709,
"num_tokens": 7539846.0,
"step": 3355
},
{
"entropy": 5.323767900466919,
"epoch": 3.6327744726879394,
"grad_norm": 1.1015625,
"learning_rate": 0.00041496879910671796,
"loss": 5.0552,
"mean_token_accuracy": 0.20095243453979492,
"num_tokens": 7550731.0,
"step": 3360
},
{
"entropy": 5.3896807670593265,
"epoch": 3.638182801514332,
"grad_norm": 1.0703125,
"learning_rate": 0.0004146327225635336,
"loss": 5.12,
"mean_token_accuracy": 0.19738423079252243,
"num_tokens": 7562283.0,
"step": 3365
},
{
"entropy": 5.3548308372497555,
"epoch": 3.6435911303407247,
"grad_norm": 0.984375,
"learning_rate": 0.0004142961385947127,
"loss": 5.1471,
"mean_token_accuracy": 0.19754419326782227,
"num_tokens": 7574361.0,
"step": 3370
},
{
"entropy": 5.3689981460571286,
"epoch": 3.6489994591671175,
"grad_norm": 1.25,
"learning_rate": 0.00041395904842340215,
"loss": 5.0956,
"mean_token_accuracy": 0.2011457070708275,
"num_tokens": 7583870.0,
"step": 3375
},
{
"entropy": 5.447643852233886,
"epoch": 3.65440778799351,
"grad_norm": 1.0859375,
"learning_rate": 0.0004136214532745887,
"loss": 5.2105,
"mean_token_accuracy": 0.19217262268066407,
"num_tokens": 7595827.0,
"step": 3380
},
{
"entropy": 5.277579689025879,
"epoch": 3.6598161168199024,
"grad_norm": 1.234375,
"learning_rate": 0.0004132833543750936,
"loss": 5.0448,
"mean_token_accuracy": 0.20935163497924805,
"num_tokens": 7606294.0,
"step": 3385
},
{
"entropy": 5.250435018539429,
"epoch": 3.6652244456462952,
"grad_norm": 1.1015625,
"learning_rate": 0.00041294475295356917,
"loss": 5.0797,
"mean_token_accuracy": 0.1973802253603935,
"num_tokens": 7617920.0,
"step": 3390
},
{
"entropy": 5.290333986282349,
"epoch": 3.670632774472688,
"grad_norm": 1.109375,
"learning_rate": 0.0004126056502404937,
"loss": 5.0066,
"mean_token_accuracy": 0.20787014961242675,
"num_tokens": 7628983.0,
"step": 3395
},
{
"entropy": 5.309329795837402,
"epoch": 3.6760411032990805,
"grad_norm": 1.1015625,
"learning_rate": 0.0004122660474681672,
"loss": 5.0881,
"mean_token_accuracy": 0.20126838088035584,
"num_tokens": 7639596.0,
"step": 3400
},
{
"entropy": 5.291783237457276,
"epoch": 3.6814494321254734,
"grad_norm": 1.140625,
"learning_rate": 0.00041192594587070706,
"loss": 5.0608,
"mean_token_accuracy": 0.20146431177854537,
"num_tokens": 7650019.0,
"step": 3405
},
{
"entropy": 5.334015846252441,
"epoch": 3.686857760951866,
"grad_norm": 1.0859375,
"learning_rate": 0.00041158534668404325,
"loss": 5.0673,
"mean_token_accuracy": 0.20519835948944093,
"num_tokens": 7661534.0,
"step": 3410
},
{
"entropy": 5.354724931716919,
"epoch": 3.6922660897782587,
"grad_norm": 1.03125,
"learning_rate": 0.00041124425114591386,
"loss": 5.0111,
"mean_token_accuracy": 0.1982477307319641,
"num_tokens": 7672716.0,
"step": 3415
},
{
"entropy": 5.270970296859741,
"epoch": 3.697674418604651,
"grad_norm": 1.109375,
"learning_rate": 0.00041090266049586107,
"loss": 5.1092,
"mean_token_accuracy": 0.20256560146808625,
"num_tokens": 7684228.0,
"step": 3420
},
{
"entropy": 5.381613397598267,
"epoch": 3.703082747431044,
"grad_norm": 1.0390625,
"learning_rate": 0.0004105605759752258,
"loss": 5.0739,
"mean_token_accuracy": 0.19580450654029846,
"num_tokens": 7695983.0,
"step": 3425
},
{
"entropy": 5.276859521865845,
"epoch": 3.7084910762574363,
"grad_norm": 0.99609375,
"learning_rate": 0.00041021799882714436,
"loss": 5.0764,
"mean_token_accuracy": 0.20103933662176132,
"num_tokens": 7708201.0,
"step": 3430
},
{
"entropy": 5.229123497009278,
"epoch": 3.713899405083829,
"grad_norm": 1.0859375,
"learning_rate": 0.0004098749302965426,
"loss": 5.0339,
"mean_token_accuracy": 0.19539251774549485,
"num_tokens": 7719041.0,
"step": 3435
},
{
"entropy": 5.294345092773438,
"epoch": 3.7193077339102216,
"grad_norm": 1.1171875,
"learning_rate": 0.0004095313716301324,
"loss": 5.0497,
"mean_token_accuracy": 0.20264862477779388,
"num_tokens": 7729751.0,
"step": 3440
},
{
"entropy": 5.243863487243653,
"epoch": 3.7247160627366145,
"grad_norm": 1.1015625,
"learning_rate": 0.0004091873240764069,
"loss": 4.9812,
"mean_token_accuracy": 0.21261585354804993,
"num_tokens": 7740898.0,
"step": 3445
},
{
"entropy": 5.3098616123199465,
"epoch": 3.730124391563007,
"grad_norm": 1.1015625,
"learning_rate": 0.00040884278888563566,
"loss": 5.1706,
"mean_token_accuracy": 0.20178489983081818,
"num_tokens": 7752214.0,
"step": 3450
},
{
"entropy": 5.315207862854004,
"epoch": 3.7355327203893998,
"grad_norm": 1.0546875,
"learning_rate": 0.00040849776730986014,
"loss": 5.0101,
"mean_token_accuracy": 0.20696818232536315,
"num_tokens": 7763221.0,
"step": 3455
},
{
"entropy": 5.355162048339844,
"epoch": 3.740941049215792,
"grad_norm": 1.0859375,
"learning_rate": 0.0004081522606028899,
"loss": 5.0738,
"mean_token_accuracy": 0.20055561661720275,
"num_tokens": 7774046.0,
"step": 3460
},
{
"entropy": 5.327772903442383,
"epoch": 3.746349378042185,
"grad_norm": 1.0625,
"learning_rate": 0.00040780627002029674,
"loss": 5.1525,
"mean_token_accuracy": 0.2019985407590866,
"num_tokens": 7784796.0,
"step": 3465
},
{
"entropy": 5.29678316116333,
"epoch": 3.7517577068685775,
"grad_norm": 1.140625,
"learning_rate": 0.0004074597968194116,
"loss": 5.0818,
"mean_token_accuracy": 0.20466591268777848,
"num_tokens": 7795370.0,
"step": 3470
},
{
"entropy": 5.4258557796478275,
"epoch": 3.7571660356949703,
"grad_norm": 1.046875,
"learning_rate": 0.0004071128422593186,
"loss": 5.1186,
"mean_token_accuracy": 0.2024161234498024,
"num_tokens": 7805634.0,
"step": 3475
},
{
"entropy": 5.327988815307617,
"epoch": 3.7625743645213627,
"grad_norm": 1.09375,
"learning_rate": 0.0004067654076008515,
"loss": 5.0653,
"mean_token_accuracy": 0.19686893969774247,
"num_tokens": 7817074.0,
"step": 3480
},
{
"entropy": 5.344467544555664,
"epoch": 3.7679826933477556,
"grad_norm": 1.1640625,
"learning_rate": 0.00040641749410658877,
"loss": 5.1357,
"mean_token_accuracy": 0.2029123544692993,
"num_tokens": 7828794.0,
"step": 3485
},
{
"entropy": 5.44368314743042,
"epoch": 3.773391022174148,
"grad_norm": 1.125,
"learning_rate": 0.0004060691030408487,
"loss": 5.1243,
"mean_token_accuracy": 0.20569152384996414,
"num_tokens": 7838994.0,
"step": 3490
},
{
"entropy": 5.246509265899658,
"epoch": 3.778799351000541,
"grad_norm": 1.1015625,
"learning_rate": 0.00040572023566968536,
"loss": 5.0218,
"mean_token_accuracy": 0.21003881245851516,
"num_tokens": 7850360.0,
"step": 3495
},
{
"entropy": 5.295813512802124,
"epoch": 3.7842076798269337,
"grad_norm": 1.2109375,
"learning_rate": 0.00040537089326088345,
"loss": 5.0342,
"mean_token_accuracy": 0.1982029601931572,
"num_tokens": 7860917.0,
"step": 3500
},
{
"entropy": 5.247469043731689,
"epoch": 3.789616008653326,
"grad_norm": 1.046875,
"learning_rate": 0.0004050210770839541,
"loss": 4.9153,
"mean_token_accuracy": 0.21182919889688492,
"num_tokens": 7873389.0,
"step": 3505
},
{
"entropy": 5.186233282089233,
"epoch": 3.7950243374797186,
"grad_norm": 1.1171875,
"learning_rate": 0.0004046707884101303,
"loss": 4.9773,
"mean_token_accuracy": 0.1983470067381859,
"num_tokens": 7884589.0,
"step": 3510
},
{
"entropy": 5.26288743019104,
"epoch": 3.8004326663061114,
"grad_norm": 1.1796875,
"learning_rate": 0.00040432002851236164,
"loss": 5.0575,
"mean_token_accuracy": 0.20026906132698058,
"num_tokens": 7896338.0,
"step": 3515
},
{
"entropy": 5.402217388153076,
"epoch": 3.8058409951325043,
"grad_norm": 1.1953125,
"learning_rate": 0.0004039687986653106,
"loss": 5.0755,
"mean_token_accuracy": 0.2025588259100914,
"num_tokens": 7907063.0,
"step": 3520
},
{
"entropy": 5.2639538764953615,
"epoch": 3.8112493239588967,
"grad_norm": 0.97265625,
"learning_rate": 0.00040361710014534714,
"loss": 5.0043,
"mean_token_accuracy": 0.21064664721488952,
"num_tokens": 7919723.0,
"step": 3525
},
{
"entropy": 5.139606237411499,
"epoch": 3.816657652785289,
"grad_norm": 1.1171875,
"learning_rate": 0.0004032649342305445,
"loss": 4.9906,
"mean_token_accuracy": 0.2104376509785652,
"num_tokens": 7930369.0,
"step": 3530
},
{
"entropy": 5.287723398208618,
"epoch": 3.822065981611682,
"grad_norm": 1.1015625,
"learning_rate": 0.0004029123022006745,
"loss": 5.0108,
"mean_token_accuracy": 0.20607363879680635,
"num_tokens": 7941726.0,
"step": 3535
},
{
"entropy": 5.347914600372315,
"epoch": 3.827474310438075,
"grad_norm": 1.125,
"learning_rate": 0.0004025592053372027,
"loss": 5.0657,
"mean_token_accuracy": 0.2048034265637398,
"num_tokens": 7952406.0,
"step": 3540
},
{
"entropy": 5.305616569519043,
"epoch": 3.8328826392644673,
"grad_norm": 1.1015625,
"learning_rate": 0.0004022056449232839,
"loss": 5.0799,
"mean_token_accuracy": 0.2043195441365242,
"num_tokens": 7964536.0,
"step": 3545
},
{
"entropy": 5.163705921173095,
"epoch": 3.8382909680908597,
"grad_norm": 1.1015625,
"learning_rate": 0.0004018516222437575,
"loss": 4.9109,
"mean_token_accuracy": 0.21903975456953048,
"num_tokens": 7974419.0,
"step": 3550
},
{
"entropy": 5.305897521972656,
"epoch": 3.8436992969172525,
"grad_norm": 1.140625,
"learning_rate": 0.0004014971385851428,
"loss": 5.0233,
"mean_token_accuracy": 0.20912724435329438,
"num_tokens": 7985128.0,
"step": 3555
},
{
"entropy": 5.375169992446899,
"epoch": 3.8491076257436454,
"grad_norm": 1.03125,
"learning_rate": 0.000401142195235634,
"loss": 5.139,
"mean_token_accuracy": 0.19376973956823348,
"num_tokens": 7997574.0,
"step": 3560
},
{
"entropy": 5.273523044586182,
"epoch": 3.854515954570038,
"grad_norm": 1.109375,
"learning_rate": 0.0004007867934850963,
"loss": 5.09,
"mean_token_accuracy": 0.20342953950166703,
"num_tokens": 8008498.0,
"step": 3565
},
{
"entropy": 5.305679798126221,
"epoch": 3.8599242833964302,
"grad_norm": 1.1484375,
"learning_rate": 0.0004004309346250603,
"loss": 4.9803,
"mean_token_accuracy": 0.21326489895582199,
"num_tokens": 8020016.0,
"step": 3570
},
{
"entropy": 5.2902507305145265,
"epoch": 3.865332612222823,
"grad_norm": 1.0078125,
"learning_rate": 0.0004000746199487181,
"loss": 5.0793,
"mean_token_accuracy": 0.1975437581539154,
"num_tokens": 8031454.0,
"step": 3575
},
{
"entropy": 5.194978713989258,
"epoch": 3.870740941049216,
"grad_norm": 1.15625,
"learning_rate": 0.000399717850750918,
"loss": 4.9924,
"mean_token_accuracy": 0.21084818989038467,
"num_tokens": 8041659.0,
"step": 3580
},
{
"entropy": 5.25621485710144,
"epoch": 3.8761492698756084,
"grad_norm": 1.15625,
"learning_rate": 0.00039936062832816,
"loss": 4.989,
"mean_token_accuracy": 0.20333430916070938,
"num_tokens": 8051814.0,
"step": 3585
},
{
"entropy": 5.353120231628418,
"epoch": 3.8815575987020012,
"grad_norm": 1.15625,
"learning_rate": 0.0003990029539785913,
"loss": 5.1131,
"mean_token_accuracy": 0.19526639878749846,
"num_tokens": 8061843.0,
"step": 3590
},
{
"entropy": 5.270770263671875,
"epoch": 3.8869659275283936,
"grad_norm": 1.0625,
"learning_rate": 0.00039864482900200135,
"loss": 5.111,
"mean_token_accuracy": 0.20148807913064956,
"num_tokens": 8074372.0,
"step": 3595
},
{
"entropy": 5.3175578117370605,
"epoch": 3.8923742563547865,
"grad_norm": 1.1328125,
"learning_rate": 0.0003982862546998169,
"loss": 4.9626,
"mean_token_accuracy": 0.21317742615938187,
"num_tokens": 8085256.0,
"step": 3600
},
{
"entropy": 5.216775178909302,
"epoch": 3.897782585181179,
"grad_norm": 1.1484375,
"learning_rate": 0.0003979272323750981,
"loss": 4.9782,
"mean_token_accuracy": 0.20454428046941758,
"num_tokens": 8095606.0,
"step": 3605
},
{
"entropy": 5.2997715950012205,
"epoch": 3.903190914007572,
"grad_norm": 1.0625,
"learning_rate": 0.0003975677633325327,
"loss": 5.0947,
"mean_token_accuracy": 0.19973311722278594,
"num_tokens": 8106674.0,
"step": 3610
},
{
"entropy": 5.351229858398438,
"epoch": 3.908599242833964,
"grad_norm": 1.1484375,
"learning_rate": 0.0003972078488784321,
"loss": 5.0187,
"mean_token_accuracy": 0.20516136288642883,
"num_tokens": 8117669.0,
"step": 3615
},
{
"entropy": 5.253053617477417,
"epoch": 3.914007571660357,
"grad_norm": 1.1015625,
"learning_rate": 0.0003968474903207263,
"loss": 5.0907,
"mean_token_accuracy": 0.2001551553606987,
"num_tokens": 8128740.0,
"step": 3620
},
{
"entropy": 5.258902215957642,
"epoch": 3.9194159004867495,
"grad_norm": 1.0234375,
"learning_rate": 0.0003964866889689592,
"loss": 5.1405,
"mean_token_accuracy": 0.20075008571147918,
"num_tokens": 8140890.0,
"step": 3625
},
{
"entropy": 5.254501914978027,
"epoch": 3.9248242293131423,
"grad_norm": 1.140625,
"learning_rate": 0.0003961254461342834,
"loss": 4.9654,
"mean_token_accuracy": 0.21354712396860123,
"num_tokens": 8152239.0,
"step": 3630
},
{
"entropy": 5.210498380661011,
"epoch": 3.9302325581395348,
"grad_norm": 1.125,
"learning_rate": 0.0003957637631294566,
"loss": 4.9818,
"mean_token_accuracy": 0.2099222257733345,
"num_tokens": 8162715.0,
"step": 3635
},
{
"entropy": 5.2807506084442135,
"epoch": 3.9356408869659276,
"grad_norm": 1.171875,
"learning_rate": 0.00039540164126883554,
"loss": 5.113,
"mean_token_accuracy": 0.19963123500347138,
"num_tokens": 8174022.0,
"step": 3640
},
{
"entropy": 5.280143976211548,
"epoch": 3.94104921579232,
"grad_norm": 1.1484375,
"learning_rate": 0.0003950390818683718,
"loss": 5.0794,
"mean_token_accuracy": 0.20172633826732636,
"num_tokens": 8185319.0,
"step": 3645
},
{
"entropy": 5.372960758209229,
"epoch": 3.946457544618713,
"grad_norm": 1.078125,
"learning_rate": 0.0003946760862456071,
"loss": 5.1052,
"mean_token_accuracy": 0.20131509602069855,
"num_tokens": 8196325.0,
"step": 3650
},
{
"entropy": 5.294921064376831,
"epoch": 3.9518658734451053,
"grad_norm": 1.1171875,
"learning_rate": 0.0003943126557196685,
"loss": 5.1891,
"mean_token_accuracy": 0.19643608778715133,
"num_tokens": 8207475.0,
"step": 3655
},
{
"entropy": 5.32238187789917,
"epoch": 3.957274202271498,
"grad_norm": 1.0390625,
"learning_rate": 0.00039394879161126333,
"loss": 5.0477,
"mean_token_accuracy": 0.21232580095529557,
"num_tokens": 8217991.0,
"step": 3660
},
{
"entropy": 5.4003208637237545,
"epoch": 3.9626825310978906,
"grad_norm": 1.0859375,
"learning_rate": 0.0003935844952426745,
"loss": 5.1582,
"mean_token_accuracy": 0.20134422481060027,
"num_tokens": 8229967.0,
"step": 3665
},
{
"entropy": 5.329679679870606,
"epoch": 3.9680908599242835,
"grad_norm": 1.1015625,
"learning_rate": 0.00039321976793775586,
"loss": 5.0814,
"mean_token_accuracy": 0.2050641193985939,
"num_tokens": 8240888.0,
"step": 3670
},
{
"entropy": 5.269544649124145,
"epoch": 3.973499188750676,
"grad_norm": 1.078125,
"learning_rate": 0.0003928546110219275,
"loss": 5.022,
"mean_token_accuracy": 0.20496581494808197,
"num_tokens": 8251578.0,
"step": 3675
},
{
"entropy": 5.335589170455933,
"epoch": 3.9789075175770687,
"grad_norm": 1.0859375,
"learning_rate": 0.00039248902582217024,
"loss": 5.1652,
"mean_token_accuracy": 0.19284765124320985,
"num_tokens": 8263211.0,
"step": 3680
},
{
"entropy": 5.292235565185547,
"epoch": 3.9843158464034616,
"grad_norm": 1.09375,
"learning_rate": 0.00039212301366702153,
"loss": 5.0577,
"mean_token_accuracy": 0.2027981922030449,
"num_tokens": 8274962.0,
"step": 3685
},
{
"entropy": 5.321161985397339,
"epoch": 3.989724175229854,
"grad_norm": 1.0234375,
"learning_rate": 0.00039175657588657063,
"loss": 5.1145,
"mean_token_accuracy": 0.19505583643913268,
"num_tokens": 8286664.0,
"step": 3690
},
{
"entropy": 5.40333046913147,
"epoch": 3.9951325040562464,
"grad_norm": 1.1484375,
"learning_rate": 0.0003913897138124531,
"loss": 5.1478,
"mean_token_accuracy": 0.20666071623563767,
"num_tokens": 8298308.0,
"step": 3695
},
{
"entropy": 5.259542094336616,
"epoch": 4.0,
"grad_norm": 2.171875,
"learning_rate": 0.0003910224287778466,
"loss": 4.9737,
"mean_token_accuracy": 0.20988202922874027,
"num_tokens": 8307556.0,
"step": 3700
},
{
"entropy": 5.228936624526978,
"epoch": 4.005408328826393,
"grad_norm": 1.1640625,
"learning_rate": 0.00039065472211746586,
"loss": 4.7918,
"mean_token_accuracy": 0.21572422236204147,
"num_tokens": 8317317.0,
"step": 3705
},
{
"entropy": 5.381158876419067,
"epoch": 4.010816657652786,
"grad_norm": 1.0703125,
"learning_rate": 0.0003902865951675576,
"loss": 4.8113,
"mean_token_accuracy": 0.21779844611883165,
"num_tokens": 8329205.0,
"step": 3710
},
{
"entropy": 5.202475833892822,
"epoch": 4.016224986479178,
"grad_norm": 1.0078125,
"learning_rate": 0.00038991804926589616,
"loss": 4.7601,
"mean_token_accuracy": 0.20786229223012925,
"num_tokens": 8341942.0,
"step": 3715
},
{
"entropy": 5.306916856765747,
"epoch": 4.0216333153055706,
"grad_norm": 1.109375,
"learning_rate": 0.000389549085751778,
"loss": 4.7264,
"mean_token_accuracy": 0.22169105857610702,
"num_tokens": 8352842.0,
"step": 3720
},
{
"entropy": 5.215069007873535,
"epoch": 4.027041644131963,
"grad_norm": 0.98046875,
"learning_rate": 0.00038917970596601765,
"loss": 4.7444,
"mean_token_accuracy": 0.22096059173345567,
"num_tokens": 8365701.0,
"step": 3725
},
{
"entropy": 5.271167230606079,
"epoch": 4.032449972958356,
"grad_norm": 1.15625,
"learning_rate": 0.0003888099112509419,
"loss": 4.8085,
"mean_token_accuracy": 0.21960905939340591,
"num_tokens": 8377845.0,
"step": 3730
},
{
"entropy": 5.1842145919799805,
"epoch": 4.037858301784748,
"grad_norm": 1.2109375,
"learning_rate": 0.00038843970295038564,
"loss": 4.7136,
"mean_token_accuracy": 0.22443787753582,
"num_tokens": 8388264.0,
"step": 3735
},
{
"entropy": 5.317769527435303,
"epoch": 4.043266630611141,
"grad_norm": 1.0390625,
"learning_rate": 0.00038806908240968666,
"loss": 4.7959,
"mean_token_accuracy": 0.21819601207971573,
"num_tokens": 8400293.0,
"step": 3740
},
{
"entropy": 5.253559303283692,
"epoch": 4.048674959437534,
"grad_norm": 1.140625,
"learning_rate": 0.000387698050975681,
"loss": 4.7784,
"mean_token_accuracy": 0.2145900920033455,
"num_tokens": 8413206.0,
"step": 3745
},
{
"entropy": 5.1965256690979,
"epoch": 4.054083288263927,
"grad_norm": 1.171875,
"learning_rate": 0.0003873266099966976,
"loss": 4.7324,
"mean_token_accuracy": 0.22217119485139847,
"num_tokens": 8423730.0,
"step": 3750
},
{
"entropy": 5.2491833686828615,
"epoch": 4.059491617090319,
"grad_norm": 1.3203125,
"learning_rate": 0.00038695476082255395,
"loss": 4.8268,
"mean_token_accuracy": 0.2125288128852844,
"num_tokens": 8432836.0,
"step": 3755
},
{
"entropy": 5.265499591827393,
"epoch": 4.064899945916712,
"grad_norm": 1.1328125,
"learning_rate": 0.0003865825048045507,
"loss": 4.7144,
"mean_token_accuracy": 0.22184101939201356,
"num_tokens": 8443373.0,
"step": 3760
},
{
"entropy": 5.241724443435669,
"epoch": 4.0703082747431045,
"grad_norm": 1.125,
"learning_rate": 0.0003862098432954672,
"loss": 4.7008,
"mean_token_accuracy": 0.22234428226947783,
"num_tokens": 8455034.0,
"step": 3765
},
{
"entropy": 5.170835065841675,
"epoch": 4.075716603569497,
"grad_norm": 1.078125,
"learning_rate": 0.0003858367776495561,
"loss": 4.7516,
"mean_token_accuracy": 0.22083321064710618,
"num_tokens": 8466597.0,
"step": 3770
},
{
"entropy": 5.351025867462158,
"epoch": 4.081124932395889,
"grad_norm": 1.1015625,
"learning_rate": 0.00038546330922253886,
"loss": 4.8063,
"mean_token_accuracy": 0.21793835312128068,
"num_tokens": 8478289.0,
"step": 3775
},
{
"entropy": 5.156632709503174,
"epoch": 4.086533261222282,
"grad_norm": 1.0546875,
"learning_rate": 0.0003850894393716007,
"loss": 4.737,
"mean_token_accuracy": 0.2260276660323143,
"num_tokens": 8490369.0,
"step": 3780
},
{
"entropy": 5.268509292602539,
"epoch": 4.091941590048675,
"grad_norm": 1.328125,
"learning_rate": 0.0003847151694553855,
"loss": 4.8549,
"mean_token_accuracy": 0.21624237447977065,
"num_tokens": 8502055.0,
"step": 3785
},
{
"entropy": 5.186176681518555,
"epoch": 4.097349918875068,
"grad_norm": 1.0546875,
"learning_rate": 0.0003843405008339908,
"loss": 4.6884,
"mean_token_accuracy": 0.2291273519396782,
"num_tokens": 8512700.0,
"step": 3790
},
{
"entropy": 5.248280239105225,
"epoch": 4.10275824770146,
"grad_norm": 1.1484375,
"learning_rate": 0.00038396543486896354,
"loss": 4.7324,
"mean_token_accuracy": 0.22924015969038009,
"num_tokens": 8524393.0,
"step": 3795
},
{
"entropy": 5.247825384140015,
"epoch": 4.108166576527853,
"grad_norm": 1.140625,
"learning_rate": 0.00038358997292329406,
"loss": 4.7592,
"mean_token_accuracy": 0.22061702758073806,
"num_tokens": 8535064.0,
"step": 3800
},
{
"entropy": 5.158923149108887,
"epoch": 4.113574905354246,
"grad_norm": 1.1171875,
"learning_rate": 0.00038321411636141214,
"loss": 4.8143,
"mean_token_accuracy": 0.21571891009807587,
"num_tokens": 8546371.0,
"step": 3805
},
{
"entropy": 5.194771432876587,
"epoch": 4.1189832341806385,
"grad_norm": 1.2265625,
"learning_rate": 0.0003828378665491811,
"loss": 4.7083,
"mean_token_accuracy": 0.2260413110256195,
"num_tokens": 8557524.0,
"step": 3810
},
{
"entropy": 5.111932849884033,
"epoch": 4.1243915630070305,
"grad_norm": 1.125,
"learning_rate": 0.000382461224853894,
"loss": 4.7448,
"mean_token_accuracy": 0.21652544736862184,
"num_tokens": 8568161.0,
"step": 3815
},
{
"entropy": 5.222511100769043,
"epoch": 4.129799891833423,
"grad_norm": 1.078125,
"learning_rate": 0.0003820841926442674,
"loss": 4.7716,
"mean_token_accuracy": 0.21885205805301666,
"num_tokens": 8579483.0,
"step": 3820
},
{
"entropy": 5.30679235458374,
"epoch": 4.135208220659816,
"grad_norm": 1.25,
"learning_rate": 0.0003817067712904372,
"loss": 4.8601,
"mean_token_accuracy": 0.21630595177412032,
"num_tokens": 8590698.0,
"step": 3825
},
{
"entropy": 5.289760875701904,
"epoch": 4.140616549486209,
"grad_norm": 1.09375,
"learning_rate": 0.00038132896216395355,
"loss": 4.8865,
"mean_token_accuracy": 0.20356166660785674,
"num_tokens": 8602669.0,
"step": 3830
},
{
"entropy": 5.177745962142945,
"epoch": 4.146024878312601,
"grad_norm": 1.09375,
"learning_rate": 0.0003809507666377758,
"loss": 4.7264,
"mean_token_accuracy": 0.2210530236363411,
"num_tokens": 8614401.0,
"step": 3835
},
{
"entropy": 5.225433874130249,
"epoch": 4.151433207138994,
"grad_norm": 1.1796875,
"learning_rate": 0.00038057218608626714,
"loss": 4.8641,
"mean_token_accuracy": 0.2134488642215729,
"num_tokens": 8627274.0,
"step": 3840
},
{
"entropy": 5.227169942855835,
"epoch": 4.156841535965387,
"grad_norm": 1.0625,
"learning_rate": 0.0003801932218851903,
"loss": 4.8251,
"mean_token_accuracy": 0.21174139380455018,
"num_tokens": 8638103.0,
"step": 3845
},
{
"entropy": 5.228398609161377,
"epoch": 4.16224986479178,
"grad_norm": 1.21875,
"learning_rate": 0.000379813875411702,
"loss": 4.7647,
"mean_token_accuracy": 0.22324918657541276,
"num_tokens": 8649073.0,
"step": 3850
},
{
"entropy": 5.227480363845825,
"epoch": 4.167658193618172,
"grad_norm": 1.1171875,
"learning_rate": 0.00037943414804434826,
"loss": 4.7319,
"mean_token_accuracy": 0.2177593544125557,
"num_tokens": 8660037.0,
"step": 3855
},
{
"entropy": 5.297253751754761,
"epoch": 4.173066522444564,
"grad_norm": 1.09375,
"learning_rate": 0.0003790540411630592,
"loss": 4.8496,
"mean_token_accuracy": 0.21644241660833358,
"num_tokens": 8670900.0,
"step": 3860
},
{
"entropy": 5.229861164093018,
"epoch": 4.178474851270957,
"grad_norm": 1.1640625,
"learning_rate": 0.00037867355614914404,
"loss": 4.8664,
"mean_token_accuracy": 0.21475912481546403,
"num_tokens": 8682646.0,
"step": 3865
},
{
"entropy": 5.198261260986328,
"epoch": 4.18388318009735,
"grad_norm": 1.2578125,
"learning_rate": 0.0003782926943852864,
"loss": 4.7489,
"mean_token_accuracy": 0.2238985478878021,
"num_tokens": 8692508.0,
"step": 3870
},
{
"entropy": 5.222509908676147,
"epoch": 4.189291508923742,
"grad_norm": 1.125,
"learning_rate": 0.00037791145725553853,
"loss": 4.725,
"mean_token_accuracy": 0.22145478129386903,
"num_tokens": 8703711.0,
"step": 3875
},
{
"entropy": 5.162336206436157,
"epoch": 4.194699837750135,
"grad_norm": 1.1484375,
"learning_rate": 0.0003775298461453172,
"loss": 4.7062,
"mean_token_accuracy": 0.22696628868579866,
"num_tokens": 8715531.0,
"step": 3880
},
{
"entropy": 5.172789764404297,
"epoch": 4.200108166576528,
"grad_norm": 1.1875,
"learning_rate": 0.000377147862441398,
"loss": 4.711,
"mean_token_accuracy": 0.2265646681189537,
"num_tokens": 8726182.0,
"step": 3885
},
{
"entropy": 5.22358455657959,
"epoch": 4.205516495402921,
"grad_norm": 1.1953125,
"learning_rate": 0.00037676550753191075,
"loss": 4.7829,
"mean_token_accuracy": 0.2251006320118904,
"num_tokens": 8736223.0,
"step": 3890
},
{
"entropy": 5.1700376033782955,
"epoch": 4.210924824229313,
"grad_norm": 1.140625,
"learning_rate": 0.0003763827828063339,
"loss": 4.8159,
"mean_token_accuracy": 0.22132253646850586,
"num_tokens": 8747723.0,
"step": 3895
},
{
"entropy": 5.291456031799316,
"epoch": 4.2163331530557056,
"grad_norm": 1.1484375,
"learning_rate": 0.00037599968965549,
"loss": 4.7976,
"mean_token_accuracy": 0.21205141991376877,
"num_tokens": 8757756.0,
"step": 3900
},
{
"entropy": 5.209738683700562,
"epoch": 4.221741481882098,
"grad_norm": 1.1796875,
"learning_rate": 0.0003756162294715405,
"loss": 4.7399,
"mean_token_accuracy": 0.22141652256250383,
"num_tokens": 8768226.0,
"step": 3905
},
{
"entropy": 5.168905258178711,
"epoch": 4.227149810708491,
"grad_norm": 1.1796875,
"learning_rate": 0.00037523240364798063,
"loss": 4.7764,
"mean_token_accuracy": 0.22340039312839508,
"num_tokens": 8778920.0,
"step": 3910
},
{
"entropy": 5.258641767501831,
"epoch": 4.232558139534884,
"grad_norm": 1.21875,
"learning_rate": 0.00037484821357963423,
"loss": 4.8927,
"mean_token_accuracy": 0.21655535995960234,
"num_tokens": 8790784.0,
"step": 3915
},
{
"entropy": 5.218029928207398,
"epoch": 4.237966468361276,
"grad_norm": 1.1796875,
"learning_rate": 0.000374463660662649,
"loss": 4.7659,
"mean_token_accuracy": 0.2183724746108055,
"num_tokens": 8801596.0,
"step": 3920
},
{
"entropy": 5.2418529987335205,
"epoch": 4.243374797187669,
"grad_norm": 1.1328125,
"learning_rate": 0.000374078746294491,
"loss": 4.793,
"mean_token_accuracy": 0.21937247067689897,
"num_tokens": 8813159.0,
"step": 3925
},
{
"entropy": 5.2435462474823,
"epoch": 4.248783126014062,
"grad_norm": 1.1640625,
"learning_rate": 0.00037369347187393996,
"loss": 4.7462,
"mean_token_accuracy": 0.22190145701169967,
"num_tokens": 8824100.0,
"step": 3930
},
{
"entropy": 5.145112037658691,
"epoch": 4.254191454840455,
"grad_norm": 1.2734375,
"learning_rate": 0.0003733078388010842,
"loss": 4.7415,
"mean_token_accuracy": 0.22087637037038804,
"num_tokens": 8835768.0,
"step": 3935
},
{
"entropy": 5.190743255615234,
"epoch": 4.259599783666847,
"grad_norm": 1.0234375,
"learning_rate": 0.0003729218484773149,
"loss": 4.8552,
"mean_token_accuracy": 0.21553286612033845,
"num_tokens": 8848301.0,
"step": 3940
},
{
"entropy": 5.148532962799072,
"epoch": 4.2650081124932395,
"grad_norm": 1.2421875,
"learning_rate": 0.0003725355023053221,
"loss": 4.7084,
"mean_token_accuracy": 0.23386980593204498,
"num_tokens": 8859948.0,
"step": 3945
},
{
"entropy": 5.2061621189117435,
"epoch": 4.270416441319632,
"grad_norm": 1.2265625,
"learning_rate": 0.0003721488016890884,
"loss": 4.825,
"mean_token_accuracy": 0.2174012243747711,
"num_tokens": 8870795.0,
"step": 3950
},
{
"entropy": 5.173050451278686,
"epoch": 4.275824770146025,
"grad_norm": 1.1796875,
"learning_rate": 0.00037176174803388496,
"loss": 4.7727,
"mean_token_accuracy": 0.21645693480968475,
"num_tokens": 8881084.0,
"step": 3955
},
{
"entropy": 5.291169023513794,
"epoch": 4.281233098972417,
"grad_norm": 1.203125,
"learning_rate": 0.00037137434274626545,
"loss": 4.8955,
"mean_token_accuracy": 0.2193419650197029,
"num_tokens": 8892156.0,
"step": 3960
},
{
"entropy": 5.180820178985596,
"epoch": 4.28664142779881,
"grad_norm": 1.2734375,
"learning_rate": 0.0003709865872340618,
"loss": 4.8171,
"mean_token_accuracy": 0.21348263025283815,
"num_tokens": 8903073.0,
"step": 3965
},
{
"entropy": 5.253063774108886,
"epoch": 4.292049756625203,
"grad_norm": 1.2421875,
"learning_rate": 0.0003705984829063782,
"loss": 4.7986,
"mean_token_accuracy": 0.2177883967757225,
"num_tokens": 8913745.0,
"step": 3970
},
{
"entropy": 5.223085021972656,
"epoch": 4.297458085451596,
"grad_norm": 1.171875,
"learning_rate": 0.0003702100311735869,
"loss": 4.7537,
"mean_token_accuracy": 0.2223805844783783,
"num_tokens": 8925136.0,
"step": 3975
},
{
"entropy": 5.176297569274903,
"epoch": 4.302866414277988,
"grad_norm": 1.2109375,
"learning_rate": 0.00036982123344732223,
"loss": 4.8206,
"mean_token_accuracy": 0.21707260906696318,
"num_tokens": 8935875.0,
"step": 3980
},
{
"entropy": 5.200548839569092,
"epoch": 4.308274743104381,
"grad_norm": 1.1953125,
"learning_rate": 0.00036943209114047613,
"loss": 4.7444,
"mean_token_accuracy": 0.21994930505752563,
"num_tokens": 8946504.0,
"step": 3985
},
{
"entropy": 5.295788955688477,
"epoch": 4.3136830719307735,
"grad_norm": 1.2421875,
"learning_rate": 0.0003690426056671926,
"loss": 4.9146,
"mean_token_accuracy": 0.21547133475542068,
"num_tokens": 8957515.0,
"step": 3990
},
{
"entropy": 5.2737537860870365,
"epoch": 4.319091400757166,
"grad_norm": 1.171875,
"learning_rate": 0.0003686527784428627,
"loss": 4.909,
"mean_token_accuracy": 0.21105027496814727,
"num_tokens": 8967774.0,
"step": 3995
},
{
"entropy": 5.2086974620819095,
"epoch": 4.324499729583558,
"grad_norm": 1.15625,
"learning_rate": 0.00036826261088411955,
"loss": 4.8259,
"mean_token_accuracy": 0.21815041452646255,
"num_tokens": 8979209.0,
"step": 4000
},
{
"epoch": 4.324499729583558,
"eval_entropy": 5.129207630590959,
"eval_loss": 5.875708103179932,
"eval_mean_token_accuracy": 0.17788886231454937,
"eval_num_tokens": 8979209.0,
"eval_runtime": 2.5205,
"eval_samples_per_second": 1394.552,
"eval_steps_per_second": 174.567,
"step": 4000
},
{
"entropy": 5.1698521137237545,
"epoch": 4.329908058409951,
"grad_norm": 1.1875,
"learning_rate": 0.0003678721044088329,
"loss": 4.7449,
"mean_token_accuracy": 0.22811723202466966,
"num_tokens": 8990858.0,
"step": 4005
},
{
"entropy": 5.2381916522979735,
"epoch": 4.335316387236344,
"grad_norm": 1.2578125,
"learning_rate": 0.0003674812604361043,
"loss": 4.7611,
"mean_token_accuracy": 0.22092103958129883,
"num_tokens": 9001955.0,
"step": 4010
},
{
"entropy": 5.2503519535064695,
"epoch": 4.340724716062737,
"grad_norm": 1.2109375,
"learning_rate": 0.0003670900803862615,
"loss": 4.8644,
"mean_token_accuracy": 0.21506840288639067,
"num_tokens": 9015109.0,
"step": 4015
},
{
"entropy": 5.179874420166016,
"epoch": 4.346133044889129,
"grad_norm": 1.1875,
"learning_rate": 0.0003666985656808537,
"loss": 4.7549,
"mean_token_accuracy": 0.2173784926533699,
"num_tokens": 9025927.0,
"step": 4020
},
{
"entropy": 5.110817241668701,
"epoch": 4.351541373715522,
"grad_norm": 1.2421875,
"learning_rate": 0.00036630671774264635,
"loss": 4.8007,
"mean_token_accuracy": 0.22302627563476562,
"num_tokens": 9037327.0,
"step": 4025
},
{
"entropy": 5.264145946502685,
"epoch": 4.356949702541915,
"grad_norm": 1.1015625,
"learning_rate": 0.0003659145379956158,
"loss": 4.8265,
"mean_token_accuracy": 0.21460790187120438,
"num_tokens": 9048521.0,
"step": 4030
},
{
"entropy": 5.249226665496826,
"epoch": 4.3623580313683075,
"grad_norm": 1.125,
"learning_rate": 0.00036552202786494393,
"loss": 4.8533,
"mean_token_accuracy": 0.21577533483505248,
"num_tokens": 9060097.0,
"step": 4035
},
{
"entropy": 5.1628114700317385,
"epoch": 4.367766360194699,
"grad_norm": 1.1484375,
"learning_rate": 0.00036512918877701367,
"loss": 4.7656,
"mean_token_accuracy": 0.21338739693164827,
"num_tokens": 9071073.0,
"step": 4040
},
{
"entropy": 5.196001434326172,
"epoch": 4.373174689021092,
"grad_norm": 1.0859375,
"learning_rate": 0.00036473602215940316,
"loss": 4.7359,
"mean_token_accuracy": 0.22415471374988555,
"num_tokens": 9082208.0,
"step": 4045
},
{
"entropy": 5.269560050964356,
"epoch": 4.378583017847485,
"grad_norm": 1.09375,
"learning_rate": 0.0003643425294408807,
"loss": 4.8195,
"mean_token_accuracy": 0.2192169427871704,
"num_tokens": 9093318.0,
"step": 4050
},
{
"entropy": 5.236953926086426,
"epoch": 4.383991346673878,
"grad_norm": 1.1171875,
"learning_rate": 0.00036394871205139984,
"loss": 4.8381,
"mean_token_accuracy": 0.2181643858551979,
"num_tokens": 9104297.0,
"step": 4055
},
{
"entropy": 5.172978925704956,
"epoch": 4.38939967550027,
"grad_norm": 1.21875,
"learning_rate": 0.0003635545714220938,
"loss": 4.7626,
"mean_token_accuracy": 0.22120705395936965,
"num_tokens": 9115740.0,
"step": 4060
},
{
"entropy": 5.214205312728882,
"epoch": 4.394808004326663,
"grad_norm": 1.1484375,
"learning_rate": 0.0003631601089852706,
"loss": 4.7844,
"mean_token_accuracy": 0.22138622105121614,
"num_tokens": 9127471.0,
"step": 4065
},
{
"entropy": 5.2109921932220455,
"epoch": 4.400216333153056,
"grad_norm": 1.078125,
"learning_rate": 0.0003627653261744075,
"loss": 4.8677,
"mean_token_accuracy": 0.2143697664141655,
"num_tokens": 9139797.0,
"step": 4070
},
{
"entropy": 5.2805290699005125,
"epoch": 4.405624661979449,
"grad_norm": 1.0546875,
"learning_rate": 0.00036237022442414636,
"loss": 4.9033,
"mean_token_accuracy": 0.2102605313062668,
"num_tokens": 9151414.0,
"step": 4075
},
{
"entropy": 5.274412536621094,
"epoch": 4.411032990805841,
"grad_norm": 1.171875,
"learning_rate": 0.0003619748051702878,
"loss": 4.8679,
"mean_token_accuracy": 0.21292463988065718,
"num_tokens": 9164326.0,
"step": 4080
},
{
"entropy": 5.282187271118164,
"epoch": 4.416441319632233,
"grad_norm": 1.1484375,
"learning_rate": 0.0003615790698497862,
"loss": 4.8784,
"mean_token_accuracy": 0.21291628181934358,
"num_tokens": 9174523.0,
"step": 4085
},
{
"entropy": 5.2507611274719235,
"epoch": 4.421849648458626,
"grad_norm": 1.1171875,
"learning_rate": 0.00036118301990074463,
"loss": 4.8805,
"mean_token_accuracy": 0.21525037586688994,
"num_tokens": 9185744.0,
"step": 4090
},
{
"entropy": 5.246658611297607,
"epoch": 4.427257977285019,
"grad_norm": 1.265625,
"learning_rate": 0.0003607866567624097,
"loss": 4.8474,
"mean_token_accuracy": 0.21757164001464843,
"num_tokens": 9195986.0,
"step": 4095
},
{
"entropy": 5.207152605056763,
"epoch": 4.432666306111411,
"grad_norm": 1.1484375,
"learning_rate": 0.00036038998187516583,
"loss": 4.8821,
"mean_token_accuracy": 0.20915853083133698,
"num_tokens": 9207054.0,
"step": 4100
},
{
"entropy": 5.142826938629151,
"epoch": 4.438074634937804,
"grad_norm": 1.1796875,
"learning_rate": 0.00035999299668053043,
"loss": 4.7944,
"mean_token_accuracy": 0.21401069164276124,
"num_tokens": 9218021.0,
"step": 4105
},
{
"entropy": 5.110489463806152,
"epoch": 4.443482963764197,
"grad_norm": 1.25,
"learning_rate": 0.0003595957026211487,
"loss": 4.6857,
"mean_token_accuracy": 0.23302003294229506,
"num_tokens": 9229580.0,
"step": 4110
},
{
"entropy": 5.204845714569092,
"epoch": 4.44889129259059,
"grad_norm": 1.1015625,
"learning_rate": 0.00035919810114078815,
"loss": 4.7612,
"mean_token_accuracy": 0.21849105954170228,
"num_tokens": 9241378.0,
"step": 4115
},
{
"entropy": 5.2413819313049315,
"epoch": 4.4542996214169825,
"grad_norm": 1.0234375,
"learning_rate": 0.00035880019368433354,
"loss": 4.8832,
"mean_token_accuracy": 0.20542484670877456,
"num_tokens": 9253807.0,
"step": 4120
},
{
"entropy": 5.197515153884888,
"epoch": 4.4597079502433745,
"grad_norm": 1.140625,
"learning_rate": 0.0003584019816977813,
"loss": 4.811,
"mean_token_accuracy": 0.2168327286839485,
"num_tokens": 9264610.0,
"step": 4125
},
{
"entropy": 5.247724866867065,
"epoch": 4.465116279069767,
"grad_norm": 1.1640625,
"learning_rate": 0.00035800346662823493,
"loss": 4.8376,
"mean_token_accuracy": 0.22170430123806,
"num_tokens": 9275013.0,
"step": 4130
},
{
"entropy": 5.259762144088745,
"epoch": 4.47052460789616,
"grad_norm": 1.03125,
"learning_rate": 0.000357604649923899,
"loss": 4.8675,
"mean_token_accuracy": 0.21409146785736083,
"num_tokens": 9287010.0,
"step": 4135
},
{
"entropy": 5.179459762573242,
"epoch": 4.475932936722553,
"grad_norm": 1.1875,
"learning_rate": 0.0003572055330340744,
"loss": 4.8077,
"mean_token_accuracy": 0.2238604962825775,
"num_tokens": 9299542.0,
"step": 4140
},
{
"entropy": 5.142919921875,
"epoch": 4.481341265548945,
"grad_norm": 1.171875,
"learning_rate": 0.00035680611740915264,
"loss": 4.8939,
"mean_token_accuracy": 0.20940080732107164,
"num_tokens": 9311469.0,
"step": 4145
},
{
"entropy": 5.196005821228027,
"epoch": 4.486749594375338,
"grad_norm": 1.1328125,
"learning_rate": 0.0003564064045006113,
"loss": 4.7827,
"mean_token_accuracy": 0.222554050385952,
"num_tokens": 9323235.0,
"step": 4150
},
{
"entropy": 5.153643465042114,
"epoch": 4.492157923201731,
"grad_norm": 1.171875,
"learning_rate": 0.00035600639576100786,
"loss": 4.7639,
"mean_token_accuracy": 0.22529457211494447,
"num_tokens": 9334072.0,
"step": 4155
},
{
"entropy": 5.200942420959473,
"epoch": 4.497566252028124,
"grad_norm": 1.2265625,
"learning_rate": 0.00035560609264397497,
"loss": 4.7556,
"mean_token_accuracy": 0.22053186744451522,
"num_tokens": 9344554.0,
"step": 4160
},
{
"entropy": 5.288739442825317,
"epoch": 4.502974580854516,
"grad_norm": 1.140625,
"learning_rate": 0.00035520549660421515,
"loss": 4.8634,
"mean_token_accuracy": 0.22072732746601104,
"num_tokens": 9354652.0,
"step": 4165
},
{
"entropy": 5.143185806274414,
"epoch": 4.5083829096809085,
"grad_norm": 1.1640625,
"learning_rate": 0.0003548046090974954,
"loss": 4.7859,
"mean_token_accuracy": 0.22373250871896744,
"num_tokens": 9366827.0,
"step": 4170
},
{
"entropy": 5.1459380149841305,
"epoch": 4.513791238507301,
"grad_norm": 1.2109375,
"learning_rate": 0.00035440343158064176,
"loss": 4.8365,
"mean_token_accuracy": 0.21650842428207398,
"num_tokens": 9378454.0,
"step": 4175
},
{
"entropy": 5.274607515335083,
"epoch": 4.519199567333694,
"grad_norm": 1.109375,
"learning_rate": 0.0003540019655115341,
"loss": 4.8221,
"mean_token_accuracy": 0.22054063826799392,
"num_tokens": 9389811.0,
"step": 4180
},
{
"entropy": 5.11309962272644,
"epoch": 4.524607896160086,
"grad_norm": 1.0859375,
"learning_rate": 0.00035360021234910133,
"loss": 4.7699,
"mean_token_accuracy": 0.21781020611524582,
"num_tokens": 9402131.0,
"step": 4185
},
{
"entropy": 5.157134628295898,
"epoch": 4.530016224986479,
"grad_norm": 1.1796875,
"learning_rate": 0.00035319817355331537,
"loss": 4.7534,
"mean_token_accuracy": 0.21301970779895782,
"num_tokens": 9413349.0,
"step": 4190
},
{
"entropy": 5.244472408294678,
"epoch": 4.535424553812872,
"grad_norm": 1.1640625,
"learning_rate": 0.0003527958505851858,
"loss": 4.8331,
"mean_token_accuracy": 0.2209853559732437,
"num_tokens": 9424166.0,
"step": 4195
},
{
"entropy": 5.098556661605835,
"epoch": 4.540832882639265,
"grad_norm": 1.3203125,
"learning_rate": 0.00035239324490675546,
"loss": 4.7108,
"mean_token_accuracy": 0.22704413086175917,
"num_tokens": 9434170.0,
"step": 4200
},
{
"entropy": 5.143066167831421,
"epoch": 4.546241211465657,
"grad_norm": 1.0703125,
"learning_rate": 0.0003519903579810943,
"loss": 4.7103,
"mean_token_accuracy": 0.22983715683221817,
"num_tokens": 9445895.0,
"step": 4205
},
{
"entropy": 5.150725650787353,
"epoch": 4.55164954029205,
"grad_norm": 1.171875,
"learning_rate": 0.0003515871912722944,
"loss": 4.7056,
"mean_token_accuracy": 0.2305183231830597,
"num_tokens": 9456541.0,
"step": 4210
},
{
"entropy": 5.135134935379028,
"epoch": 4.5570578691184425,
"grad_norm": 1.078125,
"learning_rate": 0.0003511837462454643,
"loss": 4.77,
"mean_token_accuracy": 0.21956500113010408,
"num_tokens": 9468371.0,
"step": 4215
},
{
"entropy": 5.230216598510742,
"epoch": 4.562466197944835,
"grad_norm": 1.140625,
"learning_rate": 0.00035078002436672443,
"loss": 4.8215,
"mean_token_accuracy": 0.21773815304040908,
"num_tokens": 9479836.0,
"step": 4220
},
{
"entropy": 5.1390351295471195,
"epoch": 4.567874526771227,
"grad_norm": 1.0703125,
"learning_rate": 0.0003503760271032007,
"loss": 4.7523,
"mean_token_accuracy": 0.22365643382072448,
"num_tokens": 9491513.0,
"step": 4225
},
{
"entropy": 5.174953603744507,
"epoch": 4.57328285559762,
"grad_norm": 1.15625,
"learning_rate": 0.0003499717559230205,
"loss": 4.9148,
"mean_token_accuracy": 0.2128012552857399,
"num_tokens": 9502294.0,
"step": 4230
},
{
"entropy": 5.200818967819214,
"epoch": 4.578691184424013,
"grad_norm": 1.171875,
"learning_rate": 0.00034956721229530586,
"loss": 4.7697,
"mean_token_accuracy": 0.21208871603012086,
"num_tokens": 9514171.0,
"step": 4235
},
{
"entropy": 5.15206356048584,
"epoch": 4.584099513250406,
"grad_norm": 1.109375,
"learning_rate": 0.0003491623976901695,
"loss": 4.7765,
"mean_token_accuracy": 0.2192790687084198,
"num_tokens": 9525856.0,
"step": 4240
},
{
"entropy": 5.19573826789856,
"epoch": 4.589507842076799,
"grad_norm": 1.125,
"learning_rate": 0.0003487573135787085,
"loss": 4.7754,
"mean_token_accuracy": 0.22540073245763778,
"num_tokens": 9536879.0,
"step": 4245
},
{
"entropy": 5.1057915687561035,
"epoch": 4.594916170903191,
"grad_norm": 1.046875,
"learning_rate": 0.00034835196143299956,
"loss": 4.7776,
"mean_token_accuracy": 0.22640183717012405,
"num_tokens": 9548753.0,
"step": 4250
},
{
"entropy": 5.186993169784546,
"epoch": 4.600324499729584,
"grad_norm": 1.0859375,
"learning_rate": 0.00034794634272609313,
"loss": 4.8709,
"mean_token_accuracy": 0.2171752020716667,
"num_tokens": 9560360.0,
"step": 4255
},
{
"entropy": 5.20418152809143,
"epoch": 4.605732828555976,
"grad_norm": 1.203125,
"learning_rate": 0.0003475404589320089,
"loss": 4.7735,
"mean_token_accuracy": 0.2225883737206459,
"num_tokens": 9571933.0,
"step": 4260
},
{
"entropy": 5.1791015625,
"epoch": 4.611141157382368,
"grad_norm": 1.125,
"learning_rate": 0.0003471343115257291,
"loss": 4.88,
"mean_token_accuracy": 0.214799465239048,
"num_tokens": 9582574.0,
"step": 4265
},
{
"entropy": 5.2256396293640135,
"epoch": 4.616549486208761,
"grad_norm": 1.1796875,
"learning_rate": 0.00034672790198319453,
"loss": 4.7891,
"mean_token_accuracy": 0.21801409721374512,
"num_tokens": 9594099.0,
"step": 4270
},
{
"entropy": 5.227209234237671,
"epoch": 4.621957815035154,
"grad_norm": 1.125,
"learning_rate": 0.0003463212317812985,
"loss": 4.827,
"mean_token_accuracy": 0.21566763818264006,
"num_tokens": 9605453.0,
"step": 4275
},
{
"entropy": 5.073718786239624,
"epoch": 4.627366143861547,
"grad_norm": 1.109375,
"learning_rate": 0.0003459143023978813,
"loss": 4.7178,
"mean_token_accuracy": 0.22432279735803604,
"num_tokens": 9615792.0,
"step": 4280
},
{
"entropy": 5.141191101074218,
"epoch": 4.63277447268794,
"grad_norm": 1.15625,
"learning_rate": 0.0003455071153117252,
"loss": 4.814,
"mean_token_accuracy": 0.21015540808439254,
"num_tokens": 9626742.0,
"step": 4285
},
{
"entropy": 5.218060779571533,
"epoch": 4.638182801514332,
"grad_norm": 1.203125,
"learning_rate": 0.0003450996720025493,
"loss": 4.8498,
"mean_token_accuracy": 0.2157706916332245,
"num_tokens": 9636771.0,
"step": 4290
},
{
"entropy": 5.262406253814698,
"epoch": 4.643591130340725,
"grad_norm": 1.109375,
"learning_rate": 0.00034469197395100323,
"loss": 4.8317,
"mean_token_accuracy": 0.21994881480932235,
"num_tokens": 9649231.0,
"step": 4295
},
{
"entropy": 5.263737440109253,
"epoch": 4.6489994591671175,
"grad_norm": 1.2578125,
"learning_rate": 0.00034428402263866285,
"loss": 4.8637,
"mean_token_accuracy": 0.20947184562683105,
"num_tokens": 9659716.0,
"step": 4300
},
{
"entropy": 5.1370399475097654,
"epoch": 4.6544077879935095,
"grad_norm": 1.21875,
"learning_rate": 0.00034387581954802406,
"loss": 4.7669,
"mean_token_accuracy": 0.21796492636203765,
"num_tokens": 9670421.0,
"step": 4305
},
{
"entropy": 5.223067378997802,
"epoch": 4.659816116819902,
"grad_norm": 1.1953125,
"learning_rate": 0.00034346736616249786,
"loss": 4.8372,
"mean_token_accuracy": 0.2140335828065872,
"num_tokens": 9680720.0,
"step": 4310
},
{
"entropy": 5.19291124343872,
"epoch": 4.665224445646295,
"grad_norm": 1.140625,
"learning_rate": 0.00034305866396640473,
"loss": 4.7321,
"mean_token_accuracy": 0.2318376526236534,
"num_tokens": 9693521.0,
"step": 4315
},
{
"entropy": 5.1591602802276615,
"epoch": 4.670632774472688,
"grad_norm": 1.21875,
"learning_rate": 0.00034264971444496954,
"loss": 4.8524,
"mean_token_accuracy": 0.21431104838848114,
"num_tokens": 9704537.0,
"step": 4320
},
{
"entropy": 5.142458295822143,
"epoch": 4.676041103299081,
"grad_norm": 1.171875,
"learning_rate": 0.00034224051908431574,
"loss": 4.7847,
"mean_token_accuracy": 0.22502675354480745,
"num_tokens": 9715562.0,
"step": 4325
},
{
"entropy": 5.166618824005127,
"epoch": 4.681449432125473,
"grad_norm": 1.1171875,
"learning_rate": 0.0003418310793714602,
"loss": 4.7389,
"mean_token_accuracy": 0.22202754467725755,
"num_tokens": 9726598.0,
"step": 4330
},
{
"entropy": 5.2268894672393795,
"epoch": 4.686857760951866,
"grad_norm": 1.1640625,
"learning_rate": 0.0003414213967943077,
"loss": 4.8569,
"mean_token_accuracy": 0.21525177955627442,
"num_tokens": 9737088.0,
"step": 4335
},
{
"entropy": 5.222609567642212,
"epoch": 4.692266089778259,
"grad_norm": 1.15625,
"learning_rate": 0.00034101147284164583,
"loss": 4.7656,
"mean_token_accuracy": 0.22113731503486633,
"num_tokens": 9746651.0,
"step": 4340
},
{
"entropy": 5.157958173751831,
"epoch": 4.6976744186046515,
"grad_norm": 1.1484375,
"learning_rate": 0.00034060130900313905,
"loss": 4.8145,
"mean_token_accuracy": 0.21096471697092056,
"num_tokens": 9757622.0,
"step": 4345
},
{
"entropy": 5.127590084075928,
"epoch": 4.7030827474310435,
"grad_norm": 1.265625,
"learning_rate": 0.00034019090676932383,
"loss": 4.7697,
"mean_token_accuracy": 0.22989437878131866,
"num_tokens": 9767759.0,
"step": 4350
},
{
"entropy": 5.3040358543396,
"epoch": 4.708491076257436,
"grad_norm": 1.15625,
"learning_rate": 0.0003397802676316027,
"loss": 4.9098,
"mean_token_accuracy": 0.21758915334939957,
"num_tokens": 9778817.0,
"step": 4355
},
{
"entropy": 5.113615083694458,
"epoch": 4.713899405083829,
"grad_norm": 1.203125,
"learning_rate": 0.00033936939308223935,
"loss": 4.7139,
"mean_token_accuracy": 0.22662854045629502,
"num_tokens": 9788535.0,
"step": 4360
},
{
"entropy": 5.159414005279541,
"epoch": 4.719307733910222,
"grad_norm": 1.0625,
"learning_rate": 0.00033895828461435275,
"loss": 4.7933,
"mean_token_accuracy": 0.22037333399057388,
"num_tokens": 9800032.0,
"step": 4365
},
{
"entropy": 5.065600967407226,
"epoch": 4.724716062736614,
"grad_norm": 1.109375,
"learning_rate": 0.0003385469437219121,
"loss": 4.7444,
"mean_token_accuracy": 0.21907117813825608,
"num_tokens": 9811101.0,
"step": 4370
},
{
"entropy": 5.1119468212127686,
"epoch": 4.730124391563007,
"grad_norm": 1.3125,
"learning_rate": 0.00033813537189973105,
"loss": 4.7389,
"mean_token_accuracy": 0.22492649555206298,
"num_tokens": 9821228.0,
"step": 4375
},
{
"entropy": 5.118333959579468,
"epoch": 4.7355327203894,
"grad_norm": 1.046875,
"learning_rate": 0.00033772357064346266,
"loss": 4.7554,
"mean_token_accuracy": 0.21604670733213424,
"num_tokens": 9832842.0,
"step": 4380
},
{
"entropy": 5.185558414459228,
"epoch": 4.740941049215793,
"grad_norm": 1.1953125,
"learning_rate": 0.0003373115414495935,
"loss": 4.9157,
"mean_token_accuracy": 0.21205592453479766,
"num_tokens": 9843489.0,
"step": 4385
},
{
"entropy": 5.2465376377105715,
"epoch": 4.746349378042185,
"grad_norm": 1.09375,
"learning_rate": 0.0003368992858154389,
"loss": 4.8342,
"mean_token_accuracy": 0.2219047337770462,
"num_tokens": 9854361.0,
"step": 4390
},
{
"entropy": 5.184808301925659,
"epoch": 4.7517577068685775,
"grad_norm": 1.1875,
"learning_rate": 0.00033648680523913643,
"loss": 4.7954,
"mean_token_accuracy": 0.21774271577596666,
"num_tokens": 9864793.0,
"step": 4395
},
{
"entropy": 5.1303857326507565,
"epoch": 4.75716603569497,
"grad_norm": 1.2109375,
"learning_rate": 0.0003360741012196417,
"loss": 4.7389,
"mean_token_accuracy": 0.22457690089941024,
"num_tokens": 9875541.0,
"step": 4400
},
{
"entropy": 5.162422370910645,
"epoch": 4.762574364521363,
"grad_norm": 1.078125,
"learning_rate": 0.000335661175256722,
"loss": 4.7913,
"mean_token_accuracy": 0.22141399681568147,
"num_tokens": 9887619.0,
"step": 4405
},
{
"entropy": 5.29186224937439,
"epoch": 4.767982693347756,
"grad_norm": 1.1796875,
"learning_rate": 0.0003352480288509513,
"loss": 4.921,
"mean_token_accuracy": 0.2129698932170868,
"num_tokens": 9898515.0,
"step": 4410
},
{
"entropy": 5.172016716003418,
"epoch": 4.773391022174148,
"grad_norm": 1.2421875,
"learning_rate": 0.00033483466350370445,
"loss": 4.7444,
"mean_token_accuracy": 0.2318284034729004,
"num_tokens": 9909006.0,
"step": 4415
},
{
"entropy": 5.111044120788574,
"epoch": 4.778799351000541,
"grad_norm": 1.1875,
"learning_rate": 0.00033442108071715215,
"loss": 4.7707,
"mean_token_accuracy": 0.22435135990381241,
"num_tokens": 9919645.0,
"step": 4420
},
{
"entropy": 5.134038972854614,
"epoch": 4.784207679826934,
"grad_norm": 1.1640625,
"learning_rate": 0.00033400728199425525,
"loss": 4.7727,
"mean_token_accuracy": 0.2211101233959198,
"num_tokens": 9930990.0,
"step": 4425
},
{
"entropy": 5.129887247085572,
"epoch": 4.789616008653326,
"grad_norm": 1.234375,
"learning_rate": 0.00033359326883875917,
"loss": 4.7372,
"mean_token_accuracy": 0.22077507078647612,
"num_tokens": 9942481.0,
"step": 4430
},
{
"entropy": 5.16159348487854,
"epoch": 4.795024337479719,
"grad_norm": 1.140625,
"learning_rate": 0.00033317904275518873,
"loss": 4.7505,
"mean_token_accuracy": 0.22420234084129334,
"num_tokens": 9953908.0,
"step": 4435
},
{
"entropy": 5.121800756454467,
"epoch": 4.800432666306111,
"grad_norm": 1.1875,
"learning_rate": 0.0003327646052488425,
"loss": 4.6676,
"mean_token_accuracy": 0.23189338743686677,
"num_tokens": 9965356.0,
"step": 4440
},
{
"entropy": 5.14687933921814,
"epoch": 4.805840995132504,
"grad_norm": 1.1328125,
"learning_rate": 0.0003323499578257873,
"loss": 4.83,
"mean_token_accuracy": 0.21911503374576569,
"num_tokens": 9977054.0,
"step": 4445
},
{
"entropy": 5.1645159244537355,
"epoch": 4.811249323958897,
"grad_norm": 1.09375,
"learning_rate": 0.00033193510199285286,
"loss": 4.8405,
"mean_token_accuracy": 0.2151738703250885,
"num_tokens": 9988051.0,
"step": 4450
},
{
"entropy": 5.200753784179687,
"epoch": 4.816657652785289,
"grad_norm": 1.171875,
"learning_rate": 0.00033152003925762615,
"loss": 4.7953,
"mean_token_accuracy": 0.21726018637418748,
"num_tokens": 9999056.0,
"step": 4455
},
{
"entropy": 5.282358074188233,
"epoch": 4.822065981611682,
"grad_norm": 1.09375,
"learning_rate": 0.0003311047711284462,
"loss": 4.8817,
"mean_token_accuracy": 0.21626786291599273,
"num_tokens": 10011109.0,
"step": 4460
},
{
"entropy": 5.221546268463134,
"epoch": 4.827474310438075,
"grad_norm": 1.15625,
"learning_rate": 0.0003306892991143983,
"loss": 4.9284,
"mean_token_accuracy": 0.21169961094856263,
"num_tokens": 10023170.0,
"step": 4465
},
{
"entropy": 5.22047266960144,
"epoch": 4.832882639264467,
"grad_norm": 1.203125,
"learning_rate": 0.0003302736247253087,
"loss": 4.8359,
"mean_token_accuracy": 0.21632813811302185,
"num_tokens": 10034607.0,
"step": 4470
},
{
"entropy": 5.145314455032349,
"epoch": 4.83829096809086,
"grad_norm": 1.0625,
"learning_rate": 0.0003298577494717391,
"loss": 4.8211,
"mean_token_accuracy": 0.22303362488746642,
"num_tokens": 10047024.0,
"step": 4475
},
{
"entropy": 5.175536298751831,
"epoch": 4.8436992969172525,
"grad_norm": 1.140625,
"learning_rate": 0.0003294416748649812,
"loss": 4.7401,
"mean_token_accuracy": 0.21645448803901673,
"num_tokens": 10057693.0,
"step": 4480
},
{
"entropy": 5.120831727981567,
"epoch": 4.849107625743645,
"grad_norm": 1.0546875,
"learning_rate": 0.00032902540241705106,
"loss": 4.7641,
"mean_token_accuracy": 0.22694476693868637,
"num_tokens": 10069879.0,
"step": 4485
},
{
"entropy": 5.150848150253296,
"epoch": 4.854515954570038,
"grad_norm": 1.15625,
"learning_rate": 0.0003286089336406837,
"loss": 4.763,
"mean_token_accuracy": 0.2268701270222664,
"num_tokens": 10081045.0,
"step": 4490
},
{
"entropy": 5.233510255813599,
"epoch": 4.85992428339643,
"grad_norm": 1.1015625,
"learning_rate": 0.00032819227004932745,
"loss": 4.8957,
"mean_token_accuracy": 0.2167412057518959,
"num_tokens": 10092156.0,
"step": 4495
},
{
"entropy": 5.207941675186158,
"epoch": 4.865332612222823,
"grad_norm": 1.1875,
"learning_rate": 0.000327775413157139,
"loss": 4.8607,
"mean_token_accuracy": 0.21476806700229645,
"num_tokens": 10104338.0,
"step": 4500
},
{
"entropy": 5.146008253097534,
"epoch": 4.870740941049216,
"grad_norm": 1.2109375,
"learning_rate": 0.0003273583644789772,
"loss": 4.7749,
"mean_token_accuracy": 0.2180731102824211,
"num_tokens": 10116374.0,
"step": 4505
},
{
"entropy": 5.24061598777771,
"epoch": 4.876149269875609,
"grad_norm": 1.234375,
"learning_rate": 0.00032694112553039795,
"loss": 4.8887,
"mean_token_accuracy": 0.20935787856578827,
"num_tokens": 10128213.0,
"step": 4510
},
{
"entropy": 5.141972494125366,
"epoch": 4.881557598702001,
"grad_norm": 1.15625,
"learning_rate": 0.0003265236978276484,
"loss": 4.8019,
"mean_token_accuracy": 0.22588060796260834,
"num_tokens": 10139404.0,
"step": 4515
},
{
"entropy": 5.122133207321167,
"epoch": 4.886965927528394,
"grad_norm": 1.15625,
"learning_rate": 0.00032610608288766185,
"loss": 4.7715,
"mean_token_accuracy": 0.2216072142124176,
"num_tokens": 10150745.0,
"step": 4520
},
{
"entropy": 5.1891453742980955,
"epoch": 4.8923742563547865,
"grad_norm": 1.1015625,
"learning_rate": 0.00032568828222805216,
"loss": 4.7483,
"mean_token_accuracy": 0.2245130404829979,
"num_tokens": 10162734.0,
"step": 4525
},
{
"entropy": 5.132432842254639,
"epoch": 4.897782585181179,
"grad_norm": 1.09375,
"learning_rate": 0.0003252702973671075,
"loss": 4.7191,
"mean_token_accuracy": 0.23531586676836014,
"num_tokens": 10174126.0,
"step": 4530
},
{
"entropy": 5.225213718414307,
"epoch": 4.903190914007571,
"grad_norm": 1.2265625,
"learning_rate": 0.00032485212982378615,
"loss": 4.8914,
"mean_token_accuracy": 0.21589030772447587,
"num_tokens": 10185765.0,
"step": 4535
},
{
"entropy": 5.208063983917237,
"epoch": 4.908599242833964,
"grad_norm": 1.2109375,
"learning_rate": 0.0003244337811177098,
"loss": 4.7643,
"mean_token_accuracy": 0.2168218731880188,
"num_tokens": 10196970.0,
"step": 4540
},
{
"entropy": 5.170761585235596,
"epoch": 4.914007571660357,
"grad_norm": 1.1015625,
"learning_rate": 0.0003240152527691586,
"loss": 4.8783,
"mean_token_accuracy": 0.2151995062828064,
"num_tokens": 10209377.0,
"step": 4545
},
{
"entropy": 5.244362926483154,
"epoch": 4.91941590048675,
"grad_norm": 1.171875,
"learning_rate": 0.00032359654629906555,
"loss": 4.8713,
"mean_token_accuracy": 0.21505070626735687,
"num_tokens": 10219932.0,
"step": 4550
},
{
"entropy": 5.170259094238281,
"epoch": 4.924824229313142,
"grad_norm": 1.2109375,
"learning_rate": 0.00032317766322901106,
"loss": 4.7427,
"mean_token_accuracy": 0.22210992872714996,
"num_tokens": 10231242.0,
"step": 4555
},
{
"entropy": 5.135043525695801,
"epoch": 4.930232558139535,
"grad_norm": 1.15625,
"learning_rate": 0.000322758605081217,
"loss": 4.8041,
"mean_token_accuracy": 0.21644930690526962,
"num_tokens": 10241837.0,
"step": 4560
},
{
"entropy": 5.175659132003784,
"epoch": 4.935640886965928,
"grad_norm": 1.1953125,
"learning_rate": 0.00032233937337854167,
"loss": 4.8148,
"mean_token_accuracy": 0.223362535238266,
"num_tokens": 10253037.0,
"step": 4565
},
{
"entropy": 5.2676169872283936,
"epoch": 4.9410492157923205,
"grad_norm": 1.046875,
"learning_rate": 0.0003219199696444741,
"loss": 4.8368,
"mean_token_accuracy": 0.21570803821086884,
"num_tokens": 10265286.0,
"step": 4570
},
{
"entropy": 5.232824230194092,
"epoch": 4.9464575446187125,
"grad_norm": 1.203125,
"learning_rate": 0.00032150039540312843,
"loss": 4.8861,
"mean_token_accuracy": 0.22036712020635604,
"num_tokens": 10275563.0,
"step": 4575
},
{
"entropy": 5.112751483917236,
"epoch": 4.951865873445105,
"grad_norm": 1.1328125,
"learning_rate": 0.00032108065217923836,
"loss": 4.8189,
"mean_token_accuracy": 0.21947121322155,
"num_tokens": 10287335.0,
"step": 4580
},
{
"entropy": 5.149396467208862,
"epoch": 4.957274202271498,
"grad_norm": 1.125,
"learning_rate": 0.00032066074149815184,
"loss": 4.8412,
"mean_token_accuracy": 0.2221337303519249,
"num_tokens": 10298816.0,
"step": 4585
},
{
"entropy": 5.192917919158935,
"epoch": 4.962682531097891,
"grad_norm": 1.1171875,
"learning_rate": 0.00032024066488582517,
"loss": 4.7764,
"mean_token_accuracy": 0.22156908065080644,
"num_tokens": 10309018.0,
"step": 4590
},
{
"entropy": 5.179701280593872,
"epoch": 4.968090859924283,
"grad_norm": 1.1640625,
"learning_rate": 0.0003198204238688178,
"loss": 4.8037,
"mean_token_accuracy": 0.22356087863445281,
"num_tokens": 10320653.0,
"step": 4595
},
{
"entropy": 5.1929848194122314,
"epoch": 4.973499188750676,
"grad_norm": 1.09375,
"learning_rate": 0.00031940001997428645,
"loss": 4.8014,
"mean_token_accuracy": 0.22206042110919952,
"num_tokens": 10330978.0,
"step": 4600
},
{
"entropy": 5.131814289093017,
"epoch": 4.978907517577069,
"grad_norm": 1.1640625,
"learning_rate": 0.00031897945472997996,
"loss": 4.8089,
"mean_token_accuracy": 0.22218139320611954,
"num_tokens": 10342395.0,
"step": 4605
},
{
"entropy": 5.196309185028076,
"epoch": 4.984315846403462,
"grad_norm": 1.234375,
"learning_rate": 0.0003185587296642333,
"loss": 4.8273,
"mean_token_accuracy": 0.2258658915758133,
"num_tokens": 10353737.0,
"step": 4610
},
{
"entropy": 5.211770248413086,
"epoch": 4.9897241752298545,
"grad_norm": 1.1953125,
"learning_rate": 0.0003181378463059625,
"loss": 4.7893,
"mean_token_accuracy": 0.2209434911608696,
"num_tokens": 10363697.0,
"step": 4615
},
{
"entropy": 5.174803876876831,
"epoch": 4.995132504056246,
"grad_norm": 1.1953125,
"learning_rate": 0.0003177168061846584,
"loss": 4.8957,
"mean_token_accuracy": 0.2160748139023781,
"num_tokens": 10375319.0,
"step": 4620
},
{
"entropy": 5.116295708550347,
"epoch": 5.0,
"grad_norm": 1.921875,
"learning_rate": 0.0003172956108303819,
"loss": 4.814,
"mean_token_accuracy": 0.2170393533176846,
"num_tokens": 10384445.0,
"step": 4625
},
{
"entropy": 5.238847255706787,
"epoch": 5.005408328826393,
"grad_norm": 1.015625,
"learning_rate": 0.0003168742617737579,
"loss": 4.5691,
"mean_token_accuracy": 0.23728263676166533,
"num_tokens": 10396437.0,
"step": 4630
},
{
"entropy": 5.204702138900757,
"epoch": 5.010816657652786,
"grad_norm": 1.0859375,
"learning_rate": 0.00031645276054597006,
"loss": 4.5667,
"mean_token_accuracy": 0.2375429168343544,
"num_tokens": 10407369.0,
"step": 4635
},
{
"entropy": 5.085882234573364,
"epoch": 5.016224986479178,
"grad_norm": 1.015625,
"learning_rate": 0.00031603110867875435,
"loss": 4.4558,
"mean_token_accuracy": 0.23949326425790787,
"num_tokens": 10417527.0,
"step": 4640
},
{
"entropy": 5.012197780609131,
"epoch": 5.0216333153055706,
"grad_norm": 1.140625,
"learning_rate": 0.000315609307704395,
"loss": 4.4689,
"mean_token_accuracy": 0.24451786577701567,
"num_tokens": 10428281.0,
"step": 4645
},
{
"entropy": 5.044778108596802,
"epoch": 5.027041644131963,
"grad_norm": 1.0703125,
"learning_rate": 0.0003151873591557176,
"loss": 4.4426,
"mean_token_accuracy": 0.243398953974247,
"num_tokens": 10439366.0,
"step": 4650
},
{
"entropy": 5.113741016387939,
"epoch": 5.032449972958356,
"grad_norm": 1.0234375,
"learning_rate": 0.00031476526456608415,
"loss": 4.575,
"mean_token_accuracy": 0.23537073731422425,
"num_tokens": 10452074.0,
"step": 4655
},
{
"entropy": 5.181456089019775,
"epoch": 5.037858301784748,
"grad_norm": 1.1875,
"learning_rate": 0.0003143430254693873,
"loss": 4.5527,
"mean_token_accuracy": 0.23576689809560775,
"num_tokens": 10461940.0,
"step": 4660
},
{
"entropy": 5.082711887359619,
"epoch": 5.043266630611141,
"grad_norm": 1.15625,
"learning_rate": 0.0003139206434000451,
"loss": 4.5211,
"mean_token_accuracy": 0.23467014580965043,
"num_tokens": 10473175.0,
"step": 4665
},
{
"entropy": 5.158622694015503,
"epoch": 5.048674959437534,
"grad_norm": 1.0703125,
"learning_rate": 0.0003134981198929948,
"loss": 4.5545,
"mean_token_accuracy": 0.22886019051074982,
"num_tokens": 10484977.0,
"step": 4670
},
{
"entropy": 5.163059234619141,
"epoch": 5.054083288263927,
"grad_norm": 1.1015625,
"learning_rate": 0.00031307545648368777,
"loss": 4.5321,
"mean_token_accuracy": 0.23974120765924453,
"num_tokens": 10495924.0,
"step": 4675
},
{
"entropy": 5.099232864379883,
"epoch": 5.059491617090319,
"grad_norm": 1.1328125,
"learning_rate": 0.00031265265470808393,
"loss": 4.5614,
"mean_token_accuracy": 0.23395949751138687,
"num_tokens": 10508374.0,
"step": 4680
},
{
"entropy": 5.054331731796265,
"epoch": 5.064899945916712,
"grad_norm": 1.125,
"learning_rate": 0.00031222971610264595,
"loss": 4.4745,
"mean_token_accuracy": 0.24568151980638503,
"num_tokens": 10519704.0,
"step": 4685
},
{
"entropy": 5.145371770858764,
"epoch": 5.0703082747431045,
"grad_norm": 1.25,
"learning_rate": 0.00031180664220433347,
"loss": 4.5883,
"mean_token_accuracy": 0.23278012424707412,
"num_tokens": 10531717.0,
"step": 4690
},
{
"entropy": 5.085246515274048,
"epoch": 5.075716603569497,
"grad_norm": 1.1796875,
"learning_rate": 0.00031138343455059823,
"loss": 4.5455,
"mean_token_accuracy": 0.23857734203338624,
"num_tokens": 10542941.0,
"step": 4695
},
{
"entropy": 5.108962059020996,
"epoch": 5.081124932395889,
"grad_norm": 1.1171875,
"learning_rate": 0.0003109600946793778,
"loss": 4.4763,
"mean_token_accuracy": 0.24454210102558135,
"num_tokens": 10553877.0,
"step": 4700
},
{
"entropy": 5.1225074291229244,
"epoch": 5.086533261222282,
"grad_norm": 1.15625,
"learning_rate": 0.00031053662412909024,
"loss": 4.4652,
"mean_token_accuracy": 0.2461608022451401,
"num_tokens": 10566123.0,
"step": 4705
},
{
"entropy": 5.052347564697266,
"epoch": 5.091941590048675,
"grad_norm": 1.171875,
"learning_rate": 0.0003101130244386283,
"loss": 4.5075,
"mean_token_accuracy": 0.24042530804872514,
"num_tokens": 10576972.0,
"step": 4710
},
{
"entropy": 5.133987617492676,
"epoch": 5.097349918875068,
"grad_norm": 1.140625,
"learning_rate": 0.00030968929714735456,
"loss": 4.5264,
"mean_token_accuracy": 0.2366169273853302,
"num_tokens": 10588708.0,
"step": 4715
},
{
"entropy": 5.115154647827149,
"epoch": 5.10275824770146,
"grad_norm": 1.1953125,
"learning_rate": 0.0003092654437950947,
"loss": 4.5441,
"mean_token_accuracy": 0.23340435177087784,
"num_tokens": 10599410.0,
"step": 4720
},
{
"entropy": 5.219666385650635,
"epoch": 5.108166576527853,
"grad_norm": 1.09375,
"learning_rate": 0.0003088414659221331,
"loss": 4.6635,
"mean_token_accuracy": 0.22346747666597366,
"num_tokens": 10612284.0,
"step": 4725
},
{
"entropy": 5.0701343536376955,
"epoch": 5.113574905354246,
"grad_norm": 1.25,
"learning_rate": 0.000308417365069206,
"loss": 4.5183,
"mean_token_accuracy": 0.24242762327194214,
"num_tokens": 10623065.0,
"step": 4730
},
{
"entropy": 5.147444248199463,
"epoch": 5.1189832341806385,
"grad_norm": 1.125,
"learning_rate": 0.00030799314277749697,
"loss": 4.5371,
"mean_token_accuracy": 0.24343049228191377,
"num_tokens": 10634574.0,
"step": 4735
},
{
"entropy": 5.171050119400024,
"epoch": 5.1243915630070305,
"grad_norm": 1.171875,
"learning_rate": 0.00030756880058863085,
"loss": 4.6206,
"mean_token_accuracy": 0.23264120370149613,
"num_tokens": 10645765.0,
"step": 4740
},
{
"entropy": 5.119320726394653,
"epoch": 5.129799891833423,
"grad_norm": 1.2890625,
"learning_rate": 0.00030714434004466823,
"loss": 4.5116,
"mean_token_accuracy": 0.24276455491781235,
"num_tokens": 10655901.0,
"step": 4745
},
{
"entropy": 5.227843856811523,
"epoch": 5.135208220659816,
"grad_norm": 1.171875,
"learning_rate": 0.00030671976268809947,
"loss": 4.7132,
"mean_token_accuracy": 0.22757336050271987,
"num_tokens": 10668030.0,
"step": 4750
},
{
"entropy": 5.1313238620758055,
"epoch": 5.140616549486209,
"grad_norm": 1.0625,
"learning_rate": 0.00030629507006183995,
"loss": 4.6016,
"mean_token_accuracy": 0.23523004949092866,
"num_tokens": 10681056.0,
"step": 4755
},
{
"entropy": 5.189333391189575,
"epoch": 5.146024878312601,
"grad_norm": 1.15625,
"learning_rate": 0.0003058702637092234,
"loss": 4.6499,
"mean_token_accuracy": 0.2233363226056099,
"num_tokens": 10692160.0,
"step": 4760
},
{
"entropy": 5.162896585464478,
"epoch": 5.151433207138994,
"grad_norm": 1.2421875,
"learning_rate": 0.00030544534517399724,
"loss": 4.57,
"mean_token_accuracy": 0.23276271671056747,
"num_tokens": 10703253.0,
"step": 4765
},
{
"entropy": 5.137832689285278,
"epoch": 5.156841535965387,
"grad_norm": 1.2578125,
"learning_rate": 0.0003050203160003163,
"loss": 4.5672,
"mean_token_accuracy": 0.23495166301727294,
"num_tokens": 10714154.0,
"step": 4770
},
{
"entropy": 5.098254823684693,
"epoch": 5.16224986479178,
"grad_norm": 1.03125,
"learning_rate": 0.0003045951777327377,
"loss": 4.4893,
"mean_token_accuracy": 0.2435910999774933,
"num_tokens": 10726735.0,
"step": 4775
},
{
"entropy": 5.097394609451294,
"epoch": 5.167658193618172,
"grad_norm": 1.1015625,
"learning_rate": 0.0003041699319162148,
"loss": 4.5748,
"mean_token_accuracy": 0.24261797219514847,
"num_tokens": 10737536.0,
"step": 4780
},
{
"entropy": 4.9923089981079105,
"epoch": 5.173066522444564,
"grad_norm": 1.234375,
"learning_rate": 0.00030374458009609193,
"loss": 4.5363,
"mean_token_accuracy": 0.23299431949853897,
"num_tokens": 10747354.0,
"step": 4785
},
{
"entropy": 5.16452956199646,
"epoch": 5.178474851270957,
"grad_norm": 1.3046875,
"learning_rate": 0.0003033191238180985,
"loss": 4.5927,
"mean_token_accuracy": 0.23733182847499848,
"num_tokens": 10757022.0,
"step": 4790
},
{
"entropy": 5.186676454544068,
"epoch": 5.18388318009735,
"grad_norm": 1.1171875,
"learning_rate": 0.0003028935646283438,
"loss": 4.6015,
"mean_token_accuracy": 0.2369183361530304,
"num_tokens": 10768485.0,
"step": 4795
},
{
"entropy": 5.111834764480591,
"epoch": 5.189291508923742,
"grad_norm": 1.1640625,
"learning_rate": 0.00030246790407331063,
"loss": 4.5177,
"mean_token_accuracy": 0.23588780611753463,
"num_tokens": 10779164.0,
"step": 4800
},
{
"entropy": 5.110886144638061,
"epoch": 5.194699837750135,
"grad_norm": 1.140625,
"learning_rate": 0.00030204214369985066,
"loss": 4.611,
"mean_token_accuracy": 0.23651799112558364,
"num_tokens": 10790986.0,
"step": 4805
},
{
"entropy": 5.150386667251587,
"epoch": 5.200108166576528,
"grad_norm": 1.1015625,
"learning_rate": 0.00030161628505517797,
"loss": 4.567,
"mean_token_accuracy": 0.24198322594165803,
"num_tokens": 10803456.0,
"step": 4810
},
{
"entropy": 5.091692543029785,
"epoch": 5.205516495402921,
"grad_norm": 1.34375,
"learning_rate": 0.00030119032968686397,
"loss": 4.5264,
"mean_token_accuracy": 0.24162456393241882,
"num_tokens": 10814884.0,
"step": 4815
},
{
"entropy": 5.146925687789917,
"epoch": 5.210924824229313,
"grad_norm": 1.1796875,
"learning_rate": 0.00030076427914283127,
"loss": 4.5666,
"mean_token_accuracy": 0.23257468938827514,
"num_tokens": 10825006.0,
"step": 4820
},
{
"entropy": 5.039157390594482,
"epoch": 5.2163331530557056,
"grad_norm": 1.2734375,
"learning_rate": 0.00030033813497134864,
"loss": 4.5203,
"mean_token_accuracy": 0.24057147949934005,
"num_tokens": 10834697.0,
"step": 4825
},
{
"entropy": 5.098128366470337,
"epoch": 5.221741481882098,
"grad_norm": 1.265625,
"learning_rate": 0.000299911898721025,
"loss": 4.599,
"mean_token_accuracy": 0.23328943699598312,
"num_tokens": 10845954.0,
"step": 4830
},
{
"entropy": 5.17861156463623,
"epoch": 5.227149810708491,
"grad_norm": 1.140625,
"learning_rate": 0.00029948557194080385,
"loss": 4.5884,
"mean_token_accuracy": 0.23492339104413987,
"num_tokens": 10858463.0,
"step": 4835
},
{
"entropy": 5.1870606422424315,
"epoch": 5.232558139534884,
"grad_norm": 1.0546875,
"learning_rate": 0.0002990591561799576,
"loss": 4.6591,
"mean_token_accuracy": 0.22013484686613083,
"num_tokens": 10870329.0,
"step": 4840
},
{
"entropy": 5.102496337890625,
"epoch": 5.237966468361276,
"grad_norm": 1.15625,
"learning_rate": 0.0002986326529880823,
"loss": 4.5555,
"mean_token_accuracy": 0.23047195971012116,
"num_tokens": 10881443.0,
"step": 4845
},
{
"entropy": 5.122408819198609,
"epoch": 5.243374797187669,
"grad_norm": 1.109375,
"learning_rate": 0.0002982060639150913,
"loss": 4.6344,
"mean_token_accuracy": 0.22991830259561538,
"num_tokens": 10894102.0,
"step": 4850
},
{
"entropy": 5.168514251708984,
"epoch": 5.248783126014062,
"grad_norm": 1.15625,
"learning_rate": 0.0002977793905112106,
"loss": 4.625,
"mean_token_accuracy": 0.23717804998159409,
"num_tokens": 10904914.0,
"step": 4855
},
{
"entropy": 5.074016523361206,
"epoch": 5.254191454840455,
"grad_norm": 1.109375,
"learning_rate": 0.00029735263432697183,
"loss": 4.468,
"mean_token_accuracy": 0.24763923585414888,
"num_tokens": 10916036.0,
"step": 4860
},
{
"entropy": 5.112421274185181,
"epoch": 5.259599783666847,
"grad_norm": 1.3046875,
"learning_rate": 0.0002969257969132085,
"loss": 4.6181,
"mean_token_accuracy": 0.23973572254180908,
"num_tokens": 10926852.0,
"step": 4865
},
{
"entropy": 5.091146469116211,
"epoch": 5.2650081124932395,
"grad_norm": 1.359375,
"learning_rate": 0.0002964988798210485,
"loss": 4.5821,
"mean_token_accuracy": 0.2380119353532791,
"num_tokens": 10937370.0,
"step": 4870
},
{
"entropy": 5.145650339126587,
"epoch": 5.270416441319632,
"grad_norm": 1.2578125,
"learning_rate": 0.0002960718846019095,
"loss": 4.5625,
"mean_token_accuracy": 0.24356661587953568,
"num_tokens": 10948835.0,
"step": 4875
},
{
"entropy": 5.092243242263794,
"epoch": 5.275824770146025,
"grad_norm": 1.21875,
"learning_rate": 0.0002956448128074931,
"loss": 4.5043,
"mean_token_accuracy": 0.23767364025115967,
"num_tokens": 10958553.0,
"step": 4880
},
{
"entropy": 5.024548006057739,
"epoch": 5.281233098972417,
"grad_norm": 1.21875,
"learning_rate": 0.0002952176659897794,
"loss": 4.5111,
"mean_token_accuracy": 0.2386179208755493,
"num_tokens": 10970063.0,
"step": 4885
},
{
"entropy": 5.1151021957397464,
"epoch": 5.28664142779881,
"grad_norm": 1.203125,
"learning_rate": 0.0002947904457010207,
"loss": 4.5561,
"mean_token_accuracy": 0.23923205584287643,
"num_tokens": 10981011.0,
"step": 4890
},
{
"entropy": 5.198963975906372,
"epoch": 5.292049756625203,
"grad_norm": 1.171875,
"learning_rate": 0.0002943631534937366,
"loss": 4.6142,
"mean_token_accuracy": 0.22557153850793837,
"num_tokens": 10993337.0,
"step": 4895
},
{
"entropy": 5.0785270690917965,
"epoch": 5.297458085451596,
"grad_norm": 1.1015625,
"learning_rate": 0.0002939357909207079,
"loss": 4.5482,
"mean_token_accuracy": 0.2385883703827858,
"num_tokens": 11003646.0,
"step": 4900
},
{
"entropy": 5.081256151199341,
"epoch": 5.302866414277988,
"grad_norm": 1.2890625,
"learning_rate": 0.0002935083595349713,
"loss": 4.5205,
"mean_token_accuracy": 0.24443619400262834,
"num_tokens": 11014249.0,
"step": 4905
},
{
"entropy": 5.134830904006958,
"epoch": 5.308274743104381,
"grad_norm": 1.0859375,
"learning_rate": 0.00029308086088981335,
"loss": 4.5709,
"mean_token_accuracy": 0.23936382979154586,
"num_tokens": 11025997.0,
"step": 4910
},
{
"entropy": 5.095680618286133,
"epoch": 5.3136830719307735,
"grad_norm": 1.25,
"learning_rate": 0.00029265329653876515,
"loss": 4.4915,
"mean_token_accuracy": 0.2470926374197006,
"num_tokens": 11036815.0,
"step": 4915
},
{
"entropy": 5.1458740234375,
"epoch": 5.319091400757166,
"grad_norm": 1.1875,
"learning_rate": 0.0002922256680355965,
"loss": 4.6738,
"mean_token_accuracy": 0.2303202599287033,
"num_tokens": 11048390.0,
"step": 4920
},
{
"entropy": 5.0420708656311035,
"epoch": 5.324499729583558,
"grad_norm": 1.234375,
"learning_rate": 0.00029179797693431046,
"loss": 4.5042,
"mean_token_accuracy": 0.24472840279340743,
"num_tokens": 11059410.0,
"step": 4925
},
{
"entropy": 5.162745952606201,
"epoch": 5.329908058409951,
"grad_norm": 1.234375,
"learning_rate": 0.0002913702247891374,
"loss": 4.5853,
"mean_token_accuracy": 0.22566224187612532,
"num_tokens": 11069509.0,
"step": 4930
},
{
"entropy": 5.071948909759522,
"epoch": 5.335316387236344,
"grad_norm": 1.25,
"learning_rate": 0.0002909424131545296,
"loss": 4.479,
"mean_token_accuracy": 0.24245238155126572,
"num_tokens": 11080204.0,
"step": 4935
},
{
"entropy": 5.166419792175293,
"epoch": 5.340724716062737,
"grad_norm": 1.25,
"learning_rate": 0.00029051454358515553,
"loss": 4.6862,
"mean_token_accuracy": 0.22651290148496628,
"num_tokens": 11091130.0,
"step": 4940
},
{
"entropy": 5.118738889694214,
"epoch": 5.346133044889129,
"grad_norm": 1.1328125,
"learning_rate": 0.00029008661763589436,
"loss": 4.6062,
"mean_token_accuracy": 0.2306537449359894,
"num_tokens": 11101853.0,
"step": 4945
},
{
"entropy": 5.130676221847534,
"epoch": 5.351541373715522,
"grad_norm": 1.1015625,
"learning_rate": 0.0002896586368618297,
"loss": 4.5585,
"mean_token_accuracy": 0.234729540348053,
"num_tokens": 11113092.0,
"step": 4950
},
{
"entropy": 5.10734806060791,
"epoch": 5.356949702541915,
"grad_norm": 1.21875,
"learning_rate": 0.00028923060281824483,
"loss": 4.6407,
"mean_token_accuracy": 0.2330939382314682,
"num_tokens": 11123756.0,
"step": 4955
},
{
"entropy": 5.1769123554229735,
"epoch": 5.3623580313683075,
"grad_norm": 1.1640625,
"learning_rate": 0.0002888025170606165,
"loss": 4.6028,
"mean_token_accuracy": 0.22955313324928284,
"num_tokens": 11135493.0,
"step": 4960
},
{
"entropy": 5.083680295944214,
"epoch": 5.367766360194699,
"grad_norm": 1.1796875,
"learning_rate": 0.00028837438114460924,
"loss": 4.5537,
"mean_token_accuracy": 0.23917055875062943,
"num_tokens": 11146323.0,
"step": 4965
},
{
"entropy": 5.0477190017700195,
"epoch": 5.373174689021092,
"grad_norm": 1.1328125,
"learning_rate": 0.0002879461966260699,
"loss": 4.5592,
"mean_token_accuracy": 0.23870966732501983,
"num_tokens": 11157434.0,
"step": 4970
},
{
"entropy": 5.092014265060425,
"epoch": 5.378583017847485,
"grad_norm": 1.203125,
"learning_rate": 0.00028751796506102224,
"loss": 4.579,
"mean_token_accuracy": 0.23468010872602463,
"num_tokens": 11169096.0,
"step": 4975
},
{
"entropy": 5.095512008666992,
"epoch": 5.383991346673878,
"grad_norm": 1.1328125,
"learning_rate": 0.00028708968800566056,
"loss": 4.5154,
"mean_token_accuracy": 0.23920983970165252,
"num_tokens": 11180260.0,
"step": 4980
},
{
"entropy": 5.107637786865235,
"epoch": 5.38939967550027,
"grad_norm": 1.1015625,
"learning_rate": 0.00028666136701634474,
"loss": 4.5426,
"mean_token_accuracy": 0.24653149843215943,
"num_tokens": 11191843.0,
"step": 4985
},
{
"entropy": 5.098368978500366,
"epoch": 5.394808004326663,
"grad_norm": 1.1328125,
"learning_rate": 0.0002862330036495942,
"loss": 4.5658,
"mean_token_accuracy": 0.24045238494873047,
"num_tokens": 11202850.0,
"step": 4990
},
{
"entropy": 5.0349040031433105,
"epoch": 5.400216333153056,
"grad_norm": 1.1171875,
"learning_rate": 0.0002858045994620825,
"loss": 4.4996,
"mean_token_accuracy": 0.23996165841817857,
"num_tokens": 11215030.0,
"step": 4995
},
{
"entropy": 5.007499742507934,
"epoch": 5.405624661979449,
"grad_norm": 1.171875,
"learning_rate": 0.00028537615601063133,
"loss": 4.444,
"mean_token_accuracy": 0.24101929515600204,
"num_tokens": 11225917.0,
"step": 5000
},
{
"epoch": 5.405624661979449,
"eval_entropy": 5.025897739150308,
"eval_loss": 5.854259490966797,
"eval_mean_token_accuracy": 0.18258314691483973,
"eval_num_tokens": 11225917.0,
"eval_runtime": 2.501,
"eval_samples_per_second": 1405.414,
"eval_steps_per_second": 175.927,
"step": 5000
},
{
"entropy": 5.093756628036499,
"epoch": 5.411032990805841,
"grad_norm": 1.2578125,
"learning_rate": 0.0002849476748522052,
"loss": 4.6827,
"mean_token_accuracy": 0.22344067245721816,
"num_tokens": 11237744.0,
"step": 5005
},
{
"entropy": 5.166733264923096,
"epoch": 5.416441319632233,
"grad_norm": 1.2578125,
"learning_rate": 0.0002845191575439057,
"loss": 4.5608,
"mean_token_accuracy": 0.23659120351076127,
"num_tokens": 11248294.0,
"step": 5010
},
{
"entropy": 5.071858692169189,
"epoch": 5.421849648458626,
"grad_norm": 1.09375,
"learning_rate": 0.0002840906056429658,
"loss": 4.543,
"mean_token_accuracy": 0.2445327654480934,
"num_tokens": 11259483.0,
"step": 5015
},
{
"entropy": 5.0410778522491455,
"epoch": 5.427257977285019,
"grad_norm": 1.0390625,
"learning_rate": 0.0002836620207067439,
"loss": 4.6533,
"mean_token_accuracy": 0.23245096653699876,
"num_tokens": 11270965.0,
"step": 5020
},
{
"entropy": 5.1253478050231935,
"epoch": 5.432666306111411,
"grad_norm": 1.2421875,
"learning_rate": 0.00028323340429271875,
"loss": 4.5916,
"mean_token_accuracy": 0.2355559289455414,
"num_tokens": 11281390.0,
"step": 5025
},
{
"entropy": 5.158014965057373,
"epoch": 5.438074634937804,
"grad_norm": 1.3203125,
"learning_rate": 0.0002828047579584833,
"loss": 4.5996,
"mean_token_accuracy": 0.235298053920269,
"num_tokens": 11291801.0,
"step": 5030
},
{
"entropy": 5.028060054779052,
"epoch": 5.443482963764197,
"grad_norm": 1.1484375,
"learning_rate": 0.00028237608326173944,
"loss": 4.5475,
"mean_token_accuracy": 0.23873327672481537,
"num_tokens": 11302807.0,
"step": 5035
},
{
"entropy": 5.133496522903442,
"epoch": 5.44889129259059,
"grad_norm": 1.1328125,
"learning_rate": 0.00028194738176029206,
"loss": 4.5827,
"mean_token_accuracy": 0.237274831533432,
"num_tokens": 11314690.0,
"step": 5040
},
{
"entropy": 5.043130207061767,
"epoch": 5.4542996214169825,
"grad_norm": 1.21875,
"learning_rate": 0.00028151865501204316,
"loss": 4.5561,
"mean_token_accuracy": 0.23939095735549926,
"num_tokens": 11325887.0,
"step": 5045
},
{
"entropy": 5.0096173763275145,
"epoch": 5.4597079502433745,
"grad_norm": 1.15625,
"learning_rate": 0.00028108990457498696,
"loss": 4.6158,
"mean_token_accuracy": 0.23323608338832855,
"num_tokens": 11337609.0,
"step": 5050
},
{
"entropy": 5.127987098693848,
"epoch": 5.465116279069767,
"grad_norm": 1.2265625,
"learning_rate": 0.00028066113200720343,
"loss": 4.4907,
"mean_token_accuracy": 0.2452102333307266,
"num_tokens": 11348982.0,
"step": 5055
},
{
"entropy": 5.180063676834107,
"epoch": 5.47052460789616,
"grad_norm": 1.09375,
"learning_rate": 0.00028023233886685314,
"loss": 4.6829,
"mean_token_accuracy": 0.2316138207912445,
"num_tokens": 11362029.0,
"step": 5060
},
{
"entropy": 5.082441329956055,
"epoch": 5.475932936722553,
"grad_norm": 1.15625,
"learning_rate": 0.0002798035267121713,
"loss": 4.5652,
"mean_token_accuracy": 0.23488624393939972,
"num_tokens": 11372557.0,
"step": 5065
},
{
"entropy": 5.116550159454346,
"epoch": 5.481341265548945,
"grad_norm": 1.1953125,
"learning_rate": 0.0002793746971014623,
"loss": 4.5782,
"mean_token_accuracy": 0.23954371213912964,
"num_tokens": 11383420.0,
"step": 5070
},
{
"entropy": 5.0962498664855955,
"epoch": 5.486749594375338,
"grad_norm": 1.2265625,
"learning_rate": 0.0002789458515930939,
"loss": 4.5219,
"mean_token_accuracy": 0.23744451254606247,
"num_tokens": 11395253.0,
"step": 5075
},
{
"entropy": 5.032715129852295,
"epoch": 5.492157923201731,
"grad_norm": 1.1015625,
"learning_rate": 0.00027851699174549164,
"loss": 4.5773,
"mean_token_accuracy": 0.2320207104086876,
"num_tokens": 11407411.0,
"step": 5080
},
{
"entropy": 5.140994262695313,
"epoch": 5.497566252028124,
"grad_norm": 1.1328125,
"learning_rate": 0.0002780881191171333,
"loss": 4.615,
"mean_token_accuracy": 0.22736505120992662,
"num_tokens": 11417742.0,
"step": 5085
},
{
"entropy": 5.0546506404876705,
"epoch": 5.502974580854516,
"grad_norm": 1.2265625,
"learning_rate": 0.00027765923526654304,
"loss": 4.5209,
"mean_token_accuracy": 0.23477157056331635,
"num_tokens": 11428948.0,
"step": 5090
},
{
"entropy": 5.054863119125367,
"epoch": 5.5083829096809085,
"grad_norm": 1.0859375,
"learning_rate": 0.00027723034175228554,
"loss": 4.5463,
"mean_token_accuracy": 0.23661569207906724,
"num_tokens": 11440246.0,
"step": 5095
},
{
"entropy": 5.048584794998169,
"epoch": 5.513791238507301,
"grad_norm": 1.1875,
"learning_rate": 0.000276801440132961,
"loss": 4.5329,
"mean_token_accuracy": 0.24560239017009736,
"num_tokens": 11451984.0,
"step": 5100
},
{
"entropy": 5.17749514579773,
"epoch": 5.519199567333694,
"grad_norm": 1.1953125,
"learning_rate": 0.0002763725319671989,
"loss": 4.6634,
"mean_token_accuracy": 0.23412647545337678,
"num_tokens": 11462763.0,
"step": 5105
},
{
"entropy": 5.152378559112549,
"epoch": 5.524607896160086,
"grad_norm": 1.140625,
"learning_rate": 0.0002759436188136525,
"loss": 4.6209,
"mean_token_accuracy": 0.2340094581246376,
"num_tokens": 11474375.0,
"step": 5110
},
{
"entropy": 5.162030458450317,
"epoch": 5.530016224986479,
"grad_norm": 1.265625,
"learning_rate": 0.00027551470223099306,
"loss": 4.5804,
"mean_token_accuracy": 0.23582287579774858,
"num_tokens": 11484846.0,
"step": 5115
},
{
"entropy": 5.085168123245239,
"epoch": 5.535424553812872,
"grad_norm": 1.203125,
"learning_rate": 0.0002750857837779045,
"loss": 4.6125,
"mean_token_accuracy": 0.2338113233447075,
"num_tokens": 11495970.0,
"step": 5120
},
{
"entropy": 5.131478214263916,
"epoch": 5.540832882639265,
"grad_norm": 1.1796875,
"learning_rate": 0.0002746568650130775,
"loss": 4.602,
"mean_token_accuracy": 0.239996737241745,
"num_tokens": 11507172.0,
"step": 5125
},
{
"entropy": 5.063758850097656,
"epoch": 5.546241211465657,
"grad_norm": 1.1640625,
"learning_rate": 0.0002742279474952039,
"loss": 4.5921,
"mean_token_accuracy": 0.2350480154156685,
"num_tokens": 11518400.0,
"step": 5130
},
{
"entropy": 5.166097927093506,
"epoch": 5.55164954029205,
"grad_norm": 1.1953125,
"learning_rate": 0.00027379903278297086,
"loss": 4.6047,
"mean_token_accuracy": 0.23305439949035645,
"num_tokens": 11528993.0,
"step": 5135
},
{
"entropy": 5.123815202713013,
"epoch": 5.5570578691184425,
"grad_norm": 1.234375,
"learning_rate": 0.00027337012243505536,
"loss": 4.6256,
"mean_token_accuracy": 0.2337266683578491,
"num_tokens": 11540783.0,
"step": 5140
},
{
"entropy": 5.022006273269653,
"epoch": 5.562466197944835,
"grad_norm": 1.1796875,
"learning_rate": 0.00027294121801011887,
"loss": 4.5714,
"mean_token_accuracy": 0.23104532063007355,
"num_tokens": 11551758.0,
"step": 5145
},
{
"entropy": 5.148687028884888,
"epoch": 5.567874526771227,
"grad_norm": 1.234375,
"learning_rate": 0.00027251232106680084,
"loss": 4.5551,
"mean_token_accuracy": 0.24146983176469802,
"num_tokens": 11562593.0,
"step": 5150
},
{
"entropy": 5.116436004638672,
"epoch": 5.57328285559762,
"grad_norm": 1.0859375,
"learning_rate": 0.00027208343316371383,
"loss": 4.6198,
"mean_token_accuracy": 0.2371422365307808,
"num_tokens": 11574301.0,
"step": 5155
},
{
"entropy": 5.048832607269287,
"epoch": 5.578691184424013,
"grad_norm": 1.03125,
"learning_rate": 0.0002716545558594373,
"loss": 4.5523,
"mean_token_accuracy": 0.2403918370604515,
"num_tokens": 11585216.0,
"step": 5160
},
{
"entropy": 5.152141761779785,
"epoch": 5.584099513250406,
"grad_norm": 1.2265625,
"learning_rate": 0.0002712256907125126,
"loss": 4.6551,
"mean_token_accuracy": 0.23105957508087158,
"num_tokens": 11597079.0,
"step": 5165
},
{
"entropy": 5.142142248153687,
"epoch": 5.589507842076799,
"grad_norm": 1.2265625,
"learning_rate": 0.0002707968392814366,
"loss": 4.6106,
"mean_token_accuracy": 0.23629478067159654,
"num_tokens": 11608225.0,
"step": 5170
},
{
"entropy": 5.111922550201416,
"epoch": 5.594916170903191,
"grad_norm": 1.140625,
"learning_rate": 0.00027036800312465635,
"loss": 4.6008,
"mean_token_accuracy": 0.23783642500638963,
"num_tokens": 11620530.0,
"step": 5175
},
{
"entropy": 5.055934715270996,
"epoch": 5.600324499729584,
"grad_norm": 1.078125,
"learning_rate": 0.0002699391838005634,
"loss": 4.6192,
"mean_token_accuracy": 0.24495489299297332,
"num_tokens": 11632409.0,
"step": 5180
},
{
"entropy": 5.066023874282837,
"epoch": 5.605732828555976,
"grad_norm": 1.078125,
"learning_rate": 0.00026951038286748824,
"loss": 4.525,
"mean_token_accuracy": 0.24540913552045823,
"num_tokens": 11644294.0,
"step": 5185
},
{
"entropy": 5.129907131195068,
"epoch": 5.611141157382368,
"grad_norm": 1.1328125,
"learning_rate": 0.0002690816018836945,
"loss": 4.5763,
"mean_token_accuracy": 0.24038067907094957,
"num_tokens": 11655370.0,
"step": 5190
},
{
"entropy": 5.1079496383667,
"epoch": 5.616549486208761,
"grad_norm": 1.140625,
"learning_rate": 0.0002686528424073731,
"loss": 4.5601,
"mean_token_accuracy": 0.24266224652528762,
"num_tokens": 11666947.0,
"step": 5195
},
{
"entropy": 5.076470422744751,
"epoch": 5.621957815035154,
"grad_norm": 1.140625,
"learning_rate": 0.00026822410599663704,
"loss": 4.5016,
"mean_token_accuracy": 0.24484066516160966,
"num_tokens": 11677281.0,
"step": 5200
},
{
"entropy": 5.092998456954956,
"epoch": 5.627366143861547,
"grad_norm": 1.1875,
"learning_rate": 0.00026779539420951554,
"loss": 4.5803,
"mean_token_accuracy": 0.22966374903917314,
"num_tokens": 11688582.0,
"step": 5205
},
{
"entropy": 5.0741111755371096,
"epoch": 5.63277447268794,
"grad_norm": 1.171875,
"learning_rate": 0.0002673667086039481,
"loss": 4.6049,
"mean_token_accuracy": 0.23013100028038025,
"num_tokens": 11698691.0,
"step": 5210
},
{
"entropy": 5.139614248275757,
"epoch": 5.638182801514332,
"grad_norm": 1.1171875,
"learning_rate": 0.0002669380507377792,
"loss": 4.6618,
"mean_token_accuracy": 0.22901782542467117,
"num_tokens": 11710993.0,
"step": 5215
},
{
"entropy": 5.100244331359863,
"epoch": 5.643591130340725,
"grad_norm": 1.1171875,
"learning_rate": 0.0002665094221687525,
"loss": 4.536,
"mean_token_accuracy": 0.243090358376503,
"num_tokens": 11722146.0,
"step": 5220
},
{
"entropy": 5.205877304077148,
"epoch": 5.6489994591671175,
"grad_norm": 1.171875,
"learning_rate": 0.0002660808244545054,
"loss": 4.7094,
"mean_token_accuracy": 0.22805256843566896,
"num_tokens": 11732756.0,
"step": 5225
},
{
"entropy": 5.10625467300415,
"epoch": 5.6544077879935095,
"grad_norm": 1.09375,
"learning_rate": 0.00026565225915256276,
"loss": 4.5216,
"mean_token_accuracy": 0.2445647433400154,
"num_tokens": 11744409.0,
"step": 5230
},
{
"entropy": 5.014366579055786,
"epoch": 5.659816116819902,
"grad_norm": 1.1953125,
"learning_rate": 0.000265223727820332,
"loss": 4.4623,
"mean_token_accuracy": 0.2480989769101143,
"num_tokens": 11754351.0,
"step": 5235
},
{
"entropy": 5.090316534042358,
"epoch": 5.665224445646295,
"grad_norm": 1.1328125,
"learning_rate": 0.0002647952320150969,
"loss": 4.5905,
"mean_token_accuracy": 0.24032554179430007,
"num_tokens": 11765800.0,
"step": 5240
},
{
"entropy": 5.095514488220215,
"epoch": 5.670632774472688,
"grad_norm": 1.2734375,
"learning_rate": 0.0002643667732940122,
"loss": 4.5841,
"mean_token_accuracy": 0.23553522378206254,
"num_tokens": 11777305.0,
"step": 5245
},
{
"entropy": 5.1290380477905275,
"epoch": 5.676041103299081,
"grad_norm": 1.203125,
"learning_rate": 0.00026393835321409796,
"loss": 4.6418,
"mean_token_accuracy": 0.23847149312496185,
"num_tokens": 11788289.0,
"step": 5250
},
{
"entropy": 5.075438165664673,
"epoch": 5.681449432125473,
"grad_norm": 1.28125,
"learning_rate": 0.00026350997333223375,
"loss": 4.5344,
"mean_token_accuracy": 0.24352279901504517,
"num_tokens": 11798759.0,
"step": 5255
},
{
"entropy": 5.111510705947876,
"epoch": 5.686857760951866,
"grad_norm": 1.2265625,
"learning_rate": 0.00026308163520515293,
"loss": 4.6373,
"mean_token_accuracy": 0.22892093807458877,
"num_tokens": 11809940.0,
"step": 5260
},
{
"entropy": 5.087829494476319,
"epoch": 5.692266089778259,
"grad_norm": 1.1640625,
"learning_rate": 0.00026265334038943735,
"loss": 4.5126,
"mean_token_accuracy": 0.24585696309804916,
"num_tokens": 11821145.0,
"step": 5265
},
{
"entropy": 5.110506916046143,
"epoch": 5.6976744186046515,
"grad_norm": 1.2265625,
"learning_rate": 0.0002622250904415113,
"loss": 4.59,
"mean_token_accuracy": 0.23473258018493653,
"num_tokens": 11832007.0,
"step": 5270
},
{
"entropy": 5.237685108184815,
"epoch": 5.7030827474310435,
"grad_norm": 1.1484375,
"learning_rate": 0.0002617968869176362,
"loss": 4.6741,
"mean_token_accuracy": 0.2271284654736519,
"num_tokens": 11844356.0,
"step": 5275
},
{
"entropy": 5.044270324707031,
"epoch": 5.708491076257436,
"grad_norm": 1.2890625,
"learning_rate": 0.0002613687313739044,
"loss": 4.5494,
"mean_token_accuracy": 0.2323143571615219,
"num_tokens": 11855294.0,
"step": 5280
},
{
"entropy": 5.0990400314331055,
"epoch": 5.713899405083829,
"grad_norm": 1.140625,
"learning_rate": 0.0002609406253662344,
"loss": 4.66,
"mean_token_accuracy": 0.2284865841269493,
"num_tokens": 11865825.0,
"step": 5285
},
{
"entropy": 5.070143222808838,
"epoch": 5.719307733910222,
"grad_norm": 1.2890625,
"learning_rate": 0.0002605125704503643,
"loss": 4.5325,
"mean_token_accuracy": 0.2336326465010643,
"num_tokens": 11876265.0,
"step": 5290
},
{
"entropy": 5.146752786636353,
"epoch": 5.724716062736614,
"grad_norm": 1.140625,
"learning_rate": 0.0002600845681818467,
"loss": 4.5812,
"mean_token_accuracy": 0.24262797832489014,
"num_tokens": 11888220.0,
"step": 5295
},
{
"entropy": 5.1307909965515135,
"epoch": 5.730124391563007,
"grad_norm": 1.1171875,
"learning_rate": 0.0002596566201160427,
"loss": 4.617,
"mean_token_accuracy": 0.2428817257285118,
"num_tokens": 11899809.0,
"step": 5300
},
{
"entropy": 5.049868202209472,
"epoch": 5.7355327203894,
"grad_norm": 1.2109375,
"learning_rate": 0.00025922872780811664,
"loss": 4.6322,
"mean_token_accuracy": 0.23154927641153336,
"num_tokens": 11911046.0,
"step": 5305
},
{
"entropy": 5.063149118423462,
"epoch": 5.740941049215793,
"grad_norm": 1.2578125,
"learning_rate": 0.00025880089281303027,
"loss": 4.6075,
"mean_token_accuracy": 0.224050635099411,
"num_tokens": 11922061.0,
"step": 5310
},
{
"entropy": 5.14631233215332,
"epoch": 5.746349378042185,
"grad_norm": 1.2265625,
"learning_rate": 0.00025837311668553683,
"loss": 4.5437,
"mean_token_accuracy": 0.24232044517993928,
"num_tokens": 11932199.0,
"step": 5315
},
{
"entropy": 5.150130701065064,
"epoch": 5.7517577068685775,
"grad_norm": 1.25,
"learning_rate": 0.0002579454009801757,
"loss": 4.6041,
"mean_token_accuracy": 0.23508304208517075,
"num_tokens": 11941511.0,
"step": 5320
},
{
"entropy": 5.047831583023071,
"epoch": 5.75716603569497,
"grad_norm": 1.171875,
"learning_rate": 0.0002575177472512669,
"loss": 4.5769,
"mean_token_accuracy": 0.23659766018390654,
"num_tokens": 11953430.0,
"step": 5325
},
{
"entropy": 5.156755590438843,
"epoch": 5.762574364521363,
"grad_norm": 1.125,
"learning_rate": 0.000257090157052905,
"loss": 4.5968,
"mean_token_accuracy": 0.2341006264090538,
"num_tokens": 11964167.0,
"step": 5330
},
{
"entropy": 5.130202865600586,
"epoch": 5.767982693347756,
"grad_norm": 1.203125,
"learning_rate": 0.00025666263193895375,
"loss": 4.6579,
"mean_token_accuracy": 0.24266277700662614,
"num_tokens": 11975428.0,
"step": 5335
},
{
"entropy": 5.105318927764893,
"epoch": 5.773391022174148,
"grad_norm": 1.328125,
"learning_rate": 0.00025623517346304027,
"loss": 4.6352,
"mean_token_accuracy": 0.23468518555164336,
"num_tokens": 11986358.0,
"step": 5340
},
{
"entropy": 5.004417848587036,
"epoch": 5.778799351000541,
"grad_norm": 1.28125,
"learning_rate": 0.00025580778317855,
"loss": 4.4355,
"mean_token_accuracy": 0.24805232286453247,
"num_tokens": 11997295.0,
"step": 5345
},
{
"entropy": 5.111599063873291,
"epoch": 5.784207679826934,
"grad_norm": 1.078125,
"learning_rate": 0.0002553804626386199,
"loss": 4.5501,
"mean_token_accuracy": 0.2441372111439705,
"num_tokens": 12008348.0,
"step": 5350
},
{
"entropy": 5.093307590484619,
"epoch": 5.789616008653326,
"grad_norm": 1.140625,
"learning_rate": 0.0002549532133961339,
"loss": 4.615,
"mean_token_accuracy": 0.237824247777462,
"num_tokens": 12019698.0,
"step": 5355
},
{
"entropy": 5.145287132263183,
"epoch": 5.795024337479719,
"grad_norm": 1.15625,
"learning_rate": 0.00025452603700371675,
"loss": 4.6236,
"mean_token_accuracy": 0.2315625086426735,
"num_tokens": 12030969.0,
"step": 5360
},
{
"entropy": 5.072210025787354,
"epoch": 5.800432666306111,
"grad_norm": 1.203125,
"learning_rate": 0.0002540989350137285,
"loss": 4.5114,
"mean_token_accuracy": 0.2476600378751755,
"num_tokens": 12042695.0,
"step": 5365
},
{
"entropy": 5.129029321670532,
"epoch": 5.805840995132504,
"grad_norm": 1.234375,
"learning_rate": 0.00025367190897825873,
"loss": 4.6611,
"mean_token_accuracy": 0.2307037815451622,
"num_tokens": 12054016.0,
"step": 5370
},
{
"entropy": 5.071478796005249,
"epoch": 5.811249323958897,
"grad_norm": 1.15625,
"learning_rate": 0.0002532449604491209,
"loss": 4.5983,
"mean_token_accuracy": 0.23205728828907013,
"num_tokens": 12065759.0,
"step": 5375
},
{
"entropy": 5.070323419570923,
"epoch": 5.816657652785289,
"grad_norm": 1.171875,
"learning_rate": 0.0002528180909778471,
"loss": 4.583,
"mean_token_accuracy": 0.24318053275346757,
"num_tokens": 12077475.0,
"step": 5380
},
{
"entropy": 5.059966135025024,
"epoch": 5.822065981611682,
"grad_norm": 1.21875,
"learning_rate": 0.00025239130211568206,
"loss": 4.5393,
"mean_token_accuracy": 0.22720250636339187,
"num_tokens": 12088965.0,
"step": 5385
},
{
"entropy": 5.065695285797119,
"epoch": 5.827474310438075,
"grad_norm": 1.0859375,
"learning_rate": 0.00025196459541357725,
"loss": 4.5739,
"mean_token_accuracy": 0.23207562863826753,
"num_tokens": 12101215.0,
"step": 5390
},
{
"entropy": 5.1242262840271,
"epoch": 5.832882639264467,
"grad_norm": 1.2109375,
"learning_rate": 0.00025153797242218604,
"loss": 4.5841,
"mean_token_accuracy": 0.23600030988454818,
"num_tokens": 12112172.0,
"step": 5395
},
{
"entropy": 5.056416463851929,
"epoch": 5.83829096809086,
"grad_norm": 1.15625,
"learning_rate": 0.00025111143469185715,
"loss": 4.5646,
"mean_token_accuracy": 0.2433018684387207,
"num_tokens": 12123461.0,
"step": 5400
},
{
"entropy": 5.055309772491455,
"epoch": 5.8436992969172525,
"grad_norm": 1.2109375,
"learning_rate": 0.0002506849837726299,
"loss": 4.533,
"mean_token_accuracy": 0.2430558145046234,
"num_tokens": 12134671.0,
"step": 5405
},
{
"entropy": 4.994070053100586,
"epoch": 5.849107625743645,
"grad_norm": 1.140625,
"learning_rate": 0.0002502586212142278,
"loss": 4.4498,
"mean_token_accuracy": 0.24918071776628495,
"num_tokens": 12145861.0,
"step": 5410
},
{
"entropy": 5.170055198669433,
"epoch": 5.854515954570038,
"grad_norm": 1.3125,
"learning_rate": 0.00024983234856605337,
"loss": 4.633,
"mean_token_accuracy": 0.22511566430330276,
"num_tokens": 12157577.0,
"step": 5415
},
{
"entropy": 5.065318202972412,
"epoch": 5.85992428339643,
"grad_norm": 1.171875,
"learning_rate": 0.00024940616737718235,
"loss": 4.6324,
"mean_token_accuracy": 0.23299359530210495,
"num_tokens": 12169786.0,
"step": 5420
},
{
"entropy": 5.115573406219482,
"epoch": 5.865332612222823,
"grad_norm": 1.1484375,
"learning_rate": 0.0002489800791963583,
"loss": 4.6011,
"mean_token_accuracy": 0.24409506767988204,
"num_tokens": 12181008.0,
"step": 5425
},
{
"entropy": 5.143574523925781,
"epoch": 5.870740941049216,
"grad_norm": 1.2421875,
"learning_rate": 0.00024855408557198657,
"loss": 4.6714,
"mean_token_accuracy": 0.23293209373950957,
"num_tokens": 12192832.0,
"step": 5430
},
{
"entropy": 5.102931022644043,
"epoch": 5.876149269875609,
"grad_norm": 1.046875,
"learning_rate": 0.000248128188052129,
"loss": 4.6233,
"mean_token_accuracy": 0.23675554990768433,
"num_tokens": 12205599.0,
"step": 5435
},
{
"entropy": 5.220578622817993,
"epoch": 5.881557598702001,
"grad_norm": 1.2890625,
"learning_rate": 0.00024770238818449804,
"loss": 4.684,
"mean_token_accuracy": 0.22862893342971802,
"num_tokens": 12217527.0,
"step": 5440
},
{
"entropy": 5.1017098903656,
"epoch": 5.886965927528394,
"grad_norm": 1.171875,
"learning_rate": 0.00024727668751645164,
"loss": 4.5677,
"mean_token_accuracy": 0.237183278799057,
"num_tokens": 12228640.0,
"step": 5445
},
{
"entropy": 5.125553989410401,
"epoch": 5.8923742563547865,
"grad_norm": 1.296875,
"learning_rate": 0.0002468510875949868,
"loss": 4.5683,
"mean_token_accuracy": 0.23590999841690063,
"num_tokens": 12239392.0,
"step": 5450
},
{
"entropy": 5.1401652812957765,
"epoch": 5.897782585181179,
"grad_norm": 1.15625,
"learning_rate": 0.00024642558996673474,
"loss": 4.6272,
"mean_token_accuracy": 0.23644618541002274,
"num_tokens": 12251507.0,
"step": 5455
},
{
"entropy": 5.1105822086334225,
"epoch": 5.903190914007571,
"grad_norm": 1.1796875,
"learning_rate": 0.00024600019617795465,
"loss": 4.6395,
"mean_token_accuracy": 0.23106056004762648,
"num_tokens": 12263117.0,
"step": 5460
},
{
"entropy": 5.1196410179138185,
"epoch": 5.908599242833964,
"grad_norm": 1.234375,
"learning_rate": 0.0002455749077745288,
"loss": 4.644,
"mean_token_accuracy": 0.23821934461593627,
"num_tokens": 12274187.0,
"step": 5465
},
{
"entropy": 5.084873628616333,
"epoch": 5.914007571660357,
"grad_norm": 1.2578125,
"learning_rate": 0.00024514972630195603,
"loss": 4.5598,
"mean_token_accuracy": 0.24169430881738663,
"num_tokens": 12285392.0,
"step": 5470
},
{
"entropy": 5.2031793117523195,
"epoch": 5.91941590048675,
"grad_norm": 1.1015625,
"learning_rate": 0.0002447246533053469,
"loss": 4.6387,
"mean_token_accuracy": 0.23779407441616057,
"num_tokens": 12297634.0,
"step": 5475
},
{
"entropy": 5.040070056915283,
"epoch": 5.924824229313142,
"grad_norm": 1.1640625,
"learning_rate": 0.00024429969032941756,
"loss": 4.5473,
"mean_token_accuracy": 0.23564749956130981,
"num_tokens": 12309067.0,
"step": 5480
},
{
"entropy": 5.029923391342163,
"epoch": 5.930232558139535,
"grad_norm": 1.15625,
"learning_rate": 0.00024387483891848456,
"loss": 4.5424,
"mean_token_accuracy": 0.24335149377584459,
"num_tokens": 12320422.0,
"step": 5485
},
{
"entropy": 5.086775493621826,
"epoch": 5.935640886965928,
"grad_norm": 1.1484375,
"learning_rate": 0.00024345010061645889,
"loss": 4.6787,
"mean_token_accuracy": 0.22812491655349731,
"num_tokens": 12331531.0,
"step": 5490
},
{
"entropy": 5.101256275177002,
"epoch": 5.9410492157923205,
"grad_norm": 1.2109375,
"learning_rate": 0.00024302547696684047,
"loss": 4.5111,
"mean_token_accuracy": 0.24030095785856248,
"num_tokens": 12342295.0,
"step": 5495
},
{
"entropy": 5.082580518722534,
"epoch": 5.9464575446187125,
"grad_norm": 1.2109375,
"learning_rate": 0.00024260096951271253,
"loss": 4.5247,
"mean_token_accuracy": 0.24051147550344468,
"num_tokens": 12352934.0,
"step": 5500
},
{
"entropy": 5.1216014385223385,
"epoch": 5.951865873445105,
"grad_norm": 1.0859375,
"learning_rate": 0.00024217657979673634,
"loss": 4.651,
"mean_token_accuracy": 0.22875461131334304,
"num_tokens": 12364016.0,
"step": 5505
},
{
"entropy": 5.105373048782349,
"epoch": 5.957274202271498,
"grad_norm": 1.171875,
"learning_rate": 0.00024175230936114507,
"loss": 4.5926,
"mean_token_accuracy": 0.23197882771492004,
"num_tokens": 12374666.0,
"step": 5510
},
{
"entropy": 5.120679092407227,
"epoch": 5.962682531097891,
"grad_norm": 1.21875,
"learning_rate": 0.0002413281597477384,
"loss": 4.5327,
"mean_token_accuracy": 0.23745722472667694,
"num_tokens": 12384454.0,
"step": 5515
},
{
"entropy": 5.059133577346802,
"epoch": 5.968090859924283,
"grad_norm": 1.125,
"learning_rate": 0.00024090413249787696,
"loss": 4.5813,
"mean_token_accuracy": 0.2395591676235199,
"num_tokens": 12396466.0,
"step": 5520
},
{
"entropy": 5.038516426086426,
"epoch": 5.973499188750676,
"grad_norm": 1.171875,
"learning_rate": 0.0002404802291524768,
"loss": 4.5223,
"mean_token_accuracy": 0.24070528745651246,
"num_tokens": 12407424.0,
"step": 5525
},
{
"entropy": 5.059326648712158,
"epoch": 5.978907517577069,
"grad_norm": 1.1484375,
"learning_rate": 0.00024005645125200375,
"loss": 4.5352,
"mean_token_accuracy": 0.2425309121608734,
"num_tokens": 12417788.0,
"step": 5530
},
{
"entropy": 5.0759850025177,
"epoch": 5.984315846403462,
"grad_norm": 1.1640625,
"learning_rate": 0.0002396328003364675,
"loss": 4.6445,
"mean_token_accuracy": 0.2318225994706154,
"num_tokens": 12429735.0,
"step": 5535
},
{
"entropy": 5.121332359313965,
"epoch": 5.9897241752298545,
"grad_norm": 1.3046875,
"learning_rate": 0.00023920927794541665,
"loss": 4.585,
"mean_token_accuracy": 0.23201659172773362,
"num_tokens": 12440281.0,
"step": 5540
},
{
"entropy": 5.1707377433776855,
"epoch": 5.995132504056246,
"grad_norm": 1.15625,
"learning_rate": 0.0002387858856179324,
"loss": 4.6484,
"mean_token_accuracy": 0.22764950394630432,
"num_tokens": 12452127.0,
"step": 5545
},
{
"entropy": 5.083885563744439,
"epoch": 6.0,
"grad_norm": 2.328125,
"learning_rate": 0.00023836262489262361,
"loss": 4.5888,
"mean_token_accuracy": 0.24051977197329202,
"num_tokens": 12461334.0,
"step": 5550
},
{
"entropy": 5.086653184890747,
"epoch": 6.005408328826393,
"grad_norm": 1.0859375,
"learning_rate": 0.00023793949730762049,
"loss": 4.3569,
"mean_token_accuracy": 0.25400849133729936,
"num_tokens": 12472411.0,
"step": 5555
},
{
"entropy": 5.042824792861938,
"epoch": 6.010816657652786,
"grad_norm": 1.09375,
"learning_rate": 0.00023751650440056982,
"loss": 4.3451,
"mean_token_accuracy": 0.25822981745004653,
"num_tokens": 12482829.0,
"step": 5560
},
{
"entropy": 5.073545742034912,
"epoch": 6.016224986479178,
"grad_norm": 1.1796875,
"learning_rate": 0.00023709364770862885,
"loss": 4.4078,
"mean_token_accuracy": 0.25036914795637133,
"num_tokens": 12494939.0,
"step": 5565
},
{
"entropy": 5.015249872207642,
"epoch": 6.0216333153055706,
"grad_norm": 1.125,
"learning_rate": 0.00023667092876845976,
"loss": 4.2981,
"mean_token_accuracy": 0.2621407866477966,
"num_tokens": 12505608.0,
"step": 5570
},
{
"entropy": 5.015564060211181,
"epoch": 6.027041644131963,
"grad_norm": 1.203125,
"learning_rate": 0.0002362483491162239,
"loss": 4.3161,
"mean_token_accuracy": 0.264655539393425,
"num_tokens": 12516110.0,
"step": 5575
},
{
"entropy": 5.150920104980469,
"epoch": 6.032449972958356,
"grad_norm": 1.140625,
"learning_rate": 0.00023582591028757706,
"loss": 4.3775,
"mean_token_accuracy": 0.2547082617878914,
"num_tokens": 12526877.0,
"step": 5580
},
{
"entropy": 5.085649013519287,
"epoch": 6.037858301784748,
"grad_norm": 1.15625,
"learning_rate": 0.00023540361381766274,
"loss": 4.3703,
"mean_token_accuracy": 0.2546262010931969,
"num_tokens": 12538574.0,
"step": 5585
},
{
"entropy": 5.063450002670288,
"epoch": 6.043266630611141,
"grad_norm": 1.140625,
"learning_rate": 0.0002349814612411073,
"loss": 4.4194,
"mean_token_accuracy": 0.2511056512594223,
"num_tokens": 12550313.0,
"step": 5590
},
{
"entropy": 5.080852222442627,
"epoch": 6.048674959437534,
"grad_norm": 1.203125,
"learning_rate": 0.00023455945409201411,
"loss": 4.3648,
"mean_token_accuracy": 0.251961413025856,
"num_tokens": 12561750.0,
"step": 5595
},
{
"entropy": 5.085720157623291,
"epoch": 6.054083288263927,
"grad_norm": 1.09375,
"learning_rate": 0.00023413759390395828,
"loss": 4.428,
"mean_token_accuracy": 0.24815989136695862,
"num_tokens": 12573915.0,
"step": 5600
},
{
"entropy": 5.135279798507691,
"epoch": 6.059491617090319,
"grad_norm": 1.1484375,
"learning_rate": 0.0002337158822099807,
"loss": 4.4059,
"mean_token_accuracy": 0.2509478613734245,
"num_tokens": 12585254.0,
"step": 5605
},
{
"entropy": 5.075468826293945,
"epoch": 6.064899945916712,
"grad_norm": 1.203125,
"learning_rate": 0.0002332943205425825,
"loss": 4.4093,
"mean_token_accuracy": 0.2519256502389908,
"num_tokens": 12596633.0,
"step": 5610
},
{
"entropy": 5.025220966339111,
"epoch": 6.0703082747431045,
"grad_norm": 1.2578125,
"learning_rate": 0.00023287291043371978,
"loss": 4.353,
"mean_token_accuracy": 0.2512174382805824,
"num_tokens": 12607332.0,
"step": 5615
},
{
"entropy": 5.049488353729248,
"epoch": 6.075716603569497,
"grad_norm": 1.140625,
"learning_rate": 0.00023245165341479796,
"loss": 4.3871,
"mean_token_accuracy": 0.2563488602638245,
"num_tokens": 12618591.0,
"step": 5620
},
{
"entropy": 5.075482940673828,
"epoch": 6.081124932395889,
"grad_norm": 1.40625,
"learning_rate": 0.00023203055101666593,
"loss": 4.3661,
"mean_token_accuracy": 0.2556263044476509,
"num_tokens": 12629014.0,
"step": 5625
},
{
"entropy": 5.092593860626221,
"epoch": 6.086533261222282,
"grad_norm": 1.1484375,
"learning_rate": 0.0002316096047696108,
"loss": 4.3925,
"mean_token_accuracy": 0.2469010606408119,
"num_tokens": 12640135.0,
"step": 5630
},
{
"entropy": 5.05594654083252,
"epoch": 6.091941590048675,
"grad_norm": 1.21875,
"learning_rate": 0.0002311888162033522,
"loss": 4.4137,
"mean_token_accuracy": 0.2506154954433441,
"num_tokens": 12651005.0,
"step": 5635
},
{
"entropy": 5.118357706069946,
"epoch": 6.097349918875068,
"grad_norm": 1.2421875,
"learning_rate": 0.00023076818684703682,
"loss": 4.4637,
"mean_token_accuracy": 0.2449328362941742,
"num_tokens": 12662947.0,
"step": 5640
},
{
"entropy": 5.085834980010986,
"epoch": 6.10275824770146,
"grad_norm": 1.203125,
"learning_rate": 0.00023034771822923268,
"loss": 4.3923,
"mean_token_accuracy": 0.2475297763943672,
"num_tokens": 12673638.0,
"step": 5645
},
{
"entropy": 5.037565851211548,
"epoch": 6.108166576527853,
"grad_norm": 1.2421875,
"learning_rate": 0.0002299274118779236,
"loss": 4.3473,
"mean_token_accuracy": 0.2588935747742653,
"num_tokens": 12684036.0,
"step": 5650
},
{
"entropy": 5.023610210418701,
"epoch": 6.113574905354246,
"grad_norm": 1.2578125,
"learning_rate": 0.00022950726932050386,
"loss": 4.4207,
"mean_token_accuracy": 0.2527086704969406,
"num_tokens": 12695574.0,
"step": 5655
},
{
"entropy": 5.132417106628418,
"epoch": 6.1189832341806385,
"grad_norm": 1.1015625,
"learning_rate": 0.00022908729208377267,
"loss": 4.4485,
"mean_token_accuracy": 0.24634739011526108,
"num_tokens": 12707017.0,
"step": 5660
},
{
"entropy": 5.057981491088867,
"epoch": 6.1243915630070305,
"grad_norm": 1.1640625,
"learning_rate": 0.00022866748169392815,
"loss": 4.32,
"mean_token_accuracy": 0.26268827319145205,
"num_tokens": 12717368.0,
"step": 5665
},
{
"entropy": 5.024951505661011,
"epoch": 6.129799891833423,
"grad_norm": 1.171875,
"learning_rate": 0.00022824783967656208,
"loss": 4.3196,
"mean_token_accuracy": 0.25522277057170867,
"num_tokens": 12727957.0,
"step": 5670
},
{
"entropy": 5.033692264556885,
"epoch": 6.135208220659816,
"grad_norm": 1.265625,
"learning_rate": 0.00022782836755665475,
"loss": 4.3266,
"mean_token_accuracy": 0.2628965064883232,
"num_tokens": 12739041.0,
"step": 5675
},
{
"entropy": 5.1106596946716305,
"epoch": 6.140616549486209,
"grad_norm": 1.3046875,
"learning_rate": 0.00022740906685856876,
"loss": 4.3241,
"mean_token_accuracy": 0.26627043038606646,
"num_tokens": 12750468.0,
"step": 5680
},
{
"entropy": 5.056627321243286,
"epoch": 6.146024878312601,
"grad_norm": 1.15625,
"learning_rate": 0.00022698993910604383,
"loss": 4.4088,
"mean_token_accuracy": 0.24593029916286469,
"num_tokens": 12762320.0,
"step": 5685
},
{
"entropy": 5.13172607421875,
"epoch": 6.151433207138994,
"grad_norm": 1.203125,
"learning_rate": 0.000226570985822191,
"loss": 4.4362,
"mean_token_accuracy": 0.24388669580221176,
"num_tokens": 12773481.0,
"step": 5690
},
{
"entropy": 5.061193323135376,
"epoch": 6.156841535965387,
"grad_norm": 1.109375,
"learning_rate": 0.00022615220852948765,
"loss": 4.3764,
"mean_token_accuracy": 0.254576013982296,
"num_tokens": 12785925.0,
"step": 5695
},
{
"entropy": 5.026907873153687,
"epoch": 6.16224986479178,
"grad_norm": 1.1328125,
"learning_rate": 0.00022573360874977145,
"loss": 4.3965,
"mean_token_accuracy": 0.2550534322857857,
"num_tokens": 12798017.0,
"step": 5700
},
{
"entropy": 5.0545814514160154,
"epoch": 6.167658193618172,
"grad_norm": 1.125,
"learning_rate": 0.00022531518800423484,
"loss": 4.4231,
"mean_token_accuracy": 0.2518355429172516,
"num_tokens": 12809454.0,
"step": 5705
},
{
"entropy": 5.036812353134155,
"epoch": 6.173066522444564,
"grad_norm": 1.21875,
"learning_rate": 0.0002248969478134199,
"loss": 4.3683,
"mean_token_accuracy": 0.25098541378974915,
"num_tokens": 12820259.0,
"step": 5710
},
{
"entropy": 5.0702924728393555,
"epoch": 6.178474851270957,
"grad_norm": 1.140625,
"learning_rate": 0.00022447888969721232,
"loss": 4.4206,
"mean_token_accuracy": 0.24790642857551576,
"num_tokens": 12832215.0,
"step": 5715
},
{
"entropy": 5.0459705829620365,
"epoch": 6.18388318009735,
"grad_norm": 1.21875,
"learning_rate": 0.00022406101517483636,
"loss": 4.3903,
"mean_token_accuracy": 0.25190104097127913,
"num_tokens": 12843375.0,
"step": 5720
},
{
"entropy": 5.102580308914185,
"epoch": 6.189291508923742,
"grad_norm": 1.234375,
"learning_rate": 0.00022364332576484897,
"loss": 4.4213,
"mean_token_accuracy": 0.2548479750752449,
"num_tokens": 12855500.0,
"step": 5725
},
{
"entropy": 5.0764915466308596,
"epoch": 6.194699837750135,
"grad_norm": 1.2421875,
"learning_rate": 0.0002232258229851345,
"loss": 4.4262,
"mean_token_accuracy": 0.25448043942451476,
"num_tokens": 12865625.0,
"step": 5730
},
{
"entropy": 5.107598114013672,
"epoch": 6.200108166576528,
"grad_norm": 1.171875,
"learning_rate": 0.00022280850835289885,
"loss": 4.3947,
"mean_token_accuracy": 0.25172959715127946,
"num_tokens": 12876752.0,
"step": 5735
},
{
"entropy": 5.053556346893311,
"epoch": 6.205516495402921,
"grad_norm": 1.2578125,
"learning_rate": 0.00022239138338466452,
"loss": 4.3435,
"mean_token_accuracy": 0.26145315170288086,
"num_tokens": 12887729.0,
"step": 5740
},
{
"entropy": 4.977486562728882,
"epoch": 6.210924824229313,
"grad_norm": 1.2578125,
"learning_rate": 0.00022197444959626451,
"loss": 4.3719,
"mean_token_accuracy": 0.26408295780420304,
"num_tokens": 12898075.0,
"step": 5745
},
{
"entropy": 5.059645128250122,
"epoch": 6.2163331530557056,
"grad_norm": 1.140625,
"learning_rate": 0.00022155770850283723,
"loss": 4.4001,
"mean_token_accuracy": 0.24792602509260178,
"num_tokens": 12909360.0,
"step": 5750
},
{
"entropy": 5.078243732452393,
"epoch": 6.221741481882098,
"grad_norm": 1.296875,
"learning_rate": 0.00022114116161882065,
"loss": 4.3778,
"mean_token_accuracy": 0.25061326026916503,
"num_tokens": 12920135.0,
"step": 5755
},
{
"entropy": 5.075050258636475,
"epoch": 6.227149810708491,
"grad_norm": 1.265625,
"learning_rate": 0.00022072481045794733,
"loss": 4.4257,
"mean_token_accuracy": 0.25036286264657975,
"num_tokens": 12930892.0,
"step": 5760
},
{
"entropy": 5.103361415863037,
"epoch": 6.232558139534884,
"grad_norm": 1.2578125,
"learning_rate": 0.00022030865653323823,
"loss": 4.4604,
"mean_token_accuracy": 0.24151381254196166,
"num_tokens": 12941881.0,
"step": 5765
},
{
"entropy": 5.207461261749268,
"epoch": 6.237966468361276,
"grad_norm": 1.1640625,
"learning_rate": 0.0002198927013569977,
"loss": 4.4521,
"mean_token_accuracy": 0.25455030649900434,
"num_tokens": 12954190.0,
"step": 5770
},
{
"entropy": 5.121049594879151,
"epoch": 6.243374797187669,
"grad_norm": 1.2578125,
"learning_rate": 0.0002194769464408076,
"loss": 4.4668,
"mean_token_accuracy": 0.24447044730186462,
"num_tokens": 12964796.0,
"step": 5775
},
{
"entropy": 5.032493925094604,
"epoch": 6.248783126014062,
"grad_norm": 1.2421875,
"learning_rate": 0.0002190613932955226,
"loss": 4.3051,
"mean_token_accuracy": 0.2618804663419724,
"num_tokens": 12975989.0,
"step": 5780
},
{
"entropy": 4.998596620559693,
"epoch": 6.254191454840455,
"grad_norm": 1.1171875,
"learning_rate": 0.00021864604343126365,
"loss": 4.3264,
"mean_token_accuracy": 0.24551878571510316,
"num_tokens": 12987720.0,
"step": 5785
},
{
"entropy": 4.9964025020599365,
"epoch": 6.259599783666847,
"grad_norm": 1.2421875,
"learning_rate": 0.00021823089835741312,
"loss": 4.2749,
"mean_token_accuracy": 0.2673639252781868,
"num_tokens": 12999014.0,
"step": 5790
},
{
"entropy": 5.1089273452758786,
"epoch": 6.2650081124932395,
"grad_norm": 1.265625,
"learning_rate": 0.000217815959582609,
"loss": 4.4525,
"mean_token_accuracy": 0.24347484856843948,
"num_tokens": 13009229.0,
"step": 5795
},
{
"entropy": 5.061414766311645,
"epoch": 6.270416441319632,
"grad_norm": 1.1796875,
"learning_rate": 0.00021740122861473992,
"loss": 4.3525,
"mean_token_accuracy": 0.2591205403208733,
"num_tokens": 13020753.0,
"step": 5800
},
{
"entropy": 5.006845378875733,
"epoch": 6.275824770146025,
"grad_norm": 1.2265625,
"learning_rate": 0.00021698670696093932,
"loss": 4.3339,
"mean_token_accuracy": 0.25727398246526717,
"num_tokens": 13032007.0,
"step": 5805
},
{
"entropy": 4.958788251876831,
"epoch": 6.281233098972417,
"grad_norm": 1.125,
"learning_rate": 0.00021657239612757963,
"loss": 4.2785,
"mean_token_accuracy": 0.2635518029332161,
"num_tokens": 13042827.0,
"step": 5810
},
{
"entropy": 4.9195812225341795,
"epoch": 6.28664142779881,
"grad_norm": 1.2578125,
"learning_rate": 0.00021615829762026734,
"loss": 4.338,
"mean_token_accuracy": 0.2562535762786865,
"num_tokens": 13053146.0,
"step": 5815
},
{
"entropy": 5.105458784103393,
"epoch": 6.292049756625203,
"grad_norm": 1.2265625,
"learning_rate": 0.00021574441294383752,
"loss": 4.4892,
"mean_token_accuracy": 0.24603179544210435,
"num_tokens": 13064334.0,
"step": 5820
},
{
"entropy": 5.083749628067016,
"epoch": 6.297458085451596,
"grad_norm": 1.234375,
"learning_rate": 0.00021533074360234806,
"loss": 4.3459,
"mean_token_accuracy": 0.26156525909900663,
"num_tokens": 13075265.0,
"step": 5825
},
{
"entropy": 5.059867477416992,
"epoch": 6.302866414277988,
"grad_norm": 1.2109375,
"learning_rate": 0.00021491729109907414,
"loss": 4.3997,
"mean_token_accuracy": 0.2572763070464134,
"num_tokens": 13088442.0,
"step": 5830
},
{
"entropy": 5.026959466934204,
"epoch": 6.308274743104381,
"grad_norm": 1.15625,
"learning_rate": 0.00021450405693650333,
"loss": 4.3343,
"mean_token_accuracy": 0.25450841784477235,
"num_tokens": 13099211.0,
"step": 5835
},
{
"entropy": 5.108422946929932,
"epoch": 6.3136830719307735,
"grad_norm": 1.2734375,
"learning_rate": 0.00021409104261632932,
"loss": 4.4476,
"mean_token_accuracy": 0.25354350805282594,
"num_tokens": 13110516.0,
"step": 5840
},
{
"entropy": 5.082192850112915,
"epoch": 6.319091400757166,
"grad_norm": 1.1328125,
"learning_rate": 0.00021367824963944727,
"loss": 4.3867,
"mean_token_accuracy": 0.2537351742386818,
"num_tokens": 13122696.0,
"step": 5845
},
{
"entropy": 5.041290283203125,
"epoch": 6.324499729583558,
"grad_norm": 1.296875,
"learning_rate": 0.00021326567950594766,
"loss": 4.4152,
"mean_token_accuracy": 0.25945159047842026,
"num_tokens": 13133500.0,
"step": 5850
},
{
"entropy": 5.067854738235473,
"epoch": 6.329908058409951,
"grad_norm": 1.1953125,
"learning_rate": 0.0002128533337151114,
"loss": 4.4082,
"mean_token_accuracy": 0.2557085111737251,
"num_tokens": 13144444.0,
"step": 5855
},
{
"entropy": 5.038957166671753,
"epoch": 6.335316387236344,
"grad_norm": 1.2265625,
"learning_rate": 0.0002124412137654041,
"loss": 4.3997,
"mean_token_accuracy": 0.25047909915447236,
"num_tokens": 13156087.0,
"step": 5860
},
{
"entropy": 5.107436847686768,
"epoch": 6.340724716062737,
"grad_norm": 1.1953125,
"learning_rate": 0.00021202932115447056,
"loss": 4.4288,
"mean_token_accuracy": 0.25145320892333983,
"num_tokens": 13167343.0,
"step": 5865
},
{
"entropy": 5.11137318611145,
"epoch": 6.346133044889129,
"grad_norm": 1.078125,
"learning_rate": 0.00021161765737912937,
"loss": 4.5034,
"mean_token_accuracy": 0.23796405047178268,
"num_tokens": 13179197.0,
"step": 5870
},
{
"entropy": 5.083620691299439,
"epoch": 6.351541373715522,
"grad_norm": 1.28125,
"learning_rate": 0.00021120622393536775,
"loss": 4.445,
"mean_token_accuracy": 0.2475633889436722,
"num_tokens": 13189759.0,
"step": 5875
},
{
"entropy": 5.044642686843872,
"epoch": 6.356949702541915,
"grad_norm": 1.1171875,
"learning_rate": 0.00021079502231833585,
"loss": 4.3604,
"mean_token_accuracy": 0.2547649756073952,
"num_tokens": 13200634.0,
"step": 5880
},
{
"entropy": 5.065172815322876,
"epoch": 6.3623580313683075,
"grad_norm": 1.1171875,
"learning_rate": 0.00021038405402234116,
"loss": 4.4369,
"mean_token_accuracy": 0.24777600169181824,
"num_tokens": 13212599.0,
"step": 5885
},
{
"entropy": 5.102966547012329,
"epoch": 6.367766360194699,
"grad_norm": 1.1875,
"learning_rate": 0.0002099733205408435,
"loss": 4.5189,
"mean_token_accuracy": 0.24546874314546585,
"num_tokens": 13224491.0,
"step": 5890
},
{
"entropy": 5.129796361923217,
"epoch": 6.373174689021092,
"grad_norm": 1.2734375,
"learning_rate": 0.0002095628233664492,
"loss": 4.4202,
"mean_token_accuracy": 0.2585400566458702,
"num_tokens": 13236655.0,
"step": 5895
},
{
"entropy": 5.128116798400879,
"epoch": 6.378583017847485,
"grad_norm": 1.1875,
"learning_rate": 0.0002091525639909061,
"loss": 4.4435,
"mean_token_accuracy": 0.25246652215719223,
"num_tokens": 13247986.0,
"step": 5900
},
{
"entropy": 5.15279712677002,
"epoch": 6.383991346673878,
"grad_norm": 1.15625,
"learning_rate": 0.00020874254390509757,
"loss": 4.4916,
"mean_token_accuracy": 0.2485489323735237,
"num_tokens": 13259949.0,
"step": 5905
},
{
"entropy": 4.978144693374634,
"epoch": 6.38939967550027,
"grad_norm": 1.25,
"learning_rate": 0.00020833276459903766,
"loss": 4.3761,
"mean_token_accuracy": 0.2529650777578354,
"num_tokens": 13270840.0,
"step": 5910
},
{
"entropy": 5.02023549079895,
"epoch": 6.394808004326663,
"grad_norm": 1.125,
"learning_rate": 0.0002079232275618651,
"loss": 4.3945,
"mean_token_accuracy": 0.2529839798808098,
"num_tokens": 13281895.0,
"step": 5915
},
{
"entropy": 5.073026037216186,
"epoch": 6.400216333153056,
"grad_norm": 1.1796875,
"learning_rate": 0.0002075139342818388,
"loss": 4.3994,
"mean_token_accuracy": 0.2498616933822632,
"num_tokens": 13292505.0,
"step": 5920
},
{
"entropy": 5.084267520904541,
"epoch": 6.405624661979449,
"grad_norm": 1.2421875,
"learning_rate": 0.00020710488624633118,
"loss": 4.4115,
"mean_token_accuracy": 0.2495535284280777,
"num_tokens": 13304457.0,
"step": 5925
},
{
"entropy": 5.026647090911865,
"epoch": 6.411032990805841,
"grad_norm": 1.171875,
"learning_rate": 0.00020669608494182384,
"loss": 4.4381,
"mean_token_accuracy": 0.24386645257472991,
"num_tokens": 13316228.0,
"step": 5930
},
{
"entropy": 5.135671138763428,
"epoch": 6.416441319632233,
"grad_norm": 1.2265625,
"learning_rate": 0.00020628753185390164,
"loss": 4.4866,
"mean_token_accuracy": 0.24633659720420836,
"num_tokens": 13327980.0,
"step": 5935
},
{
"entropy": 5.08243088722229,
"epoch": 6.421849648458626,
"grad_norm": 1.140625,
"learning_rate": 0.0002058792284672475,
"loss": 4.4853,
"mean_token_accuracy": 0.24394746273756027,
"num_tokens": 13339869.0,
"step": 5940
},
{
"entropy": 5.071419811248779,
"epoch": 6.427257977285019,
"grad_norm": 1.2109375,
"learning_rate": 0.0002054711762656369,
"loss": 4.4195,
"mean_token_accuracy": 0.2557200253009796,
"num_tokens": 13350766.0,
"step": 5945
},
{
"entropy": 4.979526567459106,
"epoch": 6.432666306111411,
"grad_norm": 1.1796875,
"learning_rate": 0.00020506337673193236,
"loss": 4.2973,
"mean_token_accuracy": 0.26564027220010755,
"num_tokens": 13362913.0,
"step": 5950
},
{
"entropy": 5.071963262557984,
"epoch": 6.438074634937804,
"grad_norm": 1.1328125,
"learning_rate": 0.00020465583134807836,
"loss": 4.4282,
"mean_token_accuracy": 0.24921981245279312,
"num_tokens": 13374663.0,
"step": 5955
},
{
"entropy": 4.964849519729614,
"epoch": 6.443482963764197,
"grad_norm": 1.2109375,
"learning_rate": 0.00020424854159509587,
"loss": 4.2875,
"mean_token_accuracy": 0.259347477555275,
"num_tokens": 13386201.0,
"step": 5960
},
{
"entropy": 5.019578218460083,
"epoch": 6.44889129259059,
"grad_norm": 1.2578125,
"learning_rate": 0.0002038415089530767,
"loss": 4.3867,
"mean_token_accuracy": 0.2532976076006889,
"num_tokens": 13397079.0,
"step": 5965
},
{
"entropy": 5.100378894805909,
"epoch": 6.4542996214169825,
"grad_norm": 1.125,
"learning_rate": 0.00020343473490117846,
"loss": 4.4254,
"mean_token_accuracy": 0.24831065237522126,
"num_tokens": 13409811.0,
"step": 5970
},
{
"entropy": 5.061957883834839,
"epoch": 6.4597079502433745,
"grad_norm": 1.2734375,
"learning_rate": 0.00020302822091761884,
"loss": 4.3451,
"mean_token_accuracy": 0.2666120633482933,
"num_tokens": 13419725.0,
"step": 5975
},
{
"entropy": 4.976794242858887,
"epoch": 6.465116279069767,
"grad_norm": 1.109375,
"learning_rate": 0.00020262196847967091,
"loss": 4.3184,
"mean_token_accuracy": 0.2538869589567184,
"num_tokens": 13430411.0,
"step": 5980
},
{
"entropy": 5.048067808151245,
"epoch": 6.47052460789616,
"grad_norm": 1.21875,
"learning_rate": 0.00020221597906365667,
"loss": 4.4166,
"mean_token_accuracy": 0.2553139790892601,
"num_tokens": 13440964.0,
"step": 5985
},
{
"entropy": 5.088424491882324,
"epoch": 6.475932936722553,
"grad_norm": 1.1875,
"learning_rate": 0.00020181025414494285,
"loss": 4.3973,
"mean_token_accuracy": 0.25630178302526474,
"num_tokens": 13451640.0,
"step": 5990
},
{
"entropy": 5.103601169586182,
"epoch": 6.481341265548945,
"grad_norm": 1.2421875,
"learning_rate": 0.0002014047951979344,
"loss": 4.4259,
"mean_token_accuracy": 0.2498370200395584,
"num_tokens": 13463185.0,
"step": 5995
},
{
"entropy": 4.955135202407837,
"epoch": 6.486749594375338,
"grad_norm": 1.125,
"learning_rate": 0.0002009996036960704,
"loss": 4.2997,
"mean_token_accuracy": 0.2633310094475746,
"num_tokens": 13474675.0,
"step": 6000
},
{
"epoch": 6.486749594375338,
"eval_entropy": 4.99499137618325,
"eval_loss": 5.836542129516602,
"eval_mean_token_accuracy": 0.18491305688565426,
"eval_num_tokens": 13474675.0,
"eval_runtime": 2.519,
"eval_samples_per_second": 1395.391,
"eval_steps_per_second": 174.672,
"step": 6000
}
],
"logging_steps": 5,
"max_steps": 9240,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.1111628640256e+16,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}