Files
ModelHub XC cc46931824 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/hin-deva-10mb-ppt-Dp-10mb_seed3407
Source: Original Platform
2026-07-30 02:44:17 +08:00

2035 lines
54 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.06429627724554748,
"eval_steps": 500,
"global_step": 1000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.742568206787109,
"epoch": 0.00032148138622773744,
"grad_norm": 4.65625,
"learning_rate": 2e-06,
"loss": 10.8036,
"mean_token_accuracy": 0.0,
"num_tokens": 12742.0,
"step": 5
},
{
"entropy": 10.742579936981201,
"epoch": 0.0006429627724554749,
"grad_norm": 4.53125,
"learning_rate": 4.5e-06,
"loss": 10.7869,
"mean_token_accuracy": 0.0002144496247638017,
"num_tokens": 24140.0,
"step": 10
},
{
"entropy": 10.742603588104249,
"epoch": 0.0009644441586832123,
"grad_norm": 4.90625,
"learning_rate": 7e-06,
"loss": 10.7587,
"mean_token_accuracy": 0.00010395010467618704,
"num_tokens": 35301.0,
"step": 15
},
{
"entropy": 10.742618370056153,
"epoch": 0.0012859255449109497,
"grad_norm": 4.84375,
"learning_rate": 9.5e-06,
"loss": 10.7259,
"mean_token_accuracy": 8.291873964481056e-05,
"num_tokens": 47594.0,
"step": 20
},
{
"entropy": 10.742617893218995,
"epoch": 0.001607406931138687,
"grad_norm": 4.5,
"learning_rate": 1.2e-05,
"loss": 10.6444,
"mean_token_accuracy": 0.0009544001193717122,
"num_tokens": 60157.0,
"step": 25
},
{
"entropy": 10.742464923858643,
"epoch": 0.0019288883173664245,
"grad_norm": 3.90625,
"learning_rate": 1.4500000000000002e-05,
"loss": 10.5219,
"mean_token_accuracy": 0.008633292093873025,
"num_tokens": 71681.0,
"step": 30
},
{
"entropy": 10.741884708404541,
"epoch": 0.002250369703594162,
"grad_norm": 3.015625,
"learning_rate": 1.7000000000000003e-05,
"loss": 10.4068,
"mean_token_accuracy": 0.022283684648573398,
"num_tokens": 84059.0,
"step": 35
},
{
"entropy": 10.740736961364746,
"epoch": 0.0025718510898218995,
"grad_norm": 2.53125,
"learning_rate": 1.95e-05,
"loss": 10.2636,
"mean_token_accuracy": 0.029509490355849266,
"num_tokens": 95765.0,
"step": 40
},
{
"entropy": 10.739063930511474,
"epoch": 0.0028933324760496365,
"grad_norm": 2.140625,
"learning_rate": 2.2e-05,
"loss": 10.1737,
"mean_token_accuracy": 0.033080863580107686,
"num_tokens": 108095.0,
"step": 45
},
{
"entropy": 10.738058280944824,
"epoch": 0.003214813862277374,
"grad_norm": 2.078125,
"learning_rate": 2.4500000000000003e-05,
"loss": 10.0966,
"mean_token_accuracy": 0.03380006831139326,
"num_tokens": 120722.0,
"step": 50
},
{
"entropy": 10.73799819946289,
"epoch": 0.0035362952485051115,
"grad_norm": 1.9921875,
"learning_rate": 2.7e-05,
"loss": 10.006,
"mean_token_accuracy": 0.03798699378967285,
"num_tokens": 132684.0,
"step": 55
},
{
"entropy": 10.73742036819458,
"epoch": 0.003857776634732849,
"grad_norm": 1.90625,
"learning_rate": 2.95e-05,
"loss": 9.9558,
"mean_token_accuracy": 0.03450928349047899,
"num_tokens": 143940.0,
"step": 60
},
{
"entropy": 10.736388874053954,
"epoch": 0.0041792580209605865,
"grad_norm": 1.796875,
"learning_rate": 3.2e-05,
"loss": 9.9101,
"mean_token_accuracy": 0.04125991053879261,
"num_tokens": 156206.0,
"step": 65
},
{
"entropy": 10.73477258682251,
"epoch": 0.004500739407188324,
"grad_norm": 1.8359375,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.7902,
"mean_token_accuracy": 0.03981789126992226,
"num_tokens": 167417.0,
"step": 70
},
{
"entropy": 10.732693958282471,
"epoch": 0.0048222207934160615,
"grad_norm": 1.8125,
"learning_rate": 3.7e-05,
"loss": 9.7708,
"mean_token_accuracy": 0.04258622564375401,
"num_tokens": 180372.0,
"step": 75
},
{
"entropy": 10.729571533203124,
"epoch": 0.005143702179643799,
"grad_norm": 1.90625,
"learning_rate": 3.95e-05,
"loss": 9.6547,
"mean_token_accuracy": 0.045089634135365486,
"num_tokens": 191614.0,
"step": 80
},
{
"entropy": 10.72476511001587,
"epoch": 0.0054651835658715365,
"grad_norm": 1.796875,
"learning_rate": 4.2000000000000004e-05,
"loss": 9.6147,
"mean_token_accuracy": 0.040345224365592,
"num_tokens": 202885.0,
"step": 85
},
{
"entropy": 10.71826524734497,
"epoch": 0.005786664952099273,
"grad_norm": 1.7421875,
"learning_rate": 4.45e-05,
"loss": 9.5588,
"mean_token_accuracy": 0.0393321730196476,
"num_tokens": 215099.0,
"step": 90
},
{
"entropy": 10.710640907287598,
"epoch": 0.0061081463383270106,
"grad_norm": 1.7734375,
"learning_rate": 4.7000000000000004e-05,
"loss": 9.4198,
"mean_token_accuracy": 0.042821163311600685,
"num_tokens": 227257.0,
"step": 95
},
{
"entropy": 10.7003662109375,
"epoch": 0.006429627724554748,
"grad_norm": 1.796875,
"learning_rate": 4.9500000000000004e-05,
"loss": 9.3598,
"mean_token_accuracy": 0.046982531622052195,
"num_tokens": 240338.0,
"step": 100
},
{
"entropy": 10.68521671295166,
"epoch": 0.0067511091107824855,
"grad_norm": 1.8203125,
"learning_rate": 5.2e-05,
"loss": 9.2122,
"mean_token_accuracy": 0.0441419318318367,
"num_tokens": 251438.0,
"step": 105
},
{
"entropy": 10.664322471618652,
"epoch": 0.007072590497010223,
"grad_norm": 1.78125,
"learning_rate": 5.45e-05,
"loss": 9.1438,
"mean_token_accuracy": 0.050481327995657924,
"num_tokens": 264614.0,
"step": 110
},
{
"entropy": 10.634937763214111,
"epoch": 0.0073940718832379605,
"grad_norm": 1.75,
"learning_rate": 5.7e-05,
"loss": 9.0251,
"mean_token_accuracy": 0.049148940667510035,
"num_tokens": 278360.0,
"step": 115
},
{
"entropy": 10.593732261657715,
"epoch": 0.007715553269465698,
"grad_norm": 1.6171875,
"learning_rate": 5.9499999999999996e-05,
"loss": 8.9153,
"mean_token_accuracy": 0.05156457796692848,
"num_tokens": 290884.0,
"step": 120
},
{
"entropy": 10.54275369644165,
"epoch": 0.008037034655693436,
"grad_norm": 1.6484375,
"learning_rate": 6.2e-05,
"loss": 8.8351,
"mean_token_accuracy": 0.052396486327052114,
"num_tokens": 304431.0,
"step": 125
},
{
"entropy": 10.474855613708495,
"epoch": 0.008358516041921173,
"grad_norm": 1.6796875,
"learning_rate": 6.450000000000001e-05,
"loss": 8.6397,
"mean_token_accuracy": 0.05697291418910026,
"num_tokens": 317555.0,
"step": 130
},
{
"entropy": 10.39169454574585,
"epoch": 0.00867999742814891,
"grad_norm": 1.59375,
"learning_rate": 6.7e-05,
"loss": 8.4698,
"mean_token_accuracy": 0.058742289617657664,
"num_tokens": 329754.0,
"step": 135
},
{
"entropy": 10.3007230758667,
"epoch": 0.009001478814376648,
"grad_norm": 1.4296875,
"learning_rate": 6.950000000000001e-05,
"loss": 8.3392,
"mean_token_accuracy": 0.07013382948935032,
"num_tokens": 341808.0,
"step": 140
},
{
"entropy": 10.171103858947754,
"epoch": 0.009322960200604385,
"grad_norm": 1.4609375,
"learning_rate": 7.2e-05,
"loss": 8.1587,
"mean_token_accuracy": 0.06642449870705605,
"num_tokens": 353209.0,
"step": 145
},
{
"entropy": 10.069665241241456,
"epoch": 0.009644441586832123,
"grad_norm": 1.2734375,
"learning_rate": 7.45e-05,
"loss": 8.1634,
"mean_token_accuracy": 0.06020556911826134,
"num_tokens": 365744.0,
"step": 150
},
{
"entropy": 9.936939144134522,
"epoch": 0.00996592297305986,
"grad_norm": 1.3828125,
"learning_rate": 7.7e-05,
"loss": 8.0462,
"mean_token_accuracy": 0.06147486455738545,
"num_tokens": 379133.0,
"step": 155
},
{
"entropy": 9.757997035980225,
"epoch": 0.010287404359287598,
"grad_norm": 1.203125,
"learning_rate": 7.950000000000001e-05,
"loss": 7.9266,
"mean_token_accuracy": 0.06376843340694904,
"num_tokens": 390921.0,
"step": 160
},
{
"entropy": 9.523485374450683,
"epoch": 0.010608885745515335,
"grad_norm": 1.3125,
"learning_rate": 8.2e-05,
"loss": 7.8396,
"mean_token_accuracy": 0.07127328738570213,
"num_tokens": 404468.0,
"step": 165
},
{
"entropy": 9.345615196228028,
"epoch": 0.010930367131743073,
"grad_norm": 1.21875,
"learning_rate": 8.450000000000001e-05,
"loss": 7.6793,
"mean_token_accuracy": 0.07266218103468418,
"num_tokens": 414790.0,
"step": 170
},
{
"entropy": 9.119754123687745,
"epoch": 0.011251848517970809,
"grad_norm": 1.1953125,
"learning_rate": 8.7e-05,
"loss": 7.6479,
"mean_token_accuracy": 0.06817427426576614,
"num_tokens": 427720.0,
"step": 175
},
{
"entropy": 8.906557750701904,
"epoch": 0.011573329904198546,
"grad_norm": 0.91015625,
"learning_rate": 8.95e-05,
"loss": 7.5546,
"mean_token_accuracy": 0.07729550525546074,
"num_tokens": 438501.0,
"step": 180
},
{
"entropy": 8.68680248260498,
"epoch": 0.011894811290426284,
"grad_norm": 0.96484375,
"learning_rate": 9.2e-05,
"loss": 7.5063,
"mean_token_accuracy": 0.07282244712114334,
"num_tokens": 450035.0,
"step": 185
},
{
"entropy": 8.589659690856934,
"epoch": 0.012216292676654021,
"grad_norm": 1.1796875,
"learning_rate": 9.45e-05,
"loss": 7.4857,
"mean_token_accuracy": 0.0773538451641798,
"num_tokens": 461665.0,
"step": 190
},
{
"entropy": 8.466110229492188,
"epoch": 0.012537774062881759,
"grad_norm": 1.34375,
"learning_rate": 9.7e-05,
"loss": 7.407,
"mean_token_accuracy": 0.07190582565963269,
"num_tokens": 472514.0,
"step": 195
},
{
"entropy": 8.35852632522583,
"epoch": 0.012859255449109496,
"grad_norm": 0.9453125,
"learning_rate": 9.95e-05,
"loss": 7.469,
"mean_token_accuracy": 0.07612953037023544,
"num_tokens": 484057.0,
"step": 200
},
{
"entropy": 8.286659240722656,
"epoch": 0.013180736835337234,
"grad_norm": 1.1640625,
"learning_rate": 0.000102,
"loss": 7.2817,
"mean_token_accuracy": 0.07883379608392715,
"num_tokens": 496374.0,
"step": 205
},
{
"entropy": 8.222426700592042,
"epoch": 0.013502218221564971,
"grad_norm": 1.1875,
"learning_rate": 0.00010449999999999999,
"loss": 7.4006,
"mean_token_accuracy": 0.08155124634504318,
"num_tokens": 508816.0,
"step": 210
},
{
"entropy": 8.164955520629883,
"epoch": 0.013823699607792709,
"grad_norm": 1.1875,
"learning_rate": 0.000107,
"loss": 7.2353,
"mean_token_accuracy": 0.08206439130008221,
"num_tokens": 520738.0,
"step": 215
},
{
"entropy": 8.113754081726075,
"epoch": 0.014145180994020446,
"grad_norm": 0.98828125,
"learning_rate": 0.0001095,
"loss": 7.1869,
"mean_token_accuracy": 0.08583443649113179,
"num_tokens": 531924.0,
"step": 220
},
{
"entropy": 8.066366481781007,
"epoch": 0.014466662380248184,
"grad_norm": 0.96875,
"learning_rate": 0.000112,
"loss": 7.2385,
"mean_token_accuracy": 0.09169937074184417,
"num_tokens": 543924.0,
"step": 225
},
{
"entropy": 8.05418610572815,
"epoch": 0.014788143766475921,
"grad_norm": 1.40625,
"learning_rate": 0.0001145,
"loss": 7.3141,
"mean_token_accuracy": 0.0864493004977703,
"num_tokens": 555669.0,
"step": 230
},
{
"entropy": 8.044883394241333,
"epoch": 0.015109625152703659,
"grad_norm": 1.3828125,
"learning_rate": 0.00011700000000000001,
"loss": 7.2002,
"mean_token_accuracy": 0.09331929311156273,
"num_tokens": 567187.0,
"step": 235
},
{
"entropy": 7.921926689147949,
"epoch": 0.015431106538931396,
"grad_norm": 1.171875,
"learning_rate": 0.00011949999999999999,
"loss": 7.1648,
"mean_token_accuracy": 0.08909451588988304,
"num_tokens": 579812.0,
"step": 240
},
{
"entropy": 7.9616796493530275,
"epoch": 0.015752587925159132,
"grad_norm": 1.171875,
"learning_rate": 0.000122,
"loss": 7.2286,
"mean_token_accuracy": 0.0948996253311634,
"num_tokens": 592539.0,
"step": 245
},
{
"entropy": 7.915118932723999,
"epoch": 0.01607406931138687,
"grad_norm": 0.984375,
"learning_rate": 0.0001245,
"loss": 7.1744,
"mean_token_accuracy": 0.09123623445630073,
"num_tokens": 603561.0,
"step": 250
},
{
"entropy": 7.95502872467041,
"epoch": 0.016395550697614607,
"grad_norm": 1.0390625,
"learning_rate": 0.000127,
"loss": 7.1403,
"mean_token_accuracy": 0.09563293382525444,
"num_tokens": 615309.0,
"step": 255
},
{
"entropy": 7.883571195602417,
"epoch": 0.016717032083842346,
"grad_norm": 1.0546875,
"learning_rate": 0.0001295,
"loss": 7.2078,
"mean_token_accuracy": 0.09283049032092094,
"num_tokens": 628213.0,
"step": 260
},
{
"entropy": 7.916977882385254,
"epoch": 0.017038513470070082,
"grad_norm": 0.96875,
"learning_rate": 0.000132,
"loss": 7.1712,
"mean_token_accuracy": 0.09053821936249733,
"num_tokens": 640786.0,
"step": 265
},
{
"entropy": 7.736500692367554,
"epoch": 0.01735999485629782,
"grad_norm": 1.15625,
"learning_rate": 0.00013450000000000002,
"loss": 6.9442,
"mean_token_accuracy": 0.09789396971464157,
"num_tokens": 653298.0,
"step": 270
},
{
"entropy": 7.796767520904541,
"epoch": 0.017681476242525557,
"grad_norm": 1.03125,
"learning_rate": 0.00013700000000000002,
"loss": 7.1179,
"mean_token_accuracy": 0.09451311975717544,
"num_tokens": 667729.0,
"step": 275
},
{
"entropy": 7.758620405197144,
"epoch": 0.018002957628753296,
"grad_norm": 1.1953125,
"learning_rate": 0.0001395,
"loss": 6.9965,
"mean_token_accuracy": 0.10174397602677346,
"num_tokens": 678289.0,
"step": 280
},
{
"entropy": 7.761229801177978,
"epoch": 0.01832443901498103,
"grad_norm": 1.125,
"learning_rate": 0.00014199999999999998,
"loss": 7.1014,
"mean_token_accuracy": 0.09417134001851082,
"num_tokens": 689595.0,
"step": 285
},
{
"entropy": 7.707542467117309,
"epoch": 0.01864592040120877,
"grad_norm": 1.3125,
"learning_rate": 0.0001445,
"loss": 6.9575,
"mean_token_accuracy": 0.10247044488787652,
"num_tokens": 701044.0,
"step": 290
},
{
"entropy": 7.664159297943115,
"epoch": 0.018967401787436507,
"grad_norm": 1.265625,
"learning_rate": 0.000147,
"loss": 7.0154,
"mean_token_accuracy": 0.09950036033988,
"num_tokens": 713616.0,
"step": 295
},
{
"entropy": 7.647959280014038,
"epoch": 0.019288883173664246,
"grad_norm": 1.21875,
"learning_rate": 0.0001495,
"loss": 6.9233,
"mean_token_accuracy": 0.1026333898305893,
"num_tokens": 725328.0,
"step": 300
},
{
"entropy": 7.647801685333252,
"epoch": 0.01961036455989198,
"grad_norm": 1.1953125,
"learning_rate": 0.000152,
"loss": 6.9827,
"mean_token_accuracy": 0.10479021072387695,
"num_tokens": 738135.0,
"step": 305
},
{
"entropy": 7.666160726547242,
"epoch": 0.01993184594611972,
"grad_norm": 1.21875,
"learning_rate": 0.00015450000000000001,
"loss": 7.0659,
"mean_token_accuracy": 0.09956069737672806,
"num_tokens": 750746.0,
"step": 310
},
{
"entropy": 7.654135274887085,
"epoch": 0.020253327332347457,
"grad_norm": 1.0703125,
"learning_rate": 0.000157,
"loss": 6.8949,
"mean_token_accuracy": 0.10135210454463958,
"num_tokens": 763983.0,
"step": 315
},
{
"entropy": 7.494717454910278,
"epoch": 0.020574808718575196,
"grad_norm": 1.0703125,
"learning_rate": 0.0001595,
"loss": 6.8483,
"mean_token_accuracy": 0.1055855043232441,
"num_tokens": 776047.0,
"step": 320
},
{
"entropy": 7.538181352615356,
"epoch": 0.02089629010480293,
"grad_norm": 0.93359375,
"learning_rate": 0.000162,
"loss": 6.8979,
"mean_token_accuracy": 0.10393242165446281,
"num_tokens": 789551.0,
"step": 325
},
{
"entropy": 7.569456100463867,
"epoch": 0.02121777149103067,
"grad_norm": 0.95703125,
"learning_rate": 0.00016450000000000001,
"loss": 6.8266,
"mean_token_accuracy": 0.1120136708021164,
"num_tokens": 801870.0,
"step": 330
},
{
"entropy": 7.441139793395996,
"epoch": 0.021539252877258407,
"grad_norm": 1.0546875,
"learning_rate": 0.00016700000000000002,
"loss": 6.8251,
"mean_token_accuracy": 0.10700582489371299,
"num_tokens": 813782.0,
"step": 335
},
{
"entropy": 7.5361223220825195,
"epoch": 0.021860734263486146,
"grad_norm": 1.140625,
"learning_rate": 0.00016950000000000003,
"loss": 6.886,
"mean_token_accuracy": 0.11066097766160965,
"num_tokens": 826179.0,
"step": 340
},
{
"entropy": 7.415356826782227,
"epoch": 0.02218221564971388,
"grad_norm": 1.0703125,
"learning_rate": 0.00017199999999999998,
"loss": 6.8989,
"mean_token_accuracy": 0.10546407401561737,
"num_tokens": 838827.0,
"step": 345
},
{
"entropy": 7.442149639129639,
"epoch": 0.022503697035941617,
"grad_norm": 1.0625,
"learning_rate": 0.00017449999999999999,
"loss": 6.8217,
"mean_token_accuracy": 0.11060597971081734,
"num_tokens": 851543.0,
"step": 350
},
{
"entropy": 7.508502197265625,
"epoch": 0.022825178422169357,
"grad_norm": 1.1953125,
"learning_rate": 0.000177,
"loss": 6.8139,
"mean_token_accuracy": 0.112100800126791,
"num_tokens": 863557.0,
"step": 355
},
{
"entropy": 7.371269845962525,
"epoch": 0.023146659808397092,
"grad_norm": 1.1171875,
"learning_rate": 0.0001795,
"loss": 6.8226,
"mean_token_accuracy": 0.11001520678400993,
"num_tokens": 877640.0,
"step": 360
},
{
"entropy": 7.435138940811157,
"epoch": 0.02346814119462483,
"grad_norm": 0.96484375,
"learning_rate": 0.000182,
"loss": 6.9016,
"mean_token_accuracy": 0.11292736753821372,
"num_tokens": 889521.0,
"step": 365
},
{
"entropy": 7.44185962677002,
"epoch": 0.023789622580852567,
"grad_norm": 1.359375,
"learning_rate": 0.0001845,
"loss": 6.7138,
"mean_token_accuracy": 0.11192596107721328,
"num_tokens": 899886.0,
"step": 370
},
{
"entropy": 7.424141836166382,
"epoch": 0.024111103967080307,
"grad_norm": 1.2109375,
"learning_rate": 0.000187,
"loss": 6.835,
"mean_token_accuracy": 0.10648501366376877,
"num_tokens": 911448.0,
"step": 375
},
{
"entropy": 7.346240711212158,
"epoch": 0.024432585353308042,
"grad_norm": 1.171875,
"learning_rate": 0.0001895,
"loss": 6.8403,
"mean_token_accuracy": 0.10451060682535171,
"num_tokens": 922938.0,
"step": 380
},
{
"entropy": 7.440135097503662,
"epoch": 0.02475406673953578,
"grad_norm": 1.125,
"learning_rate": 0.000192,
"loss": 6.816,
"mean_token_accuracy": 0.10817886143922806,
"num_tokens": 935037.0,
"step": 385
},
{
"entropy": 7.338301467895508,
"epoch": 0.025075548125763517,
"grad_norm": 1.171875,
"learning_rate": 0.0001945,
"loss": 6.7998,
"mean_token_accuracy": 0.10885120332241058,
"num_tokens": 946395.0,
"step": 390
},
{
"entropy": 7.387865447998047,
"epoch": 0.025397029511991256,
"grad_norm": 1.03125,
"learning_rate": 0.00019700000000000002,
"loss": 6.7903,
"mean_token_accuracy": 0.11720103770494461,
"num_tokens": 957963.0,
"step": 395
},
{
"entropy": 7.322666645050049,
"epoch": 0.025718510898218992,
"grad_norm": 1.1875,
"learning_rate": 0.00019950000000000002,
"loss": 6.7715,
"mean_token_accuracy": 0.10996255949139595,
"num_tokens": 970474.0,
"step": 400
},
{
"entropy": 7.304989814758301,
"epoch": 0.02603999228444673,
"grad_norm": 1.171875,
"learning_rate": 0.000202,
"loss": 6.7076,
"mean_token_accuracy": 0.1160525843501091,
"num_tokens": 984090.0,
"step": 405
},
{
"entropy": 7.233718299865723,
"epoch": 0.026361473670674467,
"grad_norm": 1.0859375,
"learning_rate": 0.00020449999999999998,
"loss": 6.6529,
"mean_token_accuracy": 0.1177474744617939,
"num_tokens": 997159.0,
"step": 410
},
{
"entropy": 7.222785997390747,
"epoch": 0.026682955056902206,
"grad_norm": 1.265625,
"learning_rate": 0.000207,
"loss": 6.654,
"mean_token_accuracy": 0.11934740170836448,
"num_tokens": 1009350.0,
"step": 415
},
{
"entropy": 7.325893259048462,
"epoch": 0.027004436443129942,
"grad_norm": 1.1328125,
"learning_rate": 0.0002095,
"loss": 6.7141,
"mean_token_accuracy": 0.11572676599025726,
"num_tokens": 1021170.0,
"step": 420
},
{
"entropy": 7.200784921646118,
"epoch": 0.02732591782935768,
"grad_norm": 1.1484375,
"learning_rate": 0.000212,
"loss": 6.7053,
"mean_token_accuracy": 0.11510597914457321,
"num_tokens": 1033173.0,
"step": 425
},
{
"entropy": 7.3387078762054445,
"epoch": 0.027647399215585417,
"grad_norm": 1.1875,
"learning_rate": 0.0002145,
"loss": 6.6451,
"mean_token_accuracy": 0.11399412080645561,
"num_tokens": 1045811.0,
"step": 430
},
{
"entropy": 7.223242235183716,
"epoch": 0.027968880601813156,
"grad_norm": 1.15625,
"learning_rate": 0.00021700000000000002,
"loss": 6.6814,
"mean_token_accuracy": 0.11766811162233352,
"num_tokens": 1058519.0,
"step": 435
},
{
"entropy": 7.186439037322998,
"epoch": 0.028290361988040892,
"grad_norm": 1.234375,
"learning_rate": 0.0002195,
"loss": 6.661,
"mean_token_accuracy": 0.11952715441584587,
"num_tokens": 1069977.0,
"step": 440
},
{
"entropy": 7.247150611877442,
"epoch": 0.02861184337426863,
"grad_norm": 1.328125,
"learning_rate": 0.000222,
"loss": 6.7042,
"mean_token_accuracy": 0.12207212299108505,
"num_tokens": 1081368.0,
"step": 445
},
{
"entropy": 7.224388504028321,
"epoch": 0.028933324760496367,
"grad_norm": 1.046875,
"learning_rate": 0.0002245,
"loss": 6.7154,
"mean_token_accuracy": 0.11299246326088905,
"num_tokens": 1093936.0,
"step": 450
},
{
"entropy": 7.168924283981323,
"epoch": 0.029254806146724106,
"grad_norm": 0.953125,
"learning_rate": 0.00022700000000000002,
"loss": 6.6693,
"mean_token_accuracy": 0.1225433073937893,
"num_tokens": 1106217.0,
"step": 455
},
{
"entropy": 7.140732955932617,
"epoch": 0.029576287532951842,
"grad_norm": 1.1328125,
"learning_rate": 0.00022950000000000002,
"loss": 6.6131,
"mean_token_accuracy": 0.1190965436398983,
"num_tokens": 1120108.0,
"step": 460
},
{
"entropy": 7.190146207809448,
"epoch": 0.029897768919179578,
"grad_norm": 1.1796875,
"learning_rate": 0.00023200000000000003,
"loss": 6.691,
"mean_token_accuracy": 0.1148249328136444,
"num_tokens": 1132390.0,
"step": 465
},
{
"entropy": 7.1808641910552975,
"epoch": 0.030219250305407317,
"grad_norm": 1.046875,
"learning_rate": 0.00023449999999999998,
"loss": 6.6407,
"mean_token_accuracy": 0.1223123162984848,
"num_tokens": 1144612.0,
"step": 470
},
{
"entropy": 7.130864477157592,
"epoch": 0.030540731691635053,
"grad_norm": 1.2109375,
"learning_rate": 0.000237,
"loss": 6.5913,
"mean_token_accuracy": 0.1303763821721077,
"num_tokens": 1156151.0,
"step": 475
},
{
"entropy": 7.050965404510498,
"epoch": 0.030862213077862792,
"grad_norm": 1.1953125,
"learning_rate": 0.0002395,
"loss": 6.5653,
"mean_token_accuracy": 0.1250072978436947,
"num_tokens": 1168777.0,
"step": 480
},
{
"entropy": 7.13370532989502,
"epoch": 0.031183694464090528,
"grad_norm": 1.1484375,
"learning_rate": 0.000242,
"loss": 6.6091,
"mean_token_accuracy": 0.1207241289317608,
"num_tokens": 1181233.0,
"step": 485
},
{
"entropy": 7.062533330917359,
"epoch": 0.031505175850318264,
"grad_norm": 1.1328125,
"learning_rate": 0.0002445,
"loss": 6.4888,
"mean_token_accuracy": 0.12689791172742843,
"num_tokens": 1192315.0,
"step": 490
},
{
"entropy": 7.057355880737305,
"epoch": 0.031826657236546006,
"grad_norm": 1.2890625,
"learning_rate": 0.000247,
"loss": 6.5874,
"mean_token_accuracy": 0.12290141731500626,
"num_tokens": 1203452.0,
"step": 495
},
{
"entropy": 7.104999351501465,
"epoch": 0.03214813862277374,
"grad_norm": 1.03125,
"learning_rate": 0.0002495,
"loss": 6.4607,
"mean_token_accuracy": 0.12253987565636634,
"num_tokens": 1215024.0,
"step": 500
},
{
"entropy": 6.960715389251709,
"epoch": 0.03246962000900148,
"grad_norm": 1.1484375,
"learning_rate": 0.000252,
"loss": 6.5357,
"mean_token_accuracy": 0.12099924460053443,
"num_tokens": 1227389.0,
"step": 505
},
{
"entropy": 7.088908338546753,
"epoch": 0.032791101395229214,
"grad_norm": 1.125,
"learning_rate": 0.0002545,
"loss": 6.5929,
"mean_token_accuracy": 0.12899895682930945,
"num_tokens": 1239580.0,
"step": 510
},
{
"entropy": 6.991267108917237,
"epoch": 0.033112582781456956,
"grad_norm": 1.2890625,
"learning_rate": 0.000257,
"loss": 6.4972,
"mean_token_accuracy": 0.12959347441792488,
"num_tokens": 1251057.0,
"step": 515
},
{
"entropy": 7.053374528884888,
"epoch": 0.03343406416768469,
"grad_norm": 1.2265625,
"learning_rate": 0.0002595,
"loss": 6.5123,
"mean_token_accuracy": 0.12708231583237647,
"num_tokens": 1261979.0,
"step": 520
},
{
"entropy": 7.0755468845367435,
"epoch": 0.03375554555391243,
"grad_norm": 1.234375,
"learning_rate": 0.000262,
"loss": 6.5544,
"mean_token_accuracy": 0.1266493871808052,
"num_tokens": 1274862.0,
"step": 525
},
{
"entropy": 6.957923030853271,
"epoch": 0.034077026940140163,
"grad_norm": 1.1953125,
"learning_rate": 0.00026450000000000003,
"loss": 6.5144,
"mean_token_accuracy": 0.12210054397583008,
"num_tokens": 1286798.0,
"step": 530
},
{
"entropy": 6.912027025222779,
"epoch": 0.034398508326367906,
"grad_norm": 1.0234375,
"learning_rate": 0.00026700000000000004,
"loss": 6.4476,
"mean_token_accuracy": 0.13111426010727883,
"num_tokens": 1298709.0,
"step": 535
},
{
"entropy": 7.059010982513428,
"epoch": 0.03471998971259564,
"grad_norm": 1.1015625,
"learning_rate": 0.00026950000000000005,
"loss": 6.5366,
"mean_token_accuracy": 0.12991197258234025,
"num_tokens": 1310597.0,
"step": 540
},
{
"entropy": 7.001475191116333,
"epoch": 0.03504147109882338,
"grad_norm": 1.203125,
"learning_rate": 0.00027200000000000005,
"loss": 6.5354,
"mean_token_accuracy": 0.1257152423262596,
"num_tokens": 1321986.0,
"step": 545
},
{
"entropy": 6.898067474365234,
"epoch": 0.03536295248505111,
"grad_norm": 1.1640625,
"learning_rate": 0.0002745,
"loss": 6.4693,
"mean_token_accuracy": 0.12922092527151108,
"num_tokens": 1334042.0,
"step": 550
},
{
"entropy": 7.061205530166626,
"epoch": 0.035684433871278856,
"grad_norm": 1.171875,
"learning_rate": 0.000277,
"loss": 6.4141,
"mean_token_accuracy": 0.13716451823711395,
"num_tokens": 1345544.0,
"step": 555
},
{
"entropy": 6.891375637054443,
"epoch": 0.03600591525750659,
"grad_norm": 1.0546875,
"learning_rate": 0.0002795,
"loss": 6.4736,
"mean_token_accuracy": 0.13048869818449021,
"num_tokens": 1356390.0,
"step": 560
},
{
"entropy": 6.955321550369263,
"epoch": 0.03632739664373433,
"grad_norm": 1.1484375,
"learning_rate": 0.00028199999999999997,
"loss": 6.4478,
"mean_token_accuracy": 0.12905914708971977,
"num_tokens": 1367673.0,
"step": 565
},
{
"entropy": 6.978991460800171,
"epoch": 0.03664887802996206,
"grad_norm": 1.0703125,
"learning_rate": 0.0002845,
"loss": 6.5471,
"mean_token_accuracy": 0.12287317663431167,
"num_tokens": 1378831.0,
"step": 570
},
{
"entropy": 6.9239545345306395,
"epoch": 0.0369703594161898,
"grad_norm": 1.15625,
"learning_rate": 0.000287,
"loss": 6.4504,
"mean_token_accuracy": 0.12795896902680398,
"num_tokens": 1390664.0,
"step": 575
},
{
"entropy": 6.862272691726685,
"epoch": 0.03729184080241754,
"grad_norm": 1.265625,
"learning_rate": 0.0002895,
"loss": 6.4401,
"mean_token_accuracy": 0.12892675697803496,
"num_tokens": 1402452.0,
"step": 580
},
{
"entropy": 6.953590202331543,
"epoch": 0.03761332218864528,
"grad_norm": 1.203125,
"learning_rate": 0.000292,
"loss": 6.4336,
"mean_token_accuracy": 0.1350032038986683,
"num_tokens": 1414961.0,
"step": 585
},
{
"entropy": 6.967419624328613,
"epoch": 0.03793480357487301,
"grad_norm": 1.25,
"learning_rate": 0.0002945,
"loss": 6.5459,
"mean_token_accuracy": 0.12986136153340339,
"num_tokens": 1427130.0,
"step": 590
},
{
"entropy": 6.999366188049317,
"epoch": 0.03825628496110075,
"grad_norm": 1.09375,
"learning_rate": 0.000297,
"loss": 6.5246,
"mean_token_accuracy": 0.12499598488211631,
"num_tokens": 1439670.0,
"step": 595
},
{
"entropy": 6.75904483795166,
"epoch": 0.03857776634732849,
"grad_norm": 1.0703125,
"learning_rate": 0.0002995,
"loss": 6.3962,
"mean_token_accuracy": 0.13737771436572074,
"num_tokens": 1451083.0,
"step": 600
},
{
"entropy": 6.9564125537872314,
"epoch": 0.03889924773355623,
"grad_norm": 1.125,
"learning_rate": 0.000302,
"loss": 6.5001,
"mean_token_accuracy": 0.12657159492373465,
"num_tokens": 1461668.0,
"step": 605
},
{
"entropy": 6.856050968170166,
"epoch": 0.03922072911978396,
"grad_norm": 1.0703125,
"learning_rate": 0.0003045,
"loss": 6.4294,
"mean_token_accuracy": 0.12893444746732713,
"num_tokens": 1474610.0,
"step": 610
},
{
"entropy": 6.858731031417847,
"epoch": 0.0395422105060117,
"grad_norm": 1.046875,
"learning_rate": 0.000307,
"loss": 6.4416,
"mean_token_accuracy": 0.13238393440842627,
"num_tokens": 1486322.0,
"step": 615
},
{
"entropy": 6.896153497695923,
"epoch": 0.03986369189223944,
"grad_norm": 1.2734375,
"learning_rate": 0.0003095,
"loss": 6.3976,
"mean_token_accuracy": 0.13269342258572578,
"num_tokens": 1498463.0,
"step": 620
},
{
"entropy": 6.833624172210693,
"epoch": 0.04018517327846718,
"grad_norm": 1.0625,
"learning_rate": 0.000312,
"loss": 6.4049,
"mean_token_accuracy": 0.1366283804178238,
"num_tokens": 1509636.0,
"step": 625
},
{
"entropy": 6.8152320861816404,
"epoch": 0.04050665466469491,
"grad_norm": 1.28125,
"learning_rate": 0.0003145,
"loss": 6.3352,
"mean_token_accuracy": 0.1357703410089016,
"num_tokens": 1523039.0,
"step": 630
},
{
"entropy": 6.893960666656494,
"epoch": 0.04082813605092265,
"grad_norm": 1.1875,
"learning_rate": 0.000317,
"loss": 6.5259,
"mean_token_accuracy": 0.12882191091775894,
"num_tokens": 1535491.0,
"step": 635
},
{
"entropy": 6.884737253189087,
"epoch": 0.04114961743715039,
"grad_norm": 1.046875,
"learning_rate": 0.0003195,
"loss": 6.4357,
"mean_token_accuracy": 0.13706220015883447,
"num_tokens": 1547246.0,
"step": 640
},
{
"entropy": 6.814633703231811,
"epoch": 0.04147109882337813,
"grad_norm": 1.2421875,
"learning_rate": 0.000322,
"loss": 6.4277,
"mean_token_accuracy": 0.1322600543498993,
"num_tokens": 1558948.0,
"step": 645
},
{
"entropy": 6.686750745773315,
"epoch": 0.04179258020960586,
"grad_norm": 1.1640625,
"learning_rate": 0.00032450000000000003,
"loss": 6.2122,
"mean_token_accuracy": 0.1456362023949623,
"num_tokens": 1571590.0,
"step": 650
},
{
"entropy": 6.888936519622803,
"epoch": 0.0421140615958336,
"grad_norm": 1.09375,
"learning_rate": 0.00032700000000000003,
"loss": 6.4346,
"mean_token_accuracy": 0.1308947794139385,
"num_tokens": 1582646.0,
"step": 655
},
{
"entropy": 6.749909734725952,
"epoch": 0.04243554298206134,
"grad_norm": 1.234375,
"learning_rate": 0.00032950000000000004,
"loss": 6.413,
"mean_token_accuracy": 0.13245051279664039,
"num_tokens": 1595393.0,
"step": 660
},
{
"entropy": 6.742237949371338,
"epoch": 0.04275702436828908,
"grad_norm": 1.296875,
"learning_rate": 0.00033200000000000005,
"loss": 6.3141,
"mean_token_accuracy": 0.13743347227573394,
"num_tokens": 1607048.0,
"step": 665
},
{
"entropy": 6.773509550094604,
"epoch": 0.04307850575451681,
"grad_norm": 1.125,
"learning_rate": 0.00033450000000000005,
"loss": 6.41,
"mean_token_accuracy": 0.12926661148667334,
"num_tokens": 1619572.0,
"step": 670
},
{
"entropy": 6.804459476470948,
"epoch": 0.04339998714074455,
"grad_norm": 1.2109375,
"learning_rate": 0.000337,
"loss": 6.3502,
"mean_token_accuracy": 0.1368434838950634,
"num_tokens": 1631342.0,
"step": 675
},
{
"entropy": 6.70438814163208,
"epoch": 0.04372146852697229,
"grad_norm": 1.078125,
"learning_rate": 0.0003395,
"loss": 6.2264,
"mean_token_accuracy": 0.14183585047721864,
"num_tokens": 1644192.0,
"step": 680
},
{
"entropy": 6.752353096008301,
"epoch": 0.04404294991320003,
"grad_norm": 1.2265625,
"learning_rate": 0.000342,
"loss": 6.3503,
"mean_token_accuracy": 0.13174555450677872,
"num_tokens": 1656080.0,
"step": 685
},
{
"entropy": 6.761217737197876,
"epoch": 0.04436443129942776,
"grad_norm": 1.0546875,
"learning_rate": 0.00034449999999999997,
"loss": 6.4007,
"mean_token_accuracy": 0.12576238363981246,
"num_tokens": 1669649.0,
"step": 690
},
{
"entropy": 6.725815725326538,
"epoch": 0.0446859126856555,
"grad_norm": 1.1640625,
"learning_rate": 0.000347,
"loss": 6.2721,
"mean_token_accuracy": 0.13926005065441133,
"num_tokens": 1680722.0,
"step": 695
},
{
"entropy": 6.70696120262146,
"epoch": 0.045007394071883235,
"grad_norm": 1.046875,
"learning_rate": 0.0003495,
"loss": 6.3386,
"mean_token_accuracy": 0.1366697758436203,
"num_tokens": 1693477.0,
"step": 700
},
{
"entropy": 6.703974771499634,
"epoch": 0.04532887545811098,
"grad_norm": 1.03125,
"learning_rate": 0.000352,
"loss": 6.2352,
"mean_token_accuracy": 0.1410387024283409,
"num_tokens": 1705823.0,
"step": 705
},
{
"entropy": 6.785667657852173,
"epoch": 0.04565035684433871,
"grad_norm": 1.03125,
"learning_rate": 0.0003545,
"loss": 6.3254,
"mean_token_accuracy": 0.14233048632740974,
"num_tokens": 1717339.0,
"step": 710
},
{
"entropy": 6.76090669631958,
"epoch": 0.04597183823056645,
"grad_norm": 1.125,
"learning_rate": 0.000357,
"loss": 6.3435,
"mean_token_accuracy": 0.13566424325108528,
"num_tokens": 1729407.0,
"step": 715
},
{
"entropy": 6.704364395141601,
"epoch": 0.046293319616794185,
"grad_norm": 1.109375,
"learning_rate": 0.0003595,
"loss": 6.29,
"mean_token_accuracy": 0.13379911631345748,
"num_tokens": 1741876.0,
"step": 720
},
{
"entropy": 6.77631402015686,
"epoch": 0.04661480100302193,
"grad_norm": 1.1328125,
"learning_rate": 0.000362,
"loss": 6.4265,
"mean_token_accuracy": 0.13033137172460557,
"num_tokens": 1755751.0,
"step": 725
},
{
"entropy": 6.657670211791992,
"epoch": 0.04693628238924966,
"grad_norm": 1.0,
"learning_rate": 0.0003645,
"loss": 6.1913,
"mean_token_accuracy": 0.1418625645339489,
"num_tokens": 1766711.0,
"step": 730
},
{
"entropy": 6.637538290023803,
"epoch": 0.0472577637754774,
"grad_norm": 0.9609375,
"learning_rate": 0.000367,
"loss": 6.342,
"mean_token_accuracy": 0.13235798180103303,
"num_tokens": 1781099.0,
"step": 735
},
{
"entropy": 6.792068195343018,
"epoch": 0.047579245161705135,
"grad_norm": 1.1328125,
"learning_rate": 0.0003695,
"loss": 6.3176,
"mean_token_accuracy": 0.1338970459997654,
"num_tokens": 1793964.0,
"step": 740
},
{
"entropy": 6.59170298576355,
"epoch": 0.04790072654793288,
"grad_norm": 1.0078125,
"learning_rate": 0.000372,
"loss": 6.3336,
"mean_token_accuracy": 0.136866308003664,
"num_tokens": 1806013.0,
"step": 745
},
{
"entropy": 6.797374200820923,
"epoch": 0.04822220793416061,
"grad_norm": 1.296875,
"learning_rate": 0.0003745,
"loss": 6.3025,
"mean_token_accuracy": 0.1357277400791645,
"num_tokens": 1819486.0,
"step": 750
},
{
"entropy": 6.608404302597046,
"epoch": 0.04854368932038835,
"grad_norm": 1.1328125,
"learning_rate": 0.000377,
"loss": 6.209,
"mean_token_accuracy": 0.139783376455307,
"num_tokens": 1830707.0,
"step": 755
},
{
"entropy": 6.744276094436645,
"epoch": 0.048865170706616085,
"grad_norm": 1.1640625,
"learning_rate": 0.0003795,
"loss": 6.4339,
"mean_token_accuracy": 0.13964696526527404,
"num_tokens": 1842601.0,
"step": 760
},
{
"entropy": 6.641026306152344,
"epoch": 0.04918665209284383,
"grad_norm": 0.98828125,
"learning_rate": 0.000382,
"loss": 6.2247,
"mean_token_accuracy": 0.14221392944455147,
"num_tokens": 1854989.0,
"step": 765
},
{
"entropy": 6.668173885345459,
"epoch": 0.04950813347907156,
"grad_norm": 1.046875,
"learning_rate": 0.0003845,
"loss": 6.3488,
"mean_token_accuracy": 0.13909211456775666,
"num_tokens": 1867613.0,
"step": 770
},
{
"entropy": 6.559179830551147,
"epoch": 0.0498296148652993,
"grad_norm": 1.0546875,
"learning_rate": 0.00038700000000000003,
"loss": 6.1666,
"mean_token_accuracy": 0.1398898646235466,
"num_tokens": 1879203.0,
"step": 775
},
{
"entropy": 6.739627838134766,
"epoch": 0.050151096251527034,
"grad_norm": 1.1015625,
"learning_rate": 0.00038950000000000003,
"loss": 6.3404,
"mean_token_accuracy": 0.13396444767713547,
"num_tokens": 1892402.0,
"step": 780
},
{
"entropy": 6.695523881912232,
"epoch": 0.05047257763775478,
"grad_norm": 1.171875,
"learning_rate": 0.00039200000000000004,
"loss": 6.3368,
"mean_token_accuracy": 0.13424392864108087,
"num_tokens": 1904777.0,
"step": 785
},
{
"entropy": 6.697699403762817,
"epoch": 0.05079405902398251,
"grad_norm": 1.171875,
"learning_rate": 0.00039450000000000005,
"loss": 6.3303,
"mean_token_accuracy": 0.14127687290310859,
"num_tokens": 1915303.0,
"step": 790
},
{
"entropy": 6.605134391784668,
"epoch": 0.05111554041021025,
"grad_norm": 1.171875,
"learning_rate": 0.00039700000000000005,
"loss": 6.1703,
"mean_token_accuracy": 0.14601608961820603,
"num_tokens": 1927440.0,
"step": 795
},
{
"entropy": 6.599157094955444,
"epoch": 0.051437021796437984,
"grad_norm": 1.03125,
"learning_rate": 0.0003995,
"loss": 6.2865,
"mean_token_accuracy": 0.14217782020568848,
"num_tokens": 1939028.0,
"step": 800
},
{
"entropy": 6.546269845962525,
"epoch": 0.05175850318266572,
"grad_norm": 1.1953125,
"learning_rate": 0.000402,
"loss": 6.0901,
"mean_token_accuracy": 0.14469429180026055,
"num_tokens": 1949002.0,
"step": 805
},
{
"entropy": 6.540508651733399,
"epoch": 0.05207998456889346,
"grad_norm": 1.0390625,
"learning_rate": 0.0004045,
"loss": 6.1717,
"mean_token_accuracy": 0.14316056221723555,
"num_tokens": 1960724.0,
"step": 810
},
{
"entropy": 6.635583829879761,
"epoch": 0.0524014659551212,
"grad_norm": 1.1953125,
"learning_rate": 0.00040699999999999997,
"loss": 6.2174,
"mean_token_accuracy": 0.15010152757167816,
"num_tokens": 1972874.0,
"step": 815
},
{
"entropy": 6.5239417552948,
"epoch": 0.052722947341348934,
"grad_norm": 1.140625,
"learning_rate": 0.0004095,
"loss": 6.2177,
"mean_token_accuracy": 0.14256786555051804,
"num_tokens": 1985303.0,
"step": 820
},
{
"entropy": 6.585869884490966,
"epoch": 0.05304442872757667,
"grad_norm": 1.1796875,
"learning_rate": 0.000412,
"loss": 6.2209,
"mean_token_accuracy": 0.1398877792060375,
"num_tokens": 1996460.0,
"step": 825
},
{
"entropy": 6.571089553833008,
"epoch": 0.05336591011380441,
"grad_norm": 1.09375,
"learning_rate": 0.0004145,
"loss": 6.2383,
"mean_token_accuracy": 0.14395796954631807,
"num_tokens": 2008237.0,
"step": 830
},
{
"entropy": 6.622538232803345,
"epoch": 0.05368739150003215,
"grad_norm": 0.9765625,
"learning_rate": 0.000417,
"loss": 6.2403,
"mean_token_accuracy": 0.14386678040027617,
"num_tokens": 2020207.0,
"step": 835
},
{
"entropy": 6.661964750289917,
"epoch": 0.054008872886259884,
"grad_norm": 1.21875,
"learning_rate": 0.0004195,
"loss": 6.2427,
"mean_token_accuracy": 0.13739722222089767,
"num_tokens": 2031521.0,
"step": 840
},
{
"entropy": 6.462450408935547,
"epoch": 0.05433035427248762,
"grad_norm": 1.09375,
"learning_rate": 0.000422,
"loss": 6.2228,
"mean_token_accuracy": 0.14301058202981948,
"num_tokens": 2043455.0,
"step": 845
},
{
"entropy": 6.503607940673828,
"epoch": 0.05465183565871536,
"grad_norm": 1.15625,
"learning_rate": 0.0004245,
"loss": 6.1393,
"mean_token_accuracy": 0.14353580325841903,
"num_tokens": 2055173.0,
"step": 850
},
{
"entropy": 6.541472578048706,
"epoch": 0.0549733170449431,
"grad_norm": 0.96875,
"learning_rate": 0.000427,
"loss": 6.1403,
"mean_token_accuracy": 0.15179161876440048,
"num_tokens": 2066734.0,
"step": 855
},
{
"entropy": 6.639166307449341,
"epoch": 0.055294798431170834,
"grad_norm": 1.09375,
"learning_rate": 0.0004295,
"loss": 6.2761,
"mean_token_accuracy": 0.1436140313744545,
"num_tokens": 2078000.0,
"step": 860
},
{
"entropy": 6.475754165649414,
"epoch": 0.05561627981739857,
"grad_norm": 1.0625,
"learning_rate": 0.000432,
"loss": 6.2339,
"mean_token_accuracy": 0.13742900639772415,
"num_tokens": 2090853.0,
"step": 865
},
{
"entropy": 6.5641477584838865,
"epoch": 0.05593776120362631,
"grad_norm": 1.2265625,
"learning_rate": 0.0004345,
"loss": 6.2037,
"mean_token_accuracy": 0.14319348186254502,
"num_tokens": 2102077.0,
"step": 870
},
{
"entropy": 6.494472360610962,
"epoch": 0.05625924258985405,
"grad_norm": 1.125,
"learning_rate": 0.000437,
"loss": 6.2086,
"mean_token_accuracy": 0.1428264133632183,
"num_tokens": 2114102.0,
"step": 875
},
{
"entropy": 6.49079270362854,
"epoch": 0.056580723976081784,
"grad_norm": 1.0703125,
"learning_rate": 0.0004395,
"loss": 6.0957,
"mean_token_accuracy": 0.14935592859983443,
"num_tokens": 2125155.0,
"step": 880
},
{
"entropy": 6.433831787109375,
"epoch": 0.05690220536230952,
"grad_norm": 1.109375,
"learning_rate": 0.000442,
"loss": 6.0576,
"mean_token_accuracy": 0.14371880292892455,
"num_tokens": 2136501.0,
"step": 885
},
{
"entropy": 6.521292591094971,
"epoch": 0.05722368674853726,
"grad_norm": 1.109375,
"learning_rate": 0.0004445,
"loss": 6.1641,
"mean_token_accuracy": 0.14184854477643966,
"num_tokens": 2149142.0,
"step": 890
},
{
"entropy": 6.478517198562622,
"epoch": 0.057545168134765,
"grad_norm": 1.03125,
"learning_rate": 0.000447,
"loss": 6.079,
"mean_token_accuracy": 0.15349558889865875,
"num_tokens": 2161548.0,
"step": 895
},
{
"entropy": 6.435318660736084,
"epoch": 0.057866649520992734,
"grad_norm": 1.0625,
"learning_rate": 0.00044950000000000003,
"loss": 6.1254,
"mean_token_accuracy": 0.14672751501202583,
"num_tokens": 2174109.0,
"step": 900
},
{
"entropy": 6.477844858169556,
"epoch": 0.05818813090722047,
"grad_norm": 1.0390625,
"learning_rate": 0.00045200000000000004,
"loss": 6.089,
"mean_token_accuracy": 0.15101353526115419,
"num_tokens": 2186559.0,
"step": 905
},
{
"entropy": 6.43283166885376,
"epoch": 0.05850961229344821,
"grad_norm": 1.0625,
"learning_rate": 0.00045450000000000004,
"loss": 6.1185,
"mean_token_accuracy": 0.15171128660440444,
"num_tokens": 2199397.0,
"step": 910
},
{
"entropy": 6.388595533370972,
"epoch": 0.05883109367967595,
"grad_norm": 1.1484375,
"learning_rate": 0.00045700000000000005,
"loss": 6.1171,
"mean_token_accuracy": 0.1468488872051239,
"num_tokens": 2211176.0,
"step": 915
},
{
"entropy": 6.3985847473144535,
"epoch": 0.059152575065903684,
"grad_norm": 1.078125,
"learning_rate": 0.00045950000000000006,
"loss": 6.078,
"mean_token_accuracy": 0.15174092650413512,
"num_tokens": 2223661.0,
"step": 920
},
{
"entropy": 6.408503246307373,
"epoch": 0.05947405645213142,
"grad_norm": 1.1796875,
"learning_rate": 0.000462,
"loss": 6.0222,
"mean_token_accuracy": 0.14833907932043075,
"num_tokens": 2233609.0,
"step": 925
},
{
"entropy": 6.424277496337891,
"epoch": 0.059795537838359156,
"grad_norm": 1.1953125,
"learning_rate": 0.0004645,
"loss": 6.1108,
"mean_token_accuracy": 0.14718108102679253,
"num_tokens": 2245791.0,
"step": 930
},
{
"entropy": 6.391247034072876,
"epoch": 0.0601170192245869,
"grad_norm": 1.09375,
"learning_rate": 0.000467,
"loss": 6.0183,
"mean_token_accuracy": 0.14811496585607528,
"num_tokens": 2258640.0,
"step": 935
},
{
"entropy": 6.4228808879852295,
"epoch": 0.060438500610814634,
"grad_norm": 1.171875,
"learning_rate": 0.0004695,
"loss": 6.118,
"mean_token_accuracy": 0.13841042444109916,
"num_tokens": 2270487.0,
"step": 940
},
{
"entropy": 6.4019317626953125,
"epoch": 0.06075998199704237,
"grad_norm": 1.375,
"learning_rate": 0.000472,
"loss": 6.1586,
"mean_token_accuracy": 0.14111901223659515,
"num_tokens": 2283852.0,
"step": 945
},
{
"entropy": 6.472497415542603,
"epoch": 0.061081463383270106,
"grad_norm": 1.1015625,
"learning_rate": 0.0004745,
"loss": 6.1262,
"mean_token_accuracy": 0.14592221304774283,
"num_tokens": 2295351.0,
"step": 950
},
{
"entropy": 6.520536708831787,
"epoch": 0.06140294476949785,
"grad_norm": 1.21875,
"learning_rate": 0.000477,
"loss": 6.1374,
"mean_token_accuracy": 0.14523889273405075,
"num_tokens": 2307723.0,
"step": 955
},
{
"entropy": 6.310831737518311,
"epoch": 0.061724426155725584,
"grad_norm": 1.203125,
"learning_rate": 0.0004795,
"loss": 6.0438,
"mean_token_accuracy": 0.15202855616807937,
"num_tokens": 2320273.0,
"step": 960
},
{
"entropy": 6.316798114776612,
"epoch": 0.06204590754195332,
"grad_norm": 1.046875,
"learning_rate": 0.000482,
"loss": 6.055,
"mean_token_accuracy": 0.15343189984560013,
"num_tokens": 2332142.0,
"step": 965
},
{
"entropy": 6.3915996074676515,
"epoch": 0.062367388928181056,
"grad_norm": 0.984375,
"learning_rate": 0.0004845,
"loss": 6.1411,
"mean_token_accuracy": 0.1484244257211685,
"num_tokens": 2346027.0,
"step": 970
},
{
"entropy": 6.468223333358765,
"epoch": 0.0626888703144088,
"grad_norm": 1.078125,
"learning_rate": 0.000487,
"loss": 6.1227,
"mean_token_accuracy": 0.1468320369720459,
"num_tokens": 2357606.0,
"step": 975
},
{
"entropy": 6.406705331802368,
"epoch": 0.06301035170063653,
"grad_norm": 1.0546875,
"learning_rate": 0.0004895,
"loss": 6.0776,
"mean_token_accuracy": 0.15517954528331757,
"num_tokens": 2369122.0,
"step": 980
},
{
"entropy": 6.341184473037719,
"epoch": 0.06333183308686427,
"grad_norm": 1.15625,
"learning_rate": 0.000492,
"loss": 5.9906,
"mean_token_accuracy": 0.15497024059295655,
"num_tokens": 2380313.0,
"step": 985
},
{
"entropy": 6.496398115158081,
"epoch": 0.06365331447309201,
"grad_norm": 1.203125,
"learning_rate": 0.0004945,
"loss": 6.187,
"mean_token_accuracy": 0.1426093466579914,
"num_tokens": 2392535.0,
"step": 990
},
{
"entropy": 6.377195549011231,
"epoch": 0.06397479585931974,
"grad_norm": 1.1875,
"learning_rate": 0.000497,
"loss": 6.1267,
"mean_token_accuracy": 0.14542814046144487,
"num_tokens": 2404878.0,
"step": 995
},
{
"entropy": 6.302570390701294,
"epoch": 0.06429627724554748,
"grad_norm": 1.1328125,
"learning_rate": 0.0004995,
"loss": 5.99,
"mean_token_accuracy": 0.15718609392642974,
"num_tokens": 2416656.0,
"step": 1000
}
],
"logging_steps": 5,
"max_steps": 4000,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 545716838891520.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}