Files
hin-deva-10mb-ppt-Dp-10mb_s…/checkpoint-1000/trainer_state.json
ModelHub XC f6b9a959ff 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/hin-deva-10mb-ppt-Dp-10mb_seed455
Source: Original Platform
2026-09-08 20:54:22 +08:00

2035 lines
54 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.06429627724554748,
"eval_steps": 500,
"global_step": 1000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.742344284057618,
"epoch": 0.00032148138622773744,
"grad_norm": 5.1875,
"learning_rate": 2e-06,
"loss": 10.7889,
"mean_token_accuracy": 0.0001923076924867928,
"num_tokens": 10787.0,
"step": 5
},
{
"entropy": 10.742341995239258,
"epoch": 0.0006429627724554749,
"grad_norm": 4.6875,
"learning_rate": 4.5e-06,
"loss": 10.7754,
"mean_token_accuracy": 9.199631749652326e-05,
"num_tokens": 21408.0,
"step": 10
},
{
"entropy": 10.74231481552124,
"epoch": 0.0009644441586832123,
"grad_norm": 4.84375,
"learning_rate": 7e-06,
"loss": 10.7745,
"mean_token_accuracy": 0.0,
"num_tokens": 33838.0,
"step": 15
},
{
"entropy": 10.742263031005859,
"epoch": 0.0012859255449109497,
"grad_norm": 4.875,
"learning_rate": 9.5e-06,
"loss": 10.7415,
"mean_token_accuracy": 0.0,
"num_tokens": 46592.0,
"step": 20
},
{
"entropy": 10.742058944702148,
"epoch": 0.001607406931138687,
"grad_norm": 4.21875,
"learning_rate": 1.2e-05,
"loss": 10.6278,
"mean_token_accuracy": 0.00028761792345903813,
"num_tokens": 57409.0,
"step": 25
},
{
"entropy": 10.741728782653809,
"epoch": 0.0019288883173664245,
"grad_norm": 3.71875,
"learning_rate": 1.4500000000000002e-05,
"loss": 10.5262,
"mean_token_accuracy": 0.005182119726669043,
"num_tokens": 68705.0,
"step": 30
},
{
"entropy": 10.74124059677124,
"epoch": 0.002250369703594162,
"grad_norm": 3.09375,
"learning_rate": 1.7000000000000003e-05,
"loss": 10.4297,
"mean_token_accuracy": 0.019557270966470242,
"num_tokens": 81460.0,
"step": 35
},
{
"entropy": 10.740433311462402,
"epoch": 0.0025718510898218995,
"grad_norm": 2.5,
"learning_rate": 1.95e-05,
"loss": 10.2725,
"mean_token_accuracy": 0.02960890345275402,
"num_tokens": 93576.0,
"step": 40
},
{
"entropy": 10.739229869842529,
"epoch": 0.0028933324760496365,
"grad_norm": 2.125,
"learning_rate": 2.2e-05,
"loss": 10.1857,
"mean_token_accuracy": 0.02886150423437357,
"num_tokens": 105556.0,
"step": 45
},
{
"entropy": 10.738618659973145,
"epoch": 0.003214813862277374,
"grad_norm": 2.03125,
"learning_rate": 2.4500000000000003e-05,
"loss": 10.0792,
"mean_token_accuracy": 0.031074166856706144,
"num_tokens": 117850.0,
"step": 50
},
{
"entropy": 10.738714694976807,
"epoch": 0.0035362952485051115,
"grad_norm": 1.9296875,
"learning_rate": 2.7e-05,
"loss": 10.0244,
"mean_token_accuracy": 0.031163782812654972,
"num_tokens": 130955.0,
"step": 55
},
{
"entropy": 10.738016033172608,
"epoch": 0.003857776634732849,
"grad_norm": 1.9140625,
"learning_rate": 2.95e-05,
"loss": 9.9307,
"mean_token_accuracy": 0.03660368006676436,
"num_tokens": 141959.0,
"step": 60
},
{
"entropy": 10.736786365509033,
"epoch": 0.0041792580209605865,
"grad_norm": 1.84375,
"learning_rate": 3.2e-05,
"loss": 9.8915,
"mean_token_accuracy": 0.03608605414628983,
"num_tokens": 153856.0,
"step": 65
},
{
"entropy": 10.73516550064087,
"epoch": 0.004500739407188324,
"grad_norm": 1.9140625,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.8384,
"mean_token_accuracy": 0.043716078624129295,
"num_tokens": 166748.0,
"step": 70
},
{
"entropy": 10.732550621032715,
"epoch": 0.0048222207934160615,
"grad_norm": 1.9375,
"learning_rate": 3.7e-05,
"loss": 9.728,
"mean_token_accuracy": 0.04251385778188706,
"num_tokens": 177172.0,
"step": 75
},
{
"entropy": 10.728882122039796,
"epoch": 0.005143702179643799,
"grad_norm": 1.8046875,
"learning_rate": 3.95e-05,
"loss": 9.6737,
"mean_token_accuracy": 0.04158058017492294,
"num_tokens": 189418.0,
"step": 80
},
{
"entropy": 10.723980331420899,
"epoch": 0.0054651835658715365,
"grad_norm": 2.0625,
"learning_rate": 4.2000000000000004e-05,
"loss": 9.5846,
"mean_token_accuracy": 0.039340490289032456,
"num_tokens": 201349.0,
"step": 85
},
{
"entropy": 10.718004131317139,
"epoch": 0.005786664952099273,
"grad_norm": 1.8046875,
"learning_rate": 4.45e-05,
"loss": 9.5176,
"mean_token_accuracy": 0.04345524609088898,
"num_tokens": 212298.0,
"step": 90
},
{
"entropy": 10.710467433929443,
"epoch": 0.0061081463383270106,
"grad_norm": 1.796875,
"learning_rate": 4.7000000000000004e-05,
"loss": 9.467,
"mean_token_accuracy": 0.04573878571391106,
"num_tokens": 223831.0,
"step": 95
},
{
"entropy": 10.699566841125488,
"epoch": 0.006429627724554748,
"grad_norm": 1.78125,
"learning_rate": 4.9500000000000004e-05,
"loss": 9.3601,
"mean_token_accuracy": 0.04835316389799118,
"num_tokens": 236675.0,
"step": 100
},
{
"entropy": 10.683355236053467,
"epoch": 0.0067511091107824855,
"grad_norm": 1.7421875,
"learning_rate": 5.2e-05,
"loss": 9.242,
"mean_token_accuracy": 0.04662417732179165,
"num_tokens": 247634.0,
"step": 105
},
{
"entropy": 10.66143503189087,
"epoch": 0.007072590497010223,
"grad_norm": 1.8046875,
"learning_rate": 5.45e-05,
"loss": 9.1162,
"mean_token_accuracy": 0.05328451320528984,
"num_tokens": 259101.0,
"step": 110
},
{
"entropy": 10.631138801574707,
"epoch": 0.0073940718832379605,
"grad_norm": 1.6328125,
"learning_rate": 5.7e-05,
"loss": 9.0393,
"mean_token_accuracy": 0.05271790884435177,
"num_tokens": 272151.0,
"step": 115
},
{
"entropy": 10.594438171386718,
"epoch": 0.007715553269465698,
"grad_norm": 1.75,
"learning_rate": 5.9499999999999996e-05,
"loss": 8.8606,
"mean_token_accuracy": 0.057512912154197696,
"num_tokens": 283619.0,
"step": 120
},
{
"entropy": 10.537901401519775,
"epoch": 0.008037034655693436,
"grad_norm": 1.734375,
"learning_rate": 6.2e-05,
"loss": 8.7551,
"mean_token_accuracy": 0.05864038914442062,
"num_tokens": 296233.0,
"step": 125
},
{
"entropy": 10.46686897277832,
"epoch": 0.008358516041921173,
"grad_norm": 1.6015625,
"learning_rate": 6.450000000000001e-05,
"loss": 8.6685,
"mean_token_accuracy": 0.05632430389523506,
"num_tokens": 309222.0,
"step": 130
},
{
"entropy": 10.386721515655518,
"epoch": 0.00867999742814891,
"grad_norm": 1.515625,
"learning_rate": 6.7e-05,
"loss": 8.4983,
"mean_token_accuracy": 0.05754401199519634,
"num_tokens": 322291.0,
"step": 135
},
{
"entropy": 10.285922241210937,
"epoch": 0.009001478814376648,
"grad_norm": 1.484375,
"learning_rate": 6.950000000000001e-05,
"loss": 8.3328,
"mean_token_accuracy": 0.06465739980340005,
"num_tokens": 333520.0,
"step": 140
},
{
"entropy": 10.168986701965332,
"epoch": 0.009322960200604385,
"grad_norm": 1.453125,
"learning_rate": 7.2e-05,
"loss": 8.1641,
"mean_token_accuracy": 0.0657901257276535,
"num_tokens": 344883.0,
"step": 145
},
{
"entropy": 10.042533111572265,
"epoch": 0.009644441586832123,
"grad_norm": 1.3515625,
"learning_rate": 7.45e-05,
"loss": 8.0727,
"mean_token_accuracy": 0.07245785929262638,
"num_tokens": 356600.0,
"step": 150
},
{
"entropy": 9.882461643218994,
"epoch": 0.00996592297305986,
"grad_norm": 1.4609375,
"learning_rate": 7.7e-05,
"loss": 7.9127,
"mean_token_accuracy": 0.0721237450838089,
"num_tokens": 368527.0,
"step": 155
},
{
"entropy": 9.694390869140625,
"epoch": 0.010287404359287598,
"grad_norm": 1.5,
"learning_rate": 7.950000000000001e-05,
"loss": 7.8511,
"mean_token_accuracy": 0.06826285421848297,
"num_tokens": 379836.0,
"step": 160
},
{
"entropy": 9.510071659088135,
"epoch": 0.010608885745515335,
"grad_norm": 1.0625,
"learning_rate": 8.2e-05,
"loss": 7.8393,
"mean_token_accuracy": 0.0674971140921116,
"num_tokens": 392535.0,
"step": 165
},
{
"entropy": 9.299476528167725,
"epoch": 0.010930367131743073,
"grad_norm": 0.91015625,
"learning_rate": 8.450000000000001e-05,
"loss": 7.7515,
"mean_token_accuracy": 0.06860553249716758,
"num_tokens": 405259.0,
"step": 170
},
{
"entropy": 9.040483093261718,
"epoch": 0.011251848517970809,
"grad_norm": 0.96875,
"learning_rate": 8.7e-05,
"loss": 7.599,
"mean_token_accuracy": 0.07114262394607067,
"num_tokens": 417922.0,
"step": 175
},
{
"entropy": 8.870688247680665,
"epoch": 0.011573329904198546,
"grad_norm": 1.078125,
"learning_rate": 8.95e-05,
"loss": 7.6169,
"mean_token_accuracy": 0.07012484185397624,
"num_tokens": 429411.0,
"step": 180
},
{
"entropy": 8.67488489151001,
"epoch": 0.011894811290426284,
"grad_norm": 1.171875,
"learning_rate": 9.2e-05,
"loss": 7.386,
"mean_token_accuracy": 0.0772802360355854,
"num_tokens": 439950.0,
"step": 185
},
{
"entropy": 8.489033699035645,
"epoch": 0.012216292676654021,
"grad_norm": 1.328125,
"learning_rate": 9.45e-05,
"loss": 7.3822,
"mean_token_accuracy": 0.07805034667253494,
"num_tokens": 451245.0,
"step": 190
},
{
"entropy": 8.393837928771973,
"epoch": 0.012537774062881759,
"grad_norm": 0.8671875,
"learning_rate": 9.7e-05,
"loss": 7.4539,
"mean_token_accuracy": 0.07150709182024002,
"num_tokens": 465146.0,
"step": 195
},
{
"entropy": 8.359711456298829,
"epoch": 0.012859255449109496,
"grad_norm": 1.28125,
"learning_rate": 9.95e-05,
"loss": 7.4708,
"mean_token_accuracy": 0.07765417769551278,
"num_tokens": 477079.0,
"step": 200
},
{
"entropy": 8.254557895660401,
"epoch": 0.013180736835337234,
"grad_norm": 1.0546875,
"learning_rate": 0.000102,
"loss": 7.2964,
"mean_token_accuracy": 0.08167731463909149,
"num_tokens": 488216.0,
"step": 205
},
{
"entropy": 8.201800632476807,
"epoch": 0.013502218221564971,
"grad_norm": 1.3984375,
"learning_rate": 0.00010449999999999999,
"loss": 7.2996,
"mean_token_accuracy": 0.08416381254792213,
"num_tokens": 501040.0,
"step": 210
},
{
"entropy": 8.122812938690185,
"epoch": 0.013823699607792709,
"grad_norm": 1.015625,
"learning_rate": 0.000107,
"loss": 7.2535,
"mean_token_accuracy": 0.08663205504417419,
"num_tokens": 512636.0,
"step": 215
},
{
"entropy": 8.088646793365479,
"epoch": 0.014145180994020446,
"grad_norm": 0.9765625,
"learning_rate": 0.0001095,
"loss": 7.301,
"mean_token_accuracy": 0.08183000981807709,
"num_tokens": 525249.0,
"step": 220
},
{
"entropy": 8.097221660614014,
"epoch": 0.014466662380248184,
"grad_norm": 1.34375,
"learning_rate": 0.000112,
"loss": 7.3486,
"mean_token_accuracy": 0.08002460822463035,
"num_tokens": 536963.0,
"step": 225
},
{
"entropy": 8.05938491821289,
"epoch": 0.014788143766475921,
"grad_norm": 1.171875,
"learning_rate": 0.0001145,
"loss": 7.2099,
"mean_token_accuracy": 0.08030182272195815,
"num_tokens": 549008.0,
"step": 230
},
{
"entropy": 8.041013956069946,
"epoch": 0.015109625152703659,
"grad_norm": 1.0390625,
"learning_rate": 0.00011700000000000001,
"loss": 7.2319,
"mean_token_accuracy": 0.09074903577566147,
"num_tokens": 560958.0,
"step": 235
},
{
"entropy": 7.961578607559204,
"epoch": 0.015431106538931396,
"grad_norm": 0.9921875,
"learning_rate": 0.00011949999999999999,
"loss": 7.1147,
"mean_token_accuracy": 0.09378238469362259,
"num_tokens": 572472.0,
"step": 240
},
{
"entropy": 7.922268009185791,
"epoch": 0.015752587925159132,
"grad_norm": 1.015625,
"learning_rate": 0.000122,
"loss": 7.1808,
"mean_token_accuracy": 0.08942435756325721,
"num_tokens": 585125.0,
"step": 245
},
{
"entropy": 7.913467741012573,
"epoch": 0.01607406931138687,
"grad_norm": 1.0390625,
"learning_rate": 0.0001245,
"loss": 7.1259,
"mean_token_accuracy": 0.09376866966485978,
"num_tokens": 597774.0,
"step": 250
},
{
"entropy": 7.856596946716309,
"epoch": 0.016395550697614607,
"grad_norm": 0.98828125,
"learning_rate": 0.000127,
"loss": 7.1233,
"mean_token_accuracy": 0.09992039278149605,
"num_tokens": 610130.0,
"step": 255
},
{
"entropy": 7.8915050506591795,
"epoch": 0.016717032083842346,
"grad_norm": 1.03125,
"learning_rate": 0.0001295,
"loss": 7.1488,
"mean_token_accuracy": 0.09605236500501632,
"num_tokens": 621659.0,
"step": 260
},
{
"entropy": 7.833514070510864,
"epoch": 0.017038513470070082,
"grad_norm": 1.0078125,
"learning_rate": 0.000132,
"loss": 7.0552,
"mean_token_accuracy": 0.09916835874319077,
"num_tokens": 633172.0,
"step": 265
},
{
"entropy": 7.854182243347168,
"epoch": 0.01735999485629782,
"grad_norm": 1.125,
"learning_rate": 0.00013450000000000002,
"loss": 7.0595,
"mean_token_accuracy": 0.09681920260190964,
"num_tokens": 643928.0,
"step": 270
},
{
"entropy": 7.712904834747315,
"epoch": 0.017681476242525557,
"grad_norm": 1.2265625,
"learning_rate": 0.00013700000000000002,
"loss": 6.9556,
"mean_token_accuracy": 0.09763396382331849,
"num_tokens": 654693.0,
"step": 275
},
{
"entropy": 7.817079973220825,
"epoch": 0.018002957628753296,
"grad_norm": 1.1484375,
"learning_rate": 0.0001395,
"loss": 7.1338,
"mean_token_accuracy": 0.09172611869871616,
"num_tokens": 667216.0,
"step": 280
},
{
"entropy": 7.727632856369018,
"epoch": 0.01832443901498103,
"grad_norm": 1.5078125,
"learning_rate": 0.00014199999999999998,
"loss": 6.9273,
"mean_token_accuracy": 0.10492636933922768,
"num_tokens": 679605.0,
"step": 285
},
{
"entropy": 7.6807286739349365,
"epoch": 0.01864592040120877,
"grad_norm": 1.0703125,
"learning_rate": 0.0001445,
"loss": 7.0243,
"mean_token_accuracy": 0.09721777960658073,
"num_tokens": 691581.0,
"step": 290
},
{
"entropy": 7.730735111236572,
"epoch": 0.018967401787436507,
"grad_norm": 1.203125,
"learning_rate": 0.000147,
"loss": 7.064,
"mean_token_accuracy": 0.10062759071588516,
"num_tokens": 703162.0,
"step": 295
},
{
"entropy": 7.675752592086792,
"epoch": 0.019288883173664246,
"grad_norm": 1.0390625,
"learning_rate": 0.0001495,
"loss": 6.947,
"mean_token_accuracy": 0.10126433670520782,
"num_tokens": 715024.0,
"step": 300
},
{
"entropy": 7.604991054534912,
"epoch": 0.01961036455989198,
"grad_norm": 1.390625,
"learning_rate": 0.000152,
"loss": 6.9484,
"mean_token_accuracy": 0.10657469853758812,
"num_tokens": 728434.0,
"step": 305
},
{
"entropy": 7.582369089126587,
"epoch": 0.01993184594611972,
"grad_norm": 1.109375,
"learning_rate": 0.00015450000000000001,
"loss": 6.9856,
"mean_token_accuracy": 0.10384280532598496,
"num_tokens": 741049.0,
"step": 310
},
{
"entropy": 7.556066989898682,
"epoch": 0.020253327332347457,
"grad_norm": 1.0234375,
"learning_rate": 0.000157,
"loss": 6.8995,
"mean_token_accuracy": 0.10891256630420684,
"num_tokens": 753316.0,
"step": 315
},
{
"entropy": 7.487519884109497,
"epoch": 0.020574808718575196,
"grad_norm": 1.078125,
"learning_rate": 0.0001595,
"loss": 6.8976,
"mean_token_accuracy": 0.10375816151499748,
"num_tokens": 766605.0,
"step": 320
},
{
"entropy": 7.575658369064331,
"epoch": 0.02089629010480293,
"grad_norm": 1.125,
"learning_rate": 0.000162,
"loss": 6.8776,
"mean_token_accuracy": 0.10548696890473366,
"num_tokens": 778857.0,
"step": 325
},
{
"entropy": 7.49542875289917,
"epoch": 0.02121777149103067,
"grad_norm": 1.1015625,
"learning_rate": 0.00016450000000000001,
"loss": 6.8801,
"mean_token_accuracy": 0.0980547919869423,
"num_tokens": 790497.0,
"step": 330
},
{
"entropy": 7.548171281814575,
"epoch": 0.021539252877258407,
"grad_norm": 1.2421875,
"learning_rate": 0.00016700000000000002,
"loss": 6.9457,
"mean_token_accuracy": 0.10034449025988579,
"num_tokens": 803021.0,
"step": 335
},
{
"entropy": 7.514672136306762,
"epoch": 0.021860734263486146,
"grad_norm": 1.234375,
"learning_rate": 0.00016950000000000003,
"loss": 6.8973,
"mean_token_accuracy": 0.10233017727732659,
"num_tokens": 815056.0,
"step": 340
},
{
"entropy": 7.548324632644653,
"epoch": 0.02218221564971388,
"grad_norm": 0.984375,
"learning_rate": 0.00017199999999999998,
"loss": 6.8436,
"mean_token_accuracy": 0.11048155352473259,
"num_tokens": 827149.0,
"step": 345
},
{
"entropy": 7.47729377746582,
"epoch": 0.022503697035941617,
"grad_norm": 1.1484375,
"learning_rate": 0.00017449999999999999,
"loss": 6.8877,
"mean_token_accuracy": 0.10872978940606118,
"num_tokens": 839172.0,
"step": 350
},
{
"entropy": 7.497987508773804,
"epoch": 0.022825178422169357,
"grad_norm": 1.75,
"learning_rate": 0.000177,
"loss": 6.9329,
"mean_token_accuracy": 0.10738308876752853,
"num_tokens": 851148.0,
"step": 355
},
{
"entropy": 7.548883295059204,
"epoch": 0.023146659808397092,
"grad_norm": 1.140625,
"learning_rate": 0.0001795,
"loss": 6.8783,
"mean_token_accuracy": 0.10820900201797486,
"num_tokens": 862904.0,
"step": 360
},
{
"entropy": 7.436304187774658,
"epoch": 0.02346814119462483,
"grad_norm": 1.359375,
"learning_rate": 0.000182,
"loss": 6.7668,
"mean_token_accuracy": 0.11688080206513404,
"num_tokens": 874720.0,
"step": 365
},
{
"entropy": 7.409350728988647,
"epoch": 0.023789622580852567,
"grad_norm": 1.0625,
"learning_rate": 0.0001845,
"loss": 6.8078,
"mean_token_accuracy": 0.11283540055155754,
"num_tokens": 887261.0,
"step": 370
},
{
"entropy": 7.4675617694854735,
"epoch": 0.024111103967080307,
"grad_norm": 1.0859375,
"learning_rate": 0.000187,
"loss": 6.7767,
"mean_token_accuracy": 0.1088891163468361,
"num_tokens": 898048.0,
"step": 375
},
{
"entropy": 7.336610507965088,
"epoch": 0.024432585353308042,
"grad_norm": 1.03125,
"learning_rate": 0.0001895,
"loss": 6.8343,
"mean_token_accuracy": 0.11030351296067238,
"num_tokens": 910297.0,
"step": 380
},
{
"entropy": 7.432262849807739,
"epoch": 0.02475406673953578,
"grad_norm": 1.0546875,
"learning_rate": 0.000192,
"loss": 6.8693,
"mean_token_accuracy": 0.10626164525747299,
"num_tokens": 923463.0,
"step": 385
},
{
"entropy": 7.399855327606201,
"epoch": 0.025075548125763517,
"grad_norm": 0.99609375,
"learning_rate": 0.0001945,
"loss": 6.8379,
"mean_token_accuracy": 0.11091364100575447,
"num_tokens": 935306.0,
"step": 390
},
{
"entropy": 7.355379390716553,
"epoch": 0.025397029511991256,
"grad_norm": 1.0859375,
"learning_rate": 0.00019700000000000002,
"loss": 6.7379,
"mean_token_accuracy": 0.115155877918005,
"num_tokens": 947827.0,
"step": 395
},
{
"entropy": 7.281255531311035,
"epoch": 0.025718510898218992,
"grad_norm": 1.375,
"learning_rate": 0.00019950000000000002,
"loss": 6.6838,
"mean_token_accuracy": 0.12000245451927186,
"num_tokens": 961664.0,
"step": 400
},
{
"entropy": 7.312869071960449,
"epoch": 0.02603999228444673,
"grad_norm": 1.21875,
"learning_rate": 0.000202,
"loss": 6.7829,
"mean_token_accuracy": 0.09842887446284294,
"num_tokens": 973981.0,
"step": 405
},
{
"entropy": 7.335048866271973,
"epoch": 0.026361473670674467,
"grad_norm": 1.3515625,
"learning_rate": 0.00020449999999999998,
"loss": 6.8181,
"mean_token_accuracy": 0.11232979372143745,
"num_tokens": 986702.0,
"step": 410
},
{
"entropy": 7.318604183197022,
"epoch": 0.026682955056902206,
"grad_norm": 1.1640625,
"learning_rate": 0.000207,
"loss": 6.7181,
"mean_token_accuracy": 0.11695454865694047,
"num_tokens": 998513.0,
"step": 415
},
{
"entropy": 7.294521141052246,
"epoch": 0.027004436443129942,
"grad_norm": 1.3515625,
"learning_rate": 0.0002095,
"loss": 6.7037,
"mean_token_accuracy": 0.11898418515920639,
"num_tokens": 1011111.0,
"step": 420
},
{
"entropy": 7.186019515991211,
"epoch": 0.02732591782935768,
"grad_norm": 1.2578125,
"learning_rate": 0.000212,
"loss": 6.6799,
"mean_token_accuracy": 0.11566238775849343,
"num_tokens": 1021779.0,
"step": 425
},
{
"entropy": 7.370555067062378,
"epoch": 0.027647399215585417,
"grad_norm": 1.0703125,
"learning_rate": 0.0002145,
"loss": 6.7381,
"mean_token_accuracy": 0.11263754442334176,
"num_tokens": 1033228.0,
"step": 430
},
{
"entropy": 7.226527881622315,
"epoch": 0.027968880601813156,
"grad_norm": 1.0703125,
"learning_rate": 0.00021700000000000002,
"loss": 6.6415,
"mean_token_accuracy": 0.11632440984249115,
"num_tokens": 1044964.0,
"step": 435
},
{
"entropy": 7.18967342376709,
"epoch": 0.028290361988040892,
"grad_norm": 1.2265625,
"learning_rate": 0.0002195,
"loss": 6.6058,
"mean_token_accuracy": 0.12256524711847305,
"num_tokens": 1056450.0,
"step": 440
},
{
"entropy": 7.242304182052612,
"epoch": 0.02861184337426863,
"grad_norm": 1.0703125,
"learning_rate": 0.000222,
"loss": 6.7402,
"mean_token_accuracy": 0.1159943200647831,
"num_tokens": 1067031.0,
"step": 445
},
{
"entropy": 7.1245410442352295,
"epoch": 0.028933324760496367,
"grad_norm": 1.3046875,
"learning_rate": 0.0002245,
"loss": 6.6051,
"mean_token_accuracy": 0.1228414848446846,
"num_tokens": 1078718.0,
"step": 450
},
{
"entropy": 7.182725429534912,
"epoch": 0.029254806146724106,
"grad_norm": 1.0703125,
"learning_rate": 0.00022700000000000002,
"loss": 6.6217,
"mean_token_accuracy": 0.11590910404920578,
"num_tokens": 1091630.0,
"step": 455
},
{
"entropy": 7.229373598098755,
"epoch": 0.029576287532951842,
"grad_norm": 1.2109375,
"learning_rate": 0.00022950000000000002,
"loss": 6.6761,
"mean_token_accuracy": 0.11919770017266273,
"num_tokens": 1102339.0,
"step": 460
},
{
"entropy": 7.166626882553101,
"epoch": 0.029897768919179578,
"grad_norm": 1.2109375,
"learning_rate": 0.00023200000000000003,
"loss": 6.6491,
"mean_token_accuracy": 0.11653751060366631,
"num_tokens": 1114385.0,
"step": 465
},
{
"entropy": 7.213460397720337,
"epoch": 0.030219250305407317,
"grad_norm": 1.0625,
"learning_rate": 0.00023449999999999998,
"loss": 6.6627,
"mean_token_accuracy": 0.12240460664033889,
"num_tokens": 1126364.0,
"step": 470
},
{
"entropy": 7.160998678207397,
"epoch": 0.030540731691635053,
"grad_norm": 1.265625,
"learning_rate": 0.000237,
"loss": 6.6469,
"mean_token_accuracy": 0.12170583978295327,
"num_tokens": 1137492.0,
"step": 475
},
{
"entropy": 7.108113145828247,
"epoch": 0.030862213077862792,
"grad_norm": 1.078125,
"learning_rate": 0.0002395,
"loss": 6.5317,
"mean_token_accuracy": 0.12732059210538865,
"num_tokens": 1148734.0,
"step": 480
},
{
"entropy": 7.14542589187622,
"epoch": 0.031183694464090528,
"grad_norm": 0.96875,
"learning_rate": 0.000242,
"loss": 6.6757,
"mean_token_accuracy": 0.12211950346827508,
"num_tokens": 1163229.0,
"step": 485
},
{
"entropy": 7.165257167816162,
"epoch": 0.031505175850318264,
"grad_norm": 1.015625,
"learning_rate": 0.0002445,
"loss": 6.6959,
"mean_token_accuracy": 0.1155033528804779,
"num_tokens": 1175452.0,
"step": 490
},
{
"entropy": 7.1013343334198,
"epoch": 0.031826657236546006,
"grad_norm": 1.0078125,
"learning_rate": 0.000247,
"loss": 6.5479,
"mean_token_accuracy": 0.12406643405556679,
"num_tokens": 1187836.0,
"step": 495
},
{
"entropy": 7.197257661819458,
"epoch": 0.03214813862277374,
"grad_norm": 1.09375,
"learning_rate": 0.0002495,
"loss": 6.6297,
"mean_token_accuracy": 0.12298163026571274,
"num_tokens": 1198867.0,
"step": 500
},
{
"entropy": 7.00099925994873,
"epoch": 0.03246962000900148,
"grad_norm": 1.1015625,
"learning_rate": 0.000252,
"loss": 6.5666,
"mean_token_accuracy": 0.11886920258402825,
"num_tokens": 1212534.0,
"step": 505
},
{
"entropy": 7.123233509063721,
"epoch": 0.032791101395229214,
"grad_norm": 1.4375,
"learning_rate": 0.0002545,
"loss": 6.4812,
"mean_token_accuracy": 0.1376668132841587,
"num_tokens": 1223028.0,
"step": 510
},
{
"entropy": 7.040684223175049,
"epoch": 0.033112582781456956,
"grad_norm": 1.1875,
"learning_rate": 0.000257,
"loss": 6.5438,
"mean_token_accuracy": 0.12737778946757317,
"num_tokens": 1235460.0,
"step": 515
},
{
"entropy": 6.9980145454406735,
"epoch": 0.03343406416768469,
"grad_norm": 1.1953125,
"learning_rate": 0.0002595,
"loss": 6.5329,
"mean_token_accuracy": 0.1297763057053089,
"num_tokens": 1247180.0,
"step": 520
},
{
"entropy": 7.0526275634765625,
"epoch": 0.03375554555391243,
"grad_norm": 1.0859375,
"learning_rate": 0.000262,
"loss": 6.5934,
"mean_token_accuracy": 0.12331821173429489,
"num_tokens": 1260000.0,
"step": 525
},
{
"entropy": 6.997141313552857,
"epoch": 0.034077026940140163,
"grad_norm": 1.203125,
"learning_rate": 0.00026450000000000003,
"loss": 6.4284,
"mean_token_accuracy": 0.12857622653245926,
"num_tokens": 1271346.0,
"step": 530
},
{
"entropy": 7.008873414993286,
"epoch": 0.034398508326367906,
"grad_norm": 1.0703125,
"learning_rate": 0.00026700000000000004,
"loss": 6.5163,
"mean_token_accuracy": 0.12632984891533852,
"num_tokens": 1283017.0,
"step": 535
},
{
"entropy": 7.0776612758636475,
"epoch": 0.03471998971259564,
"grad_norm": 1.15625,
"learning_rate": 0.00026950000000000005,
"loss": 6.5481,
"mean_token_accuracy": 0.12498711422085762,
"num_tokens": 1293243.0,
"step": 540
},
{
"entropy": 6.8785299301147464,
"epoch": 0.03504147109882338,
"grad_norm": 1.171875,
"learning_rate": 0.00027200000000000005,
"loss": 6.439,
"mean_token_accuracy": 0.134949841350317,
"num_tokens": 1304801.0,
"step": 545
},
{
"entropy": 7.143336582183838,
"epoch": 0.03536295248505111,
"grad_norm": 1.046875,
"learning_rate": 0.0002745,
"loss": 6.6164,
"mean_token_accuracy": 0.12681611329317094,
"num_tokens": 1315985.0,
"step": 550
},
{
"entropy": 6.930103540420532,
"epoch": 0.035684433871278856,
"grad_norm": 1.125,
"learning_rate": 0.000277,
"loss": 6.4575,
"mean_token_accuracy": 0.13166105449199678,
"num_tokens": 1327771.0,
"step": 555
},
{
"entropy": 6.966667604446411,
"epoch": 0.03600591525750659,
"grad_norm": 1.3359375,
"learning_rate": 0.0002795,
"loss": 6.412,
"mean_token_accuracy": 0.13625267744064332,
"num_tokens": 1338524.0,
"step": 560
},
{
"entropy": 6.932982063293457,
"epoch": 0.03632739664373433,
"grad_norm": 1.2734375,
"learning_rate": 0.00028199999999999997,
"loss": 6.4579,
"mean_token_accuracy": 0.12851827815175057,
"num_tokens": 1350619.0,
"step": 565
},
{
"entropy": 6.9319816589355465,
"epoch": 0.03664887802996206,
"grad_norm": 1.1484375,
"learning_rate": 0.0002845,
"loss": 6.4918,
"mean_token_accuracy": 0.12711360901594163,
"num_tokens": 1362781.0,
"step": 570
},
{
"entropy": 6.932379579544067,
"epoch": 0.0369703594161898,
"grad_norm": 1.171875,
"learning_rate": 0.000287,
"loss": 6.4437,
"mean_token_accuracy": 0.1318575732409954,
"num_tokens": 1373784.0,
"step": 575
},
{
"entropy": 7.074356174468994,
"epoch": 0.03729184080241754,
"grad_norm": 1.1171875,
"learning_rate": 0.0002895,
"loss": 6.705,
"mean_token_accuracy": 0.11901014372706413,
"num_tokens": 1386426.0,
"step": 580
},
{
"entropy": 6.872195100784301,
"epoch": 0.03761332218864528,
"grad_norm": 1.0703125,
"learning_rate": 0.000292,
"loss": 6.3845,
"mean_token_accuracy": 0.13377587869763374,
"num_tokens": 1397703.0,
"step": 585
},
{
"entropy": 6.900994157791137,
"epoch": 0.03793480357487301,
"grad_norm": 1.046875,
"learning_rate": 0.0002945,
"loss": 6.4395,
"mean_token_accuracy": 0.12795801013708114,
"num_tokens": 1410071.0,
"step": 590
},
{
"entropy": 6.954240083694458,
"epoch": 0.03825628496110075,
"grad_norm": 1.3828125,
"learning_rate": 0.000297,
"loss": 6.4338,
"mean_token_accuracy": 0.1245950624346733,
"num_tokens": 1421387.0,
"step": 595
},
{
"entropy": 6.907541370391845,
"epoch": 0.03857776634732849,
"grad_norm": 1.2109375,
"learning_rate": 0.0002995,
"loss": 6.4593,
"mean_token_accuracy": 0.12624357938766478,
"num_tokens": 1433253.0,
"step": 600
},
{
"entropy": 6.899614143371582,
"epoch": 0.03889924773355623,
"grad_norm": 1.4296875,
"learning_rate": 0.000302,
"loss": 6.4459,
"mean_token_accuracy": 0.12114612162113189,
"num_tokens": 1444189.0,
"step": 605
},
{
"entropy": 6.889805459976197,
"epoch": 0.03922072911978396,
"grad_norm": 1.1484375,
"learning_rate": 0.0003045,
"loss": 6.4478,
"mean_token_accuracy": 0.12658536732196807,
"num_tokens": 1455830.0,
"step": 610
},
{
"entropy": 6.883515930175781,
"epoch": 0.0395422105060117,
"grad_norm": 1.2421875,
"learning_rate": 0.000307,
"loss": 6.474,
"mean_token_accuracy": 0.13375141024589537,
"num_tokens": 1467442.0,
"step": 615
},
{
"entropy": 6.902092170715332,
"epoch": 0.03986369189223944,
"grad_norm": 1.2421875,
"learning_rate": 0.0003095,
"loss": 6.378,
"mean_token_accuracy": 0.1375095695257187,
"num_tokens": 1478113.0,
"step": 620
},
{
"entropy": 6.887974262237549,
"epoch": 0.04018517327846718,
"grad_norm": 1.2265625,
"learning_rate": 0.000312,
"loss": 6.4173,
"mean_token_accuracy": 0.1352170430123806,
"num_tokens": 1490097.0,
"step": 625
},
{
"entropy": 6.751322174072266,
"epoch": 0.04050665466469491,
"grad_norm": 1.15625,
"learning_rate": 0.0003145,
"loss": 6.3863,
"mean_token_accuracy": 0.13129702284932138,
"num_tokens": 1501565.0,
"step": 630
},
{
"entropy": 6.841671752929687,
"epoch": 0.04082813605092265,
"grad_norm": 1.1640625,
"learning_rate": 0.000317,
"loss": 6.385,
"mean_token_accuracy": 0.13331395909190177,
"num_tokens": 1512434.0,
"step": 635
},
{
"entropy": 6.838632202148437,
"epoch": 0.04114961743715039,
"grad_norm": 1.0859375,
"learning_rate": 0.0003195,
"loss": 6.3326,
"mean_token_accuracy": 0.13992721661925317,
"num_tokens": 1524212.0,
"step": 640
},
{
"entropy": 6.717573928833008,
"epoch": 0.04147109882337813,
"grad_norm": 1.046875,
"learning_rate": 0.000322,
"loss": 6.2641,
"mean_token_accuracy": 0.13435597494244575,
"num_tokens": 1536588.0,
"step": 645
},
{
"entropy": 6.813121795654297,
"epoch": 0.04179258020960586,
"grad_norm": 1.140625,
"learning_rate": 0.00032450000000000003,
"loss": 6.4067,
"mean_token_accuracy": 0.1357954926788807,
"num_tokens": 1548334.0,
"step": 650
},
{
"entropy": 6.733175325393677,
"epoch": 0.0421140615958336,
"grad_norm": 1.1796875,
"learning_rate": 0.00032700000000000003,
"loss": 6.3691,
"mean_token_accuracy": 0.13718299865722655,
"num_tokens": 1560381.0,
"step": 655
},
{
"entropy": 6.773969268798828,
"epoch": 0.04243554298206134,
"grad_norm": 1.1015625,
"learning_rate": 0.00032950000000000004,
"loss": 6.3926,
"mean_token_accuracy": 0.1230570524930954,
"num_tokens": 1573484.0,
"step": 660
},
{
"entropy": 6.820370149612427,
"epoch": 0.04275702436828908,
"grad_norm": 1.171875,
"learning_rate": 0.00033200000000000005,
"loss": 6.3808,
"mean_token_accuracy": 0.13517048284411431,
"num_tokens": 1585471.0,
"step": 665
},
{
"entropy": 6.72473177909851,
"epoch": 0.04307850575451681,
"grad_norm": 1.0234375,
"learning_rate": 0.00033450000000000005,
"loss": 6.2612,
"mean_token_accuracy": 0.14530360400676728,
"num_tokens": 1596321.0,
"step": 670
},
{
"entropy": 6.86566572189331,
"epoch": 0.04339998714074455,
"grad_norm": 1.2265625,
"learning_rate": 0.000337,
"loss": 6.4255,
"mean_token_accuracy": 0.1406514436006546,
"num_tokens": 1608219.0,
"step": 675
},
{
"entropy": 6.6760951519012455,
"epoch": 0.04372146852697229,
"grad_norm": 1.0859375,
"learning_rate": 0.0003395,
"loss": 6.2714,
"mean_token_accuracy": 0.13934220522642135,
"num_tokens": 1619420.0,
"step": 680
},
{
"entropy": 6.79856915473938,
"epoch": 0.04404294991320003,
"grad_norm": 1.1015625,
"learning_rate": 0.000342,
"loss": 6.3423,
"mean_token_accuracy": 0.13619581386446952,
"num_tokens": 1631022.0,
"step": 685
},
{
"entropy": 6.7899799823760985,
"epoch": 0.04436443129942776,
"grad_norm": 1.0859375,
"learning_rate": 0.00034449999999999997,
"loss": 6.3661,
"mean_token_accuracy": 0.13836024552583695,
"num_tokens": 1642930.0,
"step": 690
},
{
"entropy": 6.691325092315674,
"epoch": 0.0446859126856555,
"grad_norm": 1.0703125,
"learning_rate": 0.000347,
"loss": 6.3574,
"mean_token_accuracy": 0.1367586337029934,
"num_tokens": 1655776.0,
"step": 695
},
{
"entropy": 6.817952728271484,
"epoch": 0.045007394071883235,
"grad_norm": 1.0390625,
"learning_rate": 0.0003495,
"loss": 6.361,
"mean_token_accuracy": 0.1369588740170002,
"num_tokens": 1669330.0,
"step": 700
},
{
"entropy": 6.626900386810303,
"epoch": 0.04532887545811098,
"grad_norm": 1.078125,
"learning_rate": 0.000352,
"loss": 6.3733,
"mean_token_accuracy": 0.1379777029156685,
"num_tokens": 1682126.0,
"step": 705
},
{
"entropy": 6.74940242767334,
"epoch": 0.04565035684433871,
"grad_norm": 1.1328125,
"learning_rate": 0.0003545,
"loss": 6.2913,
"mean_token_accuracy": 0.14252828136086465,
"num_tokens": 1693070.0,
"step": 710
},
{
"entropy": 6.821109485626221,
"epoch": 0.04597183823056645,
"grad_norm": 1.2109375,
"learning_rate": 0.000357,
"loss": 6.3673,
"mean_token_accuracy": 0.13518087714910507,
"num_tokens": 1705254.0,
"step": 715
},
{
"entropy": 6.716013097763062,
"epoch": 0.046293319616794185,
"grad_norm": 1.1015625,
"learning_rate": 0.0003595,
"loss": 6.3296,
"mean_token_accuracy": 0.1330641709268093,
"num_tokens": 1718214.0,
"step": 720
},
{
"entropy": 6.745158529281616,
"epoch": 0.04661480100302193,
"grad_norm": 1.109375,
"learning_rate": 0.000362,
"loss": 6.36,
"mean_token_accuracy": 0.13509849980473518,
"num_tokens": 1731046.0,
"step": 725
},
{
"entropy": 6.691292095184326,
"epoch": 0.04693628238924966,
"grad_norm": 1.171875,
"learning_rate": 0.0003645,
"loss": 6.3051,
"mean_token_accuracy": 0.13931626304984093,
"num_tokens": 1744332.0,
"step": 730
},
{
"entropy": 6.6679082870483395,
"epoch": 0.0472577637754774,
"grad_norm": 1.109375,
"learning_rate": 0.000367,
"loss": 6.3141,
"mean_token_accuracy": 0.1361882694065571,
"num_tokens": 1757744.0,
"step": 735
},
{
"entropy": 6.755461311340332,
"epoch": 0.047579245161705135,
"grad_norm": 1.0625,
"learning_rate": 0.0003695,
"loss": 6.3255,
"mean_token_accuracy": 0.13589167818427086,
"num_tokens": 1769710.0,
"step": 740
},
{
"entropy": 6.661909294128418,
"epoch": 0.04790072654793288,
"grad_norm": 1.0390625,
"learning_rate": 0.000372,
"loss": 6.3197,
"mean_token_accuracy": 0.134683046489954,
"num_tokens": 1782299.0,
"step": 745
},
{
"entropy": 6.686239433288574,
"epoch": 0.04822220793416061,
"grad_norm": 1.171875,
"learning_rate": 0.0003745,
"loss": 6.2854,
"mean_token_accuracy": 0.1418588526546955,
"num_tokens": 1794407.0,
"step": 750
},
{
"entropy": 6.681186580657959,
"epoch": 0.04854368932038835,
"grad_norm": 1.1796875,
"learning_rate": 0.000377,
"loss": 6.2539,
"mean_token_accuracy": 0.13846987187862397,
"num_tokens": 1806512.0,
"step": 755
},
{
"entropy": 6.679962110519409,
"epoch": 0.048865170706616085,
"grad_norm": 0.9921875,
"learning_rate": 0.0003795,
"loss": 6.2985,
"mean_token_accuracy": 0.14243988171219826,
"num_tokens": 1819456.0,
"step": 760
},
{
"entropy": 6.526072311401367,
"epoch": 0.04918665209284383,
"grad_norm": 1.1953125,
"learning_rate": 0.000382,
"loss": 6.1211,
"mean_token_accuracy": 0.14557768478989602,
"num_tokens": 1831866.0,
"step": 765
},
{
"entropy": 6.57554988861084,
"epoch": 0.04950813347907156,
"grad_norm": 1.1015625,
"learning_rate": 0.0003845,
"loss": 6.141,
"mean_token_accuracy": 0.14539860635995866,
"num_tokens": 1842662.0,
"step": 770
},
{
"entropy": 6.579600238800049,
"epoch": 0.0498296148652993,
"grad_norm": 1.0078125,
"learning_rate": 0.00038700000000000003,
"loss": 6.1807,
"mean_token_accuracy": 0.14677832573652266,
"num_tokens": 1855599.0,
"step": 775
},
{
"entropy": 6.664310932159424,
"epoch": 0.050151096251527034,
"grad_norm": 1.265625,
"learning_rate": 0.00038950000000000003,
"loss": 6.2611,
"mean_token_accuracy": 0.13455238118767737,
"num_tokens": 1866656.0,
"step": 780
},
{
"entropy": 6.580622625350952,
"epoch": 0.05047257763775478,
"grad_norm": 1.1484375,
"learning_rate": 0.00039200000000000004,
"loss": 6.2491,
"mean_token_accuracy": 0.13729645386338235,
"num_tokens": 1877473.0,
"step": 785
},
{
"entropy": 6.699300527572632,
"epoch": 0.05079405902398251,
"grad_norm": 1.046875,
"learning_rate": 0.00039450000000000005,
"loss": 6.2869,
"mean_token_accuracy": 0.13934579417109488,
"num_tokens": 1889113.0,
"step": 790
},
{
"entropy": 6.575865650177002,
"epoch": 0.05111554041021025,
"grad_norm": 1.0,
"learning_rate": 0.00039700000000000005,
"loss": 6.1885,
"mean_token_accuracy": 0.1417413368821144,
"num_tokens": 1901528.0,
"step": 795
},
{
"entropy": 6.590616846084595,
"epoch": 0.051437021796437984,
"grad_norm": 1.0703125,
"learning_rate": 0.0003995,
"loss": 6.2219,
"mean_token_accuracy": 0.13816025704145432,
"num_tokens": 1912036.0,
"step": 800
},
{
"entropy": 6.601884841918945,
"epoch": 0.05175850318266572,
"grad_norm": 1.03125,
"learning_rate": 0.000402,
"loss": 6.1707,
"mean_token_accuracy": 0.14483692795038222,
"num_tokens": 1923939.0,
"step": 805
},
{
"entropy": 6.482674884796142,
"epoch": 0.05207998456889346,
"grad_norm": 1.078125,
"learning_rate": 0.0004045,
"loss": 6.1383,
"mean_token_accuracy": 0.15191132128238677,
"num_tokens": 1935248.0,
"step": 810
},
{
"entropy": 6.679584169387818,
"epoch": 0.0524014659551212,
"grad_norm": 1.1640625,
"learning_rate": 0.00040699999999999997,
"loss": 6.2512,
"mean_token_accuracy": 0.1460711881518364,
"num_tokens": 1946732.0,
"step": 815
},
{
"entropy": 6.574809503555298,
"epoch": 0.052722947341348934,
"grad_norm": 1.1796875,
"learning_rate": 0.0004095,
"loss": 6.226,
"mean_token_accuracy": 0.1427159160375595,
"num_tokens": 1958316.0,
"step": 820
},
{
"entropy": 6.472147607803345,
"epoch": 0.05304442872757667,
"grad_norm": 1.0390625,
"learning_rate": 0.000412,
"loss": 6.0917,
"mean_token_accuracy": 0.15051717907190323,
"num_tokens": 1969543.0,
"step": 825
},
{
"entropy": 6.623300170898437,
"epoch": 0.05336591011380441,
"grad_norm": 1.234375,
"learning_rate": 0.0004145,
"loss": 6.313,
"mean_token_accuracy": 0.1366821512579918,
"num_tokens": 1981085.0,
"step": 830
},
{
"entropy": 6.603462076187133,
"epoch": 0.05368739150003215,
"grad_norm": 1.171875,
"learning_rate": 0.000417,
"loss": 6.1986,
"mean_token_accuracy": 0.14714324995875358,
"num_tokens": 1992610.0,
"step": 835
},
{
"entropy": 6.533374309539795,
"epoch": 0.054008872886259884,
"grad_norm": 1.1171875,
"learning_rate": 0.0004195,
"loss": 6.1716,
"mean_token_accuracy": 0.14295029491186143,
"num_tokens": 2004154.0,
"step": 840
},
{
"entropy": 6.516127395629883,
"epoch": 0.05433035427248762,
"grad_norm": 1.0703125,
"learning_rate": 0.000422,
"loss": 6.0815,
"mean_token_accuracy": 0.14348058253526688,
"num_tokens": 2015141.0,
"step": 845
},
{
"entropy": 6.5279299259185795,
"epoch": 0.05465183565871536,
"grad_norm": 0.9921875,
"learning_rate": 0.0004245,
"loss": 6.1455,
"mean_token_accuracy": 0.15023983269929886,
"num_tokens": 2028173.0,
"step": 850
},
{
"entropy": 6.429127645492554,
"epoch": 0.0549733170449431,
"grad_norm": 1.1328125,
"learning_rate": 0.000427,
"loss": 6.1486,
"mean_token_accuracy": 0.14123030006885529,
"num_tokens": 2039979.0,
"step": 855
},
{
"entropy": 6.57825779914856,
"epoch": 0.055294798431170834,
"grad_norm": 1.046875,
"learning_rate": 0.0004295,
"loss": 6.0981,
"mean_token_accuracy": 0.14770488440990448,
"num_tokens": 2051052.0,
"step": 860
},
{
"entropy": 6.48339581489563,
"epoch": 0.05561627981739857,
"grad_norm": 1.0078125,
"learning_rate": 0.000432,
"loss": 6.2736,
"mean_token_accuracy": 0.13757081255316733,
"num_tokens": 2064252.0,
"step": 865
},
{
"entropy": 6.527880430221558,
"epoch": 0.05593776120362631,
"grad_norm": 1.1640625,
"learning_rate": 0.0004345,
"loss": 6.1659,
"mean_token_accuracy": 0.14587004482746124,
"num_tokens": 2075697.0,
"step": 870
},
{
"entropy": 6.587885761260987,
"epoch": 0.05625924258985405,
"grad_norm": 1.21875,
"learning_rate": 0.000437,
"loss": 6.2902,
"mean_token_accuracy": 0.1394598327577114,
"num_tokens": 2088354.0,
"step": 875
},
{
"entropy": 6.597920179367065,
"epoch": 0.056580723976081784,
"grad_norm": 1.21875,
"learning_rate": 0.0004395,
"loss": 6.2794,
"mean_token_accuracy": 0.14314963445067405,
"num_tokens": 2101291.0,
"step": 880
},
{
"entropy": 6.531395626068115,
"epoch": 0.05690220536230952,
"grad_norm": 1.40625,
"learning_rate": 0.000442,
"loss": 6.1794,
"mean_token_accuracy": 0.15109536275267602,
"num_tokens": 2114151.0,
"step": 885
},
{
"entropy": 6.5403975486755375,
"epoch": 0.05722368674853726,
"grad_norm": 1.1484375,
"learning_rate": 0.0004445,
"loss": 6.2204,
"mean_token_accuracy": 0.140879013389349,
"num_tokens": 2127638.0,
"step": 890
},
{
"entropy": 6.454720592498779,
"epoch": 0.057545168134765,
"grad_norm": 1.1015625,
"learning_rate": 0.000447,
"loss": 6.1054,
"mean_token_accuracy": 0.15080050081014634,
"num_tokens": 2139773.0,
"step": 895
},
{
"entropy": 6.582310771942138,
"epoch": 0.057866649520992734,
"grad_norm": 1.1328125,
"learning_rate": 0.00044950000000000003,
"loss": 6.2261,
"mean_token_accuracy": 0.13719287440180777,
"num_tokens": 2151167.0,
"step": 900
},
{
"entropy": 6.373457574844361,
"epoch": 0.05818813090722047,
"grad_norm": 0.98828125,
"learning_rate": 0.00045200000000000004,
"loss": 6.1103,
"mean_token_accuracy": 0.14882433116436006,
"num_tokens": 2163150.0,
"step": 905
},
{
"entropy": 6.511533308029175,
"epoch": 0.05850961229344821,
"grad_norm": 1.1328125,
"learning_rate": 0.00045450000000000004,
"loss": 6.138,
"mean_token_accuracy": 0.1470898576080799,
"num_tokens": 2175116.0,
"step": 910
},
{
"entropy": 6.402334594726563,
"epoch": 0.05883109367967595,
"grad_norm": 1.0703125,
"learning_rate": 0.00045700000000000005,
"loss": 6.0541,
"mean_token_accuracy": 0.1523958332836628,
"num_tokens": 2188074.0,
"step": 915
},
{
"entropy": 6.463513612747192,
"epoch": 0.059152575065903684,
"grad_norm": 1.125,
"learning_rate": 0.00045950000000000006,
"loss": 6.1002,
"mean_token_accuracy": 0.1470402017235756,
"num_tokens": 2200706.0,
"step": 920
},
{
"entropy": 6.349210262298584,
"epoch": 0.05947405645213142,
"grad_norm": 1.109375,
"learning_rate": 0.000462,
"loss": 6.1154,
"mean_token_accuracy": 0.15224614143371581,
"num_tokens": 2212493.0,
"step": 925
},
{
"entropy": 6.507826137542724,
"epoch": 0.059795537838359156,
"grad_norm": 1.0859375,
"learning_rate": 0.0004645,
"loss": 6.1258,
"mean_token_accuracy": 0.14575668349862098,
"num_tokens": 2224668.0,
"step": 930
},
{
"entropy": 6.432238912582397,
"epoch": 0.0601170192245869,
"grad_norm": 1.125,
"learning_rate": 0.000467,
"loss": 6.1242,
"mean_token_accuracy": 0.14432022348046303,
"num_tokens": 2236280.0,
"step": 935
},
{
"entropy": 6.493103885650635,
"epoch": 0.060438500610814634,
"grad_norm": 1.0234375,
"learning_rate": 0.0004695,
"loss": 6.1341,
"mean_token_accuracy": 0.14489658921957016,
"num_tokens": 2246947.0,
"step": 940
},
{
"entropy": 6.486361408233643,
"epoch": 0.06075998199704237,
"grad_norm": 1.078125,
"learning_rate": 0.000472,
"loss": 6.1497,
"mean_token_accuracy": 0.1474609225988388,
"num_tokens": 2258591.0,
"step": 945
},
{
"entropy": 6.394432783126831,
"epoch": 0.061081463383270106,
"grad_norm": 1.09375,
"learning_rate": 0.0004745,
"loss": 6.1055,
"mean_token_accuracy": 0.1405967153608799,
"num_tokens": 2269725.0,
"step": 950
},
{
"entropy": 6.481177186965942,
"epoch": 0.06140294476949785,
"grad_norm": 1.0546875,
"learning_rate": 0.000477,
"loss": 6.0784,
"mean_token_accuracy": 0.1547504723072052,
"num_tokens": 2282172.0,
"step": 955
},
{
"entropy": 6.446505546569824,
"epoch": 0.061724426155725584,
"grad_norm": 1.25,
"learning_rate": 0.0004795,
"loss": 6.2106,
"mean_token_accuracy": 0.14404927641153337,
"num_tokens": 2293991.0,
"step": 960
},
{
"entropy": 6.479608154296875,
"epoch": 0.06204590754195332,
"grad_norm": 1.0859375,
"learning_rate": 0.000482,
"loss": 6.1149,
"mean_token_accuracy": 0.1508398488163948,
"num_tokens": 2306715.0,
"step": 965
},
{
"entropy": 6.330813074111939,
"epoch": 0.062367388928181056,
"grad_norm": 1.1640625,
"learning_rate": 0.0004845,
"loss": 6.1465,
"mean_token_accuracy": 0.14545181691646575,
"num_tokens": 2319096.0,
"step": 970
},
{
"entropy": 6.360287046432495,
"epoch": 0.0626888703144088,
"grad_norm": 1.140625,
"learning_rate": 0.000487,
"loss": 6.0329,
"mean_token_accuracy": 0.14853936582803726,
"num_tokens": 2332239.0,
"step": 975
},
{
"entropy": 6.3763471126556395,
"epoch": 0.06301035170063653,
"grad_norm": 1.0390625,
"learning_rate": 0.0004895,
"loss": 6.1228,
"mean_token_accuracy": 0.14723728373646736,
"num_tokens": 2343897.0,
"step": 980
},
{
"entropy": 6.353127479553223,
"epoch": 0.06333183308686427,
"grad_norm": 0.99609375,
"learning_rate": 0.000492,
"loss": 6.0663,
"mean_token_accuracy": 0.14970697611570358,
"num_tokens": 2356811.0,
"step": 985
},
{
"entropy": 6.3828963279724125,
"epoch": 0.06365331447309201,
"grad_norm": 1.09375,
"learning_rate": 0.0004945,
"loss": 6.0559,
"mean_token_accuracy": 0.15341916903853417,
"num_tokens": 2369146.0,
"step": 990
},
{
"entropy": 6.346980619430542,
"epoch": 0.06397479585931974,
"grad_norm": 1.0234375,
"learning_rate": 0.000497,
"loss": 6.0164,
"mean_token_accuracy": 0.1514612004160881,
"num_tokens": 2381154.0,
"step": 995
},
{
"entropy": 6.36736650466919,
"epoch": 0.06429627724554748,
"grad_norm": 1.15625,
"learning_rate": 0.0004995,
"loss": 6.1074,
"mean_token_accuracy": 0.14672497659921646,
"num_tokens": 2392095.0,
"step": 1000
}
],
"logging_steps": 5,
"max_steps": 4000,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 535645743022080.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}