Files
dan-latn-100mb-ppt-Dp-100mb…/checkpoint-500/trainer_state.json
ModelHub XC 7d89f9f142 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/dan-latn-100mb-ppt-Dp-100mb_seed455
Source: Original Platform
2026-08-13 11:57:17 +08:00

1035 lines
27 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.027977506085107573,
"eval_steps": 500,
"global_step": 500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.691505527496338,
"epoch": 0.0002797750608510757,
"grad_norm": 12.375,
"learning_rate": 2e-06,
"loss": 10.7862,
"mean_token_accuracy": 0.0,
"num_tokens": 9833.0,
"step": 5
},
{
"entropy": 10.691538619995118,
"epoch": 0.0005595501217021514,
"grad_norm": 13.0,
"learning_rate": 4.5e-06,
"loss": 10.7246,
"mean_token_accuracy": 0.0,
"num_tokens": 19666.0,
"step": 10
},
{
"entropy": 10.691145992279052,
"epoch": 0.0008393251825532272,
"grad_norm": 9.3125,
"learning_rate": 7e-06,
"loss": 10.4747,
"mean_token_accuracy": 0.019643833697773515,
"num_tokens": 28771.0,
"step": 15
},
{
"entropy": 10.682477760314942,
"epoch": 0.0011191002434043028,
"grad_norm": 6.21875,
"learning_rate": 9.5e-06,
"loss": 10.1639,
"mean_token_accuracy": 0.04193656481802464,
"num_tokens": 38625.0,
"step": 20
},
{
"entropy": 10.617809772491455,
"epoch": 0.0013988753042553786,
"grad_norm": 4.09375,
"learning_rate": 1.2e-05,
"loss": 9.8606,
"mean_token_accuracy": 0.04725950676947832,
"num_tokens": 47864.0,
"step": 25
},
{
"entropy": 10.55274839401245,
"epoch": 0.0016786503651064545,
"grad_norm": 3.421875,
"learning_rate": 1.4500000000000002e-05,
"loss": 9.6963,
"mean_token_accuracy": 0.04289307370781899,
"num_tokens": 55926.0,
"step": 30
},
{
"entropy": 10.584246730804443,
"epoch": 0.0019584254259575303,
"grad_norm": 3.078125,
"learning_rate": 1.7000000000000003e-05,
"loss": 9.6414,
"mean_token_accuracy": 0.044558577984571454,
"num_tokens": 64915.0,
"step": 35
},
{
"entropy": 10.56161117553711,
"epoch": 0.0022382004868086057,
"grad_norm": 2.65625,
"learning_rate": 1.95e-05,
"loss": 9.6116,
"mean_token_accuracy": 0.041977206617593764,
"num_tokens": 73813.0,
"step": 40
},
{
"entropy": 10.549141788482666,
"epoch": 0.0025179755476596815,
"grad_norm": 2.421875,
"learning_rate": 2.2e-05,
"loss": 9.5772,
"mean_token_accuracy": 0.04488353617489338,
"num_tokens": 83706.0,
"step": 45
},
{
"entropy": 10.555339050292968,
"epoch": 0.0027977506085107573,
"grad_norm": 2.53125,
"learning_rate": 2.4500000000000003e-05,
"loss": 9.5206,
"mean_token_accuracy": 0.041607250832021235,
"num_tokens": 92739.0,
"step": 50
},
{
"entropy": 10.562696361541748,
"epoch": 0.003077525669361833,
"grad_norm": 2.65625,
"learning_rate": 2.7e-05,
"loss": 9.4731,
"mean_token_accuracy": 0.04852877669036389,
"num_tokens": 101880.0,
"step": 55
},
{
"entropy": 10.513782119750976,
"epoch": 0.003357300730212909,
"grad_norm": 2.59375,
"learning_rate": 2.95e-05,
"loss": 9.4135,
"mean_token_accuracy": 0.05527102164924145,
"num_tokens": 111303.0,
"step": 60
},
{
"entropy": 10.410881614685058,
"epoch": 0.0036370757910639847,
"grad_norm": 2.578125,
"learning_rate": 3.2e-05,
"loss": 9.2608,
"mean_token_accuracy": 0.059278345108032225,
"num_tokens": 121022.0,
"step": 65
},
{
"entropy": 10.35908842086792,
"epoch": 0.0039168508519150606,
"grad_norm": 2.3125,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.1931,
"mean_token_accuracy": 0.05288665182888508,
"num_tokens": 129764.0,
"step": 70
},
{
"entropy": 10.414530277252197,
"epoch": 0.004196625912766136,
"grad_norm": 2.671875,
"learning_rate": 3.7e-05,
"loss": 9.12,
"mean_token_accuracy": 0.05712716057896614,
"num_tokens": 139543.0,
"step": 75
},
{
"entropy": 10.420390224456787,
"epoch": 0.004476400973617211,
"grad_norm": 2.453125,
"learning_rate": 3.95e-05,
"loss": 9.0894,
"mean_token_accuracy": 0.055438223481178286,
"num_tokens": 148772.0,
"step": 80
},
{
"entropy": 10.439853763580322,
"epoch": 0.004756176034468288,
"grad_norm": 2.53125,
"learning_rate": 4.2000000000000004e-05,
"loss": 8.8746,
"mean_token_accuracy": 0.06480722092092037,
"num_tokens": 158786.0,
"step": 85
},
{
"entropy": 10.333017063140868,
"epoch": 0.005035951095319363,
"grad_norm": 2.46875,
"learning_rate": 4.45e-05,
"loss": 8.7978,
"mean_token_accuracy": 0.06817127540707588,
"num_tokens": 166989.0,
"step": 90
},
{
"entropy": 10.257375049591065,
"epoch": 0.005315726156170439,
"grad_norm": 2.421875,
"learning_rate": 4.7000000000000004e-05,
"loss": 8.6945,
"mean_token_accuracy": 0.06792460419237614,
"num_tokens": 175840.0,
"step": 95
},
{
"entropy": 10.24816074371338,
"epoch": 0.005595501217021515,
"grad_norm": 2.484375,
"learning_rate": 4.9500000000000004e-05,
"loss": 8.6247,
"mean_token_accuracy": 0.06662830822169781,
"num_tokens": 185375.0,
"step": 100
},
{
"entropy": 10.16532497406006,
"epoch": 0.005875276277872591,
"grad_norm": 2.125,
"learning_rate": 5.2e-05,
"loss": 8.5206,
"mean_token_accuracy": 0.07044463530182839,
"num_tokens": 194647.0,
"step": 105
},
{
"entropy": 10.170048713684082,
"epoch": 0.006155051338723666,
"grad_norm": 2.421875,
"learning_rate": 5.45e-05,
"loss": 8.4143,
"mean_token_accuracy": 0.07247264273464679,
"num_tokens": 203882.0,
"step": 110
},
{
"entropy": 10.117275524139405,
"epoch": 0.006434826399574742,
"grad_norm": 2.796875,
"learning_rate": 5.7e-05,
"loss": 8.2929,
"mean_token_accuracy": 0.06882111690938472,
"num_tokens": 212641.0,
"step": 115
},
{
"entropy": 10.047082424163818,
"epoch": 0.006714601460425818,
"grad_norm": 2.125,
"learning_rate": 5.9499999999999996e-05,
"loss": 8.1784,
"mean_token_accuracy": 0.07864802330732346,
"num_tokens": 221668.0,
"step": 120
},
{
"entropy": 9.896892261505126,
"epoch": 0.006994376521276893,
"grad_norm": 2.390625,
"learning_rate": 6.2e-05,
"loss": 8.0655,
"mean_token_accuracy": 0.07759866937994957,
"num_tokens": 230277.0,
"step": 125
},
{
"entropy": 9.822550010681152,
"epoch": 0.0072741515821279695,
"grad_norm": 1.8125,
"learning_rate": 6.450000000000001e-05,
"loss": 7.9853,
"mean_token_accuracy": 0.07847488112747669,
"num_tokens": 240191.0,
"step": 130
},
{
"entropy": 9.653499507904053,
"epoch": 0.007553926642979045,
"grad_norm": 2.40625,
"learning_rate": 6.7e-05,
"loss": 7.8597,
"mean_token_accuracy": 0.08022317960858345,
"num_tokens": 249600.0,
"step": 135
},
{
"entropy": 9.487109375,
"epoch": 0.007833701703830121,
"grad_norm": 1.96875,
"learning_rate": 6.950000000000001e-05,
"loss": 7.7858,
"mean_token_accuracy": 0.07919244170188904,
"num_tokens": 258766.0,
"step": 140
},
{
"entropy": 9.301309394836426,
"epoch": 0.008113476764681197,
"grad_norm": 1.84375,
"learning_rate": 7.2e-05,
"loss": 7.5919,
"mean_token_accuracy": 0.08380925506353379,
"num_tokens": 268399.0,
"step": 145
},
{
"entropy": 9.010336112976074,
"epoch": 0.008393251825532272,
"grad_norm": 1.3359375,
"learning_rate": 7.45e-05,
"loss": 7.5475,
"mean_token_accuracy": 0.08445582017302514,
"num_tokens": 278348.0,
"step": 150
},
{
"entropy": 8.899579620361328,
"epoch": 0.008673026886383347,
"grad_norm": 1.7265625,
"learning_rate": 7.7e-05,
"loss": 7.5228,
"mean_token_accuracy": 0.07803246155381202,
"num_tokens": 288429.0,
"step": 155
},
{
"entropy": 8.617181396484375,
"epoch": 0.008952801947234423,
"grad_norm": 1.5078125,
"learning_rate": 7.950000000000001e-05,
"loss": 7.319,
"mean_token_accuracy": 0.09034765139222145,
"num_tokens": 297936.0,
"step": 160
},
{
"entropy": 8.410243892669678,
"epoch": 0.0092325770080855,
"grad_norm": 1.6640625,
"learning_rate": 8.2e-05,
"loss": 7.3897,
"mean_token_accuracy": 0.08498694151639938,
"num_tokens": 307390.0,
"step": 165
},
{
"entropy": 8.320203971862792,
"epoch": 0.009512352068936575,
"grad_norm": 1.4375,
"learning_rate": 8.450000000000001e-05,
"loss": 7.3416,
"mean_token_accuracy": 0.07727829068899154,
"num_tokens": 316381.0,
"step": 170
},
{
"entropy": 8.236638164520263,
"epoch": 0.00979212712978765,
"grad_norm": 1.96875,
"learning_rate": 8.7e-05,
"loss": 7.3116,
"mean_token_accuracy": 0.07726738080382348,
"num_tokens": 325086.0,
"step": 175
},
{
"entropy": 8.076795291900634,
"epoch": 0.010071902190638726,
"grad_norm": 1.5546875,
"learning_rate": 8.95e-05,
"loss": 7.1784,
"mean_token_accuracy": 0.08438889384269714,
"num_tokens": 334438.0,
"step": 180
},
{
"entropy": 7.889586877822876,
"epoch": 0.010351677251489803,
"grad_norm": 1.3515625,
"learning_rate": 9.2e-05,
"loss": 7.1976,
"mean_token_accuracy": 0.0870728187263012,
"num_tokens": 343169.0,
"step": 185
},
{
"entropy": 7.912118721008301,
"epoch": 0.010631452312340878,
"grad_norm": 1.734375,
"learning_rate": 9.45e-05,
"loss": 7.126,
"mean_token_accuracy": 0.08688639178872108,
"num_tokens": 352260.0,
"step": 190
},
{
"entropy": 7.820125246047974,
"epoch": 0.010911227373191954,
"grad_norm": 1.6796875,
"learning_rate": 9.7e-05,
"loss": 7.0827,
"mean_token_accuracy": 0.08836827799677849,
"num_tokens": 361436.0,
"step": 195
},
{
"entropy": 7.675041007995605,
"epoch": 0.01119100243404303,
"grad_norm": 1.3515625,
"learning_rate": 9.95e-05,
"loss": 7.1613,
"mean_token_accuracy": 0.09058133289217948,
"num_tokens": 370232.0,
"step": 200
},
{
"entropy": 7.803629922866821,
"epoch": 0.011470777494894105,
"grad_norm": 1.5234375,
"learning_rate": 0.000102,
"loss": 7.1257,
"mean_token_accuracy": 0.0905453845858574,
"num_tokens": 380211.0,
"step": 205
},
{
"entropy": 7.76220006942749,
"epoch": 0.011750552555745182,
"grad_norm": 1.390625,
"learning_rate": 0.00010449999999999999,
"loss": 7.1154,
"mean_token_accuracy": 0.08261686339974403,
"num_tokens": 390089.0,
"step": 210
},
{
"entropy": 7.6790376663208,
"epoch": 0.012030327616596257,
"grad_norm": 1.734375,
"learning_rate": 0.000107,
"loss": 7.0364,
"mean_token_accuracy": 0.08655178025364876,
"num_tokens": 398513.0,
"step": 215
},
{
"entropy": 7.6753379821777346,
"epoch": 0.012310102677447332,
"grad_norm": 1.484375,
"learning_rate": 0.0001095,
"loss": 7.1785,
"mean_token_accuracy": 0.08271857276558876,
"num_tokens": 408114.0,
"step": 220
},
{
"entropy": 7.658677101135254,
"epoch": 0.012589877738298408,
"grad_norm": 1.4296875,
"learning_rate": 0.000112,
"loss": 7.0324,
"mean_token_accuracy": 0.08730659186840058,
"num_tokens": 417680.0,
"step": 225
},
{
"entropy": 7.590711975097657,
"epoch": 0.012869652799149483,
"grad_norm": 1.2421875,
"learning_rate": 0.0001145,
"loss": 6.94,
"mean_token_accuracy": 0.0981583096086979,
"num_tokens": 426056.0,
"step": 230
},
{
"entropy": 7.538638401031494,
"epoch": 0.01314942786000056,
"grad_norm": 1.4296875,
"learning_rate": 0.00011700000000000001,
"loss": 6.8994,
"mean_token_accuracy": 0.09497818350791931,
"num_tokens": 435465.0,
"step": 235
},
{
"entropy": 7.547599267959595,
"epoch": 0.013429202920851636,
"grad_norm": 1.25,
"learning_rate": 0.00011949999999999999,
"loss": 6.9882,
"mean_token_accuracy": 0.09514376819133759,
"num_tokens": 444295.0,
"step": 240
},
{
"entropy": 7.532002258300781,
"epoch": 0.013708977981702711,
"grad_norm": 1.28125,
"learning_rate": 0.000122,
"loss": 6.9084,
"mean_token_accuracy": 0.09089445620775223,
"num_tokens": 453111.0,
"step": 245
},
{
"entropy": 7.416005039215088,
"epoch": 0.013988753042553786,
"grad_norm": 1.28125,
"learning_rate": 0.0001245,
"loss": 6.8671,
"mean_token_accuracy": 0.09376973509788514,
"num_tokens": 462438.0,
"step": 250
},
{
"entropy": 7.44201397895813,
"epoch": 0.014268528103404862,
"grad_norm": 1.5234375,
"learning_rate": 0.000127,
"loss": 6.8518,
"mean_token_accuracy": 0.0919196330010891,
"num_tokens": 471610.0,
"step": 255
},
{
"entropy": 7.486415004730224,
"epoch": 0.014548303164255939,
"grad_norm": 1.4140625,
"learning_rate": 0.0001295,
"loss": 6.9342,
"mean_token_accuracy": 0.09321872368454934,
"num_tokens": 480849.0,
"step": 260
},
{
"entropy": 7.40749454498291,
"epoch": 0.014828078225107014,
"grad_norm": 1.34375,
"learning_rate": 0.000132,
"loss": 6.9376,
"mean_token_accuracy": 0.08951603546738625,
"num_tokens": 489756.0,
"step": 265
},
{
"entropy": 7.461516523361206,
"epoch": 0.01510785328595809,
"grad_norm": 1.734375,
"learning_rate": 0.00013450000000000002,
"loss": 6.9217,
"mean_token_accuracy": 0.09437951892614364,
"num_tokens": 498818.0,
"step": 270
},
{
"entropy": 7.285744953155517,
"epoch": 0.015387628346809165,
"grad_norm": 1.25,
"learning_rate": 0.00013700000000000002,
"loss": 6.8458,
"mean_token_accuracy": 0.09555465653538704,
"num_tokens": 508508.0,
"step": 275
},
{
"entropy": 7.444489002227783,
"epoch": 0.015667403407660242,
"grad_norm": 1.5078125,
"learning_rate": 0.0001395,
"loss": 7.0025,
"mean_token_accuracy": 0.09034469872713088,
"num_tokens": 518257.0,
"step": 280
},
{
"entropy": 7.36638994216919,
"epoch": 0.015947178468511316,
"grad_norm": 1.328125,
"learning_rate": 0.00014199999999999998,
"loss": 6.9625,
"mean_token_accuracy": 0.08916445821523666,
"num_tokens": 527811.0,
"step": 285
},
{
"entropy": 7.358241605758667,
"epoch": 0.016226953529362393,
"grad_norm": 1.3671875,
"learning_rate": 0.0001445,
"loss": 6.8297,
"mean_token_accuracy": 0.09337828531861306,
"num_tokens": 536991.0,
"step": 290
},
{
"entropy": 7.320535326004029,
"epoch": 0.016506728590213467,
"grad_norm": 1.1484375,
"learning_rate": 0.000147,
"loss": 6.9245,
"mean_token_accuracy": 0.0914350025355816,
"num_tokens": 546498.0,
"step": 295
},
{
"entropy": 7.351836109161377,
"epoch": 0.016786503651064544,
"grad_norm": 1.2109375,
"learning_rate": 0.0001495,
"loss": 6.8809,
"mean_token_accuracy": 0.09436944723129273,
"num_tokens": 556022.0,
"step": 300
},
{
"entropy": 7.289101552963257,
"epoch": 0.01706627871191562,
"grad_norm": 1.40625,
"learning_rate": 0.000152,
"loss": 6.8212,
"mean_token_accuracy": 0.09640712589025498,
"num_tokens": 565392.0,
"step": 305
},
{
"entropy": 7.230247545242309,
"epoch": 0.017346053772766695,
"grad_norm": 1.46875,
"learning_rate": 0.00015450000000000001,
"loss": 6.8043,
"mean_token_accuracy": 0.09431554824113846,
"num_tokens": 574485.0,
"step": 310
},
{
"entropy": 7.3728536605834964,
"epoch": 0.01762582883361777,
"grad_norm": 1.375,
"learning_rate": 0.000157,
"loss": 6.8343,
"mean_token_accuracy": 0.09452549517154693,
"num_tokens": 583149.0,
"step": 315
},
{
"entropy": 7.280808210372925,
"epoch": 0.017905603894468845,
"grad_norm": 1.5234375,
"learning_rate": 0.0001595,
"loss": 6.8855,
"mean_token_accuracy": 0.09358676373958588,
"num_tokens": 592876.0,
"step": 320
},
{
"entropy": 7.064757013320923,
"epoch": 0.018185378955319922,
"grad_norm": 1.3203125,
"learning_rate": 0.000162,
"loss": 6.6685,
"mean_token_accuracy": 0.09988230094313622,
"num_tokens": 602001.0,
"step": 325
},
{
"entropy": 7.323857975006104,
"epoch": 0.018465154016171,
"grad_norm": 1.484375,
"learning_rate": 0.00016450000000000001,
"loss": 6.8667,
"mean_token_accuracy": 0.09093789532780647,
"num_tokens": 611602.0,
"step": 330
},
{
"entropy": 7.089147615432739,
"epoch": 0.018744929077022073,
"grad_norm": 1.34375,
"learning_rate": 0.00016700000000000002,
"loss": 6.7506,
"mean_token_accuracy": 0.09642454162240029,
"num_tokens": 620905.0,
"step": 335
},
{
"entropy": 7.273478889465332,
"epoch": 0.01902470413787315,
"grad_norm": 1.203125,
"learning_rate": 0.00016950000000000003,
"loss": 6.8279,
"mean_token_accuracy": 0.0952286258339882,
"num_tokens": 630151.0,
"step": 340
},
{
"entropy": 7.070547962188721,
"epoch": 0.019304479198724227,
"grad_norm": 1.1796875,
"learning_rate": 0.00017199999999999998,
"loss": 6.7905,
"mean_token_accuracy": 0.09692409187555313,
"num_tokens": 639864.0,
"step": 345
},
{
"entropy": 7.4187744140625,
"epoch": 0.0195842542595753,
"grad_norm": 1.3515625,
"learning_rate": 0.00017449999999999999,
"loss": 6.8707,
"mean_token_accuracy": 0.09315617531538009,
"num_tokens": 648819.0,
"step": 350
},
{
"entropy": 7.169836378097534,
"epoch": 0.019864029320426378,
"grad_norm": 1.4140625,
"learning_rate": 0.000177,
"loss": 6.8027,
"mean_token_accuracy": 0.09456639736890793,
"num_tokens": 658438.0,
"step": 355
},
{
"entropy": 7.143348264694214,
"epoch": 0.020143804381277452,
"grad_norm": 1.2109375,
"learning_rate": 0.0001795,
"loss": 6.7459,
"mean_token_accuracy": 0.09843514785170555,
"num_tokens": 668140.0,
"step": 360
},
{
"entropy": 7.207337665557861,
"epoch": 0.02042357944212853,
"grad_norm": 1.3203125,
"learning_rate": 0.000182,
"loss": 6.7733,
"mean_token_accuracy": 0.09692016914486885,
"num_tokens": 677505.0,
"step": 365
},
{
"entropy": 7.047050952911377,
"epoch": 0.020703354502979606,
"grad_norm": 1.0703125,
"learning_rate": 0.0001845,
"loss": 6.7596,
"mean_token_accuracy": 0.09099765941500663,
"num_tokens": 687911.0,
"step": 370
},
{
"entropy": 7.110365295410157,
"epoch": 0.02098312956383068,
"grad_norm": 1.40625,
"learning_rate": 0.000187,
"loss": 6.7002,
"mean_token_accuracy": 0.10557077825069427,
"num_tokens": 696565.0,
"step": 375
},
{
"entropy": 7.068933725357056,
"epoch": 0.021262904624681757,
"grad_norm": 1.2265625,
"learning_rate": 0.0001895,
"loss": 6.6321,
"mean_token_accuracy": 0.09727629125118256,
"num_tokens": 704918.0,
"step": 380
},
{
"entropy": 7.053268480300903,
"epoch": 0.02154267968553283,
"grad_norm": 1.28125,
"learning_rate": 0.000192,
"loss": 6.6612,
"mean_token_accuracy": 0.1000488631427288,
"num_tokens": 716172.0,
"step": 385
},
{
"entropy": 7.058245515823364,
"epoch": 0.021822454746383908,
"grad_norm": 1.46875,
"learning_rate": 0.0001945,
"loss": 6.6344,
"mean_token_accuracy": 0.10481962487101555,
"num_tokens": 725075.0,
"step": 390
},
{
"entropy": 7.085121202468872,
"epoch": 0.022102229807234985,
"grad_norm": 1.4765625,
"learning_rate": 0.00019700000000000002,
"loss": 6.7861,
"mean_token_accuracy": 0.09666902050375939,
"num_tokens": 733314.0,
"step": 395
},
{
"entropy": 7.137383270263672,
"epoch": 0.02238200486808606,
"grad_norm": 1.359375,
"learning_rate": 0.00019950000000000002,
"loss": 6.6717,
"mean_token_accuracy": 0.10260491818189621,
"num_tokens": 742390.0,
"step": 400
},
{
"entropy": 6.997572708129883,
"epoch": 0.022661779928937135,
"grad_norm": 1.2265625,
"learning_rate": 0.000202,
"loss": 6.7582,
"mean_token_accuracy": 0.09590908735990525,
"num_tokens": 751464.0,
"step": 405
},
{
"entropy": 7.058079195022583,
"epoch": 0.02294155498978821,
"grad_norm": 1.234375,
"learning_rate": 0.00020449999999999998,
"loss": 6.6488,
"mean_token_accuracy": 0.10047566667199134,
"num_tokens": 760746.0,
"step": 410
},
{
"entropy": 6.995281791687011,
"epoch": 0.023221330050639286,
"grad_norm": 1.25,
"learning_rate": 0.000207,
"loss": 6.5617,
"mean_token_accuracy": 0.10464712381362914,
"num_tokens": 769052.0,
"step": 415
},
{
"entropy": 6.989618110656738,
"epoch": 0.023501105111490363,
"grad_norm": 1.2265625,
"learning_rate": 0.0002095,
"loss": 6.7826,
"mean_token_accuracy": 0.09742124751210213,
"num_tokens": 778660.0,
"step": 420
},
{
"entropy": 7.074799585342407,
"epoch": 0.023780880172341437,
"grad_norm": 1.296875,
"learning_rate": 0.000212,
"loss": 6.6877,
"mean_token_accuracy": 0.10435819402337074,
"num_tokens": 787841.0,
"step": 425
},
{
"entropy": 6.878971099853516,
"epoch": 0.024060655233192514,
"grad_norm": 1.328125,
"learning_rate": 0.0002145,
"loss": 6.537,
"mean_token_accuracy": 0.10397473350167274,
"num_tokens": 796175.0,
"step": 430
},
{
"entropy": 6.980287361145019,
"epoch": 0.024340430294043588,
"grad_norm": 1.234375,
"learning_rate": 0.00021700000000000002,
"loss": 6.5959,
"mean_token_accuracy": 0.10773405581712722,
"num_tokens": 805941.0,
"step": 435
},
{
"entropy": 6.9006028175354,
"epoch": 0.024620205354894665,
"grad_norm": 1.1953125,
"learning_rate": 0.0002195,
"loss": 6.6389,
"mean_token_accuracy": 0.09920870438218117,
"num_tokens": 815058.0,
"step": 440
},
{
"entropy": 7.100294494628907,
"epoch": 0.024899980415745742,
"grad_norm": 1.2578125,
"learning_rate": 0.000222,
"loss": 6.6593,
"mean_token_accuracy": 0.10117991864681244,
"num_tokens": 824459.0,
"step": 445
},
{
"entropy": 6.872482252120972,
"epoch": 0.025179755476596816,
"grad_norm": 1.0859375,
"learning_rate": 0.0002245,
"loss": 6.656,
"mean_token_accuracy": 0.10260392725467682,
"num_tokens": 835250.0,
"step": 450
},
{
"entropy": 6.986909580230713,
"epoch": 0.025459530537447893,
"grad_norm": 1.03125,
"learning_rate": 0.00022700000000000002,
"loss": 6.6617,
"mean_token_accuracy": 0.10458940342068672,
"num_tokens": 844643.0,
"step": 455
},
{
"entropy": 6.96947169303894,
"epoch": 0.025739305598298966,
"grad_norm": 1.21875,
"learning_rate": 0.00022950000000000002,
"loss": 6.5977,
"mean_token_accuracy": 0.10226123109459877,
"num_tokens": 853375.0,
"step": 460
},
{
"entropy": 6.875414848327637,
"epoch": 0.026019080659150044,
"grad_norm": 1.1640625,
"learning_rate": 0.00023200000000000003,
"loss": 6.5253,
"mean_token_accuracy": 0.11177821755409241,
"num_tokens": 862244.0,
"step": 465
},
{
"entropy": 6.945923662185669,
"epoch": 0.02629885572000112,
"grad_norm": 1.34375,
"learning_rate": 0.00023449999999999998,
"loss": 6.6286,
"mean_token_accuracy": 0.09996586814522743,
"num_tokens": 871828.0,
"step": 470
},
{
"entropy": 6.8525604724884035,
"epoch": 0.026578630780852194,
"grad_norm": 1.3125,
"learning_rate": 0.000237,
"loss": 6.6076,
"mean_token_accuracy": 0.10374173521995544,
"num_tokens": 881087.0,
"step": 475
},
{
"entropy": 6.889187860488891,
"epoch": 0.02685840584170327,
"grad_norm": 1.234375,
"learning_rate": 0.0002395,
"loss": 6.6779,
"mean_token_accuracy": 0.10589562878012657,
"num_tokens": 890061.0,
"step": 480
},
{
"entropy": 7.009466075897217,
"epoch": 0.027138180902554345,
"grad_norm": 1.1328125,
"learning_rate": 0.000242,
"loss": 6.6192,
"mean_token_accuracy": 0.10268636345863343,
"num_tokens": 899388.0,
"step": 485
},
{
"entropy": 6.763098287582397,
"epoch": 0.027417955963405422,
"grad_norm": 1.3203125,
"learning_rate": 0.0002445,
"loss": 6.5255,
"mean_token_accuracy": 0.10589060559868813,
"num_tokens": 908295.0,
"step": 490
},
{
"entropy": 6.7688929557800295,
"epoch": 0.0276977310242565,
"grad_norm": 1.21875,
"learning_rate": 0.000247,
"loss": 6.4924,
"mean_token_accuracy": 0.10882084742188454,
"num_tokens": 917514.0,
"step": 495
},
{
"entropy": 6.904528284072876,
"epoch": 0.027977506085107573,
"grad_norm": 1.1328125,
"learning_rate": 0.0002495,
"loss": 6.5978,
"mean_token_accuracy": 0.10768755748867989,
"num_tokens": 927146.0,
"step": 500
}
],
"logging_steps": 5,
"max_steps": 4000,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1367316707328000.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}