Files
Qwen2-0.2B-pt/trainer_state.json
ModelHub XC add683145f 初始化项目,由ModelHub XC社区提供模型
Model: FlameF0X/Qwen2-0.2B-pt
Source: Original Platform
2026-08-19 12:03:16 +08:00

805 lines
21 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 5.505980336902749,
"eval_steps": 500,
"global_step": 5500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.05009706305967813,
"grad_norm": 0.03959885612130165,
"learning_rate": 0.00039643636363636365,
"loss": 8.247153930664062,
"step": 50
},
{
"epoch": 0.10019412611935626,
"grad_norm": 0.06453777104616165,
"learning_rate": 0.0003928,
"loss": 6.775548706054687,
"step": 100
},
{
"epoch": 0.1502911891790344,
"grad_norm": 0.044737644493579865,
"learning_rate": 0.0003891636363636364,
"loss": 6.13874755859375,
"step": 150
},
{
"epoch": 0.2003882522387125,
"grad_norm": 0.04348504915833473,
"learning_rate": 0.0003855272727272727,
"loss": 5.674862670898437,
"step": 200
},
{
"epoch": 0.25048531529839063,
"grad_norm": 0.04105028137564659,
"learning_rate": 0.0003818909090909091,
"loss": 5.481221923828125,
"step": 250
},
{
"epoch": 0.3005823783580688,
"grad_norm": 0.036216188222169876,
"learning_rate": 0.0003782545454545455,
"loss": 5.2625799560546875,
"step": 300
},
{
"epoch": 0.3506794414177469,
"grad_norm": 0.04335073381662369,
"learning_rate": 0.00037461818181818183,
"loss": 5.2168896484375,
"step": 350
},
{
"epoch": 0.400776504477425,
"grad_norm": 0.04208400472998619,
"learning_rate": 0.0003709818181818182,
"loss": 5.047581481933594,
"step": 400
},
{
"epoch": 0.4508735675371031,
"grad_norm": 0.03973660618066788,
"learning_rate": 0.0003673454545454546,
"loss": 4.901430053710937,
"step": 450
},
{
"epoch": 0.5009706305967813,
"grad_norm": 0.04200887680053711,
"learning_rate": 0.0003637090909090909,
"loss": 4.947251892089843,
"step": 500
},
{
"epoch": 0.5510676936564594,
"grad_norm": 0.03778240829706192,
"learning_rate": 0.0003600727272727273,
"loss": 4.783945617675781,
"step": 550
},
{
"epoch": 0.6011647567161376,
"grad_norm": 0.03789258375763893,
"learning_rate": 0.00035643636363636366,
"loss": 4.65736328125,
"step": 600
},
{
"epoch": 0.6512618197758157,
"grad_norm": 0.04156795144081116,
"learning_rate": 0.0003528,
"loss": 4.65760009765625,
"step": 650
},
{
"epoch": 0.7013588828354937,
"grad_norm": 0.039154913276433945,
"learning_rate": 0.00034916363636363636,
"loss": 4.571568298339844,
"step": 700
},
{
"epoch": 0.751455945895172,
"grad_norm": 0.03703027218580246,
"learning_rate": 0.0003455272727272727,
"loss": 4.600850219726563,
"step": 750
},
{
"epoch": 0.80155300895485,
"grad_norm": 0.03860793262720108,
"learning_rate": 0.0003418909090909091,
"loss": 4.517155151367188,
"step": 800
},
{
"epoch": 0.8516500720145281,
"grad_norm": 0.041256874799728394,
"learning_rate": 0.0003382545454545455,
"loss": 4.417881164550781,
"step": 850
},
{
"epoch": 0.9017471350742062,
"grad_norm": 0.03689438849687576,
"learning_rate": 0.00033461818181818183,
"loss": 4.484612731933594,
"step": 900
},
{
"epoch": 0.9518441981338844,
"grad_norm": 0.03756825625896454,
"learning_rate": 0.0003309818181818182,
"loss": 4.381386413574218,
"step": 950
},
{
"epoch": 1.0010019412611935,
"grad_norm": 0.038922447711229324,
"learning_rate": 0.0003273454545454546,
"loss": 4.3032598876953125,
"step": 1000
},
{
"epoch": 1.0510990043208717,
"grad_norm": 0.04151051118969917,
"learning_rate": 0.0003237090909090909,
"loss": 4.182417602539062,
"step": 1050
},
{
"epoch": 1.1011960673805499,
"grad_norm": 0.04009559378027916,
"learning_rate": 0.0003200727272727273,
"loss": 4.127420349121094,
"step": 1100
},
{
"epoch": 1.1512931304402279,
"grad_norm": 0.05916987359523773,
"learning_rate": 0.00031643636363636366,
"loss": 4.093446350097656,
"step": 1150
},
{
"epoch": 1.201390193499906,
"grad_norm": 0.050286173820495605,
"learning_rate": 0.0003128,
"loss": 4.1190118408203125,
"step": 1200
},
{
"epoch": 1.2514872565595843,
"grad_norm": 0.04280118644237518,
"learning_rate": 0.00030916363636363637,
"loss": 4.028871154785156,
"step": 1250
},
{
"epoch": 1.3015843196192622,
"grad_norm": 0.04192357882857323,
"learning_rate": 0.0003055272727272728,
"loss": 4.048726196289063,
"step": 1300
},
{
"epoch": 1.3516813826789404,
"grad_norm": 0.04237925261259079,
"learning_rate": 0.0003018909090909091,
"loss": 4.040621948242188,
"step": 1350
},
{
"epoch": 1.4017784457386187,
"grad_norm": 0.03903389349579811,
"learning_rate": 0.0002982545454545455,
"loss": 3.970195007324219,
"step": 1400
},
{
"epoch": 1.4518755087982966,
"grad_norm": 0.043686334043741226,
"learning_rate": 0.00029461818181818184,
"loss": 4.004866943359375,
"step": 1450
},
{
"epoch": 1.5019725718579748,
"grad_norm": 0.03819845989346504,
"learning_rate": 0.0002909818181818182,
"loss": 4.016416320800781,
"step": 1500
},
{
"epoch": 1.552069634917653,
"grad_norm": 0.03920253366231918,
"learning_rate": 0.00028734545454545455,
"loss": 4.042017211914063,
"step": 1550
},
{
"epoch": 1.602166697977331,
"grad_norm": 0.04260282963514328,
"learning_rate": 0.0002837090909090909,
"loss": 3.9518801879882814,
"step": 1600
},
{
"epoch": 1.6522637610370092,
"grad_norm": 0.03717462718486786,
"learning_rate": 0.00028007272727272725,
"loss": 3.95722900390625,
"step": 1650
},
{
"epoch": 1.7023608240966874,
"grad_norm": 0.03952144458889961,
"learning_rate": 0.00027643636363636366,
"loss": 3.94101806640625,
"step": 1700
},
{
"epoch": 1.7524578871563654,
"grad_norm": 0.04585320129990578,
"learning_rate": 0.0002728,
"loss": 3.9851666259765626,
"step": 1750
},
{
"epoch": 1.8025549502160436,
"grad_norm": 0.04449595883488655,
"learning_rate": 0.00026916363636363637,
"loss": 3.977145080566406,
"step": 1800
},
{
"epoch": 1.8526520132757218,
"grad_norm": 0.04211384057998657,
"learning_rate": 0.0002655272727272728,
"loss": 3.9011749267578124,
"step": 1850
},
{
"epoch": 1.9027490763353998,
"grad_norm": 0.045762062072753906,
"learning_rate": 0.0002618909090909091,
"loss": 3.8687625122070313,
"step": 1900
},
{
"epoch": 1.952846139395078,
"grad_norm": 0.03589547425508499,
"learning_rate": 0.0002582545454545455,
"loss": 3.847414855957031,
"step": 1950
},
{
"epoch": 2.002003882522387,
"grad_norm": 0.046568579971790314,
"learning_rate": 0.00025461818181818184,
"loss": 3.8405825805664064,
"step": 2000
},
{
"epoch": 2.0521009455820653,
"grad_norm": 0.04410920664668083,
"learning_rate": 0.0002509818181818182,
"loss": 3.6514605712890624,
"step": 2050
},
{
"epoch": 2.1021980086417433,
"grad_norm": 0.04531016945838928,
"learning_rate": 0.00024734545454545455,
"loss": 3.6210012817382813,
"step": 2100
},
{
"epoch": 2.1522950717014213,
"grad_norm": 0.04714471474289894,
"learning_rate": 0.00024370909090909093,
"loss": 3.6106887817382813,
"step": 2150
},
{
"epoch": 2.2023921347610997,
"grad_norm": 0.0496392548084259,
"learning_rate": 0.00024007272727272726,
"loss": 3.537988586425781,
"step": 2200
},
{
"epoch": 2.2524891978207777,
"grad_norm": 0.04905026778578758,
"learning_rate": 0.00023643636363636367,
"loss": 3.4873788452148435,
"step": 2250
},
{
"epoch": 2.3025862608804557,
"grad_norm": 0.04541793838143349,
"learning_rate": 0.0002328,
"loss": 3.528775634765625,
"step": 2300
},
{
"epoch": 2.352683323940134,
"grad_norm": 0.04438253119587898,
"learning_rate": 0.00022916363636363637,
"loss": 3.5195965576171875,
"step": 2350
},
{
"epoch": 2.402780386999812,
"grad_norm": 0.04466085880994797,
"learning_rate": 0.00022552727272727273,
"loss": 3.524605407714844,
"step": 2400
},
{
"epoch": 2.45287745005949,
"grad_norm": 0.043507009744644165,
"learning_rate": 0.0002218909090909091,
"loss": 3.548528137207031,
"step": 2450
},
{
"epoch": 2.5029745131191685,
"grad_norm": 0.04215335100889206,
"learning_rate": 0.00021825454545454544,
"loss": 3.5333798217773436,
"step": 2500
},
{
"epoch": 2.5530715761788465,
"grad_norm": 0.049123767763376236,
"learning_rate": 0.00021461818181818182,
"loss": 3.5535186767578124,
"step": 2550
},
{
"epoch": 2.6031686392385245,
"grad_norm": 0.04664550721645355,
"learning_rate": 0.00021098181818181823,
"loss": 3.528506164550781,
"step": 2600
},
{
"epoch": 2.653265702298203,
"grad_norm": 0.04763299971818924,
"learning_rate": 0.00020734545454545455,
"loss": 3.43850830078125,
"step": 2650
},
{
"epoch": 2.703362765357881,
"grad_norm": 0.050708673894405365,
"learning_rate": 0.00020370909090909093,
"loss": 3.5349993896484375,
"step": 2700
},
{
"epoch": 2.753459828417559,
"grad_norm": 0.04584009572863579,
"learning_rate": 0.0002000727272727273,
"loss": 3.4938180541992185,
"step": 2750
},
{
"epoch": 2.8035568914772373,
"grad_norm": 0.04499977082014084,
"learning_rate": 0.00019643636363636364,
"loss": 3.5182513427734374,
"step": 2800
},
{
"epoch": 2.8536539545369153,
"grad_norm": 0.04771441966295242,
"learning_rate": 0.0001928,
"loss": 3.3792236328125,
"step": 2850
},
{
"epoch": 2.9037510175965933,
"grad_norm": 0.04623362421989441,
"learning_rate": 0.00018916363636363638,
"loss": 3.552237548828125,
"step": 2900
},
{
"epoch": 2.9538480806562717,
"grad_norm": 0.04291446879506111,
"learning_rate": 0.00018552727272727273,
"loss": 3.3860333251953123,
"step": 2950
},
{
"epoch": 3.003005823783581,
"grad_norm": 0.04738181456923485,
"learning_rate": 0.0001818909090909091,
"loss": 3.427495422363281,
"step": 3000
},
{
"epoch": 3.053102886843259,
"grad_norm": 0.04887455329298973,
"learning_rate": 0.00017825454545454547,
"loss": 3.1966757202148437,
"step": 3050
},
{
"epoch": 3.103199949902937,
"grad_norm": 0.046684056520462036,
"learning_rate": 0.00017461818181818185,
"loss": 3.1526495361328126,
"step": 3100
},
{
"epoch": 3.153297012962615,
"grad_norm": 0.0529169924557209,
"learning_rate": 0.0001709818181818182,
"loss": 3.1627899169921876,
"step": 3150
},
{
"epoch": 3.203394076022293,
"grad_norm": 0.05269123986363411,
"learning_rate": 0.00016734545454545456,
"loss": 3.1990621948242186,
"step": 3200
},
{
"epoch": 3.253491139081971,
"grad_norm": 0.050295427441596985,
"learning_rate": 0.0001637090909090909,
"loss": 3.188307800292969,
"step": 3250
},
{
"epoch": 3.3035882021416496,
"grad_norm": 0.05785530433058739,
"learning_rate": 0.0001600727272727273,
"loss": 3.166661682128906,
"step": 3300
},
{
"epoch": 3.3536852652013276,
"grad_norm": 0.051539987325668335,
"learning_rate": 0.00015643636363636365,
"loss": 3.1088409423828125,
"step": 3350
},
{
"epoch": 3.4037823282610056,
"grad_norm": 0.04825356602668762,
"learning_rate": 0.0001528,
"loss": 3.149294738769531,
"step": 3400
},
{
"epoch": 3.453879391320684,
"grad_norm": 0.053647857159376144,
"learning_rate": 0.00014916363636363638,
"loss": 3.1625897216796877,
"step": 3450
},
{
"epoch": 3.503976454380362,
"grad_norm": 0.04727034643292427,
"learning_rate": 0.00014552727272727274,
"loss": 3.1458837890625,
"step": 3500
},
{
"epoch": 3.55407351744004,
"grad_norm": 0.05557869374752045,
"learning_rate": 0.0001418909090909091,
"loss": 3.149683837890625,
"step": 3550
},
{
"epoch": 3.6041705804997184,
"grad_norm": 0.0650995746254921,
"learning_rate": 0.00013825454545454547,
"loss": 3.1026031494140627,
"step": 3600
},
{
"epoch": 3.6542676435593964,
"grad_norm": 0.04856622591614723,
"learning_rate": 0.00013461818181818183,
"loss": 3.22126220703125,
"step": 3650
},
{
"epoch": 3.7043647066190744,
"grad_norm": 0.05039793998003006,
"learning_rate": 0.00013098181818181818,
"loss": 3.1272393798828126,
"step": 3700
},
{
"epoch": 3.754461769678753,
"grad_norm": 0.05844203755259514,
"learning_rate": 0.00012734545454545453,
"loss": 3.0862982177734377,
"step": 3750
},
{
"epoch": 3.8045588327384308,
"grad_norm": 0.05493615195155144,
"learning_rate": 0.00012370909090909091,
"loss": 3.1446405029296876,
"step": 3800
},
{
"epoch": 3.8546558957981087,
"grad_norm": 0.054356664419174194,
"learning_rate": 0.00012007272727272727,
"loss": 3.0820523071289063,
"step": 3850
},
{
"epoch": 3.904752958857787,
"grad_norm": 0.0555652491748333,
"learning_rate": 0.00011643636363636364,
"loss": 3.183399353027344,
"step": 3900
},
{
"epoch": 3.954850021917465,
"grad_norm": 0.058864276856184006,
"learning_rate": 0.00011279999999999999,
"loss": 3.0196658325195314,
"step": 3950
},
{
"epoch": 4.004007765044774,
"grad_norm": 0.06324097514152527,
"learning_rate": 0.00010916363636363639,
"loss": 3.0737509155273437,
"step": 4000
},
{
"epoch": 4.054104828104452,
"grad_norm": 0.05261604115366936,
"learning_rate": 0.00010552727272727274,
"loss": 2.770926513671875,
"step": 4050
},
{
"epoch": 4.104201891164131,
"grad_norm": 0.05924660712480545,
"learning_rate": 0.00010189090909090911,
"loss": 2.7489028930664063,
"step": 4100
},
{
"epoch": 4.154298954223808,
"grad_norm": 0.05496729537844658,
"learning_rate": 9.825454545454546e-05,
"loss": 2.7954165649414064,
"step": 4150
},
{
"epoch": 4.204396017283487,
"grad_norm": 0.05670342594385147,
"learning_rate": 9.461818181818183e-05,
"loss": 2.8602774047851565,
"step": 4200
},
{
"epoch": 4.254493080343165,
"grad_norm": 0.062024831771850586,
"learning_rate": 9.09818181818182e-05,
"loss": 2.8147286987304687,
"step": 4250
},
{
"epoch": 4.304590143402843,
"grad_norm": 0.055980272591114044,
"learning_rate": 8.734545454545455e-05,
"loss": 2.8248248291015625,
"step": 4300
},
{
"epoch": 4.354687206462521,
"grad_norm": 0.05720142275094986,
"learning_rate": 8.370909090909092e-05,
"loss": 2.8425811767578124,
"step": 4350
},
{
"epoch": 4.4047842695221995,
"grad_norm": 0.06002994254231453,
"learning_rate": 8.007272727272727e-05,
"loss": 2.8419833374023438,
"step": 4400
},
{
"epoch": 4.454881332581877,
"grad_norm": 0.05916266515851021,
"learning_rate": 7.643636363636364e-05,
"loss": 2.8121533203125,
"step": 4450
},
{
"epoch": 4.5049783956415554,
"grad_norm": 0.05626993626356125,
"learning_rate": 7.280000000000001e-05,
"loss": 2.7959454345703123,
"step": 4500
},
{
"epoch": 4.555075458701234,
"grad_norm": 0.05815758556127548,
"learning_rate": 6.916363636363636e-05,
"loss": 2.7882369995117187,
"step": 4550
},
{
"epoch": 4.605172521760911,
"grad_norm": 0.06205146387219429,
"learning_rate": 6.552727272727273e-05,
"loss": 2.83596435546875,
"step": 4600
},
{
"epoch": 4.65526958482059,
"grad_norm": 0.05774429440498352,
"learning_rate": 6.18909090909091e-05,
"loss": 2.77343994140625,
"step": 4650
},
{
"epoch": 4.705366647880268,
"grad_norm": 0.05843517184257507,
"learning_rate": 5.8254545454545465e-05,
"loss": 2.8070660400390626,
"step": 4700
},
{
"epoch": 4.755463710939946,
"grad_norm": 0.06255511194467545,
"learning_rate": 5.4618181818181826e-05,
"loss": 2.782181396484375,
"step": 4750
},
{
"epoch": 4.805560773999624,
"grad_norm": 0.06288160383701324,
"learning_rate": 5.0981818181818187e-05,
"loss": 2.819413757324219,
"step": 4800
},
{
"epoch": 4.855657837059303,
"grad_norm": 0.06578859686851501,
"learning_rate": 4.734545454545455e-05,
"loss": 2.764403076171875,
"step": 4850
},
{
"epoch": 4.90575490011898,
"grad_norm": 0.07166821509599686,
"learning_rate": 4.370909090909091e-05,
"loss": 2.7576608276367187,
"step": 4900
},
{
"epoch": 4.955851963178659,
"grad_norm": 0.05862944945693016,
"learning_rate": 4.0072727272727276e-05,
"loss": 2.8215606689453123,
"step": 4950
},
{
"epoch": 5.005009706305968,
"grad_norm": 0.06217258423566818,
"learning_rate": 3.6436363636363644e-05,
"loss": 2.781416931152344,
"step": 5000
},
{
"epoch": 5.055106769365646,
"grad_norm": 0.062334153801202774,
"learning_rate": 3.2800000000000004e-05,
"loss": 2.5809677124023436,
"step": 5050
},
{
"epoch": 5.105203832425324,
"grad_norm": 0.0632292777299881,
"learning_rate": 2.9163636363636365e-05,
"loss": 2.5479400634765623,
"step": 5100
},
{
"epoch": 5.155300895485002,
"grad_norm": 0.06300564855337143,
"learning_rate": 2.5527272727272726e-05,
"loss": 2.521404571533203,
"step": 5150
},
{
"epoch": 5.205397958544681,
"grad_norm": 0.06724506616592407,
"learning_rate": 2.1890909090909094e-05,
"loss": 2.489826507568359,
"step": 5200
},
{
"epoch": 5.255495021604358,
"grad_norm": 0.06318136304616928,
"learning_rate": 1.8254545454545455e-05,
"loss": 2.4983534240722656,
"step": 5250
},
{
"epoch": 5.3055920846640365,
"grad_norm": 0.0806359350681305,
"learning_rate": 1.4618181818181819e-05,
"loss": 2.5284886169433594,
"step": 5300
},
{
"epoch": 5.355689147723715,
"grad_norm": 0.060305405408144,
"learning_rate": 1.0981818181818182e-05,
"loss": 2.5243402099609376,
"step": 5350
},
{
"epoch": 5.4057862107833925,
"grad_norm": 0.06560583412647247,
"learning_rate": 7.345454545454546e-06,
"loss": 2.6004681396484375,
"step": 5400
},
{
"epoch": 5.455883273843071,
"grad_norm": 0.06115686148405075,
"learning_rate": 3.7090909090909092e-06,
"loss": 2.524554443359375,
"step": 5450
},
{
"epoch": 5.505980336902749,
"grad_norm": 0.06685449182987213,
"learning_rate": 7.272727272727273e-08,
"loss": 2.5241400146484376,
"step": 5500
}
],
"logging_steps": 50,
"max_steps": 5500,
"num_input_tokens_seen": 0,
"num_train_epochs": 6,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 5.5700701446144e+16,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}