commit add683145fef7734709dbd9ffec2d0dba68c0199 Author: ModelHub XC Date: Wed Aug 19 12:03:16 2026 +0800 初始化项目,由ModelHub XC社区提供模型 Model: FlameF0X/Qwen2-0.2B-pt Source: Original Platform diff --git a/.gitattributes b/.gitattributes new file mode 100644 index 0000000..52373fe --- /dev/null +++ b/.gitattributes @@ -0,0 +1,36 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text diff --git a/README.md b/README.md new file mode 100644 index 0000000..15c3489 --- /dev/null +++ b/README.md @@ -0,0 +1,43 @@ +--- +library_name: transformers +license: apache-2.0 +datasets: +- Salesforce/wikitext +- roneneldan/TinyStories +- FlameF0X/arXiv-AI-ML +- Skylion007/openwebtext +- flytech/python-codes-25k +- bookcorpus/bookcorpus +--- + +## Model usage + +```py +import torch +from transformers import AutoTokenizer, AutoModelForCausalLM + +model_path = "FlameF0X/Qwen2-0.2B-pt" + +tokenizer = AutoTokenizer.from_pretrained(model_path, trust_remote_code=True) +model = AutoModelForCausalLM.from_pretrained( + model_path, + torch_dtype="auto", + device_map="auto", + trust_remote_code=True +) + +prompt = "The future of Artificial Intelligence is" +inputs = tokenizer(prompt, return_tensors="pt").to(model.device) + +output_ids = model.generate( + **inputs, + max_new_tokens=50, + do_sample=True, + temperature=0.7, + top_p=0.9, + repetition_penalty=1.1 +) + +response = tokenizer.decode(output_ids[0], skip_special_tokens=True) +print(f"--- Base Model Completion ---\n{response}") +``` \ No newline at end of file diff --git a/chat_template.jinja b/chat_template.jinja new file mode 100644 index 0000000..7be44a6 --- /dev/null +++ b/chat_template.jinja @@ -0,0 +1 @@ +{% for message in messages %}{{ '<|im_start|>' + message['role'] + '\n' + message['content'] + '<|im_end|>' + '\n' }}{% endfor %}{% if add_generation_prompt %}{{ '<|im_start|>assistant\n' }}{% endif %} \ No newline at end of file diff --git a/config.json b/config.json new file mode 100644 index 0000000..7ac658d --- /dev/null +++ b/config.json @@ -0,0 +1,41 @@ +{ + "architectures": [ + "Qwen2ForCausalLM" + ], + "attention_dropout": 0.0, + "bos_token_id": null, + "dtype": "float32", + "eos_token_id": 151643, + "hidden_act": "silu", + "hidden_size": 512, + "initializer_range": 0.02, + "intermediate_size": 1376, + "layer_types": [ + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention" + ], + "max_position_embeddings": 2048, + "max_window_layers": 28, + "model_type": "qwen2", + "num_attention_heads": 8, + "num_hidden_layers": 8, + "num_key_value_heads": 8, + "pad_token_id": 151643, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "rope_theta": 10000.0, + "rope_type": "default" + }, + "sliding_window": null, + "tie_word_embeddings": false, + "transformers_version": "5.2.0", + "use_cache": false, + "use_sliding_window": false, + "vocab_size": 151936 +} diff --git a/generation_config.json b/generation_config.json new file mode 100644 index 0000000..355f282 --- /dev/null +++ b/generation_config.json @@ -0,0 +1,9 @@ +{ + "_from_model_config": true, + "eos_token_id": 151643, + "output_attentions": false, + "output_hidden_states": false, + "pad_token_id": 151643, + "transformers_version": "5.2.0", + "use_cache": true +} diff --git a/model.safetensors b/model.safetensors new file mode 100644 index 0000000..d759a64 --- /dev/null +++ b/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:faf36569e51c90f8b6296f66c2bae24cb7de5eba7c02bdc504ec5b93eb7bef96 +size 723612256 diff --git a/optimizer.pt b/optimizer.pt new file mode 100644 index 0000000..d33a0fe --- /dev/null +++ b/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:81c7a6fff45f4b89ab525e03302b282ecc75124b092205d0558c7fd587025a05 +size 1447288075 diff --git a/rng_state.pth b/rng_state.pth new file mode 100644 index 0000000..3ab6836 --- /dev/null +++ b/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:01f9a0f7843a37be87edd23f4e88aa93b38b95cc2c07503eeb1cf2e4632453a2 +size 14645 diff --git a/scaler.pt b/scaler.pt new file mode 100644 index 0000000..be15b4c --- /dev/null +++ b/scaler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2bb8c4f79563cb7c9027a7d8be443142caa0e3f4a88491ec812af28bc90af134 +size 1383 diff --git a/scheduler.pt b/scheduler.pt new file mode 100644 index 0000000..cf21a7d --- /dev/null +++ b/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:52b53c7725b85591dbff9bca4427304e767d6b6a9c1f4cb0b48836ba94f0d628 +size 1465 diff --git a/tokenizer.json b/tokenizer.json new file mode 100644 index 0000000..46b69f2 --- /dev/null +++ b/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d429fe753aea0ff87a94e86396d5508abb0d1d0e1f7a0d47c787ff72e0bf2691 +size 11422170 diff --git a/tokenizer_config.json b/tokenizer_config.json new file mode 100644 index 0000000..c960ecf --- /dev/null +++ b/tokenizer_config.json @@ -0,0 +1,29 @@ +{ + "add_prefix_space": false, + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "extra_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "is_local": false, + "model_max_length": 131072, + "pad_token": "<|endoftext|>", + "split_special_tokens": false, + "tokenizer_class": "Qwen2Tokenizer", + "unk_token": null +} diff --git a/trainer_state.json b/trainer_state.json new file mode 100644 index 0000000..4be6941 --- /dev/null +++ b/trainer_state.json @@ -0,0 +1,804 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.505980336902749, + "eval_steps": 500, + "global_step": 5500, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.05009706305967813, + "grad_norm": 0.03959885612130165, + "learning_rate": 0.00039643636363636365, + "loss": 8.247153930664062, + "step": 50 + }, + { + "epoch": 0.10019412611935626, + "grad_norm": 0.06453777104616165, + "learning_rate": 0.0003928, + "loss": 6.775548706054687, + "step": 100 + }, + { + "epoch": 0.1502911891790344, + "grad_norm": 0.044737644493579865, + "learning_rate": 0.0003891636363636364, + "loss": 6.13874755859375, + "step": 150 + }, + { + "epoch": 0.2003882522387125, + "grad_norm": 0.04348504915833473, + "learning_rate": 0.0003855272727272727, + "loss": 5.674862670898437, + "step": 200 + }, + { + "epoch": 0.25048531529839063, + "grad_norm": 0.04105028137564659, + "learning_rate": 0.0003818909090909091, + "loss": 5.481221923828125, + "step": 250 + }, + { + "epoch": 0.3005823783580688, + "grad_norm": 0.036216188222169876, + "learning_rate": 0.0003782545454545455, + "loss": 5.2625799560546875, + "step": 300 + }, + { + "epoch": 0.3506794414177469, + "grad_norm": 0.04335073381662369, + "learning_rate": 0.00037461818181818183, + "loss": 5.2168896484375, + "step": 350 + }, + { + "epoch": 0.400776504477425, + "grad_norm": 0.04208400472998619, + "learning_rate": 0.0003709818181818182, + "loss": 5.047581481933594, + "step": 400 + }, + { + "epoch": 0.4508735675371031, + "grad_norm": 0.03973660618066788, + "learning_rate": 0.0003673454545454546, + "loss": 4.901430053710937, + "step": 450 + }, + { + "epoch": 0.5009706305967813, + "grad_norm": 0.04200887680053711, + "learning_rate": 0.0003637090909090909, + "loss": 4.947251892089843, + "step": 500 + }, + { + "epoch": 0.5510676936564594, + "grad_norm": 0.03778240829706192, + "learning_rate": 0.0003600727272727273, + "loss": 4.783945617675781, + "step": 550 + }, + { + "epoch": 0.6011647567161376, + "grad_norm": 0.03789258375763893, + "learning_rate": 0.00035643636363636366, + "loss": 4.65736328125, + "step": 600 + }, + { + "epoch": 0.6512618197758157, + "grad_norm": 0.04156795144081116, + "learning_rate": 0.0003528, + "loss": 4.65760009765625, + "step": 650 + }, + { + "epoch": 0.7013588828354937, + "grad_norm": 0.039154913276433945, + "learning_rate": 0.00034916363636363636, + "loss": 4.571568298339844, + "step": 700 + }, + { + "epoch": 0.751455945895172, + "grad_norm": 0.03703027218580246, + "learning_rate": 0.0003455272727272727, + "loss": 4.600850219726563, + "step": 750 + }, + { + "epoch": 0.80155300895485, + "grad_norm": 0.03860793262720108, + "learning_rate": 0.0003418909090909091, + "loss": 4.517155151367188, + "step": 800 + }, + { + "epoch": 0.8516500720145281, + "grad_norm": 0.041256874799728394, + "learning_rate": 0.0003382545454545455, + "loss": 4.417881164550781, + "step": 850 + }, + { + "epoch": 0.9017471350742062, + "grad_norm": 0.03689438849687576, + "learning_rate": 0.00033461818181818183, + "loss": 4.484612731933594, + "step": 900 + }, + { + "epoch": 0.9518441981338844, + "grad_norm": 0.03756825625896454, + "learning_rate": 0.0003309818181818182, + "loss": 4.381386413574218, + "step": 950 + }, + { + "epoch": 1.0010019412611935, + "grad_norm": 0.038922447711229324, + "learning_rate": 0.0003273454545454546, + "loss": 4.3032598876953125, + "step": 1000 + }, + { + "epoch": 1.0510990043208717, + "grad_norm": 0.04151051118969917, + "learning_rate": 0.0003237090909090909, + "loss": 4.182417602539062, + "step": 1050 + }, + { + "epoch": 1.1011960673805499, + "grad_norm": 0.04009559378027916, + "learning_rate": 0.0003200727272727273, + "loss": 4.127420349121094, + "step": 1100 + }, + { + "epoch": 1.1512931304402279, + "grad_norm": 0.05916987359523773, + "learning_rate": 0.00031643636363636366, + "loss": 4.093446350097656, + "step": 1150 + }, + { + "epoch": 1.201390193499906, + "grad_norm": 0.050286173820495605, + "learning_rate": 0.0003128, + "loss": 4.1190118408203125, + "step": 1200 + }, + { + "epoch": 1.2514872565595843, + "grad_norm": 0.04280118644237518, + "learning_rate": 0.00030916363636363637, + "loss": 4.028871154785156, + "step": 1250 + }, + { + "epoch": 1.3015843196192622, + "grad_norm": 0.04192357882857323, + "learning_rate": 0.0003055272727272728, + "loss": 4.048726196289063, + "step": 1300 + }, + { + "epoch": 1.3516813826789404, + "grad_norm": 0.04237925261259079, + "learning_rate": 0.0003018909090909091, + "loss": 4.040621948242188, + "step": 1350 + }, + { + "epoch": 1.4017784457386187, + "grad_norm": 0.03903389349579811, + "learning_rate": 0.0002982545454545455, + "loss": 3.970195007324219, + "step": 1400 + }, + { + "epoch": 1.4518755087982966, + "grad_norm": 0.043686334043741226, + "learning_rate": 0.00029461818181818184, + "loss": 4.004866943359375, + "step": 1450 + }, + { + "epoch": 1.5019725718579748, + "grad_norm": 0.03819845989346504, + "learning_rate": 0.0002909818181818182, + "loss": 4.016416320800781, + "step": 1500 + }, + { + "epoch": 1.552069634917653, + "grad_norm": 0.03920253366231918, + "learning_rate": 0.00028734545454545455, + "loss": 4.042017211914063, + "step": 1550 + }, + { + "epoch": 1.602166697977331, + "grad_norm": 0.04260282963514328, + "learning_rate": 0.0002837090909090909, + "loss": 3.9518801879882814, + "step": 1600 + }, + { + "epoch": 1.6522637610370092, + "grad_norm": 0.03717462718486786, + "learning_rate": 0.00028007272727272725, + "loss": 3.95722900390625, + "step": 1650 + }, + { + "epoch": 1.7023608240966874, + "grad_norm": 0.03952144458889961, + "learning_rate": 0.00027643636363636366, + "loss": 3.94101806640625, + "step": 1700 + }, + { + "epoch": 1.7524578871563654, + "grad_norm": 0.04585320129990578, + "learning_rate": 0.0002728, + "loss": 3.9851666259765626, + "step": 1750 + }, + { + "epoch": 1.8025549502160436, + "grad_norm": 0.04449595883488655, + "learning_rate": 0.00026916363636363637, + "loss": 3.977145080566406, + "step": 1800 + }, + { + "epoch": 1.8526520132757218, + "grad_norm": 0.04211384057998657, + "learning_rate": 0.0002655272727272728, + "loss": 3.9011749267578124, + "step": 1850 + }, + { + "epoch": 1.9027490763353998, + "grad_norm": 0.045762062072753906, + "learning_rate": 0.0002618909090909091, + "loss": 3.8687625122070313, + "step": 1900 + }, + { + "epoch": 1.952846139395078, + "grad_norm": 0.03589547425508499, + "learning_rate": 0.0002582545454545455, + "loss": 3.847414855957031, + "step": 1950 + }, + { + "epoch": 2.002003882522387, + "grad_norm": 0.046568579971790314, + "learning_rate": 0.00025461818181818184, + "loss": 3.8405825805664064, + "step": 2000 + }, + { + "epoch": 2.0521009455820653, + "grad_norm": 0.04410920664668083, + "learning_rate": 0.0002509818181818182, + "loss": 3.6514605712890624, + "step": 2050 + }, + { + "epoch": 2.1021980086417433, + "grad_norm": 0.04531016945838928, + "learning_rate": 0.00024734545454545455, + "loss": 3.6210012817382813, + "step": 2100 + }, + { + "epoch": 2.1522950717014213, + "grad_norm": 0.04714471474289894, + "learning_rate": 0.00024370909090909093, + "loss": 3.6106887817382813, + "step": 2150 + }, + { + "epoch": 2.2023921347610997, + "grad_norm": 0.0496392548084259, + "learning_rate": 0.00024007272727272726, + "loss": 3.537988586425781, + "step": 2200 + }, + { + "epoch": 2.2524891978207777, + "grad_norm": 0.04905026778578758, + "learning_rate": 0.00023643636363636367, + "loss": 3.4873788452148435, + "step": 2250 + }, + { + "epoch": 2.3025862608804557, + "grad_norm": 0.04541793838143349, + "learning_rate": 0.0002328, + "loss": 3.528775634765625, + "step": 2300 + }, + { + "epoch": 2.352683323940134, + "grad_norm": 0.04438253119587898, + "learning_rate": 0.00022916363636363637, + "loss": 3.5195965576171875, + "step": 2350 + }, + { + "epoch": 2.402780386999812, + "grad_norm": 0.04466085880994797, + "learning_rate": 0.00022552727272727273, + "loss": 3.524605407714844, + "step": 2400 + }, + { + "epoch": 2.45287745005949, + "grad_norm": 0.043507009744644165, + "learning_rate": 0.0002218909090909091, + "loss": 3.548528137207031, + "step": 2450 + }, + { + "epoch": 2.5029745131191685, + "grad_norm": 0.04215335100889206, + "learning_rate": 0.00021825454545454544, + "loss": 3.5333798217773436, + "step": 2500 + }, + { + "epoch": 2.5530715761788465, + "grad_norm": 0.049123767763376236, + "learning_rate": 0.00021461818181818182, + "loss": 3.5535186767578124, + "step": 2550 + }, + { + "epoch": 2.6031686392385245, + "grad_norm": 0.04664550721645355, + "learning_rate": 0.00021098181818181823, + "loss": 3.528506164550781, + "step": 2600 + }, + { + "epoch": 2.653265702298203, + "grad_norm": 0.04763299971818924, + "learning_rate": 0.00020734545454545455, + "loss": 3.43850830078125, + "step": 2650 + }, + { + "epoch": 2.703362765357881, + "grad_norm": 0.050708673894405365, + "learning_rate": 0.00020370909090909093, + "loss": 3.5349993896484375, + "step": 2700 + }, + { + "epoch": 2.753459828417559, + "grad_norm": 0.04584009572863579, + "learning_rate": 0.0002000727272727273, + "loss": 3.4938180541992185, + "step": 2750 + }, + { + "epoch": 2.8035568914772373, + "grad_norm": 0.04499977082014084, + "learning_rate": 0.00019643636363636364, + "loss": 3.5182513427734374, + "step": 2800 + }, + { + "epoch": 2.8536539545369153, + "grad_norm": 0.04771441966295242, + "learning_rate": 0.0001928, + "loss": 3.3792236328125, + "step": 2850 + }, + { + "epoch": 2.9037510175965933, + "grad_norm": 0.04623362421989441, + "learning_rate": 0.00018916363636363638, + "loss": 3.552237548828125, + "step": 2900 + }, + { + "epoch": 2.9538480806562717, + "grad_norm": 0.04291446879506111, + "learning_rate": 0.00018552727272727273, + "loss": 3.3860333251953123, + "step": 2950 + }, + { + "epoch": 3.003005823783581, + "grad_norm": 0.04738181456923485, + "learning_rate": 0.0001818909090909091, + "loss": 3.427495422363281, + "step": 3000 + }, + { + "epoch": 3.053102886843259, + "grad_norm": 0.04887455329298973, + "learning_rate": 0.00017825454545454547, + "loss": 3.1966757202148437, + "step": 3050 + }, + { + "epoch": 3.103199949902937, + "grad_norm": 0.046684056520462036, + "learning_rate": 0.00017461818181818185, + "loss": 3.1526495361328126, + "step": 3100 + }, + { + "epoch": 3.153297012962615, + "grad_norm": 0.0529169924557209, + "learning_rate": 0.0001709818181818182, + "loss": 3.1627899169921876, + "step": 3150 + }, + { + "epoch": 3.203394076022293, + "grad_norm": 0.05269123986363411, + "learning_rate": 0.00016734545454545456, + "loss": 3.1990621948242186, + "step": 3200 + }, + { + "epoch": 3.253491139081971, + "grad_norm": 0.050295427441596985, + "learning_rate": 0.0001637090909090909, + "loss": 3.188307800292969, + "step": 3250 + }, + { + "epoch": 3.3035882021416496, + "grad_norm": 0.05785530433058739, + "learning_rate": 0.0001600727272727273, + "loss": 3.166661682128906, + "step": 3300 + }, + { + "epoch": 3.3536852652013276, + "grad_norm": 0.051539987325668335, + "learning_rate": 0.00015643636363636365, + "loss": 3.1088409423828125, + "step": 3350 + }, + { + "epoch": 3.4037823282610056, + "grad_norm": 0.04825356602668762, + "learning_rate": 0.0001528, + "loss": 3.149294738769531, + "step": 3400 + }, + { + "epoch": 3.453879391320684, + "grad_norm": 0.053647857159376144, + "learning_rate": 0.00014916363636363638, + "loss": 3.1625897216796877, + "step": 3450 + }, + { + "epoch": 3.503976454380362, + "grad_norm": 0.04727034643292427, + "learning_rate": 0.00014552727272727274, + "loss": 3.1458837890625, + "step": 3500 + }, + { + "epoch": 3.55407351744004, + "grad_norm": 0.05557869374752045, + "learning_rate": 0.0001418909090909091, + "loss": 3.149683837890625, + "step": 3550 + }, + { + "epoch": 3.6041705804997184, + "grad_norm": 0.0650995746254921, + "learning_rate": 0.00013825454545454547, + "loss": 3.1026031494140627, + "step": 3600 + }, + { + "epoch": 3.6542676435593964, + "grad_norm": 0.04856622591614723, + "learning_rate": 0.00013461818181818183, + "loss": 3.22126220703125, + "step": 3650 + }, + { + "epoch": 3.7043647066190744, + "grad_norm": 0.05039793998003006, + "learning_rate": 0.00013098181818181818, + "loss": 3.1272393798828126, + "step": 3700 + }, + { + "epoch": 3.754461769678753, + "grad_norm": 0.05844203755259514, + "learning_rate": 0.00012734545454545453, + "loss": 3.0862982177734377, + "step": 3750 + }, + { + "epoch": 3.8045588327384308, + "grad_norm": 0.05493615195155144, + "learning_rate": 0.00012370909090909091, + "loss": 3.1446405029296876, + "step": 3800 + }, + { + "epoch": 3.8546558957981087, + "grad_norm": 0.054356664419174194, + "learning_rate": 0.00012007272727272727, + "loss": 3.0820523071289063, + "step": 3850 + }, + { + "epoch": 3.904752958857787, + "grad_norm": 0.0555652491748333, + "learning_rate": 0.00011643636363636364, + "loss": 3.183399353027344, + "step": 3900 + }, + { + "epoch": 3.954850021917465, + "grad_norm": 0.058864276856184006, + "learning_rate": 0.00011279999999999999, + "loss": 3.0196658325195314, + "step": 3950 + }, + { + "epoch": 4.004007765044774, + "grad_norm": 0.06324097514152527, + "learning_rate": 0.00010916363636363639, + "loss": 3.0737509155273437, + "step": 4000 + }, + { + "epoch": 4.054104828104452, + "grad_norm": 0.05261604115366936, + "learning_rate": 0.00010552727272727274, + "loss": 2.770926513671875, + "step": 4050 + }, + { + "epoch": 4.104201891164131, + "grad_norm": 0.05924660712480545, + "learning_rate": 0.00010189090909090911, + "loss": 2.7489028930664063, + "step": 4100 + }, + { + "epoch": 4.154298954223808, + "grad_norm": 0.05496729537844658, + "learning_rate": 9.825454545454546e-05, + "loss": 2.7954165649414064, + "step": 4150 + }, + { + "epoch": 4.204396017283487, + "grad_norm": 0.05670342594385147, + "learning_rate": 9.461818181818183e-05, + "loss": 2.8602774047851565, + "step": 4200 + }, + { + "epoch": 4.254493080343165, + "grad_norm": 0.062024831771850586, + "learning_rate": 9.09818181818182e-05, + "loss": 2.8147286987304687, + "step": 4250 + }, + { + "epoch": 4.304590143402843, + "grad_norm": 0.055980272591114044, + "learning_rate": 8.734545454545455e-05, + "loss": 2.8248248291015625, + "step": 4300 + }, + { + "epoch": 4.354687206462521, + "grad_norm": 0.05720142275094986, + "learning_rate": 8.370909090909092e-05, + "loss": 2.8425811767578124, + "step": 4350 + }, + { + "epoch": 4.4047842695221995, + "grad_norm": 0.06002994254231453, + "learning_rate": 8.007272727272727e-05, + "loss": 2.8419833374023438, + "step": 4400 + }, + { + "epoch": 4.454881332581877, + "grad_norm": 0.05916266515851021, + "learning_rate": 7.643636363636364e-05, + "loss": 2.8121533203125, + "step": 4450 + }, + { + "epoch": 4.5049783956415554, + "grad_norm": 0.05626993626356125, + "learning_rate": 7.280000000000001e-05, + "loss": 2.7959454345703123, + "step": 4500 + }, + { + "epoch": 4.555075458701234, + "grad_norm": 0.05815758556127548, + "learning_rate": 6.916363636363636e-05, + "loss": 2.7882369995117187, + "step": 4550 + }, + { + "epoch": 4.605172521760911, + "grad_norm": 0.06205146387219429, + "learning_rate": 6.552727272727273e-05, + "loss": 2.83596435546875, + "step": 4600 + }, + { + "epoch": 4.65526958482059, + "grad_norm": 0.05774429440498352, + "learning_rate": 6.18909090909091e-05, + "loss": 2.77343994140625, + "step": 4650 + }, + { + "epoch": 4.705366647880268, + "grad_norm": 0.05843517184257507, + "learning_rate": 5.8254545454545465e-05, + "loss": 2.8070660400390626, + "step": 4700 + }, + { + "epoch": 4.755463710939946, + "grad_norm": 0.06255511194467545, + "learning_rate": 5.4618181818181826e-05, + "loss": 2.782181396484375, + "step": 4750 + }, + { + "epoch": 4.805560773999624, + "grad_norm": 0.06288160383701324, + "learning_rate": 5.0981818181818187e-05, + "loss": 2.819413757324219, + "step": 4800 + }, + { + "epoch": 4.855657837059303, + "grad_norm": 0.06578859686851501, + "learning_rate": 4.734545454545455e-05, + "loss": 2.764403076171875, + "step": 4850 + }, + { + "epoch": 4.90575490011898, + "grad_norm": 0.07166821509599686, + "learning_rate": 4.370909090909091e-05, + "loss": 2.7576608276367187, + "step": 4900 + }, + { + "epoch": 4.955851963178659, + "grad_norm": 0.05862944945693016, + "learning_rate": 4.0072727272727276e-05, + "loss": 2.8215606689453123, + "step": 4950 + }, + { + "epoch": 5.005009706305968, + "grad_norm": 0.06217258423566818, + "learning_rate": 3.6436363636363644e-05, + "loss": 2.781416931152344, + "step": 5000 + }, + { + "epoch": 5.055106769365646, + "grad_norm": 0.062334153801202774, + "learning_rate": 3.2800000000000004e-05, + "loss": 2.5809677124023436, + "step": 5050 + }, + { + "epoch": 5.105203832425324, + "grad_norm": 0.0632292777299881, + "learning_rate": 2.9163636363636365e-05, + "loss": 2.5479400634765623, + "step": 5100 + }, + { + "epoch": 5.155300895485002, + "grad_norm": 0.06300564855337143, + "learning_rate": 2.5527272727272726e-05, + "loss": 2.521404571533203, + "step": 5150 + }, + { + "epoch": 5.205397958544681, + "grad_norm": 0.06724506616592407, + "learning_rate": 2.1890909090909094e-05, + "loss": 2.489826507568359, + "step": 5200 + }, + { + "epoch": 5.255495021604358, + "grad_norm": 0.06318136304616928, + "learning_rate": 1.8254545454545455e-05, + "loss": 2.4983534240722656, + "step": 5250 + }, + { + "epoch": 5.3055920846640365, + "grad_norm": 0.0806359350681305, + "learning_rate": 1.4618181818181819e-05, + "loss": 2.5284886169433594, + "step": 5300 + }, + { + "epoch": 5.355689147723715, + "grad_norm": 0.060305405408144, + "learning_rate": 1.0981818181818182e-05, + "loss": 2.5243402099609376, + "step": 5350 + }, + { + "epoch": 5.4057862107833925, + "grad_norm": 0.06560583412647247, + "learning_rate": 7.345454545454546e-06, + "loss": 2.6004681396484375, + "step": 5400 + }, + { + "epoch": 5.455883273843071, + "grad_norm": 0.06115686148405075, + "learning_rate": 3.7090909090909092e-06, + "loss": 2.524554443359375, + "step": 5450 + }, + { + "epoch": 5.505980336902749, + "grad_norm": 0.06685449182987213, + "learning_rate": 7.272727272727273e-08, + "loss": 2.5241400146484376, + "step": 5500 + } + ], + "logging_steps": 50, + "max_steps": 5500, + "num_input_tokens_seen": 0, + "num_train_epochs": 6, + "save_steps": 1000, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": true + }, + "attributes": {} + } + }, + "total_flos": 5.5700701446144e+16, + "train_batch_size": 2, + "trial_name": null, + "trial_params": null +} diff --git a/training_args.bin b/training_args.bin new file mode 100644 index 0000000..da470a4 --- /dev/null +++ b/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:de609ccea9af6b329f32bfaddc1a8db3173f8b8cd3b100f2af29c9b14269a93a +size 5201