初始化项目,由ModelHub XC社区提供模型
Model: FlameF0X/Qwen2-0.2B-it Source: Original Platform
This commit is contained in:
8
.eval_results/mmlu_pro.yaml
Normal file
8
.eval_results/mmlu_pro.yaml
Normal file
@@ -0,0 +1,8 @@
|
|||||||
|
- dataset:
|
||||||
|
id: TIGER-Lab/MMLU-Pro
|
||||||
|
task_id: mmlu_pro
|
||||||
|
value: 4.0
|
||||||
|
source:
|
||||||
|
url: https://huggingface.co/FlameF0X/Qwen2-0.2B-it
|
||||||
|
name: Model Card
|
||||||
|
user: FlameF0X
|
||||||
17
.eval_results/results.yaml
Normal file
17
.eval_results/results.yaml
Normal file
@@ -0,0 +1,17 @@
|
|||||||
|
- dataset:
|
||||||
|
id: TIGER-Lab/MMLU-Pro
|
||||||
|
task_id: mmlu_pro
|
||||||
|
value: 4.0
|
||||||
|
source:
|
||||||
|
url: https://huggingface.co/FlameF0X/Qwen2-0.2B-it
|
||||||
|
name: Model Card
|
||||||
|
user: FlameF0X
|
||||||
|
|
||||||
|
- dataset:
|
||||||
|
id: openai/gsm8k
|
||||||
|
task_id: gsm8k
|
||||||
|
value: 2.0
|
||||||
|
source:
|
||||||
|
url: https://huggingface.co/FlameF0X/Qwen2-0.2B-it
|
||||||
|
name: Model Card
|
||||||
|
user: FlameF0X
|
||||||
36
.gitattributes
vendored
Normal file
36
.gitattributes
vendored
Normal file
@@ -0,0 +1,36 @@
|
|||||||
|
*.7z filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.arrow filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.bin filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.bz2 filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ckpt filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ftz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.gz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.h5 filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.joblib filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.lfs.* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.mlmodel filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.model filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.msgpack filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.npy filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.npz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.onnx filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ot filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.parquet filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pb filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pickle filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pkl filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pt filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pth filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.rar filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tar.* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tar filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tflite filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tgz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.wasm filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.xz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.zip filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.zst filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
tokenizer.json filter=lfs diff=lfs merge=lfs -text
|
||||||
126
README.md
Normal file
126
README.md
Normal file
@@ -0,0 +1,126 @@
|
|||||||
|
---
|
||||||
|
library_name: transformers
|
||||||
|
base_model:
|
||||||
|
- FlameF0X/Qwen2-0.2B-pt
|
||||||
|
license: apache-2.0
|
||||||
|
datasets:
|
||||||
|
- Salesforce/wikitext
|
||||||
|
- roneneldan/TinyStories
|
||||||
|
- FlameF0X/arXiv-AI-ML
|
||||||
|
- Skylion007/openwebtext
|
||||||
|
- flytech/python-codes-25k
|
||||||
|
- bookcorpus/bookcorpus
|
||||||
|
- HuggingFaceH4/ultrachat_200k
|
||||||
|
- openai/gsm8k
|
||||||
|
- microsoft/orca-math-word-problems-200k
|
||||||
|
- laion/OIG
|
||||||
|
- microsoft/wiki_qa
|
||||||
|
metrics:
|
||||||
|
- accuracy
|
||||||
|
model-index:
|
||||||
|
- name: FlameF0X/Qwen2-0.2B-it
|
||||||
|
results:
|
||||||
|
- task:
|
||||||
|
type: text-generation
|
||||||
|
name: Text Generation
|
||||||
|
dataset:
|
||||||
|
id: openai/gsm8k
|
||||||
|
name: GSM8K
|
||||||
|
type: gsm8k
|
||||||
|
config: main
|
||||||
|
split: test
|
||||||
|
metrics:
|
||||||
|
- name: Accuracy
|
||||||
|
type: accuracy
|
||||||
|
value: 2.00
|
||||||
|
verified: false
|
||||||
|
source:
|
||||||
|
name: Local Benchmark
|
||||||
|
url: https://huggingface.co/FlameF0X/Qwen2-0.2B-it
|
||||||
|
- task:
|
||||||
|
type: text-generation
|
||||||
|
name: Text Generation
|
||||||
|
dataset:
|
||||||
|
id: TIGER-Lab/MMLU-Pro
|
||||||
|
name: MMLU-Pro
|
||||||
|
type: TIGER-Lab/MMLU-Pro
|
||||||
|
config: default
|
||||||
|
split: test
|
||||||
|
metrics:
|
||||||
|
- name: Accuracy
|
||||||
|
type: accuracy
|
||||||
|
value: 4.00
|
||||||
|
verified: false
|
||||||
|
source:
|
||||||
|
name: Local Benchmark
|
||||||
|
url: https://huggingface.co/FlameF0X/Qwen2-0.2B-it
|
||||||
|
---
|
||||||
|
|
||||||
|
## Evaluation Results
|
||||||
|
|
||||||
|
| Benchmark | Score |
|
||||||
|
|-----------|-------|
|
||||||
|
| GSM8K (test) | 2.00% |
|
||||||
|
| MMLU-Pro (test) | 4.00% |
|
||||||
|
|
||||||
|
> Results obtained via local evaluation. Given the model size (0.2B parameters), low benchmark scores are expected.
|
||||||
|
|
||||||
|
## Model Usage
|
||||||
|
```python
|
||||||
|
import torch
|
||||||
|
from transformers import AutoTokenizer, AutoModelForCausalLM
|
||||||
|
|
||||||
|
model_path = "FlameF0X/Qwen2-0.2B-it"
|
||||||
|
|
||||||
|
tokenizer = AutoTokenizer.from_pretrained(model_path, trust_remote_code=True)
|
||||||
|
model = AutoModelForCausalLM.from_pretrained(
|
||||||
|
model_path,
|
||||||
|
torch_dtype="auto",
|
||||||
|
device_map="auto",
|
||||||
|
trust_remote_code=True
|
||||||
|
)
|
||||||
|
|
||||||
|
messages = [
|
||||||
|
{"role": "system", "content": "You are a helpful assistant."},
|
||||||
|
{"role": "user", "content": "Explain how a transformer model works in one sentence."}
|
||||||
|
]
|
||||||
|
|
||||||
|
text = tokenizer.apply_chat_template(
|
||||||
|
messages,
|
||||||
|
tokenize=False,
|
||||||
|
add_generation_prompt=True
|
||||||
|
)
|
||||||
|
|
||||||
|
model_inputs = tokenizer([text], return_tensors="pt").to(model.device)
|
||||||
|
|
||||||
|
generated_ids = model.generate(
|
||||||
|
**model_inputs,
|
||||||
|
max_new_tokens=128,
|
||||||
|
do_sample=True,
|
||||||
|
temperature=0.7
|
||||||
|
)
|
||||||
|
|
||||||
|
generated_ids = [
|
||||||
|
output_ids[len(input_ids):]
|
||||||
|
for input_ids, output_ids in zip(model_inputs.input_ids, generated_ids)
|
||||||
|
]
|
||||||
|
|
||||||
|
response = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
|
||||||
|
print(f"--- Assistant Response ---\n{response}")
|
||||||
|
```
|
||||||
|
|
||||||
|
## Training Data
|
||||||
|
|
||||||
|
This model was instruction-tuned on a mixture of:
|
||||||
|
|
||||||
|
- `Salesforce/wikitext` — General text
|
||||||
|
- `roneneldan/TinyStories` — Short story generation
|
||||||
|
- `FlameF0X/arXiv-AI-ML` — AI/ML research papers
|
||||||
|
- `Skylion007/openwebtext` — Web text
|
||||||
|
- `flytech/python-codes-25k` — Python code
|
||||||
|
- `bookcorpus/bookcorpus` — Books
|
||||||
|
- `HuggingFaceH4/ultrachat_200k` — Instruction following
|
||||||
|
- `openai/gsm8k` — Math reasoning
|
||||||
|
- `microsoft/orca-math-word-problems-200k` — Math word problems
|
||||||
|
- `laion/OIG` — Open instruction generalist
|
||||||
|
- `microsoft/wiki_qa` — Question answering
|
||||||
1
chat_template.jinja
Normal file
1
chat_template.jinja
Normal file
@@ -0,0 +1 @@
|
|||||||
|
{% for message in messages %}{{ '<|im_start|>' + message['role'] + '\n' + message['content'] + '<|im_end|>' + '\n' }}{% endfor %}{% if add_generation_prompt %}{{ '<|im_start|>assistant\n' }}{% endif %}
|
||||||
41
config.json
Normal file
41
config.json
Normal file
@@ -0,0 +1,41 @@
|
|||||||
|
{
|
||||||
|
"architectures": [
|
||||||
|
"Qwen2ForCausalLM"
|
||||||
|
],
|
||||||
|
"attention_dropout": 0.0,
|
||||||
|
"bos_token_id": null,
|
||||||
|
"dtype": "float32",
|
||||||
|
"eos_token_id": 151643,
|
||||||
|
"hidden_act": "silu",
|
||||||
|
"hidden_size": 512,
|
||||||
|
"initializer_range": 0.02,
|
||||||
|
"intermediate_size": 1376,
|
||||||
|
"layer_types": [
|
||||||
|
"full_attention",
|
||||||
|
"full_attention",
|
||||||
|
"full_attention",
|
||||||
|
"full_attention",
|
||||||
|
"full_attention",
|
||||||
|
"full_attention",
|
||||||
|
"full_attention",
|
||||||
|
"full_attention"
|
||||||
|
],
|
||||||
|
"max_position_embeddings": 2048,
|
||||||
|
"max_window_layers": 28,
|
||||||
|
"model_type": "qwen2",
|
||||||
|
"num_attention_heads": 8,
|
||||||
|
"num_hidden_layers": 8,
|
||||||
|
"num_key_value_heads": 8,
|
||||||
|
"pad_token_id": 151643,
|
||||||
|
"rms_norm_eps": 1e-06,
|
||||||
|
"rope_parameters": {
|
||||||
|
"rope_theta": 10000.0,
|
||||||
|
"rope_type": "default"
|
||||||
|
},
|
||||||
|
"sliding_window": null,
|
||||||
|
"tie_word_embeddings": false,
|
||||||
|
"transformers_version": "5.2.0",
|
||||||
|
"use_cache": false,
|
||||||
|
"use_sliding_window": false,
|
||||||
|
"vocab_size": 151936
|
||||||
|
}
|
||||||
9
generation_config.json
Normal file
9
generation_config.json
Normal file
@@ -0,0 +1,9 @@
|
|||||||
|
{
|
||||||
|
"_from_model_config": true,
|
||||||
|
"eos_token_id": 151643,
|
||||||
|
"output_attentions": false,
|
||||||
|
"output_hidden_states": false,
|
||||||
|
"pad_token_id": 151643,
|
||||||
|
"transformers_version": "5.2.0",
|
||||||
|
"use_cache": true
|
||||||
|
}
|
||||||
3
model.safetensors
Normal file
3
model.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:f34ca4b7fea430ee68446e9d66f21dc0db8d5c674a3ba30b6b634694e8d9e501
|
||||||
|
size 723612256
|
||||||
3
optimizer.pt
Normal file
3
optimizer.pt
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:de8b2cf2a988ec7f7c7f403ba328be18f8874faaf5ecc21164260f960eb24b0f
|
||||||
|
size 1447288075
|
||||||
3
rng_state.pth
Normal file
3
rng_state.pth
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:17cd930da9783ca70bad4b9cdeee6a06c0acea8f34645a333c93341f487f66a3
|
||||||
|
size 14645
|
||||||
3
scaler.pt
Normal file
3
scaler.pt
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:f4aa03f6e0cd07cf67ce1fbe3101d545f5771ef9148b9debf02b11cf6948da5c
|
||||||
|
size 1383
|
||||||
3
scheduler.pt
Normal file
3
scheduler.pt
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:8918e26db947366e457e93daaf6ae845d9aef0ef762ad16d34c2fab1781df115
|
||||||
|
size 1465
|
||||||
3
tokenizer.json
Normal file
3
tokenizer.json
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:d429fe753aea0ff87a94e86396d5508abb0d1d0e1f7a0d47c787ff72e0bf2691
|
||||||
|
size 11422170
|
||||||
29
tokenizer_config.json
Normal file
29
tokenizer_config.json
Normal file
@@ -0,0 +1,29 @@
|
|||||||
|
{
|
||||||
|
"add_prefix_space": false,
|
||||||
|
"backend": "tokenizers",
|
||||||
|
"bos_token": null,
|
||||||
|
"clean_up_tokenization_spaces": false,
|
||||||
|
"eos_token": "<|endoftext|>",
|
||||||
|
"errors": "replace",
|
||||||
|
"extra_special_tokens": [
|
||||||
|
"<|im_start|>",
|
||||||
|
"<|im_end|>",
|
||||||
|
"<|object_ref_start|>",
|
||||||
|
"<|object_ref_end|>",
|
||||||
|
"<|box_start|>",
|
||||||
|
"<|box_end|>",
|
||||||
|
"<|quad_start|>",
|
||||||
|
"<|quad_end|>",
|
||||||
|
"<|vision_start|>",
|
||||||
|
"<|vision_end|>",
|
||||||
|
"<|vision_pad|>",
|
||||||
|
"<|image_pad|>",
|
||||||
|
"<|video_pad|>"
|
||||||
|
],
|
||||||
|
"is_local": false,
|
||||||
|
"model_max_length": 131072,
|
||||||
|
"pad_token": "<|endoftext|>",
|
||||||
|
"split_special_tokens": false,
|
||||||
|
"tokenizer_class": "Qwen2Tokenizer",
|
||||||
|
"unk_token": null
|
||||||
|
}
|
||||||
314
trainer_state.json
Normal file
314
trainer_state.json
Normal file
@@ -0,0 +1,314 @@
|
|||||||
|
{
|
||||||
|
"best_global_step": null,
|
||||||
|
"best_metric": null,
|
||||||
|
"best_model_checkpoint": null,
|
||||||
|
"epoch": 9.807384615384615,
|
||||||
|
"eval_steps": 500,
|
||||||
|
"global_step": 2000,
|
||||||
|
"is_hyper_param_search": false,
|
||||||
|
"is_local_process_zero": true,
|
||||||
|
"is_world_process_zero": true,
|
||||||
|
"log_history": [
|
||||||
|
{
|
||||||
|
"epoch": 0.24615384615384617,
|
||||||
|
"grad_norm": 0.09971032291650772,
|
||||||
|
"learning_rate": 7.921600000000001e-05,
|
||||||
|
"loss": 3.8301455688476564,
|
||||||
|
"step": 50
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.49230769230769234,
|
||||||
|
"grad_norm": 0.0911579355597496,
|
||||||
|
"learning_rate": 7.8416e-05,
|
||||||
|
"loss": 3.0332159423828124,
|
||||||
|
"step": 100
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.7384615384615385,
|
||||||
|
"grad_norm": 0.10190442204475403,
|
||||||
|
"learning_rate": 7.7616e-05,
|
||||||
|
"loss": 2.7591339111328126,
|
||||||
|
"step": 150
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.9846153846153847,
|
||||||
|
"grad_norm": 0.09316737949848175,
|
||||||
|
"learning_rate": 7.6816e-05,
|
||||||
|
"loss": 2.617864074707031,
|
||||||
|
"step": 200
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.2264615384615385,
|
||||||
|
"grad_norm": 0.08559751510620117,
|
||||||
|
"learning_rate": 7.601600000000001e-05,
|
||||||
|
"loss": 2.3154002380371095,
|
||||||
|
"step": 250
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.4726153846153847,
|
||||||
|
"grad_norm": 0.0818333625793457,
|
||||||
|
"learning_rate": 7.5216e-05,
|
||||||
|
"loss": 2.227242126464844,
|
||||||
|
"step": 300
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.7187692307692308,
|
||||||
|
"grad_norm": 0.09082052856683731,
|
||||||
|
"learning_rate": 7.441600000000001e-05,
|
||||||
|
"loss": 2.1838539123535154,
|
||||||
|
"step": 350
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.964923076923077,
|
||||||
|
"grad_norm": 0.08575436472892761,
|
||||||
|
"learning_rate": 7.361600000000001e-05,
|
||||||
|
"loss": 2.1341651916503905,
|
||||||
|
"step": 400
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 2.206769230769231,
|
||||||
|
"grad_norm": 0.08966775238513947,
|
||||||
|
"learning_rate": 7.2816e-05,
|
||||||
|
"loss": 1.9519345092773437,
|
||||||
|
"step": 450
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 2.452923076923077,
|
||||||
|
"grad_norm": 0.08918383717536926,
|
||||||
|
"learning_rate": 7.201600000000001e-05,
|
||||||
|
"loss": 1.8568724060058595,
|
||||||
|
"step": 500
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 2.699076923076923,
|
||||||
|
"grad_norm": 0.09143362194299698,
|
||||||
|
"learning_rate": 7.1216e-05,
|
||||||
|
"loss": 1.8383006286621093,
|
||||||
|
"step": 550
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 2.9452307692307693,
|
||||||
|
"grad_norm": 0.0969746857881546,
|
||||||
|
"learning_rate": 7.0416e-05,
|
||||||
|
"loss": 1.8297712707519531,
|
||||||
|
"step": 600
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 3.187076923076923,
|
||||||
|
"grad_norm": 0.09824724495410919,
|
||||||
|
"learning_rate": 6.9616e-05,
|
||||||
|
"loss": 1.6545506286621094,
|
||||||
|
"step": 650
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 3.4332307692307693,
|
||||||
|
"grad_norm": 0.08493440598249435,
|
||||||
|
"learning_rate": 6.8816e-05,
|
||||||
|
"loss": 1.6011067199707032,
|
||||||
|
"step": 700
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 3.6793846153846155,
|
||||||
|
"grad_norm": 0.08676321804523468,
|
||||||
|
"learning_rate": 6.801600000000001e-05,
|
||||||
|
"loss": 1.5964797973632812,
|
||||||
|
"step": 750
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 3.9255384615384616,
|
||||||
|
"grad_norm": 0.09471355378627777,
|
||||||
|
"learning_rate": 6.7216e-05,
|
||||||
|
"loss": 1.5877139282226562,
|
||||||
|
"step": 800
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 4.1673846153846155,
|
||||||
|
"grad_norm": 0.08782424032688141,
|
||||||
|
"learning_rate": 6.641600000000001e-05,
|
||||||
|
"loss": 1.4405186462402344,
|
||||||
|
"step": 850
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 4.413538461538462,
|
||||||
|
"grad_norm": 0.09666605293750763,
|
||||||
|
"learning_rate": 6.5616e-05,
|
||||||
|
"loss": 1.383701171875,
|
||||||
|
"step": 900
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 4.659692307692308,
|
||||||
|
"grad_norm": 0.10380911082029343,
|
||||||
|
"learning_rate": 6.481600000000001e-05,
|
||||||
|
"loss": 1.375392608642578,
|
||||||
|
"step": 950
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 4.905846153846154,
|
||||||
|
"grad_norm": 0.10152668505907059,
|
||||||
|
"learning_rate": 6.4016e-05,
|
||||||
|
"loss": 1.3678237915039062,
|
||||||
|
"step": 1000
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 5.147692307692307,
|
||||||
|
"grad_norm": 0.102939173579216,
|
||||||
|
"learning_rate": 6.321600000000001e-05,
|
||||||
|
"loss": 1.257767333984375,
|
||||||
|
"step": 1050
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 5.3938461538461535,
|
||||||
|
"grad_norm": 0.09689474105834961,
|
||||||
|
"learning_rate": 6.241600000000001e-05,
|
||||||
|
"loss": 1.179140625,
|
||||||
|
"step": 1100
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 5.64,
|
||||||
|
"grad_norm": 0.09813547879457474,
|
||||||
|
"learning_rate": 6.1616e-05,
|
||||||
|
"loss": 1.1883023071289063,
|
||||||
|
"step": 1150
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 5.886153846153846,
|
||||||
|
"grad_norm": 0.10634688287973404,
|
||||||
|
"learning_rate": 6.0816e-05,
|
||||||
|
"loss": 1.196829605102539,
|
||||||
|
"step": 1200
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 6.128,
|
||||||
|
"grad_norm": 0.10477212816476822,
|
||||||
|
"learning_rate": 6.0016e-05,
|
||||||
|
"loss": 1.0858740234375,
|
||||||
|
"step": 1250
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 6.374153846153846,
|
||||||
|
"grad_norm": 0.10455155372619629,
|
||||||
|
"learning_rate": 5.9216000000000004e-05,
|
||||||
|
"loss": 0.9896931457519531,
|
||||||
|
"step": 1300
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 6.6203076923076924,
|
||||||
|
"grad_norm": 0.10506019741296768,
|
||||||
|
"learning_rate": 5.8416000000000004e-05,
|
||||||
|
"loss": 1.0163351440429687,
|
||||||
|
"step": 1350
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 6.866461538461539,
|
||||||
|
"grad_norm": 0.1090712919831276,
|
||||||
|
"learning_rate": 5.7616e-05,
|
||||||
|
"loss": 1.0064225006103515,
|
||||||
|
"step": 1400
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 7.108307692307692,
|
||||||
|
"grad_norm": 0.10628747940063477,
|
||||||
|
"learning_rate": 5.6816000000000006e-05,
|
||||||
|
"loss": 0.931029052734375,
|
||||||
|
"step": 1450
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 7.354461538461538,
|
||||||
|
"grad_norm": 0.1018829494714737,
|
||||||
|
"learning_rate": 5.601600000000001e-05,
|
||||||
|
"loss": 0.8393967437744141,
|
||||||
|
"step": 1500
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 7.600615384615384,
|
||||||
|
"grad_norm": 0.11559069901704788,
|
||||||
|
"learning_rate": 5.521600000000001e-05,
|
||||||
|
"loss": 0.8411316680908203,
|
||||||
|
"step": 1550
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 7.8467692307692305,
|
||||||
|
"grad_norm": 0.12172011286020279,
|
||||||
|
"learning_rate": 5.441600000000001e-05,
|
||||||
|
"loss": 0.8445599365234375,
|
||||||
|
"step": 1600
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 8.088615384615384,
|
||||||
|
"grad_norm": 0.09611531347036362,
|
||||||
|
"learning_rate": 5.3616e-05,
|
||||||
|
"loss": 0.7935149383544922,
|
||||||
|
"step": 1650
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 8.334769230769231,
|
||||||
|
"grad_norm": 0.11105120927095413,
|
||||||
|
"learning_rate": 5.2816000000000004e-05,
|
||||||
|
"loss": 0.6863140106201172,
|
||||||
|
"step": 1700
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 8.580923076923076,
|
||||||
|
"grad_norm": 0.10133285075426102,
|
||||||
|
"learning_rate": 5.2016000000000005e-05,
|
||||||
|
"loss": 0.6949832153320312,
|
||||||
|
"step": 1750
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 8.827076923076923,
|
||||||
|
"grad_norm": 0.11194281280040741,
|
||||||
|
"learning_rate": 5.1216000000000006e-05,
|
||||||
|
"loss": 0.7070323944091796,
|
||||||
|
"step": 1800
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 9.068923076923078,
|
||||||
|
"grad_norm": 0.093862384557724,
|
||||||
|
"learning_rate": 5.0416e-05,
|
||||||
|
"loss": 0.6766038513183594,
|
||||||
|
"step": 1850
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 9.315076923076923,
|
||||||
|
"grad_norm": 0.1024981439113617,
|
||||||
|
"learning_rate": 4.9616e-05,
|
||||||
|
"loss": 0.5633995056152343,
|
||||||
|
"step": 1900
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 9.56123076923077,
|
||||||
|
"grad_norm": 0.10483216494321823,
|
||||||
|
"learning_rate": 4.8816e-05,
|
||||||
|
"loss": 0.5755315399169922,
|
||||||
|
"step": 1950
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 9.807384615384615,
|
||||||
|
"grad_norm": 0.11396331340074539,
|
||||||
|
"learning_rate": 4.8016e-05,
|
||||||
|
"loss": 0.5865091705322265,
|
||||||
|
"step": 2000
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"logging_steps": 50,
|
||||||
|
"max_steps": 5000,
|
||||||
|
"num_input_tokens_seen": 0,
|
||||||
|
"num_train_epochs": 25,
|
||||||
|
"save_steps": 1000,
|
||||||
|
"stateful_callbacks": {
|
||||||
|
"TrainerControl": {
|
||||||
|
"args": {
|
||||||
|
"should_epoch_stop": false,
|
||||||
|
"should_evaluate": false,
|
||||||
|
"should_log": false,
|
||||||
|
"should_save": true,
|
||||||
|
"should_training_stop": false
|
||||||
|
},
|
||||||
|
"attributes": {}
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"total_flos": 2.019225655836672e+16,
|
||||||
|
"train_batch_size": 2,
|
||||||
|
"trial_name": null,
|
||||||
|
"trial_params": null
|
||||||
|
}
|
||||||
3
training_args.bin
Normal file
3
training_args.bin
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:197af5fb66d4f0b05823de4e1b82d51e93a46f42124f1586c8e67d8a8a0dfbdc
|
||||||
|
size 5201
|
||||||
Reference in New Issue
Block a user