初始化项目,由ModelHub XC社区提供模型

Model: mlfoundations-dev/oh-dcft-v3.1-claude-3-5-sonnet-20241022
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-06-26 23:06:12 +08:00
commit fd3eeb9e96
22 changed files with 3791 additions and 0 deletions

54
.gitattributes vendored Normal file
View File

@@ -0,0 +1,54 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zstandard filter=lfs diff=lfs merge=lfs -text
*.tfevents* filter=lfs diff=lfs merge=lfs -text
*.db* filter=lfs diff=lfs merge=lfs -text
*.ark* filter=lfs diff=lfs merge=lfs -text
**/*ckpt*data* filter=lfs diff=lfs merge=lfs -text
**/*ckpt*.meta filter=lfs diff=lfs merge=lfs -text
**/*ckpt*.index filter=lfs diff=lfs merge=lfs -text
*.ckpt filter=lfs diff=lfs merge=lfs -text
*.gguf* filter=lfs diff=lfs merge=lfs -text
*.ggml filter=lfs diff=lfs merge=lfs -text
*.llamafile* filter=lfs diff=lfs merge=lfs -text
*.pt2 filter=lfs diff=lfs merge=lfs -text
*.mlmodel filter=lfs diff=lfs merge=lfs -text
*.npy filter=lfs diff=lfs merge=lfs -text
*.npz filter=lfs diff=lfs merge=lfs -text
*.pickle filter=lfs diff=lfs merge=lfs -text
*.pkl filter=lfs diff=lfs merge=lfs -text
*.tar filter=lfs diff=lfs merge=lfs -text
*.wasm filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text
model-00001-of-00004.safetensors filter=lfs diff=lfs merge=lfs -text
tokenizer.json filter=lfs diff=lfs merge=lfs -text
training_args.bin filter=lfs diff=lfs merge=lfs -text
model-00003-of-00004.safetensors filter=lfs diff=lfs merge=lfs -text
model-00004-of-00004.safetensors filter=lfs diff=lfs merge=lfs -text
model-00002-of-00004.safetensors filter=lfs diff=lfs merge=lfs -text

67
README.md Normal file
View File

@@ -0,0 +1,67 @@
---
library_name: transformers
license: llama3.1
base_model: meta-llama/Meta-Llama-3.1-8B
tags:
- llama-factory
- full
- generated_from_trainer
model-index:
- name: oh-dcft-v3.1-claude-3-5-sonnet-20241022
results: []
---
<!-- This model card has been generated automatically according to the information the Trainer had access to. You
should probably proofread and complete it, then remove this comment. -->
# oh-dcft-v3.1-claude-3-5-sonnet-20241022
This model is a fine-tuned version of [meta-llama/Meta-Llama-3.1-8B](https://huggingface.co/meta-llama/Meta-Llama-3.1-8B) on the mlfoundations-dev/oh-dcft-v3.1-claude-3-5-sonnet-20241022 dataset.
It achieves the following results on the evaluation set:
- Loss: 0.4631
## Model description
More information needed
## Intended uses & limitations
More information needed
## Training and evaluation data
More information needed
## Training procedure
### Training hyperparameters
The following hyperparameters were used during training:
- learning_rate: 5e-06
- train_batch_size: 8
- eval_batch_size: 8
- seed: 42
- distributed_type: multi-GPU
- num_devices: 8
- gradient_accumulation_steps: 8
- total_train_batch_size: 512
- total_eval_batch_size: 64
- optimizer: Use OptimizerNames.ADAMW_TORCH with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
- lr_scheduler_type: constant
- num_epochs: 3.0
### Training results
| Training Loss | Epoch | Step | Validation Loss |
|:-------------:|:------:|:----:|:---------------:|
| 0.4822 | 0.9986 | 454 | 0.4843 |
| 0.4246 | 1.9995 | 909 | 0.4651 |
| 0.3735 | 2.9959 | 1362 | 0.4631 |
### Framework versions
- Transformers 4.46.1
- Pytorch 2.3.0
- Datasets 3.1.0
- Tokenizers 0.20.3

12
all_results.json Normal file
View File

@@ -0,0 +1,12 @@
{
"epoch": 2.995875721748694,
"eval_loss": 0.46309909224510193,
"eval_runtime": 303.4791,
"eval_samples_per_second": 40.369,
"eval_steps_per_second": 0.633,
"total_flos": 2281191348633600.0,
"train_loss": 0.44531785190192963,
"train_runtime": 45435.4893,
"train_samples_per_second": 15.368,
"train_steps_per_second": 0.03
}

36
config.json Normal file
View File

@@ -0,0 +1,36 @@
{
"_name_or_path": "meta-llama/Meta-Llama-3.1-8B",
"architectures": [
"LlamaForCausalLM"
],
"attention_bias": false,
"attention_dropout": 0.0,
"bos_token_id": 128000,
"eos_token_id": 128001,
"head_dim": 128,
"hidden_act": "silu",
"hidden_size": 4096,
"initializer_range": 0.02,
"intermediate_size": 14336,
"max_position_embeddings": 131072,
"mlp_bias": false,
"model_type": "llama",
"num_attention_heads": 32,
"num_hidden_layers": 32,
"num_key_value_heads": 8,
"pretraining_tp": 1,
"rms_norm_eps": 1e-05,
"rope_scaling": {
"factor": 8.0,
"high_freq_factor": 4.0,
"low_freq_factor": 1.0,
"original_max_position_embeddings": 8192,
"rope_type": "llama3"
},
"rope_theta": 500000.0,
"tie_word_embeddings": false,
"torch_dtype": "bfloat16",
"transformers_version": "4.46.1",
"use_cache": false,
"vocab_size": 128256
}

41
configs.yaml Normal file
View File

@@ -0,0 +1,41 @@
adam_beta1: '0.9'
adam_beta2: '0.999'
bf16: 'True'
cutoff_len: '2048'
dataset: mlfoundations-dev/oh-dcft-v3.1-claude-3-5-sonnet-20241022
dataset_dir: ONLINE
ddp_timeout: '180000000'
deepspeed: /opt/ml/code/zero3.json
do_train: 'True'
enable_liger_kernel: 'False'
eval_strategy: epoch
finetuning_type: full
formatting: sharegpt
global_batch_size: '512'
gradient_accumulation_steps: '8'
gradient_checkpointing: 'True'
hub_model_id: mlfoundations-dev/oh-dcft-v3.1-claude-3-5-sonnet-20241022
learning_rate: 5e-06
logging_steps: '10'
lr_scheduler_type: constant
max_grad_norm: '1'
messages: conversations
model_name_or_path: meta-llama/Meta-Llama-3.1-8B
neat_packing: 'True'
num_train_epochs: '3.0'
output_dir: /opt/ml/model
overwrite_cache: 'True'
overwrite_output_dir: 'True'
packing: 'True'
per_device_train_batch_size: '8'
plot_loss: 'True'
preprocessing_num_workers: '16'
push_to_db: 'True'
push_to_hub: 'True'
report_to: wandb
run_name: oh-dcft-v3.1-claude-3-5-sonnet-20241022
save_strategy: epoch
stage: sft
template: llama3
val_size: '0.05'
weight_decay: '0.1'

1
configuration.json Normal file
View File

@@ -0,0 +1 @@
{"framework": "pytorch", "task": "text-generation", "allow_remote": true}

7
eval_results.json Normal file
View File

@@ -0,0 +1,7 @@
{
"epoch": 2.995875721748694,
"eval_loss": 0.46309909224510193,
"eval_runtime": 303.4791,
"eval_samples_per_second": 40.369,
"eval_steps_per_second": 0.633
}

9
generation_config.json Normal file
View File

@@ -0,0 +1,9 @@
{
"_from_model_config": true,
"bos_token_id": 128000,
"do_sample": true,
"eos_token_id": 128001,
"temperature": 0.6,
"top_p": 0.9,
"transformers_version": "4.46.1"
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:6ec9edd7cd8df2fcf1264b4fad1c1f05d7329ac1525927268e0dcba85aa98484
size 4976698672

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:447849aabe821a95cbe8fee34e425a2f4ee75e68c5e760f40f2ae11d1e2785c4
size 4999802720

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:9c67e7ffbce9103cfee4239af72936b1b2512854f650b73f6ac142628ddd4bbc
size 4915916176

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:916455d9384741d097fffd526034ed42fa53c121b84dcf8bd93b8c25a6cdd11c
size 1168138808

View File

@@ -0,0 +1,298 @@
{
"metadata": {
"total_size": 16060522496
},
"weight_map": {
"lm_head.weight": "model-00004-of-00004.safetensors",
"model.embed_tokens.weight": "model-00001-of-00004.safetensors",
"model.layers.0.input_layernorm.weight": "model-00001-of-00004.safetensors",
"model.layers.0.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.0.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.0.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.0.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"model.layers.0.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.0.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.0.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.0.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.1.input_layernorm.weight": "model-00001-of-00004.safetensors",
"model.layers.1.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.1.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.1.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.1.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"model.layers.1.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.1.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.1.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.1.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.10.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.layers.10.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.10.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.10.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.10.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.layers.10.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.10.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.10.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.10.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.11.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.layers.11.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.11.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.11.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.11.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.layers.11.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.11.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.11.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.11.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.12.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.layers.12.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.12.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.12.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.12.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.layers.12.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.12.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.12.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.12.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.13.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.layers.13.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.13.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.13.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.13.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.layers.13.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.13.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.13.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.13.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.14.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.layers.14.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.14.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.14.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.14.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.layers.14.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.14.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.14.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.14.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.15.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.layers.15.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.15.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.15.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.15.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.layers.15.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.15.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.15.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.15.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.16.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.layers.16.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.16.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.16.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.16.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.layers.16.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.16.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.16.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.16.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.17.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.layers.17.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.17.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.17.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.17.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.layers.17.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.17.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.17.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.17.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.18.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.layers.18.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.18.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.18.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.18.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.layers.18.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.18.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.18.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.18.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.19.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.layers.19.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.19.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.19.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.19.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.layers.19.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.19.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.19.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.19.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.2.input_layernorm.weight": "model-00001-of-00004.safetensors",
"model.layers.2.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.2.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.2.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.2.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"model.layers.2.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.2.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.2.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.2.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.20.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.layers.20.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.20.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.20.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.20.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.layers.20.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.20.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.20.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.20.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.21.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.layers.21.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.21.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.21.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.21.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.layers.21.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.21.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.21.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.21.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.22.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.layers.22.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.22.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.22.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.22.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.layers.22.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.22.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.22.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.22.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.23.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.layers.23.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.23.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.23.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.23.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.layers.23.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.23.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.23.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.23.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.24.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.layers.24.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.24.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.24.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.24.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.layers.24.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.24.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.24.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.24.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.25.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.layers.25.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.25.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.25.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.25.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.layers.25.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.25.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.25.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.25.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.26.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.layers.26.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.26.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.26.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.26.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.layers.26.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.26.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.26.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.26.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.27.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.layers.27.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.27.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.27.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.27.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.layers.27.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.27.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.27.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.27.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.28.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.layers.28.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.28.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.28.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.28.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.layers.28.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.28.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.28.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.28.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.29.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.layers.29.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.29.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.29.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.29.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.layers.29.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.29.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.29.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.29.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.3.input_layernorm.weight": "model-00001-of-00004.safetensors",
"model.layers.3.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.3.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.3.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.3.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"model.layers.3.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.3.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.3.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.3.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.30.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.layers.30.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.30.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.30.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.30.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.layers.30.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.30.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.30.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.30.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.31.input_layernorm.weight": "model-00004-of-00004.safetensors",
"model.layers.31.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
"model.layers.31.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.31.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.31.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
"model.layers.31.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.31.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.31.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.31.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.layers.4.input_layernorm.weight": "model-00001-of-00004.safetensors",
"model.layers.4.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.4.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.4.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.4.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"model.layers.4.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.4.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.4.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.4.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.5.input_layernorm.weight": "model-00001-of-00004.safetensors",
"model.layers.5.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.5.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.5.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.5.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"model.layers.5.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.5.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.5.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.5.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.6.input_layernorm.weight": "model-00001-of-00004.safetensors",
"model.layers.6.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.6.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.6.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.6.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"model.layers.6.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.6.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.6.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.6.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.7.input_layernorm.weight": "model-00001-of-00004.safetensors",
"model.layers.7.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.7.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.7.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.7.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"model.layers.7.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.7.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.7.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.7.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.8.input_layernorm.weight": "model-00001-of-00004.safetensors",
"model.layers.8.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.8.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.8.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.8.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"model.layers.8.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.8.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.8.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.8.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
"model.layers.9.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.layers.9.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.9.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.9.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.9.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.layers.9.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.9.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.9.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.layers.9.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.norm.weight": "model-00004-of-00004.safetensors"
}
}

17
special_tokens_map.json Normal file
View File

@@ -0,0 +1,17 @@
{
"bos_token": {
"content": "<|begin_of_text|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"eos_token": {
"content": "<|eot_id|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"pad_token": "<|eot_id|>"
}

BIN
tokenizer.json (Stored with Git LFS) Normal file

Binary file not shown.

2065
tokenizer_config.json Normal file

File diff suppressed because it is too large Load Diff

8
train_results.json Normal file
View File

@@ -0,0 +1,8 @@
{
"epoch": 2.995875721748694,
"total_flos": 2281191348633600.0,
"train_loss": 0.44531785190192963,
"train_runtime": 45435.4893,
"train_samples_per_second": 15.368,
"train_steps_per_second": 0.03
}

140
trainer_log.jsonl Normal file
View File

@@ -0,0 +1,140 @@
{"current_steps": 10, "total_steps": 1362, "loss": 0.7982, "lr": 5e-06, "epoch": 0.021996150673632114, "percentage": 0.73, "elapsed_time": "0:05:31", "remaining_time": "12:26:41"}
{"current_steps": 20, "total_steps": 1362, "loss": 0.6818, "lr": 5e-06, "epoch": 0.04399230134726423, "percentage": 1.47, "elapsed_time": "0:10:55", "remaining_time": "12:13:35"}
{"current_steps": 30, "total_steps": 1362, "loss": 0.6576, "lr": 5e-06, "epoch": 0.06598845202089634, "percentage": 2.2, "elapsed_time": "0:16:18", "remaining_time": "12:04:24"}
{"current_steps": 40, "total_steps": 1362, "loss": 0.6179, "lr": 5e-06, "epoch": 0.08798460269452846, "percentage": 2.94, "elapsed_time": "0:21:43", "remaining_time": "11:57:50"}
{"current_steps": 50, "total_steps": 1362, "loss": 0.5951, "lr": 5e-06, "epoch": 0.10998075336816057, "percentage": 3.67, "elapsed_time": "0:27:05", "remaining_time": "11:50:58"}
{"current_steps": 60, "total_steps": 1362, "loss": 0.579, "lr": 5e-06, "epoch": 0.1319769040417927, "percentage": 4.41, "elapsed_time": "0:32:28", "remaining_time": "11:44:42"}
{"current_steps": 70, "total_steps": 1362, "loss": 0.5625, "lr": 5e-06, "epoch": 0.1539730547154248, "percentage": 5.14, "elapsed_time": "0:37:52", "remaining_time": "11:39:00"}
{"current_steps": 80, "total_steps": 1362, "loss": 0.5544, "lr": 5e-06, "epoch": 0.17596920538905692, "percentage": 5.87, "elapsed_time": "0:43:15", "remaining_time": "11:33:06"}
{"current_steps": 90, "total_steps": 1362, "loss": 0.5474, "lr": 5e-06, "epoch": 0.19796535606268903, "percentage": 6.61, "elapsed_time": "0:48:40", "remaining_time": "11:27:53"}
{"current_steps": 100, "total_steps": 1362, "loss": 0.5403, "lr": 5e-06, "epoch": 0.21996150673632114, "percentage": 7.34, "elapsed_time": "0:54:05", "remaining_time": "11:22:41"}
{"current_steps": 110, "total_steps": 1362, "loss": 0.5409, "lr": 5e-06, "epoch": 0.24195765740995326, "percentage": 8.08, "elapsed_time": "0:59:29", "remaining_time": "11:17:04"}
{"current_steps": 120, "total_steps": 1362, "loss": 0.5282, "lr": 5e-06, "epoch": 0.2639538080835854, "percentage": 8.81, "elapsed_time": "1:04:52", "remaining_time": "11:11:30"}
{"current_steps": 130, "total_steps": 1362, "loss": 0.5315, "lr": 5e-06, "epoch": 0.28594995875721746, "percentage": 9.54, "elapsed_time": "1:10:15", "remaining_time": "11:05:53"}
{"current_steps": 140, "total_steps": 1362, "loss": 0.5307, "lr": 5e-06, "epoch": 0.3079461094308496, "percentage": 10.28, "elapsed_time": "1:15:38", "remaining_time": "11:00:17"}
{"current_steps": 150, "total_steps": 1362, "loss": 0.5256, "lr": 5e-06, "epoch": 0.3299422601044817, "percentage": 11.01, "elapsed_time": "1:21:01", "remaining_time": "10:54:39"}
{"current_steps": 160, "total_steps": 1362, "loss": 0.5236, "lr": 5e-06, "epoch": 0.35193841077811383, "percentage": 11.75, "elapsed_time": "1:26:26", "remaining_time": "10:49:20"}
{"current_steps": 170, "total_steps": 1362, "loss": 0.5148, "lr": 5e-06, "epoch": 0.3739345614517459, "percentage": 12.48, "elapsed_time": "1:31:49", "remaining_time": "10:43:51"}
{"current_steps": 180, "total_steps": 1362, "loss": 0.5147, "lr": 5e-06, "epoch": 0.39593071212537806, "percentage": 13.22, "elapsed_time": "1:37:11", "remaining_time": "10:38:14"}
{"current_steps": 190, "total_steps": 1362, "loss": 0.5184, "lr": 5e-06, "epoch": 0.41792686279901015, "percentage": 13.95, "elapsed_time": "1:42:33", "remaining_time": "10:32:39"}
{"current_steps": 200, "total_steps": 1362, "loss": 0.5099, "lr": 5e-06, "epoch": 0.4399230134726423, "percentage": 14.68, "elapsed_time": "1:47:56", "remaining_time": "10:27:08"}
{"current_steps": 210, "total_steps": 1362, "loss": 0.5117, "lr": 5e-06, "epoch": 0.4619191641462744, "percentage": 15.42, "elapsed_time": "1:53:19", "remaining_time": "10:21:40"}
{"current_steps": 220, "total_steps": 1362, "loss": 0.5055, "lr": 5e-06, "epoch": 0.4839153148199065, "percentage": 16.15, "elapsed_time": "1:58:41", "remaining_time": "10:16:09"}
{"current_steps": 230, "total_steps": 1362, "loss": 0.5043, "lr": 5e-06, "epoch": 0.5059114654935386, "percentage": 16.89, "elapsed_time": "2:04:04", "remaining_time": "10:10:38"}
{"current_steps": 240, "total_steps": 1362, "loss": 0.5084, "lr": 5e-06, "epoch": 0.5279076161671707, "percentage": 17.62, "elapsed_time": "2:09:26", "remaining_time": "10:05:08"}
{"current_steps": 250, "total_steps": 1362, "loss": 0.5007, "lr": 5e-06, "epoch": 0.5499037668408029, "percentage": 18.36, "elapsed_time": "2:14:49", "remaining_time": "9:59:40"}
{"current_steps": 260, "total_steps": 1362, "loss": 0.5004, "lr": 5e-06, "epoch": 0.5718999175144349, "percentage": 19.09, "elapsed_time": "2:20:15", "remaining_time": "9:54:28"}
{"current_steps": 270, "total_steps": 1362, "loss": 0.4997, "lr": 5e-06, "epoch": 0.5938960681880671, "percentage": 19.82, "elapsed_time": "2:25:38", "remaining_time": "9:49:02"}
{"current_steps": 280, "total_steps": 1362, "loss": 0.4933, "lr": 5e-06, "epoch": 0.6158922188616992, "percentage": 20.56, "elapsed_time": "2:31:01", "remaining_time": "9:43:34"}
{"current_steps": 290, "total_steps": 1362, "loss": 0.4969, "lr": 5e-06, "epoch": 0.6378883695353313, "percentage": 21.29, "elapsed_time": "2:36:23", "remaining_time": "9:38:08"}
{"current_steps": 300, "total_steps": 1362, "loss": 0.4971, "lr": 5e-06, "epoch": 0.6598845202089634, "percentage": 22.03, "elapsed_time": "2:41:46", "remaining_time": "9:32:41"}
{"current_steps": 310, "total_steps": 1362, "loss": 0.4883, "lr": 5e-06, "epoch": 0.6818806708825955, "percentage": 22.76, "elapsed_time": "2:47:11", "remaining_time": "9:27:22"}
{"current_steps": 320, "total_steps": 1362, "loss": 0.4912, "lr": 5e-06, "epoch": 0.7038768215562277, "percentage": 23.49, "elapsed_time": "2:52:35", "remaining_time": "9:22:00"}
{"current_steps": 330, "total_steps": 1362, "loss": 0.4961, "lr": 5e-06, "epoch": 0.7258729722298598, "percentage": 24.23, "elapsed_time": "2:58:01", "remaining_time": "9:16:43"}
{"current_steps": 340, "total_steps": 1362, "loss": 0.4879, "lr": 5e-06, "epoch": 0.7478691229034918, "percentage": 24.96, "elapsed_time": "3:03:26", "remaining_time": "9:11:24"}
{"current_steps": 350, "total_steps": 1362, "loss": 0.4948, "lr": 5e-06, "epoch": 0.769865273577124, "percentage": 25.7, "elapsed_time": "3:08:49", "remaining_time": "9:05:58"}
{"current_steps": 360, "total_steps": 1362, "loss": 0.491, "lr": 5e-06, "epoch": 0.7918614242507561, "percentage": 26.43, "elapsed_time": "3:14:16", "remaining_time": "9:00:42"}
{"current_steps": 370, "total_steps": 1362, "loss": 0.4924, "lr": 5e-06, "epoch": 0.8138575749243883, "percentage": 27.17, "elapsed_time": "3:19:41", "remaining_time": "8:55:23"}
{"current_steps": 380, "total_steps": 1362, "loss": 0.485, "lr": 5e-06, "epoch": 0.8358537255980203, "percentage": 27.9, "elapsed_time": "3:25:05", "remaining_time": "8:50:00"}
{"current_steps": 390, "total_steps": 1362, "loss": 0.4913, "lr": 5e-06, "epoch": 0.8578498762716524, "percentage": 28.63, "elapsed_time": "3:30:30", "remaining_time": "8:44:39"}
{"current_steps": 400, "total_steps": 1362, "loss": 0.4946, "lr": 5e-06, "epoch": 0.8798460269452846, "percentage": 29.37, "elapsed_time": "3:35:56", "remaining_time": "8:39:19"}
{"current_steps": 410, "total_steps": 1362, "loss": 0.478, "lr": 5e-06, "epoch": 0.9018421776189167, "percentage": 30.1, "elapsed_time": "3:41:21", "remaining_time": "8:34:00"}
{"current_steps": 420, "total_steps": 1362, "loss": 0.485, "lr": 5e-06, "epoch": 0.9238383282925487, "percentage": 30.84, "elapsed_time": "3:46:47", "remaining_time": "8:28:39"}
{"current_steps": 430, "total_steps": 1362, "loss": 0.4841, "lr": 5e-06, "epoch": 0.9458344789661809, "percentage": 31.57, "elapsed_time": "3:52:12", "remaining_time": "8:23:18"}
{"current_steps": 440, "total_steps": 1362, "loss": 0.4805, "lr": 5e-06, "epoch": 0.967830629639813, "percentage": 32.31, "elapsed_time": "3:57:37", "remaining_time": "8:17:55"}
{"current_steps": 450, "total_steps": 1362, "loss": 0.4822, "lr": 5e-06, "epoch": 0.9898267803134452, "percentage": 33.04, "elapsed_time": "4:03:02", "remaining_time": "8:12:34"}
{"current_steps": 454, "total_steps": 1362, "eval_loss": 0.4843384027481079, "epoch": 0.998625240582898, "percentage": 33.33, "elapsed_time": "4:10:53", "remaining_time": "8:21:46"}
{"current_steps": 460, "total_steps": 1362, "loss": 0.4742, "lr": 5e-06, "epoch": 1.0118229309870772, "percentage": 33.77, "elapsed_time": "4:15:02", "remaining_time": "8:20:05"}
{"current_steps": 470, "total_steps": 1362, "loss": 0.4381, "lr": 5e-06, "epoch": 1.0338190816607093, "percentage": 34.51, "elapsed_time": "4:20:27", "remaining_time": "8:14:18"}
{"current_steps": 480, "total_steps": 1362, "loss": 0.4396, "lr": 5e-06, "epoch": 1.0558152323343415, "percentage": 35.24, "elapsed_time": "4:25:52", "remaining_time": "8:08:32"}
{"current_steps": 490, "total_steps": 1362, "loss": 0.436, "lr": 5e-06, "epoch": 1.0778113830079736, "percentage": 35.98, "elapsed_time": "4:31:16", "remaining_time": "8:02:46"}
{"current_steps": 500, "total_steps": 1362, "loss": 0.4308, "lr": 5e-06, "epoch": 1.0998075336816058, "percentage": 36.71, "elapsed_time": "4:36:41", "remaining_time": "7:57:01"}
{"current_steps": 510, "total_steps": 1362, "loss": 0.4368, "lr": 5e-06, "epoch": 1.121803684355238, "percentage": 37.44, "elapsed_time": "4:42:05", "remaining_time": "7:51:14"}
{"current_steps": 520, "total_steps": 1362, "loss": 0.4419, "lr": 5e-06, "epoch": 1.14379983502887, "percentage": 38.18, "elapsed_time": "4:47:30", "remaining_time": "7:45:31"}
{"current_steps": 530, "total_steps": 1362, "loss": 0.4361, "lr": 5e-06, "epoch": 1.165795985702502, "percentage": 38.91, "elapsed_time": "4:52:54", "remaining_time": "7:39:48"}
{"current_steps": 540, "total_steps": 1362, "loss": 0.4345, "lr": 5e-06, "epoch": 1.1877921363761341, "percentage": 39.65, "elapsed_time": "4:58:16", "remaining_time": "7:34:02"}
{"current_steps": 550, "total_steps": 1362, "loss": 0.4339, "lr": 5e-06, "epoch": 1.2097882870497663, "percentage": 40.38, "elapsed_time": "5:03:39", "remaining_time": "7:28:18"}
{"current_steps": 560, "total_steps": 1362, "loss": 0.4385, "lr": 5e-06, "epoch": 1.2317844377233984, "percentage": 41.12, "elapsed_time": "5:09:02", "remaining_time": "7:22:35"}
{"current_steps": 570, "total_steps": 1362, "loss": 0.4329, "lr": 5e-06, "epoch": 1.2537805883970305, "percentage": 41.85, "elapsed_time": "5:14:27", "remaining_time": "7:16:56"}
{"current_steps": 580, "total_steps": 1362, "loss": 0.4333, "lr": 5e-06, "epoch": 1.2757767390706627, "percentage": 42.58, "elapsed_time": "5:19:51", "remaining_time": "7:11:15"}
{"current_steps": 590, "total_steps": 1362, "loss": 0.4317, "lr": 5e-06, "epoch": 1.2977728897442948, "percentage": 43.32, "elapsed_time": "5:25:13", "remaining_time": "7:05:32"}
{"current_steps": 600, "total_steps": 1362, "loss": 0.4294, "lr": 5e-06, "epoch": 1.3197690404179268, "percentage": 44.05, "elapsed_time": "5:30:37", "remaining_time": "6:59:54"}
{"current_steps": 610, "total_steps": 1362, "loss": 0.4305, "lr": 5e-06, "epoch": 1.341765191091559, "percentage": 44.79, "elapsed_time": "5:36:03", "remaining_time": "6:54:17"}
{"current_steps": 620, "total_steps": 1362, "loss": 0.4358, "lr": 5e-06, "epoch": 1.363761341765191, "percentage": 45.52, "elapsed_time": "5:41:27", "remaining_time": "6:48:38"}
{"current_steps": 630, "total_steps": 1362, "loss": 0.433, "lr": 5e-06, "epoch": 1.3857574924388232, "percentage": 46.26, "elapsed_time": "5:46:51", "remaining_time": "6:43:00"}
{"current_steps": 640, "total_steps": 1362, "loss": 0.4316, "lr": 5e-06, "epoch": 1.4077536431124553, "percentage": 46.99, "elapsed_time": "5:52:16", "remaining_time": "6:37:24"}
{"current_steps": 650, "total_steps": 1362, "loss": 0.4309, "lr": 5e-06, "epoch": 1.4297497937860875, "percentage": 47.72, "elapsed_time": "5:57:41", "remaining_time": "6:31:48"}
{"current_steps": 660, "total_steps": 1362, "loss": 0.438, "lr": 5e-06, "epoch": 1.4517459444597196, "percentage": 48.46, "elapsed_time": "6:03:05", "remaining_time": "6:26:12"}
{"current_steps": 670, "total_steps": 1362, "loss": 0.4279, "lr": 5e-06, "epoch": 1.4737420951333515, "percentage": 49.19, "elapsed_time": "6:08:30", "remaining_time": "6:20:36"}
{"current_steps": 680, "total_steps": 1362, "loss": 0.4326, "lr": 5e-06, "epoch": 1.495738245806984, "percentage": 49.93, "elapsed_time": "6:13:55", "remaining_time": "6:15:01"}
{"current_steps": 690, "total_steps": 1362, "loss": 0.4359, "lr": 5e-06, "epoch": 1.5177343964806158, "percentage": 50.66, "elapsed_time": "6:19:18", "remaining_time": "6:09:24"}
{"current_steps": 700, "total_steps": 1362, "loss": 0.4291, "lr": 5e-06, "epoch": 1.539730547154248, "percentage": 51.4, "elapsed_time": "6:24:41", "remaining_time": "6:03:48"}
{"current_steps": 710, "total_steps": 1362, "loss": 0.4303, "lr": 5e-06, "epoch": 1.56172669782788, "percentage": 52.13, "elapsed_time": "6:30:06", "remaining_time": "5:58:14"}
{"current_steps": 720, "total_steps": 1362, "loss": 0.4324, "lr": 5e-06, "epoch": 1.5837228485015122, "percentage": 52.86, "elapsed_time": "6:35:29", "remaining_time": "5:52:39"}
{"current_steps": 730, "total_steps": 1362, "loss": 0.4345, "lr": 5e-06, "epoch": 1.6057189991751444, "percentage": 53.6, "elapsed_time": "6:40:53", "remaining_time": "5:47:04"}
{"current_steps": 740, "total_steps": 1362, "loss": 0.4311, "lr": 5e-06, "epoch": 1.6277151498487763, "percentage": 54.33, "elapsed_time": "6:46:19", "remaining_time": "5:41:31"}
{"current_steps": 750, "total_steps": 1362, "loss": 0.4297, "lr": 5e-06, "epoch": 1.6497113005224087, "percentage": 55.07, "elapsed_time": "6:51:44", "remaining_time": "5:35:58"}
{"current_steps": 760, "total_steps": 1362, "loss": 0.4258, "lr": 5e-06, "epoch": 1.6717074511960406, "percentage": 55.8, "elapsed_time": "6:57:09", "remaining_time": "5:30:26"}
{"current_steps": 770, "total_steps": 1362, "loss": 0.4308, "lr": 5e-06, "epoch": 1.693703601869673, "percentage": 56.53, "elapsed_time": "7:02:33", "remaining_time": "5:24:52"}
{"current_steps": 780, "total_steps": 1362, "loss": 0.4278, "lr": 5e-06, "epoch": 1.7156997525433049, "percentage": 57.27, "elapsed_time": "7:07:58", "remaining_time": "5:19:19"}
{"current_steps": 790, "total_steps": 1362, "loss": 0.4267, "lr": 5e-06, "epoch": 1.737695903216937, "percentage": 58.0, "elapsed_time": "7:13:23", "remaining_time": "5:13:47"}
{"current_steps": 800, "total_steps": 1362, "loss": 0.4323, "lr": 5e-06, "epoch": 1.7596920538905692, "percentage": 58.74, "elapsed_time": "7:18:46", "remaining_time": "5:08:14"}
{"current_steps": 810, "total_steps": 1362, "loss": 0.4265, "lr": 5e-06, "epoch": 1.7816882045642013, "percentage": 59.47, "elapsed_time": "7:24:11", "remaining_time": "5:02:42"}
{"current_steps": 820, "total_steps": 1362, "loss": 0.4299, "lr": 5e-06, "epoch": 1.8036843552378334, "percentage": 60.21, "elapsed_time": "7:29:33", "remaining_time": "4:57:08"}
{"current_steps": 830, "total_steps": 1362, "loss": 0.4254, "lr": 5e-06, "epoch": 1.8256805059114654, "percentage": 60.94, "elapsed_time": "7:34:57", "remaining_time": "4:51:36"}
{"current_steps": 840, "total_steps": 1362, "loss": 0.4268, "lr": 5e-06, "epoch": 1.8476766565850977, "percentage": 61.67, "elapsed_time": "7:40:23", "remaining_time": "4:46:06"}
{"current_steps": 850, "total_steps": 1362, "loss": 0.4229, "lr": 5e-06, "epoch": 1.8696728072587296, "percentage": 62.41, "elapsed_time": "7:45:49", "remaining_time": "4:40:35"}
{"current_steps": 860, "total_steps": 1362, "loss": 0.4238, "lr": 5e-06, "epoch": 1.8916689579323618, "percentage": 63.14, "elapsed_time": "7:51:14", "remaining_time": "4:35:04"}
{"current_steps": 870, "total_steps": 1362, "loss": 0.4267, "lr": 5e-06, "epoch": 1.913665108605994, "percentage": 63.88, "elapsed_time": "7:56:39", "remaining_time": "4:29:33"}
{"current_steps": 880, "total_steps": 1362, "loss": 0.426, "lr": 5e-06, "epoch": 1.935661259279626, "percentage": 64.61, "elapsed_time": "8:02:04", "remaining_time": "4:24:02"}
{"current_steps": 890, "total_steps": 1362, "loss": 0.4274, "lr": 5e-06, "epoch": 1.9576574099532582, "percentage": 65.35, "elapsed_time": "8:07:25", "remaining_time": "4:18:30"}
{"current_steps": 900, "total_steps": 1362, "loss": 0.4246, "lr": 5e-06, "epoch": 1.9796535606268901, "percentage": 66.08, "elapsed_time": "8:12:49", "remaining_time": "4:12:58"}
{"current_steps": 909, "total_steps": 1362, "eval_loss": 0.46506866812705994, "epoch": 1.9994500962331592, "percentage": 66.74, "elapsed_time": "8:23:02", "remaining_time": "4:10:41"}
{"current_steps": 910, "total_steps": 1362, "loss": 0.4343, "lr": 5e-06, "epoch": 2.0016497113005225, "percentage": 66.81, "elapsed_time": "8:24:45", "remaining_time": "4:10:43"}
{"current_steps": 920, "total_steps": 1362, "loss": 0.3763, "lr": 5e-06, "epoch": 2.0236458619741544, "percentage": 67.55, "elapsed_time": "8:30:09", "remaining_time": "4:05:06"}
{"current_steps": 930, "total_steps": 1362, "loss": 0.3715, "lr": 5e-06, "epoch": 2.045642012647787, "percentage": 68.28, "elapsed_time": "8:35:34", "remaining_time": "3:59:29"}
{"current_steps": 940, "total_steps": 1362, "loss": 0.3793, "lr": 5e-06, "epoch": 2.0676381633214187, "percentage": 69.02, "elapsed_time": "8:40:59", "remaining_time": "3:53:53"}
{"current_steps": 950, "total_steps": 1362, "loss": 0.3768, "lr": 5e-06, "epoch": 2.089634313995051, "percentage": 69.75, "elapsed_time": "8:46:24", "remaining_time": "3:48:17"}
{"current_steps": 960, "total_steps": 1362, "loss": 0.381, "lr": 5e-06, "epoch": 2.111630464668683, "percentage": 70.48, "elapsed_time": "8:51:50", "remaining_time": "3:42:42"}
{"current_steps": 970, "total_steps": 1362, "loss": 0.3779, "lr": 5e-06, "epoch": 2.133626615342315, "percentage": 71.22, "elapsed_time": "8:57:15", "remaining_time": "3:37:07"}
{"current_steps": 980, "total_steps": 1362, "loss": 0.3757, "lr": 5e-06, "epoch": 2.1556227660159473, "percentage": 71.95, "elapsed_time": "9:02:40", "remaining_time": "3:31:31"}
{"current_steps": 990, "total_steps": 1362, "loss": 0.3799, "lr": 5e-06, "epoch": 2.177618916689579, "percentage": 72.69, "elapsed_time": "9:08:05", "remaining_time": "3:25:57"}
{"current_steps": 1000, "total_steps": 1362, "loss": 0.3791, "lr": 5e-06, "epoch": 2.1996150673632116, "percentage": 73.42, "elapsed_time": "9:13:31", "remaining_time": "3:20:22"}
{"current_steps": 1010, "total_steps": 1362, "loss": 0.3767, "lr": 5e-06, "epoch": 2.2216112180368435, "percentage": 74.16, "elapsed_time": "9:18:55", "remaining_time": "3:14:47"}
{"current_steps": 1020, "total_steps": 1362, "loss": 0.3775, "lr": 5e-06, "epoch": 2.243607368710476, "percentage": 74.89, "elapsed_time": "9:24:19", "remaining_time": "3:09:12"}
{"current_steps": 1030, "total_steps": 1362, "loss": 0.3776, "lr": 5e-06, "epoch": 2.2656035193841078, "percentage": 75.62, "elapsed_time": "9:29:41", "remaining_time": "3:03:37"}
{"current_steps": 1040, "total_steps": 1362, "loss": 0.3768, "lr": 5e-06, "epoch": 2.28759967005774, "percentage": 76.36, "elapsed_time": "9:35:05", "remaining_time": "2:58:03"}
{"current_steps": 1050, "total_steps": 1362, "loss": 0.3743, "lr": 5e-06, "epoch": 2.309595820731372, "percentage": 77.09, "elapsed_time": "9:40:29", "remaining_time": "2:52:29"}
{"current_steps": 1060, "total_steps": 1362, "loss": 0.3817, "lr": 5e-06, "epoch": 2.331591971405004, "percentage": 77.83, "elapsed_time": "9:45:53", "remaining_time": "2:46:55"}
{"current_steps": 1070, "total_steps": 1362, "loss": 0.3782, "lr": 5e-06, "epoch": 2.3535881220786363, "percentage": 78.56, "elapsed_time": "9:51:18", "remaining_time": "2:41:22"}
{"current_steps": 1080, "total_steps": 1362, "loss": 0.3802, "lr": 5e-06, "epoch": 2.3755842727522682, "percentage": 79.3, "elapsed_time": "9:56:42", "remaining_time": "2:35:48"}
{"current_steps": 1090, "total_steps": 1362, "loss": 0.3756, "lr": 5e-06, "epoch": 2.3975804234259006, "percentage": 80.03, "elapsed_time": "10:02:05", "remaining_time": "2:30:14"}
{"current_steps": 1100, "total_steps": 1362, "loss": 0.3792, "lr": 5e-06, "epoch": 2.4195765740995325, "percentage": 80.76, "elapsed_time": "10:07:28", "remaining_time": "2:24:41"}
{"current_steps": 1110, "total_steps": 1362, "loss": 0.3842, "lr": 5e-06, "epoch": 2.441572724773165, "percentage": 81.5, "elapsed_time": "10:12:50", "remaining_time": "2:19:07"}
{"current_steps": 1120, "total_steps": 1362, "loss": 0.3767, "lr": 5e-06, "epoch": 2.463568875446797, "percentage": 82.23, "elapsed_time": "10:18:15", "remaining_time": "2:13:35"}
{"current_steps": 1130, "total_steps": 1362, "loss": 0.3827, "lr": 5e-06, "epoch": 2.4855650261204287, "percentage": 82.97, "elapsed_time": "10:23:40", "remaining_time": "2:08:02"}
{"current_steps": 1140, "total_steps": 1362, "loss": 0.3849, "lr": 5e-06, "epoch": 2.507561176794061, "percentage": 83.7, "elapsed_time": "10:29:04", "remaining_time": "2:02:30"}
{"current_steps": 1150, "total_steps": 1362, "loss": 0.3813, "lr": 5e-06, "epoch": 2.529557327467693, "percentage": 84.43, "elapsed_time": "10:34:29", "remaining_time": "1:56:58"}
{"current_steps": 1160, "total_steps": 1362, "loss": 0.3804, "lr": 5e-06, "epoch": 2.5515534781413254, "percentage": 85.17, "elapsed_time": "10:39:55", "remaining_time": "1:51:26"}
{"current_steps": 1170, "total_steps": 1362, "loss": 0.3751, "lr": 5e-06, "epoch": 2.5735496288149573, "percentage": 85.9, "elapsed_time": "10:45:19", "remaining_time": "1:45:53"}
{"current_steps": 1180, "total_steps": 1362, "loss": 0.3731, "lr": 5e-06, "epoch": 2.5955457794885897, "percentage": 86.64, "elapsed_time": "10:50:43", "remaining_time": "1:40:21"}
{"current_steps": 1190, "total_steps": 1362, "loss": 0.3757, "lr": 5e-06, "epoch": 2.6175419301622216, "percentage": 87.37, "elapsed_time": "10:56:09", "remaining_time": "1:34:50"}
{"current_steps": 1200, "total_steps": 1362, "loss": 0.3742, "lr": 5e-06, "epoch": 2.6395380808358535, "percentage": 88.11, "elapsed_time": "11:01:35", "remaining_time": "1:29:18"}
{"current_steps": 1210, "total_steps": 1362, "loss": 0.3753, "lr": 5e-06, "epoch": 2.661534231509486, "percentage": 88.84, "elapsed_time": "11:07:00", "remaining_time": "1:23:47"}
{"current_steps": 1220, "total_steps": 1362, "loss": 0.3741, "lr": 5e-06, "epoch": 2.683530382183118, "percentage": 89.57, "elapsed_time": "11:12:25", "remaining_time": "1:18:16"}
{"current_steps": 1230, "total_steps": 1362, "loss": 0.3785, "lr": 5e-06, "epoch": 2.70552653285675, "percentage": 90.31, "elapsed_time": "11:17:49", "remaining_time": "1:12:44"}
{"current_steps": 1240, "total_steps": 1362, "loss": 0.3761, "lr": 5e-06, "epoch": 2.727522683530382, "percentage": 91.04, "elapsed_time": "11:23:13", "remaining_time": "1:07:13"}
{"current_steps": 1250, "total_steps": 1362, "loss": 0.3748, "lr": 5e-06, "epoch": 2.7495188342040144, "percentage": 91.78, "elapsed_time": "11:28:37", "remaining_time": "1:01:42"}
{"current_steps": 1260, "total_steps": 1362, "loss": 0.3728, "lr": 5e-06, "epoch": 2.7715149848776464, "percentage": 92.51, "elapsed_time": "11:34:02", "remaining_time": "0:56:11"}
{"current_steps": 1270, "total_steps": 1362, "loss": 0.3794, "lr": 5e-06, "epoch": 2.7935111355512783, "percentage": 93.25, "elapsed_time": "11:39:28", "remaining_time": "0:50:40"}
{"current_steps": 1280, "total_steps": 1362, "loss": 0.3789, "lr": 5e-06, "epoch": 2.8155072862249106, "percentage": 93.98, "elapsed_time": "11:44:53", "remaining_time": "0:45:09"}
{"current_steps": 1290, "total_steps": 1362, "loss": 0.3732, "lr": 5e-06, "epoch": 2.837503436898543, "percentage": 94.71, "elapsed_time": "11:50:16", "remaining_time": "0:39:38"}
{"current_steps": 1300, "total_steps": 1362, "loss": 0.3741, "lr": 5e-06, "epoch": 2.859499587572175, "percentage": 95.45, "elapsed_time": "11:55:42", "remaining_time": "0:34:08"}
{"current_steps": 1310, "total_steps": 1362, "loss": 0.3753, "lr": 5e-06, "epoch": 2.881495738245807, "percentage": 96.18, "elapsed_time": "12:01:07", "remaining_time": "0:28:37"}
{"current_steps": 1320, "total_steps": 1362, "loss": 0.3756, "lr": 5e-06, "epoch": 2.903491888919439, "percentage": 96.92, "elapsed_time": "12:06:32", "remaining_time": "0:23:07"}
{"current_steps": 1330, "total_steps": 1362, "loss": 0.378, "lr": 5e-06, "epoch": 2.925488039593071, "percentage": 97.65, "elapsed_time": "12:11:56", "remaining_time": "0:17:36"}
{"current_steps": 1340, "total_steps": 1362, "loss": 0.3795, "lr": 5e-06, "epoch": 2.947484190266703, "percentage": 98.38, "elapsed_time": "12:17:22", "remaining_time": "0:12:06"}
{"current_steps": 1350, "total_steps": 1362, "loss": 0.3742, "lr": 5e-06, "epoch": 2.9694803409403354, "percentage": 99.12, "elapsed_time": "12:22:46", "remaining_time": "0:06:36"}
{"current_steps": 1360, "total_steps": 1362, "loss": 0.3735, "lr": 5e-06, "epoch": 2.991476491613968, "percentage": 99.85, "elapsed_time": "12:28:10", "remaining_time": "0:01:06"}
{"current_steps": 1362, "total_steps": 1362, "eval_loss": 0.46309909224510193, "epoch": 2.995875721748694, "percentage": 100.0, "elapsed_time": "12:35:40", "remaining_time": "0:00:00"}
{"current_steps": 1362, "total_steps": 1362, "epoch": 2.995875721748694, "percentage": 100.0, "elapsed_time": "12:37:14", "remaining_time": "0:00:00"}

1018
trainer_state.json Normal file

File diff suppressed because it is too large Load Diff

3
training_args.bin Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:828f54959abc9135ca5e2800fad905c34ef1effb2bea2bebf4f589360b7d0d5b
size 7224

BIN
training_eval_loss.png Normal file

Binary file not shown.

After

Width:  |  Height:  |  Size: 31 KiB

BIN
training_loss.png Normal file

Binary file not shown.

After

Width:  |  Height:  |  Size: 33 KiB