初始化项目,由ModelHub XC社区提供模型

Model: lldois/v07_final_only_lr2e5
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-07-29 10:10:10 +08:00
commit 2693e7ba50
16 changed files with 3062 additions and 0 deletions

36
.gitattributes vendored Normal file
View File

@@ -0,0 +1,36 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bin filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ckpt filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.mlmodel filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.npy filter=lfs diff=lfs merge=lfs -text
*.npz filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pickle filter=lfs diff=lfs merge=lfs -text
*.pkl filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
*.safetensors filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tar filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.wasm filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text
tokenizer.json filter=lfs diff=lfs merge=lfs -text

58
README.md Normal file
View File

@@ -0,0 +1,58 @@
---
library_name: transformers
license: other
base_model: OpenOneRec/OneReason-0.8B-pretrain-competition
tags:
- llama-factory
- full
- generated_from_trainer
model-index:
- name: v07_final_only_lr2e5
results: []
---
<!-- This model card has been generated automatically according to the information the Trainer had access to. You
should probably proofread and complete it, then remove this comment. -->
# v07_final_only_lr2e5
This model is a fine-tuned version of [OpenOneRec/OneReason-0.8B-pretrain-competition](https://huggingface.co/OpenOneRec/OneReason-0.8B-pretrain-competition) on the overnight_final_only dataset.
## Model description
More information needed
## Intended uses & limitations
More information needed
## Training and evaluation data
More information needed
## Training procedure
### Training hyperparameters
The following hyperparameters were used during training:
- learning_rate: 2e-05
- train_batch_size: 1
- eval_batch_size: 8
- seed: 202607067
- gradient_accumulation_steps: 4
- total_train_batch_size: 4
- optimizer: Use OptimizerNames.ADAMW_TORCH with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
- lr_scheduler_type: cosine
- lr_scheduler_warmup_steps: 0.03
- num_epochs: 1
### Training results
### Framework versions
- Transformers 5.6.0
- Pytorch 2.7.1+cu126
- Datasets 4.0.0
- Tokenizers 0.22.2

8
all_results.json Normal file
View File

@@ -0,0 +1,8 @@
{
"epoch": 1.0,
"total_flos": 1.4163205452745114e+17,
"train_loss": 1.2549793832631224,
"train_runtime": 2346.2604,
"train_samples_per_second": 0.505,
"train_steps_per_second": 0.127
}

89
chat_template.jinja Normal file
View File

@@ -0,0 +1,89 @@
{%- if tools %}
{{- '<|im_start|>system\n' }}
{%- if messages[0].role == 'system' %}
{{- messages[0].content + '\n\n' }}
{%- endif %}
{{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within <tools></tools> XML tags:\n<tools>" }}
{%- for tool in tools %}
{{- "\n" }}
{{- tool | tojson }}
{%- endfor %}
{{- "\n</tools>\n\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\n<tool_call>\n{\"name\": <function-name>, \"arguments\": <args-json-object>}\n</tool_call><|im_end|>\n" }}
{%- else %}
{%- if messages[0].role == 'system' %}
{{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }}
{%- endif %}
{%- endif %}
{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
{%- for message in messages[::-1] %}
{%- set index = (messages|length - 1) - loop.index0 %}
{%- if ns.multi_step_tool and message.role == "user" and message.content is string and not(message.content.startswith('<tool_response>') and message.content.endswith('</tool_response>')) %}
{%- set ns.multi_step_tool = false %}
{%- set ns.last_query_index = index %}
{%- endif %}
{%- endfor %}
{%- for message in messages %}
{%- if message.content is string %}
{%- set content = message.content %}
{%- else %}
{%- set content = '' %}
{%- endif %}
{%- if (message.role == "user") or (message.role == "system" and not loop.first) %}
{{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
{%- elif message.role == "assistant" %}
{%- set reasoning_content = '' %}
{%- if message.reasoning_content is string %}
{%- set reasoning_content = message.reasoning_content %}
{%- else %}
{%- if '</think>' in content %}
{%- set reasoning_content = content.split('</think>')[0].rstrip('\n').split('<think>')[-1].lstrip('\n') %}
{%- set content = content.split('</think>')[-1].lstrip('\n') %}
{%- endif %}
{%- endif %}
{%- if loop.index0 > ns.last_query_index %}
{%- if loop.last or (not loop.last and reasoning_content) %}
{{- '<|im_start|>' + message.role + '\n<think>\n' + reasoning_content.strip('\n') + '\n</think>\n\n' + content.lstrip('\n') }}
{%- else %}
{{- '<|im_start|>' + message.role + '\n' + content }}
{%- endif %}
{%- else %}
{{- '<|im_start|>' + message.role + '\n' + content }}
{%- endif %}
{%- if message.tool_calls %}
{%- for tool_call in message.tool_calls %}
{%- if (loop.first and content) or (not loop.first) %}
{{- '\n' }}
{%- endif %}
{%- if tool_call.function %}
{%- set tool_call = tool_call.function %}
{%- endif %}
{{- '<tool_call>\n{"name": "' }}
{{- tool_call.name }}
{{- '", "arguments": ' }}
{%- if tool_call.arguments is string %}
{{- tool_call.arguments }}
{%- else %}
{{- tool_call.arguments | tojson }}
{%- endif %}
{{- '}\n</tool_call>' }}
{%- endfor %}
{%- endif %}
{{- '<|im_end|>\n' }}
{%- elif message.role == "tool" %}
{%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
{{- '<|im_start|>user' }}
{%- endif %}
{{- '\n<tool_response>\n' }}
{{- content }}
{{- '\n</tool_response>' }}
{%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
{{- '<|im_end|>\n' }}
{%- endif %}
{%- endif %}
{%- endfor %}
{%- if add_generation_prompt %}
{{- '<|im_start|>assistant\n' }}
{%- if enable_thinking is defined and enable_thinking is false %}
{{- '<think>\n\n</think>\n\n' }}
{%- endif %}
{%- endif %}

63
config.json Normal file
View File

@@ -0,0 +1,63 @@
{
"architectures": [
"Qwen3ForCausalLM"
],
"attention_bias": false,
"attention_dropout": 0.0,
"bos_token_id": null,
"dtype": "bfloat16",
"eos_token_id": 151645,
"head_dim": 128,
"hidden_act": "silu",
"hidden_size": 1024,
"initializer_range": 0.02,
"intermediate_size": 3072,
"layer_types": [
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention"
],
"max_position_embeddings": 40960,
"max_window_layers": 28,
"model_type": "qwen3",
"num_attention_heads": 16,
"num_hidden_layers": 28,
"num_key_value_heads": 8,
"pad_token_id": 151643,
"rms_norm_eps": 1e-06,
"rope_parameters": {
"rope_theta": 1000000,
"rope_type": "default"
},
"sliding_window": null,
"tie_word_embeddings": false,
"transformers_version": "5.6.0",
"use_cache": false,
"use_sliding_window": false,
"vocab_size": 176253
}

12
generation_config.json Normal file
View File

@@ -0,0 +1,12 @@
{
"do_sample": true,
"eos_token_id": [
151645,
151643
],
"pad_token_id": 151643,
"temperature": 0.6,
"top_k": 20,
"top_p": 0.95,
"transformers_version": "5.6.0"
}

3
model.safetensors Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:d5e0552c85e88bb3697cec4af20ba637dac3a3dd4d98987d8597f8ed596dd6c1
size 1602902832

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:b69a79ad80af6e10a8107138cbecc905ae68ef51abe0747025615e39359dc24f
size 18665

3
tokenizer.json Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:cd4d15f596979aecbc11ba12668cb21c9fb8452ce1235cd9d7878cc950170421
size 16016554

16
tokenizer_config.json Normal file
View File

@@ -0,0 +1,16 @@
{
"add_prefix_space": false,
"backend": "tokenizers",
"bos_token": null,
"clean_up_tokenization_spaces": false,
"eos_token": "<|im_end|>",
"errors": "replace",
"is_local": false,
"local_files_only": false,
"model_max_length": 131072,
"pad_token": "<|endoftext|>",
"padding_side": "right",
"split_special_tokens": false,
"tokenizer_class": "Qwen2Tokenizer",
"unk_token": null
}

2244
train.log Normal file

File diff suppressed because one or more lines are too long

8
train_results.json Normal file
View File

@@ -0,0 +1,8 @@
{
"epoch": 1.0,
"total_flos": 1.4163205452745114e+17,
"train_loss": 1.2549793832631224,
"train_runtime": 2346.2604,
"train_samples_per_second": 0.505,
"train_steps_per_second": 0.127
}

60
trainer_log.jsonl Normal file
View File

@@ -0,0 +1,60 @@
{"current_steps": 5, "total_steps": 297, "loss": 2.3417264938354494, "lr": 8.888888888888888e-06, "epoch": 0.016863406408094434, "percentage": 1.68, "elapsed_time": "0:00:38", "remaining_time": "0:37:34"}
{"current_steps": 10, "total_steps": 297, "loss": 1.7059539794921874, "lr": 2e-05, "epoch": 0.03372681281618887, "percentage": 3.37, "elapsed_time": "0:01:18", "remaining_time": "0:37:19"}
{"current_steps": 15, "total_steps": 297, "loss": 1.7476335525512696, "lr": 1.9985129789397633e-05, "epoch": 0.050590219224283306, "percentage": 5.05, "elapsed_time": "0:01:54", "remaining_time": "0:35:56"}
{"current_steps": 20, "total_steps": 297, "loss": 1.5680081367492675, "lr": 1.9940563382223196e-05, "epoch": 0.06745362563237774, "percentage": 6.73, "elapsed_time": "0:02:33", "remaining_time": "0:35:20"}
{"current_steps": 25, "total_steps": 297, "loss": 1.347496223449707, "lr": 1.9866433320848793e-05, "epoch": 0.08431703204047218, "percentage": 8.42, "elapsed_time": "0:03:13", "remaining_time": "0:35:03"}
{"current_steps": 30, "total_steps": 297, "loss": 1.2069475173950195, "lr": 1.9762960071199334e-05, "epoch": 0.10118043844856661, "percentage": 10.1, "elapsed_time": "0:03:52", "remaining_time": "0:34:33"}
{"current_steps": 35, "total_steps": 297, "loss": 1.324411678314209, "lr": 1.963045136707763e-05, "epoch": 0.11804384485666104, "percentage": 11.78, "elapsed_time": "0:04:33", "remaining_time": "0:34:05"}
{"current_steps": 40, "total_steps": 297, "loss": 1.165403175354004, "lr": 1.946930129495106e-05, "epoch": 0.13490725126475547, "percentage": 13.47, "elapsed_time": "0:05:13", "remaining_time": "0:33:36"}
{"current_steps": 45, "total_steps": 297, "loss": 1.2257371902465821, "lr": 1.9279989121921846e-05, "epoch": 0.15177065767284992, "percentage": 15.15, "elapsed_time": "0:05:55", "remaining_time": "0:33:08"}
{"current_steps": 50, "total_steps": 297, "loss": 1.234571933746338, "lr": 1.9063077870366504e-05, "epoch": 0.16863406408094436, "percentage": 16.84, "elapsed_time": "0:06:36", "remaining_time": "0:32:39"}
{"current_steps": 55, "total_steps": 297, "loss": 1.3958836555480958, "lr": 1.881921264348355e-05, "epoch": 0.18549747048903878, "percentage": 18.52, "elapsed_time": "0:07:15", "remaining_time": "0:31:56"}
{"current_steps": 60, "total_steps": 297, "loss": 1.0263965606689454, "lr": 1.854911870672947e-05, "epoch": 0.20236087689713322, "percentage": 20.2, "elapsed_time": "0:07:56", "remaining_time": "0:31:21"}
{"current_steps": 65, "total_steps": 297, "loss": 1.228264617919922, "lr": 1.8253599330848638e-05, "epoch": 0.21922428330522767, "percentage": 21.89, "elapsed_time": "0:08:36", "remaining_time": "0:30:44"}
{"current_steps": 70, "total_steps": 297, "loss": 1.250452423095703, "lr": 1.7933533402912354e-05, "epoch": 0.23608768971332209, "percentage": 23.57, "elapsed_time": "0:09:16", "remaining_time": "0:30:05"}
{"current_steps": 75, "total_steps": 297, "loss": 1.2329339027404784, "lr": 1.758987281247162e-05, "epoch": 0.25295109612141653, "percentage": 25.25, "elapsed_time": "0:09:56", "remaining_time": "0:29:25"}
{"current_steps": 80, "total_steps": 297, "loss": 1.2469540596008302, "lr": 1.7223639620597556e-05, "epoch": 0.26981450252951095, "percentage": 26.94, "elapsed_time": "0:10:33", "remaining_time": "0:28:39"}
{"current_steps": 85, "total_steps": 297, "loss": 1.0711227416992188, "lr": 1.6835923020228714e-05, "epoch": 0.2866779089376054, "percentage": 28.62, "elapsed_time": "0:11:16", "remaining_time": "0:28:06"}
{"current_steps": 90, "total_steps": 297, "loss": 1.6063650131225586, "lr": 1.6427876096865394e-05, "epoch": 0.30354131534569984, "percentage": 30.3, "elapsed_time": "0:11:52", "remaining_time": "0:27:18"}
{"current_steps": 95, "total_steps": 297, "loss": 1.1470824241638184, "lr": 1.6000712399244813e-05, "epoch": 0.32040472175379425, "percentage": 31.99, "elapsed_time": "0:12:33", "remaining_time": "0:26:42"}
{"current_steps": 100, "total_steps": 297, "loss": 1.255699348449707, "lr": 1.5555702330196024e-05, "epoch": 0.3372681281618887, "percentage": 33.67, "elapsed_time": "0:13:11", "remaining_time": "0:25:58"}
{"current_steps": 105, "total_steps": 297, "loss": 1.0055023193359376, "lr": 1.509416936840842e-05, "epoch": 0.35413153456998314, "percentage": 35.35, "elapsed_time": "0:13:51", "remaining_time": "0:25:19"}
{"current_steps": 110, "total_steps": 297, "loss": 1.4475191116333008, "lr": 1.4617486132350343e-05, "epoch": 0.37099494097807756, "percentage": 37.04, "elapsed_time": "0:14:30", "remaining_time": "0:24:39"}
{"current_steps": 115, "total_steps": 297, "loss": 1.1591588973999023, "lr": 1.4127070298043949e-05, "epoch": 0.38785834738617203, "percentage": 38.72, "elapsed_time": "0:15:11", "remaining_time": "0:24:02"}
{"current_steps": 120, "total_steps": 297, "loss": 1.1827627182006837, "lr": 1.3624380382837017e-05, "epoch": 0.40472175379426645, "percentage": 40.4, "elapsed_time": "0:15:52", "remaining_time": "0:23:25"}
{"current_steps": 125, "total_steps": 297, "loss": 1.4125149726867676, "lr": 1.3110911407710909e-05, "epoch": 0.42158516020236086, "percentage": 42.09, "elapsed_time": "0:16:30", "remaining_time": "0:22:42"}
{"current_steps": 130, "total_steps": 297, "loss": 1.1916536331176757, "lr": 1.2588190451025209e-05, "epoch": 0.43844856661045534, "percentage": 43.77, "elapsed_time": "0:17:11", "remaining_time": "0:22:05"}
{"current_steps": 135, "total_steps": 297, "loss": 1.049894142150879, "lr": 1.205777210692235e-05, "epoch": 0.45531197301854975, "percentage": 45.45, "elapsed_time": "0:17:51", "remaining_time": "0:21:26"}
{"current_steps": 140, "total_steps": 297, "loss": 1.4272873878479004, "lr": 1.1521233861899168e-05, "epoch": 0.47217537942664417, "percentage": 47.14, "elapsed_time": "0:18:32", "remaining_time": "0:20:47"}
{"current_steps": 145, "total_steps": 297, "loss": 1.1360230445861816, "lr": 1.098017140329561e-05, "epoch": 0.48903878583473864, "percentage": 48.82, "elapsed_time": "0:19:12", "remaining_time": "0:20:07"}
{"current_steps": 150, "total_steps": 297, "loss": 1.2251985549926758, "lr": 1.0436193873653362e-05, "epoch": 0.5059021922428331, "percentage": 50.51, "elapsed_time": "0:19:50", "remaining_time": "0:19:26"}
{"current_steps": 155, "total_steps": 297, "loss": 1.2744477272033692, "lr": 9.890919085058179e-06, "epoch": 0.5227655986509275, "percentage": 52.19, "elapsed_time": "0:20:29", "remaining_time": "0:18:46"}
{"current_steps": 160, "total_steps": 297, "loss": 1.2714393615722657, "lr": 9.34596870769857e-06, "epoch": 0.5396290050590219, "percentage": 53.87, "elapsed_time": "0:21:08", "remaining_time": "0:18:05"}
{"current_steps": 165, "total_steps": 297, "loss": 1.019619846343994, "lr": 8.802963446950378e-06, "epoch": 0.5564924114671164, "percentage": 55.56, "elapsed_time": "0:21:47", "remaining_time": "0:17:25"}
{"current_steps": 170, "total_steps": 297, "loss": 0.9829767227172852, "lr": 8.263518223330698e-06, "epoch": 0.5733558178752108, "percentage": 57.24, "elapsed_time": "0:22:28", "remaining_time": "0:16:47"}
{"current_steps": 175, "total_steps": 297, "loss": 1.5283356666564942, "lr": 7.72923736965627e-06, "epoch": 0.5902192242833052, "percentage": 58.92, "elapsed_time": "0:23:08", "remaining_time": "0:16:07"}
{"current_steps": 180, "total_steps": 297, "loss": 1.0275829315185547, "lr": 7.201709859690081e-06, "epoch": 0.6070826306913997, "percentage": 60.61, "elapsed_time": "0:23:49", "remaining_time": "0:15:29"}
{"current_steps": 185, "total_steps": 297, "loss": 1.1475248336791992, "lr": 6.682504582466482e-06, "epoch": 0.6239460370994941, "percentage": 62.29, "elapsed_time": "0:24:28", "remaining_time": "0:14:48"}
{"current_steps": 190, "total_steps": 297, "loss": 1.0172494888305663, "lr": 6.173165676349103e-06, "epoch": 0.6408094435075885, "percentage": 63.97, "elapsed_time": "0:25:06", "remaining_time": "0:14:08"}
{"current_steps": 195, "total_steps": 297, "loss": 1.176294994354248, "lr": 5.675207936698337e-06, "epoch": 0.657672849915683, "percentage": 65.66, "elapsed_time": "0:25:47", "remaining_time": "0:13:29"}
{"current_steps": 200, "total_steps": 297, "loss": 1.2884156227111816, "lr": 5.190112310806126e-06, "epoch": 0.6745362563237775, "percentage": 67.34, "elapsed_time": "0:26:25", "remaining_time": "0:12:48"}
{"current_steps": 205, "total_steps": 297, "loss": 1.2367602348327638, "lr": 4.7193214934963204e-06, "epoch": 0.6913996627318718, "percentage": 69.02, "elapsed_time": "0:27:03", "remaining_time": "0:12:08"}
{"current_steps": 210, "total_steps": 297, "loss": 1.2425697326660157, "lr": 4.264235636489542e-06, "epoch": 0.7082630691399663, "percentage": 70.71, "elapsed_time": "0:27:44", "remaining_time": "0:11:29"}
{"current_steps": 215, "total_steps": 297, "loss": 1.0178656578063965, "lr": 3.826208184292952e-06, "epoch": 0.7251264755480608, "percentage": 72.39, "elapsed_time": "0:28:24", "remaining_time": "0:10:50"}
{"current_steps": 220, "total_steps": 297, "loss": 1.4105095863342285, "lr": 3.4065418489993118e-06, "epoch": 0.7419898819561551, "percentage": 74.07, "elapsed_time": "0:29:05", "remaining_time": "0:10:10"}
{"current_steps": 225, "total_steps": 297, "loss": 1.2955214500427246, "lr": 3.0064847359663284e-06, "epoch": 0.7588532883642496, "percentage": 75.76, "elapsed_time": "0:29:42", "remaining_time": "0:09:30"}
{"current_steps": 230, "total_steps": 297, "loss": 1.0158836364746093, "lr": 2.6272266318987606e-06, "epoch": 0.7757166947723441, "percentage": 77.44, "elapsed_time": "0:30:21", "remaining_time": "0:08:50"}
{"current_steps": 235, "total_steps": 297, "loss": 1.2233789443969727, "lr": 2.26989546637263e-06, "epoch": 0.7925801011804384, "percentage": 79.12, "elapsed_time": "0:31:03", "remaining_time": "0:08:11"}
{"current_steps": 240, "total_steps": 297, "loss": 1.1834559440612793, "lr": 1.9355539573251737e-06, "epoch": 0.8094435075885329, "percentage": 80.81, "elapsed_time": "0:31:42", "remaining_time": "0:07:31"}
{"current_steps": 245, "total_steps": 297, "loss": 1.0230623245239259, "lr": 1.6251964504869221e-06, "epoch": 0.8263069139966274, "percentage": 82.49, "elapsed_time": "0:32:22", "remaining_time": "0:06:52"}
{"current_steps": 250, "total_steps": 297, "loss": 1.103525447845459, "lr": 1.339745962155613e-06, "epoch": 0.8431703204047217, "percentage": 84.18, "elapsed_time": "0:33:04", "remaining_time": "0:06:13"}
{"current_steps": 255, "total_steps": 297, "loss": 0.9862545013427735, "lr": 1.0800514341068592e-06, "epoch": 0.8600337268128162, "percentage": 85.86, "elapsed_time": "0:33:44", "remaining_time": "0:05:33"}
{"current_steps": 260, "total_steps": 297, "loss": 1.7211034774780274, "lr": 8.468852088055291e-07, "epoch": 0.8768971332209107, "percentage": 87.54, "elapsed_time": "0:34:19", "remaining_time": "0:04:53"}
{"current_steps": 265, "total_steps": 297, "loss": 1.0896631240844727, "lr": 6.409407324267448e-07, "epoch": 0.893760539629005, "percentage": 89.23, "elapsed_time": "0:34:59", "remaining_time": "0:04:13"}
{"current_steps": 270, "total_steps": 297, "loss": 1.114693832397461, "lr": 4.628304925177318e-07, "epoch": 0.9106239460370995, "percentage": 90.91, "elapsed_time": "0:35:38", "remaining_time": "0:03:33"}
{"current_steps": 275, "total_steps": 297, "loss": 1.1860212326049804, "lr": 3.1308419643406915e-07, "epoch": 0.927487352445194, "percentage": 92.59, "elapsed_time": "0:36:18", "remaining_time": "0:02:54"}
{"current_steps": 280, "total_steps": 297, "loss": 1.1702337265014648, "lr": 1.921471959676957e-07, "epoch": 0.9443507588532883, "percentage": 94.28, "elapsed_time": "0:36:55", "remaining_time": "0:02:14"}
{"current_steps": 285, "total_steps": 297, "loss": 1.0407076835632325, "lr": 1.0037916285192129e-07, "epoch": 0.9612141652613828, "percentage": 95.96, "elapsed_time": "0:37:34", "remaining_time": "0:01:34"}
{"current_steps": 290, "total_steps": 297, "loss": 1.326705265045166, "lr": 3.805301908254455e-08, "epoch": 0.9780775716694773, "percentage": 97.64, "elapsed_time": "0:38:14", "remaining_time": "0:00:55"}
{"current_steps": 295, "total_steps": 297, "loss": 1.308372402191162, "lr": 5.354125236343155e-09, "epoch": 0.9949409780775716, "percentage": 99.33, "elapsed_time": "0:38:52", "remaining_time": "0:00:15"}
{"current_steps": 297, "total_steps": 297, "epoch": 1.0, "percentage": 100.0, "elapsed_time": "0:39:06", "remaining_time": "0:00:00"}

456
trainer_state.json Normal file
View File

@@ -0,0 +1,456 @@
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 297,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.016863406408094434,
"grad_norm": 38.5,
"learning_rate": 8.888888888888888e-06,
"loss": 2.3417264938354494,
"step": 5
},
{
"epoch": 0.03372681281618887,
"grad_norm": 9.875,
"learning_rate": 2e-05,
"loss": 1.7059539794921874,
"step": 10
},
{
"epoch": 0.050590219224283306,
"grad_norm": 9.875,
"learning_rate": 1.9985129789397633e-05,
"loss": 1.7476335525512696,
"step": 15
},
{
"epoch": 0.06745362563237774,
"grad_norm": 6.78125,
"learning_rate": 1.9940563382223196e-05,
"loss": 1.5680081367492675,
"step": 20
},
{
"epoch": 0.08431703204047218,
"grad_norm": 8.375,
"learning_rate": 1.9866433320848793e-05,
"loss": 1.347496223449707,
"step": 25
},
{
"epoch": 0.10118043844856661,
"grad_norm": 8.5625,
"learning_rate": 1.9762960071199334e-05,
"loss": 1.2069475173950195,
"step": 30
},
{
"epoch": 0.11804384485666104,
"grad_norm": 5.8125,
"learning_rate": 1.963045136707763e-05,
"loss": 1.324411678314209,
"step": 35
},
{
"epoch": 0.13490725126475547,
"grad_norm": 5.90625,
"learning_rate": 1.946930129495106e-05,
"loss": 1.165403175354004,
"step": 40
},
{
"epoch": 0.15177065767284992,
"grad_norm": 5.96875,
"learning_rate": 1.9279989121921846e-05,
"loss": 1.2257371902465821,
"step": 45
},
{
"epoch": 0.16863406408094436,
"grad_norm": 9.4375,
"learning_rate": 1.9063077870366504e-05,
"loss": 1.234571933746338,
"step": 50
},
{
"epoch": 0.18549747048903878,
"grad_norm": 6.75,
"learning_rate": 1.881921264348355e-05,
"loss": 1.3958836555480958,
"step": 55
},
{
"epoch": 0.20236087689713322,
"grad_norm": 6.5625,
"learning_rate": 1.854911870672947e-05,
"loss": 1.0263965606689454,
"step": 60
},
{
"epoch": 0.21922428330522767,
"grad_norm": 4.15625,
"learning_rate": 1.8253599330848638e-05,
"loss": 1.228264617919922,
"step": 65
},
{
"epoch": 0.23608768971332209,
"grad_norm": 7.21875,
"learning_rate": 1.7933533402912354e-05,
"loss": 1.250452423095703,
"step": 70
},
{
"epoch": 0.25295109612141653,
"grad_norm": 5.5,
"learning_rate": 1.758987281247162e-05,
"loss": 1.2329339027404784,
"step": 75
},
{
"epoch": 0.26981450252951095,
"grad_norm": 7.5,
"learning_rate": 1.7223639620597556e-05,
"loss": 1.2469540596008302,
"step": 80
},
{
"epoch": 0.2866779089376054,
"grad_norm": 6.84375,
"learning_rate": 1.6835923020228714e-05,
"loss": 1.0711227416992188,
"step": 85
},
{
"epoch": 0.30354131534569984,
"grad_norm": 6.8125,
"learning_rate": 1.6427876096865394e-05,
"loss": 1.6063650131225586,
"step": 90
},
{
"epoch": 0.32040472175379425,
"grad_norm": 6.75,
"learning_rate": 1.6000712399244813e-05,
"loss": 1.1470824241638184,
"step": 95
},
{
"epoch": 0.3372681281618887,
"grad_norm": 6.3125,
"learning_rate": 1.5555702330196024e-05,
"loss": 1.255699348449707,
"step": 100
},
{
"epoch": 0.35413153456998314,
"grad_norm": 6.09375,
"learning_rate": 1.509416936840842e-05,
"loss": 1.0055023193359376,
"step": 105
},
{
"epoch": 0.37099494097807756,
"grad_norm": 2.96875,
"learning_rate": 1.4617486132350343e-05,
"loss": 1.4475191116333008,
"step": 110
},
{
"epoch": 0.38785834738617203,
"grad_norm": 6.4375,
"learning_rate": 1.4127070298043949e-05,
"loss": 1.1591588973999023,
"step": 115
},
{
"epoch": 0.40472175379426645,
"grad_norm": 7.65625,
"learning_rate": 1.3624380382837017e-05,
"loss": 1.1827627182006837,
"step": 120
},
{
"epoch": 0.42158516020236086,
"grad_norm": 7.90625,
"learning_rate": 1.3110911407710909e-05,
"loss": 1.4125149726867676,
"step": 125
},
{
"epoch": 0.43844856661045534,
"grad_norm": 6.3125,
"learning_rate": 1.2588190451025209e-05,
"loss": 1.1916536331176757,
"step": 130
},
{
"epoch": 0.45531197301854975,
"grad_norm": 7.5625,
"learning_rate": 1.205777210692235e-05,
"loss": 1.049894142150879,
"step": 135
},
{
"epoch": 0.47217537942664417,
"grad_norm": 6.4375,
"learning_rate": 1.1521233861899168e-05,
"loss": 1.4272873878479004,
"step": 140
},
{
"epoch": 0.48903878583473864,
"grad_norm": 7.71875,
"learning_rate": 1.098017140329561e-05,
"loss": 1.1360230445861816,
"step": 145
},
{
"epoch": 0.5059021922428331,
"grad_norm": 6.78125,
"learning_rate": 1.0436193873653362e-05,
"loss": 1.2251985549926758,
"step": 150
},
{
"epoch": 0.5227655986509275,
"grad_norm": 8.5,
"learning_rate": 9.890919085058179e-06,
"loss": 1.2744477272033692,
"step": 155
},
{
"epoch": 0.5396290050590219,
"grad_norm": 7.34375,
"learning_rate": 9.34596870769857e-06,
"loss": 1.2714393615722657,
"step": 160
},
{
"epoch": 0.5564924114671164,
"grad_norm": 5.15625,
"learning_rate": 8.802963446950378e-06,
"loss": 1.019619846343994,
"step": 165
},
{
"epoch": 0.5733558178752108,
"grad_norm": 6.4375,
"learning_rate": 8.263518223330698e-06,
"loss": 0.9829767227172852,
"step": 170
},
{
"epoch": 0.5902192242833052,
"grad_norm": 6.9375,
"learning_rate": 7.72923736965627e-06,
"loss": 1.5283356666564942,
"step": 175
},
{
"epoch": 0.6070826306913997,
"grad_norm": 7.0,
"learning_rate": 7.201709859690081e-06,
"loss": 1.0275829315185547,
"step": 180
},
{
"epoch": 0.6239460370994941,
"grad_norm": 3.703125,
"learning_rate": 6.682504582466482e-06,
"loss": 1.1475248336791992,
"step": 185
},
{
"epoch": 0.6408094435075885,
"grad_norm": 10.125,
"learning_rate": 6.173165676349103e-06,
"loss": 1.0172494888305663,
"step": 190
},
{
"epoch": 0.657672849915683,
"grad_norm": 8.0625,
"learning_rate": 5.675207936698337e-06,
"loss": 1.176294994354248,
"step": 195
},
{
"epoch": 0.6745362563237775,
"grad_norm": 6.8125,
"learning_rate": 5.190112310806126e-06,
"loss": 1.2884156227111816,
"step": 200
},
{
"epoch": 0.6913996627318718,
"grad_norm": 7.375,
"learning_rate": 4.7193214934963204e-06,
"loss": 1.2367602348327638,
"step": 205
},
{
"epoch": 0.7082630691399663,
"grad_norm": 5.8125,
"learning_rate": 4.264235636489542e-06,
"loss": 1.2425697326660157,
"step": 210
},
{
"epoch": 0.7251264755480608,
"grad_norm": 5.5625,
"learning_rate": 3.826208184292952e-06,
"loss": 1.0178656578063965,
"step": 215
},
{
"epoch": 0.7419898819561551,
"grad_norm": 4.125,
"learning_rate": 3.4065418489993118e-06,
"loss": 1.4105095863342285,
"step": 220
},
{
"epoch": 0.7588532883642496,
"grad_norm": 3.625,
"learning_rate": 3.0064847359663284e-06,
"loss": 1.2955214500427246,
"step": 225
},
{
"epoch": 0.7757166947723441,
"grad_norm": 6.5625,
"learning_rate": 2.6272266318987606e-06,
"loss": 1.0158836364746093,
"step": 230
},
{
"epoch": 0.7925801011804384,
"grad_norm": 5.8125,
"learning_rate": 2.26989546637263e-06,
"loss": 1.2233789443969727,
"step": 235
},
{
"epoch": 0.8094435075885329,
"grad_norm": 5.0625,
"learning_rate": 1.9355539573251737e-06,
"loss": 1.1834559440612793,
"step": 240
},
{
"epoch": 0.8263069139966274,
"grad_norm": 7.4375,
"learning_rate": 1.6251964504869221e-06,
"loss": 1.0230623245239259,
"step": 245
},
{
"epoch": 0.8431703204047217,
"grad_norm": 5.21875,
"learning_rate": 1.339745962155613e-06,
"loss": 1.103525447845459,
"step": 250
},
{
"epoch": 0.8600337268128162,
"grad_norm": 5.03125,
"learning_rate": 1.0800514341068592e-06,
"loss": 0.9862545013427735,
"step": 255
},
{
"epoch": 0.8768971332209107,
"grad_norm": 3.734375,
"learning_rate": 8.468852088055291e-07,
"loss": 1.7211034774780274,
"step": 260
},
{
"epoch": 0.893760539629005,
"grad_norm": 8.0625,
"learning_rate": 6.409407324267448e-07,
"loss": 1.0896631240844727,
"step": 265
},
{
"epoch": 0.9106239460370995,
"grad_norm": 5.8125,
"learning_rate": 4.628304925177318e-07,
"loss": 1.114693832397461,
"step": 270
},
{
"epoch": 0.927487352445194,
"grad_norm": 7.8125,
"learning_rate": 3.1308419643406915e-07,
"loss": 1.1860212326049804,
"step": 275
},
{
"epoch": 0.9443507588532883,
"grad_norm": 6.84375,
"learning_rate": 1.921471959676957e-07,
"loss": 1.1702337265014648,
"step": 280
},
{
"epoch": 0.9612141652613828,
"grad_norm": 6.46875,
"learning_rate": 1.0037916285192129e-07,
"loss": 1.0407076835632325,
"step": 285
},
{
"epoch": 0.9780775716694773,
"grad_norm": 7.40625,
"learning_rate": 3.805301908254455e-08,
"loss": 1.326705265045166,
"step": 290
},
{
"epoch": 0.9949409780775716,
"grad_norm": 5.09375,
"learning_rate": 5.354125236343155e-09,
"loss": 1.308372402191162,
"step": 295
},
{
"epoch": 1.0,
"step": 297,
"total_flos": 1.4163205452745114e+17,
"train_loss": 1.2549793832631224,
"train_runtime": 2346.2604,
"train_samples_per_second": 0.505,
"train_steps_per_second": 0.127
}
],
"logging_steps": 5,
"max_steps": 297,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.4163205452745114e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}

3
training_args.bin Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:c7113eab0106929dfb2715cbf469774ad1964bc45464b8bd545fa0bec3efa581
size 6033

BIN
training_loss.png Normal file

Binary file not shown.

After

Width:  |  Height:  |  Size: 51 KiB