初始化项目,由ModelHub XC社区提供模型

Model: lldois/v17_item_caption_cot_lr13e6
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-07-19 05:08:10 +08:00
commit 07ab8ea5e2
16 changed files with 3220 additions and 0 deletions

36
.gitattributes vendored Normal file
View File

@@ -0,0 +1,36 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bin filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ckpt filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.mlmodel filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.npy filter=lfs diff=lfs merge=lfs -text
*.npz filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pickle filter=lfs diff=lfs merge=lfs -text
*.pkl filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
*.safetensors filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tar filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.wasm filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text
tokenizer.json filter=lfs diff=lfs merge=lfs -text

58
README.md Normal file
View File

@@ -0,0 +1,58 @@
---
library_name: transformers
license: other
base_model: OpenOneRec/OneReason-0.8B-pretrain-competition
tags:
- llama-factory
- full
- generated_from_trainer
model-index:
- name: v17_item_caption_cot_lr13e6
results: []
---
<!-- This model card has been generated automatically according to the information the Trainer had access to. You
should probably proofread and complete it, then remove this comment. -->
# v17_item_caption_cot_lr13e6
This model is a fine-tuned version of [OpenOneRec/OneReason-0.8B-pretrain-competition](https://huggingface.co/OpenOneRec/OneReason-0.8B-pretrain-competition) on the exp_item_caption_cot dataset.
## Model description
More information needed
## Intended uses & limitations
More information needed
## Training and evaluation data
More information needed
## Training procedure
### Training hyperparameters
The following hyperparameters were used during training:
- learning_rate: 1.3e-05
- train_batch_size: 1
- eval_batch_size: 8
- seed: 202607173
- gradient_accumulation_steps: 4
- total_train_batch_size: 4
- optimizer: Use OptimizerNames.ADAMW_TORCH with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
- lr_scheduler_type: cosine
- lr_scheduler_warmup_steps: 0.03
- num_epochs: 1
### Training results
### Framework versions
- Transformers 5.6.0
- Pytorch 2.7.1+cu126
- Datasets 4.0.0
- Tokenizers 0.22.2

8
all_results.json Normal file
View File

@@ -0,0 +1,8 @@
{
"epoch": 1.0,
"total_flos": 2.0218118019963494e+17,
"train_loss": 1.6924350921143876,
"train_runtime": 3361.2318,
"train_samples_per_second": 0.502,
"train_steps_per_second": 0.126
}

89
chat_template.jinja Normal file
View File

@@ -0,0 +1,89 @@
{%- if tools %}
{{- '<|im_start|>system\n' }}
{%- if messages[0].role == 'system' %}
{{- messages[0].content + '\n\n' }}
{%- endif %}
{{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within <tools></tools> XML tags:\n<tools>" }}
{%- for tool in tools %}
{{- "\n" }}
{{- tool | tojson }}
{%- endfor %}
{{- "\n</tools>\n\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\n<tool_call>\n{\"name\": <function-name>, \"arguments\": <args-json-object>}\n</tool_call><|im_end|>\n" }}
{%- else %}
{%- if messages[0].role == 'system' %}
{{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }}
{%- endif %}
{%- endif %}
{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
{%- for message in messages[::-1] %}
{%- set index = (messages|length - 1) - loop.index0 %}
{%- if ns.multi_step_tool and message.role == "user" and message.content is string and not(message.content.startswith('<tool_response>') and message.content.endswith('</tool_response>')) %}
{%- set ns.multi_step_tool = false %}
{%- set ns.last_query_index = index %}
{%- endif %}
{%- endfor %}
{%- for message in messages %}
{%- if message.content is string %}
{%- set content = message.content %}
{%- else %}
{%- set content = '' %}
{%- endif %}
{%- if (message.role == "user") or (message.role == "system" and not loop.first) %}
{{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
{%- elif message.role == "assistant" %}
{%- set reasoning_content = '' %}
{%- if message.reasoning_content is string %}
{%- set reasoning_content = message.reasoning_content %}
{%- else %}
{%- if '</think>' in content %}
{%- set reasoning_content = content.split('</think>')[0].rstrip('\n').split('<think>')[-1].lstrip('\n') %}
{%- set content = content.split('</think>')[-1].lstrip('\n') %}
{%- endif %}
{%- endif %}
{%- if loop.index0 > ns.last_query_index %}
{%- if loop.last or (not loop.last and reasoning_content) %}
{{- '<|im_start|>' + message.role + '\n<think>\n' + reasoning_content.strip('\n') + '\n</think>\n\n' + content.lstrip('\n') }}
{%- else %}
{{- '<|im_start|>' + message.role + '\n' + content }}
{%- endif %}
{%- else %}
{{- '<|im_start|>' + message.role + '\n' + content }}
{%- endif %}
{%- if message.tool_calls %}
{%- for tool_call in message.tool_calls %}
{%- if (loop.first and content) or (not loop.first) %}
{{- '\n' }}
{%- endif %}
{%- if tool_call.function %}
{%- set tool_call = tool_call.function %}
{%- endif %}
{{- '<tool_call>\n{"name": "' }}
{{- tool_call.name }}
{{- '", "arguments": ' }}
{%- if tool_call.arguments is string %}
{{- tool_call.arguments }}
{%- else %}
{{- tool_call.arguments | tojson }}
{%- endif %}
{{- '}\n</tool_call>' }}
{%- endfor %}
{%- endif %}
{{- '<|im_end|>\n' }}
{%- elif message.role == "tool" %}
{%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
{{- '<|im_start|>user' }}
{%- endif %}
{{- '\n<tool_response>\n' }}
{{- content }}
{{- '\n</tool_response>' }}
{%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
{{- '<|im_end|>\n' }}
{%- endif %}
{%- endif %}
{%- endfor %}
{%- if add_generation_prompt %}
{{- '<|im_start|>assistant\n' }}
{%- if enable_thinking is defined and enable_thinking is false %}
{{- '<think>\n\n</think>\n\n' }}
{%- endif %}
{%- endif %}

63
config.json Normal file
View File

@@ -0,0 +1,63 @@
{
"architectures": [
"Qwen3ForCausalLM"
],
"attention_bias": false,
"attention_dropout": 0.0,
"bos_token_id": null,
"dtype": "bfloat16",
"eos_token_id": 151645,
"head_dim": 128,
"hidden_act": "silu",
"hidden_size": 1024,
"initializer_range": 0.02,
"intermediate_size": 3072,
"layer_types": [
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention"
],
"max_position_embeddings": 40960,
"max_window_layers": 28,
"model_type": "qwen3",
"num_attention_heads": 16,
"num_hidden_layers": 28,
"num_key_value_heads": 8,
"pad_token_id": 151643,
"rms_norm_eps": 1e-06,
"rope_parameters": {
"rope_theta": 1000000,
"rope_type": "default"
},
"sliding_window": null,
"tie_word_embeddings": false,
"transformers_version": "5.6.0",
"use_cache": false,
"use_sliding_window": false,
"vocab_size": 176253
}

12
generation_config.json Normal file
View File

@@ -0,0 +1,12 @@
{
"do_sample": true,
"eos_token_id": [
151645,
151643
],
"pad_token_id": 151643,
"temperature": 0.6,
"top_k": 20,
"top_p": 0.95,
"transformers_version": "5.6.0"
}

3
model.safetensors Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:fa3aae4d2c25bdbbb6600452553b9d069270d0d76733acc50d83c073cf16c116
size 1602902832

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:d804af73d9aad5d8c36ca91f847cce44c7d73052dd5f96ea109d4870ef2bdcd3
size 23915

3
tokenizer.json Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:cd4d15f596979aecbc11ba12668cb21c9fb8452ce1235cd9d7878cc950170421
size 16016554

16
tokenizer_config.json Normal file
View File

@@ -0,0 +1,16 @@
{
"add_prefix_space": false,
"backend": "tokenizers",
"bos_token": null,
"clean_up_tokenization_spaces": false,
"eos_token": "<|im_end|>",
"errors": "replace",
"is_local": false,
"local_files_only": false,
"model_max_length": 131072,
"pad_token": "<|endoftext|>",
"padding_side": "right",
"split_special_tokens": false,
"tokenizer_class": "Qwen2Tokenizer",
"unk_token": null
}

2202
train.log Normal file

File diff suppressed because one or more lines are too long

8
train_results.json Normal file
View File

@@ -0,0 +1,8 @@
{
"epoch": 1.0,
"total_flos": 2.0218118019963494e+17,
"train_loss": 1.6924350921143876,
"train_runtime": 3361.2318,
"train_samples_per_second": 0.502,
"train_steps_per_second": 0.126
}

85
trainer_log.jsonl Normal file
View File

@@ -0,0 +1,85 @@
{"current_steps": 5, "total_steps": 423, "loss": 2.976611328125, "lr": 4e-06, "epoch": 0.011841326228537596, "percentage": 1.18, "elapsed_time": "0:00:40", "remaining_time": "0:56:41"}
{"current_steps": 10, "total_steps": 423, "loss": 2.77978572845459, "lr": 8.999999999999999e-06, "epoch": 0.023682652457075192, "percentage": 2.36, "elapsed_time": "0:01:20", "remaining_time": "0:55:39"}
{"current_steps": 15, "total_steps": 423, "loss": 2.5306840896606446, "lr": 1.2999809184667674e-05, "epoch": 0.035523978685612786, "percentage": 3.55, "elapsed_time": "0:01:58", "remaining_time": "0:53:45"}
{"current_steps": 20, "total_steps": 423, "loss": 2.2824148178100585, "lr": 1.2993131824301589e-05, "epoch": 0.047365304914150384, "percentage": 4.73, "elapsed_time": "0:02:38", "remaining_time": "0:53:20"}
{"current_steps": 25, "total_steps": 423, "loss": 2.1631048202514647, "lr": 1.297692489759098e-05, "epoch": 0.05920663114268798, "percentage": 5.91, "elapsed_time": "0:03:19", "remaining_time": "0:52:49"}
{"current_steps": 30, "total_steps": 423, "loss": 2.0169919967651366, "lr": 1.2951212190435705e-05, "epoch": 0.07104795737122557, "percentage": 7.09, "elapsed_time": "0:04:00", "remaining_time": "0:52:35"}
{"current_steps": 35, "total_steps": 423, "loss": 1.9718114852905273, "lr": 1.2916031439779258e-05, "epoch": 0.08288928359976318, "percentage": 8.27, "elapsed_time": "0:04:40", "remaining_time": "0:51:52"}
{"current_steps": 40, "total_steps": 423, "loss": 1.9569698333740235, "lr": 1.2871434278224593e-05, "epoch": 0.09473060982830077, "percentage": 9.46, "elapsed_time": "0:05:21", "remaining_time": "0:51:14"}
{"current_steps": 45, "total_steps": 423, "loss": 1.889408493041992, "lr": 1.281748615825617e-05, "epoch": 0.10657193605683836, "percentage": 10.64, "elapsed_time": "0:05:57", "remaining_time": "0:50:04"}
{"current_steps": 50, "total_steps": 423, "loss": 1.8037897109985352, "lr": 1.2754266256179397e-05, "epoch": 0.11841326228537596, "percentage": 11.82, "elapsed_time": "0:06:39", "remaining_time": "0:49:37"}
{"current_steps": 55, "total_steps": 423, "loss": 1.820526123046875, "lr": 1.2681867355918499e-05, "epoch": 0.13025458851391356, "percentage": 13.0, "elapsed_time": "0:07:16", "remaining_time": "0:48:40"}
{"current_steps": 60, "total_steps": 423, "loss": 1.7561323165893554, "lr": 1.2600395712843294e-05, "epoch": 0.14209591474245115, "percentage": 14.18, "elapsed_time": "0:07:56", "remaining_time": "0:48:04"}
{"current_steps": 65, "total_steps": 423, "loss": 1.813785934448242, "lr": 1.2509970897824807e-05, "epoch": 0.15393724097098876, "percentage": 15.37, "elapsed_time": "0:08:35", "remaining_time": "0:47:20"}
{"current_steps": 70, "total_steps": 423, "loss": 1.7308807373046875, "lr": 1.241072562174851e-05, "epoch": 0.16577856719952636, "percentage": 16.55, "elapsed_time": "0:09:13", "remaining_time": "0:46:32"}
{"current_steps": 75, "total_steps": 423, "loss": 1.6870466232299806, "lr": 1.230280554074281e-05, "epoch": 0.17761989342806395, "percentage": 17.73, "elapsed_time": "0:09:53", "remaining_time": "0:45:56"}
{"current_steps": 80, "total_steps": 423, "loss": 1.6947086334228516, "lr": 1.218636904240859e-05, "epoch": 0.18946121965660154, "percentage": 18.91, "elapsed_time": "0:10:35", "remaining_time": "0:45:25"}
{"current_steps": 85, "total_steps": 423, "loss": 1.6740726470947265, "lr": 1.2061587013363553e-05, "epoch": 0.20130254588513913, "percentage": 20.09, "elapsed_time": "0:11:17", "remaining_time": "0:44:55"}
{"current_steps": 90, "total_steps": 423, "loss": 1.6932085037231446, "lr": 1.1928642588442567e-05, "epoch": 0.21314387211367672, "percentage": 21.28, "elapsed_time": "0:11:57", "remaining_time": "0:44:13"}
{"current_steps": 95, "total_steps": 423, "loss": 1.6984859466552735, "lr": 1.1787730881922022e-05, "epoch": 0.22498519834221434, "percentage": 22.46, "elapsed_time": "0:12:37", "remaining_time": "0:43:35"}
{"current_steps": 100, "total_steps": 423, "loss": 1.6615169525146485, "lr": 1.1639058701162737e-05, "epoch": 0.23682652457075193, "percentage": 23.64, "elapsed_time": "0:13:18", "remaining_time": "0:42:59"}
{"current_steps": 105, "total_steps": 423, "loss": 1.629263687133789, "lr": 1.1482844243091624e-05, "epoch": 0.24866785079928952, "percentage": 24.82, "elapsed_time": "0:13:59", "remaining_time": "0:42:22"}
{"current_steps": 110, "total_steps": 423, "loss": 1.7143014907836913, "lr": 1.1319316773967625e-05, "epoch": 0.2605091770278271, "percentage": 26.0, "elapsed_time": "0:14:38", "remaining_time": "0:41:39"}
{"current_steps": 115, "total_steps": 423, "loss": 1.648763656616211, "lr": 1.1148716292901853e-05, "epoch": 0.27235050325636473, "percentage": 27.19, "elapsed_time": "0:15:15", "remaining_time": "0:40:52"}
{"current_steps": 120, "total_steps": 423, "loss": 1.6492090225219727, "lr": 1.0971293179625803e-05, "epoch": 0.2841918294849023, "percentage": 28.37, "elapsed_time": "0:15:52", "remaining_time": "0:40:04"}
{"current_steps": 125, "total_steps": 423, "loss": 1.6368392944335937, "lr": 1.0787307827024565e-05, "epoch": 0.2960331557134399, "percentage": 29.55, "elapsed_time": "0:16:33", "remaining_time": "0:39:27"}
{"current_steps": 130, "total_steps": 423, "loss": 1.6719234466552735, "lr": 1.0597030258974366e-05, "epoch": 0.30787448194197753, "percentage": 30.73, "elapsed_time": "0:17:13", "remaining_time": "0:38:48"}
{"current_steps": 135, "total_steps": 423, "loss": 1.6404973983764648, "lr": 1.0400739734045288e-05, "epoch": 0.3197158081705151, "percentage": 31.91, "elapsed_time": "0:17:51", "remaining_time": "0:38:05"}
{"current_steps": 140, "total_steps": 423, "loss": 1.6293134689331055, "lr": 1.0198724335650807e-05, "epoch": 0.3315571343990527, "percentage": 33.1, "elapsed_time": "0:18:30", "remaining_time": "0:37:25"}
{"current_steps": 145, "total_steps": 423, "loss": 1.6447383880615234, "lr": 9.991280549245664e-06, "epoch": 0.3433984606275903, "percentage": 34.28, "elapsed_time": "0:19:11", "remaining_time": "0:36:47"}
{"current_steps": 150, "total_steps": 423, "loss": 1.6770294189453125, "lr": 9.778712827192572e-06, "epoch": 0.3552397868561279, "percentage": 35.46, "elapsed_time": "0:19:50", "remaining_time": "0:36:07"}
{"current_steps": 155, "total_steps": 423, "loss": 1.5788751602172852, "lr": 9.561333141936387e-06, "epoch": 0.36708111308466546, "percentage": 36.64, "elapsed_time": "0:20:30", "remaining_time": "0:35:28"}
{"current_steps": 160, "total_steps": 423, "loss": 1.5903149604797364, "lr": 9.33946052814153e-06, "epoch": 0.3789224393132031, "percentage": 37.83, "elapsed_time": "0:21:11", "remaining_time": "0:34:49"}
{"current_steps": 165, "total_steps": 423, "loss": 1.6232831954956055, "lr": 9.113420614464618e-06, "epoch": 0.3907637655417407, "percentage": 39.01, "elapsed_time": "0:21:49", "remaining_time": "0:34:08"}
{"current_steps": 170, "total_steps": 423, "loss": 1.5795005798339843, "lr": 8.883545145649511e-06, "epoch": 0.40260509177027826, "percentage": 40.19, "elapsed_time": "0:22:30", "remaining_time": "0:33:30"}
{"current_steps": 175, "total_steps": 423, "loss": 1.6659164428710938, "lr": 8.65017149564615e-06, "epoch": 0.4144464179988159, "percentage": 41.37, "elapsed_time": "0:23:10", "remaining_time": "0:32:50"}
{"current_steps": 180, "total_steps": 423, "loss": 1.6965517044067382, "lr": 8.41364217246776e-06, "epoch": 0.42628774422735344, "percentage": 42.55, "elapsed_time": "0:23:49", "remaining_time": "0:32:10"}
{"current_steps": 185, "total_steps": 423, "loss": 1.5858169555664063, "lr": 8.174304315513122e-06, "epoch": 0.43812907045589106, "percentage": 43.74, "elapsed_time": "0:24:29", "remaining_time": "0:31:30"}
{"current_steps": 190, "total_steps": 423, "loss": 1.6201683044433595, "lr": 7.932509186091612e-06, "epoch": 0.4499703966844287, "percentage": 44.92, "elapsed_time": "0:25:06", "remaining_time": "0:30:47"}
{"current_steps": 195, "total_steps": 423, "loss": 1.6074403762817382, "lr": 7.68861165189882e-06, "epoch": 0.46181172291296624, "percentage": 46.1, "elapsed_time": "0:25:46", "remaining_time": "0:30:07"}
{"current_steps": 200, "total_steps": 423, "loss": 1.617002296447754, "lr": 7.442969666199241e-06, "epoch": 0.47365304914150386, "percentage": 47.28, "elapsed_time": "0:26:27", "remaining_time": "0:29:29"}
{"current_steps": 205, "total_steps": 423, "loss": 1.6207464218139649, "lr": 7.195943742480528e-06, "epoch": 0.4854943753700414, "percentage": 48.46, "elapsed_time": "0:27:06", "remaining_time": "0:28:49"}
{"current_steps": 210, "total_steps": 423, "loss": 1.6103069305419921, "lr": 6.94789642535021e-06, "epoch": 0.49733570159857904, "percentage": 49.65, "elapsed_time": "0:27:46", "remaining_time": "0:28:10"}
{"current_steps": 215, "total_steps": 423, "loss": 1.5691112518310546, "lr": 6.6991917584515e-06, "epoch": 0.5091770278271166, "percentage": 50.83, "elapsed_time": "0:28:26", "remaining_time": "0:27:30"}
{"current_steps": 220, "total_steps": 423, "loss": 1.6248830795288085, "lr": 6.450194750179039e-06, "epoch": 0.5210183540556542, "percentage": 52.01, "elapsed_time": "0:29:05", "remaining_time": "0:26:50"}
{"current_steps": 225, "total_steps": 423, "loss": 1.561983585357666, "lr": 6.201270837978755e-06, "epoch": 0.5328596802841918, "percentage": 53.19, "elapsed_time": "0:29:48", "remaining_time": "0:26:13"}
{"current_steps": 230, "total_steps": 423, "loss": 1.588427734375, "lr": 5.952785352018004e-06, "epoch": 0.5447010065127295, "percentage": 54.37, "elapsed_time": "0:30:27", "remaining_time": "0:25:33"}
{"current_steps": 235, "total_steps": 423, "loss": 1.6155115127563477, "lr": 5.705102979013181e-06, "epoch": 0.5565423327412671, "percentage": 55.56, "elapsed_time": "0:31:06", "remaining_time": "0:24:53"}
{"current_steps": 240, "total_steps": 423, "loss": 1.5733617782592773, "lr": 5.458587227001667e-06, "epoch": 0.5683836589698046, "percentage": 56.74, "elapsed_time": "0:31:46", "remaining_time": "0:24:13"}
{"current_steps": 245, "total_steps": 423, "loss": 1.5730903625488282, "lr": 5.213599891843665e-06, "epoch": 0.5802249851983422, "percentage": 57.92, "elapsed_time": "0:32:27", "remaining_time": "0:23:34"}
{"current_steps": 250, "total_steps": 423, "loss": 1.5600762367248535, "lr": 4.970500526236871e-06, "epoch": 0.5920663114268798, "percentage": 59.1, "elapsed_time": "0:33:07", "remaining_time": "0:22:55"}
{"current_steps": 255, "total_steps": 423, "loss": 1.610726547241211, "lr": 4.729645912023323e-06, "epoch": 0.6039076376554174, "percentage": 60.28, "elapsed_time": "0:33:47", "remaining_time": "0:22:15"}
{"current_steps": 260, "total_steps": 423, "loss": 1.5865031242370606, "lr": 4.4913895365628424e-06, "epoch": 0.6157489638839551, "percentage": 61.47, "elapsed_time": "0:34:26", "remaining_time": "0:21:35"}
{"current_steps": 265, "total_steps": 423, "loss": 1.603274154663086, "lr": 4.256081073941585e-06, "epoch": 0.6275902901124926, "percentage": 62.65, "elapsed_time": "0:35:05", "remaining_time": "0:20:55"}
{"current_steps": 270, "total_steps": 423, "loss": 1.600333023071289, "lr": 4.0240658717771024e-06, "epoch": 0.6394316163410302, "percentage": 63.83, "elapsed_time": "0:35:46", "remaining_time": "0:20:16"}
{"current_steps": 275, "total_steps": 423, "loss": 1.5704521179199218, "lr": 3.7956844443730916e-06, "epoch": 0.6512729425695678, "percentage": 65.01, "elapsed_time": "0:36:26", "remaining_time": "0:19:36"}
{"current_steps": 280, "total_steps": 423, "loss": 1.5828316688537598, "lr": 3.5712719729676987e-06, "epoch": 0.6631142687981054, "percentage": 66.19, "elapsed_time": "0:37:06", "remaining_time": "0:18:57"}
{"current_steps": 285, "total_steps": 423, "loss": 1.5770600318908692, "lr": 3.351157813808825e-06, "epoch": 0.6749555950266429, "percentage": 67.38, "elapsed_time": "0:37:46", "remaining_time": "0:18:17"}
{"current_steps": 290, "total_steps": 423, "loss": 1.593960666656494, "lr": 3.1356650147784227e-06, "epoch": 0.6867969212551805, "percentage": 68.56, "elapsed_time": "0:38:24", "remaining_time": "0:17:37"}
{"current_steps": 295, "total_steps": 423, "loss": 1.580451774597168, "lr": 2.9251098412751775e-06, "epoch": 0.6986382474837182, "percentage": 69.74, "elapsed_time": "0:39:04", "remaining_time": "0:16:57"}
{"current_steps": 300, "total_steps": 423, "loss": 1.614090347290039, "lr": 2.719801312051425e-06, "epoch": 0.7104795737122558, "percentage": 70.92, "elapsed_time": "0:39:44", "remaining_time": "0:16:17"}
{"current_steps": 305, "total_steps": 423, "loss": 1.5809415817260741, "lr": 2.5200407456855087e-06, "epoch": 0.7223208999407934, "percentage": 72.1, "elapsed_time": "0:40:24", "remaining_time": "0:15:38"}
{"current_steps": 310, "total_steps": 423, "loss": 1.553083324432373, "lr": 2.3261213183552334e-06, "epoch": 0.7341622261693309, "percentage": 73.29, "elapsed_time": "0:41:06", "remaining_time": "0:14:58"}
{"current_steps": 315, "total_steps": 423, "loss": 1.6024253845214844, "lr": 2.1383276335613797e-06, "epoch": 0.7460035523978685, "percentage": 74.47, "elapsed_time": "0:41:45", "remaining_time": "0:14:18"}
{"current_steps": 320, "total_steps": 423, "loss": 1.5699667930603027, "lr": 1.9569353044328275e-06, "epoch": 0.7578448786264061, "percentage": 75.65, "elapsed_time": "0:42:25", "remaining_time": "0:13:39"}
{"current_steps": 325, "total_steps": 423, "loss": 1.608834457397461, "lr": 1.7822105492262824e-06, "epoch": 0.7696862048549438, "percentage": 76.83, "elapsed_time": "0:43:05", "remaining_time": "0:12:59"}
{"current_steps": 330, "total_steps": 423, "loss": 1.5530618667602538, "lr": 1.614409800614272e-06, "epoch": 0.7815275310834814, "percentage": 78.01, "elapsed_time": "0:43:44", "remaining_time": "0:12:19"}
{"current_steps": 335, "total_steps": 423, "loss": 1.6589471817016601, "lr": 1.4537793293348317e-06, "epoch": 0.7933688573120189, "percentage": 79.2, "elapsed_time": "0:44:21", "remaining_time": "0:11:39"}
{"current_steps": 340, "total_steps": 423, "loss": 1.6034730911254882, "lr": 1.300554882755248e-06, "epoch": 0.8052101835405565, "percentage": 80.38, "elapsed_time": "0:45:00", "remaining_time": "0:10:59"}
{"current_steps": 345, "total_steps": 423, "loss": 1.6377271652221679, "lr": 1.1549613388802793e-06, "epoch": 0.8170515097690941, "percentage": 81.56, "elapsed_time": "0:45:40", "remaining_time": "0:10:19"}
{"current_steps": 350, "total_steps": 423, "loss": 1.6403684616088867, "lr": 1.0172123763126773e-06, "epoch": 0.8288928359976317, "percentage": 82.74, "elapsed_time": "0:46:19", "remaining_time": "0:09:39"}
{"current_steps": 355, "total_steps": 423, "loss": 1.5954139709472657, "lr": 8.875101606503659e-07, "epoch": 0.8407341622261694, "percentage": 83.92, "elapsed_time": "0:46:59", "remaining_time": "0:09:00"}
{"current_steps": 360, "total_steps": 423, "loss": 1.5502955436706543, "lr": 7.660450477805567e-07, "epoch": 0.8525754884547069, "percentage": 85.11, "elapsed_time": "0:47:41", "remaining_time": "0:08:20"}
{"current_steps": 365, "total_steps": 423, "loss": 1.5533514976501466, "lr": 6.529953045062282e-07, "epoch": 0.8644168146832445, "percentage": 86.29, "elapsed_time": "0:48:22", "remaining_time": "0:07:41"}
{"current_steps": 370, "total_steps": 423, "loss": 1.5953169822692872, "lr": 5.485268469150119e-07, "epoch": 0.8762581409117821, "percentage": 87.47, "elapsed_time": "0:49:01", "remaining_time": "0:07:01"}
{"current_steps": 375, "total_steps": 423, "loss": 1.5968003273010254, "lr": 4.5279299687445366e-07, "epoch": 0.8880994671403197, "percentage": 88.65, "elapsed_time": "0:49:41", "remaining_time": "0:06:21"}
{"current_steps": 380, "total_steps": 423, "loss": 1.5658743858337403, "lr": 3.659342570110326e-07, "epoch": 0.8999407933688574, "percentage": 89.83, "elapsed_time": "0:50:22", "remaining_time": "0:05:41"}
{"current_steps": 385, "total_steps": 423, "loss": 1.5887388229370116, "lr": 2.880781045031754e-07, "epoch": 0.9117821195973949, "percentage": 91.02, "elapsed_time": "0:51:02", "remaining_time": "0:05:02"}
{"current_steps": 390, "total_steps": 423, "loss": 1.5834945678710937, "lr": 2.1933880399092585e-07, "epoch": 0.9236234458259325, "percentage": 92.2, "elapsed_time": "0:51:43", "remaining_time": "0:04:22"}
{"current_steps": 395, "total_steps": 423, "loss": 1.5624884605407714, "lr": 1.5981723987682304e-07, "epoch": 0.9354647720544701, "percentage": 93.38, "elapsed_time": "0:52:24", "remaining_time": "0:03:42"}
{"current_steps": 400, "total_steps": 423, "loss": 1.6257368087768556, "lr": 1.09600768264133e-07, "epoch": 0.9473060982830077, "percentage": 94.56, "elapsed_time": "0:53:03", "remaining_time": "0:03:03"}
{"current_steps": 405, "total_steps": 423, "loss": 1.5857719421386718, "lr": 6.876308874971658e-08, "epoch": 0.9591474245115453, "percentage": 95.74, "elapsed_time": "0:53:43", "remaining_time": "0:02:23"}
{"current_steps": 410, "total_steps": 423, "loss": 1.5751670837402343, "lr": 3.736413625971091e-08, "epoch": 0.9709887507400828, "percentage": 96.93, "elapsed_time": "0:54:22", "remaining_time": "0:01:43"}
{"current_steps": 415, "total_steps": 423, "loss": 1.6034950256347655, "lr": 1.544999308676015e-08, "epoch": 0.9828300769686205, "percentage": 98.11, "elapsed_time": "0:55:01", "remaining_time": "0:01:03"}
{"current_steps": 420, "total_steps": 423, "loss": 1.5355438232421874, "lr": 3.052821257894633e-09, "epoch": 0.9946714031971581, "percentage": 99.29, "elapsed_time": "0:55:42", "remaining_time": "0:00:23"}
{"current_steps": 423, "total_steps": 423, "epoch": 1.0, "percentage": 100.0, "elapsed_time": "0:56:01", "remaining_time": "0:00:00"}

631
trainer_state.json Normal file
View File

@@ -0,0 +1,631 @@
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 423,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.011841326228537596,
"grad_norm": 44.75,
"learning_rate": 4e-06,
"loss": 2.976611328125,
"step": 5
},
{
"epoch": 0.023682652457075192,
"grad_norm": 12.25,
"learning_rate": 8.999999999999999e-06,
"loss": 2.77978572845459,
"step": 10
},
{
"epoch": 0.035523978685612786,
"grad_norm": 8.3125,
"learning_rate": 1.2999809184667674e-05,
"loss": 2.5306840896606446,
"step": 15
},
{
"epoch": 0.047365304914150384,
"grad_norm": 5.0625,
"learning_rate": 1.2993131824301589e-05,
"loss": 2.2824148178100585,
"step": 20
},
{
"epoch": 0.05920663114268798,
"grad_norm": 3.453125,
"learning_rate": 1.297692489759098e-05,
"loss": 2.1631048202514647,
"step": 25
},
{
"epoch": 0.07104795737122557,
"grad_norm": 2.953125,
"learning_rate": 1.2951212190435705e-05,
"loss": 2.0169919967651366,
"step": 30
},
{
"epoch": 0.08288928359976318,
"grad_norm": 3.375,
"learning_rate": 1.2916031439779258e-05,
"loss": 1.9718114852905273,
"step": 35
},
{
"epoch": 0.09473060982830077,
"grad_norm": 5.15625,
"learning_rate": 1.2871434278224593e-05,
"loss": 1.9569698333740235,
"step": 40
},
{
"epoch": 0.10657193605683836,
"grad_norm": 2.421875,
"learning_rate": 1.281748615825617e-05,
"loss": 1.889408493041992,
"step": 45
},
{
"epoch": 0.11841326228537596,
"grad_norm": 3.40625,
"learning_rate": 1.2754266256179397e-05,
"loss": 1.8037897109985352,
"step": 50
},
{
"epoch": 0.13025458851391356,
"grad_norm": 3.953125,
"learning_rate": 1.2681867355918499e-05,
"loss": 1.820526123046875,
"step": 55
},
{
"epoch": 0.14209591474245115,
"grad_norm": 2.4375,
"learning_rate": 1.2600395712843294e-05,
"loss": 1.7561323165893554,
"step": 60
},
{
"epoch": 0.15393724097098876,
"grad_norm": 2.703125,
"learning_rate": 1.2509970897824807e-05,
"loss": 1.813785934448242,
"step": 65
},
{
"epoch": 0.16577856719952636,
"grad_norm": 2.3125,
"learning_rate": 1.241072562174851e-05,
"loss": 1.7308807373046875,
"step": 70
},
{
"epoch": 0.17761989342806395,
"grad_norm": 2.453125,
"learning_rate": 1.230280554074281e-05,
"loss": 1.6870466232299806,
"step": 75
},
{
"epoch": 0.18946121965660154,
"grad_norm": 2.78125,
"learning_rate": 1.218636904240859e-05,
"loss": 1.6947086334228516,
"step": 80
},
{
"epoch": 0.20130254588513913,
"grad_norm": 3.46875,
"learning_rate": 1.2061587013363553e-05,
"loss": 1.6740726470947265,
"step": 85
},
{
"epoch": 0.21314387211367672,
"grad_norm": 2.09375,
"learning_rate": 1.1928642588442567e-05,
"loss": 1.6932085037231446,
"step": 90
},
{
"epoch": 0.22498519834221434,
"grad_norm": 2.078125,
"learning_rate": 1.1787730881922022e-05,
"loss": 1.6984859466552735,
"step": 95
},
{
"epoch": 0.23682652457075193,
"grad_norm": 3.328125,
"learning_rate": 1.1639058701162737e-05,
"loss": 1.6615169525146485,
"step": 100
},
{
"epoch": 0.24866785079928952,
"grad_norm": 2.0625,
"learning_rate": 1.1482844243091624e-05,
"loss": 1.629263687133789,
"step": 105
},
{
"epoch": 0.2605091770278271,
"grad_norm": 2.015625,
"learning_rate": 1.1319316773967625e-05,
"loss": 1.7143014907836913,
"step": 110
},
{
"epoch": 0.27235050325636473,
"grad_norm": 2.0625,
"learning_rate": 1.1148716292901853e-05,
"loss": 1.648763656616211,
"step": 115
},
{
"epoch": 0.2841918294849023,
"grad_norm": 2.1875,
"learning_rate": 1.0971293179625803e-05,
"loss": 1.6492090225219727,
"step": 120
},
{
"epoch": 0.2960331557134399,
"grad_norm": 2.875,
"learning_rate": 1.0787307827024565e-05,
"loss": 1.6368392944335937,
"step": 125
},
{
"epoch": 0.30787448194197753,
"grad_norm": 2.890625,
"learning_rate": 1.0597030258974366e-05,
"loss": 1.6719234466552735,
"step": 130
},
{
"epoch": 0.3197158081705151,
"grad_norm": 2.9375,
"learning_rate": 1.0400739734045288e-05,
"loss": 1.6404973983764648,
"step": 135
},
{
"epoch": 0.3315571343990527,
"grad_norm": 2.1875,
"learning_rate": 1.0198724335650807e-05,
"loss": 1.6293134689331055,
"step": 140
},
{
"epoch": 0.3433984606275903,
"grad_norm": 2.015625,
"learning_rate": 9.991280549245664e-06,
"loss": 1.6447383880615234,
"step": 145
},
{
"epoch": 0.3552397868561279,
"grad_norm": 3.578125,
"learning_rate": 9.778712827192572e-06,
"loss": 1.6770294189453125,
"step": 150
},
{
"epoch": 0.36708111308466546,
"grad_norm": 2.734375,
"learning_rate": 9.561333141936387e-06,
"loss": 1.5788751602172852,
"step": 155
},
{
"epoch": 0.3789224393132031,
"grad_norm": 2.265625,
"learning_rate": 9.33946052814153e-06,
"loss": 1.5903149604797364,
"step": 160
},
{
"epoch": 0.3907637655417407,
"grad_norm": 2.234375,
"learning_rate": 9.113420614464618e-06,
"loss": 1.6232831954956055,
"step": 165
},
{
"epoch": 0.40260509177027826,
"grad_norm": 2.125,
"learning_rate": 8.883545145649511e-06,
"loss": 1.5795005798339843,
"step": 170
},
{
"epoch": 0.4144464179988159,
"grad_norm": 1.9453125,
"learning_rate": 8.65017149564615e-06,
"loss": 1.6659164428710938,
"step": 175
},
{
"epoch": 0.42628774422735344,
"grad_norm": 2.25,
"learning_rate": 8.41364217246776e-06,
"loss": 1.6965517044067382,
"step": 180
},
{
"epoch": 0.43812907045589106,
"grad_norm": 4.34375,
"learning_rate": 8.174304315513122e-06,
"loss": 1.5858169555664063,
"step": 185
},
{
"epoch": 0.4499703966844287,
"grad_norm": 2.046875,
"learning_rate": 7.932509186091612e-06,
"loss": 1.6201683044433595,
"step": 190
},
{
"epoch": 0.46181172291296624,
"grad_norm": 2.25,
"learning_rate": 7.68861165189882e-06,
"loss": 1.6074403762817382,
"step": 195
},
{
"epoch": 0.47365304914150386,
"grad_norm": 2.546875,
"learning_rate": 7.442969666199241e-06,
"loss": 1.617002296447754,
"step": 200
},
{
"epoch": 0.4854943753700414,
"grad_norm": 2.171875,
"learning_rate": 7.195943742480528e-06,
"loss": 1.6207464218139649,
"step": 205
},
{
"epoch": 0.49733570159857904,
"grad_norm": 2.140625,
"learning_rate": 6.94789642535021e-06,
"loss": 1.6103069305419921,
"step": 210
},
{
"epoch": 0.5091770278271166,
"grad_norm": 2.546875,
"learning_rate": 6.6991917584515e-06,
"loss": 1.5691112518310546,
"step": 215
},
{
"epoch": 0.5210183540556542,
"grad_norm": 2.359375,
"learning_rate": 6.450194750179039e-06,
"loss": 1.6248830795288085,
"step": 220
},
{
"epoch": 0.5328596802841918,
"grad_norm": 2.921875,
"learning_rate": 6.201270837978755e-06,
"loss": 1.561983585357666,
"step": 225
},
{
"epoch": 0.5447010065127295,
"grad_norm": 2.21875,
"learning_rate": 5.952785352018004e-06,
"loss": 1.588427734375,
"step": 230
},
{
"epoch": 0.5565423327412671,
"grad_norm": 2.0,
"learning_rate": 5.705102979013181e-06,
"loss": 1.6155115127563477,
"step": 235
},
{
"epoch": 0.5683836589698046,
"grad_norm": 2.109375,
"learning_rate": 5.458587227001667e-06,
"loss": 1.5733617782592773,
"step": 240
},
{
"epoch": 0.5802249851983422,
"grad_norm": 2.171875,
"learning_rate": 5.213599891843665e-06,
"loss": 1.5730903625488282,
"step": 245
},
{
"epoch": 0.5920663114268798,
"grad_norm": 3.15625,
"learning_rate": 4.970500526236871e-06,
"loss": 1.5600762367248535,
"step": 250
},
{
"epoch": 0.6039076376554174,
"grad_norm": 2.203125,
"learning_rate": 4.729645912023323e-06,
"loss": 1.610726547241211,
"step": 255
},
{
"epoch": 0.6157489638839551,
"grad_norm": 1.90625,
"learning_rate": 4.4913895365628424e-06,
"loss": 1.5865031242370606,
"step": 260
},
{
"epoch": 0.6275902901124926,
"grad_norm": 2.0,
"learning_rate": 4.256081073941585e-06,
"loss": 1.603274154663086,
"step": 265
},
{
"epoch": 0.6394316163410302,
"grad_norm": 2.578125,
"learning_rate": 4.0240658717771024e-06,
"loss": 1.600333023071289,
"step": 270
},
{
"epoch": 0.6512729425695678,
"grad_norm": 2.109375,
"learning_rate": 3.7956844443730916e-06,
"loss": 1.5704521179199218,
"step": 275
},
{
"epoch": 0.6631142687981054,
"grad_norm": 2.03125,
"learning_rate": 3.5712719729676987e-06,
"loss": 1.5828316688537598,
"step": 280
},
{
"epoch": 0.6749555950266429,
"grad_norm": 2.5625,
"learning_rate": 3.351157813808825e-06,
"loss": 1.5770600318908692,
"step": 285
},
{
"epoch": 0.6867969212551805,
"grad_norm": 1.984375,
"learning_rate": 3.1356650147784227e-06,
"loss": 1.593960666656494,
"step": 290
},
{
"epoch": 0.6986382474837182,
"grad_norm": 1.9609375,
"learning_rate": 2.9251098412751775e-06,
"loss": 1.580451774597168,
"step": 295
},
{
"epoch": 0.7104795737122558,
"grad_norm": 2.078125,
"learning_rate": 2.719801312051425e-06,
"loss": 1.614090347290039,
"step": 300
},
{
"epoch": 0.7223208999407934,
"grad_norm": 2.578125,
"learning_rate": 2.5200407456855087e-06,
"loss": 1.5809415817260741,
"step": 305
},
{
"epoch": 0.7341622261693309,
"grad_norm": 2.34375,
"learning_rate": 2.3261213183552334e-06,
"loss": 1.553083324432373,
"step": 310
},
{
"epoch": 0.7460035523978685,
"grad_norm": 1.9765625,
"learning_rate": 2.1383276335613797e-06,
"loss": 1.6024253845214844,
"step": 315
},
{
"epoch": 0.7578448786264061,
"grad_norm": 2.328125,
"learning_rate": 1.9569353044328275e-06,
"loss": 1.5699667930603027,
"step": 320
},
{
"epoch": 0.7696862048549438,
"grad_norm": 2.4375,
"learning_rate": 1.7822105492262824e-06,
"loss": 1.608834457397461,
"step": 325
},
{
"epoch": 0.7815275310834814,
"grad_norm": 3.0625,
"learning_rate": 1.614409800614272e-06,
"loss": 1.5530618667602538,
"step": 330
},
{
"epoch": 0.7933688573120189,
"grad_norm": 2.421875,
"learning_rate": 1.4537793293348317e-06,
"loss": 1.6589471817016601,
"step": 335
},
{
"epoch": 0.8052101835405565,
"grad_norm": 2.3125,
"learning_rate": 1.300554882755248e-06,
"loss": 1.6034730911254882,
"step": 340
},
{
"epoch": 0.8170515097690941,
"grad_norm": 2.140625,
"learning_rate": 1.1549613388802793e-06,
"loss": 1.6377271652221679,
"step": 345
},
{
"epoch": 0.8288928359976317,
"grad_norm": 2.15625,
"learning_rate": 1.0172123763126773e-06,
"loss": 1.6403684616088867,
"step": 350
},
{
"epoch": 0.8407341622261694,
"grad_norm": 1.859375,
"learning_rate": 8.875101606503659e-07,
"loss": 1.5954139709472657,
"step": 355
},
{
"epoch": 0.8525754884547069,
"grad_norm": 2.15625,
"learning_rate": 7.660450477805567e-07,
"loss": 1.5502955436706543,
"step": 360
},
{
"epoch": 0.8644168146832445,
"grad_norm": 1.890625,
"learning_rate": 6.529953045062282e-07,
"loss": 1.5533514976501466,
"step": 365
},
{
"epoch": 0.8762581409117821,
"grad_norm": 2.15625,
"learning_rate": 5.485268469150119e-07,
"loss": 1.5953169822692872,
"step": 370
},
{
"epoch": 0.8880994671403197,
"grad_norm": 2.359375,
"learning_rate": 4.5279299687445366e-07,
"loss": 1.5968003273010254,
"step": 375
},
{
"epoch": 0.8999407933688574,
"grad_norm": 2.359375,
"learning_rate": 3.659342570110326e-07,
"loss": 1.5658743858337403,
"step": 380
},
{
"epoch": 0.9117821195973949,
"grad_norm": 1.90625,
"learning_rate": 2.880781045031754e-07,
"loss": 1.5887388229370116,
"step": 385
},
{
"epoch": 0.9236234458259325,
"grad_norm": 2.203125,
"learning_rate": 2.1933880399092585e-07,
"loss": 1.5834945678710937,
"step": 390
},
{
"epoch": 0.9354647720544701,
"grad_norm": 2.359375,
"learning_rate": 1.5981723987682304e-07,
"loss": 1.5624884605407714,
"step": 395
},
{
"epoch": 0.9473060982830077,
"grad_norm": 2.171875,
"learning_rate": 1.09600768264133e-07,
"loss": 1.6257368087768556,
"step": 400
},
{
"epoch": 0.9591474245115453,
"grad_norm": 2.015625,
"learning_rate": 6.876308874971658e-08,
"loss": 1.5857719421386718,
"step": 405
},
{
"epoch": 0.9709887507400828,
"grad_norm": 2.203125,
"learning_rate": 3.736413625971091e-08,
"loss": 1.5751670837402343,
"step": 410
},
{
"epoch": 0.9828300769686205,
"grad_norm": 1.9140625,
"learning_rate": 1.544999308676015e-08,
"loss": 1.6034950256347655,
"step": 415
},
{
"epoch": 0.9946714031971581,
"grad_norm": 3.640625,
"learning_rate": 3.052821257894633e-09,
"loss": 1.5355438232421874,
"step": 420
},
{
"epoch": 1.0,
"step": 423,
"total_flos": 2.0218118019963494e+17,
"train_loss": 1.6924350921143876,
"train_runtime": 3361.2318,
"train_samples_per_second": 0.502,
"train_steps_per_second": 0.126
}
],
"logging_steps": 5,
"max_steps": 423,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": false,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.0218118019963494e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}

3
training_args.bin Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:6a907eb06183c527a4f0ab17010e57da97e69d15be7365f3c9dede68a3f3685f
size 6033

BIN
training_loss.png Normal file

Binary file not shown.

After

Width:  |  Height:  |  Size: 38 KiB