初始化项目,由ModelHub XC社区提供模型
Model: boradorish/llama3-3B-sft Source: Original Platform
This commit is contained in:
93
checkpoint-92/chat_template.jinja
Normal file
93
checkpoint-92/chat_template.jinja
Normal file
@@ -0,0 +1,93 @@
|
||||
{{- bos_token }}
|
||||
{%- if custom_tools is defined %}
|
||||
{%- set tools = custom_tools %}
|
||||
{%- endif %}
|
||||
{%- if not tools_in_user_message is defined %}
|
||||
{%- set tools_in_user_message = true %}
|
||||
{%- endif %}
|
||||
{%- if not date_string is defined %}
|
||||
{%- if strftime_now is defined %}
|
||||
{%- set date_string = strftime_now("%d %b %Y") %}
|
||||
{%- else %}
|
||||
{%- set date_string = "26 Jul 2024" %}
|
||||
{%- endif %}
|
||||
{%- endif %}
|
||||
{%- if not tools is defined %}
|
||||
{%- set tools = none %}
|
||||
{%- endif %}
|
||||
|
||||
{#- This block extracts the system message, so we can slot it into the right place. #}
|
||||
{%- if messages[0]['role'] == 'system' %}
|
||||
{%- set system_message = messages[0]['content']|trim %}
|
||||
{%- set messages = messages[1:] %}
|
||||
{%- else %}
|
||||
{%- set system_message = "" %}
|
||||
{%- endif %}
|
||||
|
||||
{#- System message #}
|
||||
{{- "<|start_header_id|>system<|end_header_id|>\n\n" }}
|
||||
{%- if tools is not none %}
|
||||
{{- "Environment: ipython\n" }}
|
||||
{%- endif %}
|
||||
{{- "Cutting Knowledge Date: December 2023\n" }}
|
||||
{{- "Today Date: " + date_string + "\n\n" }}
|
||||
{%- if tools is not none and not tools_in_user_message %}
|
||||
{{- "You have access to the following functions. To call a function, please respond with JSON for a function call." }}
|
||||
{{- 'Respond in the format {"name": function name, "parameters": dictionary of argument name and its value}.' }}
|
||||
{{- "Do not use variables.\n\n" }}
|
||||
{%- for t in tools %}
|
||||
{{- t | tojson(indent=4) }}
|
||||
{{- "\n\n" }}
|
||||
{%- endfor %}
|
||||
{%- endif %}
|
||||
{{- system_message }}
|
||||
{{- "<|eot_id|>" }}
|
||||
|
||||
{#- Custom tools are passed in a user message with some extra guidance #}
|
||||
{%- if tools_in_user_message and not tools is none %}
|
||||
{#- Extract the first user message so we can plug it in here #}
|
||||
{%- if messages | length != 0 %}
|
||||
{%- set first_user_message = messages[0]['content']|trim %}
|
||||
{%- set messages = messages[1:] %}
|
||||
{%- else %}
|
||||
{{- raise_exception("Cannot put tools in the first user message when there's no first user message!") }}
|
||||
{%- endif %}
|
||||
{{- '<|start_header_id|>user<|end_header_id|>\n\n' -}}
|
||||
{{- "Given the following functions, please respond with a JSON for a function call " }}
|
||||
{{- "with its proper arguments that best answers the given prompt.\n\n" }}
|
||||
{{- 'Respond in the format {"name": function name, "parameters": dictionary of argument name and its value}.' }}
|
||||
{{- "Do not use variables.\n\n" }}
|
||||
{%- for t in tools %}
|
||||
{{- t | tojson(indent=4) }}
|
||||
{{- "\n\n" }}
|
||||
{%- endfor %}
|
||||
{{- first_user_message + "<|eot_id|>"}}
|
||||
{%- endif %}
|
||||
|
||||
{%- for message in messages %}
|
||||
{%- if not (message.role == 'ipython' or message.role == 'tool' or 'tool_calls' in message) %}
|
||||
{{- '<|start_header_id|>' + message['role'] + '<|end_header_id|>\n\n'+ message['content'] | trim + '<|eot_id|>' }}
|
||||
{%- elif 'tool_calls' in message %}
|
||||
{%- if not message.tool_calls|length == 1 %}
|
||||
{{- raise_exception("This model only supports single tool-calls at once!") }}
|
||||
{%- endif %}
|
||||
{%- set tool_call = message.tool_calls[0].function %}
|
||||
{{- '<|start_header_id|>assistant<|end_header_id|>\n\n' -}}
|
||||
{{- '{"name": "' + tool_call.name + '", ' }}
|
||||
{{- '"parameters": ' }}
|
||||
{{- tool_call.arguments | tojson }}
|
||||
{{- "}" }}
|
||||
{{- "<|eot_id|>" }}
|
||||
{%- elif message.role == "tool" or message.role == "ipython" %}
|
||||
{{- "<|start_header_id|>ipython<|end_header_id|>\n\n" }}
|
||||
{%- if message.content is mapping or message.content is iterable %}
|
||||
{{- message.content | tojson }}
|
||||
{%- else %}
|
||||
{{- message.content }}
|
||||
{%- endif %}
|
||||
{{- "<|eot_id|>" }}
|
||||
{%- endif %}
|
||||
{%- endfor %}
|
||||
{%- if add_generation_prompt %}
|
||||
{{- '<|start_header_id|>assistant<|end_header_id|>\n\n' }}
|
||||
{%- endif %}
|
||||
36
checkpoint-92/config.json
Normal file
36
checkpoint-92/config.json
Normal file
@@ -0,0 +1,36 @@
|
||||
{
|
||||
"architectures": [
|
||||
"LlamaForCausalLM"
|
||||
],
|
||||
"attention_bias": false,
|
||||
"attention_dropout": 0.0,
|
||||
"bos_token_id": 128000,
|
||||
"dtype": "bfloat16",
|
||||
"eos_token_id": 128009,
|
||||
"head_dim": 128,
|
||||
"hidden_act": "silu",
|
||||
"hidden_size": 3072,
|
||||
"initializer_range": 0.02,
|
||||
"intermediate_size": 8192,
|
||||
"max_position_embeddings": 131072,
|
||||
"mlp_bias": false,
|
||||
"model_type": "llama",
|
||||
"num_attention_heads": 24,
|
||||
"num_hidden_layers": 28,
|
||||
"num_key_value_heads": 8,
|
||||
"pad_token_id": 128009,
|
||||
"pretraining_tp": 1,
|
||||
"rms_norm_eps": 1e-05,
|
||||
"rope_scaling": {
|
||||
"factor": 32.0,
|
||||
"high_freq_factor": 4.0,
|
||||
"low_freq_factor": 1.0,
|
||||
"original_max_position_embeddings": 8192,
|
||||
"rope_type": "llama3"
|
||||
},
|
||||
"rope_theta": 500000.0,
|
||||
"tie_word_embeddings": true,
|
||||
"transformers_version": "4.56.2",
|
||||
"use_cache": false,
|
||||
"vocab_size": 128256
|
||||
}
|
||||
14
checkpoint-92/generation_config.json
Normal file
14
checkpoint-92/generation_config.json
Normal file
@@ -0,0 +1,14 @@
|
||||
{
|
||||
"bos_token_id": 128000,
|
||||
"do_sample": true,
|
||||
"eos_token_id": [
|
||||
128009,
|
||||
128001,
|
||||
128008,
|
||||
128009
|
||||
],
|
||||
"pad_token_id": 128009,
|
||||
"temperature": 0.6,
|
||||
"top_p": 0.9,
|
||||
"transformers_version": "4.56.2"
|
||||
}
|
||||
3
checkpoint-92/model-00001-of-00002.safetensors
Normal file
3
checkpoint-92/model-00001-of-00002.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:9ed471d592fa82d113dbc910673f3c78d23c950c6ffc26c9655428315a6dea8e
|
||||
size 4965799096
|
||||
3
checkpoint-92/model-00002-of-00002.safetensors
Normal file
3
checkpoint-92/model-00002-of-00002.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:5048216cd781cfd10c332634507fa0aad926ce173140cd3968c89bbeae48c13f
|
||||
size 2247734992
|
||||
263
checkpoint-92/model.safetensors.index.json
Normal file
263
checkpoint-92/model.safetensors.index.json
Normal file
@@ -0,0 +1,263 @@
|
||||
{
|
||||
"metadata": {
|
||||
"total_parameters": 3212749824,
|
||||
"total_size": 7213504512
|
||||
},
|
||||
"weight_map": {
|
||||
"lm_head.weight": "model-00002-of-00002.safetensors",
|
||||
"model.embed_tokens.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.0.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.0.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.0.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.0.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.1.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.1.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.1.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.1.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.1.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.10.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.10.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.10.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.10.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.10.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.10.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.10.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.11.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.11.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.11.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.11.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.11.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.11.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.12.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.12.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.12.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.12.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.12.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.12.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.12.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.12.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.12.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.13.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.13.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.13.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.13.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.13.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.13.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.13.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.13.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.13.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.14.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.14.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.14.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.14.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.14.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.14.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.14.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.14.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.14.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.15.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.15.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.15.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.15.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.15.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.15.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.15.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.16.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.16.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.16.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.16.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.16.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.16.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.16.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.16.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.16.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.17.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.17.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.17.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.17.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.17.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.17.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.17.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.17.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.17.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.18.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.18.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.18.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.18.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.18.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.18.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.18.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.18.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.18.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.19.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.19.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.19.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.19.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.19.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.19.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.19.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.19.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.2.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.2.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.2.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.2.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.20.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.20.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.20.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.20.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.20.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.20.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.20.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.20.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.20.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.21.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.21.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.21.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.21.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.21.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.21.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.21.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.21.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.21.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.22.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.22.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.22.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.22.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.22.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.22.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.22.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.22.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.22.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.23.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.23.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.23.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.23.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.23.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.23.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.23.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.23.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.23.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.24.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.24.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.24.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.24.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.24.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.24.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.24.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.24.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.24.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.25.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.25.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.25.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.25.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.25.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.25.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.25.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.25.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.25.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.26.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.26.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.26.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.26.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.26.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.26.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.26.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.26.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.26.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.27.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.27.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.27.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.27.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.27.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.27.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.27.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.27.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.27.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||
"model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.3.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.3.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.3.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.4.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.4.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.4.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.4.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.4.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.5.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.5.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.5.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.5.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.6.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.6.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.6.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.6.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.6.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.6.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.7.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.7.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.7.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.8.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.8.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.8.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.8.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.8.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.8.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.8.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.8.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.8.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.9.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.9.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.9.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.9.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.9.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.9.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.9.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||
"model.norm.weight": "model-00002-of-00002.safetensors"
|
||||
}
|
||||
}
|
||||
26
checkpoint-92/special_tokens_map.json
Normal file
26
checkpoint-92/special_tokens_map.json
Normal file
@@ -0,0 +1,26 @@
|
||||
{
|
||||
"additional_special_tokens": [
|
||||
{
|
||||
"content": "<|eom_id|>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
}
|
||||
],
|
||||
"bos_token": {
|
||||
"content": "<|begin_of_text|>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
},
|
||||
"eos_token": {
|
||||
"content": "<|eot_id|>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
},
|
||||
"pad_token": "<|eot_id|>"
|
||||
}
|
||||
BIN
checkpoint-92/tokenizer.json
(Stored with Git LFS)
Normal file
BIN
checkpoint-92/tokenizer.json
(Stored with Git LFS)
Normal file
Binary file not shown.
2068
checkpoint-92/tokenizer_config.json
Normal file
2068
checkpoint-92/tokenizer_config.json
Normal file
File diff suppressed because it is too large
Load Diff
678
checkpoint-92/trainer_state.json
Normal file
678
checkpoint-92/trainer_state.json
Normal file
@@ -0,0 +1,678 @@
|
||||
{
|
||||
"best_global_step": null,
|
||||
"best_metric": null,
|
||||
"best_model_checkpoint": null,
|
||||
"epoch": 0.3546987951807229,
|
||||
"eval_steps": 500,
|
||||
"global_step": 92,
|
||||
"is_hyper_param_search": false,
|
||||
"is_local_process_zero": true,
|
||||
"is_world_process_zero": true,
|
||||
"log_history": [
|
||||
{
|
||||
"epoch": 0.0038554216867469878,
|
||||
"grad_norm": 1.2289724349975586,
|
||||
"learning_rate": 0.0,
|
||||
"loss": 0.0363,
|
||||
"step": 1
|
||||
},
|
||||
{
|
||||
"epoch": 0.0077108433734939755,
|
||||
"grad_norm": 1.148133635520935,
|
||||
"learning_rate": 5.128205128205128e-07,
|
||||
"loss": 0.042,
|
||||
"step": 2
|
||||
},
|
||||
{
|
||||
"epoch": 0.011566265060240964,
|
||||
"grad_norm": 1.251704216003418,
|
||||
"learning_rate": 1.0256410256410257e-06,
|
||||
"loss": 0.0442,
|
||||
"step": 3
|
||||
},
|
||||
{
|
||||
"epoch": 0.015421686746987951,
|
||||
"grad_norm": 1.1709717512130737,
|
||||
"learning_rate": 1.5384615384615387e-06,
|
||||
"loss": 0.0363,
|
||||
"step": 4
|
||||
},
|
||||
{
|
||||
"epoch": 0.01927710843373494,
|
||||
"grad_norm": 1.1885852813720703,
|
||||
"learning_rate": 2.0512820512820513e-06,
|
||||
"loss": 0.0281,
|
||||
"step": 5
|
||||
},
|
||||
{
|
||||
"epoch": 0.02313253012048193,
|
||||
"grad_norm": 0.7513725161552429,
|
||||
"learning_rate": 2.564102564102564e-06,
|
||||
"loss": 0.0456,
|
||||
"step": 6
|
||||
},
|
||||
{
|
||||
"epoch": 0.026987951807228915,
|
||||
"grad_norm": 0.6604480147361755,
|
||||
"learning_rate": 3.0769230769230774e-06,
|
||||
"loss": 0.0336,
|
||||
"step": 7
|
||||
},
|
||||
{
|
||||
"epoch": 0.030843373493975902,
|
||||
"grad_norm": 0.5245765447616577,
|
||||
"learning_rate": 3.58974358974359e-06,
|
||||
"loss": 0.0351,
|
||||
"step": 8
|
||||
},
|
||||
{
|
||||
"epoch": 0.03469879518072289,
|
||||
"grad_norm": 0.35446059703826904,
|
||||
"learning_rate": 4.102564102564103e-06,
|
||||
"loss": 0.022,
|
||||
"step": 9
|
||||
},
|
||||
{
|
||||
"epoch": 0.03855421686746988,
|
||||
"grad_norm": 0.40557414293289185,
|
||||
"learning_rate": 4.615384615384616e-06,
|
||||
"loss": 0.0248,
|
||||
"step": 10
|
||||
},
|
||||
{
|
||||
"epoch": 0.042409638554216866,
|
||||
"grad_norm": 0.3844715356826782,
|
||||
"learning_rate": 5.128205128205128e-06,
|
||||
"loss": 0.0289,
|
||||
"step": 11
|
||||
},
|
||||
{
|
||||
"epoch": 0.04626506024096386,
|
||||
"grad_norm": 0.31521302461624146,
|
||||
"learning_rate": 5.641025641025641e-06,
|
||||
"loss": 0.0221,
|
||||
"step": 12
|
||||
},
|
||||
{
|
||||
"epoch": 0.05012048192771084,
|
||||
"grad_norm": 0.40441566705703735,
|
||||
"learning_rate": 6.153846153846155e-06,
|
||||
"loss": 0.0226,
|
||||
"step": 13
|
||||
},
|
||||
{
|
||||
"epoch": 0.05397590361445783,
|
||||
"grad_norm": 0.30345258116722107,
|
||||
"learning_rate": 6.666666666666667e-06,
|
||||
"loss": 0.0181,
|
||||
"step": 14
|
||||
},
|
||||
{
|
||||
"epoch": 0.05783132530120482,
|
||||
"grad_norm": 0.32419148087501526,
|
||||
"learning_rate": 7.17948717948718e-06,
|
||||
"loss": 0.0217,
|
||||
"step": 15
|
||||
},
|
||||
{
|
||||
"epoch": 0.061686746987951804,
|
||||
"grad_norm": 0.29662227630615234,
|
||||
"learning_rate": 7.692307692307694e-06,
|
||||
"loss": 0.0216,
|
||||
"step": 16
|
||||
},
|
||||
{
|
||||
"epoch": 0.0655421686746988,
|
||||
"grad_norm": 0.24562332034111023,
|
||||
"learning_rate": 8.205128205128205e-06,
|
||||
"loss": 0.0163,
|
||||
"step": 17
|
||||
},
|
||||
{
|
||||
"epoch": 0.06939759036144579,
|
||||
"grad_norm": 0.21251554787158966,
|
||||
"learning_rate": 8.717948717948719e-06,
|
||||
"loss": 0.0176,
|
||||
"step": 18
|
||||
},
|
||||
{
|
||||
"epoch": 0.07325301204819278,
|
||||
"grad_norm": 0.195358544588089,
|
||||
"learning_rate": 9.230769230769232e-06,
|
||||
"loss": 0.0121,
|
||||
"step": 19
|
||||
},
|
||||
{
|
||||
"epoch": 0.07710843373493977,
|
||||
"grad_norm": 0.1519210785627365,
|
||||
"learning_rate": 9.743589743589744e-06,
|
||||
"loss": 0.0103,
|
||||
"step": 20
|
||||
},
|
||||
{
|
||||
"epoch": 0.08096385542168674,
|
||||
"grad_norm": 0.29832565784454346,
|
||||
"learning_rate": 1.0256410256410256e-05,
|
||||
"loss": 0.0197,
|
||||
"step": 21
|
||||
},
|
||||
{
|
||||
"epoch": 0.08481927710843373,
|
||||
"grad_norm": 0.24802711606025696,
|
||||
"learning_rate": 1.076923076923077e-05,
|
||||
"loss": 0.0207,
|
||||
"step": 22
|
||||
},
|
||||
{
|
||||
"epoch": 0.08867469879518072,
|
||||
"grad_norm": 0.17878903448581696,
|
||||
"learning_rate": 1.1282051282051283e-05,
|
||||
"loss": 0.014,
|
||||
"step": 23
|
||||
},
|
||||
{
|
||||
"epoch": 0.09253012048192771,
|
||||
"grad_norm": 0.23687325417995453,
|
||||
"learning_rate": 1.1794871794871796e-05,
|
||||
"loss": 0.0153,
|
||||
"step": 24
|
||||
},
|
||||
{
|
||||
"epoch": 0.0963855421686747,
|
||||
"grad_norm": 0.29058969020843506,
|
||||
"learning_rate": 1.230769230769231e-05,
|
||||
"loss": 0.0149,
|
||||
"step": 25
|
||||
},
|
||||
{
|
||||
"epoch": 0.10024096385542168,
|
||||
"grad_norm": 0.1624310314655304,
|
||||
"learning_rate": 1.2820512820512823e-05,
|
||||
"loss": 0.0127,
|
||||
"step": 26
|
||||
},
|
||||
{
|
||||
"epoch": 0.10409638554216867,
|
||||
"grad_norm": 0.27256354689598083,
|
||||
"learning_rate": 1.3333333333333333e-05,
|
||||
"loss": 0.0173,
|
||||
"step": 27
|
||||
},
|
||||
{
|
||||
"epoch": 0.10795180722891566,
|
||||
"grad_norm": 0.24831782281398773,
|
||||
"learning_rate": 1.3846153846153847e-05,
|
||||
"loss": 0.0161,
|
||||
"step": 28
|
||||
},
|
||||
{
|
||||
"epoch": 0.11180722891566265,
|
||||
"grad_norm": 0.20417729020118713,
|
||||
"learning_rate": 1.435897435897436e-05,
|
||||
"loss": 0.0127,
|
||||
"step": 29
|
||||
},
|
||||
{
|
||||
"epoch": 0.11566265060240964,
|
||||
"grad_norm": 0.22253485023975372,
|
||||
"learning_rate": 1.4871794871794874e-05,
|
||||
"loss": 0.018,
|
||||
"step": 30
|
||||
},
|
||||
{
|
||||
"epoch": 0.11951807228915663,
|
||||
"grad_norm": 0.1634419709444046,
|
||||
"learning_rate": 1.5384615384615387e-05,
|
||||
"loss": 0.0092,
|
||||
"step": 31
|
||||
},
|
||||
{
|
||||
"epoch": 0.12337349397590361,
|
||||
"grad_norm": 0.16349917650222778,
|
||||
"learning_rate": 1.5897435897435897e-05,
|
||||
"loss": 0.0151,
|
||||
"step": 32
|
||||
},
|
||||
{
|
||||
"epoch": 0.1272289156626506,
|
||||
"grad_norm": 0.2271573394536972,
|
||||
"learning_rate": 1.641025641025641e-05,
|
||||
"loss": 0.0174,
|
||||
"step": 33
|
||||
},
|
||||
{
|
||||
"epoch": 0.1310843373493976,
|
||||
"grad_norm": 0.1916988492012024,
|
||||
"learning_rate": 1.6923076923076924e-05,
|
||||
"loss": 0.0126,
|
||||
"step": 34
|
||||
},
|
||||
{
|
||||
"epoch": 0.13493975903614458,
|
||||
"grad_norm": 0.23479051887989044,
|
||||
"learning_rate": 1.7435897435897438e-05,
|
||||
"loss": 0.0116,
|
||||
"step": 35
|
||||
},
|
||||
{
|
||||
"epoch": 0.13879518072289157,
|
||||
"grad_norm": 0.18296493589878082,
|
||||
"learning_rate": 1.794871794871795e-05,
|
||||
"loss": 0.0133,
|
||||
"step": 36
|
||||
},
|
||||
{
|
||||
"epoch": 0.14265060240963856,
|
||||
"grad_norm": 0.12307147681713104,
|
||||
"learning_rate": 1.8461538461538465e-05,
|
||||
"loss": 0.0093,
|
||||
"step": 37
|
||||
},
|
||||
{
|
||||
"epoch": 0.14650602409638555,
|
||||
"grad_norm": 0.1736001819372177,
|
||||
"learning_rate": 1.8974358974358975e-05,
|
||||
"loss": 0.0097,
|
||||
"step": 38
|
||||
},
|
||||
{
|
||||
"epoch": 0.15036144578313254,
|
||||
"grad_norm": 0.21048344671726227,
|
||||
"learning_rate": 1.9487179487179488e-05,
|
||||
"loss": 0.0121,
|
||||
"step": 39
|
||||
},
|
||||
{
|
||||
"epoch": 0.15421686746987953,
|
||||
"grad_norm": 0.18844228982925415,
|
||||
"learning_rate": 2e-05,
|
||||
"loss": 0.0145,
|
||||
"step": 40
|
||||
},
|
||||
{
|
||||
"epoch": 0.1580722891566265,
|
||||
"grad_norm": 0.24053065478801727,
|
||||
"learning_rate": 2.0512820512820512e-05,
|
||||
"loss": 0.0233,
|
||||
"step": 41
|
||||
},
|
||||
{
|
||||
"epoch": 0.16192771084337348,
|
||||
"grad_norm": 0.16952425241470337,
|
||||
"learning_rate": 2.102564102564103e-05,
|
||||
"loss": 0.024,
|
||||
"step": 42
|
||||
},
|
||||
{
|
||||
"epoch": 0.16578313253012048,
|
||||
"grad_norm": 0.1816851794719696,
|
||||
"learning_rate": 2.153846153846154e-05,
|
||||
"loss": 0.0165,
|
||||
"step": 43
|
||||
},
|
||||
{
|
||||
"epoch": 0.16963855421686747,
|
||||
"grad_norm": 0.17718464136123657,
|
||||
"learning_rate": 2.2051282051282056e-05,
|
||||
"loss": 0.0171,
|
||||
"step": 44
|
||||
},
|
||||
{
|
||||
"epoch": 0.17349397590361446,
|
||||
"grad_norm": 0.44719773530960083,
|
||||
"learning_rate": 2.2564102564102566e-05,
|
||||
"loss": 0.0357,
|
||||
"step": 45
|
||||
},
|
||||
{
|
||||
"epoch": 0.17734939759036145,
|
||||
"grad_norm": 0.1649208813905716,
|
||||
"learning_rate": 2.3076923076923076e-05,
|
||||
"loss": 0.016,
|
||||
"step": 46
|
||||
},
|
||||
{
|
||||
"epoch": 0.18120481927710844,
|
||||
"grad_norm": 0.17772121727466583,
|
||||
"learning_rate": 2.3589743589743593e-05,
|
||||
"loss": 0.0106,
|
||||
"step": 47
|
||||
},
|
||||
{
|
||||
"epoch": 0.18506024096385543,
|
||||
"grad_norm": 0.30155256390571594,
|
||||
"learning_rate": 2.4102564102564103e-05,
|
||||
"loss": 0.0132,
|
||||
"step": 48
|
||||
},
|
||||
{
|
||||
"epoch": 0.18891566265060242,
|
||||
"grad_norm": 0.1777803599834442,
|
||||
"learning_rate": 2.461538461538462e-05,
|
||||
"loss": 0.0089,
|
||||
"step": 49
|
||||
},
|
||||
{
|
||||
"epoch": 0.1927710843373494,
|
||||
"grad_norm": 0.23959968984127045,
|
||||
"learning_rate": 2.512820512820513e-05,
|
||||
"loss": 0.0137,
|
||||
"step": 50
|
||||
},
|
||||
{
|
||||
"epoch": 0.1966265060240964,
|
||||
"grad_norm": 0.2473219782114029,
|
||||
"learning_rate": 2.5641025641025646e-05,
|
||||
"loss": 0.0241,
|
||||
"step": 51
|
||||
},
|
||||
{
|
||||
"epoch": 0.20048192771084336,
|
||||
"grad_norm": 0.14216162264347076,
|
||||
"learning_rate": 2.6153846153846157e-05,
|
||||
"loss": 0.0089,
|
||||
"step": 52
|
||||
},
|
||||
{
|
||||
"epoch": 0.20433734939759035,
|
||||
"grad_norm": 0.16024824976921082,
|
||||
"learning_rate": 2.6666666666666667e-05,
|
||||
"loss": 0.0105,
|
||||
"step": 53
|
||||
},
|
||||
{
|
||||
"epoch": 0.20819277108433734,
|
||||
"grad_norm": 0.19614927470684052,
|
||||
"learning_rate": 2.7179487179487183e-05,
|
||||
"loss": 0.0102,
|
||||
"step": 54
|
||||
},
|
||||
{
|
||||
"epoch": 0.21204819277108433,
|
||||
"grad_norm": 0.18651551008224487,
|
||||
"learning_rate": 2.7692307692307694e-05,
|
||||
"loss": 0.0109,
|
||||
"step": 55
|
||||
},
|
||||
{
|
||||
"epoch": 0.21590361445783132,
|
||||
"grad_norm": 0.1358720362186432,
|
||||
"learning_rate": 2.820512820512821e-05,
|
||||
"loss": 0.0082,
|
||||
"step": 56
|
||||
},
|
||||
{
|
||||
"epoch": 0.2197590361445783,
|
||||
"grad_norm": 0.13998733460903168,
|
||||
"learning_rate": 2.871794871794872e-05,
|
||||
"loss": 0.0081,
|
||||
"step": 57
|
||||
},
|
||||
{
|
||||
"epoch": 0.2236144578313253,
|
||||
"grad_norm": 0.1299574077129364,
|
||||
"learning_rate": 2.923076923076923e-05,
|
||||
"loss": 0.0067,
|
||||
"step": 58
|
||||
},
|
||||
{
|
||||
"epoch": 0.2274698795180723,
|
||||
"grad_norm": 0.17477169632911682,
|
||||
"learning_rate": 2.9743589743589747e-05,
|
||||
"loss": 0.0091,
|
||||
"step": 59
|
||||
},
|
||||
{
|
||||
"epoch": 0.23132530120481928,
|
||||
"grad_norm": 0.27078455686569214,
|
||||
"learning_rate": 3.0256410256410257e-05,
|
||||
"loss": 0.0128,
|
||||
"step": 60
|
||||
},
|
||||
{
|
||||
"epoch": 0.23518072289156627,
|
||||
"grad_norm": 0.2184700220823288,
|
||||
"learning_rate": 3.0769230769230774e-05,
|
||||
"loss": 0.0236,
|
||||
"step": 61
|
||||
},
|
||||
{
|
||||
"epoch": 0.23903614457831326,
|
||||
"grad_norm": 0.21013228595256805,
|
||||
"learning_rate": 3.128205128205129e-05,
|
||||
"loss": 0.0114,
|
||||
"step": 62
|
||||
},
|
||||
{
|
||||
"epoch": 0.24289156626506025,
|
||||
"grad_norm": 0.4988560974597931,
|
||||
"learning_rate": 3.1794871794871795e-05,
|
||||
"loss": 0.0111,
|
||||
"step": 63
|
||||
},
|
||||
{
|
||||
"epoch": 0.24674698795180722,
|
||||
"grad_norm": 0.18484456837177277,
|
||||
"learning_rate": 3.230769230769231e-05,
|
||||
"loss": 0.0104,
|
||||
"step": 64
|
||||
},
|
||||
{
|
||||
"epoch": 0.25060240963855424,
|
||||
"grad_norm": 0.19871847331523895,
|
||||
"learning_rate": 3.282051282051282e-05,
|
||||
"loss": 0.0094,
|
||||
"step": 65
|
||||
},
|
||||
{
|
||||
"epoch": 0.2544578313253012,
|
||||
"grad_norm": 0.17952671647071838,
|
||||
"learning_rate": 3.3333333333333335e-05,
|
||||
"loss": 0.0127,
|
||||
"step": 66
|
||||
},
|
||||
{
|
||||
"epoch": 0.2583132530120482,
|
||||
"grad_norm": 0.29055604338645935,
|
||||
"learning_rate": 3.384615384615385e-05,
|
||||
"loss": 0.023,
|
||||
"step": 67
|
||||
},
|
||||
{
|
||||
"epoch": 0.2621686746987952,
|
||||
"grad_norm": 0.2033795416355133,
|
||||
"learning_rate": 3.435897435897436e-05,
|
||||
"loss": 0.0091,
|
||||
"step": 68
|
||||
},
|
||||
{
|
||||
"epoch": 0.26602409638554214,
|
||||
"grad_norm": 0.2499230057001114,
|
||||
"learning_rate": 3.4871794871794875e-05,
|
||||
"loss": 0.0221,
|
||||
"step": 69
|
||||
},
|
||||
{
|
||||
"epoch": 0.26987951807228916,
|
||||
"grad_norm": 0.22038578987121582,
|
||||
"learning_rate": 3.538461538461539e-05,
|
||||
"loss": 0.0139,
|
||||
"step": 70
|
||||
},
|
||||
{
|
||||
"epoch": 0.2737349397590361,
|
||||
"grad_norm": 0.14657297730445862,
|
||||
"learning_rate": 3.58974358974359e-05,
|
||||
"loss": 0.0104,
|
||||
"step": 71
|
||||
},
|
||||
{
|
||||
"epoch": 0.27759036144578314,
|
||||
"grad_norm": 0.23861773312091827,
|
||||
"learning_rate": 3.6410256410256416e-05,
|
||||
"loss": 0.0126,
|
||||
"step": 72
|
||||
},
|
||||
{
|
||||
"epoch": 0.2814457831325301,
|
||||
"grad_norm": 0.21007320284843445,
|
||||
"learning_rate": 3.692307692307693e-05,
|
||||
"loss": 0.0133,
|
||||
"step": 73
|
||||
},
|
||||
{
|
||||
"epoch": 0.2853012048192771,
|
||||
"grad_norm": 0.20938654243946075,
|
||||
"learning_rate": 3.7435897435897436e-05,
|
||||
"loss": 0.0116,
|
||||
"step": 74
|
||||
},
|
||||
{
|
||||
"epoch": 0.2891566265060241,
|
||||
"grad_norm": 0.27394789457321167,
|
||||
"learning_rate": 3.794871794871795e-05,
|
||||
"loss": 0.0158,
|
||||
"step": 75
|
||||
},
|
||||
{
|
||||
"epoch": 0.2930120481927711,
|
||||
"grad_norm": 0.1749437153339386,
|
||||
"learning_rate": 3.846153846153846e-05,
|
||||
"loss": 0.0097,
|
||||
"step": 76
|
||||
},
|
||||
{
|
||||
"epoch": 0.29686746987951806,
|
||||
"grad_norm": 0.2208889275789261,
|
||||
"learning_rate": 3.8974358974358976e-05,
|
||||
"loss": 0.024,
|
||||
"step": 77
|
||||
},
|
||||
{
|
||||
"epoch": 0.3007228915662651,
|
||||
"grad_norm": 0.32802650332450867,
|
||||
"learning_rate": 3.948717948717949e-05,
|
||||
"loss": 0.015,
|
||||
"step": 78
|
||||
},
|
||||
{
|
||||
"epoch": 0.30457831325301205,
|
||||
"grad_norm": 0.21527938544750214,
|
||||
"learning_rate": 4e-05,
|
||||
"loss": 0.0137,
|
||||
"step": 79
|
||||
},
|
||||
{
|
||||
"epoch": 0.30843373493975906,
|
||||
"grad_norm": 0.2894026041030884,
|
||||
"learning_rate": 3.999979972589652e-05,
|
||||
"loss": 0.0177,
|
||||
"step": 80
|
||||
},
|
||||
{
|
||||
"epoch": 0.312289156626506,
|
||||
"grad_norm": 0.21148355305194855,
|
||||
"learning_rate": 3.9999198907597046e-05,
|
||||
"loss": 0.0146,
|
||||
"step": 81
|
||||
},
|
||||
{
|
||||
"epoch": 0.316144578313253,
|
||||
"grad_norm": 0.1950712502002716,
|
||||
"learning_rate": 3.999819755713442e-05,
|
||||
"loss": 0.0174,
|
||||
"step": 82
|
||||
},
|
||||
{
|
||||
"epoch": 0.32,
|
||||
"grad_norm": 0.23408709466457367,
|
||||
"learning_rate": 3.9996795694563096e-05,
|
||||
"loss": 0.0142,
|
||||
"step": 83
|
||||
},
|
||||
{
|
||||
"epoch": 0.32385542168674697,
|
||||
"grad_norm": 0.4009031355381012,
|
||||
"learning_rate": 3.999499334795875e-05,
|
||||
"loss": 0.014,
|
||||
"step": 84
|
||||
},
|
||||
{
|
||||
"epoch": 0.327710843373494,
|
||||
"grad_norm": 0.2507084012031555,
|
||||
"learning_rate": 3.999279055341771e-05,
|
||||
"loss": 0.013,
|
||||
"step": 85
|
||||
},
|
||||
{
|
||||
"epoch": 0.33156626506024095,
|
||||
"grad_norm": 0.2922132909297943,
|
||||
"learning_rate": 3.999018735505626e-05,
|
||||
"loss": 0.013,
|
||||
"step": 86
|
||||
},
|
||||
{
|
||||
"epoch": 0.33542168674698797,
|
||||
"grad_norm": 0.2073613405227661,
|
||||
"learning_rate": 3.998718380500971e-05,
|
||||
"loss": 0.0107,
|
||||
"step": 87
|
||||
},
|
||||
{
|
||||
"epoch": 0.33927710843373493,
|
||||
"grad_norm": 0.3113904595375061,
|
||||
"learning_rate": 3.998377996343139e-05,
|
||||
"loss": 0.0337,
|
||||
"step": 88
|
||||
},
|
||||
{
|
||||
"epoch": 0.34313253012048195,
|
||||
"grad_norm": 0.18452070653438568,
|
||||
"learning_rate": 3.997997589849145e-05,
|
||||
"loss": 0.0137,
|
||||
"step": 89
|
||||
},
|
||||
{
|
||||
"epoch": 0.3469879518072289,
|
||||
"grad_norm": 0.24420331418514252,
|
||||
"learning_rate": 3.9975771686375434e-05,
|
||||
"loss": 0.0104,
|
||||
"step": 90
|
||||
},
|
||||
{
|
||||
"epoch": 0.35084337349397593,
|
||||
"grad_norm": 0.3163854479789734,
|
||||
"learning_rate": 3.9971167411282835e-05,
|
||||
"loss": 0.0133,
|
||||
"step": 91
|
||||
},
|
||||
{
|
||||
"epoch": 0.3546987951807229,
|
||||
"grad_norm": 0.11558058857917786,
|
||||
"learning_rate": 3.996616316542537e-05,
|
||||
"loss": 0.0069,
|
||||
"step": 92
|
||||
}
|
||||
],
|
||||
"logging_steps": 1,
|
||||
"max_steps": 780,
|
||||
"num_input_tokens_seen": 0,
|
||||
"num_train_epochs": 3,
|
||||
"save_steps": 92,
|
||||
"stateful_callbacks": {
|
||||
"TrainerControl": {
|
||||
"args": {
|
||||
"should_epoch_stop": false,
|
||||
"should_evaluate": false,
|
||||
"should_log": false,
|
||||
"should_save": true,
|
||||
"should_training_stop": false
|
||||
},
|
||||
"attributes": {}
|
||||
}
|
||||
},
|
||||
"total_flos": 7.051174608015196e+17,
|
||||
"train_batch_size": 4,
|
||||
"trial_name": null,
|
||||
"trial_params": null
|
||||
}
|
||||
3
checkpoint-92/training_args.bin
Normal file
3
checkpoint-92/training_args.bin
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:278dd9cb4a0ad2cab5c6d1358fbf0c25929c01aec5836b90960695f31f47b1b6
|
||||
size 7825
|
||||
Reference in New Issue
Block a user