初始化项目,由ModelHub XC社区提供模型

Model: boradorish/llama3-3B-sft
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-08-14 19:23:19 +08:00
commit bad3f9b85b
116 changed files with 60476 additions and 0 deletions

View File

@@ -0,0 +1,93 @@
{{- bos_token }}
{%- if custom_tools is defined %}
{%- set tools = custom_tools %}
{%- endif %}
{%- if not tools_in_user_message is defined %}
{%- set tools_in_user_message = true %}
{%- endif %}
{%- if not date_string is defined %}
{%- if strftime_now is defined %}
{%- set date_string = strftime_now("%d %b %Y") %}
{%- else %}
{%- set date_string = "26 Jul 2024" %}
{%- endif %}
{%- endif %}
{%- if not tools is defined %}
{%- set tools = none %}
{%- endif %}
{#- This block extracts the system message, so we can slot it into the right place. #}
{%- if messages[0]['role'] == 'system' %}
{%- set system_message = messages[0]['content']|trim %}
{%- set messages = messages[1:] %}
{%- else %}
{%- set system_message = "" %}
{%- endif %}
{#- System message #}
{{- "<|start_header_id|>system<|end_header_id|>\n\n" }}
{%- if tools is not none %}
{{- "Environment: ipython\n" }}
{%- endif %}
{{- "Cutting Knowledge Date: December 2023\n" }}
{{- "Today Date: " + date_string + "\n\n" }}
{%- if tools is not none and not tools_in_user_message %}
{{- "You have access to the following functions. To call a function, please respond with JSON for a function call." }}
{{- 'Respond in the format {"name": function name, "parameters": dictionary of argument name and its value}.' }}
{{- "Do not use variables.\n\n" }}
{%- for t in tools %}
{{- t | tojson(indent=4) }}
{{- "\n\n" }}
{%- endfor %}
{%- endif %}
{{- system_message }}
{{- "<|eot_id|>" }}
{#- Custom tools are passed in a user message with some extra guidance #}
{%- if tools_in_user_message and not tools is none %}
{#- Extract the first user message so we can plug it in here #}
{%- if messages | length != 0 %}
{%- set first_user_message = messages[0]['content']|trim %}
{%- set messages = messages[1:] %}
{%- else %}
{{- raise_exception("Cannot put tools in the first user message when there's no first user message!") }}
{%- endif %}
{{- '<|start_header_id|>user<|end_header_id|>\n\n' -}}
{{- "Given the following functions, please respond with a JSON for a function call " }}
{{- "with its proper arguments that best answers the given prompt.\n\n" }}
{{- 'Respond in the format {"name": function name, "parameters": dictionary of argument name and its value}.' }}
{{- "Do not use variables.\n\n" }}
{%- for t in tools %}
{{- t | tojson(indent=4) }}
{{- "\n\n" }}
{%- endfor %}
{{- first_user_message + "<|eot_id|>"}}
{%- endif %}
{%- for message in messages %}
{%- if not (message.role == 'ipython' or message.role == 'tool' or 'tool_calls' in message) %}
{{- '<|start_header_id|>' + message['role'] + '<|end_header_id|>\n\n'+ message['content'] | trim + '<|eot_id|>' }}
{%- elif 'tool_calls' in message %}
{%- if not message.tool_calls|length == 1 %}
{{- raise_exception("This model only supports single tool-calls at once!") }}
{%- endif %}
{%- set tool_call = message.tool_calls[0].function %}
{{- '<|start_header_id|>assistant<|end_header_id|>\n\n' -}}
{{- '{"name": "' + tool_call.name + '", ' }}
{{- '"parameters": ' }}
{{- tool_call.arguments | tojson }}
{{- "}" }}
{{- "<|eot_id|>" }}
{%- elif message.role == "tool" or message.role == "ipython" %}
{{- "<|start_header_id|>ipython<|end_header_id|>\n\n" }}
{%- if message.content is mapping or message.content is iterable %}
{{- message.content | tojson }}
{%- else %}
{{- message.content }}
{%- endif %}
{{- "<|eot_id|>" }}
{%- endif %}
{%- endfor %}
{%- if add_generation_prompt %}
{{- '<|start_header_id|>assistant<|end_header_id|>\n\n' }}
{%- endif %}

36
checkpoint-92/config.json Normal file
View File

@@ -0,0 +1,36 @@
{
"architectures": [
"LlamaForCausalLM"
],
"attention_bias": false,
"attention_dropout": 0.0,
"bos_token_id": 128000,
"dtype": "bfloat16",
"eos_token_id": 128009,
"head_dim": 128,
"hidden_act": "silu",
"hidden_size": 3072,
"initializer_range": 0.02,
"intermediate_size": 8192,
"max_position_embeddings": 131072,
"mlp_bias": false,
"model_type": "llama",
"num_attention_heads": 24,
"num_hidden_layers": 28,
"num_key_value_heads": 8,
"pad_token_id": 128009,
"pretraining_tp": 1,
"rms_norm_eps": 1e-05,
"rope_scaling": {
"factor": 32.0,
"high_freq_factor": 4.0,
"low_freq_factor": 1.0,
"original_max_position_embeddings": 8192,
"rope_type": "llama3"
},
"rope_theta": 500000.0,
"tie_word_embeddings": true,
"transformers_version": "4.56.2",
"use_cache": false,
"vocab_size": 128256
}

View File

@@ -0,0 +1,14 @@
{
"bos_token_id": 128000,
"do_sample": true,
"eos_token_id": [
128009,
128001,
128008,
128009
],
"pad_token_id": 128009,
"temperature": 0.6,
"top_p": 0.9,
"transformers_version": "4.56.2"
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:9ed471d592fa82d113dbc910673f3c78d23c950c6ffc26c9655428315a6dea8e
size 4965799096

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:5048216cd781cfd10c332634507fa0aad926ce173140cd3968c89bbeae48c13f
size 2247734992

View File

@@ -0,0 +1,263 @@
{
"metadata": {
"total_parameters": 3212749824,
"total_size": 7213504512
},
"weight_map": {
"lm_head.weight": "model-00002-of-00002.safetensors",
"model.embed_tokens.weight": "model-00001-of-00002.safetensors",
"model.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.0.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.0.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.0.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.0.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.1.input_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.1.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.1.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.1.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.1.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.10.input_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.10.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.10.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.10.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.10.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.10.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.10.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.11.input_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.11.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.11.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.11.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.11.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.11.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.12.input_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.12.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.12.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.12.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.12.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.12.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.12.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.12.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.12.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.13.input_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.13.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.13.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.13.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.13.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.13.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.13.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.13.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.13.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.14.input_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.14.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.14.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.14.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.14.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.14.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.14.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.14.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.14.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.15.input_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.15.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.15.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.15.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.15.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.15.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.15.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.16.input_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.16.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.16.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.16.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.16.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.16.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.16.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.16.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.16.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.17.input_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.17.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.17.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.17.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.17.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.17.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.17.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.17.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.17.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.18.input_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.18.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.18.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.18.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.18.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.18.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.18.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.18.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.18.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.19.input_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.19.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.19.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.19.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.19.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.19.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.19.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.19.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.2.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.2.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.2.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.2.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.20.input_layernorm.weight": "model-00002-of-00002.safetensors",
"model.layers.20.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.20.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.20.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.20.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
"model.layers.20.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.20.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.20.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.20.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.21.input_layernorm.weight": "model-00002-of-00002.safetensors",
"model.layers.21.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.21.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.21.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.21.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
"model.layers.21.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.21.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.21.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.21.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.22.input_layernorm.weight": "model-00002-of-00002.safetensors",
"model.layers.22.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.22.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.22.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.22.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
"model.layers.22.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.22.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.22.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.22.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.23.input_layernorm.weight": "model-00002-of-00002.safetensors",
"model.layers.23.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.23.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.23.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.23.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
"model.layers.23.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.23.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.23.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.23.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.24.input_layernorm.weight": "model-00002-of-00002.safetensors",
"model.layers.24.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.24.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.24.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.24.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
"model.layers.24.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.24.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.24.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.24.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.25.input_layernorm.weight": "model-00002-of-00002.safetensors",
"model.layers.25.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.25.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.25.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.25.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
"model.layers.25.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.25.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.25.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.25.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.26.input_layernorm.weight": "model-00002-of-00002.safetensors",
"model.layers.26.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.26.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.26.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.26.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
"model.layers.26.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.26.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.26.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.26.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.27.input_layernorm.weight": "model-00002-of-00002.safetensors",
"model.layers.27.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.27.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.27.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.27.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
"model.layers.27.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.27.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.27.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.27.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
"model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.3.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.3.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.3.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.4.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.4.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.4.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.4.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.4.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.5.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.5.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.5.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.5.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.6.input_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.6.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.6.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.6.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.6.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.6.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.7.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.7.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.7.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.8.input_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.8.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.8.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.8.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.8.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.8.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.8.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.8.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.8.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.9.input_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.9.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.9.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.9.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.9.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
"model.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.9.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.9.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
"model.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
"model.norm.weight": "model-00002-of-00002.safetensors"
}
}

View File

@@ -0,0 +1,26 @@
{
"additional_special_tokens": [
{
"content": "<|eom_id|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
}
],
"bos_token": {
"content": "<|begin_of_text|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"eos_token": {
"content": "<|eot_id|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"pad_token": "<|eot_id|>"
}

BIN
checkpoint-92/tokenizer.json (Stored with Git LFS) Normal file

Binary file not shown.

File diff suppressed because it is too large Load Diff

View File

@@ -0,0 +1,678 @@
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.3546987951807229,
"eval_steps": 500,
"global_step": 92,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0038554216867469878,
"grad_norm": 1.2289724349975586,
"learning_rate": 0.0,
"loss": 0.0363,
"step": 1
},
{
"epoch": 0.0077108433734939755,
"grad_norm": 1.148133635520935,
"learning_rate": 5.128205128205128e-07,
"loss": 0.042,
"step": 2
},
{
"epoch": 0.011566265060240964,
"grad_norm": 1.251704216003418,
"learning_rate": 1.0256410256410257e-06,
"loss": 0.0442,
"step": 3
},
{
"epoch": 0.015421686746987951,
"grad_norm": 1.1709717512130737,
"learning_rate": 1.5384615384615387e-06,
"loss": 0.0363,
"step": 4
},
{
"epoch": 0.01927710843373494,
"grad_norm": 1.1885852813720703,
"learning_rate": 2.0512820512820513e-06,
"loss": 0.0281,
"step": 5
},
{
"epoch": 0.02313253012048193,
"grad_norm": 0.7513725161552429,
"learning_rate": 2.564102564102564e-06,
"loss": 0.0456,
"step": 6
},
{
"epoch": 0.026987951807228915,
"grad_norm": 0.6604480147361755,
"learning_rate": 3.0769230769230774e-06,
"loss": 0.0336,
"step": 7
},
{
"epoch": 0.030843373493975902,
"grad_norm": 0.5245765447616577,
"learning_rate": 3.58974358974359e-06,
"loss": 0.0351,
"step": 8
},
{
"epoch": 0.03469879518072289,
"grad_norm": 0.35446059703826904,
"learning_rate": 4.102564102564103e-06,
"loss": 0.022,
"step": 9
},
{
"epoch": 0.03855421686746988,
"grad_norm": 0.40557414293289185,
"learning_rate": 4.615384615384616e-06,
"loss": 0.0248,
"step": 10
},
{
"epoch": 0.042409638554216866,
"grad_norm": 0.3844715356826782,
"learning_rate": 5.128205128205128e-06,
"loss": 0.0289,
"step": 11
},
{
"epoch": 0.04626506024096386,
"grad_norm": 0.31521302461624146,
"learning_rate": 5.641025641025641e-06,
"loss": 0.0221,
"step": 12
},
{
"epoch": 0.05012048192771084,
"grad_norm": 0.40441566705703735,
"learning_rate": 6.153846153846155e-06,
"loss": 0.0226,
"step": 13
},
{
"epoch": 0.05397590361445783,
"grad_norm": 0.30345258116722107,
"learning_rate": 6.666666666666667e-06,
"loss": 0.0181,
"step": 14
},
{
"epoch": 0.05783132530120482,
"grad_norm": 0.32419148087501526,
"learning_rate": 7.17948717948718e-06,
"loss": 0.0217,
"step": 15
},
{
"epoch": 0.061686746987951804,
"grad_norm": 0.29662227630615234,
"learning_rate": 7.692307692307694e-06,
"loss": 0.0216,
"step": 16
},
{
"epoch": 0.0655421686746988,
"grad_norm": 0.24562332034111023,
"learning_rate": 8.205128205128205e-06,
"loss": 0.0163,
"step": 17
},
{
"epoch": 0.06939759036144579,
"grad_norm": 0.21251554787158966,
"learning_rate": 8.717948717948719e-06,
"loss": 0.0176,
"step": 18
},
{
"epoch": 0.07325301204819278,
"grad_norm": 0.195358544588089,
"learning_rate": 9.230769230769232e-06,
"loss": 0.0121,
"step": 19
},
{
"epoch": 0.07710843373493977,
"grad_norm": 0.1519210785627365,
"learning_rate": 9.743589743589744e-06,
"loss": 0.0103,
"step": 20
},
{
"epoch": 0.08096385542168674,
"grad_norm": 0.29832565784454346,
"learning_rate": 1.0256410256410256e-05,
"loss": 0.0197,
"step": 21
},
{
"epoch": 0.08481927710843373,
"grad_norm": 0.24802711606025696,
"learning_rate": 1.076923076923077e-05,
"loss": 0.0207,
"step": 22
},
{
"epoch": 0.08867469879518072,
"grad_norm": 0.17878903448581696,
"learning_rate": 1.1282051282051283e-05,
"loss": 0.014,
"step": 23
},
{
"epoch": 0.09253012048192771,
"grad_norm": 0.23687325417995453,
"learning_rate": 1.1794871794871796e-05,
"loss": 0.0153,
"step": 24
},
{
"epoch": 0.0963855421686747,
"grad_norm": 0.29058969020843506,
"learning_rate": 1.230769230769231e-05,
"loss": 0.0149,
"step": 25
},
{
"epoch": 0.10024096385542168,
"grad_norm": 0.1624310314655304,
"learning_rate": 1.2820512820512823e-05,
"loss": 0.0127,
"step": 26
},
{
"epoch": 0.10409638554216867,
"grad_norm": 0.27256354689598083,
"learning_rate": 1.3333333333333333e-05,
"loss": 0.0173,
"step": 27
},
{
"epoch": 0.10795180722891566,
"grad_norm": 0.24831782281398773,
"learning_rate": 1.3846153846153847e-05,
"loss": 0.0161,
"step": 28
},
{
"epoch": 0.11180722891566265,
"grad_norm": 0.20417729020118713,
"learning_rate": 1.435897435897436e-05,
"loss": 0.0127,
"step": 29
},
{
"epoch": 0.11566265060240964,
"grad_norm": 0.22253485023975372,
"learning_rate": 1.4871794871794874e-05,
"loss": 0.018,
"step": 30
},
{
"epoch": 0.11951807228915663,
"grad_norm": 0.1634419709444046,
"learning_rate": 1.5384615384615387e-05,
"loss": 0.0092,
"step": 31
},
{
"epoch": 0.12337349397590361,
"grad_norm": 0.16349917650222778,
"learning_rate": 1.5897435897435897e-05,
"loss": 0.0151,
"step": 32
},
{
"epoch": 0.1272289156626506,
"grad_norm": 0.2271573394536972,
"learning_rate": 1.641025641025641e-05,
"loss": 0.0174,
"step": 33
},
{
"epoch": 0.1310843373493976,
"grad_norm": 0.1916988492012024,
"learning_rate": 1.6923076923076924e-05,
"loss": 0.0126,
"step": 34
},
{
"epoch": 0.13493975903614458,
"grad_norm": 0.23479051887989044,
"learning_rate": 1.7435897435897438e-05,
"loss": 0.0116,
"step": 35
},
{
"epoch": 0.13879518072289157,
"grad_norm": 0.18296493589878082,
"learning_rate": 1.794871794871795e-05,
"loss": 0.0133,
"step": 36
},
{
"epoch": 0.14265060240963856,
"grad_norm": 0.12307147681713104,
"learning_rate": 1.8461538461538465e-05,
"loss": 0.0093,
"step": 37
},
{
"epoch": 0.14650602409638555,
"grad_norm": 0.1736001819372177,
"learning_rate": 1.8974358974358975e-05,
"loss": 0.0097,
"step": 38
},
{
"epoch": 0.15036144578313254,
"grad_norm": 0.21048344671726227,
"learning_rate": 1.9487179487179488e-05,
"loss": 0.0121,
"step": 39
},
{
"epoch": 0.15421686746987953,
"grad_norm": 0.18844228982925415,
"learning_rate": 2e-05,
"loss": 0.0145,
"step": 40
},
{
"epoch": 0.1580722891566265,
"grad_norm": 0.24053065478801727,
"learning_rate": 2.0512820512820512e-05,
"loss": 0.0233,
"step": 41
},
{
"epoch": 0.16192771084337348,
"grad_norm": 0.16952425241470337,
"learning_rate": 2.102564102564103e-05,
"loss": 0.024,
"step": 42
},
{
"epoch": 0.16578313253012048,
"grad_norm": 0.1816851794719696,
"learning_rate": 2.153846153846154e-05,
"loss": 0.0165,
"step": 43
},
{
"epoch": 0.16963855421686747,
"grad_norm": 0.17718464136123657,
"learning_rate": 2.2051282051282056e-05,
"loss": 0.0171,
"step": 44
},
{
"epoch": 0.17349397590361446,
"grad_norm": 0.44719773530960083,
"learning_rate": 2.2564102564102566e-05,
"loss": 0.0357,
"step": 45
},
{
"epoch": 0.17734939759036145,
"grad_norm": 0.1649208813905716,
"learning_rate": 2.3076923076923076e-05,
"loss": 0.016,
"step": 46
},
{
"epoch": 0.18120481927710844,
"grad_norm": 0.17772121727466583,
"learning_rate": 2.3589743589743593e-05,
"loss": 0.0106,
"step": 47
},
{
"epoch": 0.18506024096385543,
"grad_norm": 0.30155256390571594,
"learning_rate": 2.4102564102564103e-05,
"loss": 0.0132,
"step": 48
},
{
"epoch": 0.18891566265060242,
"grad_norm": 0.1777803599834442,
"learning_rate": 2.461538461538462e-05,
"loss": 0.0089,
"step": 49
},
{
"epoch": 0.1927710843373494,
"grad_norm": 0.23959968984127045,
"learning_rate": 2.512820512820513e-05,
"loss": 0.0137,
"step": 50
},
{
"epoch": 0.1966265060240964,
"grad_norm": 0.2473219782114029,
"learning_rate": 2.5641025641025646e-05,
"loss": 0.0241,
"step": 51
},
{
"epoch": 0.20048192771084336,
"grad_norm": 0.14216162264347076,
"learning_rate": 2.6153846153846157e-05,
"loss": 0.0089,
"step": 52
},
{
"epoch": 0.20433734939759035,
"grad_norm": 0.16024824976921082,
"learning_rate": 2.6666666666666667e-05,
"loss": 0.0105,
"step": 53
},
{
"epoch": 0.20819277108433734,
"grad_norm": 0.19614927470684052,
"learning_rate": 2.7179487179487183e-05,
"loss": 0.0102,
"step": 54
},
{
"epoch": 0.21204819277108433,
"grad_norm": 0.18651551008224487,
"learning_rate": 2.7692307692307694e-05,
"loss": 0.0109,
"step": 55
},
{
"epoch": 0.21590361445783132,
"grad_norm": 0.1358720362186432,
"learning_rate": 2.820512820512821e-05,
"loss": 0.0082,
"step": 56
},
{
"epoch": 0.2197590361445783,
"grad_norm": 0.13998733460903168,
"learning_rate": 2.871794871794872e-05,
"loss": 0.0081,
"step": 57
},
{
"epoch": 0.2236144578313253,
"grad_norm": 0.1299574077129364,
"learning_rate": 2.923076923076923e-05,
"loss": 0.0067,
"step": 58
},
{
"epoch": 0.2274698795180723,
"grad_norm": 0.17477169632911682,
"learning_rate": 2.9743589743589747e-05,
"loss": 0.0091,
"step": 59
},
{
"epoch": 0.23132530120481928,
"grad_norm": 0.27078455686569214,
"learning_rate": 3.0256410256410257e-05,
"loss": 0.0128,
"step": 60
},
{
"epoch": 0.23518072289156627,
"grad_norm": 0.2184700220823288,
"learning_rate": 3.0769230769230774e-05,
"loss": 0.0236,
"step": 61
},
{
"epoch": 0.23903614457831326,
"grad_norm": 0.21013228595256805,
"learning_rate": 3.128205128205129e-05,
"loss": 0.0114,
"step": 62
},
{
"epoch": 0.24289156626506025,
"grad_norm": 0.4988560974597931,
"learning_rate": 3.1794871794871795e-05,
"loss": 0.0111,
"step": 63
},
{
"epoch": 0.24674698795180722,
"grad_norm": 0.18484456837177277,
"learning_rate": 3.230769230769231e-05,
"loss": 0.0104,
"step": 64
},
{
"epoch": 0.25060240963855424,
"grad_norm": 0.19871847331523895,
"learning_rate": 3.282051282051282e-05,
"loss": 0.0094,
"step": 65
},
{
"epoch": 0.2544578313253012,
"grad_norm": 0.17952671647071838,
"learning_rate": 3.3333333333333335e-05,
"loss": 0.0127,
"step": 66
},
{
"epoch": 0.2583132530120482,
"grad_norm": 0.29055604338645935,
"learning_rate": 3.384615384615385e-05,
"loss": 0.023,
"step": 67
},
{
"epoch": 0.2621686746987952,
"grad_norm": 0.2033795416355133,
"learning_rate": 3.435897435897436e-05,
"loss": 0.0091,
"step": 68
},
{
"epoch": 0.26602409638554214,
"grad_norm": 0.2499230057001114,
"learning_rate": 3.4871794871794875e-05,
"loss": 0.0221,
"step": 69
},
{
"epoch": 0.26987951807228916,
"grad_norm": 0.22038578987121582,
"learning_rate": 3.538461538461539e-05,
"loss": 0.0139,
"step": 70
},
{
"epoch": 0.2737349397590361,
"grad_norm": 0.14657297730445862,
"learning_rate": 3.58974358974359e-05,
"loss": 0.0104,
"step": 71
},
{
"epoch": 0.27759036144578314,
"grad_norm": 0.23861773312091827,
"learning_rate": 3.6410256410256416e-05,
"loss": 0.0126,
"step": 72
},
{
"epoch": 0.2814457831325301,
"grad_norm": 0.21007320284843445,
"learning_rate": 3.692307692307693e-05,
"loss": 0.0133,
"step": 73
},
{
"epoch": 0.2853012048192771,
"grad_norm": 0.20938654243946075,
"learning_rate": 3.7435897435897436e-05,
"loss": 0.0116,
"step": 74
},
{
"epoch": 0.2891566265060241,
"grad_norm": 0.27394789457321167,
"learning_rate": 3.794871794871795e-05,
"loss": 0.0158,
"step": 75
},
{
"epoch": 0.2930120481927711,
"grad_norm": 0.1749437153339386,
"learning_rate": 3.846153846153846e-05,
"loss": 0.0097,
"step": 76
},
{
"epoch": 0.29686746987951806,
"grad_norm": 0.2208889275789261,
"learning_rate": 3.8974358974358976e-05,
"loss": 0.024,
"step": 77
},
{
"epoch": 0.3007228915662651,
"grad_norm": 0.32802650332450867,
"learning_rate": 3.948717948717949e-05,
"loss": 0.015,
"step": 78
},
{
"epoch": 0.30457831325301205,
"grad_norm": 0.21527938544750214,
"learning_rate": 4e-05,
"loss": 0.0137,
"step": 79
},
{
"epoch": 0.30843373493975906,
"grad_norm": 0.2894026041030884,
"learning_rate": 3.999979972589652e-05,
"loss": 0.0177,
"step": 80
},
{
"epoch": 0.312289156626506,
"grad_norm": 0.21148355305194855,
"learning_rate": 3.9999198907597046e-05,
"loss": 0.0146,
"step": 81
},
{
"epoch": 0.316144578313253,
"grad_norm": 0.1950712502002716,
"learning_rate": 3.999819755713442e-05,
"loss": 0.0174,
"step": 82
},
{
"epoch": 0.32,
"grad_norm": 0.23408709466457367,
"learning_rate": 3.9996795694563096e-05,
"loss": 0.0142,
"step": 83
},
{
"epoch": 0.32385542168674697,
"grad_norm": 0.4009031355381012,
"learning_rate": 3.999499334795875e-05,
"loss": 0.014,
"step": 84
},
{
"epoch": 0.327710843373494,
"grad_norm": 0.2507084012031555,
"learning_rate": 3.999279055341771e-05,
"loss": 0.013,
"step": 85
},
{
"epoch": 0.33156626506024095,
"grad_norm": 0.2922132909297943,
"learning_rate": 3.999018735505626e-05,
"loss": 0.013,
"step": 86
},
{
"epoch": 0.33542168674698797,
"grad_norm": 0.2073613405227661,
"learning_rate": 3.998718380500971e-05,
"loss": 0.0107,
"step": 87
},
{
"epoch": 0.33927710843373493,
"grad_norm": 0.3113904595375061,
"learning_rate": 3.998377996343139e-05,
"loss": 0.0337,
"step": 88
},
{
"epoch": 0.34313253012048195,
"grad_norm": 0.18452070653438568,
"learning_rate": 3.997997589849145e-05,
"loss": 0.0137,
"step": 89
},
{
"epoch": 0.3469879518072289,
"grad_norm": 0.24420331418514252,
"learning_rate": 3.9975771686375434e-05,
"loss": 0.0104,
"step": 90
},
{
"epoch": 0.35084337349397593,
"grad_norm": 0.3163854479789734,
"learning_rate": 3.9971167411282835e-05,
"loss": 0.0133,
"step": 91
},
{
"epoch": 0.3546987951807229,
"grad_norm": 0.11558058857917786,
"learning_rate": 3.996616316542537e-05,
"loss": 0.0069,
"step": 92
}
],
"logging_steps": 1,
"max_steps": 780,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 92,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 7.051174608015196e+17,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:278dd9cb4a0ad2cab5c6d1358fbf0c25929c01aec5836b90960695f31f47b1b6
size 7825