初始化项目,由ModelHub XC社区提供模型
Model: sudhisrk1982/slm-125m-instruct Source: Original Platform
This commit is contained in:
35
.gitattributes
vendored
Normal file
35
.gitattributes
vendored
Normal file
@@ -0,0 +1,35 @@
|
|||||||
|
*.7z filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.arrow filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.bin filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.bz2 filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ckpt filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ftz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.gz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.h5 filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.joblib filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.lfs.* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.mlmodel filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.model filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.msgpack filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.npy filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.npz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.onnx filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ot filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.parquet filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pb filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pickle filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pkl filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pt filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pth filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.rar filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tar.* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tar filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tflite filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tgz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.wasm filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.xz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.zip filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.zst filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
||||||
35
README.md
Normal file
35
README.md
Normal file
@@ -0,0 +1,35 @@
|
|||||||
|
---
|
||||||
|
license: apache-2.0
|
||||||
|
base_model: thesreedath/slm-125m-base
|
||||||
|
pipeline_tag: text-generation
|
||||||
|
---
|
||||||
|
|
||||||
|
# slm-125m-instruct
|
||||||
|
|
||||||
|
Instruction-tuned from [`thesreedath/slm-125m-base`](thesreedath/slm-125m-base) on 9,071 legal/financial
|
||||||
|
Q&A pairs generated from a case-law + SEC-filing corpus.
|
||||||
|
|
||||||
|
## Training
|
||||||
|
|
||||||
|
- **Base**: 125.8M params (12L / 768d / 16,384 vocab)
|
||||||
|
- **Data**: 9,071 Q&A pairs, LLM-judged (90.7% pass rate) from 19,775 raw
|
||||||
|
- **Method**: full SFT, prompt tokens masked from the loss (answer-only training)
|
||||||
|
- **Hyperparameters**: lr 2e-5, cosine decay, 3 epochs, bf16, 1xA100
|
||||||
|
- **Best val loss**: 1.914
|
||||||
|
|
||||||
|
## Chat format
|
||||||
|
|
||||||
|
```
|
||||||
|
<|bos|><|system|>{system}<|user|>{question}<|assistant|>{answer}<|eos|>
|
||||||
|
```
|
||||||
|
|
||||||
|
## Note on token ids
|
||||||
|
|
||||||
|
The base repo's `config.json` declares `eos_token_id: 2`, but id 2 is `<|pad|>`
|
||||||
|
in the tokenizer -- `<|eos|>` is id 1. This model ships the **corrected** ids
|
||||||
|
(`bos=0, eos=1, pad=2`), so generation terminates properly.
|
||||||
|
|
||||||
|
## Limitations
|
||||||
|
|
||||||
|
125M parameters trained on ~9k pairs. It answers in the right form and stops
|
||||||
|
cleanly, but factual accuracy is limited -- verify anything load-bearing.
|
||||||
31
config.json
Normal file
31
config.json
Normal file
@@ -0,0 +1,31 @@
|
|||||||
|
{
|
||||||
|
"_name_or_path": "/data/ft/base_hf",
|
||||||
|
"architectures": [
|
||||||
|
"LlamaForCausalLM"
|
||||||
|
],
|
||||||
|
"attention_bias": false,
|
||||||
|
"attention_dropout": 0.0,
|
||||||
|
"bos_token_id": 0,
|
||||||
|
"eos_token_id": 1,
|
||||||
|
"head_dim": 64,
|
||||||
|
"hidden_act": "silu",
|
||||||
|
"hidden_size": 768,
|
||||||
|
"initializer_range": 0.02,
|
||||||
|
"intermediate_size": 3072,
|
||||||
|
"max_position_embeddings": 1024,
|
||||||
|
"mlp_bias": false,
|
||||||
|
"model_type": "llama",
|
||||||
|
"num_attention_heads": 12,
|
||||||
|
"num_hidden_layers": 12,
|
||||||
|
"num_key_value_heads": 12,
|
||||||
|
"pad_token_id": 2,
|
||||||
|
"pretraining_tp": 1,
|
||||||
|
"rms_norm_eps": 1e-05,
|
||||||
|
"rope_scaling": null,
|
||||||
|
"rope_theta": 10000.0,
|
||||||
|
"tie_word_embeddings": true,
|
||||||
|
"torch_dtype": "float32",
|
||||||
|
"transformers_version": "4.46.3",
|
||||||
|
"use_cache": true,
|
||||||
|
"vocab_size": 16384
|
||||||
|
}
|
||||||
7
generation_config.json
Normal file
7
generation_config.json
Normal file
@@ -0,0 +1,7 @@
|
|||||||
|
{
|
||||||
|
"_from_model_config": true,
|
||||||
|
"bos_token_id": 0,
|
||||||
|
"eos_token_id": 1,
|
||||||
|
"pad_token_id": 2,
|
||||||
|
"transformers_version": "4.46.3"
|
||||||
|
}
|
||||||
47
metrics.jsonl
Normal file
47
metrics.jsonl
Normal file
@@ -0,0 +1,47 @@
|
|||||||
|
{"step": 10, "loss": 2.2878265976905823, "lr": 1.3209369384267192e-05, "tokens": 67923}
|
||||||
|
{"step": 20, "loss": 2.0363942682743073, "lr": 2.122748269375499e-06, "tokens": 134692}
|
||||||
|
{"step": 10, "loss": 2.939354717731476, "lr": 1.6666666666666667e-05, "tokens": 67923}
|
||||||
|
{"step": 20, "loss": 2.0424506664276123, "lr": 1.998653681152175e-05, "tokens": 134692}
|
||||||
|
{"step": 30, "loss": 1.9076462984085083, "lr": 1.9920691611412843e-05, "tokens": 201392}
|
||||||
|
{"step": 40, "loss": 1.9740137159824371, "lr": 1.9800392995936507e-05, "tokens": 267471}
|
||||||
|
{"step": 50, "loss": 1.913064181804657, "lr": 1.962637528825534e-05, "tokens": 334375}
|
||||||
|
{"step": 60, "loss": 1.7881331741809845, "lr": 1.9399700721986473e-05, "tokens": 402430}
|
||||||
|
{"step": 70, "loss": 1.9035142958164215, "lr": 1.9121752957147297e-05, "tokens": 469241}
|
||||||
|
{"step": 80, "loss": 1.8412806689739227, "lr": 1.879422863405995e-05, "tokens": 536482}
|
||||||
|
{"step": 90, "loss": 1.7583129703998566, "lr": 1.8419127016770864e-05, "tokens": 602791}
|
||||||
|
{"step": 100, "loss": 1.7790607213974, "lr": 1.799873778920377e-05, "tokens": 669064}
|
||||||
|
{"step": 100, "val_loss": 1.9379150072733562}
|
||||||
|
{"step": 110, "loss": 1.8393255770206451, "lr": 1.7535627078540492e-05, "tokens": 735863}
|
||||||
|
{"step": 120, "loss": 1.9139473736286163, "lr": 1.703262179114518e-05, "tokens": 803061}
|
||||||
|
{"step": 130, "loss": 1.8058326840400696, "lr": 1.649279235664813e-05, "tokens": 869630}
|
||||||
|
{"step": 140, "loss": 1.7196030020713806, "lr": 1.5919433985522342e-05, "tokens": 936535}
|
||||||
|
{"step": 150, "loss": 1.6133844256401062, "lr": 1.5316046554559582e-05, "tokens": 1003191}
|
||||||
|
{"step": 160, "loss": 1.653269112110138, "lr": 1.4686313243028558e-05, "tokens": 1070088}
|
||||||
|
{"step": 170, "loss": 1.6329366564750671, "lr": 1.4034078049923656e-05, "tokens": 1136019}
|
||||||
|
{"step": 180, "loss": 1.5611399412155151, "lr": 1.3363322329542786e-05, "tokens": 1202840}
|
||||||
|
{"step": 190, "loss": 1.5885104835033417, "lr": 1.267814048862513e-05, "tokens": 1269825}
|
||||||
|
{"step": 200, "loss": 1.7346630096435547, "lr": 1.1982714993397636e-05, "tokens": 1336813}
|
||||||
|
{"step": 200, "val_loss": 1.9249826570351918}
|
||||||
|
{"step": 210, "loss": 1.5117279589176178, "lr": 1.128129083909142e-05, "tokens": 1403598}
|
||||||
|
{"step": 220, "loss": 1.7542182803153992, "lr": 1.0578149637770539e-05, "tokens": 1471244}
|
||||||
|
{"step": 230, "loss": 1.6589492857456207, "lr": 9.877583482645404e-06, "tokens": 1537546}
|
||||||
|
{"step": 240, "loss": 1.7250402867794037, "lr": 9.183868748407478e-06, "tokens": 1603870}
|
||||||
|
{"step": 250, "loss": 1.7548629939556122, "lr": 8.501239987512493e-06, "tokens": 1671064}
|
||||||
|
{"step": 260, "loss": 1.7600372731685638, "lr": 7.8338640817537e-06, "tokens": 1738838}
|
||||||
|
{"step": 270, "loss": 1.6335144340991974, "lr": 7.185814806908302e-06, "tokens": 1806443}
|
||||||
|
{"step": 280, "loss": 1.5377205610275269, "lr": 6.561047965718835e-06, "tokens": 1872793}
|
||||||
|
{"step": 290, "loss": 1.515916258096695, "lr": 5.963377241001944e-06, "tokens": 1939412}
|
||||||
|
{"step": 300, "loss": 1.5368092954158783, "lr": 5.39645091628134e-06, "tokens": 2005736}
|
||||||
|
{"step": 300, "val_loss": 1.9303301175435383}
|
||||||
|
{"step": 310, "loss": 1.4315034747123718, "lr": 4.86372960604606e-06, "tokens": 2072443}
|
||||||
|
{"step": 320, "loss": 1.593166470527649, "lr": 4.368465131572412e-06, "tokens": 2139624}
|
||||||
|
{"step": 330, "loss": 1.5019963383674622, "lr": 3.9136806712550715e-06, "tokens": 2206903}
|
||||||
|
{"step": 340, "loss": 1.5305356681346893, "lr": 3.502152306613177e-06, "tokens": 2273390}
|
||||||
|
{"step": 350, "loss": 1.4501506686210632, "lr": 3.1363920766176304e-06, "tokens": 2341349}
|
||||||
|
{"step": 360, "loss": 1.4948653876781464, "lr": 2.81863264377897e-06, "tokens": 2409665}
|
||||||
|
{"step": 370, "loss": 1.492090880870819, "lr": 2.5508136655965227e-06, "tokens": 2475673}
|
||||||
|
{"step": 380, "loss": 1.5593148171901703, "lr": 2.334569954559895e-06, "tokens": 2543110}
|
||||||
|
{"step": 390, "loss": 1.5064437985420227, "lr": 2.1712214989761126e-06, "tokens": 2608734}
|
||||||
|
{"step": 400, "loss": 1.5970333516597748, "lr": 2.061765405537013e-06, "tokens": 2675708}
|
||||||
|
{"step": 400, "val_loss": 1.9279668629169464}
|
||||||
|
{"step": 410, "loss": 1.4075163304805756, "lr": 2.006869812810786e-06, "tokens": 2742536}
|
||||||
3
model.safetensors
Normal file
3
model.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:92445334200b736dbb5c14bc2c49e5bb736f2afec39bb7c1023281260f43042b
|
||||||
|
size 503405488
|
||||||
6
special_tokens_map.json
Normal file
6
special_tokens_map.json
Normal file
@@ -0,0 +1,6 @@
|
|||||||
|
{
|
||||||
|
"bos_token": "<|bos|>",
|
||||||
|
"eos_token": "<|eos|>",
|
||||||
|
"pad_token": "<|pad|>",
|
||||||
|
"unk_token": "<|unk|>"
|
||||||
|
}
|
||||||
80966
tokenizer.json
Normal file
80966
tokenizer.json
Normal file
File diff suppressed because it is too large
Load Diff
67
tokenizer_config.json
Normal file
67
tokenizer_config.json
Normal file
@@ -0,0 +1,67 @@
|
|||||||
|
{
|
||||||
|
"added_tokens_decoder": {
|
||||||
|
"0": {
|
||||||
|
"content": "<|bos|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"1": {
|
||||||
|
"content": "<|eos|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"2": {
|
||||||
|
"content": "<|pad|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"3": {
|
||||||
|
"content": "<|unk|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"4": {
|
||||||
|
"content": "<|user|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"5": {
|
||||||
|
"content": "<|assistant|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"6": {
|
||||||
|
"content": "<|system|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"bos_token": "<|bos|>",
|
||||||
|
"clean_up_tokenization_spaces": false,
|
||||||
|
"eos_token": "<|eos|>",
|
||||||
|
"model_max_length": 1000000000000000019884624838656,
|
||||||
|
"pad_token": "<|pad|>",
|
||||||
|
"tokenizer_class": "PreTrainedTokenizerFast",
|
||||||
|
"unk_token": "<|unk|>"
|
||||||
|
}
|
||||||
Reference in New Issue
Block a user