初始化项目,由ModelHub XC社区提供模型

Model: sudhisrk1982/slm-125m-instruct
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-08-03 03:55:17 +08:00
commit a786622aef
9 changed files with 81197 additions and 0 deletions

35
.gitattributes vendored Normal file
View File

@@ -0,0 +1,35 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bin filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ckpt filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.mlmodel filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.npy filter=lfs diff=lfs merge=lfs -text
*.npz filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pickle filter=lfs diff=lfs merge=lfs -text
*.pkl filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
*.safetensors filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tar filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.wasm filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text

35
README.md Normal file
View File

@@ -0,0 +1,35 @@
---
license: apache-2.0
base_model: thesreedath/slm-125m-base
pipeline_tag: text-generation
---
# slm-125m-instruct
Instruction-tuned from [`thesreedath/slm-125m-base`](thesreedath/slm-125m-base) on 9,071 legal/financial
Q&A pairs generated from a case-law + SEC-filing corpus.
## Training
- **Base**: 125.8M params (12L / 768d / 16,384 vocab)
- **Data**: 9,071 Q&A pairs, LLM-judged (90.7% pass rate) from 19,775 raw
- **Method**: full SFT, prompt tokens masked from the loss (answer-only training)
- **Hyperparameters**: lr 2e-5, cosine decay, 3 epochs, bf16, 1xA100
- **Best val loss**: 1.914
## Chat format
```
<|bos|><|system|>{system}<|user|>{question}<|assistant|>{answer}<|eos|>
```
## Note on token ids
The base repo's `config.json` declares `eos_token_id: 2`, but id 2 is `<|pad|>`
in the tokenizer -- `<|eos|>` is id 1. This model ships the **corrected** ids
(`bos=0, eos=1, pad=2`), so generation terminates properly.
## Limitations
125M parameters trained on ~9k pairs. It answers in the right form and stops
cleanly, but factual accuracy is limited -- verify anything load-bearing.

31
config.json Normal file
View File

@@ -0,0 +1,31 @@
{
"_name_or_path": "/data/ft/base_hf",
"architectures": [
"LlamaForCausalLM"
],
"attention_bias": false,
"attention_dropout": 0.0,
"bos_token_id": 0,
"eos_token_id": 1,
"head_dim": 64,
"hidden_act": "silu",
"hidden_size": 768,
"initializer_range": 0.02,
"intermediate_size": 3072,
"max_position_embeddings": 1024,
"mlp_bias": false,
"model_type": "llama",
"num_attention_heads": 12,
"num_hidden_layers": 12,
"num_key_value_heads": 12,
"pad_token_id": 2,
"pretraining_tp": 1,
"rms_norm_eps": 1e-05,
"rope_scaling": null,
"rope_theta": 10000.0,
"tie_word_embeddings": true,
"torch_dtype": "float32",
"transformers_version": "4.46.3",
"use_cache": true,
"vocab_size": 16384
}

7
generation_config.json Normal file
View File

@@ -0,0 +1,7 @@
{
"_from_model_config": true,
"bos_token_id": 0,
"eos_token_id": 1,
"pad_token_id": 2,
"transformers_version": "4.46.3"
}

47
metrics.jsonl Normal file
View File

@@ -0,0 +1,47 @@
{"step": 10, "loss": 2.2878265976905823, "lr": 1.3209369384267192e-05, "tokens": 67923}
{"step": 20, "loss": 2.0363942682743073, "lr": 2.122748269375499e-06, "tokens": 134692}
{"step": 10, "loss": 2.939354717731476, "lr": 1.6666666666666667e-05, "tokens": 67923}
{"step": 20, "loss": 2.0424506664276123, "lr": 1.998653681152175e-05, "tokens": 134692}
{"step": 30, "loss": 1.9076462984085083, "lr": 1.9920691611412843e-05, "tokens": 201392}
{"step": 40, "loss": 1.9740137159824371, "lr": 1.9800392995936507e-05, "tokens": 267471}
{"step": 50, "loss": 1.913064181804657, "lr": 1.962637528825534e-05, "tokens": 334375}
{"step": 60, "loss": 1.7881331741809845, "lr": 1.9399700721986473e-05, "tokens": 402430}
{"step": 70, "loss": 1.9035142958164215, "lr": 1.9121752957147297e-05, "tokens": 469241}
{"step": 80, "loss": 1.8412806689739227, "lr": 1.879422863405995e-05, "tokens": 536482}
{"step": 90, "loss": 1.7583129703998566, "lr": 1.8419127016770864e-05, "tokens": 602791}
{"step": 100, "loss": 1.7790607213974, "lr": 1.799873778920377e-05, "tokens": 669064}
{"step": 100, "val_loss": 1.9379150072733562}
{"step": 110, "loss": 1.8393255770206451, "lr": 1.7535627078540492e-05, "tokens": 735863}
{"step": 120, "loss": 1.9139473736286163, "lr": 1.703262179114518e-05, "tokens": 803061}
{"step": 130, "loss": 1.8058326840400696, "lr": 1.649279235664813e-05, "tokens": 869630}
{"step": 140, "loss": 1.7196030020713806, "lr": 1.5919433985522342e-05, "tokens": 936535}
{"step": 150, "loss": 1.6133844256401062, "lr": 1.5316046554559582e-05, "tokens": 1003191}
{"step": 160, "loss": 1.653269112110138, "lr": 1.4686313243028558e-05, "tokens": 1070088}
{"step": 170, "loss": 1.6329366564750671, "lr": 1.4034078049923656e-05, "tokens": 1136019}
{"step": 180, "loss": 1.5611399412155151, "lr": 1.3363322329542786e-05, "tokens": 1202840}
{"step": 190, "loss": 1.5885104835033417, "lr": 1.267814048862513e-05, "tokens": 1269825}
{"step": 200, "loss": 1.7346630096435547, "lr": 1.1982714993397636e-05, "tokens": 1336813}
{"step": 200, "val_loss": 1.9249826570351918}
{"step": 210, "loss": 1.5117279589176178, "lr": 1.128129083909142e-05, "tokens": 1403598}
{"step": 220, "loss": 1.7542182803153992, "lr": 1.0578149637770539e-05, "tokens": 1471244}
{"step": 230, "loss": 1.6589492857456207, "lr": 9.877583482645404e-06, "tokens": 1537546}
{"step": 240, "loss": 1.7250402867794037, "lr": 9.183868748407478e-06, "tokens": 1603870}
{"step": 250, "loss": 1.7548629939556122, "lr": 8.501239987512493e-06, "tokens": 1671064}
{"step": 260, "loss": 1.7600372731685638, "lr": 7.8338640817537e-06, "tokens": 1738838}
{"step": 270, "loss": 1.6335144340991974, "lr": 7.185814806908302e-06, "tokens": 1806443}
{"step": 280, "loss": 1.5377205610275269, "lr": 6.561047965718835e-06, "tokens": 1872793}
{"step": 290, "loss": 1.515916258096695, "lr": 5.963377241001944e-06, "tokens": 1939412}
{"step": 300, "loss": 1.5368092954158783, "lr": 5.39645091628134e-06, "tokens": 2005736}
{"step": 300, "val_loss": 1.9303301175435383}
{"step": 310, "loss": 1.4315034747123718, "lr": 4.86372960604606e-06, "tokens": 2072443}
{"step": 320, "loss": 1.593166470527649, "lr": 4.368465131572412e-06, "tokens": 2139624}
{"step": 330, "loss": 1.5019963383674622, "lr": 3.9136806712550715e-06, "tokens": 2206903}
{"step": 340, "loss": 1.5305356681346893, "lr": 3.502152306613177e-06, "tokens": 2273390}
{"step": 350, "loss": 1.4501506686210632, "lr": 3.1363920766176304e-06, "tokens": 2341349}
{"step": 360, "loss": 1.4948653876781464, "lr": 2.81863264377897e-06, "tokens": 2409665}
{"step": 370, "loss": 1.492090880870819, "lr": 2.5508136655965227e-06, "tokens": 2475673}
{"step": 380, "loss": 1.5593148171901703, "lr": 2.334569954559895e-06, "tokens": 2543110}
{"step": 390, "loss": 1.5064437985420227, "lr": 2.1712214989761126e-06, "tokens": 2608734}
{"step": 400, "loss": 1.5970333516597748, "lr": 2.061765405537013e-06, "tokens": 2675708}
{"step": 400, "val_loss": 1.9279668629169464}
{"step": 410, "loss": 1.4075163304805756, "lr": 2.006869812810786e-06, "tokens": 2742536}

3
model.safetensors Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:92445334200b736dbb5c14bc2c49e5bb736f2afec39bb7c1023281260f43042b
size 503405488

6
special_tokens_map.json Normal file
View File

@@ -0,0 +1,6 @@
{
"bos_token": "<|bos|>",
"eos_token": "<|eos|>",
"pad_token": "<|pad|>",
"unk_token": "<|unk|>"
}

80966
tokenizer.json Normal file

File diff suppressed because it is too large Load Diff

67
tokenizer_config.json Normal file
View File

@@ -0,0 +1,67 @@
{
"added_tokens_decoder": {
"0": {
"content": "<|bos|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"1": {
"content": "<|eos|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"2": {
"content": "<|pad|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"3": {
"content": "<|unk|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"4": {
"content": "<|user|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"5": {
"content": "<|assistant|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"6": {
"content": "<|system|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
}
},
"bos_token": "<|bos|>",
"clean_up_tokenization_spaces": false,
"eos_token": "<|eos|>",
"model_max_length": 1000000000000000019884624838656,
"pad_token": "<|pad|>",
"tokenizer_class": "PreTrainedTokenizerFast",
"unk_token": "<|unk|>"
}