78 lines
2.8 KiB
Markdown
78 lines
2.8 KiB
Markdown
|
|
---
|
||
|
|
language:
|
||
|
|
- nl
|
||
|
|
license: apache-2.0
|
||
|
|
pipeline_tag: text-generation
|
||
|
|
library_name: transformers
|
||
|
|
base_model: kamoo-ai/kamoo-one-135m
|
||
|
|
tags:
|
||
|
|
- dutch
|
||
|
|
- nederlands
|
||
|
|
- sovereign-ai
|
||
|
|
- small-language-model
|
||
|
|
- instruct
|
||
|
|
- chat
|
||
|
|
---
|
||
|
|
|
||
|
|
# kamoo-one-135m-instruct
|
||
|
|
|
||
|
|
**De instruct-variant van [kamoo-one-135m](https://huggingface.co/kamoo-ai/kamoo-one-135m): volgt Nederlandse instructies, antwoordt in ChatML en stopt netjes na zijn antwoord.**
|
||
|
|
|
||
|
|
Volledige fine-tune (assistant-only loss) van het basismodel op 22.636
|
||
|
|
Nederlandse instructievoorbeelden over negen taaktypes: instructies volgen,
|
||
|
|
kort vraag-antwoord, herschrijven naar B1, samenvatten, meerbeurten-chat,
|
||
|
|
JSON-extractie, gegrond vraag-antwoord, weigeren bij
|
||
|
|
onzekerheid/privacy, en classificeren/routeren. De tokenizer is uitgebreid
|
||
|
|
met ChatML-tokens (vocab 32.832); `<|im_end|>` is het stopteken.
|
||
|
|
|
||
|
|
## Gebruik
|
||
|
|
|
||
|
|
```bash
|
||
|
|
vllm serve kamoo-ai/kamoo-one-135m-instruct --max-model-len 1024
|
||
|
|
```
|
||
|
|
|
||
|
|
```python
|
||
|
|
from transformers import pipeline
|
||
|
|
pipe = pipeline("text-generation", model="kamoo-ai/kamoo-one-135m-instruct")
|
||
|
|
out = pipe([
|
||
|
|
{"role": "system", "content": "Je bent Kamoo, een behulpzame Nederlandstalige AI-assistent. Antwoord helder, feitelijk en beknopt."},
|
||
|
|
{"role": "user", "content": "Herschrijf naar eenvoudig Nederlands: De aanvraag wordt buiten behandeling gesteld."},
|
||
|
|
], max_new_tokens=80)
|
||
|
|
```
|
||
|
|
|
||
|
|
Geef altijd een systeemprompt mee die de taak stuurt; zonder systeemprompt
|
||
|
|
kan het model in de verkeerde taakmodus schieten.
|
||
|
|
|
||
|
|
## Trainingsdetails
|
||
|
|
|
||
|
|
- Basis: kamoo-one-135m (v0.8-corpus, 7,3 mld Nederlandse tokens; zie de
|
||
|
|
model card van het basismodel voor de volledige datastamboom).
|
||
|
|
- SFT: 2 epochs over 2,9M tokens, assistant-only loss, lr 5e-5.
|
||
|
|
- SFT-data: kamoo-sft v0.3-everyday, 22.636 synthetische, getemplate
|
||
|
|
Nederlandse voorbeelden (geen klant- of persoonsdata).
|
||
|
|
|
||
|
|
## Grenzen, eerlijk
|
||
|
|
|
||
|
|
Alles wat voor het basismodel geldt (geen betrouwbare parametrische feiten,
|
||
|
|
alleen Nederlands, 1.024 context), plus specifiek voor deze versie:
|
||
|
|
|
||
|
|
- **Vorm is sterker dan trouw.** Het model houdt zich goed aan formats
|
||
|
|
(JSON-schema's, B1-register, beknopt antwoorden) maar kan bij extractie
|
||
|
|
waarden invullen die niet letterlijk in de invoer staan. Controleer
|
||
|
|
extractie-output tegen de bron; gebruik het niet ongecontroleerd voor
|
||
|
|
gegevensinvoer.
|
||
|
|
- De SFT-data is volledig synthetisch/getemplated (v0.3); een versie met
|
||
|
|
meer gegronde en diverse voorbeelden is in ontwikkeling.
|
||
|
|
|
||
|
|
## English summary
|
||
|
|
|
||
|
|
Instruction-tuned variant of the from-scratch Dutch 135M model
|
||
|
|
kamoo-one-135m. ChatML format, stops correctly, strong at format-following
|
||
|
|
(JSON, register rewriting, summarizing); extraction faithfulness is a known
|
||
|
|
limitation of the v0.3 templated SFT data. Apache-2.0. Built by
|
||
|
|
[kamoo](https://kamoo.nl).
|
||
|
|
|
||
|
|
---
|
||
|
|
|
||
|
|
*kamoo · [kamoo.nl](https://kamoo.nl) · [platform.kamoo.nl](https://platform.kamoo.nl)*
|