Model: PraxySante/qwen3-0.6b-sft-asr-correction-v15-context-full Source: Original Platform
1.2 KiB
1.2 KiB
license, language, pipeline_tag, tags
| license | language | pipeline_tag | tags | ||||||
|---|---|---|---|---|---|---|---|---|---|
| mit |
|
text-generation |
|
Qwen3-0.6B-SFT-ASR-Correction-FR v15-context-full
Modele final de fine-tuning SFT avec contexte pour la correction d'erreurs ASR medicales en francais.
Configuration
- Base model: Qwen/Qwen3-0.6B
- Fine-tuning: SFT (Supervised Fine-Tuning)
- Context: Oui (3 champs: context, input errone, target corrige)
- Dataset: merged_with_context.jsonl (~5.5M paires)
- GPUs: 3x Tesla V100-SXM3-32GB
- Effective batch size: 48 (3 GPUs x 4 batch x 4 grad accum)
- Learning rate: 5e-6
- Max seq length: 384
- Steps: 79 836 (1 epoch)
Metriques finales
- Train loss: 0.0726
- Best eval loss: 0.073076
- Global step: 79836
Courbe d'evaluation
- step=1000: eval_loss=0.076286
- step=11000: eval_loss=0.073498
- step=21000: eval_loss=0.073254
- step=31000: eval_loss=0.073145
- step=41000: eval_loss=0.073099
- step=51000: eval_loss=0.073082
- step=61000: eval_loss=0.073087
- step=71000: eval_loss=0.073086
Reprise d'entrainement
Ce modele a ete repris depuis le checkpoint-31000 de v15-context-continued.