Files
ModelHub XC dd885cee22 初始化项目,由ModelHub XC社区提供模型
Model: PraxySante/qwen3-0.6b-sft-asr-correction-v15-context-full
Source: Original Platform
2026-07-21 01:45:10 +08:00

44 lines
1.2 KiB
Markdown

---
license: mit
language: [fr]
pipeline_tag: text-generation
tags: [grammar-correction, medical, french, asr-correction, context-aware]
---
# Qwen3-0.6B-SFT-ASR-Correction-FR v15-context-full
Modele final de fine-tuning SFT avec contexte pour la correction d'erreurs ASR medicales en francais.
## Configuration
- **Base model**: Qwen/Qwen3-0.6B
- **Fine-tuning**: SFT (Supervised Fine-Tuning)
- **Context**: Oui (3 champs: context, input errone, target corrige)
- **Dataset**: merged_with_context.jsonl (~5.5M paires)
- **GPUs**: 3x Tesla V100-SXM3-32GB
- **Effective batch size**: 48 (3 GPUs x 4 batch x 4 grad accum)
- **Learning rate**: 5e-6
- **Max seq length**: 384
- **Steps**: 79 836 (1 epoch)
## Metriques finales
- **Train loss**: 0.0726
- **Best eval loss**: 0.073076
- **Global step**: 79836
## Courbe d'evaluation
- step=1000: eval_loss=0.076286
- step=11000: eval_loss=0.073498
- step=21000: eval_loss=0.073254
- step=31000: eval_loss=0.073145
- step=41000: eval_loss=0.073099
- step=51000: eval_loss=0.073082
- step=61000: eval_loss=0.073087
- step=71000: eval_loss=0.073086
## Reprise d'entrainement
Ce modele a ete repris depuis le checkpoint-31000 de v15-context-continued.