Model: PraxySante/qwen3-0.6b-sft-asr-correction-v15-context-full Source: Original Platform
44 lines
1.2 KiB
Markdown
44 lines
1.2 KiB
Markdown
---
|
|
license: mit
|
|
language: [fr]
|
|
pipeline_tag: text-generation
|
|
tags: [grammar-correction, medical, french, asr-correction, context-aware]
|
|
---
|
|
|
|
# Qwen3-0.6B-SFT-ASR-Correction-FR v15-context-full
|
|
|
|
Modele final de fine-tuning SFT avec contexte pour la correction d'erreurs ASR medicales en francais.
|
|
|
|
## Configuration
|
|
|
|
- **Base model**: Qwen/Qwen3-0.6B
|
|
- **Fine-tuning**: SFT (Supervised Fine-Tuning)
|
|
- **Context**: Oui (3 champs: context, input errone, target corrige)
|
|
- **Dataset**: merged_with_context.jsonl (~5.5M paires)
|
|
- **GPUs**: 3x Tesla V100-SXM3-32GB
|
|
- **Effective batch size**: 48 (3 GPUs x 4 batch x 4 grad accum)
|
|
- **Learning rate**: 5e-6
|
|
- **Max seq length**: 384
|
|
- **Steps**: 79 836 (1 epoch)
|
|
|
|
## Metriques finales
|
|
|
|
- **Train loss**: 0.0726
|
|
- **Best eval loss**: 0.073076
|
|
- **Global step**: 79836
|
|
|
|
## Courbe d'evaluation
|
|
|
|
- step=1000: eval_loss=0.076286
|
|
- step=11000: eval_loss=0.073498
|
|
- step=21000: eval_loss=0.073254
|
|
- step=31000: eval_loss=0.073145
|
|
- step=41000: eval_loss=0.073099
|
|
- step=51000: eval_loss=0.073082
|
|
- step=61000: eval_loss=0.073087
|
|
- step=71000: eval_loss=0.073086
|
|
|
|
## Reprise d'entrainement
|
|
|
|
Ce modele a ete repris depuis le checkpoint-31000 de v15-context-continued.
|