初始化项目,由ModelHub XC社区提供模型
Model: PraxySante/qwen3-0.6b-sft-asr-correction-v15-context-full Source: Original Platform
This commit is contained in:
43
README.md
Normal file
43
README.md
Normal file
@@ -0,0 +1,43 @@
|
||||
---
|
||||
license: mit
|
||||
language: [fr]
|
||||
pipeline_tag: text-generation
|
||||
tags: [grammar-correction, medical, french, asr-correction, context-aware]
|
||||
---
|
||||
|
||||
# Qwen3-0.6B-SFT-ASR-Correction-FR v15-context-full
|
||||
|
||||
Modele final de fine-tuning SFT avec contexte pour la correction d'erreurs ASR medicales en francais.
|
||||
|
||||
## Configuration
|
||||
|
||||
- **Base model**: Qwen/Qwen3-0.6B
|
||||
- **Fine-tuning**: SFT (Supervised Fine-Tuning)
|
||||
- **Context**: Oui (3 champs: context, input errone, target corrige)
|
||||
- **Dataset**: merged_with_context.jsonl (~5.5M paires)
|
||||
- **GPUs**: 3x Tesla V100-SXM3-32GB
|
||||
- **Effective batch size**: 48 (3 GPUs x 4 batch x 4 grad accum)
|
||||
- **Learning rate**: 5e-6
|
||||
- **Max seq length**: 384
|
||||
- **Steps**: 79 836 (1 epoch)
|
||||
|
||||
## Metriques finales
|
||||
|
||||
- **Train loss**: 0.0726
|
||||
- **Best eval loss**: 0.073076
|
||||
- **Global step**: 79836
|
||||
|
||||
## Courbe d'evaluation
|
||||
|
||||
- step=1000: eval_loss=0.076286
|
||||
- step=11000: eval_loss=0.073498
|
||||
- step=21000: eval_loss=0.073254
|
||||
- step=31000: eval_loss=0.073145
|
||||
- step=41000: eval_loss=0.073099
|
||||
- step=51000: eval_loss=0.073082
|
||||
- step=61000: eval_loss=0.073087
|
||||
- step=71000: eval_loss=0.073086
|
||||
|
||||
## Reprise d'entrainement
|
||||
|
||||
Ce modele a ete repris depuis le checkpoint-31000 de v15-context-continued.
|
||||
Reference in New Issue
Block a user