Files
ModelHub XC dd885cee22 初始化项目,由ModelHub XC社区提供模型
Model: PraxySante/qwen3-0.6b-sft-asr-correction-v15-context-full
Source: Original Platform
2026-07-21 01:45:10 +08:00

1.2 KiB

license, language, pipeline_tag, tags
license language pipeline_tag tags
mit
fr
text-generation
grammar-correction
medical
french
asr-correction
context-aware

Qwen3-0.6B-SFT-ASR-Correction-FR v15-context-full

Modele final de fine-tuning SFT avec contexte pour la correction d'erreurs ASR medicales en francais.

Configuration

  • Base model: Qwen/Qwen3-0.6B
  • Fine-tuning: SFT (Supervised Fine-Tuning)
  • Context: Oui (3 champs: context, input errone, target corrige)
  • Dataset: merged_with_context.jsonl (~5.5M paires)
  • GPUs: 3x Tesla V100-SXM3-32GB
  • Effective batch size: 48 (3 GPUs x 4 batch x 4 grad accum)
  • Learning rate: 5e-6
  • Max seq length: 384
  • Steps: 79 836 (1 epoch)

Metriques finales

  • Train loss: 0.0726
  • Best eval loss: 0.073076
  • Global step: 79836

Courbe d'evaluation

  • step=1000: eval_loss=0.076286
  • step=11000: eval_loss=0.073498
  • step=21000: eval_loss=0.073254
  • step=31000: eval_loss=0.073145
  • step=41000: eval_loss=0.073099
  • step=51000: eval_loss=0.073082
  • step=61000: eval_loss=0.073087
  • step=71000: eval_loss=0.073086

Reprise d'entrainement

Ce modele a ete repris depuis le checkpoint-31000 de v15-context-continued.