更新 fix_tokenizer.py
All checks were successful
Docker Build and Push / docker (push) Successful in 22m39s
All checks were successful
Docker Build and Push / docker (push) Successful in 22m39s
This commit is contained in:
@@ -37,6 +37,8 @@ else:
|
||||
# ===== 自动修复策略 =====
|
||||
if typ == "fast":
|
||||
cfg["tokenizer_class"] = "PreTrainedTokenizerFast"
|
||||
cfg["from_slow"] = False
|
||||
cfg.pop("backend", None)
|
||||
|
||||
elif typ == "sentencepiece":
|
||||
cfg["tokenizer_class"] = "LlamaTokenizer"
|
||||
@@ -55,6 +57,7 @@ bad_classes = [
|
||||
|
||||
if orig_cls in bad_classes:
|
||||
print(f"[fix] override bad tokenizer_class: {orig_cls} → {cfg['tokenizer_class']}")
|
||||
print(f"[fix] override from_slow: {cfg['from_slow']}")
|
||||
|
||||
# 修复 extra_special_tokens: list → dict 格式
|
||||
if "extra_special_tokens" in cfg and isinstance(cfg["extra_special_tokens"], list):
|
||||
|
||||
Reference in New Issue
Block a user