Files
qwen3-1.7b-tah-duo-maxiter4…/checkpoint-3105/tah_config.json
ModelHub XC 6878415ec5 初始化项目,由ModelHub XC社区提供模型
Model: TaH-plus/qwen3-1.7b-tah-duo-maxiter4-amteam121k-sft
Source: Original Platform
2026-08-30 19:04:20 +08:00

49 lines
1.2 KiB
JSON

{
"embedding_key": "model.embed_tokens",
"max_iter": 4,
"iter_decider": "Qwen3MLPIterDecider",
"input_updater": "Qwen3MLPUpdater",
"train_loss": "CombinedLoss",
"eval_loss": "NextTokenPredLoss",
"eval_iter_decider": "iter_decider",
"iter_label_generator": "DynamicIterLabelGenerator",
"iter_attention_mode": "duo",
"attn_implementation": "sdpa",
"iter_attention_impl": "triton",
"weighted_hidden_method": "stop_prob_mix",
"memory_lean_fp32_reductions": false,
"detach_cross_iter_kv": false,
"iter_decider_kwargs": {
"hidden_size": 2048,
"intermediate_size": 2048,
"threshold": 0.5,
"topk": 2048
},
"input_updater_kwargs": {
"hidden_size": 2048,
"intermediate_size": 2048
},
"train_loss_kwargs": {
"losses": [
{
"name": "NextTokenPredLoss",
"weight": 1.0
},
{
"name": "IterDeciderLoss",
"weight": 0.05,
"kwargs": {
"dyn_pos_weight": true,
"cost_sensitive": true,
"cost_aware": false
}
}
]
},
"eval_loss_kwargs": {},
"eval_iter_decider_kwargs": {},
"iter_label_generator_kwargs": {
"strategy": "posterior_ce",
"abs_improv_coverage": 0.99
}
}