Go to file

ModelHub XC f76c04ceff 初始化项目，由ModelHub XC社区提供模型

Model: suayptalha/ThinkerLlama-8B-v1
Source: Original Platform

2026-05-22 04:18:12 +08:00

.gitattributes

初始化项目，由ModelHub XC社区提供模型

2026-05-22 04:18:12 +08:00

config.json

初始化项目，由ModelHub XC社区提供模型

2026-05-22 04:18:12 +08:00

configuration.json

初始化项目，由ModelHub XC社区提供模型

2026-05-22 04:18:12 +08:00

generation_config.json

初始化项目，由ModelHub XC社区提供模型

2026-05-22 04:18:12 +08:00

model-00001-of-00004.safetensors

初始化项目，由ModelHub XC社区提供模型

2026-05-22 04:18:12 +08:00

model-00002-of-00004.safetensors

初始化项目，由ModelHub XC社区提供模型

2026-05-22 04:18:12 +08:00

model-00003-of-00004.safetensors

初始化项目，由ModelHub XC社区提供模型

2026-05-22 04:18:12 +08:00

model-00004-of-00004.safetensors

初始化项目，由ModelHub XC社区提供模型

2026-05-22 04:18:12 +08:00

model.safetensors.index.json

初始化项目，由ModelHub XC社区提供模型

2026-05-22 04:18:12 +08:00

README.md

初始化项目，由ModelHub XC社区提供模型

2026-05-22 04:18:12 +08:00

special_tokens_map.json

初始化项目，由ModelHub XC社区提供模型

2026-05-22 04:18:12 +08:00

tokenizer_config.json

初始化项目，由ModelHub XC社区提供模型

2026-05-22 04:18:12 +08:00

tokenizer.json

初始化项目，由ModelHub XC社区提供模型

2026-05-22 04:18:12 +08:00

README.md

license, tags, language, base_model, pipeline_tag, library_name, datasets

license

Model Details

Reasoning Llama model series fine-tuned on microsoft/orca-math-word-problems-200k using GRPO(Group Relative Policy Optimization) reinforcement learning technique.

Base model: meta-llama/Llama-3.1-8B-Instruct

Parameters

learning_rate = 5e-6,
adam_beta1 = 0.9,
adam_beta2 = 0.99,
weight_decay = 0.1,
warmup_ratio = 0.1,
lr_scheduler_type = "cosine",
optim = "paged_adamw_8bit",

Suggested system prompt for reasoning

Respond in the following format:
<reasoning>
...
</reasoning>
<answer>
...
</answer>
Do not forget <reasoning></reasoning><answer></answer> tags.

Support:

If you find this work useful, you can support me!