OpenRLHF/Llama-3-8b-sft-mixture: Model synced from source: OpenRLHF/Llama-3-8b-sft-mixture - Llama-3-8b-sft-mixture - Gitea: Git with a cup of tea

OpenRLHF/Llama-3-8b-sft-mixture

Go to file

ModelHub XC b577761741 初始化项目，由ModelHub XC社区提供模型

Model: OpenRLHF/Llama-3-8b-sft-mixture
Source: Original Platform

2026-05-13 04:54:36 +08:00

.gitattributes

初始化项目，由ModelHub XC社区提供模型

2026-05-13 04:54:36 +08:00

config.json

初始化项目，由ModelHub XC社区提供模型

2026-05-13 04:54:36 +08:00

generation_config.json

初始化项目，由ModelHub XC社区提供模型

2026-05-13 04:54:36 +08:00

model-00001-of-00004.safetensors

初始化项目，由ModelHub XC社区提供模型

2026-05-13 04:54:36 +08:00

model-00002-of-00004.safetensors

初始化项目，由ModelHub XC社区提供模型

2026-05-13 04:54:36 +08:00

model-00003-of-00004.safetensors

初始化项目，由ModelHub XC社区提供模型

2026-05-13 04:54:36 +08:00

model-00004-of-00004.safetensors

初始化项目，由ModelHub XC社区提供模型

2026-05-13 04:54:36 +08:00

model.safetensors.index.json

初始化项目，由ModelHub XC社区提供模型

2026-05-13 04:54:36 +08:00

README.md

初始化项目，由ModelHub XC社区提供模型

2026-05-13 04:54:36 +08:00

special_tokens_map.json

初始化项目，由ModelHub XC社区提供模型

2026-05-13 04:54:36 +08:00

tokenizer_config.json

初始化项目，由ModelHub XC社区提供模型

2026-05-13 04:54:36 +08:00

tokenizer.json

初始化项目，由ModelHub XC社区提供模型

2026-05-13 04:54:36 +08:00

README.md

library_name, tags

library_name

tags

transformers

Copy from https://huggingface.co/RLHFlow/LLaMA3-SFT

We fixed the generation_config.json.

This is the SFT checkpoint used for the project Online-RLHF. Also, check the technical report here.

The model is trained from meta-llama/Meta-Llama-3-8B on a mixture of diverse open-source high-quality data for 1 epoch with detailed parameters in the report. It has not been trained by RLHF and can serve as a good starting point for the RLHF research.

The datasets included: ShareGPT, Evol-Instruct, SlimOrca, MathInstruct, Magicoder-Evol-Instruct, GPT4-LLM, OrcaMath, GPTeacher, UltraInteract.