初始化项目,由ModelHub XC社区提供模型
Model: sagnikM/hill_8k_300_hinter Source: Original Platform
This commit is contained in:
32
README.md
Normal file
32
README.md
Normal file
@@ -0,0 +1,32 @@
|
||||
---
|
||||
base_model: Qwen/Qwen3-4B-Instruct-2507
|
||||
library_name: transformers
|
||||
tags:
|
||||
- qwen3
|
||||
- verl
|
||||
- fsdp
|
||||
- hinter
|
||||
---
|
||||
|
||||
# hill_8k_300_hinter
|
||||
|
||||
This repository contains the `global_step_300` hinter checkpoint from the HiLL
|
||||
8k run, converted from verl FSDP shards to Hugging Face Transformers format.
|
||||
|
||||
## Source
|
||||
|
||||
- Base model: `Qwen/Qwen3-4B-Instruct-2507`
|
||||
- Training run: `HiLL-Llama-3.2-3B-Instruct-8k`
|
||||
- Checkpoint: `global_step_300/hinter`
|
||||
- Conversion backend: verl FSDP model merger
|
||||
|
||||
## Loading
|
||||
|
||||
```python
|
||||
from transformers import AutoModelForCausalLM, AutoTokenizer
|
||||
import torch
|
||||
|
||||
model_id = "sagnikM/hill_8k_300_hinter"
|
||||
tokenizer = AutoTokenizer.from_pretrained(model_id)
|
||||
model = AutoModelForCausalLM.from_pretrained(model_id, dtype=torch.bfloat16)
|
||||
```
|
||||
Reference in New Issue
Block a user