1.5 KiB
1.5 KiB
base_model, library_name, tags
| base_model | library_name | tags | ||||||
|---|---|---|---|---|---|---|---|---|
|
transformers |
|
merge_test_2
This is a merge of pre-trained language models created using mergekit.
Merge Details
Merge Method
This model was merged using the DELLA merge method using deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B as a base.
Models Merged
The following models were included in the merge:
- nvidia/Nemotron-Research-Reasoning-Qwen-1.5B
- nvidia/OpenMath-Nemotron-1.5B
- Fate-Zero/Archer2.0-Code-1.5B-Preview
Configuration
The following YAML configuration was used to produce this model:
merge_method: della
base_model: deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B
dtype: bfloat16
models:
- model: nvidia/OpenMath-Nemotron-1.5B
parameters:
weight: 1.0
density: 0.6
epsilon: 0.3
- model: nvidia/Nemotron-Research-Reasoning-Qwen-1.5B
parameters:
weight: 1.0
density: 0.6
epsilon: 0.3
- model: Fate-Zero/Archer2.0-Code-1.5B-Preview
parameters:
weight: 1.0
density: 0.6
epsilon: 0.3