174 lines
8.3 KiB
Markdown
174 lines
8.3 KiB
Markdown
---
|
||
library_name: transformers
|
||
tags:
|
||
- quantized
|
||
- custom
|
||
- nonlinear
|
||
- mixed-precision
|
||
- merged
|
||
- MoK
|
||
language:
|
||
- ru
|
||
- en
|
||
metrics:
|
||
- perplexity
|
||
pipeline_tag: text-generation
|
||
---
|
||
|
||
# Vikras — Experimental Family of Language Models
|
||
|
||
[EN below](#vikras--experimental-family-of-language-models-en)
|
||
|
||
## Содержание
|
||
|
||
- [Коротко о проекте](#коротко-о-проекте)
|
||
- [Что это за репозиторий](#что-это-за-репозиторий)
|
||
- [Текущий релиз: HCT/YeAM (1-3B)](#текущий-релиз-hctyeam-1-3b)
|
||
- [HCT (архитектура) / YeAM (инвариант реализации)](#hct-архитектура--yeam-инвариант-реализации)
|
||
|
||
---
|
||
|
||
## Коротко о проекте
|
||
|
||
**Vikra** — экспериментальное семейство языковых моделей, исследующее влияние:
|
||
|
||
- геометрии представлений
|
||
- квантования
|
||
- гибридных мерджей
|
||
|
||
на численную динамику трансформеров.
|
||
|
||
Проект **Vikras** не ограничивается одной базой или одной архитектурой: это семейство моделей, объединённых идеей численной инвариантности эксперимента.
|
||
|
||
- **Vikra_%** — имя конкретной модели
|
||
- **Vikras** — семейство экспериментов
|
||
- **S / M / L** — степень агрессивности и распределения битности
|
||
- **MixP / FullP / HCT** — схемы и инварианты квантования/мерджей
|
||
|
||
---
|
||
|
||
## Что это за репозиторий
|
||
|
||
Это витрина моделей **Vikras** в диапазоне **1–3B**.
|
||
Здесь лежат только компактные релизы, которые можно относительно легко запускать локально.
|
||
|
||
Сноска на основной репозиторий (лаборатория/склад):
|
||
- https://huggingface.co/srs6901/Vikras-MixP
|
||
|
||
В основном репозитории релизы и эксперименты появляются быстрее, там же полный каталог (включая более крупные модели).
|
||
|
||
---
|
||
|
||
## Текущий релиз: HCT/YeAM (1-3B)
|
||
|
||
### Релизы
|
||
|
||
- **Vikra-HCT-YeAM-LLaGemma-1B**
|
||
- Что с чем: Llama-3.2-1B-Instruct + Gemma-3-1b-pt
|
||
- HF: https://huggingface.co/srs6901/Vikras-1-to-3b-collection/tree/main/Vikra-HCT-YeAM-LLaGemma-1B
|
||
- GGUF: https://huggingface.co/srs6901/Vikras-1-to-3b-collection/blob/main/Vikra-HCT-YeAM-LLaGemma-1B-Q8_0.gguf
|
||
|
||
- **Vikra-HCT-YeAM-PhiMma-1B**
|
||
- Что с чем: Gemma-3-1b-pt + Microsoft Phi-2
|
||
- HF: https://huggingface.co/srs6901/Vikras-1-to-3b-collection/tree/main/Vikra-HCT-YeAM-PhiMma-1B
|
||
- GGUF: https://huggingface.co/srs6901/Vikras-1-to-3b-collection/blob/main/Vikra-HCT-YeAM-PhiMma-1B-Q8_0.gguf
|
||
|
||
- **Vikra-HCT-YeAM-3_3.2_QweLLa-1.7B**
|
||
- Что с чем: Llama-3.2-1B-Instruct + Qwen3-1.7B (HCT/YeAM-производный релиз)
|
||
- HF: https://huggingface.co/srs6901/Vikras-1-to-3b-collection/tree/main/Vikra-HCT-YeAM-3_3.2_QweLLa-1.7B
|
||
- GGUF: https://huggingface.co/srs6901/Vikras-1-to-3b-collection/blob/main/Vikra-HCT-YeAM-3_3.2_QweLLa-1.7B_Q8_K.gguf
|
||
|
||
---
|
||
|
||
## HCT (архитектура) / YeAM (инвариант реализации)
|
||
|
||
**HCT** — архитектурный инвариант: практический способ собирать совместимые модели и производные релизы при переносе между базами/семействами.
|
||
|
||
**YeAM (Yet Another Merge)** — инвариант реализации HCT и самостоятельная схема мерджа HF→HF: это не «ещё один SLERP/DARE/TILES» и не косметическая вариация усреднения.
|
||
YeAM выдаёт стандартный HF-результат (safetensors + index) и поддерживает:
|
||
- прямой weight-to-weight мердж
|
||
- направленное добавление знаний в выбранную модель (knowledge distillation / knowledge injection), согласованное по нескольким источникам
|
||
- дополнительный мердж Attention-слоёв как отдельную технику поверх YeAM
|
||
- мердж меньших моделей в более крупные (scale-up merge) при сохранении совместимого HF-формата
|
||
Математически YeAM работает в **реальной 4D-постановке**: обновления кодируются геометрически и согласуются через пересечения лучей в пространстве параметров. Это даёт управляемый мердж с сохранением структуры и без вырождения в наивное усреднение.
|
||
|
||
---
|
||
|
||
# Vikras — Experimental Family of Language Models (EN)
|
||
|
||
## Table of Contents
|
||
|
||
- [Project overview](#project-overview)
|
||
- [What this repository is](#what-this-repository-is)
|
||
- [Current Release: HCT/YeAM (1-3B)](#current-release-hctyeam-1-3b)
|
||
- [HCT (architecture) / YeAM (implementation invariant)](#hct-architecture--yeam-implementation-invariant)
|
||
|
||
---
|
||
|
||
## Project overview
|
||
|
||
**Vikra** is an experimental family of language models exploring how:
|
||
|
||
- representation geometry
|
||
- quantization
|
||
- hybrid merges
|
||
|
||
affect transformer numerical dynamics.
|
||
|
||
The **Vikras** project is not tied to a single base model or architecture.
|
||
It is a family of models unified by a numerical invariance philosophy of experimentation.
|
||
|
||
- **Vikra_%** — a specific model
|
||
- **Vikras** — the experimental family
|
||
- **S / M / L** — aggressiveness and bit allocation variants
|
||
- **MixP / FullP / HCT** — quantization / merge invariants
|
||
|
||
---
|
||
|
||
## What this repository is
|
||
|
||
This is a curated **1–3B** showcase for the **Vikras** family.
|
||
Only compact releases are mirrored here.
|
||
|
||
Footnote / main repository (lab + full catalog):
|
||
- https://huggingface.co/srs6901/Vikras-MixP
|
||
|
||
The main repository is updated faster and contains the complete set of experiments (including larger models).
|
||
|
||
---
|
||
|
||
## Current Release: HCT/YeAM (1-3B)
|
||
|
||
### Releases
|
||
|
||
- **Vikra-HCT-YeAM-LLaGemma-1B**
|
||
- Merge recipe: Llama-3.2-1B-Instruct + Gemma-3-1b-pt
|
||
- HF: https://huggingface.co/srs6901/Vikras-1-to-3b-collection/tree/main/Vikra-HCT-YeAM-LLaGemma-1B
|
||
- GGUF: https://huggingface.co/srs6901/Vikras-1-to-3b-collection/blob/main/Vikra-HCT-YeAM-LLaGemma-1B-Q8_0.gguf
|
||
|
||
- **Vikra-HCT-YeAM-PhiMma-1B**
|
||
- Merge recipe: Gemma-3-1b-pt + Microsoft Phi-2
|
||
- HF: https://huggingface.co/srs6901/Vikras-1-to-3b-collection/tree/main/Vikra-HCT-YeAM-PhiMma-1B
|
||
- GGUF: https://huggingface.co/srs6901/Vikras-1-to-3b-collection/blob/main/Vikra-HCT-YeAM-PhiMma-1B-Q8_0.gguf
|
||
|
||
- **Vikra-HCT-YeAM-3_3.2_QweLLa-1.7B**
|
||
- Merge recipe: Llama-3.2-1B-Instruct + Qwen3-1.7B (HCT/YeAM-derived release)
|
||
- HF: https://huggingface.co/srs6901/Vikras-1-to-3b-collection/tree/main/Vikra-HCT-YeAM-3_3.2_QweLLa-1.7B
|
||
- GGUF: https://huggingface.co/srs6901/Vikras-1-to-3b-collection/blob/main/Vikra-HCT-YeAM-3_3.2_QweLLa-1.7B_Q8_K.gguf
|
||
|
||
---
|
||
|
||
## HCT (architecture) / YeAM (implementation invariant)
|
||
|
||
**HCT** is an architectural invariant — a practical way to assemble compatible checkpoints and derived releases while moving across bases / model families.
|
||
**YeAM (Yet Another Merge)** is an implementation invariant of HCT and a standalone HF→HF merge scheme: it is not “just another SLERP/DARE/TILES” and not a cosmetic variant of averaging.
|
||
|
||
YeAM produces a standard HF output (safetensors + index) and supports:
|
||
- direct weight-to-weight merging
|
||
- targeted knowledge injection into a chosen model (knowledge distillation mode), aligned across multiple sources
|
||
- an additional Attention-layer merge as a second technique on top of YeAM
|
||
- merging smaller models into larger ones (scale-up merge) while keeping a compatible HF format
|
||
YeAM operates in a **real 4D formulation**: updates are encoded geometrically and aligned via ray intersections in parameter space. This produces controlled merges that preserve structure instead of collapsing into naive averaging.
|
||
|
||
---
|