Files
ru-gpt2-chat-362M-8K-062026/README.md

46 lines
2.6 KiB
Markdown
Raw Normal View History

---
license: mit
language:
- ru
tags:
- gpt2
- gguf
- russian
- chat
base_model:
- ai-forever/rugpt3medium_based_on_gpt2
pipeline_tag: question-answering
---
# ru-gpt2-chat-362M-8K-062026
Русскоязычная языковая модель, дообученная (Chat-tuned) на архитектуре GPT-2 с расширенным контекстным окном 8K.
> 📅 **Срез данных:** июнь 2026
## 📊 Производительность на реальном железе
Тестирование проводилось на видеокарте **GTX 1050 Ti** и процессоре **i3-10100F**:
- **GPU (GTX 1050 Ti):**
- Начало генерации: **54–62 токена/сек**
- Конец генерации: ~**48 токенов/сек** (при использовании `-ngl 33` — выгрузка 33 слоев на видеокарту)
- **CPU (i3-10100F):**
- ~**12 токенов/сек** (чистый CPU-инференс)
## ⚠️ Важные особенности и ограничения контекста
Заявленный технический максимум контекста — **8192 токена**, однако наблюдаются сильные деградации качества:
- **До 2048 токенов:** стабильная связность.
- **После 2048 токенов:** уверенность и связность падают **в 3 раза**.
- **3000 токенов:** падение качества еще **в 3 раза** (относительно 2048).
- **3400 токенов:** генерация превращается в "словесную окрошку" (отдельные осмысленные слова, но потеря логики).
- **3500+ токенов:** возможны сбои сервера, бесконечная генерация, однако корректность отдельных слов сохраняется вплоть до 8192 токенов.
**Рекомендация:** Для получения качественного ответа **не используйте системные промпты** (хотя модель является Chat-tuned), и старайтесь ограничивать длину истории до 2048 токенов.
## 🏆 Результаты тестов
- Простые вопросы (упомниает верные ответы, не всегда в верном контексте): **11/30** (лучший результат для данной конфигурации)
- Сравнение с человеком: **27/30**