46 lines
2.6 KiB
Markdown
46 lines
2.6 KiB
Markdown
---
|
||
license: mit
|
||
language:
|
||
- ru
|
||
tags:
|
||
- gpt2
|
||
- gguf
|
||
- russian
|
||
- chat
|
||
base_model:
|
||
- ai-forever/rugpt3medium_based_on_gpt2
|
||
pipeline_tag: question-answering
|
||
---
|
||
|
||
# ru-gpt2-chat-362M-8K-062026
|
||
|
||
Русскоязычная языковая модель, дообученная (Chat-tuned) на архитектуре GPT-2 с расширенным контекстным окном 8K.
|
||
|
||
> 📅 **Срез данных:** июнь 2026
|
||
|
||
## 📊 Производительность на реальном железе
|
||
|
||
Тестирование проводилось на видеокарте **GTX 1050 Ti** и процессоре **i3-10100F**:
|
||
|
||
- **GPU (GTX 1050 Ti):**
|
||
- Начало генерации: **54–62 токена/сек**
|
||
- Конец генерации: ~**48 токенов/сек** (при использовании `-ngl 33` — выгрузка 33 слоев на видеокарту)
|
||
- **CPU (i3-10100F):**
|
||
- ~**12 токенов/сек** (чистый CPU-инференс)
|
||
|
||
## ⚠️ Важные особенности и ограничения контекста
|
||
|
||
Заявленный технический максимум контекста — **8192 токена**, однако наблюдаются сильные деградации качества:
|
||
|
||
- **До 2048 токенов:** стабильная связность.
|
||
- **После 2048 токенов:** уверенность и связность падают **в 3 раза**.
|
||
- **3000 токенов:** падение качества еще **в 3 раза** (относительно 2048).
|
||
- **3400 токенов:** генерация превращается в "словесную окрошку" (отдельные осмысленные слова, но потеря логики).
|
||
- **3500+ токенов:** возможны сбои сервера, бесконечная генерация, однако корректность отдельных слов сохраняется вплоть до 8192 токенов.
|
||
|
||
**Рекомендация:** Для получения качественного ответа **не используйте системные промпты** (хотя модель является Chat-tuned), и старайтесь ограничивать длину истории до 2048 токенов.
|
||
|
||
## 🏆 Результаты тестов
|
||
|
||
- Простые вопросы (упомниает верные ответы, не всегда в верном контексте): **11/30** (лучший результат для данной конфигурации)
|
||
- Сравнение с человеком: **27/30** |