2.6 KiB
2.6 KiB
license, language, tags, base_model, pipeline_tag
| license | language | tags | base_model | pipeline_tag | ||||||
|---|---|---|---|---|---|---|---|---|---|---|
| mit |
|
|
|
question-answering |
ru-gpt2-chat-362M-8K-062026
Русскоязычная языковая модель, дообученная (Chat-tuned) на архитектуре GPT-2 с расширенным контекстным окном 8K.
📅 Срез данных: июнь 2026
📊 Производительность на реальном железе
Тестирование проводилось на видеокарте GTX 1050 Ti и процессоре i3-10100F:
- GPU (GTX 1050 Ti):
- Начало генерации: 54–62 токена/сек
- Конец генерации: ~48 токенов/сек (при использовании
-ngl 33— выгрузка 33 слоев на видеокарту)
- CPU (i3-10100F):
- ~12 токенов/сек (чистый CPU-инференс)
⚠️ Важные особенности и ограничения контекста
Заявленный технический максимум контекста — 8192 токена, однако наблюдаются сильные деградации качества:
- До 2048 токенов: стабильная связность.
- После 2048 токенов: уверенность и связность падают в 3 раза.
- 3000 токенов: падение качества еще в 3 раза (относительно 2048).
- 3400 токенов: генерация превращается в "словесную окрошку" (отдельные осмысленные слова, но потеря логики).
- 3500+ токенов: возможны сбои сервера, бесконечная генерация, однако корректность отдельных слов сохраняется вплоть до 8192 токенов.
Рекомендация: Для получения качественного ответа не используйте системные промпты (хотя модель является Chat-tuned), и старайтесь ограничивать длину истории до 2048 токенов.
🏆 Результаты тестов
- Простые вопросы (упомниает верные ответы, не всегда в верном контексте): 11/30 (лучший результат для данной конфигурации)
- Сравнение с человеком: 27/30