--- license: mit language: - ru tags: - gpt2 - gguf - russian - chat base_model: - ai-forever/rugpt3medium_based_on_gpt2 pipeline_tag: question-answering --- # ru-gpt2-chat-362M-8K-062026 Русскоязычная языковая модель, дообученная (Chat-tuned) на архитектуре GPT-2 с расширенным контекстным окном 8K. > 📅 **Срез данных:** июнь 2026 ## 📊 Производительность на реальном железе Тестирование проводилось на видеокарте **GTX 1050 Ti** и процессоре **i3-10100F**: - **GPU (GTX 1050 Ti):** - Начало генерации: **54–62 токена/сек** - Конец генерации: ~**48 токенов/сек** (при использовании `-ngl 33` — выгрузка 33 слоев на видеокарту) - **CPU (i3-10100F):** - ~**12 токенов/сек** (чистый CPU-инференс) ## ⚠️ Важные особенности и ограничения контекста Заявленный технический максимум контекста — **8192 токена**, однако наблюдаются сильные деградации качества: - **До 2048 токенов:** стабильная связность. - **После 2048 токенов:** уверенность и связность падают **в 3 раза**. - **3000 токенов:** падение качества еще **в 3 раза** (относительно 2048). - **3400 токенов:** генерация превращается в "словесную окрошку" (отдельные осмысленные слова, но потеря логики). - **3500+ токенов:** возможны сбои сервера, бесконечная генерация, однако корректность отдельных слов сохраняется вплоть до 8192 токенов. **Рекомендация:** Для получения качественного ответа **не используйте системные промпты** (хотя модель является Chat-tuned), и старайтесь ограничивать длину истории до 2048 токенов. ## 🏆 Результаты тестов - Простые вопросы (упомниает верные ответы, не всегда в верном контексте): **11/30** (лучший результат для данной конфигурации) - Сравнение с человеком: **27/30**