Files
ModelHub XC f6a0899975 初始化项目,由ModelHub XC社区提供模型
Model: MACreative/ru-gpt2-chat-362M-8K-062026
Source: Original Platform
2026-09-27 06:27:18 +08:00

2.6 KiB
Raw Permalink Blame History

license, language, tags, base_model, pipeline_tag
license language tags base_model pipeline_tag
mit
ru
gpt2
gguf
russian
chat
ai-forever/rugpt3medium_based_on_gpt2
question-answering

ru-gpt2-chat-362M-8K-062026

Русскоязычная языковая модель, дообученная (Chat-tuned) на архитектуре GPT-2 с расширенным контекстным окном 8K.

📅 Срез данных: июнь 2026

📊 Производительность на реальном железе

Тестирование проводилось на видеокарте GTX 1050 Ti и процессоре i3-10100F:

  • GPU (GTX 1050 Ti):
    • Начало генерации: 54–62 токена/сек
    • Конец генерации: ~48 токенов/сек (при использовании -ngl 33 — выгрузка 33 слоев на видеокарту)
  • CPU (i3-10100F):
    • ~12 токенов/сек (чистый CPU-инференс)

⚠️ Важные особенности и ограничения контекста

Заявленный технический максимум контекста — 8192 токена, однако наблюдаются сильные деградации качества:

  • До 2048 токенов: стабильная связность.
  • После 2048 токенов: уверенность и связность падают в 3 раза.
  • 3000 токенов: падение качества еще в 3 раза (относительно 2048).
  • 3400 токенов: генерация превращается в "словесную окрошку" (отдельные осмысленные слова, но потеря логики).
  • 3500+ токенов: возможны сбои сервера, бесконечная генерация, однако корректность отдельных слов сохраняется вплоть до 8192 токенов.

Рекомендация: Для получения качественного ответа не используйте системные промпты (хотя модель является Chat-tuned), и старайтесь ограничивать длину истории до 2048 токенов.

🏆 Результаты тестов

  • Простые вопросы (упомниает верные ответы, не всегда в верном контексте): 11/30 (лучший результат для данной конфигурации)
  • Сравнение с человеком: 27/30