Files
gemma-3-1b-it-kk/README.md
ModelHub XC 29fbbf8b0c 初始化项目,由ModelHub XC社区提供模型
Model: Xkev/gemma-3-1b-it-kk
Source: Original Platform
2026-07-20 22:19:11 +08:00

1.3 KiB

license, datasets, language, base_model, pipeline_tag, library_name, tags
license datasets language base_model pipeline_tag library_name tags
mit
K-and-K/knights-and-knaves
en
google/gemma-3-1b-it
text-generation transformers
knights-and-knaves
gemma3

Gemma-3-1B-IT — Knights-and-Knaves SFT

Paper Link: https://arxiv.org/abs/2605.28814

Cold-start supervised-fine-tuned (SFT) model of google/gemma-3-1b-it on the Knights-and-Knaves (K&K) logic-puzzle dataset.

For the post-trained model on top of this SFT model, see Xkev/gemma-3-1b-it-kk-bes.

Training

  • Base model: google/gemma-3-1b-it
  • Dataset: K&K puzzles (1k subset), formatted as chat with reasoning + JSON answer
  • Framework: verl sft_trainer
  • Hyperparameters: lr=1e-5, weight_decay=0.01, lr_warmup_ratio=0.1, cosine schedule, epochs=3, dtype=bf16

Intended use

Research on logical reasoning and post-training. Not intended for general dialog or production.

License

MIT. Base model google/gemma-3-1b-it is governed by Google's Gemma Terms of Use, which still apply to this model.