Note on Saturation: Perplexity plateaued between 3.77B and 10.00B tokens despite continued training, indicating the model has saturated its representational capacity at this size.
📊 Comparison in Sub-50M Parameter Landscape
Feature
Typical Sub-50M Models
SparkAI-47M-Llama / Instruct
Token Budget
~1B – 2B tokens
10.00 Billion Tokens (210 tokens/param)
Data Quality
Raw web text / C4
FineWeb-Edu (85%) + Cosmopedia-v2 (15%)
Architecture
Basic MHA / GPT-2 style
Modern LLaMA 3 (GQA, SwiGLU, RoPE, RMSNorm)
Model Size
~100MB – 200MB
~95.4 MB (model.safetensors)
SFT Alignment
Rare / None
Instruction-tuned with ChatML (chat_template.jinja)
Benchmarking
Few metrics
Empirical capacity saturation documented at 10B tokens
💻 Usage with Hugging Face transformers
importtorchfromtransformersimportAutoModelForCausalLM,AutoTokenizerrepo_id="vedantjadhav701/SparkAI-47m-llama-instruct"tokenizer=AutoTokenizer.from_pretrained(repo_id)model=AutoModelForCausalLM.from_pretrained(repo_id)messages=[{"role":"user","content":"What is a computer program?"}]prompt=tokenizer.apply_chat_template(messages,tokenize=False,add_generation_prompt=True)inputs=tokenizer(prompt,return_tensors="pt")outputs=model.generate(**inputs,max_new_tokens=80,do_sample=True,temperature=0.6)print(tokenizer.decode(outputs[0],skip_special_tokens=True))