HuggingFace Transformers Documentation
Reference for the Transformers library — the model-definition framework for state-of-the-art ML models across text, vision, audio, video, and multimodal tasks.
CRITICAL: grep references/ for detailed docs before answering. Individual model API docs (443 models) are NOT included — refer users to the model doc index for specific model APIs.
Quick Start
from transformers import pipeline
# Inference with Pipeline
pipe = pipeline("text-generation", model="meta-llama/Llama-3-8B-Instruct")
result = pipe("Hello, how are you?", max_new_tokens=100)
# Load model + tokenizer directly
from transformers import AutoTokenizer, AutoModelForCausalLM
tokenizer = AutoTokenizer.from_pretrained("meta-llama/Llama-3-8B-Instruct")
model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-3-8B-Instruct", device_map="auto")
# Fine-tuning with Trainer
from transformers import TrainingArguments, Trainer
args = TrainingArguments(output_dir="./output", num_train_epochs=3, per_device_train_batch_size=8)
trainer = Trainer(model=model, args=args, train_dataset=dataset)
trainer.train()
Core Concepts
| Concept |
Description |
| Pipeline |
High-level inference API for 30+ tasks |
| Auto Classes |
AutoModel, AutoTokenizer, AutoConfig — auto-detect model type |
| from_pretrained |
Load any model/tokenizer from Hub or local path |
| Trainer |
Training loop with mixed precision, distributed, callbacks |
| generate() |
Text generation with multiple decoding strategies |
| Chat Templates |
Jinja2 templates for chat model formatting |
| Quantization |
GPTQ, AWQ, bitsandbytes, GGUF, torchao, and more |
Key Topics
Inference
references/llm_tutorial.md — Text generation with LLMs
references/pipeline_tutorial.md — Pipeline API tutorial
references/generation_strategies.md — Decoding methods (greedy, beam, sampling)
references/chat_templating.md — Chat templates
references/conversations.md — Chat/tool use patterns
Optimization
references/attention_interface.md — Attention backends (FlashAttention, SDPA)
references/llm_tutorial_optimization.md — Getting the most out of LLMs
references/continuous_batching.md — Continuous batching
references/kv_cache.md — KV cache strategies
references/torchcompile.md — torch.compile integration
Training
references/trainer.md — Trainer overview
references/training.md — Fine-tuning guide
references/deepspeed.md — DeepSpeed integration
references/fsdp.md — FSDP distributed training
references/accelerate.md — Accelerate integration
Quantization
references/quantization/overview.md — Quantization overview
references/quantization/bitsandbytes.md — bitsandbytes (4/8-bit)
references/quantization/gptq.md — GPTQ
references/quantization/awq.md — AWQ
references/quantization/gguf.md — GGUF format
Models & Preprocessors
references/custom_models.md — Customizing models
references/fast_tokenizers.md — Tokenizer overview
references/image_processors.md — Image processors
references/how_to_hack_models.md — Monkey patching models
Serving & Ecosystem
references/serve-cli/ — Serve CLI
references/community_integrations/vllm.md — vLLM integration
references/community_integrations/sglang.md — SGLang integration
references/community_integrations/llama_cpp.md — llama.cpp integration
References
references/ — 146 doc files covering guides, API classes, quantization, serving, and ecosystem integrations
references/main_classes/ — Core API (Trainer, Pipeline, Configuration, Tokenizer, etc.)
references/quantization/ — 27 quantization method docs
references/community_integrations/ — Ecosystem (vLLM, SGLang, TRL, Axolotl, etc.)
1---2name: transformers-docs3description: USE THIS SKILL WHEN working with HuggingFace Transformers: loading/fine-tuning pretrained models, Pipeline API, text generation, tokenizers, chat templates, quantization (GPTQ/AWQ/bitsandbytes/GGUF), distributed training (FSDP/DeepSpeed), inference optimization, Trainer API, or vLLM/SGLang integration. Triggers on: transformers, AutoModel, AutoTokenizer, from_pretrained, pipeline(), generate(), Trainer, BitsAndBytesConfig, chat_template.4---56# HuggingFace Transformers Documentation78Reference for the [Transformers](https://huggingface.co/docs/transformers) library — the model-definition framework for state-of-the-art ML models across text, vision, audio, video, and multimodal tasks.910- [GitHub](https://github.com/huggingface/transformers) | [Docs](https://huggingface.co/docs/transformers) | [Hub](https://huggingface.co/models?library=transformers)11- 1M+ model checkpoints on HuggingFace Hub1213CRITICAL: grep `references/` for detailed docs before answering. Individual model API docs (443 models) are NOT included — refer users to the [model doc index](https://huggingface.co/docs/transformers/model_doc) for specific model APIs.1415## Quick Start1617```python18from transformers import pipeline1920# Inference with Pipeline21pipe = pipeline("text-generation", model="meta-llama/Llama-3-8B-Instruct")22result = pipe("Hello, how are you?", max_new_tokens=100)2324# Load model + tokenizer directly25from transformers import AutoTokenizer, AutoModelForCausalLM26tokenizer = AutoTokenizer.from_pretrained("meta-llama/Llama-3-8B-Instruct")27model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-3-8B-Instruct", device_map="auto")2829# Fine-tuning with Trainer30from transformers import TrainingArguments, Trainer31args = TrainingArguments(output_dir="./output", num_train_epochs=3, per_device_train_batch_size=8)32trainer = Trainer(model=model, args=args, train_dataset=dataset)33trainer.train()34```3536## Core Concepts3738| Concept | Description |39|---------|-------------|40| **Pipeline** | High-level inference API for 30+ tasks |41| **Auto Classes** | `AutoModel`, `AutoTokenizer`, `AutoConfig` — auto-detect model type |42| **from_pretrained** | Load any model/tokenizer from Hub or local path |43| **Trainer** | Training loop with mixed precision, distributed, callbacks |44| **generate()** | Text generation with multiple decoding strategies |45| **Chat Templates** | Jinja2 templates for chat model formatting |46| **Quantization** | GPTQ, AWQ, bitsandbytes, GGUF, torchao, and more |4748## Key Topics4950### Inference51- `references/llm_tutorial.md` — Text generation with LLMs52- `references/pipeline_tutorial.md` — Pipeline API tutorial53- `references/generation_strategies.md` — Decoding methods (greedy, beam, sampling)54- `references/chat_templating.md` — Chat templates55- `references/conversations.md` — Chat/tool use patterns5657### Optimization58- `references/attention_interface.md` — Attention backends (FlashAttention, SDPA)59- `references/llm_tutorial_optimization.md` — Getting the most out of LLMs60- `references/continuous_batching.md` — Continuous batching61- `references/kv_cache.md` — KV cache strategies62- `references/torchcompile.md` — torch.compile integration6364### Training65- `references/trainer.md` — Trainer overview66- `references/training.md` — Fine-tuning guide67- `references/deepspeed.md` — DeepSpeed integration68- `references/fsdp.md` — FSDP distributed training69- `references/accelerate.md` — Accelerate integration7071### Quantization72- `references/quantization/overview.md` — Quantization overview73- `references/quantization/bitsandbytes.md` — bitsandbytes (4/8-bit)74- `references/quantization/gptq.md` — GPTQ75- `references/quantization/awq.md` — AWQ76- `references/quantization/gguf.md` — GGUF format7778### Models & Preprocessors79- `references/custom_models.md` — Customizing models80- `references/fast_tokenizers.md` — Tokenizer overview81- `references/image_processors.md` — Image processors82- `references/how_to_hack_models.md` — Monkey patching models8384### Serving & Ecosystem85- `references/serve-cli/` — Serve CLI86- `references/community_integrations/vllm.md` — vLLM integration87- `references/community_integrations/sglang.md` — SGLang integration88- `references/community_integrations/llama_cpp.md` — llama.cpp integration8990## References9192- `references/` — 146 doc files covering guides, API classes, quantization, serving, and ecosystem integrations93- `references/main_classes/` — Core API (Trainer, Pipeline, Configuration, Tokenizer, etc.)94- `references/quantization/` — 27 quantization method docs95- `references/community_integrations/` — Ecosystem (vLLM, SGLang, TRL, Axolotl, etc.)