Glossary
The terms that keep showing up in the cards, and what changes once you know them.
218 terms
Basics 30
Token·Tokenizer·Vocabulary·Parameter·Weights·Embedding·Context window·Prompt·Large language model·Autoregressive generation·Inference·Open weights·Training·Neural network·Generative AI·Few-shot·Temperature·Top-p·Max tokens·Stop sequence·System prompt·Multi-turn·Streaming·Latency·Batch size·Nondeterminism·Model license·Open-source model·Hugging Face·Chat template
Model design 28
Transformer·Attention·Mixture of Experts·Multimodal·Decoder-only·Encoder·Grouped-query attention·Rotary position embedding·Active parameters·Dense model·Parameter count·Small language model·State space model·Diffusion model·Vision-language model·Frontier model·Instruct model·Reasoning model·Layer·Attention head·Feed-forward network·Expert routing·Hybrid architecture·Sliding window attention·Positional encoding·Vision encoder·Logits·Multi-head latent attention
Training 28
Pretraining·Fine-tuning·Distillation·Quantization-Aware Training·Low-Rank Adaptation·Checkpoint·Post-training·Supervised Fine-Tuning·Parameter-Efficient Fine-Tuning·QLoRA·Reinforcement Learning from Human Feedback·Reward Model·Group Relative Policy Optimization·Direct Preference Optimization·Reinforcement Learning with Verifiable Rewards·Reward Hacking·Synthetic Data·Data Curation·Curriculum Learning·Scaling Law·Base Model·Catastrophic Forgetting·Continued Pretraining·Model Merging·Self-Improvement Loop·Learning Rate·Optimizer·Training Loss
Inference & serving 24
KV Cache·Quantization·FP8·GGUF·FlashAttention·MLX·Serving·Q4 / 4-bit quantization·BF16 / FP16·PagedAttention·Continuous Batching·Speculative Decoding·Prefill Phase·Time to First Token·Throughput·Offloading·vLLM·llama.cpp·Ollama·Prompt Caching·Token Pricing·On-Device Inference·Sampling Parameters·Decode Phase
Agents & tools 28
Retrieval-Augmented Generation·Agent·Harness·Agent loop·Tool use·Function calling·Structured output·Model Context Protocol·Agent Skills·AGENTS.md·Coding agent·Sandbox·Computer use·Chunking·Vector database·Reranker·Agent memory·Context engineering·Long-horizon·Orchestration·Multi-agent·Subagent·Model router·Verifier·Trace·Context compaction·Background agent·Task decomposition
Evaluation 28
Benchmark·Hallucination·Data contamination·Terminal-Bench·SWE-bench·Eval·Leaderboard·pass@k·Elo rating·LLM-as-a-judge·Perplexity·Held-out set·Accuracy·MMLU·LMArena·Win rate·Benchmark saturation·Benchmark overfitting·Ablation study·Human evaluation·Calibration·Precision and recall·Baseline·Execution-based evaluation·Golden set·Reproducibility·Rubric·State of the art
Safety & policy 27
Uncensored Model·Human in the Loop·Prompt Injection·Red Teaming·Alignment·Constitutional AI·Jailbreak·Indirect Prompt Injection·Guardrails·Safety Classifier·Over-refusal·Watermarking·C2PA·Zero Data Retention·PII·Machine Unlearning·Data Poisoning·Model Card·System Card·Responsible Scaling Policy·EU AI Act·Dangerous Capability Evaluation·Sycophancy·Interpretability·AI Slop·Training Data Copyright·Agent Sandboxing
Infrastructure 25
CUDA·VRAM·Memory bandwidth·GPU·TPU·FLOPs·GPU-hour·GPU cluster·High Bandwidth Memory (HBM)·Batch API·Cost per token·Wafer-scale·Datacenter power·Interconnect·Tensor parallelism·Rack-scale·Liquid cooling·Cold start·Spot instance·Reserved capacity·Neocloud·Total cost of ownership·Rate limit·Data residency·GPU utilization