05

Glossary

The terms that keep showing up in the cards, and what changes once you know them.

218 terms

Basics 30

TokenTokenizerVocabularyParameterWeightsEmbeddingContext windowPromptLarge language modelAutoregressive generationInferenceOpen weightsTrainingNeural networkGenerative AIFew-shotTemperatureTop-pMax tokensStop sequenceSystem promptMulti-turnStreamingLatencyBatch sizeNondeterminismModel licenseOpen-source modelHugging FaceChat template

Model design 28

TransformerAttentionMixture of ExpertsMultimodalDecoder-onlyEncoderGrouped-query attentionRotary position embeddingActive parametersDense modelParameter countSmall language modelState space modelDiffusion modelVision-language modelFrontier modelInstruct modelReasoning modelLayerAttention headFeed-forward networkExpert routingHybrid architectureSliding window attentionPositional encodingVision encoderLogitsMulti-head latent attention

Training 28

PretrainingFine-tuningDistillationQuantization-Aware TrainingLow-Rank AdaptationCheckpointPost-trainingSupervised Fine-TuningParameter-Efficient Fine-TuningQLoRAReinforcement Learning from Human FeedbackReward ModelGroup Relative Policy OptimizationDirect Preference OptimizationReinforcement Learning with Verifiable RewardsReward HackingSynthetic DataData CurationCurriculum LearningScaling LawBase ModelCatastrophic ForgettingContinued PretrainingModel MergingSelf-Improvement LoopLearning RateOptimizerTraining Loss

Inference & serving 24

KV CacheQuantizationFP8GGUFFlashAttentionMLXServingQ4 / 4-bit quantizationBF16 / FP16PagedAttentionContinuous BatchingSpeculative DecodingPrefill PhaseTime to First TokenThroughputOffloadingvLLMllama.cppOllamaPrompt CachingToken PricingOn-Device InferenceSampling ParametersDecode Phase

Agents & tools 28

Retrieval-Augmented GenerationAgentHarnessAgent loopTool useFunction callingStructured outputModel Context ProtocolAgent SkillsAGENTS.mdCoding agentSandboxComputer useChunkingVector databaseRerankerAgent memoryContext engineeringLong-horizonOrchestrationMulti-agentSubagentModel routerVerifierTraceContext compactionBackground agentTask decomposition

Evaluation 28

BenchmarkHallucinationData contaminationTerminal-BenchSWE-benchEvalLeaderboardpass@kElo ratingLLM-as-a-judgePerplexityHeld-out setAccuracyMMLULMArenaWin rateBenchmark saturationBenchmark overfittingAblation studyHuman evaluationCalibrationPrecision and recallBaselineExecution-based evaluationGolden setReproducibilityRubricState of the art

Safety & policy 27

Uncensored ModelHuman in the LoopPrompt InjectionRed TeamingAlignmentConstitutional AIJailbreakIndirect Prompt InjectionGuardrailsSafety ClassifierOver-refusalWatermarkingC2PAZero Data RetentionPIIMachine UnlearningData PoisoningModel CardSystem CardResponsible Scaling PolicyEU AI ActDangerous Capability EvaluationSycophancyInterpretabilityAI SlopTraining Data CopyrightAgent Sandboxing

Infrastructure 25

CUDAVRAMMemory bandwidthGPUTPUFLOPsGPU-hourGPU clusterHigh Bandwidth Memory (HBM)Batch APICost per tokenWafer-scaleDatacenter powerInterconnectTensor parallelismRack-scaleLiquid coolingCold startSpot instanceReserved capacityNeocloudTotal cost of ownershipRate limitData residencyGPU utilization