Embedding Model Training

World-class guidance for TRAINING text/retrieval embedding and reranker models — bi-encoders (dual-encoders), cross-encoder rerankers, and the retrieve-then-rerank pattern. Use when training, fine-tuning, distilling, or evaluating an embedding/retriever/reranker (contrastive/InfoNCE loss, in-batch negatives, hard-negative mining, false-negative removal, cross-encoder distillation, Matryoshka/MRL nested dims, ColBERT multi-vector, instruction-tuned embeddings, multilingual/ multimodal), or when picking embedding dimension/pooling/normalization and evaluating on MTEB/BEIR (nDCG@10, recall). This is how the MODELS are built; for serving embeddings, ANN indexes, and RAG retrieval infra see [[rag-vector-databases]].

sanjeevrg89 e7b38c2 5 files · 39.0 KB Updated

File contents

sanjeevrg89/arete/tree/main/skills/embedding-model-training commit e7b38c2ec6

Frequently asked questions

npx skillmds@latest add sanjeevrg89/embedding-model-training