Tei Triton Serving

High-performance serving of embedding and reranker models in production. Covers HuggingFace Text Embeddings Inference (TEI) on GPU, Docker deployment, ONNX/FP16 quantization, dynamic batching, NVIDIA Triton for co-serving embedding + reranker + LLM, and NVIDIA NIM as a managed alternative. Benchmarks and configs. USE WHEN: user mentions "TEI", "Text Embeddings Inference", "Triton", "Triton Inference Server", "NIM", "NVIDIA NIM", "embedding server", "reranker server", "ONNX embedding", "serve BGE", "serve E5" DO NOT USE FOR: vector DB serving - use `rag-architecture`; LLM serving in general - use provider-specific docs; cost tracking - use `cost-allocation`

claude-dev-suite Updated 28 repo stars

File contents

claude-dev-suite/claude-dev-suite/tree/main/skills/rag-ops/tei-triton-serving commit 721ca5dfdb

Frequently asked questions

npx skillmds@latest add claude-dev-suite/tei-triton-serving