Rate limits

This page lists the rate limits that apply to Elastic Inference Service (EIS) models.

Exceeding a limit results in HTTP 429 responses from the server until the sliding window moves on further and parts of the limit resets.

Where both a requests-per-minute and a tokens-per-minute limit apply, whichever limit is reached first takes effect.

Model Requests/minute Notes
Elastic Managed LLMs 2,000 No rate limit on tokens

Embedding models are used for both ingest (indexing documents) and search (query-time retrieval). Limits apply independently per use.

Model Requests/minute (search) Requests/minute (ingest) Tokens/minute (search) Tokens/minute (ingest)
ELSER 6,000 6,000 600,000 6,000,000
Jina Embeddings v3 6,000 6,000 600,000 6,000,000
Jina Embeddings v5 Nano 60,000 30,000 6,000,000 30,000,000
Jina Embeddings v5 Small 60,000 30,000 6,000,000 30,000,000

Reranking models are used at search time only.

Model Requests/minute Tokens/minute
Jina Reranker v2 600 6,000,000
Jina Reranker v3 600 6,000,000
Jina Reranker v3.5 600 6,000,000