Rate limits
This page lists the rate limits that apply to Elastic Inference Service (EIS) models.
Exceeding a limit results in HTTP 429 responses from the server until the sliding window moves on further and parts of the limit resets.
Where both a requests-per-minute and a tokens-per-minute limit apply, whichever limit is reached first takes effect.
| Model | Requests/minute | Notes |
|---|---|---|
| Elastic Managed LLMs
|
2,000 | No rate limit on tokens |
Embedding models are used for both ingest (indexing documents) and search (query-time retrieval). Limits apply independently per use.
| Model | Requests/minute (search) | Requests/minute (ingest) | Tokens/minute (search) | Tokens/minute (ingest) |
|---|---|---|---|---|
| ELSER
|
6,000 | 6,000 | 600,000 | 6,000,000 |
| Jina Embeddings v3
|
6,000 | 6,000 | 600,000 | 6,000,000 |
| Jina Embeddings v5 Nano
|
60,000 | 30,000 | 6,000,000 | 30,000,000 |
| Jina Embeddings v5 Small
|
60,000 | 30,000 | 6,000,000 | 30,000,000 |
Reranking models are used at search time only.
| Model | Requests/minute | Tokens/minute |
|---|---|---|
| Jina Reranker v2
|
600 | 6,000,000 |
| Jina Reranker v3
|
600 | 6,000,000 |
| Jina Reranker v3.5
|
600 | 6,000,000 |