Zum Inhalt springen

Embeddings & Reranking API

POST /v1/embeddings

Wandelt Text in numerische Vektoren um, sodass semantische Ähnlichkeit messbar wird. Typischer Anwendungsfall ist die Befüllung und Suche in einer Vektor-DB.

ParameterTypBeschreibung
modelstringModell-ID, z. B. vllm/release/harrier-oss-v1-0.6b
inputstring/arrayText oder Liste von Texten
Terminal-Fenster
curl -X POST https://ai.noris.de/v1/embeddings \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model": "vllm/release/harrier-oss-v1-0.6b",
"input": "KI-Infrastruktur aus Deutschland"
}'

Die Antwort enthält ein embedding-Array mit dem Vektor je Input-Element:

{
"object": "list",
"data": [
{ "object": "embedding", "index": 0, "embedding": [0.0123, -0.0456, "..."] }
],
"model": "vllm/release/harrier-oss-v1-0.6b",
"usage": { "prompt_tokens": 5, "total_tokens": 5 }
}

Speichern Sie die Vektoren zusammen mit Metadaten in Ihrer Vektor-DB. Zur Suchzeit wird die Anfrage ebenfalls eingebettet und per Ähnlichkeitssuche (z. B. Cosinus) gegen die Bestände verglichen.

POST /v1/rerank

Ein Reranker bewertet Query und Dokumente paarweise und liefert eine präzisere Sortierung als die reine Embedding-Suche. Typischer Anwendungsfall ist die zweite Stufe einer RAG-Pipeline.

ParameterTypBeschreibung
modelstringModell-ID, z. B. vllm/release/bge-reranker-v2-m3
querystringSuchanfrage
documentsarrayListe der Kandidaten-Dokumente
top_nintegerAnzahl der zurückgegebenen Top-Ergebnisse
return_documentsbooleanDokumenttexte in der Antwort mitliefern
Terminal-Fenster
curl -X POST https://ai.noris.de/v1/rerank \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model": "vllm/release/bge-reranker-v2-m3",
"query": "Wie funktioniert Zero-Data-Retention?",
"documents": [
"noris speichert Prompts nicht dauerhaft.",
"Das Wetter in Nürnberg ist sonnig."
],
"top_n": 2,
"return_documents": true
}'

Die Antwort enthält ein results-Array, sortiert nach Relevanz:

{
"id": "rerank-...",
"results": [
{
"index": 0,
"relevance_score": 0.98,
"document": {"text": "noris speichert Prompts nicht dauerhaft."}
},
{
"index": 1,
"relevance_score": 0.03,
"document": {"text": "Das Wetter in Nürnberg ist sonnig."}
}
],
"model": "vllm/release/bge-reranker-v2-m3"
}

In einer RAG-Pipeline liefert die Vektor-Suche eine grobe Kandidatenmenge; der Reranker verfeinert diese Sortierung, bevor die Top-Dokumente an das LLM übergeben werden.