Modelos para RAG: responder sobre tu conocimiento

RAG = retrieve + generate. Los embeddings traen chunks; el chat contesta sin alucinar de más. Esta colección es el lado generate: modelos que siguen instrucciones, citan contexto y no queman el presupuesto en cada query.

8 modelosActualizado 2026-08-27

Modelos en esta colección

ModeloTipoContextoPrecio
GPT-4.1 mini (legacy)OpenAIChat1M tokens$0.436/M in · $1.7441/M out
Gemini 2.5 FlashGoogleChat1M tokens$0.327/M in · $2.7251/M out
Claude Haiku 4.5AnthropicChat200k tokens$1.0901/M in · $5.4503/M out
GPT-5.4 miniOpenAIChat272k tokens$0.8175/M in · $4.9053/M out
Gemini 2.5 ProGoogleChat2M tokens$1.3626/M in · $10.9006/M out
Claude Sonnet 5AnthropicChat1M tokens$3.2702/M in · $16.3509/M out
DeepSeek V4 FlashDeepSeekChat1M tokens$0.1526/M in · $0.3052/M out
Mistral SmallMistralChat128k tokens$0.109/M in · $0.327/M out

Por qué estos modelos

Flash/mini/Haiku para el 90% de preguntas; Pro/Sonnet cuando el retrieval es ruidoso o la respuesta es crítica. Empareja con la colección Embedding Models.

Úsalos con Geek Hub

Una base URL compatible con OpenAI y una API key. Cambia cualquier model id de esta lista sin reescribir tu cliente.

Consigue tu API key

Preguntas frecuentes

¿Qué embedding uso con estos?
text-embedding-3-small por default. Ver Embedding Models. No mezcles dimensiones en el mismo índice.
¿Contexto largo en vez de RAG?
A veces. Si el corpus cabe y el costo de input aguanta, long-context puede bastar. RAG escala mejor a GBs de docs.
¿Cómo reduzco alucinaciones?
Prompt estricto (“solo usa el contexto”), top-k decente, y un modelo que obedezca (Sonnet/GPT mini). Mide con evals de groundedness.

Más colecciones