Modelos con vision: multimodal para imágenes

Vision no es generar imágenes: es leerlas. Facturas, UI screenshots, diagramas y fotos de producto entran en el prompt. Esta colección junta multimodales fuertes disponibles en Geek Hub para Q&A visual y extracción.

8 modelosActualizado 2026-08-27

Modelos en esta colección

ModeloTipoContextoPrecio
Gemini 2.5 ProGoogleChat2M tokens$1.3626/M in · $10.9006/M out
Gemini 2.5 FlashGoogleChat1M tokens$0.327/M in · $2.7251/M out
Claude Sonnet 5AnthropicChat1M tokens$3.2702/M in · $16.3509/M out
GPT-5.5OpenAIChat272k tokens$5.4503/M in · $32.7018/M out
GPT-5.4 miniOpenAIChat272k tokens$0.8175/M in · $4.9053/M out
Gemini 3.6 FlashGoogleChat1M tokens$1.6351/M in · $8.1754/M out
Claude Opus 5AnthropicChat1M tokens$5.4503/M in · $27.2515/M out
Grok 4.5xAIChat500k tokens$2.1801/M in · $6.5404/M out

Por qué estos modelos

Gemini lidera en volumen visual a buen precio; Claude y GPT-5.x para análisis fino; Flash/mini cuando el throughput importa más que el último detalle.

Úsalos con Geek Hub

Una base URL compatible con OpenAI y una API key. Cambia cualquier model id de esta lista sin reescribir tu cliente.

Consigue tu API key

Preguntas frecuentes

¿Vision es lo mismo que image generation?
No. Vision = input de imagen. Generación = output de imagen (colección Image Models).
¿Puedo mandar PDFs?
Depende del proveedor y de cómo serialices el input (páginas como imagen o texto). Revisa caps en la ficha del modelo.
¿Cuál es barato para vision a escala?
Gemini Flash o GPT-5.4-mini suelen ser el sweet spot costo/calidad para alto volumen.

Más colecciones