Modelos con vision: multimodal para imágenes
Vision no es generar imágenes: es leerlas. Facturas, UI screenshots, diagramas y fotos de producto entran en el prompt. Esta colección junta multimodales fuertes disponibles en Geek Hub para Q&A visual y extracción.
Modelos en esta colección
| Modelo | Tipo | Contexto | Precio |
|---|---|---|---|
| Chat | 2M tokens | $1.3626/M in · $10.9006/M out | |
| Chat | 1M tokens | $0.327/M in · $2.7251/M out | |
| Chat | 1M tokens | $3.2702/M in · $16.3509/M out | |
| Chat | 272k tokens | $5.4503/M in · $32.7018/M out | |
| Chat | 272k tokens | $0.8175/M in · $4.9053/M out | |
| Chat | 1M tokens | $1.6351/M in · $8.1754/M out | |
| Chat | 1M tokens | $5.4503/M in · $27.2515/M out | |
| Chat | 500k tokens | $2.1801/M in · $6.5404/M out |
Por qué estos modelos
Gemini lidera en volumen visual a buen precio; Claude y GPT-5.x para análisis fino; Flash/mini cuando el throughput importa más que el último detalle.
Úsalos con Geek Hub
Una base URL compatible con OpenAI y una API key. Cambia cualquier model id de esta lista sin reescribir tu cliente.
Consigue tu API keyPreguntas frecuentes
- ¿Vision es lo mismo que image generation?
- No. Vision = input de imagen. Generación = output de imagen (colección Image Models).
- ¿Puedo mandar PDFs?
- Depende del proveedor y de cómo serialices el input (páginas como imagen o texto). Revisa caps en la ficha del modelo.
- ¿Cuál es barato para vision a escala?
- Gemini Flash o GPT-5.4-mini suelen ser el sweet spot costo/calidad para alto volumen.