Modelos de IA rápidos: baja latencia
A veces la métrica es milisegundos, no el leaderboard. Autocomplete, clasificación en el hot path y UIs que no pueden esperar. Esta colección prioriza variantes flash/lite/mini/highspeed.
Modelos en esta colección
| Modelo | Tipo | Contexto | Precio |
|---|---|---|---|
| Chat | 1M tokens | $0.109/M in · $0.436/M out | |
| Chat | 1M tokens | $0.327/M in · $2.7251/M out | |
| Chat | 1M tokens | $0.2725/M in · $1.6351/M out | |
| Chat | 1M tokens | $0.1526/M in · $0.3052/M out | |
| Chat | 1M tokens | $0.436/M in · $1.7441/M out | |
| Chat | 200k tokens | $1.0901/M in · $5.4503/M out | |
| Chat | 128k tokens | $0.109/M in · $0.109/M out | |
| Chat | 262k tokens | $1.0356/M in · $8.7205/M out | |
| Chat | 1M tokens | $0.327/M in · $2.7251/M out |
Por qué estos modelos
Flash Lite y DeepSeek Flash para el piso de latencia; Haiku y GPT mini cuando quieres velocidad con más juicio; Kimi Highspeed para code chat concurrente.
Úsalos con Geek Hub
Una base URL compatible con OpenAI y una API key. Cambia cualquier model id de esta lista sin reescribir tu cliente.
Consigue tu API keyPreguntas frecuentes
- ¿Rápido = barato?
- Casi siempre correlacionan, pero no siempre. Mira precio y p95 de latencia en tu región con un smoke test.
- ¿Sirven para agentes?
- Como workers sí. Como planner único, a veces no. Patrón típico: fast router + strong planner.
- ¿Streaming ayuda?
- Sí a la percepción. Activa stream en el cliente aunque el modelo ya sea rápido.