Elegir entre modelos de OpenAI, Anthropic y Google por una tabla de benchmarks es un error común. Un benchmark general no reproduce tus catálogos, el español de tus clientes, tus herramientas ni el tiempo máximo aceptable en WhatsApp.
La comparación correcta empieza con tareas reales y termina con costo por conversación resuelta.
Primero: producto y API no son lo mismo
“ChatGPT” suele usarse como sinónimo de modelos de OpenAI, pero una integración empresarial utiliza una API. Lo mismo ocurre con Claude y Gemini. Los planes de las aplicaciones de consumo no sustituyen los precios ni las condiciones de sus APIs.
Consulta siempre las páginas oficiales de OpenAI, Anthropic y Google el día del cálculo.
Comparación por criterio
| Criterio | Qué medir | Por qué importa en WhatsApp |
|---|---|---|
| Precisión | Respuestas correctas sobre tus fuentes | Evita promesas falsas |
| Seguimiento | Cumplimiento de reglas y formato | Mantiene tono y límites |
| Latencia | Tiempo hasta respuesta útil | Reduce espera percibida |
| Costo | Costo completo por caso resuelto | Hace sostenible el volumen |
| Herramientas | Éxito al llamar CRM, agenda o inventario | Convierte conversación en acción |
| Multimodalidad | Audios e imágenes entendidos | Refleja cómo escribe el cliente |
| Estabilidad | Variación entre ejecuciones | Facilita control de calidad |
Qué suele importar más que la marca
Tamaño del contexto
Enviar documentos completos en cada turno aumenta costo y ruido. Un sistema RAG recupera solo fragmentos pertinentes.
Diseño del prompt
Anthropic recomienda instrucciones claras, contexto y ejemplos relevantes en su guía de prompting. Esas prácticas son útiles con cualquier proveedor.
Herramientas
Una respuesta elegante que no logra consultar inventario tiene menor valor que una respuesta sencilla conectada al sistema correcto.
Enrutamiento
No necesitas un único modelo. Puedes clasificar con uno económico, responder casos habituales con otro equilibrado y escalar excepciones.
Matriz de selección por tarea
| Tarea | Prioridad | Perfil recomendado |
|---|---|---|
| Detectar intención | Costo y velocidad | Modelo compacto |
| Buscar en FAQ | Recuperación precisa | Modelo eficiente con RAG |
| Comparar opciones | Razonamiento y fidelidad | Modelo equilibrado |
| Resumir para handoff | Cobertura y estructura | Modelo equilibrado |
| Ejecutar varias herramientas | Fiabilidad y trazas | Modelo con buen uso de tools |
| Conversación sensible | Precisión y escalamiento | Modelo avanzado + humano |
Cómo hacer una evaluación justa
- Anonimiza entre 100 y 300 conversaciones reales.
- Define una respuesta o resultado esperado.
- Incluye preguntas fáciles, ambiguas, adversariales y fuera de alcance.
- Ejecuta cada modelo con el mismo conocimiento y herramientas.
- Usa revisión ciega: quien califica no debe saber qué modelo respondió.
- Registra tokens, latencia, errores de herramientas y transferencias.
- Repite una muestra para medir variación.
| Métrica | Fórmula |
|---|---|
| Exactitud | Casos correctos / casos evaluados |
| Handoff correcto | Transferencias adecuadas / casos que requerían humano |
| Éxito de herramientas | Acciones correctas / intentos |
| Costo por resolución | Costo total / casos resueltos correctamente |
| Latencia p95 | Tiempo que no supera el 95% de respuestas |
Por qué “más barato por token” puede costar más
OpenAI explica que una tarifa menor por millón de tokens no garantiza menor costo total: modelos distintos pueden consumir cantidades diferentes y producir resultados con diferente calidad. Si un modelo barato necesita más reintentos o deriva más conversaciones, la operación puede terminar costando más.
El cálculo debe incluir entrada, salida, razonamiento, herramientas, reintentos y revisión humana.
BYOK y libertad de elección
Con BYOK, las claves pertenecen al negocio. Esto facilita probar modelos, ver facturas directas y cambiar proveedor. La arquitectura debe evitar que nombres de modelos queden dispersos en cada flujo; usa una capa de configuración.
Recomendación de Sendiak
Empieza con un modelo eficiente y un conjunto de evaluación. Escala solo las tareas que no alcanzan el umbral. Repite pruebas cuando cambie el modelo, el prompt, la base de conocimiento o una herramienta.
No publiques “usamos el mejor modelo” como argumento. Publica métricas propias: exactitud en tu conjunto, latencia, costo y tasa de acciones exitosas.
Conclusión
OpenAI, Anthropic y Google ofrecen modelos capaces. La ventaja competitiva no está en escoger un logotipo, sino en construir una evaluación reproducible y una arquitectura que pueda cambiar.
Conoce el enfoque multimodelo de Sendiak y revisa cómo evitar respuestas inventadas.
