Inferencia crítica a gran escala, sobre tu endpoint dedicado.
Tienes un endpoint propio donde desplegamos uno o varios modelos de IA en el mismo entorno: el open source que elijas, un modelo propio que tú nos traigas o un fine-tuning sobre uno de nuestros modelos base servido en tu dedicated. Si no sabes qué modelo encaja con tu caso, te ayudamos a decidir. Recursos que no compartes con nadie, ideal para tus procesos más críticos, mejor aprovechamiento de la caché de contexto y una cuota mensual fija con tokens ilimitados y coste predecible.
Respuesta en 48 horas.
Un tier para cada tamaño, no para cada carga de trabajo.
Starter
Hasta 40B de parámetros en precisión completa, hasta 70B cuantizado.
Qwen3 14B
Gemma 4 27B
DeepSeek-OCR 2
Qwen3-Embedding
Mejor para Voz en tiempo real, RAG, clasificación y volumen alto. El menor coste por millón de tokens de todo el catálogo.
Pro
Hasta 350B de parámetros en precisión completa, hasta 700B cuantizado.
Qwen3-Coder-480B-A35B
DeepSeek-V4-Flash- Minimax
Mejor para Razonamiento, agentes, documentos largos y modelos MoE grandes.
Enterprise
Sin límite superior. Se dimensiona a medida para tu caso.
Kimi K3- GLM-5.3
DeepSeek-V4 Pro
Mejor para Soberanía total, un modelo frontera dedicado y despliegue on-premise.
Un tier, el modelo que tú elijas
No eliges un tier por sus especificaciones: lo eliges por el tamaño del modelo que tu caso necesita. Dentro de tu endpoint dedicado desplegamos el modelo que decidas y, si no sabes cuál, te lo recomendamos en el dimensionamiento.
Datos sensibles, con control real.
Si tratas datos de salud u otras categorías especiales del artículo 9 del RGPD, necesitas saber exactamente dónde se procesan y quién puede verlos. Dedicated Inference, con DPA, te da ese control: tu carga no comparte infraestructura con nadie. Una API pública compartida no puede dártelo.
Lo que firmamos en el contrato. Y lo que cuesta al mes.
Rendimiento y garantías
Cuota mensual fija y recursos 100 % dedicados a tu carga, comprometidos por contrato. Sin picos ajenos que te afecten. Los detalles de tu caso, desde el modelo hasta el volumen esperado, se cierran en el dimensionamiento.
Precio
Cuota mensual fija prepagada. Cuanto más largo el compromiso, menor la cuota: permanencias de 6, 12, 18 y 24 meses. Tokens ilimitados dentro de tu capacidad.
Las objeciones, respondidas.
¿Mis datos salen de España?
No. Tu endpoint corre en nuestra infraestructura propia en España.
¿Puede EE. UU. pedir acceso?
El CLOUD Act no aplica sobre nuestra infraestructura: somos una empresa española sin matriz estadounidense.
¿Comparto mi endpoint con otros clientes?
No. Tu endpoint está dedicado en exclusiva a tu carga. Si tu equipo de seguridad necesita el detalle técnico de cómo lo garantizamos, lo compartimos en el dimensionamiento o en una llamada.
¿Tengo que saber qué modelo necesito?
No. Si no sabes cuál se ajusta mejor a tu caso, te lo recomendamos nosotros en el dimensionamiento.
¿Puedo pactar retención cero?
Sí: se define en el propio acuerdo del endpoint.
¿Cuánto tarda en estar operativo?
Quote en 48 horas. Despliegue en 5 días laborables desde la firma.
¿Puedo traer mis propios pesos?
Sí, incluidos modelos fine-tuneados, aquí o en cualquier otro sitio.
¿Hablamos de tu caso?
Respuesta en 48 horas a través del formulario de contacto, normalmente antes.