SERVICIO 02 · DEDICATED INFERENCE

Inferencia crítica a gran escala, sobre tu endpoint dedicado.

Tienes un endpoint propio donde desplegamos uno o varios modelos de IA en el mismo entorno: el open source que elijas, un modelo propio que tú nos traigas o un fine-tuning sobre uno de nuestros modelos base servido en tu dedicated. Si no sabes qué modelo encaja con tu caso, te ayudamos a decidir. Recursos que no compartes con nadie, ideal para tus procesos más críticos, mejor aprovechamiento de la caché de contexto y una cuota mensual fija con tokens ilimitados y coste predecible.

Respuesta en 48 horas.

Zona privadaCliente únicoKIMI K3Endpoint en EspañaZero data retentionPrecio fijoEndpoint dedicado
Los tres tiers

Un tier para cada tamaño, no para cada carga de trabajo.

Starter

Hasta 40B de parámetros en precisión completa, hasta 70B cuantizado.

  • Logotipo de Qwen3 14BQwen3 14B
  • Logotipo de Gemma 4 27BGemma 4 27B
  • Logotipo de DeepSeek-OCR 2DeepSeek-OCR 2
  • Logotipo de Qwen3-EmbeddingQwen3-Embedding

Mejor para Voz en tiempo real, RAG, clasificación y volumen alto. El menor coste por millón de tokens de todo el catálogo.

Pro

Hasta 350B de parámetros en precisión completa, hasta 700B cuantizado.

  • Logotipo de Qwen3-Coder-480B-A35BQwen3-Coder-480B-A35B
  • Logotipo de DeepSeek-V4-FlashDeepSeek-V4-Flash
  • Minimax

Mejor para Razonamiento, agentes, documentos largos y modelos MoE grandes.

Enterprise

Sin límite superior. Se dimensiona a medida para tu caso.

  • Logotipo de Kimi K3Kimi K3
  • GLM-5.3
  • Logotipo de DeepSeek-V4 ProDeepSeek-V4 Pro

Mejor para Soberanía total, un modelo frontera dedicado y despliegue on-premise.

Cómo elegir

Un tier, el modelo que tú elijas

No eliges un tier por sus especificaciones: lo eliges por el tamaño del modelo que tu caso necesita. Dentro de tu endpoint dedicado desplegamos el modelo que decidas y, si no sabes cuál, te lo recomendamos en el dimensionamiento.

RGPD

Datos sensibles, con control real.

Artículo 9 RGPD

Si tratas datos de salud u otras categorías especiales del artículo 9 del RGPD, necesitas saber exactamente dónde se procesan y quién puede verlos. Dedicated Inference, con DPA, te da ese control: tu carga no comparte infraestructura con nadie. Una API pública compartida no puede dártelo.

Garantías y precio

Lo que firmamos en el contrato. Y lo que cuesta al mes.

Rendimiento y garantías

Cuota mensual fija y recursos 100 % dedicados a tu carga, comprometidos por contrato. Sin picos ajenos que te afecten. Los detalles de tu caso, desde el modelo hasta el volumen esperado, se cierran en el dimensionamiento.

Precio

Cuota mensual fija prepagada. Cuanto más largo el compromiso, menor la cuota: permanencias de 6, 12, 18 y 24 meses. Tokens ilimitados dentro de tu capacidad.

FAQ

Las objeciones, respondidas.

¿Mis datos salen de España?

No. Tu endpoint corre en nuestra infraestructura propia en España.

¿Puede EE. UU. pedir acceso?

El CLOUD Act no aplica sobre nuestra infraestructura: somos una empresa española sin matriz estadounidense.

¿Comparto mi endpoint con otros clientes?

No. Tu endpoint está dedicado en exclusiva a tu carga. Si tu equipo de seguridad necesita el detalle técnico de cómo lo garantizamos, lo compartimos en el dimensionamiento o en una llamada.

¿Tengo que saber qué modelo necesito?

No. Si no sabes cuál se ajusta mejor a tu caso, te lo recomendamos nosotros en el dimensionamiento.

¿Puedo pactar retención cero?

Sí: se define en el propio acuerdo del endpoint.

¿Cuánto tarda en estar operativo?

Quote en 48 horas. Despliegue en 5 días laborables desde la firma.

¿Puedo traer mis propios pesos?

Sí, incluidos modelos fine-tuneados, aquí o en cualquier otro sitio.

¿Hablamos de tu caso?

Respuesta en 48 horas a través del formulario de contacto, normalmente antes.