SERVICIO 01 · INFERENCIA SERVERLESS

Una API. Compatible con OpenAI y con Anthropic. Servida desde Europa.

Cambia la URL base y ya estás ejecutando modelos abiertos sobre nuestra infraestructura. Sin desplegar nada, sin gestionar GPUs, sin compromiso. Pagas por millón de tokens.

Respuesta en 48 horas.

ComputeClientesGateway Nextbit
El servicio

Cuatro piezas, una sola API.

api.nextbit256.com
from openai import OpenAI

client = OpenAI(
    api_key="nb-...",
    base_url="https://api.nextbit256.com/v1",  # the only change
)
SERVED FROM THE EU·Qwen3.5-35B-A3B·TTFT 210 ms·0.00% tool-call errors
Compatibilidad doble

Cambia la URL base. Tu código no se toca.

Exponemos la API en los dos formatos que ya usa tu stack: el de OpenAI y el de Anthropic. Si programas con Claude Code, Cursor, Cline o cualquier agente que hable alguno de los dos protocolos, cambias la URL base y la clave y sigue funcionando igual.

< 20 €/mes25 personas · 60 consultas al día · modelo abierto mediano
Pago por token

Sin fijos. Sin mínimos.

Pagas por millón de tokens de entrada y de salida, lo que uses y nada más. Si tienes compromiso de gasto con AWS, puedes comprar vía Private Offer en AWS Marketplace.

Infraestructura propia en España
Dónde corre

España por defecto.

Si algún modelo del catálogo se sirviera desde fuera de la Unión Europea, aparece marcado en su ficha y en la tabla de modelos, antes de que lo integres, no después.

BalanceoAutoescaladoColasTolerancia a fallosObservabilidadCumplimiento
Qué gestionamos nosotros

Hardware, balanceo y colas. Tú envías una petición HTTP.

El stack de inferencia, el autoescalado y la tolerancia a fallos corren por nuestra cuenta. No despliegas nada y no gestionas una sola GPU.

  1. 01Crea tu cuenta
  2. 02Cambia la base_url
  3. 03Corre en España
  4. 04Responde en ms
Para quién no es: si tu carga es alta y sostenida (un agente en producción, un contact center, un pipeline documental), el pago por token acaba costando más que Dedicated Inference. Te lo decimos en la primera llamada, aunque a nosotros nos convenga menos.
Catálogo

Modelos disponibles, con precio por token.

Todos hablan la misma API. La procedencia de cada modelo va marcada en su tarjeta, no en la letra pequeña.

Logotipo de QwenTexto

Qwen3.5-35B-A3B

Qwen · 35B (A3B)

0,088 $/M entrada · 0,348 $/M salida

UE
Logotipo de GemmaTexto

Gemma 4 26B A4B

Gemma · 26B (A4B)

0,100 $/M entrada · 0,400 $/M salida

UE
Texto

ALIA-40B

ALIA · 40B

0,120 $/M entrada · 0,480 $/M salida

UE
Logotipo de KimiTexto

Kimi K2.5

Kimi · MoE

0,140 $/M entrada · 0,560 $/M salida

Multi
Logotipo de DeepSeekTexto

DeepSeek V4 Flash

DeepSeek · MoE

0,140 $/M entrada · 0,280 $/M salida

UE
Logotipo de LlamaTexto

Llama 3.1 70B

Llama · 70B

0,150 $/M entrada · 0,600 $/M salida

UE

Ver todos los modelos y comparar

FAQ

Las objeciones, respondidas.

¿Es realmente compatible con la API de OpenAI?

Sí: mismo formato de peticiones y respuestas. Cambias base_url y api_key, el resto de tu código no se toca.

¿Se usan mis datos para entrenar?

No, nunca. Ni los prompts ni las respuestas entrenan ningún modelo, ni nuestro ni de terceros.

¿Cuánto guardáis las peticiones?

90 días de retención operativa con borrado automático. En Dedicated Inference puede pactarse retención cero.

¿Puedo pasar a dedicado sin reescribir código?

Sí. Misma API y misma capa: cambiar de serverless a dedicado es una decisión de despliegue, no una migración.

¿Qué límites de rate hay?

Límites estándar por clave pensados para producción. Si tu caso los supera, se amplían en el dimensionamiento.

Empieza ahora

Genera tu API key y cambia una línea de configuración.

Sin contratos, sin mínimos, sin gestionar una sola GPU. Prueba en minutos con tu stack actual.

Sin gestión de GPUsPago por tokenServido desde España