Una API. Compatible con OpenAI y con Anthropic. Servida desde Europa.
Cambia la URL base y ya estás ejecutando modelos abiertos sobre nuestra infraestructura. Sin desplegar nada, sin gestionar GPUs, sin compromiso. Pagas por millón de tokens.
Respuesta en 48 horas.
Cuatro piezas, una sola API.
from openai import OpenAI client = OpenAI( api_key="nb-...", base_url="https://api.nextbit256.com/v1", # the only change )
Cambia la URL base. Tu código no se toca.
Exponemos la API en los dos formatos que ya usa tu stack: el de OpenAI y el de Anthropic. Si programas con Claude Code, Cursor, Cline o cualquier agente que hable alguno de los dos protocolos, cambias la URL base y la clave y sigue funcionando igual.
Sin fijos. Sin mínimos.
Pagas por millón de tokens de entrada y de salida, lo que uses y nada más. Si tienes compromiso de gasto con AWS, puedes comprar vía Private Offer en AWS Marketplace.
España por defecto.
Si algún modelo del catálogo se sirviera desde fuera de la Unión Europea, aparece marcado en su ficha y en la tabla de modelos, antes de que lo integres, no después.
Hardware, balanceo y colas. Tú envías una petición HTTP.
El stack de inferencia, el autoescalado y la tolerancia a fallos corren por nuestra cuenta. No despliegas nada y no gestionas una sola GPU.
- 01Crea tu cuenta
- 02Cambia la base_url
- 03Corre en España
- 04Responde en ms
Modelos disponibles, con precio por token.
Todos hablan la misma API. La procedencia de cada modelo va marcada en su tarjeta, no en la letra pequeña.
Qwen3.5-35B-A3B
0,088 $/M entrada · 0,348 $/M salida
UEGemma 4 26B A4B
0,100 $/M entrada · 0,400 $/M salida
UEALIA-40B
0,120 $/M entrada · 0,480 $/M salida
UEKimi K2.5
0,140 $/M entrada · 0,560 $/M salida
MultiDeepSeek V4 Flash
0,140 $/M entrada · 0,280 $/M salida
UELlama 3.1 70B
0,150 $/M entrada · 0,600 $/M salida
UELas objeciones, respondidas.
¿Es realmente compatible con la API de OpenAI?
Sí: mismo formato de peticiones y respuestas. Cambias base_url y api_key, el resto de tu código no se toca.
¿Se usan mis datos para entrenar?
No, nunca. Ni los prompts ni las respuestas entrenan ningún modelo, ni nuestro ni de terceros.
¿Cuánto guardáis las peticiones?
90 días de retención operativa con borrado automático. En Dedicated Inference puede pactarse retención cero.
¿Puedo pasar a dedicado sin reescribir código?
Sí. Misma API y misma capa: cambiar de serverless a dedicado es una decisión de despliegue, no una migración.
¿Qué límites de rate hay?
Límites estándar por clave pensados para producción. Si tu caso los supera, se amplían en el dimensionamiento.
Genera tu API key y cambia una línea de configuración.
Sin contratos, sin mínimos, sin gestionar una sola GPU. Prueba en minutos con tu stack actual.