Unai España
Fundador, CEO
Un equipo pequeño y presencial en Barcelona trabajando en rendimiento en aceleradores, arquitecturas y todas las capas de la pila.
Fundador, CEO
Fundadora, CTO
Equipo técnico
Equipo técnico
Kernels
Infraestructura
Producto
Operaciones
Pocas personas, mucho contexto y cero reuniones que podrían ser un mensaje.
Todo el equipo en la misma oficina, en Poblenou. Los problemas de rendimiento se resuelven mejor delante de la misma pantalla.
Ninguna decisión técnica sin un benchmark reproducible contra tráfico real.
Desde el kernel CUDA/ROCm hasta la API pública. Nadie es dueño solo de una capa.
Cada persona tiene participación en la empresa y decide sobre lo que construye.
Respaldados por gente que ha construido infraestructura antes.
Buscamos gente obsesionada con el rendimiento.
Un equipo pequeño en Barcelona optimizando cada capa de la inferencia. Presencial, con participación y salario competitivo.
Si no encaja ninguno pero crees que deberías estar aquí, escríbenos igualmente.
Cada contrato incluye opciones. Construyes la empresa, eres parte de ella.
Clúster propio con H100, MI300X y hardware nuevo antes de que llegue al mercado.
Oficina propia, comida cubierta y equipo a tu elección.
30 minutos con alguien del equipo para entender qué buscas y qué buscamos.
Un problema de rendimiento sacado de producción. Pagada y en tu tiempo.
Trabajas con nosotros una jornada. Decidimos los dos la misma semana.
Por qué existimos y cómo trabajamos.
Modelo, motor, kernels y hardware se empujan unos a otros. La mayoría de equipos ajusta uno y deja el resto por defecto. Nosotros medimos la pila entera contra tu tráfico real.
Cada cambio pasa por un perfilado con tu carga. No desplegamos nada que no haya demostrado mejorar la métrica que te importa sin romper la corrección.
El tráfico cambia, los modelos se actualizan y llega hardware nuevo. La optimización es un proceso continuo, no un proyecto con fecha de fin.
La métrica que de verdad importa no es tokens por segundo: es cuánta inteligencia útil sacas de cada vatio y cada dólar. Todo lo que hacemos empuja esa relación.
Te decimos qué cambiamos, por qué y cuánto mejoró. Si un ajuste no aporta, lo revertimos y te lo contamos.
Ninguna optimización sale si cambia las respuestas del modelo más allá del ruido de medición.
Optimizamos contra la distribución real de tus peticiones, no contra MMLU ni contra un prompt sintético.
NVIDIA, AMD o lo que venga. Elegimos el silicio por coste y rendimiento, no por costumbre.
Trabaja con nosotros o tráenos tu carga.
Resultados medidos en producción.
Batching y caché ajustados al tráfico real de una API clínica.
Leer el caso →Kernels a medida y cuantización FP8 sin pérdida de precisión.
Leer el caso →Los tiempos de respuesta permitieron simplificar la pila y bajar el coste.
Leer el caso →Cuantización FP8 y decodificación especulativa sobre Qwen3 Coder.
Leer el caso →Consolidación de modelos de imagen y texto en un único endpoint dedicado.
Leer el caso →Autoescalado con capacidad reservada y batching adaptativo.
Leer el caso →Medidos en producción sobre todas las cargas dedicadas activas.
Nos das el modelo, un muestreo de tráfico y el SLO. Medimos la pila actual.
Motor, kernels y batching ajustados a tu carga. Cada cambio validado contra corrección.
Endpoint dedicado con mejora continua. Informe mensual de qué cambió y cuánto ganaste.
Perfilado gratuito en menos de una semana.
Notas técnicas y novedades.
Qué vamos a construir con ella y por qué el siguiente salto de rendimiento no viene del modelo.
INGENIERÍA · 02 SEP 2026Inferencia alfa en AMD: cómo llegamos a 11,33×Kernels de atención a medida para MI300X, paso a paso y con números.
Un correo al mes. Sin marketing, solo ingeniería.
500 $ en crédito gratis. Después, igualamos 1:1 hasta 10.000 $.
Crea una cuenta, verifica tu startup y recibe 500 $ de crédito al instante. A partir de ahí, por cada dólar que cargues igualamos otro, hasta 10.000 $.
Menos de 5 años desde la fundación, menos de 5 M$ levantados y un producto en desarrollo o en producción.
Sin tarjeta y sin compromiso. Suficiente para validar el producto con modelos abiertos punteros.
Por cada dólar que cargues durante el primer año, ponemos otro.
Slack compartido con el equipo que optimiza tu carga. Sin tickets.
Menos de 48 horas. Necesitamos el dominio de la empresa y una descripción del producto.
Los 500 $ iniciales caducan a los 12 meses. El matching se aplica durante el primer año desde la aprobación.
Sí. Cuando el tráfico lo justifique, el crédito restante se aplica a la capacidad dedicada.
Todo el catálogo serverless: Kimi, DeepSeek, Qwen, GLM, Llama y más. Actualizados el día que salen.
500 $ de crédito en menos de 48 horas.
Logotipo, colores y normas de uso.
Dos neutros y un verde de estado. Nada más.
Titulares y logotipo. Peso 500, interletrado -4 %.
Texto, botones e interfaz. Peso 400 y 500.
Logotipo en minúsculas, siempre en blanco sobre oscuro o negro sobre claro. Área de protección igual a la altura de la "e".
No lo deformes, no lo inclines, no añadas sombras ni degradados, no lo escribas en mayúsculas ni cambies la fuente.
Logotipo en SVG y PNG, paleta y tipografías.
Plentia aprende cómo se comporta tu carga y optimiza continuamente la pila de servicio: más rendimiento, fiabilidad y eficiencia.
230 TOK/S“Tiene la latencia más baja que hemos visto en cualquier proveedor. Y no se cae por un precipicio cuando subes las peticiones por minuto.”
Tráenos el modelo, la forma del tráfico y el SLO. Plentia construye el endpoint a su alrededor y sigue optimizando cuando ya está en producción.
Tu mezcla real de peticiones, no un benchmark genérico, decide el batching, la caché, el enrutado y el decode.
Modelo, motor, kernels y hardware se optimizan juntos contra el resultado que te importa.
Cada candidato debe preservar la corrección y cumplir tus objetivos de fiabilidad antes de poder salir.
Cuando el tráfico cambia, los modelos se actualizan o llega hardware nuevo, Plentia vuelve a medir y se adapta.
500 $ en crédito gratis. Después, igualamos 1:1 hasta 10.000 $.
La configuración más rápida rara vez es un solo interruptor. Kernels, motor de servicio, batching, cuantización, hardware y forma del tráfico se empujan unos a otros.
El agente perfila la pila para ver si la latencia o el throughput vienen del scheduling, el decoding, los kernels, la memoria o el ajuste al hardware.
Genera configuraciones candidatas de batching, decoding, cuantización, motores, kernels y hardware, y mide cada una.
Despliega la configuración más rápida y sigue perfilando el tráfico real a medida que cambian carga, modelos y hardware.
Modelo, motor, kernels y hardware se optimizan juntos contra el resultado que te importa.
Ops fusionadas, rutas de atención, variantes GEMM y kernels de decode ajustados al modelo y al hardware.
Auto-ajuste del motor de servicio para el modelo, el tráfico, la presión de memoria y el objetivo de latencia.
Compara decoding especulativo, formatos FP8 y FP4, estrategias de batching y sharding de expertos para MoE.
Trae tu modelo y tu tráfico real. Plentia perfila toda la pila de servicio y despliega solo mejoras verificadas.
Los mejores modelos. Una sola API.
Catálogo público. Los límites de tu equipo los marca tu clave API.
1curl -sS "https://api.plentia.app/v1/chat/completions" \ 2 -H "Authorization: Bearer $PLENTIA_API_KEY" \ 3 -d '{"model":"atlas-4","messages":[{"role":"user","content":"Hola"}]}'
1curl -sS "https://api.plentia.app/v1/chat/completions" \ 2 -H "Authorization: Bearer $PLENTIA_API_KEY" \ 3 -d '{"model":"nimbus-2","messages":[{"role":"user","content":"Hola"}]}'
Más modelos pronto. ✦ Añadimos modelos con frecuencia. Atento.
Crea una clave API y vuelve aquí para añadir crédito y gestionar la facturación.
Crea una clave API para empezar con el prepago. Después vuelve aquí para añadir crédito a tu saldo.
Crea y gestiona claves API para el acceso programático a Plentia.
Úsala para autenticar las peticiones a la API de Plentia.
Guarda tus claves en un lugar seguro. Cualquiera con una clave puede hacer peticiones y generar cargos en tu cuenta.
Consumo de tokens y coste por modelo en los últimos 30 días.
Cuando hagas tu primera petición verás aquí tokens, latencia y gasto por modelo.
Capacidad reservada para cargas con latencia y volumen garantizados.
Cuéntanos el modelo y el tráfico esperado y te preparamos una instancia.
Gestiona tu equipo y el acceso que se te ha concedido.
Las cuentas de equipo las configura Plentia. Escribe a hola@plentia.app y te ayudamos a configurar el acceso compartido para tu equipo.