Maximizar la inteligencia por vatio usando IA para optimizar la infraestructura de IA

Un equipo pequeño y presencial en Barcelona trabajando en rendimiento en aceleradores, arquitecturas y todas las capas de la pila.

UE

Unai España

Fundador, CEO

MR

Marta Roig

Fundadora, CTO

JP

Joan Puig

Equipo técnico

AL

Aina López

Equipo técnico

DV

David Vila

Kernels

LS

Laia Serra

Infraestructura

PM

Pol Martí

Producto

NC

Nil Costa

Operaciones

Cómo trabajamos

Pocas personas, mucho contexto y cero reuniones que podrían ser un mensaje.

Presencial en Barcelona

Todo el equipo en la misma oficina, en Poblenou. Los problemas de rendimiento se resuelven mejor delante de la misma pantalla.

Perfilar antes de opinar

Ninguna decisión técnica sin un benchmark reproducible contra tráfico real.

Toda la pila

Desde el kernel CUDA/ROCm hasta la API pública. Nadie es dueño solo de una capa.

Propiedad real

Cada persona tiene participación en la empresa y decide sobre lo que construye.

Inversores

Respaldados por gente que ha construido infraestructura antes.

40 M$Serie A · sep 2026
12personas en el equipo
2T+tokens servidos
2024fundada en Barcelona

¿Quieres trabajar con nosotros?

Buscamos gente obsesionada con el rendimiento.

Empleo

Un equipo pequeño en Barcelona optimizando cada capa de la inferencia. Presencial, con participación y salario competitivo.

Qué ofrecemos

EQUITY

Participación para todos

Cada contrato incluye opciones. Construyes la empresa, eres parte de ella.

HARDWARE

Acceso a GPUs de verdad

Clúster propio con H100, MI300X y hardware nuevo antes de que llegue al mercado.

OFICINA

Poblenou, Barcelona

Oficina propia, comida cubierta y equipo a tu elección.

Proceso

Conversación inicial

30 minutos con alguien del equipo para entender qué buscas y qué buscamos.

Prueba técnica real

Un problema de rendimiento sacado de producción. Pagada y en tu tiempo.

Día en la oficina

Trabajas con nosotros una jornada. Decidimos los dos la misma semana.

Manifiesto

Por qué existimos y cómo trabajamos.

El rendimiento no se gana en una sola capa

Modelo, motor, kernels y hardware se empujan unos a otros. La mayoría de equipos ajusta uno y deja el resto por defecto. Nosotros medimos la pila entera contra tu tráfico real.

Medir antes de opinar

Cada cambio pasa por un perfilado con tu carga. No desplegamos nada que no haya demostrado mejorar la métrica que te importa sin romper la corrección.

Nunca terminado

El tráfico cambia, los modelos se actualizan y llega hardware nuevo. La optimización es un proceso continuo, no un proyecto con fecha de fin.

Inteligencia por vatio

La métrica que de verdad importa no es tokens por segundo: es cuánta inteligencia útil sacas de cada vatio y cada dólar. Todo lo que hacemos empuja esa relación.

Sin caja negra

Te decimos qué cambiamos, por qué y cuánto mejoró. Si un ajuste no aporta, lo revertimos y te lo contamos.

Lo que esto significa en la práctica

PRINCIPIO 01

Corrección primero

Ninguna optimización sale si cambia las respuestas del modelo más allá del ruido de medición.

PRINCIPIO 02

Tu tráfico, no un benchmark

Optimizamos contra la distribución real de tus peticiones, no contra MMLU ni contra un prompt sintético.

PRINCIPIO 03

Hardware agnóstico

NVIDIA, AMD o lo que venga. Elegimos el silicio por coste y rendimiento, no por costumbre.

Si esto resuena contigo

Trabaja con nosotros o tráenos tu carga.

Casos

Resultados medidos en producción.

NEON HEALTH

Latencia un 62 % más baja sin tocar el modelo

Batching y caché ajustados al tráfico real de una API clínica.

Leer el caso →
DIGITALOCEAN

Kimi 2.5 11,33× más rápido en AMD

Kernels a medida y cuantización FP8 sin pérdida de precisión.

Leer el caso →
BRILLIANT

Eliminada una capa entera de caché especulativa

Los tiempos de respuesta permitieron simplificar la pila y bajar el coste.

Leer el caso →
LOVABLE

Coste por token un 41 % menor en generación de código

Cuantización FP8 y decodificación especulativa sobre Qwen3 Coder.

Leer el caso →
FLORA

De 3 a 1 proveedor de inferencia

Consolidación de modelos de imagen y texto en un único endpoint dedicado.

Leer el caso →
PERPLEXITY LABS

P99 estable bajo picos de 20× tráfico

Autoescalado con capacidad reservada y batching adaptativo.

Leer el caso →

Resultados agregados

Medidos en producción sobre todas las cargas dedicadas activas.

-58 %latencia P50 media
2,7×rendimiento por GPU
-44 %coste por millón de tokens
99,95 %disponibilidad

Cómo empieza un caso

Perfilado

Nos das el modelo, un muestreo de tráfico y el SLO. Medimos la pila actual.

Optimización

Motor, kernels y batching ajustados a tu carga. Cada cambio validado contra corrección.

Producción

Endpoint dedicado con mejora continua. Informe mensual de qué cambió y cuánto ganaste.

Cuéntanos tu carga

Perfilado gratuito en menos de una semana.

Blog

Notas técnicas y novedades.

DESTACADO · 14 SEP 2026Plentia cierra una ronda de 40 M$

Qué vamos a construir con ella y por qué el siguiente salto de rendimiento no viene del modelo.

INGENIERÍA · 02 SEP 2026Inferencia alfa en AMD: cómo llegamos a 11,33×

Kernels de atención a medida para MI300X, paso a paso y con números.

14 SEP 2026Plentia cierra una ronda de 40 M$ 02 SEP 2026Inferencia alfa en AMD: cómo llegamos a 11,33× 19 AGO 2026Por qué el batching adaptativo vence al estático 05 AGO 2026FP4 en producción sin sustos 22 JUL 2026KV cache: cuándo compartirlo y cuándo no 08 JUL 2026Decodificación especulativa en cargas de código 24 JUN 2026Lo que aprendimos sirviendo 1T de tokens 10 JUN 2026Novedades del panel: equipos y claves con permisos

Recibe las notas técnicas

Un correo al mes. Sin marketing, solo ingeniería.

Plentia para Startups

500 $ en crédito gratis. Después, igualamos 1:1 hasta 10.000 $.

Cómo funciona

Crea una cuenta, verifica tu startup y recibe 500 $ de crédito al instante. A partir de ahí, por cada dólar que cargues igualamos otro, hasta 10.000 $.

Requisitos

Menos de 5 años desde la fundación, menos de 5 M$ levantados y un producto en desarrollo o en producción.

Qué incluye

CRÉDITO

500 $ al instante

Sin tarjeta y sin compromiso. Suficiente para validar el producto con modelos abiertos punteros.

MATCHING

Hasta 10.000 $ igualados

Por cada dólar que cargues durante el primer año, ponemos otro.

SOPORTE

Canal directo con ingeniería

Slack compartido con el equipo que optimiza tu carga. Sin tickets.

Startups que empezaron aquí

320+startups en el programa
18pasaron a dedicado
4en Y Combinator
0 $coste hasta producción

Preguntas frecuentes

¿Cuánto tarda la verificación?

Menos de 48 horas. Necesitamos el dominio de la empresa y una descripción del producto.

¿Caduca el crédito?

Los 500 $ iniciales caducan a los 12 meses. El matching se aplica durante el primer año desde la aprobación.

¿Podemos pasar a un endpoint dedicado?

Sí. Cuando el tráfico lo justifique, el crédito restante se aplica a la capacidad dedicada.

¿Qué modelos están disponibles?

Todo el catálogo serverless: Kimi, DeepSeek, Qwen, GLM, Llama y más. Actualizados el día que salen.

Empieza hoy

500 $ de crédito en menos de 48 horas.

Marca

Logotipo, colores y normas de uso.

plentia
plentia

Colores

Dos neutros y un verde de estado. Nada más.

NEGRO #0A0A0A
HUESO #F2F2F0
SALVIA #9FB1AE
ESTADO #3DDC84

Tipografía

Inter

Titulares y logotipo. Peso 500, interletrado -4 %.

Space Grotesk

Texto, botones e interfaz. Peso 400 y 500.

Normas de uso

Logotipo en minúsculas, siempre en blanco sobre oscuro o negro sobre claro. Área de protección igual a la altura de la "e".

No

No lo deformes, no lo inclines, no añadas sombras ni degradados, no lo escribas en mayúsculas ni cambies la fuente.

Descargar el kit de marca

Logotipo en SVG y PNG, paleta y tipografías.

2T+ TOKENS DE INFERENCIA CONTINUA

Inferencia que
no deja de mejorar

Plentia aprende cómo se comporta tu carga y optimiza continuamente la pila de servicio: más rendimiento, fiabilidad y eficiencia.

motor ajustado230 TOK/S
kernels fusionados315 TOK/S
tráfico re-ajustado400 TOK/S

“Tiene la latencia más baja que hemos visto en cualquier proveedor. Y no se cae por un precipicio cuando subes las peticiones por minuto.”

HB
Harry B.Cofundador y CTO, Neon Health
VercelOllamaCommand CodeOrchestraNeon HealthConvosoDigitalOceanAWSVapiSarvam AITavusBrilliant VercelOllamaCommand CodeOrchestraNeon HealthConvosoDigitalOceanAWSVapiSarvam AITavusBrilliant
DEDICADO

La inferencia que tu producto necesita de verdad

Tráenos el modelo, la forma del tráfico y el SLO. Plentia construye el endpoint a su alrededor y sigue optimizando cuando ya está en producción.

400 TOK/S

A medida de tu tráfico

Tu mezcla real de peticiones, no un benchmark genérico, decide el batching, la caché, el enrutado y el decode.

1.020.230.84

Toda la pila explorada

Modelo, motor, kernels y hardware se optimizan juntos contra el resultado que te importa.

✓ SAFE TO SHIP

Fiable por diseño

Cada candidato debe preservar la corrección y cumplir tus objetivos de fiabilidad antes de poder salir.

FUSEDTUNEDRE-TUNEDADAPTED
380/s

Nunca deja de optimizar

Cuando el tráfico cambia, los modelos se actualizan o llega hardware nuevo, Plentia vuelve a medir y se adapta.

Plentia para Startups

500 $ en crédito gratis. Después, igualamos 1:1 hasta 10.000 $.

TECNOLOGÍA PLENTIA

Por qué importa optimizar toda la pila

La configuración más rápida rara vez es un solo interruptor. Kernels, motor de servicio, batching, cuantización, hardware y forma del tráfico se empujan unos a otros.

  1. 1

    Encontrar los cuellos de botella

    El agente perfila la pila para ver si la latencia o el throughput vienen del scheduling, el decoding, los kernels, la memoria o el ajuste al hardware.

  2. 2

    Probar muchos caminos

    Genera configuraciones candidatas de batching, decoding, cuantización, motores, kernels y hardware, y mide cada una.

  3. 3

    Desplegar el ganador medido

    Despliega la configuración más rápida y sigue perfilando el tráfico real a medida que cambian carga, modelos y hardware.

Heterogéneo por diseño

Modelo, motor, kernels y hardware se optimizan juntos contra el resultado que te importa.

NVIDIA B200/B300AMD MI350XAWS TrainiumGoogle TPU

Kernels a medida por forma de tráfico

Ops fusionadas, rutas de atención, variantes GEMM y kernels de decode ajustados al modelo y al hardware.

CUDAHIPTritonNKI

Configuración del motor por carga

Auto-ajuste del motor de servicio para el modelo, el tráfico, la presión de memoria y el objetivo de latencia.

SchedulerKV cacheRuntime

Búsqueda de estrategia de decode

Compara decoding especulativo, formatos FP8 y FP4, estrategias de batching y sharding de expertos para MoE.

Speculative DecodeFP8/FP4BatchingExpert Sharding
TU CARGA, OPTIMIZADA

Encuentra la configuración más rápida para tu carga

Trae tu modelo y tu tráfico real. Plentia perfila toda la pila de servicio y despliega solo mejoras verificadas.

Entra en Plentia

Los mejores modelos. Una sola API.

o
¿Has olvidado la contraseña?
Envíame un enlace de acceso
¿Aún no tienes cuenta? Crear cuenta

Encuentra el modelo adecuado para tu próxima tarea.

Catálogo público. Los límites de tu equipo los marca tu clave API.

AAtlas-4
Modelo generalista para código y agentes con contexto de 1M tokens.
Entrada1,19 $
Salida4,40 $
Caché0,26 $
Contexto1,0M
Copiar y ejecutar >_ cURLRazonamiento Off
1curl -sS "https://api.plentia.app/v1/chat/completions" \
2  -H "Authorization: Bearer $PLENTIA_API_KEY" \
3  -d '{"model":"atlas-4","messages":[{"role":"user","content":"Hola"}]}'
NNimbus-2
Modelo rápido para agentes y cargas de contexto largo.
Entrada1,14 $
Salida4,80 $
Caché0,19 $
Contexto262K
Copiar y ejecutar >_ cURLRazonamiento Off
1curl -sS "https://api.plentia.app/v1/chat/completions" \
2  -H "Authorization: Bearer $PLENTIA_API_KEY" \
3  -d '{"model":"nimbus-2","messages":[{"role":"user","content":"Hola"}]}'

Más modelos pronto. Añadimos modelos con frecuencia. Atento.

Facturación

Crea una clave API y vuelve aquí para añadir crédito y gestionar la facturación.

Configuración · Paso 1 de 2

Configura la facturación

Crea una clave API para empezar con el prepago. Después vuelve aquí para añadir crédito a tu saldo.

1Crear y copiar una clave API2Volver aquí y añadir crédito

Claves API

Crea y gestiona claves API para el acceso programático a Plentia.

Crea tu primera clave API

Úsala para autenticar las peticiones a la API de Plentia.

Guarda tus claves en un lugar seguro. Cualquiera con una clave puede hacer peticiones y generar cargos en tu cuenta.

Uso

Consumo de tokens y coste por modelo en los últimos 30 días.

Sin actividad

Aún no hay uso

Cuando hagas tu primera petición verás aquí tokens, latencia y gasto por modelo.

Dedicado

Capacidad reservada para cargas con latencia y volumen garantizados.

Bajo demanda

Reserva capacidad dedicada

Cuéntanos el modelo y el tráfico esperado y te preparamos una instancia.

Equipos

Gestiona tu equipo y el acceso que se te ha concedido.

Aún no hay cuenta de equipo

Las cuentas de equipo las configura Plentia. Escribe a hola@plentia.app y te ayudamos a configurar el acceso compartido para tu equipo.