IA privada
Modelos de lenguaje, voz e imagen ejecutados en hardware que controlamos, para que tus datos no salgan a servicios de terceros salvo que tú lo decidas.
El problema que resolvemos
Los servicios comerciales de IA son cómodos, pero cada consulta viaja a los servidores de otra empresa, con sus condiciones, sus cambios de precio y sus límites de uso. Para muchos negocios eso no es aceptable: historiales de clientes, datos de salud, contabilidad o propiedad intelectual no deberían depender de la política de un tercero. Y cuando todo pasa por una única API externa, un cambio ajeno puede parar tu operación.
Cómo trabajamos
Operamos nuestra propia plataforma de inferencia: un clúster Kubernetes con dos NVIDIA DGX Spark dedicados al modelo de lenguaje, una GPU independiente para generación de imagen y servicios de voz, memoria y observabilidad a su alrededor. Tus aplicaciones hablan con un único router de modelos; cada una tiene su clave y solo puede usar lo que se le ha permitido.
La regla con la que diseñamos cada sistema es sencilla: por defecto, el procesamiento es local. Si en algún caso conviene un respaldo en la nube —para no dejar sin respuesta un asistente público, por ejemplo—, se define por escrito, se limita a ese uso y queda reflejado en la configuración. En los sistemas que tratan datos sensibles, ese respaldo no existe.
Aplicamos la misma disciplina de operación que el equipo fundador ha practicado durante años en plataformas de gran escala: GitOps, monitorización, copias de seguridad, límites térmicos y de memoria vigilados, y un árbitro que decide qué carga puede entrar en cada GPU.
Qué incluye
- Evaluación de tus casos de uso y de qué datos no deben salir de casa.
- Selección de modelos y dimensionamiento de la capacidad necesaria.
- Servicio gestionado en nuestra plataforma o despliegue en infraestructura tuya.
- Integración con tus aplicaciones mediante una API compatible con OpenAI.
- Monitorización, trazas, actualizaciones de modelos y soporte.
Módulos
Inferencia en hardware propio
Dos NVIDIA DGX Spark sirviendo un modelo de lenguaje residente en paralelismo tensorial (vLLM, TP=2).
Router de modelos
LiteLLM como puerta única: cada aplicación tiene su propia clave, limitada a los modelos que puede usar, y un respaldo definido de antemano.
Observabilidad de LLM
Langfuse autoalojado para trazas, sesiones, depuración de prompts y evaluación, sin enviar las conversaciones fuera.
Voz
Transcripción con Whisper y síntesis de voz, incluida voz clonada con el consentimiento de su titular.
Memoria y búsqueda (RAG)
Índices vectoriales y de grafo (Qdrant y FalkorDB) sobre tus documentos, tu catálogo o tu historial.
Árbitro de GPU y panel de control
Un panel que publica qué carga ocupa cada GPU y un guardián que impide lanzar trabajos que tumbarían el modelo en servicio.
Acceso único
Keycloak y oauth2-proxy delante de cada servicio: una identidad por persona, grupos y permisos.
Casos relacionados
Plataforma de IA privada sobre dos NVIDIA DGX Spark
El clúster Kubernetes en el que corren todos nuestros sistemas: un modelo de lenguaje residente repartido entre dos DGX Spark, imagen en una GPU aparte, voz, memoria y observabilidad, todo bajo GitOps.
Ver caso →Sistema Galán: propuesta interactiva para un preparador de culturismo
Una propuesta que se puede recorrer, escuchar y preguntar: 23 módulos para digitalizar el método de un preparador que hoy lo lleva todo a mano, con asistente de IA y pantallas de cada fase.
Ver caso →
¿Tienes un problema de datos o de proceso?
Escríbenos: respondemos con un plan concreto, sin compromiso.
Hablemos →