// Engineering Log

Confgraph: ¿He reinventado la rueda al crear un asistente de IA para videollamadas?

Publicado el 30.07.2026

// Ruta rapida

Este articulo pertenece al tema Despliegue y estabilidad.

A veces me sorprendo pensando: «¿y si esto ya lo ha hecho alguien?» — ya después de haber escrito otro trozo de código. Con confgraph, mi secretario IA para videoconferencias, decidí no adivinar y comprobar honestamente: ¿hasta qué punto es un descubrimiento revolucionario y tiene sentido seguir?

¿Qué es este proyecto?

Confgraph es un bot backend basado en LiveKit, que entra en la videollamada como participante solo-suscriptor (sin su propio micrófono, a menudo oculto en la lista de participantes), escucha a cada hablante por separado y:

  • reconoce el habla localmente, mediante faster-whisper en CPU — sin enviar audio a ningún sitio;
  • clasifica las frases por temas y construye a partir de ellas un grafo de discusión — no una lista plana de etiquetas, sino nodos (temas) con relaciones (relation) entre ellos, a través de LLM (OpenRouter);
  • guarda la transcripción, los embeddings y el grafo en SQLite — el audio crudo no se guarda en la base;
  • responde a preguntas sobre el contenido de la llamada mediante un endpoint RAG;
  • después de la llamada genera resúmenes: por temas, off-topic, decisiones, plazos, tareas para la próxima llamada.

Encima — Meet, un fork de livekit-examples/meet con un panel «Secretario»: lista de temas, árbol de discusión con autoactualización, botón de resumen. Todo eso corre en un docker-compose propio (LiveKit + confgraph + meet), sin dependencias externas de SaaS, salvo una llamada a un LLM vía API. Se puede probar en vivo en meet.regionruza.ru.

Un pequeño apunte para quienes gustan de los detalles de configuración — de lo que realmente se puede ajustar:

ACTIVE_SPEAKER_MODE=replace   # límites de la frase = active speaker + hangover 2s
CLASSIFY_TOPIC_CONFIDENCE=0.9 # umbral por debajo del cual un breve «ok» no cambia el tema
LIVEKIT_HIDDEN=true           # el bot no aparece en la lista de participantes
CHAT_LOG_ENABLED=false        # no enviar spam al chat general de la reunión

Comprobación de si es reinventar la rueda

Antes de escribir otra línea, revisé el mercado — y esto es lo que hay.

SaaS comerciales

Otter.ai, Fireflies, Fathom, tl;dv, Grain, Read.ai — toda esta categoría funciona con el mismo principio: un bot-invitado entra en una llamada ajena (Zoom, Google Meet, Teams) como participante separado, el audio se envía a la nube y a cambio obtienes transcripción y resumen. Los precios van desde un plan gratuito con limitaciones (en Fathom, por ejemplo, hay un límite en el número de resúmenes AI por mes) hasta 30–40 dólares por asiento al mes en los planes superiores. Algunos (Fireflies, MeetGeek) tienen «topic tracking» — pero eso es seguimiento de temas repetidos como analítica, una lista plana, no un grafo con relaciones entre temas.

Self-hosted y de código abierto

Aquí es más interesante, porque son competidores directos en espíritu «gratis y sin suscripción»:

  • Meetily — código abierto, licencia MIT, Whisper/Parakeet local, resúmenes vía Ollama o cualquier API elegida. En la práctica es el análogo gratuito más cercano a confgraph en la parte de «STT + resúmenes localmente». Pero es una aplicación de escritorio para una sola persona en su máquina — no es un servicio con API para una sala con varios participantes, ni está integrado en ninguna videollamada como producto.
  • Vexa — API open-source self-hostable para bots-participantes que entran en Google Meet/Teams/Zoom, con transcripciones en tiempo real y webhooks. Es lo más cercano a confgraph en arquitectura (self-host, API-first), pero es un constructor para desarrolladores, orientado a entrar en llamadas ajenas, no una plataforma propia para reuniones. Allí no hay grafo de temas ni RAG por sala.
  • LiveKit Agents — el framework sobre el que está construido confgraph, en sí proporciona primitivos STT/TTS/VAD para agentes de voz, pero es material de base, no un secretario listo para usar. El uso de LiveKit aquí no es reinventar la rueda, sino aplicar un ladrillo ya hecho para su propósito.

Así que no es reinventar la rueda

Si se reduce al hecho puro de «transcripción local + resumen con LLM sin suscripción» — eso ya está resuelto, Meetily lo demuestra, y en ese sentido no soy el primero.

Pero hay tres cosas en esa combinación que no encontré en ningún sitio:

  1. El secretario está integrado en su propia plataforma de llamadas, y no entra como invitado en la de otro. No hace falta permiso de nadie para admitir al bot, ni confiar en la infraestructura de audio de terceros — es parte de mi propio Meet.
  2. Grafo de temas con relaciones, no una lista plana. Además, lógica sticky: un breve «sí/ok» no cambia la conversación a otro tema sin una alta confianza del clasificador. Ninguna de las herramientas encontradas tiene esto.
  3. Consultas RAG vinculadas a una sala concreta, a través de una API propia — no una búsqueda general por todo el historial de la cuenta, sino específicamente por el contexto de una conversación.

Conclusión

En parte sí, reinventar la rueda: el nodo básico «escuchar y transcribir» no lo inventé de nuevo, ya existía antes. Pero la construcción completa —mi propia plataforma + grafo de temas + RAG por sala— para mi caso no la encontré en ningún sitio. Y la mayor ventaja práctica para mí no es la unicidad de la arquitectura, sino que es mío: sin suscripción por un asiento en un equipo de una sola persona, control total sobre lo que sucede con los datos de la llamada y la posibilidad de cambiar en cualquier momento lo que no me guste, en lugar de escribir al soporte.

// Tarea parecida

Si estas resolviendo algo parecido

Este articulo pertenece a uno de los temas principales de trabajo. Puedes seguir leyendo sobre el tema, ir a la pagina principal para entender a que me dedico o abrir directamente los servicios.

Tema del articulo

Despliegue y estabilidad

Docker, CI/CD, despliegues, monitoreo, observabilidad y respuesta a incidentes.

Tareas frecuentes de esta tema

  • Configurar despliegues sin trabajo manual ni caos
  • Añadir monitoreo, alertas y observabilidad base
  • Investigar incidentes y estabilizar produccion

// Siguiente paso

Si necesitas ayuda con este tema y no solo otro articulo, es mejor ir directo a la pagina del servicio. La pagina principal y la seleccion de materiales quedan como rutas secundarias.

Abrir servicios

// Reviews

Reseñas relacionadas

Había que hacer funcionar n8n, Redis y la base de datos. Lo había encargado antes a otro proveedor; todo se rompía constantemente. Se lo encargué a Mijaíl y al día siguiente todo funcionó rápido, ¡como un reloj!

Había que poner en marcha n8n, redis y la base de datos. Contraté antes a otro proveedor, y todo se rompía constantemente. Lo encargué a Mikhail, y al día siguiente ¡todo empezó a funcionar rápido, como un reloj!

christ_media

Instalación de n8n en su servidor VPS. Configuración de n8n, Docker, IA, Telegram

24.09.2025 · ★ 5/5

Comprador experimentado

ladohinpy

Instalación de n8n en su servidor VPS. Configuración de n8n, Docker, IA, Telegram

25.08.2025 · ★ 5/5

// Contact

¿Necesitas ayuda?

Escríbeme y te ayudaré a resolver el problema

Respondo en un día laborable (03:00-13:00 GMT)

Или оставьте заявку здесь:

Escribir y recibir una respuesta rápida