Google Cloud lanza agente de memoria continua sin RAG ni embeddings
Por Redacción Automatización LatAm · 18 de julio de 2026 · Fuente original: MarkTechPost
Foto: yellowcloud · Openverse · CC BY 2.0
Google Cloud presenta un agente de IA que elimina la necesidad de bases de datos vectoriales y embeddings, usando en su lugar un proceso de consolidación continua de memoria en SQLite. Construido sobre Gemini 3.1 Flash-Lite, el sistema orquesta sub-agentes especializados que operan 24/7.
El desafío de la memoria en sistemas LLM
Los modelos de lenguaje grandes (LLMs) como GPT y Gemini manejan contexto limitado, lo que obliga a arquitecturas complejas para mantener memoria persistente de conversaciones y datos históricos. Tradicionalmente, las organizaciones recurren a Retrieval-Augmented Generation (RAG): un método que busca en bases de datos vectoriales para inyectar contexto relevante en cada consulta. Este enfoque requiere infraestructura adicional costosa: bases de datos especializadas, embeddings precalculados, pipelines ETL complejos y coordinación entre múltiples sistemas. Google Cloud ahora propone una alternativa radicalmente diferente.
La propuesta: Always-On Memory Agent
El Always-On Memory Agent es una implementación de referencia lanzada en el repositorio generative-ai de Google Cloud que redefine cómo los sistemas de IA mantienen y acceden a la memoria. En lugar de buscar en vectores, el sistema trata la memoria como un proceso continuo y ejecutable que funciona sin pausa. Está construido sobre Google ADK (Application Development Kit) y utiliza Gemini 3.1 Flash-Lite, el modelo más eficiente de la familia Gemini, optimizado para latencia baja y costos reducidos.
El aspecto revolucionario es la eliminación completa de dependencias en bases de datos vectoriales y embeddings. Estos componentes, aunque poderosos, agregan capas de complejidad operacional, requieren sincronización constante y aumentan la latencia. El nuevo enfoque los reemplaza por una arquitectura de tres sub-agentes coordinados.
Arquitectura de sub-agentes especializados
El sistema funciona mediante una orquestación elegante de tres componentes especializados:
Sub-agente Ingest: Recibe datos nuevos, los valida y los prepara para ser estructurados. Actúa como la puerta de entrada, transformando información cruda en formatos compatibles con el almacén de memoria.
Sub-agente Consolidate: Ejecuta continuamente el corazón del sistema: lee la memoria existente en SQLite, la conecta con información nueva, infiere relaciones semánticas y actualiza representaciones estructuradas. A diferencia de RAG pasivo, este agente activamente refina y enriquece el contexto disponible. Utiliza el poder de razonamiento de Gemini 3.1 Flash-Lite para sintetizar información sin necesidad de cálculos de similaridad vectorial.
Sub-agente Query: Responde consultas leyendo directamente desde SQLite, sin intermediarios. Es directo, rápido y determinista, sin la incertidumbre de búsquedas aproximadas en espacios vectoriales de alta dimensión.
Todos operan 24/7 en un ciclo perpetuo, manteniendo la memoria fresca y coherente sin intervención manual.
Ventajas técnicas y operacionales
Esta arquitectura ofrece beneficios concretos respecto a sistemas RAG tradicionales. Primero, la latencia es predecible: no hay necesidad de computar embeddings o hacer búsquedas en índices aproximados. Las consultas son consultas SQL directs, con tiempos conocidos. Segundo, el uso de SQLite (una base de datos embebida, sin servidor) reduce drásticamente los requisitos de infraestructura. No se necesan clusters de Elasticsearch, Milvus, Pinecone u otras bases vectoriales especializadas.
Tercero, el costo operacional disminuye significativamente. Embeddings de alta calidad requieren GPUs NVIDIA (H100, L40) o servicios en la nube costosos. El Always-On Memory Agent delega la comprensión semántica al propio LLM (Gemini 3.1 Flash-Lite), que es eficiente y ya está disponible a través de Google Cloud APIs. Cuarto, la seguridad mejora: los datos nunca se transforman en vectores para almacenarse en sistemas externos; permanecen estructurados y auditables dentro de SQLite.
Consolidación continua: el diferenciador clave
El término “LLM Consolidation” en el anuncio es crucial. A diferencia de RAG, que mantiene memoria estática y pasiva, Always-On Memory ejecuta consolidación continua. Esto significa que el sistema no solo almacena datos; los reinterpreta, conecta y enriquece automáticamente con cada ciclo. Si un documento nuevo contradice información anterior, el agente Consolidate lo detecta y resuelve. Si hay datos redundantes, los sintetiza. Este comportamiento emergente es posible solo porque un LLM potente (Gemini 3.1 Flash-Lite) lidera el proceso de razonamiento.
Implicaciones para plantas y fábricas en Latinoamérica
Para empresas manufactureras y plantas industriales en LatAm, esto es especialmente relevante. Muchas enfrentan desafíos al adoptar IA porque no tienen recursos para mantener infraestructura compleja: racks de servidores, GPUs especializadas, o suscripciones costosas a bases de datos vectoriales. El Always-On Memory Agent reduce estas barreras. Una planta puede ejecutar agentes de monitoreo de máquinas, diagnóstico de fallas o asistencia a operadores usando principalmente SQLite, reduciendo capex y opex significativamente.
Además, la consolidación continua es ideal para entornos dinámicos como plantas donde los procesos cambian, nueva maquinaria se integra o los estándares evolucionan. El sistema se adapta automáticamente sin reentrenamiento costoso.
Qué vigilar a futuro
Google Cloud proporciona esta como “implementación de referencia”, lo que significa que es un patrón educativo pero también potencialmente un precursor de servicios comerciales. Se espera que Google Cloud ofrezca APIs gestionadas para Always-On Memory en los próximos trimestres, similar a cómo hoy comercializa Vertex AI Search y Conversational AI. La madurez del framework Google ADK también será crucial; si se vuelve standard industrial, facilitará despliegues estandarizados en sectores verticales como manufactura, logística y energía.
Este resumen es un análisis original. Para leer la noticia completa visita la fuente original: MarkTechPost →
Sigue leyendo
Google impulsa ganancias récord con su floreciente negocio de IA en la nube
El negocio de computación en la nube de Google experimenta un crecimiento acelerado gracias a la adopción masiva de servicios de inteligencia artificial e infraestructura IA, permitiendo al gigante tecnológico reportar resultados financieros históricos.
Fuente: TechCrunch AI
Gemini de Google falla en tareas básicas de ortografía
Un modelo de IA de Google muestra dificultades para deletrear palabras simples, incluyendo su propio nombre. El incidente pone de relieve limitaciones persistentes en capacidades fundamentales de procesamiento de texto.
Fuente: TechCrunch AI
NVIDIA presenta Gated DeltaNet-2: atención lineal con control desacoplado de memoria
NVIDIA lanzó Gated DeltaNet-2, una arquitectura de atención lineal que mejora la gestión de memoria en modelos de lenguaje al separar el control de borrado y escritura de datos. Con 1.3B parámetros, supera a Mamba-2 y Mamba-3 en tareas de razonamiento y recuperación de contexto extendido.
Fuente: MarkTechPost
Sesgos en IA: algoritmos más prejuiciosos que humanos en selección
Investigadores encuentran que los modelos de lenguaje (LLMs) no solo heredan sesgos de sus datos de entrenamiento, sino que generan nuevos prejuicios durante procesos de contratación. Un análisis revela que sistemas de IA pueden ser más discriminatorios que evaluadores humanos.
Fuente: MIT Technology Review
Moonshot AI lanza nueva versión de Kimi
La empresa china Moonshot AI presentó una actualización de su modelo Kimi, generando debate sobre capacidades de IA avanzadas y su impacto geopolítico en el desarrollo de modelos de lenguaje.
Fuente: TechCrunch AI
Desvelan el funcionamiento interno de Claude y estrategia de OpenAI
Anthropic logró identificar estructuras ocultas dentro de Claude que revelan cómo el modelo procesa conceptos complejos. Simultáneamente, OpenAI avanza en su estrategia de plataforma integrada.
Fuente: MIT Technology Review