{"id":344980,"date":"2026-09-25T10:00:44","date_gmt":"2026-09-25T10:00:44","guid":{"rendered":"https:\/\/scanda.com.mx\/?p=344980"},"modified":"2026-09-28T19:46:03","modified_gmt":"2026-09-28T19:46:03","slug":"arquitectura-data-lake-componentes-capas-diseno","status":"publish","type":"post","link":"https:\/\/scanda.com.mx\/en\/arquitectura-data-lake-componentes-capas-diseno\/","title":{"rendered":"Arquitectura de data lake: componentes, capas y decisiones de dise\u00f1o"},"content":{"rendered":"<p class=\"wp-block-paragraph\">Una arquitectura de <strong>data lake<\/strong> organiza c\u00f3mo una empresa ingiere, almacena, transforma, gobierna y consume datos estructurados, semiestructurados y no estructurados. Su dise\u00f1o no debe empezar por elegir una nube: debe partir de los casos de uso, fuentes, niveles de calidad, seguridad y SLA del dato. El objetivo es convertir informaci\u00f3n dispersa en activos reutilizables para anal\u00edtica e IA.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">At <strong>MAIA by Scanda<\/strong> abordamos este problema desde Data Intelligence: integrar m\u00faltiples fuentes, gestionar calidad, MDM y gobierno, y habilitar una arquitectura moderna que permita convertir los datos existentes en decisiones confiables. Nuestro documento maestro establece precisamente que Data Intelligence debe entrar cuando existen fuentes inconsistentes que frenan iniciativas de IA o BI.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Definiciones taxon\u00f3micas<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>1. Data lake<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Repositorio de datos dise\u00f1ado para conservar grandes vol\u00famenes de informaci\u00f3n de diferentes tipos y procedencias, incluidos datos estructurados, semiestructurados y no estructurados. A diferencia de un data warehouse tradicional, puede preservar informaci\u00f3n en estado cercano al original para transformarla posteriormente seg\u00fan cada caso de uso.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Microsoft identifica los data lakes especialmente con escenarios de <strong>anal\u00edtica exploratoria, ciencia de datos y machine learning<\/strong>, donde conservar informaci\u00f3n raw y aplicar esquemas durante su procesamiento ofrece flexibilidad frente a modelos exclusivamente estructurados.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>2. Pipeline de datos<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Conjunto de procesos que transportan informaci\u00f3n desde los sistemas fuente hasta las capas de almacenamiento y consumo. Puede operar por lotes (<em>batch<\/em>), eventos, CDC (<em>Change Data Capture<\/em>) o <em>streaming<\/em>.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Un pipeline empresarial no deber\u00eda limitarse a \u201cmover archivos\u201d. Debe incorporar, seg\u00fan el caso:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>trazabilidad del origen;<\/li>\n\n\n\n<li>validaci\u00f3n de esquema;<\/li>\n\n\n\n<li>controles de calidad;<\/li>\n\n\n\n<li>tratamiento de errores;<\/li>\n\n\n\n<li>transformaci\u00f3n;<\/li>\n\n\n\n<li>observabilidad;<\/li>\n\n\n\n<li>reglas de seguridad;<\/li>\n\n\n\n<li>manejo de cambios en las fuentes.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>3. Cat\u00e1logo de datos<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Capa que registra metadatos t\u00e9cnicos y de negocio para saber <strong>qu\u00e9 datos existen, d\u00f3nde est\u00e1n, de d\u00f3nde provienen, qui\u00e9n puede utilizarlos y qu\u00e9 significan<\/strong>.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">AWS, por ejemplo, incorpora un cat\u00e1logo centralizado en su arquitectura de referencia para desacoplar productores y consumidores, compartir metadatos y facilitar funciones de gobierno y auditor\u00eda.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Tabla comparativa: capas de una arquitectura de data lake<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Una implementaci\u00f3n puede utilizar diferentes nombres y no est\u00e1 obligada a seguir exactamente tres capas. Sin embargo, separar progresivamente los datos seg\u00fan su nivel de procesamiento y confianza es un patr\u00f3n ampliamente utilizado. Microsoft describe capas raw, cleansed y curated; Databricks utiliza los t\u00e9rminos bronze, silver y gold. <a href=\"https:\/\/learn.microsoft.com\/en-us\/azure\/architecture\/data-guide\/scenarios\/data-lake?source=recommendations&amp;utm_source=chatgpt.com\">Microsoft Learn<\/a><\/p>\n\n\n\n<figure class=\"wp-block-table\"><table class=\"has-fixed-layout\"><thead><tr><td><strong>Capa<\/strong><\/td><td><strong>Estado del dato<\/strong><\/td><td><strong>Procesamiento principal<\/strong><\/td><td><strong>Consumidor t\u00edpico<\/strong><\/td><td><strong>Riesgo si est\u00e1 mal dise\u00f1ada<\/strong><\/td><\/tr><\/thead><tbody><tr><td><strong>Raw \/ Bronze<\/strong><\/td><td>Cercano al origen<\/td><td>Ingesta y metadatos m\u00ednimos<\/td><td>Ingenier\u00eda de datos, auditor\u00eda<\/td><td>Perder trazabilidad o impedir reprocesamiento<\/td><\/tr><tr><td><strong>Cleansed \/ Silver<\/strong><\/td><td>Validado y estandarizado<\/td><td>Calidad, deduplicaci\u00f3n, tipificaci\u00f3n, integraci\u00f3n<\/td><td>Analistas, data scientists, ingenier\u00eda<\/td><td>KPIs contradictorios y modelos alimentados con informaci\u00f3n inconsistente<\/td><\/tr><tr><td><strong>Curated \/ Gold<\/strong><\/td><td>Listo para negocio<\/td><td>Reglas, agregaciones y modelos de consumo<\/td><td>BI, IA, aplicaciones, negocio<\/td><td>Decisiones basadas en m\u00e9tricas ambiguas<\/td><\/tr><tr><td><strong>Cat\u00e1logo y gobierno<\/strong><\/td><td>Transversal<\/td><td>Metadatos, linaje, permisos y pol\u00edticas<\/td><td>TI, datos, seguridad, compliance<\/td><td>Exposici\u00f3n, duplicidad y falta de accountability<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Databricks documenta que Bronze conserva informaci\u00f3n raw para auditor\u00eda y reprocesamiento; Silver realiza limpieza, deduplicaci\u00f3n, validaci\u00f3n y normalizaci\u00f3n; y Gold prepara informaci\u00f3n y agregaciones orientadas al consumo del negocio.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La distinci\u00f3n es importante: <strong>las capas representan niveles de confianza y prop\u00f3sito, no simplemente carpetas con nombres distintos<\/strong>.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Cuerpo t\u00e9cnico<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>H2: Los componentes que debe tener una arquitectura de data lake empresarial<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Un data lake productivo necesita m\u00e1s que almacenamiento de objetos. En <strong>MAIA by Scanda<\/strong> recomendamos evaluar al menos siete componentes.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>1. Fuentes de datos<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Primero debe inventariarse qu\u00e9 produce informaci\u00f3n y con qu\u00e9 caracter\u00edsticas.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Las fuentes pueden incluir:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>ERP y CRM;<\/li>\n\n\n\n<li>aplicaciones empresariales;<\/li>\n\n\n\n<li>bases SQL y NoSQL;<\/li>\n\n\n\n<li>APIs;<\/li>\n\n\n\n<li>archivos CSV, Excel, JSON y XML;<\/li>\n\n\n\n<li>documentos;<\/li>\n\n\n\n<li>dispositivos IoT;<\/li>\n\n\n\n<li>telemetr\u00eda;<\/li>\n\n\n\n<li>sistemas industriales;<\/li>\n\n\n\n<li>logs;<\/li>\n\n\n\n<li>im\u00e1genes, audio y video;<\/li>\n\n\n\n<li>fuentes externas.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">La pregunta cr\u00edtica no es \u00fanicamente <strong>\u201c\u00bfpodemos conectarnos?\u201d<\/strong>, sino:<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">\u00bfQu\u00e9 decisi\u00f3n de negocio utilizar\u00e1 estos datos y con qu\u00e9 frecuencia necesita recibirlos?<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Una fuente que actualiza inventario cada cinco minutos y un hist\u00f3rico financiero mensual no necesitan el mismo patr\u00f3n de ingesta.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>H2: 2. Capa de ingesta<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La ingesta transporta los datos desde las fuentes hacia el lake.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Aqu\u00ed deben tomarse tres decisiones.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Batch vs. streaming<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Batch<\/strong> es apropiado cuando el negocio tolera latencia de minutos u horas. <strong>Streaming<\/strong> tiene sentido cuando el valor de la informaci\u00f3n disminuye r\u00e1pidamente con el tiempo.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">No todo necesita tiempo real.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Convertir cada pipeline en streaming \u201cporque podemos hacerlo\u201d puede aumentar infraestructura, operaci\u00f3n y monitoreo sin generar retorno adicional.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La decisi\u00f3n correcta se expresa como un <strong>SLA del dato<\/strong>:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>\u00bfCu\u00e1nto puede tardar desde que ocurre el evento hasta que est\u00e1 disponible?<\/li>\n\n\n\n<li>\u00bfQu\u00e9 pierde el negocio si llega 5 minutos, 1 hora o 24 horas despu\u00e9s?<\/li>\n\n\n\n<li>\u00bfCu\u00e1nto cuesta reducir esa latencia?<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">Ah\u00ed aparece el business case.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>H2: 3. Almacenamiento y separaci\u00f3n por capas<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">El almacenamiento debe permitir conservar el dato original y transformarlo progresivamente.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Raw \/ Bronze: conservar antes de transformar<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">En esta zona deben mantenerse los datos con m\u00ednima alteraci\u00f3n, acompa\u00f1ados de metadatos como origen, fecha de carga o identificador del proceso.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Esto tiene una raz\u00f3n econ\u00f3mica adem\u00e1s de t\u00e9cnica: <strong>si una transformaci\u00f3n cambia, el dato original permite reconstruir las capas posteriores sin volver a extraer toda la informaci\u00f3n desde los sistemas fuente<\/strong>.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Databricks se\u00f1ala precisamente la capacidad de reconstruir capas posteriores a partir de Bronze como una ventaja del patr\u00f3n.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Cleansed \/ Silver: construir confianza reutilizable<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Aqu\u00ed ocurre buena parte del trabajo que determina si el lake terminar\u00e1 siendo un activo o un pantano de datos.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Normalmente incluye:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>eliminaci\u00f3n de duplicados;<\/li>\n\n\n\n<li>tratamiento de nulos;<\/li>\n\n\n\n<li>estandarizaci\u00f3n de formatos;<\/li>\n\n\n\n<li>validaci\u00f3n de esquemas;<\/li>\n\n\n\n<li>homologaci\u00f3n de identificadores;<\/li>\n\n\n\n<li>reglas de calidad;<\/li>\n\n\n\n<li>resoluci\u00f3n de registros tard\u00edos;<\/li>\n\n\n\n<li>integraci\u00f3n entre fuentes;<\/li>\n\n\n\n<li>enriquecimiento;<\/li>\n\n\n\n<li>manejo de cambios de esquema.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">Databricks ubica expl\u00edcitamente estas actividades en Silver y recomienda no escribir directamente desde la ingesta a esta capa, precisamente para aislar problemas de esquema y registros corruptos.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Curated \/ Gold: publicar productos de datos<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Gold responde una pregunta diferente:<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>\u00bfQu\u00e9 necesita consumir el negocio?<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Puede contener:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>ventas por regi\u00f3n;<\/li>\n\n\n\n<li>margen por cliente;<\/li>\n\n\n\n<li>rotaci\u00f3n de inventario;<\/li>\n\n\n\n<li>comportamiento por tienda \u00d7 SKU;<\/li>\n\n\n\n<li>indicadores financieros;<\/li>\n\n\n\n<li>features para machine learning;<\/li>\n\n\n\n<li>datasets para agentes de IA;<\/li>\n\n\n\n<li>modelos dimensionales para BI.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">En esta capa, una m\u00e9trica cr\u00edtica debe tener definici\u00f3n y responsable. \u201cVentas\u201d, \u201ccliente activo\u201d o \u201cmargen\u201d parecen conceptos obvios\u2026 hasta que Finanzas, Comercial y Operaciones llevan tres cifras distintas a la misma junta.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>H2: 4. Cat\u00e1logo, metadatos y linaje<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Una arquitectura de datos no est\u00e1 gobernada porque exista un repositorio central.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Debe poder responder:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>\u00bfQui\u00e9n es due\u00f1o de este dataset?<\/li>\n\n\n\n<li>\u00bfDe qu\u00e9 sistema proviene?<\/li>\n\n\n\n<li>\u00bfCu\u00e1ndo fue actualizado?<\/li>\n\n\n\n<li>\u00bfQu\u00e9 transformaciones recibi\u00f3?<\/li>\n\n\n\n<li>\u00bfQu\u00e9 dashboards o modelos dependen de \u00e9l?<\/li>\n\n\n\n<li>\u00bfContiene informaci\u00f3n sensible?<\/li>\n\n\n\n<li>\u00bfQui\u00e9n puede consultarlo?<\/li>\n\n\n\n<li>\u00bfQu\u00e9 ocurrir\u00eda si cambia su esquema?<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">AWS plantea el cat\u00e1logo centralizado precisamente como un punto donde consumidores pueden descubrir y acceder a informaci\u00f3n de diferentes productores, y donde tambi\u00e9n pueden aplicarse controles de gobierno y auditor\u00eda.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Sin cat\u00e1logo, un data lake almacena datos. Con cat\u00e1logo, empieza a administrarlos como activos.<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>H2: 5. Data Quality: medir antes de confiar<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La calidad no debe revisarse \u00fanicamente al construir el proyecto.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Debe convertirse en un proceso continuo.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>M\u00e9tricas recomendadas<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Dependiendo del dataset:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>completitud;<\/li>\n\n\n\n<li>unicidad;<\/li>\n\n\n\n<li>exactitud;<\/li>\n\n\n\n<li>consistencia;<\/li>\n\n\n\n<li>validez;<\/li>\n\n\n\n<li>oportunidad o <em>freshness<\/em>;<\/li>\n\n\n\n<li>volumen esperado;<\/li>\n\n\n\n<li>porcentaje de registros rechazados.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">Por ejemplo, un pipeline puede t\u00e9cnicamente estar \u201cverde\u201d porque termin\u00f3 correctamente y, al mismo tiempo, haber recibido 40% menos transacciones que el promedio hist\u00f3rico.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Infraestructura disponible no equivale a informaci\u00f3n confiable.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">En el modelo de MAIA by Scanda, <strong>AI Data es un componente transversal del CoE<\/strong>, e incorpora una plataforma gobernada con Data Quality, Data as a Service y capa sem\u00e1ntica.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>H2: 6. Seguridad y gobierno desde el dise\u00f1o<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Un error frecuente es construir primero el lake y \u201cponerle seguridad\u201d despu\u00e9s.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Debe ocurrir al rev\u00e9s.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La arquitectura debe definir desde el inicio:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>identidad;<\/li>\n\n\n\n<li>RBAC;<\/li>\n\n\n\n<li>m\u00ednimo privilegio;<\/li>\n\n\n\n<li>clasificaci\u00f3n;<\/li>\n\n\n\n<li>cifrado en tr\u00e1nsito y reposo;<\/li>\n\n\n\n<li>segregaci\u00f3n de ambientes;<\/li>\n\n\n\n<li>logs;<\/li>\n\n\n\n<li>auditor\u00eda;<\/li>\n\n\n\n<li>retenci\u00f3n;<\/li>\n\n\n\n<li>tratamiento de informaci\u00f3n sensible;<\/li>\n\n\n\n<li>pol\u00edticas para datos utilizados por modelos de IA.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">Esto cobra todav\u00eda m\u00e1s relevancia cuando el data lake alimentar\u00e1 agentes o modelos generativos.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Nuestro principio en MAIA by Scanda es sencillo: <strong>la IA no corrige autom\u00e1ticamente un dato mal gobernado; puede amplificar su exposici\u00f3n<\/strong>. Nuestro marco de preparaci\u00f3n contempla inventario y clasificaci\u00f3n de informaci\u00f3n sensible, correcci\u00f3n de permisos heredados, fuentes mapeadas e identidades y privilegios validados antes de habilitar nuevos casos de IA.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>H2: 7. Capa de consumo: dise\u00f1ar desde la decisi\u00f3n hacia atr\u00e1s<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">El \u00faltimo componente determina buena parte de los anteriores.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Los consumidores pueden ser:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>dashboards;<\/li>\n\n\n\n<li>data warehouses;<\/li>\n\n\n\n<li>anal\u00edtica avanzada;<\/li>\n\n\n\n<li>aplicaciones;<\/li>\n\n\n\n<li>APIs;<\/li>\n\n\n\n<li>cient\u00edficos de datos;<\/li>\n\n\n\n<li>modelos predictivos;<\/li>\n\n\n\n<li>RAG;<\/li>\n\n\n\n<li>agentes de IA;<\/li>\n\n\n\n<li>automatizaciones.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">AWS incluye anal\u00edtica, consulta, consumo y Data Science\/AI\/ML como funciones diferenciadas dentro de una arquitectura moderna de datos.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Por eso recomendamos dise\u00f1ar <strong>desde el resultado hacia el dato<\/strong>, no al rev\u00e9s.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Por ejemplo:<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Decisi\u00f3n:<\/strong> reducir inventario inmovilizado<br>\u2193<br><strong>KPI:<\/strong> rotaci\u00f3n y d\u00edas de inventario por SKU<br>\u2193<br><strong>Producto de datos:<\/strong> inventario + ventas + pedidos + cat\u00e1logo<br>\u2193<br><strong>Transformaciones:<\/strong> homologaci\u00f3n SKU\/tienda, calidad y reglas de negocio<br>\u2193<br><strong>Fuentes:<\/strong> ERP + POS + e-commerce + WMS.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">El data lake deja entonces de ser \u201cinfraestructura de TI\u201d y adquiere una relaci\u00f3n expl\u00edcita con capital de trabajo y EBITDA.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>H2: Las 6 decisiones de dise\u00f1o que deben tomarse antes de construir<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>1. Centralizar todo vs. priorizar dominios<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">No es necesario migrar cada dato de la organizaci\u00f3n antes de producir valor.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Conviene empezar por las fuentes necesarias para un caso concreto y ampliar posteriormente.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">En MAIA by Scanda trabajamos con una l\u00f3gica similar: <strong>primero demostramos valor y despu\u00e9s justificamos una inversi\u00f3n mayor<\/strong>. El documento maestro establece que el business case debe construirse con datos reales del cliente y que el PoV funciona como compuerta antes del escalamiento.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>2. ETL vs. ELT<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>ETL<\/strong> transforma antes de cargar al repositorio destino.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>ELT<\/strong> carga primero y aprovecha la capacidad de procesamiento de la plataforma para transformar posteriormente.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">En arquitecturas modernas de lake\/lakehouse, ELT puede ofrecer mayor flexibilidad porque conserva informaci\u00f3n raw y permite producir diferentes representaciones posteriores.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">No obstante, la elecci\u00f3n debe considerar privacidad, volumen, regulaci\u00f3n y costo de procesamiento.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>3. Schema-on-read vs. schema-on-write<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">El data lake permite posponer parte del modelado hasta el consumo, pero eso no significa \u201cguardar cualquier cosa sin estructura\u201d.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La arquitectura debe decidir <strong>en qu\u00e9 momento se convierte la flexibilidad en un contrato de datos<\/strong>.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Un patr\u00f3n razonable es:<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>flexibilidad en Raw \u2192 control en Silver \u2192 sem\u00e1ntica de negocio en Gold.<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>4. Cloud, h\u00edbrido u on-premise<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La elecci\u00f3n depende de:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>soberan\u00eda;<\/li>\n\n\n\n<li>regulaci\u00f3n;<\/li>\n\n\n\n<li>latencia;<\/li>\n\n\n\n<li>conectividad;<\/li>\n\n\n\n<li>volumen;<\/li>\n\n\n\n<li>costo de transferencia;<\/li>\n\n\n\n<li>seguridad;<\/li>\n\n\n\n<li>infraestructura existente.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">En nuestro modelo operativo podemos iniciar <strong>cloud-first<\/strong> para acelerar el primer resultado y mantener una ruta hacia on-premise cuando soberan\u00eda o seguridad lo requieren; el documento maestro contempla mantener informaci\u00f3n sensible local y exponer \u00fanicamente versiones agregadas cuando el caso lo permita.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>5. Arquitectura propietaria vs. abierta<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Una decisi\u00f3n de largo plazo es cu\u00e1nto depende la plataforma de servicios exclusivos de un proveedor.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Formatos abiertos, desacoplamiento entre almacenamiento y c\u00f3mputo y componentes reemplazables pueden reducir lock-in, aunque tambi\u00e9n pueden aumentar complejidad operativa.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">No existe una respuesta universal.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La pregunta ejecutiva es:<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>\u00bfcu\u00e1nto costar\u00eda mover este dato o workload dentro de tres a\u00f1os?<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>6. Retener todo vs. administrar el ciclo de vida<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">\u201cStorage barato\u201d no significa \u201cstorage gratis\u201d.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Cada dataset debe tener pol\u00edticas de:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>retenci\u00f3n;<\/li>\n\n\n\n<li>archivado;<\/li>\n\n\n\n<li>eliminaci\u00f3n;<\/li>\n\n\n\n<li>frecuencia de acceso;<\/li>\n\n\n\n<li>tiering;<\/li>\n\n\n\n<li>replicaci\u00f3n;<\/li>\n\n\n\n<li>respaldo.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">Guardar indefinidamente informaci\u00f3n sin consumidor ni requisito regulatorio convierte el crecimiento del lake en crecimiento del OPEX.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>H2: Arquitectura de referencia de un data lake<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Una arquitectura conceptual puede visualizarse as\u00ed:<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Sistemas fuente<\/strong><br>ERP \u00b7 CRM \u00b7 POS \u00b7 IoT \u00b7 APIs \u00b7 archivos \u00b7 documentos \u00b7 logs<br>\u2193<br><strong>Ingesta<\/strong><br>Batch \u00b7 CDC \u00b7 Streaming \u00b7 APIs<br>\u2193<br><strong>Raw \/ Bronze<\/strong><br>Dato original + metadatos + hist\u00f3rico<br>\u2193<br><strong>Cleansed \/ Silver<\/strong><br>Calidad \u00b7 deduplicaci\u00f3n \u00b7 estandarizaci\u00f3n \u00b7 MDM \u00b7 integraci\u00f3n<br>\u2193<br><strong>Curated \/ Gold<\/strong><br>KPIs \u00b7 modelos de negocio \u00b7 features \u00b7 productos de datos<br>\u2193<br><strong>Consumo<\/strong><br>BI \u00b7 Analytics \u00b7 ML \u00b7 GenAI \u00b7 agentes \u00b7 aplicaciones \u00b7 automatizaci\u00f3n<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Y atravesando toda la arquitectura:<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Cat\u00e1logo + linaje + identidad + seguridad + calidad + observabilidad + gobierno.<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La arquitectura de referencia importa menos por los nombres de las cajas que por los <strong>contratos entre ellas<\/strong>: propietario, esquema, calidad, latencia, seguridad y consumidor.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>H2: C\u00f3mo saber si el data lake est\u00e1 generando valor<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">No recomendamos evaluar un data lake por terabytes almacenados.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Eso mide ocupaci\u00f3n, no resultado.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">En MAIA by Scanda utilizamos m\u00e9tricas m\u00e1s cercanas a la capacidad real de decisi\u00f3n. Nuestro documento maestro propone, entre otras, <strong>porcentaje de fuentes integradas al cat\u00e1logo maestro, tiempo de un dato a una decisi\u00f3n, costo por caso de uso en producci\u00f3n y resultado de negocio atribuido a IA<\/strong>.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Un tablero ejecutivo podr\u00eda incluir:<\/p>\n\n\n\n<figure class=\"wp-block-table\"><table class=\"has-fixed-layout\"><thead><tr><td><strong>M\u00e9trica<\/strong><\/td><td><strong>Qu\u00e9 revela<\/strong><\/td><td><strong>Impacto empresarial<\/strong><\/td><\/tr><\/thead><tbody><tr><td>% de fuentes cr\u00edticas integradas<\/td><td>Cobertura real<\/td><td>Menos reconciliaci\u00f3n manual<\/td><\/tr><tr><td>% de reglas de calidad cumplidas<\/td><td>Confianza<\/td><td>Menor riesgo de decisiones incorrectas<\/td><\/tr><tr><td>Freshness \/ latencia<\/td><td>Velocidad<\/td><td>Tiempo dato \u2192 decisi\u00f3n<\/td><\/tr><tr><td>Incidentes de calidad<\/td><td>Estabilidad<\/td><td>Menos reproceso<\/td><\/tr><tr><td>Costo por pipeline\/dominio<\/td><td>Eficiencia<\/td><td>Control del OPEX<\/td><\/tr><tr><td>Tiempo para incorporar una nueva fuente<\/td><td>Escalabilidad<\/td><td>Time-to-value<\/td><\/tr><tr><td>Productos de datos con due\u00f1o<\/td><td>Government<\/td><td>Accountability<\/td><\/tr><tr><td>Casos de IA en producci\u00f3n sobre la plataforma<\/td><td>Aprovechamiento<\/td><td>Retorno de la inversi\u00f3n<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Una se\u00f1al particularmente \u00fatil es el <strong>n\u00famero de versiones de una misma cifra<\/strong>. Si cada \u00e1rea contin\u00faa llevando su propio Excel y el consejo recibe n\u00fameros diferentes, la organizaci\u00f3n todav\u00eda no tiene una fuente operativa de verdad, aunque t\u00e9cnicamente posea un data lake. Esta misma se\u00f1al forma parte del tablero de diagn\u00f3stico de MAIA.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>H2: \u00bfQu\u00e9 errores convierten un data lake en un \u201cdata swamp\u201d?<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Los principales no suelen ser de almacenamiento.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Son de dise\u00f1o y operaci\u00f3n:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>cargar informaci\u00f3n sin un caso de uso;<\/li>\n\n\n\n<li>no conservar linaje;<\/li>\n\n\n\n<li>no asignar propietarios;<\/li>\n\n\n\n<li>permitir que cada \u00e1rea vuelva a limpiar los mismos datos;<\/li>\n\n\n\n<li>crear pipelines sin observabilidad;<\/li>\n\n\n\n<li>duplicar datasets sin contratos;<\/li>\n\n\n\n<li>mezclar informaci\u00f3n raw y certificada;<\/li>\n\n\n\n<li>aplicar permisos \u00fanicamente a nivel de infraestructura;<\/li>\n\n\n\n<li>ignorar el costo de c\u00f3mputo y transferencia;<\/li>\n\n\n\n<li>no definir cu\u00e1ndo un dato puede alimentar un modelo de IA.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">El patr\u00f3n de capas intenta evitar precisamente esto: la calidad y estructura deben aumentar progresivamente mientras el dato avanza hacia su consumo.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">En otras palabras: <strong>el problema no es que el lake crezca; el problema es que crezca m\u00e1s r\u00e1pido que la capacidad de entenderlo y gobernarlo.<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Conclusi\u00f3n Predictiva<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Durante los pr\u00f3ximos ciclos de modernizaci\u00f3n, la diferencia no estar\u00e1 simplemente entre empresas que \u201ctienen un data lake\u201d y empresas que no lo tienen. Estar\u00e1 entre organizaciones capaces de <strong>convertir datos raw en productos gobernados y reutilizables<\/strong> y aquellas que contin\u00faen reconstruyendo integraciones, definiciones y reglas de calidad para cada nuevo proyecto.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La presi\u00f3n aumentar\u00e1 con la IA generativa y los agentes: cada nuevo caso necesitar\u00e1 informaci\u00f3n identificable, accesible, confiable, gobernada y suficientemente actualizada.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Por eso, en <strong>MAIA by Scanda<\/strong> no vemos la arquitectura de datos como un proyecto previo a la IA que se termina y se archiva. La vemos como una capacidad operativa.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Nuestro enfoque de <strong>Data Intelligence<\/strong> integra gesti\u00f3n de informaci\u00f3n, MDM, Data Governance, calidad, integraci\u00f3n multi-fuente, analytics, Data as a Service e hiperautomatizaci\u00f3n. La meta no es acumular datos: es habilitar decisiones confiables y una arquitectura capaz de sostener los siguientes casos de anal\u00edtica, automatizaci\u00f3n e IA.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>CTA final de MAIA<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Tus datos no necesitan otro repositorio. Necesitan una arquitectura que permita decidir.<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Si hoy tu organizaci\u00f3n integra manualmente informaci\u00f3n de varios sistemas, mantiene diferentes versiones de una misma cifra o quiere implementar IA sin saber si sus datos est\u00e1n preparados, el primer paso no deber\u00eda ser comprar otra plataforma.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">At <strong>MAIA by Scanda<\/strong> podemos evaluar tus fuentes, calidad, integraci\u00f3n y gobierno para identificar qu\u00e9 arquitectura necesitas y qu\u00e9 caso de uso justifica construirla. Nuestro enfoque parte del resultado de negocio y construye el business case con <strong>tus propios datos<\/strong>, antes de escalar la inversi\u00f3n.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Conversemos sobre tu arquitectura de datos y definamos qu\u00e9 necesitas habilitar primero para llevar anal\u00edtica e IA a producci\u00f3n.<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>FAQ<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>1. \u00bfNecesito tener todos mis datos limpios antes de construir un data lake?<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">No. Precisamente una arquitectura por capas permite conservar informaci\u00f3n raw y aplicar calidad progresivamente. Lo importante es identificar qu\u00e9 fuentes necesita primero el caso de negocio, definir reglas de calidad y evitar que informaci\u00f3n no validada llegue a consumidores que esperan datos certificados.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>2. \u00bfUn data lake reduce costos frente a un data warehouse?<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">No autom\u00e1ticamente. Puede ofrecer almacenamiento flexible y separar almacenamiento, procesamiento y consumo, pero el TCO depende de ingesta, c\u00f3mputo, transferencia, retenci\u00f3n, herramientas, gobierno y operaci\u00f3n. Para un CFO, la comparaci\u00f3n correcta no es \u00fanicamente costo por TB: debe incluir <strong>costo por producto de datos y valor generado por sus casos de uso<\/strong>.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>3. \u00bfC\u00f3mo saber si nuestra empresa necesita un data lake?<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Es una opci\u00f3n especialmente relevante cuando existen m\u00faltiples fuentes y tipos de datos, se necesita conservar hist\u00f3rico detallado o se planean workloads de anal\u00edtica avanzada, machine learning o IA. Microsoft recomienda este patr\u00f3n particularmente para anal\u00edtica exploratoria, data science y ML.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">En MAIA by Scanda, una se\u00f1al comercial clara es encontrar <strong>m\u00faltiples fuentes inconsistentes que est\u00e9n frenando BI o IA<\/strong>; ese es precisamente uno de los escenarios de entrada definidos para Data Intelligence.<\/p>","protected":false},"excerpt":{"rendered":"<p>Una arquitectura de data lake organiza c\u00f3mo una empresa ingiere, almacena, transforma, gobierna y consume datos estructurados, semiestructurados y no estructurados. Su dise\u00f1o no debe empezar por elegir una nube: debe partir de los casos de uso, fuentes, niveles de calidad, seguridad y SLA del dato. El objetivo es convertir informaci\u00f3n dispersa en activos reutilizables [&hellip;]<\/p>\n","protected":false},"author":3,"featured_media":344981,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"_et_pb_use_builder":"off","_et_pb_old_content":"","_et_gb_content_width":"","content-type":"","footnotes":""},"categories":[1],"tags":[],"class_list":["post-344980","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-blog"],"_links":{"self":[{"href":"https:\/\/scanda.com.mx\/en\/wp-json\/wp\/v2\/posts\/344980","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/scanda.com.mx\/en\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/scanda.com.mx\/en\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/scanda.com.mx\/en\/wp-json\/wp\/v2\/users\/3"}],"replies":[{"embeddable":true,"href":"https:\/\/scanda.com.mx\/en\/wp-json\/wp\/v2\/comments?post=344980"}],"version-history":[{"count":1,"href":"https:\/\/scanda.com.mx\/en\/wp-json\/wp\/v2\/posts\/344980\/revisions"}],"predecessor-version":[{"id":344982,"href":"https:\/\/scanda.com.mx\/en\/wp-json\/wp\/v2\/posts\/344980\/revisions\/344982"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/scanda.com.mx\/en\/wp-json\/wp\/v2\/media\/344981"}],"wp:attachment":[{"href":"https:\/\/scanda.com.mx\/en\/wp-json\/wp\/v2\/media?parent=344980"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/scanda.com.mx\/en\/wp-json\/wp\/v2\/categories?post=344980"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/scanda.com.mx\/en\/wp-json\/wp\/v2\/tags?post=344980"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}