{"id":2512,"date":"2015-12-22T09:35:35","date_gmt":"2015-12-22T09:35:35","guid":{"rendered":"http:\/\/www.fractaliasystems.com\/?p=3223"},"modified":"2023-10-11T09:46:41","modified_gmt":"2023-10-11T09:46:41","slug":"arquitectura-lambda-y-tecnologias-para-el-diseno-de-soluciones-big-data-2","status":"publish","type":"post","link":"https:\/\/fractaliasystems.com\/en\/arquitectura-lambda-y-tecnologias-para-el-diseno-de-soluciones-big-data-2\/","title":{"rendered":"Arquitectura Lambda y tecnolog\u00edas para el dise\u00f1o de soluciones Big Data (2)"},"content":{"rendered":"<p>La <strong>Arquitectura Lambda<\/strong> que ha surgido en los \u00faltimos a\u00f1os con el objetivo de dar respuesta global a diferentes necesidades de an\u00e1lisis <strong><a href=\"http:\/\/www.fractaliasystems.com\/como-cambia-nuestra-vida-el-big-data\/\" target=\"_blank\" rel=\"noopener noreferrer\">Big Data<\/a><\/strong>, presenta cuatro capas de aplicaci\u00f3n que ve\u00edamos con detalle en el <a href=\"http:\/\/www.fractaliasystems.com\/arquitectura-lambda-y-tecnologias-para-el-diseno-de-soluciones-big-data-1\/\" target=\"_blank\" rel=\"noopener noreferrer\">anterior post<\/a>.<!--more-->En este caso, nos centramos en las <strong>tecnolog\u00edas<\/strong> propias&nbsp;m\u00e1s importantes, identificando su capa de aplicaci\u00f3n.<\/p>\n<p>Las tecnolog\u00edas que se emplean son en la <strong>capa de pre- procesado<\/strong> son:<\/p>\n<ul>\n<li><strong>Sribe<\/strong>. Se trata de un servicio encargado de agregar flujos de datos de registro provenientes de distintos servidores en tiempo real.<\/li>\n<li><strong>Kafka<\/strong>. Consiste en un sistema de mensajer\u00eda distribuido de alto rendimiento basado en el uso de TOPIC.<\/li>\n<li><strong>Flume<\/strong>. Servicio centrado en la recolecci\u00f3n, agregaci\u00f3n y distribuci\u00f3n de grandes cantidades de datos de registro siguiendo una arquitectura simple y flexible, basada en el streaming de flujos de datos.<\/li>\n<li><strong>Talend<\/strong>. Se trata de una de las soluciones m\u00e1s importantes de c\u00f3digo abierto para la gesti\u00f3n de datos en el entorno Big Data, puesto que permite realizar, entre otras, labores de extracci\u00f3n, transformaci\u00f3n y carga (ETL).<\/li>\n<li><strong>Penaho<\/strong>. Es tambi\u00e9n una plataforma completa que alberga un conjunto de servicios de Business Intelligence (BI) que permiten realizar, entre otros, miner\u00eda de datos, actividades ETL, generaci\u00f3n de informes, etc.<\/li>\n<li><strong>Sqoop<\/strong>. Proyecto centrado en el desarrollo de una aplicaci\u00f3n de l\u00ednea de comandos encargada de realizar la trasferencia de datos entre distintas bases de datos relacionales y Hadoop.<\/li>\n<li><strong>Chukwa<\/strong>. Sistema de c\u00f3digo abierto para la monitorizaci\u00f3n de grandes sistemas distribuidos. Se apoya sobre las soluciones HDFS y MapReduce.<\/li>\n<\/ul>\n<p>Con relaci\u00f3n a las tecnolog\u00edas a emplear en la<strong> capa de an\u00e1lisis de Big Data<\/strong>, la tecnolog\u00eda gen\u00e9rica que se emplea en esta capa es <strong>Spark<\/strong>, una herramienta encargada de realizar procesamientos masivos de datos de forma eficiente basada en un sistema de computaci\u00f3n distribuida a trav\u00e9s de cl\u00fasters de ordenadores.<\/p>\n<p>En cuento a las tecnolog\u00edas de las subcapas descritas en el anterior art\u00edculo de la capa de an\u00e1lisis, se describen a continuaci\u00f3n las m\u00e1s importantes:<\/p>\n<p>Las tecnolog\u00edas m\u00e1s importantes asociadas a la <strong>capa de velocidad <\/strong>son:<\/p>\n<ul>\n<li><strong>Storm<\/strong>. Sistema de computaci\u00f3n distribuida en tiempo real que sigue la arquitectura <em>master-salve<\/em> donde ninguna instancia mantiene estado. Su modelo de datos se basa en tuplas.<\/li>\n<li><strong>Spark streaming<\/strong>. Es una extensi\u00f3n del propio Spark encargada de suministrar capacidades de procesamiento continuo seg\u00fan streaming de datos.<\/li>\n<li><strong>S4<\/strong>. Plataforma para la computaci\u00f3n distribuida en streaming desarrollada por Apache.<\/li>\n<\/ul>\n<p>Sobre la<strong> capa batch <\/strong>se emplean las siguientes tecnolog\u00edas:<\/p>\n<ul>\n<li><strong>Hadoop HDFS<\/strong>. Sistema de archivos distribuido, port\u00e1til y escalable especialmente desarrollado para el framework Hadoop. Presenta una alta tolerancia a fallos y est\u00e1 dise\u00f1ado para su desarrollo sobre arquitecturas de bajo coste.<\/li>\n<li><strong>PostgreSQL<\/strong>. Sistema de gesti\u00f3n de bases de datos relacionales de c\u00f3digo abierto, basado en un modelo cliente servidor.<\/li>\n<\/ul>\n<p><strong>&nbsp;<\/strong>Las tecnolog\u00edas destacables en la <strong>capa de servicios <\/strong>son:<\/p>\n<ul>\n<li><strong>Pig<\/strong>. Plataforma para el an\u00e1lisis de grandes cantidades de datos que permite generar programas basadas en MapReduce para utilizaci\u00f3n en Hadoop.<\/li>\n<li><strong>Cassandra<\/strong>. Base de datos NoSQL distribuida y basada en un modelo de almacenamiento de clave-valor, cuyo objetivo principal es la escalabilidad lineal y la disponibilidad.<\/li>\n<li><strong>Hive<\/strong>. Infraestructura para el almacenamiento de datos construida sobre Hadoop que permite realizar consultas, c\u00e1lculos y an\u00e1lisis de los datos que alberga, a trav\u00e9s de un lenguaje similar al SLQ llamado HiveQL.<\/li>\n<li><strong>Cascading<\/strong>. Software de abstracci\u00f3n para el uso de Hadoop, usado principalmente para crear y ejecutar procesos complejos con grandes cantidades de datos.<\/li>\n<li><strong>HBase<\/strong>. Servicio para el modelado de bases de datos no relacionales y distribuidas escrito en Java que corre sobre HDFS.<\/li>\n<\/ul>\n","protected":false},"excerpt":{"rendered":"<p>La Arquitectura Lambda que ha surgido en los \u00faltimos a\u00f1os con el objetivo de dar respuesta global a diferentes necesidades de an\u00e1lisis Big Data, presenta cuatro capas de aplicaci\u00f3n que ve\u00edamos con detalle en el anterior post.<br \/><a href=\"https:\/\/fractaliasystems.com\/en\/arquitectura-lambda-y-tecnologias-para-el-diseno-de-soluciones-big-data-2\/\" class=\"more\">Read more<\/a><\/p>\n","protected":false},"author":2,"featured_media":2513,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[6,4],"tags":[],"class_list":["post-2512","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-innovacion-fractalia","category-it-fractalia"],"_links":{"self":[{"href":"https:\/\/fractaliasystems.com\/en\/wp-json\/wp\/v2\/posts\/2512","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/fractaliasystems.com\/en\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/fractaliasystems.com\/en\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/fractaliasystems.com\/en\/wp-json\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/fractaliasystems.com\/en\/wp-json\/wp\/v2\/comments?post=2512"}],"version-history":[{"count":1,"href":"https:\/\/fractaliasystems.com\/en\/wp-json\/wp\/v2\/posts\/2512\/revisions"}],"predecessor-version":[{"id":2841,"href":"https:\/\/fractaliasystems.com\/en\/wp-json\/wp\/v2\/posts\/2512\/revisions\/2841"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/fractaliasystems.com\/en\/wp-json\/wp\/v2\/media\/2513"}],"wp:attachment":[{"href":"https:\/\/fractaliasystems.com\/en\/wp-json\/wp\/v2\/media?parent=2512"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/fractaliasystems.com\/en\/wp-json\/wp\/v2\/categories?post=2512"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/fractaliasystems.com\/en\/wp-json\/wp\/v2\/tags?post=2512"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}