Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Cada sesión dura 2 horas
Día-1: Sesión -1: Visión general empresarial del porqué del Big Data Business Intelligence en el Gobierno
- Estudios de caso del NIH y el DoE
- Tasa de adopción de Big Data en agencias gubernamentales y cómo están alineando sus operaciones futuras en torno al análisis predictivo de Big Data
- Áreas amplias de aplicación en DoD, NSA, IRS, USDA, etc.
- Interfaz entre Big Data y datos heredados
- Comprensión básica de las tecnologías habilitadoras en el análisis predictivo
- Integración de datos y visualización de tableros (dashboards)
- Gestión de fraude
- Generación de reglas comerciales/detección de fraude
- Detección y perfilado de amenazas
- Análisis costo-beneficio para la implementación de Big Data
Día-1: Sesión-2 : Introducción al Big Data-1
- Características principales del Big Data: volumen, variedad, velocidad y veracidad. Arquitectura MPP para el volumen.
- Miércoles de datos (Data Warehouses) – esquema estático, conjunto de datos en evolución lenta
- Bases de datos MPP como Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
- Soluciones basadas en Hadoop – sin condiciones sobre la estructura del conjunto de datos.
- Patrón típico: HDFS, MapReduce (procesamiento), recuperación desde HDFS
- Lote: adecuado para análisis/no interactivo
- Volumen: datos en streaming de CEP
- Opciones típicas – productos CEP (ej. Infostreams, Apama, MarkLogic, etc.)
- Menos preparados para producción – Storm/S4
- Bases de datos NoSQL – (columnares y clave-valor): mejor adecuadas como complemento analítico a la base de datos/almacén de datos
Día-1 : Sesión -3 : Introducción al Big Data-2
Soluciones NoSQL
- Almacenamiento KV - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- Almacenamiento KV - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- Almacenamiento KV (Jerárquico) - GT.m, Cache
- Almacenamiento KV (Ordenado) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- Caché KV - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Almacenamiento de tuplas - Gigaspaces, Coord, Apache River
- Bases de datos de objetos - ZopeDB, DB40, Shoal
- Almacenamiento de documentos - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, Bases de datos XML, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Almacenamiento de columnas anchas - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Variaciones de Datos: Introducción a los problemas de limpieza de datos en el Big Data
- RDBMS – estructura/esquema estático, no fomenta un entorno ágil y exploratorio.
- NoSQL – semiestructurado, suficiente estructura para almacenar datos sin un esquema exacto previo al almacenamiento
- Problemas de limpieza de datos
Día-1 : Sesión-4 : Introducción al Big Data-3 : Hadoop
- Cuándo seleccionar Hadoop?
- ESTRUCTURADO - Los almacenes/bases de datos empresariales pueden almacenar datos masivos (a un costo) pero imponen estructura (no bueno para exploración activa)
- datos SEMIESTRUCTURADOS – difíciles de manejar con soluciones tradicionales (DW/DB)
- Acondicionar datos = ESFUERZO ENORME y estático incluso después de la implementación
- Para variedad y volumen de datos, procesados en hardware comercial – HADOOP
- Hardware comercial necesario para crear un Clúster de Hadoop
Introducción a MapReduce /HDFS
- MapReduce – distribuir la computación entre múltiples servidores
- HDFS – hacer los datos disponibles localmente para el proceso de computación (con redundancia)
- Datos – pueden ser no estructurados/sin esquema (a diferencia de RDBMS)
- Responsabilidad del desarrollador de dar sentido a los datos
- Programación MapReduce = trabajar con Java (pros/contras), carga manual de datos en HDFS
Día-2: Sesión-1: Ecosistema Big Data-Construcción de ETL para Big Data: universo de herramientas de Big Data - ¿cuál usar y cuándo?
- Hadoop vs. otras soluciones NoSQL
- Para acceso interactivo y aleatorio a los datos
- Hbase (base de datos orientada a columnas) sobre Hadoop
- Acceso aleatorio a datos pero con restricciones impuestas (máx 1 PB)
- No bueno para análisis ad-hoc, bueno para registro, conteo, series temporales
- Sqoop - Importación desde bases de datos a Hive o HDFS (acceso JDBC/ODBC)
- Flume – Fluir datos (ej. datos de registro) en HDFS
Día-2: Sesión-2: Sistema de Gestión Big Data
- Partes móviles, nodos de computación inician/fallan: ZooKeeper - Para servicios de configuración/coordinación/naming.
- Pipeline/flujo de trabajo complejo: Oozie – gestionar flujo de trabajo, dependencias, cadena de margaritas (daisy chain)
- Desplegar, configurar, gestión de clústeres, actualización, etc. (admin sys): Ambari
- En la nube : Whirr
Día-2: Sesión-3: Análisis predictivo en Inteligencia de Negocios -1: Técnicas Fundamentales & BI basado en aprendizaje automático:
- Introducción al aprendizaje automático
- Aprendizaje de técnicas de clasificación
- Predicción Bayesiana-preparación del archivo de entrenamiento
- Máquinas de Soporte Vectorial (SVM)
- Álgebra p-Tree de KNN y minería vertical
- Red Neuronal
- Problema de grandes variables en Big Data - Bosque Aleatorio (RF)
- Problema de Automatización en Big Data – Bosque Aleatorio de conjunto de modelos múltiples
- Automatización a través de Soft10-M
- Herramienta analítica de texto-Treeminer
- Aprendizaje ágil
- Aprendizaje basado en agentes
- Aprendizaje distribuido
- Introducción a Herramientas open source para análisis predictivo: R, Rapidminer, Mahout
Día-2: Sesión-4 Ecosistema de análisis predictivo-2: Problemas analíticos predictivos comunes en el Gobierno.
- Analítica de insights
- Analítica de visualización
- Análisis predictivo estructurado
- Análisis predictivo no estructurado
- Perfilado de amenazas/fraudsters/proveedores
- Motor de recomendación
- Detección de patrones
- Descubrimiento de reglas/escenarios –fallos, fraude, optimización
- Descubrimiento de causa raíz
- Análisis de sentimiento
- Analítica CRM
- Analítica de redes
- Analítica de texto
- Revisión asistida por tecnología
- Analítica de fraude
- Analítica en Tiempo Real
Día-3 : Sesión-1 : Análisis en Tiempo Real y Escalable sobre Hadoop
- Por qué fallan los algoritmos analíticos comunes en Hadoop/HDFS
- Apache Hama- para computación distribuida sincrónica masiva (Bulk Synchronous)
- Apache SPARK- para computación en clústeres para análisis en tiempo real
- Lab Gráficos CMU2 - Enfoque asíncrono basado en gráficos para computación distribuida
- Enfoque basado en álgebra p-KNN de Treeminer para reducir el costo operativo de hardware
Día-3: Sesión-2: Herramientas para eDiscovery y Forense
- eDiscovery sobre Big Data vs. datos heredados – una comparación de costo y rendimiento
- Codificación predictiva y revisión asistida por tecnología (TAR)
- Demuestra en vivo de un producto TAR (vMiner) para entender cómo funciona TAR para un descubrimiento más rápido
- Indexación más rápida a través de HDFS – velocidad de los datos
- PNL o Procesamiento del Lenguaje Natural – varias técnicas y productos open source
- eDiscovery en idiomas extranjeros-tecnología para procesamiento de idiomas extranjeros
Día-3 : Sesión 3: Big Data BI para Ciberseguridad – Entendiendo las vistas completas de 360 grados de la recopilación rápida de datos a la identificación de amenazas
- Comprensión de los fundamentos del análisis de seguridad-superficie de ataque, mala configuración de seguridad, defensas de host
- Infraestructura de red/ gran conducto de datos / ETL de respuesta para análisis en tiempo real
- Predictivo prescriptivo vs – reglas fijas basadas en reglas vs auto-descubrimiento de reglas de amenaza desde metadatos
Día-3: Sesión 4: Big Data en USDA : Aplicación en Agricultura
- Introducción al IoT (Internet de las Cosas) para agricultura-sensores basados en Big Data y control
- Introducción a imágenes satelitales y su aplicación en agricultura
- Integración de datos de sensores e imágenes para fertilidad del suelo, recomendación de cultivo y pronóstico
- Seguro agrícola y Big Data
- Pronóstico de pérdida de cultivos
Día-4 : Sesión-1: Prevención de fraude BI desde Big Data en Gobierno-Análisis de Fraude:
- Clasificación básica del análisis de fraude-basado en reglas vs analítico predictivo
- Aprendizaje supervisado vs no supervisado para detección de patrones de fraude
- Fraude de proveedores/sobrecobro por proyectos
- Fraude en Medicare y Medicaid- técnicas de detección de fraude para procesamiento de reclamaciones
- Fraudes en reembolsos de viaje
- Fraudes en devoluciones del IRS
- Estudios de caso y demostración en vivo se proporcionarán donde estén disponibles los datos.
Día-4 : Sesión-2: Analítica de Redes Sociales - Recolección y análisis de inteligencia
- API ETL de Big Data para extraer datos de redes sociales
- Texto, imágenes, metadatos y video
- Análisis de sentimiento desde el feed de redes sociales
- Filtrado contextual y no contextual del feed de redes sociales
- Dashboard de Redes Sociales para integrar diversas redes sociales
- Perfilado automatizado de perfiles de redes sociales
- Demostración en vivo de cada analítica se realizará a través de la herramienta Treeminer.
Día-4 : Sesión-3: Analítica Big Data en procesamiento de imágenes y flujos de video
- Técnicas de almacenamiento de imágenes en Big Data- Solución de almacenamiento para datos que exceden petabytes
- LTFS y LTO
- GPFS-LTFS (Solución de almacenamiento en capas para datos de imagen grandes)
- Fundamentos de analítica de imágenes
- Reconocimiento de objetos
- Segmentación de imágenes
- Rastreo de movimiento
- Reconstrucción de imagen 3-D
Día-4: Sesión-4: Aplicaciones de Big Data en NIH:
- Áreas emergentes de Bioinformática
- Meti-genómica y problemas de minería de Big Data
- Análisis predictivo de Big Data para Farmacogenómica, Metabolómica y Proteómica
- Big Data en procesos genómicos posteriores (downstream)
- Aplicación de analítica predictiva de Big data en salud pública
Dashboard de Big Data para acceso rápido a diversos datos y visualización :
- Integración de plataformas de aplicaciones existentes con Dashboard de Big Data
- Gestión de Big Data
- Estudio de caso del Dashboard de Big Data: Tableau y Pentaho
- Use la aplicación Big Data para impulsar servicios basados en ubicación en el Gobierno.
- Sistema de seguimiento y gestión
Día-5 : Sesión-1: Cómo justificar la implementación de BI Big Data dentro de una organización:
- Definición del ROI para la implementación de Big Data
- Estudios de caso para ahorrar tiempo de análisis para la recopilación y preparación de datos – aumento en la ganancia de productividad
- Estudios de caso de ganancia de ingresos ahorrando el costo de base de datos licenciada
- Ganancia de ingresos desde servicios basados en ubicación
- Ahorros de prevención de fraude
- Un enfoque de hoja de cálculo integrado para calcular gasto aprox. vs. Ganancia de ingresos/ahorros de la implementación de Big Data.
Día-5 : Sesión-2: Procedimiento paso a paso para reemplazar sistemas de datos heredados por sistemas Big Data:
- Comprensión del Hoja de Ruta práctica de Migración de Big Data
- ¿Qué información importante se necesita antes de diseñar una implementación de Big Data?
- ¿Cuáles son las diferentes formas de calcular volumen, velocidad, variedad y veracidad de los datos?
- ¿Cómo estimar el crecimiento de los datos?
- Estudios de caso
Día-5: Sesión 4: Revisión de proveedores de Big Data y revisión de sus productos. Sesión de preguntas y respuestas:
- Accenture
- APTEAN (anteriormente CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Sistemas de Datos Hitachi
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (anteriormente 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Parte de EMC)
Requerimientos
- Conocimiento básico de las operaciones empresariales y sistemas de datos en el gobierno dentro de su dominio
- Comprensión básica de SQL/Oracle o bases de datos relacionales
- Comprensión básica de Estadísticas (a nivel de hojas de cálculo)
35 Horas
Reseñas (1)
La capacidad del formador de alinear el curso con los requisitos de la organización, y no solo proporcionarlo por el mero hecho de impartirlo.
Masilonyane - Revenue Services Lesotho
Curso - Big Data Business Intelligence for Govt. Agencies
Traducción Automática