Temario del curso
Día 01
Visión general de Business Intelligence de Gran Volumen para el Análisis de Inteligencia Criminal
- Estudios de casos en Fuerzas Policiales - Policía predictiva.
- Tasa de adopción de Big Data en Agencias de Fuerza Pública y cómo están alineando sus operaciones futuras en torno al análisis predictivo de Gran Volumen.
- Soluciones tecnológicas emergentes, como sensores de disparos, videos de vigilancia y redes sociales.
- Uso de la tecnología Big Data para mitigar la sobrecarga de información.
- Interfaz entre Big Data y datos heredados (Legacy).
- Comprensión básica de las tecnologías habilitadoras en el análisis predictivo.
- Integración de datos y visualización en cuadros de mando.
- Gestión de fraudes.
- Reglas comerciales y detección de fraudes.
- Detección de amenazas y perfiles.
- Análisis costo-beneficio para la implementación de Big Data.
Introducción a Big Data
- Características principales de Big Data: Volumen, Variedad, Velocidad y Veracidad.
- Arquitectura MPP (Procesamiento Masivamente Paralelo).
- Bodegas de datos (Data Warehouses) – esquema estático, conjunto de datos que evoluciona lentamente.
- Bases de datos MPP: Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
- Soluciones basadas en Hadoop – sin condiciones sobre la estructura del conjunto de datos.
- Patrón típico: HDFS, MapReduce (crunch), recuperación desde HDFS.
- Apache Spark para procesamiento en streaming.
- Lotes (Batch): adecuados para análisis no interactivo.
- Volumen: CEP (Procesamiento de Eventos Complejos) para datos en streaming.
- Opciones típicas – productos CEP (ej. Infostreams, Apama, MarkLogic, etc.).
- Menos listos para producción – Storm/S4.
- Bases de datos NoSQL – (columnares y clave-valor): las más adecuadas como complemento analítico a bodegas de datos/bases de datos relacionales.
Soluciones NoSQL
- Almacén KV - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB).
- Almacén KV - Dynamo, Voldemort, Dynomite, SubRecord, MongoDB, DovetailDB.
- Almacén KV (Jerárquico) – GT.m, Cache.
- Almacén KV (Ordenado) – TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord.
- Caché KV - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracotta.
- Almacén de tuplas (Tuple Store) – Gigaspaces, Coord, Apache River.
- Bases de datos de objetos - ZopeDB, DB40, Shoal.
- Almacén de documentos - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, Bases de datos XML, ThruDB, CloudKit, Persevere, Riak-Basho, Scalaris.
- Almacén de columnas anchas (Wide Columnar Store) – BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI.
Variedades de datos: Introducción a los problemas de limpieza de datos en Big Data
- RDBMS – estructura/esquema estático, no promueve un entorno ágil y exploratorio.
- NoSQL – semiestructurado, tiene suficiente estructura para almacenar datos sin un esquema exacto previo al almacenamiento.
- Problemas de limpieza de datos.
Hadoop
- ¿Cuándo seleccionar Hadoop?
- DATOS ESTRUCTURADOS: Las bodegas de datos/bases de datos empresariales pueden almacenar cantidades masivas de datos (con un costo), pero imponen estructura (no es bueno para la exploración activa).
- Datos SEMIESTRUCTURADOS – difíciles de procesar con soluciones tradicionales (DW/DB).
- Almacenar datos en una bodega = Esfuerzo ENORME y estático incluso después de la implementación.
- Para variedad y volumen de datos, procesados en hardware commodity – HADOOP.
- Se necesita hardware commodity para crear un clúster de Hadoop.
Introducción a Map Reduce / HDFS
- MapReduce – distribuir el cómputo entre múltiples servidores.
- HDFS – hacer los datos accesibles localmente para el proceso de cómputo (con redundancia).
- Datos – pueden ser no estructurados o sin esquema (a diferencia de RDBMS).
- Responsabilidad del desarrollador: dar sentido a los datos.
- Programar MapReduce implica trabajar con Java (ventajas/desventajas) y cargar manualmente los datos en HDFS.
Día 02
Ecosistema de Big Data – Construcción de ETL de Gran Volumen (Extraer, Transformar, Cargar) – ¿Qué herramientas de Big Data utilizar y cuándo?
- Hadoop frente a otras soluciones NoSQL.
- Para acceso interactivo e aleatorio a los datos.
- Hbase (base de datos orientada a columnas) sobre Hadoop.
- Acceso aleatorio a los datos pero con restricciones impuestas (máx. 1 PB).
- No es bueno para análisis ad-hoc, sí para registros contables (logging), conteo y series temporales.
- Sqoop – Importar desde bases de datos a Hive o HDFS (acceso JDBC/ODBC).
- Flume – Flujo de datos (ej. datos de registro) hacia HDFS.
Sistema de Gestión de Big Data
- Componentes móviles, nodos de cómputo que inician/fallan: ZooKeeper – Para servicios de configuración/coordinación/nombrado.
- Pipeline/flujo de trabajo complejo: Oozie – administrar flujo de trabajo, dependencias, cadenas de flor (daisy chain).
- Implementar, configurar, gestión de clústeres, actualizaciones, etc. (administrador del sistema): Ambari.
- En la Nube: Whirr.
Análisis Predictivo – Técnicas Fundamentales e Inteligencia Empresarial basada en Aprendizaje Automático
- Introducción al Aprendizaje Automático.
- Aprendizaje de técnicas de clasificación.
- Predicción Bayesiana – preparación de un archivo de entrenamiento.
- Máquinas de Soporte Vectorial (SVM).
- KNN p-Tree Algebra y minería vertical.
- Redes Neuronales.
- Problema de grandes variables en Big Data – Bosque Aleatorio (RF).
- Problema de automatización en Big Data – RF de conjunto multi-modelo.
- Automatización a través de Soft10-M.
- Herramienta de análisis de texto - Treeminer.
- Aprendizaje ágil.
- Aprendizaje basado en agentes.
- Aprendizaje distribuido.
- Introducción a herramientas de código abierto para análisis predictivo: R, Python, Rapidminer, Mahout.
Ecosistema de Análisis Predictivo y su aplicación en el Análisis de Inteligencia Criminal
- Tecnología y el proceso de investigación.
- Análisis de intuición (Insight analytics).
- Análisis visual.
- Analítica predictiva estructurada.
- Analítica predictiva no estructurada.
- Perfiles de amenaza/fraudador/vendedor.
- Motor de recomendación.
- Detección de patrones.
- Descubrimiento de reglas/escenarios – falla, fraude, optimización.
- Descubrimiento de la causa raíz.
- Análisis de sentimiento.
- Analítica CRM.
- Analítica de redes.
- Análisis de texto para obtener conocimientos a partir de transcripciones, declaraciones de testigos, conversaciones en internet, etc.
- Revisión asistida por tecnología.
- Analítica de fraudes.
- Analítica en tiempo real.
Día 03
Analítica Escalable y en Tiempo Real sobre Hadoop
- Por qué los algoritmos analíticos comunes fallan en Hadoop/HDFS.
- Apache Hama – para cómputo distribuido sincrónico por lotes (Bulk Synchronous).
- Apache SPARK – para cómputo en clúster y análisis en tiempo real.
- CMU Graphics Lab2 – Enfoque asíncrono basado en grafos para el cómputo distribuido.
- KNN p – Enfoque basado en álgebra de Treeminer para reducir el costo operativo del hardware.
Herramientas para eDiscovery y Forense
- eDiscovery sobre Big Data vs. Datos heredados – una comparación de costos y rendimiento.
- Codificación predictiva y Revisión Asistida por Tecnología (TAR).
- Demostración en vivo de vMiner para comprender cómo TAR permite un descubrimiento más rápido.
- Indexación más rápida a través de HDFS – Velocidad de los datos.
- NLP (Procesamiento de Lenguaje Natural) – productos y técnicas de código abierto.
- eDiscovery en idiomas extranjeros – tecnología para el procesamiento de idiomas extranjeros.
Big Data BI para Ciberseguridad – Obtener una vista de 360 grados, recopilación rápida de datos e identificación de amenazas
- Comprensión de los fundamentos del análisis de seguridad: superficie de ataque, mala configuración de seguridad, defensas de host.
- Infraestructura de red / Gran tubería de datos (datapipe) / ETL de respuesta para analítica en tiempo real.
- Predictiva prescriptiva frente a predictiva – Reglas fijas basadas en normas vs. descubrimiento automático de reglas de amenaza a partir de metadatos.
Recopilación de datos dispares para el Análisis de Inteligencia Criminal
- Uso del IoT (Internet de las Cosas) como sensores para capturar datos.
- Uso de imágenes satelitales para vigilancia doméstica.
- Uso de datos de vigilancia e imagen para la identificación criminal.
- Otras tecnologías de recopilación de datos – drones, cámaras corporales, sistemas de etiquetado GPS y tecnología de imágenes térmicas.
- Combinación de recuperación automática de datos con datos obtenidos de informantes, interrogatorios e investigación.
- Pronóstico de actividad criminal.
Día 04
Prevención de fraudes BI a partir de Big Data en Analítica de Fraudes
- Clasificación básica de la Analítica de Fraudes – basada en reglas frente a analítica predictiva.
- Aprendizaje supervisado frente a no supervisado para la detección de patrones de fraude.
- Fraude entre empresas, fraude en reclamos médicos, fraude en seguros, evasión fiscal y lavado de dinero.
Análisis de Redes Sociales – Recopilación e análisis de inteligencia
- Cómo los criminales utilizan las redes sociales para organizarse, reclutar y planificar.
- API de ETL de Big Data para extraer datos de redes sociales.
- Texto, imágenes, metadatos y video.
- Análisis de sentimiento a partir del feed de redes sociales.
- Filtrado contextual y no contextual del feed de redes sociales.
- Panel de control de Redes Sociales para integrar diversas redes sociales.
- Perfilado automatizado de perfiles en redes sociales.
- Se dará una demostración en vivo de cada analítica a través de la herramienta Treeminer.
Análisis de Big Data en procesamiento de imágenes y flujos de video
- Técnicas de almacenamiento de imágenes en Big Data – Solución de almacenamiento para datos que superan los petabytes.
- LTFS (Sistema de Archivos de Cinta Lineal) y LTO (Tape Open Lineal).
- GPFS-LTFS (General Parallel File System - Sistema de Archivos de Cinta Lineal) – solución de almacenamiento en capas para datos de imagen grandes.
- Fundamentos del análisis de imágenes.
- Reconocimiento de objetos.
- Segmentación de imágenes.
- Rastreo de movimiento.
- Reconstrucción de imágenes 3D.
Biometría, ADN y Programas de Identificación de Nueva Generación
- Más allá de las huellas dactilares y el reconocimiento facial.
- Reconocimiento de voz, patrones de tecleo (analizando el patrón de escritura del usuario) y CODIS (Sistema de Índice Combinado de ADN).
- Más allá de la coincidencia de ADN: uso de la fenotipificación forense de ADN para construir un rostro a partir de muestras de ADN.
Panel de control (Dashboard) de Big Data para acceso rápido a diversos datos y visualización:
- Integración de la plataforma de aplicaciones existente con el Panel de control de Big Data.
- Gestión de Big Data.
- Caso de estudio del Panel de control de Big Data: Tableau y Pentaho.
- Uso de aplicaciones de Big Data para impulsar servicios basados en ubicación en el gobierno.
- Sistema de seguimiento y gestión.
Día 05
Cómo justificar la implementación de Business Intelligence de Gran Volumen dentro de una organización:
- Definición del ROI (Retorno de Inversión) para implementar Big Data.
- Estudios de casos sobre el ahorro de tiempo del analista en la recopilación y preparación de datos – aumento de la productividad.
- Ganancia de ingresos por menor costo de licencias de bases de datos.
- Ganancia de ingresos por servicios basados en ubicación.
- Ahorro de costos por prevención de fraudes.
- Un enfoque de hoja de cálculo integrada para calcular gastos aproximados versus la ganancia/ahorro de ingresos de la implementación de Big Data.
Procedimiento paso a paso para reemplazar un sistema de datos heredado con un sistema de Big Data
- Ruta de migración de Big Data.
- ¿Qué información crítica se necesita antes de diseñar un sistema de Big Data?
- ¿Cuáles son las diferentes formas de calcular el Volumen, Velocidad, Variedad y Veracidad de los datos?
- Cómo estimar el crecimiento de los datos.
- Estudios de casos.
Revisión de proveedores de Big Data y revisión de sus productos.
- Accenture
- APTEAN (anteriormente CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (anteriormente 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (parte de EMC)
Sesión de preguntas y respuestas.
Requerimientos
- Conocimiento de los procesos policiales y los sistemas de datos.
- Comprensión básica de SQL/Oracle o bases de datos relacionales.
- Conocimientos básicos de estadística (a nivel de hojas de cálculo).
Audiencia
- Especialistas en fuerzas de seguridad pública con formación técnica.
Testimonios (3)
fundamentos y amó los documentos y ejercicios preparados
Rekha Nallam - GE Medical Systems Polska Sp. z o.o.
Curso - Introduction to Predictive AI
Traducción Automática
Que fue muy priactico.
Alfonso Ramos - Banco de Mexico
Curso - Fundamentos de Integración de Datos Pentaho
Deepthi estaba muy atenta a mis necesidades, podía percibir cuándo añadir capas de complejidad y cuándo mantenerse atrás y adoptar un enfoque más estructurado. Deepthi realmente trabajó a mi ritmo y aseguró que pudiera utilizar las nuevas funciones/herramientas por mí mismo, primero mostrándome y luego dejándome recrear los elementos por mí mismo, lo cual ayudó mucho a consolidar la formación. ¡No podría estar más satisfecho con los resultados de esta capacitación y con el nivel de experiencia de Deepthi!
Deepthi - Invest Northern Ireland
Curso - IBM Cognos Analytics
Traducción Automática