Contacta con nosotros

Temario del curso

Día 01

Visión general de Business Intelligence de Gran Volumen para el Análisis de Inteligencia Criminal

  • Estudios de casos en Fuerzas Policiales - Policía predictiva.
  • Tasa de adopción de Big Data en Agencias de Fuerza Pública y cómo están alineando sus operaciones futuras en torno al análisis predictivo de Gran Volumen.
  • Soluciones tecnológicas emergentes, como sensores de disparos, videos de vigilancia y redes sociales.
  • Uso de la tecnología Big Data para mitigar la sobrecarga de información.
  • Interfaz entre Big Data y datos heredados (Legacy).
  • Comprensión básica de las tecnologías habilitadoras en el análisis predictivo.
  • Integración de datos y visualización en cuadros de mando.
  • Gestión de fraudes.
  • Reglas comerciales y detección de fraudes.
  • Detección de amenazas y perfiles.
  • Análisis costo-beneficio para la implementación de Big Data.

Introducción a Big Data

  • Características principales de Big Data: Volumen, Variedad, Velocidad y Veracidad.
  • Arquitectura MPP (Procesamiento Masivamente Paralelo).
  • Bodegas de datos (Data Warehouses) – esquema estático, conjunto de datos que evoluciona lentamente.
  • Bases de datos MPP: Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
  • Soluciones basadas en Hadoop – sin condiciones sobre la estructura del conjunto de datos.
  • Patrón típico: HDFS, MapReduce (crunch), recuperación desde HDFS.
  • Apache Spark para procesamiento en streaming.
  • Lotes (Batch): adecuados para análisis no interactivo.
  • Volumen: CEP (Procesamiento de Eventos Complejos) para datos en streaming.
  • Opciones típicas – productos CEP (ej. Infostreams, Apama, MarkLogic, etc.).
  • Menos listos para producción – Storm/S4.
  • Bases de datos NoSQL – (columnares y clave-valor): las más adecuadas como complemento analítico a bodegas de datos/bases de datos relacionales.

Soluciones NoSQL

  • Almacén KV - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB).
  • Almacén KV - Dynamo, Voldemort, Dynomite, SubRecord, MongoDB, DovetailDB.
  • Almacén KV (Jerárquico) – GT.m, Cache.
  • Almacén KV (Ordenado) – TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord.
  • Caché KV - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracotta.
  • Almacén de tuplas (Tuple Store) – Gigaspaces, Coord, Apache River.
  • Bases de datos de objetos - ZopeDB, DB40, Shoal.
  • Almacén de documentos - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, Bases de datos XML, ThruDB, CloudKit, Persevere, Riak-Basho, Scalaris.
  • Almacén de columnas anchas (Wide Columnar Store) – BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI.

Variedades de datos: Introducción a los problemas de limpieza de datos en Big Data

  • RDBMS – estructura/esquema estático, no promueve un entorno ágil y exploratorio.
  • NoSQL – semiestructurado, tiene suficiente estructura para almacenar datos sin un esquema exacto previo al almacenamiento.
  • Problemas de limpieza de datos.

Hadoop

  • ¿Cuándo seleccionar Hadoop?
  • DATOS ESTRUCTURADOS: Las bodegas de datos/bases de datos empresariales pueden almacenar cantidades masivas de datos (con un costo), pero imponen estructura (no es bueno para la exploración activa).
  • Datos SEMIESTRUCTURADOS – difíciles de procesar con soluciones tradicionales (DW/DB).
  • Almacenar datos en una bodega = Esfuerzo ENORME y estático incluso después de la implementación.
  • Para variedad y volumen de datos, procesados en hardware commodity – HADOOP.
  • Se necesita hardware commodity para crear un clúster de Hadoop.

Introducción a Map Reduce / HDFS

  • MapReduce – distribuir el cómputo entre múltiples servidores.
  • HDFS – hacer los datos accesibles localmente para el proceso de cómputo (con redundancia).
  • Datos – pueden ser no estructurados o sin esquema (a diferencia de RDBMS).
  • Responsabilidad del desarrollador: dar sentido a los datos.
  • Programar MapReduce implica trabajar con Java (ventajas/desventajas) y cargar manualmente los datos en HDFS.

Día 02

Ecosistema de Big Data – Construcción de ETL de Gran Volumen (Extraer, Transformar, Cargar) – ¿Qué herramientas de Big Data utilizar y cuándo?

  • Hadoop frente a otras soluciones NoSQL.
  • Para acceso interactivo e aleatorio a los datos.
  • Hbase (base de datos orientada a columnas) sobre Hadoop.
  • Acceso aleatorio a los datos pero con restricciones impuestas (máx. 1 PB).
  • No es bueno para análisis ad-hoc, sí para registros contables (logging), conteo y series temporales.
  • Sqoop – Importar desde bases de datos a Hive o HDFS (acceso JDBC/ODBC).
  • Flume – Flujo de datos (ej. datos de registro) hacia HDFS.

Sistema de Gestión de Big Data

  • Componentes móviles, nodos de cómputo que inician/fallan: ZooKeeper – Para servicios de configuración/coordinación/nombrado.
  • Pipeline/flujo de trabajo complejo: Oozie – administrar flujo de trabajo, dependencias, cadenas de flor (daisy chain).
  • Implementar, configurar, gestión de clústeres, actualizaciones, etc. (administrador del sistema): Ambari.
  • En la Nube: Whirr.

Análisis Predictivo – Técnicas Fundamentales e Inteligencia Empresarial basada en Aprendizaje Automático

  • Introducción al Aprendizaje Automático.
  • Aprendizaje de técnicas de clasificación.
  • Predicción Bayesiana – preparación de un archivo de entrenamiento.
  • Máquinas de Soporte Vectorial (SVM).
  • KNN p-Tree Algebra y minería vertical.
  • Redes Neuronales.
  • Problema de grandes variables en Big Data – Bosque Aleatorio (RF).
  • Problema de automatización en Big Data – RF de conjunto multi-modelo.
  • Automatización a través de Soft10-M.
  • Herramienta de análisis de texto - Treeminer.
  • Aprendizaje ágil.
  • Aprendizaje basado en agentes.
  • Aprendizaje distribuido.
  • Introducción a herramientas de código abierto para análisis predictivo: R, Python, Rapidminer, Mahout.

Ecosistema de Análisis Predictivo y su aplicación en el Análisis de Inteligencia Criminal

  • Tecnología y el proceso de investigación.
  • Análisis de intuición (Insight analytics).
  • Análisis visual.
  • Analítica predictiva estructurada.
  • Analítica predictiva no estructurada.
  • Perfiles de amenaza/fraudador/vendedor.
  • Motor de recomendación.
  • Detección de patrones.
  • Descubrimiento de reglas/escenarios – falla, fraude, optimización.
  • Descubrimiento de la causa raíz.
  • Análisis de sentimiento.
  • Analítica CRM.
  • Analítica de redes.
  • Análisis de texto para obtener conocimientos a partir de transcripciones, declaraciones de testigos, conversaciones en internet, etc.
  • Revisión asistida por tecnología.
  • Analítica de fraudes.
  • Analítica en tiempo real.

Día 03

Analítica Escalable y en Tiempo Real sobre Hadoop

  • Por qué los algoritmos analíticos comunes fallan en Hadoop/HDFS.
  • Apache Hama – para cómputo distribuido sincrónico por lotes (Bulk Synchronous).
  • Apache SPARK – para cómputo en clúster y análisis en tiempo real.
  • CMU Graphics Lab2 – Enfoque asíncrono basado en grafos para el cómputo distribuido.
  • KNN p – Enfoque basado en álgebra de Treeminer para reducir el costo operativo del hardware.

Herramientas para eDiscovery y Forense

  • eDiscovery sobre Big Data vs. Datos heredados – una comparación de costos y rendimiento.
  • Codificación predictiva y Revisión Asistida por Tecnología (TAR).
  • Demostración en vivo de vMiner para comprender cómo TAR permite un descubrimiento más rápido.
  • Indexación más rápida a través de HDFS – Velocidad de los datos.
  • NLP (Procesamiento de Lenguaje Natural) – productos y técnicas de código abierto.
  • eDiscovery en idiomas extranjeros – tecnología para el procesamiento de idiomas extranjeros.

Big Data BI para Ciberseguridad – Obtener una vista de 360 grados, recopilación rápida de datos e identificación de amenazas

  • Comprensión de los fundamentos del análisis de seguridad: superficie de ataque, mala configuración de seguridad, defensas de host.
  • Infraestructura de red / Gran tubería de datos (datapipe) / ETL de respuesta para analítica en tiempo real.
  • Predictiva prescriptiva frente a predictiva – Reglas fijas basadas en normas vs. descubrimiento automático de reglas de amenaza a partir de metadatos.

Recopilación de datos dispares para el Análisis de Inteligencia Criminal

  • Uso del IoT (Internet de las Cosas) como sensores para capturar datos.
  • Uso de imágenes satelitales para vigilancia doméstica.
  • Uso de datos de vigilancia e imagen para la identificación criminal.
  • Otras tecnologías de recopilación de datos – drones, cámaras corporales, sistemas de etiquetado GPS y tecnología de imágenes térmicas.
  • Combinación de recuperación automática de datos con datos obtenidos de informantes, interrogatorios e investigación.
  • Pronóstico de actividad criminal.

Día 04

Prevención de fraudes BI a partir de Big Data en Analítica de Fraudes

  • Clasificación básica de la Analítica de Fraudes – basada en reglas frente a analítica predictiva.
  • Aprendizaje supervisado frente a no supervisado para la detección de patrones de fraude.
  • Fraude entre empresas, fraude en reclamos médicos, fraude en seguros, evasión fiscal y lavado de dinero.

Análisis de Redes Sociales – Recopilación e análisis de inteligencia

  • Cómo los criminales utilizan las redes sociales para organizarse, reclutar y planificar.
  • API de ETL de Big Data para extraer datos de redes sociales.
  • Texto, imágenes, metadatos y video.
  • Análisis de sentimiento a partir del feed de redes sociales.
  • Filtrado contextual y no contextual del feed de redes sociales.
  • Panel de control de Redes Sociales para integrar diversas redes sociales.
  • Perfilado automatizado de perfiles en redes sociales.
  • Se dará una demostración en vivo de cada analítica a través de la herramienta Treeminer.

Análisis de Big Data en procesamiento de imágenes y flujos de video

  • Técnicas de almacenamiento de imágenes en Big Data – Solución de almacenamiento para datos que superan los petabytes.
  • LTFS (Sistema de Archivos de Cinta Lineal) y LTO (Tape Open Lineal).
  • GPFS-LTFS (General Parallel File System - Sistema de Archivos de Cinta Lineal) – solución de almacenamiento en capas para datos de imagen grandes.
  • Fundamentos del análisis de imágenes.
  • Reconocimiento de objetos.
  • Segmentación de imágenes.
  • Rastreo de movimiento.
  • Reconstrucción de imágenes 3D.

Biometría, ADN y Programas de Identificación de Nueva Generación

  • Más allá de las huellas dactilares y el reconocimiento facial.
  • Reconocimiento de voz, patrones de tecleo (analizando el patrón de escritura del usuario) y CODIS (Sistema de Índice Combinado de ADN).
  • Más allá de la coincidencia de ADN: uso de la fenotipificación forense de ADN para construir un rostro a partir de muestras de ADN.

Panel de control (Dashboard) de Big Data para acceso rápido a diversos datos y visualización:

  • Integración de la plataforma de aplicaciones existente con el Panel de control de Big Data.
  • Gestión de Big Data.
  • Caso de estudio del Panel de control de Big Data: Tableau y Pentaho.
  • Uso de aplicaciones de Big Data para impulsar servicios basados en ubicación en el gobierno.
  • Sistema de seguimiento y gestión.

Día 05

Cómo justificar la implementación de Business Intelligence de Gran Volumen dentro de una organización:

  • Definición del ROI (Retorno de Inversión) para implementar Big Data.
  • Estudios de casos sobre el ahorro de tiempo del analista en la recopilación y preparación de datos – aumento de la productividad.
  • Ganancia de ingresos por menor costo de licencias de bases de datos.
  • Ganancia de ingresos por servicios basados en ubicación.
  • Ahorro de costos por prevención de fraudes.
  • Un enfoque de hoja de cálculo integrada para calcular gastos aproximados versus la ganancia/ahorro de ingresos de la implementación de Big Data.

Procedimiento paso a paso para reemplazar un sistema de datos heredado con un sistema de Big Data

  • Ruta de migración de Big Data.
  • ¿Qué información crítica se necesita antes de diseñar un sistema de Big Data?
  • ¿Cuáles son las diferentes formas de calcular el Volumen, Velocidad, Variedad y Veracidad de los datos?
  • Cómo estimar el crecimiento de los datos.
  • Estudios de casos.

Revisión de proveedores de Big Data y revisión de sus productos.

  • Accenture
  • APTEAN (anteriormente CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (anteriormente 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (parte de EMC)

Sesión de preguntas y respuestas.

Requerimientos

  • Conocimiento de los procesos policiales y los sistemas de datos.
  • Comprensión básica de SQL/Oracle o bases de datos relacionales.
  • Conocimientos básicos de estadística (a nivel de hojas de cálculo).

Audiencia

  • Especialistas en fuerzas de seguridad pública con formación técnica.
 35 Horas

Número de participantes


Precio por participante

Testimonios (3)

Próximos cursos

Categorías Relacionadas