Want to create interactive content? It’s easy in Genially!

Get started free

MTI-4-M7-R1

PUCE

Created on September 9, 2020

Start designing with a free template

Discover more than 1500 professional designs like these:

Smart Presentation

Practical Presentation

Essential Presentation

Akihabara Presentation

KPOP Presentation

Terrazzo Presentation

Historical Presentation

Transcript

Analítica Predictiva II

Gestión de Datos de las Organizaciones

MAESTRÍA EN TECNOLOGÍAS DE LA INFORMACIÓN CON MENCIÓN EN GESTIÓN Y ADMINISTRACIÓN DE TECNOLOGÍA

Analítica y minería de texto

La era de la información en la que vivimos se caracteriza por el rápido crecimiento en la cantidad de datos e información recopilada, almacenada y disponible en formato electrónico. La gran mayoría de los datos comerciales se almacenan en documentos de texto que están prácticamente desestructurados. Según un estudio de Merrill Lynch y Gartner, el 85% de todos los datos corporativos se capturan y almacenan en algún tipo de forma no estructurada. El mismo estudio también afirmó que estos datos no estructurados se duplican en tamaño cada 18 meses. Debido a que el conocimiento es poder en el mundo de los negocios de hoy, y el conocimiento se deriva de los datos y la información, las empresas que aprovechan de manera efectiva y eficiente sus fuentes de datos de texto tendrán el conocimiento necesario para tomar mejores decisiones, lo que conducirá a una ventaja competitiva sobre aquellas empresas que se quedan atrás. Aquí es donde la necesidad de análisis de texto y minería de texto se ajusta al panorama general de las empresas de hoy.

Aunque el objetivo general tanto para el análisis de texto como para la minería de texto es convertir los datos textuales no estructurados en información procesable mediante la aplicación de procesamiento de lenguaje natural (NLP) y análisis, sus definiciones son algo diferentes, al menos para algunos expertos en el campo. Según ellos, el análisis de texto es un concepto más amplio que incluye la recuperación de información (por ejemplo, búsqueda e identificación de documentos relevantes para un conjunto dado de términos clave), así como extracción de información, minería de datos y minería web, mientras que la minería de texto se centra en descubrir conocimiento nuevo y útil de las fuentes de datos textuales. La Figura 1 ilustra las relaciones entre análisis de texto y minería de texto junto con otras áreas de aplicación relacionadas. La parte inferior de la Figura 1 enumera las principales disciplinas que juegan un papel crítico en el desarrollo de estas áreas de aplicación cada vez más populares. Análisis de texto = Recuperación de información + Extracción de información + Minería de datos + Minería web, o simplemente Análisis de texto = Recuperación de información + Minería de texto

Figura 1. Analítica de texto, áreas de aplicación relacionadas, y disciplinas habilitantes.

En comparación con minería de texto, análisis de texto es un término relativamente nuevo. Con el reciente énfasis en el análisis, como ha sido el caso en muchas otras áreas de aplicaciones técnicas relacionadas (por ejemplo, análisis del consumidor, análisis completo, análisis visual, análisis social), el campo del texto también ha querido subirse al tren de análisis. Aunque el término análisis de texto se usa más comúnmente en un contexto de aplicación comercial, la minería de texto se usa con frecuencia en círculos de investigación académica. Aunque a veces pueden definirse de manera algo diferente, el análisis de texto y la minería de texto generalmente se usan como sinónimos.

La minería de texto (también conocida como minería de datos de texto o descubrimiento de conocimiento en bases de datos textuales) es el proceso semiautomatizado de extracción de patrones (información y conocimiento útil) de grandes cantidades de fuentes de datos no estructurados. Recuerde que la minería de datos es el proceso de identificar patrones válidos, novedosos, potencialmente útiles y, en última instancia, comprensibles en los datos almacenados en bases de datos estructuradas, donde los datos se organizan en registros estructurados por variables categóricas, ordinales o continuas. La minería de texto es lo mismo que la minería de datos, ya que tiene el mismo propósito y utiliza los mismos procesos, pero con la minería de texto, la entrada al proceso es una colección de archivos de datos no estructurados (o menos estructurados) como documentos de Word, PDF archivos, extractos de texto, archivos XML, etc. En esencia, la minería de texto puede considerarse como un proceso (con dos pasos principales) que comienza con la imposición de una estructura en las fuentes de datos basadas en texto seguido de la extracción de información relevante y conocimiento de estos datos estructurados basados en texto utilizando técnicas y herramientas de minería de datos.

Los beneficios de la minería de textos son obvios en las áreas donde se generan grandes cantidades de datos textuales, como la ley (órdenes judiciales), la investigación académica (artículos de investigación), las finanzas (informes trimestrales), la medicina (resúmenes de alta), la biología ( interacciones moleculares), tecnología (archivos de patentes) y marketing (comentarios de clientes). Por ejemplo, las interacciones de forma libre basadas en texto con los clientes en forma de quejas (o elogios) y reclamos de garantía se pueden usar para identificar objetivamente las características del producto y servicio que se consideran menos que perfectas y se pueden usar como entrada para mejor desarrollo de productos y asignaciones de servicios. Del mismo modo, los programas de divulgación del mercado y los grupos focales generan grandes cantidades de datos. Al no restringir los comentarios sobre productos o servicios a una forma codificada, los clientes pueden presentar, en sus propias palabras, lo que piensan acerca de los productos y servicios de una empresa. Otra área donde el procesamiento automatizado de texto no estructurado ha tenido un gran impacto es en las comunicaciones y el correo electrónico. La minería de texto no solo se puede usar para clasificar y filtrar el correo no deseado, sino que también se puede usar para priorizar automáticamente el correo electrónico en función del nivel de importancia y generar respuestas automáticas.

Las siguientes son algunas de las áreas de aplicación más populares de minería de texto:

  • Extracción de información. Identificación de frases y relaciones clave dentro del texto mediante la búsqueda de objetos y secuencias predefinidas en el texto mediante la coincidencia de patrones.
  • Seguimiento de temas. Basado en un perfil de usuario y documentos que un usuario ve, la minería de texto puede predecir otros documentos de interés para el usuario.
  • Resumen. Resumir un documento para ahorrar tiempo por parte del lector.
  • Categorización. Identificar los temas principales de un documento y luego colocar el documento en un conjunto predefinido de categorías basadas en esos temas.
  • Clustering. Agrupar documentos similares sin tener un conjunto predefinido de categorías.
  • Vinculación de conceptos. Conecta documentos relacionados mediante la identificación de sus conceptos compartidos y, al hacerlo, ayuda a los usuarios a encontrar información que tal vez no hubieran encontrado utilizando los métodos de búsqueda tradicionales.
  • Preguntas y respuestas. Encontrar la mejor respuesta a una pregunta dada a través de la coincidencia de patrones basada en el conocimiento.

Procesamiento de Lenguaje Natural (NLP)

Algunas de las primeras aplicaciones de minería de texto utilizaron una representación simplificada llamada bolsa de palabras al presentar la estructura a una colección de documentos basados en texto para clasificarlos en dos o más clases predeterminadas o para agruparlos en agrupaciones naturales. En el modelo de bolsa de palabras, el texto, como una oración, un párrafo o un documento completo, se representa como una colección de palabras, sin tener en cuenta la gramática o el orden en que aparecen las palabras. El modelo de bolsa de palabras todavía se usa en algunas herramientas simples de clasificación de documentos. Por ejemplo, en el filtrado de correo no deseado, un mensaje de correo electrónico puede modelarse como una colección de palabras desordenada (una bolsa de palabras) que se compara con dos bolsas predeterminadas diferentes. Una bolsa está llena de palabras encontradas en mensajes de spam y la otra está llena de palabras encontradas en correos electrónicos legítimos.

Aunque es probable que algunas de las palabras se encuentren en ambas bolsas, la bolsa de "spam" contendrá palabras relacionadas con spam como stock, Viagra y comprará con mucha más frecuencia que la bolsa legítima, que contendrá más palabras relacionadas con el usuario amigos o lugar de trabajo. El nivel de coincidencia entre la bolsa de palabras de un correo electrónico específico y las dos bolsas que contienen los descriptores determina la membresía del correo electrónico como spam o legítimo. Naturalmente, nosotros (humanos) no usamos palabras sin algún orden o estructura. Usamos palabras en oraciones, que tienen una estructura semántica y sintáctica. Por lo tanto, las técnicas automatizadas (como la minería de texto) deben buscar formas de ir más allá de la interpretación de la bolsa de palabras e incorporar más y más estructura semántica en sus operaciones. La tendencia actual en la minería de texto es incluir muchas de las características avanzadas que se pueden obtener con PNL.

Se ha demostrado que el método de la bolsa de palabras puede no producir contenido de información suficientemente bueno para las tareas de minería de texto (por ejemplo, clasificación, agrupación, asociación). Un buen ejemplo de esto se puede encontrar en la medicina basada en la evidencia. Un componente crítico de los medios impresos para la validez y relevancia. Varios investigadores de la Universidad de Maryland desarrollaron modelos de evaluación de evidencia utilizando un método de bolsa de palabras. Emplearon métodos populares de aprendizaje automático junto con más de medio millón de artículos de investigación recopilados de MEDLINE (Sistema de recuperación y análisis de literatura médica en línea). En sus modelos, representaban cada resumen como una bolsa de palabras, donde cada término derivado representaba una característica. A pesar de utilizar métodos de clasificación populares con metodologías de diseño experimental comprobadas, sus resultados de predicción no fueron mucho mejores que simples suposiciones, lo que puede indicar que la bolsa de palabras no está generando una representación suficientemente buena de los artículos de investigación en este dominio; por lo tanto, se necesitan técnicas más avanzadas como la PNL.

El procesamiento del lenguaje natural (PNL) es un componente importante de la minería de textos y es un subcampo de la inteligencia artificial y la lingüística computacional. Estudia el problema de "comprender" el lenguaje humano natural, con el objetivo de convertir las representaciones del lenguaje humano (como documentos de texto) en representaciones más formales (en forma de datos numéricos y simbólicos) que sean más fáciles de manipular para los programas de computadora. El objetivo de PNL es ir más allá de la manipulación de texto basada en sintaxis (que a menudo se llama "conteo de palabras") a una verdadera comprensión y procesamiento del lenguaje natural que considera las restricciones gramaticales y semánticas, así como el contexto.

La PNL ha recorrido un largo camino desde los días del simple conteo de palabras, pero tiene un camino aún más largo para comprender realmente el lenguaje humano natural. Los siguientes son solo algunos de los desafíos comúnmente asociados con la implementación de PNL:

  • Etiquetado de parte del discurso. Es difícil marcar los términos en un texto como correspondientes a una parte particular del discurso (como sustantivos, verbos, adjetivos o adverbios) porque la parte del discurso depende no solo de la definición del término sino también del contexto dentro que se usa.
  • Segmentación de texto. Algunos idiomas escritos, como el chino, el japonés y el tailandés, no tienen límites de una sola palabra. En estos casos, la tarea de análisis de texto requiere la identificación de límites de palabras, que a menudo es una tarea difícil. Al analizar el lenguaje hablado surgen desafíos similares en la segmentación del habla porque los sonidos que representan letras y palabras sucesivas se mezclan entre sí.
  • Desambiguación del sentido de las palabras. Muchas palabras tienen más de un significado. La selección del significado que tiene más sentido solo se puede lograr teniendo en cuenta el contexto dentro del cual se usa la palabra.

  • Ambigüedad sintáctica. La gramática de los lenguajes naturales es ambigua; es decir, muchas estructuras de oraciones posibles a menudo necesitan ser consideradas. Elegir la estructura más apropiada generalmente requiere una fusión de información semántica y contextual.
  • Entrada imperfecta o irregular. Los acentos extranjeros o regionales y los impedimentos vocales en el habla y los errores tipográficos o gramaticales en los textos hacen que el procesamiento del idioma sea una tarea aún más difícil.
  • Actos de habla. Una oración a menudo puede ser considerada una acción por el hablante. La estructura de la oración por sí sola puede no contener suficiente información para definir esta acción. Por ejemplo, "¿Puedes pasar la clase?" solicita una respuesta simple sí / no, mientras que "¿Puedes pasar la sal?" es una solicitud para que se realice una acción física.

Una importante área del CRM (Gestión de relación con los clientes), en donde NLP está generando un impacto significativo es el análisis de sentimientos. El análisis de sentimientos es una técnica utilizada para detectar opiniones favorables y desfavorables hacia productos y servicios específicos utilizando una gran cantidad de fuentes de datos textuales (comentarios de los clientes en forma de publicaciones en la Web). La PNL se ha aplicado con éxito a una variedad de dominios para una amplia gama de tareas a través de programas informáticos para procesar automáticamente el lenguaje humano natural que anteriormente solo podían hacer los humanos. Las siguientes son algunas de las tareas más populares:

  • Respuesta de preguntas. La tarea de responder automáticamente una pregunta planteada en lenguaje natural; es decir, producir una respuesta en lenguaje humano cuando se le da una pregunta en lenguaje humano. Para encontrar la respuesta a una pregunta, el programa de computadora puede usar una base de datos pre-estructurada o una colección de documentos en lenguaje natural (un corpus de texto como la World Wide Web).

  • Resumen automático. La creación de una versión abreviada de un documento de texto mediante un programa de computadora que contiene los puntos más importantes del documento original.
  • Generación de lenguaje natural. Los sistemas convierten la información de las bases de datos de la computadora en lenguaje humano legible.
  • Comprensión del lenguaje natural. Los sistemas convierten muestras de lenguaje humano en representaciones más formales que son más fáciles de manipular para los programas de computadora.
  • Máquina traductora. La traducción automática de un lenguaje humano a otro.
  • Lectura en lenguas extranjeras. Un programa de computadora que ayuda a un hablante de idiomas no nativos a leer un idioma extranjero con pronunciación y acentos correctos en diferentes partes de las palabras.
  • Escritura en idiomas extranjeros. Un programa de computadora que ayuda a un usuario de un idioma no nativo a escribir en un idioma extranjero.
  • Reconocimiento de voz. Convierte palabras habladas en entradas legibles por máquina. Dado un clip de sonido de una persona que habla, el sistema produce un dictado de texto.
  • Texto a voz. También llamado síntesis de voz, un programa de computadora convierte automáticamente el texto del lenguaje normal en voz humana.
  • Pruebas de texto. Un programa de computadora lee una copia de prueba de un texto para detectar y corregir cualquier error.
  • Reconocimiento óptico de caracteres. La traducción automática de imágenes de texto escrito a mano, mecanografiado o impreso (generalmente capturado por un escáner) en documentos de texto editables por máquina.

Aplicaciones de la minería de texto

A medida que aumenta la cantidad de datos no estructurados recopilados por las organizaciones, también lo hace la propuesta de valor y la popularidad de las herramientas de minería de textos. Muchas organizaciones ahora se están dando cuenta de la importancia de extraer conocimiento de sus repositorios de datos basados en documentos mediante el uso de herramientas de minería de texto. A continuación, se incluye solo un pequeño subconjunto de las categorías de aplicaciones ejemplares de minería de texto.

Aplicaciones de marketing La minería de texto se puede utilizar para aumentar las ventas cruzadas y las ventas ascendentes mediante el análisis de los datos no estructurados generados por los centros de llamadas. El texto generado por las notas del centro de llamadas, así como las transcripciones de las conversaciones de voz con los clientes, pueden analizarse mediante algoritmos de minería de texto para extraer información novedosa y procesable sobre las percepciones de los clientes hacia los productos y servicios de una empresa. Además, los blogs, las reseñas de los usuarios de los productos en sitios web independientes y las publicaciones en el panel de discusión son una mina de oro de los sentimientos de los clientes. Esta rica recopilación de información, una vez analizada adecuadamente, se puede utilizar para aumentar la satisfacción y el valor general de la vida del cliente. La minería de texto se ha vuelto invaluable para la CRM. Las empresas pueden usar la minería de texto para analizar conjuntos completos de datos de texto no estructurados, combinados con los datos estructurados relevantes extraídos de las bases de datos de la organización, para predecir las percepciones de los clientes y el comportamiento de compra posterior.

Aplicaciones de seguridad Una de las aplicaciones de minería de texto más grandes y prominentes en el dominio de seguridad es probablemente el sistema de vigilancia altamente clasificado ECHELON. Según los rumores, se supone que ECHELON es capaz de identificar el contenido de las llamadas telefónicas, faxes, correos electrónicos y otros tipos de datos, interceptando la información enviada a través de satélites, redes telefónicas públicas y enlaces de microondas

Aplicaciones biomédicasLa minería de texto tiene un gran potencial para el campo de la medicina en general y la biomedicina en particular por varias razones. Primero, la literatura publicada y los medios de publicación (especialmente con el advenimiento de las revistas de código abierto) en el campo se están expandiendo a un ritmo exponencial. En segundo lugar, en comparación con la mayoría de los otros campos, la literatura médica está más estandarizada y ordenada, lo que la convierte en una fuente de información más "minable". Finalmente, la terminología utilizada en esta literatura es relativamente constante, con una ontología bastante estandarizada. Lo que sigue son algunos estudios ejemplares donde las técnicas de minería de texto se utilizaron con éxito en la extracción de nuevos patrones de la literatura biomédica.

Las técnicas experimentales como el análisis de microarrays de ADN, el análisis en serie de la expresión génica (SAGE) y la proteómica de espectrometría de masas, entre otros, están generando grandes cantidades de datos relacionados con genes y proteínas. Como en cualquier otro enfoque experimental, es necesario analizar esta gran cantidad de datos en el contexto de información previamente conocida sobre las entidades biológicas en estudio. La literatura es una fuente de información particularmente valiosa para la validación e interpretación de experimentos. Por lo tanto, el desarrollo de herramientas de minería de texto automatizadas para ayudar en dicha interpretación es uno de los principales desafíos en la investigación bioinformática actual.

Proceso de la minería de texto

Para tener éxito, los estudios de minería de textos deben seguir una metodología sólida basada en las mejores prácticas. Se necesita un modelo de proceso estandarizado similar al Proceso estándar entre industrias para la minería de datos (CRISP-DM), que es el estándar de la industria para proyectos de minería de datos. Aunque la mayoría de las partes de CRISP-DM también son aplicables a proyectos de minería de texto, un modelo de proceso específico para la minería de texto incluiría actividades de preprocesamiento de datos mucho más elaboradas. La Figura 2 muestra un diagrama de contexto de alto nivel de un proceso típico de minería de texto. Este diagrama de contexto presenta el alcance del proceso, enfatizando sus interfaces con el entorno más amplio. En esencia, dibuja límites alrededor del proceso específico para identificar explícitamente lo que está incluido (y excluido) del proceso de minería de texto.

Figura 2. Diagrama de contexto para el proceso de minería de texto.

Como indica el diagrama de contexto, la entrada (conexión interna al borde izquierdo de la caja) en el proceso de descubrimiento de conocimiento basado en texto son los datos no estructurados y estructurados recopilados, almacenados y puestos a disposición del proceso. El resultado (extensión externa desde el borde derecho de la caja) del proceso es el conocimiento específico del contexto que se puede utilizar para la toma de decisiones. Los controles, también llamados restricciones (conexión interna al borde superior de la caja), del proceso incluyen limitaciones de software y hardware, problemas de privacidad y las dificultades relacionadas con el procesamiento del texto que se presenta en forma de lenguaje natural. Los mecanismos (conexión interna al borde inferior de la caja) del proceso incluyen técnicas adecuadas, herramientas de software y experiencia en el dominio. El objetivo principal de la minería de texto (dentro del contexto del descubrimiento de conocimiento) es procesar datos no estructurados (textuales) para extraer patrones significativos y procesables para una mejor toma de decisiones. A un nivel muy alto, el proceso de minería de texto se puede dividir en tres tareas consecutivas, cada una de las cuales tiene entradas específicas para generar ciertas salidas (ver Figura 3). Si, por alguna razón, la salida de una tarea no es la esperada, es necesaria una redirección hacia atrás a la ejecución de la tarea anterior.

Figura 3. Proceso de Minería de Texto

Tarea 1: Establecer el corpus El objetivo principal de la primera actividad de la tarea es recopilar todos los documentos relacionados con el contexto (dominio de interés) que se está estudiando. Esta colección puede incluir documentos de texto, archivos XML, correos electrónicos, páginas web y notas breves. Además de los datos textuales fácilmente disponibles, las grabaciones de voz también se pueden transcribir usando algoritmos de reconocimiento de voz y formar parte de la colección de texto. Una vez recopilados, los documentos de texto se transforman y organizan de manera tal que tengan la misma forma de representación (por ejemplo, archivos de texto ASCII) para el procesamiento por computadora. La organización de los documentos puede ser tan simple como una colección de extractos de texto digitalizados almacenados en una carpeta de archivos o puede ser una lista de enlaces a una colección de páginas web en un dominio específico. Muchas herramientas de software de minería de texto disponibles comercialmente podrían aceptarlas como entrada y convertirlas en un archivo plano para su procesamiento. Alternativamente, el archivo plano puede prepararse fuera del software de minería de texto y luego presentarse como la entrada a la aplicación de minería de texto.

Tarea 2: Crear la matriz de términos-documentos (TDM) En esta tarea, los documentos digitalizados y organizados (el corpus) se utilizan para crear la TDM. En la TDM, las filas representan los documentos y las columnas representan los términos. Las relaciones entre los términos y los documentos se caracterizan por índices (es decir, una medida relacional que puede ser tan simple como el número de apariciones del término en los documentos respectivos). La Figura 4 es un ejemplo típico de una TDM. El objetivo es convertir la lista de documentos organizados (el corpus) en un TDM donde las celdas se llenan con los índices más apropiados. La suposición es que la esencia de un documento puede representarse con una lista y frecuencia de los términos utilizados en ese documento. Algunos términos, como artículos, verbos auxiliares y términos utilizados en casi todos los documentos del corpus no tienen poder de diferenciación y, por lo tanto, deben excluirse del proceso de indexación. Esta lista de términos, comúnmente llamados términos de detención o palabras de detención, es específica del dominio de estudio y debe ser identificada por los expertos del dominio.

Figura 4. Ejemplo de una TDM

Tarea 3: Extraer el conocimiento Usando el TDM bien estructurado, y potencialmente aumentado con otros elementos de datos estructurados, se extraen nuevos patrones en el contexto del problema específico que se está abordando. Las categorías principales de métodos de extracción de conocimiento son clasificación, agrupamiento, asociación y análisis de tendencias.

Análisis de sentimientos

Nosotros los humanos somos seres sociales. Somos expertos en utilizar una variedad de medios para comunicarnos. A menudo consultamos foros de discusión financiera antes de tomar una decisión de inversión; pedir a nuestros amigos sus opiniones sobre un restaurante recién inaugurado o una película recién estrenada; y realizamos búsquedas en Internet y leímos reseñas de consumidores e informes de expertos antes de hacer una compra grande como una casa, un automóvil o un electrodoméstico. Confiamos en las opiniones de los demás para tomar mejores decisiones, especialmente en un área donde no tenemos mucho conocimiento o experiencia. Gracias a la creciente disponibilidad y popularidad de los recursos de Internet ricos en opiniones, como los medios de comunicación social (por ejemplo, Twitter, Facebook), sitios de revisión en línea y blogs personales, ahora es más fácil que nunca encontrar opiniones de otros (miles de ellos, de hecho) en todo, desde los últimos dispositivos hasta figuras políticas y públicas. Aunque no todos expresan opiniones a través de Internet, debido principalmente al número y las capacidades de los canales de comunicación social en rápido crecimiento, los números aumentan exponencialmente.

El sentimiento es una palabra difícil de definir. A menudo se vincula o se confunde con otros términos como creencia, vista, opinión y convicción. El sentimiento sugiere una opinión establecida que refleje los sentimientos de uno. El sentimiento tiene algunas propiedades únicas que lo diferencian de otros conceptos. A menudo queremos clasificar el texto por tema, lo que puede implicar tratar con taxonomías completas de temas. La clasificación de sentimientos, por otro lado, generalmente trata con dos clases (positiva versus negativa), un rango de polaridad (por ejemplo, calificaciones de estrellas para películas), o incluso un rango de fuerza de opinión. Estas clases abarcan muchos temas, usuarios y documentos. Aunque tratar con solo unas pocas clases puede parecer una tarea más fácil que el análisis de texto estándar, esto está lejos de ser verdad.

El análisis de sentimientos está tratando de responder la pregunta "¿Qué sienten las personas sobre un tema determinado?" cavando en las opiniones de muchos mediante el uso de una variedad de herramientas automatizadas. Al reunir a investigadores y profesionales en negocios, ciencias de la computación, lingüística computacional, minería de datos, minería de textos, psicología e incluso sociología, el análisis de sentimientos tiene como objetivo expandir el análisis de texto tradicional basado en hechos a nuevas fronteras, para dar cuenta de la opinión. Sistemas de información orientados. En un entorno empresarial, especialmente en marketing y CRM, el análisis de sentimientos busca detectar opiniones favorables y desfavorables hacia productos y/o servicios específicos utilizando grandes cantidades de fuentes de datos textuales (comentarios de los clientes en forma de publicaciones en la web, tweets, blogs, etc.)

Proceso del análisis de sentimientosDebido a la complejidad del problema (conceptos subyacentes, expresiones en el texto, contexto en el que se expresa el texto, etc.), no existe un proceso estandarizado fácilmente disponible para llevar a cabo el análisis de sentimientos. Sin embargo, según el trabajo publicado en el campo del análisis de sensibilidad hasta ahora (tanto en los métodos de investigación como en el rango de aplicaciones), un proceso lógico simple de varios pasos, como se muestra en la Figura 5, parece ser una metodología apropiada para el análisis de sentimientos. Estos pasos lógicos son iterativos (es decir, la retroalimentación, las correcciones y las iteraciones son parte del proceso de descubrimiento) y de naturaleza experimental, y una vez completados y combinados, son capaces de producir la percepción deseada sobre las opiniones en la colección de texto.

Figura 5. Proceso del análisis de sentimientos

PASO 1: DETECCIÓN DEL ENTIDAD Después de la recuperación y preparación de los documentos de texto, la primera tarea principal en el análisis de sensibilidad es la detección de la objetividad. Aquí el objetivo es diferenciar entre un hecho y una opinión, que puede considerarse como una clasificación de texto como objetivo o subjetivo. Esto también se puede caracterizar como el cálculo de la polaridad O – S (objetividad - polaridad de subjetividad, que se puede representar con un valor numérico que varía de 0 a 1). Si el valor de objetividad es cercano a 1, entonces no hay ninguna opinión que explotar (es decir, es un hecho); por lo tanto, el proceso retrocede y toma los siguientes datos de texto para analizar. Por lo general, la detección de opinión se basa en el examen de adjetivos en el texto. Por ejemplo, la polaridad de "qué maravilloso trabajo" se puede determinar con relativa facilidad mirando el adjetivo.

PASO 2: CLASIFICACIÓN DE POLARIDAD N – P La segunda tarea principal es la clasificación de polaridad. Dado un texto de opinión, el objetivo es clasificar la opinión como si estuviera dentro de una de las dos polaridades de sentimiento opuestas, o ubicar su posición en el continuo entre estas dos polaridades. Cuando se ve como una característica binaria, la clasificación de polaridad es la tarea de clasificación binaria de etiquetar un documento con opiniones como una opinión positiva o negativa general (por ejemplo, pulgares arriba o pulgares abajo). Además de la identificación de la polaridad N – P, uno también debería estar interesado en identificar la fuerza del sentimiento (en lugar de solo positivo, puede expresarse como levemente, moderadamente, fuertemente o muy fuertemente positivo). La mayor parte de esta investigación se realiza en reseñas de productos o películas donde las definiciones de "positivo" y "negativo" son bastante claras. Otras tareas, como clasificar las noticias como "buenas" o "malas", presentan algunas dificultades.

Por ejemplo, un artículo puede contener noticias negativas sin usar explícitamente palabras o términos subjetivos. Además, estas clases generalmente aparecen entremezcladas cuando un documento expresa sentimientos positivos y negativos. Entonces la tarea puede ser identificar el sentimiento principal (o dominante) del documento. Aun así, para textos largos, las tareas de clasificación pueden necesitar realizarse en varios niveles: término, frase, oración y quizás a nivel de documento. Para aquellos, es común usar las salidas de un nivel como entradas para la siguiente capa superior.

PASO 3: IDENTIFICACIÓN DEL OBJETIVO El objetivo de este paso es identificar con precisión el objetivo del sentimiento expresado (por ejemplo, una persona, un producto, un evento). La dificultad de esta tarea depende en gran medida del dominio del análisis. Aunque generalmente es fácil identificar con precisión el objetivo para las revisiones de productos o películas porque la revisión está directamente conectada al objetivo, puede ser bastante difícil en otros dominios. Por ejemplo, los textos largos y de propósito general, como las páginas web, los artículos de noticias y los blogs, no siempre tienen un tema predefinido al que están asignados, y a menudo mencionan muchos objetos, cualquiera de los cuales puede deducirse como el objetivo. A veces hay más de un objetivo en una oración de sentimiento, como es el caso en textos comparativos. Una oración comparativa subjetiva ordena los objetos en orden de preferencias, por ejemplo, "Esta computadora portátil es mejor que mi PC de escritorio". Estas oraciones se pueden identificar usando adjetivos y adverbios comparativos (más, menos, mejor, más largo), adjetivos superlativos (más, menos, mejor) y otras palabras (como igual, diferir, ganar, preferir). Una vez que se han recuperado las oraciones, los objetos se pueden poner en un orden que sea más representativo de sus méritos, como se describe en el texto.

PASO 4: COLECCIÓN Y AGREGACIÓN Una vez que se identifican y calculan los sentimientos de todos los puntos de datos de texto en el documento, en este paso se agregan y se convierten en una sola medida de sentimiento para todo el documento. Esta agregación puede ser tan simple como resumir las polaridades y las fortalezas de todos los textos, o tan compleja como usar las técnicas de agregación semántica de la PNL para obtener el sentimiento final.

Minería web

Internet ha cambiado el panorama para hacer negocios para siempre. Debido al mundo altamente conectado, plano y al campo de competencia ampliado, las empresas de hoy en día enfrentan cada vez más oportunidades (poder llegar a clientes y mercados que tal vez nunca pensaron que eran posibles) y desafíos más grandes (un mercado competitivo globalizado y en constante cambio). Los que tienen la visión y las capacidades para lidiar con un entorno tan volátil se benefician enormemente de él, mientras que otros que se resisten a adaptarse tienen dificultades para sobrevivir. Tener una presencia comprometida en Internet ya no es una opción; es un requisito comercial. Los clientes esperan que las compañías ofrezcan sus productos y/o servicios a través de Internet. No solo compran productos y servicios, sino que también hablan sobre compañías y comparten sus experiencias transaccionales y de uso con otros a través de Internet.

El crecimiento de Internet y sus tecnologías habilitadoras ha facilitado la creación de datos, la recopilación de datos y el intercambio de datos/información/opiniones. Los retrasos en el servicio, la fabricación, el envío, la entrega y las consultas de los clientes ya no son incidentes privados y se aceptan como males necesarios. Ahora, gracias a las herramientas y tecnologías de redes sociales en Internet, todo el mundo lo sabe todo. Las empresas exitosas son las que adoptan estas tecnologías de Internet y las utilizan para mejorar sus procesos comerciales, de modo que puedan comunicarse mejor con sus clientes, comprender sus necesidades y deseos, y atenderlos de manera exhaustiva y expedita. Centrarse en el cliente y mantener contentos a los clientes nunca ha sido un concepto tan importante para las empresas como lo son ahora, en esta era de Internet y las redes sociales.

Debido a su gran tamaño y complejidad, la minería de la Web no es una tarea fácil de ninguna manera. La Web también plantea grandes desafíos para el descubrimiento de conocimiento efectivo y eficiente:

  • La Web es demasiado grande para una minería de datos efectiva. La Web es tan grande y crece tan rápido que es difícil incluso cuantificar su tamaño. Debido al gran tamaño de la Web, no es factible configurar un almacén de datos para replicar, almacenar e integrar todos los datos en la Web, lo que hace que la recopilación e integración de datos sea un desafío.
  • La web es demasiado compleja. La complejidad de una página web es mucho mayor que la de una página en una colección de documentos de texto tradicional. Las páginas web carecen de una estructura unificada. Contienen mucho más estilo de autor y variación de contenido que cualquier conjunto de libros, artículos u otro documento tradicional basado en texto.
  • La web es demasiado dinámica. La Web es una fuente de información altamente dinámica. La Web no solo crece rápidamente, sino que también su contenido se actualiza constantemente. Blogs, noticias, resultados del mercado de valores, informes meteorológicos, resultados deportivos, precios, anuncios de empresas y muchos otros tipos de información se actualizan regularmente en la Web.

  • La web no es específica de un dominio. La Web sirve a una amplia diversidad de comunidades y conecta miles de millones de estaciones de trabajo. Los usuarios de la web tienen antecedentes, intereses y propósitos de uso muy diferentes. La mayoría de los usuarios pueden no tener un buen conocimiento de la estructura de la red de información y pueden no ser conscientes del alto costo de una búsqueda particular que realizan.
  • La web lo tiene todo. Solo una pequeña porción de la información en la Web es verdaderamente relevante o útil para alguien (o alguna tarea). Se dice que el 99% de la información en la Web es inútil para el 99% de los usuarios de la Web. Aunque esto puede no parecer obvio, es cierto que una persona en particular generalmente está interesada en solo una pequeña porción de la Web, mientras que el resto de la Web contiene información que no es interesante para el usuario y puede afectar los resultados deseados. Encontrar la parte de la Web que es verdaderamente relevante para una persona y la tarea que se realiza es un tema destacado en la investigación relacionada con la Web.

Estos desafíos han provocado muchos esfuerzos de investigación para mejorar la eficacia y la eficiencia del descubrimiento y el uso de activos de datos en la Web. Varios motores de búsqueda web basados en índices buscan constantemente en la web e indexan páginas web bajo ciertas palabras clave. Al utilizar estos motores de búsqueda, un usuario experimentado puede localizar documentos al proporcionar un conjunto de palabras clave o frases muy limitadas. Sin embargo, un motor de búsqueda simple basado en palabras clave sufre de varias deficiencias. Primero, un tema de cualquier amplitud puede contener fácilmente cientos o miles de documentos. Esto puede conducir a una gran cantidad de entradas de documentos devueltas por el motor de búsqueda, muchas de las cuales son marginalmente relevantes para el tema. Segundo, muchos documentos que son altamente relevantes para un tema pueden no contener las palabras clave exactas que los definen.

La minería web (o minería de datos web) es el proceso de descubrir relaciones intrínsecas (es decir, información interesante y útil) a partir de datos web, que se expresan en forma de información textual, de enlace o de uso. El término minería web fue utilizado por primera vez por Etzioni (1996); Hoy en día, muchas conferencias, revistas y libros se centran en la minería de datos web. Es un área de tecnología y práctica empresarial en constante evolución. La minería web es esencialmente lo mismo que la minería de datos que utiliza datos generados a través de la Web. El objetivo es convertir vastos depósitos de transacciones comerciales, interacciones con los clientes y datos de uso del sitio web en información procesable (es decir, conocimiento) para promover una mejor toma de decisiones en toda la empresa. Debido a la creciente popularidad del término analítica, hoy en día muchos han comenzado a referirse a la minería web como analítica web. Sin embargo, estos dos términos no son lo mismo. Mientras que el análisis web se centra en los datos de uso del sitio web, la minería web incluye todos los datos generados a través de Internet, incluidos los datos de transacciones, sociales y de uso.

Cuando la analítica web tiene como objetivo describir lo que sucedió en el sitio web (empleando una metodología analítica descriptiva predefinida basada en métricas), la minería web tiene como objetivo descubrir patrones y relaciones previamente desconocidos (empleando una nueva metodología analítica predictiva o prescriptiva). Desde una perspectiva general, el análisis web puede considerarse parte de la minería web. La Figura 6 presenta una taxonomía simple de minería web, donde se divide en tres áreas principales: minería de contenido web, minería de estructura web y minería de uso web. En la figura, también se especifican las fuentes de datos utilizadas en estas tres áreas principales.

Figura 6. Taxonomía de la Minería Web

Analítica social

La analítica social puede significar cosas diferentes para diferentes personas, según su visión del mundo y su campo de estudio. Nuestra definición de analítica social es algo diferente; en lugar de centrarnos en la parte "social" (como se hace en su definición filosófica), estamos más interesados en la parte "analítica" del término. Gartner (una empresa de consultoría global de TI muy conocida) definió la analítica social como "monitoreo, análisis, medición e interpretación de interacciones digitales y relaciones de personas, temas, ideas y contenido". El análisis social incluye extraer el contenido textual creado en las redes sociales (p. Ej., Análisis de opinión, PNL) y analizar redes socialmente establecidas (p. Ej., Identificación de influencia, perfil, predicción) con el fin de obtener información sobre los comportamientos actuales y futuros de los clientes existentes y potenciales, y sobre los gustos y disgustos hacia los productos y servicios de una empresa. Según esta definición y las prácticas actuales, el análisis social puede clasificarse en dos ramas diferentes, pero no necesariamente mutuamente excluyentes: análisis de redes sociales (SNA) y análisis de medios sociales.

Análisis de redes sociales (SNA) Una red social es una estructura social compuesta de individuos/personas (o grupos de individuos u organizaciones) vinculados entre sí con algún tipo de conexiones/relaciones. La perspectiva de la red social proporciona un enfoque holístico para analizar la estructura y la dinámica de las entidades sociales. El estudio de estas estructuras utiliza SNA para identificar patrones locales y globales, localizar entidades influyentes y examinar dinámicas de red. Las redes sociales y su análisis es esencialmente un campo interdisciplinario que surgió de la psicología social, la sociología, la estadística y la teoría de grafos.

Una red social es una construcción teórica útil en las ciencias sociales para estudiar las relaciones entre individuos, grupos, organizaciones o incluso sociedades enteras (unidades sociales). El término se usa para describir una estructura social determinada por tales interacciones. Los lazos a través de los cuales se conecta una unidad social dada representan la convergencia de los diversos contactos sociales de esa unidad. En general, las redes sociales son auto organizadas, emergentes y complejas, de modo que aparece un patrón globalmente coherente a partir de la interacción local de los elementos (individuos y grupos de individuos) que componen el sistema.

Analítica de medios sociales Los medios sociales se refieren a las tecnologías habilitadoras de interacciones sociales entre las personas en las que crean, comparten e intercambian información, ideas y opiniones en comunidades y redes virtuales. Es un grupo de aplicaciones de software basadas en Internet que se basan en los fundamentos ideológicos y tecnológicos de la Web 2.0 y que permiten la creación e intercambio de contenido generado por el usuario. Los medios sociales dependen de las tecnologías móviles y otras tecnologías basadas en la Web para crear plataformas altamente interactivas para que individuos y comunidades compartan, co-crean, discutan y modifiquen el contenido generado por el usuario. Introduce cambios sustanciales en la comunicación entre organizaciones, comunidades e individuos.