1/17
Flashcards de vocabulario para repasar los conceptos fundamentales sobre el etiquetado morfosintáctico (POS tagging), modelos HMM, algoritmo de Viterbi y reconocimiento de entidades nombradas (NER).
Name | Mastery | Learn | Test | Matching | Spaced | Call with Kai | Chat |
|---|
No analytics yet
Send a link to your students to track their progress
Morfosintaxis
Parte de la gramática que integra la morfología (estudio de la estructura de las palabras) y la sintaxis (estudio del modo en que se combinan las palabras).
Categorías morfosintácticas
También llamadas categorías gramaticales o part-of-speech (POS) en inglés, proporcionan una clasificación de las palabras de una oración según su tipo.
Etiquetado morfosintáctico (POS tagging)
Proceso para identificar las diferentes partes de la oración asignando una etiqueta (tag) sobre la categoría gramatical a cada una de las palabras de un texto de entrada.
Penn Treebank
Conjunto de 45 etiquetas que identifican las diferentes partes de la oración, utilizado habitualmente por los algoritmos de procesamiento del lenguaje natural en inglés.
Desambiguación
Proceso mediante el cual una palabra ambigua, que puede pertenecer a más de una categoría gramatical, es etiquetada correctamente según el contexto de la frase analizada.
Token
Cadena de caracteres que representa una palabra. Su obtención se realiza en la fase previa de preprocesado antes del etiquetado morfosintáctico.
Modelo Oculto de Markov (HMM)
Modelo estadístico representable como una máquina de estados finitos con transiciones probabilísticas, utilizado para determinar la secuencia de etiquetas gramaticales más probable.
Algoritmo de decodificación de Viterbi
Algoritmo utilizado en HMM para estimar probabilidades y encontrar la secuencia óptima de etiquetas (tags) mediante la creación de una matriz de probabilidades y el trazado de la ruta inversa.
Probabilidad de transición (en HMM)
Probabilidad de una etiqueta dada la etiqueta anterior. Se calcula dividiendo el recuento de veces que aparece la primera etiqueta seguida por la segunda entre la frecuencia de la primera etiqueta.
Probabilidad de emisión (en HMM)
Probabilidad de que, dada una etiqueta determinada, esta se asocie con una palabra concreta.
Corpus WSJ
Colección de un millón de palabras publicadas en los artículos del Wall Street Journal en 1989, anotadas con las etiquetas morfosintácticas del Penn Treebank.
Named Entity Recognition (NER)
Tarea que consiste en identificar, de entre los distintos sustantivos de un texto, a qué tipo de entidad nombrada hacen referencia (como personas, organizaciones o ubicaciones).
Categoría PER (en NER)
Etiqueta de entidad nombrada utilizada para identificar personas o nombres propios de individuos.
Categoría GPE (en NER)
Etiqueta de entidad nombrada utilizada para identificar países, ciudades o estados.
Categoría LOC (en NER)
Etiqueta de entidad nombrada utilizada para identificar ubicaciones concretas.
Categoría ORG (en NER)
Etiqueta de entidad nombrada utilizada para identificar organizaciones o empresas.
Conditional Random Field (CRF)
Algoritmo estadístico popular utilizado para llevar a cabo tareas de etiquetado morfosintáctico (POS tagging).
Algoritmo de Brill
Método de etiquetado morfosintáctico basado en la generación de reglas.