Explore la désambiguïsation des entités, reliant le texte aux bases de connaissances et la prédiction de liens dans les graphiques de connaissances avec des exemples de Wikipedia.
Souligne l'importance des incompatibilités pour prévenir les conflits d'intérêts et maintenir la démocratie, en prônant une loi constitutionnelle en la matière.
Explore les archives historiques des journaux grâce à la qualité de l'OCR, aux entités nommées, à la modélisation des sujets et à l'analyse de la réutilisation du texte.
Explore le modèle Vector Space, le sac de mots, tf-idf, cosine similarité, Okapi BM25, et la précision et le rappel dans la récupération d'information.
Explore les complexités de la numérisation des documents urbains historiques et souligne l'importance de relier l'information pour une analyse complète.
Explore la recherche de documents, la classification, l'analyse des sentiments, les matrices TF-IDF, les méthodes de voisinage les plus proches, la factorisation matricielle, la régularisation, LDA, les vecteurs de mots contextualisés et BERT.
Explore la désambiguïsation des entités, reliant les mentions de texte à une base de connaissances, la cohérence dans les graphes d'entités et le PageRank personnalisé.
Introduit le traitement du langage naturel (NLP) et ses applications, couvrant la tokenisation, l'apprentissage automatique, l'analyse du sentiment et les applications NLP suisses.
Couvre les fondamentaux et les algorithmes du classement basé sur les liens, y compris l'indexation de texte d'ancrage, PageRank, HITS, et les implémentations pratiques.