Dataset:Embedding Data/Specter

term_id: datasetembedding_dataspecter

Category: training_techniques

Definition

Der Specter-Datensatz wird aus einer umfangreichen Sammlung von Informatik-Publikationen konstruiert und nutzt Zitationsnetzwerke, um überwachtes Lernen zu ermöglichen. Er paart Abstracts mit den sie zitierenden Papers, um

Summary

Ein groß angelegter Datensatz, der auf Veröffentlichungen und Zitaten aus dem Bereich der Informatik basiert und speziell für das Training von Embedding-Modellen für wissenschaftliche Arbeiten konzipiert ist.

Key Concepts

  • Zitationsnetzwerke
  • Akademisches NLP
  • Überwachte Embeddings
  • Ähnlichkeit von Paper

Use Cases

  • Empfehlung von Forschungsarbeiten
  • Automatisierte Zitationsanalyse
  • Suche in wissenschaftlicher Literatur