NE3L named entities Russian corpus
View resource name in all available languages
Corpus russe d’entités nommées NE3L
ID:
ELRA-W0080
The NE3L project (Named Entities 3 Languages) consisted in annotating several corpora with different languages with named entities. Text format data were extracted from newspapers and deal with various topics. 3 different languages were annotated: Arabic, Chinese and Russian.
For this project, 5 named entity categories were taken into account: Person, Place, Organisation, Time and Amount. Each language was concerned only by a subset of these categories, i.e. Arabic was marked up with Time and Amount tags, as well as Russian, whereas Chinese was marked up with Person, Place and Organisation tags.
The Russian corpus contains 75,784 words coming from articles extracted from “Izvestia” newspaper, and published in 1995.
View resource description in all available languages
Le projet NE3L (Named Entities 3 Langues) consiste à annoter plusieurs corpus de langues différentes en entités nommées. Les données, au format texte, sont extraites de journaux écrits, et traitent de sujets variés. 3 langues différentes ont été annotées : l'Arabe, le Chinois et le Russe.
Pour ce projet, 5 catégories d'entités nommées ont été prises en compte : Personne, Lieu, Organisation, Temps et Quantité. Chaque langue traitée n'est concernée que par une partie de ces catégories, ainsi: l'Arabe ne prend en compte que les balises Temps et Quantité, de même pour le Russe, et le Chinois est concerné par les balises Personne, Lieu et Organisation.
Le corpus russe contient 75,784 mots provenant d’articles tirés du journal « Izvestia », parus en 1995.
People who looked at this resource also viewed the following: