off-the-shelf datasets, dataset provider logo

fr

26

5,31 millions de paires de corpus parallèles chinois-allemand

Ce vaste corpus multilingue sino-allemand contient 5,14 millions de paires de phrases couvrant divers domaines : tourisme, santé, quotidien, actualités, etc. Les données ont été nettoyées, désensibilisées et vérifiées, offrant une ressource fiable pour la traduction automatique et l’analyse de textes multilingues.
Données de corpus parallèle chinois-allemand Corpus parallèle chinois-allemand Données de corpus parallèle Données de corpus aligné

84 516 phrases en anglais – annotées pour l’intention – en scénario interactif

Ce corpus d’identification d’intentions en anglais contient 84 516 énoncés annotés avec types d’intention, slots et valeurs correspondantes. Il couvre des domaines variés : musique, météo, dates, agendas, domotique, etc. Idéal pour la recherche en compréhension d’intention et les systèmes de dialogue intelligents.
données d’annotation d’intention en anglais Données d’annotation d’intention interactive Reconnaissance d’intention Données de reconnaissance d’intention en PNL Données NLU (compréhension du langage naturel)

1,08 million de paires de corpus parallèles anglais-russe

Ce corpus comprend 1,08 million de paires de segments anglais-russe, soigneusement filtrés pour exclure tout contenu sensible (politique, obscène, personnel). Il fournit une base linguistique propre et structurée, idéale pour les recherches en traduction automatique et en traitement de corpus textuels.
Données de corpus parallèle anglais-russe Collection de corpus anglais-russe Corpus parallèle anglais-russe Données de corpus parallèle Données de corpus aligné

1,34 million de données de corpus parallèles anglais-coréen

1,34 million de paires de textes parallèles anglais-coréen ; exclusion des termes sensibles. Utilisable comme corpus de base pour la traduction automatique, etc.
Corpus parallèles anglais et coréen collection de corpus anglais et coréen corpus d'alignement Corpus parallèles Corpus d'alignement

380 000 données de corpus parallèles japonais-anglais

380 000 paires de textes parallèles japonais-anglais ; exclusion des termes sensibles (politique, pornographie, données personnelles). Utilisable comme corpus de base pour la traduction automatique, etc.
Corpus parallèles japonais et anglais collection de corpus parallèles japonais et anglais corpus d'alignement Corpus parallèles Corpus d'alignement

47 811 données d'annotation d'intention de phrases uniques en scènes interactives

Données d'annotation d'intention de phrases uniques pour scènes interactives, 47 811 phrases. Annotation des intentions, des slots, des valeurs de slot. Intentions : musique, météo, date, planification, appareils ménagers, etc. Utilisable pour la reconnaissance d'intention.
Données d'annotation d'intention données d'annotation d'intention interactive reconnaissance d'intention données de reconnaissance d'intention NLP données NLU

80 120 000 paires de corpus parallèles sino-anglais

Corpus de traduction parallèle sino-anglais, le format de stockage de données est un document TXT, couvrant le tourisme, la médecine, la vie quotidienne, les séries télévisées et d'autres domaines. Il a été nettoyé, désensibilisé et inspecté, et peut être utilisé comme corpus de base pour l'analyse de données de texte dans la Traduction automatique et dans d'autres domaines.
Données de corpus parallèles sino-anglais Alignement sino-anglais Corpus

1,99 million de paires de corpus parallèles chinois-tchèque

Ce vaste corpus bilingue sino-tchèque contient 1,99 million de paires de phrases en chinois et en tchèque, stockées au format texte (.txt). Les données ont été nettoyées, désensibilisées et vérifiées, offrant une ressource fiable pour la traduction automatique et l’analyse de textes multilingues.
Corpus parallèle chinois-tchèque corpus aligné données de corpus parallèle données de corpus align

850 000 paires de corpus parallèles anglais-japonais

Ce vaste corpus bilingue anglais-japonais contient 850 000 paires de phrases couvrant divers domaines : tourisme, santé, quotidien, actualités, etc. Les données ont été nettoyées, désensibilisées et vérifiées, offrant une ressource fiable pour la traduction automatique et l’analyse de textes multilingues.
Données de corpus parallèle anglais-japonais corpus parallèle anglais-japonais données de corpus parallèle données de corpus aligné

loading

fe615e6d-f848-4edb-bfb5-0c8267c213eb