off-the-shelf datasets, dataset provider logo

fr

28

250 000 questions de finance – banque de données

Ce corpus se concentre sur le domaine financier, couvrant des sous-thèmes tels que les produits, les marchés, les comportements et les principes fondamentaux. Il comprend un total de 250 000 questions, réparties équitablement entre les QCM et les questions ouvertes (125 000 chacune). Stockées au format JSONL, ces données offrent une ressource riche et structurée pour la recherche académique, la formation spécialisée et le développement de compétences en finance.
Finance questions d'examen sélection questions-réponses

1,5 million de questions de test coréennes, traitées de manière structurée

Données de questions de test coréennes traitées de manière structurée, environ 1,5 million de questions. Chaque question contient le type de question, la question, la réponse, l'analyse, etc. Matières : école primaire (langue nationale, maths, anglais, sciences sociales, sciences naturelles), collège, lycée (différentes matières). Types de questions : choix multiple, remplissage, vrai/faux, réponse libre. Utilisable pour l'enrichissement des connaissances des LLM.
Questions K12 texte LLM coréen

50 000 ensembles de données d’édition d’images

50 000 ensembles de données d’édition d’images, incluant la suppression, l’ajout, la modification et le remplacement d’objets. Les cibles concernent des personnes, animaux, produits, végétaux et paysages. Chaque modification est accompagnée d’une annotation précise : détourage, suppression, insertion ou remplacement. Ce corpus est adapté à la synthèse d’images, à l’enrichissement des données et à la génération de scènes virtuelles.
Édition d’images

32 millions de questions en sciences et ingénierie — structuration et traitement textuel

Ce jeu de données comprend 32 millions de questions en mathématiques, physique, chimie et biologie, du niveau primaire à universitaire. Chaque question est annotée avec : énoncé, réponse, explication, type, matière et niveau. Cette ressource offre un socle massif pour l’enrichissement des compétences STEM des grands modèles.
Questions de sciences LLM texte

1 million de textes de problèmes de programmation chinois, traités de manière structurée

Données textuelles de problèmes de programmation chinois traitées de manière structurée. Langues : C, C++, Python, Java, JavaScript. Chaque problème contient la question, la réponse, l'analyse, le champ de langue. Aide les modèles à développer des compétences en programmation.
Questions de programmation LLM texte

100 000 ensembles de données textuelles pour le réglage fin par instruction de grands modèles linguistiques en anglais

L'ensembles de données textuelles pour le réglage fin par instruction de grands modèles linguistiques en anglais, les ressources d'entraînement spécialement conçues pour l'optimisation des modèles d'IA, améliorent considérablement la compréhension et la capacité d'exécution des instructions du modèle, et sont revérifiés par des experts linguistiques et des ingénieurs en IA, répondant parfaitement aux besoins de réglage fin des modèles pré-entraînés courants.
Ensemble de données de réglage fin LLM réglage fin supervisé Ensemble de données SFT données de réglage des instructions en anglais données LLM du domaine général réglage fin du modèle d'IA données d'entraînement de suivi des instructions ensemble de données de réglage GPT

25 000 vidéos de personnes avec différents styles

Ce corpus rassemble des vidéos de 25 000 individus filmés dans une grande variété de styles et de contextes. Il couvre un large éventail de carnations (blanche, jaune, brune, noire) et de tranches d’âge (jeunes adultes, adultes, seniors). Chaque séquence dure au moins 10 secondes avec une résolution minimale de 1920×1080 pixels. Ce jeu de données est idéal pour la génération vidéo cohérente de personnages et la synthèse de doubles numériques.
Vidéos centrées sur les personnes humain numérique génération de vidéos

Données de casse-tête de devinage

Les données de casse-tête de devinage, y compris plus de 100 000 données de devinage et plus de 3 000 données de casse-tête, peuvent être utilisées dans de multiples scénarios d'application tels que l'entraînement de grands modèles et les assistants de téléphonie mobile.
Énigmes Casse-tête

20 011 images OCR de scènes naturelles – description textuelle

Ce jeu de données contient 20 011 images issues de scènes naturelles comportant du texte dans 14 langues appartenant aux familles linguistiques asiatiques et européennes. Les images ont été prises dans des contextes réels tels que des enseignes de magasin, panneaux d’information, affiches publicitaires ou signalétiques routières, sous divers angles de prise de vue. Les descriptions en anglais précisent la disposition du texte, son contenu sémantique ainsi que les caractéristiques visuelles comme la couleur.
AIGC légende en anglais légende OCR données OCR multilingues données OCR ensemble de données OCR

loading

d20509bf-d34d-44ec-a8e3-d2a0e364f469