全部/科技/Trending 数据集

Hugging Face · Trending 数据集

HISTORY近 30 天历史柱高表示当天去重热搜数量
600760085109
09/10—10/09 有历史数据
  • 01128
    datasocial/tiktok-5.6B-videos
    size_categories:1B<n<10B, format:parquet, modality:tabular, modality:text, library:datasets, library:dask, library:polars, library:mlcroissant, region:usdatasocial
  • 02105
    XiaomiMiMo/MiMo-V2.6-RL-oss
    size_categories:1K<n<10K, format:parquet, modality:document, modality:image, modality:text, library:datasets, library:pandas, library:polars, library:mlcroissantXiaomiMiMo
  • 0353
    nisten/opus5-5-doctor-patient-conversations-all-human-diseases
    task_categories:question-answering, task_categories:text-generation, language:en, size_categories:1K<n<10K, region:us, medical, healthcare, clinical, syntheticnisten
  • 0448
    espnet/yodas3
    task_categories:audio-to-audio, task_categories:automatic-speech-recognition, task_categories:text-to-speech, task_categories:translation, size_categories:1M<n<10M, format:parquet, modality:audio, modality:tabular, modality:textespnet
  • 0546
    LightwheelAI/EgoStandard
    task_categories:video-classification, language:en, size_categories:10K<n<100K, modality:video, region:us, video, egocentric-video, embodied-ai, human-demonstrationLightwheelAI
  • 0645
    secemp9/arxiv-complete
    task_categories:text-generation, task_categories:text-retrieval, language:en, size_categories:100M<n<1B, format:parquet, modality:tabular, modality:text, library:datasets, library:dasksecemp9
  • 0741
    ankitjh4/bharat-government-documents
    task_categories:question-answering, task_categories:text-retrieval, multilinguality:multilingual, size_categories:10K<n<100K, format:parquet, modality:text, library:datasets, library:dask, library:polarsankitjh4
  • 0839
    aidigestorg/ai-village
    language:en, size_categories:1M<n<10M, region:us, agents, llm-agents, computer-use, ai-safety, agentic-behavioraidigestorg
  • 0938
    bakrianoo/jabarti-llm-dataset
    task_categories:text-generation, task_categories:question-answering, language:ar, language:en, size_categories:1M<n<10M, format:parquet, modality:tabular, modality:text, library:datasetsbakrianoo
  • 1037
    witfoo/precinct6-cybersecurity
    task_categories:text-classification, task_categories:graph-ml, language:en, size_categories:1M<n<10M, region:us, cybersecurity, intrusion-detection, provenance-graphs, MITRE-ATT&CKwitfoo
  • 1133
    MoreThought/Fable-5.1-Max-Reasoning-Filtered-10000x
    task_categories:text-generation, task_categories:question-answering, language:en, size_categories:10K<n<100K, format:json, library:datasets, library:pandas, library:polars, library:mlcroissantMoreThought
  • 1229
    LocalLLaMA/typed-decisions
    benchmark:official, benchmark:eval-yaml, task_categories:text-classification, language:en, size_categories:1K<n<10K, format:parquet, modality:tabular, modality:text, library:datasetsLocalLLaMA
  • 1326
    venvoo/china-a-share-l2-level2-limit-order-book-tick-data
    size_categories:n>1T, region:us, finance, trading, stock-market, china, a-share, level-2, limit-order-bookvenvoo
  • 1425
    Anthropic/hh-rlhf
    size_categories:100K<n<1M, format:json, modality:text, library:datasets, library:dask, library:polars, library:mlcroissant, arxiv:2204.05862, region:usAnthropic
  • 1525
    openbmb/UltraData-SFT-Agent-2609
    task_categories:text-generation, task_categories:question-answering, language:en, language:zh, size_categories:100K<n<1M, format:json, modality:text, library:datasets, library:daskopenbmb
  • 1624
    ZefanCai/Open-Jev
    task_categories:text-classification, language:en, language:zh, language:tr, size_categories:100K<n<1M, format:parquet, modality:text, library:datasets, library:pandasZefanCai
  • 1723
    docling-project/DeskForge-1M
    task_categories:image-to-text, task_categories:object-detection, language:en, size_categories:1M<n<10M, library:webdataset, arxiv:2610.02320, region:us, gui, gui-groundingdocling-project
  • 1822
    wikimedia/wikipedia
    task_categories:text-generation, task_categories:fill-mask, task_ids:language-modeling, task_ids:masked-language-modeling, language:ab, language:ace, language:ady, language:af, language:alt, language:amwikimedia
  • 1922
    genrobot2025/Gen-HumanEgo
    task_categories:robotics, language:en, size_categories:n>1T, region:us, embodied-ai, robotics, egocentric, hand-tracking, trajectorygenrobot2025
  • 2021
    OpenDataArena/Spark-234K
    task_categories:text-generation, annotations_creators:machine-generated, language_creators:machine-generated, multilinguality:monolingual, language:en, size_categories:100K<n<1M, format:parquet, modality:text, library:datasetsOpenDataArena
  • 2120
    Zaevlad/audit-findings-dataset
    task_categories:text-classification, task_categories:text-generation, language:en, size_categories:10K<n<100K, region:us, security, smart-contracts, code-audit, vulnerabilityZaevlad
  • 2219
    LightwheelAI/EgoPro
    task_categories:video-classification, language:en, size_categories:10K<n<100K, modality:video, region:us, video, egocentric-video, embodied-ai, human-demonstrationLightwheelAI
  • 2318
    LightwheelAI/EgoDemo
    task_categories:video-classification, language:en, size_categories:1K<n<10K, modality:video, region:us, video, egocentric-video, embodied-ai, human-demonstrationLightwheelAI
  • 2417
    FineEnvs/SmolDataEnvs
    task_categories:question-answering, task_categories:table-question-answering, size_categories:1K<n<10K, format:parquet, modality:tabular, modality:text, library:datasets, library:pandas, library:polarsFineEnvs
  • 2517
    harvardMadsys/freeinference_agentic_trace
    size_categories:1M<n<10M, format:parquet, modality:tabular, modality:text, library:datasets, library:pandas, library:polars, library:mlcroissant, region:usharvardMadsys
  • 2616
    ILSVRC/imagenet-1k
    task_categories:image-classification, task_ids:multi-class-image-classification, annotations_creators:crowdsourced, language_creators:crowdsourced, multilinguality:monolingual, source_datasets:original, language:en, size_categories:1M<n<10M, format:parquetILSVRC
  • 2716
    Cirquar-Tech/wm_imagined
    region:usCirquar-Tech
  • 2816
    MaziyarPanahi/AgentToolDecisions-180K
    task_categories:text-classification, task_categories:text-ranking, language:en, size_categories:100K<n<1M, format:parquet, modality:tabular, modality:text, library:datasets, library:daskMaziyarPanahi
  • 2916
    cloud0day3/alania-synthetic-speech-tr
    task_categories:text-to-speech, task_categories:automatic-speech-recognition, language:tr, size_categories:1M<n<10M, format:parquet, modality:audio, modality:text, library:datasets, library:daskcloud0day3
  • 3015
    malcolmrey/various
    size_categories:n<1K, format:imagefolder, modality:image, modality:video, library:datasets, library:mlcroissant, region:usmalcolmrey
  • 3114
    Salesforce/wikitext
    task_categories:text-generation, task_categories:fill-mask, task_ids:language-modeling, task_ids:masked-language-modeling, annotations_creators:no-annotation, language_creators:crowdsourced, multilinguality:monolingual, source_datasets:original, language:enSalesforce
  • 3214
    avbiswas/bev-decision
    task_categories:text-classification, language:en, size_categories:100K<n<1M, format:parquet, format:optimized-parquet, modality:text, library:datasets, library:pandas, library:polarsavbiswas
  • 3313
    SargeDev/jev-distill-corpus-v3
    task_categories:text-classification, language:en, size_categories:100K<n<1M, format:json, modality:text, library:datasets, library:pandas, library:polars, library:mlcroissantSargeDev
  • 3413
    Hcompany/trajectories
    language:en, size_categories:1K<n<10K, modality:image, region:us, agents, computer-use, trajectories, benchmarkHcompany
  • 3512
    gaia-benchmark/GAIA
    language:en, size_categories:n<1K, format:parquet, modality:audio, modality:document, modality:image, modality:text, library:datasets, library:pandas, library:polarsgaia-benchmark
  • 3612
    zineddine/MemoReason
    task_categories:question-answering, language:en, size_categories:100K<n<1M, format:json, modality:text, library:datasets, library:pandas, library:polars, library:mlcroissantzineddine
  • 3712
    Vyber07/cyber-security
    task_categories:text-generation, task_categories:question-answering, language:en, size_categories:n<1K, format:json, modality:text, library:datasets, library:pandas, library:polarsVyber07
  • 3812
    AxiomicLabs/Tiny_Theory_of_Mind
    task_categories:question-answering, language:en, size_categories:1K<n<10K, format:json, modality:text, library:datasets, library:pandas, library:polars, library:mlcroissantAxiomicLabs
  • 3911
    nyu-mll/glue
    task_categories:text-classification, task_ids:acceptability-classification, task_ids:natural-language-inference, task_ids:semantic-similarity-scoring, task_ids:sentiment-classification, task_ids:text-scoring, annotations_creators:other, language_creators:other, multilinguality:monolingual, source_datasets:originalnyu-mll
  • 4011
    HuggingFaceFW/fineweb
    task_categories:text-generation, language:en, size_categories:10B<n<100B, modality:tabular, modality:text, arxiv:2306.01116, arxiv:2109.07445, arxiv:2406.17557, doi:10.57967/hf/2493HuggingFaceFW
  • 4111
    TIGER-Lab/MMLU-Pro
    benchmark:official, benchmark:eval-yaml, task_categories:question-answering, language:en, size_categories:10K<n<100K, format:parquet, modality:tabular, modality:text, library:datasetsTIGER-Lab
  • 4211
    mlfoundations/MINT-1T-HTML
    task_categories:image-to-text, task_categories:text-generation, language:en, size_categories:100M<n<1B, format:parquet, modality:text, library:datasets, library:dask, library:mlcroissantmlfoundations
  • 4311
    MMMU/MMMU_Pro
    benchmark:official, benchmark:eval-yaml, task_categories:question-answering, task_categories:visual-question-answering, task_categories:multiple-choice, language:en, size_categories:1K<n<10K, format:parquet, modality:imageMMMU
  • 4411
    open-thoughts/OpenThoughts-114k
    size_categories:100K<n<1M, format:parquet, modality:text, library:datasets, library:dask, library:polars, library:mlcroissant, arxiv:2506.04178, region:usopen-thoughts
  • 4511
  • 4611
    PleIAs/SYNTH
    task_categories:text-generation, task_categories:zero-shot-classification, task_categories:summarization, language:en, language:fr, language:it, language:es, language:de, language:pl, language:nlPleIAs
  • 4711
    originlab/game-recordings-v4
    task_categories:depth-estimation, task_categories:image-to-video, task_categories:robotics, task_categories:reinforcement-learning, annotations_creators:machine-generated, source_datasets:original, language:en, size_categories:n<1K, format:parquetoriginlab
  • 4810
    openai/gsm8k
    benchmark:official, benchmark:eval-yaml, task_categories:text-generation, annotations_creators:crowdsourced, language_creators:crowdsourced, multilinguality:monolingual, source_datasets:original, language:en, size_categories:10K<n<100Kopenai
  • 4910
    Idavidrein/gpqa
    benchmark:official, benchmark:eval-yaml, task_categories:question-answering, task_categories:text-generation, language:en, size_categories:1K<n<10K, format:csv, modality:tabular, modality:textIdavidrein
  • 5010
    Necent/llm-jailbreak-prompt-injection-dataset
    task_categories:text-classification, language:en, language:zh, language:ar, language:ru, language:fr, language:de, language:es, language:hi, language:jaNecent