Data Marketplace

Use verified, licensed data with confidence. You can download right away or check the data through inquiry.

Sell your data on Flitto

Simply register your data and check its sale eligibility.

A total of 326 datasets
  • Pre-training DataAudio

    Egyptian Arabic Energy Domain Speech Dataset

    A single-turn energy domain speech dataset based on the Egyptian Arabic dialect.

    DomainBio, Environment and Energy
    LanguageArabic (Egypt)
  • Pre-training DataAudio

    Standard Arabic Public Administration Domain Speech Dataset

    A single-turn public administration domain speech dataset based on Modern Standard Arabic (MSA).

    DomainLaw and Public
    LanguageArabic
  • Pre-training DataAudio

    Gulf Arabic Public Administration Domain Speech Dataset

    A single-turn public administration domain speech dataset based on the Gulf Arabic dialect.

    DomainLaw and Public
    LanguageArabic (Saudi Arabia)|Arabic|Arabic (Kuwait)|Arabic (Qatar)|Arabic (Bahrain)|Arabic (Oman)|Arabic (Yemen)
  • Pre-training DataAudio

    North African Arabic Public Administration Domain Speech Dataset

    A single-turn public administration domain speech dataset based on the North African Arabic (Maghrebi Arabic) dialect.

    DomainLaw and Public
    LanguageArabic (Morocco)|Arabic (Algeria)|Arabic (Tunisia)|Arabic (Libya)|Arabic (Mauritania)
  • Pre-training DataAudio

    Egyptian Arabic Public Administration Domain Speech Dataset

    A single-turn public administration domain speech dataset based on the Egyptian Arabic dialect.

    DomainLaw and Public
    LanguageArabic (Egypt)
  • Alignment DataImage

    Arabic Construction Image Captioning and Preference QA Dataset

    A multimodal Arabic image dataset combining image captions and preference QA for general and construction domains, reviewed and annotated by construction and engineering domain experts.

    DomainScience and Engineering|Humanities and Social
    LanguageArabic
  • Pre-training DataText

    Multilingual Multi-Turn Chat Text Dataset

    A multilingual multi-turn chat text dataset built directly by professional annotators, including speaker information, proper nouns, chat slang, typo tags, and natural conversational turns.

    DomainHumanities and Social
    LanguageKorean|Hindi|Indonesian|Arabic|Thai|Bengali|Arabic (Egypt)|Japanese
  • Pre-training DataText

    Multilingual Domain-Specific Parallel Translation Corpus Text Dataset

    A multilingual domain-specific parallel translation corpus dataset built from Korean-to-English, Korean-to-Arabic, and Korean-to-Chinese translations specialized in military, finance, and legal domains, curated by expert annotators.

    DomainLaw and Public
    LanguageKorean|Bengali|Hindi|Indonesian|Japanese|Thai|Arabic (United Arab Emirates)|Arabic (Egypt)
  • Evaluation DataText

    General Arena Benchmark Dataset

    A Korean-based Arena benchmark text dataset built for evaluating AI model performance in general-domain comparison tasks.

    DomainIT and Tech|Humanities and Social|Science and Engineering
    LanguageKorean
  • Evaluation DataText

    General BFCL 3v Benchmark Dataset

    A Korean-based BFCL 3v benchmark text dataset built for evaluating function-calling capabilities of AI models.

    DomainIT and Tech|Humanities and Social|Science and Engineering
    LanguageKorean