Indian Flag
Government Of India
A-
A
A+
ORGANISATION
SansTib - Sanskrit-Classical Tibetan Parallel Corpus

SansTib - Sanskrit-Classical Tibetan Parallel Corpus

Sanskrit Tibetan Parallel Dataset

About Dataset

SansTib is a large-scale sentence-aligned parallel corpus of Sanskrit and Classical Tibetan Buddhist texts containing approximately 317,289 sentence pairs. The dataset also includes manually aligned evaluation datasets and a bilingual sentence embedding model for cross-lingual language understanding.

Purpose of Dataset

The Purpose Of This Dataset Is To Provide A Large Sentence-aligned Sanskrit–classical Tibetan Parallel Corpus For Cross-lingual Language Understanding And Translation Research. It Supports The Development And Evaluation Of Machine Translation Systems, Bilingual Sentence Embedding Models, Multilingual Information Retrieval, Sentence Alignment Algorithms, Semantic Similarity Models, Cross-lingual Representation Learning, Digital Philology, And Computational Research On Buddhist Literature. The Dataset Can Further Be Used To Develop Multilingual Dictionaries, Retrieval Systems, Language Resources For Low-resource Classical Languages, And Other Downstream Nlp Applications

Activity Overview Activity Overview

  • Downloads0
  • Redirect 1
  • File Size 0
  • Views 10

Tags Tags

  • Bilingual Translation
  • Parallel Corpus
  • Sanskrit
  • Computational Linguistics
  • Machine Translation
  • cross-lingual NLP
  • natural language processing (NLP)
  • semantic mapping
  • Low Resource Languages
  • Tibeto-Burman languages
  • Buddhist literature
  • Digital humanities

License Control License Control

Attribution-ShareAlike 4.0 International (CC BY-SA 4.0)