Table Understanding and (Multimodal) LLMs: A Cross-Domain Case Study on Scientific vs. Non-Scientific Data Paper • 2507.00152 • Published Jun 30, 2025 • 1
SciLaD: A Large-Scale, Transparent, Reproducible Dataset for Natural Scientific Language Processing Paper • 2512.11192 • Published Dec 12, 2025 • 1
CommonLID: Re-evaluating State-of-the-Art Language Identification Performance on Web Data Paper • 2601.18026 • Published Jan 25
Tokenizer Choice For LLM Training: Negligible or Crucial? Paper • 2310.08754 • Published Oct 12, 2023 • 3
Neighborhood Contrastive Learning for Scientific Document Representations with Citation Embeddings Paper • 2202.06671 • Published Feb 14, 2022 • 2
Specialized Document Embeddings for Aspect-based Similarity of Research Papers Paper • 2203.14541 • Published Mar 28, 2022
Efficient Language Model Training through Cross-Lingual and Progressive Transfer Learning Paper • 2301.09626 • Published Jan 23, 2023 • 2
MMTEB: Massive Multilingual Text Embedding Benchmark Paper • 2502.13595 • Published Feb 19, 2025 • 50
deutsche-telekom/gbert-large-paraphrase-euclidean Sentence Similarity • Updated Aug 24, 2024 • 8.48k • • 12
deutsche-telekom/gbert-large-paraphrase-cosine Sentence Similarity • Updated Aug 24, 2024 • 18.2k • • 27
deutsche-telekom/Llama-3.1-MoE-8x8B-Instruct-raw Text Generation • 47B • Updated Aug 23, 2024 • 22 • 1