AI Researcher – Multilingual Data

Added
1 hour ago
Location
Type
Full time
Salary
Salary not provided

Related skills

python pytorch multilingual jax tokenization

📋 Description

  • Design and conduct multilingual dataset research (collection, filtering, deduplication, quality).
  • Develop strategies for low-resource languages using sampling, augmentation, and curriculum learning.
  • Research and improve multilingual LLMs via cross-lingual transfer, alignment, robustness.
  • Build and refine multilingual evaluation benchmarks across languages.
  • Collaborate with ML engineers to influence training pipelines, architectures, and deployment.
  • Publish research findings at AI/NLP conferences; contribute to open-source when possible.

🎯 Requirements

  • Advanced background in NLP, ML, AI, or related field.
  • Proven multilingual cross-lingual NLP research with publications at ACL/EMNLP/NeurIPS/ICML/ICLR.
  • Hands-on with large-scale multilingual datasets and modern ML workflows.
  • Knowledge of multilingual tokenization, vocab design, transfer learning, representation learning, bias mitigation.
  • Proficiency in Python and PyTorch or JAX.
  • Experience with low-resource languages, non-Latin scripts, XTREME/FLORES, TyDi QA, or LLM training.

🎁 Benefits

  • Competitive compensation package.
  • Meaningful equity in an early-stage, high-growth company.
  • Ownership over research direction and technical decisions.
  • Balance academic research with production impact.
  • Access to large multilingual datasets and modern AI infra.
  • Collaborative culture valuing innovation and learning.
Share job

Meet JobCopilot: Your Personal AI Job Hunter

Automatically Apply to Engineering Jobs. Just set your preferences and Job Copilot will do the rest — finding, filtering, and applying while you focus on what matters.

Related Engineering Jobs

See more Engineering jobs →