Data Engineer — ML Training Data Pipeline
Dataeconomy · Hyderabad, India ·
- Category
- Data engineering
- Experience
- 5+ years
Dataeconomy · Hyderabad, India ·
FEI Systems · Columbia, Maryland, United States
Jobtailor · California, United States
dotSolved · Chennai, India
LSEG · IND-BLR-Divyasree Technopolis
Builds and maintains AWS data pipelines that transform raw production traces into high-quality training datasets for LLM fine-tuning — handling ingestion, deduplication, format conversion, quality filtering, and train/test splitting at scale. Core stack is Python (pandas, pyarrow), JSONL processing, HuggingFace Datasets, and AWS S3/EC2, based in Hyderabad or Pune.
What We Expect:
Preferred (Not Required): LLM training data prep
(chat templates, tool-calling schemas); Axolotl or similar dataset formats;
data versioning (DVC, LakeFS); browser-automation trace data or Playwright.
eSparkBiz · Ahmedabad, India