AI Safety Red Team Expert, English & Urdu
· US ·
- Category
- Security
Adversarially probe conversational AI models and agents for jailbreaks, prompt injections, bias exploitation, and multi-turn manipulation, then review sensitive outputs and produce safety findings and data. The role requires fluency in English and Urdu and is US-based.
Role Overview Help strengthen conversational AI systems by testing them from an adversarial perspective. You will probe models and agents for vulnerabilities, create high-quality safety data, and produce practical findings that support more robust and trustworthy AI. Key Responsibilities Test conversational AI models and agents for jailbreaks, prompt injections, misuse cases, bias exploitation, and multi-turn manipulation. Review text-based AI outputs involving sensitive topics, including bias,…