AI Safety Expert - Red Team

Mercor
San Francisco, CA
Job Description
Role Overview

As an AI Safety Expert - Red Team, you will be responsible for conversational AI models and agents, conducting jailbreaks, prompt injections, misuse cases, and bias exploitation. You will also generate high-quality human data, annotate failures, classify vulnerabilities, and flag systemic risks. You will apply structure using taxonomies, benchmarks, and playbooks to maintain consistent testing, and document reproducibly, producing reports, datasets, and attack cases for customer action.

What You Will Do

Conduct jailbreaks, prompt injections, misuse cases, and bias exploitation. Generate high-quality human data. Annotate failures, classify vulnerabilities, and flag systemic risks. Apply structure using taxonomies, benchmarks, and playbooks to maintain consistent testing. Document reproducibly, producing reports, datasets, and attack cases for customer action.

Why It Might Be a Fit

You will be a fit for this role if you have prior red teaming experience in AI adversarial work, cybersecurity, or socio-technical probing, and strong communication skills to explain risks to technical and non-technical stakeholders.

Requirements

  • Fluent in English & Odia.
  • Prior red teaming experience in AI adversarial work, cybersecurity, or socio-technical probing.
  • Strong communication skills to explain risks to technical and non-technical stakeholders.
]]>