AI Benchmark Quality Engineer Task Evaluation
Listed on 2026-10-07
-
Quality Assurance - QA/QC
Quality Engineering, IT QA Tester / Automation
Obsidian is seeking a candid evaluator to assess the quality, correctness, and reproducibility of software-engineering benchmark tasks used to train frontier AI labs. You will review repository-level tasks, reference patches, test harnesses, and grading integrity, and provide rubric-based written feedback.
Responsibilities include identifying gaps in tooling, ensuring task reproducibility across environments, and delivering concrete, rubric-based assessments to guide model training and
We would love to welcome a new AI Benchmark Quality Engineer for Task Evaluation to our team in San Francisco, CA, United States.
This opening is for the AI Benchmark Quality Engineer for Task Evaluation role at Obsidian.
We are seeking a motivated AI Benchmark Quality Engineer for Task Evaluation to join Obsidian in San Francisco, CA, United States.
Consider building your career as a AI Benchmark Quality Engineer for Task Evaluation at Obsidian.
(If this job is in fact in your jurisdiction, then you may be using a Proxy or VPN to access this site, and to progress further, you should change your connectivity to another mobile device or PC).