Category DirectoryVerified Rates: $20 - $35 / hour

LLM Reasoning, Factuality & Rubric Rating Roles

Assess model hallucinations, rate multi-turn conversations on helpfulness and honesty, check mathematical derivations, and grade complex logical reasoning traces.

Top Valued Skills:Critical ThinkingFact-CheckingPrompt EngineeringLogic AnalysisRubric Evaluation
01

Benchmark Tip

Review official platform evaluation guidelines carefully before taking baseline exams

02

Benchmark Tip

Always cite primary authoritative sources when flagging hallucinations

03

Benchmark Tip

Write concise, rubric-aligned justifications for every score

Verified AI Evaluation Opportunities (5)

Each listing displays sourced compensation rates and verified country eligibility.

View in Matching Dashboard
Ethos

Autonomous AI Agent Evaluator & Task Benchmark Contributor

$35 / hourAdvertised

Benchmark and train autonomous AI agent systems executing complex multi-step reasoning, tool invocations, web navigation, and real-world task execution. Annotate agent trajectory traces, critique planning failures, and supply high-signal correction feedback.

Payment verifiedGlobal, United States, India
Handshake AI

AI Model Contributor & Domain Specialist (Move Program)

$30 / hourAdvertised

Join the official Handshake Move Program connecting students, recent graduates, and early-career specialists to paid AI model development. Contribute high-quality domain responses, evaluate reasoning chains, and assist leading AI developers in training specialized models.

Payment verifiedUnited States, United Kingdom, Canada
Mindrift

LLM Reasoning & Factuality Evaluator

$22 / hourAdvertised

Evaluate complex multi-step reasoning chains in AI responses. Verify truthfulness against scholarly sources, ensure adherence to logical constraints, and grade hallucination severity.

Payment verifiedGlobal, India, United States
Scale AI / Remotasks

Multimodal Model Response & Safety Rater

$18 / hourAdvertised

Compare side-by-side outputs from vision-language models. Rate image captioning quality, visual reasoning, chart interpretation, and safety filter adherence according to detailed rubric guides.

Payment partially verifiedNeeds current verification
Telus International

AI Search Relevance & Reasoning Analyst

$16.5 / hourAdvertised

Evaluate the intent and precision of conversational AI search engines. Grade web citation authority, verify synthesized summaries, and detect out-of-date or contradictory search snippets.

Payment verifiedIndia, United States, Canada

Get Matched to AI Evaluation Gigs

Upload your resume or build your candidate profile to receive deterministic skill fit scores and real-time country eligibility verification.

Start Free Profile Match