Coding Agent

Agents' Last Exam
arXiv
Agents' Last Exam
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
EMNLP 2026
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks