Trustworthy AI

Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
EMNLP 2026
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
Mitigating Hallucinations in Large Language Models via Causal Reasoning
AAAI 2026
Mitigating Hallucinations in Large Language Models via Causal Reasoning