Submitted by
Yiming Xu
AI & ML interests
None defined yet.
Papers
DecepEval: A Benchmark for Evaluating Deception in LLM Agents
SimuVerity: Benchmarking Agents for Engineering-Grade Simulink Model Generation
None defined yet.
DecepEval: A Benchmark for Evaluating Deception in LLM Agents
SimuVerity: Benchmarking Agents for Engineering-Grade Simulink Model Generation