Authors
Loading...
Benchmark assesses LLM agents' exploit capabilities for web application vulnerabilities, suggesting vital cybersecurity evaluations.
Zhu et al. (2025) studied this question.