8月16日,百度安全“Agent+”攻防能力挑战赛线上靶场实战阶段顺利结束。作为本次赛事的独家技术战略合作伙伴,腾讯云鼎实验室依托智能攻防领域的技术积累,为赛事提供专业靶场、Agent 托管运行及自动化评测等技术支撑,保障来自150余支参赛战队的 Agent 在统一、隔离的实战环境中稳定运行,让 AI Agent 真正成为攻防赛场上的“参赛选手”。
聚焦自主渗透,构建 Agent 智能攻防评测能力
当前,面向 AI Agent 的网络安全评测正从漏洞发现、漏洞利用等单点能力,逐步向更复杂的自主攻击能力延伸。以 CyberGym 为代表的 Benchmark 主要围绕真实开源软件漏洞,评测 Agent 的漏洞分析、发现及 PoC 复现能力;CyberGym-E2E 进一步覆盖漏洞发现、PoC 生成和漏洞修复;ExploitGym 则聚焦将漏洞触发进一步转化为可工作的 Exploit。
这些 Benchmark 对衡量 Agent 的漏洞发现、分析和利用能力具有重要价值,但其核心评测对象仍然是漏洞及其利用过程。而真实渗透测试面对的是一个更开放的问题:在缺乏明确漏洞位置和攻击路径的情况下,Agent 能否从目标侦察开始,自主判断攻击方向、持续调整策略,并最终完成一次完整渗透?
TSecBench 则将评测视角从单个漏洞和 Exploit,延伸到Agent 的整体自主渗透能力。在面向自主渗透的黑盒目标环境中,Agent 不预先获得目标源码、漏洞位置或攻击路径,而是从目标侦察开始,自主完成服务识别、漏洞分析、攻击利用及多阶段渗透,并根据每一步的实际结果动态调整后续策略。最终评价的不只是某个漏洞是否被成功利用,而是 Agent 能否在缺乏明确路径的情况下持续进行攻击决策,并最终完成真实攻防目标。
因此,TSecBench 的核心差异并不是简单增加更多漏洞题目,而是改变了评测的基本对象和方式:从评测“一个漏洞”,走向评测“一个自主攻击者”。这使其更贴近 AI Agent 在真实红队、自动化渗透和自主网络攻防场景中的实际能力,也构成了区别于传统漏洞挖掘和 Exploit 生成 Benchmark 的自主渗透评测方向。
从 Benchmark 到赛事,支撑 Agent 大规模实战
TSecBench 不仅是一套智能攻防 Benchmark 和评测体系,也具备面向真实赛事场景的托管与承接能力。针对不同企业、团队和赛事方的评测需求,平台可以将既有靶场和赛题纳入统一的 Agent 运行与评测体系,并根据赛事规则进行环境配置、任务调度、隔离运行、结果判定和成绩统计。
此次百度安全“Agent+”攻防能力挑战赛中,参赛队伍提交自主构建的 Agent 后,由平台统一完成运行环境配置和任务调度,Agent 在隔离环境中自主执行攻防任务,平台则根据目标环境的实际状态和攻防结果进行自动判定与评分。
对于150余支战队参与的大规模线上实战,这意味着不同模型、Agent 框架和技术路线的参赛程序,可以在统一的运行条件和评测规则下接受检验,赛事组织方也无需针对不同 Agent 分别建设和维护运行环境,从而将复杂的 Agent 执行和评测工作转化为标准化、可复用的赛事基础能力。
从日常 Benchmark 评测,到企业和机构定制赛事,再到大规模 Agent 攻防竞技,TSecBench 正逐步成为连接智能攻防能力评测与真实应用场景的基础设施。
从赛事实践,到能力沉淀
从连续两届腾讯云黑客松智能渗透挑战赛,到此次百度安全“Agent+”攻防能力挑战赛,云鼎实验室持续将真实赛事作为验证 Agent 自主攻防能力和完善评测体系的重要场景。经过持续实践,相关能力进一步沉淀为 TSecBench 的题库、评测方法和赛事支撑能力,并在此次百度赛事中得到进一步验证。
未来,云鼎实验室将继续依托 TSecBench,联合产业伙伴、高校和科研机构,持续完善智能攻防 Benchmark 与评测体系,推动 Agent 自主攻防能力在更多真实场景中接受检验。
⬇️ 点击【阅读原文】,立即开始跑分
推荐站内搜索:最好用的开发软件、免费开源系统、渗透测试工具云盘下载、最新渗透测试资料、最新黑客工具下载……




还没有评论,来说两句吧...