我要求 10 个 AI 模型重建真实的网络攻击过程

林知秋AI 前沿📡 BestBlogs·AI高分精选⭐ 852026-10-02494 阅读💛 71 收藏
我要求 10 个 AI 模型重建真实的网络攻击过程

📌 One-Sentence Summary

作者开发了「Cyber Autopsy」基准测试,旨在评估 10 个 AI 模型如何根据碎片化报告重建真实世界的网络攻击,重点关注证据 grounding 和不确定性校准,而非单纯的语言流畅度。

📝 Summary

本文介绍了「Cyber Autopsy」的创建过程及其结果,这是一个旨在测试 AI 模型根据公开报告重建网络安全事件时间线能力的基准工具。与标准的总结任务不同,该基准要求模型能够区分已确认的事实、推论和未知项,并为每项主张引用具体的证据。通过对 10 个模型(包括 Gemini、GPT、Claude 等)在 7 个真实案例(如 RansomHub 入侵和 AI 编排的间谍活动)中进行测试,结果显示模型表现随案例的不同而显著波动。作者强调,缺乏支撑的「看似合理的故事」将会被扣分,并详细介绍了证据驱动重建得分(EGRS)以及在 Kaggle 上实施该基准时遇到的技术挑战。

💡 Main Points

关注证据驱动的重建而非流畅度

该基准会对「缺乏支撑的确定性」进行惩罚,并奖励能够区分观测事件、推论、失败尝试和未知项的模型,防止 AI 仅仅讲述一个听起来可能但实际上是幻觉的故事。

不同事件类型的表现差异显著

没有一个模型能主导所有任务;例如,Gemma 在 RansomHub 和敲诈案例中领先,而 Gemini 在凭据窃取和伪装成人类的间谍活动任务中表现更好。

对表述框架和证据量的敏感性

实验结果显示,在证据相同的情况下,改变攻击者的身份设定(人类 vs AI)会影响模型得分;而缩短证据窗口(例如仅截取第一天的数据)则会改变重建的准确率。

通过 EGRS 进行确定性评分

证据驱动重建得分(EGRS)是一个综合指标,结合了召回率、精确率、链接质量、证据归属和状态准确性,同时扣除幻觉产生的惩罚分。

💬 Key Quotes

一个看似合理的攻击故事是不够的;缺乏支撑的确定性应该被扣分。

将它们分开衡量,可以更容易地看出模型是在恢复证据,还是仅仅在讲述一个听起来很像那么回事的故事。

这使得缺乏支撑的确定性代价高昂,同时让模型在保留不确定性并引用重建证据时获得认可。

📊 Article Meta

AI Screening: 85

Source: DEV Community: machinelearning

Author: ujja

Category: 人工智能

Language: 英文

Read Time: 11 min

Word Count: 2723

Tags:

AI 评估与基准 , AI 安全事件 , 机器学习 , LLM , 网络安全

#AI 评估与基准# AI 安全事件# 机器学习# LLM# 网络安全

文章评论(12)

拾贝者20 小时前

这篇文章分析得很透彻,收藏了!

回复
陈皮话梅糖19 小时前

不错不错,已加入书签。

回复
风倚栏19 小时前

讲解得很细致,新手也能看懂。

回复
空向阳18 小时前

整理得太全面了,省了我不少时间。

回复
空向阳18 小时前

思路清晰,干货满满。

回复
雪影18 小时前

整理得太全面了,省了我不少时间。

回复
空向阳18 小时前

整理得太全面了,省了我不少时间。

回复
陈皮话梅糖17 小时前

作者写得真不错,学到了不少。

回复
龙文博17 小时前

赞同,实践出真知。

回复
星寻梦15 小时前

有没有更详细的教程,期待后续。

回复
陈皮话梅糖15 小时前

有没有更详细的教程,期待后续。

回复
雪知秋15 小时前

赞同,实践出真知。

回复