AI 安全研究
Evidence Integrity Research
一项进行中的研究,考察针对“以证据为依据”的 LLM 应用的提示注入:这类系统需要把自己给出的每条论断对应到支持它的来源材料。目前已完成威胁模型、一个确定性的、以证据为依据的测试平台,以及一套“干净样本对照攻击样本”的成对基准,全部基于合成数据。该框架至今只用确定性的测试替身运行过,因此还没有任何实证结论。
- 研究问题
- 嵌入在来源文档中的对抗性指令,是否会破坏以证据为依据的 LLM 应用在论断层面的证据完整性?
- 状态
- 研究方法与基准测试框架已完成;尚无真实模型结果
- 主题
- 以证据为依据的 AI 系统
- 提示 / 证据完整性
- 对抗性评估
- 可复现实验
- 代码仓库
- 尚未公开
- 论文
- 暂无论文
- 实验
以证据为依据的测试平台 已完成
合成用例、确定性分段、结构化评估,以及结构层面的引用校验。
成对攻击基准 框架已完成(仅用测试替身运行)
十组干净与攻击对照样本,覆盖四类固定攻击,并配有确定性的成对指标。
真实模型试点 尚未运行
用同一套冻结的基准对真实模型运行一次。
- 结果
- 暂无结果