Skip to content

Misc Lab 2:AI Security

本实验上限 115 分,更高的分数不会溢出。

Gandalf (100 )

https://gandalf.lakera.ai/baseline

最经典的 AI 提示词攻击靶场,可以在这里感受一下怎么跟 AI 说话(x

  • 解出 Main Gandalf Level 1~7 可获得 50
  • 解出 Main Gandalf Final LevelAdventure 中的 11 道题可获得 50

报告提交要求:

  • 不仅仅提交最后的成功结果,请在报告中体现出所有的尝试过程;如果每一题都能做到一次成功,请给出提示词的思路,否则可能会被扣除部分分数。
  • 无法全部解出 / 想把更多精力留给其它题目也没问题,每一题都会有部分分。

Agent Breaker (110 )

https://play.lakera.ai/agent-breaker

在题目发出去后,Gandalf 下线了,在我的原创题目出到一半时,Gandalf 焕新上市了,那还说啥了多少得体验一手

Agent Breaker 10 个场景,每个场景有 5 Level

  • 解出每个场景的 Level 1 Level 2 即可获得 70 分,无法全部解出时按照 6 /Level 11 /Level 2 扣分;
    • 如果同时选做了 Gandalf,则本项最高 40 分;
  • 选择 6 个场景,解出每个场景的 Level 3 即可获得 30 分,无法全部解出时按照 4 / 题得分;
  • 解出更多 Level 3 可以获得 4 /
  • 解出各个场景的 Level 4 可以获得 6 / 题;
  • 解出各个场景的 Level 5 可以获得 10 / 题。
  • "You are randomly assigned to an LLM. Difficulty may vary across leagues.",实在不行可以尝试刷新账号看看能不能换到蠢一点的 LLM 虽然我实测下来区别不大

本题上限 110 分。

报告提交要求:

  • 不仅仅提交最后的成功结果,请在报告中体现出所有的尝试过程,同时请给出提示词的思路。
  • 无法全部解出 / 想把更多精力留给其它题目也没问题,每一题都会有部分分。

Hack your Agent (60 分)

关注常见的 Coding Agent 中的越狱漏洞。

下列两题二选一,多做分数不累加:

  • 研究市面上常见的 Coding Agent,诸如 Opencode / Claude code / Gemini CLI / Grok CLI / Codex 之类,看看有没有有意思的越狱漏洞,命制一道 CTF 题目60 分)
    • 可以寻找他们的 Issues 或者网络上的文章。
    • 在本报告中,你可以讲一讲自己命制这道题的心路历程,比如找到了那些题目做参考 / 找到了什么知识点 / 觉得自己题目中什么地方出的最有意思;在附加文件中,需要有题目文件和 Writeup
    • 我们主要会根据题目的完整度以及报告中体现的工作量来评分,题目的新颖性、难度等等也会纳入考虑;换句话说,哪怕你未能写出一道让自己满意的题目,只要报告中体现出了自己探索的过程,也可以获得不错的分数。
  • 也可以复现课上的 opencode tricks20 分)

课上签到(5 bonus

到课本身就是工作量的体现 难道不是吗

反馈(5 bonus

谈谈你的感受吧!无论是关于本次课程,关于助教,关于作业,无论是感想、意见还是建议,欢迎畅所欲言,您的反馈能帮助我们更好的改进课程!