Misc Lab 2:AI Security¶
本实验上限 115 分,更高的分数不会溢出。
Gandalf (100 分 ) ¶
https://gandalf.lakera.ai/baseline
最经典的 AI 提示词攻击靶场,可以在这里感受一下怎么跟 AI 说话(x
- 解出 Main Gandalf Level 1~7 可获得 50 分
- 解出 Main Gandalf Final LevelAdventure 中的 11 道题可获得 50 分
报告提交要求:
- 不仅仅提交最后的成功结果,请在报告中体现出所有的尝试过程;如果每一题都能做到一次成功,请给出提示词的思路,否则可能会被扣除部分分数。
- 无法全部解出 / 想把更多精力留给其它题目也没问题,每一题都会有部分分。
Agent Breaker (110 分 ) ¶
https://play.lakera.ai/agent-breaker
在题目发出去后,Gandalf 下线了,在我的原创题目出到一半时,Gandalf 焕新上市了,那还说啥了多少得体验一手
Agent Breaker 有 10 个场景,每个场景有 5 个 Level。
- 解出每个场景的 Level 1 和 Level 2 即可获得 70 分,无法全部解出时按照 6 分 /Level 1,1 分 /Level 2 扣分;
- 如果同时选做了 Gandalf,则本项最高 40 分;
- 选择 6 个场景,解出每个场景的 Level 3 即可获得 30 分,无法全部解出时按照 4 分 / 题得分;
- 解出更多 Level 3 可以获得 4 分 / 题
- 解出各个场景的 Level 4 可以获得 6 分 / 题;
- 解出各个场景的 Level 5 可以获得 10 分 / 题。
- "You are randomly assigned to an LLM. Difficulty may vary across leagues.",实在不行可以尝试刷新账号看看能不能换到蠢一点的 LLM
虽然我实测下来区别不大
本题上限 110 分。
报告提交要求:
- 不仅仅提交最后的成功结果,请在报告中体现出所有的尝试过程,同时请给出提示词的思路。
- 无法全部解出 / 想把更多精力留给其它题目也没问题,每一题都会有部分分。
Hack your Agent (60 分)¶
关注常见的 Coding Agent 中的越狱漏洞。
下列两题二选一,多做分数不累加:
- 研究市面上常见的 Coding Agent,诸如 Opencode / Claude code / Gemini CLI / Grok CLI / Codex 之类,看看有没有有意思的越狱漏洞,命制一道 CTF 题目
。 (60 分)- 可以寻找他们的 Issues 或者网络上的文章。
- 在本报告中,你可以讲一讲自己命制这道题的心路历程,比如找到了那些题目做参考 / 找到了什么知识点 / 觉得自己题目中什么地方出的最有意思;在附加文件中,需要有题目文件和 Writeup。
- 我们主要会根据题目的完整度以及报告中体现的工作量来评分,题目的新颖性、难度等等也会纳入考虑;换句话说,哪怕你未能写出一道让自己满意的题目,只要报告中体现出了自己探索的过程,也可以获得不错的分数。
- 也可以复现课上的 opencode tricks
; (20 分)
课上签到(5 分 bonus)¶
到课本身就是工作量的体现 难道不是吗
反馈(5 分 bonus)¶
谈谈你的感受吧!无论是关于本次课程,关于助教,关于作业,无论是感想、意见还是建议,欢迎畅所欲言,您的反馈能帮助我们更好的改进课程!