架构技术评论

《The CTF scene is dead》博文解读

Image

原文:Kabir —The CTF scene is dead.
https://kabir.au/blog/the-ctf-scene-is-dead

0. 这篇文章在说什么

作者的核心判断是:前沿大模型/智能体把“开放式线上 CTF”这种比赛形态的计分板打穿了——榜单不再干净衡量人的能力,旧的竞争游戏回不来。

他并不是说“安全对抗不重要”,而是说:CTF 过去作为“学习阶梯 + 人才筛选信号 + 社区艺术品”的组合功能,在“允许随意用 AI 的公开线上赛”里失效了。


1. 作者的论证链:从“工具”到“替代人类”

文章最关键的概念区分是:

  • •CTF 玩家一直在用工具(调试器、脚本、框架、自动化 exploit、知识库)。
  • • 但作者认为现在出现了质变:

    “The issue is when the model does the reasoning, writes the solve, and leaves the human with nothing meaningful to do besides copy the flag.”
    (问题不在 AI 能帮忙,而在于模型完成推理、写出解法,人类只剩复制 flag。)

基于这个区分,他把“CTF 已死”建立在一个三段式演化上:

1.1 早期:中等题开始“one-shot”

作者回忆 GPT-4 出来后,不少中等难度题可以把题面/附件丢给模型,十分钟后拿到解法与 flag。当时影响还可控:难题仍需要人,节省的时间不足以摧毁竞争。

1.2 中期:Claude Code + 编排(orchestration)改变比赛轴心

作者认为 Claude Opus 4.5 之后,“可智能体化解决”的题目覆盖面大幅上升,而且 Claude Code + MCP 让“把解题做成流水线”变得极低门槛:

  • • 可以对接 CTFd API
  • • 给每个题开一个 agent 实例
  • • 先跑 1 小时自动化,把人力留给剩下的 hardest

于是榜单开始衡量:

  • • 安全能力(依然存在)
  • •编排能力(能否把 agent 大规模跑起来、管上下文、工具链)
  • •是否愿意/能负担前沿模型成本

1.3 后期:GPT-5.5 把“算力/Token”变成决定性变量

作者进一步推到结论:当模型能覆盖“组织者现实产能范围内的多数题”(尤其是小中型赛事),那么公开赛会变成:

“That makes open CTFs pay-to-win. The more tokens you can throw at a competition, the faster you can burn down the board.”

他强调这不仅是“不公平”,而是计分板语义变了:你看到的名次,越来越像“谁能跑更多 agent/更贵模型/更稳的工作流”,而不是“谁更懂安全”。


2. 文章里真正尖锐的点:CTF 不只是题库,而是一条“梯子”

文章最有洞察的部分其实不是“AI 能解题”,而是作者把 CTF 的社会功能拆开:

  1. 1.学习路径(ladder):初学者靠不断攀爬看到进步:解更多题、名次更好、加入更强团队。
  2. 2.激励结构:公开榜单提供可见的反馈回路。
  3. 3.社群筛选信号:招人/找队友/圈内声誉常会参考 CTF 记录。

作者认为 AI 破坏的是这整套反馈回路:

“If the visible scoreboard is dominated by teams using AI, a beginner is pushed toward using AI before they have built the instincts the AI is replacing. That is an anti-pattern.”

这句话背后其实是一个教育学判断:学习靠“有意义的挣扎(active struggle)”。当新手被迫用 AI 才能“看起来在进步”,他在最需要打地基的时候跳过了“构建直觉”的阶段。

作者因此建议初学者去picoGym / HackTheBox这种“教育导向、非纯榜单竞争导向”的环境。


3. 对几种常见反驳的逐条拆解(作者怎么回应)

3.1 “顶级决赛(如 DEF CON CTF)还很难,所以 CTF 没死”

作者的回应核心是:

  • • 顶级决赛参与者很少
  • • 决赛通常由 qualifier 选拔
  • • 如果 qualifier(更接近大众实际参与的开放赛形态)被 agent 大面积自动化,真正有能力的人反而更难通过“干净的”路径抵达决赛

因此,极少数精英赛不能拯救“开放线上赛”这个主流形态。

3.2 “AI 对安全研究有用,所以允许 AI 很合理”

作者区分“领域工具”与“竞技规则”:

  • • AI 对安全研究有用 ≠ AI 应该在竞技中无限制使用
  • • 类比国际象棋:引擎用于训练/复盘/讲解,但比赛中不允许开引擎

3.3 “那就适应(just adapt)”

作者认为“适应”如果指:

  • • 更强工具链:早就有人做
  • • 更难题:组织者也尝试了
  • • 接受榜单变成“AI 编排 benchmark”:那就应该诚实承认规则变了,而不是继续假装还是“人类安全竞赛”。

4. 这篇文章的强处:它抓到的不是技术细节,而是“信号崩塌”

如果把 CTF 看成一个系统,它输出三种东西:

  1. 1.技能训练(练手)
  2. 2.能力信号(榜单/战绩可被外部使用)
  3. 3.社区凝聚(一起熬夜、一起复盘、一起造题)

作者的“CTF 已死”其实主要在说第 2 点:

  • • 以前:信号相对干净(当然也不完美,但至少有共识)
  • • 现在:信号被混入“模型能力 + Token 预算 + 编排工程”,且难以在开放赛中监管

因此,不是“题不存在了”,而是“题的结果不再可用作同一种社会信号”。

这点与一些外部评论形成互文:例如 SecurityBoulevard 的一篇文章也强调竞争轴心从“谁是最好的黑客”迁移到“谁设计了最好的 agentic AI system”(注意这是媒体/行业文章,不是严格学术结论):

  • • https://securityboulevard.com/2026/03/the-death-of-the-ctf-how-agentic-ai-is-reshaping-competitive-hacking/

5. 这篇文章的薄弱处:它把“开放线上赛”与“CTF”几乎画了等号

文章标题是The CTF scene is dead,但正文的主要论域是:

  • •open online CTFs(开放式线上赛)

这里面隐含了一个可争论的前提:

  • • “CTF 场景的主轴就是公开线上比赛 + 公开榜单(CTFtime)。”

然而从更宏观的“CTF/演练作为人才管道”视角看,CTF 还可以被制度化为:

  • • 分层赛制(分组、线下监考、设备隔离)
  • • 国家队/校队路径
  • • 与网络演练结合(强调协作、决策、压力、组织流程)

例如 RUSI(英国皇家联合军种研究所)的文章就把 CTF/网络演练视为国家能力建设的“上游基础设施”,并强调它们可以作为人才发现与培养管道的一部分:

  • • https://www.rusi.org/explore-our-research/publications/cyber-effects-perspectives/cyber-exercises-and-capture-flag-competitions-uk-policy-tools

这并不能直接反驳 Kabir(因为 Kabir 说的是“开放线上赛”死了),但提示我们:

  • •“公开榜单型 CTF”死了 ≠ “CTF/竞赛化训练”整体死了
  • • 可能是“形态迁移”而非“彻底终结”

6. 如果作者是对的,会发生什么?(三类参与者的现实后果)

6.1 对选手:从“解题能力”转向“工作流工程能力”

在允许 AI 的公开赛里,优势会向这些能力倾斜:

  • • Prompt/上下文工程
  • • 工具链与沙箱管理
  • • 任务分解与并行编排
  • • 成本控制(Token/时间/算力预算)

这类能力当然也有价值,但它和传统意义的“安全基本功”并不等价。

6.2 对出题人:艺术品被“几分钟吃掉”导致供给下降

作者提到:当出题像艺术创作,而 agent 分钟级“吃掉”,出题人会失去动力。

这会带来一个长期风险:

  • • 最会出题的人减少投入
  • • 题目整体质量下降
  • • 进一步强化“AI 更容易碾压”的体感
  • • 形成负循环

6.3 对招聘方:CTF 战绩作为信号会通胀/失真

如果战绩不可区分“人 vs AI 编排”,招聘方会:

  • • 降低对公开赛战绩的权重
  • • 更看重可验证的产出(代码、博客、研究、开源贡献、面试现场题)
  • • 或者只认可更强监管条件下的比赛(线下/监考/设备管控)

7. 可能的“替代形态”:不是回到过去,而是重做规则与产品

结合 Kabir 的问题定义(开放线上赛的信号崩塌),比较现实的替代方向大概有四类:

  1. 1.明确“禁 AI”并强化可执行监管
    • • 线上几乎不可执行
    • • 线下/半线下可做(设备隔离、监考、统一环境)
  2. 2.明确“允许 AI”但把目标改成比拼“安全智能体工程”
    • • 直接承认榜单衡量的是 agentic workflow
    • • 评分维度加入:成本、可复现性、审计、解释性
  3. 3.把 CTF 从“排行榜产品”改成“学习产品”
    • • 更像 Kabir 推荐的:picoGym / HackTheBox
    • • 强调路径、讲解、复盘、可控难度曲线
    • • 榜单弱化,或者分离“学习榜单”和“竞技榜单”
  4. 4.从“解题竞赛”走向“演练/协作竞赛”
    • • 更像蓝队/紫队演练
    • • 强调沟通、分工、决策、态势感知
    • • AI 可以作为允许的工具,但人的组织能力与策略仍是关键

8. 给你的可操作建议(按身份)

8.1 如果你是参赛者

  • • 把公开赛当作“练手与社交”,谨慎把名次当作能力证明。
  • • 训练结构建议:
    1. 1. 先做“无 AI”复盘(确保你会)
    2. 2. 再用 AI 做加速与扩展(确保你理解)
  • • 多做“可验证产出”:写 writeup、做工具、开源脚本、复现真实 CVE/漏洞链。

8.2 如果你是组织者/出题人

  • • 先选清楚你要的是什么:
    • • 人类安全竞赛?(那就必须靠规则与环境约束 AI)
    • • AI 安全智能体竞赛?(那就把“用 AI”写进规则与评分)
  • • 不要用“针对 AI 的反提示/拒绝字符串”当防线。Kabir 认为这只是短期摩擦,而且会让人类也更痛苦。

8.3 如果你是招聘/面试官

  • • 把公开 CTF 战绩从“强信号”降级为“兴趣信号”。
  • • 优先采用:
    • • 现场可控的短题(白板/纸笔/隔离环境)
    • • 候选人自己的研究/开源/技术写作
    • • 让候选人讲清楚“为什么这么做”(把推理链拉出来)

9. 我对作者结论的“精炼版再表述”(更不容易引战)

与其说“CTF 死了”,更精确的表述可能是:

  • •“开放线上 CTF 的公开榜单,正在失去作为‘人类能力信号’的可信度。”

当你把论断收束到“信号/激励机制崩塌”,这篇文章就更容易被严肃讨论,也更容易催生新的比赛形态,而不是停留在情绪化争执。


附:本文引用的外部材料(用于对照,不代表完全赞同)

  • • Kabir 原文: https://kabir.au/blog/the-ctf-scene-is-dead
  • • RUSI:CTF/网络演练作为政策与人才管道工具: https://www.rusi.org/explore-our-research/publications/cyber-effects-perspectives/cyber-exercises-and-capture-flag-competitions-uk-policy-tools
  • • SecurityBoulevard(行业媒体观点):Agentic AI 重塑 CTF: https://securityboulevard.com/2026/03/the-death-of-the-ctf-how-agentic-ai-is-reshaping-competitive-hacking/
  • • CTFtime 统计入口(年度/国家/团队): https://ctftime.org/stats/