AI 时代的技术面试:一场规则正在被改写的博弈

AI 时代的技术面试:一场规则正在被改写的博弈

最近读到 Coinbase 工程团队发表的《Interviewing Engineers in the AI Era》,讲述他们如何用一整年重建技术面试流程。1沿着这条线索,我梳理了 Canva、Meta、Google、Datadog 等公司的最新实践与行业数据,越看越确定一件事:当 Coinbase 在 2025 年第四季度合并的代码中已有一半以上由 AI 生成时,传统的“白板加 LeetCode”式技术面试正在迅速失效。我之前在《ChatGPT 越用越焦虑?AI 时代知识工作者的心理健康指南》中讨论过 AI 给知识工作者带来的焦虑,本文则把镜头拉近到这种焦虑最具体的战场:技术面试。

AI 时代的面试困境,本质上是一个信号问题。旧信号(能否凭记忆写出正确的代码)已经失真,新信号(能否指挥、审查并否决 AI)仍在校准。本文梳理了这场变革的三大断层:工作本质的改变、作弊攻防的军备竞赛,以及 AI 面试官的登场;同时总结出求职者应该重点训练的能力,作为我自己的阅读与整理笔记。

TL;DR:四个核心判断

  • 面试没有跟上工作变化:AI 生成的代码已占 Coinbase 合并代码的一半以上,但多数面试仍在测试“能否在 45 分钟内凭记忆从零手写代码”,假阳性与假阴性同时上升。
  • 疑似作弊已经规模化:检测服务商 Fabric 的自有模型将 38.5% 的面试标记为疑似作弊;新一代作弊工具声称能让共享画面看起来完全干净,检测与反检测已成为一场不断升级的军备竞赛。
  • 企业正在走两条路线:一条回归线下,验证基本功;另一条开放 AI,重新设计题型。两条路线并不冲突,越来越多的公司同时采用。
  • 刷题与系统设计都没有过时:LeetCode 式题目仍然常见,只是考查方式变了;系统设计依然是资深岗位的重要分水岭;AI 协作能力则是所有职级都应立即积累的新必修课。

一、工程师的工作已经变了,面试却没有跟上

Coinbase 在 2026 年 7 月发表的《Interviewing Engineers in the AI Era》披露了一组关键数据:2025 年第一季度,AI 生成的代码在其全部合并代码中仅占 5.7%;到 2025 年第四季度,这一比例已经突破 50%,同时几乎 100% 的代码仍由人类审查。1工程师的时间正在从“从零写代码”转向编写技术规格、指挥 AI、审查 AI 生成的代码变更(PR),以及找出模型信心十足地写下的架构错误

“当‘构建’的成本趋近于零时,‘决定构建什么、验证它是否正确,并安全地交付’就成了制约因素。”——Coinbase 工程负责人

这并非个例。Google DORA 2025 对近 5,000 名技术从业者的调查显示,90% 的受访者已经在工作中使用 AI,比前一年增长 14%,常见用途包括编写和修改代码、测试与文档。Karat 在 2026 年对美国、印度和中国共 400 名工程负责人的调查则发现,AI 平均让工程师的生产力提升 34%,但这份红利的分配极不均衡:AI 正在拉大优秀工程师与较弱工程师之间的差距,而不是抹平差距。2

于是,一个尴尬的问题出现了:如果公司上线的代码几乎都是“AI 生成、人类审查”,为什么面试仍要求候选人在 45 分钟内凭记忆从零手写代码?3

二、传统面试为何失效:信号正在崩解

Coinbase 对旧面试流程的内部分析,指出了两个方向相反的失效模式:

  • 假阳性(False Positives):把“URL shortener(短链接服务)”“分布式队列”的标准答案背得滚瓜烂熟的人可以通过面试,但他们展示的其实是“备考能力”,而不是工作真正需要的判断力。
  • 假阴性(False Negatives):拥有优秀架构判断力、但没有刻意背诵固定模式的人反而会被淘汰,而这类人往往恰恰是最适合 AI 原生环境的工程师。

更令人意外的是,Coinbase 发现两轮不同面试之间存在 84% 的相关性。换句话说,两轮成本高昂的面试几乎产出了同一份信号,而且都不是公司最需要的那一个。1

Karat 的数据也支持同一结论:非实时项目作业(take-home project)和自动化编程测试,最容易因 AI 而失去区分候选人能力的效果,因为它们只看“最终产出”,而 AI 几秒钟内就能给出可运行的答案。相比之下,实时面试能够观察候选人“如何”拆解问题、做出决策并与 AI 协作,其价值反而在上升(美国有 79%、中国有 87% 的企业采用实时技术面试)。2

三、作弊军备竞赛:检测与反检测

信号崩解的另一面,是规模化的疑似作弊。首先需要说明数据性质:以下 Fabric 数据来自其自有平台上的面试,并由其自有检测模型判定(门槛是模型预测的作弊概率高于 40%);同时,Fabric 本身也销售作弊检测产品。因此,这些数字应被视为服务商自行统计的数据,而不是经过独立确认的真实作弊率。4 5

数据 来源
在 19,368 场面试中,38.5% 超过模型的“疑似作弊”门槛;技术岗位为 48%,销售岗位为 12% Fabric(2025/07–2026/01,由自有模型标记)
被标记为疑似使用 AI 作弊的候选人比例,在六个月内从 15% 升至 35% Fabric(自行追踪 5 万名候选人)
据一名受访高管估计,某科技公司有 80% 的候选人在明令禁止的情况下仍使用 LLM 完成在线编程测试 Karat(单一受访者的说法)6
被标记者中有 61.1% 的面试分数仍达到晋级门槛;如果没有被检测出来,他们会直接进入下一轮 Fabric
工作经验为 0–5 年的初级候选人,被标记的比例约为资深候选人的两倍 Fabric

Cluely、Interview Coder、Leetcode Wizard 等作弊工具声称使用 DirectX / Metal 层的 GPU 叠加层(overlay),将答案显示在屏幕捕获层之下,使得面试官看到的共享画面是“干净的”。传统的标签页切换检测、浏览器锁定和常规屏幕共享,可能无法发现这种底层叠加方式。这些技术描述大多来自作弊检测服务商,目前仍缺乏独立第三方的完整技术审计。企业因此开始转向行为分析、线下身份验证和重新设计题型;最新一代工具甚至采用“耳机加场外 LLM”的方式,让屏幕上完全不留痕迹。4

后果也已开始显现。媒体正在报道“靠 AI 骗过面试、入职后原形毕露”的案例,不过这类报道大多来自匿名个案和招聘负责人的观察,尚不能据此估算实际发生率。可以确定的是,面试表现与实际工作能力之间的落差,正成为企业关注的生产力和团队士气成本。7

四、企业的两条应对路线

路线一:回归线下,加强防作弊措施

  • Google:Google 首席执行官 Sundar Pichai 表示,公司将确保“至少有一轮面对面面试”来确认基本功;几乎所有软件工程师职位都已恢复至少一轮线下面试。8
  • Amazon:要求候选人正式确认,面试期间不会使用未经授权的生成式 AI 工具;政策保留明确授权的例外,违规可能导致候选资格被取消。
  • Anthropic:允许候选人使用 AI 润色申请材料和准备面试,但实时面试与常规带回作业(take-home assessment)默认禁止使用 AI,除非题目明确授权。有趣的是,部分技术测试会刻意允许使用 AI,却仍因自家 Claude 能力持续提升而必须不断改版。
  • McKinsey、Deloitte、Cisco:在部分职位和流程中增加线下验证,并非所有职位一律要求线下。Deloitte 早在 2024 年就已在英国应届生招聘中恢复面对面环节。9
  • 其他手段还包括类似 SAT 标准化考试的监考方式、要求摄像头拍摄工作环境,以及使用键盘或眼动检测软件等。

路线二:拥抱 AI,重写面试

  • Coinbase:分三个阶段重建面试流程(2025 年下半年先在前端岗位试点,2026 年 1 月扩展到基于代码仓库的后端题型,2026 年 3 月全面引入“AI 熟练度(AI Fluency)”信号),并从三个维度定义 AI 熟练度:使用(Usage)、应用时机(Application)和理解局限(Understanding Limits)。最终聚焦于三项基准信号:基于代码仓库的编程与调试、AI 辅助的系统设计(这一环节仍处于早期测试阶段),以及领导力与行为面试。同时坚持不增加面试轮数1
  • Canva:直接宣告:“可以在面试中使用 AI——事实上,我们明确要求这样做(Yes, You Can Use AI in Our Interviews. In fact, we insist)。”后端、机器学习和前端候选人都应当在面试中使用 Copilot、Cursor 或 Claude 等工具;评估重点则转向拆解模糊需求、策略性地使用 AI,以及批判性审查和修复 AI 生成的代码。10
  • Meta:2025 年官方证实,正在测试允许候选人使用 AI 助手的编程面试。2026 年第三方候选人指南显示,部分面试环境已经提供多个模型供候选人切换,但 Meta 尚未公开一份适用于全球的完整政策。11
  • Datadog:发布了正式的候选人 AI 使用准则。特定职位会明确安排“AI 编程面试(AI coding interview)”,其余实时编程面试默认禁止使用 AI,边界清晰透明。12
  • Karat 的“human-led, AI-enabled(人类主导、AI 赋能)”模式:由实时面试官配合允许使用 AI 的环境,观察候选人如何与 AI 协作、验证输出和处理幻觉。目前仍有 62% 的企业禁止面试中使用 AI,但趋势明显在走向开放(美国已有 38%、中国已有 68% 允许使用)。2

两条路线并不冲突。许多公司同时“恢复线下”与“开放 AI”:线下面试确保候选人身份真实并具备基本功,开放 AI 则确保评估贴近真实工作方式。

五、AI 也坐上了面试官的位置

这场变革是双向的。求职者使用 AI 海投,LinkedIn 上的求职申请量一年内暴增 45%,平均达到每分钟 11,000 份13招聘团队被 AI 生成的简历淹没,于是企业也开始使用 AI 筛选和面试:

  • Greenhouse 在 2026 年对美国、英国、爱尔兰、德国和澳大利亚共 2,950 名活跃求职者进行了调查;其中 63% 的美国受访者表示曾接受 AI 面试,比半年前约增加 12–13 个百分点。14
  • 体验却并不理想(同样主要以美国受访者为主):38% 的人曾因为招聘流程包含 AI 面试而直接退出,另有 12% 表示如果被要求参加就会退出;完成 AI 面试的人中,51% 从未收到任何结果通知。
  • 候选人并非反对 AI 本身,他们反对的是不透明的使用方式

这形成了一场荒诞的军备竞赛:AI 写简历、AI 筛简历、AI 负责面试;候选人用 AI 回答,企业再用 AI 检测 AI。双方都在使用 AI,却又互相指责对方使用 AI。

flowchart LR
    A[求职者使用 AI 批量生成简历] --> B[招聘团队每分钟收到 11,000 份申请]
    B --> C[企业使用 AI 筛选和面试]
    C --> D[候选人使用 AI 回答甚至作弊]
    D --> E[企业再用 AI 检测 AI]
    E --> A

六、评估重点的转移:从“背诵”到“判断”

综合各家实践,AI 时代面试真正想要评估的能力已经收敛为以下几点:15

  1. 指挥 AI 的能力:提示词质量、任务拆解,以及知道何时应该或不应该使用 AI。
  2. 审查与判断:能否分辨“正确的解法”和“看起来正确的解法”,并找出 AI 信心十足地写下的架构错误。
  3. 在现有代码库中工作:初步排查问题、调试他人(或 AI)编写的代码,理解依赖关系和回滚风险,因为真实工作几乎从来不是从一张白纸开始。
  4. 基本功依然重要:Canva 明确表示,代码熟练度与技术深度仍是绝对要求,只是评估情境变了;没有基础,就无法有效审查 AI。
  5. 技术品味与判断力:知道什么值得构建、哪些取舍是真实存在的,以及何时应该否决模型。Coinbase 认为,所有信号最终都在衡量这些素质。

七、求职者应该重点训练的能力

与其为面试规则的变化而焦虑,不如把时间投入正确的能力。

mindmap
  root((求职者能力地图))
    刷题基本功
      仍是常见题型
      从速度转向推理深度
      边做边讲胜过默默刷题
    系统设计
      讲清楚取舍
      资深岗位的分水岭
      把 AI 当顾问但保留最终判断
    AI 协作
      精准提问
      逐行验证输出
      找出 AI 的错误
    代码阅读与调试
      理解现有代码库
      根据错误信息定位问题
    口头解释与沟通
      说出每项决定的理由
      展示接受或否决 AI 的原因

1. 刷题(LeetCode)还重要吗?重要,但考法变了

经常有人说“刷题已经过时”,但也许结果并非如此;不过,首先应当诚实说明证据质量。多个 2026 年的面试准备来源与候选人反馈显示,LeetCode 式题目在大型科技公司的面试中依然常见。长期追踪技术面试演变的 techinterview.org 和 TechScreen 都指出,多数编程环节仍包含一到两道 LeetCode 风格的题目;后者更直接指出,因为“刷题已死”而准备不足,是代价最高的错误。16 17不过,这些来源缺少透明、可复现的跨公司统计方法(TechScreen 本身也销售面试辅助产品),所以只能证明“这种题型仍然常见”,无法精确证明它在所有公司都占主流。更确定的一点是:Google 的新制试点面试表明,即使允许使用 AI,扎实的数据结构与算法基础依然必不可少。

真正改变的是“如何练习”:

  • 从解题速度转向推理深度:几年前比的是速度,如今面试官更看重候选人能否讲清思路、应对追问,并在条件改变时调整解法。
  • 从默默刷题转向边做边讲:面试准备社区的普遍建议是,与其安静地多刷几道题,不如把重点放在边解题边讲解上,因为现在的面试更像一场技术对话。这是经验性建议,并非经过实证的量化结论。
  • 刷题是策略的一部分,而不是全部:Educative 联合创始人 Fahim ul Haq 的结论很中肯——2026 年刷 LeetCode 依然值得,但它应该服务于整体准备策略,而不是成为唯一策略。18

2. 系统设计能力还重要吗?依然是资深岗位的重要分水岭

当越来越多的“动手实现”交给 AI 时,“决定架构和取舍”的价值反而会上升。多位资深面试官都认为,系统设计比以往更加重要。但这里需要注明:“其重要性在 AI 时代上升”是根据工作内容变化得出的合理推论,目前还不是由跨行业纵向数据支持的量化结论。可以确认的证据如下:

  • Coinbase 将“AI 辅助的系统设计”列为新面试流程的三项基准信号之一,明确要求候选人在设计过程中展现与 AI 协作时的判断力。
  • 曾任 Facebook 面试官的 Arslan Ahmad 回忆,资深候选人如果设计能力不达标,即使编程能力过关,也可能被降级录用(例如从 E5 降到 E4)。19
  • The Pragmatic Engineer 提醒,所有职级都会考查编程能力,而系统设计是资深岗位的决定性环节;职级越高,其权重越大。20

与其背诵“标准架构图”,不如练习讲清楚取舍:为什么选择这个数据库?流量增长十倍时,哪里会先崩溃?发生故障时该怎么办?同时,也要练习在设计过程中把 AI 当作顾问,并由自己保留最终判断权。

3. AI 协作能力:新的必修课

Google 在 2026 年面向美国部分团队、针对初级与中级工程岗位试行的新面试,提供了最清晰的证据:候选人可以在新的“代码理解”环节使用官方提供的 Gemini,面试官则直接评估“AI 熟练度”,包括提示词质量、输出验证和调试能力。这仍然是有限试点,并不代表所有 Google 软件工程师面试都已经改制,但方向已经非常明确。21 22可以这样练习:

  • 平时就用 AI 处理真实任务,并养成逐行检查输出的习惯。
  • 练习精准提问:提供充分的上下文、说清限制条件与预期结果,而不是含糊地说“帮我做好”。
  • 练习找出 AI 的错误。一项涵盖 16 个模型和 576,000 份代码样本的研究发现,“依赖包幻觉”(引用不存在的软件包)在商业模型中的平均比例至少为 5.2%,在开源模型中则达到 21.7%;实际比例会因模型、语言和提示方式而显著不同。23能否识别这类错误,正是面试官希望看到的能力。

4. 代码阅读与调试:比从零写代码更常见的日常工作

Google 试点中的新环节考查的是“理解、调试并优化现有代码”,而不是从零编写;Coinbase 的题型也改为在接近真实场景的项目中发现并修复问题。多份 2026 年的面试指南都将“调试 AI 生成的代码”称为新的核心技能。24训练方式很务实:阅读开源项目中的他人代码,练习根据错误信息定位问题,并把 AI 生成的代码当作待审查的代码,逐段找出问题。

5. 口头解释与沟通:能解释比仅仅解出来更重要

越来越多公司的防作弊与评估手段,就是追问“为什么这样设计”。带回作业之后,通常还会有真人追问。平时就练习说出每个技术决定背后的理由;面试时,也应清楚展示为什么接受或否决 AI 的建议。这些解释本身就是很强的积极信号。

6. 无 AI 环境下的基本功:仍会在线下面试中验证

Google 恢复线下面试、Amazon 加强面试合规要求,意味着“没有 AI 时你会什么”仍会被检验。基本功的角色已经改变:不再是为了默写答案,而是为了让你有能力审查 AI。没有基础,就无法判断 AI 给出的内容是否正确。AI 应该用来弥补弱点,而不是掩盖弱点。

结语

随着 AI 发展,面试不再是每隔几年更新一次的静态流程,而是一款需要持续迭代的产品。Coinbase 愿意公开自己“尚未解决的问题”,例如题目的有效期、面试表现与实际工作表现之间的相关性,这恰恰说明整个行业仍处于早期阶段。对求职者而言,最好的准备策略从未如此“诚实”:候选人真正能够长期积累的护城河,其实是三种可迁移能力:

  1. 把模糊问题拆解成可验证的子问题(规格、边界情况与取舍,即 spec / edge cases / trade-offs)
  2. 在不确定性中做出决策,并清楚说明理由(技术品味与判断力,即 taste / judgment)
  3. 把 AI 当作加速器,而不是拐杖

延伸阅读(本站相关文章):ChatGPT 越用越焦虑?AI 时代知识工作者的心理健康指南

参考资料

  1. Coinbase — Interviewing Engineers in the AI Era: Lessons from a Year of Rebuilding  2 3 4

  2. CNN(ABC17News 转载)— AI is changing this job so fast the interview process can’t keep up 

  3. Fabric — We Analyzed 19,368 Interviews. 38.5% Were Cheating.  2

  4. Connecting People — 38% of tech candidates cheat with AI in interviews 

  5. Karat — AI in Interviews: Cheating or the New Normal? 

  6. The Straits Times — Job hunters are using AI to cheat in interviews, and failing at the office 

  7. India Today — Google brings back in-person job interviews as CEO Sundar Pichai cracks down on AI cheating 

  8. Computerworld — To counter AI cheating, companies bring back in-person job interviews 

  9. Canva Engineering — Yes, You Can Use AI in Our Interviews. In fact, we insist 

  10. WIRED — Meta Is Going to Let Job Candidates Use AI During Coding Tests 

  11. Datadog — Interviewing at Datadog: AI Guidelines 

  12. Semafor — Recruiters swamped with AI-generated job applications 

  13. Greenhouse(Morningstar/PR Newswire 转载)— 63% of Job Seekers Have Faced an AI Interview 

  14. Engineering Leadership — How to Evaluate AI Fluency in Technical Interviews 

  15. techinterview.org — From Brainteasers to LeetCode to Take-Homes: The 30-Year Arc of Tech Interviews 

  16. TechScreen — Do FAANG Companies Still Ask LeetCode? (2026) 

  17. Fahim ul Haq(Medium)— Is it still worth doing LeetCode in 2026? 

  18. Grokking the Tech Career — How will System Design evolve in the AI era? 

  19. The Pragmatic Engineer — Preparing for the Systems Design and Coding Interview 

  20. Business Insider — Google Plans to Let Software Engineers Use AI in Job Interviews 

  21. Levelop — Google Coding Interview 2026: What Changed 

  22. USENIX Security 2025 — We Have a Package for You! A Comprehensive Analysis of Package Hallucinations by Code Generating LLMs 

  23. Formation — How technical interviews are evolving with AI 

Eason Cao
Eason Cao Eason is an engineer working at FANNG and living in Europe. He was accredited as AWS Professional Solution Architect, AWS Professional DevOps Engineer and CNCF Certified Kubernetes Administrator. He started his Kubernetes journey in 2017 and enjoys solving real-world business problems.
comments powered by Disqus