K Agent AtlasKimi Code · Systems
LAST · 最后一页面试校准

LAST

最后一页面试校准

临场回答结构、白板骨架和高质量反问。

100 行约 6 分钟研究基线 2026-08-03

Kimi Code 面试最后一页

岗位一句话

把概率模型接入真实仓库、工具和开发流程,建设可恢复、可观测、可验证的 Agent runtime / harness;不是做 ReAct demo,也不是只调 prompt。

回答公式

结论 → capability frontier → PUB/PRODUCT/TRACE/EVAL 事实面 → 真实控制路径 → 失败模式 → 证据与指标 → tradeoff

任何回答如果只有名词,没有错误语义、验证或取舍,都还不够深。公开源码回答“能否审计机制”,不回答“是否能力领先”。

六个技术支柱

支柱 必须说出的词
Loop Turn/Step、steering、cancel、typed retry、budget、dedupe、verifier
Tool schema、effect、receipt、idempotency、PTY、backpressure、partial effect
Context smallest sufficient evidence、stable prefix、retrieval、compaction invariants
State append-only journal、reducer、migration、replay、artifact、reconciliation
Safety workspace trust、sandbox、capability policy、secret broker、injection
Eval real task、first bad decision、harness disclosure、broken-task audit、rollout

六个核心判断

  1. Provenance/可验证性与 frontier capability/先进性是两个正交轴;Kimi 是 glass box,Codex、Claude Code、pi 是 reference cohort,不凭 source openness 排名。
  2. 模型能力与 harness 能力必须做 ablation 才能归因。
  3. 长 context 是容量,不是相关性;context engineering 不会因 1M 消失。
  4. “Agent 说完成”不是完成;外部 verifier 才定义完成。
  5. Multi-agent 只在可分解、低冲突、可独立验证时值得。
  6. 安全体验靠确定性 containment 降低权限摩擦,不靠更多弹窗。

白板默认架构

Clients -> Session API -> Orchestrator
                         |-- Loop/State Machine
                         |-- Context Engine
                         |-- Tool Plane -> Policy/Sandbox/MCP/Remote
                         |-- Verifier
                         |-- Subagent Scheduler
                         +-- Journal -> Reducers -> Transcript/Trace/Eval
                                   \-> Artifact Store

Scope:App -> Workspace -> Session -> Agent -> Turn -> Step

恢复语义

  • cancellation ≠ rollback;
  • timeout ≠ tool 未产生副作用;
  • unknown effect 不盲目 retry;
  • tool intent -> effect receipt,缺 receipt 时先 reconciliation;
  • context overflow 走 compaction/replay;
  • quota/auth/schema 错误 fail fast;
  • transient + idempotent 才 bounded retry。

指标树

主指标:verified、regression-free、用户接受的任务完成率

Guardrails:time/cost、人工接管、permission burden、recovery、破坏性 incident、无关 diff、p95 latency。

报告必须带:model、harness、tools、effort、budget、repo commit、task validity、runs/variance。

三个项目必须各有

  • 用户后果;
  • 真实控制路径;
  • 第一次错误决定/根因证据;
  • 你的关键设计;
  • 删除了什么复杂度;
  • verifier 与量化结果;
  • 剩余风险。

四个不能说空的话

  • “加 retry” → 先分类错误、幂等与副作用;
  • “加一个 Agent” → 先证明可分解度和协调收益;
  • “上下文越长越好” → 讲 attention、成本、cache 和污染;
  • “benchmark 提升了” → 讲任务有效性、harness、预算和真实用户指标。

反问优先级

  1. 当前最主要的 failure cohort 与可信线上指标是什么?
  2. 怎样区分该训练模型还是该改 harness?
  3. 从 trace 假设到 eval、canary、线上 rollout 的闭环怎样运转?
  4. 入职 90 天后,什么具体证据代表这个人招对了?

最后提醒

  • 不声称知道内部架构或优先级;公开代码只作为可验证的讨论起点。
  • 闭源后端只写 PRODUCT 已确认、INFERENCEUNKNOWN;不把官方产品 contract 伪装成源码事实。
  • Frontier snapshot:Codex 看 durable multi-surface、parallel work、Automations 与 live steering;Claude Code 看多种 orchestration primitive、Goals/Routines、Managed Agents;pi 看 minimal programmable harness;Kimi 看 glass-box control path。它们不是未经同条件 eval 的总榜。
  • 最新协议/论文用来提出问题,不用来炫名词。
  • 任何不确定性直接限定范围;不把一次 run 说成普遍规律。
  • 最后用证据结束:测试、trace、diff、指标、未验证项。
  • 协议成熟度快照:MCP 2026-07-28 是 final stable;A2A 当前为 stable 1.0.x;ACP wire v1 stable、v2 under development;OpenTelemetry GenAI agent spans 仍为 Development。规范状态不等于生态采用率。
  • Kimi Code 证据分层:完整分析快照 e22479a,本轮最终 freshness 核到 main75395f6,最新正式 release 0.31.1;不要把三者写成同一个版本事实,更不要由 freshness 推出先进性。
⌘ K

搜索术语、机制、故障或面试问题