Kimi Code 面试最后一页
岗位一句话
把概率模型接入真实仓库、工具和开发流程,建设可恢复、可观测、可验证的 Agent runtime / harness;不是做 ReAct demo,也不是只调 prompt。
回答公式
结论 → capability frontier →
PUB/PRODUCT/TRACE/EVAL事实面 → 真实控制路径 → 失败模式 → 证据与指标 → tradeoff
任何回答如果只有名词,没有错误语义、验证或取舍,都还不够深。公开源码回答“能否审计机制”,不回答“是否能力领先”。
六个技术支柱
| 支柱 | 必须说出的词 |
|---|---|
| Loop | Turn/Step、steering、cancel、typed retry、budget、dedupe、verifier |
| Tool | schema、effect、receipt、idempotency、PTY、backpressure、partial effect |
| Context | smallest sufficient evidence、stable prefix、retrieval、compaction invariants |
| State | append-only journal、reducer、migration、replay、artifact、reconciliation |
| Safety | workspace trust、sandbox、capability policy、secret broker、injection |
| Eval | real task、first bad decision、harness disclosure、broken-task audit、rollout |
六个核心判断
- Provenance/可验证性与 frontier capability/先进性是两个正交轴;Kimi 是 glass box,Codex、Claude Code、pi 是 reference cohort,不凭 source openness 排名。
- 模型能力与 harness 能力必须做 ablation 才能归因。
- 长 context 是容量,不是相关性;context engineering 不会因 1M 消失。
- “Agent 说完成”不是完成;外部 verifier 才定义完成。
- Multi-agent 只在可分解、低冲突、可独立验证时值得。
- 安全体验靠确定性 containment 降低权限摩擦,不靠更多弹窗。
白板默认架构
Clients -> Session API -> Orchestrator
|-- Loop/State Machine
|-- Context Engine
|-- Tool Plane -> Policy/Sandbox/MCP/Remote
|-- Verifier
|-- Subagent Scheduler
+-- Journal -> Reducers -> Transcript/Trace/Eval
\-> Artifact Store
Scope:App -> Workspace -> Session -> Agent -> Turn -> Step。
恢复语义
- cancellation ≠ rollback;
- timeout ≠ tool 未产生副作用;
- unknown effect 不盲目 retry;
tool intent -> effect receipt,缺 receipt 时先 reconciliation;- context overflow 走 compaction/replay;
- quota/auth/schema 错误 fail fast;
- transient + idempotent 才 bounded retry。
指标树
主指标:verified、regression-free、用户接受的任务完成率。
Guardrails:time/cost、人工接管、permission burden、recovery、破坏性 incident、无关 diff、p95 latency。
报告必须带:model、harness、tools、effort、budget、repo commit、task validity、runs/variance。
三个项目必须各有
- 用户后果;
- 真实控制路径;
- 第一次错误决定/根因证据;
- 你的关键设计;
- 删除了什么复杂度;
- verifier 与量化结果;
- 剩余风险。
四个不能说空的话
- “加 retry” → 先分类错误、幂等与副作用;
- “加一个 Agent” → 先证明可分解度和协调收益;
- “上下文越长越好” → 讲 attention、成本、cache 和污染;
- “benchmark 提升了” → 讲任务有效性、harness、预算和真实用户指标。
反问优先级
- 当前最主要的 failure cohort 与可信线上指标是什么?
- 怎样区分该训练模型还是该改 harness?
- 从 trace 假设到 eval、canary、线上 rollout 的闭环怎样运转?
- 入职 90 天后,什么具体证据代表这个人招对了?
最后提醒
- 不声称知道内部架构或优先级;公开代码只作为可验证的讨论起点。
- 闭源后端只写
PRODUCT已确认、INFERENCE或UNKNOWN;不把官方产品 contract 伪装成源码事实。 - Frontier snapshot:Codex 看 durable multi-surface、parallel work、Automations 与 live steering;Claude Code 看多种 orchestration primitive、Goals/Routines、Managed Agents;pi 看 minimal programmable harness;Kimi 看 glass-box control path。它们不是未经同条件 eval 的总榜。
- 最新协议/论文用来提出问题,不用来炫名词。
- 任何不确定性直接限定范围;不把一次 run 说成普遍规律。
- 最后用证据结束:测试、trace、diff、指标、未验证项。
- 协议成熟度快照:MCP
2026-07-28是 final stable;A2A 当前为 stable 1.0.x;ACP wire v1 stable、v2 under development;OpenTelemetry GenAI agent spans 仍为 Development。规范状态不等于生态采用率。 - Kimi Code 证据分层:完整分析快照
e22479a,本轮最终 freshness 核到main的75395f6,最新正式 release0.31.1;不要把三者写成同一个版本事实,更不要由 freshness 推出先进性。