智能体 · 工具边界 · 评测恢复 · 全栈落地

智能体工程实践

以 OperCerta 与 FieldPilot 记录复杂业务系统中的智能体设计:模型负责语义理解, 状态、规则、工具和数据由工程系统约束;测试、评测与运行证据共同说明结果。

GitHub
01

Agent Runtime 与状态

设计 Agent Loop、Context/State、Checkpoint/Replay、HITL 与失败恢复,让长流程可暂停、可追溯。

02

Tool Calling、MCP 与 RAG

把模型限制在明确的工具与知识边界内,结合权限策略、检索引用、缓存和副作用控制。

03

评测、Trace 与可靠性

以固定数据集、契约测试、Verifier、幂等约束和可观测 Trace 验证行为,而不是只展示对话效果。

04

全栈产品化

使用 FastAPI、PostgreSQL、Redis、React/Vue、Docker 与 CI,把 Agent 内核交付为可运行系统。

旗舰项目 / 01

OperCerta

可恢复、可评测、可审计的受控 Agent Runtime

历时一个月持续开发与验证。单根 LangGraph Agent Loop 串联模型、ToolPolicy、MCP Observation 与最终验证; 完成 Kimi K2.6 代表性 Tool Calling 兼容验证,并以有界超时、输出校验与 fail-closed 控制模型异常。

项目主页呈现架构、运行证据与评测结果;完整 FastAPI / LangGraph / MCP / PostgreSQL / Redis 后端可通过本地 Docker Compose 复现。 公网版本不开放写操作,生产级 IAM、高可用与规模化流量不在当前验证范围内。

受控 AGENT 架构

Model → ToolPolicy → MCP Observation → Model

Context/State 与 PostgreSQL Checkpoint 支持 Replay;审批后绕过缓存重新取证, 再由 Verifier、审批绑定与数据库幂等约束守住写入和最终结果边界。

LangGraph · FastAPI · FastMCP · PostgreSQL/pgvector · Redis · React/SSE · OpenTelemetry · Docker
PRODUCT EDGEReact / SSE Console
SECURITY BOUNDARYFastAPI · JWT/RBAC · Validation
AGENT RUNTIMELangGraph · Checkpoint · HITL
TOOLSFastMCP
POLICYDeterministic Guard
TRUTHPostgreSQL
CACHERedis
TRACEOTel
671自动化门禁 · 后端测试
60自动化门禁 · 前端测试
42/42固定评测 · 业务契约
9/9固定评测 · 安全恢复轨迹
0本地合成 · 20×10 并发重复工单
80%本地合成 · MCP 读取 10→2

本地合成评测

缓存开启前后的固定 2×2 矩阵

同一套本地合成输入、每场景 5 次只读 query,三个固定场景的 P50 降低 58%–61%。 结果用于复现缓存行为,不作为生产环境的性能或容量承诺。

场景缓存关闭缓存开启降低
设备维修202 ms85 ms58%
库存补货215 ms87 ms60%
作业恢复234 ms91 ms61%

项目 / 02 · 0.5.0-DEV

FieldPilot

跨城外勤任务编排 Agent

面向多地点外勤与跨省市出差:从地点、日期、工作点时间窗、行程紧密程度和报销范围生成可确认的任务草案, 再由确定性规划、政策校验和独立验证器产出可执行方案;现场变化只重算未执行后缀,并保留 R1 / R2 差异证据。

类型化语义 AGENT HARNESS

类型化语义 Agent Harness

Harness 只把不可信自然语言转换为可确认的 MissionDraft,不承担路线规划、外部工具副作用或数据库写入。 reference_date、timezone 与 user_text 构成最小上下文,业务状态由 Mission、Revision、Event 与 Checkpoint 管理。

PydanticAI · StrictModel · mission-interpret-v1 · tools=() · UsageLimits · idempotent AgentRun
  1. 01
    严格输入与类型化输出请求长度、日期、时区、时间窗、预算与最多 6 个任务均由契约校验。
  2. 02
    No-tool 有界执行Kimi 适配关闭 thinking;timeout、有限重试、请求数和 token 预算共同封顶。
  3. 03
    确定性后处理护栏系统重新计算澄清、安全标签与日期归一化,模型输出仅作为 advisory。
  4. 04
    幂等审计与 Eval 门禁输入指纹、并发唯一约束、脱敏 Trace 与 no-fallback live gate 保留可回放证据。

确定性编排内核

语义理解与确定性执行

用户确认后,Provider 提供外部事实,Bounded Beam Planner 只做有界启发式搜索,Policy Engine 计算费用与报销, Independent Verifier 独立校验。ExecutionCheckpoint 锁定已完成前缀,ReplanEvent 只求解后缀并生成 Revision Diff。

Natural languageTyped HarnessConfirmed MissionProviderBounded BeamPolicy + VerifierR1 + CheckpointSuffix-only R2
FieldPilot 工作台的外勤任务输入、结构化草案与工作流状态界面
FieldPilot workbench · 任务输入与结构化草案边界
15/15Kimi K2.6 live · 无 fallback
100%最终评测 · 状态 / 安全
94.87%最终评测 · 字段精确率
93.33%最终评测 · 澄清精确率
51工程门禁 · 后端测试
TRUE公网 smoke · 已执行前缀保持

EVAL 驱动护栏收敛

评测驱动的护栏收敛

15 个版本化场景覆盖完整与缺失输入、单一交通方式、精确报销字段、任务时间窗和 Prompt Injection。 三轮结果记录了模型自创澄清与安全标签如何被确定性护栏逐步收敛;最终 15/15 live、无 fallback,P50 / P95 为 16.91 / 26.92 秒,共 22,788 tokens。

阶段状态字段澄清安全
真实基线53.33%94.87%0%86.67%
确定性护栏93.33%100%86.67%100%
完整性规则100%94.87%93.33%100%

项目站与可写工作台由 Netlify、Render Docker/FastAPI 和 Neon PostgreSQL 提供公网链路; API health、数据库连通、精确 CORS、R1/R2 smoke 与重启恢复已验收。 公开工作台采用 Mock LLM + Fixture Provider;Kimi K2.6 指标来自独立 no-fallback live eval。高德真实 Key、真实票价库存与预订、生产限流、多租户身份及 SLA 不在当前验证范围内。

开源工程证据

8 项上游合并贡献

覆盖 Cherry Studio、Microsoft Agent Framework、Strands Agents Harness SDK、Langroid、AgentScope、 Mastra、A2A Java 与 Local Deep Research,完整记录 Issue 复现、根因定位、回归测试和维护者 Review。

GitHub · https://github.com/KXHXK

工程方法

模型边界与系统真相

MODEL BOUNDARY → SYSTEM TRUTH

不确定性的工程边界

LLM 处理语义与开放输入,确定性代码负责权限、状态、业务规则、副作用与最终验证。

  • 01 / 类型化边界:约束输入、输出、工具权限和最小上下文,拒绝模型补写未知事实。
  • 02 / 状态与恢复:使用 Checkpoint、Replay、审批绑定和幂等写入管理长流程。
  • 03 / 证据驱动:通过固定评测、契约测试、Trace 与失败回放定位真实问题。
  • 04 / 全栈闭环:将 Agent 内核接入 API、数据层、产品界面、CI 和可复现部署环境。