云砺 · 研发中心 半月对齐汇报 | 呈:吴总 | 汇报人:樊国柱

把尺子立起来,再谈托付

承接年中述职「从 AI 可用,到 AI 可托付」:可托付的前提是可度量。本半月,运维 Agent 的基线与考题库、开发流程的全链路与门禁、本体的机制化验收全部落地;谷雪梅专家协同进入"实物交付 + 定时机制"阶段。

周期 2026-08-15 ~ 09-01 配合 9-1 Bi-weekly 证据可回溯:34 场会议 / 10 份纪要 / 本机 Agent 全量记录
01

半月一览

六个数字读完本报告
93%
运维 AI 初诊覆盖率
5 月仅 7%,已成规模
≈22%
初诊严格准确率
停滞,主战场已定位
157+85 题
两代运维评测集
题源 2,800+ 条真实工单
128.7 万行
代码盘点交付熵海
IP 与出域边界成文
500+
半月 commits(AI 主导)
18 个 PR 合并,单人驱动
0
本体验收假阳 / 回归
三方合验,31 项指标全中
核心判断:运维 AI 的瓶颈已从"接不接得住"(覆盖率 93%)转移到"查得对不对"(严格准确率 ≈22%)。根因实锤为知识供给断层——Agent 字典滞后本体 4.7~9.7 倍。下半月投入重心从堆场景转向知识供给 + 本体接入,P0 补账清单已出。
02

三项近期要求,逐项对齐

要求 → 动作 → 结果 → 下一步
谷雪梅 专家协同熵海领航机制已建立
要求:定时沟通,了解新技术、吸取熵海经验教训,形成我们自己的架构和规范。
  • 8-18董办立任务"技术框架对齐",8-25 完成,提前 6 天;定时同步机制经 AI 提效专项会确立
  • 8-21与陈岳阳、翟保延赴熵海现场深度交流约 2 小时,7 条经验教训入库(确定性代码+窄上下文、先 Skill 级不动参数、benchmark 天级迭代、规避 FDE 模式等)
  • 8-24~27转化为自有规范:《RSI 落地方案》+ Phase0 终稿(23 张票 / 关键路径 11.5 天,评审通过);"谷雪梅三问"定为立项门槛
  • 8-23~25实物交付:3 个候选库全历史打包 128.7 万行 / 40,486 commits,断网可编译,OSS 交付;IP 边界成文(题库/判分器/微调 delta 归云砺)
陈岳阳 协作AI 创新部高频共推
要求:和陈岳阳配合好。
  • 半月同场 19 次,为全部关键人中最高频(周二 ai agent 例会×3、计费专项日会×5、共赴熵海、AI 转型沟通会等)
  • 8-24共同评估 RSI 可行性与自备算力成本约束;共同建立运维 Agent 抽样基线
  • 8-25共同确认对外代码库遴选与出域边界
  • 8-27RSI 落地方案获其认可,形成研发 / AI 创新部共同施工图
朱伟 销售对齐销售中心逐项接住
要求:与销售端对齐,对着客户的收入和提效降本做。
  • 周一销售经营会 3 场全勤(8-17/24/31);8-17 响应"销售与技术双向协同"
  • 8-24阿里云 MCP 广场按期上架(8-23 内部 deadline);定价对接朱伟/吴总确认中
  • 接住"产品投诉根源整改"要求:产研并行推进 35 个 Top 问题,Q3 分级节奏(小 2-3 天 / 中 1 周)
  • 对着收入做:天猫优品 9 月底门店试点(差异化 = 发票数据湖仓)、松下 AI 审单 9-18 集成 10 月上线、益海嘉里 9-30 验收前 8 项整改、SSP 100+ 漏洞拟用 AI 修复
03

三方向进展 · 对照年底验收目标

年中述职既定框架,共用 OntoOS 底座

方向一 | AI Agent 接管运维基线已立

年底验收:Top3 高频场景进入 Agent 闭环,辅助闭环率 ≥30%、人工处理时长 -30%(建议线)
  • 现网基线首次测清:初诊覆盖率 93%(5 月 7%),但严格准确率 ≈22% 停滞(2,614 条工单评估);更严的 157 题基准上根因命中 AC@1 仅 10.7%、误移交率 50% —— 第一次用数字回答"我们的 AI 到底几分"
  • 根因实锤 = 知识供给断层:Agent 字典滞后本体 4.7~9.7 倍(调用边表 178 vs 844,MQ 565 vs 5,454);四个失分环节合计占 46% → P0 一周补账清单已出
  • 评测资产建成:两代考题库(157 题全集 → 85 题脱敏公开集 + 独立判分器),题源 2,800+ 条真实工单;分诊技能 100 条真实工单路由全对
  • 经营口径对齐(8-31 销售会):数字员工 Q3 规划 30 场景、已落地 10+;全局 AI 自动化处理率目标 30%→50%(3 个月),人工 case 13,000→9,000
运维 AI 初诊:覆盖已成,准确是主战场
同为百分比口径,来源:2,614 条工单评估 v3 与 157 题基准实测
初诊覆盖率 93% 5 月 7% 严格准确率 ≈22% 停滞 → 本半月主攻点 基准根因命中 10.7% 157 题基准 · 更严口径 025 5075 100%

方向二 | AI 接管开发流程链路已通

年底验收:1 条产品线跑通需求→设计→编码→测试→发布全流程,SOP / Skills / 评测可复用
  • AutoDev 平台跑通「任务创建 → 前端需求分析 → 开发 → code review / 合并 → 部署测试环境」全链路,人机协作(HITL)看板建成
  • 工程吞吐实证(AI 主导、单人驱动):ontoos_extract 半月 431 commits、18 个 PR 合并、净增约 8 万行;各仓合计 500+ commits;质量不放水——单 PR 最多 40 轮 AI 评审、207 评审线程全清,内部成果敢自判不通过
  • 开发评测集建成:金标回放 1.000;区分度实测 oracle 0.978 vs 低质取巧 0.118,"踩红线压分"机制有效
  • 技术债首次量化:两大核心仓代码重复率 42.6% / 37.8%(对照仓 11.9%)——4.0 重构与 AI 治理有了基线数字
  • 方法论沉淀:重大选型均用「多 AI 专家并行方案 + 统一评分融合」(7 份方案 6 维互评、6 家框架横评),选型定为 Inspect AI + Harbor,决策有分数、可复现

方向三 | OntoOS 企业本体底座验收机制化

年底口径:跟着三项目标建设,补齐语义、数据、接口、权限、审计与证据链,不按独立平台验收
  • 数据质量过硬:两轮全量复跑(16h58m),三方独立合验 假阳 0、回归 0、真链 175 持平、31 项行数指标全中;验收从人工判断升级为"模板出具 + 可独立复算"的机制;并主动揪出 1 处数据勘误与 1 处安全风险
  • 湖仓半月增量:ODS 101→110 表、DWD 1→3、DWS 29→33(5 月从 19 张起步);取数技能扩至 6 层面 77 场景、48 个 SQL 模板,新增代码探查/DMS 取数/中间件直连三技能
  • 代码资产家底摸清:4 平台 6,185 仓、2.33 亿行(去重 1.80 亿行)入飞书多维表格,定位 10 个最具 RSI 价值仓库——"形成自己的架构和规范"有了完整底图
  • 新湖仓落地:HoloGres + DataWorks 以 4.5 折包年采购,6 核心库 110 张表全量同步中,支持 Claude Code 直连查询
04

客户侧落点 · 对着收入和降本做

与 AI 创新部共创 + 销售支撑清单

茶姬智能客服(熵海共创)已上线放量

  • 节奏:8-10 南宁/长沙上线 → 8-17 推广 12 城市仓 → 8-24 覆盖 30 仓
  • 8-31 运营数据:日使用 1,300+ 人次、累计用户 1,800+
  • 已衍生 1-2 人月新增需求(商务跟进中);产品规划文档已沉淀

提效降本在客户合同上的落点

  • 松下 AI 审单获客户认可:9-18 集成、10 月上线;智能审单单次调用成本约 0.5~0.6 元,可规则化持续降本
  • 计费对账专项:布丁酒店试点跑通;里程碑 8 月底 5 家试点 → 9 月底计费 Agent + 合同 AI 预审 → 12 月底全平台 304 家客户合同对比
  • 天猫优品 9 月底上海 6-7 家门店试点,核心差异化能力即研发的发票数据湖仓
  • 益海嘉里 9-30 验收前完成 8 项整改;SSP 扫出 100+ 漏洞拟用 AI 修复
05

AI 投入与成本治理

用量是投入指标,不是绩效指标
全司 AI 网关月度 Token 用量(亿)
7 月创单月新高;8 月完整口径 9 月初出数
113.2 4 月 277.0 5 月 309.1 6 月 508 7 月
季度趋势用于采用度与成本治理,团队用量高度集中于深度使用者。
  • 用量看板改版上线:token / 请求 / 成本三指标贯穿,新增性能页(首字延迟、解码速度);飞书群 @ 机器人即可自助查额度与个人用量
  • 网关观测底座治理:明细查询 115 秒 → 秒级;44 万条请求日志入湖零失败;失败自动回滚 + 飞书心跳的无人值守升级
  • Agent 能力商业化前瞻(呈决策参考):完成"能力上架腾讯 WorkBuddy 等 AI 工作平台"调研——knowhow 保护须走私有 Runtime + 三协议适配路线,合规备案是关键路径,已备 P0/P1/P2 上架形态矩阵
06

半月硬数字台账

全部可回溯,口径见第 09 节
指标数值口径说明
运维 Agent
AI 初诊覆盖率93%8 月;5 月为 7%。工单评估 v3(2,614 条)
初诊严格准确率≈22%三次快照停滞;8 月样本 18%(6/33)
基准根因命中 AC@1 / 误移交率10.7% / 50%157 题基准首测,幻觉组件 0
评测题库157 + 85 题两代口径;题源 2,800+ 条真实工单,脱敏零残留
知识字典滞后倍数4.7~9.7 倍Agent 字典 vs 本体(边表 178/844,MQ 565/5,454)
开发流程
半月工程吞吐500+ commits主仓 431 commits、18 PR、净增约 8 万行,AI 主导单人驱动
评审强度峰值40 轮 / 207 线程单 PR 的 AI 评审循环,全部清零后合并
核心仓代码重复率42.6% / 37.8%jscpd 统一口径;对照仓 11.9%。技术债基线首次量化
OntoOS 底座
全量验收假阳 0 · 回归 00829 批 16h58m,三方独立合验,31 项行数指标全中
湖仓表增量(半月)ODS 101→110DWD 1→3、DWS 29→33;5 月从 19 张起步
代码资产盘点2.33 亿行4 平台 6,185 仓,去重净量 1.80 亿行,入飞书多维表格
协同与客户
熵海代码交付包128.7 万行3 库全历史 40,486 commits,断网可编译,OSS 交付
茶姬智能客服30 仓 · 日 1,300+ 人次8-31 口径,累计用户 1,800+
会议协同34 场 / 27.2 小时陈岳阳同场 19 次、朱伟 3 次、吴总 3 次(含 8-18 专项会)
运维 case 结构(参考)周均 10-12 单IP 被税局封禁类;碧桂园 7 月 201 单中影像占用类 69%
07

风险与请示

五件事,三件需要吴总表态
1. 熵海组织变动信号。获知智能客服拟移交熵海 2 队,其主方向转向 aiceo/aihr——共创模式的节奏与驻场安排需要重估。 请定与熵海合作的应对策略与节奏。
2. 运维 AI"覆盖≠准确"。93% 覆盖率下严格准确率停滞在 ≈22%,投入重心应从"堆场景"转向"知识供给 + 本体接入",P0 补账清单已出。 请认可该优先级调整。
3. 代码出域边界。与熵海合作按"2 个验证库推进、phoenix 4.0 核心不出域"执行(已与王皓、岳阳商定)。 请背书该口径,作为后续对外合作的统一红线。
4. AI 转型蓝图汇报在即。实施计划表 V2.3 按反馈返工中(已改多维表格持续维护),9 月初为汇报节点,本半月证据链已备齐。
5. 计费对账专项单点风险。核心成员仅 2 人且身兼多职,9 月底约 30 人天里程碑吃紧;已在专项会明确"不做大改"边界控制范围。
08

下半月计划(9 月上)

每项有验收物
  1. 运维知识供给 P0 补账,一周内完成;判分器人工校准,把自动评分从"暂不可信"(相关性 0.11)拉到可用线9-08 前
  2. Phase0 开发 Benchmark 开工:23 张票排期启动,关键路径 11.5 个工作日9-01 启动
  3. 谷雪梅定时同步机制首次例行会;2 个验证代码库完成交接9 月上旬
  4. AI 转型蓝图董办汇报(实施计划表定稿)9 月初
  5. 松下 AI 审单集成(9-18)、益海嘉里验收前 8 项整改(9-30 前)合同节点
  6. 新湖仓跑量 1 周后作扩容决策;湖仓周会跟进9-08 前
09

口径与证据说明

延续年中述职"诚实呈现"原则
  • 不宣称"研发效率提升 X%":评测基线本半月刚立,尚无同类任务因果对比;先有尺子,再报提效。
  • Token 用量是投入与采用深度指标,不作为绩效;费用为网关计价分析口径。
  • 评测题数 157→85 为两代口径(阶段 A 全集 → 统一框架脱敏公开集),非缩水;LLM 自动判分与人工相关性仅 0.11,已如实标注"暂不可信"并保留人工校准环。
  • 茶姬为与熵海共创产品,收入与商务归属另计;飞书客服迁移(年成本 23.62 万→4 万内)为公司面标杆案例,非研发中心成果,仅作对照。
  • 覆盖率 / 严格准确率 / AC@1 为三个不同严格度的口径,已分别标注样本与来源,不可互相折算。
数据来源:本机 6 类 AI Agent 会话记录(窗口内 2,700+ 文件、约 1.2GB,7 路并行自动挖掘)· 飞书 34 场日程与 10 份智能纪要 · 9 篇文档 · git 提交与 PR 记录。素材台账另存备查,逐项可回溯。
本报告由 Claude Code 汇编生成——多 Agent 并行挖掘、交叉验证、自动成稿,亦为研发中心 AI 工作方式的自证。