Deep Research Agent 的 FC-SFT 冷启动:从 71% 到 94% 的工具调用准确率如何做出来

Deep Research Agent 要稳定完成多工具协同,不能只依赖通用模型的原生 Function Calling。围绕 FC-SFT 冷启动链路,讲清种子数据构造、Teacher 轨迹生成、质量过滤、防遗忘混合训练和评估闭环。

发布于 2026-05-13

用 AgentSight 看清 ANOLISA 中 Agent 的 Token 消耗明细

Agent 运行时的 Token 成本往往来自系统提示词、历史消息、工具调用和重复上下文回放。AgentSight 是 ANOLISA 的可观测组件,可以监控 Agent 状态、追踪 LLM 调用、按会话和对话拆解 Token 消耗,并通过命令行或可视化面板定位成本异常。

发布于 2026-05-11

AI 工程交付中的知识沉淀:Harness 工作流的知识库架构设计

Harness Engineering 的关键不只是编排 Agent 工作流,更要让团队经验持续沉淀成可复用的知识资产。围绕知识分层、Git 化协作、按需检索、生命周期治理和异步人机协作,讲清 AI 工程交付系统该如何设计知识闭环。

发布于 2026-05-11

7 个 AI 开发工作流 GitHub 项目:模型路由、Agent 记忆与自动内容生成

围绕 AI Coding 和生成式内容工作流,梳理 9router、jcode、agentmemory、SuperSplat 等 7 个 GitHub 项目的定位、核心机制、适用场景和上手方式,帮助快速判断哪个工具能解决当前问题。

发布于 2026-05-10

Claude Code 多 Agent 机制解析:Subagent、Fork 与 Coordinator

Claude Code 的多 Agent 机制可以拆成常规 Subagent、Fork Subagent 和 Coordinator 三套设计。核心在于工具隔离、上下文隔离、异步消息通信、Prompt 缓存复用以及协调者并行调度。

发布于 2026-05-09

大模型 Scaling 路线的四重边界:能力、能源、供应链与教育应对

大模型通往 AGI 的主流路线面临能力、能源、供应链和分配机制四类边界。围绕 scaling 竞赛、数据中心资源消耗、隐形标注劳动、UBI 方案和 AI 教育工具,梳理普通人理解和应对这一轮 AI 变革的关键问题。

发布于 2026-05-08

Codex Chrome 插件:让 AI Agent 操作已登录浏览器的工作流设计

Codex Chrome 插件让 AI Agent 可以操作用户已经登录的浏览器页面,完成填表、跨网站信息整理、报销提交、多标签页协作等任务。重点讲清它解决的问题、核心机制、典型工作流以及使用时必须注意的安全边界。

发布于 2026-05-08

Vibe Coding 时代程序员的核心能力:上下文、验证与成本控制

AI 编程工具已经能生成复杂业务代码,程序员的优势不再是简单地说 AI 做不了什么,而是能定义问题、构建上下文、验证结果、做技术决策并控制 Token 成本。

发布于 2026-05-08

RAG 生产落地的三大难点:文档解析、检索调优与效果评估

RAG 系统跑通 Demo 并不难,难点在于把知识库问答调到生产可用。核心问题集中在文档预处理、检索质量调优和效果评估三层,每一层都会直接影响最终回答质量。

发布于 2026-05-08

AIHOT 的 Skill、RSS 和 API 接入指南:让 Agent 自动追踪 AI 动态

AIHOT 是一个面向 AI 动态的信息聚合服务,支持通过 Skill、RSS 和 API 接入。这里讲清楚三种接入方式分别适合什么场景,以及如何让 Agent 自动获取 AI 日报、精选动态、分类消息和关键词搜索结果。

发布于 2026-05-08