2026 年 AI 模型能力的六条技术主线:从 Agent 工程到具身智能

2026 年 AI 模型竞争正在从聊天能力转向工程执行、图像编辑、具身操作、私有智能体、数学科研和安全评估。围绕 GLM-5、MiniMax M2.5、FireRed-Image-Edit、Xiaomi-Robotics-0、ABot、Aletheia 等案例,拆解模型能力升级背后的技术路线和落地约束。

发布于 2026-02-13

FireRed-Image-Edit 的图像编辑模型设计:数据引擎、三阶段训练与文字编辑奖励

FireRed-Image-Edit 是一个面向复杂指令图像编辑的开源基础模型,重点提升指令遵循、主体一致性、文字编辑、多图参考和画质修复能力。核心设计包括规模化编辑数据引擎、三阶段训练流程,以及面向文字布局的 OCR 奖励机制。

发布于 2026-02-12

FireRed-OpenStoryline 架构解析:用 MCP 构建可交互的视频剪辑 Agent

FireRed-OpenStoryline 是一个开源视频剪辑 Agent,能够理解素材、规划故事线、调用剪辑工具,并通过自然语言接受用户修改。它的关键设计包括 Agent Client、Storyline Middleware、MCP Server、资源库和可复用的 Editing Skill。

发布于 2026-02-10

2026 智能体编码趋势:软件开发从写代码走向编排 AI Agent

智能体编码正在把软件开发从逐行编码推向任务编排。围绕软件生命周期、多智能体、长时运行、人机监督、非技术团队开发和安全治理,梳理 2026 年组织该如何落地 AI 编程能力。

发布于 2026-02-10

Agent 沙箱技术选型:从本地运行时到 Firecracker MicroVM

Agent 获得代码执行和文件读写能力后,必须通过沙箱限制文件系统、网络、进程和资源边界。这里系统讲解 Local Runtime、WASM、Docker、gVisor、MicroVM 的隔离原理、适用场景和工程选型方法。

发布于 2026-02-07

用 6 个 Skills 搭建 OpenClaw 自动化学习工作流

OpenClaw 的 Skills 可以把大模型从聊天工具扩展成能搜索资料、解析课件、生成知识结构、规划练习、记录进度和润色中文表达的工作流系统。以《世界电影史》课程为例,拆解 6 个 Skills 的职责、调用方式和注意事项。

发布于 2026-02-06

OpenClaw Skills 实战:让 AI Agent 操作浏览器并安装邮件能力

OpenClaw 可以通过 Skills 调用浏览器、邮件等外部工具,把聊天机器人从“会回复”扩展为“能执行任务”的 AI Agent。这里以默认集成的 agent-browser 和手动安装 email Skill 为例,讲清楚 Skills 的作用、使用方式和配置流程。

发布于 2026-02-05

AgentScope-Java Skill 渐进式披露机制:让多能力 Agent 按需加载上下文

多能力 Agent 如果把所有领域知识都塞进 System Prompt,会浪费上下文并降低可扩展性。AgentScope-Java 的 Skill 机制通过元数据、指令、资源三层加载,让 Agent 先知道可用能力,再按任务加载 SOP、参考文档和脚本。

发布于 2026-02-04

Deep Agents:面向复杂多步骤任务的多智能体架构

Deep Agents 是构建复杂 AI Agent 的多智能体框架,适合处理长期运行、多步骤规划、文件系统上下文、子代理协作和持久记忆等任务。内容围绕它解决的问题、核心机制、适用场景和上手方式展开。

发布于 2026-02-04

FunctionGemma 工具调用微调实战:让模型正确选择业务工具

FunctionGemma 可以把自然语言请求转换为函数调用,但通用模型不一定理解企业内部的工具选择策略。这里用“内部知识库搜索”和“Google 搜索”的路由任务,讲清 FunctionGemma 微调的原因、数据准备方式、训练流程、评估方法,以及 FunctionGemma Tuning Lab 的无代码使用方式。

发布于 2026-02-03