垂类系统的agent如何设计
核心矛盾1:垂直深度 vs 水平覆盖 一个「霸总甜宠」skill 要写到能指导 LLM 生成高质量脚本,需要非常具体的规则——比如「第一集前两分钟必须完成阶级落差建立」「打脸节奏三集一小五集一大」。但这些规则对一个 30 秒广告完全没意义,对 80 集长剧又太稀疏。 ...
核心矛盾1:垂直深度 vs 水平覆盖 一个「霸总甜宠」skill 要写到能指导 LLM 生成高质量脚本,需要非常具体的规则——比如「第一集前两分钟必须完成阶级落差建立」「打脸节奏三集一小五集一大」。但这些规则对一个 30 秒广告完全没意义,对 80 集长剧又太稀疏。 ...
首先我们要分析清楚cc现有的几个处理信息的模式: 核心维度 ReAct 隐式 plan Plan → Do 显式 plan Workflow 编排脚本 /loop 定时轮询 /goal 目标驱动 一句话理解 边想边做 先计划,再执行 用脚本编排多个 agent 定时重复跑任务 给目标,自动跑到收敛 计划可见性 低,计划藏在模型内部 高,plan 可审查 最高,控制流写在脚本里 基本无计划 中低,目标明确但路径隐式 执行方式 单 agent 串行 单 agent 串行 多 agent 并行 / pipeline 单 agent 周期执行 ...
github robothttps://github.com/pbakaus/agent-reviews 这个项目让我想到一个有意思的场景:一个让人血压升高的下午 你提了一个 PR,信心满满。几秒钟后,Copilot 来了,CodeRabbit 来了,Cursor Bugbot 也来了。它们在你的代码行上密密麻麻留下几十条评论:这里可能空指针,那里命名不规范,这个函数复杂度超标。你认认真真改了一轮,git push。 ...
headroomhttps://github.com/chopratejas/headroom 官方的说法是它是个给 AI agent 省 token 的"压缩中间层"。 AI agent(比如 Claude Code)干活时,要把一大堆东西塞给大模型读——工具输出、日志、报错、检索结果、文件内容、聊天历史。 ...
特性分析集成支持deepeval 通过一个统一的 Tracing 核心层来兼容所有框架。无论外部框架的形式如何不同,最终都汇聚到同一套数据模型和 trace 管理器。 Monkey-Patch 直接替换 SDK 类方法 Callback Handler 实现框架原生回调接口 ...
安装powershell安装 scoop bucket add extras scoop install extras/wezterm scoop install pwsh scoop install yazi这里的pwsh是powershell 7,现在更多都是用pwsh了,后面主题出现的inner liner错误,基本上都是没用pwsh的原因。 启动WezTerm是独立的应用,你可以直接搜索打开,也可以在pwsh直接输入WezTerm打开,都可以 打开你会发现默认是C盘system32的cmd.exe,这显然不是很好,我们可以配置一下,打开pwsh: notepad $env:USERPROFILE\.wezterm.lua没有就新建一个,然后给出最小配置: local wezterm = require 'wezterm' return { config.default_prog = { ‘pwsh.exe’, ‘-NoLogo’ } default_cwd = ‘D:/OS’, }默认打开powershell,然后给出默认路径(嘿,这图还是powershell的,就是因为我后面主题错了,所以前面才换成pwsh): ...
最近在楼下停车场散步,反思了一下最近遇到的bug,觉得蛮有意思的,写篇blog分享一下。 prompt engineering的useful和useless上文我们已经从架构的方面去讨论过多种的agent架构,主要还是分为隐式plan、半显式plan和显式plan的三种不同的agent风格, 那么在前年的prompt engineering的时代,RAG是那时候的热门话题,为什么要RAG呢,是因为LLM落地的第一大问题:大模型训练的语料是公开语料和通用规律,它是不知道公司内部文档、你自己的笔记和古早之前的上下文的,那时候连web search的清洗都是非常困难的,所以大模型的幻觉非常强。 ...
github link:https://github.com/gsd-build/get-shit-done/blob/main/README.zh-CN.md ...
如果要去design一个agent架构,避免不了的就是涉及到对session的管理和agent的架构,一个是表面的,一个是深层的 session管理常见可以分成以下几类: 一类是 thread/checkpoint 型(LangGraph、Dify、Flowise) 一类是 runtime snapshot/controller 型(AutoGen、OpenHands) 一类是 workspace/project 型(Open WebUI、AnythingLLM、FastGPT、LobeHub) ...
context其实跟infra息息相关,好的infra能支持非常多的idea并发的去实现,而pipeline的高度耦合使得infra变得屎山中的屎山,所以模块化的context infra势在必行。我们想构建一个context playload,一个有序、分层、可度量的 typed blocks 集合,是模型单次推理的输入态。 Context Engineering:围绕 payload 的三类能力: ...
一、workflow我习惯的方式是opencode + gpt5.2 xhigh来吵方案,然后claude code + opus + sonnet来写代码,他们有以下几个区别: gpt通常有包月的套餐,一天能用60~120刀不等,中转站包月通常一个月不会超过80 rmb,是非常实用的大模型套餐 gpt 5.2 不带codex对标的是opus4.5,gpt 5.3 codex对标的是sonnet 4.5,所以推荐gpt 5.2不带codex进行方案的讨论 ...
agent最基本的就是ReAct范式,其中最关键的就是agent plan,我们主要探讨的是单agent的plan和多agent不同范式如何plan的更好。 单agent单agent plan指的是同一个agent在一个 loop 里:规划 → 执行(工具调用)→ 观察 → 反思/重规划 → … → 完成。 ...