Agent Loop 怎么写:并行工具调用、停止条件与最小执行循环
从一次 Tool Call 走到真正会继续工作的 Agent Loop:模型调用工具、观察结果、继续决策,直到给出最终回答或触发停止条件。 昨天上班看日报时,很开心看到 DeepSeek-v4-flash-0731 正式发布,对它期待甚高。一直以来主力模型都是海外模型,但是频频封号、支付困难,层层难关只是为了给老外送钱,心里很不是滋味。倒不是要站位,只是被卡脖子的滋味不好受,在哪个领域都一样。 ...
模型到底是怎么调用工具的:从 Chat Template 到 Function Calling
手把手教你从零开发一个 Agent(1)。本期主要深入讲:什么是 Function Calling,什么是 tools,以及 LLM 实际看到了什么。 工具调用不是模型直接执行了你的函数。模型做的是读取工具说明,生成一段结构化的调用请求;真正的函数由应用侧执行,结果再回传给模型,由模型组织最终回复。 ...
手把手教你从零开发一个 Agent(0):Responses API 与多轮对话记忆
本系列应该会放 Coding Agent 的教程,以及如何开发一个 Agent,后续会往 pi-agent 的实现思路继续学习。 我会按真实开发经历梳理记录,并尽量从需求倒推实现。这样比较好理解,但弊端也很明显:我会在这个过程中踩坑,而且有些坑可能要过一阵子才意识到。再叠个甲,笔者也是小菜鸟,如有错误,欢迎指出。 ...
Git 合并策略怎么选:merge、squash、rebase 的区别
我本地刚提交了一点东西,还没 push,为了保持 git 链路干净,我执行 git pull --rebase,我对他的概念不够透彻,然后冲突了。 打开 VS Code 一看: Current Change 不是我刚写的 Incoming Change 反而是我刚写的 第一反应是:这不对吧??? 后来才发现,不是 VS Code 标错了,是我一直把 Current 和 Incoming 脑补成了“我的”和“别人的”。这两个词对我这个英语菜鸟而言真的很容易把人带歪。 ...
25GB 内存就能跑 GLM-5.2?我在 RTX 3060 上实测了 744B MoE
先说结论:能跑是真的,能不能用是另一回事,别抱太大期待。 在我的 RTX 3060 开发机上,GLM-5.2 744B 最终跑到了约 0.44 tok/s。工程上挺有意思,但离正常聊天还差得远。 这里的“25GB”是项目宣称的最低量级,不是我的整机占用。本次 Linux 可见约 39GiB,进程 RSS 约 27GB;它适合验证 MoE 路由、缓存和磁盘流式推理,不适合交互聊天或 Agent。 ...