八张 RTX 3090 本地部署 DeepSeek-V4-Flash:32K、64K、128K 实测
前两天还在纸面上计算 DeepSeek-V4-Flash 本地部署需要多少硬件,这次不继续算账了,直接上机器。 我最快能调动的本地算力就是八张 RTX 3090。为了腾显存,还把其中四张卡上常驻的 Qwen3.6-27B 服务停了。模型前一天晚上就开始下载,结果中途网络断掉,第二天又重新来了一遍。百兆网拉一百多 GB 的模型,确实很磨人。 ...
TOTP 每 30 秒换一次验证码,手机离线怎么和服务器对上?
最近在好几个平台配置 2FA 时,它们都会让我打开 Google Authenticator 扫一个二维码。扫完以后,手机上就出现了一串六位验证码,每隔一小段时间自动刷新。把验证码填回平台,就能通过校验。一直没有仔细研究过这是为什么。 更奇怪的是,生成验证码时手机甚至不需要联网。它到底怎么知道服务器此刻想要哪一串数字?如果双方各算各的,时间难道不会慢慢漂移吗? ...
Agent Loop 怎么写:并行工具调用、停止条件与最小执行循环
从一次 Tool Call 走到真正会继续工作的 Agent Loop:模型调用工具、观察结果、继续决策,直到给出最终回答或触发停止条件。 昨天上班看日报时,很开心看到 DeepSeek-v4-flash-0731 正式发布,对它期待甚高。一直以来主力模型都是海外模型,但是频频封号、支付困难,层层难关只是为了给老外送钱,心里很不是滋味。倒不是要站位,只是被卡脖子的滋味不好受,在哪个领域都一样。 ...
模型到底是怎么调用工具的:从 Chat Template 到 Function Calling
手把手教你从零开发一个 Agent(1)。本期主要深入讲:什么是 Function Calling,什么是 tools,以及 LLM 实际看到了什么。 工具调用不是模型直接执行了你的函数。模型做的是读取工具说明,生成一段结构化的调用请求;真正的函数由应用侧执行,结果再回传给模型,由模型组织最终回复。 ...
手把手教你从零开发一个 Agent(0):Responses API 与多轮对话记忆
本系列应该会放 Coding Agent 的教程,以及如何开发一个 Agent,后续会往 pi-agent 的实现思路继续学习。 我会按真实开发经历梳理记录,并尽量从需求倒推实现。这样比较好理解,但弊端也很明显:我会在这个过程中踩坑,而且有些坑可能要过一阵子才意识到。再叠个甲,笔者也是小菜鸟,如有错误,欢迎指出。 ...