25GB 内存就能跑 GLM-5.2?我在 RTX 3060 上实测了 744B MoE
先说结论:能跑是真的,能不能用是另一回事,别抱太大期待。 在我的 RTX 3060 开发机上,GLM-5.2 744B 最终跑到了约 0.44 tok/s。工程上挺有意思,但离正常聊天还差得远。 这里的“25GB”是项目宣称的最低量级,不是我的整机占用。本次 Linux 可见约 39GiB,进程 RSS 约 27GB;它适合验证 MoE 路由、缓存和磁盘流式推理,不适合交互聊天或 Agent。 ...
先说结论:能跑是真的,能不能用是另一回事,别抱太大期待。 在我的 RTX 3060 开发机上,GLM-5.2 744B 最终跑到了约 0.44 tok/s。工程上挺有意思,但离正常聊天还差得远。 这里的“25GB”是项目宣称的最低量级,不是我的整机占用。本次 Linux 可见约 39GiB,进程 RSS 约 27GB;它适合验证 MoE 路由、缓存和磁盘流式推理,不适合交互聊天或 Agent。 ...
今天办业务需要人脸识别,拿起手机把我的小胖脸放入框中眨眨眼,等待灯光闪烁,随后就是通过,这个已经见怪不怪了,偶尔还要张张嘴,左右摇头,我知道他这是在确认我是不是真人,但是哪怕我做过简单的人脸识别,我也没有深究过人脸活体检测具体有多少方法,以及闪光是在干嘛,本文对此做了调研和解释。 ...
vLLM + Qwen3.6 视频推理踩坑记录:AV1、OpenCV 与视频采样问题 Info 之前 qwen3.6-27b 模型发布后没多久我就部署他 并且测试过视频能力,一直是公司内部署的主力离线大模型。 所以我认为一直可用,但是今天同事提了个新的需求,要从视频中找出属于广告部分的内容裁剪掉。我首先给出的方案是 用 Qwen3-ASR+Qwen3-ForcedAligner 模型来获取 文本内容以及时间轴,再用 LLM 来判断哪些文本属于广告内容,随后根据文本所对应的时间轴裁剪视频,先这样子给同事搭建了环境让他去跑几个试试,同时我来试试直接让 qwen3.6 读视频是否可行。结果一来就给我个报错 ...
昨天刷到一个 AI 移动硬盘的广告,结合前段时间老板和我说的 AI NAS,本来没怎么放在心上,因为我本身不会是前者的客户,后者又不是小公司能做的,不过整理硬件的时候,发现一个 Frefly 的 RK3588 盒子,灵机一动、RK3588 有 NPU,理论肯定有人做这个端侧LLM 的推理。 ...
今天在看 codex 的 system prompt 看到对 codex 的要求是 优先用 rg,我只知道这个工具比 grep 快,似乎是个现代化的 grep,那得学,我是现代人。 参考了几篇文章:Levon 的 文本搜索神器rg的使用教程、Autumn Skerritt 的 Ripgrep cheatsheet、Marius Schulz 的 Fast Searching with ripgrep,以及官方的 ripgrep README 和 User Guide。 这篇不是全文搬运。我只是把我最可能用到的东西重新按自己的脑回路记一遍。 ...