杂技浅尝

25GB 内存就能跑 GLM-5.2?我在 RTX 3060 上实测了 744B MoE

先说结论:能跑是真的,能不能用是另一回事,别抱太大期待。 在我的 RTX 3060 开发机上,GLM-5.2 744B 最终跑到了约 0.44 tok/s。工程上挺有意思,但离正常聊天还差得远。 这里的“25GB”是项目宣称的最低量级,不是我的整机占用。本次 Linux 可见约 39GiB,进程 RSS 约 27GB;它适合验证 MoE 路由、缓存和磁盘流式推理,不适合交互聊天或 Agent。 ...

2026-07-17 · 10 分钟 · 4913 字 · Updated: 2026-07-21 · 
杂技浅尝

人脸识别为什么要眨眼还要闪各种颜色的光

今天办业务需要人脸识别,拿起手机把我的小胖脸放入框中眨眨眼,等待灯光闪烁,随后就是通过,这个已经见怪不怪了,偶尔还要张张嘴,左右摇头,我知道他这是在确认我是不是真人,但是哪怕我做过简单的人脸识别,我也没有深究过人脸活体检测具体有多少方法,以及闪光是在干嘛,本文对此做了调研和解释。 ...

2026-07-17 · 4 分钟 · 1817 字 · 
杂技浅尝

vLLM + Qwen3.6 视频推理踩坑记录

vLLM + Qwen3.6 视频推理踩坑记录:AV1、OpenCV 与视频采样问题 Info 之前 qwen3.6-27b 模型发布后没多久我就部署他 并且测试过视频能力,一直是公司内部署的主力离线大模型。 所以我认为一直可用,但是今天同事提了个新的需求,要从视频中找出属于广告部分的内容裁剪掉。我首先给出的方案是 用 Qwen3-ASR+Qwen3-ForcedAligner 模型来获取 文本内容以及时间轴,再用 LLM 来判断哪些文本属于广告内容,随后根据文本所对应的时间轴裁剪视频,先这样子给同事搭建了环境让他去跑几个试试,同时我来试试直接让 qwen3.6 读视频是否可行。结果一来就给我个报错 ...

2026-07-16 · 5 分钟 · 2113 字 · 
什么是什么

什么是 CUDA:用 Java 世界的类比看懂 Driver / Toolkit / PyTorch / Conda

AI 开发配置 conda / cuda / pytorch / nvidia-driver 很容易混淆,让人头疼,实际上踩过几次坑就能摸清它们的概念和关系了。本文尝试用 Java 开发者熟悉的语言,对照解释几个常见概念。 CUDA 是 NVIDIA 提供的 GPU 并行计算平台和编程生态。 日常 AI 开发最容易混淆的是:Driver 负责让系统驱动 GPU,PyTorch 安装包通常自带所需的 CUDA Runtime,而 CUDA Toolkit 主要在编译 CUDA C++ 或扩展时使用;Conda 负责隔离项目环境。 ...

2026-07-14 · 5 分钟 · 2474 字 · Updated: 2026-07-21 · 
琐碎快记

chatgpt 你不打算 chat 了吗

先留个能被搜到的结论:截至 2026-07-14,macOS 上误删 ChatGPT Classic 后,可以尝试运行 brew install --cask chatgpt-classic 恢复;能否安装取决于 Homebrew 当时是否仍保留这个 cask。 自从更新 chatgpt 和 codex 之后,我手贱的把 chatgpt classic 给卸载了,现在找不回来了,我怀念我的 option+space openai 是不打算继续服务普通 chat 用户了吗,或者应该把那个功能恢复吧 ...

2026-07-14 · 1 分钟 · 190 字 · Updated: 2026-07-21 ·