原标题:《1-Bit LLM in the Browser》 评分: 22 | 作者: simonebrunozzi 💭 连 car wash 都过不了,还叫智能吗? 🎯 讨论背景 这篇帖子讨论的是在浏览器里运行一个极端量化的 LLM,也就是把模型压缩到几乎最小,尽量让推理能在本地 GPU 或浏览器环境中完成。评论里提到的 bitgpu(一个开源的浏览器端 GPU 推理引擎)说明作者并不只是做演示,而是在搭一个可复用的执行框架。大家的关注点一半在速度:不同机器、不同浏览器下的 tokens/s 差距很大;另一半在能力:小模型和新加的 27B 模型都还存在常识判断、calculator tool 和工具识别上的问题。还有人把讨论延伸到 embeddings(向量表征模型)和 re-ranking(重排序模型),说明这类本地推理方案可能不仅用于聊天,还希望覆盖检索和排序等更实用的任务。 📌 讨论焦点 浏览器性能与硬件差异 有人主要在比较这类浏览器端 LLM 的实际吞吐。不同设备和浏览器差异非常大:AMD 7900XTX 上最小模型只有 2.5 tps,而 MacBook Pro 上有