原标题:《WebLLM: high-performance in-browser LLM inference engine》 评分: 127 | 作者: saikatsg 💭 浏览器 GPU 都不稳,还谈高性能推理? 🎯 讨论背景 WebLLM 是一类把大模型推理直接搬到浏览器里的引擎,依赖 WebGPU(浏览器内的 GPU 计算 API)来获得可用性能。评论显示,这种方案在桌面浏览器上并不“开箱即用”:Linux 上常要手动打开实验性开关,浏览器还可能因为驱动栈和显卡选择问题而只用到集显或软件回退。即使能跑,模型权重也通常要先下载几百 MB 到 1GB,所以它更像“把推理端塞进网页”而不是轻量应用。讨论还把它和 Transformers.js、ONNX Runtime、llama.cpp 等 browser-side / wasm 推理方案放在一起比较,反映出网页端 AI 生态正在分流到多个技术栈。 📌 讨论焦点 WebGPU 兼容性与显卡选择困难 很多人先卡在最基础的一步:浏览器里根本没有可用的 WebGPU,直接报 WebGPUNotAvailableError。Firef