过去十年,浏览器是「看」网页的工具;2024 年之后,它正在变成「算」网页的容器。WebGPU 标准的全面落地,让浏览器第一次可以直接调用本地显卡,速度比 WebGL 快一个数量级——这一次,受益最深的是 AI 大模型。
WebGPU 解决了什么
以前的 WebGL 是为 3D 图形设计的,它能跑大模型但路径非常别扭。WebGPU 重新设计了三层核心:计算着色器(compute shader)、现代 GPU 内存模型、低开销指令提交。这些特性恰好是大模型推理最需要的底层能力。
实测下来,同样一颗 M2 芯片,在 WebGPU 上跑 7B 参数模型的速度比 WebGL 快 5-10 倍,某些操作甚至能接近原生框架。
「在浏览器里跑大模型」意味着什么
第一,零安装。打开网页就是入口,没有下载 Docker、没有 Python 环境、没有驱动兼容问题。隐私敏感的数据不会离开本机——这在医疗、法律、教育等场景格外重要。
第二,跨平台。一次开发,Windows、macOS、Linux、Android 都能跑(iOS Safari 仍在跟进)。对企业来说,前端同学可以做过去只有客户端工程师才能做的事。
第三,可组合。WebGPU + WebAssembly + IndexedDB,让开发者可以做出同时具备本地推理、本地存储、本地工具调用的完整 AI 应用,而这一切都在浏览器里。
现实难点
WebGPU 并非银弹。第一,模型大小仍受限于设备内存——普通笔记本 16GB 显存是上限,要跑 70B 仍需云端。第二,浏览器厂商的实现仍有差异,Chrome、Edge、Firefox 之间的兼容性需要工程化适配。第三,电量与散热,移动设备跑 7B 模型依然吃力。
已经能做什么
今天的浏览器里已经有几十个 demo:本地运行的 LLM 聊天、写代码助手、图像生成、语音转录。主流开源模型(Llama、Mistral、Phi、Qwen)的 GGUF/ONNX 版本大多有现成的 WebGPU 加载方案。
对于个人开发者,这意味着做 AI demo 的门槛从未如此之低;对于企业,这意味着把 AI 嵌入 SaaS 产品的路径被打开——在不依赖云服务的情况下,前端就能交付真正可用的智能功能。
下一步:前端工程师怎么准备
不需要理解 GPU 编程的所有细节,但需要熟悉三个新工具:Transformers.js、ONNX Runtime Web、web-llm。这三个库已经把绝大多数大模型推理封装成「下载即用」的 JavaScript 接口。
WebGPU 不会取代云端 GPU 集群,但它会重新定义「轻 AI」的边界——以后轻量任务先在浏览器解决,重任务再回云端,会成为最自然的分层架构。


