显存这事儿得拆开看。Open WebUI 本体是 Svelte 前端加 FastAPI 后端,跑起来吃内存和一点 CPU,几乎不碰显存。真正吃显存的是推理后端——ollama 把 7B/13B 模型 load 进显存的那个动作。所以"吃显存"这锅它背得有点冤。
其实
想客户端零显存也简单:别用带 :ollama 的那个镜像,用 plain 的 open-webui,把 Connection 指到远程 vllm 或者随便哪个 OpenAI-compatible endpoint,你本地机器凉快得很。它最被低估的用法其实就是当个协议壳,很多人以为必须配本地 ollama,其实不是。
你列的三点里"接得明明白白"那条,准确说现在不止 ollama+vllm。只要 OpenAI-compatible 的 API 都能接,LM Studio、llama.cpp 的 /v1、本地 litellm 网关都行,图像模型、STT/TTS 也塞进来了。它早不是"ollama 的皮",定位在往 self-hosted 的 ChatGPT 整站靠。
补一个你没提的火因:多用户和权限。内建账号体系、角色、按组开放模型,这让它真能部署给小团队,而不只是个人玩具。老牌的 text-generation-webui 功能更猛但太开发者向,一打开全是 tab 和参数,普通人劝退。Open WebUI 正好卡在"像产品不像项目"那个甜区。它前身就是 Ollama WebUI,作者 tjbck,后来把协议层抽象出来改名才飞起来的,文档和插件你夸得没错。
我倒是拿它当本地知识库前端,丢一堆技术文档进去跑 RAG,比预想的能打。简单说你老显卡还想继续玩的话,试试 4bit 量化加把 context 窗口压到 4k,显存能省一大截。