Table of Contents

本地 AI 会缩小你的数据边界。 当模型、工具、日志和网络路径都留在设备上时,本地运行时处理的提示词会留在设备上。本地 GPU 不会把电脑变成密封系统。

模型运行时、工具插件、浏览器扩展、远程访问、暴露的 API 和模型下载仍会影响你的风险。成本同样重要。电费可能低于托管服务的 token 价格,但硬件所有权成本会把完整的回本时间推向很远的未来。

本指南先梳理隐私边界,然后使用当前供应商价格、明确的功耗假设和所提供视频中的报告数据检查成本。

这项本地与托管成本比较为下面的公式提供背景。不要在没有使用相同模型文件和运行时测试硬件的情况下,直接复制其中的吞吐量数据。

视频报告的运行时长为 2 分 31 秒。我通过观看页面核实了标题和时长。我没有复现硬件测试,因此其中报告的速度仍属于来源报告的测量结果。

简短答案

  • 为受控的数据路径选择本地推理。 将模型服务器留在设备上,绑定到回环地址,并限制工具访问权限。
  • 为偶尔使用的任务选择托管推理。 当工作量较小时,或你偏好的模型无法在系统上运行时,避免硬件支出。
  • 把本地成本视为两个数字。 将每个活跃小时的电费与硬件所有权成本分开。
  • 把隐私视为系统属性。 当插件上传文件,或本地 API 监听每个网络接口时,私有模型也会失去隐私优势。

当敏感文本必须留在工作站或隔离网络内时,本地推理很有帮助。当你需要离线运行、固定的模型版本,或不受供应商配额影响的稳定访问时,本地推理同样有帮助。

这些优势不代表答案质量更高。托管模型可能更适合某项任务、完成得更快,或需要更少维护。在购买硬件前先测量你的工作负载。

追踪数据路径

绘制请求涉及的每个组件。单看模型名称无法说明数据流向。

组件隐私问题需要收集的证据
本地模型服务器提示词是否留在主机上?进程配置、监听地址和出站流量
云端模型哪些文本、文件和工具结果离开主机?API 端点、供应商条款、请求日志和账户设置
本地应用中的云端模式选中的模型是否在设备上运行?模型标识符、供应商标签和网络连接
工具插件模型是否收到文件、Shell 输出或浏览器内容?工具列表、权限和捕获的请求数据
模型下载哪些代码和权重进入主机?源代码仓库、许可证、发布校验和下载路径
本地日志提示词和工具结果在哪里持久保存?运行时日志、Shell 历史记录、崩溃报告和备份范围

本地模型会从提示词路径中移除一个供应商。 它不会消除审查其余路径的必要性。

本地运行不代表默认私密

Ollama 的隐私政策 说明,当模型在本地运行时,Ollama 看不到提示词或数据。该政策也将本地运行与云端托管模型分开。即使同一个应用同时启动两种模式,云端模型仍会创建一个服务边界。

llama.cpp 的服务器文档 显示,本地服务器默认监听 127.0.0.1:8080。其 Docker 示例也展示了 --host 0.0.0.0,这会让服务暴露在所有接口上。更宽的绑定地址会改变访问边界。

在发送敏感文本前检查监听地址:

lsof -nP -iTCP -sTCP:LISTEN | rg 'ollama|llama|8080|11434'

在通常情况下,127.0.0.1 或 localhost 会将访问限制在同一台主机上。局域网地址或 0.0.0.0 需要防火墙规则和身份验证方案。在同时测试两者前,不要将模型端点暴露到网络中。

同时检查选中的模型名称。Ollama 的云端文档将云端模型描述为独立的服务路径。本地界面不代表本地执行。

Ollama 的 FAQ 记录了仅本地模式。将 disable_ollama_cloud 设置在 ~/.ollama/server.json 中,或在重启服务前设置 OLLAMA_NO_CLOUD=1。这会从选定的运行时中移除 Ollama 云端模型和网页搜索。它不会限制主机上的其他应用、浏览器工具、插件或网络访问。

{
  "disable_ollama_cloud": true
}

重启后验证设置。仅本地运行时会缩小一条路径,但不会建立私有主机。

计算托管成本

Token 价格会区分输入和输出。 Anthropic 将 Claude Haiku 5.5 的价格列为每百万输入 token 0.10 美元、每百万输出 token 0.50 美元,适用于不超过 100,000 token 的提示词 。超过 100,000 token 的提示词使用更高的列示价格。

OpenAI 的 token 指南 说明,单词数量不等于 token 数量。该指南也区分输入、输出、缓存输入和推理 token。使用供应商提供的用量字段,不要使用单词数估算。

对于简单比较,分别使用一百万生成 token 和一百万输入 token 作为两项独立工作负载。编码代理经常发送重复上下文并生成较短答案,因此将 token 合并为一个数字会隐藏成本构成。

计算本地电力成本

NVIDIA 的 RTX 5070 发布公告 列出的起售价为 549 美元。 NVIDIA 的 RTX 5070 系列页面 列出 12 GB 显存,以及 Founders Edition 参考设计的 250 W 总显卡功耗。NVIDIA 产品页面仍列出 549 美元,并且在本次检查期间显示显卡缺货。

显卡功耗不等于整机功耗。使用电表测量电脑。下面的示例假设整机功耗为 400 W,包括 GPU、处理器、内存、存储、风扇和电源损耗。这是用于计算的假设,不是实测结果。

美国能源信息署的预测 将 2026 年平均居民电价按每千瓦时 18.2 美分计算。你的电价会改变结果。

使用下面的公式计算生成输出:

local cost per 1M output tokens =
(whole_system_watts / 1,000)
× (1,000,000 / output_tokens_per_second / 3,600)
× electricity_price_per_kWh

在 400 W 和每千瓦时 0.182 美元的条件下,系统每个活跃小时的成本为 0.0728 美元。

输出速度生成一百万 token 所需时间一百万 token 的电力成本
每秒 20 token13 小时 53 分钟1.01 美元
每秒 50 token5 小时 33 分钟0.40 美元
每秒 94 token2 小时 57 分钟0.22 美元

在每秒输出 50 token 时,本地电力成本低于 Haiku 5.5 的 0.50 美元输出价格。在每秒输出 20 token 时,本地电力成本更高。在这些假设下,输出速度阈值约为每秒 40 token。

输入计算使用相同公式。在每秒输入 2,650 token 时,一百万输入 token 需要约 6 分 17 秒,电力成本约为 0.008 美元。在每秒输入 1,000 token 时,同样的工作成本约为 0.020 美元。

所提供的文字稿报告其 RTX 5070 示例达到每秒输出 94 token 和每秒输入 2,650 token。在 400 W 假设下,上面的算术结果与这些数字一致。文字稿没有提供独立实验室记录、模型文件哈希、运行时构建版本、提示词或电表读数。将这些速度作为参考结果,不要视为购买保证。

硬件会改变回本时间

节省电力本身无法偿还硬件成本。将完整购买成本与托管输出成本和本地可变成本之间的差额进行比较。

在每秒输出 50 token 时:

$0.50 hosted output price - $0.40 local power = $0.10 saved per 1M tokens
$549 GPU price / $0.10 = about 5.5 billion output tokens

在每秒输出 94 token 时,四舍五入后的每百万 token 节省额上升到约 0.28 美元。回收 549 美元 GPU 成本需要约 20 亿输出 token。两个数字都不包括系统内存、存储、主板、电源、散热、维护和转售价值。

发布价不是通用的购买报价。NVIDIA 当前页面显示官方价格,但没有库存。卖家的 819 美元报价需要单独核实后,才能放入回本模型。使用你的真实发票和实测墙上功耗。

已有硬件会改变决定。 如果你的工作站已经具备足够内存和合适的 GPU,硬件成本对于下一项任务来说已经沉没。比较电力、时间、质量、隐私和维护。如果你需要购买完整系统,将完整系统与托管使用进行比较。

如需了解模型适配详情,请阅读 本地 AI 模型与 GPU 上下文指南 和 16GB 显存容量指南 。如需了解报告中的本地编码代理配置,请阅读 Strata 与 OpenCode 指南 。

本地隐私带来的优势

  • 更短的数据路径: 当推理留在本地时,提示词无需到达模型供应商。
  • 离线运行: 已下载的模型和本地运行时不需要实时供应商连接来生成文本。
  • 版本控制: 你选择模型文件和运行时版本,而不是接受供应商的自动变更。
  • 用量控制: 在计算硬件所有权和电力成本后,本地推理无需按请求支付云端费用。
  • 网络策略控制: 防火墙和主机控制决定谁能访问模型端点。

这些收益对源代码、客户记录、未发布设计、私人笔记以及断网环境中的工作最有价值。本地推理仍需要磁盘加密、主机更新、账户隔离和受限工具。

本地隐私无法提供的保障

  • 质量保证: 你需要根据真实验收标准测试更小或量化的模型。
  • 供应链保证: 模型文件、运行时、插件和容器镜像需要可信来源和完整性检查。
  • 干净主机: 恶意软件、浏览器扩展、备份、崩溃报告工具和远程管理仍能看到主机数据。
  • 安全的网络端点: 绑定到所有接口的服务器会创建一个需要防御的新服务。
  • 免费系统: 电力、存储、散热、硬件损耗和维护仍然有成本。

Strata 本地编码代理指南 说明了为什么系统内存、上下文、工具访问和运行时设置都属于评估范围。GPU 显存本身无法定义隐私或性能边界。

选择正确的边界

情况更适合的首选原因
敏感文档和一台已有的兼容电脑本地推理将提示词留在受控主机内,并避免新的硬件支出
偶尔进行通用写作托管 API 或聊天服务为少量工作付费,并避免维护
前沿模型或专用云工具托管服务本地主机上没有所需模型或工具
使用经验证本地模型的大量重复工作本地或混合模式比较电力、质量、支持时间和供应商价格
混合工作负载混合路由将敏感任务留在本地,把获准的通用任务发送给托管模型

混合路由需要明确的分类规则。 将数据标记为仅限本地、获准托管处理,或在审查前禁止处理。不要依靠模型名称或应用图标来执行规则。

在信任前验证

  1. 记录模型路径。 记录模型标识符、运行时、版本和下载来源。
  2. 检查绑定地址。 确认服务器监听回环地址,除非更宽的路径有记录在案的需求。
  3. 列出每项工具。 审查文件、Shell、浏览器、网络和插件访问权限。
  4. 检查持久化位置。 找出提示词日志、工具输出、崩溃报告、备份和共享模型目录。
  5. 测试网络行为。 使用有代表性的提示词进行敏感测试时,观察网络连接。
  6. 测量系统。 记录墙上功耗、输出速度、输入速度、上下文长度和重试次数。
  7. 测试已接受的工作。 比较已完成的任务和审查工作量,不要只比较每秒 token 数。

本地 AI 与 ChatGPT 对比指南 介绍模型能力方面的权衡。将这份隐私清单与质量测试一起使用。

参考资料