Vault 常见问题

Vault 常见问题

主权知识库——文档导入、向量嵌入、RAG 检索、模型无关推理。面向业务负责人,无需技术背景。

最后更新:2026-07-09

跳转到章节

没有匹配的问题,请尝试更宽泛的关键词。
01 · 概述

基础概念 — 什么是 Vault?

9 个问题

Vault 是一个自托管知识库,利用 AI 帮助您从文档中查找信息。它就像为公司内部知识打造的功能强大的搜索引擎。

工作原理如下:

  1. 您上传文档:PDF、Word 文件、网页、电子表格等
  2. Vault 处理文档:将文档拆分为片段,创建 AI 向量嵌入(意义的数值化表示)
  3. 您提问:"我们的退款政策是什么?"或"展示竞业禁止条款的先例"
  4. Vault 找到答案:检索相关文档段落,并使用 AI 生成简洁答案

与普通搜索的关键区别在于:Vault 理解语义,而不仅仅是关键词。即使查询中没有完全相同的词,它也能找到相关信息。

企业面临知识管理难题:

  • 信息分散:文档、Wiki、邮件、Slack 消息、数据库——知识无处不在
  • 搜索失效:关键词搜索会丢失上下文。搜索"退款政策"无法找到"客户退货",即使它们是同一回事
  • AI 工具需要将数据发送到云端:云端 AI 服务(ChatGPT、Glean 等)要求将文档发送到他们的服务器——这对受监管行业而言往往是无法接受的

Vault 通过提供自托管 AI 驱动的知识检索解决这一问题。您的文档留在您的基础设施上。数据不会离开您的服务器。完全主权。

效果员工可以在几秒内找到答案,而不是几小时。无需再翻找文件夹或问同事"那个文件在哪里?"

Vault 专为受监管和数据驻留敏感型组织设计:

  • 医疗行业:符合 HIPAA 的患者记录、临床指南、政策知识检索
  • 法律行业:案件档案、先例、合同的特权文档搜索——无需将数据发送到云端 AI
  • 金融服务:监管文档搜索、合规知识库、审计追踪
  • 政府机构:具有完全数据主权的机密文档检索
  • 欧盟企业:符合 GDPR 的知识管理,具有数据驻留控制

如果您有敏感文档且无法将其发送到云端 AI 服务,Vault 就是为您准备的。

RAG = Retrieval-Augmented Generation(检索增强生成)。这是 Vault 背后的技术。

工作原理如下:

  1. 检索:当您提问时,Vault 首先检索相关文档段落(使用 AI 向量嵌入和向量搜索)
  2. 增强:这些文档段落被增强(添加)到 AI 的上下文中
  3. 生成:AI 然后基于检索到的上下文生成答案

为什么这很重要:

  • 准确性:AI 基于您的实际文档回答,而不是从训练数据中臆测
  • 可追溯性:您可以看到答案来自哪些文档
  • 时效性:AI 使用您的最新文档,而不是过时的训练数据
简单类比RAG 就像在 AI 回答之前给它一本参考书(您的文档)查阅。它不能凭空编造——必须引用来源。

主要区别:

方面ODW.ai VaultChatGPT / 云端 AI
数据位置✅ 自托管——保留在您的基础设施上❌ 发送到 OpenAI/Anthropic 服务器
知识来源✅ 您的文档(RAG)❌ 训练数据(可能已过时)
准确性✅ 基于您的文档,可引用⚠️ 可能产生幻觉或过时
隐私✅ 完全主权❌ 数据发送到第三方
合规性✅ 兼容 HIPAA、GDPR、SOC 2❌ 可能无法满足监管要求
成本免费(自托管)或 $99-$499/月$20-$200/用户/月

ChatGPT 是通用 AI 助手。Vault 是专为内部文档设计的知识检索系统。一般性问题用 ChatGPT;公司特定知识用 Vault。

Glean 和 Onyx 是优秀的云端 RAG 平台,但设计重点不同:

方面ODW.ai VaultGlean / Onyx
部署方式✅ 自托管❌ 云端 SaaS
数据主权✅ 完全控制❌ 数据发送到供应商
开源✅ 核心开源❌ 专有
模型选择✅ 模型无关(本地或 API)⚠️ 限于供应商模型
价格免费(自托管)或 $99-$499/月$10-$30/用户/月
目标市场受监管的中小企业一般企业

如果您没有主权要求并需要托管服务,选择 Glean/Onyx。如果需要完全数据控制或自托管,选择 Vault。

是的。Vault 核心是开源的(Apache 2.0 许可证)。您可以:

  • 免费自托管:下载、部署和使用 Vault,无需付费
  • 修改代码:根据需求定制 Vault
  • 贡献:提交拉取请求、报告漏洞、加入社区

企业层(SSO、高级 RBAC、审计日志、合规功能、高级支持)是付费的。这是我们资助开发的方式。

开源承诺我们相信透明、可审计的代码——特别是对于注重主权的组织。您应该能够验证 AI 工具在做什么。

"主权"意味着完全控制您的数据:

  • 数据位置:您的文档保留在您的基础设施上(本地或私有云)
  • 处理:所有 AI 处理(嵌入、检索、生成)都在您的基础设施上进行
  • 无外部依赖:不会将数据发送到 OpenAI、Anthropic 或任何第三方(除非您选择使用他们的 API)
  • 可审计:您可以检查代码、日志和数据流

这对受监管行业至关重要。如果您的 AI 工具将文档发送到云端供应商,就无法声称数据主权。

部署方面:需要。Vault 是自托管的,所以需要有人能够管理 Docker/Kubernetes、配置网络并监控基础设施。通常是 DevOps 工程师或 IT 顾问。

日常使用:不需要。管理控制台为非技术用户(知识管理员、合规官)设计。您可以在不编写代码的情况下上传文档、创建知识库并查询系统。

开发人员:Vault 提供 REST API 和 SDK(Python、JavaScript)用于自定义集成。开发人员可以构建自定义工作流、将 Vault 集成到内部工具等。

02 · 主权

文档导入与处理

8 个问题

Vault 支持广泛的文档格式:

  • PDF:基于文本的 PDF(扫描的 PDF 需要 OCR——见下文)
  • DOCX:Microsoft Word 文档
  • HTML:网页
  • Markdown:.md 文件
  • 纯文本:.txt 文件
  • CSV:逗号分隔值(结构化数据)
  • JSON:结构化数据

更多格式(PPTX、XLSX、电子邮件格式)计划在未来版本中支持。

扫描的 PDF扫描的 PDF(文本图像)需要 OCR(光学字符识别)来提取文本。Vault 包含基本 OCR,但对于大批量或复杂文档,我们建议在上传前使用专用 OCR 工具(如 Tesseract、Adobe Acrobat)。

Vault 分三步处理文档:

  1. 分块:文档被拆分为较小的块(通常每块 500-1,000 字)。这使检索更精确——Vault 返回回答您问题的具体段落,而不是整个 50 页文档。
  2. 嵌入:使用 AI 模型将每个块转换为数值表示(嵌入)。嵌入捕捉文本的语义——相似含义有相似的嵌入。
  3. 存储:嵌入存储在向量数据库中。当您查询 Vault 时,您的问题也被转换为嵌入,Vault 找到最相似的文档块。

整个过程在您上传文档时自动发生。无需手动配置。

分块是将文档拆分为较小片段的过程。重要的原因:

  • 精确性:Vault 返回回答您问题的具体段落,而不是整个 50 页文档
  • 上下文窗口:AI 模型有有限的上下文窗口(一次能处理的文本量)。分块确保每个片段适合上下文窗口
  • 效率:较小的块检索和处理更快

Vault 提供三种分块策略:

  • 固定大小:块是固定字数(如 500 字)。简单、可预测。
  • 语义:块基于语义——将含义相似的句子分组。更准确,但更慢。
  • 结构化:块基于文档结构(标题、段落、章节)。最适合结构化良好的文档。
建议从固定大小分块(默认)开始。如果准确性差,切换到语义或结构化分块。

向量嵌入是文本的数值表示。它们以 AI 能理解的方式捕捉文本的语义

工作原理如下:

  • 每段文本(句子、段落或块)被转换为数字列表(如 [0.12, -0.34, 0.56, ...])
  • 含义相似的文本有相似的嵌入(数字接近)
  • 含义不同的文本有不同的嵌入(数字相距较远)

示例:

  • "如何申请退款?"和"退货政策是什么?"有相似的嵌入(相同含义)
  • "如何申请退款?"和"今天天气怎么样?"有不同的嵌入(不同含义)

Vault 使用嵌入在您提问时查找相关文档块。您的问题被转换为嵌入,Vault 找到具有相似嵌入的文档块。

可以。Vault 支持批量上传:

  • Web 界面:拖放多个文件或文件夹
  • API:通过 REST API 以编程方式上传文件
  • 连接器:从外部源同步文档(文件系统、S3、WebDAV、SharePoint)

对于大型文档集合(1,000+ 文件),我们建议使用连接器或 API。Web 界面最适合小型上传(10-100 个文件)。

处理时间上传是即时的,但处理(分块 + 嵌入)需要时间。对于 1,000 个文档,预计需要 10-30 分钟处理时间(取决于文档大小和硬件)。

可以。Vault 包含用于外部数据源的连接器框架:

  • 文件系统:从本地或网络驱动器同步文档
  • S3 兼容:从 AWS S3、MinIO 或其他 S3 兼容存储同步
  • WebDAV:从 WebDAV 服务器同步(如 Nextcloud、ownCloud)
  • SharePoint:从 Microsoft SharePoint 同步(企业版)
  • Google Drive:从 Google Drive 同步(企业版)
  • 自定义:使用连接器 SDK 构建自己的连接器

连接器可以按计划同步(如每小时)或实时同步(通过 Webhook)。

会。Vault 支持增量更新:

  • 文件变更检测:Vault 检测文件何时被修改(通过文件系统监控或连接器同步)
  • 重新处理:Vault 仅重新处理更改的文档(而不是整个知识库)
  • 版本控制:Vault 跟踪文档版本——您可以看到回答查询时使用了哪个版本的文档

这确保您的知识库始终保持最新,无需从头重新处理所有内容。

可以。Vault 支持多个知识库:

  • 分离:为不同团队、项目或文档类型创建独立的知识库(如"人力资源政策"、"工程文档"、"法律合同")
  • 隔离:每个知识库有自己的文档、嵌入和访问控制
  • 查询范围:查询特定知识库或跨所有知识库搜索
  • 权限:控制谁可以访问哪些知识库(企业版)

这对于多租户部署(如管理多个客户的 MSP)或有严格数据分离要求的组织很有用。

03 · 集成

方案优势与设计

8 个问题
功能ODW.ai Vault典型替代方案
部署方式✅ 自托管——完全主权❌ 云端 SaaS——数据发送到供应商
开源✅ 核心开源(Apache 2.0)❌ 专有或有限开源
模型选择✅ 模型无关(本地或 API)⚠️ 限于特定模型
按任务模型路由✅ 按查询切换模型❌ 固定模型
价格免费(自托管)或 $99-$499/月$10-$30/用户/月
套件集成✅ 原生 ODW.ai 集成❌ 需要自定义集成
企业功能✅ SSO、RBAC、审计日志、合规⚠️ 各异

Vault 在主权 + 模型灵活性方面具有竞争力。如果您需要完全数据控制并希望选择 AI 模型,Vault 是最佳选择。

PrivateGPT 和 Quivr 是开源 RAG 工具,但设计重点不同:

方面ODW.ai VaultPrivateGPT / Quivr
生产就绪✅ 企业级⚠️ 实验性 / 爱好者级
多租户✅ 内置❌ 仅单用户
访问控制✅ RBAC、文档级权限❌ 无或基础
审计日志✅ 防篡改日志❌ 无
模型路由✅ 按任务模型选择⚠️ 固定模型
支持✅ 提供付费支持❌ 仅社区

PrivateGPT/Quivr 适合实验,但不适合企业生产使用。Vault 专为需要可靠性、安全性和支持的受监管企业设计。

模型无关意味着 Vault 可与任何 AI 模型配合使用——您不会被锁定在特定供应商。

Vault 支持:

  • 本地模型:通过 Ollama、vLLM 或 llama.cpp 在自己的硬件上运行模型(完全主权)
  • API 模型:使用 OpenAI、Anthropic、Google 或自定义端点(需要前沿能力时)
  • 嵌入模型:选择任何嵌入模型(OpenAI、Cohere、sentence-transformers 等)

您甚至可以按查询切换模型——简单问题用本地模型(快速、主权),复杂问题用 API 模型(更强大)。

灵活性模型无关意味着随着更好模型的发布,您可以切换——无需代码更改,无供应商锁定。

可以。Vault 支持完全离线部署:

  • 本地模型:在自己的硬件上运行嵌入和生成模型(通过 Ollama、vLLM、llama.cpp)
  • 无外部依赖:Vault 推理、嵌入或任何核心功能都不需要互联网访问
  • 物理隔离(气隙)环境:部署在物理隔离(气隙)环境中(完全没有互联网访问)

这对互联网访问受限或被禁止的政府、军事和高安全环境至关重要。

硬件要求运行本地模型需要 GPU 硬件(推荐 NVIDIA GPU)。可以进行纯 CPU 推理,但对大模型来说很慢。

Vault 的检索准确率取决于几个因素:

  • 嵌入模型:更好的嵌入模型 = 更好的检索。我们推荐使用最先进的模型(如 OpenAI text-embedding-3-large、Cohere embed-v3)
  • 分块策略:语义分块比固定大小分块更准确(但更慢)
  • 文档质量:结构良好、清晰的文档 = 更好的检索
  • 查询清晰度:清晰、具体的问题 = 更好的检索

目标:基准语料库上≥85% MRR@10(前 10 个结果的平均倒数排名)。这意味着正确答案在 85% 的情况下出现在前 10 个结果中。

调优如果准确性差,请尝试:(1) 切换到更好的嵌入模型,(2) 使用语义分块,(3) 调整块大小,(4) 改写查询。

可以。Vault 提供可配置的检索策略:

  • 相似性搜索:查找最相似的文档块(默认)
  • 混合搜索:将相似性搜索与关键词搜索(BM25)结合。对包含特定术语的查询更有效。
  • 重排序:使用交叉编码器模型在初始检索后重新排序结果。更准确,但更慢。
  • 元数据过滤:按元数据过滤结果(如仅返回特定部门、日期范围的文档)

对于开发人员:Vault 的检索管道是模块化的——您可以使用 SDK 编写自定义检索逻辑。

支持。Vault 支持多语言文档:

  • 文档导入:上传任何语言的文档(英语、中文、西班牙语、法语等)
  • 嵌入模型:使用多语言嵌入模型(如 multilingual-e5、OpenAI text-embedding-3-large)
  • 查询:用任何语言提问——Vault 检索相关文档,不分语言

UI 目前仅支持英语(v1),但多语言 UI 计划在 v1.1 中推出。

可以。Vault 核心是开源的(Apache 2.0 许可证):

  • 透明:所有代码在 GitHub 上公开可用
  • 可审计:您(或您的安全团队)可以检查代码是否有漏洞、后门或数据泄露
  • 可验证:您可以验证 Vault 是否如其所述——没有隐藏的遥测,没有数据发送到第三方

这对注重主权的组织至关重要。您应该能够验证 AI 工具在做什么。

安全审计我们欢迎第三方安全审计。如果您的组织在采用 Vault 前需要安全审计,请联系我们——我们将全力配合。
04 · 安全

检索与查询

8 个问题

Vault 提供多种查询方式:

  • Web 界面:在搜索栏中输入问题(像 Google 一样)
  • API:通过 REST API 发送查询(用于自定义集成)
  • SDK:使用 Python 或 JavaScript SDK(面向开发人员)

查询示例:

  • "我们的退款政策是什么?"
  • "展示竞业禁止条款的先例"
  • "总结第三季度财务报告"
  • "HIPAA 对数据加密的要求是什么?"

Vault 检索相关文档块并使用 AI 生成简洁答案。您还可以查看源文档以进行验证。

可以。Vault 提供来源引用:

  • 答案:基于检索文档的 AI 生成答案
  • 来源:用于生成答案的文档块列表(包含文档名称、页码和相关文本)
  • 置信度分数:Vault 对答案的置信度(基于检索相似性)

这使您能够验证答案并追溯到原始文档——对准确性和可审计性至关重要的受监管行业来说至关重要。

如果 Vault 找不到相关文档,它会说"我不知道",而不是编造答案。

这是 RAG 的一个关键特性——AI 基于您的文档。如果信息不在您的知识库中,Vault 不会产生幻觉。

您还可以配置 Vault 以:

  • 返回部分答案:"我找到了一些相关信息,但不确定是否完全回答了您的问题"
  • 建议相关查询:"我找不到答案,但您可以尝试搜索 X"
  • 标记待审:"这个问题无法回答——考虑向知识库添加相关文档"

可以。Vault 支持对话式查询:

  • 上下文保留:Vault 记住同一会话中您之前问题的上下文
  • 追问:问"能详细说明一下吗?"或"例外情况呢?"Vault 会理解上下文
  • 会话管理:每个对话是独立会话——上下文不会在会话间混淆

这使 Vault 感觉像与知识渊博的同事对话,而不仅仅是搜索引擎。

可以。Vault 支持元数据过滤:

  • 文档元数据:按文档属性过滤(如部门、作者、日期、文档类型)
  • 自定义元数据:为文档添加自定义元数据(如标签、类别、分类级别)
  • 查询时过滤:"显示 2025 年的人力资源政策"或"查找标记为'机密'的法律合同"

这对于您想要缩小搜索范围的大型知识库很有用。

查询速度取决于您的配置:

组件本地(本地部署)基于 API(OpenAI 等)
检索100-500 毫秒100-500 毫秒
生成1-5 秒(取决于 GPU)1-3 秒(取决于模型)
总计1-6 秒1-4 秒

对于延迟敏感的应用,我们建议:

  • 使用快速嵌入模型(如 sentence-transformers/all-MiniLM-L6-v2)
  • 使用快速生成模型(如本地的 Llama 3 8B,API 的 GPT-4o-mini)
  • 启用缓存(经常问的问题会被缓存)

可以。Vault 支持查询结果导出:

  • Web 界面:将结果下载为 PDF、Markdown 或纯文本
  • API:以 JSON 格式检索结果(用于编程使用)
  • 批量导出:一次导出多个查询结果(用于报告或分析)

这对于生成报告、与同事共享答案或出于合规目的归档查询结果很有用。

可以。Vault 提供查询分析(企业版):

  • 查询历史:查看所有用户提出的所有查询(带时间戳、用户和结果)
  • 使用模式:识别经常问的问题、热门知识库和常见主题
  • 成本归因:跟踪每个用户、团队或知识库的 API 成本(如果使用基于 API 的模型)
  • 未回答查询:识别 Vault 无法回答的问题——这些是知识库的空白

这帮助您了解 Vault 的使用情况以及改进知识库的方向。

05 · 部署

安全与隐私

8 个问题

安全。Vault 采用安全最佳实践构建:

  • 自托管:在您的基础设施上运行——数据不会离开您的服务器
  • 加密:静态 AES-256,传输中 TLS 1.3
  • 访问控制:RBAC、文档级权限、SSO(企业版)
  • 审计日志:所有访问和查询的防篡改日志(企业版)
  • 开源:代码可审计——您可以验证没有后门或数据泄露

Vault 专为受监管行业设计。如果您可以使用 Vault,就能通过合规审计。

不能。Vault 在您的基础设施上自托管。ODW.ai 完全无法访问您的文档、查询或嵌入。

与云端 RAG 平台(Glean、Onyx)不同,Vault 不会将遥测数据发送到第三方。一切都留在您的服务器上。

这对注重主权的组织至关重要。如果您的 RAG 工具将文档发送到云端供应商,就无法声称数据主权。

可以。Vault 提供细粒度访问控制(企业版):

  • 知识库级:控制谁可以访问哪些知识库(如人力资源团队可以访问"人力资源政策",法律团队可以访问"法律合同")
  • 文档级:控制谁可以访问特定文档(如只有经理可以访问"高管薪酬")
  • 基于角色:分配角色(管理员、编辑者、查看者)具有不同权限
  • 基于属性:基于用户属性(部门、安全级别等)控制访问

访问控制在查询时执行——如果用户没有权限访问某文档,Vault 不会在查询结果中返回它。

支持。Vault 通过 SAML 2.0 和 OIDC 支持SSO(单点登录)(企业版):

  • Okta:原生集成
  • Azure AD / Entra ID:原生集成
  • Google Workspace:原生集成
  • 其他:任何符合 SAML 2.0 或 OIDC 的身份提供商

SSO 允许用户使用现有的企业凭据登录 Vault——无需记住单独的用户名/密码。

是的。Vault HIPAA 兼容:

  • 自托管:PHI 保留在您的基础设施上——数据不会发送到第三方
  • 加密:静态 AES-256,传输中 TLS 1.3
  • 访问控制:RBAC、文档级权限、审计日志
  • 审计日志:所有 PHI 访问的防篡改日志
  • BAA:如果使用 ODW.ai 托管的 Vault(企业版),我们会签署业务伙伴协议

Vault 帮助您满足 HIPAA 要求的技术保障。您仍需要单独解决管理和物理保障。

是的。Vault GDPR 兼容:

  • 数据驻留:所有数据保留在您的基础设施上(如果使用私有云,则在您选择的区域)
  • 删除权:根据请求删除文档及相关嵌入
  • 访问权:根据请求导出用户数据
  • 数据处理记录:审计日志跟踪所有数据处理活动

Vault 帮助您满足 GDPR 要求的技术和组织措施(第 32 条)。您仍需要单独解决法律和程序要求。

可以。Vault 支持物理隔离(气隙)部署(无互联网访问):

  • 离线安装:在没有互联网访问的情况下安装 Vault(Docker 镜像、离线包)
  • 本地模型:在自己的硬件上运行嵌入和生成模型(无需调用外部服务的 API)
  • 无外部依赖:Vault 不需要互联网访问进行更新、遥测或许可证验证

物理隔离(气隙)部署常见于政府承包商、军事和高安全环境。

Vault 在查询时执行访问控制:

  • 权限检查:在返回结果之前,Vault 检查用户是否有权访问每个文档
  • 过滤:如果用户没有权限,文档会从结果中过滤掉——他们永远看不到
  • 审计日志:所有查询都会被记录(谁查询了什么、何时、返回了什么结果)

示例:初级员工查询"显示高管薪酬"。如果他们无权访问"高管薪酬"文档,Vault 不返回结果——并且查询会被记录以供审计。

06 · 合规

模型与 AI

8 个问题

Vault 是模型无关的——它支持广泛的模型:

嵌入模型:

  • OpenAI:text-embedding-3-small、text-embedding-3-large
  • Cohere:embed-english-v3.0、embed-multilingual-v3.0
  • 本地:sentence-transformers(all-MiniLM-L6-v2、all-mpnet-base-v2 等)
  • 自定义:任何提供 OpenAI 兼容 API 的模型

生成模型:

  • 本地:Llama 3、Mistral、Gemma、Qwen(通过 Ollama、vLLM、llama.cpp)
  • API:OpenAI(GPT-4o、GPT-4o-mini)、Anthropic(Claude 3.5 Sonnet)、Google(Gemini 1.5 Pro)
  • 自定义:任何提供 OpenAI 兼容 API 的模型

您可以随时切换模型——无需更改代码。

可以。Vault 支持本地模型,通过:

  • Ollama:运行本地模型的最简单方式。支持 Llama 3、Mistral、Gemma 等。
  • vLLM:用于生产工作负载的高性能推理服务器
  • llama.cpp:轻量级、CPU 友好的推理(适合边缘设备)

本地模型在您的硬件上运行——数据不会离开您的基础设施。完全主权。

硬件要求本地模型需要 GPU 硬件(推荐 NVIDIA GPU)。可以进行纯 CPU 推理,但对大模型来说很慢。对于生产使用,我们建议至少一块 NVIDIA A100 或同等产品。

可以。Vault 支持基于 API 的模型:

  • OpenAI:GPT-4o、GPT-4o-mini、text-embedding-3-large
  • Anthropic:Claude 3.5 Sonnet、Claude 3 Opus
  • Google:Gemini 1.5 Pro
  • 自定义:任何提供 OpenAI 兼容 API 的模型

基于 API 的模型在您需要本地模型尚无法匹敌的前沿能力(如复杂推理、长上下文窗口)时很有用。

数据主权如果使用基于 API 的模型,您的查询和文档块会发送到 API 提供商。这可能违反受监管行业的主权要求。为获得最大主权,请使用本地模型。

可以。Vault 支持按任务模型路由:

  • 简单查询:使用快速本地模型(如 Llama 3 8B)——快速、主权、低成本
  • 复杂查询:使用强大的 API 模型(如 GPT-4o)——更强大,但数据会离开您的基础设施
  • 自定义路由:定义规则(如"如果查询包含 PHI,仅使用本地模型")

这为您提供了两全其美的方案:敏感查询的主权,复杂查询的能力。

成本优化80% 的查询使用本地模型(快速、免费),20% 的查询使用 API 模型(复杂、付费)。这将 API 成本降低 80%。

选择嵌入模型取决于您的优先事项:

模型速度准确性成本主权
sentence-transformers/all-MiniLM-L6-v2✅ 快速⚠️ 良好✅ 免费(本地)✅ 完全
sentence-transformers/all-mpnet-base-v2⚠️ 中等✅ 更好✅ 免费(本地)✅ 完全
OpenAI text-embedding-3-large✅ 快速✅ 最佳❌ 付费❌ 无
Cohere embed-v3✅ 快速✅ 最佳❌ 付费❌ 无

建议:

  • 最大主权:使用 sentence-transformers(本地、免费)
  • 最大准确性:使用 OpenAI text-embedding-3-large 或 Cohere embed-v3(API、付费)
  • 平衡:从 sentence-transformers 开始,如果准确性差,升级到 OpenAI/Cohere

选择生成模型取决于您的优先事项:

模型速度质量成本主权
Llama 3 8B(本地)✅ 快速⚠️ 良好✅ 免费✅ 完全
Llama 3 70B(本地)⚠️ 慢✅ 更好✅ 免费✅ 完全
GPT-4o-mini(API)✅ 快速✅ 良好❌ 付费❌ 无
GPT-4o(API)⚠️ 中等✅ 最佳❌ 付费❌ 无
Claude 3.5 Sonnet(API)⚠️ 中等✅ 最佳❌ 付费❌ 无

建议:

  • 最大主权:使用 Llama 3 8B 或 70B(本地、免费)
  • 最大质量:使用 GPT-4o 或 Claude 3.5 Sonnet(API、付费)
  • 平衡:简单查询使用 Llama 3 8B,复杂查询使用 GPT-4o-mini

Vault v1 不支持。Vault 使用现有模型——不支持微调。

但是,您可以:

  • 使用检索:RAG 通常比微调对领域特定知识更有效。无需在您的文档上微调模型,只需在查询时检索相关文档。
  • 提示工程:自定义系统提示以引导模型行为(如"您是一名法律助手。根据提供的法律文档回答问题。")
  • 外部微调:在 Vault 外部微调模型(使用 Hugging Face Transformers 等工具),然后通过自定义端点在 Vault 中使用微调后的模型。

微调支持计划在 v2.0(2027 年第二季度)中推出。

可以。Vault 是模型无关的——您可以随时切换模型:

  • 无需更改代码:只需在管理控制台更新模型配置
  • 无需重新嵌入:如果切换生成模型,不需要重新嵌入文档(嵌入是模型特定的,但您可以继续使用旧嵌入或用新模型重新嵌入)
  • 按查询切换:对不同查询使用不同模型(如简单查询用本地模型,复杂查询用 API 模型)

这使您的投资面向未来——当更好的模型发布时,您可以立即采用,无需重新设计系统。

07 · 模型

部署与配置

8 个问题

Vault 提供三种部署选项:

  1. Docker Compose:最简单。一条命令(docker-compose up)即可运行。最适合开发和小型部署。
  2. Kubernetes(Helm):生产就绪。提供 Helm 图表。最适合大型部署、高可用性、自动扩展。
  3. 裸机:面向高级用户。直接安装在 Linux 服务器上。最大控制,但需要更多设置。

对于大多数客户,Docker Compose 是最快的路径。对于生产环境,我们建议 Kubernetes。

配置时间取决于您的部署:

  • Docker Compose:30 分钟。拉取镜像、配置环境变量、运行 docker-compose up
  • Kubernetes:2-4 小时。部署 Helm 图表、配置入口、设置存储、测试。
  • 裸机:1-2 天。安装依赖、配置服务、测试。

目标:从下载到首次查询 <4 小时(对于 Docker Compose 部署)。

首次查询部署后,您需要上传文档并等待处理(分块 + 嵌入)。对于 100 个文档,预计需要 5-15 分钟处理时间。

部署方面:需要。Vault 是自托管的,所以需要有人能够管理 Docker/Kubernetes、配置网络并监控基础设施。通常是 DevOps 工程师或 IT 顾问。

日常使用:不需要。管理控制台为非技术用户(知识管理员、合规官)设计。您可以在不编写代码的情况下上传文档、创建知识库并查询系统。

开发人员:Vault 提供 REST API 和 SDK(Python、JavaScript)用于自定义集成。开发人员可以构建自定义工作流、将 Vault 集成到内部工具等。

Vault 的要求取决于您的部署:

组件最低要求推荐配置
CPU2 核4+ 核
内存8 GB16+ GB
存储50 GB SSD200+ GB SSD(取决于文档量)
GPU(用于本地模型)无(使用 API 模型)NVIDIA A100 或同等产品(用于本地模型)
操作系统Linux(Ubuntu 20.04+、RHEL 8+)Ubuntu 22.04 LTS

如果使用基于 API 的模型(OpenAI、Anthropic),不需要 GPU。如果使用本地模型,强烈建议使用 GPU。

可以。Vault 可以部署在任何云提供商上:

  • AWS:使用 EC2(用于 Docker Compose)或 EKS(用于 Kubernetes)。使用 S3 存储文档,RDS 存储元数据。
  • GCP:使用 GCE(用于 Docker Compose)或 GKE(用于 Kubernetes)。使用 GCS 存储文档,Cloud SQL 存储元数据。
  • Azure:使用 VM(用于 Docker Compose)或 AKS(用于 Kubernetes)。使用 Blob Storage 存储文档,Azure SQL 存储元数据。

我们为每个云提供商提供部署指南。对于生产环境,我们建议 Kubernetes 配合托管数据库(RDS、Cloud SQL、Azure SQL)。

可以。Vault 提供迁移工具:

  • 导入文档:上传现有文档(PDF、DOCX 等)
  • 导入嵌入:如果之前的平台导出了嵌入,您可以导入它们(如果使用相同的嵌入模型)
  • 重新嵌入:如果嵌入不兼容,Vault 可以重新嵌入您的文档(需要时间,但确保准确性)

迁移通常需要 1-2 周。我们为常见平台(Glean、Onyx、PrivateGPT)提供迁移指南和支持。

Vault 通过管理控制台(基于 Web 的 UI)或环境变量配置:

  • 模型提供商:配置嵌入和生成模型(本地或 API)
  • 存储:配置文档存储(本地、S3、GCS、Azure Blob)
  • 数据库:配置元数据数据库(PostgreSQL、MySQL)
  • 向量数据库:配置向量存储(Qdrant、Weaviate、Milvus、Chroma)
  • 身份验证:配置 SSO、RBAC(企业版)

大多数配置通过 UI 完成。对于高级用户,Vault 还支持通过 YAML 文件或环境变量配置。

可以。Vault 包含沙盒模式:

  • 测试环境:在测试环境中部署 Vault,使用示例文档
  • 实验:测试不同模型、分块策略和检索配置
  • 评估:在上线前测量准确性、延迟和成本

我们建议在部署到生产环境前花 1-2 天在沙盒模式下测试。

08 · 语言

成本与定价

7 个问题

Vault 定价基于部署模式和功能:

版本价格包含
社区(免费)$0自托管、核心功能、社区支持
专业版$99/月自托管、所有核心功能、邮件支持
企业版$299-$499/月自托管、企业功能(SSO、RBAC、审计日志)、优先支持
托管版自定义定价ODW.ai 为您托管和管理 Vault(私有云)

额外成本:

  • API 成本:如果使用基于 API 的模型(OpenAI、Anthropic),直接向 API 提供商付费
  • 基础设施:您为自己的服务器/云付费(如果自托管)
注意定价为示例,可能会更改。请联系我们获取当前定价和自定义报价。

是的,显著更便宜。Glean 和 Onyx 通常成本为 $10-$30/用户/月。对于 100 人的公司,那就是 $1,000-$3,000/月。

Vault 成本为 $0-$499/月(固定费率,非按用户)。对于 100 人的公司,Vault 便宜 2-30 倍

而且 Vault 是自托管的——您获得完全主权。Glean/Onyx 是云端 SaaS——您将文档发送给他们。

当然,Glean/Onyx 是托管服务(无需管理基础设施),而 Vault 需要自托管。但如果您有基础设施且需要主权,Vault 在成本上是明显的赢家。

没有隐藏成本。总拥有成本包括:

  • Vault 订阅:基于版本的月费(社区版为 $0)
  • API 成本:如果使用基于 API 的模型(OpenAI、Anthropic),直接向 API 提供商付费
  • 基础设施:您为自己的服务器/云付费(如果自托管)

仅此而已。没有设置费、没有意外收费、没有按用户收费。

是的。社区版 100% 免费:

  • 无时间限制:永久使用
  • 无功能限制:包含所有核心功能(文档导入、RAG、API 等)
  • 无用户限制:无限用户
  • 无文档限制:无限文档

唯一的限制:

  • 企业功能:SSO、高级 RBAC、审计日志、合规功能是付费的
  • 支持:仅社区支持(GitHub 问题、Discord)。无邮件或优先支持。

我们相信开源。如果不需要企业功能,您可以永久免费使用 Vault。

我们接受:

  • 信用卡/借记卡:Visa、Mastercard、American Express(通过 Stripe)
  • 银行转账:适用于年度订阅或企业客户
  • 加密货币:比特币、以太坊、USDC(面向注重隐私的客户)

年度订阅提供发票。详情请联系我们。

可以。我们提供30 天退款保证。如果在最初 30 天内不满意,请联系我们获得全额退款——无需解释原因。

30 天后,您可以随时取消。您将继续拥有访问权限直到计费周期结束,但部分月份不提供退款。

是的。Vault 是 ODW.ai 套件的一部分。您可以:

  • 单独购买 Vault:单独使用 Vault(用于知识检索)
  • 购买完整套件:以折扣价获得 Desk、Voice、Vault、Shield 和其他模块

套件包中 Vault 享有 20-30% 的折扣。而且所有模块原生集成——Vault 作为 Desk、Voice 和其他模块的知识后端。

09 · 定价

扩展与运维

7 个问题

Vault 水平扩展:

  • 小型部署:1,000-10,000 个文档(Docker Compose,单节点)
  • 中型部署:10,000-100,000 个文档(Kubernetes,3+ 节点)
  • 大型部署:100,000-1,000,000+ 个文档(Kubernetes,自动扩展,分布式向量数据库)

对于超大型部署(100 万+ 文档),我们建议:

  • 分布式向量数据库(Qdrant 集群、Milvus 集群)
  • 托管 PostgreSQL(RDS、Cloud SQL)
  • 自动扩展 Kubernetes 集群

Vault 支持无限用户(无按用户限制):

  • 社区版:无限用户
  • 专业版:无限用户
  • 企业版:无限用户

Vault 水平扩展——添加更多节点以处理更多并发用户。典型部署每节点支持 100-1,000 个并发用户。

如果 Vault 宕机,查询功能不可用,但您的文档是安全的:

  • 文档:存储在您的数据库(PostgreSQL)和向量数据库(Qdrant、Weaviate 等)中——不会丢失
  • 恢复:重启 Vault,它会重新连接到您的数据库
  • 高可用性:对于生产环境,使用多个副本(Kubernetes)和托管数据库(RDS、Cloud SQL)部署 Vault

对于高可用性部署,我们建议:

  • Kubernetes:跨可用区的 3+ 副本
  • 托管数据库:RDS、Cloud SQL 或 Azure SQL(99.9% 正常运行时间 SLA)
  • 负载均衡器:在副本间分配流量

Vault 包含监控仪表板:

  • 系统健康:CPU、内存、磁盘、网络使用率
  • 查询指标:每秒查询数、延迟(p50、p95)、错误率
  • 文档指标:文档数、块数、嵌入数
  • 模型指标:API 成本、令牌使用、模型延迟

您还可以通过标准协议将指标导出到外部监控工具(Prometheus、Grafana、Datadog)。

Vault 数据存储在两个地方:

  • 元数据数据库:PostgreSQL(文档元数据、用户数据等)。使用标准 PostgreSQL 工具备份(pg_dump、WAL 归档)。
  • 向量数据库:Qdrant、Weaviate、Milvus 或 Chroma(嵌入)。使用向量数据库的原生备份工具备份。
  • 文档:存储在文件系统或对象存储(S3、GCS、Azure Blob)中。使用标准文件/对象存储备份工具备份。

我们建议:

  • 每日备份:所有三个组件的自动备份
  • 异地存储:将备份存储在不同位置(如 S3、GCS、异地服务器)
  • 测试恢复:定期测试从备份恢复以确保其有效

可以。Vault 支持多租户:

  • 知识库:为不同团队或部门创建独立的知识库(如"人力资源"、"工程"、"法律")
  • 访问控制:控制谁可以访问哪些知识库(企业版)
  • 隔离:每个知识库有自己的文档、嵌入和权限
  • 查询范围:查询特定知识库或跨所有知识库搜索

这对于有严格数据分离要求的组织或多租户部署(如管理多个客户的 MSP)很有用。

Vault 旨在直观易用,但我们提供培训资源:

  • 文档:为管理员、知识管理员和最终用户提供全面的用户指南
  • 视频教程:关键功能的逐步演练
  • 入职培训:对于付费客户,我们提供 1 小时的入职培训课程(远程)
  • 支持:为专业版和企业版客户提供优先支持

大多数团队在 1-2 小时的培训后即可高效工作。Web 界面特别直观——最终用户无需技术技能。

10 · 入职培训

集成与工作流

7 个问题

Vault 与所有 ODW.ai 产品原生集成:

  • Desk:使用 Vault 作为客户支持 AI 的知识后端
  • Voice:使用 Vault 作为语音助手的知识后端
  • Shield:Vault 将审计日志发送到 Shield 用于治理和合规
  • 其他模块:任何需要知识检索的 ODW.ai 模块都使用 Vault

如果使用 ODW.ai 套件,Vault 集成是自动的——无需单独配置。

提供。Vault 提供用于编程访问的 REST API:

  • 文档管理:通过 API 上传、删除和管理文档
  • 查询:通过 API 发送查询并检索结果
  • 知识库管理:通过 API 创建、删除和管理知识库
  • 管理:通过 API 配置模型、分块策略和其他设置

API 有完整文档(OpenAPI/Swagger),支持通过 API 密钥或 OAuth 2.0 进行身份验证。

提供。Vault 为流行语言提供 SDK:

  • Python:pip install odw-vault
  • JavaScript/TypeScript:npm install @odw/vault

SDK 封装 REST API,为开发人员提供更便捷的接口:

from odw_vault import VaultClient

client = VaultClient(api_key="your-api-key")
results = client.query("What's our refund policy?", knowledge_base="hr-policies")
print(results.answer)

SDK 是开源的,可在 GitHub 上获取。

可以。Vault 可以通过以下方式与内部工具集成:

  • REST API:从内部工具(Web 应用、移动应用、脚本)调用 Vault 的 API
  • SDK:使用 Python 或 JavaScript SDK 简化集成
  • Webhook:Vault 可以在文档添加/更新/删除时发送 Webhook(用于事件驱动的工作流)

常见集成:

  • Slack:构建查询 Vault 的 Slack 机器人
  • Microsoft Teams:构建查询 Vault 的 Teams 机器人
  • 内部 Web 应用:在内部门户中嵌入 Vault 的查询 UI
  • 自定义工作流:在自动化工作流中使用 Vault 的 API(如自动总结新文档)

可以。Vault 包含用于外部数据源的连接器框架:

  • SharePoint:从 Microsoft SharePoint 同步文档(企业版)
  • Google Drive:从 Google Drive 同步文档(企业版)
  • Confluence:从 Atlassian Confluence 同步页面(企业版)
  • 文件系统:从本地或网络驱动器同步文档
  • S3 兼容:从 AWS S3、MinIO 或其他 S3 兼容存储同步
  • 自定义:使用连接器 SDK 构建自己的连接器

连接器可以按计划同步(如每小时)或实时同步(通过 Webhook)。

可以。Vault 提供可嵌入的查询小部件:

  • JavaScript 小部件:在网站或 Web 应用中嵌入聊天式查询 UI
  • 可定制:自定义小部件的外观(颜色、徽标等)以匹配您的品牌
  • 身份验证:小部件遵守 Vault 的访问控制——用户只能看到他们有权限访问的文档

这适用于:

  • 面向客户:在客户门户中嵌入知识库
  • 面向员工:在内部门户中嵌入知识库
  • 产品集成:将 Vault 的查询 UI 作为功能嵌入您的产品

可以。Vault 可以与现有 AI 工具一起使用:

  • LangChain:在 LangChain 管道中使用 Vault 作为检索器
  • LlamaIndex:在 LlamaIndex 管道中使用 Vault 作为检索器
  • 自定义 RAG:在自定义 RAG 管道中使用 Vault 的 API

Vault 旨在成为知识层——它提供检索,您可以使用任何 AI 工具进行生成。

11 · 路线图

限制与路线图

8 个问题

Vault 功能强大,但在 v1.0 中有以下限制:

  • 无实时流:Vault 支持批量和近实时导入,但不支持亚秒级流
  • 无移动应用:无原生 iOS/Android 应用(Web 界面对移动友好,但无原生应用)
  • 无语音/音频导入:无法导入音频文件(如会议录音)——仅支持文本
  • 无视频分析:无法分析视频内容
  • 无工作流自动化:Vault 是知识层,不是工作流引擎(使用其他 ODW.ai 模块)
  • 仅英语 UI:UI 仅支持英语(v1)——多语言 UI 计划在 v1.1 中推出
  • 无模型微调:Vault 使用现有模型——无法微调模型(计划在 v2.0 中推出)

会。我们将在 v1.1(2026 年第四季度)中添加对更多文档格式的支持:

  • PPTX:PowerPoint 演示文稿
  • XLSX:Excel 电子表格
  • 电子邮件格式:EML、MSG(Outlook)
  • OCR:改进的扫描 PDF 和图像 OCR

如果您需要特定格式,请告诉我们——我们根据客户需求确定优先级。

计划在 v1.2(2027 年第一季度)。语音/音频导入将包括:

  • 转录:使用 Whisper 或其他 ASR 模型自动转录音频文件(会议录音、语音备忘录)
  • 说话人分离:识别会议录音中谁说了什么
  • 可搜索转录:将转录导入 Vault 以进行检索

这是希望搜索会议录音和语音备忘录的客户的高优先级功能。

计划在 v1.1(2026 年第四季度)。多语言 UI 将包括:

  • 中文(简体和繁体)
  • 西班牙语
  • 法语
  • 德语
  • 日语

查询引擎已经支持多语言文档和查询——v1 中只有 UI 仅支持英语。

关键里程碑:

  • v1.0(2026 年第三季度):MVP 发布。文档导入、RAG、模型无关推理、多租户、REST API、SDK。
  • v1.1(2026 年第四季度):更多文档格式(PPTX、XLSX、电子邮件)、多语言 UI、改进的 OCR。
  • v1.2(2027 年第一季度):语音/音频导入(转录、说话人分离)、高级分析。
  • v2.0(2027 年第二季度):模型微调、高级检索策略(混合搜索、重排序)、工作流自动化。

路线图可能会根据客户反馈更改。请联系我们获取最新路线图或请求功能。

Vault 不适合以下情况:

  • 您没有主权要求:如果不关心数据主权,云端 RAG 平台(Glean、Onyx)更简单(无需管理基础设施)。
  • 您需要实时流:Vault 支持批量和近实时导入,但不支持亚秒级流。如果需要实时,请使用专用流平台。
  • 您需要工作流自动化:Vault 是知识层,不是工作流引擎。如果需要复杂工作流,请使用专用工作流工具(或其他 ODW.ai 模块)。
  • 您需要聊天机器人 UI:Vault 提供知识层,但不提供精美的聊天机器人 UI。如果需要开箱即用的聊天机器人,请使用专用聊天机器人平台(或将 Vault 与您自己的 UI 集成)。

不保证。没有 AI 系统能保证 100% 准确。Vault 的准确性取决于:

  • 文档质量:清晰、结构良好的文档 = 更好的准确性
  • 嵌入模型:更好的嵌入模型 = 更好的检索
  • 生成模型:更好的生成模型 = 更好的答案
  • 查询清晰度:清晰、具体的问题 = 更好的答案

目标:≥85% MRR@10(前 10 个结果的平均倒数排名)。这意味着正确答案在 85% 的情况下出现在前 10 个结果中。

Vault 提供来源引用,以便您可以验证答案。如果准确性差,请尝试提高文档质量、切换到更好的模型或改写查询。

三条路径:

  1. 免费试用:下载 Vault 并自行部署。无需信用卡。用您的文档试用,看看是否适合您的用例。
  2. 演示:与我们的团队预约演示。我们将向您介绍 Vault、回答您的问题并帮助您评估它是否适合您的业务。
  3. 联系销售:对于企业客户或自定义部署(本地、物理隔离/气隙),请联系我们的销售团队获取定制报价。
准备开始?访问 odw.ai/vault 下载 Vault 或预约演示。