LexVoice 用户手册#
适用版本:1.13.4 · 更新日期:2026-07-16
LexVoice 是一款 Obsidian 录音转写与 AI 纪要插件:后台录音、分段或流式转写、AI 整理成结构化 Markdown 纪要,并提供听写、音频导入、实时大纲与知识沉淀等能力。本手册面向普通用户,覆盖安装、配置、日常使用与故障排查。
第 1 章产品概述#
1.1 定位#
LexVoice 让 Obsidian 成为一台「会议记录员」:录音过程中自动按分段把音频送去转写(转写指把语音识别为文字的服务,需要用户自行配置云端或本地服务),录音结束后再由大模型(LLM,即 AI 整理服务)把全部转写内容合并润色为一篇结构化的 Markdown 纪要。除会议录音外,插件还提供即时听写(短语音直接落字到光标处)、已有音频导入转写、实时大纲、对纪要提问与知识沉淀(人员、待办、学习卡片、热词)。
1.2 核心工作流#
录音(分段切片,边录边转)
│
▼
转写(云端或本地语音识别服务,逐段返回文字)
│
▼
AI 整理(大模型按所选模板合并润色)
│
▼
结构化纪要(frontmatter + 正文 + 可折叠原始材料)
录音开始的一刻,插件即在纪要文件夹创建占位笔记;每段转写完成后实时写入笔记;停止录音后进入收尾流程,最终重写为整合排版的完整纪要,并联动写入当日日记。
1.3 系统要求#
- Obsidian 1.10.0 及以上版本(人员库等 Bases 视图依赖该版本的官方 Bases 能力)。
- 桌面端(Windows / macOS / Linux)支持全部功能。
- 移动端可安装启用,但仅支持「仅麦克风」录音,流式转写、流式听写、PDF 报告等为桌面端限定,详见第 13 章与附录。
- 至少配置一个转写服务(如硅基流动、小米 MiMo 等);如需 AI 整理,还需配置一个 OpenAI 兼容的大模型服务。
- 部分知识层视图依赖社区插件 Dataview(学习墙、待办墙等)。
第 2 章安装与更新#
2.1 从 GitHub Release 手动安装#
这是仓库文档化的标准安装方式:
- 打开发布页 https://github.com/Lynn-x/LexVoice/releases ,下载最新版本的三个文件:
main.js、manifest.json、styles.css。 - 关闭 Obsidian。
- 在你的库(vault)目录下,进入
.obsidian/plugins/,新建文件夹lexvoice,把三个文件放入其中(完整路径为<库目录>/.obsidian/plugins/lexvoice/)。 - 重新打开 Obsidian,进入「设置 → 第三方插件」,关闭安全模式(如尚未关闭),在插件列表中启用「LexVoice」。
注意:LexVoice 的发布 tag 为裸版本号(如 1.13.4,不带 v 前缀)。
2.2 通过 BRAT 安装#
仓库根目录包含 manifest.json 与 versions.json,符合 BRAT(Beta Reviewers Auto-update Tester,一款用于安装测试版插件的社区插件)的目录要求。可尝试:在 BRAT 中选择「Add beta plugin」,填入仓库地址 Lynn-x/LexVoice 完成安装。若 BRAT 安装遇到问题,请回退到 2.1 节的手动安装方式。
2.3 插件内置增量更新器#
安装完成后,后续升级不必再手动替换文件:
- 路径:「设置 → 更新」。该页显示当前版本、可用版本、上次检查时间、上次错误与备用下载源数量,并提供「检查更新」「一键增量更新」按钮和「打开 GitHub」「打开 Release」直达链接。
- 自动检查:默认开启「启动时自动检查」,最多每 24 小时执行一次(启动后延迟约 4 秒静默进行)。发现新版本时弹出通知。
- 命令面板亦提供「检查更新」「安装可用更新」两条命令。
- 多路下载源:安装更新时按顺序尝试 fastly.jsdelivr(按版本 tag)→ cdn.jsdelivr(按版本 tag)→ GitHub Release 直连 → mirror.ghproxy.com → ghproxy.net,最后回落到分支源。jsDelivr 镜像在国内网络环境下通常可直连,无需代理。
- 安全机制:更新前先把
manifest.json、main.js、styles.css、README.md及data.json(插件设置)备份到插件目录下的.lexvoice-update-backups/<时间戳>/;所有文件先全部下载进内存,任一必需文件失败即整体放弃、不写入任何文件;写入时manifest.json排在最后,写后逐文件回读校验,避免版本错位。
2.4 升级注意事项#
- 更新只替换发布文件(
main.js等),不会覆盖data.json:API 密钥、保存路径、自定义提示词与队列数据均保留。 - 更新完成后需重启 Obsidian,或在第三方插件页关闭再启用 LexVoice 使新版本生效。
- 即使版本号相同,也可用「一键增量更新」重装官方文件,用于修复本地文件损坏。
- 插件启动时会自检
main.js实际版本与manifest.json版本是否一致,不一致时显示常驻告警,此时建议重新执行一次更新。
第 3 章快速上手:三步跑通第一篇纪要#
第一步:配置转写服务#
转写服务负责把语音识别成文字,是必配项。
- 打开「设置 → 第三方插件 → LexVoice → API」。
- 在「纪要转写」区的「转写服务」下拉中选择一家服务(默认为硅基流动),页面会显示该服务的指南卡(说明、价格提示、配置步骤与官方文档链接)。
- 到服务商官网注册并获取访问密钥(API Key),填入「访问密钥」输入框;服务地址与模型名称通常保持默认即可。
- 点「连通性测试 → 测试」——插件会用一段 1 秒静音音频发起真实转写请求,成功会显示返回结果,失败会显示错误信息。
更省事的做法:若你使用小米 MiMo 或硅基流动这类同时提供转写与大模型的平台,可在「设置 → LexVoice(首页)→ 快速配置」中选择供应商、填一次 Key、点「应用」,即可同时配好转写服务与 AI 整理服务,并自动保存为一套 API 方案。配完可直接跳到第三步。
第二步:配置 AI 整理大模型#
AI 整理服务负责把转写文字合并润色为结构化纪要;不配置也能录音转写,但纪要将停留在原始文字稿。
- 打开「设置 → API → AI 整理服务」。
- 从「服务预设」下拉中选择供应商(内置硅基流动、OpenAI、DeepSeek、阿里百炼、智谱 GLM、本地 Ollama 等 19 个预设),地址自动填入。
- 填入访问密钥(若与转写同为硅基流动或 MiMo,可点「复用转写密钥」)。
- 点「获取可用模型」,从服务返回的模型列表中点选一个模型,避免手敲出错。
- 点「测试连接」验证地址、密钥、模型三要素是否匹配。
第三步:录音并得到纪要#
- 点击屏幕上悬浮气泡的麦克风按钮(或左侧 Ribbon 的麦克风图标、实时纪要面板底部的「新建录音」按钮)开始录音。插件会立即创建占位笔记并弹出通知说明当前音源与分段策略。
- 正常开会或讲话。默认每 5 分钟切一段送转写(开头 10 秒、60 秒、180 秒各有一次快切,很快就能看到文字),每段转写实时写入笔记,实时大纲同步刷新。
- 讲完后点悬浮气泡的停止按钮(或面板停止按钮),插件自动合并润色全部转写、重写为结构化纪要、提炼主题追加到文件名并打开。至此第一篇纪要完成。
若要旁听电脑里播放的声音(线上会议、网课视频),需先安装虚拟声卡并在「设置 → 常规 → 音频输入」中切换录音来源,详见 4.3 节。
第 4 章录音与会议纪要#
4.1 功能定位#
会议录音是 LexVoice 的主链路:从开始录音到产出纪要全程自动化,中途支持暂停、实时查看转写与大纲,结束后由 AI 按所选模板整理成文,并自动命名、归档、写入日记。
4.2 开始、暂停与停止#
开始录音的入口:
- 命令面板「开始/停止录音」;
- 命令「开始录音 · 仅麦克风」「开始录音 · 麦克风 + 电脑音频」「开始录音 · 仅电脑音频」(一次性指定音源,不改默认设置);
- 左侧 Ribbon 麦克风图标;
- 悬浮气泡空闲态的麦克风按钮;
- 实时纪要面板空闲态底部「新建录音」按钮。
开始录音时,插件立即在纪要文件夹创建占位笔记(文件名按「纪要文件名格式」生成,默认 YYYY-MM-DD HHmm),并弹出通知说明当前音源与分段策略。若开启「录音开始时自动打开实时纪要面板」(默认开启),侧栏面板会随之打开。
暂停与恢复:命令「暂停/继续录音」、悬浮气泡的暂停按钮或面板录音状态条上的暂停按钮。暂停期间计时停止,暂停时长不计入录音时长与分段切点。
停止录音:命令「开始/停止录音」、Ribbon 图标、悬浮气泡的停止按钮(提示「停止并合并润色」)或面板的停止按钮。停止后自动进入收尾流程:
- 切出最后一段音频并保存整场母带(完整录音文件);
- 等待最后一段转写完成,合并全部分段转写;
- 大模型按所选模式模板合并润色;
- 按「纪要整合排版」重写整篇笔记(关闭该设置时改为追加「## 整合版」块);
- AI 提炼不超过 15 字的主题追加到文件名;
- 写入当日日记「今日会议概要」;
- 清理成功转写的分段缓存音频;
- 通知「LexVoice 处理完成」并自动打开纪要(可在「设置 → 常规 → 完成后动作」关闭)。
AI 整理失败时,可重试的任务进入待处理队列,纪要保留原始转写不丢失。
4.3 三种音源模式#
在「设置 → 常规 → 音频输入 → 录音来源」或面板空闲态的「音频」下拉中选择:
| 模式 | 适用场景 | 说明 |
|---|---|---|
| 仅麦克风 | 线下会议、口述 | 默认模式,使用麦克风采集 |
| 麦克风 + 电脑音频 | 线上会议、边看边讲解 | 两路声音混流录制成单轨 |
| 仅电脑音频 | 视频、网课、播客 | 只采集电脑播放的声音 |
「电脑音频」两种模式必须先安装虚拟声卡并在设置中显式选定设备:Windows 使用 VB-Cable,macOS 使用 BlackHole,Linux 使用 PulseAudio/PipeWire 的 monitor 设备。未选定设备时插件直接报错,不会自行猜测设备。设置页的「电脑音频指引」按钮会打开安装教学弹窗,「自动推荐」按钮在检测到虚拟声卡时可一键切换到混合或仅电脑音频模式。
每个转写分段会记录其音源标记。需要注意:混合模式录成单轨,插件无法从音频上区分「哪句是我说的、哪句来自电脑」,详见 13.2 节。
4.4 录音设备选择#
「设置 → 常规 → 音频输入」提供「麦克风」与「电脑音频输入」两个设备下拉(按当前模式显示),列出全部系统音频输入设备,疑似虚拟声卡会附加「(推荐 · 虚拟声卡)」提示。麦克风留空表示使用系统默认输入;一旦选定具体设备,插件将严格按该设备打开,设备不可用时报错提示重选,绝不静默换用其他设备。录音中,面板底部显示设备状态条与每路输入的 12 段电平条,静音时显示「静音」字样。
4.5 分段机制(即时分段转写)#
开启「即时分段转写」(默认开启)后,录音按分段间隔自动切片,每片立即发送转写,结果实时写入笔记的分段区(格式为「### 段落 N (MM:SS–MM:SS)」,附可点击回听的音频锚点),并弹出「段 N 已转写」通知。
分段机制的关键参数:
| 参数 | 值 | 说明 |
|---|---|---|
| 分段间隔默认值 | 5 分钟 | 「设置 → 进阶 → 录音与转写 → 分段间隔」或面板「更多设置」调整 |
| 分段间隔范围 | 0.5–30 分钟 | 运行时强制下限 30 秒 |
| 开头快切时点 | 第 10 秒、60 秒、180 秒 | 会话开头各切一次,让录音开始后很快有产出,之后回到常规间隔 |
其它行为:
- 转写失败的段会标注失败并自动进入重试队列(见第 12 章)。
- 关闭「即时分段转写」则整场只在停止时一次性转写。
- 当前转写服务为流式服务(OpenAI Realtime、阿里 Paraformer 等 wss 端点)时,分段设置不生效,改为全程实时字幕,详见 8.4 节。
4.6 录音文件存放与清理#
- 整场母带:由独立录制器全程录制,停止时保存为
lex-<YYYYMMDD-HHmmss>.<扩展名>到录音文件夹(默认LexVoice/录音),长期保留、不自动删除。格式一般为 webm/opus。 - 分段缓存:录音期间的切片先写入分段缓存文件夹(默认
LexVoice/.cache/segments)。整场成功收尾且母带存在时,成功转写的切片自动移入系统废纸篓;失败待重试的切片保留。可开启「保留后台切片音频」(默认关闭)改为全部保留。 - 手动清理:命令「清理过期分段音频缓存」删除缓存中超过 7 天且不再被重试队列引用的音频;命令「清理空白短录音」扫描纪要文件夹,找出时长不超过 10 秒且无有效转写文本的纪要,经确认后连同关联录音一并移入系统废纸篓。
- 误触过滤:「过滤 3 秒内录音」(默认开启)会把少于 3 秒的录音直接丢弃,不存音频、不建纪要。
- 所有删除操作均走系统废纸篓,可恢复。
4.7 纪要笔记结构#
整合排版(默认开启)下,最终纪要结构自上而下为:
- YAML frontmatter(文档属性区):插件注入
mode(模式)、time、时长、人物等字段;主题、参会人等内容字段由 AI 按模式模板填写,转写中未提及的写「未提及」;状态: 已整理;tags自动包含lexvoice/<模式>系统标签及 AI 建议的主题、项目、公司、行业等中文标签。 - 标题:「# 日期时间 · 模式前缀」。
- AI 整理正文:顶部为摘要速览(callout 块),正文按讨论脉络组织为三级标题,待办使用
- [ ]任务语法。 - 分隔线之下的「## 原始材料」区:录音信息、会中材料、实时大纲、回听时间轴、原始音频与「分段原始转写」等各自折叠存放,每段带时间区间与回听锚点。
关闭整合排版时,笔记按时间顺序保留原始分段,末尾追加「## 整合版」块。若 AI 输出被截断,正文顶部会插入告警提示。
4.8 续录到已有纪要#
在面板「纪要」列表中右键某条纪要,选择「继续录音到这篇」:插件以该纪要的原始转写为基底开始新录音,新分段的时间偏移接续原纪要总时长;停止后新旧分段合并重新整理,整篇纪要重写。同菜单还提供「与上一段录音合并」。目标必须是含 LexVoice 原始转写分段的纪要,否则会提示无法续录。
4.9 日记联动(今日会议概要)#
纪要整理成功后,插件在当日日记(依赖 Obsidian 日记功能,日记不存在时按其模板自动创建)中找到或创建「今日会议概要」标题,追加一条概要,默认包含时间、纪要链接、模式/时长/分段/模型元信息、核心摘要与待办块。同一场会议重复整理时就地更新而不重复追加。相关设置在「设置 → 常规 → 完成后动作」:开关(默认开)、标题文字与概要模板均可自定义,模板支持 {{date}}、{{note_link}}、{{summary}}、{{todos_block}} 等占位符。
4.10 悬浮气泡#
悬浮气泡默认常驻屏幕、可拖动,位置自动记忆,贴边时自动收起为停靠样式,窗口缩放后自动回到视口内。三种状态:
- 空闲态:三枚圆形按钮——打开最近一篇纪要(定位跳转)、听写(快速口述)、开始会议录音。
- 录音态:控制胶囊——跳到当前录音笔记的转写位置、暂停/继续、停止并合并润色、实时计时器。
- 听写态:实时字幕胶囊——流式听写时边说边显示当前句,批量听写显示「聆听中…」,随后依次显示「AI 整理中…」「已写入」。
悬浮气泡常驻显示、不自动隐藏,可通过命令「显示/隐藏悬浮气泡(总开关)」或「设置 → 常规 → 悬浮控制 → 显示悬浮气泡」关闭;「悬浮窗大小」提供大/中/小三档(默认大)。
4.11 注意事项#
- 已有录音进行中或听写进行中时,无法再开始新录音。
- 系统在录音中收回麦克风权限时,录音被动进入暂停态,面板显示「麦克风访问被拒绝」遮罩,可选择「仅保存录音」或跳转系统设置;恢复权限后需重新开始录音。
- AI 整理需已配置大模型服务;未配置或调用失败时纪要保留原始转写文本,可修好配置后重新整理。
- 网络中断时录音在本地正常继续,面板显示「网络中断 · 录音正常继续」横幅,转写在恢复后通过队列补齐。
- 整场几乎无声(有效采样中有声占比低于 2%)时,停止后会提示「整场几乎没检测到声音」,请检查设备选择。
第 5 章实时大纲与会议工作台#
5.1 功能定位#
实时纪要面板是 LexVoice 的会议工作台:录音中实时呈现 AI 大纲、接收会中补充与即时提问;录音外可回看纪要、执行知识沉淀、对纪要提问、管理最近纪要。
5.2 打开面板#
- 左侧 Ribbon 的列表树图标「LexVoice 实时纪要面板」;
- 命令面板「打开实时纪要面板」;
- 「设置 → LexVoice(首页)」的「打开实时纪要面板」按钮;
- 录音开始时自动打开(「设置 → 进阶」中可关闭)。
桌面端在右侧边栏打开,移动端为全屏标签页。面板是唯一实例,重复打开会聚焦已有面板。
面板上方为录音控制区,随状态切换:
- 空闲时:「模板」(整理模式)与「音频」(音源)两个常驻下拉;「更多设置」折叠区(API 方案一键切换、「分段 N 分」滚轮调节、整理偏好、思考档,折叠时右侧显示当前值摘要);设备状态条;底部「新建录音 / 音频(导入)/ 文本(导入)」按钮。面板内的修改与设置页同源、即时保存。
- 录音中:停止方块按钮、声波动画、已录时长、暂停/继续按钮,以及每路输入的电平条;出现问题时显示「网络中断 · 录音正常继续」或「AI 服务不可用」横幅;收尾阶段显示「AI 正在整理最终纪要内容」;麦克风权限被系统收回时整面板覆盖「麦克风访问被拒绝」遮罩。
下方为四个标签页:大纲、沉淀、问一问、纪要。录音中与空闲时均可切换;文件改名或删除会自动同步刷新纪要列表。
5.3 大纲标签页:实时大纲#
录音过程中,每当一段音频转写完成,插件自动调用 AI 把已有转写增量综合成一份带时间锚点的提纲;大纲条目开头的时间戳可点击回听对应位置。录音结束时还会补跑一次最终版大纲,以「录音中实时大纲」折叠块保存进纪要文件。
关于更新节奏,请务必理解:实时大纲随每段转写完成后更新,因此其体感更新频率约等于分段间隔。默认分段间隔为 5 分钟,意味着大纲大约每 5 分钟才刷新一次——如果把分段间隔设得很大(如 15–30 分钟),大纲会长时间不动,看起来像「卡住」,这是正常现象而非故障。希望大纲刷新更勤,应调小分段间隔(面板「更多设置」中滚轮调节「分段」,最低 0.5 分钟);一般会议建议 3–5 分钟。
完整的触发规则如下:
- 触发源是「一段转写完成」,触发后经至少 2.5 秒防抖再调度生成;
- 首份大纲需要累计至少 2 段或 120 字以上转写;
- 已有大纲后,两次自动生成之间至少间隔 30 秒(本地模型端点为 90 秒),且需累计新增 2 段或 200 字以上转写——由于默认 5 分钟才切一段,这条 30 秒下限只在分段很密时才成为瓶颈;
- 手动点大纲区的「刷新」按钮可强制跳过全部节流立即重算;生成中该按钮变为「停止等待」,可取消解卡。
其它行为:
- 「实时大纲」总开关位于「设置 → 进阶 → 纪要与实时大纲」(默认开启),关闭后仅可手动刷新。
- 每次大纲刷新是一次大模型调用,分段越密调用越多、消耗越大。
- 会中补充(工作台条目)会按时间插入到大纲时间线的对应位置。
- 生成失败时自动指数退避(30 秒起,最长 5 分钟)。
- 网络中断时大纲暂停,时间线上显示「大纲生成已暂停」缺口卡,恢复后自动补做。
空闲状态下,在编辑器打开任意 LexVoice 纪要时,大纲标签页自动切换为回看视图:内联音频播放器(播放/暂停/进度/静音)、保存的实时大纲(时间锚点点击即定位播放进度)与回听时间轴。
5.4 会中工作台(会中补充与即时助理)#
录音进行中、面板停在大纲标签页时,底部出现输入条(提示语:「记下来 · #概念 ?问题 !重点 @指派 /待办」),Enter 发送、Shift+Enter 换行,旁有拍照与附件按钮(移动端另有相册按钮)。
输入的文字作为带时间戳的「会中补充」按录音时刻插入大纲时间线,最终整理时作为材料并入纪要。不同前缀触发不同处理:
| 前缀 | 作用 | 是否调用 AI |
|---|---|---|
| (无前缀) | 普通会中补充,记入时间线 | 否 |
#概念 |
请 AI 就地解释一个概念(回复篇幅最宽) | 是 |
?问题 |
请 AI 基于当前大纲与前后转写即时作答 | 是 |
!重点 |
标记重点并附 AI 简评 | 是 |
@指派 |
结构化记录责任人 | 否 |
/待办 |
结构化记录待办事项 | 否 |
AI 即时回复挂在条目下方,单条超时 35 秒,失败显示错误。拍照/附件会把文件存入会议资料文件夹(默认 LexVoice/会议资料/<场次时间戳>/,路径在「设置 → 常规 → 文件与命名」)并作为材料条目上时间线,点材料标签可打开文件;每条补充都可单独移除。
5.5 问一问标签页#
对当前纪要提问:空闲时针对编辑器中打开的 LexVoice 纪要,录音中或刚结束时针对本场录音笔记。输入框 Enter 发送、Shift+Enter 换行,下方有快捷提问标签。
- 回答依据:插件把问题连同纪要内容(原始转写优先、纪要正文辅助,截断至 1.8 万字)发给大模型,只依据材料作答,无依据时明确回答「纪要中没有足够依据」。
- 历史展示:回答以手风琴形式排列,最新在前且展开;每轮回答后自动生成 3 个深度追问回填到底部「接着可以问」标签(无历史时显示 4 条静态示例提问)。
- 写入纪要:每条回答可点「写入纪要」,以时间戳加引述块形式追加到纪要的「## 问一问」小节;开启「多选」可勾选多条按时间正序批量写入。
注意:问答历史仅保存在面板内存中(按纪要路径分开),关闭面板或重启 Obsidian 即清空,只有「写入纪要」的条目会保留。单次回答超时 75 秒;纪要可用内容不足 40 字时无法提问;未配置大模型时会提示先完成配置。
5.6 沉淀标签页#
对当前纪要执行知识沉淀扫描,产出人员、待办、学习卡片、转写热词四组候选,逐组确认入库。详细说明见 10.1 节。
5.7 纪要标签页(最近纪要列表)#
按日期分组展示最近的 LexVoice 纪要(扫描最近 120 篇、显示前 48 篇),今日分组带「今日」徽标,每行显示模式图标、标题及时间、模板、时长信息。顶部工具条提供关键词搜索(实时过滤)、时间筛选(今天/本周/本月/全部,默认本周)与模板筛选。点击行打开纪要;悬停出现「重命名」按钮(就地编辑),有转写失败片段时显示「重试转写」按钮与失败/处理中状态徽标。
右键菜单是纪要再加工的主要入口:
- 重命名;
- 重试转写失败片段(显示失败段数);
- 继续录音到这篇 / 与上一段录音合并(见 4.8 节);
- 生成清稿(产出口语清理后的派生版本);
- (重新)整理为:模式子菜单,上半部可勾选偏好修饰(见 9.5 节);
- 生成 → HTML 报告 / PDF 报告 / 邮件草稿(见 10.5、10.6 节)。
清稿等派生版本以缩进子行挂在母本之下,右键提供打开母本、重新生成、删除此版本(删除需确认且不影响母本)。
5.8 注意事项#
- 面板「更多设置」中的「思考」档仅当前 AI 服务支持思维链控制时可选,不支持的服务显示「不支持」,详见 9.4 节。
- 移动端面板的「音频」下拉锁定为仅麦克风。
第 6 章听写(快速口述)#
6.1 功能定位#
听写用于短语音输入:触发一次开始录一小段话,再触发一次结束,插件转写后经 AI 结构化整理,把成稿一次性写入当前编辑器光标处(或剪贴板)。听写与会议录音链路完全独立:不建纪要文件、不进会话管理。
6.2 入口#
- 命令面板「听写 · 开始/结束」;
- 为上述命令绑定自定义快捷键(插件不预设默认快捷键,可在「设置 → 快捷键」中搜索 LexVoice 自行绑定);
- 悬浮气泡中间的波形按钮:空闲时点击开始,进行中再点一次结束。
6.3 两种转写形态:批量与流式#
| 形态 | 触发条件 | 体验 | 平台 |
|---|---|---|---|
| 批量(默认) | 听写服务未配置或地址为 https | 说完后整段转写,气泡显示「聆听中…」「AI 整理中…」 | 桌面与移动端 |
| 流式(实时字幕) | 听写服务地址为 wss:// 且地址、密钥、模型三项齐全 |
边说边出实时字幕,结束即整理 | 仅桌面端 |
- 批量形态下,未单独配置听写服务时复用当前激活的纪要转写服务。
- 流式配置入口在「设置 → API → 即时听写」,页面提供三个一键预设按钮:「Fun-ASR」(推荐)、「Paraformer-v2」、「Paraformer-8k」,点击自动填入阿里云百炼的 wss 地址与模型名,API Key 需自行填写(DashScope Key)。地址含 dashscope 走 DashScope 协议,含 openai 走 OpenAI Realtime 转写协议。设置页的「地址填写说明」折叠区解释了地址判定规则:
wss://出实时字幕,https://为批量;OpenAI 兼容的/compatible-mode/v1不是实时字幕接口。 - 移动端不支持流式听写,自动回退整段批量转写并提示一次「移动端暂不支持流式听写(需要桌面端),已改用整段转写」。
6.4 落点设置#
「设置 → API → 即时听写 → 听写落点」:
- 「插入光标(智能回退剪贴板)」(默认):写入开始录音那一刻锚定的光标位置;若 Obsidian 不在前台或没有活动编辑器,自动改为复制到剪贴板。
- 「总是复制到剪贴板」:不碰编辑器,由用户自行粘贴。
落字成功后悬浮气泡短暂显示「已写入」。
6.5 AI 整理模板#
听写结束后由主 AI 整理服务做结构化清洗,内置默认模板的规则包括:
- 多要点或步骤必须编号分条(1. 2. 3.);
- 内容较长或多话题时先一句话概括再分点(总—分结构);
- 处理口述更正(如「周三……不对,是周四」按最终版本落字)与指代补全(「这个」「那件事」补成明确所指);
- 删除口头禅、语气词与结巴,修正转写错字;只输出正文。
可在「设置 → API → 即时听写 → 自定义整理提示词」中覆盖默认模板,模板中用 {{转写}} 占位转写原文(不写则自动拼在末尾);「恢复默认」清空自定义内容、跟随内置模板(插件升级时模板自动更新)。整理调用超时 25 秒、不自动重试、强制关闭思维链以提速。
6.6 原文召回#
命令「听写 · 复制上次转写原文」把最近一次听写的转写原文(AI 整理前版本)复制到剪贴板。无论整理成功与否,原文都会留存一份;但仅保存在内存且只保留最近一次,重启 Obsidian 后丢失。
6.7 失败行为#
听写的设计原则是绝不静默丢内容:
- 麦克风打不开、转写失败、连接失败:弹出对应错误通知并写诊断日志。
- AI 整理失败或超时:兜底落转写原文,并提示「大模型整理失败,已置入转写原文」。
- 落字失败(如说话期间编辑器被关闭):先自动转投剪贴板并提示;剪贴板也失败才提示用「听写 · 复制上次转写原文」找回。
- 流式中途出错:只提示一次,结束时用已收到的文本继续整理。
- 录音不足 400 毫秒或无音频:静默放弃,不弹提示。
6.8 注意事项#
- 会议录音进行中时听写不可用,需先停止录音。
- 同一时刻只能有一场听写,转写或整理进行中再次触发会被忽略。
- 听写结果同样应用词汇表的「易错写法」本地纠错(见 8.5 节)。
第 7 章导入音频与收件箱#
7.1 功能定位#
导入功能把已有音频文件(历史录音、外部录音笔文件、会议软件导出等)转写并整理成纪要,与录音链路共享同一套转写与 AI 整理配置;收件箱则实现「音频文件一放进指定文件夹就自动转写」的外部联动。
7.2 导入入口#
- 命令面板「导入已有音频文件转写+润色」:打开「导入音频」选择窗,列出音频文件夹(默认
LexVoice/录音)内全部可识别音频,按修改时间倒序;LexVoice 自动录音切片按一次录音折叠为「录音批次」可整组勾选;窗内可选整理方式(纪要模式)。 - 文件管理器右键单个音频 →「LexVoice:转写并润色」:按当前默认整理模式直接导入,不弹选择窗。
- 多选音频右键 →「LexVoice:整合 N 段音频…」子菜单:把多段音频按所选模式合并成一篇纪要(按文件名升序、时间偏移累计拼接)。
- 实时纪要面板空闲态底部「音频(导入)」按钮;「文本(导入)」按钮对应命令「导入已有文本 / MD 结构化整理」,可把现成文字稿直接送 AI 整理。
导入产物写入纪要文件夹,文件名形如「YYYY-MM-DD HHmm · 导入.md」,含导入信息头(文件数/模式/模型),逐段追加转写文本后走与录音一致的 AI 整理流程。
7.3 支持格式#
webm、mp3、m4a、aac、acc、wav、ogg、flac、mp4、mpeg、mpga、oga。
- 单文件超过 25MB 时选择窗给出黄字警告(多数转写 API 会拒收,建议先压缩码率)。
- 0 字节空文件自动跳过并提示(常见于云盘占位文件尚未下载完成)。
- AAC 文件(.aac/.acc)会先在本机转为临时 WAV 再转写,以保证各转写服务兼容。
7.4 长音频分块#
时长达到 8 分钟或体积达到 24MB 的音频自动启用后台分块(通知「长音频已启用后台分块」):本机解码整个音频,按每块 5 分钟切成 16kHz 单声道 WAV(转写服务为小米 MiMo 时按每块 2 分钟,避开其单块 base64 不超过 10MB 的限制),块文件落盘到分段缓存文件夹后逐块上传转写。
- 并发上传数由「设置 → 进阶 → 转写并发数」控制(1–3,默认 1)。
- 成功块的缓存 WAV 自动删除(除非开启「保留后台切片音频」);失败块缓存保留供重试;缓存 7 天过期自动清理。
- 本机解码失败时回退为整文件直发转写;例外是 MiMo 场景不回退,直接跳过该文件并提示先转为 wav/mp3 或更换服务,以避免必败的重试循环。
7.5 失败重试与队列#
- 就地重试:单块最多发起 3 次请求,仅瞬时错误(429 限流、5xx、超时、网络错误)触发重试,退避时长按错误类型分档(详见 12.2 节)。
- 空结果软失败:转写返回成功但无文字、且该块时长不低于 30 秒(或时长未知)时,按软失败处理——保留缓存音频、进入重试队列,正文占位「[转写失败(空结果,已进入重试队列)]」;短于 30 秒的空结果视为该段确无内容,不重试。
- 母带恢复:队列中的临时切片丢失时,插件可按任务记录的起止时间从完整录音(母带)重新切出音频恢复重试。
- 自动重新整理:当某篇纪要的最后一个失败转写段补齐时,自动触发一次重新整理,让正文吸收补回的内容。
7.6 收件箱自动导入#
在「设置 → 进阶 → 外部音频联动」配置收件箱文件夹(库内相对路径;留空则整个功能禁用)后,音频文件一出现在该文件夹即自动处理:
- 等待稳定延时(默认 3 秒,防止 iCloud、坚果云等云盘尚未传完,范围 0–60000 毫秒);
- 通知「收件箱新增音频:xxx,处理中…」,走标准导入流程(按当前默认模式转写并整理);
- 成功后移入归档子文件夹(默认
processed;留空不归档,但可能重复处理)。
云盘同步冲突命名的文件自动跳过并提醒手动解决;同一路径 60 秒内去重;多个文件串行排队。「自动处理新文件」开关(默认开)关闭后仅能手动扫描:命令「扫描收件箱并处理所有未处理文件」或设置页「立即扫描收件箱」按钮。
7.7 进度与状态栏#
导入开始与逐文件进度均有通知;状态栏 LexVoice 区块显示旋转图标与「导入转写 i/N」,转写完成后切换显示 AI 整理子阶段与百分比;空闲且有待重试任务时显示「N 个待转写」(点击打开队列面板);完全空闲显示「LexVoice 就绪」。处理进度面板(见 12.4 节)可展开查看当前文件与步骤。
7.8 注意事项#
- 长音频分块依赖本机音频解码能力,个别编码解不了时走整文件回退;分块 WAV 会临时占用库内存储空间。
- MiMo 单次最多自动切 160 块(约 320 分钟音频),超长会报错,建议换其他服务处理超长音频。
- 处理进度面板的「已完成」记录不持久化,重启 Obsidian 后清零(队列中的待办任务不受影响)。
第 8 章转写服务配置#
8.1 功能定位#
转写服务负责把音频变成文字,是整条链路的第一环。LexVoice 内置多家服务商,会议分段、导入音频与队列重转写统一使用当前激活的转写服务;即时听写可另配独立服务。
8.2 服务商体系#
在「设置 → API → 纪要转写 → 转写服务」下拉中选择,共 9 家;选中后仅显示该服务的配置项,并附指南卡(说明、价格提示、配置步骤、官方文档链接):
| 服务 | 类型 | 默认地址 / 模型 |
|---|---|---|
| 硅基流动(默认) | 分段 | https://api.siliconflow.cn/v1/audio/transcriptions / FunAudioLLM/SenseVoiceSmall |
| OpenAI 切片转写 | 分段 | https://api.openai.com/v1/audio/transcriptions / gpt-4o-transcribe |
| 小米 MiMo(APIMiMo V2.5 ASR) | 分段(专用协议) | https://api.xiaomimimo.com/v1/chat/completions / mimo-v2.5-asr |
| OpenAI Realtime · 语音转写 | 流式 | wss://api.openai.com/v1/realtime / gpt-realtime-whisper |
| OpenAI Realtime · 语音翻译 | 流式 | wss://api.openai.com/v1/realtime/translations / gpt-realtime-translate,目标语言默认中文 |
| 阿里云百炼 Paraformer Realtime | 流式 | wss://dashscope.aliyuncs.com/api-ws/v1/inference / paraformer-realtime-v2 |
| 本地转写服务 | 分段 | http://127.0.0.1:8000/v1/audio/transcriptions / whisper-large-v3 |
| WhisperX(本地,带说话人分离) | 分段 | 同上;服务端返回说话人时归一为 [说话人N] |
| 其他转写服务(自定义) | 分段 | 全空,自行填写 OpenAI 兼容地址 |
配置与测试:
- 每家服务独立保存地址、密钥、模型与识别语言,切换互不影响;识别语言留空或 auto 表示自动检测。
- 翻译服务额外显示「目标语言(翻译输出)」下拉,共 13 种语言(默认中文)。
- 「恢复推荐值」只还原地址、模型与语言,不覆盖已填密钥(自定义服务无此按钮)。
- 「连通性测试 → 测试」用 1 秒静音音频发起真实转写请求,成功显示返回文本,失败显示错误信息。
- 对配置的所有修改会自动同步进当前激活的 API 方案。
请求超时:云端为 120 秒基础,另按上传体积追加(约每 50KB 加 1 秒,追加封顶 180 秒);本地服务(127.0.0.1 等)放宽到 10 分钟且可不填密钥。
密钥以混淆(非加密)形式保存在库内插件设置文件中,不会上传;但把库文件夹整体同步或分享给他人会泄漏密钥,请注意。
8.3 小米 MiMo 专章#
选择 MiMo(或地址、模型特征命中 MiMo)时,转写自动切换到其专用协议,行为与其他服务差异较大:
- 格式限制:服务端只接收 wav/mp3。非原生格式、或原生格式但 base64 编码超过阈值(9.5MB,贴近 10MB 上限留余量)时,插件在本机解码后按每块 2 分钟切成 16kHz 单声道 WAV 顺序上传、拼接结果。
- 录音编码联动:转写服务选 MiMo 时,录音自动改用 WebM/Opus 编码以便本机转 WAV;因此此前用其他服务录制的 m4a/mp4 文件无法用 MiMo 重新转写(仅影响重转写场景)。
- 流式接收:请求走 Chat Completions 协议、SSE 流式返回转写文本。超时分三段:首字节按体积自适应、进流后空闲 60 秒、总时长封顶 10 分钟。
- 输出上限:单次输出上限 2K token。撞顶(finish_reason=length)时保留已转文字并在末尾追加「本段较长,末尾可能有少量内容未转完」标记;连接中断且无正常结束标记时按错误处理,绝不把半截文本当成功。
- TPM 节流:MiMo 账户限额为 10K TPM(每分钟 token 数)/ 100 RPM。插件内置全局配速闸门,按估算音频时长排队发送(单次最长等待 45 秒)。导入 3 分钟一块时块间约 29 秒的间隔属于正常配速,不是卡顿。
- 其他限制:不支持热词提示参数(仅享受转写后的本地纠错);识别语言只认 zh/en/auto;单次最多切 160 块(约 320 分钟);错误码 400/401/402/403/404 等判为不可重试,429 按加长退避处理。
提示:选 MiMo 时可用「设置 → LexVoice(首页)→ 快速配置」一把 Key 同时配好转写与 AI 整理。
8.4 流式实时转写与语音翻译(会议录音)#
转写服务选择 OpenAI Realtime(转写或翻译)或阿里云百炼 Paraformer 后,正常开始录音即自动进入流式模式:录音全程保持一条 WebSocket 连接,音频实时编码推流,笔记中维护一个「实时转写中…」引用块,说话即出字(约 1.5 秒节流刷新);停止录音时取全量文本、补做词汇表本地纠错后进入正常 AI 整理。
- 翻译服务自动检测说话语言,输出「译文 + 原文」双轨文本;目标语言在服务配置中选择(支持 13 种,默认中文)。
- 流式模式下「分段间隔」「即时分段转写」设置不生效(设置页有就地标注),实时大纲的触发节奏也随之不同。
- 仅桌面端可用:移动端无法建立带鉴权头的 WebSocket,开始录音时会明确提示,音频仍会保留。
- 流式失败的段不进重试队列(无法离线重试),只能重录或对整篇重新整理;连接失败时录音继续、音频保留。
- 价格参考(以服务商实时价格为准):OpenAI 转写约 $0.017/分钟、翻译约 $0.034/分钟、Paraformer 约 3.6 元/小时。
8.5 热词与词汇表对转写的影响#
词汇表(见 10.3 节)通过两层机制提升转写准确率:
- 热词提示:对分段/导入型转写,插件把词汇表词条、人名热词(需授权,最多 80 个)与最多 20 条易错写法拼成提示文本(总长截断 800 字,含防幻觉指令)随音频上传。是否生效取决于服务是否支持 prompt 参数;MiMo 与流式服务不支持。
- 本地纠错:所有服务的转写文本返回后,插件按词汇表「易错写法」分区的「错误写法 => 标准写法」规则做本地替换(长词优先,英文不区分大小写),即时听写同样应用。
8.6 转写并发数#
「设置 → 进阶 → 录音与转写 → 转写并发数」(1 最稳 / 2 平衡 / 3 较快,默认 1)仅作用于导入长音频的分块并行上传;录音过程中的分段实时转写始终顺序处理。MiMo 分块本就顺序上传,调大并发对其无提速意义。频繁出现 429/500 错误时建议改回 1。
第 9 章AI 整理与模式体系#
9.1 功能定位#
AI 整理服务(大模型)承担纪要合并润色、实时大纲、问一问、沉淀、听写清洗、标题生成与翻译等全部智能任务。整理产出的形态由「整理模式」(模板)决定。
9.2 大模型配置#
「设置 → API → AI 整理服务」:
- 服务预设:内置 19 个,包括硅基流动、OpenAI、Poe、OpenRouter、Moonshot/Kimi、阿里百炼、DeepSeek、小米 MiMo、智谱 GLM、火山方舟、腾讯混元、Gemini(OpenAI 兼容)、xAI、Groq、Mistral、Perplexity、其他兼容网关、本地 Ollama、本地 LM Studio 等。选预设自动填入地址与说明,不覆盖已填密钥。
- 仅支持 OpenAI 兼容的 Chat Completions 协议;地址可填到
/v1或根地址,插件自动补全/chat/completions。本地 localhost 服务可不填密钥。 - 「获取可用模型」拉取服务的模型列表点选,避免手敲出错;「测试连接」发送极短请求验证地址、密钥、模型三要素。
- 硅基流动 / MiMo 场景提供「复用转写密钥」一键按钮。
- 插件按模型名自动判定输出上限(如 DeepSeek V4 为 64000、MiMo 为 16000,未知模型按 8000),避免请求超限报错。
API 方案(「设置 → API」顶部):
- 「保存为方案」把当前「转写服务 + AI 整理」整套配置(含各自密钥与转写服务快照)存为命名方案;
- 方案下拉一键整套切换,面板「更多设置 → 方案」中亦可快捷切换;
- 「检测」按钮同时测试转写(1 秒静音音频)与大模型连通性,汇总为一条结果;
- 激活某方案后,对转写或大模型配置的任何修改都会自动回写进该方案;删除方案不清空当前工作配置;
- 旧版本保存的「仅 AI 整理」方案不含转写快照,界面会标注,重新点「保存为方案」即可纳入转写配置。
快速配置:「设置 → LexVoice(首页)→ 快速配置」支持小米 MiMo 与硅基流动两家「一 Key 通用」供应商,填一次 Key 点「应用」同时配好转写与 AI 整理,并自动存成一套同名 API 方案(同名覆盖不堆叠)。MiMo 按密钥特征自动选择接入地址。
9.3 整理模式清单#
整理模式决定纪要的提示词模板与 frontmatter 结构,在「设置 → AI 整理 → 纪要模板」设默认,或在面板「模板」下拉、导入弹窗、右键菜单中按次选择:
| 模式 | 适用场景 | 产出特点 |
|---|---|---|
| 综合纪要(默认) | 通用 | 速览 / 正文 / 查阅三层结构 |
| 工作纪要 | 工作会议 | 决议、待办、风险、进展导向 |
| 访谈 | 访谈、调研 | 问答转洞察,frontmatter 记录受访者/访问者 |
| 个人笔记 | 口述、灵感、复盘 | 独白整理 |
| 学习笔记 | 课程、视频、播客 | 知识结构化 |
| 研讨会 | 多方研讨 | 观点、争议、证据梳理 |
| 仅转写不整理(off) | 只要文字稿 | 不调用大模型 |
整理输出篇幅按录音时长与转写量分四档自适应(4096/8192/16000/32000 token),并受当前模型输出上限封顶。
结构化程度:「设置 → AI 整理 → 纪要生成 → 结构化程度」提供宽松/均衡/严格三档(默认均衡),控制正文的层级化与格式化力度。
9.4 思考档(思维链控制)#
面板「更多设置 → 思考」提供三档(此项仅在面板设置,设置页无对应项):
- 快速模式:关闭思维链,省 token、提速;
- 默认模式(默认):不干预服务默认行为;
- 推理模式:显式开启思维链,适合复杂内容。
插件按服务商自动注入对应参数(如 DeepSeek/火山/智谱走 thinking 参数,硅基流动/阿里百炼/MiMo 走 enable_thinking,OpenAI o 系列/Grok/Gemini 2.5 等走 reasoning_effort)。不支持思维链控制的服务该下拉显示「不支持」。部分内部任务有固定档位(如听写清洗强制快速模式)。
9.5 重新整理#
在面板「纪要」列表右键 →「重新整理为」:从笔记底部保存的「分段原始转写」重建整篇纪要。可先勾选一个偏好修饰(更详细 / 更精炼 / 更结构化 / 更自然 / 详细拓展,勾选状态持久记忆),再点目标模式执行。执行时会应用 frontmatter 中的角色映射(把「代号 → 真名」替换到转写),保留用户对 frontmatter 的修改;产出保存为版本,可在面板查看或删除派生版本。命令面板另有「重新整理当前纪要(应用 yaml 角色映射)」,用于修改人员映射后按原模式重跑。「设置 → AI 整理 → 纪要生成」中的「重新整理偏好追加提示词」可为勾选偏好的重整追加自定义要求。
9.6 翻译(纪要语言策略)#
「设置 → AI 整理 → 语言与翻译」在整理阶段统一纪要输出语言(整理与翻译一次完成,不是独立翻译命令):
- 跟随原文(默认);
- 统一为目标语言:正文全部译为目标语言;
- 双语括注:目标语言为主,关键决策、术语、短引语括注原文。
目标语言支持中/英/日/韩及自定义;「保留专有名词原文」默认开启;还可填写额外语言要求。语言策略只影响整理产物,纪要底部的原始转写始终保留原文。注意与 8.4 节的「实时语音翻译」区分:后者是转写环节的流式翻译服务。
9.7 自定义提示词模板#
「设置 → AI 整理 → 纪要模板 → 打开模板库」:内置提示词只能「设为默认」不能修改;「新建自定义提示词」可创建完整独立模板(必须包含 {{TRANSCRIPT}} 占位符,否则无法保存),保存后作为新模式出现在所有模式选择入口,可设为全局默认。「AI 优化提示词」按钮可让大模型把你的草稿改写成结构化整理提示词。删除自定义模板时若其正是默认模板,自动回退到学习笔记模式。
9.8 标题生成与自动重命名#
整理完成后,插件取整理稿前 2500 字调用大模型提炼一个不超过 15 字的中文主题标签(偏好「具体对象-核心议题」格式,如「合同审查-供应商独家条款」),追加到文件名后重命名,库内链接自动更新;失败时静默保留原文件名。开关在「设置 → 进阶 → 自动加场景标签到文件名」(默认开)。模式为「仅转写」或整理产物为空时不重命名。
9.9 AI 润色选区#
编辑器命令「AI 润色:当前选区或整篇」把选中文本(无选区则整篇)当作转写原文,按当前默认模板整理并原地替换。注意此操作直接覆盖原文、无版本保存,请谨慎在重要笔记上使用。
第 10 章知识层#
知识层把散落在各篇纪要中的信息沉淀为可复用资产:人员档案、待办、学习卡片与转写热词,并提供聚合视图与再加工产物(可视化报告、邮件草稿)。相关设置集中在「设置 → 信息对象」。
10.1 知识沉淀(人 / 事 / 知 / 词)#
入口:面板「沉淀」标签页。首次进入显示「AI 还没读过这篇纪要」与「扫描本篇」按钮;已扫描过再次触发时会弹出「重新扫描本篇?」确认框。点「扫描本篇」后,AI 通读当前纪要产出四组候选,按「人 → 事 → 知 → 词」接力条逐组推进:
- 人员:逐条「留下/合并/忽略」,点名字可就地更正被转写认错的人名,改名同步回写笔记正文与 frontmatter;确认后进入人员库(默认
LexVoice/人员)。 - 待办:复选框模式(默认全选),「加入待办」优先写入当日日记的「## 待办」段——行内格式兼容 Tasks 插件的截止日期与责任人标注,附来源纪要回链与防重复标识;未启用日记功能时回退为待办卡片文件夹一条一文件。
- 学习卡片:写入学习卡片文件夹,一张一文件,含卡片类型(概念/机制/案例/问答/追问/观点)、摘要、观点持有人、可复用句与来源回链。
- 转写热词:按分区并入词汇表文件,作为后续转写的识别提示;已更正词同时回写纪要正文。
流水线的交互细节:
- 每组默认只显示前 8 条,可展开查看全部;后三组底部提供「加入待办/卡片库/热词库(N)」与「忽略未选」按钮。
- 完成一组后约 1 秒自动跳到下一组,全部完成显示「这场会沉淀完了」。
- 各组操作带撤销提示,误操作可即时撤回。
- 候选与处理状态嵌入纪要文件内隐藏块持久化,换设备或重开面板不丢失;重扫只覆盖未确认候选,已入库和已忽略的不受影响。
- 每组候选有数量上限:人员 20、待办 12、学习卡片 12、热词每分区 18。
供给路径有两条:
- 预提取(零额外调用):AI 整理纪要时自动附带「沉淀预提取」指令,候选以隐藏块存于笔记末尾,打开沉淀标签页直接可见;
- 手动扫描:预提取不可用或想重新提取时,点「扫描本篇」发起一次较大的大模型调用(内部走续写拼接防截断,扫描中可取消,失败只提示、不影响纪要)。
自动沉淀:「设置 → 信息对象 → 转写完成后自动沉淀」(默认关闭)开启后,每次整理完成自动后台扫描,学习卡片与待办直接入库,人员与热词仍保留手动确认流程。默认关闭即是为节省 token。
10.2 人物(人员库)#
一人一页 Markdown 档案,frontmatter 含姓名、角色、常用称呼、组织、邮箱、来源、最近更新与备注;页内自动聚合「相关纪要」(链向此人的纪要表格,需 Obsidian Bases 支持)与「相关待办」(需 Dataview 插件)。人员库默认位于 LexVoice/人员,另有总览文件 LexVoice/人员库.base(提供人员表与人员卡片两个视图)。
- 人员建议来源:单篇沉淀,或命令「AI 扫描纪要库提取人员建议」批量扫描历史纪要(每轮最多 20 篇、增量进行、剩余下次继续,建议缓存上限 500 条、跨会话保留)。
- 确认「加入人员库」时新建档案或合并进既有档案(角色、称呼、组织与证据合并),并把人员链接写回来源纪要的 frontmatter;忽略的建议进入忽略列表,可恢复。
- 设置页「从历史纪要补全」区可查看待确认与已忽略的建议。
- 人员去重:「设置 → 信息对象 → 合并重复人员」会改写全库指向重复页的链接,建议先完成设备同步再操作。
- 隐私三档(「设置 → 信息对象 → 存储与隐私 → 人员资料使用策略」):
- 隐私优先(默认):不向任何服务发送人员资料;
- 人名热词:仅姓名与常用称呼(不超过 80 条)随转写与整理请求发送以提升人名识别率,首次选择需弹窗授权,可一键撤销;
- 本地增强:仅当转写/大模型端点为本地或局域网地址时发送完整人员上下文(不超过 60 人)。
10.3 词汇表(转写词表)#
单文件 Markdown 热词表(默认 LexVoice/词汇表.md),固定六个分区:人名、品牌/机构、项目/产品、行业术语、易错写法(格式「错误写法 => 标准写法」)、其他专有名词。可手动编辑,也可通过沉淀「加入热词库」或「设置 → 信息对象 → 提取转写词表」批量扫描历史纪要补全。其对转写的两层影响见 8.5 节。以 #、>、<!--、// 开头的行会被忽略。
10.4 学习墙、待办墙、概念墙与对象总览#
命令「打开学习卡片瀑布墙」「打开概念墙」「打开待办墙」「打开对象总览」(或「设置 → 信息对象」的对应按钮)会在视图文件夹(默认 LexVoice/视图)生成聚合视图页:
| 视图 | 聚合内容 |
|---|---|
| 学习卡片瀑布墙 | 学习卡片文件夹中的全部卡片 |
| 概念墙 | 概念类学习卡片 |
| 待办墙 | 待办卡片文件夹与全库带 LexVoice 待办标记的任务行 |
| 对象总览 | 以上全部,带「全部/学习卡片/概念/待办」筛选条 |
- 待办卡片可直接在墙上勾选完成,状态回写源文件(日记或卡片)的对应任务行;点任意卡片跳转来源。
- 墙页使用 dataviewjs 渲染,需安装 Dataview 插件并启用 JavaScript 查询,否则只显示代码块。
- 墙页为生成物,每次打开时覆盖刷新,请勿在其中手写内容。
- 「补齐视图」按钮生成 9 个 .base 明细视图文件(按模式 5 个、按场景 4 个,含全部纪要总览),已存在的不覆盖;需支持 Bases 的 Obsidian 版本。
10.5 可视化报告(HTML / PDF)#
命令「AI 生成当前纪要 HTML 报告」「AI 生成当前纪要 PDF 报告(整页不截断)」,或面板纪要右键 →「生成」→ 对应项。插件把纪要二次加工成可独立分享的可视化报告:
- 研讨会模式走数据驱动的固定模板:生成前先弹配色选择,AI 只产出数据再注入内置模板整体着色;其余模式由 AI 生成报告结构后渲染为通用 HTML 报告。
- 产物写入 HTML 报告文件夹(默认
LexVoice/HTML报告),命名「<纪要名>-HTML报告.html」「<纪要名>-报告.pdf」,生成后默认用系统默认程序打开。 - HTML 内置「保存长图」按钮可导出 PNG;PDF 版按内容真实尺寸渲染为单页不分页 PDF,单页高度封顶 18000 像素,超长时提示改用 HTML。
- 限制:需已配置大模型;纪要正文(剥离原始材料后)不足 80 字时报错;PDF 生成为桌面端限定。
10.6 邮件草稿#
面板纪要右键 →「生成」→「邮件草稿」(无命令面板入口):本地生成 .eml 草稿并用系统默认邮件客户端打开。收件人从纪要 frontmatter 的参会人类字段匹配人员库档案的「邮箱」字段自动填入;正文为摘要/决策/待办/会后跟进四段;附件含纪要原文、自动渲染的纪要 PDF 及同名的已生成报告。草稿存放于 LexVoice/邮件草稿。此功能纯本地生成、不发送邮件、不调用大模型;匹配不到邮箱时仍会生成草稿并提示。
第 11 章设置参考#
设置页共 7 个常驻 tab:LexVoice(首页)、常规、API、AI 整理、信息对象、进阶、更新。以下按 tab 列出主要设置项。
11.1 LexVoice(首页)#
功能导航页,无持久设置项,包含:
- 版本号显示与「配置 API」「入门配置」「打开实时纪要面板」按钮;
- 「快速配置」:MiMo / 硅基流动一 Key 同时配好转写与 AI 整理并存成方案,带连通性检测;
- 前置准备四卡:转写服务、AI 整理、电脑音频捕获、日记;
- 进阶能力导航与费用说明。
11.2 常规#
| 设置项 | 默认值 | 说明 |
|---|---|---|
| 录音来源 | 仅麦克风 | 仅麦克风 / 麦克风+电脑音频 / 仅电脑音频 |
| 麦克风 | 系统默认输入 | 选定后严格按设备打开,不静默回退 |
| 电脑音频输入 | 未选 | 电脑音频模式必选(虚拟声卡设备) |
| LexVoice 录音文件夹 | LexVoice/录音 | 修改仅影响新文件 |
| 纪要保存位置 | LexVoice/转写纪要 | |
| 会中材料文件夹 | LexVoice/会议资料 | 工作台拍照/附件存放处 |
| 纪要文件名格式 | YYYY-MM-DD HHmm | |
| 完成后自动打开纪要 | 开 | |
| 写入今日会议概要 | 开 | 依赖 Obsidian 日记功能 |
| 日记概要标题 | 今日会议概要 | |
| 日记概要模板 | 内置模板 | 支持占位符,可一键恢复默认 |
| 显示悬浮气泡 | 开 | |
| 悬浮窗大小 | 大 | 大 / 中 / 小 |
另含「自动推荐」「设备检测」「电脑音频指引」三个功能按钮。
11.3 API#
| 设置项 | 默认值 | 说明 |
|---|---|---|
| API 方案 | 无(临时配置) | 转写+AI 整理整套保存、切换、检测、删除 |
| 转写服务 | 硅基流动 | 9 家可选,见 8.2 节 |
| 各服务地址/密钥/模型/语言 | 见 8.2 节表格 | 每家独立保存;「恢复推荐值」不覆盖密钥 |
| 目标语言(仅翻译服务) | 中文 | 13 种可选 |
| 听写服务(地址/密钥/模型/语言) | 全空 | 空 = 复用纪要转写服务;wss 地址走流式 |
| 听写落点 | 插入光标(智能回退剪贴板) | 或总是复制到剪贴板 |
| 听写自定义整理提示词 | 空(跟随内置模板) | {{转写}} 占位 |
| AI 整理服务预设 | 硅基流动 | 19 个预设 |
| AI 整理服务地址 | https://api.siliconflow.cn/v1/chat/completions | |
| AI 整理访问密钥 | 空 | 本地服务可留空 |
| AI 整理模型标识 | 空 | 「获取可用模型」点选 |
11.4 AI 整理#
| 设置项 | 默认值 | 说明 |
|---|---|---|
| 结构化程度 | 均衡 | 宽松 / 均衡 / 严格 |
| 重新整理偏好追加提示词 | 空 | 仅影响勾选了偏好的重整 |
| 语言策略 | 跟随原文 | 跟随原文 / 统一目标语言 / 双语括注 |
| 目标语言 | 中文(zh-CN) | 含自定义 |
| 保留专有名词原文 | 开 | |
| 额外语言要求 | 空 | |
| HTML 报告保存文件夹 | LexVoice/HTML报告 | |
| 报告生成后自动打开 | 开 | |
| 报告页脚公司名 | 空 | 空时用纪要「公司/」标签(研讨模板) |
| 默认纪要模板 | 综合纪要 | 模式清单见 9.3 节 |
| 模板库 | — | 自定义提示词管理,见 9.7 节 |
11.5 信息对象#
| 设置项 | 默认值 | 说明 |
|---|---|---|
| 转写完成后自动沉淀 | 关 | 开启后卡片/待办自动入库,人员/热词仍需确认 |
| 学习卡片文件夹 | LexVoice/学习卡片 | |
| 待办卡片文件夹 | LexVoice/待办卡片 | 仅日记不可用时回退使用 |
| 人员文件夹 | LexVoice/人员 | |
| 人员库总览文件 | LexVoice/人员库.base | |
| 人员资料使用策略 | 隐私优先 | 隐私优先 / 人名热词(需授权) / 本地增强 |
| 转写词表文件 | LexVoice/词汇表.md | |
| 视图文件夹 | LexVoice/视图 | 对象墙与 .base 视图存放处 |
另含批量提取(人员建议 / 转写词表)、扫描记录清空、人员去重、对象墙与明细表格入口等功能按钮。
11.6 进阶#
| 设置项 | 默认值 | 说明 |
|---|---|---|
| 即时分段转写 | 开 | 关闭则停止时一次性转写 |
| 过滤 3 秒内录音 | 开 | 误触录音直接丢弃 |
| 分段间隔 | 5 分钟 | 范围 0.5–30 分钟;流式服务下不生效 |
| 转写并发数 | 1 | 1–3,仅影响导入长音频 |
| 保留后台切片音频 | 关 | 开启后成功转写的切片也保留 |
| 纪要整合排版 | 开 | 关闭则保留分段原文并追加整合版块 |
| 自动加场景标签到文件名 | 开 | AI 提炼不超过 15 字主题 |
| 实时大纲 | 开 | 关闭后仅可手动刷新 |
| 录音开始时自动打开实时纪要面板 | 开 | |
| 本地诊断日志 | 开 | 同行有「复制诊断报告」按钮 |
| 诊断日志文件夹 | LexVoice/诊断日志 | |
| 收件箱文件夹 | 空(禁用) | 库内相对路径 |
| 自动处理新文件 | 开 | 关闭后仅可手动扫描 |
| 归档子文件夹 | processed | 空 = 不归档(可能重复处理) |
| 等待云盘同步完成(毫秒) | 3000 | 范围 0–60000 |
| 最大重试次数 | 3 | 范围 1–10(队列自动重试上限) |
另含「立即扫描收件箱」「打开队列」「重试全部」「清空诊断日志」等功能按钮。
11.7 更新#
| 设置项 | 默认值 | 说明 |
|---|---|---|
| 启动时自动检查 | 开 | 最多每 24 小时一次 |
状态行显示当前版本、可用版本、上次检查、上次错误、备用源数量与写入目录;操作按钮见 2.3 节。
11.8 仅面板可调的设置#
以下项无设置页入口,仅在实时纪要面板「更多设置」中调整:思考档(默认「默认模式」)、整理偏好(默认无)。「模板」「音频」「分段间隔」「方案」在面板中的修改与设置页同源,即时保存。
第 12 章故障排查#
12.1 诊断报告#
遇到问题需要求助或反馈时,先复制诊断报告:
- 入口:命令面板「复制诊断报告」,或「设置 → 进阶 → 诊断与日志」中的「复制诊断报告」按钮。
- 内容:环境信息(插件版本、Obsidian API 版本、平台)、配置摘要(转写服务/模型/端点、并发数、音源模式、分段间隔、队列各状态计数)与最近 100 行诊断日志(取最近 3 个日志文件),复制到剪贴板后可直接粘贴给开发者。
- 隐私脱敏:日志写入时即打码——密钥与令牌类字段、系统用户目录与本地路径全部打码,键名涉及密钥、提示词、转写文本、正文内容的字段整体替换为占位符,路径字段只留文件名;日志不写入音频、转写正文、提示词全文或 API Key。报告尾部注明脱敏范围。
- 诊断日志按天写入库内 JSONL 文件(默认
LexVoice/诊断日志/YYYY-MM-DD.jsonl),只存本地、不自动上传;「清空诊断日志」把全部日志移入系统废纸篓(需确认)。关闭「本地诊断日志」开关后不再记录,将无法追溯关闭期间的问题,一般建议保持开启。
12.2 常见错误对照表#
| 现象 | 原因与插件行为 | 建议处理 |
|---|---|---|
| 转写报 429 / 限流 | 服务端限流。插件按服务端 Retry-After 秒数(封顶 90 秒)或 30–45 秒随机退避后自动重试,单块最多 3 次请求 | 把「转写并发数」改回 1;MiMo 用户注意 10K TPM 配额,块间数十秒等待属正常配速 |
| 转写请求超时 | 云端超时为 120 秒基础 + 按体积追加(封顶再加 180 秒);本地服务放宽至 10 分钟 | 检查网络与代理;大文件先压缩码率;本地服务确认已启动 |
| 转写返回空结果 | 服务成功响应但无文字。不低于 30 秒的段按「软失败」进重试队列,正文占位「转写失败(空结果)」;短于 30 秒的视为该段无内容 | 等待队列自动重试;若反复为空,检查音频设备是否选错(录了静音) |
| MiMo 转写末尾缺内容 | 撞到 2K 输出上限。插件保留已转文字并追加「本段较长,末尾可能有少量内容未转完」标记 | 缩短分段间隔或改用其他转写服务处理长段落 |
| 队列任务显示「missing」/ 音频不存在 | 临时切片已被清理或丢失 | 在队列面板逐条点「重试」,插件会从完整录音(母带)按时间偏移重新切片恢复 |
| 队列任务显示「blocked」 | 大模型配置缺失或服务异常,整理任务等待处理 | 修好「AI 整理服务」配置后执行命令「重试所有失败任务」 |
| 流式转写段失败 | wss 连接失败或中断;此类段不进重试队列(无法离线重试) | 录音与音频不受影响;可对整篇「重新整理」,或改用分段型服务 |
| 大纲长时间不更新 | 大纲随分段转写完成才刷新,分段间隔大即更新慢 | 调小分段间隔(建议 3–5 分钟)或手动点「刷新」 |
| 无法安装/启用插件 | 文件位置或版本问题 | 确认三文件位于 .obsidian/plugins/lexvoice/、Obsidian 不低于 1.10.0、已关闭安全模式;更新失败时插件会自动尝试多个下载源 |
| 提示 main.js 与 manifest 版本不一致 | 本地文件版本错位 | 到「设置 → 更新」重新执行一键更新(版本相同也可重装修复) |
| 麦克风访问被拒绝 | 系统收回了麦克风权限 | 按遮罩指引打开系统设置授权;已录内容可选「仅保存录音」 |
| 整场几乎没检测到声音 | 有效采样中有声占比低于 2%,多为设备选错(如选了无输入的虚拟设备) | 到「设置 → 常规 → 音频输入」检查设备选择,用「设备检测」验证 |
| 导入的文件被跳过(0 字节) | 云盘占位文件尚未下载完成 | 等文件在本地下载完整后重新导入 |
| 收件箱文件未处理并提示冲突 | 云盘同步冲突副本(坚果云/Dropbox/OneDrive 冲突命名) | 手动解决冲突后再放回收件箱或手动扫描 |
| 听写结果没写进笔记 | 落字失败时自动转投剪贴板并提示 | 直接粘贴;若剪贴板也失败,用命令「听写 · 复制上次转写原文」找回 |
| AAC 音频导入前弹出转码提示 | AAC 需先在本机转为临时 WAV 以保证各转写服务兼容 | 属正常流程,等待即可;频繁处理 AAC 可考虑改用 mp3/wav 录音 |
| MiMo 无法重转写旧录音(m4a/mp4) | MiMo 只收 wav/mp3,且旧录音编码无法本机转换 | 换其他转写服务重转写,或今后固定使用 MiMo(其录音自动采用兼容编码) |
12.3 任务队列机制#
转写失败、AI 整理失败等可重试任务自动进入持久化队列:插件启动时若队列非空,会提示「发现 N 个待处理任务,后台重试中…」并自动跑一轮重试。每个任务失败一次计一次重试,达到「最大重试次数」(默认 3,可调 1–10)后停止自动重试,可手动逐条重试。永久性错误(密钥未配置、格式不被接受、超体积等)不做无谓重试。手动入口:命令「重试所有失败任务」、设置进阶页「重试全部」、面板纪要行的「重试转写」按钮或右键「重试转写失败片段」。
12.4 处理进度面板操作#
打开方式:命令「打开待处理队列」、点击状态栏进度指示、「设置 → 进阶 → 打开队列」或面板中的进度入口。面板展示三组条目:已完成(含耗时与 token 用量)、处理中(当前文件、步骤与百分比)、待处理(重试计数与最近错误信息)。每条待处理任务可单独「重试」或「删除」;底部提供「重试全部」与「清空待处理」(需确认;清空后纪要中对应位置保持现状,可在纪要中右键重新发起)。
第 13 章已知限制与最佳实践#
13.1 移动端支持范围#
移动端可用:仅麦克风录音(系统默认输入)、分段/整段云端转写、AI 整理、导入文本、纪要浏览、设置页(单列布局)、实时面板(主区域标签页)。
移动端受限:
- 录音来源强制「仅麦克风」,设备选择下拉禁用;电脑音频/虚拟声卡采集为桌面限定。
- 流式转写与流式听写不可用(移动端无法建立带鉴权头的 WebSocket):录音选流式服务会提示并保留音频;听写自动回退整段批量转写。
- PDF 报告生成为桌面限定。
- 长音频导入依赖的本机解码能力在移动端不完全可靠,建议长音频在桌面端处理。
- 移动端录音请保持 Obsidian 前台,锁屏可能中断录音。
13.2 说话人归属注意事项(重要)#
当前转写链路不含声纹分离(WhisperX 本地服务除外):转写产出的是不区分说话人的连续文本,纪要中「这句话是谁说的」由 AI 依据上下文(称呼、语境、人物关系)推断,存在张冠李戴的可能。尤其在混合音源(麦克风 + 电脑音频)下,两路声音混录成单轨,插件无法从音频上区分本人发言与对方发言。因此:涉及责任认定、承诺表述、关键决策归属等重要内容时,请通过纪要中的回听锚点回放原始音频核对,勿直接引用 AI 的归属判断作为依据。若需更准确的说话人区分,可考虑本地部署 WhisperX(带说话人分离,插件将其归一为「[说话人N]」标注;仅整段导入时编号全程一致,分段录音跨段编号可能对不上)。
13.3 MiMo 实时场景约束#
MiMo 的 TPM 配速与 2 分钟切块特性使其更适合导入与非高频分段场景:分段间隔设得很小(如 0.5–1 分钟)叠加实时大纲时,容易触发限流排队,体验为「转写慢半拍」。会议实时场景追求流畅时建议选硅基流动等分段服务或流式服务。
13.4 分段间隔建议#
- 常规会议:3–5 分钟,兼顾大纲刷新频率与调用成本。
- 需要大纲高频刷新的场合(谈判、面试):1–3 分钟,注意大模型调用次数随之上升。
- 长时间讲座、只要最终纪要:可加大间隔或关闭即时分段,停止后一次性处理。
- 记住:实时大纲的刷新节奏跟着分段间隔走,间隔设太大,大纲会显得「卡住」。
13.5 长音频导入预期#
导入长音频时,本机需先完整解码音频再切块,会短时占用较多内存与库内临时存储(分块 WAV);转写耗时与音频时长、并发数、服务商限流有关。数小时的音频建议在桌面端、网络稳定时处理,并把「转写并发数」按服务承受能力设为 2–3(MiMo 除外,保持 1 即可)。
13.6 其他已知限制#
- 混合音源录成单轨,无法事后拆分两路声音。
- 问一问历史不持久化,关闭面板即清空(写入纪要的除外)。
- 听写原文仅保留最近一次且重启后丢失,重要口述请及时确认落字结果。
- API 密钥以混淆(非加密)形式存于库内
data.json,请勿把整个库分享给不信任的对象。
第 14 章附录#
附录 A:命令面板命令全集(29 条)#
以下命令均以「LexVoice:」前缀出现在命令面板(Ctrl/Cmd+P)中:
| 命令 | 作用 |
|---|---|
| 开始/停止录音 | 空闲时开始录音,录音中停止并进入整理 |
| 暂停/继续录音 | 暂停或恢复当前录音 |
| 开始录音 · 仅麦克风 | 一次性指定音源开始录音 |
| 开始录音 · 麦克风 + 电脑音频 | 一次性指定混合音源开始录音 |
| 开始录音 · 仅电脑音频 | 一次性指定电脑音频开始录音 |
| 听写 · 开始/结束 | 触发或结束快速口述 |
| 听写 · 复制上次转写原文 | 召回最近一次听写的转写原文 |
| 导入已有音频文件转写+润色 | 打开导入音频选择窗 |
| 导入已有文本 / MD 结构化整理 | 把现成文字稿送 AI 整理 |
| AI 润色:当前选区或整篇 | 按默认模板整理选区或整篇并原地替换 |
| 重新整理当前纪要(应用 yaml 角色映射) | 按原模式重跑整理并应用人员映射 |
| 迁移历史笔记到新 frontmatter 结构 | 旧版本笔记结构升级 |
| 扫描收件箱并处理所有未处理文件 | 手动触发收件箱导入 |
| 打开实时纪要面板 | 打开侧栏工作台 |
| 显示/隐藏悬浮气泡(总开关) | 切换悬浮气泡显示 |
| 打开学习卡片瀑布墙 | 生成并打开学习卡片聚合视图 |
| 打开概念墙 | 生成并打开概念聚合视图 |
| 打开待办墙 | 生成并打开待办聚合视图 |
| 打开对象总览 | 生成并打开全对象聚合视图 |
| AI 生成当前纪要 HTML 报告 | 生成可视化 HTML 报告 |
| AI 生成当前纪要 PDF 报告(整页不截断) | 生成单页 PDF 报告(桌面端) |
| 打开待处理队列 | 打开处理进度面板 |
| 重试所有失败任务 | 批量重试队列中的失败任务 |
| 清理空白短录音 | 清理不超过 10 秒且无有效转写的纪要与录音 |
| 清理过期分段音频缓存 | 清理超过 7 天且不被队列引用的缓存音频 |
| 复制诊断报告 | 复制脱敏诊断报告到剪贴板 |
| AI 扫描纪要库提取人员建议 | 批量扫描历史纪要产出人员候选 |
| 检查更新 | 手动检查插件新版本 |
| 安装可用更新 | 执行一键增量更新 |
附录 B:数据存放位置#
| 数据 | 默认位置 |
|---|---|
| 插件设置(含混淆存储的 API Key、API 方案、队列任务、更新状态) | .obsidian/plugins/lexvoice/data.json |
| 完整录音(母带) | LexVoice/录音 |
| 转写纪要 | LexVoice/转写纪要 |
| 会中材料(拍照/附件) | LexVoice/会议资料/<会话时间戳>/ |
| 分段音频缓存 | LexVoice/.cache/segments(7 天过期自动清理) |
| HTML / PDF 报告 | LexVoice/HTML报告 |
| 邮件草稿及附件 | LexVoice/邮件草稿、LexVoice/邮件草稿/附件 |
| 诊断日志 | LexVoice/诊断日志(按天 .jsonl) |
| 词汇表 | LexVoice/词汇表.md |
| 人员档案 / 人员库 | LexVoice/人员、LexVoice/人员库.base |
| 学习卡片 / 待办卡片 | LexVoice/学习卡片、LexVoice/待办卡片 |
| 聚合视图 | LexVoice/视图 |
| 更新备份 | .obsidian/plugins/lexvoice/.lexvoice-update-backups/<时间戳>/(含 data.json 快照) |
各路径均可在对应设置 tab 修改;修改仅影响新文件,已有文件不自动迁移。插件无任何云端存储。
附录 C:隐私说明#
- 数据流向:录音音频与转写文本会发送到你自行配置的转写服务与大模型服务(云端服务商或本地服务),发送范围由你的配置决定;LexVoice 插件本身不运营任何服务器、不上传任何数据。
- 人员资料:默认「隐私优先」,不向任何服务发送人员库内容;「人名热词」模式仅在你明确授权后发送姓名与常用称呼(不超过 80 条),且可随时撤销;「本地增强」模式仅对本地/局域网端点发送完整人员上下文。
- 诊断日志:仅存本地、写入时即脱敏(密钥、路径、正文类字段打码),不含音频与转写正文;诊断报告只有在你主动执行「复制诊断报告」后才会离开本机。
- 密钥保管:API 密钥以混淆(非加密)形式保存在库内
data.json,请勿把库文件夹分享或同步给不信任的对象。 - 本地清理:所有自动/手动清理操作均把文件移入系统废纸篓,可恢复。
本手册基于 LexVoice 1.13.4 源码整理。插件持续迭代,具体界面与默认值以你安装版本的设置页为准;发现文档与实际行为不符时,欢迎到 https://github.com/Lynn-x/LexVoice 提交反馈。