Skip to content

Latest commit

 

History

6 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

PACE V2S 3.0 · 中文会议转写工作台

面向少数主要发言人、较清晰的中文会议。本机完成识别、时间对齐和说话人分组,随后回听校订、分析和导出。说话人分组不是实名身份识别,结果需要人工复核。

启动

双击桌面 PACE V2S 会议工作台 或根目录 run.bat:自动启动/复用唯一后台,等待就绪后打开网页。final2/run.bat 和原备用启动器也进入同一入口。默认固定8501;已有受管实例则打开它,占用冲突时不换端口再启动,也不强制关闭其他程序。

文件热更新已开启;没有处理任务(转写/模型复听/下载)、没有未保存保护,且网页连续30分钟无交互时自动退出。点击、输入、滚动、回听或刷新会重新计时;仅把网页开着不会保活。再次点击桌面启动器会启动后台,或打开已运行的同一实例;关闭后单独刷新网页不能唤醒。默认固定8501,占用时不换端口另起实例。见启动器与本机客户端接入。

CLI/MCP现支持带版本保护的校订、逐处术语替换、双模型复听核验、词频/发言时长分析、设置管理和多格式导出,见工作台接口与示例。本机Codex或本地运行且具备命令权限的ChatGPT Work可直接使用CLI,MCP为可选入口。

批量转写、旧音频关联、库内重转写、异常扫描、文稿JSON导入、多文稿ZIP、词库检索和模型下载管理也提供CLI入口,默认沿用已保存识别设置。命令调用流程、预览/版本/指纹检查与功能对照见CLI完整操作指南,后台需headless_version:1。

旧式重复实例已完成一次性清理,日常仅使用默认8501的托管入口;不要绕过启动器另起Streamlit开发服务器。

Agent阅读会议可直接用get/search,不启动后台:默认精简段落,--include-words才返回逐字对齐;支持时间范围、搜索前后上下文和get --view dialogue连续对话视图,保留原段ID及可选跨页版本检查。用法与旧读取格式迁移见阅读指南。

本次已建立独立环境 D:\CodexScratch\v2s-runtime\.venv,未改动旧Conda环境。新机器先安装 uv,再运行 install.bat;依赖版本由 uv.lock 锁定,安装脚本不下载模型权重。模型在界面“模型与设置”中准备。

运行环境要求:Windows x64、Python 3.12。当前锁定CUDA 12.8版Torch;已在RTX 3060 12GB验证。CPU可选择Whisper Small,Qwen在CPU上可能明显较慢。

日常使用

  1. 默认中文与Qwen3-ASR 1.7B;需要更快可选Whisper Large-v3 Turbo,保留Large-v3用于兼容和对比。
  2. 导入录音,按实际被录到的人数设置范围,也可以保持自动判断。人数范围不是识别保证。人名、项目名填入“识别热词”,会议主题填入“会议背景提示”。
  3. 导入前可分别改会议名称、选择本批项目;同项目保存到同一项目文件夹。点击开始转写后后台执行,可切换页面查看已有文稿;源文件始终保留,不改名、不删除。
  4. 在“文稿工作台”填写发言人名称、搜索回听、校订正文/时间/分组。保存后所有分析与导出同步更新;可以撤销上次校订或恢复原始结果。
  5. 新导入/明确关联的原录音与转写JSON/TXT保存到普通目录D:\V2SData\library;“媒体库”可重命名、放入回收站及恢复。历史文稿保留原存档,旧录音只需明确关联一次,之后重启可回听;不会扫描源文件夹或自动迁移过去录音。
  6. 下载TXT、JSON、SRT/VTT字幕、CSV词频、词云PNG或PDF报告;多个结果可打包ZIP(不含音频/PDF)。建议导出JSON作独立备份,换电脑时通过JSON恢复。

音频损坏提示现在可展开“音频异常定位”查看具体时间并回听原录音。“术语核验与批量校订”可对整篇同类误识别先做本地双模型复听,再选择接受建议或人工核对,支持撤销;详见异常定位和术语校订。

侧边栏顶部显示闲置倒计时;新增独立“媒体库”和“词库管理”。原专业词/自定义词/停用词资源未丢失,仍按原功能使用。详细说明见普通媒体库与词库管理。

模型当前状态

模块 当前配置 说明
中文优先 Qwen3-ASR 1.7B 已下载,GPU识别、对齐与兼容说话人流程已跑通
速度选择 Whisper Large-v3 Turbo 已下载并实测;中文标点表现需按样本比较
兼容选择 Whisper Large-v3 复用原模型,已实测识别与对齐
CPU备用 Whisper Small 已下载;CPU验收结果见验证文档
时间对齐 中文/英文 Wav2Vec2 按语种选择;其他语种保留ASR时间轴
当前默认说话人模块 pyannote 3.1 本地兼容 保留作为对照,分组需要回听校订
已就绪的可选升级 pyannote Community-1 已下载并完成10分钟真实录音离线对照;效果判定待人工回听

Community-1已于2026-09-05通过本机凭据下载到独立模型目录,可在侧边栏“高级识别设置 → 说话人模型”中选择。使用本地模型无需联网或再次提交Token;当前没有自动替换3.1默认值,也不代表已证明真实会议准确率更好。新机器下载仍需官方访问资格与有效本机Token。

已对用户指定录音的前10分钟执行受控双模型测试:两者均2组,阶段用时均约20秒,输出一致比例98.17%(不是准确率)。详见真实录音对照记录,私人正文只保存在独立本地结果目录。

原配置文件的完整路径为K:\AI\v2s\final2\.env(final2文件夹中的.env,不是final2.env),新版本会自动读取,无需搬移。请勿将文件内容或Token发送到聊天中。

设置与数据边界

  • 单文件500MB;每批最多20个文件、排队总计1GB;解码上限4小时。支持WAV/MP3/M4A/FLAC/OGG/OPUS/AAC及有音轨的MP4/WebM。
  • 以录音内容和完整识别参数去重;同名不同内容分别保留。勾选“相同录音也重新转写”可主动重跑。
  • 识别、对齐、说话人逐阶段释放模型。对齐/说话人失败仍保留正文,警告写入处理记录。
  • 词库、同义词、排除词与词云共用一致统计;专业词按配置隔离,不污染其他会话。
  • 环境变量 > 根目录.env > final2/.env > 默认值。沿用原私有配置但不复制Token。设置JSON只包含白名单字段,不含凭据或代理地址。
  • 用户明确导入/关联的原录音保存到D:\V2SData\library普通媒体目录,转写另有JSON/TXT快照;不扫描或搬动源文件。回听内存最多1GB,释放内存不删除已保存媒体。正式文稿和常用设置仍使用Windows账户绑定的DPAPI历史库,事务写入D:\CodexScratch\v2s-runtime\work\library;可用V2S_LIBRARY_DIR指定专用非同步空目录。
  • 已完成识别片段约每15秒保存一次检查点(以片段完成为触发点);服务意外退出后可恢复此前提交的文字。服务重启不能自动续跑模型,需重新加入原录音重跑;检查点明确标注为未完成。浏览器刷新不会主动取消当前服务中的任务。
  • 两个页面编辑同一文稿时,旧页面不能静默覆盖新版本;提示冲突后可保留独立副本。归档可恢复,不是永久删除。默认加载最近20份,文稿库列出最近200份;并非多人权限系统。
  • 加密文稿库不是跨电脑备份,换Windows账户可能无法解密。看到保存失败提示时,立即导出JSON;未点“保存校订”的表格输入不在自动保存范围内。
  • 个别音频数据包损坏时,可保留其余可解码内容并显式警告;按时间戳补静音避免后续时间轴前移。无法恢复的声音不会伪造,严重时间跳变或超过100个坏包拒绝处理。
  • 识别默认离线;模型下载通过独立进程联网,“本次直连”只影响下载进程,不修改系统代理。未接入云端摘要、情绪推断或会议音频上传。
  • 服务只监听回环地址,不是带账户权限控制的多人服务器,请勿直接暴露到公网。

目录与维护

app.py是唯一当前入口,pace_v2s/是V3代码,tests/是当前回归测试,resources/仍使用原词库。final1.py、app3.py等及final2/main.py保留为历史实现,不再作为默认入口。

模型、依赖和测试产物放在D:\CodexScratch,未创建运行时目录到OneDrive的链接。不要把虚拟环境或模型依赖树复制进同步目录。

旧模型转换/包内补丁/Gemini试验已停用;旧Token诊断改为只报告配置存在性。词库更新需显式--download,只生成独立预览,不覆盖当前词库。历史Git提交包含曾经硬编码的凭据:本次移除了启动器中的值,但未重写历史或执行账号密钥轮换;建议自行撤销失效凭据。

详见重构前基线、新旧功能设置对应、架构和维护、验收及限制。

About

No description, website, or topics provided.

Resources

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages