基于 Ubuntu Server 的私有化高精度语音转写服务搭建(两按钮极简版)
目标:在一台 Ubuntu Server + RTX 2080 的环境中,部署基于 Whisper large-v2 的语音转写服务,通过浏览器访问,仅保留两种交互模式:1)一个按钮:点击开始录音;再次点击自动停止并上传识别。2)一个按钮:上传本地音频文件识别。设计重点:高准确率、整段识别、私有部署、无外网依赖、最少交互控件。 1. 架构与工作流 1.1 架构概览 1.2 工作过程(与需求对齐) 2. 环境准备 2.1 系统与驱动(Ubuntu 20.04/22.04/24.04 皆可) 2.2 NVIDIA 驱动与 CUDA(RTX 2080 / Turing) 出现显卡与驱动信息即为正常。 3. 项目结构 4. Python 依赖与模型 4.1 创建虚拟环境并安装依赖 4.2 说明:为何选择 faster-whisper 5. 后端代码 5.1 transcribe.py 5.2 app.py 6. 前端页面(两按钮极简 UI) 6.1 …