GitHub - dseditor/QwenASRMiniTool: 基於OpenVino-int8權重,精簡的QwenASR小工具,用於即時辨識以及字幕轉換使用 · GitHub

GitHub - dseditor/QwenASRMiniTool: 基於OpenVino-int8權重,精簡的QwenASR小工具,用於即時辨識以及字幕轉換使用 · GitHub

📌 GitHub - dseditor/QwenASRMiniTool: 基於OpenVino-int8權重,精簡的QwenASR小工具,用於即時辨識以及字幕轉換使用 · GitHub

以下為「聲音辨識小工具」(QwenASR-WebView)的內容總結:


⓵ 【容易懂 Easy Know】

這是一款安裝在電腦上的「超級聽寫小幫手」!就像把一位專業速記員請到你家一樣,不論是影片、音樂還是麥克風講話,它都能快速把聲音變成字幕。最厲害的是,所有聲音都在你自己的電腦裡處理,完全不會上傳到網路,保護隱私又安全。就算電腦沒有高級顯示卡,普通電腦也能順暢跑。它還支援唱卡拉OK般的逐字高亮效果,甚至連日文動漫歌曲都能精準辨識,操作起來就像開網頁一樣簡單!


⓶ 【總結 Overall Summary】

「聲音辨識小工具」(QwenASR-WebView)是一款主打完全離線、保護隱私的本地端語音辨識與字幕生成工具。本版本升級為現代化的原生 WebView2 介面,核心整合了 Qwen3-ASR 與 Whisper (Breeze-ASR-26) 兩大語音模型架構,提供使用者高精確度且免連網的轉錄服務。

系統支援多種運算後端:針對無獨顯環境提供 OpenVINO (CPU INT8) 加速,針對有顯卡使用者則透過 CrispASR (Vulkan) 實現跨 NVIDIA、AMD 與 Intel 顯示卡的通用硬體加速,免除繁瑣的驅動安裝流程。功能方面涵蓋單檔與批次轉錄、麥克風停頓偵測錄音、說話者分離標記、字級時間軸對齊(卡拉OK動態效果),以及全新加入的「日語動漫特化模型」,大幅提升日語歌曲與動漫台詞的辨識品質,並修正了日文漢字誤被繁化的問題。此外,工具還內建 OpenAI 相容 API、手機區域網上傳與 Cloudflare 臨時通道,兼顧個人日常使用與進階串接需求。


⓷ 【觀點 Viewpoints】

  • 隱私至上的本地運算架構:所有資料皆在使用者本機處理,不仰賴雲端伺服器,解決了商務會議或個人私密音檔外流的資安隱患。
  • 極致的硬體相容性設計:透過 CPU (OpenVINO) 與通用 GPU (Vulkan) 的雙軌設計,擺脫了過去 AI 工具高度綁定 NVIDIA CUDA 的硬體限制。
  • 細緻的語種與情境特化:引入針對日語動漫微調的模型,並解決繁簡轉換機制中對日文漢字的誤傷,體現針對特定社群需求的深度優化。
  • 兼顧單機體驗與生態擴展:除了具備直覺的圖形化介面,還提供標準 OpenAI 相容 API 與區域網掃碼功能,便於整合至自動化工作流或多裝置協同作業。

⓸ 【摘要 Abstract】

  • 🔒 本地離線運算:音訊與影片全程在電腦本機轉換,資料絕不上傳,徹底保障隱私。
  • 跨平台硬體加速:支援純 CPU (OpenVINO) 與 GPU (Vulkan/CrispASR),NVIDIA、AMD、Intel 顯卡皆能通吃。
  • 🎵 卡拉OK逐字對齊:具備字級時間軸功能,播放時字幕逐字高亮,便於校對與歌詞製作。
  • 🇯🇵 日語動漫特化:新增 Qwen3-ASR 日語特化模型,顯著改善日語歌曲辨識,並保留原生漢字不誤繁化。
  • 👥 多功能處理能力:支援說話者分離(標記人名)、參考文字提示(Prompt)、波形可視化跳播與批次排程轉錄。
  • 🎙️ 智慧錄音轉譯:麥克風錄音時自動偵測語句停頓進行分段辨識,支援即時邊錄邊存。
  • 🌐 多裝置與 API 支援:內建 OpenAI 相容轉錄 API、手機掃碼同網段上傳,以及 Cloudflare 臨時外網通道。
  • ⚠️ 使用注意事項:Windows 安裝路徑建議採用全英文,以避免底層程式調用時發生錯誤。

⓹ 【FAQ 測驗】

Q1. 關於此工具在沒有獨立顯示卡(GPU)的電腦上執行,下列敘述何者正確?

A. 完全無法執行,必須購買 NVIDIA 顯示卡
B. 必須依賴連上雲端伺服器才能運作
C. 可以透過 OpenVINO (CPU) 核心以純 CPU 模式順暢執行
D. 只能辨識英文,無法辨識中文或日文
正確答案:C
解析:本工具支援純 CPU(OpenVINO INT8)推理模式,免顯卡、免驅動即可在一般電腦本機執行。

Q2. 新增的「Qwen3-ASR-1.7B 日語動漫特化模型」解決了以下哪項問題?

A. 自動將日文全部翻譯為繁體中文
B. 提升日語歌詞與台詞的辨識精準度,並避免日文漢字被 OpenCC 誤轉為繁中字形
C. 縮短日文音檔長度以節省儲存空間
D. 強制移除背景音樂只保留人聲
正確答案:B
解析:該特化模型改善了日文動漫與歌曲的辨識率,同時修正了語言選日語時會跳過繁化,保留原生漢字(如「会/静」不被轉成「會/靜」)。

Q3. 若想將多段會議錄音或多集 Podcast 一次性依序轉成字幕,應使用哪一項功能?

A. 端點分頁的 Cloudflare 對外通道
B. 麥克風即時錄製分頁
C. 「批次」分頁中的多選加入檔案並依序辨識
D. 模型自檢修復功能
正確答案:C
解析:「批次」分頁支援一次匯入大量音訊或影片,系統會自動排程並依序進行辨識。


⓺ 【關鍵標籤 Hashtags】

#語音辨識 #字幕生成 #離線轉錄 #QwenASR #開源工具

✡ Oli小濃縮 Summary bot 為您濃縮重點 ✡

▶ https://github.com/dseditor/QwenASRMiniTool