メインコンテンツへスキップ
WeeMed Logo

革新的な技術を通じて医療機関向けのスマート情報システムを構築し、医療サービスの品質向上に取り組んでいます

瑋易科技株式会社

法人番号:00085209

フォローする:

クイックナビゲーション

  • 会社概要
  • つくっているもの
  • ソリューション
  • EAPマーケットプレイス
  • サービス
  • 技術
  • ニュース
  • 採用
  • お問い合わせ

法的情報・企業情報

プライバシーポリシー利用規約情報セキュリティポリシーESG 持続可能性

お問い合わせ

カスタマーサービス
+886-4-23016388
メール
service@weemed.ai
会社住所
台中市西区台湾大道二段186号20階の1
© 2024-2026 瑋易科技株式会社。無断転載を禁じます。
ESG 持続可能性プライバシーポリシー利用規約情報セキュリティポリシー
WeemedAI Logo
ホーム
私たちについて
製品
つくっているもの
サービス
お問い合わせ

台湾語音声認識

高齢者が話すのは台湾語で、機械はそれを聞き取れません

このページは音声の半分についてです。なぜ現場に台湾語を聞き取れるモデルが要るのか、MediaTek がすでに終えていた工程はどれか、私たちが埋めた工程はどれか、そして試したもののまだ形になっていないもの。Hugging Face に置いた 4 つのファイルのうち 3 つは、この仕事から生まれました。

なぜ必要なのか

高齢者が話し、介護職員は下を向いて入力している

地域拠点で、介護職員が高齢者の隣に座り、タブレットを持っています。昨日はよく眠れましたか。夜中に起きますか。高齢者が答えます。職員は聞きながら、その答えを様式の文言に置き換えながら、下を向いて入力します。高齢者は、その人のつむじに向かって話すことになります。

しかも高齢者が話すのは台湾語です。台湾語と華語が同じ一文に混ざることもよくあります。「わたしの足がね、sng(だるい)」。職員本人は完全に理解しています。ただ、入力するには先に華語へ直さなければなりません。

私たちが欲しかったのは単純なことです。顔を上げて、ちゃんと人と話してもらう。記録は勝手にできあがる。それには台湾語を聞き取れる音声モデルが必要でした。既製の音声認識は華語は得意で、台湾語は苦手です。そして高齢者が、システムに合わせて華語に切り替えてくれることはありません。

台湾語を聞き取れるモデルは、すでに台湾の誰かが作っていました。私たちが埋めたのは「現場にある PC に入らない」という部分です。

私たちの担当はどの工程か

いちばん難しいところは MediaTek が終えていました

Breeze-ASR-26 は MediaTek Research が訓練し公開したモデルで(Apache-2.0、OpenAI Whisper large-v2 由来)、台湾語と台湾なまりを聞き取ります。訓練は私たちではありません。ここは明記しておきます。

ただ 3.1 GB あり、快適に動かすには GPU が要ります。拠点にある 6 年前の PC には入りませんし、職員のスマートフォンなら言うまでもありません。だから残りを私たちがやりました。小さくして、速度とメモリを実測して、3 種類の機械向けに 3 つの版を作り、ネット上に戻しました。

  • このモデルは設計上、台湾語を台湾語正書法ではなく華語漢字で書き出します。得られるのは「意味」であって、台湾語の読みではありません。
  • 3 秒未満で内容の薄い音声では、Whisper 系のすべての実装が推測を始めます。これは系列の性質であり、量子化のせいではありません。

3 つの版

同じモデル、3 種類の機械

違いはどのハードウェアで動かすかだけです。すべて Apache-2.0。商用利用も改変も、許可は不要です。

  • Breeze-ASR-26-ct2

    サーバーがあるなら、これが一番速い

    サイズ
    1.5 GB(int8)、稼働時のメモリは約 2.9 GB
    速度
    RTF 0.21、実時間の約 5 倍速
    向き
    サーバー、8 GB 以上の機械、GPU 環境
    実行環境
    faster-whisper / CTranslate2
    Hugging Face model card
  • Breeze-ASR-26-GGML

    古いノート PC 1 台でも動く。ドラッグするだけ

    サイズ
    848 MB(Q4_0)/1.1 GB(Q5_0)
    メモリ
    約 1.85 GB。4 GB の機械でも動く
    速度
    RTF 0.40(4 スレッド CPU)
    実行環境
    whisper.cpp / MacWhisper / superwhisper、コード不要
    Hugging Face model card
  • Breeze-ASR-26-ONNX

    スマートフォンとブラウザで動く台湾語認識

    形式
    int8 ONNX(encoder・decoder 各 1 ファイル)
    速度
    RTF 1.3(4 スレッド CPU)、他の 2 つより遅い
    向き
    Android、iOS、ブラウザ(WASM)
    実行環境
    sherpa-onnx / onnxruntime
    Hugging Face model card

5 秒を超える音声なら、圧縮前後の違いは分かりません(元モデルに対する文字誤差は約 3.6%)。訪問時、職員の手元にあるのはスマートフォン 1 台だけということも少なくないので、いちばん遅い版も必要でした。

公開しなかったもの

できが足りないものは、上げません

237 MB まで縮めて、スマートフォンで直接動かす試みもしました。進展は本物でした。実際の長い音声で、元のモデルとの差は 63% から 38.7% まで縮まりました。しかし元のモデル自身は 14% です。まだ差が大きいので、公開していません。

途中で書き残すに値する失敗もありました。最初の試みでは、小さいモデルに大きいモデルの「言い回し」を真似させすぎて、かえって悪くなりました。正解そのものを主役に戻し、真似は補助に回してから前進が始まりました。こうした記録も公開します。きれいな数字より、他の人の助けになるからです。

行き詰まっているのは訓練技法ではありません。台湾語の録音が少なすぎることです。公開ソースを合わせても数十時間、しかも大半は原稿を読んだ短文で、高齢者が実際に話す言葉とはかなり違います。

もっと根本的な問題もあります。話される台湾語を忠実に書き表すのは台羅(Tâi-lô)ローマ字で、華語漢字で書くと台湾語の読みが失われます。漢字で「斷腦筋」と書かれても、読む人はそれが脳卒中を指すと分かりません。だからいま作っているのは台羅を出力する版です。まだ完成していません。できたら、このページに載ります。

製品の中での役割

音が言葉になるのは、最初の一歩にすぎません

音声から出てくる文字は、依然として現場の言い方のままです。「皮蛇」は「皮蛇」のままで、「帯状疱疹」に戻して初めて記録に入ります。それは別のモデルの仕事です。両方そろって、話された一文が使える記録になります。

  • その言葉を読み解くモデル:IlhaEmbed
  • 記録がシステムに整理されるまで:Intake AI
  • 何を公開し、なぜ開くのか

台湾語を聞き取れるモデルは、すでにありました。私たちはそれを、現場にある PC に入るようにしました。

どうぞ使ってください。

3 つの版はすべて Hugging Face 上、Apache-2.0 です。各 model card に計測方法・限界・適した用途を記載しています。上流は MediaTek Research の Breeze-ASR-26。訓練は彼らの仕事で、私たちは量子化・計測・形式変換を担いました。

Hugging Face の組織ページへ取材・協業のお問い合わせ