活用事例一覧へ
2026年7月27日音声・翻訳・文字起こし検証時期:2026年4月

音声認識APIの選び方2026|日本語精度・コスト・個人情報対応で比較する【AI活用検証vol.81】

音声認識APIの選び方2026|日本語精度・コスト・個人情報対応で比較する【AI活用検証vol.81】

音声認識APIの選定は、精度・コスト・レイテンシの3軸で語られがちです。しかし扱う音声に個人情報が含まれるかどうかで、選択肢そのものが変わります。

この調査では、主要なSTT(Speech-to-Text)APIを横断比較し、用途別の推薦とローカル運用への切り替え基準まで整理しました。

この調査の概要

最終更新

2026年5月1日

対象

主要クラウドSTT API 13サービス/ローカルデプロイ可能なOSSモデル

比較軸

コスト(1分あたり)/レイテンシ/日本語精度(WER)/データプライバシー

結論

新規・日本語精度重視ならElevenLabs Scribe v2/OpenAI互換のまま安くするならGroq Whisper v3 Turbo/個人情報・カルテを含むならローカルOSSまたは国産オンプレ

本記事の料金・仕様・法令情報は2026年5月時点のものです。導入時は必ず最新の公式情報をご確認ください。法的判断が必要な場合は専門家にご相談ください。

結論:まず「個人情報を含むか」で分岐する

音声データに個人情報・カルテ情報が含まれる?
│
├── YES
│   ├── クラウドAPIで対応したい
│   │   ├── ZDR + BAA 取得可能 → Azure Speech (Japan East) が最も整備済み
│   │   └── 取得困難 or リスク回避 → ローカル or 国産オンプレへ
│   ├── 自社サーバーあり(オンプレ)
│   │   → Speaches + faster-whisper をDockerデプロイ
│   └── 国産サポート・SLAが必要
│       → 国産の医療特化サービス
│
└── NO(個人情報なし・一般用途)
    ├── 新規・日本語精度重視 → ElevenLabs Scribe v2  ← 大抵これでOK
    ├── OpenAI互換コード流用 → Groq Whisper v3 Turbo
    ├── バッチ最安値 → fal.ai Wizper
    ├── リアルタイム会話 → ElevenLabs Scribe v2 Realtime
    └── ミーティング文字起こし → Gladia Solaria-1

個人情報を扱わないなら、比較は素直に精度とコストで決まります。扱うなら、まず法的要件を満たせる選択肢に絞ってから性能を見る、という順番になります。

日本語精度(WER:低いほど高精度)

サービス

日本語WER

ElevenLabs Scribe v2

2.2%

Soniox

8.7%

Groq / fal.ai Wizper

約5〜8%(Whisper large-v3相当)

Deepgram Nova-3

11.7%

OpenAI gpt-4o-transcribe

13.8%

Azure Speech

14.0%

Google STT

14.2%

AssemblyAI

14.8%

Amazon Transcribe

16.2%

差が大きすぎるため、精度が最優先なら選択肢は絞られます。WER 2.2%と13.8%では、後工程の修正量がまったく変わります。

なお出典には注意が必要です。Sonioxの数値は自社主催ベンチマークによるものでバイアスの可能性があります。ベンチマークは誰が測ったかを確認する必要があります。

コスト(1分あたり)

サービス

バッチ

ストリーミング

備考

ElevenLabs Scribe v2

$0.0037

バッチ専用。精度業界最高

ElevenLabs Scribe v2 Realtime

$0.0065

リアルタイム専用。150ms

Groq Whisper v3 Turbo

$0.00067

OpenAI完全互換。最安バッチクラス

fal.ai Wizper

$0.0005

最安値。バッチ特化

Deepgram Nova-3

$0.0043

$0.0077

低レイテンシ・日英混在対応

Gladia Solaria-1

$0.0041〜

$0.0042〜

ミーティング文字起こし特化

OpenAI gpt-4o-transcribe

$0.006

$0.006

両対応

Google STT v2(Dynamic Batch)

$0.003

$0.016

大量バッチに有利

Azure Speech

$0.006

$0.0167

5時間/月無料枠。日本リージョンあり

Amazon Transcribe

$0.024

$0.024

割高・15秒最低課金

精度最高のElevenLabsが最安クラスではないものの、$0.0037/分は十分に安価です。OpenAI比で約40%安、Amazon比で約85%安になります。

レイテンシ(ストリーミング)

サービス

レイテンシ

Gladia Solaria-1

103ms(partials)

ElevenLabs Scribe v2 Realtime

150ms

OpenAI Realtime API

約232ms(不安定報告あり)

Deepgram Nova-3

<300ms

AssemblyAI

約300ms

Google STT v2

約350ms

Azure Speech

約450ms

Amazon Transcribe

600〜800ms

リアルタイム会話やコールセンター用途では、この差が体感に直結します。

用途別の推薦

ユースケース

推薦

理由

新規・日本語精度重視(個人情報なし)

ElevenLabs Scribe v2

WER 2.2%・コスト・リアルタイム全方位最良

OpenAI互換のまま移行したい

Groq Whisper v3 Turbo

$0.00067/分・エンドポイントURLを変えるだけ

バッチ処理・コスト最安

fal.ai Wizper

$0.0005/分・250x realtime速度

リアルタイム会話・コールセンター

ElevenLabs Scribe v2 Realtime

150ms・話者分離32名

ミーティング・会議文字起こし

Gladia Solaria-1

partials 103ms・話者分離込み

日本国内データ処理必須

Azure Speech(Japan East)

APPI対応・国内処理が最も明確

ElevenLabs Scribe v2 のトレードオフ

精度で選ぶ場合でも、割り切る点があります。

観点

評価

日本語精度

◎ WER 2.2%。「Excellent(WER≤5%)」を公式保証

話者分離

◎ 最大32名まで対応。追加料金なし

多言語

◎ 99言語対応

OpenAI互換

✕ 独自APIスキーマ。既存コードは移行作業が必要

データ処理地

✕ 日本リージョンなし。音声データは米国処理

個人情報・医療データ

✕ 通常プランはNG

既存コードがOpenAI SDK前提なら、Groq Whisperへの移行が現実的です。エンドポイントURLの変更だけで済み、コストは$0.00067/分になります。

ローカルモデルが必要になる3つのケース

1. 音声データに個人情報・要配慮個人情報が含まれる
   (医療カルテ、金融相談、弁護士相談 など)

2. 法的にデータを国外に出せない
   (厚労省ガイドライン第6.0版・APPI対応が必要)

3. 月100時間以上の大量処理でTCO最小化したい
   (月100時間超でローカルGPUがクラウドAPIより安くなる)

法的根拠として、厚生労働省「医療情報システムの安全管理ガイドライン第6.0版」(2023年5月)では音声データが要配慮個人情報に該当し、クラウド利用時は「データ処理場所の明示」と「責任分界の書面化」が必須とされています。

またAPPI改正(2027年施行見込み)では、音声データが「生体データ」として特別カテゴリに分類される可能性があります。これは特定のサービスの問題ではなく、米国クラウドAPI全般に同様に適用されます。

「API経由なら学習に使われない」は半分正しい

観点

実態

学習への利用

✅ API経由はデフォルトで学習に使われない(主要サービス共通)

ログの保持

⚠️ OpenAIはデフォルト最大30日間保持される

ゼロ保持(ZDR)

Enterprise/Businessプランで申請可

学習利用の有無とログ保持は別の話です。「学習に使われないから安全」という理解では不十分で、保持期間の確認が必要になります。

サービス別のポリシーには差があります。

サービス

デフォルト学習利用

医療データ対応

OpenAI API

なし

条件付き可(ZDRで保持0日)

ElevenLabs

なし

BAA要問い合わせ

Azure Speech

なし

◎ Japan East + BAA整備済み

Google Cloud STT

なし

△ 要個別確認

AWS Transcribe

あり(要オプトアウト)

△ 日本語医療は限定的

AWSのみ「デフォルトで学習に使われる」設定です。オプトアウトはAWS Organizationsポリシーで可能ですが、設定しないままだと意図しない利用になります。

個人情報の扱いの判断基準

ケース

判断

個人情報なし(講義録音・会議メモ等)

✅ 通常のAPI利用でOK

氏名・連絡先程度が含まれる

⚠️ APPI越境移転同意の確認が必要

医療カルテ・診察音声

❌ 通常プランはNG。ZDR + BAA + APPI対応が必要

医療データをクラウドAPIで扱う場合の3条件は次のとおりです。

  1. ZDR(ゼロデータリテンション)を有効化 — Enterprise/Businessプランで個別申請
  2. BAA(Business Associate Agreement)を締結
  3. 日本APPIの越境移転要件を満たす — 本人同意の取得、または十分な安全管理措置の整備

ローカルで動かす:GPUなしでも実用になる

「ローカル=高性能GPUが必要」と思われがちですが、環境によって選択肢があります。

GPU環境

モデル

日本語精度(CER)

速度

最小GPU

Whisper large-v3

8.5%

標準

RTX 3060(12GB)

Whisper large-v3-Turbo

8.8%

5.4倍速

RTX 3060(6GB)

faster-whisper(INT8量子化)

同等

4倍速

RTX 3060

kotoba-whisper v2.2

9.2%

6.3倍速

RTX 3060(8GB)

実運用の推奨は faster-whisper large-v3 INT8 です。VRAMを削減しつつ速度が出ます。

Apple Silicon(GPUなし)

チップ

10分音声の処理時間

RTF

M1(MacBook Air)

約3分

0.30x

M2(MacBook Air)

約2.5分

0.25x

M3 Pro

約1.5分

0.15x

M4 Pro

約50秒

0.08x

RTF < 1.0はリアルタイムより速いことを意味します。M1でも十分実用的です。推奨ツールは mlx-whisper(faster-whisperはNVIDIA GPU前提のためApple Siliconでは非効率)。

x86 CPU

small がCPU専用の実用ライン(RTF 約0.1〜0.2)です。large-v3(量子化なし)はRTF 2.5以上でCPU単独では非現実的。ツールは whisper.cpp が適します。

ローカル運用のコスト分岐点

選択肢(月500時間処理)

月額

初期費用

ElevenLabs Scribe v2

約$1,110/月

なし

OpenAI gpt-4o-transcribe

約$1,800/月

なし

ローカル(GPU購入)

電気代+保守のみ

約$2,000

GPUクラウドインスタンス借用

約$200〜250/月

なし

月500時間規模では、GPUクラウドの借用がコスト面で最も有利になります。ただしデータは外部に出るため、個人情報を扱う場合は選択肢になりません。

ローカルモデルをAPIとして公開する

既存コードを活かす方法があります。OpenAI互換APIを提供するOSSサーバーを使う構成です。

from openai import OpenAI

client = OpenAI(api_key="dummy", base_url="http://localhost:8000")

with open("audio.mp3", "rb") as f:
    result = client.audio.transcriptions.create(
        model="Systran/faster-whisper-large-v3",
        file=f
    )
print(result.text)

docker-compose up 1コマンドで起動し、OpenAIの /v1/audio/transcriptions と完全互換のため、既存のOpenAI SDKコードをエンドポイントURLの変更だけで流用できます。

「クラウドAPIからローカルへの移行」が、コードの書き換えなしで済むかどうかは移行コストを大きく左右します。

よくある質問

日本語で一番精度が高いのはどれですか?

ElevenLabs Scribe v2(WER 2.2%)です。「Excellent(WER≤5%)」を公式に保証しており、次点との差も大きくなっています。

既存のOpenAI SDKコードを活かしたい場合は?

Groq Whisper v3 Turbo($0.00067/分)が現実的です。OpenAI完全互換のため、エンドポイントURLを変えるだけで移行できます。

医療データや個人情報を含む音声は?

通常のクラウドAPIプランでは扱えません。クラウドで対応するならZDR + BAA + APPI越境移転要件の3条件が必要で、Azure Speech(Japan East)が最も整備されています。リスク回避ならローカルOSSまたは国産オンプレです。

GPUがなくてもローカルで動きますか?

動きます。Apple SiliconならM1でもRTF 0.30x(10分音声を約3分)で実用的です。x86 CPUでは small モデルが実用ラインになります。

まとめ

  • 選定はまず「個人情報を含むか」で分岐する。含むなら法的要件を満たす選択肢に絞ってから性能を見る
  • 日本語精度はElevenLabs Scribe v2(WER 2.2%)が突出。次点とは大きな差がある
  • 既存のOpenAI SDKコードを活かすならGroq Whisper v3 Turbo($0.00067/分・完全互換)
  • 「学習に使われない」とログ保持は別の話。OpenAIはデフォルト30日保持、AWSはデフォルトで学習利用
  • 医療データをクラウドで扱うにはZDR + BAA + APPI越境移転要件の3条件
  • GPUがなくてもローカルは実用的。Apple SiliconならM1でRTF 0.30x
  • OpenAI互換のOSSサーバーを使えば、ローカルへの移行がエンドポイント変更だけで済む

APIの選定は、性能表を見比べるだけでは決まりません。扱うデータの性質を先に確認しておくと、そもそも比較すべき対象が変わります。

株式会社AI棒では、こうしたAI活用の検証を日々行い、企業の音声AI導入を支援しています。ご相談はお問い合わせフォームから、継続的な伴走支援についてはAI参謀をご覧ください。

関連する検証事例

© 株式会社AI棒 All Rights Reserved.