- ホーム
- 音声AI
音声AI
-
ComfyUI v0.30.0 の 768P はパートナーノード側 — ローカルのネイティブ実行は …
2026年8月3日の v0.30.0 は、MiniMax-H3 のネイティブ対応(手元の GPU で回す)と、パートナーノードの 768P 対応(API の向こ…
-
Claude 音声モードが Opus / Sonnet 対応 — 音声が「入力手段」から「実行手段」…
Haiku 固定をやめ、コネクタを音声から呼べるようになった。日本語を含む11言語に対応。文字起こし(記録が目的)と音声モード(実行が目的)の違いを実務目線で切…
-
Qwen-Audio-3.0-TTS は重みが無い — 音声合成を「撤退できるか」で選ぶという判断
評価で首位、価格は競合の3分の1。ただし提供は API のみで、ダウンロードできる重みがない。コスト・データの外部送信・商用可否に加えて「撤退のしやすさ」を軸に…
-
Inkling は手元では動かない — 1bit 量子化で 270GB という現実と、個人開発者の入…
Thinking Machines Lab の Inkling は Apache 2.0 のオープンウェイトだが、1bit 量子化でも 270GB ある。軽量版…
-
OpenAI「GPT-Live」の全二重音声 — 3段パイプラインのどこが置き換わるか
聞きながら同時に話すGPT-Liveは、音声認識→LLM→音声合成という従来の3段パイプラインの前提を崩す。相づちや割り込みがどの層の変化から生まれるのか、公開…
-
Google Chirp 3: Transcription が GA — 話者分離・多言語ASRと自…
Chirp 3 が一般提供になり話者分離と自動言語検出に対応。faster-whisper のローカル構成とクラウドASRのトレードオフを整理し、同一音源で精度…
-
Whisper文字起こしアプリの作り方 — 録音から Word 出力までローカルで完結させる
録音/音声ファイルをローカルWhisperで文字起こししWord出力するデスクトップアプリの作り方。スレッド処理、ハルシネーション対策、入力デバイス選択の勘所を…
-
Grokで回すXメディア生成パイプラインの作り方 — 検索から画像・音声・動画まで自動化する
xAI GrokでX検索・画像・音声・動画生成を一本のStreamlitアプリに通すパイプラインの作り方。生成入口の集約、ffmpeg合成、外部API新機能を安…