
Diaは、Nari Labs社によって開発されたオープンソースのテキスト音声合成(TTS)モデルで、超リアルなダイアログ音声の生成に特化しています。テキストスクリプトを一度の処理でリアルな複数文字のダイアログに変換し、感情やイントネーションの制御をサポートし、笑いなどの非言語的な表現まで生成します。Diaの中核をなすのは、16億個のパラメータモデルです。.

Orpheus-TTSは、Llama-3bアーキテクチャで開発されたオープンソースの音声合成(TTS)システムで、人間の自然な音声に近い音声を生成することを目標としている。Canopy AIチームによって開発され、英語、スペイン語、フランス語、ドイツ語、イタリア語、ポルトガル語、中国語などの多言語に対応している。このシステムは...

ElevenLabs MCPは、GitHubでホストされているElevenLabsの公式オープンソースプロジェクトです。Model Control Protocol (Model Context Protocol, MCP)に基づいたサーバーツールで、AIモデルとElevenLabを接続するために設計されています。

Vapiは開発者のための音声AIプラットフォームです。Vapiは、リアルタイム会話、テレフォニー統合、マルチプラットフォーム展開をサポートする完全なツールとインフラを提供します。開発者はこれを使用して、自然でスムーズな音声...

MiniMax Audioは、MiniMax社のAI音声生成ツールで、テキストを類似性の高い自然な音声に素早く変換することを主な特徴としています。Speech-02モデルをベースにしており、最大99%の音声合成類似度、スタジオ級の音質、30以上の言語と幅広い口語をサポートしています。

Text2Voiceは、シリコンベースのモビリティAPIをベースにテキスト読み上げ機能を提供するオープンソースツールで、すっきりとしたグラフィカル・ユーザー・インターフェース(GUI)が最大の特徴だ。開発者のSheldon Lee氏によってGitHub上で作成され、ユーザーが簡単にテキストを音声に変換できるインターフェースとなっている。このプロジェクトではPy...

Open-VoiceCanvasは、ItusiAIチームによって開発されたオープンソースの音声合成プラットフォームです。50以上の言語をサポートし、テキストを自然な音声に変換することができ、音声をアップロードすることでパーソナライズされた音声をクローンすることができます。このプロジェクトはOpenAI TTS、AWS Polly、MiniM...を統合している。

Paper to Podcastは、学術研究論文を生き生きとした楽しいポッドキャストに変えることに特化したオープンソースのツールです。人工知能技術を使ってPDF形式の論文を3人の登場人物(ホスト、学習者、専門家)の対話に変えることで、複雑な学術コンテンツを簡単に理解できるようにする。このプロジェクトは、開発者のAzzed...

MegaTTS3は、ByteDanceが浙江大学と共同で開発したオープンソースの音声合成ツールで、高品質の中国語と英語の音声を生成することに重点を置いています。MegaTTS3のコアモデルは、わずか0.45Bのパラメータで、軽量かつ効率的で、中国語と英語の混在音声の生成と音声クローニングをサポートしています。このプロジェクトはGitHubでホストされており、コードと学習済みモデルを無料でダウンロードできます。.

PodcastleはAIベースのオンライン・プラットフォームで、高品質なポッドキャストの迅速な作成と編集を支援することに特化している。録音、編集、公開機能が統合されており、ユーザーは特別な機器や複雑なソフトウェアを必要とせず、すべてブラウザから行うことができる。このプラットフォームはAI技術を活用し、ノイズキャンセリング、オーディオエンハンスメント、自動書き起こしを提供する。.

IndexTTSはGitHubでホストされているオープンソースの音声合成(TTS)ツールで、index-tsチームによって開発されています。XTTSとTortoiseの技術をベースにしており、改良されたモジュール設計によって効率的で高品質な音声合成を実現しています。IndexTTSは数万時間に及ぶ...

csm-mlxは、Appleが開発したMLXフレームワークをベースに、CSM(Conversation Speech Model)音声対話モデルをApple Silicon専用に最適化したものです。このプロジェクトにより、ユーザーはAppleデバイス上で効率的な音声生成を簡単な方法で実行することができます。

Autiobooksは、.epub形式のeBookを.m4b形式のオーディオブックに素早く変換するためのオープンソースツールです。Kokoroが提供する高品質の音声合成技術を使用し、自然で滑らかな音声を生成します。このツールはDavid Nesbittによって開発され、MIT ...

PlayHTは、AI音声生成に特化した効率的なオンラインプラットフォームで、テキストを自然でリアルな音声に素早く変換することができます。600以上のAI音声を提供し、60以上の言語と多様なアクセントをサポートし、ポッドキャスト制作、教育コンテンツ、マーケティング、プロモーションなど様々なシナリオに適しています。ユーザーはテキストを入力し、適切な音声スタイルを選択するだけです。.

MLX-Audioは、AppleのMLXフレームワーク上で開発されたオープンソースツールで、音声合成(TTS)と音声合成(STS)機能に重点を置いています。MシリーズチップのようなApple Siliconの強力なコンピューティング能力を最大限に活用し、効率的で高速な音声合成ソリューションを提供します。どのような ...

Spark-TTSは、SparkAudioチームによって開発され、GitHubでホストされているオープンソースの音声合成(TTS)ツールです。高度なディープラーニング技術に基づいており、複数の言語と音声スタイルをサポートしています...

“Cat&Star”(maoyuxing.com)は、子供向けにデザインされたインタラクティブな物語作成プラットフォームで、モバイルアプリケーションを通じて、親子でパーソナライズされたおとぎ話を共同作成することができる。ユーザーは子供の名前、好み、その他の情報を入力することで、ユニークな物語コンテンツを作成することができ、子供が物語の主人公となり、読書への興味と想像力を高めることができる。このプラットフォームは...

TTS Importerは、Azure TTS(Text-to-Speech)音声合成サービスを様々な読み上げソフトに簡単にインポートするために設計されたオープンソースプロジェクトです。このツールは、Read (legado)、Love Reader、Source Readerなど、人気のある読み上げソフトをサポートしています。TTS Importe...

NVIDIA AI Blueprint: PDF to Podcastは、NVIDIAによって開発された、PDFドキュメントを魅力的なオーディオコンテンツに変換するオープンソースプロジェクトです。このプロジェクトは、NVIDIA NIM(NVIDIA Inference Microservice...
トップに戻る

