マニュアル
製品サイト マイページ

Podcast配信

記事や書いた文章を音声番組にして、Spotify・Apple Podcastsへ配信する

記事がそのまま番組になります

書いた記事から、台本・音声・配信用のRSSフィードまで作れます。録音も編集も不要です。記事を持たない回も、その場で文章を書いて作れます。

記事一覧からワンクリックで

手で書いた記事も、AIが書いた記事も、「投稿」の一覧から1回で音声にできます。行にカーソルを合わせると「編集 / ゴミ箱 / 表示」と並ぶところに 「Podcastにする」 が出るので、押すだけです。固定ページでも同じように出ます。

Podcast配信の画面を開いて記事を探す必要はありません。押すとその場で生成が始まり、できあがった回は「Sorabun > Podcast配信」に並びます。

TTSのAPIキーを設定していないときと、「設定 > 使う機能」でPodcastを外しているときは出ません。

手順

  1. 「設定 > Podcast生成(TTS)」で音声合成のAPIキーを設定します(Fish Audio または OpenAI)
  2. 「Sorabun > Podcast配信」の「エピソードを作る」で、記事を選ぶか、文章を書いて作ります
  3. 「同じ画面」で番組情報(タイトル・説明・カバー画像・カテゴリ)を入力します
  4. 生成されたRSSフィードのURLを、Spotify・Apple Podcastsなどに登録します
Podcast配信の「エピソードを作る」。記事から作るか、その場で書いた文章から作るかを選べます
Podcast配信の「エピソードを作る」。記事から作るか、その場で書いた文章から作るかを選べます

文章から作る

記事にするほどではない回を出したいことがあります。お知らせ、いただいた質問への回答、季節の挨拶。そういう回は「Sorabun > Podcast配信 > エピソードを作る」で 「文章から」 を選び、タイトルと文章を書いてください。

  • 話したいことをそのまま書けば大丈夫です。箇条書きのメモでもかまいません。AIが話し言葉の台本に組み直します(自分で台本を書いた場合は、次の項をご覧ください)
  • 100〜10,000文字。書いた分量に合わせて番組の長さが決まります
  • この回だけのカバーアートを付けられます(未設定なら番組のカバーが使われます)
  • 話し方(一人語り / 対談)も、この回だけ切り替えられます

自分で書いた台本を、そのまま読ませる

台本を自分で書く人にとっては、AIが組み直すことがそのまま邪魔になります。収録の代わりに使いたいのに、書いたとおりに読んでくれないからです。

「台本の作り方」で 「書いたものを、そのまま台本として読み上げる」 を選ぶと、AIを通さず、書いた文をそのまま読み上げます。言い回しは一字一句変わりません。

書き方には決まりが3つだけあります。

  • 話者を分けるときは、行頭に A: B: と書きます。「設定 > Podcast生成(TTS)」で話者名を決めていれば、その名前(さくら: など)でもかまいません
  • 指定しなかった行は、直前の話者が続けて話します。一人語りのときは、B: と書いても全部ひとりで読みます
  • 【ジングル】 のようなト書きだけの行は読み飛ばします。そのまま読み上げると「ジングル」と喋ってしまい、聴いている人には事故にしか聞こえないためです

長い段落は、句点で区切って読み上げます。句点の無い長文はそのまま1つの発話として渡すので、読みやすいところで句点を打ってください。

できあがった回は、記事から作った回と同じようにエピソード一覧に並び、同じRSSフィードで配信されます。BGMを重ねる仕上げも同じように使えます。

短い文章に長い尺を指示しません

記事から作るときは8〜12分で固定しています。記事はどれも似た分量があるからです。

文章から作る場合は300字のこともあり、そこへ「8〜12分で」と指示すると、AIが尺を埋めるために書かれていないことを話し始めます。聴いている人には、それが作り話かどうか分かりません。そのため長さのほうを文章に合わせ、あわせて「元の文章に無いことは足さない。尺が足りなければ短いまま終える」と台本づくりに伝えています。

文章から作った回は記事一覧に出ません

サイトにも管理画面の投稿一覧にも出ない、専用の入れ物に入ります。記事ではないので、一覧やサイト内検索に現れると読者が「開けない記事」に行き当たるためです。

そのぶん、消すのも「Sorabun > Podcast配信」からになります。各行の「削除」で、音声ごと消えます。元の文章はその場で「元の文章を見る」から確認できます。

既存の記事から作る

「エピソードを作る」で 「記事から」 を選ぶと、サイトにある記事・固定ページから選んで音声にできます(新しい順に200件)。Sorabunで作った記事だけでなく、前から公開している記事も対象です。アイキャッチがあれば、その回のカバーアートとして使われます。

詳しい設定

「設定 > Podcast生成(TTS)」で番組の作り方を細かく決められます。

項目設定キー
音声合成サービスpodcast_provider
話し方(一人語り / 対話)podcast_mode
番組名podcast_show_name
オープニング・エンディングの定型文podcast_opening / podcast_ending
読み上げの速さpodcast_speed
話者の名前podcast_speaker_a / podcast_speaker_b
Fish Audioの声fish_voice_a / fish_voice_b
OpenAI TTSの声openai_voice_a / openai_voice_b
読み辞書(読み間違いを直す)podcast_yomi
台本への追加指示podcast_custom_prompt
冒頭の間podcast_lead_silence
話の間podcast_gap
BGM(ジングル)を付けるpodcast_bgm
BGMの重ね方(前奏・余韻・重なり・ダッキング量)podcast_mix_lead / podcast_mix_tail / podcast_mix_overlap / podcast_mix_duck
OpenAI TTS の声は marin / cedar がおすすめ

marincedar が最も自然です。alloyecho は旧世代の声で、平板に聞こえます。

「台本への追加指示」に書いた内容は、台本づくりだけでなく読み上げAIの話し方にもそのまま渡ります。「落ち着いた低めの声で」「早口にならないように」といった指示がそのまま効くので、棒読みに感じるときはここに一言足してください。

音声合成サービスを選ぶ

読み上げには Fish AudioOpenAI TTS のどちらかを使います。既定はFish Audioです。

Fish Audio(既定)OpenAI TTS
キーfishaudio_api_key(新しく取ります)openai_api_keyを流用
読み上げの世代選べます(fish_model・既定はS2.1 Pro)固定
日本語自然。抑揚がつきます自然。声の種類は少なめ
声の指定ボイスID(fish_voice_a / fish_voice_b声の名前(marin / cedar など)
自分の声登録して使えます(ボイスクローン)使えません

すでにOpenAIのキーをお持ちで、まず動かしてみたいだけなら、OpenAI TTSを選べば新しくキーを取らずに始められます。番組として続けるなら、声を選べるFish Audioをおすすめします。

Fish AudioのキーとボイスID

  1. fish.audio でアカウントを作り、「API Keys」でキーを発行します
  2. 「設定 > Podcast生成(TTS)」の「Fish Audio APIキー」に貼ります
  3. 声を決めるときは、fish.audioのボイスライブラリで使いたい声のページを開き、URLの末尾の英数字(ボイスID)を「声A(メイン)」に貼ります
  4. 対談形式にするなら、別の声のIDを「声B(対談時)」にも貼ります

ボイスIDは空欄のままでも動きます(既定の声になります)。まず空欄で1回作って、声を変えたくなってから設定してください。

自分の声で読ませる

fish.audioに自分の声を録音して登録すると、その声にもボイスIDが振られます。あとは同じように「声A」に貼るだけで、自分の声の番組が毎日出せるようになります。

料金は読み上げた文字数に対する従量課金です。課金は音声を作るときだけなので、できあがった回を何人が聴いても追加の費用はかかりません。金額は各社の料金ページでご確認ください。

読み上げの世代(fish_model

Fish Audioは読み上げの世代を選べます。既定は S2.1 Pro(2026年9月時点の最新)。設定画面の「読み上げの世代」から変えられます。

選択肢どんなとき
S2.1 Pro(推奨)迷ったらこれ。いちばん自然です
S2.1 Pro 無料枠まず試したいとき
S2 Pro前世代。以前の声に戻したいとき
S1旧世代
世代は始めに決めてください

番組の途中で変えると、そこから声の印象が変わります。聴いている人には「急に別人になった」ように聞こえるので、始めに決めておくことをおすすめします。

指定した世代が使えなかったときは、fish.audio側の既定で読み上げます。回そのものは作られます(世代が引退した日に番組が止まるより、指定が効かないほうがましなので、そうしてあります)。

話し方を選ぶ

  • 一人語り — ナレーション形式。情報を淡々と伝える番組向き
  • 対話形式 — 2人の掛け合い。聞きやすく、長い内容に向いています

記事ページにプレーヤーを出す

番組設定で「記事にプレーヤーを追加」を有効にすると、記事の下に音声プレーヤーが表示されます。読むか聴くかを読者が選べるようになります。

配信先への登録は一度だけ

RSSフィードのURLを各配信先に登録すれば、以降のエピソードは自動で反映されます。

回の長さ

長さはもとの記事や文章の量で決まります。450文字で1分と見て、そのぶんの長さを台本づくりに指示しています。分量と離れた長さを指示すると、AIが尺を埋めるために書かれていないことを話し始めるためです。

もとの文章頼む長さ
300文字2〜5分
2250文字3〜7分
4500文字8〜12分
9000文字18〜22分
12000文字(上限)23〜27分

上限は25分です。もとの文章は12000文字までなので、それ以上は頼めません。記事から作る回は、短い記事でも8〜12分を下回りません(番組として揃うように)。

読み上げる行数には600行の上限もあります。これはAIが暴走したときの歯止めで、25分の回でも届きません。

20分を超える回は、BGMを重ねる仕上げが重くなります

「BGMを重ねる」はブラウザの中で音を展開して混ぜています。MP3を音の波に戻すと百倍近くに膨らむため、25分の回では数百MBになり、端末によっては途中で止まったりタブが落ちたりします。

20分を超える回は、押したときに確認が出ます。「まとめて仕上げる」では飛ばします(1本落ちると、あとに並んでいる回も道連れになるため)。配信中の音声は無傷なので、失敗しても回そのものは残ります。

長い回でBGMを付けたいときは、設定の「BGM(ジングル)を付ける」(前後に繋ぐだけ)をお使いください。こちらはサーバー側で繋ぐので、長さの影響を受けません。

v2.54.0 より前は、6分ほどで途中で終わることがありました

上限が120行だったためです。1発話が1〜3文なので、120行では6分ほどにしかならず、超えたぶんは黙って捨てられていました。音は正常に再生され、結びの挨拶が無いまま途中で終わるだけなので、最後まで聴くまで気づけません。長い記事ほど起きやすい壊れ方でした。

v2.54.0 で上限を600行に上げ、万一切り詰めたときは「Sorabun > Podcast配信」のエピソード一覧に、何行を読み上げなかったかを出すようにしました。

間(ま)を作る

読み上げは1行ずつ別々に作って繋いでいます。そのまま繋ぐと、どの行の切れ目もほぼ0秒になり、話しているというより読み上げ機に聞こえます。「設定 > Podcast生成(TTS)」で、2種類の間を入れられます。

冒頭の間

podcast_lead_silence。再生を押してから最初の声が出るまでの間です。既定は0秒(入れない)。

配信先の再生機によっては、頭のひと言が切れて聞こえることがあります。冒頭のあいさつが毎回途中から始まるようなら、1〜2秒入れてみてください。

読み間違いを直す(読み辞書)

読み上げAIは、漢字をどう読むかを文脈から推測します。日本語はここが弱く、こうなります。

書いたもの読まれかた
会社に入る「かいしゃにいる」(正しくは「はいる」)
一日「いちにち」か「ついたち」か決まらない
行った「おこなった」か「いった」か決まらない
人名・社名・商品名まず当たりません
ひらがなにすると、別の壊れ方をします

「会社にはいる」と書くと、今度は文節を切り直されて「会社には、いる」と読まれます。ひらがなでの修正は効きません。

カタカナで書けば直ります。 カタカナは音の並びとして読まれるので、文節の切り直しが起きません。

「Sorabun > 設定 > Podcast生成(TTS)> 読み辞書」(podcast_yomi)に、1行に1つずつ書きます。

`` 会社に入る,カイシャニハイル 入社,ニュウシャ 空文,ソラブン SEO,エスイーオー ``

  • 区切りはカンマのほか、タブ・=> でもかまいません
  • 行の頭に # を付けた行は覚書きとして読み飛ばします
  • 置き換わるのは読み上げに渡す文字だけです。 記事の本文も、画面に出る台本も、元のまま残ります
  • 「入」と「入社」のように重なる語を両方入れても、長いほうが優先されます

読み間違えそうな語をAIに探してもらう

読み辞書の下にある「読み間違えそうな語をAIに探してもらう」を押すと、直近の記事を読んで、読みが割れそうな語の候補を出します。

  • 同じ表記で読みが分かれる語(入る・一日・行った・開く など)
  • 人名・社名・商品名
  • 業界用語や英字の並び(SEO・CTA・API など)

出てきた候補はチェックを外せます。入れたいものだけ選んで「辞書に足す」を押し、ページ下部の「設定を保存」で確定します。

見つけるのはAI、決めるのは人

候補を出すところまでがAIの仕事です。黙って本文を書き換えることはしません。 勝手に直されると、良くなったのか壊れたのかが分からなくなり、おかしくなったときに原因を追えないためです。

台本を作る時点でも避けています

そもそも読みが割れる言い回しを使わないよう、台本を書くAIに指示しています。「会社に入る」なら「会社に入社する」「会社に加わる」のように、読みが1つに決まる言い方へ言い換えます。

辞書が要るのは、言い換えでは避けられないもの(人名・社名・商品名など)が中心になります。

1行だけ読み直す

イントネーションがおかしい行が1つあるとき、その行だけを読み直せます。回ごと作り直す必要はありません。

「Sorabun > Podcast配信」のエピソード一覧で、音声の下にある「+ 行ごとに読み直す」を押すと、その回の台本が行ごとに並びます。おかしかった行の「この行を読み直す」を押してください。

  • その行の音だけが入れ替わります。 ほかの行はそのままです
  • 配信URLは変わりません。 フィードに載っているのはこのURLなので、配信先の回はそのまま新しい音になります
  • 行の文を直してから読み直すこともできます。読み辞書はここでも効くので、「会社に入る」を「会社にハイル」と書き直してから読み直す、という使い方ができます
  • 行の長さが変われば、回の長さもそのぶん伸び縮みします
声の下にBGMを重ねてある回

「BGMを重ねる」で仕上げた回を読み直すと、その重ね合わせは外れます(前後にジングルを繋いだだけの状態に戻ります)。読み直したあと、もう一度「仕上げ直す」を押してください。声の下に重ねる処理はブラウザの中で行うため、サーバー側では再現できません。

v2.77.0より前に作った回は対象外です

1行だけ読み直すには「その行が音のどこにあるか」の控えが要ります。以前はこの控えを残していなかったため、それより前に作った回には「行ごとに読み直す」が出ません。 回ごと作り直すと使えるようになります。

音声をメディアライブラリで差し替えた回も、控えと合わなくなるため対象外になります(合わないまま切ると、別の行の途中を消してしまうためです)。

話の間

podcast_gap。文と文のあいだに置く間です。既定は0.2秒。0にすると、今までどおりそのまま繋ぎます。

ここで決めた長さは基準で、行の終わり方を見て自動的に伸び縮みします

行の終わり方0.2秒のとき
「。」で終わる基準どおり0.2秒
「?」「!」で終わる長め(問いかけたあとは受ける間が要る)0.26秒
「、」「…」で終わる短め(文がまだ続いている)0.1秒
句読点なしやや短め(呼びかけや見出しのことが多い)0.14秒
空行で区切られていた1つぶん足す(話題が変わる)0.4秒
数字より短く感じないのは、読み上げの音そのものにも間があるから

読み上げAIが返す音は、末尾にわずかな無音を含んでいます。ここで足した長さは、その上に乗ります。0.2秒でも、聴くと0.4秒くらいに感じます。 数字を決めるときは、耳で聞いた印象を基準にしてください。

v2.64.0で、既定を0.4秒から0.2秒に縮めました。0.4秒のままお使いだった場合は、更新のときに自動で0.2秒になります(ご自分で別の数字を入れていた場合は、そのままです)。

最後の行のうしろには入れません。そこには終わりのBGMか、ファイルの終わりが続きます。

空行が効くのは、自分で書いた台本のときだけ

「台本をそのまま読ませる」で作った回は、空行で区切ったところが長い間になります。段落を分けたいところで1行空けてください。AIに台本を書かせた回は、行そのものが一区切りなので、基準の間だけが入ります。

読み上げの速さ

podcast_speed。番組全体の速さです。既定は1.0(ふつう)。0.9でゆっくりめ、1.1で少し速め。0.6〜1.5まで指定できます。

聴く人は再生機の側でも速さを変えられます。ここは「この番組の地の速さ」だと考えて、大きく動かさないほうが自然に聞こえます。

Fish AudioとOpenAI TTSのどちらでも効きます。

台本に話し方を書き込む

「台本をそのまま読ませる」で作った回は、どう読むかも台本に書けます。間と同じ書き方で、書いた行から先の調子が変わります。

`` A: ここまでが前置きです。 【ゆっくり】 A: ここがいちばん大事なところです。 【ふつう】 A: では、次にいきましょう。 ``

書き方どうなるかFish AudioOpenAI TTS
【ゆっくり】少しゆっくりになる
【はやく】少し速くなる
【明るく】明るく弾んだ調子になる×
【やさしく】やわらかく静かな調子になる×
【強調】はっきりと力を込めた調子になる×
【ふつう】元に戻す
  • 言い方はいくつか受けます。【落ち着いて】【ゆっくり】と同じ、【力強く】【強調】と同じです
  • 英語でも書けます(【slow】 【emphasis】 【normal】
  • 書いた行から先にずっと効きます。【ふつう】まで戻りません。段落ごとに書き直す必要はありません
  • 話者が変わっても続きます(A:B:のたびに書き直す必要はありません)
  • 印だけの行は読み上げません
速さ以外は、Fish Audioでは効きません

【明るく】 【やさしく】 【強調】 は、読み上げAIに言葉で頼む形で伝えています。この頼み方ができるのはOpenAI TTSだけなので、Fish Audioでは読み飛ばされます(エラーにはならず、ふつうに読まれます)。

速さ(【ゆっくり】 【はやく】)は、読み上げそのものの設定として渡すので、どちらでも効きます

台本に間を書き込む

秒数まで自分で決めたいときは、台本にそのまま書けます。「台本をそのまま読ませる」で作った回で使えます。

`` A: ここまでが前置きです。 【間3秒】 A: ここから本題です。 ``

書き方は次のとおりです。かっこは 【】 [] () () のどれでも構いません。

書き方
【間】1秒
【間3秒】3秒
【3秒】3秒
【間0.5秒】0.5秒
  • 全角の数字(【間3秒】)でも読みます
  • 英語でも書けます(【pause】 【pause 3s】、大文字小文字は問いません)
  • 続けて書けば足し算になります(【間】【間2秒】 を並べると3秒)
  • 上限は10秒です
  • 「話の間」を0にしていても、書いた間だけは入ります。自分で書いた指示が設定に負けないようにしてあります
数字だけの 【3】 は間になりません

ト書きの通し番号と見分けがつかないため、今までどおり読み飛ばすだけです。黙って長い無音が入るより安全なので、 のどちらかを必ず書いてください。

台本のいちばん上に書いた間も効きません(前の行が無いため)。冒頭の間は上の「冒頭の間」の設定で入れてください。

長くしすぎると、次の行が来る前に「止まった」と思われます。上限は2秒までで、自動の伸びを含めても3秒を超えません。0.3〜0.5秒が目安です。

BGM(ジングル)

「設定 > Podcast生成(TTS) > BGM(ジングル)を付ける」で、読み上げの前後にBGMを繋げます。既定でONです。

番組の頭と尻に同じジングルが鳴るだけで、ぐっと番組らしくなります。追加の道具は要らないので、共用サーバーでも動き、予約投稿でもそのまま付きます。

BGMは「設定 > Podcast生成(TTS)」でメディアライブラリから選びます。OP・EDそれぞれ指定でき、長さや形式が合わないときはその場で警告が出ます。

自動でできあがるのはここまでです。前後に繋ぐだけなので、声の下にBGMを敷く(ダッキング)ことはしません

BGMを声に重ねる(手動)

繋ぐだけでは物足りないときは、回ごとに「BGMを重ねる」を押すと、BGMを声の下に敷き直せます。「Sorabun > Podcast配信」のエピソード一覧、各行の「再生」の隣にボタンがあります(BGMを設定しているときだけ出ます)。

押すと、こうなります。

  • オープニングBGMが単独で鳴り、声が入るところで自動的に下がります(ダッキング)
  • 声が終わると元の音量に戻り、フェードして終わります
  • エンディングBGMは、声の終わりに少し重ねてから流します
  • BGMは読み上げ音声と同じ形式に揃うので、繋ぐだけのときに出ることがある「境目で一瞬途切れる」が起きません

重ね方は「設定 > Podcast生成(TTS) > BGMの重ね方」で決めます。

項目意味既定
前奏BGMが鳴り始めてから声が入るまで2秒
余韻声が終わったあとBGMを残す長さ10秒
重なり終わりのBGMを声の終わりにかぶせる長さ2秒
声の下でのBGM声が入っている間、BGMを何dB下げるか20dB
この処理はブラウザで行います

サーバーに音声処理の道具(ffmpeg)が入っている前提を置けないため、管理画面を開いているブラウザで音を組み立てます。20分の回で1〜2分ほどかかり、その間はこの画面を開いたままにしてください。

途中で閉じても、配信中の音声は差し替え前のまま無傷です。差し替わるのは、最後まで書き出せてサーバーが受け取ったときだけなので、あとからやり直せます。

自動生成は待たされません

このボタンは、できあがった回を後から塗り直すだけのものです。押さなければ何も起きません。記事の自動生成・予約投稿は今までどおり、前後に繋いだ状態で完成・公開されます。

v2.20.0 より前の「音の仕上げ」は、ここが逆でした。仕上げが自動生成の途中に割り込み、BGM無しのまま「仕上げ待ち」で止まるため、予約投稿がBGM無しで公開されていました。そのため一度取りやめています。

重ねる前の読み上げ音声は取っておくので、重ね方を変えて何度でも仕上げ直せます(音声合成のやり直しは不要で、費用もかかりません)。差し替えても音声のURLは変わらないため、配信済みのRSSはそのまま使えます。

一度重ねると音は少し変わります

重ねるにはMP3をいったん音の波に戻し、もう一度MP3にする必要があります。繋ぐだけのときは無変換なので、ここだけは1世代ぶん劣化します。聴き比べて、ダッキングと引き換えに見合うかで決めてください。

v2.28.0 より前に作った回は、どこまでがBGMか分からないことがあります(BGMを設定し直した場合など)。その回は押しても「重ねられません」と出るので、音声を作り直してからお試しください。

音量について

音量を測って揃える処理は行いません(重ねたときに音が割れないよう、そのぶんだけ下げます)。Spotify は -14 LUFS、Apple Podcasts は -16 LUFS を目安に、再生時に各社が音量を揃え直すためです。配信側で調整されるので、こちらで精密に合わせても結果に反映されにくく、代わりに処理の重さと設定の多さだけが残ります。

音量まで追い込みたい場合は、書き出したMP3を Auphonic などの音声仕上げサービスや、お使いの編集ソフトに通してください。メディアライブラリのファイルを差し替えれば、配信済みのRSSはそのまま使えます。

ffmpeg は使いません

サーバーの ffmpeg で仕上げる経路は復活させていません。共用サーバーにまず入っておらず主経路が動かないこと、ブラウザ版と2つ持つと「どちらの音が出たのか」を確かめる手段が無いことが理由です。