Podcast配信
記事や書いた文章を音声番組にして、Spotify・Apple Podcastsへ配信する
記事がそのまま番組になります
書いた記事から、台本・音声・配信用のRSSフィードまで作れます。録音も編集も不要です。記事を持たない回も、その場で文章を書いて作れます。
記事一覧からワンクリックで
手で書いた記事も、AIが書いた記事も、「投稿」の一覧から1回で音声にできます。行にカーソルを合わせると「編集 / ゴミ箱 / 表示」と並ぶところに 「Podcastにする」 が出るので、押すだけです。固定ページでも同じように出ます。
Podcast配信の画面を開いて記事を探す必要はありません。押すとその場で生成が始まり、できあがった回は「Sorabun > Podcast配信」に並びます。
TTSのAPIキーを設定していないときと、「設定 > 使う機能」でPodcastを外しているときは出ません。
手順
- 「設定 > Podcast生成(TTS)」で音声合成のAPIキーを設定します(Fish Audio または OpenAI)
- 「Sorabun > Podcast配信」の「エピソードを作る」で、記事を選ぶか、文章を書いて作ります
- 「同じ画面」で番組情報(タイトル・説明・カバー画像・カテゴリ)を入力します
- 生成されたRSSフィードのURLを、Spotify・Apple Podcastsなどに登録します

文章から作る
記事にするほどではない回を出したいことがあります。お知らせ、いただいた質問への回答、季節の挨拶。そういう回は「Sorabun > Podcast配信 > エピソードを作る」で 「文章から」 を選び、タイトルと文章を書いてください。
- 話したいことをそのまま書けば大丈夫です。箇条書きのメモでもかまいません。AIが話し言葉の台本に組み直します(自分で台本を書いた場合は、次の項をご覧ください)
- 100〜10,000文字。書いた分量に合わせて番組の長さが決まります
- この回だけのカバーアートを付けられます(未設定なら番組のカバーが使われます)
- 話し方(一人語り / 対談)も、この回だけ切り替えられます
自分で書いた台本を、そのまま読ませる
台本を自分で書く人にとっては、AIが組み直すことがそのまま邪魔になります。収録の代わりに使いたいのに、書いたとおりに読んでくれないからです。
「台本の作り方」で 「書いたものを、そのまま台本として読み上げる」 を選ぶと、AIを通さず、書いた文をそのまま読み上げます。言い回しは一字一句変わりません。
書き方には決まりが3つだけあります。
- 話者を分けるときは、行頭に
A:B:と書きます。「設定 > Podcast生成(TTS)」で話者名を決めていれば、その名前(さくら:など)でもかまいません - 指定しなかった行は、直前の話者が続けて話します。一人語りのときは、
B:と書いても全部ひとりで読みます 【ジングル】のようなト書きだけの行は読み飛ばします。そのまま読み上げると「ジングル」と喋ってしまい、聴いている人には事故にしか聞こえないためです
長い段落は、句点で区切って読み上げます。句点の無い長文はそのまま1つの発話として渡すので、読みやすいところで句点を打ってください。
できあがった回は、記事から作った回と同じようにエピソード一覧に並び、同じRSSフィードで配信されます。BGMを重ねる仕上げも同じように使えます。
記事から作るときは8〜12分で固定しています。記事はどれも似た分量があるからです。
文章から作る場合は300字のこともあり、そこへ「8〜12分で」と指示すると、AIが尺を埋めるために書かれていないことを話し始めます。聴いている人には、それが作り話かどうか分かりません。そのため長さのほうを文章に合わせ、あわせて「元の文章に無いことは足さない。尺が足りなければ短いまま終える」と台本づくりに伝えています。
サイトにも管理画面の投稿一覧にも出ない、専用の入れ物に入ります。記事ではないので、一覧やサイト内検索に現れると読者が「開けない記事」に行き当たるためです。
そのぶん、消すのも「Sorabun > Podcast配信」からになります。各行の「削除」で、音声ごと消えます。元の文章はその場で「元の文章を見る」から確認できます。
既存の記事から作る
「エピソードを作る」で 「記事から」 を選ぶと、サイトにある記事・固定ページから選んで音声にできます(新しい順に200件)。Sorabunで作った記事だけでなく、前から公開している記事も対象です。アイキャッチがあれば、その回のカバーアートとして使われます。
詳しい設定
「設定 > Podcast生成(TTS)」で番組の作り方を細かく決められます。
| 項目 | 設定キー |
|---|---|
| 音声合成サービス | podcast_provider |
| 話し方(一人語り / 対話) | podcast_mode |
| 番組名 | podcast_show_name |
| オープニング・エンディングの定型文 | podcast_opening / podcast_ending |
| 読み上げの速さ | podcast_speed |
| 話者の名前 | podcast_speaker_a / podcast_speaker_b |
| Fish Audioの声 | fish_voice_a / fish_voice_b |
| OpenAI TTSの声 | openai_voice_a / openai_voice_b |
| 読み辞書(読み間違いを直す) | podcast_yomi |
| 台本への追加指示 | podcast_custom_prompt |
| 冒頭の間 | podcast_lead_silence |
| 話の間 | podcast_gap |
| BGM(ジングル)を付ける | podcast_bgm |
| BGMの重ね方(前奏・余韻・重なり・ダッキング量) | podcast_mix_lead / podcast_mix_tail / podcast_mix_overlap / podcast_mix_duck |
marin と cedar が最も自然です。alloy や echo は旧世代の声で、平板に聞こえます。
「台本への追加指示」に書いた内容は、台本づくりだけでなく読み上げAIの話し方にもそのまま渡ります。「落ち着いた低めの声で」「早口にならないように」といった指示がそのまま効くので、棒読みに感じるときはここに一言足してください。
音声合成サービスを選ぶ
読み上げには Fish Audio と OpenAI TTS のどちらかを使います。既定はFish Audioです。
| Fish Audio(既定) | OpenAI TTS | |
|---|---|---|
| キー | fishaudio_api_key(新しく取ります) | openai_api_keyを流用 |
| 読み上げの世代 | 選べます(fish_model・既定はS2.1 Pro) | 固定 |
| 日本語 | 自然。抑揚がつきます | 自然。声の種類は少なめ |
| 声の指定 | ボイスID(fish_voice_a / fish_voice_b) | 声の名前(marin / cedar など) |
| 自分の声 | 登録して使えます(ボイスクローン) | 使えません |
すでにOpenAIのキーをお持ちで、まず動かしてみたいだけなら、OpenAI TTSを選べば新しくキーを取らずに始められます。番組として続けるなら、声を選べるFish Audioをおすすめします。
Fish AudioのキーとボイスID
- fish.audio でアカウントを作り、「API Keys」でキーを発行します
- 「設定 > Podcast生成(TTS)」の「Fish Audio APIキー」に貼ります
- 声を決めるときは、fish.audioのボイスライブラリで使いたい声のページを開き、URLの末尾の英数字(ボイスID)を「声A(メイン)」に貼ります
- 対談形式にするなら、別の声のIDを「声B(対談時)」にも貼ります
ボイスIDは空欄のままでも動きます(既定の声になります)。まず空欄で1回作って、声を変えたくなってから設定してください。
fish.audioに自分の声を録音して登録すると、その声にもボイスIDが振られます。あとは同じように「声A」に貼るだけで、自分の声の番組が毎日出せるようになります。
料金は読み上げた文字数に対する従量課金です。課金は音声を作るときだけなので、できあがった回を何人が聴いても追加の費用はかかりません。金額は各社の料金ページでご確認ください。
読み上げの世代(fish_model)
Fish Audioは読み上げの世代を選べます。既定は S2.1 Pro(2026年9月時点の最新)。設定画面の「読み上げの世代」から変えられます。
| 選択肢 | どんなとき |
|---|---|
| S2.1 Pro(推奨) | 迷ったらこれ。いちばん自然です |
| S2.1 Pro 無料枠 | まず試したいとき |
| S2 Pro | 前世代。以前の声に戻したいとき |
| S1 | 旧世代 |
番組の途中で変えると、そこから声の印象が変わります。聴いている人には「急に別人になった」ように聞こえるので、始めに決めておくことをおすすめします。
指定した世代が使えなかったときは、fish.audio側の既定で読み上げます。回そのものは作られます(世代が引退した日に番組が止まるより、指定が効かないほうがましなので、そうしてあります)。
話し方を選ぶ
- 一人語り — ナレーション形式。情報を淡々と伝える番組向き
- 対話形式 — 2人の掛け合い。聞きやすく、長い内容に向いています
記事ページにプレーヤーを出す
番組設定で「記事にプレーヤーを追加」を有効にすると、記事の下に音声プレーヤーが表示されます。読むか聴くかを読者が選べるようになります。
RSSフィードのURLを各配信先に登録すれば、以降のエピソードは自動で反映されます。
回の長さ
長さはもとの記事や文章の量で決まります。450文字で1分と見て、そのぶんの長さを台本づくりに指示しています。分量と離れた長さを指示すると、AIが尺を埋めるために書かれていないことを話し始めるためです。
| もとの文章 | 頼む長さ |
|---|---|
| 300文字 | 2〜5分 |
| 2250文字 | 3〜7分 |
| 4500文字 | 8〜12分 |
| 9000文字 | 18〜22分 |
| 12000文字(上限) | 23〜27分 |
上限は25分です。もとの文章は12000文字までなので、それ以上は頼めません。記事から作る回は、短い記事でも8〜12分を下回りません(番組として揃うように)。
読み上げる行数には600行の上限もあります。これはAIが暴走したときの歯止めで、25分の回でも届きません。
「BGMを重ねる」はブラウザの中で音を展開して混ぜています。MP3を音の波に戻すと百倍近くに膨らむため、25分の回では数百MBになり、端末によっては途中で止まったりタブが落ちたりします。
20分を超える回は、押したときに確認が出ます。「まとめて仕上げる」では飛ばします(1本落ちると、あとに並んでいる回も道連れになるため)。配信中の音声は無傷なので、失敗しても回そのものは残ります。
長い回でBGMを付けたいときは、設定の「BGM(ジングル)を付ける」(前後に繋ぐだけ)をお使いください。こちらはサーバー側で繋ぐので、長さの影響を受けません。
上限が120行だったためです。1発話が1〜3文なので、120行では6分ほどにしかならず、超えたぶんは黙って捨てられていました。音は正常に再生され、結びの挨拶が無いまま途中で終わるだけなので、最後まで聴くまで気づけません。長い記事ほど起きやすい壊れ方でした。
v2.54.0 で上限を600行に上げ、万一切り詰めたときは「Sorabun > Podcast配信」のエピソード一覧に、何行を読み上げなかったかを出すようにしました。
間(ま)を作る
読み上げは1行ずつ別々に作って繋いでいます。そのまま繋ぐと、どの行の切れ目もほぼ0秒になり、話しているというより読み上げ機に聞こえます。「設定 > Podcast生成(TTS)」で、2種類の間を入れられます。
冒頭の間
podcast_lead_silence。再生を押してから最初の声が出るまでの間です。既定は0秒(入れない)。
配信先の再生機によっては、頭のひと言が切れて聞こえることがあります。冒頭のあいさつが毎回途中から始まるようなら、1〜2秒入れてみてください。
読み間違いを直す(読み辞書)
読み上げAIは、漢字をどう読むかを文脈から推測します。日本語はここが弱く、こうなります。
| 書いたもの | 読まれかた |
|---|---|
| 会社に入る | 「かいしゃにいる」(正しくは「はいる」) |
| 一日 | 「いちにち」か「ついたち」か決まらない |
| 行った | 「おこなった」か「いった」か決まらない |
| 人名・社名・商品名 | まず当たりません |
「会社にはいる」と書くと、今度は文節を切り直されて「会社には、いる」と読まれます。ひらがなでの修正は効きません。
カタカナで書けば直ります。 カタカナは音の並びとして読まれるので、文節の切り直しが起きません。
「Sorabun > 設定 > Podcast生成(TTS)> 読み辞書」(podcast_yomi)に、1行に1つずつ書きます。
`` 会社に入る,カイシャニハイル 入社,ニュウシャ 空文,ソラブン SEO,エスイーオー ``
- 区切りはカンマのほか、タブ・
=>・→でもかまいません - 行の頭に
#を付けた行は覚書きとして読み飛ばします - 置き換わるのは読み上げに渡す文字だけです。 記事の本文も、画面に出る台本も、元のまま残ります
- 「入」と「入社」のように重なる語を両方入れても、長いほうが優先されます
読み間違えそうな語をAIに探してもらう
読み辞書の下にある「読み間違えそうな語をAIに探してもらう」を押すと、直近の記事を読んで、読みが割れそうな語の候補を出します。
- 同じ表記で読みが分かれる語(入る・一日・行った・開く など)
- 人名・社名・商品名
- 業界用語や英字の並び(SEO・CTA・API など)
出てきた候補はチェックを外せます。入れたいものだけ選んで「辞書に足す」を押し、ページ下部の「設定を保存」で確定します。
候補を出すところまでがAIの仕事です。黙って本文を書き換えることはしません。 勝手に直されると、良くなったのか壊れたのかが分からなくなり、おかしくなったときに原因を追えないためです。
台本を作る時点でも避けています
そもそも読みが割れる言い回しを使わないよう、台本を書くAIに指示しています。「会社に入る」なら「会社に入社する」「会社に加わる」のように、読みが1つに決まる言い方へ言い換えます。
辞書が要るのは、言い換えでは避けられないもの(人名・社名・商品名など)が中心になります。
1行だけ読み直す
イントネーションがおかしい行が1つあるとき、その行だけを読み直せます。回ごと作り直す必要はありません。
「Sorabun > Podcast配信」のエピソード一覧で、音声の下にある「+ 行ごとに読み直す」を押すと、その回の台本が行ごとに並びます。おかしかった行の「この行を読み直す」を押してください。
- その行の音だけが入れ替わります。 ほかの行はそのままです
- 配信URLは変わりません。 フィードに載っているのはこのURLなので、配信先の回はそのまま新しい音になります
- 行の文を直してから読み直すこともできます。読み辞書はここでも効くので、「会社に入る」を「会社にハイル」と書き直してから読み直す、という使い方ができます
- 行の長さが変われば、回の長さもそのぶん伸び縮みします
「BGMを重ねる」で仕上げた回を読み直すと、その重ね合わせは外れます(前後にジングルを繋いだだけの状態に戻ります)。読み直したあと、もう一度「仕上げ直す」を押してください。声の下に重ねる処理はブラウザの中で行うため、サーバー側では再現できません。
1行だけ読み直すには「その行が音のどこにあるか」の控えが要ります。以前はこの控えを残していなかったため、それより前に作った回には「行ごとに読み直す」が出ません。 回ごと作り直すと使えるようになります。
音声をメディアライブラリで差し替えた回も、控えと合わなくなるため対象外になります(合わないまま切ると、別の行の途中を消してしまうためです)。
話の間
podcast_gap。文と文のあいだに置く間です。既定は0.2秒。0にすると、今までどおりそのまま繋ぎます。
ここで決めた長さは基準で、行の終わり方を見て自動的に伸び縮みします。
| 行の終わり方 | 間 | 0.2秒のとき |
|---|---|---|
| 「。」で終わる | 基準どおり | 0.2秒 |
| 「?」「!」で終わる | 長め(問いかけたあとは受ける間が要る) | 0.26秒 |
| 「、」「…」で終わる | 短め(文がまだ続いている) | 0.1秒 |
| 句読点なし | やや短め(呼びかけや見出しのことが多い) | 0.14秒 |
| 空行で区切られていた | 1つぶん足す(話題が変わる) | 0.4秒 |
読み上げAIが返す音は、末尾にわずかな無音を含んでいます。ここで足した長さは、その上に乗ります。0.2秒でも、聴くと0.4秒くらいに感じます。 数字を決めるときは、耳で聞いた印象を基準にしてください。
v2.64.0で、既定を0.4秒から0.2秒に縮めました。0.4秒のままお使いだった場合は、更新のときに自動で0.2秒になります(ご自分で別の数字を入れていた場合は、そのままです)。
最後の行のうしろには入れません。そこには終わりのBGMか、ファイルの終わりが続きます。
「台本をそのまま読ませる」で作った回は、空行で区切ったところが長い間になります。段落を分けたいところで1行空けてください。AIに台本を書かせた回は、行そのものが一区切りなので、基準の間だけが入ります。
読み上げの速さ
podcast_speed。番組全体の速さです。既定は1.0(ふつう)。0.9でゆっくりめ、1.1で少し速め。0.6〜1.5まで指定できます。
聴く人は再生機の側でも速さを変えられます。ここは「この番組の地の速さ」だと考えて、大きく動かさないほうが自然に聞こえます。
Fish AudioとOpenAI TTSのどちらでも効きます。
台本に話し方を書き込む
「台本をそのまま読ませる」で作った回は、どう読むかも台本に書けます。間と同じ書き方で、書いた行から先の調子が変わります。
`` A: ここまでが前置きです。 【ゆっくり】 A: ここがいちばん大事なところです。 【ふつう】 A: では、次にいきましょう。 ``
| 書き方 | どうなるか | Fish Audio | OpenAI TTS |
|---|---|---|---|
【ゆっくり】 | 少しゆっくりになる | ○ | ○ |
【はやく】 | 少し速くなる | ○ | ○ |
【明るく】 | 明るく弾んだ調子になる | × | ○ |
【やさしく】 | やわらかく静かな調子になる | × | ○ |
【強調】 | はっきりと力を込めた調子になる | × | ○ |
【ふつう】 | 元に戻す | ○ | ○ |
- 言い方はいくつか受けます。
【落ち着いて】は【ゆっくり】と同じ、【力強く】は【強調】と同じです - 英語でも書けます(
【slow】【emphasis】【normal】) - 書いた行から先にずっと効きます。
【ふつう】まで戻りません。段落ごとに書き直す必要はありません - 話者が変わっても続きます(
A:とB:のたびに書き直す必要はありません) - 印だけの行は読み上げません
【明るく】 【やさしく】 【強調】 は、読み上げAIに言葉で頼む形で伝えています。この頼み方ができるのはOpenAI TTSだけなので、Fish Audioでは読み飛ばされます(エラーにはならず、ふつうに読まれます)。
速さ(【ゆっくり】 【はやく】)は、読み上げそのものの設定として渡すので、どちらでも効きます。
台本に間を書き込む
秒数まで自分で決めたいときは、台本にそのまま書けます。「台本をそのまま読ませる」で作った回で使えます。
`` A: ここまでが前置きです。 【間3秒】 A: ここから本題です。 ``
書き方は次のとおりです。かっこは 【】 [] () () のどれでも構いません。
| 書き方 | 間 |
|---|---|
【間】 | 1秒 |
【間3秒】 | 3秒 |
【3秒】 | 3秒 |
【間0.5秒】 | 0.5秒 |
- 全角の数字(
【間3秒】)でも読みます - 英語でも書けます(
【pause】【pause 3s】、大文字小文字は問いません) - 続けて書けば足し算になります(
【間】と【間2秒】を並べると3秒) - 上限は10秒です
- 「話の間」を0にしていても、書いた間だけは入ります。自分で書いた指示が設定に負けないようにしてあります
【3】 は間になりませんト書きの通し番号と見分けがつかないため、今までどおり読み飛ばすだけです。黙って長い無音が入るより安全なので、間 か 秒 のどちらかを必ず書いてください。
台本のいちばん上に書いた間も効きません(前の行が無いため)。冒頭の間は上の「冒頭の間」の設定で入れてください。
長くしすぎると、次の行が来る前に「止まった」と思われます。上限は2秒までで、自動の伸びを含めても3秒を超えません。0.3〜0.5秒が目安です。
BGM(ジングル)
「設定 > Podcast生成(TTS) > BGM(ジングル)を付ける」で、読み上げの前後にBGMを繋げます。既定でONです。
番組の頭と尻に同じジングルが鳴るだけで、ぐっと番組らしくなります。追加の道具は要らないので、共用サーバーでも動き、予約投稿でもそのまま付きます。
BGMは「設定 > Podcast生成(TTS)」でメディアライブラリから選びます。OP・EDそれぞれ指定でき、長さや形式が合わないときはその場で警告が出ます。
自動でできあがるのはここまでです。前後に繋ぐだけなので、声の下にBGMを敷く(ダッキング)ことはしません。
BGMを声に重ねる(手動)
繋ぐだけでは物足りないときは、回ごとに「BGMを重ねる」を押すと、BGMを声の下に敷き直せます。「Sorabun > Podcast配信」のエピソード一覧、各行の「再生」の隣にボタンがあります(BGMを設定しているときだけ出ます)。
押すと、こうなります。
- オープニングBGMが単独で鳴り、声が入るところで自動的に下がります(ダッキング)
- 声が終わると元の音量に戻り、フェードして終わります
- エンディングBGMは、声の終わりに少し重ねてから流します
- BGMは読み上げ音声と同じ形式に揃うので、繋ぐだけのときに出ることがある「境目で一瞬途切れる」が起きません
重ね方は「設定 > Podcast生成(TTS) > BGMの重ね方」で決めます。
| 項目 | 意味 | 既定 |
|---|---|---|
| 前奏 | BGMが鳴り始めてから声が入るまで | 2秒 |
| 余韻 | 声が終わったあとBGMを残す長さ | 10秒 |
| 重なり | 終わりのBGMを声の終わりにかぶせる長さ | 2秒 |
| 声の下でのBGM | 声が入っている間、BGMを何dB下げるか | 20dB |
サーバーに音声処理の道具(ffmpeg)が入っている前提を置けないため、管理画面を開いているブラウザで音を組み立てます。20分の回で1〜2分ほどかかり、その間はこの画面を開いたままにしてください。
途中で閉じても、配信中の音声は差し替え前のまま無傷です。差し替わるのは、最後まで書き出せてサーバーが受け取ったときだけなので、あとからやり直せます。
このボタンは、できあがった回を後から塗り直すだけのものです。押さなければ何も起きません。記事の自動生成・予約投稿は今までどおり、前後に繋いだ状態で完成・公開されます。
v2.20.0 より前の「音の仕上げ」は、ここが逆でした。仕上げが自動生成の途中に割り込み、BGM無しのまま「仕上げ待ち」で止まるため、予約投稿がBGM無しで公開されていました。そのため一度取りやめています。
重ねる前の読み上げ音声は取っておくので、重ね方を変えて何度でも仕上げ直せます(音声合成のやり直しは不要で、費用もかかりません)。差し替えても音声のURLは変わらないため、配信済みのRSSはそのまま使えます。
重ねるにはMP3をいったん音の波に戻し、もう一度MP3にする必要があります。繋ぐだけのときは無変換なので、ここだけは1世代ぶん劣化します。聴き比べて、ダッキングと引き換えに見合うかで決めてください。
v2.28.0 より前に作った回は、どこまでがBGMか分からないことがあります(BGMを設定し直した場合など)。その回は押しても「重ねられません」と出るので、音声を作り直してからお試しください。
音量について
音量を測って揃える処理は行いません(重ねたときに音が割れないよう、そのぶんだけ下げます)。Spotify は -14 LUFS、Apple Podcasts は -16 LUFS を目安に、再生時に各社が音量を揃え直すためです。配信側で調整されるので、こちらで精密に合わせても結果に反映されにくく、代わりに処理の重さと設定の多さだけが残ります。
音量まで追い込みたい場合は、書き出したMP3を Auphonic などの音声仕上げサービスや、お使いの編集ソフトに通してください。メディアライブラリのファイルを差し替えれば、配信済みのRSSはそのまま使えます。
サーバーの ffmpeg で仕上げる経路は復活させていません。共用サーバーにまず入っておらず主経路が動かないこと、ブラウザ版と2つ持つと「どちらの音が出たのか」を確かめる手段が無いことが理由です。