タイトルどおりなんですが結果から言うと失敗でした(´・ω・`)
なんというか、メディアだとよかったのに、生放送で聴いたら微妙だった、みたいなw
そもそものきっかけは、曲作りを依頼されたことに始まるのですが、わたし自身音楽についての知見はありませんのでもらった歌詞をAIに放り込んでできた曲を依頼元に渡しただけなんですが、むっちゃ微妙な曲だったにも関わらず、何回か聞いてると意外にふと口ずさむくらいの感じになってましたw
で、
これはなんか使えるんじゃね?
ということで早速GPTに依頼。

むちゃぶりにも関わらず作ってくれましたよw

早速、もらったプロンプトと歌詞を使って、ACE-STEPで生成してみました(゚∀゚)
できたやつ
とりあえずそれっぽいのができたのですが、当然これはなっちの声ではありませんので、DEEP EXTRACTでボーカルと曲に分離。ボーカルの方をAI変換でなっちの声にするという寸法です。
今はDEEP EXTRACTはバージョン2があるようなんですけど、ConfyUI Managerでは1しかなかったので1でやってます。
ボ-カル変換で採用したのはTTS-Audio-SuiteのChatterbox。実はかなり前に使ったことがあるんですが、当時は日本語はダメダメでした(´・ω・`)

ワークフローは赤枠のやつを使用。あ、言い忘れましたがこちらもConfyUI用です。

上側は学習データがいるっぽいので下側(赤枠のところ)だけ使います。
画像ではBGMって書いちゃってますが、分離したボーカルデータをそこに入れてます。サンプル音声のところになっちの声ですね。
で、結果(´・ω・`)グエー
思わずリラックス!リラックス!って言いたくなる音声ですw
もしかしたらエコーとか掛けたら使えるようになるのかもしれませんが、そもそもコレ聴いてなっちだ!(゚∀゚)とはなりませんね。
ちなみに、Chatterboxの設定にJapaneseがあるんですが、選択しても未対応でエラーがでるので、変換はenglishでやってます。
もう少しパラメーター弄ってみようと思いますがまぁ厳しいだろうなぁ(´・ω・`)
なんというか、メディアだとよかったのに、生放送で聴いたら微妙だった、みたいなw
そもそものきっかけは、曲作りを依頼されたことに始まるのですが、わたし自身音楽についての知見はありませんのでもらった歌詞をAIに放り込んでできた曲を依頼元に渡しただけなんですが、むっちゃ微妙な曲だったにも関わらず、何回か聞いてると意外にふと口ずさむくらいの感じになってましたw
で、
これはなんか使えるんじゃね?
ということで早速GPTに依頼。

むちゃぶりにも関わらず作ってくれましたよw

早速、もらったプロンプトと歌詞を使って、ACE-STEPで生成してみました(゚∀゚)
できたやつ
とりあえずそれっぽいのができたのですが、当然これはなっちの声ではありませんので、DEEP EXTRACTでボーカルと曲に分離。ボーカルの方をAI変換でなっちの声にするという寸法です。
今はDEEP EXTRACTはバージョン2があるようなんですけど、ConfyUI Managerでは1しかなかったので1でやってます。
ボ-カル変換で採用したのはTTS-Audio-SuiteのChatterbox。実はかなり前に使ったことがあるんですが、当時は日本語はダメダメでした(´・ω・`)

ワークフローは赤枠のやつを使用。あ、言い忘れましたがこちらもConfyUI用です。

上側は学習データがいるっぽいので下側(赤枠のところ)だけ使います。
画像ではBGMって書いちゃってますが、分離したボーカルデータをそこに入れてます。サンプル音声のところになっちの声ですね。
で、結果(´・ω・`)グエー
思わずリラックス!リラックス!って言いたくなる音声ですw
もしかしたらエコーとか掛けたら使えるようになるのかもしれませんが、そもそもコレ聴いてなっちだ!(゚∀゚)とはなりませんね。
ちなみに、Chatterboxの設定にJapaneseがあるんですが、選択しても未対応でエラーがでるので、変換はenglishでやってます。
もう少しパラメーター弄ってみようと思いますがまぁ厳しいだろうなぁ(´・ω・`)


















