自分の声や好きな音を入れると、聞いてもほとんど分からないのに、周波数の図(スペクトログラム)にすると謎ノ美兎の顔が浮かびます。まずは下で試してみてください。
- 録音する:その場で最長15秒録音できます。音声は端末の中だけで処理され、送信されません
- 音声・動画ファイル:mp3・m4a・wav・mp4・movなど、手持ちの音声や動画の音を使えます(先頭20秒まで)
- こっそり:元の音はそのままで、謎ノ美兎の線画の形をした小さな音を足します
- 足す音の大きさ:小さいほど気づかれにくく、顔は薄くなります
- 音に合わせる:曲のように音が詰まっていて顔が埋もれるときに。まわりの音の大きさに合わせて線を足します
- 足し引き:音がまばらな所は線を足して明るく、詰まった所は線の部分の音を小さくして暗い線にします。どんな音でも形が出やすい方法です
- 並べる:顔を横・縦・ななめに何枚も重ねて並べられます(型押しでは、手前の顔が奥の顔を隠します)
- 使う区間:長い曲や動画は、顔を入れる20秒を好きなところから選べます
- 顔の大きさ・位置:大きさと場所を変えられます。「おまかせ配置」で、音の静かな場所に置くこともできます(型押し・並べ替えでも使えます)
- 顔の細かさ:「こっそり」の顔を粗くできます。粗いほど足す音の出入りがなめらかになり、聞いたときに目立ちにくくなります(初期設定は「ふつう」)
- 声のない声タブ:人の声を一切使わず、ピアノやサイン波だけで喋らせます
ミコンスキーまずは「録音する」で、何か一言しゃべってみてください。「顔入りの音」を聞いても、たぶん違いは分からないはずです。
スペクトログラムって何?
音を「時間」と「高さ(周波数)」の図にしたものです。明るいところほど、その高さの音が強く鳴っています。





波形だと「あ」と「い」の違いはほとんど分かりませんが、スペクトログラムだと横じまの並び方が違うのが見えます。



この図は「絵」として見えるので、音の中に絵を描くこともできます。今回はそれを使いました。
最初の版は、音が壊れました
最初に作った方式(「並べ替え」と「型押し」)は、顔ははっきり出るのですが、音が壊れてしまいました。


原因は2つありました。
- 音の中身を丸ごと入れ替えていた:顔を入れる区間では、元の音の成分を並べ替えたり、顔の形に置き換えたりしていたので、その区間は元の音ではなくノイズになっていました
- 背景まで音にしていた:写真の明るいところを強い音にしていたので、明るい壁(背景)まで大きな音になっていました



顔をはっきり出そうとするほど、音のほうが壊れていく。見えることと聞こえないことは、引っ張り合いの関係なんです。
「こっそり」埋め込む仕組み
そこで考え方を逆にしました。元の音は1サンプルも書き換えず、小さな音を足すだけにします。足す音は、謎ノ美兎の線画の形をしています。
① 写真から線画をつくる


線画にすると、音にする部分が画面の約7%だけになります。足す音の量が少なくて済むので、そのぶん小さくしても顔が見えます。
② 線画の音を足す


線画の音は、スペクトログラムがちょうど線画になるように作った音です。これを元の音にそっと足します。母音のサンプルでは、足した音の大きさは元の音より−42 dB(音の大きさでおよそ126分の1)、1サンプルあたりの差は最大でも0.0098でした。



声と重なっているところは声のほうが強いので、顔は隠れます。声の上の高い音のほうや、しゃべっていない「間」に顔が見えます。
どこまで小さくできる?


| 設定 | 足した音の大きさ(元の音比) | 見え方 |
|---|---|---|
| −45 dB | −29 dB | はっきり見える |
| −58 dB(初期値) | −42 dB | 見える |
| −70 dB | −54 dB | 目をこらすと見える |
設定は「元の音の一番大きい成分に対して何dB下に足すか」で、表の真ん中の列は、音全体の大きさで比べた値です(母音のサンプルでの実測値)。



正直に言うと、ヘッドホンで静かなところだけを聞くと、小さな「サー」という音が分かるかもしれません。ウィジェットの「足した音だけを大きくして聞く」で、何を足したかを確かめられます。
高い音の帯域に隠す


「高音域」を選ぶと、16〜20kHzの帯域にだけ顔を並べます。このあたりは大人には聞こえにくい高さなので、気づかれにくさでは一番です。



そのかわり、顔は小さくなります。それに、この帯域は音の圧縮で真っ先に削られやすいところでもあります。
MP3やAACにしても残る?


手元で試した範囲では、MP3とAAC(どちらも128kbps)に変換しても線画は残りました。高音域に入れた顔も残っていました。



ただ、XやYouTubeなどは投稿された音をそれぞれのやり方で圧縮し直すので、そこで残るかはまだ確かめていません。確実に残したいときは、WAVのまま渡すのがおすすめです。
おまけ:声のない声
昔、ピアノの音だけで人の声を再現する動画がはやりました。人の声は1つも入っていないのに、何と言っているか知ってから聞くと、急に言葉に聞こえるというものです。
ウィジェットの「声のない声」タブで、それができます。入れた音を鍵盤88個の高さごとに分けて、強いものだけを、ピアノの音かサイン波(ピーという純音)で鳴らし直します。




人の声は1サンプルも使っていませんが、母音ごとの「どの高さが強いか」の並びは残っています。実際に、元の母音と再現した音の特徴を比べてみると、ピアノでもサイン波でも、5つの母音すべてで正しい母音がいちばん似ていました。





ただし、このテストに使ったのは合成した母音です。本物の声で言葉に聞こえるかは、ぜひ自分で録音して確かめてみてください。
派手なモードも残しています
「並べ替え」と「型押し」も残してあります。顔を入れた部分の音は壊れますが、顔はいちばんはっきり出ます。
- 並べ替え:時間ごとに、周波数の成分の並び順だけを入れ替える(元の音の成分だけで顔を描く)
- 型押し:背景を除いた顔だけを、4〜16kHzの小さめの範囲に押し付ける(顔の外側は元の音のまま)



ホラーっぽい効果音を作りたいときは、むしろこっちが向いています。
応用:謎ノ美兎透かしの文章を読む
謎ノ美兎透かしでつくった文章を、上の「録音」で自分で読んでみてください。文章の単語の並びと、声のスペクトログラムの両方に謎ノ美兎が入った、二重の透かしになります。
いかがでしたか?





録音した声で試したら、スペクトログラムの画像をXで見せてください。ヘッドホンで聞き比べて、違いが分かったかどうかも教えてもらえるとうれしいです。
まとめ
- スペクトログラムは、音を「時間×高さ」の絵にしたもの
- 最初の版は、音の中身を入れ替えていたので音が壊れた
- 今回は、元の音を書き換えず、謎ノ美兎の線画の形をした小さな音を足すだけ
- 足す音は元の音より約−42 dB(初期値)。小さくするほど気づかれにくく、顔は薄くなる
- 16〜20kHzに入れると聞こえにくい(ただし圧縮の設定によっては消える)
- おまけで、声を使わずにピアノやサイン波で喋らせることもできる
画像を並べ替えて謎ノ美兎にする「謎ノ美兎ソート」もあります。あわせてどうぞ。
※ 謎ノ美兎のファン作品(二次創作)です。










コメント