MP3 Compression

MP3 Compression — cover MP3 Compression — page 1

今日のユビキタスなストリーミングサービスやデジタル音楽ライブラリが登場する以前は、高音質オーディオファイルの途方もないサイズが、広範なデジタル配信やポータブルリスニングにとって乗り越えられない障壁となっていました。非圧縮デジタルオーディオは膨大なストレージと帯域幅を必要とし、黎明期のインターネットや初期のポータブルデバイスには実用的ではありませんでした。課題は深刻でした。音質を知覚できるほど犠牲にすることなく、オーディオファイルのサイズを大幅に削減するにはどうすればよいか、というものでした。

MP3 Compression — page 2

毎秒四万四千百回サンプリングされ、各サンプルに十六ビットの情報を持つ二つのステレオチャンネルで構成される標準的な非圧縮CD品質のオーディオは、毎秒百万四千ビットを超える膨大なデータストリームを生成しました。これは、一分間の音楽でおよそ十メガバイトに相当します。このようなファイルは、初期のパーソナルコンピューターのストレージ容量をすぐに圧倒し、ダイヤルアップインターネット接続では送信に法外な時間がかかりました。より小さなファイルを求める探求は、データだけでなく人間の知覚そのものを理解する、根本的に新しいアプローチを必要としました。この探求は、研究者たちを人間の耳が音を処理する方法、すなわち、より大きな音がより小さな音を「マスク」して聞こえなくする「心理音響マスキング」という概念の根本的な理解へと導きました。

MP3 Compression — page 3

オーディオファイルのサイズを小さくしようとする最初の試みでは、単純な切り捨てや積極的なフィルタリングが行われ、音質が著しく劣化しました。これらの方法は、人間の聴覚のニュアンスを無視して、すべてのオーディオデータを等しく重要であると扱ったため、失敗しました。本当の課題は、リスナーに気づかれずに、冗長な情報や知覚できない情報を特定して排除することでした。これには、人間が音をどのように知覚するかを研究する心理音響学の深い理解が必要でした。研究者たちは、主観的な聴取体験に影響を与えることなく、オーディオスペクトルのどの部分を削除できるかをインテリジェントに「決定」できるアルゴリズムを開発する必要がありました。これは、単純な数学的解決策では達成できないデリケートなバランスでした。

MP3 Compression — page 4

一九八〇年代半ば、ドイツのフラウンホーファー応用研究機構、特にエアランゲンにある集積回路研究所(IIS)は、デジタルオーディオ研究の中心地となりました。この取り組みの多くを主導したのは、優れた電気技師であり数学者でもあるカールハインツ・ブランデンブルク博士でした。彼のチームは、人間の聴覚の既知の限界を利用してオーディオデータを圧縮するという、知覚オーディオ符号化と呼ばれる概念に焦点を当てました。彼は、真の効率は単なるデータ削減からではなく、耳のフィルタリングプロセスを模倣するインテリジェントなシステムから生まれることを理解していました。私たちが音をどのように知覚するかについてのこの深い探求が、後に世界標準となるものの基礎を築いたのです。

MP3 Compression — page 5

ブランデンブルクとそのチームだけがこの追求をしていたわけではありません。多くのグループが音声圧縮に取り組んでいました。国際標準化機構(ISO)は、音声と動画の圧縮規格を開発するために、一九八八年にムービング・ピクチャー・エキスパーツ・グループ(MPEG)を設立しました。フラウンホーファーが提案したコーデックは、ASPEC(アダプティブ・スペクトラル・パーセプチュアル・エントロピー・コーディング)として知られ、多くの競合提案の一つでした。このプロセスには、厳格な聴覚テストと継続的なアルゴリズムの改良が含まれ、可聴なアーティファクトを導入することなく、大幅な圧縮率を達成しようと試みました。初期のバージョンは、「プリエコー」やその他の歪みに悩まされることが多く、チームは常に革新し、心理音響モデルを改良することを余儀なくされました。

MP3 Compression — page 6

MP3圧縮の核となるブレークスルーは、二つの主要な技術、すなわち修正離散コサイン変換(MDCT)と洗練された心理音響モデルにありました。MDCTは、微調整されたフィルターバンクのように機能し、音声セグメントを取り込み、それを個々の周波数成分に分解しました。これは、プリズムが白色光を構成色に分離するのと非常によく似ています。これにより、アルゴリズムは音のスペクトルを非常に高い精度で分析することができました。音声がこれらの周波数帯域に分解されると、心理音響モデルは、聴覚マスキングのような原理に基づいて、音のどの部分が人間の耳には本当に聞こえないかを特定できました。聴覚マスキングとは、特に周波数や時間が近い場合に、大きな音が小さな音を覆い隠す現象です。

MP3 Compression — page 7

MP3の真の天才性は、その心理音響モデルにありました。これは主に二つの現象、周波数マスキングと時間マスキングを利用しています。周波数マスキングは、ある周波数の大きな音が、近くの周波数の小さな音を聞こえなくする現象です。人間の耳は、その小さな音を区別することができません。一方、時間マスキングは、大きな音がその直前または直後に発生する小さな音をマスクする方法を説明します。各周波数帯域の「マスキング閾値」を計算することで、MP3アルゴリズムは、リスナーが何の損失も感じることなく、その閾値以下のすべてのオーディオ情報を破棄することができました。この心理音響的に無関係なデータをインテリジェントに破棄することが、知覚上の劣化を最小限に抑えつつ高い圧縮率を達成し、ファイルサイズを十倍以上に削減する鍵となりました。

MP3 Compression — page 8

一九九三年までに、フラウンホーファーの研究チームの努力は、一般にMP3として知られるMPEG-1オーディオレイヤーIIIの作成という形で実を結びました。これは正式に標準化され、驚くべき圧縮効率を提供しました。通常、オーディオファイルを元のサイズの約十分の一にまで縮小しながら、ほぼCD品質のサウンドを維持しました。当初の採用は遅く、主に科学および研究コミュニティ内にとどまっていました。しかし、インターネット速度が向上し、一九九〇年代後半に初期のポータブルMP3プレーヤーが登場すると、このフォーマットの可能性は否定できないものとなりました。これらの小さなファイルを簡単に共有できるようになったことで、MP3は急速に主流となり、音楽の消費と流通の方法を根本的に変えました。アメリカの発明家ジョージ・ワシントン・カーヴァーがかつて「教育は自由の黄金の扉を開く鍵である」と述べたように、この文脈において、MP3圧縮はデジタルオーディオの自由が何を意味し得るかを世界に教えました。

MP3 Compression — page 9

MP3技術が広く採用されたことは、まさに革命的でした。それは音楽へのアクセスを民主化し、インターネット接続と十分なストレージがあれば誰でも膨大な楽曲ライブラリを利用できるようにしました。しかし、これは従来の音楽業界との激しい戦いを引き起こしました。彼らは物理メディアがもはや主流ではない世界に適応するのに苦労したのです。このフォーマットは広範な著作権侵害を助長した一方で、合法的なデジタル音楽ストアやストリーミングサービスの道も開きました。MP3フォーマットは、効率的なデジタル配信が可能であるだけでなく、避けられないものであり、音楽の経済的および文化的景観を永遠に変えることを証明しました。それはその後のオーディオコーデックのテンプレートとなり、デジタルサウンドで達成可能なことの限界を押し広げました。

MP3 Compression — page 10

AACやOgg Vorbisのような、より新しく効率的なオーディオコーデックが登場したにもかかわらず、MP3フォーマットの遺産は今も残っています。それは根本的にパラダイムを転換させ、高品質のオーディオが小さく管理しやすいパッケージで提供できることを証明しました。この革新は、パーソナル音楽プレーヤー、デジタル音楽マーケットプレイス、そして最終的には今日を支配するストリーミング経済の台頭を直接可能にしました。ブランデンブルクと彼のチームによって開発された心理音響マスキングと効率的なスペクトル符号化の原則は、現代のオーディオ圧縮アルゴリズムの設計に影響を与え続けています。MP3圧縮は単なるファイルフォーマットではありませんでした。それは音楽との関係を再定義し、デジタル時代において音楽を無限にアクセスしやすく、個人的で、遍在するものにした触媒でした。それはまさにデジタルオーディオの自由の黄金の扉を開いたのです。