音频工具 · 杂项

音频可视化导出视频

波形/频谱→MP4(抖音/B 站)

本地处理 · 不上传 免费 · 无需登录 无次数限制 累计 55 次使用
本地处理 · 文件永不上传
点击 / 拖拽音频文件到此 本地解析 · MP3 / WAV / OGG / FLAC / M4A / AAC local only · nothing uploaded
实时预览analyser · live preview
可视化样式visualizer style
频谱柱状frequency bars
波形线oscilloscope
圆形频谱radial spectrum
粒子律动particles
画布设置canvas & theme

导出格式说明:浏览器 MediaRecorder 主流输出 WebM(VP8/VP9 + Opus); Safari 若支持会优先 MP4,否则为 WebM。多数平台(B 站 / 抖音网页端)可直接上传 WebM; 如需严格 MP4,下载后用本地 FFmpeg(ffmpeg -i in.webm out.mp4)或在线转换工具转码。 录制时长 = 音频时长,需保持本页面前台播放。

就绪 · 选择音频后实时预览律动
第一节

关于本工具

About

剪辑一段播客切片准备发抖音,波形图却总跟人声错位。这个工具把音频文件拖进去,选波形或频谱样式,直接导出带画面的 MP4——声画同步由 FFmpeg 在服务端计算,不依赖浏览器性能。适合做口播字幕底版、音乐可视化预览,或给纯音频内容配一个能上传 B 站的封面帧。

使用场景

播客片头定调

独立播客主录制完一期关于「深夜便利店」的对谈,想剪一个 15 秒的片头视频发在 B 站。用本工具将人声轨道转为波形动画,叠加便利店收银台的音效频谱,画面随「叮咚」门铃声出现波峰。相比套用模板,能精确卡住人声断句的节奏点,让片头视觉与音频的情绪起伏同步。

音乐人 demo 包装

独立音乐人做完一首 demo 小样,想发给厂牌 A&R 但只有纯音频文件。用本工具将主歌、副歌的频谱差异可视化,导出 30 秒的波形视频。A&R 在微信里点开就能看到副歌部分频谱饱满、能量集中,比单纯听音频多一层「视觉拐点」来判断歌曲结构是否完整。

有声书样章试听

有声书主播录完样章,甲方编辑要求提供「可直观对比情绪起伏」的试听素材。主播将同一段文本的 3 种演绎(平静叙述、戏剧化、轻声低语)分别生成波形视频。编辑通过波形疏密和振幅高低,快速判断哪种演绎在「紧张段落」声音爆发力更足,省去逐个听 3 遍的对比时间。

ASMR 频道封面

ASMR 创作者录制了一段 5 分钟的「翻书声 + 雨声」白噪音,想做一个动态封面放在 YouTube 频道首页。用本工具截取声音最密集的 3 秒片段导出频谱图,画面中高频雨声呈现连续雾状纹理、低频翻书声为实心波峰,两种视觉质感并存,比静态图片更能传达音频的「沉浸感」。

乐器维修前后对比

吉他维修师修好一把琴颈弯曲的老吉他,录下同一根弦在维修前/后的拨弦声。用本工具生成两段波形视频,维修前的波形振幅小且衰减快(琴弦打品),维修后振幅大且尾部平稳。发给客户时,客户能通过波形差异直接看到「打品」问题已解决,而非只听音频凭感觉判断。

第二节

使用指南

Getting Started

使用步骤

  1. 1上传或粘贴音频文件(支持 MP3、WAV、FLAC),格式不符时输入框下方显示红色提示
  2. 2在「可视化类型」下拉框选择波形或频谱,右侧预览区同步显示对应动画效果
  3. 3拖动「分辨率」滑块(360p–1080p)和「帧率」滑块(15–60fps),画质参数即时更新到预览画面
  4. 4点击「导出 MP4」按钮,进度条从 0% 走到 100%,完成后按钮变为「下载文件」

输入输出示例

输入输出说明
上传一段 30 秒、44100Hz、16bit 单声道 WAV 语音文件,选择“波形”样式,画布 1920×1080,帧率 30fps输出一个 30 秒的 MP4 视频,画面为白色背景上蓝色波形曲线,波形高度随音频振幅实时变化,左上角无任何水印或文字叠加常规:最典型的使用场景——单声道语音转波形视频,验证基本波形生成与画布尺寸、帧率的正确匹配
上传一段 3 分钟、48000Hz、24bit 立体声 FLAC 音乐文件,选择“频谱”样式,画布 1080×1920(竖屏),帧率 60fps输出一个 3 分钟的 MP4 视频,画面为黑色背景上彩色频谱柱状图,左右声道分别显示为对称的两组频谱柱,频率范围 20Hz-20kHz 清晰可见常规:立体声高采样率音乐转频谱视频,验证立体声分离处理、竖屏适配及高帧率渲染
上传一段 0.5 秒、8000Hz、8bit 单声道 PCM 音频文件,选择“波形”样式,画布 640×480,帧率 10fps输出一个 0.5 秒的 MP4 视频,画面中波形仅显示约 5 个完整周期(因时长极短),波形曲线平滑无毛刺边界:极短音频(<1秒)与极低采样率(8kHz)的组合,验证工具对短时音频的波形采样点是否足够、帧率过低时是否出现丢帧或画面空白
上传一段 60 分钟、192000Hz、32bit 浮点立体声 WAV 文件,选择“频谱”样式,画布 1920×1080,帧率 30fps输出一个 60 分钟的 MP4 视频,文件大小约 4.5GB(取决于码率设置),画面频谱随时间推进,无内存溢出或中途崩溃边界:超长音频(1小时)与超高采样率(192kHz),验证工具对大文件的分段处理能力、内存管理及输出文件大小是否合理
上传一段 0 字节的空白 WAV 文件(或仅含 WAV 头部的空音频)工具提示“音频数据为空,请上传有效音频文件”,不生成任何视频文件边界:空音频输入,验证工具对无效输入的容错处理——应明确报错而非生成空白视频或崩溃
上传一段 10 秒、44100Hz、16bit 单声道 MP3 文件(实际为 MP3 格式但文件扩展名改为 .wav)工具提示“文件格式不匹配:文件头标识为 MP3,但扩展名为 .wav”,拒绝处理易错:用户常通过改扩展名伪装文件格式,工具应通过文件头(magic number)校验真实格式,而非仅依赖扩展名
上传一段 10 秒、44100Hz、16bit 单声道 WAV 文件,选择“频谱”样式,画布 1920×1080,帧率 30fps,但音频文件实际仅包含静音(所有采样值为 0)输出一个 10 秒的 MP4 视频,画面中频谱柱全部为最低高度(接近 0),无任何颜色变化易错:静音音频输入,验证工具对全零采样值的处理——频谱不应出现随机噪声或异常峰值,应保持平坦

常见错误对照

1.音频时长超出免费处理限制,导出失败

✗ 错误上传了一段 30 分钟的播客录音
✓ 修复先剪辑出 30 秒以内的片段再上传

浏览器端 WASM 处理受内存限制,长音频会导致页面崩溃或导出空白视频。工具通常有明确时长上限(如 30 秒),超出后应分段处理。

2.频谱模式与音乐风格不匹配,视觉混乱

✗ 错误给一首纯钢琴曲选择「频谱」模式
✓ 修复给纯钢琴曲选择「波形」或「条形频谱」

频谱图展示全频段能量分布,适合电子乐、摇滚等宽频音乐。纯钢琴曲频段窄,频谱图会显得稀疏、动态不足,视觉上不如波形直观。

3.输出分辨率设置过高,导出速度极慢

✗ 错误为抖音短视频设置 4K (3840×2160) 分辨率
✓ 修复选择 1080×1920(竖屏 9:16)

FFmpeg 编码 4K 视频帧数多、计算量大,浏览器端 WASM 性能有限。抖音平台实际展示上限为 1080P,设置更高分辨率只会徒增处理时间。

4.背景色与波形颜色相近,波形不可见

✗ 错误背景色设为白色 (#FFFFFF),波形也设为白色
✓ 修复背景色 #1A1A2E,波形色 #E94560(高对比度配色)

波形/频谱本质是像素颜色差异,背景与前景色对比度不足时,视觉上波形会「消失」。推荐深色背景 + 亮色波形,或使用工具预设的对比色方案。

5.音频采样率低于视频帧率,波形卡顿

✗ 错误上传 8kHz 采样率的语音录音,帧率设为 30fps
✓ 修复上传 44.1kHz 或更高采样率的音频

波形生成依赖音频采样点。8kHz 每秒仅 8000 个采样点,30fps 视频每帧只能分配到约 267 个采样点,导致波形细节不足、视觉上跳跃卡顿。

6.文件名含特殊字符导致 FFmpeg 解析失败

✗ 错误上传文件名为「我的音乐 (2024).mp3」
✓ 修复重命名为「my_music_2024.mp3」

FFmpeg 命令行解析时,括号、空格、中文等字符可能被 shell 或 WASM 沙箱错误转义。建议仅使用字母、数字、下划线、连字符。

7.导出视频时长远大于音频时长,尾部静音

✗ 错误设置导出时长 60 秒,但音频只有 20 秒
✓ 修复导出时长设为「与音频相同」或手动设为 20 秒

工具按设定时长生成视频帧,音频结束后 FFmpeg 会用静音填充剩余帧。结果视频后 40 秒只有静止波形图 + 无声,浪费存储且不符合发布预期。

第三节

工作原理

How It Works

核心公式

Y(t) = A(t) × sin(2π × f(t) × t + φ(t))

变量说明

  • Y(t)t 时刻的音频采样振幅值
  • A(t)t 时刻的瞬时振幅包络(音量)
  • f(t)t 时刻的瞬时频率(Hz)
  • φ(t)t 时刻的初始相位偏移(弧度)

示例

取 44100 Hz 采样率下第 1000 个采样点(t = 1000/44100 ≈ 0.02268 s),该点振幅包络 A=0.8,频率 f=440 Hz(A4 音),相位 φ=0:Y = 0.8 × sin(2π × 440 × 0.02268) = 0.8 × sin(62.83) ≈ 0.8 × 0.5878 ≈ 0.470。该值映射到视频帧对应像素的亮度或颜色通道,形成波形/频谱可视化图像。

上传音频文件FFmpeg 解析波形/ 频谱数据合成可视化帧+ 音频轨道MP4关键参数(用户可调)• 可视化类型:波形图 / 频谱图• 分辨率:1920×1080 / 1280×720• 背景色:自定义• 帧率:30fps / 60fps
用户输入 服务端处理 输出结果
第五节

常见问题

Q & A
上传的音频文件最大能多大?支持什么格式?

本工具基于 FFmpeg 在服务端处理,理论上支持 FFmpeg 能解码的所有常见音频格式,包括 mp3、wav、flac、aac、ogg、m4a 等。单文件大小上限取决于服务器配置和当前负载,通常 200MB 以内的文件可稳定处理。如果文件过大,建议先用其他工具截取片段再上传。输出固定为 MP4 视频,编码为 H.264 + AAC。

波形和频谱两种模式有什么区别?我该选哪个?

波形(Waveform)显示声音的振幅随时间变化,适合突出节奏和音量起伏,比如人声独白、鼓点清晰的音乐。频谱(Spectrogram)展示频率分布,颜色深浅代表能量强弱,适合分析混音细节或电子乐。如果只是做抖音/B 站配图视频,波形更直观;如果是展示音频内容复杂程度,频谱更有信息量。

为什么生成的视频里音频和画面不同步?

本工具使用 FFmpeg 的 `showwaves` 或 `showspectrum` 滤镜实时渲染,输出时音频流和视频流由同一输入源驱动,理论上不会出现不同步。如果发现不同步,常见原因是输入音频本身采样率不标准(如 8000Hz 极端低采样率),或浏览器播放器解码兼容性问题。建议下载后使用本地播放器(如 VLC)检查,排除浏览器缓存导致的错觉。

能不能调整视频分辨率或背景颜色?

目前工具提供固定输出分辨率(如 1920x1080)和默认深色背景,暂不支持用户自定义分辨率或背景色。如果对尺寸或配色有特殊要求,可以下载生成的 MP4 后,用剪辑软件(如剪映、Premiere)二次调整。未来版本可能增加更多自定义选项。

音频文件会保存在服务器上吗?隐私安全吗?

上传的音频文件仅在服务端暂存用于处理,生成视频后立即删除,不留存任何音频内容。处理过程由后端 Go 服务调用 FFmpeg 完成,不经过第三方 API。如果对隐私有极高要求,建议使用纯本地离线工具(如 Audacity 导出视频),但本工具不会长期保留用户数据。

生成的视频能直接发抖音/B 站吗?有什么注意事项?

输出为 H.264 编码的 MP4,是目前主流平台兼容性最好的格式,可直接上传抖音、B 站、微信视频号。注意:如果音频时长较短(< 30 秒),抖音可能自动循环播放;B 站对竖屏视频有 9:16 比例推荐,本工具默认输出 16:9 横屏,上传前建议用剪辑软件裁剪比例。另外,背景音乐版权需自行确保。

为什么生成的视频没有声音?

首先确认上传的音频文件本身有声音(可用播放器试听)。本工具默认将原音频流原样复制到输出视频中,不会静音。如果输出视频无声,可能是浏览器预览时未开启声音,或下载后播放器解码问题。建议下载到本地用 VLC 或系统自带播放器打开,检查音频轨道是否存在。若仍无声,可能是输入音频编码极特殊(如 AC3),可尝试转码为 WAV 再上传。

能不能只截取音频中的某一段生成视频?

当前版本不支持在工具内裁剪音频片段。如果需要只处理音频的某一段,建议先用其他工具(如 Audacity、在线裁剪工具)截取所需片段,再上传到本工具生成视频。后续版本可能会加入起始时间和结束时间输入框。

和手机 App 里的音频可视化比,这个工具有什么优势?

手机 App 通常输出固定模板(如圆形频谱、跳动音符),可定制性强但画质受限。本工具基于 FFmpeg 渲染,输出无损原始画质(1080p 甚至更高),适合需要高清素材的后期剪辑。另外,手机 App 往往有水印或内购去水印,本工具免费无广告无水印。缺点是没有实时预览和丰富特效,适合追求简洁、高质量输出的用户。

隐私保证所有计算与处理均在你的浏览器本地完成,输入数据不会上传服务器,也不会保存或共享。

选择 打开 +新窗口 esc关闭