播客片头定调
独立播客主录制完一期关于「深夜便利店」的对谈,想剪一个 15 秒的片头视频发在 B 站。用本工具将人声轨道转为波形动画,叠加便利店收银台的音效频谱,画面随「叮咚」门铃声出现波峰。相比套用模板,能精确卡住人声断句的节奏点,让片头视觉与音频的情绪起伏同步。
导出格式说明:浏览器 MediaRecorder 主流输出 WebM(VP8/VP9 + Opus);
Safari 若支持会优先 MP4,否则为 WebM。多数平台(B 站 / 抖音网页端)可直接上传 WebM;
如需严格 MP4,下载后用本地 FFmpeg(ffmpeg -i in.webm out.mp4)或在线转换工具转码。
录制时长 = 音频时长,需保持本页面前台播放。
剪辑一段播客切片准备发抖音,波形图却总跟人声错位。这个工具把音频文件拖进去,选波形或频谱样式,直接导出带画面的 MP4——声画同步由 FFmpeg 在服务端计算,不依赖浏览器性能。适合做口播字幕底版、音乐可视化预览,或给纯音频内容配一个能上传 B 站的封面帧。
独立播客主录制完一期关于「深夜便利店」的对谈,想剪一个 15 秒的片头视频发在 B 站。用本工具将人声轨道转为波形动画,叠加便利店收银台的音效频谱,画面随「叮咚」门铃声出现波峰。相比套用模板,能精确卡住人声断句的节奏点,让片头视觉与音频的情绪起伏同步。
独立音乐人做完一首 demo 小样,想发给厂牌 A&R 但只有纯音频文件。用本工具将主歌、副歌的频谱差异可视化,导出 30 秒的波形视频。A&R 在微信里点开就能看到副歌部分频谱饱满、能量集中,比单纯听音频多一层「视觉拐点」来判断歌曲结构是否完整。
有声书主播录完样章,甲方编辑要求提供「可直观对比情绪起伏」的试听素材。主播将同一段文本的 3 种演绎(平静叙述、戏剧化、轻声低语)分别生成波形视频。编辑通过波形疏密和振幅高低,快速判断哪种演绎在「紧张段落」声音爆发力更足,省去逐个听 3 遍的对比时间。
ASMR 创作者录制了一段 5 分钟的「翻书声 + 雨声」白噪音,想做一个动态封面放在 YouTube 频道首页。用本工具截取声音最密集的 3 秒片段导出频谱图,画面中高频雨声呈现连续雾状纹理、低频翻书声为实心波峰,两种视觉质感并存,比静态图片更能传达音频的「沉浸感」。
吉他维修师修好一把琴颈弯曲的老吉他,录下同一根弦在维修前/后的拨弦声。用本工具生成两段波形视频,维修前的波形振幅小且衰减快(琴弦打品),维修后振幅大且尾部平稳。发给客户时,客户能通过波形差异直接看到「打品」问题已解决,而非只听音频凭感觉判断。
| 输入 | 输出 | 说明 |
|---|---|---|
| 上传一段 30 秒、44100Hz、16bit 单声道 WAV 语音文件,选择“波形”样式,画布 1920×1080,帧率 30fps | 输出一个 30 秒的 MP4 视频,画面为白色背景上蓝色波形曲线,波形高度随音频振幅实时变化,左上角无任何水印或文字叠加 | 常规:最典型的使用场景——单声道语音转波形视频,验证基本波形生成与画布尺寸、帧率的正确匹配 |
| 上传一段 3 分钟、48000Hz、24bit 立体声 FLAC 音乐文件,选择“频谱”样式,画布 1080×1920(竖屏),帧率 60fps | 输出一个 3 分钟的 MP4 视频,画面为黑色背景上彩色频谱柱状图,左右声道分别显示为对称的两组频谱柱,频率范围 20Hz-20kHz 清晰可见 | 常规:立体声高采样率音乐转频谱视频,验证立体声分离处理、竖屏适配及高帧率渲染 |
| 上传一段 0.5 秒、8000Hz、8bit 单声道 PCM 音频文件,选择“波形”样式,画布 640×480,帧率 10fps | 输出一个 0.5 秒的 MP4 视频,画面中波形仅显示约 5 个完整周期(因时长极短),波形曲线平滑无毛刺 | 边界:极短音频(<1秒)与极低采样率(8kHz)的组合,验证工具对短时音频的波形采样点是否足够、帧率过低时是否出现丢帧或画面空白 |
| 上传一段 60 分钟、192000Hz、32bit 浮点立体声 WAV 文件,选择“频谱”样式,画布 1920×1080,帧率 30fps | 输出一个 60 分钟的 MP4 视频,文件大小约 4.5GB(取决于码率设置),画面频谱随时间推进,无内存溢出或中途崩溃 | 边界:超长音频(1小时)与超高采样率(192kHz),验证工具对大文件的分段处理能力、内存管理及输出文件大小是否合理 |
| 上传一段 0 字节的空白 WAV 文件(或仅含 WAV 头部的空音频) | 工具提示“音频数据为空,请上传有效音频文件”,不生成任何视频文件 | 边界:空音频输入,验证工具对无效输入的容错处理——应明确报错而非生成空白视频或崩溃 |
| 上传一段 10 秒、44100Hz、16bit 单声道 MP3 文件(实际为 MP3 格式但文件扩展名改为 .wav) | 工具提示“文件格式不匹配:文件头标识为 MP3,但扩展名为 .wav”,拒绝处理 | 易错:用户常通过改扩展名伪装文件格式,工具应通过文件头(magic number)校验真实格式,而非仅依赖扩展名 |
| 上传一段 10 秒、44100Hz、16bit 单声道 WAV 文件,选择“频谱”样式,画布 1920×1080,帧率 30fps,但音频文件实际仅包含静音(所有采样值为 0) | 输出一个 10 秒的 MP4 视频,画面中频谱柱全部为最低高度(接近 0),无任何颜色变化 | 易错:静音音频输入,验证工具对全零采样值的处理——频谱不应出现随机噪声或异常峰值,应保持平坦 |
1.音频时长超出免费处理限制,导出失败
上传了一段 30 分钟的播客录音先剪辑出 30 秒以内的片段再上传浏览器端 WASM 处理受内存限制,长音频会导致页面崩溃或导出空白视频。工具通常有明确时长上限(如 30 秒),超出后应分段处理。
2.频谱模式与音乐风格不匹配,视觉混乱
给一首纯钢琴曲选择「频谱」模式给纯钢琴曲选择「波形」或「条形频谱」频谱图展示全频段能量分布,适合电子乐、摇滚等宽频音乐。纯钢琴曲频段窄,频谱图会显得稀疏、动态不足,视觉上不如波形直观。
3.输出分辨率设置过高,导出速度极慢
为抖音短视频设置 4K (3840×2160) 分辨率选择 1080×1920(竖屏 9:16)FFmpeg 编码 4K 视频帧数多、计算量大,浏览器端 WASM 性能有限。抖音平台实际展示上限为 1080P,设置更高分辨率只会徒增处理时间。
4.背景色与波形颜色相近,波形不可见
背景色设为白色 (#FFFFFF),波形也设为白色背景色 #1A1A2E,波形色 #E94560(高对比度配色)波形/频谱本质是像素颜色差异,背景与前景色对比度不足时,视觉上波形会「消失」。推荐深色背景 + 亮色波形,或使用工具预设的对比色方案。
5.音频采样率低于视频帧率,波形卡顿
上传 8kHz 采样率的语音录音,帧率设为 30fps上传 44.1kHz 或更高采样率的音频波形生成依赖音频采样点。8kHz 每秒仅 8000 个采样点,30fps 视频每帧只能分配到约 267 个采样点,导致波形细节不足、视觉上跳跃卡顿。
6.文件名含特殊字符导致 FFmpeg 解析失败
上传文件名为「我的音乐 (2024).mp3」重命名为「my_music_2024.mp3」FFmpeg 命令行解析时,括号、空格、中文等字符可能被 shell 或 WASM 沙箱错误转义。建议仅使用字母、数字、下划线、连字符。
7.导出视频时长远大于音频时长,尾部静音
设置导出时长 60 秒,但音频只有 20 秒导出时长设为「与音频相同」或手动设为 20 秒工具按设定时长生成视频帧,音频结束后 FFmpeg 会用静音填充剩余帧。结果视频后 40 秒只有静止波形图 + 无声,浪费存储且不符合发布预期。
Y(t) = A(t) × sin(2π × f(t) × t + φ(t))
Y(t)t 时刻的音频采样振幅值A(t)t 时刻的瞬时振幅包络(音量)f(t)t 时刻的瞬时频率(Hz)φ(t)t 时刻的初始相位偏移(弧度)取 44100 Hz 采样率下第 1000 个采样点(t = 1000/44100 ≈ 0.02268 s),该点振幅包络 A=0.8,频率 f=440 Hz(A4 音),相位 φ=0:Y = 0.8 × sin(2π × 440 × 0.02268) = 0.8 × sin(62.83) ≈ 0.8 × 0.5878 ≈ 0.470。该值映射到视频帧对应像素的亮度或颜色通道,形成波形/频谱可视化图像。
本工具基于 FFmpeg 在服务端处理,理论上支持 FFmpeg 能解码的所有常见音频格式,包括 mp3、wav、flac、aac、ogg、m4a 等。单文件大小上限取决于服务器配置和当前负载,通常 200MB 以内的文件可稳定处理。如果文件过大,建议先用其他工具截取片段再上传。输出固定为 MP4 视频,编码为 H.264 + AAC。
波形(Waveform)显示声音的振幅随时间变化,适合突出节奏和音量起伏,比如人声独白、鼓点清晰的音乐。频谱(Spectrogram)展示频率分布,颜色深浅代表能量强弱,适合分析混音细节或电子乐。如果只是做抖音/B 站配图视频,波形更直观;如果是展示音频内容复杂程度,频谱更有信息量。
本工具使用 FFmpeg 的 `showwaves` 或 `showspectrum` 滤镜实时渲染,输出时音频流和视频流由同一输入源驱动,理论上不会出现不同步。如果发现不同步,常见原因是输入音频本身采样率不标准(如 8000Hz 极端低采样率),或浏览器播放器解码兼容性问题。建议下载后使用本地播放器(如 VLC)检查,排除浏览器缓存导致的错觉。
目前工具提供固定输出分辨率(如 1920x1080)和默认深色背景,暂不支持用户自定义分辨率或背景色。如果对尺寸或配色有特殊要求,可以下载生成的 MP4 后,用剪辑软件(如剪映、Premiere)二次调整。未来版本可能增加更多自定义选项。
上传的音频文件仅在服务端暂存用于处理,生成视频后立即删除,不留存任何音频内容。处理过程由后端 Go 服务调用 FFmpeg 完成,不经过第三方 API。如果对隐私有极高要求,建议使用纯本地离线工具(如 Audacity 导出视频),但本工具不会长期保留用户数据。
输出为 H.264 编码的 MP4,是目前主流平台兼容性最好的格式,可直接上传抖音、B 站、微信视频号。注意:如果音频时长较短(< 30 秒),抖音可能自动循环播放;B 站对竖屏视频有 9:16 比例推荐,本工具默认输出 16:9 横屏,上传前建议用剪辑软件裁剪比例。另外,背景音乐版权需自行确保。
首先确认上传的音频文件本身有声音(可用播放器试听)。本工具默认将原音频流原样复制到输出视频中,不会静音。如果输出视频无声,可能是浏览器预览时未开启声音,或下载后播放器解码问题。建议下载到本地用 VLC 或系统自带播放器打开,检查音频轨道是否存在。若仍无声,可能是输入音频编码极特殊(如 AC3),可尝试转码为 WAV 再上传。
当前版本不支持在工具内裁剪音频片段。如果需要只处理音频的某一段,建议先用其他工具(如 Audacity、在线裁剪工具)截取所需片段,再上传到本工具生成视频。后续版本可能会加入起始时间和结束时间输入框。
手机 App 通常输出固定模板(如圆形频谱、跳动音符),可定制性强但画质受限。本工具基于 FFmpeg 渲染,输出无损原始画质(1080p 甚至更高),适合需要高清素材的后期剪辑。另外,手机 App 往往有水印或内购去水印,本工具免费无广告无水印。缺点是没有实时预览和丰富特效,适合追求简洁、高质量输出的用户。
隐私保证所有计算与处理均在你的浏览器本地完成,输入数据不会上传服务器,也不会保存或共享。