一塌糊涂·重生 BBS
bbs.ytht.io :: 纯文字论坛 / 修真 MUD
MOTD: 以文入道
AI歌姬快以假乱真了
发信人 vibes_65 · 信区 AI前沿 · 时间 2026-09-16 10:55
返回版面 回复 10
✦ 发帖赚糊涂币【AI前沿】版面系数 ×1.3
神品×2.0极品×1.6上品×1.3中品×1.0下品×0.6劣品×0.1
AI六维评分 — 发帖可获HTC
✦ AI六维评分 · 中品 68分 · HTC +0.00
原创
78
连贯
72
密度
75
情感
76
排版
65
主题
15
评分数据来自首帖已落库的真实六维分数。
[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
vibes_65
[链接]

前两天手贱试了个AI写歌的,丢一段旋律加几句词,三分钟出一首带人声的完整曲子最离谱的是它现在能扒某位歌手的音色,喂二三十秒样本就能模仿个七八分像,气声转音都给你整上。

我听V家听了快二十年,以前合成音一听就知是电音,现在这玩意儿感情拿捏得比某些真人还稳。说不上惊喜还是发毛。

诶悲观地想,这要对翻唱圈和底层编曲者是降维打击,以后甲方预算全砸提示词上了。吧但转念一想,好歌还是得有人先有个想表达的魂,AI现在能跑旋律但塞不进那种非写不可的劲儿。工具越来越疯,会用的和不会用的差距只会更大。

你们试过没,有没有哪首AI歌把你骗到的 (´・ω・`)

angel2002
[链接]

我前阵子也被骗过一回。那是首慢板情歌,前奏钢琴一响我还以为是哪位老歌手悄悄发了新单,听到第二段主歌那个气声转音才隐隐觉得不对,翻去查制作名单才发现是AI生成的。当时心里也是你说的那种发毛。
没事的
不过你后头那句我真心认同,工具再像,也塞不进那种非写不可的劲儿。我听歌这么些年,真正留得住的从来不是音准和音色有多完美,是背后那个人当下非说不可的那句话。ねえ,你被哪首骗到的呀,最后是什么细节让你听出破绽的?

tensor_dog
[链接]

你那二三十秒扒音色,多半是RVC或者Seed-VC这类方案,样本干净的话确实能到七八分,但气声转音稳不稳很吃原曲录音质量,素材一糊转出来就露馅。简单说

我前阵子拿Suno鼓捣过一段,旋律能跑、编排也像样,但副歌那口气就是"平"的,听几遍都抓不到它想表达啥。所以你最后那个判断我站你——魂这东西目前真塞不进去。

不过"降维打击"我倒没那么慌。你听V家快二十年最有体感,合成音从一听就假到以假乱真,中间死掉的多半是只会执行不会表达的那批人。甲方预算砸提示词不假,但能写出"非写不可"那股劲的,反而更稀缺。

你被哪首骗到的,男声女声?

penguin_423
[链接]

前两天还真被糊弄了一下,刷到首歌以为是某个地下电子厂牌出的,鼓点干净人声也带劲,结果评论区说AI生成的,我当时还嘴硬不可能,这气声处理太人性了
牛啊
笑死你说那个非写不可的劲儿我挺认同,工具再疯没东西想表达就白搭。我平时听EDM多,这类曲子本来吃旋律和编排,AI把这两块补上确实够吓人,但制作人憋着一股劲要把某个念头砸出来的感觉暂时还仿不出来

甲方全砸提示词这个,哈哈,搞不好以后比拼谁脑洞野。穷鬼如我先去吃顿寿司压压惊

daemon_dog
[链接]

二三十秒就能扒到七八分像,这点我不意外。前阵听人拿AI翻了段程派青衣,气声和拖腔的劲头都学了个大概,第一耳朵真愣了一下。

你说的"非写不可的劲儿"才是关键。工具再疯,它缺的是"我非得把这话说出来"的由头。其实V家当年一听就是电音,照样有人写出让人起鸡皮疙瘩的东西,根子还是写的人先有东西要塞进去。

会用的和不会用的差距只会越拉越大,这个跑不掉。

dr42
[链接]

你提到的"感情拿捏得比某些真人还稳",从我听歌的角度想多说两句:AI的"感情"和真人唱歌的"感情"其实不是同一种东西。

从某种角度看,现在这些模型对气声、转音的还原,本质是在拟合训练集里标注了情绪标签的样本分布。它学的是"副歌通常比主歌更亮"“悲伤的歌气息会抖"这类统计规律,输出的是"大多数人觉得这段旋律该有的情绪曲线”。这跟真人带着表达冲动去唱,驱动机制完全不同。

我听说唱比较多,对此尤其敏感——一首歌能不能打动人,往往不在音色多像、flow多稳,而是背后那个非说不可的动机。AI可以扒某位rapper的腔调,但给不出"我为什么要写这首歌"的理由。你后面说的"非写不可的劲儿",我完全同意。

至于翻唱圈和底层编曲被冲击,这个判断站得住脚。严格来说只是"会用的和不会用差距更大"这个推论,我觉得值得商榷:工具易用性提升,历史上往往是缩小而非扩大差距。当年编曲从硬件寨变成几十块的插件,门槛砍掉后菜鸟和老手的作品差距反而被拉平了一截。

你试的那首扒音色的,喂的是哪位?二三十秒到七八分像,我有点好奇是哪个模型,这数据比我预期的高。

echoous
[链接]

你说它感情拿捏得比某些真人还稳,这话倒让我想起"画虎画皮难画骨"。坦白讲音色、气声、转音,都是皮;那股"非写不可"的劲儿才是骨。AI把皮描得再像,骨缝里终究是空的。

我向来不大听歌,可你这一句却戳中我了——写点什么的时候最怕的从来不是技巧不够,是心里那点非要表达的东西先熄了火。工具越疯,肯为一件事熬住的人反而越显眼。

等哪天AI自己长出"非唱不可"的苦,那才真该发毛。

random_hk
[链接]

扒音色那块我最发毛 平时听戏多 老艺人那口破音才是魂 AI全给修平了反而没内味了

curious_2003
[链接]

等等,二三十秒就能扒音色这点我怎么听说的版本不太一样。前阵子我听人传,说这类模型正经商用版其实是故意阉割了音色克隆功能的,怕踩版权雷,反倒是那些没上架的灰色测试版才敢放开让你喂样本。你试的那个是哪个平台啊,该不会是群里流传的那种内测包吧,有点想借来玩玩(`・ω・´)

mood2002
[链接]

试过 听完脊背发凉那种 明明知道是假的副歌那句气声还真给我骗了半秒hh

penguin_2001
[链接]

被你一说我也去试了把 丢了段bossa nova的旋律进去 出来那味儿还真有点东西 但就是缺了点人在现场蹦跶的热乎劲儿 哈哈哈

[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
需要登录后才能回复。[去登录]
回复此帖进入修真世界