AI 全自动直播电台

让 AI 一个人
撑起整场深夜直播

接入直播间弹幕后,它会自己看弹幕、自己想该说什么、用自己的嗓子说出来。24 小时不停播,不冷场,不复读。

7×24
7×24 小时不下播
真人一样会累、会跑题、会沉默
<1s
首句延迟
缓存命中时几乎无等待
12
套自动化回归
改一行代码就知道有没有碰坏别的
Why

它凭什么不像机器人

市面上多数「AI 主播」只是一个接了 TTS 的聊天机器人。这一套把一整晚直播拆成了六个环节,每一环都为"像人"服务。

常见的 AI 主播
  • 有人说话才有反应,没人就一声不吭
  • 每句话都完整、工整、一路往前推
  • 整场一个调子,情绪靠标点猜
  • 插播进来就把讲到一半的话扔了
  • 合成卡住了就一直卡着,没人知道
这一套
  • 冷场自己找话说——会起一篇散文慢慢讲,讲到一半还能接回来
  • 话是毛糙的——重复、改口、半截话、说到一半放弃
  • 一句一层情绪,连清嗓、卡壳、叹气都是真的动静
  • 插播让路再接回,讲过的半篇稿子不扔
  • 合成挂了会自己换路,并且明明白白告诉你

真的在读弹幕

礼物连击会合成一句,进场的人会攒够再一起打招呼 — — 真人主播不会一个一个念名字。

一句话一层情绪

每一句单独标注情绪再送进合成,上一句还在笑、下一句就沉下来,不再是全程一个调子。

记得住老听众

名字、来过几次、每次待多久、说过什么都记着。老观众回来时它会主动提起上次的事。

会犹豫,也会跑题

内置潜意识和走神机制:想到一半忘词、突然惦记起别的事,都比「流畅地输出内容」更像人。

声音是你自己的

基于声音克隆,用你的一段录音当嗓子。语速音高一律不加工,避免任何变声感。

内容安全兜底

敏感词在进直播前多层拦截,写错的话不会有机会被念出来。

清嗓 [cough]、卡壳 [Uhm]、叹气 [sigh]、 反问 [Question-ah]、真的笑 [laughing] —— 这些写进文本会被真念成那个动静,不是打个字假装一下。
Cold Open

没人的时候,才是真功夫

大多数 AI 主播在没人说话的那一刻就死了。这一套把"冷场"当成正常状态来经营。

1安静先按节奏等一会儿,不是立刻找话说
2预热等太久就把下一期稿子先写好攒着(不出声)
3开口起一篇几百字的散文,一件具体的小事慢慢讲
4接得上下一期从上一期的最后一句接着往下说
5让路有人来了就停,稿子留着不扔
6接回回完愣一下,回到刚才那件事上

散文是连着的

不是一串各自独立的短故事。一次写一整篇,上一句带出下一句,中间会跑出去一小段,绕回来也行不回来也行。结尾停在画面上,不许总结。

四道看门狗盯着

干涸保险丝、静默看门狗、合成健康度、外部服务掉线自动降级。哪一环断了都会在控制台上喊出来,不会"看起来一切正常,就是不出声"。

Cover

开播前,先给她做张封面

写一句今晚想聊什么,她会照着自己的样子画 —— 她住的城市、她桌上那件没扔的旧东西、她常去的那条街,都会进到画面里。

一句话出封面

你写"今晚聊前任,外面在下雨",她把它翻成画面。也可以扔几张参考图进去,会更像你想要的那个调子。

要哪几种尺寸都行

竖版 1080×1920(直播间挂的那张)、方形头像、竖构图、横版回放缩略图 —— 一次全出,某个尺寸失败不影响别的。

让它动起来

封面变成一段 8 秒的活图:构图、主体、光线原样不动,动的只有灯光极缓的明暗、窗帘和发丝的轻飘、空气里那点浮尘。

Pipeline

数据是怎么走的

从一条弹幕进来到一句话播出,中间经过六个独立的环节。

1

采集

WebSocket 接入直播伴侣推送,重连退避、去重、礼物合并

2

决策

判断这一刻说还是不说、说什么、对谁说

3

审查

敏感词与氛围词过滤,过不了的句子直接丢掉

4

口语化

去儿化音、去书面腔、数字转中文口语

5

情绪

逐句标注情绪状态,驱动合成端的情感向量

6

播出

预合成队列、缓存复用、BGM 自动让位

Engineering

让人放心改的代码

这个项目的每一行都改得动 —— 因为改坏了会在几秒钟内被指出来。

12 套自动化回归

一条命令跑完:模块导入、配置注册表、冷场链路、打断接回、记忆清除、前端冒烟、死代码扫描…… 全绿才敢提交。

踩过的坑写在注释里

每个反直觉的写法旁边都记着"当初为什么"。跨时钟比较、配置键分裂、前端队列没被通知 —— 这些不是 bug,是教训。

分层,各司其职

写稿的不知道怎么发声,发声的不知道稿子怎么来的。每层只管一件事,唯一出口写死在文档里。

docs/ARCHITECTURE.md —— 数据流、分层职责、两条铁律、四道看门狗、排障手册都在里面。 想知道系统怎么跑的,从那儿开始看。

撑起整场深夜直播

接入直播间弹幕后,它会自己看弹幕、自己想该说什么、用自己的嗓子说出来。24 小时不停播,不冷场,不复读。

本机运行 数据不出硬盘 虚拟直播间可先试