市面上多数「AI 主播」只是一个接了 TTS 的聊天机器人。这一套把一整晚直播拆成了六个环节,每一环都为"像人"服务。
礼物连击会合成一句,进场的人会攒够再一起打招呼 — — 真人主播不会一个一个念名字。
每一句单独标注情绪再送进合成,上一句还在笑、下一句就沉下来,不再是全程一个调子。
名字、来过几次、每次待多久、说过什么都记着。老观众回来时它会主动提起上次的事。
内置潜意识和走神机制:想到一半忘词、突然惦记起别的事,都比「流畅地输出内容」更像人。
基于声音克隆,用你的一段录音当嗓子。语速音高一律不加工,避免任何变声感。
敏感词在进直播前多层拦截,写错的话不会有机会被念出来。
大多数 AI 主播在没人说话的那一刻就死了。这一套把"冷场"当成正常状态来经营。
不是一串各自独立的短故事。一次写一整篇,上一句带出下一句,中间会跑出去一小段,绕回来也行不回来也行。结尾停在画面上,不许总结。
干涸保险丝、静默看门狗、合成健康度、外部服务掉线自动降级。哪一环断了都会在控制台上喊出来,不会"看起来一切正常,就是不出声"。
写一句今晚想聊什么,她会照着自己的样子画 —— 她住的城市、她桌上那件没扔的旧东西、她常去的那条街,都会进到画面里。
你写"今晚聊前任,外面在下雨",她把它翻成画面。也可以扔几张参考图进去,会更像你想要的那个调子。
竖版 1080×1920(直播间挂的那张)、方形头像、竖构图、横版回放缩略图 —— 一次全出,某个尺寸失败不影响别的。
封面变成一段 8 秒的活图:构图、主体、光线原样不动,动的只有灯光极缓的明暗、窗帘和发丝的轻飘、空气里那点浮尘。
从一条弹幕进来到一句话播出,中间经过六个独立的环节。
WebSocket 接入直播伴侣推送,重连退避、去重、礼物合并
判断这一刻说还是不说、说什么、对谁说
敏感词与氛围词过滤,过不了的句子直接丢掉
去儿化音、去书面腔、数字转中文口语
逐句标注情绪状态,驱动合成端的情感向量
预合成队列、缓存复用、BGM 自动让位
这个项目的每一行都改得动 —— 因为改坏了会在几秒钟内被指出来。
一条命令跑完:模块导入、配置注册表、冷场链路、打断接回、记忆清除、前端冒烟、死代码扫描…… 全绿才敢提交。
每个反直觉的写法旁边都记着"当初为什么"。跨时钟比较、配置键分裂、前端队列没被通知 —— 这些不是 bug,是教训。
写稿的不知道怎么发声,发声的不知道稿子怎么来的。每层只管一件事,唯一出口写死在文档里。