1. 项目背景与需求解析
春节贴对联是中国延续千年的传统习俗,但现代人常面临两个痛点:一是市售对联内容同质化严重,难以体现个性;二是针对商铺、公司等特殊场景的定制化对联获取成本高。传统解决方案要么依赖人工创作(价格昂贵),要么使用通用模板(缺乏针对性)。
我们基于Rokid灵珠平台开发的智能对联生成系统,通过计算机视觉与自然语言处理的结合,实现了"所见即所得"的对联创作体验。当用户通过智能眼镜观察大门时,系统能自动识别场景类型(家庭住宅/公司/商铺),结合2026年马年生肖元素,实时生成符合传统格律的定制对联。整个过程无需手动输入任何信息,真正实现了"看一眼就出对联"的无感交互。
技术选型关键考量:之所以选择灵珠平台,是因为其预置的视觉感知技能已达到商用级准确率(实测大门识别准确率92%),且提供完整的端云协同架构,开发者无需从零搭建AI基础设施。
2. 系统架构与核心模块
2.1 整体技术架构
系统采用三层架构设计:
- 终端层:Rokid智能眼镜作为采集设备,通过摄像头获取门景图像,通过麦克风接收语音指令
- 能力层:
- 视觉感知模块:基于YOLOv5改进的目标检测模型,专为门景识别优化
- 自然语言生成:采用Doubao-Seed-1.6大模型,针对对联生成微调
- 交互层:多模态交互引擎,协调视觉输入与语音输出的逻辑流转

2.2 核心算法细节
2.2.1 门景检测模型
- 基础模型:YOLOv5s 轻量化版本
- 训练数据:自建10,000张门景数据集(含家庭/公司/商铺三类)
- 关键改进:
- 添加注意力机制模块,提升门框特征提取能力
- 采用Focal Loss解决类别不平衡问题(商铺样本较少)
- 输出层增加场景分类分支(与检测任务联合训练)
python复制# 模型关键配置示例
model = YOLOv5(
backbone='CSPDarknet',
neck='PANet',
head=DetectHead(
num_classes=3, # 三类场景
anchors=[[10,13], [16,30], [33,23]],
loss_fn=MultiTaskLoss( # 联合损失函数
det_loss=FocalLoss(),
cls_loss=CrossEntropyLoss()
)
)
)
2.2.2 对联生成策略
采用两阶段生成方法:
- 关键词提取:根据场景类型选择主题词库
- 家庭:平安、团圆、吉祥等
- 商铺:财源、兴旺、生意等
- 格律控制:通过受限解码确保:
- 上联尾字为仄声(中文三/四声)
- 下联尾字为平声(中文一/二声)
- 横批固定4字
实测难点:传统RNN模型在平仄控制上准确率仅68%,改用Transformer架构+格律约束后提升至93%
3. 开发实操全流程
3.1 灵珠平台配置步骤
-
创建智能体
- 登录Rokid开发者平台
- 新建"门景对联生成器"项目
- 配置基础信息:
- 调用权限:视觉感知技能、语音交互API
- 设备限制:仅限Rokid眼镜系列
-
技能接入
- 在"能力中心"添加:
视觉感知v2.3:用于门景检测多模态交互引擎:协调输入输出
- 设置置信度阈值为0.75(平衡准确率与召回率)
- 在"能力中心"添加:
-
Prompt工程
markdown复制# 角色设定
你是一位专业对联创作师,需遵守:
1. 严格检测输入是否为门景照片
2. 识别场景类型(家庭/公司/商铺)
3. 生成7字对联,横批4字
4. 上联仄声收尾,下联平声收尾
# 示例
输入:家庭大门照片
输出:
上联:马跃前程千业旺
下联:春临小院四季安
横批:吉祥如意
3.2 调试技巧实录
-
视觉模块调试
- 问题:商铺门面误识别为家庭
- 解决方案:
- 收集更多商铺样本重新训练
- 添加显眼的商铺特征(招牌、二维码等)到负样本
-
生成质量优化
- 常见问题:下联平声不准
- 改进方法:
- 在beam search中增加平仄打分项
- 建立声调检查规则:
python复制def check_tone(last_char):
tones = get_pinyin_tones(last_char) # 获取拼音声调
return tones[-1] in [1,2] # 下联需平声
4. 应用效果与实测数据
4.1 性能指标
| 测试项 | 家庭场景 | 商铺场景 | 公司场景 |
|---|---|---|---|
| 识别准确率 | 94% | 88% | 91% |
| 生成耗时 | 1.2s | 1.3s | 1.1s |
| 格律正确率 | 96% | 93% | 95% |
4.2 用户体验优化点
-
交互设计
- 成功识别时:振动反馈+语音提示"为您生成马年对联"
- 识别失败时:显示引导框线"请对准门框重试"
-
个性化定制
- 语音指令支持:
- "换个更喜庆的"
- "字数少一点"
- "加入发财二字"
- 语音指令支持:
5. 开发经验与避坑指南
-
数据收集教训
- 初期仅收集正视角门景照片,实际使用发现斜角拍摄常见
- 修正方案:补充30°、45°斜角样本,增强模型鲁棒性
-
性能优化技巧
- 视觉模型量化:FP32→INT8,推理速度提升2.3倍
- 生成模型缓存:对常见场景预生成候选对联,首字响应时间从800ms降至200ms
-
格律校验方案对比
- 方案A:纯规则校验(开发快但覆盖率低)
- 方案B:规则+MLP分类器(准确率高但耗资源)
- 最终选择:规则校验+Top3候选重排序,平衡效率与质量
这个项目最让我意外的是传统民俗与AI技术的结合度——通过精准的场景识别和受限文本生成,机器创作的对联在文化适配性上已接近人工水平。特别是在商铺对联场景中,系统生成的"马跃千程迎贵客,春盈万铺聚财源"等句子,实际获得了商户的高度认可。后续计划加入书法风格转换功能,让AI不仅能创作内容,还能呈现墨宝效果。
