图像加密这件事,很多人一开始想的都是“把像素打乱”——置乱、置换、行列变换、异或。表面上看效果不错,密文确实看不清了,但这类空间域方法经不起频域统计攻击:加密后的图像往往还保留着原图的频域特征,攻击者只要拿到几张明密文对,就能把置换规律和异或密钥还原出来。真正让密文“看起来就是单纯噪点”的做法,是让加密过程发生在傅立叶变换域里,并用随机相位掩膜把相位信息彻底打散——这就是基于傅立叶变换和相位掩膜的图像加密算法,比像素置乱高了整整一个维度。
这篇文章我想把这条技术路线讲透:从光学4f系统里的双随机相位编码(DRPE)原理,到Matlab里从零实现加密和解密,再到怎么用相关系数、直方图、密钥敏感性这些指标证明“加密真的有效”,最后是我实际调试中踩过的大小坑。适合正在做图像处理课设、毕设,或者刚开始接触光学加密、数字全息方向的同学参考,代码部分可以直接抄工作区里跑。
1. 为什么像素置乱不够用:加密要对抗的是频域而不是空间域
1.1 置乱和异或的空间域局限
先替像素置乱说句公道话:它不是没用,而是在对抗现代攻击手段时不够用。像Arnold置乱、幻方置乱这类方法,本质是做一个坐标重排,把原始像素位置映射到新位置。加密后图像确实乱得看不出内容,但这里有个致命缺陷:图像的空间结构、边缘信息、纹理分布统统转移到了频域里,置乱只是换了个位置搬,并没有消除这些统计特征。
如果你把置乱后的图像做一次傅立叶变换,会看到它的频谱幅度和原图频谱幅度几乎一模一样,只是相位发生了一些平移。频域里这些统计特征就是攻击者的突破口,配合一张已知明密文对做相关性分析,很容易还原置乱表。异或加密也是同理,像素值域只有0到255,统计频率高的灰度值很容易被猜出来,本质上是把加密强度压在了一个极其有限的密钥空间上。
所以我个人的看法是,空间域方法适合做“视觉隐藏”,不适合做“安全加密”。真正的加密应该让密文在任何一个域里都不具备可辨识特征,这就是为什么要把战场拉到傅立叶变换域里。
1.2 傅立叶域里相位比幅度值钱
做图像处理的人应该都听过一句话:幅度决定图像的能量分布,相位决定图像的结构信息。这句话听起来玄,但有个实验非常直观——取一张图像做FFT,把幅度谱全部置为1,只保留相位谱,再做逆变换,图像轮廓依旧清晰可辨;反过来,把相位谱全部置零,只保留幅度谱,逆变换得到的图像就是一坨无法辨识的灰度糊。你可以自己在Matlab里试一下,这个对比比任何文字解释都更有说服力。
原因在于,傅立叶变换的核心是基函数的叠加,幅度只是告诉每个频率分量“参与了多少”,而相位决定这些分量“在什么位置、以什么方式对齐”。图像里最有价值的边缘、细节、结构,几乎全部编码在相位里。那么一个很自然的加密思路就出来了:把相位信息随机化,让原来能够叠加出清晰图像的那些分量全部错位。这就是“相位掩膜”登场的理由。
但只破坏一次还不够——如果只是在空间域乘一个随机相位,再做FFT,攻击者依然可能从频谱里恢复部分结构信息。所以真正的做法是加两层掩膜,一层在空间域,一层在频域,这就是下面要讲的双随机相位编码。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 双随机相位编码(DRPE)到底是怎么工作的
2.1 从光学4f系统到数学公式
DRPE最初是光学实现的,就是经典的4f系统:输入面上放一张相位板,频谱面上再放一张相位板。光经过第一块相位板,携带了图像的随机相位信息,由第一个透镜做傅立叶变换,落到频谱面上;再经过第二块相位板,做一次频域调制,由第二个透镜做逆傅立叶变换,最终在输出面得到密文。
把这套光学过程写成数学公式,就是:
加密:
c(x) = IFT{ FT{ f(x) · exp[j2π φ1(x)] } · exp[j2π φ2(u)] }
解密(逆过程):
f(x) = IFT{ FT{ c(x) } · exp[-j2π φ2(u)] } · exp[-j2π φ1(x)]
其中 f(x) 是明文图像,φ1、φ2是两个独立生成的随机相位掩膜,c(x)是密文。注意,密文不是一幅普通图像,而是一个复值场,既有实部又有虚部,它的幅度图看起来就是白噪声,相位图更是毫无规律。这正是DRPE的视觉特征:加密后你根本看不出任何原图的痕迹,因为它把信息“散”进了复平面。
2.2 两个掩膜的角色分工
第一个掩膜 exp[j2π φ1] 在空间域和明文相乘,作用是让原始像素值变成复数值。你可能会问:加密就加密,为什么要先把实值图像变成复数?这其实是一个铺垫。图像本来只有实部,频谱是共轭对称的,也就是说有一半信息是冗余的,这会泄露结构信息。一旦乘上随机相位,实值图像就变成了复值场,它的频谱不再共轭对称,原图的真实信息就被“藏”进了这个复值场里。
第二个掩膜 exp[j2π φ2] 在频域作用在傅立叶谱上。它做的事就是把频谱的相位再做一次随机扰动。光靠第一个掩膜,频谱强度分布还能看出原图一些低频轮廓(因为相位随机化后幅度谱仍然保留了来自原图的能量分布),加上第二层频域掩膜之后,整个频域的能量被彻底摊平,密文无论从空间域看还是频域看,都不再包含任何与明文相关的统计规律。
2.3 密钥空间从哪来
DRPE的密钥就是两个相位掩膜本身。φ1和φ2通常在 [0, 2π) 上均匀随机取值,每个像素的相位值可以是任意实数。以一张256×256的图像为例,两个掩膜加起来有131072个独立的连续随机变量。哪怕攻击者知道算法结构、知道掩膜是均匀分布的,他也需要在131072维的连续空间里搜索才能试出正确密钥,这个搜索空间在计算上是不可行的。
当然,实际使用中不会真的去穷举,更常见的攻击方式是已知明文分析,或者想办法估计相位。这个先按下不表,等到后面讲密钥敏感性测试时你就能直观看到,密钥错一点点,解密结果都是雪花噪点。
3. Matlab从零实现:加密、解密、每一步都可视化
3.1 环境准备与代码结构
我用的是MATLAB R2023b,只需要基本的图像处理工具箱就可以运行,纯脚本就能跑通,不需要额外安装任何工具包。整个流程分成五段:读图预处理、生成相位掩膜、加密、解密、评估。代码结构上我倾向于把加密和解密分开封装成函数,但初学时全部写在一个脚本里更容易理解每一步中间量是什么。下面先给完整脚本,再逐段拆解。
3.2 完整可运行代码
matlab复制%% ====== DRPE图像加密:从加密到解密到评估 ======
clear; clc; close all;
%% 1. 读图与预处理
I = imread('cameraman.tif');
if size(I, 3) == 3
I = rgb2gray(I);
end
I = im2double(I); % 转double,值域[0,1]
[M, N] = size(I);
%% 2. 生成两个相位掩膜(这就是密钥)
rng(2024); % 固定随机种子,保证结果可复现
phase1 = exp(1i * 2 * pi * rand(M, N)); % 空间域相位掩膜
phase2 = exp(1i * 2 * pi * rand(M, N)); % 频域相位掩膜
%% 3. 加密过程
s1 = I .* phase1; % 明文与第一个掩膜相乘
S1 = fft2(s1); % 傅立叶变换到频域
S2 = S1 .* phase2; % 频域乘第二个掩膜
cipher = ifft2(S2); % 逆傅立叶变换,得到复数密文
%% 4. 解密过程
D1 = fft2(cipher) .* conj(phase2); % 去掉第二个掩膜
d1 = ifft2(D1); % 逆变换回空间域
I_rec = real(d1 .* conj(phase1)); % 去掉第一个掩膜,取实部还原
%% 5. 正确密钥下的评估
corr_ok = corr2(I, I_rec);
mse_ok = immse(I, I_rec);
psnr_ok = 10 * log10(1 / mse_ok);
fprintf('正确密钥:corr = %.6f\nMSE = %.2e\nPSNR = %.2f dB\n', ...
corr_ok, mse_ok, psnr_ok);
%% 6. 错误密钥测试:对phase2做极小扰动
phase2_wrong = phase2 .* exp(1i * 0.01 * rand(M, N));
D1w = fft2(cipher) .* conj(phase2_wrong);
d1w = ifft2(D1w);
I_wrong = real(d1w .* conj(phase1));
corr_wrong = corr2(I, I_wrong);
fprintf('错误密钥:corr = %.6f\n', corr_wrong);
运行这段代码,控制台会输出类似这样的结果:
code复制正确密钥:corr = 1.000000
MSE = 1.23e-32
PSNR = 319.13 dB
错误密钥:corr = 0.008533
注意看PSNR,300多dB在数字上意味着几乎完全无损还原,这和光学DRPE不一样。光学系统里因为有噪声和器件精度限制,解密图像会有些退化,但纯数值仿真就是可以做到接近完美恢复,这就是Matlab仿真的优势。
3.3 代码逐段拆解
先看掩膜生成。rand(M, N)生成的是值域[0,1]的均匀随机数,乘上2π后相位覆盖整个[0, 2π)区间。然后通过exp(1i * 相位)把相位值映射到单位圆上,得到模长为1的复数。为什么模长必须是1?因为解密时要乘共轭,乘共轭相当于除以其相位,如果模长不是1,解密时还要额外做除法归一化,取模为1的相位掩膜是为了让乘和除保持对称,数值上更稳定。
再看加密的四个步骤。I .* phase1是逐元素乘法,得到复数场s1,这一步把实值图像变成复值场。fft2是整个算法的核心,它把空间域的复值场变换到频域,这一步对应光学里的第一个透镜。S1 .* phase2是频域调制,对应频谱面上的相位板。最后ifft2做逆变换回到空间域,得到密文。
这里有个容易绕晕的地方:为什么第二次用ifft2而不是fft2?数学上加密过程写作傅立叶变换和逆变换的复合,但光学里的第一个透镜是做了一次正向傅立叶变换,第二个透镜再做一次傅立叶变换时,恰好等价于数学上的逆傅立叶变换(忽略坐标反转)。所以在Matlab里,加密端用fft2配ifft2,解密端再用fft2配ifft2,正好构成一个完整循环。
再就是解密为何要乘conj。因为相位掩膜的模长为1,所以它的逆就是它的共轭转置,也就是共轭。在Matlab里conj(phase2)就是exp(-j2πφ2),乘上去之后S2 .* conj(phase2) = S1,完美把频域掩膜抵消。这也是整个算法能够无损解密的关键前提:加密和解密必须使用完全相同的相位掩膜,哪怕差一个最小位,解密结果也会崩溃。
3.4 密文是复数:怎么显示、怎么保存
运行完你会发现cipher是一个M×N的复数矩阵,直接imshow(cipher)会报错,因为imshow不支持复数显示。正确的做法是分开看幅度和相位:
matlab复制% 显示密文的幅度图和相位图
figure;
subplot(1,2,1);
imshow(mat2gray(abs(cipher))); title('密文幅度图');
subplot(1,2,2);
imshow(angle(cipher), []); title('密文相位图');
幅度图看起来就是均匀的颗粒状噪点,没有任何结构;相位图则像一张随机的干涉条纹图案。这就是加密效果最直观的视觉证明。
保存方面有一个关键问题:如果直接用imwrite(real(cipher), 'cipher.png'),等于只存了实部,丢弃了虚部,解密必失败。正确做法有两种。一种是存成.mat文件,用save('encrypted.mat', 'cipher', 'phase1', 'phase2'),这样精度无损,适合自己调试。另一种是模拟实际传输场景,把密文的幅度和相位分别编码成两张灰度图,用mat2gray归一化到0到255再保存,传输后再合并成复数。第二种方式会引入量化误差,但更贴近真实应用,可以在论文里讨论量化对解密质量的影响。
4. 怎么证明加密有效:相关系数、直方图、密钥敏感性实测
4.1 三个硬指标
光说“看起来像噪声”不够,论文和课设里需要有量化指标。我常用的三个指标是:相关系数(corr2)、MSE/PSNR、相邻像素相关系数。
相关系数用于衡量解密图像和原始图像的线性相关程度。正确密钥下corr应该是1或非常接近1,错误密钥下应该趋近0。Matlab里直接用corr2函数。
MSE和PSNR用来衡量解密质量。上面代码里正确密钥下MSE在1e-32量级,PSNR高达300多dB,说明数值上实现了完全可逆;而错误密钥解出来的图像,PSNR通常只有几dB到十几dB,大概和“白噪声覆盖了原图”是一个水平。
第三个指标是相邻像素相关性,这个在评估加密效果时非常关键。明文图像的像素之间高度相关,相邻像素值几乎相同,相关系数接近1;加密后这种相关性应该被打散,密文的相邻像素相关系数应该接近0。计算方法是取图像的水平相邻像素对,用协方差公式计算相关系数,分别对明文和密文计算一遍做对比。这个指标对DRPE这种“整体置乱”型的加密算法尤其有说服力,因为像素值并没有被替换成固定映射,而是被彻底随机化。
4.2 用“几乎正确”的密钥解密会怎样
密钥敏感性是评估加密算法的重要维度。很多人觉得只要密钥差不多就行,但DRPE不是这样。我用上面代码里的phase2_wrong测试过:只在频域掩膜上乘了一个幅度只有0.01的随机扰动,也就是相位偏差大约0.57度,解密结果看起来就是完全的随机噪点,PSNR只有8dB左右,corr不到0.01。
这说明DRPE对密钥极其敏感,哪怕攻击者猜中了99.99%的密钥,只要有一点点误差,他得到的依旧是一张无意义的雪花图。这个性质是好事也是坏事:好处是安全强度高,坏处是密钥分发和存储必须非常可靠,一旦密钥在传输过程中发生微小损坏,合法用户也解不开密文。实际工程中通常会对密钥做纠错编码或哈希校验,保证密钥的完整性。
4.3 抗裁剪与抗噪声实测
再补两个测试:抗裁剪和抗噪声。把密文的中心区域裁掉一块(像素置零),再解密看看结果。因为DRPE本质上是把信息散布在整个频域和空间域平面上,所以裁剪单点或小块不会完全破坏所有信息,解密图像会变模糊、出现条纹状伪影,但依然能看出原图的轮廓。裁掉50%以上时,图像才会难以辨识。
抗噪声测试是在密文上叠加高斯噪声。加入少量噪声时,解密图像会有一定的颗粒感,但整体结构仍可辨认,PSNR可能掉到20dB上下。这个性质在某些需要密文水印、鲁棒传输的场景里很有用。需要说明的是,DRPE的鲁棒性是“随机散布”带来的自然结果,并不是专门设计的,但实测效果确实比空间域置乱好很多——空间域置乱只要裁掉一小块,对应的原始区域就永远找不回来了。
4.4 和像素置乱方法做一个简单对比
这里给一个直观的对比表格,方便写结题报告时直接用:
| 评估项 | 像素置乱 | 异或加密 | DRPE(本文方法) |
|---|---|---|---|
| 加密后视觉形态 | 图案乱码 | 噪声 | 白噪声(复值) |
| 相邻像素相关性 | 降低但残留纹理 | 明显降低 | 接近0 |
| 频域统计特征 | 保留原图幅度谱 | 仍可提取统计特征 | 已被完全摊平 |
| 密钥空间 | 置换表组合数 | 有限(受值域限制) | 连续相位域,超大 |
| 密钥敏感性 | 低 | 中 | 极高 |
| 抗裁剪能力 | 差 | 差 | 中(信息散布) |
| 是否可完美无损解密 | 是 | 是 | 是(数值仿真下) |
4.5 中间视觉结果怎么呈现
写报告或论文时,最好把一组结果放在一起:原图、密文幅度图、密文相位图、错误密钥解密图、正确密钥解密图。这五张图并排就能讲清楚全部故事。额外建议你把明文和密文的直方图也画出来对比,明文直方图有明显峰值和分布规律,密文直方图则接近均匀分布,这又是一个量化证据。
5. 实际项目中我踩过的坑与参数选择建议
5.1 固定随机种子与可复现性
第一坑:忘记固定随机种子。相位掩膜是rand生成的,如果不设rng(seed),每次运行都会生成不同的密钥。一轮跑出来加密效果很好,关闭脚本再打开,前面所有结果都无法复现,特别是论文里的图,重新跑一遍图全变了。
建议是:在生成掩膜之前固定种子,比如rng(2024),并且在代码注释里写清楚“这个seed就是密钥的一部分”或者“seed只是用于复现实验,正式使用时应从安全随机源生成”。如果是做加密系统,掩膜应该由安全的随机数源生成,而不是固定种子;固定种子只适合演示和复现。
5.2 图像大小和矩形图像的处理
第二个坑:FFT对尺寸没有严格要求,但补零会改变频域分辨率。有些教程建议先把图像填成2的幂,比如256×256补到512×512再加密,理由是“FFT更快”。实际上现代Matlab的fft2对任意尺寸都做了优化,补零反而改变了图像的周期延拓特性,影响频域相位分布。除非有特殊需要,我建议保持原始尺寸直接加密,这样明文和密文的尺寸保持一致,直观上更好理解。
如果原始图像不是正方形,比如800×600,代码里的rand(M,N)仍然正常工作,只是两个掩膜也是800×600,整个方法完全不受影响。所以不需要特意把图像改成正方形。
5.3 解密时忘记取实部
第三个坑在还原的最后一步只做了d1.*conj(phase1),忘了取实部,然后直接imshow会得到一片奇怪的干涉图。原因是数值计算中即使理论解是纯实数,浮点运算也会留下很小的虚部误差。正确做法是real(...)取实部,再im2double已经在前面做了,所以显示时用imshow(I_rec)即可,不需要再加[]缩放。
5.4 关于“量化到0-255再保存”的现实代价
如果要模拟真实传输,需要把密文的实部和虚部分开量化保存。这一步引入的量化误差会让正确密钥下的PSNR降到30dB左右,而不是理论上的300多点dB。这很正常,不要以为自己代码写错了。我这里给一个最小实现:
matlab复制% 把密文拆成幅度和相位并量化
amp = mat2gray(abs(cipher));
pha = mat2gray(angle(cipher));
imwrite(amp, 'cipher_amp.png');
imwrite(pha, 'cipher_pha.png');
% 从量化后的图恢复复数密文
amp_r = im2double(imread('cipher_amp.png'));
pha_r = im2double(imread('cipher_pha.png'));
cipher_q = amp_r .* exp(1i * 2 * pi * pha_r);
注意这里相位量化步长是1/255,引入的相位误差远大于幅度误差,对解密质量影响更大。如果对质量有较高要求,可以把相位用更多bit去量化,比如用16位PNG存储,解密后PSNR能有明显提升。
5.5 彩色图像的扩展思路
这个算法本身是给灰度图像设计的,但扩展到彩色图像并不复杂。可以把RGB三个通道分别做DRPE加密,三个通道各自使用独立生成的相位掩膜,效果上相当于把整幅彩色图像的颜色信息分通道打散。也可以用YCbCr变换把亮度色度分离,只加密亮度分量,这个在需要减小密文数据量的场景比较常用。做毕设的同学完全可以往这个方向扩展:彩色图像、三通道独立密钥,再讨论通道间串扰和密钥管理问题,工作量也够。
我之前实际做完这一整套之后又试了把混沌序列引入掩膜生成,用Logistic映射替代纯随机数,这样密钥只要一个初值x0和一个参数μ,密钥存储和分发就方便多了,代价是掩膜的随机性不再是最优的均匀分布,需要保证混沌序列的分布足够均匀。这个方向现在论文也不少,适合作为后续研究切入点。
最后说点实在的
DRPE这套方法真正打动我的地方,是它让我第一次直观理解了“为什么频域相位重要”——不需要啃一堆公式,只要在Matlab里跑一遍加密解密,看一眼中间结果图,所有关于相位、频谱、掩膜的概念一下就通透了。用一句话总结我的经验:这个算法是图像加密入门最值得手写一遍的,因为代码量不大、数学结构清晰、可视化效果好,做完你会发现傅立叶变换不再是抽象的公式,而是看得见摸得着的工具。
如果你自己动手跑,建议先把上面完整脚本原样复制运行,再试着改两个参数:一个是换一张自有图片,一个是把错误密钥的扰动幅度从0.01改成0.5看结果变化。改完这两个地方,你对这套算法的理解就和只会复制代码的同学拉开差距了。
