IT数码 购物 网址 头条 软件 日历 阅读 图书馆
TxT小说阅读器
↓语音阅读,小说下载,古典文学↓
图片批量下载器
↓批量下载图片,美女图库↓
图片自动播放器
↓图片自动播放器↓
一键清除垃圾
↓轻轻一点,清除系统垃圾↓
开发: C++知识库 Java知识库 JavaScript Python PHP知识库 人工智能 区块链 大数据 移动开发 嵌入式 开发工具 数据结构与算法 开发测试 游戏开发 网络协议 系统运维
教程: HTML教程 CSS教程 JavaScript教程 Go语言教程 JQuery教程 VUE教程 VUE3教程 Bootstrap教程 SQL数据库教程 C语言教程 C++教程 Java教程 Python教程 Python3教程 C#教程
数码: 电脑 笔记本 显卡 显示器 固态硬盘 硬盘 耳机 手机 iphone vivo oppo 小米 华为 单反 装机 图拉丁
 
   -> PHP知识库 -> php检测utf8mb4字符的方法与清理方法 -> 正文阅读

[PHP知识库]php检测utf8mb4字符的方法与清理方法

/**
 * 字符串基础工具
 * @author JerryLi
 * @version 20210724
 */
class StringBaseTool{
    /**
     * 截断字符串,保持固定的暂用字节长度
     * @param string $sStr 源字符串
     * @param int $iMaxLen 保留字节长度
     * @param string $sRepStr 替换字符串
     * @return string
     */
    static public function cutStrKeepByte(string $sStr, int $iMaxLen, string $sRepStr='...'): string{
        $iReplen = strlen($sRepStr);
        if (strlen($sStr) > $iMaxLen){ //字节数数超长,需要裁剪
            $iMaxLen -= $iReplen; //保留拖尾替换字符长度
            $aBuf = [];
            $iByteLen = 0;
            for ($i=0,$iLoop=mb_strlen($sStr); $i<$iLoop; $i++){
                $sChr = mb_substr($sStr, $i, 1); //每次取一个字
                if (($iByteLen + strlen($sChr)) <= $iMaxLen){ //未到执行长度,继续追加
                    $aBuf[] = $sChr;
                    $iByteLen += strlen($sChr); //长度计数
                }else{ //长度符合结束提取
                    return implode($aBuf) . $sRepStr;
                }
            }
        }
        return $sStr; //原样返回
    }
    /**
     * 清理字符串内的utf8mb4字符集
     * @param string $sSrc 原始数据
     * @param string $sReplace 替换符
     * @return string
     */
    static public function clearUtf8mb4(string $sSrc, string $sReplace='?'): string{
        return preg_replace(
            '%(?:
                \xF0[\x90-\xBF][\x80-\xBF]{2}      # planes 1-3
                | [\xF1-\xF3][\x80-\xBF]{3}          # planes 4-15
                | \xF4[\x80-\x8F][\x80-\xBF]{2}      # plane 16
            )%xs', $sReplace, $sSrc);
    }
    /**
     * 检查是否包含utf8mb4字符集
     * @param string $sSrc 原始数据
     * @return bool
     */
    static public function isExistUtf8mb4(string $sSrc): bool{
        return preg_match(
                '%(?:
                \xF0[\x90-\xBF][\x80-\xBF]{2}      # planes 1-3
                | [\xF1-\xF3][\x80-\xBF]{3}          # planes 4-15
                | \xF4[\x80-\x8F][\x80-\xBF]{2}      # plane 16
            )%xs', $sSrc) > 0;
    }
}

字节上代码,原理就不细说了,都是生产环境的代码。

isExistUtf8mb4 用来检测是否包含Utf8mb4字符。clearUtf8mb4用来清理Utf8mb4字符。

顺便补个原理吧:11110xxx 10xxxxxx 10xxxxxx 10xxxxxx,即最高字节具有240或更高的值.如果字符串中有任何这样的字节,则它是4字节序列的指示符,发现这种结构的标志就可以认为是utf8mb4.

  PHP知识库 最新文章
Laravel 下实现 Google 2fa 验证
UUCTF WP
DASCTF10月 web
XAMPP任意命令执行提升权限漏洞(CVE-2020-
[GYCTF2020]Easyphp
iwebsec靶场 代码执行关卡通关笔记
多个线程同步执行,多个线程依次执行,多个
php 没事记录下常用方法 (TP5.1)
php之jwt
2021-09-18
上一篇文章      下一篇文章      查看所有文章
加:2021-07-25 11:26:31  更:2021-07-25 11:26:48 
 
开发: C++知识库 Java知识库 JavaScript Python PHP知识库 人工智能 区块链 大数据 移动开发 嵌入式 开发工具 数据结构与算法 开发测试 游戏开发 网络协议 系统运维
教程: HTML教程 CSS教程 JavaScript教程 Go语言教程 JQuery教程 VUE教程 VUE3教程 Bootstrap教程 SQL数据库教程 C语言教程 C++教程 Java教程 Python教程 Python3教程 C#教程
数码: 电脑 笔记本 显卡 显示器 固态硬盘 硬盘 耳机 手机 iphone vivo oppo 小米 华为 单反 装机 图拉丁

360图书馆 购物 三丰科技 阅读网 日历 万年历 2024年4日历 -2024/4/29 19:56:28-

图片自动播放器
↓图片自动播放器↓
TxT小说阅读器
↓语音阅读,小说下载,古典文学↓
一键清除垃圾
↓轻轻一点,清除系统垃圾↓
图片批量下载器
↓批量下载图片,美女图库↓
  网站联系: qq:121756557 email:121756557@qq.com  IT数码