您现在的位置： 365建站网 > 365文章 > php/javascript中urlencode编码转化的用法

php/javascript中urlencode编码转化的用法

文章来源：365jz.com 点击数：683 更新时间：2017-12-30 16:55 参与评论

URLEncode：是指针对网页url中的中文字符的一种编码转化方式，最常见的就是Baidu、Google等搜索引擎中输入中文查询时候，生成经过Encode过的网页URL。

URLEncode的方式一般有两种，一种是传统的基于GB2312的Encode（Baidu、Yisou等使用），另一种是基于UTF-8的Encode（Google、Yahoo等使用）。

本工具分别实现两种方式的Encode与Decode:

中文 -> GB2312的Encode -> %D6%D0%CE%C4

中文 -> UTF-8的Encode -> %E4%B8%AD%E6%96%87

Html中的URLEncode：

编码为GB2312的html文件中：http://s.365jz.com/中文.rar -> 浏览器自动转换为 -> http://s.365jz.com/%D6%D0%CE%C4.rar

注意：Firefox对GB2312的Encode的中文URL支持不好，因为它默认是UTF-8编码发送URL的，但是ftp://协议可以，我试过了，我认为这应该算是Firefox一个bug。

编码为UTF-8的html文件中：http://s.365jz.com/中文.rar -> 浏览器自动转换为 -> http://s.365jz.com/%E4%B8%AD%E6%96%87.rar

JavaScript中的URLEncode：

如：%E4%B8%AD%E6%96%87-_.%20%E4%B8%AD%E6%96%87-_.%20

encodeURI不对下列字符进行编码：“:”、“/”、“;”、“?”、“@”等特殊字符。

前段时间说自己遇到了个《URL加号引发错误》的BUG，引起这个bug的原因就是自己在URL中使用了 urlencode 函数，该函数会把空格转换成加号，这样就导致URL解析出错，而空格只有转换成 %20 才可以可以正常解析，这时我们就需要使用 rawurlencode 函数。

下面就介绍一下 urlencode 函数与 rawurlencode 函数的区别：

urlencode 函数：

返回字符串，此字符串中除了 -_. 之外的所有非字母数字字符都将被替换成百分号（%）后跟两位十六进制数，空格则编码为加号（+）。此编码与 WWW 表单 POST 数据的编码方式是一样的，同时与 application/x-www-form-urlencoded 的媒体类型编码方式一样。由于历史原因，此编码在将空格编码为加号（+）方面与 RFC1738 编码（参见 rawurlencode()）不同。

rawurlencode 函数：

返回字符串，此字符串中除了 -_. 之外的所有非字母数字字符都将被替换成百分号（%）后跟两位十六进制数。这是在 » RFC 3986 中描述的编码，是为了保护原义字符以免其被解释为特殊的 URL 定界符，同时保护 URL 格式以免其被传输媒体（像一些邮件系统）使用字符转换时弄乱。下面我们来看一下例子：

<?php

$string = "hello world";

echo urlencode($string) . '<br/>'; //输出：hello+world
echo rawurldecode($string) . '<br/>';//输出：hello%20world

?>

具体例子比较：

<?php
for ($i = 0x20; $i < 0x7f; $i++) { 
$str .= dechex($i); 
}

$asscii = pack("H*",$str); 
echo "所有的可打印的asscii字符：（从空格到~）n". $asscii."\n"; 
echo "urlencode 的结果：\n".urlencode($asscii); 
echo "\n"; 
echo "urlencode 不做编码的字https://www.365jz.com/符：\n".preg_replace("/%.{2}/","",urlencode($asscii)); 
echo "\n"; 
echo "rawurlencode 的结果：\n".rawurlencode($asscii); 
echo "\n"; 
echo "rawurlencode 不做编码的字符：\n".preg_replace("/%.{2}/","",rawurlencode($asscii)); 
echo "\n";

exit;
?>

输出结果：
———————————————————————————
所有的可打印的asscii字符：（从空格到~）
!"#$%&'()*+,-./0123456789:;<=>?@ABCDEFGHIJKLMNOPQRSTUVWXYZ[\]^_abcdefghijklmnopqrstuvwxyz{|}~
urlencode 的结果：
+%21%22%23%24%25%26%27%28%29%2A%2B%2C-.%2F0123456789%3A%3B%3C%3D%3E%3F%40ABCDEFGHIJKLMNOPQRSTUVWXYZ%5B%5C%5D%5E_%60abcdefghijklmnopqrstuvwxyz%7B%7C%7D%7E
urlencode 不做编码的字符：
+-.0123456789ABCDEFGHIJKLMNOPQRSTUVWXYZ_abcdefghijklmnopqrstuvwxyz
rawurlencode 的结果：
%20%21%22%23%24%25%26%27%28%29%2A%2B%2C-.%2F0123456789%3A%3B%3C%3D%3E%3F%40ABCDEFGHIJKLMNOPQRSTUVWXYZ%5B%5C%5D%5E_%60abcdefghijklmnopqrstuvwxyz%7B%7C%7D%7E
rawurlencode 不做编码的字符：
-.0123456789ABCDEFGHIJKLMNOPQRSTUVWXYZ_abcdefghijklmnopqrstuvwxyz

比较二者的结果：

1. 数字、大小写字母都不编码
2. 减号、点号、下划线三个不编码
3. rawurlencode比urlencode多编码一个”加号“

关于JavaScript中escape与encodeURIComponent的区别：

>>> console.log(encodeURIComponent("统一注册1"));

%E7%BB%9F%E4%B8%80%E6%B3%A8%E5%86%8C1
>>> console.log(escape("统一注册1"));
%u7EDF%u4E00%u6CE8%u518C1

<?php
echo iconv("utf-8","gbk",urldecode("%E7%BB%9F%E4%B8%80%E6%B3%A8%E5%86%8C1")); 
echo "\n"; 
echo urldecode("%u7EDF%u4E00%u6CE8%u518C1"); 
// 使用下面的unescape可以
//echo iconv("utf-8","gbk",unescape("%u7EDF%u4E00%u6CE8%u518C1"); 
exit;
?>

输出结果：
======================================
统一注册1
%u7EDF%u4E00%u6CE8%u518C1
======================================

结果说明：

1. encodeURIComponent 总是把输入转换成utf8编码处理的，按字节编码

2. escape是按照unicode编码处理的，因为它也对url中不安全的字符做了编码，所以也可以在url中做编码使用，但是，服务器端不会自动解码，下面提供一个PHP版的解码函数，是用手册里找的：

<?php

function unescape($str) { 
  $str = rawurldecode($str); 
  preg_match_all("/(?:%u.{4})|&#x.{4};|&#d+;|.+/U",$str,$r); 
  $ar = $r[0]; 
  foreach($ar as $k=>$v) { 
    if(substr($v,0,2) == "%u") 
      $ar[$k] = iconv("UCS-2","UTF-8",pack("H4",substr($v,-4))); 
    elseif(substr($v,0,3) == "&#x") 
      $ar[$k] = iconv("UCS-2","UTF-8",pack("H4",substr($v,3,-1))); 
    elseif(substr($v,0,2) == "&#") { 
      $ar[$k] = iconv("UCS-2","UTF-8",pack("n",substr($v,2,-1))); 
    } 
  } 
  return join("",$ar); 
}

?>

 

>>> console.log(escape(" !\"#$%&'()*+,-./0123456789:;=>?@ABCDEFGHIJKLMNOPQRSTUVWXYZ[\]^_abcdefghijklmnopqrstuvwxyz{|}~"));
%20%21%22%23%24%25%26%27%28%29*+%2C-./0123456789%3A%3B%3C%3D%3E%3F@ABCDEFGHIJKLMNOPQRSTUVWXYZ%5B%5D%5E_%60abcdefghijklmnopqrstuvwxyz%7B%7C%7D%7E
>>> console.log(encodeURIComponent("!\"#$%&'()*+,-./0123456789:;<=>?@ABCDEFGHIJKLMNOPQRSTUVWXYZ[\]^_abcdefghijklmnopqrstuvwxyz{|}~"));
%20!%22%23%24%25%26'()*%2B%2C-.%2F0123456789%3A%3B%3C%3D%3E%3F%40ABCDEFGHIJKLMNOPQRSTUVWXYZ%5B%5D%5E_%60abcdefghijklmnopqrstuvwxyz%7B%7C%7D~
>>> console.log(escape("!\"#$%&'()*+,-./0123456789:;<=>?@ABCDEFGHIJKLMNOPQRSTUVWXYZ[\]^_abcdefghijklmnopqrstuvwxyz{|}~").replace(/%.{2}/g,""));

*+-./0123456789@ABCDEFGHIJKLMNOPQRSTUVWXYZ_abcdefghijklmnopqrstuvwxyz
>>> console.log(encodeURIComponent("!\"#$%&'()*+,-./0123456789:;<=>?@ABCDEFGHIJKLMNOPQRSTUVWXYZ[\]^_`abcdefghijklmnopqrstuvwxyz{|}~").replace(/%.{2}/g,""));
!'()*-.0123456789ABCDEFGHIJKLMNOPQRSTUVWXYZ_abcdefghijklmnopqrstuvwxyz~

结果比较：

escape未编码的字符： *+-./@_ 共7个

encodeURIComponent未编码的字符： !'()*-._~ 共9个

在使用url进行参数传递时，经常会传递一些中文名（或含有特殊字符）的参数或URL地址，在后台处理时会发生转换错误。在有些传递页面使用GB2312，而在接收页面使用UTF8，这样接收到的参数就可能会与原来发生不一致。使用服务器端的 urlEncode函数编码的URL，与使用客户端javascript的encodeURI函数编码的URL，结果就不一样。javascript对文字进行编码涉及3 个函数： escape,encodeURI,encodeURIComponent，相应 3 个解码函数： unescape,decodeURI,decodeURIComponent

javaScript中的编码方法：
escape () 方法：采用ISO Latin字符集对指定的字符串进行编码。所有的空格符、标点符号、特殊字符以及其他非ASCII字符都将被转化成%xx格式的字符编码（xx等于该字符在字符集表里面的编码的16进制数字）。比如，空格符对应的编码是%20。unescape方法与此相反。不会被此方法编码的字符： @ * / +
encodeURI ()方法：把URI字符串采用UTF-8编码格式转化成escape格式的字符串。不会被此方法编码的字符：! @ # $& * ( ) = : / ; ? + '
encodeURIComponent ()方法：把URI字符串采用UTF-8编码格式转化成escape格式的字符串。与encodeURI()相比，这个方法将对更多的字符进行编码，比如 / 等字符。所以如果字符串里面包含了URI的几个部分的话，不能用这个方法来进行编码，否则 / 字符被编码之后URL将显示错误。不会被此方法编码的字符：! * ( )
因此，对于中文字符串来说，如果不希望把字符串编码格式转化成UTF-8格式的（比如原页面和目标页面的charset是一致的时候），只需要使用escape。如果你的页面是GB2312或者其他的编码，而接受参数的页面是 UTF-8编码的，就要采用encodeURI或者encodeURIComponent。

另外，encodeURI/encodeURIComponent是在javascript1.5之后引进的，escape则在javascript1.0版本就有。
1、传递参数时需要使用 encodeURIComponent，这样组合的 url 才不会被 # 等特殊字符截断。例如：<script language="javascript">document.write('<a href="http://passport.baidu.com/?logout&aid=7&u='+encodeURIComponent ("http://cang.baidu.com/bruce42")+'">退出 </a>');</script>
2、进行 url跳转时可以整体使用 encodeURI。例如：Location.href=encodeURI ("http://cang.baidu.com/do/s?word=百度 &ct=21");
3、 js 使用数据时可以使用escape 。例如：搜藏中history 纪录。
4、 escape对 0-255 以外的unicode 值进行编码时输出 %u**** 格式，其它情况下escape ， encodeURI ， encodeURIComponent编码结果相同。

最多使用的应为encodeURIComponent ，它是将中文、韩文等特殊字符转换成utf-8 格式的 url 编码，所以如果给后台传递参数需要使用encodeURIComponent 时需要后台解码对 utf-8 支持（form 中的编码方式和当前页面编码方式相同）

escape不编码字符有 69 个： *， + ， - ， . ， / ， @ ， _ ， 0-9 ， a-z ，A-Z
encodeURI不编码字符有 82 个： !， # ， $ ， & ， ' ， ( ， ) ， * ， + ， , ， - ， . ， / ， : ， ; ， = ， ? ， @ ， _ ， ~ ， 0-9， a-z ， A-Z
encodeURIComponent不编码字符有 71 个： !， ' ， ( ， ) ， * ， - ， . ， _ ， ~ ， 0-9 ， a-z ，A-Z

以下是url中可能用到的特殊字符及在url中的经过编码后的值：（略）
项目中发现，直接对url中的参数部分做encodeURI() 编码转换，后台servlet通过getParamater（）获取时，不需要转换可以直接获取到正确的值。说明：参数没有用到中文，框架用的是struts框架

如对本文有疑问，请提交到交流论坛，广大热心网友会为你解答！！点击进入论坛

您可能感兴趣的文章:

发表评论 (683人查看，0条评论): 请自觉遵守互联网相关的政策法规，严禁发布色情、暴力、反动的言论。

昵称：

最新评论

------分隔线----------------------------

上一篇：php/javascript日期转时间戳,指定日期转换成时间戳
下一篇：Server.UrlEncode与HttpUtility.UrlEncode的用法区别

大家感兴趣的内容

php/javascript中urlencode编码转化的用法

您可能感兴趣的文章:

公司信息

快速入口

其它栏目

业务咨询