WEB开发网: 计算机世界尽管现在越来越多地试图使用unicode这一世界语来说话,但还是存在着gb2312,shift-jis这样的方言,使用MSXML DOM就会清楚地体会到方言的不便。 我想将下面这个文本文档
赞助商链接
中资源
>> 最新文章
>> 赞助商
>> 热门文章
WEB开发网文章阅读

从字符文档到xml文档

作者:未知 文章来源:WEB开发网 更新时间:2007-11-3 7:56:08

    计算机世界尽管现在越来越多地试图使用unicode这一世界语来说话,但还是存在着gb2312,shift-jis这样的方言,使用MSxml(标准化越来越近了) DOM就会清楚地体会到方言的不便。
    我想将下面这个文本文档直接存为转换成xml(标准化越来越近了),是否OK,答案是NG(No Good)
strxml(标准化越来越近了)="<?xml(标准化越来越近了) version=""1.0"" encoding=""GB2312""?><xml(标准化越来越近了)>这里是一些编码为GB2312的xml(标准化越来越近了)文档</xml(标准化越来越近了)>"
Set domxml(标准化越来越近了) = New DOMDocument
domxml(标准化越来越近了).loadxml(标准化越来越近了) strxml(标准化越来越近了)
If domxml(标准化越来越近了).parseError Then Debug.Print domxml(标准化越来越近了).parseError.reason Else Debug.Print domxml(标准化越来越近了).xml(标准化越来越近了)
    执行这段代码会返回Switch from current encoding to specified encoding not supported.(不支持从当前编码转换到指定的编码)这样的错误信息。为什么会这样呢?Chris Lovett说:[Loadxml(标准化越来越近了) 方法总是采用只在 UCS-2 或 UTF-16 中编码的 Unicode BSTR。如果将非有效的 Unicode BSTR 的内容传递给 Loadxml(标准化越来越近了),则加载会失败。]
    因此我们不得不只加载没有用"方言"的文档给DOMDocument对象。将<?xml(标准化越来越近了) version="1.0" encoding="GB2312"?>去掉,这样的话strxml(标准化越来越近了)将作为unicode字符串交给dom处理。
strxml(标准化越来越近了)="<xml(标准化越来越近了)>这里是一些编码为GB2312的xml(标准化越来越近了)文档</xml(标准化越来越近了)>"
   看到上面的用法,热爱自己语言的人们也许会大骂ms的。
   如果对这一问题深入研究一下,其实我们完全能做到将带有方言标志的文档直接加载到dom上,我编了一个小函数解决之一问题。
Private Function Str2xml(标准化越来越近了)(strOri As String) As DOMDocument
Dim xml(标准化越来越近了)Doc As DOMDocument
Set xml(标准化越来越近了)Doc = New DOMDocument
Dim pi() As Byte
pi() = StrConv(strOri, vbFromUnicode)
xml(标准化越来越近了)Doc.Load pi
Set Str2xml(标准化越来越近了) = xml(标准化越来越近了)Doc
End Function
我们用如下代码试一下
Set domxml(标准化越来越近了) = New DOMDocument
Set domxml(标准化越来越近了) = Str2xml(标准化越来越近了)(strxml(标准化越来越近了))
If domxml(标准化越来越近了).parseError Then Debug.Print domxml(标准化越来越近了).parseError.reason Else Debug.Print domxml(标准化越来越近了).xml(标准化越来越近了)
   就会发现正确输出了带<?xml(标准化越来越近了) version="1.0">标志的xml(标准化越来越近了)文档。但你如果用这个函数处理不带"方言"标志的文档可能会出现下面的错误
An Invalid character was found in text content.(在文本内容里存在非法字符)对于这个问题我也是在写这篇文章的时候才发现,我想在将一个text文档转换为xml(标准化越来越近了)文档的时候应该先检查一下语言标志吧。如果说方言交给我的函数去做,说世界语的就让他说吧。
Str2xml(标准化越来越近了)函数的原理是什么呢?
从下面Chris Lovett的描述里我想大家不难作出解释。
Load 方法可将以下内容当作 VARIANT:
1,(URL):如果 VARIANT 是 BSTR,则将其理解为 URL。
2,(VT_ARRAY 或 VT_UI1): VARIANT 也可以是包含原始编码字节的 SAFEARRAY。
3,(IUnknown): 如果 VARIANT 是 IUnknown 接口,则 DOM 文档为 IStream、IPersistStream 和 IPersistStreamInit 调用 QueryInterface。
   在msdn里没有提及load的非url应用,只是在ms的例子里能看到一些端倪,而且也是怪怪的。我的这篇文章也许可以称为msxml(标准化越来越近了) inside文章了吧。
   顺便提一下用xml(标准化越来越近了)http发到server上的数据在转化为xml(标准化越来越近了)文档的时候就使用了load的这一用法。
// Load the posted xml(标准化越来越近了) data and save it to disk.
xml(标准化越来越近了)doc.load(Request);
   大家不觉的load(Request)的用法怪怪的吗?
   其实我们分析一下用Request.BinaryRead读到的内容就会明白了。那就是文本文档的SafeArray形式,一切没有什么神秘的。
   建议大家读〈xml(标准化越来越近了) 数据的编码方式〉的中文版本。

百度搜索中共有相关主题
[阅读:次] [返回上一页] [打 印]
  • 相关文章
  • 本类热门