10453 次阅读
4 条回复
世界语到汉语和英语的自动翻译试验 宋健宇语言交流
世界语到汉语和英语的自动翻译试验
--EChA机器翻译系统概述
0. 本文是我在导师刘涌泉和刘倬先生指导下所做的毕业设计的论文总结. 共分十大部分:
1. EChA概况: 系统流程图;
2. 世界语: 语言学特点及其研究价值;
3. 层次递归成分体系CDC: 体现独立分析结果的EChA中间语言;
4. EChA机器词典, 句子加工场格式;
5. 世界语形态分析: 削尾算法, 关于削缀问题的讨论;
6. 句法分析第一线: 虚词处理, 规则和规则分开的讨论;
7. 句法分析第二线: CDC的求解, 中间结果分析;
8. 英语形态生成, 汉语形态修辞, 原语和译语对比差异的一般总结, 多义区分例释;
9. 调序: 自底而上加工;
10. EChA试验结果分析, 汉语和英语的机译文的比较, 关于文学作品可不可以跟机器翻译结合的问题, 修辞的讨论.
1. EChA概况
EChA (E-Ch/A: el Esperanto en la Chinan kaj Anglan Lingvojn) 系统是以世界语作为源语, 以汉语和英语作为目标语的一对多小型实验系统。它是一个句对句的, 分析和综合有一定独立性的全文机器翻译系统。本系统实现了翻译过程的完全自动化,不需要译前和译后编辑。(由于纯技术原因, 世界语中的几个戴帽字母暂时还需要用加 H 的复合字母来转写.) EChA系统从上机调试到打出译文只用了五个月, 全部工作历时近一年, 进展比较顺利。本系统使用的是IBM-PC/XT微型机, 编程语言 BASIC (Version D2.00), 同时选用IBM公司的BASIC编译程序软件包。EChA由CCDOS操作系统(即带有汉字库的PC DOS 2.10)支持。系统主体是六线分析和综合程序。另外还建立了三部词典, 两个词表, 编制了词典的造查, 扩充和维护程序。整个系统由近一万条BASIC语句构成。编程时充分利用了BASIC串处理函数, 显得特别方便。
这次试验共翻译了150多句世界语文句。汉语和英语的机器译文都通顺或可懂, 结果令人满意。(见附录) 提供本系统试验的源语素材有三部分: 第一部分是选自著名世界语作家Sandor Szhatmari的世界语原文著作 "Mashinmondo" (<<机器世界>>, 中国展望出版社)上的两段连续文章(12句, P.100-101), 句子比较长, 结构也比较复杂。第二部分选自魏原枢和徐文琪编著的 <<世界语语法>> (上海外语教育出版社, 1982.10)中的典型例句(100多句), 这些例句(其中有一部分是日常用语)都具有一定的语言学特点, 表现了不同时态(简单时态,复合时态), 语态(主动语态, 被动语态), 语式(陈述语式, 命令语式, 假定语式),不同的句式(简单句, 并列句, 复合句, 无主句, 独词句, 一般疑问句, 特殊疑问句, 等等),不同的句型以及动词的各种形式。总之, 它们具有相当的代表性, 基本上反映了世界语语法概貌, 这就弥补了连续文句特点单一的不足, 更有利于试验EChA系统的能力和适应性。最后作为一种尝试,还选译了两首世界语诗歌(第一首是著名的世界语者的颂歌“希望之歌”)。
EChA由三大部分组成: 1) 机器词典; 2) 源语分析; 3) 目标语生成。源语分析部分包括了世界语的全部基本语法和常用句型。然而, 由于机器条件和实验周期的限制, 本系统的规模(特别是词典的规模)还很小, 有待于进一步扩充和改进。----准备从两方面来扩充EChA系统, 一是补充例句, 做扩大试验; 二是增加俄语和法语作为新的目标语, 进一步检验体现独立分析结果的中间语言CDC(层次递归成分体系, 第3节详述)的适应范围, 并探讨其完善的途径。另外, 时间仓促给系统还带来一些问题: EChA的结构还不是很合理, 算法有待于进一步优化, 规则和算法还没能分开, 在分析和综合的独立性上下了不少功夫, 但还没有完全独立。
尽管还有上述问题, 然而按照设计要求, 只要适当扩充词典, 系统就有能力处理世界语的绝大多数语言现象。在中国近三十年的机器翻译研究历史中, EChA是第一个以世界语为研究对象的机译系统。在世界语跟机器翻译结合的过程中, EChA是一个成功的尝试和良好的开端。我们热切希望得到专家学者, 世界语同志们的帮助和指导。
EChA系统流程图
______丨________
/ 原文输入 丨
/________________丨
_______________________丨______________________
词 丨 1. 削尾, 查词典(实词词典, 虚词词典, 成语词典, 丨
典 丨 词类词义区分表) 丨
(形态分析) 丨______________________________________________丨
------------------- _______________________丨_______________________
句 丨 2. 连词标点, 切分, 其他虚词 丨
法 丨______________________________________________丨
分 _______________________丨_______________________
析 丨 3. 中间语言CDC的求解 丨
丨______________________________________________丨
------------------- _______________________丨_______________________
丨 4. 多义词区分; 英语形态生成及汉语形态修辞; 查 丨
目 丨 英语不规则词词表 丨
标 丨______________________________________________丨
语 _______________________丨_______________________
生 丨 5. 英语调序 丨
成 丨_______________________________________________丨
_______________________丨_______________________
丨 6. 汉语调序及其他修辞 丨
丨_______________________________________________丨
_________丨_________
丨 译文输出 丨
丨__________________丨
源语文句输入以后, 作第一遍扫描。首先判定加工词长度是否大于三。若大于三, 转子程序削尾后查实词词干词典, 否则查虚词词典。因为世界语虚词(无词尾变化)大多短小, 以三为界限最合理, 可以大大减少虚查次数。词典查不着的作生词处理, 削尾信息保留。查完词典及词表以后, 把削尾信息和词典信息移到计算机内存中所开辟的句子加工场。
句法分析确定源语文句的层次结构和句法关系。分析结果以一种高度形式化的层次递归成分体系CDC来体现。CDC是独立于目标语的机器翻译中间语言, 这种独立性对于一对多机译系统是必要的。CDC由形态, 成分, 节点, 分布, 链号和层次几部分信息构成。它不但揭示了源语文句的正确的句法树, 而且还包含了其它的有用的信息。事实上, 它为建立多目标语的生成系统奠定了良好的基础。
句法分析第一线处理虚词, 中心任务是加工连词和标点, 正确切分语段。原则上为每一个虚词编制一套分析规则。世界语虚词数量很有限, 但用法较多, 具有民族语功能词的类似的复杂性, 是语言个性的集中表现, 所以分别加工比较适宜, 这也有利于规则跟规则分开。该线加工任务很重, 特别是连词KAJ和KE, 分析规则十分复杂。在很大程度上, 虚词分析对了, 句法关系也就清楚了。因此, 集中力量编制一套完备的针对具体虚词的分析系统, 对于世界语类型的机器翻译至关重要。该线正确处理了虚词个性现象, 便可以保证下一线分析的充分抽象性和概括性, 这样做对于象世界语这样的科学而规则的语言显得特别有利。句法分析第二线运用自顶而下的方法, 从句子的谓语轴心(第一层)着手, 一层一层往下递归加工, 直到最末层(终结节点层)。加工过程就是不断递归调用各子程序的过程。其中以动词子程序为核心, 它充分反映了世界语语法的基本内容及其高度规则性。分析完毕得出一条对应于源语文句的中间语言CDC的链。
综合第一线做英语形态生成和汉语形态修辞。英语形态并不发达, 所以世英的形态转换规则也不复杂。汉语缺乏形态, 一般用适当的虚词(助词, 副词等)来代替。我们把多义词区分规则也放在这一线, 这是因为多义区分的条件至此已经具备。一般来说, 根据多义词及其联系词的CDC成分和语义特征就可以得出该词的正确义项。综合第二线和第三线分别做英语调序和汉语调序。调序信息由CDC结合目标语语法规律得出, 调序的方法是自底而上, 层层归约, 这样就不至于调乱。我们知道, 世界语语序极为灵活自由, 而汉语语序却很固定, 所以生成汉语的主要任务是调序。对于英语, 调序的任务较轻, 主要是保证文句主干 "主谓宾" 次序不乱。英语名词没有主宾格的区分, 所以关键是把前置宾语移到动词之后。"世界语是印欧语系的一个合理化的公分母", 与英语相似处毕竟很多, 比如同一句法层次的定语或状语的内部调序, 在译汉语时是一个难题, 而在印欧系诸语言中则不是大问题。另外修辞加工的过程也可以免了。(世英转换中的成语和多义现象较之世汉转换也少得多。)总之, 英语生成比汉语生成容易许多。
EChA虽然是个不大的系统, 但是内容比较丰富。它既有形态分析, 又有形态生成, 也有调序和修辞, 还有自己的一套成分体系。我们在总体设计时, 已经考虑到增加新的不同类型的目标语扩充该系统的需要。可以预计, 如果增加两线俄语和法语的生成程序(主要是形态生成), 分析部分稍作改动(主要是充实与综合还没有完全独立开来的虚词分析规则), 就可以实现崐世到汉/英/法/俄的自动翻译。总之, 实用机译系统所能遇到的问题, EChA几乎都已涉及, 而且主体六线程序各个有自己的特色, 是个有相当代表性的一对多全自动机译模型。
2. 世界语: 语言学特点及其研究价值
在进入EChA系统的细节和探讨机器翻译的一般理论和方法之前, 我们专列这一节讨论世界语本身, 这对说明本系统的设计思想和具体方法是很必要的。毫无疑问, 我们的讨论主要是从语言学角度着眼。
世界语(Esperanto)是波兰的语言大师柴门霍夫博士( L.L.Zamenhof 1859.12.15 - 1917.4.14 )于1887年在印欧语系的基础上经过艰苦研究提出的一个人造语方案。由于其科学, 简明, 逻辑性强, 由于日益增长的克服语言障碍的国际需要, 也由于其维护世界和平, 增进各民族相互了解, 实现世界大同的崇高理想的感召, 它逐渐为人们所接受。目前, 世界上有2000多万人在学习和使用世界语。世界语早已脱尽了人造的斧痕, 走上了自然发展的道路。它不但能写也能说, 不但适于表达精密的科学思想, 而且在文学上也取得了令人赞叹的成就。从莱勃尼茨的万国通用文字的设想开始, 先后提出的人造语方案达150多种, 唯有世界语经受住各种考验生存下来了。现在, 越来越多的人认识到世界语作为国际辅助语的独特价值。有些国际性学术会议(如控制论大会)已经采用世界语作为工作语言。
世界语中除数量有限的虚词外, 其他词都有非常规则的形态变化, 借以表现该词的词性、格、数、时态、语态、语式、分词形式等语法信息。另外还有一整套前缀后缀, 用以表现词汇意义上的细微差别和修辞色彩。世界语是典型的黏着语, 词尾和语缀的意义单一, 可以叠加。这套词尾和语缀设计得非常巧妙, 规则, 特别容易掌握, 而且也非常适合机器的递归加工。(EChA的削尾算法就体现了这种递归加工的优点, 见本文第5节。)世界语没有语法同形词, 句法关系一目了然, 这不论对人还是对机器的识辨, 都是一个极为有利的条件(民族语机器翻译中同形判别的问题在这儿根本不存在了)。同时, 世界语的词类转换也特别灵活, 只要逻辑上说得过去, 不致引起误解, 同一个词干可以根据句法需要, 通过词尾变化随意改变词性。(我国古汉语词类活用也比较自由, 在一定程度上具有类似的灵活性, 可惜这种活用没有明确的形态标志, 常常要靠逻辑语义的分析才能确定。)
世界语的词尾形式并不很多, 但却很完备, 可以和形态发达的语言相媲美, 这一点我们不能不为之惊叹。拿格来说, 世界语只有普通格(零形态)和目的格(加词尾-N)两种, 但由于它把词性和格的用法巧妙地统一起来, 再加上有介词这种分析形式的后备, 表达起来跟形态丰富的语言一样灵活自由。俄语是现代形态最丰富的语言之一, 它有六个格。粗略地说, 它的一格(主格)跟世界语普通格对应, 二格(属格)跟世界语形容词--姑且叫做形容格吧(加词尾-A)对应, 三格(与格)在世界语中没有相应的屈折形式, 一般用介词AL来代替。四格(宾格)对应于世界语的目的格。五格(工具格)跟世界语副词--也姑且叫做状格吧相对应。六格是前置格, 跟前置词O,Ha,B等搭配, 它本身并不表示特定的语义关系。有意思的是, 世界语介词后可以跟崐普通格和目的格两种, 前者表示静态, 后者表示动态(方向)。比较俄语的类似用法, 世界语的简洁和完备的特点是很明显的。
世界语基本语法规则共16条, 原则上没有例外.[0] 由此人们也许会推断这门语言很简陋, 刻板, 缺乏表现力。这是一个极大的误解。这里涉及世界语的另一个非常突出的语言学特点, 就是它兼有分析性语言和综合性语言的要素(虚词和形态都比较丰富), 同一种语义既可以用分析形式(借助于虚词), 又可以用综合形式(借助于屈折变化)来表示----当然, 这两种形式并不等同, 它们体现了不同的风格。由于这一特点, 世界语兼容性强, 文体多样, 特别灵活, 富于弹性和表现力。如果作为目标语, 它最能维妙维肖地模仿原文的语言特色。它既可以反映语序自由, 文体柔美的斯拉夫风格, 又可以表现形态缺乏的语言(如汉语和英语)的单纯, 严谨, 密集的特点。下面我们举几个例子来看一下分析形式和综合形式在世界语中的兼容并存情况:
分析形式 综合形式
1. 时态: Mi ESTAS skrib-ANTA. Mi skrib-AS. / Mi skrib-ANTAS.
I AM writ-ING. 我 "在" 写字。
2. 语态: Ghi ESTAS limig-ITA. Ghi limig-ITAS. / Ghi lim-IGHAS.
It IS limit-ED. 它 "被" 限定了。
3. 词义: Tio estas MALGRANDA (ETA) sekreto. Tio estas sekret-ETO.
That is a LITTLE secret.
那是 "小" 秘密。
4. 介词与副词(状格):
Li parolas EN (PER) Esperanto. Li parolas esperant-E. Li parolas Esperant-ON.
He speaks IN Esperanto. He speaks Esperanto.
他 "用" 世界语说话。 他说世界语。
5. 介词与格(目的格):
Shi parolis POR 30 minutoj. Shi parolis 30 minut-OJN.
She spoke FOR 30 minutes. 她说了30分钟.
6. 分析形式向综合形式的转换:
LAU kutimo ...............LAU-kutim-E...kutim-E
这种分析形式和综合形式并存的情形在世界语中极其普遍, 这一点跟民族语不一样。虽然没有绝对不用分析形式的综合性语言, 也没有绝对不用综合形式的分析性语言, 但是, 每一个具体的民族语言总是以一种形式为主, 而且在多数场合总是一种形式排斥另一种形式, 一般不允许并存。
总之, 跟人们通常想象的正相反, 世界语是高度灵活的, 表达方式极其多样, 且能互相转换。这种高度灵活性正好适应了人类思维模糊性的特点。灵活性与规则性的高度统一, 这就是世界语的真正奇迹。
人造语言的规则性容易为人理解。关于灵活性, 再补充几点。由于篇幅关系, 我们不打算展开, 必要时辅以一两句例证。
1. 在世界语中动词的及物与不及物的界限模糊了。
Mi IRAS. / IRU vian propran VOJON!
I GO. / GO your own WAY!
我行走。/ 走你自己的路!
La tuta homaro PAROLOS nur unu LINGVON. / Mi PAROLAS esperante (en Esperanto, per Espernato).
The whole mankind will SPEAK only one LANGUAGE. / I SPEAK in Esperanto.
全人类将说仅仅一种语言。/ 我用世界语说话。
2. 直接宾语(所谓宾格)与间接宾语(所谓与格)的界限模糊了。
informi ION al IU / informi IUN pri IO
tell sth. to sb. / tell sb. about sth.
向某人告诉某事 / 告诉某人关于某事
3. 宾语与状语的界限模糊了。世界语语法规定: 目的格(即通常所谓宾格)也可以表达某种状语意义(参见基本法规第14和第13条)。
Mi invitas vin VOJAGHI kun mi PEKINON.
I invite you to TRAVEL with me TO PEKING.
我邀请你和我一起 “旅游北京”。
4. 词缀与词根的界限模糊了, 从而派生词与合成词的界限模糊了。同时虚词与实词的界限也模糊了。
sekret-ET-o / ET-a sekreto JES, / mi JES-as vian opinion.
little secret 小秘密 Yes, I agree with you. 是的, 我同意你的意见。
ANTAU-vidi / Sinjorinoj ANTAU-as. Kred-IND-a / ne-IND-a , IND-igi , sen-IND-ulo
foresee / Ladies first. believ-able / not worthy, make worthy, good-for-nothing
5. 万能介词JE的设置。人们在表达思想时, 常常只意识到从属成分与中心成分有某种朦胧的修饰关系, 但却说不出, 往崐往也不必要说究竟是何种语义联系。为了适应人类思维的这种模糊特点, 柴门霍夫引入介词JE。这是一个很有见识的创造。表达这种模糊关系还可用屈折形式的目的格或副词(状格), 见基本法规第14条。
6. 词性与格在用法上的统一。词性和格都是根据词尾 "入句而后定" 的动态句法特征, 都能表现比较抽象的语义关系, 可以相互补充。(这跟分析形式的介词短语不同。介词除了上述JE外, 一般用来表示较为具体和确定的语义关系。)
Mi skribas plum-E.
CF: (俄) (五格)
7. 极其灵活的词类转换。
La FLOR-OJ FLOR-AS. Li KANT-AS italan popolan KANT-ON. Mi estas GHOJ-A. Mi GHOJ-AS.
The flowers blossom. He sang an Italian folk song. I am glad.
8. 词序的自由。
Mi amas vin. (106) / Mi vin amas. / Vin amas mi. (108) / Vin mi amas. (111) / Amas mi vin.
Amas vin mi.
I love you. 我爱你。
9. 构词的灵活。派生词: 词缀的丰富及其黏合特点; 合成词: 词根与词根的自由复合。
Shi rid-AS. Shi rid-ETAS. Shi estas rid-EMA. Shi estas rid-EMULO.
Shi estas rid-EMULINO (rid-EMINO). Shi estas rid-EMULINETO (rid-EMINETO).......
她笑。 她微笑。 她爱笑。 她是爱笑的人。
她是爱笑的女人。 她是爱笑的小女孩儿 ......。
INTER-lingvo 中间语言
fonto-lingvo celo-lingvo ponto-lingvo naci-lingvo internaci-lingvo
源语 目标语 媒介语(桥梁语言) 民族语 国际语
10.完善的时态语态系统和精巧的相关词表。世界语的时态语态系统和相关词表是两项绝妙的创造。它们是如此地精巧完善, 富有逻辑的力量和美, 每一个世界语者都象化学家欣赏元素周期表一样体验到这种美, 并为此感到自豪。借助于唯一的一个助动词ESTI, 世界语能表达各种复合时态语态。相关词表所能表达的语义的简洁和丰富更是无与伦比的。
世界语的这些特点给人们的自由创造留下了很大的余地, 为人们充分发挥自己的语言才能提供了最好的条件。这种灵活性并不影响作为世界语基础的16条基本法则的不可动摇的严格性。在这儿, 自由和约束达到了完美的统一。在世界语国里, 每个人都在不同程度上是创造者, 每一个世界语者都体验到这种创造的乐趣。人们再也不是习惯的奴隶了。
然而, 不能不承认, 世界语的灵活和自由给机器的自动处理带来了一定的困难。我们在研制EChA系统的过程中, 深深感到, 与民族语相比, 以世界语为源语的机器翻译虽然有其容易的一面, 也有其特有的难处, 总之要比我们预料的要复杂得多。容易来自其高度规则性, 困难则源于其高度灵活性。
世界语作为人们唯一实际使用的人造语言自然有它独特的研究价值。拿它与民族语作对比研究, 我们会得到很多有益的启示。由于其独特的地位, 人们在研究思维与语言, 民族与语言, 社会与语言, 个体与语言, 信仰与语言等等的关系, 以及探讨语言的共性, 语言的本质, 语言的前途(未来社会的语言), 语言的形式和内容, 语言的类型, 语言的教学等问题时都可能在研究世界语的过程中获益。另外, 世界语本身的发展也需要语言学者对它作科学的研究和总结, 这不但有益于这门语言健康的发展, 有助于世界语语言学理论体系的建立, 同时也会丰富一般语言学的理论。语言学者对世界语的理论研究虽然早已开始, 但还远远不够。
对于机器翻译工作者, 世界语还有一层特殊的意义, 就是世界语作为民族语间机器翻译的媒介语的价值.[1] 这可以从两方面看: 1) 按照机器特点对世界语作必要改造, 定义一个作为媒介语的世界语子集, 再辅以一套高度形式化的成分体系。这个设想我们在第一届中国世界语大会上提过。我们也确实设计过一个以世界语作为媒介语的英汉机器翻译规则系统。虽然由于时间等原因没有能上机试验, 但我们相信该方案是可行的, 也是值得尝试的。拿世界语或其子集作媒介语, 尽管还远远不是最理想, 但如果研制的是印欧语系间多语言自动翻译, 或者是以这些语言为源语的多对一系统(如英/法/德/俄--汉系统), 相信会带来很多方便。2) 虽然不直接采用世界语作媒介语, 但在设计机译媒介语时, 认真吸取世界语的优点, 可以少走弯路。
本文来自CSDN博客,转载请标明出处:http://blog.csdn.net/kevinsung/archive/2007/08/26/1759770.aspx
--EChA机器翻译系统概述
0. 本文是我在导师刘涌泉和刘倬先生指导下所做的毕业设计的论文总结. 共分十大部分:
1. EChA概况: 系统流程图;
2. 世界语: 语言学特点及其研究价值;
3. 层次递归成分体系CDC: 体现独立分析结果的EChA中间语言;
4. EChA机器词典, 句子加工场格式;
5. 世界语形态分析: 削尾算法, 关于削缀问题的讨论;
6. 句法分析第一线: 虚词处理, 规则和规则分开的讨论;
7. 句法分析第二线: CDC的求解, 中间结果分析;
8. 英语形态生成, 汉语形态修辞, 原语和译语对比差异的一般总结, 多义区分例释;
9. 调序: 自底而上加工;
10. EChA试验结果分析, 汉语和英语的机译文的比较, 关于文学作品可不可以跟机器翻译结合的问题, 修辞的讨论.
1. EChA概况
EChA (E-Ch/A: el Esperanto en la Chinan kaj Anglan Lingvojn) 系统是以世界语作为源语, 以汉语和英语作为目标语的一对多小型实验系统。它是一个句对句的, 分析和综合有一定独立性的全文机器翻译系统。本系统实现了翻译过程的完全自动化,不需要译前和译后编辑。(由于纯技术原因, 世界语中的几个戴帽字母暂时还需要用加 H 的复合字母来转写.) EChA系统从上机调试到打出译文只用了五个月, 全部工作历时近一年, 进展比较顺利。本系统使用的是IBM-PC/XT微型机, 编程语言 BASIC (Version D2.00), 同时选用IBM公司的BASIC编译程序软件包。EChA由CCDOS操作系统(即带有汉字库的PC DOS 2.10)支持。系统主体是六线分析和综合程序。另外还建立了三部词典, 两个词表, 编制了词典的造查, 扩充和维护程序。整个系统由近一万条BASIC语句构成。编程时充分利用了BASIC串处理函数, 显得特别方便。
这次试验共翻译了150多句世界语文句。汉语和英语的机器译文都通顺或可懂, 结果令人满意。(见附录) 提供本系统试验的源语素材有三部分: 第一部分是选自著名世界语作家Sandor Szhatmari的世界语原文著作 "Mashinmondo" (<<机器世界>>, 中国展望出版社)上的两段连续文章(12句, P.100-101), 句子比较长, 结构也比较复杂。第二部分选自魏原枢和徐文琪编著的 <<世界语语法>> (上海外语教育出版社, 1982.10)中的典型例句(100多句), 这些例句(其中有一部分是日常用语)都具有一定的语言学特点, 表现了不同时态(简单时态,复合时态), 语态(主动语态, 被动语态), 语式(陈述语式, 命令语式, 假定语式),不同的句式(简单句, 并列句, 复合句, 无主句, 独词句, 一般疑问句, 特殊疑问句, 等等),不同的句型以及动词的各种形式。总之, 它们具有相当的代表性, 基本上反映了世界语语法概貌, 这就弥补了连续文句特点单一的不足, 更有利于试验EChA系统的能力和适应性。最后作为一种尝试,还选译了两首世界语诗歌(第一首是著名的世界语者的颂歌“希望之歌”)。
EChA由三大部分组成: 1) 机器词典; 2) 源语分析; 3) 目标语生成。源语分析部分包括了世界语的全部基本语法和常用句型。然而, 由于机器条件和实验周期的限制, 本系统的规模(特别是词典的规模)还很小, 有待于进一步扩充和改进。----准备从两方面来扩充EChA系统, 一是补充例句, 做扩大试验; 二是增加俄语和法语作为新的目标语, 进一步检验体现独立分析结果的中间语言CDC(层次递归成分体系, 第3节详述)的适应范围, 并探讨其完善的途径。另外, 时间仓促给系统还带来一些问题: EChA的结构还不是很合理, 算法有待于进一步优化, 规则和算法还没能分开, 在分析和综合的独立性上下了不少功夫, 但还没有完全独立。
尽管还有上述问题, 然而按照设计要求, 只要适当扩充词典, 系统就有能力处理世界语的绝大多数语言现象。在中国近三十年的机器翻译研究历史中, EChA是第一个以世界语为研究对象的机译系统。在世界语跟机器翻译结合的过程中, EChA是一个成功的尝试和良好的开端。我们热切希望得到专家学者, 世界语同志们的帮助和指导。
EChA系统流程图
______丨________
/ 原文输入 丨
/________________丨
_______________________丨______________________
词 丨 1. 削尾, 查词典(实词词典, 虚词词典, 成语词典, 丨
典 丨 词类词义区分表) 丨
(形态分析) 丨______________________________________________丨
------------------- _______________________丨_______________________
句 丨 2. 连词标点, 切分, 其他虚词 丨
法 丨______________________________________________丨
分 _______________________丨_______________________
析 丨 3. 中间语言CDC的求解 丨
丨______________________________________________丨
------------------- _______________________丨_______________________
丨 4. 多义词区分; 英语形态生成及汉语形态修辞; 查 丨
目 丨 英语不规则词词表 丨
标 丨______________________________________________丨
语 _______________________丨_______________________
生 丨 5. 英语调序 丨
成 丨_______________________________________________丨
_______________________丨_______________________
丨 6. 汉语调序及其他修辞 丨
丨_______________________________________________丨
_________丨_________
丨 译文输出 丨
丨__________________丨
源语文句输入以后, 作第一遍扫描。首先判定加工词长度是否大于三。若大于三, 转子程序削尾后查实词词干词典, 否则查虚词词典。因为世界语虚词(无词尾变化)大多短小, 以三为界限最合理, 可以大大减少虚查次数。词典查不着的作生词处理, 削尾信息保留。查完词典及词表以后, 把削尾信息和词典信息移到计算机内存中所开辟的句子加工场。
句法分析确定源语文句的层次结构和句法关系。分析结果以一种高度形式化的层次递归成分体系CDC来体现。CDC是独立于目标语的机器翻译中间语言, 这种独立性对于一对多机译系统是必要的。CDC由形态, 成分, 节点, 分布, 链号和层次几部分信息构成。它不但揭示了源语文句的正确的句法树, 而且还包含了其它的有用的信息。事实上, 它为建立多目标语的生成系统奠定了良好的基础。
句法分析第一线处理虚词, 中心任务是加工连词和标点, 正确切分语段。原则上为每一个虚词编制一套分析规则。世界语虚词数量很有限, 但用法较多, 具有民族语功能词的类似的复杂性, 是语言个性的集中表现, 所以分别加工比较适宜, 这也有利于规则跟规则分开。该线加工任务很重, 特别是连词KAJ和KE, 分析规则十分复杂。在很大程度上, 虚词分析对了, 句法关系也就清楚了。因此, 集中力量编制一套完备的针对具体虚词的分析系统, 对于世界语类型的机器翻译至关重要。该线正确处理了虚词个性现象, 便可以保证下一线分析的充分抽象性和概括性, 这样做对于象世界语这样的科学而规则的语言显得特别有利。句法分析第二线运用自顶而下的方法, 从句子的谓语轴心(第一层)着手, 一层一层往下递归加工, 直到最末层(终结节点层)。加工过程就是不断递归调用各子程序的过程。其中以动词子程序为核心, 它充分反映了世界语语法的基本内容及其高度规则性。分析完毕得出一条对应于源语文句的中间语言CDC的链。
综合第一线做英语形态生成和汉语形态修辞。英语形态并不发达, 所以世英的形态转换规则也不复杂。汉语缺乏形态, 一般用适当的虚词(助词, 副词等)来代替。我们把多义词区分规则也放在这一线, 这是因为多义区分的条件至此已经具备。一般来说, 根据多义词及其联系词的CDC成分和语义特征就可以得出该词的正确义项。综合第二线和第三线分别做英语调序和汉语调序。调序信息由CDC结合目标语语法规律得出, 调序的方法是自底而上, 层层归约, 这样就不至于调乱。我们知道, 世界语语序极为灵活自由, 而汉语语序却很固定, 所以生成汉语的主要任务是调序。对于英语, 调序的任务较轻, 主要是保证文句主干 "主谓宾" 次序不乱。英语名词没有主宾格的区分, 所以关键是把前置宾语移到动词之后。"世界语是印欧语系的一个合理化的公分母", 与英语相似处毕竟很多, 比如同一句法层次的定语或状语的内部调序, 在译汉语时是一个难题, 而在印欧系诸语言中则不是大问题。另外修辞加工的过程也可以免了。(世英转换中的成语和多义现象较之世汉转换也少得多。)总之, 英语生成比汉语生成容易许多。
EChA虽然是个不大的系统, 但是内容比较丰富。它既有形态分析, 又有形态生成, 也有调序和修辞, 还有自己的一套成分体系。我们在总体设计时, 已经考虑到增加新的不同类型的目标语扩充该系统的需要。可以预计, 如果增加两线俄语和法语的生成程序(主要是形态生成), 分析部分稍作改动(主要是充实与综合还没有完全独立开来的虚词分析规则), 就可以实现崐世到汉/英/法/俄的自动翻译。总之, 实用机译系统所能遇到的问题, EChA几乎都已涉及, 而且主体六线程序各个有自己的特色, 是个有相当代表性的一对多全自动机译模型。
2. 世界语: 语言学特点及其研究价值
在进入EChA系统的细节和探讨机器翻译的一般理论和方法之前, 我们专列这一节讨论世界语本身, 这对说明本系统的设计思想和具体方法是很必要的。毫无疑问, 我们的讨论主要是从语言学角度着眼。
世界语(Esperanto)是波兰的语言大师柴门霍夫博士( L.L.Zamenhof 1859.12.15 - 1917.4.14 )于1887年在印欧语系的基础上经过艰苦研究提出的一个人造语方案。由于其科学, 简明, 逻辑性强, 由于日益增长的克服语言障碍的国际需要, 也由于其维护世界和平, 增进各民族相互了解, 实现世界大同的崇高理想的感召, 它逐渐为人们所接受。目前, 世界上有2000多万人在学习和使用世界语。世界语早已脱尽了人造的斧痕, 走上了自然发展的道路。它不但能写也能说, 不但适于表达精密的科学思想, 而且在文学上也取得了令人赞叹的成就。从莱勃尼茨的万国通用文字的设想开始, 先后提出的人造语方案达150多种, 唯有世界语经受住各种考验生存下来了。现在, 越来越多的人认识到世界语作为国际辅助语的独特价值。有些国际性学术会议(如控制论大会)已经采用世界语作为工作语言。
世界语中除数量有限的虚词外, 其他词都有非常规则的形态变化, 借以表现该词的词性、格、数、时态、语态、语式、分词形式等语法信息。另外还有一整套前缀后缀, 用以表现词汇意义上的细微差别和修辞色彩。世界语是典型的黏着语, 词尾和语缀的意义单一, 可以叠加。这套词尾和语缀设计得非常巧妙, 规则, 特别容易掌握, 而且也非常适合机器的递归加工。(EChA的削尾算法就体现了这种递归加工的优点, 见本文第5节。)世界语没有语法同形词, 句法关系一目了然, 这不论对人还是对机器的识辨, 都是一个极为有利的条件(民族语机器翻译中同形判别的问题在这儿根本不存在了)。同时, 世界语的词类转换也特别灵活, 只要逻辑上说得过去, 不致引起误解, 同一个词干可以根据句法需要, 通过词尾变化随意改变词性。(我国古汉语词类活用也比较自由, 在一定程度上具有类似的灵活性, 可惜这种活用没有明确的形态标志, 常常要靠逻辑语义的分析才能确定。)
世界语的词尾形式并不很多, 但却很完备, 可以和形态发达的语言相媲美, 这一点我们不能不为之惊叹。拿格来说, 世界语只有普通格(零形态)和目的格(加词尾-N)两种, 但由于它把词性和格的用法巧妙地统一起来, 再加上有介词这种分析形式的后备, 表达起来跟形态丰富的语言一样灵活自由。俄语是现代形态最丰富的语言之一, 它有六个格。粗略地说, 它的一格(主格)跟世界语普通格对应, 二格(属格)跟世界语形容词--姑且叫做形容格吧(加词尾-A)对应, 三格(与格)在世界语中没有相应的屈折形式, 一般用介词AL来代替。四格(宾格)对应于世界语的目的格。五格(工具格)跟世界语副词--也姑且叫做状格吧相对应。六格是前置格, 跟前置词O,Ha,B等搭配, 它本身并不表示特定的语义关系。有意思的是, 世界语介词后可以跟崐普通格和目的格两种, 前者表示静态, 后者表示动态(方向)。比较俄语的类似用法, 世界语的简洁和完备的特点是很明显的。
世界语基本语法规则共16条, 原则上没有例外.[0] 由此人们也许会推断这门语言很简陋, 刻板, 缺乏表现力。这是一个极大的误解。这里涉及世界语的另一个非常突出的语言学特点, 就是它兼有分析性语言和综合性语言的要素(虚词和形态都比较丰富), 同一种语义既可以用分析形式(借助于虚词), 又可以用综合形式(借助于屈折变化)来表示----当然, 这两种形式并不等同, 它们体现了不同的风格。由于这一特点, 世界语兼容性强, 文体多样, 特别灵活, 富于弹性和表现力。如果作为目标语, 它最能维妙维肖地模仿原文的语言特色。它既可以反映语序自由, 文体柔美的斯拉夫风格, 又可以表现形态缺乏的语言(如汉语和英语)的单纯, 严谨, 密集的特点。下面我们举几个例子来看一下分析形式和综合形式在世界语中的兼容并存情况:
分析形式 综合形式
1. 时态: Mi ESTAS skrib-ANTA. Mi skrib-AS. / Mi skrib-ANTAS.
I AM writ-ING. 我 "在" 写字。
2. 语态: Ghi ESTAS limig-ITA. Ghi limig-ITAS. / Ghi lim-IGHAS.
It IS limit-ED. 它 "被" 限定了。
3. 词义: Tio estas MALGRANDA (ETA) sekreto. Tio estas sekret-ETO.
That is a LITTLE secret.
那是 "小" 秘密。
4. 介词与副词(状格):
Li parolas EN (PER) Esperanto. Li parolas esperant-E. Li parolas Esperant-ON.
He speaks IN Esperanto. He speaks Esperanto.
他 "用" 世界语说话。 他说世界语。
5. 介词与格(目的格):
Shi parolis POR 30 minutoj. Shi parolis 30 minut-OJN.
She spoke FOR 30 minutes. 她说了30分钟.
6. 分析形式向综合形式的转换:
LAU kutimo ...............LAU-kutim-E...kutim-E
这种分析形式和综合形式并存的情形在世界语中极其普遍, 这一点跟民族语不一样。虽然没有绝对不用分析形式的综合性语言, 也没有绝对不用综合形式的分析性语言, 但是, 每一个具体的民族语言总是以一种形式为主, 而且在多数场合总是一种形式排斥另一种形式, 一般不允许并存。
总之, 跟人们通常想象的正相反, 世界语是高度灵活的, 表达方式极其多样, 且能互相转换。这种高度灵活性正好适应了人类思维模糊性的特点。灵活性与规则性的高度统一, 这就是世界语的真正奇迹。
人造语言的规则性容易为人理解。关于灵活性, 再补充几点。由于篇幅关系, 我们不打算展开, 必要时辅以一两句例证。
1. 在世界语中动词的及物与不及物的界限模糊了。
Mi IRAS. / IRU vian propran VOJON!
I GO. / GO your own WAY!
我行走。/ 走你自己的路!
La tuta homaro PAROLOS nur unu LINGVON. / Mi PAROLAS esperante (en Esperanto, per Espernato).
The whole mankind will SPEAK only one LANGUAGE. / I SPEAK in Esperanto.
全人类将说仅仅一种语言。/ 我用世界语说话。
2. 直接宾语(所谓宾格)与间接宾语(所谓与格)的界限模糊了。
informi ION al IU / informi IUN pri IO
tell sth. to sb. / tell sb. about sth.
向某人告诉某事 / 告诉某人关于某事
3. 宾语与状语的界限模糊了。世界语语法规定: 目的格(即通常所谓宾格)也可以表达某种状语意义(参见基本法规第14和第13条)。
Mi invitas vin VOJAGHI kun mi PEKINON.
I invite you to TRAVEL with me TO PEKING.
我邀请你和我一起 “旅游北京”。
4. 词缀与词根的界限模糊了, 从而派生词与合成词的界限模糊了。同时虚词与实词的界限也模糊了。
sekret-ET-o / ET-a sekreto JES, / mi JES-as vian opinion.
little secret 小秘密 Yes, I agree with you. 是的, 我同意你的意见。
ANTAU-vidi / Sinjorinoj ANTAU-as. Kred-IND-a / ne-IND-a , IND-igi , sen-IND-ulo
foresee / Ladies first. believ-able / not worthy, make worthy, good-for-nothing
5. 万能介词JE的设置。人们在表达思想时, 常常只意识到从属成分与中心成分有某种朦胧的修饰关系, 但却说不出, 往崐往也不必要说究竟是何种语义联系。为了适应人类思维的这种模糊特点, 柴门霍夫引入介词JE。这是一个很有见识的创造。表达这种模糊关系还可用屈折形式的目的格或副词(状格), 见基本法规第14条。
6. 词性与格在用法上的统一。词性和格都是根据词尾 "入句而后定" 的动态句法特征, 都能表现比较抽象的语义关系, 可以相互补充。(这跟分析形式的介词短语不同。介词除了上述JE外, 一般用来表示较为具体和确定的语义关系。)
Mi skribas plum-E.
CF: (俄) (五格)
7. 极其灵活的词类转换。
La FLOR-OJ FLOR-AS. Li KANT-AS italan popolan KANT-ON. Mi estas GHOJ-A. Mi GHOJ-AS.
The flowers blossom. He sang an Italian folk song. I am glad.
8. 词序的自由。
Mi amas vin. (106) / Mi vin amas. / Vin amas mi. (108) / Vin mi amas. (111) / Amas mi vin.
Amas vin mi.
I love you. 我爱你。
9. 构词的灵活。派生词: 词缀的丰富及其黏合特点; 合成词: 词根与词根的自由复合。
Shi rid-AS. Shi rid-ETAS. Shi estas rid-EMA. Shi estas rid-EMULO.
Shi estas rid-EMULINO (rid-EMINO). Shi estas rid-EMULINETO (rid-EMINETO).......
她笑。 她微笑。 她爱笑。 她是爱笑的人。
她是爱笑的女人。 她是爱笑的小女孩儿 ......。
INTER-lingvo 中间语言
fonto-lingvo celo-lingvo ponto-lingvo naci-lingvo internaci-lingvo
源语 目标语 媒介语(桥梁语言) 民族语 国际语
10.完善的时态语态系统和精巧的相关词表。世界语的时态语态系统和相关词表是两项绝妙的创造。它们是如此地精巧完善, 富有逻辑的力量和美, 每一个世界语者都象化学家欣赏元素周期表一样体验到这种美, 并为此感到自豪。借助于唯一的一个助动词ESTI, 世界语能表达各种复合时态语态。相关词表所能表达的语义的简洁和丰富更是无与伦比的。
世界语的这些特点给人们的自由创造留下了很大的余地, 为人们充分发挥自己的语言才能提供了最好的条件。这种灵活性并不影响作为世界语基础的16条基本法则的不可动摇的严格性。在这儿, 自由和约束达到了完美的统一。在世界语国里, 每个人都在不同程度上是创造者, 每一个世界语者都体验到这种创造的乐趣。人们再也不是习惯的奴隶了。
然而, 不能不承认, 世界语的灵活和自由给机器的自动处理带来了一定的困难。我们在研制EChA系统的过程中, 深深感到, 与民族语相比, 以世界语为源语的机器翻译虽然有其容易的一面, 也有其特有的难处, 总之要比我们预料的要复杂得多。容易来自其高度规则性, 困难则源于其高度灵活性。
世界语作为人们唯一实际使用的人造语言自然有它独特的研究价值。拿它与民族语作对比研究, 我们会得到很多有益的启示。由于其独特的地位, 人们在研究思维与语言, 民族与语言, 社会与语言, 个体与语言, 信仰与语言等等的关系, 以及探讨语言的共性, 语言的本质, 语言的前途(未来社会的语言), 语言的形式和内容, 语言的类型, 语言的教学等问题时都可能在研究世界语的过程中获益。另外, 世界语本身的发展也需要语言学者对它作科学的研究和总结, 这不但有益于这门语言健康的发展, 有助于世界语语言学理论体系的建立, 同时也会丰富一般语言学的理论。语言学者对世界语的理论研究虽然早已开始, 但还远远不够。
对于机器翻译工作者, 世界语还有一层特殊的意义, 就是世界语作为民族语间机器翻译的媒介语的价值.[1] 这可以从两方面看: 1) 按照机器特点对世界语作必要改造, 定义一个作为媒介语的世界语子集, 再辅以一套高度形式化的成分体系。这个设想我们在第一届中国世界语大会上提过。我们也确实设计过一个以世界语作为媒介语的英汉机器翻译规则系统。虽然由于时间等原因没有能上机试验, 但我们相信该方案是可行的, 也是值得尝试的。拿世界语或其子集作媒介语, 尽管还远远不是最理想, 但如果研制的是印欧语系间多语言自动翻译, 或者是以这些语言为源语的多对一系统(如英/法/德/俄--汉系统), 相信会带来很多方便。2) 虽然不直接采用世界语作媒介语, 但在设计机译媒介语时, 认真吸取世界语的优点, 可以少走弯路。
本文来自CSDN博客,转载请标明出处:http://blog.csdn.net/kevinsung/archive/2007/08/26/1759770.aspx
| Nenio estas pli bela ol esti juna kaj paroli esperante! Էսպերանտոյի գեղեցիկ, երիտասարդ էսպերանտո, Esperanto is 'n jong en mooi Esperanto se yon jèn ak bèl |