思考的时间,他身体微微前倾,直接切入了最核心的专业领域。
“我深入了解过你现在正在带队研发的‘搜狗’第三代中文搜索引擎。”
“你现在的核心架构思路。是基于复杂的分词算法,对互联网上海量的网页文本进行抓取、建立索引、然后再进行排序。”
“而且,我不得不承认,你在这个领域做出了非常卓越的创新。你改进了传统的中文分词技术,创造性地引入了‘隐马尔可夫模型’(HMM)来做歧义切分。这在很大程度上,解决了中文语句里最头疼的一词多义和长句解析的难题。这很了不起。”
听到“隐马尔可夫模型”这个异常生僻、专业底层的算法名词从一个“资本家”的嘴里吐出来。
王小川的瞳孔下意识的收缩了一下。
但他还没来得及惊讶,张明远接下来的话,却如同一把锋利的手术刀,毫不留情地切开了他这套系统最致命的软肋!
“但是!”
张明远目光锐利,直视着王小川的眼睛:
“你现在的这套系统,有两个非常致命、且明显的短板!”
“第一,你的爬虫抓取模块!”
“它对传统静态网页的抓取确实很高效。但是,对于目前互联网上刚刚兴起、且未来必将成为主流的动态脚本页面,你们的爬虫适配极差!在抓取这类动态内容时,会出现大量的数据丢失和索引失败!”
“第二,你的排序算法缺陷!”
张明远的手指在桌面上轻轻敲击:
“你们现在的搜索结果呈现,仅仅只依靠网页内部的关键词匹配权重来决定排名。你们完全没有引入网页与网页之间的链接关系来做权重计算!”
“这会导致什么后果?”
“这就导致,那些恶意堆砌关键词的垃圾网页、内容农场、以及低质量的山寨站点,会大量地排在用户搜索结果的最前面!”
张明远给出了一针见血的结论:
“搜索出来的结果不准确,甚至全是垃圾信息。这会让用户的体验大打折扣,最终彻底失去市场竞争力!”
这番点评。
没有任何华丽的商业辞藻,没有半句画大饼的废话。
句句切中要害!全都是实打实、王小川目前在研发中最头疼、甚至连搜狐内部的很多高管都听不懂的技术痛点!
王小川原本
本章未完,请点击下一页继续阅读!