yuanfan 事情是酱紫的,最近俺在一台新服务器装新的 R,迁过来一些以前写的脚本,里面用了 jiebaR 包,想着反正很多包都装了新版本不如把 jiebaR 也装一下最新的试试,然后就发现 jiebaR 被从 CRAN 上移除了。 另外再问问,大家使用 R 有没有其他更好用的分词包呀?
yihui 大概是覃大侠没时间了吧。从它最后一次的 CRAN 检查结果来看,问题也并不严重,不过不知道过了这么久是不是又会有新的问题。总之呢,要是有人想把它重新托举回 CRAN 的话,源码库在此:https://github.com/qinwf/jiebaR 我可以做媒,请覃大侠把这个库托孤给新的维护者。 维护 R 包不易,请大家平时多多善待 R 包维护者啊(比如我)。
Yousa-Mirage 自荐一下我开发的 jiebaRS 包。在 jiebaR 的基础上,我基于 Rust jieba-rs 开发了 jiebaRS 包,作为 jiebaR 的替代方案。jiebaRS 支持分词、词性标注、关键词提取等功能,相比 jiebaR,jiebaRS: Rust 后端,性能更高、内存安全性更好; 支持 TF-IDF 和 TextRank 关键词提取; 支持批量并行分词; 支持自定义多本用户词典、停用词、IDF 和 HMM 模型; 面向较新的 R、Rust 和跨平台构建环境持续维护; 尽量保持与 jiebaR 相近的 API 设计和使用方式。 实测结果中,jiebaRS 对《围城》进行分词耗时约 0.04 秒,与 jiebaR 的结果词表相似度为 92.9%。欢迎大家安装、使用和反馈。 CRAN:https://cran.r-project.org/web/packages/jiebaRS/index.html 文档网站:https://yousa-mirage.github.io/jiebaRS GitHub:Yousa-Mirage/jiebaRS