以文本方式查看主题

-  W3CHINA.ORG讨论区 - 语义网·描述逻辑·本体·RDF·OWL  (http://bbs.xml.org.cn/index.asp)
--  『 Web挖掘技术 』   (http://bbs.xml.org.cn/list.asp?boardid=69)
----  WEB日志数据如何进行预处理?  (http://bbs.xml.org.cn/dispbbs.asp?boardid=69&rootid=&id=50214)


--  作者:liuag
--  发布时间:7/19/2007 9:35:00 AM

--  WEB日志数据如何进行预处理?
WEB日志中有很多记录是不完整的或错误的信息,这对数据挖掘不但没有用,还会增加处理的复杂性。如何把这些噪音信息过滤掉呢?

WEB会话识别,现在常用的是时间阈值(Timeout)方法,如30min为一个会话时间段,但仍然会出现不少错误的会话。有更好的方法吗?

最近在做这方面的工作,希望和大家交流一下,谢谢


--  作者:liuag
--  发布时间:7/20/2007 12:24:00 PM

--  
没人给点建议
--  作者:DMman
--  发布时间:7/20/2007 5:19:00 PM

--  
个人没做过,一些web挖掘的资源 开源软件等 希望能有所得
http://dmoz.org/Computers/Software/Internet/Site_Management/Log_Analysis/
--  作者:liuag
--  发布时间:7/23/2007 9:12:00 AM

--  
谢谢楼上的,还是自己找文献慢慢研究吧
--  作者:DMman
--  发布时间:7/23/2007 10:32:00 AM

--  
以下是引用liuag在2007-7-23 9:12:00的发言:
谢谢楼上的,还是自己找文献慢慢研究吧


现在做WEB挖掘这一块确实比较少,而且因为里面牵涉到很多技术性问题,利益相关,所以即使有人做出了成果,也不愿意公诸于众。开源之风还要迟些才能吹到.....
--  作者:liuag
--  发布时间:7/24/2007 8:56:00 PM

--  
以下是引用DMman在2007-7-23 10:32:00的发言:
[quote]以下是引用liuag在2007-7-23 9:12:00的发言:
谢谢楼上的,还是自己找文献慢慢研究吧
[/quote]
现在做WEB挖掘这一块确实比较少,而且因为里面牵涉到很多技术性问题,利益相关,所以即使有人做出了成果,也不愿意公诸于众。开源之风还要迟些才能吹到.....

可以理解!但是已经公开发表的还是可以讨论的,省得再去查很多文献了


--  作者:jackmtlee
--  发布时间:3/9/2009 8:37:00 PM

--  
分享一下啊。jackmtlee@yahoo.cn。谢谢
W 3 C h i n a ( since 2003 ) 旗 下 站 点
苏ICP备05006046号《全国人大常委会关于维护互联网安全的决定》《计算机信息网络国际联网安全保护管理办法》
63.477ms