新书推介:《语义网技术体系》
作者:瞿裕忠,胡伟,程龚
   XML论坛     >>W3CHINA.ORG讨论区<<     计算机科学论坛     SOAChina论坛     Blog     开放翻译计划     新浪微博  
 
  • 首页
  • 登录
  • 注册
  • 软件下载
  • 资料下载
  • 核心成员
  • 帮助
  •   Add to Google

    >> 搜索引擎, 信息分类与检索, 语义搜索, Lucene, Nutch, GRUB, Larbin, Weka
    [返回] W3CHINA.ORG讨论区 - 语义网·描述逻辑·本体·RDF·OWL计算机技术与应用『 Web挖掘技术 』 → WEB日志数据如何进行预处理? 查看新帖用户列表

      发表一个新主题  发表一个新投票  回复主题  (订阅本版) 您是本帖的第 9384 个阅读者浏览上一篇主题  刷新本主题   树形显示贴子 浏览下一篇主题
     * 贴子主题: WEB日志数据如何进行预处理? 举报  打印  推荐  IE收藏夹 
       本主题类别:     
     liuag 帅哥哟,离线,有人找我吗?处女座1979-9-13
      
      
      等级:大一新生
      文章:5
      积分:82
      门派:IEEE.ORG.CN
      注册:2007/7/9

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给liuag发送一个短消息 把liuag加入好友 查看liuag的个人资料 搜索liuag在『 Web挖掘技术 』 的所有贴子 点击这里发送电邮给liuag 引用回复这个贴子 回复这个贴子 查看liuag的博客楼主
    发贴心情 WEB日志数据如何进行预处理?

    WEB日志中有很多记录是不完整的或错误的信息,这对数据挖掘不但没有用,还会增加处理的复杂性。如何把这些噪音信息过滤掉呢?

    WEB会话识别,现在常用的是时间阈值(Timeout)方法,如30min为一个会话时间段,但仍然会出现不少错误的会话。有更好的方法吗?

    最近在做这方面的工作,希望和大家交流一下,谢谢


       收藏   分享  
    顶(0)
      




    ----------------------------------------------
    人是要有点理想的

    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2007/7/19 9:35:00
     
     liuag 帅哥哟,离线,有人找我吗?处女座1979-9-13
      
      
      等级:大一新生
      文章:5
      积分:82
      门派:IEEE.ORG.CN
      注册:2007/7/9

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给liuag发送一个短消息 把liuag加入好友 查看liuag的个人资料 搜索liuag在『 Web挖掘技术 』 的所有贴子 点击这里发送电邮给liuag 引用回复这个贴子 回复这个贴子 查看liuag的博客2
    发贴心情 
    没人给点建议

    ----------------------------------------------
    人是要有点理想的

    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2007/7/20 12:24:00
     
     DMman 帅哥哟,离线,有人找我吗?魔羯座1984-1-11
      
      
      威望:1
      头衔:数据挖掘青年
      等级:研二(Pi-Calculus看得一头雾水)(版主)
      文章:803
      积分:5806
      门派:W3CHINA.ORG
      注册:2007/4/9

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给DMman发送一个短消息 把DMman加入好友 查看DMman的个人资料 搜索DMman在『 Web挖掘技术 』 的所有贴子 点击这里发送电邮给DMman 访问DMman的主页 引用回复这个贴子 回复这个贴子 查看DMman的博客3
    发贴心情 
    个人没做过,一些web挖掘的资源 开源软件等 希望能有所得
    http://dmoz.org/Computers/Software/Internet/Site_Management/Log_Analysis/

    ----------------------------------------------
    数据挖掘青年 http://blogger.org.cn/blog/blog.asp?name=DMman
    纪录片之家 (很多纪录片下载)http://www.jlpzj.com/?fromuid=137653

    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2007/7/20 17:19:00
     
     liuag 帅哥哟,离线,有人找我吗?处女座1979-9-13
      
      
      等级:大一新生
      文章:5
      积分:82
      门派:IEEE.ORG.CN
      注册:2007/7/9

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给liuag发送一个短消息 把liuag加入好友 查看liuag的个人资料 搜索liuag在『 Web挖掘技术 』 的所有贴子 点击这里发送电邮给liuag 引用回复这个贴子 回复这个贴子 查看liuag的博客4
    发贴心情 
    谢谢楼上的,还是自己找文献慢慢研究吧

    ----------------------------------------------
    人是要有点理想的

    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2007/7/23 9:12:00
     
     DMman 帅哥哟,离线,有人找我吗?魔羯座1984-1-11
      
      
      威望:1
      头衔:数据挖掘青年
      等级:研二(Pi-Calculus看得一头雾水)(版主)
      文章:803
      积分:5806
      门派:W3CHINA.ORG
      注册:2007/4/9

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给DMman发送一个短消息 把DMman加入好友 查看DMman的个人资料 搜索DMman在『 Web挖掘技术 』 的所有贴子 点击这里发送电邮给DMman 访问DMman的主页 引用回复这个贴子 回复这个贴子 查看DMman的博客5
    发贴心情 
    以下是引用liuag在2007-7-23 9:12:00的发言:
    谢谢楼上的,还是自己找文献慢慢研究吧


    现在做WEB挖掘这一块确实比较少,而且因为里面牵涉到很多技术性问题,利益相关,所以即使有人做出了成果,也不愿意公诸于众。开源之风还要迟些才能吹到.....

    ----------------------------------------------
    数据挖掘青年 http://blogger.org.cn/blog/blog.asp?name=DMman
    纪录片之家 (很多纪录片下载)http://www.jlpzj.com/?fromuid=137653

    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2007/7/23 10:32:00
     
     liuag 帅哥哟,离线,有人找我吗?处女座1979-9-13
      
      
      等级:大一新生
      文章:5
      积分:82
      门派:IEEE.ORG.CN
      注册:2007/7/9

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给liuag发送一个短消息 把liuag加入好友 查看liuag的个人资料 搜索liuag在『 Web挖掘技术 』 的所有贴子 点击这里发送电邮给liuag 引用回复这个贴子 回复这个贴子 查看liuag的博客6
    发贴心情 
    以下是引用DMman在2007-7-23 10:32:00的发言:
    [quote]以下是引用liuag在2007-7-23 9:12:00的发言:
    谢谢楼上的,还是自己找文献慢慢研究吧
    [/quote]
    现在做WEB挖掘这一块确实比较少,而且因为里面牵涉到很多技术性问题,利益相关,所以即使有人做出了成果,也不愿意公诸于众。开源之风还要迟些才能吹到.....

    可以理解!但是已经公开发表的还是可以讨论的,省得再去查很多文献了

    ----------------------------------------------
    人是要有点理想的

    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2007/7/24 20:56:00
     
     jackmtlee 帅哥哟,离线,有人找我吗?
      
      
      等级:大一新生
      文章:10
      积分:92
      门派:XML.ORG.CN
      注册:2008/10/28

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给jackmtlee发送一个短消息 把jackmtlee加入好友 查看jackmtlee的个人资料 搜索jackmtlee在『 Web挖掘技术 』 的所有贴子 引用回复这个贴子 回复这个贴子 查看jackmtlee的博客7
    发贴心情 
    分享一下啊。jackmtlee@yahoo.cn。谢谢
    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2009/3/9 20:37:00
     
     GoogleAdSense
      
      
      等级:大一新生
      文章:1
      积分:50
      门派:无门无派
      院校:未填写
      注册:2007-01-01
    给Google AdSense发送一个短消息 把Google AdSense加入好友 查看Google AdSense的个人资料 搜索Google AdSense在『 Web挖掘技术 』 的所有贴子 访问Google AdSense的主页 引用回复这个贴子 回复这个贴子 查看Google AdSense的博客广告
    2024/5/2 8:46:49

    本主题贴数7,分页: [1]

    管理选项修改tag | 锁定 | 解锁 | 提升 | 删除 | 移动 | 固顶 | 总固顶 | 奖励 | 惩罚 | 发布公告
    W3C Contributing Supporter! W 3 C h i n a ( since 2003 ) 旗 下 站 点
    苏ICP备05006046号《全国人大常委会关于维护互联网安全的决定》《计算机信息网络国际联网安全保护管理办法》
    109.375ms