chendeben 9 năm trước cách đây
mục cha
commit
19c30d0f25

BIN
yidu/.DS_Store


BIN
yidu/yispider/.DS_Store


+ 34 - 2
yidu/yispider/collect.ini

@@ -2,13 +2,13 @@
 version=2.0
 version=2.0
 
 
 #采集规则
 #采集规则
-rule_name=23us.xml
+rule_name=42.51.156.246.xml
 
 
 #新书是否入库, false不添加新书,true表示添加新书
 #新书是否入库, false不添加新书,true表示添加新书
 add_new_book=true
 add_new_book=true
 
 
 #默认完本标记, 如果规则文件中没有则使用此处配置
 #默认完本标记, 如果规则文件中没有则使用此处配置
-full_flag=完结
+full_flag=完结
 
 
 #默认大类
 #默认大类
 default_category=10
 default_category=10
@@ -21,3 +21,35 @@ interval=10
 
 
 #采集超时时间, 根据目标站网络情况设置, 默认为60秒
 #采集超时时间, 根据目标站网络情况设置, 默认为60秒
 connection_timeout=120
 connection_timeout=120
+
+#程序默认监听端口, 正常结束程序时会通过此端口发送消息, 如果发生端口冲突, 请自行修改
+stop_port=10987
+
+#访问目标站方式user-agent
+#模拟爬虫的值分别为:baidu 模拟百度爬虫 (默认方式)、google、 sogou、yahoo、msn、youdao、jike
+#模拟人工:user_ie_x64, user_ie_x86
+user_agent=baidu
+
+#章节名启用短名称匹配
+shortname=false
+
+#章节内容全角转半角
+qj2bj=false
+
+#将繁体转换为简体
+big5_gbk=false
+
+#采集章节间隔(单位:秒),默认0
+collect_chpater_interval=0
+
+#代理服务器IP
+proxy_ip=
+
+#代理服务器端口
+proxy_port=5487
+
+#空章节重试
+empty_chpater_retry=5
+
+#空章节重试
+empty_chpater_retry_interval = 3

+ 2 - 2
yidu/yispider/jdbc.properties

@@ -1,6 +1,6 @@
 #for postgresql
 #for postgresql
 jdbc.driverClassName=org.postgresql.Driver
 jdbc.driverClassName=org.postgresql.Driver
-jdbc.url=jdbc:postgresql://127.0.0.1:5432/yidu
+jdbc.url=jdbc:postgresql://yidu_postgres:5432/yidu
 jdbc.username=postgres
 jdbc.username=postgres
 jdbc.password=postgres
 jdbc.password=postgres
 
 
@@ -29,4 +29,4 @@ jdbc.testConnectionOnCheckin = false
 #\u68c0\u9a8c\u94fe\u63a5\u6709\u6548\u6027\u4f7f\u7528\u7684\u8868\uff0c c3p0\u4f1a\u81ea\u52a8\u521b\u5efa
 #\u68c0\u9a8c\u94fe\u63a5\u6709\u6548\u6027\u4f7f\u7528\u7684\u8868\uff0c c3p0\u4f1a\u81ea\u52a8\u521b\u5efa
 jdbc.automaticTestTable = DB_TEST
 jdbc.automaticTestTable = DB_TEST
 #\u5f53\u8fde\u63a5\u6c60\u7528\u5b8c\u65f6\u5ba2\u6237\u7aef\u8c03\u7528getConnection()\u540e\u7b49\u5f85\u83b7\u53d6\u65b0\u8fde\u63a5\u7684\u65f6\u95f4\uff0c\u8d85\u65f6\u540e\u5c06\u629b\u51faSQLException,\u5982\u8bbe\u4e3a0\u5219\u65e0\u9650\u671f\u7b49\u5f85\u3002\u5355\u4f4d\u6beb\u79d2\u3002Default: 0 
 #\u5f53\u8fde\u63a5\u6c60\u7528\u5b8c\u65f6\u5ba2\u6237\u7aef\u8c03\u7528getConnection()\u540e\u7b49\u5f85\u83b7\u53d6\u65b0\u8fde\u63a5\u7684\u65f6\u95f4\uff0c\u8d85\u65f6\u540e\u5c06\u629b\u51faSQLException,\u5982\u8bbe\u4e3a0\u5219\u65e0\u9650\u671f\u7b49\u5f85\u3002\u5355\u4f4d\u6beb\u79d2\u3002Default: 0 
-jdbc.checkoutTimeout=30000
+jdbc.checkoutTimeout=30000

+ 1 - 1
yidu/yispider/logback.xml

@@ -58,7 +58,7 @@
     </logger>
     </logger>
 
 
     <root level="INFO">
     <root level="INFO">
-        <appender-ref ref="stdout" />
+        <!--<appender-ref ref="stdout" />-->
         <appender-ref ref="file-info" />
         <appender-ref ref="file-info" />
         <appender-ref ref="file-error" />
         <appender-ref ref="file-error" />
     </root>
     </root>

+ 0 - 41
yidu/yispider/readme.txt

@@ -1,41 +0,0 @@
-1. 不带参数启动, 默认为采集规则中指定的所有小说, 即同-ca参数
-2. 正常采集规则中指定的所有小说使用参数 -ca启动
-3. 如果只采集部分小说, 可使用-c 111,222,333 或者-c 111-222启动采集器, 前者意思为采集目标站章节号为111,222,333的小说, 后者意思为采集目标站章节号从111到222之间的所有小说
-4. 如果采集中出现了一些空章节, 或者小说封面、简介、进度、分类错误, 可以使用修复采集 -ra启动, 可指定修复内容
-5. 如果只修复部分小说, 可使用-r 111,222,333 或者-c 111-222启动采集器, 参数含义类似-c, 只是-c为采集指定小说, -r为修复指定小说
-6. 使用-r或-ra进行修复采集时可同时制定需要修复的选项, -cover,-intro,-top,-sub,-keywords,-degree,-etxt,-txt,以上参数分别对应封面图片, 小说简介, 小说大类,小说细类, 关键词, 写作进度, 空章节(只修复空章节), txt文本(无论本地是否存在对应的章节内容, 只要指定txt则重新采集)
-7. 如果启动需要单独指定采集时使用的规则, 可使用-rule xxxx.xml参数(必须同时制定-ca -c -ra -r四个命令之一), 其中xxxx.xml为rules文件夹下的规则名, 注意这里的参数需要使用文件全名, 即带了后缀的, 如果不知道怎么看文件后缀, 请使用谷歌或者度娘
-
-
-配置易读:
-1. 配置jdbc.properties,将#for postgresql下的四行开始的#去掉,同时将#for mysql下的四行行首加上#
-2. 将site.ini中的local_program值修改为yidu
-3. 将collect.ini中的create_html设置为false
-
-配置杰奇:
-1. 配置jdbc.properties,将#for postgresql下的四行行首加上#,同时将#for mysql下的四行行首的#去掉
-2. 将site.ini中的local_program值修改为jieqi
-3. 将collect.ini中的create_html设置为true
-
-配置site.ini:
-主要配置项包括: local_program、txt_file、cover_dir
-其中local_program参考[配置易读]、[配置杰奇]
-txt_file为你的txt文件路径路径路径路径, 配置的时候需要注意不要把占位符删掉
-cover_dir为你的封面图片所在目录目录目录目录,  配置的时候注意占位符
-
-
-采集器默认为单线程执行, 如果有多线程需求, 请按照以下配置:
-1. 在数据库中增加唯一索引
-create unique index unique_index_articleno_chaptername ON t_chapter(articleno,chaptername);
-create unique index unique_index_articlename_author ON t_article(articlename,author);
-2. 将collect.ini中的concurrent_novel_task设置为大于1的数字
-
-多线程采集优势:
-理论上采集速度可以无限提升
-
-多线程采集风险:
-1. 会消耗更多的系统资源
-2. 多线程采集速度过快, 由于网络延时性, 可能会采到很多空章节
-
-解决方案:
-同时开启修复采集

+ 1 - 1
yidu/yispider/run.ini

@@ -1,2 +1,2 @@
 -rule 23us.xml -ca
 -rule 23us.xml -ca
--rule 22mt.xml -ca
+-rule slzww.com.xml -c 3884

+ 7 - 14
yidu/yispider/site.ini

@@ -2,7 +2,7 @@
 local_site_url=http://tttt
 local_site_url=http://tttt
 
 
 #本站名称, 需要生成静态页时此项必填
 #本站名称, 需要生成静态页时此项必填
-local_site_name=很牛小说网
+local_site_name=易读
 
 
 #本站txt文件编码
 #本站txt文件编码
 charset=GBK
 charset=GBK
@@ -11,24 +11,17 @@ charset=GBK
 local_program=yidu
 local_program=yidu
 
 
 #本站根目录
 #本站根目录
-base_path=D:/workspace/99_website/YiDu-Novel/
+#base_path=D:/workspace/99_website/YiDu-Novel/
+base_path=D:/server/upupw/vhosts/tttt/
 
 
-############占位符说明############
-#	#subDir#对易读和杰奇来说subDir就是小说编号除以1000以后的整数值
-#	#articleNo#即小说编号
-#	#chapterNo#即章节编号
-#	#pinyin#即小说名对应的拼音
-##############################
 #章节txt存放绝对路径
 #章节txt存放绝对路径
-txt_file=D:/workspace/99_website/YiDu-Novel/files/article/txt/#subDir#/#articleNo#/#chapterNo#.txt
+#txt_dir=D:/workspace/99_website/YiDu-Novel/files/article/txt/
+txt_file=/usr/local/tomcat/webapps/ROOT/txt/#subDir#/#articleNo#/#chapterNo#.txt
 
 
 #文章封面存放绝对路径
 #文章封面存放绝对路径
-cover_dir=D:/workspace/99_website/YiDu-Novel/files/article/image/#subDir#/#articleNo#/
+#cover_dir=D:/workspace/99_website/YiDu-Novel/files/article/image/
+cover_dir=/usr/local/tomcat/webapps/ROOT/cover/#subDir#/#articleNo#/
 
 
-#访问目标站方式user-agent
-#模拟爬虫的值分别为:baidu 模拟百度爬虫 (默认方式)、google、 sogou、yahoo、msn、youdao、jike
-#模拟人工:user_ie_x64, user_ie_x86
-user_agent=user_ie_x64
 
 
 #是否开启拼音  ----- 此选项只针对定制版的杰奇系统, 1为开启, 0为关闭, 默认为0
 #是否开启拼音  ----- 此选项只针对定制版的杰奇系统, 1为开启, 0为关闭, 默认为0
 use_pinyin=0
 use_pinyin=0

BIN
yidu/yispider/spider.jar


+ 1 - 2
yidu/yispider/start.sh

@@ -4,5 +4,4 @@
 #export PATH=$PATH:$JAVA_HOME/bin
 #export PATH=$PATH:$JAVA_HOME/bin
 #export CLASSPATH=.:$JAVA_HOME/jre/lib:$JAVA_HOME/lib:$JAVA_HOME/lib/tools.jar
 #export CLASSPATH=.:$JAVA_HOME/jre/lib:$JAVA_HOME/lib:$JAVA_HOME/lib/tools.jar
 
 
-#/usr/java/jdk1.6.0_45/bin/java -jar spider.jar -ca &
-/usr/java/jdk1.6.0_45/bin/java -jar spider.jar -ca &
+java -jar spider.jar -ca &

+ 1 - 0
yidu/yispider/stop.sh

@@ -0,0 +1 @@
+java -cp spider_lib/*.jar:spider.jar org.yi.spider.StopApp