23052010 life
図書館の利用集中図書をBeautifulSoupでスクレイピングしてみた。
doctypeが
<!DOCTYPE html PUBLIC "-//W3C//DTD HTML 4.01 Transitional//EN"//>
となっていてなんだかなぁと。Validation Serviceくらいかけておけばいいのに
#!/usr/bin/env python
# -*- encoding:utf-8 -*-
import urllib2,re
from BeautifulSoup import BeautifulSoup
url = "http://library.fujishi.jp/opw/OPW/OPWBESTREAD.CSP?SID=6238242_4drwukDg00_92488&DB=LIB&MODE=1&FLG=RESET"
html = urllib2.urlopen(url).read()
html_fixed = re.sub("//>"," >",html)
soup = BeautifulSoup(html_fixed)
for _a in soup.findAll('a'):
if 'OPWSRCHTYPE.CSP' in _a.get('href'):
print "- [%(title)s](%(url)s)" % {'title':_a.string, 'url':_a.get('href')}
結果
日本人の英語 (岩波新書)
11ぴきのねこ
11ぴきのねことあほうどり
11ぴきのねこふくろのなか
11ぴきのねことへんなねこ (11ぴきのねこシリーズ)
韓国の美味しい町 (光文社新書)

会社のつくり方 (日経文庫)
ニュー・スーパーマリオブラザーズ・Wii
スーパーマリオギャラクシー 2(「はじめてのスーパーマリオギャラクシー 2」同梱)
ライフログのすすめ―人生の「すべて」をデジタルに記録する! (ハヤカワ新書juice)
レイアウト HTC Desire SoftBank X06HT用シリコンジャケット/ブラック RT-HX06C1/B
レイアウト HTC Desire SoftBank X06HT用鮮やか高光沢保護フィルム RT-HX06FS1/AR