全文検索エンジン Hyper Estraier 2

このエントリーをはてなブックマークに追加
267名無しさん@お腹いっぱい。:2010/09/23(木) 19:36:40
作ってる本人も遅いって言ってた気がする。
268265:2010/09/23(木) 20:30:00
mixiでTCが使われているのは全文検索じゃなかったね。ゴメン
269名無しさん@お腹いっぱい。:2010/10/07(木) 04:14:16
>>263
N-gramのN=2とかが関係してるんじゃない?
わかち書きを変えてみると違う結果になると思う。
270名無しさん@お腹いっぱい。:2010/10/09(土) 17:47:15
>>269
レス、ありがとうございました。
とりあえず、est_cond_set_optionsのオプションをESTCONDSUREで
検索してみましたが、結果の数は変わりませんでした。
なんにしろ、N-gram関連を勉強してみます。
271名無しさん@お腹いっぱい。:2010/10/11(月) 12:23:08
>>263

wildmax の設定でいくらか調整できると思う。
けれど一文字で検索する場合には、N-gramインデックスでは
あまり良い結果出せないんじゃないかな。

269が書いた通り、2-gramに対し一文字で検索するため、
「ab」を含む文書を取得する
「a」で始まる2-gramをwildmax個拾って、それらを含む文書を
取得する(2gramの出現頻度とかは見てない)

という内部動作なんだろうなと、前に思った。
272名無しさん@お腹いっぱい。:2010/10/27(水) 20:48:38
>>271
遅レスすいません。さっき、気づきました。
詳細な情報ありがとうございました。
とりあえず、ソースを読んでみましたが、
QDBMの中身も把握してないと理解
できなさそうなので、時間のあるときに
見てみます。
273名無しさん@お腹いっぱい。:2010/10/30(土) 15:19:33
誰かこの問題をHyper Estraier でも起きないか検証してくれw
ttp://uinyan.com/windows7_critical_bug/
274名無しさん@お腹いっぱい。:2010/11/16(火) 15:09:15
windowsですが、DesktopHEの他に、似たソフトってないですか?
もしくはどなたか改造されていたり。
フォルダ順ができるだけでも楽になるのですが・・・
275名無しさん@お腹いっぱい。:2011/02/10(木) 08:37:50
ファイル名のみ、または、最初の数行だけをクロールすることは可能?
全文だとインデックスがすごい容量になりそうなので、できるだけ少ないクロールをしたいのですが。
276名無しさん@お腹いっぱい。:2011/02/10(木) 09:36:59
”インデックスの容量”を心配しているの?
だとしたら杞憂だと思うんだけど、もしかして組込み系?
277名無しさん@お腹いっぱい。:2011/02/10(木) 13:07:41
>>276
いえ、普通のLinuxマシンで、1TBほどのファイルサーバーをクロールしようと考えています。インデックスの容量とクロール時間を気にしています。
なので、とりあえずはファイル名と最初の数行だけをクロールしたいと考えていました。
278名無しさん@お腹いっぱい。:2011/02/10(木) 13:47:37
>>277
インデックスの容量 -> テキスト情報量に依存
クロール時間    -> クロール方法に依存

マニュアルをちゃんと読んでから検討したほうがいいよ。
279名無しさん@お腹いっぱい。:2011/02/10(木) 23:56:21
最近のMinGWでコンパイルに成功したかたいますか?

ライブラリ名が変更されてるのを修正すればコンパイルは通るのですが、
実行すると異郷終了します

そもそもqdbmのmake checkでvtestが失敗するようで、
コンパイルできないのが正しいんでしょうか?
一応バイナリ版のqdbmを持ってきて実行しても
やはりインデックス作成で異常終了してしまいました

なにかポインタがあれば教えてください
280名無しさん@お腹いっぱい。:2011/04/14(木) 21:08:55.94
大文字小文字を区別して検索できるようにして欲しい
281名無しさん@お腹いっぱい。:2011/04/17(日) 12:28:30.18
インデックスがでかくなってくると速度落ちないですか?
回避する方法ありますか?
282281:2011/04/17(日) 12:31:21.73
>>251も自分だ。10ヶ月ほど前にも書き込んでたが。
解決策見つからず。
283名無しさん@お腹いっぱい。:2011/05/07(土) 18:02:40.44
>>251,281-282
この遅くなるって、
c:\hyperestraier\estcmd: INFO: flushing index words: name=index ...
ってでてディスク凄いアクセスするようになって遅くなって感じですか?

自分は上記のような感じで

ファイル数12500、総サイズ1.33G程度のHTMLファイルを
スキャンし終わるまで14分位かかってしまいます。

オプションとしては次のようにしているのですが・・・
gather -il ja -lt -1 -lf -1 -pc CP932 -sd -cm -cs 400
284名無しさん@お腹いっぱい。:2011/05/11(水) 20:07:25.33
もう見てる人居ないんだろうか
285名無しさん@お腹いっぱい。:2011/05/11(水) 20:21:05.25
見てるけど、開発が止まっちゃってて新しい話題がないよなー
286名無しさん@お腹いっぱい。:2011/05/12(木) 05:31:56.98
一応チェックリストには入れてる
287名無しさん@お腹いっぱい。:2011/05/13(金) 19:03:09.08
namazu と これくらいかー?
使える全文検索は。
288名無しさん@お腹いっぱい。:2011/07/13(水) 06:07:12.29
luceneで決まりだろ
289名無しさん@お腹いっぱい。:2011/07/13(水) 16:35:33.19
クラウドサービスの検索エンジンでタダで使えるのってあるのでしょうか?
全部Webに乗っけてしまって、site:付きでググってもらうのは他人に説明不要で楽なんだけど。
何一つ知らないので、どなたか詳しい方や使った経験ある人は紹介してくれませんか。

query文法を調整したり、著者名は特別扱いしたり、順位付けをカスタマイズしたり(それか不要な
結果をフィルタリングしたり)、出力のフォーマットを調整できればとかいう希望をもってます。
290名無しさん@お腹いっぱい。:2011/07/19(火) 00:44:48.88
今はkyotoだっけtokyoだっけ?
291名無しさん@お腹いっぱい。:2011/07/19(火) 12:55:07.65
作者がmixiからgoogleにいったよね
292名無しさん@お腹いっぱい。:2011/07/19(火) 14:38:11.73
>>291
へえ、ついに検索の総本山へか
293名無しさん@お腹いっぱい。:2011/08/13(土) 15:26:49.80
え?自分で会社作ってたんじゃなかったっけ??
294名無しさん@お腹いっぱい。:2011/08/15(月) 10:45:08.18
失敗したんだって
295名無しさん@お腹いっぱい。:2011/08/28(日) 22:41:21.12
解決策が見つからなかったので質問させてください。
Windows用バイナリをWindowsサーバに入れて、ファイルサーバの検索用に
使用しています。ファイルサーバのパスに「−」(全角マイナス)が含ま
れている場合、検索結果のリンクの「−」の部分がunicodeの「-」になっ
てしまい、リンクからファイルを開くことができません。


unicode→Shift-JISの変換がうまくいっていないのかと思いますが、どの
ようにすれば解決するのか教えてください。また、この問題はLinuxでは
そもそも発生しない問題でしょうか。

Windows用バイナリ
http://hyperestraier.sourceforge.net/win/
296名無しさん@お腹いっぱい。:2011/09/18(日) 23:41:27.20
P2Pでクローラーを動かしてます。

特定のURLがインデックスされるかを知るにはどうすればよろしいのでしょうか?
297296 :2011/09/18(日) 23:42:18.24
お願いします
298192.774:2011/11/26(土) 01:02:16.43
検索革命のせいか検索デスクの逆リンクがまだ動かない。
299名無しさん@お腹いっぱい。:2012/01/18(水) 15:49:41.20
mew以外にもhyper estraier で過去ログの高速検索ができるメールソフトないでしょうか
300名無しさん@お腹いっぱい。:2012/01/18(水) 19:37:28.38
Gnus
301名無しさん@お腹いっぱい。:2012/04/19(木) 18:59:45.66
Hyper EstraierをGoogleアラートに登録してたら、
今日こんな↓
https://gist.github.com/2418271
が送られてきたが、これなんだろ? mac用のruby使ったinstaller?
githubよく知らんので、これが全部なのかなんかの一部なのかも分からん。
なにこれ?
302名無しさん@お腹いっぱい。:2012/04/19(木) 21:59:39.60
Homebrew http://mxcl.github.com/homebrew/
っつうMac用パッケージ管理システムのインストール定義だね。
rubyスクリプトで定義が書けるんだね。
303名無しさん@お腹いっぱい。:2012/04/20(金) 21:10:24.25
やはりMacでしたか。よくわからないのですが、
僕はWinとUbuntuしか持ってないので使い道ないですね。

しかしこれだけ情報が増えた世界で個人で気軽に使える
全文検索エンジンは絶対使わなきゃ損と思ってるのですが、
いまいちもりあがりませんな…
304名無しさん@お腹いっぱい。:2012/04/20(金) 23:35:36.63
>>303
Hyper Estraierが出てきた当時はサイト内検索はnamazuから取って変わると
思っていたけどGoogleカスタム検索のほうが流行ってしまって見ることは
かなり少なくなってしまった気がするな。俺はローカルのメールを検索するのに
現役で使っているけど。
MLログを見てみたら作者がフェードアウトしてしまってもう5年経つのか。
後継のソフトウェアを作ってるみたいだけどもう少し表に出てきてほしい。
305名無しさん@お腹いっぱい。:2012/04/21(土) 19:13:50.93
>>304
>>303さんとは別の者だけど
ブログ見る限りは、子供できて家庭が忙しくて
プライベートで全文検索どころじゃないのかなあと
googleに再就職した、とは書いてあるけど
306303:2012/04/21(土) 20:56:51.07
>>304
うちの会社だけなのかな、よその部署から情報もらおうと思うと
同じ本部内ですらすごく嫌がられる。だからActive Directoryで
公開されているフォルダを全部DesktopHEでインデックス化しちゃったんだよね。
よくない事かもしれないけど、いろいろ分かって捗るw
307名無しさん@お腹いっぱい:2012/05/21(月) 00:40:06.77
検索に基礎がなっていない。
308名無しさん@お腹いっぱい。:2012/08/11(土) 17:34:18.82
すいません、質問させてください。

まずは、環境から。
ubuntuにhyperestraier wv xlhtml ppthtmlをインストール。
word、excel等を検索対象とするために、
# cp /usr/share/hyperestraier/filter/* /usr/lib/bin/
(ダメ押し?でこれも # PATH=$PATH:/usr/share/hyperestraier/filter)
これでパスが通るはず?

で、実際にやってみました。
$ estcmd gather -fx .doc,.xls,.odt,.ods T@estxfilt -fz -ic UTF8 -pc UTF8 -sd -cm インデクスフォルダ/ 検索対象フォルダ/
$ estcmd gather -fx .doc,.xls,.odt,.ods T@estxfilt -fz -ic UTF8 -pc UTF8 -sd -cm インデクスフォルダ/ ほげ
これで、doc、xls等が検索対象になっていることは確認できましたが、
estcmd: INFO: 26 (~/fuga.ods): registered
sh: 1: estxfilt: not found
と表示され、txtファイル以外の検索はできないようです。

どのようにすれば、doc、xlsファイル等を検索できるでしょうか?
また、そもそもLinuxでMSofficeのファイルを全文検索することは可能なのでしょうか?
さらに、odfファイル全般についても検索可能かをお尋ねしたいと思います。

以上、よろしくお願いいたします。
309名無しさん@お腹いっぱい。:2012/08/11(土) 17:38:13.25
訂正です。
下の方の
$ estcmd gather -fx .doc,.xls,.odt,.ods T@estxfilt -fz -ic UTF8 -pc UTF8 -sd -cm インデクスフォルダ/ ほげ
   ↓
$ estcmd search -ic utf-8 -vh インデクスフォルダ/ ほげ

です。 失礼しました。
310名無しさん@お腹いっぱい。:2012/08/11(土) 18:17:47.26
>>309
estfxmsotohtml を使うんじゃないの。
H@estfxmsotohtml でhtmlにして登録じゃないの。
311名無しさん@お腹いっぱい。:2012/08/11(土) 19:07:37.99
>>310
おぉ、うまくいきました。
T@estxfilt→H@estfxmsotohtmlと置き換えることで、
xlsとdocが検索できるようになりました。
ありがとうございました。

ところで、ODFファイルの検索は可能なのでしょうか?
MS関連のファイルには対応しているけど、
Linuxで使われているOpenOfficeのファイルに対応してないというのは、
ちょっと納得できないような・・・。
312名無しさん@お腹いっぱい。:2012/08/11(土) 20:12:21.99
>>311
ODFがメジャーになる前だったからなあ……
odt2txt ってコマンドがあるからこいつを使ってフィルタを作ればいいんじゃないかな。
シェルスクリプトでフィルタ書くの簡単だし。
313名無しさん@お腹いっぱい。:2012/08/11(土) 20:36:05.84
>>312
レスどうもです。
odsはどうするのでしょうか?
っていうか、そんなスキルないですよorz

フィルタ書くの簡単だとしたら、
なんでLinuxで全文検索が簡単にできるようにならないんでしょうかね?
個人的には、デスクトップ検索はPCの必須アイテムだと考えていますが、
googleデスクトップは終了しちゃうし、DesktopHEは64bitで使えないし、
現在windowsで最強のデスクトップ検索ソフトのfilediverは超マイナーだし、
デスクトップ検索は、世間的にはあんまり関心のない分野なのかなと思ったりします。
314名無しさん@お腹いっぱい。:2012/08/11(土) 20:56:51.31
>>313
知らんがな。
おまえの愚痴に付き合う気はない。
欲しい人は自分で書く。そういう世界だから。
あとデスクトップ検索アプリは他にちゃんとあるし、フィルタもすでに作っている人がいる。
315名無しさん@お腹いっぱい。:2012/10/10(水) 14:49:50.26
pandocというのがodfの変換もできるほか、いろいろ変換できそう
316名無しさん@お腹いっぱい。
>>313
DesktopHEはWin7x64で快適に動作していますが。