如果我明白你想要什么,我会这样做:
require 'nokogiri'
doc = Nokogiri::XML(<<EOT)
<document>
<page>
<column>
<text>
<par>
<line linenum="1" columnnum="1">Hello</line>
</par>
</text>
</column>
<column>
<text>
<par>
<line linenum="1" columnnum="2">World</line>
</par>
</text>
</column>
</page>
<page>
<column>
<text>
<par>
<line linenum="1" columnnum="3">What's</line>
<line linenum="2" columnnum="3">Up?</line>
</par>
</text>
</column>
</page>
</document>
EOT
line_text = doc.search('column').map { |column|
column.search('line').map{ |line|
{
line: line['linenum'],
column: line['columnnum'],
text: line.text
}
}
}
此时
line_text
包含:
line_text
# => [[{:line=>"1", :column=>"1", :text=>"Hello"}],
# [{:line=>"1", :column=>"2", :text=>"World"}],
# [{:line=>"1", :column=>"3", :text=>"What's"},
# {:line=>"2", :column=>"3", :text=>"Up?"}]]
这是按分组
<column>
。元数据不是必需的,但如果它存在于XML中则很方便。如果没有,请删除行以捕获这些参数,并只返回文本:
line_text = doc.search('column').map { |column|
column.search('line').map{ |line|
line.text
}
}
line_text
# => [["Hello"], ["World"], ["What's", "Up?"]]
行_文本
现在是一个数组数组。外部数组中的每个元素都表示一列,该子数组中的元素是行,因此您可以使用更小的返回数组以及一些额外代码来跟踪这些内容:
line_text.each.with_index(1) do |column, column_num|
column.each.with_index(1) do |text, line_num|
puts "column: #{column_num} line: #{line_num} text: #{text}"
end
end
# >> column: 1 line: 1 text: Hello
# >> column: 2 line: 1 text: World
# >> column: 3 line: 1 text: What's
# >> column: 3 line: 2 text: Up?