metaclass: (Default)
metaclass ([personal profile] metaclass) wrote2009-11-09 08:28 pm

Адъ CSV

А напишите кто-нибудь табличку состояний CSV парсера? Т.е. последовательность символов, разделенных запятыми, в строках, разделенных \r или \r\n разбить на список списков строк. Если в строке должны быть служебные символы (т.е. запятая или \r \n) - строка обрамляется в кавычки, если внутри такой строки нужна кавычка - ставится две кавычки подряд.
На самом деле там немного сложнее, типа допустимо незначимые пробелы возле запятых, а значимыми их делают тоже через кавычки, управляющие символы <32 вроде тоже обязательно в кавычки, но это пофиг.
Вроде блин простая задачка, а каждый раз когда ее приходится делать - получаются на пару страниц конечные автоматы.

[identity profile] vp.livejournal.com 2009-11-09 09:08 pm (UTC)(link)
Что-то ты усложняешь.
Есть делиметер, допустим, запятая.
Поиск делиметера, по позициям - нарезка строки в список строк.
все, строка распаршена. Дальше по каждой подстроке уже убирание кавычек краевых, если они присутствуют, ну и байт стаффинг кавычек. Хотя на самом деле меня плющит, что вот делиметер внутри никаким байстаффингом не кодируется. То есть его просто тупо не может быть. Надо документ почитать про CSV, я не помню, как там по науке. Также и не помню как с \r\n быть по науке.

[identity profile] metaclass.livejournal.com 2009-11-09 09:12 pm (UTC)(link)
У меня нет строки целиком. Есть входные символы, из потока. Т.е. обрабатывать нужно классическим конечным автоматом :)
Поиск делимитера по позициям ломается на делимитерах внутри кавычек.
И обрабатываю я не одну строку а все строки подряд, потому что у меня может быть такое:
"test
test"
и это должно вернуться в виде одной строки внутри списка, с \r\n внутри

[identity profile] lionet.livejournal.com 2009-11-09 09:44 pm (UTC)(link)
Зачем "нужно" классическим? Можно BNF-based парсером. yacc/lex, no?

[identity profile] metaclass.livejournal.com 2009-11-09 09:47 pm (UTC)(link)
Можно и им, но мне быстрее обычный конечный автомат было сделать на дотнете, чем искать кодогенератор и придумывать грамматику.

[identity profile] arush-damage.livejournal.com 2009-11-09 09:49 pm (UTC)(link)
нафига там автомат?
там кроме одного флага и значения предыдущего символа ничего не нужно

[identity profile] metaclass.livejournal.com 2009-11-09 09:55 pm (UTC)(link)
Вот я до проверки значения предыдущего символа не додумался - вместо этого использовал состояние конечного автомата.

[identity profile] lionet.livejournal.com 2009-11-09 09:59 pm (UTC)(link)
Предыдущий символ будет пробел. И что получится?

[identity profile] metaclass.livejournal.com 2009-11-09 10:03 pm (UTC)(link)
В том алгоритме на С, что ниже - добавится в выходную строку.
Вроде бы по стандарту, он должен игнорироваться, если около разделителей, а внутри строки недопустим.

[identity profile] arush-damage.livejournal.com 2009-11-09 11:44 pm (UTC)(link)
Стандарт ломало читать :)
Обработка пробелов - вообще не проблема.

[identity profile] arush-damage.livejournal.com 2009-11-09 11:46 pm (UTC)(link)
А вот про конец строки я забыл :(

[identity profile] metaclass.livejournal.com 2009-11-10 08:13 am (UTC)(link)
Вот про это я и говорю - сколько не делаю, обязательно что нибудь забуду :)